쿼리당 에너지 사용량과 전기 요금, 전력망 탄소 집약도를 바탕으로 대규모 언어 모델(LLM) 추론을 대규모로 운영할 때의 전기 비용과 탄소 배출량을 추정한다.
입력
작업량
대상 기간 동안 집계할 추론 요청의 수다. 하루, 한 달, 또는 기능의 전체 수명 등 원하는 기간을 기준으로 한다.
하나의 요청에 응답하기 위해 소비되는 전력으로, 유휴 상태와 냉각에 드는 간접 비용의 몫을 포함한다. 서비스 중인 모델에서 짧은 응답은 흔히 와트시의 일부에 불과하며, 긴 생성과 더 큰 모델은 더 많은 전력을 소비한다.
전기 및 전력망
$
킬로와트시당 지불하는 금액이다. 데이터센터 또는 클라우드 요금을 사용한다. 상업용 요금은 가정용과 다르며 지역에 따라 큰 차이가 있다.
전력 1킬로와트시당 배출되는 이산화탄소의 그램 수로, 지역의 발전 구성에 따라 달라진다. 석탄 비중이 높은 전력망은 수력이나 원자력이 주를 이루는 전력망보다 몇 배 더 집약적이다.
결과
값을 입력하면 계산 결과가 표시됩니다.
$
소비된 ...를 킬로와트시당 0.15 $로 계산한 비용이다.
세부 정보
쿼리 1,000,000건을 각 0.5 Wh로 처리할 때 전체에서 소비되는 전력이다.
킬로와트시당 400 그램의 전력망 집약도에서 소비된 ...에 기인하는 이산화탄소다.
추론 에너지 비용이란
추론 에너지 비용은 일정량의 언어 모델 추론 요청을 처리하는 데 드는 전기
비용과 그에 따른 탄소 배출량이다. 쿼리당 에너지 수치에 쿼리 수를 곱한 뒤
전기 요금으로 환산하고, 지역 전력망의 배출 집약도를 이용해 탄소량으로
변환하여 구한다. 일회성 사건인 학습과 달리, 추론 에너지는 배포된 모델이
응답하는 요청마다 반복되므로 대규모에서는 서비스 중인 모델의 운영
발자국을 지배한다.
계산식
쿼리 수를 , 쿼리당 에너지를 라 한다. 총에너지는 이 둘의 곱이며,
전기 비용은 에너지에 킬로와트시당 가격 를 곱한 값이고, 배출량은
에너지에 킬로와트시당 이산화탄소 그램 단위의 전력망 집약도 를 곱한 뒤
킬로그램으로 환산하기 위해 1000으로 나눈 값이다.
E=N⋅EqC=E⋅pemCO2=E⋅1000Ig
쿼리당 에너지는 작다. 가동률이 높은 가속기에서 처리되는 짧은 응답은 흔히
와트시의 일부에 불과하다. 따라서 가격과 배출을 적용하기 전에 수치를
킬로와트시로 환산한다.
계산 예시
쿼리 N = 1{,}000{,}000건을 각 와트시로 처리하는 경우를
생각한다. 총에너지는 다음과 같다.
E=1,000,000×0.5 Wh=500,000 Wh=500 kWh.
전기 요금이 킬로와트시당 p_e = \0.15$일 때, 비용은 다음과 같다.
C=500×$0.15=$75.
중간 수준의 혼합 전력망에 해당하는 킬로와트시당 그램의 전력망
집약도에서 배출량은 다음과 같다.
mCO2=500×1000400=200 kg of CO2.
따라서 100만 건의 쿼리는 전기 비용 약 $75이 들며, 가 이미 포함하는
범위를 넘어서는 냉각과 유휴 간접 비용을 제외하고 대략 200kg의 이산화탄소를
배출한다.
변동 요인과 활용
세 가지 입력은 각각 결과를 독립적으로 변화시킨다. 쿼리당 에너지는 모델
크기와 시퀀스 길이, 하드웨어, 배치 처리에 따라 달라진다. 가동률이 낮은
하드웨어에서 큰 모델이 수행하는 긴 생성은 짧은 것보다 훨씬 많은 전력을
끌어온다. 전기 요금은 지역과 계약에 따라 변하고, 전력망 집약도는 수력이나
원자력 비중이 높은 전력망의 킬로와트시당 100그램 미만에서 석탄 비중이 높은
전력망의 700그램 초과까지 분포하므로, 동일한 작업이라도 연산이 수행되는
위치에 따라 배출량이 몇 배 차이가 날 수 있다. 에너지와 비용은
자체 호스팅 대 API 손익분기 계산기 분석과 같은 인프라 선택에
반영되며, 그 분석에서 전기는 자체 호스팅 변동 비용의 일부다. 학습 에너지는
제외된다. 학습은 별도의 일회성 비용으로 해당 모델이 응답하는 모든 쿼리에
걸쳐 분산되므로, 전체 수명 주기 수치는 이를 별도로 산정해야 한다. 결과는
계측된 측정값이 아니라 자릿수 수준의 추정값이다.
자주 묻는 질문 (FAQ)
추론 쿼리 하나는 얼마만큼의 에너지를 사용하는가
모델 크기와 시퀀스 길이, 하드웨어, 배치 처리에 따라 크게 달라진다. 가동률이 높은 가속기에서 처리되는 짧은 응답은 와트시의 작은 일부를 소비하는 반면, 가동률이 낮은 하드웨어에서 큰 모델이 수행하는 긴 생성은 상당히 더 많은 전력을 소비한다. 가능하면 자신의 배포 환경에서 직접 측정해야 한다. 공시된 수치는 대략적인 평균이며 냉각과 유휴 간접 비용을 포함하는 경우가 드물다.
어떤 전력망 탄소 집약도를 사용해야 하는가
사용자가 있는 지역이 아니라 연산이 실제로 수행되는 지역의 수치를 사용한다. 국가 및 지역 전력망 운영자가 평균 집약도를 공시하며, 클라우드 제공업체는 지역 단위 수치를 보고한다. 수력과 원자력, 풍력이 주를 이루는 전력망은 킬로와트시당 100그램 미만일 수 있는 반면, 석탄 비중이 높은 전력망은 700그램을 넘을 수 있다.
여기에는 모델 학습에 사용된 에너지가 포함되는가
포함되지 않는다. 이 계산은 요청을 처리하는 데 소비되는 전력만 추정한다. 학습은 별도의 일회성 비용으로, 해당 모델이 처리하는 모든 쿼리에 걸쳐 분산되므로 요청량이 많을수록 쿼리당 학습 에너지의 몫은 서비스 운영에 비해 작아진다. 전체 수명 주기 수치가 필요하면 학습은 별도로 산정해야 한다.
면책조항
추론에 대한 에너지 수치는 모델과 하드웨어, 배치 처리, 데이터센터 효율에 크게 좌우되는 추정값이다. 전력망 집약도와 전기 요금은 지역과 시점에 따라 달라진다. 결과는 계측된 측정값이 아니라 자릿수 수준의 추정값으로 다루어야 한다.