Metlivi 블로그

슬로건 없이 AI의 환경적 비용을 측정하는 방법

AI의 환경적 비용을 유용하게 추정하려면, 먼저 어떤 활동이 측정되는지, 측정의 시작과 끝은 어디인지, 보고된 단위는 무엇인지 질문해야 합니다. 모델 학습과 프롬프트 응답은 서로 다른 워크로드이며, 전력 사용량은 배출량과 동일하지 않고, 단일 프롬프트에 대한 수치가 데이터 센터의 전체 수요를 대변할 수는 없습니다. 실용적인 비교는 결론을 내리기 전에 이러한 차이점을 기록합니다.

2026년 9월 30일6분 분량독서·예술·문화작성: Metlivi Editorial Team
섹션 1

먼저 학습과 추론을 분리하는 것부터 시작하세요

학습은 모델을 생성하거나 업데이트하는 데 사용되는 연산입니다. 서빙이라고도 불리는 추론은 배포 후 출력을 생성하는 데 사용되는 연산입니다. 단일 학습 실행은 정해진 기간 동안 상당한 에너지를 소비할 수 있는 반면, 추론은 여러 사용자와 요청에 걸쳐 반복됩니다. 시간이 지남에 따라 반복되는 서빙의 총합은 학습과 함께 유의미해질 수 있지만, 상대적 점유율은 모델, 사용량 및 집계 기간에 따라 달라집니다. 둘을 합산한 총계가 제시되기 전에 이 두 가지는 별도로 측정되고 보고되어야 합니다. 국제에너지기구(IEA)는 학습과 배포 모두를 데이터 센터 활동으로 설명하며, Google의 기술 연구는 모델 학습을 경계 밖에 두고 추론만을 구체적으로 측정합니다. IEA, “Energy demand from AI” 및 Elsworth et al., “Measuring the environmental impact of delivering AI at Google Scale”

학습의 경우 유용한 보고에는 실행 기간, 소비된 에너지, 관련된 하드웨어, 수치가 주 가속기만을 포괄하는지 아니면 더 넓은 컴퓨팅 시스템까지 포함하는지 여부가 들어갑니다. 추론의 경우 서비스와 작업을 정의해야 합니다. 예를 들어 명시된 측정 기간 동안 지정된 어시스턴트의 텍스트 생성 등이 있습니다. 보고된 단위가 요청당, 토큰당, 생성된 출력당, 또는 총 서비스 에너지인지 명시하십시오. 이러한 분모는 서로 다른 질문에 답합니다. 요청당 수치는 프롬프트 및 응답 길이, 모델 라우팅, 워크로드 조건에 따라 달라질 수 있으며, 토큰당 수치는 토큰에 정비례하여 확장되지 않는 오버헤드를 숨길 수 있습니다.

섹션 2

수치를 비교하기 전에 경계를 확인하세요

측정 경계는 어떤 장비와 활동이 계산되는지 정의합니다. 좁은 범위의 추정치는 활성 GPU 또는 기타 AI 가속기가 사용하는 전력만을 집계할 수 있습니다. 더 넓은 범위의 서빙 추정치는 호스트 CPU 및 메모리, 가용성을 위해 예약된 유휴 머신, 전력 변환, 냉각 및 기타 데이터 센터 오버헤드를 포함할 수 있습니다. 일부 경계는 설비 외부의 네트워크, 최종 사용자 장치, 모델 학습 또는 데이터 스토리지를 제외합니다. 특정 추정치가 자체적으로는 타당하더라도 시스템의 더 많은—또는 다른—부분을 포함하는 추정치와 비교하기에는 부적절할 수 있습니다.

Google이 발표한 Gemini Apps 추정치는 왜 경계가 중요한지를 잘 보여줍니다. 중간값 텍스트 프롬프트에 대한 2025년 5월 추정치는 포괄적 서빙 방법을 사용하여 0.24와트시(Wh)였습니다. 호스트 CPU와 메모리, 유휴 머신, 시설 오버헤드를 제외한 동일한 연구의 더 좁은 방법으로는 0.10Wh가 나왔습니다. 이는 하나의 제품, 날짜, 지표 및 회계 경계에 대한 결과일 뿐, AI 프롬프트에 대한 보편적인 값이 아닙니다. 이 연구는 학습 및 최종 사용자 장치도 제외합니다. Google Cloud, “Measuring the environmental impact of AI inference” 및 첨부된 기술 논문

작업당 수치를 읽을 때는 간단한 경계 설명을 확인하십시오. 총계가 가속기 전용인지 풀스택인지, 데이터 센터 오버헤드가 포함되었는지, 학습 및 데이터 센터 외 활동이 포함되었는지가 명시되어 있어야 합니다. 해당 정보가 누락된 경우 비교하기에 불완전한 수치로 취급하십시오. 다른 출처의 오버헤드 승수를 임의로 추가하지 마십시오. 시설 효율성과 워크로드 조건은 서로 다릅니다.

섹션 3

주장에 단위를 결합하여 파악하세요

전기는 일반적으로 작은 작업의 경우 와트시(Wh), 더 큰 총계의 경우 킬로와트시(kWh), 시설 또는 지역 총계의 경우 메가와트시 또는 테라와트시로 보고됩니다. 1kWh는 1,000Wh와 같습니다. 와트(W) 또는 킬로와트(kW)로 측정되는 전력은 한 순간 또는 일정 간격 동안의 비율(속도)이며, Wh 또는 kWh 단위의 에너지는 시간에 따라 누적됩니다. 따라서 데이터 센터의 전력 용량에 대한 언급만으로는 그 자체로 데이터 센터가 1년 동안 얼마나 많은 전기를 사용했는지 알 수 없습니다.

배출량은 일반적으로 작업당 CO₂e 그램 또는 연간 CO₂e 톤과 같이 이산화탄소 환산량의 질량으로 표시됩니다. 전기 관련 배출량을 추정하기 위해 에너지 사용량은 전력 배출 계수와 결합되며, 이 계수의 값은 전력망, 기간 및 회계 방법에 따라 달라집니다. 장비 제조 과정에서 발생하는 내재 배출량은 별도의 구성 요소이며 선택한 방법에 따라 하드웨어 수명 또는 사용량에 할당될 수 있습니다. 에너지와 배출량은 서로 다른 결과로 구분하십시오. 배출량 수치가 낮다는 것은 전력 사용량이 적다는 것이 아니라 탄소 집약도가 낮은 전력 공급을 반영한 것일 수 있습니다. 물 사용량 또한 별개의 지표이며 자체적인 경계와 단위가 필요합니다.

섹션 4

하드웨어 효율성을 전체 결과가 아닌 하나의 입력값으로 다루세요

하드웨어 효율성은 에너지 단위당 유용한 연산, 또는 유용한 작업 단위당 에너지로 표현될 수 있습니다. 그러나 칩의 와트당 최대 성능은 실제 서비스 작업을 완료하는 데 사용되는 에너지와 동일하지 않습니다. 실제 결과는 가동률, 소프트웨어 및 모델 설계, 워크로드 규모, 일괄 처리(배칭), 시스템 지원 장비 및 시설에 따라서도 달라집니다. IEA는 데이터 센터 전력의 상당 부분을 서버가 차지하지만, 냉각 및 기타 구성 요소의 비율은 설비 유형에 따라 크게 달라진다고 지적합니다. IEA, “Energy demand from AI”

개인적인 비교를 위해서는 동일한 서비스 및 기간 내의 동일하게 정의된 작업을 선택하고, 가능한 경우 제공업체가 측정한 작업당 에너지를 활용하십시오. 두 모델이나 서비스를 비교하는 경우 작업, 출력 길이, 측정 경계, 유휴 용량 처리 방식이 비교 가능한지 확인하십시오. 하드웨어 사양이나 벤치마크는 효율성 잠재력을 설명하는 데 도움이 될 수 있지만, 실제 운영 환경의 에너지 사용량을 독립적으로 입증하지는 못합니다.

섹션 5

데이터 센터 총계는 규모 파악에 사용하고, 프롬프트별 정밀도에는 사용하지 마세요

시설 또는 국가 단위의 총계는 요청당 추정치와는 다른 질문에 답합니다. 총 전력 소비량은 제공된 모든 워크로드, 설비 장비, 선택된 기간 동안의 수요 변화를 반영합니다. 이러한 총계를 추정된 요청 수로 나누면 분자와 분모가 동일한 서비스, 위치 및 기간을 다룰 때에만 대략적인 평균을 얻을 수 있습니다. 공유 인프라는 비-AI 워크로드도 처리하므로, 할당 방법이 정당화되지 않는 한 시설 전력 전부를 AI에 귀속시키는 것은 AI의 비중을 과장하게 됩니다.

미국 에너지부의 2024년 로렌스 버클리 국립연구소 보고서는 미국의 역사적 데이터 센터 전력 사용량을 추정하고 2028년까지의 미래 수요 시나리오 범위를 제시합니다. 이는 국가 데이터 센터 분석이지, 개별 AI 요청에 대한 에너지를 직접 측정한 것이 아닙니다. 보고서의 규모와 시나리오 접근 방식은 총수요의 불확실성을 이해하는 데 유용하지만, 좁게 정의된 서빙 작업에는 제품 수준의 운영 텔레메트리가 더 적합합니다. Lawrence Berkeley National Laboratory, “2024 United States Data Center Energy Usage Report”

섹션 6

불확실성을 숨기지 말고 기술하세요

불확실성은 운영 데이터에 대한 불완전한 접근성, 계측되지 않고 추정된 워크로드, 유휴 용량에 대한 가정, 변동하는 하드웨어 가동률, 공유 장비 할당 방식에 대한 선택을 통해 발생할 수 있습니다. 배출량은 전력 사용 위치와 시점, 배출 계수, 구매 전력에 대한 회계 처리를 통해 추가적인 변동성을 더합니다. 데이터 센터 총계 역시 완전한 계측 데이터를 사용할 수 없을 때는 추정치와 시나리오에 의존합니다. IEA는 현재와 미래의 데이터 센터 전력 소비량에 상당한 불확실성이 있음을 명시적으로 언급합니다. IEA, “Energy demand from AI”

따라서 유용한 보고서는 관찰 기간을 명시하고, 경계를 설명하며, 수치가 직접 계측된 것인지 모델링된 것인지 식별하고, 주요 가정을 기술합니다. 추정치가 시나리오나 할당 방식에 따라 달라지는 경우 범위를 제시하거나 이러한 선택이 결과에 어떤 영향을 미치는지 설명하십시오. 기초 측정 데이터가 뒷받침하지 못할 때는 소수점을 과도하게 표기하지 마십시오. 중간값, 평균값 또는 대표 작업 또한 정확하게 레이블을 지정해야 합니다. 각각은 워크로드 분포를 다르게 요약하며, 어느 것도 모든 요청을 설명하지는 못합니다.

섹션 7

주장을 평가하기 위한 실용적인 체크리스트

AI에 대한 환경 수치를 인용하거나 비교하기 전에 다음 사항을 질문하십시오:

학습, 추론, 또는 이 둘을 합산한 총계인가?

어떤 서비스, 워크로드, 기간, 기능 단위를 설명하는가?

가속기만 계산하는가, 아니면 호스트, 유휴 용량, 시설 오버헤드도 포함하는가?

해당 값은 에너지, 전력, 배출량, 물 중 무엇이며 어떤 단위가 사용되었는가?

배출량의 경우 어떤 전력 계수, 위치, 시간 기준, 내재 배출량 처리 방식이 적용되었는가?

결과가 측정된 것인가, 추정된 것인가, 시나리오 기반인가, 그리고 어떤 중요한 제외 사항이나 불확실성이 남아 있는가?

일상적인 개인의 선택에 있어 이 체크리스트는 맥락이 결여된 “대화당 에너지” 수치보다 훨씬 더 실천적입니다. 이는 하나의 정의된 서비스에 대한 측정 결과와 AI 전반에 대한 막연한 주장을 구분하는 데 도움이 되며, 어떤 세부 정보가 누락되어 비교를 신뢰할 수 없게 만드는지 보여줍니다.

관련 글

이 주제 더 살펴보기