Metlivi ブログ

スローガンに惑わされずにAIの環境負荷を測定する方法

AIの環境負荷を有用に見積もるには、まずどの活動が測定されているのか、測定の開始点と終了点はどこか、そしてどの単位で報告されているのかを問う必要があります。モデルのトレーニングとプロンプトへの回答は異なるワークロードであり、電力消費量は排出量と同じではありません。また、1つのプロンプトに関する数値がデータセンター全体の需要を代表することはできません。実用的な比較を行うには、結論を出す前にこれらの違いを記録しておく必要があります。

2026年9月30日所要時間 6 分読書・アート・文化Metlivi Editorial Team
セクション 1

まずはトレーニングと推論を分けることから始める

トレーニングとは、モデルを作成または更新するために使用される計算のことです。サービングとも呼ばれる推論は、展開後に出力を生成するために使用される計算です。単一のトレーニング実行は、定義された期間にわたってかなりのエネルギーを消費する可能性がありますが、推論はユーザーやリクエスト全体で繰り返されます。時間の経過とともに、繰り返されるサービングからの合計量はトレーニングと並んで無視できないものになりますが、その相対的なシェアはモデル、使用状況、およびカウントされる期間によって異なります。合計値を提示する前に、この2つは個別に測定および報告されるべきです。国際エネルギー機関(IEA)はトレーニングと展開の両方をデータセンターの活動として説明しており、Googleの技術研究ではモデルのトレーニングを境界外に置きながら推論を具体的に測定しています(IEA「Energy demand from AI」、Elsworth et al.「Measuring the environmental impact of delivering AI at Google Scale」)。

トレーニングの場合、有用な報告には、実行の期間、消費されたエネルギー、関与したハードウェア、および数値がメインのアクセラレータのみを対象としているか、より広範なコンピューティングシステムを対象としているかが含まれます。推論の場合は、サービスとタスクを定義します(例:指定された測定期間中の特定の名前付きアシスタントによるテキスト生成など)。報告される単位がリクエストあたり、トークンあたり、生成された出力あたり、またはサービスの総エネルギーであるかどうかも含めてください。これらの分母は異なる疑問に答えるものです。リクエストあたりの値は、プロンプトと応答の長さ、モデルのルーティング、ワークロードの状況によって異なる場合があります。トークンあたりの値は、トークン数に直接比例して拡大縮小しないオーバーヘッドを覆い隠してしまう可能性があります。

セクション 2

数値を比較する前に境界を確認する

測定境界によって、どの機器や活動がカウントされているかが特定されます。狭い見積もりでは、アクティブなGPUまたは他のAIアクセラレータによって消費される電力がカウントされる場合があります。より広範なサービングの見積もりには、ホストCPUやメモリ、可用性のために予約されたアイドル状態のマシン、電力変換、冷却、その他のデータセンターのオーバーヘッドも含まれる場合があります。一部の境界では、施設外のネットワーク、エンドユーザーのデバイス、モデルのトレーニング、またはデータストレージが除外されます。見積もりは、それ自体では妥当であっても、システムのより多くの部分(または異なる部分)をカウントしている別の見積もりと比較するには不適切な場合があります。

Googleが公開したGemini Appsの見積もりは、なぜ境界が重要であるかを示しています。包括的なサービング手法を使用した2025年5月のテキストプロンプトの中央値の見積もりは0.24ワット時(Wh)でした。同じ研究におけるより狭い手法(ホストCPUとメモリ、アイドル状態のマシン、施設のオーバーヘッドを除外したもの)では0.10 Whとなりました。これらは1つの製品、日付、指標、および算定境界に対する結果であり、AIプロンプトに対する普遍的な値ではありません。この研究では、トレーニングやエンドユーザーのデバイスも除外されています(Google Cloud「Measuring the environmental impact of AI inference」および付随する技術論文)。

タスクごとの数値を読む際は、境界に関する簡潔な説明を探してください。合計がアクセラレータのみかフルスタックか、データセンターのオーバーヘッドが含まれているか、トレーニングやデータセンター以外の活動が含まれているかが記載されている必要があります。その情報がない場合、比較のための数値としては不完全であると見なしてください。他のソースからのオーバーヘッド乗数を勝手に追加してはいけません。施設の効率やワークロードの状況はそれぞれ異なるためです。

セクション 3

単位と主張を結びつけておく

電力は通常、小さなタスクではワット時(Wh)、より大きな合計値ではキロワット時(kWh)、施設または地域の合計値ではメガワット時やテラワット時で報告されます。1 kWhは1,000 Whに相当します。ワット(W)またはキロワット(kW)で測定される電力(仕事率)は、ある瞬間またはある間隔におけるレートです。WhまたはkWhで表されるエネルギー(電力量)は、時間の経過とともに蓄積されます。したがって、データセンターの受電容量についての記述は、それ単体では年間でどれだけの電力を使用したかを述べていることにはなりません。

排出量は通常、タスクあたりのCO₂eのグラム数や年間あたりのCO₂eのトン数など、二酸化炭素換算の質量として表されます。電力関連の排出量を推定するには、エネルギー使用量と電力の排出係数を組み合わせますが、その値はグリッド(送電網)、期間、算定方法によって異なります。製造設備からのエンボディド・エミッション(内包排出量)は別の構成要素であり、選択した方法に基づいてハードウェアの寿命や使用状況全体に配分される場合があります。エネルギーと排出量は別々の結果として扱ってください。排出量の数値が低いことは、電力使用量が少ないのではなく、炭素集約度の低い電力供給を反映している可能性があります。水の使用量もまた別の指標であり、独自の境界と単位が必要です。

セクション 4

ハードウェアの効率は1つの入力値として扱い、結果の全体と見なさない

ハードウェアの効率は、エネルギー単位あたりの有用な計算量、または有用な仕事の単位あたりのエネルギーとして表すことができます。しかし、チップのワットあたりのピークパフォーマンスは、実際のサービスタスクを完了するために使用されるエネルギーと同じではありません。現実世界の結果は、稼働率、ソフトウェアとモデルの設計、ワークロードの規模、バッチ処理、システムサポート機器、および施設にも依存します。IEAは、サーバーがデータセンターの電力の大部分を平均して占めている一方で、冷却やその他のコンポーネントが占める割合は施設の種類によって大幅に異なると指摘しています(IEA「Energy demand from AI」)。

個人的な比較を行う場合は、同じサービスおよび期間における同じ定義されたタスクを選択し、利用可能であればプロバイダーが測定したタスクあたりのエネルギーを使用することが推奨されます。2つのモデルやサービスを比較する場合は、タスク、出力の長さ、測定境界、およびアイドル容量の扱いが同等であることを確認してください。ハードウェアの仕様やベンチマークは効率の可能性を説明するのに役立ちますが、本番環境でのエネルギー使用量を単独で確定するものではありません。

セクション 5

データセンターの総量は規模の把握に用い、プロンプトごとの精度を求めるために使わない

施設または国全体の合計値は、リクエストごとの見積もりとは異なる疑問に答えるものです。総電力消費量は、選択した期間に処理されたすべてのワークロード、施設設備、および需要の変化を反映しています。このような合計を推定リクエスト数で割っても、分子と分母が同じサービス、場所、期間をカバーしている場合にのみ大まかな平均値が得られます。共有インフラストラクチャはAI以外のワークロードも処理するため、配分方法がそれを正当化しない限り、施設のすべての電力をAIに割り当てるとAIのシェアを過大評価することになります。

米国エネルギー省のローレンス・バークレー国立研究所による2024年の報告書では、過去の米国のデータセンターの電力使用量を推定し、2028年までの将来の需要シナリオの範囲を提示しています。これは全国のデータセンターの分析であり、個々のAIリクエストに対するエネルギーの直接的な測定ではありません。その規模とシナリオアプローチは総需要の不確実性を理解するのに役立ちますが、狭く定義されたサービスタスクには製品レベルの運用テレメトリの方がより関連性があります(ローレンス・バークレー国立研究所「2024 United States Data Center Energy Usage Report」)。

セクション 6

不確実性を隠すのではなく説明する

不確実性は、運用データへのアクセスの不完全さ、実測ではなく推定されたワークロード、アイドル容量に関する仮定、変化するハードウェアの稼働率、共有機器の割り当て方法の選択などを通じて入り込む可能性があります。排出量は、電力の場所やタイミング、排出係数、購入した電力の会計処理によってさらに変動が生じます。完全な測定データが利用できない場合、データセンターの合計値も推定値やシナリオに依存します。IEAは、現在および将来のデータセンターの電力消費に大きな不確実性があることを明示的に指摘しています(IEA「Energy demand from AI」)。

したがって、有用な報告書では、観測期間を明記し、境界を説明し、数値が直接測定されたものかモデル化されたものかを特定し、主要な仮定を述べます。見積もりがシナリオや配分の選択に依存する場合は、範囲を示したり、それらの選択が結果にどのように影響するかを説明したりします。基礎となる測定がそれをサポートしていない場合は、多くの小数点以下の桁数を提示することは避けてください。中央値、平均値、または代表的なタスクも正確にラベル付けする必要があります。それぞれがワークロードの分布を異なる方法で要約しており、どれもすべてのリクエストを説明しているわけではないからです。

セクション 7

主張を評価するための実践的なチェックリスト

AIの環境数値を引用したり比較したりする前に、次の点を確認してください。

それはトレーニング、推論、またはそれらの合計のどれですか?

どのようなサービス、ワークロード、期間、機能単位を説明していますか?

アクセラレータのみをカウントしていますか、それともホスト、アイドル容量、施設のオーバーヘッドもカウントしていますか?

その値はエネルギー、電力、排出量、水使用量のどれですか?そしてどのような単位が使われていますか?

排出量については、どのような電力排出係数、場所、時間基準、およびエンボディド・エミッション(内包排出量)の処理が適用されましたか?

結果は測定値、推定値、シナリオベースのどれですか?また、どのような重要な除外事項や不確実性が残っていますか?

日常の個人的な選択においては、文脈を欠いた「チャットあたりのエネルギー」という数値よりも、このチェックリストの方が実用的です。定義された1つのサービスに対する測定結果とAI全体に関する大まかな主張を区別するのに役立ち、どの詳細が欠けていると比較の信頼性が損なわれるかを示してくれます。

関連記事

このテーマをさらに見る