Metlivi 部落格

如何擺脫口號,客觀衡量 AI 的環境成本

要對 AI 的環境成本做出有價值的評估,首先要問清楚正在衡量的是哪種活動、衡量的起點與終點在哪裡,以及所報告的單位是什麼。訓練模型與回答提示詞屬於不同的工作負載;用電量並不等同於碳排放;單一提示詞的數據也無法代表整個資料中心的總需求。切實可行的比較方式,應在得出結論之前先釐清這些差異。

2026年9月30日6 min read閱讀、藝術與文化作者:Metlivi Editorial Team
第 1 節

首先區分訓練與推論

訓練是用於建立或更新模型的運算過程。推論(也稱為服務提供,serving)則是在部署後用於生成輸出的運算過程。單次訓練運行可能會在特定時期內消耗大量能源,而推論則是跨使用者和請求反覆進行。隨著時間的推移,反覆提供服務所累積的總量可能會與訓練相當,但兩者的相對比例取決於模型、使用情況以及計算的時期。在呈現任何合併總量之前,應分別衡量並報告這兩者。國際能源總署(IEA)將訓練和部署都描述為資料中心活動,而 Google 的一項技術研究則專門衡量推論,將模型訓練排除在其邊界之外。IEA,《AI 的能源需求》與 Elsworth 等人,《衡量在 Google 規模下提供 AI 的環境影響》

對於訓練,有價值的報告應包括運行的持續時間、消耗的能源、涉及的硬體,以及該數據是僅涵蓋主要加速器還是更廣泛的運算系統。對於推論,應明確定義服務與任務:例如,在特定測量期間為某個指定助理進行的文字生成。同時應註明報告的單位是每次請求、每 Token、每生成的輸出,還是整個服務的總能源。這些分母回答的是不同的問題。每次請求的數值可能會隨提示詞與回應長度、模型路由以及工作負載狀況而有所變化;每 Token 的數值則可能隱藏了無法隨 Token 數量直接等比縮放的額外開銷。

第 2 節

在比較數據之前檢查邊界

測量邊界決定了哪些設備和活動會被納入計算。較狹義的估算可能僅計算處於活動狀態的 GPU 或其他 AI 加速器所消耗的電力。較廣義的服務估算可能還包括主機 CPU 和記憶體、為維持可用性而保留的閒置機器、電源轉換、冷卻系統以及其他資料中心的額外開銷。某些邊界會排除設施外部的網路、終端使用者裝置、模型訓練或資料儲存。一項估算在其自身範圍內可能是完全有效的,但若與納入了系統中更多(或不同)部分的另一項估算進行比較,則可能並不合適。

Google 公布的 Gemini Apps 估算說明了為什麼邊界至關重要。其 2025 年 5 月對文字提示詞中位數的估算,在使用全面服務方法時為 0.24 瓦時(Wh);而同一研究中採用較狹義的方法(排除了主機 CPU 與記憶體、閒置機器和設施開銷)則得出 0.10 Wh。這些是針對單一產品、日期、指標和會計邊界得出的結果,並非適用於所有 AI 提示詞的通用數值。該研究同樣排除了訓練和終端使用者裝置。Google Cloud,《衡量 AI 推論的環境影響》及隨附的技術論文

在閱讀任何針對單項任務的數據時,請尋找簡要的邊界說明。它應說明該總量是僅限於加速器還是涵蓋全堆疊、是否包括資料中心額外開銷,以及是否包含訓練和非資料中心活動。如果缺少這些資訊,在進行比較時應將該數據視為不完整。切勿私自加上來自其他來源的開銷乘數:設施效率和工作負載條件各不相同。

第 3 節

確保單位與聲明緊密結合

電力通常以小型任務的瓦時(Wh)、較大總量的千瓦時(kWh),以及設施或區域總量的百萬瓦時(MWh)或吉瓦時(GWh)來報告。1 kWh 等於 1,000 Wh。功率以瓦特(W)或千瓦(kW)為單位,表示某個瞬間或特定區間內的速率;而以 Wh 或 kWh 表示的能源則是隨時間累積的。因此,僅憑有關資料中心電力容量的陳述,並不能說明其在一整年內實際消耗了多少電力。

碳排放通常以二氧化碳當量質量表示,例如每項任務排放多少克 CO₂e 或每年排放多少公噸 CO₂e。為了估算與電力相關的排放量,會將能源使用量與電力的排放係數結合計算,該係數的值取決於電網、時間週期和會計方法。製造設備所產生的隱含碳排放是一個獨立的組成部分,可在所選的方法下分攤到硬體的使用壽命或使用過程中。請將能源與排放作為兩種不同的結果分開處理;較低的排放數字可能僅反映了採用較低碳的電力供應,而非用電量較低。水資源消耗是另一項獨立的指標,同樣需要其專門的邊界與單位。

第 4 節

將硬體效率視為一項輸入,而非最終結果

硬體效率可以表示為每單位能源的有效運算量,或是每單位有效工作的耗能。但晶片的每瓦峰值效能並不等同於完成實際服務任務所消耗的能源。現實世界中的結果還取決於利用率、軟體與模型設計、工作負載大小、批次處理(batching)、系統支援設備以及設施本身。IEA 指出,伺服器平均佔據了資料中心用電量的很大一部分,而冷卻及其他元件所佔的比例則因設施類型而有顯著差異。IEA,《AI 的能源需求》

若要進行個人層面的比較,最好在相同的服務和時期內針對相同的定義任務進行比較,並盡可能採用提供商測得的單項任務能源數據。如果要比較兩種模型或服務,請確認任務、輸出長度、測量邊界以及對閒置容量的處理方式具備可比性。硬體規格或基準測試有助於解釋效率潛力,但它本身並不能直接確立生產環境中的實際能源消耗。

第 5 節

以資料中心總量掌握宏觀規模,而非單一提示詞的精確度

單一設施或全國性的總量回答的問題,與每次請求的估算截然不同。總用電量反映了所處理的所有工作負載、設施配備以及特定區間內需求的變化。只有在分子和分母涵蓋相同服務、地點和時期的情況下,將此類總量除以預估的請求次數才能得出粗略的平均值。共享基礎架構也同時支援非 AI 工作負載,因此除非分攤方法有合理依據,否則將設施的所有電力全部歸因於 AI 將會誇大 AI 的份額。

美國能源部 2024 年勞倫斯柏克萊國家實驗室的報告估算了美國資料中心過去的用電量,並提出了至 2028 年的多種未來需求情境。這是一項全國性的資料中心分析,而非對單一 AI 請求能源消耗的直接測量。其宏觀規模和情境方法有助於理解整體需求的不確定性,而產品層級的操作遙測數據則更適用於狹義定義的服務提供任務。勞倫斯柏克萊國家實驗室,《2024 年美國資料中心能源使用報告》

第 6 節

如實陳述不確定性,而非刻意隱瞞

不確定性可能源於對操作數據的存取不完整、依賴估算而非計量的工作負載、對閒置容量的假設、硬體利用率的波動,以及共享設備的分攤方式。此外,由於用電地點與時間、排放係數以及外購電力的會計處理方式不同,碳排放會帶來更多變數。在缺乏完整計量數據的情況下,資料中心總量同樣依賴於估算與情境推演。IEA 明確指出,目前和未來的資料中心用電量存在相當大的不確定性。IEA,《AI 的能源需求》

因此,一份有價值的報告應當指明其觀察時期、描述邊界、明確標示數據是直接計量還是模擬得出,並列出關鍵假設。若估算依賴於情境設定或分攤方式的選擇,應給出範圍或說明這些選擇如何影響結果。當底層測量不足以支援高精度時,應避免列出過多小數位數。對中位數、平均數或代表性任務也應給予準確的標註:每種方式對工作負載分佈的總結角度各不相同,且都不能代表每一個具體的請求。

第 7 節

評估各類說法的實用檢查清單

在引用或比較有關 AI 的環境數據之前,請先確認:

這項數據指的是訓練、推論,還是兩者的總和?

它描述的是什麼服務、工作負載、時期和功能單位?

它是僅計算加速器,還是同時包含主機、閒置容量與設施開銷?

該數值代表能源、功率、碳排放還是水資源?使用的單位是什麼?

對於碳排放,採用了何種電力係數、地理位置、時間基準以及隱含排放處理方式?

該結果是實測、估算還是基於情境推演?還存在哪些重要排除項或不確定性?

對於日常的個人決策而言,這份檢查清單比脫離背景脈絡的「每次對話耗能」數值更具實用價值。它有助於區分針對單一具體服務的測量結果與對 AI 整體的泛泛之談,並揭示出哪些細節的缺失會導致比較失去可靠性。

相關閱讀

繼續探索這個主題