如何摒弃口号、切实衡量人工智能的环境成本
要想对人工智能的环境成本做出有价值的估算,首先应明确衡量的是何种活动、衡量的始末边界在哪里,以及报告所采用的单位是什么。训练模型与回答提示属于截然不同的工作负载;电力消耗并不等同于碳排放;单次提示的数据也无法代表整个数据中心的总体需求。只有在得出结论前厘清这些区别,对比分析才具有实际意义。
首先区分训练与推理
训练是指用于创建或更新模型所需的计算。推理(亦称服务交付,serving)是指在模型部署后生成输出所需的计算。单次训练运行可能会在特定时期内消耗大量能源,而推理则会随着不同用户和请求不断重复发生。随着时间推移,多次提供服务所累积的总量可能会逐渐与训练相当,但两者的相对占比取决于具体模型、使用情况以及统计的时间段。在呈现任何综合总量之前,应分别衡量并报告这两者。国际能源署(IEA)将训练和部署均归为数据中心活动,而谷歌的一项技术研究在专门衡量推理时,便将模型训练排除在其统计边界之外。参见国际能源署,《人工智能的能源需求》(Energy demand from AI)与 Elsworth 等人,《衡量谷歌规模下提供人工智能的环境影响》(Measuring the environmental impact of delivering AI at Google Scale)。
对于训练而言,有价值的报告应包含运行周期、能耗、涉及的硬件,以及该数据是仅涵盖主要加速器还是包含了更广泛的计算系统。对于推理而言,应界定具体的服务与任务:例如特定助手在指定衡量周期内的文本生成。此外还需说明报告的单位是按每次请求、每个 token、每次生成的输出,还是按整个服务的总能耗计算。这些分母解答的是不同的问题。按请求计算的数值可能会随提示与响应的长度、模型路由和工作负载状况而波动;按 token 计算的数值则可能掩盖不随 token 数量直接线性缩放的固定开销。
比对数据前先核查边界
衡量边界决定了哪些设备和活动被纳入统计。狭义的估算可能只计算运行中的 GPU 或其他 AI 加速器所消耗的电量。更宽泛的服务估算还可能计入宿主 CPU 与内存、为保障可用性而预留的空闲机器、电力转换损失、冷却系统以及其他数据中心开销。有些边界则排除了设施外部的网络传输、终端用户设备、模型训练或数据存储。一项估算在自身设定范围内可能是合理有效的,但若直接与计入了更多(或不同)系统组成部分的另一项估算进行比对,则并不合适。
谷歌公布的 Gemini Apps 估算充分说明了边界的重要性。其 2025 年 5 月针对中位数文本提示的估算显示,采用全面服务交付法得出的能耗为 0.24 瓦时(Wh);而在同一项研究中,采用排除了宿主 CPU 与内存、空闲机器及基础设施开销的更窄边界方法时,得出的数值为 0.10 瓦时。这些仅是针对某一款产品、某一日期、某一指标及特定统计边界下的结果,并非适用于所有 AI 提示的普适数值。该研究同样排除了训练与终端设备。参见 Google Cloud,《衡量人工智能推理的环境影响》(Measuring the environmental impact of AI inference)及配套技术论文。
在查阅任何单项任务的数据时,请寻找简要的边界说明。它应当阐明该总量是仅限加速器还是涵盖全栈,是否包含数据中心基础设施开销,以及是否包含了训练和非数据中心活动。如果缺少这些信息,该数据在用于比对时应被视作不完整的。切勿随意套用其他来源的开销系数:设施的能效与工作负载条件各不相同。
指标表述务必明确对应单位
电力消耗通常在小任务中以瓦时(Wh)表示,在较大总量中以千瓦时(kWh)表示,在设施或区域总量中以兆瓦时(MWh)或吉瓦时(GWh)表示。1 kWh 等于 1,000 Wh。功率(单位为瓦特 W 或千瓦 kW)是某一时刻或时间间隔内的速率;而以 Wh 或 kWh 计量的能量则是随时间累积的。因此,单凭数据中心电力容量的数据,并不能说明它在一整年里实际消耗了多少电量。
碳排放通常以二氧化碳当量质量来表示,例如单项任务产生的克二氧化碳当量(g CO₂e)或全年的吨二氧化碳当量(t CO₂e)。为了估算与用电相关的排放,需要将能耗与电力的排放因子相结合,而该因子的数值取决于电网构成、时间段和核算方法。制造设备产生的隐含排放则属于另一独立部分,可根据所选方法分摊到硬件的整个生命周期或使用期内。请务必将能耗与排放作为独立指标区分对待;较低的排放数据可能反映的是电网供电更为清洁,而非用电量更少。水资源消耗是另一项独立指标,同样需要界定自身的边界和单位。
将硬件效率视为单一输入项,而非最终结果
硬件效率可以用单位能耗下的有效计算量表示,也可以用完成单位有效工作所需的能量来表示。但芯片的峰值每瓦性能并不等同于完成实际服务任务时所消耗的能量。现实环境中的结果还取决于利用率、软件与模型设计、工作负载规模、批处理(batching)、系统支持设备以及设施本身。国际能源署指出,平均而言服务器占据了数据中心电耗的主要份额,而冷却及其他组件的占比则因设施类型不同而存在巨大差异。参见国际能源署,《人工智能的能源需求》(Energy demand from AI)。
在进行个性化比对时,最好基于相同服务和相同时段内定义的同一任务,并尽可能采用服务商实测的单次任务能耗。若要对比两种模型或服务,请确认任务类型、输出长度、衡量边界以及对空闲容量的处理方式具有可比性。硬件规格或基准测试有助于了解潜在的效率上限,但它本身并不能直接证明生产环境下的实际能耗。
以数据中心总量把握宏观规模,而非用于推导单次提示的精确能耗
单一设施或全国的总能耗解答的问题与单次请求的估算完全不同。总用电量反映了选定周期内所服务的所有工作负载、设施设备以及需求波动。仅当分子和分母涵盖相同的服务、地点和时段时,用此类总量除以预估的请求总数才能得出一个大致的平均值。此外,共享基础设施同时还承载着非 AI 工作负载,因此除非分配方法能够证明其合理性,否则将设施的全部用电都归咎于 AI 会高估 AI 的实际份额。
美国能源部劳伦斯伯克利国家实验室 2024 年的报告估算了美国数据中心历史用电量,并提出了截至 2028 年的一系列未来需求情景。这是一项全国性的数据中心分析,而非对单个 AI 请求能耗的直接测量。其宏观尺度和情景预测方法有助于理解总需求的波动范围与不确定性,而产品级的运行遥测数据才更适用于界定边界狭窄的服务交付任务。参见劳伦斯伯克利国家实验室,《2024年美国数据中心能耗报告》(2024 United States Data Center Energy Usage Report)。
坦承不确定性,而非刻意掩盖
不确定性可能源于运行数据获取不全、工作负载系估算而非实测、对空闲容量的预设假设、硬件利用率的波动,以及共享设备的分配方式选择。在碳排放方面,用电地点与时段、排放因子以及购电核算方式的差异,会进一步加大波动性。在缺乏完整实测数据时,数据中心总量同样依赖于估算与情景假设。国际能源署明确指出,当前及未来的数据中心用电量存在相当大的不确定性。参见国际能源署,《人工智能的能源需求》(Energy demand from AI)。
因此,一份有参考价值的报告应当注明其观察周期、描述统计边界、说明数据是直接实测还是建模推算,并陈述关键假设。当估算结果取决于不同情景或分配方式时,应提供数值区间或解释这些选择如何影响最终结果。当下层测量精度不足以支撑时,应避免保留过多小数位。对中位数、平均值或代表性任务的标注也应严谨准确:它们对工作负载分布的概括方式各异,且没有哪一个能代表所有请求。
评估环境数据主张的实用核对清单
在转述或对比某项 AI 环境数据之前,请先确认:
该数据是指训练、推理,还是两者的总和?
它描述的是何种服务、工作负载、时间段以及功能单位?
它仅统计了加速器,还是同时计入了宿主机、空闲容量及基础设施开销?
所列数值是能量、功率、碳排放还是用水量——具体采用了什么单位?
对于碳排放,采用了何种电力排放因子、地域基准、时间基准以及隐含排放处理方法?
该结果是实测、估算还是基于情景推算得出的?仍存在哪些重要的排除项或不确定性?
对于日常的个人选择而言,这份清单比脱离具体语境的“每次对话能耗”数字更具实操意义。它有助于区分针对单一特定服务的实测结果与针对整个人工智能领域的宽泛论调,并能揭示出缺少哪些细节会导致比对失去可靠性。
