Como medir o custo ambiental da IA sem slogans
Para uma estimativa útil do custo ambiental da IA, primeiro pergunte qual atividade está sendo medida, onde a medição começa e termina, e qual unidade é informada. O treinamento de um modelo e a resposta a um comando (prompt) são cargas de trabalho diferentes; o consumo de eletricidade não é o mesmo que emissões; e um número para um único prompt não pode substituir a demanda total de um data center. Uma comparação prática registra essas distinções antes de tirar conclusões.
Comece separando o treinamento da inferência
O treinamento é a computação usada para criar ou atualizar um modelo. A inferência, também chamada de serviço (serving), é a computação usada para produzir uma resposta após a implementação. Uma única execução de treinamento pode consumir energia substancial ao longo de um período definido, enquanto a inferência é repetida entre usuários e solicitações. Com o tempo, o total decorrente do atendimento repetido de requisições pode se tornar relevante em comparação ao treinamento, mas as parcelas relativas dependem do modelo, do uso e do período contabilizado. Os dois devem ser medidos e relatados separadamente antes que qualquer total combinado seja apresentado. A Agência Internacional de Energia descreve tanto o treinamento quanto a implementação como atividades de data center, e um estudo técnico do Google mede especificamente a inferência, deixando o treinamento do modelo fora do seu escopo. IEA, “Energy demand from AI” e Elsworth et al., “Measuring the environmental impact of delivering AI at Google Scale”
Para o treinamento, um relatório útil inclui a duração da execução, a energia consumida, o hardware envolvido e se o valor cobre apenas os aceleradores principais ou o sistema de computação mais amplo. Para a inferência, defina o serviço e a tarefa: por exemplo, geração de texto para um assistente específico durante um período de medição declarado. Inclua se a unidade informada é por solicitação, por token, por saída gerada ou a energia total do serviço. Esses denominadores respondem a perguntas diferentes. Um valor por solicitação pode variar com o comprimento do prompt e da resposta, o roteamento do modelo e as condições da carga de trabalho; um valor por token pode ocultar custos indiretos (overheads) que não escalam diretamente com os tokens.
Verifique o escopo antes de comparar números
O escopo de medição identifica quais equipamentos e atividades são contabilizados. Uma estimativa restrita pode contar a eletricidade consumida por GPUs ativas ou outros aceleradores de IA. Uma estimativa de inferência mais ampla também pode incluir CPUs e memória do host, máquinas ociosas reservadas para disponibilidade, conversão de energia, resfriamento e outros custos indiretos do data center. Alguns escopos excluem a rede fora das instalações, dispositivos do usuário final, treinamento do modelo ou armazenamento de dados. Uma estimativa pode ser internamente válida e, ainda assim, ser inadequada para comparação com outra que contabiliza mais — ou diferentes — partes do sistema.
A estimativa publicada pelo Google para o Gemini Apps ilustra por que o escopo é importante. Sua estimativa de maio de 2025 para o prompt de texto mediano foi de 0,24 watt-hora (Wh) usando seu método abrangente de inferência; um método mais restrito no mesmo estudo, que excluiu a CPU e a memória do host, máquinas ociosas e custos indiretos da instalação, resultou em 0,10 Wh. Esses são resultados para um produto, data, métrica e limite contábil específicos, não valores universais para um prompt de IA. O estudo também exclui o treinamento e os dispositivos do usuário final. Google Cloud, “Measuring the environmental impact of AI inference” e o artigo técnico complementar
Ao ler qualquer número por tarefa, procure por uma breve declaração de escopo. Ela deve informar se o total se refere apenas a aceleradores ou à pilha completa (full-stack), se os custos indiretos do data center estão incluídos e se o treinamento e as atividades fora do data center estão inclusos. Se essa informação estiver ausente, trate o número como incompleto para comparação. Não adicione silenciosamente um multiplicador de custos indiretos de outra fonte: a eficiência das instalações e as condições da carga de trabalho variam.
Mantenha as unidades vinculadas à afirmação
A eletricidade é comumente informada em watts-hora (Wh) para uma tarefa pequena, quilowatts-hora (kWh) para totais maiores, e megawatts-hora ou terawatts-hora para totais de instalações ou regionais. Um kWh equivale a 1.000 Wh. A potência, medida em watts (W) ou quilowatts (kW), é uma taxa em um determinado momento ou ao longo de um intervalo; a energia em Wh ou kWh acumula-se com o tempo. Portanto, uma declaração sobre a capacidade de potência de um data center não indica, por si só, quanta eletricidade ele usou durante um ano.
As emissões são geralmente expressas como massa de dióxido de carbono equivalente, como gramas de CO₂e por tarefa ou toneladas de CO₂e por ano. Para estimar as emissões relacionadas à eletricidade, o consumo de energia é combinado com um fator de emissão para a eletricidade, cujo valor depende da rede elétrica, do período e do método contábil. As emissões incorporadas da fabricação de equipamentos são um componente separado e podem ser alocadas ao longo da vida útil do hardware ou do uso sob um método escolhido. Mantenha energia e emissões como resultados distintos; um número de emissões mais baixo pode refletir um fornecimento de eletricidade com menor intensidade de carbono, e não um menor consumo de eletricidade. O uso de água é outra métrica distinta e precisa de seu próprio escopo e unidade.
Trate a eficiência do hardware como um parâmetro, não como o resultado final
A eficiência do hardware pode ser expressa como computação útil por unidade de energia, ou como energia por unidade de trabalho útil. No entanto, o desempenho máximo de um chip por watt não é o mesmo que a energia usada para concluir uma tarefa de serviço real. Os resultados no mundo real também dependem da utilização, do design de software e modelo, do tamanho da carga de trabalho, do processamento em lote (batching), dos equipamentos de suporte do sistema e das instalações. A IEA observa que os servidores respondem por uma grande parcela da eletricidade dos data centers em média, enquanto as parcelas de resfriamento e outros componentes variam substancialmente por tipo de instalação. IEA, “Energy demand from AI”
Para uma comparação pessoal, prefira a mesma tarefa definida no mesmo serviço e período, com a energia por tarefa medida pelo provedor, se disponível. Se comparar dois modelos ou serviços, verifique se a tarefa, a extensão da resposta gerada, o escopo de medição e o tratamento da capacidade ociosa são comparáveis. Uma especificação de hardware ou benchmark pode ajudar a explicar o potencial de eficiência, mas não estabelece de forma independente o consumo de energia em produção.
Use os totais do data center para entender a escala, não para precisão por prompt
O total de uma instalação ou de um país responde a uma pergunta diferente de uma estimativa por solicitação. O consumo total de eletricidade reflete todas as cargas de trabalho atendidas, os equipamentos da instalação e as mudanças na demanda ao longo de um intervalo escolhido. Dividir esse total por um número estimado de solicitações pode criar uma média aproximada apenas se o numerador e o denominador cobrirem os mesmos serviços, locais e período. A infraestrutura compartilhada também atende a cargas de trabalho que não são de IA, portanto, atribuir toda a eletricidade da instalação à IA superestimaria a fatia da IA, a menos que o método de alocação justifique isso.
O relatório de 2024 do Lawrence Berkeley National Laboratory para o Departamento de Energia dos EUA estima o consumo histórico de eletricidade dos data centers norte-americanos e apresenta uma série de cenários de demanda futura até 2028. Trata-se de uma análise nacional de data centers, não de uma medição direta da energia para uma solicitação individual de IA. Sua abordagem de escala e cenários é útil para entender a incerteza na demanda agregada, enquanto a telemetria operacional no nível do produto é mais relevante para uma tarefa de inferência estritamente definida. Lawrence Berkeley National Laboratory, “2024 United States Data Center Energy Usage Report”
Descreva a incerteza em vez de ocultá-la
A incerteza pode surgir devido ao acesso incompleto a dados operacionais, cargas de trabalho estimadas em vez de medidas, premissas sobre capacidade ociosa, variações na utilização do hardware e escolhas sobre como os equipamentos compartilhados são alocados. As emissões introduzem mais variações por meio da localização e do horário do consumo da eletricidade, dos fatores de emissão e do tratamento contábil da eletricidade adquirida. Os totais de data centers também dependem de estimativas e cenários quando dados medidos completos não estão disponíveis. A IEA aponta explicitamente uma incerteza substancial no consumo de eletricidade atual e futuro dos data centers. IEA, “Energy demand from AI”
Portanto, um relatório útil indica seu período de observação, descreve o escopo, identifica se os números são medidos diretamente ou modelados e expõe as principais premissas. Onde as estimativas dependerem de cenários ou escolhas de alocação, forneça um intervalo ou explique como essas escolhas afetam o resultado. Evite apresentar muitas casas decimais quando a medição subjacente não as sustenta. Uma tarefa mediana, média ou representativa também deve ser rotulada com precisão: cada uma resume uma distribuição de carga de trabalho de maneira diferente, e nenhuma descreve todas as solicitações.
Uma lista de verificação prática para avaliar uma afirmação
Antes de reproduzir ou comparar um número ambiental relativo à IA, pergunte:
Trata-se de treinamento, inferência ou um total combinado?
Qual serviço, carga de trabalho, período e unidade funcional ele descreve?
Ele contabiliza apenas aceleradores ou também hosts, capacidade ociosa e custos indiretos da instalação?
O valor se refere a energia, potência, emissões ou água — e quais unidades são usadas?
Para emissões, qual fator de eletricidade, localização, base temporal e tratamento de emissões incorporadas foram aplicados?
O resultado é medido, estimado ou baseado em cenários, e quais exclusões ou incertezas importantes permanecem?
Para escolhas pessoais do dia a dia, esta lista de verificação é mais aplicável do que um número descontextualizado de “energia por chat”. Ela ajuda a distinguir um resultado medido para um serviço definido de uma afirmação genérica sobre a IA como um todo, e mostra quais detalhes ausentes tornariam uma comparação não confiável.
