Blog Metlivi

Come misurare l'impatto ambientale dell'IA senza slogan

Per una stima utile del costo ambientale dell'IA, chiediti prima quale attività viene misurata, dove inizia e finisce la misurazione e quale unità di misura viene riportata. L'addestramento di un modello e la risposta a un prompt sono carichi di lavoro differenti; il consumo di elettricità non coincide con le emissioni; e il dato relativo a un singolo prompt non può rappresentare la domanda complessiva di un data center. Un confronto pratico tiene conto di queste distinzioni prima di trarre conclusioni.

30 settembre 20266 min di letturaLettura, arte e culturaDi Metlivi Editorial Team
Sezione 1

Inizia separando l'addestramento dall'inferenza

L'addestramento è il calcolo impiegato per creare o aggiornare un modello. L'inferenza, detta anche serving, è il calcolo utilizzato per generare un output dopo il deployment. Una singola sessione di addestramento può consumare una quantità considerevole di energia nell'arco di un periodo definito, mentre l'inferenza si ripete tra molteplici utenti e richieste. Nel tempo, il totale dovuto al serving ripetuto può diventare rilevante tanto quanto l'addestramento, ma le quote relative dipendono dal modello, dall'utilizzo e dal lasso di tempo considerato. I due aspetti dovrebbero essere misurati e riportati separatamente prima di presentare un totale aggregato. L'Agenzia Internazionale dell'Energia descrive sia l'addestramento sia il deployment come attività dei data center, e uno studio tecnico di Google misura nello specifico l'inferenza, escludendo dal proprio perimetro l'addestramento dei modelli. IEA, “Energy demand from AI” ed Elsworth et al., “Measuring the environmental impact of delivering AI at Google Scale”

Per l'addestramento, una rendicontazione utile comprende la durata dell'esecuzione, l'energia consumata, l'hardware impiegato e se il dato copre unicamente gli acceleratori principali o il sistema di calcolo nel suo complesso. Per l'inferenza, occorre definire il servizio e il task: ad esempio, la generazione di testo per uno specifico assistente durante un determinato periodo di misurazione. Bisogna includere se l'unità riportata è per richiesta, per token, per output generato o per l'energia totale del servizio. Questi denominatori rispondono a quesiti diversi. Il valore per singola richiesta può variare in base alla lunghezza del prompt e della risposta, al routing del modello e alle condizioni del carico di lavoro; un valore per token può mascherare i costi generali (overhead) che non scalano in modo lineare con i token.

Sezione 2

Verifica il perimetro prima di confrontare i dati

Il perimetro di misurazione identifica quali apparecchiature e attività vengono conteggiate. Una stima ristretta potrebbe conteggiare solo l'elettricità assorbita dalle GPU attive o da altri acceleratori IA. Una stima più ampia dell'attività di serving può includere anche le CPU e la memoria dell'host, le macchine inattive mantenute di riserva per la disponibilità, la conversione di potenza, il raffreddamento e altri costi generali del data center. Alcuni perimetri escludono la rete esterna alla struttura, i dispositivi degli utenti finali, l'addestramento dei modelli o l'archiviazione dei dati. Una stima può essere internamente valida pur non essendo idonea al confronto con un'altra che prende in considerazione componenti maggiori — o differenti — del sistema.

La stima pubblicata da Google per le app Gemini mostra chiaramente perché il perimetro è fondamentale. La stima di maggio 2025 per un prompt di testo mediano era di 0,24 wattora (Wh) impiegando il metodo di serving completo; un metodo più ristretto nello stesso studio, che escludeva CPU e memoria host, macchine inattive e overhead della struttura, ha restituito un valore di 0,10 Wh. Si tratta di risultati riferiti a un singolo prodotto, a una specifica data, a una metrica e a un perimetro di calcolo ben precisi, non di valori universali validi per qualsiasi prompt di IA. Lo studio esclude inoltre l'addestramento e i dispositivi degli utenti finali. Google Cloud, “Measuring the environmental impact of AI inference” e il relativo paper tecnico

Quando esamini un dato relativo a un singolo task, cerca una breve dichiarazione sul perimetro adottato. Dovrebbe specificare se il totale riguarda solo gli acceleratori o l'intero stack, se include l'overhead del data center e se include l'addestramento e le attività esterne al data center. Se queste informazioni mancano, considera il dato incompleto ai fini di una comparazione. Non aggiungere arbitrariamente un moltiplicatore di overhead ricavato da un'altra fonte: l'efficienza degli impianti e le condizioni dei carichi di lavoro variano.

Sezione 3

Mantieni le unità di misura legate all'affermazione

L'elettricità viene generalmente indicata in wattora (Wh) per compiti ridotti, in chilowattora (kWh) per totali più ampi e in megawattora o terawattora per i totali di una struttura o di una regione. Un kWh equivale a 1.000 Wh. La potenza, misurata in watt (W) o chilowatt (kW), rappresenta una frequenza o tasso istantaneo o rilevato in un intervallo; l'energia in Wh o kWh si accumula nel tempo. Di conseguenza, un'affermazione sulla capacità di potenza di un data center non indica, di per sé, quanta elettricità abbia consumato nell'arco di un anno.

Le emissioni sono solitamente espresse come massa di anidride carbonica equivalente, come grammi di CO₂e per task o tonnellate di CO₂e all'anno. Per stimare le emissioni legate all'elettricità, il consumo energetico viene combinato con un fattore di emissione dell'energia elettrica, il cui valore dipende dalla rete, dal periodo temporale e dal metodo di calcolo. Le emissioni incorporate derivanti dalla produzione delle apparecchiature costituiscono una componente distinta e possono essere ripartite lungo il ciclo di vita dell'hardware o in base all'utilizzo secondo il metodo scelto. Mantieni separati i risultati relativi a energia ed emissioni; un dato inferiore sulle emissioni potrebbe semplicemente riflettere una fornitura elettrica a minor intensità di carbonio, e non un minore consumo di elettricità. Il consumo idrico rappresenta un'ulteriore metrica a sé stante e necessita di un proprio perimetro e della propria unità di misura.

Sezione 4

Tratta l'efficienza dell'hardware come un singolo fattore, non come il risultato finale

L'efficienza dell'hardware può essere espressa come calcolo utile per unità di energia, oppure come energia per unità di lavoro utile. Tuttavia, le prestazioni di picco per watt di un chip non coincidono con l'energia impiegata per completare un'effettiva richiesta di servizio. I risultati nel mondo reale dipendono anche dal tasso di utilizzo, dalla progettazione del software e del modello, dalle dimensioni del carico di lavoro, dal batching, dalle apparecchiature di supporto del sistema e dalla struttura stessa. L'IEA segnala che i server rappresentano in media una quota rilevante dell'elettricità di un data center, mentre le percentuali per il raffreddamento e per gli altri componenti variano notevolmente a seconda della tipologia di impianto. IEA, “Energy demand from AI”

Per un confronto su scala personale, prediligi il medesimo task definito sullo stesso servizio e nello stesso periodo, avvalendoti, se disponibile, dell'energia per task misurata dal fornitore. Se confronti due modelli o servizi, verifica che il task, la lunghezza dell'output, il perimetro di misurazione e la gestione della capacità inattiva siano comparabili. Le specifiche hardware o i benchmark possono aiutare a chiarire il potenziale di efficienza, ma non stabiliscono in modo autonomo il consumo energetico effettivo in produzione.

Sezione 5

Usa i totali dei data center per valutare la scala, non per la precisione del singolo prompt

Il consumo totale di una struttura o di una nazione risponde a una domanda diversa rispetto alla stima per singola richiesta. Il consumo complessivo di elettricità riflette tutti i carichi di lavoro serviti, le apparecchiature dell'impianto e le fluttuazioni della domanda nell'arco dell'intervallo temporale prescelto. Dividere tale totale per un numero stimato di richieste può fornire soltanto una media approssimativa, a patto che numeratore e denominatore facciano riferimento agli stessi servizi, alle stesse sedi e allo stesso periodo. Le infrastrutture condivise gestiscono anche carichi di lavoro non legati all'IA; pertanto, attribuire tutta l'elettricità della struttura all'IA ne sovrastimerebbe l'impatto, a meno che il metodo di allocazione non lo giustifichi esplicitamente.

Il rapporto del 2024 del Lawrence Berkeley National Laboratory per il Dipartimento dell'Energia degli Stati Uniti stima il consumo storico di elettricità dei data center statunitensi e presenta una serie di scenari per la domanda futura fino al 2028. Si tratta di un'analisi a livello di data center nazionali, non di una misurazione diretta dell'energia per una singola richiesta di IA. La scala e l'approccio per scenari sono utili per comprendere l'incertezza della domanda aggregata, mentre la telemetria operativa a livello di prodotto è più adatta per un task di serving definito in modo circoscritto. Lawrence Berkeley National Laboratory, “2024 United States Data Center Energy Usage Report”

Sezione 6

Descrivi l'incertezza anziché nasconderla

L'incertezza può derivare da un accesso parziale ai dati operativi, da carichi di lavoro stimati anziché misurati al contatore, da ipotesi sulla capacità inattiva, dalla variazione dell'utilizzo dell'hardware e dalle scelte sui criteri di allocazione delle apparecchiature condivise. Le emissioni introducono un'ulteriore variabilità legata alla localizzazione geografica e alle fasce orarie dell'elettricità, ai fattori di emissione e ai criteri contabili applicati all'elettricità acquistata. Anche i dati aggregati dei data center si basano su stime e scenari quando non sono disponibili dati di misurazione completi. L'IEA segnala esplicitamente un margine di incertezza sostanziale nei consumi elettrici attuali e futuri dei data center. IEA, “Energy demand from AI”

Un report accurato dichiara pertanto il periodo di osservazione, descrive il perimetro, specifica se i valori sono stati misurati direttamente o modellati e indica le ipotesi fondamentali. Qualora le stime dipendano da scenari o scelte di allocazione, è opportuno fornire un intervallo di valori o spiegare come tali scelte influiscano sul risultato. Evita di indicare troppe cifre decimali quando la misurazione alla base non le supporta. Inoltre, un valore mediano, medio o un task rappresentativo devono essere etichettati con precisione: ciascuno sintetizza la distribuzione del carico di lavoro in modo diverso e nessuno di essi riflette la totalità delle richieste.

Sezione 7

Una checklist pratica per valutare un'affermazione

Prima di rilanciare o confrontare un dato ambientale relativo all'IA, chiediti:

Si tratta di addestramento, di inferenza o di un totale combinato?

Quale servizio, carico di lavoro, periodo e unità funzionale descrive?

Conteggia unicamente gli acceleratori o include anche gli host, la capacità inattiva e l'overhead dell'impianto?

Il valore fa riferimento a energia, potenza, emissioni o acqua — e quali unità di misura vengono impiegate?

Per le emissioni, quali fattori di emissione elettrica, localizzazione, riferimento temporale e criteri per le emissioni incorporate sono stati applicati?

Il risultato è misurato, stimato o basato su scenari, e quali esclusioni rilevanti o elementi di incertezza permangono?

Per le scelte quotidiane a livello individuale, questa checklist risulta più utile ed efficace rispetto a un dato decontestualizzato sul "consumo di energia per chat". Aiuta a distinguere una misurazione circoscritta a un singolo servizio specifico da affermazioni generiche sull'IA nel suo complesso, evidenziando quali omissioni renderebbero inaffidabile qualsiasi confronto.

Letture correlate

Continua a esplorare il tema