Metlivi Blog

Wie man die Umweltkosten von KI ohne Parolen misst

Für eine aussagekräftige Schätzung der Umweltkosten von KI muss man sich zunächst fragen, welche Aktivität gemessen wird, wo die Messung beginnt und endet und welche Einheit angegeben wird. Das Training eines Modells und das Beantworten eines Prompts sind unterschiedliche Arbeitslasten; Stromverbrauch ist nicht dasselbe wie Emissionen; und ein Wert für einen einzelnen Prompt kann nicht stellvertretend für den Gesamtbedarf eines Rechenzentrums stehen. Ein fundierter Vergleich erfasst diese Unterschiede, bevor Schlussfolgerungen gezogen werden.

30. September 20266 min readLesen, Kunst & KulturVon Metlivi Editorial Team
Abschnitt 1

Zunächst Training und Inferenz voneinander trennen

Training bezeichnet die Rechenleistung, die zur Erstellung oder Aktualisierung eines Modells eingesetzt wird. Inferenz, auch Serving genannt, ist die Rechenleistung, die nach der Bereitstellung zur Erzeugung einer Ausgabe verwendet wird. Ein einzelner Trainingslauf kann über einen bestimmten Zeitraum erhebliche Energie verbrauchen, während Inferenz wiederholt von vielen Nutzern und bei zahlreichen Anfragen stattfindet. Im Laufe der Zeit kann die Summe des wiederholten Servings neben dem Training ins Gewicht fallen, die relativen Anteile hängen jedoch vom Modell, der Nutzung und dem betrachteten Zeitraum ab. Beide Bereiche sollten separat gemessen und ausgewiesen werden, bevor ein Gesamtwert präsentiert wird. Die Internationale Energieagentur beschreibt sowohl Training als auch Bereitstellung als Aktivitäten von Rechenzentren, und eine technische Studie von Google misst gezielt die Inferenz, klammert das Modelltraining jedoch aus ihren Systemgrenzen aus. IEA, „Energy demand from AI“ und Elsworth et al., „Measuring the environmental impact of delivering AI at Google Scale“

Beim Training umfasst eine aussagekräftige Berichterstattung die Dauer des Laufs, den Energieverbrauch, die beteiligte Hardware und die Angabe, ob sich der Wert nur auf die primären Beschleuniger oder das gesamte Rechensystem bezieht. Bei der Inferenz sollten Dienst und Aufgabe klar definiert werden: beispielsweise die Texterstellung für einen bestimmten Assistenten während eines angegebenen Messzeitraums. Geben Sie an, ob die Einheit pro Anfrage, pro Token, pro generierter Ausgabe oder als Gesamtenergie des Dienstes ausgewiesen wird. Diese Nenner beantworten unterschiedliche Fragen. Ein Pro-Anfrage-Wert kann je nach Länge von Prompt und Antwort, Modell-Routing und Systemlast variieren; ein Pro-Token-Wert kann Gemeinkosten verschleiern, die nicht linear mit den Tokens skalieren.

Abschnitt 2

Vor dem Zahlenvergleich die Systemgrenzen prüfen

Die Systemgrenze legt fest, welche Geräte und Aktivitäten erfasst werden. Eine enge Schätzung erfasst möglicherweise nur den Strom, der von aktiven GPUs oder anderen KI-Beschleunigern verbraucht wird. Eine breiter angelegte Serving-Schätzung kann zusätzlich Host-CPUs und Arbeitsspeicher, für die Verfügbarkeit reservierte Leerlaufmaschinen, Stromwandlung, Kühlung und sonstige Gemeinkosten des Rechenzentrums einbeziehen. Manche Systemgrenzen schließen externe Netzwerke außerhalb der Anlage, Endgeräte der Nutzer, Modelltraining oder Datenspeicherung aus. Eine Schätzung kann intern vollkommen valide sein, sich aber dennoch nicht für den Vergleich mit Werten eignen, die mehr – oder andere – Teile des Systems einbeziehen.

Googles veröffentlichte Schätzung für die Gemini Apps veranschaulicht, warum die Systemgrenzen entscheidend sind. Die Schätzung vom Mai 2025 für den medianen Text-Prompt lag bei 0,24 Wattstunden (Wh) unter Verwendung der umfassenden Serving-Methode; eine engere Methode in derselben Studie, die Host-CPU und -Speicher, Leerlaufmaschinen und Anlagen-Gemeinkosten ausschloss, ergab 0,10 Wh. Dies sind Ergebnisse für ein einzelnes Produkt, Datum, eine Kennzahl und eine Bilanzierungsgrenze – keine universellen Werte für einen KI-Prompt. Die Studie schließt zudem das Training und Endgeräte aus. Google Cloud, „Measuring the environmental impact of AI inference“ und das begleitende Whitepaper

Achten Sie bei allen Pro-Aufgabe-Zahlen auf eine kurze Definition der Systemgrenzen. Es sollte klar hervorgehen, ob die Gesamtsumme nur Beschleuniger oder den gesamten Stack umfasst, ob Gemeinkosten des Rechenzentrums enthalten sind und ob Training sowie Aktivitäten außerhalb des Rechenzentrums berücksichtigt wurden. Fehlen diese Angaben, ist die Zahl für einen fundierten Vergleich unvollständig. Es sollte nicht eigenmächtig ein pauschaler Zuschlag aus einer anderen Quelle addiert werden, da sich Effizienz der Anlagen und Auslastungsbedingungen unterscheiden.

Abschnitt 3

Einheiten stets im Kontext der Aussage belassen

Strom wird üblicherweise in Wattstunden (Wh) für kleine Aufgaben, in Kilowattstunden (kWh) für größere Summen und in Megawattstunden oder Terawattstunden für Anlagen oder regionale Gesamtmengen angegeben. Eine kWh entspricht 1.000 Wh. Leistung, gemessen in Watt (W) oder Kilowatt (kW), beschreibt eine Rate zu einem bestimmten Zeitpunkt oder über ein Intervall; Energie in Wh oder kWh akkumuliert sich über die Zeit. Eine Aussage über die Leistungskapazität eines Rechenzentrums sagt daher für sich genommen noch nichts darüber aus, wie viel Strom im Laufe eines Jahres tatsächlich verbraucht wurde.

Emissionen werden in der Regel als Masse von Kohlendioxid-Äquivalenten ausgedrückt, etwa in Gramm CO₂e pro Aufgabe oder Tonnen CO₂e pro Jahr. Um strombezogene Emissionen abzuschätzen, wird der Energieverbrauch mit einem Emissionsfaktor für Strom kombiniert, dessen Wert vom Stromnetz, dem Zeitraum und der Bilanzierungsmethode abhängt. Graue Emissionen aus der Geräteherstellung stellen eine separate Komponente dar und können nach der gewählten Methode über die Lebensdauer oder die Nutzung der Hardware verteilt werden. Energie und Emissionen sollten als unterschiedliche Ergebnisse behandelt werden; ein niedrigerer Emissionswert kann auf eine kohlenstoffärmere Stromversorgung zurückzuführen sein und nicht auf einen geringeren Stromverbrauch. Der Wasserverbrauch ist eine weitere eigenständige Kennzahl, die eigene Grenzen und Einheiten erfordert.

Abschnitt 4

Hardware-Effizienz als Einzelfaktor betrachten, nicht als Gesamtergebnis

Hardware-Effizienz kann als nutzbare Rechenleistung pro Energieeinheit oder als Energiebedarf pro Einheit nutzbarer Arbeit ausgedrückt werden. Die Spitzenleistung eines Chips pro Watt entspricht jedoch nicht dem Energieaufwand, der für die Ausführung einer realen Serviceaufgabe nötig ist. Ergebnisse unter realen Bedingungen hängen zudem von der Auslastung, dem Software- und Modelldesign, dem Arbeitslastumfang, dem Batching, der unterstützenden Systemtechnik und der Anlage selbst ab. Die IEA stellt fest, dass Server im Durchschnitt einen großen Teil des Stroms von Rechenzentren verbrauchen, während die Anteile für Kühlung und andere Komponenten je nach Anlagentyp stark variieren. IEA, „Energy demand from AI“

Für persönliche Vergleiche empfiehlt es sich, dieselbe definierte Aufgabe beim selben Dienst und im selben Zeitraum heranzuziehen – idealerweise mit der vom Anbieter gemessenen Energie pro Aufgabe, sofern verfügbar. Beim Vergleich zweier Modelle oder Dienste ist darauf zu achten, dass Aufgabe, Ausgabelänge, Systemgrenzen und der Umgang mit Leerlaufkapazitäten vergleichbar sind. Eine Hardwarespezifikation oder ein Benchmark kann das Effizienzpotenzial verdeutlichen, liefert aber für sich genommen keinen verlässlichen Nachweis für den realen Energieverbrauch im Produktivbetrieb.

Abschnitt 5

Gesamtzahlen von Rechenzentren für Größenordnungen nutzen, nicht für Details pro Prompt

Ein standortbezogener oder nationaler Gesamtwert beantwortet eine ganz andere Frage als eine Schätzung pro Anfrage. Der gesamte Stromverbrauch spiegelt alle ausgeführten Workloads, die Anlageninfrastruktur und Nachfrageschwankungen über ein gewähltes Intervall wider. Teilt man eine solche Gesamtsumme durch eine geschätzte Anzahl von Anfragen, entsteht bestenfalls ein grober Durchschnittswert – und das nur, wenn Zähler und Nenner dieselben Dienste, Standorte und Zeiträume abdecken. Geteilte Infrastrukturen bedienen zudem auch Nicht-KI-Workloads. Eine pauschale Zurechnung des gesamten Stroms der Anlage zu KI würde deren Anteil überzeichnen, sofern die Zuordnungsmethode dies nicht stichhaltig begründet.

Der Bericht des Lawrence Berkeley National Laboratory für das US-Energieministerium aus dem Jahr 2024 schätzt den historischen Stromverbrauch von US-Rechenzentren und skizziert verschiedene künftige Nachfrageszenarien bis 2028. Hierbei handelt es sich um eine nationale Rechenzentrums-Analyse und nicht um eine direkte Messung des Energiebedarfs für eine einzelne KI-Anfrage. Dieser Maßstab und der Szenario-Ansatz sind nützlich, um die Unsicherheiten bezüglich des Gesamtbedarfs zu verstehen, während für eine eng umrissene Serving-Aufgabe betriebliche Telemetriedaten auf Produktebene relevanter sind. Lawrence Berkeley National Laboratory, „2024 United States Data Center Energy Usage Report“

Abschnitt 6

Unsicherheiten transparent beschreiben statt verbergen

Unsicherheiten können durch lückenhaften Zugriff auf Betriebsdaten, geschätzte statt gemessene Arbeitslasten, Annahmen über Leerlaufkapazitäten, wechselnde Hardware-Auslastung und die Art der Zuweisung gemeinsamer Ressourcen entstehen. Bei den Emissionen kommen weitere Schwankungen durch Standort und Zeitpunkt des Strombezugs, Emissionsfaktoren sowie die bilanzielle Behandlung von eingekauftem Grünstrom hinzu. Auch Gesamtzahlen für Rechenzentren basieren auf Schätzungen und Szenarien, wenn lückenlose Zählerdaten fehlen. Die IEA weist ausdrücklich auf erhebliche Unsicherheiten beim aktuellen und künftigen Stromverbrauch von Rechenzentren hin. IEA, „Energy demand from AI“

Ein aufschlussreicher Bericht benennt daher seinen Erfassungszeitraum, beschreibt die Systemgrenzen, kennzeichnet Werte als direkt gemessen oder modelliert und legt zentrale Annahmen offen. Wenn Schätzungen von Szenarien oder Zuweisungsentscheidungen abhängen, sollten Bandbreiten angegeben oder der Einfluss dieser Annahmen auf das Ergebnis erklärt werden. Viele Nachkommastellen sollten vermieden werden, wenn die zugrunde liegende Messung diese Genauigkeit gar nicht hergibt. Ein Median, Mittelwert oder eine repräsentative Aufgabe sollte zudem präzise gekennzeichnet sein: Jeder dieser Werte fasst eine Lastverteilung anders zusammen, und keiner bildet jede beliebige Anfrage exakt ab.

Abschnitt 7

Eine praktische Checkliste zur Bewertung von Aussagen

Bevor man Umweltkennzahlen zu KI weiterverbreitet oder vergleicht, sollte man Folgendes hinterfragen:

Handelt es sich um Training, Inferenz oder einen Gesamtwert?

Welcher Dienst, welcher Workload, welcher Zeitraum und welche funktionelle Einheit werden beschrieben?

Werden nur Beschleuniger erfasst oder auch Hosts, Leerlaufkapazitäten und Anlagen-Gemeinkosten?

Bezieht sich der Wert auf Energie, Leistung, Emissionen oder Wasser – und welche Einheiten werden verwendet?

Welcher Strommix-Faktor, Standort, Zeitbezug und welcher Ansatz für graue Emissionen wurden bei den Emissionswerten zugrunde gelegt?

Ist das Ergebnis gemessen, geschätzt oder szenariobasiert, und welche wesentlichen Ausschlüsse oder Unsicherheiten bestehen?

Für alltägliche persönliche Entscheidungen ist diese Checkliste hilfreicher als eine isolierte Zahl zum „Energieverbrauch pro Chat“. Sie hilft dabei, ein gemessenes Ergebnis für einen konkreten Dienst von pauschalen Behauptungen über KI als Ganzes zu unterscheiden, und zeigt, welche fehlenden Details einen Vergleich unzuverlässig machen.

Weitere Artikel

Dieses Thema weiter erkunden