كيف تقيس التكلفة البيئية للذكاء الاصطناعي بعيداً عن الشعارات الرنانة
للحصول على تقدير مفيد للتكلفة البيئية للذكاء الاصطناعي، اسأل أولاً عن النشاط الذي يتم قياسه، وأين يبدأ القياس وأين ينتهي، وما هي الوحدة المسجلة. فتدريب النموذج والإجابة على مطالبة هما عبئا عمل مختلفان؛ واستهلاك الكهرباء ليس هو نفسه الانبعاثات؛ ورقم مخصص لمطالبة واحدة لا يمكن أن يمثل إجمالي الطلب لمركز بيانات. إن المقارنة العملية تسجل هذه الفروق قبل استخلاص النتائج.
ابدأ بالفصل بين التدريب والاستدلال
التدريب هو الحوسبة المستخدمة لإنشاء نموذج أو تحديثه. أما الاستدلال، والذي يسمى أيضاً خدمة الاستدلال (serving)، فهو الحوسبة المستخدمة لإنتاج مخرجات بعد النشر. قد تستهلك جولة تدريب واحدة طاقة كبيرة على مدى فترة محددة، في حين يتكرر الاستدلال عبر المستخدمين والطلبات. وبمرور الوقت، يمكن أن يصبح الإجمالي الناتج عن تقديم الخدمة المتكرر كبيراً إلى جانب التدريب، لكن الحصص النسبية تعتمد على النموذج والاستخدام والفترة المحتسبة. ينبغي قياس الاثنين والإبلاغ عنهما بشكل منفصل قبل تقديم أي إجمالي مجمع. وتصف وكالة الطاقة الدولية كلاً من التدريب والنشر بأنهما من أنشطة مراكز البيانات، في حين تقيس دراسة فنية لشركة Google الاستدلال على وجه التحديد مع ترك تدريب النموذج خارج حدودها. وكالة الطاقة الدولية، "الطلب على الطاقة من الذكاء الاصطناعي" وإلسورث وآخرون، "قياس الأثر البيئي لتقديم خدمات الذكاء الاصطناعي على نطاق Google"
بالنسبة للتدريب، تتضمن التقارير المفيدة مدة التشغيل، والطاقة المستهلكة، والأجهزة المعنية، وما إذا كان الرقم يغطي فقط المسرّعات الرئيسية أم نظام الحوسبة الأوسع. وبالنسبة للاستدلال، حدد الخدمة والمهمة: على سبيل المثال، توليد النصوص لمساعد مسمى خلال فترة قياس محددة. وضّح ما إذا كانت الوحدة المسجلة لكل طلب، أو لكل رمز مميز (token)، أو لكل مخرج مُولّد، أو إجمالي طاقة الخدمة. تجيب هذه المقامات على أسئلة مختلفة؛ حيث يمكن أن تختلف القيمة لكل طلب باختلاف طول المطالبة والاستجابة، وتوجيه النموذج، وظروف عبء العمل؛ في حين أن القيمة لكل رمز مميز قد تخفي النفقات العامة التي لا تتناسب طردياً مع الرموز.
تحقق من الحدود قبل مقارنة الأرقام
تحدد حدود القياس المعدات والأنشطة التي يتم احتسابها. قد يحتسب التقدير الضيق الكهرباء المسحوبة بواسطة وحدات معالجة الرسومات (GPUs) النشطة أو مسرّعات الذكاء الاصطناعي الأخرى. أما تقدير الاستدلال الأوسع فقد يشمل أيضاً وحدات المعالجة المركزية (CPUs) المضيفة والذاكرة، والأجهزة الخاملة المخصصة للجاهزية، وتحويل الطاقة، والتبريد، وغير ذلك من النفقات العامة لمركز البيانات. وتستثني بعض الحدود الشبكة خارج المنشأة، أو أجهزة المستخدم النهائي، أو تدريب النماذج، أو تخزين البيانات. يمكن أن يكون التقدير صحيحاً داخلياً مع بقائه غير صالح للمقارنة مع تقدير آخر يحتسب أجزاء أكثر—أو مختلفة—من النظام.
يوضح تقدير Gemini Apps المنشور من Google سبب أهمية الحدود. فقد كان تقديرها لشهر مايو 2025 لمتوسط المطالبة النصية هو 0.24 واط-ساعة (Wh) باستخدام طريقة الاستدلال الشاملة؛ في حين أنتجت طريقة أضيق في نفس الدراسة، والتي استبعدت وحدة المعالجة المركزية المضيفة والذاكرة والأجهزة الخاملة ونفقات المنشأة العامة، 0.10 واط-ساعة. هذه نتائج لمنتج وتاريخ ومقياس وحدود محاسبية محددة، وليست قيماً عامة لمطالبة الذكاء الاصطناعي. كما تستبعد الدراسة التدريب وأجهزة المستخدم النهائي. Google Cloud، "قياس الأثر البيئي لاستدلال الذكاء الاصطناعي" والورقة الفنية المصاحبة
عند قراءة أي رقم خاص بمهمة ما، ابحث عن بيان حدود موجز. يجب أن يوضح ما إذا كان الإجمالي يقتصر على المسرّع فقط أم يشمل الحزمة الكاملة، وما إذا كانت النفقات العامة لمركز البيانات مشمولة، وما إذا كان التدريب والأنشطة خارج مركز البيانات متضمنة. وإذا كانت هذه المعلومات مفقودة، فتعامل مع الرقم على أنه غير مكتمل للمقارنة. لا تضف معامل نفقات عامة ضمنياً من مصدر آخر: فكفاءة المنشأة وظروف عبء العمل تختلف.
حافظ على ربط الوحدات بالادعاء
يُبلّغ عن الكهرباء عادةً بالواط-ساعة (Wh) للمهمة الصغيرة، وبالكيلوواط-ساعة (kWh) للإجماليات الأكبر، وبالميجاواط-ساعة أو التيراواط-ساعة لإجماليات المنشأة أو الإجماليات الإقليمية. يعادل الكيلوواط-ساعة الواحد 1,000 واط-ساعة. أما القدرة، المقاسة بالواط (W) أو الكيلوواط (kW)، فهي معدل في لحظة معينة أو خلال فترة زمنية؛ في حين تتراكم الطاقة بالواط-ساعة أو الكيلوواط-ساعة بمرور الوقت. وبالتالي، فإن البيان المتعلق بالقدرة الكهربائية لمركز البيانات لا يحدد، بحد ذاته، كمية الكهرباء التي استخدمها خلال عام.
عادةً ما يُعبّر عن الانبعاثات بكتلة مكافئ ثاني أكسيد الكربون، مثل غرامات من مكافئ ثاني أكسيد الكربون (CO₂e) لكل مهمة أو أطنان من مكافئ ثاني أكسيد الكربون سنوياً. ولتقدير الانبعاثات المرتبطة بالكهرباء، يُدمج استخدام الطاقة مع معامل انبعاثات الكهرباء، وتعتمد قيمته على الشبكة، والفترة الزمنية، وطريقة المحاسبة. وتُعد الانبعاثات الضمنية (المجسدة) الناتجة عن تصنيع المعدات عنصراً منفصلاً ويمكن توزيعها على مدى العمر الافتراضي للأجهزة أو الاستخدام وفقاً لمنهجية مختارة. احتفظ بالطاقة والانبعاثات كنتائج منفصلة؛ فالرقم الأقل للانبعاثات قد يعكس إمداداً كهربائياً أقل كثافة كربونية، وليس استهلاكاً أقل للكهرباء. كما يُعد استخدام المياه مقياساً مستقلاً آخر يحتاج إلى حدوده ووحدته الخاصة.
تعامل مع كفاءة الأجهزة كمدخل واحد، وليس كنتيجة كاملة
يمكن التعبير عن كفاءة الأجهزة كحوسبة مفيدة لكل وحدة طاقة، أو كطاقة لكل وحدة عمل مفيد. لكن ذروة أداء الشريحة لكل واط ليست هي نفسها الطاقة المستخدمة لإكمال مهمة خدمة حقيقية. تعتمد النتائج في العالم الفعلي أيضاً على الاستخدام، وتصميم البرمجيات والنموذج، وحجم عبء العمل، والتجميع في دفعات (batching)، ومعدات دعم النظام، والمنشأة. وتشير وكالة الطاقة الدولية إلى أن الخوادم تمثل حصة كبيرة من كهرباء مركز البيانات في المتوسط، بينما تختلف الحصص المخصصة للتبريد والمكونات الأخرى بشكل كبير حسب نوع المنشأة. وكالة الطاقة الدولية، "الطلب على الطاقة من الذكاء الاصطناعي"
لإجراء مقارنة شخصية، يفضل اختيار نفس المهمة المحددة على نفس الخدمة والفترة، مع اعتماد الطاقة المقاسة للمهمة من جانب المزود إذا كانت متاحة. وإذا كنت تقارن بين نموذجين أو خدمتين، فتحقق من أن المهمة، وطول المخرجات، وحدود القياس، والتعامل مع القدرة الخاملة قابلة للمقارنة. يمكن لمواصفات الأجهزة أو الاختبارات القياسية أن تساعد في شرح إمكانات الكفاءة، لكنها لا تثبت بشكل مستقل استخدام الطاقة في بيئة الإنتاج الفعلية.
استخدم إجماليات مراكز البيانات لفهم الحجم الإجمالي، وليس لدقة كل مطالبة
يجيب الإجمالي الخاص بالمنشأة أو الإجمالي الوطني على سؤال يختلف عن التقدير لكل طلب. يعكس إجمالي استهلاك الكهرباء جميع أعباء العمل المقدمة، ومعدات المنشأة، والتغيرات في الطلب خلال فترة زمنية محددة. وقد يؤدي تقسيم هذا الإجمالي على عدد تقديري من الطلبات إلى إعطاء متوسط تقريبي فقط إذا كان البسط والمقام يغطيان نفس الخدمات والمواقع والفترة الزمنية. وتخدم البنية التحتية المشتركة أيضاً أعباء عمل غير مرتبطة بالذكاء الاصطناعي، لذا فإن تخصيص كل كهرباء المنشأة للذكاء الاصطناعي سيبالغ في تقدير حصته ما لم تبرر طريقة التخصيص ذلك.
يقدر تقرير مختبر لورنس بيركلي الوطني لعام 2024 التابع لوزارة الطاقة الأمريكية الاستخدام التاريخي للكهرباء في مراكز البيانات الأمريكية ويقدم مجموعة من سيناريوهات الطلب المستقبلية حتى عام 2028. وهذا تحليل لمراكز البيانات على المستوى الوطني، وليس قياساً مباشراً للطاقة لمطالبة ذكاء اصطناعي فردية. إن نهج النطاق والسيناريوهات المتبع فيه مفيد لفهم عدم اليقين في الطلب الإجمالي، في حين أن القياس التشغيلي عن بُعد على مستوى المنتج أكثر صلة بمهمة خدمة محددة بدقة. مختبر لورنس بيركلي الوطني، "تقرير استخدام الطاقة في مراكز البيانات بالولايات المتحدة لعام 2024"
صف عدم اليقين بدلاً من إخفائه
يمكن أن يتسرب عدم اليقين من خلال الوصول غير الكامل إلى البيانات التشغيلية، وأعباء العمل المقدرة بدلاً من المقاسة بالعدادات، والافتراضات حول القدرة الخاملة، وتغير استغلال الأجهزة، والخيارات المتعلقة بكيفية تخصيص المعدات المشتركة. وتضيف الانبعاثات تفاوتاً إضافياً من خلال موقع وتوقيت الكهرباء، وعوامل الانبعاثات، والمعالجة المحاسبية للكهرباء المشتراة. تعتمد إجماليات مراكز البيانات أيضاً على التقديرات والسيناريوهات عندما لا تتوفر بيانات مقاسة كاملة. وتشير وكالة الطاقة الدولية صراحة إلى وجود قدر كبير من عدم اليقين في استهلاك مراكز البيانات للكهرباء حالياً ومستقبلاً. وكالة الطاقة الدولية، "الطلب على الطاقة من الذكاء الاصطناعي"
لذلك، يحدد التقرير المفيد فترة المراقبة الخاصة به، ويصف الحدود، ويوضح ما إذا كانت الأرقام مقاسة مباشرة أم منمذجة، وينص على الافتراضات الرئيسية. وحيثما تعتمد التقديرات على السيناريوهات أو خيارات التخصيص، قدم نطاقاً أو اشرح كيف تؤثر هذه الخيارات على النتيجة. تجنب تقديم الكثير من الخانات العشرية عندما لا يدعمها القياس الأساسي. كما ينبغي أيضاً تصنيف المهمة المتوسطة (median)، أو الحسابية (mean)، أو التمثيلية بدقة: فكل منها يلخص توزيع عبء العمل بشكل مختلف، ولا يصف أي منها كل طلب.
قائمة تحقق عملية لتقييم الادعاءات
قبل تكرار أو مقارنة رقم بيئي خاص بالذكاء الاصطناعي، اسأل:
هل يتعلق الأمر بالتدريب، أم بالاستدلال، أم بإجمالي مجمع؟
ما هي الخدمة، وعبء العمل، والفترة، والوحدة الوظيفية التي يصفها؟
هل يحتسب المسرّعات فقط، أم يشمل أيضاً الأجهزة المضيفة، والقدرة الخاملة، ونفقات المنشأة العامة؟
هل القيمة تعبر عن طاقة، أم قدرة، أم انبعاثات، أم مياه—وما هي الوحدات المستخدمة؟
بالنسبة للانبعاثات، ما هو معامل الكهرباء، والموقع، والأساس الزمني، وطريقة معالجة الانبعاثات الضمنية المطبقة؟
هل النتيجة مقاسة، أم مقدرة، أم مبنية على سيناريو، وما هي الاستثناءات أو جوانب عدم اليقين الهامة المتبقية؟
بالنسبة للخيارات الشخصية العادية، تعد قائمة التحقق هذه أكثر قابلية للتطبيق من رقم "الطاقة لكل محادثة" المجرد من سياقه. فهي تساعد على التمييز بين نتيجة مقاسة لخدمة محددة وبين ادعاء فضفاض حول الذكاء الاصطناعي ككل، وتوضح التفاصيل المفقودة التي تجعل المقارنة غير موثوقة.
