مدونة Metlivi

«يعرف اسمي» مقابل «يفهم مشروعي»: كيف تُميّز بينهما

إذا استخدم روبوت الدردشة القائم على الذكاء الاصطناعي اسمك، فهذا يُظهر قدرته على الوصول إلى تفصيلة شخصية أو تذكرها. لكن هذا لا يُثبت في حد ذاته قدرته على استخدام سياق مشروعك الإبداعي بدقة. للحكم على مدى فاعلية فهمه للسياق، أعطه مهمة صغيرة ضمن المشروع ذات قيود واضحة، ثم تحقق مما إذا كانت إجابته تحافظ على التفاصيل، وتُطبّق تفضيلاتك، وتتعامل مع التصحيحات في الخطوات اللاحقة. قيّم ما يفعله، لا ما يدعي أنه يفهمه.

30 سبتمبر 20267 دقائق قراءةالقراءة والفنون والثقافةبقلم Metlivi Editorial Team
القسم 1

لماذا يُعد تذكّر الاسم اختباراً محدوداً؟

الاسم هو حقيقة موجزة: يمكن تخزينه، أو تكراره، أو استمداده من سياق متاح في الدردشة أو الحساب. في ChatGPT، على سبيل المثال، يمكن للذاكرة أن تتضمن تفاصيل يقدمها المستخدم، في حين قد تُستخدم أيضاً معلومات المحادثات السابقة ذات الصلة عند توفر الميزة المقابلة وتفعيلها. تشير وثائق المنتج أيضاً إلى أن الذاكرة لا تحتفظ بكل التفاصيل وأن عناصر التحكم المتاحة تختلف باختلاف الخطة والمنطقة والمنصة ومساحة العمل. وبالتالي، فإن معرفة الاسم الصحيح تدلك فقط على أن هذه التفصيلة كانت متاحة للإجابة؛ ولا تكشف مقدار السياق المحيط الذي يمكن للنظام استرجاعه أو تطبيقه. مركز مساعدة OpenAI، «الذاكرة في ChatGPT» (Memory in ChatGPT)

يمثل المشروع الإبداعي اختباراً أكثر ثراءً لأنه يجمع عادةً بين عدة حقائق وتفضيلات: ما الذي يجري إنتاجه، ولمن، وما الذي حُسم بالفعل، وما يزال مفتوحاً، وما نوع الاقتراحات المرحب بها. فتكرار «أنت أليكس» يختبر استرجاع تسمية واحدة. أما طلب ثلاث أفكار تتوافق مع موجز محدد للمشروع فيختبر ما إذا كان بإمكان النظام اختيار تفاصيل متعددة ذات صلة واستخدامها معاً.

هذا التمييز عملي، وليس حكماً حول ما إذا كان النموذج يمتلك فهماً شبيهاً بالإنسان. فالسؤال المفيد هو ما إذا كان بإمكانه تطبيق السياق الذي قدمته له على المهمة التالية، وما إذا كان بإمكانك التحقق من ذلك التطبيق في النتيجة.

القسم 2

ما الذي يُعتبر فهماً للمشروع في سياق مهمة ما

للاستخدام اليومي، اعتبر عبارة «يفهم مشروعي» اختصاراً لمجموعة من القدرات القابلة للملاحظة. فالإجابة المفيدة يجب أن تحافظ على الحقائق الثابتة دون خلط، وتميز القرارات عن الاحتمالات، وتتبع القيود المهمة للطلب، وتسأل أو تشير إلى عدم اليقين عندما يؤدي غياب تفصيلة ما إلى تغيير الإجابة. هذه معايير للمهام: يمكنك فحص المخرجات وتحديد ما إذا كانت تلبيها.

تقدم الأبحاث أسباباً تدعو لاختبار كل جزء بدلاً من الاعتماد على الصياغة اللبقة والطلاقة. فمعيار FollowBench، وهو اختبار قياسي لنماذج اللغة أُجري عام 2024، يقسم قيود التعليمات إلى فئات مثل المحتوى والموقف والأسلوب والشكل والأمثلة. ووجدت اختباراته أن الأداء يتراجع مع تراكم القيود، وأن بعض الفئات كانت أصعب من غيرها. يُقيّم هذا المعيار مهام مضبوطة ومحددة، وليس محادثتك الخاصة، لكنه يدعم عادة مفيدة: تحقق من كل متطلب مهم على حدة بدلاً من منح الإجابة قبولاً تاماً لمجرد أنها تبدو منطقية. جيانغ وآخرون، «FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models»

قام معيار منفصل لفهم السياق باختبار الخصائص اللغوية عبر أربع مهام وتسع مجموعات بيانات. وأفاد مؤلفوه بأن النماذج الكثيفة المدربة مسبقاً واجهت صعوبة في التعامل مع الخصائص السياقية الأكثر دقة مقارنة بالنماذج الرائدة المضبوطة بدقة (fine-tuned) في تقييمهم. لا تتنبأ هذه النتيجة بكيفية تعامل أي مساعد حالي مع مشروعك، لكنها تعزز قيمة فحص المعنى والعلاقات، بدلاً من مجرد البحث عن كلمات مألوفة. «Can Large Language Models Understand Context?»

بالنسبة للمشروع، قد تكون تلك العلاقات: «الملصق مخصص لمبادرة مقايضة بذور في الحي»؛ و«تاريخ الفعالية لم يُحدد بعد»؛ و«الاتجاه البصري مشرق ومصنوع يدوياً»؛ و«تجنب اللغة التي تبدو وكأنها إعلان ترويجي». فالإجابة التي تكرر «مقايضة البذور» ولكنها تختلق تاريخاً أو تتجاهل النبرة المطلوبة تكون قد تذكرت موضوعاً دون اتباع الموجز جيداً.

القسم 3

إجراء اختبار صغير وقابل للملاحظة للمشروع

اختر مهمة بسيطة منخفضة المخاطر تشبه العمل الذي تريد المساعدة فيه فعلياً. قدّم لروبوت الدردشة موجزاً قصيراً، ثم اطلب مخرجاً واحداً ملموساً. قد يكون الموجز المفيد على النحو التالي: «أنا أعمل على دعوة من صفحة واحدة لفعالية تبادل بذور في الحي. لم يُحدد التاريخ بعد، لذا لا تذكره. اجعل النبرة دافئة وبسيطة. أريد من الناس إحضار بذور تحمل ملصقات توضيحية، لكن الحضور مفتوح للجميع». ثم اطلب عنواناً رئيسياً وفقرة دعوة قصيرة.

قبل قراءة الإجابة، حوّل الموجز إلى قائمة تحقق بسيطة. في هذا المثال، تحقق مما إذا كانت المخرجات:

تتجنب اختلاق تاريخ؛

تبقي الدعوة مفتوحة للجميع؛

تذكر البذور التي تحمل ملصقات كأمر ينبغي إحضاره؛

تستخدم نبرة دافئة وبسيطة؛ و

تقدم العنوان والفقرة المطلوبين.

قائمة التحقق هذه هي وسيلة مساعدة تحريرية، وليست اختباراً علمياً معتمداً. وتكمن قيمتها في أنها تجعل الأخطاء مرئية. فقد تبدو الفقرة منمقة ولكنها تخفق في الالتزام بأحد القيود، في حين قد تتبع الإجابة البسيطة الموجز بدقة.

بعد ذلك، اطلب خطوة ثانية تعتمد على الأولى: «الآن، اكتب نسخة أقصر للافتة صغيرة، مع عدم ذكر التاريخ أيضاً، وإبقاء الدعوة مفتوحة للجميع». تحقق مما إذا كانت القيود الأساسية باقية بعد تغيير الصيغة. ثم صحح أي خطأ بوضوح—على سبيل المثال، «يُرجى إزالة عبارة "للمزارعين ذوي الخبرة"؛ فالمبتدئون مرحب بهم أيضاً»—وانظر ما إذا كانت المراجعة التالية ستزيلها بالفعل دون إعادة استحضار الاستثناء ذاته بصيغة أخرى.

القسم 4

تقييم دقة التنفيذ والمتابعة، لا الثقة في الصياغة

تتكون بطاقة التقييم العملية من أربعة أجزاء:

الاسترجاع: هل تستخدم الإجابة حقائق المشروع ذات الصلة بشكل صحيح؟

الانتقاء: هل تستحضر الحقائق المهمة لهذه المهمة المحددة، بدلاً من سرد تفاصيل غير ذات صلة؟

التطبيق: هل تتبع قيود المحتوى والنبرة والصيغة المحددة في الموجز في العمل النهائي؟

التحديث: بعد تصحيحك لتفصيلة معينة، هل تعكس النسخة التالية ذلك التصحيح؟

ابحث عن أدلة ملموسة في المخرجات: صياغة تُبقي التاريخ غير محدد، أو ظهور عبارة مطلوبة، أو تصحيح يظل ثابتاً في المراجعة. لا تعول كثيراً على عبارات مثل «أتذكر مشروعك» أو «أفهم بالضبط ما تعنيه». فهذه العبارات لا تثبت أن المخرج التالي سيستخدم الموجز بدقة.

اجعل الاختبار متناسباً مع المهمة. فالإجابة الناجحة الواحدة دليل يخص هذا الطلب بعينه، وليست إثباتاً على الأداء الثابت في كل محادثة قادمة. إذا كان المشروع يمتد عبر عدة محادثات، فتحقق مما إذا كانت الأداة التي تستخدمها تحتوي على ميزات الذاكرة أو سياق المشروع مفعلة، وراجع عناصر التحكم المتاحة فيها. بالنسبة لـ ChatGPT، تُميز الوثائق بين الذكريات المحفوظة وتلك المستمدة من سجل الدردشة؛ كما تشير أيضاً إلى أن ملخصات الذاكرة قد تسقط بعض التفاصيل وأن مصادر السياق قد تكون قابلة للمراجعة عند ظهورها. يمكن أن تتغير الميزات وعناصر التحكم، لذا ارجع إلى إعدادات المنتج الحالية وصفحة المساعدة الخاصة بحسابك. مركز مساعدة OpenAI، «الذاكرة في ChatGPT» (Memory in ChatGPT)

تتطلب المحادثات الطويلة عناية خاصة. ففي تجارب مضبوطة وردت في دراسة «Lost in the Middle»، وجد الباحثون أن قدرة نماذج اللغة المختبرة على استخدام المعلومات ذات الصلة يمكن أن تختلف بناءً على موقعها داخل النص الطويل المدخل، وغالباً ما يكون الأداء أقوى للمعلومات القريبة من البداية أو النهاية مقارنة بتلك الموجودة في المنتصف. اختبرت الدراسة نماذج ومهام محددة؛ وهي لا تجزم بأن كل مساعد سيفقد تفاصيل مشروعك. لكنها تقترح مسار عمل معقولاً: أعد ذكر القرارات القليلة المهمة قبل طلب مخرج رئيسي، خاصة بعد حوار طويل. ليو وآخرون، «Lost in the Middle: How Language Models Use Long Contexts»

القسم 5

اجعل الموجز أسهل في الاستخدام

عندما تفشل الإجابة في إصابة الهدف، حدد سبب الإخفاق قبل أن تقرر معناه. هل كان النظام قادراً على الوصول إلى المعلومات؟ هل دُفنت التفصيلة داخل محادثة طويلة؟ هل تضمن الطلب متطلبات كثيرة مدمجة معاً؟ هل كان التفضيل عاماً وفضفاضاً لدرجة لا تكفي لتوجيه خيار محدد؟ تتطلب هذه الاحتمالات حلولاً مختلفة: أعد ذكر القرار، أو اختصر الموجز، أو قسّم المتطلبات إلى نقاط، أو قدّم مثالاً ملموساً على الأسلوب الذي تريده.

يمكن لملخص المشروع الموجز أن يجعل تقييم العمل المتكرر أسهل. اجعله مقتصراً على التفاصيل الثابتة والمفيدة: هدف المشروع، والجمهور، والخيارات المؤكدة، والأسئلة المفتوحة، وبعض التفضيلات. ميّز التفاصيل غير المؤكدة بأنها غير مؤكدة وضع إشارة على القرارات التي تغيرت. عند بدء مهمة يترتب عليها عمل لاحق، قم بتضمين الجزء ذي الصلة مباشرة في طلبك بدلاً من افتراض أن روبوت الدردشة سيسترجع كل تفصيلة سابقة. هذا اقتراح لمسار العمل مستنتج من التقلب الموثق في أداء الذاكرة ومن الأبحاث المتعلقة باستخدام السياق؛ ولا يعد ضماناً للحصول على نتائج أفضل.

إذا تذكر النظام اسمك بدقة ولكنه أخفق مراراً في مراعاة خيار أساسي في المشروع، فتعامل مع الأمرين كملاحظتين منفصلتين. وإذا أنجز مسودة أولى قوية ولكنه فشل في نقل التصحيح إلى النسخة التالية، فلاحظ ذلك أيضاً. يظل بإمكان المساعد المفيد توفير الوقت عندما توفر له السياق وتفحص النتيجة؛ واختبارك يوضح لك الأجزاء التي تتطلب انتباهك.

القسم 6

الفرق العملي

«يعرف اسمي» تعني أن هناك تفصيلة شخصية كانت متاحة وظهرت في الإجابة. أما «يفهم مشروعي» فيُحكم عليها بشكل أكثر فاعلية من خلال قدرته على استحضار السياق المناسب وتطبيقه في مهمة حقيقية: الحفاظ على القرارات المؤكدة، واتباع القيود المطلوبة، وتكييف الصيغة، واستيعاب التصحيحات. جرّب تقديم موجز قصير، وقيّم النتيجة المرئية وفقاً لقائمة تحقق، وكرر الفحص في خطوة لاحقة. يمنحك ذلك مقياساً ملموساً لدقة متابعة متطلبات المشروع دون الخلط بين تفصيلة مألوفة أو ادعاء واثق وبين الاستخدام الموثوق للسياق.

قراءات ذات صلة

متابعة استكشاف الموضوع