مدونة Metlivi

كيفية قياس مدى فائدة محادثة ذكاء اصطناعي قصيرة دون تحسين مدة الجلسة

يمكن أن تكون محادثة الذكاء الاصطناعي القصيرة ناجحة عندما تساعد شخصاً ما على إنجاز مهمة إبداعية صغيرة: اختيار لوحة ألوان، أو تسمية مشروع عطلة نهاية الأسبوع، أو العثور على بعض الأفكار لنشاط شخصي. لتقييم هذا التبادل، حدد ما كان يريده الشخص، ثم تحقق مما إذا كانت الإجابة ذات صلة ومفيدة وسهلة التوجيه أو الإنهاء. يمكن للوقت المستغرق والزيارات المتكررة أن تصف الاستخدام، لكنها وحدها لا يمكن أن تخبرك ما إذا كان التبادل مفيداً.

30 سبتمبر 20266 دقائق للقراءةالقراءة والفنون والثقافةبقلم Metlivi Editorial Team
القسم 1

ابدأ بالمهمة التي جاء الشخص للقيام بها

قبل اختيار مقياس، حدد مهمة عادية واحدة بمصطلحات قابلة للملاحظة. إن مهمة «الحصول على بضعة أسماء مرحة لحديقة أعشاب في الشرفة» أسهل في التقييم من «إجراء محادثة تفاعلية». فالأولى تمنح المراجعين شيئاً ملموساً للبحث عنه: هل قدم النظام أسماء تتناسب مع الطلب، وهل تمكن الشخص من اختيار أحدها أو تعديله؟

يتبع هذا مبدأً أوسع في قابلية الاستخدام: الحكم على ما إذا كان مستخدمون محددون يحققون أهدافاً محددة بفعالية وكفاءة ورضا في سياق معين. يتعامل تعريف ISO مع هذه الخصائص على أنها صفات مترابطة ولكنها متميزة، لذا لا يوجد مقياس واحد — بما في ذلك المدة — يحل محلها جميعاً. ISO 9241-11:2018، *Ergonomics of human-system interaction — Part 11: Usability: Definitions and concepts*

بالنسبة للطلبات الإبداعية، حدد الإنجاز كنتيجة مفيدة بدلاً من إجابة صحيحة واحدة. قد يخرج الشخص بفكرة واحدة مختارة، أو قائمة مختصرة، أو اتجاه أفضل لمحاولة أخرى. دوّن مسبقاً ما يُعد كافياً للمهمة. يمنع ذلك فرق العمل من إعادة تعريف النجاح بهدوء على أنه «استمر المستخدم في الدردشة».

القسم 2

سجل الإنجاز والصلة بالموضوع بشكل منفصل

يمكن أن تبدأ المراجعة العملية بسؤالين: هل وصل التبادل إلى النتيجة المحددة، وهل كانت ردود المساعد متناسبة مع الطلب؟ احتفظ بالإجابات منفصلة. قد يكون الرد ذا صلة بالموضوع ولكنه يترك الشخص دون خيار قابل للاستخدام؛ كما يمكن للشخص إكمال مهمة بعد تجاهل رد مشتت أو عام.

يُعد إنجاز المهمة مقياساً شائعاً وبسيطاً، ولكنه يختزل النتائج في نتيجة بنعم أو لا، ولا يوضح سبب فشل شخص ما أو مدى جودة المهمة المكتملة. اربطه بمراجعة قصيرة للمحادثة أو بتقييم مباشر من المستخدم. مجموعة نيلسن نورمان (Nielsen Norman Group)، «Success Rate: The Simplest Usability Metric»

تدعم أبحاث الحوار هذه الرؤية الأكثر تفصيلاً. فقد قامت دراسة حول الحوار الموجه نحو المهام بتوصيف الصلة بالموضوع، وإثارة الاهتمام، والفهم، وإنجاز المهمة، والكفاءة على مستوى كل من الدور في الحوار والمحادثة ككل؛ ووجدت أن التقييم الإجمالي الواحد يمكن أن يغفل فروقاً دقيقة مفيدة، وأن الرضا تفاوت بين المراجعين والمحادثات. لا تمثل هذه النتائج صيغة تقييم شاملة، لكنها تقدم مجموعة أبعاد مدروسة يمكن تكييفها مع مهمة إبداعية. سيرو، وعليان نجادي، ودي ريكه، «Understanding User Satisfaction with Task-oriented Dialogue Systems»

القسم 3

تعامل مع جودة الاستجابة باعتبارها مسألة تخص كل دور في الحوار

راجع ما إذا كانت كل إجابة تستجيب لآخر طلب وتستخدم السياق المناسب من الأدوار السابقة في الحوار. إذا قال الشخص «اجعل هذه الاقتراحات أقل رسمية» على سبيل المثال، فيجب أن يغير الرد المفيد التالي الاقتراحات وفقاً لذلك. احسب التكرار الذي يمكن تفاديه، أو الشروط التي تم تجاهلها، أو طلبات التوضيح التي لا تساعد في دفع المهمة إلى الأمام.

وجدت دراسة حول المساعدين الأذكياء أن الرضا اختلف حسب السيناريو: كان إنجاز المهمة مهماً جداً في بعض المهام، بينما كان الجهد المبذول مهماً في مهام أخرى. وذكرت أيضاً أن الحفاظ على سياق المحادثة كان أمراً بالغ الأهمية، وأن الرضا العام عن المهمة لا يمكن اختزاله في الرضا عن استفسارات فردية. والنتيجة العملية المترتبة على ذلك هي فحص كل من الردود المحددة والتبادل ككل، مع تفسير كل منها في ضوء مهمته. أبحاث مايكروسوفت (Microsoft Research)، «Understanding User Satisfaction with Intelligent Assistants»

بالنسبة لتبادل إبداعي، قد تصنف مراجعة بشرية قصيرة الردود بأنها ذات صلة، أو ذات صلة جزئية، أو خارجة عن موضوع المهمة، وتلاحظ ما إذا كان المساعد قد اتبع التصحيحات. هذه التصنيفات هي طريقة مراجعة مقترحة، وليست معياراً مرجعياً معتمداً. وإذا وفرها مصنف آلي، فافحص العينات يدوياً: فقد تخفق الدرجة المنمقة في ملاحظة اقتراح يطابق التوجيه من الناحية الفنية ولكنه لا يمنح الشخص أي شيء يمكنه استخدامه.

القسم 4

تحقق من قدرة الشخص على توجيه المحادثة

يظهر تحكم المستخدم في اللحظات الصغيرة: كأن يتمكن الشخص من تضييق نطاق الطلب، أو طلب أسلوب آخر، أو تصحيح سوء فهم، أو التوقف بعد الحصول على ما يكفي. راجع نصوص المحادثات للتأكد مما إذا كان النظام قد استجاب للتوجيه بدلاً من الإصرار بشكل متكرر على مسار محادثته الخاص. وإذا كانت الواجهة توفر عناصر تحكم للإيقاف، أو التعديل، أو إعادة التوليد، أو مسح الرد، فاختبر ما إذا كانت هذه الإجراءات تعمل بالشكل الذي يتوقعه المستخدمون.

وصفت الأبحاث المتعلقة بالوكلاء الحواريين الاستقلالية بمصطلحات تتضمن التحكم في المحادثة، والأسئلة، والردود. وهذا يدعم التعامل مع التحكم كخاصية يجب فحصها، على الرغم من أنه لا يحدد مقياساً شاملاً واحداً للمنتج خاصاً بها. يانغ وأوريسيكيو، «Designing Conversational Agents: A Self-Determination Theory Approach»

يمكن لسؤال مستخدم خفيف أن يجعل التحكم قابلاً للقياس: «هل تمكنت من توجيه المحادثة للوصول إلى النتيجة التي أردتها؟» اطرح هذا السؤال بعد التبادل، إلى جانب سؤال حول إنجاز المهمة. حافظ على اتساق خيارات الإجابة عبر الجلسات واسمح بتقديم شرح موجز. تُعد الدرجة المنخفضة إشارة لفحص المحادثة، وليست دليلاً على سبب بعينه.

القسم 5

اعتبر النهاية الواضحة نتيجة صحيحة ومقبولة

تكون نقطة النهاية الجيدة عندما يحصل الشخص على ما يحتاجه ويمكنه المغادرة دون مطالبة أخرى من النظام. بالنسبة لمثال حديقة الأعشاب، قد تكون تلك هي اللحظة التي يختارون فيها اسماً. قد تكون المحادثة التي تنتهي عند هذا الحد أكثر فائدة من محادثة تطول بأسئلة متابعة عامة. هذا مبدأ قياس مستنتج من المهمة: إذا اكتمل الهدف، فإن الأدوار الإضافية في الحوار لا تضيف قيمة تلقائياً.

تتبع ما إذا كانت المهمة تبدو مكتملة وما إذا كان الشخص قد اختار الاستمرار، ولكن فسر تلك الأحداث في سياقها. يمكن أن يعكس دور المتابعة فضولاً، أو تصحيحاً ضرورياً، أو إجابة غير مكتملة. وقد يعني الخروج الصامت أن الشخص راضٍ، أو مشتت الذهن، أو محبط. لا يمكن لطول المحادثة وحده التمييز بين هذه التفسيرات؛ استخدم مراجعات لعينات من نصوص المحادثات أو تعليقات موجزة من المستخدمين للتحقق من ذلك.

القسم 6

استخدم المدة الزمنية كسياق، وليس كحكم نهائي

يمكن أن تساعد المدة في الإجابة عن أسئلة تشغيلية، مثل ما إذا كان مسار معين يتطلب بشكل روتيني العديد من الأدوار في الحوار. ومع ذلك، تظل مقياساً للنشاط المنقضي، وليست دليلاً مباشراً على أن الإجابة كانت مفيدة. على سبيل المثال، تُعرّف Google Analytics وقت التفاعل بأنه مدة تفاعل المستخدم المرتبطة بالأحداث؛ كما تحذر إرشادات المطورين الخاصة بها من أن إطالة الجلسات بشكل مصطنع يؤدي إلى تشويه بيانات السلوك. هذه تعريفات تحليلية وتحذيرات متعلقة بالتنفيذ، وليست مقياساً للجودة لمحادثة إبداعية. Google Analytics، «Measurement Protocol reference» وGoogle Analytics، «Measure sessions and user engagement»

قارن الوقت فقط بين المهام المتشابهة وإلى جانب إنجاز المهمة، والصلة بالموضوع، وتحكم المستخدم، ووجود نقطة نهاية واضحة. قد يعكس متوسط المدة الأقصر إجابة أكثر مباشرة، ولكنه قد يعكس أيضاً استسلام المستخدمين. وقد تعني المدة الأطول تكراراً مثمراً — أو احتكاكاً وصعوبة لا داعي لهما. يجب أن يأتي الدليل الداعم من نتيجة المهمة وما مر به الأشخاص، وليس من مدار الساعة وحده.

القسم 7

روتين تقييم مقتضب

بالنسبة لدراسة صغيرة، امنح المشاركين مهمة إبداعية واحدة مصاغة بوضوح، ودعهم يستخدمون الدردشة بشكل طبيعي، وسجل ما إذا كانوا قد وصلوا إلى النتيجة التي حددوها. راجع عينة من المحادثات للتأكد من الصلة بالموضوع، ومتابعة السياق، وفرص التوجيه أو التوقف. بعد كل مهمة، اسأل عما إذا كانوا قد حصلوا على نتيجة مفيدة وشعروا بالقدرة على توجيه المحادثة. سجل المدة كسياق، ثم افحص الحالات التي تختلف فيها المدة عن الفائدة المسجلة.

أبلغ عن المقاييس بشكل منفصل بدلاً من دمجها في درجة «تفاعل» واحدة. حدد المهمة، وكيف تم الحكم على الإنجاز، ومن قام بمراجعة الردود، وكيف جُمعت آراء المستخدمين. إذا كانت العينة صغيرة أو كان تعريف المهمة شخصياً، فصف النتائج بأنها توجيهية بدلاً من تعميمها على كل مستخدم أو طلب إبداعي.

تكتسب المحادثة القصيرة أهميتها عندما تنقل الشخص من طلب محدد إلى نتيجة يمكنه استخدامها، مع تركه متحكماً في المسار ونقطة التوقف. قِس تلك النتائج مباشرة. دع طول الجلسة يساعد في تفسير التجربة، ولكن لا تدعه يحدد النجاح.

قراءات ذات صلة

متابعة استكشاف الموضوع