ما وراء محاكاة الصوت البشري: أربعة أهداف أفضل لتصميم محادثات الذكاء الاصطناعي
بالنسبة للمصممين الذين يُشكّلون تفاعلات محادثات الذكاء الاصطناعي، فإن مبدأ "اجعله يبدو حقيقيًا" فضفاض للغاية ولا يمكنه توجيه قرارات مفيدة. والهدف الأفضل هو مساعدة المستخدم في الحصول على إجابة واضحة، واستكشاف فكرة ما، وفهم ما أنجزه النظام، واختيار الخطوة التالية. تشير الأبحاث المتعلقة بالإشارات التشخيصية (تجسيم الصفات البشرية) إلى أن العلامات الشبيهة بالبشر قد تغيّر مدى ثقة الناس في دقة معلومات الذكاء الاصطناعي. وهذا يجعل من الوضوح، والممارسة الإبداعية المرنة، وحالة المهام الموثوقة، وتحكّم المستخدم، أهدافًا تصميمية أكثر فائدة من مجرد تقليد هوية بشرية.
لماذا يجب أن تتجاوز محادثات الذكاء الاصطناعي مجرد محاكاة الهيئة البشرية؟
يمكن للمحادثة أن تبدو طلقة دون أن تمنح المستخدم صورة موثوقة عن النظام. ففي تجربة شارك فيها 2,165 مشاركًا، غيّر الباحثون الوسيط المستخدم؛ فاستخدم نموذج لغوي اصطلاحي النص وحده تارة أو الصوت مع النص تارة أخرى، كما تنوعت إشارته إلى نفسه بين "أنا" أو "النظام". وقد أدى استخدام الصوت إلى جانب النص إلى رفع تقييمات المشاركين للتجسيم البشري ودقة المعلومات؛ كما أدت صياغة المتكلم إلى زيادة تقييمات الدقة وتقليل المخاطر المتصورة في سياق معين. وتظل هذه النتائج مرتبطة بظروف تلك الدراسة تحديدًا، إلا أنها توضح أن الإشارة التي تجعل النظام يبدو أكثر إنسانية يمكن أن تؤثر أيضًا على الأحكام الصادرة بشأن معلوماته. Google Research، "Believing Anthropomorphism: Examining the Role of Anthropomorphic Cues on User Trust in Large Language Models"
لهذا السبب تستحق الإشارات التشخيصية وجودة التفاعل مراجعات تقييمية منفصلة؛ إذ يركز تدقيق الإشارات التشخيصية على ما توحي به الواجهة حول هوية الذكاء الاصطناعي أو صفاته الإنسانية. بينما يدرس تدقيق مخاطر التقدير ما إذا كانت الإشارة قد تدفع المستخدمين إلى المبالغة في تقدير دقة المخرجات أو مدى الاعتماد عليها. وتتناول أهداف التصميم الموضحة أدناه مسألة مختلفة: ما الذي ينبغي أن يكون الشخص قادرًا على فهمه وفعله وتقريره أثناء التفاعل؟ ويمكن للنبرة الودية أن تتوافق مع هذه الأهداف، بشرط ألا تحجب إمكانيات النظام أو حالة المهمة.
تنظم مجموعة أدوات Human-AI eXperience التابعة لشركة Microsoft إرشاداتها بناءً على كيفية تصرف نظام الذكاء الاصطناعي عند الاستخدام الأول، وأثناء التفاعل، وعندما يخطئ، وعلى مدار الوقت. ويُعدّ هذا الهيكل مفيدًا لتصميم المحادثات لأنه ينقل التركيز من شخصية النظام إلى الاحتياجات المتغيرة للشخص الذي يستخدمه. Microsoft، "Guidelines for Human-AI Interaction"
اجعل الوضوح ميزة مرئية في المحادثة
يبدأ الوضوح بمهمة المستخدم، وليس بنبرة صوتية حوارية متقنة. فالشخص الذي يطلب ثلاثة أفكار لأنشطة نهاية الأسبوع يحتاج إلى خيارات يمكنه المقارنة بينها؛ ومن يطلب إعادة صياغة يحتاج إلى مسودة يمكنه تعديلها. وينبغي للواجهة أن تجعل الإجراء المطلوب والنتيجة المسترجعة متميزين وسهلي التفريق. وإذا كان الذكاء الاصطناعي يقترح مواد أو يلخصها أو يحولها، فقم بتسمية هذه المساهمة بوضوح واحتفظ بسياق كافٍ حتى يتمكن المستخدم من الحكم عليها.
يمكن للتفاعل المفيد أيضًا أن يوضح ما يمكن للذكاء الاصطناعي فعله وما لا يمكنه فعله في اللحظة التي تهم فيها تلك المعلومة. على سبيل المثال، إذا كان المساعد الحواري يمكنه اقتراح خطة ولكنه لا يستطيع إجراء حجز، فلا ينبغي أن تترك الاستجابةُ هذا الإجراءَ غامضًا. اذكر بوضوح ما هو جاهز، وما زال يتطلب تدخل المستخدم، والتفاصيل التي تظل غير مؤكدة. وهذه توصية تصميمية مستخلصة من تركيز مجموعة HAX على السلوك المناسب طوال فترة التفاعل، وليست ادعاءً بأن نمط صياغة واحد يصلح لكل منتج.
تتمثل طريقة التحقق البسيطة من الوضوح في سؤال أحد المستخدمين بعد محادثة قصيرة: ما الذي طلبته من النظام أن يفعله؟ وما الذي فعله بالفعل؟ وما الذي ستحتاج إلى التحقق منه أو تقريره قبل استخدام النتيجة؟ فإذا تباعدت الإجابات عن المعنى المقصود من الواجهة، فراجع الصياغة أو الهيكل أو مؤشرات الخطوة التالية قبل إضافة المزيد من السمات الشخصية للنظام.
استخدم أسلوب التجربة المرن لدعم الاستكشاف
تمنح المرونة التفاعلية الناس وسيلة لاستكشاف الأداة وإمكانياتها. ففي دراسة شملت 372 منشورًا أنشأها المستخدمون حول ChatGPT، حدد الباحثون تفاعلات قائمة على التجربة والمداعبة شملت المزاح، وتحدي النظام، واختبار حدوده. ويصف المؤلفون هذه التفاعلات بأنها طريقة يستكشف بها الناس قدرات الذكاء الاصطناعي ومدى استقلاليته، مع الإشارة إلى أن العينة تعكس منشورات من فترة مبكرة لاستخدام ChatGPT. Nikghalb and Cheng، "Interrogating AI: Characterizing Emergent Playful Interactions with ChatGPT"
بالنسبة للمصممين، لا يعني المغزى العملي هنا تحويل كل مساعد إلى ممثل كوميدي، بل تسهيل التجربة منخفضة المخاطر: توفير طرق لتجربة زاوية مختلفة، أو مقارنة البدائل، أو مراجعة مسودة دون فقدان النسخة السابقة. ويمكن لموجّه إبداعي قصير مثل "أعطني ثلاثة موضوعات غير متوقعة" أن يدعو إلى الاستكشاف مع إبقاء هدف المستخدم في الحسبان. يجب أن يكون التجريب التفاعلي وضعًا متاحًا، وليس أداءً مفروضًا يُلزم المستخدم بتحمله.
تميز الأبحاث المتعلقة بأدوات التأليف التفاعلية الممتعة بين الإنسان والذكاء الاصطناعي بين المرح والإبداع، في حين تصف اللعب التفاعلي بأنه وسيلة مساعدة محتملة للاستجابات الإبداعية. كما تناقش الواجهة، وسلوك الذكاء الاصطناعي، والحوار كفرص تصميمية، مع التعامل مع التجربة التفاعلية على أنها ممارسة تجب مساندتها وليست نتيجة يمكن ضمانها. Liapis et al.، "Designing for Playfulness in Human-AI Authoring Tools"
حافظ على وضوح حالة المهمة عبر الجولات التفاعلية
يمكن لواجهة الدردشة أن تبدو طبيعية ومع ذلك تفقد تتبع مسار العمل. تشمل حالة المهمة هدف المستخدم الحالي، والقرارات المتخذة بالفعل، والخيارات التي لا تزال مفتوحة، والخطوة التالية. وعندما يتحول التبادل إلى خطوات متعددة، يمكن أن يُظهر تلخيص موجز الفهمَ الحالي للنظام: "تبقى لديك خياران؛ وأنت تفضل نزهة قصيرة؛ ولم أختر موقعًا بعد". يتيح ذلك للمستخدم فرصة لتصحيح المسار قبل استمرار المحادثة.
يجب أن يتناسب نمط التفاعل مع مدى تعقيد المهمة. تميز ورقة دينغ وتشان البحثية حول الإنشاء المشترك للنصوص بين الإنسان والذكاء الاصطناعي بين التنظيم محدد النطاق، والمهام الإبداعية المستقلة، والمهام الإبداعية المعقدة والمترابطة. وهي تربط بين هذه التصنيفات وأنماط تفاعل مختلفة، بدءًا من التدخل المحدود ووصولاً إلى التعاون التكراري. والاستنتاج التصميمي المفيد هنا هو أن الإجابة المقتصرة على جولة واحدة قد تناسب ملخصًا محددًا، بينما تستفيد المهمة الإبداعية المتطورة من الجولات التي تعرض الخيارات وتتيح للشخص تشكيل النتيجة. Ding and Chan، "Mapping the Design Space of Interactions in Human-AI Text Co-creation Tasks"
لإجراء فحص عملي للحالة، تتبع مهمة نموذجية عبر مسار المحادثة. واسأل عند كل جولة عما إذا كان الشخص قادرًا على معرفة ما تم إنجازه، وما يزال غير محسوم، وكيفية تصحيح أي افتراض خاطئ. فإذا كانت الإجابة تعتمد على تذكر عدة جولات سابقة، فأضف ملخصًا موجزًا أو قائمة واضحة بالقرارات. وإذا لم يتمكن النظام من الحفاظ على التفاصيل بشكل موثوق، فاجعل هذا القصور واضحًا بدلاً من التظاهر باستمرارية غير موجودة.
امنح المستخدمين تحكمًا ذا مغزى
يعني التحكم منح الشخص طريقة قابلة للاستخدام لتوجيه التفاعل أو تعديله. وفي المحادثات، يمكن أن يكون هذا الأمر بسيطًا ومباشرًا كالسماح للمستخدم بالاختيار بين البدائل، أو تحرير مسودة مولدة، أو تغيير قيد معين، أو مطالبة النظام بالتوقف والتلخيص. وتكون عناصر التحكم هذه أكثر قيمة عندما تؤثر على قرار يهتم به المستخدم؛ فقائمة التعديلات التي لا تغير شيئًا ذا مغزى تضيف تعقيدًا دون إتاحة تحكم فعلي.
قارنت تجربة تضمنت وكيلاً حواريًا في مناقشات جماعية بين طرق مختلفة لضبط التوقعات حول قدرته على تحديد المشاركين ذوي المساهمات القليلة؛ حيث اختبرت تقديم معلومات حول الدقة، وشرح منهجية الكشف وبياناته، وتوفير عنصر تحكم في الضبط. وفي تلك الدراسة على وجه التحديد، ساعد التفسير المستخدمين على فهم الخوارزمية وكان الأكثر فعالية بوجه عام؛ في حين أدى مجرد توفير عنصر تحكم في الضبط إلى تجربة مناقشة أكثر سلبية في نظرهم. وتحذر هذه النتيجة من اعتبار عنصر التحكم مفيدًا لمجرد وجوده: بل وضح ما يغيره واجعل النتيجة مفهومة. Do et al.، "Inform, Explain, or Control: Techniques to Adjust End-User Performance Expectations for a Conversational Agent Facilitating Group Chat Discussions"
يتمثل التسلسل العملي للتصميم في: إظهار التفسير الحالي، وتقديم عدد قليل من الإجراءات التالية ذات المغزى، وجعل التصحيح أمرًا سهلاً. على سبيل المثال، بعد إنشاء خطة لنزهة ما، قد يسأل النظام عما إذا كان ينبغي تقصير المسار، أو استبدال نشاط بآخر، أو الاحتفاظ بالمسودة. يحدد كل خيار تغييرًا ملموسًا. وهذا المثال توضيحي؛ فهو يصف نمط تفاعل عام، وليس ميزة لمنتج معين.
حوّل الأهداف إلى قائمة مراجعة للتدقيق
عند تقييم تصميم محادثة ما، راجع مهمة عادية واحدة من البداية إلى النهاية. وتحقق مما إذا كان التبادل الأول يوضح دور النظام؛ وما إذا كان المستخدم قادرًا على التمييز بين الاقتراح والإجراء المكتمل؛ وما إذا كانت الجولة الاستكشافية تشجع على التجربة دون فرض شخصية مصطنعة؛ وما إذا كانت المحادثة تعرض القرارات والخطوات غير المحسومة بدقة. ثم تحقق مما إذا كان الشخص قادرًا على تصحيح النظام وفهم تأثير كل عنصر تحكم متاح.
أخيرًا، راجع اللغة وطريقة العرض لرصد أي إشارات قد توحي بهوية بشرية أو بمستوى موثوقية استثنائي. وانتبه إلى ما إذا كانت صيغ المتكلم، أو الصوت، أو اللغة العاطفية، أو الصورة الرمزية الشبيهة بالبشر يمكن أن تؤثر على حكم المستخدم على الإجابة. وهذا التدقيق يكمل اختبار ما إذا كان التفاعل مفهومًا ومفيدًا، ولا يحل محله. إن المعيار الأقوى لتصميم المحادثة هو ما إذا كان الشخص يستطيع متابعة مهمته الخاصة مع رؤية واضحة لمساهمة الذكاء الاصطناعي وللخطوة التالية—وليس ما إذا كان التبادل ينجح في محاكاة محادثة مع إنسان.
