لماذا يصعب تنسيق المشاهد الجماعية للذكاء الاصطناعي مقارنة بالمحادثات ذات الشخصية الواحدة
تحتوي المحادثة ذات الشخصية الواحدة على صوت واحد ومسار محادثة واحد لمتابعته. أما مشهد الذكاء الاصطناعي متعدد الشخصيات، فيجب عليه أيضاً تحديد من يتحدث تالياً، وما يعرفه كل شخصية، ومن تُعرض كلماته، وكيف يتغير الموقف المشترك. لجعل المشهد الجماعي متماسكاً، تعامل مع هذه الأمور كمهام تنسيق منفصلة: ضع سياسة للتحدث، وتتبع المعرفة بحسب الشخصية، وميز كل دور باستمرار، وسجل التغييرات المهمة في القصة بشكل صريح.
يحتوي المشهد الجماعي على أكثر من مهمة حوارية واحدة
في التبادل الفردي المباشر، يمكن للنموذج عادةً التعامل مع أحدث رسالة على أنها الشيء التالي الذي يجب الرد عليه. أما في المشهد الجماعي، فقد تخاطب إحدى الشخصيات شخصاً آخر غير المستخدم، أو تجيب عن سؤال شخصية أخرى، أو تلتزم الصمت بينما يستمر المشهد في التقدم. إن اختيار سطر حوار معقول ليس سوى جزء من المهمة؛ إذ يتعين على النظام أيضاً اختيار المتحدث والحفاظ على تحديد من يستجيب لمن.
يظهر هذا التمييز في أبحاث الحوار متعدد الأطراف. تصف دراسة حول تتبع الأهداف متعددة الأطراف أشخاصاً يتشاركون الأهداف، ويجيب بعضهم على بعض، ويقدمون معلومات حول أهداف مشارك آخر—وهي تفاعلات لا تحدث بالطريقة نفسها في الحوار ثنائي الأطراف. أفاد الباحثون أيضاً أن المهمة ظلت تمثل تحدياً لنماذج اللغة التي قاموا بتقييمها. يتعلق هذا الاكتشاف بالمحادثات الموجهة نحو المهام، ولكنه يوضح سبب تغيير إضافة المشاركين لبنية المشكلة، وليس فقط لعدد الأصوات. Multi-party Goal Tracking with LLMs
تتمثل الطريقة المفيدة لتخطيط المشهد في التمييز بين ثلاثة قرارات عند كل نبضة سردية: ما الذي حدث للتو، ومن لديه سبب للرد، وما الرد الذي من شأنه دفع المشهد المشترك إلى الأمام. إذا تحدثت شخصية فقط لمجرد ملء الدور، فغالباً ما تبدو النتيجة وكأنها عملية تفقد حضور وغياب. وإذا سُمح لشخصية واحدة بالهيمنة على كل نبضة، فقد ينهار المشهد ليعود إلى تبادل أحادي الشخصية مع إلحاق أسماء إضافية فحسب.
يحتاج ترتيب التحدث إلى قاعدة يمكن للمشهد اتباعها
لا يوجد ترتيب أدوار واحد هو الأفضل لكل مشهد إبداعي. فالترتيب التناوبي الثابت يسهل التنبؤ به ومفيد عندما تحتاج كل شخصية إلى فرصة منتظمة للمساهمة. أما الاختيار السياقي فيمكن أن يبدو أكثر استجابة: إذ تتحدث الشخصية عندما يمنحها الفعل أو السؤال الأخير سبباً واضحاً. ويمكن للتسلسل المقيد أن يحمي بنية معينة، مثل السماح لشخصية واحدة باقتراح خطة قبل أن يبدي الآخرون ردود أفعالهم.
توضح أطر العمل الجماعية متعددة الوكلاء (Multi-agent group-chat) هذه الفروق بشكل صريح. تصف وثائق AutoGen من Microsoft المتحدثين المحددين بواسطة النموذج، والأدوار التناوبية الدورية (round-robin)، ودوال الاختيار القابلة للتخصيص؛ ويمكن لأداة الاختيار الخاصة به استخدام أسماء المشاركين، وأوصافهم، وتاريخ المحادثة. وتشير الوثائق أيضاً إلى خيار افتراضي يمنع المشارك نفسه من التحدث في أدوار متتالية. هذه خيارات تنسيقية وليست قواعد لرواية القصص، لكنها تقدم قائمة عملية لتصميم المشهد. AutoGen Selector Group Chat
بالنسبة لمشهد إبداعي، حدد سياسة اختيار موجزة بلغة عادية قبل التوليد. على سبيل المثال: "دع الشخص الذي وُجه إليه الحديث مباشرة يجيب أولاً. وإلا فاختر الشخصية التي يكون هدفها المحدد أو فعلها الحالي أكثر صلة. وتخطَّ أي شخص ليس لديه رد فعل مفيد. وتجنب منح شخص واحد دورين متتاليين إلا إذا كان بصدد إكمال فعل ما." هذه قاعدة تصميم مقترحة وليست ضمانة مقاسة. وتكمن قيمتها في أنها تمنح النظام سبباً لاختيار المتحدث بدلاً من الاعتماد على التناوب العشوائي.
يجب تتبع معرفة الشخصية بشكل منفصل
لا يعني المشهد المشترك بالضرورة أن كل شخصية يجب أن تعرف كل حقيقة. فقد تكون إحدى الشخصيات قد رأت ملاحظة، وأخرى قد سمعت تفسيراً جزئياً فقط، بينما الثالثة ربما لم تصل بعد. إذا كانت عملية الكتابة تخزن فقط تاريخ محادثة واحداً غير متمايز، فيمكن للنموذج بسهولة معاملة حقيقة ذُكرت في مكان ما من الدردشة على أنها معرفة عامة لجميع الشخصيات.
استخدم سجلاً بسيطاً للمعرفة إلى جانب ملخص المشهد. ولكل حقيقة مهمة، سجل من يعرفها وكيف علم بها. وافصل بوضوح بين المعلومات غير المؤكدة وتلك المؤكدة: فعبارة "ميرا تشك في أن المظروف موجه إلى جو" لا تعادل "ميرا قرأت المظروف". قبل أي دور، تحقق من المتحدث المقترح استناداً إلى ذلك السجل. وإذا كانت تنقصه المعلومات، فيمكنه أن يسأل، أو يلاحظ، أو يخمن، أو يظل غير مطلع؛ ولا ينبغي له أن يذكرها كشيء يعرفه.
تحدد الأبحاث حول استمرار القصة القائمة على الشخصيات كلاً من اتساق الشخصية، وعلاقات الشخصيات، والتقدم المنطقي للحبكة كتحديات مترابطة. تضيف الدراسة معلومات علاقات الشخصيات إلى سياق القصة وتفيد بأن هذا قد حسّن دقة استمرار القصة مقارنة بخطوط الأساس الخاصة بها. إنها لا تضع طريقة عالمية واحدة لتتبع المعرفة في كل مشهد من مشاهد الذكاء الاصطناعي، لكنها تدعم مبدأ تصميم أوسع: سياق العلاقات بين الشخصيات هو جزء من حالة المشهد، وليس مجرد سيرة ذاتية تزيينية. Telling Stories through Multi-User Dialogue by Modeling Character Relations
تسميات المتحدثين جزء من المعنى
قد تبدو الأسماء المجاورة للحوار مجرد تنسيق، لكن الإسناد الصحيح يساعد في الحفاظ على تدفق المحادثة. يتغير معنى العبارة اعتماداً على من يقولها: فسؤال من المضيف قد يعد دعوة للإجابة، بينما قد يشير السؤال نفسه من زائر إلى عدم اليقين أو التحدي. وإذا اختلت التسميات، فلن يتمكن القراء من معرفة من لاحظ حدثاً، أو قطع وعداً، أو من يرد على من بشكل موثوق.
توضح دراسة لتصنيف أفعال الحوار متعدد الأطراف المدرك للمتحدث هذا الارتباط بوضوح: إذ تجادل بأن معرفة من تحدث تساعد في استعادة القصد من الكلام في سياقه، وأن نمذجة التفاعلات تصبح أصعب مع زيادة عدد المحاورين. يختبر الباحثون طرقاً تمثل سلوك المتحدث في السياق الحواري المحلي. هذا بحث لفهم الحوار وليس تقييماً للكتابة الإبداعية، لكنه يؤكد سبب كون تسمية المتحدث الثابتة معلومة بنيوية. Who Is Speaking? Speaker-Aware Multiparty Dialogue Act Classification
احتفظ بهوية المتحدث كبيانات منظمة لأطول فترة ممكنة، ثم اعرضها كتسمية مرئية. استخدم اسماً معتمداً واحداً لكل شخصية، ولا تتنقل بعشوائية بين اللقب والاسم المستعار والاسم الأول إذا كان ذلك قد يربك الإسناد. واحرص أيضاً على تمييز السرد عن الحوار. سطر مثل: ميرا: "تركته بجانب الباب." ينسب بوضوح كلاً من الكلام والادعاء الوارد فيه إلى ميرا؛ بينما يؤدي السطر غير المنسوب المضمن في مشهد مزدحم إلى اللبس والغموض.
تحتاج حالة القصة المشتركة إلى تحديثات صريحة
يمكن للشخصيات تذكر ما حدث، لكن المشهد يحتاج أيضاً إلى سجل مقتضب لما هو صحيح وواقعي الآن. بعد كل نبضة سردية ذات مغزى، قم بتحديث الحقائق مثل الموقع، ومن هو حاضر، وما هو الشيء الذي تحرك، وما القرار الذي تم اتخاذه، وما الذي لا يزال دون حل. تعامل مع هذا كسجل للأحداث الملموسة والقابلة للملاحظة بدلاً من إعادة سرد طويلة للحوار.
يكتسب هذا أهمية لأن المشهد الجماعي يحتوي على وجهات نظر متعددة حول تسلسل مشترك. فقد يكون ادعاء أحد الأشخاص خاطئاً، وقد يصححه آخر، وقد يتصرف ثالث قبل سماع أي منهما. يساعد تسجيل النتيجة بشكل منفصل عن سطور الحوار المنطوقة في تجنب تحويل كل تأكيد إلى حقيقة أساسية في القصة. قد ينص إدخال مفيد على ما يلي: "المفتاح على طاولة المطبخ؛ وضعه جو هناك. لم ترَه ميرا." هذا التحديث الفردي يغطي حالة العالم المشتركة وحدود المعرفة الفردية معاً.
تصف وثائق تنسيق الدردشة الجماعية مزامنة تاريخ المحادثة عبر المشاركين قبل كل دور وبث كل رد حتى يتمكن الآخرون من استخدام السياق المحدث. يوفر هذا النمط الهندسي تشبيهاً مفيداً للرواية الخيالية: يحتاج المشاركون إلى الوصول إلى سجل المشهد الحالي، لكن معرفة الشخصية لا تزال بحاجة إلى حدودها الخاصة. Microsoft Agent Framework: Group Chat Orchestration
مراجعة تنسيقية عملية قبل الصياغة
قبل توليد المشهد، اكتب أربع ملاحظات صغيرة: طاقم الشخصيات والهدف المباشر لكل شخص؛ الموقف المشترك الحالي؛ سجل معرفة للحقائق التي لا يعلمها الجميع؛ وقاعدة اختيار المتحدث التالي. أثناء الصياغة، تحقق من كل دور بمقارنته بتلك الملاحظات. وبعد الصياغة، ابحث عن أخطاء تسميات المتحدثين، والمعلومات غير المدعومة، والأدوار المكررة دون سبب، والتغييرات التي طرأت على المشهد ولم تُسجل أبداً.
على سبيل المثال، افترض أن ثلاثة أصدقاء يختارون الطريق الذي سيسلكونه عبر سوق يقام في عطلة نهاية الأسبوع. لاحظ أحدهم كشكاً للمصنوعات اليدوية سيغلق قريباً؛ ويقارن آخر طوابير الطعام؛ والثالث لم يرَ أياً من العلامتين بعد. يمكن للشخصية الأولى ذكر الكشك الذي يوشك على الإغلاق، ويمكن للثانية موازنة ذلك مع الطابور، ويمكن للثالثة أن تسأل عما فاتها. إذا أشارت الشخصية الثالثة فوراً إلى العلامة دون أن يبلغها أحد أو تراها، فإن سجل المعرفة يكشف عن خطأ في الاستمرارية. هذا سيناريو توضيحي وليس تجربة مسجلة.
الفرق الجوهري يكمن في التنسيق: فالردود ذات الشخصية الواحدة تواصل بشكل أساسي تبادلاً واحداً، بينما يجب على المشاهد الجماعية أن تحافظ على اتساق الأدوار، والهويات، والمعرفة، والأحداث المشتركة في الوقت نفسه. إن الفصل بين هذه المسؤوليات يجعل من السهل إنشاء مشاهد مفعمة بالحيوية دون إجبار كل شخصية على التحدث في كل دور أو منح الجميع المعلومات ذاتها.
