مدونة Metlivi

هل يجعل التفاعل الصوتي لعبة الغموض أكثر غماراً حقاً؟

يمكن للإدخال الصوتي أن يجعل اللغز الخيالي يبدو أكثر واقعية وفورية عندما يتمكن اللاعب من طرح سؤال بشكل طبيعي والحصول على إجابة ذات صلة دون معاناته مع واجهة المستخدم. لكن التحدث وحده لا يضمن الانغماس في التجربة؛ إذ يمكن لأخطاء التعرف على الصوت، وفترات التوقف المحرجة، والمقاطعات، والنصوص المكتوبة غير المرئية أن تشتت الانتباه بعيداً عن القصة. لتحديد ما إذا كان الصوت مفيداً، قارنه بالإدخال النصي استناداً إلى الأسئلة المهمة: هل فهمت اللعبة السؤال المقصود؟ هل استجابت في اللحظة المناسبة؟ هل تمكن اللاعب من رؤية ما سمعته اللعبة وتصحيحه؟ وهل كان خيار النص لا يزال متاحاً؟

30 سبتمبر 20267 دقائق للقراءةالقراءة والفنون والثقافةبقلم Metlivi Editorial Team
القسم 1

ابدأ بدقة فهم الأسئلة، وليس بكون التحدث فكرة مبتكرة وجديدة

في ألعاب الغموض، يتعين على النظام الصوتي القيام بأكثر من مجرد تحويل الصوت إلى كلمات؛ إذ يجب عليه الحفاظ على السؤال الذي قصده اللاعب وربطه بالدليل الصحيح أو برد الشخصية المناسب. إن النص المحول الذي يغير عبارة "Where was the key?" (أين كان المفتاح؟) إلى "Where was the case?" (أين كانت الحقيبة/القضية؟) قد يغير مسار المحادثة بالكامل، حتى وإن كان نظام التعرف على الصوت يرى أن النتيجة التي قدمها تبدو منطقية.

التعرف على الصوت ليس دقيقاً بنسبة مائة بالمائة، ومعدل الخطأ في الكلمات المعتاد لا يعكس الصورة كاملة: فبعض التبديلات تكون أكثر تأثيراً من غيرها. توضح وثائق Google أن معدل الخطأ في الكلمات يحسب الإضافات والتبديلات والحذف، مع التنبيه أيضاً إلى أن هذا المقياس يتعامل مع الأخطاء وفقاً لعدد كلماتها. بالنسبة للعبة غموض، يعني ذلك أن درجة الاختبار السريع يجب تعزيزها بمراجعة للكلمات ذات التأثير المباشر، مثل الأسماء والأماكن والأدوات وأدوات الاستفهام. Google Cloud: Measure and improve speech accuracy

تتمثل المقارنة العملية في إعداد مجموعة صغيرة من الأسئلة النموذجية التي قد يطرحها اللاعب حول الدليل نفسه، ثم تجربة كل سؤال عبر الصوت والنص. سجّل ما إذا كانت الإجابة تتناول الموضوع المقصود، وما إذا كان هناك خطأ في سماع اسم أو تفصيل رئيسي، وما إذا كان على اللاعب التكرار أو إعادة الصياغة. ضمّن أسئلة تحتوي على أسماء شخصيات ومصطلحات أدلة أقل شيوعاً: فقد تواجه الأنظمة الصوتية صعوبة في التعرف على الأسماء غير المدرجة في القاموس، وتوصي Google بتقديم تلميحات بالعبارات لمثل هذه المصطلحات عند استخدام خدمتها. Google Cloud: Best practices

هذه المقارنة هي وسيلة مساعدة لاتخاذ القرار وليست مقياساً مرجعياً عاماً لكل لعبة أو محرك صوتي. أجرِ الاختبار في بيئة اللعب الفعلية، بما في ذلك الأصوات الخلفية المعتادة للعبة والميكروفون الذي سيستخدمه اللاعب. قد لا تعبر النتيجة الصادرة من غرفة هادئة أو باستخدام ميكروفون مختلف عن ظروف اللعب الحقيقية؛ وعلى نحو مماثل، توصي إرشادات الدقة من Google باستخدام صوت يمثل البيئة المستهدفة تماماً. Google Cloud: Measure and improve speech accuracy

القسم 2

تحقق مما إذا كانت الاستجابة تأتي في وقت مناسب وقابل للاستخدام

قد يتم التعرف على السؤال بشكل صحيح ومع ذلك تبدو الاستجابة غير سلسة إذا انتظرت اللعبة طويلاً قبل عرض ردها أو نطقه. وعلى العكس من ذلك، فإن الرد السريع الذي يقاطع حديث الممثل الصوتي أو ينطلق بينما لا يزال اللاعب ينهي سؤاله قد يكون مربكاً. المقياس المفيد ليس مجرد متوسط وقت استجابة النظام؛ بل راقب التفاعل بأكمله: متى يبدأ اللاعب، ومتى تتعرف اللعبة على نهاية الجملة، ومتى تظهر التغذية الراجعة، ومتى يبدأ الرد.

ينبع هذا التمييز من طريقة التعامل مع التفاعل الصوتي. على سبيل المثال، تفصل واجهة التعرف على الصوت في Android بين النتائج الجزئية، ونهاية الكلام، والنتائج النهائية؛ وقد تظهر النتائج الجزئية صفراً أو مرة واحدة أو عدة مرات حسب طريقة تطبيق الخدمة. يوضح ذلك سبب إمكانية تغير النص أو الاستجابة المعروضة للاعب أثناء معالجة الكلام، وسبب وجوب قيام المطورين باختبار السلوك المرئي بدلاً من افتراض أن جميع محركات التعرف تعمل بالأسلوب نفسه. Android Developers: RecognitionListener

لإجراء اختبار لعب بسيط، لاحظ نوعين من التأخير: الوقت بين إنهاء السؤال ورؤية أنه قد فُهم، والوقت بين التأكيد واستجابة القصة المفيدة. سجّل أيضاً ما إذا كانت اللعبة تنتظر وقفة واضحة، أو تستجيب بتسرع مفرط لأي تردد، أو تترك اللاعب غير متأكد مما إذا كان الميكروفون لا يزال يستمع إليه. هذه الملاحظات يجب جمعها وليست حدوداً زمنية مطلقة: فالمصادر لا تحدد وقتاً معيناً للاستجابة يضمن وحده لعبة غموض أكثر غماراً.

القسم 3

تعامل مع المقاطعة كجزء طبيعي من المحادثة

غالباً ما تتضمن مشاهد الغموض حواراً أو سرداً أو شخصية تكمل إجابتها. وإذا حاول اللاعب طرح سؤال متابعة أثناء حديث اللعبة، فيجب أن يتبع النظام سلوكاً واضحاً: التوقف التام، أو الإيقاف المؤقت، أو وضع السؤال في قائمة الانتظار، أو تجاهله. إن الواجهة الصوتية التي تتعامل مع المقاطعة بشكل سيئ قد تجبر اللاعب على الانتظار لسماع معلومات فهمها بالفعل، أو تتحدث في الوقت نفسه فوق محتوى قصصي مهم.

تناولت الأبحاث المتعلقة بواجهات الحوار الصوتي هذه المشكلة مباشرة. اقترحت دراسة أجريت عام 1995 تخطيط المخرجات المنطوقة في وحدات من المعلومات ومراقبة تبادل الأدوار بحيث يتم التعامل مع مقاطعة المستخدم بسلاسة أكبر. وذكرت الدراسة أن أكثر من نصف المشاركين رأوا أن التعامل كان سلساً، في حين أن نتائجها المحددة المتعلقة بوقت المهمة والمحادثة تعود إلى بيئة تلك الدراسة وليست بالضرورة عامة على ألعاب الغموض. السؤال التصميمي القابل للتطبيق هنا هو ما إذا كانت اللعبة تحتفظ بالجزء الذي سمعه اللاعب بالفعل من الدليل وتوضح ما يحدث بعد المقاطعة. Kikuchi et al., “Handling of user interruption to achieve timing-free utterances for spoken dialogue interface”

أثناء الاختبار، جرب المقاطعة عند نقطة طبيعية في الاستجابة المنطوقة، ثم اطرح سؤال متابعة قصيراً. تحقق مما إذا كانت اللعبة تتوقف على الفور، وما إذا كان سؤال المتابعة قد التُقط، وما إذا كان بإمكان اللاعب إعادة تشغيل المعلومات التي قوطعت أو مراجعتها. إذا كانت الإجابة بالنفي، فقد يضيف الصوت عبئاً جديداً في تبادل الأدوار بدلاً من أن يوفر طريقة أكثر سلاسة للتحقيق في المشهد الخيالي.

القسم 4

اجعل الكلمات التي تم التعرف عليها مرئية وقابلة للاسترداد والتعديل

يمنح النص المقروء اللاعب فرصة لاكتشاف اسم أو سؤال خاطئ قبل أن تتصرف اللعبة بناءً عليه. كما أنه يجعل حالة النظام أقل غموضاً: إذ يمكن للاعب معرفة ما إذا كان النظام لم يسمع شيئاً، أو سمع الشيء الخطأ، أو سمع الكلمات الصحيحة ولكنه أعاد إجابة غير متوقعة. لا يكون النص مفيداً إلا إذا كان مقروءاً بوضوح أثناء اللعب ويقدم طريقة واضحة لإعادة المحاولة أو تعديل الخطأ المؤثر.

تُظهر واجهات برمجة التطبيقات للمنصات أن بعض الأنظمة يمكنها توفير نتائج جزئية ونهائية للتعرف، لكن توقيت وتوفر النص الجزئي يمكن أن يعتمدا على خدمة التعرف على الصوت. لا تتعامل مع النص المرحلي كإدخال مؤكد ما لم توضح الواجهة ذلك صراحة. في اختبار اللعبة، تحقق مما إذا كان السؤال النهائي الذي تم التعرف عليه يظل مرئياً لفترة كافية للمراجعة، وما إذا كانت التصحيحات سهلة، وما إذا كانت رسالة الخطأ تشرح ما يمكن للاعب فعله بعد ذلك. Android Developers: RecognitionListener

لا ينبغي اعتبار النص المرئي دليلاً قاطعاً على الدقة. تشير Google إلى أن درجات الثقة ومعدل الخطأ في الكلمات مقاييس مستقلة، وبالتالي فإن النتيجة التي تبدو موثوقة لا تثبت بالضرورة أن الاسم أو الدليل الحاسم قد تم التعرف عليه بشكل صحيح. بالنسبة للاعب، التصميم الأكثر أماناً هو السماح له بفحص الكلمات وتصحيح السؤال أو تكراره بدلاً من مطالبته بالثوق في درجة دقة مخفية. Google Cloud: Measure and improve speech accuracy

القسم 5

حافظ على الإدخال النصي كبديل حقيقي وفعّال

إن توفير خيار احتياطي للكتابة النصية ليس مجرد وسيلة ملائمة للاستخدام في غرفة هادئة؛ بل يتيح للاعب اختيار طريقة أخرى لإتمام التفاعل الخيالي نفسه عندما يكون التحدث غير متاح، أو غير ملائم، أو عندما يُفهم الكلام بشكل خاطئ بصورة متكررة. توصي إرشادات العوامل البشرية الصادرة عن المعهد الأوروبي لمعايير الاتصالات (ETSI) بتوفير طريقة غير صوتية للمعلومات التي يتم إدخالها صوتياً في العادة، إلى جانب توفير تغذية راجعة مثل قراءة ما فهمه النظام صوتياً وإتاحة وظيفة التراجع. ETSI: Human Factors; Inclusive eServices for all

لإجراء مقارنة عادلة، يجب أن يتيح النص الوصول إلى نفس خيارات الأسئلة واستجابات القصة التي يتيحها الصوت. فإذا كان بإمكان اللاعبين طرح أسئلة مفتوحة فقط عن طريق التحدث، فإن النص لا يعد بديلاً مكافئاً؛ وإذا كان النص يقتصر على اختيار قائمة محددة بينما يقبل الصوت أسئلة مفتوحة، فيجب توضيح هذا الفارق عند تقييم التجربة. تؤكد إرشادات مبادرة إتاحة الويب (W3C) بشأن البدائل النصية على ضرورة الحفاظ على نفس المعلومات والوظائف عبر البدائل المختلفة، وهو مبدأ مفيد عند التحقق من أن تغيير نمط الإدخال لا يحرم اللاعب من مساره داخل المشهد. W3C WAI: Understanding Guideline 1.1, Text Alternatives

القسم 6

استخدم مقارنة موجزة لتحديد ما إذا كان الصوت مناسباً للعبة

قارن بين نمطي الإدخال مقابل المهمة الخيالية نفسها: اسأل عن دليل، وتابع استفساراً بناءً على إجابة، وصحح سؤالاً واحداً تم سماعه أو كتابته بشكل خاطئ عمداً. في كل محاولة، سجّل ما إذا كان السؤال المقصود قد فُهم، وعدد المحاولات التي تطلبها ذلك، وما إذا كان هناك تأخير أو مقاطعة عطلت التفاعل، وما إذا كانت الكلمات مرئية، وما إذا كان نمط الإدخال البديل قد أتم المهمة نفسها. احتفظ بالنتائج كملاحظات مستمدة من ظروف الاختبار الخاصة بك بدلاً من اعتبارها ادعاءات عامة تنطبق على جميع اللاعبين أو الأجهزة.

يُعد الصوت إضافة واعدة عندما ينقل سؤال اللاعب المقصود بدقة ليقابله رد ذو صلة، ويتعامل مع تبادل الأدوار دون إرباك المشهد، ويجعل الأخطاء مرئية وقابلة للتصحيح، ويترك خيار النص متاحاً. وإذا كانت هذه الشروط ضعيفة، فقد يظل التحدث وسيلة اختيارية لإدخال الأسئلة، لكنه ليس دليلاً بحد ذاته على أن لعبة الغموض أصبحت أكثر غماراً. فالإجابة الأكثر وضوحاً تنبع من التفاعل الذي يستطيع اللاعب إكماله بالفعل ومن مدى السلاسة وغياب العقبات التي يواجهها في تلك التجربة.

قراءات ذات صلة

متابعة استكشاف الموضوع