مدونة Metlivi

ما يمكن للقراء المحاكين بالذكاء الاصطناعي إخبارك به عن كتابتك وما لا يمكنهم إخبارك به

إذا كنت تراجع صفحة أو دليلاً أو مجموعة من التعليمات، يمكن للنموذج اللغوي مساعدتك في رصد الصياغات التي قد تربك القارئ. يمكنه الإشارة إلى عبارة غير واضحة، أو وصف سوء فهم محتمل، أو التحقق مما إذا كانت المسودة تبدو كأنها تجيب على سؤال مطروح. لكن رد الفعل المحاكى لا يمكنه إثبات أن القراء المستهدفين قد فهموا النص، أو وظفوا السياق الصحيح معه، أو أتموا المهمة التي يصفها. ولأجل ذلك، راقب بعض الأشخاص الحقيقيين من جمهورك وهم يحاولون تنفيذ المهمة واطلب منهم شرح ما فهموه.

30 سبتمبر 20266 دقائق للقراءةالقراءة والفنون والثقافةبقلم Metlivi Editorial Team
القسم 1

ما يمكن للنموذج نقده بشكل مفيد في المسودة

يمكن للنموذج فحص الكلمات والبنية التي تقدمها له. اطلب منه تحديد المصطلحات التي قد تكون غير مألوفة، أو الخطوات التي يبدو أنها مفقودة، أو التعليمات التي تحمل أكثر من معنى محتمل، أو سؤالاً تتركه المسودة دون إجابة. يمكنك أيضًا أن تطلب منه توضيح الأدلة النصية التي قادته إلى كل ملاحظة. يُعد هذا مفيدًا كفحص تحريري أولي: فهو يولد نقاطًا مقترحة للتحقق منها، وليس نتائج تخص القراء الفعليين.

اجعل المهمة محددة. على سبيل المثال، في صفحة تشرح كيفية اختيار رحلة ليوم واحد، اطلب من النموذج الإشارة إلى التفاصيل التي سيحتاجها القارئ للمقارنة بين الخيارات وأين تظهر تلك التفاصيل. اطلب مقاطع محددة وسوء الفهم المحتمل لكل منها، ثم قارن كل اقتراح بهدفك والنص الفعلي. إن الإجابة السلسة ليست دليلاً على أن أي شخص حقيقي سيقرأ المقطع بهذه الطريقة.

قد تضفي مطالبات الشخصية (Persona prompts) بعض البنية المفيدة، لكن وصفاً مثل "زائر لأول مرة ومشغول للغاية" لا يجعل النموذج ذلك الزائر فعلياً. وجدت الأبحاث حول استخدام موجهات الشخصية أن فوائدها تعتمد على ما إذا كانت متغيرات الشخصية تتوافق مع الأنماط الموجودة في التعليقات البشرية؛ وعبر العديد من مجموعات البيانات الذاتية، لم تفسر هذه المتغيرات سوى قدر ضئيل من الاختلاف. تعامل مع ردود الفعل القائمة على الشخصية كفرضيات، وليس كعينة تمثيلية لآراء الجمهور. هو وكولير، "Quantifying the Persona Effect in LLM Simulations"

القسم 2

ما لا يمكن لردود الفعل المحاكاة إثباته

لا يمكن لاستجابة النموذج أن تحدد ما لاحظه قارئ معين أو استنتجه أو تذكره أو فعله. يتلقى النموذج نصًا ومطالبة، ثم يُنشئ إجابة. أما القارئ الحقيقي فيواجه المحتوى بمعرفته الخاصة، وأهدافه، ومشتتاته، وتوقعاته، وظروفه. هذه العوامل هي التي تحدد ما إذا كانت الجملة مفهومة وما إذا كان بإمكان الشخص التصرف بناءً عليها.

يكتسب هذا الفارق أهمية كبرى عندما يكون السؤال متعلقاً بالسلوك: هل يمكن لشخص ما العثور على المعلومات الصحيحة؟ هل يفسر التوجيه كما هو مقصود؟ هل يمكنه إنهاء المهمة دون تلميح؟ يمكن للنموذج التفكير المنطقي بشأن هذه الأسئلة، لكن روايته لما سيفعله تظل نصًا تم إنشاؤه. لم يتصفح النموذج الصفحة بشكل مستقل أو يثبت أن شخصًا من جمهورك يمكنه استخدامها بالفعل.

كما تحذر الأبحاث في محاكاة النماذج من اعتبار الاستجابات الواضحة أو المتنوعة دليلاً على الدقة ومطابقة الواقع. وجدت دراسة أجريت عام 2025 حول محاكاة الإجابات على الاستطلاعات أن الأساليب المختبرة واجهت صعوبة في إعادة إنتاج إجابات المستخدمين بدقة؛ حيث كانت النماذج قادرة على الاحتفاظ بوجهات النظر عبر التغيرات الديموغرافية وواجهت صعوبة في التكيف مع الفروق الدقيقة بين الملفات الشخصية. لا تختبر تلك الدراسة بشكل مباشر كل أشكال نقد الكتابة أو مهام قابلية الاستخدام، لكنها تدعم حداً عملياً: القارئ المحاكى المقنع لا يُعد إثباتاً لكيفية استجابة الجمهور الحقيقي. يو وآخرون، "An Analysis of Large Language Models for Simulating User Responses in Surveys"

القسم 3

ما يمكن أن يكشفه اختبار مصغر على قراء حقيقيين

يمكن لاختبار نوعي مصغر أن يُظهر مواضع تردد المشاركين الحقيقيين، وما يغفلون عنه، وكيف يفسرون عبارة معينة، وما إذا كانوا يصلون إلى النتيجة المقصودة. يمكنك إعطاء كل شخص مهمة واقعية، والسماح له باستخدام المسودة أو الصفحة، ومراقبة ما يحدث. يمكن للأسئلة المتابعة أن توضح ما ظنوا أن الكلمة تعنيه أو سبب اختيارهم لخطوة معينة. يجمع ذلك بين السلوك الملحوظ والتفسير الخاص بالمشارك.

بالنسبة لمهمة متعلقة بالمحتوى، حدد معيار النجاح قبل الجلسة. إذا كان النص دليلاً لرحلة ليوم واحد، على سبيل المثال، يمكنك أن تطلب من المشارك اختيار خيار يناسب تفضيلاً محدداً وشرح المعلومات التي شكلت هذا الاختيار. لاحظ ما إذا كانوا يعثرون على التفاصيل ذات الصلة، والكلمات أو الأقسام التي تعطلهم، وما إذا كان شرحهم يطابق الفروق التي كان الدليل ينوي إيصالها. هذا المثال هو تصميم اختبار مقترح، وليس ادعاءً بشأن أي دليل أو نتيجة معينة.

توصي التوجيهات الحكومية بشأن اختبارات قابلية الاستخدام النوعية بتوظيف أشخاص يمكن أن يكونوا مستخدمين فعليين، وتكليفهم بمهمة، وتجنب التعليمات المفرطة، ومراجعة إتمام المهام والأخطاء الشائعة بعد ذلك. وبالمثل، تصف مجموعة نيلسن نورمان (Nielsen Norman Group) دراسات قابلية الاستخدام بأنها وسيلة للتحقق مما إذا كان المحتوى سهلاً في العثور عليه وفهمه أو ما إذا كان بإمكان الأشخاص إكمال المهمة. يؤكد كلاهما على مراقبة ما يفعله المشاركون؛ وذلك دليل لا يمكن لأي استجابة محاكاة تقديمه. GOV.UK، "Usability testing: qualitative studies"، مجموعة نيلسن نورمان، "Checklist for Planning Usability Studies"

القسم 4

كيفية إجراء اختبار مصغر ومفيد

ابدأ بقرار واحد أو مهمة واحدة يُفترض أن يدعمها النص. استقطب أشخاصًا يشبهون الجمهور المستهدف بطرق ذات صلة، لا سيما في تجربتهم مع الموضوع. ثم اكتب سيناريو يمنحهم سببًا لاستخدام المحتوى دون إخبارهم بمكان الإجابة أو الكلمات التي يجب البحث عنها. إن المهمة التي تكرر نص تسمية موجودة في الصفحة قد تختبر دون قصد مطابقة الكلمات بدلاً من اختبار ما إذا كان المحتوى يساعد شخصًا ما على تحقيق هدفه؛ توصي NN/G بكتابة مهام محددة دون تلميحات توجه السلوك مسبقاً.

خلال الجلسة، دع المشاركين يتابعون بأقل قدر من التوجيه. سجّل ما يفعلونه، وأين يتوقفون، وما يقولونه بكلماتهم الخاصة، وما إذا كانوا قد أتموا المهمة. إذا طلبوا المساعدة، دوّن النقطة التي احتاجوا عندها للمساعدة. بعد ذلك، اطلب منهم وصف ما فهموه وما سيفعلونه بعد ذلك. تقترح إرشادات GOV.UK إشراك خمسة إلى ستة مشاركين لاختبار قابلية الاستخدام النوعي؛ وتوصي NN/G عمومًا بخمسة للدراسات النوعية التقليدية. هذه نقاط انطلاق عملية للعثور على المشكلات، وليست أحجام عينات تجعل النتائج ممثلة لمجتمع كامل. إذا كنت بحاجة إلى نسب مئوية أو مقارنات قابلة للتعميم، فأنت بحاجة إلى تصميم كمي بعينة أكبر ومقاييس مضبوطة. GOV.UK، "Usability testing: qualitative studies"، وNN/G، "Quantitative vs. Qualitative Usability Testing"

القسم 5

تحويل الملاحظات إلى تعديلات، لا إلى ادعاءات عامة

بعد بضع جلسات، ابحث عن العقبات المتكررة وحالات الإخفاق الفردية ذات الأثر الكبير. إذا أساء عدة مشاركين فهم العبارة نفسها، فهذا مرشح قوي لإعادة الصياغة. وإذا عجز شخص واحد عن إتمام المهمة، فافحص الظروف واسأل عما إذا كان هذا الإخفاق مهمًا للجمهور المستهدف؛ ولا تعامل جلسة واحدة على أنها معدل ينطبق على عموم الجمهور. تهدف الدراسة النوعية المصغرة إلى كشف المشاكل وتوجيه التغييرات، وليس تقدير عدد الأشخاص الذين ستواجههم هذه المشكلات في شريحة جمهور أوسع. تشير NN/G إلى أن النتائج النوعية تعتمد على عينة المشاركين وتفسير الباحث، بينما تتطلب ادعاءات قابلية الاستخدام الرقمية دراسة كمية بحجم مناسب.

قم بتعديل النص، ثم اختبر النسخة المعدلة مع قراء جدد كلما أمكن ذلك. يمكن للنموذج مساعدتك في استكشاف صياغات بديلة أو رصد مواضع غموض جديدة بين الجولات. حافظ على التمييز بين أنواع الأدلة في ملاحظاتك: "توقع النموذج أن هذا قد يكون مربكًا" هو دافع للتحقق؛ "فسر مشاركان هذه الخطوة بشكل مختلف ولم يصل أحدهما إلى النتيجة" هي ملاحظة من اختبار فعلي. لا يثبت أي منهما بمفرده أن كل قارئ ستكون له التجربة نفسها، لكن الثاني يخبرك بما حدث في المهمة التي راقبتها بالفعل."

القسم 6

تقسيم عملي للمهام

استخدم النموذج لتوليد أسئلة حول المسودة. واستعن بقراء حقيقيين للإجابة عن أسئلة تتعلق بالفهم الفعلي وأداء المهام. عندما تعتمد المهمة على جمهور معين، أو بيئة محددة، أو خبرة سابقة، استقطب مشاركين تنطبق عليهم تلك الشروط بدلاً من مطالبة النموذج باختلاقها. وعندما تحتاج إلى معدل أو مقارنة موثوقة، صمم دراسة كمية بدلاً من تحويل حفنة من الجلسات النوعية إلى ادعاء إحصائي.

يتيح هذا التقسيم للنقد المحاكى تسريع المراجعة دون الخلط بين رد الفعل المحتمل ودليل نجاح القارئ. فالسؤال الحاسم ليس ما إذا كان النموذج قادرًا على إنتاج صوت قارئ مقنع؛ بل ما إذا كان القارئ المستهدف قادرًا على فهم المحتوى والقيام بما كُتب النص لمساعدته على أدائه."

قراءات ذات صلة

متابعة استكشاف الموضوع