सत्र की अवधि (Session Length) को अनुकूलित किए बिना एक उपयोगी संक्षिप्त AI चैट का मूल्यांकन कैसे करें
एक संक्षिप्त AI बातचीत तब सफल हो सकती है जब वह किसी व्यक्ति को एक छोटे रचनात्मक कार्य को पूरा करने में मदद करती है: जैसे कि रंग पैलेट चुनना, सप्ताहांत के किसी प्रोजेक्ट का नामकरण करना, या किसी व्यक्तिगत गतिविधि के लिए कुछ विचार खोजना। उस संवाद का मूल्यांकन करने के लिए, पहले यह परिभाषित करें कि व्यक्ति क्या चाहता था, और फिर यह जांचें कि क्या उत्तर प्रासंगिक, उपयोगी और नियंत्रित करने या समाप्त करने में आसान था। बिताया गया समय और दोबारा आने की संख्या उपयोग का विवरण तो दे सकते हैं, लेकिन वे अकेले यह नहीं बता सकते कि संवाद ने वास्तव में मदद की या नहीं।
उस कार्य से शुरुआत करें जिसे करने के लिए व्यक्ति आया था
कोई मीट्रिक चुनने से पहले, किसी एक सामान्य कार्य को ऐसे शब्दों में परिभाषित करें जिनका अवलोकन किया जा सके। "एक आकर्षक बातचीत करना" की तुलना में "बालकनी के हर्ब गार्डन के लिए कुछ चंचल नाम प्राप्त करना" का आकलन करना आसान है। पहला विकल्प समीक्षकों को देखने के लिए कुछ ठोस आधार देता है: क्या सिस्टम ने ऐसे नाम सुझाए जो अनुरोध के अनुकूल थे, और क्या व्यक्ति उनमें से किसी एक को चुन सका या उसमें बदलाव कर सका?
यह एक व्यापक उपयोगिता (यूज़ेबिलिटी) सिद्धांत का अनुसरण करता है: यह आंकना कि क्या निर्दिष्ट उपयोगकर्ता किसी विशेष संदर्भ में निर्दिष्ट लक्ष्यों को प्रभावी ढंग से, कुशलता से और संतुष्टि के साथ प्राप्त करते हैं। ISO परिभाषा इन्हें संबंधित लेकिन अलग-अलग गुणों के रूप में मानती है, इसलिए कोई भी एकल माप—जिसमें अवधि भी शामिल है—इन सभी का प्रतिनिधित्व नहीं कर सकता। ISO 9241-11:2018, *Ergonomics of human-system interaction — Part 11: Usability: Definitions and concepts*
रचनात्मक अनुरोधों के लिए, कार्य पूरा होने को केवल एक सही उत्तर के बजाय एक उपयोगी परिणाम के रूप में परिभाषित करें। कोई व्यक्ति एक चुने हुए विचार, एक संक्षिप्त सूची (शॉर्टलिस्ट), या किसी अन्य प्रयास के लिए बेहतर दिशा लेकर जा सकता है। पहले से ही लिखकर तय कर लें कि उस कार्य के लिए क्या पर्याप्त माना जाएगा। इससे टीमें चुपके से सफलता को "उपयोगकर्ता बातचीत करता रहा" के रूप में पुनर्परिभाषित करने से बचती हैं।
कार्य पूरा होने (Completion) और प्रासंगिकता (Relevance) का अलग-अलग मूल्यांकन करें
एक व्यावहारिक समीक्षा दो प्रश्नों से शुरू हो सकती है: क्या बातचीत लक्षित परिणाम तक पहुंची, और क्या सहायक के उत्तर अनुरोध के अनुकूल थे? दोनों उत्तरों को अलग रखें। एक उत्तर प्रासंगिक हो सकता है लेकिन फिर भी वह व्यक्ति को किसी उपयोगी विकल्प के बिना छोड़ सकता है; कोई व्यक्ति ध्यान भटकाने वाले या सामान्य उत्तर को अनदेखा करने के बाद भी कार्य पूरा कर सकता है।
कार्य पूरा होना (Task completion) एक सामान्य, सरल माप है, लेकिन यह परिणामों को केवल हाँ-या-ना में समेट देता है और यह नहीं बताता कि कोई व्यक्ति क्यों असफल रहा या पूरा हुआ कार्य कितनी अच्छी तरह हुआ। इसके साथ बातचीत की एक संक्षिप्त समीक्षा या उपयोगकर्ता की प्रत्यक्ष रेटिंग को जोड़ें। Nielsen Norman Group, “Success Rate: The Simplest Usability Metric”
संवाद संबंधी शोध (Dialogue research) इस अधिक विस्तृत दृष्टिकोण का समर्थन करता है। कार्य-उन्मुख संवाद के एक अध्ययन ने टर्न और पूरी बातचीत दोनों स्तरों पर प्रासंगिकता, रोचकता, समझ, कार्य पूरा होने और दक्षता का विश्लेषण किया; इसमें पाया गया कि एक समग्र रेटिंग उपयोगी अंतरों को अनदेखा कर सकती है, और संतुष्टि का स्तर विभिन्न समीक्षकों और संवादों के आधार पर अलग-अलग था। ये निष्कर्ष कोई सार्वभौमिक स्कोरिंग फॉर्मूला नहीं हैं, लेकिन वे एक रचनात्मक कार्य के अनुकूल बनाने के लिए आयामों का एक ठोस सेट प्रदान करते हैं। Siro, Aliannejadi, and de Rijke, “Understanding User Satisfaction with Task-oriented Dialogue Systems”
उत्तर की गुणवत्ता को टर्न-स्तरीय (Turn-level) प्रश्न के रूप में देखें
समीक्षा करें कि क्या प्रत्येक उत्तर नवीनतम अनुरोध पर प्रतिक्रिया देता है और पिछले मोड़ों (turns) से प्रासंगिक संदर्भ का उपयोग करता है। उदाहरण के लिए, यदि व्यक्ति कहता है "इन्हें थोड़ा कम औपचारिक बनाएं", तो अगले उपयोगी उत्तर में सुझावों को उसी के अनुसार बदलना चाहिए। टालने योग्य दोहराव, छूटी हुई शर्तें, या स्पष्टीकरण के ऐसे अनुरोधों की गिनती करें जो कार्य को आगे बढ़ाने में मदद नहीं करते हैं।
बुद्धिमान सहायकों (intelligent assistants) के एक अध्ययन में पाया गया कि संतुष्टि परिदृश्य के आधार पर भिन्न थी: कुछ कार्यों में कार्य पूरा होना अत्यधिक महत्वपूर्ण था, जबकि अन्य में प्रयास अधिक मायने रखता था। इसने यह भी बताया कि बातचीत के संदर्भ को बनाए रखना महत्वपूर्ण था और समग्र कार्य संतुष्टि को केवल व्यक्तिगत प्रश्नों की संतुष्टि तक सीमित नहीं किया जा सकता था। इसका व्यावहारिक निहितार्थ यह है कि विशिष्ट उत्तरों और पूरी बातचीत दोनों का निरीक्षण किया जाए, साथ ही प्रत्येक की व्याख्या उसके कार्य के आधार पर की जाए। Microsoft Research, “Understanding User Satisfaction with Intelligent Assistants”
एक रचनात्मक संवाद के लिए, एक संक्षिप्त मानवीय समीक्षा उत्तरों को प्रासंगिक, आंशिक रूप से प्रासंगिक, या कार्य से भटके हुए के रूप में वर्गीकृत कर सकती है, और यह नोट कर सकती है कि क्या सहायक ने सुधारों का पालन किया। ये लेबल एक प्रस्तावित समीक्षा पद्धति हैं, न कि कोई मान्य बेंचमार्क। यदि कोई स्वचालित क्लासिफायरियर इन्हें प्रदान करता है, तो नमूनों की मैन्युअल रूप से जांच करें: एक अच्छा दिखने वाला स्कोर अभी भी ऐसे सुझाव को छोड़ सकता है जो तकनीकी रूप से प्रॉम्प्ट से मेल खाता है लेकिन व्यक्ति को उपयोग करने लायक कुछ नहीं देता।
जांचें कि क्या व्यक्ति बातचीत को निर्देशित कर पा रहा था
उपयोगकर्ता का नियंत्रण छोटे-छोटे पलों में दिखाई देता है: व्यक्ति अपने अनुरोध को सीमित कर सकता है, किसी अन्य शैली की मांग कर सकता है, किसी गलतफहमी को सुधार सकता है, या पर्याप्त जानकारी मिलने के बाद रुक सकता है। इस बात के लिए ट्रांसक्रिप्ट की समीक्षा करें कि क्या सिस्टम ने बार-बार बातचीत की अपनी दिशा पर अड़े रहने के बजाय उपयोगकर्ता के निर्देशों का पालन किया। यदि इंटरफ़ेस उत्तर को रोकने, संपादित करने, पुन: उत्पन्न करने, या साफ़ करने के नियंत्रण प्रदान करता है, तो परीक्षण करें कि क्या वे क्रियाएं लोगों की अपेक्षा के अनुरूप काम करती हैं।
संवादात्मक एजेंटों (conversational agents) पर शोध ने स्वायत्तता का वर्णन ऐसे शब्दों में किया है जिसमें बातचीत, प्रश्नों और उत्तरों पर नियंत्रण शामिल है। यह नियंत्रण को एक निरीक्षण योग्य गुण के रूप में मानने का समर्थन करता है, हालांकि यह इसके लिए कोई सार्वभौमिक उत्पाद मीट्रिक स्थापित नहीं करता है। Yang and Aurisicchio, “Designing Conversational Agents: A Self-Determination Theory Approach”
एक सरल उपयोगकर्ता प्रश्न नियंत्रण को मापने योग्य बना सकता है: "क्या आप बातचीत को उस परिणाम तक ले जा सके जो आप चाहते थे?" बातचीत के बाद, कार्य-पूर्णता के प्रश्न के साथ ही इसे पूछें। सभी सत्रों में उत्तर के विकल्पों को सुसंगत रखें और एक संक्षिप्त स्पष्टीकरण की अनुमति दें। कम स्कोर बातचीत का निरीक्षण करने का एक संकेत है, किसी विशेष कारण का निश्चित प्रमाण नहीं।
एक स्पष्ट समाप्ति को एक वैध परिणाम के रूप में पहचानें
एक अच्छा समाप्ति बिंदु वह होता है जब व्यक्ति को वह मिल जाता है जो उसे चाहिए और वह सिस्टम के किसी अन्य प्रॉम्प्ट के बिना बातचीत छोड़ सकता है। हर्ब-गार्डन वाले उदाहरण के लिए, यह वह क्षण हो सकता है जब वे कोई नाम चुन लेते हैं। उस बिंदु पर समाप्त होने वाली बातचीत सामान्य अनुवर्ती (follow-up) प्रश्नों द्वारा बढ़ाई गई बातचीत से अधिक उपयोगी हो सकती है। यह कार्य से निकाला गया एक माप सिद्धांत है: यदि लक्ष्य पूरा हो गया है, तो अतिरिक्त मोड़ (turns) अपने आप कोई मूल्य नहीं जोड़ते हैं।
ट्रैक करें कि क्या कार्य पूरा हुआ प्रतीत होता है और क्या व्यक्ति ने बातचीत जारी रखने का विकल्प चुना, लेकिन इन घटनाओं की व्याख्या संदर्भ के अनुसार करें। एक अनुवर्ती मोड़ जिज्ञासा, एक आवश्यक सुधार, या एक अधूरे उत्तर को दर्शा सकता है। बातचीत का अचानक समाप्त होना यह संकेत दे सकता है कि व्यक्ति संतुष्ट है, उसका ध्यान भटक गया है, या वह निराश है। केवल बातचीत की लंबाई इन व्याख्याओं में अंतर नहीं कर सकती; जांच के लिए चुनिंदा ट्रांसक्रिप्ट समीक्षाओं या संक्षिप्त उपयोगकर्ता फीडबैक का उपयोग करें।
अवधि का उपयोग संदर्भ के रूप में करें, अंतिम निर्णय के रूप में नहीं
अवधि परिचालन संबंधी प्रश्नों के उत्तर देने में मदद कर सकती है, जैसे कि क्या किसी विशिष्ट प्रवाह में नियमित रूप से कई मोड़ों (turns) की आवश्यकता होती है। यह केवल बीती हुई गतिविधि का एक माप है, इस बात का सीधा प्रमाण नहीं कि उत्तर उपयोगी था। उदाहरण के लिए, Google Analytics एंगेजमेंट समय को घटनाओं से जुड़ी उपयोगकर्ता सहभागिता की अवधि के रूप में परिभाषित करता है; इसका डेवलपर मार्गदर्शन यह भी चेतावनी देता है कि सत्रों को कृत्रिम रूप से बढ़ाने से व्यवहार संबंधी डेटा विकृत होता है। ये एनालिटिक्स परिभाषाएं और कार्यान्वयन चेतावनियां हैं, रचनात्मक चैट के लिए कोई गुणवत्ता माप नहीं। Google Analytics, “Measurement Protocol reference” और Google Analytics, “Measure sessions and user engagement”
समय की तुलना केवल समान कार्यों के बीच और कार्य पूर्णता, प्रासंगिकता, उपयोगकर्ता नियंत्रण और एक स्पष्ट समाप्ति बिंदु के साथ करें। एक छोटी औसत अवधि अधिक सीधे उत्तर को दर्शा सकती है, लेकिन यह उपयोगकर्ताओं द्वारा प्रयास छोड़ देने का संकेत भी हो सकती है। लंबी अवधि का अर्थ उत्पादक पुनरावृत्ति हो सकता है—या फिर अनावश्यक अड़चनें। इसके सहायक प्रमाण कार्य के परिणाम और लोगों के अनुभव से मिलने चाहिए, केवल घड़ी से नहीं।
एक संक्षिप्त मूल्यांकन दिनचर्या
एक छोटे अध्ययन के लिए, प्रतिभागियों को स्पष्ट शब्दों में एक रचनात्मक कार्य दें, उन्हें चैट का स्वाभाविक रूप से उपयोग करने दें, और रिकॉर्ड करें कि क्या वे अपने द्वारा निर्धारित परिणाम तक पहुंचे। प्रासंगिकता, संदर्भ का पालन करने और दिशा बदलने या रोकने के अवसरों के लिए बातचीत के एक नमूने की समीक्षा करें। प्रत्येक कार्य के बाद, पूछें कि क्या उन्हें एक उपयोगी परिणाम मिला और क्या उन्हें लगा कि वे बातचीत को निर्देशित करने में सक्षम थे। संदर्भ के रूप में अवधि को रिकॉर्ड करें, फिर उन मामलों का निरीक्षण करें जहां अवधि और बताई गई उपयोगिता में असहमति हो।
मापों को केवल एक "सहभागिता" (engagement) स्कोर में समेटने के बजाय अलग-अलग रिपोर्ट करें। कार्य, पूर्णता का आकलन कैसे किया गया, उत्तरों की समीक्षा किसने की, और उपयोगकर्ता की प्रतिक्रिया कैसे एकत्र की गई, इसका उल्लेख करें। यदि नमूना छोटा है या कार्य की परिभाषा व्यक्तिपरक है, तो निष्कर्षों को हर उपयोगकर्ता या रचनात्मक अनुरोध पर सामान्यीकृत करने के बजाय दिशा-सूचक के रूप में वर्णित करें।
एक संक्षिप्त बातचीत तब महत्वपूर्ण होती है जब वह व्यक्ति को एक विशिष्ट अनुरोध से उस परिणाम तक ले जाती है जिसका वे उपयोग कर सकते हैं, साथ ही मार्ग और समाप्ति बिंदु पर उनका नियंत्रण बनाए रखती है। उन परिणामों को सीधे मापें। सत्र की लंबाई को अनुभव को समझाने में मदद करने दें, लेकिन इसे सफलता को परिभाषित न करने दें।
