Metlivi ब्लॉग

AI साथी पूर्वाग्रह और नकारात्मक लेबलों को सुदृढ़ करने से कैसे बच सकते हैं

एक AI साथी बिना कोई भी खुला शत्रुतापूर्ण वाक्य प्रदर्शित किए एक संकीर्ण लूप बना सकता है। कोई उपयोगकर्ता दो आमंत्रण अस्वीकार करता है; उत्पाद यह सहेज लेता है कि "अकेले रहना पसंद करता है"; बाद के सुझाव समूह गतिविधियों को छोड़ देते हैं; वे सीमित विकल्प अधिक शांत-सत्र (quiet-session) डेटा उत्पन्न करते हैं; और प्रणाली अपने स्वयं के संकीर्ण दायरे को पुष्टि के रूप में पढ़ने लगती है। इसका व्यावहारिक सुरक्षा उपाय हर पूर्वाग्रह को दूर करने का वादा नहीं है। यह एक ट्रेस करने योग्य (खोजी जा सकने वाली) डिज़ाइन है: अवलोकनों को अनुमानों से अलग रखें, किसी एक पल को पहचान में बदलने से बचें, यह दिखाएं कि कोई अनुमान किन सतहों को प्रभावित करता है, और व्यक्ति को इसे सही करने या रद्द करने की अनुमति दें। NIST हानिकारक पूर्वाग्रह को एक सामाजिक-तकनीकी (sociotechnical) जोखिम के रूप में देखता है, जबकि Google PAIR आगाह करता है कि क्लिक और अन्य अंतर्निहित संकेत अस्पष्ट हो सकते हैं। नीचे दिया गया ऑडिट इनपुट से मेमोरी, सुझावों, सारांशों और सूचनाओं तक एक लेबल को ट्रैक करता है, और फिर यह परीक्षण करता है कि क्या कोई सुधार वास्तव में प्रत्येक सतह को बदलता है।

27 अगस्त 20268 मिनट में पढ़ेंसमय प्रबंधन और व्यक्तिगत विकासलेखक: Metlivi Editorial Team
खंड 1

शब्दों पर बहस करने से पहले लेबल लूप का खाका तैयार करें

चार स्तंभों से शुरुआत करें: अवलोकन योग्य घटना, सिस्टम का अनुमान, संग्रहीत स्थिति, और डाउनस्ट्रीम सतह। "इस सप्ताह दो आमंत्रण अस्वीकार किए" एक तारीख और संदर्भ के साथ एक घटना है। "हो सकता है कि अभी शांत शाम पसंद करे" एक अनंतिम अनुमान है। "सामाजिक नहीं है" एक स्थायी चरित्र लेबल है और इसे उस साक्ष्य से नहीं बनाया जाना चाहिए। हर उस स्थान को सूचीबद्ध करें जहां यह स्थिति दिखाई दे सकती है: मेमोरी, प्रोफ़ाइल सारांश, प्रॉम्प्ट असेंबली, सुझाव, सूचनाएं, खोज रैंकिंग और निर्यात किया गया डेटा। यह खाका एक ऐसे फीडबैक लूप को उजागर करता है जिसे केवल एक चैट ट्रांसक्रिप्ट नहीं दिखा सकती। NIST की जनरेटिव-AI प्रोफ़ाइल हानिकारक पूर्वाग्रह और समरूपीकरण (homogenization) की पहचान ऐसे जोखिमों के रूप में करती है जिनके लिए प्रलेखित माप और परीक्षण की आवश्यकता होती है। इसलिए उपयोगी इकाई केवल एक वाक्य नहीं है; यह वह पूरा मार्ग है जिसके द्वारा एक वाक्य उत्पाद का दोहराया जाने वाला व्यवहार बन जाता है।

खंड 2

समय, संदर्भ और स्रोत के साथ अवलोकन लिखें

ऐसी भाषा को प्राथमिकता दें जिसे कोई दूसरा व्यक्ति सत्यापित कर सके: "मंगलवार को एक शांत विकल्प चुना" या "इस सुझाव को एक बार खारिज किया।" स्रोत को दृश्यमान रखें: प्रत्यक्ष उपयोगकर्ता कथन, देखा गया कार्य, उत्पाद का अनुमान, या उपयोगकर्ता द्वारा पुष्टि की गई प्राथमिकता। एक क्रिया से स्थायी व्यक्तित्व, मंशा, क्षमता या समूह के लक्षण का अनुमान न लगाएं। संदर्भ बदलने की संभावना होने पर समाप्ति समय (expiry) जोड़ें। एक सत्र की प्राथमिकता सत्र के साथ समाप्त हो सकती है; किसी यात्रा के लिए पुष्ट की गई प्राथमिकता यात्रा के बाद समाप्त हो सकती है। NIST का पूर्वाग्रह प्रकाशन इस बात पर जोर देता है कि पूर्वाग्रह सामाजिक-तकनीकी होता है, जो डेटा, मानवीय विकल्पों और परिनियोजन (डिप्लॉयमेंट) संदर्भ के माध्यम से उत्पन्न होता है। सटीक रिकॉर्ड इसलिए मायने रखते हैं क्योंकि एक प्रतीत होने वाला निष्पक्ष क्षेत्र तब अनुचित हो सकता है जब उसका मूल गायब हो जाता है और उसे उस स्थिति से बाहर पुनः उपयोग किया जाता है जिसने इसे उत्पन्न किया था।

खंड 3

अंतर्निहित व्यवहार को एक मत (वोट) न समझें

एक क्लिक, लंबा ठहराव, खारिज करना या बार-बार किसी विकल्प को चुनने के कई स्पष्टीकरण हो सकते हैं। उपयोगकर्ता खोजबीन कर रहा हो सकता है, उसके पास समय की कमी हो सकती है, वह दोहराव से बच रहा हो सकता है, या केवल दिखाए गए एकमात्र विकल्प को स्वीकार कर रहा हो सकता है। Google PAIR का कहना है कि अंतर्निहित फीडबैक अस्पष्ट हो सकता है और किसी सहभागिता का अर्थ अनिवार्य रूप से यह नहीं होता कि "मुझे और दिखाएं।" ऐसे संकेतों को अवलोकन के रूप में चिह्नित करें, अनुमोदन के रूप में नहीं। स्थायी वैयक्तिकरण को बदलने से पहले अधिक पुख्ता सबूतों की मांग करें: एक स्पष्ट प्राथमिकता, वास्तविक रूप से विभिन्न विकल्पों के बीच दोहराया गया व्यवहार, या ऐसी पुष्टि जिसे उपयोगकर्ता अस्वीकार कर सके। इसके अलावा विकल्पों के सेट का भी निरीक्षण करें। यदि सिस्टम ने समूह विकल्पों को दिखाना बंद कर दिया था, तो बाद के शांत विकल्प मूल लेबल की निष्पक्ष रूप से पुष्टि नहीं कर सकते क्योंकि विकल्प को हटा दिया गया था।

खंड 4

सुधारों को स्थिति, दायरा और प्रसार प्रदान करें

ऐसे नियंत्रण प्रदान करें जो अनुमान से मेल खाते हों: "मेरे बारे में नहीं," "केवल आज के लिए," "संपादित करें," "इसका उपयोग बंद करें," और "रीसेट करें।" एक सुधार के लिए एक स्थिति की आवश्यकता होती है—अनुरोधित, लागू, आंशिक रूप से लागू, या अवरुद्ध—और एक दायरा: यह बातचीत, भविष्य के सुझाव, संग्रहीत प्रोफ़ाइल, सारांश, सूचनाएं और जुड़े हुए उपकरण। Google PAIR अनुकूली (अडैप्टिव) प्रणालियों द्वारा उपयोग की जाने वाली जानकारी का लोगों को निरीक्षण करने, संपादित करने और रीसेट करने की अनुमति देने की सिफारिश करता है, साथ ही किसी प्रभाव के अपेक्षित समय और दायरे को समझाने की भी। यदि कैश या साझा की गई प्रतियां किसी अन्य प्रक्रिया का पालन करती हैं, तो हर जगह तुरंत हटा दिए जाने का वादा न करें। इसके बजाय, दिखाएं कि क्या बदला, क्या शेष है, यह क्यों शेष है और इसकी जांच कब की जाएगी। अस्वीकार किए गए लेबल को चुपचाप एक नए स्रोत के रूप में संरक्षित किए बिना सुधार का एक न्यूनतम घटना रिकॉर्ड रखें।

खंड 5

बहु-दृष्टिकोण और प्रति-तथ्यात्मक (काउंटरफ़ैक्चुअल) जांच चलाएं

उसी तटस्थ अवलोकन के लिए, किसी को भी सत्य बताए बिना कम से कम दो प्रशंसनीय संदर्भ स्पष्टीकरण तैयार करें। अस्वीकार की गई कोई घटना समय, यात्रा की दूरी या अस्थायी प्राथमिकता को दर्शा सकती है। सहायक को किसी चरित्र लेबल का चयन करने के बजाय पूछना चाहिए या अनिश्चित रहना चाहिए। एक अलग परीक्षण खाते में, अवलोकन और अनुरोध को स्थिर रखते हुए एक गैर-प्रासंगिक पहचान संकेत को बदलें। सुझाव, टोन और मेमोरी के नियम काफी हद तक एक समान रहने चाहिए जब तक कि बदला गया विवरण कार्य के लिए वास्तव में आवश्यक न हो। NIST पूर्वाग्रह जोखिम के लिए प्रति-तथ्यात्मक और कम-संदर्भ वाले परीक्षण की सिफारिश करता है। कृत्रिम, सामान्य उदाहरणों का उपयोग करें; परीक्षण सामग्री के रूप में वास्तविक लोगों की प्रोफ़ाइल न बनाएं या अपमानजनक रूढ़िवादिता उत्पन्न न करें। केवल पहले उत्तर की नहीं, बल्कि चैट, सुझाव, सारांश और सूचना सतहों की तुलना करें।

खंड 6

सत्यापित करें कि लूप छिपा होने के बजाय टूटा हुआ है

हानिरहित परीक्षण खाते का उपयोग करें। समय-सीमित प्राथमिकता दर्ज करें, देखें कि कौन सी सतहें बदलती हैं, फिर इसे सही करें या रद्द करें। किसी अन्य डिवाइस पर ऐप को फिर से खोलें, एक नए सुझाव का अनुरोध करें, दिखाई देने वाले प्रोफ़ाइल या निर्यात का निरीक्षण करें, और ध्यान दें कि क्या पुराना अनुमान वापस आता है। पांच परिणामों को रिकॉर्ड करें: अवलोकन बरकरार रखा गया, अनुमान अनंतिम है, उपयोगकर्ता द्वारा पुष्ट प्राथमिकता, सही या रद्द किया गया, और अनसुलझा। OECD का मानव-केंद्रित निष्पक्षता सिद्धांत संदर्भ के लिए उपयुक्त सुरक्षा उपायों और मानवीय निगरानी का समर्थन करता है। व्यावहारिक स्वीकृति परीक्षण अधिक संकीर्ण है: उत्पाद स्रोत श्रेणी की व्याख्या कर सकता है, एक सुधार घोषित सतहों तक पहुंचता है, और नए साक्ष्य के बिना अस्वीकृत लेबल को फिर से बनाने के लिए बाद के व्यवहार का उपयोग नहीं किया जाता है। यह अनिश्चितता के प्रति ईमानदार रहते हुए सुदृढीकरण के जोखिम को कम करता है; यह सिस्टम को पूर्वाग्रह-मुक्त प्रमाणित नहीं करता है।

संबंधित लेख

इस विषय को आगे पढ़ें