Metlivi ब्लॉग

जब किसी AI साथी की आवाज़ बदल जाए: क्या अलग लग रहा है उसे कैसे पहचानें और सामंजस्य बैठाएं

यदि किसी AI साथी की आवाज़ अलग सुनाई दे रही है, तो यह तय करने से पहले कि क्या करना है, बदलाव को पहचानें: इसकी पिच, गति, उच्चारण और आपके बोलने के बीच के ठहराव की तुलना करें। यदि ऐप आवाज़ के विकल्प या पूर्वावलोकन (प्रीव्यू) प्रदान करता है, तो उन्हें सुनें और वह विकल्प चुनें जो आपके लिए उपयुक्त हो; जहां सुविधा उपलब्ध हो, वहां एक सरल निर्देश दें जैसे कि "थोड़ा धीरे बोलें।" आवाज़ का अपडेट केवल ध्वनि की गुणवत्ता (टिम्बर) से कहीं अधिक बदल सकता है। उदाहरण के लिए, OpenAI का कहना है कि उसके नए ChatGPT Voice अनुभव ने अपनी आवाज़ों को रीमास्टर किया है और बातचीत में रुकावटों तथा ठहरावों को संभालने के तरीके को बदला है। ये उत्पाद-विशिष्ट विवरण हैं, लेकिन वे यह स्पष्ट करते हैं कि एक जानी-पहचानी बातचीत अचानक अलग क्यों लग सकती है। OpenAI’s GPT‑Live announcement

30 सितंबर 20267 min readपढ़ना, कला और संस्कृतिलेखक: Metlivi Editorial Team
खंड 1

एक जानी-पहचानी AI आवाज़ अलग क्यों लग सकती है?

"आवाज़" केवल एक ध्वनि विशेषता नहीं है। एक श्रोता किसी आवाज़ को आंशिक रूप से उसकी पिच रेंज या टिम्बर से पहचान सकता है, लेकिन गति, ज़ोर (emphasis), उच्चारण और बोलने की बारी का समय भी समग्र प्रभाव को आकार देते हैं। एक उत्पाद अपडेट इनमें से कई चीज़ों को एक साथ बदल सकता है। उदाहरण के लिए, OpenAI का वर्तमान Voice सहायता पृष्ठ चयन योग्य आवाज़ों को सूचीबद्ध करता है और कहता है कि उपयोगकर्ता सिस्टम से उसके टोन, गति या प्रतिक्रिया शैली को बदलने के लिए कह सकते हैं; इसके रिलीज़ नोट्स समय के साथ Voice अनुभव में हुए परिवर्तनों का वर्णन करते हैं। उपलब्ध नियंत्रण और व्यवहार उत्पाद, संस्करण और खाते पर निर्भर करते हैं, इसलिए यह मानने के बजाय कि पुराना मेनू अभी भी लागू होता है, ऐप की वर्तमान सेटिंग्स की जांच करें। ChatGPT Voice help

बदलाव सूक्ष्म भी हो सकता है। हो सकता है कि आवाज़ की पिच समान हो लेकिन नामों का उच्चारण अलग हो, वाक्यों को किसी अन्य गति से पूरा किया जाए, या उत्तर देने से पहले एक अलग ठहराव लिया जाए। यदि वे विवरण उस जानी-पहचानी आवाज़ को समझने में आसान बनाने का हिस्सा थे, तो नए संस्करण की आदत डालने में ध्यान देने की आवश्यकता हो सकती है। यह एक व्यावहारिक व्याख्या है, न कि यह दावा कि प्रत्येक श्रोता उसी तरह प्रतिक्रिया देगा।

खंड 2

क्या सुनना और परखना चाहिए: चार प्रत्यक्ष अंतर

सरल तुलना के लिए एक ही छोटे प्रॉम्प्ट या विषय का उपयोग करें, यदि ऐप आपको आवाज़ों को फिर से चलाने या उनका पूर्वावलोकन करने देता है। एक ही समय में पूरी आवाज़ का आकलन करने की कोशिश करने के बजाय प्रत्येक विशेषता को अलग-अलग सुनें।

पिच और वोकल क्वालिटी। क्या आवाज़ अधिक ऊंची या नीची, अधिक चमकदार या अधिक गूंजदार लगती है? ये व्यक्तिगत अनुभव हैं, इसलिए आपको किसी ध्वनिक माप का नाम देने की आवश्यकता नहीं है। सरल भाषा में तुलना नोट करें, जैसे कि "वाक्यों के अंत में स्वर का धीमा होना।"

गति और वाक्यक्रम (phrasing)। क्या यह तेज़ बोलती है, वाक्यों के भीतर छोटे ठहराव छोड़ती है, या अलग-अलग शब्दों पर ज़ोर देती है? अधिक तेज़ प्रस्तुति एक परिचित उत्तर को अधिक संक्षिप्त महसूस करा सकती है, भले ही शब्द न बदले हों।

उच्चारण। उन ध्वनियों को सुनें जो पहचान को प्रभावित करती हैं: कोई नाम, कोई स्थान, कोई लिया गया शब्द (borrowed word), या उस भाषा का कोई शब्द जिसे आप अक्सर उपयोग करते हैं। यदि उच्चारण का कोई अंतर आवाज़ को समझने में कठिन बना रहा है तो एक उदाहरण रिकॉर्ड या नोट करें।

बोलने की बारी का समय (Turn timing)। ध्यान दें कि क्या आपके रुकने के बाद आवाज़ जल्दी बोलना शुरू करती है, अधिक देर तक प्रतीक्षा करती है, या तब उत्तर देती है जब आप अभी भी अपनी बात जोड़ रहे होते हैं। मानव बातचीत के अध्ययनों में, बोलने की बारी का समय व्याकरण और स्वर-शैली (prosody) जैसे संकेतों द्वारा आकार लेता है, और बोलने की बारी के बीच का अंतर बातचीत के प्रकार के साथ बदलता रहता है। वह प्रमाण मानव बातचीत से संबंधित है; यह यह स्थापित नहीं करता है कि कोई विशेष AI प्रणाली अपने उत्तरों का समय कैसे निर्धारित करती है। यह यह समझाने में अवश्य मदद करता है कि बातचीत के एक अलग हिस्से के रूप में बदला हुआ ठहराव ध्यान देने योग्य क्यों हो सकता है। Stivers et al., “Universals and cultural variation in turn-taking in conversation”

खंड 3

आवाज़ के विकल्पों या पूर्वावलोकन का उपयोग कैसे करें

सबसे पहले, उन नियंत्रणों को खोजें जो वास्तव में आपके ऐप में उपलब्ध हैं। सेटिंग्स में आवाज़ या ऑडियो अनुभाग देखें, या वॉइस बातचीत स्क्रीन खोलें और उसके मेनू की जांच करें। यदि नामित विकल्प हैं, तो जहां उपलब्ध हो, प्रत्येक उपलब्ध पूर्वावलोकन को सुनें। एक नाम या संक्षिप्त विवरण विकल्पों को सीमित कर सकता है, लेकिन गति, उच्चारण और वोकल क्वालिटी का आकलन करने के लिए नमूना सुनना अधिक उपयोगी है। उपलब्धता, लेबल और नियंत्रण अलग-अलग उत्पादों में भिन्न हो सकते हैं और अपडेट के साथ बदल सकते हैं।

ChatGPT का वर्तमान सहायता पृष्ठ, एक उत्पाद-विशिष्ट उदाहरण के रूप में, उपयोगकर्ताओं को उनके लिए उपलब्ध विकल्पों में से अपनी पसंदीदा आवाज़ चुनने के लिए Settings → Voice पर निर्देशित करता है। यह यह भी कहता है कि किसी सक्रिय वॉइस बातचीत के दौरान चयनित आवाज़ को बदलने से उसी चैट में एक नया वॉइस कॉल शुरू हो जाता है। पृष्ठ कहता है कि उपयोगकर्ता बातचीत के दौरान टोन, गति या प्रतिक्रिया शैली में बदलाव के लिए कह सकते हैं, और ChatGPT से तेज़ या धीरे बोलने के लिए कह सकते हैं, जबकि सटीक प्लेबैक-स्पीड नियंत्रण वर्तमान में उपलब्ध नहीं हैं। इन निर्देशों को अन्य AI साथी ऐप्स पर सामान्यीकृत नहीं किया जाना चाहिए। ChatGPT Voice help

विकल्पों की तुलना करते समय, अमूर्त रूप से यह पूछने के बजाय कि कौन सा "सर्वश्रेष्ठ" है, सुनने की एक छोटी चेकलिस्ट का उपयोग करें:

आपके सामान्य सुनने के वॉल्यूम पर आपके लिए कौन सी आवाज़ समझना सबसे आसान है?

क्या इसकी गति आपको प्रत्येक विचार को समझने के लिए पर्याप्त समय देती है?

क्या आपके लिए महत्वपूर्ण शब्दों या नामों का उच्चारण स्पष्ट रूप से किया गया है?

क्या ठहराव आपको अपनी बात पूरी करने की जगह देते हैं?

यदि पूर्वावलोकन उन प्रश्नों का उत्तर देने के लिए बहुत छोटा है, तो किसी ऐसे विषय का उपयोग करके एक संक्षिप्त, सामान्य बातचीत का प्रयास करें जिसे आप अच्छी तरह से जानते हैं। परिचित सामग्री उत्तर के अर्थ को समझने में ध्यान लगाने के बजाय आवाज़ के तरीके पर ध्यान देना आसान बनाती है। इसे एक व्यक्तिगत तुलना मानें, औपचारिक परीक्षण नहीं।

खंड 4

बदलाव का वर्णन कैसे करें और अपनी प्राथमिकता कैसे बताएं

एक स्पष्ट प्राथमिकता किसी श्रव्य विशेषता और एक क्रिया का नाम देती है। उदाहरण के लिए: "कृपया थोड़ा और धीरे बोलें और मेरे समाप्त करने के बाद थोड़ा विराम लें।" या: "वही आवाज़ रखें, लेकिन इन दो नामों का उच्चारण वैसे ही करें जैसे मैंने उन्हें लिखा है।" यदि सेवा में एक समर्पित उच्चारण या कस्टम-निर्देश सेटिंग है, तो उपलब्ध होने पर उसका उपयोग करें; यह न मानें कि प्रत्येक ऐप इसका समर्थन करता है। एक सीधा अनुरोध बातचीत के भीतर प्रतिक्रियाओं का मार्गदर्शन कर सकता है, लेकिन यह डिफ़ॉल्ट आवाज़ को स्थायी रूप से नहीं बदल सकता है या बाद के सत्रों को प्रभावित नहीं कर सकता है।

आपने जो सुना उसे इस बात से अलग रखें कि आप उसे कैसे आंकते हैं। "आवाज़ अब अंतिम शब्द पर अधिक ज़ोर देती है" एक अवलोकन है। "मैं पहले की, अधिक स्थिर शैली पसंद करता हूं" एक प्राथमिकता है। इन्हें अलग रखने से आपको यह तय करने में मदद मिलती है कि क्या कोई सेटिंग, कोई भिन्न आवाज़, या गति का एक सरल अनुरोध उस अंतर को दूर करेगा जिसे आपने वास्तव में देखा है।

खंड 5

एक संक्षिप्त सामंजस्य दिनचर्या

एक परिचित प्रॉम्प्ट चुनें। एक या दो वाक्यों का उपयोग करें जो एक सामान्य मौखिक प्रतिक्रिया को आमंत्रित करते हैं, न कि किसी असामान्य तकनीकी प्रदर्शन को।

एक समय में एक विशेषता पर ध्यान दें। पहली बार में, गति पर ध्यान दें; दूसरी बार में, उच्चारण या बोलने की बारी के समय की जांच करें। यह किसी एक प्रमुख अंतर को आवाज़ के हर पहलू का प्रतिनिधित्व करने से रोकता है।

उपलब्ध पूर्वावलोकन या सेटिंग आज़माएं। केवल ऐप द्वारा प्रदान किए गए विकल्पों की तुलना करें। यदि इसमें कोई पूर्वावलोकन नहीं है, तो आवाज़ के नाम से अनुमान लगाने के बजाय एक संक्षिप्त बातचीत का उपयोग करें।

एक विशिष्ट निर्देश दें। धीमी गति, किसी विशेष शब्द का स्पष्ट उच्चारण, या उत्तर देने से पहले अधिक समय का अनुरोध करें। एक अनुरोध यह बताना आसान बनाता है कि क्या समायोजन से मदद मिली।

कुछ सामान्य बातचीत के बाद पुनर्मूल्यांकन करें। श्रोता अभ्यास के साथ कुछ अपरिचित वाक् पैटर्न के अनुकूल हो सकते हैं, लेकिन शोध यह वादा नहीं करता है कि कोई विशेष AI आवाज़ सहज हो जाएगी या कोई बदलाव एक निश्चित समय सारिणी पर होगा। विदेशी लहजे वाले मानव भाषण के अल्पकालिक अनुकूलन पर अध्ययनों में विशिष्ट प्रयोगात्मक कार्यों में अभ्यास के बाद बेहतर पहचान पाई गई है, जिसमें किसी अन्य वक्ता के प्रति कुछ स्थानांतरण भी शामिल है; यह सुनने पर उपयोगी पृष्ठभूमि है, न कि AI आवाज़ अपडेट के बारे में प्रत्यक्ष प्रमाण। Xie et al., “Rapid adaptation to foreign-accented speech and its transfer to an unfamiliar talker”

खंड 6

जब सेटिंग बदलना अधिक व्यावहारिक विकल्प हो

यदि स्पष्ट गति या उच्चारण अनुरोध का प्रयास करने के बाद भी नई आवाज़ को समझना मुश्किल बना रहता है, तो यदि आप चाहें तो कोई अन्य उपलब्ध आवाज़ चुनें। यदि कोई भी विकल्प विशिष्ट समस्या का समाधान नहीं करता है, तो उस बातचीत के लिए टेक्स्ट अधिक सुविधाजनक हो सकता है। इंटरफ़ेस को कार्य के साथ मिलाने के ये सामान्य तरीके हैं; अपने आप को ऐसी वॉइस सेटिंग का उपयोग करने के लिए मजबूर करने की कोई आवश्यकता नहीं है जो आपके काम के अनुकूल न हो।

यह जांचना भी मददगार हो सकता है कि क्या ऐप ने हाल ही में अपने वॉइस अनुभव में बदलाव किया है। रिलीज़ नोट्स यह समझा सकते हैं कि किसी उत्पाद ने अपनी आवाज़ें या बातचीत का समय बदल दिया है, हालांकि वे आपको यह नहीं बता सकते कि आपने वास्तव में क्या सुना या कौन सी सेटिंग आपके लिए उपयुक्त होगी। उदाहरण के लिए, OpenAI अपने रिलीज़ नोट्स में अपने ChatGPT Voice सुविधाओं और आवाज़ के व्यवहार में अपडेट का वर्णन करता है। किसी अन्य सेवा के लिए, उस सेवा के अपने वर्तमान दस्तावेज़ीकरण से परामर्श लें। ChatGPT release notes

व्यावहारिक लक्ष्य सीधा है: श्रव्य अंतर को पहचानें, आपके पास मौजूद नियंत्रणों का परीक्षण करें, फिर उस आवाज़ या बातचीत शैली को बनाए रखें जो आपकी दैनिक बातचीत के लिए काम करती है। एक पूर्वावलोकन विकल्पों की तुलना करने में मदद कर सकता है, और एक विशिष्ट अनुरोध आपकी प्राथमिकता को स्पष्ट कर सकता है; दोनों में से किसी के लिए भी बदली हुई ध्वनि को उत्पाद के बोलने के तरीके में बदलाव से अधिक कुछ मानने की आवश्यकता नहीं है।

संबंधित लेख

इस विषय को आगे पढ़ें