शैली और अंदाज़ के आधार पर रचनात्मक लेखन मॉडल्स का परीक्षण कैसे करें
यदि आप यह पता लगाना चाहते हैं कि कोई लेखन मॉडल किसी विशिष्ट शैली (genre) या अंदाज़ (style) के अनुकूल है या नहीं, तो उसे नियंत्रित प्रॉम्प्ट के तहत वही छोटा लेखन कार्य दें, और फिर पहले से तय किए गए मानदंडों के आधार पर अनुच्छेदों की तुलना करें। शैली और अंदाज़ को मिलाने से पहले उनका अलग-अलग परीक्षण करें। इससे यह देखना आसान हो जाता है कि क्या मॉडल कहानी की आवश्यकताओं को पूरा करने से चूक गया, टोन को गलत समझा, या उसने केवल ऐसा गद्य तैयार किया जिसे आपको बड़े पैमाने पर संशोधित करना पड़ेगा। नीचे दिया गया वर्कफ़्लो उन लेखकों के लिए है जो किसी विशिष्ट लघु-कथा कार्य के लिए मॉडल चुन रहे हैं; यह तुलना का एक व्यावहारिक तरीका है, गुणवत्ता की कोई गारंटी नहीं।
आपको पहले किसका परीक्षण करना चाहिए: शैली (Genre) या अंदाज़ (Style)?
शैली और अंदाज़ किसी गद्यांश के विभिन्न हिस्सों को आकार देते हैं। शैली (Genre) कथानक के प्रवाह, माहौल, परिवेश और महत्वपूर्ण विवरणों के प्रकार जैसी चीजों को लेकर पाठक की अपेक्षाएं तय करती है। अंदाज़ (Style) का संबंध वाक्य की लंबाई, शब्दावली, दृष्टिकोण (point of view), लय और गद्यांश में उपयोग किए जाने वाले विवरणों की मात्रा जैसे विकल्पों से है। ये श्रेणियां आपस में जुड़ी हुई हैं, लेकिन अलग-अलग चरणों में इनका परीक्षण करने से आपको अधिक स्पष्ट मूल्यांकन मिलता है।
शुरुआत शैली (Genre) से करें। देखें कि क्या मॉडल दृश्य के मूल उद्देश्य को पूरा कर सकता है: उदाहरण के लिए, किसी भूतिया कहानी में एक रहस्यमयी आधार स्थापित करना, किसी मिस्ट्री में सुरागों की कड़ी बनाए रखना, या एक सुसंगत काल्पनिक परिवेश तैयार करना। इसके बाद एक निश्चित दृश्य के आधार पर अंदाज़ (Style) का परीक्षण करें, जिसमें "साहित्यिक" या "सिनेमैटिक" जैसे व्यापक लेबल पर निर्भर रहने के बजाय प्रत्यक्ष रूप से दिखने वाले लक्षणों को निर्दिष्ट करें। "क्लोज़ थर्ड पर्सन, संयमित विवरण, दबाव की स्थिति में छोटे वाक्य, और पात्र की भावनाओं का कोई स्पष्टीकरण नहीं" जैसी मांग "इसे वायुमंडलीय बनाएं" की तुलना में मूल्यांकन के लिए अधिक स्पष्ट आधार देती है।
यह अंतर केवल एक व्यावहारिक कार्यप्रणाली है, यह दावा नहीं कि शैली या अंदाज़ को निष्पक्ष रूप से मापा जा सकता है। [Google Cloud प्रॉम्प्ट-डिज़ाइन गाइड](https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/prompts/introduction-prompt-design) स्पष्ट, विशिष्ट निर्देश, प्रासंगिक जानकारी, उदाहरण और प्रॉम्प्ट तुलना की अनुशंसा करती है। [OpenAI की प्रॉम्प्टिंग गाइड](https://developers.openai.com/api/docs/guides/prompting) भी प्रयोग करने और उदाहरणों तथा कार्य-विशिष्ट विवरणों को स्पष्ट रखने की सलाह देती है। वे सिद्धांत एक नियंत्रित परीक्षण का समर्थन करते हैं; वे यह साबित नहीं करते कि हर रचनात्मक कार्य के लिए एक ही प्रॉम्प्ट प्रारूप सबसे अच्छा है।
एक छोटी, निष्पक्ष तुलना तैयार करें
एक ऐसा कार्य चुनें जो उस लेखन का प्रतिनिधित्व करता हो जिसमें आपको वास्तव में सहायता की आवश्यकता है। इसे इतना छोटा रखें कि इसकी बारीकी से समीक्षा की जा सके: 250 शब्दों का एक दृश्य, किसी परिवेश का विवरण, या एक पैराग्राफ का संशोधन बिना किसी लंबे प्रारूप की प्रतिस्पर्धा में उलझे उपयोगी अंतर प्रकट कर सकता है।
एक साझा प्रॉम्प्ट लिखें जिसमें निश्चित कहानी के तथ्य, गद्यांश की लंबाई, दृष्टिकोण (POV), और सामग्री की कोई भी सीमा शामिल हो। फिर केवल उस विशेषता को बदलकर कुछ परीक्षण प्रॉम्प्ट बनाएं जिसकी आप जांच कर रहे हैं। यदि जॉनर हैंडलिंग की तुलना कर रहे हैं, तो वही आधार रखें और अलग-अलग जॉनर ट्रीटमेंट मांगें। यदि अंदाज़ (style) की तुलना कर रहे हैं, तो समान शैली और दृश्य तथ्यों को बनाए रखें, फिर केवल अनुरोधित स्वर (voice) के लक्षणों को बदलें। आधार, लंबाई, दृष्टिकोण और अंदाज़ को एक साथ न बदलें; यदि आउटपुट भिन्न होते हैं, तो आपको पता नहीं चलेगा कि किस बदलाव के कारण यह अंतर आया।
जहाँ संभव हो, समान मॉडल सेटिंग्स का उपयोग करें, और मॉडल का नाम, तारीख, प्रॉम्प्ट का टेक्स्ट, और आपके द्वारा बदली गई किसी भी सेटिंग को नोट करें। यदि आप सेटिंग्स को नियंत्रित नहीं कर सकते हैं, तो उस सीमा को दर्ज करें और किसी एक आउटपुट को मॉडल के स्थायी माप के रूप में मानने से बचें। एक दूसरी बार जनरेट करने से यह पता लगाने में मदद मिल सकती है कि कोई आशाजनक या निराशाजनक परिणाम दोहराने योग्य था या नहीं, लेकिन यह किसी छोटे व्यक्तिगत परीक्षण को एक व्यापक बेंचमार्क में नहीं बदलता है।
प्रॉम्प्ट देने से पहले, अपने कार्य के लिए महत्वपूर्ण तीन से पांच मानदंड चुनें। किसी रहस्यमय दृश्य के लिए, इनमें शामिल हो सकते हैं: सुराग मौजूद है लेकिन समझाया नहीं गया है; नैरेटर का ज्ञान सुसंगत रहता है; गद्य तनाव बनाए रखता है; और दृश्य एक सार्थक प्रश्न के साथ समाप्त होता है। शैली परीक्षण के लिए, मानदंडों में दृष्टिकोण की निरंतरता, वाक्यों की विविधता, ठोस बिंब और संयम शामिल हो सकते हैं। कम से कम एक "ज़रूर रखें" (must keep) और एक "कतई न रखें" (must not) मानदंड शामिल करें। अन्यथा, एक धाराप्रवाह गद्यांश किसी छूटी हुई शर्त से आपका ध्यान भटका सकता है।
एक व्यावहारिक उदाहरण: एक शांत रहस्यमय दृश्य का परीक्षण
मान लीजिए कि आप एक समकालीन रहस्य लिख रहे हैं जिसमें एक केयरटेकर एक बंद अभिलेखागार (locked archive) के अंदर एक गीले पैर का निशान खोजता है। गद्यांश क्लोज़ थर्ड पर्सन और सूक्ष्म (understated) होना चाहिए। ये केवल उदाहरणात्मक प्रॉम्प्ट इनपुट हैं, किसी मॉडल परीक्षण के परिणाम नहीं।
सबसे पहले, इस तरह के प्रॉम्प्ट के साथ शैली (Genre) की जांच करें:
उदाहरण परीक्षण प्रॉम्प्ट: क्लोज़ थर्ड पर्सन में 250 शब्दों का समकालीन रहस्य दृश्य लिखें। एक केयरटेकर भोर में एक बंद अभिलेखागार में प्रवेश करता है और एक सूखी खिड़की के पास एक गीले पैर का निशान पाता है। कारण को अस्पष्ट रखें। एक ऐसा ठोस विवरण शामिल करें जो सुराग बन सके, लेकिन किसी संदिग्ध की पहचान न करें और न ही पैर के निशान की व्याख्या करें। संयमित गद्य का उपयोग करें और एक अनसुलझे विकल्प पर समाप्त करें।
अपनी चेकलिस्ट के आधार पर आउटपुट की समीक्षा करें। क्या यह अभिलेखागार को बंद और खिड़की को सूखा रखता है? क्या यह अनिश्चितता को बनाए रखता है, या कोई व्याख्या गढ़ता है? क्या कोई ऐसा विवरण है जो सुराग के रूप में लेबल किए बिना सुराग का काम कर सके? क्या अंत केवल रुकने के बजाय एक विकल्प पैदा करता है? प्रत्येक बिंदु को "पूरा हुआ", "आंशिक रूप से पूरा हुआ", या "छूट गया" के रूप में चिह्नित करें, और उस सटीक वाक्य को कॉपी करें जिसके आधार पर आपने यह निर्णय लिया। यह उद्धरण आपके नोट्स के लिए है; यह "अच्छा तनाव" जैसे सामान्य प्रभाव को किसी विशिष्ट अवलोकन की जगह लेने से रोकता है।
इसके बाद, दृश्य के तथ्यों और रहस्य की आवश्यकताओं को स्थिर रखें, लेकिन अंदाज़ (style) के निर्देश को बदलें। एक रूप छोटे वाक्यों और न्यूनतम आंतरिक चिंतन की मांग कर सकता है; दूसरा रूप दृष्टिकोण को क्लोज़ रखते हुए लंबे, अधिक सूक्ष्मदर्शी वाक्यों का अनुरोध कर सकता है। तुलना करें कि वे विशिष्ट निर्देश गद्य को कैसे प्रभावित करते हैं। आप यह नहीं पूछ रहे हैं कि कौन सा अंदाज़ सार्वभौमिक रूप से श्रेष्ठ है। आप यह पूछ रहे हैं कि कौन सा आउटपुट आपको इस दृश्य और आपकी अपनी लक्षित टोन के लिए अधिक उपयोगी सामग्री देता है।
अंत में, सबसे मजबूत गद्यांश में एक लक्षित संशोधन का अनुरोध करें। उदाहरण के लिए: "पैर के निशान और बंद कमरे के तथ्यों को अपरिवर्तित रखें। केयरटेकर के संदेह को समझाने वाले वाक्य को हटा दें; इसके बजाय कार्रवाई के माध्यम से बेचैनी व्यक्त करें।" कहानी के तथ्यों में अनपेक्षित बदलावों के लिए संशोधन की जांच करें और देखें कि क्या उसने वास्तव में व्याख्या को हटा दिया है। एक उपयोगी मॉडल परीक्षण में पहले ड्राफ्ट के प्रवाह के साथ-साथ संशोधन व्यवहार भी शामिल होता है, क्योंकि आपके वास्तविक वर्कफ़्लो में स्थानीय बदलावों के कई दौर शामिल हो सकते हैं।
स्कोरकार्ड का उपयोग करें, फिर एक संपादकीय निर्णय लें
एक सरल स्कोरकार्ड तुलना को सटीक बनाए रख सकता है:
अंतिम पंक्ति को अपनी प्रक्रिया के बारे में एक निर्णय के रूप में मानें, साहित्यिक योग्यता का कोई वस्तुनिष्ठ माप नहीं। आप एक ऐसे कच्चे मसौदे को प्राथमिकता दे सकते हैं जो मूल आधार को सुरक्षित रखता है और आपको एक मजबूत बिंब देता है, बजाय उस परिष्कृत गद्यांश के जो रहस्य को बहुत जल्दी सुलझा देता है। आप यह भी तय कर सकते हैं कि उस कार्य के लिए दोनों में से कोई भी मॉडल उपयोगी नहीं है। यदि आप संख्यात्मक अंकों का उपयोग करते हैं, तो शुरू करने से पहले परिभाषित करें कि प्रत्येक संख्या का क्या अर्थ है, और किसी छोटे स्कोर अंतर को सांख्यिकीय रूप से सार्थक प्रस्तुत न करें।
यह पद्धति रचनात्मक कार्य को पुनरावृत्तीय (iterative) मानने के व्यापक दृष्टिकोण से भी मेल खाती है। उभरते हुए लेखकों के साथ एक व्यावहारिक अध्ययन में, चक्रवर्ती और उनके सहयोगियों ने एक सहयोगी लेखन प्रणाली के साथ लेखकों की बातचीत की जांच की, और लेखन को एक पुनरावृत्तीय गतिविधि के रूप में वर्णित किया; यह कार्य एक एकल प्रॉम्प्ट द्वारा तैयार कहानी के बजाय एक संवादात्मक प्रक्रिया का वर्णन करता है। अध्ययन के प्रतिभागी, प्रणाली और लेखन कार्य इसके निष्कर्षों के सामान्यीकरण को सीमित करते हैं। यह आपके अपने संशोधन चक्र के परीक्षण के लिए एक उपयोगी संदर्भ है, इस बात का प्रमाण नहीं कि कोई विशेष मॉडल या वर्कफ़्लो हर लेखक के लिए काम करेगा। देखें [“लार्ज लैंग्वेज मॉडल्स के युग में रचनात्मकता समर्थन: उभरते लेखकों को शामिल करते हुए एक अनुभवजन्य अध्ययन”](https://arxiv.org/abs/2309.12570)।
टूल बदलने से पहले कमजोर आउटपुट का विश्लेषण करें
जब कोई गद्यांश निराश करता है, तो कमी को सटीक रूप से पहचानें। यदि यह किसी निश्चित तथ्य का खंडन करता है, तो उस तथ्य को प्रमुख बनाएं और प्रॉम्प्ट से परस्पर विरोधी विवरण हटा दें। यदि गद्य मूल आधार का पालन करता है लेकिन वांछित आवाज़ से चूक जाता है, तो अस्पष्ट विशेषणों को ठोस लक्षणों से बदलें या अपने द्वारा लिखा गया एक छोटा उदाहरण जोड़ें। यदि मॉडल किसी इच्छित रहस्य को बार-बार सुलझा देता है, तो उससे स्पष्ट रूप से अनिश्चितता बनाए रखने और कारणों का उल्लेख करने से बचने के लिए कहें। एक समय में एक निर्देश बदलें, फिर तुलना दोबारा चलाएं।
यदि गद्यांश आपकी चेकलिस्ट को पूरा करता है लेकिन फिर भी असंतोषजनक लगता है, तो समस्या निर्देशों के पालन के बजाय व्यक्तिगत पसंद या उपयुक्तता की हो सकती है। ठोस शब्दों में नोट करें कि क्या गलत लग रहा है: बहुत अधिक व्याख्या, सामान्य बिंब, पूर्वानुमेय संवाद, या आपकी पसंद से अलग लय। फिर तय करें कि क्या केंद्रित संशोधन का अनुरोध करना उचित है या दृश्य का मसौदा आपके द्वारा खुद तैयार करना बेहतर होगा। एक प्रशंसनीय गद्य उत्पन्न करने की मॉडल की क्षमता यह स्थापित नहीं करती है कि वह आपके इरादे को समझता है या उस गद्य को रखा जाना चाहिए।
मॉडल परीक्षण की सीमाएं
कुछ गिने-चुने आउटपुट यह स्थापित नहीं कर सकते कि कोई मॉडल किसी पूरी शैली में लगातार अच्छा है, न ही किसी एक लेखक की चेकलिस्ट हर पाठक का प्रतिनिधित्व कर सकती है। आउटपुट भिन्न हो सकते हैं, प्रॉम्प्ट किसी एक मॉडल का पक्ष ले सकते हैं, और शैली से परिचित होना इस बात को प्रभावित करता है कि समीक्षक क्या नोटिस करता है। अपने निष्कर्षों को सीमित रखें: "इन दो परीक्षणों में, इस संस्करण ने दृश्य के तथ्यों को बेहतर ढंग से संरक्षित किया" यह दावा करना अधिक तर्कसंगत है बजाय इसके कि "यह रहस्य-लेखन का सबसे अच्छा मॉडल है।"
इसके अलावा किसी प्रसिद्ध लेखक की नकल करने में सावधानी बरतें। यदि आपको किसी विशेष शिल्प प्रभाव की आवश्यकता है, तो प्रभाव का सीधे वर्णन करें—जैसे कि संक्षिप्त वाक्य-विन्यास (spare syntax), बारीक अवलोकन, या सूखा हास्य (dry humor)—और उन लक्षणों का मूल्यांकन करें। यह किसी नाम को एक विश्वसनीय शैली विनिर्देश मानने के बजाय, उन लेखन विकल्पों का एक स्पष्ट परीक्षण प्रस्तुत करता है जो आप वास्तव में चाहते हैं।
परीक्षण का उपयोगी परिणाम इस बात का रिकॉर्ड है कि क्या हुआ: कार्य, प्रॉम्प्ट, मॉडल और सेटिंग्स, चेकलिस्ट, आउटपुट साक्ष्य, और आपके द्वारा आजमाया गया संशोधन। उस रिकॉर्ड के साथ, आप उस मॉडल को चुन सकते हैं जो एक परिभाषित कार्य का सबसे अच्छा समर्थन करता है—या यह तय कर सकते हैं कि आपका समय गद्यांश को खुद संशोधित करने में बेहतर व्यतीत होगा।
