← नवीनतम पेपर
💬 NLP

GENIE: A Fine-Grained Measure for Novelty

यह शोध पत्र GENIE को प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय (fine-grained) मूल्यांकन मीट्रिक है जिसे कार्य-विशिष्ट विशेषताओं के आधार पर लार्ज लैंग्वेज मॉडल (LLM) की प्रतिक्रियाओं की नवीनता को मापने के लिए डिज़ाइन किया गया है, जो समग्र मीट्रिक्स की सीमाओं को संबोधित करता है और रचनात्मकता शमन (creativity mitigation) विधियों की प्रभावशीलता के बारे में अंतर्दृष्टि प्रदान करता है।

मूल लेखक: Ramya Namuduri, Manya Wadhwa, Anshun Asher Zheng, Greg Durrett, Junyi Jessy Li

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ramya Namuduri, Manya Wadhwa, Anshun Asher Zheng, Greg Durrett, Junyi Jessy Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक टैलेंट शो के जज हैं जहाँ 100 प्रतियोगियों को एक डायनासोर और एक कंप्यूटर के बारे में कहानी सुनाने के लिए कहा गया है।

अधिकांश कहानियाँ बिल्कुल एक जैसी लगती हैं: एक टी-रेक्स (T-Rex) जंगल में एक लैपटॉप पाता है, डर जाता है, और भाग जाता है। लेकिन फिर, एक प्रतियोगी एक ऐसी कहानी सुनाता है जिसमें एक टी-रेक्स वास्तव में एक ऊब चुका ऑफिस वर्कर है जो एक प्रागैतिहासिक शरीर में फंसा हुआ है, और एक नाव पर टूटे हुए टोस्टर को ठीक करने की कोशिश कर रहा है।

पुराने जजों के साथ समस्या
अतीत में, यदि आप जानना चाहते थे कि कोई कहानी कितनी "रचनात्मक" या "नई" थी, तो आप एक "होलिस्टिक" (समग्र) जज का उपयोग करते थे। यह जज पूरी कहानी को देखता था और उसे एक एकल स्कोर देता था, जैसे कि "10 में से 7"।

  • दोष: यह एक शिक्षक की तरह है जो आपको गणित के टेस्ट के लिए एक ही ग्रेड देता है बिना यह बताए कि आपने कौन से सवाल सही या गलत किए। यदि डायनासोर की कहानी को "7" मिला, तो आपको पता नहीं चलता कि वह अपनी सेटिंग (नाव) के कारण रचनात्मक थी, अपने पात्र (ऑफिस वर्कर) के कारण, या अपनी कहानी (प्लॉट) के कारण।
  • भ्रम: कभी-कभी, एक कहानी नई लग सकती है क्योंकि लेखक ने फैंसी शब्दों का उपयोग किया है (पैराफ्रेसिंग/समानार्थी शब्दों का प्रयोग), लेकिन वास्तविक विचार उबाऊ होते हैं। पुराने जज अक्सर इन फैंसी शब्दों से धोखा खा जाते हैं।

नया समाधान: GENIE
लेखकों ने एक नया टूल बनाया है जिसे GENIE (Granular Evaluation of Novel Ideas with Explainability) कहा जाता है। GENIE को केवल एक एकल जज के रूप में नहीं, बल्कि विशेषज्ञ निरीक्षकों की एक टीम के रूप में सोचें।

एक एकल स्कोर देने के बजाय, GENIE कहानी को विशिष्ट "फीचर्स" या श्रेणियों में तोड़ देता है, जैसे कि:

  • सेटिंग (Setting): यह कहाँ होता है?
  • प्लॉट (Plot): वास्तव में क्या होता है?
  • चरित्र (Character): मुख्य व्यक्ति (या डायनासोर) कौन है?
  • शैली (Style): इसे कैसे लिखा गया है?

GENIE कैसे काम करता है ("सवाल और जवाब" का खेल)
GENIE केवल अनुमान नहीं लगाता; यह कहानी को समझने के लिए "बीस सवाल" (Twenty Questions) के खेल को खेलता है:

  1. जनसंख्या (The Population): सबसे पहले, GENIE अन्य कहानियों के एक विशाल ढेर को देखता है ताकि यह देख सके कि "मानक" डायनासोर कहानियाँ कैसी दिखती हैं।
  2. प्रश्न: एक नई कहानी के लिए, GENIE विशिष्ट प्रश्नों को पूछता है जो फीचर्स पर आधारित होते हैं।
    • प्रश्न: "सेटिंग क्या है?"
    • उत्तर: "एक नाव।"
  3. तुलना: GENIE उत्तरों की तुलना कहानियों के उस ढेर से करता है।
    • यदि 99 अन्य कहानियों ने "जंगल" कहा, और इस एक ने "नाव" कहा, तो GENIE सेटिंग की नवीनता (Setting Novelty) के लिए उच्च स्कोर देता है।
    • यदि 99 अन्य कहानियों ने कहा कि "डायनासोर को कंप्यूटर मिलता है," और यह एक भी वही बात कहता है, तो GENIE प्लॉट की नवीनता (Plot Novelty) के लिए कम स्कोर देता है।

यह बेहतर क्यों है
लेखक दावा करते हैं कि GENIE पुराने "होलिस्टिक" जजों की तुलना में सच्चाई पकड़ने में बहुत बेहतर है।

  • यह ईमानदार है: यह आपको बिल्कुल बता सकता है कि रचनात्मकता कहाँ है। "यह कहानी अपनी सेटिंग में बहुत नई है, लेकिन अपने प्लॉट में बहुत उबाऊ है।"
  • यह फैंसी शब्दों से नहीं छलता: यदि किसी लेखक ने केवल एक उबाऊ कहानी को अलग शब्दों के साथ फिर से लिखा है (पैराफ्रेसिंग), तो पुराने जज सोच सकते हैं कि यह नया है। GENIE देखता है कि इसके उत्तर अभी भी समान हैं, इसलिए वह जानता है कि कहानी वास्तव में नई नहीं है।
  • यह "नया" और "अच्छा" को अलग करता है: कभी-कभी एक कहानी अजीब और नई होती है लेकिन पढ़ने में बहुत खराब होती है। पुराने जज अक्सर "रचनात्मकता" को "गुणवत्ता" के साथ मिला देते हैं। GENIE केवल यह मापता है कि विचार कितने अलग हैं, न कि उन्हें कितनी अच्छी तरह लिखा गया है।

टूल का परीक्षण
लेखकों ने GENIE का परीक्षण निम्नलिखित तरीकों से किया:

  1. सर्जरी (Surgery): उन्होंने एक उबाऊ कहानी ली और उसमें केवल एक चीज़ को सर्जिकल तरीके से बदल दिया (जैसे सेटिंग को जंगल से बदलकर नाव कर दिया)। GENIE ने सही ढंग से पहचाना कि केवल सेटिंग बदली है और उस विशिष्ट भाग के लिए उच्च स्कोर दिया।
  2. पैराफ्रेसिंग (Paraphrasing): उन्होंने एक कहानी ली और उसे समान अर्थ के साथ अलग शब्दों में फिर से लिखा। GENIE ने सही ढंग से कहा, "यह वास्तव में नया नहीं है," जबकि पुराने जज भ्रमित हो गए और उन्हें लगा कि यह अलग है।

निष्कर्ष
GENIE रचनात्मकता को मापने का एक नया तरीका है जो केवल एक अस्पष्ट स्कोर नहीं देता है। यह एक सूक्ष्मदर्शी (microscope) की तरह कार्य करता है, जो हमें स्पष्ट रूप से दिखाता है कि कहानी के कौन से हिस्से ताज़ा हैं और कौन से हिस्से केवल वही हैं जो बाकी सब कर रहे हैं। यह शोधकर्ताओं को यह समझने में मदद करता है कि AI न केवल रचनात्मक है, बल्कि वह कहाँ रचनात्मक है और उसे कहाँ सुधार करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →