← नवीनतम पेपर
🤖 machine learning

Task-Awareness Improves LLM Generations and Uncertainty

यह शोध पत्र एक निर्णय-सैद्धांतिक ढांचे का प्रस्ताव करता है जो बेयस-इष्टतम (Bayes-optimal) प्रतिक्रियाओं को संश्लेषित करने और जोखिम को मापने के लिए आउटपुट को कार्य-निर्भर गुप्त संरचना (task-dependent latent structure) में मॉडल करके LLM जनरेशन और अनिश्चितता अनुमान में सुधार करता है, जिससे यह मानक भाषा-स्थान डिकोडिंग विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Tim Tomov, Dominik Fuchsgruber, Stephan Günnemann

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tim Tomov, Dominik Fuchsgruber, Stephan Günnemann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बातूनी रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो आपके सवालों के जवाब देता है। आमतौर पर, जब आप इससे कुछ पूछते हैं, तो यह एक लंबा वाक्य या पैराग्राफ उगल देता है। लेकिन अक्सर, जो आप वास्तव में चाहते हैं वह एक पैराग्राफ नहीं होता; आप एक विशिष्ट संख्या, वस्तुओं की एक सूची, एक ग्राफ़, या एक शब्द चाहते हैं।

यह शोध पत्र तर्क देता है कि हम वर्तमान में इस रोबोट से गलत "भाषा" में काम करने के लिए कह रहे हैं। हम इसके कच्चे शब्दों को सुन रहे हैं, लेकिन हमें उन शब्दों के पीछे की संरचना (structure) को सुनना चाहिए।

यहाँ उनके विचार का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: सिग्नल नहीं, शोर को सुनना

कल्पना कीजिए कि आप रोबोट से पूछ रहे हैं, "अमेरिका की सीमा किन महासागरों से लगती है?"

  • पुराना तरीका: रोबोट कह सकता है, "खैर, प्रशांत महासागर पश्चिम में है, और अटलांटिक पूर्व में है, लेकिन शायद हिंद महासागर दूर है..." या यह सिर्फ "प्रशांत" का अनुमान लगा सकता है।
  • समस्या: रोबोट टेक्स्ट जेनरेट कर रहा है। लेकिन आपके प्रश्न में वास्तव में एक छिपा हुआ ढांचा है: यह महासागरों के एक सेट (set) के लिए पूछ रहा है।
  • शोध पत्र का अंतर्दृष्टि (Insight): रोबोट के उत्तर को शब्दों की एक स्ट्रिंग के रूप में मानने के बजाय, हमें इसके "कंकाल" या "ब्लूप्रिंट" में तुरंत अनुवाद करना चाहिए। इस मामले में, ब्लूप्रिंट एक सूची है: {प्रशांत, अटलांटिक}

2. समाधान: "मास्टर शेफ" की उपमा

लेखक एक नया तरीका प्रस्तावित करते हैं जिससे सबसे अच्छा उत्तर प्राप्त किया जा सके, जिसे वे टास्क-अवेयरनेस (Task-Awareness) कहते हैं।

कल्पना कीजिए कि आप एक मास्टर शेफ (नया फ्रेमवर्क) हैं और रोबोट एक लाइन कुक (line cook) है जो बार-बार आपके पास सूप के अलग-अलग संस्करण लाता रहता है।

  • रोबोट (लाइन कुक): वह आपके पास सूप के 20 अलग-अलग कटोरे लाता है। कुछ में बहुत अधिक नमक है, कुछ में गाजर नहीं है, कुछ में शोरबा (broth) कम है।
  • पुराना तरीका (बीम सर्च): आप उन 20 कटोरों में से वह एक कटोरा चुनते हैं जो सबसे अच्छा दिखता है और उसे परोस देते हैं। यदि सबसे अच्छे कटोरे का स्वाद भी अजीब है, तो आप वही अजीब स्वाद परोसते हैं।
  • नया तरीका (बेयज़-ऑप्टिमल सिंथेसिस): आप केवल एक कटोरा नहीं चुनते। आप उन 20 कटोरों को एक विशाल मिक्सिंग पॉट में डालते हैं और औसत (average) स्वाद चखते हैं।
    • यदि 15 कटोरों में गाजर थी और 5 में नहीं थी, तो आपके "औसत" सूप में निश्चित रूप से गाजर होगी।
    • यदि 10 कटोरों में नमक था और 10 में नहीं था, तो आपके "औसत" सूप में बिल्कुल सही मात्रा में नमक होगा।
    • जादू: यह "औसत सूप" शायद वह कटोरा नहीं है जो रोबोट ने वास्तव में बनाया था। यह एक नया, संश्लेषित व्यंजन (synthesized dish) है जो रोबोट के सभी अनुमानों के सर्वोत्तम हिस्सों को मिलाकर बनाया गया है।

गणित में, यह "मिक्सिंग पॉट" कच्चे टेक्स्ट की दुनिया के बजाय एक लेटेंट स्पेस (Latent Space - एक संरचित मानचित्र) में होता है।

3. वे इसे कैसे करते हैं (मानचित्र और पैमाना)

इसे काम करने के योग्य बनाने के लिए, लेखक दो चीजें करते हैं:

  1. मानचित्र (Latent Structure): वे कार्य के लिए एक विशिष्ट मानचित्र परिभाषित करते हैं।
    • यदि कार्य "एक शहर चुनें" है, तो मानचित्र शहरों की एक सूची है।
    • यदि कार्य "एक निबंध को रेट करें" है, तो यह 0 से 10 तक की एक संख्या रेखा है।
    • यदि कार्य "महासागरों की सूची दें" है, तो यह महासागरों के नामों का एक सेट है।
  2. पैमाना (Dissimilarity Measure): वे एक नियम परिभाषित करते हैं कि एक उत्तर कितना "गलत" है।
    • शहरों के लिए, एक अक्षर की गलती भी बुरी है।
    • संख्याओं के लिए, 5 अंक कम या ज्यादा होना बुरा है।
    • सेट्स (sets) के लिए, एक महासागर को छोड़ देना एक विशिष्ट प्रकार की त्रुटि है।

इस मानचित्र और पैमाने का उपयोग करके, वे बेयज़-ऑप्टिमल रिस्पॉन्स (Bayes-Optimal Response) की गणना करते हैं। यह गणितीय रूप से "परफेक्ट" उत्तर है जो सभी अनुमानों के आधार पर गलत होने की संभावना को कम करता है।

4. "अनिश्चितता" (Uncertainty) मीटर

शोध पत्र यह भी दावा करता है कि यह तरीका यह बताने में बेहतर है कि रोबोट कब भ्रमित है।

  • पुराना तरीका: रोबोट एक पूरी तरह से गलत उत्तर देते हुए भी कह सकता है कि "मैं 90% निश्चित हूँ।" या वह पांच अलग-अलग उत्तर दे सकता है, और हम बस यह गिनते हैं कि उसने कितने अलग-अलग शब्दों का उपयोग किया।
  • नया तरीका: लेखक देखते हैं कि "ब्लूप्रिंट्स" कितने फैले हुए हैं।
    • यदि रोबोट के 20 अनुमान मानचित्र पर {प्रशांत} के रूप में मैप होते हैं, तो "फैलाव" बहुत कम है। रोबोट आश्वस्त है।
    • यदि रोबोट के अनुमान {प्रशांत}, {अटलांटिक}, {हिंद}, और {आर्कटिक} के रूप में मैप होते हैं, तो "फैलाव" बहुत बड़ा है।
    • शोध पत्र इस फैलाव को बेयज़ रिस्क (Bayes Risk) कहता है। यह एक संख्या है जो बताती है: "हे, रोबलेट भ्रमित है क्योंकि इसका आंतरिक मानचित्र हर जगह बिखरा हुआ है।" यह संख्या पिछले तरीकों की तुलना में यह भविष्यवाणी करने में बहुत अधिक सटीक है कि अंतिम उत्तर सही होगा या नहीं।

5. परिणाम

लेखकों ने कई कार्यों पर इनका परीक्षण किया:

  • प्रश्न उत्तर (Question Answering): सही शहर या वस्तुओं की सूची प्राप्त करना।
  • सारांशीकरण (Summarization): एक लंबे टेक्स्ट को मुख्य तथ्यों के ग्राफ़ में बदलना।
  • अनुवाद (Translation): टेक्स्ट को एक भाषा से दूसरी भाषा में बदलना।

लगभग हर मामले में, उनका "मास्टर शेफ" तरीका (संरचना से उत्तर को संश्लेषित करना) केवल रोबोट द्वारा लिखे गए एकल वाक्य को चुनने की तुलना में बेहतर उत्तर प्रदान करता है। यह एक बेहतर चेतावनी प्रणाली (अनिश्चितता स्कोर) भी देता है कि रोबोट कब गलत होने की संभावना रखता है।

सारांश

शोध पत्र कहता है: AI के उत्तरों को कविता की तरह मानना बंद करें। उन्हें डेटा की तरह मानें।

  1. AI के शब्दों को तुरंत एक संरचित प्रारूप (एक सूची, एक संख्या, एक ग्राफ़) में अनुवादित करें।
  2. केवल एक सबसे अच्छे अनुमान को न चुनें; सभी अनुमानों को गणितीय रूप से संयोजित करके एक "परफेक्ट औसत" उत्तर बनाएं।
  3. यह जानने के लिए कि आपको उत्तर पर कितना भरोसा करना चाहिए, उन अनुमानों की "अव्यवस्था" का उपयोग करें।

ऐसा करके, AI अधिक विश्वसनीय हो जाता है और उसकी गलतियों को पहचानना आसान हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →