← नवीनतम पेपर
🤖 AI

Forecasting Future Behavior as a Learning Task

यह शोध पत्र तर्कसंगत प्रक्षेप पथों (reasoning trajectories) से भविष्य के एआई मॉडल परिणामों की सीधे भविष्यवाणी करने के लिए विशिष्ट "व्यवहार पूर्वानुमानकर्ताओं" (Behavior Forecasters) को प्रशिक्षित करने का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण पारंपरिक, अक्सर अविश्वसनीय स्पष्टीकरणों की आवश्यकता को दरकिनार करते हुए सटीकता और दक्षता में उन्नत भाषा मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Mosh Levy, Yoav Goldberg, Asa Cooper Stickland

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mosh Levy, Yoav Goldberg, Asa Cooper Stickland

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र (paper) का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

मुख्य विचार: मन को पढ़े बिना भविष्य का अनुमान लगाना

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, लेकिन थोड़ा रहस्यमयी, रोबोट मित्र है (जिसे लार्ज रीजनिंग मॉडल या LRM कहा जाता है)। आप उससे एक सवाल पूछते हैं, और वह आपको जवाब देने से पहले काफी देर तक ज़ोर-ज़ोर से सोचता है।

आमतौर पर, इस रोबोट पर भरोसा करने के लिए, हम इसकी सोचने की प्रक्रिया को पढ़ने की कोशिश करते हैं ताकि समझ सकें कि इसने वह उत्तर क्यों दिया। हम यह मान लेते हैं कि अगर रोबोट कहता है, "मैंने 2 और 2 को जोड़ा क्योंकि 2+2=4 होता है," तो इसने वास्तव में वही गणित किया है।

समस्या: लेखकों ने पाया कि इन उन्नत रोबोटों के लिए, उनके विचारों को पढ़ना अक्सर एक जाल है।

  • रोबोट अपने "सोचने वाले" टेक्स्ट में कुछ और कह सकता है, लेकिन असल में उसके "दिमाग" में कुछ और चल रहा हो सकता है।
  • वह उन महत्वपूर्ण सुरागों को नज़रअंदाज़ कर सकता है जिन्होंने उसके उत्तर को प्रभावित किया था।
  • वह एक ऐसी कहानी लिख सकता है जो सुनने में तार्किक लगे, लेकिन वह उस वास्तविक गणित से मेल नहीं खाती जो उसने वास्तव में किया है।

इसलिए, यदि आप केवल उसके पिछले विचारों को पढ़कर यह अनुमान लगाने की कोशिश करते हैं कि रोबोट भविष्य में कैसा व्यवहार करेगा, तो आप गलत हो सकते हैं। यह एक जादूगर के अगले करतब का अनुमान लगाने की तरह है, जहाँ आप केवल उस स्क्रिप्ट को पढ़ रहे हैं जो उसने दर्शकों के लिए लिखी है, जबकि पर्दे के पीछे की गई उसकी गुप्त चालों को अनदेखा कर रहे हैं।

समाधान: "व्यवहार पूर्वानुमानकर्ता" (The Behavior Forecaster)

रोबोट के मन को पढ़ने की कोशिश करने के बजाय (जो कि अविश्वसनीय है), लेखकों ने एक विशेषज्ञ जासूस बनाया है जिसे "बिहेवियर फोरकास्टर" (Behavior Forecaster) कहा जाता है।

इसे इस तरह समझें:

  1. पुराना तरीका (Naive Reading): आप एक मानव जासूस को काम पर रखते हैं जो रोबोट के सोचने वाले टेक्स्ट को पढ़ता है और अनुमान लगाता है, "हम्म, ऐसा लग रहा है कि यह वही उत्तर दोहराएगा।" यह धीमा, महंगा और अक्सर गलत होता है क्योंकि जासूस को रोबट की गुप्त आदतों का पता नहीं होता।
  2. नया तरीका (Behavior Forecaster): आप एक छोटा, सुपर-फास्ट कंप्यूटर प्रोग्राम प्रशिक्षित करते हैं जो रोबोट के सोचने वाले टेक्स्ट को देखता है और कहता है, "इस टेक्स्ट के पैटर्न के आधार पर, 90% संभावना है कि यह रोबोट फिर से वही उत्तर देगा।"

यह नया जासूस इस बात की परवाह नहीं करता कि टेक्स्ट इंसान के लिए तार्किक है या नहीं। इसे बस इस बात से मतलब है कि वह टेक्स्ट वैसा ही दिखता है जैसा कि रोबोट आमतौर पर तब लिखता है जब वह कोई उत्तर दोहराने वाला होता है। यह कहानी को समझने के बजाय रोबोट के गुप्त "फिंगरप्रिंट" (पहचान) को सीखता है।

उन्होंने जासूस को कैसे प्रशिक्षित किया

आप इस जासूस को इंसानों से डेटा लेबल करवाकर नहीं सिखा सकते (इसमें बहुत समय लगेगा)। इसके बजाय, उन्होंने एक चतुर तकनीक का उपयोग किया:

  1. प्रयोगशाला का प्रयोग: उन्होंने रोबोट से एक ही सवाल 10 बार पूछा।
    • परिदृश्य A: रोबोट ने 9 बार एक ही उत्तर दिया। (लेबल: "बहुत स्थिर" या Very Stable)
    • परिदृश्य B: रोबोट ने 5 बार अलग-अलग उत्तर दिए। (लेबल: "अस्थिर" या Unstable)
  2. पाठ: उन्होंने जासूस को रोबोट द्वारा लिखा गया पहला सोचने वाला टेक्स्ट दिखाया, और उसे 10 प्रयोगों का परिणाम बताया।
  3. परिणाम: जासूस ने टेक्स्ट में उन छिपे हुए संकेतों को पहचानना सीख लिया जिन्हें इंसान मिस कर देते हैं। उसने सीखा, "ओह, जब रोबोट शब्दों का यह विशिष्ट पैटर्न लिखता है, तो इसका मतलब है कि वह सुसंगत (consistent) होने वाला है।"

उन्होंने क्या परीक्षण किया

उन्होंने इस जासूस का दो विशिष्ट प्रश्नों पर परीक्षण किया:

  1. "दोहराव" परीक्षण (The "Repeat" Test): यदि हम रोबोट से वही सवाल फिर से पूछें, तो क्या वह बिल्कुल वही उत्तर देगा?
    • उदाहरण: यदि आप आज एक मौसम पूर्वानुमानकर्ता से पूछते हैं "क्या बारिश होगी?" और वह कहता है "हाँ," तो क्या वह फिर से "हाँ" कहेगा यदि आप उससे 10 मिनट बाद पूछें?
  2. "क्या होगा अगर" परीक्षण (The "What If" Test): यदि हम प्रश्न का एक विशिष्ट हिस्सा (जैसे कोई सुराग या संकेत) हटा देते हैं, तो क्या रोबोट अपना उत्तर बदल देगा?
    • उदाहरण: यदि आप पहेली से "संकेत" हटा देते हैं, तो क्या रोबोट अभी भी उसे हल कर पाएगा, या वह भ्रमित हो जाएगा?

परिणाम: जासूस की जीत

लेखकों ने अपने छोटे, प्रशिक्षित जासूस की तुलना दुनिया के दो सबसे स्मार्ट और महंगे AI मॉडल्स (GPT-5.4 और Claude Opus 4.6) से की, जो "नाइव रीडर्स" (Naive Readers) के रूप में कार्य कर रहे थे।

  • सटीकता (Accuracy): प्रशिक्षित जासूस अधिक सटीक था। वह स्मार्ट इंसानों या अन्य AI मॉडल्स की तुलना में रोबोट के भविष्य के व्यवहार की बेहतर भविष्यवाणी कर सका, जो केवल टेक्स्ट को पढ़कर ऐसा कर सकते थे।
  • गति और लागत (Speed & Cost): जासूस को चलाना 10,000 गुना सस्ता और तेज़ था। स्मार्ट रीडर्स को समस्या को समझने के लिए भारी कंप्यूटिंग शक्ति की आवश्यकता थी; जासूस को बस एक त्वरित नज़र डालने की ज़रूरत थी।
  • रहस्य: मुख्य बात यह थी कि जासूस को उस विशिष्ट रोबोट के लिए प्रशिक्षित किया गया था जिसे वह देख रहा था। उसने उस रोबोट की अनूठी विचित्रताओं को सीखा, जबकि स्मार्ट रीडर्स केवल सामान्य अंग्रेजी नियमों के आधार पर अनुमान लगा रहे थे।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर यह निष्कर्ष निकालता है कि रीजनिंग टेक्स्ट केवल एक कहानी नहीं है। इसमें छिपे हुए डेटा पैटर्न होते हैं जो हमें बताते हैं कि मॉडल कैसा व्यवहार करेगा, भले ही कहानी स्वयं भ्रामक हो।

"व्यवहार की भविष्यवाणी" को एक सीखने के कार्य (एक मॉडल को इसे करने के लिए प्रशिक्षित करना) के रूप में देखने के बजाय, एक पढ़ने के कार्य (टेक्स्ट को समझने की कोशिश करना) के रूप में देखने से, हम AI सिस्टम पर भरोसा करने के लिए बेहतर, सस्ते और अधिक विश्वसनीय उपकरण बना सकते हैं।

संक्षेप में: रोबोट क्या करेगा यह जानने के लिए उसकी कहानी को समझने की कोशिश न करें। इसके बजाय, एक विशेषज्ञ को रोबोट के लिखने के पैटर्न (handwriting patterns) को पहचानने के लिए प्रशिक्षित करें, और उस विशेषज्ञ को भविष्य बताने दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →