← नवीनतम पेपर
💬 NLP

Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

यह शोधपत्र एक प्रशिक्षण-मुक्त विधि प्रस्तावित करता है जो रिकवरेबल (recoverable) और स्ट्रक्चरल (structural) विफलताओं के बीच अंतर करने के लिए विफल तर्क ट्रेसेस (reasoning traces) के वितरण संबंधी हस्ताक्षरों का विश्लेषण करती है, जिससे एक ऐसा रूटिंग नियम सक्षम होता है जो मॉडल वेट्स (model weights) तक पहुंच की आवश्यकता के बिना कठिन समस्याओं के लिए रेस्क्यू दरों में महत्वपूर्ण सुधार करता है।

मूल लेखक: Nizar Islah, Istabrak Abbes, Irina Rish, Sarath Chandar, Eilif B. Muller

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nizar Islah, Istabrak Abbes, Irina Rish, Sarath Chandar, Eilif B. Muller

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कठिन पहेली को हल करने की कोशिश कर रहे हैं, लेकिन आपका AI सहायक बार-बार अटक जाता है। आमतौर पर, जब कोई AI विफल होता है, तो मानक समाधान बस यह कहना होता है, "फिर से कोशिश करो!" और उम्मीद करना कि इस बार वह भाग्यशाली होगा। आप उससे 10, 50, या यहाँ तक कि 100 बार कोशिश करने के लिए कह सकते हैं।

यह शोध पत्र तर्क देता है कि अंधाधुंध तरीके से बार-बार प्रयास करना समय और धन की बर्बादी है।

इसके बजाय, लेखक सुझाव देते हैं कि जब एक AI विफल होता है, तो उसके विफल होने का तरीका अपने आप में एक गुप्त मानचित्र (map) होता है। विफल प्रयास के "पदचिह्नों" (footprints) को देखकर (विशेष रूप से शब्दों के पीछे की गणितीय संभावनाओं को, न कि स्वयं शब्दों को), हम निदान कर सकते हैं कि वह क्यों विफल हुआ और इसे ठीक करने के लिए सटीक सही उपकरण का चुनाव कर सकते हैं, बजाय इसके कि केवल बेहतर परिणाम की उम्मीद में पासा फेंका जाए।

यहाँ उनके विचार का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "पासा फेंकने" की रणनीति

वर्तमान में, जब एक AI किसी तर्क कार्य (जैसे गणित की समस्या या कोडिंग चुनौती) में विफल होता है, तो सामान्य समाधान टेस्ट-टाइम स्केलिंग (Test-Time Scaling) है। इसका अर्थ है अधिक प्रयास उत्पन्न करने के लिए अधिक कंप्यूटर शक्ति खर्च करना।

  • उपमा: कल्पना कीजिए कि आप एक बंद दरवाजे को खोलने की कोशिश कर रहे हैं। यदि चाबी काम नहीं करती है, तो आप बस उसे 50 बार और हिलाकर देखते हैं। कभी-कभी, आप भाग्यशाली होते हैं और वह खुल जाता है। लेकिन अक्सर, ताला जाम होता है, या चाबी का आकार गलत होता है, और चाबी को कितनी भी बार हिलाने से वह कभी नहीं खुलेगा।
  • पेपर का दावा: अधिकांश विफलताएं केवल "दुर्भाग्यपूर्ण रोल" नहीं हैं। कुछ संरचनात्मक बाधाएं (structural jams) हैं जिनके लिए पूरी तरह से एक अलग उपकरण की आवश्यकता होती है।

2. निदान: "पदचिह्नों" को पढ़ना

लेखक प्रस्तावित करते हैं कि एक विफल प्रयास अपने पीछे एक अनूठा "हस्ताक्षर" या "पदचिह्न" छोड़ जाता है। वे यह देखने के लिए टेक्स्ट नहीं पढ़ते कि क्या गलत हुआ; वे AI के विकल्पों की गणितीय संभावना (mathematical probability) को देखते हैं।

उन्होंने इन पदचिह्नों में तीन विशिष्ट "महत्वपूर्ण संकेतों" (vital signs) की पहचान की:

  1. भ्रम कितना व्यापक है? (क्या AI हर जगह भ्रमित है, या केवल एक विशिष्ट चरण पर?)
  2. गलती कितनी केंद्रित है? (क्या इसने एक बड़ी, तीखी गलती की, या यह एक बिखरा हुआ ढेर है?)
  3. AI कितना "अटका हुआ" है? (क्या AI अपने गलत उत्तर के प्रति इतना आश्वस्त है कि उसे बदला नहीं जा सकता, या वह डगमगा रहा है?)

3. समाधान: "स्मार्ट राउटर"

केवल पुन: प्रयास करने के बजाय, यह पेपर एक राउटर (Router) पेश करता है। इस राउटर को एक मैकेनिक के रूप में सोचें जो कार के डैशबोर्ड लाइट्स (पदचिह्नों) को देखता है और तय करता है कि कौन सा उपकरण उपयोग करना है।

इन तीन महत्वपूर्ण संकेतों के आधार पर, राउटर तीन विशिष्ट सुधारों में से एक चुनता है:

  • यदि AI हर जगह भ्रमित है (Distributed Deformation): राउटर एक "सघन" (dense) सुधार लागू करता है, जो पूरे वाक्य में AI की सोच को धीरे से दिशा देता है।
  • यदि AI ने एक तीखी, विशिष्ट गलती की है (Rank Misrouting): राउटर एक "विरल" (sparse) सुधार लागू करता है, जो उस विशिष्ट क्षण पर एक छोटा सा सुधार इंजेक्ट करता है ताकि AI के तर्क को बदला जा सके।
  • यदि AI बहुत आश्वस्त और अटका हुआ है (Entropy Brittle): राउटर एक "तापमान" (temperature) सुधार लागू करता है, जो अनिवार्य रूप से AI को कहता है, "शांत हो जाओ, थोड़ा अधिक स्वतंत्र रूप से सोचो," ताकि वह अपने कठोर, गलत पथ से बाहर निकल सके।

4. परिणाम: कठिन नहीं, बल्कि स्मार्ट

इस पेपर का परीक्षण कई AI मॉडलों और कठिन कार्यों (जैसे कोडिंग और विज्ञान के प्रश्न) पर किया गया।

  • "पुनः प्रयास" (Retry) रणनीति: एक निश्चित सफलता दर प्राप्त करने के लिए, आपको एक ही चीज़ को बार-बार करने के लिए 50 यूनिट कंप्यूटर शक्ति खर्च करनी पड़ सकती है।
  • "राउटर" रणनीति: विफलता का निदान करने और सही उपकरण चुनने के माध्यम से, राउटर ने केवल लगभग 1.5 यूनिट शक्ति का उपयोग करके समान सफलता दर प्राप्त की।

वास्तव में, सबसे कठिन समस्याओं के लिए जहाँ "पुनः प्रयास करना" काम नहीं करता, इस पद्धति ने बिना अतिरिक्त प्रशिक्षण या AI के मस्तिष्क को बदले 12% अधिक समस्याओं को सफलतापूर्वक हल किया।

5. "ऑडिट" बोनस

एक दूसरा दिलचस्प खोज भी है। लेखकों ने पाया कि विफलता के पदचिह्नों का प्रकार आपको बताता है कि AI को कैसे प्रशिक्षित किया गया था।

  • उपमा: यदि आप कीचड़ भरे रास्ते पर टायर के निशान देखते हैं, तो आप बता सकते हैं कि कार को एक सावधान चालक द्वारा चलाया गया था या एक लापरवाह चालक द्वारा, भले ही आपने कभी चालक को न देखा हो।
  • निष्कर्ष: वे विफल प्रयासों को देखकर सटीक रूप से अनुमान लगा सकते थे कि AI को "सुपरवाइज्ड फाइन-ट्यूनिंग" (जैसे एक छात्र जो पाठ्यपुस्तक रटता है) का उपयोग करके प्रशिक्षित किया गया था या "रीइन्फोर्समेंट लर्निंग" (जैसे एक छात्र जो परीक्षण और त्रुटि से सीखता है) का उपयोग करके। यह हमें केवल AI की विफलता को देखकर उसके प्रशिक्षण इतिहास का "ऑडिट" करने की अनुमति देता है।

सारांश

पेपर कहता है: अनुमान लगाना बंद करें। जब एक AI विफल होता है, तो उस पर अधिक कंप्यूटिंग शक्ति न लगाएं। विफलता के आकार को देखें। वह आकार आपको बताता है कि ताला खोलने के लिए कौन सी "चाबी" का उपयोग करना है। यह अत्यधिक मात्रा में पैसा और ऊर्जा बचाते हुए उन समस्याओं को हल करता है जिन्हें पहले ठीक करना असंभव था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →