← नवीनतम पेपर
🤖 machine learning

Conformal Thinking: Risk Control for Reasoning on a Compute Budget

यह शोध पत्र तर्क करने वाले (reasoning) LLMs के लिए एक वितरण-मुक्त (distribution-free) जोखिम नियंत्रण ढांचे का प्रस्ताव करता है जो उपयोगकर्ता द्वारा निर्दिष्ट त्रुटि दर का कड़ाई से पालन करते हुए कंप्यूट लागत को कम करने के लिए नवीन ऊपरी और निचली सीमाओं का उपयोग करके अनुकूलित एडेप्टिव टोकन बजट निर्धारित करता है।

मूल लेखक: Xi Wang, Anushri Suresh, Alvin Zhang, Rishi More, William Jurayj, Benjamin Van Durme, Mehrdad Farajtabar, Daniel Khashabi, Eric Nalisnick

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xi Wang, Anushri Suresh, Alvin Zhang, Rishi More, William Jurayj, Benjamin Van Durme, Mehrdad Farajtabar, Daniel Khashabi, Eric Nalisnick

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रहस्यों को सुलझाने के लिए एक प्रतिभाशाली लेकिन महंगे जासूस को काम पर रख रहे हैं। कुछ रहस्य आसान हैं जिन्हें पाँच मिनट में सुलझाया जा सकता है; कुछ इतने जटिल हैं कि पाँच घंटे सोचने के बाद भी, जासूस उसमें फंसा रहता है।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, ये "जासूस" तर्क संबंधी समस्याओं (reasoning problems) को हल करने वाले लार्ज लैंग्वेज मॉडल्स (LLMs) हैं। उन्हें काम पर रखने की "लागत" टोकन्स (टेक्स्ट के टुकड़े जो वे जनरेट करते हैं) में मापी जाती है। वे जितना अधिक सोचते हैं, उतनी ही अधिक लागत आती है।

समस्या यह है कि ये AI जासूस अक्सर ज़रूरत से ज़्यादा सोचने (overthinking) लगते हैं। वे एक आसान पहेली को 10 सेकंड में सुलझा सकते हैं, लेकिन केवल सुनिश्चित होने के लिए वे अगले 10 मिनट तक बिना रुके बोलते रह सकते हैं। इसके विपरीत, यदि कोई पहेली असंभव है, तो वे पूरे समय सीमा के दौरान अपने पहिए घुमाते रह सकते हैं, जिससे संसाधनों की बर्बादी होती है।

यह पेपर, जिसका शीर्षक "कॉन्फॉर्मल थिंकिंग" (Conformal Thinking) है, यह प्रस्तावित करता है कि AI को कब सोचना बंद करना है, यह बताने का एक नया तरीका। यह एक सख्त मैनेजर की तरह है जो दो विशिष्ट नियमों का पालन करता है, जिससे यह सुनिश्चित होता है कि आपको कम से कम खर्च में सबसे अच्छा उत्तर मिले, और यह भी गारंटी मिलती है कि आप बहुत अधिक गलत उत्तर न दें।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. पुराना तरीका: "आत्मविश्वास" का नियम

पहले, शोधकर्ता AI को तब रोकने की कोशिश करते थे जब वह "आत्मविश्वास" महसूस करता था।

  • उपमा: कल्पना कीजिए कि जासूस कहता है, "मुझे 90% यकीन है कि यही जवाब है!" मैनेजर घड़ी रोक देता है।
  • दोष: यह केवल आसान या हल करने योग्य मामलों के लिए काम करता है। यदि मामला असंभव है, तो जासूस कभी भी 90% आत्मविश्वास तक नहीं पहुँच पाएगा। वे तब तक सोचते रहेंगे जब तक कि मैनेजर का समय (या पैसा) खत्म न हो जाए, जिससे एक हताश प्रयास पर संसाधनों की बर्बादी होगी। साथ ही, उस "90%" नंबर को सेट करना मुश्किल है; यदि यह बहुत अधिक है, तो समय बर्बाद होता है; यदि बहुत कम है, तो गलत उत्तर मिलते हैं।

2. नया तरीका: "दो-थ्रेशोल्ड" वाला मैनेजर

लेखक एक स्मार्ट मैनेजर पेश करते हैं जो केवल एक नहीं, बल्कि दो स्टॉप साइन (रोकने के संकेत) का उपयोग करता है। वे इसे रिस्क कंट्रोल (Risk Control) कहते हैं।

अपर थ्रेशोल्ड (ऊपरी सीमा - "मैं निश्चित हूँ" वाला स्टॉप)

यह पुराना नियम है। यदि जासूस का आत्मविश्वास पर्याप्त रूप से बढ़ जाता है (जैसे, 95%), तो तुरंत रुक जाएँ और उत्तर दें।

  • लक्ष्य: आसान समस्याओं पर जल्दी रुककर पैसे बचाना।

लोअर थ्रेशोल्ड (निचली सीमा - "हार मान लो" वाला स्टॉप)

यह नया और चतुर हिस्सा है। कल्पना कीजिए कि जासूस एक मामले पर काम कर रहा है, लेकिन उसका आत्मविश्वास बढ़ नहीं रहा है; बल्कि, यह घट रहा है या स्थिर है।

  • उपमा: मैनेजर कहता है, "आप एक घंटे से काम कर रहे हैं, और आप समाधान के करीब भी नहीं पहुँच रहे हैं। यदि आप जल्द ही प्रगति नहीं करते हैं, तो आप बजट बर्बाद कर रहे हैं। अभी रुक जाइए।"
  • लक्ष्य: असंभव समस्याओं पर नुकसान को जल्दी काटकर पैसे बचाना।

3. "रिस्क बजट" (सुरक्षा जाल)

इस पेपर का सबसे महत्वपूर्ण हिस्सा यह है कि वे इन दोनों स्टॉप साइन को कहाँ सेट करने का निर्णय कैसे लेते हैं।

अनुमान लगाने के बजाय (जैसे, "आइए 85% आत्मविश्वास पर रुकते हैं"), उपयोगकर्ता एक रिस्क बजट सेट करता है।

  • उपमा: आप मैनेजर को बताते हैं, "मैं यह स्वीकार करने को तैयार हूँ कि 5% बार, हम बहुत जल्दी रुक सकते हैं और गलत उत्तर दे सकते हैं। लेकिन मैं उस त्रुटि दर (error rate) को 5% से नीचे रखते हुए अधिक से अधिक पैसा बचाना चाहता हूँ।"
  • यह कैसे काम करता है: सिस्टम समस्याओं के एक अभ्यास सेट (वैलिडेशन सेट) को देखता है और गणितीय रूप से गणना करता है कि "कॉन्फिडेंस" स्टॉप और "गिव अप" स्टॉप को ठीक कहाँ रखना है ताकि त्रुटि दर आपकी 5% की सीमा के भीतर रहे। यह एक सांख्यिकीय सुरक्षा जाल (जिसे "डिस्ट्रीबशन-फ्री रिस्क कंट्रोल" कहा जाता है) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि भले ही परीक्षण वाली समस्याएँ अभ्यास वाली समस्याओं से थोड़ी अलग हों, त्रुटि दर अचानक बढ़ न जाए।

4. परिणाम: समझदारी भरा खर्च

इस पेपर का परीक्षण कठिन गणित और विज्ञान की समस्याओं पर किया गया। यहाँ उन्होंने क्या पाया:

  • "निराशाजनक" मामलों को सुलझाना: "लोअर थ्रेशोल्ड" (हार मान लो नियम) ने उन समस्याओं पर बहुत सारा पैसा बचाया जिन्हें AI हल नहीं कर सकता था। इसने AI को असंभव कार्यों पर समय बर्बाद करने से रोका।
  • "आसान" मामलों को सुलझाना: "अपर थ्रेशोल्ड" (आत्मविश्वास नियम) ने आसान कार्यों पर AI को ज़रूरत से ज़्यादा सोचने से रोककर पैसे बचाए।
  • कॉम्बो (संयोजन): दोनों नियमों का एक साथ उपयोग करना सबसे कुशल था। इसने AI को सही उत्तर पाने के लिए बस पर्याप्त समय खर्च करने की अनुमति दी, और उससे अधिक नहीं।

सारांश

कॉन्फॉर्मल थिंकिंग को AI की सोच के लिए एक स्मार्ट बजट मैनेजर के रूप में समझें।

  1. आप जोखिम सेट करते हैं: "मैं 5% त्रुटि दर सहन कर सकता हूँ।"
  2. सिस्टम नियम सेट करता है: यह स्वचालित रूप से गणना करता है कि कब कहना है "बहुत बढ़िया, रुक जाओ!" और कब कहना है "यह काम नहीं कर रहा है, रुक जाओ!"
  3. परिणाम: आपको उत्तरों की समान गुणवत्ता मिलती है, लेकिन आप काफी कम पैसा (कंप्यूट) खर्च करते हैं क्योंकि AI दोनों तरह की समस्याओं—आसान और असंभव—पर समय बर्बाद करना बंद कर देता है।

यह पेपर दावा करता है कि यह तरीका विभिन्न प्रकार के AI मॉडल्स और कठिन कार्यों (जैसे गणित और विज्ञान) पर काम करता है, जिससे यह सुनिश्चित होता है कि AI अपनी सुरक्षा गारंटी को बनाए रखते हुए कुशल बना रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →