← नवीनतम पेपर
💬 NLP

Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers

यह शोध पत्र इस धारणा को चुनौती देता है कि केवल उत्तर विकल्पों का उपयोग करके बहुविकल्पीय प्रश्नों पर बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की सफलता हमेशा एक सतही शॉर्टकट होती है, यह प्रदर्शित करते हुए कि टेस्ट-टाइम रीजनिंग अक्सर मामूली डेटा पूर्वाग्रहों पर निर्भर रहने के बजाय लुप्त प्रश्नों का अनुमान लगाने जैसी अधिक सुदृढ़ रणनीतियों के माध्यम से प्रदर्शन में सुधार करती है।

मूल लेखक: Nishant Balepur, Atrey Desai, Rachel Rudinger

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nishant Balepur, Atrey Desai, Rachel Rudinger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुविकल्पीय (multiple-choice) परीक्षा दे रहे हैं, लेकिन किसी ने प्रश्न को कागज से फाड़ दिया है। अब आपके पास केवल चार संभावित उत्तर बचे हैं (A, B, C, और D)।

अतीत में, शोधकर्ताओं का मानना था कि यदि कोई कंप्यूटर (एक लार्ज लैंग्वेज मॉडल या LLM) प्रश्न देखे बिना ही सही उत्तर का अनुमान लगा लेता है, तो वह "चीटिंग" कर रहा है। उन्होंने माना कि कंप्यूटर केवल मूर्खतापूर्ण पैटर्न पहचान रहा है, जैसे कि "उत्तर C में ही कॉमा (comma) है," या "उत्तर B सबसे लंबा शब्द है।" उन्हें लगा कि कंप्यूटर वास्तव में बुद्धिमान नहीं था; वह बस एक धोखेबाज था।

यह शोध पत्र कहता है: "ठहरिए। आइए कंप्यूटर के 'रफ वर्क' (scratch paper) को देखते हैं।"

लेखकों ने 12 अलग-अलग उन्नत AI मॉडलों को ऐसे कई "प्रश्न-विहीन" परीक्षण दिए। लेकिन इसमें एक मोड़ था: उन्होंने AI को उत्तर देने से पहले ज़ोर से सोचने (think out loud) के लिए कहा। उन्होंने मॉडलों को अपना तर्क चरण-दर-चरण लिखने के लिए मजबूर किया, ठीक वैसे ही जैसे एक छात्र गणित के टेस्ट पर अपना काम दिखाता है।

यहाँ उन्होंने जो पाया, उसे सरल भाषा में समझाया गया है:

1. "धोखेबाज" वास्तव में एक जासूस हो सकता है

जब AI ने केवल उत्तरों को देखा, तो वह सही उत्तर का अनुमान लगाने में आश्चर्यजनक रूप से कुशल था।

  • पुराना दृष्टिकोण: "यह केवल शब्द की लंबाई या अजीब फॉर्मेटिंग के आधार पर अनुमान लगा रहा है। यह एक चीटिंग है।"
  • नया दृष्टिकोण: AI के "रफ वर्क" (तर्क प्रक्रिया) ने दिखाया कि वह वास्तविक जासूसी कार्य कर रहा था।
    • "सबसे अलग को पहचानना" (The "Odd One Out" Strategy): कभी-कभी AI ने देखा कि तीन उत्तर "रसोई के सामान" के बारे में थे और एक "कार के इंजन" के बारे में था। प्रश्न देखे बिना भी, उसने अनुमान लगाया कि प्रश्न संभवतः रसोई के सामान के बारे में होगा, इसलिए उसने कार के इंजन वाले विकल्प को अलग (outlier) मानकर चुना।
    • "तथ्य की जाँच करना" (The "Fact Checker" Strategy): AI उत्तरों को पढ़ेगा और कहेगा, "रुको, मकड़ियाँ घास नहीं खातीं। वह उत्तर जैविक रूप से असंभव है। मैं इसे काट देता हूँ।"
    • "प्रश्न का पुनर्निर्माण करना" (The "Question Reconstructor" Strategy): AI उत्तरों को देखेगा और कहेगा, "ये सभी उत्तर नवीकरणीय ऊर्जा (renewable energy) के बारे में हैं। गायब प्रश्न संभवतः नवीकरणीय संसाधनों के बारे में पूछ रहा होगा।" फिर वह उस अनुमान के आधार पर समस्या को हल करेगा।

उपमा: कल्पना कीजिए कि आप एक कमरे में जाते हैं और चार लोगों को देखते हैं: तीन ने शेफ की टोपी पहनी है, और एक ने फायरफाइटर का हेलमेट पहना है। आपको नहीं पता कि वह कमरा किस काम के लिए है, लेकिन आप अनुमान लगाते हैं, "यह एक कुकिंग क्लास है, और वह फायरफाइटर यहाँ घुसपैठिया है।" आपको दरवाजे पर लगा साइन बोर्ड देखने की ज़रूरत नहीं पड़ी, फिर भी आपने एक स्मार्ट अनुमान लगाया। AI भी बिल्कुल ऐसा ही कर रहा था।

2. अधिक गहराई से सोचना हमेशा मदद नहीं करता (जब प्रश्न गायब हो)

शोधकर्ताओं ने AI को "अधिक गहराई से सोचने" के लिए प्रेरित करने की कोशिश की, उन्हें अधिक समय दिया और लंबे स्पष्टीकरण लिखने को कहा।

  • परिणाम: जब AI के पास पूरा प्रश्न था, तो अधिक गहराई से सोचने से वह बहुत अधिक बुद्धिमान हो गया।
  • ट्विस्ट: जब AI के पास केवल उत्तर थे (कोई प्रश्न नहीं), तो अधिक गहराई से सोचने से उसके स्कोर में बहुत कम सुधार हुआ।
  • क्यों? यह सुझाव देता है कि AI समस्या को सुलझाने के लिए "समय" के साथ संघर्ष नहीं कर रहा है; बल्कि वह विशिष्ट कौशलों (जैसे पैटर्न पहचानना और एलिमिनेशन) का उपयोग कर रहा है जो तुरंत काम करते हैं। यह कोई कमी नहीं है; यह पहेली को सुलझाने का एक अलग तरीका है।

3. सभी शॉर्टकट बुरे नहीं होते

यह शोध पत्र तर्क देता है कि हमें इन "प्रश्न-विहीन" परीक्षणों को पूरी तरह से खारिज नहीं कर देना चाहिए।

  • बुरे शॉर्टकट: यदि AI किसी उत्तर को केवल इसलिए चुनता है क्योंकि उसमें केवल वही एक संख्या वाला शब्द है, तो यह एक दोष है। तब टेस्ट खराब है।
  • अच्छे शॉर्टकट: यदि AI वास्तविक दुनिया के ज्ञान के आधार पर अन्य विकल्पों को तार्किक रूप से हटा देता है (जैसे, "जीव विज्ञान इस तरह काम नहीं करता"), तो यह वास्तव में एक कौशल है। यह दर्शाता है कि AI उन अवधारणाओं (concepts) को समझता है जो उत्तरों के पीछे छिपी हैं, भले ही उसके पास प्रॉम्प्ट न हो।

4. बड़ा सबक: टेस्ट को सुधारें, छात्र को दोष न दें

लेखक AI बेंचमार्क (वे टेस्ट जिनका उपयोग AI को ग्रेड देने के लिए किया जाता है) को देखने का एक नया तरीका प्रस्तावित करते हैं।

  • पहले: यदि एक AI ने प्रश्न देखे बिना प्रश्न को सही बताया, तो हम कहते थे, "टेस्ट खराब है" या "AI चीटिंग कर रहा है।"
  • अब: हमें AI के तर्क (reasoning) को देखना चाहिए।
    • यदि AI ने एक सतही ट्रिक का उपयोग किया (जैसे, "मैंने A चुना क्योंकि यह पहला अक्षर है"), तो हाँ, टेस्ट दोषपूर्ण है (शायद उत्तर बहुत अधिक स्पष्ट हैं)।
    • यदि AI ने गहरा तर्क दिया (जैसे, "मैंने B और C को हटा दिया क्योंकि वे एक-दूसरे का खंडन करते हैं"), तो AI वास्तव में बुद्धिमान है, और टेस्ट ठीक है।

अंतिम रूपक:
कल्पना कीजिए कि एक शिक्षक एक छात्र को बहुविकल्पीय टेस्ट देता है लेकिन गलती से प्रश्न के ऊपर टेप चिपका देता है।

  • यदि छात्र "A" इसलिए चुनता है क्योंकि वह पहला अक्षर है, तो छात्र केवल अनुमान लगा रहा है।
  • लेकिन यदि छात्र उत्तरों को देखता है, महसूस करता है कि तीन "सेबों" के बारे में हैं और एक "कारों" के बारे में है, और सही अनुमान लगाता है कि प्रश्न फलों के बारे में था, तो वह छात्र वास्तव में बहुत बुद्धिमान है।

यह शोध पत्र कहता है: केवल स्कोर को न देखें। तर्क (reasoning) को देखें। कभी-कभी, जो चीटिंग जैसा दिखता है, वह वास्तव में प्रभावशाली, लचीली बुद्धिमत्ता का प्रदर्शन होता है। और कभी-कभी, यह वास्तव में टेस्ट की ही एक खामी होती है। तर्क प्रक्रिया (reasoning trace) वह उपकरण है जो हमें इनके बीच अंतर करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →