← नवीनतम पेपर
🤖 AI

Teaching LLMs String Matching, Backtracking, and Error Recovery to Deduce Bases and Truth Tables for the Combinatorially Exploding Bit Manipulation Puzzles

यह शोध पत्र बिट मैनिपुलेशन पहेलियों को हल करने के लिए एक नवीन एल्गोरिद्मिक ढांचे को प्रस्तुत करता है जो पारंपरिक अंकगणितीय तर्क को स्ट्रिंग समानता, बैकट्रैकिंग DFS और त्रुटि रिकवरी तंत्रों से बदल देता है, जिससे 96% सत्यापन सटीकता और NVIDIA Nemotron Model Reasoning Challenge में समग्र रूप से 7वां स्थान प्राप्त हुआ है।

मूल लेखक: Prateek Agnihotri, Sanchit Jain, Prabhat Agnihotri, Aditya Prasad, Shubham Jain

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Prateek Agnihotri, Sanchit Jain, Prabhat Agnihotri, Aditya Prasad, Shubham Jain

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य को सुलझाने की कोशिश कर रहे हैं जहाँ एक गुप्त मशीन आठ लाइट स्विचों की एक स्ट्रिंग (जैसे 10100011) को एक नए पैटर्न (जैसे 11011001) में बदल देती है। आपका काम उस गुप्त नियम का पता लगाना है जिसका उपयोग मशीन करती है ताकि आप स्विचों की एक नई, अनदेखी स्ट्रिंग के साथ उसके व्यवहार की भविष्यवाणी कर सकें।

यह "बिट मैनिपुलेशन पज़ल" (Bit Manipulation Puzzle) है, जो NVIDIA Nemotron चैलेंज से लिया गया है। यह पेपर बताता है कि कैसे शोधकर्ताओं की एक टीम ने एक लार्ज लैंग्वेज मॉडल (LLM) को—जो आमतौर पर कहानियाँ लिखने में माहिर होता है लेकिन गणित में बहुत खराब होता है—इस विशिष्ट पहेली को बिना भ्रमित हुए हल करने के लिए प्रशिक्षित किया।

उन्होंने इसे इस प्रकार किया, जिसे सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: AI की "मानसिक गणित" (Mental Math) की विफलता

सामान्य रूप से, यदि आप किसी AI से इसे हल करने के लिए कहते हैं, तो वह जटिल मानसिक गणित करने की कोशिश करता है। वह अपने दिमाग में नंबरों को खिसकाने, उन्हें जोड़ने या लॉजिक गेट्स (जैसे "AND" या "OR") का उपयोग करने की कल्पना करता है।

  • उपमा: कल्पना कीजिए कि आप किसी व्यक्ति को एक भूलभुलैया (maze) को हल करने के लिए कह रहे हैं और वह अपने दिमाग में एक ही समय में हर संभव रास्ते की सटीक दूरी की गणना करने की कोशिश कर रहा है। वह अभिभूत हो जाएगा, बेतहाशा अनुमान लगाने लगेगा, और अंततः गलत उत्तर (एक "hallucination") देगा।
  • वास्तविकता: संभावित नियमोंों की संख्या इतनी विशाल है (केवल एक साधारण नियम के लिए 330,000 से अधिक संयोजन) कि AI "ब्रूट फोर्स" (brute force) के जरिए गणित नहीं कर सकता। वह खो जाता है।

2. समाधान: गणित को "स्ट्रिंग मैचिंग" गेम में बदलना

टीम ने महसूस किया कि उन्हें AI को गणित करने की आवश्यकता नहीं है। इसके बजाय, उन्होंने इस समस्या को एक पैटर्न मैचिंग के खेल में बदल दिया, जैसे कि कोई जासूस उंगलियों के निशान (fingerprints) की तुलना कर रहा हो।

स्टेप A: "22 टॉर्च" (Bases)

पूरी 8-बिट स्ट्रिंग को देखने के बजाय, उन्होंने इसे विभाजित किया। उन्होंने कल्पना की कि 22 अलग-अलग "टॉर्च" (जिन्हें Bases कहा जाता है) इनपुट स्ट्रिंग पर रोशनी डाल सकती हैं।

  • कुछ टॉर्च ठीक उसी जगह देखती हैं जहाँ आप हैं।
  • कुछ 1 स्थान बाईं ओर देखती हैं (Right Shift)।
  • कुछ 1 स्थान दाईं ओर देखती हैं (Left Shift)।
  • कुछ किनारों से घूमकर आती हैं (Circular Shift)।
  • शिफ्ट: "गणित का सूत्र क्या है?" पूछने के बजाय, उन्होंने पूछा, "इन 22 टॉर्चों में से कौन सी टॉर्च वास्तव में प्रकाश चालू या बंद करने के लिए जिम्मेदार है?" इसने एक जटिल गणितीय समस्या को एक सरल "सही उपकरण चुनने" की समस्या में बदल दिया।

स्टेप B: "ट्रुथ टेबल" (The Cheat Sheet)

एक बार जब उन्हें पता चल गया कि कौन सी टॉर्च महत्वपूर्ण हैं, तो उन्हें उन्हें जोड़ने वाले जटिल समीकरण को समझने की आवश्यकता नहीं थी। उन्होंने बस एक चीट शीट (Truth Table) बनाई।

  • उपमा: भौतिकी (physics) का यह निष्कर्ष निकालने के बजाय कि गेंद क्यों गिरती है, आप बस लिख देते हैं: "यदि मैं गेंद गिराता हूँ, तो वह गिरती है। यदि मैं उसे ऊपर फेंकता हूँ, तो वह नीचे आती है।" आप परिणाम देखते हैं और उसे लिख लेते हैं। AI बस उदाहरणों को देखता है, देखता है कि कौन सी टॉर्च चालू थी, और परिणाम लिख देता है। किसी जटिल बीजगणित (algebra) की आवश्यकता नहीं है।

स्टेप C: "जासूस के सुराग" (Minimal Bitflips)

यह पता लगाने के लिए कि कौन सी टॉर्च "असली" थीं, टीम ने Minimal Bitflips नामक एक चतुर तकनीक का उपयोग किया।

  • उपमा: कल्पना कीजिए कि आपके पास दो लगभग एक जैसी रेसिपी हैं, लेकिन एक केक बनाती है और दूसरी सूप। यदि दोनों रेसिपी के बीच का एकमात्र अंतर यह है कि एक में नमक इस्तेमाल हुआ और दूसरे में नहीं, तो आप निश्चित रूप से जानते हैं कि नमक ही वह गुप्त सामग्री है।
  • AI ने उदाहरणों की तुलना की। यदि दो इनपुट लगभग समान थे लेकिन उनके आउटपुट अलग थे, तो AI ने देखा कि ठीक कौन सी "टॉर्च" बदली थी। वह बदलाव ही सुराग था।

3. "बैकट्रैकिंग" (अपनी बात बदलने की सीख)

सबसे कठिन काम AI के लिए यह स्वीकार करना है कि वह गलत है। यदि AI एक नियम का अनुमान लगाता है और वह विफल हो जाता है, तो वह आमतौर पर गलत रास्ते पर ही चलता रहता है।

  • नवाचार: टीम ने AI को एक भूलभुलैया वाले खेल खेलने वाले इंसान की तरह व्यवहार करना सिखाया। यदि वह किसी डेड एंड (collision - जहाँ नियम फिट नहीं बैठता) से टकराता है, तो वह कहता है, "ओह, यह काम नहीं किया," और एक अलग रास्ता आज़माने के लिए बैकट्रैक (backtrack) करता है।
  • प्रशिक्षण ट्रिक (Dynamic Masking): आमतौर पर, AI को यह सिखाने के लिए बहुत महंगे और धीमे प्रशिक्षण की आवश्यकता होती है। टीम ने "डायनेमिक मास्किंग" नामक एक स्मार्ट ट्रिक का उपयोग किया।
    • उपमा: कल्पना कीजिए कि एक शिक्षक (AI) उत्तर का अनुमान लगा रहा है, और एक रेफरी (एक बाहरी कंप्यूटर) तुरंत फुसफुसाकर कहता है, "गलत, फिर से कोशिश करो," बिना शिक्षक को खुद रेफरी का उत्तर कैलकुलेट किए।
    • AI ने इस "फुसफुसाहट" को सुनना, अपनी गलती को समझना और एक नया अनुमान लगाना सीखा। इसने AI को एक "System 2" विचारक (धीमा, सावधानीपूर्वक, तार्किक) बनने के लिए प्रशिक्षित किया, न कि "System 1" विचारक (तेज, सहज, त्रुटिपूर्ण) बनने के लिए।

4. टोकन की समस्या: एक बार में एक अक्षर पढ़ना

मानक AI टेक्स्ट को टुकड़ों (chunks) में पढ़ता है (जैसे "1010" को एक शब्द के रूप में पढ़ना)। यह बिट पहेलियों के लिए बुरा है क्योंकि यह स्थानिक व्यवस्था (spatial arrangement) को बिगाड़ देता है।

  • समाधान: टीम ने AI को मजबूर किया कि वह प्रत्येक 0 और 1 को एक अलग टोकन के रूप में पढ़े।
  • उपमा: "CAT" जैसे शब्द को एक इकाई के रूप में पढ़ने के बजाय, AI को "C", फिर "A", फिर "T" को व्यक्तिगत रूप से पढ़ने के लिए मजबूर किया गया। इसने यह सुनिश्चित किया कि AI यह न भूल जाए कि कौन सा बिट कहाँ स्थित है।

परिणाम

इन ट्रिक्स को मिलाकर:

  1. गणित की समस्या को स्ट्रिंग-मैचिंग गेम के रूप में पुनर्गठित (Reframing) करना।
  2. AI को डेड एंड मिलने पर बैकट्रैक (backtrack) करना सिखाना।
  3. उसे एक-एक करके बिट्स को पढ़ने के लिए मजबूर करना।

टीम के AI ने इन पहेलियों पर 96% से अधिक सटीकता प्राप्त की: यह इस विशिष्ट श्रेणी में सभी टीमों में से उच्चतम स्कोर था, जिससे उन्हें प्रतियोगिता में कुल 7वां स्थान प्राप्त करने में मदद मिली।

संक्षेप में: उन्होंने AI को एक गणितज्ञ बनने के बजाय एक सावधान जासूस बनने के लिए प्रशिक्षित किया जो अपने सुरागों की जांच करता है, अपनी गलती स्वीकार करता है, और तब तक फिर से प्रयास करता है जब तक कि उसे सही पैटर्न न मिल जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →