Teaching Language Models to Think in Code
यह शोध पत्र ThinC को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो भाषा मॉडल की तर्क प्रक्रिया को प्राकृतिक भाषा और कोड के अंतर्संबंधित स्वरूप से बदलकर एक कोड-केंद्रित प्रतिमान में स्थानांतरित कर देता है जहाँ कोड स्वयं प्राथमिक तर्ककर्ता के रूप में कार्य करता है, जो कोड प्रक्षेप पथों (trajectories) को आसवित (distill) करके और सुपरवाइज्ड फाइन-ट्यूनिंग के बाद सुदृढीकरण लर्निंग (reinforcement learning) का उपयोग करके प्रतियोगिता-स्तर के गणितीय बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही कठिन गणितीय पहेली को हल करने की कोशिश कर रहे हैं। आपके पास इसे करने के दो तरीके हैं:
पुराना तरीका (इंटरलीव्ड रीजनिंग - Interleaved Reasoning): आप अंग्रेजी में खुद से बात करते हुए चरणों को समझते हैं। "ठीक है, पहले मुझे 500 को 0.12 से गुणा करना होगा..." फिर, आप थोड़े अनिश्चित हो जाते हैं, इसलिए आप अपने काम की जांच करने के लिए एक कैलकुलेटर (कोड टूल) से पूछते हैं। लेकिन यहाँ एक पेच है: यदि आपने अपनी अंग्रेजी सोच में कोई गलती की है (जैसे यह कहना कि 500 का 0.12, 50 होता है न कि 60), तो आप गलती से वह गलत संख्या कैलकुलेटर में टाइप कर सकते हैं। कैलकुलेटर वही करता है जो आप उसे बताते हैं; उसे आपकी गलती का पता नहीं चलता। वह गलत संख्या के साथ गणना करता है, और आपको गलत उत्तर मिलता है।
नया तरीका (THINC): आप एक रणनीति बनाने के लिए अंग्रेजी में एक छोटा सा क्षण लेते हैं ("मुझे इस आकृति का क्षेत्रफल ज्ञात करना है"), और फिर आप तुरंत पूरा काम एक रोबोट प्रोग्रामर को सौंप देते हैं। रोबोट कोड लिखता है, उसे चलाता है, परिणाम देखता है, और उस परिणाम के आधार पर अगला कोड लिखता है, और तब तक जारी रखता है जब तक कि उत्तर बाहर न आ जाए। आप अपने दिमाग में या अंग्रेजी वाक्यों में कोई गणित नहीं करते हैं; रोबोट सारा भारी काम करता है।
यह पेपर THINC (थिंकिंग इन कोड) पेश करता है, जो AI मॉडल को गणित की समस्याओं को हल करने का एक नया तरीका सिखाने का एक तरीका है, जिससे कोड स्वयं सोचने वाला (thinker) बन जाता है, न कि केवल एक उपकरण जिसे AI अपने काम की जांच करने के लिए उपयोग करता है।
पुराने तरीके के साथ समस्या
लेखकों का कहना है कि वर्तमान AI मॉडल जो अंग्रेजी सोच और कोड को मिलाते हैं (जिन्हें "टूल-इंटीग्रेटेड रीजनिंग" कहा जाता है), उनमें तीन मुख्य खामियां हैं, जिन्हें वे "स्ट्रक्चरल लिमिटेशन्स" (संरचनात्मक सीमाएं) कहते हैं:
- "पोस्ट-हॉक" वेरीफायर (Post-Hoc Verifier): AI अक्सर पहले अंग्रेजी में पूरा समाधान लिख देता है, फिर केवल यह कहने के लिए कोड चलाता है, "हाँ, यह सही है।" कोड वास्तव में सोच नहीं रहा है; यह केवल अंत में एक मुहर लगाने जैसा है।
- "साइलेंट एरर" (Silent Error): यदि AI अपनी अंग्रेजी सोच में गणितीय गलती करता है (जैसे 500 का 12% 60 के बजाय 50 बताना), तो वह उस गलत संख्या को कोड में कॉपी कर सकता है। कोड फिर उस गलत संख्या के साथ गणना करता है, और AI को कभी पता नहीं चलता। त्रुटि "साइलेंट" होती है क्योंकि कोड केवल आदेशों का पालन करता है।
- "डबल वर्क" (Double Work): AI अक्सर इस बात की लंबी अंग्रेजी व्याख्या लिखता है कि समस्या को कैसे हल किया जाए, और फिर ऐसा कोड लिखता है जो ठीक वही काम करता है। यह एक रेसिपी को अंग्रेजी में लिखने और फिर यह साबित करने के लिए कि आप खाना बनाना जानते हैं, उसी रेसिपी को फ्रेंच में लिखने जैसा है। यह अनावश्यक और भ्रमित करने वाला है।
THINC समाधान
THINC खेल के नियम बदल देता है। इसके बजाय कि AI गणित के बारे में बात करे, AI गणित में बात करता है (कोड के माध्यम से)।
- योजना (The Plan): AI रणनीति निर्धारित करने के लिए एक छोटा अंग्रेजी वाक्य से शुरू करता है (जैसे, "मैं उत्तर खोजने के लिए संख्याओं को लूप करूँगा")।
- काम (The Work): उस एक वाक्य के बाद, सब कुछ कोड ब्लॉक्स में होता है। AI कोड का एक हिस्सा लिखता है, उसे चलाता है, उसका आउटपुट देखता है, और फिर उस आउटपुट के आधार पर कोड का अगला हिस्सा लिखता है।
- परिणाम (The Result): अंतिम उत्तर सीधे कंप्यूटर के कैलकुलेटर (इंटरप्रेटर) से आता है, न कि AI द्वारा अंग्रेजी में अनुमान लगाने से।
उन्होंने AI को कैसे सिखाया
शोधकर्ताओं ने केवल AI को यह नहीं बताया; उन्होंने इसे तीन-चरणीय प्रक्रिया के माध्यम से सिखाया:
- डिस्टिलेशन (शिक्षक - Distillation): उन्होंने एक बहुत ही स्मार्ट, बड़े AI मॉडल को लिया और उसे इस नए "कोड-फर्स्ट" स्टाइल का उपयोग करके गणित की समस्याओं को हल करने के लिए कहा। उन्होंने 12,200 "कोड-फर्स्ट" समाधानों के आदर्श उदाहरण एकत्र किए।
- सुपरवाइज्ड फाइन-ट्यूनिंग (छात्र - Supervised Fine-Tuning): उन्होंने दो छोटे AI मॉडलों को (एक जिसमें 1.7 बिलियन "मस्तिष्क कोशिकाएं" थीं और एक 4 बिलियन वाली) इन उदाहरणों की नकल करने के लिए सिखाया। इसने मॉडलों को कोड में सोचने की आदत सिखाई।
- रीइन्फोर्समेंट लर्निंग (कोच - Reinforcement Learning): उन्होंने मॉडलों को हजारों गणितीय समस्याओं पर अभ्यास करने दिया। यदि मॉडल सही उत्तर प्राप्त करता है, तो उसे एक "पुरस्कार" मिलता है। यदि वह विफल होता है, तो वह एक अलग कोड रणनीति आज़माना सीखता है। इसने मॉडलों को बहुत अधिक स्मार्ट और विश्वसनीय बनाया।
परिणाम: छोटे मॉडल, बड़ी जीत
पेपर में इन नए मॉडलों का परीक्षण बहुत कठिन, प्रतियोगिता-स्तर की गणित प्रतियोगिताओं (जैसे AIME और HMMT) पर किया गया।
- दिग्गजों को पछाड़ना: 4-बिलियन-पैरामीटर वाले THINC मॉडल ने औसतन 78.1% स्कोर किया। यह 1.7B मॉडल से बेहतर है, अन्य "टूल-इंटीग्रेटेड" मॉडलों से बेहतर है, और यहाँ तक कि एक विशाल 235-बिलियन-पैरामीटर वाले मॉडल से भी बेहतर है जो केवल अंग्रेजी में सोचता है!
- विश्वसनीयता: 99.2% मामलों में, अंतिम उत्तर सीधे कंप्यूटर के कोड आउटपुट से लिया गया था। AI ने अनुमान नहीं लगाया; उसने गणना की।
- वापसी (Bouncing Back): यदि कोड ने गलती की और क्रैश हो गया (एक एरर), तो THINC मॉडल बिना "बातचीत" के माध्यम से बाहर निकले बिना, अगले कोड ब्लॉक में इसे ठीक करने में आश्चर्यजनक रूप से सक्षम था। अन्य मॉडल जो अंग्रेजी और कोड को मिलाते हैं, वे कोड एरर आने पर बिखर जाते हैं।
निचोड़ (The Bottom Line)
पेपर का दावा है कि AI को गणित के बारे में "बात करना" बंद करने और कोड में गणित "करना" शुरू करने के लिए मजबूर करके, मॉडल अधिक सटीक हो जाते हैं, वे कम मूर्खतापूर्ण अंकगणितीय गलतियाँ करते हैं, और कठिन समस्याओं को अधिक कुशलता से हल करते हैं। यह एक इंसान से स्विच करने जैसा है जो अपने दिमाग में भाग विभाजन (long division) करने की कोशिश कर रहा है, और फिर एक ऐसे इंसान को जो एक कैलकुलेटर को स्टेप-बाय-स्टेप प्रोग्राम करना जानता है ताकि वह बिना किसी मानसिक गणितीय त्रुटि के इसे कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।