← नवीनतम पेपर
💬 NLP

ReForm: Reflective Autoformalization with Prospective Bounded Sequence Optimization

ReForm एक रिफ्लेक्टिव ऑटोफॉर्मलाइजेशन विधि है जो प्रोस्पेक्टिव बाउंडेड सीक्वेंस ऑप्टिमाइजेशन (PBSO) नामक एक नवीन प्रशिक्षण तकनीक के साथ इटरेटिव सेल्फ-करेक्शन को एकीकृत करके प्राकृतिक भाषा गणित को औपचारिक कथनों में अनुवादित करने की सिमेंटिक सटीकता में सुधार करती है।

मूल लेखक: Guoxin Chen, Jing Wu, Xinjie Chen, Wayne Xin Zhao, Ruihua Song, Chengxi Li, Kai Fan, Dayiheng Liu, Minpeng Liao

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Guoxin Chen, Jing Wu, Xinjie Chen, Wayne Xin Zhao, Ruihua Song, Chengxi Li, Kai Fan, Dayiheng Liu, Minpeng Liao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "अनुवाद में खो जाने वाली" गणितीय दुविधा

कल्पना कीजिए कि आप एक विश्व स्तरीय गणितज्ञ हैं जो केवल अंग्रेजी बोलते हैं। आपके पास एक नए प्रमेय (theorem) के लिए एक शानदार विचार है, लेकिन आपको इसे एक सुपर-इंटेलिजेंट रोबोट को समझाना है जो केवल एक बहुत ही सख्त, अति-तार्किक भाषा जिसे Lean कहा जाता है, उसे समझता है।

यदि आप रोबोट को बताते हैं, "संख्या लगभग दस के आसपास है," तो रोबोट क्रैश हो जाएगा। उसे सटीक रूप से जानना होगा: "क्या यह 10.0 है? क्या यह 10.00001 है? क्या यह एक पूर्णांक (integer) है?"

वर्तमान में, हम AI (लार्ज लैंग्वेज मॉडल्स) का उपयोग अंग्रेजी और Lean के बीच अनुवादक के रूप में करते हैं। लेकिन एक बड़ी समस्या है: AI एक "वन-शॉट" (एक बार में होने वाला) अनुवादक है। यह अंग्रेजी को पढ़ता है, एक ही बार में Lean कोड लिखता है, और "सेंड" बटन दबा देता है।

चूंकि गणित अविश्वसनीय रूप से संवेदनशील होता है, इसलिए एक छोटी सी चूक भी—जैसे "कम या बराबर से कम" के बजाय केवल "कम से कम" लिख देना—पूरे अनुवाद को बेकार बना देती है। AI उस छात्र की तरह है जो गणित की परीक्षा जल्दी-जल्दी लिखता है, दस सेकंड में खत्म करता है, और बिना कभी यह जांचे कि उसने कोई मूर्खतापूर्ण गलती तो नहीं की, अपना पेपर जमा कर देता है।


समाधान: REFORM (द "सेल्फ-करेक्टिंग स्कॉलर")

शोधकर्ताओं ने REFORM नामक एक नई विधि बनाई है। एक जल्दबाजी करने वाले अनुवादक के बजाय, REFORM AI को एक चिंतनशील विद्वान (Reflective Scholar) में बदल देता है।

इन दो छात्रों के बीच के अंतर के बारे में सोचें:

  1. वन-पास स्टूडेंट (एक बार में काम करने वाला छात्र): प्रश्न पढ़ता है, उत्तर लिखता है, और तुरंत जमा कर देता है। (यह वर्तमान AI के काम करने का तरीका है)।
  2. REFORM स्टूडेंट (REFORM वाला छात्र): प्रश्न पढ़ता है, एक ड्राफ्ट लिखता है, अपने काम की समीक्षा करने के लिए रुकता है, महसूस करता है, "अरे, मैं यह बताना भूल गया कि x एक धनात्मक संख्या होनी चाहिए!", अपनी गलती को मिटाता है, और एक आदर्श अंतिम संस्करण लिखता है।

यह कैसे काम करता है (तीन स्तंभ):

1. सेल्फ-करेक्शन लूप (द "मिरर" मेथड)
REFORM केवल अनुवाद नहीं करता; यह खुद से बात करता है। यह एक लूप का पालन करता है:

  • चरण A: "यहाँ मेरा Lean कोड का पहला प्रयास है।"
  • चरण B: "मुझे उस कोड को आईने में देखना चाहिए। क्या यह वास्तव में अंग्रेजी प्रश्न से मेल खाता है? हम्म, मैं वेरिएबल xx के बारे में एक बाधा (constraint) लिखना भूल गया।"
  • चरण C: "ठीक है, मुझे इसे ठीक करना चाहिए और फिर से प्रयास करना चाहिए।"

2. PBSO (द "फेयर ग्रेडिंग" सिस्टम)
AI को इस तरह सोचने के लिए प्रशिक्षित करना कठिन है। यदि आप केवल अंतिम उत्तर के लिए AI को पुरस्कृत करते हैं, तो वह एक सही उत्तर देकर लेकिन बीच में एक बेकार, निरर्थक आलोचना लिखकर "चीटिंग" करना सीख सकता है।

शोधकर्ताओं ने PBSO (प्रोस्पेक्टिव बाउंडेड सीक्वेंस ऑप्टिमाइजेशन) का आविष्कार किया। इसे एक ऐसे शिक्षक के रूप में सोचें जो न केवल अंतिम परीक्षा का ग्रेड देता है, बल्कि रफ कार्य (scratchpad work) की गुणवत्ता के लिए भी अंक देता है। यह AI को पुरस्कृत करता है:

  • गणित को सही ढंग से हल करने के लिए (लक्ष्य)।
  • अपनी गलतियों की एक स्मार्ट, सहायक आलोचना लिखने के लिए (प्रक्रिया)।
    यह सुनिश्चित करता है कि AI वास्तव में सोचना सीखता है, न कि केवल उत्तरों को रटता है।

3. ConsistencyCheck (द "एक्सपर्ट ऑडिट")
यह साबित करने के लिए कि यह काम कर रहा है, उन्होंने केवल AI पर भरोसा नहीं किया। उन्होंने AI के काम की जांच करने के लिए मानव विशेषज्ञों को काम पर लगाया। उन्होंने एक चौंकाने वाली बात भी खोजी: मानव विशेषज्ञ औपचारिक गणित में लगभग 38% बार गलतियाँ करते हैं! यह साबित करता है कि ऑटोफॉर्मलाइजेशन इतना कठिन है कि मनुष्यों को भी मदद की आवश्यकता होती है, जो REFORM विधि को और भी महत्वपूर्ण बनाता है।


परिणाम: एक बड़ी छलांग

परिणाम ऐसे थे जैसे किसी अनुमान लगाने वाले छात्र की तुलना में पढ़ाई करने वाले छात्र से की जा रही हो। REFORM ने पिछले सर्वश्रेष्ठ मॉडलों की तुलना में गणित अनुवाद की सटीकता में औसतन 22.6% का सुधार किया।

संक्षेप में, REFORM AI को एक तेज़ बोलने वाले अनुवादक से बदलकर एक सावधान, सोचने वाले गणितज्ञ में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →