← नवीनतम पेपर
🤖 machine learning

Interactive Critique-Revision Training for Reliable Structured LLM Generation

यह शोध पत्र DPA-GRPO का प्रस्ताव करता है, जो एक जनरेटर-वेरिफायर गेम के लिए एक डुअल पेयर्ड-एक्शन प्रशिक्षण विधि है जो संरचित LLM आउटपुट को अनुकूलित करने के लिए सुरक्षा आश्वासन मामलों (safety assurance cases) और काउंटरफैक्चुअल एक्शन समूहों का उपयोग करता है, जो TaxCalcBench TY24 बेंचमार्क पर बेहतर सटीकता, त्रुटि पहचान और कैलिब्रेटेड संशोधन व्यवहार प्रदर्शित करता है।

मूल लेखक: Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही जटिल, उच्च-दांव वाले टैक्स फॉर्म को भरने की कोशिश कर रहे हैं। आपके पास एक स्मार्ट असिस्टेंट (जेनरेटर/Generator) है जो नंबर लिखता है, और एक सख्त ऑडिटर (वेरिफायर/Verifier) है जो काम की जाँच करता है।

अतीत में, यदि आपने किसी AI से यह करने के लिए कहा होता, तो वह बस नंबर लिख देता और उम्मीद करता कि सब ठीक हो जाए। कभी-कभी वह सही होता; कभी-कभी वह कोई छोटी सी गलती कर देता, और किसी को पता भी नहीं चलता। अन्य तरीकों ने AI को खुद से "बहस" करने के लिए प्रेरित किया, लेकिन अक्सर इससे AI खुद को शानदार लगने वाले लेकिन फर्जी तर्कों के साथ गलत उत्तरों के लिए राजी कर लेता था।

यह पेपर एक नई प्रशिक्षण विधि पेश करता है जिसे DPA-GRPO कहा जाता है। इसे एक कठोर "रिहर्सल" के रूप में समझें जहाँ असिस्टेंट और ऑडिटर एक टीम के रूप में एक साथ काम करना सीखते हैं, न कि केवल दो ऐसे लोगों के रूप में जो एक-दूसरे पर चिल्ला रहे हों।

यह सिस्टम कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ तोड़कर समझाया गया है:

1. दो खिलाड़ी: ड्राफ्ट्समैन और इंस्पेक्टर

  • द जेनरेटर (द ड्राफ्ट्समैन): यह AI टैक्स फॉर्म को देखता है और एक उत्तर प्रस्तावित करता है (जैसे, "आपका छात्र ऋण कटौती $3,000 है")।
  • द वेरिफायर (द इंस्पेक्टर): यह AI ड्राफ्ट्समैन के उत्तर को देखता है। इसके पास दो विकल्प हैं:
    • शांत रहना: "ठीक लग रहा है, मैं इसे मंजूरी देता हूँ।"
    • झंडा उठाना (SAC): "एक मिनट रुकिए! मुझे एक त्रुटि मिली है।" महत्वपूर्ण बात यह है कि जब यह झंडा उठाता है, तो यह केवल यह नहीं कह सकता कि "आप गलत हैं।" इसे एक सेफ्टी एश्योरेंस केस (SAC) प्रदान करना होगा। यह एक औपचारिक मेमो की तरह है जिसमें शामिल है:
      • दावा (The Claim): "संख्या बहुत अधिक है।"
      • तर्क (The Argument): "कानून कहता है कि अधिकतम सीमा $2,500 है।"
      • प्रमाण (The Evidence): "यहाँ रसीद है जो दिखाती है कि आपने $3,000 का भुगतान किया है।"

2. "दूसरा मौका" वाला लूप (The "Second Chance" Loop)

यदि इंस्पेक्टर झंडा उठाता है, तो ड्राफ्ट्समैन को दूसरा मौका मिलता है। वह यह कर सकता है:

  • बनाए रखना (Keep): "मैं अपने मूल उत्तर पर कायम हूँ; आपका झंडा एक गलती थी।"
  • संशोधित करना (Revise): "आप सही हैं, मुझसे गणित की त्रुटि हुई। यहाँ सुधारा हुआ नंबर है।"

3. प्रशिक्षण खेल (The "Coach")

इस पेपर का जादू यह है कि वे AI को कैसे सिखाते हैं। वे केवल यह नहीं कहते कि "अच्छा काम किया" या "बुरा काम किया।" वे एक खेल खेलते हैं जहाँ AI क्या हो सकता था (काउंटरफैक्टुअल्स/counterfactuals) से सीखता है।

एक कोच की कल्पना करें जो अभ्यास मैच देख रहा है:

  • परिदृश्य A: ड्राफ्ट्समैन सही होता है, और इंस्पेक्टर शांत रहता है। (परफेक्ट!) कोच दोनों को पुरस्कृत करता है।
  • परिदृश्य B: ड्राफ्ट्समैन गलत होता है, और इंस्पेक्टर त्रुटि को मिस कर देता है। (बुरा!) कोच इंस्पेक्टर को बताता है, "आपको झंडा उठाना चाहिए था!"
  • परिदृश्य C: ड्राफ्ट्समैन सही होता है, लेकिन इंस्पेक्टर गलत तरीके से झंडा उठाता है। (बुरा!) कोच इंस्पेक्टर को बताता है, "परानॉयड होना बंद करें; वह उत्तर सही था।"
  • परिदृश्य D: इंस्पेक्टर झंडा उठाता है, और ड्राफ्ट्समैन त्रुटि को सुधार देता है। (अच्छा!) दोनों को टीम वर्क के लिए पुरस्कृत किया जाता है।
  • परिदृश्य E: इंस्पेक्टर झंडा उठाता है, लेकिन ड्राफ्ट्समैन का "सुधार" चीज़ों को और भी खराब बना देता है। (बुरा!) कोच ड्राफ्ट्समैन को बताता है, "सिर्फ इसलिए चीजें न बदलें क्योंकि किसी ने चिल्लाया है; जाँच लें कि क्या बदलाव वास्तव में बेहतर है।"

सिस्टम एक गणितीय सूत्र (GRPO) का उपयोग करता है ताकि AI का "दिमाग" इस तरह से विकसित हो सके कि वह सीख सके:

  1. पहली बार में ही सही उत्तर देना।
  2. केवल तभी झंडा उठाना जब वास्तव में आवश्यकता हो।
  3. केवल तभी उत्तर बदलना जब बदलाव वास्तव में एक सुधार हो।

4. परिणाम: एक बेहतर टीम

शोधकर्ताओं ने इसका परीक्षण TaxCalcBench नामक एक बेंचमार्क पर किया, जो अमेरिकी टैक्स फॉर्म भरने का अनुकरण करता है। उन्होंने इसकी तुलना निम्नलिखित से की:

  • ज़ीरो-शॉट (Zero-shot): बिना प्रशिक्षण के केवल अनुमान लगाने वाला AI।
  • पुरानी विधियाँ: केवल ड्राफ्ट्समैन को बेहतर बनाने के लिए प्रशिक्षित करना, बिना किसी समर्पित इंस्पेक्टर के।

निष्कर्ष स्पष्ट थे:

  • नया "टीम" (DPA-GRPO) एकल ड्राफ्ट्समैन या अप्रशिक्षित AI की तुलना में काफी अधिक उत्तर सही करता है।
  • इंस्पेक्टर ने "झूठी चेतावनी" (गलत अलार्म) देना बंद करना सीख लिया और उन वास्तविक गलतियों को पकड़ना शुरू कर दिया जिन्हें वह पहले मिस कर देता था।
  • ड्राफ्ट्समैन ने यह सीखना शुरू किया कि कब अपना उत्तर बदलना है, बजाय इसके कि वह हर सुधार का आँख मूंदकर पालन करे।

मुख्य बात (The Bottom Line)

यह पेपर एक तरीका प्रस्तावित करता है जिससे संरचित कार्यों (जैसे फॉर्म भरना) में AI को अधिक विश्वसनीय बनाया जा सके, इसके लिए प्रक्रिया को एक निर्माता और एक आलोचक के बीच एक सहयोगात्मक खेल में बदल दिया गया है। केवल इस उम्मीद में कि AI सही होगा, इसके बजाय वे AI को तर्क करने, साक्ष्य की जाँच करने और अपने काम को एक संरचित, अनुशासित तरीके से संशोधित करने के लिए सिखाते हैं, जिसके परिणामस्वरूप कम त्रुटियां और अधिक भरोसेमंद आउटपुट प्राप्त होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →