BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation
यह शोध पत्र BALTO को प्रस्तुत करता है, जो एक संतुलित टोकन-स्तरीय नीति अनुकूलन (balanced token-level policy optimization) ढांचा है जो सत्यापित दावा-स्तरीय निर्णयों को टोकन-स्तरीय पुरस्कारों में प्रोजेक्ट करके LLM मतिभ्रम (hallucinations) को कम करता है ताकि सूचनात्मकता से समझौता किए बिना स्थिर, कुशल प्रशिक्षण और उत्कृष्ट निष्ठा सुनिश्चित की जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र BALTO: Hallucination Mitigation के लिए Balanced Token-Level Policy Optimization का सरल भाषा और रचनात्मक उपमाओं के साथ स्पष्टीकरण दिया गया है।
बड़ी समस्या: "एक ही आकार सबके लिए" वाली सजा (The "One-Size-Fits-All" Punishment)
कल्पना कीजिए कि आप एक छात्र (AI) को एक विशिष्ट पाठ्यपुस्तक के आधार पर इतिहास का निबंध लिखना सिखा रहे हैं। छात्र 500 शब्दों का निबंध लिखता है। यह ज्यादातर सटीक है, लेकिन बीच में, वह एक युद्ध की एक फर्जी तारीख बना देता है।
पुराना तरीका (Response-Level Rewards):
अतीत में, शिक्षक (AI ट्रेनर्स) पूरे निबंध को पढ़ते थे और उसे एक एकल ग्रेड देते थे। यदि निबंध में वह एक फर्जी तारीख होती थी, तो शिक्षक पूरे निबंध को "खराब" मान सकते थे।
- परिणाम: छात्र को पूरे निबंध के लिए दंडित किया जाता है, भले ही उन हिस्सों के लिए भी जहाँ उसने जनरलों के नाम या मौसम को सही ढंग से लिखा था। गलत होने से बचने के लिए, छात्र सुरक्षित रहने के लिए बहुत छोटे, उबाऊ निबंध लिखने लगता है, या वह इस बात को लेकर भ्रमित हो जाता है कि उसने क्या सही किया था। वह जोखिम लेना बंद कर देता है, और निबंध कम उपयोगी हो जाते हैं।
नया समाधान: BALTO (एक "संतुलित" शिक्षक)
इस शोध पत्र के लेखक एक नई विधि प्रस्तावित करते हैं जिसे BALTO कहा जाता है। पूरे निबंध को एक स्कोर के साथ ग्रेड देने के बजाय, BALTO एक अत्यंत सटीक संपादक की तरह काम करता है जो ठीक से हाईलाइट करता है कि कौन से शब्द गलत हैं और कौन से सही।
यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:
1. "बुरे सेबों" को खोजना (Fine-Grained Detection)
BALTO केवल पूरे निबंध को नहीं देखता। यह निबंध को छोटे दावों (जैसे "युद्ध 1863 में हुआ था") में तोड़ देता है। यह प्रत्येक दावे की पाठ्यपुस्तक के विरुद्ध जाँच करता है।
- यदि कोई दावा फर्जी है, तो यह उस विशिष्ट शब्दों को चिह्नित करता है जो इसके लिए जिम्मेदार हैं (जैसे, "1863")।
- यदि कोई दावा सत्य है, तो यह उन शब्दों को "अच्छा" के रूप में चिह्नित करता है।
- यदि कोई शब्द केवल जोड़ने वाला (जैसे "और" या "द") है, तो यह उसे अनदेखा कर देता है।
2. "संतुलित" स्कोरकार्ड (Balanced Credit Assignment)
यही जादुई हिस्सा है। पुराने तरीके में, यदि आपको एक फर्जी तारीख मिलती थी, तो आप पूरे निबंध से अंक काट सकते थे। BALTO कुछ अधिक स्मार्ट करता है: यह स्कोर को संतुलित करता है।
- बुरे शब्द: फर्जी तारीख को एक नकारात्मक स्कोर (दंड) मिलता है।
- अच्छे शब्द: सही तथ्य एक सकारात्मक स्कोर (पुरस्कार) प्राप्त करते हैं।
- संतुलन: सिस्टम यह सुनिश्चित करता है कि कुल "बुरे अंक" कुल "अच्छे अंकों" के बराबर हों।
उपमा: कल्पना कीजिए कि एक सी-सॉ (seesaw) है।
- यदि छात्र एक फर्जी तथ्य लिखता है, तो सी-सॉ उस तरफ नीचे झुक जाता है।
- इसे ठीक करने के लिए, BALTO पूरे सी-सॉ को नीचे नहीं धकेलता (पूरे निबंध को दंडित नहीं करता)। इसके बजाय, यह दूसरे पक्ष पर सही तथ्यों को ऊपर धकेलता है।
- लक्ष्य वजन को बदलना है: संभावना (probability) को फर्जी तथ्यों से हटाकर वास्तविक तथ्यों की ओर ले जाना।
यह बेहतर क्यों है (सिद्धांत)
यह शोध पत्र गणित का उपयोग करके दो मुख्य बातें सिद्ध करता है:
- कम शोर (स्थिरता/Stability): जब आप एक गलती के लिए पूरे निबंध को दंडित करते हैं, तो आप AI को भ्रमित करते हैं। वह सोचता है, "क्या मैंने तारीख गलत लिखी? या व्याकरण? या वर्तनी?" BALTO AI को बताता है कि गलती वास्तव में कहाँ थी। यह सीखने की प्रक्रिया को बहुत सहज और कम अराजक बनाता है।
- "जम जाने" से बचना (क्षमता/Efficiency): यदि शुरुआत में AI बहुत खराब है, तो पुराना तरीका उसे इतना बड़ा दंड दे सकता है कि वह सीखना बंद कर देता है (इसे 'ग्रेडिएंट स्टार्वेशन' कहते हैं)। यदि AI लगभग सटीक है, तो पुराना तरीका एक छोटी सी चूक के लिए उसे इतनी कठोरता से दंडित कर सकता है कि वह टूट जाए। BALTO पुरस्कारों और दंडों को छोटा और संतुलित रखता है, ताकि AI शुरू से अंत तक निरंतर सीख सके।
परिणाम: क्या हुआ?
शोधकर्ताओं ने तीन अलग-अलग "परीक्षाओं" (डेटासेट्स) पर इसका परीक्षण किया जिसमें वित्तीय डेटा, सामान्य ज्ञान और पठन बोध शामिल था। उन्होंने दो अलग-अलग AI मॉडल (Qwen3-8B और Qwen3-4B) का उपयोग किया।
- विश्वसनीयता (Faithfulness): BALTO ने अन्य सभी विधियों की तुलना में कम झूठ पैदा किए।
- सूचनात्मकता (Informativeness): पुराने तरीकों के विपरीत, जो AI को छोटे, सुरक्षित उत्तर लिखने के लिए मजबूर करते थे, BALTO ने AI को लंबे, विस्तृत और उपयोगी उत्तर लिखने की अनुमति दी।
- ट्रेड-ऑफ (Trade-off): शोध पत्र दिखाता है कि BALTO सबसे अच्छा संतुलन प्राप्त करता है: यह AI को झूठ बोलने से रोकता है बिना उसे बोलना बंद कराए।
सारांश
BALTO को एक ऐसे शिक्षक के रूप में समझें जो निबंधों को केवल एक "पास/फेल" स्टैम्प के साथ ग्रेड देना बंद कर देता है। इसके बजाय, यह एक लाल पेन का उपयोग करके एक झूठ को घेरता है और एक हरे पेन का उपयोग करके सच्चाई को हाईलाइट करता है, जिससे यह सुनिश्चित होता है कि छात्र अपने बाकी काम का आत्मविश्वास खोए बिना ठीक से सीख सके। इससे AI न केवल ईमानदार बल्कि सहायक भी बनता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।