Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs
यह शोध पत्र AVES-DPO का प्रस्ताव करता है, जो एक स्व-सुधारित प्राथमिकता शिक्षण ढांचा (self-corrected preference learning framework) है जो एक सर्वसम्मति-आधारित सत्यापन तंत्र के माध्यम से इन-डिस्ट्रीब्यूशन प्राथमिकता युग्मों को उत्पन्न करके लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जिससे प्रोप्रायटरी मॉडल्स पर निर्भरता के कारण होने वाले वितरण संबंधी बेमेल (distributional mismatch) को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, कलात्मक रोबोट है जिसे चित्रों का वर्णन करना पसंद है। आप उसे एक रसोई की तस्वीर दिखाते हैं, और वह कहता है, "मुझे एक भूरी कैबिनेट, एक लकड़ी का फर्श, और एक कुत्ते के पास खड़ा एक व्यक्ति दिखाई दे रहा है।" लेकिन रुकिए—तस्वीर में कोई कुत्ता नहीं है! रोबोट ने इसे खुद से बना लिया। इसे हैलुसिनेशन (Hallucination) कहा जाता है। यह ऐसा है जैसे रोबोट फोटो देखते समय दिवास्वप्न देख रहा हो।
लंबे समय तक, वैज्ञानिकों ने इसे ठीक करने के लिए एक "सुपर-एक्सपर्ट" (जैसे कि GPT-4V जैसा एक विशाल, महंगा AI मॉडल) को रोबोट की गलतियों को देखने और उसे यह बताने के लिए काम पर रखने की कोशिश की कि, "नहीं, वहाँ कोई कुत्ता नहीं है। इसे ठीक करो।" फिर वे रोबोट को उन सुधारों का उपयोग करके सिखाते थे।
पुराने तरीके के साथ समस्या
इस पेपर के लेखकों ने महसूस किया कि इस योजना में एक दोष था। कल्पना कीजिए कि आप एक छात्र को एक पूरी तरह से अलग कलाकार की उत्कृष्ट कृति (मास्टरपीस) की नकल करके पेंटिंग करना सिखा रहे हैं। छात्र उस मास्टर की शैली तो सीख सकता है, लेकिन यह उसकी अपनी प्राकृतिक पेंटिंग शैली से मेल नहीं खाएगा।
ठीक उसी तरह, जब "सुपर-एक्सपर्ट" रोबोट को सुधारता है, तो सुधार उस विशेषज्ञ की तरह सुनाई देता है, न कि रोबोट की तरह। इससे रोबोट भ्रमित हो जाता है क्योंकि "सही उत्तर" उसके अपने मस्तिष्क के लिए पराया लगता है, जिससे सीखने की प्रक्रिया अक्षम हो जाती है और इसके लिए भारी मात्रा में डेटा की आवश्यकता होती है।
नया समाधान: "AVES-DPO" (स्व-सुधार करने वाला कलाकार)
लेखक एक नई विधि प्रस्तावित करते हैं जिसे AVES-DPO कहा जाता है। एक बाहरी विशेषज्ञ को काम पर रखने के बजाय, वे रोबोट को अपने काम की जांच करने और उसे ठीक करने की शिक्षा देते हैं।
यहाँ उनका "स्व-सुधार" (Self-Correction) की प्रक्रिया कैसे काम करती है, इसे सरल चरणों में विभाजित किया गया है:
- पहला ड्राफ्ट (गलती): रोबट तस्वीर को देखता है और एक विवरण लिखता है। वह गलती से एक कुत्ता बना सकता है या कैबिनेट का रंग गलत बता सकता है।
- जासूसी कार्य (सत्यापन): रोबोट को इसे ठीक करने से पहले, वे "जासूसों" की एक टीम (विशेषज्ञ, ओपन-सोर्स AI उपकरण) का उपयोग करते हैं जो विवरण को स्कैन करते हैं।
- क्या रोबोट ने कहा कि वहाँ एक कुत्ता है? जासूस फोटो की जाँच करता है। "नहीं, कोई कुत्ता नहीं है।"
- क्या इसने कहा कि कैबिनेट नीली है? जासूस जाँच करता है। "नहीं, वे भूरी हैं।"
- क्या इसने कहा कि व्यक्ति ने एक कप पकड़ा हुआ है? जासूस जाँच करता है। "कोई कप नहीं है।"
- यदि जासूस सहमत होते हैं, तो गलती की पुष्टि हो जाती है। यदि वे अनिश्चित हैं, तो वे सुनिश्चित होने के लिए दूसरी राय मांगते हैं।
- स्व-सुधार (सुधार): अब, रोबोट पुष्ट की गई गलतियों की सूची को देखता है। वह अपनी कहानी को फिर से लिखता है।
- वह नकली कुत्ते को हटा देता है।
- वह "नीली कैबिनेट" को "भूरी कैबिनेट" में बदल देता है।
- महत्वपूर्ण बात यह है कि वह केवल खराब हिस्सों को हटाता ही नहीं है; वह उन वास्तविक विवरणों को भी जोड़ता है जिन्हें उसने छोड़ दिया था, जैसे "फर्श चमकदार है" या "वहाँ एक खिड़की है।"
- पाठ (वरीयता सीखना): अब रोबोट के पास कहानी के दो संस्करण हैं:
- संस्करण A: मूल, गलतियों से भरी कहानी ( "खराब" उत्तर)।
- संस्करण B: नया, स्व-सुधारित, विस्तृत कहानी ("अच्छा" उत्तर)।
- रोबोट को संस्करण B को पसंद करने के लिए प्रशिक्षित किया जाता है। क्योंकि संस्करण B उसने खुद लिखा है, इसलिए "अच्छा" उत्तर बिल्कुल उसके जैसा ही सुनाई देता है। यह उसके अपने मस्तिष्क में पूरी तरह फिट बैठता है।
यह एक बड़ी बात क्यों है
पेपर का दावा है कि यह तरीका तीन कारणों से गेम-चेंजर है:
- यह कुशल है: क्योंकि रोबोट अपनी "आवाज़" से सीख रहा है, इसलिए वह बहुत तेज़ी से सीखता है। उन्हें रोबोट को सिखाने के लिए केवल लगभग 5,200 उदाहरणों की आवश्यकता थी। अन्य तरीकों को समान परिणाम प्राप्त करने के लिए 25 गुना अधिक डेटा (120,000 से अधिक उदाहरण) की आवश्यकता थी। यह एक विदेशी लहजे की नकल करने के बजाय दर्पण में खुद से बात करके भाषा सीखने जैसा है।
- यह अधिक गलतियाँ पकड़ता है: पुराने तरीके मुख्य रूप से "बड़ी" गलतियाँ पकड़ते थे, जैसे कि किसी पूरी वस्तु (एक कुत्ते) का आविष्कार करना। यह नया तरीका "छोटी" गलतियों को भी पकड़ लेता है, जैसे कि संबंध को गलत बताना (यह कहना कि कुत्ता बाईं ओर है जबकि वह वास्तव में दाईं ओर है) या गलत रंग बताना।
- यह सस्ता है: आपको सुधार करने के लिए महंगे "सुपर-एक्सपर्ट" AI मॉडल को भुगतान करने की आवश्यकता नहीं है। रोबोट सारा भारी काम खुद करता है।
परिणाम
जब उन्होंने इस नई विधि का परीक्षण किया, तो रोबोट चित्रों का सटीक वर्णन करने में बहुत बेहतर हो गया। उसने वस्तुओं का आविष्कार करना बंद कर दिया और विवरणों को सही ढंग से बताया, और यह सब बहुत कम प्रशिक्षण डेटा का उपयोग करते हुए किया।
सीमाओं पर एक नोट
लेखक ईमानदार हैं कि उनका तरीका अभी क्या नहीं कर सकता है।
- यह एक बार में एक वस्तु को देखने पर सबसे अच्छा काम करता है। यदि किसी चित्र में 50 लोगों की एक अराजक भीड़ जटिल तरीकों से एक-दूसरे के साथ बातचीत कर रही है, तो सिस्टम थोड़ा भ्रमित हो सकता है।
- सबसे बड़े, सबसे शक्तिशाली रोबोटों (13-बिलियन-पैरामीटर वाले मॉडल्स) के लिए, हैलुसिनेशन को ठीक करने से वे थोड़े अधिक "सतर्क" हो गए। वे चीजें बनाने से बचने में इतने अच्छे हो गए कि वे कभी-कभी उस सामान्य ज्ञान को भी भूल जाते थे जिसे वे पहले से जानते थे। यह 100% तथ्यात्मक होने और 100% बातूनी होने के बीच का एक समझौता (trade-off) है।
संक्षेप में, AVES-DPO के बारे में यह है कि यह रोबोट को अपना सबसे अच्छा संपादक बनने की शिक्षा देता है, यह सुनिश्चित करता है कि जो "सत्य" वह सीख रहा है, वह उसके अपने मन में स्वाभाविक रूप से फिट होने वाला सत्य है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।