ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning
यह शोध पत्र ConsistentRFT प्रस्तुत करता है, जो एक सामान्य ढांचा है जो डायनेमिक ग्रैनुलैरिटी रोलआउट मैकेनिज्म और कंसिस्टेंट पॉलिसी ग्रेडिएंट ऑप्टिमाइजेशन के माध्यम से सीमित अन्वेषण और ट्रेजेक्टरी इमिटेशन की समस्याओं को संबोधित करके फ्लो-आधारित सुदृढीकरण फाइन-ट्यूनिंग (reinforcement fine-tuning) में विजुअल हैलुसिनेशन को कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली कलाकार (एक AI इमेज जनरेटर) है जो आपके विवरणों के आधार पर चित्र बनाने में बहुत कुशल है। हालाँकि, जब आप उससे "एक बेसबॉल खिलाड़ी को पिच करते हुए पेंट करने" के लिए कहते हैं, तो वह कभी-कभी घास की बनावट या गेंद की सिलाई पर इतना जुनूनी हो जाता है कि वह यह भूल जाता है कि खिलाड़ी वास्तव में हाथ में बल्ला पकड़े हुए है, या वह गलती से तीसरा हाथ जोड़ देता है। इसे विजुअल हैलुसिनेशन (Visual Hallucination) कहा जाता है।
यह शोध पत्र एक नया प्रशिक्षण तरीका पेश करता है जिसे ConsistentRFT कहा जाता है ताकि इसे ठीक किया जा सके। यह कैसे काम करता है, यहाँ सरल रूप में समझाया गया है:
समस्या: "अति-अनुकूलित" (Over-Optimized) कलाकार
शोधकर्ताओं ने पाया कि इन AI कलाकारों को सिखाने के वर्तमान तरीके (जिन्हें रिइन्फोर्समेंट फाइन-ट्यूनिंग कहा जाता है) में दो मुख्य खामियां हैं:
- "ज़ूम-इन" का जाल (एक्सप्लोरेशन समस्या):
कल्पना कीजिए कि AI एक "अच्छी" तस्वीर क्या होती है, यह सीखने की कोशिश कर रहा है। वर्तमान तरीके एक ऐसे फोटोग्राफर की तरह हैं जो केवल सूक्ष्म विवरणों (जैसे पेड़ की एक अकेली पत्ती) पर ज़ूम करता है ताकि यह देखा जा सके कि वह स्पष्ट दिख रही है या नहीं। वे पूरे पेड़ को अनदेखा कर देते हैं।
- परिणाम: AI सूक्ष्म विवरणों को एकदम सटीक बनाने में इतना माहिर हो जाता है कि वह उच्च स्कोर पाने के लिए नकली विवरण (जैसे ग्रिड पैटर्न या अतिरिक्त फूल) बनाना शुरू कर देता है, भले ही मुख्य चित्र का कोई अर्थ न निकलता हो।
- "नकलची" का भ्रम (एक्सप्लोइटेशन समस्या):
सीखने के लिए, AI अपने अभ्यास के दौरान बनाई गई "जीतने वाली" ड्राइंग की नकल करने की कोशिश करता है। लेकिन क्योंकि अभ्यास करने का तरीका थोड़ा अराजक (रैंडम नॉइज़) था, इसलिए AI अच्छी चीजों के साथ-साथ उस अराजकता की भी नकल करने लगता है।
- परिणाम: AI उन तार्किक नियमों को भूल जाता है जो उसने अपने निर्माण के समय सीखे थे। वह अजीब शॉर्टकट लेने लगता है, जिससे चित्र असंगत या धुंधले हो जाते हैं।
समाधान: ConsistentRFT
लेखक इन समस्याओं को ठीक करने के लिए दो मुख्य रणनीतियों के साथ एक नया प्रशिक्षण कोच प्रस्तावित करते हैं:
1. "डायनामिक ज़ूम" रणनीति (Dynamic Granularity Rollout)
केवल सूक्ष्म विवरणों पर ज़ूम करने या केवल पूरी तस्वीर को देखने के बजाय, यह नया तरीका AI को दोनों काम करने के लिए सिखाता है, लेकिन सही समय पर।
- उपमा: कल्पना कीजिए कि एक शिक्षक छात्र से कहता है, "पहले, पूरे जंगल को देखो ताकि यह सुनिश्चित हो सके कि पेड़ सही जगह पर हैं (ग्लोबल सिमेंटिक्स)। फिर, यह देखने के लिए ज़ूम करें कि पत्तियां यथार्थवादी दिख रही हैं या नहीं (लोकल डिटेल्स)।"
- यह कैसे काम करता है: सिस्टम प्रशिक्षण के दौरान "कोर्स-ग्रेन्ड" (बड़ी तस्वीर देखना) और "फाइन-ग्रेन्ड" (विवरण देखना) के बीच स्विच करता है। यह सबसे विविध उदाहरणों को चुनने के लिए एक स्मार्ट फ़िल्टर का भी उपयोग करता है, ताकि AI बार-बार एक ही "परफेक्ट" पत्ती को याद न करता रहे।
2. "स्थिर हाथ" की रणनीति (Consistent Policy Gradient Optimization)
यह हिस्सा AI को अराजक "अभ्यास" ड्राइंग की नकल करने से रोकता है और उसे उन तार्किक नियमों पर टिके रहने के लिए मजबूर करता है जो वह पहले से जानता है।
- उपमा: कल्पना कीजिए कि AI साइकिल चलाना सीख रहा है। पुराना तरीका उसे एक नशे में धुत सवार के टेढ़े-मेढ़े रास्ते की नकल करने के लिए कहता है क्योंकि उसने फिनिश लाइन तक पहुँच लिया था। नया तरीका कहता है, "नहीं, एक अनुभवी सवार के सुचारू, सीधे रास्ते की नकल करो, भले ही उसने थोड़ा अलग रास्ता लिया हो।"
- यह कैसे काम करता है: यह एक नियम जोड़ता है कि "आप स्टेप 10 पर जो कुछ भी बनाते हैं, वह तार्किक रूप से स्टेप 9 में बनाए गए चित्र से जुड़ा होना चाहिए।" यह AI को केवल उच्च रिवॉर्ड स्कोर पाने के लिए अजीब, असंबद्ध विवरण बनाने से रोकता है।
परिणाम: एक बेहतर कलाकार
इस शोध पत्र ने FLUX1.dev नामक एक लोकप्रिय इमेज जनरेटर पर इस नए तरीके का परीक्षण किया।
- कम हैलुसिनेशन: इसने "लो-लेवल" हैलुसिनेशन (अजीब बनावट, ग्रिड लाइनें) को 49% और "हाई-लेवल" हैलुसिनेशन (गलत वस्तुएं, गायब हिस्से) को 38% कम कर दिया।
- बेहतर सामान्यीकरण (Generalization): अन्य तरीकों के विपरीत, जो विशिष्ट परीक्षण प्रश्नों में तो बेहतर थे लेकिन बाकी सब में खराब हो गए, इस तरीके ने अनदेखे प्रॉम्प्ट्स को समझने की AI की क्षमता में 5.1% का सुधार किया।
- गति: यह मानक तरीकों के समान ही तेज़ काम करता है, जो इसे एक व्यावहारिक अपग्रेड बनाता है।
संक्षेप में: ConsistentRFT AI को बड़ी तस्वीर देखने और विवरणों पर ध्यान देने के बीच संतुलन बनाना सिखाता है, और उसे तार्किक रहने के लिए मजबूर करता है, जिसके परिणामस्वरूप ऐसी छवियां मिलती हैं जो सुंदर होने के साथ-साथ वास्तव में अर्थपूर्ण भी होती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।