← नवीनतम पेपर
💻 computer science

Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation

यह शोध पत्र पुनरावृत्तिगत दृश्य निर्माण क्षमताओं (iterative visual generation capabilities) का मूल्यांकन करने के लिए R^3-Bench बेंचमार्क प्रस्तुत करता है और R^3-Refiner फ्रेमवर्क का प्रस्ताव करता है, जो परावर्तक दृश्य निर्माण (reflective visual generation) में त्रुटि पहचान और सुधारात्मक कार्रवाई के बीच के अंतर को पाटने के लिए GRPO और एक पदानुक्रमित पुरस्कार तंत्र (hierarchical reward mechanism) का लाभ उठाता है।

मूल लेखक: Junjie Wang, Xinghua Lou, Jason Li, Ye Tian, Keyu Chen, Yulin Li, Bin Kang, Jacky Mai, Yanwei Li, Zhuotao Tian, Liqiang Nie

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junjie Wang, Xinghua Lou, Jason Li, Ye Tian, Keyu Chen, Yulin Li, Bin Kang, Jacky Mai, Yanwei Li, Zhuotao Tian, Liqiang Nie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक बहुत ही विशिष्ट रेसिपी के आधार पर केक बनाने की कोशिश कर रहे हैं: "एक गोल चॉकलेट केक जिसके ऊपर तीन स्ट्रॉबेरी हों, जो एक नीली प्लेट पर रखा हो।"

समस्या: "वन-शॉट" शेफ
अधिकांश वर्तमान AI इमेज जनरेटर एक ऐसे शेफ की तरह हैं जो इस केक को एक ही बार में, बहुत जल्दबाजी में बनाने की कोशिश करते हैं। वे रेसिपी देखते हैं, सामग्री उठाते हैं, और उन्हें पैन में डाल देते हैं। जब वे केक बाहर निकालते हैं, तो वह या तो जल गया होता है, या उसमें केवल दो स्ट्रॉबेरी होती हैं, या वह लाल प्लेट पर रखा होता है। यदि आप उनसे पूछते हैं, "क्या आपने इसे सही किया?" तो वे आत्मविश्वास से कह सकते हैं, "हाँ!" क्योंकि वे अपने काम की जाँच करने में खराब हैं। या, यदि वे स्वीकार करते हैं कि यह गलत है, तो वे कह सकते हैं, "ठीक है, मैं रेसिपी को बदलकर 'लाल प्लेट' कर देता हूँ" बजाय इसके कि वे केक को ठीक करें। वे गलतियों को पहचानने में माहिर हैं लेकिन उन्हें वास्तव में ठीक करने में बहुत खराब हैं।

समाधान: "रीज़न-रिफ्लेक्ट-रेक्टिफाई" लूप (Reason-Reflect-Rectify Loop)
यह पेपर काम करने का एक नया तरीका पेश करता है जिसे R3 कहा जाता है। इसमें AI एक साधारण प्रयास के बजाय एक मास्टर शेफ की तरह काम करता है जिसके पास दूसरा मौका है।

  1. रीज़न (Reason - तर्क देना): शेफ केक और रेसिपी को देखता है। "हूँ, रेसिपी कहती है तीन स्ट्रॉबेरी, लेकिन मुझे केवल दो दिख रही हैं।"
  2. रिफ्लेक्ट (Reflect - चिंतन करना): शेफ गहराई से सोचता है। "मैं एक स्ट्रॉबेरी भूल गया। मुझे यह भी दिख रहा है कि प्लेट लाल है, लेकिन इसे नीला होना चाहिए था।"
  3. रेक्टिफाई (Rectify - सुधारना): शेफ केवल "ओप्स" नहीं कहता। वह अपने सहायक को एक विशिष्ट निर्देश देता है: "ऊपर एक स्ट्रॉबेरी जोड़ें और लाल प्लेट को नीली प्लेट से बदल दें।"

नया बेंचमार्क: R3-Bench
लेखकों ने महसूस किया कि जबकि हर कोई यह परीक्षण कर रहा था कि AI चित्र कैसे बनाता है, कोई भी यह परीक्षण नहीं कर रहा था कि वे उन्हें कैसे ठीक करते हैं। इसलिए, उन्होंने एक विशाल परीक्षण बनाया जिसे R3-Bench कहा जाता है।
इसे एक "फिक्स-इट एग्जाम" (सुधारने की परीक्षा) के रूप में समझें जिसमें 670 पेचीदा परिदृश्य हैं। यह AI को एक ऐसी तस्वीर दिखाता है जो थोड़ी गलत है (जैसे, हरे फूल के बजाय पीला फूल) और उससे पूछता है:

  • "क्या यह तस्वीर सही है या गलत?" (द वर्डिक्ट - निर्णय)
  • "यह गलत क्यों है?" (द रिफ्लेक्शन - चिंतन)
  • "इसे ठीक करने के लिए मुझे वास्तव में क्या बदलने की आवश्यकता है?" (द रेक्टिफिकेशन - सुधार)

खोज: "स्मार्ट क्रिटिक, डंब डूअर" गैप (Smart Critic, Dumb Doer Gap)
जब उन्होंने इस परीक्षा पर सर्वश्रेष्ठ AI मॉडल का परीक्षण किया, तो उन्हें एक मजेदार समस्या मिली। AI शानदार आलोचक (क्रिटिक) थे लेकिन भद्दे सुधारक (डूअर) थे।

  • वे पूरी तरह से पहचान सकते थे कि फूल का रंग गलत था।
  • लेकिन जब उन्हें ठीक करने के लिए कहा गया, तो उन्होंने अक्सर खराब निर्देश दिए, जैसे "फूल को दूसरे रंग में बदल दें" (अस्पष्ट) या, और भी बुरा, "रेसिपी को बदलकर 'पीला फूल' कर दें" (उपयोगकर्ता के मूल विचार को छोड़ देना)।
    वे बीमारी का निदान तो कर सकते थे लेकिन दवा नहीं लिख सकते थे।

समाधान: R3-Refiner (ट्रेनिंग जिम)
इस समस्या को हल करने के लिए, लेखकों ने एक प्रशिक्षण प्रणाली बनाई जिसे R3-Refiner कहा जाता है।
कल्पित कीजिए कि एक वीडियो गेम है जहाँ AI शेफ की भूमिका निभाता है।

  • खेल: AI केक को ठीक करने की कोशिश करता है।
  • रिवॉर्ड सिस्टम (पुरस्कार प्रणाली): यदि AI केवल कहता है "यह गलत है" लेकिन इसे ठीक नहीं करता है, तो उसे कम स्कोर मिलता है। यदि वह केक के बजाय रेसिपी को ठीक करने की कोशिश करता है, तो उसे दंड (पेनल्टी) मिलता है।
  • जादू: यह प्रणाली एक विशेष "सेल्फ-चेक" रिवॉर्ड का उपयोग करती है। AI चित्र को ठीक करता है, फिर तुरंत उस नए चित्र को देखता है और पूछता है, "क्या मैंने वास्तव में इसे बेहतर बनाया है?" यदि चित्र अब रेसिपी के अधिक करीब है, तो AI को उच्च स्कोर मिलता है। यह AI को सिखाता है कि उसका काम केवल त्रुटि के बारे में बात करना नहीं है, बल्कि उस पर कार्य करना है।

परिणाम
इस प्रशिक्षण के बाद, AI इस "फिक्स-इट एग्जाम" में बहुत बेहतर हो गया।

  • वह त्रुटियों को पहचानने (द वर्डिक्ट) में काफी बेहतर हो गया।
  • सबसे महत्वपूर्ण बात यह है कि वह ऐसे निर्देश देने में बहुत बेहतर हो गया जो वास्तव में चित्र को ठीक करते हैं (द रेक्टिफिकेशन)।
    लेखकों ने दिखाया कि यह नया "ट्रेनर" कई अलग-अलग AI सिस्टम में लगाया जा सकता है, जिससे वे अपनी गलतियों से सीखकर उच्च-गुणवत्ता वाली छवियां बनाने में बेहतर बन जाते हैं।

सारांश में
यह पेपर कहता है: "वर्तमान AI गलतियाँ करने में और उन्हें पहचानने में बहुत अच्छा है, लेकिन उन्हें ठीक करने में खराब है। हमने इस अंतर को मापने के लिए एक परीक्षण बनाया है, और हमने एक प्रशिक्षण पद्धति बनाई है जो AI को केवल त्रुटियों के बारे में 'बात' करने के बजाय वास्तव में उन्हें 'ठीक' करना सिखाती है, जिससे बहुत बेहतर चित्र प्राप्त होते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →