← नवीनतम पेपर
💬 NLP

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

यह शोधपत्र EditReward को प्रस्तुत करता है, जो एक नए बड़े पैमाने के मानव प्राथमिकता डेटासेट पर प्रशिक्षित एक मानव-संरेखित (human-aligned) रिवॉर्ड मॉडल है, जो निर्देश-निर्देशित छवि संपादन (instruction-guided image editing) के मूल्यांकन में अत्याधुनिक प्रदर्शन प्राप्त करता है और ओपन-सोर्स संपादन मॉडलों के प्रशिक्षण को महत्वपूर्ण रूप से सुधारने के लिए उच्च-गुणवत्ता वाले डेटा को प्रभावी ढंग से फ़िल्टर करता है।

मूल लेखक: Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक रोबोट को खाना बनाना सिखाने की कोशिश कर रहे हैं। आप रोबोट को एक रेसिपी देते हैं: "इस सादे स्टेक को एक रसीले, मीडियम-रेयर मास्टरपीस और साथ में शतावरी (asparagus) में बदल दो।"

कभी-कभी, रोबोट बहुत अच्छा काम करता है। कभी-कभी, वह स्टेक को जलाकर कोयला बना देता है, या गलती से शतावरी को पत्थरों के ढेर में बदल देता है। बेहतर होने के लिए, रोबोट को एक टेस्ट-टेस्टर (रिवॉर्ड मॉडल) की आवश्यकता होती है जो उसे बता सके, "अच्छा काम किया!" या "फिर से कोशिश करो।"

समस्या यह है कि वर्तमान में उपलब्ध अधिकांश टेस्ट-टेस्टर:

  1. बहुत रोबोटिक हैं: वे केवल यह देखते हैं कि स्टेक का तापमान सही है या नहीं, लेकिन उन्हें इस बात की परवाह नहीं होती कि वह स्वाद में कैसा है।
  2. बहुत पक्षपाती हैं: वे अन्य रोबोटों द्वारा प्रशिक्षित किए गए हैं, इसलिए वे बस एक-दूसरे की गलतियों की नकल करते हैं।
  3. बहुत महंगे हैं: सबसे अच्छे मानव टेस्ट-टेस्टर दुर्लभ और धीमे होते हैं।

यह पेपर EDITREWARD पेश करता है, जो विशेष रूप से इमेज एडिटिंग (छवि संपादन) के लिए डिज़ाइन किया गया एक नया, सुपर-स्मार्ट टेस्ट-टेस्टर है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "टेस्ट-टेस्ट" डेटासेट (EDITREWARD-DATA)

नया टेस्ट-टेस्टर बनाने से पहले, लेखकों को एक विशाल लाइब्रेरी की आवश्यकता थी जिसमें "अच्छे" और "बुरे" उदाहरण हों।

  • पुराना तरीका: वे आमतौर पर इंटरनेट पर मौजूद यादृच्छिक (random) लोगों से छवियों को ग्रेड देने के लिए कहते थे। यह मिशेलिन-स्टार भोजन को जज करने के लिए भीड़ से पूछने जैसा है; कुछ को यह पसंद आएगा, कुछ को नापसंद, और कई तो बस अनुमान लगा रहे होंगे। यह डेटा "शोरयुक्त" (noisy) होता है।
  • नया तरीका: लेखकारों ने हजारों इमेज एडिट्स को देखने के लिए विशेषज्ञ शेफ (प्रशिक्षित मानव एनोटेटर्स) को काम पर रखा।
  • ट्विस्ट: उन्होंने केवल एक सिंगल स्कोर (जैसे "10 में से 5") नहीं दिया। उन्होंने दो अलग-अलग स्कोर दिए:
    1. क्या इसने निर्देशों का पालन किया? (क्या इसने वास्तव में स्टेक को मीडियम-रेयर में बदला?)
    2. क्या यह सुंदर है? (क्या यह स्वादिष्ट और वास्तविक दिखता है, या किसी प्लास्टिक के खिलौने जैसा?)
  • परिणाम: उन्होंने 2,00,000 सावधानीपूर्वक ग्रेड किए गए उदाहरणों की एक लाइब्रेरी बनाई। यह "गोल्ड स्टैंडर्ड" डेटासेट है।

2. नया टेस्ट-टेस्टर (EDITREWARD मॉडल)

इस उच्च-गुणवत्ता वाली लाइब्रेरी का उपयोग करके, उन्होंने EDITREWARD नामक एक नया AI मॉडल प्रशिक्षित किया।

  • यह कैसे सोचता है: केवल अनुमान लगाने के बजाय, यह मूल छवि, निर्देश और परिणाम को देखता है। यह खुद से दो सवाल पूछता है: "क्या रोबोट ने बात मानी?" और "क्या यह अच्छा दिख रहा है?"
  • भ्रम को संभालना: कभी-कभी, एक छवि निर्देशों का पालन करने में तो उत्तम होती है लेकिन थोड़ी अजीब दिखती है, या दिखने में शानदार होती है लेकिन कोई विवरण छूट जाता है। पुराने मॉडल इसमें भ्रमित हो जाते हैं। EDITREWARD इतना स्मार्ट है कि वह कह सकता है, "ठीक है, यह एक समझौता (trade-off) है," और एक सूक्ष्म स्कोर दे सकता है। यह "टाई" (जब दो छवियां अलग-अलग तरीकों से अच्छी होती हैं) से भी सीखता है कि वे क्यों अच्छी हैं।

3. "टेस्ट-टेस्ट" चुनौती (EDITREWARD-BENCH)

अपने नए टेस्ट-टेस्टर को सर्वश्रेष्ठ साबित करने के लिए, उन्होंने एक नई, कठिन परीक्षा बनाई जिसे EDITREWARD-BENCH कहा जाता है।

  • परीक्षा: केवल दो छवियों (A बनाम B) की तुलना करने के बजाय, वे कभी-कभी एक साथ तीन या चार छवियां दिखाते हैं और मॉडल को उन्हें पूरी तरह से रैंक करने के लिए कहते हैं।
  • स्कोर: EDITREWARD ने इस परीक्षा में वर्तमान चैंपियनों (जैसे GPT-4o और GPT-5) को पीछे छोड़ दिया। यह इस बात के साथ बेहतर तालमेल बिठाता है कि वास्तविक मनुष्य क्या सोचते हैं कि एक "अच्छा" एडिट क्या है।

4. वास्तविक दुनिया का परीक्षण: एक बिखरी हुई रसोई को साफ करना

इस नए टेस्ट-टेस्टर के साथ उन्होंने जो किया, वह इस पेपर का सबसे रोमांचक हिस्सा है।

  • समस्या: उनके पास इमेज एडिट्स का एक बहुत बड़ा, बिखरा हुआ डेटासेट है जिसे "ShareGPT-4o-Image" कहा जाता है। इसमें 46,000 उदाहरण हैं, लेकिन उनमें से कई बेकार हैं (बुरे एडिट्स, गलत निर्देश)। इस कचरे पर रोबोट को प्रशिक्षित करने से रोबोट खराब हो जाता है।
  • समाधान: उन्होंने EDITREWARD को एक फिल्टर के रूप में उपयोग किया। इसने सभी 46,000 उदाहरणों को देखा और केवल शीर्ष 20,000 उच्च-गुणवत्ता वाले उदाहरणों को चुना।
  • परिणाम: उन्होंने एक रोबोट (Step1X-Edit) लिया और उसे केवल उन 20,000 साफ उदाहरणों पर प्रशिक्षित किया।
    • पहले: रोबोट ठीक-ठाक था (स्कोर: 6.4/10)।
    • बाद में: रोबोट अद्भुत हो गया (स्कोर: 7.1/10)।
    • सबक: 46,000 बिखरे हुए उदाहरणों के बजाय 20,000 सटीक उदाहरणों पर प्रशिक्षित होना बेहतर है। EDITREWARD ने सफलतापूर्वक रसोई को साफ किया ताकि रोबोट सही ढंग से सीख सके।

सारांश

EDITREWARD को एक अत्यंत सख्त, उच्च प्रशिक्षित कला समीक्षक के रूप में समझें जिसने इमेज एडिटिंग की हर किताब पढ़ ली है।

  1. इसने 2,00,000 सावधानीपूर्वक ग्रेड किए गए उदाहरणों से सीखा।
  2. यह वर्तमान "प्रसिद्ध" AI समीक्षकों की तुलना में कला को परखने में बेहतर है।
  3. सबसे महत्वपूर्ण बात यह है कि यह बिखरे हुए ट्रेनिंग डेटा को साफ कर सकता है, जिससे ओपन-सोर्स इमेज एडिटिंग टूल्स को महंगे, क्लोज्ड-सोर्स दिग्गजों (जैसे OpenAI या Google के टूल्स) के बराबर आने में मदद मिलती है।

लेखक इस "समीक्षक", "ग्रेड की गई कला की लाइब्रेरी", और "परीक्षा" को जनता के लिए जारी कर रहे हैं, ताकि भविष्य में बेहतर इमेज-एडिटिंग रोबोट बनाने में सभी की मदद हो सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →