← नवीनतम पेपर
💻 computer science

EditCaption: Human-Aligned Instruction Synthesis for Image Editing via Supervised Fine-Tuning and Direct Preference Optimization

यह शोध पत्र EditCaption का प्रस्ताव करता है, जो एक दो-चरणीय पोस्ट-ट्रेनिंग पाइपलाइन है जो विजन-लैंग्वेज मॉडल्स में व्यवस्थित विफलता मोड को संबोधित करने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन को जोड़ता है, जिससे उच्च-गुणवत्ता वाले, मानव-संरेखित निर्देश ट्रिपलेट्स उत्पन्न होते हैं जो अत्याधुनिक बेसलाइनों की तुलना में इमेज एडिटिंग प्रदर्शन में महत्वपूर्ण सुधार करते हैं।

मूल लेखक: Xiangyuan Wang, Honghao Cai, Yunhao Bai, Tianze Zhou, Haohua Chen, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangyuan Wang, Honghao Cai, Yunhao Bai, Tianze Zhou, Haohua Chen, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को पेंटिंग करना सिखा रहे हैं। आप उसे केवल एक "पहले" की तस्वीर और एक "बाद की" तस्वीर नहीं दिखाते; बल्कि आपको पहली तस्वीर को दूसरी में बदलने के लिए एक रेसिपी (एक निर्देश) देनी होती है।

उदाहरण के लिए, यदि "पहले" की तस्वीर में पार्क में एक कुत्ता है, और "बाद की" तस्वीर में वही कुत्ता बाईं ओर एक टोपी पहने हुए है, तो रेसिपी को कहना होगा: "कुत्ते के बाएं कान पर एक टोपी रखें।"

समस्या यह है कि जब हम इन बड़ी, बुद्धिमान एआई कंप्यूटरों (जिन्हें विजन-लैंग्वेज मॉडल्स कहा जाता है) से इन रेसिपी को स्वचालित रूप से लिखने के लिए कहते हैं, तो वे अक्सर भ्रमित हो जाते हैं। वे कह सकते हैं, "कुत्ते के दाएं कान पर एक टोपी रखें," या वे यह बताना भूल सकते हैं कि टोपी लाल रंग की है, या वे फोटो के एंगल को गलत समझ सकते हैं। यदि रोबोट कलाकार एक खराब रेसिपी का पालन करता है, तो पेंटिंग गलत बनेगी।

यह शोध पत्र, जिसका शीर्षक EditCaption है, रोबोट की इन रेसिपी लिखने की क्षमता को ठीक करने के बारे में है ताकि वे एकदम सटीक हों।

तीन बड़ी गलतियाँ

लेखकों ने पाया कि जब एआई दो तस्वीरों के बीच के अंतर का वर्णन करने की कोशिश करता है, तो वह तीन विशिष्ट प्रकार की "हलुसिनेशन" (गलतियाँ) करता है:

  1. "बाएं/दाएं" का घालमेल: एआई अपने निर्देश उल्टे कर देता है। वह सोचता है कि "बायां" वास्तव में "दायां" है।
  2. "कैमरा एंगल" का भ्रम: एआई यह नहीं समझ पाता कि कैमरा करीब आया है या व्यक्ति घूम गया है। वह परिप्रेक्ष्य (परस्पेक्टिव) को गलत समझ लेता है।
  3. "अस्पष्ट विवरण" की समस्या: एआई कहता है "रंग बदलें" बजाय इसके कि "शर्ट को नीले से लाल में बदलें"। वह छोटे, महत्वपूर्ण विवरणों को छोड़ देता है।

वास्तव में, लेखकों ने इसका परीक्षण किया और पाया कि सबसे अच्छे एआई मॉडल्स द्वारा लिखी गई रेसिपी में से लगभग आधा (47%) इतनी खराब थी कि एक इंसान भी उसका उपयोग रोबोट कलाकार को प्रशिक्षित करने के लिए नहीं कर सकता था।

समाधान: दो-चरणीय प्रशिक्षण शिविर (Two-Step Training Camp)

इसे ठीक करने के लिए, लेखकों ने एक नया सिस्टम बनाया जिसे EditCaption कहा जाता है। इसे एआई के लिए एक दो-चरणीय प्रशिक्षण शिविर के रूप में समझें, जिसे उसे एक भ्रमित छात्र से एक मास्टर एडिटर में बदलने के लिए डिज़ाइन किया गया है।

चरण 1: "होमवर्क" चरण (सुपरवाइज्ड फाइन-ट्यूनिंग)

सबसे पहले, उन्होंने 100,000 फोटो जोड़े एकत्र किए। उन्होंने एक स्मार्ट एआई से शुरुआती रेसिपी लिखने के लिए कहा, लेकिन फिर उन्होंने खराब रेसिपी को हटाने के लिए एक "क्वालिटी चेकर" (एक टूल जिसे EditScore कहा जाता है) का उपयोग किया।

फिर, सबसे महत्वपूर्ण हिस्सा: इंसानों ने हस्तक्षेप किया। वास्तविक लोगों ने शेष 100,000 रेसिपी को देखा और उन्हें सुधारा। उन्होंने बाएं/दाएं के भ्रम को ठीक किया, कैमरा एंगल को स्पष्ट किया, और छूटे हुए विवरण जोड़े (जैसे केवल "टोपी" के बजाय "लाल टोपी")। एआई ने इन 100,000 परफेक्ट रेसिपी को एक छात्र की तरह पाठ्यपुस्तक का अध्ययन करते हुए सीखा। इसे सुपरवाइज़्ड फाइन-ट्यूनिंग (SFT) कहा जाता है।

चरण 2: "बहस" चरण (डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन)

इस प्रशिक्षण के बाद भी, एआई अभी भी कुछ सूक्ष्म गलतियाँ कर रहा था। इसलिए, लेखकों ने एक "बहस" आयोजित की।

उन्होंने एआई को एक फोटो जोड़ा दिखाया और उसे एक रेसिपी लिखने के लिए कहा। एआई ने एक "अच्छी लेकिन त्रुटिपूर्ण" रेसिपी लिखी (जैसे, "दाएं ओर एक टोपी रखें" )। फिर, एक इंसान ने एक परफेक्ट रेसिपी लिखी (जैसे, "बाईं ओर एक टोपी रखें" )।

एआई को ये दोनों संस्करण दिखाए गए और कहा गया: "इंसान वाला संस्करण विजेता है। आपको यह सीखने की जरूरत है कि मानव संस्करण बेहतर क्यों है और जो गलती आपने अभी की है उसे दोबारा न दोहराएं।" यह प्रक्रिया, जिसे डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (DPO) कहा जाता है, एआई को उसके अपने दोषों की तुलना मानवीय पूर्णता से करके अपनी बुरी आदतों से बचने के लिए सिखाती है।

परिणाम: दिग्गजों को पछाड़ना

लेखकों ने अपने नए एआई (जो Qwen3-VL नामक मॉडल पर आधारित है) का परीक्षण जेमिनी और GPT-4 जैसे कुछ बहुत महंगे, क्लोज्ड-सोर्स दिग्गजों सहित अन्य प्रसिद्ध एआई मॉडल्स के विरुद्ध किया।

  • स्कोर: उनके नए एआई ने एक कठिन परीक्षण में 5 में से 4.712 का स्कोर किया, जिससे पिछले लीडर्स को पीछे छोड़ दिया।
  • मानव परीक्षण: प्रशिक्षण से पहले, एआई के निर्देश 47% बार बेकार थे। उनके दो-चरणीय प्रशिक्षण के बाद, "बेकार" होने की दर घटकर केवल 23% रह गई, और "सही" होने की दर बढ़कर 66% हो गई।

बड़ी तस्वीर (The Big Picture)

यह क्यों मायने रखता है?
फोटो एडिट करने के लिए एआई बनाना कठिन है क्योंकि आपको लाखों "पहले/बाद के" उदाहरणों की आवश्यकता होती है जिनमें एकदम सटीक निर्देश हों। लाखों निर्देश लिखने के लिए इंसानों को काम पर रखना बहुत महंगा और धीमा है।

EditCaption इन निर्देशों को स्वचालित रूप से उत्पन्न करने का एक स्केलेबल तरीका प्रदान करता है। यह एक ऐसी मशीन बनाने जैसा है जो रोबोट शेफ के लिए एकदम सही कुकिंग रेसिपी लिख सकती है। एक बार जब रोबोट शेफ इन सटीक रेसिपी से सीख जाता है, तो वह हमारे आदेशों का सटीक रूप से पालन करते हुए हमारे लिए अद्भुत नई छवियां बना सकता है, बिना बाएं, दाएं या रंगों के बारे में भ्रमित हुए।

संक्षेप में: उन्होंने पाया कि एआई निर्देश देने में बुरा था, उन्होंने उसे मानवीय सुधारों का उपयोग करके सही तरीका सिखाने के लिए एक सिस्टम बनाया, और उन्होंने साबित किया कि यह नया शिक्षक एआई को लगभग किसी भी अन्य मॉडल से अधिक स्मार्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →