← नवीनतम पेपर
⚡ electrical engineering

FireRed-Image-Edit-1.0 Technical Report

यह शोध पत्र FireRed-Image-Edit को प्रस्तुत करता है, जो एक अत्याधुनिक डिफ्यूजन ट्रांसफार्मर है जो निर्देश-आधारित इमेज एडिटिंग के लिए एक सावधानीपूर्वक क्यूरेट किए गए 100M-सैंपल प्रशिक्षण कॉर्पस, डेटा दक्षता और नियंत्रणीयता के लिए नवीन तकनीकों वाले मल्टी-स्टेज ऑप्टिमाइज़ेशन पाइपलाइन, और विविध एडिटिंग कार्यों में उत्कृष्ट प्रदर्शन प्राप्त करने के लिए व्यापक REDEdit-Bench का लाभ उठाता है।

मूल लेखक: Super Intelligence Team, Changhao Qiao, Chao Hui, Chen Li, Cunzheng Wang, Dejia Song, Jiale Zhang, Jing Li, Qiang Xiang, Runqi Wang, Shuang Sun, Wei Zhu, Xu Tang, Yao Hu, Yibo Chen, Yuhao Huang, Yuxua
प्रकाशित 2026-06-16
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Super Intelligence Team, Changhao Qiao, Chao Hui, Chen Li, Cunzheng Wang, Dejia Song, Jiale Zhang, Jing Li, Qiang Xiang, Runqi Wang, Shuang Sun, Wei Zhu, Xu Tang, Yao Hu, Yibo Chen, Yuhao Huang, Yuxuan Duan, Zhiyi Chen, Ziyuan Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ FireRed-Image-Edit पेपर का हिंदी अनुवाद दिया गया है:

मुख्य विचार: तस्वीरों के लिए एक मास्टर शेफ

कल्पना कीजिए कि आपके पास एक फोटो है, और आप उसे बदलना चाहते हैं। शायद आप कुत्ते को बिल्ली से बदलना चाहते हैं, आसमान को नीले से सूर्यास्त में बदलना चाहते हैं, या किसी साइन पर लिखे टेक्स्ट को ठीक करना चाहते हैं।

ज्यादातर AI टूल्स नौसिखिया रसोइयों (novice cooks) की तरह हैं: वे खाना जला सकते हैं, रेसिपी भूल सकते हैं, या एक मसाला डालने के चक्कर में पूरा किचन ही बर्बाद कर सकते हैं। कुछ "ब्लैक बॉक्स" कमर्शियल शेफ हैं (जैसे Nano Banana Pro) जो शानदार व्यंजन तो बनाते हैं लेकिन यह नहीं बताते कि वे इसे कैसे करते हैं। अन्य ओपन-सोर्स शेफ हैं जो सिर्फ एक बड़ा और बड़ा किचन (अधिक कंप्यूटर पावर) खरीदकर खाना बनाने की कोशिश करते हैं, जो महंगा और बर्बादी भरा है।

FireRed-Image-Edit एक मास्टर शेफ की तरह है जिसे बड़े किचन की जरूरत नहीं है। इसके बजाय, उन्होंने अपनी रेसिपी, सामग्री (ingredients), और पकाने की तकनीक को बेहतर बनाया है। वे एक साधारण निर्देश ("सूप को तीखा बनाओ") ले सकते हैं और पूरे भोजन को खराब किए बिना उसे पूरी तरह से निष्पादित कर सकते हैं।


1. सामग्री: एक विशाल, स्वच्छ पेंट्री (Pantry)

एक शानदार भोजन पकाने के लिए, आपको बेहतरीन सामग्री की आवश्यकता होती है। टीम ने केवल सड़क से रैंडम खाना नहीं उठाया; उन्होंने एक विशाल, व्यवस्थित पेंट्री बनाई।

  • संग्रह (The Collection): उन्होंने 1.6 बिलियन "रेसिपी कार्ड" (इमेज और टेक्स्ट जोड़े) एकत्र किए। यह बहुत सारा डेटा है!
  • सफाई (The Cleaning): कल्पना कीजिए कि आपको एक रेसिपी मिलती है जिसमें लिखा है "नमक डालें" लेकिन फोटो धुंधली है, उस पर वॉटरमार्क है, या वह केवल एक डुप्लिकेट है। उन्होंने एक स्मार्ट फिल्टर सिस्टम बनाया (एक बहुत ही सख्त खाद्य सुरक्षा निरीक्षक की तरह) ताकि खराब सामग्री को बाहर निकाला जा सके। उन्होंने डुप्लिकेट, धुंधली तस्वीरों और ऐसी छवियों को हटा दिया जो अन्य रोबोटों द्वारा बनाई गई लगती थीं (ताकि डेटा वास्तविक रहे)।
  • परिणाम: इतनी सारी सफाई के बाद, उन्होंने टॉप 100 मिलियन उच्च-गुणवत्ता वाले नमूनों को रखा। उन्होंने सुनिश्चित किया कि उनके पास "शून्य से निर्माण करने" (Text-to-Image) और "मौजूदा फोटो को बदलने" (Image Editing) का एक सटीक 50/50 मिश्रण हो।

उपमा (Analogy): इसे एक ऐसे लाइब्रेरियन की तरह समझें जो लाखों बिखरी हुई किताबों को छाँटता है, फटे हुए और खाली पन्नों को फेंक देता है, और शेष 100,000 बेहतरीन किताबों को एक ऐसी लाइब्रेरी में व्यवस्थित करता है जहाँ हर सेक्शन संतुलित हो।

2. पकाने की तकनीक: स्मार्ट ट्रेनिंग

सभी सामग्रियों को बस एक बर्तन में डालकर उम्मीद करने के बजाय, उन्होंने एक परिष्कृत बहु-चरणीय पकाने की प्रक्रिया (multi-stage cooking process) का उपयोग किया।

  • चरण 1: प्री-ट्रेनिंग (बुनियादी बातें): उन्होंने AI को दुनिया की बुनियादी बातें सिखाईं—एक कुत्ता कैसा दिखता है, सूर्यास्त क्या है, टेक्स्ट कैसे काम करता है। उन्होंने एक "करिकुलम" दृष्टिकोण का उपयोग किया, बड़ी तस्वीर (लो नॉइज़) से शुरू करके धीरे-धीरे सूक्ष्म विवरणों (हाई नॉइज़) की ओर बढ़े, ताकि AI अभिभूत न हो जाए।
  • चरण 2: फाइन-ट्यूनिंग (विशेषज्ञता): अब, उन्होंने AI को विशेष रूप से निर्देशों का पालन करना सिखाया। यदि आप कहते हैं "बिल्ली को बाईं ओर ले जाओ," तो AI बिना कुत्ते को हिलाए ठीक वही करने के बारे में सीखता है।
  • चरण 3: सुदृढीकरण सीखना (Reinforcement Learning - स्वाद परीक्षण): यह उनका सीक्रेट सॉस है। उन्होंने DPO (Direct Preference Optimization) नामक सिस्टम का उपयोग किया। कल्पना कीजिए कि AI एक फोटो के दो संस्करण बनाता है। एक "जज" (एक स्मार्ट AI मॉडल) बेहतर वाले को चुनता है। FireRed मॉडल इन विकल्पों से सीखकर बेहतर और बेहतर होता जाता है।
    • विशेष ट्रिक: उन्होंने Asymmetric Gradient Optimization नामक तकनीक का उपयोग किया। इसे इस तरह समझें कि शेफ को कहना: "सिर्फ टोस्ट जलने से बचने पर ध्यान न दें; बल्कि टोस्ट को परफेक्टली गोल्डन बनाने पर सक्रिय रूप से ध्यान केंद्रित करें।" यह AI को केवल गलतियों से बचने के बजाय उच्च-गुणवत्ता वाले परिणाम बनाने के लिए प्रेरित करता है।

उपमा: यह एक छात्र की तरह है जो पहले गणित सीखता है, फिर बीजगणित (algebra) सीखता है, और अंत में एक ऐसी परीक्षा देता है जहाँ एक ट्यूटर उसके काम को ग्रेड देता है। यदि वह कोई प्रश्न गलत करता है, तो ट्यूटर केवल "गलत" नहीं कहता; वह उसे सही तरीका दिखाता है, और छात्र उस विशिष्ट कौशल में महारत हासिल करने पर ध्यान केंद्रित करता है।

3. उपकरण: दक्षता और सटीकता

पेपर में कुछ चतुर उपकरणों का परिचय दिया गया है जो खाना पकाने को तेज़ और अधिक सटीक बनाते हैं।

  • बकेट सैंपलर (The Bucket Sampler): आमतौर पर, कंप्यूटर चौकोर फोटो और लंबी फोटो को एक ही ट्रे में फिट करने में समय बर्बाद करते हैं। FireRed एक स्मार्ट ट्रे सिस्टम का उपयोग करता है जो समान आकार के फोटो को एक साथ समूहबद्ध करता है, ताकि कंप्यूटर खाली जगह पर ऊर्जा बर्बाद न करे।
  • स्टोकेस्टिक इंस्ट्रक्शन अलाइनमेंट (Stochastic Instruction Alignment): कभी-कभी, एक निर्देश कहता है "Fig 1" और "Fig 2।" यदि कंप्यूटर क्रम बदल देता है, तो AI भ्रमित हो सकता है। FireRed AI को यह सिखाता है कि "Fig 1" केवल एक लेबल है, और उसे कंटेंट (विषय-वस्तु) को देखना चाहिए, न कि क्रम को। यह एक बच्चे को सिखाने जैसा है कि "लाल गेंद" लाल गेंद ही है, चाहे वह मेज के बाईं ओर हो या दाईं ओर।
  • पहचान संरक्षण (Identity Preservation): जब किसी व्यक्ति की फोटो को एडिट किया जाता है, तो आप नहीं चाहेंगे कि उसका चेहरा किसी और जैसा हो जाए। FireRed एक कंसिस्टेंसी लॉस (Consistency Loss) (एक सुरक्षा जाल) का उपयोग करता है जो एडिटिंग प्रक्रिया के दौरान चेहरे की जांच करता है। यह एक सुरक्षा गार्ड की तरह है जो सुनिश्चित करता है कि जबकि आप कपड़े बदल रहे हैं, व्यक्ति का चेहरा बिल्कुल वैसा ही रहे।

4. स्वाद परीक्षण: एक नया बेंचमार्क

अपने मॉडल को सिद्ध करने के लिए, उन्होंने केवल पुराने परीक्षणों का उपयोग नहीं किया। उन्होंने एक नया, व्यापक परीक्षण बनाया जिसे REDEdit-Bench कहा जाता है।

  • परीक्षण: इसमें 1,673 अलग-अलग एडिटिंग चुनौतियाँ हैं, जिनमें "बैकग्राउंड बदलना" से लेकर "पोस्टर पर टेक्स्ट ठीक करना" या "व्यक्ति को अधिक सुंदर बनाना" तक शामिल है।
  • फैसला: जब उन्होंने अपने मॉडल को अन्य प्रसिद्ध मॉडलों (ओपन-सोर्स और महंगे कमर्शियल दोनों) के खिलाफ चलाया, तो FireRed-Image-Edit शीर्ष पर रहा या पहले स्थान के लिए टाई हुआ। यह विशेष रूप से अच्छा था:
    • निर्देशों का पालन करने में: जो आपने पूछा वह बिल्कुल वैसा ही करने में।
    • निरंतरता बनाए रखने में: फोटो के उन हिस्सों को न बिगाड़ने में जिन्हें आपने बदलने के लिए नहीं कहा था।
    • टेक्स्ट एडिटिंग में: साइन पर टाइपो (लिखने की गलती) को ठीक करने या शब्दों को बदलने में बिना अक्षरों को अजीब दिखाए।

सारांश

FireRed-Image-Edit एक नया AI मॉडल है जो आपके टेक्स्ट निर्देशों के आधार पर फोटो को एडिट करता है। यह एक विशाल, महंगे कंप्यूटर होने पर निर्भर नहीं है। इसके बजाय, यह निम्नलिखित पर निर्भर है:

  1. सुपर-क्लीन डेटा (सबसे अच्छी सामग्री)।
  2. स्मार्ट ट्रेनिंग स्टेप्स (एक परफेक्ट रेसिपी)।
  3. विशेष उपकरण (कुशल किचन गैजेट्स)।

परिणामस्वरूप, यह एक ऐसा ओपन-सोर्स मॉडल है जो सबसे महंगे कमर्शियल टूल्स के बराबर या कभी-कभी उनसे भी बेहतर तरीके से फोटो एडिट कर सकता है, जबकि यह बहुत अधिक कुशल और समझने में आसान है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →