← नवीनतम पेपर
💻 computer science

ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework

यह शोधपत्र ScaleEditor को पेश करता है, जो एक पूर्णतः ओपन-सोर्स पदानुक्रमित मल्टी-एजेंट फ्रेमवर्क है जो अब तक का सबसे बड़ा इमेज एडिटिंग डेटासेट (ScaleEdit-12M) उत्पन्न करता है, और यह प्रदर्शित करता है कि एजेंटिक पाइपलाइन्स महंगी प्रोप्रायटरी APIs पर निर्भर हुए बिना वाणिज्यिक-ग्रेड डेटा गुणवत्ता प्राप्त कर सकती हैं और मॉडल के प्रदर्शन में महत्वपूर्ण सुधार कर सकती हैं।

मूल लेखक: Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang, Ganlin Yang, Yu Qiao, Hongsheng Li, Gen Luo, Hongjie Zhang

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang, Ganlin Yang, Yu Qiao, Hongsheng Li, Gen Luo, Hongjie Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को ठीक वैसा ही पेंट करना सिखाना चाहते जैसा आप कल्पना करते हैं। आप उसे कहते हैं, "आसमान को सूर्यास्त में बदल दो," "उस बदसूरत साइन बोर्ड को हटा दो," या "इस फोटो को कॉमिक बुक में बदल दो।"

लंबे समय तक, इन रोबोट्स को सिखाना केवल भोजन के कुछ टुकड़ों का उपयोग करके एक कुत्ते को प्रशिक्षित करने जैसा था। डेटा (वे "टुकड़े") या तो बहुत कम था, या बहुत अव्यवस्थित था, या इसे प्राप्त करने के लिए बहुत अधिक शुल्क देना पड़ता था क्योंकि उदाहरण बनाने के लिए "सुपर-रोबोट्स" (कमर्शियल AI) का उपयोग करना पड़ता था।

ScaleEdit-12M एक नया प्रोजेक्ट है जो रोब-हेल्पर्स की एक टीम का उपयोग करके एक विशाल, मुफ्त और उच्च गुणवत्ता वाला प्रशिक्षण किचन बनाकर इस समस्या को हल करता है।

यहाँ इसका सरल विवरण दिया गया है कि उन्होंने इसे कैसे किया:

1. समस्या: "महंगे शेफ" की दुविधा

पहले, अच्छा प्रशिक्षण डेटा प्राप्त करने के लिए, शोधकर्ताओं के पास दो बुरे विकल्प थे:

  • विकल्प A: डेटा बनाने के लिए एक सस्ते, ओपन-सोर्स रोबोट का उपयोग करें। लेकिन यह रोबोट अनाड़ी था, जिससे ऐसी तस्वीरें बनती थीं जो अजीब दिखती थीं या निर्देशों का ठीक से पालन नहीं करती थीं।
  • विकल्प B: डेटा बनाने के लिए एक "सुपर शेफ" (जैसे GPT-4o) को भुगतान करें। परिणाम स्वादिष्ट थे, लेकिन बिल इतना अधिक था कि आप केवल एक छोटा सा भोजन ही बना सकते थे। आप पूरी दुनिया को खिला नहीं सकते थे।

2. समाधान: "रोबोट असेंबली लाइन" (ScaleEditor)

लेखकों ने ScaleEditor नामक एक नई प्रणाली बनाई। इसे एक अकेले रोबोट के रूप में नहीं, बल्कि एक फैक्ट्री असेंबली लाइन के रूप में सोचें जो विशेषज्ञ रोबोट श्रमिकों की एक टीम द्वारा संचालित होती है जो कभी थकते नहीं हैं और जिनकी कोई लागत नहीं है।

उनकी यह "फैक्ट्री" तीन चरणों में कैसे काम करती है:

  • चरण 1: खोजकर्ता (Source Expansion)
    कल्पना कीजिए कि रोबोटों की एक टीम पूरे इंटरनेट, पुस्तकालयों और यहाँ तक कि नए चित्र खुद बनाकर खोजबीन कर रही है। वे 10 मिलियन से अधिक विभिन्न चित्र एकत्र करते हैं—समुद्र तट, शहर, लोग, जानवर—ताकि प्रशिक्षण डेटा केवल बिल्लियों और कुत्तों के बारे में न हो। यह सब कुछ के बारे में है।
  • चरण 2: संपादक (Multi-Agent Synthesis)
    यही जादुई हिस्सा है। एक अकेले रोबोट द्वारा सब कुछ करने के बजाय, वे एक टास्क राउटर (एक फोरमैन की तरह) का उपयोग करते हैं।
    • यदि चित्र एक इमारत का है, तो फोरमैन उसे "आर्किटेक्चर रोबोट" के पास भेज देता है।
    • यदि चित्र में टेक्स्ट है, तो वह "टाइपो-फिक्सिंग रोबोट" के पास जाता है।
    • यदि निर्देश जटिल है (जैसे "सूरज को पिघलती हुई घड़ी जैसा दिखाओ"), तो वह "लॉजिक रोबोट" के पास जाता है।
      प्रत्येक विशेष रोबोट एक विशिष्ट निर्देश लिखता है और उस काम के लिए फोटो को पूरी तरह से संपादित करता है। वे मिलकर 12 मिलियन अद्वितीय "पहले और बाद के" (Before and After) जोड़े बनाते हैं।
  • चरण 3: निरीक्षक (Quality Control)
    डेटा का उपयोग करने से पहले, "निरीक्षकों" (AI रोबोट्स की एक अन्य टीम) की एक टीम हर एक फोटो की जांच करती है। वे पूछते हैं:
    • "क्या रोबोट ने वास्तव में वही किया जो निर्देश में कहा गया था?"
    • "क्या फोटो प्राकृतिक दिखती है, या इसमें कोई गड़बड़ी (glitch) है?"
    • "क्या लाइटिंग सही है?"
      यदि कोई फोटो एक भी जांच में विफल हो जाती है, तो उसे कचरे में फेंक दिया जाता है। केवल उत्तम 12 मिलियन ही चयन के योग्य होते हैं।

3. परिणाम: "सुपर-स्टूडेंट"

उन्होंने इस विशाल, उच्च-गुणवत्ता वाले डेटासेट (जिसे ScaleEdit-12M कहा जाता है) का उपयोग दो लोकप्रिय ओपन-सोर्स AI मॉडल्स (UniWorld-V1 और Bagel) को प्रशिक्षित करने के लिए किया।

उपमा (Analogy):
कल्पना कीजिए कि आपके पास एक छात्र है जो कला में ठीक-ठाक है।

  • पहले: आपने उन्हें अध्ययन करने के लिए कुछ पुरानी, धुंधली पत्रिकाएं दीं। वे थोड़ा सुधरे।
  • बाद में: आपने उन्हें चरण-दर-चरण निर्देशों के साथ 12 मिलियन उत्तम, हाई-डेफिनिशन आर्ट बुक्स की एक लाइब्रेरी दी।
  • परिणाम: छात्र केवल थोड़ा बेहतर नहीं हुआ; वह एक मास्टर बन गया।

4. यह क्यों महत्वपूर्ण है

पेपर दिखाता है कि जब उन्होंने इन नए मॉडल्स का परीक्षण किया:

  • उन्होंने लगभग हर अन्य ओपन-सोर्स मॉडल को पछाड़ दिया।
  • उन्होंने महंगे, कमर्शियल डेटा (जिसकी लागत लाखों में थी) पर प्रशिक्षित मॉडल्स के बराबर प्रदर्शन किया।
  • वे कठिन कार्यों में बहुत अच्छे हो गए, जैसे साइन बोर्ड में टेक्स्ट को ठीक करना या किसी वस्तु के भौतिक विज्ञान (physics) को बदलना (जैसे, अंडे को टूटा हुआ दिखाना)।

मुख्य बात (The Bottom Line)

यह पेपर साबित करता है कि महान AI को प्रशिक्षित करने के लिए आपको "सुपर शेफ" पर बहुत सारा पैसा खर्च करने की आवश्यकता नहीं है। एक स्मार्ट, स्वचालित रोबोट वर्कर्स की टीम (एक मल्टी-एजेंट फ्रेमवर्क) बनाकर, आप मुफ्त में एक विशाल, उच्च-गुणवत्ता वाला डेटासेट तैयार कर सकते हैं।

यह एक छोटे, अव्यवस्थित घरेलू किचन को एक विश्व स्तरीय, स्वचालित रेस्टोरेंट चेन में बदलने जैसा है जो पूरे AI समुदाय को खिलाती है, यह साबित करते हुए कि ओपन-सोर्स सहयोग महंगे, बंद दरवाजों वाले रहस्यों की बराबरी कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →