← नवीनतम पेपर
🤖 AI

OctoT2I: A Self-Evolving Agentic Text-to-Image Router

OctoT2I एक नवीन स्व-विकसित एजेंटिक फ्रेमवर्क है जो मानव-पर्यवेक्षण-मुक्त, पुनरावृत्ति शिक्षण तंत्र का उपयोग करके कई मॉडलों के बीच कार्यों को गतिशील रूप से रूट करता है, जिससे मौजूदा टेक्स्ट-टू-इमेज विधियों की सीमाओं को संबोधित किया जाता है, और इस प्रकार जनरेशन गुणवत्ता और इन्फरेंस दक्षता के बीच एक बेहतर संतुलन प्राप्त किया जाता है।

मूल लेखक: Xu Jiang, Bin Chen, Gehui Li, Yule Duan, Ronggang Wang, Jian Zhang

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xu Jiang, Bin Chen, Gehui Li, Yule Duan, Ronggang Wang, Jian Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक आर्ट सप्लाई स्टोर (कला सामग्री की दुकान) में जा रहे हैं। इस स्टोर में हजारों अलग-अलग कलाकार (AI मॉडल्स) हैं, लेकिन वे सभी बहुत अलग हैं:

  • कलाकार A एक स्पीड डेमन (गति का भूत) है। वह एक सेकंड के भीतर एक चित्र बना सकता है, लेकिन वह अक्सर वस्तुओं की सही संख्या बनाना भूल जाता है (जैसे आपसे पांच सेबों के लिए कहने पर तीन सेब बना देना)।
  • कलाकार B एक धीमा, सूक्ष्मता से काम करने वाला पूर्णतावादी (परफेक्शनिस्ट) है। वह बहुत समय और ऊर्जा लेता है, लेकिन वह जटिल निर्देशों का पालन करने में माहिर है, जैसे "एक नीले कुत्ते के बाईं ओर एक लाल कुर्सी रखें।"
  • कलाकार C रंगों के मामले में बेहतरीन है लेकिन आकृतियों (शेप्स) में बहुत खराब है।

अतीत में, यदि आप किसी कंप्यूटर को कोई चित्र बनाने के लिए कहते, तो वह बस एक कलाकार को चुन लेता और उम्मीद करता कि सब ठीक होगा। यदि उसने एक जटिल कार्य के लिए स्पीड डेमन को चुना, तो आपको एक गड़बड़ परिणाम मिलता। यदि उसने एक सरल कार्य के लिए परफेक्शनिस्ट को चुना, तो आप समय और बिजली बर्बाद करते।

एंट्री ऑक्टोटी2आई (OctoT2I): "स्मार्ट आर्ट डायरेक्टर"

यह पेपर OctoT2I को पेश करता है, जो एक शानदार, स्वयं सीखने वाले "आर्ट डायरेक्टर" की तरह काम करता है। यह अनुमान लगाने के बजाय कि किस कलाकार का उपयोग करना है, OctoT2I सीखता है कि हर विशिष्ट कार्य के लिए कौन सबसे अच्छा है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "स्वयं विकसित होने वाला" इंटर्न (मानव शिक्षकों की आवश्यकता नहीं)

आमतौर पर, कंप्यूटर को यह सिखाने के लिए कि कौन सा कलाकार किस काम में अच्छा है, इंसानों को लंबे मैनुअल लिखने पड़ते हैं या हजारों उदाहरणों को लेबल करने में वर्षों बिताने पड़ते हैं। यह महंगा और धीमा है।

OctoT2I अलग है। इसमें एक "सेल्फ-इवॉल्विंग मैकेनिज्म" (स्वयं विकसित होने वाली प्रणाली) है। इसे एक ऐसे इंटर्न के रूप में सोचें जो पूरी तरह से करके सीखता है।

  • लूप (चक्र): इंटर्न एक कार्य चुनता है (जैसे, "5 बिल्लियाँ बनाओ"), फिर उसे कलाकार A, फिर कलाकार B, फिर कलाकार C के साथ आजमाता है।
  • ग्रेडिंग (मूल्यांकन): वह परिणामों की जाँच करता है। क्या कलाकार A ने 5 बिल्लियाँ बनाईं? नहीं, उन्होंने 3 बनाईं। क्या कलाकार B ने 5 बनाईं? हाँ!
  • मेमोरी (याददाश्त): वह इसे अपनी व्यक्तिगत नोटबुक में लिखता है। "कलाकार B गिनती के लिए महान है; कलाकार A तेज़ है लेकिन गिनती में खराब है।"
  • प्रूनिंग (छंटाई): इंटर्न इतना स्मार्ट है कि वह उन चीजों का परीक्षण करने में समय बर्बाद करना बंद कर देता है जिन्हें वह पहले से जानता है। यदि वह जानता है कि कलाकार A गिनती में बुरा है, तो वह अगली बार "100 हाथियों" के लिए कलाकार A का परीक्षण करने की जहमत नहीं उठाएगा। वह केवल नए, कठिन संयोजनों का परीक्षण करता है।

समय के साथ, यह इंटर्न ठीक से जानता है कि किस प्रॉम्प्ट के लिए किस टूल का उपयोग करना है, और यह सब बिना किसी इंसान के निर्देश दिए कर लेता है।

2. "रीज़न-एक्ट-रिफ्लेक्ट" लूप (निर्णय लेने की प्रक्रिया)

जब आप OctoT2I को एक चित्र बनाने के लिए कहते हैं, तो यह केवल एक कलाकार को चुनकर चलता नहीं है। यह एक स्मार्ट चक्र चलाता है:

  1. रीज़न (तर्क): यह आपके अनुरोध को देखता है (जैसे, "एक स्नोबोर्ड की फोटो") और अपनी नोटबुक चेक करता है। "आह, यह सरल है। मैं समय बचाने के लिए स्पीड डेमन (sd-turbo) का उपयोग करूँगा।"
  2. एक्ट (कार्य): यह अनुरोध को स्पीड डेमन के पास भेजता है।
  3. रिफ्लेक्ट (चिंतन): यह परिणाम की जाँच करता है। "बिल्कुल सही! 0.5 सेकंड में हो गया।"
  4. सेफ्टी नेट (सुरक्षा जाल): लेकिन यदि आप कुछ कठिन पूछते हैं, जैसे "5 हैमबर्गर," तो सिस्टम अपनी नोटबुक फिर से चेक करता है। "ओह, स्पीड डेमन गिनती में विफल रहता है। मुझे परफेक्शनिस्ट (flow-grpo) की आवश्यकता है।" यह बीच में ही टूल बदल देता है यदि पहला प्रयास पर्याप्त नहीं होता।

3. परिणाम: तेज़, सस्ता और सटीक

पेपर का दावा है कि OctoT2I एक गेम-चेंजर है क्योंकि यह क्वालिटी (गुणवत्ता) और एफिशिएंसी (दक्षता) के बीच संतुलन बनाता है:

  • स्पीड (गति): यह पिछले स्मार्ट सिस्टम की तुलना में 90% तेज़ है। यह जानता है कि कब तेज़ टूल्स का उपयोग करना है और कब धीमे टूल्स का, जिससे अनावश्यक देरी से बचा जा सके।
  • ऊर्जा: क्योंकि यह गलत टूल्स पर समय बर्बाद करना बंद कर देता है, इसलिए यह 56% कम ऊर्जा का उपयोग करता है।
  • सटीकता: मानक परीक्षणों पर, इसने 0.96 आउट ऑफ 1.0 स्कोर किया, जो सभी अन्य "एजेंटिक" (मल्टी-टूल) सिस्टम को पीछे छोड़ देता है। यह विशिष्ट वस्तुओं की संख्या और स्थानिक संबंधों (जैसे, "गेंद बॉक्स के पीछे है") जैसे कठिन अनुरोधों को सही ढंग से संभालता है जिन्हें अन्य सिस्टम गलत कर देते हैं।

सारांश उपमा (Analogy)

कल्पना कीजिए कि आप एक शेफ हैं।

  • पुराना तरीका: आपके पास एक चाकू है। कभी आपको प्याज काटना होता है (आसान), कभी आपको मछली का फिलेट निकालना होता है (कठिन)। आप दोनों के लिए एक ही चाकू का उपयोग करते हैं। यह मछली के लिए धीमा है और प्याज के लिए ज़रूरत से ज़्यादा (overkill) है।
  • OctoT2I का तरीका: आपके पास विशेष चाकूओं की एक दराज है। आपके पास एक स्मार्ट सू-शेफ (Sous-Chef) (OctoT2I) है जिसने ट्रायल एंड एरर के माध्यम से सीखा है कि हर एक सामग्री के लिए कौन सा चाकू उठाना है।
    • यदि आप कहते हैं "प्याज काटो," तो सू-शेफ तेज़, सस्ता चाकू उठाता है।
    • यदि आप कहते हैं "मछली का फिलेट निकालो," तो वह सटीक, महंगा चाकू उठाता है।
    • सू-शेफ ने यह कौशल पूरी तरह से रसोई में अभ्यास करके सीखा है, न कि किसी इंसान द्वारा लिखे गए मैनुअल को पढ़कर।

परिणाम? आपको बेहतरीन भोजन मिलता है, तेज़ सेवा के साथ, और कम बर्बादी के साथ। यही वह काम है जो OctoT2I AI इमेज जनरेशन के लिए करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →