← नवीनतम पेपर
🤖 AI

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

यह शोध पत्र टेक्स्ट-टू-इमेज इन-कॉन्टेक्स्ट लर्निंग के लिए एक ट्री-ऑफ-थॉट्स रीजनिंग फ्रेमवर्क का प्रस्ताव करता है जो अतिरिक्त प्रशिक्षण की आवश्यकता के बिना संरचनात्मक अस्पष्टता को हल करने और छवि संश्लेषण की गुणवत्ता में सुधार करने के लिए एक बहु-चरणीय पीढ़ी, मूल्यांकन और चयन प्रक्रिया का उपयोग करता है।

मूल लेखक: Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली लेकिन थोड़े भ्रमित कलाकार को एक नया चित्र बनाने के लिए सिखाने की कोशिश कर रहे हैं। आप उन्हें कोई लंबा मैनुअल नहीं देते; इसके बजाय, आप उन्हें तीन छोटे उदाहरण चित्र दिखाते हैं और कहते हैं, "यह पैटर्न है। अब, उसी पैटर्न का उपयोग करके एक समुद्र तट (beach) का चित्र बनाओ।"

यह Text-to-Image In-Context Learning (T2I-ICL) की चुनौती है। "कलाकार" (एक AI मॉडल) को आपके उदाहरणों को देखना होगा, छिपे हुए नियमों (पैटर्न) को समझना होगा और फिर एक नए अनुरोध को लागू करना होगा।

समस्या यह है कि जैसा कि पेपर में बताया गया है, यहाँ तक कि सबसे स्मार्ट AI कलाकार भी भ्रमित हो जाते हैं। वे नियमों को मिला सकते हैं, पैटर्न को भूल सकते हैं, या गलत विचार पर अटक सकते हैं। वे पहली ही कोशिश में उत्तर का अनुमान लगाने की कोशिश करते हैं, और यदि उनका अनुमान गलत होता है, तो अंतिम पेंटिंग एक गड़बड़ बन जाती है।

समाधान: "ट्री ऑफ थॉट्स" (Tree of Thoughts)

लेखक AI को पेंट करने से पहले सोचने में मदद करने के लिए एक नया तरीका प्रस्तावित करते हैं। वे इसे Tree-of-Thoughts (ToT) कहते हैं।

AI के सामान्य तरीके को एक सिंगल-लेन हाईवे के रूप में सोचें। AI सड़क पर चलता है, एक के बाद एक निर्णय लेता है, और एक अंतिम प्रॉम्प्ट (पेंटिंग के लिए निर्देश) तक पहुँचता है। यदि वह शुरुआत में गलत मोड़ ले लेता है, तो वह गलत दिशा में तब तक चलता रहता है जब तक कि वह दुर्घटनाग्रस्त न हो जाए।

Tree-of-Thoughts विधि एक स्काउट्स (खोजी दल) की टीम के साथ हाइकिंग अभियान की तरह है।

  1. स्काउट टीम (शाखाएँ बनाना/Branching): केवल एक स्काउट के चलने के बजाय, AI एक ही समय में कई "स्काउट्स" (संभावित विचार) भेजता है।
  2. चेकपॉइंट्स (चरण/Stages): हाइक को चार विशिष्ट चेकपॉइंट्स में विभाजित किया गया है:
    • दृश्य (Scene): बड़ी तस्वीर क्या है?
    • विशेषता (Attribute): विशिष्ट विवरण क्या हैं (रंग, आकार)?
    • स्थिरता (Stability): क्या यह समझ में आता है? क्या यह स्थिर है?
    • संरचना (Composition): हम सब कुछ कैसे व्यवस्थित करते हैं?
  3. स्कोरकार्ड (मूल्यांकन/Evaluation): प्रत्येक चेकपॉइंट पर, एक "जज" देखता है कि प्रत्येक स्काउट ने अब तक क्या पाया है। जज पूछता है:
    • "क्या आपने मूल उदाहरणों को सुना?"
    • "क्या आपने मुख्य वस्तु को समान रखा?"
    • "क्या आपका विचार स्पष्ट और भ्रमित करने वाला नहीं है?"
    • "क्या आपने बहुत जल्दी निष्कर्ष निकाल लिया?"
  4. कटौती (छंटाई/Pruning): यदि किसी स्काउट का विचार कमजोर या भ्रमित करने वाला है, तो टीम उस शाखा को काट देती है। यदि दो स्काउट्स के पास अच्छे विचार हैं जो बहुत समान हैं, तो टीम सुरक्षा के लिए दोनों को रखती है।
  5. विजेता: अंत तक, टीम सबसे अच्छे पथ का चयन करती है—वह पथ जिसने नियमों का सबसे पूर्ण रूप से पालन किया। यह विजेता पथ पेंटिंग AI को दिया जाने वाला अंतिम निर्देश बनता है।

वास्तविक दुनिया में क्या होता है?

शोधकर्ताओं ने इसका परीक्षण CoBSAT नामक एक बेंचमार्क पर किया, जो पहेलियों की एक श्रृंखला की तरह है जहाँ AI को मुख्य वस्तु को समान रखते हुए रंग, शैली या पृष्ठभूमि जैसी चीजों को बदलना होता है।

  • पुराना तरीका (Baseline): AI तुरंत अनुमान लगाता है। यह अक्सर एक धुंधला मवाद बना देता है या नए अनुरोध के अनुकूल होने के बजाय उदाहरणों को ही दोहरा देता है।
  • "चेन ऑफ थॉट" (Chain of Thought) का तरीका: AI पेंट करने से पहले खुद से थोड़ी बात करता है। यह बेहतर है, लेकिन यह अभी भी केवल एक ही पथ पर चलता है। यदि यह फंस जाता है, तो यह फंसा ही रहता है।
  • "ट्री ऑफ थॉट्स" (Tree-of-Thoughts) का तरीका: AI कई रास्तों की खोज करता है, बुरे रास्तों को हटा देता है, और सबसे अच्छा चुनता है।

परिणाम:

  • बेहतर पेंटिंग्स: Tree-of-Thoughts विधि द्वारा उत्पन्न चित्र बहुत अधिक सटीक थे। यदि उदाहरणों में जिम में एक भेड़ दिखाई गई थी, और अनुरोध समुद्र तट पर एक भेड़ के लिए था, तो AI ने सही ढंग से समुद्र तट पर एक भेड़ बनाई। पुराने तरीके अक्सर समुद्र तट पर एक जिम या एक भ्रमित ढेर बना देते थे।
  • मानवीय प्राथमिकता (Human Preference): जब मनुष्यों ने परिणामों को देखा, तो उन्होंने अन्य तरीकों की तुलना में 60% से 68% बार Tree-of-Thoughts छवियों को पसंद किया। उन्हें लगा कि चित्र अनुरोध और उदाहरणों का बेहतर पालन करते हैं।
  • कोई अतिरिक्त प्रशिक्षण नहीं: सबसे अच्छी बात यह है कि AI को दोबारा स्कूल जाने की आवश्यकता नहीं पड़ी। शोधकर्ताओं ने AI के मस्तिष्क को नहीं बदला; उन्होंने बस यह बदला कि वह पेंटिंग शुरू करने से पहले कैसे सोचता है।

सारांश में

यह पेपर दिखाता है कि यदि आप एक AI को विभिन्न विचारों को खोजने, उन्हें नियमों के विरुद्ध परखने और सबसे अच्छा चुनने (स्काउट्स की एक टीम की तरह) का क्षण देते हैं, तो यह जटिल निर्देशों का पालन करने में बहुत बेहतर हो जाता है। यह अनुमान लगाना बंद कर देता है और तर्क करना शुरू कर देता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के बहुत स्पष्ट और सटीक चित्र मिलते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →