← नवीनतम पेपर
💬 NLP

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner मल्टीमॉडल मॉडल्स का एक परिवार है जो एक स्केलेबल डेटा पाइपलाइन, Tool-GRPO सुदृढीकरण लर्निंग (reinforcement learning), और गतिशील टूल विनियमन (dynamic tool regulation) के लिए एक अनुकूली तंत्र के माध्यम से टूल ऑर्केस्ट्रेशन को एक सामान्य कौशल के रूप में सीखकर, अत्याधुनिक विजुअल रीजनिंग और अनदेखे टूल्स के प्रति सामान्यीकरण प्राप्त करता है।

मूल लेखक: Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

प्रकाशित 2026-01-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन थोड़ा अनाड़ी सहायक है जो एक जटिल पहेली को हल करने की कोशिश कर रहा है, जैसे कि भूलभुलैया से गुजरना या किसी टूटी हुई तस्वीर को ठीक करना। कभी-कभी, यह सहायक इसलिए फंस जाता है क्योंकि वह विवरणों को स्पष्ट रूप से नहीं देख पाता, या वह भूलभुलैया के नियमों को भूल जाता है।

AdaReasoner इस सहायक को प्रशिक्षित करने का एक नया तरीका है ताकि वह सब कुछ अपने दिमाग में करने की कोशिश करना बंद करे और यह जानना शुरू करे कि कब मदद मांगनी है, किस उपकरण के लिए पूछना है, और उसका उपयोग कैसे करना है।

यह कैसे काम करता है, इसका विवरण यहाँ दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "सब कुछ खुद करने वाला" जाल (The "Do-It-All" Trap)

वर्तमान AI मॉडल उन छात्रों की तरह हैं जिन्हें केवल अपने दिमाग का उपयोग करके गणित की समस्या हल करने के लिए कहा जाता है। यदि समस्या के लिए कैलकुलेटर की आवश्यकता है, तो छात्र उत्तर का अनुमान लगा सकता है या गणित को अपने दिमाग में करने की कोशिश कर सकता है और गलत हो सकता है। उन्हें यह नहीं पता होता कि कैलकुलेटर कब उठाना है, या वे गलत चीज़ उठा सकते हैं (जैसे कैलकुलेटर के बजाय स्केल)।

2. समाधान: एक "उपकरण ऑर्केस्ट्रा" (A "Tool Orchestra")

शोधकर्ताओं ने AdaReasoner बनाया है, जो उपकरणों (जैसे आवर्धक लेंस, मानचित्र, या कैलकुलेटर) को एक ऑर्केस्ट्रा के वाद्य यंत्रों की तरह मानता है। AI अब केवल एक एकल कलाकार (soloist) नहीं है; यह एक कंडक्टर है।

  • इसे पता है कि कब बजाना है: यह सीखता है कि कुछ कार्यों के लिए, इसे ज़ूम इन करने की आवश्यकता होती है (एक "आवर्धक लेंस" टूल), लेकिन अन्य कार्यों के लिए, इसे एक रेखा खींचने की आवश्यकता होती है (एक "स्केल" टूल)।
  • इसे पता है कि कब रुकना है: यदि कोई उपकरण मदद नहीं करता है, तो यह सीखता है कि उसे नीचे रख दे और एक अलग दृष्टिकोण अपनाए।
  • यह नए वाद्य यंत्रों के अनुकूल होता है: भले ही आप AI को एक बिल्कुल नया उपकरण दें जिसे उसने पहले कभी नहीं देखा है, वह केवल उसके निर्देश मैनुअल (टूल के विवरण) को पढ़कर यह समझ सकता है कि उसका उपयोग कैसे करना है।

3. उन्होंने इसे कैसे प्रशिक्षित किया (तीन-चरणीय रेसिपी)

AI को ये कौशल सिखाने के लिए, शोधकर्ताओं ने तीन-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:

  • चरण 1: "स्क्रिप्टेड रिहर्सल" (टूल कोल्ड स्टार्ट - Tool Cold Start)
    कल्पना कीजिए कि एक नाटक शिक्षक एक अभिनेता को नाटक के लिए एक सटीक स्क्रिप्ट दे रहा है। AI को चरण-दर-चरण समस्याओं को हल करने के उच्च-गुणवत्ता वाले उदाहरण दिखाए जाते हैं, जिसमें उपकरणों का सही ढंग से उपयोग किया जाता है। यह इसे बुनियादी "चालें" और उपकरणों को पकड़ने का तरीका सिखाता है।

    • उपमा: यह एक शेफ को प्याज काटने का सटीक तरीका दिखाने जैसा है, इससे पहले कि उसे खाना पकाने के लिए छोड़ा जाए।
  • चरण 2: "गलती और सुधार" का खेल (टूल GRPO - Tool GRPO)
    एक बार जब AI बुनियादी बातें जान लेता है, तो वे इसे एक खेल खेलने देते हैं जहाँ इसे पहेली सुलझाने के लिए अंक मिलते हैं।

    • यदि यह सही समय पर सही उपकरण का उपयोग करता है, तो इसे बड़ा इनाम मिलता है।
    • यदि यह ऐसे उपकरण का उपयोग करता है जो मदद नहीं करता, या बिना जांचे अनुमान लगाता है, तो इसे छोटा इनाम या दंड मिलता है।
    • उपमा: यह एक वीडियो गेम की तरह है जहाँ AI सीखता है कि नदी पार करने के लिए "जेटपैक" का उपयोग करना बहुत अच्छा है, लेकिन दरवाजा खोलने के लिए "जेटपैक" का उपयोग करना समय की बर्बादी है। यह अपनी रणनीति को बेहतर बनाने के लिए सीखता है।
  • चरण 3: "सीक्रेट कोड" चुनौती (अनुकूली सीखना - Adaptive Learning)
    यह सुनिश्चित करने के लिए कि AI केवल उपकरणों के नाम याद नहीं कर रहा है (जैसे यह याद रखना कि "टूल A" हमेशा मापने के लिए है), शोधकर्ताओं ने प्रशिक्षण के दौरान उपकरणों के नाम और विवरण को बेतरतीब ढंग से बदल दिया।

    • उपमा: कल्पना कीजिए कि आप किसी को कार चलाना सिखा रहे हैं, लेकिन हर दिन आप गैस पेडल का नाम "Gas" से बदलकर "Go", "Fuel", या "X7a2" कर देते हैं। छात्र को यह सीखना होगा कि पेडल क्या करता है, न कि उसका नाम क्या है। यह सुनिश्चित करता है कि AI किसी भी उपकरण को संभाल सके, भले ही उसने उसे पहले कभी न देखा हो।

4. परिणाम: छोटा दिमाग, बड़े कौशल (Small Brain, Big Skills)

सबसे रोमांचक हिस्सा पेपर का यह है कि उन्होंने एक अपेक्षाकृत छोटे AI मॉडल (एक "7B" मॉडल, जो एक बुद्धिमान कॉलेज छात्र की तरह है) को ये टूल कौशल दिए।

  • परिणाम: यह छोटा मॉडल टूल का उपयोग करने में इतना कुशल हो गया कि इसने कठिन दृश्य पहेलियों पर बहुत बड़े, "क्लोज्ड-सोर्स" मॉडलों (जैसे GPT-5 और Claude Sonnet 4) को भी हरा दिया।
  • उपमा: यह एक साइकिल को हाई-टेक गियर और GPS देने जैसा है। अचानक, साइकिल इतनी अच्छी हो जाती है कि वह फेरारी के साथ दौड़ सकती है क्योंकि साइकिल को पता है कि उसे रास्ते पर कैसे नेविगेट करना है, जबकि फेरारी केवल अंधेरे में गाड़ी चला रही है।

5. पेपर से वास्तविक दुनिया के उदाहरण

पेपर दिखाता है कि AI क्या कर रहा है:

  • भूलभुलैया में रास्ता खोजना: अनुमान लगाने के बजाय, यह शुरू और अंत बिंदुओं को खोजने के लिए एक टूल का उपयोग करता है, फिर गड्ढों से बचने के लिए एक "पाथफाइंडिंग" टूल का उपयोग करके एक आदर्श मार्ग खींचता है।
  • जिग्सॉ पहेली को ठीक करना: यह एक चित्र में गायब काले धब्बे को खोजने के लिए एक टूल का उपयोग करता है, फिर तब तक अलग-अलग पहेली के टुकड़ों को डालने की कोशिश करता है जब तक कि एक फिट न हो जाए।
  • वेबसाइट पढ़ना: यह किसी विशिष्ट बटन पर ज़ूम करने के लिए एक "क्रॉप" टूल का उपयोग करता है और उस पर लिखे टेक्स्ट को पढ़ने के लिए एक "OCR" टूल (एक डिजिटल आँख की तरह) का उपयोग करता है, जिससे वह ठीक से समझ पाता है कि कुछ खरीदना कैसे है।

सारांश

AdaReasoner AI मॉडलों को आंतरिक रूप से हर चीज़ में पूर्ण होने की कोशिश करना बंद करने की शिक्षा देता है। इसके बजाय, यह उन्हें स्मार्ट मैनेजर बनना सिखाता है जो जानते हैं कि भारी काम करने के लिए विशेषज्ञ टूल को कब बुलाना है। नए उपकरणों और कार्यों के अनुकूल होने की क्षमता सीखकर, एक छोटा AI भी जटिल दृश्य समस्याओं को बहुत बड़ी और अधिक महंगी प्रणालियों से बेहतर तरीके से हल कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →