← नवीनतम पेपर
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

यह शोध पत्र InfantAgent-Next को प्रस्तुत करता है, जो एक अत्यधिक मॉड्यूलर मल्टीमॉडल जनरलिस्ट एजेंट है जो सहयोगी, चरण-दर-चरण कंप्यूटर इंटरैक्शन को सक्षम करने के लिए टूल-आधारित और शुद्ध विजन क्षमताओं को एकीकृत करता है, जिससे OSWorld, GAIA और SWE-Bench सहित विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ा अनाड़ी, व्यक्तिगत सहायक है जिसका नाम InfantAgent-Next है।

कंप्यूटर ऑटोमेशन की दुनिया में, आज के अधिकांश सहायक उन विशेषज्ञों की तरह हैं जो केवल एक काम बहुत अच्छी तरह से जानते हैं, या उन सामान्य विशेषज्ञों की तरह जो सब कुछ करने की कोशिश करते हैं लेकिन अक्सर भ्रमित हो जाते हैं।

  • कुछ सहायक लाइब्रेरियन (Librarians) की तरह होते हैं: वे विशिष्ट उपकरणों की सूची (जैसे "वेब खोजें" या "एक फ़ाइल खोलें") का उपयोग करने में माहिर होते हैं, लेकिन यदि आप उन्हें स्क्रीन पर किसी ऐसे बटन को क्लिक करने के लिए कहते हैं जिसे उन्होंने पहले कभी नहीं देखा है, तो वे जम जाते हैं क्योंकि उनके पास उस विशिष्ट बटन के लिए कोई टूल नहीं होता।
  • अन्य सहायक कलाकारों (Artists) की तरह होते हैं: वे स्क्रीन को देख सकते हैं और "देख" सकते हैं कि वहां क्या है, लेकिन वे जटिल गणित करने या कोड लिखने में संघर्ष करते हैं क्योंकि वे केवल अपनी आंखों से सब कुछ करने की कोशिश कर रहे होते हैं, बिना किसी कैलकुलेटर या टेक्स्ट एडिटर के।

InfantAgent-Next अलग है। यह एक एकल व्यक्ति के बजाय एक स्विस आर्मी नाइफ टीम (Swiss Army Knife Team) को काम पर रखने जैसा है।

यह कैसे काम करता है: "दिमाग और हाथ" की टीम

एक विशाल दिमाग जो सब कुछ करने की कोशिश करता है, उसके बजाय, InfantAgent-Next हर काम को छोटे चरणों में तोड़ देता है और प्रत्येक चरण को उस विशेषज्ञ के पास भेजता है जो उसके लिए सबसे उपयुक्त है।

  1. प्रबंधक (द प्लानर - The Manager): जब आप पूछते हैं, "इस वेबपेज को मेरे बुकमार्क्स में सेव करें," तो एक उच्च-स्तरीय "मैनेजर" मॉडल आपके अनुरोध को पढ़ता है। वह खुद माउस क्लिक करने की कोशिश नहीं करता है। इसके बजाय, वह कहता है, "ठीक है, हमें ब्राउज़र खोलना होगा, बुकमार्क बटन ढूंढना होगा और उस पर क्लिक करना होगा।"
  2. विशेषज्ञ (The Specialists): फिर मैनेजर काम के लिए सही विशेषज्ञ को बुलाता है:
    • आंख (विजुअल ग्राउंडिंग - The Eye): यदि कार्य "लाल बटन पर क्लिक करना" है, तो एक विशेष विजन मॉडल स्क्रीन को देखता है, उस लाल बटन के सटीक पिक्सेल निर्देशांक (coordinates) ढूंढता है, और सिस्टम को बताता है कि उसे कहां क्लिक करना है। यह एक अंधेरे में तीर चलाने वाले धनुर्धर को गाइड करने वाले एक तेज आंखों वाले स्पॉटर की तरह है।
    • कैलकुलेटर (कोड निष्पादन - The Calculator): यदि कार्य "इस एक्सेल फ़ाइल का विश्लेषण करें" है, तो मैनेजर फ़ाइल को एक कोडिंग विशेषज्ञ को सौंप देता है जो स्क्रीन को देखकर पंक्तियों को गिनने के बजाय तुरंत गणित करने के लिए एक स्क्रिप्ट लिखता है।
    • कान (ऑडियो विश्लेषण - The Ear): यदि आप एक रिकॉर्डिंग अपलोड करते हैं और पूछते हैं, "कौन सा पेज नंबर बताया गया है?", तो एक विशेष ऑडियो मॉडल फ़ाइल को सुनता है और उत्तर निकालता है।
  3. स्मृति (The Memory): सिस्टम एक साझा नोटबुक रखता है। हर बार जब कोई विशेषज्ञ एक चरण पूरा करता है, तो वे उसे लिख देते हैं। अगला विशेषज्ञ नोटबुक उठाता है, क्या हुआ है उसे पढ़ता है, और कहानी को आगे बढ़ाता है। यह सुनिश्चित करता है कि टीम लक्ष्य से भटक न जाए।

यह क्यों महत्वपूर्ण है (जादुई ट्रिक्स)

यह पेपर दो मुख्य समस्याओं को उजागर करता है जिन्हें यह सिस्टम हल करता है:

  • "क्लिकिंग" की समस्या: कई AI एजेंट स्क्रीन पर सही जगह क्लिक करने में खराब होते हैं। वे बटन से 5 पिक्सेल बाईं ओर क्लिक कर सकते हैं और चूक सकते हैं। InfantAgent-Next "ज़ूम-इन" तकनीक का उपयोग करता है। यदि इसे किसी बटन पर क्लिक करना है, तो यह केवल अनुमान नहीं लगाता। यह स्क्रीन की एक तस्वीर लेता है, उस क्षेत्र को ढूंढता है, उस क्षेत्र को बड़ा करने के लिए उसे क्रॉप करता है, फिर से बटन को ढूंढता है, उसे फिर से क्रॉप करता है, और फिर क्लिक करता है। यह घास के ढेर में सुई खोजने के लिए आवर्धक लेंस (magnifying glass) का उपयोग करने जैसा है, जिससे क्लिक सटीक होता है।
  • "एडिटिंग" की समस्या: टेक्स्ट फ़ाइल को एडिट करते समय, AI अक्सर लाइन नंबर गलत कर देता है (जैसे, "लाइन 5 बदलें" जबकि यह लाइन 6 होनी चाहिए)। InfantAgent-Next में एक "डबल-चेक" प्रणाली है। यह एक बदलाव का प्रस्ताव देता है, फिर वास्तविक टेक्स्ट को देखकर सत्यापित करता है, "क्या लाइन 5 वास्तव में वही कहती है जो मैं सोच रहा हूँ?" यदि नहीं, तो यह संपादन करने से पहले अपनी योजना को समायोजित करता है, जिससे गड़बबड़ गलतियों को रोका जा सके।

यह क्या कर सकता है (प्रमाण)

शोधकर्ताओं ने तीन प्रकार की चुनौतियों पर अन्य शीर्ष स्तर के AI एजेंटों के मुकाबले इस "विशेषज्ञों की टीम" का परीक्षण किया:

  1. वास्तविक दुनिया के डेस्कटॉप कार्य (OSWorld): उन्होंने एजेंट को "फ़ाइल डाउनलोड करना," "दस्तावेज़ संपादित करना," और "वेबसाइट ब्राउज़ करना" जैसे कार्य करने के लिए कहा। InfantAgent-ित ने प्रसिद्ध "Claude Computer Use" एजेंट को 7.27% से पछाड़ दिया। यह बिना मानवीय मदद के काम को पूरा करने में बेहतर था।
  2. कोडिंग और बग फिक्स (SWE-Bench): उन्होंने एजेंट को वास्तविक सॉफ्टवेयर प्रोजेक्ट्स में टूटे हुए कोड को ठीक करने के लिए कहा। इसने कई महंगे, बंद-स्रोत (closed-source) वाणिज्यिक एजेंटों के बराबर या उनसे बेहतर प्रदर्शन किया।
  3. सामान्य ज्ञान और तर्क (GAIA): उन्होंने जटिल प्रश्न पूछे जिनके लिए वेब खोजने, फ़ाइलें पढ़ने और तर्क करने की आवश्यकता थी। InfantAgent-Next सभी ओपन-सोर्स एजेंटों में दूसरे स्थान पर रहा, जिससे सिद्ध हुआ कि यह जटिल, बहु-चरणीय तर्क को संभाल सकता है।

मुख्य निष्कर्ष

InfantAgent-Next केवल एक बड़ा AI मॉडल नहीं है जो सब कुछ होने की कोशिश कर रहा है। यह एक मॉड्यूलर कंडक्टर (modular conductor) है जो जानता है कि कब "आंख," "कान," "कोडर," या "माउस-क्लिकर" को बुलाना है। प्रत्येक विशेषज्ञ को वह करने देने से जिसमें वे सर्वश्रेष्ठ हैं, पूरा सिस्टम बहुत अधिक स्मार्ट, सटीक और हमारे कंप्यूटरों पर दैनिक कार्यों को संभालने में सक्षम हो जाता है।

शोधकर्ताओं ने इस "विशेषज्ञों की टीम" के कोड को उपयोग और अध्ययन के लिए सभी के लिए उपलब्ध कराया है, ताकि भविष्य में और भी बेहतर कंप्यूटर सहायकों के निर्माण में मदद मिल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →