← नवीनतम पेपर
💬 NLP

STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics

यह शोध पत्र STT-Arena प्रस्तुत करता है, जो टूल-उपयोग कार्यों में स्थानिक-कालिक व्यवधानों (spatio-temporal disruptions) के प्रति बड़े भाषा मॉडलों की अनुकूलन क्षमता का मूल्यांकन करने के लिए एक यथार्थवादी बेंचमार्क है, जो वर्तमान मॉडलों में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और एक परिष्कृत प्रशिक्षण दृष्टिकोण प्रस्तावित करता है जो एक विशिष्ट एजेंट तैयार करता है जो अत्याधुनिक प्रणालियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "LLM" नामक एक अत्यंत बुद्धिमान ट्रैवल एजेंट हैं। आपका काम एक क्लाइंट के लिए एक जटिल यात्रा बुक करना है: सबसे सस्ती उड़ान खोजना, होटल आरक्षित करना और टैक्सी का प्रबंध करना। एक आदर्श, स्थिर दुनिया में, आप बस एक चेकलिस्ट का पालन करेंगे: "फ्लाइट A बुक करें, फिर होटल B।"

लेकिन वास्तविक दुनिया स्थिर नहीं होती। कीमतें बदलती हैं, उड़ानें रद्द हो जाती हैं, और अचानक कहीं भी ट्रैफिक जाम लग जाता है। यह पेपर, STT-Arena, यह देखने के लिए एक नया, बहुत कठिन परीक्षण पेश करता है कि क्या ये AI एजेंट वास्तविक दुनिया की उथल-पुथल को संभाल सकते हैं।

यहाँ सरल शब्दों में इस पेपर का विवरण दिया गया है:

1. समस्या: "अतीत में फंसा हुआ" एजेंट

अधिकांश वर्तमान AI एजेंट एक शांत कमरे में निर्देशों का पालन करने में बहुत अच्छे होते हैं। लेकिन यदि वे काम कर रहे होते समय स्थिति बदल जाती है, तो वे अक्सर भ्रमित हो जाते हैं।

  • उपमा: कल्पना कीजिए कि आप एक पार्टी में जा रहे हैं। आपने अपने रूट की योजना 10 मिनट पुराने मानचित्र के आधार पर बनाई थी। अचानक, एक बड़ा हादसा आपके रास्ते को ब्लॉक कर देता है। एक स्मार्ट मानव चालक अवरोध को देखता है, एक नया मानचित्र चेक करता है, और एक वैकल्पिक रास्ता (डेटर) ढूंढ लेता है।
  • AI की विफलता: कई वर्तमान AI उस ब्लॉक किए गए रास्ते की ओर बढ़ते रहते हैं, यह तर्क देते हुए, "लेकिन मानचित्र ने कहा था कि यह साफ है!" वे यह महसूस करने में विफल रहते हैं कि दुनिया बदल गई है और उन्हें एक नई योजना की आवश्यकता है। वे "अतीत में फंसे हुए" हैं।

2. समाधान: STT-Arena ("क्योस सिम्युलेटर")

शोधकर्ताओं ने इस विशिष्ट कौशल का परीक्षण करने के लिए STT-Arena नामक एक वीडियो-गेम जैसा वातावरण बनाया है।

  • सेटअप: उन्होंने 227 अलग-अलग परिदृश्य बनाए (जैसे उड़ान बुक करना, वेयरहाउस डिलीवरी प्रबंधित करना, या मेडिकल अपॉइंटमेंट शेड्यूल करना)।
  • ट्विस्ट: कार्य के बीच में, वातावरण एक "स्पैटियो-टेम्पोरल ट्रिगर" (स्थानिक-कालिक ट्रिगर) फेंकता है।
    • स्पैटियो (स्थान): वह वेयरहाउस जहाँ आप ट्रक भेज रहे थे, अचानक अपने दरवाजे बंद कर देता है।
    • टेम्पोरल (समय): वह फ्लाइट टिकट की कीमत जो आपने 30 सेकंड पहले देखी थी, अब दोगुनी हो गई है।
  • लक्ष्य: AI को इस परिवर्तन को नोटिस करना चाहिए, यह स्वीकार करना चाहिए कि उसकी पुरानी योजना टूट गई है, और तुरंत काम पूरा करने के लिए एक नई योजना बनानी चाहिए। यदि काम असंभव हो जाता है (जैसे, एकमात्र उड़ान रद्द हो गई है और कोई अन्य विकल्प मौजूद नहीं है), तो AI को यह कहना चाहिए, "मैं यह नहीं कर सकता," बजाय इसके कि वह एक टूटी हुई योजना को जबरदस्ती लागू करने की कोशिश करे।

3. परिणाम: यहाँ तक कि सबसे स्मार्ट AI भी संघर्ष करते हैं

शोधकर्ताओं ने इस एरिना पर दुनिया के सबसे उन्नत AI मॉडल (बड़ी टेक कंपनियों के नवीनतम संस्करणों सहित) का परीक्षण किया।

  • स्कोर: सर्वश्रेष्ठ AI भी केवल लगभग 35% कार्यों को सही ढंग से कर पाया। इसका मतलब है कि वे दो-तिहाई से अधिक बार विफल रहे।
  • निष्कर्ष: वर्तमान AI "मौके पर सोचने" (thinking on its feet) में आश्चर्यजनक रूप से खराब है जब खेल के बीच में नियम बदल जाते हैं। वे शतरंज के खिलाड़ी की तरह हैं जो भूल जाते हैं कि हर चाल के बाद बोर्ड बदल गया है।

4. वे क्यों विफल होते हैं? (तीन "बुरी आदतें")

शोधकर्ताओं ने उनकी गलतियों का विश्लेषण किया और पाया कि AI एजेंटों में तीन आवर्ती "बुरी आदतें" हैं:

  1. "ज़ोंबी वॉक" (Stale-State Execution): AI उसी टूल का उपयोग करने या उसी पथ का पालन करने की कोशिश करता रहता है जो पहले से ही टूटा हुआ है। यह एक ऐसे दरवाजे को खोलने की कोशिश करने जैसा है जो एक घंटे से बंद है, बिना यह जांचे कि क्या वह लॉक है।
  2. "गलत निदान" (Misdiagnosis of Triggers): जब AI को एक त्रुटि संदेश (जैसे "फ्लाइट अनुपलब्ध") मिलता है, तो वह इसे टाइपो या ग्लिच समझता है। वह संदेश को ठीक करने की कोशिश करता है बजाय इसके कि वह यह महसूस करे कि वास्तविकता बदल गई है (जैसे, तूफान के कारण उड़ान वास्तव में रद्द हो गई है)।
  3. "झूठी समाप्ति" (Missing Post-Adaptation Verification): AI एक नई योजना बनाता है और एक चरण सफलतापूर्वक पूरा करता है, फिर तुरंत कहता है, "हो गया!" बिना यह जांचे कि क्या पूरा काम वास्तव में पूरा हो गया है। यह पिज्जा ऑर्डर करने, ड्राइवर को स्टोर से निकलते देखने और ग्राहक को यह बताने जैसा है, "रात का खाना तैयार है," भले ही पिज्जा अभी तक पहुँचा न हो।

5. समाधान: AI को "सफाई करना" सिखाना

इन बुरी आदतों को ठीक करने के लिए, शोधकर्ताओं ने केवल AI को अधिक डेटा नहीं दिया। उन्होंने एक चतुर प्रशिक्षण पद्धति का उपयोग किया:

  • ट्रैजेक्टरी रिफाइनमेंट (Trajectory Refinement): उन्होंने उन उदाहरणों को लिया कि कैसे AI ने समस्याओं को हल करने की कोशिश की, "बुरी आदतों" (ज़ोंबी वॉक और गलत निदान) को पाया, और उदाहरणों को मैन्युअल रूप से संपादित किया ताकि यह दिखाया जा सके कि सही प्रतिक्रिया कैसे दी जाए।
  • परिणाम: उन्होंने एक छोटे, 4-बिलियन-पैरामीटर वाले मॉडल (जिसे STT-Agent कहा जाता है) को इन "साफ किए गए" उदाहरणों पर प्रशिक्षित किया।
  • आउटकम: इस छोटे, विशेष रूप से प्रशिक्षित मॉडल ने वास्तव में इस टेस्ट पर कई विशाल, महंगे वाणिज्यिक मॉडलों को हरा दिया। इसने साबित कर दिया कि AI को यह सिखाना कि गलतियों से कैसे उबरना है, केवल AI को बड़ा बनाने से कहीं अधिक महत्वपूर्ण है।

सारांश

STT-Arena AI के लिए एक वास्तविकता की जाँच है। यह दिखाता है कि जबकि AI स्थिर निर्देशों का पालन करने में स्मार्ट है, यह वर्तमान में उस दुनिया को संभालने में बहुत खराब है जो उसके काम करने के दौरान बदल जाती है। यह पेपर सिद्ध करता है कि AI को विशेष रूप से यह पहचानने के लिए प्रशिक्षित करके कि चीजें कब गलत होती हैं और उन्हें कैसे ठीक किया जाए (बजड़े पुराने प्लान को अंधाधुंध दोहराने के बजाय), हम यात्रा बुकिंग या लॉजिस्टिक्स जैसे वास्तविक दुनिया के कार्यों के लिए बहुत अधिक विश्वसनीय एजेंट बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →