← नवीनतम पेपर
💬 NLP

ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories

यह शोध पत्र ISE को प्रस्तुत करता है, जो एक तीन-चरणीय संश्लेषण प्रतिमान (three-stage synthesis paradigm) है जो उच्च-गुणवत्ता वाले, निष्पादन-आधारित (execution-grounded) मल्टी-टर्न OS-एजेंट प्रक्षेपवक्र (trajectories) उत्पन्न करता है ताकि फाइन-ट्यून किए गए मॉडलों में टूल-उपयोग प्रदर्शन को महत्वपूर्ण रूप से सुधारा जा सके, जो बड़े ज़ीरो-शॉट बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Siyuan Luo, Nairong Zheng, Lin Zhou, Tiankuo Yao, Shengyou Yuan, Haojia Yu, Cong Pang, Jiapeng Luo, Lewei Lu

प्रकाशित 2026-06-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyuan Luo, Nairong Zheng, Lin Zhou, Tiankuo Yao, Shengyou Yuan, Haojia Yu, Cong Pang, Jiapeng Luo, Lewei Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन रोबोट को कंप्यूटर का उपयोग करना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह जटिल कार्यों को संभाल सके, जैसे कि "मेरी फाइलों को व्यवस्थित करें, उन पर एक रिपोर्ट लिखें, और इसे मेरे बॉस को ईमेल करें।"

समस्या यह है कि, इस शोध पत्र के अनुसार, जिन "पाठ्यपुस्तकों" (प्रशिक्षण डेटा) का उपयोग हम इन रोबोटों को सिखाने के लिए कर रहे हैं, वे तीन विशिष्ट तरीकों से त्रुटिपूर्ण हैं:

  1. वे उपकरणों से शुरू होते हैं, उपयोगकर्ता से नहीं: अधिकांश डेटा कंप्यूटर के उपलब्ध कमांड्स (जैसे "फाइल डिलीट करें" या "ईमेल भेजें") की एक सूची देखकर और उनका उपयोग करने का एक कारण बनाकर बनाया जाता है। यह एक शेफ को यह सिखाने जैसा है कि "यहाँ एक चाकू है, अब कुछ काटने का एक कारण सोचो," बजाय इसके कि "मुझे भूख लगी है, मेरे लिए एक सैंडविच बनाओ" से शुरुआत की जाए।

  2. वे बहुत छोटे हैं: वास्तविक जीवन में आगे-पीछे की बातचीत (back-and-forth) होती है। यदि रोबोट कोई गलती करता है, तो आप उसे सुधारते हैं। यदि वह सफल होता है, तो आप अगले कदम के लिए कहते हैं। अधिकांश प्रशिक्षण डेटा केवल एक प्रश्न और एक उत्तर है, जो एक वेंडिंग मशीन के लेनदेन की तरह है, न कि एक वास्तविक बातचीत की तरह।

  3. वे नकली हैं: रोबोटों को आमतौर पर "सिम्युलेटेड" (कृत्रिम) परिणामों पर प्रशिक्षित किया जाता है। कंप्यूटर एक फाइल को डिलीट करने का दिखावा करता है या त्रुटि संदेश (error message) क्या होगा इसका अनुमान लगाता है। यह वास्तव में कभी भी असली कंप्यूटर को नहीं छूता, इसलिए यह कभी नहीं सीख पाता कि चीजें वास्तव में गलत होने पर क्या करना है।

समाधान: ISE (इन्टेंट → सिम्युलेट → एक्जीक्यूट)

लेखक एक नया तीन-चरणीय नुस्खा प्रस्तावित करते हैं जिसे ISE कहा जाता है ताकि इस समस्या को ठीक किया जा सके। इसे रोबोटों के लिए एक उच्च-स्तरीय कुकरी स्कूल (culinary school) के रूप में समझें।

चरण 1: मेनू (इन्टेंट - Intent)

उपकरणों की सूची से शुरू करने के बजाय, वे वास्तविक मानवीय आवश्यकताओं से शुरू करते हैं।

  • उपमा: कल्पना कीजिए कि एक शेफ एक मेनू बनाता है जो वास्तव में अलग-अलग प्रकार के लोगों की खाने की इच्छाओं पर आधारित है, न कि केवल पेंट्री में मौजूद सामग्रियों पर।
  • उन्होंने यह कैसे किया: उन्होंने 50,000 अद्वितीय "पर्सोना" (जैसे एक व्यस्त फाइनेंस मैनेजर, एक रचनात्मक लेखक, या एक छात्र) बनाए और उन्हें विभिन्न प्रकार के कार्यों और कठिनाई स्तरों के साथ मिलाया। यह सुनिश्चित करता है कि रोबोट केवल आसान, सामान्य अनुरोधों के बजाय वास्तविक दुनिया के विविध अनुरोधों को संभालने के लिए सीखे।

चरण 2: रोल-प्ले (सिम्युलेट - Simulate)

यहीं वे "बहुत छोटे" वाली समस्या को ठीक करते हैं। वे एक विशेष AI का उपयोग मानव उपयोगकर्ता के रूप में करते हैं।

  • उपमा: कल्पना कीजिए कि एक मेथड एक्टर एक परेशान ग्राहक की भूमिका निभा रहा है। वह अभिनेता केवल यह नहीं कहता "एक सैंडविच बनाओ" और रुक नहीं जाता। यदि रोबलेट ब्रेड गिरा देता है, तो अभिनेता कहता है, "अरे, तुमने ब्रेड गिरा दी, उसे उठाओ!" यदि रोबोट अच्छा काम करता है, तो वह कहता है, "बहुत बढ़िया, अब इसमें चीज़ डाल दो।"
  • सीक्रेट सॉस: लेखकों ने यह सुनिश्चित किया कि यह "अभिनेता" AI अपने किरदार में बना रहे। यह गलती से एक सहायक (assistant) में नहीं बदल जाता (जो प्रशिक्षण को खराब कर देगा)। यह सख्ती से उपयोगकर्ता की भूमिका में रहता है, जो रोबोट के वास्तविक कार्यों पर प्रतिक्रिया देता है, न कि उस पर जो रोबोट सोचता है कि उसने किया।

चरण 3: असली किचन (एक्जीक्यूट - Execute)

यह सबसे महत्वपूर्ण चरण है। रोबोट केवल अनुमान नहीं लगाता; वह वास्तव में काम करता है एक वास्तविक, अलग किए गए कंप्यूटर पर।

  • उपमा: एक शेफ असली सब्जियों को काटने के बजाय एक ऐसी कटिंग बोर्ड पर काटने का नाटक करने के बजाय, वास्तव में असली सब्जियां काटता है। यदि चाकू फिसलता है और मेज को काट देता है, तो सिस्टम उस वास्तविक गलती को रिकॉर्ड करता है।
  • यह क्यों मायने रखता है: जब रोबोट कोई कमांड चलाने की कोशिश करता है और वह विफल हो जाता है (जैसे, "फाइल नहीं मिली"), तो "अभिनेता" उपयोगकर्ता उस वास्तविक त्रुटि संदेश को देखता है और उस पर प्रतिक्रिया करता है। यह रोबोट को वास्तविक दुनिया की आपदाओं से उबरना सिखाता है, जो नकली सिमुलेशन नहीं कर सकते।

परिणाम

उन्होंने इस नए "पाठ्यपुस्तक" (जिसे ISETrace कहा जाता है) को लिया और इससे एक रोबोट (विशेष रूप से Qwen3-8B नामक मॉडल) को प्रशिक्षित किया।

  • पहले: इस नए प्रशिक्षण के बिना, रोबोट केवल लगभग 19% जटिल, बहु-चरणीय कंप्यूटर कार्यों को हल कर सकता था।
  • बाद में: इस नए प्रशिक्षण के साथ, रोबोट ने 37% कार्यों को हल किया।
  • तुलना: इस प्रशिक्षित 8-बिलियन-पैरामीटर वाले रोबोट ने वास्तव में एक बहुत बड़े रोबोट (32 बिलियन पैरामीटर) से बेहतर प्रदर्शन किया जो इस डेटा पर प्रशिक्षित नहीं था, और एक बहुत प्रसिद्ध, महंगे व्यावसायिक रोबोट (GPT-4o) से भी बेहतर प्रदर्शन किया जो इस डेटा पर प्रशिक्षित नहीं था।

मुख्य निष्कर्ष (The Takeaway)

यह शोध पत्र तर्क देता है कि आप क्या डेटा बना रहे हैं, यह उतना ही महत्वपूर्ण है जितना कि आप डेटा को कैसे बना रहे हैं। वास्तविक मानवीय आवश्यकताओं से शुरू करके, लंबी बातचीत के लिए मजबूर करके, और रोबोट को वास्तविक कंप्यूटरों पर अभ्यास करने देकर (असफलताओं सहित), उन्होंने एक बहुत अधिक बुद्धिमान एजेंट बनाया।

उन्होंने यह भी सिद्ध किया कि "लंबी बातचीत" वाला हिस्सा ही मुख्य कुंजी थी। जब उन्होंने प्रशिक्षण डेटा को केवल एकल प्रश्नों तक सीमित कर दिया (बातचीत के उतार-चढ़ाव को हटा दिया), तो रोबोट का प्रदर्शन काफी गिर गया। यह दर्शाता है कि एक रोबोट को वास्तव में उपयोगी होने के लिए बातचीत को संभालने का कौशल सीखना आवश्यक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →