← नवीनतम पेपर
💻 computer science

Covering Human Action Space for Computer Use: Data Synthesis and Benchmark

यह शोध पत्र CUActSpot बेंचमार्क और एक रेंडरर-आधारित डेटा सिंथेसिस पाइपलाइन को पेश करके जटिल, कम-आवृत्ति वाली अंतःक्रियाओं पर कंप्यूटर-उपयोग एजेंटों की खराब विश्वसनीयता को संबोधित करता है, जो मिलकर एक 4B-पैरामीटर वाले मॉडल को विविध GUI मोडैलिटीज में बड़े ओपन-सोर्स मॉडलों से बेहतर प्रदर्शन करने में सक्षम बनाता है।

मूल लेखक: Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong Yin, Mingxi Cheng, Ji Li, Qi Dai, Chong Luo, Xu Yang, Xin Geng, Baining Guo

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong Yin, Mingxi Cheng, Ji Li, Qi Dai, Chong Luo, Xu Yang, Xin Geng, Baining Guo

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट बटलर को अपना कंप्यूटर इस्तेमाल करना सिखा रहे हैं। आप चाहते हैं कि वह बिल्कुल आपकी तरह बटन क्लिक करे, ईमेल टाइप करे और फाइलों को व्यवस्थित करे। लंबे समय से, शोधकर्ता इन रोबोट्स को मुख्य रूप से सरल क्लिकिंग कार्यों पर प्रशिक्षित कर रहे हैं, जैसे कि "सबमिट" बटन दबाना या किसी लिंक पर क्लिक करना। यह ऐसा है जैसे आप रोबोट को केवल डोरबेल बजाना सिखा रहे हों।

लेकिन कंप्यूटर का वास्तविक उपयोग बहुत जटिल है। कभी-कभी आपको एक फोल्डर से दूसरी जगह फाइल ड्रैग (खींचना) करनी पड़ती है, फोटो को काटने के लिए उसके चारों ओर एक घेरा बनाना (ड्रॉ) पड़ता है, या किसी पैराग्राफ को डिलीट करने के लिए टेक्स्ट को सिलेक्ट (चुनना) करना पड़ता है। यह पेपर तर्क देता है कि वर्तमान रोबोट बटलर इन "लॉन्ग-टेल" (जटिल) कार्यों में विफल हो रहे हैं क्योंकि उनका पर्याप्त अभ्यास नहीं हुआ है। वे उस छात्र की तरह हैं जिसने केवल बहुविकल्पीय (multiple-choice) परीक्षा के लिए पढ़ाई की है लेकिन अचानक उससे निबंध लिखने को कहा गया है।

यहाँ बताया गया है कि लेखकों ने सरल उपमाओं (analogies) का उपयोग करके इसे कैसे ठीक किया:

1. समस्या: "क्लिक-ओनली" का जाल

लेखकों ने देखा कि उन्नत AI मॉडल (जैसे GPT-5.4) कंप्यूटर का उपयोग करने में क्यों विफल होते हैं। उन्होंने पाया कि जबकि रोबोट साधारण क्लिक करने में ठीक हैं, वे स्प्रेडशीट सेल को ड्रैग करने या कोई आकृति बनाने जैसे जटिल काम करने में भ्रमित हो जाते हैं।

  • उपमा: एक ड्राइविंग टेस्ट की कल्पना करें जहाँ आपने केवल चाबी घुमाने का अभ्यास किया है। यदि अचानक आपको समानांतर पार्किंग (parallel park) करनी पड़े या हाईवे पर मर्ज होना पड़े, तो आप दुर्घटनाग्रस्त हो जाएंगे। वर्तमान AI मॉडल चाबी घुमाने (क्klik) में अच्छे हैं लेकिन पार्किंग करने में बहुत खराब हैं।

2. समाधान भाग 1: एक नया "ड्राइविंग टेस्ट" (CUActSpot)

इसे ठीक करने के लिए, टीम ने CUActSpot नामक एक नया बेंचमार्क बनाया। इसे रोबोट के लिए एक नया, कठिन ड्राइविंग टेस्ट समझें।

  • क्या अलग है? इस टेस्ट में केवल "लाल बटन क्लिक करें" कहने के बजाय, यह टेस्ट रोबोट से कहता है:
    • फाइल को कूड़ेदान (trash can) में ड्रैग करें।
    • दो आकृतियों को जोड़ने के लिए एक रेखा बनाएं (ड्रॉ)
    • दस्तावेज़ में एक विशिष्ट शब्द को सिलेक्ट करें।
    • एक फोटो से किसी व्यक्ति को काटकर निकालें (कट आउट)
  • पाँच दुनिया (Five Worlds): यह टेस्ट आपकी स्क्रीन पर पाँच अलग-अलग "दुनियाओं" को कवर करता है: मानक ऐप्स (GUI), टेक्स्ट दस्तावेज़, स्प्रेडशीट्स (Tables), ड्राइंग कैनवस और प्राकृतिक तस्वीरें।
  • नियम: उन्होंने रोबोट को ग्रेड देने के लिए सख्त नियम बनाए। यदि रोबोट एक फाइल को ड्रैग करने की कोशिश करता है लेकिन गलती से किसी "प्रतिबंधित" क्षेत्र (जैसे पॉप-अप विज्ञापन) पर क्लिक कर देता है, तो वह तुरंत फेल हो जाता है। यह सुनिश्चित करता है कि रोबोट सटीक हो, न कि केवल भाग्यशाली।

3. समाधान भाग 2: "मैजिक फैक्ट्री" (डेटा सिंथेसिस)

सबसे बड़ी समस्या यह थी कि रोबोट को सिखाने के लिए इन जटिल कार्यों के पर्याप्त उदाहरण मौजूद नहीं थे। आप केवल इन जटिल कार्यों के लाखों घंटों तक रिकॉर्ड होने का इंतजार नहीं कर सकते; इसमें बहुत समय लगता है।

  • उपमा: वास्तविक ड्राइवरों के अभ्यास करने का इंतजार करने के बजाय, टीम ने एक वीडियो गेम सिम्युलेटर बनाया।
  • यह कैसे काम करता है: उन्होंने लाखों नकली कंप्यूटर स्क्रीन स्वचालित रूप से उत्पन्न करने के लिए कोड लिखा।
    • उन्होंने रैंडम नंबरों के साथ नकली स्प्रेडशीट्स बनाईं।
    • उन्होंने कैनवस पर नकली आकृतियाँ बनाईं।
    • उन्होंने वास्तविक फोटो लीं और उनके विशिष्ट हिस्सों को मार्क किया।
  • "शिक्षक" (LLM): उन्होंने एक स्मार्ट AI (एक LLM) का उपयोग किया जो इन नकली स्क्रीनों को देखता है और निर्देश लिखता है जैसे, "हरे रंग के तीर को पीले घेरे के ऊपर खींचें।" AI ने उन सटीक निर्देशांकों (coordinates) की भी गणना की जहाँ रोबोट को जाना है।
  • परिणाम: उन्होंने 5 करोड़ (50 million) अभ्यास नमूने तैयार किए। यह रोबोट को वास्तविक कार छूने से पहले सिम्युलेटर में लाखों घंटों के ड्राइविंग अभ्यास देने जैसा है।

4. खोज: विविधता, मात्रा से बेहतर है

टीम ने यह देखने के लिए प्रयोग किए कि क्या चीज़ रोबोट को स्मार्ट बनाती है। उन्हें एक आश्चर्यजनक बात पता चली:

  • पुराना तरीका: रोबोट को एक ही चीज़ का अधिक हिस्सा देना (जैसे, बटन क्लिक करने के 10 मिलियन उदाहरण) ज्यादा मदद नहीं करता था।
  • नया तरीका (विविधता स्केलिंग): रोबोट को अलग-अलग प्रकार के कार्य देना (क्लिकिंग, ड्रैगिंग, ड्राइंग, टेबल्स, टेक्स्ट) उसे बहुत अधिक स्मार्ट बनाता है।
  • उपमा: यह एक शेफ की तरह है। यदि आप केवल प्याज काटने का अभ्यास करते हैं, तो आप प्याज में अच्छे हो जाते हैं। लेकिन यदि आप प्याज काटने, टमाटर काटने, स्टेक ग्रिल करने और ब्रेड बेक करने का अभ्यास करते हैं, तो आप एक मास्टर शेफ बन जाते हैं जो किसी भी रेसिपी को संभाल सकता है। रोबोट ने सीखा कि माउस चलाने का कौशल उस विशिष्ट वस्तु से अधिक महत्वपूर्ण है जिसे वह हिला रहा है।

5. परिणाम: नया रोबोट (Phi-Ground-Any-4B)

इस नए "ड्राइविंग टेस्ट" और "मैजिक फैक्ट्री" के डेटा का उपयोग करके, उन्होंने Phi-Ground-Any-4B नामक एक नया मॉडल प्रशिक्षित किया।

  • उपलब्धि: यह मॉडल अपेक्षाकृत छोटा है (केवल 4 बिलियन पैरामीटर्स), फिर भी यह इन जटिल कार्यों पर बहुत बड़े, ओपन-सोर्स मॉडल्स (कुछ 32 बिलियन से अधिक) को पछाड़ देता है।
  • चुनौती: मॉडल अभी भी पुराने स्टाइल के टेस्ट (जो केवल मानक बटन क्लिक करने पर केंद्रित हैं) पर थोड़ा कमजोर है, लेकिन यह उन जटिल कार्यों में चैंपियन है जो वास्तविक दुनिया के कंप्यूटर उपयोग के लिए वास्तव में मायने रखते हैं।

सारांश

पेपर कहता है: "रोबोट को केवल क्लिक करना सिखाना बंद करें। वास्तविक कंप्यूटर उपयोग में ड्रैगिंग, ड्राइंग और एडिटिंग शामिल है। हमने इन कौशलों को मापने के लिए एक नया टेस्ट बनाया, लाखों अभ्यास उदाहरण उत्पन्न करने के लिए एक फैक्ट्री बनाई, और यह साबित किया कि रोबोट को कार्यों की एक विस्तृत विविधता सिखाने से वे केवल क्लिक करना सिखाने की तुलना में कंप्यूटर का उपयोग करने में बहुत बेहतर बनते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →