← नवीनतम पेपर
🤖 AI

GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

यह शोध पत्र GAIA को प्रस्तुत करता है, जो एक डेटा फ्लाईव्हील सिस्टम है जो GUI एजेंट कार्यों का मूल्यांकन और परिशोधन करने के लिए एक सहज क्रिटिक मॉडल (Intuitive Critic Model) को पुनरावृत्ति से प्रशिक्षित करता है, जिससे टेस्ट-टाइम स्केलिंग सक्षम होती है और डेटा संग्रह एवं पुनप्रशिक्षण के एक स्व-सुधार चक्र के माध्यम से एजेंट के प्रदर्शन में क्रमिक सुधार होता है।

मूल लेखक: Shaokang Wang, Pei Fu, Ruoceng Zhang, Shaojie Zhang, Xiuwen Xi, Jiahui Yang, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaokang Wang, Pei Fu, Ruoceng Zhang, Shaojie Zhang, Xiuwen Xi, Jiahui Yang, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को स्मार्टफोन या कंप्यूटर स्क्रीन पर नेविगेट करना सिखा रहे हैं ताकि वह कार्य पूरे कर सके, जैसे कि "मैप पर एक गैस स्टेशन खोजें और फिर राइड बुक करें।" इस रोबोट को चलाने के लिए एक बहुत ही स्मार्ट AI है, लेकिन इसमें एक बड़ी खामी है: यह कभी भी "अनडू" (undo) बटन नहीं दबाता। यदि रोबोट एक भी गलत क्लिक कर देता है, तो वह हमेशा के लिए भटक सकता है, और पूरा कार्य विफल हो सकता है।

यह पेपर एक नए सिस्टम GAIA (GUI Action Critic's Data Flywheel System) को पेश करता है ताकि इसे ठीक किया जा सके। GAIA को एक अत्यधिक सख्त कोच या सुरक्षा निरीक्षक के रूप में सोचें जो रोबोट के कोई भी कदम उठाने से पहले उसके पास खड़ा होता है।

यह सिस्टम कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "वन-शॉट" गलती (The "One-Shot" Mistake)

वर्तमान AI रोबोट तुरंत सही कदम का अनुमान लगाने की कोशिश करते हैं। यदि वे गलत अनुमान लगाते हैं, तो कार्य बर्बाद हो जाता है। इसे ठीक करने के पिछले प्रयासों में "वेरिफायर" (verifiers) का उपयोग किया गया था, लेकिन वे उन शिक्षकों की तरह थे जो रोबोट को सिखाने के लिए नकली गलतियाँ (जैसे स्क्रीन पर कहीं भी बेतरतीब ढंग से क्लिक करना) पैदा करते थे। यह अच्छी तरह से काम नहीं किया क्योंकि वास्तविक गलतियाँ अधिक सूक्ष्म और विशिष्ट होती हैं। इसके अलावा, कुछ पिछले तरीकों ने रोबोट को हर कदम के बारे में बहुत अधिक "सोचने" के लिए मजबूर किया, जो धीमा और अक्षम था।

2. समाधान: "सहज आलोचक" (The "Intuitive Critic" - ICM)

लेखकों ने एक विशेष मॉडल बनाया जिसे इंट्यूटिव क्रिटिक मॉडल (ICM) कहा जाता है।

  • यह क्या करता है: रोबोट को लंबी तर्क प्रक्रिया (reasoning process) के माध्यम से सोचने के बजाय, ICM एक इंसान के अंतर्ज्ञान (gut feeling) की तरह काम करता है। यह स्क्रीन, निर्देश और रोबोट के प्रस्तावित कदम को देखता है, और तुरंत कहता है, "हाँ, यह एक अच्छा कदम है" या "नहीं, यह गलत है।"
  • यह बेहतर क्यों है: यह तेज़ और सहज है, ठीक वैसे ही जैसे आप तुरंत जान जाते हैं कि कोई चाबी ताले में फिट बैठेगी या नहीं, बिना धातु के रसायन विज्ञान का विश्लेषण किए।

3. इंजन: "डेटा फ्लाईव्हील" (The "Data Flywheel")

यह इस पेपर का सबसे रचनात्मक हिस्सा है। फ्लाईव्हील एक भारी पहिया होता है जो ऊर्जा संचित करता है; एक बार जब यह घूमने लगता है, तो यह चलता रहता है और मजबूत होता जाता है। GAIA, आलोचक (Critic) को समय के साथ स्मार्ट बनाने के लिए डेटा फ्लाईव्हील का उपयोग करता है।

यहाँ चक्र दिया गया है:

  • राउंड 1 (शुरुआत): सिस्टम एक बुनियादी रोबोट लेता है और उसे कार्य हल करने की कोशिश करने देता है। यह उन कदमों को रिकॉर्ड करता है जो सफल रहे (Positive) और वे कदम भी जो विफल रहे (Negative)। यह डेटा पहले संस्करण के क्रिटिक (ICM) को प्रशिक्षित करने के लिए उपयोग किया जाता है।
  • राउंड 2 (स्पिन): अब, बुनियादी रोबोट फिर से कार्य हल करने का प्रयास करता है, लेकिन इस बार, क्रिटिक निगरानी करता है। रोबोट कई संभावित कदम उत्पन्न करता है (जैसे पासा फेंकना), और क्रिटिक सबसे अच्छे कदम को चुनता है।
  • फीडबैक लूप: कभी-कभी, क्रिटिक भी बहुत कठिन कार्यों में भ्रमित हो सकता है। सिस्टम इन "पेचीदा" क्षणों को सहेज लेता है, उन्हें लेबल करता है, और उन्हें प्रशिक्षण डेटा में वापस डाल देता है।
  • परिणाम: सिस्टम क्रिटिक के दूसरे, अधिक स्मार्ट संस्करण (जिसे ICM-r2 कहा जाता है) को प्रशिक्षित करता है। यह नया संस्करण सूक्ष्म त्रुटियों को पहचानने में बेहतर होता है क्योंकि इसने उन कठिन मामलों को "देखा" है जिन्हें पहले संस्करण ने मिस कर दिया था।

4. "बेस्ट-ऑफ-एन" रणनीति (The "Best-of-N" Strategy)

वास्तविक परीक्षण के दौरान, रोबोट केवल एक कदम नहीं चुनता है। वह 8 संभावित कदमों की एक सूची बनाता है (जैसे एक शेफ 8 अलग-अलग रेसिपी आज़माता है)। क्रिटिक उन सभी 8 का स्वाद लेता है और उनमें से सबसे सफल होने वाले को चुनता है। इसे टेस्ट-टाइम स्केलिंग (Test-Time Scaling) कहा जाता है। इसके लिए मुख्य रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं होती है; यह केवल विकल्पों को फ़िल्टर करने के लिए क्रिटिक का उपयोग करता है।

5. परिणाम

लेखकों ने विभिन्न AI मॉडलों (दोनों मुफ्त/ओपन-सोर्स और सशुल्क/क्लोज्ड-सोर्स) पर इस सिस्टम का परीक्षण किया।

  • परिणाम: इस "क्रिटिक कोच" को जोड़ने से, रोबोट कार्य पूरा करने में काफी बेहतर हो गए।
  • सुधार: सिस्टम ने जितना अधिक डेटा को रीसायकल किया (फ्लाईव्हील को घुमाया), क्रिटिक उतना ही बेहतर होता गया, जिससे रोबोट की सफलता दर में और भी वृद्धि हुई।

सारांश उपमा (Summary Analogy)

कल्पित कीजिए कि एक छात्र ड्राइविंग टेस्ट दे रहा है।

  • GAIA के बिना: छात्र गाड़ी चलाता है, और यदि वह फुटपाथ से टकरा जाता है, तो टेस्ट समाप्त हो जाता है।
  • GAIA के साथ: छात्र स्टीयरिंग घुमाने से पहले, एक क्रिटिक कोच सड़क को देखता है। छात्र तीन संभावित मोड़ सुझाता है। कोच तुरंत कहता है, "बाएँ मत मुड़ो, वहाँ गड्ढा है। दाएँ मुड़ो।"
  • फ्लाईव्हील: हर बार जब कोच किसी पेचीदा स्थिति को लगभग मिस कर देता है, तो वह उसे एक नोटबुक में लिख लेता है। बाद में, वह उस नोटबुक का अध्ययन करता है ताकि अगले दौर के लिए और भी अधिक सटीक कोच बन सके।

पेपर का दावा है कि यह सिस्टम AI एजेंटों को सुरक्षित, सटीक और जटिल डिजिटल कार्यों को बिना क्रैश हुए संभालने में सक्षम बनाता है, और यह सब केवल एक स्मार्ट "दूसरी राय" (second opinion) परत जोड़कर संभव हुआ है जो इसके उपयोग के साथ और भी स्मार्ट होती जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →