← नवीनतम पेपर
💬 NLP

Video-Based Reward Modeling for Computer-Use Agents

यह शोध पत्र एक्ज़ीक्यूशन वीडियो रिवॉर्ड मॉडल (ExeVRM) को प्रस्तुत करता है, जो एक स्केलेबल और मॉडल-अग्नोस्टिक फ्रेमवर्क है जो एक नए 53k वीडियो-टास्क-रिवॉर्ड डेटासेट और स्पैटियोटेम्पोरल टोकन प्रूनिंग का लाभ उठाकर निष्पादन वीडियो से कंप्यूटर-उपयोग करने वाले एजेंट के प्रक्षेपवक्रों का सटीक मूल्यांकन करता है, जो कार्य सफलता भविष्यवाणी में अग्रणी प्रोप्राइटरी मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर चलाना सिखा रहे हैं। आप उसे कहते हैं, "कृपया पेरिस के लिए एक फ्लाइट बुक करें और पुष्टिकरण ईमेल (confirmation email) को सेव करें।" रोबोट क्लिक करना, टाइप करना और नेविगेट करना शुरू करता है। लेकिन आपको कैसे पता चलेगा कि उसने वास्तव में अपना काम सही ढंग से किया है या नहीं?

यह वह समस्या है जिसे पेपर "Video-Based Reward Modeling for Computer-Use Agents" हल करने की कोशिश करता है। यहाँ उनके समाधान का एक सरल विवरण दिया गया, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।

1. समस्या: रोबोट की सोच का "ब्लैक बॉक्स" (Black Box)

वर्तमान में, जब हम किसी रोबोट के प्रदर्शन को ग्रेड देने की कोशिश करते हैं, तो हम अक्सर उसके आंतरिक "विचारों" या उसके द्वारा लिखे गए कोड को देखते हैं। लेकिन अलग-अलग रोबोट अलग तरह से सोचते हैं। कोई कोड लिख सकता है, कोई बटन क्लिक कर सकता है, और कोई बस अपने तरीके से आगे बढ़ सकता है। यह दो अलग-अलग छात्रों के गणित के टेस्ट को ग्रेड करने जैसा है जब एक बीजगणित (algebra) का उपयोग करता है और दूसरा कैलकुलेटर का; उनकी तुलना निष्पक्ष रूप से करना कठिन है।

पेपर का विचार: यह देखने के बजाय कि रोबोट ने कैसे सोचा, आइए केवल उसके द्वारा किए गए कार्य की फिल्म (movie) देखें।

  • उपमा: कल्पना कीजिए कि एक शिक्षक छात्र के निबंध को ग्रेड दे रहा है। छात्र को निबंध लिखते समय अपने मस्तिष्क की केमिस्ट्री समझाने के लिए कहने के बजाय, शिक्षक केवल अंतिम ड्राफ्ट पढ़ता है। यदि कहानी समझ में आती है और प्रश्न का उत्तर देती है, तो वह एक अच्छा निबंध है।
  • समाधान: शोधकर्ताओं ने एक ऐसा सिस्टम बनाया जो कंप्यूटर स्क्रीन की वीडियो रिकॉर्डिंग देखता है। यह रोबोट के आंतरिक कोड को अनदेखा करता है और केवल दृश्य परिणाम (visual result) को परखता है: "क्या रोबोट ने वास्तव में फ्लाइट बुक की?"

2. चुनौती: बहुत अधिक शोर, बहुत कम संकेत (Too Much Noise, Too Little Signal)

कंप्यूटर स्क्रीन अव्यवस्थित होती है। यदि आप किसी को कंप्यूटर का उपयोग करते हुए 5 मिनट का वीडियो रिकॉर्ड करते हैं, तो स्क्रीन का 90% हिस्सा स्थिर (static) हो सकता है (जैसे एक खाली सफेद बैकग्राउंड, एक टूलबार जो कभी नहीं हिलता, या कोने में एक लोगो)। असली एक्शन—वह छोटा सा क्षण जहाँ रोबोट गलत बटन क्लिक करता है या एक अक्षर टाइप करता है—स्क्रीन के एक छोटे से कोने में केवल एक सेकंड के लिए हो सकता है।

उपमा: कल्पना कीजिए कि आप घास के ढेर में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं, लेकिन घास का ढेर एक विशाल, चलता-फिरता वीडियो है। अधिकांश वीडियो केवल हरी घास (स्थिर बैकग्राउंड) है। आपको घास को अनदेखा करना होगा और केवल उस छोटे से क्षण पर ध्यान केंद्रित करना होगा जब सुई गिरती है।

समाधान: "टोकन प्रूनिंग" (स्मार्ट फ़िल्टर)
शोधकर्ताओं ने Spatiotemporal Token Pruning नामक एक विशेष फ़िल्टर बनाया।

  • Spatial Pruning (द मिटाने वाला): यह एक सिंगल फ्रेम को देखता है और कहता है, "यह बड़ा नीला बैकग्राउंड उबाऊ है और इसमें कोई बदलाव नहीं हुआ है। चलिए जगह बचाने के लिए इसे मिटा देते हैं।"
  • Temporal Pruning (द स्किप करने वाला): यह समय के साथ वीडियो को देखता है और कहता है, "यह साइडबार पिछले 10 सेकंड से एक जैसा ही है। चलिए इन फ्रेम्स को छोड़ देते हैं।"
  • परिणाम: सिस्टम केवल "निर्णायक" क्षणों को रखता है—कर्सर का हिलना, एक नई विंडो का पॉप-अप होना, या टेक्स्ट बॉक्स का रंग बदलना। यह एक भारी, धीमे वीडियो को एक हल्के, हाई-स्पीड हाइलाइट रील में बदल देता है।

3. डेटा की समस्या: रोबोट को क्या नहीं करना है, यह कैसे सिखाएं

रोबोट को यह सिखाने के लिए कि "बुरा काम" कैसा दिखता है, आपको विफलता (failure) के उदाहरणों की आवश्यकता होती है। लेकिन मौजूदा डेटा में ज्यादातर केवल वही दिखाया जाता है जहाँ रोबोट चीजें पूरी तरह से कर रहा होता है। यह एक ड्राइविंग इंस्ट्रक्टर को केवल परफेक्ट ड्राइवर के वीडियो दिखाकर सिखाने जैसा है; उन्हें यह नहीं पता चलेगा कि छात्र ने टर्न सिग्नल देना भूल गया है, यह कैसे पहचानें।

समाधान: "Adversarial Instruction Translation"
शोधकर्ताओं ने नकली "गलत" उदाहरण बनाने के लिए एक चतुर ट्रिक का उपयोग किया।

  • उपमा: कल्पना कीजिए कि आपके पास किसी के परफेक्ट सैंडविच बनाने का वीडियो है। फिर आप एक स्मार्ट AI से पूछते हैं: "एक ऐसी रेसिपी लिखें जो इस वीडियो में फिट बैठती हुई लगे, लेकिन वास्तव में गलत हो।"
    • वीडियो: कोई ब्रेड पर हैम (ham) रख रहा है।
    • नकली निर्देश: "कृपया पीनट बटर और जेली सैंडविच बनाएं।"
    • मेलान्वैत (Mismatch): AI महसूस करता है, "अरे, वीडियो में हैम दिख रहा है, लेकिन निर्देश में पीनट बटर मांगा गया था! यह एक विफलता है!"
  • परिणाम: उन्होंने ऐसे 53,000 "मिसमैच" जोड़े बनाए। यह उनके मॉडल को सूक्ष्म त्रुटियों को पहचानने के लिए प्रशिक्षित करता है, न कि केवल बड़ी विफलताओं को।

4. परिणाम: "ExeVRM" मॉडल

उन्होंने इन सभी हिस्सों को मिलाकर ExeVRM (Execution Video Reward Model) नामक एक मॉडल बनाया।

  • यह क्या करता है: आप इसमें उपयोगकर्ता का निर्देश और रोबोट द्वारा उसे करने का एक वीडियो डालते हैं। मॉडल वीडियो को देखता है और कहता है, "सफलता" (Success) या "विफलता" (Failure), और यहाँ तक कि यह भी बताता है कि रोबोट ने ठीक कब गलती की।
  • यह कितना अच्छा है? इसने इस विशिष्ट कार्य में सबसे बड़े, सबसे महंगे AI मॉडल्स (जैसे GPT-5 और Gemini) को भी पीछे छोड़ दिया।
    • उपमा: यह एक नए, विशेष रेफरी की तरह है जो केवल गेम टेप देखता है। भले ही यह "सुपर रेफरी" (बड़े मॉडल्स) की तुलना में छोटा और सस्ता है, लेकिन यह फाउल पकड़ने में वास्तव में बेहतर है क्योंकि इसे सामान्य ज्ञान के बजाय विशेष रूप से वीडियो फुटेज पर प्रशिक्षित किया गया है।

सारांश

यह पेपर कंप्यूटर का उपयोग करने वाले रोबोट्स के लिए एक विशेष वीडियो रेफरी बनाने के बारे में है।

  1. विचारों को अनदेखा करें: केवल स्क्रीन का वीडियो देखें।
  2. फालतू चीजों को काटें: वीडियो के उबाऊ, स्थिर हिस्सों को हटाने के लिए एक स्मार्ट फ़िल्टर का उपयोग करें ताकि कंप्यूटर अभिभूत (overwhelmed) न हो।
  3. नकली विफलताएं बनाएं: AI का उपयोग करके "गलत" निर्देश आविष्कार करें ताकि मॉडल को गलतियाँ कैसी दिखती हैं, यह सिखाया जा सके।
  4. विजेता: परिणाम एक ऐसा मॉडल है जो दुनिया के वर्तमान दिग्गज AI मॉडल्स की तुलना में कंप्यूटर कार्यों को ग्रेड करने में तेज़, सस्ता और अधिक सटीक है।

यह सुनिश्चित करने की दिशा में एक कदम है कि हमारे भविष्य के AI असिस्टेंट केवल यह दिखाने के लिए नहीं कि वे काम कर रहे हैं, बल्कि वास्तव में काम कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →