← नवीनतम पेपर
🤖 AI

GEBench: Benchmarking Image Generation Models as GUI Environments

GEBench एक नया बेंचमार्क और एक बहु-आयामी मीट्रिक (GE-Score) है जिसे एकल-चरण और बहु-चरण इंटरैक्शन के माध्यम से टेम्पोरल रूप से सुसंगत और तार्किक रूप से सुसंगत GUI स्टेट ट्रांज़िशन उत्पन्न करने की इमेज जनरेशन मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxi
प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxin Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं, लेकिन एक पहले से बने हुए संसार के बजाय, गेम को वास्तविक समय में एक AI द्वारा "सपना" देखा जा रहा है। आप "Open Settings" बटन दबाते हैं, और AI तुरंत एक बिल्कुल नई तस्वीर बनाता है कि उस सेटिंग्स मेनू को कैसा दिखना चाहिए।

यह जादुई लग सकता है, लेकिन एक बहुत बड़ी समस्या है: हमें यह कैसे पता चलेगा कि AI वास्तव में "गेम खेल" रहा है, या यह केवल सुंदर लेकिन बेतुकी कल्पनाएँ (hallucinations) रच रहा है?

यह शोध पत्र, GEBench, ठीक इसी विषय के बारे में है। इसका विवरण यहाँ दिया गया है:

1. समस्या: "सुंदर झूठा" विरोधाभास (The "Beautiful Liar" Paradox)

वर्तमान AI मॉडल (जैसे कि जो कला बनाते हैं) सुंदर चित्र बनाने में अद्भुत हैं। हालाँकि, यदि आप एक AI से "Phone Settings" स्क्रीन दिखाने के लिए कहते हैं और फिर उससे "Wi-Fi बटन पर क्लिक करने" के लिए कहते हैं, तो AI आपको फोन की एक सुंदर तस्वीर तो दिखा सकता है, लेकिन Wi-Fi बटन गलत जगह पर हो सकता है, टेक्स्ट अजीब (gibberish) दिख सकता है, या अगली स्क्रीन पूरी तरह से एक अलग फोन जैसी दिख सकती है।

AI की दुनिया में, हम इसे टेम्पोरल कोहेरेंस (temporal coherence) और स्पेशियल ग्राउंडिंग (spatial grounding) की कमी कहते हैं। आम भाषा में, इसका मतलब है कि AI में "अल्पकालिक स्मृति (short-term memory) की समस्या" और "खराब हाथ-आँख का समन्वय (hand-eye coordination)" है। वह एक फ्रेम को पूरी तरह से बना सकता है, लेकिन वह एक तार्किक कहानी का पालन नहीं कर सकता।

2. समाधान: GEBench (अल्टीमेट "UI ड्राइविंग टेस्ट")

शोधकर्ताओं ने GEBench बनाया है, जो एक डिजिटल इंटरफ़ेस के भीतर AI के लिए एक कठोर "ड्राइविंग टेस्ट" की तरह काम करता है। केवल AI से "बिल्ली बनाने" के लिए कहने के बजाय, वे उसे एक डिजिटल इंटरफ़ेस के भीतर विशिष्ट "ड्राइविंग" कार्य देते हैं:

  • एकल चरण (The Single Step): "इस विशिष्ट आइकन पर क्लिक करें। मुझे दिखाएं कि आगे क्या होता है।" (बुनियादी प्रतिक्रियाओं का परीक्षण)।
  • लंबी यात्रा (The Long Journey): "होम स्क्रीन से शुरू करें और सफलतापूर्वक कॉफी ऑर्डर करें।" (दीर्घकालिक योजना और स्मृति का परीक्षण)।
  • काल्पनिक ऐप (The Imaginary App): "एक अंतरिक्ष यात्री के लिए एक बिल्कुल नया ऐप डिज़ाइन करें।" (रचनात्मकता और तर्क का परीक्षण)।
  • सटीकता परीक्षण (The Precision Test): "ठीक इन निर्देशांकों [X, Y] पर क्लिक करें।" (हाथ-आँख के समन्वय का परीक्षण)।

3. स्कोरिंग: "GE-Score" (पाँच-सितारा समीक्षा)

AI को ग्रेड देने के लिए, वे केवल यह नहीं कहते कि "अच्छा दिखता है" या "बुरा दिखता है"। वे एक पांच-आयामी ग्रेडिंग प्रणाली का उपयोग करते हैं, ठीक वैसे ही जैसे एक रेस्टोरेंट क्रिटिक करता है:

  1. लक्ष्य प्राप्ति (क्या आपको खाना मिला?): क्या AI ने वास्तव में वह किया जो आपने उससे पूछा था? यदि आपने मेनू खोलने के लिए कहा, तो क्या मेनू खुला है?
  2. इंटरैक्शन लॉजिक (क्या किचन समझ में आता है?): यदि आप "डिलीट" पर क्लिक करते हैं, तो क्या ऐप वास्तव में "क्या आप आश्वस्त हैं?" वाला पॉप-अप दिखाता है, या यह बस किसी यादृच्छिक स्क्रीन पर पहुँच जाता है?
  3. निरंतरता (क्या वेटर वही व्यक्ति है?): यदि आप एक स्क्रीन से दूसरी स्क्रीन पर जाते हैं, तो क्या फोन अभी भी वही फोन दिखता है, या उसका रंग और आकार अचानक बदल गया?
  4. UI प्लाउज़िबिलिटी (क्या मेनू पठनीय है?): क्या बटन असली बटन की तरह दिखते हैं, या वे अजीब, पिघले हुए धब्बों जैसे दिखते हैं?
  5. विजुअल क्वालिटी (क्या प्रस्तुति सुंदर है?): क्या टेक्स्ट स्पष्ट और साफ है, या यह धुंधला और अस्त-व्यस्त है?

4. निष्कर्ष: AI एक "प्रतिभाशाली लेकिन विचलित छात्र" है

दुनिया के सर्वश्रेष्ठ AI (जैसे गूगल और OpenAI के मॉडल्स) का परीक्षण करने के बाद, शोधकर्ताओं ने कुछ दिलचस्प पाया:

AI एकल चरणों में प्रतिभाशाली है (वह एक सुंदर स्क्रीन बना सकता है), लेकिन लंबे अनुक्रमों (sequences) में बुरी तरह विफल हो जाता है। जैसे-जैसे "कहानी" आगे बढ़ती है, AI भ्रमित हो जाता है। वह भूल जाता है कि वह कहाँ था, वह निर्देशांकों (coordinates) का ट्रैक खो देता है, और वह टेक्स्ट और आइकनों की "कल्पना" (hallucinate) करने लगता है।

यह क्यों मायने रखता है?

भविष्य में, हम ऐसे AI "एजेंट्स" चाहते हैं जो आपके कंप्यूटर का उपयोग आपके लिए कर सकें—फ्लाइट बुक करना, फाइलें व्यवस्थित करना, या आपके ईमेल प्रबंधित करना। ऐसा करने के लिए, AI को एक विश्वसनीय "दुनिया" में रहना होगा। GEBench वह पैमाना है जो वैज्ञानिकों को एक ऐसा AI बनाने में मदद करेगा जो केवल इंटरफेस के सपने नहीं देखता, बल्कि वास्तव में उनमें नेविगेट करना समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →