Do LLMs Need to See Everything? A Benchmark and Study of Failures in LLM-driven Smartphone Automation using Screentext vs. Screenshots
यह शोधपत्र डेलीड्रॉइड (DailyDroid) को प्रस्तुत करता है, जो 75 स्मार्टफोन ऑटोमेशन कार्यों का एक बेंचमार्क है, जिसका उपयोग केवल टेक्स्ट-आधारित बनाम मल्टीमॉडल इनपुट का उपयोग करने वाले एलएलएम-संचालित (LLM-driven) एजेंटों के विफलता मोड का मूल्यांकन और विश्लेषण करने के लिए किया गया है, जो यह प्रकट करता है कि हालांकि मल्टीमॉडल इनपुट मामूली सुधार प्रदान करते हैं, फिर भी यूआई (UI) सुलभता और मॉडल डिजाइन में महत्वपूर्ण समस्याएं बनी हुई हैं।