FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting
本文介绍了 FineState-Bench,这是一个包含 2,209 个实例的综合基准测试,并采用了一种新颖的四阶段诊断流程,该流程揭示了当前大型视觉语言模型在实现精确的、基于状态条件的图形用户界面交互方面存在显著局限性,同时证明了改进的视觉定位能力可以显著提升性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教机器人使用电脑。过去,我们主要测试机器人能否找到按钮并点击它。如果机器人找到了正确的按钮,我们就会说:“干得好!”
但这篇新论文FineState-Bench指出,仅仅找到按钮是不够的。这就像告诉机器人:“把音量旋钮调到正好 75%。”如果机器人找到了音量旋钮,却点击了上面的错误位置,音量最终可能变成 60% 或 90%。对机器人而言,它“点击了旋钮”,但对人类来说,任务失败了,因为状态(音量级别)并不完全正确。
以下是研究人员所做工作和发现的一个简要分解:
1. 问题:“差不多”远远不够
当前针对 AI 智能体(使用屏幕的机器人)的测试就像玩“热或冷”游戏。它们只检查 AI 是否找到了正确的区域。但在现实生活中,我们需要精确性。
- 旧方法:机器人点击了“音量”滑块吗?是?通过。
- 新方法(FineState-Bench):机器人是否点击了滑块上能使音量恰好为 75% 的确切位置?如果它点击了 74% 或 76% 的位置,则失败。
作者表示,当前的 AI 模型在这方面实际上相当糟糕。即使是最聪明的模型,平均也只有约**23%**的时间能正确达到“精确状态”。它们擅长找到大致区域,但在命中改变设置所需的微小、精确目标方面表现极差。
2. 解决方案:为机器人建立一个新的“健身房”
为了解决这个问题,团队构建了FineState-Bench,这是一个包含超过 2,200 项不同任务的庞大测试平台。
- 游乐场:涵盖电脑、手机和网站。
- 任务:不再是简单的“点击这里”,任务非常具体:“将日期设置为 12 月 25 日”、“将此滑块拖动至 77.7%"或“选择确切的那种红色”。
- 地图:对于每项任务,他们都创建了一张超精确的地图。他们不仅仅在整个滑块周围画一个框,而是在你需要触摸以获得正确结果的滑块的确切部分周围画了一个微小的框。
3. 诊断工具:“视觉侦探”
研究人员意识到,当机器人失败时,我们不知道为什么。是它们没有理解指令?是找到了错误的按钮?还是找到了正确的按钮却错过了微小的目标?
为了解决这个问题,他们创建了一个视觉诊断助手(VDA)。你可以把它想象成站在机器人旁边的一位 helpful 的人类教练。
- 没有教练:机器人看着屏幕并猜测。(成功率:低)。
- 有教练:教练低声说:“嘿,你需要的那个红色按钮实际上就在这个小小的方框里,”并指向它。
- 结果:当机器人获得这个额外提示时,其成功率显著提高(约提升 15%)。
这告诉我们:机器人并不一定“愚蠢”或无法理解目标。它们的主要问题是视觉盲区。它们看不到需要点击的微小、精确的位置。如果我们给它们提供更好的视觉提示,它们在执行任务时会变得好得多。
4. 主要结论
该论文得出结论,虽然 AI 智能体在导航屏幕方面变得越来越好,但它们仍然在细粒度精确性方面挣扎。
- 它们就像在黑暗中试图穿针的人:能找到针(按钮),但无法让线穿过针眼(精确状态)。
- 当前的测试太容易了,因为它们接受“差不多”。
- 要构建真正可靠的机器人,使其能够执行复杂任务(例如调整专业视频编辑器的设置或填写精确的医疗表格),我们需要测试它们的精确度,而不仅仅是大致位置。
简而言之:机器人越来越擅长找到门,但它们仍然需要帮助才能完美地将钥匙插入锁孔。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。