From Subjective Judgments to Auditable Standards:Protocol-Guided AI Auditing of Website Redundancy
本文介绍了 CORA,这是一个协议引导的审计框架,它通过使用版本化的视觉语言模型和严格的验证门控,将网站冗余分解为截然不同的、可审计的指标(重复负载、常规使用税和故障域恢复储备),旨在证明其相对于标量基准线具有更高的预测准确性,同时强调其目前作为受控基准测试候选对象而非通用标准的地位。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
我们正生活在一个利用人工智能辅助构建网站的时代,而同样这些工具也越来越多地被要求去评判它们所协助创建的网页质量。然而,衡量数字界面的质量绝非仅仅通过统计错误就能实现的。对于一个人来说,某个功能可能感觉像是贴心的备份,但对另一个人来说,它可能就是令人分心的干扰,这取决于他们的使用目的以及可能出现的状况。在可用性研究领域,研究人员长期以来一直致力于将这些不断变化的、主观的感觉转化为稳固且可重复的标准。挑战不仅在于要求计算机观察屏幕并说“这很乱”,还在于如何精确定义什么是“乱”,如何证明计算机观察的对象是正确的,以及如何确保答案不会仅仅因为软件版本的更新而发生改变。如果没有严格的方法,无论计算机的语气听起来多么自信,其判断都不过是一种猜测。
北京航空航天大学和北京理工大学的研究团队提出了一种处理这一问题的新方法,他们不将网站冗余性的评估视为单一的观点,而是将其视为一种严谨的三部分测量。他们将这种方法称为 CORA。CORA 并没有要求模型为一个页面的混乱程度给出单一的分数,而是将这一概念拆解为三个不同的问题。首先,它询问什么是被重复的:是视觉装饰、信息文本,还是用户的交互方式?其次,它询问这种重复在用户正常使用过程中造成了什么代价,例如在绕过不必要元素时所需的额外点击或时间。第三,也是最重要的一点,它询问如果发生故障,什么东西仍然保持可用。如果一个主要按钮失效了,是否存在备份路径?如果主菜单崩溃了,是否有一个地标来引导用户?通过将这三个要素——什么是重复的、重复的代价是什么、以及在故障中能幸存下来的是什么——进行分离,研究人员旨在创造一种既精确又对其局限性保持诚实的测量方法。
为了测试这个想法,研究人员构建了一个透明的实验室环境,使他们能够控制网站和任务的每一个细节。他们创建了数千个模拟场景,在其中刻意添加或删除重复元素,因为他们完全清楚“正确”答案应当是什么。随后,他们要求两个不同的人工智能模型充当审计员。这些模型不被允许仅仅进行猜测;它们被要求为每一项主张提供具体的证据,指向屏幕上支持其判断的精确部分。在任何分数发布之前,必须通过一套严格的独立检查。系统会验证模型的证据是否确实与屏幕相匹配,逻辑是否遵循一致的顺序,以及模型是否只是在对每个页面重复相同的答案。如果其中一项检查失败,系统就会拦截分数,拒绝发布任何无法完全验证的结果。
这项实验的结果揭示了一个关键的区别:一个能够重复答案的计算机与一个能够真正衡量一个概念的计算机之间是不同的。在一组测试中,研究人员发现他们的三部分方法成功地将重复的“代价”与备份选项的“储备”区分开来。当他们在模拟网站中引入故障时,系统正确地识别出,即使页面看起来更混乱,拥有更多备份路径的页面也更具鲁棒性。这种分离使得系统能够比那些仅仅统计总混乱程度的方法,更好地预测用户在故障场景下的成功率。然而,当研究人员转向人工智能模型来进行实际评判时,结果却令人清醒。两个模型都产生了高度一致且可重复的答案,但都没有一个能通过严格的验证检查。一个模型给出的答案表面上看起来是正确的,但无法指向屏幕上正确的证据。另一个模型则只是将自己的观察结果复制回系统,而不是提供请求的分析。由于验证闸门按照设计在工作,它拒绝从任何一个模型中发布自动评分,尽管它们已经生成了数千个响应。
这种拒绝发布分数的情况并非实验的失败,反而恰恰是其主要的成功之处。这项研究表明,重复性并不等同于有效性。机器可以持续产生错误的答案,或者产生一个缺乏任何真实视觉证据支撑的一致性答案。通过构建一个在发布判断前先检查证据的系统,研究人员展示了自动捕捉这些失败的可能性。这项研究并未找到一个让计算机今天就能完美评判网站质量的“灵丹妙药”。相反,它提供了一个构建此类系统的蓝图:即将计算机视为一种需要经过校准和检查的版本化仪器,而非一个只会陈述真理的神谕。研究人员总结道,虽然该方法在受控的模拟环境中表现良好,但尚未准备好投入现实世界。它既没有在真实人类使用的实际网站上进行过测试,也没有与人类专家进行对比,以观察计算机“拦截”的分数是否符合人类的直觉。目前,该系统是一个概念验证:它确保当我们最终让机器来评判我们的数字空间时,我们能确切知道它们看到了什么,错过了什么,以及为什么它们选择了保持沉默。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。