Context-Aware Fine-Grained Ranking of Art Exam Works Under Shared Evaluation Conditions
本文通过引入一个按考试组别组织的全新数据集,并提出一种利用双路径参考编码和自适应路由来捕捉视觉相似作品间上下文感知相对质量差异的组别条件框架,解决了艺术考试中细粒度排序的挑战。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在视觉艺术的世界里,眼睛通常是最终的评判者,但在高风险的艺术考试领域,这种判断必须是连贯、公平且精准的。几十年来,研究人员一直在教计算机观察单张照片并决定其美感程度,这一领域被称为图像美学评估。这些系统已经非常擅长识别孤立存在的构图精美的风景画或引人注入的肖像画。然而,艺术评分的真正挑战很少是在真空中发生的。当一位老师评价一组学生作品时,如果所有学生都是根据同一个特定场景的指令进行创作,那么比较的对象并不是哪张画在全世界范围内最美,而是哪一张在这一特定群体中表现最好。两幅针对同一主题的素描之间的细微差别往往过于精细,以至于标准的计算机模型无法捕捉,因为这些模型训练时是逐一观察图像的,从未见过它们所处的同伴环境。
这正是来自湖北工业大学、香港理工大学及其他机构的研究团队致力于解决的具体难题。他们意识到,现有的艺术评判工具缺少了一个至关重要的上下文信息:艺术创作所共享的环境。为了解决这个问题,他们构建了一个新的专门数据库,称为“艺术考试数据集”(Art Exam Dataset)。该集合包含3,360件学生艺术品,涵盖了从铅笔素描到速写以及全彩绘画的各种类型。至关重要的是,这些作品并非随机堆砌的图片;它们被组织成93个不同的组别,每个组别代表一个单一的考试主题。在每一个组别中,学生们面对的是相同的题目和相同的条件,这使得这些作品能够像随机的互联网照片那样直接进行比较。
研究人员随后开发了一种新的计算机评分方式,称之为“组条件方法”(group-conditioned approach)。该系统不再将每幅画作视为孤立的对象,而是同时观察整个组别。想象一位老师站在一排学生画作前;他们不会在真空中评判第一幅画,然后再在真空中评判第二幅。他们会扫视整排画作,理解在这个特定的集合中,“好”的画作可能与在另一个集合中看起来不同。计算机模型模仿了这种行为。它首先形成一个关于该特定组别内平均水平画作的总体概念。然后,它将每一位学生的作品与该组平均水平进行对比。它会提出两个问题:这幅画与该集合中的典型作品有何不同?以及它如何在人群中脱颖而出?通过结合这些比较,系统学会了识别出那些将顶尖作品与平庸之作区分开来的细微差别,即使在主题几乎完全相同的情况下也是如此。
这种方法的测试结果是针对各种试图评判艺术的现有方法进行的。这项名为DPAR-Net的新系统在按正确顺序对作品进行排名方面表现得更为准确。当研究人员衡量计算机的排名与人类考官给出的实际分数匹配程度时,新方法始终优于旧模型。它在区分极其相似的作品方面特别有效,而之前的系统在处理此类任务时经常出错。研究还表明,仅仅让计算机观察更多数据或使用单张图像更复杂的特征是不够的;关键在于迫使模型理解图像之间的关系。系统学到了,一件艺术品在考试中的价值是相对于其同伴而言的,而非绝对的。
尽管取得了这些成功,研究人员也谨慎地指出了他们工作的局限性。计算机学习的是模仿分数的相对排序,而不是理解艺术深层的、主观的哲学。它目前还无法阅读老师用来判断面部结构与背景阴影的特定评分标准,因为数据集仅包含最终得分,而不包含详细的评语或细分说明。此外,人类评分本身也包含一定程度的主观性,而计算机只是在学习如何与这种人类共识保持一致,而不是在寻找某种关于美的客观真理。研究人员还观察到,系统有时在处理具有极强视觉冲击力但技术稳定性可能较弱的作品时会遇到困难,这表明该模型在理解专业艺术评论的细微差别方面仍有很长的学习之路。
最终,这项工作为未来如何实现艺术考试自动评分提供了新的基础。通过将焦点从评判单张图像转向共同评判一组图像,研究人员创造了一个更适用于艺术教育现实的工具。他们的数据集和方法提供了一种筛选大量提交作品、按质量进行组织并辅助人类教师进行评估的方式。虽然它还不能取代人类的眼睛,但它提供了一个全新的视角,让我们去审视艺术评估中复杂且具有比较性的本质,证明了有时,要看清一件作品的质量,你必须首先理解它所处的同伴环境。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。