✨ 要点🔬 技术摘要
想象一下,如果你要评判一个人读一本书的水平如何。你可以问他们一系列多项选择题,比如:“那只狗是什么颜色的?”或者“英雄赢了吗?”这些测试既快速又易于评分,但它们只能告诉你一个人是否能发现事实。它们无法告诉你这个人是否真的能创作一个故事、理解深层含义,或者解释为什么一个情节漏洞会毁掉整本书。这正是数据可视化 领域的研究人员所面临的问题。可视化素养不仅仅是看着一张图表并读出一个数字;它关乎整个工具箱:理解数据的含义、察觉图表何时在误导你,甚至能够从零开始绘制自己的图表。长期以来,科学家们主要使用这些“多项选择题”式的测试来衡量这项技能。但就像一场只要求你圈出正确单词的写作测试一样,这些旧有的测试对于聪明人来说可能太简单了(每个人都能拿A),并且它们忽略了专家们每天都在使用的那些真正困难且具有创造性的技能。
因此,一支研究小组决定尝试一些不同的方法。他们不再只是要求人们从列表中挑选正确答案,而是要求他们去绘制 和讲述 。在他们的研究中,他们给参与者布置了三种类型的任务:一组人需要根据一堆杂乱的数字列表绘制图表草图;另一组人需要观察一个奇怪的图表并大声说出其中的问题所在;第三组人则需要做传统的、老派的多项选择题。他们测试了三类人群:普通的互联网从业者(他们可能没有专门学习过图表)、修过相关课程的大学生,以及从事可视化研究工作的专业人士。
结果就像是在观察一位主厨、一名烹饪系学生和一位家庭厨师尝试做饭。那些旧的多项选择题就像是在问:“盐是咸的吗?”每个人都能答对,所以这些测试无法区分大师和初学者。但当研究人员要求人们绘制 图表或评判 一个糟糕的图表时,差异变得清晰可见。专家们绘制出了复杂且深思熟虑的设计,并能发现图表中细微的错误;而初学者则在基础知识上挣扎,或者在尝试动手绘图时感到挫败。这项研究表明,这些“绘制与讲述”类的测试能更好地识别谁才是真正的专业人士,尤其是当你需要区分学生和专业人士时。虽然这些新测试的评分时间更长,设置也更复杂,但研究人员认为,这是衡量现实世界技能的必要升级,就像学校使用论文而非仅仅使用填涂卡来评判写作能力一样。
技术摘要:阅读、批判还是绘图?调查可视化素养评估的替代模态
问题陈述 可视化素养是一个包含解码、构建和批判可视化的多维构念。然而,现有的评估工具(如 VLAT、Mini-VLAT、CALVI)主要采用多项选择题形式,侧重于图表理解和事实提取等低阶技能。这些定量方法通常存在“天花板效应”,即即使是具备中等水平技能的个体也会得到接近满分的成绩,从而无法区分不同的专业水平。此外,它们缺乏评估高阶技能的细微差别,例如应用外部知识、形成批判性意见以及从零开始设计可视化。作者认为,类比于在 SAT 和 GRE 等文本素养标准化考试中加入论文题,可视化领域也需要非约束性的、以创建为中心的定性评估,以全面评价可视化素项技能的范围。
研究方法 作者进行了一项针对受试者内设计的用户研究(N = 80 N=80 N = 80 ),旨在开发并验证两种新的定性评估模态:绘图(Sketching)与 批判(Critique) 。
参与者: 招募了代表不同专业水平的三个不同群体:
众包人员(Crowdworkers) (n = 42 n=42 n = 42 ):通过 Prolific 招募,被假定为几乎没有接受过正式的可视化训练。
学生(Students) (n = 21 n=21 n = 21 ):修读过可视化课程的本科生或研究生。
专家(Experts) (n = 17 n=17 n = 17 ):可视化研究人员(持有博士学位或具备审稿能力的人员)。
评估任务:
绘图: 参与者被呈现了五组多样化的数据集(例如,社交网络、文件层级结构、降雨数据),并被要求“绘制一张你认为最能代表该数据的可视化图表”,同时进行出声思维(think aloud)。他们使用带有溯源追踪功能的 Web 端画布(TLDraw)进行操作。
批判: 参与者被展示了具有刻意设计缺陷的可视化图表(例如,使用不当颜色尺度的 3D 矩形树图、具有误导性对数比例投影的折线图,以及分箱处理不当的地图)。他们被要求进行出声思维并对可视化图表进行批判。
控制措施: 参与者还完成了既有的多项选择评估:Mini-VLAT (理解力)和 CALVI (批判性思维)。
评分与分析:
评分量表(Rubrics): 为两种模态开发了整体式评分量表。绘图量表评估了可视化设计/层级、基础编码选择、语义有效性以及引导/文本。批判量表评估了阅读、情境化和判断力。评分范围从“无”到“优秀”(5 分制)。
统计分析: 作者利用贝叶斯项目反应理论(IRT)中的 2PL 序数回归模型来估计潜在能力和项目区分度。作者使用 Welch's t 检验来比较各组均值,并计算了四种评估方式之间潜在能力得分的 Pearson 相关系数。
核心贡献
新型评估模态: 本文引入并验证了两种定性、开放式的评估任务(绘图与批判),旨在衡量传统多项选择测试无法捕捉的高阶可视化素养技能。
整体式评分量表: 作者提供了详细的整体式评分量表,用于评估自由形式的草图和出声思维批判,其评估维度超越了简单的正确性,转而评估设计逻辑和推理过程。
实证验证: 通过与既有评估的对比研究,本文证明了这些定性模态能够成功区分专业水平(众包人员、学生、专家),而传统测试在此方面表现乏力。
结果
专业水平的分辨能力: 绘图和批判评估均表现出对专业水平差异的高度敏感性。
绘图: 显著区分了所有三个群体(专家 vs. 众包人员;学生 vs. 众包人员;专家 vs. 学生)。
批判: 显著区分了专家与众包人员,以及专家与学生,但学生与众包人员之间的区别较不明显。
对比: 相比之下,Mini-VLAT 表现出明显的天花板效应,各组之间没有显著的成对差异。CALVI 显示出一定的区分度(专家 vs. 众包人员),但其敏感度低于定性测量手段。
项目区分度: 贝叶斯 IRT 分析显示,绘图和批判项目的区分度较高(批判的中位数约为 1.92,绘图约为 1.52),表明它们能有效区分不同能力的参与者。
相关性: 定性评估(绘图与批判)彼此之间呈中度相关(r ≈ 0.59 r \approx 0.59 r ≈ 0.59 ),且与 CALVI 也呈中度相关(r ≈ 0.52 – 0.57 r \approx 0.52\text{--}0.57 r ≈ 0.52 – 0.57 ),但与 Mini-VLAT 的相关性较弱(r ≈ 0.30 r \approx 0.30 r ≈ 0.30 )。这表明虽然这些评估相关,但它们捕捉的是不同的技能集。
定性观察:
众包人员经常对手动绘图表示沮丧,并依赖于熟悉的、往往并不恰当的图表类型(例如,对所有数据都使用条形图)。
专家展现出了细致的设计选择(例如,避免节点链接图中出现边交叉)和更深层的上下文推理。
众包人员往往进行“浅层批判”,侧重于基本规则(例如,“需要一个标题”)而非设计共情或数据素养问题。
意义与主张 作者认为,定性、多模态评估是现有可视化素养评估的重要补充,特别是当目标是区分具备可视化训练的人员与未受训人员时。他们指出,虽然多项选择测试在评估基础理解力方面效率很高,但不足以评估从事高级可视化工作所需的构建与批判技能。
本文将这些工具定位为现有测试的有力补充,而非完全替代品,特别是在需要高保真技能区分度的场景下(例如,为涉及可视化设计的实验筛选参与者)。作者承认增加管理和评分的负担是其局限性,但认为对高阶技能的洞察足以证明其价值。他们还提到,未来的工作可以探索使用大语言模型(LLM)进行评分,但同时也对其处理整体式评分量表的能力及方言偏差提出了警示。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。