想象一下,你是一位想要建造一种新型房屋的建筑师。你决定不再使用标准的砖块和砂浆,而是发明属于自己的建筑模块。为了实现这一目标,你需要一本特殊的“说明书”(一种元语言),它会告诉你如何设计这些新模块、它们如何组合在一起,以及如何将它们组装成一栋完整的房子。
Neverlang 是一个帮助建筑师(软件开发人员)创建这些定制建筑模块的工具。但在任何人开始使用它之前,他们需要先理解这本说明书本身。
这篇论文就像是给学生进行的一系列三次课堂测试,旨在考察两件事:
- 理解力: 他们是否真的能读懂并理解这本说明书?
- 采用度: 他们是否足够喜欢它,以至于将来想要使用它?
以下是研究人员发现的结果,使用了简单的类比:
1. 设置:三个不同的班级
研究人员并没有只测试一组人;他们运行了三个独立的“实验”(就像三个不同的班级),以确保其结果是可靠的。
- 班级 1 (2022年): 意大利的本科生和研究生。他们观看了一段 15 分钟的短视频来学习基础知识。
- 班级 2 (2023年): 来自一所专门国际学校的博士生。他们参加了一个长达 12 小时的研讨会来学习该工具。
- 班级 3 (2023年): 另一组意大利学生,同样使用了短视频进行学习。
2. 测试:阅读 vs. 建造
学生们接受了两类挑战:
- 阅读测试(理解力): 他们需要回答关于语法(句法)和指令含义的问题。有些问题很简单(比如“这个词是什么意思?”),有些则很难(比如“如果我想修改这条规则,我该怎么做?”)。
- 意见调查(采用度): 测试结束后,他们填写了一份问卷,内容包括:“这是否易于使用?”、“这是否有用?”以及“你会再次使用它吗?”
3. 结果:好消息、坏消息与令人惊讶的事实
好消息:他们掌握了!
学生们对阅读说明书的能力出奇地好。
- 类比: 这就像学习一个新棋类游戏。大多数学生可以快速理解规则和棋子(语法)。大约 80% 的学生通过了“阅读测试”并取得了良好的成绩。
- 转折点: 虽然他们理解了规则,但实际去“修改”游戏(通过改变规则来创造一种新的变体)却很难。这就像你完美掌握了国际象棋的玩法,但在现场发明一种新的国际象棋变体时却感到吃力。
混合的消息:他们认为它有用,但它很笨拙
当被问及对该工具的看法时:
- 有用性: 他们压倒性地同意,“是的,这个工具很有用!”(92% 的人)。他们看到了潜在的价值,就像意识到一把瑞士军刀是一个非常棒的工具。
- 易用性: 这是薄弱环节。只有大约一半的学生觉得它“易于使用”。感觉它有点像是在尝试使用一把按钮过多且没有清晰说明书的高科技瑞士军刀。它确实有用,但操作起来令人沮丧。
- 使用意向: 尽管感到挫败,大多数学生仍表示,如果有机会,他们未来仍会尝试使用它。
大惊喜:理解并不等于喜爱
通常,我们会假设如果一个人能很好地理解某样东西,他就会喜欢并想要使用它。
- 类比: 想象一名学生在一次困难的数学考试中拿到了 A。你会预期他会热爱数学。但在本研究中,那些在“阅读测试”中获得高分的学生,并不一定表示该工具对他们来说更容易使用或更有用。
- 发现: 理解程度与喜爱程度之间没有任何联系。你可能是一个精通阅读说明书的天才,但仍然觉得这个工具用起来很烦人。反之,你可能在阅读时有些吃力,但仍然认为这是一个伟大的想法。
4. 结论
研究人员得出结论,Neverlang 是一个功能强大的工具,人们可以学会阅读它,但它需要变得更加用户友好。
- 隐喻: 它就像一辆动力强劲的高性能跑车。驾驶员(学生)可以搞清楚如何驾驶它(理解力),并且知道它很快、很有用(有用性)。然而,方向盘很硬,仪表盘也很混乱(易用性)。
- 启示: 为了让更多人去驾驶这辆车,设计师不一定需要让引擎变得更强大(该工具在这一点上已经做得很好)。相反,他们需要让转向更平顺,让仪表盘更清晰。
简而言之:人们可以理解这个工具,并且认为它很有价值,但他们觉得使用起来很困难。研究表明,提高易用性是让更多人采用它的关键,无论他们的理解能力有多强。
技术摘要:理解力 vs. 采用率:通过一系列实验评估语言工作台
问题陈述
语言工作台是旨在促进编程语言及其生态系统定义、重用和组合的工具。尽管它们具有简化语言开发的潜力,但在实践中仍未得到充分利用。现有的关于评估此类工具的文献主要侧重于定量技术指标,如代码行数、依赖计数和任务完成时间。在评估用户中心方面存在显著空白,特别是元语言(用于定义其他语言的语言)的可理解性(comprehensibility)以及用户接受度(user acceptance,即感知的易用性、有用性和使用意向)。此外,虽然理解力和接受度通常被认为具有相关性,但这种关系在语言工作台中尚未得到实证验证。本文通过涉及新手用户的系列实验,对模块化语言工作台 Neverlang 进行了评估,旨在填补这些空白。
方法论
本研究采用由三个实验组成的系列研究(一个原始研究和两个重复研究)来评估 Neverlang。实验对象为对该工具没有经验的新手用户(学生和博士候选人)。
实验设计
实验遵循准实验设计,分为四个阶段:
- 培训: 参与者接受了结构化培训。在原始研究(UniMI 1, 2022)和第二次重复研究(UniMI 2, 2023)中,这包括一段 15 分钟的视频。第一次重复研究(BISS 2023)则采用了为期 12 小时的强化研讨会。
- 理解力测试: 参与者完成了评估其对 Neverlang 元语言理解程度的测试。该测试改编自方法评估模型(MEM),测量了三个认知维度:
- 可学习性(Learnability): 理解语法和符号的能力。
- 可理解性(Understandability): 理解程序含义和构造的能力。
- 演进性(Evolving): 修改程序的能力(仅在第二次重复研究中进行评估)。
- 阈值: 基于意大利学术评分标准,设定了 0.6(60% 正确率)作为“充分”理解能力的阈值。
- 接受度问卷: 参与者完成了定制的 MEM 问卷,测量:
- 感知易用性(PEOU)
- 感知有用性(PU)
- 使用意向(ITU)
- 研究后阶段: 收集人口统计学数据和自我评估的先验知识。
统计分析
由于数据呈非正态分布,研究采用了非参数统计检验:
- Wilcoxon 符号秩检验: 用于确定理解力得分和接受度变量是否显著超过各自的阈值(理解力为 0.6,接受度为 3.0)。
- Spearman 秩相关系数: 用于分析接受度变量之间的关系,以及理解力与接受度之间的关系。
- 元分析: 使用随机效应模型汇总三个实验的结果。这包括比例的元分析(针对 RQ1 和 RQ2)以及相关系数的元分析(针对 RQ3 和 RQ4)。应用了 Holm-Bonferroni 校正以控制多次比较中的 I 类错误。
核心贡献
- 实证评估框架: 本文提出了一种专门针对语言工作台定制的 MEM 应用,区分了细粒度(可学习性、可理解性、演进性)和粗粒度的可理解性。
- 系列实验: 研究提供了一个由 50 名参与者组成的稳健数据集,涵盖了三个不同的实验迭代,为结论提供了比单项研究评估更可靠的基础。
- 解耦理解力与接受度: 研究明确调查并报告了用户实际理解元语言的能力与其主观接受工具程度之间的关系(或缺乏关系)。
- 公开复现包: 所有实验材料、结果和统计代码均已公开,以支持可复现性。
结果
研究问题 1:可理解性
- 发现: 用户展示了对 Neverlang 元语言的充分理解。比例的元分析表明,总体上有 76% 的用户超过了 0.6 的理解力阈值。
- 维度分解: 可学习性(语法)是最强的维度,84% 的用户超过了阈值。可理解性紧随其后,为 82%。演进性(修改代码)仅在第二次重复研究中进行了评估,且未达到统计显著性,这表明对于新手来说,实际应用仍然具有挑战性。
- 结论: Neverlang 的语法对新手用户是易于获取的,但将该语言应用于修改程序则较为困难。
研究问题 2:用户接受度
- 发现: 接受度结果褒贬不一。
- 感知有用性 (PU): 评价很高。92% 的用户认为该工具有用,这一结果在所有实验中均具有统计显著性。
- 使用意向 (ITU): 62% 的用户表达了使用该工具的意向,但这一结果在统计上并不确定(置信区间包含了中性阈值)。
- 感知易用性 (PEOU): 这是评分最低的变量。只有 48% 的用户认为该工具易于使用,且该结果不具备统计显著性。
- 结论: 虽然用户认可该工具的价值,但易用性仍然是采用过程中的一个重要障碍。
研究问题 3:接受度变量之间的关系
- 发现: 元分析证实了感知有用性与使用意向之间,以及感知易用性与使用意向之间存在显著的正相关关系。
- 结论: 用户采用 Neverlang 的意愿受其对工具效用感和易用性的共同驱动。然而,易用性与有用性之间的相关性并不始终显著,这表明用户即使觉得工具难以使用,仍可能认为其有用。
研究问题 4:理解力与接受度之间的关系
- 发现: 未发现理解力(实际成功率)与用户接受度(感知成功率)之间存在显著相关性。
- 结论: 用户正确理解和修改 Neverlang 程序的能力,并不能预测其对工具易用性、有用性或使用意向的感知。高理解力并不一定转化为高接受度,反之亦然。
重要性与主张
本文的主张在于,其研究结果强调了语言工作台中理解力与采用率之间复杂的相互作用。其主要意义在于证明了:
- 技术因素与以人为本的因素是截然不同的: 提高元语言的技术可理解性(例如语法)并不会自动带来更好的用户接受度。
- 易用性至关重要: 尽管感知有用性很高,但缺乏感知的易用性是采用过程中的主要障碍。作者认为,Neverlang 的模块化特性虽然强大,但也引入了新手用户难以应对的复杂性。
- 教育视角: 本研究验证了将语言工作台作为教学模块化和声明式编程工具的可行性,前提是必须提供结构化的培训,以解决特定的难点(特别是“演进”代码方面的难点)。
- 需要生态系统支持: 作者认为,为了让像 Neverlang 这样的学术工具得到采用,它们需要工业标准的支撑,包括详尽的文档、可重用的库,以及潜在的更用户友好的界面(GUI),以降低准入门槛。
文章总结道,未来的工作应侧重于与其他工作台的对比研究、评估长期可重用性的纵向研究,以及通过定性调查来理解为何高理解力并不与接受度相关联。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。