← 最新论文
💻 computer science

User Reviews as a Source for Usability Requirements: A Precursor Study on Using Large Language Models

本文探讨了利用大语言模型分析用户评论以提取可用性需求的潜力,并通过编码数据集和提示工程证明,只要精心设计提示,大语言模型在识别可用性问题上即可达到与人类相当的性能。

原作者: Cedric Wellhausen, Laura Reinhardt, Kurt Schneider

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Cedric Wellhausen, Laura Reinhardt, Kurt Schneider

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家繁忙餐厅的厨师。你想知道顾客对食物的确切看法,以便改进菜单。你可以雇佣一支专业美食评论家团队来品尝每一道菜并撰写详细报告,但这既昂贵又缓慢。或者,你也可以直接阅读人们在网站上留下的成千上万条杂乱、情绪化且有时令人困惑的评论。

本文旨在探讨如何训练一台超级智能的计算机(称为大型语言模型,或 LLM)来阅读这些杂乱的评论,并找出那些真正关于可用性的评论——即应用程序使用起来的难易程度。

以下是他们实验的简化故事:

问题:噪音太多,时间太少

软件公司正淹没在用户评论中。人们会写道:“这个应用简直是噩梦!”或者“我点了三次,它还是没反应!”或者“我喜欢新功能,但按钮太小了。”

  • 旧方法:为了找到有用的投诉,研究人员过去使用机器学习来训练计算机。但这就像试图通过向狗扔成千上万根棍子并指望它学会捡拾来训练狗一样。这需要大量的人力先对数据进行标注。
  • 新想法:如果我们直接让一台超级智能的计算机(LLM)阅读评论并告诉我们哪些是关于“可用性”的,会怎样?这些计算机已经在整个互联网上接受过训练,因此它们可能无需我们从头教导就能理解上下文。

实验:“品尝测试”

来自德国的研究人员设立了一项受控测试,以查看计算机能否像人类专家一样胜任这项工作。

  1. 食材:他们从三种截然不同的应用程序中收集了 300 条真实用户评论:

    • 交通/雷达应用(供驾驶员使用)。
    • 杂货店应用(供购物者使用)。
    • 音乐制作应用(供音乐家使用)。
    • 为什么选这三种? 为了确保计算机不仅仅擅长处理某一特定类型的语言。
  2. 人类评委:两位人类专家阅读了所有 300 条评论。他们使用一份著名的清单(尼尔森十大可用性启发式原则)来判断一条评论是否关于“可用性”(真)或否(假)。他们就那些棘手的问题进行争论,直到达成一致。这创造了“黄金标准”答案键。

  3. 计算机学生:他们给 LLM 提供了一套指令(称为提示)。可以将此提示想象成食谱。

    • 第一次尝试:食谱很模糊。计算机感到困惑。
    • 第二和第三次尝试:研究人员完善了食谱,添加了更具体的步骤和示例(例如告诉计算机:“如果有人说应用‘笨拙’,这就算作可用性问题”)。
    • 最终测试:他们给计算机提供了最终完善的食谱,并要求它对全部 300 条评论进行评分。

结果:有希望但不完美的学生

研究人员将计算机的评分与人类专家的答案键进行了比较。

  • 好消息:计算机在找出“真”评论方面出奇地好。它没有漏掉多少可用性问题投诉。如果人类说“这是一个可用性问题”,计算机通常会同意。
  • 坏消息:计算机有点过于急切。有时,当人类认为只是一般性投诉或错误时,它却将某些评论标记为“可用性问题”。
  • 可靠性检查:当他们测量计算机和人类在完全相同的答案上达成一致的概率时,结果喜忧参半。
    • 对于音乐应用,他们相当一致。
    • 对于交通和杂货应用,他们分歧更多。
    • 至关重要的是,计算机的错误并没有发生在人类也不确定的地方。计算机正在犯自己独特的错误,这意味着它尚未完全像人类专家那样“思考”。

结论:得力的助手,而非替代品

该论文得出结论,虽然计算机尚未准备好完全取代人类专家,但它是一个非常有用的工具

将 LLM 想象成一名超级快速的实习生

  • 如果你让实习生阅读 1,000 条评论,他们会找出几乎每一条关于可用性的投诉。
  • 他们也可能标记出一些实际上并非可用性问题的内容(误报),但研究人员认为,拥有一些额外的评论供检查总比错过真正的问题要好。
  • 让实习生高效工作的关键在于提示(指令)。模糊的指令导致糟糕的结果;而详细、精心设计的指令则带来良好的结果。

简而言之:你不再需要花费数月时间训练计算机来阅读评论。你只需要给一台智能计算机一套非常清晰的指令,它就能出色地帮助你发现用户真正的需求。不过,你仍然需要人类进行复查,特别是针对棘手的情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →