Understanding the Challenges and Opportunities of Generative AI Apps: An Empirical Study
这项实证研究分析了超过一百万条用户评论,提出了用于大规模生成式人工智能应用评估的 SARA 框架,在识别用户感知到的关键机遇与挑战的同时,揭示了用户关切随时间演变的规律。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,移动应用的世界就像一座巨大而繁忙的城市。多年来,人们开发工具来帮助自己计算、导航或整理事务。但在 2022 年,一种新型的“魔法商店”开张了:由生成式人工智能(Gen-AI)驱动的应用程序。这些不仅仅是工具;它们是能够写故事、绘画以及像人类一样聊天的创意伙伴。
这篇论文就像一次大规模的城市人口普查。研究人员并没有只询问少数人的看法,而是聆听了 Google Play 商店中近 200 款不同的生成式 AI 应用程序的超过一百万条用户评论。他们想知道:普通大众究竟对这些“魔法商店”说了些什么?
以下是他们研究发现的简要总结,使用了简单的类比:
1. 侦探的工具包:"SARA"
研究人员知道,人工阅读一百万条评论将耗时无穷。因此,他们构建了一个名为SARA(选择、获取、精炼、分析)的数字侦探框架。
- 问题:想象一下试图在干草堆里找一根针,但这个干草堆里塞满了空包装纸和垃圾(即那些只说“好”或“坏”却未解释原因的评论)。
- 解决方案:SARA 就像一个智能过滤器。它首先收集评论,然后丢弃“垃圾”(无信息的评论),最后利用超级智能 AI(大型语言模型)阅读剩余的评论,并将它们按主题分类。
- 结果:他们发现,如果你给 AI 提供几个它需要寻找的示例(例如展示五个“好”评论的示例),它在理解用户在谈论什么方面的准确率会变得极高(达到 91%)。
2. 好消息:用户喜爱之处(“机遇”)
当人们谈论生成式 AI 时,往往比谈论常规应用功能时更开心。研究人员发现了人们爱上这些应用程序的三种主要方式:
- 乐于助人的导师与治疗师(可及性与福祉):
- 比喻:将生成式 AI 想象成一位永不疲倦的 24/7 导师和一位从不评判的友好伙伴。
- 发现:人们使用这些应用程序学习困难学科、完成作业,或者仅仅在感到孤独时进行聊天。一些有学习障碍的用户发现,这些应用程序提供了他们在别处无法获得的个性化帮助。
- 创意搭档(协作工具):
- 比喻:生成式 AI 并没有取代艺术家;它是一支永不耗尽颜料的画笔。
- 发现:用户并非只是要求 AI 包办一切。他们将其作为伙伴来头脑风暴、撰写歌词或设计角色。这是一个“共同创作”的过程,人类与 AI 协同工作。
- 瑞士军刀(多功能性):
- 比喻:这些应用程序就像数字万能胶带。
- 发现:用户发现了开发者从未想象到的用途。人们用它们获取烹饪建议、健身计划、宗教研究帮助以及编程支持。这些应用程序足够灵活,几乎能融入日常生活的任何部分。
3. 坏消息:令用户沮丧之处(“挑战”)
尽管备受喜爱,但魔法中仍存在裂痕。研究人员确定了三个主要的头痛问题:
- “期望差距”(管理期望):
- 比喻:这就像点了一份五星级美食,却得到了一片烤焦的面包,因为厨师(AI)没有完全理解订单。
- 发现:用户通常期望 AI 完美无缺。当它犯错、遗忘细节或给出奇怪的答案时,用户会感到沮丧。挑战在于教育用户:AI 很聪明但并不完美,并帮助他们理解其局限性。
- “审查员与艺术家”的拔河(内容审核):
- 比喻:想象一个有着严格游乐场管理员的游乐场。有时,管理员为了确保安全,会阻止你玩一个实际上很安全的游戏。
- 发现:用户意见分歧。一些人因应用程序阻止了无害的创意故事(如书中的反派角色)而感到愤怒,因为安全过滤器过于严格。另一些人则因过滤器不够严格而允许不良内容通过而感到愤怒。找到正确的平衡点非常困难。
- “噱头”问题(战略整合):
- 比喻:这就像给自行车装上一个涡轮增压引擎。它看起来很酷,但如果它让自行车摇晃甚至导致 crashes,那就毫无帮助。
- 发现:有时开发者添加 AI 仅仅是因为它很流行,而不是因为它真的有帮助。如果 AI 功能缓慢、充满漏洞,或者实际上并没有让应用程序变得更好,用户就会感到恼火。他们想知道 AI 存在的原因。
4. 情绪随时间的变化
研究人员观察了这些情绪随年份的变化,就像快进观看一部电影:
- 从“哇!”到“哇,等等……":起初,人们只是对 AI 能够对话感到惊叹。现在,由于使用如此频繁,有些人开始上瘾,或者过度依赖它寻求情感支持,这成为了一个新的担忧。
- 从“我的数据安全吗?”到“为什么我不能说这个?”:早期,人们担心隐私。现在,主要的争论点在于审查。人们更多地争论他们被允许创造什么,而不是他们的数据是否安全。
5. “双商店”差异
研究人员还比较了来自 Google Play 商店(主要是 Android)和 Apple App Store(主要是 iPhone)的评论。
- Android 用户往往更像机械师:他们谈论引擎如何运行、速度是否快以及代码是否良好。
- Apple 用户往往更像艺术家和哲学家:他们更多地谈论如何在日常生活中使用该工具,并更担心伦理和隐私问题。
核心结论
这项研究表明,生成式 AI 应用程序是一种强大的新工具,人们真心喜爱其在创造力和帮助方面的表现。然而,为了保持用户的满意度,开发者需要诚实地说明 AI 能做什么和不能做什么,找到一种公平的方式来过滤内容而不过于严格,并确保他们添加 AI 不仅仅是为了跟风。
研究人员还指出,开发者通常很少回复这些评论。当他们回复时,通常会发送通用的“谢谢”,或要求用户通过电子邮件提供更多细节,因为修复 AI 问题往往过于复杂,无法在简短的文本消息中解决。
简而言之:魔法是真实的,但它需要更好的规则和更清晰的沟通,才能为每个人完美运作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。