← 最新论文
🤖 AI

From Prompt to Product: A Human-Centered Benchmark of Agentic App Generation Systems

本文提出了一个以人为核心的基准测试框架,通过大规模人工评估对比了 Replit、Bolt 和 Firebase Studio 三个提示生成应用平台,发现 Firebase Studio 在易用性、信任度及视觉吸引力等维度上全面领先,揭示了现有系统在视觉表现与功能可靠性之间的差距。

原作者: Marcos Ortiz, Justin Hill, Collin Overbay, Ingrida Semenec, Frederic Sauve-Hoover, Jim Schwoebel, Joel Shor

发布于 2026-02-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Marcos Ortiz, Justin Hill, Collin Overbay, Ingrida Semenec, Frederic Sauve-Hoover, Jim Schwoebel, Joel Shor

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一场**“智能装修大师”的终极大比拼**。

想象一下,你手里有一张简单的装修草图(也就是自然语言提示词,比如“帮我做一个能记录吃药时间的手机网页”),你不需要懂任何建筑知识(编程),只要把这张草图交给三位不同的“智能装修大师”(AI 系统),它们就能在几分钟内为你盖好一栋房子(生成一个完整的网页应用)。

这篇论文的作者们就是想知道:这三位大师,谁盖的房子最好住?谁最靠谱?

1. 比赛背景:为什么我们要比一比?

以前,我们评价 AI 写代码,就像看它能不能解出一道数学题(比如算出 1+1 等于几)。但现在,这些 AI 不仅能解题,还能直接盖房子。

  • 问题在于:有些 AI 盖的房子,外表看着像皇宫(界面漂亮),但进去发现门是锁死的(功能不行);有些房子虽然简陋,但能住人。
  • 过去的盲点:以前的测试只看代码对不对,没人去真正“住”一下。
  • 这次的任务:作者们组织了一场大规模的“试住体验”,找来了 200 多位普通人和专业人士,让他们亲自去体验这三家 AI 盖出来的房子。

2. 参赛选手:三位“装修大师”

比赛邀请了三位目前最火的 AI 工具:

  1. Firebase Studio(谷歌旗下的新工具)
  2. Bolt(一款流行的 AI 编程助手)
  3. Replit(老牌在线编程平台)

3. 比赛规则:怎么比?

作者们准备了96 个不同的装修需求(提示词),涵盖了从简单的“记事本”到复杂的“医院管理系统”等各种场景。

  • 第一步:各自盖房。让三位大师分别根据这 96 个需求,盖出 288 栋房子(应用)。
  • 第二步:独立试住。让测试者先不看别人,单独进一栋房子,问:“这房子亮堂吗?”(清晰度)“好走吗?”(易用性)。
  • 第三步:左右互搏(关键)。这是最精彩的部分。让测试者同时看两栋房子(比如 Firebase 盖的和 Bolt 盖的),然后问:“你更喜欢住哪一栋?”“你觉得哪栋更让人放心?”

4. 比赛结果:谁赢了?

结果非常有趣,就像是一场“反转剧”:

  • 如果只单独看(独立评分)
    大家觉得这三家盖的房子都差不多,都能住,分数都很高(都在 3.8 分左右,满分 5 分)。这时候很难分出高下,就像你闭着眼睛摸三张不同的椅子,觉得都挺舒服。

  • 如果放在一起比(左右互搏)
    一旦让测试者同时面对两栋房子,差距就出来了!

    • 🏆 冠军:Firebase Studio
      它就像一位全能管家。不仅房子盖得漂亮(视觉吸引力强),而且让人住得安心(信任度高),用起来也顺手。在所有的“二选一”比赛中,它几乎都赢了。
    • 🥈 亚军:Bolt
      它像一位注重颜值的艺术家。房子盖得挺好看,大家也喜欢,但在“好不好用”和“让人放心”这两个方面,稍微输给 Firebase 一点。
    • 🥉 季军:Replit
      它像一位老派的工匠。虽然也能盖房子,但在美观度、易用性和让人信任的感觉上,普遍不如前两位。

5. 核心发现:为什么“单独看”和“一起看”不一样?

论文发现了一个很重要的现象:“当局者迷,旁观者清”

  • 当你单独看一个 AI 生成的应用时,你可能觉得“嗯,挺不错的”。
  • 但当你把两个放在一起对比时,你立刻就能发现:“哎呀,这个按钮太隐蔽了”或者“那个颜色看着真舒服”。
  • 结论:想要真正评价这些 AI 工具,不能只让它们“单打独斗”,必须让它们“同台竞技”。只有对比,才能看出谁才是真正的高手。

6. 这对我们意味着什么?

  • 对于普通人:如果你想用 AI 快速做一个小工具,选对工具很重要。目前来看,Firebase Studio 可能是最省心、最靠谱的选择。
  • 对于开发者:现在的 AI 已经能生成很完整的软件了,但“长得好看”和“真的好用”之间还有差距。未来的 AI 不仅要能写代码,还要懂“用户体验”。
  • 对于未来:作者们把这次比赛的所有数据、代码和测试方法都公开了。这就像把“装修图纸”和“评分表”都贴在了网上,让全世界的科学家和开发者都能接着比,看看谁能盖出更完美的“未来之家”。

一句话总结
这篇论文告诉我们,现在的 AI 装修大师们已经能盖出像模像样的房子了,但如果你把它们放在一起比,Firebase Studio 目前是最懂用户、最让人放心的那位“金牌管家”。而想要真正看清谁强谁弱,必须让它们“同台 PK",而不是各自为战

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →