← 最新论文
🤖 AI

Five Fatal Assumptions: Why T-Shirt Sizing Systematically Fails for AI Projects

本文指出传统的 T 恤尺码估算法因依赖线性扩展、可重复性等五项在 AI 项目中失效的假设而系统性失灵,并针对大语言模型与多智能体系统的非线性特性,提出了一种基于明确决策门控的“检查点估算”新范式,以帮助团队更有效地规划 AI 项目。

原作者: Raja Soundaramourty, Ozkan Kilic, Ramu Chenchaiah

发布于 2026-02-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Raja Soundaramourty, Ozkan Kilic, Ramu Chenchaiah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文其实是在讲一个很扎心的道理:我们用来估算传统软件项目的那套老办法(比如给任务贴"T 恤尺码”标签:S、M、L、XL),在搞人工智能(AI)项目时,完全行不通,甚至会误导大家。

想象一下,你以前是盖房子的包工头,现在突然被叫去指挥一群“会思考的机器人”写小说。如果你还拿着盖房子的老规矩去估算,肯定会翻车。

作者把导致翻车的五个致命假设,用大白话和生动的比喻解释如下:

1. 线性思维陷阱:以为“加一倍功能,就加一倍工作量”

  • 传统软件(盖房子): 就像砌墙。砌 100 块砖要 1 小时,砌 200 块砖大概就要 2 小时。工作量是直线增长的,很 predictable(可预测)。
  • AI 项目(训练怪兽): 就像驯服一只野兽
    • 让 AI 从 85% 的准确率提升到 90%,可能只需要多喂点数据;
    • 但要从 90% 提升到 95%,你可能需要10 倍的数据、10 倍的算力,甚至发现现在的技术根本做不到。
    • 比喻: 传统软件是爬楼梯,一步一个台阶;AI 是爬悬崖,前面很平缓,最后那几米垂直高度,可能需要你造一架直升机才能上去。

2. 经验主义陷阱:以为“以前做过,这次也能照搬”

  • 传统软件(做菜单): 你以前做过“川菜馆”的菜单,这次做“粤菜馆”的菜单,虽然口味不同,但切菜、炒菜、上菜的流程差不多,经验很有用。
  • AI 项目(开盲盒): 每个 AI 项目面对的数据都是全新的“未知大陆”。
    • 你做过“客服聊天机器人”,不代表你能搞定“医疗诊断机器人”。因为医疗数据的坑(比如生僻词、隐私、歧义)是以前没见过的。
    • 比喻: 以前你熟悉在平地上开车,现在让你去开潜水艇。虽然都是“交通工具”,但海底的压力、暗流和导航方式完全不同。以前的经验不仅没用,还可能让你以为“这很简单”,结果一头扎进海底。

3. 时间换人陷阱:以为“人多力量大,时间就能缩短”

  • 传统软件(搬砖): 如果搬砖需要 8 小时,你派 8 个人,理论上 1 小时就能搬完(虽然人多嘴杂会慢点,但大体可行)。
  • AI 项目(等面发酵): 有些步骤是必须排队的,谁也帮不了。
    • 数据没洗干净,模型没法训练;模型没训练好,没法调参。就像等面团发酵,你派 100 个厨师在旁边盯着,面团也不会因为人多而发酵得更快。
    • 比喻: AI 项目里有很多“硬性等待时间”。就像煮一锅汤,你加再多勺子去搅,汤也不会因为人多而瞬间熟透。

4. 拆解陷阱:以为“把大任务拆成小块,大家分头干就行”

  • 传统软件(拼乐高): 你可以让 A 组拼轮子,B 组拼车身,C 组拼窗户,最后组装起来就行。大家互不干扰。
  • AI 项目(牵一发而动全身): AI 系统里的数据、模型、提示词(Prompt)是紧紧缠绕在一起的。
    • 你改了一下数据格式,整个模型的逻辑就崩了;你改了一个提示词,所有代理(Agent)的对话都乱了。
    • 比喻: 传统软件像乐高积木,拆开了能独立拼;AI 像一团乱麻的耳机线,你动其中一根线,整团线都会跟着乱,根本没法分头处理。

5. 完工陷阱:以为“测试通过了,就算做完了”

  • 传统软件(修车): 车修好了,引擎能转,刹车灵了,这就叫“完工”。标准很明确。
  • AI 项目(走钢丝): AI 的“完工”标准是飘忽不定的。
    • 今天模型准确率达标了,明天法务部说“它偶尔会胡说八道(幻觉)”,不行,重做!
    • 后天安全部门说“它有点偏见”,不行,再调!
    • 比喻: 传统软件是射箭,射中靶心就算赢;AI 是在移动的靶子上射箭,靶子(安全标准、法律要求、用户体验)一直在动,你刚射中,靶子就跑了。

那该怎么办?作者提出了“检查点估算法” (Checkpoint Sizing)

既然不能一开始就定死时间(因为全是未知数),那就边走边看,分阶段决策

想象成“探险队”模式:
不要一开始就承诺“我们要花 3 个月穿越这片森林”。
而是设定几个检查点

  1. 第一站(数据检查): 先去看看路(数据)好不好走?如果路断了(数据质量差),那就别硬冲,要么修路,要么换路线。
  2. 第二站(测试检查): 试着走一段,看看机器人会不会迷路?如果迷路率太高,就停下来调整装备。
  3. 第三站(安全检查): 看看有没有遇到野兽(安全隐患)?如果有,得先解决安全问题。

核心思想:

  • 不要在出发前就发誓“我们 3 个月一定到”。
  • 每到一个检查点,根据实际看到的情况,重新评估:“嘿,前面路不好走,我们可能得花 6 个月,或者干脆换个方向。”

总结

这篇论文就是给项目经理和老板们的一剂清醒剂:
别再用盖房子的老黄历来管 AI 项目了。 AI 充满了不确定性,就像在迷雾中开车。传统的"T 恤尺码”估算法只会让你误判路况,导致项目延期或失败。
正确的做法是: 承认未知,设立检查点,根据实际反馈不断调整计划,把“承诺”变成“假设”,用证据来指导决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →