Tendem: A Hybrid AI+Human Platform
Tendem 是一个人工智能与人类结合的混合平台,它利用自动化智能体处理结构化任务,并利用专家人工进行验证,从而在保持相当运营成本的同时,实现了比纯人工智能或纯人工工作流更卓越的质量与速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你需要完成一个复杂的项目,比如整理海量数据、撰写一份详细报告或研究某个特定主题。你有三个主要选择:雇佣一名人类自由职业者、使用全自动 AI 机器人,或者使用 Tendem。
根据论文,Tendem 是一个“混合型”团队。你可以把它想象成由人类专家驾驶的高速赛车。AI 是引擎,负责繁重的体力活、高速行驶和重复性工作。人类专家则是驾驶员,负责盯着路面,在情况变得复杂时转向,并在 AI 开始产生幻觉或迷失方向时踩下刹车。
以下是该论文用简单术语对该系统的拆解:
1. 工作原理:“副驾驶”系统
论文将 Tendem 描述为一种 AI 与人类协作的工作流,但它们各司其职:
- AI(引擎): 它处理那些枯燥、快速且重复的任务。它浏览网页、阅读文件并起草内容。它就像一个永不疲倦的超级速记实习生。
- 人类专家(副驾驶): 他们并不参与每一个步骤。相反,他们充当安全网。他们在特定的“关卡”(就像比赛中的检查点)检查 AI 的工作。如果 AI 感到不确定,或者任务具有风险性,人类就会介入进行修正、验证事实,并确保最终产品达到完美。
- 质量检查: 在结果发送给客户之前,它会经过双重检查系统。首先,自动化工具会扫描错误;然后,人类专家会对结果进行最终审视,以确保其确实符合逻辑并满足客户需求。
2. 大赛:Tendem 对阵竞争对手
研究人员使用 94 项现实世界的任务(如收集商业联系人、构建自动化工作流或编写市场研究报告)测试了 Tendem 与另外两组的对比。
- 对手 A(人类自由职业者): 这些是在 Upwork 等平台上雇佣的人才。他们聪明且可靠,但速度较慢且成本较高。
- 对手 B(纯 AI): 这是一个试图独立完成整个工作的全自动 AI(例如标准的 ChatGPT 智能体)。它速度快且便宜,但经常出错、遗漏细节或捏造事实。
测试结果:
- 质量: Tendem 摘得了金牌。74.5% 的 Tendem 结果被评为“优秀”(可立即使用)。
- 人类自由职业者的“优秀”率为 53.2%。
- 纯 AI 机器人仅获得 40.4% 的“优秀”率。
- 类比:如果你订购了 100 个披萨,Tendem 会做对 75 个;人类团队会做对 53 个;而纯 AI 团队则会烤焦或烤糊 60 个。
- 速度: Tendem 比人类快得多。它将总时间缩短了一半(快了 53%)。
- 人类平均耗时约 35 小时。
- Tendem 耗时约 16.5 小时。
- 类比:Tendem 就像是一个利用无人机瞬间投递包裹的快递员,而人类自由职业者则必须开着卡车在交通拥堵中穿行。
- 成本: Tendem 的平均成本比人类低(降低了 36% 的中位数成本),尽管纯 AI 版本是最便宜的(但质量很差)。
3. 为什么 Tendem 能胜出?
论文指出,Tendem 之所以获胜,是因为它弥补了双方的弱点:
- AI 虽快但脆弱: 当 AI 感到困惑或面临复杂的、多步骤的问题时,它往往会编造事实或忽略指令。Tendem 的人类专家会在这些错误到达客户手中之前将其拦截。
- 人类虽谨慎但缓慢: 人类擅长判断,但容易疲劳且处理重复性数据录入时耗时较长。Tendem 的 AI 处理了枯燥的工作,让专家能专注于重要的决策。
4. 系统背后的“大脑”
论文还单独测试了 Tendem 中的 AI 部分(不带人类)。他们发现 AI 在以下方面表现非常强劲:
- 网页浏览: 在网上寻找信息。
- 工具使用: 使用软件来完成任务。
- 推理: 解决困难的逻辑谜题。
它的表现几乎与当今最顶尖的 AI 模型不相上下。这证明了其“引擎”功能足够强大,足以承担大部分工作,因此人类只需要偶尔介入来掌舵。
总结
Tendem 是一种“两全其美”的解决方案。 它结合了 AI 的速度与低成本,以及人类专家的可靠性与判断力。在测试中,它比单纯雇佣人类更高效、成本更低、质量更高,同时也避免了 AI 独立工作时容易出现的错误。
注:论文特别说明,该系统适用于通用专业任务(如研究、数据和内容),不涵盖高风险领域(如医疗建议、法律咨询或高级编程)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。