← 最新论文
💬 NLP

Tendem: A Hybrid AI+Human Platform

Tendem 是一个人工智能与人类结合的混合平台,它利用自动化智能体处理结构化任务,并利用专家人工进行验证,从而在保持相当运营成本的同时,实现了比纯人工智能或纯人工工作流更卓越的质量与速度。

原作者: Konstantin Chernyshev, Ekaterina Artemova, Viacheslav Zhukov, Maksim Nerush, Mariia Fedorova, Iryna Repik, Olga Shapovalova, Aleksey Sukhorosov, Vladimir Dobrovolskii, Natalia Mikhailova, Sergei Tilga

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Konstantin Chernyshev, Ekaterina Artemova, Viacheslav Zhukov, Maksim Nerush, Mariia Fedorova, Iryna Repik, Olga Shapovalova, Aleksey Sukhorosov, Vladimir Dobrovolskii, Natalia Mikhailova, Sergei Tilga

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你需要完成一个复杂的项目,比如整理海量数据、撰写一份详细报告或研究某个特定主题。你有三个主要选择:雇佣一名人类自由职业者、使用全自动 AI 机器人,或者使用 Tendem

根据论文,Tendem 是一个“混合型”团队。你可以把它想象成由人类专家驾驶的高速赛车。AI 是引擎,负责繁重的体力活、高速行驶和重复性工作。人类专家则是驾驶员,负责盯着路面,在情况变得复杂时转向,并在 AI 开始产生幻觉或迷失方向时踩下刹车。

以下是该论文用简单术语对该系统的拆解:

1. 工作原理:“副驾驶”系统

论文将 Tendem 描述为一种 AI 与人类协作的工作流,但它们各司其职:

  • AI(引擎): 它处理那些枯燥、快速且重复的任务。它浏览网页、阅读文件并起草内容。它就像一个永不疲倦的超级速记实习生。
  • 人类专家(副驾驶): 他们并不参与每一个步骤。相反,他们充当安全网。他们在特定的“关卡”(就像比赛中的检查点)检查 AI 的工作。如果 AI 感到不确定,或者任务具有风险性,人类就会介入进行修正、验证事实,并确保最终产品达到完美。
  • 质量检查: 在结果发送给客户之前,它会经过双重检查系统。首先,自动化工具会扫描错误;然后,人类专家会对结果进行最终审视,以确保其确实符合逻辑并满足客户需求。

2. 大赛:Tendem 对阵竞争对手

研究人员使用 94 项现实世界的任务(如收集商业联系人、构建自动化工作流或编写市场研究报告)测试了 Tendem 与另外两组的对比。

  • 对手 A(人类自由职业者): 这些是在 Upwork 等平台上雇佣的人才。他们聪明且可靠,但速度较慢且成本较高。
  • 对手 B(纯 AI): 这是一个试图独立完成整个工作的全自动 AI(例如标准的 ChatGPT 智能体)。它速度快且便宜,但经常出错、遗漏细节或捏造事实。

测试结果:

  • 质量: Tendem 摘得了金牌。74.5% 的 Tendem 结果被评为“优秀”(可立即使用)。
    • 人类自由职业者的“优秀”率为 53.2%
    • 纯 AI 机器人仅获得 40.4% 的“优秀”率。
    • 类比:如果你订购了 100 个披萨,Tendem 会做对 75 个;人类团队会做对 53 个;而纯 AI 团队则会烤焦或烤糊 60 个。
  • 速度: Tendem 比人类快得多。它将总时间缩短了一半(快了 53%)。
    • 人类平均耗时约 35 小时。
    • Tendem 耗时约 16.5 小时。
    • 类比:Tendem 就像是一个利用无人机瞬间投递包裹的快递员,而人类自由职业者则必须开着卡车在交通拥堵中穿行。
  • 成本: Tendem 的平均成本比人类低(降低了 36% 的中位数成本),尽管纯 AI 版本是最便宜的(但质量很差)。

3. 为什么 Tendem 能胜出?

论文指出,Tendem 之所以获胜,是因为它弥补了双方的弱点:

  • AI 虽快但脆弱: 当 AI 感到困惑或面临复杂的、多步骤的问题时,它往往会编造事实或忽略指令。Tendem 的人类专家会在这些错误到达客户手中之前将其拦截。
  • 人类虽谨慎但缓慢: 人类擅长判断,但容易疲劳且处理重复性数据录入时耗时较长。Tendem 的 AI 处理了枯燥的工作,让专家能专注于重要的决策。

4. 系统背后的“大脑”

论文还单独测试了 Tendem 中的 AI 部分(不带人类)。他们发现 AI 在以下方面表现非常强劲:

  • 网页浏览: 在网上寻找信息。
  • 工具使用: 使用软件来完成任务。
  • 推理: 解决困难的逻辑谜题。

它的表现几乎与当今最顶尖的 AI 模型不相上下。这证明了其“引擎”功能足够强大,足以承担大部分工作,因此人类只需要偶尔介入来掌舵。

总结

Tendem 是一种“两全其美”的解决方案。 它结合了 AI 的速度与低成本,以及人类专家的可靠性与判断力。在测试中,它比单纯雇佣人类更高效、成本更低、质量更高,同时也避免了 AI 独立工作时容易出现的错误。

注:论文特别说明,该系统适用于通用专业任务(如研究、数据和内容),不涵盖高风险领域(如医疗建议、法律咨询或高级编程)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →