← 最新论文
💬 NLP

From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b

本文介绍了一种针对 BioASQ 14b Task B 的问题类型感知大语言模型框架,该框架采用了定制的推理策略——例如针对“是/否”问题的片段重排、针对事实型问题的思维链以及针对列表型问题的多智能体协作——以实现具有竞争力的性能,并在第 4 批次的事实型子任务中获得第一名。

原作者: Taeyun Roh, Eunha Lee, Wonjune Jang, Sohyun Chung, Junha Jung, Jaewoo Kang

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Taeyun Roh, Eunha Lee, Wonjune Jang, Sohyun Chung, Junha Jung, Jaewoo Kang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一个由专家组成的侦探团队,正试图解决一个巨大的医学谜团。线索(科学文章)散落在数千页的篇幅中,有时彼此矛盾,而且是用非常特定、晦涩的语言编写的。你的目标是回答三类特定类型的问题:“这是真的吗?”(是/否)、“具体的名称是什么?”(事实型)以及“列出所有涉及的名称”(列表型)。

这篇论文描述了一个名为 ku_dmis 的新侦探团队,他们参加了一场比赛(BioASQ 14b),以测试他们利用人工智能(AI)解决这些谜题的能力如何。他们并没有为每个案例使用“一刀切”的单一侦探,而是构建了一个专门的团队,让不同的 AI 模型根据问题的类型扮演不同的专家角色。

以下是他们的系统运作方式,通过简单的类比进行了分解:

1. “是/否”侦探:洗牌与投票

问题: 有时,如果侦探以不同的顺序阅读线索,他们可能会感到困惑并改变主意。如果线索杂乱无章或相互矛盾,单个 AI 可能会仅仅因为证据呈现的顺序很奇怪而做出错误的判断。
解决方案: 团队使用了一种“洗牌与投票”策略。

  • 洗牌: 他们获取同一组线索,并像洗扑克牌一样随机重新排列它们。
  • 投票: 他们要求四名不同的 AI 侦探阅读这些洗牌后的“牌组”,并给出“是”或“否”的答案。
  • 决胜局: 如果四个人意见一致,那就太棒了!如果他们产生分歧,一位特别的“监督员”侦探就会介入。这位监督员会将线索整理成“支持‘是’”、“支持‘否’”和“可能”三个堆栈,从而做出最终且冷静的决定。
  • 结果: 这使得他们的“是/否”回答非常稳定且准确,即使在面对杂乱的线索时也极少改变主意。

2. “事实型”侦探:示例图书馆

问题: 这些问题要求提供一个特定的名称,例如“最常见的基因是什么?”AI 需要找到那个精确的名称。如果它说“基因 X”,而官方答案是“基因 X-Alpha”,它可能会被判定为错误。
解决方案: 他们采用了“展示,而不只是讲述”的方法。

  • 图书馆: 在回答之前,系统会查阅一个已解决案例的图书馆,寻找与当前问题非常相似的例子。
  • 向导: 它向 AI 展示这些例子,并说:“看,当我们以前遇到类似这样的问题时,我们是如何找到答案以及如何书写它的。”
  • 共识: 就像处理“是/否”问题一样,他们使用多个 AI 模型。如果四分之三的模型对特定的名称达成一致,他们就会保留该名称。
  • 结果: 这帮助他们更频繁地找到正确的名称,尤其是在比赛的最后一轮中,他们在这一特定问题类型上取得了第一名

3. “列表型”侦探:流水线

问题: 这些问题要求列出一整组项目(例如,“列出所有与该蛋白质相互作用的药物”)。AI 会遇到困难:它可能会遗漏某些项目(召回率低),或者编造一些听起来很真实但实际并不存在的虚假项目(幻觉)。
解决方案: 他们建立了一个由四个人组成的流水线,每个人都有特定的职责:

  • 代理人 1(搜寻者): 阅读所有线索,并提取出一大堆潜在的名称,此时还不必担心它们是否完美。
  • 代理人 2(推理者): 查看这堆名称和原始线索,以构建一份草案列表。
  • 代理人 3(审计员): 检查草案列表。“这个名称真的在原文线索中吗?它是重复的吗?它是虚假的吗?”他们负责剔除不合格的内容。
  • 代理人 4(监督员): 负责审查工作的负责人。如果审计员发现了问题,监督员会回到线索中进行修正。
  • 结果: 这种团队协作帮助他们找到了更多正确的项目,同时避免了虚假项目的出现,随着比赛的进行,他们的得分显著提高。

大局观

这篇论文的核心思想是:不同的问题需要不同的思考方式。

  • 对于简单的“是/否”问题,他们使用投票来避免混乱。
  • 对于特定的“名称”问题,他们使用示例来学习正确的格式。
  • 对于复杂的“列表”问题,他们使用专家团队来进行检查和复核。

通过将 AI 视为一个灵活的专家团队而非单个机器人,他们能够比以往更好地处理医疗研究中杂乱且矛盾的特性。在正式比赛中,他们的系统表现非常出色,特别是在寻找正确的特定名称(事实型问题)方面表现优异。

重要提示: 本论文完全侧重于如何从提供的文本中获得正确答案。它并不声称该系统可以诊断患者、开具处方或取代医院中的医生;它严格来说是一个基于书面科学证据回答问题的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →