这就是一个名为 CRAFT 的新工具发挥作用的地方。把 CRAFT 想象成一个在案件中工作的超级聪明的侦探团队。CRAFT 不是让单个侦探去猜测时间线,而是使用两个协同工作的 AI “智能体”(agents)进行循环。第一个智能体——生成器(Generator),就像一位富有创造力的作家,阅读患者的故事并尝试起草一份症状时间表。第二个智能体——验证器(Verifier),则像一位严厉的编辑,负责检查这份草案。编辑不仅仅是说“做得好”或“做得不好”,他们会给出具体且有针对性的反馈,例如:“你把头痛和呕吐放在了同一个时间段内,但故事里说它们发生在不同的日子。”随后,作家根据这些反馈重写时间表,而编辑再次进行检查。他们不断重复这个过程——起草、批评、重写——直到时间表完美无缺或者尝试次数用尽。
研究人员在名为 MedTempo 的大规模新数据集上测试了这个系统,该数据集包含了 5,347 份关于人们对 COVID-19 疫苗产生反应的真实报告。这些报告非常棘手,因为它们都是没有明确日期的单一故事,就像我们类比中的那本凌乱的日记。研究小组发现,这种“起草与编辑”的循环比让 AI 只尝试猜一次时间线的效果要好得多。事实上,随着反馈轮数的增加,系统的准确性显著提高。他们在四种不同的 AI “大脑”(从非常强大的模型到稍小一点的模型)上进行了测试,在每种情况下,CRAFT 方法都帮助 AI 更频繁地答对了时间线。
然而,论文也指出,并非所有的 AI 大脑学习反馈的方式都相同。最强大的 AI 模型(如来自 Claude 和 GPT 的模型)能够利用编辑的笔记做出重大改进,在多轮迭代中修正错误。但一些较小或能力较低的模型则遇到了瓶颈:它们要么在第一次尝试时就答对了,不需要更多帮助;要么会被反馈搞糊涂,导致答案变得更糟。研究人员还发现,故事的难度因患者接种的疫苗不同而异;关于某种特定疫苗的故事在让 AI 解开逻辑方面始终比其他疫苗更难,这表明人们描述不同疫苗的方式可能存在细微差别。
最终,这篇论文表明,给 AI 一个机会通过一个有用的批评者来“再思考一下”是一种获胜策略,用于理清复杂的医学故事。这不仅仅是关于拥有一个聪明的 AI,更是关于给这个 AI 一个检查自己工作的结构化方式。作者建议,虽然这种方法是一个巨大的进步,但仍需开展工作,以确保 AI 知道何时应该停止编辑,以及何时应该信任自己的第一直觉,特别是针对不同类型的医疗报告。这种方法最终可以帮助医生和安全监测人员比以前更快、更准确地从患者的故事中发现危险模式。