Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring
本文评估了一个已部署的多智能体文档创作系统,并揭示了一个关键的不对称现象,即在将输入指令从散文式文本转换为结构化标记时,写作质量会显著下降,这表明结构化约束应保留给阅读任务,而基于散文式的提示对于生成任务则更为优越。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在自动化写作的世界里,存在着一种持久的信念,即结构是清晰度的终极关键。长期以来,计算机一直被教导,当文档以清晰的标签和标记组织起来,而非作为一堵纯文本墙时,阅读起来会更加准确。这一原则已成为人工智能领域的一项标准规则:如果你想让机器找到特定的事实或遵循特定的指令,为信息提供一个结构化的地图有助于它导航数据。因此,许多工程师假设这种结构性的优势同样适用于机器写作。其逻辑似乎是合理的:如果结构有助于计算机阅读,那么它也应该有助于计算机写作。
然而,一项新的研究通过观察一个非常具体的、高风险的任务,挑战了这一假设:撰写政府招标的正式响应文件。这些是复杂的文档,公司必须回答来自客户的数百个问题,通常需要遵循严格的格式规则并使用客户的精确措辞。研究人员构建了一个由多个人工智能智能体组成的系统来处理这项工作,将阅读需求、收集事实和起草答案的任务进行了分离。他们将该系统与同一组织提交的真实人类编写的标书进行了对比测试。他们发现,机器的学习方式呈现出一种令人惊讶的分歧。虽然结构使机器成为更好的阅读者,但它实际上使机器成为了更差的作者。研究表明,引导人工智能的最佳方式不是强迫它遵循僵化的模板,而是让它阅读结构化数据,然后用自然语言进行写作,并应用其内部检查机制以确保质量。
研究人员首先部署了他们的多智能体系统,为真实的采购请求起草响应。该系统的设计初衷是谨慎且精确。它不会尝试猜测答案;相反,它将工作分解为细小的步骤。首先,它阅读客户的文件,并将其转换为一种能够保留问题与指令之间关系的结构化格式。然后,它从过去的文档和公司记录库中收集信息。最后,它起草答案。为了观察其表现如何,团队将机器的草案与该组织为另一份标书手工编写的真实标书进行了对比。在这次对比中,机器没有任何可以模仿的范例;它必须完全依赖自身的推理能力和所提供的文档。
一位独立的评判者——另一个经过训练、旨在评估写作质量而非仅仅评估其与原文相似度的人工智能——对结果进行了评审。在 55 个章节中,机器的答案在 40 个章节中被评定为至少与人类编写的一样好。在 4 个章节中,机器的表现甚至被评定得更好。它没有完全漏掉任何章节。唯一的主要问题是一个未经证实的说法,即机器推断出了一个文本中并未明确说明的安全特性。考虑到该机器并非尖端模型,且没有任何先前的范例可供学习,这一结果令人印象深刻。
但研究人员并没有止步于表面得分。他们深入挖掘了机器表现不如人类作者的 15 个章节。他们想知道机器表现不佳是因为写作水平差,还是仅仅因为缺乏正确的信息。他们发现,在近 70% 的案例中,所谓的“失败”实际上是数据的缺失。人类作者凭借经验或私下交谈了解某些细节,而机器的系统从未被告知这些细节。当研究人员调整评分以忽略这些缺失的事实后,机器的表现跃升至近 90%。这揭示了一个关键洞察:机器与人类之间的差距主要不在于写作能力,而在于信息获取能力。机器是一个称职的作者,但由于简报不完整而经常处于劣势。
随后,研究团队进行了一项更受控的实验,以测试结构的作用。团队将机器接收到的指令以两种不同的方式呈现。在一个版本中,指令是以标准备忘录的形式以纯文本编写的。在另一个版本中,指令被转换成了一种类似于带有标签的数字文件的嵌套结构化格式。他们预期结构化版本会像帮助阅读那样帮助机器更好地理解任务。然而,事实恰恰相反。当指令是结构化的时候,回答的质量显著下降。机器产生的正确答案变少了,并且在自己的写作中更频繁地重复指令。这是一种困惑的表现。
研究人员意识到,结构改变了机器关注的对象。当指令是纯文本时,机器专注于请求的含义。当指令以标签形式结构化时,机器则专注于标签本身。它开始将客户名称或文档标题视为最重要的部分,导致它在回答时使用诸如“客户要求……”之类的尴尬措辞,而不是直接回答问题。这表明,虽然结构有助于机器定位信息,但在需要生成新内容时,它会分散机器的注意力。
团队还调查了机器如何处理关于“不要做什么”的规则。他们发现,仅仅告诉机器“不要使用这个词”往往会让问题变得更糟。机器会固执于那个禁用的词,并意外地包含它,或者以违反规则的方式使用它。然而,当他们给机器布置了一个针对自身句子的测试——要求它检查一个句子是否与原问题过于相似,并根据需要进行重写时——错误消失了。机器学会了自我监管,而无需被明确告知要避免什么。
最后,研究人员注意到在其处理自身笔记时存在一个微妙但危险的缺陷。机器有时会在文档中添加一个小标记以指示特定位置。这个标记会略微改变文本的长度。由于机器是按固定大小的块来处理文本的,这种长度上的微小变化会移动块的边界。结果,机器观察到的单词集合会发生偏移,导致提取的问题数量完全不同。仅仅两个标记的差异就导致系统减少了 17 个问题的提取。这表明,即使是机器标注工作时极其微小的随机变化,也会因为系统在切割信息时过于僵化而引发连锁反应式的巨大错误。
呈现出的整体图景是一种谨慎的平衡。这项研究并不是声称人工智能已经解决了撰写正式文档的问题,也不意味着机器已经准备好完全取代人类作者。相反,它提供了一张精确的地图,标明了这项技术在何处有效,以及在何处挣扎。机器是阅读和组织信息的强大工具,尤其是在信息是结构化的时候。但当涉及到写作时,强迫其进入僵化的结构会使其产生困惑。最有效的方法是让机器阅读结构化数据,但允许它用自然语言进行写作,并利用自我检查来确保其不偏离轨道。这种阅读与写作之间的区别不仅仅是一个技术细节,它是构建可以被信任处理重要任务的系统的基本规则。研究人员发现,最好的结果并非来自于让机器遵循完美的模板,而是来自于给予它正确的信息,并让它对最终草案应用自身的判断。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。