Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions
本综述系统地回顾了74项研究,旨在为开源情报(OSINT)领域的智能体化与生成式人工智能建立一个包含11个类别的分类法,识别了幻觉的已知风险与其经验测量之间的关键差距,绘制了当前研究在情报生命周期各阶段的优势与不足图谱,并提出了一个十点议程,倡导将“人机协同副驾驶”模型作为最可行的近期部署策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解重大谜团的侦探。线索散落在各处:数以百万计的社交媒体帖子、新闻文章、隐藏论坛和加密信息。在过去,你必须亲手阅读每一条线索。这既缓慢又令人精疲力竭,而且你经常会遗漏关键信息。
现在,想象你有一个超级聪明的机器人助手(人工智能),它可以在几秒钟内读完所有这些线索,把点点连成线,并为你写一份报告。这篇论文是对 74 项不同研究的深度综述,旨在探究这个机器人助手是否已经准备好胜任这份工作。
以下是研究人员发现的简单解读,使用了日常生活中常见的类比:
1. 机器人很快,但我们不知道它是否诚实
论文指出,这个机器人(被称为“代理型 AI”或“生成式 AI”)在收集信息和组织信息方面表现得极其出色。它就像一个超级快速的图书管理员,能找到你甚至都不知道存在的书籍。
然而,存在一个巨大的问题: 我们并不真正清楚这个机器人编造内容的频率有多高。
- “幻觉”问题: 在 AI 世界中,“幻觉”意味着机器人自信地告诉你一个听起来是真的谎言。
- 研究结果: 研究人员查看了 74 项研究。其中 20 多项研究承认:“嘿,这个机器人可能会撒谎。”但只有一项研究真正尝试衡量它在真实的 OSINT(开源情报)情境下撒谎的频率。那项研究发现其谎言率为 4%,但那是由于在完美、简单的条件下进行的。
- 类比: 这就像有一个学生声称自己能通过数学考试。20 个人说:“我觉得他可能会作弊”,但实际上只有一个人真的给他出了考卷。其他人只是在没有进行实际检查的情况下,就假设他是诚实的。
2. 机器人擅长开始,但不擅长完成
研究人员梳理了侦探的工作流程:
- 收集线索(采集)
- 阅读并分类它们(分析)
- 核实其真实性(验证)
- 撰写最终报告(报告)
- 做出最终决策(决策支持)
研究结果: 机器人在步骤 1 和 2 表现卓越。它可以比任何人类更好地收集和分类线索。但在步骤 3、4 和 5 中,它几乎完全被忽略了。
- 类比: 这就像雇佣一个机器人来做搬运家具的重体力活(收集和分类),然后却期望人类去处理布置墙上艺术品以及决定沙发摆放位置等精细工作。论文指出,我们过度关注于“重体力活”,而忽略了那些出错代价最高的精细且关键的部分。
3. “考试成绩” vs. “真实工作”
我们在如何测试这些机器人方面存在巨大的分歧。
- 选择题测试: 一些研究使用简单的多项选择题来测试机器人(就像智力问答)。机器人的得分高达 91%,超过了人类专家。
- 真实工作测试: 其他研究则通过给机器人一个混乱的、现实世界的案例来进行测试,要求它阅读数百份文件、寻找隐藏的联系并撰写报告。在这种测试中,机器人失败了。它无法处理复杂性或不确定性。
- 类比: 这就像一名驾驶员在驾驶模拟器上获得了完美分数(多项选择题测试),但一旦回到真实的交通环境中,面对雨天和行人时,却直接撞车了(真实工作测试)。论文警告我们不要被高分所迷惑。
4. “毒井”风险
论文强调了一个可怕的风险:如果机器人发现的线索本身就是假的怎么办?
- 研究结果: 研究人员展示了坏人可以利用类似的 AI 工具来编写虚假新闻或虚假威胁报告。当机器人阅读这些虚假报告时,它会相信它们,并将它们加入到自己的“知识库”中。
- 类比: 想象你的机器人助手正在从一条河流中取水饮用。但有人已经在上游偷偷下毒了。机器人不知道水被污染了,它只是喝了下去,然后告诉你:“这水真不错!”论文指出,机器人没有内置的过滤器来区分真水和毒水。
5. 解决方案:“副驾驶”模式
那么,我们应该解雇这个机器人吗?不,论文建议我们保留它,但要改变使用它的方式。
- 建议: 我们应该采用**“人类在环”(Human-in-the-Loop)模式。把它想象成飞机中的“副驾驶”**。
- 机器人(副驾驶)负责枯燥、繁重的体力活:收集数据、分类文件和撰写初稿。
- 人类(机长)坐在座位上,检查机器人的工作,核实事实,并做出最终决策。
- 为什么? 因为机器人虽然快,但容易撒谎且容易被误导。人类虽然慢,但拥有识别谎言的判断力。在能够证明机器人 100% 可靠之前,人类必须始终掌握控制权。
总结
论文得出结论:虽然 AI 是情报工作中一个强大的新工具,但目前单独使用它风险过高。它就像一个尚未经过充分安全测试的强大引擎。在让我们独自驾驶这辆车之前,我们需要建立更好的安全检查机制(针对撒谎、针对虚假新闻的测试以及法律规则)。目前最好的方法是建立一种伙伴关系:由机器人承担重体力活,而由人类确保它所说的是真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。