想象一下,你正在试图破解一个巨大的全球性谜团,而线索散落在四个完全不同的、嘈杂的社区中:一个繁忙的公共广场(X/Twitter)、一个深度钻研的图书馆(Reddit)、一个秘密的后巷聊天室(Telegram)以及一个私人俱乐部(Discord)。
在过去,安全团队试图通过雇佣只懂一种语言或只访问一个社区的侦探来解决这些谜团。他们往往会错过大局,因为坏人将他们的计划拆分了:计划的一部分可能是在 X 上用法语发布的,另一部分是在 Telegram 上用俄语发布的,而第三部分则是 Reddit 上的技术图表。等到传统的安全报告(比如警察简报)印出来时,坏人早已转移了。
TIBlender 是一款全新的、超级智能的“侦探机构”,旨在解决这个问题。以下是它的运作方式,我们使用简单的类比来解释:
1. 问题所在:“破碎的拼图”
网络威胁就像是一个拼图,其碎片散落在不同的语言和平台中。
- 噪音: 这些平台充满了垃圾信息、笑话和假新闻(就像试图在火海中的草堆里寻找一根特定的针)。
- 滞后: 传统的安全情报源就像是第二天印刷的报纸。等你读到时,事件在几小时前就已经发生了。
- 缺口: 没有单一的平台拥有完整的故事。如果你只盯着 X,你会错过 Reddit 上的技术细节;如果你只盯着 Telegram,你会错过 X 上的公开警告。
2. 解决方案:一支专业化机器人团队(多智能体系统)
与其让一个侦探尝试做所有事情,TIBlender 使用了一支 AI 机器人 团队,每个机器人都有特定的工作。把它们想象成一支专业化的特遣队:
- 收集者(第 1 步): 这个机器人跑遍所有四个社区,倾听每一场对话。它不仅阅读文本,甚至能阅读图片中的文字(就像侦探阅读照片中的手写笔记)。它将所有内容翻译成英语,以便团队理解。
- 组织者(第 2 步): 这个机器人将成千上万条零散的消息进行归类。它会问:“来自 X、Telegram 和 Reddit 的这五条帖子是否都在讨论同一个 ‘Foo-VPN’ 黑客攻击?”它将破碎的拼图碎片缝合在一起,还原成一个完整的“行动(Campaign)”故事。
- 调查员(第 3 步): 这是核心团队。一旦故事被分组,四名不同的专家机器人会从不同角度进行调查:
- 基础设施智能体: “坏人在哪里隐藏?让我们检查他们的服务器和域名。”
- 技术智能体: “这次攻击到底是如何运作的?让我们看看代码。”
- 社交智能体: “谁正在被欺骗?这个骗局是如何传播的?”
- 行为智能体: “谁是幕后黑手?他们是已知的犯罪集团吗?”
- 至关重要的一点是: 这些机器人使用外部工具(如检查公共记录)来验证线索是真是假。
- 法官(第 4 步): 在团队撰写报告之前,两名独立的“法官”机器人会对工作进行审查。它们会问:“证据是否充足?线索之间是否存在矛盾?”如果证据不足,它们会将调查员打回原籍,要求进一步挖掘。这可以防止误报。
- 报告员(第 5 步): 最后,一个机器人会撰写一份清晰、结构化的报告。它不会只说“发现了坏事”,它会说:“这是恶意网站,这是恶意文件,这是他们是如何实施攻击的,以及为什么我们确定这是事实。”
3. “自我进化”的大脑
TIBlender 并非静止不变的。它拥有一个反馈循环。
- 趋势检测: 如果它注意到一种新型威胁突然出现(例如一种新的病毒),它会自动更改搜索关键词以捕捉更多此类威胁。
- 从成功中学习: 如果某种特定的调查策略在过去效果很好,系统就会学习在面对未来的类似威胁时再次使用该策略。
4. 他们发现了什么?(结果)
团队在现实世界中对 TIBlender 进行了为期 31 天的测试。结果如下:
- “缺失碎片”的发现: 当他们移除仅仅 一个 平台(比如关闭 Discord 监控)时,对于某些类别的威胁报告量会减少高达 50%。这证明了每个平台都持有其他平台所没有的独特线索。
- 击败竞争对手: 与仅观察单一平台的系统相比,TIBlender 发现了更多的恶意指标(如恶意网站或文件),并且发现了更多其他系统遗漏的新指标。
- 预警能力: TIBlender 在官方公开安全情报发布之前就发现了威胁。在某些情况下,它比政府数据库正式列出某个“零日漏洞”(一种全新的、尚未修复的黑客攻击)的时间还要早 13 天。
- 质量控制: 尽管它发现的威胁更多,但它并没有带来更多的误报。 “法官”机器人确保了报告的高质量和证据支持。
核心结论
TIBlender 就像是一个高度互联的新闻编辑部,它倾听每个社区每种语言的声音,通过专家团队交叉核实事实,并在坏人完成攻击之前,向安全团队交付经过验证的警告。它将混乱的社交媒体杂谈转化为清晰、可操作的危险地图。
技术摘要:TIBlender
问题陈述
网络威胁情报(TI)的收集目前高度依赖商业和公共威胁情报源,这不可避免地在威胁出现与发布之间引入了时间滞后。虽然社交媒体平台(如 X、Reddit、Telegram、Discord)已被证明在官方情报源之前就携带了失陷指标(IoC)和攻击活动细节,但现有方法无法实现将这些碎片化、多语言数据整合为可操作报告的全自动化。
现有系统面临三个根本性挑战:
- 碎片化集成: 威胁信号分布在具有不同语言、发布文化和粒度的异构平台中。单一平台的监测会导致结构性不完整的智能。
- 可靠性验证: 社交媒体包含大量的噪声、误导信息和夸张言论。依赖单一视角的自动化提取无法完全消除误报,且现有方法缺乏从独立视角进行交叉验证证据的机制。
- 噪声过滤与自适应: 威胁信号被埋没在垃圾信息和广告之下。此外,静态的监控规则无法跟上不断演变的攻击目标、技术以及对手所使用的平台。
目前尚无系统能同时解决多平台数据集成、跨源验证以及自适应噪声过滤,从而生成端到端的自动化 TI 报告。
方法论:TIBlender 系统设计
TIBlender 是一个自主多智能体系统,旨在监控多个社交媒体平台,关联碎片化信号,并生成结构化的、有证据支持的 TI 报告。该系统以固定间隔周期运行,利用由跨周期反馈机制增强的五步循环流水线。
1. 系统架构
系统监控四个代表性平台:X(快速传播)、Reddit(深入的技术讨论)、Telegram(威胁行为者活动)和 Discord(行为者协作)。它为每个阶段采用专门的大语言模型(LLM)智能体,涵盖从数据提取到结构化报告生成的全过程。
2. 五步循环流水线
- 第 1 步:自适应采集与帖子分析:
- 通过预定义的多种语言关键词以及由趋势检测驱动的动态关键词增强进行采集。
- 对图像应用光学字符识别(OCR),并使用 LLM 智能体并行生成英文威胁摘要并提取 IoC(URL、哈希、域名、IP、CVE)。
- 输出(威胁摘要、IoC 列表)对,供下游处理。
- 第 2 步:活动级聚类:
- 使用双轨方法将帖子整合为代表同一威胁活动的簇:
- IoC 轨道: 使用并查集算法合并具有高 IoC 重叠度(Jaccard 相似度)的帖子。
- 非 IoC 轨道: 使用威胁摘要的语义相似度,将不含 IoC 的帖子附加到现有簇中,或通过 HDBSCAN 进行分组。
- LLM 智能体根据目标组织和攻击向量将簇拆分为活动级单元,并分配严重程度等级(LOW/MEDIUM/HIGH/CRITICAL)。
- 第 3 步:多视角调查:
- 部署四个专门的调查智能体(基础设施、技术、社交、行为者)来收集证据。
- 模式选择: 簇以多视角模式(针对新型威胁)或 RL 引导模式(针对类似于过去案例的威胁)进行处理。RL 引导模式使用强化学习策略,根据历史成功率来优先确定调查重点。
- 智能体使用外部工具(RDAP/WHOIS、被动 DNS、CVE 数据库)从初始 IoC 转向相关的基础设施和行为者信息。
- 第 4 步:自适应评估环:
- 独立的“评审”智能体(来自不同的 LLM 提供商以减少偏差)从三个维度评估调查上下文:充分性(是否收集了所有必需的数据点?)、一致性(是否存在矛盾?)以及 证据质量(是否以高置信度证据为主?)。
- 如果证据不足,系统会触发多视角模式下的后续调查。
- 应用保守的共识规则:只有当所有评审员达成一致时,报告才会继续执行;否则,该报告将被跳过以抑制误报。
- 第 5 步:结构化报告生成:
- 将经过验证的调查上下文转换为结构化 TI 报告(JSON、PDF、Markdown、STIX 2.1)。
- 报告包含明确的理由说明、置信度评分以及提取类型(直接提取 vs. 转向提取)。
3. 跨周期反馈
- 基于趋势的查询自适应: 分析簇趋势(容量、传播、升级)以生成下一周期的动态搜索查询,确保对新兴威胁的覆盖。
- 在线 RL 策略学习: 利用过去周期中的成功调查轨迹来微调第 3 步的 RL 策略,提高未来调查的效率。
核心贡献
- TIBlender 实现: 一个多智能体系统,能够整合来自多个平台的碎片化、多语言威胁信号,并自主生成带有验证 IoC 和证据支持理由的可操作 TI 报告。
- 跨平台必要性的定量验证: 证明了每个平台都贡献了独特的威胁信息。排除任何单一平台都会导致特定威胁类别(例如,排除 Discord 会导致漏洞类报告减少 43%)的显著损失。
- 运行态预警能力: 通过大规模部署,该系统能够捕捉到早于公共情报源和漏洞注册库的威胁,包括正在进行的实战攻击(in-the-wild exploitation)。
实验结果
系统在 X、Reddit、Telegram 和 Discord 上进行了为期 31 天(2026 年 3 月 16 日至 4 月 16 日)的部署。
- 规模: 处理了 873,973 条原始帖子,将其整合为 184,240 个簇,并生成了 8,288 份可操作的威胁报告。
- 跨平台依赖性:
- X 是网络钓鱼/欺诈的主要来源(65%)。
- Reddit 在恶意软件/C2 领域占主导地位(59%)。
- Discord 和 X 平分了漏洞类报告(分别为 45% 和 46%)。
- APT/勒索软件 是分布最广泛的类别,四个平台均有显著贡献。
- 排除任何单一平台都会导致特定类别中高达 50% 的报告丢失。
- 与单平台基准对比:
- 在相同的输入条件下,TIBlender 的 IoC 提取(直接 + 转向)在量级上超过了单平台基准(Tweezers, DarkGram, Reddit2CTI)1.6 倍至 5.1 倍。
- 新颖性: TIBlender 识别出的 IoC 中,有 81.7%–94.0% 是在各自单平台基准中不存在的。
- 质量: TIBlender 的 IoC 在 19.7%–32.3% 的案例中被 11 个以上的 VirusTotal 引擎标记,显著优于基准(例如,DarkGram 仅为 0.4%)。相比之下,其域名 IoC 的误报率保持在较低水平(1.8%–2.3%),而基准最高可达 44.0%。
- 与公共情报源对比:
- 情报范围缺失: TIBlender 识别出的 IoC 中,有 83.0%–99.6% 在六个主要公共情报源(PhishTank, MalwareBazaar, URLhaus, CISA KEV, OTX Pulses, TweetFeed)中均未出现。
- 早期检测: TIBlender 在 13.7%–31.3% 的案例中比公共情报源更早发现重叠的 IoC。
- 领先时间: 该系统捕获实战攻击的时间比 CISA KEV 列表提前最多 13.4 天,比 PhishTank 提前最多 72 小时。
重要性与主张
本文确立了跨平台社交媒体监测作为运营级 TI 流水线中有效且可扩展的预警层的作用。作者认为:
- 集成至关重要: 没有哪个平台能提供完整的视图;跨平台集成对于实现全面覆盖是必不可少的。
- 自动化是可行的: 拥有角色专业化 LLM 的多智能体系统可以成功实现自动化,完成关联碎片化证据、验证可靠性以及生成结构化报告等复杂任务。
- 及时性: 与传统的基于情报源的收集相比,自动化监控社交媒体可以显著缩短新兴威胁的检测时间,在漏洞被正式编目或广泛传播之前提供可操作的情报。
作者强调,其方法通过牺牲少量的漏报率(false negatives)来换取大幅降低误报率(false positives),从而优先保证了能够直接集成到安全运营中心(SOC)中的可靠性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。