想象一下,互联网是一座巨大且繁忙的城市,每一座网站都是其中的一栋建筑。有些建筑是诚实的图书馆,有些是阴暗的小巷商店,还有一些则是彻头彻尾的陷阱。现在,要分辨它们变得越来越难,因为坏人正在建造极具欺骗性的假门面,而且新的“建筑”每秒钟都在涌现。
这篇论文介绍了一个名为 CrediBench 的庞大新工具,旨在帮助我们在这座城市中穿行,并弄清哪些建筑是值得信赖的。
以下是他们所做工作的详细拆解,使用了简单的类比:
1. 问题所在:旧地图太小了
以前,研究人员试图识别虚假新闻或危险网站时面临两个主要问题:
- 他们只看“菜单”: 大多数工具仅仅阅读单个网页上的文本(即“菜单”)来决定它是否是一家好的餐厅。他们忽略了店主是谁,或者店主的交友圈如何。
- 地图规模太小: 现有的数据集就像是单个街区的地图。它们没有足够的数据来观察整个城市,尤其是这些建筑之间的连接关系是如何随时间变化的。
2. 解决方案:一张巨大的、活着的城市地图
作者构建了 CrediBench,它就像是一张涵盖了整个互联网、长达八个月的高清延时摄影地图。
- 规模: 它非常宏大。它追踪了超过 4,000 万个“建筑”(域名) 和连接它们的 10 亿条“道路”(超链接)。为了让你有个直观的概念,这比以往任何同类地图都要大出好几个数量级。
- 三个维度: 不仅仅是看文本,CrediBench 同时观察三件事:
- 文本: 页面上写了什么?(菜单)。
- 结构: 谁链接向谁?(邻里间的流言蜚语和盟友关系)。
- 时间: 这些连接是如何变化的?(比如,一家声誉良好的图书馆是否在上周突然开始链接到一家阴暗的商店?)。
3. “可信度评分”
研究人员教会了计算机如何扮演“专家检查员”的角色。他们创建了两种方式来测试该系统:
- “信任计” (回归任务): 系统不仅仅是说“好”或“坏”,而是给出一个 0 到 1 之间的分数,表示该网站的可信程度究竟有多高。
- “及格/不及格”测试 (分类任务): 一个简单的“是,这是安全的”或“否,这是危险的”判断。
为了训练这些检查员,他们并没有凭空猜测。他们收集了一份包含 66.2 万个网站 的庞大名单,这些网站已被专家、大众和安全公司标记为“可信”或“不可靠”(涵盖了误导信息、恶意软件和网络钓鱼等领域)。这是有史以来收集到的同类名单中规模最大的一份。
4. 结果:团队协作胜出
团队进行了实验,以观察哪种“感官”最为重要:阅读文本、观察链接,还是观察时间线。
- 发现: 你不能只依赖一种感官。一个只读文本的模型表现尚可,但一个只看链接的模型也表现尚可。
- 赢家: 将这三种感官(文本 + 链接 + 时间)结合在一起的**“超级检查员”**成为了明显的冠军。
- 在“信任计”任务中,它大幅降低了错误率(从 16% 的错误率降至 10%)。
- 在“及格/不及格”测试中,它的准确率从 56% 跳升到了 85%。
5. 为什么这很重要
论文指出,虚假信息是通过网站之间的“连接”像病毒一样传播的,而不仅仅是通过页面上的文字。通过观察整个城市地图以及它的动态变化,我们可以更快地识别出那些“糟糕的街区”。
简而言之: 作者构建了有史以来最详细、规模最大的互联网信任网络地图。他们证明了,要识破骗子,你不仅要读他们说了什么,还要看他们和谁混在一起,以及观察他们的关系如何随时间演变。他们制作了这张地图并提供了训练工具供所有人使用,以便未来的研究人员可以构建更好的“城市检查员”,从而保护互联网的安全。
技术摘要:CrediBench:用于可信度预测的 Web 规模网络数据
问题陈述
自动评估在线来源的可信度对于应对现代信息生态系统至关重要,特别是在生成式 AI 能够产生难以辨别且具有说服力的内容,导致虚假信息快速传播的背景下。现有的可信度预测方法面临两个主要局限性:
- 数据稀缺与成本高昂: 大多数方法依赖于稀缺、昂贵的人工标注或专家驱动的评估,这无法扩展到现代信息流的庞大规模。
- 模态单一: 当前的研究主要集中在单个声明、帖子或文档上,仅分析基于文本(内生)的信号。这忽略了互联网拓扑结构中固有的结构和时间信号,例如互联域名及其随时间的演变。
此外,现有的可信度预测数据集在规模上受到限制(通常仅包含数万个域名),并且往往缺乏对三种核心模态的整合:互联网拓扑(图结构)、时间性(随时间演变)以及网页文本内容。这一差距阻碍了开发可扩展、泛化性强的虚假信息缓解策略。
方法论
作者提出了 CrediBench,这是一个 Web 规模的数据集和框架,旨在通过将可信度预测建模为 文本属性时序图(Text-Attributed Temporal Graph, TAG) 学习问题来解决上述差距。
1. 数据构建流水线
CrediBench 是基于八个月的 Common Crawl 数据构建的。该流水线包括:
- 图构建: 节点代表 Web 域名,边代表它们之间的超链接。数据集在每个月度快照中包含超过 4000 万个节点和超过 10 亿条边。
- 文本提取: 使用分布式 Spark 集群从 Common Crawl 的 WET 文件中为每个域名提取原始网页内容(纯正文文本)。这些文本被处理成嵌入向量(embeddings)。
- 时间快照: 数据被组织成月度快照(例如 2024 年 10 月至 12 月),捕捉 Web 图谱和内容的动态演变。
- 过滤: 对度数低于阈值(默认为 3)的域名进行过滤,以保持活跃域名的单一连通分量,从而降低计算负载并专注于相关实体。
2. 标签集
为了实现监督学习,作者策划了两个不同的标签集:
- 回归标签(域名质量评分 - DQR): 一个包含 11,520 个经过专家驱动可信度评分标注的域名数据集。其地面真值(ground truth)是基于对六个专家来源进行主成分分析(PCA)后得到的第一个主成分(PC1)得分,范围在 0 到 1 之间。
- 二分类标签(DomainRel): 一个由八个来源(包括事实核查机构、来自维基百科等的众包列表,以及恶意软件/钓鱼数据库)聚合而成的 662,575 个域名 的新颖数据集。域名被标记为可信(1)或不可信(0),涵盖四个类别:虚假信息、众包、钓鱼和恶意软件。
3. 任务形式化
论文将可信度预测形式化为 TAG 上的两个节点级任务:
- 回归: 预测连续的可信度分数(y∈[0,1])。
- 二分类: 预测布尔类型的可信状态(y∈{0,1})。
4. 实验模型
作者评估了多种模态及其组合:
- 仅文本: 使用 Gemma3、Qwen3 和 OpenAI TE3L 等大语言模型(LLM)来嵌入文本内容,并输入到 MLP 回归器/分类器中。
- 仅图结构: 使用图神经网络(GCN、GraphSAGE、GAT)来学习超链接结构。
- 多模态: 通过拼接图嵌入(来自 GAT)和文本嵌入(来自 LLM)来形成联合表示。
- 时序性: 通过聚合连续月度快照中的嵌入,来捕捉时间演变。
核心贡献
- 最大的域名可信度数据集: CrediBench 是同类中规模最大的数据集,具有丰富的文本属性和 8 个月的 Web 规模图谱。每个快照包含 >40M 节点、>1B 条边和 >100GB 文本内容。
- 新颖的多模态标注: 引入了 DomainRel,这是一个包含 662k 域名、跨越四个不同可信度类别的二分类标签集,其规模和多样性显著超过了现有的域名级数据集。
- 多模态性的实证验证: 研究表明,结合图结构、文本内容和时间演变,其性能优于单模态方法。
- 开放资源: 该数据集托管在 Hugging Face 上,并提供了一个用户友好的 PyPI 包(
credigraph),用于 API 访问和复现。
实验结果
实验针对 2024 年美国联邦选举前后的快照(2024 年 10 月至 12 月)进行。
- 回归性能:
- 多模态模型(GAT + 文本嵌入)取得了最佳结果,将平均绝对误差(MAE)从 0.162(LLM-URL 基准)降低至 0.107。
- 仅文本模型(使用 OpenAI TE3L)的表现优于仅图模型,表明文本内容提供了强信号,但两种模态的结合产生了最低误差。
- 分类性能:
- 多模态分类器将准确率从 56%(LightGBM 基准)提升至 85%。
- 表现最好的模型是多模态 GAT 结合文本嵌入(GAT ⊕ Gemma3/TE3L),在各快照中达到了约 84-85% 的准确率。
- 时序洞察:
- 引入时间演变(聚合跨月数据)进一步将回归任务的 MAE 降低至 0.107,证实了 Web 图谱的动态特性是一个关键信号。
- 域名重叠分析显示,虽然约 49% 的域名在各月间保留,但仅有约 19% 的边是共同的,这凸显了时序图学习的必要性。
意义与主张
论文声称,通过解决大规模、多模态数据集匮乏的关键问题,CrediBench 为未来的可信度预测研究提供了“坚实的基础”。作者断言:
- 可扩展性是关键: 现有方法无法扩展到 Web 级别;CrediBench 使得训练能够处理数十亿次交互的模型成为可能。
- 整体信号是必要的: 实证结果支持了以下假设:可信度不仅是文本或结构的函数,更是它们随时间相互作用的结果。忽视任何一种模态都会导致次优的表现。
- 可复现性: 通过发布数据和代码,作者旨在加速开发原则性的、可扩展的缓解策略,以应对诸如 LLM 等不断演进的内容生成方法带来的虚假信息挑战。
这项工作定位为理解“在变化的 Web 拓扑结构中体现出的结构性和时序性可信度信号”的必要步骤,超越了仅限于声明级分析的局限,转向了域名级、Web 规模的视角。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。