← 最新论文
🤖 machine learning

CrediBench: Building Web-Scale Network Datasets for Information Integrity

本文介绍了 CrediBench,这是一个包含超过 4000 万个领域、长达八个月的图、文本和时间数据的网络规模多模态数据集,它通过捕捉现有声明级方法经常忽略的结构和动态信号,显著提升了可信度预测模型的性能。

原作者: Emma Kondrup, Sebastian Sabry, Hussein Abdallah, Zachary Yang, Jiaqi Xiong, Kellin Pelrine, James Zhou, Zhijin Guo, Michael M. Bronstein, Jean-François Godbout, Reihaneh Rabbany, Shenyang Huang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Emma Kondrup, Sebastian Sabry, Hussein Abdallah, Zachary Yang, Jiaqi Xiong, Kellin Pelrine, James Zhou, Zhijin Guo, Michael M. Bronstein, Jean-François Godbout, Reihaneh Rabbany, Shenyang Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一座巨大且繁忙的城市,每一座网站都是其中的一栋建筑。有些建筑是诚实的图书馆,有些是阴暗的小巷商店,还有一些则是彻头彻尾的陷阱。现在,要分辨它们变得越来越难,因为坏人正在建造极具欺骗性的假门面,而且新的“建筑”每秒钟都在涌现。

这篇论文介绍了一个名为 CrediBench 的庞大新工具,旨在帮助我们在这座城市中穿行,并弄清哪些建筑是值得信赖的。

以下是他们所做工作的详细拆解,使用了简单的类比:

1. 问题所在:旧地图太小了

以前,研究人员试图识别虚假新闻或危险网站时面临两个主要问题:

  • 他们只看“菜单”: 大多数工具仅仅阅读单个网页上的文本(即“菜单”)来决定它是否是一家好的餐厅。他们忽略了店主是谁,或者店主的交友圈如何。
  • 地图规模太小: 现有的数据集就像是单个街区的地图。它们没有足够的数据来观察整个城市,尤其是这些建筑之间的连接关系是如何随时间变化的。

2. 解决方案:一张巨大的、活着的城市地图

作者构建了 CrediBench,它就像是一张涵盖了整个互联网、长达八个月的高清延时摄影地图。

  • 规模: 它非常宏大。它追踪了超过 4,000 万个“建筑”(域名) 和连接它们的 10 亿条“道路”(超链接)。为了让你有个直观的概念,这比以往任何同类地图都要大出好几个数量级。
  • 三个维度: 不仅仅是看文本,CrediBench 同时观察三件事:
    1. 文本: 页面上写了什么?(菜单)。
    2. 结构: 谁链接向谁?(邻里间的流言蜚语和盟友关系)。
    3. 时间: 这些连接是如何变化的?(比如,一家声誉良好的图书馆是否在上周突然开始链接到一家阴暗的商店?)。

3. “可信度评分”

研究人员教会了计算机如何扮演“专家检查员”的角色。他们创建了两种方式来测试该系统:

  • “信任计” (回归任务): 系统不仅仅是说“好”或“坏”,而是给出一个 0 到 1 之间的分数,表示该网站的可信程度究竟有多高。
  • “及格/不及格”测试 (分类任务): 一个简单的“是,这是安全的”或“否,这是危险的”判断。

为了训练这些检查员,他们并没有凭空猜测。他们收集了一份包含 66.2 万个网站 的庞大名单,这些网站已被专家、大众和安全公司标记为“可信”或“不可靠”(涵盖了误导信息、恶意软件和网络钓鱼等领域)。这是有史以来收集到的同类名单中规模最大的一份。

4. 结果:团队协作胜出

团队进行了实验,以观察哪种“感官”最为重要:阅读文本、观察链接,还是观察时间线。

  • 发现: 你不能只依赖一种感官。一个只读文本的模型表现尚可,但一个只看链接的模型也表现尚可。
  • 赢家: 将这三种感官(文本 + 链接 + 时间)结合在一起的**“超级检查员”**成为了明显的冠军。
    • 在“信任计”任务中,它大幅降低了错误率(从 16% 的错误率降至 10%)。
    • 在“及格/不及格”测试中,它的准确率从 56% 跳升到了 85%

5. 为什么这很重要

论文指出,虚假信息是通过网站之间的“连接”像病毒一样传播的,而不仅仅是通过页面上的文字。通过观察整个城市地图以及它的动态变化,我们可以更快地识别出那些“糟糕的街区”。

简而言之: 作者构建了有史以来最详细、规模最大的互联网信任网络地图。他们证明了,要识破骗子,你不仅要读他们说了什么,还要看他们和谁混在一起,以及观察他们的关系如何随时间演变。他们制作了这张地图并提供了训练工具供所有人使用,以便未来的研究人员可以构建更好的“城市检查员”,从而保护互联网的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →