← 最新论文
💻 computer science

CRED-1: An Open Multi-Signal Domain Credibility Dataset for Automated Pre-Bunking of Online Misinformation

该论文介绍了 CRED-1,这是一个开源的多信号领域可信度数据集,它整合了公开许可源列表与域名年龄、网络流行度、事实核查频率及安全威胁等四种计算信号,旨在支持隐私保护的客户端预辟谣应用以在内容交付阶段自动识别在线虚假信息。

原作者: Alexander Loth, Martin Kappes, Marc-Oliver Pahl

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Loth, Martin Kappes, Marc-Oliver Pahl

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 CRED-1 的新工具,你可以把它想象成互联网世界的"食品成分安全标签"或"餐厅卫生评级",只不过它是专门用来给网站打分的。

为了让你更容易理解,我们用几个生活中的比喻来拆解这篇论文的核心内容:

1. 它是什么?(一个“黑名单”小册子)

想象一下,你走进一家大超市(互联网),货架上摆着成千上万种商品(网站)。有些商品是新鲜健康的,有些则是过期的、甚至有毒的(虚假信息网站)。

以前,如果你想避开那些“有毒”商品,你得靠自己去查,或者依赖某些昂贵的私人侦探(商业公司)提供的名单。
CRED-1 就是作者团队制作的一本免费、公开、透明的“避坑指南”。它列出了 2,672 个已知有问题的网站域名,并给每个网站打了一个0 到 1 的信用分

  • 0 分:就像“剧毒食品”,完全不可信(比如纯粹的假新闻、阴谋论)。
  • 1 分:就像“有机认证食品”,非常可靠。
  • 0.5 分:就像“加工食品”,虽然能看,但里面可能掺了调料(有偏见或半真半假)。

2. 它是怎么做出来的?(像侦探一样搜集线索)

作者没有凭空捏造这些分数,而是像侦探一样,把两条线索拼在一起,再补充四个“背景调查”:

  • 线索 A & B(基础名单):他们把两个已有的公开名单(OpenSources.co 和 Iffy.news)合并了。这就像把两个老饕的“避雷清单”合二为一。
  • 线索 C(年龄):查一下这个网站注册了多久。就像查一家餐厅开了多少年,虽然老店不一定好吃,但刚注册几天的“快闪店”往往更可疑。
  • 线索 D(人气):查一下它在互联网上的排名(Tranco 榜单)。就像看一家餐厅是不是在“米其林指南”前列,虽然人气高不代表一定好,但完全没名气的小网站风险可能更高。
  • 线索 E(纠错记录):查一下有没有人专门去“打假”过这个网站(Google Fact Check)。如果一家餐厅总被卫生局通报,那它的分数肯定低。
  • 线索 F(安全警报):查一下它有没有挂病毒或搞诈骗(Google Safe Browsing)。

打分规则
作者把这些线索像调鸡尾酒一样混合在一起。如果一个网站被多个来源标记为“假新闻”,或者被 Fact Check 打假过很多次,它的分数就会急剧下降。

  • 特别规则:如果一个网站被 Google 标记为“有病毒/诈骗”,不管它其他方面表现多好,直接给个极低分(0.05),就像直接拉进黑名单。

3. 它有什么用?(手机里的“隐形保镖”)

这个数据集最大的亮点是小巧隐私友好

  • 小巧:整个名单只有 145KB(比一张高清照片还小),可以塞进你的手机或电脑浏览器插件里。
  • 隐私:因为它就在你的设备上运行,不需要把你的浏览记录上传到云端服务器。就像你出门前自己看一眼“避坑指南”,而不是把你要买什么告诉超市经理。

应用场景
当你打开一个新闻链接时,浏览器插件会瞬间查一下这个域名在 CRED-1 里有没有记录。

  • 如果有记录且分数低,插件会弹窗提醒你:“嘿,这个网站经常发假消息,请小心!”
  • 这就是论文里说的"预辟谣"(Pre-bunking):在假新闻伤害到你之前,先给你打个预防针。

4. 一些有趣的发现(侦探笔记)

作者在研究中发现了一些反直觉的事情:

  • 老网站也可能是骗子:很多人以为假网站都是刚注册的“小混混”。但数据显示,很多假新闻网站已经“经营”了 14 年之久!它们像伪装成老店的骗子,让人放松警惕。
  • 假新闻和病毒是两码事:大多数传播假新闻的网站并没有病毒(只有 2 个被标记)。它们是在“合法”的框架下散布谎言,而不是直接攻击你的电脑。
  • 很少被专门打假:虽然这些网站很坏,但只有极少数(2.5%)被 Fact Check 机构专门针对过。这意味着大部分假网站其实是在“法外之地”游走的。

5. 它的局限性(说明书里的“免责声明”)

  • 主要是英语:这份名单主要针对英语网站,对中文或其他语言的网站覆盖较少。
  • 只列“坏蛋”:它只收录了已知有问题的网站。如果一个网站不在名单里,并不代表它一定是好人,只是还没被收录进来。
  • 依赖源头:它的准确性取决于最初那两个名单的质量。

总结

CRED-1 就像是一个由社区共同维护的、免费的、装在口袋里的互联网“食品安全员”。它不试图阻止你说话,也不审查内容,只是在你点击链接的那一刻,悄悄告诉你:“这家‘餐厅’的卫生评级可能不太行,请三思而后食。”

这项工作的核心精神是透明开源:任何人都可以查看它的代码,验证它的分数,甚至把它改进得更好,而不是把它藏在某个大公司的黑盒子里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →