GEO-Flag: Detecting and Measuring GEO-Optimized Web Content
本文介绍了 GEO-Flag,这是一个包含 GEOFlagBench 基准测试和干预配对训练(Intervention-Paired Training)方法的综合框架,旨在有效地检测、审计并衡量生成式引擎优化(GEO)在现实世界搜索生态系统中的普遍程度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
互联网正在改变我们寻找答案的方式。几十年来,我们通过输入问题并浏览一系列链接来进行搜索,然后亲自点击进入阅读来源。现在,新一代搜索工具利用人工智能为我们阅读这些链接,将信息综合成一个带有引用的单一、直接的答案。这种转变带来了便利,但也创造了一种新的脆弱性。正如过去网站可以通过调整来提高在传统搜索列表中的排名一样,一种新的做法也随之出现:内容被刻意修改,以被这些人工智能系统抓取并引用。这种被称为“生成式引擎优化”(generative engine optimization)的做法,可能会让微弱或错误的信息看起来证据充分,因为人工智能会将其作为事实呈现,而没有向用户展示完整的竞争性来源列表。危险在于其不透明性:如果人工智能引用了一个专门为被引用而构建的页面,用户看到的是一个自信的答案,而非背后的操纵手段。
一个研究小组致力于了解这一问题的规模并建立衡量工具。他们首先创建了一个包含 3,200 个网页的大规模测试集,涵盖健康、金融、技术和旅游领域。这些页面包括人类原创写作、经人工智能润色的文本以及完全由机器生成的文本。至关重要的是,他们还创建了这些页面的不同版本,这些版本是使用八种旨在操纵新 AI 搜索引擎的策略进行专门修改而成的。凭借这一多样化的集合,他们测试了现有的识别这些优化页面的方法。他们发现,虽然有些工具整体上能高精度地标记出这些内容,但它们往往依赖于“捷径”。许多检测器仅仅是根据文本是由人类还是 AI 编写来进行猜测,而不是识别出用于操纵搜索引擎的具体改动。当研究人员在人类精心应用优化技术的页面上测试这些工具时,检测器经常失效,这表明它们之前的成功其实是基于对所检测内容的误解。
为了解决这个问题,研究人员开发了一种名为“干预配对训练”(intervention-paired training)的新型训练方法。他们不再只是向计算机展示“好”页面和“坏”页面的例子,而是向它展示成对的页面:原始版本和修改版本。他们教导系统识别出某种特定的改动(例如添加某个短语以提高可见度)应当增加怀疑分数,而一般的语法或风格改进则不应如此。这种方法迫使检测器专注于实际的优化行为,而非作者的身份。结果是可靠性的显著提升。新系统能够以更高的准确度正确识别优化页面,并且重要的是,它不会因为原始文本是由人还是机器编写而产生混淆。它学会了识别操纵行为本身。
随后,该团队构建了一个更进一步的完整审计系统。一旦某个页面被标记为可能经过优化,系统就会检查该页面引用的链接是否可靠。它会为出版商分配一个等级,从高度权威的机构到易于创建或编辑的来源不等,并检查这些链接是否仍然有效。当他们将整个流程应用于来自 Google 和一种新型 AI 驱动搜索工具的真实世界搜索结果时,他们发现大约 8.9% 返回的页面是针对生成式搜索进行了优化的。这个数字并非静态;对于在 2026 年被修改过的页面,这一比例跃升至 16.36%。研究还揭示了来源质量的显著差异。AI 搜索工具返回的页面严重依赖低等级来源的引用,其中近四分之三的引用被贴上了低可验证性标签,而传统搜索结果中这一比例不足一半。
这些发现表明,在线信息的格局正在迅速变化。研究人员估计,目前出现在这些新搜索结果中的页面中,有超过十分之一可能是经过战略性修改以影响 AI 的。问题不仅在于虚假信息的传播,还在于我们用来验证事实的机制——引用——正成为操纵的一部分。通过识别这些模式并衡量其普遍程度,研究人员提供了一种洞察新搜索时代幕后真相的方法。他们的工作并不声称已经解决了这个问题,或找到了所有操纵的实例,但它为衡量这一问题建立了清晰的基础。它表明,如果没有新的工具来检测这些特定的优化行为,用户可能会越来越多地遇到那些看起来权威、实则建立在经过战略构建且往往未经核实的来源之上的答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。