← 最新论文
💻 computer science

Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA

本文提出并评估了利用人类特有感知优势(ASCII 艺术和重叠音频)的新型 CAPTCHA 方案,结果显示当前前沿大语言模型在这些任务上表现极差,表明该方案在当下具有极高的有效性,但其长期抵御 AI 演进的能力仍需进一步研究。

原作者: Choon-Hou Rafael Chong

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Choon-Hou Rafael Chong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常紧迫的问题:当人工智能(AI)变得像人一样聪明,甚至更聪明时,我们该如何区分“真人”和“机器人”?

想象一下,以前的互联网大门前都站着一个守卫(也就是我们熟悉的 CAPTCHA,比如让你选“所有的红绿灯”或输入扭曲的字母)。以前,机器人看不懂这些图,所以守卫能拦住它们。但现在,最新的超级 AI 模型(比如 GPT-5、Gemini 3 等)已经能轻松解开这些谜题,就像小学生解开了奥数题一样简单。传统的守卫已经失效了。

作者提出了一种新的思路:不要和 AI 比拼“谁更聪明”,而是比拼“谁更像人”。 人类在进化过程中,大脑里有一些 AI 还没学会的“超能力”。

作者测试了两种利用这些“人类超能力”的新守卫方法:

1. 视觉守卫:ASCII 艺术(用字符画成的图)

  • 这是什么?
    想象一下,不用画笔画出一个人脸,而是用键盘上的符号(比如 |_/)拼凑出一张脸。这就是 ASCII 艺术。
  • 人类怎么做?
    人类的大脑很神奇,看到一堆杂乱的符号,能自动把它们“脑补”成一个整体形状。就像看云一样,你一眼就能看出那是一匹马,而不是几朵云。
  • AI 为什么懵圈?
    作者把这种“字符画”扔给世界上最先进的 AI 看。结果令人震惊:AI 完全看不懂! 哪怕是最强的 AI,面对这些由符号组成的字母或图案,就像看着天书一样,正确率几乎为零。
    • 比喻: 这就像给 AI 看一堆乱码,让它猜这堆乱码拼出来的是“猫”还是“狗”。AI 习惯了看高清照片,突然让它看用乐高积木拼成的抽象画,它的大脑(算法)就死机了,因为它不知道如何把那些零散的“积木块”(字符)拼成一个有意义的整体。
  • 结论: 这种守卫对人类来说很简单(一眼就能认出),但对 AI 来说却难如登天。而且生成这种图的成本极低,瞬间就能生成成千上万张。

2. 听觉守卫:鸡尾酒会效应(在嘈杂中听清人声)

  • 这是什么?
    想象你在一个喧闹的派对上(鸡尾酒会),周围有人在聊天、音乐在响。但你依然能听清你朋友在你耳边说的话。人类的大脑有一种“鸡尾酒会效应”,能自动过滤背景噪音,专注于一个声音。
  • AI 为什么懵圈?
    作者让 AI 听一段录音,录音里是两个人同时在说话,或者说话声里夹杂着巨大的噪音。
    • 比喻: 这就像让 AI 在狂风暴雨中听清一根针掉在地上的声音。虽然现在的 AI 能听懂安静的录音,但一旦声音重叠、变乱,AI 就晕头转向了,只能猜个大概(正确率跌到接近随机猜测的水平)。
  • 缺点: 虽然有效,但生成这种“嘈杂音频”比生成图片要慢,成本也更高,而且对听力不好的人不太友好。

3. 核心策略:让机器人“算不起账”

除了让 AI“看不懂”,作者还提出了一个更深层的策略:让 AI“算不起”。

  • 比喻: 以前我们试图造一堵 AI 翻不过的墙。现在,我们不如在门口放一个巨大的、需要花 100 个小时才能解开的谜题。
    • 对于真人:解这个谜题只需要 10 秒钟,毫无压力。
    • 对于机器人:它也能解,但需要耗费巨大的算力和时间。如果黑客想发动攻击,需要同时控制几百万个机器人,每个机器人解一个谜题都要花 100 秒,那它们的电费和时间成本就会高到破产。
  • 结论: 即使未来 AI 变聪明了,能解开这些谜题,但只要解谜题的成本(时间、金钱)远高于它攻击带来的收益,黑客就会因为“无利可图”而放弃攻击。这就好比在银行门口设一个需要花 1 小时才能打开的锁,虽然小偷能打开,但他为了偷 100 块钱花 1 小时,太不划算了。

总结

这篇论文告诉我们,面对越来越聪明的 AI,我们不需要造出更复杂的“迷宫”去困住它们,而是可以回归人类最原始的感知本能(比如看字符画、在噪音中听人说话)。

  • ASCII 艺术就像是一个“视觉陷阱”,专门利用 AI 看不懂抽象符号的弱点。
  • 嘈杂音频就像是一个“听觉迷宫”,利用 AI 处理复杂声音的短板。

虽然这些方法不能保证永远有效(毕竟 AI 也在进化),但它们是目前打破“机器人泛滥”僵局的一把新钥匙。未来的网络安全,可能不再是比拼谁更聪明,而是比拼谁更“像人”,以及谁能让机器人“亏本”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →