← 最新论文
📄 other

QuatHashing: Perceptually Hashing with Quaternion Discrete Wavelet Transform for Reduced-Reference Visual Security Assessment

本文提出了 QuatHashing,一种基于方向互补子带上的四元数离散小波变换和注意力机制来生成感知哈希,从而有效评估加密图像质量的降维参考视觉安全性评估方法。

原作者: Yannan Ren, Jiantao Wang, Hua Wu

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yannan Ren, Jiantao Wang, Hua Wu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

图像安全中的隐形艺术

想象一下,你正试图发送一条秘密信息,但你不是用隐形墨水来书写,而是通过对一张照片进行“打乱”。在数字安全领域,这被称为感知图像加密(perceptual image encryption)。与传统的加密不同——传统加密会将图像变成一团混乱的静态噪声,看起来就像坏掉的电视屏幕——感知加密则更加微妙。它隐藏了图片的“含义”,同时保留了其部分视觉轮廓,就像是把脸部模糊处理到刚好让人看不出是谁,但仍能看出那是一个人的程度。这在流媒体视频或分享照片等场景中非常有用,因为你既想保护隐私,又希望图像能够快速加载。

但棘手的地方在于:你如何知道你的“打乱”是否真的奏效了?如果你只是观察图片,它可能看起来还是有点清晰,这意味着你的秘密是安全的;但如果它看起来太模糊,说明加密强度过高,导致速度变慢。科学家们使用一种叫做**视觉安全评估(Visual Security Assessment, VSA)**的方法来衡量这一点。你可以把它想象成一场针对安全性的“味觉测试”。你需要一种方法来为图像被隐藏得有多好进行评分,而不需要让人类盯着看上好几个小时。目标是找到一个图像的数学“指纹”,这个指面会随着图像变得过于易于辨识而发生精确变化,从而充当一个永不疲倦的完美保安。

论文的核心思想:QuatHashing

在这项研究中,作者引入了一种名为 QuatHashing 的新方法。他们想要构建一个更好的“安全保安”来守护这些被打乱的图像。他们没有仅仅将图像视为一个平面的颜色网格,而是决定使用一种名为**四元数(Quaternion)**的数学工具,将图像视为一个由四个部分组成的 3D 物体。

要理解这如何运作,想象你有一张城市的照片。通常,计算机将其视为一张扁平的纸。但作者决定将城市拆分为两个特殊的层:一层只显示水平线条(如地平线或建筑物的顶部),另一层只显示垂直线条(如摩天大楼或树干)。他们称之为“互补子带(complementary sub-bands)”。通过这种方式分离图像,他们可以精确观察加密是如何干扰水平和垂直细节的,而这是其他方法经常忽略的地方。

一旦拥有了这两个特殊的层,他们就会使用一个被称为**四元数离散小波变换(Quaternion Discrete Wavelet Transform, QDWT)**的神奇数学透镜。你可以把这个透镜想象成一个超强倍率的缩放功能,它同时从三个维度观察图像:

  1. 大局观(低频): 观察主要的形状和轮廓。如果加密较弱,人脸或建筑物的基本轮廓在这里可能仍然可见。
  2. 纹理(高频): 观察微小的细节,比如木材的纹理或衣服的图案。良好的加密应该完全打乱这些纹理。
  3. 结构(多尺度): 检查图像的不同部分是如何相互关联的,确保图像的“骨架”被破坏。

作者发现,通过结合这三个视角,他们可以创建一个非常紧凑的图像“指纹”(或哈希值)。但他们并未止步于此。他们意识到人类的眼睛是非常挑剔的;我们对边缘和亮点变化的感知比对平滑、枯燥区域的感知要敏锐得多。因此,他们在指纹中加入了一个特殊的“注意力”系统。这个系统就像一个聚光灯,只关注图像中最有趣的部分(边缘和纹理),而忽略那些无聊的部分。这使得安全评分更加准确,因为它模拟了真实人类判断图像的方式。

他们的发现

团队通过将他们的新方法 QuatHashing 与许多现有的图像安全测量方法进行了对比测试。他们使用了两个已经被人类实际评分过的打乱图像大型数据库。

结果非常令人振奋。作者发现,与旧方法相比,QuatHashing 能更好地预测图像的安全程度。它在判断“中等质量”图像(即那些既非完美清晰、也非完全无法辨认的图像)的安全度方面表现尤为出色。在这些复杂的中间地带,其他方法往往会产生混乱,但 QuatHashing 却能保持一致性。

例如,在观察该方法与人类意见的匹配程度时,他们的新方法在准确性方面得分很高。它特别擅长捕捉那些“接近安全但仍留有痕迹”的图像——即那些人类肉眼仍能捕捉到蛛丝马迹的图像。作者指出,通过使用这种“四部分”数学(四元数)并专注于水平和垂直方向,他们创造了一个对人类视觉世界更加敏感的工具。

简而言之,论文表明,如果你想知道你的打乱图像是否真正免受窥视,你不应该仅仅观察整张图片。相反,你应该将其拆分为水平和垂直的部分,通过一个特殊的 3D 透镜进行观察,并专注于那些吸引眼球的部分。这就是 QuatHashing 用来守护你的数字秘密的“秘密配方”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →