← 最新论文
💻 computer science

Task-Adaptive Decoder Specialization for Unified Image Coding Toward Human Reconstruction and Machine Classification

本文提出了一种任务自适应解码器特化框架,该框架利用共享编码器和潜表示,通过动态重构的解码器侧适配器,在统一图像编码中(特别是在低比特率下),同时增强用于机器分类的语义判别性和用于人类感知的高频纹理保真度。

原作者: Wei Zhang, Xiwu Shang, Mengyao Wang, Xiaoli Zhao, Guozhong Wang

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Zhang, Xiwu Shang, Mengyao Wang, Xiaoli Zhao, Guozhong Wang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图同时向两位截然不同的朋友发送一张完美的照片。其中一位朋友,我们称之为“人类”,非常在意照片看起来怎么样。他们想看到猫咪毛发的质感、窗户锐利的边缘,以及落日那微妙的色彩。如果照片看起来模糊不清或者像融化的塑料一样平滑,人类就会感到不悦。另一位朋友,“机器”,则完全不在乎美感。机器是一个机器人大脑,它只需要知道:“那是猫还是狗?”对于机器来说,照片只要清晰到足以识别形状和眼睛即可,它并不介意毛发看起来有点模糊,只要能捕捉到识别重要的细节就行。

问题在于,发送两张单独的照片会占用过多的空间和带宽。只发送一张照片却很棘手,因为对“人类”而言完美的照片对“机器”来说可能太模糊了,而对“机器”而言完美的照片对“人类”来说又可能太有颗粒感了。这就是图像压缩的世界,这是一个致力于缩小数字图片以便存储和快速传输的计算机科学领域。巨大的挑战在于“统一编码”:即创建一个能够同时满足人类视觉和机器大脑的单一压缩文件。通常情况下,当你试图同时取悦两者时,往往最终两者都无法完美取悦,尤其是在需要将文件体积压缩得非常小时。

这篇论文介绍了一种解决这种“拉锯战”的聪明新方法。作者们并没有试图为每个人创造一张完美的图像,而是提出了一种系统:图像作为一个紧凑的整体包被发送,但其“拆解”方式会根据观察者的不同而改变。想象一下这是一个神奇的行李箱,里面装有一套相同的原料。如果你是一名厨师(人类),行李箱打开后会展现出一个配备了搅拌机和搅拌器的厨房,用来制作丝滑美味的汤;如果你是一名科学家(机器),同一个行李箱打开后则会展现出一台显微镜和一台天平,用来分析化学成分。原料(数据)是相同的,但用于处理它们的工具是不同的。

由上海工程技术大学的张伟(Wei Zhang)及其同事领导的研究团队构建了一个名为“任务自适应解码器专门化框架”的系统。简单来说,他们创建了一个共享的“编码器”(负责将照片压缩成微小文件的部分),这个编码器对所有人都是一样的。然而,在接收端,他们增加了两个仅在需要时才会启动的特殊“适配器”。

首先,针对机器,他们添加了一个名为 LSSP(潜空间语义保留)的工具。想象一下压缩后的照片是一张略显模糊的素描。机器需要准确知道物体的身份。LSSP 工具就像一个智能荧光笔,在素描被完全绘制出来之前,专门对眼睛和耳朵的轮廓进行强化。它并不会向文件中添加新的像素,它只是重新排列现有的信息,使最重要的线索更加突出。

其次,针对人类,他们添加了一个名为 HFR(分层高频恢复)的工具。当照片被过度压缩时,往往会失去它的“颗粒感”——比如衣服的纹理或车轮的辐条等微小细节。HFR 工具就像一个纹理画家。它观察模糊的基础图像,并利用对形状连接的智能理解,将缺失的粗糙边缘和精细细节重新“画”回来。它不需要接收额外的数据来完成这一点;它根据上下文推断出缺失的纹理,从而让图像在人类眼中看起来更加锐利、真实。

团队测试了该系统,发现它表现得非常出色,尤其是在文件体积非常小(低比特率)的情况下。在实验中,该方法在仅为 0.15 bpp(每像素比特)的极低数据速率下,帮助机器识别图像的准确率达到了 77.86%,优于其他顶尖方法。对于人类而言,重建的图像更加清晰,在标准测试图像上的质量得分达到了 29.78 dB,比以往的方法提高了近 1 dB

论文指出,通过保持“打包”方式不变,但根据任务改变“拆解”工具,可以在不需要发送两个单独文件的情况下实现两全其美。这是一种表达方式,即:“我们不需要妥协,我们只需要聪明地完成工作。”虽然这些结果令人鼓舞,但作者也指出,这是一个针对图像压缩与分类的特定解决方案,他们计划在未来探索这种“神奇行李箱”方法是否能应用于更复杂的任务,例如识别移动物体或理解视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →