← 最新论文
🤖 AI

AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization

本文介绍了 AudioTQ,一种数据无关(data-oblivious)的时域音频编解码器,它通过结合随机快速沃尔什-哈达玛旋转(Fast Walsh-Hadamard rotation)、Lloyd-Max 量化以及残差修正层,在标准 CPU 上实现了实时 6 位压缩,在显著减小文件体积的同时保持了约 30 dB 的 SQNR。

原作者: Sahil Gangurde

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Sahil Gangurde

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数字音频,即我们在手机和电脑中听到的声音,本质上是空气压力随时间变化的记录。为了存储这种声音,计算机每秒钟会对这些压力变化进行数千次快照,并为每次快照分配一个数字。这些数字越精确,声音就越好,但文件也会变得越大。几十年来,在不损失过多质量的情况下缩小这些文件的标准方法是将声音转化为另一种语言:工程师不再逐刻观察压力变化,而是将声音分析为不同音乐音高的混合物。然后,他们利用关于人类听觉的复杂规则来决定哪些音高过于微弱或被更响亮的声音所掩盖,以至于大脑永远不会注意到它们,并将这些部分删除。这种方法效果很好,但它需要沉重的数学机制和对人类耳朵功能的深刻理解。

然而,一种新的方法表明,我们可能根本不需要了解人类的耳朵也能有效地压缩音频。这种新方法并不试图模仿生物学,而是将声音简单地视为可以重新排列的一串数字。通过借鉴最初旨在缩小人工智能模型庞大内存需求的技巧,研究人员创建了一个通过数学方式重塑数据本身来压缩音频的系统。其结果是一个可以在标准计算机处理器上快速运行、无需专门硬件、且压缩率足以媲美最成熟音频格式的编解码器,同时其运作方式完全不同。

由 Sahil Gangarde 领导的研究团队开发了名为 AudioTQ 的系统。他们的目标是创建一个有损音频编解码器——一种通过永久丢弃部分信息来减小文件大小的工具,但该工具直接作用于原始的时域信号,而不先将其转换为频率。传统方法依赖于心理声学模型,即人类听觉敏感度的复杂图谱,以此来决定丢弃哪些内容。AudioTQ 完全拒绝了这一点。相反,它依赖于这样一个数学特性:随机化数字的排列往往会使它们趋向于形成一种可预测的、钟形分布的模式。这正是大型语言模型能够以更少的比特内存运行的统计行为。

该过程始于获取一段原始音频数据。想象一段很短的歌曲片段,比如长达半秒钟,包含数百个独立的音量测量值。在标准计算机中,这些测量值被存储为较大的精确数字。AudioTQ 系统首先对这组数字块应用特定的数学旋转。这种旋转并非混沌意义上的随机,而是一种结构化的、快速的计算,用于混合这些数值。研究人员发现,这种混合过程平滑了音频中的极端峰值和寂静谷底,将原始声音那锯齿状、不可预测的形状转化为一种更均匀的分布。数据实际上变得“高斯化”了,这意味着它们紧密聚集在一个中心平均值周围,极少出现极端异常值。

一旦数据被重塑为这种可预测的模式,系统就能以惊人的效率对其进行压缩。因为这些数字现在遵循一种标准的已知形状,系统可以使用预先计算好的映射表,将每个数字替换为一个更小的代码。系统不再存储完整的精确值,而只是记录该数字落入了哪个“桶”或类别中。在这一特定设计中,研究人员使用了 6 位(6-bit)代码,这允许产生 64 个不同的类别。相比于高质量录音中使用的 24 位或 32 位精度,这是一个显著的降低。然而,仅仅降低精度会引入刺耳的类静电噪声。为了解决这个问题,系统添加了一个微小的、单位的修正。它会检查原始数字是略高于还是低于其所属“桶”的中心,并记录那个方向。这个额外的比特就像一个精细调节旋钮,使得系统能够以接近 7 位的分辨率重建声音,尽管它实际只存储了 6 位主数据加 1 位修正。

最后一步是将这些代码打包进标准计算机内存。由于计算机处理数据时以 8 位(字节)为一组效率最高,系统巧妙地将 6 位代码和 1 位修正合并到一个 8 位的容器中,并留出一个空位。这种对齐确保了软件可以在单个处理器核心上高速运行,而无需专门的硬件加速器。结果是文件体积比原始文件显著缩小。在测试中,该系统将高质量录音的大小减少了约 74%,这意味着一个原本 20 MB 的文件变成了仅 5 MB 多一点。

尽管数据大幅减少,重建声音的质量仍然保持得非常高。当研究人员将压缩后的音频与原始音频进行对比时,发现它们的波形匹配度超过了 99.95%。该系统保留了鼓点的锐利攻击感和语音的细微细节,没有出现通常在激进压缩中出现的失真现象。信噪比(衡量有用声音相对于压缩引入噪声的比例)达到了约 30 分贝。这种保真度可以与 MP3 或 AAC 等成熟格式相媲美,然而它是通过从未分析过声音的频率内容或模拟人类听觉来实现的。

研究人员还确定了一种该方法可能失效的具体场景。如果音频信号恰好与旋转本身的数学结构对齐,数据就不会均匀展开,从而导致压缩崩溃并产生严重的失真。为了防止这种情况,系统包含了一个安全机制,可以检测到此类对齐情况,并在处理前稍微偏移数据,以确保该方法保持稳健。这种自我纠错功能,结合在标准硬件上运行的能力,表明“数据无关”(data-oblivious)的技术可以为音频压缩提供一条新路径。它证明了通过理解数据本身的统计特性,而非听者的生物学特性,我们能够构建出既轻量又强大的高效、高质量音频工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →