← 最新论文
⚡ electrical engineering

A Fully Streaming Low-Latency FPGA Architecture for Range-Doppler SAR Processing Using Radix-2 SDF FFT

本文提出了一种用于距离-多普勒合成孔径雷达(SAR)处理的全流式 FPGA 架构,该架构利用基-2 流式数据格式(SDF)FFT 流水线中的分布式阶段性延迟存储器来实现距离向和方位向的并发压缩,从而消除了集中式帧缓冲并大幅降低了首次输出延迟和总处理延迟。

原作者: Abbas Fadavi

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Abbas Fadavi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一台能够穿透云层、雨幕和黑夜,从飞行器或卫星上捕捉地球表面详细图像的相机。这就是合成孔径雷达(SAR)的力量,这项技术已成为绘制地球地图、监测灾害以及引导自主系统的核心技术。为了将从地面反射回来的原始无线电信号转化为清晰的图像,数据必须经过一个被称为“距离-多普勒算法”(Range-Doppler algorithm)的复杂数学变换。这个过程包含两个主要步骤:首先是沿着雷达波束指向的方向进行图像锐化,其次是沿着飞行器飞行的方向进行锐化。几十年来,构建执行此任务的计算机芯片的标准方法是,在第一步完全形成整个图像之前,等待第二步开始。这种方法虽然易于管理,却造成了一个显著的瓶颈:机器处于闲置状态,等待大量的数据块被存储和组织完成后,才能开始下一个阶段的工作。

一位名叫阿巴斯·法达维(Abbas Fadavi)的研究人员提出了一种不同的组织工作方式,它完全消除了等待期。在 2026 年 8 月发表的一项研究中,法达维描述了一种新型现场可编程门阵列(FPGA)设计,这是一种常用于高速信号处理的可重构计算机芯片。该架构并没有将整个中间图像存储在一个大型的中央存储缓冲区中,而是将必要的存储分散到整个处理流水线之中。通过精心安排数据流的时序并使用特定类型的数字滤波器,该系统允许在第一批数据准备就绪时,便立即开始第二步锐化。这意味着两个图像形成阶段可以同时进行,而不是先后进行。其结果是,该处理器能更快地交付第一个清晰的图像点,并且处理整个图像的时间缩短了大约一半,且无需更强大的硬件或改变底层的数学逻辑。

传统雷达处理的核心问题在于数据如何在系统中移动。当雷达扫描某一区域时,它会收集一个巨大的数值网格,代表返回信号的强度。为了创建聚焦图像,计算机必须对这些数值进行一系列计算,具体使用的是一种称为快速傅里叶变换(FFT)的方法。在传统的 FPGA 设计中,计算机完成图像每一行的第一组锐化计算,并将所有结果存储在一个大型的二维存储块中。只有当整个数据块填满后,计算机才会开始第二组计算。这产生了一个很长的延迟,因为当第一部分在填充存储器时,第二部分处理器处于空转状态。这就像一条工厂装配线,第一站制造出一辆汽车并将其停放在一个巨大的停车场里,而第二站必须等到停车场里停满了车辆后才能开始为车喷漆。

法达维的解决方案取消了这个“停车场”。新设计使用了一种被称为“基-2单路径延迟反馈”(radix-2 single-path delay feedback)架构的特定数字处理器。在这种设置下,持有数据所需的内存并非一个独立的、大型的存储单元,而是直接构建在计算流水线的步骤之中。随着数据流经处理器,它会经过作为计算过程一部分的小型临时暂存区。通过安排数据流,使得第一阶段计算的输出能够自然地进入第二阶段的输入,而无需重新排序或存储在中央块中,系统可以在前几个数据点产生时便开始第二阶段的处理。这使得距离向和方位向的处理可以相互重叠,从而让机器的每个部分从一开始就保持忙碌。

研究人员通过构建该系统的完整模型并在特定的中端 FPGA 芯片(Xilinx Kintex UltraScale)上运行来测试这一想法。他们编写程序使芯片处理一个标准的雷达场景,其中包含 512 行数据,每行包含 1,024 个采样点。结果令人瞩目。在传统的基于帧的处理方法中,系统必须等待 525,824 个时钟周期才能产生第一个输出像素。而在新的流式架构下,该等待时间降至仅 2,048 个时钟周期。此外,处理整个图像帧所需的总时间从超过 105 万个时钟周期降至约 52.6 万个时钟周期。这代表了处理时间缩减了近一半,而这种提升并非通过加快单个计算速度实现的,而是通过改变它们进行的顺序实现的。

至关重要的是,研究证实这种加速并没有以牺牲精度或增加复杂度为代价。研究人员验证了由这种新型流式芯片生成的图像在数学上与传统方法生成的图像完全一致,唯一的微小差异是由数字计算机的标准舍入误差引起的。该设计还保持了稳定的速度,一旦初始流水线填满,每隔一个时钟周期就能产生一个完整的数据点。虽然芯片上使用的总内存量与旧设计相似,但其使用方式发生了根本性的变化。内存不再是两个独立任务之间的被动存储箱,而是成为了连续流动过程中的活跃组成部分,仅在同步两个处理阶段时才短暂持有数据。

这项工作表明,通过架构调度而非单纯依靠原始计算能力,即可实现合成孔径雷达实时成像性能的显著提升。通过重新组织数据在芯片中的移动方式,研究人员创建了一个确定性的系统,这意味着其时序是可预测且一致的,并且具有高度的效率。研究结果表明,未来的雷达系统可以提供延迟极低的图像,从而在分秒必争的应用场景中实现更快的决策。研究结论指出,这种流式处理方法为克服合成孔径雷达处理中的长期延迟提供了一条切实可行的路径,证明了有时提高效率最有效的方法不是更努力地工作,而是以不同的顺序进行工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →