云计算百科
云计算领域专业知识百科平台

边缘感知的热红外无人机集群跟踪

大家读完觉得有帮助记得关注和点赞!!!

摘要

热红外成像对于视觉条件退化环境下的无人机集群作业至关重要。然而,由于外观特征有限、遮挡频繁以及机动性强,跟踪微小无人机仍具挑战性。尽管Anti-UAV挑战赛等基准推动了显著进展,现有方法主要优先考虑精度,却忽视了实时边缘部署的计算约束。标准卡尔曼滤波虽然为边缘设备提供了所需的效率,但其恒定速度假设在无人机高动态运动和热成像传感器抖动下常常失效。更复杂的非线性估计器虽能提升鲁棒性,却常引入额外的计算开销。为填补此空白,我们提出一种以自适应运动学卡尔曼滤波为核心的边缘感知在线跟踪流水线。该滤波在标准线性KF基础上融入了状态依赖的运动学建模,同时保持了实时效率。结合瞬态假阳性抑制和运动学驱动的预测平滑技术,所提流水线在严苛的热红外条件下提升了轨迹连续性。在Beyond Strong Baseline基准上的实验为边缘感知无人机跟踪提供了起点,通过联合评估跟踪性能与计算效率,为未来的实时部署提供了见解。

1 引言

协同无人机集群在监视、搜救和环境监测等应用中日益重要。热红外成像已成为此类应用的关键感知模态,在RGB相机失效的夜间和恶劣天气条件下提供可靠感知。然而,在资源受限的边缘设备上实现实时多目标跟踪仍然充满挑战,需要在跟踪精度与计算效率之间取得平衡。

图1:在BSB排行榜上,使用Intel Core i7-12650H CPU、NVIDIA GeForce RTX 4050笔记本GPU(6GB显存)和24GB内存,对比不同在线跟踪流水线与所提AKKF的FPS-HOTA关系。横轴表示在线吞吐量,纵轴表示HOTA。气泡大小代表计算资源占用。红色虚线标示边缘感知阈值,浅绿色区域标示边缘部署的首选运行区间。

多种多目标跟踪流水线遵循“检测-跟踪”范式,将目标检测器与ByteTrack、BoT-SORT等数据关联方法相结合。近期的检测器-跟踪器框架,如YOLOv12结合BoT-SORT,已在Anti-UAV挑战赛中取得竞争力。尽管KF因其简洁高效而成为在线跟踪的主流运动模型,但其固定的运动学假设限制了其在动态无人机运动下的鲁棒性。为解决此局限,我们重新审视传统KF,引入自适应运动学建模,在保持实时效率的同时,迈向跟踪性能与计算效率间更优的平衡,如图1所示。我们的贡献总结如下:

  • 自适应运动学卡尔曼滤波:我们为标准线性KF增添了状态依赖的运动学建模,以实现鲁棒、实时的无人机集群跟踪。

  • 边缘感知在线跟踪流水线:我们集成了瞬态假阳性抑制和运动学驱动的预测平滑技术,实现可靠、连续的热红外无人机跟踪。

  • BSB基准评估:大量实验刻画了跟踪流水线的精度-效率权衡,为边缘感知无人机跟踪提供了实用参考。

2 相关工作

2.1 无人机数据集与基准

无人机已广泛应用于计算机视觉领域,从空对地目标检测到协同多智能体感知。相应地,涵盖了不同传感模态和视角的无人机感知数据集不断涌现,包括地空/空空视角的检测与分割、无人机集群监测以及热红外无人机检测与跟踪。

尽管无人机数据集日益丰富,但针对多无人机跟踪的标准化基准仍显不足。现有研究常依赖自定义数据集,导致数据特性和评估协议各异。成熟的Anti-UAV基准为热红外无人机跟踪提供了正式评估平台,但其评估可用性有限,且未明确考虑边缘部署的计算效率。基于公开发布的Anti-UAV数据,BSB基准提供了一个持续维护的多无人机跟踪评估平台¹,包含精心划分的训练/测试集、表1总结的数据特性以及基于HOTA的评估协议,使得在挑战性热红外无人机场景下对跟踪方法进行可复现的比较成为可能。

特性

训练数据²

测试数据³⁴

序列数量

102

98

帧数

77,293

74,537

分辨率

640×512

640×512

边界框总数

1,633,110

1,950

宽度范围

[1.43, 72.50]

[3.60, 60.68]

宽度均值±标准差

10.68 ± 5.80

10.49 ± 5.27

高度范围

[0.88, 52.84]

[3.17, 45.12]

高度均值±标准差

8.83 ± 4.43

9.49 ± 4.91

面积范围

[2.36, 3128.69]

[11.92, 2126.08]

面积均值±标准差

116.90 ± 158.98

122.73 ± 189.04

表1:BSB基准数据集特性概要。​ 该基准精选自200个公开视频,采用序列级划分以防止信息泄露,并保持训练集与测试集间场景覆盖的一致性。测试集仅提供首帧边界框标注用于跟踪器初始化与评估。

2.2 实时多目标跟踪

近期研究探索了数据驱动的状态估计器以建模复杂运动动力学。同时,高效的运动中心关联策略在实时跟踪中展现了竞争力。基于运动的跟踪器,如ByteTrack和OCSORT,通过利用边界框运动学和观测历史实现了有效关联。混合跟踪器,包括StrongSORT和BoT-SORT,进一步融入ReID模块和相机运动补偿以提升关联性能,同时保持实时效率。

大多数基于运动的跟踪器的核心是离散时间KF,它为线性动力学下的状态估计提供了高效的递归框架。给定时间步k∈ℕ₊的目标状态𝒙k∈ℝⁿ和含噪观测𝒛k∈ℝᵐ,系统建模为:

𝒙k = 𝑭k 𝒙{k−1} + 𝒘k, (1)

𝒛k = 𝑯k 𝒙k + 𝒗k, (2)

其中𝑭k和𝑯k分别表示状态转移矩阵和观测矩阵。在边界框多目标跟踪中无外部控制输入,动力学由运动学演化主导,过程噪声𝒘k∼𝒩(𝟎, 𝑸k),测量噪声𝒗k∼𝒩(𝟎, 𝑹k)。先验估计通过预测步传播:

𝒙̂{k|k−1} = 𝑭k 𝒙̂_{k−1|k−1}, (3)

𝑷{k|k−1} = 𝑭k 𝑷{k−1|k−1} 𝑭k^⊤ + 𝑸_k. (4)

然后在更新步计算卡尔曼增益𝑲_k,以融合先验预测与新测量值:

𝑲k = 𝑷{k|k−1} 𝑯k^⊤ (𝑯k 𝑷{k|k−1} 𝑯k^⊤ + 𝑹_k)^{−1}, (5)

𝒙̂{k|k} = 𝒙̂{k|k−1} + 𝑲k (𝒛k − 𝑯k 𝒙̂{k|k−1}), (6)

𝑷{k|k} = (𝑰 − 𝑲k 𝑯k) 𝑷{k|k−1}, (7)

其中𝑲_k根据其不确定性自适应地平衡运动预测与检测器测量。

非线性KF变体,如扩展卡尔曼滤波和无迹卡尔曼滤波,为复杂动力学提供了更大的建模灵活性,但因其在多目标场景下的计算开销,很少被用于边界框多目标跟踪。因此,包括近期流水线在内的最先进跟踪器,继续依赖具有线性恒定速度假设和预定义噪声模型的标准KF,热红外无人机跟踪系统亦是如此。

3 方法

3.1 自适应运动学卡尔曼滤波

我们在保持实时效率的同时,通过状态依赖的运动学建模扩展了线性KF。沿袭BoT-SORT,AKKF自适应更新转移矩阵和测量不确定性:

𝑭k = 𝑭k(𝒙{k−1}), 𝑹k = 𝑹k(𝒛k). (8)

状态和测量向量定义为:

𝒙_k = [x_c(k), y_c(k), w(k), h(k), v_x(k), v_y(k), v_w(k), v_h(k)]^⊤, (9,10)

𝒛k = [z{x_c}(k), z_{y_c}(k), z_w(k), z_h(k)]^⊤, (11)

其中(x_c, y_c, w, h)表示边界框中心和尺度,(v_x, v_y, v_w, v_h)表示相应速度,𝒛_k表示第k帧的检测器测量值。帧间隔设为Δt=1。

3.1.1 面积自适应运动阻尼

标准KF通过将𝑭{5,5}和𝑭{6,6}设为1来假设恒定的位置速度。在长时间遮挡期间,此假设会导致轨迹漂移,因为最后一次估计的速度被持续传播。为解决此问题,我们引入面积自适应运动阻尼,它根据目标尺度动态阻尼位置速度。受空气动力学阻尼模型启发,阻尼因子定义为:

D{xy} = α (A{box} / (A_{box} + β)), (12)

其中A{box}=max(1, w×h)是边界框面积,α控制最大阻尼强度,β决定饱和行为。速度保留项被替换为(1−D{xy}),允许在遮挡期间速度衰减,同时保持轨迹连续性。

3.1.2 透视感知速度制动

标准KF通过将𝑭{7,7}和𝑭{8,8}设为1来假设恒定的尺度速度。当无人机远离相机时,若检测不可用,负的尺度速度(v_w<0, v_h<0)可能导致尺度崩溃。为缓解此问题,我们引入透视感知速度制动,它根据目标尺度动态抑制尺度速度:

D_w = γ / max(w(k−1), ϵ), D_h = γ / max(h(k−1), ϵ), (13)

其中ϵ防止数值不稳定,γ控制制动强度。系数修改尺度速度保留项以减少过度的尺度变化。

3.1.3 动态测量噪声估计

标准BoT-SORT测量模型假设尺度依赖的测量协方差𝑹k。然而,热红外杂波可能引入超出基于尺度不确定性的、几何不一致的虚假检测。为解决此问题,我们提出动态测量噪声估计,它根据检测一致性调整测量不确定性。给定测量的和预测的纵横比a{meas}=w{meas}/h{meas}和a{pred}=w{pred}/h_{pred},我们定义一个异常因子:

ρ = 1 + κ (|a{meas} − a{pred}| / a_{pred})², (14)

其中κ控制对纵横比偏差的敏感度。随后更新测量协方差为:

𝑹k(𝒛k) = ρ 𝑹_k. (15)

大的几何不一致性会增大ρ,从而放大𝑹_k并降低不可靠检测的卡尔曼增益贡献,使预测占主导地位。

3.2 在线跟踪流水线

除所提AKKF外,我们进一步通过两个专为热红外无人机跟踪定制的实用组件增强在线跟踪流水线:瞬态假阳性抑制以提升轨迹可靠性,以及运动学引导的预测平滑以在临时观测间隙保持轨迹连续性。

3.2.1 瞬态假阳性抑制

标准BoT-SORT实现会在时间确认前输出新初始化的轨迹片段,允许单帧假阳性出现在最终跟踪结果中。这在热红外影像中尤为成问题,因为热杂波频繁产生瞬态虚假检测。为解决此问题,我们通过仅输出已确认的轨迹片段,恢复了时间轨迹确认机制,即瞬态假阳性抑制。如图2所示,此优化将基线HOTA从0.82357提升至0.825405。除表2报告的结果外,所有后续实验均在此更新后的基线上进行。

3.2.2 运动学引导的预测平滑

临时的漏检可能由热成像传感器抖动、运动模糊或相互遮挡引起,这会中断热红外无人机跟踪中的轨迹关联。为提升轨迹连续性,我们引入预测平滑策略。当第k帧无有效检测关联时,跳过测量更新,直接将预测作为后验估计:

𝒙̂{k|k} = 𝒙̂{k|k−1} = 𝑭k 𝒙̂{k−1|k−1}, (16)

𝑷{k|k} = 𝑷{k|k−1} = 𝑭k 𝑷{k−1|k−1} 𝑭k^⊤ + 𝑸k. (17)

我们定义τ_{coast}为由预测平滑处理的连续漏检帧数。如图2所示,使用RF-DETR Nano跟踪流水线(输入分辨率640),标准KF和所提AKKF均在单帧预测平滑时达到最佳性能。

图2:使用RF-DETR Nano跟踪流水线(输入分辨率640)时,TFPS和预测平滑在BSB排行榜上的效果。HOTA随预测平滑帧数的变化绘制。灰色垂直虚线标示Sec. 3.2.1讨论的TFPS带来的性能增益。标准BoT-SORT和所提AKKF均在单帧预测平滑时达到峰值HOTA。

4 实验结果

4.1 实现细节

我们评估了多种先进检测器,包括YOLOv12、YOLO26和RF-DETR,并与BoT-SORT跟踪器和所提AKKF集成。我们主要报告第2.1节介绍的BSB排行榜评估的HOTA指标。模型配置,包括模型大小和输入分辨率,见表2。除非另有说明,批大小设为32,而YOLOv12s和YOLOv12m分别使用批大小16和8。

除图1和表3使用NVIDIA GeForce RTX 4050笔记本GPU(6GB显存)以更好模拟边缘部署条件外,所有实验均在NVIDIA H100 80GB GPU上进行。图2中离线结果0.8271与图1中在线结果0.8274之间的微小HOTA差异源于不同的处理流水线:离线流水线在跟踪前将检测输出截断至两位小数,而在线流水线直接使用原始输出。

4.2 主要结果

表2总结了包括训练时间、推理速度、峰值GPU内存占用、检测精度和跟踪性能在内的结果。RF-DETR Nano在1280分辨率下取得了最高的HOTA分数0.8437。下划线标示的配置,包括RF-DETR Nano(640分辨率)和YOLO26n(1280及640分辨率),被选为边缘感知候选方案,并在图1中针对资源受限部署进行了进一步评估。

图3的可视化对比展示了不同配置的跟踪行为。最左列显示了文献[17]的强基线,具有最佳定位和身份保持能力;中间三个面板展示了边缘感知候选方案,跟踪质量从左至右逐渐下降。在相同分辨率下,YOLO26n(640分辨率)比YOLOv12n取得了更优的精度-吞吐量权衡,与图1一致。图3从上到下标记为[Coast]的时间演化演示了在临时观测间隙期间有效的预测平滑。

模型

尺度

尺寸(像素)

训练

 

推理

 

 

 

 

 

 

峰值GPU内存(GB)↓​

总时间(hh:mm:ss)↓​

峰值GPU内存(GB)↓​

总时间(hh:mm:ss)↓​

AP^{val}_{50-95}↑​

HOTA↑​

YOLOv12

n

1280

1.042

07:20:20

0.473

00:26:22

54.011

0.717086

 

s

1280

0.958

12:42:55

0.477

00:25:47

54.022

0.715683

 

m

1280

1.257

21:56:43

0.483

00:28:07

47.181

0.713188

 

n

640

0.868

02:09:41

0.433

00:20:57

13.688

0.521526

 

s

640

0.892

02:36:01

0.436

00:24:30

20.452

0.552467

 

m

640

0.925

03:38:52

0.444

00:20:25

27.878

0.551958

YOLO26

n

1280

2.026

05:13:49

0.472

00:11:24

40.835

0.764241

 

s

1280

3.073

06:13:00

0.464

00:12:53

65.396

0.748453

 

m

1280

5.464

08:27:27

0.465

00:15:32

75.624

0.788816

 

n

640

1.050

03:02:54

0.448

00:05:38

10.560

0.681414

 

s

640

1.315

03:15:21

0.452

00:05:59

14.542

0.693846

 

m

640

1.892

04:00:13

0.444

00:06:07

20.659

0.711008

RF-DETR

n

1280

1.144

17:12:11

0.435

00:45:22

31.327

0.843723​

 

s

1280

1.144

18:44:13

0.437

00:44:40

31.931

0.831454

 

m

1280

1.144

20:06:52

0.437

00:44:58

33.030

0.835436

 

n

640

0.906

11:31:36

0.422

00:31:16

13.349

0.823570

 

s

640

0.906

13:19:50

0.427

00:32:50

18.747

0.815145

 

m

640

0.906

14:50:46

0.415

00:34:51

17.681

0.809826

表2:BSB排行榜上检测架构的综合对比。​ 所有测量均使用NVIDIA H100 80GB GPU获得。报告了峰值训练内存、推理时间、检测精度以及使用原始BoT-SORT跟踪器的跟踪性能。最佳性能检测器以粗体标示,边缘感知候选方案以下划线标示。

图3:来自不同流水线的跟踪边界框在BB2P_02序列连续两帧上的可视化。

4.3 消融研究与讨论

表3总结了AKKF各组件的贡献。完整的AKKF取得了最佳的总体跟踪性能,在所有指标上均优于基线,同时将FPS从132.03降至94.92。除消融结果外,图4显示更高的检测精度并不必然转化为更好的跟踪性能,揭示了文献[17]中也观察到的检测-跟踪悖论。对于微小目标跟踪,提高输入分辨率能持续提升性能,这与先前发现一致。由于无人机目标已极其微小,进一步降低分辨率可能严重损害跟踪质量。因此,未来的改进应侧重于计算优化,如模型剪枝。此外,在热红外影像外观线索有限的边缘约束下,通过运动建模利用时间信息是一个有前景的方向。

AKKF组件

 

 

跟踪精度

 

 

效率

AAMD

PAVB

DMNE

HOTA↑​

MOTA↑​

IDF1↑​

FPS↑​

 

 

 

0.826116

0.636194

0.687265

132.03

 

 

0.826154

0.636183

0.687287

129.71

 

0.826196

0.636275

0.687395

129.89

 

0.826441

0.636180

0.687744

126.05

 

0.826240

0.636296

0.687429

127.91

 

0.826462

0.636185

0.687766

123.56

0.826606​

0.636284​

0.688019​

94.92

表3:所提AKKF组件(包括AAMD、PAVB和DMNE)的消融研究。​ 使用Intel Core i7-12650H CPU、NVIDIA GeForce RTX 4050笔记本GPU(6GB显存)和24GB内存。首行基线表示具有恒定速度运动学、TFPS且无预测平滑的标准BoT-SORT,而AKKF通过所提组件引入自适应运动学建模。各跟踪指标的最佳结果以粗体标示。

图4:BSB排行榜上跟踪流水线的AP@50:95-HOTA对比。横轴表示以AP@50:95衡量的检测性能,纵轴表示以HOTA衡量的跟踪性能。结果显示更高的检测精度并不必然带来更好的跟踪性能,揭示了检测-跟踪悖论。

5 结论

本文提出了一种面向热红外无人机集群的边缘感知跟踪流水线,它联合考虑了跟踪鲁棒性与计算效率。我们提出了AKKF,它通过状态依赖的运动阻尼、速度约束和测量不确定性估计,利用自适应运动学先验增强了标准KF框架。结合TFPS和预测平滑技术,所提流水线在临时观测间隙下实现了鲁棒的热红外无人机跟踪。在BSB基准上的大量实验验证了其有效性,并凸显了热红外无人机跟踪中的检测-跟踪悖论。未来工作将探索模型压缩、时间信息利用以及在专用边缘设备上的验证。

 

赞(0)
未经允许不得转载:网硕互联帮助中心 » 边缘感知的热红外无人机集群跟踪
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!