沈阳自动化所在复杂场景下视频目标跟踪方法研究方面取得进展

PNPTrack 在复杂场景下跟踪目标
(上方①为PNPTrack(红框)与其他方法在两个不同序列上的跟踪结果对比;下方②—⑤依次为带目标边界框的图像、搜索特征与模板特征的交互结果、搜索特征与正向时空特征的交互结果,以及搜索特征与负向时空特征的交互结果。)
视觉目标跟踪是计算机视觉的一项基础任务,其目标是在连续视频帧中持续定位某一特定物体或区域,在自动驾驶、安防监控等领域具有重要应用价值。然而,受目标形变、遮挡、外观剧烈变化等因素影响,仅依靠初始模板的传统跟踪方法往往鲁棒性不足,通常需要引入历史帧的时空信息来提升跟踪稳定性。
现有方法在利用时空信息时又普遍面临两方面问题:一方面,时空模块与骨干网络深度耦合,往往需要从头进行全参数重训练,训练成本高昂;另一方面,引入专门的时空处理模块会增加推理复杂度,且推理时需在骨干网络之后串行执行,导致推理延迟增大,难以在高性能骨干网络上取得令人满意的效果。
针对这一问题,中国科学院沈阳自动化研究所光电信息技术研究室科研团队提出了一种即插即用的视觉跟踪框架 PNPTrack,该方法在无需全参数重训练,也无需额外引入时空处理模块的前提下,仍能有效利用时空信息提升跟踪的稳定性和精度。
科研团队将骨干网络的编码器划分为浅层与深层两部分:浅层编码器在训练中保持冻结、不参与时空交互,从而大幅减少可训练参数和训练资源;深层编码器则通过正向时空特征与负向时空特征完成时空信息的整合。
科研团队采取了以下方式让正向时空特征与负向时空特征各自发挥作用。一方面,通过正向时空特征提取与目标相关的信息,用于增强目标响应,帮助模型在复杂场景下更准确地识别目标;另一方面,通过负向时空特征提取背景信息,用于抑制背景干扰、细化目标边界。两类时空特征分别与搜索区域特征进行独立的交互计算,避免相互抑制。同时,科研团队将时空特征的“提取”与“利用”过程解耦,二者可在网络内部并行执行,从而降低对推理速度的影响。
该方法并非简单地将时空信息与原有匹配信息叠加在一起,而是让两者“各司其职”。时空特征主要负责对搜索区域特征进行增强与抑制的调整——增强目标相关响应、抑制背景干扰,同时尽量不改变原有的模板与搜索特征匹配过程,从而减少单一信息不准确带来的影响。得益于这一设计,模型在推理时可以自由开启或关闭时空特征:关闭后即可恢复为原始跟踪器,无需重新加载模型或调整参数,真正实现即插即用。
科研团队在多个公开视觉跟踪数据集上进行了测试。结果显示,该方法在 GOT-10k、LaSOT、LaSOText 等主流数据集上均取得了领先水平的性能。在仅使用 GOT-10k 官方训练集训练时,平均重叠率(AO)达 75.8%。在骨干网络通用性测试中,该方法在 ViT、HiViT、Fast-iTPN 等多种骨干网络上均实现了稳定的性能提升。实验还显示,该方法仅需引入少量额外的投影参数,即可在保持较高推理速度的同时提升跟踪精度。
该研究为兼顾跟踪精度与计算效率提供了新的技术思路。通过有针对性地挖掘并利用目标和背景的历史信息,该方法能够以较低的模型升级成本改善复杂场景下的跟踪表现,可为智能监控、移动机器人与自动驾驶等领域的视觉感知技术发展提供参考。
相关成果以 Adaptive Positive-Negative Spatiotemporal Attention Feature Modulation for Plug-and-Play Visual Tracking为题发表于期刊 Expert Systems with Applications。沈阳自动化所博士研究生时健为论文第一作者,罗海波研究员为通讯作者。(光电信息技术研究室)
论文链接:https://doi.org/10.1016/j.eswa.2026.134042
DOI:10.1016/j.eswa.2026.134042
附件下载: