沈阳自动化所在域泛化目标检测研究方面取得进展

HierarchicalDG跨模态因果感知层次表征学习框架
目标检测技术能够识别图像中目标物体的类别并定位其空间位置,是自动驾驶、机器人感知、智能监控等领域的关键基础技术。但现实场景中,受天气条件、光照强弱、成像设备差异等因素影响,容易产生数据分布偏移问题,进而造成模型漏检、误检,严重制约实际使用效果。如何基于现有场景数据开展模型训练,提升模型在未知环境下的适应能力,是提高视觉系统实际应用能力的重要问题。
针对这一问题,中国科学院沈阳自动化研究所机器人与智能系统全国重点实验室科研团队提出跨模态因果感知层次表征学习框架Hierarc hicalDG,构建“图像特征—场景注意力—目标表征—视觉子原型—因果原型”的层次学习链路,逐层提炼并迁移视觉语言模型中的知识。相关成果以Cross-Modality Causal-aware Hierarchical Representation Learning for Domain Generalized Object Detection为题发表于国际期刊IEEE Transactions on Pattern Analysis and Machine Intelligence (T-PAMI)。该框架将文本语义作为因果干预信号,在维持类别内部特征多样性的前提下,学习具有稳定语义结构的视觉原型;依托原型机制引导目标分类过程,把类别层面的因果不变性传递至目标与场景表征,从而提升模型对数据分布变化的鲁棒性。实验验证结果显示,该框架在多天气变化、图像扰动、真实图像到艺术图像迁移、跨相机以及仿真到现实五类基准测试任务中,均取得了良好的跨场景泛化效果。同时,推理阶段无需调用视觉语言模型分支,兼顾跨场景泛化性能与推理效率。科研团队进一步在语义分割和目标跟踪任务中开展了拓展验证,验证了该学习范式的跨任务适用性,为提升复杂环境下视觉感知模型的泛化能力提供了新的技术思路。该该论文第一作者为博士研究生刘雅静,通讯作者为田建东研究员。
机器智能研究组长期聚焦计算机视觉与具身智能等前沿方向,在复杂场景视觉感知、具身导航和机器人操作、偏振图像处理等领域持续取得原创性成果,相关论文陆续发表于人工智能与计算机视觉领域AAAI 2026、ICML 2026、CVPR 2026、ICLR 2026等国际顶级学术会议,以及TPAMI、TIP、TCYB、TNNLS、TMM、TSP等国际顶级学术期刊。(机器人学研究室)。
论文链接:https://ieeexplore.ieee.org/abstract/document/11690989
DOI: 10.1109/TPAMI.2026.3733780
附件下载: