沈阳自动化所在机器人视觉语言导航领域研究取得进展

发布时间:2026-09-03

隐式指令推理迭代具身导航示意图


基于动态演化具身导航原型知识终身学习架构


视觉语言导航(Vision-and-Language Navigation,VLN)目标是让机器人能够理解人类自然语言指令,并结合视觉感知在复杂三维环境中自主导航,是具身智能实现自然人机交互和自主决策的重要基础,在家庭服务、智能制造等领域具有广阔应用前景。

近期,中国科学院沈阳自动化研究所科研团队围绕具身导航中的意图推理与持续自主学习开展研究,分别提出了具有隐式指令推理能力的导航智能体ReasonWalker,以及具有持续知识积累与自主进化能力的终身导航智能体EverWalker,推动视觉语言导航机器人由“执行明确指令”向“理解用户意图”,由“一次训练固定使用”向“长期学习持续进化”发展。

现有视觉语言导航主要依赖明确、逐步指令,难以真正理解用户高层意图,针对这一问题,科研团队提出了推理迭代导航新范式及ReasonWalker导航模型,将机器人导航由传统的“路径指令跟随”进一步拓展为面向用户需求的意图理解与自主推理决策。科研团队构建了可持续更新的显式场景记忆,将机器人在长期导航过程中获得的空间结构、物体语义及区域关联转化为可复用的场景知识,并进一步借助预训练大模型的能力,对用户指令、实时视觉观测与场景记忆进行统一建模和联合推理,形成“意图理解—场景关联—目标推断—动作决策”的完整认知闭环,使导航机器人由听懂怎么走迈向理解为什么走、判断去哪里并自主决定怎么走。

面向机器人长期自主运行的核心问题,科研团队探索导航智能体突破“一次训练、能力固化”的传统模式,实现知识不断积累、能力持续增强的终身自主进化。他们提出了终身视觉语言导航新范式,并设计EverWalker终身导航智能体,让机器人可以在动态变化的环境里不断吸纳全新经验,同时留存、重组过往习得知识。科研团队构建了动态演化的原型化导航知识空间,把多场景下可迁移的导航经验凝练压缩为知识原型,支持原型随新场景自动扩展迭代,实现跨场景知识沉淀复用;通过原型条件超网络,智能体依据实时观测检索、组合相关知识,动态生成适配当前场景与任务状态的运行参数,无需预先知晓任务类型,即可完成自适应调整。

ReasonWalker的相关研究以ReasonWalker: Reasoning Iterative Vision-and-Language Navigation with Implicit Instructions为题发表于国际期刊IEEE Transactions on Cybernetics。博士生王旭东为论文第一作者,韩志研究员为通讯作者。

EverWalker的相关研究以Evolving the Prototype Journey: Lifelong Vision-and-Language Navigation with Prototype Adaptation为题发表于国际期刊IEEE Transactions on Circuits and Systems for Video Technology,实习生李干和博士生王旭东为论文共同第一作者,韩志研究员为通讯作者。

科研团队长期聚焦于机器人具身智能研究,致力于提升机器人在开放、动态和长期运行环境中的自主感知、推理、决策及持续学习能力,在机器人具身导航、具身操作等领域持续取得原创性成果,提出的Uni-Walker、AlldayWalker、SkillsCrafter算法已被 ICLR 2026、AAAI 2026 等国际学术会议录用。相关研究得到国家重点研发计划、国家自然科学基金、沈阳自动化所基础研究计划等项目的资助。(机器人学研究室)

ReasonWalker 论文链接:https://ieeexplore.ieee.org/document/11655574

DOI:10.1109/TCYB.2026.3721071


EverWalker 论文链接:https://ieeexplore.ieee.org/document/11667662

DOI:10.1109/TCSVT.2026.3727681



附件下载: