AdvNav揭示具身智能导航系统的潜在安全风险

香港科技大学(广州)团队提出的 AdvNav 在不访问模型内部信息的前提下,通过行为引导的黑盒攻击验证了视觉语言导航系统的视觉脆弱性,并在 R2R 数据集上对 HAMT 与 MapGPT 取得最高 87.30% 的攻击成功率。

具身智能机器人正把“看见并理解环境”作为行动前提,但一篇被 ACM Multimedia 2026 录用的论文指出,这种对视觉输入的高度依赖可能成为系统性弱点。香港科技大学(广州)团队提出的 AdvNav,是一个面向视觉语言导航任务的黑盒对抗攻击框架,其目标不是侵入模型,而是通过干扰导航智能体的第一人称画面,观察其行为变化并据此迭代优化扰动。

AdvNav揭示具身智能导航系统的潜在安全风险主题相关图片
来自网络

与图像分类中“输入一张图、立即得到结果”的攻击场景不同,视觉语言导航是典型的多步时序决策任务。智能体需要同时理解画面和自然语言指令,还要依据历史轨迹决定下一步。某一步的小错误未必立即导致失败,智能体可能靠后续推理自我修正;同时,任务是否失败的反馈往往要等整段导航结束后才能获得。这些特点使传统依赖梯度或单步输出的攻击方法难以直接迁移。

AdvNav 的约束因此更为现实:不访问模型参数和梯度,只利用可观察的输入与输出。为了在没有梯度的情况下得到可用的优化信号,该方法设计了一种双粒度行为反馈,包括三部分:

  • 轨迹级性能得分:以导航误差和路径加权成功率等指标衡量整段导航的退化程度;
  • 动作级奖励得分:观察每一步动作概率,捕捉“正确动作信心下降”这类尚未表现为轨迹偏差的软失败;
  • 偏差指示:判断实际路径是否已偏离干净条件下的轨迹,用于区分真正的走错和单纯的置信度波动。

这些反馈共同引导一种混合优化策略:一方面自适应调整扰动强度,另一方面用遗传算法演化噪声的空间结构。论文提到,AdvNav 使用空间上较为连贯的 Perlin 噪声,而非高频随机像素噪声,使扰动在视觉上更隐蔽,同时能持续干扰智能体的感知与决策循环。

在 Room-to-Room(R2R)数据集上,研究团队对两类代表性模型进行了测试:基于 Transformer 的 HAMT,以及基于大语言模型的 MapGPT。结果显示,AdvNav 对 HAMT 的攻击成功率为 49.70%,对采用 Qwen3-VL 和 GPT-4V 后端的 MapGPT 分别为 65.96% 和 87.30%。也就是说,攻击者无需接触模型内部,仅凭行为观察就能显著提升导航失败概率,且推理能力更强的大模型版本反而更易受此类视觉扰动影响。

论文作者为 Chenyang Li、Kaige Li、Zeyu Jiang 和 Changhao Chen,预印本已发布在 arXiv。这项工作的意义更多在于“压力测试”:它表明当前视觉语言导航系统普遍存在感知层面的脆弱性,为后续设计更具鲁棒性的具身智能系统提供了参照。若医院配送、仓储搬运或家用服务机器人要在真实光照、遮挡和镜头污染等条件下稳定运行,视觉通道的抗扰动能力就不应被当作默认前提。