给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!

3D视觉工坊 2026-10-06 00:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

作者供稿直发 | 来源:3D视觉工坊

3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图1

给机器人一张 360° 全景图 ,它就能更可靠地听懂指令、找到路吗?

我们的出发点很直接: 更完整的视觉上下文,应该让导航决策更有依据。 当目标通道位于侧面时,全景能提前呈现入口和后续路线,机器人有机会在额外转身探索之前,就判断该往哪里走。

但实验发现: 沿用以往的VLN训练与执行方式,只把透视图换成全景,收益仍然有限。 问题随之变得清楚——周围的信息已经看见了,导航策略却还没有学会充分利用它。

围绕这个问题,我们来自浙江大学与香港大学的团队提出了 PanoVLN :让动作规划、训练数据和空间表示一起适应全景。采用 4B 视觉语言主干、RGB-only 视觉输入 ,模型在两大导航基准上取得领先结果,并在真实机器狗上实现更连贯的导航。

给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图2PanoVLN:更完整的视觉上下文,为导航提供更充分的决策依据

论文:PanoVLN: Towards Effective Panoramic Vision\-and\-Language Navigation

作者:Zhen Wang、Changpeng Wang、Zhe Liu、Zhangyang Qi、Yuxiang Lu、Zimo Zeng、Donglian Qi、Xi Chen

单位: 浙江大学、香港大学

HomePage: https://wangzhen-w.github.io/PanoVLN/

Code: https://github.com/wangzhen-w/PanoVLN

arXiv: https://arxiv.org/abs/2609.34759

Model: https://huggingface.co/wangzhen-w/PanoVLN

Dataset:https://huggingface.co/datasets/wangzhen-w/PanoVLN

01|三个关键改动,让全景真正参与决策

看得更全,也要规划得更远

一张全景可以呈现多个方向的路线,为更长时域的动作规划提供依据。例如,路线朝侧面转向时,全景已经能提供下一段移动所需的线索。

短动作目标却可能让这些信息派不上用场。 通往不同方向的路线,开头都可能是“先往前走”。只预测眼前几步,模型主要看正前方,也可能给出正确动作。

我们因此延长训练时的目标动作序列,让预测覆盖后续的路线选择。模型要判断接下来沿哪条路走,就需要结合指令,利用不同方向的路线信息。

注意力对比直观地呈现了这种变化: 短序列模型接收的是全景,使用方式却仍像透视策略,主要关注正前方;PanoVLN 则能根据指令,关注前方视野之外的目标通道。

给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图3同一全景、同一指令:短序列模型主要关注前方,PanoVLN 关注到与指令相关的侧面通道

动作长度消融中,透视策略在预测 4 个动作 时表现最佳,全景策略则更适合 18 个动作 。执行时,我们再用 置信度引导执行(CGE) ,根据预测的可靠程度决定走多少步后重新观察,让较长的规划与灵活的执行配合起来。

岔路看得更多,就专门训练选路

全景在分岔处尤其有用:多个方向的通道同时可见,模型需要结合指令选中正确的一条。

为此,我们在 800 个 HM3D 场景中构建约 9.8 万条轨迹 ,增加分岔决策,配上明确指定目标入口的指令,并加强转弯与停止附近的监督。训练任务由此反复教会模型:从眼前的多个选项中,选出指令要求的路线。

看懂地标,更要看懂空间关系

导航既需要认出门、桌子和通道,也需要理解它们如何组成一条可走的路线。

PanoVLN 融合来自 同一张 RGB 全景 的两类信息:视觉语言模型提供场景语义,冻结的 PanoVGGT 编码器提供几何特征。两者按对应区域对齐, 无需额外深度输入,也不增加视觉 token 数量 。

给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图4PanoVLN 整体架构:语义与几何融合,预测较长动作序列,由 CGE 决定本轮执行长度

02|双基准 SOTA:4B 模型,成功率达 77.3% / 78.0%

采用 Qwen3.5-4B 主干,完整 PanoVLN 在 R2R-CE / RxR-CE Val-Unseen 上的成功率分别达到 77.3% / 78.0% ,较论文比较表中的此前最好结果提高 11.9 / 8.7 个百分点 。

这些测试场景没有出现在训练中。即使只使用 R2R-CE 与 RxR-CE 导航数据,PanoVLN† 的成功率也达到 73.9% / 74.1% ;加入我们构建的数据后,性能进一步提升。

给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图5未见场景导航结果:SR 为成功率,SPL 同时衡量成功与路径效率;† 表示未使用 R2R-CE / RxR-CE 之外的导航数据

03|走出仿真:机器狗更会选路,也更少停顿

我们将 PanoVLN 部署到 Unitree Go2 ,搭配 Insta360 X5 全景相机与远程 RTX 3090,在办公室、走廊和校园中测试, 无需针对测试场景专门微调 。

下面这组连续帧展示了一个校园案例:机器人根据指令直行,找到左侧的棕色躺椅,并到目标旁停止。上排是行进过程,下排是对应的全景观察。

给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图6真机导航连续帧:根据指令直行,前往左侧目标并停止

收益也体现在移动过程中。在同步执行测试中,PanoVLN 的平均导航耗时为 86.4 秒 ,平均策略调用 7.4 次 ;StreamVLN 的对应值为 117.8 秒、34.3 次 。等待时间占比也从 27.1% 降到 13.6% 。

有把握时连续走一段,再根据预测可靠程度决定何时重新观察。 这减少了反复请求模型带来的等待,让机器人的行进更连贯。

给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图7真机执行效率:导航耗时、策略调用次数与等待时间对比;单次推理延迟不含网络通信

代码、模型与数据已开源

PanoVLN 的核心发现是: 更完整的视觉输入,需要与之匹配的学习和决策方式。 当模型学会利用不同方向的路线、入口和空间关系,全景才能转化为更准确、更连贯的导航。

训练与数据生成代码、评测和真机部署流程、模型权重及训练数据均已公开。

本文仅做学术分享,如有侵权,请联系删文。

。

给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图8给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图9给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图10给机器人360°视野,为什么还是走不好?浙大&港大开源PanoVLN,4B模型拿下双基准 SOTA!图11

扫码添加微信,备注:姓名+方向+单位,邀请入群。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源 机器人
more
黄仁勋驳斥AI末日论:警惕恐慌阻碍产业落地,能源与开源成关键变量
开源项目d4r实现AMD显卡运行DLSS 4,FP8原生支持成关键突破
比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA
刚刚,320B中国开源黑马杀出!模型自己抓Bug,凶手是一个空格
开源王座易主?小米罗福莉发新模型:工程难度超DeepSeek-R1
Meta开源Muse硬件接口:从“聊天机器人”到“具身智能”的野心跃迁
亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源
淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作
「开源版Jev」登上Hugging Face热榜第一
魔搭开源动态检索新框架,无需预构建向量索引,知识库还能自己进化
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号