走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」

机器之心 2026-09-05 12:01
走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图1


短途还能走对,路一长就乱了。UrbanGround 把大模型放进用香港真实三维数据搭建的城市沙盒。短程导航最高成功率为 75.0%,长程却只剩 0% 到 3.8%。模型像是「走两步,就忘了路」:刚才还知道往哪走,转过几个路口,前面的判断就接不上了。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图2

图 1 UrbanGround 以香港真实三维地理数据为底座,支持第一人称探索、全局地图、昼夜与天气切换,以及行人移动。


如今的大模型,认出城市街景里的地标已经不算难。在 UrbanGround 中,10 个模型的视觉识别准确率为 75.0% 到 93.8%。如果只看一张图,它们答得相当不错。


可一旦真让它们上街找路,情况就变了。短程导航中,表现最好的模型能完成 75.0% 的任务。路线拉长后,10 个模型的成功率都落在 0% 到 3.8% 之间。「走两步,就忘了路」,说的正是这种反差:眼前几步能走对,前面作出的判断却很难一路带到终点。


为了弄清这种反差从哪里来,上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学和牛津大学的研究团队推出了 UrbanGround。团队把香港的真实三维地理数据做成一座可以连续行走的城市沙盒。模型从第一人称看街景、查地图、过天桥,也会撞墙、遇到封路和移动行人。到了这里,答对问题只是起点,真正的考验是能不能把路走完。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图3




这一次,模型不只要看懂街景,还得把路走完


过去的城市空间智能评测,很多停在单张街景或航拍图上。模型只需回答眼前的问题,不用真的走出下一步。即使是导航,视角也常沿着预设节点切换,模型并没有真的在一座连续的城市里一步步找路。


UrbanGround 由地理层、仿真层和智能体层组成。


地理层以香港地政总署公开的 3D Visualisation Map 和 3D Pedestrian Network 为底图,把地理坐标、三维网格和步行网络对齐到同一套沙盒坐标中。


仿真层把地图变成一座可以走进去的城市。建筑、墙体、坡道和地形起伏都会影响行动。同一地点可以切换昼夜和天气,道路也能在途中封闭,行人会沿步行网络移动。研究者可以反复跑同一条路线,只改天气、封路或人流,看模型会怎么应对。


智能体层规定了模型每一步能看到什么、能做什么。它只能看到当前的第一人称画面和任务说明,需要时可以打开地图,再选择移动、转向、跳跃或操作地图。地图标出当前位置和目标,却不替它规划路线。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图4

图 2 同一地点可以切换昼夜和天气,行人会沿着步行网络移动,并与模型发生碰撞。


会看街景,为什么还是走不完一条路


UrbanGround 设置了十几类任务,但追问的是同一件事:模型刚刚作出的判断,在转弯、走远或遇到封路后,还管不管用?


论文从空间定位、持续记忆和动态调整三个方面来测。空间定位先问模型有没有弄清眼前的空间关系。认出地标只是第一步,它还得知道地标在自己的哪个方向,才能决定往哪走;持续记忆把路拉长。当地标离开视野,模型要把先前看到的线索、眼前街景和地图重新对上,不能每过一个路口就从头找方向;动态演化再把路况改掉。前方突然封路、行人挡在路上,模型能不能看出原路已经走不通,并及时换路?


研究团队最终整理出 810 个经过人工检查的任务实例,覆盖香港多个城区,并用同一套动作接口测试了 10 个多模态模型。任务从短到长:先看懂眼前,再把判断带进更长的路线,最后还要应付途中变化。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图5

图 3 810 个任务实例分布在香港多个城区


空间定位:认得出地标,却分不清方向


第一组实验只看最短的一段行动。视觉识别测试模型能否认出周围目标,方向理解要求它判断地标相对自己的方位,主动探索则允许它走上几步,补看初始视角里没有的线索。


认东西不算难。10 个模型的视觉识别准确率为 75.0% 到 93.8%,主动探索准确率也达到 46.3% 到 82.5%。只要线索在附近,模型往往能一边看、一边走,完成这段任务。


方向却难得多。10 个模型的方向理解准确率只有 23.3% 到 58.3%。Gemini-3.1-Pro 的视觉识别准确率达到 82.5%,方向理解却只有 23.3%,甚至低于随机猜测。它能认出地标,却不容易在视角转动后判断地标究竟在左边还是右边。还没走远,方向已经可能错了。会认地方,不等于知道该往哪走。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图6

表 1 视觉识别准确率。PNA 指轨迹位于登记行人网络上的动作时间占比


答对了,也不等于走得对。有些模型找到了正确线索,轨迹却离开了行人网络。论文里有个很直观的例子:GPT-5.5 需要回答北京同仁堂旁边是哪家银行。它找到了药房旁的东亚银行,答案没错,探索时却直接横穿马路,离开了步行区域。答案虽对,走法却是现实里不允许的。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图7

图 4 GPT-5.5 答对了银行,却在找线索时直接横穿马路


持续记忆:走两步,就忘了路


第二组实验把路拉长,还加入语言指令、路径限制、地点搜索和多地点规划等任务。形式不同,难点却一样:地标离开视野后,模型还能不能接着判断自己在哪、要往哪走?


短途还走得不错。GPT-5.5 和 Claude-Opus-4.6 的成功率都为 75.0%。一到长路线,10 个模型的成功率只剩 0% 到 3.8%。GPT-5.5 从 75.0% 跌到 0%,Claude-Opus-4.6 从 75.0% 跌到 1.3%。眼前几步会走,不代表整条路走得完。


问题不只是路更长、步骤更多。每次转弯、过街或开关地图,模型都要重新判断自己在哪、目标在哪。它可能连续几步都走对,也可能在一个路口走偏后仍按原方向前进。小偏差一路累积,最后就很难回到正确路线。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图8

表 2 短程导航最高成功率为 75.0%,长程导航中所有模型都不超过 3.8%。八类任务使用同一套城市交互接口。


按起点到目标的距离分组,趋势也很清楚:距离越长,短程导航和指令导航的成功率总体越低。个别模型的曲线会有起伏,所以不能说每多走一步,性能就一定下降。但总体上,路线越长,走偏后没能纠正的情况就越多。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图9

图 5 在同一类任务中,交互距离增加时,成功率总体下降,但各模型的曲线并不完全一致。


如果只看是否到达终点,很容易以为模型一开始就走错了。轨迹却不是这样。长程任务结束时,各模型仍有 52.5% 到 81.3% 的轨迹比起点更靠近目标,可完整成功率只有 0% 到 3.8%。它们往往找对了大方向,也走对了一段,最后还是卡在半路。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图10

图 6 长程导航中,不少轨迹结束时比起点更接近目标,多地点规划也常能完成部分访问,但完整成功率仍接近零。


其中一段 GPT-5.5 轨迹很有代表性。绿篱挡住直行路线后,模型找到了正式坡道,走上结构复杂的天桥,继续朝目标前进。至少这一段,它看懂了道路结构,也选对了路。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图11

图 7 绿篱挡路后,模型找到正式坡道并穿过天桥,这一段走对了。


另一段轨迹则在关键节点出了问题。模型能识别道路,也会调整方向,却在走偏后没有重新规划,错误一直带到任务结束。GPT-5.5 的长程任务中,57.5% 的轨迹最终比起点更接近目标,34.6% 的轨迹把距离缩短了至少 20%。可这些轨迹放在一起,任务结束时的平均剩余距离仍是初始距离的 98.9%,到达率为 0%。一部分轨迹走近了,另一部分则绕得更远,整体几乎没有净进展。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图12

图 8 GPT-5.5 朝目标穿过道路,遇到中央障碍后仍反复向前,直到第 100 步也没重新找到路线。


动态调整:城市已经变了,模型还在走旧路


长路线考验的是前面的判断能不能一直管用。到了动态环境,情况又多了一层:路况变了,模型会不会放弃原来的走法?最后一组实验在模型行动过程中加入封路和移动行人,看它会不会改道、避让。


研究人员先在同一个地点、同一个任务上切换时间和天气。局部问答会有波动,短程导航却没有普遍变差。以 GPT-5.5 为例,晴天、夜晚和阴天的短程成功率分别为 75.0%、75.0% 和 76.3%。这说明前面的长程失败不能简单推给天黑或坏天气。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图13

表 3 相同任务在不同时间和天气下的局部问答与短程导航结果


接着,研究人员在模型走到一半时封路,并放入移动行人。封路任务中,各模型的路网遵循率为 93.0% 到 96.4%,封路遵守率却只有 10.0% 到 46.7%,最终到达率也只有 0% 到 3.3%。移动行人任务中,路网遵循率仍有 90.6% 到 98.5%,碰撞率却高达 76.3% 到 90.0%。这些模型大部分时间仍走在路网上,却不太会因前方封闭及时改道,也常常避不开行人。看见变化还不够,动作必须跟着变。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图14

表 4 模型大部分时间仍在登记行人网络上,但封路遵守率很低,行人碰撞率很高。SPR 指封路后没有穿越关闭线的任务比例,PCR 指行人碰撞率。


会认地标,也会走几步,为什么路一长就乱了


把这些结果放在一起,最值得注意的不是模型「又有几项没做好」,而是同一个判断能不能一直管用。短程导航成功率最高为 75.0%,路线一长,却跌到 0% 到 3.8%。遇到封路和行人后,问题更明显:模型大部分时间仍在路网上走,封路遵守率却只有 10.0% 到 46.7%,碰撞率达到 76.3% 到 90.0%。眼前知道该怎么做,不等于后面会一直照着做。


这也是「走两步,就忘了路」真正指向的地方,模型并非完全不会认路。前一刻作出的判断,常常管不到后面的动作。路线越长、途中变化越多,这种前后接不上的情况就越明显。


要看清问题出在哪,只靠单张图片或预设节点还不够。模型必须在一座连续的城市里自己走,研究者才看得到它从哪一步开始偏,又为什么没能绕回来。


为什么要在真实城市里做一场可重复的实验


真实城市里的机器人实验代价高,也很难让每个模型遇到完全相同的情况。UrbanGround 把这类测试搬进可以重复运行的城市沙盒。同一条路线可以一遍遍重跑,也能只改天气、封路或人流。机器人真正进入城市或园区前,研究者可以先找出它最容易在哪些地方走偏。


沙盒里的街景、三维几何和每一步动作彼此对得上。模型每走一步,下一帧画面都会按同一套城市几何更新。研究者因此能把每一步画面和动作一一对上,看到模型从哪一步开始走偏,又怎样越走越远。


论文、项目主页、代码和 App 都已公开。读者可以像玩开放世界游戏一样在香港街头行走,也可以接入自己的 Agent,看看它在真实城市结构里会怎么走。


走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」图15


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
大模型
more
新品直击|毫秒级避障加多模态大模型,瞳行科技助盲AI眼镜亮相福祉博览会
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
具身智能岗位暴增6至7倍,人才争夺战升温,但薪资仍不及大模型
小白玩转大模型开发(5): Gradio Interface 实战教程
华为WATCH 6 Pro陶瓷白定档9月7日,全瓷设计配盘古大模型重塑穿戴美学
小米玄戒芯片沟通会曝光两款原型机,O100主打端侧大模型高速推理
启发学习:让大模型认知从外化到内生
AI修车?网友实测大模型诊断引擎,被指“赛博朋克”却低效高危
具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型
美团Q2营收破千亿,自研万亿参数大模型落地国产算力集群
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号