走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」
机器之心 · 人工智能
机器之心 2026-09-05 12:02 北京 「像玩开放世界游戏一样在香港街头行走」。 短途还能走对,路一长就乱了。UrbanGround 把大模型放进用香港真实三维数据搭建的城市沙盒。短程导航最高成功率为 75.0%,长程却只剩 0% 到 3.8%。模型像是「走两步,就忘了路」:刚才还知道往哪走,转过几个路口,前面的判断就接不上了。 图 1 UrbanGround 以香港真实三维地理数据为底座,支持第一人称探索、全局地图、昼夜与天气切换,以及行人移动。 如今的大模型,认出城市街景里的地标已经不算难。在 UrbanGround 中,10 个模型的视觉识别准确率为 75.0% 到 93.8%。如果只看一张图,它们答得相当不错。 可一旦真让它们上街找路,情况就变了。短程导航中,表现最好的模型能完成 75.0% 的任务。路线拉长后,10 个模型的成功率都落在 0% 到 3.8% 之间。「走两步,就忘了路」,说的正是这种反差:眼前几步能走对,前面作出的判断却很难一路带到终点。 为了弄清这种反差从哪里来, 上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学和牛津大学的研究团队推出了 UrbanGround。 团队把香港的真实三维地理数据做成一座可以连续行走的城市沙盒。模型从第一人称看街景、查地图、过天桥,也会撞墙、遇到封路和移动行人。到了这里,答对问题只是起点,真正的考验是能不能把路走完。 项目地址: https://urbanground.github.io 论文链接: https://arxiv.org/abs/2608.27456 Huggingface: https://huggingface.co/papers/2608.27456 代码地址: https://github.com/UrbanGround/UrbanGround App链接: https://github.com/UrbanGround/UrbanGround/releases 这一次,模型不只要看懂街景,还得把路走完 过去的城市空间智能评测,很多停在单张街景或航拍图上。模型只需回答眼前的问题,不用真的走出下一步。即使是导航,视角也常沿着预设节点切换,模型并没有真的在一座连续的城市里一步步找路。 UrbanGround 由地理层、仿真层和智能体层组成。 地理层 以香港地政总署公开的 3D Visualisation Map 和 3D Pedestrian Network 为底图,把地理坐标、三维网格和步行网络对齐到同一套沙盒坐标中。 仿真层 把地图变成一座可以走进去的城市。建筑、墙体、坡道和地形起伏都会影响行动。同一地点可以切换昼夜和天气,道路也能在途中封闭,行人会沿步行网络移动。研究者可以反复跑同一条路线,只改天气、封路或人流,看模型会怎么应对。 智能体层 规定了模型每一步能看到什么、能做什么。它只能看到当前的第一人称画面和任务说明,需要时可以打开地图,再选择移动、转向、跳跃或操作地图。地图标出当前位置和目标,却不替它规划路线。 图 2 同一地点可以切换昼夜和天气,行人会沿着步行网络移动,并与模型发生碰撞。 会看街景,为什么还是走不完一条路 UrbanGround 设置了十几类任务,但追问的是同一件事: 模型刚刚作出的判断,在转弯、走远或遇到封路后,还管不管用? 论文从 空间定位、持续记忆和动态调整 三个方面来测。空间定位先问模型有没有弄清眼前的空间关系。认出地标只是第一步,它还得知道地标在自己的哪个方向,才能决定往哪走;持续记忆把路拉长。当地标离开视野,模型要把先前看到的线索、眼前街景和地图重新对上,不能每过一个路口就从头找方向;动态演化再把路况改掉。前方突然封路、行人挡在路上,模型能不能看出原路已经走不通,并及时换路? 研究团队最终整理出 810 个 经过人工检查的任务实例,覆盖香港多个城区,并用同一套动作接口测试了 10 个多模态模型。任务从短到长:先看懂眼前,再把判断带进更长的路线,最后还要应付途中变化。 图 3 810 个任务实例分布在香港多个城区 空间定位:认得出地标,却分不清方向 第一组实验只看最短的一段行动。视觉识别测试模型能否认出周围目标,方向理解要求它判断地标相对自己的方位,主动探索则允许它走上几步,补看初始视角里没有的线索。 认东西不算难。10 个模型的视觉识别准确率为 75.0% 到 93.8%,主动探索准确率也达到 46.3% 到 82.5%。只要线索在附近,模型往往能一边看、一边走,完成这段任务。 方向却难得多。10 个模型的方向理解准确率只有 23.3% 到 58.3%。Gemini-3.1-Pro 的视觉识别准确率达到 82.5%,方向理解却只有 23.3%,甚至低于随机猜测。它能认出地标,却不容易在视角转动后判断