根据互联网公开信息整理:9月27日,IROS 2026将在匹兹堡开幕。时隔31年,这场全球规模最大的机器人学术会议之一重回“钢铁之城”,正式议程论文达到1933篇,而投稿总数高达4348篇,最终录用1585篇,录用率仅36.45%,为近年最低。把这近两千篇论文铺开,它更像一张2026年机器人研究的横截面:从强化学习、模仿学习,到路径规划、视觉感知、运动控制、灵巧操作,再到人形机器人、触觉和大模型,过去几年几乎所有重要技术路线都同时出现在这张图谱里。但真正值得注意的,并不是Humanoid、VLA或World Model这些更容易获得产业和媒体关注的关键词。对1933篇论文进行多标签梳理后可以看到:Robot Learning/Embodied AI相关论文约809篇,Navigation/Planning约564篇,Perception/Vision约556篇,Control/Dynamics约546篇,Manipulation约520篇,而Humanoid/Legged仅约213篇。这些数字不能简单相加,但它们说明了一件事:大模型没有吃掉机器人学,反而更深地嵌入了感知、规划、控制与操作。
这种“嵌入”不是一句空话,而是体现在论文之间的交叉关系里。Robot Learning与Manipulation同时出现的论文约276篇,与Perception交叉约269篇,与Navigation/Planning交叉约225篇,与Control/Dynamics交叉也有221篇。学习方法没有简单挤压掉机器人原有的技术模块,反而越来越深地钻进这些传统问题之中。比如石溪大学Jorge Mendez-Mendez的《A Systematic Study of Large Language Models for Task and Motion Planning with PDDLStream》,系统测试了大语言模型嵌入传统Task and Motion Planning框架后的表现。结论并不是“大模型可以直接取代规划器”,反而显示:几何约束、运动可行性和执行逻辑仍需要传统规划体系参与,LLM可以理解“把杯子拿到桌子另一边”是什么意思,但机器人真正执行时,还必须回答会不会碰撞、关节是否可达、路径能否执行、环境有没有变化。 问题因此从“LLM能不能替代Planner”,变成了两者应该如何分工。控制端同样如此:中佛罗里达大学等团队的《Training Fast Robot Policies with Slow Foundation Models》让大型模型更多参与训练,再学习一个更轻、更快的策略负责实际执行——因为语言模型晚几百毫秒用户只会觉得反应慢,机器人在抓取、接触或保持平衡时晚几百毫秒,任务可能已经失败。
VLA也在从“证明能做”进入“补短板”阶段。在多标签统计中,VLA、VLM、LLM和Foundation Model相关论文约162篇,占全部论文的8.4%,其中明确涉及VLA的约82篇。这个规模已经足以形成一条独立研究主线,但它们关注的问题不再停留在“模型还能不能更大”,而是迅速分化到效率、三维理解、长时记忆、视角变化、现实适应和安全。进入Best Paper候选的Shallow-π通过知识蒸馏压缩VLA,解决模型太大、推理太慢的问题;天津大学、原力灵机与清华团队的GeoVLA显式加入深度和三维几何信息,把3D representation与视觉语言特征共同用于动作生成;首尔大学与MIT的AnyCamVLA研究摄像机位置改变后VLA为何失效;南京大学、早稻田大学等团队的Long-Term Memory把长期记忆接入VLA Agent;成均馆大学的RoboBRIDGE则在预训练策略外围加入Monitor、Perceptor、Planner、Controller和Robot Interface。这些工作指向同一个判断:VLA接下来的竞争不只是scaling,而是system engineering——一个VLA如何与感知、记忆、规划、控制和硬件共同工作,最终从一个能输出动作的模型,变成能长期运行的机器人系统。
与此同时,机器人正在重新长出“中间层”。Reasoning/Memory相关论文约119篇,占6.2%,其中Reasoning约64篇,Memory约36篇,已经形成一批明确Session。如果端到端模型已经可以直接从视觉和语言生成动作,为什么还需要Reasoning、Memory、Planner,甚至重新引入Symbolic Constraint和显式3D representation?原因在于,机器人任务一旦变长,“当前这一帧看到什么”就不再足够。西交利物浦大学的TempoFit利用temporal KV memory让现有策略跨时间保存历史信息;东京理科大学的GaussMemory把Memory放进三维空间——物体即使暂时被遮挡,也不能从机器人的“世界”里消失;香港科技大学(广州)与华为的DualCoT-VLA在动作生成前加入视觉Chain-of-Thought和语言Chain-of-Thought;纽约州立大学布法罗分校团队的VL-Nav把视觉语言模型的语义理解与显式空间、符号推理结合,获得本届认知机器人最佳论文奖——让神经网络只承担开放世界的感知,把空间与语义关系的推断交给结构化符号推理,两者分工而非端到端黑箱,同年该团队在ReS AI Workshop上以同一思路的长时程任务规划工作IFLAX再获最佳论文,形成方法呼应。这些工作表面上技术不同,但都在解决同一个结构性问题:高层语义理解和低层连续动作之间存在巨大距离。机器人学正在重新发明大模型与低层控制之间的中间层,端到端没有简单失败,模块化也没有简单复辟,而是随着任务从单步抓取走向长时操作,系统重新出现层级。Manipulation则成为最密集的战场之一:相关论文约520篇,Dexterous/Tactile等方向约225篇,其中Tactile约91篇,Dexterous约52篇。普渡大学与哥伦比亚大学的VTAP Gripper没有追求极高自由度拟人手,而是用三根可重构柔性手指和主动视觉触觉掌面完成抓取和手内操作;北京理工大学的PDS Joint从关节结构切入灵巧手设计;普渡大学与意大利理工学院的TacVLA把触觉直接送进VLA;斯科尔科沃科学技术学院的HapticVLA则在训练阶段使用触觉,推理阶段不再强制依赖实时触觉。触觉、学习、感知和控制正在同一批操作任务里不断汇合。
Humanoid也在从“会走”向“边走边干活”扩展。统计中,Humanoid/Loco-Manipulation相关论文约89篇,占4.6%,其中46篇与Control交叉,44篇与Learning交叉,34篇涉及Manipulation,32篇涉及Planning。加州大学圣迭戈分校团队的SteadyTray获得本届最佳移动操作论文奖,它把locomotion与payload stabilization显式解耦——基础行走策略负责走路,额外的残差策略只学用上半身动作抵消末端执行器处的步态扰动,仿真中变速度跟踪成功率96.9%、抗外力扰动鲁棒性74.5%,并在宇树G1上实现零样本sim-to-real迁移。清华大学张智楷等人牵头的LATENT获得最佳娱乐与趣味论文奖,用在线蒸馏构建“可修正潜动作空间”,从不完美的人类动作数据中学习人形网球技能,29自由度宇树G1上正手成功率96.52(最强基线PULSE 71.85),真机人机对拉最高90.90%,机器人自对打最多连续25个回合。人形机器人不能只拥有一套稳定步态再简单“加两只手”,真正的whole-body intelligence要求腿、躯干和手臂围绕任务共同运动。 而World Model虽然讨论热度很高,但明确相关论文只有19篇,约占1%。它开始出现在四足运动、灵巧操作、精密插接、人形whole-body control、医疗机器人和导航中。机器人真正需要的不是视觉上合理的未来,而是动作条件下、几何上和物理上足够可信的未来。World Model目前更像一条从预测世界向参与控制过渡的技术路线,而不是已经统治机器人研究的方法。
把这些研究放在一起看,IROS 2026最值得注意的并不是某一种技术路线正在“赢”。VLA没有取代传统规划和控制,World Model还没有成为主流,Humanoid也只是整个机器人研究版图中的一部分。真正发生的变化是:这些新方法进入物理世界以后,感知、记忆、规划、控制、触觉、安全和恢复这些问题重新变得不可回避。语言模型过去几年的成功,很大程度上来自把大量任务统一进一个模型;但机器人不同,它不仅要“理解”,还要真正行动,而物理世界会把误差、延迟、接触和失败全部暴露出来。所以,IROS 2026更像是在回答一个新的问题:当模型已经足够强以后,怎样把这些能力重新拼成一个真正能工作的机器人系统。这并不意味着端到端失败了,也不意味着传统模块重新占据主导,更准确地说,机器人正在重新寻找大模型、规划、控制和硬件之间的边界。未来的竞争,可能不再只是比谁的模型更大、能力更多,而是谁能把这些能力真正稳定地组合起来。当机器人越来越聪明以后,真正困难的开始变成:怎么让它不出错。
那么,该如何系统学习三维视觉、具身智能等前沿3D视觉技术呢?今天就给大家推荐一个专业、干货满满的学习圈子————「3D视觉从入门到精通」知识星球,这里不仅有SLAM和3DGS的学习资料,还覆盖了自动驾驶、具身智能、无人机、机械臂抓取等方向的干货资料。
经常有粉丝问这样一个问题:
「3D视觉从入门到精通」知识星球,里面有什么内容? 加入星球,是不是可以学习视频课程呢?有哪些会员权益? 以下将给大家详细介绍?(注:扫码加入后,可在知识星球APP/网页端微信登录,即可进入星球)
今天,咱们一起聊一聊这个沉淀了近9年的3D视觉技术圈子。
一 什么是知识星球?
知识星球是一个高度活跃的社区平台,在这里你可以和相同研究方向的小伙伴一起探讨科研工作难题、交流最新领域进展、分享3D视觉最新顶会论文&代码资料、分享视频(讲解3D视觉重要知识点)、发布高质量的求职就业信息,承接项目等,当然还可以侃侃而谈,吐槽学习工作生活。
二 「3D视觉从入门到精通」知识星球
目前已有近6300+活跃成员,主要涉及方向:工业3D视觉、SLAM、自动驾驶、三维重建、无人机、具身智能、大模型等科技前沿方向。


细分方向众多,包括但不限于:工业3D视觉、三维重建、自动驾驶、具身智能、大模型、扩散模型等科技前沿方向,也涉及视觉竞赛、硬件选型、视觉产品落地经验分享、学术&求职交流等。我们也会紧跟最新前沿科技发展,也是我们星球里的热门讨论话题。

三 星球内全系列视频教程汇总

视频教程分为两大板块:第一板块为核心主线课程,精心打磨了近20门系列视频教程,内容系统、循序渐进,更是大家学习的重点,带你学习工业3D视觉、SLAM、3DGS、自动驾驶与无人机等3D视觉技术,下面我们会详细介绍这部分内容;第二板块为前沿技术分享,特邀行业大咖与学术大牛开展直播分享,内容全面覆盖具身智能、自动驾驶、三维重建、数字人、扩散模型、3D生成等热门前沿方向,本部分为非重点内容,不再做详细介绍。
3.0 3DGS独家视频教程
3.0.1 3DGS三维重建系列视频教程

3.0.2 基于NeRF、3DGS三维重建的SLAM算法视频教程
本视频教程从理论和代码实现两方面展开,带你从零入门NeRF/Gaussian Based SLAM的原理学习、论文阅读、代码梳理等。理论层面,从线性代数入手到传统的计算机图形学,让大家明了现代三维重建的理论基础和源头;代码层面通过多个练习手把手教会大家复现计算机图形学、NeRF相关工作。

3.1 基础课程
3.1.1 高精度相机标定从理论到实战系统教程
本课程主要包含两部分,分别是相机标定和3D视觉,相机标定包含单目、双目和鱼眼相机标定;3D视觉包含立体视觉、结构光和TOF,以立体视觉为主。课程提供对应数据与代码。
课程亮点:除了相机标定的基础原理和代码之外,星球里还补充了高精度相机标定的改进方法以及实战技巧,这是相当硬核的。

3.1.2 ROS2从入门到实战视频教程
ROS2从入门到实战视频教程,从小白方式介绍到高阶使用讲解,对ROS2进行全面的实操教学训练,为大家提供系统性的学习机会。

3.1.3 四旋翼飞行器:算法与实战

3.1.4 C++从零基础入门到进阶
力求通过视频教程的学习,彻底搞懂C++较难的一些模块,掌握SLAM等算法的编写套路,学会C++相关岗位的面试技巧。学懂本课程,并且对其中的疑难点能够较好的理解运用,可以达到1-2年的C++开发工程师的经验水平。

3.2 工业3D视觉系列视频课程
3.2.1 基于面结构光三维重建系列视频


3.2.2 机械臂抓取、三维点云、三维重建等

3.2.3 线结构光(单双目)三维重建系统教程等
本门课程面向实战教学,手把手带你从零实现一套属于自己的线激光3D扫描系统。几乎每一个章节都配备有相应的讲义、代码,帮助大家更好地理解线激光三维重建技术。

3.3 SLAM系列视频
3.3.1 如何轻松拿捏LIO-SAM?(提供注释版本代码)

3.3.2 彻底剖析激光-视觉-IMU-GPS融合SLAM算法
本视频课程从理论和代码实现两个方面对激光雷达-视觉IMU-GPS融合的SLAM算法框架和技术难点进行讲解,并且博士大佬会根据自己多年的机器人工程经验,向大家讲解在实际机器人应用中多模态融合的方法和技巧。

3.3.3 ORB-SLAM3理论基础+关键技术详解

3.3.4 视觉-惯性SLAM:VINS-Fusion原理精讲
视觉-惯性SLAM的入门与实践视频教程,结合VINS-Fusion源码,系统地对视觉-惯性SLAM的基础理论知识进行梳理。整套课程由一线算法工程师教授,从基础理论到代码剖析,保姆级教学,助力学员一步步从小白成长为大牛。

3.4 自动驾驶
3.4.1 面向自动驾驶领域的多传感器融合系统教程
主要分两个大模块:理论篇和实战篇,理论篇部分主要介绍自动驾驶中常用的传感器硬件、传感器间的时间同步和空间同步以及多传感器间的信息融合理论知识;实战篇更多偏向工程应用,工程中传感器间同步与融合如何实现等。

3.4.2 面向自动驾驶领域的3D点云深度学习目标检测
本视频教程以3D点云深度学习为主,对Point-based和Voxel-based系列的3D目标检测网络架构进行系统剖析和代码梳理,助力各位同学在点云深度学习更快的入门和更深的理解。

3.4.3 单目深度估计方法:理论与实战视频
视频教程主要分为两大部分:理论篇和实战篇,由于有监督方法的深度真值获取困难,且无监督方法的效果与有监督方法几乎相当,我们将课程的重心放在了无监督方法上。

3.4.4 自动驾驶中的深度学习模型部署实战视频
本视频教程将采用理论和实践相结合的思路,首先对TensorRT的编程模型以及GPU/cuda的相关知识进行讲解,带领大家达到知其所以然的程度;之后课程将用分类、检测、分割三个例子来展示详细编程流程,并给出相关代码,达到真正能落地的工业级分享。

四 3D视觉基础入门
考虑到很多初学者在配置3D视觉软件或者视觉库可能会有困难,我们已经为大家梳理了各个模块的配置教程文档,供学习参考。

五 3D视觉源码汇总

下面为大家节选展示星球内的3D视觉行业相关源码:


六 高质量项目发布与对接
下面为大家节选展示星球内的项目承接:



七 专业的智囊团为星球成员答疑解惑
下面为大家节选展示星球内的答疑解惑:




八 最新前沿顶会论文分享
下面为大家节选展示星球内的前沿顶会:







九 精华问题100问
下面为大家节选展示星球内的精华问题100问:
结构光


相位偏折术


BEV与Occupancy


MVSNet


线结构光


Transformer


机器人规划控制

四旋翼建模与控制

十 3D视觉方向求职招聘
下面为大家节选展示星球内的求职招聘内容:


十一 星球会员权益
项目、学习、求职中遇到的问题,免费获得解答。 终身免费学习星球往期已更新完毕的所有视频内容。 星球每月之星给予丰厚的现金奖励。 优先承接来星球内部项目对接。 终身免费下载星球往期分享的文献和项目代码。 优先获得3D视觉企业(与工坊深度合作企业)内推资格。 快速找到志同道合的学习伙伴,不再单打独斗,抱团取暖,走得更快更远。 不定期星球内部会组织项目实训,包括相机标定、机械臂抓取、三维重建优化等
写在最后
目前已有6400多名3D视觉从业者正在星球里一起交流、分享、进步,我们也欢迎您一道同行!

