《Xbotics具身智能二十一讲1.0》正式发布,一份真能找到工作的知识宝藏

Xbotics具身智能实验室 2026-09-07 12:04

点击下方卡片,关注【Xbotics具身智能实验室】公众号

你想要的这里都有~~



近几年,很多同学都问过我们这个问题。

坦白说,只学完一门十几个小时的课程,很难直接换来一份工作。具身智能涉及机器人系统、感知、控制、数据和学习算法。每个方向都能单独讲很久,真正做项目时,又需要把这些能力接在一起。

我们办过一些线下学习活动,也越来越清楚:只讲一两个模型,或者带大家完成一次实验,很难帮大家建立完整的认识。

所以这一次,我们想把具身智能的主要知识串起来。

《Xbotics具身智能二十一讲》从机器人系统讲起,逐步进入视觉操作、模仿学习、VLA、强化学习、视觉语言导航、Agent和世界模型。每一讲都会说明相关方法解决什么问题,并配套可以运行和验证的实践Demo。

我们希望大家学完之后,能看懂一套具身系统怎样运行,能动手完成项目,也能更清楚自己适合哪个方向。

《Xbotics具身智能二十一讲1.0》正式发布,一份真能找到工作的知识宝藏图1

21讲三阶段

  • 第1—7讲——基础部分:机器人系统、ROS 2、控制、感知、仿真和视觉操作;
  • 第8—16讲——进阶部分:数据采集、模仿学习、VLA和强化学习;
  • 第17—21讲——前沿拓展:视觉语言导航、Agent、世界模型与综合项目。

刚接触具身智能的同学,可以从第1讲开始。已经有机器人或算法基础的同学,也可以直接进入自己关心的模块。

第一部分:机器人系统基础(第1—4讲)

这一部分先把机器人的基本运行方式讲清楚:状态、观测、动作和反馈分别是什么,软件模块怎样通信,模型输出怎样传给执行器,相机中的信息又怎样转换到机器人坐标系。

《Xbotics具身智能二十一讲1.0》正式发布,一份真能找到工作的知识宝藏图2

第1讲:具身智能导论

这讲学什么: 先建立一张具身智能的知识地图,了解感知、决策、行动和反馈怎样组成闭环,以及后面的不同方法分别在解决什么问题。

实践Demo: 运行一个最小二维Reaching Demo,观察智能体怎样根据当前位置和目标位置生成动作,并在反复反馈中逐步缩小误差。有硬件时,还可以把这一过程映射到机械臂的目标接近任务。

第2讲:机器人系统架构——硬件、软件与ROS 2

这讲学什么:了解机器人硬件、软件和ROS 2怎样协同工作,以及模型输出怎样稳定地传到机器人上。

实践Demo:基于ROS 2搭建LeRobot / SO101最小闭环。没有硬件时,可以使用Mock节点模拟机器人状态与执行器;有真机时,再替换硬件适配层,并检查Topic类型、时间戳、节点连接、目标发布和动作限幅。

第3讲:机器人本体与控制基础

这讲学什么:理解模型输出的Action到了机器人上,究竟代表什么动作。

实践Demo:围绕SO101或仿真机械臂,对比关节绝对位置、关节增量和末端增量等动作表示,并检查关节限位、归一化、控制频率和底层控制器。

第4讲:传感器与感知基础

这讲学什么:理解机器人怎样把传感器采集到的信息,转换成可以用于行动的空间位置。

实践Demo:完成“点击图像像素→查询深度→RGB-D反投影→camerabase_link坐标变换→输出目标点”的完整流程,并通过可视化或已知物体检查结果是否准确。

第二部分:机器人视觉操作(第5—7讲)

这一部分会搭建一条可以逐步检查的视觉操作流程:先定义任务,再从视觉信息中得到物体的位置和姿态,最后控制机器人完成抓取、检查和失败恢复。

《Xbotics具身智能二十一讲1.0》正式发布,一份真能找到工作的知识宝藏图3

第5讲:仿真环境与操作任务搭建

这讲学什么:学习怎样把现实中的机器人任务放进仿真环境,并定义训练和评测规则。

实践Demo:搭建一个机械臂或人形机器人仿真环境,定义Observation、Action、Reset、Termination和Success Metric。随后修改摩擦、质量、延迟和初始条件,观察这些参数会怎样影响任务结果。

《Xbotics具身智能二十一讲1.0》正式发布,一份真能找到工作的知识宝藏图4

第6讲:机器人感知与位姿估计

这讲学什么:解决机器人看见物体以后,怎样计算抓取位置和姿态的问题。

实践Demo:使用RGB-D、Open3D、手眼标定脚本或ManiSkill,完成目标区域提取、三维点云生成、位姿估计和抓取目标输出。有真机时,可以继续验证机械臂末端是否准确到达预期位置。

第7讲:机器人操作技能

这讲学什么:把单个目标位置扩展成一段完整的操作流程,让机器人知道每一步应该做什么,以及失败后怎样处理。

实践Demo:在Mock、SO101或ManiSkill后端运行Pick-and-Place状态机,对比自上而下抓取和侧向抓取,并记录阶段切换、目标位姿、夹爪状态、执行时间和失败类型。

第三部分:端到端机器人操作(第8—13讲)

从这一部分开始,课程进入数据驱动的机器人操作。我们会依次回答几个问题:Policy是什么,训练数据从哪里来,策略怎样训练,VLA模型如何选择、微调和部署。

《Xbotics具身智能二十一讲1.0》正式发布,一份真能找到工作的知识宝藏图5

第8讲:端到端策略导论——从Pipeline到Policy

这讲学什么:理解机器人怎样从人工编排的操作流程,过渡到直接从数据中学习“观测到动作”的对应关系。

实践Demo:在仿真环境中运行第一个Policy Rollout,对比策略输出和规则控制的差别。随后使用部署检查单核对观测顺序、动作维度、归一化统计量、控制频率、动作限幅和终止条件。

第9讲:操作数据闭环——采一份能训练的数据集

这讲学什么:把“数据很重要”拆成具体的采集规范,让读者知道什么样的数据可以训练,什么样的数据会给模型留下问题。

实践Demo:以SO101和LeRobot为标准路径采集操作数据。没有硬件时,可以通过仿真、键盘或Mock环境生成相同格式的Episode,并检查视频帧、时间戳、状态与动作维度、动作分布和任务标签。

第10讲:模仿学习实战——ACT、Diffusion与Flow Matching

这讲学什么:学习怎样用采集到的数据训练动作策略,并判断模型在闭环执行中是否真的有效。

实践Demo:在LeRobot、LIBERO或对应环境中完成策略训练与推理,记录训练曲线、验证曲线、Rollout视频、成功率和失败类型,同时分析Loss较低但实际执行失败的情况。

第11讲:VLA模型导览——从OpenVLA到π0家族

这讲学什么:了解主流VLA模型的基本思路,以及选择模型时需要考虑哪些任务和资源条件。

实践Demo:结合模型架构图和输入输出流程,观察图像、语言指令和机器人状态怎样转换成动作序列。随后完成模型选型对比,检查Checkpoint、算力需求和部署条件。

第12讲:VLA微调实战——从全量SFT到LoRA上真机

这讲学什么:让预训练模型适应自己的机器人、相机布局、动作尺度和任务表达。

实践Demo:基于OpenPI、LeRobot或课程工程,在示例数据或自有数据上运行全量微调和LoRA微调,记录显存占用、训练时间和Checkpoint,再完成离线推理、仿真Rollout或真机部署检查。

第13讲:VLA前沿——跑得更快、记得更久、用上全身

这讲学什么:了解当前VLA还存在哪些能力和工程限制,以及这些问题可以从哪些方向继续研究。

实践Demo:结合论文架构、端到端延迟、控制周期和系统对比,分析一个VLA系统的主要问题来自模型、系统、数据还是机器人本体。

第四部分:强化学习(第14—16讲)

模仿学习关注“专家是怎么做的”,强化学习进一步关注“机器人这样做,最终结果好不好”。这一部分覆盖仿真训练、大模型后训练和真机经验复用。

《Xbotics具身智能二十一讲1.0》正式发布,一份真能找到工作的知识宝藏图6

第14讲:强化学习入门——从策略梯度到PPO

这讲学什么:建立理解具身强化学习所需的基本概念,包括Observation、Action、Reward和Termination。

实践Demo:在Unitree G1或其他仿真任务中定义观测、动作、奖励和终止条件,运行并对比不同策略梯度方法,观察奖励曲线、步态表现、失败姿态和扰动恢复能力。

第15讲:GRPO后训练——从VLM任务到VLA探索

这讲学什么:先通过结果容易验证的VLM任务理解GRPO,再讨论这类后训练方法怎样用于具身策略。

实践Demo:完成候选生成、规则评分、组内标准化和参数更新的小实验。进阶实践会进一步把观察与动作序列接入VLA后训练,对比监督微调前后的可验证表现。

第16讲:Off-policy强化学习——从仿真提速到真机落地

这讲学什么:研究怎样重复利用过去采集的经验,减少真机交互成本,提高数据利用率。

实践Demo:在SO101类任务或仿真环境中建立Replay Buffer,观察新经验和旧经验怎样共同参与更新。进阶实践还会加入人工干预、自动奖励和失败恢复,并记录每次交互的来源和价值。

第五部分:视觉语言导航VLN(第17—18讲)

这一部分把机器人的能力从局部操作扩展到空间移动。机器人需要理解“穿过走廊,在沙发旁停下”这类语言指令,并根据环境持续调整行动。

《Xbotics具身智能二十一讲1.0》正式发布,一份真能找到工作的知识宝藏图7

第17讲:VLN理论基础

这讲学什么:了解视觉语言导航解决什么问题、有哪些典型任务,以及怎样判断机器人是否正确到达目标。

实践Demo:在Habitat-Sim / Habitat-Lab、Matterport3D或VLN-CE环境和数据体系中,检查场景、指令、轨迹和动作定义。随后手工分析成功与失败轨迹,并计算或解释SR、SPL等指标。

第18讲:VLN实操与评测

这讲学什么:把VLN的概念落到模型、代码、运行轨迹和评测结果上。

实践Demo:运行DUET等代表性VLN基线,并根据实际条件尝试InternVLA-N1等较新系统。实验将记录SR、SPL、路径长度和轨迹可视化结果,重点检查转向、回退、停止和长指令理解能力。

第六部分:Agent、世界模型与前沿进展(第19—21讲)

最后一部分进入具身智能的前沿方向:机器人怎样组织多种技能,怎样预测行动可能带来的结果,以及数据、仿真、模型和机器人接口正在发生哪些变化。

《Xbotics具身智能二十一讲1.0》正式发布,一份真能找到工作的知识宝藏图8

第19讲:Embodied Agent——任务规划与技能调用

这讲学什么:让系统根据一个较长的目标,安排并调用多种机器人技能。

实践Demo:使用LangGraph或类似工具调用Mock Skills,运行多步骤计划。每个Skill都需要定义输入、输出、前置条件、超时、成功证据和失败码,并模拟目标丢失、技能执行失败和重新规划。

第20讲:世界模型——预测、规划与数据飞轮

这讲学什么:理解机器人怎样预测行动后的环境变化,并利用预测结果辅助规划和决策。

实践Demo:以Fast-WAM为复现案例,阅读训练和推理代码,理解Video Co-training与直接动作输出之间的关系。随后完成最小评测,并对比Fast-WAM、Joint和IDM的未来视频、动作可见性和推理延迟。

第21讲:具身智能前沿进展——综合闭环与课程答辩

这讲学什么:把前面学到的系统、感知、控制、数据和模型连接起来,完成一次综合项目。

实践Demo与答辩:围绕一个选定方向完成技术地图和系统方案,说明任务边界、模块接口、数据来源、训练与推理流程、评测指标、风险和失败回流。答辩材料需要包含架构图、实验结果、失败案例和下一轮改进计划。

学完以后,可以形成哪些成果?

这21讲想帮助大家完成几件具体的事:

  • 看懂机器人系统、感知、控制、数据和模型之间的关系;
  • 跑通一批可以记录、评测和复现的实践Demo;
  • 了解从数据采集、模型训练到部署评测的基本流程;
  • 完成一个包含架构图、实验结果和失败分析的综合项目;
  • 根据自己的基础和兴趣,找到适合继续深入的方向。

课程同时提供真机与仿真两类入口。

真机可以暴露噪声、延迟、摩擦、标定和安全等实际问题;仿真与Mock环境更适合快速试错、重复评测和并行训练。两条路径会尽量使用一致的观测、动作和评测方式,大家可以从自己现有的条件开始。

这些内容对应哪些岗位方向?

不同模块与实际岗位的关系,大致可以这样理解:

  • 系统、ROS 2、本体和控制,更接近机器人软件、系统集成和应用开发;
  • 传感器、位姿估计和视觉操作,更接近机器人感知与操作算法;
  • 数据闭环、模仿学习和VLA,更接近具身算法、数据和策略学习;
  • 强化学习、VLN、Agent和世界模型,更适合希望继续做进阶算法或研究的同学;
  • 综合项目中的系统设计、实验记录和失败分析,可以进一步整理成作品集与面试材料。

课程会帮大家理解岗位需要哪些能力,也会提供动手实践的入口。真正进入行业,还需要持续做项目、读代码、跑实验,并积累解决实际问题的经验。

作者清单(第一版)

《Xbotics具身智能二十一讲》由Xbotics具身智能社区发起,采用“内容共创+项目复现+真机验证”的方式推进。

发起与总策划:Xbotics具身智能实验室

各部分作者:将在课程单讲和课程仓库中陆续公布。

审阅与修改:雨浩、郑晓佳、王乙然、曹浩、谢维烨

以上为第一版作者与共创名单。后续参与内容审阅、项目贡献、代码复现和实验验证的成员,也会根据实际贡献持续更新。

课程内容由Xbotics具身智能社区共同创作。代码及外部开源项目的使用方式,以对应仓库标注的许可协议为准。

接下来,怎么更新?

接下来,《Xbotics具身智能教程》将保持每周一讲的更新节奏。

每一讲都会围绕几个具体问题展开:这一讲解决什么问题,关键概念怎样理解,有哪些实践Demo可以运行,怎样判断实验结果,实验失败后又该从哪里检查。

模型和方法一直在变化,系统思维、接口意识、实验设计和失败分析,会长期影响一个人解决机器人问题的能力。

我们希望通过这21讲,把具身智能该学什么、怎么练、怎样验证学习成果讲清楚。看懂系统、跑通项目、留下实验记录,并能解释机器人为什么失败,这些都会成为继续深入学习的基础。

如果你也想跟着这套路线学下去,后台回复“二十一讲”,获取课程目录和学习资料;点击“阅读原文”获取知识库。

从第1讲开始,边学边做,一步步把具身智能系统跑起来。


-END-

Ask Me Anything|提问箱

对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。

怎么问:在评论区留言,或私信公众号

我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。

提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。

一起把问题变成知识,推动社区进步 🚀


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC
more
首份中报仍未扭亏,“Physical AI”新标签加身,这家汽车芯片龙头能否换挡提速?
投资4500万、年产16480片,赛富乐斯启动量子点全彩Micro-LED微显示项目技改
最新议程更新 | 2026中国MicroLED CPO产业高峰论坛即将揭幕
8点1氪:片仔癀市值蒸发超2100亿;苹果换帅,特努斯接替库克任苹果CEO;Anthropic签署由英伟达支持的350亿美元云计算协议
十年连接26万台设备,蘑菇物联让Physical AI先在能源系统里跑了起来
如何做IC设计科研?(PPT分享)
合见工软发布国产首个Agentic EDA体系,填补3DIC物理设计空白
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型
荣耀Magic9系列细节再曝,内置风扇+双2亿ARRI联名影像
399美元开源鸭Microduck:软件全白嫖,硬件零图纸!扒完代码我才发现复刻没那么简单
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号