具身智能入门与实践开源教程
Tip
📖 在线阅读:点击进入完整教程 →
推荐使用网页版,支持全文搜索、章节导航和交互演示。初次学习可从 新手入门:具身导论 → 开始。
教程和交互页上方的「复制为 Markdown」可复制正文,下拉菜单可预览 Markdown。支持代码、表格和 LaTeX 公式,文末附有原网页链接,方便继续查看交互演示。
Caution
Alpha 内测版本:仍在迁移和重构中,部分章节是占位页,欢迎提 Issue 反馈问题或建议。
从零到一搭建一台具身智能机器人:深入强化学习、World-Model、VLA 等智能决策方法的工程落地,贯穿仿真环境、控制器、运动规划、感知系统等技能树模块,并在真实项目中跑通"决策—控制—感知"完整链路。
🧭 新手入门:具身导论 — 了解具身智能的概念、任务、载体与方法。
网站分为「具身导论、理论基础、项目实战」三个栏目:具身导论介绍领域全貌,并整理论文、数据集、开源项目和工具;理论基础讲解原理;项目实战包含分章项目、独立 Demo 与复现案例,按「AMD 专区、仿真实战、真机实战」归类。
从 具身导论 建立对具身智能的全局认识,再进入理论基础与项目实战学习具体技术:
| 章节 | 内容 |
|---|---|
| 1. 什么是具身智能 | 定义、感知—决策—行动闭环,以及身体为什么重要 |
| 2. 发展脉络 | 规则编程、模型控制、深度强化学习和大模型四个时期 |
| 3. 机器人的技能 | 定义任务,认识抓取、操作、运动与导航 |
| 4. 具身智能的载体 | 人形、机械臂、轮式、四足、移动操作与仿真载体 |
| 5. 核心挑战 | 数据、仿真到真实、泛化、实时性、安全与评测 |
| 6. 技术栈 | VLM、VLA、世界模型与操作、运控、导航等模块的介绍和学习入口 |
| 7. 就业岗位 | 大脑类算法、小脑类算法、感知导航、工程平台与硬件岗位的职责和面试准备 |
导论中的 领域资源 整理公开的学习与研究资源:
从 项目实战总览 选择分章项目或独立实验,按步骤完成实现与评测。
| 分类 | 章节 | 简介 |
|---|---|---|
| AMD 专区 | AUP Learning Cloud 云算力 | Ryzen AI APU、ROCm、JupyterHub 与 Code Server |
| AMD 专区 | MicroDuck RL|AMD ROCm | R9700、ROCm MuJoCo Warp、动态接触回归与双足 PPO |
| AMD 专区 | 玩转 Pupper 四足机器人 | AMD 平台上的强化学习运动策略与 VLA 实验 |
| 仿真实战 | 从零到一搭建四足机器人 | MuJoCo、PD、运动学、策略训练、语言控制与感知 |
| 仿真实战 | MicroDuck RL 小黄鸭双足机器人 | mjlab + MuJoCo Warp:GPU 并行 PPO 与双足步态训练 |
| 仿真实战 | MuJoCo 机械臂与 DDPG | MuJoCo 环境与连续控制实验 |
| 仿真实战 | ACT 双臂操作训练 | ACT + ALOHA:训练、评估与结果复现 |
| 真机实战 | LeRobot 中文课程讲义 | Unit 0–2:机器人学习、数据集、工具链与经典机器人学,为真机实践做准备 |
| 真机实战 | SO-101 + LeRobot 真机教程 | 硬件连通、安全测试与动作回放 |
MicroDuck RL · 小黄鸭双足稳定步态
mjlab + MuJoCo Warp · PPO GPU 并行训练(iteration 1500)
从 0 到 1 搭建四足机器人 CS123 仿真版 · MuJoCo + PPO + LLM 控制 |
ReBot-Act · ACT 训练效果 真机视觉模仿学习 · 方块抓取与放置 |
ACT · ALOHA 双臂交接 50k 训练 · MuJoCo 20 回合成功率 50% |
理论基础按当前导航的四列组织:大脑、小脑、感知系统、工程底座。
| 章节 | 简介 |
|---|---|
| 强化学习决策 | MDP、DQN、PPO、SAC、DDPG/TD3 与模仿学习 |
| 视觉-语言-动作大模型(VLA) | RT-1/RT-2、OpenVLA、ACT、Diffusion Policy、π 系列 |
| World-Model | 世界模型在具身场景下的落地路径 |
| 章节 | 简介 |
|---|---|
| 强化学习控制 | 把策略学习接到连续控制和机器人任务上 |
| 控制器 | PID、LQR、MPC、阻抗控制与系统集成教程 |
| 运动规划 | Motion Planning 与 MoveIt 2 规划闭环 |
本体感知:机器人必须知道自己在哪里、姿态如何、速度如何、是否失稳。
外部感知:相机、雷达、触觉、电机电流、IMU、足端接触、机身姿态、末端位置。
| 章节 | 简介 |
|---|---|
| 视觉感知与 VLM | Transformer、ViT、视觉编码器与多模态融合 |
| 传感器标定与 sim2real | 坐标系、时间同步、外参误差放大和在线标定监控 |
| 章节 | 简介 |
|---|---|
| 仿真工具 | Isaac Sim、MuJoCo、Gymnasium、PyBullet 快速上手 |
| ROS2 | 坐标变换、FK/IK、tf2、URDF 与 MoveIt 2 |
| 数据工程与模仿学习 | 从遥操作数据到模仿学习、LeRobot 工具链和策略训练 |
Datawhale 会围绕本教程组织组队学习。历史与在筹备中的组队学习计划文档会集中放在 docs/team-learning/(施工中),包括每期的学习路线、打卡要求和对应章节的导读。
- 最新一期报名入口:施工中
- 往期学习资料归档:施工中
本地开发和 CI 统一使用 .nvmrc 指定的 Node.js 26.11.1 及其自带的 npm,版本要求见 package.json。使用 nvm 时,在仓库目录运行 nvm install 和 nvm use;其他安装方式请选同一版本。.npmrc 会检查安装时的版本,并为 npm 脚本关闭 Node 的实验性 Web Storage,避免静态构建触发 localStorage 警告;浏览器中的存储功能不受影响。
仓库使用 Git LFS 存放视频和 GIF。clone 之后必须先装 git-lfs 再 git lfs pull,否则本地看到的图/视频是 pointer 文本而不是真内容。完整步骤见 CONTRIBUTING.md。
# 1. 装 git-lfs(每台机器只需一次)
# brew install git-lfs # macOS
# sudo apt install git-lfs # Ubuntu / Debian
# choco install git-lfs # Windows
# 2. 初始化并拉取 LFS 文件
git lfs install
git lfs pull
# 3. 切换到 .nvmrc 指定版本(已安装 nvm 时)
nvm install
nvm use
# 4. 按锁文件装依赖、起本地预览
npm ci
npm run dev网站默认中文,可通过导航栏的语言菜单切换为 English 或 Italiano。英文和意大利语版本均覆盖 README、首页与导航、具身导论(含交互演示与资源页)、学习地图和项目总览。其他教程正文与独立实验页暂时显示中文,并用当前语言标注翻译范围。
# 单独启动英文开发环境(开发服务器一次只运行一种语言)
npm run start -- --locale en
# 意大利语
npm run start -- --locale it
# 构建并检查三种语言,再预览跨语言切换
npm run build
npm run check:i18n
npm run serve中文路径为 /dive-into-embodied-ai/,英文和意大利语分别位于 /en/、/it/ 子路径。界面译文保存在 i18n/<locale>/code.json,导航和页脚译文位于 i18n/<locale>/docusaurus-theme-classic/,其中 <locale> 为 en 或 it。
后续章节的译文 Markdown 可按原目录结构放入 i18n/<locale>/docusaurus-plugin-content-docs/current/,保留原文的文档 ID、slug 和显式章节锚点。缺少译稿时,Docusaurus 会显示中文原文,并提供当前语言的提示及中文版本链接。运行 npm run check:i18n 可检查译文、占位符、路由和跨语言锚点。
| 姓名 | 职责 | 简介 |
|---|---|---|
| 江季 | 项目负责人 | 蘑菇书作者,强化学习算法研究员 |
| 康博 | 项目负责人 | nobl.ai 联合创始人 & 比利时根特大学访问教授 |
| 黄潇 | 项目负责人 | 同济大学毕业,智驾算法工程师 |
| 罗如意 | 项目负责人 | 智能汽车竞赛国奖&FunRec开源项目负责人 |
本作品采用知识共享署名-非商业性使用-相同方式共享 4.0 国际许可协议进行许可。


