具身智能基础:从语言智能到物理世界交互
目录
1 概述 {#1}
具身智能(Embodied AI / Embodied Intelligence)指智能体以实体形态(机器人、移动平台等)存在于物理环境中,通过传感与执行闭环完成任务的智能形态。与纯语言或纯视觉智能的根本区别在于:它必须与物理世界形成闭环交互——感知当前状态、做出决策、发出动作,再根据环境反馈更新感知,如此往复。
- 纯语言智能(LLM):输入输出均为符号序列,不接触物理因果链;
- 纯视觉智能:理解图像/视频,但不产生改变世界的动作;
- 具身智能:输出会真实改变世界状态,并被新一轮观测所捕获。
与 LLM / MLLM 的关系是互补而非替代:LLM 提供常识、语义理解与长程推理,Vision-Language-Action(VLA)模型则把这种高层认知落到关节级别的动作。可以粗略地把具身智能看作 “MLLM 的大脑 + 机器人的身体”。
典型任务包括:
- 机器人操作(Manipulation):抓取、放置、装配、工具使用、双手协作;
- 导航(Navigation):在室内外环境中自主移动、避障、寻路;
- 移动操控(Mobile Manipulation):边走边操作,如打开柜门取物、清理桌面。
2 问题建模 {#2}
具身智能通常被建模为马尔可夫决策过程(MDP)或更一般的部分可观马尔可夫决策过程(POMDP),因为机器人只能通过带噪传感器间接估计真实状态。
2.1 MDP / POMDP 要素
- 状态 $s_t$:环境与机器人的完整描述,通常不可直接获取;包含视觉观测(RGB-D 帧)、本体感觉(关节角度、力矩、末端位姿)等。
- 观测 $o_t$:传感器读数,$o_t \sim \Omega(s_t)$,$\Omega$ 为观测函数。
- 动作 $a_t$:可执行指令,如关节力矩 $\tau_t$、末端速度 $\dot{x}_t$、夹爪开合量,或离散化的动作 token。
- 转移 $p(s_{t+1} \mid s_t, a_t)$:环境动力学,通常未知。
- 奖励 $r_t = r(s_t, a_t)$:任务完成度的标量反馈。
- 策略 $\pi_\theta(a_t \mid o_t)$:由参数 $\theta$ 决定的(随机)策略。
2.2 策略目标
目标是找到使折扣累积回报最大的策略:
\[\max_\theta\; \mathbb{E}_{\pi_\theta}\left[\sum_{t=0}^{T}\gamma^t r_t\right]\]其中 $\gamma \in [0,1)$ 为折扣因子。在模仿学习设定下并不显式使用奖励,而是从专家演示中直接回归策略;两者最终都希望逼近一个好的回报。
2.3 POMDP 的近似求解
由于真实状态不可观测,Agent 通常用历史观测与动作的函数作为策略条件:
\[\pi_\theta(a_t \mid o_1, a_1, \dots, o_t)\]实现上可使用循环网络(维护隐状态)或 Transformer(读完整历史)。当观测足以近似状态时(如 RGB-D + 本体感觉齐全),可视为”近似 MDP”。
3 三种范式对比 {#3}
| 范式 | 表示 | 优点 | 局限 |
|---|---|---|---|
| 基于规则控制 | PID / 运动学规划 / 状态机 | 可解释、稳定、可验证 | 难以泛化到非结构化场景 |
| 学习式(经典 RL) | $\pi_\theta(a \mid s)$,奖励驱动 | 可发现新策略、自适应 | 样本效率低、真机探索代价高 |
| 端到端 VLA | $\pi_\theta(a \mid o, \ell)$,条件于语言 | 跨任务泛化、利用大规模预训练 | 黑箱、数据昂贵、实时性约束 |
范式演进的主线是:从手工设计规则 → 从数据中学习 → 从大规模多模态预训练中迁移,使得策略具备语言可指令性与跨任务泛化能力。
4 关键概念 {#4}
4.1 动作分块 (Action Chunking)
为降低高频控制下的延迟与累计误差,现代 VLA 通常一次预测未来 $H$ 步动作:
\[a_{t:t+H} = \pi_\theta(o_t, \ell)\]随后用执行窗口内若干步(或加平滑/低通滤波)发送给机器人。
4.2 跨实体泛化 (Cross-Embodiment)
不同机器人形态(单臂、双臂、夹爪、灵巧手)共享同一策略或表征。常见做法:
- 统一动作空间:把不同机器人的动作投影到同一空间(如 7-DoF 末端 + 1-DoF 夹爪);
- 形态 token:把”机器人体型”也作为输入 token,让策略适配。
4.3 Sim-to-Real
仿真训练 + 真机部署的范式,需要弥合 Sim-to-Real gap,详见 Sim-to-Real 与仿真器。
4.4 长程任务分解
对”做早餐”这种长程任务,单一策略难以端到端完成。常用”分层规划”:
- 高层:LLM/VLM 把任务拆为子目标序列(”开冰箱 → 取鸡蛋 → 煎蛋 → …”);
- 低层:每个子目标由专门的 VLA 策略执行。
这条思路的代表性工作见 具身智能前沿专题 的”分层规划”小节。
5 参考文献 {#5}
[1] Sutton & Barto, Reinforcement Learning: An Introduction (2nd Edition), MIT Press, 2018.
[2] K. Åström, Introduction to Stochastic Control, Academic Press, 1970.
[3] K. Klee, POMDPs for Robotics, Foundations and Trends in Robotics, 2013.
[4] A. Mandlekar et al., Towards General-Purpose Robots: Foundation Models and Transfer Learning, 2023. arXiv:2304.12931.
[5] R. S. Sutton, The Bitter Lesson, 2019. http://www.incompleteideas.net/IncIdeas/BitterLesson.html.
留下评论