01基础概念与任务
先建立地图:具身智能在做什么、机器人要完成哪些任务、常说的「泛化」「跨本体」指什么。 · 150 条
- 1.1具身智能是什么12
- 1.2机器人要做的基本任务11
- 1.3策略:从观测到动作18
- 1.4泛化:没见过也能做对23
- 1.5操作任务细分15
- 1.6行走、导航与探索18
- 1.7工厂、仓库与家庭11
- 1.8与人和其他机器人共处10
- 1.9听懂语言、理解世界18
- 1.10远期目标与思想源流14
1.1具身智能是什么
起点:具身智能指什么、和离身AI有何不同、由哪些部分组成、难在哪里。
- 具身智能Embodied AI有身体、能在物理世界中感知、决策和行动的人工智能。
- 离身智能Disembodied AI没有身体、只在数字世界里处理信息的 AI,如聊天机器人、图像识别模型。
- 物理AIPhysical AI能感知、理解物理世界并在其中行动的 AI,如机器人和自动驾驶。
- 自动驾驶Autonomous Driving让汽车在少人或无人干预下自己感知路况、做决策并控制行驶。
- 智能体与环境Agent and Environment (Agent-Environment Interaction)做决策的一方叫智能体,它身处并能影响的外部世界叫环境。
- 具身智能体Embodied Agent拥有物理或虚拟身体、通过感知和动作与环境交互的智能体。
- 本体Robot Embodiment机器人的物理身体:形态、关节、传感器和执行器的具体组合。
- 感知-行动闭环Perception-Action Loop感知决定动作,动作又改变下一刻的感知,两者不断循环往复。
- 机器人学习Robot Learning用机器学习让机器人从数据和交互中习得技能,而不是靠手写规则。
- 通用机器人General-purpose Robot不为单一任务定制、能在多种场景下完成多种任务的机器人。
- 莫拉维克悖论Moravec's Paradox对机器来说,高级推理容易,人类习以为常的感知和运动反而最难。
- 感觉运动技能Sensorimotor Skills把感官信息实时转成身体动作的能力,比如抓、走、接、拧。
1.2机器人要做的基本任务
有了概念,看机器人具体要干的活:操作物体、自身移动、导航,再串成长任务。
- 操作Robotic Manipulation机器人用手或工具接触物体,改变它的位置、姿态或状态。
- 抓取Grasping机器人用夹爪、吸盘或灵巧手把物体稳稳拿起来。
- 抓取放置Pick-and-Place把物体从一处拿起、移动并放到指定位置的基础操作任务。
- 双臂操作Bimanual Manipulation机器人用两条手臂互相配合,完成一个操作任务。
- 灵巧操作Dexterous Manipulation用多指灵巧手,靠手指协调和力度调节来抓取、翻转、摆弄物体。
- 运动(移动)Locomotion机器人靠腿、轮子等方式把自己从一处移动到另一处的能力。
- 导航Navigation机器人根据传感器观测,自主移动到指定位置或目标物体旁。
- 视觉语言导航Vision-and-Language Navigation让智能体听懂自然语言路线描述,靠视觉在陌生环境里走到目的地。
- 移动操作Mobile Manipulation把机械臂装在可移动底盘上,边走边干活,把导航和操作结合起来。
- 长程任务Long-horizon Task要连续完成多个子步骤、持续较长时间才能达成目标的任务。
- 原子技能Skill Primitive可复用的最小动作单元,如抓取、放置、开抽屉,组合起来完成复杂任务。
1.3策略:从观测到动作
把上面各种任务统一成「观测→策略→动作」的循环,再看策略的种类和系统分层。
- 观测Observation智能体每个时刻从环境拿到的信息,是策略做决策的输入。
- 状态空间State Space系统所有可能状态的集合;机器人里常由关节角、位姿、速度等量构成。
- 动作空间Action Space智能体每一步能做出的所有动作的集合,以及动作的数值格式。
- 策略Policy根据当前观测决定下一步做什么动作的规则,通常是一个神经网络。
- 推理(前向计算)Inference用训练好的模型对新输入算出输出,只做前向计算、不更新参数。
- 回合Episode从环境重置开始,到任务完成、失败或超时为止的一次完整尝试。
- 轨迹Trajectory随时间变化的一串位置或状态-动作序列,也指一条完整的演示记录。
- 开环Open-loop执行过程中不看反馈,按事先算好的指令一口气做完。
- 闭环Closed-loop边做边看:每一步都根据最新观测结果调整下一步动作。
- 手眼协调Hand-Eye Coordination用相机看到的信息实时引导机械臂和夹爪动作,边看边调的能力。
- 视觉运动策略Visuomotor Policy直接把相机图像映射成机器人动作的控制策略,通常是一个神经网络。
- 动作多峰性Action Multimodality同一情境下有多种都正确的做法,动作分布出现多个「峰」。
- 目标条件策略Goal-conditioned Policy除了当前观测,还把「要达到的目标」作为输入来决定动作的策略。
- 语言条件策略Language-conditioned Policy输入里带一句语言指令、按指令不同输出不同动作的机器人策略。
- 通用策略(通才策略)Generalist Policy一个模型就能执行多种任务、适配多种场景甚至多种机器人的控制策略。
- 专用策略Specialist Policy只针对单一机器人、单一任务或单一场景训练的策略,与通用策略相对。
- 感知-规划-行动范式Sense-Plan-Act机器人先感知建模、再规划、最后执行,循环往复的经典控制流程。
- 大脑-小脑架构(大小脑)Brain–Cerebellum Architecture (Robot Brain & Cerebellum)把机器人系统分成负责理解和规划的「大脑」、负责执行动作的「小脑」两层。
1.4泛化:没见过也能做对
有了策略,就要问它好不好:换了物体、场景、指令甚至机器人,还能不能做对。
- 泛化Generalization模型在训练时没见过的新情况下,仍然能做对的能力。
- 分布内In-distribution测试时遇到的情况和训练数据来自同一分布,也就是模型「见过类似的」。
- 分布外Out-of-distribution测试时遇到的数据和训练数据分布不同,比如新物体、新场景。
- 分布偏移(协变量偏移)Distribution Shift / Covariate Shift部署时遇到的数据分布和训练数据不一致,导致模型表现变差。
- 长尾问题Long-tail Problem单个罕见、总数却极多的情况,训练数据很少覆盖,最容易出错。
- 零样本Zero-shot不给新任务或新环境任何训练样本,模型直接上手完成。
- 少样本Few-shot只给几个到几十个示例,模型就能学会或做对一个新任务。
- 鲁棒性Robustness输入或环境出现干扰、噪声、小变化时,系统表现不明显下降的能力。
- 干扰物Distractor Objects场景里与当前任务无关、却可能把策略带偏的多余物体。
- 失败恢复Failure Recovery机器人发现自己做错或快要失败时,自己调整并把任务继续做完的能力。
- 物体泛化Object Generalization策略换到训练时没见过的新物体上,仍能完成同一任务的能力。
- 位置泛化(空间泛化)Position / Spatial Generalization物体摆到训练时没出现过的位置或朝向,策略仍能做对的能力。
- 场景泛化Scene / Environment Generalization策略换到没见过的房间、桌面、光照或背景里仍能完成任务。
- 视觉泛化Visual Generalization画面外观变了(背景、光照、颜色、干扰物、相机角度),策略照样能完成任务。
- 语义泛化Semantic Generalization面对没见过的物体、概念或指令说法,仍能理解意思并正确执行。
- 行为泛化Behavioral Generalization情况变化使「正确动作」也必须改变时,策略仍能完成任务的能力。
- 任务泛化Task Generalization策略完成训练中没出现过的新任务或新指令的能力。
- 组合泛化Compositional Generalization把分别学过的要素重新组合,处理训练中没见过的搭配。
- 跨本体Cross-Embodiment用多种不同机器人的数据训练一个模型,让它能控制不同机器人。
- 本体差异Embodiment Gap不同机器人之间、人与机器人之间在外形、结构和动作方式上的差别。
- 本体无关Embodiment-agnostic方法或表示不绑定某一款机器人的结构,可以用到不同机器人上。
- 开放词汇Open-vocabulary模型能认出或处理训练标注类别之外、用任意文字描述的物体和概念。
- 开放世界Open-world环境不受控、不断冒出训练时没见过的东西,系统仍要正常工作的设定。
1.5操作任务细分
回到操作这条主线:在抓取、双臂、灵巧之上,细看更难、更专门的操作任务。
- 桌面操作Tabletop Manipulation固定在桌边的机械臂对桌上物体做抓取、推动、摆放等操作。
- 铰接物体操作Articulated Object Manipulation操作带活动关节部件的物体,如开柜门、拉抽屉、掀笔记本盖。
- 柔性物体操作Deformable Object Manipulation抓取和操控受力会弯折、拉伸、变形的物体,如衣服、线缆、食材。
- 衣物操作Garment Manipulation让机器人展平、折叠、悬挂、整理衣物,是柔性物体操作里最典型的一类。
- 精细操作Fine-grained Manipulation对位置和力度要求很高、容错很小的操作,如插电池、穿线、拧小螺丝。
- 接触丰富操作Contact-rich Manipulation需要与物体或环境持续接触、并控制好接触力才能完成的操作任务。
- 装配Robotic Assembly让机器人把零件插、拧、扣、卡到一起,组成部件或产品的操作任务。
- 轴孔装配Peg-in-Hole Insertion把销、轴或插头插进配合孔里的装配任务,考验精度和力控。
- 手内操作In-hand Manipulation用手指在手里调整物体的朝向或位置,不用放下再重新抓。
- 工具使用Tool Use机器人借助外部物体当工具,完成徒手够不着或做不到的任务。
- 任务导向抓取(功能性抓取)Task-Oriented Grasping按接下来要做的事选抓法:同一物体用途不同,抓的位置和姿态也不同。
- 非抓取操作Non-prehensile Manipulation不把物体抓牢,而是靠推、拨、翻、抛等动作来移动它
- 动态操作Dynamic Manipulation利用速度、惯性和重力完成的操作,比如抛、甩、接、颠。
- 外在灵巧性Extrinsic Dexterity借助重力、桌面、墙壁、手臂甩动等外部条件,让简单夹爪完成复杂操作。
- 空中操作Aerial Manipulation让无人机等飞行平台带上机械臂或夹爪,在空中与物体发生物理接触。
1.6行走、导航与探索
再看移动这条主线:腿足怎样走稳、走难路,以及按不同目标导航和探索环境。
- 腿足运动Legged Locomotion让四足、双足等腿式机器人稳定地走、跑、跳、爬坡的运动控制问题。
- 双足行走Bipedal Locomotion机器人只用两条腿走、跑并保持平衡的运动能力,是人形机器人的基本功。
- 复杂地形行走Rough-terrain Locomotion足式机器人在台阶、碎石、草地、雪地等不平整地面上稳定移动的能力。
- 盲走Blind Locomotion不用相机和雷达,只靠关节、IMU 等本体感知走路的运动控制方式。
- 感知行走Perceptive Locomotion足式机器人借助相机、激光雷达看清前方地形,再决定怎么迈步。
- 跑酷Parkour腿足机器人靠视觉连续攀爬、跳跃、钻过障碍的高动态运动技能。
- 跌倒恢复(摔倒起身)Fall Recovery / Getting Up人形或足式机器人摔倒后,从躺、趴等姿势自己重新站起来的能力。
- 文本驱动动作生成Text-to-Motion (Text-Driven Humanoid Motion Generation)输入一句文字描述,输出一段对应的人体或人形机器人全身动作。
- 运动操作一体化Loco-manipulation腿部移动和手臂操作放在一起协调控制,边走边干活。
- 点目标导航Point-Goal Navigation给出相对起点的目标坐标,让机器人在陌生环境里自己走到那个点。
- 物体目标导航Object-Goal Navigation只告诉机器人物体类别(如「椅子」),让它在陌生房子里自己找过去。
- 图像目标导航Image-Goal Navigation给机器人一张目标位置的照片,让它在陌生环境里自己找过去
- 视听导航Audio-Visual Navigation智能体同时用「眼睛」和「耳朵」,在三维环境中找到发声的目标。
- 空中视觉语言导航(无人机 VLN)Aerial Vision-and-Language Navigation (UAV VLN)让无人机听懂自然语言指令,在城市等三维户外空间里飞到目标位置。
- 社交导航Social Navigation机器人在人群中移动,既要到达目标,也要守人的社交习惯。
- 具身视觉跟踪(目标跟随)Embodied Visual Tracking机器人靠自身相机持续跟着指定目标移动,让目标始终留在视野里。
- 主动探索Active Exploration智能体自己决定去哪看、碰什么,主动获取未知环境或物体的信息。
- 具身问答Embodied Question Answering智能体在三维环境里自己走动收集信息,再回答问题的任务。
1.7工厂、仓库与家庭
把任务放进真实场景:从规整可控的工厂仓库,到杂乱多变的家庭。
- 结构化 / 非结构化环境Structured vs. Unstructured Environment结构化环境里物品和流程固定可预知;非结构化环境杂乱多变、无法事先规定。
- 示教再现Teach-and-Playback Programming人先带机器人走一遍并记录位置,机器人再按记录原样重复执行。
- 上下料Machine Tending (Loading & Unloading)把工件装进机床或设备、加工完再取出来的工厂工序。
- 质检Quality Inspection (Visual Inspection Task)让机器人用相机等传感器检查产品有没有缺陷或装错。
- 料箱搬运Tote Handling (Material Handling)在仓库和产线上取放、搬运标准塑料周转箱(料箱)的任务。
- 码垛 / 拆垛Palletizing / Depalletizing把箱子、袋子按规则堆上托盘,或从托盘上一件件拆下来
- 分拣Sorting (Parcel / Item Sorting)识别传送带或料箱里的物品,并按目的地或类别送到不同位置。
- 拣选(订单拣货)Order Picking / Piece Picking按订单从货架或料箱里把指定商品一件件取出来的仓储作业
- 无序抓取Bin Picking机器人从杂乱堆放的料箱里识别并逐个取出零件或商品。
- 家务任务Household Tasks在真实家庭里收拾、清洁、洗衣、做饭等日常活,是通用机器人的主要目标场景。
- 物体重排Rearrangement把环境里的物体挪动、摆放成指定目标状态的具身任务。
1.8与人和其他机器人共处
真实场景里少不了人:人机交互、协作与安全,以及多台机器人怎样配合。
- 人机交互Human-Robot Interaction研究人和机器人怎么沟通、协作、安全共处的领域。
- 恐怖谷Uncanny Valley机器人越像人越讨喜,但「很像又不完全像」时反而让人不适。
- 人机协作Human-Robot Collaboration人和机器人在同一空间里分工配合,共同完成一项任务。
- 物理人机交互Physical Human-Robot Interaction人和机器人之间有直接身体接触、相互传递力的交互。
- 人机物体交接Human-Robot Handover机器人和人之间把物体递过去、接过来的交互任务
- 具身安全Embodied Safety确保机器人在真实世界行动时不伤人、不毁物,也不被恶意指令操纵。
- 机器人三定律 / 机器人宪法Asimov's Three Laws of Robotics / Robot Constitution阿西莫夫为机器人设定的三条行为准则,以及大模型时代的规则版。
- 共融机器人Tri-Co Robot (Coexisting-Cooperative-Cognitive Robot)能与人、环境和其他机器人安全共存、协作,并理解彼此意图的机器人。
- 多机器人协作Multi-robot Collaboration多台机器人分工配合,完成一台做不了或做得慢的任务
- 群体智能Swarm Intelligence大量简单个体只按局部规则互动,整体却涌现出智能行为。
1.9听懂语言、理解世界
从执行转向理解:机器人「大脑」如何听懂指令、推理空间与物理、感知和记忆。
- 指令跟随Instruction Following机器人听懂人用自然语言下的指令,并在真实环境里把事做出来。
- 语言接地Grounding / Language Grounding把语言里的词和指令,对应到真实世界中具体的物体、位置和动作上。
- 幻觉Hallucination模型一本正经地输出与事实或眼前场景不符的内容。
- 意图理解(隐式指令)Intent Understanding / Implicit Instruction Following听懂人没直说的需求,从一句暗示推断出该做什么
- 语言纠正(实时语言反馈)Language Corrections (Verbal Feedback)机器人干活时,人用一句话实时指出问题,机器人马上改动作
- 可引导性Steerability不重新训练,只靠提示或条件就能改变模型具体怎么做事的能力。
- 推理(思考)Reasoning模型给出答案或动作前先分析、拆解、规划的能力,不是前向计算那个推理。
- 具身推理Embodied Reasoning让模型懂物理世界:知道东西在哪、怎么抓、接下来该做什么。
- 空间智能Spatial Intelligence理解三维空间中物体的位置、距离和形状,并据此推理和行动的能力。
- 空间推理Spatial Reasoning判断物体位置、距离、大小、方向及相互关系的能力。
- 直觉物理Intuitive Physics不靠公式也能预判物体怎么动的常识,比如没支撑会掉、挡住了仍存在。
- 可供性Affordance物体或环境「允许你对它做什么」,比如把手能拉、按钮能按。
- 人-物交互Human-Object Interaction研究人怎样拿、推、打开、使用物体,是机器人向人学动作的重要素材。
- 具身感知Embodied Perception为行动服务的感知:边移动边观察,理解三维空间并支撑决策。
- 以物体为中心的表示Object-centric Representation把场景拆成一个个物体分别编码,而不是整张图压成一个向量
- 部分可观测马尔可夫决策过程Partially Observable Markov Decision Process智能体看不全真实状态、只能凭观测推断时的决策数学框架。
- 具身记忆Embodied Memory机器人把看过、做过的事存下来,供之后决策和回答问题使用。
- 具身交互Embodied Interaction智能体在物理或仿真空间中与人、物体和环境发生的交互。
1.10远期目标与思想源流
最后看大图景:终点怎么衡量、规模与经验的路线之争,以及背后的思想源头。
- 具身通用智能Embodied AGI能像人一样在真实世界完成各种开放任务的具身智能,是该领域的远期目标。
- 自主等级Levels of Autonomy按机器人在多大程度上不靠人就能感知、决策、执行来划分的等级。
- 人形机器人智能化分级Humanoid Robot Intelligence Level Grading中国电子学会发布的团体标准,按四个维度把人形机器人智能水平分成 L1–L5。
- 物理图灵测试Physical Turing Test分不出一件现实中的体力活是人干的还是机器人干的,就算通过。
- 咖啡测试The Coffee Test (Wozniak)让机器走进一户陌生人家,自己找齐东西把咖啡煮出来。
- 苦涩的教训The Bitter Lesson萨顿的观点:长期看,能随算力扩展的通用方法胜过人工注入的领域知识。
- 涌现能力Emergent Abilities小模型没有、模型或数据规模变大后才出现的能力。
- 经验时代Era of ExperienceSilver 与 Sutton 的观点:AI 下一阶段主要靠自身交互经验来学习。
- 人工智能三大学派(符号主义 / 连接主义 / 行为主义)Three Schools of AI: Symbolism, Connectionism, Behaviorism (Actionism)中文教材对 AI 路线的经典划分:靠逻辑符号、靠神经网络、靠与环境交互。
- 符号落地问题Symbol Grounding Problem机器里的符号怎样对应到真实世界的事物,从而真正有意义。
- 包容架构(行为式机器人)Subsumption Architecture / Behavior-based Robotics用多层简单行为直连感知与动作、高层可压制低层的机器人控制架构。
- 具身认知Embodied Cognition认为思维离不开身体及身体与环境互动的认知科学观点。
- 形态计算Morphological Computation把一部分控制工作交给身体的形状和材料本身去完成
- 形态-控制协同设计(形态进化)Morphology-Control Co-design / Morphological Evolution把机器人的身体结构和控制策略放在一起优化,而非先定身体再学控制