{"lang":"zh","today":"2026-09-30","cats":[{"key":"concept","name":"基础概念与任务","blurb":"先建立地图：具身智能在做什么、机器人要完成哪些任务、常说的「泛化」「跨本体」指什么。","sections":[{"title":"具身智能是什么","blurb":"起点：具身智能指什么、和离身AI有何不同、由哪些部分组成、难在哪里。"},{"title":"机器人要做的基本任务","blurb":"有了概念，看机器人具体要干的活：操作物体、自身移动、导航，再串成长任务。"},{"title":"策略：从观测到动作","blurb":"把上面各种任务统一成「观测→策略→动作」的循环，再看策略的种类和系统分层。"},{"title":"泛化：没见过也能做对","blurb":"有了策略，就要问它好不好：换了物体、场景、指令甚至机器人，还能不能做对。"},{"title":"操作任务细分","blurb":"回到操作这条主线：在抓取、双臂、灵巧之上，细看更难、更专门的操作任务。"},{"title":"行走、导航与探索","blurb":"再看移动这条主线：腿足怎样走稳、走难路，以及按不同目标导航和探索环境。"},{"title":"工厂、仓库与家庭","blurb":"把任务放进真实场景：从规整可控的工厂仓库，到杂乱多变的家庭。"},{"title":"与人和其他机器人共处","blurb":"真实场景里少不了人：人机交互、协作与安全，以及多台机器人怎样配合。"},{"title":"听懂语言、理解世界","blurb":"从执行转向理解：机器人「大脑」如何听懂指令、推理空间与物理、感知和记忆。"},{"title":"远期目标与思想源流","blurb":"最后看大图景：终点怎么衡量、规模与经验的路线之争，以及背后的思想源头。"}]},{"key":"robot","name":"机器人类型与代表产品","blurb":"认识机器人长什么样：从机械臂到人形的各种形态，以及市面上的代表型号。","sections":[{"title":"机械臂家族","blurb":"从最常见的机器人讲起：一条机械臂，以及它在工厂、实验室和桌面上的几种变体。"},{"title":"轮子、腿与移动操作","blurb":"机械臂只能待在原地；这节看机器人怎么移动：轮子、腿，以及带臂的移动操作。"},{"title":"人形机器人的几种形态","blurb":"双足再配上躯干和双臂就是人形；按身高、下半身和外观，人形又分几种。"},{"title":"按用途分类与其他形态","blurb":"前面按长相分，这节按用途分：工业之外的服务、特种，再补上飞行、仿生和软体。"},{"title":"科研常用机械臂","blurb":"形态讲完，开始认具体型号：先看论文里最常见的几款机械臂，再看同类其他选择。"},{"title":"双臂与移动操作平台","blurb":"用上一节的臂搭成平台：双臂遥操作、科研移动底盘，以及底盘加臂的移动操作。"},{"title":"海外人形机器人","blurb":"代表产品先看海外人形：从 ASIMO 到明星公司，再看新秀、家用、经典与开源。"},{"title":"海外四足及其他","blurb":"海外人形之外：波士顿动力等公司的四足机器人，以及仓储、手术等专用机器人。"},{"title":"国内人形机器人","blurb":"回到国内人形：先看宇树、智元等头部公司，再看国家队、跨界玩家和各家新势力。"},{"title":"国内四足及其他","blurb":"最后是国产四足：以宇树从 A1、Go2 到 B2 的机器狗为主线，再看其他几家。"}]},{"key":"hardware","name":"硬件与本体部件","blurb":"把机器人拆开看：电机、减速器、丝杠、灵巧手、算力平台这些零件各管什么。","sections":[{"title":"执行器与关节模组","blurb":"看过机器人形态，先拆出让它动起来的部件：执行器、关节模组和舵机"},{"title":"电机种类与参数","blurb":"拆开关节模组，先看电机：有哪几种，参数表上的扭矩和发热怎么读"},{"title":"减速器、轴承与丝杠","blurb":"电机转得快、力气小：减速器换成大扭矩，轴承扛住负载，丝杠把转动变直线"},{"title":"驱动器、编码器与总线","blurb":"机械件之后是电子件：驱动器管电流、编码器测角度、总线传指令，外加断电保护"},{"title":"关节驱动方案","blurb":"零件认齐了看怎么搭：围绕减速比高低的取舍，有准直驱、弹性驱动、液压、腱绳等路线"},{"title":"夹爪与末端工具","blurb":"关节讲完看手臂末端：从最常用的二指夹爪，到吸盘、软体夹爪和快换接口"},{"title":"灵巧手：结构与产品","blurb":"比夹爪更像人手：先认手指关节和几种驱动方式，再看主流灵巧手产品"},{"title":"移动底盘与腿脚","blurb":"从手转到下半身：轮式底盘有哪几种轮系，腿足机器人的脚和腿长什么样"},{"title":"主控、控制器与算力","blurb":"手脚之后看大脑：跑模型的主控与算力指标，管实时控制的下位机和控制器"},{"title":"电池、结构与实验配套","blurb":"最后补齐整机：电池续航、布线、材料与整机指标，以及实验室常用配套设备"}]},{"key":"mechanics","name":"力学与运动学","blurb":"机器人怎么动的物理基础：位姿怎么表示、正逆运动学、雅可比、动力学和平衡。","sections":[{"title":"坐标系与位姿","blurb":"起点：用坐标系把物体「在哪、朝哪」写成数字，再学会在坐标系之间换算。"},{"title":"旋转的多种表示","blurb":"展开上一节的「朝向」：欧拉角、四元数、轴角、6D 各有利弊，再到李群与旋量。"},{"title":"连杆、关节与机构","blurb":"从单个刚体到整台机器人：连杆和关节怎样连成机构，一共有几个自由度。"},{"title":"正运动学与逆运动学","blurb":"结构定了就能计算：关节角与末端位姿互相换算，以及建模、可达范围和标定。"},{"title":"速度与雅可比","blurb":"从位置推进到速度：雅可比把关节速度换成末端速度，奇异和冗余都由此而来。"},{"title":"力、静力学与惯量","blurb":"前面只管几何，这里开始算力：力矩、力旋量、静力平衡，以及质心和惯量。"},{"title":"动力学与振动","blurb":"把力和运动连起来：写出运动方程、用递推算法高效求解，再看弹簧阻尼与振动。"},{"title":"接触、摩擦与抓取","blurb":"从机器人自身转向外界：接触力、摩擦和碰撞，再用它们分析怎样抓稳物体。"},{"title":"足式平衡与简化模型","blurb":"上一节的接触力用到脚下：腿足机器人怎样判断站稳，以及规划平衡的简化模型。"},{"title":"步态与行走","blurb":"从站稳到走和跑：步态的相位与类型、跑跳模型，以及更自然、更省能的走法。"}]},{"key":"control","name":"控制与规划","blurb":"让关节按想要的方式动：从 PID 到力控、MPC、运动规划和全身控制。","sections":[{"title":"控制基础：分层与反馈","blurb":"先看控制处在系统哪一层、每秒算几次，再学 PID 等按误差出力的反馈控制。"},{"title":"关节控制与模型补偿","blurb":"把反馈用到关节电机上：位置/速度/力矩模式、驱动接口，再靠动力学模型补偿与抗扰。"},{"title":"末端控制与力控","blurb":"从控制各关节换成直接控制末端，再学接触时怎么控力、怎么顺从，以及视觉伺服。"},{"title":"轨迹生成与跟踪","blurb":"控制器要跟的目标从哪来：用路点、插值、速度曲线生成平滑轨迹，再把它跟稳。"},{"title":"最优控制与 MPC","blurb":"上节靠插值，这节把控制写成优化问题：LQR、轨迹优化、MPC，以及卡尔曼估计。"},{"title":"足式与全身控制","blurb":"用前面的工具让腿足和人形走稳：步态、落脚、平衡、全身控制，再到强化学习运控。"},{"title":"路径规划与导航","blurb":"从「控」转向「规」：在地图上用 A* 等算法找路，再分全局、局部两层导航避障。"},{"title":"机械臂运动规划","blurb":"关节一多就没法画格子搜：靠碰撞检查、RRT 等采样法和轨迹优化来规划手臂动作。"},{"title":"任务层：编排与规划","blurb":"再往上一层，决定先做什么后做什么：状态机、行为树、符号规划，到大模型任务规划。"},{"title":"安全与稳定保障","blurb":"贯穿各层的兜底：急停、限位、碰撞检测、安全标准，再到可证明稳定与安全的理论。"}]},{"key":"perception","name":"感知与传感器","blurb":"机器人怎么看和摸：相机、深度、IMU、力和触觉，以及点云、标定、SLAM。","sections":[{"title":"感知总览与相机成像","blurb":"感知分本体与外部两类；先学最常用的 RGB 相机：装在哪、怎么成像、有哪些参数。"},{"title":"深度相机与激光雷达","blurb":"在相机成像的基础上加入距离：双目、结构光、ToF 深度相机和激光雷达。"},{"title":"本体感知与力觉","blurb":"从感知外界转向感知自身：编码器与 IMU 测运动，力/力矩传感器测受力和接触。"},{"title":"触觉感知","blurb":"比力传感器更细的「摸」：触觉阵列、电子皮肤、视触觉传感器及触觉数据的用法。"},{"title":"标定与时空对齐","blurb":"传感器都认识了，再把它们对齐：相机与手眼标定、多传感器外参和时间同步。"},{"title":"检测、分割与跟踪","blurb":"从这里进入视觉算法：在图像里框出、抠出、跟踪物体，并能用文字指定目标。"},{"title":"从图像恢复三维","blurb":"不靠深度传感器，只用普通图像估深度、做多视图几何，再到网络一步出三维。"},{"title":"点云处理与三维表示","blurb":"拿到三维数据后：点云的降采样、配准与网络，再到网格、NeRF、高斯泼溅等表示。"},{"title":"物体位姿、抓取与可供性","blurb":"把前面的三维感知用于操作：估计物体 6D 位姿、检测抓取、找可供性和铰接结构。"},{"title":"人体、手部与人机交互","blurb":"感知对象从物体换成人：人体与手的姿态、三维网格，以及手势、视线和语音。"},{"title":"状态估计与SLAM","blurb":"回答「我在哪」：从各类里程计和多传感器融合，到 SLAM 与已知地图里的定位。"},{"title":"地图、语义与空间智能","blurb":"在定位之上理解整个场景：几何与语义地图、场景图，到大模型的空间推理与主动感知。"}]},{"key":"software","name":"软件与工具链","blurb":"把本体、控制和感知串起来的软件：ROS 2、URDF、运动库、学习框架和部署工具。","sections":[{"title":"开发环境基础","blurb":"先把电脑配好：编程语言、Linux、代码仓库、环境隔离、GPU 与远程登录。"},{"title":"ROS 2 入门","blurb":"环境就绪后学机器人软件的「胶水」：节点与话题等通信方式，以及项目怎么组织。"},{"title":"机器人模型与坐标系","blurb":"会用 ROS 后，用 URDF 等文件描述机器人，再用 TF、RViz 看到它。"},{"title":"通信中间件进阶","blurb":"回到通信层深挖：DDS、QoS、零拷贝，以及 ROS 之外的通信库和框架。"},{"title":"连接真机与实时系统","blurb":"通信打通后接上真机：厂商 SDK、驱动、嵌入式与实时系统，把指令送到电机。"},{"title":"运动学、规划与控制库","blurb":"真机能收发指令后，用现成库算运动学、规划无碰撞轨迹、求解优化控制。"},{"title":"感知、建图与导航","blurb":"让机器人看懂环境：图像与点云库、标定、SLAM 建图，再到自主导航。"},{"title":"数据记录与可视化","blurb":"把传感器和机器人状态录下来、画出来：既用来调试，也为后面的学习攒数据。"},{"title":"深度学习与机器人学习库","blurb":"有了数据就能学：深度学习框架、模型仓库，再到 LeRobot 与强化学习库。"},{"title":"训练工程与算力","blurb":"把训练跑起来再放大：租卡、记实验、省显存、多卡与集群、大规模强化学习。"},{"title":"部署与推理加速","blurb":"训好的策略搬回机器人：远程或端侧运行，再靠算子优化、导出和推理引擎提速。"},{"title":"产业平台与生态","blurb":"最后看厂商如何把前面各层打包：英伟达 Isaac、国产机器人 OS 与云平台。"}]},{"key":"sim","name":"仿真与评测","blurb":"在电脑里练和考：仿真器怎么工作、仿真和真机的差距，以及常用的评测基准。","sections":[{"title":"仿真基本概念","blurb":"在电脑里练机器人的第一步：仿真器是什么、怎么一步步交互、怎样又快又真。"},{"title":"物理引擎：刚体与接触","blurb":"拆开上一节的物理引擎，看它每一步怎样算刚体运动、碰撞和接触力。"},{"title":"软体、流体与可微仿真","blurb":"从不变形的刚体扩展到布、绳、液体等会变形的物体，再看能求梯度的仿真。"},{"title":"渲染与传感器仿真","blurb":"物理之外的另一半：把场景画成相机图像，并模拟触觉等传感器的读数。"},{"title":"主流仿真器与框架","blurb":"物理和渲染落到具体软件上：MuJoCo、Isaac 两大家族和其他常用仿真器。"},{"title":"场景、资产与室内平台","blurb":"有了仿真器，还要往里放东西：物体资产、现成室内场景，以及自动批量造场景。"},{"title":"从仿真到真机","blurb":"在仿真里练好后怎么上真机：先认清虚实差距，再学随机化和把现实搬进仿真。"},{"title":"评测方法与指标","blurb":"练完开始考：成功率怎么算，真机和仿真怎么测，结果怎样才可信、可比。"},{"title":"桌面操作基准","blurb":"用上一节的方法读具体考卷，先从最常见的机械臂桌面操作基准开始。"},{"title":"家务、导航与问答基准","blurb":"从桌面扩展到整栋房子：长程家务、语言导航、具身问答和大模型当大脑。"},{"title":"强化学习与运动控制基准","blurb":"换一类任务：强化学习的经典考题，以及足式、人形机器人练走路的环境和基准。"},{"title":"真机与世界模型评测","blurb":"跳出固定的仿真考卷：真机上大规模评测，用世界模型评策略，以及怎么评世界模型。"}]},{"key":"data","name":"数据与采集","blurb":"学习的原料：演示数据怎么采、有哪些数据集、数据怎么处理和规模化。","sections":[{"title":"数据的基本单位与来源","blurb":"先认识一条演示数据由观测和动作组成，再看真机、仿真、人类视频几大来源。"},{"title":"用真机采：遥操作与示教","blurb":"从几大来源里最可靠的真机数据学起：人推着、扳着或远程操控机器人把过程录下。"},{"title":"不用真机：手持与穿戴采集","blurb":"遥操作离不开真机、又贵又慢，于是改让人拿仿机器人夹爪或戴设备直接干活。"},{"title":"动作捕捉与人形动作数据","blurb":"从手扩展到全身：用动捕录下人的整套动作，再换算成人形机器人能跟的轨迹。"},{"title":"人类视频与第一人称数据","blurb":"再退一步只拍人干活：视频量最大最便宜，难点是缺动作标签、人手不像机器人。"},{"title":"仿真资产与合成数据","blurb":"不再靠人一条条采：备好物体和场景资产，在仿真里批量生成演示或用生成模型造。"},{"title":"主流真机数据集","blurb":"回到真机看公开数据集：先看汇总多种机器人的 OXE，再按时间看各家代表。"},{"title":"数据格式与工具","blurb":"上节数据集存成什么文件、用什么库读：从 HDF5、RLDS 到 LeRobot。"},{"title":"清洗、标注与配比","blurb":"有了原始数据还要加工：清洗质检、补标注，再挑选、按比例混合后才拿去训练。"},{"title":"规模化：数采厂到数据飞轮","blurb":"最后看怎么把数据量做上去：数采厂、众包、机器人自采，直到部署回流形成飞轮。"}]},{"key":"training","name":"训练与学习方法","blurb":"模型怎么学出来：模仿学习、强化学习、预训练和微调，以及让它更稳的技巧。","sections":[{"title":"学习范式总览","blurb":"数据备好后，先认识几种基本学法：有答案、没答案、自造答案、照示范、靠奖励。"},{"title":"训练基本功","blurb":"不管哪种学法，训练都是算损失、求梯度、更新参数，还要防过拟合、保稳定。"},{"title":"损失函数与训练目标","blurb":"把上一节的损失函数展开讲：回归、分类、序列预测和扩散生成各用什么目标。"},{"title":"模仿学习","blurb":"套用前面的监督训练照人类示范学动作，并看它为什么会越走越偏。"},{"title":"强化学习核心概念","blurb":"示范之外的第二条路是靠奖励试错，先掌握奖励、回报、价值这些基本概念。"},{"title":"强化学习经典算法","blurb":"把上一节的概念落成具体算法：从策略梯度、PPO 到 DQN、SAC。"},{"title":"奖励从哪来","blurb":"算法有了还得给对奖励：手写、从示范或模型学出来，以及奖励稀疏时怎么办。"},{"title":"离线强化学习","blurb":"前面的算法都要边交互边学，这一节改为只用现成数据学策略，再接上在线微调。"},{"title":"预训练与表征学习","blurb":"从强化学习转到大模型路线：先在海量多源数据上预训练、学出通用表征。"},{"title":"微调与后训练","blurb":"预训练完再适配具体任务：微调、监督和强化学习后训练，以及防遗忘和蒸馏。"},{"title":"从仿真到真机","blurb":"落到机器人上：仿真里大规模练、迁到真机，再在真机上靠试错和人工纠正接着学。"},{"title":"推理时提升与快速适应","blurb":"训练收尾后，不改或少改权重也能变强：推理时多算，或快速适应新任务。"}]},{"key":"model","name":"模型与架构","blurb":"学出来的模型长什么样：Transformer、VLM、动作怎么生成、VLA 和世界模型。","sections":[{"title":"神经网络基础","blurb":"从最基本的神经网络零件和经典结构学起，后面所有模型都用它们搭成。"},{"title":"从注意力到大语言模型","blurb":"大模型的共同主干：token、注意力和 Transformer，再到大语言模型。"},{"title":"视觉编码器与视觉语言模型","blurb":"给语言模型装上眼睛：先看图像怎样变成 token，再看 VLA 的底座 VLM。"},{"title":"生成模型入门","blurb":"前面的模型只给一个答案；这里学整个数据分布，以及把向量变成离散码。"},{"title":"扩散模型与流匹配","blurb":"上节生成模型的主力路线：加噪去噪与流匹配，动作和视频生成都靠它。"},{"title":"动作怎么表示和输出","blurb":"有了网络和生成方法，看机器人动作怎样表示，又怎样回归、离散或生成出来。"},{"title":"VLA 的结构与扩展","blurb":"VLM 接上动作输出就成了 VLA：看它怎样出动作、跨机器人、接更多传感器。"},{"title":"分层系统与具身推理","blurb":"和上节端到端相对：规划与控制分给不同模型，再让模型先推理后行动。"},{"title":"世界模型与视频生成","blurb":"用前面的生成模型预测「做了动作世界会怎样」，最后与动作生成合二为一。"},{"title":"推理加速、部署与可靠性","blurb":"前面所有模型最终都要上机：怎样更快更省，以及怎样知道它没把握。"}]},{"key":"named_model","name":"代表性模型与工作","blurb":"按发展脉络看有名的模型：从 SayCan、RT-2 到 π 系列、GR00T 和世界模型。","sections":[{"title":"具身借用的基础大模型","blurb":"具身模型的「眼睛」和「大脑」多是借来的：先认识这些大模型和视觉编码器"},{"title":"大模型当大脑","blurb":"有了大模型，最早的用法是当大脑：拆任务、写代码和奖励、看懂空间，再调现成技能"},{"title":"端到端学习与 RT 系列","blurb":"另一条路是端到端学控制：从真机学抓取到通才模型，再到 RT-2 首提 VLA"},{"title":"模仿学习经典策略","blurb":"同期小模型模仿学习也在进化：从 PerAct 到扩散策略、ACT，学会精细双臂活"},{"title":"开源通用策略与 VLA","blurb":"RT 与模仿学习汇成开源 VLA：Octo、OpenVLA 之后，改进百花齐放"},{"title":"π 系列与强化学习","blurb":"PI 的 π 系列是 VLA 标杆；再看强化学习怎样让策略从经验里变强"},{"title":"海外巨头与明星公司","blurb":"技术路线讲完看公司：英伟达、Figure、谷歌等海外公司各自的基座模型"},{"title":"国内具身模型","blurb":"再看国内：大厂、研究院和创业公司的基座，多在 VLA 与世界动作模型两条路上"},{"title":"世界模型与视频学习","blurb":"回到世界模型这条线：先在想象里练策略，再生成世界、从视频里学动作"},{"title":"足式、灵巧手与敏捷技能","blurb":"从操作转向运动：四足越野跑酷、灵巧手转物体，都在仿真里强化学习练成再上真机"},{"title":"人形全身控制与遥操作","blurb":"同一套方法搬到人形：从动画角色模仿、双足行走，到全身遥操作和动作跟踪"},{"title":"导航与自动驾驶","blurb":"最后看移动：导航从拼模块找路到导航大模型，自动驾驶从 ALVINN 走到 VLA"}]},{"key":"company","name":"公司与机构","blurb":"谁在做具身智能：科技巨头、国内外本体和模型公司、零部件厂商和研究机构。","sections":[{"title":"科技巨头的具身布局","blurb":"学完模型看公司：谷歌、英伟达等大厂出算力、平台和模型，也造机器人、投创业公司。"},{"title":"海外具身大模型公司","blurb":"大厂之外，海外一批创业公司主攻机器人大脑，PI 和 Skild 领头。"},{"title":"海外人形与本体公司","blurb":"大脑要装进身体：Figure、波士顿动力、1X 等海外公司造人形和各类本体。"},{"title":"国内人形与本体公司","blurb":"回到国内，造本体的公司最多：宇树、智元、优必选领头，人形、四足、轮式双臂都有。"},{"title":"国内具身大模型公司","blurb":"国内也有主攻大脑的一拨：自变量、千寻、智平方领头，不少团队出自高校和智驾圈。"},{"title":"跨界入局：汽车与消费电子","blurb":"原生具身公司之外，汽车和消费电子公司也跨界造机器人，小米、小鹏是代表。"},{"title":"机械臂、服务与物流机器人","blurb":"人形热之前就在卖的机器人：科研常用机械臂、工业四大家族，以及服务和物流机器人。"},{"title":"世界模型、仿真与数据","blurb":"从造机器人转到上游：这拨公司主打世界模型、仿真平台和训练数据，给大脑供料。"},{"title":"核心零部件与灵巧手","blurb":"软件上游之后看硬件上游：灵巧手、夹爪、减速器、丝杠、电机、关节和控制器。"},{"title":"传感器、动捕与芯片","blurb":"零部件管「动」，这拨管「看、摸、算」：相机雷达、触觉力觉、动捕设备和芯片。"},{"title":"研究机构与高校实验室","blurb":"产业链之外，是出论文、出人才的地方：高校实验室、企业研究院和国内新型研发机构。"},{"title":"历史名企与行业组织","blurb":"最后是背景板：开过路或已退场的名企，以及办赛、办会、发报告、出钱的组织。"}]},{"key":"industry","name":"行业黑话与商业","blurb":"看懂新闻稿、路演和群聊里的说法：本体、大小脑、数据飞轮、量产……","sections":[{"title":"行业地图：谁在做什么","blurb":"学完技术和公司，先拼行业地图：产业链怎么分段，各类玩家做什么、从哪来。"},{"title":"路线之争","blurb":"认清玩家后看他们争什么：人形与否、真机或仿真、软硬一体或解耦、怎样走向通用。"},{"title":"看懂 Demo 与榜单","blurb":"路线好不好要看成果：学会读 Demo 和榜单，分清自主与遥控、剪辑与挑结果。"},{"title":"论文、会议与期刊","blurb":"比 Demo 更严谨的证据在论文里：认识预印本、顶会和机器人主流会议与期刊。"},{"title":"大会、比赛与出圈事件","blurb":"走出学术会议，看公众舞台：大会、发布会、春晚和机器人赛事，用前面学的眼光看。"},{"title":"量产与供应链","blurb":"表演之外，机器人得先造出来：量产怎么算、为什么难、成本与供应链、验证阶段。"},{"title":"场景落地与工厂自动化","blurb":"造出来还要进场景干活：落地分几步、工厂拿什么考核、工厂为什么需要机器人。"},{"title":"商业模式与市场","blurb":"能干活之后要能赚钱：卖给谁、怎么收费，以及有没有跑通商业闭环。"},{"title":"冷热、融资与上市","blurb":"商业故事最终要讲给资本听：先辨行业冷热与泡沫，再看融资、上市和概念股。"},{"title":"政策与标准","blurb":"资本之外还有政府推动：国家定调、专项文件、揭榜与场景开放，最后是标准和新职业。"}]}],"terms":[{"id":"embodied-ai","category":"concept","sec":0,"tier":1,"sources":[{"title":"维基百科：具身智能","url":"https://zh.wikipedia.org/wiki/具身智能"},{"title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","url":"https://arxiv.org/abs/2407.06886"}],"as_of":"","related_ids":["disembodied-ai","physical-ai","embodied-agent","embodied-cognition","general-purpose-robot","vision-language-action-model"],"name":"具身智能","alt":"Embodied AI","abbr":"","aliases":["具身人工智能","Embodied Intelligence","EAI","Embodied Artificial Intelligence"],"one_liner":"有身体、能在物理世界中感知、决策和行动的人工智能。","explanation":"具身智能指拥有物理实体（或仿真中的身体），通过与环境实时交互来感知、决策和行动的智能系统，典型载体是机器人和自动驾驶汽车。与之相对的是离身智能，比如 ChatGPT 这类只处理文字图片、不直接作用于物理世界的模型。思想源头常追溯到图灵 1950 年的论文《计算机器与智能》，以及 20 世纪 80–90 年代布鲁克斯等人强调身体与环境交互的机器人研究。它的核心是「感知—决策—行动—反馈」的闭环。近几年大语言模型和视觉语言模型让机器人能理解开放指令，具身智能成为热点，常被视为实现通用人工智能（AGI）的关键一环。","example":"家用机器人听到「把脏衣服放进洗衣机」，要自己找到衣服、走过去、抓起来、打开机门放进去，全程靠视觉反馈调整动作，这是具身智能；ChatGPT 只能告诉你步骤，属于离身智能。","related":["离身智能","物理AI","具身智能体","具身认知","通用机器人","视觉-语言-动作模型"]},{"id":"disembodied-ai","category":"concept","sec":0,"tier":2,"sources":[{"title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI (arXiv 2407.06886)","url":"https://arxiv.org/abs/2407.06886"}],"as_of":"","related_ids":["embodied-ai","embodied-cognition","large-language-model","moravec-s-paradox","language-grounding"],"name":"离身智能","alt":"Disembodied AI","abbr":"","aliases":["非具身智能","离身AI","Non-embodied AI"],"one_liner":"没有身体、只在数字世界里处理信息的 AI，如聊天机器人、图像识别模型。","explanation":"离身智能是与具身智能相对的说法，指不依附物理身体、只在网络空间中感知和决策的 AI：输入是文本、图片、视频等数据，输出是文字、标签或图像，不需要亲自动手改变物理环境。ChatGPT 这类大语言模型、人脸识别、推荐系统都属于此类。中山大学 Liu 等人 2024 年的具身智能综述用一张表对比两者：离身智能的认知与物理实体是分开的，具身智能的认知融入机器人、汽车等实体。这个区分的意义在于：离身模型从互联网数据学到的知识很强，但缺少与真实世界交互的反馈，放进机器人还要解决语言接地（把词和真实物体、动作对应起来）、动作输出和实时性问题。","example":"ChatGPT 能写出叠衣服的详细步骤，但它没有手，不能真的把衣服叠好；让机器人照着这些步骤叠出来，就是具身智能要解决的事。","related":["具身智能","具身认知","大语言模型","莫拉维克悖论","语言接地"]},{"id":"physical-ai","category":"concept","sec":0,"tier":1,"sources":[{"title":"What is Physical AI? (NVIDIA Glossary)","url":"https://www.nvidia.com/en-us/glossary/generative-physical-ai/"},{"title":"NVIDIA Launches Cosmos World Foundation Model Platform to Accelerate Physical AI Development (NVIDIA Newsroom, 2025-01-06)","url":"https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-world-foundation-model-platform-to-accelerate-physical-ai-development"}],"as_of":"2026-09","related_ids":["embodied-ai","world-foundation-model","nvidia-cosmos","nvidia-three-computer-solution","sim-to-real-transfer","chatgpt-moment-for-robotics"],"name":"物理AI","alt":"Physical AI","abbr":"","aliases":["物理人工智能","物理智能","生成式物理 AI"],"one_liner":"能感知、理解物理世界并在其中行动的 AI，如机器人和自动驾驶。","explanation":"物理 AI 是英伟达大力推广的说法，官方定义为能在物理世界中感知、理解、推理，并执行或协调复杂动作的系统，覆盖机器人、自动驾驶汽车，以及用固定摄像头优化工厂和仓库的「智能空间」。它关注的问题和学术界常说的「具身智能」基本重合，但范围更宽，连只靠固定摄像头、没有身体的「智能空间」也算在内。英伟达给出的开发流程分三步：在数据中心训练模型；在仿真平台 Omniverse 和世界基础模型 Cosmos 里做仿真、生成合成数据；再部署到 Jetson、DRIVE 等端侧计算平台。2025 年 1 月 CES 上发布 Cosmos 时，黄仁勋说「机器人的 ChatGPT 时刻即将到来」。","example":"自动驾驶汽车实时处理传感器数据决定转向和刹车，仓库里的自主移动机器人避开障碍搬运货物，都属于英伟达所说的物理 AI。","related":["具身智能","世界基础模型","Cosmos","英伟达三台计算机","仿真到现实迁移","ChatGPT 时刻"]},{"id":"autonomous-driving","category":"concept","sec":0,"tier":2,"sources":[{"title":"Self-driving car - Wikipedia（含 SAE J3016 分级）","url":"https://en.wikipedia.org/wiki/Self-driving_car"}],"as_of":"","related_ids":["end-to-end","world-model","lidar","levels-of-autonomy","autonomous-driving-talent-moving-into-embodied-ai","embodied-ai"],"name":"自动驾驶","alt":"Autonomous Driving","abbr":"","aliases":["智驾","智能驾驶","无人驾驶","Self-driving"],"one_liner":"让汽车在少人或无人干预下自己感知路况、做决策并控制行驶。","explanation":"自动驾驶指车辆依靠摄像头、激光雷达、毫米波雷达等传感器和车载计算机，自主完成感知、决策规划和控制。美国汽车工程师学会的 SAE J3016 标准把它分为 L0 到 L5 六级：L2 系统同时管转向和速度，但驾驶员要全程盯着；L3 起系统在特定条件下接管驾驶，需要时请人接手；L4 在限定区域内可以完全无人；L5 在任何条件下都不需要人。国内常说的「智驾」多指 L2 级辅助驾驶。自动驾驶可看作最早规模化落地的具身智能，端到端模型、世界模型、仿真和数据闭环等技术两边相通，业内也常说「智驾转具身」。","example":"城市 NOA（领航辅助驾驶）能在城区自动跟车、变道、过路口，但驾驶员必须随时准备接管，属于 L2 级。","related":["端到端","世界模型","激光雷达","自主等级","智驾转具身","具身智能"]},{"id":"agentenvironment-interaction","category":"concept","sec":0,"tier":1,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"Gymnasium Documentation: Basic Usage","url":"https://gymnasium.farama.org/introduction/basic_usage/"}],"as_of":"","related_ids":["reinforcement-learning","markov-decision-process","observation","action-space","reward-function","environment"],"name":"智能体与环境","alt":"Agent and Environment (Agent-Environment Interaction)","abbr":"","aliases":["智能体-环境交互","Agent-Environment Loop","Agent-Environment Interface"],"one_liner":"做决策的一方叫智能体，它身处并能影响的外部世界叫环境。","explanation":"这是强化学习描述问题的基本框架。智能体是做决策的一方，环境是它之外、它能观察和影响的一切。两者循环交互：智能体看到当前观测，选一个动作；环境据此变到新状态，返回新观测和奖励（衡量好坏的一个数），如此往复直到回合结束。在具身智能里，智能体通常是机器人上运行的策略模型，环境是真实世界或仿真器，包括桌面、物体和周围的人。这个框架让导航、抓取、行走等不同问题能用同一套术语描述；Gymnasium 等强化学习环境库也按它设计接口，用 reset 开始新回合、用 step 执行一步动作。","example":"机械臂叠毛巾：智能体是叠毛巾的策略，环境是桌面、毛巾所在的真实场景；策略每一步根据相机画面（观测）输出一组关节动作，环境随之变化，再返回动作后的新画面。","related":["强化学习","马尔可夫决策过程","观测","动作空间","奖励函数","环境（Env）与 reset / step 接口"]},{"id":"embodied-agent","category":"concept","sec":0,"tier":2,"sources":[{"title":"Embodied agent - Wikipedia","url":"https://en.wikipedia.org/wiki/Embodied_agent"},{"title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI (arXiv 2407.06886)","url":"https://arxiv.org/abs/2407.06886"}],"as_of":"","related_ids":["embodied-ai","agentenvironment-interaction","perception-action-loop","disembodied-ai","policy"],"name":"具身智能体","alt":"Embodied Agent","abbr":"","aliases":["具身代理"],"one_liner":"拥有物理或虚拟身体、通过感知和动作与环境交互的智能体。","explanation":"智能体（agent）指能感知环境、并采取行动去达成目标的系统；具身智能体强调它有一个身体，并通过这个身体在环境中感知和行动。维基百科的定义是：通过身处环境中的物理身体与环境交互的智能体；广义上也包括仿真器或游戏里的虚拟身体。它和只输出文字的对话式智能体不同，需要把理解指令、主动探索、多模态感知和执行动作串成闭环。Liu 等人 2024 年的综述把具身智能体列为具身智能四大研究目标之一，并认为多模态大模型是它目前主流的大脑。真实机器人、自动驾驶汽车、Habitat 等仿真器里的导航智能体都属于此类。","example":"在家庭仿真器 Habitat 中，一个带相机的虚拟机器人收到去厨房找杯子的指令，自己移动、观察，最终停在杯子前面，它就是一个具身智能体。","related":["具身智能","智能体与环境","感知-行动闭环","离身智能","策略"]},{"id":"embodiment","category":"concept","sec":0,"tier":1,"sources":[{"title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models（项目页）","url":"https://robotics-transformer-x.github.io/"},{"title":"Open X-Embodiment 论文（arXiv 2310.08864）","url":"https://arxiv.org/abs/2310.08864"}],"as_of":"","related_ids":["cross-embodiment","embodiment-gap","embodiment-agnostic","degrees-of-freedom","humanoid-robot","robot-body-maker"],"name":"本体","alt":"Robot Embodiment","abbr":"","aliases":["机器人本体","具身形态","Embodiment","Robot Body"],"one_liner":"机器人的物理身体：形态、关节、传感器和执行器的具体组合。","explanation":"本体是国内具身智能圈对机器人「身体」的叫法，对应英文 embodiment，指一台机器人具体的硬件形态：是单臂、双臂、四足还是人形，有多少自由度（可粗略理解为能独立活动的关节数），装了哪些相机和力传感器，末端是夹爪还是灵巧手。本体决定了策略能看到什么（观测空间）、能输出什么（动作空间），同一个模型换一种本体往往不能直接用，这叫本体差异。Open X-Embodiment 数据集汇集了 22 种本体的数据，就是为了研究跨本体迁移。行业里「本体厂商」指造机器人硬件的公司，与只做模型的「大脑公司」相对。","example":"Franka 机械臂和宇树 G1 人形机器人是两种差别很大的本体：前者是 7 个关节加一个二指夹爪，后者要同时控制腿、腰和双臂的二十多个关节。","related":["跨本体","本体差异","本体无关","自由度","人形机器人","本体厂商"]},{"id":"perception-action-loop","category":"concept","sec":0,"tier":2,"sources":[{"title":"Embodied cognition - Wikipedia","url":"https://en.wikipedia.org/wiki/Embodied_cognition"},{"title":"Sensory-motor coupling - Wikipedia","url":"https://en.wikipedia.org/wiki/Sensory-motor_coupling"}],"as_of":"","related_ids":["embodied-ai","closed-loop-control","open-loop-control","embodied-cognition","sense-plan-act","active-perception"],"name":"感知-行动闭环","alt":"Perception-Action Loop","abbr":"","aliases":["感知-动作循环","感知运动回路","感知-行动循环"],"one_liner":"感知决定动作，动作又改变下一刻的感知，两者不断循环往复。","explanation":"感知-行动闭环描述智能体和环境之间持续往复的过程：传感器拿到观测，策略给出动作，动作改变了环境和自身位置，于是下一刻看到的东西也变了。这个想法来自认知科学和生态心理学，Gibson、Varela 等人都强调感知不是被动接收，而是和身体运动耦合在一起；机器人学家 Rodney Brooks 也主张智能要通过身体与世界相连。它是具身智能和离身 AI 的关键区别：图像分类模型看一张图给一个答案就结束，机器人策略则要以每秒几次到几十次的频率反复观测、出动作、再观测，才能纠正误差、应对变化。","example":"机械臂抓杯子时，手腕相机每帧都看到杯子和夹爪的相对位置，策略据此修正下一步；杯子被碰歪了也能跟过去重新对准。","related":["具身智能","闭环","开环","具身认知","感知-规划-行动范式","主动感知"]},{"id":"robot-learning","category":"concept","sec":0,"tier":1,"sources":[{"title":"Robot learning - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_learning"}],"as_of":"","related_ids":["imitation-learning","reinforcement-learning","policy","sim-to-real-transfer","foundation-model","embodied-ai"],"name":"机器人学习","alt":"Robot Learning","abbr":"","aliases":["机器人学习方法"],"one_liner":"用机器学习让机器人从数据和交互中习得技能，而不是靠手写规则。","explanation":"机器人学习是机器学习与机器人学的交叉领域，研究让机器人通过学习算法获得新技能或适应环境，而不是由工程师逐条编写控制程序。主要路线有模仿学习（从人类演示中学，比如遥操作采集的数据）、强化学习（在仿真或真机上靠奖励试错），以及近几年用大规模数据预训练的机器人基础模型。它要解决的核心难题是：真机数据少且贵、真机试错有风险、仿真和现实之间有差距。该领域的专门会议是 CoRL（Conference on Robot Learning），具身智能里的大部分模型研究都属于这个范畴。","example":"用遥操作采集几十条叠毛巾的演示，训练一个 ACT 策略，让双臂机器人自己学会叠毛巾，而不需要人写出每一步的关节角。","related":["模仿学习","强化学习","策略","仿真到现实迁移","基础模型","具身智能"]},{"id":"general-purpose-robot","category":"concept","sec":0,"tier":1,"sources":[{"title":"Figure AI: Master Plan","url":"https://www.figure.ai/master-plan"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"2024-10","related_ids":["embodied-ai","generalist-policy","humanoid-robot","industrial-robot","embodied-foundation-model","pi0"],"name":"通用机器人","alt":"General-purpose Robot","abbr":"","aliases":["通才机器人","Generalist Robot","通用型机器人"],"one_liner":"不为单一任务定制、能在多种场景下完成多种任务的机器人。","explanation":"通用机器人是相对专用机器人说的。传统工业机器人为某条产线、某道工序编程，换任务就要重新编程、改工装；通用机器人希望像人一样，一套硬件加一个智能系统就能做很多事，还能应付没见过的物体和环境。硬件上多选人形或双臂移动平台，因为门、工具、楼梯都是按人体设计的，Figure 等公司就以此作为做人形的理由；软件上依赖通用策略或具身大模型，从大规模数据中学到跨任务能力，例如 Physical Intelligence 的 π0 用单臂、双臂和移动操作机器人的数据训练，能叠衣服、收拾桌子、组装纸箱。目前各家产品离这个目标都还有距离，它是具身智能的长期方向。","example":"Figure 在落款 2022 年 5 月的公司规划（Master Plan）里提出做「通用人形机器人」：用一种人形硬件承担大量原本由人做的工作，而不是为每个任务造一种专用机器人。","related":["具身智能","通用策略（通才策略）","人形机器人","工业机器人","具身大模型","π0"]},{"id":"moravec-s-paradox","category":"concept","sec":0,"tier":1,"sources":[{"title":"Moravec's paradox (Wikipedia)","url":"https://en.wikipedia.org/wiki/Moravec%27s_paradox"}],"as_of":"","related_ids":["embodied-ai","sensorimotor-skills","embodied-cognition","the-bitter-lesson","physical-turing-test"],"name":"莫拉维克悖论","alt":"Moravec's Paradox","abbr":"","aliases":["莫拉维克佯谬","Moravec 悖论"],"one_liner":"对机器来说，高级推理容易，人类习以为常的感知和运动反而最难。","explanation":"1988 年，机器人学家汉斯·莫拉维克在《Mind Children》一书中指出：让计算机在智力测验或下跳棋上达到成人水平相对容易，让它拥有一岁小孩的感知和行动能力却很难甚至做不到。罗德尼·布鲁克斯、马文·明斯基等人在 1980 年代也表达过类似看法，平克后来概括为「难的问题容易，容易的问题难」。常见解释是：感知和运动技能经过漫长进化打磨，人做起来毫不费力，因而低估了它们的难度；抽象推理在进化上出现得晚，人脑并不擅长，所以显得难，对计算机来说其实没那么难。这条悖论常被用来解释为什么大模型能写代码、解数学题，机器人叠衣服却还远不如人又快又稳，也是具身智能被视为 AI 下一道难关的理由之一。","example":"大语言模型已经能解竞赛数学题，但叠衣服、系鞋带这类小孩都会的事，机器人做起来仍远不如人快、不如人稳。","related":["具身智能","感觉运动技能","具身认知","苦涩的教训","物理图灵测试"]},{"id":"sensorimotor-skills","category":"concept","sec":0,"tier":3,"sources":[{"title":"Moravec's paradox - Wikipedia","url":"https://en.wikipedia.org/wiki/Moravec%27s_paradox"},{"title":"End-to-End Training of Deep Visuomotor Policies (arXiv 1504.00702)","url":"https://arxiv.org/abs/1504.00702"},{"title":"Sensory-motor coupling - Wikipedia","url":"https://en.wikipedia.org/wiki/Sensory-motor_coupling"}],"as_of":"","related_ids":["moravec-s-paradox","perception-action-loop","visuomotor-policy","embodied-cognition","end-to-end-training-of-deep-visuomotor-policies"],"name":"感觉运动技能","alt":"Sensorimotor Skills","abbr":"","aliases":["感知运动技能","感觉-运动技能"],"one_liner":"把感官信息实时转成身体动作的能力，比如抓、走、接、拧。","explanation":"感觉运动技能一词源自认知科学和神经科学，指把视觉、触觉、本体感觉等感官输入和肌肉动作紧密耦合起来完成的技能，如伸手抓物、走路保持平衡、接住抛来的球。在机器人领域，它泛指需要感知与控制实时闭环配合的底层能力。莫拉维克悖论指出，人觉得毫不费力的感觉运动技能对机器反而最难，因为它们是长期进化打磨出来的。2015 年 Levine 等人的端到端视觉运动策略工作用卷积网络直接把图像映射成电机力矩，是用深度学习学这类技能的代表作；今天的视觉运动策略和 VLA，本质上也是在学感觉运动技能。","example":"拧瓶盖：机器人要一边看瓶口位置，一边根据手上的受力微调角度和力度，Levine 等人的端到端视觉运动策略就把它当作测试任务之一。","related":["莫拉维克悖论","感知-行动闭环","视觉运动策略","具身认知","端到端视觉运动策略（引导策略搜索）"]},{"id":"manipulation","category":"concept","sec":1,"tier":1,"sources":[{"title":"Russ Tedrake, Robotic Manipulation (MIT course notes), Ch.1 Introduction","url":"https://manipulation.csail.mit.edu/intro.html"}],"as_of":"","related_ids":["grasping","dexterous-manipulation","bimanual-manipulation","contact-rich-manipulation","mobile-manipulation","locomotion"],"name":"操作","alt":"Robotic Manipulation","abbr":"","aliases":["机器人操作","操控","操纵","Manipulation"],"one_liner":"机器人用手或工具接触物体，改变它的位置、姿态或状态。","explanation":"操作指机器人用机械臂、夹爪或灵巧手接触物体并改变它的位置、姿态或状态，比如抓取、放置、开抽屉、倒水、叠衣服。它和「运动（移动）」是具身智能的两大能力方向：运动管身体怎么走，操作管手怎么干活。MIT 教授 Russ Tedrake 在讲义《Robotic Manipulation: Perception, Planning, and Control》中指出，操作远不止抓取放置：手要不断建立和断开接触、施加力、在「粘住」和「滑动」两种摩擦状态间快速切换，光这些在动力学和控制上就很难；装洗碗机、叠衣服这类人觉得平常的事，对机器人仍极具挑战，处在机器人研究的最前沿。常见细分有灵巧操作、双臂操作、接触丰富操作、柔性物体操作等。","example":"让双臂机器人把洗碗机里的碗逐个取出、放进橱柜，是一个包含多次抓取和放置的长程操作任务。","related":["抓取","灵巧操作","双臂操作","接触丰富操作","移动操作","运动（移动）"]},{"id":"grasping","category":"concept","sec":1,"tier":1,"sources":[{"title":"Data-Driven Grasp Synthesis - A Survey (Bohg et al., arXiv:1309.2660)","url":"https://arxiv.org/abs/1309.2660"}],"as_of":"","related_ids":["pick-and-place","grasp-pose-detection","force-closure","gripper","dexterous-hand","bin-picking"],"name":"抓取","alt":"Grasping","abbr":"","aliases":["机器人抓取","Robotic Grasping"],"one_liner":"机器人用夹爪、吸盘或灵巧手把物体稳稳拿起来。","explanation":"抓取指机器人用末端执行器（夹爪、吸盘或灵巧手）稳定地握住物体并拿起。核心问题是「从哪儿抓、用什么姿态抓」：算法根据相机图像或点云算出抓取位姿（夹爪的位置和朝向），再由运动规划把手移过去。早期方法靠几何和力学分析，例如判断是否满足力封闭（手指接触力能抵抗来自任意方向的外力和力矩）；Bohg 等人 2013 年的综述把数据驱动方法按已知物体、相似物体、未知物体三类梳理。现在常见做法是用深度网络在点云上直接预测抓取位姿，或由 VLA 模型端到端输出抓取动作。抓取是抓取放置、移动操作等许多操作任务的第一步。","example":"深度相机拍下杂乱的桌面，网络在点云上给出几十个候选夹爪位姿并打分，机器人选分最高的那个去夹起马克杯。","related":["抓取放置","抓取位姿检测","力封闭","夹爪","灵巧手","无序抓取"]},{"id":"pick-and-place","category":"concept","sec":1,"tier":1,"sources":[{"title":"Transporter Networks: Rearranging the Visual World for Robotic Manipulation (arXiv:2010.14406)","url":"https://arxiv.org/abs/2010.14406"}],"as_of":"","related_ids":["grasping","rearrangement","skill-primitive","sorting","palletizing-depalletizing","transporter-networks"],"name":"抓取放置","alt":"Pick-and-Place","abbr":"","aliases":["拾取放置","抓放","Pick and Place"],"one_liner":"把物体从一处拿起、移动并放到指定位置的基础操作任务。","explanation":"抓取放置是最基础也最常见的操作任务：先抓起目标物体，再移到目标位置放下。工业上它早已用于分拣、上下料、码垛等环节，通常靠固定程序加视觉定位完成；在机器人学习里，它是 VLA 和模仿学习论文的常规测试任务，指令多为「把 A 放到 B 里/上」。它看似简单，却串起识别目标、选抓取点、规划避障轨迹、确定放置位姿几个环节，也常作为原子技能组合进长程任务。2020 年谷歌的 Transporter Networks 把抓取放置建模为「从哪里拿、移到哪里」的空间位移，学会了堆积木、装配套件等任务，样本效率比当时的对比方法高出几个数量级。","example":"指令「把红色方块放进碗里」：机器人先夹起方块，移到碗上方，再松开夹爪。","related":["抓取","物体重排","原子技能","分拣","码垛 / 拆垛","Transporter Networks"]},{"id":"bimanual-manipulation","category":"concept","sec":1,"tier":1,"sources":[{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ALOHA / ACT)","url":"https://arxiv.org/abs/2304.13705"},{"title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","url":"https://arxiv.org/abs/2401.02117"}],"as_of":"2024-01","related_ids":["dual-arm-robot","aloha","action-chunking-with-transformers","mobile-aloha","dexterous-manipulation","mobile-manipulation"],"name":"双臂操作","alt":"Bimanual Manipulation","abbr":"","aliases":["双手操作","双臂协同操作","Dual-arm Manipulation"],"one_liner":"机器人用两条手臂互相配合，完成一个操作任务。","explanation":"双臂操作指机器人同时控制两条机械臂（或人形机器人的两只手）协同完成任务，比如一只手扶住瓶子、另一只手拧盖子，或两手一起叠衣服。很多日常任务单臂做不了或做不好，所以它是家务、装配等场景的核心能力。难点在于动作维度翻倍，两臂要在时间和空间上精确配合，还常碰到柔性物体和密集接触。2023 年 Tony Zhao、Chelsea Finn 等人的 ALOHA 用低成本双臂遥操作平台加 ACT 算法，每个任务只用约 10 分钟（50 条）演示，就让机器人在打开半透明调料杯、给遥控器装电池等精细任务上达到 80%–90% 的成功率，不过最难的穿扎带只有 20%；2024 年的 Mobile ALOHA 又把双臂装上了移动底盘。","example":"Mobile ALOHA 每个任务只用 20–50 条人类演示，就能自主完成煎虾装碗、打开双门壁柜放锅、呼叫并乘电梯等需要双臂配合加移动的任务。","related":["双臂机器人","ALOHA 双臂平台","ACT","Mobile ALOHA","灵巧操作","移动操作"]},{"id":"dexterous-manipulation","category":"concept","sec":1,"tier":1,"sources":[{"title":"Learning Dexterous In-Hand Manipulation (OpenAI)","url":"https://arxiv.org/abs/1808.00177"},{"title":"Dexterous Manipulation through Imitation Learning: A Survey","url":"https://arxiv.org/abs/2504.03515"}],"as_of":"","related_ids":["dexterous-hand","in-hand-manipulation","contact-rich-manipulation","tactile-sensor","dactyl","bimanual-manipulation"],"name":"灵巧操作","alt":"Dexterous Manipulation","abbr":"","aliases":["灵巧手操作","多指灵巧操作"],"one_liner":"用多指灵巧手，靠手指协调和力度调节来抓取、翻转、摆弄物体。","explanation":"灵巧操作指机器人手（通常是多指灵巧手）通过多根手指的精细协调和力度调节，去抓取、调整姿态并操作物体，比如在手里转动方块、用手指拧瓶盖、调整握笔姿势。相比二指夹爪的一开一合，它更接近人手，是让机器人使用人类工具、处理复杂物品的关键。难点是关节多、自由度高，接触频繁且难建模，触觉感知和数据采集也都难。代表工作是 OpenAI 2018 年在仿真中用强化学习加域随机化（随机改变摩擦、外观等参数）训练 Shadow 灵巧手转物体，再直接迁移到真机，并自发学出了指步态（手指轮流松开、换位，接力转动物体）等类似人手的技巧；近年更多工作用遥操作或人手视频做模仿学习。","example":"OpenAI 的 Dactyl 用 Shadow 灵巧手把手里的积木转到指定朝向：积木姿态由三台普通相机的画面估计，指尖位置靠动作捕捉系统测量，没用触觉，策略全部在仿真中训练。","related":["灵巧手","手内操作","接触丰富操作","触觉传感器","Dactyl（OpenAI 魔方灵巧手）","双臂操作"]},{"id":"locomotion","category":"concept","sec":1,"tier":1,"sources":[{"title":"Robot locomotion (Wikipedia)","url":"https://en.wikipedia.org/wiki/Robot_locomotion"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv:2109.11978)","url":"https://arxiv.org/abs/2109.11978"}],"as_of":"2021-09","related_ids":["legged-locomotion","bipedal-locomotion","rl-based-locomotion-control","sim-to-real-transfer","loco-manipulation","manipulation"],"name":"运动（移动）","alt":"Locomotion","abbr":"","aliases":["移动","行走","运动能力","机器人运动"],"one_liner":"机器人靠腿、轮子等方式把自己从一处移动到另一处的能力。","explanation":"Locomotion 泛指机器人让自身移动的方式，包括轮式滚动、腿足行走、跳跃、飞行等；它和改变外部物体状态的「操作」（Manipulation）是机器人能力的两大分支。具身智能里多指四足、双足和人形机器人的腿足运动：要协调十几到几十个关节，保持平衡，应对台阶、碎石等地形。传统方法靠动力学模型和模型预测控制；近年主流是在 GPU 并行仿真里用强化学习训策略再迁移到真机，2021 年苏黎世联邦理工（ETH）与英伟达的工作在单块 GPU 上同时仿真数千台 ANYmal 四足，平地行走不到 4 分钟、崎岖地形约 20 分钟就能训出策略。中文「运动」也常对应 Motion，Locomotion 专指移动本体。","example":"用 legged_gym 在 Isaac Gym 里同时仿真 4096 台 ANYmal 四足，在台阶、斜坡、障碍等地形上训练约 20 分钟，得到的策略直接部署到真机上，能上下楼梯、越过障碍。","related":["腿足运动","双足行走","强化学习运控","仿真到现实迁移","运动操作一体化","操作"]},{"id":"navigation","category":"concept","sec":1,"tier":1,"sources":[{"title":"On Evaluation of Embodied Navigation Agents (Anderson et al., arXiv:1807.06757)","url":"https://arxiv.org/abs/1807.06757"}],"as_of":"","related_ids":["vision-and-language-navigation","object-goal-navigation","point-goal-navigation","success-weighted-by-path-length","simultaneous-localization-and-mapping","mobile-manipulation"],"name":"导航","alt":"Navigation","abbr":"","aliases":["具身导航","Embodied Navigation","视觉导航"],"one_liner":"机器人根据传感器观测，自主移动到指定位置或目标物体旁。","explanation":"导航指智能体决定「去哪、怎么走」并移动到目标。传统机器人导航由建图定位（SLAM）、路径规划和避障控制组成；具身智能里的导航更强调在没见过的环境中，仅凭第一人称相机等传感器完成任务。2018 年 Anderson 等十余位研究者发布的共识报告把目标分为三类：点目标（走到给定坐标）、物体目标（找到某类物体，如冰箱）、区域目标（到达某类区域，如厨房），并提出 SPL 指标，同时考虑是否成功和路线是否绕远。目标也可以换种方式给出，比如用自然语言描述路线的视觉语言导航（VLN）、用一张图片指定目标的图像目标导航。导航和操作结合就是移动操作。","example":"机器人收到「找到冰箱」的目标，在没去过的公寓里边走边看，最后停下时与冰箱的距离小于阈值（报告建议取机身宽度的 2 倍）才算成功。","related":["视觉语言导航","物体目标导航","点目标导航","路径长度加权成功率","同步定位与建图","移动操作"]},{"id":"vision-and-language-navigation","category":"concept","sec":1,"tier":1,"sources":[{"title":"Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments","url":"https://arxiv.org/abs/1711.07280"},{"title":"Room-to-Room (R2R) 数据集主页","url":"https://bringmeaspoon.org/"},{"title":"Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments (VLN-CE)","url":"https://arxiv.org/abs/2004.02857"}],"as_of":"","related_ids":["navigation","room-to-room","success-weighted-by-path-length","object-goal-navigation","navila","vision-language-model"],"name":"视觉语言导航","alt":"Vision-and-Language Navigation","abbr":"VLN","aliases":["视觉-语言导航"],"one_liner":"让智能体听懂自然语言路线描述，靠视觉在陌生环境里走到目的地。","explanation":"视觉语言导航是 Anderson 等人在 CVPR 2018 论文中提出的具身任务：智能体收到一段类似「出门右转，经过沙发后在厨房门口停下」的指令，只靠第一人称视觉，在没去过的室内环境里一步步走到终点。配套的 Room-to-Room（R2R）数据集基于 Matterport3D 真实房屋扫描，覆盖 90 栋建筑、约 2.2 万条人工撰写的指令。它考验语言理解、视觉感知和空间记忆的配合。原版 R2R 里智能体只能在预先拍好全景图的点位之间跳转，2020 年的 VLN-CE 改成在连续三维空间里用前进、转向等底层动作移动，更接近真机；之后又出现了能在真机上运行的 NaVid、NaVILA 等模型。","example":"指令「沿走廊直走，在第二扇门左转进卧室，停在床边」，机器人边看边走，最后停在床边算成功。","related":["导航","R2R / VLN-CE 视觉语言导航基准","路径长度加权成功率","物体目标导航","NaVILA","视觉语言模型"]},{"id":"mobile-manipulation","category":"concept","sec":1,"tier":1,"sources":[{"title":"Mobile manipulator (Wikipedia)","url":"https://en.wikipedia.org/wiki/Mobile_manipulator"},{"title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation (arXiv:2401.02117)","url":"https://arxiv.org/abs/2401.02117"}],"as_of":"2024-01","related_ids":["mobile-manipulator","navigation","manipulation","loco-manipulation","mobile-aloha","mobile-base"],"name":"移动操作","alt":"Mobile Manipulation","abbr":"","aliases":["移动抓取","移动操控"],"one_liner":"把机械臂装在可移动底盘上，边走边干活，把导航和操作结合起来。","explanation":"移动操作指装在移动底盘（轮式或足式）上的机械臂一边移动一边完成操作任务，这类机器人叫移动操作机器人或复合机器人。固定机械臂只能在臂展范围内工作，装上底盘后可以在整个房间、仓库甚至楼层间作业。代价是自由度更多、环境更不规整：要同时决定底盘去哪、手臂怎么动，还要处理底盘定位误差对抓取精度的影响。2024 年斯坦福的 Mobile ALOHA 用低成本全身遥操作采数据，每个任务只用 20–50 条演示，就能自主完成煎虾装碗、开双门壁柜放锅、呼叫并进入电梯等任务，并发现与静态 ALOHA 的双臂数据协同训练可把成功率最多提高 90%。它是家务和仓储机器人的核心能力。","example":"Mobile ALOHA 在灶台前倒油、下虾，一只手把锅斜着端起、另一只手用锅铲给虾翻面，再靠底盘转身，把虾倒进身后桌上的碗里。","related":["复合机器人","导航","操作","运动操作一体化","Mobile ALOHA","移动底盘"]},{"id":"long-horizon-task","category":"concept","sec":1,"tier":1,"sources":[{"title":"CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks (arXiv:2112.03227)","url":"https://arxiv.org/abs/2112.03227"}],"as_of":"","related_ids":["skill-primitive","hierarchical-architecture","compounding-error","failure-recovery","embodied-memory","calvin-benchmark"],"name":"长程任务","alt":"Long-horizon Task","abbr":"","aliases":["长时序任务","长视野任务","长周期任务","多阶段任务"],"one_liner":"要连续完成多个子步骤、持续较长时间才能达成目标的任务。","explanation":"长程任务指要连续执行很多步、跨越多个子目标的任务，比如「收拾餐桌」要依次收盘子、倒残渣、放进水槽。难点主要有三个：一是误差累积，前一步的小偏差让后面的状态越来越偏离训练数据；二是成功信号往往到最后才出现，很难判断中间哪步做错；三是要记住做过什么、决定下一步做什么。基准 CALVIN（2021）把 34 种子任务串成每条 5 个指令的序列来评测，论文中的模仿学习基线在同环境训练测试时，连做 1 个的成功率约 49%，连做 5 个只有 0.08%。常见对策有分层架构（上层大模型拆任务、下层策略执行原子技能）、记忆模块和失败恢复。","example":"「收拾餐桌」：依次把盘子、杯子放进收纳箱，把纸巾扔进垃圾桶，最后擦桌面，任何一步失败整体都算没完成。","related":["原子技能","分层架构","复合误差","失败恢复","具身记忆","CALVIN"]},{"id":"skill-primitive","category":"concept","sec":1,"tier":2,"sources":[{"title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances (SayCan)","url":"https://arxiv.org/abs/2204.01691"},{"title":"Accelerating Robotic Reinforcement Learning via Parameterized Action Primitives (RAPS)","url":"https://arxiv.org/abs/2110.15360"}],"as_of":"","related_ids":["long-horizon-task","hierarchical-architecture","motion-primitives","saycan","llm-based-task-planning","dynamic-movement-primitives"],"name":"原子技能","alt":"Skill Primitive","abbr":"","aliases":["技能基元","原子动作","基础技能","动作基元","Action Primitive"],"one_liner":"可复用的最小动作单元，如抓取、放置、开抽屉，组合起来完成复杂任务。","explanation":"把机器人能力拆成一组可单独调用、单独训练的基本动作，例如「抓起」「放下」「推」「打开抽屉」「移动到某处」。每个原子技能通常带参数（抓哪个物体、放到哪里），由上层的规划器或大模型按顺序调用，拼成长程任务。好处是每个技能容易单独训练和验证，也能跨任务复用；代价是技能库之外的动作做不了，技能衔接处容易出错。代表工作有谷歌的 SayCan（2022），让大语言模型从预训练技能库里挑下一步，并用各技能的价值函数判断当前是否可行；RAPS（2021）则把手工定义的参数化基元当作强化学习的动作空间，以提高探索和学习效率。","example":"「把可乐放进冰箱」可拆成：导航到桌边→抓取可乐→导航到冰箱→打开冰箱门→放置可乐→关门，每一步都是一个原子技能。","related":["长程任务","分层架构","运动基元","SayCan","大模型任务规划","动态运动基元"]},{"id":"observation","category":"concept","sec":2,"tier":1,"sources":[{"title":"Basic Usage (Gymnasium Documentation)","url":"https://gymnasium.farama.org/introduction/basic_usage/"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv:2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["state-space","action-space","proprioception","partially-observable-markov-decision-process","policy","observation-action-pair"],"name":"观测","alt":"Observation","abbr":"","aliases":["观测空间","Observation Space","观察"],"one_liner":"智能体每个时刻从环境拿到的信息，是策略做决策的输入。","explanation":"观测是智能体每一步从环境得到的输入。在强化学习的「观测—动作—奖励」循环里，环境重置时和每执行一个动作后都会返回新观测；观测空间规定这些输入的格式和取值范围，比如 Gymnasium 里 CartPole 的观测就是小车位置、速度、杆角度等几个数。真实机器人的观测通常包括多路相机图像、深度或点云、关节角度和夹爪开合等本体感知信息，以及语言指令。观测不等于状态：状态是环境的完整描述，观测常只看到一部分（有遮挡、有噪声），这种情形用部分可观测马尔可夫决策过程（POMDP）建模。很多策略会输入最近几帧观测，Diffusion Policy 把这个帧数叫观测视界。","example":"一个 VLA 策略每一步的观测：头部相机和腕部相机各一张 RGB 图、7 个关节角、夹爪开度，加上指令「把杯子放到盘子上」。","related":["状态空间","动作空间","本体感知","部分可观测马尔可夫决策过程","策略","观测-动作对"]},{"id":"state-space","category":"concept","sec":2,"tier":2,"sources":[{"title":"Markov decision process - Wikipedia","url":"https://en.wikipedia.org/wiki/Markov_decision_process"},{"title":"State space (computer science) - Wikipedia","url":"https://en.wikipedia.org/wiki/State_space_(computer_science)"}],"as_of":"","related_ids":["observation","action-space","markov-decision-process","partially-observable-markov-decision-process","proprioception","state-space-model"],"name":"状态空间","alt":"State Space","abbr":"","aliases":["状态","State","状态集合"],"one_liner":"系统所有可能状态的集合；机器人里常由关节角、位姿、速度等量构成。","explanation":"在强化学习和控制里，状态是描述系统此刻情况、足以预测下一步变化的一组量，所有可能状态合起来就是状态空间。马尔可夫决策过程（MDP，强化学习的标准数学框架）把它记作 S，可以是离散的（如棋盘格子），也可以是连续的（实数向量）。机器人的状态通常包括关节角与角速度、末端位姿、夹爪开合，以及物体的位置等。真实机器人往往拿不到完整状态，只能通过相机和传感器得到「观测」，这时问题就变成部分可观测 MDP。VLA 论文里的 state 多指机器人自身的关节量，与图像一起输入模型。它和 Mamba 这类「状态空间模型」不是一回事。","example":"一台 7 自由度机械臂加平行夹爪，本体状态可以是 7 个关节角、7 个关节角速度和 1 个夹爪开度，共 15 维实数向量。","related":["观测","动作空间","马尔可夫决策过程","部分可观测马尔可夫决策过程","本体感知","状态空间模型"]},{"id":"action-space","category":"concept","sec":2,"tier":1,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"Gymnasium Documentation: Basic Usage","url":"https://gymnasium.farama.org/introduction/basic_usage/"}],"as_of":"","related_ids":["state-space","observation","policy","delta-action-vs-absolute-action","action-tokenizer","unified-action-space"],"name":"动作空间","alt":"Action Space","abbr":"","aliases":["连续动作空间","离散动作空间","Continuous Action Space","Discrete Action Space"],"one_liner":"智能体每一步能做出的所有动作的集合，以及动作的数值格式。","explanation":"动作空间是强化学习和机器人学习的基础概念，指智能体每一步可选的全部动作。它分两类：离散动作空间只有有限个选项，比如 Atari 游戏的几个按键；连续动作空间里动作是一串实数，比如机械臂各关节的目标角度，或末端执行器（臂最末端的夹爪或工具）的位移加夹爪开合。机器人的底层控制基本是连续动作空间，但也有离散的例子，如具身导航基准常用「前进、左转、右转、停止」几个动作。同一任务可以用关节角或末端位姿、增量或绝对值来表示动作，不同机器人的维度也不同，这正是跨本体训练要处理的难题。VLA 模型常见的做法是把连续动作离散成 token 输出，或用扩散、流匹配、直接回归等方式生成连续值。","example":"CartPole 小车只有「向左推」「向右推」两个动作，是离散动作空间；OpenVLA 输出的机械臂动作是 3 维平移 + 3 维旋转 + 1 维夹爪开合，共 7 维连续动作空间。","related":["状态空间","观测","策略","增量动作 / 绝对动作","动作分词器","统一动作空间"]},{"id":"policy","category":"concept","sec":2,"tier":1,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["visuomotor-policy","imitation-learning","reinforcement-learning","observation","action-space","vision-language-action-model"],"name":"策略","alt":"Policy","abbr":"","aliases":["控制策略","策略网络","Policy Network"],"one_liner":"根据当前观测决定下一步做什么动作的规则，通常是一个神经网络。","explanation":"策略是强化学习和机器人学习的核心概念，指智能体从「当前状态或观测」到「动作」的映射，常记作 π。确定性策略对同一输入总给出同一个动作，随机策略则输出一个动作分布再从中采样。在具身智能里，策略通常是一个神经网络：输入相机画面、关节角等本体状态，有时再加一句语言指令，输出机械臂末端位姿、关节目标角或行走速度指令。训练策略主要靠模仿学习（照着人类演示学）和强化学习（靠奖励试错），VLA 模型本质上也是一种大规模策略。注意别和强化学习里的「模型」混淆：那里单说「模型」常指预测环境下一步怎么变化的动力学模型（如「基于模型的强化学习」），而策略负责选动作。","example":"扩散策略在 Push-T 任务里读入相机画面和末端当前位置，每次输出接下来一小段末端移动目标，控制机械臂把 T 形块推到指定位置。","related":["视觉运动策略","模仿学习","强化学习","观测","动作空间","视觉-语言-动作模型"]},{"id":"inference","category":"concept","sec":2,"tier":1,"sources":[{"title":"What is AI inference? (IBM)","url":"https://www.ibm.com/think/topics/ai-inference"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"2024-10","related_ids":["reasoning","inference-latency","action-chunking","asynchronous-inference","inference-deployment","post-training-quantization"],"name":"推理（前向计算）","alt":"Inference","abbr":"","aliases":["模型推理","前向推理","推断"],"one_liner":"用训练好的模型对新输入算出输出，只做前向计算、不更新参数。","explanation":"Inference 指使用训练好的模型：输入新数据，跑一遍前向计算得到输出，不算梯度、不更新参数，与「训练」相对。中文「推理」同时对应 Inference 和 Reasoning（模型分步思考），读论文要看上下文区分。对机器人来说，推理速度决定控制跟不跟得上：π0 论文报告，在一块 RTX 4090 上处理 3 路相机图像、生成一段动作约需 73 毫秒。推理太慢，机器人会在两段动作之间停顿，所以才有动作分块、异步推理、量化和 TensorRT 加速等手段。推理可以在机器人本体上跑，也可以放在远程服务器上再经网络回传，后者要多算网络延迟。","example":"π0 控制 50Hz 的机器人时，每 0.5 秒推理一次、输出一段动作，执行完 25 步后再推理下一段。","related":["推理（思考）","推理延迟","动作分块","异步推理","推理部署","训练后量化"]},{"id":"episode","category":"concept","sec":2,"tier":1,"sources":[{"title":"Gymnasium Documentation: Basic Usage","url":"https://gymnasium.farama.org/introduction/basic_usage/"},{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"}],"as_of":"","related_ids":["trajectory","rollout","success-rate","epoch","termination-vs-truncation","demonstration-data"],"name":"回合","alt":"Episode","abbr":"","aliases":["轮次","一集","幕"],"one_liner":"从环境重置开始，到任务完成、失败或超时为止的一次完整尝试。","explanation":"回合是强化学习和机器人学习里的时间单位：环境重置到初始状态后，智能体一步步行动，直到任务完成、失败或达到步数上限，这一整段就是一个回合，记录下的观测和动作序列就是一条轨迹。Gymnasium 用两个标志区分结束原因：terminated 表示任务本身完成或失败，truncated 表示被时间上限等外部条件截断。在机器人模仿学习中，一条演示数据通常对应一个回合；评测时说「每个任务跑 50 个回合」，就是让机器人从头尝试 50 次再统计成功率。注意它和训练轮次（epoch，把整个数据集过一遍）不是一回事。","example":"叠衣服任务里，从把一件皱衣服摊到桌上开始，到机器人叠好或 2 分钟超时为止，算一个回合。","related":["轨迹","推演","成功率","训练轮次","终止与截断","演示数据"]},{"id":"trajectory","category":"concept","sec":2,"tier":1,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL（Trajectories）","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"Lynch & Park, Modern Robotics, Ch.9 Trajectory Generation（预印本 PDF）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["episode","trajectory-planning","trajectory-tracking","demonstration-data","action-chunking","path-planning"],"name":"轨迹","alt":"Trajectory","abbr":"","aliases":["运动轨迹"],"one_liner":"随时间变化的一串位置或状态-动作序列，也指一条完整的演示记录。","explanation":"轨迹在具身智能里有两层常用含义。在机器人学里，轨迹是一条路径加上时间安排，规定机器人每个时刻应处在哪个位置或关节角，《Modern Robotics》教材把它定义为「路径 + 时间缩放」，控制器的任务就是跟踪这条轨迹。在强化学习和数据集里，轨迹指智能体与环境交互产生的状态、动作序列 τ=(s0, a0, s1, a1, …)，一条遥操作演示录下来就是一条轨迹，Open X-Embodiment 等数据集就用轨迹条数来计量规模。模型一次输出的一段未来动作（动作分块）也常被称作一小段轨迹。","example":"机械臂从桌上抓起杯子的 3 秒里，以 50Hz 记录下的 150 个末端位姿和夹爪开合值，就是一条轨迹。","related":["回合","轨迹规划","轨迹跟踪","演示数据","动作分块","路径规划"]},{"id":"open-loop-control","category":"concept","sec":2,"tier":1,"sources":[{"title":"Open-loop controller (Wikipedia)","url":"https://en.wikipedia.org/wiki/Open-loop_controller"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/abs/2410.24164"},{"title":"Real-Time Execution of Action Chunking Flow Policies (arXiv:2506.07339)","url":"https://arxiv.org/abs/2506.07339"}],"as_of":"2025-06","related_ids":["closed-loop-control","action-chunking","action-horizon","real-time-chunking","temporal-ensembling","open-loop-evaluation"],"name":"开环","alt":"Open-loop","abbr":"","aliases":["开环执行","开环控制","Open-loop Control"],"one_liner":"执行过程中不看反馈，按事先算好的指令一口气做完。","explanation":"开环原是控制理论术语：控制动作不依赖系统输出，执行时不检查结果是否达标，比如只按定时运转的烘干机；闭环则持续测量结果并修正。在机器人学习里，它常指一段动作执行期间不读新观测。以动作分块为例，模型一次预测未来若干步动作，π0 论文写明动作块按开环执行：在 50Hz 的机器人上每 0.5 秒推理一次，其间执行的 25 步动作不看新画面。开环执行动作连贯、推理次数少，但对突发变化反应慢，物体被碰歪也要等下一次推理才能纠正。常见折中是只执行预测的一部分就重新规划（Diffusion Policy 的滚动时域做法），或用实时动作分块在执行当前段时并行计算下一段。","example":"开环回放：机械臂按录好的轨迹去夹杯子，杯子被人挪开几厘米也照样合上夹爪；闭环策略会根据新画面调整手的位置。","related":["闭环","动作分块","动作视界","实时动作分块","时序集成","开环评测"]},{"id":"closed-loop-control","category":"concept","sec":2,"tier":1,"sources":[{"title":"Wikipedia: Closed-loop controller","url":"https://en.wikipedia.org/wiki/Closed-loop_controller"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["open-loop-control","perception-action-loop","closed-loop-evaluation","action-chunking","visual-servoing","model-predictive-control"],"name":"闭环","alt":"Closed-loop","abbr":"","aliases":["闭环执行","闭环控制","反馈控制","Closed-loop Control"],"one_liner":"边做边看：每一步都根据最新观测结果调整下一步动作。","explanation":"闭环原是控制理论概念：控制器持续测量系统的实际输出，与目标比较，用偏差修正动作，比如定速巡航遇到上坡会自动加大动力。相对的开环是按预定指令执行、不看结果。在机器人学习里，闭环执行指策略在执行中不断读取新的相机图像和关节状态再决定下一步，因此能应对物体被碰歪、抓取打滑等意外；开环则是一次算好整段轨迹照着走。很多扩散策略和 VLA 一次输出一段动作块，只执行一部分就重新观测、重新预测（滚动时域控制），在动作连贯和及时反馈之间折中。「闭环评测」也指让策略真的在环境里跑，而不是只和数据集里的动作比对。","example":"机械臂去抓杯子时有人把杯子挪开 5 厘米：闭环策略从下一帧图像看到变化会改轨迹，开环执行则会照原计划抓空。","related":["开环","感知-行动闭环","闭环评测","动作分块","视觉伺服","模型预测控制"]},{"id":"hand-eye-coordination","category":"concept","sec":2,"tier":2,"sources":[{"title":"Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection (arXiv 1603.02199)","url":"https://arxiv.org/abs/1603.02199"}],"as_of":"","related_ids":["hand-eye-calibration","visual-servoing","visuomotor-policy","closed-loop-control","google-arm-farm","grasping"],"name":"手眼协调","alt":"Hand-Eye Coordination","abbr":"","aliases":["眼手协调"],"one_liner":"用相机看到的信息实时引导机械臂和夹爪动作，边看边调的能力。","explanation":"手眼协调原本描述人和动物的能力：眼睛看到目标，手就能准确伸过去抓住，并边看边修正。放到机器人上，指把相机图像和机械臂动作连成闭环。传统做法先做手眼标定，算出相机和机械臂之间的坐标变换，再把检测到的目标位置换算成手臂坐标一次性执行，标定稍有偏差就会抓偏。2016 年 Levine 等人在谷歌用 6 到 14 台机械臂、两个月采集了 80 多万次抓取尝试，训练卷积网络直接从单目图像判断某个夹爪运动能否抓成功，不需要相机标定，还能在抓取过程中持续调整，是端到端学习手眼协调的代表工作。注意它和手眼标定是两个概念。","example":"物体在抓取途中被碰歪了，机器人根据相机画面不断修正夹爪位置，而不是按一开始算好的坐标直接伸过去。","related":["手眼标定","视觉伺服","视觉运动策略","闭环","Google 机械臂农场（大规模抓取自监督）","抓取"]},{"id":"visuomotor-policy","category":"concept","sec":2,"tier":2,"sources":[{"title":"End-to-End Training of Deep Visuomotor Policies (arXiv 1504.00702)","url":"https://arxiv.org/abs/1504.00702"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["policy","end-to-end","diffusion-policy","imitation-learning","vision-language-action-model","end-to-end-training-of-deep-visuomotor-policies"],"name":"视觉运动策略","alt":"Visuomotor Policy","abbr":"","aliases":["视觉-运动策略","视觉运动控制策略"],"one_liner":"直接把相机图像映射成机器人动作的控制策略，通常是一个神经网络。","explanation":"「策略」指从观测到动作的映射；视觉运动策略特指输入以图像为主（常加上关节角等本体状态）、输出电机指令、关节位置或末端位姿的策略。2015 年 Levine、Finn 等人的论文《End-to-End Training of Deep Visuomotor Policies》让这个词流行起来：用一个约 9.2 万参数的卷积网络，从原始图像直接输出关节力矩，完成拧瓶盖等任务，说明感知和控制联合训练更有效。今天的 ACT、扩散策略以及加了语言输入的 VLA 模型，都属于视觉运动策略，多用模仿学习或强化学习训练。","example":"扩散策略（Diffusion Policy）的论文标题就是「通过动作扩散学习视觉运动策略」：输入相机图像，输出一段机械臂动作序列，完成推 T 形块等操作任务。","related":["策略","端到端","扩散策略","模仿学习","视觉-语言-动作模型","端到端视觉运动策略（引导策略搜索）"]},{"id":"action-multimodality","category":"concept","sec":2,"tier":2,"sources":[{"title":"Diffusion Policy 项目页（Columbia）","url":"https://diffusion-policy.cs.columbia.edu/"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","url":"https://arxiv.org/abs/2303.04137"},{"title":"Behavior Transformers: Cloning k Modes with One Stone","url":"https://arxiv.org/abs/2206.11251"}],"as_of":"","related_ids":["diffusion-policy","flow-matching","gaussian-mixture-model","behavior-transformer","behavior-cloning","diffusion-action-head"],"name":"动作多峰性","alt":"Action Multimodality","abbr":"","aliases":["多峰动作分布","动作多峰分布","动作多模态","动作多模态性","多模态动作分布","多峰分布","Multimodal Action Distribution","模式平均","Mode Averaging"],"one_liner":"同一情境下有多种都正确的做法，动作分布出现多个「峰」。","explanation":"动作多峰性指在同一个观测下合理的动作不止一种，比如绕开障碍物可以从左走也可以从右走，人类演示里两种都有，动作的概率分布就有两个峰。如果用均方误差直接回归一个动作，模型会学到两个峰的平均值，也就是「模式平均」，结果可能径直撞向障碍物。解决办法是用能表达多峰分布的策略：高斯混合模型、把动作离散成 token 再分类（如 BeT），以及扩散策略和流匹配。扩散策略论文把「处理多峰动作分布」列为主要优势之一，这也是如今很多 VLA 采用扩散或流匹配动作头的原因之一。","example":"Push-T 任务里，演示者有时从左侧、有时从右侧推 T 形块；直接回归的策略容易学成两者的平均，扩散策略则在每次执行中只选定一侧推到底。","related":["扩散策略","流匹配","高斯混合模型","BeT / VQ-BeT","行为克隆","扩散动作头"]},{"id":"goal-conditioned-policy","category":"concept","sec":2,"tier":2,"sources":[{"title":"Goal-Conditioned Reinforcement Learning: Problems and Solutions (IJCAI 2022 Survey, arXiv 2201.08299)","url":"https://arxiv.org/abs/2201.08299"},{"title":"Hindsight Experience Replay (arXiv 1707.01495)","url":"https://arxiv.org/abs/1707.01495"},{"title":"Learning Latent Plans from Play (arXiv 1903.01973)","url":"https://arxiv.org/abs/1903.01973"}],"as_of":"","related_ids":["goal-conditioned-reinforcement-learning","hindsight-experience-replay","language-conditioned-policy","goal-conditioned-behavior-cloning","hindsight-relabeling","policy"],"name":"目标条件策略","alt":"Goal-conditioned Policy","abbr":"","aliases":["目标条件化策略"],"one_liner":"除了当前观测，还把「要达到的目标」作为输入来决定动作的策略。","explanation":"目标条件策略是把目标也当作输入的策略，常写作 π(a | s, g)：s 是当前状态或观测，g 是目标，可以是一个目标位置、一张目标图像或一个目标状态。普通策略只学一个固定任务，目标条件策略用同一个网络完成「到达不同目标」的一族任务，换目标不用重新训练。在强化学习里这叫目标条件强化学习，常配合后见之明经验回放（HER，把没达成原目标的轨迹按实际到达的位置重新标注成功）缓解稀疏奖励；在模仿学习里，Lynch 等人 2019 年的 Play-LMP 用无任务标签的玩耍数据训练，测试时给出目标就能完成对应动作。目标用一句话描述时，就是语言条件策略。","example":"给机械臂一张「积木在桌子左上角」的照片作为目标，策略就把积木往那里推；换一张照片，同一个策略就去完成新目标。","related":["目标条件强化学习","后见之明经验回放","语言条件策略","目标条件模仿学习","事后重标注","策略"]},{"id":"language-conditioned-policy","category":"concept","sec":2,"tier":2,"sources":[{"title":"Language Conditioned Imitation Learning over Unstructured Data (Lynch & Sermanet)","url":"https://arxiv.org/abs/2005.07648"},{"title":"CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks","url":"https://arxiv.org/abs/2112.03227"}],"as_of":"","related_ids":["policy","goal-conditioned-policy","vision-language-action-model","instruction-following","calvin-benchmark","play-data"],"name":"语言条件策略","alt":"Language-conditioned Policy","abbr":"","aliases":["语言引导策略","语言条件模仿学习"],"one_liner":"输入里带一句语言指令、按指令不同输出不同动作的机器人策略。","explanation":"策略（policy）是从观测到动作的映射；语言条件策略在输入里额外加一条自然语言指令，同一个网络根据指令不同去做不同任务，而不是每个任务单独训练一个模型。Google 的 Lynch 与 Sermanet 2020 年提出的语言条件模仿学习（发表于 RSS 2021）用一个端到端网络同时学习像素感知、语言理解和连续控制，并利用大量无标注的「玩耍数据」，需要语言标注的数据不到总量的 1%。CALVIN（2021）是专门评测这类策略的基准，要求机器人按顺序完成多条语言指令组成的长程任务。今天的视觉-语言-动作模型（VLA，如 RT-2、π0）本质上也是语言条件策略，只是换成了预训练视觉语言模型做骨干。与之对应的是目标条件策略，它用目标图像而不是语言来指定任务。","example":"同一个机械臂策略，输入「打开抽屉」就去拉抽屉，输入「按下绿色按钮」就去按按钮（CALVIN 基准里的任务）。","related":["策略","目标条件策略","视觉-语言-动作模型","指令跟随","CALVIN","玩耍数据"]},{"id":"generalist-policy","category":"concept","sec":2,"tier":1,"sources":[{"title":"Octo: An Open-Source Generalist Robot Policy","url":"https://arxiv.org/abs/2405.12213"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"2024-10","related_ids":["policy","specialist-policy","octo","pi0","vision-language-action-model","cross-embodiment"],"name":"通用策略（通才策略）","alt":"Generalist Policy","abbr":"","aliases":["通才策略","通用机器人策略","Generalist Robot Policy"],"one_liner":"一个模型就能执行多种任务、适配多种场景甚至多种机器人的控制策略。","explanation":"策略是把观测映射成动作的模型。通用策略指用大规模、多任务、常常跨机器人的数据训练出的单个策略，能按语言指令或目标图像完成许多不同任务，在新场景下也有一定泛化能力；与之相对的专用策略只为一个任务或一台机器人训练。它通常先大规模预训练，再用少量目标场景数据微调到具体机器人和任务，思路类似大语言模型。代表作有 2024 年的开源模型 Octo（在 Open X-Embodiment 的 80 万条轨迹上训练，可在消费级显卡上几小时内微调到新机器人）、OpenVLA，以及 Physical Intelligence 的 π0 系列。如今多数 VLA 模型都以通用策略为目标。","example":"给 Octo 一句语言指令，或一张任务完成后的目标图像，它都能据此输出机械臂动作，不需要为每个任务单独训练一个模型。","related":["策略","专用策略","Octo","π0","视觉-语言-动作模型","跨本体"]},{"id":"specialist-policy","category":"concept","sec":2,"tier":2,"sources":[{"title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models (project page)","url":"https://robotics-transformer-x.github.io/"},{"title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models (arXiv)","url":"https://arxiv.org/abs/2310.08864"},{"title":"Octo: An Open-Source Generalist Robot Policy","url":"https://arxiv.org/abs/2405.12213"}],"as_of":"2023-10","related_ids":["generalist-policy","policy","fine-tuning","cross-embodiment","rt-x","open-x-embodiment"],"name":"专用策略","alt":"Specialist Policy","abbr":"","aliases":["专才策略","单任务策略","专家策略","Single-task Policy"],"one_liner":"只针对单一机器人、单一任务或单一场景训练的策略，与通用策略相对。","explanation":"为某个具体机器人、具体任务甚至具体环境单独采数据、从头训练的控制策略。过去机器人学习基本都这样做：换一台机器人或一个任务，就重新采数据、重新训一个模型。它在自己的任务上往往表现不错、所需数据也少，但难以迁移。Open X-Embodiment（2023）的对比显示，在数据少的场景下，用 22 种机器人混合数据训练的 RT-1-X 比各自只用本数据集训练的原方法平均高约 50%。现在常见做法是先预训练通用策略，再用少量本任务数据微调成专用策略。注意「专家策略」在模仿学习里也指提供示范的 expert，含义不同。","example":"只用某台 ALOHA 采集的「拧瓶盖」示范从头训练一个 ACT 策略：它在这台机器、这个任务上可用，换成叠衣服或换一台机械臂就得重新采数据、重新训练。","related":["通用策略（通才策略）","策略","微调","跨本体","RT-X","Open X-Embodiment 数据集"]},{"id":"sense-plan-act","category":"concept","sec":2,"tier":2,"sources":[{"title":"Robotic paradigm - Wikipedia","url":"https://en.wikipedia.org/wiki/Robotic_paradigm"},{"title":"Shakey the robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Shakey_the_robot"},{"title":"Subsumption architecture - Wikipedia","url":"https://en.wikipedia.org/wiki/Subsumption_architecture"}],"as_of":"","related_ids":["perception-action-loop","subsumption-architecture","hierarchical-architecture","end-to-end","task-planning","world-model"],"name":"感知-规划-行动范式","alt":"Sense-Plan-Act","abbr":"SPA","aliases":["感知-决策-执行","感知-规划-执行","层级式范式","Hierarchical Paradigm"],"one_liner":"机器人先感知建模、再规划、最后执行，循环往复的经典控制流程。","explanation":"经典机器人学的三步流程：先用传感器感知环境并更新内部世界模型，再在模型上规划下一步动作，最后交给执行器执行，如此循环。20 世纪 60–70 年代斯坦福研究院（SRI）的 Shakey 机器人是代表，它用 STRIPS 规划器和 A* 搜索把指令拆成可执行步骤。缺点是依赖准确的世界模型、计算慢，环境一变就容易出错；80 年代中期 Rodney Brooks 提出不建全局模型、让感知直接驱动行为的包容架构，后来又出现两者结合的混合架构。今天的模块化方案仍沿用这一思路，端到端 VLA 则用一个网络直接把观测映射成动作。","example":"Shakey 接到「把积木推下平台」的指令后，先识别平台和坡道，再规划出「推来坡道—爬上平台—推积木」的步骤，最后逐步执行。","related":["感知-行动闭环","包容架构（行为式机器人）","分层架构","端到端","任务规划","世界模型"]},{"id":"braincerebellum-architecture","category":"concept","sec":2,"tier":1,"sources":[{"title":"RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration","url":"https://arxiv.org/abs/2505.03673"},{"title":"FlagOpen/RoboOS (GitHub)","url":"https://github.com/FlagOpen/RoboOS"},{"title":"工业和信息化部：《人形机器人创新发展指导意见》解读（2023-11）","url":"https://www.miit.gov.cn/zwgk/zcjd/art/2023/art_e3f5686c2f0d49f9968b7ae011d558e1.html"}],"as_of":"2025-06","related_ids":["dual-system-architecture","hierarchical-architecture","embodied-foundation-model","locomotion-control","whole-body-control","roboos"],"name":"大脑-小脑架构（大小脑）","alt":"Brain–Cerebellum Architecture (Robot Brain & Cerebellum)","abbr":"","aliases":["大小脑架构","大脑+小脑","具身大脑与运动小脑","Brain-Cerebellum Hierarchical Architecture"],"one_liner":"把机器人系统分成负责理解和规划的「大脑」、负责执行动作的「小脑」两层。","explanation":"这是国内具身智能圈对分层系统的通俗叫法，借用人脑分工。「大脑」通常是多模态大模型（能同时处理图像和文字的大模型），负责理解指令、感知场景、拆解任务和高层决策；「小脑」把子任务变成具体动作，可以是技能库、VLA 策略，也可以是强化学习或传统控制写成的运动控制器，频率更高、更贴近硬件。分层的好处是两层能分别训练和替换，一个大脑也能调度多台不同机器人。智源研究院 2025 年发布的 RoboOS 就采用这种架构：RoboBrain 作大脑，可插拔的小脑技能库负责执行。工信部 2023 年印发的《人形机器人创新发展指导意见》也按「大脑、小脑、肢体」划分关键技术。","example":"人形机器人听到「把桌上的水杯递给我」：大脑模型把它拆成走到桌前、抓起杯子、递给人三步，小脑里的行走控制器和抓取策略再分别执行。","related":["快慢双系统","分层架构","具身大模型","运动控制","全身控制","RoboOS"]},{"id":"generalization","category":"concept","sec":3,"tier":1,"sources":[{"title":"A Taxonomy for Evaluating Generalist Robot Manipulation Policies (STAR-Gen)","url":"https://arxiv.org/abs/2503.01238"}],"as_of":"2025-03","related_ids":["overfitting","out-of-distribution","zero-shot","object-generalization","visual-generalization","semantic-generalization"],"name":"泛化","alt":"Generalization","abbr":"","aliases":["泛化能力"],"one_liner":"模型在训练时没见过的新情况下，仍然能做对的能力。","explanation":"泛化是机器学习的核心概念，指模型在训练数据之外的新样本上依然表现良好，而不只是记住训练集（只记住训练集、换新数据就变差叫过拟合）。机器人学习里泛化尤其难，因为真实世界变化太多：换块桌布、换个杯子、挪个位置、换种说法，都可能让策略失败。所以研究者常按变化类型分开评测，如物体泛化、场景泛化、位置泛化、指令泛化。2025 年 Jensen Gao、Dorsa Sadigh 等人提出的 STAR-Gen 把泛化分为视觉（外观和背景变化）、语义（概念和指令变化）、行为（需要不同的动作方式）三类，并发现开源 VLA 模型尽管用互联网规模的语言数据预训练过，在语义泛化上仍常常吃力。泛化能力是衡量通用策略的主要标准。","example":"策略只在白色桌面上练过抓红色方块；测试时换成木纹桌面（视觉泛化），或把指令改成「抓那个能装水的东西」（语义泛化），就能检验它的泛化能力。","related":["过拟合","分布外","零样本","物体泛化","视觉泛化","语义泛化"]},{"id":"in-distribution","category":"concept","sec":3,"tier":2,"sources":[{"title":"Generalized Out-of-Distribution Detection: A Survey (Yang et al.)","url":"https://arxiv.org/abs/2110.11334"}],"as_of":"","related_ids":["out-of-distribution","generalization","distribution-shift","long-tail-problem","robustness","object-generalization"],"name":"分布内","alt":"In-distribution","abbr":"ID","aliases":["分布内数据","同分布"],"one_liner":"测试时遇到的情况和训练数据来自同一分布，也就是模型「见过类似的」。","explanation":"机器学习默认训练数据和测试数据来自同一个概率分布，满足这个条件的测试样本就叫分布内（ID）；来自不同分布的叫分布外（OOD）。Yang 等人的 OOD 检测综述（2021）把分布变化分成两类：协变量偏移（输入的样子变了，比如光照、背景、相机换了，但任务类别没变）和语义偏移（出现了训练里没有的新类别）。在机器人里，「分布内」通常指测试时的物体、场景、摆放位置和指令都落在训练演示覆盖的范围内。很多策略在分布内成功率很高，一换桌布、换物体就大幅下降，所以论文常把分布内和分布外的结果分开报告，用来衡量泛化能力。它和泛化、分布外、分布偏移、长尾问题直接相关。","example":"用 50 条演示训练机械臂把红色方块放进盘子，测试时仍是同一张桌子、同一个红方块、位置在训练范围内，这就是分布内测试；换成没见过的绿色杯子就属于分布外。","related":["分布外","泛化","分布偏移（协变量偏移）","长尾问题","鲁棒性","物体泛化"]},{"id":"out-of-distribution","category":"concept","sec":3,"tier":1,"sources":[{"title":"Towards Out-Of-Distribution Generalization: A Survey (arXiv:2108.13624)","url":"https://arxiv.org/abs/2108.13624"}],"as_of":"","related_ids":["in-distribution","generalization","distribution-shift","long-tail-problem","robustness","zero-shot"],"name":"分布外","alt":"Out-of-distribution","abbr":"OOD","aliases":["分布外泛化","OOD 泛化","Out-of-Distribution Generalization"],"one_liner":"测试时遇到的数据和训练数据分布不同，比如新物体、新场景。","explanation":"机器学习通常默认训练数据和测试数据来自同一分布（独立同分布假设）。分布外指测试输入落在训练分布之外，比如换了没见过的物体、光照、桌布、相机角度或指令说法；落在训练分布之内的叫分布内（ID）。模型在分布外输入上性能往往明显下降，研究如何让模型此时仍然可用就是 OOD 泛化，清华大学崔鹏团队 2021 年的综述对此做了系统梳理。机器人尤其容易遇到这个问题：真实环境变化无穷，演示数据只覆盖有限场景；执行中一步走偏，后续观测也会偏离训练数据（分布偏移）。论文评测「泛化」时，通常就是在刻意构造的分布外条件下测成功率。","example":"策略只在白色桌面上用红杯子训练过，测试时换成木纹桌面和蓝色碗，这就是一次分布外测试。","related":["分布内","泛化","分布偏移（协变量偏移）","长尾问题","鲁棒性","零样本"]},{"id":"distribution-shift","category":"concept","sec":3,"tier":2,"sources":[{"title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (arXiv 1011.0686)","url":"https://arxiv.org/abs/1011.0686"},{"title":"Domain adaptation - Wikipedia","url":"https://en.wikipedia.org/wiki/Domain_adaptation"}],"as_of":"","related_ids":["compounding-error","dagger","behavior-cloning","out-of-distribution","recovery-and-correction-data","domain-adaptation"],"name":"分布偏移（协变量偏移）","alt":"Distribution Shift / Covariate Shift","abbr":"","aliases":["数据分布偏移","协变量漂移","Dataset Shift"],"one_liner":"部署时遇到的数据分布和训练数据不一致，导致模型表现变差。","explanation":"分布偏移泛指训练数据和实际使用数据的分布不同。协变量偏移是其中一种：输入的分布变了，但输入到正确输出的对应关系没变；另外两种常见的是标签偏移和概念偏移。在机器人模仿学习中它格外突出：策略只在专家走过的状态上学过，执行时一旦出一点小错，就会进入示范里没见过的状态，错误再引发更大偏离，这就是复合误差。Ross 等人在 AISTATS 2011 指出，这种自己的动作决定下一步输入的设定违背了独立同分布假设，并提出 DAgger：让策略自己去跑，请专家给新遇到的状态标注正确动作，逐步让训练分布贴近策略实际遇到的分布。","example":"行为克隆训练的抓杯策略在示范里总是从正上方接近杯子；部署时手臂偏了 2 厘米，这个位置训练集里没有，策略给出的动作越来越离谱，最后把杯子碰倒。","related":["复合误差","DAgger（数据集聚合）","行为克隆","分布外","纠偏数据","领域自适应"]},{"id":"long-tail-problem","category":"concept","sec":3,"tier":2,"sources":[{"title":"Beyond the Majority: Long-tail Imitation Learning for Robotic Manipulation (ICRA 2026)","url":"https://arxiv.org/abs/2602.06512"},{"title":"Dynamically Conservative Self-Driving Planner for Long-Tail Cases","url":"https://arxiv.org/abs/2305.07497"}],"as_of":"2026-02","related_ids":["out-of-distribution","generalization","data-flywheel","failure-recovery","robustness","autonomous-driving"],"name":"长尾问题","alt":"Long-tail Problem","abbr":"","aliases":["长尾场景","Corner Case","边缘案例","长尾分布"],"one_liner":"单个罕见、总数却极多的情况，训练数据很少覆盖，最容易出错。","explanation":"长尾来自统计里的长尾分布：少数常见情况（头部）占了大部分数据，大量罕见情况（尾部）各自出现很少，但加起来数量巨大。自动驾驶最早把它当作核心难题：绝大多数时间是正常行驶，但偶尔会遇到施工改道、路上的掉落物、突然冲出的行人等 corner case，这些场景数据少，又往往关乎安全。具身智能同样如此：家里的物体、摆放和意外状况千变万化，演示数据也天然偏向少数任务；ICRA 2026 的论文 Beyond the Majority 指出，通用机器人策略在数据稀少的尾部任务上泛化明显变差，常规的重采样方法效果有限。应对思路包括持续回收部署中的失败数据（数据飞轮）、用仿真和合成数据补尾部、提升模型泛化和失败恢复能力。长尾是「演示能跑通」和「产品能落地」之间差距的主要来源。","example":"家务机器人能稳定收拾常见的碗筷，但遇到打翻的汤汁、卡在桌缝里的叉子或宠物突然跳上桌，这些少见情况就属于长尾。","related":["分布外","泛化","数据飞轮","失败恢复","鲁棒性","自动驾驶"]},{"id":"zero-shot","category":"concept","sec":3,"tier":1,"sources":[{"title":"Zero-shot learning - Wikipedia","url":"https://en.wikipedia.org/wiki/Zero-shot_learning"},{"title":"Robot Utility Models: General Policies for Zero-Shot Deployment in New Environments","url":"https://robotutilitymodels.com/"}],"as_of":"","related_ids":["few-shot","generalization","out-of-distribution","open-vocabulary","fine-tuning","generalist-policy"],"name":"零样本","alt":"Zero-shot","abbr":"","aliases":["零样本泛化","零次学习","零样本学习","Zero-shot Learning","Zero-shot Generalization"],"one_liner":"不给新任务或新环境任何训练样本，模型直接上手完成。","explanation":"零样本原本是机器学习里的概念：模型测试时要识别训练中从没见过的类别，靠属性、文字描述等辅助信息把已学知识迁移过去，2009 年 Palatucci 等人的 NIPS 论文使用了「zero-shot learning」这一说法。到了大模型和具身智能时代，含义扩展为「新任务、新物体或新场景不再采数据、不再微调，拿来就用」。例如通用策略在没见过的厨房里直接开抽屉，就叫零样本泛化。它与少样本（给几条示例）相对，常用来衡量机器人基础模型的泛化能力。读论文要留意：有的「零样本」只指场景没见过，任务类型训练时其实见过。","example":"Robot Utility Models 为开柜门、开抽屉等 5 类任务各训练一个策略，不再采数据也不微调，直接部署到没见过的新环境，报告平均成功率约 90%。","related":["少样本","泛化","分布外","开放词汇","微调","通用策略"]},{"id":"few-shot","category":"concept","sec":3,"tier":2,"sources":[{"title":"Language Models are Few-Shot Learners (GPT-3, arXiv 2005.14165)","url":"https://arxiv.org/abs/2005.14165"},{"title":"RVT-2: Learning Precise Manipulation from Few Demonstrations (arXiv 2406.08545)","url":"https://arxiv.org/abs/2406.08545"}],"as_of":"","related_ids":["zero-shot","in-context-learning","fine-tuning","demonstration-data","sample-efficiency","one-shot-imitation-learning"],"name":"少样本","alt":"Few-shot","abbr":"","aliases":["小样本","少样本学习","Few-shot Learning"],"one_liner":"只给几个到几十个示例，模型就能学会或做对一个新任务。","explanation":"少样本指面对新任务时只用很少的示例。在大语言模型里，它通常指把几个示例直接写进提示词，不更新参数就让模型照着做；2020 年 GPT-3 的论文《Language Models are Few-Shot Learners》让这种用法广为人知，这种能力也叫上下文学习。在机器人领域，少样本更多指只采集几条到几十条演示数据（人遥操作机器人完成任务的记录），在预训练模型基础上微调就学会新任务。真机数据采集又慢又贵，一个方法学新任务需要多少条演示，是衡量它是否实用的重要指标。它与零样本（一个示例都不给）相对。","example":"RVT-2 在真机上只用 10 条演示，就能学会需要高精度的操作任务。","related":["零样本","上下文学习","微调","演示数据","样本效率","单样本模仿学习"]},{"id":"robustness","category":"concept","sec":3,"tier":2,"sources":[{"title":"Robustness (computer science) - Wikipedia","url":"https://en.wikipedia.org/wiki/Robustness_(computer_science)"},{"title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","url":"https://arxiv.org/abs/2510.13626"}],"as_of":"2025-10","related_ids":["generalization","domain-randomization","data-augmentation","out-of-distribution","generalization-robustness-evaluation","push-recovery"],"name":"鲁棒性","alt":"Robustness","abbr":"","aliases":["稳健性","抗干扰能力"],"one_liner":"输入或环境出现干扰、噪声、小变化时，系统表现不明显下降的能力。","explanation":"鲁棒性是英文 robust（强健）的音译，指系统在输入出错、环境扰动或条件变化时仍能正常工作的能力。它和泛化有重叠但侧重不同：泛化问「换成新物体、新场景还行不行」，鲁棒性更关注同一任务遇到光照变化、相机偏移、传感器噪声、被人推一下等干扰时会不会崩。真实世界的扰动无处不在，所以机器人对鲁棒性要求很高。2025 年的 LIBERO-Plus 在仿真基准 LIBERO 上系统加入七类扰动，发现一些 VLA 在相机视角或初始状态稍变时成功率从 95% 跌到 30% 以下，还常常忽略语言指令。常用提升手段有域随机化、数据增强和扰动训练。","example":"四足机器人行走时被人从侧面踹一脚，仍能调整步伐站稳；机械臂策略在相机被碰歪几厘米后照样能抓到物体。","related":["泛化","域随机化","数据增强","分布外","泛化与鲁棒性评测","推恢复"]},{"id":"distractor-objects","category":"concept","sec":3,"tier":2,"sources":[{"title":"THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation (arXiv 2402.08191)","url":"https://arxiv.org/abs/2402.08191"}],"as_of":"","related_ids":["visual-generalization","robustness","out-of-distribution","the-colosseum-a-benchmark-for-evaluating-generalization-for","generalization-robustness-evaluation","open-vocabulary-object-detection"],"name":"干扰物","alt":"Distractor Objects","abbr":"","aliases":["干扰物体","Distractors"],"one_liner":"场景里与当前任务无关、却可能把策略带偏的多余物体。","explanation":"干扰物指操作或导航场景中与当前指令无关的物体，例如让机器人拿起红色杯子时，桌上另外摆着的碗、玩具和其他杯子。评测时常故意增减干扰物，看策略会不会抓错目标、被遮挡或画面变化带偏，是衡量视觉泛化和鲁棒性的常用维度。RSS 2024 的 The Colosseum 基准沿 14 种扰动方向测试操作策略，发现单项扰动就会让成功率下降 30%–50%，其中干扰物数量、目标物颜色和光照的影响最大。训练时加入杂乱场景、做数据增强，或先用开放词汇检测把目标框出来，是常见的应对办法。","example":"训练数据里桌上只有一个苹果，测试时旁边多放一个橙子和一个红色小球，模仿学习策略可能伸手去抓红球。","related":["视觉泛化","鲁棒性","分布外","The Colosseum","泛化与鲁棒性评测","开放词汇检测"]},{"id":"failure-recovery","category":"concept","sec":3,"tier":2,"sources":[{"title":"REFLECT: Summarizing Robot Experiences for Failure Explanation and Correction (arXiv 2306.15724)","url":"https://arxiv.org/abs/2306.15724"},{"title":"AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation (arXiv 2410.00371)","url":"https://arxiv.org/abs/2410.00371"},{"title":"RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction (arXiv 2509.07953)","url":"https://arxiv.org/abs/2509.07953"}],"as_of":"2025-09","related_ids":["recovery-and-correction-data","human-intervention-data","compounding-error","human-in-the-loop","rac","long-horizon-task"],"name":"失败恢复","alt":"Failure Recovery","abbr":"","aliases":["自我纠错","错误恢复","Error Recovery"],"one_liner":"机器人发现自己做错或快要失败时，自己调整并把任务继续做完的能力。","explanation":"失败恢复指机器人在执行中察觉异常（抓空、物体滑落、卡住），再通过重试、换做法或退回安全状态把任务继续下去。只学过成功示范的模仿学习策略一旦偏离示范轨迹，就会进入没见过的状态，小错越积越大（即复合误差），所以恢复能力往往决定长程任务能不能做完。常见思路有两类：一是先检测并解释失败再重新规划，如 CoRL 2023 的 REFLECT 用大语言模型总结机器人经历、说明哪里出错，2024 年的 AHA 专门训练视觉语言模型判断失败；二是把恢复动作直接教给策略，如 2025 年的 RaC 在快失败时由人介入，先把机器人退回熟悉状态再示范纠正，用这类数据训练策略。","example":"RaC 让双臂机器人挂衬衫、装箱时，人在即将失败处接管，把机器人退回到熟悉的状态再演示纠正动作，策略从这些数据里学会自己补救。","related":["纠偏数据","干预数据","复合误差","人在回路","RaC","长程任务"]},{"id":"object-generalization","category":"concept","sec":3,"tier":2,"sources":[{"title":"OpenVLA: An Open-Source Vision-Language-Action Model","url":"https://arxiv.org/html/2406.09246"},{"title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation","url":"https://arxiv.org/abs/2410.18647"}],"as_of":"","related_ids":["generalization","scene-generalization","spatial-generalization","semantic-generalization","visual-generalization","zero-shot"],"name":"物体泛化","alt":"Object Generalization","abbr":"","aliases":["新物体泛化","未见物体泛化"],"one_liner":"策略换到训练时没见过的新物体上，仍能完成同一任务的能力。","explanation":"物体泛化是评测机器人策略时最常见的一类泛化，指把物体换成训练数据里没出现过的（新类别、新形状尺寸、新颜色材质）后，任务还能不能做成。OpenVLA 的评测把它拆得更细：颜色外观变化算视觉泛化，大小形状变化算物理泛化，没见过的目标物体算语义泛化。它重要是因为真实家庭和工厂里的物体种类几乎无穷，不可能每样都采数据。2024 年一项模仿学习数据缩放研究发现，策略对新物体的泛化随训练物体种类数呈幂律增长，物体多样性比单纯堆演示条数更管用。","example":"只用 3 种杯子采了「把杯子放到盘子上」的演示，测试时换成没见过的马克杯、纸杯和玻璃杯，看成功率掉多少。","related":["泛化","场景泛化","位置泛化（空间泛化）","语义泛化","视觉泛化","零样本"]},{"id":"spatial-generalization","category":"concept","sec":3,"tier":2,"sources":[{"title":"OpenVLA: An Open-Source Vision-Language-Action Model","url":"https://arxiv.org/html/2406.09246"},{"title":"DemoGen: Synthetic Demonstration Generation for Data-Efficient Visuomotor Policy Learning","url":"https://arxiv.org/abs/2502.16932"},{"title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","url":"https://arxiv.org/abs/2510.13626"}],"as_of":"2025-10","related_ids":["generalization","object-generalization","scene-generalization","out-of-distribution","demogen","libero-plus"],"name":"位置泛化（空间泛化）","alt":"Position / Spatial Generalization","abbr":"","aliases":["空间泛化","位置泛化","运动泛化","Motion Generalization"],"one_liner":"物体摆到训练时没出现过的位置或朝向，策略仍能做对的能力。","explanation":"位置泛化指任务和物体都不变，只是物体或机器人自身的初始位置、朝向换到训练数据没覆盖的地方，策略还能不能成功。OpenVLA 的评测把它叫「运动泛化」，定义就是没见过的物体位置和朝向。它是视觉运动策略的常见短板：模仿学习得到的策略往往只在演示覆盖过的区域附近可靠，物体挪远一点成功率就明显下降，所以采数据时要在桌面不同位置反复摆放。DemoGen 为此用一条真人演示合成出大量不同位置的演示；LIBERO-Plus 发现，只要稍微扰动机器人初始状态或相机视角，一些 VLA 的成功率就会从 95% 跌到 30% 以下。","example":"训练时方块只放在桌面左半边，测试时放到右半边或旋转 90 度，看机械臂能否照样抓起。","related":["泛化","物体泛化","场景泛化","分布外","DemoGen","LIBERO-Plus"]},{"id":"scene-generalization","category":"concept","sec":3,"tier":2,"sources":[{"title":"Decomposing the Generalization Gap in Imitation Learning for Visual Robotic Manipulation (Xie et al., 2023)","url":"https://arxiv.org/abs/2307.03659"},{"title":"π0.5: a Vision-Language-Action Model with Open-World Generalization","url":"https://arxiv.org/abs/2504.16054"},{"title":"Robot Utility Models: General Policies for Zero-Shot Deployment in New Environments","url":"https://arxiv.org/abs/2409.05865"}],"as_of":"2025-04","related_ids":["generalization","object-generalization","task-generalization","visual-generalization","out-of-distribution","data-diversity"],"name":"场景泛化","alt":"Scene / Environment Generalization","abbr":"","aliases":["环境泛化","新场景泛化"],"one_liner":"策略换到没见过的房间、桌面、光照或背景里仍能完成任务。","explanation":"泛化的一个维度，考察训练好的机器人策略被搬到训练时没见过的环境——新房间、新桌面纹理、不同光照、相机位置变化、背景杂物——时还能否成功。机器人数据多在少数实验室采集，模型容易记住场景外观本身，换个厨房就失败，所以它是能否进入用户家庭的关键指标。Xie、Finn 等人 2023 年把影响因素拆成光照、相机位姿等 11 类逐一测试；π0.5（Physical Intelligence，2025）把「在全新住宅里收拾厨房和卧室」作为主要评测。常见手段是增加采集环境的数量与多样性、数据增强、与网页数据协同训练。","example":"π0.5 在训练中从未出现过的真实住宅里，完成收拾厨房、整理卧室等长程任务。","related":["泛化","物体泛化","任务泛化","视觉泛化","分布外","数据多样性"]},{"id":"visual-generalization","category":"concept","sec":3,"tier":3,"sources":[{"title":"Decomposing the Generalization Gap in Imitation Learning for Visual Robotic Manipulation (Xie et al., 2023)","url":"https://arxiv.org/abs/2307.03659"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model","url":"https://arxiv.org/abs/2406.09246"},{"title":"What Can RL Bring to VLA Generalization? An Empirical Study","url":"https://arxiv.org/abs/2505.19789"}],"as_of":"2025-05","related_ids":["generalization","semantic-generalization","spatial-generalization","distractor-objects","domain-randomization","data-augmentation"],"name":"视觉泛化","alt":"Visual Generalization","abbr":"","aliases":["视觉鲁棒性","外观泛化"],"one_liner":"画面外观变了（背景、光照、颜色、干扰物、相机角度），策略照样能完成任务。","explanation":"泛化的一个子类，指机器人策略在训练没见过的视觉条件下仍能完成同样的任务：换了背景和桌布、光照变化、物体换了颜色或纹理、画面里多出干扰物、相机位置挪动等。任务和动作没变，变的只是「看到的样子」，所以常和语义泛化（新物体、新指令）、位置泛化分开评测，OpenVLA 的真机评测就单列了这一项。模仿学习策略直接从像素学动作，容易把背景、光照这些无关细节也记进去。2023 年 Xie、Finn 等人逐个拆解这些因素，发现新背景最容易适应、新相机位置最难。常见应对办法有域随机化、数据增强、用预训练视觉编码器，以及在更多样的场景里采数据。","example":"OpenVLA 真机评测里的「把茄子放进锅里」：用一只手工纸糊、外观与 BridgeData V2 训练数据中不同的锅，考查策略还能不能认出锅并完成任务。","related":["泛化","语义泛化","位置泛化（空间泛化）","干扰物","域随机化","数据增强"]},{"id":"semantic-generalization","category":"concept","sec":3,"tier":3,"sources":[{"title":"What Can RL Bring to VLA Generalization? An Empirical Study (arXiv 2505.19789)","url":"https://arxiv.org/abs/2505.19789"},{"title":"RT-2: New model translates vision and language into action (Google DeepMind)","url":"https://deepmind.google/discover/blog/rt-2-new-model-translates-vision-and-language-into-action/"}],"as_of":"2025-05","related_ids":["generalization","visual-generalization","object-generalization","compositional-generalization","vision-language-action-model","rt-2"],"name":"语义泛化","alt":"Semantic Generalization","abbr":"","aliases":[],"one_liner":"面对没见过的物体、概念或指令说法，仍能理解意思并正确执行。","explanation":"语义泛化是评测机器人策略、尤其是视觉-语言-动作模型（VLA）时常用的一个泛化维度，看模型能否在「意思层面」举一反三：没见过的物体类别、新的容器、换一种说法的指令、需要常识或概念推理的任务。它和视觉泛化（背景、光照、纹理变化）、执行层面的泛化（物体位置、初始姿态变化）相区分。2025 年的《What Can RL Bring to VLA Generalization?》按视觉、语义、执行三类构造测试，语义类包括未见物体、未见容器、未见指令表述、干扰容器等。VLA 被寄予厚望，一大原因就是能从互联网图文预训练中继承语义知识。","example":"RT-2 能执行「把可乐罐移到泰勒·斯威夫特的照片旁」或「捡起可以当临时锤子用的东西」（它选了石头），这些概念并不在机器人训练数据里。","related":["泛化","视觉泛化","物体泛化","组合泛化","视觉-语言-动作模型","RT-2"]},{"id":"behavioral-generalization","category":"concept","sec":3,"tier":3,"sources":[{"title":"A Taxonomy for Evaluating Generalist Robot Manipulation Policies (STAR-Gen, arXiv 2503.01238)","url":"https://arxiv.org/abs/2503.01238"}],"as_of":"","related_ids":["generalization","visual-generalization","semantic-generalization","spatial-generalization","object-generalization","cross-embodiment"],"name":"行为泛化","alt":"Behavioral Generalization","abbr":"","aliases":[],"one_liner":"情况变化使「正确动作」也必须改变时，策略仍能完成任务的能力。","explanation":"机器人策略泛化的一个维度。2025 年 Jensen Gao、Dorsa Sadigh 等人提出的 STAR-Gen 分类法把操作泛化分成三类：视觉泛化（画面变了，如换背景、换光照）、语义泛化（语言指令或概念变了）和行为泛化——变化让专家本该做出的动作也跟着变了。行为泛化包括：物体位置变了、物体形状变了需要换抓法、桌面变杂乱或高度变了、质量和摩擦等看不见的物体属性变了，甚至换了一台机器人。这类变化光「认出来」不够，还得「做对」，所以要求训练数据里有足够多样的动作。","example":"训练时杯子总放在桌子中央，测试时挪到桌角，或换成必须捏住把手才能拿起的杯子，策略得调整轨迹和抓法——这属于行为泛化；只把桌布换个颜色则属于视觉泛化。","related":["泛化","视觉泛化","语义泛化","位置泛化（空间泛化）","物体泛化","跨本体"]},{"id":"task-generalization","category":"concept","sec":3,"tier":2,"sources":[{"title":"BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning","url":"https://arxiv.org/abs/2202.02005"},{"title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","url":"https://arxiv.org/abs/2311.01977"}],"as_of":"","related_ids":["generalization","zero-shot","compositional-generalization","semantic-generalization","rt-trajectory","instruction-following"],"name":"任务泛化","alt":"Task Generalization","abbr":"","aliases":["新任务泛化","跨任务泛化"],"one_liner":"策略完成训练中没出现过的新任务或新指令的能力。","explanation":"泛化的一个维度，指模型能否做训练数据里没有的任务，例如只学过「把苹果放进碗里」和「打开抽屉」，能否完成「把苹果放进抽屉」。它通常比换物体、换场景更难，因为要把学过的动作重新组合，还要理解新的语义。谷歌 BC-Z（2022）在 100 多个任务上训练后，在 24 个没有任何示范的新任务上取得平均 44% 的成功率；RT-Trajectory（2023）指出只用语言作条件的策略很难从抓放迁移到折叠这类动作不同的任务，于是改用粗略的轨迹草图作条件。VLA 借助大模型的语义知识，也被寄望提升这类泛化。","example":"只学过「把苹果放进碗里」和「打开抽屉」的机械臂被要求「把苹果放进抽屉」——这是训练数据里没有的任务组合，能做成就体现了任务泛化。","related":["泛化","零样本","组合泛化","语义泛化","RT-Trajectory","指令跟随"]},{"id":"compositional-generalization","category":"concept","sec":3,"tier":3,"sources":[{"title":"Generalization without Systematicity: On the Compositional Skills of Sequence-to-Sequence Recurrent Networks (Lake & Baroni, ICML 2018)","url":"https://arxiv.org/abs/1711.00350"},{"title":"Efficient Data Collection for Robotic Manipulation via Compositional Generalization (Gao et al., RSS 2024)","url":"https://arxiv.org/abs/2403.05110"}],"as_of":"","related_ids":["generalization","task-generalization","semantic-generalization","zero-shot","out-of-distribution","skill-primitive"],"name":"组合泛化","alt":"Compositional Generalization","abbr":"","aliases":["系统性泛化","Systematic Generalization"],"one_liner":"把分别学过的要素重新组合，处理训练中没见过的搭配。","explanation":"组合泛化指模型把训练中分别见过的要素（词、物体、技能、环境因素）按新方式组合后，仍能正确处理。这个问题最早在语言和认知科学中讨论：人学会新动词 dax 后，马上能理解 dax twice 和 sing and dax；Lake 与 Baroni 2018 年（ICML）用 SCAN 基准表明，循环神经网络在需要真正组合的测试上会大幅失败。放到机器人里，要素可以是物体种类、摆放位置、桌面纹理、相机视角，也可以是「抓起」「放进」等原子技能。它重要的原因是要素的组合数随数量成倍增长，不可能每种都采数据。Gao 等人（RSS 2024）发现机器人策略确实能组合部分环境因素，据此设计采集方案，可以少采很多数据。VLA 能否执行「把没见过的物体放进没见过的容器」，也常被当作组合泛化来测。","example":"训练数据里有「红杯子放进碗」和「蓝盘子放进篮子」，测试时让机器人「把红杯子放进篮子」。","related":["泛化","任务泛化","语义泛化","零样本","分布外","原子技能"]},{"id":"cross-embodiment","category":"concept","sec":3,"tier":1,"sources":[{"title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","url":"https://arxiv.org/abs/2310.08864"},{"title":"Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation (CrossFormer)","url":"https://arxiv.org/abs/2408.11812"}],"as_of":"2024-08","related_ids":["embodiment","embodiment-gap","cross-embodiment-data","open-x-embodiment","rt-x","crossformer"],"name":"跨本体","alt":"Cross-Embodiment","abbr":"","aliases":["跨具身","跨形态","跨本体迁移","Cross-embodiment Transfer","Cross-embodiment Learning"],"one_liner":"用多种不同机器人的数据训练一个模型，让它能控制不同机器人。","explanation":"本体指机器人的具体身体：几条臂、几个关节、用夹爪还是灵巧手、装了哪些相机。每种机器人单独采的数据都不多，跨本体学习就是把不同本体的数据合起来训练一个策略，让知识在机器人之间共享，并能迁移或微调到新机器人上。难点是各机器人的观测和动作空间不同，维度、坐标系、控制频率都不一样。2023 年 21 家机构合作的 Open X-Embodiment 汇集了 22 种机器人的数据，在其上训练的 RT-1-X、RT-2-X 出现正迁移，即其他机器人的数据让本机器人做得更好；2024 年的 CrossFormer 用 20 种本体的 90 万条轨迹训练单个策略，同时控制机械臂、轮式机器人、四足和无人机。","example":"Octo 在 Open X-Embodiment 的多机器人数据上预训练，之后几小时就能微调到观测和动作空间都不同的新机器人上。","related":["本体","本体差异","跨本体数据","Open X-Embodiment 数据集","RT-X","CrossFormer"]},{"id":"embodiment-gap","category":"concept","sec":3,"tier":2,"sources":[{"title":"Phantom: Training Robots Without Robots Using Only Human Videos (arXiv 2503.00779)","url":"https://arxiv.org/abs/2503.00779"},{"title":"Mirage: Cross-Embodiment Zero-Shot Policy Transfer with Cross-Painting (arXiv 2402.19249)","url":"https://arxiv.org/abs/2402.19249"}],"as_of":"","related_ids":["cross-embodiment","embodiment","unified-action-space","motion-retargeting","human-video-data","cross-painting"],"name":"本体差异","alt":"Embodiment Gap","abbr":"","aliases":["具身鸿沟","本体鸿沟","形态差异","Cross-embodiment Gap"],"one_liner":"不同机器人之间、人与机器人之间在外形、结构和动作方式上的差别。","explanation":"本体指智能体的身体，包括外观、自由度、运动学结构、手或夹爪的形态、传感器位置和控制接口。本体差异就是两种身体之间的这些不同：换一台机械臂，关节数和动作空间都可能变；人手有五指，很多机器人只有二指夹爪。它是跨本体学习和利用人类视频的核心障碍：在 A 身体上采的数据或训练的策略，往往不能直接用在 B 身体上。常见对策有：统一动作空间或给每种本体加专属输出头；用动作重定向把人手动作映射到机器人关节；在画面上做替换，如 Mirage 把目标机器人抹掉换成源机器人，Phantom（CoRL 2025）把人类视频中的手臂抹掉再叠上渲染的机器人。","example":"用人拿杯子的第一人称视频训练机器人：训练画面里是人手，部署时相机看到的是金属夹爪；人手能捏住的细杯柄，二指夹爪也未必能用同样方式夹住。","related":["跨本体","本体","统一动作空间","动作重定向","人类视频数据","跨本体图像替换"]},{"id":"embodiment-agnostic","category":"concept","sec":3,"tier":3,"sources":[{"title":"Embodiment-Agnostic Action Planning via Object-Part Scene Flow (Tang et al., 2024)","url":"https://arxiv.org/abs/2409.10032"},{"title":"Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation (CrossFormer)","url":"https://arxiv.org/abs/2408.11812"}],"as_of":"","related_ids":["cross-embodiment","embodiment-gap","unified-action-space","embodiment-specific-head","latent-action","intermediate-representation"],"name":"本体无关","alt":"Embodiment-agnostic","abbr":"","aliases":["本体不可知","与本体无关"],"one_liner":"方法或表示不绑定某一款机器人的结构，可以用到不同机器人上。","explanation":"本体无关用来形容一种模型、表示或数据格式不绑定特定的机器人本体（关节数、夹爪类型、相机位置、控制频率各不相同）。机器人学习中，每种机器人的动作空间都不一样，直接混在一起训练很难，所以研究者常用与本体无关的形式描述「要做什么」，比如物体该怎么移动（物体轨迹或场景流）、手或末端的轨迹、潜在动作，再为具体机器人换算出关节指令。Tang 等人 2024 年的工作先生成物体部件的 3D 场景流，再解出不同机器人的动作轨迹，还能从人类视频中学习。另一条路是让同一个网络直接消化各种本体的数据，如 CrossFormer 用同一套权重控制单臂、双臂、轮式车、四旋翼和四足。它与跨本体、统一动作空间、本体专属头等概念相关，目标都是让数据和模型在不同机器人之间复用。","example":"同一条「把杯子挪到盘子左边」的物体运动轨迹，可以分别换算成机械臂夹爪的动作和人形机器人手的动作。","related":["跨本体","本体差异","统一动作空间","本体专属头","潜在动作","中间表示"]},{"id":"open-vocabulary","category":"concept","sec":3,"tier":2,"sources":[{"title":"Open-Vocabulary Object Detection Using Captions","url":"https://arxiv.org/abs/2011.10678"},{"title":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics","url":"https://arxiv.org/abs/2401.12202"}],"as_of":"","related_ids":["open-vocabulary-object-detection","open-vocabulary-segmentation","zero-shot","clip","ok-robot","open-world"],"name":"开放词汇","alt":"Open-vocabulary","abbr":"","aliases":["开集词汇","开放词表"],"one_liner":"模型能认出或处理训练标注类别之外、用任意文字描述的物体和概念。","explanation":"传统检测、分割模型只认训练时固定的一组类别（比如 COCO 的 80 类），叫封闭词汇。开放词汇指模型能接受任意文字作为类别，包括标注里从没出现过的词。2020 年 Zareian 等人提出开放词汇目标检测 OVR-CNN：先用大量图文对学一个视觉-语义共享空间，再用少量框标注训练检测器。之后 CLIP 这类图文对比模型让这条路线普及，出现了 OWL-ViT、Grounding DINO、YOLO-World 等。在具身智能里，开放词汇让机器人能听懂事先没定义过的物体名，常用于开放词汇抓取、导航和移动操作。","example":"OK-Robot 在真实家庭里接收「把毛绒兔子放进篮子」这类任意物体名的指令，先用开放词汇模型找到物体，再抓取放置。","related":["开放词汇检测","开放词汇分割","零样本","CLIP","OK-Robot","开放世界"]},{"id":"open-world","category":"concept","sec":3,"tier":2,"sources":[{"title":"Towards Open World Recognition","url":"https://arxiv.org/abs/1412.5687"},{"title":"π0.5: a Vision-Language-Action Model with Open-World Generalization","url":"https://arxiv.org/abs/2504.16054"}],"as_of":"2025-04","related_ids":["open-vocabulary","out-of-distribution","scene-generalization","long-tail-problem","pi0-5","in-the-wild-data"],"name":"开放世界","alt":"Open-world","abbr":"","aliases":["开放环境","In-the-wild","真实开放场景"],"one_liner":"环境不受控、不断冒出训练时没见过的东西，系统仍要正常工作的设定。","explanation":"开放世界是相对「封闭世界」假设而言的：后者默认测试时出现的类别和场景都在训练范围内。2014 年 Bendale 和 Boult 在视觉识别里正式定义开放世界识别，要求系统能发现未知类别、标为未知，再逐步学会它们。具身智能里这个词用得更宽，泛指走出实验室，进入真实家庭、商店、户外等不受控环境，物体、布局、光照和人的行为都无法提前穷举。Physical Intelligence 2025 年发布的 π0.5 就以开放世界泛化为目标，展示了在全新家庭里收拾厨房、卧室等长程任务。这通常要靠多样化数据和互联网知识迁移来支撑。","example":"π0.5 被放进训练数据里从没出现过的住户家中，接到「收拾厨房」这类指令后自行完成多步清理。","related":["开放词汇","分布外","场景泛化","长尾问题","π0.5","野外数据"]},{"id":"tabletop-manipulation","category":"concept","sec":4,"tier":2,"sources":[{"title":"CLIPort: What and Where Pathways for Robotic Manipulation","url":"https://arxiv.org/abs/2109.12098"},{"title":"Interactive Language: Talking to Robots in Real Time (Language-Table)","url":"https://arxiv.org/abs/2210.06407"}],"as_of":"","related_ids":["manipulation","pick-and-place","rearrangement","mobile-manipulation","cliport","language-table"],"name":"桌面操作","alt":"Tabletop Manipulation","abbr":"","aliases":["桌面场景操作"],"one_liner":"固定在桌边的机械臂对桌上物体做抓取、推动、摆放等操作。","explanation":"机器人操作研究里最常见的实验设定：一台或两台机械臂固定在桌旁，相机从上方、侧面或手腕处看桌面，任务是对桌上物体做抓取、放置、推动、堆叠、摆图案、叠布等。它把移动和导航问题排除在外，场景好搭、便于复现，因此大量数据集和基准都基于桌面。例如 CLIPort（2021）用一个多任务策略覆盖 10 个仿真和 9 个真实桌面任务；谷歌 Language-Table 收集了近 60 万条带语言标注的桌面推方块轨迹。缺点是离真实家庭环境较远、工作空间小，所以近年研究逐渐扩展到移动操作和全身操作。","example":"桌上散放几块彩色积木，用户说「用积木摆一个笑脸」，机械臂依次把积木推到对应位置（Language-Table 中的任务）。","related":["操作","抓取放置","物体重排","移动操作","CLIPort","Language-Table 数据集"]},{"id":"articulated-object-manipulation","category":"concept","sec":4,"tier":2,"sources":[{"title":"Where2Act: From Pixels to Actions for Articulated 3D Objects","url":"https://arxiv.org/abs/2101.02692"},{"title":"SAPIEN: A SimulAted Part-based Interactive ENvironment","url":"https://arxiv.org/abs/2003.08515"}],"as_of":"","related_ids":["articulated-object","articulation-estimation","partnet-mobility","sapien","affordance","manipulation"],"name":"铰接物体操作","alt":"Articulated Object Manipulation","abbr":"","aliases":["关节物体操作","铰接体操作"],"one_liner":"操作带活动关节部件的物体，如开柜门、拉抽屉、掀笔记本盖。","explanation":"铰接物体指由转动或滑动关节连起来的多个部件组成的物体，比如柜门（绕合页转动）、抽屉（沿导轨滑动）、笔记本电脑、水龙头、冰箱门。操作这类物体时，机器人不仅要找到把手，还要推断关节类型、转轴位置和运动方向，并在运动中顺着约束方向施力，否则会卡住甚至扯坏把手。它是家务机器人的基础能力。研究上常用 SAPIEN 仿真器及配套的 PartNet-Mobility 铰接物体数据集；代表工作如 ICCV 2021 的 Where2Act，它通过在仿真中反复交互，学会预测物体上哪里能推、哪里能拉。","example":"打开一个没见过的微波炉：先认出门把手，判断门绕左侧竖直轴转动，再沿以转轴为圆心的圆弧把门拉开。","related":["铰接物体","铰接结构估计","PartNet-Mobility 数据集","SAPIEN","可供性","操作"]},{"id":"deformable-object-manipulation","category":"concept","sec":4,"tier":2,"sources":[{"title":"Challenges and Outlook in Robotic Manipulation of Deformable Objects (arXiv 2105.01767)","url":"https://arxiv.org/abs/2105.01767"}],"as_of":"","related_ids":["garment-manipulation","deformable-body-simulation","cloth-simulation","contact-rich-manipulation","tactile-sensor","softgym-benchmarking-deep-reinforcement-learning-for-deforma"],"name":"柔性物体操作","alt":"Deformable Object Manipulation","abbr":"DOM","aliases":["可变形物体操作","柔性体操作"],"one_liner":"抓取和操控受力会弯折、拉伸、变形的物体，如衣服、线缆、食材。","explanation":"柔性物体操作指操控受力后形状会明显改变的物体，包括布料衣物、绳索线缆、袋子、面团、食材乃至人体组织。传统抓取研究默认物体是刚体，只需估计位置和朝向共 6 个自由度；柔性物体的形状自由度极高，还会折叠、自遮挡，受力后的形变是非线性的，难以建模和仿真。Zhu 等人 2021 年的综述归纳出三大技术难点：形变难感知、自由度高、形变建模非线性，并通过同行问卷认为感知是最值得投入的方向。应用包括叠衣服、工业线束装配、果蔬采摘、手术缝合、助老穿衣等。","example":"叠衣服：机器人要先把一团皱巴巴的 T 恤铺平，再按折线对折，每一步之后衣服形状都会变，没有能提前标好的固定抓取点。","related":["衣物操作","软体仿真","布料仿真","接触丰富操作","触觉传感器","SoftGym"]},{"id":"garment-manipulation","category":"concept","sec":4,"tier":2,"sources":[{"title":"GarmentLab: A Unified Simulation and Benchmark for Garment Manipulation (arXiv 2411.01200)","url":"https://arxiv.org/abs/2411.01200"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"","related_ids":["deformable-object-manipulation","cloth-simulation","bimanual-manipulation","pi0","long-horizon-task","household-tasks"],"name":"衣物操作","alt":"Garment Manipulation","abbr":"","aliases":["叠衣服","叠衣服任务","Cloth Folding","Laundry Folding","Cloth Manipulation"],"one_liner":"让机器人展平、折叠、悬挂、整理衣物，是柔性物体操作里最典型的一类。","explanation":"衣物操作指机器人处理衣服、毛巾等织物的任务，包括展平、折叠、挂衣、整理一堆待洗衣物，甚至帮人穿衣。它属于柔性物体操作：布料能任意变形，没法像刚体那样用一个位姿描述状态，皱成一团时大面积自我遮挡，看不清哪是领口哪是袖子，物理仿真也难做准。因此叠衣服长期被当作检验机器人操作能力的标志性任务。2024 年 Physical Intelligence 的 π0 论文把叠衣服列为代表任务之一；同年的 GarmentLab（NeurIPS 2024）提供了覆盖多种衣物和机器人的仿真基准，并指出现有方法在新衣物上泛化仍然不足。","example":"机器人面对一堆揉皱的 T 恤，要先抓起一件、抖开铺平，再按固定步骤对折叠好，放到一边后接着处理下一件。","related":["柔性物体操作","布料仿真","双臂操作","π0","长程任务","家务任务"]},{"id":"fine-grained-manipulation","category":"concept","sec":4,"tier":2,"sources":[{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ALOHA / ACT, arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"},{"title":"3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing (arXiv 2410.24091)","url":"https://arxiv.org/abs/2410.24091"}],"as_of":"","related_ids":["dexterous-manipulation","contact-rich-manipulation","action-chunking-with-transformers","3d-vitac","visuo-tactile-fusion","bimanual-manipulation"],"name":"精细操作","alt":"Fine-grained Manipulation","abbr":"","aliases":["精密操作","Precise Manipulation","Fine Manipulation"],"one_liner":"对位置和力度要求很高、容错很小的操作，如插电池、穿线、拧小螺丝。","explanation":"精细操作指容错空间很小、需要毫米级定位或细致力度控制的操作任务，比如把电池插进槽里、揭开半透明小杯的盖子、把线穿过小孔。难点有两处：视觉上目标小、常被手或夹爪挡住，稍有偏差就失败；接触时用力稍大就会压坏物体或卡死。早期多靠精确建模加力控，近年主流是端到端模仿学习。2023 年 Zhao 等人的 ALOHA 论文用低成本双臂加 ACT 算法，只用约 10 分钟演示，就在 6 个精细任务上做到 80–90% 成功率。也有工作引入触觉，如 3D-ViTac 融合视觉与触觉来处理易碎物体。它和灵巧操作常一起出现，但后者更强调多指手。","example":"ALOHA 的双臂从半透明的小酱料杯上揭开盖子，或把电池准确插进槽里。","related":["灵巧操作","接触丰富操作","ACT","3D-ViTac","视触觉融合","双臂操作"]},{"id":"contact-rich-manipulation","category":"concept","sec":4,"tier":2,"sources":[{"title":"A Survey of Robot Manipulation in Contact (arXiv 2112.01942)","url":"https://arxiv.org/abs/2112.01942"},{"title":"Factory: Fast Contact for Robotic Assembly (arXiv 2205.03532)","url":"https://arxiv.org/abs/2205.03532"}],"as_of":"","related_ids":["peg-in-hole-insertion","force-control","impedance-control","tactile-sensor","dexterous-manipulation","robotic-assembly"],"name":"接触丰富操作","alt":"Contact-rich Manipulation","abbr":"","aliases":["富接触操作","强接触操作","Manipulation in Contact"],"one_liner":"需要与物体或环境持续接触、并控制好接触力才能完成的操作任务。","explanation":"接触丰富操作指机器人在任务中与物体、环境保持持续或反复接触，必须显式或隐式地控制接触力才能成功的一类操作，典型如轴孔装配、拧螺母、插插头、擦桌子、按摩。Suomalainen 等人 2022 年发表在 Robotics and Autonomous Systems 的综述把它分成两种：任务本身要求接触的，以及主动借助接触来消除位置不确定性的（比如让零件贴着表面滑进孔里）。难点在于容差小、接触状态靠视觉很难看清，仿真也不容易算准摩擦和碰撞。常见做法是阻抗控制或力控（让机械臂像弹簧一样顺从外力），配合力/力矩传感器或触觉传感器；学习方法则把力或触觉信号加入策略输入。","example":"用机械臂把螺母拧到螺栓上：对准后要一边施加轴向压力一边旋转，力太大会卡死，太小会打滑。英伟达 2022 年的 Factory 仿真框架就以螺母螺栓装配为主要场景。","related":["轴孔装配","力控","阻抗控制","触觉传感器","灵巧操作","装配"]},{"id":"robotic-assembly","category":"concept","sec":4,"tier":2,"sources":[{"title":"NIST Robotic Grasping and Manipulation for Assembly - Assembly Performance Metrics and Test Methods","url":"https://www.nist.gov/el/intelligent-systems-division-73500/robotic-grasping-and-manipulation-assembly/assembly"},{"title":"IndustReal: Transferring Contact-Rich Assembly Tasks from Simulation to Reality","url":"https://arxiv.org/abs/2305.17110"}],"as_of":"","related_ids":["peg-in-hole-insertion","contact-rich-manipulation","force-control","compliance-control","factory-industreal","industrial-robot"],"name":"装配","alt":"Robotic Assembly","abbr":"","aliases":["机器人装配","组装"],"one_liner":"让机器人把零件插、拧、扣、卡到一起，组成部件或产品的操作任务。","explanation":"装配是工业机器人最传统、也最难全自动化的任务之一，包括轴孔插入、齿轮啮合、插接插头、拧螺母、挂皮带、布线束等。难点在于零件配合间隙很小，常常比视觉定位误差还小，必须靠力觉或柔顺控制在接触中摸索对准，属于典型的接触丰富操作。美国国家标准与技术研究院（NIST）为此设计了一套装配任务板作为评测基准。传统方案依赖精密夹具和示教编程，换产品就得重新调试；学习方法正在补这一块，例如英伟达的 IndustReal 在仿真里用强化学习训练插装策略，再直接迁移到真实机械臂上。","example":"机械臂把一根圆柱销插进配合很紧的孔里：先移到孔上方，接触后靠力反馈微调位置，对准后再压入。","related":["轴孔装配","接触丰富操作","力控","柔顺控制","Factory / IndustReal 接触丰富装配仿真","工业机器人"]},{"id":"peg-in-hole-insertion","category":"concept","sec":4,"tier":3,"sources":[{"title":"Advances in Robotic Peg-in-Hole Assembly: A Comprehensive Review (Chinese Journal of Mechanical Engineering, 2025)","url":"https://link.springer.com/article/10.1186/s10033-025-01349-w"}],"as_of":"","related_ids":["contact-rich-manipulation","robotic-assembly","force-control","impedance-control","remote-center-compliance-device","factory-industreal"],"name":"轴孔装配","alt":"Peg-in-Hole Insertion","abbr":"","aliases":["孔轴装配","插孔任务","插销入孔","Peg-in-Hole Assembly"],"one_liner":"把销、轴或插头插进配合孔里的装配任务，考验精度和力控。","explanation":"轴孔装配指机器人把一个零件（轴、销、插头）插入另一个零件的孔里，是工业装配中最典型、研究最多的操作之一，也常被当作接触丰富操作（过程中持续接触、受力复杂的操作）的标准测试题。难点在于配合间隙往往很小，只靠位置控制容易卡阻或楔死，需要根据接触力不断微调。2025 年《中国机械工程学报》英文版的一篇综述把过程分为搜孔、对准、插入三个阶段，把方法归为被动柔顺（如远中心柔顺装置）、主动柔顺（力控、阻抗控制）和结合学习的智能柔顺装配。模仿学习、强化学习和仿真到现实迁移的研究也常拿它做基准任务。","example":"ALOHA 仿真里的 Insertion 任务：左右两只机械臂分别抓起插座和插销，在空中把插销插进插座。","related":["接触丰富操作","装配","力控","阻抗控制","远中心柔顺装置（RCC）","Factory / IndustReal 接触丰富装配仿真"]},{"id":"in-hand-manipulation","category":"concept","sec":4,"tier":2,"sources":[{"title":"Learning Dexterous In-Hand Manipulation (OpenAI, 2018)","url":"https://arxiv.org/abs/1808.00177"}],"as_of":"","related_ids":["dexterous-manipulation","dexterous-hand","finger-gaiting","dactyl","domain-randomization","tactile-sensor"],"name":"手内操作","alt":"In-hand Manipulation","abbr":"","aliases":["手中操作","手内重定向","In-hand Reorientation"],"one_liner":"用手指在手里调整物体的朝向或位置，不用放下再重新抓。","explanation":"手内操作指机器人用多指手在不松开物体的前提下，靠手指配合去转动、平移或重新握住手里的物体，典型任务是把物体转到指定朝向（手内重定向）。人转笔、拧钥匙、玩魔方靠的都是这种能力。难点在于接触点多且不断变化，手指要轮流接触和离开物体（指步态），视线还常被自己的手挡住。代表工作是 OpenAI 2018 年的 Learning Dexterous In-Hand Manipulation：在仿真里用强化学习训练 Shadow 灵巧手转方块，同时随机化摩擦系数、物体外观等物理和视觉属性（域随机化），再直接迁移到真机；训练中自然涌现了指步态、多指协同和利用重力等行为。它是灵巧操作里最难的子问题之一，常和触觉传感、仿真到现实迁移一起出现。","example":"OpenAI 的 Shadow 灵巧手只靠手指拨动，把掌心上的字母方块转到指定的那一面朝上（Dactyl 项目）。","related":["灵巧操作","灵巧手","指步态","Dactyl（OpenAI 魔方灵巧手）","域随机化","触觉传感器"]},{"id":"tool-use","category":"concept","sec":4,"tier":2,"sources":[{"title":"Creative Robot Tool Use with Large Language Models (arXiv 2310.13065)","url":"https://arxiv.org/abs/2310.13065"}],"as_of":"","related_ids":["affordance","manipulation","contact-rich-manipulation","llm-based-task-planning","long-horizon-task","dexterous-manipulation"],"name":"工具使用","alt":"Tool Use","abbr":"","aliases":["工具操作"],"one_liner":"机器人借助外部物体当工具，完成徒手够不着或做不到的任务。","explanation":"指机器人把环境中的物体当作手臂的延伸来用，比如用钩子把远处的东西拉过来、用铲子翻炒、用螺丝刀拧螺丝。难点在于要理解工具的形状和可供性（物体能被怎样使用），掌握工具与目标物之间的接触力学，并在握住工具后重新规划动作。2023 年的 RoboTool 研究把「创造性工具使用」分为三类：从多个物体中选对工具、按顺序使用多个工具、临时制造或组装工具。近年常见做法是用大语言模型做高层推理，再用模仿学习或强化学习学具体动作。注意它和大模型领域的「工具调用」（让 AI 调用 API）不是一回事。","example":"RoboTool（2023）中，Kinova 机械臂够不到桌子远端的牛奶盒，于是从几件物品中挑出锤子，把牛奶盒勾到可抓取的范围内。","related":["可供性","操作","接触丰富操作","大模型任务规划","长程任务","灵巧操作"]},{"id":"task-oriented-grasping","category":"concept","sec":4,"tier":3,"sources":[{"title":"Same Object, Different Grasps: Data and Semantic Knowledge for Task-Oriented Grasping (Murali et al., CoRL 2020)","url":"https://arxiv.org/abs/2011.06431"},{"title":"GraspGPT: Leveraging Semantic Knowledge from a Large Language Model for Task-Oriented Grasping","url":"https://arxiv.org/abs/2307.13204"}],"as_of":"2023-07","related_ids":["grasping","affordance","affordance-detection","grasp-pose-detection","tool-use","human-robot-handover"],"name":"任务导向抓取（功能性抓取）","alt":"Task-Oriented Grasping","abbr":"TOG","aliases":["功能性抓取","面向任务的抓取","Functional Grasping"],"one_liner":"按接下来要做的事选抓法：同一物体用途不同，抓的位置和姿态也不同。","explanation":"普通抓取只关心「抓稳」，任务导向抓取还要求抓法适合后续任务：用锤子钉钉子要握锤柄，把剪刀递给别人则应捏住刀刃一侧、把手柄留给对方。它要把物体部件、可供性（物体哪个部位能拿来干什么）和任务语义联系起来，是连接「抓起来」和「用起来」的一环。2020 年卡内基梅隆大学等团队在 CoRL 发表 TaskGrasp 数据集（191 个物体、56 种任务、约 25 万个抓取），用知识图谱编码物体与任务的关系来泛化到新物体和新任务；2023 年的 GraspGPT 等工作开始借大语言模型的常识处理没见过的物体-任务组合。","example":"同一把刀：机器人自己切菜时握刀柄；递给人时捏住刀背一侧，把刀柄朝向对方。","related":["抓取","可供性","可供性检测","抓取位姿检测","工具使用","人机物体交接"]},{"id":"non-prehensile-manipulation","category":"concept","sec":4,"tier":3,"sources":[{"title":"Learning to Grasp the Ungraspable with Emergent Extrinsic Dexterity (Zhou & Held, CoRL 2022)","url":"https://arxiv.org/abs/2211.01500"},{"title":"Nonprehensile Dynamic Manipulation: A Survey (Ruggiero et al., RA-L 2018)","url":"https://doi.org/10.1109/LRA.2018.2801939"}],"as_of":"","related_ids":["extrinsic-dexterity","contact-rich-manipulation","dynamic-manipulation","grasping","push-t","quasi-static-assumption"],"name":"非抓取操作","alt":"Non-prehensile Manipulation","abbr":"","aliases":["非抓握操作","推拨操作","Nonprehensile Manipulation"],"one_liner":"不把物体抓牢，而是靠推、拨、翻、抛等动作来移动它","explanation":"非抓取操作指机器人不用夹爪或手把物体完全握住，而是通过推、滑、拨、翻转、抛接、托举等方式改变物体的位置和姿态。它有用的原因是：物体太大、太扁、贴着墙或被挡住时根本抓不起来；有时推一下也比抓起再放下更快。难点在于物体怎么动取决于摩擦和接触，很难精确预测和控制。Mason、Lynch 等人较早研究了推动操作的力学，Ruggiero 等人 2018 年在 RA-L 发表了动态非抓取操作综述。常用基准 Push-T 就是把 T 形块推到目标位置。它常与外在灵巧性一起出现，即借助桌面、墙壁等环境完成操作。","example":"扁平的卡片平躺在桌上夹不起来，机器人先把它推到桌边让一截悬空，再从侧面夹住；Zhou 和 Held（CoRL 2022）用强化学习让简单夹爪把物体顶到墙上翻起再抓，真机成功率 78%。","related":["外在灵巧性","接触丰富操作","动态操作","抓取","Push-T","准静态假设"]},{"id":"dynamic-manipulation","category":"concept","sec":4,"tier":3,"sources":[{"title":"Dynamic Nonprehensile Manipulation: Controllability, Planning and Experiments (Lynch & Mason, IJRR 1999)","url":"https://publications.ri.cmu.edu/dynamic-nonprehensile-manipulation-controllability-planning-and-experiments/"},{"title":"FlingBot: The Unreasonable Effectiveness of Dynamic Manipulation for Cloth Unfolding (CoRL 2021)","url":"https://arxiv.org/abs/2105.03655"},{"title":"TossingBot: Learning to Throw Arbitrary Objects with Residual Physics","url":"https://arxiv.org/abs/1903.11239"}],"as_of":"","related_ids":["non-prehensile-manipulation","deformable-object-manipulation","garment-manipulation","extrinsic-dexterity","quasi-static-assumption","manipulation"],"name":"动态操作","alt":"Dynamic Manipulation","abbr":"","aliases":[],"one_liner":"利用速度、惯性和重力完成的操作，比如抛、甩、接、颠。","explanation":"动态操作指机器人有意利用物体的速度、惯性、重力、离心力等动力学效应完成任务，比如抛掷、甩动、接住、拍打。与它相对的是准静态操作：动作慢到可以忽略惯性，每一刻都近似处于静止平衡，大多数抓取放置属于这一类。机器人学里较早的系统研究来自 Lynch 与 Mason（IJRR 1999），他们证明只有一两个关节的简单机械臂，借助滚动、滑动和抛飞也能控制物体状态。动态操作更快，还能把物体送到手臂够不到的地方；难点在于物体一旦脱手就无法修正，需要准确预测动力学，高速下对感知和控制延迟也更敏感。近年学习方法把它和数据驱动结合，如 TossingBot 学抛物入箱，FlingBot 学甩开布料，IRP 学甩绳击中目标。","example":"FlingBot 用双臂抓住布的两角向前一甩，把一团乱布摊开，比一点点拉平快得多，还能展开比手臂够得着范围更大的布。","related":["非抓取操作","柔性物体操作","衣物操作","外在灵巧性","准静态假设","操作"]},{"id":"extrinsic-dexterity","category":"concept","sec":4,"tier":3,"sources":[{"title":"Extrinsic Dexterity: In-Hand Manipulation with External Forces (Chavan-Dafle et al., ICRA 2014)","url":"https://publications.ri.cmu.edu/extrinsic-dexterity-in-hand-manipulation-with-external-forces/"},{"title":"Learning to Grasp the Ungraspable with Emergent Extrinsic Dexterity (Zhou & Held, CoRL 2022)","url":"https://arxiv.org/abs/2211.01500"}],"as_of":"","related_ids":["non-prehensile-manipulation","in-hand-manipulation","contact-rich-manipulation","dexterous-manipulation","dynamic-manipulation","gripper"],"name":"外在灵巧性","alt":"Extrinsic Dexterity","abbr":"","aliases":["外部灵巧性"],"one_liner":"借助重力、桌面、墙壁、手臂甩动等外部条件，让简单夹爪完成复杂操作。","explanation":"外在灵巧性由 Chavan-Dafle、Rodriguez、Mason 等人在 ICRA 2014 的论文中提出，指不靠手指自身的灵活运动，而是借助手外部的资源，包括重力、与桌面或墙壁的接触、手臂的动态运动，来调整物体在手中的位置或完成操作。传统灵巧操作主要依赖多指手的手指协调运动。原论文为简单夹爪设计了 12 种重新抓取动作，在 3 个物体上做了 1200 多次实验，说明简单夹爪也能完成相当多的手内操作。它的意义在于：高自由度灵巧手昂贵且难控制，而善用环境能大幅扩展简单夹爪的能力。后续工作开始用学习方法自动发现这类技巧，例如 Zhou 与 Held（CoRL 2022）用强化学习让夹爪学会把平躺、无处下手的物体推靠墙壁翻起再抓，从仿真迁移到真机的成功率为 78%。","example":"书平放在桌上，夹爪无从下手，机器人先把书推到墙边让它斜立起来，再从侧面夹住。","related":["非抓取操作","手内操作","接触丰富操作","灵巧操作","动态操作","夹爪"]},{"id":"aerial-manipulation","category":"concept","sec":4,"tier":3,"sources":[{"title":"Aerial Manipulation: A Literature Review (Ruggiero, Lippiello, Ollero, IEEE RA-L 2018)","url":"https://doi.org/10.1109/LRA.2018.2808541"},{"title":"Past, Present, and Future of Aerial Robotic Manipulators (Ollero et al., IEEE T-RO)","url":"https://doi.org/10.1109/TRO.2021.3084395"},{"title":"AEROARMS project","url":"https://aeroarms-project.eu/"}],"as_of":"","related_ids":["unmanned-aerial-vehicle","mobile-manipulation","contact-rich-manipulation","inspection-robot","aerial-vision-and-language-navigation","whole-body-control"],"name":"空中操作","alt":"Aerial Manipulation","abbr":"","aliases":["空中机器人操作","飞行操作"],"one_liner":"让无人机等飞行平台带上机械臂或夹爪，在空中与物体发生物理接触。","explanation":"把飞行平台的机动性和机械臂的操作能力结合起来的方向。常见形态是多旋翼无人机挂载一条或多条机械臂、夹爪，也有直升机和能朝多个方向产生推力的专用平台。与只负责拍照测绘的普通无人机不同，它要在悬停或飞行中抓取、按压、插拔或做接触式检测。难点在于机械臂运动和接触力会反过来扰动机体姿态，需要把飞行与操作放在一起建模和控制，同时载重和续航都很受限。欧盟 AEROARMS 项目（2015–2019，塞维利亚大学 Ollero 团队牵头）研制了带多条机械臂的无人机，用于炼油厂等工业设施的检测与维护。","example":"AEROARMS 项目的多臂无人机在德国一处炼油厂完成最终评审演示，飞到高处管道旁做接触式检测，替代人员登高作业。","related":["无人机（空中机器人）","移动操作","接触丰富操作","巡检机器人","空中视觉语言导航（无人机 VLN）","全身控制"]},{"id":"legged-locomotion","category":"concept","sec":5,"tier":2,"sources":[{"title":"Learning Quadrupedal Locomotion over Challenging Terrain (Lee et al., Science Robotics 2020)","url":"https://arxiv.org/abs/2010.11251"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (Rudin et al.)","url":"https://arxiv.org/abs/2109.11978"}],"as_of":"","related_ids":["locomotion","bipedal-locomotion","quadruped-robot","rl-based-locomotion-control","perceptive-locomotion","sim-to-real-transfer"],"name":"腿足运动","alt":"Legged Locomotion","abbr":"","aliases":["足式运动","腿式运动","足式行走"],"one_liner":"让四足、双足等腿式机器人稳定地走、跑、跳、爬坡的运动控制问题。","explanation":"腿足运动研究腿式机器人（四足、双足等）如何靠交替落脚在地面上移动。和轮子相比，腿能跨越台阶、碎石、草地等不连续地形，但要持续处理平衡、脚与地面接触的切换和摔倒风险。传统方法依赖动力学模型和模型预测控制（MPC，每一步都往前优化一小段动作）；近几年强化学习成为主流：ETH Zurich 的 Lee 等人（Science Robotics 2020）只用关节和惯性等本体感知在仿真里训练，零样本迁移到 ANYmal 四足，在泥地、雪地、碎石上也能走；Rudin 等人（2021）在单张 GPU 上并行上千个仿真机器人，平地策略不到 4 分钟、崎岖地形约 20 分钟就能训练出来。它下分双足行走、盲走、感知行走、跑酷等子方向，是四足和人形机器人最基础的能力。","example":"ANYmal 四足机器人只靠自身关节和 IMU 信号，没有摄像头，在泥地、雪地和流水中保持行走（Lee 等，2020）。","related":["运动（移动）","双足行走","四足机器人","强化学习运控","感知行走","仿真到现实迁移"]},{"id":"bipedal-locomotion","category":"concept","sec":5,"tier":2,"sources":[{"title":"Real-World Humanoid Locomotion with Reinforcement Learning (arXiv 2303.03381)","url":"https://arxiv.org/abs/2303.03381"},{"title":"Zero moment point - Wikipedia","url":"https://en.wikipedia.org/wiki/Zero_moment_point"}],"as_of":"","related_ids":["legged-locomotion","humanoid-robot","zero-moment-point","rl-based-locomotion-control","sim-to-real-transfer","balance-control"],"name":"双足行走","alt":"Bipedal Locomotion","abbr":"","aliases":["双足步行","人形行走","Humanoid Locomotion"],"one_liner":"机器人只用两条腿走、跑并保持平衡的运动能力，是人形机器人的基本功。","explanation":"双足行走指机器人只靠两条腿完成行走、奔跑、上下台阶、被推后站稳等动作。两足支撑面小、重心高，天生不稳，是足式运动里最难的一类。早期主流方法围绕零力矩点（ZMP，地面反力产生的水平力矩为零的点）：规划重心和落脚点，让 ZMP 始终落在脚掌支撑区内，本田 ASIMO 就是这一路线。近几年主流转向强化学习：在仿真里用大量随机化环境训练，再零样本迁移到真机，例如伯克利团队 2023 年用因果 Transformer 让 Agility Digit 在广场、草地等多种户外地面上行走。它是人形机器人做移动操作的前提。","example":"伯克利 Radosavovic 等人的行走控制器完全在仿真中训练，不做微调直接部署到 Agility Digit 人形机器人上，在人行道、跑道、草地上稳定行走，还能承受外力推搡。","related":["腿足运动","人形机器人","零力矩点","强化学习运控","仿真到现实迁移","平衡控制"]},{"id":"rough-terrain-locomotion","category":"concept","sec":5,"tier":2,"sources":[{"title":"Learning Quadrupedal Locomotion over Challenging Terrain (Lee et al., Science Robotics 2020)","url":"https://arxiv.org/abs/2010.11251"},{"title":"Learning robust perceptive locomotion for quadrupedal robots in the wild (Miki et al., Science Robotics 2022)","url":"https://arxiv.org/abs/2201.08117"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (Rudin et al., CoRL 2021)","url":"https://arxiv.org/abs/2109.11978"}],"as_of":"2022-01","related_ids":["legged-locomotion","perceptive-locomotion","blind-locomotion","terrain-curriculum","teacher-student-distillation","sim-to-real-transfer"],"name":"复杂地形行走","alt":"Rough-terrain Locomotion","abbr":"","aliases":["越野行走","非结构化地形行走","复杂地形运动"],"one_liner":"足式机器人在台阶、碎石、草地、雪地等不平整地面上稳定移动的能力。","explanation":"指腿足机器人在台阶、斜坡、碎石、泥地、雪地等不平整甚至会变形的地面上行走而不摔倒。传统做法靠人工建模和调参，地形一变就容易失效。2020 年苏黎世联邦理工（ETH）团队用强化学习在仿真里训练 ANYmal 四足：先让能看到真实地形的「教师」策略学会走，再蒸馏给只靠本体感知（关节角、IMU 等身体内部传感器）的「学生」策略，直接部署到野外；2022 年又融合了深度等外部感知，论文称在阿尔卑斯山完成了约一小时的徒步路线，用时与人类推荐时间相当。如今它是检验足式运控的基本考题，常与地形课程、域随机化一起出现。","example":"ANYmal 四足在 2022 年 Science Robotics 论文中，靠融合深度感知与本体感知的策略，走完了阿尔卑斯山一段约一小时的徒步路线。","related":["腿足运动","感知行走","盲走","地形课程","教师-学生蒸馏","仿真到现实迁移"]},{"id":"blind-locomotion","category":"concept","sec":5,"tier":3,"sources":[{"title":"Learning Quadrupedal Locomotion over Challenging Terrain (Lee et al., Science Robotics 2020)","url":"https://arxiv.org/abs/2010.11251"},{"title":"Blind Bipedal Stair Traversal via Sim-to-Real Reinforcement Learning (Siekmann et al., RSS 2021)","url":"https://arxiv.org/abs/2105.08328"}],"as_of":"","related_ids":["perceptive-locomotion","proprioception","legged-locomotion","rough-terrain-locomotion","teacher-student-distillation","sim-to-real-transfer"],"name":"盲走","alt":"Blind Locomotion","abbr":"","aliases":["纯本体感知行走","无视觉行走","Proprioceptive Locomotion"],"one_liner":"不用相机和雷达，只靠关节、IMU 等本体感知走路的运动控制方式。","explanation":"盲走指足式机器人行走时不使用相机、激光雷达等外部感知，只依赖关节编码器、IMU（惯性测量单元）等本体感知信号，靠脚下的触地反馈推断地形。代表工作是 ETH 苏黎世 Hutter 组 2020 年发表在 Science Robotics 上的 ANYmal 四足控制器：神经网络只读取本体感知信号序列，训练时用了教师-学生蒸馏，在仿真中训练后零样本迁移到泥地、雪地、碎石、茂密植被和流水等野外地形。2021 年 Siekmann 等人（RSS）用类似思路，让双足机器人 Cassie 只靠本体感知走真实楼梯。盲走的好处是不怕视觉失效（黑暗、烟雾、草丛遮挡），也省掉建图带来的延迟和误差；缺点是只能踩到之后再反应，难以提前规划跨越高台阶或沟壑。因此它常和感知行走结合，在视觉不可靠时兜底。","example":"ANYmal 四足机器人不看路，只凭腿部关节和 IMU 的信号，走过泥地、雪地和湍急的流水。","related":["感知行走","本体感知","腿足运动","复杂地形行走","教师-学生蒸馏","仿真到现实迁移"]},{"id":"perceptive-locomotion","category":"concept","sec":5,"tier":3,"sources":[{"title":"Learning robust perceptive locomotion for quadrupedal robots in the wild (Science Robotics, 2022)","url":"https://arxiv.org/abs/2201.08117"}],"as_of":"","related_ids":["blind-locomotion","legged-locomotion","rough-terrain-locomotion","elevation-map","proprioception","exteroception"],"name":"感知行走","alt":"Perceptive Locomotion","abbr":"","aliases":["感知型运动","视觉行走","感知式足式运动"],"one_liner":"足式机器人借助相机、激光雷达看清前方地形，再决定怎么迈步。","explanation":"感知行走指腿足机器人同时使用本体感知（关节角度、IMU 等身体内部信号）和外部感知（深度相机、激光雷达建的高程图等），提前看到台阶、沟坎和障碍再调整步态；与之相对的是只靠本体感知「摸着走」的盲走。难点在于外部感知不总可靠：雪地、高草、反光都会让地图出错。苏黎世联邦理工 Miki 等人 2022 年发表在《Science Robotics》的工作，用基于注意力的循环编码器融合两类输入，在仿真中训练后部署到 ANYmal 四足上，感知失真时会自动更多依赖本体感知。如今人形和四足的爬楼梯、跑酷大多属于感知行走。","example":"Miki 等人的控制器驱动 ANYmal 四足在阿尔卑斯山完成一段约一小时的徒步路线，用时与给人类徒步者的推荐时间相当。","related":["盲走","腿足运动","复杂地形行走","高程图","本体感知","外部感知"]},{"id":"parkour","category":"concept","sec":5,"tier":2,"sources":[{"title":"Robot Parkour Learning","url":"https://arxiv.org/abs/2309.05665"},{"title":"Extreme Parkour with Legged Robots","url":"https://arxiv.org/abs/2309.14341"},{"title":"Flipping the Script with Atlas (Boston Dynamics)","url":"https://bostondynamics.com/blog/flipping-the-script-with-atlas/"}],"as_of":"2024-06","related_ids":["legged-locomotion","perceptive-locomotion","robot-parkour-learning","extreme-parkour","sim-to-real-transfer","teacher-student-distillation"],"name":"跑酷","alt":"Parkour","abbr":"","aliases":["机器人跑酷"],"one_liner":"腿足机器人靠视觉连续攀爬、跳跃、钻过障碍的高动态运动技能。","explanation":"跑酷原是人类街头运动，在机器人领域指四足或人形机器人快速通过高台、沟壑、矮栏、窄缝等障碍，是检验运动控制极限的代表任务。波士顿动力液压版 Atlas 的跑酷表演用的是离线轨迹优化做好的动作模板，再由模型预测控制和实时感知微调。2023 年起学习方法成为主流：Robot Parkour Learning（CoRL 2023）和 Extreme Parkour 先在仿真里用强化学习训练，再蒸馏成只看深度相机的端到端策略，直接部署到低成本四足上；2024 年 Humanoid Parkour Learning 把类似做法用到人形机器人。","example":"Extreme Parkour 中，一台低成本四足只凭前置深度相机，跳上约两倍身高的台子、跨过约两倍身长的沟。","related":["腿足运动","感知行走","Robot Parkour Learning","Extreme Parkour","仿真到现实迁移","教师-学生蒸馏"]},{"id":"fall-recovery","category":"concept","sec":5,"tier":2,"sources":[{"title":"Learning Humanoid Standing-up Control across Diverse Postures (HoST, arXiv 2502.08378)","url":"https://arxiv.org/abs/2502.08378"},{"title":"Learning Getting-Up Policies for Real-World Humanoid Robots (HumanUP, arXiv 2502.12152)","url":"https://arxiv.org/abs/2502.12152"}],"as_of":"2025-04","related_ids":["host","fall-mitigation-and-fall-recovery","push-recovery","balance-control","rl-based-locomotion-control","humanoid-robot"],"name":"跌倒恢复（摔倒起身）","alt":"Fall Recovery / Getting Up","abbr":"","aliases":["摔倒起身","起身控制","Standing-up Control"],"one_liner":"人形或足式机器人摔倒后，从躺、趴等姿势自己重新站起来的能力。","explanation":"跌倒恢复指腿足机器人摔倒后，从仰躺、俯卧、侧卧、靠墙等姿势重新站起，回到能继续行走的状态。人形机器人重心高、脚底支撑面小，在真实环境里摔倒难以完全避免，如果每次都要人扶，就谈不上自主部署。起身比走路难学：躯干、四肢多处同时触地，接触顺序不固定，奖励又很稀疏。过去常用人工编排的固定起身动作，换个姿势或地形就容易失败。2025 年出现了在仿真里用强化学习训练、直接迁移到宇树 G1 真机的方法，如 HoST 和 HumanUP，均发表于 RSS 2025。与之相关的还有跌倒保护，即摔倒过程中尽量减小冲击、保护硬件。","example":"HumanUP 在宇树 G1 上测试，机器人能从仰躺和俯卧两种姿势出发，在草地、雪地和斜坡上自己站起来。","related":["HoST（人形起身）","跌倒保护与摔倒恢复","推恢复","平衡控制","强化学习运控","人形机器人"]},{"id":"text-to-motion","category":"concept","sec":5,"tier":3,"sources":[{"title":"Generating Diverse and Natural 3D Human Motions from Texts (HumanML3D, CVPR 2022)","url":"https://ericguo5513.github.io/text-to-motion/"},{"title":"Human Motion Diffusion Model (MDM)","url":"https://arxiv.org/abs/2209.14916"},{"title":"Learning from Massive Human Videos for Universal Humanoid Pose Control (UH-1)","url":"https://arxiv.org/abs/2412.14172"}],"as_of":"2024-12","related_ids":["mdm","humanml3d","uh-1","motion-retargeting","motion-tracking","whole-body-control"],"name":"文本驱动动作生成","alt":"Text-to-Motion (Text-Driven Humanoid Motion Generation)","abbr":"","aliases":["文本生成动作","Text-to-Motion","语言驱动人形动作生成"],"one_liner":"输入一句文字描述，输出一段对应的人体或人形机器人全身动作。","explanation":"起源于图形学和视觉领域的人体动作生成：输入「一个人向前走几步再挥手」这样的文字，模型输出一段三维人体姿态序列，代表数据集是 HumanML3D（CVPR 2022，14,616 段动作、44,970 条文本描述），代表模型有基于扩散模型的 MDM（2022）。搬到人形机器人上，生成的人体动作不一定符合机器人的关节结构和物理约束，通常要先做动作重定向（把人的动作映射到机器人骨架），再交给强化学习训练的运动跟踪或全身控制策略执行。2024 年 12 月的 UH-1 从约 240 小时视频整理出 Humanoid-X 数据集，训练模型从文字生成人形动作，并在宇树 H1-2 上做了真机验证。","example":"UH-1 论文中，给宇树 H1-2 输入「拳击」「鼓掌」「弹吉他」等 12 条语言指令，模型生成对应的全身动作，论文报告真机成功率接近 100%。","related":["MDM（人体动作扩散模型）","HumanML3D 数据集","UH-1 / Humanoid-X","动作重定向","运动跟踪","全身控制"]},{"id":"loco-manipulation","category":"concept","sec":5,"tier":2,"sources":[{"title":"Deep Whole-Body Control: Learning a Unified Policy for Manipulation and Locomotion (CoRL 2022)","url":"https://arxiv.org/abs/2210.10044"},{"title":"HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit","url":"https://arxiv.org/abs/2502.13013"}],"as_of":"","related_ids":["mobile-manipulation","whole-body-control","legged-locomotion","humanoid-robot","legged-mobile-manipulator","homie"],"name":"运动操作一体化","alt":"Loco-manipulation","abbr":"","aliases":["移动-操作一体","全身移动操作","Whole-body Loco-manipulation"],"one_liner":"腿部移动和手臂操作放在一起协调控制，边走边干活。","explanation":"Loco-manipulation 由 locomotion（运动）和 manipulation（操作）合成，指腿式机器人（带机械臂的四足、人形）把移动和操作当作一个整体来完成任务，比如下蹲捡起地上的箱子、边走边推车。它和一般的移动操作有区别：轮式底盘上的机械臂可以先移动、停稳再操作，而腿式机器人的腿本身要参与平衡和发力，手臂一动重心就变，必须全身协调。Fu、Cheng、Pathak 的 Deep Whole-Body Control（CoRL 2022）指出，把腿和臂分开控制需要大量工程来协调，而且误差会在模块间传递，于是用一个强化学习策略同时控制带臂四足的腿和臂。人形方向，HOMIE（2025）用踏板控制行走、同构外骨骼控制手臂、数据手套控制手指，让人形机器人边走、边下蹲边操作物体。它是人形机器人进入家庭和工厂的关键能力。","example":"人形机器人走到货架前，下蹲把最底层的箱子抱起，再站起来边走边把箱子搬到推车上。","related":["移动操作","全身控制","腿足运动","人形机器人","足式移动操作机器人（带臂四足）","HOMIE"]},{"id":"point-goal-navigation","category":"concept","sec":5,"tier":2,"sources":[{"title":"On Evaluation of Embodied Navigation Agents","url":"https://arxiv.org/abs/1807.06757"},{"title":"Habitat Challenge 2020","url":"https://aihabitat.org/challenge/2020/"},{"title":"DD-PPO: Learning Near-Perfect PointGoal Navigators from 2.5 Billion Frames","url":"https://arxiv.org/abs/1911.00357"}],"as_of":"2020-06","related_ids":["navigation","object-goal-navigation","success-weighted-by-path-length","habitat","image-goal-navigation","visual-odometry"],"name":"点目标导航","alt":"Point-Goal Navigation","abbr":"PointNav","aliases":["点导航","PointGoal Navigation"],"one_liner":"给出相对起点的目标坐标，让机器人在陌生环境里自己走到那个点。","explanation":"点目标导航是 2018 年导航评测工作组论文定义的最基础的具身导航任务：智能体在没见过的环境里出生，目标用相对起点的坐标给出（如「向北 5 米、向西 3 米」），不用认物体，只需避障、规划并走到位。Habitat 2020 挑战赛规定，发出停止动作时距目标 0.36 米（两倍机身半径）以内算成功，用路径长度加权成功率 SPL 衡量走得是否高效。2019 年 Wijmans 等人的 DD-PPO 用 25 亿步仿真经验训练，在有 RGB-D 相机和 GPS+指南针时基本「解决」了该任务；2020 年挑战赛又去掉 GPS+指南针并加入噪声，更接近真机。","example":"在 Habitat 里给智能体目标「向北 5 米、向西 3 米」，它只靠第一人称 RGB-D 相机绕开沙发和墙，在 0.36 米内停下即为成功。","related":["导航","物体目标导航","路径长度加权成功率","Habitat","图像目标导航","视觉里程计"]},{"id":"object-goal-navigation","category":"concept","sec":5,"tier":2,"sources":[{"title":"ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects","url":"https://arxiv.org/abs/2006.13171"},{"title":"Habitat Challenge 2020","url":"https://aihabitat.org/challenge/2020/"},{"title":"On Evaluation of Embodied Navigation Agents","url":"https://arxiv.org/abs/1807.06757"}],"as_of":"2020-06","related_ids":["navigation","point-goal-navigation","image-goal-navigation","vision-and-language-navigation","success-weighted-by-path-length","habitat"],"name":"物体目标导航","alt":"Object-Goal Navigation","abbr":"ObjectNav","aliases":["目标物体导航","物体导航","ObjectGoal Navigation"],"one_liner":"只告诉机器人物体类别（如「椅子」），让它在陌生房子里自己找过去。","explanation":"物体目标导航是具身导航的标准任务之一。2018 年导航评测工作组论文把导航目标分为点目标、物体目标、区域目标，2020 年的 ObjectNav Revisited 又统一了评测细则。设定是：智能体被放在没见过的室内环境随机位置，只拿到一个物体类别名，靠第一人称 RGB-D 相机边走边找。Habitat 2020 挑战赛规定，智能体主动发出「停止」时离任一该类物体不超过 1 米、且从停止处能看到它才算成功，常用指标是成功率和路径长度加权成功率 SPL。它比点目标导航难，因为要认出物体、推测它通常在哪，还要高效探索。","example":"在 Habitat 仿真器里给智能体指令「找到马桶」，它从客厅出发，推断马桶多半在卫生间，探索到后在 1 米以内停下。","related":["导航","点目标导航","图像目标导航","视觉语言导航","路径长度加权成功率","Habitat"]},{"id":"image-goal-navigation","category":"concept","sec":5,"tier":3,"sources":[{"title":"Target-driven Visual Navigation in Indoor Scenes using Deep Reinforcement Learning (Zhu et al.)","url":"https://arxiv.org/abs/1609.05143"},{"title":"Instance-Specific Image Goal Navigation: Training Embodied Agents to Find Object Instances","url":"https://arxiv.org/abs/2211.15876"}],"as_of":"","related_ids":["navigation","object-goal-navigation","point-goal-navigation","vision-and-language-navigation","habitat","ai2-thor"],"name":"图像目标导航","alt":"Image-Goal Navigation","abbr":"ImageNav","aliases":["图像导航","ImageGoal Navigation"],"one_liner":"给机器人一张目标位置的照片，让它在陌生环境里自己找过去","explanation":"图像目标导航是具身导航的一类基准任务：智能体被放进没见过的室内环境，目标是一张在目标位置拍的照片，它只靠自身相机观测走到那里。早期代表工作是 Zhu 等人 2016 年的目标驱动视觉导航，同时发布了 AI2-THOR 仿真器；后来 Habitat 等平台把它做成标准任务。原始设定有两个问题：随机拍的目标图可能只是一面墙，难以分辨；目标图还得和机器人相机参数一致。Krantz 等人 2022 年提出实例图像目标导航（InstanceImageNav），目标图对准某个具体物体、可用任意相机拍摄，更贴近实际使用。","example":"用户用手机拍下书房里的那把椅子发给家用机器人，机器人在全屋探索，找到这把椅子并停在旁边。","related":["导航","物体目标导航","点目标导航","视觉语言导航","Habitat","AI2-THOR"]},{"id":"audio-visual-navigation","category":"concept","sec":5,"tier":3,"sources":[{"title":"SoundSpaces: Audio-Visual Navigation in 3D Environments (arXiv 1912.11474)","url":"https://arxiv.org/abs/1912.11474"},{"title":"Semantic Audio-Visual Navigation (arXiv 2012.11583)","url":"https://arxiv.org/abs/2012.11583"}],"as_of":"","related_ids":["navigation","object-goal-navigation","point-goal-navigation","multimodal-perception","microphone-array","habitat"],"name":"视听导航","alt":"Audio-Visual Navigation","abbr":"","aliases":["音视频导航","音频视觉导航"],"one_liner":"智能体同时用「眼睛」和「耳朵」，在三维环境中找到发声的目标。","explanation":"在视觉导航的基础上加入听觉：智能体同时接收第一人称画面和音频，要走到一个正在发声的物体旁边。声音能绕过墙体、在房间里反射，既提示方向也透露空间结构，目标不在视野内时尤其有用。ECCV 2020 的 SoundSpaces 是这一方向的早期代表：它基于几何声学，为 Matterport3D 和 Replica 两套真实扫描场景渲染声音，并接入 Habitat 仿真器，用多模态深度强化学习训练智能体。后续的「语义视听导航」让物体发出符合自身语义的短暂声音，如马桶冲水、门吱呀响，声音停了仍要凭记忆找过去。","example":"在 SoundSpaces 中，智能体被放进一套陌生公寓，只听到某处有声音在响，需要结合画面和声音一路走到声源旁并停下。","related":["导航","物体目标导航","点目标导航","多模态感知","麦克风阵列","Habitat"]},{"id":"aerial-vision-and-language-navigation","category":"concept","sec":5,"tier":3,"sources":[{"title":"AerialVLN: Vision-and-Language Navigation for UAVs (arXiv 2308.06735, ICCV 2023)","url":"https://arxiv.org/abs/2308.06735"}],"as_of":"","related_ids":["vision-and-language-navigation","unmanned-aerial-vehicle","room-to-room","navigation","long-horizon-task","aerial-manipulation"],"name":"空中视觉语言导航（无人机 VLN）","alt":"Aerial Vision-and-Language Navigation (UAV VLN)","abbr":"Aerial VLN","aliases":["无人机视觉语言导航","UAV VLN"],"one_liner":"让无人机听懂自然语言指令，在城市等三维户外空间里飞到目标位置。","explanation":"视觉语言导航（VLN）原本研究地面机器人在室内按语言指令行走，空中 VLN 把它搬到无人机上：智能体看第一人称画面，按一段描述地标和路线的指令在户外飞行。与地面相比，它多了高度这一维，路径动辄数百米，指令要提到更多地标，定位和长程记忆都更难。代表基准是 ICCV 2023 的 AerialVLN：基于虚幻引擎 4 和微软 AirSim 搭了 25 个城市级场景，收集 8446 条飞行路径、25338 条指令，平均路径长 661.8 米，动作包括前进、左右转、上升、下降、左右平移和停止。","example":"在 AerialVLN 测试集上，按平均 83 个英文单词的指令飞行，CMA 基线的成功率只有 1.6%，人类为 80.8%，差距很大。","related":["视觉语言导航","无人机（空中机器人）","R2R / VLN-CE 视觉语言导航基准","导航","长程任务","空中操作"]},{"id":"social-navigation","category":"concept","sec":5,"tier":3,"sources":[{"title":"Core Challenges of Social Robot Navigation: A Survey (ACM THRI, 2023)","url":"https://dl.acm.org/doi/10.1145/3583741"},{"title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","url":"https://huggingface.co/papers/2310.13724"}],"as_of":"","related_ids":["navigation","human-robot-interaction","velocity-obstacles","habitat","embodied-safety"],"name":"社交导航","alt":"Social Navigation","abbr":"","aliases":["人群导航","社会化导航","社交机器人导航"],"one_liner":"机器人在人群中移动，既要到达目标，也要守人的社交习惯。","explanation":"社交导航研究机器人在有人的环境里（商场、车站、办公室、家里）怎么移动：不仅要避免碰撞、到达目的地，还要让周围的人觉得自然舒适，比如保持合适的个人空间、不从两个说话的人中间穿过、主动礼让。Mavrogiannis 等人 2023 年在 ACM THRI 的综述把核心挑战归为运动规划、行为设计和评测三类，并指出领域缺少统一评测标准。常见方法有速度障碍法（如 ORCA）、社会力模型，以及在仿真中用强化学习或模仿学习训练的策略。Meta 的 Habitat 3.0 把「找到并跟随一个人」也定义成社交导航任务。","example":"Habitat 3.0 的社交导航任务：机器人在没见过的家庭场景里找到一个人形化身并跟随，全程保持 1 到 2 米的安全距离，一旦碰撞就判失败。","related":["导航","人机交互","速度障碍法 / ORCA","Habitat","具身安全"]},{"id":"embodied-visual-tracking","category":"concept","sec":5,"tier":3,"sources":[{"title":"End-to-end Active Object Tracking via Reinforcement Learning (Luo et al., ICML 2018)","url":"https://arxiv.org/abs/1705.10561"},{"title":"TrackVLA: Embodied Visual Tracking in the Wild","url":"https://arxiv.org/abs/2505.23189"},{"title":"TrackVLA project page","url":"https://pku-epic.github.io/TrackVLA-web/"}],"as_of":"2025-05","related_ids":["object-tracking","trackvla","vision-and-language-navigation","active-perception","social-navigation","vision-language-action-model"],"name":"具身视觉跟踪（目标跟随）","alt":"Embodied Visual Tracking","abbr":"EVT","aliases":["目标跟随","主动目标跟踪","Active Object Tracking"],"one_liner":"机器人靠自身相机持续跟着指定目标移动，让目标始终留在视野里。","explanation":"具身视觉跟踪指智能体仅凭第一人称视觉，在动态环境中持续跟随指定目标（通常是行人或另一台机器人），并控制自身移动，让目标保持在视野内、距离合适。它和传统视觉跟踪的区别是：传统方法只在录好的视频里框出目标，而这里跟踪器要自己输出运动指令，看到什么取决于自己怎么走。Wenhan Luo 等人 2018 年（ICML）的主动目标跟踪用强化学习把画面直接映射成前进、转弯等动作，是早期代表。难点在于遮挡、外观相似的干扰者、目标突然转向，以及目标识别和路径规划要同时完成。2025 年北京大学、银河通用等团队的 TrackVLA（CoRL 2025）用一个视觉-语言-动作模型同时做识别和轨迹规划，并构建了 EVT-Bench，采集约 170 万条样本。应用包括陪伴跟随、跟拍和物流跟车。","example":"机器狗听到「跟着穿红衣服的人」后在人群中锁定对方；对方拐进走廊被短暂挡住，它仍能找回并继续跟随。","related":["目标跟踪","银河通用 TrackVLA","视觉语言导航","主动感知","社交导航","视觉-语言-动作模型"]},{"id":"active-exploration","category":"concept","sec":5,"tier":3,"sources":[{"title":"Learning to Explore using Active Neural SLAM (arXiv 2004.05155)","url":"https://arxiv.org/abs/2004.05155"}],"as_of":"","related_ids":["frontier-based-exploration","active-perception","interactive-perception","exploration-vs-exploitation","simultaneous-localization-and-mapping","navigation"],"name":"主动探索","alt":"Active Exploration","abbr":"","aliases":["自主探索"],"one_liner":"智能体自己决定去哪看、碰什么，主动获取未知环境或物体的信息。","explanation":"与被动接收数据相对，主动探索指智能体自己选择移动和交互方式，以尽量少的代价获取信息。在导航里，它通常指把机器人放进陌生房屋，要求在限定步数内尽量多地覆盖并建图，是后续找物体、具身问答等任务的前置能力。经典做法是前沿探索，即朝已知与未知区域的交界处走；学习方法如 2020 年的 Active Neural SLAM，用神经网络建图，由全局策略选长期目标、局部策略负责走过去。在操作里，它也指推一推、晃一晃物体来判断质量、铰接结构等看不出来的属性。强化学习里的「探索」是相关但更宽的概念。","example":"在 Habitat 仿真器中，Active Neural SLAM 智能体在陌生公寓里自主走动并画出俯视地图；该方法的变体还获得了 CVPR 2019 Habitat 点目标导航挑战赛冠军。","related":["前沿探索","主动感知","交互式感知","探索与利用","同步定位与建图","导航"]},{"id":"embodied-question-answering","category":"concept","sec":5,"tier":3,"sources":[{"title":"Embodied Question Answering (Das et al., CVPR 2018)","url":"https://arxiv.org/abs/1711.11543"},{"title":"EmbodiedQA project page","url":"https://embodiedqa.org/"},{"title":"OpenEQA: Embodied Question Answering in the Era of Foundation Models","url":"https://open-eqa.github.io/"}],"as_of":"2024-06","related_ids":["embodied-interaction","visual-question-answering","openeqa","active-exploration","vision-and-language-navigation","embodied-memory"],"name":"具身问答","alt":"Embodied Question Answering","abbr":"EQA","aliases":["Embodied QA"],"one_liner":"智能体在三维环境里自己走动收集信息，再回答问题的任务。","explanation":"具身问答由 Abhishek Das、Dhruv Batra 等人在 2017 年底提出（CVPR 2018 口头报告）：智能体被放在 3D 房屋环境的随机位置，收到一个问题，比如「车是什么颜色」，它必须以第一人称视角自己导航、找到相关物体，再给出答案。首个数据集 EQA v1 建在 House3D 仿真器上，问题分位置、颜色、房间颜色、介词关系几类。这个任务把主动感知、语言理解、目标导航、常识推理和语言接地放在一起，因此常被当作检验具身智能的综合基准。之后出现了多目标、真实扫描场景等变体；Meta FAIR 在 CVPR 2024 发布的 OpenEQA 把它扩展到开放词汇，分为「凭记忆回答」和「主动探索后回答」两种设置。大模型时代常用视觉语言模型加前沿探索来做。","example":"问智能体「厨房里有几把椅子」，它需要从客厅出发找到厨房、数清椅子，再给出答案。","related":["具身交互","视觉问答","OpenEQA 开放词汇具身问答基准","主动探索","视觉语言导航","具身记忆"]},{"id":"structured-vs-unstructured-environment","category":"concept","sec":6,"tier":2,"sources":[{"title":"Autonomous robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Autonomous_robot"},{"title":"Industrial robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Industrial_robot"}],"as_of":"","related_ids":["industrial-robot","teach-and-playback-programming","scene-generalization","open-world","general-purpose-robot","service-robot"],"name":"结构化 / 非结构化环境","alt":"Structured vs. Unstructured Environment","abbr":"","aliases":["结构化环境","非结构化环境","结构化场景","非结构化场景"],"one_liner":"结构化环境里物品和流程固定可预知；非结构化环境杂乱多变、无法事先规定。","explanation":"描述机器人工作环境可预测程度的一对说法。结构化环境指工厂产线这类场所：工件的位置、姿态和节拍都事先设计好，机器人照固定程序重复动作即可，传统工业机器人主要在这里工作。非结构化环境指家庭、商超、户外等：物品随意摆放、会被人挪动，光照和地面变化大，还有人在走动，无法事先写死每个动作。具身智能想解决的核心问题之一，就是让机器人从结构化环境走进非结构化环境，这需要感知、泛化和实时决策，而不能只靠示教编程。两者之间还有「半结构化」场景，例如仓库货架区。","example":"汽车焊装线上每台车身都停在同一位置，属于结构化环境；家里厨房台面上的碗筷每天摆法不同、旁边还有人走动，属于非结构化环境。","related":["工业机器人","示教再现","场景泛化","开放世界","通用机器人","服务机器人"]},{"id":"teach-and-playback-programming","category":"concept","sec":6,"tier":2,"sources":[{"title":"Teach pendant - Wikipedia","url":"https://en.wikipedia.org/wiki/Teach_pendant"},{"title":"Unimate - Wikipedia","url":"https://en.wikipedia.org/wiki/Unimate"},{"title":"Industrial robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Industrial_robot"}],"as_of":"","related_ids":["teach-pendant","kinesthetic-teaching","industrial-robot","imitation-learning","structured-vs-unstructured-environment","offline-programming"],"name":"示教再现","alt":"Teach-and-Playback Programming","abbr":"","aliases":["示教-再现","示教编程","Teach and Playback"],"one_liner":"人先带机器人走一遍并记录位置，机器人再按记录原样重复执行。","explanation":"传统工业机器人最主要的编程方式：操作员用示教器（带急停和使能开关的手持编程盒）点动机器人，或直接手拉机械臂，把一串关键位置和路径记录下来，之后机器人按记录反复「回放」。1961 年在通用汽车工厂上岗的第一台工业机器人 Unimate，就是把示教时的关节位置存进磁鼓存储器再重放。它简单可靠、重复精度高，适合焊接、喷涂、搬运等位置固定的重复作业；但机器人只是复现轨迹、不理解任务，工件位置一变就要重新示教。具身智能里的模仿学习也从人类示范出发，区别是要学出能根据观测调整动作的策略，而不是机械回放。","example":"汽车焊装车间里，工程师用示教器把焊枪逐个移到车身上的焊点并保存，此后每台车身到位，机器人都按这段程序依次焊接。","related":["示教器","拖动示教","工业机器人","模仿学习","结构化 / 非结构化环境","离线编程"]},{"id":"machine-tending","category":"concept","sec":6,"tier":2,"sources":[{"title":"Machine Tending - Universal Robots","url":"https://www.universal-robots.com/applications/machine-tending/"},{"title":"Figure 02 at BMW (Figure AI, 2025-11-19)","url":"https://www.figure.ai/news/production-at-bmw"}],"as_of":"2025-11","related_ids":["industrial-robot","collaborative-robot","pick-and-place","factory-pilot-deployment","cycle-time-units-per-hour","teach-and-playback-programming"],"name":"上下料","alt":"Machine Tending (Loading & Unloading)","abbr":"","aliases":["机床上下料","机床看护","Machine Tending"],"one_liner":"把工件装进机床或设备、加工完再取出来的工厂工序。","explanation":"上下料是制造业最常见的自动化场景之一：把毛坯或零件装到数控机床（CNC）、注塑机、冲压机、焊装夹具等设备上（上料），加工完成后取下成品放到料架或传送带（下料），英文叫 machine tending。优傲机器人（Universal Robots）把它描述为自动完成物料装卸并持续监控生产过程，好处是设备可以连续运转、减少停机。这类工作重复、枯燥，常伴随噪音和切屑，传统上由工业机器人或协作机器人配专用夹具完成，换产品就要重新示教、改工装。具身智能公司把它当作人形机器人进厂的早期落地场景，看中的是不改产线、直接顶替人工工位，但节拍（每件用时）、定位精度和长时间稳定运行是主要考验。","example":"Figure 官方称，Figure 02 在宝马斯帕坦堡工厂把钣金件放到焊装夹具上，累计上料 9 万多件，参与了 3 万多辆 X3 的生产。","related":["工业机器人","协作机器人","抓取放置","进厂实训","节拍 / UPH","示教再现"]},{"id":"quality-inspection","category":"concept","sec":6,"tier":3,"sources":[{"title":"人形机器人「打工搭子」来了：优必选Walker S进车厂「实习」 会贴车标还能做质检（财联社）","url":"https://www.cls.cn/detail/1602283"},{"title":"全球首次！人形机器人批量进入汽车工厂（北京亦庄）","url":"https://www.ncsti.gov.cn/kjdt/scyq/bjjjjskfq/jkdt/202504/t20250403_200518.html"},{"title":"Automated optical inspection - Wikipedia","url":"https://en.wikipedia.org/wiki/Automated_optical_inspection"}],"as_of":"2025-04","related_ids":["machine-vision","object-detection","factory-pilot-deployment","real-world-deployment","humanoid-robot","industrial-robot"],"name":"质检","alt":"Quality Inspection (Visual Inspection Task)","abbr":"","aliases":["质量检测","视觉检测","外观检测"],"one_liner":"让机器人用相机等传感器检查产品有没有缺陷或装错。","explanation":"质检是工业生产中检查产品或部件是否合格的工序。传统做法是在产线上固定相机做机器视觉检测，例如电路板制造常用的自动光学检测（AOI），拍照查找缺件、偏移、焊点异常等。具身智能语境下的「质检」更多指让人形或移动操作机器人走到工位，自己调整视角，必要时动手配合（拉一下安全带、看一眼门锁）再判断结果，因此常被当作人形机器人进厂实训最先尝试的任务之一。它对视觉检测精度、位姿估计以及能否跟上产线节拍都有要求。","example":"据报道，优必选 Walker S 在蔚来工厂实训时承担车门锁质检、安全带检测和车灯盖板质检，检测时实时采集图像并在系统里标注是否合格；2025 年东风柳汽计划部署的 20 台 Walker S1，任务清单里也包括多项检测工序。","related":["机器视觉（工业视觉）","目标检测","进厂实训","场景落地","人形机器人","工业机器人"]},{"id":"tote-handling","category":"concept","sec":6,"tier":2,"sources":[{"title":"Agility Robotics – Solutions (Tote Handling)","url":"https://www.agilityrobotics.com/solutions"},{"title":"GXO signs industry-first multi-year agreement with Agility Robotics","url":"https://gxo.com/news_article/gxo-signs-industry-first-multi-year-agreement-with-agility-robotics/"}],"as_of":"2024-06","related_ids":["palletizing-depalletizing","machine-tending","sorting","humanoid-robot","real-world-deployment","robot-as-a-service"],"name":"料箱搬运","alt":"Tote Handling (Material Handling)","abbr":"","aliases":["周转箱搬运","料箱转运"],"one_liner":"在仓库和产线上取放、搬运标准塑料周转箱（料箱）的任务。","explanation":"料箱（tote）是物流仓库和工厂里装零件、商品的标准塑料周转箱。料箱搬运指把料箱从货架、推车或协作机械臂处取下，搬到输送线、工位或另一处存放点，有时还包括叠箱和拆箱。它属于物料搬运中最常见、最重复的工作：箱子规格统一、动作相对固定、容错空间较大，因此被不少人形机器人公司选作首批落地场景。相比改造输送线或加装专用设备，人形机器人的卖点是能直接插进原本由人负责的工位，但节拍、连续运行时长和可靠性仍是客户考核的重点。","example":"2024 年 6 月，物流公司 GXO 与 Agility Robotics 签订多年期机器人即服务协议，在 SPANX 的仓库里让 Digit 人形机器人把协作机械臂递出的料箱搬到输送线上。","related":["码垛 / 拆垛","上下料","分拣","人形机器人","场景落地","机器人即服务"]},{"id":"palletizing-depalletizing","category":"concept","sec":6,"tier":3,"sources":[{"title":"Palletizer - Wikipedia","url":"https://en.wikipedia.org/wiki/Palletizer"},{"title":"Mech-Mind: Depalletizing and Palletizing solution","url":"https://www.mech-mind.com/solution/depalletizing-and-palletizing.html"},{"title":"Boston Dynamics Stretch","url":"https://bostondynamics.com/products/stretch/"}],"as_of":"","related_ids":["industrial-robot","tote-handling","vacuum-suction-cup","3d-vision-guided-robotics","boston-dynamics-stretch","lights-out-factory"],"name":"码垛 / 拆垛","alt":"Palletizing / Depalletizing","abbr":"","aliases":["堆垛","卸垛","Palletization / Depalletization","混箱码垛"],"one_liner":"把箱子、袋子按规则堆上托盘，或从托盘上一件件拆下来","explanation":"码垛是把纸箱、袋装货、桶等按一定垛型堆到托盘上，方便叉车整托运输；拆垛（卸垛）则反过来，把托盘上的货物逐个取下送上输送线。据维基百科，第一台机械码垛机出现在 1948 年，机器人码垛机在 20 世纪 80 年代初出现。单一品规的码垛已很成熟，难的是混箱：尺寸不同的箱子要现场规划出稳定的垛型，类似三维装箱问题；拆垛时箱子紧挨着、贴有胶带或反光膜，需要 3D 视觉认出每个箱子的位置和边界。梅卡曼德等厂商提供视觉引导的拆码垛方案，波士顿动力的 Stretch 也能把卸下的箱子码到托盘上。","example":"物流中心入库时，3D 相机拍下一托混装纸箱，机器人逐个识别并用真空吸盘卸到输送线上；梅卡曼德称其拆码垛方案最快约每小时 900 件。","related":["工业机器人","料箱搬运","真空吸盘","3D 视觉引导","波士顿动力 Stretch","黑灯工厂"]},{"id":"sorting","category":"concept","sec":6,"tier":2,"sources":[{"title":"Sortation - Wikipedia","url":"https://en.wikipedia.org/wiki/Sortation"},{"title":"Helix Accelerating Real-World Logistics (Figure AI, 2025-02-26)","url":"https://www.figure.ai/news/helix-logistics"},{"title":"Amazon introduces Sparrow (About Amazon)","url":"https://www.aboutamazon.com/news/operations/amazon-introduces-sparrow-a-state-of-the-art-robot-that-handles-millions-of-diverse-products"}],"as_of":"2025-02","related_ids":["bin-picking","order-picking","pick-and-place","tote-handling","real-world-deployment","vacuum-suction-cup"],"name":"分拣","alt":"Sorting (Parcel / Item Sorting)","abbr":"","aliases":["包裹分拣","物品分拣","Sortation"],"one_liner":"识别传送带或料箱里的物品，并按目的地或类别送到不同位置。","explanation":"物流和制造里的基础作业：识别物品（读条码、看类别或外观），再把它分流到对应的格口、料箱或传送带。传统分拣靠交叉带、摆轮等固定设备加条码扫描，擅长规则纸箱；形状不规则的软包、混杂堆放的散件仍大量依赖人工。机器人分拣要先从杂乱物品中单件抓出，再判断去向并放置，涉及视觉识别、抓取规划和吸盘或夹爪的选择。它是具身智能公司最常展示的落地场景之一，例如亚马逊的 Sparrow 能在仓库里识别并抓取单件商品；Figure 在 2025 年 2 月演示人形机器人把包裹从一条传送带搬到另一条，并把面单转向扫码方向。","example":"Figure 的人形机器人用 Helix 模型在物流线上逐件抓取纸箱和软包，调整面单朝向后放上另一条传送带供扫码。","related":["无序抓取","拣选（订单拣货）","抓取放置","料箱搬运","场景落地","真空吸盘"]},{"id":"order-picking","category":"concept","sec":6,"tier":3,"sources":[{"title":"Order picking - Wikipedia","url":"https://en.wikipedia.org/wiki/Order_picking"},{"title":"Analysis and Observations from the First Amazon Picking Challenge","url":"https://arxiv.org/abs/1601.05484"},{"title":"Amazon Vulcan: robot with a sense of touch for picking and stowing","url":"https://www.aboutamazon.com/news/operations/amazon-vulcan-robot-pick-stow-touch"}],"as_of":"2025","related_ids":["bin-picking","pick-and-place","sorting","tote-handling","amazon-vulcan","amazon-picking-challenge"],"name":"拣选（订单拣货）","alt":"Order Picking / Piece Picking","abbr":"","aliases":["拣货","订单拣选","单件拣选","Piece Picking"],"one_liner":"按订单从货架或料箱里把指定商品一件件取出来的仓储作业","explanation":"拣选是仓储物流的核心环节：按客户订单从库存中取出指定数量的商品，汇总后发货，分为整托、整箱和单件拣选。单件拣选（piece picking）要面对成千上万种 SKU，商品形状、材质、包装千差万别，还常有软袋和透明件，是最难自动化的一种。机器人方案通常用 3D 视觉识别商品、规划抓取点，再用吸盘或夹爪取出放进订单箱。亚马逊办过拣选挑战赛推动研究（首届有 26 支队伍参加），并先后推出 Sparrow 和带触觉的 Vulcan 拣货机器人，据称 Vulcan 能处理其仓库约 75% 的商品种类。","example":"电商仓库里，货架被搬运机器人送到工作站，机械臂用视觉认出料箱里的一支牙膏和一包纸巾，分别吸取后放进同一个订单的包装箱。","related":["无序抓取","抓取放置","分拣","料箱搬运","Amazon Vulcan 触觉拣货机器人","亚马逊拣选挑战赛"]},{"id":"bin-picking","category":"concept","sec":6,"tier":3,"sources":[{"title":"Bin picking – Wikipedia","url":"https://en.wikipedia.org/wiki/Bin_picking"}],"as_of":"","related_ids":["grasping","grasp-pose-detection","6d-object-pose-estimation","3d-vision-guided-robotics","machine-tending","amazon-picking-challenge"],"name":"无序抓取","alt":"Bin Picking","abbr":"","aliases":["料箱拣选","箱内拣选","随机拣选"],"one_liner":"机器人从杂乱堆放的料箱里识别并逐个取出零件或商品。","explanation":"工业和物流里的经典任务：零件或商品随意堆在箱子里，姿态各异、互相遮挡甚至缠绕，机器人要先用相机（通常是 3D 视觉）识别目标，估计它的位姿或可抓取点，再规划不碰箱壁的路径，用吸盘或夹爪逐个取出。制造业里常称「3D 视觉引导无序抓取」，用于机床上下料、零件上线；物流里则是从周转箱里拣出单件商品。亚马逊在 2015–2017 年举办的拣选挑战赛让它成为机器人研究的热点。如今的难点集中在透明、反光、柔软的物体，以及从没见过的新物品。","example":"汽车零部件厂里，结构光相机拍下一箱乱堆的金属件，算法算出每个零件的 6D 位姿，机械臂依次抓出并摆到机床上料位。","related":["抓取","抓取位姿检测","6D位姿估计","3D 视觉引导","上下料","亚马逊拣选挑战赛"]},{"id":"household-tasks","category":"concept","sec":6,"tier":2,"sources":[{"title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation (arXiv 2403.09227)","url":"https://arxiv.org/abs/2403.09227"},{"title":"π0.5: a Vision-Language-Action Model with Open-World Generalization (arXiv 2504.16054)","url":"https://arxiv.org/abs/2504.16054"}],"as_of":"2025-04","related_ids":["long-horizon-task","mobile-manipulation","structured-vs-unstructured-environment","behavior-1k","pi0-5","garment-manipulation"],"name":"家务任务","alt":"Household Tasks","abbr":"","aliases":["家庭任务","家务劳动"],"one_liner":"在真实家庭里收拾、清洁、洗衣、做饭等日常活，是通用机器人的主要目标场景。","explanation":"家务任务泛指在住宅里完成的日常活动，如收拾桌面、把碗放进洗碗机、擦台面、叠衣服、铺床。家庭是典型的非结构化环境：每户布局、物品、光照都不同，东西随处乱放，任务往往由很多步组成，还常涉及衣物这类柔性物体和抽屉、柜门这类铰接物体。因此能否在没见过的家里做家务，常被当作检验通用机器人泛化能力的试金石。斯坦福等发布的 BEHAVIOR-1K 基准依据「你希望机器人为你做什么」的调研，定义了 1000 种日常活动，在 OmniGibson 仿真器里评测；2025 年 4 月 Physical Intelligence 发布的 π0.5 展示了在全新住宅里清理厨房或卧室。","example":"在一户从没进去过的房子里，机器人把散落的衣服放进洗衣篮、把餐具收进水槽，再把台面擦干净。","related":["长程任务","移动操作","结构化 / 非结构化环境","BEHAVIOR-1K","π0.5","衣物操作"]},{"id":"rearrangement","category":"concept","sec":6,"tier":3,"sources":[{"title":"Rearrangement: A Challenge for Embodied AI (arXiv 2011.01975)","url":"https://arxiv.org/abs/2011.01975"},{"title":"Visual Room Rearrangement (CVPR 2021)","url":"https://arxiv.org/abs/2103.16544"}],"as_of":"","related_ids":["household-tasks","mobile-manipulation","long-horizon-task","pick-and-place","embodied-agent","habitat"],"name":"物体重排","alt":"Rearrangement","abbr":"","aliases":["重排任务","物体整理","场景重排"],"one_liner":"把环境里的物体挪动、摆放成指定目标状态的具身任务。","explanation":"物体重排是 2020 年 Batra、Levine、Malik 等十余位学者在《Rearrangement: A Challenge for Embodied AI》中提出的统一任务框架：给定一个物理环境，智能体要通过移动物体、开关柜门抽屉等操作，把环境带到指定的目标状态。目标可以用物体位姿、目标图像、自然语言给出，也可以让智能体先亲眼看一遍目标状态。它把导航、感知、抓取放置和长程规划放进同一个可度量的任务里，收拾房间、摆餐具、整理货架都能写成重排问题。AI2-THOR、Habitat 等平台都推出过对应基准。","example":"AI2-THOR 的 Visual Room Rearrangement（CVPR 2021）：智能体先在房间里走一圈记住物体摆放，之后部分物体被挪动或开合状态被改变，它要把一切恢复原样；配套数据集 RoomR 含 120 个场景、72 类物体、6000 种设置。","related":["家务任务","移动操作","长程任务","抓取放置","具身智能体","Habitat"]},{"id":"human-robot-interaction","category":"concept","sec":7,"tier":2,"sources":[{"title":"Human–robot interaction - Wikipedia","url":"https://en.wikipedia.org/wiki/Human–robot_interaction"}],"as_of":"","related_ids":["human-robot-collaboration","physical-human-robot-interaction","human-robot-handover","instruction-following","embodied-safety","teleoperation"],"name":"人机交互","alt":"Human-Robot Interaction","abbr":"HRI","aliases":["人-机器人交互","人机互动"],"one_liner":"研究人和机器人怎么沟通、协作、安全共处的领域。","explanation":"人机交互（HRI）研究人与机器人之间的交互，横跨机器人学、人工智能、自然语言处理、设计和心理学。ACM/IEEE 人机交互国际会议从 2006 年开始举办，是这个方向的主要学术会议。它关心的问题包括：机器人怎么听懂人的语音、手势和意图，怎么把自己的状态和打算告诉人，以及和人近距离共处时怎么保证安全。按有没有身体接触，常分成物理人机交互（pHRI，比如人扶着机械臂一起搬东西）和社交交互（对话、表情、陪伴）。机器人进入家庭、商场、工厂后，大部分时间要和不懂技术的普通人打交道，HRI 做得好不好直接决定机器人能不能被真正用起来。它和人机协作、指令跟随、遥操作、具身安全等词条紧密相关。","example":"用户对家用机器人说「把那杯水递给我」并用手指了一下方向，机器人理解后把杯子稳稳递到人手里；其中的语音理解、手势识别和安全递交都属于 HRI 的研究内容。","related":["人机协作","物理人机交互","人机物体交接","指令跟随","具身安全","遥操作"]},{"id":"uncanny-valley","category":"concept","sec":7,"tier":2,"sources":[{"title":"The Uncanny Valley: The Original Essay by Masahiro Mori (IEEE Spectrum)","url":"https://spectrum.ieee.org/the-uncanny-valley"},{"title":"Uncanny valley – Wikipedia","url":"https://en.wikipedia.org/wiki/Uncanny_valley"}],"as_of":"","related_ids":["humanoid-robot","hyper-realistic-humanoid-robot","human-robot-interaction","engineered-arts-ameca","sophia"],"name":"恐怖谷","alt":"Uncanny Valley","abbr":"","aliases":["恐怖谷效应","恐怖谷理论"],"one_liner":"机器人越像人越讨喜，但「很像又不完全像」时反而让人不适。","explanation":"日本机器人学家森政弘 1970 年在日本杂志《Energy》上提出的假说，日文原名「不気味の谷現象」。他用一条「亲和感—像人程度」曲线描述：机器人越像人，人对它的好感越高；但当外形已很接近真人却有细微破绽时，好感会骤降为反感，形成一个「谷」，只有做到与真人难以区分，好感才回升。他还指出，动起来会放大这种效应。对人形机器人设计的启示是：要么明显「非人」（机械感或卡通化），要么各方面同样逼真，避免逼真皮肤配僵硬表情这类混搭。IEEE Spectrum 于 2012 年刊出经授权的英文全译本。","example":"森政弘原文的例子：做工精致的假手看上去很逼真，可一握上去冰冷、无力，人会突然感到不适。","related":["人形机器人","超仿生人形机器人","人机交互","Ameca 表情人形","Sophia（索菲亚）机器人"]},{"id":"human-robot-collaboration","category":"concept","sec":7,"tier":2,"sources":[{"title":"Cobot - Wikipedia","url":"https://en.wikipedia.org/wiki/Cobot"}],"as_of":"","related_ids":["collaborative-robot","human-robot-interaction","physical-human-robot-interaction","iso-ts-15066-robots-and-robotic-devices-collaborative-robots","power-and-force-limiting","human-robot-handover"],"name":"人机协作","alt":"Human-Robot Collaboration","abbr":"HRC","aliases":["人机协同"],"one_liner":"人和机器人在同一空间里分工配合，共同完成一项任务。","explanation":"人机协作指人和机器人共享工作空间、一起完成同一任务，而不是把机器人关在围栏里单独干活，是人机交互的一个分支。工业上最常见：1996 年美国西北大学的 Colgate 和 Peshkin 发明了协作机器人（cobot），后来发展成可以在人身边工作的轻量机械臂品类。国际机器人联合会把协作程度分为共存、顺序协作、同时协作、响应式协作四级，目前工厂里多数应用停在前两级。安全是核心问题，ISO 10218 和 ISO/TS 15066 对协作应用提出了功率与力限制、速度与分离监控等要求。对具身智能来说，机器人进入工厂和家庭后，还要能读懂人的意图、配合人的动作，比如一起抬桌子、递接工具。","example":"装配线上工人负责对准零件，旁边的协作机械臂托住较重的部件，人靠近时自动减速，人离开后再恢复速度。","related":["协作机器人","人机交互","物理人机交互","ISO/TS 15066 协作机器人安全标准","功率与力限制","人机物体交接"]},{"id":"physical-human-robot-interaction","category":"concept","sec":7,"tier":3,"sources":[{"title":"Physical Human-Robot Interaction (Haddadin & Croft, Springer Handbook of Robotics, 2016)","url":"https://research.monash.edu/en/publications/physical-human-robot-interaction"}],"as_of":"","related_ids":["human-robot-interaction","human-robot-collaboration","impedance-control","power-and-force-limiting","iso-ts-15066-robots-and-robotic-devices-collaborative-robots","kinesthetic-teaching"],"name":"物理人机交互","alt":"Physical Human-Robot Interaction","abbr":"pHRI","aliases":["物理人机互动","人机物理交互"],"one_liner":"人和机器人之间有直接身体接触、相互传递力的交互。","explanation":"物理人机交互研究人与机器人发生身体接触、互相施力的情形，比如人手推着机械臂示教、人和机器人一起抬东西、人穿戴外骨骼，是人机交互中最看重安全的一支。Haddadin 与 Croft 在《Springer 机器人手册》第二版（2016）的综述中把核心问题归为四块：人体安全（碰撞伤害分析与标准）、适合交互的机器人设计（轻量、力矩可控、能感知接触）、顾及人的运动规划，以及交互规划与反射式控制。常用技术有碰撞检测、阻抗/导纳控制、关节力矩传感，以及 ISO/TS 15066 规定的功率与力限制。","example":"拖动示教：操作者直接握住协作机械臂末端拖到目标位置，机器人进入零力或低阻抗模式顺着人手的力运动，同时记录轨迹以便复现。","related":["人机交互","人机协作","阻抗控制","功率与力限制","ISO/TS 15066 协作机器人安全标准","拖动示教"]},{"id":"human-robot-handover","category":"concept","sec":7,"tier":3,"sources":[{"title":"Object Handovers: a Review for Robotics (Ortenzi et al.)","url":"https://arxiv.org/abs/2007.12952"}],"as_of":"","related_ids":["human-robot-collaboration","physical-human-robot-interaction","human-robot-interaction","grasping","task-oriented-grasping","force-control"],"name":"人机物体交接","alt":"Human-Robot Handover","abbr":"","aliases":["物体传递","人机交接","Object Handover","Robot-to-Human / Human-to-Robot Handover"],"one_liner":"机器人和人之间把物体递过去、接过来的交互任务","explanation":"人机物体交接指机器人把物体递给人（机器人是给予方），或从人手里接过物体（机器人是接收方）。Ortenzi 等人 2020 年的综述把它分成两个阶段：交接前，双方要就在哪儿交、什么时候交形成默契；物理交换阶段从接收方碰到物体开始，到给予方完全松手结束。难点是要同时预测人的动作、规划手臂轨迹、选一个让对方好接的抓取位置，并根据受力判断何时松手：松早了会掉，松晚了会拽手。它是家庭服务、护理和工厂人机协作中最常见的物理交互之一。","example":"护理机器人给坐在床边的老人递水杯：把杯子送到对方手前、杯柄朝向对方，感到对方握住并往回拉的力后再松开夹爪。","related":["人机协作","物理人机交互","人机交互","抓取","任务导向抓取（功能性抓取）","力控"]},{"id":"embodied-safety","category":"concept","sec":7,"tier":2,"sources":[{"title":"Generating Robot Constitutions & Benchmarks for Semantic Safety (arXiv 2503.08663)","url":"https://arxiv.org/abs/2503.08663"},{"title":"BadRobot: Jailbreaking Embodied LLM Agents in the Physical World (arXiv 2407.20242)","url":"https://arxiv.org/abs/2407.20242"}],"as_of":"2025-03","related_ids":["functional-safety","physical-human-robot-interaction","safe-reinforcement-learning","control-barrier-function","asimov-s-three-laws-of-robotics","iso-ts-15066-robots-and-robotic-devices-collaborative-robots"],"name":"具身安全","alt":"Embodied Safety","abbr":"","aliases":["机器人安全","具身AI安全","Embodied AI Safety"],"one_liner":"确保机器人在真实世界行动时不伤人、不毁物，也不被恶意指令操纵。","explanation":"具身安全关注具身智能体在物理世界执行任务带来的风险，大致分两层。一层是传统的物理安全：碰撞检测、力和速度限制、急停等，对应 ISO/TS 15066 这类协作机器人标准。另一层是大模型进入机器人后出现的新问题，谷歌 DeepMind 称为语义安全：模型可能因幻觉、提示注入或常识错误做出危险动作。ICLR 2025 的 BadRobot 论文展示了通过语音越狱，让基于大模型的机器人执行有害动作；DeepMind 2025 年提出 ASIMOV 基准和自动生成的机器人宪法，用来评估和约束模型行为。","example":"用户对家用机器人说「把这瓶清洁剂倒进杯子端给客人」，具身安全要求上层模型识别出这是危险请求并拒绝；底层控制则保证手臂即使出错，也不会用过大的力撞到人。","related":["功能安全","物理人机交互","安全强化学习","控制障碍函数","机器人三定律 / 机器人宪法","ISO/TS 15066 协作机器人安全标准"]},{"id":"asimov-s-three-laws-of-robotics","category":"concept","sec":7,"tier":3,"sources":[{"title":"Three Laws of Robotics – Wikipedia","url":"https://en.wikipedia.org/wiki/Three_Laws_of_Robotics"},{"title":"Shaping the future of advanced robotics (Google DeepMind, AutoRT)","url":"https://deepmind.google/discover/blog/shaping-the-future-of-advanced-robotics/"},{"title":"Generating Robot Constitutions & Benchmarks for Semantic Safety (arXiv 2503.08663)","url":"https://arxiv.org/abs/2503.08663"}],"as_of":"2025-03","related_ids":["embodied-safety","safety-filter","functional-safety","emergency-stop","autort","gemini-robotics"],"name":"机器人三定律 / 机器人宪法","alt":"Asimov's Three Laws of Robotics / Robot Constitution","abbr":"","aliases":["阿西莫夫三定律","机器人学三定律","Robot Constitution"],"one_liner":"阿西莫夫为机器人设定的三条行为准则，以及大模型时代的规则版。","explanation":"科幻作家阿西莫夫在 1942 年短篇《环舞》（Runaround）中完整提出：一、机器人不得伤害人类，或因不作为让人类受到伤害；二、机器人必须服从人类命令，除非与第一条冲突；三、在不违背前两条的前提下，机器人要保护自己。后来又加了优先级更高的「第零定律」：不得伤害人类整体。三定律只是小说设定。大模型接入机器人后，谷歌 DeepMind 借用这一思路提出「机器人宪法」：用自然语言写一组安全规则放进提示词，让模型在挑选任务、决定动作时自我约束。它是力限制、急停等物理安全措施之外的补充，不能替代后者。","example":"谷歌 DeepMind 的 AutoRT（2024）在提示词中写入受三定律启发的机器人宪法，规定机器人不接涉及人、动物、尖锐物体或电器的任务；2025 年的 ASIMOV 基准用自动生成并迭代修订的宪法评测语义安全，最高对齐率 84.3%。","related":["具身安全","安全滤波器","功能安全","急停","AutoRT","Gemini Robotics"]},{"id":"tri-co-robot","category":"concept","sec":7,"tier":3,"sources":[{"title":"Tri-Co Robot: a Chinese robotic research initiative for enhanced robot interaction capabilities (Ding et al., National Science Review)","url":"https://academic.oup.com/nsr/article/5/6/799/4588213"}],"as_of":"2017-12","related_ids":["human-robot-collaboration","collaborative-robot","human-robot-interaction","physical-human-robot-interaction","swarm-intelligence","multi-robot-collaboration"],"name":"共融机器人","alt":"Tri-Co Robot (Coexisting-Cooperative-Cognitive Robot)","abbr":"Tri-Co","aliases":["Tri-Co Robot"],"one_liner":"能与人、环境和其他机器人安全共存、协作，并理解彼此意图的机器人。","explanation":"国家自然科学基金委提出的机器人研究方向，Tri-Co 取自共存（Coexisting）、协作（Cooperative）、认知（Cognitive）。据丁汉等人 2017 年在 National Science Review 发表的介绍，基金委当年启动了为期 8 年的共融机器人重大研究计划。「共存」指机器人以本质安全的方式进入人的生活和工作空间，「协作」指通过交流互动与人或其他机器人配合，「认知」指能感知并预测环境和他人的行为与意图。研究主题包括刚-柔-软混合结构、多模态感知与基于生物信号的人机交互、多机器人群体智能，应用面向灵巧制造、康复辅助、巡检救援等。它关注的问题与今天的人机协作、具身智能大量重叠。","example":"康复助力设备要读懂穿戴者的肌电等生物信号、顺着人的发力方向给助力，同时保证不伤人，正好对应「共存、协作、认知」三方面要求。","related":["人机协作","协作机器人","人机交互","物理人机交互","群体智能","多机器人协作"]},{"id":"multi-robot-collaboration","category":"concept","sec":7,"tier":3,"sources":[{"title":"Large Language Models for Multi-Robot Systems: A Survey","url":"https://arxiv.org/abs/2502.03814"},{"title":"RoCo: Dialectic Multi-Robot Collaboration with Large Language Models","url":"https://arxiv.org/abs/2307.04738"},{"title":"Amazon: 1 million robots and the DeepFleet foundation model","url":"https://www.aboutamazon.com/news/operations/amazon-million-robots-ai-foundation-model"}],"as_of":"2025","related_ids":["swarm-intelligence","multi-agent-path-finding","multi-agent-reinforcement-learning","fleet-management-system","human-robot-collaboration","task-planning"],"name":"多机器人协作","alt":"Multi-robot Collaboration","abbr":"","aliases":["多机协同","多机器人系统","Multi-Robot Systems (MRS)","Multi-robot Coordination"],"one_liner":"多台机器人分工配合，完成一台做不了或做得慢的任务","explanation":"多机器人协作研究如何让多台机器人（同型或异构）分配任务、协调路径、避免相互碰撞，共同完成任务。核心问题包括任务分配、多智能体路径规划、通信与信息共享；控制方式分集中式（一个调度系统统一指挥）和分布式（每台机器人按局部信息决策，群体机器人是其极端形式）。最成熟的落地在仓储物流：亚马逊称已部署约 100 万台机器人，并用名为 DeepFleet 的基础模型统一调度车队，预计让机器人行驶时间缩短 10%。大模型出现后，也有工作让多台机械臂用语言对话商量分工，例如 2023 年的 RoCo。","example":"RoCo 里两台机械臂协作完成桌面任务：各自的大模型代理用自然语言讨论谁负责哪一步，再生成路径点交给运动规划器执行，发生碰撞时根据环境反馈重新商量。","related":["群体智能","多智能体路径规划","多智能体强化学习","多机调度系统","人机协作","任务规划"]},{"id":"swarm-intelligence","category":"concept","sec":7,"tier":3,"sources":[{"title":"Swarm intelligence - Wikipedia","url":"https://en.wikipedia.org/wiki/Swarm_intelligence"},{"title":"A self-organizing thousand-robot swarm (Harvard SEAS, 2014)","url":"https://seas.harvard.edu/news/self-organizing-thousand-robot-swarm"}],"as_of":"","related_ids":["multi-robot-collaboration","multi-agent-reinforcement-learning","emergent-abilities","multi-agent-path-finding","unmanned-aerial-vehicle"],"name":"群体智能","alt":"Swarm Intelligence","abbr":"SI","aliases":["集群智能","群智能","Collective Intelligence","群体机器人（Swarm Robotics）"],"one_liner":"大量简单个体只按局部规则互动，整体却涌现出智能行为。","explanation":"群体智能指由许多简单个体组成、没有中央控制的系统所表现出的集体行为：每个个体只感知邻居、遵循简单规则，整体却能自组织出觅食、筑巢、编队等复杂结果，蚁群、蜂群、鸟群、鱼群都是自然界的例子。这个术语由 Beni 和 Wang 在 1989 年研究细胞机器人系统时提出。它催生了蚁群优化、粒子群优化等算法，也发展出群体机器人学：用大量低成本机器人协作完成搜索、覆盖、搬运、编队等任务，优点是容易扩展，个别机器人损坏也不影响整体。它和多机器人协作、多智能体强化学习关系密切。","example":"哈佛大学 2014 年在《Science》发表的 Kilobot 实验：1024 台直径只有几厘米的小机器人只靠红外和邻居通信，就自组装成五角星、字母 K 等形状。","related":["多机器人协作","多智能体强化学习","涌现能力","多智能体路径规划","无人机（空中机器人）"]},{"id":"instruction-following","category":"concept","sec":8,"tier":2,"sources":[{"title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","url":"https://arxiv.org/abs/2502.19417"}],"as_of":"2025-02","related_ids":["language-conditioned-policy","vision-language-action-model","hi-robot","language-grounding","semantic-generalization","language-corrections"],"name":"指令跟随","alt":"Instruction Following","abbr":"","aliases":["语言指令跟随","具身指令跟随"],"one_liner":"机器人听懂人用自然语言下的指令，并在真实环境里把事做出来。","explanation":"在具身智能里，指令跟随指机器人根据自然语言指令（有时配合图像、手势）完成对应的动作或任务，而不是只执行预先写死的程序。早期研究多是「把红块推到左边」这类短指令；现在转向开放式指令，例如 Physical Intelligence 的 Hi Robot（2025）要处理「给我做个素三明治」这种复杂请求，以及执行途中「那个不是垃圾」这类实时纠正。它采用分层结构：高层视觉语言模型理解指令和反馈、决定下一步做什么，低层策略执行具体动作。指令跟随决定了普通人能不能不写代码就给机器人派活，也是评测 VLA（视觉-语言-动作模型）语义泛化的主要维度。","example":"用户说「把桌上的垃圾扔掉，但别碰那个杯子」，机器人要识别哪些是垃圾、避开杯子，再逐个拾起放进垃圾桶。","related":["语言条件策略","视觉-语言-动作模型","Hi Robot","语言接地","语义泛化","语言纠正（实时语言反馈）"]},{"id":"language-grounding","category":"concept","sec":8,"tier":2,"sources":[{"title":"Symbol grounding problem - Wikipedia","url":"https://en.wikipedia.org/wiki/Symbol_grounding_problem"},{"title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances (SayCan, arXiv 2204.01691)","url":"https://arxiv.org/abs/2204.01691"}],"as_of":"","related_ids":["symbol-grounding-problem","saycan","visual-grounding","affordance","instruction-following","large-language-model"],"name":"语言接地","alt":"Grounding / Language Grounding","abbr":"","aliases":["落地","接地","Grounding","语义落地","语言落地"],"one_liner":"把语言里的词和指令，对应到真实世界中具体的物体、位置和动作上。","explanation":"语言接地指让模型理解的语言和物理世界对上号：「红杯子」是桌上哪个物体，「放左边」对应哪块区域，「打开抽屉」要做哪些动作。它源自 Harnad 1990 年提出的符号落地问题：符号如果只靠别的符号来定义，就永远碰不到真实含义。大语言模型读过海量文本，却没在具体环境里行动过，可能提出当前机器人做不到的计划。2022 年谷歌等的 SayCan 用每个技能的价值函数（估计该技能在当前场景下能否成功）给语言模型的建议打分，把规划落到机器人真能做的事上。注意中文「落地」也常指商业部署，要看上下文；把文字对应到图中位置的视觉任务另称视觉定位。","example":"用户说「我把饮料洒了，帮帮我」，SayCan 让语言模型列出候选步骤，再用价值函数挑出当前场景里真能做成的，比如先去拿海绵。","related":["符号落地问题","SayCan","视觉定位（Grounding）","可供性","指令跟随","大语言模型"]},{"id":"hallucination","category":"concept","sec":8,"tier":2,"sources":[{"title":"A Survey on Hallucination in Large Language Models (arXiv 2311.05232)","url":"https://arxiv.org/abs/2311.05232"},{"title":"HEAL: An Empirical Study on Hallucinations in Embodied Agents Driven by Large Language Models (arXiv 2506.15065)","url":"https://arxiv.org/abs/2506.15065"},{"title":"Hallucination (artificial intelligence) - Wikipedia","url":"https://en.wikipedia.org/wiki/Hallucination_(artificial_intelligence)"}],"as_of":"2025-10","related_ids":["large-language-model","vision-language-model","language-grounding","uncertainty-estimation","knowno","embodied-safety"],"name":"幻觉","alt":"Hallucination","abbr":"","aliases":["AI 幻觉","模型幻觉"],"one_liner":"模型一本正经地输出与事实或眼前场景不符的内容。","explanation":"幻觉指大模型生成看似合理、实际与事实或输入不符的内容，最早在大语言模型上被广泛讨论，比如编造不存在的论文；视觉模型也会「看到」图里并不存在的物体。到了具身场景，幻觉会从「说错」变成「做错」：规划器可能让机器人去拿房间里根本没有的东西，或对无法完成的指令硬着头皮执行。2025 年的 HEAL 研究（EMNLP 2025 Findings）专门测试了大语言模型驱动的具身智能体，在两个仿真环境中评测 12 个模型，发现指令与场景对不上时模型普遍识别不出来，在专门构造的测试集上幻觉率最高可达普通提示的 40 倍。常见对策包括用感知结果核对计划、让模型不确定时向人求助、做不确定性估计。","example":"厨房里没有苹果，用户却说「把苹果放进冰箱」，基于大语言模型的规划器仍然生成「走到苹果旁、拿起苹果」的步骤。","related":["大语言模型","视觉语言模型","语言接地","不确定性估计","KnowNo（会求助的机器人）","具身安全"]},{"id":"intent-understanding","category":"concept","sec":8,"tier":3,"sources":[{"title":"SayCan: Do As I Can, Not As I Say (project page)","url":"https://say-can.github.io/"},{"title":"Reasoning Grasping via Multimodal Large Language Model","url":"https://arxiv.org/abs/2402.06798"},{"title":"RoboBench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain","url":"https://arxiv.org/abs/2510.17801"}],"as_of":"2025-10","related_ids":["instruction-following","embodied-reasoning","saycan","vision-language-model","llm-based-task-planning","human-robot-interaction"],"name":"意图理解（隐式指令）","alt":"Intent Understanding / Implicit Instruction Following","abbr":"","aliases":["隐式指令理解","意图推理","Implicit Instruction Understanding","Intention Reasoning"],"one_liner":"听懂人没直说的需求，从一句暗示推断出该做什么","explanation":"意图理解指机器人面对没有直接说出目标物体或动作的指令时，能推断出人真正想要什么。显式指令像「把海绵拿给我」，隐式指令像「我饮料洒了，能帮忙吗」，后者需要常识推理：洒了要擦，擦要用海绵。谷歌 2022 年的 SayCan 用大语言模型把这类话拆成可执行步骤；CoRL 2024 的 Reasoning Grasping 把间接指令直接落到抓取位姿上，推断该抓哪个物体、哪个部位。2025 年的 RoboBench 评测发现，多模态大模型当机器人「大脑」时，隐式指令理解仍是明显短板。","example":"对 SayCan 说「我饮料洒了，能帮忙吗」，它规划出：1. 找到海绵 2. 拿起海绵 3. 拿给你 4. 结束。","related":["指令跟随","具身推理","SayCan","视觉语言模型","大模型任务规划","人机交互"]},{"id":"language-corrections","category":"concept","sec":8,"tier":3,"sources":[{"title":"Interactive Language: Talking to Robots in Real Time","url":"https://arxiv.org/abs/2210.06407"},{"title":"Yell At Your Robot: Improving On-the-Fly from Language Corrections","url":"https://arxiv.org/abs/2403.12910"}],"as_of":"2024-03","related_ids":["language-conditioned-policy","human-in-the-loop","hierarchical-architecture","hi-robot","rt-h","failure-recovery"],"name":"语言纠正（实时语言反馈）","alt":"Language Corrections (Verbal Feedback)","abbr":"","aliases":["语言反馈","口头纠正","Verbal Corrections","Real-time Language Feedback"],"one_liner":"机器人干活时，人用一句话实时指出问题，机器人马上改动作","explanation":"语言纠正指人在机器人执行任务时，用自然语言实时插话调整它的行为，比如「往左一点」「先别拿杯子」。和重新遥操作示教相比，说一句话成本低得多，非专家也能用。谷歌 2022 年的 Interactive Language 训练出能执行约 8.7 万条不同语言指令的实时策略，人可以边看边说，引导机械臂用积木摆出笑脸。Shi 等人 2024 年的 YAY Robot 采用分层结构：高层策略输出语言指令，低层策略执行；人的口头纠正既能当场改变行为，又被收集起来继续训练高层策略，无需额外遥操作数据。","example":"机器人往袋子里装东西时总是对不准袋口，人说「往左一点」，机器人当场调整；这条纠正被记录下来，下次高层策略会自己发出类似指令。","related":["语言条件策略","人在回路","分层架构","Hi Robot","RT-H","失败恢复"]},{"id":"steerability","category":"concept","sec":8,"tier":3,"sources":[{"title":"π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities (arXiv 2604.15483)","url":"https://arxiv.org/abs/2604.15483"},{"title":"π0.7: a Steerable Model with Emergent Capabilities (Physical Intelligence blog)","url":"https://www.pi.website/blog/pi07"}],"as_of":"2026-04","related_ids":["pi0-7","instruction-following","language-corrections","prompt-prompt-engineering","language-conditioned-policy","goal-conditioned-policy"],"name":"可引导性","alt":"Steerability","abbr":"","aliases":["可操控性","可驾驭性"],"one_liner":"不重新训练，只靠提示或条件就能改变模型具体怎么做事的能力。","explanation":"可引导性原本多见于大语言模型领域，指用户能否用提示词、系统指令等在推理时调整模型的行为。放到机器人基础模型上，它指策略不仅知道「做什么」，还能按提示改变「怎么做」。Physical Intelligence 在 2026 年 4 月发布的 π0.7 把它当作核心卖点：训练时给每段数据配上多样的上下文，包括描述任务和子步骤的语言、速度与质量等元数据、关节或末端控制模式标签、视觉子目标图像；推理时就能用这些条件引导它换一种做法，还能靠语言一步步教它完成没练过的任务。带标签的失败数据、次优数据也因此可以拿来训练。","example":"研究者用逐步的语言指导（如「用左夹爪打开空气炸锅」「把红薯放进去」）让 π0.7 操作训练中没专门采集过示范的厨房电器。","related":["π0.7","指令跟随","语言纠正（实时语言反馈）","提示词 / 提示工程","语言条件策略","目标条件策略"]},{"id":"reasoning","category":"concept","sec":8,"tier":2,"sources":[{"title":"Robotic Control via Embodied Chain-of-Thought Reasoning","url":"https://arxiv.org/abs/2407.08693"},{"title":"Gemini Robotics 1.5 brings AI agents into the physical world (Google DeepMind)","url":"https://deepmind.google/discover/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/"}],"as_of":"2025-09","related_ids":["inference","chain-of-thought","embodied-chain-of-thought","embodied-reasoning","gemini-robotics-1-5","dual-system-architecture"],"name":"推理（思考）","alt":"Reasoning","abbr":"","aliases":["推理能力","思考"],"one_liner":"模型给出答案或动作前先分析、拆解、规划的能力，不是前向计算那个推理。","explanation":"中文「推理」对应两个英文词：Inference 指模型跑一次前向计算得到输出，Reasoning 指分析条件、拆解步骤、得出结论的能力，本条讲后者。大语言模型靠思维链（先写中间步骤再作答）提升了推理表现，具身智能随后把它搬到机器人上：2024 年的具身思维链 ECoT 让 VLA 出动作前先写子任务、物体框和夹爪位置，在 OpenVLA 上把成功率提高了 28 个百分点；谷歌 DeepMind 2025 年 9 月发布的 Gemini Robotics 1.5 会在动作前先生成自然语言思考，再由高层的 Gemini Robotics-ER 1.5 做规划。推理有助于长程、多步、需要常识的任务，代价是延迟增加。","example":"让机器人「按颜色分拣衣服」，它先想清楚「白衣服放白筐、其他放黑筐」，再规划「先拿起红毛衣放进黑筐」，最后执行动作。","related":["推理（前向计算）","思维链","具身思维链","具身推理","Gemini Robotics 1.5","快慢双系统"]},{"id":"embodied-reasoning","category":"concept","sec":8,"tier":2,"sources":[{"title":"Gemini Robotics: Bringing AI into the Physical World (arXiv 2503.20020)","url":"https://arxiv.org/abs/2503.20020"},{"title":"ERQA benchmark (GitHub, Google DeepMind)","url":"https://github.com/embodiedreasoning/ERQA"},{"title":"Gemini Robotics ER - Google DeepMind","url":"https://deepmind.google/models/gemini-robotics/gemini-robotics-er/"}],"as_of":"2026-09","related_ids":["embodied-reasoning-model","gemini-robotics-er","spatial-reasoning","erqa","nvidia-cosmos-reason","dual-system-architecture"],"name":"具身推理","alt":"Embodied Reasoning","abbr":"ER","aliases":["具身推理能力"],"one_liner":"让模型懂物理世界：知道东西在哪、怎么抓、接下来该做什么。","explanation":"具身推理指模型对物理世界做空间、时间和因果层面的理解与推断，并服务于机器人行动，比如在图上指出可抓的位置、预测物体的 3D 框和运动轨迹、判断任务是否完成、把长指令拆成步骤。谷歌 DeepMind 2025 年 3 月发布 Gemini Robotics 时把这部分单独做成 Gemini Robotics-ER 模型，能力包括目标检测、指向、轨迹预测、抓取预测、多视角对应和 3D 框预测，同时开源了 400 道题的 ERQA 评测集；截至 2026 年该系列已更新到 Gemini Robotics-ER 2，可通过 Gemini API 调用。它常充当快慢双系统里的慢系统，先想清楚，再把动作交给 VLA 或底层控制器执行。","example":"给模型一张厨房照片和指令「把杯子放进水槽」，具身推理模型先在图上标出杯柄位置和通往水槽的路径点，再交给动作模型执行。","related":["具身推理模型","Gemini Robotics-ER","空间推理","ERQA 具身推理问答基准","Cosmos Reason","快慢双系统"]},{"id":"spatial-intelligence","category":"concept","sec":8,"tier":1,"sources":[{"title":"Fei-Fei Li: From Words to Worlds: Spatial Intelligence is AI's Next Frontier","url":"https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence"},{"title":"Theory of multiple intelligences - Wikipedia","url":"https://en.wikipedia.org/wiki/Theory_of_multiple_intelligences"},{"title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","url":"https://arxiv.org/abs/2412.14171"}],"as_of":"2025-11","related_ids":["spatial-reasoning","world-model","3d-vision","vsi-bench","world-labs","physical-ai"],"name":"空间智能","alt":"Spatial Intelligence","abbr":"","aliases":["视觉空间智能","Visual-Spatial Intelligence"],"one_liner":"理解三维空间中物体的位置、距离和形状，并据此推理和行动的能力。","explanation":"在心理学里，加德纳 1983 年在 Frames of Mind 一书中提出多元智能理论，空间智能是其中一种，指在脑中想象和判断空间关系的能力。AI 领域近年由李飞飞大力推广：她联合创立了 World Labs，2025 年 11 月发文称空间智能是 AI 的下一个前沿，认为模型除了懂语言，还要能感知、生成、推理并与三维世界交互。对具身智能来说，机器人判断「杯子离盘子多远」「这个柜子放不放得下」都依赖空间智能；VSI-Bench 等基准专门测多模态大模型的这类能力，结果显示仍明显不如人类。","example":"执行「把离门最近的那把椅子推到桌子下面」，机器人要先在三维场景里判断哪把椅子离门最近，再估计桌下空间够不够。","related":["空间推理","世界模型","3D视觉","VSI-Bench 视觉空间智能基准","World Labs","物理AI"]},{"id":"spatial-reasoning","category":"concept","sec":8,"tier":2,"sources":[{"title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","url":"https://arxiv.org/abs/2401.12168"},{"title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces (VSI-Bench)","url":"https://arxiv.org/abs/2412.14171"}],"as_of":"2024-12","related_ids":["spatial-intelligence","embodied-reasoning","spatialvlm","vsi-bench","vision-language-model","3d-visual-grounding"],"name":"空间推理","alt":"Spatial Reasoning","abbr":"","aliases":["空间理解","Spatial Understanding","三维空间推理"],"one_liner":"判断物体位置、距离、大小、方向及相互关系的能力。","explanation":"指模型根据图像或视频回答「杯子在盘子左边吗」「两个物体相距多远」这类问题，涵盖相对方位、度量距离、大小比较、视角变换等。它是机器人把语言指令落到具体位置和动作上的前提。多模态大模型擅长识别「是什么」，对「在哪、多远」普遍较弱。谷歌 SpatialVLM（2024）用自动管线从 1000 万张真实图片生成 20 亿条带度量信息的空间问答训练 VLM；Thinking in Space（2024，李飞飞、谢赛宁等）提出含 5000 多道题的 VSI-Bench，发现现有模型明显不如人，而让模型先显式画出「认知地图」能提升距离判断。","example":"指令「把离你最近的红杯子放到碗的右边」，模型需先估计几个杯子离机器人的距离，再确定碗的右侧在画面中对应哪块区域。","related":["空间智能","具身推理","SpatialVLM","VSI-Bench 空间智能基准","视觉语言模型","3D视觉定位"]},{"id":"intuitive-physics","category":"concept","sec":8,"tier":2,"sources":[{"title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos (Garrido et al., 2025)","url":"https://arxiv.org/abs/2502.11831"},{"title":"Do generative video models understand physical principles? (Physics-IQ)","url":"https://arxiv.org/abs/2501.09038"}],"as_of":"2025-02","related_ids":["world-model","embodied-reasoning","v-jepa-2","physics-iq","joint-embedding-predictive-architecture","spatial-reasoning"],"name":"直觉物理","alt":"Intuitive Physics","abbr":"","aliases":["物理常识","Physical Commonsense","物理推理"],"one_liner":"不靠公式也能预判物体怎么动的常识，比如没支撑会掉、挡住了仍存在。","explanation":"直觉物理原本是认知科学概念，指人（包括婴儿）对物理世界的朴素理解：物体被挡住后仍然存在（物体恒存）、不会凭空穿过彼此、没有支撑会下落、形状不会突然改变。研究者常用「违反预期」范式来测：给被试看一段违背物理规律的视频，看其是否表现出「惊讶」。AI 领域用同样的方法考模型：Meta 2025 年的研究发现，在表征空间做视频预测的 V-JEPA 表现出对多种直觉物理性质的理解，而像素空间的视频预测模型和多模态大模型表现更接近随机；Google DeepMind 的 Physics-IQ 基准也发现 Sora 等视频生成模型画面逼真，但物理理解很有限，且和视觉真实感无关。对机器人来说，直觉物理决定它能否预判推一下杯子会不会倒、东西叠起来稳不稳，是世界模型和具身推理要具备的基础能力。","example":"给模型看一段球滚到挡板后面、随后在挡板另一侧凭空消失的视频，如果模型的预测误差（相当于「惊讶度」）明显升高，就说明它掌握了物体恒存。","related":["世界模型","具身推理","V-JEPA 2","Physics-IQ 物理理解基准","联合嵌入预测架构","空间推理"]},{"id":"affordance","category":"concept","sec":8,"tier":2,"sources":[{"title":"Affordance - Wikipedia","url":"https://en.wikipedia.org/wiki/Affordance"},{"title":"SayCan: Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","url":"https://say-can.github.io/"}],"as_of":"","related_ids":["affordance-detection","saycan","grasping","articulated-object-manipulation","embodied-perception","language-grounding"],"name":"可供性","alt":"Affordance","abbr":"","aliases":["示能性","功能可供性"],"one_liner":"物体或环境「允许你对它做什么」，比如把手能拉、按钮能按。","explanation":"可供性由美国心理学家詹姆斯·吉布森在 1966 年提出、1979 年在《视觉感知的生态学方法》中系统阐述，指环境为动物提供的行动可能性。它是相对的：同一把椅子对人是可坐的，对猫是可跳上去的。1988 年唐·诺曼把它引入交互设计。在机器人里，可供性回答「这个物体能怎么交互、从哪里下手」，例如杯柄可握、抽屉把手可拉。常见做法是在图像或点云上标出可交互区域（可供性检测），或像 SayCan 那样用价值函数估计某个技能此刻能否成功，把大模型的计划限制在机器人真能做到的范围内。","example":"看到一个马克杯，可供性模型会把杯柄标为「可抓握」区域、把杯口标为「可倒入」区域，机器人据此决定从哪里下手。","related":["可供性检测","SayCan","抓取","铰接物体操作","具身感知","语言接地"]},{"id":"human-object-interaction","category":"concept","sec":8,"tier":2,"sources":[{"title":"Learning to Detect Human-Object Interactions (HICO-DET, arXiv 1702.05448)","url":"https://arxiv.org/abs/1702.05448"},{"title":"HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction (arXiv 2203.01577)","url":"https://arxiv.org/abs/2203.01577"}],"as_of":"","related_ids":["hand-object-interaction","affordance","human-video-data","hoi4d","egocentric-video","omomo"],"name":"人-物交互","alt":"Human-Object Interaction","abbr":"HOI","aliases":["人物交互"],"one_liner":"研究人怎样拿、推、打开、使用物体，是机器人向人学动作的重要素材。","explanation":"人-物交互（HOI）研究人和物体之间发生了什么动作。在计算机视觉里，经典任务是 HOI 检测：在图像中框出人和物体，并判断二者关系，输出「人、动作、物体」三元组，如「人、骑、自行车」，代表数据集是 WACV 2018 的 HICO-DET。之后研究扩展到视频、3D 和 4D，关注手怎样接触物体、物体怎样随之运动，如 CVPR 2022 的 HOI4D 含 240 万帧第一人称 RGB-D 视频、800 个物体实例。对具身智能来说，人的交互视频比机器人数据多得多、便宜得多，从中提取接触位置、手部轨迹和可供性（物体能被怎样使用），是给机器人扩充训练数据的重要路线。缩写 HOI 有时也指手物交互。","example":"从大量人开冰箱的视频里，识别出「人、拉开、冰箱门」的交互和手握把手的位置，再用来教机器人开门。","related":["手物交互","可供性","人类视频数据","HOI4D 数据集","第一人称视频","OMOMO 人-物交互动作数据集"]},{"id":"embodied-perception","category":"concept","sec":8,"tier":3,"sources":[{"title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI (Liu et al., 2024)","url":"https://arxiv.org/abs/2407.06886"}],"as_of":"","related_ids":["active-perception","interactive-perception","simultaneous-localization-and-mapping","scene-understanding","embodied-interaction","multimodal-perception"],"name":"具身感知","alt":"Embodied Perception","abbr":"","aliases":[],"one_liner":"为行动服务的感知：边移动边观察，理解三维空间并支撑决策。","explanation":"具身感知指身处环境中的智能体为了行动而进行的感知。和传统计算机视觉「给一张图、输出标签」不同，它的输入是随身体移动不断变化的第一人称观测，要回答的是「我在哪、周围是什么三维结构、下一步该往哪看、怎么动」。中山大学等团队 2024 年的具身智能综述把它列为四个研究方向之一，内容包括视觉 SLAM（同时定位与建图）、3D 场景理解、主动探索，以及视觉语言导航等任务。它的关键特点是主动：智能体可以转头、走近、挪开遮挡物来获取更多信息，而不是被动接收数据。机器人上的深度相机、激光雷达、触觉传感器，以及点云、语义地图等表示，都服务于具身感知。","example":"机器人在桌上找不到遥控器时，会换个角度或挪开挡在前面的杂志再看，而不是只对当前一帧图片做检测。","related":["主动感知","交互式感知","同步定位与建图","场景理解","具身交互","多模态感知"]},{"id":"object-centric-representation","category":"concept","sec":8,"tier":3,"sources":[{"title":"Object-Centric Learning with Slot Attention","url":"https://arxiv.org/abs/2006.15055"},{"title":"VIOLA: Imitation Learning for Vision-Based Manipulation with Object Proposal Priors","url":"https://arxiv.org/abs/2210.11339"}],"as_of":"","related_ids":["representation-learning","compositional-generalization","3d-scene-graph","distractor-objects","vision-encoder","keypoint-detection"],"name":"以物体为中心的表示","alt":"Object-centric Representation","abbr":"","aliases":["物体中心表示","对象中心表征","Object-centric Learning"],"one_liner":"把场景拆成一个个物体分别编码，而不是整张图压成一个向量","explanation":"以物体为中心的表示指把图像或场景分解成若干物体，每个物体用自己的一组特征（位置、形状、类别等）表示，而不是把整幅画面压成一个特征向量。代表方法是 Locatello 等人 2020 年（NeurIPS）的 Slot Attention：若干个「槽」通过注意力相互竞争，无监督地各自绑定到一个物体。在机器人操作中，这种表示让策略只关注和任务有关的物体，换背景、加干扰物时更稳。2022 年的 VIOLA 用预训练视觉模型给出的物体候选构建物体级表示，再用 Transformer 策略挑出相关物体，论文报告成功率比最好的基线提升 45.8%。","example":"桌上有杯子、碗和勺子，策略先把画面分成三个物体表示；执行「把勺子放进碗里」时只看勺子和碗，桌布换了颜色也不受影响。","related":["表征学习","组合泛化","3D场景图","干扰物","视觉编码器","关键点检测"]},{"id":"partially-observable-markov-decision-process","category":"concept","sec":8,"tier":3,"sources":[{"title":"Partially observable Markov decision process - Wikipedia","url":"https://en.wikipedia.org/wiki/Partially_observable_Markov_decision_process"}],"as_of":"","related_ids":["markov-decision-process","observation","state-space","embodied-memory","memory-augmented-vla","reinforcement-learning"],"name":"部分可观测马尔可夫决策过程","alt":"Partially Observable Markov Decision Process","abbr":"POMDP","aliases":["部分可观察马尔可夫决策过程"],"one_liner":"智能体看不全真实状态、只能凭观测推断时的决策数学框架。","explanation":"部分可观测马尔可夫决策过程是马尔可夫决策过程（MDP，序贯决策的标准模型）的扩展：智能体拿不到真实状态，只能得到带噪声、不完整的观测。Åström 在 1965 年提出这一框架，1998 年 Kaelbling、Littman 等人把它系统引入人工智能规划。常用做法是维护一个「信念」，即对真实状态的概率分布，每拿到新观测就按贝叶斯公式更新。机器人几乎总处在部分可观测的环境里：相机有遮挡，抽屉里看不见，物体多重要拿起来才知道。精确求解计算量极大，实际中常用近似规划，或让策略网络输入历史帧、加记忆模块来隐式估计状态。","example":"机器人要从一排关着门的柜子里找杯子，开门前看不到杯子在哪，只能根据已经看过的柜格更新「杯子可能在哪一格」的概率，再决定下一扇先开哪个。","related":["马尔可夫决策过程","观测","状态空间","具身记忆","记忆增强 VLA","强化学习"]},{"id":"embodied-memory","category":"concept","sec":8,"tier":3,"sources":[{"title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","url":"https://arxiv.org/abs/2508.19236"},{"title":"ReMEmbR: Building and Reasoning Over Long-Horizon Spatio-Temporal Memory for Robot Navigation","url":"https://arxiv.org/abs/2409.13682"},{"title":"KARMA: Augmenting Embodied AI Agents with Long-and-short Term Memory Systems","url":"https://arxiv.org/abs/2409.14908"}],"as_of":"2025-08","related_ids":["memory-augmented-vla","memory-augmented-vla","long-horizon-task","partially-observable-markov-decision-process","3d-scene-graph","embodied-question-answering"],"name":"具身记忆","alt":"Embodied Memory","abbr":"","aliases":["机器人记忆"],"one_liner":"机器人把看过、做过的事存下来，供之后决策和回答问题使用。","explanation":"具身记忆指具身智能体在长时间运行中保存并调用过去经历的机制：去过哪里、东西放在哪、任务做到了哪一步、上次在哪里失败。它之所以必要，是因为机器人每次只能看到局部（部分可观测），很多任务又持续几分钟到几天，只看当前画面的策略会忘掉已完成的子任务，或反复寻找同一样东西。常见做法有三类：一是在模型内部保存历史特征，如 MemoryVLA（2025）借鉴人的工作记忆和情景记忆，给 VLA 加了记忆库；二是维护外部结构化记忆，如 3D 场景图、语义地图，KARMA 用长期场景图加短期状态记录来辅助家务规划；三是检索增强，如 ReMEmbR 把长时间导航的画面按时间、位置存进数据库，用来回答「在哪、什么时候发生」一类问题。","example":"巡逻机器人被问「上次在哪看到一辆红色推车」，需要从几小时的历史画面中检索出时间和位置再回答。","related":["记忆增强 VLA","MemoryVLA","长程任务","部分可观测马尔可夫决策过程","3D场景图","具身问答"]},{"id":"embodied-interaction","category":"concept","sec":8,"tier":3,"sources":[{"title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI (Liu et al., 2024)","url":"https://arxiv.org/abs/2407.06886"},{"title":"Paul Dourish (Wikipedia, on Where the Action Is: The Foundations of Embodied Interaction)","url":"https://en.wikipedia.org/wiki/Paul_Dourish"}],"as_of":"","related_ids":["embodied-perception","embodied-question-answering","human-robot-interaction","physical-human-robot-interaction","interactive-perception","language-grounding"],"name":"具身交互","alt":"Embodied Interaction","abbr":"","aliases":[],"one_liner":"智能体在物理或仿真空间中与人、物体和环境发生的交互。","explanation":"具身交互在具身智能领域指智能体（真实机器人或仿真中的虚拟体）在物理或仿真空间中与人和环境发生的交互：既包括移动、抓取、推拉等会改变环境的动作，也包括听人的语言指令行事、回答问题。中山大学等团队 2024 年的具身智能综述把它列为四个研究方向之一（另外三个是具身感知、具身智能体、仿真到现实），并以具身问答和语言引导抓取为典型任务。它和纯感知的区别在于交互会改变环境，智能体既要决定做什么，也要判断何时已获得足够信息。这个词在人机交互（HCI）领域另有用法：Paul Dourish 2001 年的著作 Where the Action Is 用它指人通过身体、实物和社会情境与计算系统互动，属于界面设计理论，读文献时需要区分。","example":"用户说「我渴了，给我点喝的」，机器人要推断出意图，找到饮料并稳稳递过去，而不只是认出画面里有杯子。","related":["具身感知","具身问答","人机交互","物理人机交互","交互式感知","语言接地"]},{"id":"embodied-agi","category":"concept","sec":9,"tier":2,"sources":[{"title":"Toward Embodied AGI: A Review of Embodied AI and the Road Ahead (arXiv 2505.14235)","url":"https://arxiv.org/abs/2505.14235"}],"as_of":"2025-05","related_ids":["embodied-ai","general-purpose-robot","physical-turing-test","levels-of-autonomy","humanoid-robot-intelligence-level-grading"],"name":"具身通用智能","alt":"Embodied AGI","abbr":"","aliases":["具身AGI","通用具身智能"],"one_liner":"能像人一样在真实世界完成各种开放任务的具身智能，是该领域的远期目标。","explanation":"具身通用智能是把通用人工智能（AGI）和具身智能结合起来的目标概念，目前没有统一标准。Wang 与 Sun 2025 年的综述给出一个实用定义：展现类人交互能力、能以人类水平完成多样开放式真实世界任务的具身智能。文中仿照自动驾驶分级提出 L1–L5：L1 完成单一任务，L2 完成组合任务，L3 有条件地完成通用任务，L4、L5 逐步走向开放任务、类人行为和无需人工干预；并从全模态、类人认知、实时响应、泛化四个维度评估，认为当前具身智能大致处在 L1 与 L2 之间。这类分级主要用来描述方向和衡量进度。","example":"按该分级，只会在产线上抓一种零件的机械臂属于 L1；能把一句「做杯咖啡」拆成取杯、接水、按按钮等预设技能并依次完成的机器人接近 L2。","related":["具身智能","通用机器人","物理图灵测试","自主等级","人形机器人智能化分级"]},{"id":"levels-of-autonomy","category":"concept","sec":9,"tier":2,"sources":[{"title":"Toward a framework for levels of robot autonomy in human-robot interaction (Beer, Fisk, Rogers, 2014)","url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC5656240/"},{"title":"Self-driving car - Wikipedia（SAE J3016 分级）","url":"https://en.wikipedia.org/wiki/Self-driving_car"}],"as_of":"","related_ids":["fully-autonomous","teleoperation","humanoid-robot-intelligence-level-grading","shared-autonomy","human-robot-interaction","autonomous-driving"],"name":"自主等级","alt":"Levels of Autonomy","abbr":"","aliases":["自主性","自主程度","Autonomy","机器人自主等级"],"one_liner":"按机器人在多大程度上不靠人就能感知、决策、执行来划分的等级。","explanation":"自主等级描述一个系统在感知、决策和执行上能在多大程度上不依赖人。最广为人知的是 SAE International 2014 年发布的 J3016 自动驾驶分级（L0 到 L5），关键分界在 L2 和 L3 之间：从 L3 起由系统而不是驾驶员负责监控环境。机器人领域，Beer、Fisk、Rogers 在 2014 年提出了从纯遥操作到完全自主的 10 级分类框架，并讨论自主程度如何影响人对机器人的接受度、情境感知和对可靠性的判断。具身智能里常问的「这段演示是遥操作还是全自主」，本质上就是在问自主等级；国内的人形机器人智能化分级标准也借鉴了自动驾驶的分级思路。自主程度越高，对鲁棒性、失败恢复和安全的要求越高。","example":"同样是叠衣服的视频，由操作员戴 VR 头显实时遥控属于最低自主等级；机器人自己看、自己决定、自己做且全程无人介入，才算全自主。","related":["全自主","遥操作","人形机器人智能化分级","共享自主","人机交互","自动驾驶"]},{"id":"humanoid-robot-intelligence-level-grading","category":"concept","sec":9,"tier":2,"sources":[{"title":"全球首个《人形机器人智能化分级》标准推出，行业商业化进程加速（新浪财经，2025-05-29）","url":"https://baijiahao.baidu.com/s?id=1833417873950992497"}],"as_of":"2025-05","related_ids":["levels-of-autonomy","agibot-g1g5-embodied-ai-roadmap","humanoid-robot","beijing-humanoid-robot-innovation-center","miit-humanoid-robot-and-embodied-ai-standardization-technica"],"name":"人形机器人智能化分级","alt":"Humanoid Robot Intelligence Level Grading","abbr":"","aliases":["L1–L5 分级","T/CIE 298-2025","四维五级"],"one_liner":"中国电子学会发布的团体标准，按四个维度把人形机器人智能水平分成 L1–L5。","explanation":"《人形机器人智能化分级》（T/CIE 298-2025）是中国电子学会 2025 年 5 月发布的团体标准，由北京人形机器人创新中心牵头，上海、浙江人形机器人创新中心以及优必选、宇树科技、中国信通院等单位参与制定，据报道是全球首个针对人形机器人智能化能力的分级标准。它采用「四维五级」框架：从感知认知（P）、决策学习（D）、执行表现（E）、协作交互（C）四个维度评价，智能化水平从 L1 到 L5 逐级递增；标准包含 22 个一级指标和 100 余项技术条款。思路借鉴了自动驾驶的分级体系，目的是给厂商、客户和投资方一把统一的尺子，减少各家自说自话地宣传「智能」。注意它和智元提出的 G1–G5 技术路线不是一回事，后者是单家公司的技术演进规划。","example":"","related":["自主等级","智元 G1–G5 技术路线","人形机器人","北京人形机器人创新中心","人形机器人与具身智能标准化技术委员会"]},{"id":"physical-turing-test","category":"concept","sec":9,"tier":2,"sources":[{"title":"The Physical Turing Test: Jim Fan on Nvidia's Roadmap for Embodied AI (Sequoia Capital, YouTube)","url":"https://www.youtube.com/watch?v=_2NijXqBESI"},{"title":"AI Ascent 2025 (Sequoia Capital)","url":"https://www.sequoiacap.com/article/ai-ascent-2025/"},{"title":"Turing test - Wikipedia","url":"https://en.wikipedia.org/wiki/Turing_test"}],"as_of":"2025-05","related_ids":["embodied-ai","physical-ai","general-purpose-robot","household-tasks","moravec-s-paradox","digital-cousin"],"name":"物理图灵测试","alt":"Physical Turing Test","abbr":"","aliases":["物理版图灵测试"],"one_liner":"分不出一件现实中的体力活是人干的还是机器人干的，就算通过。","explanation":"物理图灵测试是英伟达 AI 总监 Jim Fan（范麟熙）在 2025 年 5 月红杉资本 AI Ascent 大会演讲中提出的说法，把图灵测试从「聊天分不出人机」搬到物理世界：让机器人完成真实的家务等体力活，如果人看结果分辨不出是人还是机器做的，就算通过。他在演讲里主张用大规模仿真来弥补机器人训练数据的不足，并介绍了数字孪生、数字表亲等思路。类似想法更早就有，认知科学家 Harnad 提出的「完全图灵测试」也要求同时检验感知和操作物体的能力。这个词现在常被用来形容通用家务机器人的终极目标。","example":"Jim Fan 举的场景：周日晚上开完派对家里一片狼藉，周一回家发现屋子已收拾干净、还摆好了烛光晚餐，你分不清是人还是机器人做的。","related":["具身智能","物理AI","通用机器人","家务任务","莫拉维克悖论","数字表亲"]},{"id":"the-coffee-test","category":"concept","sec":9,"tier":3,"sources":[{"title":"Artificial general intelligence - Wikipedia（Tests for human-level AGI 一节）","url":"https://en.wikipedia.org/wiki/Artificial_general_intelligence"}],"as_of":"2025","related_ids":["physical-turing-test","embodied-agi","household-tasks","open-world","long-horizon-task","moravec-s-paradox"],"name":"咖啡测试","alt":"The Coffee Test (Wozniak)","abbr":"","aliases":["沃兹尼亚克咖啡测试","Wozniak Coffee Test"],"one_liner":"让机器走进一户陌生人家，自己找齐东西把咖啡煮出来。","explanation":"苹果联合创始人史蒂夫·沃兹尼亚克（Steve Wozniak）提出的一种通用人工智能测试：机器要走进一户普通美国家庭，自己弄明白怎么煮咖啡——找到咖啡机、找到咖啡、加水、找到杯子、按对按钮完成冲泡。和只考对话的图灵测试不同，它要求在没见过的真实环境里完成感知、搜索、常识推理和操作，因此常被用来说明「会聊天」不等于「会干活」。据维基百科整理，2024 年 1 月 Figure 01 人形机器人演示了自主操作 Keurig 胶囊咖啡机，2025 年爱丁堡大学的 ELLMER 框架据报道让机械臂按语音指令在厨房做咖啡；但这些都不是在随机挑选的陌生家庭里完成的，离测试原本的要求还有距离。","example":"大模型能列出煮咖啡的每一步，但要通过咖啡测试，机器人得在一间从没去过的厨房里自己翻柜子找咖啡粉，并认出这台咖啡机该按哪个按钮。","related":["物理图灵测试","具身通用智能","家务任务","开放世界","长程任务","莫拉维克悖论"]},{"id":"the-bitter-lesson","category":"concept","sec":9,"tier":2,"sources":[{"title":"The Bitter Lesson (Rich Sutton, 2019)","url":"http://www.incompleteideas.net/IncIdeas/BitterLesson.html"}],"as_of":"","related_ids":["scaling-law","end-to-end","moravec-s-paradox","foundation-model","data-scarcity","embodied-ai"],"name":"苦涩的教训","alt":"The Bitter Lesson","abbr":"","aliases":["惨痛的教训","痛苦的教训"],"one_liner":"萨顿的观点：长期看，能随算力扩展的通用方法胜过人工注入的领域知识。","explanation":"强化学习奠基人之一 Rich Sutton 在 2019 年 3 月发表的一篇短文。他回顾 70 年 AI 研究后指出：长期真正有效的是能充分利用算力的通用方法——搜索和学习，而不是把人对领域的理解硬编码进系统。象棋、围棋、语音、视觉都走过同一条路：先靠人工知识取得短期进步，最后被规模化的搜索和学习超越，根本原因是单位算力的成本持续指数下降。在具身智能里，这篇文章常被用来支持「端到端 + 大数据 + 大模型」路线、反对过多手工设计的模块；争议点在于机器人数据远比文本和图像稀缺，能否照搬仍有分歧。","example":"萨顿文中的例子：计算机围棋曾长期依赖人工棋理和围棋特有结构，最终被「大规模搜索 + 自我对弈学习价值函数」的方法全面超越。","related":["缩放定律","端到端","莫拉维克悖论","基础模型","数据荒","具身智能"]},{"id":"emergent-abilities","category":"concept","sec":9,"tier":2,"sources":[{"title":"Emergent Abilities of Large Language Models (arXiv 2206.07682)","url":"https://arxiv.org/abs/2206.07682"},{"title":"Are Emergent Abilities of Large Language Models a Mirage? (arXiv 2304.15004)","url":"https://arxiv.org/abs/2304.15004"},{"title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv 2307.15818)","url":"https://arxiv.org/abs/2307.15818"}],"as_of":"","related_ids":["scaling-law","large-language-model","chain-of-thought","rt-2","zero-shot","generalization"],"name":"涌现能力","alt":"Emergent Abilities","abbr":"","aliases":["涌现","Emergence","Emergent Capabilities"],"one_liner":"小模型没有、模型或数据规模变大后才出现的能力。","explanation":"这一说法由 Wei 等人 2022 年的论文《Emergent Abilities of Large Language Models》系统提出，定义是：一种能力在较小模型中不存在、在较大模型中出现，无法靠外推小模型的表现来预测，例如多步算术、思维链推理。2023 年 Schaeffer 等人提出反驳：很多「突然出现」来自评价指标，用全对才得分的指标会显得跳变，换成连续指标后提升其实是平滑的。在具身智能里，涌现常指训练数据中没有、测试时却表现出来的能力，比如 RT-2 能执行机器人数据里没有的指令（把物体放到某个数字或图标上），或挑出石头当临时锤子。看到宣传里的涌现，要结合具体评测来判断。","example":"RT-2 的机器人示范数据里没有「把物体放到数字卡片上」这类任务，但它的视觉语言模型底座从网络图文里认识数字，于是能照做。","related":["缩放定律","大语言模型","思维链","RT-2","零样本","泛化"]},{"id":"era-of-experience","category":"concept","sec":9,"tier":3,"sources":[{"title":"Welcome to the Era of Experience (Silver & Sutton, 2025, preprint)","url":"https://storage.googleapis.com/deepmind-media/Era-of-Experience%20/The%20Era%20of%20Experience%20Paper.pdf"}],"as_of":"2025-04","related_ids":["reinforcement-learning","the-bitter-lesson","real-world-reinforcement-learning","self-improvement","data-flywheel","continual-learning"],"name":"经验时代","alt":"Era of Experience","abbr":"","aliases":["Welcome to the Era of Experience"],"one_liner":"Silver 与 Sutton 的观点：AI 下一阶段主要靠自身交互经验来学习。","explanation":"经验时代出自 David Silver 与 Richard Sutton 2025 年 4 月发布的短文 Welcome to the Era of Experience，是 MIT Press 图书 Designing an Intelligence 中一章的预印本；Silver 是 AlphaGo 系列的主要负责人之一，Sutton 是强化学习奠基人之一。文章认为，靠海量人类数据训练、再用人类偏好微调的「人类数据时代」在数学、代码、科学等领域正接近上限，下一阶段智能体应主要从自己与环境交互产生的经验中学习。文中列出四个特征：活在长期的经验流里而非短对话中；行动和观察扎根于环境；奖励来自环境中的真实信号而非人的事先评判；规划和推理也基于经验。对具身智能而言，这一观点支持机器人在真实部署中持续试错、自我改进。","example":"文中举 AlphaProof 为例：它先学习约十万条人类写的形式化证明，再通过与证明系统交互自行生成约一亿条，最终在国际数学奥林匹克上达到奖牌水平。","related":["强化学习","苦涩的教训","真机强化学习","自我提升","数据飞轮","持续学习"]},{"id":"three-schools-of-ai","category":"concept","sec":9,"tier":3,"sources":[{"title":"Symbolic artificial intelligence - Wikipedia","url":"https://en.wikipedia.org/wiki/Symbolic_artificial_intelligence"},{"title":"联结主义 - 维基百科","url":"https://zh.wikipedia.org/wiki/联结主义"},{"title":"Behavior-based robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Behavior-based_robotics"}],"as_of":"","related_ids":["subsumption-architecture","symbol-grounding-problem","embodied-cognition","perception-action-loop","neural-network","moravec-s-paradox"],"name":"人工智能三大学派（符号主义 / 连接主义 / 行为主义）","alt":"Three Schools of AI: Symbolism, Connectionism, Behaviorism (Actionism)","abbr":"","aliases":["AI 三大流派","符号主义","连接主义（联结主义）","行为主义（控制论学派）"],"one_liner":"中文教材对 AI 路线的经典划分：靠逻辑符号、靠神经网络、靠与环境交互。","explanation":"中文人工智能教材里常见的一种划分，按「智能从哪来」把研究路线分成三派。符号主义（又称逻辑主义）认为智能是对符号做逻辑推理，代表是 Newell 和 Simon 1950 年代的逻辑理论家程序和后来的专家系统；连接主义（又称仿生学派）认为智能来自大量简单神经元的连接和学习，今天的深度学习、大模型都属于这一派；行为主义（又称控制论学派）认为智能体现在感知-动作闭环里，不必先建完整的世界模型，代表是 Rodney Brooks 1980 年代在 MIT 用包容架构做的机器人。具身智能思想上最接近行为主义，方法上大量用连接主义的神经网络，三派在今天是融合的。","example":"让机器人「把苹果放进碗里」：符号主义会手写规则「若看到苹果且手空，则去抓」；连接主义用大量演示训练神经网络，直接从图像输出动作；行为主义则搭一组「看到-伸手-调整」的反应回路，让行为在与环境的交互中成形。今天的 VLA 模型主要走连接主义路线。","related":["包容架构（行为式机器人）","符号落地问题","具身认知","感知-行动闭环","神经网络","莫拉维克悖论"]},{"id":"symbol-grounding-problem","category":"concept","sec":9,"tier":3,"sources":[{"title":"The Symbol Grounding Problem (Harnad, Physica D 1990)","url":"https://arxiv.org/abs/cs/9906002"},{"title":"Symbol grounding problem - Wikipedia","url":"https://en.wikipedia.org/wiki/Symbol_grounding_problem"}],"as_of":"","related_ids":["language-grounding","embodied-cognition","disembodied-ai","three-schools-of-ai","saycan"],"name":"符号落地问题","alt":"Symbol Grounding Problem","abbr":"","aliases":["符号接地问题"],"one_liner":"机器里的符号怎样对应到真实世界的事物，从而真正有意义。","explanation":"认知科学家 Stevan Harnad 1990 年在 Physica D 上提出的问题：一个只按规则摆弄符号的系统，它的符号怎样获得自身的意义，而不是全靠人来解释？他举的例子是只拿一本中文-中文词典学中文，每个词都用别的词解释，查来查去也落不到实物上。Harnad 的方案是让最基础的符号扎根在感知上：先有对外界的感官表征，再学出区分类别的特征，符号是这些类别的名字，复杂概念由它们组合而成。具身智能常把它当作「为什么需要身体」的理论依据之一，讨论语言接地（把词和视觉、动作对应起来）时也常引用它。","example":"给机器人下指令「把红色的杯子拿过来」：大语言模型能解析这句话，但只有把「红色的杯子」对应到相机画面里的某个物体、把「拿」对应到一串抓取动作，这句话对机器人才算落了地。","related":["语言接地","具身认知","离身智能","人工智能三大学派（符号主义 / 连接主义 / 行为主义）","SayCan"]},{"id":"subsumption-architecture","category":"concept","sec":9,"tier":3,"sources":[{"title":"Subsumption architecture - Wikipedia","url":"https://en.wikipedia.org/wiki/Subsumption_architecture"}],"as_of":"","related_ids":["sense-plan-act","three-schools-of-ai","embodied-cognition","finite-state-machine","moravec-s-paradox","behavior-tree"],"name":"包容架构（行为式机器人）","alt":"Subsumption Architecture / Behavior-based Robotics","abbr":"","aliases":["包容式架构","分层包容结构","基于行为的机器人学","行为式机器人学"],"one_liner":"用多层简单行为直连感知与动作、高层可压制低层的机器人控制架构。","explanation":"包容架构由 MIT 的 Rodney Brooks 于 1986 年在论文《A robust layered control system for a mobile robot》中提出，是行为式机器人学的代表。它反对「先建完整世界模型、再规划、再执行」的感知-规划-行动流程，把控制拆成若干并行的行为层，每层用简单的有限状态机把传感器直接连到执行器：底层避障，上层漫游、探索；高层可以用抑制和压制信号改写低层的输入输出，从而「包容」低层行为。它反应快、鲁棒，但难以支撑复杂推理和语言理解，常被视为具身认知和人工智能行为主义学派的源头之一。","example":"Brooks 实验室的六足机器人 Genghis 靠分层的简单行为实现行走；另一台机器人 Herbert 用同样的思路在办公室里收集空饮料罐。","related":["感知-规划-行动范式","人工智能三大学派（符号主义 / 连接主义 / 行为主义）","具身认知","有限状态机","莫拉维克悖论","行为树"]},{"id":"embodied-cognition","category":"concept","sec":9,"tier":3,"sources":[{"title":"Embodied Cognition (Stanford Encyclopedia of Philosophy)","url":"https://plato.stanford.edu/entries/embodied-cognition/"},{"title":"Embodied cognition (Wikipedia)","url":"https://en.wikipedia.org/wiki/Embodied_cognition"}],"as_of":"","related_ids":["embodied-ai","disembodied-ai","subsumption-architecture","morphological-computation","symbol-grounding-problem","moravec-s-paradox"],"name":"具身认知","alt":"Embodied Cognition","abbr":"","aliases":["具身性","涉身性","Embodiment (cognitive science)","具身心智","涉身认知"],"one_liner":"认为思维离不开身体及身体与环境互动的认知科学观点。","explanation":"具身认知是认知科学和心灵哲学中的一类理论，主张思维不只是大脑里的符号运算，而是由身体的形态、感觉运动能力以及身体与环境的互动共同塑造。思想源头可追溯到梅洛-庞蒂等人的现象学；1991 年 Varela、Thompson、Rosch 合著的《具身心智》（The Embodied Mind）把它系统化，Lakoff 与 Johnson 则从语言角度论证抽象概念来自身体经验。它对机器人学影响很直接：Rodney Brooks 放弃「先建完整世界模型再规划」的做法，让传感器直接驱动行为，主张世界本身就是最好的模型；Rolf Pfeifer 等人也认为真正的智能需要有感觉运动能力的身体。今天「具身智能」的说法就源于这一脉络，它为「智能要在与物理世界的交互中形成」提供了理论依据。","example":"英语用 grasp（抓住）表示「理解」，Lakoff 与 Johnson 把这类说法看作抽象概念借用身体经验的证据。","related":["具身智能","离身智能","包容架构（行为式机器人）","形态计算","符号落地问题","莫拉维克悖论"]},{"id":"morphological-computation","category":"concept","sec":9,"tier":3,"sources":[{"title":"Trade-Offs in Exploiting Body Morphology for Control (Hoffmann & Müller)","url":"https://arxiv.org/abs/1411.2276"},{"title":"Passive dynamics - Wikipedia","url":"https://en.wikipedia.org/wiki/Passive_dynamics"}],"as_of":"","related_ids":["embodied-cognition","passive-dynamic-walking","soft-robot","compliance","morphology-control-co-design","cost-of-transport"],"name":"形态计算","alt":"Morphological Computation","abbr":"","aliases":["形态学计算"],"one_liner":"把一部分控制工作交给身体的形状和材料本身去完成","explanation":"形态计算是具身智能和仿生机器人里的一个观点：身体的形状、材料弹性、质量分布本身就能承担一部分原本要由控制器计算的工作，相当于把计算「卸载」给身体。这一思路主要由 Rolf Pfeifer 等具身认知研究者推广。经典例子是 Tad McGeer 在 20 世纪 80 年代末做的被动动力学行走器：没有电机和控制器，只靠重力和腿的自然摆动就能走下斜坡。软体夹爪靠材料变形自动贴合物体，也常被当作例子。Hoffmann 和 Müller 提醒，身体越软越复杂不一定越好控制，需要在形态设计和控制方法之间权衡。","example":"被动动力学行走器没有任何电机，只靠腿长、质量分布和重力就能走下缓坡；据维基百科，康奈尔基于这一原理的双足机器人单位运输成本约 0.20，与人接近，本田 ASIMO 约为 3.23。","related":["具身认知","被动动力学行走","软体机器人","柔顺性","形态-控制协同设计（形态进化）","运输成本"]},{"id":"morphology-control-co-design","category":"concept","sec":9,"tier":3,"sources":[{"title":"Evolved Virtual Creatures (Karl Sims, 1994)","url":"https://www.karlsims.com/evolved-virtual-creatures.html"},{"title":"Embodied Intelligence via Learning and Evolution (DERL)","url":"https://arxiv.org/abs/2102.02202"},{"title":"Transform2Act: Learning a Transform-and-Control Policy for Efficient Agent Design","url":"https://arxiv.org/abs/2110.03659"}],"as_of":"","related_ids":["morphological-computation","reinforcement-learning","embodiment","simulator","soft-robot","embodied-ai"],"name":"形态-控制协同设计（形态进化）","alt":"Morphology-Control Co-design / Morphological Evolution","abbr":"","aliases":["形态与控制联合优化","形态进化","Brain-Body Co-design","Co-design of Morphology and Control"],"one_liner":"把机器人的身体结构和控制策略放在一起优化，而非先定身体再学控制","explanation":"形态-控制协同设计指同时搜索机器人的身体（肢体数量、长度、关节布置等）和控制它的策略。传统做法是先定本体，再为它编写或训练控制器；协同设计认为最优控制取决于身体，最优身体也取决于控制，应放在一个循环里优化。1994 年 Karl Sims 在 SIGGRAPH 发表的「Evolving Virtual Creatures」用模拟进化同时演化虚拟生物的形态和神经控制器。2021 年斯坦福 Gupta 等人的 DERL 用进化改身体、用强化学习训控制；ICLR 2022 的 Transform2Act 则把「改身体」也当成策略动作一起学。","example":"在 DERL 中，由不同肢体拼成的虚拟智能体在仿真里学走路和操作，表现好的个体被保留并变异身体结构，多代之后出现了更稳定、更节能、学得更快的形态。","related":["形态计算","强化学习","本体","仿真器","软体机器人","具身智能"]},{"id":"robotic-arm","category":"robot","sec":0,"tier":1,"sources":[{"title":"Franka Research 3 (franka.de)","url":"https://franka.de/franka-research-3"}],"as_of":"","related_ids":["degrees-of-freedom","end-effector","collaborative-robot","industrial-robot","7-dof-robot-arm","franka-emika-panda-franka-research-3"],"name":"机械臂","alt":"Robotic Arm (Manipulator)","abbr":"","aliases":["机器人手臂","操作臂","单臂机器人","Manipulator"],"one_liner":"由关节和连杆串成、末端装夹爪或工具的手臂式机器人","explanation":"机械臂是由一串连杆和关节组成的机器人手臂，底座固定，末端装夹爪、吸盘或灵巧手等末端执行器。6 个自由度就能让末端到达空间中任意位置和朝向，7 自由度则多出一个冗余关节，可以绕开障碍。它分为追求速度和精度、需要围栏隔离的工业机械臂，以及带力感知、能和人共处的协作机械臂。具身智能研究里的操作任务（抓取、装配、叠衣服）大多在机械臂上完成，常见的有 Franka、UR5e、WidowX 和低成本的 SO-100。","example":"Open X-Embodiment 数据集中大部分数据来自单臂或双臂机械臂。","related":["自由度","末端执行器","协作机器人","工业机器人","七自由度机械臂","Franka 机械臂（Panda / FR3）"]},{"id":"6-axis-robot-arm","category":"robot","sec":0,"tier":2,"sources":[{"title":"Robotic arm - Wikipedia","url":"https://en.wikipedia.org/wiki/Robotic_arm"},{"title":"Universal Robots UR5e","url":"https://www.universal-robots.com/products/ur5e/"}],"as_of":"","related_ids":["robotic-arm","degrees-of-freedom","inverse-kinematics","spherical-wrist","7-dof-robot-arm","universal-robots-ur5e"],"name":"六轴机械臂","alt":"6-Axis Robot Arm","abbr":"","aliases":["六自由度机械臂","6-DoF 机械臂","6-DoF Robot Arm"],"one_liner":"有六个串联转动关节、末端能到达任意位置和姿态的机械臂","explanation":"六轴机械臂由六个串联的转动关节组成，是工业机器人和协作机器人最常见的构型。空间中一个物体的位姿（位置 x/y/z 加三个转角）正好有 6 个自由度，所以六个关节理论上足以让末端执行器（装在手腕末端的夹爪、焊枪等工具）在工作空间内到达任意位姿。常见设计是前三轴定位置、后三轴组成球形手腕定姿态，因此多数能用公式直接求逆运动学（由目标位姿算关节角）。代表产品有 UR5e、xArm6、松灵 PiPER 等，在具身智能研究里常作单臂操作平台；它没有多余自由度，遇到奇异位形或需要绕障时不如七自由度机械臂灵活。","example":"UR5e 是六轴协作机械臂，负载 5 kg，常被用来做抓取放置实验。","related":["机械臂","自由度","逆运动学","球形手腕","七自由度机械臂","UR5e 协作机械臂"]},{"id":"7-dof-robot-arm","category":"robot","sec":0,"tier":2,"sources":[{"title":"DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset","url":"https://droid-dataset.github.io/"},{"title":"Robotic arm - Wikipedia","url":"https://en.wikipedia.org/wiki/Robotic_arm"}],"as_of":"","related_ids":["kinematic-redundancy","null-space","swivel-angle","6-axis-robot-arm","franka-emika-panda-franka-research-3","kuka-lbr-iiwa"],"name":"七自由度机械臂","alt":"7-DoF Robot Arm","abbr":"","aliases":["七轴机械臂","冗余机械臂","7-DoF Redundant Manipulator"],"one_liner":"比六轴多一个关节、同一末端位姿可对应多种手臂姿态的冗余机械臂","explanation":"七自由度机械臂有 7 个串联关节，比确定末端位姿所需的 6 个多出一个，这叫运动学冗余。好处是同一个末端位姿对应无穷多组关节角，控制器可以在零空间（不改变末端位姿的那部分关节运动）里调整手肘位置，用来避障、绕开奇异位形和关节限位，动作也更接近人的手臂（肩、肘、腕大致也是 7 个自由度）。代价是逆运动学没有唯一解，需要臂型角等额外参数或数值优化来选解。代表产品有 Franka Panda / FR3、KUKA LBR iiwa、Kinova Gen3、xArm7；智元远征 A2 等人形机器人的单臂也采用 7 自由度设计。","example":"DROID 数据集在多个实验室用 Franka Panda 七自由度机械臂采集。","related":["运动学冗余","零空间","臂型角（肘部自运动角）","六轴机械臂","Franka 机械臂（Panda / FR3）","库卡 LBR iiwa"]},{"id":"industrial-robot","category":"robot","sec":0,"tier":2,"sources":[{"title":"IFR: Industrial Robots","url":"https://ifr.org/industrial-robots"},{"title":"IFR: Robot definitions at ISO","url":"https://ifr.org/standardisation"}],"as_of":"","related_ids":["collaborative-robot","6-axis-robot-arm","selective-compliance-assembly-robot-arm","big-four-of-industrial-robotics","teach-and-playback-programming","international-federation-of-robotics"],"name":"工业机器人","alt":"Industrial Robot","abbr":"","aliases":["工业机械臂"],"one_liner":"用在工厂自动化里、可编程的多关节机械臂等机器人。","explanation":"按国际机器人联合会（IFR）采用的 ISO 8373 定义，工业机器人是自动控制、可重复编程、至少三个轴可编程的多用途操作机，可以固定安装，也可以装在移动平台上，用于工业自动化。常见形态有六轴机械臂、SCARA、Delta 并联和直角坐标机器人，主要做焊接、喷涂、搬运、装配、码垛。它们大多靠示教或离线编程执行固定轨迹，精度和节拍很高，但换任务要重新编程，这正是具身智能想用学习方法去补的地方。主要厂商有发那科、ABB、库卡、安川，被称为「四大家族」。","example":"汽车焊装车间里成排的六轴机械臂按示教好的轨迹给车身点焊。","related":["协作机器人","六轴机械臂","SCARA 机器人","工业机器人四大家族","示教再现","国际机器人联合会"]},{"id":"selective-compliance-assembly-robot-arm","category":"robot","sec":0,"tier":3,"sources":[{"title":"Wikipedia: SCARA","url":"https://en.wikipedia.org/wiki/SCARA"}],"as_of":"","related_ids":["industrial-robot","6-axis-robot-arm","pick-and-place","robotic-assembly","cartesian-robot","delta-robot"],"name":"SCARA 机器人","alt":"Selective Compliance Assembly Robot Arm","abbr":"SCARA","aliases":["平面关节机器人","Selective Compliance Articulated Robot Arm"],"one_liner":"水平方向可弯、竖直方向刚硬的四轴工业机械臂，擅长快速装配和搬运","explanation":"SCARA 是一类工业机器人构型，20 世纪 70 年代末由日本山梨大学牧野洋提出。典型结构是两个轴线竖直的转动关节让手臂在水平面内摆动，再加一个上下移动的直线轴和一个末端旋转轴，共 4 个自由度。名字里的「选择性柔顺」指它在水平方向有一定顺应性、竖直方向很刚，适合把零件垂直插进孔里。和六轴机械臂比，它工作空间小、动作受限，但速度快、重复精度高、价格低，大量用于电子装配、点胶、分拣等平面上的抓取放置工作。","example":"手机主板产线上把小元件抓起来垂直插装到电路板上，常用 SCARA 机器人。","related":["工业机器人","六轴机械臂","抓取放置","装配","直角坐标机器人","Delta 并联机器人（蜘蛛手）"]},{"id":"delta-robot","category":"robot","sec":0,"tier":3,"sources":[{"title":"Delta robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Delta_robot"},{"title":"Reymond Clavel - Wikipedia","url":"https://en.wikipedia.org/wiki/Reymond_Clavel"}],"as_of":"","related_ids":["parallel-mechanism","pick-and-place","sorting","industrial-robot","selective-compliance-assembly-robot-arm","serial-mechanism"],"name":"Delta 并联机器人（蜘蛛手）","alt":"Delta Robot (Parallel Robot)","abbr":"","aliases":["蜘蛛手","Delta 机器人","并联机械手"],"one_liner":"三根手臂并联拉一个小平台的高速分拣机器人，产线上俗称蜘蛛手。","explanation":"Delta 机器人是 20 世纪 80 年代由瑞士洛桑联邦理工学院 Reymond Clavel 团队发明的并联机器人（多条运动链同时连接末端，和常见机械臂那样一节接一节的串联结构相对）。它有三条手臂从顶部基座垂下，经平行四边形连杆共同拉住一个小平台，使平台只能平移不能转动，常再加一个旋转轴。电机都装在固定基座上，运动部分很轻，所以速度极快、定位准，但负载小、工作空间有限。它最初是为了高速把巧克力装盒，如今广泛用于食品包装、电子元件和药品的高速分拣，是抓取放置场景的典型设备。","example":"食品厂流水线上方倒挂的蜘蛛手，靠视觉识别传送带上的饼干，每秒抓几件放进包装盒。","related":["并联机构","抓取放置","分拣","工业机器人","SCARA 机器人","串联机构"]},{"id":"cartesian-robot","category":"robot","sec":0,"tier":3,"sources":[{"title":"Cartesian coordinate robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Cartesian_coordinate_robot"}],"as_of":"","related_ids":["industrial-robot","prismatic-joint","selective-compliance-assembly-robot-arm","6-axis-robot-arm","machine-tending","palletizing-depalletizing"],"name":"直角坐标机器人","alt":"Cartesian Robot","abbr":"","aliases":["桁架机器人","龙门机器人","Gantry Robot","Cartesian Coordinate Robot"],"one_liner":"三根互相垂直的直线轴带着末端沿 X、Y、Z 平移的机器人。","explanation":"直角坐标机器人的三个主运动轴都是直线轴（移动关节），分别沿互相垂直的 X、Y、Z 方向运动，所以末端位置就等于三根轴的读数，逆运动学几乎不用算。横梁两端都有支撑、架在工作区上方的叫龙门（桁架）机器人，行程大、刚性好、能搬重物。它结构简单、精度高、易于扩展，常见于机床上下料、码垛、点胶、3D 打印机和 CNC 机床。缺点是占地大、只能在方盒子里动、姿态灵活性差，需要转角度时要再加旋转轴。它和六轴机械臂、SCARA 一起构成工业机器人的几种基本构型。","example":"注塑机上方的三轴桁架机械手，把成型件从模具里取出放到传送带上。","related":["工业机器人","移动关节","SCARA 机器人","六轴机械臂","上下料","码垛 / 拆垛"]},{"id":"collaborative-robot","category":"robot","sec":0,"tier":2,"sources":[{"title":"Cobot - Wikipedia","url":"https://en.wikipedia.org/wiki/Cobot"},{"title":"ISO/TS 15066:2016 Robots and robotic devices — Collaborative robots","url":"https://www.iso.org/standard/62996.html"}],"as_of":"","related_ids":["industrial-robot","human-robot-collaboration","iso-ts-15066-robots-and-robotic-devices-collaborative-robots","power-and-force-limiting","kinesthetic-teaching","universal-robots"],"name":"协作机器人","alt":"Collaborative Robot","abbr":"Cobot","aliases":["协作臂","协作机械臂","Cobot"],"one_liner":"可以不设围栏、与人共享工作空间的轻型机械臂","explanation":"协作机器人（Cobot）指设计上可以和人在同一空间一起工作的机器人，最常见的是负载几公斤到二三十公斤的轻型六轴或七轴机械臂。传统工业机器人要关在安全围栏里，协作机器人则靠功率与力限制、碰撞检测（关节电流或力矩传感器发现意外接触就立即停下）、速度与分离监控等手段降低伤人风险，相关要求写在 ISO 10218 和 ISO/TS 15066 中。它通常支持拖动示教（用手拖着机械臂记录动作），部署门槛低，是中小工厂自动化和具身智能实验室的常用平台。代表有优傲 UR 系列、Franka、越疆、节卡、非夕等。注意是否「协作」要看整套应用的风险评估，换一台协作臂不等于自动安全。","example":"UR5e 负载 5 kg，可直接用手拖动示教，是科研中最常见的协作机械臂之一。","related":["工业机器人","人机协作","ISO/TS 15066 协作机器人安全标准","功率与力限制","拖动示教","优傲机器人"]},{"id":"desktop-robot-arm","category":"robot","sec":0,"tier":2,"sources":[{"title":"TheRobotStudio/SO-ARM100 - GitHub","url":"https://github.com/TheRobotStudio/SO-ARM100"},{"title":"SO-101 - LeRobot Docs","url":"https://huggingface.co/docs/lerobot/so101"}],"as_of":"2025","related_ids":["so-100-so-101-arm","lerobot","leader-follower-teleoperation","elephant-robotics-mycobot","dobot-magician","open-source-hardware"],"name":"桌面机械臂","alt":"Desktop Robot Arm","abbr":"","aliases":["桌面级机械臂","低成本机械臂","Desktop Robotic Arm"],"one_liner":"能直接放在桌上的小型低成本机械臂，多用于教学、爱好和数据采集","explanation":"桌面机械臂指体积小、重量轻、能直接放在办公桌上用的机械臂，负载通常只有几百克到一两公斤，价格远低于工业机械臂。早期多用于教学和创客，如越疆 Dobot Magician、大象机器人 myCobot。2024 年后，Hugging Face LeRobot 社区的开源 SO-100 / SO-101（舵机驱动、3D 打印结构，据称单臂物料约百美元级）让它成了具身智能入门的热门平台：一台主臂用手拖动、一台从臂跟随，就能遥操作采集演示数据，再训练 ACT、SmolVLA 等策略。它的精度、刚度和负载有限，适合算法验证，不适合工业作业。","example":"SO-101 用飞特 STS3215 舵机和 3D 打印件组装，一主一从即可遥操作采数据训练 ACT。","related":["SO-100 / SO-101 机械臂","LeRobot","主从臂遥操作","大象机器人 myCobot","越疆 Dobot Magician","开源硬件"]},{"id":"dual-arm-robot","category":"robot","sec":0,"tier":2,"sources":[{"title":"ALOHA: A Low-cost Open-source Hardware System for Bimanual Teleoperation","url":"https://tonyzhaozh.github.io/aloha/"},{"title":"Mobile ALOHA","url":"https://mobile-aloha.github.io/"}],"as_of":"","related_ids":["bimanual-manipulation","aloha","mobile-aloha","agilex-cobot-magic","abb-yumi","rethink-robotics-baxter"],"name":"双臂机器人","alt":"Dual-arm (Bimanual) Robot","abbr":"","aliases":["双臂协作机器人","Bimanual Robot","Dual-arm Robot"],"one_liner":"有两条机械臂、能像人一样双手配合干活的机器人","explanation":"双臂机器人指带两条机械臂、能两手协同完成任务的机器人，可以是固定在桌边的双臂平台，也可以装在移动底盘或人形躯干上。很多日常任务一只手做不了，比如叠衣服、拧瓶盖、一手扶一手插，这类双臂操作要求两臂在时间和空间上配合，动作维度也翻倍，是模仿学习和 VLA 研究的重点难题。早期代表有 Rethink Baxter、ABB YuMi；具身智能研究里最常见的是斯坦福的 ALOHA（两对低成本主从臂做遥操作采集）及其衍生的松灵 Cobot Magic，RDT-1B、π0 等模型大量使用这类双臂数据训练。","example":"Mobile ALOHA 把 ALOHA 双臂装上移动底盘，每个任务约 50 条演示就学会炒虾等长程家务。","related":["双臂操作","ALOHA 双臂平台","Mobile ALOHA","松灵 Cobot Magic","ABB YuMi 双臂协作机器人","Baxter 双臂机器人"]},{"id":"wheeled-robot","category":"robot","sec":1,"tier":3,"sources":[{"title":"Robot locomotion - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_locomotion"}],"as_of":"","related_ids":["mobile-base","differential-drive-base","mecanum-wheel","wheel-legged-robot","wheeled-humanoid-robot","autonomous-mobile-robot"],"name":"轮式机器人","alt":"Wheeled Robot","abbr":"","aliases":["轮式移动机器人"],"one_liner":"靠轮子移动的机器人，平地上快且省电，但怕台阶和崎岖地形。","explanation":"轮式机器人是用轮子（或履带）移动的机器人，是最常见、技术最成熟的移动形态。在平整硬地面上，滚动的轮子几乎不损失能量，比腿足走路更省电、更快、更稳，结构和控制也简单；代价是上不了楼梯，过不了大沟坎和松软地面。常见底盘有差速驱动（两个主动轮靠转速差转向）、全向轮和麦克纳姆轮（能原地横移）、阿克曼转向（像汽车一样）。代表产品从扫地机器人、仓库里的 AGV/AMR，到装上机械臂的复合机器人（如 PR2、Fetch），再到轮式人形机器人。","example":"扫地机器人就是最常见的差速驱动轮式机器人。","related":["移动底盘","差速底盘","麦克纳姆轮","轮足机器人","轮式人形机器人","自主移动机器人"]},{"id":"automated-guided-vehicle","category":"robot","sec":1,"tier":3,"sources":[{"title":"Automated guided vehicle - Wikipedia","url":"https://en.wikipedia.org/wiki/Automated_guided_vehicle"},{"title":"AGV vs AMR - AGV Network","url":"https://www.agvnetwork.com/agv-vs-amr"}],"as_of":"","related_ids":["autonomous-mobile-robot","mobile-base","wheeled-robot","tote-handling","fleet-management-system","simultaneous-localization-and-mapping"],"name":"自动导引车","alt":"Automated Guided Vehicle","abbr":"AGV","aliases":["AGV 小车"],"one_liner":"沿磁条、二维码等预设路线自动行驶的搬运小车。","explanation":"AGV 是工厂和仓库里最早普及的自动搬运设备，按预先铺设的导引方式走固定或半固定路线，常见导引有地面磁条、埋地电线、二维码、激光反射板等。它的好处是路线确定、可靠、便宜；缺点是改线要重新铺设，路上遇到障碍通常只会停下等待，不会自己绕行。能自己建图、实时规划路线的车通常叫 AMR（自主移动机器人），不过现在不少 AGV 也用上了激光 SLAM（同步定位与建图），两者边界在变模糊。AGV 是理解移动底盘和仓储物流自动化的起点。","example":"汽车总装线上沿地面磁条把零部件料车送到工位的潜伏式 AGV。","related":["自主移动机器人","移动底盘","轮式机器人","料箱搬运","多机调度系统","同步定位与建图"]},{"id":"autonomous-mobile-robot","category":"robot","sec":1,"tier":3,"sources":[{"title":"AGV vs AMR - AGV Network","url":"https://www.agvnetwork.com/agv-vs-amr"},{"title":"AGV vs AMR: differences and how to choose | Navitec Systems","url":"https://navitecsystems.com/agv-vs-amr-what-is-the-difference-and-which-one-to-choose/"}],"as_of":"","related_ids":["automated-guided-vehicle","mobile-base","mobile-manipulator","navigation","simultaneous-localization-and-mapping","fleet-management-system"],"name":"自主移动机器人","alt":"Autonomous Mobile Robot","abbr":"AMR","aliases":[],"one_liner":"不靠地面轨道、靠传感器自己定位和规划路线的移动机器人。","explanation":"AMR 用激光雷达、相机、IMU（惯性测量单元）等传感器，通过 SLAM（同步定位与建图）知道自己在哪，再自己规划路径；遇到人或障碍会实时绕行，而不是像传统 AGV 那样停下等待。部署时一般不用改造地面，换场地、改路线只需重新建图和设点，所以在电商仓储、医院配送、工厂物料流转里越来越常见。缺点是单价通常比磁条 AGV 高。AMR 本身不一定带机械臂；在它上面装臂就成了复合机器人（移动操作平台），这也是具身智能做移动操作的常见硬件形态。","example":"电商仓库里把货架或料箱送到拣货工位的激光导航搬运机器人。","related":["自动导引车","移动底盘","复合机器人","导航","同步定位与建图","多机调度系统"]},{"id":"mobile-manipulator","category":"robot","sec":1,"tier":2,"sources":[{"title":"The Robot Report: Stretch 3 mobile manipulator","url":"https://www.therobotreport.com/stretch-3-mobile-manipulator-hello-robot-designed-open-source-development/"}],"as_of":"","related_ids":["mobile-manipulation","mobile-base","autonomous-mobile-robot","wheeled-humanoid-robot","hello-robot-stretch","mobile-aloha"],"name":"复合机器人","alt":"Mobile Manipulator","abbr":"","aliases":["移动操作机器人","移动机械臂"],"one_liner":"移动底盘上装机械臂，既能走又能动手的机器人。","explanation":"复合机器人是把移动底盘（AGV/AMR 或轮式底盘）和机械臂组合在一起的机器人，国内工业界常叫「复合机器人」，学术界叫移动操作机器人。单独的机械臂只能在固定工位干活，单独的移动机器人只能搬运；合在一起就能在车间、仓库、家里跑到不同位置去抓取、上下料、开门开抽屉。难点是底盘和手臂要协同规划与控制，导航定位误差会传到末端。学术常用平台有 Hello Robot Stretch、TIAGo、Fetch、Mobile ALOHA，很多轮式人形机器人本质上也属于这一类。","example":"工厂里一台 AMR 背着协作机械臂，在多台机床之间跑动自动上下料。","related":["移动操作","移动底盘","自主移动机器人","轮式人形机器人","Hello Robot Stretch","Mobile ALOHA"]},{"id":"legged-robot","category":"robot","sec":1,"tier":2,"sources":[{"title":"IEEE Spectrum: How MIT's Mini Cheetah Can Help Accelerate Robotics Research","url":"https://spectrum.ieee.org/mit-mini-cheetah-accelerate-research"}],"as_of":"","related_ids":["quadruped-robot","bipedal-robot","legged-locomotion","rl-based-locomotion-control","wheel-legged-robot","mit-mini-cheetah"],"name":"足式机器人","alt":"Legged Robot","abbr":"","aliases":["腿足机器人","腿式机器人"],"one_liner":"用腿而不是轮子移动的机器人，如四足机器狗和双足人形。","explanation":"足式机器人靠腿交替着地来移动，按腿数分为双足（人形）、四足（机器狗）、六足等。和轮式相比，它只需离散的落脚点，能上楼梯、跨障碍、走碎石和草地，适合非结构化环境；代价是控制难，需要实时保持平衡。早期多用基于模型的控制（如 MPC、零力矩点），近年主流是在仿真里用强化学习训练运控策略再迁移到真机。代表有波士顿动力 Spot、宇树 Go2、ANYmal、MIT Mini Cheetah 以及各类人形机器人。","example":"宇树 Go2 四足机器狗用强化学习训练的步态在楼梯和草地上行走。","related":["四足机器人","双足机器人","腿足运动","强化学习运控","轮足机器人","MIT Mini Cheetah"]},{"id":"quadruped-robot","category":"robot","sec":1,"tier":1,"sources":[{"title":"Spot | Boston Dynamics","url":"https://bostondynamics.com/products/spot/"}],"as_of":"","related_ids":["legged-locomotion","boston-dynamics-spot","unitree-go2","anybotics-anymal","rl-based-locomotion-control","sim-to-real-transfer"],"name":"四足机器人","alt":"Quadruped Robot","abbr":"","aliases":["机器狗","四足机器狗","四足"],"one_liner":"用四条腿行走的足式机器人，俗称机器狗","explanation":"四足机器人是用四条腿移动的机器人，常见构型每条腿 3 个关节，全身约 12 个自由度。相比双足，它随时有多条腿着地，天然更稳；相比轮式，它能跨台阶、走碎石和坡地。因此它是最早走向商用的足式机器人，主要用于工业巡检、安防、勘察和科研教育，背上加机械臂还能做移动操作。近年来主流做法是在仿真里用强化学习训练运动策略再迁移到真机。代表有波士顿动力 Spot、ANYbotics ANYmal、宇树 Go2、云深处绝影系列。","example":"宇树 Go2 在仿真里用强化学习训出的步态可以直接部署到真机上。","related":["腿足运动","波士顿动力 Spot","宇树 Go2","ANYmal 四足","强化学习运控","仿真到现实迁移"]},{"id":"wheel-legged-robot","category":"robot","sec":1,"tier":2,"sources":[{"title":"Learning robust autonomous navigation and locomotion for wheeled-legged robots (Science Robotics)","url":"https://arxiv.org/html/2405.01792v1"},{"title":"LimX Dynamics launches W1 wheeled quadruped (The Robot Report)","url":"https://www.therobotreport.com/limx-dynamics-launches-w1-wheeled-quadruped/"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"轮足机器人","alt":"Wheel-legged Robot","abbr":"","aliases":["轮腿机器人","轮足式机器人","Wheeled-legged Robot"],"one_liner":"腿的末端装上驱动轮，平地滚着跑、遇到障碍能迈腿的机器人","explanation":"轮足机器人是在足式机器人的每条腿末端装上带电机的轮子，兼得两种移动方式的好处：平地上用轮子滚，比走路快也更省电；遇到台阶、沟坎时锁住轮子当脚用，或者抬腿跨过去。常见形态有双轮足（如苏黎世联邦理工的 Ascento、逐际动力 TRON 1）和四轮足（如 ANYmal 轮式版及其衍生的 Swiss-Mile、逐际动力 W1、宇树 Go2-W 和 B2-W）。难点在控制：要同时协调轮子转动和腿部姿态，现在多用强化学习在仿真里训练控制策略。","example":"Swiss-Mile 的四轮足机器人在人行道上以轮子高速滑行送货，到楼梯前切换成迈腿上台阶。","related":["足式机器人(Legged Robot)","轮式机器人(Wheeled Robot)","宇树 Go2-W(Unitree Go2-W)","宇树 B2-W(Unitree B2-W)","逐际动力 TRON 1(LimX Dynamics TRON 1)","形态之争(Form-Factor Debate (humanoid vs. non-humanoid, wheeled vs. legged))"]},{"id":"legged-mobile-manipulator","category":"robot","sec":1,"tier":3,"sources":[{"title":"Unitree Robotics Launches Z1 Robot Arm","url":"https://shop.unitree.com/blogs/news/unitree-technology-launches-z1-robot-arm-for-its-quadruped-robots"},{"title":"Unitree quadruped robots get a helping hand - New Atlas","url":"https://newatlas.com/robotics/unitree-quadruped-robots-z1-arm/"}],"as_of":"","related_ids":["quadruped-robot","mobile-manipulation","loco-manipulation","whole-body-control","umi-on-legs","boston-dynamics-spot"],"name":"足式移动操作机器人（带臂四足）","alt":"Legged Mobile Manipulator (Quadruped with Arm)","abbr":"","aliases":["带臂四足","四足机械臂","机器狗加机械臂"],"one_liner":"在四足机器人背上装机械臂，既能走复杂地形又能动手操作。","explanation":"这类机器人把机械臂装在四足机器人背上，让它走到哪里就能在哪里开门、按按钮、捡东西。典型代表有波士顿动力的 Spot 加 Spot Arm、ANYbotics 的 ANYmal 加机械臂、宇树四足配 Z1 机械臂。相比轮式复合机器人，它能上楼梯、过碎石；难点在于手臂一动，机身重心和受力就变，机械臂和四条腿必须协调控制，否则会失稳或够不准。因此研究上常用全身控制或强化学习把腿和臂当成一个整体来训练，UMI on Legs 等工作就是在这类平台上做的。","example":"Spot 带着机械臂走进工厂，自己拧开阀门、拉开门，再继续巡检。","related":["四足机器人","移动操作","运动操作一体化","全身控制","UMI on Legs","波士顿动力 Spot"]},{"id":"bipedal-robot","category":"robot","sec":1,"tier":2,"sources":[{"title":"Humanoid robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Humanoid_robot"},{"title":"Zero moment point - Wikipedia","url":"https://en.wikipedia.org/wiki/Zero_moment_point"}],"as_of":"","related_ids":["bipedal-locomotion","humanoid-robot","legged-robot","zero-moment-point","inverted-pendulum-model","agility-robotics-cassie"],"name":"双足机器人","alt":"Bipedal Robot","abbr":"","aliases":["两足机器人","Biped","Biped Robot"],"one_liner":"靠两条腿行走的机器人，人形机器人最典型的下半身形态","explanation":"双足机器人指靠两条腿移动的机器人，可以是完整的人形，也可以只有腿（如 Agility Cassie）。两条腿支撑面小，行走中常有单脚着地的阶段，本身不稳定，需要持续做平衡控制。传统方法用零力矩点（判断脚底会不会翻转的参考点）和倒立摆模型规划步态，本田 ASIMO 是代表；近几年主流转向在仿真里用强化学习训练行走策略，再迁移到真机。它的好处是能上下楼梯、跨越障碍、进入为人设计的环境，代价是能耗、成本和摔倒风险都高于轮式底盘。宇树 G1、Agility Digit、Booster T1 都属于双足机器人。","example":"本田 ASIMO 靠 ZMP 规划步态行走；宇树 G1 则用仿真中强化学习训练出的策略行走。","related":["双足行走","人形机器人","足式机器人","零力矩点","倒立摆模型","Agility Cassie"]},{"id":"humanoid-robot","category":"robot","sec":2,"tier":1,"sources":[{"title":"Optimus (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Optimus_(robot)"},{"title":"Unitree G1","url":"https://www.unitree.com/g1/"}],"as_of":"","related_ids":["full-size-humanoid-robot","wheeled-humanoid-robot","bipedal-locomotion","whole-body-control","tesla-optimus","unitree-g1"],"name":"人形机器人","alt":"Humanoid Robot","abbr":"","aliases":["类人机器人","人形"],"one_liner":"外形和人相似、有躯干双臂（通常还有双腿）的机器人","explanation":"人形机器人指身体结构模仿人类的机器人，一般有头、躯干、两条手臂，多数用双腿行走，也有用轮式底盘代替腿的「轮式人形」。全身通常有二三十到五十多个自由度（可独立运动的关节）。做成人形的理由是：人的环境（楼梯、门把手、工具）都是按人设计的，人形可以直接用；人类视频和遥操作数据也更容易迁移过来。难点是双足平衡、全身协调控制和成本。早期代表有本田 ASIMO，近年有波士顿动力 Atlas、特斯拉 Optimus、Figure 03、宇树 G1 等。","example":"宇树 G1、特斯拉 Optimus 都是双足人形；银河通用 Galbot G1 是轮式人形。","related":["全尺寸人形机器人","轮式人形机器人","双足行走","全身控制","擎天柱","宇树 G1"]},{"id":"full-size-humanoid-robot","category":"robot","sec":2,"tier":2,"sources":[{"title":"百度百科：天工（全尺寸人形机器人）","url":"https://baike.baidu.com/item/%E5%A4%A9%E5%B7%A5/64343233"},{"title":"北京人形：天工自主跑完北京亦庄半马","url":"https://x-humanoid.com/news-view-164.html"}],"as_of":"2026-09","related_ids":["humanoid-robot","small-size-humanoid-robot","tiangong","tesla-optimus","unitree-h1","bipedal-locomotion"],"name":"全尺寸人形机器人","alt":"Full-size Humanoid Robot","abbr":"","aliases":["全尺寸人形","成人尺寸人形"],"one_liner":"身高接近成年人（约1.5–1.8米）的人形机器人。","explanation":"全尺寸人形机器人指身高、臂展大致和成年人相当的人形机器人，行业里通常把 1.5 米以上、接近 1.6–1.8 米的机型归入这一类，与 1.3 米左右的小尺寸人形相对。它的意义在于能直接用为人设计的环境：够得着货架和操作台、跨得过台阶、用得了人的工具，所以工厂搬运、仓储等落地场景多选这一档。代价是更重、更贵、摔倒风险更大，对关节模组（电机加减速器的一体化关节）和平衡控制要求更高。国外代表有特斯拉 Optimus、Figure、波士顿动力 Atlas，国内有北京人形「天工」、宇树 H1 等。","example":"北京人形机器人创新中心的天工 Ultra 身高 180 cm、体重 52 kg，2025 年 4 月以 2 小时 40 分 42 秒跑完北京亦庄人形机器人半程马拉松。","related":["人形机器人","小尺寸人形机器人","天工","擎天柱","宇树 H1","双足行走"]},{"id":"small-size-humanoid-robot","category":"robot","sec":2,"tier":3,"sources":[{"title":"Wikipedia: Humanoid robot","url":"https://en.wikipedia.org/wiki/Humanoid_robot"}],"as_of":"","related_ids":["humanoid-robot","full-size-humanoid-robot",null,"booster-robotics-t1","softbank-robotics-nao","research-and-education-market"],"name":"小尺寸人形机器人","alt":"Small-size Humanoid Robot","abbr":"","aliases":["半尺寸人形","小型人形机器人","Half-size Humanoid"],"one_liner":"身高明显低于成人的人形机器人，更轻、更便宜、摔了也不容易坏","explanation":"小尺寸人形机器人指身高明显低于成年人的双足人形机器人，行业里没有统一标准，大致指 1.5 米以下，常见的在 1–1.4 米，更小的有几十厘米的教育机型。个子小带来的好处是：体重轻、关节力矩需求小，成本和售价低，摔倒时冲击小，适合科研、教育、比赛和强化学习运控实验。代价是够不着台面和货架，负载有限，不适合直接干工厂或家务的活。近两年国产厂商把这类机型的价格做到了几万元，成为很多实验室的入门平台。","example":"宇树 G1（约 1.3 米）、加速进化 Booster T1、松延动力 N2 都属于这一类；更早的 NAO 只有 58 厘米。","related":["人形机器人","全尺寸人形机器人","宇树 G1(Unitree G1)","加速进化 Booster T1","NAO 机器人","科研教育市场"]},{"id":"wheeled-humanoid-robot","category":"robot","sec":2,"tier":2,"sources":[{"title":"Galbot G1 Specs & Price (Humanoid.guide)","url":"https://humanoid.guide/product/galbot/"},{"title":"1X Technologies - Wikipedia","url":"https://en.wikipedia.org/wiki/1X_Technologies"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"轮式人形机器人","alt":"Wheeled Humanoid Robot","abbr":"","aliases":["轮臂机器人","轮式双臂机器人","轮式人形","Wheeled Dual-arm Robot"],"one_liner":"上半身像人（双臂、头、躯干），下半身换成轮式底盘的机器人","explanation":"轮式人形机器人保留人形的上半身——头部相机、两条手臂、常带可升降或弯折的腰部——下半身用轮式移动底盘代替双腿。放弃双足行走，换来的是稳定、省电、成本低、控制简单，不怕摔倒，也方便长时间干活；代价是上不了楼梯、过不了复杂地形。它主要瞄准工厂、仓储、商超、家庭等平地场景里的操作任务，是国内具身智能公司的主流形态之一，代表有银河通用 Galbot G1、智元远征 A2-W、星海图 R1、星尘智能 Astribot S1，以及 1X 早期的 EVE。","example":"银河通用 Galbot G1 在药店里用轮式底盘移动到货架前，升降腰部，用双臂从高处货架取药。","related":["人形机器人(Humanoid Robot)","复合机器人(Mobile Manipulator)","移动底盘(Mobile Base / Chassis)","银河通用 Galbot G1(Galbot G1)","星海图 R1(Galaxea R1)","形态之争(Form-Factor Debate (humanoid vs. non-humanoid, wheeled vs. legged))"]},{"id":"upper-body-humanoid-robot","category":"robot","sec":2,"tier":3,"sources":[{"title":"Baxter (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Baxter_(robot)"}],"as_of":"","related_ids":["humanoid-robot","wheeled-humanoid-robot","dual-arm-robot","bimanual-manipulation","teleoperation","rethink-robotics-baxter"],"name":"半身人形机器人","alt":"Upper-body Humanoid Robot","abbr":"","aliases":["上半身人形机器人"],"one_liner":"只有人形上半身（头、躯干、双臂）、没有双腿的机器人。","explanation":"半身人形机器人只保留人形的上半身：头部（通常装相机）、躯干和两条手臂，手上配灵巧手或夹爪；下半身是固定底座、桌边支架，或换成轮式底盘（这时也叫轮式人形机器人）。去掉双腿后不用处理平衡和摔倒，成本更低、更稳定，适合长时间做双臂操作。在具身智能里它常被当作数据采集和操作研究平台：人通过遥操作带它做任务，收集演示数据来训练 VLA 等策略模型。早期代表是 Rethink Robotics 2012 年推出的 Baxter。","example":"Rethink Robotics 的 Baxter：两条手臂加一块显示表情的屏幕脸，固定在底座上工作。","related":["人形机器人","轮式人形机器人","双臂机器人","双臂操作","遥操作","Baxter 双臂机器人"]},{"id":"hyper-realistic-humanoid-robot","category":"robot","sec":2,"tier":3,"sources":[{"title":"Latest Geminoid Is Incredibly Realistic - IEEE Spectrum","url":"https://spectrum.ieee.org/latest-geminoid-is-disturbingly-realistic"},{"title":"Hyper-Realistic Humanoids Creep into Mainstream | Mike Kalil","url":"https://mikekalil.com/blog/new-breed-hyper-realistic-humanoid-robots/"}],"as_of":"2025-12","related_ids":["humanoid-robot","uncanny-valley","engineered-arts-ameca","sophia","aheadform","human-robot-interaction"],"name":"超仿生人形机器人","alt":"Hyper-realistic (Bionic) Humanoid Robot / Android","abbr":"","aliases":["仿真人机器人","Android","拟人机器人"],"one_liner":"外观、皮肤和表情尽量逼真像真人的人形机器人。","explanation":"超仿生人形机器人追求的是「看起来像人」：硅胶皮肤、仿真五官，脸部藏着几十个小电机或人工肌肉来做眨眼、微笑、口型等表情。代表作有石黑浩团队的 Geminoid 系列、Hanson Robotics 的 Sophia、Engineered Arts 的 Ameca，国内有 2024 年成立的首形科技（AheadForm）。它们主要用于人机交互、社会心理学研究、展馆接待和陪伴，多数行走和操作能力很弱，有的还要靠遥操作驱动。和擎天柱这类以干活为目标的人形机器人是两条路线；做得不够逼真时容易落入「恐怖谷」，让人觉得诡异。","example":"Ameca 能根据对话实时做出皱眉、惊讶等表情，常在科技展会上和观众聊天，但它下半身基本固定不动。","related":["人形机器人","恐怖谷","Ameca 表情人形","Sophia（索菲亚）机器人","首形科技","人机交互"]},{"id":"service-robot","category":"robot","sec":3,"tier":2,"sources":[{"title":"IFR: Service Robots","url":"https://ifr.org/service-robots"},{"title":"IFR: Robot definitions at ISO","url":"https://ifr.org/standardisation"}],"as_of":"","related_ids":["industrial-robot","robot-vacuum-cleaner","companion-robot","autonomous-mobile-robot","human-robot-interaction","international-federation-of-robotics"],"name":"服务机器人","alt":"Service Robot","abbr":"","aliases":[],"one_liner":"为人或设备做有用工作的机器人，区别于工业机器人。","explanation":"按 ISO 8373:2021（IFR 统计沿用），服务机器人是为人或设备执行有用任务的机器人，工业自动化中的机器人单独归为工业机器人。IFR 又把它分成专业服务机器人（物流、清洁、医疗、农业、巡检、餐饮配送等）和个人/家用服务机器人（扫地机、陪伴、教育娱乐等）。它们大多工作在人多、变化大的环境，更依赖感知、导航和人机交互。具身智能公司做的人形和移动操作机器人，瞄准的家务、导览、零售等场景多属于这一类。","example":"餐厅送餐机器人、医院物流机器人和家用扫地机器人都属于服务机器人。","related":["工业机器人","扫地机器人","陪伴机器人","自主移动机器人","人机交互","国际机器人联合会"]},{"id":"robot-vacuum-cleaner","category":"robot","sec":3,"tier":3,"sources":[{"title":"Robotic vacuum cleaner (Wikipedia)","url":"https://en.wikipedia.org/wiki/Robotic_vacuum_cleaner"},{"title":"Electrolux Trilobite (Wikipedia)","url":"https://en.wikipedia.org/wiki/Electrolux_Trilobite"}],"as_of":"","related_ids":["service-robot","consumer-grade-robot","simultaneous-localization-and-mapping","coverage-path-planning","lidar","autonomous-docking-and-recharging"],"name":"扫地机器人","alt":"Robot Vacuum Cleaner","abbr":"","aliases":["扫地机","清洁机器人","Robot Vacuum"],"one_liner":"能自主移动清扫地面的家用机器人，最普及的消费级机器人。","explanation":"扫地机器人是一种在家里自己规划路线、边走边吸尘拖地的轮式服务机器人。第一款量产型号是伊莱克斯 2001 年的 Trilobite，真正走红的是 iRobot 2002 年的 Roomba，早期靠碰撞后随机转向。如今主流产品用激光雷达或视觉做 SLAM（边走边建地图并定位自己），按房间做覆盖路径规划，再用结构光或摄像头识别障碍物，基站可自动集尘、洗拖布。它是出货量最大的家用机器人，也常被拿来说明「机器人进家」的门槛：地图、避障、自主回充都已成熟，但真正动手整理物品仍很难，近年已有厂商开始给扫地机加机械臂。","example":"典型用法：扫地机先绕屋一圈用激光雷达建出户型图，用户在 App 里划禁区，之后它按房间顺序清扫并自动回充。","related":["服务机器人","消费级机器人","同步定位与建图","覆盖路径规划","激光雷达","自主回充"]},{"id":"companion-robot","category":"robot","sec":3,"tier":3,"sources":[{"title":"ElliQ - Wikipedia","url":"https://en.wikipedia.org/wiki/ElliQ"},{"title":"Exploring LOVOT robots as companions for older adults - PMC","url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC11811964/"}],"as_of":"","related_ids":["service-robot","human-robot-interaction","consumer-grade-robot","to-consumer","large-language-model","uncanny-valley"],"name":"陪伴机器人","alt":"Companion Robot","abbr":"","aliases":["情感陪伴机器人","社交陪伴机器人"],"one_liner":"以情感陪伴、聊天互动为主要功能的服务机器人，不以干活为目的。","explanation":"陪伴机器人是服务机器人里的一类，主要任务不是搬东西或做家务，而是陪人说话、回应情绪、提醒日程，常用于独居老人、儿童和宠物替代场景。典型代表有日本产业技术综合研究所的海豹形治疗机器人 Paro、Intuition Robotics 面向老人的桌面机器人 ElliQ、GROOVE X 的 LOVOT 等。它们通常不追求灵巧操作，而是把重点放在人机交互（语音、表情、触摸反馈）和长期关系维持上。大语言模型出现后，这类产品的对话能力明显提升，但能否真正缓解孤独、会不会造成情感依赖，仍是研究和伦理讨论的焦点。","example":"ElliQ 会主动问老人今天感觉如何，建议听音乐或和家人视频，用来减轻独居带来的孤独感。","related":["服务机器人","人机交互","消费级机器人","ToC","大语言模型","恐怖谷"]},{"id":"surgical-robot","category":"robot","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Robot-assisted surgery","url":"https://en.wikipedia.org/wiki/Robot-assisted_surgery"}],"as_of":"","related_ids":["da-vinci-surgical-system-da-vinci-research-kit","leader-follower-teleoperation","teleoperation","bilateral-teleoperation","special-purpose-robot","service-robot"],"name":"手术机器人","alt":"Surgical Robot","abbr":"","aliases":["外科手术机器人","Robot-assisted Surgery"],"one_liner":"帮医生做手术的机器人，多数是医生在操作台遥控机械臂","explanation":"手术机器人是辅助外科医生完成手术的机器人系统。主流是主从遥操作：医生坐在控制台看放大的三维内窥镜画面，操纵主手，病人旁的从动机械臂按比例、滤掉手抖后执行，把细长器械从小切口伸进体内。代表是美国 Intuitive Surgical 的达芬奇系统，2000 年获美国 FDA 批准用于腹腔镜手术；另有骨科、神经外科、血管介入等专科机型，国内也有多家厂商产品获批。它们目前几乎都不自主决策，但积累了大量遥操作数据，研究界用达芬奇研究套件（dVRK）探索自主缝合等任务。","example":"前列腺切除等泌尿外科手术是达芬奇系统用得最多的场景之一。","related":["达芬奇手术机器人 / dVRK","主从臂遥操作","遥操作","双边遥操作","特种机器人","服务机器人"]},{"id":"special-purpose-robot","category":"robot","sec":3,"tier":3,"sources":[{"title":"百度百科：特种机器人","url":"https://baike.baidu.com/item/特种机器人"}],"as_of":"","related_ids":["inspection-robot","quadruped-robot","dirty-dull-and-dangerous-jobs","unmanned-aerial-vehicle","teleoperation","service-robot"],"name":"特种机器人","alt":"Special-purpose Robot","abbr":"","aliases":["特种作业机器人"],"one_liner":"替人去危险或极端环境干活的机器人，如排爆、消防、巡检、水下","explanation":"特种机器人是国内常用的分类说法，与工业机器人、服务机器人并列，指在危险、极端或人难以进入的环境里执行专门任务的机器人。常见的有排爆机器人、消防机器人、电力和管廊巡检机器人、核电站检修机器人、矿山和隧道机器人、水下机器人、太空机器人等，军警和应急救援也是主要用户。它们通常要求防爆、防水、耐高温或抗辐射，很多仍以遥操作为主、局部自主。四足机器人近几年在巡检、消防、救援里用得越来越多，是具身智能落地较早的方向之一。","example":"变电站里让四足机器人按路线巡检、读表计、测温，替代人工夜间巡查。","related":["巡检机器人","四足机器人","3D 工作（脏、累、险）","无人机（空中机器人）","遥操作","服务机器人"]},{"id":"inspection-robot","category":"robot","sec":3,"tier":3,"sources":[{"title":"2025年中国变电站设备巡检机器人行业市场现状及趋势研判_智研咨询","url":"https://www.chyxx.com/industry/1215922.html"}],"as_of":"2026-05","related_ids":["special-purpose-robot","quadruped-robot","autonomous-mobile-robot","real-world-deployment","thermal-camera","deep-robotics"],"name":"巡检机器人","alt":"Inspection Robot","abbr":"","aliases":["智能巡检机器人","巡视机器人"],"one_liner":"代替人在变电站、隧道、机房等场所定期巡查设备状态的机器人。","explanation":"巡检机器人是一类特种机器人，按预定路线或自主导航到各个点位，用可见光相机读表计、用红外热像仪测温、用气体或声音传感器查泄漏和异响，发现异常就报警。按移动方式可分为轮式、履带式、轨道式（挂在机房顶上的导轨上）、四足和无人机几类；轮式最成熟，四足适合碎石、台阶等复杂地面。电力行业用得最早最多，国内厂商有亿嘉和、国网智能、申昊科技等。它是具身机器人较早真正落地、能算清投资回报的场景之一，近年开始接入视觉大模型做缺陷识别。","example":"变电站里的轮式巡检机器人每天定时绕场一圈，读取油位表和开关状态，并用红外热像仪找出发热的接头。","related":["特种机器人","四足机器人","自主移动机器人","场景落地","热成像相机（红外热像仪）","云深处科技"]},{"id":"unmanned-aerial-vehicle","category":"robot","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Unmanned aerial vehicle","url":"https://en.wikipedia.org/wiki/Unmanned_aerial_vehicle"}],"as_of":"","related_ids":["aerial-manipulation","aerial-vision-and-language-navigation","px4-ardupilot","dji","swarm-intelligence","motion-planning"],"name":"无人机（空中机器人）","alt":"UAV / Aerial Robot (Drone)","abbr":"UAV","aliases":["无人机","空中机器人","Drone"],"one_liner":"机上没有飞行员、靠遥控或自主飞行的飞行器，是会飞的机器人","explanation":"无人机（UAV，Unmanned Aerial Vehicle）指机上没有飞行员的飞行器，可以遥控，也可以自主飞行。常见形态有多旋翼（四旋翼等，能垂直起降和悬停，最常见）、固定翼（航程长、续航久）和直升机式。在机器人学里，它被当作「空中机器人」：同样要做状态估计、建图、路径规划和控制，只是运动发生在三维空间、对重量和能耗特别敏感。和具身智能相关的方向包括空中视觉语言导航（听指令飞到目标）、带机械臂的空中操作、多机集群协作。开源飞控 PX4、ArduPilot 是研究常用的软件基础，消费级市场以大疆为代表。","example":"给四旋翼无人机一句「飞到红色屋顶的房子上方」，它根据相机画面自主规划航线飞过去，这就是空中视觉语言导航。","related":["空中操作","空中视觉语言导航（无人机 VLN）","PX4 / ArduPilot","大疆创新","群体智能","运动规划"]},{"id":"bio-inspired-robot","category":"robot","sec":3,"tier":3,"sources":[{"title":"Bio-inspired robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Bio-inspired_robotics"}],"as_of":"","related_ids":["quadruped-robot","soft-robot","artificial-muscle","legged-robot","morphological-computation","humanoid-robot"],"name":"仿生机器人","alt":"Bio-inspired Robot","abbr":"","aliases":["Bionic Robot","仿生学机器人"],"one_liner":"借鉴动物身体结构或运动方式来设计的机器人。","explanation":"仿生机器人不是某一种形态，而是一种设计思路：从动物身上学结构、运动或感知原理，再做成工程上更简单可用的机械。学界常区分「照着抄」（仿生模仿）和「学原理再简化」（仿生启发）。常见对象包括四足动物的步态、蛇的蠕动、壁虎脚掌的吸附、章鱼触手的柔软抓握、昆虫和蝙蝠的扑翼飞行等。典型例子有 MIT 的 Cheetah 四足、壁虎机器人 Stickybot、CMU 的蛇形机器人和 Festo 的各类仿生样机。人形机器人和四足机器人广义上也属于仿生，软体机器人和人工肌肉则是仿生在材料与驱动上的延伸。","example":"MIT Sangbae Kim 组仿照猎豹设计的 Cheetah 系列四足机器人。","related":["四足机器人","软体机器人","人工肌肉","足式机器人","形态计算","人形机器人"]},{"id":"soft-robot","category":"robot","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Soft robotics","url":"https://en.wikipedia.org/wiki/Soft_robotics"}],"as_of":"","related_ids":["soft-gripper","pneumatic-actuation","artificial-muscle","compliance","deformable-body-simulation","bio-inspired-robot"],"name":"软体机器人","alt":"Soft Robot","abbr":"","aliases":["Soft Robotics"],"one_liner":"用硅胶等柔软材料做身体、能大幅变形的机器人","explanation":"软体机器人是用硅胶、弹性体等柔软材料做主体的机器人，身体可以连续弯曲、伸缩，而不是靠刚性连杆加关节运动。驱动方式常见的有气动（往腔体里充气让它弯曲）、腱绳拉动、形状记忆合金和介电弹性体等人工肌肉。它的好处是天然柔顺，碰到人或易碎物体不容易伤害，能包裹形状不规则的东西；难点是变形自由度近乎无限，建模、仿真和精确控制都比刚性机器人难。目前最成熟的落地是软体夹爪，用于抓水果、食品等。","example":"2016 年哈佛大学发布的 Octobot 是一只全软材料、无电子元件的章鱼形机器人，靠化学反应产气驱动。","related":["软体夹爪","气动驱动","人工肌肉","柔顺性","软体仿真","仿生机器人"]},{"id":"franka-emika-panda-franka-research-3","category":"robot","sec":4,"tier":1,"sources":[{"title":"Franka Research 3 (franka.de)","url":"https://franka.de/franka-research-3"},{"title":"Agile Robots acquires Franka Emika - The Robot Report","url":"https://www.therobotreport.com/agile-robots-acquires-franka-emika/"}],"as_of":"2025-03","related_ids":["7-dof-robot-arm","joint-torque-sensor","libfranka-franka-control-interface","droid","collaborative-robot","agile-robots"],"name":"Franka 机械臂（Panda / FR3）","alt":"Franka Emika Panda / Franka Research 3","abbr":"FR3","aliases":["Franka","Franka Panda","Panda 机械臂","Franka Research 3","Franka Emika Panda","Franka Emika"],"one_liner":"德国 Franka 的 7 自由度力控机械臂，科研最常用的单臂之一","explanation":"Franka 机械臂由德国慕尼黑的 Franka Emika 公司研发，早期型号叫 Panda，后继科研版是 Franka Research 3（FR3）。它有 7 个自由度（比定位末端所需的 6 个多一个，更灵活），7 个关节都装了力矩传感器，能做柔顺的力控；负载 3 公斤，臂展 855 毫米，重复定位精度 ±0.1 毫米，通过 FCI 接口以 1 kHz 实时控制。公司 2023 年申请破产后被思灵机器人（Agile Robots）收购，改名 Franka Robotics。因为力控好、开放接口全，DROID、Open X-Embodiment 等大量机器人学习数据集都用它采集。","example":"DROID 数据集用 Franka Panda 在几百个真实场景里采集了大规模操作数据。","related":["七自由度机械臂","关节力矩传感器","libfranka","DROID 数据集","协作机器人","思灵机器人"]},{"id":"universal-robots-ur5e","category":"robot","sec":4,"tier":2,"sources":[{"title":"UR5e 技术规格表（Universal Robots）","url":"https://www.universal-robots.com/manuals/EN/TechSheets/UR5e_techsheet_pdf_online/UR5e_techsheet_en.pdf"},{"title":"Universal Robots launches e-Series collaborative robots","url":"https://www.universal-robots.com/about-universal-robots/news-centre/universal-robots-launches-e-series-setting-a-new-standard-for-collaborative-automation-platforms/"}],"as_of":"2023-08","related_ids":[null,null,null,null,null,null],"name":"UR5e 协作机械臂","alt":"Universal Robots UR5e","abbr":"","aliases":["UR5e","UR5","优傲 UR5e"],"one_liner":"优傲机器人的 6 轴协作机械臂，负载 5 kg，科研和工厂都很常见","explanation":"UR5e 是丹麦优傲机器人（Universal Robots）2018 年 6 月推出的 e 系列协作机械臂（能和人在同一空间安全工作的机械臂），是早年 UR5 的升级版。它有 6 个转动关节，负载 5 kg、臂展 850 mm、重复定位精度 ±0.03 mm，末端内置六维力传感器，配触屏示教器编程。因为稳定、接口开放（RTDE 可实时读写关节状态），它是机器人学习实验室的常用硬件之一，很多真机数据集和 VLA 论文都用过它。","example":"π0 的训练数据里就包含单臂 UR5e 和双臂 UR5e 平台采集的操作数据。","related":["优傲机器人(Universal Robots)","协作机器人(Collaborative Robot)","六轴机械臂(6-Axis Robot Arm)","RTDE(Real-Time Data Exchange (Universal Robots))","六维力传感器(Six-Axis Force/Torque Sensor)","Franka 机械臂（Panda / FR3）(Franka Emika Panda / Franka Research 3)"]},{"id":"trossen-robotics-widowx-250","category":"robot","sec":4,"tier":2,"sources":[{"title":"Trossen Robotics: WidowX 250 S","url":"https://www.trossenrobotics.com/widowx-250"},{"title":"Interbotix 文档：WidowX-250 6DOF","url":"https://docs.trossenrobotics.com/interbotix_xsarms_docs/specifications/wx250s.html"}],"as_of":"","related_ids":["bridgedata-v2","trossen-robotics-viperx-300","aloha","trossen-robotics","robotis-dynamixel-servo","simplerenv"],"name":"WidowX 250 机械臂","alt":"Trossen Robotics WidowX 250","abbr":"","aliases":["WidowX","WidowX 250 S","WX250s"],"one_liner":"Trossen Robotics 的低成本 6 自由度科研机械臂，BridgeData 常用平台。","explanation":"WidowX 250 是美国 Trossen Robotics 的 Interbotix X 系列桌面机械臂，用 ROBOTIS 的 Dynamixel X 系列舵机驱动。6 自由度版（250 S）臂展约 650 mm，额定负载 250 g，价格远低于工业机械臂，支持 ROS。它在机器人学习圈很常见：伯克利的 BridgeData V2 数据集就是用 WidowX 250 采的，Open X-Embodiment、Octo、OpenVLA 都含这部分数据，SimplerEnv 里也有对应的 WidowX 评测场景；ALOHA 双臂平台的主臂同样用 WidowX。缺点是负载小、精度一般。","example":"OpenVLA 论文在 WidowX 250 上做 BridgeData 场景的真机评测。","related":["BridgeData V2 数据集","ViperX 300 机械臂","ALOHA 双臂平台","Trossen Robotics","Dynamixel 舵机","SimplerEnv"]},{"id":"trossen-robotics-viperx-300","category":"robot","sec":4,"tier":3,"sources":[{"title":"Trossen Robotics: ViperX 300 S","url":"https://www.trossenrobotics.com/viperx-300"}],"as_of":"2026-09","related_ids":["aloha","trossen-robotics-widowx-250","trossen-robotics","robotis-dynamixel-servo","action-chunking-with-transformers","leader-follower-teleoperation"],"name":"ViperX 300 机械臂","alt":"Trossen Robotics ViperX 300","abbr":"","aliases":["ViperX","ViperX 300 S","ViperX 300 6DOF"],"one_liner":"Trossen 的低成本科研机械臂，原版 ALOHA 用它做执行臂","explanation":"ViperX 300 是美国 Trossen Robotics（Interbotix X 系列）出的科研教育用小型机械臂，由 Dynamixel 舵机驱动。官网列出的 300 S 版本为 6 自由度，臂展 750 毫米，负载 750 克（约为同门 WidowX 250 的三倍），重复定位精度 1 毫米。它便宜、能用 ROS 直接控制，是很多模仿学习工作的硬件底座：2023 年斯坦福的 ALOHA 双臂遥操作系统就用两台 ViperX 300 做执行臂（follower）、两台 WidowX 250 做示教臂（leader），ACT 算法最早就在这套硬件上验证。官网显示标准版 300 S 已停产，另有专门的 ALOHA 版本。","example":"ALOHA 平台上，操作员拖动 WidowX 示教臂，两台 ViperX 300 同步复现动作，完成穿扎带、装电池等精细任务。","related":["ALOHA 双臂平台","WidowX 250 机械臂","Trossen Robotics","Dynamixel 舵机","ACT","主从臂遥操作"]},{"id":"so-100-so-101-arm","category":"robot","sec":4,"tier":2,"sources":[{"title":"GitHub: TheRobotStudio/SO-ARM100","url":"https://github.com/TheRobotStudio/SO-ARM100"},{"title":"CNX Software: SO-ARM101 open-source dual robotic arm kit","url":"https://www.cnx-software.com/2025/05/02/so-arm101-open-source-dual-robotic-arm-kit-works-with-hugging-faces-lerobot/"}],"as_of":"2025-05","related_ids":["lerobot","leader-follower-teleoperation","feetech-sts3215-servo","action-chunking-with-transformers","smolvla","desktop-robot-arm"],"name":"SO-100 / SO-101 机械臂","alt":"SO-100 / SO-101 Arm (LeRobot)","abbr":"","aliases":["SO-100","SO-101","SO-ARM100","SO-ARM101"],"one_liner":"配合 Hugging Face LeRobot 使用的百元级开源 3D 打印机械臂。","explanation":"SO-100 是 TheRobotStudio 与 Hugging Face 合作设计的开源桌面机械臂，结构件用 3D 打印，每条臂用 6 个飞特 STS3215 串口舵机（5 个关节加 1 个夹爪），一主一从两条臂组成主从遥操作：人掰动主臂，从臂跟随并记录数据。SO-101 是 2025 年的改进版，走线更好、组装不用拆舵机齿轮、主臂换了不同减速比的舵机。官方 BOM 显示一套双臂零件约 230 美元。它直接接入 LeRobot 库，能采数据、训练 ACT、SmolVLA 等策略，是入门者动手做模仿学习最便宜的路径之一。","example":"用 SO-101 主从臂采 50 条「把积木放进盒子」的演示，再用 LeRobot 训练 ACT 策略让从臂自主完成。","related":["LeRobot","主从臂遥操作","飞特 STS3215 舵机","ACT","SmolVLA","桌面机械臂"]},{"id":"koch-v1-1-arm","category":"robot","sec":4,"tier":3,"sources":[{"title":"Koch v1.1 - LeRobot Documentation (Hugging Face)","url":"https://huggingface.co/docs/lerobot/koch"},{"title":"Koch v1.1 Low-Cost Robot Arm: Follower - ROBOTIS","url":"https://www.robotis.us/koch-v1-1-low-cost-robot-arm-follower/"}],"as_of":"2025","related_ids":["lerobot","so-100-so-101-arm","leader-follower-teleoperation","robotis-dynamixel-servo","action-chunking-with-transformers","desktop-robot-arm"],"name":"Koch v1.1 机械臂","alt":"Koch v1.1 Arm","abbr":"","aliases":["Koch 机械臂","Koch v1.1"],"one_liner":"用 Dynamixel 舵机和 3D 打印件搭的开源低成本主从机械臂。","explanation":"Koch 机械臂最初由 Tau Robotics 的 Alexander Koch 设计，Hugging Face 工程师改成更易组装的 v1.1 版。它有 6 个自由度（5 个关节加夹爪），结构件靠 3D 打印，关节用 ROBOTIS 的 Dynamixel XL430、XL330 舵机，USB 串口通信。一套分主臂（leader）和从臂（follower）：人手拨动主臂，从臂同步跟随，边做边录数据，再用 ACT 等算法训练模仿学习策略。据经销商介绍单臂约 400 美元可搭成。它是 LeRobot 早期教程主推的硬件，后来更便宜的 SO-100/SO-101 成为主流。","example":"按 LeRobot 教程搭一对 Koch 臂，录 50 条「把积木放进盒子」的演示，再训练一个 ACT 策略。","related":["LeRobot","SO-100 / SO-101 机械臂","主从臂遥操作","Dynamixel 舵机","ACT","桌面机械臂"]},{"id":"kinova-gen3","category":"robot","sec":4,"tier":3,"sources":[{"title":"Discover our Gen3 robotic arm - Kinova","url":"https://www.kinovarobotics.com/product/gen3-robots"},{"title":"Kinova Gen3 Specifications - QVIRO","url":"https://qviro.com/product/kinova/gen3/specifications"}],"as_of":"","related_ids":["robotic-arm","7-dof-robot-arm","collaborative-robot","joint-torque-sensor","franka-emika-panda-franka-research-3","universal-robots-ur5e"],"name":"Kinova Gen3","alt":"Kinova Gen3","abbr":"","aliases":["Gen3","Kinova Gen3 机械臂"],"one_liner":"加拿大 Kinova 公司的超轻量 7 自由度科研机械臂。","explanation":"Kinova Gen3 是加拿大 Kinova 公司的轻量机械臂，有 7 自由度和 6 自由度两个版本。7 自由度版自重约 8.2 kg、最大臂展约 902 mm、连续负载约 4 kg，功耗很低，所有关节可无限旋转，关节内集成力矩传感器，底层控制频率 1 kHz，可选配腕部 2D/3D 视觉模块。Kinova 早年做轮椅辅助机械臂，Gen3 延续了轻便、易装在移动平台上的特点，接口开放（支持 ROS 和底层力矩控制），在高校操作、人机交互和强化学习研究里很常见，常被拿来和 Franka、UR5e 对比。","example":"研究者把 Kinova Gen3 装在移动底盘上做开门、取物等移动操作实验。","related":["机械臂","七自由度机械臂","协作机器人","关节力矩传感器","Franka 机械臂（Panda / FR3）","UR5e 协作机械臂"]},{"id":"kuka-lbr-iiwa","category":"robot","sec":4,"tier":3,"sources":[{"title":"LBR iiwa | KUKA Global","url":"https://www.kuka.com/en-us/products/robotics-systems/industrial-robots/lbr-iiwa"},{"title":"KUKA LBR iiwa cobot review - Standard Bots","url":"https://standardbots.com/blog/iiwa"}],"as_of":"","related_ids":["collaborative-robot","7-dof-robot-arm","joint-torque-sensor","impedance-control","kuka","contact-rich-manipulation"],"name":"库卡 LBR iiwa","alt":"KUKA LBR iiwa","abbr":"","aliases":["iiwa","LBR iiwa 7 R800","LBR iiwa 14 R820"],"one_liner":"库卡的 7 轴灵敏型协作机械臂，每个关节都带力矩传感器。","explanation":"LBR iiwa 是德国库卡（KUKA）的协作机械臂，LBR 意为轻型机器人，iiwa 是「智能工业工作助手」的缩写，技术源自德国宇航中心（DLR）的轻型机器人研究。它有 7 个轴，每个轴都装了关节力矩传感器，能感知外力、碰到人立即降力降速，也能做阻抗控制和拖动示教。有两个型号：iiwa 7 R800 负载 7 kg、臂展 800 mm；iiwa 14 R820 负载 14 kg、臂展 820 mm。它在接触丰富操作、力控和人机协作研究里用得很多，是这类研究的经典平台。","example":"研究者用 iiwa 的笛卡尔阻抗模式做轴孔装配，让机械臂在插入时顺着接触力自动微调位置。","related":["协作机器人","七自由度机械臂","关节力矩传感器","阻抗控制","库卡","接触丰富操作"]},{"id":"flexiv-rizon","category":"robot","sec":4,"tier":3,"sources":[{"title":"Flexiv Rizon - The Adaptive 7-Axis Robot Arm with Force Control","url":"https://www.flexiv.us/products/rizon"},{"title":"Rizon 4 | World's First 7-axis Adaptive Robot - A3","url":"https://www.automate.org/products/flexiv-robotics/rizon"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"非夕 拂晓 Rizon","alt":"Flexiv Rizon","abbr":"","aliases":["Rizon 4","拂晓","Rizon 4s"],"one_liner":"非夕科技的七轴力控机械臂，关节带力矩传感，擅长精细接触作业。","explanation":"拂晓（Rizon）是非夕科技（Flexiv）推出的七轴「自适应」机械臂系列，最常见的 Rizon 4 负载 4 kg、臂展约 780 mm。它的特点是全身力感知：每个关节都有力矩传感，配合高精度力控算法，可以感知到约 0.1 N 的力，做力位混合控制（一部分方向控位置、一部分方向控力）和多点碰撞检测；带「s」的型号在末端另加六维力传感器。和普通只控位置的工业臂相比，它适合打磨、插装、装配这类需要「手感」的接触作业。在具身智能研究里，它常被用来做接触丰富操作和力觉策略学习的实验平台。","example":"用 Rizon 4 做轴孔装配：先靠视觉把轴对到孔附近，再用阻抗控制边感受接触力边把轴推入。","related":["非夕科技(Flexiv Robotics)","七自由度机械臂(7-DoF Robot Arm)","力控(Force Control)","关节力矩传感器(Joint Torque Sensor)","接触丰富操作(Contact-rich Manipulation)","力位混合控制(Hybrid Force/Position Control)"]},{"id":"ufactory-xarm","category":"robot","sec":4,"tier":3,"sources":[{"title":"UFACTORY xArm 协作机械臂","url":"https://www.ufactory.cc/xarm-collaborative-robot/"}],"as_of":"2026-09","related_ids":["collaborative-robot","6-axis-robot-arm","7-dof-robot-arm","strain-wave-gear","gello","franka-emika-panda-franka-research-3"],"name":"xArm 机械臂","alt":"UFACTORY xArm","abbr":"","aliases":["xArm6","xArm7","xArm5","Lite 6","xArm 850"],"one_liner":"深圳UFACTORY出的平价协作机械臂系列，科研实验室常见","explanation":"xArm 是深圳 UFACTORY（众为创造）推出的轻型协作机械臂系列，用谐波减速器和伺服电机做关节，带碰撞检测，价格比 Franka、UR 等进口臂低不少。官网参数：xArm 5/6/7 分别为 5、6、7 自由度，臂展都是 700 毫米，负载 3/5/3.5 公斤，重复定位精度 ±0.1 毫米，三款官网标价均约 5300 美元起；入门款 Lite 6 负载 600 克、臂展 440 毫米；xArm 850 臂展 850 毫米、负载 5 公斤。因为有 Python SDK 和 ROS 支持、便宜耐用，它常被高校实验室用来做模仿学习和遥操作数据采集，GELLO 等开源遥操作项目也提供了 xArm 版本。","example":"实验室用 GELLO 主手遥操作一台 xArm 7 采集叠毛巾演示，再训练扩散策略复现。","related":["协作机器人","六轴机械臂","七自由度机械臂","谐波减速器","GELLO","Franka 机械臂（Panda / FR3）"]},{"id":"rethink-robotics-baxter","category":"robot","sec":4,"tier":3,"sources":[{"title":"Rethink Robotics launches Baxter the Robot (Robohub)","url":"https://robohub.org/rethink-robotics-launches-baxter-the-robot/"},{"title":"Rethink Robotics, Pioneer of Collaborative Robots, Shuts Down (IEEE Spectrum)","url":"https://spectrum.ieee.org/automaton/robotics/industrial-robots/rethink-robotics-pioneer-of-collaborative-robots-shuts-down"}],"as_of":"2018-10","related_ids":["rethink-robotics","rethink-robotics-sawyer","collaborative-robot","dual-arm-robot","series-elastic-actuator","kinesthetic-teaching"],"name":"Baxter 双臂机器人","alt":"Rethink Robotics Baxter","abbr":"","aliases":["Baxter"],"one_liner":"Rethink Robotics 2012 年推出的低价双臂协作机器人，带屏幕「脸」。","explanation":"Baxter 是 iRobot 联合创始人 Rodney Brooks 创办的 Rethink Robotics 在 2012 年推出的双臂机器人，售价约 2.2 万美元，远低于当时的工业机器人。它有两条 7 自由度手臂，关节用串联弹性驱动器（电机和负载之间加弹簧，碰到人会「软」一些），头部是一块显示表情的屏幕，工人可以直接拽着手臂拖动示教，不用写程序。它是协作机器人概念的早期代表，也因为有研究版而成为 2010 年代机器人学习实验室的常用平台。商业上销量不及预期，Rethink 于 2018 年关闭，Baxter 停产。","example":"RoboNet 数据集里就收录了 Baxter 采集的推动物体视频数据，用来训练视频预测模型。","related":["Rethink Robotics","Sawyer 机械臂","协作机器人","双臂机器人","串联弹性驱动器","拖动示教"]},{"id":"rethink-robotics-sawyer","category":"robot","sec":4,"tier":3,"sources":[{"title":"Inside HAHN Group's plan to revive Rethink Robotics (The Robot Report)","url":"https://www.therobotreport.com/hahn-group-rethink-robotics-sawyer-cobot/"},{"title":"Sawyer - ROBOTS: Your Guide to the World of Robotics","url":"https://robotsguide.com/robots/sawyer"}],"as_of":"2018-10","related_ids":["rethink-robotics","rethink-robotics-baxter","collaborative-robot","7-dof-robot-arm","meta-world","robonet"],"name":"Sawyer 机械臂","alt":"Rethink Robotics Sawyer","abbr":"","aliases":["Sawyer"],"one_liner":"Rethink Robotics 2015 年推出的单臂 7 自由度协作机械臂。","explanation":"Sawyer 是 Rethink Robotics 继 Baxter 之后在 2015 年推出的单臂协作机器人，7 个自由度、负载 4 公斤，比 Baxter 更小、更快、更精确，同样带显示屏头部和 Intera 图形化编程软件，支持拖动示教。2018 年 Rethink 关闭后，德国 HAHN 集团收购了 Sawyer 和 Intera 的知识产权与商标并继续改进销售。在机器人学习领域，Sawyer 是 2010 年代后期伯克利、斯坦福等实验室的常用手臂，出现在 RoboNet、Meta-World（仿真里用的就是 Sawyer 模型）等数据集和基准中。","example":"Meta-World 基准的 50 个操作任务（开抽屉、按按钮等）都是在仿真版 Sawyer 手臂上定义的。","related":["Rethink Robotics","Baxter 双臂机器人","协作机器人","七自由度机械臂","Meta-World","RoboNet 数据集"]},{"id":"abb-yumi","category":"robot","sec":4,"tier":3,"sources":[{"title":"IRB 14000 YuMi Dual Arm（ABB 官方）","url":"https://one.robotics.abb.com/en/robots/p/IRB-14000-YuMi-Dual-Arm"}],"as_of":"2015","related_ids":[null,null,null,null,null,null],"name":"ABB YuMi 双臂协作机器人","alt":"ABB YuMi","abbr":"","aliases":["YuMi","IRB 14000","IRB 14050（单臂 YuMi）"],"one_liner":"ABB 2015 年推出的双臂协作机器人，专做小零件精细装配","explanation":"YuMi（型号 IRB 14000）是 ABB 在 2015 年推出的双臂协作机器人，名字取自英文 you and me，强调人机并肩工作。它在一个紧凑躯干上装两条 7 轴机械臂，每臂负载 0.5 kg、工作半径约 0.56 米、重复定位精度约 0.02 mm，外壳带软垫、力量受限，可以不加围栏和工人同台作业。它主要用于电子、小件装配等需要双手配合的精细工序，后来还推出单臂版 IRB 14050。YuMi 也是较早被研究界用来做双臂操作实验的商业平台。","example":"在电子产品产线上，YuMi 一只手扶住手机外壳，另一只手把小零件压进卡槽。","related":["ABB(ABB Robotics)","协作机器人(Collaborative Robot)","双臂机器人(Dual-arm (Bimanual) Robot)","七自由度机械臂(7-DoF Robot Arm)","装配(Robotic Assembly)","人机协作(Human-Robot Collaboration)"]},{"id":"agilex-piper","category":"robot","sec":4,"tier":3,"sources":[{"title":"AgileX 官网：PiPER","url":"https://global.agilex.ai/products/piper"},{"title":"Generation Robots：6-Axis Robotic Arm PiPER","url":"https://www.generationrobots.com/en/404258-6-axis-robotic-arm-piper.html"},{"title":"TechEBlog：AgileX PiPER Robotic Arm Costs $2,499","url":"https://www.techeblog.com/agilex-piper-robotic-arm-human-precision/"}],"as_of":"2026-09","related_ids":["agilex-robotics","6-axis-robot-arm","desktop-robot-arm","agilex-cobot-magic","pose-repeatability","leader-follower-teleoperation"],"name":"松灵 PiPER 机械臂","alt":"AgileX PiPER","abbr":"","aliases":["PiPER","PiPER-X"],"one_liner":"松灵出的轻量低价六轴机械臂，科研和数采常用","explanation":"PiPER 是松灵机器人（AgileX）推出的轻量六自由度机械臂。公开参数：自重 4.2 kg，负载 1.5 kg，臂展 626 mm，重复定位精度 0.1 mm，支持 Python SDK、ROS1 和 ROS2。它价格低（据报道海外售价约 2,499 美元起），重量轻，适合放在移动底盘上或成对组成双臂系统，因此在具身智能的科研和数据采集里用得多，松灵自己的 Cobot Magic 双臂平台就用它做主从臂。它的精度和负载不如工业协作臂，更适合实验室和教学。","example":"把两台 PiPER 装在桌面两侧，配主臂做双臂遥操作采数据。","related":["松灵机器人","六轴机械臂","桌面机械臂","松灵 Cobot Magic","重复定位精度","主从臂遥操作"]},{"id":"arx-x5-r5-arm","category":"robot","sec":4,"tier":3,"sources":[{"title":"方舟无限新品发布（机器人大讲堂）","url":"https://www.leaderobot.com/news/4422"},{"title":"real-stanford/arx5-sdk","url":"https://github.com/real-stanford/arx5-sdk"}],"as_of":"2026-09","related_ids":["robotic-arm","6-axis-robot-arm","agilex-piper","umi-on-legs","leader-follower-teleoperation","desktop-robot-arm"],"name":"方舟无限 ARX X5 / R5 机械臂","alt":"ARX X5 / R5 Arm","abbr":"","aliases":["ARX 机械臂","ARX5"],"one_liner":"北京方舟无限出的轻量六轴力控机械臂，科研圈做模仿学习常用。","explanation":"方舟无限（ARX）2023 年在北京成立，X5（早期也叫 ARX5）是它的六自由度超轻型力控机械臂：连夹爪自重约 3.3 kg，额定负载约 2 kg，据报道首发定价约 6 万元/台；R5 是后续同为六自由度的型号；另有更便宜的 L5 系列（据报道约 2.98 万元/台）。它的卖点是轻、便宜、各关节可做力控，适合装在移动底盘或四足上，也方便搭双臂遥操作平台。斯坦福 REAL 实验室开源了 arx5-sdk（C++/Python 控制接口），UMI on Legs、UVA 等研究都用它做实验，因此在具身数据采集和策略复现里出镜率很高。","example":"UMI on Legs 把 ARX5 机械臂装在宇树四足背上，用手持夹爪采来的数据训练移动操作策略。","related":["机械臂","六轴机械臂","松灵 PiPER 机械臂","UMI on Legs","主从臂遥操作","桌面机械臂"]},{"id":"realman-rm-series-arm","category":"robot","sec":4,"tier":3,"sources":[{"title":"睿尔曼智能 | RM65","url":"https://www.realman-robotics.cn/cn/products/rm65.html"},{"title":"本体参数：RM75 系列参数及 D-H 模型（睿尔曼开发者文档）","url":"https://develop.realman-robotics.com/robot/robotParameter/RM75OntologyParameters/"}],"as_of":"2026-09","related_ids":["realman-robotics","collaborative-robot","6-axis-robot-arm","7-dof-robot-arm","payload-to-weight-ratio","mobile-manipulator"],"name":"睿尔曼 RM 系列机械臂","alt":"RealMan RM Series Arm","abbr":"","aliases":["RM65","RM75"],"one_liner":"睿尔曼智能的超轻量仿人机械臂，控制器集成在臂内。","explanation":"RM 系列是北京睿尔曼智能（RealMan）做的轻量协作机械臂，官方称「超轻量仿人机械臂」，主力型号是 6 轴的 RM65 和 7 轴的 RM75。以 B 型为例，RM65-B 自重约 7.2 公斤、额定负载 5 公斤、工作半径约 610 毫米；RM75-B 自重约 7.8 公斤、额定负载 5 公斤，重复定位精度 ±0.05 毫米。特点是控制器集成在本体里、可用 24V 直流供电，负载自重比高，所以容易装到移动底盘、轮式人形或双臂平台上，国内不少具身智能公司和高校的双臂/复合机器人用它做手臂。","example":"把两台 RM75 装在升降柱和移动底盘上，就能拼成一台双臂复合机器人，用来采集遥操作数据。","related":["睿尔曼智能","协作机器人","六轴机械臂","七自由度机械臂","负载自重比","复合机器人"]},{"id":"i2rt-yam-arm","category":"robot","sec":4,"tier":3,"sources":[{"title":"YAM Arm Series | I2RT Robotics","url":"https://doc.i2rt.com/products/yam"},{"title":"YAM Pro – I2RT Robotics","url":"https://i2rt.com/products/yam-pro-6-dof-arm-copy"}],"as_of":"2026-09","related_ids":["robotic-arm","dual-arm-robot","leader-follower-teleoperation","molmoact2-bimanualyam","desktop-robot-arm"],"name":"I2RT YAM 机械臂","alt":"I2RT YAM Arm","abbr":"","aliases":["YAM","YAM 机械臂"],"one_liner":"I2RT 公司推出的低成本 6 自由度科研机械臂，常用于双臂数据采集。","explanation":"YAM 是美国初创公司 I2RT Robotics 做的 6 自由度机械臂，走 CAN 总线，面向具身智能科研和数据采集。官方分 Standard、Pro、Ultra 和负载更大的 BIG YAM 几档，以 Pro 为例额定负载约 3 kg、工作范围约 750 mm，末端配平行夹爪（开合约 95 mm）。价格在几千美元级（官网标价约 3000–5000 美元，Pro 为 3499 美元），比 Franka 这类传统科研臂便宜一个数量级，又比 SO-101 这种舵机臂结实，因此常被两两组成双臂平台，配主从臂遥操作采集演示数据。Ai2 发布的 BimanualYAM 双臂数据集就是用它采的。","example":"Ai2 用两台 YAM 组成双臂平台，采集了 MolmoAct2-BimanualYAM 数据集。","related":["机械臂","双臂机器人","主从臂遥操作","BimanualYAM 数据集","桌面机械臂"]},{"id":"openarm","category":"robot","sec":4,"tier":3,"sources":[{"title":"OpenArm Project Overview","url":"https://docs.openarm.dev/"},{"title":"enactic/openarm - GitHub","url":"https://github.com/enactic/openarm"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"OpenArm","alt":"Enactic OpenArm","abbr":"","aliases":["OpenArm 2.0"],"one_liner":"Enactic 维护的开源七自由度人形机械臂，面向接触丰富任务的数据采集与研究。","explanation":"OpenArm 是由 Enactic 公司制造并维护的开源人形机械臂项目，硬件 CAD、固件、控制软件和仿真模型全部公开。每条臂 7 个自由度，比例按身高约 160–165 cm 的人设计，用可反驱的准直驱关节（电机能被外力推动，碰撞时更安全），走 CAN-FD 总线，官方给出负载额定 4.1 kg、峰值 6.0 kg。项目配套一条无电机、运动学与本体一致的主臂，用于主从遥操作和带力反馈的双边遥操作。据其 GitHub 说明，完整双臂系统约 6500 美元。它的定位是给做模仿学习、VLA 数据采集的实验室一个比工业协作臂便宜、又比舵机小臂更能出力的开源双臂平台。截至 2026-09 官方文档当前版本为 2.0。","example":"实验室搭两套 OpenArm 双臂，用配套主臂遥操作采集叠衣服演示数据，再训练扩散策略回放到从臂上执行。","related":["开源硬件(Open-source Hardware)","七自由度机械臂(7-DoF Robot Arm)","双臂机器人(Dual-arm (Bimanual) Robot)","主从臂遥操作(Leader-Follower Teleoperation)","准直驱(Quasi-Direct Drive)","接触丰富操作(Contact-rich Manipulation)"]},{"id":"dobot-magician","category":"robot","sec":4,"tier":3,"sources":[{"title":"Dobot Magician Specifications (RobotLAB PDF)","url":"https://www.robotlab.com/hubfs/Dobot/Dobot%20Magician%20Specifications.pdf?t=1515807244104"},{"title":"Dobot Magician 4-Axis Robotic Arm - Rapid Electronics","url":"https://www.rapidonline.com/dobot-magician-4-axis-robotic-arm-for-education-and-research-70-0480"}],"as_of":"2026-09","related_ids":[null,null,null,null,null],"name":"越疆 Dobot Magician","alt":"Dobot Magician","abbr":"","aliases":["Dobot 魔术师"],"one_liner":"越疆出的四轴桌面机械臂，主打教育和入门实验。","explanation":"Dobot Magician 是深圳越疆科技推出的桌面级机械臂，4 个轴（自由度，即能独立转动的关节数），官方参数为最大负载 500 g、最大工作半径 320 mm、重复定位精度约 0.2 mm，本体约 4 kg。它随机附带夹爪、吸盘和笔等多种末端执行器（装在手臂末端干活的部件），可做抓取放置、写字画画、激光雕刻和 3D 打印，支持图形化编程和 Python 等接口。它精度和负载都有限，做不了真正的工业活，但价格低、体积小、放在桌上就能用，常被高校和中小学拿来讲机器人运动学、做抓取放置和视觉分拣的入门实验。","example":"课堂上用 Dobot Magician 配一个摄像头，识别桌上不同颜色的方块并用吸盘把它们分拣到对应区域。","related":["桌面机械臂(Desktop Robot Arm)","越疆科技(Dobot)","科研教育市场(Research & Education Market)","抓取放置(Pick-and-Place)","大象机器人 myCobot(Elephant Robotics myCobot)"]},{"id":"elephant-robotics-mycobot","category":"robot","sec":4,"tier":3,"sources":[{"title":"myCobot 280 - Elephant Robotics Shop","url":"https://shop.elephantrobotics.com/collections/mycobot-280"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"大象机器人 myCobot","alt":"Elephant Robotics myCobot","abbr":"","aliases":["myCobot","myCobot 280"],"one_liner":"大象机器人出的小型六轴桌面协作机械臂，便宜好上手。","explanation":"myCobot 是深圳大象机器人（Elephant Robotics）推出的桌面六轴协作机械臂系列，最常见的 myCobot 280 自重约 850 g、工作半径 280 mm、负载 250 g、重复定位精度约 ±0.5 mm，有 M5Stack、树莓派、Arduino、Jetson 等不同主控版本。它支持 ROS（机器人操作系统）、Python、C++ 和图形化编程，常被用来学正逆运动学、做 ROS/MoveIt 实验和简单的视觉抓取。和 Dobot Magician 比，它多了两个轴，末端姿态更灵活；但负载和精度都很低，只适合教学、演示和原型验证。","example":"用 Python 调 myCobot 280 的接口，让它按预设路点依次移动，并配合夹爪把桌上的小积木挪到指定位置。","related":["桌面机械臂(Desktop Robot Arm)","六轴机械臂(6-Axis Robot Arm)","协作机器人(Collaborative Robot)","越疆 Dobot Magician(Dobot Magician)","SO-100 / SO-101 机械臂(SO-100 / SO-101 Arm (LeRobot))","机器人操作系统(Robot Operating System)"]},{"id":"aloha","category":"robot","sec":5,"tier":1,"sources":[{"title":"ALOHA project page (Tony Zhao et al.)","url":"https://tonyzhaozh.github.io/aloha/"}],"as_of":"2023-04","related_ids":["action-chunking-with-transformers","mobile-aloha","aloha-2","leader-follower-teleoperation","bimanual-manipulation","trossen-robotics-viperx-300"],"name":"ALOHA 双臂平台","alt":"A Low-cost Open-source Hardware System for Bimanual Teleoperation","abbr":"ALOHA","aliases":["ALOHA"],"one_liner":"斯坦福开源的低成本双臂遥操作平台，约 2 万美元","explanation":"ALOHA 是 Tony Zhao、Chelsea Finn 等人（斯坦福，合作方有伯克利和 Meta）2023 年随论文《Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware》开源的双臂硬件，整套约 2 万美元。它用两只小的主臂（人手拿着动）带动两只从臂（照着动）做遥操作采数据，配 4 路相机（2 个固定、2 个腕部）。同一篇论文提出了 ACT 算法，只用约 10 分钟演示就能学会穿扎带、插电池等精细双臂任务。它把双臂数据采集的门槛拉低，后续衍生出 Mobile ALOHA、ALOHA 2 等版本，也是很多 VLA 论文的真机平台。","example":"π0、ACT 等工作都在 ALOHA 类双臂平台上演示过叠衣服、装电池等任务。","related":["ACT","Mobile ALOHA","ALOHA 2","主从臂遥操作","双臂操作","ViperX 300 机械臂"]},{"id":"aloha-2","category":"robot","sec":5,"tier":3,"sources":[{"title":"arXiv 2405.02292: ALOHA 2: An Enhanced Low-Cost Hardware for Bimanual Teleoperation","url":"https://arxiv.org/abs/2405.02292"}],"as_of":"2024-05","related_ids":["aloha","mobile-aloha","aloha-unleashed","leader-follower-teleoperation","google-deepmind","gemini-robotics"],"name":"ALOHA 2","alt":"ALOHA 2: An Enhanced Low-Cost Hardware for Bimanual Teleoperation","abbr":"","aliases":["ALOHA2"],"one_liner":"谷歌 DeepMind 改进的开源低成本双臂遥操作硬件，ALOHA 的第二代","explanation":"ALOHA 2 是谷歌 DeepMind 牵头（「ALOHA 2 Team」，含 Chelsea Finn 等研究者）在 2024 年 2 月发布、同年 5 月上 arXiv 的开源双臂遥操作硬件，是斯坦福 ALOHA 的改进版。它保留「人摆弄主臂、从臂跟随」的低成本思路，重点改进了人体工学和耐用性：主臂夹爪操作力降到约十分之一，从臂夹持力翻倍，采集软件基于 ROS2、以 50 Hz 记录数据。全部硬件设计开源，还附带经过系统辨识的 MuJoCo 仿真模型。ALOHA Unleashed 和 Gemini Robotics 的双臂数据都在这类平台上采集。","example":"Gemini Robotics 演示的折纸、装饭盒等双臂任务，就在 ALOHA 2 上完成。","related":["ALOHA 双臂平台","Mobile ALOHA","ALOHA Unleashed","主从臂遥操作","谷歌 DeepMind","Gemini Robotics"]},{"id":"agilex-cobot-magic","category":"robot","sec":5,"tier":3,"sources":[{"title":"松灵官网：COBOT MAGIC 基于 Mobile ALOHA 架构的双臂遥操作平台","url":"https://www.agilex.ai/page/690aef2d5e78cfa260412cb5"},{"title":"无人系统网：首个「Mobile ALOHA」国产平替，松灵发布Cobot Magic","url":"https://m.youuvs.com/news/detail/202401/41607.html"}],"as_of":"2026-09","related_ids":["mobile-aloha","agilex-robotics","agilex-piper","leader-follower-teleoperation","action-chunking-with-transformers","rdt-1b"],"name":"松灵 Cobot Magic","alt":"AgileX Cobot Magic","abbr":"","aliases":["Cobot Magic","松灵 Mobile ALOHA"],"one_liner":"松灵仿照斯坦福 Mobile ALOHA 做的移动双臂遥操作采集平台","explanation":"Cobot Magic 是松灵机器人按斯坦福 Mobile ALOHA 架构做的商品化平台，2024 年初开放预售，被称为 Mobile ALOHA 的国产平替。它由主从两对机械臂（人操纵主臂，从臂跟着动）、差速移动底盘、多个相机和工控机组成，现款集成松灵自研的 PiPER 六轴臂和 TRACER 底盘。用途是采集双臂移动操作的示教数据，并直接跑 ACT 等 ALOHA 开源算法。由于买来即可用，不少高校拿它做数据采集，清华的 RDT-1B 就用到了在这类平台上采的数据。","example":"实验室用 Cobot Magic 遥操作采集几十条「擦桌子」示教，再训练 ACT 策略让它自主完成。","related":["Mobile ALOHA","松灵机器人","松灵 PiPER 机械臂","主从臂遥操作","ACT","RDT-1B"]},{"id":"turtlebot","category":"robot","sec":5,"tier":3,"sources":[{"title":"TurtleBot 官网","url":"https://www.turtlebot.com/"}],"as_of":"2026-09","related_ids":["robot-operating-system","robot-operating-system-2","differential-drive-base","simultaneous-localization-and-mapping","ros-2-navigation-stack","wheeled-robot"],"name":"TurtleBot","alt":"TurtleBot","abbr":"","aliases":["TurtleBot 3","TurtleBot 4"],"one_liner":"学 ROS 最常用的开源小型轮式移动机器人套件","explanation":"TurtleBot 是一款低成本、软件开源的个人机器人套件，2010 年 11 月由 Willow Garage 的 Melonee Wise 和 Tully Foote 创建，和 ROS（机器人操作系统）一起成长。它是一个带传感器和电脑的差速轮式底盘，不带机械臂，主要用来学习建图、定位、导航。目前主流是两代：TurtleBot 3 由 Open Robotics 与 ROBOTIS 合作，有 Burger、Waffle Pi 等型号；TurtleBot 4 由 Open Robotics 与 Clearpath Robotics 合作，基于 iRobot Create 3 底盘，带激光雷达和 OAK-D 深度相机，默认跑 ROS 2。ROS 官方教程和 Nav2 等导航框架大量以它为示例，是移动机器人入门的标准教具。","example":"按 ROS 2 教程，用 TurtleBot 4 跑 SLAM 建一张房间地图，再用 Nav2 让它自主开到指定位置。","related":["机器人操作系统","ROS 2","差速底盘","同步定位与建图","Nav2","轮式机器人"]},{"id":"clearpath-robotics-jackal-husky-ugv","category":"robot","sec":5,"tier":3,"sources":[{"title":"Jackal UGV - Clearpath Robotics","url":"https://clearpathrobotics.com/jackal-small-unmanned-ground-vehicle/"},{"title":"Husky A300 - Clearpath Robotics","url":"https://clearpathrobotics.com/husky-a300-unmanned-ground-vehicle-robot/"}],"as_of":"2025","related_ids":["mobile-base","wheeled-robot","autonomous-mobile-robot","robot-operating-system","simultaneous-localization-and-mapping","navigation"],"name":"Clearpath Jackal / Husky 移动底盘","alt":"Clearpath Robotics Jackal / Husky UGV","abbr":"","aliases":["Jackal","Husky","Husky A300"],"one_liner":"加拿大 Clearpath 出的两款轮式无人车底盘，科研界最常用的户外移动平台。","explanation":"Jackal 和 Husky 是加拿大公司 Clearpath Robotics（2023 年被美国罗克韦尔自动化收购，现为其旗下品牌）的两款轮式无人地面车（UGV，没有驾驶员的地面移动平台）。Jackal 小巧，重约 17 kg、可载 20 kg、最快 2 m/s，防护等级 IP62；Husky 是中型四轮底盘，新款 Husky A300 自重约 80 kg、载重约 100 kg、防护等级 IP54。两者出厂就接好了 ROS（机器人操作系统）、机载电脑、GPS 和 IMU（惯性测量单元），顶部留有安装板，能直接装激光雷达、相机甚至机械臂。它们解决的是「做导航、建图、野外机器人研究不想自己造车」的问题，所以大量 SLAM（同步定位与建图）、户外导航论文都用它们做实验载体。","example":"在 Husky 顶上装一台激光雷达和一只 UR5e 机械臂，就是很多实验室自搭的户外移动操作平台。","related":["移动底盘","轮式机器人","自主移动机器人","机器人操作系统","同步定位与建图","导航"]},{"id":"hello-robot-stretch","category":"robot","sec":5,"tier":2,"sources":[{"title":"The Robot Report: Stretch 3 from Hello Robot designed for open-source mobile manipulation","url":"https://www.therobotreport.com/stretch-3-mobile-manipulator-hello-robot-designed-open-source-development/"},{"title":"Hello Robot 官网购买页","url":"https://hello-robot.com/purchase/"}],"as_of":"2024-02","related_ids":["mobile-manipulator","mobile-manipulation","ok-robot","dobb-e","hello-robot","household-tasks"],"name":"Hello Robot Stretch","alt":"Hello Robot Stretch","abbr":"","aliases":["Stretch RE1","Stretch 2","Stretch 3"],"one_liner":"Hello Robot 公司做的轻量开源移动操作机器人，常用于家居研究。","explanation":"Stretch 是美国公司 Hello Robot 推出的移动操作机器人：底部是小型差速底盘，上面一根竖直升降柱，柱上挂一根可水平伸缩的手臂，末端是腕部加夹爪。它不追求人形，而是用很少的自由度覆盖桌面、地面和柜子等家居高度。第三代 Stretch 3 于 2024 年 2 月发布，售价 24,950 美元，重约 24.5 kg，占地约 33×34 cm，标配 DexWrist 3 腕部和夹爪内置的深度相机。因为轻、便宜、软件开源，它成了学术界做家庭场景移动操作的常用平台，OK-Robot、Dobb·E 等工作都用它做实验。","example":"OK-Robot 用 Stretch 在真实家庭里完成「把桌上的某个物体拿到指定位置」的开放词汇抓取放置。","related":["复合机器人","移动操作","OK-Robot","Dobb·E","Hello Robot","家务任务"]},{"id":"willow-garage-pr2","category":"robot","sec":5,"tier":3,"sources":[{"title":"Willow Garage - Wikipedia","url":"https://en.wikipedia.org/wiki/Willow_Garage"}],"as_of":"2014-01","related_ids":["robot-operating-system","willow-garage","mobile-manipulation","mobile-manipulator","dual-arm-robot","fetch-robotics-fetch"],"name":"PR2","alt":"Willow Garage PR2 (Personal Robot 2)","abbr":"PR2","aliases":["Personal Robot 2"],"one_liner":"Willow Garage 2010 年推出的双臂移动操作研究机器人，ROS 的发源平台。","explanation":"PR2 是美国机器人研究机构 Willow Garage 研发的移动操作机器人，2010 年 8 月开始发售。它有全向移动底盘、可升降躯干、两条 7 自由度手臂（负载约 1.8 kg）、头部相机和激光雷达，底座里装着两台 8 核服务器。2010 年 Willow Garage 把 PR2 借给 11 个研究团队用两年，配套的开源软件就是 ROS（机器人操作系统），ROS 由此在学界普及。据报道售价约 40 万美元。Willow Garage 于 2014 年初关闭，PR2 的后续支持转给 Clearpath Robotics。","example":"伯克利团队曾用 PR2 演示从一堆毛巾里拿起并叠好毛巾。","related":["机器人操作系统","Willow Garage","移动操作","复合机器人","双臂机器人","Fetch 移动操作机器人"]},{"id":"toyota-human-support-robot","category":"robot","sec":5,"tier":3,"sources":[{"title":"Toyota: HSR Developers' Community","url":"https://global.toyota/en/detail/8709541"}],"as_of":"2016-04","related_ids":["service-robot","mobile-manipulation","mobile-manipulator","household-tasks","robocup","toyota-research-institute"],"name":"丰田 HSR","alt":"Toyota Human Support Robot","abbr":"HSR","aliases":["Human Support Robot"],"one_liner":"丰田为居家照护研发的单臂移动操作机器人，常用于家庭服务研究","explanation":"HSR 是丰田汽车 2012 年推出的生活辅助机器人，目标是帮助老人和行动不便的人完成日常小事，也可由家人或护工远程操作。它是圆柱形移动底盘加一条单臂的结构：底盘直径 430 毫米，身高可在 1005–1350 毫米间升降，重约 37 公斤，手臂伸展约 600 毫米，最大负载 1.2 公斤，最高速度 0.8 公里/小时。2015 年丰田成立 HSR 开发者社区，把机器人提供给高校和研究机构，大家共享软件。因为体型接近家具尺度、能开门捡东西，它成了家庭服务、移动操作研究的常见平台，据报道也被 RoboCup@Home 用作标准平台。","example":"研究者用 HSR 在模拟家居环境里做「把地上的杂物捡起来放进箱子」的整理任务。","related":["服务机器人","移动操作","复合机器人","家务任务","RoboCup 机器人世界杯","丰田研究院"]},{"id":"fetch-robotics-fetch","category":"robot","sec":5,"tier":3,"sources":[{"title":"Fetch Mobile Manipulator spec sheet","url":"https://www.amaasia.net/product%20PDF/Fetch_spec_download.pdf"},{"title":"Zebra Technologies Completes Acquisition of Fetch Robotics","url":"https://businesswire.com/news/home/20210810005268/en/Zebra-Technologies-Completes-Acquisition-of-Fetch-Robotics"}],"as_of":"2021-08","related_ids":[null,null,null,null,null,null],"name":"Fetch 移动操作机器人","alt":"Fetch Robotics Fetch","abbr":"","aliases":["Fetch","Fetch Mobile Manipulator"],"one_liner":"Fetch Robotics 出的科研用移动操作机器人，底盘加升降躯干和七轴臂。","explanation":"Fetch 是美国 Fetch Robotics 公司推出的研究型移动操作机器人：差速驱动底盘、可升降躯干、可俯仰转动的头部，外加一条可反驱的 7 自由度机械臂和平行二指夹爪。机械臂由谐波减速器配无框电机组成，负载约 6 kg；底盘带 SICK 激光雷达，头部有深度相机，运行 ROS。它在 2010 年代中后期是美国高校做移动操作、抓取和导航研究的常见平台，地位类似更早的 PR2。公司主业其实是仓储自主移动机器人，2021 年被 Zebra Technologies 收购：Zebra 以约 2.9 亿美元买下它此前未持有的 95% 股份，整体估值约 3.05 亿美元。","example":"研究组在 Fetch 上跑 MoveIt 做抓取规划，让它从货架上取下指定物体再开到桌边放下。","related":["复合机器人(Mobile Manipulator)","移动操作(Mobile Manipulation)","PR2(Willow Garage PR2 (Personal Robot 2))","TIAGo(PAL Robotics TIAGo)","七自由度机械臂(7-DoF Robot Arm)","机器人操作系统(Robot Operating System)"]},{"id":"pal-robotics-tiago","category":"robot","sec":5,"tier":3,"sources":[{"title":"TIAGo | Mobile Manipulator Robot (PAL Robotics)","url":"https://pal-robotics.com/robot/tiago/"},{"title":"TIAGo Datasheet (PAL Robotics)","url":"https://pal-robotics.com/wp-content/uploads/2024/04/Datasheet-TIAGo.pdf"}],"as_of":"2026-09","related_ids":["mobile-manipulation","mobile-manipulator","willow-garage-pr2","fetch-robotics-fetch","toyota-human-support-robot","robot-operating-system"],"name":"TIAGo","alt":"PAL Robotics TIAGo","abbr":"","aliases":["TIAGo++","TIAGo Pro"],"one_liner":"PAL Robotics 的模块化移动操作机器人，科研和家庭服务研究常用。","explanation":"TIAGo 是西班牙 PAL Robotics 推出的移动操作机器人（底盘能走、上面有机械臂），标准版由差速驱动底盘、可升降躯干（高度约 1.1–1.45 米）、一条 7 自由度机械臂和可俯仰转动的头部组成，头部带 RGB-D 相机（彩色+深度）。它主打模块化：可选夹爪或灵巧手、单臂或双臂（TIAGo++），手臂还可选串联弹性驱动（SEA）版本，关节能做力矩控制、碰撞更安全；官方给出单臂负载约 3 公斤（不含末端执行器），另有升级款 TIAGo Pro。系统基于 ROS，所以很多高校拿它做导航、抓取、人机交互和家庭服务类任务研究，定位和 PR2、Fetch、丰田 HSR 属于同一类科研平台。","example":"研究者在 TIAGo 上跑 ROS 的 Nav2 导航加 MoveIt 抓取规划，让它从厨房台面取杯子送到人手里。","related":["移动操作","复合机器人","PR2","Fetch 移动操作机器人","丰田 HSR","机器人操作系统"]},{"id":"everyday-robots-mobile-manipulator","category":"robot","sec":5,"tier":3,"sources":[{"title":"Alphabet closes Everyday Robots among layoffs - The Robot Report","url":"https://www.therobotreport.com/alphabet-closes-everyday-robots-among-layoffs/"},{"title":"RT-1: Robotics Transformer for Real-World Control at Scale (arXiv)","url":"https://arxiv.org/abs/2212.06817"}],"as_of":"2023-02","related_ids":[null,null,null,null,null,null],"name":"Everyday Robots 移动机械臂","alt":"Everyday Robots Mobile Manipulator","abbr":"EDR","aliases":["RT-1 所用机器人","谷歌移动机械臂"],"one_liner":"谷歌 RT-1、SayCan 等工作用的单臂轮式移动机器人。","explanation":"这是 Alphabet X 孵化的 Everyday Robots 团队造的轮式移动操作机器人：底部是移动底盘，上面一条 7 自由度机械臂、二指夹爪，头部集成相机等传感器。团队曾让一百多台这种机器人在谷歌办公室里擦桌子、分拣垃圾、开门。它是谷歌机器人学习论文的主力平台，SayCan、RT-1、RT-2 都在它上面做实验，其中 RT-1 用 13 台机器人在 17 个月里采了约 13 万条演示。2023 年 2 月，随 Alphabet 年初的裁员该项目被关闭，部分团队和技术并入谷歌研究院的机器人项目。这款机器人没有商业化，但它采集的数据（RT-1 数据集）被纳入 Open X-Embodiment，影响至今。","example":"SayCan 演示中，它听到「我把饮料洒了」后，规划出找海绵、拿过来的步骤，并在厨房里执行。","related":["Everyday Robots(Everyday Robots (Alphabet X))","复合机器人(Mobile Manipulator)","RT-1(RT-1: Robotics Transformer for Real-World Control at Scale)","SayCan(SayCan (Do As I Can, Not As I Say: Grounding Language in Robotic Affordances))","RT-1 数据集(RT-1 Robot Action Dataset (Fractal))","谷歌 DeepMind(Google DeepMind)"]},{"id":"locobot","category":"robot","sec":5,"tier":3,"sources":[{"title":"PyRobot: An Open-source Robotics Framework for Research and Benchmarking（arXiv）","url":"https://arxiv.org/pdf/1906.08236"},{"title":"LoCoBot（robots.ros.org）","url":"https://robots.ros.org/locobot/"}],"as_of":"2019-06","related_ids":["mobile-manipulation","mobile-manipulator","robot-operating-system","habitat","point-goal-navigation","turtlebot"],"name":"LoCoBot 低成本移动操作机器人","alt":"LoCoBot","abbr":"","aliases":[],"one_liner":"CMU 设计、配合 Facebook AI 的 PyRobot 使用的低价移动操作科研平台","explanation":"LoCoBot 是卡内基梅隆大学（CMU）设计的低成本移动操作机器人，配合 Facebook AI（现 Meta）2019年开源的 PyRobot 框架使用，由 Trossen Robotics 销售。默认配置是 Kobuki 差速底盘、Intel NUC 小电脑、Intel RealSense D435 深度相机和一条 WidowX 小机械臂（PyRobot 论文中为5自由度、负载约0.2千克、最大臂展约0.55米）。PyRobot 在 ROS（机器人操作系统）之上提供与硬件无关的导航和操作 Python 接口，让不熟悉 ROS 的深度学习研究者也能直接控制真机。它价格低、能同时做导航和抓取，适合预算有限的实验室做具身导航、抓取和仿真到现实迁移实验。","example":"在 Habitat 仿真里训练的点目标导航策略，部署到 LoCoBot 真机上测试成功率，对比仿真与真实的差距。","related":["移动操作","复合机器人","机器人操作系统","Habitat","点目标导航","TurtleBot"]},{"id":"tidybot-plus-plus","category":"robot","sec":5,"tier":3,"sources":[{"title":"arXiv 2412.10447: TidyBot++","url":"https://arxiv.org/abs/2412.10447"},{"title":"GitHub: jimmyyhwu/tidybot2","url":"https://github.com/jimmyyhwu/tidybot2"}],"as_of":"2024-12","related_ids":["mobile-manipulation","mobile-manipulator","kinova-gen3","diffusion-policy","teleoperation","mobile-aloha"],"name":"TidyBot++ 开源全向移动操作平台","alt":"TidyBot++ (Open-Source Holonomic Mobile Manipulator)","abbr":"","aliases":["TidyBot++","tidybot2"],"one_liner":"斯坦福等开源的低成本全向移动底盘加机械臂，用于家务移动操作研究","explanation":"TidyBot++ 是斯坦福大学与普林斯顿大学（Jimmy Wu、Shuran Song、Oussama Khatib、Jeannette Bohg 等）发表于 CoRL 2024 的开源移动操作平台，硬件图纸和代码都公开。核心是一个用带动力脚轮做成的全向（holonomic）底盘：平面上前后、左右、转向三个自由度可以独立同时控制，不用像差速底盘那样先转身再走，简化了移动中操作。底盘可以装任意机械臂，论文用 Kinova Gen3。它配了手机遥操作界面方便采集演示，再用扩散策略训练，在真实公寓里完成多种家务。据报道底盘造价约 5000–6000 美元（不含机械臂）。","example":"用手机遥操作界面在真实公寓里采集示范，再训练扩散策略，让机器人自主完成家务类移动操作任务。","related":["移动操作","复合机器人","Kinova Gen3","扩散策略","遥操作","Mobile ALOHA"]},{"id":"lekiwi","category":"robot","sec":5,"tier":3,"sources":[{"title":"GitHub - SIGRobotics-UIUC/LeKiwi: Low-Cost Mobile Manipulator","url":"https://github.com/SIGRobotics-UIUC/LeKiwi"},{"title":"Upgrading the LeKiwi into a LiDAR-equipped explorer | Foxglove","url":"https://foxglove.dev/blog/upgrading-the-lekiwi-into-a-lidar-equipped-explorer"}],"as_of":"2025","related_ids":["lerobot","so-100-so-101-arm","mobile-manipulation","omni-wheel","xlerobot","feetech-sts3215-servo"],"name":"LeKiwi 移动底盘机械臂","alt":"LeKiwi","abbr":"","aliases":["LeKiwi"],"one_liner":"三全向轮底盘加 SO-101 机械臂的开源低成本移动操作机器人。","explanation":"LeKiwi 由伊利诺伊大学厄巴纳-香槟分校的学生社团 SIGRobotics 在 2025 年初开源，已被 Hugging Face 的 LeRobot 官方支持。它的底盘用三个呈 120° 布置的全向轮（Kiwi 驱动），可以原地任意方向平移和旋转；底盘上装一台 SO-101（或 SO-100）机械臂，底盘和手臂都用飞特 STS3215 舵机，主控是树莓派 5，底盘和手腕各有一个摄像头。整套靠 3D 打印和现成零件搭建，让个人和学生也能用很低成本做移动操作的遥操作采集和模仿学习。","example":"用 SO-101 主臂加键盘遥操作 LeKiwi 走到桌边抓起一只袜子，录下数据后用 LeRobot 训练策略。","related":["LeRobot","SO-100 / SO-101 机械臂","移动操作","全向轮","XLeRobot","飞特 STS3215 舵机"]},{"id":"xlerobot","category":"robot","sec":5,"tier":3,"sources":[{"title":"Vector-Wangel/XLeRobot (GitHub)","url":"https://github.com/Vector-Wangel/XLeRobot"}],"as_of":"2025-12","related_ids":["lerobot","so-100-so-101-arm","lekiwi","mobile-manipulation","open-source-hardware","mobile-manipulator"],"name":"XLeRobot","alt":"XLeRobot","abbr":"","aliases":[],"one_liner":"物料成本约 660 美元起的开源双臂轮式家用机器人。","explanation":"XLeRobot 是莱斯大学研究生 Gaotian（Vector）Wang 个人发起的开源硬件项目，2025 年 6 月发布 0.2.0 版。它把两条 SO-100/SO-101 低成本机械臂装到移动底盘上（最初用全向轮，2025 年 12 月加入两轮差速版本），头部配 RGB 相机，可升级双目或 RealSense 深度相机，由笔记本或树莓派驱动。基础配置物料成本约 660 美元起（不含 3D 打印、运费和税）。它建立在 Hugging Face LeRobot、SO-101、LeKiwi 等项目之上，目标是让个人和学生花很少的钱就能做双臂移动操作和家务任务研究。","example":"","related":["LeRobot","SO-100 / SO-101 机械臂","LeKiwi 移动底盘机械臂","移动操作","开源硬件","复合机器人"]},{"id":"honda-asimo","category":"robot","sec":6,"tier":2,"sources":[{"title":"Honda Debuts New Humanoid Robot ASIMO (2000)","url":"https://global.honda/en/newsroom/news/2000/c001120b-eng.html"},{"title":"Wikipedia: ASIMO","url":"https://en.wikipedia.org/wiki/ASIMO"}],"as_of":"2022-03","related_ids":["humanoid-robot","bipedal-locomotion","zero-moment-point","model-based-control","hrp-humanoid-robot-series"],"name":"本田 ASIMO","alt":"Honda ASIMO","abbr":"","aliases":["阿西莫","ASIMO"],"one_liner":"本田 2000 年发布的双足人形机器人，早期人形机器人代表作。","explanation":"ASIMO 是日本本田公司研发的双足人形机器人，2000 年发布首代，身高约 1.2 米。2011 年的新版身高 130 cm、体重 48 kg、共 57 个自由度，奔跑速度约 9 km/h，能上下楼梯、端托盘、和人简单互动。它基于零力矩点（ZMP）等基于模型的平衡控制，大量动作靠工程师预先规划，代表了「深度学习之前」人形机器人的最高水平。本田 2018 年停止研发，2022 年 3 月最后一次公开亮相后退役。今天讲人形机器人的发展史时常拿它和学习型控制的新一代人形做对比。","example":"2011 版 ASIMO 在展示中能单腿跳、边跑边转弯，并按指令倒饮料递给观众。","related":["人形机器人","双足行走","零力矩点","基于模型的控制","HRP 系列人形机器人"]},{"id":"boston-dynamics-atlas","category":"robot","sec":6,"tier":3,"sources":[{"title":"Atlas shrugged: Boston Dynamics retires its hydraulic humanoid robot (TechCrunch)","url":"https://techcrunch.com/2024/04/16/atlas-shrugged-boston-dynamics-retires-its-humanoid-robot/"},{"title":"Atlas (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Atlas_(robot)"}],"as_of":"2024-04","related_ids":["boston-dynamics-atlas-2","boston-dynamics","hydraulic-actuation","darpa-robotics-challenge","model-predictive-control","bipedal-locomotion"],"name":"液压版 Atlas","alt":"Boston Dynamics Atlas (Hydraulic)","abbr":"","aliases":["HD Atlas","老版 Atlas","Atlas HD"],"one_liner":"波士顿动力 2013–2024 年的液压驱动人形机器人，以跑酷和后空翻视频闻名。","explanation":"液压版 Atlas 最初由波士顿动力在美国 DARPA（国防高级研究计划局）资助下为 DARPA 机器人挑战赛研制，2013 年 7 月公开：当时身高约 1.88 m、重约 150 kg，还要拖着电源线。2016 年后换成更小、自带电池的新版，靠液压执行器输出大功率，能跑、跳、后空翻、跑酷、搬箱子。它的运动主要靠基于模型的控制（如模型预测控制）和离线设计的动作，展示了人形机器人动态平衡的上限。它一直是研究平台、从未商用，2024 年 4 月退役，由同月发布的电动版 Atlas 接替。","example":"2021 年「Parkour Atlas」视频中两台 Atlas 连续跳箱、翻越障碍并做后空翻。","related":["波士顿动力 Atlas（电动版）","波士顿动力","液压驱动","DARPA 机器人挑战赛","模型预测控制","双足行走"]},{"id":"boston-dynamics-atlas-2","category":"robot","sec":6,"tier":1,"sources":[{"title":"Boston Dynamics Unveils New Atlas Robot to Revolutionize Industry","url":"https://bostondynamics.com/blog/boston-dynamics-unveils-new-atlas-robot-to-revolutionize-industry/"},{"title":"CES 2026: Boston Dynamics unveils new Atlas humanoid robot (Robotics 24/7)","url":"https://www.robotics247.com/article/ces-2026-boston-dynamics-unveils-new-atlas-humanoid-robot/technologies"}],"as_of":"2026-01","related_ids":["boston-dynamics-atlas","boston-dynamics","hyundai-motor-group","google-deepmind","full-size-humanoid-robot","humanoid-robot"],"name":"波士顿动力 Atlas（电动版）","alt":"Boston Dynamics Atlas (Electric)","abbr":"","aliases":["Atlas","电动版 Atlas","电动 Atlas","阿特拉斯"],"one_liner":"波士顿动力 2024 年推出的全电驱人形机器人，面向工厂作业","explanation":"电动版 Atlas 是波士顿动力（现属现代汽车集团）2024 年 4 月发布的人形机器人，接替退役的液压版 Atlas。它改用电机驱动，关节可大范围甚至整圈旋转，动作不必模仿人类姿态。2026 年 1 月 CES 上发布产品版：56 个自由度、臂展约 2.3 米、可搬起 50 公斤、电池约 4 小时且能自己回充电站换电池，支持自主、遥操作和平板操控三种模式。官方称 2026 年的部署全部供给现代汽车工厂和谷歌 DeepMind（双方合作训练基础模型）。","example":"Atlas 在现代汽车工厂里搬运和排序汽车零部件。","related":["液压版 Atlas","波士顿动力","现代汽车集团","谷歌 DeepMind","全尺寸人形机器人","人形机器人"]},{"id":"tesla-optimus","category":"robot","sec":6,"tier":1,"sources":[{"title":"Optimus (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Optimus_(robot)"},{"title":"Tesla Optimus Gen 3 (Not a Tesla App)","url":"https://www.notateslaapp.com/news/4725/tesla-app-leaks-new-optimus-gen-3-robot-design"}],"as_of":"2026-09","related_ids":["tesla","tesla-optimus-v3","tesla-optimus-hand","tesla-supply-chain","tesla-we-robot-event","humanoid-robot"],"name":"擎天柱","alt":"Tesla Optimus","abbr":"","aliases":["Optimus","特斯拉 Optimus","特斯拉人形机器人","Optimus Gen 2"],"one_liner":"特斯拉研发的通用双足人形机器人","explanation":"Optimus（中文常称擎天柱）是特斯拉的人形机器人项目，2021 年 8 月 AI Day 首次公布，2022 年展示原型机，2023 年 12 月发布第二代（Gen 2）。公开参数：身高约 1.73 米、体重约 57 公斤、可搬约 20 公斤，Gen 2 的手最初有 11 个自由度，2024 年展示的新手升级到 22 个。特斯拉想复用自动驾驶的视觉神经网络、电池和电机供应链来造人形，马斯克多次表示目标售价约 2–3 万美元。截至 2026 年 9 月，面向量产的第三代尚未正式发布，公司称 Fremont 工厂在装年产能百万台级的产线（据报道）。","example":"2024 年特斯拉 We, Robot 发布会上 Optimus 给来宾倒饮料，事后被指部分动作靠远程遥操作。","related":["特斯拉","特斯拉 Optimus V3（Gen 3）","特斯拉 Optimus 灵巧手","T 链（特斯拉链）","特斯拉 We, Robot 发布会","人形机器人"]},{"id":"tesla-optimus-v3","category":"robot","sec":6,"tier":2,"sources":[{"title":"Wikipedia: Optimus (robot)","url":"https://en.wikipedia.org/wiki/Optimus_(robot)"}],"as_of":"2026-09","related_ids":["tesla-optimus","tesla","tesla-optimus-hand","full-size-humanoid-robot","mass-production","tesla-supply-chain"],"name":"特斯拉 Optimus V3（Gen 3）","alt":"Tesla Optimus V3 (Optimus Gen 3)","abbr":"","aliases":["Optimus V3","Optimus Gen 3","擎天柱第三代"],"one_liner":"特斯拉面向量产设计的第三代 Optimus 人形机器人，截至 2026-09 尚未正式发布。","explanation":"Optimus V3 是特斯拉人形机器人 Optimus 的第三代，官方定位是第一版为大规模量产而设计的机型。马斯克在 2026 年 4 月的一季度财报会上表示 V3 会在临近量产时发布；特斯拉正在弗里蒙特工厂安装设计年产 100 万台的产线，并规划得州工厂的更大产线。截至 2026 年 9 月，V3 尚未正式亮相，身高、自由度、售价等参数没有官方公布，网上流传的数字多为媒体推测。前一代 Optimus Gen 2（2023 年 12 月）单手 11 个自由度，特斯拉 2024 年展示过 22 自由度的新灵巧手。关注它主要是看人形机器人能否真正进入百万台级量产。","example":"","related":["擎天柱","特斯拉","特斯拉 Optimus 灵巧手","全尺寸人形机器人","量产","T 链（特斯拉链）"]},{"id":"figure-01","category":"robot","sec":6,"tier":3,"sources":[{"title":"Figure AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Figure_AI"},{"title":"OpenAI Makes Figure's Robot Talk Like Human - FavTutor","url":"https://favtutor.com/articles/figure-robot-openai-demo/"}],"as_of":"2024-08","related_ids":["figure-ai","figure-02",null,"openai",null,null],"name":"Figure 01","alt":"Figure 01","abbr":"","aliases":["Figure One"],"one_liner":"Figure AI 的第一代通用人形机器人，因与 OpenAI 合作的对话演示走红。","explanation":"Figure 01 是美国 Figure AI（Brett Adcock 于 2022 年创立）的第一代双足人形机器人，面向物流、仓储和工厂体力活，公开参数为身高约 1.68 m、体重约 60 kg、负载约 20 kg、续航约 5 小时，线缆外露便于维护。2024 年 1 月 Figure 与宝马签约，将人形机器人引入其美国斯帕坦堡工厂；2024 年 3 月发布与 OpenAI 合作的演示视频，Figure 01 一边用语音和人对话，一边把苹果递给对方、收拾盘子，官方称 1 倍速、一镜到底。2024 年 8 月它被 Figure 02 取代，之后与 OpenAI 的合作也在 2025 年初结束，Figure 转向自研的 Helix 模型。","example":"2024 年 3 月的演示里，人问「能给我点吃的吗」，Figure 01 把桌上唯一可吃的苹果递过去，并解释为什么这样选。","related":["Figure AI","Figure 02","Helix(Figure Helix (Vision-Language-Action model))","OpenAI","全尺寸人形机器人(Full-size Humanoid Robot)","一镜到底(One-Take (Uncut) Video)"]},{"id":"figure-02","category":"robot","sec":6,"tier":2,"sources":[{"title":"Figure AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Figure_AI"},{"title":"BMW tests Figure 02 humanoid on production line - The Robot Report","url":"https://www.therobotreport.com/bmw-tests-figure-02-humanoid-on-production-line/"}],"as_of":"2025-10","related_ids":["figure-ai","figure-helix","figure-01","figure-03","humanoid-robot","dual-system-architecture"],"name":"Figure 02","alt":"Figure 02","abbr":"","aliases":["F.02","Figure 2"],"one_liner":"Figure AI 2024 年发布的第二代人形机器人，曾在宝马工厂试点","explanation":"Figure 02 是美国 Figure AI 于 2024 年 8 月发布的第二代通用人形机器人，接替 Figure 01。公开参数为身高约 1.68 米、重约 70 kg，双手各 16 个自由度，全身 6 个摄像头；官方称电池容量比上一代多 50%、机载算力是上一代的 3 倍，线缆全部内藏。它在宝马斯帕坦堡工厂做过车身零件搬运和放置试点，也是 Figure 自研 VLA 模型 Helix（2025 年 2 月发布，采用快慢双系统）的首个载体，演示过两台机器人协作收纳杂货、物流线上分拣包裹等任务。2025 年 10 月 Figure 03 发布后，Figure 02 成为上一代产品。","example":"2025 年 2 月，Figure 用 Helix 同时控制两台 Figure 02，按语音指令一起把杂货收进冰箱。","related":["Figure AI","Helix","Figure 01","Figure 03","人形机器人","快慢双系统"]},{"id":"figure-03","category":"robot","sec":6,"tier":1,"sources":[{"title":"Figure AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Figure_AI"},{"title":"Figure 03 Specs & Price | Humanoid.guide","url":"https://humanoid.guide/product/figure-03/"}],"as_of":"2025-10","related_ids":["figure-ai","figure-helix","figure-helix-02","figure-02","botq","humanoid-robot"],"name":"Figure 03","alt":"Figure 03","abbr":"","aliases":["F.03"],"one_liner":"Figure AI 2025 年发布的第三代人形机器人，面向家庭和量产","explanation":"Figure 03 是美国公司 Figure AI 于 2025 年 10 月 9 日发布的第三代人形机器人，接替 Figure 02。它围绕自家 VLA 模型 Helix 设计：指尖有触觉传感器（据称可感知约 3 克的力），手掌带相机，外壳改用可拆洗的软质织物，脚部内置线圈可 2 kW 无线充电。据报道身高约 1.73 米、体重约 61 公斤。它也按大规模制造来设计，由 Figure 的 BotQ 工厂生产，官方称首条产线年产能可达 1.2 万台。","example":"Figure 发布视频中，Figure 03 用 Helix 在家中叠衣服、装洗碗机。","related":["Figure AI","Helix","Helix 02","Figure 02","Figure BotQ 工厂","人形机器人"]},{"id":"1x-eve","category":"robot","sec":6,"tier":3,"sources":[{"title":"1X Technologies - Wikipedia","url":"https://en.wikipedia.org/wiki/1X_Technologies"}],"as_of":"2025-10","related_ids":[null,null,"1x-neo",null,"openai"],"name":"1X EVE","alt":"1X EVE","abbr":"","aliases":["EVE","Halodi EVE"],"one_liner":"挪威公司 1X 的轮式人形机器人，面向安保、物流和医疗场景","explanation":"EVE 是挪威机器人公司 1X Technologies（前身 Halodi Robotics，2022 年更名）的第一款人形机器人，上半身是带双臂和头部的人形，下半身是轮式底盘。它采用 1X 自研的驱动、感知和操作技术，定位是物流、安保、医疗等机构场景的实地测试平台，能用语音指令连续执行任务。2023 年 OpenAI 创业基金领投 1X 的 A2 轮，让 EVE 受到广泛关注。此后 1X 把重心转向面向家庭的双足人形 NEO，EVE 更多作为早期代表。","example":"","related":["1X(1X Technologies)","轮式人形机器人(Wheeled Humanoid Robot)","1X NEO","1X 世界模型(1X World Model)","OpenAI"]},{"id":"1x-neo","category":"robot","sec":6,"tier":2,"sources":[{"title":"1X NEO Home Robot","url":"https://www.1x.tech/discover/neo-home-robot"},{"title":"NEO humanoid available for preorder - The Robot Report","url":"https://www.therobotreport.com/1x-announces-pre-order-launch-neo-humanoid-robot/"}],"as_of":"2026-07","related_ids":["1x-technologies","redwood","1x-world-model","1x-eve","tendon-driven-actuation","remote-teleoperation-takeover"],"name":"1X NEO","alt":"1X NEO","abbr":"","aliases":["NEO","NEO Gamma","NEO Beta"],"one_liner":"1X 公司面向家庭的双足人形机器人，定价 2 万美元","explanation":"NEO 是挪威起家、总部在美国的 1X Technologies 研发的家用人形机器人，2024 年发布 NEO Beta，2025 年 2 月发布 NEO Gamma，2025 年 10 月开放消费者预订：买断 2 万美元，或每月 499 美元订阅。据报道身高约 1.68 米、重约 30 公斤，可抬起 70 公斤，手部 22 自由度，采用腱绳驱动和软质外壳，运行噪声约 22 分贝。它做不到的家务可由 1X 员工远程遥操作完成，这引发隐私争议。官方计划 2026 年起在美国交付，截至 2026 年 7 月尚无已证实的用户交付（据报道）。","example":"用户在手机 App 里安排 NEO 叠衣服，不会的任务可预约远程操作员接管。","related":["1X","1X Redwood","1X 世界模型","1X EVE","腱绳驱动","远程接管（人工兜底）"]},{"id":"agility-robotics-cassie","category":"robot","sec":6,"tier":3,"sources":[{"title":"Oregon State University：Bipedal robot developed at Oregon State achieves Guinness World Record in 100 meters","url":"https://news.oregonstate.edu/news/bipedal-robot-developed-oregon-state-achieves-guinness-world-record-100-meters"},{"title":"The Robot Report：Watch a Cassie bipedal robot run 100 meters","url":"https://www.therobotreport.com/watch-a-cassie-bipedal-robot-run-100-meters/"}],"as_of":"2022-05","related_ids":["agility-robotics","bipedal-robot","reverse-knee-leg","agility-robotics-digit","rl-based-locomotion-control","sim-to-real-transfer"],"name":"Agility Cassie","alt":"Agility Robotics Cassie","abbr":"","aliases":["Cassie"],"one_liner":"没有上身、只有两条鸟腿的双足机器人，腿足强化学习的经典平台","explanation":"Cassie 是俄勒冈州立大学 Jonathan Hurst 团队设计、Agility Robotics 制造的双足机器人，2017 年推出，研发得到 DARPA 资助。它没有头和手臂，只有两条膝盖像鸵鸟一样反向弯曲的腿，腿部设计重视弹性和能量效率。它是最早在户外用机器学习控制跑步步态的双足机器人之一，被很多高校用来做强化学习运控和仿真到真机迁移研究。2022 年它以 24.73 秒创下双足机器人 100 米跑吉尼斯纪录。Agility 后来在它的腿部基础上加了上身，做成人形机器人 Digit。","example":"伯克利等团队在 Cassie 上用强化学习训练行走策略，再从仿真迁移到真机。","related":["Agility Robotics","双足机器人","反关节（鸟腿）","Agility Digit 人形机器人","强化学习运控","仿真到现实迁移"]},{"id":"agility-robotics-digit","category":"robot","sec":6,"tier":2,"sources":[{"title":"Agility Unveils Digit 5 Humanoid Robot Built for Cooperatively Safe Work at Scale","url":"https://www.agilityrobotics.com/content/agility-unveils-digit-5-humanoid-robot-built-for-cooperatively-safe-work-at-scale"},{"title":"Agility Robotics Digit Specs & Price | Humanoid.guide","url":"https://humanoid.guide/product/digit/"}],"as_of":"2026-09","related_ids":["agility-robotics","bipedal-robot","agility-robotics-cassie","robofab","tote-handling","robot-as-a-service"],"name":"Agility Digit 人形机器人","alt":"Agility Robotics Digit (incl. Digit 5)","abbr":"Digit","aliases":["Digit","Digit 4","Digit 5"],"one_liner":"Agility Robotics 的反关节双足人形机器人，主打仓储物流中搬运料箱","explanation":"Digit 是美国 Agility Robotics 研发的双足人形机器人，腿部沿用前代 Cassie 的反关节设计（像鸟腿，膝盖向后弯），上身有双臂和简化的末端执行器，主要在仓库里搬运料箱（塑料周转箱）。上一代 Digit 身高约 1.75 米、负载约 16 kg，已在 GXO 等物流企业按「机器人即服务」付费部署，公司还建了 RoboFab 工厂生产。2026 年 9 月 15 日发布的第五代 Digit 5 主打「协作安全」：用多种传感器和独立安全控制器监测周围的人，靠近到不安全距离时自动避让或停止，目标是不设安全围栏也能和工人同场作业；官方称截至 2026 年 5 月多年期订单已超 3 亿美元，2027 年上半年开始早期交付、年底全面供货。","example":"Digit 在 GXO 仓库里把料箱从货架搬到传送带，是较早付费商用的人形机器人之一。","related":["Agility Robotics","双足机器人","Agility Cassie","Agility RoboFab 工厂","料箱搬运","机器人即服务"]},{"id":"apptronik-apollo","category":"robot","sec":6,"tier":2,"sources":[{"title":"Apptronik 官网","url":"https://apptronik.com/"},{"title":"Apptronik - Apollo 2","url":"https://apptronik.com/apollo/apollo-2"},{"title":"Apptronik Opens 90,000 Sq Ft Testing Site for New Apollo 2 Humanoid (A3)","url":"https://www.automate.org/robotics/industry-insights/apptronik-opens-90-000-sq-ft-testing-site-for-new-apollo-2-humanoid/aph"}],"as_of":"2026-07","related_ids":["apptronik","humanoid-robot","gemini-robotics","google-deepmind","wheeled-humanoid-robot","tote-handling"],"name":"Apptronik Apollo","alt":"Apptronik Apollo","abbr":"","aliases":["Apollo","Apollo 2"],"one_liner":"美国 Apptronik 公司的通用人形机器人，瞄准物流和制造中的搬运","explanation":"Apollo 是美国得州公司 Apptronik 于 2023 年发布的人形机器人，身高约 1.73 米、重约 73 kg、负载约 25 kg，设计目标是在仓库和工厂里搬箱子、运料箱，电池可更换。Apptronik 源自得州大学奥斯汀分校的机器人实验室，Apollo 使用自研电动执行器。2026 年 6 月发布的 Apollo 2 提供双足和轮式底盘两种形态，定位是训练与数据平台，据报道有 35 个自由度（其中手部 12 个）；机队在公司的 Robot Park 场地和客户现场持续采集真实数据，与 Google DeepMind 合作训练 Gemini Robotics 系列模型。据报道公司把 Apollo 3 定为首款正式商用产品，目标 2027 年。","example":"Apptronik 与梅赛德斯-奔驰合作，在其工厂试点用 Apollo 搬运零件料箱。","related":["Apptronik","人形机器人","Gemini Robotics","谷歌 DeepMind","轮式人形机器人","料箱搬运"]},{"id":"sanctuary-ai-phoenix","category":"robot","sec":6,"tier":3,"sources":[{"title":"Robotics 24/7: Sanctuary AI Unveils Phoenix, Sixth Generation Humanoid","url":"https://www.robotics247.com/article/sanctuary_ai_unveils_phoenix_sixth_generation_humanoid_general_purpose_robot"},{"title":"RoboZaps: Sanctuary AI Phoenix 2026 status","url":"https://blog.robozaps.com/b/sanctuary-ai-phoenix-review"}],"as_of":"2026-06","related_ids":["sanctuary-ai","humanoid-robot","dexterous-hand","hydraulic-actuation","teleoperation","general-purpose-robot"],"name":"Sanctuary Phoenix","alt":"Sanctuary AI Phoenix","abbr":"","aliases":["Phoenix"],"one_liner":"加拿大 Sanctuary AI 的通用人形机器人，以液压灵巧手著称","explanation":"Phoenix 是加拿大温哥华公司 Sanctuary AI 做的通用人形机器人，2023 年 5 月发布第六代，2024 年 4 月、12 月又相继推出第七、第八代。公司公布的第六代参数：身高约 170 厘米、体重约 70 千克、负载约 25 千克。最突出的是液压驱动的灵巧手，每只约 21 个自由度并带触觉反馈；控制软件叫 Carbon，早期大量依靠人通过遥操作（远程操纵）采集示范数据再训练。据报道，Sanctuary 在 2024–2025 年经历裁员和管理层变动，2026 年转向给其他公司的工业机器人提供 AI 软件，Phoenix 没有公开销售。","example":"据报道，Sanctuary 曾在零售门店试点中让 Phoenix 完成理货、贴标签等上百项任务，其中不少由人遥操作完成。","related":["Sanctuary AI","人形机器人","灵巧手","液压驱动","遥操作","通用机器人"]},{"id":"neura-robotics-4ne1","category":"robot","sec":6,"tier":3,"sources":[{"title":"Humanoid Robot 4NE1 for Work and Life（NEURA Robotics）","url":"https://neura-robotics.com/products/4ne1/"},{"title":"Automatica 2025: NEURA Robotics unveils 3rd generation 4NE1 humanoid（Robotics 24/7）","url":"https://www.robotics247.com/article/automatica-2025-neura-robotics-unveils-3rd-generation-4ne1-humanoid/food"}],"as_of":"2025-06","related_ids":["neura-robotics","humanoid-robot","electronic-skin","human-robot-collaboration","full-size-humanoid-robot","exteroception"],"name":"NEURA 4NE1","alt":"NEURA Robotics 4NE1","abbr":"","aliases":["4NE-1"],"one_liner":"德国 NEURA Robotics 的通用人形机器人，强调全身传感和人机协作","explanation":"4NE1 是德国 NEURA Robotics 研发的人形机器人，第三代于2025年6月在慕尼黑 Automatica 展首发。官网参数：身高180厘米、重80千克、行走速度5千米/时，标称负载10–100千克。它配有覆盖机身的传感器皮肤和360度感知，用来察觉周围环境和人，便于安全地与人协作；软件上结合语言模型、计算机视觉和强化学习，支持远程操作和可更换前臂，另有轮式等变体。据报道它全身约55个自由度（每只手12个），双电池设计可轮换以接近全天运行。NEURA 还推出面向科研教育的小尺寸版 4NE1 Mini，官网称计划2026年春交付。它是欧洲人形机器人的代表产品之一。","example":"高校可预订 4NE1 Mini，用于具身智能教学和算法验证。","related":["NEURA Robotics","人形机器人","电子皮肤","人机协作","全尺寸人形机器人","外部感知"]},{"id":"mentee-robotics-menteebot","category":"robot","sec":6,"tier":3,"sources":[{"title":"Mobileye To Acquire Mentee Robotics to Accelerate Physical AI Leadership（Mobileye News）","url":"https://www.mobileye.com/news/mobileye-to-acquire-mentee-robotics-to-accelerate-physical-ai-leadership/"},{"title":"Mobileye acquires humanoid robot startup Mentee Robotics for $900M（TechCrunch）","url":"https://techcrunch.com/2026/01/06/mobileye-acquires-humanoid-robot-startup-mentee-robotics-for-900m"}],"as_of":"2026-01","related_ids":["mentee-robotics","mobileye","humanoid-robot","vision-only-approach","sim-to-real-transfer","hot-swappable-battery"],"name":"MenteeBot","alt":"Mentee Robotics MenteeBot","abbr":"","aliases":["MenteeBot V3","Menteebot 3.0"],"one_liner":"以色列 Mentee Robotics 的通用人形机器人，公司2026年被 Mobileye 收购","explanation":"MenteeBot 是以色列初创公司 Mentee Robotics 研发的通用人形机器人。公司约2022年由 Mobileye 创始人 Amnon Shashua 与 Lior Wolf（任 CEO）等人创立。据报道第三代 MenteeBot 身高约175厘米、体重约70千克、负载约25千克、约40个自由度，只用相机感知（侧后方鱼眼相机实现360度视野），采用自研电机与执行器、带触觉的机械手和热插拔电池，训练大量依赖仿真到现实迁移。官方强调场景理解、自然语言指令跟随，以及不靠遥操作的端到端自主执行。2026年1月6日，Mobileye 宣布以约9亿美元收购 Mentee，计划2026年做首批客户概念验证部署、2028年量产。","example":"按收购公告的规划，MenteeBot 将在2026年进入客户现场，做不依赖遥操作的自主作业概念验证。","related":["Mentee Robotics","Mobileye","人形机器人","纯视觉方案","仿真到现实迁移","热插拔电池"]},{"id":"foundation-robotics-phantom","category":"robot","sec":6,"tier":3,"sources":[{"title":"US firm Foundation plans to build 50,000 humanoid robots by 2027 - Interesting Engineering","url":"https://interestingengineering.com/military/us-foundation-build-50000-humanoid-robots"},{"title":"Foundation Emerges With Phantom Humanoid - Humanoids Daily","url":"https://www.humanoidsdaily.com/news/foundation-emerges-with-phantom-humanoid-betting-on-novel-actuators-and-hybrid-ai"}],"as_of":"2025-12","related_ids":[null,null,null,null,null,null],"name":"Foundation Phantom","alt":"Foundation Robotics Phantom","abbr":"","aliases":["Phantom","Phantom MK1"],"one_liner":"美国 Foundation 公司的全尺寸人形，明确面向工业和军事高危任务。","explanation":"Phantom 是美国旧金山初创公司 Foundation（Foundation Robotics，2023 年由 Sankaet Pathak 创立）推出的全尺寸人形机器人，当前型号为 Phantom MK1。据报道身高约 1.75 m、体重约 80 kg，使用自研可反驱摆线执行器，感知以相机为主、不依赖激光雷达。和多数人形公司主打工厂或家庭不同，Foundation 公开把国防列为重点方向，目标任务包括侦察、排爆等「让机器人先进去」的高危作业，并强调人类保留致命决策权。公司提出激进量产目标：据报道计划 2026 年部署约 1 万台、2027 年底累计 5 万台，租赁价约每台每年 10 万美元。这些是计划而非已实现数字。","example":"Foundation 设想在排爆场景中让 Phantom 先进入可疑区域执行查看和处置，操作员在远处监督。","related":["Foundation(Foundation Robotics)","全尺寸人形机器人(Full-size Humanoid Robot)","特种机器人(Special-purpose Robot)","摆线减速器(Cycloidal Reducer)","纯视觉方案(Vision-Only Approach)","机器人租赁(Robot Rental)"]},{"id":"clone-robotics-protoclone","category":"robot","sec":6,"tier":3,"sources":[{"title":"Watch creepy humanoid robot twitch and move with human-like skeleton - Interesting Engineering","url":"https://interestingengineering.com/innovation/video-worlds-first-humanoid-lifelike-muscles"},{"title":"Clone Robotics' Protoclone Has Over 1,000 Myofiber Artificial Muscles - TechEBlog","url":"https://www.techeblog.com/clone-robotics-protoclone-musculoskeletal-android-demo-video/"}],"as_of":"2025-02","related_ids":["artificial-muscle","bio-inspired-robot","humanoid-robot","pneumatic-artificial-muscle","uncanny-valley","clone-robotics"],"name":"Clone Protoclone","alt":"Clone Robotics Protoclone","abbr":"","aliases":["Protoclone","Protoclone V1","肌肉骨骼仿生人形"],"one_liner":"Clone Robotics 做的仿人体肌肉骨骼人形，用上千根人工肌肉代替电机。","explanation":"Protoclone 是初创公司 Clone Robotics 在 2025 年 2 月公开的「肌肉骨骼人形机器人」样机 V1。它不走电机加减速器的常规路线，而是照着人体结构做：聚合物骨架仿照人体 206 块骨头，用 1000 多根名为 Myofiber 的流体驱动人工肌肉拉动关节，号称有 200 多个自由度；身上约 500 个传感器，包括头部 4 个深度相机、约 70 个惯性单元和 320 个压力传感点，目前由一台 500 W 电动泵供能。公开视频里它被悬挂着抽动四肢，还没展示自主行走。它的意义在于探索「仿生驱动」这条路：人工肌肉若能做到够快够有力，机器人的柔顺性和外形会更接近人，但控制难度也高得多。","example":"Protoclone V1 的发布视频里，机器人面部空白、吊在支架上，四肢靠人工肌肉收缩抽动，引发大量「恐怖谷」讨论。","related":["人工肌肉","仿生机器人","人形机器人","气动人工肌肉","恐怖谷","Clone Robotics"]},{"id":"hexagon-aeon","category":"robot","sec":6,"tier":3,"sources":[{"title":"Hexagon launches AEON, a humanoid built for industry - Hexagon Robotics","url":"https://robotics.hexagon.com/hexagon-launches-aeon-a-humanoid-built-for-industry/"},{"title":"Hexagon Enters Humanoid Arena with AEON Robot for Industry - Humanoids Daily","url":"https://www.humanoidsdaily.com/news/hexagon-enters-humanoid-arena-with-aeon-robot-for-industry"}],"as_of":"2025-06","related_ids":["wheel-legged-robot","humanoid-robot","industrial-robot","autonomous-battery-swapping","nvidia","maxon"],"name":"Hexagon AEON","alt":"Hexagon AEON","abbr":"","aliases":["AEON","海克斯康 AEON"],"one_liner":"瑞典海克斯康 2025 年发布的轮足式工业人形机器人，可自主换电","explanation":"AEON 是瑞典测量技术公司海克斯康（Hexagon）在 2025 年 6 月 17 日发布的工业人形机器人，由其机器人部门研发。下肢是「轮足」：有腿，脚部是轮子，兼顾移动速度和姿态调整。据报道身高 165 cm、体重 60 kg、34 个自由度、负载 15 kg，配 12 个摄像头和多种传感器。它有电池更换机制，可不停机连续工作。目标场景是汽车、航空、物流等行业的上下料、零件检测和现实捕捉（用传感器扫描生成三维数字模型）。合作方包括英伟达、微软和 maxon（执行器），舍弗勒和皮拉图斯是首批试点客户。","example":"在飞机零件厂，AEON 手持扫描设备绕着部件走一圈，生成用于质检的三维数字模型。","related":["轮足机器人","人形机器人","工业机器人","自主换电","英伟达","Maxon"]},{"id":"humanoid-hmnd-01","category":"robot","sec":6,"tier":3,"sources":[{"title":"Humanoid Unveils Record Breaking Bipedal Robot Walking 48 Hours After Assembly - Humanoid","url":"https://thehumanoid.ai/humanoid-unveils-record-breaking-bipedal-robot-walking-48-hours-after-assembly/"},{"title":"HMND 01 ALPHA WHEELED - Humanoid","url":"https://thehumanoid.ai/hmnd-01-alpha-wheeled/"}],"as_of":"2025-12","related_ids":["humanoid","wheeled-humanoid-robot","bipedal-robot","humanoid-robot","proof-of-concept","palletizing-depalletizing"],"name":"Humanoid HMND 01","alt":"Humanoid HMND 01","abbr":"","aliases":["HMND 01","HMND 01 Alpha","HMND 01 Alpha Wheeled","HMND 01 Alpha Bipedal"],"one_liner":"英国公司 Humanoid 的工业人形机器人，有轮式和双足两个版本","explanation":"HMND 01 是英国伦敦公司 Humanoid 的人形机器人产品线，面向工业和物流。先是 2025 年 9 月推出的 HMND 01 Alpha 轮式版：上半身人形，下半身为全向轮式底盘，据报道最大速度 7.2 km/h、负载 15 kg，已完成首批商业概念验证，用于仓库拣选、堆垛等任务。2025 年 12 月 2 日又发布双足版 HMND 01 Alpha Bipedal：身高 179 cm，29 个自由度（不含手），双臂负载 15 kg，续航 3 小时且电池可更换，可选 12 自由度灵巧手或简易夹爪；官方称它组装完成后 48 小时内就实现了稳定行走。","example":"在物流仓库里，HMND 01 轮式版从货架取件并码放到托盘上。","related":["Humanoid（英国人形机器人公司）","轮式人形机器人","双足机器人","人形机器人","概念验证","码垛 / 拆垛"]},{"id":"rainbow-robotics-rb-y1","category":"robot","sec":6,"tier":3,"sources":[{"title":"RB-Y1 (Rainbow Robotics)","url":"https://rainbow-robotics.com/en/products/rb-y1/"},{"title":"Rainbow Robotics unveils RB-Y1 wheeled, two-armed robot (The Robot Report)","url":"https://www.therobotreport.com/rainbow-robotics-unveils-rb-y1-wheeled-two-armed-robot/"}],"as_of":"2025-01","related_ids":["rainbow-robotics","wheeled-humanoid-robot","mobile-manipulation","bimanual-manipulation","samsung-electronics","mobile-manipulator"],"name":"彩虹机器人 RB-Y1","alt":"Rainbow Robotics RB-Y1","abbr":"","aliases":["RB-Y1"],"one_liner":"韩国 Rainbow Robotics 的轮式双臂人形移动操作平台。","explanation":"RB-Y1 是韩国 Rainbow Robotics（由参与研发 HUBO 人形的 KAIST 团队创立，三星电子 2025 年初增持成为最大股东）在 2024 年 3 月公开的轮式人形机器人：上身两条 7 自由度手臂，腰部是一条 6 自由度的「单腿」躯干，可弯腰、升降，下面是轮式底盘。官网参数：整机约 131 公斤，高约 1.4 米，单臂负载约 3 公斤，底盘最高行驶速度约 1.5 米/秒。它用轮子代替双腿，省掉了平衡控制的难题，把重点放在双臂操作和移动操作上，因此常被当作采集示教数据、训练 VLA 等策略的科研平台。","example":"研究者用 VR 遥操作 RB-Y1 在室内走到桌边、弯腰用双手搬起箱子，并记录数据训练模仿学习策略。","related":["Rainbow Robotics","轮式人形机器人","移动操作","双臂操作","三星电子（机器人业务）","复合机器人"]},{"id":"dexmate-vega-series","category":"robot","sec":6,"tier":3,"sources":[{"title":"Dexmate Opens Preorders for Vega Mobile Humanoid Robot - Mike Kalil","url":"https://mikekalil.com/blog/dexmate-vega/"},{"title":"Vega - Dexmate Store","url":"https://shop.dexmate.com/products/vega"}],"as_of":"2026-09","related_ids":["wheeled-humanoid-robot","dual-arm-robot","mobile-manipulation","dexterous-hand","lifting-column","unified-robot-description-format"],"name":"Dexmate Vega 轮式双臂人形","alt":"Dexmate Vega Series","abbr":"","aliases":["Vega","Dexmate Vega"],"one_liner":"美国 Dexmate 的轮式双臂人形，躯干可折叠升降，面向科研和数据采集。","explanation":"Vega 是美国加州圣克拉拉初创公司 Dexmate 的首款通用机器人，2025 年开放预订，早期带灵巧手的配置标价约 8.99 万美元；截至 2026 年 9 月，官网在售的 Vega 1 Pro 标价 7.2 万美元（不含手）。它下半身是全向轮式底盘，上半身是双臂加头部的人形结构，最有特点的是可折叠升降躯干：收起约 66 cm 方便运输，伸展后可够到约 2.2 m 高处。早期公开资料称全身约 36 个自由度（含双手）、每条臂负载约 7 kg；现款 Vega 1 Pro 本体 24 个自由度（双臂各 7、躯干 3、头部 3、底盘 4），末端的 6 自由度灵巧手或夹爪需另选，带 RGBD 相机、激光雷达、力/力矩传感器等，续航 10 小时以上，并提供 Python API 和可导入仿真器的 URDF/USD 模型。它属于轮式人形这一路线：放弃双足行走，换取稳定、续航和便于做操作研究。","example":"实验室可以用 Vega 做移动操作数据采集，让它在家庭场景里从高柜取物再放到桌面。","related":["轮式人形机器人","双臂机器人","移动操作","灵巧手","升降柱","统一机器人描述格式"]},{"id":"sunday-robotics-memo","category":"robot","sec":6,"tier":3,"sources":[{"title":"Sunday Robotics 官网","url":"https://www.sunday.ai/"},{"title":"SiliconANGLE: Sunday raises $165M at $1.15B valuation to launch Memo","url":"https://siliconangle.com/2026/03/12/sunday-raises-165m-1-15b-valuation-launch-memo-household-robot/"}],"as_of":"2026-03","related_ids":["sunday-robotics","skill-capture-glove","sunday-robotics-act-1","robot-free-data-collection","household-tasks","mobile-manipulation"],"name":"Sunday Memo","alt":"Sunday Robotics Memo","abbr":"","aliases":["Memo"],"one_liner":"Sunday Robotics 的轮式双臂家务机器人，靠人戴手套采的数据训练","explanation":"Memo 是美国创业公司 Sunday Robotics 的家用机器人，2025 年 11 月随公司结束隐身一同发布；公司由 ACT/ALOHA 作者 Tony Zhao 和 Diffusion Policy/UMI 作者迟宬（Cheng Chi）创办。形态是轮式底座加可升降躯干和两条带夹爪的手臂，外覆硅胶软壳，官网称可降到地面、升到约 7 英尺高。它最大的特点是训练数据不靠机器人遥操作，而是让人戴「技能采集手套」在真实家庭里做家务采集，再训练自家模型 ACT-1。演示任务有收餐桌、装洗碗机、叠袜子、做浓缩咖啡。官网称手工造一台约 2 万美元，计划 2026 年底小规模内测；2026 年 3 月据报道完成 1.65 亿美元融资、估值 11.5 亿美元。","example":"Memo 把餐桌上的碗碟和玻璃杯收走并逐个放进洗碗机，是它的代表性长程演示。","related":["Sunday Robotics","技能采集手套","Sunday ACT-1","无本体采集","家务任务","移动操作"]},{"id":"weave-robotics-isaac","category":"robot","sec":6,"tier":3,"sources":[{"title":"Weave Robotics 官网","url":"https://www.weaverobotics.com/"},{"title":"Isaac 1 产品页","url":"https://www.weaverobotics.com/isaac-1"}],"as_of":"2026-09","related_ids":["household-tasks","garment-manipulation","remote-teleoperation-takeover","consumer-grade-robot","1x-neo","sunday-robotics-memo"],"name":"Weave Isaac","alt":"Weave Robotics Isaac","abbr":"","aliases":["Isaac","Isaac 0","Isaac 1"],"one_liner":"美国 Weave Robotics 的家用机器人系列，从叠衣服做起。","explanation":"Isaac 是美国加州公司 Weave Robotics 的家用机器人产品线。Isaac 0 是固定式叠衣机器人，只做一件事：把洗好的衣服叠整齐，已在美国加州交付，官网称现场累计运行超过 2000 小时。Isaac 1 是可移动的双臂版本：轮式底盘、可伸缩躯干（高约 0.9–1.75 m）、两条 6 自由度手臂配单自由度夹手，能收脏衣服、叠衣、铺床、收拾玩具和鞋子。它默认自主运行，必要时由远程人员遥操作协助。售价 7999 美元或每月 449 美元订阅，官网称 2026 年秋季首批交付。","example":"Isaac 0 放在家里洗衣区，自动把一篮烘干的衣服逐件叠好。","related":["家务任务","衣物操作","远程接管（人工兜底）","消费级机器人","1X NEO","Sunday Memo"]},{"id":"lg-cloid","category":"robot","sec":6,"tier":3,"sources":[{"title":"LG Electronics Presents LG CLOiD Home Robot at CES 2026 - LG Newsroom","url":"https://www.lg.com/global/newsroom/news/home-appliance-solution/lg-electronics-presents-lg-cloid-home-robot-to-demonstrate-zero-labor-home-at-ces-2026/"},{"title":"CES 2026: LG to debut new CLOiD humanoid robot for the home - The Robot Report","url":"https://www.therobotreport.com/ces-2026-lg-to-debut-new-cloid-humanoid-robot-for-the-home/"}],"as_of":"2026-01","related_ids":["wheeled-humanoid-robot","household-tasks","vision-language-action-model","garment-manipulation","consumer-electronics-show","consumer-grade-robot"],"name":"LG CLOiD","alt":"LG CLOiD","abbr":"","aliases":["CLOiD 家用人形","LG CLOiD 家用机器人"],"one_liner":"LG 在 CES 2026 发布的轮式家用人形机器人，演示做饭和叠衣。","explanation":"CLOiD 是 LG 电子在 2026 年 1 月 CES 上展示的家用机器人，围绕 LG 提出的「零家务之家」概念。它是轮式底盘加人形上身：躯干高度可在约 105–143 cm 间调节，双臂各 7 个自由度、臂展约 87 cm，两只手各有五根独立驱动的手指。头部集成芯片、屏幕、摄像头和扬声器。LG 称它搭载视觉语言模型和 VLA 模型，用数万小时家务数据训练，并能通过 ThinQ 平台联动 LG 家电。现场演示了从冰箱取牛奶、把可颂放进烤箱、启动洗衣并叠衣服。发布时未公布售价和上市时间。","example":"CES 2026 展台上，CLOiD 从冰箱取出牛奶、把可颂放进烤箱准备早餐。","related":["轮式人形机器人","家务任务","视觉-语言-动作模型","衣物操作","CES 国际消费电子展","消费级机器人"]},{"id":"hrp-humanoid-robot-series","category":"robot","sec":6,"tier":3,"sources":[{"title":"Humanoid Robotics Project - Wikipedia","url":"https://en.wikipedia.org/wiki/Humanoid_Robotics_Project"},{"title":"Development of a humanoid robot prototype, HRP-5P, capable of heavy labor - Phys.org","url":"https://phys.org/news/2018-11-humanoid-robot-prototype-hrp-5p-capable.html"},{"title":"HRP-4 - ROBOTS Guide (IEEE Spectrum)","url":"https://robotsguide.com/robots/hrp4"}],"as_of":"2018-11","related_ids":["humanoid-robot","honda-asimo","zero-moment-point","zmp-preview-control","bipedal-locomotion","model-based-control"],"name":"HRP 系列人形机器人","alt":"HRP Humanoid Robot Series (AIST HRP-2 / HRP-4 / HRP-5P)","abbr":"HRP","aliases":["HRP-2","HRP-4","HRP-4C","HRP-5P","Humanoid Robotics Project"],"one_liner":"日本产综研与川田工业开发的经典人形机器人系列，双足行走研究的老平台","explanation":"HRP 系列是日本产业技术综合研究所（AIST）与川田工业等企业合作开发的人形机器人，名字来自日本经济产业省支持的「人形机器人项目」（Humanoid Robotics Project）。代表型号：2002 年发布的 HRP-2，长期被当作双足行走和全身控制的研究平台；2010 年亮相的 HRP-4，更轻更纤细，另有女性外观的 HRP-4C；2018 年的 HRP-5P，面向重体力劳动，演示过搬运并安装大块石膏板。这一系列以基于零力矩点（ZMP）的步行控制著称，是强化学习运控兴起之前「基于模型的人形控制」的代表。","example":"HRP-5P 自主识别并抬起一块石膏板，走到墙边把它装上。","related":["人形机器人","本田 ASIMO","零力矩点","ZMP 预观控制","双足行走","基于模型的控制"]},{"id":"icub","category":"robot","sec":6,"tier":3,"sources":[{"title":"The iCub humanoid robot: an open platform for research in embodied cognition","url":"https://www.academia.edu/2732397/The_iCub_humanoid_robot_an_open_platform_for_research_in_embodied_cognition"},{"title":"Developing Advanced Control Software for the iCub Humanoid Robot - MathWorks","url":"https://it.mathworks.com/company/technical-articles/developing-advanced-control-software-for-the-icub-humanoid-robot.html"}],"as_of":"","related_ids":["humanoid-robot","embodied-cognition","small-size-humanoid-robot","open-source-hardware","softbank-robotics-nao"],"name":"iCub","alt":"iCub (Istituto Italiano di Tecnologia)","abbr":"","aliases":["iCub 人形机器人","iCub3"],"one_liner":"意大利技术研究院开发的儿童大小开源人形机器人，用于认知研究。","explanation":"iCub 起源于 2004 年启动的欧盟 RobotCub 项目，由意大利技术研究院（IIT）主导研发，目标是研究具身认知：智能是否要靠身体和环境交互才能长出来。它身高约 104 cm、重约 22 kg，像个小孩，全身 53 个自由度，其中手和眼睛、头颈占了很大比例，方便研究抓握和视觉注意。硬件设计和软件（基于 YARP 中间件）以 GPL 等开源协议发布，全球有 50 多家研究机构在用。后来 IIT 又做了更高的 iCub3，用于远程化身遥操作。","example":"研究者让 iCub 像婴儿一样反复摆弄玩具，观察它能否靠自己的动作学会物体概念。","related":["人形机器人","具身认知","小尺寸人形机器人","开源硬件","NAO 机器人"]},{"id":"nasa-valkyrie","category":"robot","sec":6,"tier":3,"sources":[{"title":"Valkyrie (robot)（Wikipedia）","url":"https://en.wikipedia.org/wiki/Valkyrie_(robot)"},{"title":"VALKYRIE R5 Fact Sheet（NASA）","url":"https://www.nasa.gov/wp-content/uploads/2023/06/r5-fact-sheet.pdf"}],"as_of":"2015","related_ids":["humanoid-robot","darpa-robotics-challenge","whole-body-control","boston-dynamics-atlas","bipedal-robot","florida-institute-for-human-and-machine-cognition"],"name":"NASA Valkyrie 人形机器人","alt":"NASA Valkyrie (R5)","abbr":"","aliases":["Valkyrie","R5","女武神"],"one_liner":"NASA 约翰逊航天中心研制的全电动人形机器人，编号 R5","explanation":"Valkyrie（编号 R5）是 NASA 约翰逊航天中心2012年10月开始研制的全电动双足人形机器人，最初为参加美国 DARPA 机器人挑战赛（DRC，考验机器人在灾后环境中开车、开门、爬梯等能力）而造，2013年7月完成原型。它身高约1.87米、重约129千克、44个自由度，电池续航约1小时。2013年12月 DRC 预赛中因网络故障一分未得。之后 NASA 把它转向太空应用，设想让它在人类登陆前先到其他星球干活：一方面举办以其仿真模型为对象的太空机器人挑战赛，另一方面在2015年把两台 R5 交给 MIT 和美国东北大学的研究团队。它是研究人形全身控制、平衡与远程操作的经典科研平台。","example":"","related":["人形机器人","DARPA 机器人挑战赛","全身控制","液压版 Atlas","双足机器人","IHMC（美国人机认知研究所）"]},{"id":"pal-robotics-talos","category":"robot","sec":6,"tier":3,"sources":[{"title":"TALOS | High-Performance Humanoid Robot (PAL Robotics)","url":"https://pal-robotics.com/robot/talos/"},{"title":"TALOS: A new humanoid research platform targeted for industrial applications","url":"https://hal.science/hal-01485519v1/file/iros-talos.pdf"}],"as_of":"2026-09","related_ids":["humanoid-robot","torque-control","whole-body-control","joint-torque-sensor","crocoddyl","pal-robotics-tiago"],"name":"TALOS 人形机器人","alt":"PAL Robotics TALOS","abbr":"","aliases":["TALOS"],"one_liner":"西班牙 PAL Robotics 做的全尺寸、全关节力矩控制的科研人形机器人。","explanation":"TALOS 是西班牙 PAL Robotics 在 2017 年前后推出的双足人形科研平台，身高约 1.75 米、体重约 95 公斤，全身 32 个自由度，官方称所有主要关节都带力矩传感器，脚踝和手腕另装 4 个六维力传感器，关节间用 EtherCAT 总线（一种工业实时通信协议）通信，单臂伸直可负载约 6 公斤。它的卖点是能做力矩控制（直接指定关节输出多大力，而不只是指定转到哪个角度），因此常被欧洲实验室用来验证全身控制、接触规划、轨迹优化等基于模型的算法。和如今强化学习驱动的新一代人形相比，它更像一台「力控研究用的标准样机」。","example":"法国 LAAS-CNRS 团队长期用 TALOS 做实验，其开源的 Pinocchio、Crocoddyl 等动力学与最优控制库都在它身上验证过。","related":["人形机器人","力矩控制","全身控制","关节力矩传感器","Crocoddyl","TIAGo"]},{"id":"softbank-robotics-nao","category":"robot","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Nao (robot)","url":"https://en.wikipedia.org/wiki/Nao_(robot)"},{"title":"The Robot Report: Aldebaran, maker of Pepper and Nao robots, put in receivership","url":"https://www.therobotreport.com/aldebaran-pepper-nao-robots-receivership/"}],"as_of":"2025-07","related_ids":["small-size-humanoid-robot","softbank-robotics-pepper","robocup","softbank-group","research-and-education-market","human-robot-interaction"],"name":"NAO 机器人","alt":"SoftBank Robotics NAO","abbr":"","aliases":["NAO","Nao"],"one_liner":"法国 Aldebaran 做的 58 厘米小型人形机器人，长期用于教育和 RoboCup","explanation":"NAO 是法国 Aldebaran Robotics 研发的小型双足人形机器人，第一版在 2000 年代后期推出。2012–2013 年软银收购 Aldebaran，之后改名 SoftBank Robotics，所以常叫「软银 NAO」；2022 年又被德国 United Robotics Group 买下并改回 Aldebaran 之名。第六代 NAO V6（2018 年）身高约 57 厘米、重约 5.2 千克，有 25 个自由度，带摄像头、麦克风和触摸传感器，可以用图形化工具或 Python 编程。它多年是 RoboCup 标准平台组的指定机型，也是全球高校和中小学最常见的教学人形之一。据报道，Aldebaran 2025 年进入破产管理，随后资产被深圳公司 Maxvision（盛视科技）收购。","example":"RoboCup 标准平台组的机器人足球比赛里，各队用的都是同一款 NAO，只比软件。","related":["小尺寸人形机器人","Pepper 机器人","RoboCup 机器人世界杯","软银集团","科研教育市场","人机交互"]},{"id":"softbank-robotics-pepper","category":"robot","sec":6,"tier":3,"sources":[{"title":"The Robot Report: Aldebaran, maker of Pepper and Nao robots, put in receivership","url":"https://www.therobotreport.com/aldebaran-pepper-nao-robots-receivership/"},{"title":"Humanoid Index: Pepper by SoftBank Robotics","url":"https://humanoidindex.org/robots/pepper"}],"as_of":"2025-07","related_ids":["service-robot","companion-robot","softbank-robotics-nao","wheeled-humanoid-robot","guided-tours-and-reception","softbank-group"],"name":"Pepper 机器人","alt":"SoftBank Robotics Pepper","abbr":"","aliases":["Pepper"],"one_liner":"软银 2014 年发布的轮式陪伴接待机器人，胸前带平板，主打对话和情绪识别","explanation":"Pepper 是软银与旗下 Aldebaran 共同开发的社交服务机器人，2014 年 6 月发布，2015 年在日本开售。它身高约 1.2 米，上半身是人形（头、双臂、手），下半身是三轮全向移动底座，不会走路；胸前有一块 10.1 英寸平板，约 20 个自由度。卖点是语音对话和识别人的表情情绪，主要用在商场导购、银行和酒店接待、教育等场景。它证明了「会聊天的人形」难以撑起商业需求：据报道软银 2021 年前后已暂停生产，2025 年相关资产随 Aldebaran 一起被收购。","example":"2015–2018 年日本不少手机店和银行门口放着 Pepper 做迎宾和业务介绍。","related":["服务机器人","陪伴机器人","NAO 机器人","轮式人形机器人","导览接待","软银集团"]},{"id":"sophia","category":"robot","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Sophia (robot)","url":"https://en.wikipedia.org/wiki/Sophia_(robot)"},{"title":"World Economic Forum: A robot has just been granted citizenship of Saudi Arabia","url":"https://www.weforum.org/stories/2017/10/a-robot-has-just-been-granted-citizenship-of-saudi-arabia/"}],"as_of":"2017-11","related_ids":["hyper-realistic-humanoid-robot","uncanny-valley","engineered-arts-ameca","human-robot-interaction","pre-programmed-motion","demo"],"name":"Sophia（索菲亚）机器人","alt":"Sophia (Hanson Robotics)","abbr":"","aliases":["索菲亚","Sophia the Robot"],"one_liner":"香港 Hanson Robotics 的仿真人脸社交机器人，因获沙特「公民身份」出名","explanation":"Sophia 是香港公司 Hanson Robotics（创始人 David Hanson）开发的社交人形机器人，2016 年 2 月激活，同年 3 月在美国 SXSW 大会首次公开亮相。它的重点是一张能做出几十种表情的仿真人脸，身体动作能力很弱，早期版本没有腿。2017 年 10 月沙特阿拉伯授予它「公民身份」，同年 11 月成为联合国开发计划署首位非人类「创新大使」，由此成为媒体明星。研究者普遍批评它的对话很大程度依赖预设脚本，宣传夸大了 AI 能力。它常被用来讨论恐怖谷效应和机器人营销与真实能力的差距。","example":"Sophia 在各类大会上的「即兴问答」，被多方报道为事先准备好的问题和答案。","related":["超仿生人形机器人","恐怖谷","Ameca 表情人形","人机交互","预编程动作（动作编排）","Demo（演示视频）"]},{"id":"engineered-arts-ameca","category":"robot","sec":6,"tier":3,"sources":[{"title":"Ameca (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Ameca_(robot)"},{"title":"Ameca Humanoid Robot From Engineered Arts to Debut at CES 2022 - Robotics 24/7","url":"https://www.robotics247.com/article/ameca_humanoid_robot_engineered_arts_debuts_ces_2022"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"Ameca 表情人形","alt":"Engineered Arts Ameca","abbr":"","aliases":["Ameca"],"one_liner":"英国 Engineered Arts 做的人形机器人，以逼真面部表情著称。","explanation":"Ameca 是英国康沃尔公司 Engineered Arts 于 2021 年开发、2022 年 1 月在 CES 首次公开展示的人形机器人。它有灰色橡胶面部和双手，刻意设计成不分性别，头部和面部有大量小型执行器，能做出眨眼、皱眉、惊讶等细腻表情；驱动软件是公司的 Tritium 云端机器人操作系统，可接入大语言模型进行对话。Ameca 不能自主行走，主要用于展会、博物馆、接待和人机交互研究。它常被用来讨论恐怖谷效应（仿人程度很高但不完全像人时让人不适），也说明人形机器人除了运动和操作，还有「表情交互」这条分支。","example":"展会上 Ameca 接入大语言模型与观众对话，回答时配合挑眉、微笑等表情，视频在社交网络上广泛传播。","related":["人形机器人(Humanoid Robot)","超仿生人形机器人(Hyper-realistic (Bionic) Humanoid Robot / Android)","恐怖谷(Uncanny Valley)","人机交互(Human-Robot Interaction)","Sophia（索菲亚）机器人(Sophia (Hanson Robotics))","导览接待(Guided Tours & Reception)"]},{"id":"pollen-robotics-reachy-2","category":"robot","sec":6,"tier":3,"sources":[{"title":"Reachy 2 - The open-source humanoid for embodied AI (Pollen Robotics)","url":"https://pollen-robotics.com/reachy-2/"},{"title":"Hugging Face buys a humanoid robotics startup (TechCrunch)","url":"https://techcrunch.com/2025/04/14/hugging-face-buys-a-humanoid-robotics-startup"}],"as_of":"2025-04","related_ids":["pollen-robotics","hugging-face","pollen-robotics-reachy-mini","upper-body-humanoid-robot","vr-teleoperation","lerobot"],"name":"Reachy 2","alt":"Pollen Robotics Reachy 2","abbr":"","aliases":["Reachy"],"one_liner":"法国 Pollen Robotics 的开源上半身人形机器人，主打 VR 遥操作与科研。","explanation":"Reachy 2 是法国 Pollen Robotics 在 2024 年 10 月推出的开源人形科研平台，2025 年 4 月 Pollen 被 Hugging Face 收购。它是上半身人形：两条 7 自由度手臂，单臂可举约 3 公斤，头部和手腕用自研的 Orbita 并联关节，配平行夹爪，头部有 RGB-D 相机和 ToF 深度传感器，可选装三个全向轮加激光雷达的移动底盘。软件基于 ROS 2，提供 Python 接口，官方配 VR 遥操作，方便采集示教数据训练模仿学习策略。据报道，带移动底盘的完整版约 7 万多美元。","example":"研究者戴 VR 头显遥操作 Reachy 2 叠衣服、收拾桌面，录下的数据用 LeRobot 训练 ACT 等策略。","related":["Pollen Robotics","Hugging Face","Reachy Mini 桌面机器人","半身人形机器人","VR 遥操作","LeRobot"]},{"id":"pollen-robotics-reachy-mini","category":"robot","sec":6,"tier":3,"sources":[{"title":"Reachy Mini - The Open-Source Robot for Today's and Tomorrow's AI Builders (Hugging Face Blog)","url":"https://huggingface.co/blog/reachy-mini"},{"title":"Hugging Face and Pollen Robotics launch $299 Reachy Mini robot (Investing.com)","url":"https://www.investing.com/news/company-news/hugging-face-and-pollen-robotics-launch-299-reachy-mini-robot-93CH-4128614"}],"as_of":"2026-09","related_ids":["pollen-robotics","hugging-face","pollen-robotics-reachy-2","companion-robot","open-source-hardware","human-robot-interaction"],"name":"Reachy Mini 桌面机器人","alt":"Pollen Robotics Reachy Mini","abbr":"","aliases":["Reachy Mini"],"one_liner":"Hugging Face 与 Pollen 推出的几百美元级开源桌面小机器人。","explanation":"Reachy Mini 是 Hugging Face 和其收购的 Pollen Robotics 在 2025 年 7 月推出的开源桌面机器人，高约 28 厘米、重约 1.5 公斤，以套件形式出售、用户自己组装。它没有手臂，只有一个 6 自由度的头部、可整体旋转的身体和两根会动的天线，带广角相机、4 个麦克风和扬声器，主要用来做表情、对话、人机交互类 AI 应用。分两个版本：Lite 版需连电脑运行，无线版自带树莓派、Wi-Fi 和电池。发布时起售价 299 美元（Lite）和 449 美元（无线版），目前官网标价为 399 和 499 美元。编程用开源 Python SDK，并可在 Hugging Face 上分享应用。","example":"开发者把语音识别和大语言模型接到 Reachy Mini 上，让它听到名字就转头看人并用天线做出回应。","related":["Pollen Robotics","Hugging Face","Reachy 2","陪伴机器人","开源硬件","人机交互"]},{"id":"hugging-face-hopejr","category":"robot","sec":6,"tier":3,"sources":[{"title":"Hugging Face unveils two new humanoid robots - TechCrunch","url":"https://techcrunch.com/2025/05/29/hugging-face-unveils-two-new-humanoid-robots/"},{"title":"Hugging Face Launches 2 New Affordable Humanoid Robots - Technology Org","url":"https://www.technology.org/2025/05/30/hugging-face-launches-2-new-affordable-humanoid-robots/"}],"as_of":"2025-05","related_ids":["hugging-face","lerobot","pollen-robotics-reachy-mini","pollen-robotics","open-source-hardware","so-100-so-101-arm"],"name":"HopeJR 开源人形","alt":"Hugging Face HopeJR","abbr":"","aliases":["HopeJR","Hope JR"],"one_liner":"Hugging Face 2025 年公布的开源全尺寸人形机器人，66 自由度、约 3000 美元","explanation":"HopeJR 是 Hugging Face 在 2025 年 5 月底公布的开源全尺寸人形机器人，和桌面机器人 Reachy Mini 同时发布；发布前一个月，Hugging Face 刚收购了法国人形机器人公司 Pollen Robotics。HopeJR 有 66 个可驱动自由度，能行走和活动双臂，预计售价约 3000 美元，硬件设计开源。它属于 Hugging Face 以 LeRobot 为核心的开源机器人路线，意义在于把人形机器人硬件价格压到普通实验室和个人开发者够得着的水平，方便大家复现、改装和采数据。","example":"学生团队按开源设计组装 HopeJR，配合 LeRobot 采集示范数据训练操作策略。","related":["Hugging Face","LeRobot","Reachy Mini 桌面机器人","Pollen Robotics","开源硬件","SO-100 / SO-101 机械臂"]},{"id":"berkeley-humanoid-lite","category":"robot","sec":6,"tier":3,"sources":[{"title":"Demonstrating Berkeley Humanoid Lite (arXiv 2504.17249)","url":"https://arxiv.org/abs/2504.17249"},{"title":"Berkeley Humanoid Lite project page","url":"https://lite.berkeley-humanoid.org/"}],"as_of":"2025-04","related_ids":["open-source-hardware","small-size-humanoid-robot","cycloidal-reducer","3d-printing","berkeley-artificial-intelligence-research","sim-to-real-transfer"],"name":"伯克利 Humanoid Lite","alt":"Berkeley Humanoid Lite","abbr":"","aliases":[],"one_liner":"伯克利开源的小型人形机器人，零件大多能用桌面 3D 打印机打出来。","explanation":"Berkeley Humanoid Lite 由加州大学伯克利分校 Hybrid Robotics 实验室在 2025 年 4 月发布（论文 arXiv 2504.17249，发表于 RSS 2025）。它身高约 0.8 m、重约 16 kg，关节用 3D 打印的摆线减速器配电机，整机硬件、代码和训练环境全部开源，据论文估算零件成本在美国约 4,300 美元、在中国约 3,200 美元，整体低于 5,000 美元。它想解决的是人形机器人太贵、研究门槛太高的问题：学生可以自己打印、组装，再用 Isaac Lab 训练强化学习行走策略并部署到真机。","example":"团队用在仿真中训练的强化学习策略，让自己组装的 Humanoid Lite 在真机上完成行走。","related":["开源硬件","小尺寸人形机器人","摆线减速器","3D 打印（FDM / 光固化）","伯克利人工智能研究实验室","仿真到现实迁移"]},{"id":"toddlerbot","category":"robot","sec":6,"tier":3,"sources":[{"title":"ToddlerBot 项目主页","url":"https://toddlerbot.github.io/"},{"title":"ToddlerBot: Open-Source ML-Compatible Humanoid Platform for Loco-Manipulation (arXiv)","url":"https://arxiv.org/abs/2502.00893"}],"as_of":"2025-09","related_ids":["small-size-humanoid-robot","open-source-hardware","humanoid-robot","sim-to-real-transfer","diffusion-policy","vr-teleoperation"],"name":"ToddlerBot","alt":"ToddlerBot","abbr":"","aliases":[],"one_liner":"斯坦福开源的幼儿大小人形机器人，全身3D打印，面向机器学习研究","explanation":"ToddlerBot 是斯坦福大学 Haochen Shi、Weizhuo Wang、宋舒然（Shuran Song）、C. Karen Liu 等人做的开源小尺寸人形机器人，论文发表于 CoRL 2025。它高约 0.56 米、重约 3.4 公斤（论文版本，后续版本略重，约 3.7 公斤），有 30 个主动自由度（每条手臂 7 个、每条腿 6 个、颈部和腰部各 2 个），整机 3D 打印、用市售零件，总成本低于 6000 美元，并公开了代码和组装文档。它要解决的是人形机器人又贵又怕摔、很难拿来大量采数据和做实验的问题：摔坏了能快速修，研究者可以放心跑强化学习行走、VR 遥操作采数据、训练扩散策略做抓取推箱等全身任务，也常被拿来验证仿真到现实迁移。","example":"论文中用 VR 遥操作采集演示数据，再训练扩散策略让 ToddlerBot 完成抓取、推动等全身操作任务。","related":["小尺寸人形机器人","开源硬件","人形机器人","仿真到现实迁移","扩散策略","VR 遥操作"]},{"id":"disney-research-bdx-droid","category":"robot","sec":6,"tier":3,"sources":[{"title":"Design and Control of a Bipedal Robotic Character - Disney Research","url":"https://la.disneyresearch.com/publication/design-and-control-of-a-bipedal-robotic-character/"},{"title":"Design and Control of a Bipedal Robotic Character - arXiv","url":"https://arxiv.org/html/2501.05204v1"},{"title":"BDX Droids - Disney Research","url":"https://la.disneyresearch.com/bdx-droids/"}],"as_of":"2025","related_ids":["bipedal-robot","rl-based-locomotion-control","motion-tracking","open-duck-mini","sim-to-real-transfer","newton-physics-engine"],"name":"迪士尼 BDX 机器人","alt":"Disney Research BDX Droid","abbr":"","aliases":["BDX","BD-X","BDX Droids"],"one_liner":"迪士尼做的星战风双足小机器人，用强化学习把动画师设计的动作搬到真机上。","explanation":"BDX 是迪士尼研究院与华特迪士尼幻想工程团队开发的双足角色机器人，外形像《星球大战》里的小机器人，在迪士尼乐园等场合与游客互动。它的技术要点写在论文《Design and Control of a Bipedal Robotic Character》（RSS 2024）里：动画师先做出带情绪的走路、张望等动作，再用强化学习在仿真中训练控制策略，让真机既能表演这些动作、又能稳住平衡；运行时由动画引擎混合多个动画片段生成指令，操作员用遥控器触发。它展示了「表演性动作 + 稳健运控」可以兼得。2025 年它还在英伟达 GTC 上同台亮相，开源社区也据此做了复刻项目 Open Duck Mini。","example":"BDX 在乐园里摇头晃脑地走向游客、歪头「打招呼」，这些情绪化动作来自动画师设计、由强化学习策略执行。","related":["双足机器人","强化学习运控","运动跟踪","Open Duck Mini","仿真到现实迁移","Newton 物理引擎"]},{"id":"open-duck-mini","category":"robot","sec":6,"tier":3,"sources":[{"title":"apirrone/Open_Duck_Mini（GitHub）","url":"https://github.com/apirrone/Open_Duck_Mini"},{"title":"apirrone/Open_Duck_Playground（GitHub）","url":"https://github.com/apirrone/Open_Duck_Playground"}],"as_of":"2025-02","related_ids":["disney-research-bdx-droid","open-source-hardware","mujoco-playground","sim-to-real-transfer","bipedal-robot","pollen-robotics"],"name":"Open Duck Mini","alt":"Open Duck Mini","abbr":"","aliases":["Open Duck"],"one_liner":"仿迪士尼 BDX 机器人的开源小型双足机器人，物料目标400美元内","explanation":"Open Duck Mini 是 GitHub 开发者 apirrone 发起的开源项目，目标是复刻迷你版的迪士尼 BDX 机器人（迪士尼乐园里那种会走路、动作很有表现力的小型双足角色机器人）。v2 版腿伸直约42厘米高，物料成本目标低于400美元，机载电脑是树莓派 Zero 2W，代码以 Apache-2.0 协议开源，项目得到 Hugging Face 和 Pollen Robotics 赞助。行走策略在 MuJoCo 仿真里用强化学习训练，导出为 ONNX 模型后部署到真机；项目还开源了参考动作生成器和基于 MuJoCo Playground 的训练环境。它是个人和学生低成本入门「仿真里训练双足行走、再迁移到真机」的热门项目。","example":"爱好者按开源图纸3D打印外壳组装 Open Duck Mini，把在 MuJoCo Playground 里训练的行走策略导出为 ONNX，部署到树莓派上运行。","related":["迪士尼 BDX 机器人","开源硬件","MuJoCo Playground","仿真到现实迁移","双足机器人","Pollen Robotics"]},{"id":"boston-dynamics-bigdog","category":"robot","sec":7,"tier":3,"sources":[{"title":"BigDog - Wikipedia","url":"https://en.wikipedia.org/wiki/BigDog"},{"title":"BigDog - ROBOTS: Your Guide to the World of Robotics","url":"https://robotsguide.com/robots/bigdog"}],"as_of":"","related_ids":["quadruped-robot","boston-dynamics","hydraulic-actuation","boston-dynamics-spot","dynamic-stability","push-recovery"],"name":"波士顿动力 BigDog（大狗）","alt":"Boston Dynamics BigDog","abbr":"","aliases":["BigDog","大狗机器人"],"one_liner":"波士顿动力 2005 年起研发的军用液压四足机器人，动态平衡腿足机器人的代表作。","explanation":"BigDog 由波士顿动力联合哈佛大学 Concord 野外站等单位研发，2005 年起由 DARPA 资助，目标是给士兵在复杂地形上驮物资。它长约 1 m、重约 109 kg，用内燃机带动液压泵驱动四条腿，据报道可负重约 150 kg。它最出名的是被人踹一脚、在冰面打滑后还能自己站稳的视频，让「动态平衡」的腿足机器人第一次被大众看到。后续军用版 LS3 因噪音太大等原因未被列装。它的技术路线延续到了后来的电动四足 Spot。","example":"BigDog 演示视频中，工程师侧踹机身、机器人在冰面上打滑，都能调整步伐恢复平衡。","related":["四足机器人","波士顿动力","液压驱动","波士顿动力 Spot","动态稳定","推恢复"]},{"id":"boston-dynamics-spot","category":"robot","sec":7,"tier":1,"sources":[{"title":"Boston Dynamics Launches Commercial Sales of Spot Robot","url":"https://bostondynamics.com/news/boston-dynamics-launches-commercial-sales-of-spot-robot/"},{"title":"Spot | Boston Dynamics","url":"https://bostondynamics.com/products/spot/"}],"as_of":"2020-06","related_ids":["quadruped-robot","boston-dynamics","inspection-robot","legged-mobile-manipulator","anybotics-anymal","unitree-go2"],"name":"波士顿动力 Spot","alt":"Boston Dynamics Spot","abbr":"","aliases":["Spot","Spot 机器狗"],"one_liner":"波士顿动力的商用四足机器狗，主要用于工业巡检","explanation":"Spot 是波士顿动力推出的四足机器人，2020 年 6 月开放商业销售，当时基础套件标价 74,500 美元（现改为询价）。它四条腿共 12 个自由度，自重约 32.5 公斤，背上可载约 14 公斤，最高速度约 1.6 米/秒，能上下楼梯、走坡地和碎石路。背部留有扩展接口，可加装机械臂、热成像相机、激光雷达等载荷，常用于工厂、电站的自动巡检和危险场所勘察。它是最早规模化商用的足式机器人之一，也常被当作四足机器人的代表。","example":"电厂用 Spot 按固定路线巡检，读仪表、测设备温度。","related":["四足机器人","波士顿动力","巡检机器人","足式移动操作机器人（带臂四足）","ANYmal 四足","宇树 Go2"]},{"id":"boston-dynamics-stretch","category":"robot","sec":7,"tier":3,"sources":[{"title":"Boston Dynamics' Stretch robot handles truck unloading & palletizing (The Robot Report)","url":"https://www.therobotreport.com/boston-dynamics-stretch-robot-truck-unloading-palletizing/"},{"title":"Stretch - ROBOTS: Your Guide to the World of Robotics","url":"https://robotsguide.com/robots/bdstretch"}],"as_of":"2026-09","related_ids":["boston-dynamics","palletizing-depalletizing","vacuum-suction-cup","mobile-manipulator","tote-handling","real-world-deployment"],"name":"波士顿动力 Stretch","alt":"Boston Dynamics Stretch","abbr":"","aliases":["Stretch 仓储卸货机器人"],"one_liner":"波士顿动力的仓储卸货机器人，用吸盘从货柜里自动搬箱子。","explanation":"Stretch 是波士顿动力 2021 年发布的第一款专用于仓储的机器人，用来干卸货柜、卸卡车这类又累又重复的活。结构是四轮全向移动底盘，上面装一条定制的 7 自由度机械臂，末端是多吸盘的智能夹爪，底盘上的感知桅杆负责识别箱子。它能把箱子从货柜里取出放到传送带上，据官方宣称每小时最多搬约 800 箱、单箱最重约 23 kg（50 磅），电池续航约 8 小时。它说明了在明确场景里，非人形的专用形态往往比人形更快落地。","example":"物流仓库里，Stretch 开进集装箱把纸箱逐个吸起放上伸缩传送带完成卸车。","related":["波士顿动力","码垛 / 拆垛","真空吸盘","复合机器人","料箱搬运","场景落地"]},{"id":"mit-mini-cheetah","category":"robot","sec":7,"tier":2,"sources":[{"title":"MIT: Mini cheetah is the first four-legged robot to do a backflip","url":"https://robotics.mit.edu/mini-cheetah-first-four-legged-robot-do-backflip/"},{"title":"IEEE Spectrum: How MIT's Mini Cheetah Can Help Accelerate Robotics Research","url":"https://spectrum.ieee.org/mit-mini-cheetah-accelerate-research"}],"as_of":"2019-03","related_ids":["quadruped-robot","quasi-direct-drive","mit-mini-cheetah-actuator","mit-mode","legged-robot","unitree-robotics"],"name":"MIT Mini Cheetah","alt":"MIT Mini Cheetah","abbr":"","aliases":["迷你猎豹"],"one_liner":"MIT 仿生机器人实验室的小型四足机器人，2019 年首个完成后空翻。","explanation":"Mini Cheetah 是 MIT 仿生机器人实验室（Sangbae Kim 团队）做的小型四足机器人，重约 20 磅（约 9 kg），12 个模块化电机，每条腿有髋部 2 个自由度加膝关节 1 个。2019 年它成为首个做出后空翻的四足机器人。它最大的影响在执行器设计：高扭矩密度电机配低减速比行星减速器（准直驱），既能承受冲击又能反驱、靠电流估计力矩，这套「MIT Cheetah 执行器」和配套的 MIT 模式电机指令后来被宇树等大量厂商借鉴。团队还把多台借给其他实验室，成为早期强化学习运控研究的常用平台。","example":"MIT 团队用离线轨迹优化算出后空翻的动作和各电机力矩，让 Mini Cheetah 在真机上完成后空翻。","related":["四足机器人","准直驱","MIT Cheetah 执行器","MIT 模式","足式机器人","宇树科技"]},{"id":"anybotics-anymal","category":"robot","sec":7,"tier":3,"sources":[{"title":"ANYmal - ANYbotics","url":"https://www.anybotics.com/robotics/anymal/"},{"title":"ANYmal - Robotic Systems Lab, ETH Zurich","url":"https://rsl.ethz.ch/robots-media/anymal.html"}],"as_of":"2026-09","related_ids":["quadruped-robot","anybotics","eth-zurich-robotic-systems-lab","anymal-rl-locomotion-series","inspection-robot","perceptive-locomotion"],"name":"ANYmal 四足","alt":"ANYbotics ANYmal","abbr":"","aliases":["ANYmal"],"one_liner":"瑞士 ANYbotics 的工业巡检四足机器人，也是四足强化学习研究的经典平台。","explanation":"ANYmal 源自苏黎世联邦理工（ETH Zurich）机器人系统实验室，2016 年第一版问世，同年团队成立 ANYbotics 做商业化。现款 ANYmal D 自重约 50 kg，可挂载约 10 kg 的检测载荷；ANYmal X 是面向石化等有爆炸风险场所的防爆版。它主要卖给电厂、油气、化工做自主巡检，替人读表、测温、听异响。在学术圈，ANYmal 是足式运控研究的标志性平台：执行器网络（用神经网络拟合电机特性）、教师-学生蒸馏的盲走、结合地形感知的感知行走等代表工作都在它身上完成并发表于 Science Robotics。","example":"ETH 的 Miki 等人 2022 年让 ANYmal 结合外部感知和本体感知，走完瑞士埃策尔山（Etzel）的登山徒步路线。","related":["四足机器人","ANYbotics","苏黎世联邦理工机器人系统实验室","ANYmal 强化学习运控系列（执行器网络 / 教师-学生盲走 / 感知行走）","巡检机器人","感知行走"]},{"id":"ghost-robotics-vision-60","category":"robot","sec":7,"tier":3,"sources":[{"title":"Vision 60 | Ghost Robotics","url":"https://www.ghostrobotics.io/vision-60"},{"title":"LIG Nex1 takes controlling shares of Ghost Robotics for $240M - The Robot Report","url":"https://www.therobotreport.com/lig-nex1-takes-controlling-shares-of-ghost-robotics-for-240m/"}],"as_of":"2025-12","related_ids":["quadruped-robot","boston-dynamics-spot","anybotics-anymal","special-purpose-robot","ingress-protection-rating","legged-mobile-manipulator"],"name":"Ghost Vision 60 四足","alt":"Ghost Robotics Vision 60","abbr":"","aliases":["Vision 60","V60"],"one_liner":"美国 Ghost Robotics 的中型全天候四足机器人，主要用于国防和安防","explanation":"Vision 60 是美国费城 Ghost Robotics 公司的中型四足机器人，官方称 Q-UGV（四足无人地面车辆），主要用于国防、安防和工业巡检。公开参数：自重约 51 kg，负载约 10 kg，IP67 防护（防尘、可短时浸水），工作温度 −40 至 55 °C，最高速度约 3 m/s，单次充电行程约 10 km。它从 2020 年底起在美国空军多个基地用于巡逻。2024 年 7 月，韩国防务公司 LIG Nex1 完成收购其 60% 股权，交易额约 2.4 亿美元。和波士顿动力 Spot 相比，它更强调恶劣环境下的耐用性，可挂载传感器、机械臂等任务载荷。","example":"美国空军基地用 Vision 60 挂载摄像头沿围界自动巡逻。","related":["四足机器人","波士顿动力 Spot","ANYmal 四足","特种机器人","IP 防护等级","足式移动操作机器人（带臂四足）"]},{"id":"amazon-vulcan","category":"robot","sec":7,"tier":3,"sources":[{"title":"About Amazon：Introducing Vulcan, Amazon's first robot with a sense of touch","url":"https://www.aboutamazon.com/news/operations/amazon-vulcan-robot-pick-stow-touch"},{"title":"Amazon Science：How Amazon's Vulcan robots use touch to plan and execute motions","url":"https://www.amazon.science/blog/how-amazons-vulcan-robots-use-touch-to-plan-and-execute-motions"}],"as_of":"2025-05","related_ids":["amazon-robotics","tactile-sensor","six-axis-force-torque-sensor","vacuum-suction-cup","order-picking","contact-rich-manipulation"],"name":"Amazon Vulcan 触觉拣货机器人","alt":"Amazon Vulcan","abbr":"","aliases":["Vulcan"],"one_liner":"亚马逊首款带力觉「触觉」的仓储拣货机器人","explanation":"Vulcan 是亚马逊 2025 年 5 月在德国多特蒙德发布的仓储机器人，官方称是其首款有「触觉」的机器人。它的末端靠力反馈传感器感知何时接触物体、用多大力，从而在塞满商品的货架格子里推开别的东西、把货放进去或取出来。末端有两种：一种像直发夹板、带小传送带，用于存货；另一种是带相机的吸盘臂，用于拣货。它能处理仓库里约 75% 的商品，主要负责工人够不着的货架最高层和最低层，已在美国斯波坎和德国汉堡的仓库使用。","example":"Vulcan 用夹板把格子里的商品推向一侧，腾出空间后把新货塞进去。","related":["亚马逊机器人","触觉传感器","六维力传感器","真空吸盘","拣选（订单拣货）","接触丰富操作"]},{"id":"da-vinci-surgical-system-da-vinci-research-kit","category":"robot","sec":7,"tier":3,"sources":[{"title":"The da Vinci Research Kit (dVRK) - Intuitive Foundation","url":"https://www.intuitive-foundation.org/dvrk/"},{"title":"What is the dVRK? — dVRK documentation","url":"https://dvrk.readthedocs.io/main/pages/introduction/what_is_it.html"}],"as_of":"","related_ids":["surgical-robot","teleoperation","leader-follower-teleoperation","imitation-learning","robot-operating-system"],"name":"达芬奇手术机器人 / dVRK","alt":"da Vinci Surgical System / da Vinci Research Kit (dVRK)","abbr":"dVRK","aliases":["达芬奇","da Vinci","达芬奇研究套件"],"one_liner":"直觉外科的主从式微创手术机器人，dVRK 是它退役硬件改成的开源科研平台。","explanation":"达芬奇手术系统由美国直觉外科（Intuitive Surgical）研发，是最主流的微创手术机器人：医生坐在控制台看 3D 内窥镜画面，操纵主手，病床边的多条机械臂按比例复现动作，属于主从遥操作。dVRK（da Vinci Research Kit）是 2012 年起由约翰斯·霍普金斯大学、伍斯特理工学院和直觉外科合作搭建的科研平台：把退役达芬奇的机械臂和主手接上开源的电子、固件和软件，并与 ROS 集成，目前已部署在全球 40 多家机构。它让研究者能直接读写关节数据、录制手术演示，因此成了手术自动化、遥操作界面和手术场景模仿学习研究的通用实验台。","example":"约翰斯·霍普金斯大学等团队在 dVRK 上录制缝合、提针等演示，用模仿学习训练策略自主完成这些子任务。","related":["手术机器人","遥操作","主从臂遥操作","模仿学习","机器人操作系统"]},{"id":"unitree-g1","category":"robot","sec":8,"tier":1,"sources":[{"title":"Unitree G1 官网","url":"https://www.unitree.com/g1/"},{"title":"Unitree Robotics unveils G1 humanoid for $16K - The Robot Report","url":"https://www.therobotreport.com/unitree-robotics-unveils-g1-humanoid-for-16k/"}],"as_of":"2026-09","related_ids":["unitree-robotics","unitree-h1","small-size-humanoid-robot","unitree-rl-gym","unitree-sdk2","unitree-dex3-1"],"name":"宇树 G1","alt":"Unitree G1","abbr":"","aliases":["G1","Unitree G1"],"one_liner":"宇树科技的小型双足人形机器人，科研最常用的人形平台之一","explanation":"G1 是杭州宇树科技 2024 年 5 月发布的双足人形机器人，发布价 9.9 万元起（约 1.6 万美元），把人形机器人价格拉到了高校实验室买得起的区间。官网参数：站立高约 1.32 米、重约 35 公斤（含电池），全身 23–43 个关节电机（EDU 版可加腰部和灵巧手），单腿 6 自由度，续航约 2 小时，可折叠收纳。因为便宜、开放 SDK 且有现成的强化学习训练代码，它成为运动控制、全身遥操作和人形 VLA 论文最常用的真机之一。","example":"很多人形动作模仿论文（如 BeyondMimic、TWIST）都在宇树 G1 上做真机演示。","related":["宇树科技","宇树 H1","小尺寸人形机器人","unitree_rl_gym","宇树 SDK","宇树 Dex3-1 灵巧手"]},{"id":"unitree-r1","category":"robot","sec":8,"tier":2,"sources":[{"title":"Unitree launches $5,900 humanoid robot (Robotics and Automation News)","url":"https://roboticsandautomationnews.com/2025/07/29/shock-price-unitree-launches-5900-humanoid-robot/93357/"},{"title":"Unitree R1 – Unitree 官方商城","url":"https://shop.unitree.com/products/unitree-r1"}],"as_of":"2026-04","related_ids":[null,null,null,null,null],"name":"宇树 R1","alt":"Unitree R1","abbr":"","aliases":["R1","R1-Air","R1 EDU"],"one_liner":"宇树 2025 年推出的低价小型人形机器人，起售价约 3.99 万元","explanation":"R1 是宇树科技 2025 年 7 月发布的小尺寸人形机器人，身高约 1.23 米、体重约 25–29 kg（依版本），全身 20–26 个自由度（依版本），能侧手翻、倒地自己爬起、下坡跑。它最受关注的是价格：起售价约 3.99 万元人民币（约 5900 美元），还有更便宜的 R1-Air 版，把人形机器人拉到了个人开发者和学校买得起的区间，海外官方商城标价约 4900 美元。主要用于教育、科研和娱乐。","example":"高校实验室用几台 R1 做人形运动控制课程，学生在仿真里训练策略后直接上真机测试。","related":["宇树科技(Unitree Robotics)","小尺寸人形机器人(Small-size Humanoid Robot)","万元级人形机器人(10,000-Yuan-Class Humanoid Robot)","宇树 G1(Unitree G1)","消费级机器人(Consumer-Grade Robot)"]},{"id":"unitree-h1","category":"robot","sec":8,"tier":2,"sources":[{"title":"Unitree H1 - ROBOTS: Your Guide to the World of Robotics (IEEE)","url":"https://robotsguide.com/robots/unitree-h1"},{"title":"Unitree Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Unitree_Robotics"}],"as_of":"2025-02","related_ids":[null,null,null,null,null,null],"name":"宇树 H1","alt":"Unitree H1","abbr":"","aliases":["H1","H1-2"],"one_liner":"宇树第一款全尺寸通用人形机器人，曾创下人形跑步速度纪录","explanation":"H1 是宇树科技 2023 年 8 月发布的全尺寸双足人形机器人，身高约 1.8 米、体重约 47 kg，膝关节峰值扭矩约 360 N·m，头部带 3D 激光雷达和深度相机。它以运动能力出名，跑步速度达到 3.3 m/s，一度是全尺寸人形机器人的最快纪录；2025 年春晚《秧BOT》扭秧歌的就是 H1。后续升级版 H1-2 增加了手臂自由度（可独立活动的关节数）。H1 是较早能买到的全尺寸人形之一，很多人形全身控制、遥操作论文用它做实验。","example":"H2O、OmniH2O 等人形遥操作工作用 H1 做真机实验，让机器人实时模仿操作员的全身动作。","related":["宇树科技(Unitree Robotics)","全尺寸人形机器人(Full-size Humanoid Robot)","宇树 H2(Unitree H2)","宇树 G1(Unitree G1)","《秧BOT》(Yangbot (Unitree H1 Yangge Dance, 2025 Spring Festival Gala))","H2O（人到人形）(H2O: Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation)"]},{"id":"unitree-h2","category":"robot","sec":8,"tier":2,"sources":[{"title":"Unitree Unveils H2, a Full-Sized Humanoid Successor to the H1 (Humanoids Daily)","url":"https://www.humanoidsdaily.com/news/unitree-unveils-h2-humanoid-successor-to-h1"}],"as_of":"2025-10","related_ids":[null,null,null,null,null],"name":"宇树 H2","alt":"Unitree H2","abbr":"","aliases":["H2","H2 Plus"],"one_liner":"宇树 2025 年 10 月发布的新一代全尺寸人形机器人，H1 的继任者","explanation":"H2 是宇树科技 2025 年 10 月 20 日发布的全尺寸仿生人形机器人，身高约 1.8 米、体重约 70 kg，共 31 个自由度：每条腿 6 个、每只手臂 7 个、腰 3 个、脖子 2 个。和 H1 比，它不再追求跑得快，而是加了手臂和腰部的灵活度、可选装灵巧手，面向需要真正干活的操作任务；外形上还有仿生面部。发布视频里展示了舞蹈、拳击、武术动作和走秀。","example":"","related":["宇树科技(Unitree Robotics)","宇树 H1(Unitree H1)","全尺寸人形机器人(Full-size Humanoid Robot)","自由度(Degrees of Freedom)","宇树 G1(Unitree G1)"]},{"id":"agibot-expedition-a2-series","category":"robot","sec":8,"tier":2,"sources":[{"title":"AgiBot - Wikipedia","url":"https://en.wikipedia.org/wiki/AgiBot"},{"title":"AgiBot A2 Specs & Price | Humanoid.guide","url":"https://humanoid.guide/product/a2/"}],"as_of":"2025-11","related_ids":["agibot","humanoid-robot","wheeled-humanoid-robot","agibot-a3","agibot-genie-g1","7-dof-robot-arm"],"name":"智元 远征 A2 系列（A2 / A2-W）","alt":"AgiBot Expedition A2 Series (A2 Ultra / A2 Lite / A2-W)","abbr":"","aliases":["远征 A2","AgiBot A2","A2-W","A2 Ultra","A2 Lite"],"one_liner":"智元机器人 2024 年发布的远征系列人形机器人，含双足版和轮式版 A2-W","explanation":"远征 A2 是智元机器人（AgiBot）2024 年 8 月发布的人形机器人系列，主打交互服务和工业场景。双足版 A2 是全尺寸人形，据公开资料身高约 1.7–1.75 米，双臂各 7 个自由度，可配灵巧手；A2-W 是轮式底盘加双臂的版本，面向工厂物料搬运，不是简单给 A2 换上轮子；此后又细分出 A2 Ultra、A2 Lite 等配置。2025 年 11 月，一台 A2 从苏州走到上海，连续行走约 106 公里，创下吉尼斯世界纪录。A2 系列和精灵 G 系列、灵犀 X 系列一起构成智元的人形产品线，常见于展厅接待导览和工厂试点。","example":"2025 年 11 月，远征 A2 用三天从苏州走到上海，行走约 106 公里，获吉尼斯世界纪录。","related":["智元机器人","人形机器人","轮式人形机器人","智元 远征 A3","智元 精灵 G1","七自由度机械臂"]},{"id":"agibot-a3","category":"robot","sec":8,"tier":3,"sources":[{"title":"IT之家：智元新一代全尺寸人形机器人远征 A3 发布","url":"https://www.ithome.com/0/938/490.htm"},{"title":"腾讯新闻：智元机器人正式发布全新一代全尺寸人形机器人远征A3","url":"https://news.qq.com/rain/a/20260213A0788L00"}],"as_of":"2026-04","related_ids":["agibot","full-size-humanoid-robot","agibot-expedition-a2-series","commercial-robot-performances","dexterous-hand","hot-swappable-battery"],"name":"智元 远征 A3","alt":"AgiBot A3","abbr":"","aliases":["远征 A3","AgiBot Expedition A3"],"one_liner":"智元 2026 年推出的全尺寸双足人形机器人，主打舞台演艺和导览","explanation":"远征 A3 是智元机器人的新一代全尺寸人形机器人，2026 年 2 月首次发布，4 月的发布会公布了主要参数：身高 173 cm、体重 55 kg，标称续航 10 小时，支持快速换电。据报道全身 31 个主动自由度（颈 2、单臂 7、腰 3、单腿 6），手臂末端负载 3 kg，可换装灵巧手。它面向文娱商演、导览导购这类人机互动场景，带 UWB 厘米级定位（超宽带无线定位），用于上百台机器人同步编队表演。它是远征 A2 系列的后续型号。","example":"官方演示中多台远征 A3 靠厘米级定位对齐站位，完成整齐的群舞编排。","related":["智元机器人","全尺寸人形机器人","智元 远征 A2 系列（A2 / A2-W）","商演","灵巧手","热插拔电池"]},{"id":"agibot-genie-g1","category":"robot","sec":8,"tier":3,"sources":[{"title":"IT之家：智元机器人全系产品开售，精灵 G1 售价 45 万元","url":"https://www.ithome.com/0/876/106.htm"},{"title":"智元官网：精灵G1","url":"https://www.agibot.com.cn/a2dproduct/169.html"}],"as_of":"2025-08","related_ids":["agibot","wheeled-humanoid-robot","agibot-world","agibot-go-1","7-dof-robot-arm","teleoperation"],"name":"智元 精灵 G1","alt":"AgiBot Genie G1","abbr":"","aliases":["精灵 G1","AgiBot G1"],"one_liner":"智元的轮式双臂机器人，主要用于采数据和科研，AgiBot World 就是用它采的","explanation":"精灵 G1 是智元机器人的轮式双臂机器人：上身是两条 7 自由度机械臂，腰部可调节高度，下面是移动底盘，末端可装夹爪或灵巧手，身上共 8 个相机。它的主要用途是遥操作采集真机数据和做模型研究。智元与上海人工智能实验室在 2024 年底开源的 AgiBot World 数据集，就是由 100 台 G1 采集的，后来的 GO-1 模型也基于这批数据训练，所以 G1 的数据格式在业内用得很广。2025 年 8 月开售，面向科研教育，售价 45 万元。","example":"研究者下载 AgiBot World 数据集微调 VLA 时，数据里的本体就是精灵 G1。","related":["智元机器人","轮式人形机器人","AgiBot World 数据集","智元 GO-1（启元大模型）","七自由度机械臂","遥操作"]},{"id":"agibot-genie-g2","category":"robot","sec":8,"tier":3,"sources":[{"title":"IT之家：智元精灵 G2 新一代工业级交互式具身作业机器人发布","url":"https://www.ithome.com/0/889/866.htm"},{"title":"中国日报网：智元发布新一代工业级交互式具身作业机器人精灵G2","url":"https://qiye.chinadaily.com.cn/a/202510/16/WS68f0b2b8a310c4deea5ecac8.html"}],"as_of":"2025-10","related_ids":["agibot","agibot-genie-g1","wheeled-humanoid-robot","nvidia-jetson-thor","joint-impedance-control","hot-swappable-battery"],"name":"智元 精灵 G2","alt":"AgiBot Genie G2","abbr":"","aliases":["精灵 G2"],"one_liner":"智元 2025 年发布的工业级轮式双臂机器人，带力控手臂和灵巧手","explanation":"精灵 G2 是智元机器人 2025 年 10 月 16 日发布的轮式双臂机器人，定位工业级作业，是精灵 G1 的后续型号。硬件上用英伟达 Jetson Thor 做主控，双臂全部关节带力矩传感器，靠关节阻抗控制（让关节像弹簧一样受力会让）实现柔顺操作；可配 19 自由度灵巧手和触觉感知，5 自由度腰腿加全向底盘，双电池热插拔，配 360° 鱼眼相机和前后激光雷达用于导航避障。据报道已用于汽车零部件装配、内存条插接、物流供包和导览，首发时获数亿元订单。","example":"在汽车零部件产线上，G2 完成安全带锁芯的装配工序。","related":["智元机器人","智元 精灵 G1","轮式人形机器人","Jetson Thor","关节阻抗控制","热插拔电池"]},{"id":"agibot-lingxi-x1","category":"robot","sec":8,"tier":3,"sources":[{"title":"IT之家：智元机器人宣布灵犀 X1 面向全球开源","url":"https://www.ithome.com/0/804/935.htm"},{"title":"极客公园：智元灵犀X1软硬件全套图纸和代码全公开","url":"https://www.geekpark.net/news/342219"}],"as_of":"2024-10","related_ids":["agibot","small-size-humanoid-robot","open-source-hardware","joint-actuator-module","agibot-lingxi-x2","bipedal-robot"],"name":"智元 灵犀 X1","alt":"AgiBot Lingxi X1","abbr":"","aliases":["灵犀 X1"],"one_liner":"智元开源全套图纸和代码的小尺寸双足人形机器人","explanation":"灵犀 X1 是智元机器人内部 X-Lab（稚晖君团队）做的小尺寸双足人形机器人，身高约 1.3 m、重约 33 kg，2024 年 8 月亮相。2024 年 10 月 24 日，智元把它的软硬件全套图纸和代码开源到 GitHub，资料超过 1.2 GB。全身只用两款自研关节电机（PowerFlow R86、R52）拼装，关节中空走线，模块化设计，可以自己买零件复刻。对入门者来说，它的意义是提供了一份完整的人形机器人设计参考，而不只是一台成品。","example":"有开发者按开源的 BOM 和图纸采购零件，自己组装出一台灵犀 X1。","related":["智元机器人","小尺寸人形机器人","开源硬件","关节模组","智元 灵犀 X2","双足机器人"]},{"id":"agibot-lingxi-x2","category":"robot","sec":8,"tier":3,"sources":[{"title":"澎湃新闻：智元灵犀X2公布售价区间","url":"https://www.thepaper.cn/newsDetail_forward_30860019"},{"title":"IT之家：智元机器人全系产品开售","url":"https://www.ithome.com/0/876/106.htm"}],"as_of":"2025-08","related_ids":["agibot","agibot-lingxi-x1","small-size-humanoid-robot","edu-edition","bipedal-robot","guided-tours-and-reception"],"name":"智元 灵犀 X2","alt":"AgiBot Lingxi X2","abbr":"","aliases":["灵犀 X2"],"one_liner":"智元 2025 年推出的约 1.3 米双足人形机器人，面向交互和科研教育","explanation":"灵犀 X2 是智元机器人 2025 年 3 月 11 日发布的小尺寸双足人形机器人，灵犀 X1 的后续型号，身高约 1.3 m、体重约 34 kg，5 月开售。它强调运动能力和人机交互，演示过骑自行车、跳舞。版本较多：5 月首批开售的是交互版、Pro 探索版、Ultra 旗舰版，8 月又加了青春版；青春版 27 个自由度，探索版 31 个、可选装灵巧手或夹爪。据报道售价从十几万到三四十万元不等，2025 年 8 月青春版定价 9.8 万元，是智元价位最低的人形机器人之一。","example":"景区和展厅用灵犀 X2 青春版做迎宾、讲解等互动表演。","related":["智元机器人","智元 灵犀 X1","小尺寸人形机器人","EDU 版（科研教育版）","双足机器人","导览接待"]},{"id":"galbot-g1","category":"robot","sec":8,"tier":1,"sources":[{"title":"Galbot G1 官网","url":"http://www.galbot.com/g1/"},{"title":"银河通用的第一个人形机器人 GALBOT（腾讯新闻）","url":"https://news.qq.com/rain/a/20240616A06S3D00"}],"as_of":"2024-06","related_ids":["wheeled-humanoid-robot","graspvla","astrabrain","galbot-s1","mobile-manipulator","synthetic-data"],"name":"银河通用 Galbot G1","alt":"Galbot G1","abbr":"","aliases":["银河通用 G1","Galbot G1"],"one_liner":"银河通用的轮式双臂人形机器人，腿部可折叠升降","explanation":"Galbot G1 是北京银河通用机器人公司 2024 年 6 月发布的轮式人形机器人。它没有双足，而是把腿做成一条可折叠的升降腿，下接全向轮底盘，靠「跪」和「站」两种姿态覆盖离地 0–2.1 米的取放高度。官网参数：最高 1.73 米，双臂各 7 自由度，除底盘和末端外共 21 个自由度，单臂负载 5 公斤，续航约 8 小时，主控为英伟达 Orin。它主打商超、药房、工厂里的抓取与搬运，背后的抓取与导航模型大量用仿真合成数据训练。","example":"Galbot G1 在无人药房里按订单从货架上取药。","related":["轮式人形机器人","银河通用 GraspVLA","银河星脑 AstraBrain","银河通用 Galbot S1","复合机器人","合成数据"]},{"id":"galbot-s1","category":"robot","sec":8,"tier":3,"sources":[{"title":"双臂最大50KG负载、零遥操全自主作业，银河通用发布Galbot S1 - NE时代","url":"https://ne-time.cn/web/article/37805"},{"title":"银河通用发布首款工业级重载机器人，Galbot G1年出货破1200台 - 同花顺","url":"https://m.10jqka.com.cn/20260129/c674397841.shtml"}],"as_of":"2026-01","related_ids":["galbot-g1","mobile-manipulator","tote-handling","payload","autonomous-battery-swapping","industrial-robot"],"name":"银河通用 Galbot S1","alt":"Galbot S1","abbr":"","aliases":["银河通用 S1"],"one_liner":"银河通用的工业重载双臂移动机器人，双臂负载 50 kg，用于产线搬运","explanation":"Galbot S1 是银河通用在 2026 年 1 月发布的工业级重载机器人，面向工厂产线的物料搬运。构型是移动底盘加双臂，双臂最大负载 50 kg，操作空间覆盖 0–2.3 米高度，能从不同高度的货架上搬料箱。支持自主换电、可 24 小时连续作业，安全上用视觉加雷达多重冗余。官方强调它由自研搬运模型驱动、「零遥操、全自主」作业，已在真实工厂产线落地。它代表具身公司进入重体力工业场景的一类产品：比起人形外观，更看重负载、续航和连续作业。","example":"在工厂里，S1 自主识别料箱位置，从货架上搬下几十公斤的零件箱运到产线工位。","related":["银河通用 Galbot G1","复合机器人","料箱搬运","负载","自主换电","工业机器人"]},{"id":"galbot-et1","category":"robot","sec":8,"tier":3,"sources":[{"title":"银河通用首款双足机器人 Galbot ET1「星仔」亮相 - IT之家","url":"https://www.ithome.com/0/992/247.htm"},{"title":"原生智能体机器人「银河星仔」开启预订，24小时突破200台 - 中新网","url":"https://www.chinanews.com.cn/cj/2026/09-04/10690406.shtml"}],"as_of":"2026-09","related_ids":["galbot-g1","astrabrain","bipedal-robot","motion-tracking","world-robot-conference"],"name":"银河通用 Galbot ET1","alt":"Galbot ET1","abbr":"","aliases":["银河星仔","星仔"],"one_liner":"银河通用首款双足人形机器人，昵称「星仔」，主打实时交互和舞蹈","explanation":"Galbot ET1 是银河通用（Galbot）的首款双足人形机器人，昵称「银河星仔」，2026 年 8 月在世界机器人大会首次公开亮相。银河通用此前的主力产品 Galbot G1 是轮式双臂构型，ET1 则换成双足，面向文旅导览、演艺和商业展示。它搭载银河星脑 AstraBrain 的智能体模型，不靠预设脚本，能实时理解语音指令并生成语音和动作；现场演示了街舞、手撑地、倒立，以及实时识别并跟随真人舞者的动作。9 月 3 日开启预订，据报道 24 小时预订量超过 200 台。","example":"展会上真人舞者即兴跳一段，ET1 实时识别动作并同步跟跳。","related":["银河通用 Galbot G1","银河星脑 AstraBrain","双足机器人","运动跟踪","世界机器人大会"]},{"id":"ubtech-walker-x","category":"robot","sec":8,"tier":3,"sources":[{"title":"UBTech 官网: Walker X","url":"https://www.ubtrobot.com/en/humanoid/products/walker-x"}],"as_of":"2026-09","related_ids":["ubtech-robotics","ubtech-walker-s2","humanoid-robot","bipedal-locomotion","dexterous-hand","guided-tours-and-reception"],"name":"优必选 Walker X","alt":"UBTech Walker X","abbr":"","aliases":["Walker X"],"one_liner":"优必选的双足服务型人形机器人，主打展厅导览与交互","explanation":"Walker X 是优必选（UBTech）的商用双足人形机器人，据报道在 2021 年世界人工智能大会上发布，是其 Walker 系列从研发样机走向商用展示的一代。官网参数：身高 130 厘米、重 63 公斤，全身 41 个自由度（双腿各 6、双臂各 7、双手各 6、颈部 3），最高步行速度 3 公里/小时，续航约 2 小时；能上 15 厘米台阶、走 20 度斜坡，用 U-SLAM 做视觉导航，带 7 自由度手臂和 6 自由度力控仿人手，面部是两块柔性曲面屏，可显示多种表情。它主要用于展厅导览、接待和科研展示；优必选后来面向工厂的产品线是 Walker S 系列。","example":"在展会上，Walker X 自主走到展台前，用手拿起物品递给参观者并用屏幕表情互动。","related":["优必选","优必选 Walker S2","人形机器人","双足行走","灵巧手","导览接待"]},{"id":"ubtech-walker-s2","category":"robot","sec":8,"tier":2,"sources":[{"title":"UBTECH Walker S2 官网产品页","url":"https://www.ubtrobot.com/en/humanoid/products/walker-s2"},{"title":"全球首创！优必选工业人形机器人Walker S2实现自主换电（国家科技创新中心）","url":"https://www.ncsti.gov.cn/kjdt/scyq/bjjjjskfq/jkdt/202507/t20250721_210973.html"}],"as_of":"2025-12","related_ids":[null,null,null,null,null,null],"name":"优必选 Walker S2","alt":"UBTech Walker S2","abbr":"","aliases":["Walker S2","Walker S 系列","Walker S1"],"one_liner":"优必选 2025 年发布的工业人形机器人，能自己给自己换电池","explanation":"Walker S2 是优必选在 2025 年 7 月发布的全尺寸工业人形机器人，Walker S 系列的新一代。它最大的特点是自主换电：机器人用双臂把背后的电池取下、换上满电的，全程约 3 分钟，不用停机或人工介入，从而支持 7×24 小时连续作业（续航一直是人形机器人进厂的瓶颈）。据公开资料身高约 1.76 米，腰部可旋转约 ±162° 并能俯仰，可搬运 15 kg 负载。据报道它 2025 年拿到多笔上亿元订单，主要用于汽车工厂搬运、分拣等工位。","example":"在汽车总装车间搬运料箱，电量低时自己走到换电站用双手更换电池，然后回到工位继续干活。","related":["优必选(UBTech Robotics)","人形机器人(Humanoid Robot)","自主换电(Autonomous Battery Swapping)","热插拔电池(Hot-Swappable Battery)","进厂实训(In-Factory Training / Pilot Deployment)","优必选 Walker X(UBTech Walker X)"]},{"id":"ubtech-uworld-u1-series","category":"robot","sec":8,"tier":3,"sources":[{"title":"UBTech 官网: U1 PRO","url":"https://www.ubtrobot.com/en/humanoid/products/u1-pro"}],"as_of":"2026-09","related_ids":["hyper-realistic-humanoid-robot","ubtech-robotics","humanoid-robot","uncanny-valley","human-robot-interaction","engineered-arts-ameca"],"name":"优必选 优世界 U1","alt":"UBTech UWORLD U1 Series","abbr":"","aliases":["U1 PRO"],"one_liner":"优必选的超仿生人形机器人系列，外观按真人1:1仿制","explanation":"优世界 U1 是优必选（UBTech）推出的超仿生人形机器人系列。优必选官网把它单列为「超仿生人形机器人」（Ultra-Bionic Humanoids）类别，在售型号为 U1 PRO，并称自己在推进「1:1 全尺寸超仿生人形机器人」的量产。超仿生人形的特点是脸部和皮肤做得接近真人，重点在表情、对话等人机交互，而不是搬运、装配这类体力活，和优必选面向工厂的 Walker S 系列定位不同。官网未公开身高、自由度、价格等参数；「优世界」这一中文系列名和具体发布时间本条未能在官网核实，以官方后续信息为准。","example":"","related":["超仿生人形机器人","优必选","人形机器人","恐怖谷","人机交互","Ameca 表情人形"]},{"id":"fourier-gr-1","category":"robot","sec":8,"tier":2,"sources":[{"title":"Fourier Intelligence launches production version of GR-1 humanoid robot - The Robot Report","url":"https://www.therobotreport.com/fourier-intelligence-launches-production-version-of-gr-1-humanoid-robot/"},{"title":"GR-1 general-purpose humanoid robot will carry nearly its own weight - New Atlas","url":"https://newatlas.com/robotics/fourier-gr1-humanoid-robot/"}],"as_of":"2024","related_ids":["fourier","full-size-humanoid-robot","fourier-gr-2","fourier-gr-3","joint-actuator-module","idp3"],"name":"傅利叶 GR-1","alt":"Fourier GR-1","abbr":"","aliases":["GR-1","GR1","Fourier GR1"],"one_liner":"傅利叶 2023 年发布的全尺寸人形机器人，国内较早量产交付的人形平台","explanation":"GR-1 是上海傅利叶（Fourier，原名傅利叶智能，早期以康复机器人起家）2023 年 7 月发布的通用人形机器人，身高约 1.65 米、体重约 55 kg，全身约 40 个自由度，关节采用自研 FSA 一体化执行器（把电机、减速器、驱动器、编码器集成在一起的关节模组），官方称最大负载约 50 kg、步行速度约 5 km/h。它是国内较早开放预售并批量交付给高校和研究机构的人形平台之一，不少人形操作研究（如 iDP3）都在它上面做实验。之后傅利叶又推出 GR-2、GR-3 等后续型号。","example":"iDP3（改进版 3D 扩散策略）论文用傅利叶 GR-1 做人形机器人的双臂操作实验。","related":["傅利叶","全尺寸人形机器人","傅利叶 GR-2","傅利叶 GR-3","关节模组","iDP3"]},{"id":"fourier-gr-2","category":"robot","sec":8,"tier":3,"sources":[{"title":"Fourier launches GR-2 humanoid, software platform - The Robot Report","url":"https://www.therobotreport.com/fourier-launches-gr-2-humanoid-software-platform/"},{"title":"Fourier's new GR-2 robot displays human-like motion and flexibility - Interesting Engineering","url":"https://interestingengineering.com/innovation/fouriers-gr-2-upgraded-humanoid-robot"}],"as_of":"2024-09","related_ids":["fourier","fourier-gr-1","fourier-gr-3","full-size-humanoid-robot","dexterous-hand","joint-actuator-module"],"name":"傅利叶 GR-2","alt":"Fourier GR-2","abbr":"","aliases":["GR-2"],"one_liner":"傅利叶 2024 年发布的全尺寸人形机器人，53 自由度、配 12 自由度灵巧手","explanation":"傅利叶 GR-2 是上海傅利叶在 2024 年 9 月底发布的全尺寸人形机器人，是 GR-1 的升级版。公开参数：身高 175 cm、体重 63 kg，全身 53 个自由度（可独立驱动的关节数），其中每只灵巧手 12 个自由度；单臂负载 3 kg；电池可拆卸，续航约 2 小时。关节用傅利叶自研的 FSA 执行器，峰值扭矩超过 380 N·m。它主要卖给高校和研发团队，用来做遥操作采集数据、训练操作策略等实验，发布时傅利叶还配套推出了开发软件平台。","example":"研究团队用 VR 遥操作控制 GR-2 的双手完成抓取演示，再拿这些数据训练模仿学习策略。","related":["傅利叶","傅利叶 GR-1","傅利叶 GR-3","全尺寸人形机器人","灵巧手","关节模组"]},{"id":"fourier-gr-3","category":"robot","sec":8,"tier":3,"sources":[{"title":"Fourier Intelligence unveils the Care-bot GR-3, its first full-sized companion humanoid robot - TechNode","url":"https://technode.com/2025/08/07/fourier-intelligence-unveils-the-care-bot-gr-3-its-first-full-sized-companion-humanoid-robot/"},{"title":"Fourier (company) - Wikipedia","url":"https://en.wikipedia.org/wiki/Fourier_(company)"}],"as_of":"2025-08","related_ids":["fourier","fourier-gr-2","companion-robot","service-robot","tactile-sensor","human-robot-interaction"],"name":"傅利叶 GR-3","alt":"Fourier GR-3","abbr":"","aliases":["GR-3","Care-bot GR-3"],"one_liner":"傅利叶 2025 年发布的陪伴型全尺寸人形机器人，主打康养与交互","explanation":"傅利叶在 2025 年 8 月发布的「Care-bot」GR-3，是它首款主打陪伴交互的全尺寸人形机器人。身高 165 cm、体重 71 kg，全身 55 个自由度，配 12 自由度灵巧手，单臂负载约 3 kg。外壳用软质包覆材料，身上分布 31 个压力传感器，能感知被触碰；整合了语音、视觉、触觉交互模块，电池可快换，单块续航约 3 小时。和偏科研的 GR-2 不同，GR-3 面向康养、陪护、导览等需要和人近距离相处的场景——傅利叶本身就是做康复机器人起家的。","example":"在康养机构里，GR-3 被老人拍肩后转身回应，陪着聊天、做简单的康复引导。","related":["傅利叶","傅利叶 GR-2","陪伴机器人","服务机器人","触觉传感器","人机交互"]},{"id":"fourier-n1","category":"robot","sec":8,"tier":3,"sources":[{"title":"Fourier Launches First Open-Source Humanoid Robot, Fourier N1 - AIbase","url":"https://www.aibase.com/news/17071"},{"title":"Fourier N1 open source humanoid - Webull News","url":"https://www.webull.com/news/12624717734265856"}],"as_of":"2025-04","related_ids":["fourier","open-source-hardware","small-size-humanoid-robot","bipedal-robot","rl-based-locomotion-control","fourier-gr-2"],"name":"傅利叶 N1","alt":"Fourier N1","abbr":"","aliases":["N1"],"one_liner":"傅利叶 2025 年发布的开源小尺寸人形机器人，公开图纸和物料清单","explanation":"傅利叶 N1 是傅利叶在 2025 年 4 月 11 日发布的首款开源人形机器人。身高 1.31 m、体重 38 kg，全身 23 个自由度，不带灵巧手；最高奔跑速度 3.5 m/s，关节最大扭矩 96 N·m，单块电池续航 2 小时以上，结构是铝合金加工程塑料。发布时同步公开了物料清单（BOM）、设计图纸、装配说明和基础运行软件，开发者可以照着自己造一台或改装。它适合做双足行走、强化学习运动控制这类研究，门槛比全尺寸机型低。","example":"实验室按公开的 BOM 和图纸自己组装 N1，在 Isaac Lab 里训练行走策略后部署到真机。","related":["傅利叶","开源硬件","小尺寸人形机器人","双足机器人","强化学习运控","傅利叶 GR-2"]},{"id":"tiangong","category":"robot","sec":8,"tier":2,"sources":[{"title":"北京人形：发布通用人形机器人母平台「天工」","url":"https://www.x-humanoid.com/news-view-4.html"},{"title":"北京人形：「天工」2时40分42秒自主跑完北京亦庄半马","url":"https://x-humanoid.com/news-view-164.html"}],"as_of":"2025-04","related_ids":["beijing-humanoid-robot-innovation-center","full-size-humanoid-robot","huisi-kaiwu","pelican-vl","xr-1","humanoid-robot-half-marathon"],"name":"天工","alt":"Tiangong (Beijing Humanoid Robot Innovation Center / X-Humanoid)","abbr":"","aliases":["天工 Ultra","天工人形机器人"],"one_liner":"北京人形机器人创新中心推出的全尺寸电驱人形机器人平台。","explanation":"天工是北京人形机器人创新中心（X-Humanoid）2024 年 4 月发布的通用人形机器人「母平台」，纯电驱，首版身高 163 cm、体重 43 kg，配有 3D 视觉、IMU 和六维力传感器，定位为开放给行业二次开发的公共平台。后续的天工 Ultra 身高 180 cm、体重 52 kg，2025 年 4 月在北京亦庄人形机器人半程马拉松中以 2 小时 40 分 42 秒夺冠。创新中心同时发布慧思开物平台、Pelican-VL、XR-1 等模型，天工是这些软件的主要载体。","example":"天工 Ultra 在 2025 年北京亦庄半马中跑完 21 公里夺冠。","related":["北京人形机器人创新中心","全尺寸人形机器人","慧思开物","北京人形 Pelican-VL","北京人形 XR-1","人形机器人半程马拉松"]},{"id":"qinglong","category":"robot","sec":8,"tier":3,"sources":[{"title":"WAIC 2024：全球首款全尺寸通用人形机器人开源公版机「青龙」发布（机器人大讲堂）","url":"https://www.leaderobot.com/news/4397"},{"title":"OpenLoong 人形机器人全栈开源社区","url":"https://www.openloong.org.cn/cn"}],"as_of":"2024-07","related_ids":["national-and-local-co-built-humanoid-robotics-innovation-cen","tiangong","full-size-humanoid-robot","open-source-hardware","humanoid-robot"],"name":"青龙","alt":"Qinglong (OpenLoong)","abbr":"","aliases":["青龙人形机器人","OpenLoong"],"one_liner":"上海国地共建人形机器人创新中心发布的全尺寸开源人形机器人公版机。","explanation":"青龙是国家地方共建人形机器人创新中心（上海人形机器人创新中心，运营主体为人形机器人（上海）有限公司）在 2024 年 7 月世界人工智能大会上发布的全尺寸双足人形机器人，定位为开源「公版机」。公开参数为身高 185 厘米、全身 43 个自由度、关节峰值扭矩 400 牛·米、算力 400 TOPS（每秒万亿次运算）。发布同时成立了 OpenLoong 开源社区，公开整机设计和软件，让高校和企业能在同一个本体上做二次开发，减少各家重复造硬件。它和北京人形机器人创新中心的「天工」经常被并列为国内两个开源通用人形平台。","example":"开发者可从 OpenLoong 社区下载青龙的模型和控制代码，在仿真里先调运动控制再上真机。","related":["国家地方共建人形机器人创新中心（上海人形机器人创新中心）","天工","全尺寸人形机器人","开源硬件","人形机器人"]},{"id":"xpeng-iron","category":"robot","sec":8,"tier":2,"sources":[{"title":"Xpeng unveils next-gen Iron humanoid robot at 2025 AI Day (CnEVPost)","url":"https://cnevpost.com/2025/11/05/xpeng-unveils-next-gen-iron-humanoid-robot/"},{"title":"XPENG Unveils VLA 2.0, Robotaxi, Next-Gen IRON（小鹏官网）","url":"https://www.xpeng.com/news/019a56f54fe99a2a0a8d8a0282e402b7"}],"as_of":"2025-11","related_ids":[null,null,null,null,null,null],"name":"小鹏 IRON","alt":"XPeng IRON","abbr":"","aliases":["IRON","新一代 IRON"],"one_liner":"小鹏汽车做的人形机器人，2025 年新一代版本外形高度拟人","explanation":"IRON 是小鹏汽车的人形机器人，首代在 2024 年小鹏 AI Day 亮相，新一代于 2025 年 11 月发布。新一代身高约 1.78 米、体重约 70 kg，全身 82 个自由度，其中单手 22 个；它有仿人脊柱、仿生肌肉和柔性皮肤，头部是曲面屏，采用全固态电池，搭载 3 颗小鹏自研图灵 AI 芯片（合计 2250 TOPS 算力），运行小鹏第二代 VLA（视觉-语言-动作）模型。小鹏的目标是 2026 年底量产，先放在自家门店做导购接待，是车企造人形的代表。","example":"","related":["小鹏汽车(XPeng)","人形机器人(Humanoid Robot)","车企造人形（车企入局）(Automakers Entering Humanoid Robotics)","视觉-语言-动作模型(Vision-Language-Action Model)","固态电池(Solid-State Battery)","导览接待(Guided Tours & Reception)"]},{"id":"xiaomi-cyberone","category":"robot","sec":8,"tier":3,"sources":[{"title":"CyberOne - ROBOTS: Your Guide to the World of Robotics (IEEE)","url":"https://robotsguide.com/robots/cyberone"}],"as_of":"2022-08","related_ids":["humanoid-robot","full-size-humanoid-robot","bipedal-robot","xiaomi","xiaomi-cyberdog","proof-of-concept"],"name":"小米 CyberOne","alt":"Xiaomi CyberOne","abbr":"","aliases":["铁大","CyberOne"],"one_liner":"小米 2022 年发布的全尺寸双足人形机器人，昵称「铁大」。","explanation":"CyberOne 是小米 2022 年 8 月在雷军年度演讲上发布的人形机器人，昵称「铁大」。身高 177 cm、体重 52 kg，全身 21 个自由度，关节执行器由小米自研，能双足行走（约 3.6 km/h），具备人脸识别、情绪识别和三维环境感知。它是小米第一款全尺寸人形机器人，定位是技术展示和概念验证，没有公开发售；IEEE 机器人指南给出的估价约 7–8 万美元。它和 CyberDog 一起构成小米早期的仿生机器人探索，是国内大厂较早入局人形机器人的例子。","example":"","related":["人形机器人","全尺寸人形机器人","双足机器人","小米","小米 CyberDog","概念验证"]},{"id":"honor-lightning-humanoid-robot","category":"robot","sec":8,"tier":3,"sources":[{"title":"百余台机器人同跑半马 「闪电」超越人类纪录 - 新华网","url":"https://www.news.cn/sports/20260419/0834250af22d4432ac708322aa8f7123/c.html"},{"title":"荣耀晒「闪电」机器人最新战报 - IT之家","url":"https://www.ithome.com/0/993/297.htm"},{"title":"一年提速近两小时、从遥控到自主、跑赢人类！人形机器人「半马」刷新纪录（每日经济新闻，2026-04-19）","url":"https://www.nbd.com.cn/articles/2026-04-19/4345990.html"},{"title":"Ratified: world records for Kiplimo, Tharp and Wanyonyi（World Athletics，2026-09-03）","url":"https://worldathletics.org/news/press-releases/ratified-world-records-kiplimo-tharp-wanyonyi"}],"as_of":"2026-04","related_ids":["humanoid-robot-half-marathon","bipedal-locomotion","joint-actuator-module","liquid-cooled-joint-actuators","peak-torque","rl-based-locomotion-control"],"name":"荣耀「闪电」人形机器人","alt":"Honor Lightning Humanoid Robot","abbr":"","aliases":["闪电","荣耀闪电"],"one_liner":"荣耀自研的双足人形机器人，2026 年以 50 分 26 秒夺得北京人形半马冠军","explanation":"「闪电」是手机厂商荣耀自研的首款大尺寸人形机器人，由深圳荣耀智慧科技开发有限公司研发。身高 169 cm、腿长约 95 cm，据报道体重约 45 kg；采用荣耀自研的一体化关节模组，峰值扭矩 400 N·m，并配液冷散热系统，给长时间高功率奔跑的电机降温。2026 年 4 月 19 日，它以自主导航模式在北京亦庄人形机器人半程马拉松中以净时 50 分 26 秒夺冠，快于当时的人类男子半马世界纪录 57 分 20 秒（乌干达选手基普利莫 2026 年 3 月在里斯本创造）。它是消费电子企业跨界做人形机器人、主攻高速运动控制的代表。","example":"2026 年北京亦庄人形半马中，夺冠的那台「闪电」不靠遥控、自主导航跑完约 21 公里，中途只在 10.6 公里处换了一次电池。","related":["人形机器人半程马拉松","双足行走","关节模组","关节液冷（主动散热）","峰值扭矩","强化学习运控"]},{"id":"dobot-atom","category":"robot","sec":8,"tier":3,"sources":[{"title":"越疆正式发布并预售具身智能人形机器人 Dobot Atom - 动点科技","url":"https://cn.technode.com/post/2025-03-19/dobot-atom/"},{"title":"19.9万元起，中国全尺寸人形机器人价格破冰 - 南方财经网","url":"https://www.sfccn.com/2025/3-18/xMMDE0NzNfMjAxMjAxMA.html"}],"as_of":"2025-03","related_ids":["dobot","humanoid-robot","full-size-humanoid-robot","straight-knee-walking","dexterous-hand","collaborative-robot"],"name":"越疆 Atom","alt":"Dobot Atom","abbr":"","aliases":["Dobot Atom","越疆 Dobot Atom"],"one_liner":"协作机械臂厂商越疆 2025 年推出的全尺寸人形机器人，19.9 万元起。","explanation":"Dobot Atom 是协作机械臂厂商越疆科技在 2025 年 3 月 18 日发布并开启预售的全尺寸人形机器人，售价 19.9 万元起。公开参数：身高 1.53 m、体重 62 kg，全身 41 个自由度，手臂是越疆自家的 7 自由度工业级协作臂（重复定位精度 ±0.05 mm），配五指灵巧手，上肢共 28 个自由度参与端到端操作。它主打直膝行走，官方称比常见的屈膝步态能耗低 42%。越疆的思路是把工业协作臂的精度和量产经验迁移到人形上，发布演示包括做早餐、倒咖啡、取快递、前台接待等任务。","example":"发布会演示中，Atom 自主完成倒牛奶、烤面包、水果摆盘等一整套做早餐流程。","related":["越疆科技","人形机器人","全尺寸人形机器人","直膝行走","灵巧手","协作机器人"]},{"id":"deep-robotics-dr02","category":"robot","sec":8,"tier":3,"sources":[{"title":"DEEP Robotics Launches World's First All-Weather Industrial Humanoid Robot - TechNode","url":"https://technode.com/2025/10/09/deep-robotics-launches-worlds-first-all-weather-industrial-humanoid-robot/"},{"title":"Deep Robotics unveils DR02, the world's first IP66-rated humanoid robot - KrASIA","url":"https://kr-asia.com/deep-robotics-unveils-dr02-the-worlds-first-ip66-rated-humanoid-robot"}],"as_of":"2025-10","related_ids":["humanoid-robot","full-size-humanoid-robot","deep-robotics","ingress-protection-rating","inspection-robot","deep-robotics-jueying-x30"],"name":"云深处 DR02","alt":"DEEP Robotics DR02","abbr":"","aliases":["DR02","DR-02"],"one_liner":"云深处 2025 年发布的全尺寸人形机器人，主打全身 IP66 防水防尘。","explanation":"DR02 是杭州云深处科技在 2025 年 10 月 9 日发布的全尺寸人形机器人，面向工厂和户外巡检等工业场景。公开参数：身高 175 cm、据报道重约 65 kg，常规步速 1.5 m/s、最高 4 m/s，负载 20 kg，能上 20 cm 台阶和 20° 坡，工作温度 -20℃～55℃，搭载 275 TOPS 算力单元。官方称它是全球首款全身达到 IP66 防护等级（防尘、防强力喷水）的人形机器人，采用模块化快拆设计便于维护。云深处原本以四足机器人起家，DR02 把四足产品在防护和户外可靠性上的积累搬到了人形上，瞄准的是「全天候」工业应用。","example":"云深处宣传 DR02 可在雨天、粉尘环境下做户外安防巡逻和工厂作业。","related":["人形机器人","全尺寸人形机器人","云深处科技","IP 防护等级","巡检机器人","云深处 绝影 X30"]},{"id":"booster-robotics-t1","category":"robot","sec":8,"tier":2,"sources":[{"title":"Booster T1 | Made for Developers","url":"https://www.booster.tech/booster-t1/"},{"title":"RoboCup 解决方案 | 加速进化","url":"https://www.booster.tech/zh/robocup/"},{"title":"Booster Robotics Booster T1 Specs & Price | Humanoid.guide","url":"https://humanoid.guide/product/booster-t1/"}],"as_of":"2025-07","related_ids":["booster-robotics","small-size-humanoid-robot","bipedal-robot","robocup","nvidia-jetson-orin","booster-robotics-k1"],"name":"加速进化 Booster T1","alt":"Booster Robotics T1","abbr":"","aliases":["Booster T1","T1"],"one_liner":"加速进化推出的 1.2 米小尺寸人形机器人，面向开发者和机器人足球","explanation":"Booster T1 是加速进化（Booster Robotics）推出的小尺寸双足人形机器人，身高约 1.2 米、重约 30 kg，基础版 23 个自由度，可选装夹爪或灵巧手，搭载英伟达 Jetson AGX Orin（最高约 200 TOPS 算力）。官方定位是「专为开发者打造」，开放 SDK，方便做强化学习运控和上层算法研究。它最出名的是机器人足球：2025 年 7 月，清华火神队用 T1 在巴西 RoboCup 世界杯拿下人形成人组冠军。体型小、摔倒损失小、价格比全尺寸人形低，适合高校和实验室做运控与具身研究。","example":"2025 年 RoboCup 巴西世界杯上，清华火神队用 Booster T1 获得人形成人组冠军。","related":["加速进化","小尺寸人形机器人","双足机器人","RoboCup 机器人世界杯","Jetson Orin","加速进化 Booster K1"]},{"id":"booster-robotics-k1","category":"robot","sec":8,"tier":3,"sources":[{"title":"Booster Robotics Launches K1 (Humanoids Daily)","url":"https://www.humanoidsdaily.com/news/booster-robotics-launches-k1-robocup-champion-platform"},{"title":"Booster K1 humanoid robot | Generation Robots","url":"https://www.generationrobots.com/en/404324-booster-k1-humanoid-robot.html"}],"as_of":"2025-10","related_ids":["booster-robotics","booster-robotics-t1","small-size-humanoid-robot","robocup","edu-edition","rl-based-locomotion-control"],"name":"加速进化 Booster K1","alt":"Booster Robotics K1","abbr":"","aliases":["Booster K1"],"one_liner":"北京加速进化推出的约 95 cm 小型人形机器人，主打教育科研和机器人足球。","explanation":"Booster K1 是加速进化（Booster Robotics，2023 年在北京成立）在 2025 年 10 月正式发布的小尺寸人形机器人。身高约 95 cm、重约 19.5 kg，全身 22 个自由度（每条腿 6 个、每只手臂 4 个），据报道起售价约 4,999 美元，按算力和续航分几个版本，支持 Python、ROS 2 二次开发。发布前，它作为德国 HTWK 队的比赛平台拿下了 RoboCup 2025 KidSize 组冠军。它面向高校、竞赛队和开发者，定位是入门级具身智能开发平台，可用来做强化学习运控和足球等动态任务。","example":"HTWK 队用 K1 参加 RoboCup 2025 人形 KidSize 组并夺冠。","related":["加速进化","加速进化 Booster T1","小尺寸人形机器人","RoboCup 机器人世界杯","EDU 版（科研教育版）","强化学习运控"]},{"id":"noetix-n2","category":"robot","sec":8,"tier":3,"sources":[{"title":"3.99 万元起，全球首个连续空翻人形机器人 NOETIX 松延动力 N2 发布（IT之家）","url":"https://www.ithome.com/0/837/928.htm"},{"title":"马拉松亚军人形机器人「松延动力 N2」被拍卖，以 5.7 万元成交（IT之家）","url":"https://www.ithome.com/0/847/782.htm"}],"as_of":"2025-04","related_ids":["noetix-robotics","small-size-humanoid-robot","humanoid-robot-half-marathon","noetix-bumi","rl-based-locomotion-control","degrees-of-freedom"],"name":"松延动力 N2","alt":"Noetix N2","abbr":"","aliases":["N2","NOETIX N2"],"one_liner":"松延动力2025年发布的1.2米人形机器人，能连续空翻，3.99万元起","explanation":"N2 是松延动力（Noetix）2025年3月14日发布的小尺寸人形机器人，售价3.99万元起，并在京东上线销售。它身高1.2米、重30千克，全身只有18个自由度（每条腿5个、每条手臂4个），用精简自由度换取轻量化和抗摔性能。它能大步走、奔跑（实测最快约3.5米/秒）、单双脚跳和跳舞，发布时宣传为全球首个能连续空翻的人形机器人。2025年4月北京亦庄人形机器人半程马拉松上，N2 获得亚军，这台参赛机器人随后被拍卖，以5.7万元成交。它以低价和运动表现为卖点，常作为运动控制能力的展示平台。","example":"在2025年北京亦庄人形机器人半程马拉松中，一台 N2 跑完全程获得亚军。","related":["松延动力","小尺寸人形机器人","人形机器人半程马拉松","松延动力 小布米","强化学习运控","自由度"]},{"id":"noetix-bumi","category":"robot","sec":8,"tier":3,"sources":[{"title":"全球首款万元以内高性能人形机器人：松延动力 Bumi 小布米发布，9998 元能跑能跳舞（IT之家）","url":"https://www.ithome.com/0/891/493.htm"},{"title":"松延动力获 1000 台小布米 Bumi 订单（IT之家）","url":"https://www.ithome.com/0/904/883.htm"}],"as_of":"2025-12","related_ids":["noetix-robotics","small-size-humanoid-robot","10-000-yuan-class-humanoid-robot","consumer-grade-robot","noetix-n2","research-and-education-market"],"name":"松延动力 小布米","alt":"Noetix Bumi","abbr":"","aliases":["Bumi","布米","Bumi 小布米"],"one_liner":"松延动力2025年推出的9998元小型人形机器人，面向家庭和教育","explanation":"小布米（Bumi）是北京松延动力（Noetix）2025年10月发布、10月23日开启预售的小尺寸双足人形机器人，定价9998元，官方称是全球首款万元以内的高性能人形机器人。它身高约94厘米、体重约12千克、自由度不少于21个，能走、能跑、能跳舞，小到可以被人抱起。它支持图形化编程（孩子拖拽模块就能编排动作）和语音交互，主要面向家庭陪伴、儿童编程教育和科研入门。据报道发布后不久即获得1000台订单。它把人形机器人价格拉进万元级，是「消费级人形机器人」讨论中的标志性产品。","example":"孩子在平板上拖拽动作模块编排一段舞蹈，下发给小布米表演。","related":["松延动力","小尺寸人形机器人","万元级人形机器人","消费级机器人","松延动力 N2","科研教育市场"]},{"id":"engineai-se01","category":"robot","sec":8,"tier":3,"sources":[{"title":"Engine AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Engine_AI"},{"title":"EngineAI Robotics SE01 Specs - Humanoid.guide","url":"https://humanoid.guide/product/se01/"}],"as_of":"2024-10","related_ids":[null,null,null,null,null,null],"name":"众擎 SE01","alt":"EngineAI SE01","abbr":"","aliases":["SE01"],"one_liner":"众擎 2024 年发布的 1.7 米全尺寸人形，以接近人类的自然步态出名。","explanation":"SE01 是众擎机器人 2024 年 10 月发布的全尺寸通用人形机器人，身高约 170 cm、体重约 55 kg、32 个自由度，行走速度约 2 m/s，采用自研谐波、行星和丝杠关节模组，膝关节峰值扭矩据报道约 186 N·m。它发布时的卖点是用端到端神经网络控制步态，走路步幅大、直膝迈步，比当时多数人形机器人「小碎步、屈膝走」更像人，相关视频在网上引起较大讨论。公司称其面向工业产线和家庭陪伴等场景，实际仍以展示和科研合作为主。","example":"SE01 发布视频中以大步幅、直膝的方式在街道上行走，被拿来和早期人形机器人屈膝小碎步的步态对比。","related":["众擎机器人(EngineAI)","全尺寸人形机器人(Full-size Humanoid Robot)","直膝行走(Straight-Knee Walking (vs. Bent-Knee / Crouched Gait))","强化学习运控(RL-based Locomotion Control)","众擎 PM01(EngineAI PM01)","众擎 T800(EngineAI T800)"]},{"id":"engineai-pm01","category":"robot","sec":8,"tier":3,"sources":[{"title":"Engine AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Engine_AI"},{"title":"EngineAI releases PM01 humanoid robot - The Robot Report","url":"https://www.therobotreport.com/engineai-releases-pm01-humanoid-robot-for-commercial-educational-use/"}],"as_of":"2024-12","related_ids":[null,null,null,null,null,null],"name":"众擎 PM01","alt":"EngineAI PM01","abbr":"","aliases":["PM01"],"one_liner":"众擎 2024 年底发布的 1.38 米轻量双足人形机器人，面向科研教育。","explanation":"PM01 是深圳众擎机器人（EngineAI）2024 年 12 月发布的小尺寸双足人形机器人，身高约 1.38 m、体重约 40 kg、全身 24 个自由度，腰部可大角度转动（报道为 320°），行走速度约 2 m/s。商业和教育版售价报道为 8.8 万元人民币左右，并提供面向二次开发的开源版本。它因较早在视频中完成人形机器人前空翻而受关注。定位上，PM01 和宇树 G1 类似，是价格相对低、便于高校和开发者做强化学习运控、sim-to-real 实验的研究平台，而不是直接进厂干活的产品。","example":"高校团队在 Isaac Lab 里用强化学习训练 PM01 的行走策略，再部署到真机上做仿真到现实迁移实验。","related":["众擎机器人(EngineAI)","小尺寸人形机器人(Small-size Humanoid Robot)","双足机器人(Bipedal Robot)","强化学习运控(RL-based Locomotion Control)","宇树 G1(Unitree G1)","众擎 SE01(EngineAI SE01)"]},{"id":"engineai-t800","category":"robot","sec":8,"tier":3,"sources":[{"title":"众擎T800人形机器人一脚把自家CEO踹翻在地 - 新浪科技","url":"https://finance.sina.com.cn/tech/roll/2025-12-07/doc-infzxvsm5162157.shtml"},{"title":"Engine AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Engine_AI"}],"as_of":"2026-01","related_ids":[null,null,null,null,null,null],"name":"众擎 T800","alt":"EngineAI T800","abbr":"","aliases":["T800"],"one_liner":"众擎 2025 年底发布的 1.73 米高动态全尺寸人形，主打大扭矩和格斗动作。","explanation":"T800 是众擎机器人 2025 年 12 月初发布的全尺寸通用人形机器人，身高 1.73 m、体重约 75 kg；关节协同峰值扭矩 450 N·m，采用镁铝合金骨架和固态电池，官方称续航 4–5 小时。国内分基础版、开源版、Pro、Max 四个配置，基础版起售价 18 万元。发布后因宣传视频动作过于流畅被质疑是 CG，公司随后发布 T800 踢倒 CEO 赵同阳的视频回应质疑，引发热议。它代表了国内人形厂商用高动态动作（踢腿、格斗）展示硬件爆发力的路线。","example":"2025 年 12 月众擎发布视频，身穿护具的 CEO 赵同阳与 T800 对抗，被其一脚踢倒；赵同阳事后称不穿护具「绝对会骨折」。","related":["众擎机器人(EngineAI)","全尺寸人形机器人(Full-size Humanoid Robot)","固态电池(Solid-State Battery)","Demo（演示视频）(Demo (Demonstration Video))","CMG 机甲格斗擂台赛(CMG World Robot Competition - Mecha Fighting Series)","众擎 SE01(EngineAI SE01)"]},{"id":"limx-dynamics-cl-1","category":"robot","sec":8,"tier":3,"sources":[{"title":"逐际动力首次公开人形机器人 CL-1 动态测试（逐际动力新闻中心）","url":"https://www.limxdynamics.com/zh/news/BK000005"},{"title":"逐际动力 CL-1 实现能力升级，新一代全尺寸人形机器人 CL-2 公开亮相（IT之家）","url":"https://www.ithome.com/0/790/893.htm"}],"as_of":"2024-08","related_ids":["limx-dynamics","humanoid-robot","perceptive-locomotion","limx-dynamics-oli","full-size-humanoid-robot","loco-manipulation"],"name":"逐际动力 CL-1","alt":"LimX Dynamics CL-1","abbr":"","aliases":["CL-1"],"one_liner":"逐际动力2023年底公开的全尺寸人形机器人原型，以感知上楼梯出名","explanation":"CL-1 是深圳逐际动力（LimX Dynamics）的全尺寸人形机器人，2023年12月28日首次公开动态测试视频。官方称它打通了从实时地形感知、步态规划到全身控制的全栈闭环，能根据相机看到的台阶动态上楼梯、下约15度斜坡、在室内外行走，是国内首个基于实时地形感知动态上楼梯的人形机器人。2024年世界机器人大会上，CL-1 又展示了在货架间负重深蹲、搬运货物等移动操作，同期公开了新一代 CL-2。官方未公开完整的身高和自由度参数。它是逐际动力人形路线的早期原型，后续演进到面向科研的全尺寸人形 Oli，可作为「感知行走」（边看地形边调整落脚）在人形上落地的早期案例。","example":"2023年底公开的视频里，CL-1 通过实时感知台阶，一步一阶连续走上楼梯，再从约15度的斜坡走下来。","related":["逐际动力","人形机器人","感知行走","逐际动力 Oli","全尺寸人形机器人","运动操作一体化"]},{"id":"limx-dynamics-oli","category":"robot","sec":8,"tier":3,"sources":[{"title":"LimX Dynamics Launches Full-Size Humanoid Robot LimX Oli（LimX Newsroom）","url":"https://www.limxdynamics.com/en/news/BK000043"},{"title":"LimX Dynamics launches humanoid robot LimX Oli starting at $21,800（TechNode）","url":"https://technode.com/2025/07/31/limx-dynamics-launches-humanoid-robot-limx-oli-starting-at-21800/"}],"as_of":"2025-08","related_ids":["limx-dynamics","full-size-humanoid-robot","limx-dynamics-cl-1","research-and-education-market","whole-body-control","dexterous-hand"],"name":"逐际动力 Oli","alt":"LimX Dynamics Oli","abbr":"","aliases":["LimX Oli"],"one_liner":"逐际动力2025年发布的165厘米全尺寸人形，面向具身智能科研","explanation":"LimX Oli 是逐际动力2025年7月30日发布的全尺寸通用人形机器人，身高165厘米，全身31个主动自由度（不含末端执行器：每臂7、每腿6、腰3、颈2），分 Lite、EDU、Super 三个版本，起售价15.8万元人民币，并在2025年世界机器人大会公开亮相。它主打软硬件模块化：末端可换二指夹爪或五指灵巧手，可加装麦克风、相机、触觉传感器、IMU、激光雷达等第三方传感器，提供关节级和任务级控制的开放 SDK，支持 OTA 更新运动库和控制器。目标用户是做具身智能研究的高校、实验室和方案集成商，可用来验证全身控制、运动操作一体化和 VLA 等算法。","example":"实验室购买 EDU 版 Oli，换上五指灵巧手，通过开放 SDK 部署自己训练的全身控制策略做搬运实验。","related":["逐际动力","全尺寸人形机器人","逐际动力 CL-1","科研教育市场","全身控制","灵巧手"]},{"id":"limx-dynamics-tron-1","category":"robot","sec":8,"tier":3,"sources":[{"title":"LimX Dynamics Launches Multi-Modal Biped Robot TRON 1（LimX Newsroom）","url":"https://www.limxdynamics.com/en/news/BK000040"},{"title":"World's first multi-modal biped robot could soon be yours（New Atlas）","url":"https://newatlas.com/robotics/limx-tron-1-biped-robot/"}],"as_of":"2024-10","related_ids":["limx-dynamics","bipedal-robot","wheel-legged-robot","point-foot-vs-flat-foot","rl-based-locomotion-control","limx-dynamics-tron-2"],"name":"逐际动力 TRON 1","alt":"LimX Dynamics TRON 1","abbr":"","aliases":["TRON1"],"one_liner":"逐际动力2024年推出的可换足端双足机器人，定位科研运控平台","explanation":"TRON 1 是逐际动力2024年10月17日发布的多形态双足机器人，是在其早期点足双足样机 P1 基础上推出的面向科研用户的产品。最大特点是足端可换：点足（最简单的腿足形态，最容易控制）、平足（像人一样站立和行走）和轮足（腿末端装轮子，可滑行也可迈腿越障）三种模式，官方称换装后硬件自动识别、软件自动适配。早鸟价1.5万美元起（活动截至2024年底）。它没有手臂，只有腿，官方定位是人形机器人运动控制的入门平台和具身智能研究测试床，适合高校拿来做强化学习运控、仿真到现实迁移等研究。后续升级款为可切换双臂、双足、轮足构型的 TRON 2。","example":"研究组在仿真器里用强化学习训练 TRON 1 的点足行走策略，再部署到真机上验证仿真到现实迁移效果。","related":["逐际动力","双足机器人","轮足机器人","点足 / 平足","强化学习运控","逐际动力 TRON 2"]},{"id":"limx-dynamics-tron-2","category":"robot","sec":8,"tier":3,"sources":[{"title":"逐际动力 TRON 2 具身机器人发布：可变化三种形态，4.98 万起（IT之家）","url":"https://www.ithome.com/0/906/067.htm"},{"title":"TRON 2 - 多形态具身机器人 - 参数（逐际动力官网）","url":"https://limxdynamics.com/zh/products/tron2/spec"}],"as_of":"2025-12","related_ids":["limx-dynamics","limx-dynamics-tron-1","wheel-legged-robot","mobile-manipulation","vision-language-action-model","research-and-education-market"],"name":"逐际动力 TRON 2","alt":"LimX Dynamics TRON 2","abbr":"","aliases":["TRON2"],"one_liner":"逐际动力2025年底发布的模块化机器人，可切换双臂、双足、轮足构型","explanation":"TRON 2 是逐际动力2025年12月18日发布的多形态具身机器人，售价4.98万元起。它采用全身模块化架构：同一个本体可在双臂、双足、双轮足三种核心构型之间快速切换，官方称还支持人形、四足等重构。公开参数包括：7自由度类人单臂，臂展70厘米，双臂负载10千克、机身极限负重60千克；双足形态具备感知避障和上下楼梯能力，续航约4小时、最大负载30千克；双轮足形态负载30千克并支持自动回充。它提供全开放 API 和标准化硬件接口，定位科研平台，用于 VLA 模型、移动操作、全身运控等研究，是 TRON 1 的升级。","example":"同一台 TRON 2 先装成双臂构型在桌面采集抓取数据训练 VLA，再换成双轮足构型做移动操作实验。","related":["逐际动力","逐际动力 TRON 1","轮足机器人","移动操作","视觉-语言-动作模型","科研教育市场"]},{"id":"robotera-star1","category":"robot","sec":8,"tier":3,"sources":[{"title":"IT之家：星动纪元发布首款产品级人形机器人 STAR1","url":"https://www.ithome.com/0/790/117.htm"},{"title":"网易：星动纪元发布人形机器人STAR1","url":"https://www.163.com/dy/article/JA4IJOQD0511B8LM.html"}],"as_of":"2024-08","related_ids":[null,"full-size-humanoid-robot","era-42","robotera-xhand1","robotera-l7","rl-based-locomotion-control"],"name":"星动纪元 STAR1","alt":"RobotEra STAR1","abbr":"","aliases":["Star1"],"one_liner":"星动纪元 2024 年发布的全尺寸双足人形机器人，主打负重和奔跑","explanation":"STAR1 是星动纪元（RobotEra，清华大学交叉信息研究院孵化的人形机器人公司）于 2024 年 8 月 19 日发布的首款「产品级」人形机器人。厂商公布的参数：全身 55 个主动自由度（双腿 12、双臂 14、腰 3、颈 2，外加两只各 12 自由度的灵巧手），最大关节扭矩 400 N·m，最大跑速超过 6 米/秒，最大负载 160 千克。设计上让手和相机的位置接近人类，方便直接复用人类动作数据做模仿学习；运动控制用强化学习训练。它是星动纪元早期的旗舰人形平台，公司之后又推出了端到端模型 ERA-42 和新一代全尺寸人形 L7。","example":"发布时展示了在户外奔跑和负重行走，以此说明其关节扭矩和耐力。","related":["星动纪元(RobotEra)","全尺寸人形机器人","星动纪元 ERA-42","星动纪元 XHAND1 灵巧手","星动纪元 L7","强化学习运控"]},{"id":"robotera-l7","category":"robot","sec":8,"tier":3,"sources":[{"title":"跳街舞、打螺丝：星动纪元「星动 L7」发布（IT之家）","url":"https://www.ithome.com/0/869/844.htm"},{"title":"星动L7（星动纪元官网）","url":"https://www.robotera.com/robot/l7.html"}],"as_of":"2025-07","related_ids":["robotera","era-42","robotera-star1","robotera-xhand1","full-size-humanoid-robot","humanoid-robot"],"name":"星动纪元 L7","alt":"RobotEra L7","abbr":"","aliases":["星动L7","STAR L7"],"one_liner":"星动纪元 2025 年发布的全尺寸双足人形机器人，全身 55 自由度。","explanation":"星动 L7 是清华系具身智能公司星动纪元在 2025 年 7 月 22 日发布的全尺寸双足人形机器人。公开参数：身高 171 厘米、体重 65 公斤（不含灵巧手），全身 55 个自由度，其中颈部 2、双臂各 7、腰部 3、双腿各 6、两只灵巧手各 12；自研关节模组峰值扭矩 400 牛·米，双臂负重 20 公斤，官方称奔跑速度可达 4 米/秒。它由公司自研的端到端 VLA 模型 ERA-42 驱动，发布时演示了街舞等高动态动作和拧螺丝、分拣等精细操作，定位是既能跑跳又能干活的通用人形。","example":"发布会上 L7 既跳了街舞，又在工位上用灵巧手完成拧螺丝和物料分拣。","related":["星动纪元","星动纪元 ERA-42","星动纪元 STAR1","星动纪元 XHAND1 灵巧手","全尺寸人形机器人","人形机器人"]},{"id":"leju-kuavo","category":"robot","sec":8,"tier":3,"sources":[{"title":"乐聚人形机器人「夸父」发布：搭载开源鸿蒙，多地形行走还能跳 - IT之家","url":"https://www.ithome.com/0/737/085.htm"},{"title":"乐聚 KUAVO（夸父）人形机器人科研版发布，支持开箱即用 - IT之家","url":"https://www.ithome.com/0/800/849.htm"}],"as_of":"2025","related_ids":["leju-robotics","humanoid-robot","full-size-humanoid-robot","huawei","research-and-education-market"],"name":"乐聚 夸父","alt":"Leju Kuavo","abbr":"","aliases":["夸父","KUAVO"],"one_liner":"乐聚机器人推出的全尺寸双足人形，搭载开源鸿蒙系统。","explanation":"夸父（KUAVO）是深圳乐聚机器人的全尺寸双足人形机器人，2023 年 12 月发布，官方称是国内首款搭载开源鸿蒙系统、能跳跃和多地形行走的高动态人形。2024 年 10 月推出科研版，主打开箱即用。公开参数（第四代及 4 Pro）：身高最高约 1.66 m、重约 45 kg，全身约 30 个自由度，配双目深度相机、可选激光雷达，最快步速约 4.6 km/h，能连续跳跃 20 cm 以上。据报道它接入了华为盘古具身大模型做多步任务规划，也与中国移动、华为合作做过 5G-A 人形机器人。","example":"高校实验室买夸父科研版，在其上开发和验证双足行走与抓取算法。","related":["乐聚机器人","人形机器人","全尺寸人形机器人","华为","科研教育市场"]},{"id":"kepler-forerunner-k2","category":"robot","sec":8,"tier":3,"sources":[{"title":"Kepler debuts fifth-gen K2 humanoid robot - Interesting Engineering","url":"https://interestingengineering.com/innovation/kepler-debuts-k2-humanoid-robot"},{"title":"开普勒K2大黄蜂在WAIC 2025完成8小时续航直播挑战_新浪财经","url":"https://cj.sina.com.cn/articles/view/7207652843/1ad9c0deb02001iwd2?froms=ggmp"},{"title":"商业化落地提速，开普勒K2大黄蜂已开启量产预售","url":"https://www.lvyouxfnet.com/117310.html"}],"as_of":"2025-09","related_ids":["humanoid-robot","full-size-humanoid-robot","kepler-robotics","planetary-roller-screw","linear-actuator","battery-runtime"],"name":"开普勒 先行者 K2","alt":"Kepler Forerunner K2","abbr":"","aliases":["大黄蜂","K2 Bumblebee","K2 大黄蜂"],"one_liner":"开普勒机器人的全尺寸双足人形，主打工业场景和长续航。","explanation":"先行者 K2 是上海开普勒探索机器人公司的人形机器人，2025 年推出商用版 K2「大黄蜂」。公开参数：身高约 175 cm、体重约 75 kg、全身 52 个自由度，双手为腱绳驱动、每只 11 个自由度，电池约 2.33 kWh。它的特点是「混动」关节方案：腿部等处用行星滚柱丝杠直线执行器，其余用旋转执行器。2025 年 WAIC 上它做了 8 小时连续直播展示续航。据报道量产预售分双足基础版、双足开发版和轮式开发版，起售价 24.8 万元（海外约 3 万美元），定位物流分拣、工厂搬运等工业场景。","example":"在 WAIC 2025 展台上，K2 大黄蜂从早 9 点到下午 5 点不间断做分拣和抓取演示，验证 8 小时续航。","related":["人形机器人","全尺寸人形机器人","开普勒机器人","行星滚柱丝杠","线性执行器（直线执行器 / 电缸）","续航"]},{"id":"magiclab-magicbot","category":"robot","sec":8,"tier":3,"sources":[{"title":"魔法原子推出高动态双足人形机器人 MagicBot Z1，最高 50 自由度（IT之家）","url":"https://www.ithome.com/0/866/630.htm"},{"title":"魔法原子人形机器人MagicBot工厂训练实拍 展现多机协作能力（腾讯新闻）","url":"https://news.qq.com/rain/a/20241202A08Q4700"}],"as_of":"2026-07","related_ids":["magiclab","humanoid-robot","full-size-humanoid-robot","factory-pilot-deployment","dexterous-hand","small-size-humanoid-robot"],"name":"魔法原子 MagicBot","alt":"MagicLab MagicBot","abbr":"","aliases":["MagicBot","MagicBot Gen1"],"one_liner":"追觅孵化的魔法原子推出的人形机器人系列，主打工厂和商用场景","explanation":"MagicBot 是魔法原子（MagicLab）的人形机器人产品系列。魔法原子2024年1月成立，由追觅科技孵化。首款全尺寸 MagicBot（Gen1）身高约174厘米、42个自由度，配自研灵巧手，双臂可提约20千克、整机负载约40千克，续航约5小时；2024年12月公开了多台 MagicBot 在工厂产线做质检、物料搬运、零件摆放、扫码等实训并小规模协作的视频。2025年推出小尺寸双足版 MagicBot Z1，身高约140厘米、体重约40千克，基础24个自由度、可扩展到约50个。据报道2026年世界人工智能大会上又首发了旗舰全尺寸人形 MagicBot X1。它代表依托母公司制造生态、先从工厂场景切入的国内人形路线。","example":"魔法原子公开的实训视频中，多台 MagicBot 在工厂产线上分工完成来料检测、物料搬运和扫码。","related":["魔法原子","人形机器人","全尺寸人形机器人","进厂实训","灵巧手","小尺寸人形机器人"]},{"id":"paxini-tora-one","category":"robot","sec":8,"tier":3,"sources":[{"title":"帕西尼发布第二代多维触觉人形机器人 TORA-ONE（IT之家）","url":"https://www.ithome.com/0/790/616.htm"}],"as_of":"2024-08","related_ids":["paxini-tech","tactile-sensor","paxini-px-6ax","dexterous-hand","visuo-tactile-fusion","humanoid-robot"],"name":"帕西尼 TORA-ONE","alt":"PaXini TORA-ONE","abbr":"","aliases":["TORA-ONE"],"one_liner":"帕西尼推出的主打多维触觉感知的人形机器人。","explanation":"TORA-ONE 是触觉传感器公司帕西尼感知（PaXini）做的人形机器人，第二代于 2024 年 8 月世界机器人大会期间发布。据发布报道，它本体有 47 个自由度，搭配 26 自由度的仿生灵巧手，身高可在 1.46–1.86 米之间调节；最大特点是双手集成近 2000 个自研 ITPU 多维触觉传感单元，能测接触面上的压力和细微形变，官方称测量精度到 0.01 牛。这类设计针对的是纯视觉机器人「看得见摸不准」的问题：拧瓶盖、捏软物体时需要知道用了多大力、有没有打滑。帕西尼同时把这些触觉数据用于自家的视触觉多模态模型训练。","example":"演示中 TORA-ONE 用带触觉的手指抓取易碎或柔软的物品，根据触觉反馈实时调整握力。","related":["帕西尼感知","触觉传感器","帕西尼 PX-6AX 多维触觉传感器","灵巧手","视触觉融合","人形机器人"]},{"id":"astribot-s1","category":"robot","sec":8,"tier":3,"sources":[{"title":"Humanoid homebot tackles impressive array of household chores (New Atlas)","url":"https://newatlas.com/robotics/astribot-s1-humanoid-launch/"},{"title":"Astribot S1 Specs | Humanoid.guide","url":"https://humanoid.guide/product/astribot-s1/"}],"as_of":"2026-09","related_ids":["wheeled-humanoid-robot","astribot","tendon-driven-actuation","bimanual-manipulation","imitation-learning","household-tasks"],"name":"星尘智能 Astribot S1","alt":"Astribot S1","abbr":"","aliases":["Astribot S1"],"one_liner":"星尘智能的轮式双臂人形机器人，以绳驱传动和快速灵巧的家务演示出名。","explanation":"Astribot S1 由深圳星尘智能（Astribot）研发，2024 年 4 月发布演示视频，同年在北京世界机器人大会公开亮相。形态是全向轮底盘加上半身人形：双臂各 7 自由度，加躯干和头部，全身二十多个自由度。它的特点是用绳驱（腱绳）传动，手臂又快又轻，据报道末端最高速度约 10 m/s、单臂负载约 5–10 kg（不同来源口径不一）。官方视频展示了叠衣、倒酒、颠锅、收纳等原速家务，多数动作靠遥操作采集数据后做模仿学习。它代表了「不用腿、先把上半身操作做好」的轮式人形路线。","example":"S1 发布视频中以原速完成叠衣服、抽桌布不倒杯等家务动作。","related":["轮式人形机器人","星尘智能","腱绳驱动","双臂操作","模仿学习","家务任务"]},{"id":"galaxea-r1","category":"robot","sec":8,"tier":3,"sources":[{"title":"19.9 万元起，星海图 R1 系列仿人形通用机器人发布 - IT之家","url":"https://www.ithome.com/0/821/803.htm"},{"title":"R1 - 星海图官网","url":"https://galaxea-ai.com/cn/products/R1"}],"as_of":"2025-01","related_ids":["galaxea-ai","galaxea-g0-dual-system-vla","galaxea-open-world-dataset","wheeled-humanoid-robot","mobile-manipulator","mobile-manipulation"],"name":"星海图 R1","alt":"Galaxea R1","abbr":"","aliases":["R1 Pro","R1 Lite","Galaxea R1 Pro","Galaxea R1 Lite"],"one_liner":"星海图的轮式双臂仿人形机器人系列，含 R1 Pro、R1、R1 Lite 三款","explanation":"星海图 R1 是星海图（Galaxea AI）的轮式仿人形机器人系列，2025 年 1 月发布，定价 19.9 万元起，包含 R1 Pro、R1、R1 Lite 三款。构型都是「轮式底盘 + 可动躯干 + 双臂」，手能下探到地面、上够约 2 m（Lite 为 1.7 m）。R1 Pro 全身 26 自由度、双 7 轴力控臂，双臂最大负载 10 kg，末端可换灵巧手；R1 为 24 自由度、双 6 轴臂；R1 Lite 为 23 自由度、6 轴双臂。标配英伟达 Jetson AGX Orin 32GB。它常被用作移动操作的数据采集和 VLA 模型部署平台。","example":"用 R1 Lite 在真实家庭里采集「开冰箱、取饮料、放到桌上」的遥操作数据，再训练 VLA 模型。","related":["星海图","星海图 G0","星海图开放世界数据集","轮式人形机器人","复合机器人","移动操作"]},{"id":"ai2-robotics-alphabot","category":"robot","sec":8,"tier":3,"sources":[{"title":"新浪财经：智平方发布全新一代智能机器人AlphaBot 2","url":"https://finance.sina.com.cn/jjxw/2025-04-17/doc-inetnwin2047310.shtml"},{"title":"深圳新闻网：智平方发布全新一代通用智能机器人AlphaBot 2","url":"https://www.sznews.com/news/content/mb/2025-04/18/content_31541723.htm"}],"as_of":"2025-04","related_ids":["ai2-robotics","govla","wheeled-humanoid-robot","dual-system-architecture","whole-body-control","mobile-manipulation"],"name":"智平方 AlphaBot","alt":"AI² Robotics AlphaBot","abbr":"","aliases":["AlphaBot","AlphaBot 2","爱宝"],"one_liner":"深圳智平方的轮式双臂人形机器人，搭载自研全身 VLA 模型","explanation":"AlphaBot（中文名爱宝）是深圳智平方（AI² Robotics）的轮式人形机器人系列。2025 年 4 月发布的 AlphaBot 2 全身 34 个以上自由度，单臂臂展 700 mm，腰腿可升降，竖直作业范围 0–240 cm，连续工作 6 小时以上。它的「大脑」是智平方自研的 GOVLA 模型，采用快慢双系统：慢系统负责推理和拆任务，快系统直接输出全身动作和移动轨迹，而不只控制机械臂。发布时公司宣布到 2028 年建设万台产能。","example":"AlphaBot 2 在展会上演示移动到货架前、升降腰部取放高处物品。","related":["智平方","智平方 GOVLA（AlphaBrain）","轮式人形机器人","快慢双系统","全身控制","移动操作"]},{"id":"unitree-a1","category":"robot","sec":9,"tier":3,"sources":[{"title":"Unitree A1 官网","url":"https://www.unitree.com/A1"}],"as_of":"2026-09","related_ids":["quadruped-robot","unitree-robotics","unitree-go1","rapid-motor-adaptation","rl-based-locomotion-control","sim-to-real-transfer"],"name":"宇树 A1","alt":"Unitree A1","abbr":"","aliases":["A1"],"one_liner":"宇树早期的中小型电驱四足机器人，曾是强化学习运控常用平台","explanation":"A1 是宇树科技（Unitree）较早推出的中小型四足机器人（据报道约 2020 年上市），电机直驱关节、结构紧凑。官网参数：有效负载 5 公斤，最大持续奔跑速度 3.3 米/秒（约 11.9 公里/小时），关节最大扭矩 33.5 牛·米、最大关节转速 21 弧度/秒，续航 1–2.5 小时。由于价格远低于 ANYmal、Spot 等，它在 2020–2022 年前后成为学术界做强化学习行走、仿真到现实迁移的热门硬件，例如快速运动适应（RMA）论文就在 A1 上做实物实验。之后宇树用 Go1、Go2 替代了它的定位。","example":"RMA 论文在 A1 上部署仿真里训练的行走策略，让它在草地、沙地、台阶等没见过的地面上稳定行走。","related":["四足机器人","宇树科技","宇树 Go1","快速运动适应","强化学习运控","仿真到现实迁移"]},{"id":"unitree-go1","category":"robot","sec":9,"tier":3,"sources":[{"title":"Unitree Go1 官网","url":"https://www.unitree.com/go1"}],"as_of":"2023-07","related_ids":["unitree-go2","unitree-robotics","quadruped-robot","rl-based-locomotion-control","sim-to-real-transfer","walk-these-ways"],"name":"宇树 Go1","alt":"Unitree Go1","abbr":"","aliases":["Go1"],"one_liner":"宇树科技 2021 年推出的消费级四足机器狗，Go2 的前代。","explanation":"Go1 是宇树科技 2021 年发布的小型四足机器人，整机约 12 kg，四条腿共 12 个关节电机。分 Air、Pro、Edu 三个版本，官网标价 Air 2700 美元、Pro 3500 美元，Edu 版面向科研、开放编程接口，官方称最高速度约 4.7 m/s。机身装有 5 组鱼眼双目深度相机，能做跟随和避障。它把四足机器人的价格拉到万元级，很多高校用它做强化学习运控和仿真到现实迁移（仿真里训练、真机部署）研究；2023 年起被 Go2 接替。","example":"MIT 的 Walk These Ways 等腿足强化学习论文用 Go1 做真机实验。","related":["宇树 Go2","宇树科技","四足机器人","强化学习运控","仿真到现实迁移","Walk These Ways"]},{"id":"unitree-go2","category":"robot","sec":9,"tier":2,"sources":[{"title":"Introducing Unitree Go2 - Quadruped Robot of Embodied AI (PR Newswire)","url":"https://www.prnewswire.com/news-releases/introducing-unitree-go2---quadruped-robot-of-embodied-ai-301879381.html"},{"title":"Unitree Go2（百度百科英文版）","url":"https://baike.baidu.com/en/item/Unitree%20Go2/1517731"}],"as_of":"2023-07","related_ids":[null,null,null,null,null,null],"name":"宇树 Go2","alt":"Unitree Go2","abbr":"","aliases":["Go2","Go2 Air","Go2 Pro","Go2 EDU"],"one_liner":"宇树 2023 年推出的消费级小型机器狗，也是最常见的科研四足平台之一","explanation":"Go2 是宇树科技 2023 年 7 月发布的消费级四足机器人，接替 Go1，起售价 9997 元（约 1600 美元），整机约 15 kg，分 Air、Pro、EDU 等版本。它标配宇树自研的 L1 4D 激光雷达，做 360°×90° 环境感知。因为便宜、耐摔、有开放 SDK（软件开发包），EDU 版被大量高校拿来做强化学习运控（在仿真里训练走路策略再部署到真机）、导航和足式移动操作研究，是具身智能论文里出镜率很高的机器狗。","example":"用 unitree_rl_gym 在 Isaac Gym 里训练 Go2 的行走策略，再把策略部署到 Go2 EDU 真机上验证。","related":["宇树科技(Unitree Robotics)","四足机器人(Quadruped Robot)","宇树 Go1(Unitree Go1)","宇树 Go2-W(Unitree Go2-W)","强化学习运控(RL-based Locomotion Control)","unitree_rl_gym(unitree_rl_gym (Unitree RL Gym))"]},{"id":"unitree-go2-w","category":"robot","sec":9,"tier":3,"sources":[{"title":"Unitree Go2-W 官网","url":"https://www.unitree.com/go2-w"}],"as_of":"2026-09","related_ids":["wheel-legged-robot","unitree-go2","unitree-b2-w","quadruped-robot","rl-based-locomotion-control","unitree-robotics"],"name":"宇树 Go2-W","alt":"Unitree Go2-W","abbr":"","aliases":["Go2-W"],"one_liner":"宇树科技在 Go2 四条腿末端装上轮子的轮足机器狗。","explanation":"Go2-W 是宇树科技基于 Go2 做的四轮足机器人：每条腿末端装一个带轮毂电机的 7 英寸充气轮，平地上用轮子跑，遇到台阶、坡道再靠腿抬跨。官网参数：尺寸约 70×43×50 cm，整机约 18 kg（含电池），常规负载约 8 kg、极限约 12 kg，速度 0–2.5 m/s，最大爬坡 35°，续航约 1.5–3 小时，配 3D 激光雷达和高清相机。轮足兼顾速度、能耗和越障，但轮和腿要协调控制，通常用强化学习在仿真里训练。它和更大的 B2-W 同属宇树轮足产品线。","example":"","related":["轮足机器人","宇树 Go2","宇树 B2-W","四足机器人","强化学习运控","宇树科技"]},{"id":"unitree-b2","category":"robot","sec":9,"tier":3,"sources":[{"title":"Unitree B2 官网","url":"https://www.unitree.com/b2"}],"as_of":"2026-09","related_ids":["quadruped-robot","unitree-robotics","unitree-b2-w","inspection-robot","special-purpose-robot","boston-dynamics-spot"],"name":"宇树 B2","alt":"Unitree B2","abbr":"","aliases":["B2"],"one_liner":"宇树的大型行业级四足机器人，负重大、续航长、IP67防护","explanation":"B2 是宇树科技（Unitree）面向工业场景的大型四足机器人（据报道 2023 年底发布），对标波士顿动力 Spot 这类行业级产品。官网参数：含电池约 60 公斤；站立负载不低于 120 公斤，行走负载超过 40 公斤；最高速度超过 6 米/秒，官网称是最快的行业级四足；电池 2250 瓦时，空载行走超过 5 小时、里程超过 20 公里，负重 20 公斤时仍超过 4 小时；IP67 防尘防水。它主要用于电力、化工巡检、应急救援和户外搬运等需要负重和长续航的场景，也可以背机械臂做移动操作。同系列的 B2-W 是轮足版本。","example":"在化工厂里，B2 背着气体检测仪和摄像头雨天巡检管廊，自主爬楼梯到上层平台。","related":["四足机器人","宇树科技","宇树 B2-W","巡检机器人","特种机器人","波士顿动力 Spot"]},{"id":"unitree-b2-w","category":"robot","sec":9,"tier":3,"sources":[{"title":"Unitree B2-W 官网","url":"https://www.unitree.com/b2-w"}],"as_of":"2026-09","related_ids":["wheel-legged-robot","unitree-b2","unitree-go2-w","unitree-robotics","inspection-robot","rl-based-locomotion-control"],"name":"宇树 B2-W","alt":"Unitree B2-W","abbr":"","aliases":["B2-W"],"one_liner":"宇树B2的轮足版本，足端装轮子，既能走又能快速滑行","explanation":"B2-W 是宇树科技（Unitree）在 B2 基础上推出的轮足机器人（据报道 2024 年推出）：四条腿末端换成驱动轮，平地上像车一样滚动，遇到台阶、碎石时又能用腿抬起跨越，兼顾轮子的效率和腿的越障能力。官网参数：含电池约 85 公斤；静止负载最高 120 公斤，行走负载超过 40 公斤；最高速度 15 公里/小时；空载续航约 30 公里，负重 40 公斤时约 25 公里；IP67 防护。它适合园区巡检、户外长距离运输、应急救援等路程长、地形杂的场景，其轮腿协同的动作也常被当作强化学习运控能力的展示。","example":"B2-W 在野外载着物资沿土路高速滑行，遇到沟坎时抬腿越过再继续滚动前进。","related":["轮足机器人","宇树 B2","宇树 Go2-W","宇树科技","巡检机器人","强化学习运控"]},{"id":"unitree-as2","category":"robot","sec":9,"tier":3,"sources":[{"title":"Unitree As2 官网","url":"https://www.unitree.com/As2"}],"as_of":"2026-09","related_ids":["quadruped-robot","unitree-robotics","unitree-go2","unitree-b2","wheel-legged-robot","inspection-robot"],"name":"宇树 As2","alt":"Unitree As2","abbr":"","aliases":["As2","As2-W"],"one_liner":"宇树的紧凑型行业级四足机器人，约20公斤，另有轮足版As2-W","explanation":"As2 是宇树科技（Unitree）的紧凑型行业四足机器人，定位介于消费级 Go2 和大型行业级 B2 之间。官网参数：含电池约 20 公斤，站立尺寸 720×378×457 毫米，12 个关节电机，关节最大扭矩最高约 95 牛·米；站立负载最高 65 公斤、持续行走负载约 15 公斤；速度 0–3.7 米/秒（部分型号最高约 5 米/秒）；空载连续行走约 4 小时、约 20 公里；IP54 防雨。分 AIR、PRO、X、EDU 四个版本，官网未公开售价。As2-W 是同系列的轮足版本，把足端换成驱动轮，适合平地长距离快速移动。它面向巡检、安防等行业场景，EDU 版可做二次开发。","example":"在变电站里用 As2 背着相机沿固定路线巡检，遇到台阶用腿跨过去。","related":["四足机器人","宇树科技","宇树 Go2","宇树 B2","轮足机器人","巡检机器人"]},{"id":"unitree-a2","category":"robot","sec":9,"tier":2,"sources":[{"title":"Unitree launches A2 quadruped equipped with front and rear lidar (The Robot Report)","url":"https://www.therobotreport.com/unitree-launches-a2-quadruped-equipped-with-front-and-rear-lidar/"},{"title":"Unitree launches A2 quadruped robot with 100 kg load capacity and 20 km range","url":"https://roboticsandautomationnews.com/2025/08/07/unitree-unveils-new-a2-quadruped-robot-with-100-kg-load-capacity-and-20-km-range/93591/"}],"as_of":"2025-08","related_ids":[null,null,null,null,null,null],"name":"宇树 A2","alt":"Unitree A2","abbr":"","aliases":["A2","宇树 A2 四足机器人"],"one_liner":"宇树 2025 年发布的工业级四足机器人，前后各带一颗激光雷达","explanation":"宇树 A2 是宇树科技 2025 年 8 月发布的工业级四足机器狗，定位在消费级 Go2 和重型 B2 之间。官方参数：自重约 37 kg，站立最大负载 100 kg、行走负载 25 kg，空载续航约 20 km，最高速度约 5 m/s；前后各装一颗工业激光雷达（测距并建三维地图的传感器）加高清相机，消除视野盲区；双电池并联可热插拔。主要面向巡检、物流、应急救援和科研。注意它和智元的「远征 A2」人形机器人不是一个东西，只是撞了名字。","example":"电力巡检公司让 A2 背着检测设备在变电站里按路线自主巡逻，电量低时换电池继续跑。","related":["宇树科技(Unitree Robotics)","四足机器人(Quadruped Robot)","宇树 B2(Unitree B2)","宇树 Go2(Unitree Go2)","巡检机器人(Inspection Robot)","激光雷达(LiDAR (Light Detection and Ranging))"]},{"id":"unitree-z1-robotic-arm","category":"robot","sec":9,"tier":3,"sources":[{"title":"Unitree Z1 官网","url":"https://www.unitree.com/z1"}],"as_of":"2026-09","related_ids":["robotic-arm","legged-mobile-manipulator","mobile-manipulation","unitree-robotics","6-axis-robot-arm","payload"],"name":"宇树 Z1 机械臂","alt":"Unitree Z1 Robotic Arm","abbr":"","aliases":["Z1","Z1 AIR","Z1 PRO"],"one_liner":"宇树科技的轻量六轴机械臂，可装在四足机器人背上做移动操作。","explanation":"Z1 是宇树科技推出的 6 自由度轻量机械臂，分 AIR 和 PRO 两版：自重约 4.3 kg / 4.5 kg，负载 2 kg / 3 kg 以上，臂展（工作半径）约 740 mm，重复定位精度约 0.1 mm。官网说明它可以和宇树 Aliengo、B1 等移动机器人配合，装在四足机器人背上组成「带臂四足」，做开门、捡东西这类足式移动操作；也可以单独固定在桌面上做操作研究。","example":"把 Z1 装到宇树 B1 四足机器人背上，让机器狗边走边用手臂去够地上的物体。","related":["机械臂","足式移动操作机器人（带臂四足）","移动操作","宇树科技","六轴机械臂","负载"]},{"id":"deep-robotics-lite3","category":"robot","sec":9,"tier":3,"sources":[{"title":"云深处发布绝影 Lite3机器狗：面向教育科研场景 - 腾讯云","url":"https://cloud.tencent.cn/developer/news/1027675"},{"title":"重磅！云深处发布绝影Lite3机器狗，售价16900起 - 机器人大讲堂","url":"https://www.leaderobot.com/news/676"}],"as_of":"2023-03","related_ids":["quadruped-robot","deep-robotics","rl-based-locomotion-control","unitree-go2","sim-to-real-transfer","research-and-education-market"],"name":"云深处 绝影 Lite3","alt":"DEEP Robotics Lite3","abbr":"","aliases":["Lite3","绝影Lite3","Jueying Lite3"],"one_liner":"云深处面向教育科研的小型四足机器狗，1.69 万元起，可二次开发。","explanation":"绝影 Lite3 是云深处科技 2023 年 3 月 15 日发布的小型四足机器人，面向高校科研、教育和科技爱好者，发布时售价 16900 元起，分体验版、探索版、专业版、激光版等配置。官方参数：持续行走负载 7.5 kg，运动续航约 90 分钟、里程约 5 km，控制频率 1 kHz，采用实时控制系统。它开放模块化接口，可加装 RTK 定位、5G、AI 主机和各类传感器，支持二次开发。实验室常用它做强化学习运控（在仿真里训练行走策略再部署到真机）和导航研究，是和宇树 Go 系列同一档位的国产科研机器狗。","example":"研究者在 Isaac Gym 里训练 Lite3 的行走策略，再通过官方 SDK 部署到真机做仿真到现实迁移实验。","related":["四足机器人","云深处科技","强化学习运控","宇树 Go2","仿真到现实迁移","科研教育市场"]},{"id":"deep-robotics-jueying-x30","category":"robot","sec":9,"tier":3,"sources":[{"title":"绝影X30 产品资料 - 云深处科技","url":"https://deep-website.oss-cn-hangzhou.aliyuncs.com/app/X30.pdf"},{"title":"云深处发布行业应用旗舰机器狗绝影X30 - ITBear","url":"https://www.itbear.com.cn/html/2023-10/474576.html"}],"as_of":"2023-10","related_ids":["quadruped-robot","inspection-robot","deep-robotics","ingress-protection-rating","boston-dynamics-spot","special-purpose-robot"],"name":"云深处 绝影 X30","alt":"DEEP Robotics Jueying X30","abbr":"","aliases":["X30","绝影X30","X30 Pro"],"one_liner":"云深处面向电力、隧道巡检和应急的行业级旗舰四足机器人。","explanation":"绝影 X30 是云深处科技 2023 年 10 月发布的行业级四足机器人，定位巡检、侦察、安防和测绘等工业场景。官方参数：整机含电池约 56 kg，有效负载不少于 20 kg，续航 2.5～4 小时，最大爬坡 45°，防护等级 IP67，工作温度 -20℃～55℃。它强调融合感知，在昏暗、强光、闪烁甚至无光环境下也能自主导航作业。和实验室用的小型机器狗不同，X30 的卖点是能长期在变电站、管廊、隧道这类恶劣环境里跑，是国产四足在工业巡检市场的代表产品之一，常被拿来和波士顿动力 Spot 对比。","example":"电站把 X30 设成定时巡检，它按预设路线爬楼梯、过管廊，拍仪表读数和红外测温画面。","related":["四足机器人","巡检机器人","云深处科技","IP 防护等级","波士顿动力 Spot","特种机器人"]},{"id":"deep-robotics-lynx","category":"robot","sec":9,"tier":3,"sources":[{"title":"云深处山猫 M20 行业级全地形轮足机器人发布 - IT之家","url":"https://www.ithome.com/0/849/905.htm"},{"title":"山猫 - 云深处科技官网","url":"https://www.deeprobotics.cn/robot/wap/lynx.html"}],"as_of":"2025-04","related_ids":["wheel-legged-robot","quadruped-robot","deep-robotics","inspection-robot","unitree-b2-w","deep-robotics-jueying-x30"],"name":"云深处 山猫","alt":"DEEP Robotics Lynx","abbr":"","aliases":["Lynx","山猫 M20","Lynx M20"],"one_liner":"云深处的轮足机器狗，腿末端是轮子，能跑能走能越障。","explanation":"山猫是云深处科技的轮足机器人系列，四条腿的末端装的是驱动轮：平地上用轮子滑行，省电又快；遇到台阶、碎石再像四足一样迈腿。行业版山猫 M20 于 2025 年 4 月 29 日发布，定位复杂地形和危险环境作业，官方称支持 15 kg 有效负载、带载续航约 12 km，具备工业级 IP66 防护、-20℃～55℃ 工作温度，配激光雷达可全向避障，Pro 版支持自主导航和自主充电，背部留有机械和电气接口挂载设备。轮足构型兼顾轮式的效率和足式的通过性，是近年四足机器人的一个热门方向。","example":"山猫 M20 可背着检测设备在厂区道路上轮式快速移动，到楼梯前切换成迈步上楼。","related":["轮足机器人","四足机器人","云深处科技","巡检机器人","宇树 B2-W","云深处 绝影 X30"]},{"id":"xiaomi-cyberdog","category":"robot","sec":9,"tier":3,"sources":[{"title":"CyberDog - ROBOTS: Your Guide to the World of Robotics (IEEE)","url":"https://robotsguide.com/robots/cyberdog"}],"as_of":"2023-08","related_ids":["quadruped-robot","xiaomi","xiaomi-cyberone","quasi-direct-drive","unitree-go1","nvidia-jetson"],"name":"小米 CyberDog","alt":"Xiaomi CyberDog","abbr":"","aliases":["铁蛋","CyberDog 2"],"one_liner":"小米 2021 年发布的开源四足仿生机器狗，昵称「铁蛋」。","explanation":"CyberDog 是小米 2021 年 8 月发布的四足机器人，首批「开拓者版」限量 1000 台、售价 9999 元，面向开发者和极客。整机约 14 kg，12 个准直驱关节电机（行星减速加无刷电机），最高奔跑速度约 11.5 km/h，能做后空翻。主控是英伟达 Jetson Xavier NX，传感器包括 RealSense 深度相机、超广角相机、超声波、ToF、GPS、IMU 等，跑 Ubuntu 和 ROS，软件代码开源。2023 年小米推出第二代 CyberDog 2（据报道售价 12999 元）。","example":"","related":["四足机器人","小米","小米 CyberOne","准直驱","宇树 Go1","英伟达 Jetson"]},{"id":"agibot-d1-quadruped","category":"robot","sec":9,"tier":3,"sources":[{"title":"IT之家：智元首款四足机器人 D1 Ultra 上线官网","url":"https://www.ithome.com/0/870/216.htm"},{"title":"IT之家：智元机器人全系产品开售","url":"https://www.ithome.com/0/876/106.htm"}],"as_of":"2025-08","related_ids":["quadruped-robot","agibot","rl-based-locomotion-control","unitree-go2","deep-robotics-lite3","ingress-protection-rating"],"name":"智元 D1 四足","alt":"AgiBot D1 Quadruped","abbr":"","aliases":["D1 Pro","D1 Edu","D1 Ultra"],"one_liner":"智元的四足机器狗系列，分教育娱乐款和工业款","explanation":"D1 是智元机器人的首个四足机器人系列。2025 年 7 月官网先上线工业级的 D1 Ultra，8 月随智元全系产品开售，分 D1 Pro、D1 Edu、D1 Ultra 三款：Pro 和 Edu 面向文娱商演与科研教育，Ultra 面向巡检等工业场景，防护等级 IP54（防尘、防溅水）。公开参数：最高奔跑速度 3.7 m/s，可跳 35 cm 高、连续爬 16 cm 台阶，D1 Pro 重约 15 kg、续航 1–2 小时。运动控制用强化学习训练的策略，而不是手工调的步态控制器。开售价 D1 Pro 1.3 万元、D1 Edu 3.6 万元。","example":"高校实验室用 D1 Edu 做四足强化学习运控的仿真到真机实验。","related":["四足机器人","智元机器人","强化学习运控","宇树 Go2","云深处 绝影 Lite3","IP 防护等级"]},{"id":"vbot-super-robot-dog","category":"robot","sec":9,"tier":3,"sources":[{"title":"Vbot 维他动力官网","url":"https://www.vbot.cn/"}],"as_of":"2026-09","related_ids":["quadruped-robot","vbot","consumer-grade-robot","companion-robot","unitree-go2","xiaomi-cyberdog"],"name":"维他动力 Vbot 超能机器狗","alt":"Vbot Super Robot Dog","abbr":"","aliases":["Vbot","大头BoBo","大头"],"one_liner":"维他动力推出的家用消费级机器狗，主打语音指挥、不用遥控。","explanation":"Vbot 超能机器狗是北京维他动力公司的首款产品，昵称「大头」，面向家庭和个人用户。官网称它是「无需遥控的智能机器狗」：带 Agent 智能体能力，能听语音指令、在家中自主导航避障、自动跟随，支持 App 控制和 OTA 远程升级，留有相机接口、磁吸接口和 Type-C 口方便扩展，官方称可拖拽约 100 kg。官网公布预订累计 6540 台、预售额近 1 亿元，国内 2026 年 4 月开始量产交付，海外版 2026 年二季度上市。据报道公司由前地平线高管余轶南创办。","example":"","related":["四足机器人","维他动力","消费级机器人","陪伴机器人","宇树 Go2","小米 CyberDog"]},{"id":"actuator","category":"hardware","sec":0,"tier":1,"sources":[{"title":"Actuator - Wikipedia","url":"https://en.wikipedia.org/wiki/Actuator"},{"title":"Boston Dynamics: An Electric New Era for Atlas (2024-04)","url":"https://bostondynamics.com/blog/electric-new-era-for-atlas/"}],"as_of":"","related_ids":["joint-actuator-module","servo-motor","speed-reducer-gearbox","hydraulic-actuation","torque-density","backdrivability"],"name":"执行器","alt":"Actuator","abbr":"","aliases":["驱动器","作动器"],"one_liner":"把电能、液压或气压转换成运动和力的部件，是机器人的「肌肉」来源。","explanation":"执行器是机器人里真正产生运动的部件，按能量来源分为电动（电机）、液压、气动，以及形状记忆合金、人工肌肉等新型驱动。控制器算出的指令（位置、速度或力矩）最终都要靠执行器落地，它的扭矩、速度、精度、重量和发热直接决定机器人能做多快、多重、多精细的动作。今天的人形和四足机器人大多用电机加减速器组成的关节模组；早期的波士顿动力 Atlas 用液压，2024 年起改为电动版。选执行器时常看的指标有峰值扭矩、扭矩密度（单位重量能出多大力矩）和反驱性（外力能否反推关节转动）。注意中文「驱动器」有时也指执行器（如串联弹性驱动器），但更常指控制电机电流的电机驱动器，要看上下文。","example":"2024 年 4 月，波士顿动力让用了十多年的液压版 Atlas 退役，换成全电动执行器的新 Atlas，官方称新版力量更大、活动范围比以往各代都广。","related":["关节模组","伺服电机","减速器","液压驱动","扭矩密度","反驱性"]},{"id":"rotary-actuator","category":"hardware","sec":0,"tier":2,"sources":[{"title":"Rotary actuator - Wikipedia","url":"https://en.wikipedia.org/wiki/Rotary_actuator"}],"as_of":"","related_ids":["actuator","joint-actuator-module","linear-actuator","speed-reducer-gearbox","revolute-joint","peak-torque"],"name":"旋转执行器","alt":"Rotary Actuator","abbr":"","aliases":["旋转关节模组","旋转关节执行器"],"one_liner":"输出转动的执行器，机器人转动关节的动力单元。","explanation":"旋转执行器指输出是绕轴转动的驱动单元，和输出直线运动的线性执行器相对。在人形和机械臂里，它通常做成一体化关节模组：电机加减速器，再加编码器、驱动器，有的还带力矩传感器和抱闸，装上就是一个转动关节。选型主要看峰值 / 额定扭矩、转速、重量和反驱性（能不能从输出端被人推动）。人形机器人的肩、肘、髋、膝等大多是旋转执行器，而直线执行器常用在小腿、踝等需要推拉的位置，两者搭配是整机设计的基本取舍。","example":"","related":["执行器","关节模组","线性执行器（直线执行器 / 电缸）","减速器","转动关节","峰值扭矩"]},{"id":"linear-actuator","category":"hardware","sec":0,"tier":2,"sources":[{"title":"Linear actuator - Wikipedia","url":"https://en.wikipedia.org/wiki/Linear_actuator"}],"as_of":"","related_ids":["rotary-actuator","planetary-roller-screw","ball-screw","actuator","linkage-transmission","parallel-ankle-mechanism"],"name":"线性执行器（直线执行器 / 电缸）","alt":"Linear Actuator (Electric Cylinder)","abbr":"","aliases":["直线执行器","电缸","直线驱动器"],"one_liner":"输出直线推拉运动而非旋转的驱动部件。","explanation":"线性执行器输出的是直线运动。机器人里最常见的是电缸：电机带动丝杠（滚珠丝杠或行星滚柱丝杠，把旋转变成直线移动），推动推杆伸缩。它通常不直接当关节，而是像肌肉一样装在连杆上，推拉产生关节转动，比如人形机器人的膝、踝、腰，或灵巧手里驱动手指的微型电缸。优点是推力大、能自锁、刚度高、便于布置在离关节较远处；缺点是速度和反驱性通常不如旋转关节模组，结构也更复杂。它是人形机器人执行器路线讨论里和旋转执行器并列的另一类。","example":"因时 RH56 灵巧手每根手指由一个微型电缸经连杆驱动弯曲。","related":["旋转执行器","行星滚柱丝杠","滚珠丝杠","执行器","连杆传动","并联踝关节"]},{"id":"joint-actuator-module","category":"hardware","sec":0,"tier":1,"sources":[{"title":"Mini Cheetah: A Platform for Pushing the Limits of Dynamic Quadruped Control (ICRA 2019)","url":"https://ieeexplore.ieee.org/document/8793865"},{"title":"Unitree GO-M8010-6 关节电机参数（宇树官网）","url":"https://www.unitree.com/mobile/go1/motor/"}],"as_of":"","related_ids":["actuator","quasi-direct-drive","planetary-gearbox","strain-wave-gear","rotary-encoder","servo-drive"],"name":"关节模组","alt":"Joint Actuator Module","abbr":"","aliases":["关节执行器","一体化关节","一体化关节模组","关节电机"],"one_liner":"把电机、减速器、编码器和驱动器集成在一起的机器人关节单元。","explanation":"关节模组是现代人形、四足机器人的标准关节做法：把无刷电机、减速器（行星、谐波或 RV）、编码器（测角度）、驱动器（控制电流）乃至力矩传感器和抱闸（断电时锁住关节的刹车）封装成一个整体，对外只留电源和通信线（常见 CAN、RS-485 或 EtherCAT）。整机厂只需把模组装进骨架、发位置或力矩指令即可，研发和维修都更省事。它的扭矩、转速、重量、背隙（齿轮间隙）和发热决定了机器人的运动能力，也是整机成本大头之一。MIT Mini Cheetah 的开源关节设计推动了低成本关节模组的普及。","example":"宇树 GO-M8010-6 是四足机器人常用的一体化关节电机，内置约 6.33:1 的行星减速器。","related":["执行器","准直驱","行星减速器","谐波减速器","编码器","电机驱动器"]},{"id":"core-components","category":"hardware","sec":0,"tier":2,"sources":[{"title":"Industrial robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Industrial_robot"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"核心零部件","alt":"Core Components","abbr":"","aliases":["三大核心零部件"],"one_liner":"决定机器人性能和成本的关键部件，传统说法是减速器、伺服、控制器三样。","explanation":"核心零部件是产业界的说法，指决定一台机器人性能、价格和供应安全的那几类关键部件。工业机器人时代常说「三大核心零部件」：减速器（把电机的高转速换成大力矩）、伺服系统（伺服电机加驱动器）、控制器，合起来占整机成本的大头。到了人形机器人，清单通常扩展为关节模组、行星滚柱丝杠、无框力矩电机、空心杯电机、灵巧手、六维力传感器、主控芯片等。这些部件的产能、良率和国产化程度，直接决定整机能不能降价、能不能量产，所以也是研报和投资里讨论「卡脖子」「国产替代」时的主要对象。","example":"谐波减速器、RV 减速器曾长期依赖日本哈默纳科、纳博特斯克，国内厂商如绿的谐波的崛起常被当作核心零部件国产替代的例子。","related":["减速器(Speed Reducer / Gearbox)","伺服电机(Servo Motor)","机器人控制器(Robot Controller)","关节模组(Joint Actuator Module)","国产替代(Domestic Substitution)","BOM 成本(Bill of Materials Cost)"]},{"id":"servo","category":"hardware","sec":0,"tier":2,"sources":[{"title":"Servo (radio control) - Wikipedia","url":"https://en.wikipedia.org/wiki/Servo_(radio_control)"},{"title":"SO-ARM100 (TheRobotStudio) GitHub","url":"https://github.com/TheRobotStudio/SO-ARM100"}],"as_of":"","related_ids":["robotis-dynamixel-servo","feetech-sts3215-servo","so-100-so-101-arm","servo-motor","pulse-width-modulation","desktop-robot-arm"],"name":"舵机","alt":"Servo (Smart Serial Bus Servo)","abbr":"","aliases":["总线舵机","智能舵机"],"one_liner":"电机、减速齿轮、位置传感器和控制板封在一起的小型位置执行器。","explanation":"舵机原本是航模里用来控制舵面的小执行器：一个小盒子里装电机、减速齿轮、位置传感器（电位器或磁编码器）和控制板，给目标角度它就自己转到位。传统舵机用 PWM 脉宽给指令；总线舵机（智能舵机）改用串行总线，多个舵机串在一根线上，每个有 ID，还能回读位置、电流、温度。它便宜、好用，但扭矩和精度有限，多用于教育、桌面机械臂、小型人形和遥操作主臂。做真机实验的新人常从舵机臂入手。","example":"LeRobot 的 SO-100 / SO-101 机械臂用飞特 STS3215 总线舵机，一台只要几百美元。","related":["Dynamixel 舵机","飞特 STS3215 舵机","SO-100 / SO-101 机械臂","伺服电机","PWM（脉宽调制）","桌面机械臂"]},{"id":"robotis-dynamixel-servo","category":"hardware","sec":0,"tier":2,"sources":[{"title":"ROBOTIS e-Manual: DYNAMIXEL XL330-M288-T","url":"https://emanual.robotis.com/docs/en/dxl/x/xl330-m288/"},{"title":"low_cost_robot (Koch arm) README","url":"https://github.com/AlexanderKoch-Koch/low_cost_robot"}],"as_of":"2026-09","related_ids":["servo","robotis","koch-v1-1-arm","gello","trossen-robotics-viperx-300","rs-485"],"name":"Dynamixel 舵机","alt":"ROBOTIS DYNAMIXEL Servo","abbr":"","aliases":["DXL","Dynamixel","DYNAMIXEL 智能执行器"],"one_liner":"韩国 ROBOTIS 出的智能总线舵机，科研和低成本机械臂里最常见。","explanation":"DYNAMIXEL 是韩国 ROBOTIS 公司的智能执行器产品线，一个模块里集成了电机、减速器、控制电路、编码器和通信接口。多个舵机可以用一根总线串起来（菊花链），每个有自己的 ID，上位机按协议读写位置、速度、电流、温度等寄存器，并能切换位置 / 速度 / 电流控制模式。相比自己搭电机加驱动，它省去了大量接线和调参，因此成了机器人学习里低成本机械臂和主从遥操作臂的常用选择。常见型号有小巧的 XL330、XL430 和更强的 XM430 等。","example":"Koch v1.1 机械臂用 XL430 和 XL330 两种 Dynamixel 舵机组装，GELLO 遥操作主臂也基于 Dynamixel。","related":["舵机","ROBOTIS","Koch v1.1 机械臂","GELLO","ViperX 300 机械臂","RS-485 总线"]},{"id":"feetech-sts3215-servo","category":"hardware","sec":0,"tier":2,"sources":[{"title":"Feetech STS3215 Magnetic Encoder 360° Serial bus Servo Evaluation - 飞特","url":"https://www.feetechrc.com/2020-05-13_56655.html"},{"title":"FeeTech 12V 30kg.cm Magnetic Encoding Servo STS3215 - RobotShop","url":"https://www.robotshop.com/products/feetech-12v-30kgcm-magnetic-encoding-servo-sts3215"},{"title":"Testing of Feetech STS3215 Servomotor: Backlash, Repeatability, and Torque - Robo9","url":"https://robonine.com/testing-of-feetech-sts3215-servomotor-backlash-repeatability-and-torque/"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"飞特 STS3215 舵机","alt":"Feetech STS3215 Servo","abbr":"","aliases":["STS3215","ST3215"],"one_liner":"飞特出的串行总线智能舵机，是 LeRobot SO-100/SO-101 机械臂的标配关节。","explanation":"STS3215 是深圳飞特模型公司推出的串行总线舵机（把电机、减速齿轮、位置传感器和控制板封装在一起的小关节）。它用 12 位磁编码器测角，一圈 4096 个刻度，可 360° 转动；多个舵机通过半双工串口总线串在一起，每个有自己的 ID，能读回位置、速度、电压、电流、温度和负载。常见两个版本：7.4V 约 19 kg·cm、12V 约 30 kg·cm 堵转扭矩。它便宜、易买、接线简单，被 Hugging Face LeRobot 的 SO-100/SO-101 开源机械臂选作全部关节，因此成了低成本具身智能入门的事实标准，也常用于 Koch、LeKiwi 等平台。缺点是塑料齿轮有背隙，精度和刚度有限。","example":"组装一台 SO-101 需要 12 个 STS3215（主臂和从臂各 6 个），装好后先逐个设置 ID 再做标定。","related":["舵机(Servo (Smart Serial Bus Servo))","SO-100 / SO-101 机械臂(SO-100 / SO-101 Arm (LeRobot))","LeRobot(LeRobot (Hugging Face))","Dynamixel 舵机(ROBOTIS DYNAMIXEL Servo)","磁编码器(Magnetic Encoder)","背隙(Backlash)"]},{"id":"brushless-dc-motor","category":"hardware","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Brushless DC electric motor","url":"https://en.wikipedia.org/wiki/Brushless_DC_electric_motor"}],"as_of":"","related_ids":["permanent-magnet-synchronous-motor","field-oriented-control","outrunner-motor","servo-drive","hall-effect-sensor","joint-actuator-module"],"name":"无刷直流电机","alt":"Brushless DC Motor","abbr":"BLDC","aliases":["无刷电机","BLDC 电机"],"one_liner":"用电子电路代替电刷换向的直流电机，机器人关节的主力电机","explanation":"无刷直流电机把永磁体放在转子上、线圈放在定子上，由驱动器根据转子位置（霍尔传感器或编码器）用电子方式切换线圈电流，代替有刷电机里会磨损的电刷和换向器。因此它寿命长、效率高、发热集中在定子便于散热，扭矩密度也更高。机器人关节、无人机、灵巧手里的电机大多是无刷电机，通常配合磁场定向控制（FOC）做精确的电流和力矩控制。它和永磁同步电机结构相近，区别主要在反电动势波形和驱动方式，工程上常被混称。","example":"四足机器人的关节模组通常是外转子无刷电机 + 行星减速器 + 编码器，由驱动器用 FOC 控制输出力矩。","related":["永磁同步电机","磁场定向控制","外转子电机","电机驱动器","霍尔传感器","关节模组"]},{"id":"permanent-magnet-synchronous-motor","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Synchronous motor - Wikipedia","url":"https://en.wikipedia.org/wiki/Synchronous_motor"}],"as_of":"","related_ids":["brushless-dc-motor","field-oriented-control","rare-earth-permanent-magnet","servo-motor","frameless-torque-motor","joint-actuator-module"],"name":"永磁同步电机","alt":"Permanent Magnet Synchronous Motor","abbr":"PMSM","aliases":["永磁交流伺服电机"],"one_liner":"转子用永磁体、转速和供电频率严格同步的交流电机。","explanation":"永磁同步电机的转子上装永磁体（多为钕铁硼），定子通三相交流电产生旋转磁场，转子跟着磁场以相同频率转动，所以叫「同步」。它和无刷直流电机结构几乎一样，区别主要在反电动势波形（正弦 vs 梯形）和驱动方式：PMSM 用正弦电流配合磁场定向控制（FOC），力矩更平稳、噪声更小；机器人圈里两者常被混称。PMSM 效率高、功率密度高，但必须有编码器等位置传感器告诉驱动器转子在哪。电动汽车驱动电机、工业伺服电机和大多数机器人关节电机都属于这一类。","example":"人形机器人关节模组里的无框力矩电机，本质上多是配 FOC 驱动的永磁同步电机。","related":["无刷直流电机","磁场定向控制","稀土永磁（钕铁硼）","伺服电机","无框力矩电机","关节模组"]},{"id":"servo-motor","category":"hardware","sec":1,"tier":2,"sources":[{"title":"Servomotor - Wikipedia","url":"https://en.wikipedia.org/wiki/Servomotor"}],"as_of":"","related_ids":["servo-drive","rotary-encoder","permanent-magnet-synchronous-motor","stepper-motor","joint-actuator-module","cascade-control"],"name":"伺服电机","alt":"Servo Motor","abbr":"","aliases":["伺服","伺服系统"],"one_liner":"带位置反馈、能闭环精确控制位置和速度的电机。","explanation":"伺服电机指配有编码器等位置反馈、和伺服驱动器一起组成闭环控制的电机，能精确跟踪位置、速度或力矩指令。「伺服」强调的是闭环跟随这种控制方式，不是某种电机结构，里面通常是永磁同步电机或无刷直流电机。和步进电机不同，它能实时发现并纠正误差，负载变化时也能保持精度。工业机器人、数控机床和机器人关节都大量使用。人形机器人的关节模组本质上也是一套紧凑的伺服系统：电机加减速器加编码器加驱动器。","example":"","related":["电机驱动器","编码器","永磁同步电机","步进电机","关节模组","串级控制"]},{"id":"stepper-motor","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Stepper motor - Wikipedia","url":"https://en.wikipedia.org/wiki/Stepper_motor"}],"as_of":"","related_ids":["servo-motor","brushless-dc-motor","rotary-encoder","open-loop-control","desktop-robot-arm","position-control"],"name":"步进电机","alt":"Stepper Motor","abbr":"","aliases":["步进马达"],"one_liner":"每收到一个脉冲就转过固定角度，不用编码器也能开环定位的电机。","explanation":"步进电机把一圈分成固定的步数（常见每步 1.8°，即一圈 200 步），驱动器每发一个脉冲，转子就走一步，控制器数脉冲就知道转到了哪里，因此可以开环控制，成本也低。它在 3D 打印机、数控雕刻机和一些桌面机械臂里很常见。缺点是转速升高后扭矩下降明显，负载过大时会「丢步」而控制器察觉不到，静止时也持续通电发热。需要力控、反驱和高动态响应的机器人关节，一般改用无刷电机加编码器的伺服方案。","example":"桌面 3D 打印机的 X/Y/Z 轴和挤出机通常都由步进电机驱动。","related":["伺服电机","无刷直流电机","编码器","开环","桌面机械臂","位置控制"]},{"id":"frameless-torque-motor","category":"hardware","sec":1,"tier":2,"sources":[{"title":"Torque motor - Wikipedia","url":"https://en.wikipedia.org/wiki/Torque_motor"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"无框力矩电机","alt":"Frameless Torque Motor","abbr":"","aliases":["无框电机","力矩电机"],"one_liner":"只卖定子和转子、不带外壳轴承的电机，直接装进关节结构里。","explanation":"无框力矩电机是一种以部件形式出售的永磁电机：只有定子（线圈）和转子（磁钢环）两部分，没有外壳、轴承、输出轴和编码器，由机器人厂商把它直接装进自己设计的关节壳体里。它通常做成直径大、厚度薄的扁平环形，极数多，低速下就能输出较大力矩，中间还留有大孔，方便走线或放减速器。这样做省掉了联轴器和重复的结构件，关节更紧凑、更轻、刚性更好。协作机械臂和人形机器人的旋转关节模组，常见组合是无框力矩电机加谐波或行星减速器、双编码器和抱闸。代表厂商有科尔摩根等。","example":"协作臂关节把无框电机的转子套在中空轴上、定子压进关节外壳，电缆从中间的孔穿过去。","related":["关节模组(Joint Actuator Module)","永磁同步电机(Permanent Magnet Synchronous Motor)","中空走线(Hollow-Shaft Cable Routing)","谐波减速器(Strain Wave Gear (Harmonic Drive))","直驱(Direct Drive)","科尔摩根(Kollmorgen)"]},{"id":"outrunner-motor","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Outrunner - Wikipedia","url":"https://en.wikipedia.org/wiki/Outrunner"}],"as_of":"","related_ids":["brushless-dc-motor","quasi-direct-drive","mit-mini-cheetah-actuator","motor-velocity-constant","torque-density","axial-flux-motor"],"name":"外转子电机","alt":"Outrunner Motor","abbr":"","aliases":["外转子无刷电机"],"one_liner":"转子套在外面、整个外壳一起转的无刷电机，扭矩大。","explanation":"外转子电机是一种无刷电机结构：绕组所在的定子在中间不动，贴着永磁体的外壳作为转子在外圈旋转。因为磁体离转轴更远，同样的电磁力能产生更大的力矩，所以外转子电机天生低速大扭矩、扭矩密度高，但转动惯量较大，绕组被包在里面散热也较差。它最早在航模和无人机里普及，价格便宜、选择多。机器人领域把它和一级小减速比行星减速器组合，就是准直驱执行器的常见做法：力矩够用、反驱性好，适合需要柔顺和抗冲击的腿足关节。","example":"MIT Mini Cheetah 的关节执行器就是在外转子无刷电机里塞进一级约 6:1 的行星减速器。","related":["无刷直流电机","准直驱","MIT Cheetah 执行器","KV 值（转速常数）","扭矩密度","轴向磁通电机"]},{"id":"axial-flux-motor","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Axial flux motor - Wikipedia","url":"https://en.wikipedia.org/wiki/Axial_flux_motor"}],"as_of":"","related_ids":["brushless-dc-motor","permanent-magnet-synchronous-motor","torque-density","joint-actuator-module","outrunner-motor","hub-motor"],"name":"轴向磁通电机","alt":"Axial Flux Motor","abbr":"","aliases":["盘式电机","轴向磁场电机"],"one_liner":"磁场沿转轴方向穿过气隙、外形扁平如圆盘的电机","explanation":"普通（径向磁通）电机的磁力线沿半径方向穿过定子与转子之间的气隙，转子是圆柱形；轴向磁通电机把定子和转子做成相对的圆盘，磁力线沿转轴方向走。同样体积下作用半径更大，扭矩密度（单位重量能输出的扭矩）高，且轴向很薄，适合做扁平的关节模组、轮毂电机和电动车驱动。代价是气隙控制、轴向磁拉力等制造难度更高，成本也更高。人形机器人希望关节又短又有劲，因此它是关节电机的一个研发方向。","example":"","related":["无刷直流电机","永磁同步电机","扭矩密度","关节模组","外转子电机","轮毂电机"]},{"id":"coreless-motor","category":"hardware","sec":1,"tier":2,"sources":[{"title":"Coreless DC motor - Wikipedia","url":"https://en.wikipedia.org/wiki/Coreless_DC_motor"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"空心杯电机","alt":"Coreless Motor","abbr":"","aliases":["无铁芯电机","Coreless DC Motor"],"one_liner":"转子没有铁芯、绕组做成杯状的小型电机，轻、响应快，常用在灵巧手里。","explanation":"空心杯电机是一种小型直流电机，转子不用硅钢片铁芯，而是把铜线绕组做成一个自支撑的空心杯子。没有铁芯带来几个好处：转子很轻、转动惯量小，启停和加减速快；没有铁芯里的涡流和磁滞损耗，效率高；也没有齿槽转矩（转动时一格一格的顿挫感），低速更平稳。代价是散热差、功率上不去、价格较高。它长期用于医疗器械、精密仪器和航模，瑞士 Maxon、德国冯哈伯是代表厂商。具身智能里，它主要用在灵巧手的手指关节，配合微型丝杠或减速齿轮驱动每根手指。","example":"不少灵巧手把空心杯电机和微型丝杠塞进手掌或手指里，一个电机驱动一个自由度。","related":["灵巧手(Dexterous Hand)","无刷直流电机(Brushless DC Motor)","微型丝杠(Micro Lead Screw)","齿槽转矩(Cogging Torque)","Maxon(maxon)","冯哈伯(FAULHABER)"]},{"id":"rated-torque","category":"hardware","sec":1,"tier":2,"sources":[{"title":"What's Continuous Stall Torque vs Rated Torque vs Peak Torque? - Parker","url":"https://parkermotion.atlassian.net/wiki/spaces/EIPKB1/pages/23593062"},{"title":"maxon motor: Key information (datasheet explanations)","url":"https://people.ece.ubc.ca/leos/pdf/datasheets/Maxon/MaxonSpecs.pdf"}],"as_of":"","related_ids":["peak-torque","torque-speed-curve","motor-thermal-derating-overheat-protection","liquid-cooled-joint-actuators","torque-constant","payload"],"name":"额定扭矩","alt":"Rated Torque","abbr":"","aliases":["额定力矩","持续扭矩","连续扭矩"],"one_liner":"电机能长时间连续输出而不过热的扭矩。","explanation":"额定扭矩是电机或关节模组在规定条件（额定转速、环境温度、散热方式）下可以长期连续输出、线圈温度又不超过允许范围的扭矩。它本质上是热极限：扭矩越大电流越大、发热越多，额定值就是发热和散热刚好平衡的点。参数表里它和峰值扭矩一起给出，峰值常是额定的数倍，但只能短时使用。选型时要把整个动作周期的扭矩按均方根（RMS）算成等效值，再和额定扭矩比：机械臂长时间举着负载、人形机器人长时间站立，这些持续负载都得落在额定范围内。给关节加液冷等主动散热可以提高能持续输出的扭矩。","example":"机械臂末端伸到 0.5 m 处举着 1 kg 物体，仅这一项就给肩关节带来约 4.9 N·m 的重力矩；要长时间保持这个姿态，肩关节额定扭矩必须高于总重力矩（还要算上手臂自重）。","related":["峰值扭矩","扭矩-转速曲线（T-N 曲线）","电机温升与过热保护","关节液冷（主动散热）","力矩常数（Kt）","负载"]},{"id":"peak-torque","category":"hardware","sec":1,"tier":2,"sources":[{"title":"What's Continuous Stall Torque vs Rated Torque vs Peak Torque? - Parker","url":"https://parkermotion.atlassian.net/wiki/spaces/EIPKB1/pages/23593062"},{"title":"maxon motor: Key information (datasheet explanations)","url":"https://people.ece.ubc.ca/leos/pdf/datasheets/Maxon/MaxonSpecs.pdf"}],"as_of":"","related_ids":["rated-torque","torque-density","torque-speed-curve","motor-thermal-derating-overheat-protection","joint-actuator-module","stall-torque-no-load-speed"],"name":"峰值扭矩","alt":"Peak Torque","abbr":"","aliases":["峰值力矩","最大扭矩"],"one_liner":"电机或关节短时间内能输出的最大扭矩，撑不了多久。","explanation":"峰值扭矩是电机、减速器或整个关节模组短时间内能输出的最大扭矩，单位牛·米（N·m）。它主要受驱动器最大电流、电机磁路饱和和发热限制：电流越大扭矩越大，线圈升温也越快，所以峰值扭矩只能维持很短时间，时间长了会触发过热保护。它和额定扭矩（能长时间持续输出的扭矩）一起列在关节参数表里。对足式和人形机器人，跳跃、爬起、抗推恢复这类动态动作靠的是峰值扭矩，日常站立行走则要看额定扭矩，所以选型不能只看峰值这一个数。","example":"人形机器人从深蹲起跳时，膝关节要在零点几秒内输出远超站立所需的扭矩，靠的就是峰值扭矩；如果长时间保持这么大的扭矩，关节电机会过热降额。","related":["额定扭矩","扭矩密度","扭矩-转速曲线（T-N 曲线）","电机温升与过热保护","关节模组","堵转扭矩 / 空载转速"]},{"id":"stall-torque-no-load-speed","category":"hardware","sec":1,"tier":2,"sources":[{"title":"Stall torque - Wikipedia","url":"https://en.wikipedia.org/wiki/Stall_torque"},{"title":"ROBOTIS e-Manual: XL330-M288-T specifications","url":"https://emanual.robotis.com/docs/en/dxl/x/xl330-m288/"}],"as_of":"","related_ids":["torque-speed-curve","peak-torque","rated-torque","servo","motor-thermal-derating-overheat-protection","torque-constant"],"name":"堵转扭矩 / 空载转速","alt":"Stall Torque / No-load Speed","abbr":"","aliases":["堵转力矩","空载速度"],"one_liner":"电机被卡死时的最大扭矩，和不带负载时的最高转速。","explanation":"这是电机和舵机参数表上的两个端点值。堵转扭矩指输出轴被卡住、转速为零时电机能输出的扭矩，是理论上的最大值；空载转速指不带负载时能达到的最高转速。对直流电机来说，扭矩和转速大致呈一条从堵转点到空载点的斜线（即扭矩-转速曲线），实际工作点在两者之间。堵转时电流最大、发热最快，长时间堵转会烧电机，所以选型不能只看堵转扭矩，还要看额定扭矩和持续工作能力。","example":"选舵机做机械臂时，关节实际需要的扭矩一般只取堵转扭矩的一小部分，给加速和发热留余量。","related":["扭矩-转速曲线（T-N 曲线）","峰值扭矩","额定扭矩","舵机","电机温升与过热保护","力矩常数（Kt）"]},{"id":"torque-speed-curve","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Motor constants - Wikipedia","url":"https://en.wikipedia.org/wiki/Motor_constants"}],"as_of":"","related_ids":["stall-torque-no-load-speed","peak-torque","rated-torque","torque-constant","motor-thermal-derating-overheat-protection","power-density"],"name":"扭矩-转速曲线（T-N 曲线）","alt":"Torque-Speed Curve","abbr":"","aliases":["T-N 曲线","转矩-转速特性曲线","力矩-速度曲线"],"one_liner":"画出电机在各个转速下最多能输出多大力矩的曲线","explanation":"扭矩-转速曲线横轴是转速、纵轴是力矩，描述电机在给定电压下的输出能力边界。低速时力矩最大，转速升高后，反电动势（电机转动时自己产生的反向电压）抵消掉供电电压，能输入的电流变少，力矩随之下降，到空载转速时降为零。曲线通常分两块：连续工作区，可以长时间运行不过热；峰值区，只能短时间使用。选关节电机时要把任务需要的力矩和速度（比如机器人起跳、快速摆腿）画到这张图上，看是否落在电机能力范围内，并留余量。","example":"设计四足机器人时，把跳跃过程中膝关节的力矩-速度轨迹叠加到候选电机的 T-N 曲线上，检查是否超出峰值区。","related":["堵转扭矩 / 空载转速","峰值扭矩","额定扭矩","力矩常数（Kt）","电机温升与过热保护","功率密度"]},{"id":"motor-thermal-derating-overheat-protection","category":"hardware","sec":1,"tier":3,"sources":[{"title":"moteus r4.11 - mjbots（连续电流与散热条件对照）","url":"https://mjbots.com/products/moteus-r4-11"}],"as_of":"","related_ids":["peak-torque","rated-torque","liquid-cooled-joint-actuators","torque-limiting","servo-drive","torque-speed-curve"],"name":"电机温升与过热保护","alt":"Motor Thermal Derating / Overheat Protection","abbr":"","aliases":["热降额","过温保护"],"one_liner":"电机越用越热，驱动器按温度限电流，太热就停机保护。","explanation":"电机工作时，电流流过绕组会发热（铜损，与电流平方成正比），铁芯里也有损耗，温度会持续上升。温度过高会烧坏绕组绝缘、让永磁体退磁，所以驱动器一般用热敏电阻监测绕组和功率管温度：接近上限时先降额，也就是主动压低最大电流和力矩；超过阈值就报错关断。这也是电机要分峰值扭矩和额定扭矩的原因——峰值只能撑几秒，长时间只能跑额定值。对人形和四足机器人，长时间站立、半蹲或搬重物时膝、髋关节持续大力矩，最容易触发过热；常见对策有关节液冷、加散热片，以及在强化学习奖励里惩罚关节力矩。","example":"人形机器人长时间半蹲搬箱子时，膝关节电机温度上升，驱动器自动降低电流上限，机器人会出现腿软、动作变慢，严重时进入保护停机。","related":["峰值扭矩","额定扭矩","关节液冷（主动散热）","力矩限幅","电机驱动器","扭矩-转速曲线（T-N 曲线）"]},{"id":"liquid-cooled-joint-actuators","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Water cooling - Wikipedia","url":"https://en.wikipedia.org/wiki/Water_cooling"}],"as_of":"","related_ids":["motor-thermal-derating-overheat-protection","rated-torque","peak-torque","joint-actuator-module","power-density","torque-density"],"name":"关节液冷（主动散热）","alt":"Liquid-Cooled Joint Actuators (Active Thermal Management)","abbr":"","aliases":["液冷关节","关节主动散热"],"one_liner":"在关节电机里走冷却液，把绕组热量带走，让关节能长时间大扭矩输出。","explanation":"关节液冷是在关节模组的电机外壳或定子附近开冷却通道，用泵让冷却液循环，把电机绕组和驱动器产生的热量带到散热器排掉。电机的发热大致与电流平方成正比，持续输出多大扭矩主要受绕组温度限制，而不是受电机能瞬间给多大力限制；风冷或自然散热跟不上时，关节只能降额运行或触发过热保护。液冷能明显抬高持续扭矩，让人形机器人长时间搬重物、连续高动态运动。代价是多了泵、管路和冷却液，增加重量、复杂度和漏液风险。电动车驱动电机普遍液冷，人形机器人关节正在借鉴这一做法。","example":"","related":["电机温升与过热保护","额定扭矩","峰值扭矩","关节模组","功率密度","扭矩密度"]},{"id":"torque-constant","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Motor constants - Wikipedia","url":"https://en.wikipedia.org/wiki/Motor_constants"},{"title":"GO-M8010-6 Motor User Manual V1.0","url":"https://techshare.co.jp/faq/wp-content/uploads/2023/12/GO-M8010-6_Motor_Data_User_Manual_V1.0.pdf"}],"as_of":"","related_ids":["torque-control","motor-velocity-constant","torque-speed-curve","sensorless-force-estimation","field-oriented-control","brushless-dc-motor"],"name":"力矩常数（Kt）","alt":"Torque Constant","abbr":"Kt","aliases":["转矩常数","扭矩常数"],"one_liner":"电机每通 1 安培电流能产生多少力矩，单位 N·m/A","explanation":"力矩常数 Kt 描述电机电流和输出力矩的比例关系：力矩 ≈ Kt × 电流。它由电机的磁铁、绕组匝数等结构决定，在额定范围内近似不变。这个参数很重要，因为机器人关节做力矩控制时，驱动器实际控制的是电流，靠 Kt 把「想要的力矩」换算成「该给的电流」；反过来，读电流也能粗略估计关节受力，这就是无传感器力估计的基础。Kt 和反电动势常数、KV 值是同一件事的不同表达：Kt 越大，同样电流力矩越大，但最高转速越低。带减速器时要分清手册给的是电机端还是输出端的值。","example":"宇树 GO-M8010-6 关节电机手册标注的力矩常数约为 0.639 N·m/A。","related":["力矩控制","KV 值（转速常数）","扭矩-转速曲线（T-N 曲线）","无传感器力估计","磁场定向控制","无刷直流电机"]},{"id":"motor-velocity-constant","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Motor constants - Wikipedia","url":"https://en.wikipedia.org/wiki/Motor_constants"}],"as_of":"","related_ids":["torque-constant","outrunner-motor","brushless-dc-motor","torque-speed-curve","quasi-direct-drive","gear-ratio"],"name":"KV 值（转速常数）","alt":"Motor Velocity Constant (KV Rating)","abbr":"KV","aliases":["转速常数","Kv"],"one_liner":"电机每加 1 伏电压，空载时每分钟能多转多少圈。","explanation":"KV 值是无刷电机最常见的标称参数，单位是 rpm/V：一台 KV100 的电机接 24V，空载转速大约 2400 rpm。它和力矩常数（Kt，每安培电流产生多少力矩）近似成反比，常用估算 Kt ≈ 9.55 / KV（N·m/A）。所以 KV 越低，同样电流下力矩越大、转速越低；KV 越高则反过来。无人机、航模要高转速，常选高 KV；机器人关节要低速大力矩，一般选低 KV 的大直径外转子电机，再配小减速比减速器。选电机时 KV 要和电源电压、目标转速、减速比一起看。","example":"一台 KV100 的电机接 24V 电源，空载转速约 2400 rpm；按估算公式，其力矩常数约 0.095 N·m/A。","related":["力矩常数（Kt）","外转子电机","无刷直流电机","扭矩-转速曲线（T-N 曲线）","准直驱","减速比"]},{"id":"torque-density","category":"hardware","sec":1,"tier":2,"sources":[{"title":"Torque density - Wikipedia","url":"https://en.wikipedia.org/wiki/Torque_density"}],"as_of":"","related_ids":["joint-actuator-module","peak-torque","quasi-direct-drive","gear-ratio","power-density","mit-mini-cheetah-actuator"],"name":"扭矩密度","alt":"Torque Density","abbr":"","aliases":["力矩密度"],"one_liner":"电机或关节每单位重量（或体积）能输出多大扭矩。","explanation":"扭矩密度一般用 N·m/kg（每公斤多少牛·米）表示，有时也按体积算。它是评价电机和关节模组的核心指标：机器人每个关节都要带着后面所有关节一起动，关节越重，腿和手臂越难做快做灵活，电池也更费。提高扭矩密度的办法有用大直径外转子电机、轴向磁通电机、更好的散热，以及加减速器放大扭矩；但减速比越大，反驱性越差、反射惯量越大，所以足式机器人常用低减速比的准直驱方案来平衡。","example":"MIT Mini Cheetah 用大直径扁平电机加约 6:1 行星减速器，在很轻的关节里拿到足够扭矩，成为准直驱关节的代表设计。","related":["关节模组","峰值扭矩","准直驱","减速比","功率密度","MIT Cheetah 执行器"]},{"id":"power-density","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Power-to-weight ratio - Wikipedia","url":"https://en.wikipedia.org/wiki/Power-to-weight_ratio"}],"as_of":"","related_ids":["torque-density","peak-torque","joint-actuator-module","liquid-cooled-joint-actuators","rare-earth-permanent-magnet","torque-speed-curve"],"name":"功率密度","alt":"Power Density (W/kg)","abbr":"","aliases":["比功率","功率重量比"],"one_liner":"每千克能输出多少功率，衡量电机和关节「又轻又有劲」","explanation":"功率密度指单位质量（有时是单位体积）能输出的功率，常用 W/kg。功率等于扭矩乘以转速，所以它和扭矩密度（N·m/kg，只看能出多大力）不同，还考虑能转多快。足式机器人跳跃、奔跑、摔倒起身都要短时大功率，腿又必须轻，所以关节电机追求高功率密度。提升手段包括高性能钕铁硼磁钢、更好的散热（如关节液冷）、更高的母线电压。评价电池时也会看功率密度，要和决定续航的能量密度（Wh/kg）区分开。","example":"","related":["扭矩密度","峰值扭矩","关节模组","关节液冷（主动散热）","稀土永磁（钕铁硼）","扭矩-转速曲线（T-N 曲线）"]},{"id":"rare-earth-permanent-magnet","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Neodymium magnet - Wikipedia","url":"https://en.wikipedia.org/wiki/Neodymium_magnet"}],"as_of":"2025-04","related_ids":["permanent-magnet-synchronous-motor","brushless-dc-motor","torque-density","power-density","motor-thermal-derating-overheat-protection","core-components"],"name":"稀土永磁（钕铁硼）","alt":"Rare-earth Permanent Magnet (NdFeB)","abbr":"NdFeB","aliases":["钕铁硼","钕磁铁","稀土永磁体"],"one_liner":"以钕、铁、硼为主的强磁材料，是机器人关节电机的核心原料","explanation":"钕铁硼是以钕、铁、硼为主要成分的永磁材料（主相 Nd2Fe14B），1980 年代初由日本住友特殊金属和美国通用汽车分别独立开发，是目前磁性最强的商用永磁体。机器人关节里的永磁同步电机、无刷电机、空心杯电机，转子磁钢基本都用它，同样体积下能出更大扭矩，直接决定关节的扭矩密度和功率密度。它的弱点是高温下会退磁，常加入镝、铽等重稀土提高耐温。中国在稀土开采和磁材加工上占全球大部分份额，2025 年 4 月起对镝、铽等部分中重稀土及相关产品实施出口管制，影响海外电机供应链。","example":"","related":["永磁同步电机","无刷直流电机","扭矩密度","功率密度","电机温升与过热保护","核心零部件"]},{"id":"slotted-vs-slotless-brushless-motor","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Cogging torque - Wikipedia","url":"https://en.wikipedia.org/wiki/Cogging_torque"},{"title":"Brushless DC electric motor - Wikipedia","url":"https://en.wikipedia.org/wiki/Brushless_DC_electric_motor"}],"as_of":"","related_ids":["cogging-torque","brushless-dc-motor","coreless-motor","permanent-magnet-synchronous-motor","torque-density"],"name":"有齿槽 / 无齿槽无刷电机","alt":"Slotted vs. Slotless Brushless Motor","abbr":"","aliases":["有槽 / 无槽无刷电机"],"one_liner":"按定子铁芯有没有开槽绕线来区分的两类无刷电机。","explanation":"常见的有齿槽无刷电机把线圈绕在定子铁芯的齿上，磁路集中，扭矩大、成本低；但转子磁铁经过齿和槽时磁阻变化，会产生齿槽转矩，低速转动时一顿一顿。无齿槽电机把线圈做成自支撑绕组，贴在光滑的铁芯内壁，没有齿，齿槽转矩基本消失，转得平顺、低速控制细腻；代价是气隙变大，同尺寸扭矩偏小，价格也更高。灵巧手、精密云台等讲究平稳的场合常用无齿槽或空心杯电机，腿足关节多用大扭矩的有齿槽电机。","example":"需要低速平稳转动的精密云台常选无齿槽电机，避免齿槽转矩带来的顿挫。","related":["齿槽转矩","无刷直流电机","空心杯电机","永磁同步电机","扭矩密度"]},{"id":"cogging-torque","category":"hardware","sec":1,"tier":3,"sources":[{"title":"Cogging torque - Wikipedia","url":"https://en.wikipedia.org/wiki/Cogging_torque"}],"as_of":"","related_ids":["slotted-vs-slotless-brushless-motor","brushless-dc-motor","permanent-magnet-synchronous-motor","coreless-motor","torque-control","backdrivability"],"name":"齿槽转矩","alt":"Cogging Torque","abbr":"","aliases":["齿槽力矩","定位力矩"],"one_liner":"永磁电机不通电时，磁铁与定子齿互相吸引产生的周期性脉动扭矩","explanation":"永磁电机的定子铁芯开有槽，转子磁铁经过「齿」和「槽」时磁阻不同，会被吸向磁阻最小的位置，所以即使不通电，用手转电机也能感到一格一格的顿挫，这就是齿槽转矩。它叠加在输出扭矩上形成周期性波动，低速时最明显，会引起抖动和噪声，影响精细力控和反驱手感。常见对策有斜槽或斜极、优化槽极配合，或改用无齿槽结构彻底消除，控制上也可以查表做前馈补偿。关节电机选型和力控标定时需要关注。","example":"用手慢慢拨动断电的无刷电机，感到一格一格的阻力，就是齿槽转矩。","related":["有齿槽 / 无齿槽无刷电机","无刷直流电机","永磁同步电机","空心杯电机","力矩控制","反驱性"]},{"id":"speed-reducer-gearbox","category":"hardware","sec":2,"tier":1,"sources":[{"title":"Wikipedia: Gear train","url":"https://en.wikipedia.org/wiki/Gear_train"},{"title":"Wikipedia: Strain wave gearing","url":"https://en.wikipedia.org/wiki/Strain_wave_gearing"}],"as_of":"","related_ids":["gear-ratio","strain-wave-gear","planetary-gearbox","rotate-vector-reducer","joint-actuator-module","backlash"],"name":"减速器","alt":"Speed Reducer / Gearbox","abbr":"","aliases":["减速机","齿轮箱","精密减速器"],"one_liner":"装在电机后面，把高转速小扭矩换成低转速大扭矩的齿轮装置","explanation":"减速器是装在电机和负载之间的传动装置，用齿轮把电机的高转速、小扭矩变成低转速、大扭矩。电机本身转得快但力气小，机器人关节需要转得慢、力气大，所以绝大多数关节模组都是「电机 + 减速器 + 编码器 + 驱动器」的组合。减速比（输入转速除以输出转速）越大，输出扭矩越大，但反驱性越差，背隙和摩擦的影响也越明显。机器人里常见三种：谐波减速器（小巧、几乎无背隙，多用于手臂和手腕）、RV 减速器（刚性好、抗冲击，多用于工业机器人的大关节）、行星减速器（减速比小、反驱性好，多用于四足和人形的准直驱关节）。","example":"工业六轴机械臂的底座、大臂等承重关节常用 RV 减速器，末端手腕等轻载关节常用谐波减速器。","related":["减速比","谐波减速器","行星减速器","RV减速器","关节模组","背隙"]},{"id":"gear-ratio","category":"hardware","sec":2,"tier":2,"sources":[{"title":"Gear train - Wikipedia","url":"https://en.wikipedia.org/wiki/Gear_train"}],"as_of":"","related_ids":["speed-reducer-gearbox","strain-wave-gear","planetary-gearbox","backdrivability","reflected-inertia","quasi-direct-drive"],"name":"减速比","alt":"Gear Ratio","abbr":"","aliases":["传动比"],"one_liner":"电机转几圈、输出轴才转一圈的比值。","explanation":"减速比是减速器（把电机高转速换成低转速、大力矩的齿轮机构）输入转速与输出转速之比。比如 10:1 表示电机转 10 圈输出转 1 圈，理想情况下输出力矩放大约 10 倍、速度降到十分之一。机器人电机本身转得快但力矩小，必须靠减速器才能驱动关节。减速比是关节设计的核心取舍：比值大，力矩足、定位准，但关节变「硬」、难被外力反推（反驱性差），电机转子惯量按减速比的平方放大到输出端（反射惯量）；比值小则相反。工业机械臂常用谐波或 RV 减速器、比值很大，足式机器人多用低减速比的准直驱关节。","example":"MIT Mini Cheetah 的关节执行器只用 6:1 的行星减速，以换取好的反驱性和抗冲击能力。","related":["减速器","谐波减速器","行星减速器","反驱性","反射惯量","准直驱"]},{"id":"backlash","category":"hardware","sec":2,"tier":2,"sources":[{"title":"Wikipedia: Backlash (engineering)","url":"https://en.wikipedia.org/wiki/Backlash_(engineering)"}],"as_of":"","related_ids":["speed-reducer-gearbox","strain-wave-gear","planetary-gearbox","dual-encoder","pose-repeatability"],"name":"背隙","alt":"Backlash","abbr":"","aliases":["回差","齿隙","空程"],"one_liner":"齿轮换向时输入转了、输出还没动的那一小段空转量","explanation":"背隙是传动系统里相互啮合的齿之间留下的间隙：输入端换向转动时，要先走完这段间隙，输出端才开始跟着动。它通常用弧分表示。背隙会让关节在换向时出现一小段「死区」，降低定位精度和控制稳定性，在做精细操作或力控时尤其明显，还可能在控制中引起抖动。不同减速器背隙差别很大：谐波减速器接近零，RV 减速器很小，普通行星减速器相对大一些。编码器装在电机端还是输出端（双编码器）也会影响能否察觉和补偿背隙。","example":"机械臂末端来回小幅摆动时，如果关节背隙大，末端会在换向瞬间先停顿一下再跟上，轨迹上出现小台阶。","related":["减速器","谐波减速器","行星减速器","双编码器","重复定位精度"]},{"id":"planetary-gearbox","category":"hardware","sec":2,"tier":1,"sources":[{"title":"Epicyclic gearing - Wikipedia","url":"https://en.wikipedia.org/wiki/Epicyclic_gearing"},{"title":"Mini Cheetah: A Platform for Pushing the Limits of Dynamic Quadruped Control (ICRA 2019)","url":"https://ieeexplore.ieee.org/document/8793865"}],"as_of":"","related_ids":["speed-reducer-gearbox","gear-ratio","strain-wave-gear","quasi-direct-drive","backlash","joint-actuator-module"],"name":"行星减速器","alt":"Planetary Gearbox","abbr":"","aliases":["行星齿轮箱","行星减速箱","行星齿轮减速器"],"one_liner":"用太阳轮、行星轮和内齿圈把电机高转速变成大扭矩的减速器。","explanation":"行星减速器由中间的太阳轮、围着它转的几个行星轮、外圈的内齿圈和连接行星轮的行星架组成，因形似行星绕太阳转而得名。电机转得快但扭矩小，减速器把转速降下来、扭矩放大，关节才推得动腿和手臂。它的优点是结构紧凑、多个行星轮分担负载、单级效率高，而且单级减速比较低（常见几比一到十比一左右），外力容易反推，适合需要力控和抗冲击的腿足机器人。缺点是背隙（齿轮间隙）通常比谐波减速器大，精度略差。准直驱关节一般就是电机加单级行星减速器。","example":"MIT Mini Cheetah 的关节采用约 6:1 的单级行星减速器。","related":["减速器","减速比","谐波减速器","准直驱","背隙","关节模组"]},{"id":"strain-wave-gear","category":"hardware","sec":2,"tier":1,"sources":[{"title":"Wikipedia: Strain wave gearing","url":"https://en.wikipedia.org/wiki/Strain_wave_gearing"},{"title":"Harmonic Drive: Strain Wave Gear Technology","url":"https://www.harmonicdrive.net/technology/harmonicdrive"},{"title":"US Patent 2,906,143: Strain Wave Gearing（C. W. Musser，1955 年申请）","url":"https://patents.google.com/patent/US2906143A/en"}],"as_of":"","related_ids":["speed-reducer-gearbox","wave-generator","flexspline","circular-spline","backlash","leaderdrive"],"name":"谐波减速器","alt":"Strain Wave Gear (Harmonic Drive)","abbr":"","aliases":["谐波","谐波齿轮减速器","Harmonic Drive","Strain Wave Gearing"],"one_liner":"靠柔性齿圈弹性变形来减速的精密减速器，小巧、几乎无背隙","explanation":"谐波减速器由三件组成：波发生器（椭圆凸轮加柔性轴承）、柔轮（薄壁、可弹性变形的外齿圈）和刚轮（刚性内齿圈）。波发生器转动时把柔轮撑成椭圆，只在长轴两端与刚轮啮合；柔轮通常比刚轮少两个齿，波发生器转一圈，柔轮只相对刚轮错过两个齿，所以单级就能得到很大的减速比（约 30:1 到 320:1）。原理由美国发明家 C. Walton Musser 在 1955 年发明并申请专利（1959 年获授权），日本 Harmonic Drive Systems（哈默纳科）是代表厂商，国内有绿的谐波、来福谐波等。它体积小、重量轻、背隙接近零，广泛用于协作机械臂、人形机器人的手臂和手腕关节；缺点是柔轮会疲劳，刚度和抗冲击能力不如 RV 减速器。","example":"协作机械臂的关节模组多采用「无框力矩电机 + 谐波减速器」的中空结构，线缆从中间穿过。","related":["减速器","波发生器","柔轮","刚轮","背隙","绿的谐波"]},{"id":"rotate-vector-reducer","category":"hardware","sec":2,"tier":2,"sources":[{"title":"Cycloidal drive - Wikipedia","url":"https://en.wikipedia.org/wiki/Cycloidal_drive"},{"title":"Nabtesco Precision Reduction Gears","url":"https://www.nabtesco.com/en/"}],"as_of":"","related_ids":["speed-reducer-gearbox","cycloidal-reducer","strain-wave-gear","planetary-gearbox","nabtesco","industrial-robot"],"name":"RV减速器","alt":"Rotate Vector Reducer","abbr":"RV","aliases":["RV 减速机"],"one_liner":"行星齿轮加摆线针轮两级减速的精密减速器，刚性高、承载大。","explanation":"RV 减速器是一种两级精密减速器：第一级是行星齿轮，第二级是摆线针轮（摆线轮在一圈针齿里偏心滚动，实现大减速比）。它由日本纳博特斯克（Nabtesco）推向工业机器人市场。和谐波减速器相比，RV 体积重量更大，但刚性高、抗冲击、能扛大负载，所以传统工业六轴机器人的腰、肩、肘等重载关节多用 RV，小臂和手腕多用谐波。人形机器人更看重轻量，关节里用得较少，了解它主要是为了看懂工业机器人和减速器产业链。","example":"工业机器人底座回转轴常用 RV 减速器承受整臂的重量和倾覆力矩。","related":["减速器","摆线减速器","谐波减速器","行星减速器","纳博特斯克","工业机器人"]},{"id":"cycloidal-reducer","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Cycloidal drive - Wikipedia","url":"https://en.wikipedia.org/wiki/Cycloidal_drive"}],"as_of":"","related_ids":["speed-reducer-gearbox","rotate-vector-reducer","strain-wave-gear","planetary-gearbox","backlash","gear-ratio"],"name":"摆线减速器","alt":"Cycloidal Reducer","abbr":"","aliases":["摆线针轮减速器","摆线减速机","Cycloidal Drive"],"one_liner":"靠偏心转动的摆线盘与一圈针齿啮合来大比例降速增扭的减速器","explanation":"摆线减速器是一种机械减速装置：输入轴带动偏心轴，使边缘为摆线齿形的圆盘在一圈固定针齿里「滚着转」，圆盘每公转一圈只自转很少一点，从而得到很大的减速比（单级常见几十比一）。它同时有多个齿在受力，所以抗冲击、刚性好、背隙（齿轮反向时的空行程）可以做得很小。工业机械臂根部大关节常用的 RV 减速器，就是「行星齿轮 + 摆线针轮」两级组合。在人形和四足机器人里，它常被拿来和谐波减速器、行星减速器比较：比谐波更耐冲击，但结构更重、加工精度要求高。","example":"六轴工业机器人底座和大臂关节里的 RV 减速器，第二级就是摆线针轮结构。","related":["减速器","RV减速器","谐波减速器","行星减速器","背隙","减速比"]},{"id":"worm-gear","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Worm drive - Wikipedia","url":"https://en.wikipedia.org/wiki/Worm_drive"}],"as_of":"","related_ids":["speed-reducer-gearbox","gear-ratio","backdrivability","strain-wave-gear","planetary-gearbox","trapezoidal-lead-screw-and-self-locking"],"name":"蜗轮蜗杆","alt":"Worm Gear","abbr":"","aliases":["蜗杆减速器","蜗轮蜗杆减速器","Worm Drive"],"one_liner":"螺旋状蜗杆带动蜗轮，实现大减速比和垂直换向的齿轮传动","explanation":"蜗轮蜗杆是一种经典齿轮传动：螺杆状的蜗杆转一圈，只推动与它垂直啮合的蜗轮转过一个或几个齿，所以单级就能做出几十比一的大减速比，同时把旋转方向转 90 度。它常见的特点是可以自锁（外力很难从蜗轮反推蜗杆），断电后能保持位置，不用额外抱闸。缺点是齿面滑动摩擦大、效率低、发热，也基本不可反驱，不适合需要柔顺、力控的关节。在具身智能硬件里，它多用于灵巧手手指、云台、升降机构等小空间、需要保持姿态的部位，和谐波减速器、行星减速器是不同取舍。","example":"部分低成本灵巧手用微型电机加蜗轮蜗杆驱动手指，断电后手指仍能保持握住的姿势。","related":["减速器","减速比","反驱性","谐波减速器","行星减速器","梯形丝杠（滑动丝杠）与自锁"]},{"id":"wave-generator","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Strain wave gearing - Wikipedia","url":"https://en.wikipedia.org/wiki/Strain_wave_gearing"}],"as_of":"","related_ids":["strain-wave-gear","flexspline","circular-spline","gear-ratio","backlash","thin-section-bearing"],"name":"波发生器","alt":"Wave Generator","abbr":"","aliases":["波发生器凸轮","椭圆凸轮"],"one_liner":"谐波减速器的输入件：椭圆凸轮加柔性轴承，把柔轮撑成椭圆","explanation":"波发生器是谐波减速器三大件之一（另外两个是柔轮和刚轮），接在电机上作为输入。它由一个椭圆形凸轮和套在外面的薄壁柔性轴承组成，装进薄壁的柔轮里，把柔轮撑成椭圆，使柔轮只在长轴两端和刚轮的内齿啮合。波发生器每转一圈，啮合位置跟着转一圈，而柔轮通常比刚轮少 2 个齿，于是柔轮只相对刚轮错开 2 个齿，得到很大的减速比，单级常见几十到一百多。谐波减速器由此做到体积小、背隙小，广泛用于机械臂和人形机器人的关节。","example":"减速比 100 的谐波减速器：柔轮 200 齿、刚轮 202 齿，波发生器转 100 圈，柔轮输出转 1 圈。","related":["谐波减速器","柔轮","刚轮","减速比","背隙","薄壁轴承"]},{"id":"flexspline","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Strain wave gearing - Wikipedia","url":"https://en.wikipedia.org/wiki/Strain_wave_gearing"}],"as_of":"","related_ids":["strain-wave-gear","wave-generator","circular-spline","gear-ratio","backlash"],"name":"柔轮","alt":"Flexspline","abbr":"","aliases":["柔性齿轮"],"one_liner":"谐波减速器里那个会被撑成椭圆、薄壁带外齿的柔性杯状齿轮","explanation":"柔轮是谐波减速器的三大核心件之一（另两个是波发生器和刚轮）。它是一个薄壁的杯形或帽形金属件，外圈带齿。椭圆形的波发生器在里面转动时，把柔轮撑成椭圆，只在长轴两端与刚轮的内齿啮合；柔轮比刚轮少两个齿，波发生器每转一圈，柔轮就相对刚轮错过两个齿，从而得到上百比一的减速比。柔轮要反复弹性变形，材料、热处理和加工精度直接决定谐波减速器的寿命和精度，也是国产谐波减速器攻关的重点部件。","example":"","related":["谐波减速器","波发生器","刚轮","减速比","背隙"]},{"id":"circular-spline","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Strain wave gearing - Wikipedia","url":"https://en.wikipedia.org/wiki/Strain_wave_gearing"}],"as_of":"","related_ids":["strain-wave-gear","flexspline","wave-generator","gear-ratio","backlash","leaderdrive"],"name":"刚轮","alt":"Circular Spline","abbr":"","aliases":["刚性齿轮"],"one_liner":"谐波减速器里带内齿、通常固定不动的刚性外圈","explanation":"谐波减速器由三件组成：椭圆形的波发生器、薄壁可变形的柔轮（外齿）和刚轮（内齿）。刚轮是一个厚实的内齿圈，齿数通常比柔轮多 2 个。波发生器转动时把柔轮撑成椭圆，柔轮长轴两端的齿与刚轮啮合，啮合位置随之旋转；波发生器转一圈，柔轮相对刚轮只错开齿数差那么多个齿，从而得到大减速比。常见用法是刚轮固定在壳体上、柔轮输出。刚轮的齿形精度和刚度直接影响背隙和传动精度。","example":"柔轮 200 齿、刚轮 202 齿，刚轮固定、柔轮输出时减速比为 200÷2＝100:1。","related":["谐波减速器","柔轮","波发生器","减速比","背隙","绿的谐波"]},{"id":"crossed-roller-bearing","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Rolling-element bearing - Wikipedia","url":"https://en.wikipedia.org/wiki/Rolling-element_bearing"}],"as_of":"","related_ids":["strain-wave-gear","thin-section-bearing","joint-actuator-module","stiffness","core-components","payload"],"name":"交叉滚子轴承","alt":"Crossed Roller Bearing","abbr":"","aliases":["交叉圆柱滚子轴承"],"one_liner":"滚子相互垂直交叉排列，一个就能承受各方向载荷的薄型轴承","explanation":"交叉滚子轴承在内外圈之间的 V 形滚道里放一排圆柱滚子，相邻滚子轴线互相垂直交替排列，因此一个轴承就能同时承受径向力、双向轴向力和倾覆力矩，而普通方案往往要两个轴承成对使用。它截面薄、刚度高、旋转精度好，常用于机器人关节输出端、转台，很多谐波减速器组件也自带它作为输出轴承，直接承受外部负载。代价是对安装面精度要求高，价格也更贵。","example":"协作机械臂关节模组里，谐波减速器输出端常用交叉滚子轴承支撑末端传来的弯矩。","related":["谐波减速器","薄壁轴承","关节模组","刚度","核心零部件","负载"]},{"id":"thin-section-bearing","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Kaydon Bearings (thin-section bearing manufacturer)","url":"https://www.kaydonbearings.com/"},{"title":"Bearing (mechanical) - Wikipedia","url":"https://en.wikipedia.org/wiki/Bearing_(mechanical)"}],"as_of":"","related_ids":["crossed-roller-bearing","joint-actuator-module","hollow-shaft-cable-routing","strain-wave-gear","lightweighting"],"name":"薄壁轴承","alt":"Thin-Section Bearing","abbr":"","aliases":["薄截面轴承","等截面薄壁轴承"],"one_liner":"截面很薄、内孔很大的轴承，适合做中空、轻量的机器人关节。","explanation":"薄壁轴承的内外圈截面尺寸很小，而且在同一系列里截面固定、不随内径增大而变厚，所以大孔径时依然轻薄。机器人关节既要中空走线，又要压缩体积和重量，常在谐波减速器、关节模组输出端和转台里使用薄壁的深沟球、角接触或四点接触球轴承；交叉滚子轴承也常做成薄型，同时承受径向力、轴向力和倾覆力矩。代价是刚性和承载能力低于同孔径的标准轴承，对安装配合和壳体精度要求更高。","example":"","related":["交叉滚子轴承","关节模组","中空走线","谐波减速器","轻量化（镁合金 / 碳纤维）"]},{"id":"ball-screw","category":"hardware","sec":2,"tier":2,"sources":[{"title":"Wikipedia: Ball screw","url":"https://en.wikipedia.org/wiki/Ball_screw"}],"as_of":"","related_ids":["planetary-roller-screw","linear-actuator","screw-lead","trapezoidal-lead-screw-and-self-locking","holding-brake"],"name":"滚珠丝杠","alt":"Ball Screw","abbr":"","aliases":["滚珠螺杆"],"one_liner":"螺杆和螺母之间夹着滚珠，把旋转高效地变成直线运动","explanation":"滚珠丝杠是把电机的旋转运动变成直线运动的传动件：螺杆和螺母的螺纹槽之间装着一圈圈钢珠，钢珠在槽里滚动并循环，把普通丝杠的滑动摩擦变成滚动摩擦，所以传动效率高、精度高、磨损小。它广泛用于数控机床、直线模组和直角坐标机器人。在人形机器人里，丝杠用来做直线执行器（电缸），推动膝、踝等关节；承载更大的场合会改用接触面更多的行星滚柱丝杠。因为效率高，滚珠丝杠一般不能自锁，断电时需要抱闸防止负载下滑。","example":"数控机床的工作台由伺服电机带动滚珠丝杠，实现精确的直线进给。","related":["行星滚柱丝杠","线性执行器（直线执行器 / 电缸）","导程","梯形丝杠（滑动丝杠）与自锁","抱闸"]},{"id":"planetary-roller-screw","category":"hardware","sec":2,"tier":2,"sources":[{"title":"Roller screw - Wikipedia","url":"https://en.wikipedia.org/wiki/Roller_screw"}],"as_of":"","related_ids":["ball-screw","inverted-planetary-roller-screw","linear-actuator","screw-lead","tesla-optimus","domestic-substitution"],"name":"行星滚柱丝杠","alt":"Planetary Roller Screw","abbr":"","aliases":["滚柱丝杠"],"one_liner":"用带螺纹的滚柱传力，把电机转动变成大推力直线运动的丝杠。","explanation":"行星滚柱丝杠是把旋转运动转成直线运动的传动件，结构和滚珠丝杠相似，但在丝杠和螺母之间用一圈带螺纹的滚柱代替滚珠，滚柱像行星一样边自转边绕丝杠公转。瑞典工程师 Carl Bruno Strandgren 在 20 世纪 40 年代做出了早期实用设计。因为接触线多，它比同尺寸滚珠丝杠承载更大、刚度更高、寿命更长，但螺纹加工要求高，价格可达滚珠丝杠的十倍左右，过去主要用在航空、机床等场合。人形机器人兴起后，它被装进线性执行器，驱动膝、肘、踝等需要大推力的关节，成了热门的核心零部件和国产替代方向。","example":"特斯拉在 2022 年 AI Day 上展示的 Optimus 线性执行器，内部是电机加行星滚柱丝杠，把转动变成推杆伸缩来驱动关节。","related":["滚珠丝杠","反向式行星滚柱丝杠","线性执行器（直线执行器 / 电缸）","导程","擎天柱","国产替代"]},{"id":"inverted-planetary-roller-screw","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Roller screw - Wikipedia","url":"https://en.wikipedia.org/wiki/Roller_screw"}],"as_of":"","related_ids":["planetary-roller-screw","ball-screw","linear-actuator","screw-lead",null],"name":"反向式行星滚柱丝杠","alt":"Inverted Planetary Roller Screw","abbr":"","aliases":["反向滚柱丝杠","反向行星滚柱丝杠"],"one_liner":"把长螺纹做在螺母内壁、滚柱随丝杠移动的行星滚柱丝杠变体。","explanation":"行星滚柱丝杠用一圈带螺纹的滚柱代替滚珠，在丝杠和螺母之间传力，把旋转变成直线运动，承载能力和寿命比滚珠丝杠高。标准型是丝杠长、螺母短，螺母沿丝杠走；反向式则反过来，长螺纹做在螺母内壁，滚柱和较短的丝杠一起沿螺母移动，输出由丝杠推出。这样螺母可以直接做成电机转子，电机和丝杠嵌套在一起，得到很紧凑的直线执行器。人形机器人需要在小体积里输出大推力的膝、踝、肘等部位关注这类方案，据报道特斯拉 Optimus 的直线执行器就采用了行星滚柱丝杠。它的加工难度高，国产化是产业链热点之一。","example":"","related":["行星滚柱丝杠","滚珠丝杠","线性执行器（直线执行器 / 电缸）","导程","特斯拉(Tesla)"]},{"id":"screw-lead","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Leadscrew - Wikipedia","url":"https://en.wikipedia.org/wiki/Leadscrew"},{"title":"Screw thread (Lead, pitch, and starts) - Wikipedia","url":"https://en.wikipedia.org/wiki/Screw_thread"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"导程","alt":"Screw Lead","abbr":"","aliases":["丝杠导程"],"one_liner":"丝杠转一圈时螺母沿轴向走的距离","explanation":"导程是丝杠（把旋转变成直线运动的螺纹传动件）转一整圈时，螺母沿轴线移动的距离，等于螺距乘以螺纹的线数（头数）。它相当于旋转到直线的「减速比」：导程越小，同样的电机扭矩能推出更大的力、位置分辨率更高，但直线速度更慢；导程越大则反过来。设计人形机器人的直线执行器或灵巧手的微型丝杠驱动时，导程要和电机转速、扭矩、所需推力一起选。导程小的梯形丝杠还可能自锁，断电后不会被负载反推回去。","example":"导程 5 mm 的滚珠丝杠，电机转速 3000 rpm 时，螺母速度为 3000÷60×5 = 250 mm/s。","related":["滚珠丝杠(Ball Screw)","行星滚柱丝杠(Planetary Roller Screw)","线性执行器（直线执行器 / 电缸）(Linear Actuator (Electric Cylinder))","微型丝杠(Micro Lead Screw)","梯形丝杠（滑动丝杠）与自锁(Trapezoidal Lead Screw & Self-Locking)","减速比(Gear Ratio)"]},{"id":"trapezoidal-lead-screw-and-self-locking","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Leadscrew - Wikipedia","url":"https://en.wikipedia.org/wiki/Leadscrew"}],"as_of":"","related_ids":["ball-screw","screw-lead","micro-lead-screw","backdrivability","linear-actuator","holding-brake"],"name":"梯形丝杠（滑动丝杠）与自锁","alt":"Trapezoidal Lead Screw & Self-Locking","abbr":"","aliases":["梯形丝杆","滑动丝杠","T 型丝杠"],"one_liner":"螺纹截面呈梯形、靠滑动摩擦传动的丝杠，断电能自己锁住","explanation":"梯形丝杠是一种把旋转变成直线运动的丝杠，螺纹截面是梯形，螺母和丝杠之间是滑动接触，不像滚珠丝杠那样中间有滚珠。它便宜、结构简单，但摩擦大、效率低。摩擦大带来一个性质叫自锁：当螺纹升角小于摩擦角时，轴向推力推不动丝杠反转，所以断电后负载不会自己往下掉，不需要额外抱闸。代价是反驱性差，外力推不动关节，不适合需要柔顺或力控的场合。它常用在低成本直线执行器、升降机构，以及一些用微型丝杠推动手指的灵巧手里。","example":"桌面 3D 打印机的 Z 轴常用 T8 梯形丝杠，断电后打印平台不会下滑。","related":["滚珠丝杠","导程","微型丝杠","反驱性","线性执行器（直线执行器 / 电缸）","抱闸"]},{"id":"micro-lead-screw","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Leadscrew - Wikipedia","url":"https://en.wikipedia.org/wiki/Leadscrew"},{"title":"灵心巧手 - 全球领先的机器人灵巧手 | LinkerBot","url":"https://www.linkerbot.cn/"}],"as_of":"","related_ids":["coreless-motor","ball-screw","planetary-roller-screw","trapezoidal-lead-screw-and-self-locking","screw-lead","linkage-transmission"],"name":"微型丝杠","alt":"Micro Lead Screw","abbr":"","aliases":["微型滚珠丝杠","微型行星滚柱丝杠"],"one_liner":"直径只有几毫米的丝杠，把小电机的转动变成直线推拉。","explanation":"微型丝杠是直径通常只有几毫米的丝杠，包括微型梯形丝杠、微型滚珠丝杠和微型行星滚柱丝杠，作用是把电机的旋转变成螺母的直线移动。在灵巧手里，常见做法是空心杯电机加微型丝杠组成一个小直线驱动器，藏在手掌或手指里推拉连杆，带动手指弯曲。导程（转一圈螺母走多远）越小，推力越大但速度越慢；梯形丝杠摩擦大能自锁，断电后手指仍能保持握力。人形机器人对它的需求量大，精度和寿命是国产化的难点之一。","example":"灵心巧手 Linker Hand L20 用无刷电机加精密滚珠丝杠驱动连杆，带动手指关节运动。","related":["空心杯电机","滚珠丝杠","行星滚柱丝杠","梯形丝杠（滑动丝杠）与自锁","导程","连杆传动"]},{"id":"linear-motor","category":"hardware","sec":2,"tier":3,"sources":[{"title":"Linear motor - Wikipedia","url":"https://en.wikipedia.org/wiki/Linear_motor"}],"as_of":"","related_ids":["linear-actuator","planetary-roller-screw","ball-screw","direct-drive","permanent-magnet-synchronous-motor","backlash"],"name":"直线电机","alt":"Linear Motor","abbr":"","aliases":["线性电机"],"one_liner":"不经丝杠等传动、直接输出直线推力和直线运动的电机。","explanation":"直线电机的定子（线圈或磁轨）和动子沿一条直线展开，通电后动子直接沿轨道平移，中间没有丝杠、齿轮这类把转动变成直线运动的机构。好处是速度快、定位精度高、没有背隙（传动间隙），因此大量用在半导体设备、精密平台和高速分拣上；缺点是单位体积推力小、成本高、断电不能自锁。新人容易混淆的是：人形机器人上常说的「线性执行器」或「电缸」，大多是旋转电机加行星滚柱丝杠，并不是直线电机。","example":"晶圆检测设备的精密运动平台常用直线电机驱动，配合光栅尺实现微米级定位。","related":["线性执行器（直线执行器 / 电缸）","行星滚柱丝杠","滚珠丝杠","直驱","永磁同步电机","背隙"]},{"id":"servo-drive","category":"hardware","sec":3,"tier":2,"sources":[{"title":"Servo drive - Wikipedia","url":"https://en.wikipedia.org/wiki/Servo_drive"},{"title":"ODrive Robotics","url":"https://odriverobotics.com/"}],"as_of":"","related_ids":["servo-motor","field-oriented-control","integrated-drive-and-control","ethercat","controller-area-network","odrive"],"name":"电机驱动器","alt":"Servo Drive / Motor Driver","abbr":"","aliases":["驱动器","伺服驱动器","电驱"],"one_liner":"把控制指令变成电机电流的功率电子板，负责电流环等底层控制。","explanation":"电机驱动器是控制器和电机之间的功率电子模块。上位机或主控只发「转到哪 / 转多快 / 出多大力矩」这类指令，驱动器读取编码器，用功率管（MOSFET 等）按 PWM 方式给电机绕组通电，内部跑电流环、速度环、位置环（即串级控制），无刷电机还要做磁场定向控制（FOC）。它通过 CAN、EtherCAT、RS-485 等总线与主控通信。选型看电压、持续 / 峰值电流、控制频率和通信接口。在人形机器人里，驱动器常和电机、减速器集成在关节模组里，称为驱控一体。","example":"ODrive、mjbots moteus 是机器人爱好者常用的开源无刷电机驱动器。","related":["伺服电机","磁场定向控制","驱控一体","EtherCAT 总线","CAN 总线","ODrive 驱动器"]},{"id":"pulse-width-modulation","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Pulse-width modulation - Wikipedia","url":"https://en.wikipedia.org/wiki/Pulse-width_modulation"}],"as_of":"","related_ids":["servo-drive","field-oriented-control","servo","brushless-dc-motor","microcontroller-unit","raspberry-pi"],"name":"PWM（脉宽调制）","alt":"Pulse Width Modulation","abbr":"PWM","aliases":["脉宽调制","脉冲宽度调制"],"one_liner":"用快速开关的方波、调节高电平占比来控制平均电压或功率","explanation":"PWM 是一种用数字开关信号控制「多大功率」的方法：信号频率固定，只调一个周期里高电平所占的比例（占空比）。占空比 50%，负载上的平均电压就约为电源电压的一半。开关器件只处于全开或全关，自身损耗小，所以电机驱动器、开关电源、LED 调光都用它。在机器人里，电机驱动器用三相逆变桥的 PWM 生成电机电流，常和磁场定向控制（FOC）配合；舵机则用 PWM 脉冲的宽度编码目标角度。单片机和树莓派都能直接输出 PWM。","example":"常见模拟舵机每 20 ms 收一个脉冲，脉宽约 1–2 ms 对应不同的目标角度。","related":["电机驱动器","磁场定向控制","舵机","无刷直流电机","微控制器","树莓派"]},{"id":"absolute-encoder","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Rotary encoder - Wikipedia","url":"https://en.wikipedia.org/wiki/Rotary_encoder"}],"as_of":"","related_ids":["rotary-encoder","incremental-encoder","magnetic-encoder","optical-encoder","dual-encoder","joint-actuator-module"],"name":"绝对值编码器","alt":"Absolute Encoder","abbr":"","aliases":["绝对式编码器"],"one_liner":"每个角度都有唯一读数、断电重启后仍知道当前位置的编码器。","explanation":"编码器是测量电机或关节转了多少角度的传感器。绝对值编码器给每个位置一个唯一编码，上电立刻就能读出当前角度；增量式编码器只数脉冲，断电后要重新回零才知道自己在哪。对机器人来说，绝对值编码器意味着开机不用把关节转到限位去找零点，人形机器人和机械臂的关节模组普遍采用。常见实现有磁编码器和光电编码器；多圈绝对值编码器还能记住转过了几圈。很多关节在电机端和输出端各放一个编码器，称为双编码器。","example":"人形机器人开机时，关节上的绝对值编码器直接报告各关节角度，不需要先摆到固定姿势回零。","related":["编码器","增量式编码器","磁编码器","光电编码器","双编码器","关节模组"]},{"id":"incremental-encoder","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Incremental encoder - Wikipedia","url":"https://en.wikipedia.org/wiki/Incremental_encoder"}],"as_of":"","related_ids":["rotary-encoder","absolute-encoder","dual-encoder","homing-zero-offset-calibration","optical-encoder"],"name":"增量式编码器","alt":"Incremental Encoder","abbr":"","aliases":["增量编码器"],"one_liner":"只输出转动变化量的脉冲、需计数才知道位置的编码器。","explanation":"增量式编码器随转轴转动输出一串脉冲，通常是相位差 90 度的 A、B 两路信号（正交信号），再加一路每圈一个的 Z 零位脉冲。控制器数脉冲个数得到转了多少，看 A、B 谁先谁后判断方向。它结构简单、便宜、分辨率容易做高，所以在电机上很常见。缺点是它只知道「相对上电时动了多少」，断电后位置就丢了，每次开机要回零，或者借助 Z 脉冲、限位开关重新找基准。机器人关节如果只用增量编码器，开机常有一个回零动作；想免回零就要用绝对值编码器，或采用双编码器方案。","example":"3D 打印机和很多桌面机械臂开机先把各轴撞一下限位开关，就是因为用的是增量式位置反馈，得先回零。","related":["编码器","绝对值编码器","双编码器","回零 / 零位标定","光电编码器"]},{"id":"optical-encoder","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Rotary encoder - Wikipedia","url":"https://en.wikipedia.org/wiki/Rotary_encoder"}],"as_of":"","related_ids":["rotary-encoder","incremental-encoder","absolute-encoder","magnetic-encoder","dual-encoder","servo-motor"],"name":"光电编码器","alt":"Optical Encoder","abbr":"","aliases":["光编"],"one_liner":"靠光线穿过带刻线的码盘来测量转角的编码器，精度高。","explanation":"光电编码器由光源、码盘和光电接收器组成：码盘上刻有透光和不透光的细条纹，随电机轴转动时光被周期性遮断，接收器据此输出脉冲或读出码道，换算成转角。按输出方式分增量式（数脉冲，断电后要重新找零）和绝对值式（每个位置有唯一编码，上电即知角度）。它的优点是分辨率和精度高、不受磁场干扰，工业伺服电机和高端机械臂关节常用；缺点是怕灰尘、油污和冲击，体积和成本也比磁编码器高，所以低成本机器人关节多改用磁编码器。","example":"工业伺服电机尾部常装 17 位以上的绝对值光电编码器，一圈可分辨 2^17 = 131072 个位置。","related":["编码器","增量式编码器","绝对值编码器","磁编码器","双编码器","伺服电机"]},{"id":"magnetic-encoder","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Rotary encoder - Wikipedia","url":"https://en.wikipedia.org/wiki/Rotary_encoder"}],"as_of":"","related_ids":["rotary-encoder","optical-encoder","absolute-encoder","dual-encoder","field-oriented-control","hall-effect-sensor"],"name":"磁编码器","alt":"Magnetic Encoder","abbr":"","aliases":["磁编","磁性编码器"],"one_liner":"用磁铁加霍尔或磁阻芯片测量电机轴转角的角度传感器。","explanation":"磁编码器是编码器（测转角的传感器）的一种：在电机轴端装一块径向充磁的小磁铁，正对它放一颗霍尔或磁阻芯片，芯片读出磁场方向就得到转角。它体积小、成本低、不怕灰尘和油污，所以在机器人关节模组里非常普遍，常用来给磁场定向控制（FOC，一种电机控制方法）提供转子角度。与光电编码器相比，它的精度和分辨率通常低一些，也容易受外部磁场和装配偏心影响，需要标定。高端关节常在电机端和输出端各放一个编码器，组成双编码器方案。","example":"许多开源关节驱动板在电机轴端贴一块磁铁，板上正对着焊一颗 ams 的 AS5047P 磁编芯片读取转子角度。","related":["编码器","光电编码器","绝对值编码器","双编码器","磁场定向控制","霍尔传感器"]},{"id":"hall-effect-sensor","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Hall effect sensor - Wikipedia","url":"https://en.wikipedia.org/wiki/Hall_effect_sensor"}],"as_of":"","related_ids":["brushless-dc-motor","magnetic-encoder","rotary-encoder","field-oriented-control","servo-drive"],"name":"霍尔传感器","alt":"Hall-effect Sensor","abbr":"","aliases":["霍尔元件","霍尔开关"],"one_liner":"利用霍尔效应把磁场变化转成电信号的传感器。","explanation":"霍尔传感器基于霍尔效应：电流流过半导体片时，垂直方向的磁场会让片子两侧出现电压，磁场越强电压越大。它便宜、无接触、体积小，是电机里最常见的位置传感器之一。在无刷电机里，通常装三个霍尔元件检测转子磁极大致位置，驱动器据此决定给哪相绕组通电（换相）；把霍尔芯片对准一块径向磁铁，就构成了磁编码器，用来测关节角度。霍尔原理也用于电流检测和接近开关。它的分辨率和抗干扰能力不如光电编码器，所以机器人关节里常把它当作换相或粗定位信号，再配更精的编码器。","example":"航模和平衡车常用的有感无刷电机，电机尾部引出的那组细线就是三个霍尔传感器的信号线。","related":["无刷直流电机","磁编码器","编码器","磁场定向控制","电机驱动器"]},{"id":"inductive-encoder","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Zettlex inductive encoders - Celera Motion","url":"https://www.celeramotion.com/zettlex/"},{"title":"Resolver (electrical) - Wikipedia","url":"https://en.wikipedia.org/wiki/Resolver_(electrical)"}],"as_of":"","related_ids":["rotary-encoder","magnetic-encoder","optical-encoder","resolver","hollow-shaft-cable-routing"],"name":"电感式编码器","alt":"Inductive Encoder","abbr":"","aliases":["感应式编码器"],"one_liner":"用线圈和电磁感应测量角度或位移的编码器。","explanation":"电感式编码器通常由印在电路板上的发射线圈、接收线圈和一个随轴转动的金属靶盘组成。发射线圈产生交变磁场，靶盘转到不同位置会改变接收线圈感应到的信号，由此解算出角度。它和旋转变压器原理相近，但做成了扁平的电路板形态。相比光电编码器，它不怕油污、灰尘和凝露；相比依赖磁铁的磁编码器，它对外部磁场干扰更不敏感，且容易做成大孔径的环形，适合中空关节。代价是信号处理复杂一些，精度和成本介于磁编码器与高端光电编码器之间，具体看产品。","example":"中空关节模组里套在输出轴外的一圈薄环形编码器，可能就是电感式方案。","related":["编码器","磁编码器","光电编码器","旋转变压器（旋变）","中空走线"]},{"id":"resolver","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Resolver (electrical) - Wikipedia","url":"https://en.wikipedia.org/wiki/Resolver_(electrical)"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"旋转变压器（旋变）","alt":"Resolver","abbr":"","aliases":["旋变"],"one_liner":"像小变压器一样测电机转角的电磁传感器，耐高温抗振","explanation":"旋转变压器是一种测转角的电磁传感器：定子上的励磁绕组通交流电，转子转动时，两组输出绕组感应出分别与转角正弦、余弦成比例的信号，再由专用解码芯片（RDC）换算成角度。它没有光学元件，转子上也没有电子器件，耐高温、振动、油污和冲击，长期用于电动汽车驱动电机、航空航天和工业伺服。和光电、磁编码器比，旋变更皮实，但精度和分辨率通常不如高端光电编码器，还需要额外的解码电路。机器人关节里更常见的是磁编码器，旋变多见于对可靠性要求高的大功率场合。","example":"电动汽车驱动电机普遍用旋变给磁场定向控制提供转子角度。","related":["编码器(Rotary Encoder)","磁编码器(Magnetic Encoder)","光电编码器(Optical Encoder)","永磁同步电机(Permanent Magnet Synchronous Motor)","磁场定向控制(Field-Oriented Control)"]},{"id":"dual-encoder","category":"hardware","sec":3,"tier":2,"sources":[{"title":"Rotary encoder - Wikipedia","url":"https://en.wikipedia.org/wiki/Rotary_encoder"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"双编码器","alt":"Dual Encoder","abbr":"","aliases":["双编"],"one_liner":"关节在电机端和输出端各装一个编码器，同时测电机转角和关节实际转角。","explanation":"双编码器是关节模组的一种配置：一个编码器（测转角的传感器）装在电机轴上，测电机转了多少；另一个装在减速器输出端，直接测关节实际转到哪。只有电机端编码器时，关节角度要靠「电机角度 ÷ 减速比」推算，减速器的背隙、柔轮弹性变形都会带来误差；输出端再加一个，就能直接读到真实关节位置，上电也能立刻知道绝对位置，不用回零。两个读数的差还能用来估算传动变形和负载力矩。它提高了定位精度和安全性，代价是成本、体积和线束增加。高端协作臂和不少人形机器人关节模组采用双编码器。","example":"谐波减速关节在电机端用高分辨率增量编码器做速度环，在输出端用绝对值编码器读关节角。","related":["编码器(Rotary Encoder)","绝对值编码器(Absolute Encoder)","关节模组(Joint Actuator Module)","背隙(Backlash)","谐波减速器(Strain Wave Gear (Harmonic Drive))","回零 / 零位标定(Homing / Joint Zero-Offset Calibration)"]},{"id":"joint-zero-calibration","category":"hardware","sec":3,"tier":2,"sources":[{"title":"Rotary encoder - Wikipedia","url":"https://en.wikipedia.org/wiki/Rotary_encoder"}],"as_of":"","related_ids":["rotary-encoder","absolute-encoder","incremental-encoder","kinematic-calibration","forward-kinematics","so-100-so-101-arm"],"name":"关节零位标定（回零）","alt":"Joint Zero Calibration / Homing","abbr":"","aliases":["零位标定","回零","零点标定"],"one_liner":"告诉机器人每个关节的「零度」在哪儿。","explanation":"关节零位标定是确定每个关节编码器读数与真实关节角度对应关系的过程：把关节摆到一个已知的参考姿态（如机械限位、标定工装或指定的零位姿势），记下此时编码器的读数作为偏置，之后所有角度都以它为零点换算。增量式编码器断电会丢失位置，开机要先「回零」；绝对值编码器能记住位置，但装配、换电机或更换减速器后仍要重新标定。零位偏了，正运动学算出的末端位置就会偏，训练好的策略放到另一台机器上也会失灵，因此换硬件后常先做这一步。","example":"LeRobot 的 SO-101 机械臂首次使用前要运行 calibrate 命令，把每个关节摆到中位并转过全行程来记录零位和范围。","related":["编码器","绝对值编码器","增量式编码器","运动学标定","正运动学","SO-100 / SO-101 机械臂"]},{"id":"controller-area-network","category":"hardware","sec":3,"tier":2,"sources":[{"title":"Wikipedia: CAN bus","url":"https://en.wikipedia.org/wiki/CAN_bus"},{"title":"Wikipedia: CAN FD","url":"https://en.wikipedia.org/wiki/CAN_FD"}],"as_of":"","related_ids":["ethercat","rs-485","socketcan","canopen-cia-402-drive-profile","servo-drive","mit-mode"],"name":"CAN 总线","alt":"Controller Area Network / CAN with Flexible Data-Rate","abbr":"CAN","aliases":["CAN FD","CAN FD 总线"],"one_liner":"两根线串起多个电机和传感器的现场总线，机器人关节通信常用","explanation":"CAN 总线是博世在 1980 年代为汽车设计的串行通信总线，用一对差分线把多个节点串起来，抗干扰强、布线简单，每帧自带优先级仲裁和错误检测。经典 CAN 最高 1 Mbit/s、每帧最多 8 字节数据；CAN FD 是后续升级版，数据段可以更快、每帧最多 64 字节。在机器人里，大量关节电机、灵巧手和电池管理系统都走 CAN / CAN FD，上位机通过 USB-CAN 适配器或 Linux 的 SocketCAN 收发指令。它的带宽有限，关节数多、控制频率高时常分成几路总线，或改用 EtherCAT。","example":"达妙、小米 CyberGear 等关节电机都通过 CAN 接收 MIT 模式的位置、速度、刚度、阻尼和前馈力矩指令。","related":["EtherCAT 总线","RS-485 总线","SocketCAN","CANopen / CiA 402 驱动协议","电机驱动器","MIT 模式"]},{"id":"canopen-cia-402-drive-profile","category":"hardware","sec":3,"tier":3,"sources":[{"title":"CANopen - Wikipedia","url":"https://en.wikipedia.org/wiki/CANopen"}],"as_of":"","related_ids":["controller-area-network","ethercat","socketcan","cyclic-synchronous-position-velocity-torque-modes","servo-enable","servo-drive"],"name":"CANopen / CiA 402 驱动协议","alt":"CANopen / CiA 402 Drive Profile","abbr":"","aliases":["CiA 402","DS402","CANopen 驱动规范"],"one_liner":"基于 CAN 的工业通信协议，及其中统一伺服驱动器行为的设备规范","explanation":"CANopen 是 CiA（CAN in Automation 协会）制定的上层协议，在 CAN 总线之上规定了对象字典（设备所有参数的编号表）、PDO/SDO 两类报文和网络管理。CiA 402 是其中的「驱动与运动控制」设备规范，统一了伺服驱动器的状态机（上电、使能、故障等）、控制字与状态字，以及位置、速度、力矩、回零等运行模式，包括周期同步位置/速度/力矩（CSP/CSV/CST）。符合规范的驱动器可以用同一套主站代码控制。EtherCAT 也沿用这套规范（CoE），所以机器人关节驱动无论走 CAN 还是 EtherCAT 都常见到它。","example":"向驱动器依次写控制字 0x06、0x07、0x0F，让它从就绪、上电走到「运行使能」状态。","related":["CAN 总线","EtherCAT 总线","SocketCAN","周期同步位置 / 速度 / 力矩模式（CSP / CSV / CST）","伺服使能（上使能 / 下使能）","电机驱动器"]},{"id":"ethercat","category":"hardware","sec":3,"tier":2,"sources":[{"title":"EtherCAT - Wikipedia","url":"https://en.wikipedia.org/wiki/EtherCAT"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"EtherCAT 总线","alt":"EtherCAT (Ethernet for Control Automation Technology)","abbr":"EtherCAT","aliases":[],"one_liner":"倍福提出的基于以太网的实时工业总线，常用来连接机器人各关节驱动器。","explanation":"EtherCAT 是德国倍福（Beckhoff）公司提出的工业以太网现场总线，现由 EtherCAT 技术协会维护，并纳入 IEC 61158 国际标准。它的特点是「飞读飞写」：主站发出一帧数据，依次流过每个从站，每个从站在帧经过时就读走发给自己的指令、写入自己的状态，不用每个设备单独收发，因此通信周期可以做到很短、时钟同步抖动很小。机器人里，主控作为主站，各关节驱动器、力传感器作为从站串成一条线，以 1 kHz 甚至更高频率同步收发位置、力矩指令。和 CAN 总线比，它带宽高得多、适合关节多的人形机器人，但需要专门的主站软件和更贵的从站芯片。","example":"开源主站 SOEM 或 IgH 跑在打了实时补丁的 Linux 上，以 1 kHz 周期控制整台人形机器人的关节驱动器。","related":["EtherCAT 主站(EtherCAT Master (SOEM / IgH))","CAN 总线(Controller Area Network / CAN with Flexible Data-Rate)","电机驱动器(Servo Drive / Motor Driver)","实时控制(Real-Time Control)","周期同步位置 / 速度 / 力矩模式（CSP / CSV / CST）(Cyclic Synchronous Position / Velocity / Torque Modes (CiA 402))"]},{"id":"rs-485","category":"hardware","sec":3,"tier":3,"sources":[{"title":"RS-485 - Wikipedia","url":"https://en.wikipedia.org/wiki/RS-485"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"RS-485 总线","alt":"RS-485","abbr":"","aliases":["485 总线","EIA-485","TIA-485"],"one_liner":"用差分双绞线的串行通信标准，抗干扰、能拉长线，常连电机舵机","explanation":"RS-485（正式名 TIA/EIA-485）是一种串行通信的物理层标准，用一对双绞线传差分信号（看两根线的电压差），抗干扰强，传输距离可达上千米，一条总线可挂多个设备，通常半双工（同一时刻只能一方发送）。它只规定电气特性，上层协议常见 Modbus RTU 或厂商私有协议。机器人里，很多舵机、关节电机、电动夹爪和传感器都用 RS-485。它的问题是速率比 EtherCAT、CAN FD 低，且靠主机轮询各设备，关节多、控制频率高时就不够用。","example":"电动夹爪常通过 RS-485 跑 Modbus RTU 协议，上位机经 USB 转 485 模块发指令控制开合。","related":["CAN 总线(Controller Area Network / CAN with Flexible Data-Rate)","EtherCAT 总线(EtherCAT (Ethernet for Control Automation Technology))","舵机(Servo (Smart Serial Bus Servo))","电机驱动器(Servo Drive / Motor Driver)","宇树 GO-M8010-6 关节电机(Unitree GO-M8010-6 Motor)"]},{"id":"integrated-drive-and-control","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Servo drive - Wikipedia","url":"https://en.wikipedia.org/wiki/Servo_drive"},{"title":"Motor controller - Wikipedia","url":"https://en.wikipedia.org/wiki/Motor_controller"}],"as_of":"","related_ids":["servo-drive","joint-actuator-module","robot-controller","ethercat","compute-control-integration"],"name":"驱控一体","alt":"Integrated Drive and Control","abbr":"","aliases":["驱控一体化"],"one_liner":"把电机驱动器和运动控制器合并成一个硬件单元。","explanation":"传统工业机器人里，运动控制器（算轨迹、做规划）和各轴伺服驱动器（给电机通电流）是分开的几个盒子，用总线连起来。驱控一体就是把两者合到一块板子或一个柜子里：控制算法和电流环在同一处理器或同一模块上跑，省掉中间通信。好处是体积小、布线少、成本低，控制延迟也更短，便于做高带宽的力控。在关节层面，这个词也常指把驱动器直接集成进关节模组，每个关节自带「驱动 + 控制」，上层只需通过 EtherCAT 或 CAN 发指令。人形机器人和协作臂的一体化关节基本都属于这一思路。","example":"","related":["电机驱动器","关节模组","机器人控制器","EtherCAT 总线","算控一体"]},{"id":"holding-brake","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Electromagnetic brake - Wikipedia","url":"https://en.wikipedia.org/wiki/Electromagnetic_brake"}],"as_of":"","related_ids":["joint-actuator-module","emergency-stop","safe-torque-off","servo-enable","safety-gantry"],"name":"抱闸","alt":"Holding Brake","abbr":"","aliases":["制动器","电磁抱闸","刹车"],"one_liner":"装在电机或关节上、断电时自动锁住转轴的制动器。","explanation":"抱闸一般是电磁式的：通电时电磁铁吸开摩擦片，电机可以转；断电时弹簧把摩擦片压紧，转轴被锁住，所以叫「失电制动」。它的作用是在停电、急停或下使能时把关节保持在原位，防止机械臂在重力下掉落砸到人或物；它主要用来「保持」，一般不负责高速运动中的刹车。工业机械臂和协作机器人的关节模组大多带抱闸。代价是增加重量、体积和成本，所以部分四足、人形机器人的关节不装抱闸，断电后会瘫软，调试时常配吊架。选关节模组时，是否带抱闸、抱闸能扛多大扭矩都是常看的参数。","example":"协作机械臂按下急停后手臂停在半空不下坠，靠的就是各关节里的抱闸。","related":["关节模组","急停","安全扭矩关断","伺服使能（上使能 / 下使能）","吊装架（安全吊架）"]},{"id":"safe-torque-off","category":"hardware","sec":3,"tier":3,"sources":[{"title":"IEC 61800-5-2 (IEC Webstore)","url":"https://webstore.iec.ch/en/publication/30617"},{"title":"IEC 61508 - Wikipedia","url":"https://en.wikipedia.org/wiki/IEC_61508"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"安全扭矩关断","alt":"Safe Torque Off","abbr":"STO","aliases":["STO","安全转矩关断"],"one_liner":"驱动器用硬件切断电机供能、让它不再出力的安全功能","explanation":"STO 是 IEC 61800-5-2 定义的驱动器安全功能：触发后，驱动器用硬件电路封锁逆变器的开关信号，电机不再产生扭矩，靠惯性和摩擦自行停下（对应 IEC 60204-1 的 0 类停止）。它一般用双通道硬件输入实现，不依赖软件，可以达到较高的功能安全等级（SIL / PL）。要注意，STO 不等于断主电，也不会主动刹车，更托不住重力负载，竖直方向的关节要配合抱闸；需要先减速再关断时用 SS1 功能。机器人的急停按钮通常就接到驱动器的 STO 端子上。","example":"协作机械臂急停时，控制器触发各关节驱动器的 STO，同时抱闸吸合，防止手臂在重力下掉落。","related":["急停(Emergency Stop)","功能安全(Functional Safety)","抱闸(Holding Brake)","电机驱动器(Servo Drive / Motor Driver)","保护性停止(Protective Stop)"]},{"id":"regenerative-braking-and-brake-resistor","category":"hardware","sec":3,"tier":3,"sources":[{"title":"Regenerative braking - Wikipedia","url":"https://en.wikipedia.org/wiki/Regenerative_braking"},{"title":"Braking chopper - Wikipedia","url":"https://en.wikipedia.org/wiki/Braking_chopper"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"再生制动与泄放电阻（泄放模块）","alt":"Regenerative Braking & Brake (Shunt) Resistor","abbr":"","aliases":["再生制动","泄放电阻","制动电阻","泄放模块"],"one_liner":"电机减速时变成发电机回灌能量，泄放电阻把多余电能烧成热","explanation":"电机在减速、被外力反拖（比如机器人落地、下蹲、急停）时会变成发电机，把动能送回驱动器的直流母线，这叫再生制动。母线电压因此升高，如果电池或电源吸收不了，就要靠泄放电路（一个开关管加一个功率电阻，也叫制动斩波器）在电压超过阈值时把多余电能转成热量，否则驱动器会过压报警甚至损坏。电池供电的机器人能回收一部分能量，但电池满电或用不能反灌的实验室直流电源供电时，必须加泄放模块。它和电机驱动器、电源设计、急停策略直接相关。","example":"腿足机器人接在实验室直流稳压电源上做跳跃测试，落地时关节电机反拖回灌，母线电压冲高，驱动器报过压；在母线上并一个泄放模块后问题消失。","related":["电机驱动器(Servo Drive / Motor Driver)","无刷直流电机(Brushless DC Motor)","电池管理系统(Battery Management System)","急停(Emergency Stop)","抱闸(Holding Brake)"]},{"id":"odrive","category":"hardware","sec":3,"tier":3,"sources":[{"title":"ODrive Robotics","url":"https://odriverobotics.com/"},{"title":"odriverobotics/ODrive - GitHub","url":"https://github.com/odriverobotics/ODrive"}],"as_of":"2026-09","related_ids":["servo-drive","field-oriented-control","mjbots-moteus","controller-area-network","brushless-dc-motor","rotary-encoder"],"name":"ODrive 驱动器","alt":"ODrive","abbr":"","aliases":["ODrive Robotics"],"one_liner":"ODrive Robotics 出的无刷电机驱动器，机器人爱好者和实验室常用。","explanation":"ODrive 是 ODrive Robotics 公司的无刷电机控制器系列，用磁场定向控制（FOC）驱动电机，提供位置、速度、力矩控制。早期的 ODrive v3.x 硬件和固件以 MIT 许可开源，在机器人爱好者和高校里流行很广，现已停止开发。现在的主力是 ODrive Pro（14–58V，连续 3000W）和 ODrive S1（12–50V，连续 1600W）等，支持 CAN、UART、步进/方向接口，并提供 Python、Arduino 和 ROS 2 库，但新产品固件不再公开。它常被用来驱动轮毂电机底盘、四足和人形机器人的关节原型。","example":"很多开源四足和轮式底盘项目用一块 ODrive 同时驱动两台无刷电机，通过 CAN 总线接到上位机。","related":["电机驱动器","磁场定向控制","moteus 驱动器","CAN 总线","无刷直流电机","编码器"]},{"id":"mjbots-moteus","category":"hardware","sec":3,"tier":3,"sources":[{"title":"moteus r4.11 - mjbots","url":"https://mjbots.com/products/moteus-r4-11"}],"as_of":"2026-09","related_ids":["servo-drive","field-oriented-control","controller-area-network","odrive","quasi-direct-drive","magnetic-encoder"],"name":"moteus 驱动器","alt":"mjbots moteus","abbr":"","aliases":["moteus"],"one_liner":"mjbots 出的开源小型无刷电机驱动板，能把航模电机变成伺服关节。","explanation":"moteus 是美国 mjbots 公司（Josh Pieper 主导）做的无刷电机控制器，巴掌大小，贴在电机背后就能让普通航模无刷电机变成可控位置、速度、力矩的伺服执行器。当前 r4.11 版本支持 10–44V 输入、峰值 100A 相电流，板上集成绝对值磁编码器（测转子角度），通过 5Mbps 的 CAN-FD 总线（一种高速现场总线）级联通信，固件以 Apache 2.0 许可开源。它内部跑磁场定向控制（FOC，一种让无刷电机平稳输出力矩的算法），适合自制四足、小型人形和机械臂关节，是低成本准直驱执行器的常见选择。","example":"mjbots 自家的 quad A1 四足机器人，每个关节都由一块 moteus 驱动外转子无刷电机。","related":["电机驱动器","磁场定向控制","CAN 总线","ODrive 驱动器","准直驱","磁编码器"]},{"id":"backdrivability","category":"hardware","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Backdrivability","url":"https://en.wikipedia.org/wiki/Backdrivability"}],"as_of":"","related_ids":["quasi-direct-drive","reflected-inertia","gear-ratio","proprioceptive-actuator","kinesthetic-teaching","compliance"],"name":"反驱性","alt":"Backdrivability","abbr":"","aliases":["反向驱动性","可反驱性"],"one_liner":"从输出端用外力能不能轻松推动关节、带着电机反转","explanation":"反驱性指从关节输出端施加外力时，能不能轻松地反过来推动传动链和电机。反驱性好的关节，被人推或撞到时会顺势让开，电机电流也能反映外力大小，便于做力控、碰撞检测和拖动示教；反驱性差的关节（比如大减速比、蜗轮蜗杆或丝杠自锁结构）外力推不动，更「硬」，也更容易在冲击下损坏。反驱性主要由减速比、传动效率和摩擦决定：减速比越大，折算到输出端的反射惯量和摩擦越大，越难反驱。四足和人形机器人常用的准直驱关节，就是用较小的减速比换取好的反驱性。","example":"准直驱关节的腿落地受冲击时能被地面推回一点，起到缓冲作用；高减速比的关节则会把冲击直接传给齿轮。","related":["准直驱","反射惯量","减速比","本体感受式执行器","拖动示教","柔顺性"]},{"id":"reflected-inertia","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Proprioceptive Actuator Design in the MIT Cheetah (Wensing et al., IEEE T-RO 2017)","url":"https://doi.org/10.1109/TRO.2016.2640183"}],"as_of":"","related_ids":["proprioceptive-actuator","backdrivability","gear-ratio","moment-of-inertia","quasi-direct-drive","strain-wave-gear"],"name":"反射惯量","alt":"Reflected Inertia","abbr":"","aliases":["折算惯量","等效惯量"],"one_liner":"电机转子惯量经减速器放大后，在关节输出端表现出的等效惯量","explanation":"反射惯量是把电机转子（以及减速器输入侧零件）的转动惯量折算到关节输出端后的等效值，约等于转子惯量乘以减速比的平方。减速比越大，关节在外界看来就「越沉」：受到冲击时转子必须被一起加速，冲击力更大；外力也更难把关节反推回去，反驱性变差，力控带宽下降。这正是 MIT Cheetah 等腿足机器人选用低减速比「本体感受式执行器」的主要原因之一，落地时腿要能顺势让开。关节设计常在扭矩密度（要大减速比）和低反射惯量之间取舍。","example":"同一电机配 6:1 减速器，反射惯量约为转子惯量的 36 倍；换成 100:1 的谐波减速器，就变成约 10000 倍。","related":["本体感受式执行器","反驱性","减速比","转动惯量","准直驱","谐波减速器"]},{"id":"direct-drive","category":"hardware","sec":4,"tier":2,"sources":[{"title":"Direct drive mechanism - Wikipedia","url":"https://en.wikipedia.org/wiki/Direct_drive_mechanism"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"直驱","alt":"Direct Drive","abbr":"DD","aliases":["直接驱动","DD 电机"],"one_liner":"电机直接带动关节或负载，中间不经过减速器等传动机构。","explanation":"直驱指电机输出轴直接连到负载上，不经过齿轮、减速器、皮带等传动环节，减速比为 1。好处是没有背隙（齿轮间的空程）、摩擦小、反驱性好（外力能轻松推动关节），力矩可以从电流直接估出来，控制带宽高、动作柔顺；坏处是电机必须自己产生全部力矩，所以要做得又大又重，扭矩密度吃紧、发热也大。机器人里完全直驱多见于转台、部分机械臂关节和一些灵巧手设计；腿足机器人更常用折中的准直驱（小减速比的行星减速器），兼顾力矩和柔顺。","example":"全直驱灵巧手把电机直接放在每个手指关节处，不用腱绳或连杆传动。","related":["准直驱(Quasi-Direct Drive)","反驱性(Backdrivability)","背隙(Backlash)","减速比(Gear Ratio)","全直驱灵巧手(Fully Direct-Drive Dexterous Hand)","无框力矩电机(Frameless Torque Motor)"]},{"id":"quasi-direct-drive","category":"hardware","sec":4,"tier":1,"sources":[{"title":"Proprioceptive Actuator Design in the MIT Cheetah (IEEE T-RO 2017)","url":"https://ieeexplore.ieee.org/document/7827048"},{"title":"Mini Cheetah: A Platform for Pushing the Limits of Dynamic Quadruped Control (ICRA 2019)","url":"https://ieeexplore.ieee.org/document/8793865"},{"title":"Unitree GO-M8010-6 关节电机参数（宇树官网）","url":"https://www.unitree.com/mobile/go1/motor/"}],"as_of":"","related_ids":["direct-drive","proprioceptive-actuator","backdrivability","planetary-gearbox","joint-actuator-module","mit-mini-cheetah-actuator"],"name":"准直驱","alt":"Quasi-Direct Drive","abbr":"QDD","aliases":["准直驱电机","QDD 电机","低减速比执行器","准直接驱动"],"one_liner":"大扭矩电机配低减速比齿轮的关节方案，兼顾力量和柔顺。","explanation":"准直驱是一种关节设计思路：用扭矩密度高的大直径无刷电机，只配一级低减速比（通常低于 10:1）的减速器，介于电机直接驱动（直驱）和高减速比（如谐波）之间。低减速比带来好的反驱性和低反射惯量（电机转子折算到关节端的惯量，随减速比的平方增大），外力能反推关节，落地冲击不易打坏齿轮；电机电流和输出力矩近似成正比，不装力矩传感器也能估算和控制关节力。MIT 的 Cheetah 系列把这种「本体感受式执行器」做法推广开，如今宇树等四足、人形机器人的腿部关节大多采用它，也很适合强化学习训练的运控策略。","example":"MIT Mini Cheetah 的 12 个关节用同一款模组：无刷电机加 6:1 单级行星减速器；宇树 Go1 用的 GO-M8010-6 关节电机也是类似结构，减速比 6.33:1。","related":["直驱","本体感受式执行器","反驱性","行星减速器","关节模组","MIT Cheetah 执行器"]},{"id":"proprioceptive-actuator","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Proprioceptive Actuator Design in the MIT Cheetah (Wensing et al., IEEE T-RO 2017)","url":"https://doi.org/10.1109/TRO.2016.2640183"}],"as_of":"","related_ids":["quasi-direct-drive","backdrivability","reflected-inertia","mit-mini-cheetah-actuator","torque-control","sensorless-force-estimation"],"name":"本体感受式执行器","alt":"Proprioceptive Actuator","abbr":"","aliases":["本体感知执行器","本体感受驱动器"],"one_liner":"不装力传感器、靠电机电流就能感知和控制关节力的执行器","explanation":"这是 MIT 仿生机器人实验室 Sangbae Kim 团队为 MIT Cheetah 提出并系统阐述的执行器设计思路（Wensing 等，IEEE T-RO 2017）。做法是用大直径、大扭矩的电机配低减速比的单级行星减速器，让传动摩擦小、反射惯量（电机转子折算到关节端的惯量）小、可以被外力反推。这样电机电流就能较准确地反映关节受力，不用额外的力传感器也能做高带宽的力控，还能在落地冲击时柔顺地吸收能量。今天四足机器人和不少人形机器人的「准直驱」关节模组都来自这一思路。","example":"MIT Mini Cheetah 的关节用约 6:1 的单级行星减速器，靠电流估计足端受力完成后空翻等动作。","related":["准直驱","反驱性","反射惯量","MIT Cheetah 执行器","力矩控制","无传感器力估计"]},{"id":"mit-mini-cheetah-actuator","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Mini Cheetah: A Platform for Pushing the Limits of Dynamic Quadruped Control (ICRA 2019)","url":"https://doi.org/10.1109/ICRA.2019.8793865"},{"title":"bgkatz/motorcontrol - GitHub","url":"https://github.com/bgkatz/motorcontrol"}],"as_of":"","related_ids":["mit-mini-cheetah","quasi-direct-drive","proprioceptive-actuator","mit-mode","planetary-gearbox","backdrivability"],"name":"MIT Cheetah 执行器","alt":"MIT Mini Cheetah Actuator","abbr":"","aliases":["Mini Cheetah 电机","Mini Cheetah 关节模组"],"one_liner":"MIT 为 Mini Cheetah 四足设计的准直驱关节模组，后被业界广泛仿制。","explanation":"MIT Cheetah 执行器是 MIT 仿生机器人实验室（Sangbae Kim 组）的 Ben Katz 为 Mini Cheetah 四足机器人设计的关节模组：大直径外转子无刷电机，配一级 6:1 行星减速器，再集成驱动板和磁编码器，通过 CAN 总线通信。减速比小意味着反射惯量小、能被外力反推，关节可以直接用电流估算力矩，不需要额外的力矩传感器，这就是准直驱和本体感受式执行器的思路。由于设计资料和固件公开，国内外大量低成本关节电机沿用了它的结构和「MIT 模式」控制指令。","example":"达妙、小米 CyberGear、CubeMars AK 系列等关节电机都支持 MIT 模式，一帧指令同时给目标位置、速度、Kp、Kd 和前馈力矩。","related":["MIT Mini Cheetah","准直驱","本体感受式执行器","MIT 模式","行星减速器","反驱性"]},{"id":"cubemars-ak-series-actuator","category":"hardware","sec":4,"tier":3,"sources":[{"title":"AK80-9 KV100 Robotic Actuator（CubeMars 官网）","url":"https://www.cubemars.com/goods-982-AK80-9.html"},{"title":"AK80-9 V3.0 Robotic Actuator（CubeMars 官网）","url":"https://www.cubemars.com/product/ak80-9-v3-0-robotic-actuator.html"}],"as_of":"2026-09","related_ids":["quasi-direct-drive","mit-mode","mit-mini-cheetah-actuator","joint-actuator-module","damiao-dm-j4310-2ec-joint-motor","unitree-go-m8010-6-motor"],"name":"CubeMars AK 系列关节电机","alt":"CubeMars AK Series Actuator","abbr":"","aliases":["AK80-9","T-Motor AK 电机","AK 系列动力模组"],"one_liner":"CubeMars 推出的集成行星减速器和驱动器的一体化关节模组","explanation":"AK 系列是 CubeMars（电机厂商 T-Motor 旗下的机器人动力品牌）的一体化关节模组，把无刷电机、行星减速器、编码器和驱动器装在一个壳体里，型号如 AK80-9 中的 9 指 9:1 减速比。以 AK80-9 为例，额定扭矩 9 N·m，峰值 18 N·m（V3.0 版标称 22 N·m），重约 485 g。它支持 CAN 通信和 MIT 模式（一次下发目标位置、速度、前馈力矩和刚度阻尼增益），低减速比使其反驱性较好，常用于高校四足、外骨骼和机械臂原型。","example":"在 MIT 模式下给 AK80-9 同时发送 Kp、Kd、目标位置和前馈力矩，就能实现关节阻抗控制。","related":["准直驱","MIT 模式","MIT Cheetah 执行器","关节模组","达妙 DM-J4310 关节电机","宇树 GO-M8010-6 关节电机"]},{"id":"damiao-dm-j4310-2ec-joint-motor","category":"hardware","sec":4,"tier":3,"sources":[{"title":"DM-J4310-2EC V1.1 关节电机 - 深圳市达妙科技","url":"https://www.mdmbot.com/index.php?c=show&id=84"}],"as_of":"2025","related_ids":["joint-actuator-module","damiao-technology","mit-mode","controller-area-network","dual-encoder","quasi-direct-drive"],"name":"达妙 DM-J4310 关节电机","alt":"DAMIAO DM-J4310-2EC Joint Motor","abbr":"","aliases":["DM4310","DM-J4310-2EC","达妙电机"],"one_liner":"深圳达妙科技的小型一体化关节电机，常用于桌面机械臂和人形小关节","explanation":"DM-J4310-2EC 是深圳市达妙科技推出的一款小尺寸关节模组，把无刷电机、减速器、驱动器和双编码器集成在一起，输出轴能读到单圈绝对位置，通过 CAN 总线接收指令并回传速度、位置、力矩和温度。官网 V1.1 版标称额定扭矩 3 Nm、峰值 7 Nm，后续版本有所提升。它价格低、接线简单，支持常见的 MIT 模式（同时给位置、速度、刚度、阻尼和前馈力矩），因此在学生项目、开源机械臂和人形机器人的手臂、头部等小负载关节里用得很多，是入门做真机时常见的「标准件」。","example":"自己搭一台低成本 6 轴桌面机械臂时，腕部三个关节常选 DM4310，大臂再换更大号的达妙电机。","related":["关节模组","达妙科技","MIT 模式","CAN 总线","双编码器","准直驱"]},{"id":"unitree-go-m8010-6-motor","category":"hardware","sec":4,"tier":3,"sources":[{"title":"GO-M8010-6 Motor - Unitree Shop","url":"https://shop.unitree.com/products/go1-motor"},{"title":"GO-M8010-6 Motor User Manual V1.0","url":"https://techshare.co.jp/faq/wp-content/uploads/2023/12/GO-M8010-6_Motor_Data_User_Manual_V1.0.pdf"}],"as_of":"2026-09","related_ids":["joint-actuator-module","quasi-direct-drive","unitree-robotics","torque-constant","field-oriented-control","damiao-dm-j4310-2ec-joint-motor"],"name":"宇树 GO-M8010-6 关节电机","alt":"Unitree GO-M8010-6 Motor","abbr":"","aliases":["GO-M8010-6","Go1 电机"],"one_liner":"宇树科技单独出售的一体化关节电机，最大力矩 23.7 N·m","explanation":"GO-M8010-6 是宇树科技的一款关节电机模组，把永磁同步电机、驱动板、减速器、编码器和轴承集成在一起，拿来就能当机器人关节用。据用户手册，它减速比 6.33，最大输出力矩 23.7 N·m，最高转速 30 rad/s，重约 530 g，推荐 24 V 供电；内置磁场定向控制（FOC）算法、温度传感器和绝对值编码器，力矩常数约 0.639 N·m/A。低减速比使它有较好的反驱性，适合腿足机器人做力矩控制。因为价格较低、资料公开，它常被高校和开源小型四足、人形项目选作关节。","example":"","related":["关节模组","准直驱","宇树科技","力矩常数（Kt）","磁场定向控制","达妙 DM-J4310 关节电机"]},{"id":"xiaomi-cybergear-micro-motor","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Stirring up the motor industry, Xiaomi launches ultra-high... (SMM News)","url":"https://news.metal.com/newscontent/102352716"},{"title":"Xiaomi CyberGear Micromotor Intelligent Motor (EOL) - OpenELAB","url":"https://openelab.io/products/xiaomi-cybergear-micromotor-intelligent-motor"}],"as_of":"2026-09","related_ids":["quasi-direct-drive","joint-actuator-module","mit-mode","controller-area-network","damiao-dm-j4310-2ec-joint-motor","xiaomi-cyberdog"],"name":"小米 CyberGear 微电机","alt":"Xiaomi CyberGear Micro-Motor","abbr":"","aliases":["CyberGear","小米微电机"],"one_liner":"小米 2023 年推出的低价一体化关节电机，峰值扭矩 12 N·m","explanation":"CyberGear 是小米在 2023 年 8 月推出的一体化关节电机，把无刷电机、减速器、编码器和驱动器集成在一个直径约 80 mm、重 317 g 的模组里，峰值扭矩 12 N·m、持续扭矩 4 N·m，走 CAN 总线通信，发布价 499 元，据报道源自小米 CyberDog 2 机器狗的关节技术。这类准直驱电机减速比小、可反驱，适合足式机器人和机械臂做力矩控制。它以远低于同类产品的价格进入市场，被很多学生和爱好者用来自制四足、双足机器人和桌面机械臂。据经销商页面显示已停产，同类可选达妙、宇树等关节电机。","example":"爱好者用 12 个 CyberGear 电机搭一台小型四足机器人，通过 CAN 总线发 MIT 模式指令控制各关节。","related":["准直驱","关节模组","MIT 模式","CAN 总线","达妙 DM-J4310 关节电机","小米 CyberDog"]},{"id":"series-elastic-actuator","category":"hardware","sec":4,"tier":2,"sources":[{"title":"Series elastic actuator - Wikipedia","url":"https://en.wikipedia.org/wiki/Series_elastic_actuator"}],"as_of":"","related_ids":["actuator","compliance","torque-control","quasi-direct-drive","variable-stiffness-actuator","backdrivability"],"name":"串联弹性驱动器","alt":"Series Elastic Actuator","abbr":"SEA","aliases":["串联弹性执行器","串联弹性驱动"],"one_liner":"在电机和负载之间串一个弹簧，靠测弹簧变形来算力。","explanation":"串联弹性驱动器是在电机（加减速器）和输出端之间故意串入一个弹性元件（弹簧）的执行器，由 MIT 的 Gill Pratt 和 Matthew Williamson 在 1995 年提出。测出弹簧的变形量就能算出输出力矩，从而做精确的力控；弹簧还能缓冲碰撞冲击、保护减速器，让机器人和人接触时更安全。代价是刚度降低、带宽变低，精确位置控制更难。它常用于需要柔顺的腿足、外骨骼和协作机器人。和它对照的路线是准直驱：不加弹簧，靠低减速比直接从电流估算力矩。","example":"Rethink Robotics 的 Baxter 双臂机器人关节用的就是串联弹性驱动器，碰到人会被推开而不是硬顶。","related":["执行器","柔顺性","力矩控制","准直驱","变刚度驱动器","反驱性"]},{"id":"variable-stiffness-actuator","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Variable impedance actuators: A review (Robotics and Autonomous Systems, 2013)","url":"https://doi.org/10.1016/j.robot.2013.06.009"}],"as_of":"","related_ids":["series-elastic-actuator","stiffness","compliance","impedance-control","variable-impedance-control","physical-human-robot-interaction"],"name":"变刚度驱动器","alt":"Variable Stiffness Actuator","abbr":"VSA","aliases":["可变刚度执行器","变刚度执行器"],"one_liner":"关节「软硬程度」可以在运动中机械调节的驱动器","explanation":"变刚度驱动器在电机和关节之间加入弹性元件，并用额外的机构（通常是第二个电机）实时改变这个弹簧的有效刚度，使关节位置和软硬程度可以分别控制。它是串联弹性驱动器（刚度固定）的扩展，2000 年代起由比萨大学、德国宇航中心（DLR）、意大利技术研究院等团队系统研究。好处是：刚度调低时撞到人冲击小、更安全；需要精确定位时调高刚度；弹簧还能储能再释放，用于投掷、跳跃等爆发动作。缺点是结构复杂、重量和成本高，所以目前主要用于研究平台，量产机器人更多用软件实现的阻抗控制。","example":"DLR 的 Hand Arm System 在手臂和手部关节里使用了变刚度驱动。","related":["串联弹性驱动器","刚度","柔顺性","阻抗控制","变阻抗控制","物理人机交互"]},{"id":"intrinsic-vs-extrinsic-actuation","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Shadow Dexterous Hand Series - Shadow Robot Company","url":"https://www.shadowrobot.com/dexterous-hand-series/"},{"title":"LEAP Hand","url":"https://leaphand.com/"}],"as_of":"","related_ids":["dexterous-hand","tendon-driven-actuation","hybrid-drive-dexterous-hand","reflected-inertia","linkage-transmission","timing-belt-drive"],"name":"驱动器内置 / 外置（近端布置）","alt":"Intrinsic vs. Extrinsic Actuation (Proximal Actuator Placement)","abbr":"","aliases":["内置驱动 / 外置驱动","近端布置"],"one_liner":"电机放在关节旁边，还是放到靠近躯干处再远程传动。","explanation":"这组词说的是执行器（电机）放在哪。内置（intrinsic）指电机就装在被驱动的部位里，比如灵巧手的电机塞在手掌和手指里；外置（extrinsic）指电机放在更靠近躯干的地方，比如前臂，再用腱绳、连杆或同步带把动力传到手指，这和人手的大部分肌肉长在前臂是一个道理。把重的电机往近端（靠近身体）放，叫近端布置，能减轻末端重量和转动惯量，让手臂、腿摆得更快更省力。代价是传动链变长，会带来摩擦、回差和张力管理问题。灵巧手、人形机器人的腿和手臂设计都要在这两者间权衡。","example":"Shadow 灵巧手把电机放在前臂、用腱绳拉手指（外置）；LEAP Hand 把舵机直接装在手指关节上（内置）。","related":["灵巧手","腱绳驱动","混合驱动灵巧手","反射惯量","连杆传动","同步带传动"]},{"id":"timing-belt-drive","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Belt (mechanical) - Wikipedia","url":"https://en.wikipedia.org/wiki/Belt_(mechanical)"}],"as_of":"","related_ids":["speed-reducer-gearbox","gear-ratio","linkage-transmission","tendon-driven-actuation","intrinsic-vs-extrinsic-actuation","reflected-inertia"],"name":"同步带传动","alt":"Timing Belt Drive","abbr":"","aliases":["皮带传动","齿形带传动"],"one_liner":"用带齿的皮带和齿轮啮合来传递转动，不打滑","explanation":"同步带传动是在皮带内侧做出齿，和带齿的带轮啮合，把一个轴的转动传到另一个轴。普通平皮带靠摩擦传力，会打滑；同步带靠齿啮合，转速比固定，所以叫「同步」。它重量轻、噪声小、不用润滑，还能顺便做一点减速（两个带轮大小不同）。在机器人里，它常用来把电机放到离关节远的位置，比如把电机挪到靠近身体的地方以减小腿或手臂末端的惯量，也用在直线模组和桌面机械臂上。缺点是皮带有弹性，刚度不如齿轮，长期使用会松弛，需要张紧。","example":"桌面 3D 打印机的 XY 轴普遍用 GT2 同步带带动喷头移动。","related":["减速器","减速比","连杆传动","腱绳驱动","驱动器内置 / 外置（近端布置）","反射惯量"]},{"id":"linkage-transmission","category":"hardware","sec":4,"tier":2,"sources":[{"title":"Linkage (mechanical) - Wikipedia","url":"https://en.wikipedia.org/wiki/Linkage_(mechanical)"}],"as_of":"","related_ids":["four-bar-linkage","tendon-driven-actuation","parallel-ankle-mechanism","dexterous-hand","linear-actuator","parallel-mechanism"],"name":"连杆传动","alt":"Linkage Transmission","abbr":"","aliases":["连杆驱动"],"one_liner":"用铰接的刚性杆件把动力传到关节。","explanation":"连杆传动用若干刚性杆件通过铰链连在一起（典型如四连杆机构），把电机或电缸的运动传到远处的关节，并按杆长设计出想要的运动关系。它的好处是刚度高、能承受较大力，还能把重的电机放在靠近躯干处以减轻肢体末端质量。缺点是运动范围受杆件几何限制，结构占空间。在人形机器人上常见于并联踝关节和膝关节；在灵巧手上，连杆驱动和腱绳驱动是两大主流，连杆方案更结实、易维护，腱绳方案更轻巧、灵活。","example":"很多人形机器人的踝关节把两个电机放在小腿上，通过两根连杆推拉脚板实现俯仰和侧摆。","related":["四连杆机构","腱绳驱动","并联踝关节","灵巧手","线性执行器（直线执行器 / 电缸）","并联机构"]},{"id":"tendon-driven-actuation","category":"hardware","sec":4,"tier":2,"sources":[{"title":"Shadow Dexterous Hand - Shadow Robot Company","url":"https://www.shadowrobot.com/dexterous-hand-series/"}],"as_of":"","related_ids":["dexterous-hand","shadow-dexterous-hand","bowden-cable","tendon-routing-configurations","tendon-material","linkage-transmission"],"name":"腱绳驱动","alt":"Tendon-Driven Actuation","abbr":"","aliases":["绳驱","肌腱驱动","腱驱动"],"one_liner":"电机放在远处，用绳子像肌腱一样拉动关节转动。","explanation":"腱绳驱动模仿人手的肌腱：电机装在前臂或手掌里，用高强度细绳（常用超高分子量聚乙烯纤维）穿过滑轮或护套拉动手指关节。好处是手指本身很轻很细，可以做出接近人手的尺寸和较多自由度；代价是绳子会伸长、有摩擦和预紧力变化，建模和控制都更难，需要定期标定和维护。由于绳子只能拉不能推，一个关节往往要两根绳或绳加弹簧回位，对应 N、N+1、2N 等布线方式。Shadow 灵巧手是经典的腱绳驱动灵巧手，特斯拉 Optimus 灵巧手据报道也采用了类似方案。","example":"Shadow 灵巧手把电机放在前臂里，通过腱绳拉动 20 多个手指关节，外形和尺寸接近人手。","related":["灵巧手","Shadow 灵巧手","鲍登线","腱绳驱动配置（N 型 / N+1 型 / 2N 型）","腱绳材料（超高分子量聚乙烯纤维 UHMWPE）","连杆传动"]},{"id":"bowden-cable","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Bowden cable - Wikipedia","url":"https://en.wikipedia.org/wiki/Bowden_cable"}],"as_of":"","related_ids":["tendon-driven-actuation","exoskeleton","intrinsic-vs-extrinsic-actuation","dexterous-hand","friction-compensation","tendon-material"],"name":"鲍登线","alt":"Bowden Cable","abbr":"","aliases":["套索","Bowden 线","鲍登索"],"one_liner":"套管里穿一根钢丝、能沿弯曲路径传递拉力的软线，如自行车刹车线","explanation":"鲍登线由内芯钢丝（或绳）和包在外面、不可压缩的套管组成，套管两端固定，拉动一端的内芯，另一端随之移动，最常见的就是自行车刹车线。机器人里用它把电机放在躯干、背包或手臂近端，再把拉力沿弯曲路径送到手指、手腕或外骨骼关节，让远端更轻、惯量更小。缺点是内芯与套管间摩擦大且随弯曲角度变化，还有迟滞和弹性伸长，精确力控需要做补偿。它是腱绳驱动的一种常见实现方式。","example":"哈佛 Wyss 研究所的软体外骨骼把电机放在腰部，经鲍登线拉动踝关节辅助行走。","related":["腱绳驱动","外骨骼","驱动器内置 / 外置（近端布置）","灵巧手","摩擦补偿","腱绳材料（超高分子量聚乙烯纤维 UHMWPE）"]},{"id":"hydraulic-actuation","category":"hardware","sec":4,"tier":2,"sources":[{"title":"Hydraulic machinery - Wikipedia","url":"https://en.wikipedia.org/wiki/Hydraulic_machinery"},{"title":"Atlas (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Atlas_(robot)"}],"as_of":"2024-04","related_ids":["boston-dynamics-atlas","electro-hydrostatic-actuator","pneumatic-actuation","actuator","power-density","boston-dynamics-bigdog"],"name":"液压驱动","alt":"Hydraulic Actuation","abbr":"","aliases":["液压执行器"],"one_liner":"用加压液体推动油缸或马达来驱动关节。","explanation":"液压驱动用泵把液压油加压，经阀门控制流向液压缸或液压马达，把液体压力变成关节的推力或力矩。它的优点是功率密度和力量大、抗冲击，缺点是需要泵、油管和阀，系统笨重、噪声大、会漏油，维护成本高，控制也更复杂。早期高动态足式机器人多用液压，代表是波士顿动力的 BigDog 和液压版 Atlas。随着电机和减速器性能提升，人形机器人已普遍转向电驱，波士顿动力也在 2024 年让液压版 Atlas 退役、换成电动版。液压在重载工程机械和部分大型腿足机器人上仍有应用。","example":"波士顿动力液压版 Atlas 用液压驱动完成跑酷、后空翻，2024 年由电动版 Atlas 接替。","related":["液压版 Atlas","电动静液作动器","气动驱动","执行器","功率密度","波士顿动力 BigDog（大狗）"]},{"id":"electro-hydrostatic-actuator","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Electro-hydraulic actuator - Wikipedia","url":"https://en.wikipedia.org/wiki/Electro-hydraulic_actuator"}],"as_of":"","related_ids":["hydraulic-actuation","actuator","linear-actuator","boston-dynamics-atlas","torque-density"],"name":"电动静液作动器","alt":"Electro-Hydrostatic Actuator","abbr":"EHA","aliases":["电静液作动器","电液作动器"],"one_liner":"电机带小油泵、油路自成闭环的一体化液压执行器，不需要外接液压站","explanation":"电动静液作动器把电机、双向小油泵、油缸和油箱封装成一个独立模块：电机正转或反转，油泵就把油推向油缸一侧，活塞随之伸缩，油路在模块内部闭环。它保留了液压「力大、抗冲击」的优点，又去掉了传统液压系统需要的中央油泵站、长油管和伺服阀，只要通电和控制信号就能工作，效率也更高。EHA 最早在飞机舵面控制等航空领域推广，后来被用到大负载腿足机器人和人形机器人的腿部关节上，作为纯电机关节与传统液压之间的折中方案。","example":"","related":["液压驱动","执行器","线性执行器（直线执行器 / 电缸）","液压版 Atlas","扭矩密度"]},{"id":"pneumatic-actuation","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Pneumatic actuator - Wikipedia","url":"https://en.wikipedia.org/wiki/Pneumatic_actuator"}],"as_of":"","related_ids":["pneumatic-gripper","pneumatic-artificial-muscle","soft-robot","hydraulic-actuation","vacuum-suction-cup","compliance"],"name":"气动驱动","alt":"Pneumatic Actuation","abbr":"","aliases":["气压驱动"],"one_liner":"用压缩空气推动气缸或软体腔体来产生运动的驱动方式。","explanation":"气动驱动用空压机产生的压缩空气，经电磁阀控制进出气缸、气动马达或软体气囊，把气压变成直线或旋转运动。优点是结构简单、便宜、功率重量比高，而且空气可压缩，天然带柔顺性，碰到人或物体时冲击小，在易燃易爆环境也比电机安全。缺点同样来自可压缩性：精确控制位置和力很难，响应有延迟，还需要空压机、管路和阀岛，噪声大、能效低，不便装进移动机器人。因此它在工厂里主要用于开合式动作，如气动夹爪、真空吸盘和定位气缸；在研究里则是软体机器人和气动人工肌肉的主要动力来源。","example":"产线上的气动二指夹爪只有开、合两个状态，靠电磁阀切换气路，几十毫秒内完成抓取。","related":["气动夹爪","气动人工肌肉","软体机器人","液压驱动","真空吸盘","柔顺性"]},{"id":"artificial-muscle","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Artificial muscle - Wikipedia","url":"https://en.wikipedia.org/wiki/Artificial_muscle"}],"as_of":"","related_ids":["pneumatic-artificial-muscle","hydraulically-amplified-self-healing-electrostatic-actuator","shape-memory-alloy","dielectric-elastomer-actuator","soft-robot","clone-robotics-protoclone"],"name":"人工肌肉","alt":"Artificial Muscle","abbr":"","aliases":["人造肌肉"],"one_liner":"受电、气压或温度刺激后能像肌肉一样收缩伸长的驱动器件","explanation":"人工肌肉泛指在电、气压、温度、化学等刺激下能收缩、伸长或弯曲的执行器（把能量变成运动的部件），常见类别有气动人工肌肉（橡胶管外套编织网，充气后变粗变短）、形状记忆合金、介电弹性体、HASEL 电液执行器、扭绞纤维等。和「电机+减速器」相比，它更轻、天然柔顺，适合软体机器人、外骨骼和仿生手；短板是效率、响应速度、寿命和精确控制普遍不如电机，目前多处在研究和小众产品阶段。","example":"Clone Robotics 的 Protoclone 仿生人形据报道用水压驱动的人工肌肉带动骨骼结构。","related":["气动人工肌肉","HASEL 电液人工肌肉","形状记忆合金","介电弹性体","软体机器人","Clone Protoclone"]},{"id":"pneumatic-artificial-muscle","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Pneumatic artificial muscles - Wikipedia","url":"https://en.wikipedia.org/wiki/Pneumatic_artificial_muscles"}],"as_of":"","related_ids":["pneumatic-actuation","artificial-muscle","exoskeleton","soft-robot","bio-inspired-robot","hydraulically-amplified-self-healing-electrostatic-actuator"],"name":"气动人工肌肉","alt":"Pneumatic Artificial Muscle (McKibben Muscle)","abbr":"PAM","aliases":["McKibben 肌肉","麦基本肌肉","气动肌肉"],"one_liner":"充气后像肌肉一样变粗缩短、产生拉力的软管式驱动器。","explanation":"气动人工肌肉最经典的形式是 McKibben 肌肉：一根橡胶内管外面套着编织网套，充气时内管向外鼓，编织网把径向膨胀转换成轴向缩短，于是两端产生拉力，和生物肌肉收缩很像。它以 20 世纪 50 年代为小儿麻痹患者设计矫形器的物理学家 Joseph McKibben 命名。优点是很轻、力重比高、天然柔顺；缺点是只能拉不能推，需要像人体肌肉那样成对拮抗布置，收缩量有限，并且有明显的非线性和迟滞，精确建模和控制困难。常见于康复外骨骼、仿生手臂和软体机器人研究。","example":"Festo 的 Fluidic Muscle 是一种工业化的气动肌肉产品，可用于抓取和张紧等需要柔顺拉力的场合。","related":["气动驱动","人工肌肉","外骨骼","软体机器人","仿生机器人","HASEL 电液人工肌肉"]},{"id":"shape-memory-alloy","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Shape-memory alloy - Wikipedia","url":"https://en.wikipedia.org/wiki/Shape-memory_alloy"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"形状记忆合金","alt":"Shape Memory Alloy","abbr":"SMA","aliases":["记忆合金","SMA","镍钛合金"],"one_liner":"变形后一加热就恢复原形的合金，通电收缩可当人工肌肉","explanation":"形状记忆合金是一类在低温下被变形后、加热到相变温度以上就能恢复原来形状的合金，最常用的是镍钛合金（Nitinol，1960 年代初由美国海军军械实验室发现）。原理是材料在两种晶体结构（马氏体和奥氏体）之间转变。做成细丝后通电加热，丝会收缩几个百分点并产生拉力，可以当执行器或「人工肌肉」。优点是力重比高、结构简单、没有噪声；缺点是行程小、靠散热冷却所以回复慢、能量效率低、滞回明显难以精确控制。常用于微型机器人、仿生手指和软体机器人。","example":"用几根通电的镍钛丝拉动腱绳，驱动一个小型仿生手指弯曲，断电冷却后靠弹簧复位。","related":["人工肌肉(Artificial Muscle)","执行器(Actuator)","软体机器人(Soft Robot)","腱绳驱动(Tendon-Driven Actuation)","介电弹性体(Dielectric Elastomer Actuator)"]},{"id":"dielectric-elastomer-actuator","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Dielectric elastomers - Wikipedia","url":"https://en.wikipedia.org/wiki/Dielectric_elastomers"}],"as_of":"","related_ids":["artificial-muscle","hydraulically-amplified-self-healing-electrostatic-actuator","shape-memory-alloy","soft-robot","actuator","soft-gripper"],"name":"介电弹性体","alt":"Dielectric Elastomer Actuator","abbr":"DEA","aliases":["介电弹性体执行器","介电弹性体驱动器"],"one_liner":"给软薄膜两面加高电压，靠静电力把它压薄拉大来产生动作的人工肌肉","explanation":"介电弹性体执行器是一类电驱动的人工肌肉：一层柔软的绝缘弹性膜（如硅胶、丙烯酸胶）两面涂上可拉伸电极，加上几千伏的高电压后，两侧电荷互相吸引把膜压薄，膜就在面内扩张，断电后回弹。它的优点是轻、快、安静、能量密度较高，形变可以很大，适合做软体机器人、微型抓手和仿生鱼等。缺点是需要千伏级高压、容易击穿、输出力偏小，所以目前主要停留在实验室和小型装置里。它和 HASEL 电液人工肌肉、形状记忆合金一样，常被归入「新型驱动」方向。","example":"把 DEA 薄膜卷成管状，通电伸长、断电缩回，就能做成一根可控的软体「肌肉」驱动小夹爪。","related":["人工肌肉","HASEL 电液人工肌肉","形状记忆合金","软体机器人","执行器","软体夹爪"]},{"id":"hydraulically-amplified-self-healing-electrostatic-actuator","category":"hardware","sec":4,"tier":3,"sources":[{"title":"Acome et al., Hydraulically amplified self-healing electrostatic actuators with muscle-like performance, Science 2018","url":"https://doi.org/10.1126/science.aao6139"}],"as_of":"","related_ids":["artificial-muscle","dielectric-elastomer-actuator","soft-robot","pneumatic-artificial-muscle","actuator"],"name":"HASEL 电液人工肌肉","alt":"Hydraulically Amplified Self-healing Electrostatic Actuator","abbr":"HASEL","aliases":["HASEL 执行器"],"one_liner":"用高压静电挤压密封液体、模仿肌肉收缩的软体执行器。","explanation":"HASEL 由美国科罗拉多大学博尔德分校 Keplinger 团队提出，2018 年发表于 Science。它是一个装满液态绝缘介质的柔性薄膜袋，袋外贴电极；加上高压后电极相互吸合，把液体挤到袋子另一部分，袋子鼓起或收缩，产生类似肌肉的动作。因为绝缘层是液体，局部击穿后液体会流回填补，所以能「自愈」。它结合了静电驱动响应快和液压驱动变形大的优点，适合软体机器人和仿生机构。短板是需要千伏级高压，输出力和可靠性离机器人关节电机还有距离，目前主要在研究和小规模应用阶段。","example":"","related":["人工肌肉","介电弹性体","软体机器人","气动人工肌肉","执行器"]},{"id":"end-effector","category":"hardware","sec":5,"tier":1,"sources":[{"title":"Robot end effector - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_end_effector"},{"title":"Franka Hand（Franka Robotics 官网）","url":"https://franka.de/franka-hand"}],"as_of":"","related_ids":["gripper","dexterous-hand","end-effector-pose","tool-center-point","tool-flange","inverse-kinematics"],"name":"末端执行器","alt":"End Effector","abbr":"EEF","aliases":["末端","EE","末端工具"],"one_liner":"装在机械臂最末端、直接和物体接触干活的工具。","explanation":"末端执行器是机械臂运动链最后一节上安装的工具，通过工具法兰连接，负责真正与环境接触：夹爪、灵巧手、真空吸盘、焊枪、螺丝刀都属于它。机械臂负责把末端送到指定位姿，末端执行器负责完成抓、吸、拧等具体动作。在具身智能论文里，「EEF」还常指末端的位置和姿态：很多策略直接输出末端位姿（任务空间动作），再靠逆运动学换算成各关节角度；另一类则直接输出关节角。换一种末端执行器，动作空间和可做的任务都会跟着变。","example":"Franka 机械臂最常搭配的末端执行器是自家的 Franka Hand 二指平行夹爪。","related":["夹爪","灵巧手","末端位姿","工具中心点","工具法兰","逆运动学"]},{"id":"gripper","category":"hardware","sec":5,"tier":1,"sources":[{"title":"Robot end effector - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_end_effector"}],"as_of":"","related_ids":["end-effector","parallel-jaw-gripper","electric-gripper","adaptive-gripper","dexterous-hand","grasping"],"name":"夹爪","alt":"Gripper","abbr":"","aliases":["机械夹爪","机器人夹爪"],"one_liner":"靠手指开合来夹住物体的末端执行器，结构比灵巧手简单。","explanation":"夹爪是最常见的末端执行器，用两根或三根手指开合来夹持物体。按驱动方式分电动夹爪和气动夹爪，按结构分平行二指、三指、自适应（欠驱动，手指能顺着物体形状包裹）、软体夹爪等；真空吸盘、磁力夹爪有时也被归入广义的「夹爪」。它的优点是便宜、可靠、好控制，通常只需要一个开合量作为动作，所以大多数机器人学习数据集和 VLA 模型都基于夹爪。缺点是做不了拧、转、按按钮之类需要多指配合的精细动作，这部分要靠灵巧手。","example":"Robotiq 2F-85 是科研和工业里常见的二指自适应电动夹爪，最大开口 85 毫米。","related":["末端执行器","二指夹爪","电动夹爪","自适应夹爪","灵巧手","抓取"]},{"id":"parallel-jaw-gripper","category":"hardware","sec":5,"tier":1,"sources":[{"title":"Robotiq 2F-85 & 2F-140 Adaptive Grippers","url":"https://robotiq.com/products/2f85-140-adaptive-robot-gripper"},{"title":"Franka Hand（Franka Robotics 官网，二指平行夹爪）","url":"https://franka.de/franka-hand"},{"title":"Zhao et al. 2023: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["gripper","end-effector","antipodal-grasp","grasping","aloha","franka-hand"],"name":"二指夹爪","alt":"Parallel Jaw Gripper","abbr":"","aliases":["平行夹爪","两指夹爪","平行二指夹爪"],"one_liner":"两根手指相对平移开合来夹东西的夹爪，最常用也最简单。","explanation":"二指夹爪有两根相对的手指，开合时两指保持平行地靠拢或分开，像一把平口钳。它结构简单、成本低、夹持稳定，控制上通常只用一个量（开口宽度或开/合）表示动作，因此是机器人学习里最主流的末端：Open X-Embodiment、DROID 等大规模数据集里的数据绝大多数来自二指夹爪，OpenVLA、π0 等模型输出的夹爪动作也是一维。抓取研究里常用「对跖抓取」（两个接触点受力方向相对）分析它能否夹稳。局限是难以处理需要多指配合或手内调整的任务。","example":"ALOHA 双臂平台每只手臂末端都是一个二指平行夹爪。","related":["夹爪","末端执行器","对跖抓取","抓取","ALOHA 双臂平台","Franka 夹爪"]},{"id":"electric-gripper","category":"hardware","sec":5,"tier":2,"sources":[{"title":"Robot end effector - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_end_effector"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"电动夹爪","alt":"Electric Gripper","abbr":"","aliases":[],"one_liner":"用电机驱动开合的机器人夹爪，可以控制开口位置、速度和夹持力。","explanation":"电动夹爪是装在机械臂末端、用电机（通常配丝杠、齿轮或连杆）驱动手指开合的末端执行器。和靠压缩空气推动的气动夹爪相比，它不需要气源，能精确设定张开宽度、闭合速度和夹持力，还能读回当前位置和电流，适合夹易碎物体和需要反馈的任务；缺点是一般比气动夹爪贵、力气和速度偏小。具身智能研究里最常用的就是二指电动夹爪，因为它只有一个自由度，动作空间简单，遥操作和策略学习都好做；数据集里的夹爪动作往往就是一个开合量。","example":"Robotiq 2F-85 和 Franka 自带夹爪都是研究中常见的二指电动夹爪。","related":["夹爪(Gripper)","二指夹爪(Parallel Jaw Gripper)","气动夹爪(Pneumatic Gripper)","末端执行器(End Effector)","Robotiq 2F-85 夹爪(Robotiq 2F-85 Gripper)","指尖力 / 握力(Fingertip Force / Grip Force)"]},{"id":"franka-hand","category":"hardware","sec":5,"tier":2,"sources":[{"title":"Franka Hand - Franka Robotics","url":"https://franka.de/franka-hand"},{"title":"Franka Hand Product Manual (2022)","url":"https://franka.de/hubfs/Product%20Manual%20Franka%20Hand_R50010_1.2_EN.pdf"}],"as_of":"2026-09","related_ids":["parallel-jaw-gripper","electric-gripper","franka-emika-panda-franka-research-3","end-effector","libfranka-franka-control-interface","robotiq-2f-85-gripper"],"name":"Franka 夹爪","alt":"Franka Hand","abbr":"","aliases":["Panda 夹爪","Franka Emika Hand"],"one_liner":"Franka 机械臂原配的二指平行电动夹爪。","explanation":"Franka Hand 是德国 Franka Robotics（原 Franka Emika）为 Panda / FR3 机械臂配套的电动二指平行夹爪，两根手指对着平移开合。官方参数为总行程 80 mm，持续夹持力 70 N、最大 140 N，自重约 0.7 kg，指尖可拆换，常用 3D 打印指尖适配不同物体。因为 Franka 机械臂在学术界极普及，这个夹爪连同它的仿真模型成了大量操作论文和基准里的默认末端执行器（装在机械臂末端、直接接触物体的部件），用 libfranka 就能控制开合与夹持力。","example":"robosuite、LIBERO 等仿真基准里 Panda 机械臂默认装的就是按 Franka Hand 建模的二指夹爪。","related":["二指夹爪","电动夹爪","Franka 机械臂（Panda / FR3）","末端执行器","libfranka","Robotiq 2F-85 夹爪"]},{"id":"robotiq-2f-85-gripper","category":"hardware","sec":5,"tier":2,"sources":[{"title":"Robotiq 2F-85 / 2F-140 Instruction Manual - Specifications","url":"https://assets.robotiq.com/website-assets/support_documents/document/online/2F-85_2F-140_TM_InstructionManual_HTML5_20190503.zip/2F-85_2F-140_TM_InstructionManual_HTML5/Content/6.%20Specifications.htm"},{"title":"Robotiq 2F-85 & 2F-140 Adaptive Grippers","url":"https://robotiq.com/products/2f85-140-adaptive-robot-gripper"}],"as_of":"2026-09","related_ids":["gripper","parallel-jaw-gripper","adaptive-gripper","end-effector","robotiq","droid"],"name":"Robotiq 2F-85 夹爪","alt":"Robotiq 2F-85 Gripper","abbr":"","aliases":["2F-85","Robotiq 二指夹爪"],"one_liner":"加拿大 Robotiq 公司的电动自适应二指夹爪，开口 85 毫米。","explanation":"2F-85 是加拿大 Robotiq 公司生产的电动二指夹爪，名字里的 85 指手指最大开口 85 mm。官方规格：夹持力可在约 20–235 N 之间设定，重复精度 0.05 mm。它的手指是连杆结构，既能像普通平行夹爪那样两指对捏，也能在碰到物体后自动弯曲把物体包住（即「自适应 / 欠驱动」，一个电机带动多个关节）。它和 UR、Franka 等协作机械臂接口兼容，装上就能用，所以成了机器人学习实验室最常见的末端执行器之一，很多公开数据集和策略模型的动作空间里夹爪维度就是它的开合量。","example":"DROID 数据集的采集平台是 Franka 机械臂加 Robotiq 2F-85 夹爪。","related":["夹爪","二指夹爪","自适应夹爪","末端执行器","Robotiq","DROID 数据集"]},{"id":"adaptive-gripper","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Underactuation - Wikipedia","url":"https://en.wikipedia.org/wiki/Underactuation"}],"as_of":"","related_ids":["gripper","underactuation","robotiq-2f-85-gripper","parallel-jaw-gripper","fin-ray-gripper","soft-gripper"],"name":"自适应夹爪","alt":"Adaptive / Underactuated Gripper","abbr":"","aliases":["欠驱动夹爪"],"one_liner":"电机比关节少、手指能自动贴合物体形状的夹爪。","explanation":"自适应夹爪属于欠驱动设计：驱动器数量少于关节数量，靠连杆、弹簧或腱绳把一个电机的力分到多个指节。手指碰到物体后，没被挡住的指节会继续弯曲，自动包住物体，不需要逐个控制关节。这样既能像普通二指夹爪那样平行夹取，又能对圆柱、不规则物体做包络抓取，控制简单、成本低、容错高。代价是指节姿态不能精确控制，做不了手内操作。Robotiq 2F-85 是科研和工业里最常见的自适应夹爪之一。","example":"Robotiq 2F-85 只用一个电机，既能平行夹起薄片零件，也能让指节弯曲包住水杯。","related":["夹爪","欠驱动","Robotiq 2F-85 夹爪","二指夹爪","鳍条夹爪","软体夹爪"]},{"id":"three-finger-gripper","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Robot end effector - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_end_effector"}],"as_of":"","related_ids":["gripper","parallel-jaw-gripper","adaptive-gripper","dexterous-hand","end-effector","grasping"],"name":"三指夹爪","alt":"Three-Finger Gripper","abbr":"","aliases":["三指手","三指自适应夹爪"],"one_liner":"有三根手指的机械夹爪，介于二指夹爪和五指灵巧手之间","explanation":"三指夹爪是装在机械臂末端、用三根手指抓东西的末端执行器。常见做法是两根手指可以绕手掌转动、改变排布，第三根相对，这样既能像二指夹爪一样对捏，也能三指包住圆柱、球这类物体。和二指夹爪比，它接触点多、抓得更稳，能适应更多形状；和五指灵巧手比，它电机少、结构简单、更耐用。不少三指夹爪是欠驱动的（电机数少于关节数），手指碰到物体后会自动弯曲贴合。研究和工业里都用过，典型代表有 BarrettHand 和 Robotiq 三指自适应夹爪。","example":"BarrettHand：三根手指，其中两根可绕手掌旋转，常用于早期抓取规划研究。","related":["夹爪","二指夹爪","自适应夹爪","灵巧手","末端执行器","抓取"]},{"id":"pneumatic-gripper","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Robot end effector - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_end_effector"}],"as_of":"","related_ids":["gripper","electric-gripper","end-effector","pneumatic-actuation","vacuum-suction-cup","parallel-jaw-gripper"],"name":"气动夹爪","alt":"Pneumatic Gripper","abbr":"","aliases":["气爪","气动手指"],"one_liner":"用压缩空气推动气缸，带动夹指开合的夹爪","explanation":"气动夹爪靠压缩空气推动气缸里的活塞，再通过连杆或齿条带动夹指开合，由电磁阀切换气路来控制「开」和「合」。它结构简单、便宜、动作快、夹持力大、耐用，是工厂产线最常见的末端执行器之一。缺点是一般只有全开和全闭两个位置，夹持力和开合宽度很难精细控制，还得配气泵、气管和电磁阀。具身智能研究里更常用电动夹爪，因为策略要输出连续的开合宽度；在节拍要求高的搬运、分拣场景，气动夹爪仍是主流。","example":"流水线上抓取零件的双指气动夹爪：PLC 给电磁阀一个信号，气路切换，夹指闭合夹住零件。","related":["夹爪","电动夹爪","末端执行器","气动驱动","真空吸盘","二指夹爪"]},{"id":"vacuum-suction-cup","category":"hardware","sec":5,"tier":2,"sources":[{"title":"Suction cup - Wikipedia","url":"https://en.wikipedia.org/wiki/Suction_cup"}],"as_of":"","related_ids":["end-effector","gripper","bin-picking","sorting","order-picking","palletizing-depalletizing"],"name":"真空吸盘","alt":"Vacuum Suction Cup","abbr":"","aliases":["吸盘"],"one_liner":"靠抽出吸盘内空气产生负压，把物体吸住的末端执行器。","explanation":"真空吸盘是工业里最常见的末端执行器之一：吸盘贴到物体表面后，由真空泵或真空发生器抽走里面的空气，内外气压差就把物体压在吸盘上。它结构简单、便宜、定位要求低，只要能接触到一块较平整、不漏气的表面就能吸起来，所以在物流分拣、电商拣货、无序抓取里用得很多。缺点是对多孔、粗糙、柔软或很小的物体不好用，也做不了需要手指配合的操作。很多拣货机器人把吸盘和夹爪组合使用。","example":"亚马逊仓库里的拣货机械臂常用吸盘从货箱中吸起纸盒和塑料袋包装的商品。","related":["末端执行器","夹爪","无序抓取","分拣","拣选（订单拣货）","码垛 / 拆垛"]},{"id":"magnetic-gripper","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Electropermanent magnet - Wikipedia","url":"https://en.wikipedia.org/wiki/Electropermanent_magnet"},{"title":"Robot end effector - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_end_effector"}],"as_of":"","related_ids":["end-effector","vacuum-suction-cup","gripper","electroadhesion-gripper","industrial-robot","palletizing-depalletizing"],"name":"磁力夹爪","alt":"Magnetic Gripper","abbr":"","aliases":["电磁吸盘","磁性夹爪","电永磁吸盘"],"one_liner":"靠电磁铁或可开关永磁铁吸住铁质工件的末端执行器。","explanation":"磁力夹爪是一种末端执行器（装在机械臂末端干活的部件），用电磁铁或电永磁铁（通电一瞬间切换磁性、平时不耗电保持吸力）吸住钢铁类工件。它只需接触工件一个面，不用手指合拢，抓取快、结构简单，适合搬运钢板、冲压件和铁质零件；电永磁方案在断电时仍能吸住，安全性更好。局限也很明显：只对铁磁性材料有效，薄板容易一次吸起多张，放下时可能有剩磁残留。它和真空吸盘、二指夹爪一样，是工业场景里常用的非灵巧抓取方案。","example":"冲压生产线上，机械臂末端的磁力吸盘一次吸起一张钢板，送进下一台压机。","related":["末端执行器","真空吸盘","夹爪","静电吸附夹爪","工业机器人","码垛 / 拆垛"]},{"id":"electroadhesion-gripper","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Electroadhesion - Wikipedia","url":"https://en.wikipedia.org/wiki/Electroadhesion"}],"as_of":"","related_ids":["gripper","soft-gripper","vacuum-suction-cup","deformable-object-manipulation","end-effector"],"name":"静电吸附夹爪","alt":"Electroadhesion Gripper","abbr":"","aliases":["电吸附夹爪","静电吸附抓手"],"one_liner":"在柔性垫里埋电极加高压，靠静电吸力把物体「粘」起来的夹爪","explanation":"静电吸附夹爪利用电吸附原理：在柔软的夹爪表面下埋入交错排布的电极，通上高电压后在物体表面感应出相反电荷，两者之间产生静电吸引力，把物体贴住提起；断电后吸力随即消失。它不需要夹紧也不需要真空，对布料、纸张、薄膜、易碎或形状不规则的物体比较友好，功耗也很低。局限是吸力随材料、湿度和表面状况变化大，承重有限，所以常与机械手指组合，让手指负责包络、电吸附负责增加摩擦和贴合。","example":"抓一张平铺在桌上的布或纸时，普通二指夹爪很难插到下面，电吸附垫直接贴上去通电就能提起。","related":["夹爪","软体夹爪","真空吸盘","柔性物体操作","末端执行器"]},{"id":"soft-gripper","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Soft robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Soft_robotics"}],"as_of":"","related_ids":["gripper","soft-robot","pneumatic-actuation","fin-ray-gripper","granular-jamming-gripper","compliance"],"name":"软体夹爪","alt":"Soft Gripper","abbr":"","aliases":["柔性夹爪","软体手"],"one_liner":"用硅胶等软材料做手指、靠自身变形包住物体的夹爪。","explanation":"软体夹爪的手指用硅胶、橡胶等弹性材料制成，多数靠往内部腔体充气或抽气让手指弯曲（气动驱动），也有用腱绳或电机拉动的。手指本身是软的，接触时会顺着物体表面变形，所以不需要精确知道物体形状和位置，也不容易压坏易碎品，是软体机器人最常见的落地形式。常用于食品、水果、生鲜的抓取分拣。缺点是抓取力和定位精度较低，材料会老化。它和鳍条夹爪、颗粒阻塞夹爪一样，靠结构的柔顺性被动适应物体。","example":"食品产线用气动软体夹爪抓取鸡蛋、草莓等易碎物品。","related":["夹爪","软体机器人","气动驱动","鳍条夹爪","颗粒阻塞夹爪","柔顺性"]},{"id":"fin-ray-gripper","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Soft robotics（含 Fin Ray 抓手介绍）- Wikipedia","url":"https://en.wikipedia.org/wiki/Soft_robotics"}],"as_of":"","related_ids":["soft-gripper","parallel-jaw-gripper","adaptive-gripper","compliance","gripper"],"name":"鳍条夹爪","alt":"Fin Ray Gripper","abbr":"","aliases":["Fin Ray 夹爪","鱼鳍夹爪","Fin Ray 效应夹爪"],"one_liner":"模仿鱼鳍结构、手指受压时会自动向物体弯曲包住它的柔性夹爪","explanation":"鳍条夹爪的手指是一个三角形框架，两条外边由若干横向小肋条连接，结构灵感来自鱼鳍（Fin Ray 效应）。当物体从侧面压到手指上时，手指不会被压瘪退开，而是朝物体方向弯过去，自动贴合物体轮廓。这样只要一个普通的二指开合动作，就能以较大接触面积温和地包住水果、瓶子等形状各异的物体，不需要额外传感器或复杂控制。它通常用软塑料或 3D 打印制造，成本低，常作为二指夹爪的替换指尖，属于被动柔顺的软体夹爪。","example":"把平行夹爪的硬指头换成两片 3D 打印的鳍条手指，就能稳稳夹起番茄而不捏破。","related":["软体夹爪","二指夹爪","自适应夹爪","柔顺性","夹爪"]},{"id":"granular-jamming-gripper","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Jamming (physics) - Wikipedia","url":"https://en.wikipedia.org/wiki/Jamming_(physics)"}],"as_of":"","related_ids":["soft-gripper","gripper","vacuum-suction-cup","soft-robot","compliance"],"name":"颗粒阻塞夹爪","alt":"Granular Jamming Gripper (Universal Gripper)","abbr":"","aliases":["通用夹爪","阻塞夹爪","咖啡粉气球夹爪"],"one_liner":"装满颗粒的软囊先贴住物体，抽真空后变硬把物体「锁」住的夹爪","explanation":"颗粒阻塞夹爪由一个装满咖啡粉、沙子等颗粒的柔软气囊构成。抓取时，松软的气囊先压到物体上，顺着物体形状包裹过去；然后抽出囊内空气，颗粒互相挤紧、不再流动（物理上称「阻塞」相变），气囊瞬间变硬，靠摩擦、吸附和几何卡住把物体抓牢；再充气就松开。它由芝加哥大学、康奈尔大学与 iRobot 的研究者在 2010 年的 PNAS 论文中提出，因不需要预先知道物体形状、能抓各种形状的小物体而被称为「通用夹爪」。缺点是对大而平的物体效果差。","example":"同一个装咖啡粉的气球夹爪，不用换手指就能抓起硬币、鸡蛋和螺丝刀。","related":["软体夹爪","夹爪","真空吸盘","软体机器人","柔顺性"]},{"id":"tool-flange","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Robot end effector - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_end_effector"}],"as_of":"","related_ids":["tool-center-point","end-effector","tool-changer","six-axis-force-torque-sensor","robotic-arm"],"name":"工具法兰","alt":"Tool Flange","abbr":"","aliases":["末端法兰","法兰盘","机械臂法兰"],"one_liner":"机械臂最末端用来安装夹爪等工具的标准圆盘接口","explanation":"工具法兰是机械臂最后一个关节末端的那块圆形安装面，上面有按规定位置分布的螺纹孔和定位销孔，夹爪、力传感器、相机支架、快换盘都装在这里。国际标准 ISO 9409-1 规定了法兰的尺寸和孔位，按这个标准做的工具可以在不同品牌机械臂之间通用，不合标准就得加转接板。法兰中心通常也是机械臂默认的末端坐标系原点，装上工具后要在控制器里设置工具中心点（TCP）偏移，机械臂才知道真正干活的点在哪。部分协作机器人还在法兰附近留有电源和通信接口，方便给电动夹爪供电。","example":"给 UR5e 换夹爪时，先把夹爪按 ISO 9409-1 孔位拧到法兰上，再在示教器里设置 TCP 偏移。","related":["工具中心点","末端执行器","工具快换盘","六维力传感器","机械臂"]},{"id":"tool-changer","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Robotic Tool Changers - ATI Industrial Automation","url":"https://www.ati-ia.com/products/toolchanger/robot_tool_changer.aspx"}],"as_of":"","related_ids":["tool-flange","end-effector","gripper","vacuum-suction-cup","tool-use","robotic-arm"],"name":"工具快换盘","alt":"Tool Changer","abbr":"","aliases":["快换盘","快换装置","工具快换"],"one_liner":"让机械臂几秒内自动换上不同末端工具的接口装置","explanation":"工具快换盘装在机械臂法兰和末端工具之间，分两半：主侧固定在机械臂上，工具侧装在每个工具上。机械臂把主侧对准工具侧，靠气动或电动锁紧机构扣上，同时接通气路、电信号和通信，就完成了换工具。它解决的是「一台机械臂只装一个夹爪」的限制：同一台臂可以一会儿用吸盘搬箱子，一会儿换二指夹爪装配，一会儿换螺丝刀。工业产线上很常见；在具身智能里，它也用在需要多种工具的移动操作和实验平台上。主要厂商有 ATI、Schunk 等。","example":"机械臂先用真空吸盘取料，放回工具架后换上电动夹爪完成装配，全程不用人手动拆装。","related":["工具法兰","末端执行器","夹爪","真空吸盘","工具使用","机械臂"]},{"id":"remote-center-compliance-device","category":"hardware","sec":5,"tier":3,"sources":[{"title":"Remote center compliance - Wikipedia","url":"https://en.wikipedia.org/wiki/Remote_center_compliance"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"远中心柔顺装置（RCC）","alt":"Remote Center Compliance Device","abbr":"RCC","aliases":["RCC","远心柔顺装置"],"one_liner":"装在手腕和夹具之间的被动弹性机构，让插装时零件自动对准孔","explanation":"RCC 是 20 世纪 70 年代末由美国 Draper 实验室（Whitney 等人）提出的一种被动柔顺机构，由弹性元件组成，装在机械臂腕部和夹具之间。它的特点是柔顺中心在装置外面、落在被夹零件的尖端附近，所以零件插孔时一碰到孔边的侧向力，就会自动横移和偏转去对准，不容易卡死。它不需要力传感器和主动力控（用控制算法调节接触力），靠机械结构就能吸收几毫米级的位置误差，至今仍用于工业装配。在学习型装配研究里，常被拿来和主动柔顺控制比较。","example":"机械臂把销钉插进公差很小的孔时，在法兰和夹爪之间加一个 RCC，销钉偏了一点也能滑进去，而不是卡在孔口。","related":["轴孔装配(Peg-in-Hole Insertion)","柔顺性(Compliance)","柔顺控制(Compliance Control)","阻抗控制(Impedance Control)","装配(Robotic Assembly)"]},{"id":"dexterous-hand","category":"hardware","sec":6,"tier":1,"sources":[{"title":"Shadow Hand - Wikipedia","url":"https://en.wikipedia.org/wiki/Shadow_Hand"},{"title":"OpenAI 2019: Solving Rubik's Cube with a Robot Hand (arXiv 1910.07113)","url":"https://arxiv.org/abs/1910.07113"}],"as_of":"","related_ids":["dexterous-manipulation","in-hand-manipulation","end-effector","active-dof-passive-dof","shadow-dexterous-hand","tendon-driven-actuation"],"name":"灵巧手","alt":"Dexterous Hand","abbr":"","aliases":["多指灵巧手","五指灵巧手","机器人灵巧手"],"one_liner":"有多根可独立活动手指、能做精细操作的机器人手。","explanation":"灵巧手是装在机械臂末端、模仿人手结构的多指末端执行器，通常有 3–5 根手指、十几到二十多个关节。和只能开合的夹爪相比，它能做捏、握、转笔、拧瓶盖、手内调整物体姿态（手内操作）等动作，是人形机器人做通用操作的关键部件。难点在于自由度多、空间小：电机、减速器、传感器要塞进手掌和手指，常用腱绳、连杆或微型丝杠传动；控制上动作空间维度高，数据也难采。灵巧手常标「主动自由度」（真正由电机驱动的关节数），它往往少于总关节数。","example":"OpenAI 的 Dactyl 项目在 2019 年用 Shadow 灵巧手单手还原魔方。","related":["灵巧操作","手内操作","末端执行器","主动自由度 / 被动自由度","Shadow 灵巧手","腱绳驱动"]},{"id":"metacarpophalangeal-proximal-and-distal-interphalangeal-join","category":"hardware","sec":6,"tier":3,"sources":[{"title":"Metacarpophalangeal joint - Wikipedia","url":"https://en.wikipedia.org/wiki/Metacarpophalangeal_joint"},{"title":"Interphalangeal joints of the hand - Wikipedia","url":"https://en.wikipedia.org/wiki/Interphalangeal_joints_of_the_hand"}],"as_of":"","related_ids":["dexterous-hand","active-dof-passive-dof","thumb-opposition","flexion-extension-and-abduction-adduction","underactuation","mano"],"name":"掌指关节 / 指间关节（MCP / PIP / DIP）","alt":"Metacarpophalangeal / Proximal & Distal Interphalangeal Joints","abbr":"MCP / PIP / DIP","aliases":["掌指关节","近端指间关节","远端指间关节"],"one_liner":"手指从根部到指尖的三个关节，是描述灵巧手结构的通用术语。","explanation":"这三个缩写来自人手解剖学：MCP 是手指根部连接手掌的掌指关节，能屈伸也能左右侧摆，共 2 个自由度；PIP 是中间的近端指间关节，DIP 是靠指尖的远端指间关节，各只能屈伸。人在弯曲手指时 DIP 基本跟着 PIP 一起动，所以很多灵巧手用连杆或腱绳把两者耦合，一个电机带两个关节，结果是关节数多于主动自由度（电机数）。拇指的结构不同，没有 PIP/DIP 之分。看灵巧手参数时，分清关节数和主动自由度，才能比较不同产品。","example":"因时 RH56 灵巧手每根手指只有一个电机，通过连杆同时带动 MCP 和 PIP 屈曲，因此全手 12 个关节只有 6 个主动自由度。","related":["灵巧手","主动自由度 / 被动自由度","拇指对掌","屈伸与侧摆（外展/内收）","欠驱动","MANO 手部模型"]},{"id":"thumb-opposition","category":"hardware","sec":6,"tier":3,"sources":[{"title":"Opposable thumb - Wikipedia","url":"https://en.wikipedia.org/wiki/Opposable_thumb"},{"title":"Unitree Dex5-1 - Unitree Robotics","url":"https://www.unitree.com/mobile/Dex5-1/"}],"as_of":"","related_ids":["dexterous-hand","grasp-taxonomy","metacarpophalangeal-proximal-and-distal-interphalangeal-join","dexterous-manipulation","degrees-of-freedom"],"name":"拇指对掌","alt":"Thumb Opposition","abbr":"","aliases":["对掌运动"],"one_liner":"拇指转过来让指腹正对其他手指指腹的动作","explanation":"拇指对掌是人手的一种基本动作：拇指在掌根处旋转、内收，让拇指指腹和食指、中指等的指腹面对面。捏起硬币、拧瓶盖、握笔都靠它。对机器人灵巧手来说，能不能做出对掌，决定了能不能完成精细捏取；只会弯曲、不会旋转的拇指，只能做粗糙的包握。所以设计仿人手时，拇指根部通常至少要有两个自由度（一个弯曲、一个旋转），高端手会给拇指更多主动自由度。评估一只灵巧手时，拇指能否分别碰到其他四指指尖，是常用的检查项。","example":"宇树 Dex5-1 灵巧手的拇指有 4 个主动自由度，能做对掌捏取。","related":["灵巧手","抓握分类（强力抓握 / 精细捏取）","掌指关节 / 指间关节（MCP / PIP / DIP）","灵巧操作","自由度"]},{"id":"fingertip-force-grip-force","category":"hardware","sec":6,"tier":2,"sources":[{"title":"Grip strength - Wikipedia","url":"https://en.wikipedia.org/wiki/Grip_strength"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"指尖力 / 握力","alt":"Fingertip Force / Grip Force","abbr":"","aliases":["指尖力","握持力"],"one_liner":"灵巧手或夹爪能施加的力：指尖力看单根手指，握力看整只手合拢。","explanation":"指尖力指单根手指末端能对物体施加的最大力，决定捏取、按按钮、拧小物件这类精细动作能不能做；握力指整只手（或夹爪两指）合拢握住物体时的总夹持力，决定能提多重、握得牢不牢。两者通常以牛顿（N）或公斤力标注，是灵巧手和夹爪参数表里的核心指标。数值大不等于好用：力太大控制不细容易捏碎物体，力太小又会打滑，所以还要看力控精度、响应速度和持续工作时的发热。评估时也要注意厂商给的是峰值还是可持续值、在哪个手指姿态下测的。","example":"灵巧手规格表通常同时列出单指指尖力和整手握力，两者数值可能相差数倍。","related":["灵巧手(Dexterous Hand)","夹爪(Gripper)","抓取(Grasping)","摩擦锥(Friction Cone)","力封闭(Force Closure)","抓握分类（强力抓握 / 精细捏取）(Grasp Taxonomy (Power vs. Precision Grasp))"]},{"id":"tendon-routing-configurations","category":"hardware","sec":6,"tier":3,"sources":[{"title":"Design and Control of a Tendon-Driven Robotic Finger Based on Grasping Task Analysis (PMC)","url":"https://www.ncbi.nlm.nih.gov/pmc/articles/PMC11201696/"},{"title":"Wire Driven Multi-fingered Hand - Springer Nature Link","url":"https://link.springer.com/rwe/10.1007/978-94-007-6046-2_84"}],"as_of":"","related_ids":["tendon-driven-actuation","dexterous-hand","tendon-material","underactuation","degrees-of-freedom","intrinsic-vs-extrinsic-actuation"],"name":"腱绳驱动配置（N 型 / N+1 型 / 2N 型）","alt":"Tendon Routing Configurations (N / N+1 / 2N)","abbr":"","aliases":["N 型 / N+1 型 / 2N 型腱绳布置"],"one_liner":"按「N 个关节配几根腱绳」区分的三种腱绳驱动布局。","explanation":"腱绳只能拉不能推，一根绳只能让关节往一个方向转。驱动 N 个自由度常见三种配法：2N 型给每个关节配一对拮抗绳（一根屈、一根伸），控制最直接，还能调关节刚度，但电机数量翻倍；N+1 型让 N 个关节共用 N+1 根绳，靠绳在各关节上的耦合走线实现全部可控，同时保证每根绳始终处于拉紧状态，电机最省；N 型每个关节只配一根拉绳，回程靠弹簧，结构简单，但回程力和速度受弹簧限制。选哪种取决于手部空间、电机数量和力控需求。","example":"斯坦福/JPL 三指手每根手指 3 个自由度用 4 根腱绳驱动（N+1 型）；Utah/MIT 灵巧手采用 2N 型。","related":["腱绳驱动","灵巧手","腱绳材料（超高分子量聚乙烯纤维 UHMWPE）","欠驱动","自由度","驱动器内置 / 外置（近端布置）"]},{"id":"tendon-material","category":"hardware","sec":6,"tier":3,"sources":[{"title":"Ultra-high-molecular-weight polyethylene - Wikipedia","url":"https://en.wikipedia.org/wiki/Ultra-high-molecular-weight_polyethylene"},{"title":"Dyneema - Wikipedia","url":"https://en.wikipedia.org/wiki/Dyneema"}],"as_of":"","related_ids":["tendon-driven-actuation","tendon-routing-configurations","dexterous-hand","bowden-cable","tesla-optimus-hand"],"name":"腱绳材料（超高分子量聚乙烯纤维 UHMWPE）","alt":"Tendon Material (Ultra-High-Molecular-Weight Polyethylene Fiber)","abbr":"UHMWPE","aliases":["UHMWPE 纤维","迪尼玛（Dyneema）","大力马线","PE 线"],"one_liner":"腱绳驱动灵巧手常用的高强度、低伸长、耐磨的合成纤维绳。","explanation":"超高分子量聚乙烯纤维（UHMWPE，常见商品名 Dyneema、Spectra）由分子链极长的聚乙烯纺成，同等重量下强度远高于钢丝，伸长小、摩擦系数低、耐反复弯折。腱绳驱动的灵巧手要把前臂电机的拉力经手腕、指节的滑轮或导管传到指尖：绳子一伸长，手指位置就不准；一磨断，手就坏了，所以常选这种纤维编织绳。它的短板是不耐高温，长期受力会缓慢蠕变，设计时通常要加预紧和张力补偿。","example":"不少开源腱绳灵巧手直接用钓鱼用的编织 PE 线（俗称大力马线）作腱绳。","related":["腱绳驱动","腱绳驱动配置（N 型 / N+1 型 / 2N 型）","灵巧手","鲍登线","特斯拉 Optimus 灵巧手"]},{"id":"fully-direct-drive-dexterous-hand","category":"hardware","sec":6,"tier":3,"sources":[{"title":"直驱传动，扛起最强灵巧手的大旗 - 腾讯新闻","url":"https://news.qq.com/rain/a/20251201A04RU300"}],"as_of":"2025-12","related_ids":["dexterous-hand","direct-drive","tendon-driven-actuation","linkage-transmission","hybrid-drive-dexterous-hand","backdrivability"],"name":"全直驱灵巧手","alt":"Fully Direct-Drive Dexterous Hand","abbr":"","aliases":["直驱灵巧手"],"one_liner":"每个主动关节都由装在关节处的电机直接驱动、不走腱绳或连杆的灵巧手","explanation":"全直驱灵巧手指每个主动自由度都配一个微型电机，而且电机就放在对应关节附近，尽量缩短电机到关节的传动链，不像腱绳驱动那样把电机放在前臂再拉绳，也不像连杆方案那样一个电机带好几个关节。好处是响应快、摩擦和间隙小、可以反向驱动（外力能推动关节），便于用电机电流估计受力，自由度也能做得很高。难点是手指里空间极小，要塞下电机、编码器和驱动电路，整手会更重、发热更集中，对微电机工艺要求很高。2025 年起国内有多家厂商推出这类产品。","example":"据报道，舞肌科技的 Wuji Hand（20 自由度）和 Sharpa Wave（22 自由度）都采用直驱方案。","related":["灵巧手","直驱","腱绳驱动","连杆传动","混合驱动灵巧手","反驱性"]},{"id":"hybrid-drive-dexterous-hand","category":"hardware","sec":6,"tier":3,"sources":[{"title":"Robotic hand - Wikipedia","url":"https://en.wikipedia.org/wiki/Robotic_hand"}],"as_of":"","related_ids":["dexterous-hand","fully-direct-drive-dexterous-hand","tendon-driven-actuation","linkage-transmission","intrinsic-vs-extrinsic-actuation"],"name":"混合驱动灵巧手","alt":"Hybrid-Drive Dexterous Hand","abbr":"","aliases":["混驱灵巧手","混驱"],"one_liner":"在同一只灵巧手里组合多种驱动与传动方式的设计。","explanation":"混合驱动灵巧手是国内行业里常用的说法，指一只手里不只用一种驱动方案，而是按关节分工组合：比如部分关节用掌内微电机直接驱动或经连杆驱动，另一部分用腱绳由前臂电机拉动；也有把电机驱动和被动弹性元件结合的做法。目的在于平衡几件互相冲突的事：手要小而轻、自由度要多、指尖力要够、还要好维护。纯腱绳手灵活但张力难控制、易磨损，纯连杆或全直驱手结构可靠但电机难塞下。混驱是一种折中路线，具体怎么混各家不同，看产品时要问清每个关节用的是什么传动。","example":"手指屈伸用前臂电机经腱绳拉动、手指侧摆用掌内微电机直接驱动，就是一种混驱方案。","related":["灵巧手","全直驱灵巧手","腱绳驱动","连杆传动","驱动器内置 / 外置（近端布置）"]},{"id":"allegro-hand","category":"hardware","sec":6,"tier":2,"sources":[{"title":"Allegro Hand 官网（Wonik Robotics）","url":"https://www.allegrohand.com/"},{"title":"Allegro Hand v4.0 - Wonikrobotics Wiki","url":"http://wiki.wonikrobotics.com/AllegroHandWiki/index.php/Allegro_Hand_v4.0"}],"as_of":"2026-09","related_ids":["dexterous-hand","leap-hand","shadow-dexterous-hand","in-hand-manipulation","hora","dexterous-manipulation"],"name":"Allegro 灵巧手","alt":"Allegro Hand","abbr":"","aliases":["Allegro Hand","Allegro 手"],"one_liner":"韩国 Wonik Robotics 的四指 16 自由度灵巧手，学术界最常用之一","explanation":"Allegro Hand 是韩国 Wonik Robotics 生产的商用灵巧手，四根手指、每指 4 个关节，共 16 个自由度，每个关节由独立电机驱动、可做电流（力矩）控制，通过 CAN 总线以约 333 Hz 通信。它价格远低于 Shadow 灵巧手，又有现成的 ROS 驱动和仿真模型，长期是学术界做手内操作、灵巧抓取和仿真到现实迁移的常用平台。局限是只有四指、比人手少一根，单关节扭矩不大。据厂商资料，新一代 V5 在指尖加入了触觉传感器。","example":"HORA 用强化学习在仿真里训练、再迁移到真机，让 Allegro Hand 只靠本体感知就能在手里连续转动各种物体。","related":["灵巧手","LEAP Hand","Shadow 灵巧手","手内操作","HORA（手内物体旋转 + RMA）","灵巧操作"]},{"id":"leap-hand","category":"hardware","sec":6,"tier":2,"sources":[{"title":"LEAP Hand: Low-Cost, Efficient, and Anthropomorphic Hand for Robot Learning (arXiv 2309.06440)","url":"https://arxiv.org/abs/2309.06440"},{"title":"LEAP Hand V2 Advanced project page","url":"https://v2-adv.leaphand.com/"}],"as_of":"2025-06","related_ids":["dexterous-hand","allegro-hand","robotis-dynamixel-servo","open-source-hardware","motion-retargeting","cmu-robotics-institute"],"name":"LEAP Hand","alt":"LEAP Hand (Low-cost, Efficient, Anthropomorphic Hand)","abbr":"","aliases":["LEAP Hand v2"],"one_liner":"CMU 开源的低成本 16 自由度仿人灵巧手。","explanation":"LEAP Hand 由卡内基梅隆大学 Kenneth Shaw、Ananye Agarwal 和 Deepak Pathak 提出，发表于 RSS 2023。它是四指 16 个自由度的仿人手，关节用 Dynamixel 舵机直接驱动，零件现成可买加 3D 打印，论文称约 2000 美元、4 小时就能装好，成本约为 Allegro 手的八分之一，并设计了在任意手指姿态下都保持灵活的指根结构。它开源硬件、仿真模型和软件，方便研究者做遥操作、从人类视频学习和仿真到真机迁移。后续团队又推出 v2 系列，包括刚柔混合外壳的版本。","example":"研究者用网络摄像头估计人手姿态，重定向到 LEAP Hand 上进行遥操作采数据。","related":["灵巧手","Allegro 灵巧手","Dynamixel 舵机","开源硬件","动作重定向","卡内基梅隆大学机器人研究所"]},{"id":"orca-open-source-reliable-cost-effective-anthropomorphic-rob","category":"hardware","sec":6,"tier":3,"sources":[{"title":"The ORCA Hand - Soft Robotics Lab, ETH Zurich","url":"https://srl.ethz.ch/orcahand.html"},{"title":"arXiv 2504.04259 ORCA: An Open-Source, Reliable, Cost-Effective, Anthropomorphic Robotic Hand","url":"https://arxiv.org/abs/2504.04259"},{"title":"arXiv 2606.14561 ORCA: A Platform for Open-Source Dexterity Research","url":"https://arxiv.org/abs/2606.14561"}],"as_of":"2026-06","related_ids":["dexterous-hand","tendon-driven-actuation","leap-hand","tactile-sensor","open-source-hardware","lerobot"],"name":"ORCA 灵巧手","alt":"ORCA: Open-Source, Reliable, Cost-Effective, Anthropomorphic Robotic Hand","abbr":"ORCA","aliases":["ORCA Hand"],"one_liner":"苏黎世联邦理工开源的 17 自由度腱绳驱动拟人灵巧手。","explanation":"ORCA 是苏黎世联邦理工（ETH Zurich）软体机器人实验室开源的拟人灵巧手，论文 2025 年 4 月挂出、发表于 IROS 2025。它有 17 个自由度（手指 16 个、手腕 1 个），用腱绳驱动（电机放在手外，用绳子像肌腱一样拉手指），集成触觉传感器；零件可 3D 打印或直接买到，材料成本低于 2000 瑞士法郎，不到 8 小时即可装完。设计上有可脱位复位的关节、自动标定和绳子自动张紧，测试中连续运行一万多个循环（约 20 小时）无硬件故障。2026 年 6 月团队又发布平台论文，把底层控制、仿真、消费级设备遥操作、手部动作重定向打通，并接入 LeRobot 训练流程。","example":"研究者按官网的 STL 文件和装配视频自己打印、组装一只 ORCA 手，再用 VR 头显遥操作采集数据、训练灵巧操作策略。","related":["灵巧手","腱绳驱动","LEAP Hand","触觉传感器","开源硬件","LeRobot"]},{"id":"shadow-dexterous-hand","category":"hardware","sec":6,"tier":2,"sources":[{"title":"Shadow Dexterous Hand Series - Shadow Robot","url":"https://shadowrobot.com/dexterous-hand-series/"},{"title":"Shadow Hand - Wikipedia","url":"https://en.wikipedia.org/wiki/Shadow_Hand"}],"as_of":"2026-09","related_ids":["dexterous-hand","shadow-robot-company","dactyl","tendon-driven-actuation","dex-ee","in-hand-manipulation"],"name":"Shadow 灵巧手","alt":"Shadow Dexterous Hand","abbr":"","aliases":["Shadow Hand","影子灵巧手"],"one_liner":"英国 Shadow Robot 公司的高仿人灵巧手，24 个关节、20 个驱动自由度。","explanation":"Shadow 灵巧手由英国伦敦的 Shadow Robot Company 研发，是该公司的旗舰产品。它按人手尺寸和关节范围设计，共 24 个关节，其中 20 个可独立驱动，其余靠欠驱动联动；电动版把电机放在前臂，通过腱绳拉动手指，并有丰富的位置和触觉传感。它价格高、维护复杂，但长期是灵巧操作研究的标杆平台，很多仿真环境也内置了它的模型。该公司后来又和 Google DeepMind 合作推出更耐用的 DEX-EE 灵巧手。","example":"OpenAI 的 Dactyl 项目在仿真中训练强化学习策略，再让真实 Shadow 手单手转魔方。","related":["灵巧手","Shadow Robot Company","Dactyl（OpenAI 魔方灵巧手）","腱绳驱动","Shadow DEX-EE 灵巧手","手内操作"]},{"id":"dex-ee","category":"hardware","sec":6,"tier":3,"sources":[{"title":"DEX-EE Series - Shadow Robot","url":"https://shadowrobot.com/dex-ee_series/"},{"title":"Our latest advances in robot dexterity - Google DeepMind","url":"https://deepmind.google/blog/advances-in-robot-dexterity/"}],"as_of":"2026-09","related_ids":["dexterous-hand","shadow-robot-company","shadow-dexterous-hand","google-deepmind","tactile-sensor","dexterous-manipulation"],"name":"Shadow DEX-EE 灵巧手","alt":"DEX-EE (Shadow Robot × Google DeepMind)","abbr":"","aliases":["DEX-EE","DEX-EE Chiral"],"one_liner":"Shadow Robot 与谷歌 DeepMind 合作研发的三指耐用型科研灵巧手","explanation":"DEX-EE 是英国 Shadow Robot 公司应谷歌 DeepMind 机器人团队的需求、历时约五年迭代出的灵巧手。它不追求长得像人手：三根手指、每指 4 个自由度共 12 个，整手比人手大约一半，重约 4.1 kg。设计重点是「经得起摔打」和「感觉灵敏」，因为强化学习要在真机上反复试错，普通灵巧手很容易被撞坏。每根手指的指尖装有上百个触觉单元的光学触觉传感器，指节上也有多维触觉，另外还有位置、力和 IMU 数据高速回传。之后推出的 DEX-EE Chiral 把第三指下移到侧面，像人的拇指一样与其他手指对置，更方便人类遥操作和模仿学习，有左手、右手和双手套装。","example":"DeepMind 把 DEX-EE 用作真实世界学习研究平台，让策略在真机上反复抓取、摆弄物体收集数据。","related":["灵巧手","Shadow Robot Company","Shadow 灵巧手","谷歌 DeepMind","触觉传感器","灵巧操作"]},{"id":"inspire-rh56-dexterous-hand","category":"hardware","sec":6,"tier":2,"sources":[{"title":"RH56DFX - INSPIRE ROBOTS","url":"https://en.inspire-robots.com/product/rh56dfx/"},{"title":"The Dexterous Hand RH56 Series User Manual","url":"https://en.inspire-robots.com/wp-content/uploads/2024/02/INSPIRE-ROBOTS-THE-DEXTEROUS-HAND-RH56-SERIES-USER-MANUAL.pdf"}],"as_of":"2026-09","related_ids":["dexterous-hand","inspire-robots","linear-actuator","linkage-transmission","unitree-h1","open-television"],"name":"因时 RH56 灵巧手","alt":"Inspire RH56 Dexterous Hand","abbr":"","aliases":["因时灵巧手","RH56DFX","Inspire Hand"],"one_liner":"因时机器人的五指灵巧手，6 个电机驱动 12 个关节。","explanation":"RH56 是北京因时机器人推出的五指仿人灵巧手系列，RH56DFX 是其中常用型号。它有 6 个主动自由度、12 个关节：每根手指由一个内置的微型直线伺服驱动器（小电缸）经连杆带动弯曲，拇指多一个侧摆，其余关节靠连杆联动。官方参数为单指指尖力约 10 N、拇指约 15 N，内置位置和力反馈，断电可自锁，支持 RS485 或 CAN 通信。它价格和可靠性适中，被大量装在宇树 H1、G1 等人形机器人上做遥操作和模仿学习，是国内外实验室最常见的灵巧手之一。","example":"Open-TeleVision 用 Apple Vision Pro 遥操作装有因时灵巧手的宇树 H1 采集数据。","related":["灵巧手","因时机器人","线性执行器（直线执行器 / 电缸）","连杆传动","宇树 H1","Open-TeleVision"]},{"id":"brainco-revo-hand","category":"hardware","sec":6,"tier":3,"sources":[{"title":"BrainCo Revo 2 参数（官方文档）","url":"https://www.brainco-hz.com/docs/revolimb-hand/en/revo2/parameters.html"},{"title":"Revo 2 | BrainCo","url":"https://brainco.tech/product/revo2"}],"as_of":"2026-09","related_ids":["dexterous-hand","brainco","underactuation","active-dof-passive-dof","inspire-rh56-dexterous-hand","unitree-dex3-1"],"name":"强脑科技 Revo 灵巧手","alt":"BrainCo Revo Hand","abbr":"","aliases":["Revo 2","BrainCo 灵巧手","Revo 2 灵巧手"],"one_liner":"强脑科技的轻量仿生灵巧手，Revo 2 为 6 电机、11 自由度、约 383 g","explanation":"Revo 是强脑科技（BrainCo，杭州的脑机接口公司）在其智能假肢技术基础上做的机器人灵巧手系列。官方文档显示 Revo 2 用 6 个电机驱动 6 个主动关节，加上被动联动关节共 11 个自由度：拇指有屈伸和内收外展主动自由度，四指各一个主动屈伸自由度，其余关节靠机构联动（欠驱动）。单手约 383 g，全握力不低于 50 N，最大负载不低于 20 kg，分 Basic、Pro、Touch 三版，Touch 版带多维触觉模组，接口有 RS485、CAN FD，Pro/Touch 另支持 EtherCAT。它重量轻、接口通用，常装在人形机器人上做抓取和遥操作实验。","example":"Revo 2 有适配宇树人形机器人的版本在经销渠道销售。","related":["灵巧手","强脑科技","欠驱动","主动自由度 / 被动自由度","因时 RH56 灵巧手","宇树 Dex3-1 灵巧手"]},{"id":"psyonic-ability-hand","category":"hardware","sec":6,"tier":3,"sources":[{"title":"Ability Hand - PSYONIC","url":"https://www.psyonic.io/ability-hand"},{"title":"How a Loyola alum built the world's first touch-sensing bionic hand","url":"https://news.luc.edu/stories/science-tech/how-a-loyola-alum-built-the-worlds-first-touch-sensing-bionic-hand/"}],"as_of":"2026-09","related_ids":["dexterous-hand","tactile-sensor","dexterous-manipulation","teleoperation","degrees-of-freedom","inspire-rh56-dexterous-hand"],"name":"PSYONIC Ability Hand","alt":"PSYONIC Ability Hand","abbr":"","aliases":["Ability Hand","PSYONIC 仿生手"],"one_liner":"美国 PSYONIC 公司的触觉仿生假肢手，也常被当作机器人灵巧手","explanation":"Ability Hand 是美国 PSYONIC 公司（总部圣地亚哥，创始人 Aadeel Akhtar）做的仿生手。它首先是给上肢截肢者用的假肢，公司称其为首款带触觉反馈的仿生手：指尖有压力传感器，抓东西时通过振动把触感传给使用者的残肢。五指都能屈伸，拇指可电动旋转，共 6 个主动自由度，重约 490 克，外壳耐冲击。因为轻、快、耐用，又有面向研究的接口，不少机器人团队把它装在机械臂或人形机器人上，当作灵巧手做灵巧操作和遥操作研究。","example":"研究者把 Ability Hand 装到机械臂末端，用数据手套遥操作采集抓取演示，再训练模仿学习策略。","related":["灵巧手","触觉传感器","灵巧操作","遥操作","自由度","因时 RH56 灵巧手"]},{"id":"unitree-dex3-1","category":"hardware","sec":6,"tier":2,"sources":[{"title":"Unitree Dex3-1 - Unitree Robotics","url":"https://www.unitree.com/mobile/Dex3-1/"}],"as_of":"2026-09","related_ids":["unitree-g1","unitree-robotics","dexterous-hand","unitree-dex5-1","tactile-sensor","motion-retargeting"],"name":"宇树 Dex3-1 灵巧手","alt":"Unitree Dex3-1","abbr":"","aliases":["宇树 Dex3","Dex3"],"one_liner":"宇树为 G1 人形机器人配的三指力控灵巧手，共 7 个自由度。","explanation":"Dex3-1 是宇树科技推出的三指灵巧手，主要搭配宇树 G1 人形机器人使用。它有 7 个主动自由度：拇指 3 个，食指和中指各 2 个；其中 6 个关节是微型无刷电机直驱，1 个带齿轮传动，支持力控。触觉版每只手有 33 个压力传感器，分布在手掌、指腹和指尖。它不追求像人手一样五指，而是用较少的手指换取结构简单和可靠，能完成抓取、捏取等常见操作，在科研圈里常和 G1 一起用于遥操作采数据和训练操作策略。","example":"很多基于宇树 G1 的遥操作和 VLA 实验，用 Apple Vision Pro 捕捉人手动作，再重定向到 Dex3-1 上完成抓取。","related":["宇树 G1","宇树科技","灵巧手","宇树 Dex5-1 灵巧手","触觉传感器","动作重定向"]},{"id":"unitree-dex5-1","category":"hardware","sec":6,"tier":3,"sources":[{"title":"Unitree Dex5-1 - Unitree Robotics","url":"https://www.unitree.com/mobile/Dex5-1/"},{"title":"Unitree releases new Dex5-1 humanoid robot hand - Robotics 24/7","url":"https://www.robotics247.com/article/unitree-releases-new-dex5-1-humanoid-robot-hand"}],"as_of":"2026-09","related_ids":["dexterous-hand","unitree-dex3-1","unitree-robotics","tactile-sensor","thumb-opposition","coreless-motor"],"name":"宇树 Dex5-1 灵巧手","alt":"Unitree Dex5-1","abbr":"","aliases":["Dex5","Dex5-1P"],"one_liner":"宇树科技推出的 20 自由度五指灵巧手，可配触觉版本","explanation":"Dex5-1 是宇树科技给自家人形机器人配套的五指灵巧手。它共 20 个自由度，其中 16 个主动、4 个被动：拇指 4 个主动自由度，其余四指各 3 个主动加 1 个被动。关节用空心杯电机加低背隙减速器驱动，官方称各关节可反向驱动（外力能推动关节），便于做力控，指尖重复定位精度约 ±1 mm。带「P」后缀的 Dex5-1P 在手掌、指尖和指节上加了 94 个触觉传感器。据产品页面，它可装在宇树 H1、H1-2 等人形机器人上，也被研究者用于灵巧操作和遥操作数据采集。","example":"","related":["灵巧手","宇树 Dex3-1 灵巧手","宇树科技","触觉传感器","拇指对掌","空心杯电机"]},{"id":"agibot-omnihand","category":"hardware","sec":6,"tier":3,"sources":[{"title":"智元机器人发布 OmniHand 2025 灵巧手，9800 元起 - IT之家","url":"https://www.ithome.com/0/875/978.htm"},{"title":"OmniHand 专业款2025 - 智元灵巧手","url":"https://www.zhiyuan-robot.com/DOCS/OS/Omnihand-O12"}],"as_of":"2025-08","related_ids":["agibot","dexterous-hand","tactile-sensor","inspire-rh56-dexterous-hand","unitree-dex3-1","agibot-lingxi-x2"],"name":"智元 OmniHand 灵巧手","alt":"AgiBot OmniHand (OmniHand 2025 / OmniHand Pro 2025)","abbr":"","aliases":["OmniHand 2025","OmniHand 灵动款","OmniHand 专业款","智元灵巧手"],"one_liner":"智元机器人 2025 年推出的五指灵巧手系列，分灵动款和专业款。","explanation":"OmniHand 是智元机器人的灵巧手产品线，2025 年 8 月 17 日发布 OmniHand 2025 系列。灵动款面向交互服务，16 个自由度，重约 500 g，可选覆盖手心、手背和五指的 400 多个触觉点位，首发限时价 9800 元（指导价 1.48 万元）；专业款面向工业作业，19 个自由度、重约 750 g，单指最大 20 N，带多模态触觉感知。它可以装在智元自家人形机器人上，也单独卖给其他本体和科研用户，属于国产灵巧手降价走量的代表产品。","example":"","related":["智元机器人","灵巧手","触觉传感器","因时 RH56 灵巧手","宇树 Dex3-1 灵巧手","智元 灵犀 X2"]},{"id":"robotera-xhand1","category":"hardware","sec":6,"tier":3,"sources":[{"title":"IT之家：星动纪元机器人灵巧手 XHAND1 亮相","url":"https://www.ithome.com/0/811/850.htm"},{"title":"新浪科技：星动纪元发布星动 XHAND 1 PRO","url":"https://finance.sina.com.cn/tech/discovery/2026-06-17/doc-inictaet3890715.shtml"}],"as_of":"2026-06","related_ids":[null,null,null,null,null,null],"name":"星动纪元 XHAND1 灵巧手","alt":"RobotEra XHAND1","abbr":"","aliases":["XHAND","XHAND1","XHAND 1"],"one_liner":"星动纪元的 12 自由度纯电驱五指灵巧手，指尖带触觉阵列","explanation":"XHAND1 是星动纪元 2024 年 11 月发布的五指灵巧手，是其人形机器人 STAR1 的手部末端。它有 12 个主动自由度（拇指、食指各 3 个，其余三指各 2 个，食指可侧摆），纯电驱，每个自由度有独立的驱动源，可以单独控制。每根手指配有超过 100 点的触觉阵列传感器，能感知三维力和温度，官方称单手最大握力约 80 N。2026 年 6 月，星动纪元又发布了升级款 XHAND 1 PRO，全直驱、21 个自由度，整手有 18 个分布式触觉传感器。","example":"官方演示中，XHAND1 单手可以提起 25 kg 的哑铃。","related":["灵巧手(Dexterous Hand)","星动纪元(RobotEra)","星动纪元 STAR1(RobotEra STAR1)","全直驱灵巧手(Fully Direct-Drive Dexterous Hand)","触觉传感器(Tactile Sensor)","灵巧操作(Dexterous Manipulation)"]},{"id":"wuji-hand","category":"hardware","sec":6,"tier":3,"sources":[{"title":"产品介绍 - 文档中心 - 舞肌科技","url":"https://docs.wuji.tech/docs/zh/wuji-hand/latest/overview/"},{"title":"舞肌科技 官方网站","url":"https://www.wuji.tech/en/"}],"as_of":"2026-09","related_ids":["dexterous-hand","fully-direct-drive-dexterous-hand","dexterous-manipulation","backdrivability","data-glove","in-hand-manipulation"],"name":"舞肌 Wuji Hand","alt":"Wuji Hand","abbr":"","aliases":["舞肌灵巧手","Wuji Hand 2"],"one_liner":"深圳舞肌科技推出的 20 个主动自由度全直驱灵巧手","explanation":"Wuji Hand 是深圳舞肌科技有限公司（WUJI TECH）做的仿人灵巧手，每根手指 4 个自由度，共 20 个主动自由度。它的特点是全直驱：小电机直接装进手指里驱动各个关节，而不是像很多灵巧手那样用腱绳或连杆把几个关节耦合在一起，因此每个关节都能独立控制，且可反驱（外力能推动关节，便于力控和安全接触）。官方文档给出 20 轴 1000 Hz 控制、以太网通信。据报道第一代售价约 5 万元，官方演示过转笔、用剪刀、用筷子夹球等精细操作；第二代 Wuji Hand 2 据报道在 ICRA 2026 展出。它常配合数据手套做遥操作采集数据，用于灵巧操作研究。","example":"研究者戴数据手套遥操作 Wuji Hand 转笔、按打火机，采集的数据用于训练灵巧操作策略。","related":["灵巧手","全直驱灵巧手","灵巧操作","反驱性","数据手套","手内操作"]},{"id":"linker-hand","category":"hardware","sec":6,"tier":3,"sources":[{"title":"灵心巧手 - 全球领先的机器人灵巧手 | LinkerBot","url":"https://www.linkerbot.cn/"},{"title":"灵心巧手（Linkerbot） - RobotScope","url":"https://robotscope.net/companies/linkerbot/"}],"as_of":"2026-09","related_ids":["linkerbot","dexterous-hand","tendon-driven-actuation","linkage-transmission","dexterous-manipulation","data-glove"],"name":"灵心巧手 Linker Hand","alt":"Linker Hand","abbr":"","aliases":["Linker Hand 灵巧手"],"one_liner":"北京灵心巧手公司的灵巧手产品系列，覆盖腱绳、连杆、直驱三种驱动。","explanation":"Linker Hand 是灵心巧手（北京）科技（Linkerbot）的灵巧手产品线。据官方介绍，该系列自由度从 6 到 42 不等，覆盖腱绳驱动、连杆传动和直驱三种技术路线。其中 L20 基于连杆结构，21 个自由度，用无刷电机加精密滚珠丝杠驱动；L30 是腱绳驱动，22 个自由度。灵巧手是人形机器人做精细操作的末端执行器，自由度越高越接近人手，但控制和数据采集也越难。这类产品常被高校和机器人公司买来装在机械臂或人形上，配合数据手套、VR 遥操作采集灵巧操作数据。","example":"研究者把 Linker Hand 装在机械臂末端，用数据手套遥操作采集抓取、拧瓶盖等灵巧操作演示，再训练 VLA 策略。","related":["灵心巧手","灵巧手","腱绳驱动","连杆传动","灵巧操作","数据手套"]},{"id":"sharpawave","category":"hardware","sec":6,"tier":3,"sources":[{"title":"PR Newswire: Sharpa Reaches Key Milestone With Mass Production","url":"https://www.prnewswire.com/news-releases/ai-robotmaker-sharpa-reaches-key-milestone-with-mass-production-of-worlds-most-advanced-human-sized-robotic-hand-302643434.html"},{"title":"Sharpa Wave 官网","url":"https://www.sharpa.com/pages/wave"},{"title":"CNX Software: Sharpa Wave 22 DoF dexterous hand","url":"https://www.cnx-software.com/2026/06/02/sharpa-wave-high-end-dexterous-robotic-hand-with-22-dof-high-sensitivity-dynamic-tactile-array/"}],"as_of":"2025-12","related_ids":[null,null,null,null,null,null],"name":"Sharpa Wave 灵巧手","alt":"SharpaWave","abbr":"","aliases":["Sharpa Wave","Sharpa W01","Sharpa W02"],"one_liner":"Sharpa 公司的 22 自由度人手大小灵巧手，指尖有高密度视触觉阵列","explanation":"SharpaWave 是 Sharpa 的旗舰灵巧手。Sharpa 成立于 2024 年，总部在新加坡，上海有研发和制造。这只手和成人手 1:1 大小，有 22 个主动自由度，每个指尖集成一个微型摄像头和超过 1000 个触觉像素，官方称「动态触觉阵列」（DTA），力分辨率达 0.005 N，指尖输出力超过 20 N，关节可反驱（外力能推动关节，抗冲击）。它面向具身智能研究和整机集成，提供 ROS 2 包、MuJoCo 仿真模型和 C++ / Python 接口。公司于 2025 年 12 月 16 日宣布量产。","example":"研究者可以先在 MuJoCo 里用官方提供的 SharpaWave 模型训练灵巧操作策略，再迁移到真手上。","related":["灵巧手(Dexterous Hand)","视触觉传感器(Vision-Based Tactile Sensor)","灵巧操作(Dexterous Manipulation)","手内操作(In-hand Manipulation)","反驱性(Backdrivability)","字节 GR-Dexter(GR-Dexter (ByteDance Seed; VLA for bimanual high-DoF dexterous hands))"]},{"id":"tesla-optimus-hand","category":"hardware","sec":6,"tier":3,"sources":[{"title":"Optimus (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Optimus_(robot)"},{"title":"The Forearm Is the New Hand: Inside Tesla's Optimus V3 Patents","url":"https://droids.substack.com/p/the-forearm-is-the-new-hand-inside"}],"as_of":"2026-09","related_ids":["dexterous-hand","tendon-driven-actuation","tesla-optimus","tesla-optimus-v3","intrinsic-vs-extrinsic-actuation","tesla-supply-chain"],"name":"特斯拉 Optimus 灵巧手","alt":"Tesla Optimus Hand","abbr":"","aliases":["Optimus 灵巧手","Optimus Hand"],"one_liner":"特斯拉为人形机器人 Optimus 自研的灵巧手，第三代为 22 自由度。","explanation":"特斯拉 Optimus 灵巧手是特斯拉为自家人形机器人 Optimus 自研的手。据维基百科，2023 年第二代 Optimus 的手有 11 个自由度，2024 年公布的第三代手为 22 个自由度。2026 年 4 月公开的国际专利显示，新手把主要电机移到前臂，每根手指由三根细腱绳穿过手腕带动，以减轻手部重量和冲击，并用手腕处的走线结构减少手腕转动对手指的串扰。截至 2026 年 9 月，Optimus 第三代整机尚未正式发布，量产规格以官方公布为准。","example":"据公开专利，每根手指由三根腱绳从前臂的执行器拉动，手掌和手指里基本不放电机。","related":["灵巧手","腱绳驱动","擎天柱","特斯拉 Optimus V3（Gen 3）","驱动器内置 / 外置（近端布置）","T 链（特斯拉链）"]},{"id":"mobile-base","category":"hardware","sec":7,"tier":2,"sources":[{"title":"Mobile ALOHA 项目主页","url":"https://mobile-aloha.github.io/"},{"title":"Mecanum wheel - Wikipedia","url":"https://en.wikipedia.org/wiki/Mecanum_wheel"}],"as_of":"","related_ids":["differential-drive-base","mecanum-wheel","swerve-drive","mobile-manipulator","wheeled-humanoid-robot","mobile-manipulation"],"name":"移动底盘","alt":"Mobile Base / Chassis","abbr":"","aliases":["底盘","AGV 底盘","移动平台"],"one_liner":"机器人下半身的轮式移动平台，载着上身到处走。","explanation":"移动底盘指机器人负责移动的那部分，一般集成驱动轮和电机、电池、激光雷达或相机、IMU（惯性测量单元）和运动控制器，对外提供「给个速度就走」的接口（在 ROS 里通常是 cmd_vel 速度指令）。按轮系分，有差速底盘（两轮差速转向，结构简单）、麦克纳姆轮或全向轮底盘（能横移）、舵轮底盘（每个轮子能单独转向，承载大）和阿克曼底盘（像汽车一样前轮转向）。把机械臂或人形上半身装到底盘上，就成了复合机器人或轮式人形机器人，底盘的定位导航精度和续航直接影响移动操作做得好不好。","example":"Mobile ALOHA 把 ALOHA 双臂遥操作系统装到一台移动底盘上，让机器人能在家里边移动边做炒菜、开柜门等双臂任务。","related":["差速底盘","麦克纳姆轮","舵轮","复合机器人","轮式人形机器人","移动操作"]},{"id":"differential-drive-base","category":"hardware","sec":7,"tier":3,"sources":[{"title":"Differential wheeled robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Differential_wheeled_robot"}],"as_of":"","related_ids":["mobile-base","differential-drive-kinematics","nonholonomic-constraint","mecanum-wheel","swerve-drive","wheel-odometry"],"name":"差速底盘","alt":"Differential Drive Base","abbr":"","aliases":["差速驱动","差分驱动底盘","两轮差速底盘"],"one_liner":"左右两个驱动轮各自调速，靠轮速差来转向的移动底盘","explanation":"差速底盘是最常见的移动机器人底盘：左右各一个独立电机驱动的轮子，外加一两个万向从动轮支撑。两轮同速就直行，一快一慢就转弯，一正一反就原地打转。它结构简单、便宜、好控制，运动学只需两个参数（轮速、轮距）就能算出底盘的线速度和角速度，所以扫地机器人、TurtleBot、很多仓储 AMR 都用它。缺点是不能横着平移（属于非完整约束），在狭窄空间里调整姿态不如麦克纳姆轮或舵轮底盘灵活。在 ROS 里通常用 cmd_vel 话题直接给它发线速度和角速度指令。","example":"扫地机器人就是典型的差速底盘：两个驱动轮加前方一个万向轮，能原地转身但不能横移。","related":["移动底盘","差速驱动运动学","非完整约束","麦克纳姆轮","舵轮","轮式里程计"]},{"id":"hub-motor","category":"hardware","sec":7,"tier":3,"sources":[{"title":"Wheel hub motor - Wikipedia","url":"https://en.wikipedia.org/wiki/Wheel_hub_motor"}],"as_of":"","related_ids":["mobile-base","differential-drive-base","wheel-legged-robot","outrunner-motor","direct-drive"],"name":"轮毂电机","alt":"Hub Motor (In-wheel Motor)","abbr":"","aliases":["轮内电机"],"one_liner":"电机直接装进车轮轮毂里、直接带轮子转的驱动方式。","explanation":"轮毂电机把电机整体塞进车轮内部，通常是外转子结构：外壳连着轮胎一起转，省掉了传动轴、齿轮箱或皮带。它结构紧凑、传动损耗小、每个轮子可以单独控制，常见于电动自行车、平衡车，也用在移动机器人底盘和轮足机器人的足端。缺点是轮子变重（簧下质量大，影响减震），电机散热和防水要求更高，低速大扭矩时往往还要配减速。对机器人来说，它让底盘设计更简单，差速转向只需分别控制左右轮速。","example":"不少 DIY 移动机器人直接拆平衡车的轮毂电机做底盘驱动轮。","related":["移动底盘","差速底盘","轮足机器人","外转子电机","直驱"]},{"id":"ackermann-steering-chassis","category":"hardware","sec":7,"tier":3,"sources":[{"title":"Ackermann steering geometry - Wikipedia","url":"https://en.wikipedia.org/wiki/Ackermann_steering_geometry"}],"as_of":"","related_ids":["mobile-base","differential-drive-base","nonholonomic-constraint","hybrid-a-star","pure-pursuit","autonomous-driving"],"name":"阿克曼底盘","alt":"Ackermann Steering Chassis","abbr":"","aliases":["阿克曼转向底盘"],"one_liner":"像汽车一样靠前轮偏转来转弯的移动底盘。","explanation":"阿克曼底盘采用汽车的阿克曼转向几何：转弯时内侧前轮比外侧前轮偏得更多，让所有车轮绕同一个圆心滚动，减少轮胎侧滑。它适合较高速度和户外路面，结构和汽车一致，所以常用于自动驾驶小车、园区配送车和教学用的智能车。缺点是不能原地转向、有最小转弯半径，属于非完整约束（不能直接横向移动），路径规划要考虑这一点，常配合混合 A*、纯追踪等算法。室内移动操作机器人更多用差速底盘或全向轮底盘。","example":"很多自动驾驶教学小车和 ROS 智能车套件采用阿克曼底盘，用纯追踪算法跟踪规划出的路径。","related":["移动底盘","差速底盘","非完整约束","混合 A*","纯追踪算法","自动驾驶"]},{"id":"mecanum-wheel","category":"hardware","sec":7,"tier":2,"sources":[{"title":"Mecanum wheel - Wikipedia","url":"https://en.wikipedia.org/wiki/Mecanum_wheel"}],"as_of":"","related_ids":["omni-wheel","mobile-base","swerve-drive","differential-drive-base","automated-guided-vehicle","mobile-manipulator"],"name":"麦克纳姆轮","alt":"Mecanum Wheel","abbr":"","aliases":["麦轮"],"one_liner":"轮缘斜装一圈小辊子、能让底盘横着走的全向轮。","explanation":"麦克纳姆轮由瑞典 Mecanum AB 公司工程师 Bengt Ilon 在 1970 年代初发明。轮子外圈装着一排与轮轴成 45° 的小辊子，轮子转动时地面给它的力是斜向的。底盘四角各装一个麦轮、每个轮子由独立电机驱动，组合各轮的转向和转速，就能把斜向力合成为前后、左右平移或原地旋转，不用转弯就能全向移动。代价是辊子承载有限、怕不平地面和缝隙、容易打滑，能效和定位精度不如普通轮子，所以多用在平整的室内地面，比如 AGV、移动操作平台和机器人比赛车。","example":"大疆 RoboMaster S1 教育机器人用四个麦克纳姆轮，可以一边横移一边转动云台。","related":["全向轮","移动底盘","舵轮","差速底盘","自动导引车","复合机器人"]},{"id":"omni-wheel","category":"hardware","sec":7,"tier":3,"sources":[{"title":"Omni wheel - Wikipedia","url":"https://en.wikipedia.org/wiki/Omni_wheel"}],"as_of":"","related_ids":["mecanum-wheel","swerve-drive","mobile-base","differential-drive-base","nonholonomic-constraint","mobile-manipulation"],"name":"全向轮","alt":"Omni Wheel","abbr":"","aliases":["万向轮（全向轮）","Omni 轮"],"one_liner":"轮缘装一圈小滚子，既能正常滚动又能被侧向推着走的轮子。","explanation":"全向轮的轮缘上装着一圈可以自由转动的小滚子，滚子轴与轮轴垂直。轮子被电机驱动时正常向前滚；受到侧向力时，小滚子转动，轮子可以几乎无阻力地横向滑移。把三个轮子互成 120°、或四个轮子十字布置，分别控制每个轮的转速，底盘就能在平面上朝任意方向平移、同时原地转向。它和麦克纳姆轮都是全向移动方案：麦轮滚子斜 45°、四轮像汽车那样平行摆放；全向轮滚子 90°、轮子要斜着或成角度布置。缺点是滚子之间有缝，行驶有振动，承载和越障能力有限，适合室内平整地面。","example":"RoboCup 足球机器人小型组常用四个全向轮组成底盘，可以边平移边转身带球。","related":["麦克纳姆轮","舵轮","移动底盘","差速底盘","非完整约束","移动操作"]},{"id":"swerve-drive","category":"hardware","sec":7,"tier":3,"sources":[{"title":"Swerve Drive Kinematics - WPILib Docs","url":"https://docs.wpilib.org/en/stable/docs/software/kinematics-and-odometry/swerve-drive-kinematics.html"}],"as_of":"","related_ids":["mobile-base","mecanum-wheel","omni-wheel","differential-drive-base","automated-guided-vehicle","wheeled-humanoid-robot"],"name":"舵轮","alt":"Swerve Drive / Steerable Drive Wheel","abbr":"","aliases":["舵轮底盘","驱动转向一体轮"],"one_liner":"每个轮子既能驱动又能单独转向的轮组，可让底盘全向移动。","explanation":"舵轮把一个驱动电机和一个转向电机装在同一个轮组上：驱动电机让轮子滚动，转向电机让整个轮子绕竖直轴转到任意朝向。底盘装两到四个舵轮，控制器分别算出每个轮子的速度和角度，就能边平移边转身、横着走。相比麦克纳姆轮，舵轮承载大、对地面平整度要求低、打滑少，但机构和控制更复杂，成本更高。常见于重载 AGV、仓储搬运机器人，以及部分轮式人形和复合机器人的底盘。","example":"FIRST 机器人竞赛（FRC）中常见四个舵轮组成的底盘，可以一边平移一边转身。","related":["移动底盘","麦克纳姆轮","全向轮","差速底盘","自动导引车","轮式人形机器人"]},{"id":"lifting-column","category":"hardware","sec":7,"tier":3,"sources":[{"title":"Hello Robot Stretch","url":"https://hello-robot.com/"}],"as_of":"","related_ids":["mobile-manipulator","mobile-base","wheeled-humanoid-robot","workspace","prismatic-joint","ball-screw"],"name":"升降柱","alt":"Lifting Column","abbr":"","aliases":["升降立柱","升降模组"],"one_liner":"装在底盘上、让机器人躯干或手臂整体上下移动的竖直直线轴。","explanation":"升降柱是移动操作机器人和轮式人形机器人上常见的竖直直线运动部件，一般由电机带动丝杠或同步带，驱动立柱或滑台上下移动，把双臂、头部相机整体抬高或放低。它解决的是工作高度问题：固定高度的手臂很难同时够到地面和高处的货架，加一根升降轴就能用一个自由度覆盖从低到高的工作空间，比做一双长腿便宜、稳定得多。选型时主要看行程、负载、速度和断电能否自锁（防止掉电时手臂下坠）。它和移动底盘、机械臂一起构成复合机器人的常见配置。","example":"Hello Robot 的 Stretch 在底盘上立了一根竖直升降轴，伸缩手臂挂在上面，可以从地面捡东西，也能够到桌面和台面。","related":["复合机器人","移动底盘","轮式人形机器人","工作空间","移动关节","滚珠丝杠"]},{"id":"reverse-knee-leg","category":"hardware","sec":7,"tier":3,"sources":[{"title":"Digitigrade - Wikipedia","url":"https://en.wikipedia.org/wiki/Digitigrade"},{"title":"Agility Robotics","url":"https://agilityrobotics.com/"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"反关节（鸟腿）","alt":"Reverse-Knee / Digitigrade (Bird-like) Leg","abbr":"","aliases":["鸟腿","反曲腿","趾行腿"],"one_liner":"看起来膝盖向后弯的腿型，其实是像鸟一样用脚趾着地","explanation":"反关节腿看上去「膝盖」朝后弯，其实是模仿鸟类的趾行结构：那个反弯的关节相当于人的踝关节，真正的膝盖在大腿上部靠近身体的位置。代表是 Agility Robotics 的 Cassie 和 Digit。这种腿把电机等重物集中在髋部附近，小腿和脚很轻，摆腿惯量小，有利于快速迈步和节能。缺点是和人类腿的结构不一致，人体动捕数据要做动作重定向（把人的动作映射到机器人关节）时更难对应，也不太像人，所以做全身模仿的人形机器人多数改用人类式的正向膝关节。","example":"Agility 的 Cassie 双足机器人就是反关节腿，靠轻量远端腿部跑完了户外 5 公里测试。","related":["双足机器人(Bipedal Robot)","Agility Cassie(Agility Robotics Cassie)","Agility Digit 人形机器人(Agility Robotics Digit (incl. Digit 5))","点足 / 平足(Point Foot vs. Flat Foot)","动作重定向(Motion Retargeting)"]},{"id":"safety-gantry","category":"hardware","sec":7,"tier":2,"sources":[{"title":"Unitree G1 SDK Development Guide","url":"https://support.unitree.com/home/en/G1_developer"}],"as_of":"","related_ids":["humanoid-robot","sim-to-real-transfer","joint-zero-calibration","fall-mitigation-and-fall-recovery","emergency-stop"],"name":"吊装架（安全吊架）","alt":"Safety Gantry / Hoist (Suspended Start)","abbr":"","aliases":["吊架","安全吊绳","悬挂启动"],"one_liner":"把人形或足式机器人吊起来调试的架子，防止摔坏。","explanation":"吊装架是一种带吊绳的龙门架或移动吊车，调试人形、双足机器人时把机器人挂在上面。它的用途有两个：一是开机、零位标定、切换控制模式时让机器人悬空，腿不着地，避免在控制器没准备好时倒下；二是测试新的行走策略（尤其是刚从仿真迁到真机时）时绳子留一点余量，机器人失稳就被吊住，不会摔坏关节和外壳。很多人形厂商的上手说明都要求先吊起再启动运动控制。它是真机实验的基本安全措施，不参与控制本身。","example":"把强化学习训练出的行走策略第一次部署到人形真机时，通常先挂在吊架上让脚离地踏步，再慢慢放低让脚着地。","related":["人形机器人","仿真到现实迁移","关节零位标定（回零）","跌倒保护与摔倒恢复","急停"]},{"id":"onboard-compute-platform","category":"hardware","sec":8,"tier":2,"sources":[{"title":"Jetson Thor | NVIDIA","url":"https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-thor/"}],"as_of":"2026-09","related_ids":["nvidia-jetson","nvidia-jetson-thor","d-robotics-rdk-s100","rockchip-rk3588","lower-level-controller","on-device-edge-deployment"],"name":"主控","alt":"Onboard Compute Platform","abbr":"","aliases":["算力平台","端侧算力","机载计算平台"],"one_liner":"装在机器人身上、跑感知和模型推理的主计算机。","explanation":"主控指机器人本体上负责「想」的那块计算平台，运行感知、定位导航、任务规划和 VLA 等模型推理，再把指令下发给运动控制器和各关节驱动。常见选择有英伟达 Jetson 系列（Orin、Thor）、瑞芯微 RK3588、地瓜 RDK S100 这类带 NPU 的 SoC，以及 x86 工控机。选型主要看算力（用 TOPS 或 TFLOPS 表示）、内存、功耗、接口和软件生态。机器人靠电池供电、还要散热，主控算力远小于训练服务器，模型往往要压缩、量化，或把部分计算放到云端。中文里「主控」有时也泛指控制板上的主芯片，要看上下文。","example":"英伟达 Jetson Thor 模组标称最高 2070 FP4 TFLOPS 算力、128 GB 内存，功耗 40–130 W，定位是人形等机器人的主控。","related":["英伟达 Jetson","Jetson Thor","地瓜 RDK S100","瑞芯微 RK3588","下位机","端侧部署"]},{"id":"nvidia-jetson","category":"hardware","sec":8,"tier":1,"sources":[{"title":"NVIDIA Embedded Systems for Autonomous Machines","url":"https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/"},{"title":"Nvidia Jetson - Wikipedia","url":"https://en.wikipedia.org/wiki/Nvidia_Jetson"}],"as_of":"2026-09","related_ids":["nvidia-jetson-orin","nvidia-jetson-thor","onboard-compute-platform","on-device-edge-deployment","nvidia-jetpack-sdk","nvidia-tensorrt"],"name":"英伟达 Jetson","alt":"NVIDIA Jetson","abbr":"","aliases":["Jetson","Jetson 系列"],"one_liner":"英伟达面向机器人和边缘设备的嵌入式 AI 计算平台系列。","explanation":"Jetson 是英伟达推出的嵌入式计算平台，把 Arm CPU、英伟达 GPU 和内存做成一块小尺寸、低功耗的核心模组，再配载板（引出各种接口的底板）或开发者套件使用。它让机器人不连云端也能在本体上跑神经网络，是机器人主控里最常见的方案之一。系列从 2014 年的 TK1 起步，经历 TX1/TX2、Xavier、Nano、Orin，到 2025 年基于 Blackwell 架构的 Thor。软件上统一用 JetPack（含 Ubuntu 系统、CUDA、TensorRT 等），所以在服务器上训练好的模型比较容易部署上去。选型时主要看算力、内存和功耗。","example":"很多人形机器人和四足机器人把 Jetson Orin 装在机身里，作为运行感知和策略模型的主控。","related":["Jetson Orin","Jetson Thor","主控","端侧部署","JetPack","TensorRT"]},{"id":"nvidia-jetson-orin","category":"hardware","sec":8,"tier":1,"sources":[{"title":"NVIDIA Jetson Orin","url":"https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-orin/"},{"title":"NVIDIA Technical Blog: Jetson Orin Nano Developer Kit Gets a Super Boost (2024-12)","url":"https://developer.nvidia.com/blog/nvidia-jetson-orin-nano-developer-kit-gets-a-super-boost/"},{"title":"Unitree G1 官方产品页","url":"https://www.unitree.com/g1"}],"as_of":"2026-09","related_ids":["nvidia-jetson","nvidia-jetson-thor","onboard-compute-platform","tops","on-device-edge-deployment","nvidia-jetpack-sdk"],"name":"Jetson Orin","alt":"NVIDIA Jetson Orin","abbr":"","aliases":["AGX Orin","Orin NX","Orin Nano","Jetson AGX Orin"],"one_liner":"英伟达 2022 年起推出的 Ampere 架构嵌入式 AI 模组系列。","explanation":"Jetson Orin 是 Jetson 家族上一代主力，基于 Ampere 架构 GPU，按性能从高到低分为 AGX Orin、Orin NX、Orin Nano 三档，功耗约 7–60 瓦。其中 AGX Orin 标称最高约 275 TOPS（每秒万亿次 INT8 运算，按稀疏计算）算力。2024 年底英伟达通过软件更新推出「Super」模式提升 Orin Nano 和 Orin NX 性能，Orin Nano Super 开发者套件定价 249 美元。它是这几年机器人本体上最常见的主控，能跑检测、分割、SLAM 和小型策略模型，但跑数十亿参数的 VLA 比较吃力。","example":"宇树 G1 EDU 版提供 Jetson Orin 作为二次开发算力模块。","related":["英伟达 Jetson","Jetson Thor","主控","TOPS（每秒万亿次运算）","端侧部署","JetPack"]},{"id":"nvidia-jetson-thor","category":"hardware","sec":8,"tier":1,"sources":[{"title":"NVIDIA Jetson Thor","url":"https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-thor/"},{"title":"NVIDIA launches Jetson T2000 and T3000 modules - CNX Software","url":"https://www.cnx-software.com/2026/07/16/nvidia-jetson-t2000-and-t3000-modules-for-edge-ai-and-robotics-applications/"}],"as_of":"2026-07","related_ids":["nvidia-jetson","nvidia-jetson-orin","onboard-compute-platform","on-device-edge-deployment","nvidia-three-computer-solution","nvidia-isaac-gr00t-n1"],"name":"Jetson Thor","alt":"NVIDIA Jetson Thor","abbr":"","aliases":["Jetson AGX Thor","Jetson T5000","Jetson T4000","Jetson T3000","Jetson T2000"],"one_liner":"英伟达基于 Blackwell 架构、主打人形机器人的新一代嵌入式主控。","explanation":"Jetson Thor 是 Jetson 家族最新一代，2025 年 8 月开售 Jetson AGX Thor 开发者套件（3499 美元）。旗舰模组 T5000 采用 Blackwell GPU、14 核 Arm Neoverse CPU、128GB 内存，标称最高 2070 TFLOPS（FP4 精度、按稀疏计算），功耗 40–130 瓦。2026 年 1 月又正式推出 T4000，并在 2026 年 7 月发布更小更便宜的 T3000（约 865 FP4 TFLOPS、32GB）和 T2000（约 400 TFLOPS、16GB），据报道 2027 年一季度供货。它的定位是让人形机器人在本体上直接跑 VLA、视觉语言模型等大模型，英伟达把它作为「三台计算机」里负责部署的那台。","example":"英伟达自家的 GR00T N 系列模型把 Jetson Thor 作为端侧部署目标平台之一。","related":["英伟达 Jetson","Jetson Orin","主控","端侧部署","英伟达三台计算机","GR00T N1 系列"]},{"id":"system-on-chip","category":"hardware","sec":8,"tier":2,"sources":[{"title":"System on a chip - Wikipedia","url":"https://en.wikipedia.org/wiki/System_on_a_chip"}],"as_of":"","related_ids":["onboard-compute-platform","nvidia-jetson","rockchip-rk3588","neural-processing-unit","tops","system-on-module-carrier-board-developer-kit"],"name":"片上系统（SoC）","alt":"System on Chip","abbr":"SoC","aliases":["系统级芯片"],"one_liner":"把 CPU、GPU、AI 加速器等集成在一块芯片上的完整计算系统。","explanation":"片上系统是把 CPU、GPU、神经网络处理器（NPU，专门跑神经网络的计算单元）、内存控制器、视频编解码和各种接口集成在同一块芯片上的设计，手机芯片就是典型的 SoC。机器人主控大多也是 SoC：体积小、功耗低，适合装进电池供电的本体里。选型时主要看 AI 算力（常用 TOPS 表示）、内存带宽和功耗。英伟达 Jetson Orin / Thor、瑞芯微 RK3588、地瓜 RDK S100 都属于这一类，通常以核心模组加载板的形式交付。","example":"英伟达 Jetson AGX Orin 模组的核心就是一块集成了 Arm CPU 和 Ampere 架构 GPU 的 SoC，常被装进人形机器人和四足机器人当主控。","related":["主控","英伟达 Jetson","瑞芯微 RK3588","神经网络处理器（NPU / BPU）","TOPS（每秒万亿次运算）","核心模组与载板（SoM / 载板 / 开发者套件）"]},{"id":"neural-processing-unit","category":"hardware","sec":8,"tier":2,"sources":[{"title":"Neural processing unit - Wikipedia","url":"https://en.wikipedia.org/wiki/Neural_processing_unit"}],"as_of":"","related_ids":["system-on-chip","tops","onboard-compute-platform","rockchip-rknn-toolkit","horizon-robotics-openexplorer","post-training-quantization"],"name":"神经网络处理器（NPU / BPU）","alt":"Neural Processing Unit","abbr":"NPU","aliases":["BPU","AI 加速器","神经网络加速器"],"one_liner":"芯片里专门加速神经网络矩阵运算的低功耗计算单元。","explanation":"NPU 是专为神经网络推理设计的加速器，核心是大量乘加运算单元，擅长卷积和矩阵乘，常以 INT8 等低精度运行，同样算力下功耗比 GPU 低，因此常作为一个模块集成在手机、汽车和机器人用的 SoC（片上系统）里。各厂商叫法不同，地平线把自家的 NPU 架构叫 BPU（Brain Processing Unit），地瓜机器人的 RDK 系列开发板也沿用这一名称。用 NPU 通常要先用厂商工具链（如 RKNN-Toolkit、地平线天工开物）把模型转换、量化成专用格式，遇到不支持的算子还得回退到 CPU 或 GPU，大模型上机部署常卡在这一步。","example":"在瑞芯微 RK3588 开发板上，用 RKNN-Toolkit 把 YOLO 检测模型量化成 INT8 后放到 NPU 上跑，把 CPU 腾出来做别的事。","related":["片上系统（SoC）","TOPS（每秒万亿次运算）","主控","RKNN-Toolkit","地平线天工开物","训练后量化"]},{"id":"tops","category":"hardware","sec":8,"tier":2,"sources":[{"title":"NVIDIA Jetson Orin","url":"https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-orin/"}],"as_of":"","related_ids":["onboard-compute-platform","system-on-chip","flops-tflops","numerical-precision-formats","nvidia-jetson-orin","on-device-edge-deployment"],"name":"TOPS（每秒万亿次运算）","alt":"Tera Operations Per Second","abbr":"TOPS","aliases":["算力单位"],"one_liner":"衡量 AI 芯片算力的单位，表示每秒能做多少万亿次运算。","explanation":"TOPS 是 AI 芯片最常见的宣传指标，1 TOPS 表示每秒一万亿次运算，通常按 INT8（8 位整数）精度计算，也有厂商按更低的 INT4、FP4 精度标注，数字会更大。它和 TFLOPS（每秒万亿次浮点运算）不是一回事，比较时要看清精度。TOPS 是理论峰值，模型实际跑多快还取决于内存带宽、软件栈和算子支持，所以只能粗看。挑机器人主控时，TOPS 用来初步判断能不能在本体上跑视觉模型或 VLA。","example":"英伟达 Jetson AGX Orin 64GB 标称 275 TOPS（INT8 稀疏），是很多人形机器人的主控选择。","related":["主控","片上系统（SoC）","浮点算力（FLOPS / TFLOPS）","数值精度格式（FP32 / BF16 / FP16 / FP8 / INT8）","Jetson Orin","端侧部署"]},{"id":"flops-tflops","category":"hardware","sec":8,"tier":2,"sources":[{"title":"FLOPS - Wikipedia","url":"https://en.wikipedia.org/wiki/FLOPS"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"浮点算力（FLOPS / TFLOPS）","alt":"FLOPS / TFLOPS (Floating-Point Operations per Second)","abbr":"","aliases":["FLOPS","TFLOPS","每秒浮点运算次数"],"one_liner":"芯片每秒能做多少次浮点运算，TFLOPS 表示每秒一万亿次。","explanation":"FLOPS 是每秒浮点运算次数，用来衡量 GPU、主控芯片的计算能力；TFLOPS 是 10¹² 次/秒，PFLOPS 是 10¹⁵ 次/秒。要和小写 s 的 FLOPs 区分：FLOPs 是一次前向计算总共要做多少次运算，是模型的计算量；FLOPS 是芯片每秒能做多少，二者相除可粗估推理时间。看这个数要注意精度：同一块芯片在 FP32、FP16、FP8、FP4 下的数字差好几倍，厂商宣传常用最低精度或稀疏条件下的峰值；整数运算一般用 TOPS 表示。实际能跑到多少还受显存带宽和算子效率限制。选机器人主控、估算 VLA 能否在端侧实时运行时都会用到它。","example":"英伟达 Jetson Thor 宣传的算力按 FP4 精度计，和按 FP16 标的旧款 Orin 不能直接比数字。","related":["TOPS（每秒万亿次运算）(Tera Operations Per Second)","浮点运算量（FLOPs）(Floating-Point Operations (FLOPs))","数值精度格式（FP32 / BF16 / FP16 / FP8 / INT8）(Numerical Precision Formats (FP32 / BF16 / FP16 / FP8 / INT8))","Jetson Thor(NVIDIA Jetson Thor)","主控(Onboard Compute Platform)","推理延迟(Inference Latency)"]},{"id":"system-on-module-carrier-board-developer-kit","category":"hardware","sec":8,"tier":3,"sources":[{"title":"System on module - Wikipedia","url":"https://en.wikipedia.org/wiki/System_on_module"},{"title":"Jetson Modules - NVIDIA Developer","url":"https://developer.nvidia.com/embedded/jetson-modules"}],"as_of":"","related_ids":["nvidia-jetson","nvidia-jetson-orin","nvidia-jetson-thor","onboard-compute-platform","system-on-chip","embedded-system"],"name":"核心模组与载板（SoM / 载板 / 开发者套件）","alt":"System-on-Module / Carrier Board / Developer Kit","abbr":"SoM","aliases":["核心板","底板","开发套件","Dev Kit"],"one_liner":"把芯片做成小模块、再插到带接口的底板上使用的嵌入式硬件形态。","explanation":"核心模组（SoM）把处理器、内存、存储和电源管理集成在一块小板上，本身几乎没有对外接口；载板负责把网口、USB、相机接口、供电等引出来；开发者套件则是厂商配好的「模组 + 参考载板 + 散热」整套，买来就能开发。机器人团队通常先用开发者套件验证算法，量产时再按机身空间自己设计载板，只采购模组。英伟达 Jetson 系列就是典型的这种形态。","example":"Jetson AGX Orin 开发者套件：Orin 模组装在参考载板上，接上电源和相机就能跑模型；做整机时再换成自研载板。","related":["英伟达 Jetson","Jetson Orin","Jetson Thor","主控","片上系统（SoC）","嵌入式系统"]},{"id":"rockchip-rk3588","category":"hardware","sec":8,"tier":3,"sources":[{"title":"Rockchip RK3588 - Rockchips.net","url":"https://rockchips.net/product/rk3588/"},{"title":"CNX Software: Rockchip RK3588 specifications revealed","url":"https://www.cnx-software.com/2020/11/26/rockchip-rk3588-specifications-revealed-8k-video-6-tops-npu-pcie-3-0-up-to-32gb-ram/"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"瑞芯微 RK3588","alt":"Rockchip RK3588","abbr":"","aliases":["RK3588","RK3588S"],"one_liner":"瑞芯微的 8nm 八核 ARM 芯片，带 6 TOPS NPU，常作低成本机器人主控","explanation":"RK3588 是福州瑞芯微推出的旗舰 SoC（把 CPU、GPU、AI 加速器等集成在一颗芯片上），8nm 工艺，CPU 为 4 个 Cortex-A76 加 4 个 Cortex-A55，GPU 为 Mali-G610，内置 6 TOPS 的 NPU（神经网络加速单元），支持 8K 视频编解码。它被大量开发板和工控主板采用，在机器人里常用作低成本、低功耗的主控或上位机，跑 ROS 2、相机处理和轻量模型推理；模型要先用 RKNN-Toolkit 转换才能跑在 NPU 上。和英伟达 Jetson Orin 比，它便宜省电，但 AI 算力和 CUDA 生态差很多，跑不动大型 VLA。","example":"把 YOLO 检测模型用 RKNN-Toolkit 转成 RKNN 格式，部署到 RK3588 开发板的 NPU 上，给小车做实时目标识别。","related":["主控(Onboard Compute Platform)","RKNN-Toolkit(Rockchip RKNN-Toolkit)","神经网络处理器（NPU / BPU）(Neural Processing Unit)","英伟达 Jetson(NVIDIA Jetson)","端侧部署(On-Device / Edge Deployment)","TOPS（每秒万亿次运算）(Tera Operations Per Second)"]},{"id":"black-sesame-sesamex","category":"hardware","sec":8,"tier":3,"sources":[{"title":"黑芝麻智能亮相2026世界人工智能大会（黑芝麻智能官网）","url":"https://www.blacksesame.com/zh/list_8/994.html"},{"title":"A2000明年量产，具身智能打平台战：黑芝麻智能的两张牌（OFweek）","url":"https://www.ofweek.com/auto/2026-04/ART-70101-8110-30684885.html"}],"as_of":"2026-07","related_ids":["onboard-compute-platform","nvidia-jetson-thor","d-robotics-rdk-s100","tops","compute-control-integration","nvidia-jetson"],"name":"黑芝麻 SesameX","alt":"Black Sesame SesameX","abbr":"","aliases":["SesameX","SesameX 多维具身智能计算平台"],"one_liner":"黑芝麻智能面向机器人推出的具身智能计算平台，含多款算力模组","explanation":"SesameX 是车载芯片公司黑芝麻智能推出的「多维具身智能计算平台」，把它在智能驾驶芯片上的车规级算力方案复用到机器人上，面向服务、工业、人形等机器人。官方介绍平台自研 Kalos、Aura、Liora 三款核心模组，算力覆盖约 48 TOPS 到近 600 TOPS（TOPS 即每秒万亿次运算），与其华山 A2000 等芯片家族配套。它和英伟达 Jetson Thor、地瓜 RDK S100 定位相近，作为机器人本体上的主控，运行感知、VLA 等模型并配合运动控制。","example":"黑芝麻智能在 2026 世界人工智能大会上展出了 SesameX 平台（据官网新闻）。","related":["主控","Jetson Thor","地瓜 RDK S100","TOPS（每秒万亿次运算）","算控一体","英伟达 Jetson"]},{"id":"qualcomm-dragonwing-iq10","category":"hardware","sec":8,"tier":3,"sources":[{"title":"Introducing the Qualcomm Dragonwing IQ10 RRD (Edge AI and Vision Alliance)","url":"https://www.edge-ai-vision.com/2026/06/introducing-the-qualcomm-dragonwing-iq10-rrd-a-full-stack-robotics-reference-design/"},{"title":"Qualcomm's Dragonwing IQ10 Aims to Be the Brain for Next-Gen Humanoids (BigGo News)","url":"https://biggo.com/news/202601051624_qualcomm-dragonwing-iq10-robot-processor-ces-2026"}],"as_of":"2026-09","related_ids":["onboard-compute-platform","nvidia-jetson-thor","tops","on-device-edge-deployment","humanoid-robot","gigabit-multimedia-serial-link"],"name":"高通跃龙 IQ10","alt":"Qualcomm Dragonwing IQ10","abbr":"","aliases":["Dragonwing IQ10","跃龙 IQ10","IQ10"],"one_liner":"高通面向工业和人形机器人的高端机载处理器平台","explanation":"IQ10 是高通 Dragonwing（跃龙）工业与嵌入式产品线里面向机器人的高端处理器，据报道于 2026 年 1 月 CES 发布，目标是工业机器人、自主移动机器人和人形机器人的「机载大脑」。官方给出的 AI 算力最高约 700 TOPS，集成 18 核 Oryon CPU、NPU 和 GPU，意在让感知、规划和模型推理在机器人本机完成，不必外挂加速卡。2026 年 6 月高通在 Computex 推出基于它的机器人参考设计 IQ10 RRD，支持最多 12 路 GMSL2 相机及激光雷达、IMU，计划 2026 年 9 月起全球供货，合作方包括 NEURA Robotics、加速进化、VinMotion 等。它和英伟达 Jetson Thor 属于同类竞品。","example":"","related":["主控","Jetson Thor","TOPS（每秒万亿次运算）","端侧部署","人形机器人","GMSL 相机接口"]},{"id":"host-computer","category":"hardware","sec":8,"tier":2,"sources":[{"title":"上位机 - 百度百科","url":"https://baike.baidu.com/item/%E4%B8%8A%E4%BD%8D%E6%9C%BA"}],"as_of":"","related_ids":["lower-level-controller","industrial-pc","onboard-compute-platform","robot-controller","qt","software-development-kit"],"name":"上位机","alt":"Host Computer","abbr":"","aliases":["主控电脑"],"one_liner":"发指令、做高层计算的电脑，下位机负责执行。","explanation":"上位机是国内工程圈的常用说法，指机器人系统里负责高层决策、人机界面和数据处理的计算机，通常是 PC、工控机或 Jetson 这类板卡；它把目标位置、速度等指令通过网口、USB、CAN 等发给下位机（直接驱动电机、读传感器的单片机或驱动器），再接收下位机回传的状态。这种分工让耗算力、不要求严格实时的任务（视觉、规划、跑神经网络策略）放在上位机，而电流环、位置环这类高频闭环留在下位机。做具身智能时，VLA 模型通常跑在上位机上。「上位机软件」也常指这台电脑上的调试界面程序。","example":"用一台带 GPU 的电脑跑策略模型，通过网线调用宇树 SDK 给 G1 的关节发送目标位置，这台电脑就是上位机。","related":["下位机","工控机","主控","机器人控制器","Qt（上位机图形界面开发框架）","软件开发工具包"]},{"id":"lower-level-controller","category":"hardware","sec":8,"tier":2,"sources":[{"title":"上位机 - 维基百科","url":"https://zh.wikipedia.org/wiki/上位机"},{"title":"Microcontroller - Wikipedia","url":"https://en.wikipedia.org/wiki/Microcontroller"}],"as_of":"","related_ids":["host-computer","microcontroller-unit","stmicroelectronics-stm32-mcu-family","servo-drive","real-time-control","controller-area-network"],"name":"下位机","alt":"Lower-level Controller (Slave Computer)","abbr":"","aliases":["底层控制器","下位控制器"],"one_liner":"直接连传感器和电机、负责实时底层控制的嵌入式控制板。","explanation":"下位机是中文工程圈相对「上位机」的叫法，指直接连接电机驱动、编码器、IMU 等硬件的那一层计算单元，通常是 MCU（单片机）、DSP 或 PLC。它不跑大模型，只做对时间要求严格的事：以很高的固定频率读传感器、跑电流环和位置环、输出 PWM（脉宽调制）信号，并通过 CAN、EtherCAT 或串口接收上位机下发的目标、回传状态。上位机（工控机、Jetson 等）负责感知、规划和策略推理。这样分工能让高层算法偶尔卡顿时，底层控制仍然稳定。英文资料多叫 low-level / embedded controller，slave 是较旧的说法。","example":"人形机器人里，Jetson 上的策略比如每 20 ms 输出一次关节目标角度，各关节驱动板上的 STM32 下位机以更高频率闭环跟踪这些目标。","related":["上位机","微控制器","STM32","电机驱动器","实时控制","CAN 总线"]},{"id":"embedded-system","category":"hardware","sec":8,"tier":2,"sources":[{"title":"Embedded system - Wikipedia","url":"https://en.wikipedia.org/wiki/Embedded_system"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"嵌入式系统","alt":"Embedded System","abbr":"","aliases":[],"one_liner":"嵌在设备内部、专门完成特定控制任务的小型计算机系统。","explanation":"嵌入式系统指藏在设备里、为某个特定功能服务的计算机，由处理器（微控制器 MCU 或片上系统 SoC）、存储、外设接口和上面跑的固件或精简操作系统组成。和通用电脑比，它讲究体积小、功耗低、成本低、响应时间确定。机器人里嵌入式系统到处都是：电机驱动器里的 MCU 跑电流环，传感器板负责采集和打包数据，灵巧手、电池管理系统都有自己的主控；上层的主控（如 Jetson）也常被归为嵌入式平台。做机器人要和它打交道：刷固件、调通信协议、处理实时性。","example":"关节驱动器里的 STM32 以几十 kHz 跑电流环，再通过 CAN 或 EtherCAT 接收上位机指令。","related":["微控制器(Microcontroller Unit)","片上系统（SoC）(System on Chip)","固件(Firmware)","实时操作系统(Real-Time Operating System)","STM32(STMicroelectronics STM32 MCU Family)","下位机(Lower-level Controller (Slave Computer))"]},{"id":"microcontroller-unit","category":"hardware","sec":8,"tier":3,"sources":[{"title":"Microcontroller - Wikipedia","url":"https://en.wikipedia.org/wiki/Microcontroller"}],"as_of":"","related_ids":["stmicroelectronics-stm32-mcu-family","lower-level-controller","embedded-system","real-time-operating-system","field-oriented-control","system-on-chip"],"name":"微控制器","alt":"Microcontroller Unit","abbr":"MCU","aliases":["单片机"],"one_liner":"把处理器、存储和各种外设接口集成在一颗芯片上的小型控制芯片。","explanation":"微控制器俗称单片机，是把 CPU 内核、闪存、内存、定时器、模数转换、PWM（脉宽调制）输出以及 CAN、串口等通信接口集成在一颗芯片上的控制器，常见的有意法半导体的 STM32、乐鑫的 ESP32。它算力小、功耗低，但响应时间确定，适合跑裸机程序或实时操作系统。在机器人里，MCU 分布在关节驱动器、传感器板、灵巧手和电池管理系统中，负责几十千赫兹的电流环等底层实时控制；跑 Linux 和神经网络的主控（如 Jetson）则是另一类芯片，两者通过总线配合。","example":"关节驱动板上的 STM32 以很高频率执行 FOC 电流环，同时通过 CAN 总线接收上位机发来的位置和力矩指令。","related":["STM32","下位机","嵌入式系统","实时操作系统","磁场定向控制","片上系统（SoC）"]},{"id":"stmicroelectronics-stm32-mcu-family","category":"hardware","sec":8,"tier":2,"sources":[{"title":"STM32 32-bit Arm Cortex MCUs - STMicroelectronics","url":"https://www.st.com/en/microcontrollers-microprocessors/stm32-32-bit-arm-cortex-mcus.html"},{"title":"STM32 - Wikipedia","url":"https://en.wikipedia.org/wiki/STM32"}],"as_of":"","related_ids":["microcontroller-unit","embedded-system","lower-level-controller","servo-drive","controller-area-network","real-time-operating-system"],"name":"STM32","alt":"STMicroelectronics STM32 MCU Family","abbr":"","aliases":["STM32 单片机"],"one_liner":"意法半导体基于 Arm Cortex-M 内核的 32 位单片机系列。","explanation":"STM32 是意法半导体（STMicroelectronics）推出的 32 位微控制器（MCU，单片机）家族，内核是 Arm Cortex-M 系列，型号从低功耗的 L 系列到高性能的 H 系列覆盖很广。它价格低、外设丰富（PWM、ADC、CAN、UART 等），开发资料和社区完善，在国内电子和机器人圈几乎是嵌入式入门标配。在机器人里，它常做下位机：跑电机驱动的电流环、读编码器和 IMU、处理 CAN 总线通信，再把数据交给上位机或主控（如 Jetson）跑策略。","example":"很多开源无刷电机驱动板和关节模组的控制芯片就是 STM32。","related":["微控制器","嵌入式系统","下位机","电机驱动器","CAN 总线","实时操作系统"]},{"id":"arduino-esp32-microcontroller-boards","category":"hardware","sec":8,"tier":3,"sources":[{"title":"Arduino - Official Site","url":"https://www.arduino.cc/"},{"title":"ESP32 - Espressif Systems","url":"https://www.espressif.com/en/products/socs/esp32"}],"as_of":"","related_ids":["microcontroller-unit","lower-level-controller","stmicroelectronics-stm32-mcu-family","servo","raspberry-pi","open-source-hardware"],"name":"Arduino / ESP32 开发板","alt":"Arduino / ESP32 Microcontroller Boards","abbr":"","aliases":["Arduino","ESP32"],"one_liner":"便宜好上手的单片机开发板，常用来控制舵机、读传感器。","explanation":"Arduino 是意大利团队发起的开源单片机平台，配有简化的编程环境和大量现成库；ESP32 是乐鑫科技推出的低成本单片机芯片，自带 Wi-Fi 和蓝牙，也能用 Arduino 环境编程。它们都属于微控制器（MCU），算力很小，不能跑神经网络大模型，但实时性好、功耗低，适合做下位机：驱动舵机和电机、读编码器和 IMU、通过串口或无线和上位机通信。入门做桌面机械臂、小车、小型双足机器人时经常用到，上面由树莓派或电脑跑视觉和策略。","example":"做一个低成本桌面机械臂时，可以用 ESP32 接收电脑发来的关节角指令，再用 PWM 信号驱动各个舵机。","related":["微控制器","下位机","STM32","舵机","树莓派","开源硬件"]},{"id":"raspberry-pi","category":"hardware","sec":8,"tier":3,"sources":[{"title":"Raspberry Pi - Wikipedia","url":"https://en.wikipedia.org/wiki/Raspberry_Pi"},{"title":"Raspberry Pi 官网","url":"https://www.raspberrypi.com/"}],"as_of":"","related_ids":["microcontroller-unit","arduino-esp32-microcontroller-boards","embedded-system","robot-operating-system-2","lekiwi","policy-server"],"name":"树莓派","alt":"Raspberry Pi","abbr":"","aliases":["Raspberry Pi","RPi"],"one_liner":"英国树莓派出品的廉价卡片电脑，机器人入门常用的板载计算机","explanation":"树莓派是英国树莓派基金会及其子公司 Raspberry Pi Ltd 推出的信用卡大小单板计算机，2012 年首发，基于 ARM 处理器，能跑 Linux（官方 Raspberry Pi OS，也可装 Ubuntu），带一排 GPIO 引脚，可以直接接传感器、舵机和电机驱动板。它便宜、资料多、社区大，是机器人教学和低成本平台常用的「大脑」，可以跑 ROS 2、读相机、控制小车。它的算力跑不动大模型，做 VLA 时通常只负责采集数据和执行动作，推理交给远程 GPU 上的策略服务器。","example":"Hugging Face 的 LeKiwi 移动机械臂用树莓派 5 做板载电脑，采集相机和电机数据，策略在笔记本或 GPU 上推理后把动作发回。","related":["微控制器","Arduino / ESP32 开发板","嵌入式系统","ROS 2","LeKiwi 移动底盘机械臂","策略服务器"]},{"id":"compute-control-integration","category":"hardware","sec":8,"tier":3,"sources":[{"title":"地瓜机器人发布首款单SoC算控一体化机器人开发套件（36氪）","url":"https://eu.36kr.com/zh/p/3333355053115910"},{"title":"RDK S100 开发套件（地瓜机器人开发者社区）","url":"https://developer.d-robotics.cc/rdks100"}],"as_of":"2025-06","related_ids":["braincerebellum-architecture","d-robotics-rdk-s100","system-on-chip","microcontroller-unit","real-time-control","onboard-compute-platform"],"name":"算控一体","alt":"Compute-Control Integration","abbr":"","aliases":["算控一体化","大小脑一体"],"one_liner":"把 AI 推理算力和实时运动控制集成到同一颗芯片或同一块板上","explanation":"传统机器人常用两套硬件：一台算力平台跑感知和决策模型，另一块 MCU（微控制器）或运动控制板负责毫秒级的关节控制，两者经网线或总线通信。算控一体指把两者集成到同一颗 SoC（片上系统）或同一块主板上：高性能 CPU/NPU 做「大脑」的模型推理，片内的实时核做「小脑」的运动控制。好处是减少板间通信延迟、线束、成本和功耗；难点是保证控制任务的实时性和功能安全不被 AI 任务干扰。地瓜机器人 RDK S100 等产品以此为卖点。","example":"地瓜 RDK S100 在单颗 SoC 上集成 6 核 Cortex-A78AE CPU、80 TOPS 的 BPU 和 4 核 Cortex-R52+ MCU（据官方发布）。","related":["大脑-小脑架构（大小脑）","地瓜 RDK S100","片上系统（SoC）","微控制器","实时控制","主控"]},{"id":"d-robotics-rdk-s100","category":"hardware","sec":8,"tier":3,"sources":[{"title":"RDK S100 开发套件 - 地瓜机器人开发者社区","url":"https://developer.d-robotics.cc/rdks100"},{"title":"80 TOPS算力、大小脑超级异构！地瓜机器人RDK S100开启预售 - 量子位","url":"https://www.qbitai.com/2025/06/292932.html"}],"as_of":"2025-06","related_ids":["onboard-compute-platform","compute-control-integration","nvidia-jetson","nvidia-jetson-orin","d-robotics","neural-processing-unit"],"name":"地瓜 RDK S100","alt":"D-Robotics RDK S100","abbr":"","aliases":["RDK S100P","RDK S100 开发套件"],"one_liner":"地瓜机器人推出的单芯片「算控一体」机器人开发套件，80 TOPS 起","explanation":"RDK S100 是地平线旗下地瓜机器人在 2025 年 6 月发布的机器人开发套件，主打把 AI 推理和电机实时控制放进同一颗 SoC（片上系统）：6 核 Cortex-A78AE CPU 跑系统和规划，自研 Nash 架构 BPU（神经网络加速单元）提供 80 TOPS 算力跑视觉、VLA 等模型，另有 4 核 Cortex-R52+ MCU 负责关节级实时控制。高配版 S100P 为 128 TOPS、24GB 内存。它要解决的是机器人上「大脑用一块板、小脑再用一块板」带来的通信延迟和成本问题。发布时预售价据报道为 2499 元，定位对标英伟达 Jetson Orin 一类的边缘主控。","example":"开发者可在同一块 RDK S100 上用 BPU 跑感知模型、用板上 MCU 通过 CAN 直接驱动机械臂关节。","related":["主控","算控一体","英伟达 Jetson","Jetson Orin","地瓜机器人","神经网络处理器（NPU / BPU）"]},{"id":"robot-controller","category":"hardware","sec":8,"tier":2,"sources":[{"title":"Industrial robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Industrial_robot"}],"as_of":"","related_ids":["teach-pendant","industrial-robot","servo-motor","integrated-drive-and-control","rtde","libfranka-franka-control-interface"],"name":"机器人控制器","alt":"Robot Controller","abbr":"","aliases":["控制柜","控制器","控制箱"],"one_liner":"机械臂配套的控制箱，里面是运动控制计算机、伺服驱动和安全电路。","explanation":"机器人控制器在工业机器人里通常是一个独立的控制柜或控制箱，内部装有运动控制计算机、各关节伺服驱动器、电源、安全回路和 I/O 接口，外接示教器。它负责解析程序、做正逆运动学和轨迹插补，把每个关节的目标交给伺服驱动闭环执行，同时处理急停、碰撞检测、限位等安全功能。工业机器人四大家族都有自家控制器，协作机器人把控制箱做得更小，一些新产品还把驱动集成进关节（驱控一体）。做具身智能研究时，策略一般不直接驱动电机，而是通过控制器的接口（如 UR 的 RTDE、Franka 的 libfranka）高频发送目标位姿或关节指令，由控制器负责底层跟踪和安全保护。","example":"用 UR 协作臂做 VLA 实验时，工作站上的策略通过 RTDE 接口把关节目标发给 UR 控制箱，控制箱再驱动六个关节电机，急停和安全限制也由它负责。","related":["示教器","工业机器人","伺服电机","驱控一体","RTDE","libfranka"]},{"id":"teach-pendant","category":"hardware","sec":8,"tier":3,"sources":[{"title":"Teach pendant - Wikipedia","url":"https://en.wikipedia.org/wiki/Teach_pendant"}],"as_of":"","related_ids":["teach-and-playback-programming","industrial-robot","emergency-stop","robot-controller","kinesthetic-teaching","offline-programming"],"name":"示教器","alt":"Teach Pendant","abbr":"TP","aliases":["示教盒"],"one_liner":"工业机械臂配的手持操作终端，用来点动、示教和编写运动程序。","explanation":"示教器是连在机器人控制柜上的手持终端，带屏幕、按键或触摸屏，还有急停按钮和使能开关（三段式，松开或按死都会停机）。操作员用它点动关节或末端到目标位置并记录下来，拼成程序，之后机器人按程序重复执行，这就是「示教再现」。它是发那科、ABB、库卡等工业机器人最传统的编程方式。协作机械臂常改用平板式示教器或拖动示教；做具身智能研究时，示教器多用来回零、改参数和紧急停机。","example":"操作员用示教器把机械臂点动到工件上方，记为一个路点，再依次记录几个点，组成一段搬运程序。","related":["示教再现","工业机器人","急停","机器人控制器","拖动示教","离线编程"]},{"id":"industrial-pc","category":"hardware","sec":8,"tier":2,"sources":[{"title":"Industrial PC - Wikipedia","url":"https://en.wikipedia.org/wiki/Industrial_PC"}],"as_of":"","related_ids":["host-computer","lower-level-controller","robot-controller","programmable-logic-controller","ethercat-master","nvidia-jetson"],"name":"工控机","alt":"Industrial PC","abbr":"IPC","aliases":["工业计算机","工业控制计算机"],"one_liner":"为工厂等恶劣环境加固过的电脑。","explanation":"工控机是按工业标准加固的计算机，内部架构和普通 PC 基本相同（多为 x86，跑 Windows 或 Linux），但在外壳、散热、供电和接口上做了强化：常见无风扇散热、宽电压输入、防尘抗振、耐高低温，并带多路串口、CAN、网口等工业接口，能长时间不间断运行。在机器人上，它常作为上位机或机器人控制器的核心，运行 ROS、运动规划、视觉或 EtherCAT 主站。和 Jetson 这类嵌入式 AI 板卡相比，工控机通用性好、扩展强，但体积和功耗一般更大。","example":"AGV / AMR 底盘里装一台无风扇工控机，运行 ROS 导航并通过 CAN 总线控制电机驱动器。","related":["上位机","下位机","机器人控制器","PLC（可编程逻辑控制器）","EtherCAT 主站","英伟达 Jetson"]},{"id":"programmable-logic-controller","category":"hardware","sec":8,"tier":3,"sources":[{"title":"Programmable logic controller - Wikipedia","url":"https://en.wikipedia.org/wiki/Programmable_logic_controller"}],"as_of":"","related_ids":["industrial-robot","robot-controller","ethercat","host-computer","lower-level-controller","real-time-control"],"name":"PLC（可编程逻辑控制器）","alt":"Programmable Logic Controller","abbr":"PLC","aliases":["可编程控制器"],"one_liner":"工厂里控制设备动作和产线逻辑的专用工业计算机","explanation":"PLC 是为工业现场设计的专用计算机，按固定扫描周期循环工作：读取输入（传感器、按钮、限位开关），执行用户程序，刷新输出（继电器、电磁阀、电机驱动器）。它诞生于 1960 年代末，为了替代汽车厂里复杂的继电器柜；编程语言由 IEC 61131-3 标准规定，最常见的是梯形图。它可靠、抗干扰、能连续运行多年。机器人进工厂时，整条产线的节拍和联锁一般由 PLC 管，机械臂控制器通过 I/O 信号或工业总线与 PLC「握手」，具身智能机器人落地产线同样要和现有 PLC 对接。","example":"PLC 检测到工件到位后给机械臂发「开始」信号，机械臂抓完回一个「完成」信号，PLC 再启动下一段传送带。","related":["工业机器人","机器人控制器","EtherCAT 总线","上位机","下位机","实时控制"]},{"id":"gpu-memory","category":"hardware","sec":8,"tier":2,"sources":[{"title":"Video random-access memory - Wikipedia","url":"https://en.wikipedia.org/wiki/Video_random-access_memory"},{"title":"openpi - Physical Intelligence (GitHub)","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"","related_ids":["parameter-count","lora","post-training-quantization","gradient-checkpointing","batch-size","on-device-edge-deployment"],"name":"GPU 显存","alt":"GPU Memory (VRAM)","abbr":"VRAM","aliases":["显存"],"one_liner":"显卡自带的内存，决定能装下多大的模型和批量。","explanation":"GPU 显存是显卡上独立的高速内存，模型参数、梯度、优化器状态、中间激活值和输入数据都要放在里面才能被 GPU 计算。显存大小直接决定能训练或推理多大的模型、批大小（一次喂进去的样本数）能开多大。训练比推理吃显存得多，因为还要存梯度和优化器状态。显存不够时常见办法有：降低数值精度（如 BF16、INT8 量化）、LoRA 只训练少量参数、梯度检查点、多卡分摊。对具身智能来说，它决定了一个 VLA 模型能否在实验室的显卡上微调，以及能否塞进机器人上的端侧芯片。","example":"openpi 文档给出的参考：π0 推理需 8 GB 以上显存，LoRA 微调约 22.5 GB 以上，全参数微调约 70 GB 以上。","related":["参数量","低秩适配","训练后量化","梯度检查点（激活重计算）","批大小","端侧部署"]},{"id":"common-training-and-inference-gpus","category":"hardware","sec":8,"tier":2,"sources":[{"title":"openpi README（Hardware Requirements）","url":"https://github.com/Physical-Intelligence/openpi"},{"title":"NVIDIA DGX B200 User Guide: Introduction","url":"https://docs.nvidia.com/dgx/dgxb200-user-guide/introduction-to-dgxb200.html"}],"as_of":"2026-09","related_ids":["gpu-memory","nvidia-jetson","lora","full-fine-tuning","numerical-precision-formats","autodl"],"name":"常用 GPU 型号（RTX 4090 / A100 / H100 / B200）","alt":"Common Training / Inference GPUs (RTX 4090 / A100 / H100 / B200)","abbr":"","aliases":["4090","A100","H100","B200"],"one_liner":"训练和部署具身模型最常见的几款英伟达显卡，差别主要在显存和算力","explanation":"这是具身智能论文和代码仓库里最常出现的几款英伟达 GPU。RTX 4090（Ada 架构，24 GB 显存）是消费级游戏卡，常用来做单机推理和小规模微调；A100（Ampere 架构，40 / 80 GB）和 H100（Hopper 架构，80 GB，支持 FP8）是数据中心卡，多卡互联后用于预训练和全参数微调；B200（Blackwell 架构）单卡显存最高约 180 GB，8 卡的 DGX B200 合计约 1.4 TB 显存。选卡先看显存，它决定能放下多大的模型和批大小，再看算力、支持的数值精度和卡间互联带宽。机器人本体上跑模型一般用 Jetson 这类端侧芯片，而不是这些卡。","example":"openpi 仓库给出的参考：π0 推理需要 8 GB 以上显存、LoRA 微调需要 22.5 GB 以上，RTX 4090 都够用；全参数微调需要 70 GB 以上，要用 A100 80GB 或 H100。","related":["GPU 显存","英伟达 Jetson","低秩适配","全参数微调","数值精度格式（FP32 / BF16 / FP16 / FP8 / INT8）","AutoDL（GPU 算力租用平台）"]},{"id":"battery-runtime","category":"hardware","sec":9,"tier":1,"sources":[{"title":"Unitree G1 官方产品页","url":"https://www.unitree.com/g1"}],"as_of":"2026-09","related_ids":["battery-management-system","hot-swappable-battery","autonomous-battery-swapping","autonomous-docking-and-recharging","humanoid-robot"],"name":"续航","alt":"Battery Endurance / Runtime","abbr":"","aliases":["电池续航","续航时间"],"one_liner":"机器人充满一次电能连续工作多长时间。","explanation":"续航指机器人在一块电池（或一次充满电）下能持续运行的时间，受电池容量、整机重量、电机效率和任务强度共同影响：同一台机器人站着不动和连续行走、搬重物时差别很大。人形机器人因为要一直维持平衡、关节多，续航普遍只有几个小时，是走进工厂和家庭的主要瓶颈之一。常见解法有增大电池、降低功耗、做热插拔电池（不关机换电）、自主回充或自主换电。读厂商参数时要注意它是在什么工况下测的。","example":"宇树 G1 人形机器人官网标称续航约 2 小时。","related":["电池管理系统","热插拔电池","自主换电","自主回充","人形机器人"]},{"id":"hot-swappable-battery","category":"hardware","sec":9,"tier":2,"sources":[{"title":"Hot swapping - Wikipedia","url":"https://en.wikipedia.org/wiki/Hot_swapping"}],"as_of":"","related_ids":["battery-runtime","battery-management-system","autonomous-battery-swapping","autonomous-docking-and-recharging","humanoid-robot"],"name":"热插拔电池","alt":"Hot-Swappable Battery","abbr":"","aliases":["快拆电池","快换电池"],"one_liner":"不用关机或拆螺丝就能快速换下的电池。","explanation":"热插拔电池指设备可以在不断电或只做短暂停机的情况下，把电池快速拔下、换上满电的一块，一般靠卡扣或导轨设计，不需要工具。严格的「热插拔」要求换电时系统不掉电（例如有两块电池轮换或内置备用电源）；很多机器人宣传的「快拆电池」只是拆装快，换时仍要关机，两者要区分。人形和四足机器人续航通常只有一到几个小时，靠快速换电才能连续工作或连续采数据，因此它是机器人从演示走向实际部署的一项工程细节。更进一步是机器人自己去换电站换电（自主换电）。","example":"宇树 G1 等机器人采用快拆电池，数据采集时可以换电后继续作业。","related":["续航","电池管理系统","自主换电","自主回充","人形机器人"]},{"id":"autonomous-battery-swapping","category":"hardware","sec":9,"tier":2,"sources":[{"title":"UBTECH Walker S2 产品页","url":"https://www.ubtrobot.com/en/humanoid/products/walker-s2"},{"title":"CnEVPost: UBTech shows how its humanoid robot can work 24/7 with autonomous battery swap","url":"https://cnevpost.com/2025/07/17/ubtech-humanoid-robot-autonomous-battery-swap/"}],"as_of":"2025-07","related_ids":["autonomous-docking-and-recharging","hot-swappable-battery","battery-runtime","battery-management-system","ubtech-walker-s2"],"name":"自主换电","alt":"Autonomous Battery Swapping","abbr":"","aliases":["自主换电池","自动换电"],"one_liner":"机器人电量不足时自己走到换电站、把电池换掉，不用人插手","explanation":"自主换电指机器人在电量不足时自己去换电站，把耗尽的电池取下、装上满电电池，全程不需要人工，换完继续干活。和充电相比，它省掉了几小时的等待，让机器人可以接近全天连续工作，是人形机器人进工厂做产线任务时绕不开的问题。实现上需要可快速插拔的电池结构（常配合双电池或备用电源保证换电时不断电）、精确的定位和手眼协调。2025 年优必选发布的 Walker S2 宣称可在约 3 分钟内用双臂自主更换自身电池。","example":"优必选 Walker S2 在产线上电量低时走到换电柜前，用双臂拔下背后的电池、插入满电电池，全程不停机。","related":["自主回充","热插拔电池","续航","电池管理系统","优必选 Walker S2"]},{"id":"autonomous-docking-and-recharging","category":"hardware","sec":9,"tier":2,"sources":[{"title":"Wikipedia: Robotic vacuum cleaner","url":"https://en.wikipedia.org/wiki/Robotic_vacuum_cleaner"},{"title":"Wikipedia: Charging station","url":"https://en.wikipedia.org/wiki/Charging_station"}],"as_of":"","related_ids":["autonomous-battery-swapping","battery-runtime","wireless-charging","robot-vacuum-cleaner","apriltag","navigation"],"name":"自主回充","alt":"Autonomous Docking and Recharging","abbr":"","aliases":["自动回充","自主充电"],"one_liner":"机器人电量低时自己找回充电桩并对准接口充上电","explanation":"自主回充指机器人在电量低或任务结束时，自己导航回到充电桩、对准触点或插头完成充电，充满后再出发。扫地机器人最早把它普及开，如今四足、巡检机器人和移动底盘也基本标配。难点在最后几厘米的对准：通常靠红外信标、二维码或 AprilTag 等标记、激光雷达轮廓匹配来精确定位。和自主换电相比，回充结构简单、成本低，但充电期间机器人无法工作。","example":"扫地机器人清扫结束或电量不足时，会自己回到底座充电，充满后回到中断的位置继续清扫。","related":["自主换电","续航","无线充电","扫地机器人","AprilTag","导航"]},{"id":"wireless-charging","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Inductive charging - Wikipedia","url":"https://en.wikipedia.org/wiki/Inductive_charging"}],"as_of":"","related_ids":["autonomous-docking-and-recharging","battery-runtime","battery-management-system","autonomous-battery-swapping","automated-guided-vehicle"],"name":"无线充电","alt":"Wireless (Inductive) Charging","abbr":"","aliases":["感应充电","Inductive Charging"],"one_liner":"不插线、靠电磁感应隔空给电池充电的方式","explanation":"无线充电是利用电磁感应（或磁共振）让发射线圈和接收线圈之间传递电能，不需要物理插头接触的充电方式，手机和电动牙刷上很常见。对机器人来说，自主充电时要精确对准插口很难，插拔触点还会磨损、进灰或受潮；无线充电只要求机器人停到大致位置，对定位精度要求更低，也便于做防水密封。代价是传输效率通常低于有线充电，功率受限、会发热。它常用于扫地机器人、AGV、巡检机器人的自主回充，也是移动机器人实现长时间无人值守运行的一种方案。","example":"仓储 AGV 停到地面的充电板上方，由地板下的发射线圈给车载电池补电，无需人工插线。","related":["自主回充","续航","电池管理系统","自主换电","自动导引车"]},{"id":"battery-management-system","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Battery management system - Wikipedia","url":"https://en.wikipedia.org/wiki/Battery_management_system"}],"as_of":"","related_ids":["battery-runtime","hot-swappable-battery","autonomous-battery-swapping","solid-state-battery","controller-area-network","regenerative-braking-and-brake-resistor"],"name":"电池管理系统","alt":"Battery Management System","abbr":"BMS","aliases":[],"one_liner":"监测保护电池组、估算剩余电量的电路和软件","explanation":"电池管理系统是装在电池包里的一套电路和软件，实时采集每节电芯的电压、电流和温度，据此估算剩余电量（SOC）和健康状态（SOH），在过充、过放、过流、过温时切断回路，并做电芯均衡，让各节电芯电量保持一致。移动机器人靠锂电池供电，关节电机瞬间的大电流和制动时的回灌电流都会冲击电池，BMS 决定了电量读数准不准、会不会突然断电以及电池寿命。它通常经 CAN 等总线把电量和告警上报给主控，热插拔电池和自主换电也依赖它确认电池状态。","example":"机器人 App 里显示的剩余电量百分比，就是 BMS 估算后经总线上报的结果。","related":["续航","热插拔电池","自主换电","固态电池","CAN 总线","再生制动与泄放电阻（泄放模块）"]},{"id":"solid-state-battery","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Solid-state battery - Wikipedia","url":"https://en.wikipedia.org/wiki/Solid-state_battery"}],"as_of":"","related_ids":["battery-runtime","battery-management-system","hot-swappable-battery","autonomous-battery-swapping","humanoid-robot"],"name":"固态电池","alt":"Solid-State Battery","abbr":"","aliases":["全固态电池"],"one_liner":"用固体电解质替代液态电解液的锂电池。","explanation":"固态电池把传统锂离子电池里的液态电解液换成固体电解质（氧化物、硫化物或聚合物），理论上更不容易起火，也更容易搭配锂金属负极来提高能量密度。人形机器人机身空间和重量都紧张，续航普遍只有几小时，所以能量密度更高、更安全的电池被看作延长续航的方向之一。全固态电池的大规模量产仍在推进中，市面上常说的「半固态」电池仍含少量液态电解质；各家对「固态」的口径不一，看宣传时要分清。","example":"","related":["续航","电池管理系统","热插拔电池","自主换电","人形机器人"]},{"id":"wire-harness","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Cable harness - Wikipedia","url":"https://en.wikipedia.org/wiki/Cable_harness"}],"as_of":"","related_ids":["hollow-shaft-cable-routing","slip-ring","joint-actuator-module","ethercat","controller-area-network"],"name":"线束","alt":"Wire Harness","abbr":"","aliases":["线缆束","Cable Harness"],"one_liner":"把机器人里的电源线、信号线捆扎成束并配好接插件的布线组件","explanation":"线束是把多根电源线、通信线、编码器信号线按固定走向捆在一起，两端压好接插件的组件，汽车和机器人都大量使用。人形机器人有几十个关节，每个关节模组都要供电并接入总线（如 EtherCAT、CAN），线要穿过不停转动的关节，反复弯折和扭转容易磨损、断线或接触不良，是整机故障的常见来源。因此设计时要考虑线束走向、弯曲半径和固定方式，常配合中空走线（线从关节中心孔穿过）或滑环（让线穿过无限旋转的关节）来减少缠绕。线束的布置也会影响关节能转多大角度和整机装配效率。","example":"人形机器人的手臂线束通常沿关节中心的空心轴穿过，从肩部一路走到腕部和灵巧手。","related":["中空走线","滑环","关节模组","EtherCAT 总线","CAN 总线"]},{"id":"hollow-shaft-cable-routing","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Slip ring - Wikipedia","url":"https://en.wikipedia.org/wiki/Slip_ring"}],"as_of":"","related_ids":["joint-actuator-module","wire-harness","slip-ring","strain-wave-gear","frameless-torque-motor"],"name":"中空走线","alt":"Hollow-Shaft Cable Routing","abbr":"","aliases":["中空轴走线","内走线"],"one_liner":"让线缆从关节电机和减速器的中心孔里穿过去的走线方式。","explanation":"中空走线指关节模组的电机转子、减速器和编码器都做成空心结构，中间留一个通孔，供电线、通信线、气管从关节内部穿到下一节，而不是挂在外面。好处是外观整洁、线缆不会被缠绕或刮扯、也减少了卡住人手的风险，对需要贴近人工作的协作臂和人形机器人很重要。代价是电机和减速器得做大一圈，孔径和线缆弯折寿命要一起设计；线缆在孔里会随关节扭转，所以关节转角有上限。需要无限旋转的场合则改用滑环。谐波减速器常见的「中空型」型号就是为此设计的。","example":"很多协作机械臂外表看不到一根线，就是线缆全部从各关节中心孔里穿过去。","related":["关节模组","线束","滑环","谐波减速器","无框力矩电机"]},{"id":"slip-ring","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Slip ring - Wikipedia","url":"https://en.wikipedia.org/wiki/Slip_ring"}],"as_of":"","related_ids":["hollow-shaft-cable-routing","wire-harness","joint-actuator-module","revolute-joint","ethercat"],"name":"滑环","alt":"Slip Ring","abbr":"","aliases":["导电滑环","旋转电连接器"],"one_liner":"让旋转部件和固定部件之间持续供电、传信号的旋转电接头。","explanation":"滑环由随轴一起转的导电环和固定不动的电刷组成，电刷压在环上滑动接触，把电源、编码器信号或总线数据跨过旋转面传过去。它解决的是「关节要无限圈连续转动，线缆却会缠绕、扭断」的问题。机器人里常用于需要连续回转的部位，比如云台、转台和部分腰部或腕部回转关节；转角有限的机械臂关节更常用中空走线。滑环有磨损和接触噪声，传高速信号要选专门的型号。","example":"能无限圈旋转的监控云台，靠滑环给相机供电并把视频信号传回底座。","related":["中空走线","线束","关节模组","转动关节","EtherCAT 总线"]},{"id":"pose-repeatability","category":"hardware","sec":9,"tier":2,"sources":[{"title":"Industrial robot - Wikipedia（Repeatability 与 ISO 9283 小节）","url":"https://en.wikipedia.org/wiki/Industrial_robot"}],"as_of":"","related_ids":["absolute-positioning-accuracy","industrial-robot","teach-and-playback-programming","kinematic-calibration","hand-eye-calibration","collaborative-robot"],"name":"重复定位精度","alt":"Pose Repeatability","abbr":"","aliases":["重复精度","位姿重复性"],"one_liner":"让机器人反复去同一个点，每次落点之间差多少。","explanation":"重复定位精度衡量机器人多次执行同一指令、到达同一目标位姿时，实际落点彼此之间有多一致，通常写成「±0.05 mm」这种形式。国际标准 ISO 9283 规定了测量方法：让机器人从同一方向反复到达同一位置，统计落点的离散程度。它不同于绝对定位精度：后者看机器人按坐标去一个点时离真实目标有多远，一般比重复精度差得多，要靠运动学标定改善。传统工业机器人多用示教再现，同一个点反复去，所以最看重重复精度；按视觉算出的坐标去抓东西时，绝对精度和手眼标定误差更关键。","example":"规格表写重复定位精度 ±0.1 mm 的机械臂，示教好的点能稳定回到 0.1 mm 以内；但按相机算出的坐标去一个新位置，误差可能大得多，那是绝对定位精度的问题。","related":["绝对定位精度","工业机器人","示教再现","运动学标定","手眼标定","协作机器人"]},{"id":"ingress-protection-rating","category":"hardware","sec":9,"tier":3,"sources":[{"title":"IP code - Wikipedia","url":"https://en.wikipedia.org/wiki/IP_code"}],"as_of":"","related_ids":["quadruped-robot","inspection-robot","industrial-robot","joint-actuator-module","mean-time-between-failures"],"name":"IP 防护等级","alt":"Ingress Protection Rating","abbr":"IP","aliases":["IP67","IP54","IP 代码"],"one_liner":"国际标准里衡量设备防尘、防水能力的两位数等级。","explanation":"IP 防护等级由国际电工委员会标准 IEC 60529 定义，写成「IP」加两位数字。第一位表示防固体异物（含粉尘）的能力，0 到 6，6 为完全防尘；第二位表示防水能力，0 到 9，数字越大越能扛水，例如 4 是防溅水，7 是短时浸水。某一项没测就用 X 代替，如 IPX7。机器人产品页上常写的 IP54 大致意思是防尘、防溅水，IP67 是完全防尘并能短时泡水。它决定了机器人能不能在户外、雨天、工厂油污或需要冲洗的环境里用，四足、巡检机器人和食品行业机械臂都很看重这项指标。","example":"户外巡检四足机器人标 IP67，意味着淋雨、蹚浅水坑一般没问题。","related":["四足机器人","巡检机器人","工业机器人","关节模组","平均无故障时间"]},{"id":"payload-to-weight-ratio","category":"hardware","sec":9,"tier":3,"sources":[{"title":"UR5e - Universal Robots","url":"https://www.universal-robots.com/products/ur5e/"}],"as_of":"","related_ids":["payload","torque-density","lightweighting","robotic-arm","collaborative-robot","power-density"],"name":"负载自重比","alt":"Payload-to-Weight Ratio","abbr":"","aliases":["自重负载比"],"one_liner":"机器人能搬的重量和它自身重量之比，越高说明越轻越有劲。","explanation":"负载自重比是额定负载除以机器人（通常指机械臂或整机）自身重量，用来衡量结构是否轻、驱动是否强。也有人反过来写成自重负载比，读数时要看清分子分母。这个比值受电机扭矩密度、减速器、结构材料共同影响：想提高它，就要用更高功率密度的关节、镁合金或碳纤维等轻量化材料。对固定在桌面的机械臂，它主要影响安装和成本；对人形、四足或装在移动底盘上的机械臂更关键，因为手臂每重一公斤，腿、底盘和电池都要多扛一公斤，续航随之变短。比较时还要注意厂商给的是额定负载还是峰值负载、在什么臂展和速度下测得。","example":"一台自重 20 kg、额定负载 5 kg 的协作臂，负载自重比为 1:4。","related":["负载","扭矩密度","轻量化（镁合金 / 碳纤维）","机械臂","协作机器人","功率密度"]},{"id":"lightweighting","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Magnesium alloy - Wikipedia","url":"https://en.wikipedia.org/wiki/Magnesium_alloy"},{"title":"Carbon-fiber reinforced polymers - Wikipedia","url":"https://en.wikipedia.org/wiki/Carbon-fiber-reinforced_polymers"}],"as_of":"","related_ids":["replacing-steel-with-engineering-plastics","payload-to-weight-ratio","moment-of-inertia","battery-runtime","polyether-ether-ketone","torque-density"],"name":"轻量化（镁合金 / 碳纤维）","alt":"Lightweighting (Magnesium Alloy / Carbon Fiber)","abbr":"","aliases":["轻量化设计"],"one_liner":"用镁合金、碳纤维、工程塑料等轻材料给机器人本体减重。","explanation":"轻量化指在保证强度和刚度的前提下降低机器人结构件的重量，常用材料有镁合金（密度约为铝合金的三分之二）、碳纤维复合材料（比强度高，适合做杆件和外壳）以及 PEEK 等工程塑料。对腿足和人形机器人来说，减重的收益会层层放大：四肢越轻，转动惯量越小，关节电机需要的扭矩越低，续航更长，摔倒或碰到人时冲击也更小。代价是材料和加工成本更高，镁合金要做防腐处理，碳纤维件不便修补。它常和以塑代钢、负载自重比、续航一起讨论。","example":"把机械腿的铝合金小腿换成碳纤维管，可以减轻腿部远端重量，让髋、膝关节在快速摆腿时更省力。","related":["以塑代钢","负载自重比","转动惯量","续航","PEEK","扭矩密度"]},{"id":"replacing-steel-with-engineering-plastics","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Polyether ether ketone - Wikipedia","url":"https://en.wikipedia.org/wiki/Polyether_ether_ketone"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"以塑代钢","alt":"Replacing Steel with Engineering Plastics","abbr":"","aliases":["以塑代金属"],"one_liner":"用 PEEK 等工程塑料替代金属做机器人结构件和传动件，减重降本","explanation":"以塑代钢指用 PEEK（聚醚醚酮）、POM、纤维增强尼龙、碳纤维复合材料等工程塑料，替代钢、铝做结构件和部分传动件，如外壳、骨架、齿轮、轴承保持架。人形机器人追求轻量化和量产降本，这条路线因此受关注，据报道特斯拉 Optimus 等项目在评估 PEEK 部件，带动了相关概念股。好处是密度远低于钢、可注塑批量成型；代价是刚度、耐热性和抗蠕变（长期受力下缓慢变形）不如金属，往往需要重新设计结构，不能简单替换。","example":"把关节外壳从铝合金改成碳纤维增强 PEEK 注塑件，零件更轻，也能一次成型，不用 CNC 逐件加工。","related":["PEEK(Polyether Ether Ketone)","轻量化（镁合金 / 碳纤维）(Lightweighting (Magnesium Alloy / Carbon Fiber))","BOM 成本(Bill of Materials Cost)","量产(Mass Production)","人形机器人(Humanoid Robot)"]},{"id":"polyether-ether-ketone","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Polyether ether ketone - Wikipedia","url":"https://en.wikipedia.org/wiki/Polyether_ether_ketone"}],"as_of":"","related_ids":["replacing-steel-with-engineering-plastics","lightweighting","speed-reducer-gearbox","strain-wave-gear","core-components"],"name":"PEEK","alt":"Polyether Ether Ketone","abbr":"PEEK","aliases":["聚醚醚酮","PEEK 材料"],"one_liner":"耐高温、高强度的特种工程塑料，被看好用于机器人减重","explanation":"PEEK 即聚醚醚酮，一种半结晶的特种工程塑料，熔点约 343°C，强度、耐磨性和耐化学腐蚀都好，密度约 1.3 g/cm³，只有钢的约六分之一，长期用在航空、医疗植入物和汽车零件上。人形机器人关节多、要轻，行业里把 PEEK 看作「以塑代钢」的候选材料，用来做齿轮、轴承保持架、减速器部分零件和结构件，以减轻重量、降低运动部件的惯量。主要障碍是原料和加工成本高，承受大载荷的核心传动件目前仍以金属为主。","example":"","related":["以塑代钢","轻量化（镁合金 / 碳纤维）","减速器","谐波减速器","核心零部件"]},{"id":"3d-printing","category":"hardware","sec":9,"tier":2,"sources":[{"title":"Wikipedia: 3D printing","url":"https://en.wikipedia.org/wiki/3D_printing"},{"title":"Wikipedia: Fused filament fabrication","url":"https://en.wikipedia.org/wiki/Fused_filament_fabrication"}],"as_of":"","related_ids":["open-source-hardware","so-100-so-101-arm","leap-hand","universal-manipulation-interface","gripper","cad-software"],"name":"3D 打印（FDM / 光固化）","alt":"3D Printing (FDM / Resin SLA)","abbr":"","aliases":["增材制造","FDM","SLA","光固化打印"],"one_liner":"一层层堆材料直接做出零件，实验室快速做夹爪、支架的主力工具","explanation":"3D 打印是按层堆叠材料直接做出零件的增材制造方法。FDM（熔融沉积成型）把 PLA、PETG、尼龙等塑料丝加热挤出、一层层堆起来，便宜、适合做结构件；光固化（SLA / LCD）用光照射液态树脂逐层固化，表面细腻、精度高，但零件偏脆。具身智能实验室常用它快速做夹爪指尖、相机支架、手持采集器外壳和开源机械臂零件，改一版设计当天就能装上验证。很多开源硬件都直接提供可打印的模型文件，配合舵机或电机就能组装。","example":"LeRobot 的 SO-100 / SO-101 机械臂和 UMI 手持夹爪，结构件都是用桌面 FDM 打印机打出来的。","related":["开源硬件","SO-100 / SO-101 机械臂","LEAP Hand","通用操作接口","夹爪","CAD 建模软件（SolidWorks / Onshape / Fusion 360）"]},{"id":"open-source-hardware","category":"hardware","sec":9,"tier":2,"sources":[{"title":"Open Source Hardware Definition | OSHWA","url":"https://www.oshwa.org/definition/"},{"title":"Open-source hardware - Wikipedia","url":"https://en.wikipedia.org/wiki/Open-source_hardware"},{"title":"TheRobotStudio/SO-ARM100 - GitHub","url":"https://github.com/TheRobotStudio/SO-ARM100"}],"as_of":"2026-09","related_ids":["so-100-so-101-arm","aloha","leap-hand","berkeley-humanoid-lite","lerobot","3d-printing"],"name":"开源硬件","alt":"Open-source Hardware","abbr":"OSHW","aliases":["开源机器人硬件"],"one_liner":"公开图纸、物料清单和固件，允许任何人复制改造的硬件。","explanation":"开源硬件指设计资料公开、并按许可证允许他人学习、修改、制造甚至销售的硬件。公开内容一般包括 CAD 模型、电路原理图和 PCB、物料清单（BOM）、装配说明和固件。常用定义来自开源硬件协会（OSHWA），许可证有 CERN OHL 等。在具身智能领域，开源硬件大大降低了入门门槛：ALOHA、SO-100/SO-101 机械臂、LEAP Hand、Berkeley Humanoid Lite、ToddlerBot 等都公开了图纸和代码，实验室和个人可以用 3D 打印件加现成电机自己组装，别的团队也能复现论文、共享同一种本体采集的数据。","example":"SO-101 机械臂由 TheRobotStudio 开源，用 3D 打印结构件和飞特 STS3215 舵机组装，配合 Hugging Face 的 LeRobot 就能遥操作采数据、训练策略。","related":["SO-100 / SO-101 机械臂","ALOHA 双臂平台","LEAP Hand","伯克利 Humanoid Lite","LeRobot","3D 打印（FDM / 光固化）"]},{"id":"exoskeleton","category":"hardware","sec":9,"tier":2,"sources":[{"title":"Powered exoskeleton - Wikipedia","url":"https://en.wikipedia.org/wiki/Powered_exoskeleton"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"外骨骼","alt":"Exoskeleton","abbr":"","aliases":["外骨骼机器人","Powered Exoskeleton"],"one_liner":"穿戴在人身上、关节与人体对应的机械结构，可助力也可用来采集动作。","explanation":"外骨骼是穿在人体外面、关节位置和人体关节对应的机械装置。带电机的动力外骨骼可以给人助力，用于康复训练、帮行动不便者行走、减轻工人搬运负担；不带动力、只装编码器的被动外骨骼，则能精确记录人的关节角度。后一种在具身智能里很重要：做成和机器人手臂同构（关节数、比例一致）的外骨骼，人穿上做动作，读数可以直接映射成机器人关节指令，用于遥操作和采集演示数据，比视觉动捕更准、延迟更低。部分外骨骼还带力反馈，让操作者感到机器人碰到的阻力。","example":"AirExo 用低成本外骨骼遥操作双臂机器人；HOMIE 用同构外骨骼驾驶舱控制人形机器人上半身。","related":["外骨骼遥操作(Exoskeleton Teleoperation)","AirExo 外骨骼(AirExo)","HOMIE(HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit)","遥操作(Teleoperation)","主从臂遥操作(Leader-Follower Teleoperation)","动作捕捉(Motion Capture)"]},{"id":"vr-headset","category":"hardware","sec":9,"tier":2,"sources":[{"title":"Virtual reality headset - Wikipedia","url":"https://en.wikipedia.org/wiki/Virtual_reality_headset"}],"as_of":"","related_ids":["vr-teleoperation","teleoperation","apple-vision-pro","meta-quest-3-pico-4-ultra-xr-headsets","open-television","motion-retargeting"],"name":"VR 头显","alt":"VR Headset","abbr":"","aliases":["XR 头显","MR 头显"],"one_liner":"戴在头上的虚拟 / 混合现实设备，具身里常用来遥操作机器人。","explanation":"VR 头显是戴在头上、给双眼显示画面并追踪头部运动的设备，新款大多同时支持透视看真实环境（混合现实，所以也叫 XR / MR 头显）。在具身智能里它的主要用途是遥操作采数据：头显追踪操作者的头、手腕和手指姿态，映射成机器人动作；机器人头部相机的画面再实时传回头显，让操作者像站在机器人位置上一样干活。相比主从臂，头显便宜、上手快，还能控制灵巧手，常见型号有 Apple Vision Pro、Meta Quest 3、PICO 4 Ultra。","example":"Open-TeleVision 用 Apple Vision Pro 追踪操作者的手，并把机器人双目相机画面实时传回头显，遥操作人形机器人完成操作任务。","related":["VR 遥操作","遥操作","Apple Vision Pro","Meta Quest 3 / PICO 4 Ultra 头显","Open-TeleVision","动作重定向"]},{"id":"meta-quest-3-pico-4-ultra-xr-headsets","category":"hardware","sec":9,"tier":3,"sources":[{"title":"Meta Quest 3 - Wikipedia","url":"https://en.wikipedia.org/wiki/Meta_Quest_3"},{"title":"unitreerobotics/xr_teleoperate - GitHub","url":"https://github.com/unitreerobotics/xr_teleoperate"}],"as_of":"2026-09","related_ids":["vr-teleoperation","vr-headset","apple-vision-pro","unitree-xr-teleoperate","xrobotoolkit","motion-retargeting"],"name":"Meta Quest 3 / PICO 4 Ultra 头显","alt":"Meta Quest 3 / PICO 4 Ultra XR Headsets","abbr":"","aliases":["Quest 3","PICO 4 Ultra","XR 头显"],"one_liner":"两款常被拿来做机器人遥操作的消费级混合现实头显。","explanation":"Meta Quest 3 是 Meta 在 2023 年推出的混合现实头显，PICO 4 Ultra 是字节跳动旗下 PICO 在 2024 年推出的同类产品。两者都自带头部定位、手势追踪、手柄追踪和彩色透视摄像头，价格远低于 Apple Vision Pro。在具身智能里，它们主要用作低成本 VR 遥操作设备：头显把操作者的头部位姿、手部关键点或手柄位姿实时发给机器人，经动作重定向变成关节指令；机器人头部相机的画面再传回头显，让操作者身临其境地干活，同时记录下演示数据。","example":"宇树开源的 xr_teleoperate 支持用 Quest 3、PICO 4 Ultra 等 XR 设备遥操作宇树 G1 人形机器人及其灵巧手。","related":["VR 遥操作","VR 头显","Apple Vision Pro","宇树 xr_teleoperate（XR 遥操作）","XRoboToolkit","动作重定向"]},{"id":"rigid-body","category":"mechanics","sec":0,"tier":2,"sources":[{"title":"Wikipedia: Rigid body","url":"https://en.wikipedia.org/wiki/Rigid_body"},{"title":"Modern Robotics (Lynch & Park), Ch.2 Degrees of Freedom of a Rigid Body","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["rigid-body-dynamics","pose","degrees-of-freedom","link","rigid-body-simulation","deformable-body-simulation"],"name":"刚体","alt":"Rigid Body","abbr":"","aliases":["刚性物体"],"one_liner":"受力后内部任意两点距离都不变、完全不变形的理想化物体。","explanation":"刚体是经典力学的理想化模型：无论受多大的力，物体内部任意两点之间的距离都保持不变，也就是完全不变形。现实中没有真正的刚体，但金属连杆、杯子、积木这类形变很小的物体都可以这样近似。这样做的好处是描述极简：三维空间里一个刚体的状态只需 6 个数，3 个表示参考点（通常取质心）的位置，3 个表示朝向（可用旋转矩阵、四元数或欧拉角），即 6 个自由度。机器人学的建模几乎都建立在它上面：机械臂的每根连杆、被抓取的物体、MuJoCo 或 Isaac Sim 里的 body 都按刚体处理；布料、绳子、面团这类会明显变形的物体则需要软体仿真。","example":"仿真里夹爪夹起一个方块，只要记录它的 3 维位置加 1 个四元数（共 7 个数，对应 6 个自由度）就完全确定了它的位姿；一件 T 恤却需要成百上千个网格顶点才能描述。","related":["刚体动力学","位姿","自由度","连杆","刚体仿真","软体仿真"]},{"id":"degrees-of-freedom","category":"mechanics","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Degrees of freedom (mechanics)","url":"https://en.wikipedia.org/wiki/Degrees_of_freedom_(mechanics)"},{"title":"Unitree G1 官网规格","url":"https://www.unitree.com/g1"}],"as_of":"2026-09","related_ids":["active-dof-passive-dof","kinematic-redundancy","revolute-joint","configuration-space","joint-space","underactuation"],"name":"自由度","alt":"Degrees of Freedom","abbr":"DoF","aliases":["DOF","自由度数"],"one_liner":"确定系统各部分位置所需的最少独立变量数，机器人里常指能独立运动的关节数。","explanation":"自由度是完整确定一个机械系统构型（系统上每一点在哪）所需的最少独立参数个数。空间中一个自由刚体有 6 个自由度：沿 x、y、z 平移，加绕三根轴旋转。机器人每个转动或移动关节通常贡献 1 个自由度，所以有「六轴机械臂」「7 自由度机械臂」的说法。6 个自由度是让末端在空间中任意摆放位置和朝向的最低数量；多出来的叫冗余自由度，同一个末端位姿可对应无数组关节角，可用来绕开障碍。人的手臂（肩 3、肘 1、腕 3）就是 7 自由度。厂商标的总自由度常把灵巧手手指算进去，对比时要看清口径。","example":"据宇树官网，G1 基础版共 23 个自由度（单腿 6、单臂 5、腰 1），EDU 版加装灵巧手等部件后为 23–43 个。","related":["主动自由度 / 被动自由度","运动学冗余","转动关节","构型空间","关节空间","欠驱动"]},{"id":"coordinate-frame","category":"mechanics","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Frame of reference","url":"https://en.wikipedia.org/wiki/Frame_of_reference"},{"title":"ROS REP 103: Standard Units of Measure and Coordinate Conventions","url":"https://raw.githubusercontent.com/ros-infrastructure/rep/master/rep-0103.rst"}],"as_of":"","related_ids":["world-frame","base-frame","camera-coordinate-frame","coordinate-transformation","tf-tf2-transform-tree","pose"],"name":"坐标系","alt":"Coordinate Frame","abbr":"","aliases":["参考系","参考坐标系","Reference Frame","frame"],"one_liner":"规定了原点和坐标轴朝向的参照，用来描述位置和方向。","explanation":"坐标系（机器人领域常叫 frame）由一个原点和三根互相垂直的坐标轴构成，位置用 (x, y, z) 三个数表示，朝向用相对各轴的旋转表示。同一个点在不同坐标系下数值不同，所以任何位置、速度、力都要说明「在哪个坐标系下」。一台机器人身上有很多坐标系：世界坐标系固定在环境里，基坐标系固定在底座，每个连杆、相机、夹爪也各有一个。物理学里的参考系还涉及观察者的运动状态，但机器人工程中两个词常混用。ROS 规定一律用右手坐标系，并用 TF 坐标树管理坐标系之间的关系。","example":"相机测得杯子在相机坐标系下位于镜头正前方 0.6 米，而机械臂需要杯子在基坐标系下的位置，两者要通过坐标变换换算。","related":["世界坐标系","基坐标系","相机坐标系","坐标变换","TF 坐标树","位姿"]},{"id":"right-handed-frame-and-axis-conventions","category":"mechanics","sec":0,"tier":2,"sources":[{"title":"REP 103: Standard Units of Measure and Coordinate Conventions","url":"https://github.com/ros-infrastructure/rep/blob/master/rep-0103.rst"},{"title":"Isaac Sim Documentation: Conventions Reference","url":"https://docs.isaacsim.omniverse.nvidia.com/latest/reference_material/reference_conventions.html"},{"title":"glTF 2.0 Specification: Coordinate System and Units","url":"https://github.com/KhronosGroup/glTF/blob/main/specification/2.0/Specification.adoc"}],"as_of":"","related_ids":["coordinate-frame","coordinate-transformation","camera-coordinate-frame","tf-tf2-transform-tree","rep-105","quaternion-component-order"],"name":"右手坐标系与轴向约定","alt":"Right-handed Frame & Axis Conventions (ROS REP 103: x forward / y left / z up; Z-up vs Y-up; camera optical frame)","abbr":"","aliases":["右手定则","REP 103","Z-up / Y-up","相机光学坐标系","Camera Optical Frame","ENU"],"one_liner":"约定 x、y、z 怎么排、哪个轴朝上；各软件不统一，换算出错很常见。","explanation":"右手坐标系指 x、y、z 满足右手定则：右手拇指、食指、中指分别指向 x、y、z，即 x 叉乘 y 得 z；绕某轴的正向转动，是右手握轴、拇指指向正方向时四指弯曲的方向。ROS 的 REP 103（2010 年起草）规定本体坐标系 x 朝前、y 朝左、z 朝上，地理坐标用东-北-天（ENU）；相机另设带 _optical 后缀的光学坐标系，z 朝前、x 朝右、y 朝下。另一个分歧是哪个轴朝上：ROS、MuJoCo、Isaac Sim 默认 Z 朝上，glTF 规定 Y 朝上；USD 相机 -Z 朝前、+Y 朝上，与 ROS 光学系差一个绕 x 轴 180° 的旋转。导入网格、动捕数据或点云前不对齐这些约定，就会出现模型躺倒、左右镜像、点云倒置。","example":"深度相机给出的点云在光学坐标系里 z 朝前；若直接当成本体坐标系（x 朝前、z 朝上）使用，桌上的物体会像被转了 90° 一样立到空中，必须先乘一个固定旋转，把 camera_optical 系转到 camera_link 系。","related":["坐标系","坐标变换","相机坐标系","TF 坐标树","REP 105 坐标系约定（map / odom / base_link）","四元数分量顺序约定（wxyz / xyzw）"]},{"id":"world-frame","category":"mechanics","sec":0,"tier":1,"sources":[{"title":"Modern Robotics (Lynch & Park, 2017), Ch.3 Rigid-Body Motions","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"},{"title":"ROS REP 105: Coordinate Frames for Mobile Platforms","url":"https://raw.githubusercontent.com/ros-infrastructure/rep/master/rep-0105.rst"},{"title":"MuJoCo Documentation: Modeling","url":"https://mujoco.readthedocs.io/en/stable/modeling.html"}],"as_of":"","related_ids":["coordinate-frame","base-frame","body-frame","camera-extrinsics","coordinate-transformation","rep-105"],"name":"世界坐标系","alt":"World Frame","abbr":"","aliases":["世界系","全局坐标系","固定坐标系","空间坐标系","Space Frame","Fixed Frame"],"one_liner":"整个场景共用、固定不动的参考坐标系，所有位置都可换算到它下面。","explanation":"世界坐标系是固定在环境里、不随机器人运动的参考系，《Modern Robotics》称为固定系或空间系 {s}，可以设在房间一角或桌面上。机器人系统里还有基坐标系（固定在底座）、机体坐标系（跟着身体动）、相机坐标系等，各传感器的测量先落在各自坐标系下，要经坐标变换统一到同一个参考系（通常就是世界坐标系）才能放在一起规划。仿真器里通常有显式的世界根节点，如 MuJoCo 的 worldbody；ROS 的 REP 105 把 map 定为固定在世界的坐标系，z 轴朝上。固定底座的机械臂，代码里常直接把基坐标系当世界坐标系。","example":"桌面抓取时把世界坐标系原点设在桌面、z 轴朝上：相机看到杯子后，先用相机外参把杯子坐标从相机坐标系换算到世界坐标系，机械臂再据此规划抓取。","related":["坐标系","基坐标系","机体坐标系","相机外参","坐标变换","REP 105 坐标系约定（map / odom / base_link）"]},{"id":"base-frame","category":"mechanics","sec":0,"tier":1,"sources":[{"title":"ROS REP 105: Coordinate Frames for Mobile Platforms","url":"https://raw.githubusercontent.com/ros-infrastructure/rep/master/rep-0105.rst"},{"title":"ROS REP 103: Standard Units of Measure and Coordinate Conventions","url":"https://raw.githubusercontent.com/ros-infrastructure/rep/master/rep-0103.rst"},{"title":"libfranka robot_state.h（O_T_EE: end effector pose in base frame）","url":"https://raw.githubusercontent.com/frankarobotics/libfranka/main/include/franka/robot_state.h"}],"as_of":"","related_ids":["world-frame","coordinate-frame","end-effector-pose","coordinate-transformation","tf-tf2-transform-tree","body-frame"],"name":"基坐标系","alt":"Base Frame","abbr":"","aliases":["基座坐标系","机器人基坐标系","base_link"],"one_liner":"固定在机器人底座上的坐标系，机械臂末端的位置和朝向多以它为参照。","explanation":"基坐标系是刚性固定在机器人底座上的参考坐标系，原点位置和轴朝向由厂商规定，ROS 约定 x 朝前、y 朝左、z 朝上。机械臂控制器报出的末端位置和姿态，默认都是相对它说的，比如 Franka 的接口把末端位姿记为 O_T_EE，即「末端在基坐标系 O 下的位姿」；ROS 里通常叫 base_link。它和世界坐标系的区别是：机械臂装在移动底盘或人形身上时，基坐标系跟着机器人一起动，世界坐标系则固定在环境里。采集数据时动作按哪个坐标系记录必须写清，否则换一台机器就对不上。","example":"桌上一台固定机械臂，指令「末端移到基坐标系下 (0.5, 0, 0.3) 米」，按 x 朝前、z 朝上的约定，就是底座正前方 0.5 米、高 0.3 米处。","related":["世界坐标系","坐标系","末端位姿","坐标变换","TF 坐标树","机体坐标系"]},{"id":"body-frame","category":"mechanics","sec":0,"tier":2,"sources":[{"title":"Modern Robotics（Lynch & Park, 2017 预印本）第 3 章 Rigid-Body Motions","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"isaaclab.envs.mdp API（base_lin_vel / projected_gravity 等观测）","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.envs.mdp.html"}],"as_of":"","related_ids":["world-frame","base-frame","coordinate-transformation","projected-gravity","pose","velocity-command-tracking"],"name":"机体坐标系","alt":"Body Frame","abbr":"","aliases":["本体坐标系","机身坐标系","体坐标系","{b}"],"one_liner":"固连在机器人身体上、随身体一起移动和转动的坐标系。","explanation":"机体坐标系（教材里常记作 {b}）是绑在刚体或机器人躯干上的坐标系，原点和三根轴随身体一起平移、转动；与之相对的是固定不动的世界坐标系。描述物体的位置和朝向，本质上就是给出机体系相对世界系的位姿；速度、力等量也都可以选在世界系或机体系里表达。腿足机器人的强化学习策略通常把观测放在机体系里：Isaac Lab 的 base_lin_vel、base_ang_vel 和 projected_gravity（重力方向在机体系中的投影，用来感知身体倾斜）都定义在机器人根坐标系下，这样策略不必关心机器人在世界里面朝哪边。","example":"让四足机器人「以 0.5 m/s 向前走」时，速度指令一般在机体系里给出，x 方向就是机身朝向的前方；无论机器人在世界里面朝东还是朝北，同一条指令都表示「往自己前面走」。","related":["世界坐标系","基坐标系","坐标变换","投影重力","位姿","速度指令跟踪"]},{"id":"pose","category":"mechanics","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Pose (computer vision)","url":"https://en.wikipedia.org/wiki/Pose_(computer_vision)"},{"title":"ROS 2 common_interfaces: geometry_msgs/msg/Pose.msg","url":"https://raw.githubusercontent.com/ros2/common_interfaces/rolling/geometry_msgs/msg/Pose.msg"}],"as_of":"","related_ids":["end-effector-pose","coordinate-frame","rotation-matrix","quaternion","homogeneous-transformation-matrix","6d-object-pose-estimation"],"name":"位姿","alt":"Pose","abbr":"","aliases":["6D位姿","6-DoF Pose","6D Pose","位置与姿态"],"one_liner":"物体在空间里的位置加朝向，三维中共 6 个自由度。","explanation":"位姿是「位置 + 姿态」的合称。三维空间里，位置用 x、y、z 三个坐标，姿态（朝向）再占三个转动自由度，合起来就是常说的 6D 位姿或 6-DoF 位姿。位姿一定是相对某个坐标系说的，同一个杯子在相机坐标系和世界坐标系里的数值不同。朝向可以用旋转矩阵、四元数、欧拉角等方式存储，位置和旋转也常合写成 4×4 的齐次变换矩阵。机器人抓取前常要先估计物体位姿，机械臂控制常以末端位姿为目标，VLA 模型输出的动作也常是末端位姿或它的增量。","example":"ROS 的 geometry_msgs/Pose 消息由 position（x, y, z，单位米）和 orientation（四元数 x, y, z, w）两部分组成，正好对应一个位姿。","related":["末端位姿","坐标系","旋转矩阵","四元数","齐次变换矩阵","6D位姿估计"]},{"id":"rotation-matrix","category":"mechanics","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Rotation matrix","url":"https://en.wikipedia.org/wiki/Rotation_matrix"},{"title":"Modern Robotics (Lynch & Park, 2017), 3.2.1 Rotation Matrices","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"}],"as_of":"","related_ids":["special-orthogonal-group-so","homogeneous-transformation-matrix","quaternion","axis-angle-representation","6d-rotation-representation","coordinate-transformation"],"name":"旋转矩阵","alt":"Rotation Matrix","abbr":"","aliases":["方向余弦矩阵","Direction Cosine Matrix","DCM"],"one_liner":"用行列式为 1 的 3×3 正交矩阵表示三维旋转，乘上向量就把它转过去。","explanation":"旋转矩阵是描述三维朝向最基础的方式。3×3 矩阵 R 的三列，分别是物体自身坐标系的 x、y、z 轴在参考坐标系里的方向（单位向量），每个元素等于两根轴夹角的余弦，所以也叫方向余弦矩阵。它必须满足 RᵀR = I（各列互相垂直、长度为 1）且 det R = 1，所有这样的矩阵构成特殊正交群 SO(3)。9 个数里只有 3 个自由度，有冗余，但没有欧拉角那样的奇异点，运算也简单：把一个向量转过去就是用 R 左乘它，连续两次旋转就是矩阵相乘（顺序不能换），求逆只需转置。旋转矩阵加上平移，就是 4×4 的齐次变换矩阵。","example":"绕 z 轴转 θ 的旋转矩阵是 [[cosθ, −sinθ, 0], [sinθ, cosθ, 0], [0, 0, 1]]；θ = 90° 时，原来指向 x 方向的向量 (1, 0, 0) 被转到 (0, 1, 0)。","related":["特殊正交群 SO(3)","齐次变换矩阵","四元数","轴角","6D 旋转表示","坐标变换"]},{"id":"special-orthogonal-group-so","category":"mechanics","sec":0,"tier":2,"sources":[{"title":"Wikipedia: 3D rotation group","url":"https://en.wikipedia.org/wiki/3D_rotation_group"},{"title":"Modern Robotics (Lynch & Park), Ch.3 Rigid-Body Motions (Definitions 3.1, 3.13)","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Wikipedia: Euclidean group","url":"https://en.wikipedia.org/wiki/Euclidean_group"}],"as_of":"","related_ids":["rotation-matrix","lie-group","exponential-map","skew-symmetric-matrix","homogeneous-transformation-matrix","6d-rotation-representation"],"name":"特殊正交群 SO(3)","alt":"Special Orthogonal Group SO(3)","abbr":"SO(3)","aliases":["三维旋转群","SO3","特殊欧氏群 SE(3)","Special Euclidean Group SE(3)","特殊欧几里得群","SE3","刚体运动群","李代数","Lie Algebra","so(3)","se(3)"],"one_liner":"三维空间所有旋转构成的集合，元素是行列式为 1 的正交矩阵。","explanation":"SO(3) 是三维空间中所有旋转构成的群，元素是满足 RᵀR=I（Rᵀ 为转置，I 为单位阵，即正交）且 det R=1（行列式为 1，排除镜像）的 3×3 旋转矩阵。两个旋转相乘仍是旋转，但顺序不能交换。它是一个 3 维的弯曲空间（流形）而非普通向量空间，旋转不能直接相加或取平均，这正是四元数、6D 表示、球面插值等方法存在的原因。把平移也并进来就得到特殊欧氏群 SE(3)，即用 4×4 齐次变换矩阵表示的刚体位姿，共 6 个自由度。二者都是李群，在单位元处的切空间叫李代数 so(3)、se(3)；so(3) 就是 3×3 反对称矩阵，与三维角速度向量一一对应，经指数映射可变回旋转。","example":"机械臂末端位姿是 SE(3) 中的一个 4×4 矩阵：左上 3×3 是 SO(3) 旋转，右上一列是位置。神经网络直接回归 9 个数得到的矩阵一般不满足 RᵀR=I，需要用 SVD 或 Gram-Schmidt 正交化投影回 SO(3)。","related":["旋转矩阵","李群","指数映射","反对称矩阵","齐次变换矩阵","6D 旋转表示"]},{"id":"coordinate-transformation","category":"mechanics","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Transformation matrix（Affine transformations / homogeneous coordinates）","url":"https://en.wikipedia.org/wiki/Transformation_matrix"},{"title":"ROS REP 105: Coordinate Frames for Mobile Platforms","url":"https://raw.githubusercontent.com/ros-infrastructure/rep/master/rep-0105.rst"},{"title":"Modern Robotics（Lynch & Park）Ch.3 Rigid-Body Motions","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"}],"as_of":"","related_ids":["homogeneous-transformation-matrix","rotation-matrix","tf-tf2-transform-tree","hand-eye-calibration","camera-extrinsics","forward-kinematics"],"name":"坐标变换","alt":"Coordinate Transformation","abbr":"","aliases":["坐标系变换","Frame Transformation","刚体变换","位姿变换"],"one_liner":"把点或位姿在一个坐标系下的数值，换算成另一个坐标系下的数值。","explanation":"坐标变换回答「A 坐标系下的这个点，在 B 坐标系下是多少」。两个坐标系之间差一个旋转加一个平移：p_B = R·p_A + t，R 是 3×3 旋转矩阵，表示 A 系相对 B 系的朝向；t 是平移向量，即 A 系原点在 B 系下的坐标。实践中常把 R 和 t 拼成 4×4 齐次变换矩阵 T，这样平移也能写成矩阵乘法，多段变换直接连乘，如 T_base_obj = T_base_cam · T_cam_obj。机器人里处处要用：相机看到的物体要换到基坐标系才能去抓；正运动学就是沿关节逐段连乘变换矩阵。ROS 用 TF 库维护和查询这些变换。","example":"相机固定在机器人外部时，手眼标定得到相机在基坐标系下的位姿 T_base_cam，视觉模型给出杯子在相机坐标系下的位置，两者相乘就得到杯子在基坐标系下的位置，机械臂据此规划抓取。","related":["齐次变换矩阵","旋转矩阵","TF 坐标树","手眼标定","相机外参","正运动学"]},{"id":"homogeneous-transformation-matrix","category":"mechanics","sec":0,"tier":2,"sources":[{"title":"Modern Robotics 3.3.1: Homogeneous Transformation Matrices (Northwestern)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/3-3-1-homogeneous-transformation-matrices/"},{"title":"Modern Robotics (Lynch & Park) preprint PDF","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["rotation-matrix","coordinate-transformation","pose","forward-kinematics","hand-eye-calibration","tf-tf2-transform-tree"],"name":"齐次变换矩阵","alt":"Homogeneous Transformation Matrix","abbr":"","aliases":["齐次变换","4×4 变换矩阵","刚体变换","Rigid Transformation","SE(3) 矩阵"],"one_liner":"把旋转和平移合成一个 4×4 矩阵，描述一个坐标系相对另一个的位姿。","explanation":"齐次变换矩阵 T 是机器人学描述位姿的标准写法：左上 3×3 是旋转矩阵 R（朝向），右上 3×1 是平移向量 p（位置），最后一行固定为 [0 0 0 1]。所有这样的矩阵构成特殊欧氏群 SE(3)。补上最后一行，把点写成 [x, y, z, 1]，旋转加平移就能用一次矩阵乘法完成。它有三种用法：表示坐标系 {b} 在 {s} 下的位姿 T_sb；换参考系，按下标相消 T_sc = T_sb·T_bc 串起来；对坐标系或物体做平移旋转。正运动学就是把各关节的变换依次相乘，得到末端相对基座的位姿；ROS 的 TF 坐标树存的也是它。注意矩阵乘法不可交换，左乘和右乘含义不同。","example":"相机装在机械臂手腕上：已知基座到末端的 T_base_ee 和末端到相机的 T_ee_cam（手眼标定得到），相乘得到 T_base_cam，就能把相机看到的点换算到基座坐标系下去抓。","related":["旋转矩阵","坐标变换","位姿","正运动学","手眼标定","TF 坐标树"]},{"id":"projected-gravity","category":"mechanics","sec":0,"tier":2,"sources":[{"title":"Isaac Lab API: isaaclab.envs.mdp (projected_gravity)","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.envs.mdp.html"},{"title":"legged_gym (ETH RSL): legged_robot.py","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"},{"title":"unitree_rl_gym: deploy_real.py","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/deploy/deploy_real/deploy_real.py"}],"as_of":"","related_ids":["proprioception","inertial-measurement-unit","body-frame","quaternion","rl-based-locomotion-control","roll-pitch-yaw"],"name":"投影重力","alt":"Projected Gravity","abbr":"","aliases":["重力投影","投影重力向量","Projected Gravity Vector","projected_gravity","projected_gravity_b"],"one_liner":"把竖直向下的重力方向换到机器人机体坐标系下表示，告诉策略身体歪了多少。","explanation":"投影重力是足式和人形机器人强化学习中几乎必备的观测量：取世界坐标系下的单位重力方向 (0, 0, −1)，用躯干（基座）姿态四元数的逆旋转换到机体坐标系下表示。机器人站直时它等于 (0, 0, −1)；身体前倾或侧倾时 x、y 分量变为非零，大小反映俯仰和横滚的程度。它只包含倾斜信息、不含朝向（偏航角），而偏航角对保持平衡没用、在真机上还会漂移，所以比直接输入四元数更干净。真机上由 IMU 估计的姿态算出。legged_gym、Isaac Lab 都把它放进观测，奖励函数也常用其 x、y 分量的平方来惩罚身体不水平。","example":"宇树 unitree_rl_gym 的真机部署脚本读取 IMU 四元数，算出投影重力放进观测的第 4–6 维，与角速度、速度指令、关节角等一起输入行走策略。","related":["本体感知","惯性测量单元","机体坐标系","四元数","强化学习运控","横滚-俯仰-偏航角"]},{"id":"euler-angles","category":"mechanics","sec":1,"tier":1,"sources":[{"title":"Wikipedia: Euler angles","url":"https://en.wikipedia.org/wiki/Euler_angles"},{"title":"Wikipedia: Gimbal lock","url":"https://en.wikipedia.org/wiki/Gimbal_lock"},{"title":"On the Continuity of Rotation Representations in Neural Networks（Zhou et al.）","url":"https://arxiv.org/abs/1812.07035"}],"as_of":"","related_ids":["roll-pitch-yaw","gimbal-lock","quaternion","rotation-matrix","intrinsic-vs-extrinsic-rotations","6d-rotation-representation"],"name":"欧拉角","alt":"Euler Angles","abbr":"","aliases":[],"one_liner":"用依次绕坐标轴转动的三个角度来描述物体朝向。","explanation":"欧拉角由瑞士数学家欧拉提出，用三次绕坐标轴的旋转描述刚体朝向，三个角常记作 α、β、γ 或 φ、θ、ψ。转动顺序共 12 种：首尾同轴的（如 Z-X-Z）是经典欧拉角，三轴各不相同的（如 Z-Y-X）叫 Tait-Bryan 角，常说的横滚、俯仰、偏航属于后者。绕随物体转动的轴旋转叫内旋，绕固定轴叫外旋。欧拉角直观好读，但顺序和内外旋约定不同，同一组数字代表的姿态就不同；某些角度下两根转轴重合会丢掉一个自由度，即万向节死锁。所以程序内部多用四元数或旋转矩阵，神经网络预测旋转常改用 6D 表示。","example":"一架飞机先转向 30°、再抬头 10°、机身不滚转，可以写成一组 Z-Y-X 顺序的欧拉角：偏航 30°、俯仰 10°、横滚 0°。","related":["横滚-俯仰-偏航角","万向节死锁","四元数","旋转矩阵","内旋与外旋","6D 旋转表示"]},{"id":"roll-pitch-yaw","category":"mechanics","sec":1,"tier":1,"sources":[{"title":"Modern Robotics (Lynch & Park, 2017), Appendix B.2 Roll–Pitch–Yaw Angles","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"},{"title":"ROS REP 103: Standard Units of Measure and Coordinate Conventions","url":"https://raw.githubusercontent.com/ros-infrastructure/rep/master/rep-0103.rst"},{"title":"Wikipedia: Aircraft principal axes","url":"https://en.wikipedia.org/wiki/Aircraft_principal_axes"}],"as_of":"","related_ids":["euler-angles","gimbal-lock","intrinsic-vs-extrinsic-rotations","rotation-matrix","quaternion","inertial-measurement-unit"],"name":"横滚-俯仰-偏航角","alt":"Roll-Pitch-Yaw","abbr":"RPY","aliases":["横滚角/俯仰角/偏航角","翻滚角","roll/pitch/yaw","RPY 角","Roll-Pitch-Yaw Angles"],"one_liner":"用绕 x、y、z 轴的三个转角描述朝向：横滚、俯仰、偏航。","explanation":"这组叫法来自航空航海：横滚（roll）绕前后轴侧倾，俯仰（pitch）绕左右轴抬头低头，偏航（yaw）绕竖直轴转向。ROS 的 REP 103 约定机体 x 朝前、y 朝左、z 朝上；RPY 指依次绕固定坐标系的 x、y、z 轴转 γ、β、α 三个角，旋转矩阵 R = Rz(α)·Ry(β)·Rx(γ)（Rz(α) 即绕 z 轴转 α），与 ZYX 欧拉角结果相同。它直观好调，URDF 的 rpy 属性就是这种写法。缺点是俯仰到 ±90° 时横滚和偏航耦合（万向节死锁），角度在 ±180° 处还会跳变，所以程序内部多用四元数。","example":"人形机器人的 IMU（惯性测量单元）常直接给出 roll、pitch、yaw：roll 或 pitch 的绝对值突然变大，说明身体在侧倒或前后倾倒，yaw 表示身体朝向哪个方向。","related":["欧拉角","万向节死锁","内旋与外旋","旋转矩阵","四元数","惯性测量单元"]},{"id":"intrinsic-vs-extrinsic-rotations","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Davenport chained rotations（Intrinsic / Extrinsic rotations）","url":"https://en.wikipedia.org/wiki/Davenport_chained_rotations"},{"title":"SciPy 文档：Rotation.from_euler（大写为内旋、小写为外旋）","url":"https://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.transform.Rotation.from_euler.html"},{"title":"Lynch & Park, Modern Robotics（2017）附录 B：ZYX 欧拉角与 roll-pitch-yaw 角","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["euler-angles","roll-pitch-yaw","rotation-matrix","gimbal-lock","coordinate-transformation","quaternion"],"name":"内旋与外旋","alt":"Intrinsic vs. Extrinsic Rotations","abbr":"","aliases":["动轴旋转 / 定轴旋转","内在旋转 / 外在旋转","欧拉角旋转顺序约定"],"one_liner":"连续旋转时每步绕跟着转的新轴（内旋），还是绕固定不动的原轴（外旋）。","explanation":"用三个角（欧拉角）描述姿态时，必须约定每一步绕哪根轴转。内旋绕物体自身坐标系的轴转，每转一步，后面要用的轴也跟着变；外旋始终绕固定的世界坐标系的轴转。两者可以互换：同样三个角，内旋按 Z→Y→X 的顺序做，等于外旋按 X→Y→Z 倒过来做，得到同一个旋转矩阵 R = Rz(α)Ry(β)Rx(γ)（Rz(α) 指绕 z 轴转 α 角的旋转矩阵，其余同理）。机器人里常说的 ZYX 欧拉角是内旋，横滚-俯仰-偏航角（RPY）多按外旋 XYZ 定义，所以两者数值相同。不同软件、数据集约定不一，读别人的姿态数据前要先确认是内旋还是外旋、轴顺序是什么。","example":"SciPy 的 Rotation.from_euler 用大写「ZYX」表示内旋、小写「zyx」表示外旋；同一组角度写成「XYZ」和「xyz」会得到不同姿态，一个大小写之差就能让机械臂末端转错方向。","related":["欧拉角","横滚-俯仰-偏航角","旋转矩阵","万向节死锁","坐标变换","四元数"]},{"id":"gimbal-lock","category":"mechanics","sec":1,"tier":2,"sources":[{"title":"Gimbal lock - Wikipedia","url":"https://en.wikipedia.org/wiki/Gimbal_lock"}],"as_of":"","related_ids":["euler-angles","roll-pitch-yaw","quaternion","6d-rotation-representation","rotation-matrix","singular-configuration"],"name":"万向节死锁","alt":"Gimbal Lock","abbr":"","aliases":["万向锁","框架自锁"],"one_liner":"用欧拉角表示旋转时，某个角转到 90° 使两根转轴重合、丢掉一个自由度。","explanation":"万向节死锁原本是机械问题：三层嵌套的万向支架转到某个角度时，两根转轴变得平行，平台就失去一个方向的转动能力。数学上用欧拉角或横滚-俯仰-偏航角描述姿态也有同样现象：俯仰角到 ±90° 时，偏航和横滚绕的是同一根轴，改哪个效果都一样，附近某些小转动无法用角度的小变化表达，插值和求导都会出现跳变。阿波罗 11 号的惯性测量单元就受此限制，按设计俯仰接近 85° 时平台会被冻结，需要人工把飞船转离该姿态。机器人里的应对是用四元数、旋转矩阵或 6D 旋转表示来存储和计算姿态，欧拉角只留给人看；训练策略时若直接回归欧拉角，也可能在奇异点附近学出不连续的动作。","example":"用横滚-俯仰-偏航角控制机械臂末端时，把俯仰调到 90° 后会发现，调偏航和调横滚都让夹爪绕同一根轴转，另一个方向的微小转动必须让三个角一起大幅跳变才能做到。","related":["欧拉角","横滚-俯仰-偏航角","四元数","6D 旋转表示","旋转矩阵","奇异位形"]},{"id":"quaternion","category":"mechanics","sec":1,"tier":1,"sources":[{"title":"Wikipedia: Quaternions and spatial rotation","url":"https://en.wikipedia.org/wiki/Quaternions_and_spatial_rotation"},{"title":"Wikipedia: Quaternion（History）","url":"https://en.wikipedia.org/wiki/Quaternion"},{"title":"ROS 2 common_interfaces: geometry_msgs/msg/Quaternion.msg","url":"https://raw.githubusercontent.com/ros2/common_interfaces/rolling/geometry_msgs/msg/Quaternion.msg"},{"title":"MuJoCo Documentation: Modeling（Frame orientations：quat 默认 1 0 0 0，实部在前）","url":"https://mujoco.readthedocs.io/en/stable/modeling.html"}],"as_of":"","related_ids":["rotation-matrix","euler-angles","gimbal-lock","quaternion-double-cover","spherical-linear-interpolation","quaternion-component-order"],"name":"四元数","alt":"Quaternion","abbr":"","aliases":["单位四元数","Unit Quaternion","姿态四元数"],"one_liner":"用 4 个数表示三维旋转，机器人软件里最常用的朝向格式。","explanation":"四元数由哈密顿（William Rowan Hamilton）在 1843 年提出，形式为 w + xi + yj + zk。长度为 1 的单位四元数可表示三维旋转：绕单位轴 u 转 θ 角，对应 q = (cos(θ/2), u·sin(θ/2))，前一项是实部 w，后三项是虚部 x、y、z。它没有欧拉角的万向节死锁（某些角度下丢掉一个转动自由度），又比 9 个数的旋转矩阵紧凑、插值平滑，ROS、MuJoCo 都用它存朝向。注意：q 和 −q 是同一个旋转；分量顺序各家不同，MuJoCo 是 wxyz，ROS 消息是 xyzw，混用是常见 bug。","example":"绕 z 轴转 90°：θ/2 = 45°，按 wxyz 写是 (0.707, 0, 0, 0.707)，填进 ROS 的 Quaternion 消息则是 x=0, y=0, z=0.707, w=0.707。","related":["旋转矩阵","欧拉角","万向节死锁","四元数双倍覆盖","球面线性插值","四元数分量顺序约定（wxyz / xyzw）"]},{"id":"quaternion-component-order","category":"mechanics","sec":1,"tier":2,"sources":[{"title":"Joan Solà, Quaternion kinematics for the error-state Kalman filter (arXiv:1711.02508)","url":"https://arxiv.org/abs/1711.02508"},{"title":"Isaac Lab: Migrating to Isaac Lab 3.0 (Quaternion Format)","url":"https://github.com/isaac-sim/IsaacLab/blob/develop/docs/source/migration/migrating_to_isaaclab_3-0.rst"},{"title":"SciPy: Rotation.from_quat","url":"https://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.transform.Rotation.from_quat.html"}],"as_of":"2026-09","related_ids":["quaternion","quaternion-double-cover","right-handed-frame-and-axis-conventions","coordinate-transformation","mujoco","nvidia-isaac-lab"],"name":"四元数分量顺序约定（wxyz / xyzw）","alt":"Quaternion Component Order Convention (scalar-first wxyz vs scalar-last xyzw; Hamilton vs JPL)","abbr":"","aliases":["标量在前 / 标量在后","Scalar-first / Scalar-last","wxyz","xyzw","Hamilton 约定","JPL 约定"],"one_liner":"四元数的实部 w 放第一位还是最后一位，各软件库并不统一。","explanation":"单位四元数用四个数表示旋转：实部 w 和虚部 x、y、z。分量顺序约定指存储时 w 放最前（wxyz，标量在前）还是最后（xyzw，标量在后），各软件并不统一：ROS 消息和 SciPy 默认 xyzw，MuJoCo 和 Isaac Sim Core 用 wxyz；Isaac Lab 2.x 用 wxyz，3.0 改为 xyzw 以对齐 Warp、PhysX 和 Newton。更深一层是 Hamilton 与 JPL 约定：据 Solà 的综述，Hamilton 定义 ij=k（右手），JPL 定义 ji=k（左手），同一组数字在两者下代表互逆的旋转；机器人领域多用 Hamilton，航天领域多用 JPL。拼接不同来源的数据时顺序弄错，程序照常运行但姿态全错，是新手常踩的坑。","example":"「不旋转」在 wxyz 下写作 (1, 0, 0, 0)，在 xyzw 下写作 (0, 0, 0, 1)。若把 ROS 录下的 (0, 0, 0, 1) 按 wxyz 读进 MuJoCo，会被当成绕 z 轴转 180° 的姿态，机器人一开场就朝反方向。","related":["四元数","四元数双倍覆盖","右手坐标系与轴向约定","坐标变换","MuJoCo","Isaac Lab"]},{"id":"spherical-linear-interpolation","category":"mechanics","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Slerp","url":"https://en.wikipedia.org/wiki/Slerp"},{"title":"SciPy: scipy.spatial.transform.Slerp","url":"https://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.transform.Slerp.html"}],"as_of":"","related_ids":["quaternion","quaternion-double-cover","trajectory-interpolation","special-orthogonal-group-so","geodesic-distance-on-so","euler-angles"],"name":"球面线性插值","alt":"Spherical Linear Interpolation","abbr":"SLERP","aliases":["Slerp","四元数插值","Quaternion Slerp"],"one_liner":"在两个旋转之间沿最短弧、以恒定角速度平滑过渡的插值方法。","explanation":"球面线性插值（Slerp）用来在两个旋转之间生成中间旋转，由 Ken Shoemake 在 1985 年的 SIGGRAPH 论文中引入计算机图形学。把单位四元数看作四维单位球面上的点，Slerp 沿连接两点的大圆弧前进：slerp(q₀,q₁;t) = [sin((1−t)Ω)/sinΩ]·q₀ + [sin(tΩ)/sinΩ]·q₁，其中 t 从 0 到 1 表示进度，Ω 是两个四元数之间的夹角。结果是绕固定轴、角速度恒定的转动。直接对四元数或欧拉角做线性插值会转速不均甚至绕远路；又因为 q 和 −q 表示同一个旋转，实现时若两者点积为负要先把一端取反，保证走短弧。机器人里常用于末端姿态轨迹插值、把低频策略输出插成高频控制指令、动捕数据重采样。","example":"策略以 10 Hz 输出末端目标姿态、底层控制器以 500 Hz 运行时，可以用 SciPy 的 Slerp 类在相邻两个姿态之间插出 50 个中间姿态，让末端匀速转过去。","related":["四元数","四元数双倍覆盖","轨迹插值","特殊正交群 SO(3)","旋转测地距离","欧拉角"]},{"id":"quaternion-double-cover","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Quaternions and spatial rotation","url":"https://en.wikipedia.org/wiki/Quaternions_and_spatial_rotation"},{"title":"Wikipedia: 3D rotation group（S³ 到 SO(3) 的二对一覆盖）","url":"https://en.wikipedia.org/wiki/3D_rotation_group"},{"title":"On the Continuity of Rotation Representations in Neural Networks (arXiv 1812.07035)","url":"https://arxiv.org/abs/1812.07035"}],"as_of":"","related_ids":["quaternion","6d-rotation-representation","spherical-linear-interpolation","geodesic-distance-on-so","special-orthogonal-group-so","quaternion-component-order"],"name":"四元数双倍覆盖","alt":"Quaternion Double Cover","abbr":"","aliases":["q 与 -q 等价","四元数符号歧义","Quaternion Sign Ambiguity","双覆盖"],"one_liner":"单位四元数 q 和 −q 表示同一个旋转，每个姿态都对应两个四元数。","explanation":"用单位四元数 q = (w, x, y, z) 表示旋转时，q 和 −q 得到完全相同的旋转矩阵：旋转公式对 q 是二次的，符号相互抵消。数学上，单位四元数组成的三维球面 S³ 到旋转群 SO(3) 是二对一映射（双倍覆盖），每个姿态对应球面上一对对径点。这在具身智能里是常见坑：同一个末端朝向在数据里可能时而是 q、时而是 −q，网络直接回归四元数并用普通 L2 损失，会把相同的姿态当成相差很大；衡量差异应该用 1 − |q₁·q₂|，或取 ‖q − q̂‖ 与 ‖q + q̂‖ 中较小者。做球面插值前若点积为负要先翻号，否则会绕远路。Zhou 等人（2019）进一步证明四维及以下的旋转表示都不连续，所以不少策略改用 6D 旋转表示。","example":"绕 z 轴转 90° 的四元数是 q = (0.707, 0, 0, 0.707)（w 在前）；−q = (−0.707, 0, 0, −0.707) 相当于多转一整圈 360°，姿态完全一样。常见的规范化做法是强制 w ≥ 0。","related":["四元数","6D 旋转表示","球面线性插值","旋转测地距离","特殊正交群 SO(3)","四元数分量顺序约定（wxyz / xyzw）"]},{"id":"6d-rotation-representation","category":"mechanics","sec":1,"tier":2,"sources":[{"title":"On the Continuity of Rotation Representations in Neural Networks (Zhou et al., CVPR 2019)","url":"https://arxiv.org/abs/1812.07035"},{"title":"real-stanford/diffusion_policy: rotation_transformer.py","url":"https://raw.githubusercontent.com/real-stanford/diffusion_policy/main/diffusion_policy/model/common/rotation_transformer.py"}],"as_of":"","related_ids":["rotation-matrix","quaternion","euler-angles","9d-rotation-representation","action-representation","diffusion-policy"],"name":"6D 旋转表示","alt":"6D Rotation Representation","abbr":"6D","aliases":["6D rotation","连续旋转表示","rotation_6d","Continuous 6D Rotation Representation"],"one_liner":"取旋转矩阵前两列共 6 个数表示旋转，适合神经网络学习。","explanation":"6D 旋转表示由 Zhou 等人在 CVPR 2019 论文《On the Continuity of Rotation Representations in Neural Networks》中提出。他们证明三维旋转在 4 维及以下欧氏空间里没有连续表示，欧拉角、四元数都有跳变（如 q 与 −q 是同一旋转），网络回归这类目标误差偏大；5 维、6 维中则存在连续表示。做法是只保留旋转矩阵前两列；还原时第一列归一化，第二列去掉沿第一列的分量再归一化，第三列取两者叉乘，类似 Gram-Schmidt 正交化。机器人学习里常用它表示末端朝向的动作或观测。","example":"Diffusion Policy 官方代码里的 RotationTransformer 默认把轴角转换成 rotation_6d，用来处理末端朝向。","related":["旋转矩阵","四元数","欧拉角","9D 旋转表示","动作表示","扩散策略"]},{"id":"9d-rotation-representation","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"An Analysis of SVD for Deep Rotation Estimation (arXiv 2006.14616, NeurIPS 2020)","url":"https://arxiv.org/abs/2006.14616"},{"title":"google-research/special_orthogonalization README","url":"https://github.com/google-research/google-research/tree/master/special_orthogonalization"},{"title":"On the Continuity of Rotation Representations in Neural Networks (arXiv 1812.07035)","url":"https://arxiv.org/abs/1812.07035"}],"as_of":"","related_ids":["6d-rotation-representation","rotation-matrix","quaternion","special-orthogonal-group-so","geodesic-distance-on-so","euler-angles"],"name":"9D 旋转表示","alt":"9D Rotation Representation (SVD Orthogonalization)","abbr":"","aliases":["SVD 正交化","9D rotation","对称正交化","Symmetric Orthogonalization"],"one_liner":"让网络直接输出 3×3 共 9 个数，再用 SVD 投影成最近的合法旋转矩阵。","explanation":"9D 旋转表示是神经网络预测三维旋转的一种输出方式：网络输出 9 个无约束实数排成 3×3 矩阵 M，做奇异值分解 M = UΣVᵀ，取 R = U·diag(1, 1, det(UVᵀ))·Vᵀ，就得到离 M 最近的旋转矩阵（det 项保证它不是镜像）。Levinson 等人在 NeurIPS 2020 论文 An Analysis of SVD for Deep Rotation Estimation 中系统论证了它：几乎处处光滑，不像四元数、欧拉角会跳变；输入带噪声时，重建误差的期望约为 6D 表示所用 Gram-Schmidt 正交化的一半；在点云对齐、物体位姿、逆运动学等多个任务上达到当时最好水平。需要网络直接回归物体或末端姿态时，它和 6D 表示是替代四元数、欧拉角的常见选择。","example":"论文官方仓库给的实现只有十来行：把形状为 [batch, 9] 的网络输出重排成 3×3，做 SVD，按 det(UVᵀ) 修正最后一列的符号，得到 [batch, 3, 3] 的旋转矩阵，可以直接接在任何回归网络末尾端到端训练。","related":["6D 旋转表示","旋转矩阵","四元数","特殊正交群 SO(3)","旋转测地距离","欧拉角"]},{"id":"geodesic-distance-on-so","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Zhou et al., On the Continuity of Rotation Representations in Neural Networks（geodesic error 定义）","url":"https://arxiv.org/abs/1812.07035"}],"as_of":"","related_ids":["special-orthogonal-group-so","rotation-matrix","quaternion-double-cover","6d-rotation-representation","6d-object-pose-estimation","euler-angles"],"name":"旋转测地距离","alt":"Geodesic Distance on SO(3)","abbr":"","aliases":["测地误差","旋转角度误差","角距离","Angular Distance","Geodesic Error"],"one_liner":"两个姿态之间最少还要转多少度，是衡量旋转误差的标准度量。","explanation":"旋转测地距离指在旋转群 SO(3)（所有三维旋转构成的集合）上两个旋转之间的最短「路程」，数值上就是把一个姿态转到另一个姿态所需的最小旋转角，范围 0 到 π（180°）。对旋转矩阵 R₁、R₂，先算相对旋转 R₁ᵀR₂，再取 θ = arccos((tr(R₁ᵀR₂) − 1)/2)，tr 是矩阵对角线元素之和；用单位四元数 q₁、q₂ 时可写成 θ = 2·arccos(|q₁·q₂|)，取绝对值是因为 q 和 −q 表示同一个旋转。直接比较欧拉角或四元数分量的差会被表示方式误导，测地距离只看实际差了多少角度。6D 物体位姿估计、旋转表示研究（如 Zhou 等人提出 6D 旋转表示的论文）都用它报告「测地误差」，也可以直接当作训练损失。","example":"R₁ 为单位阵、R₂ 绕 z 轴转 90°：tr(R₂) = 0+0+1 = 1，θ = arccos(0) = 90°。又如偏航角 179° 和 −179°，数值差 358°，测地距离只有 2°。","related":["特殊正交群 SO(3)","旋转矩阵","四元数双倍覆盖","6D 旋转表示","6D位姿估计","欧拉角"]},{"id":"axis-angle-representation","category":"mechanics","sec":1,"tier":2,"sources":[{"title":"Axis–angle representation - Wikipedia","url":"https://en.wikipedia.org/wiki/Axis%E2%80%93angle_representation"},{"title":"scipy.spatial.transform.Rotation.as_rotvec - SciPy Manual","url":"https://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.transform.Rotation.as_rotvec.html"},{"title":"Controllers - robosuite documentation","url":"https://robosuite.ai/docs/modules/controllers.html"}],"as_of":"","related_ids":["rotation-matrix","quaternion","euler-angles","rodrigues-rotation-formula","exponential-map","6d-rotation-representation"],"name":"轴角","alt":"Axis-Angle Representation","abbr":"","aliases":["旋转向量","Rotation Vector","rotvec","轴-角表示","Euler vector"],"one_liner":"用「绕哪根轴转、转多少角度」来表示一次三维旋转。","explanation":"轴角表示用一个单位向量 e（旋转轴方向）和一个角度 θ（绕该轴转过的弧度）来描述三维旋转，依据是任何旋转都等价于绕某根固定轴的一次转动。把两者相乘得到三维的旋转向量 θe：方向是转轴，长度是转角，只用 3 个数，SciPy 里叫 rotvec。它和旋转矩阵之间用罗德里格斯公式互相换算，数学上就是 SO(3) 指数映射的坐标。缺点是不唯一：θ 加减 2π，或把轴和角同时取反，都表示同一个旋转，θ 接近 0 或 π 时换算要特殊处理。因为维度低、小角度时平滑，它常被用作机械臂末端姿态增量的动作表示。","example":"robosuite 的 OSC_POSE 控制器动作是 6 维（不含夹爪），后 3 维就是相对当前末端姿态的旋转增量，用轴角 (ax, ay, az) 表示；绕 z 轴转 90° 写作 (0, 0, 1.571)。","related":["旋转矩阵","四元数","欧拉角","罗德里格斯公式","指数映射","6D 旋转表示"]},{"id":"rodrigues-rotation-formula","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Rodrigues' rotation formula","url":"https://en.wikipedia.org/wiki/Rodrigues%27_rotation_formula"},{"title":"Wikipedia: Olinde Rodrigues","url":"https://en.wikipedia.org/wiki/Olinde_Rodrigues"}],"as_of":"","related_ids":["axis-angle-representation","rotation-matrix","skew-symmetric-matrix","exponential-map","special-orthogonal-group-so","product-of-exponentials-formula"],"name":"罗德里格斯公式","alt":"Rodrigues' Rotation Formula","abbr":"","aliases":["罗德里格旋转公式","罗德里格斯旋转公式","欧拉有限旋转公式"],"one_liner":"已知旋转轴和转角，直接算出三维旋转矩阵的公式。","explanation":"罗德里格斯公式以法国数学家 Olinde Rodrigues 命名（他在 1840 年发表了相关结果），也有学者认为应归功于欧拉。它回答一个问题：绕单位向量 k 表示的轴转 θ 角，对应的旋转矩阵是什么。矩阵形式为 R = I + sinθ·K + (1−cosθ)·K²，其中 I 是 3×3 单位矩阵，K 是 k 的反对称矩阵（K 乘任意向量 v 等于叉乘 k×v）。它把轴角表示（用一根轴加一个角描述旋转）换成旋转矩阵，本质上是旋转群 SO(3) 上指数映射的闭式解：exp(θK) 的无穷级数正好化简成这三项。机器人里用得很多，比如用指数积公式算正运动学、把轴角形式的动作转成姿态；OpenCV 里把旋转向量转成旋转矩阵的函数就叫 cv2.Rodrigues。","example":"绕 z 轴（k = (0,0,1)）转 90°：sin90° = 1，cos90° = 0，代入得 R = I + K + K²，算出来把 x 轴方向 (1,0,0) 转到 y 轴方向 (0,1,0)，和直觉一致。","related":["轴角","旋转矩阵","反对称矩阵","指数映射","特殊正交群 SO(3)","指数积公式"]},{"id":"skew-symmetric-matrix","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Skew-symmetric matrix","url":"https://en.wikipedia.org/wiki/Skew-symmetric_matrix"},{"title":"Wikipedia: Rodrigues' rotation formula","url":"https://en.wikipedia.org/wiki/Rodrigues%27_rotation_formula"}],"as_of":"","related_ids":["rodrigues-rotation-formula","rotation-matrix","special-orthogonal-group-so","lie-group","exponential-map","screw-theory"],"name":"反对称矩阵","alt":"Skew-Symmetric Matrix","abbr":"","aliases":["斜对称矩阵","叉乘矩阵","hat 算子","Cross-Product Matrix","[ω]×"],"one_liner":"转置等于自身相反数的矩阵；3×3 时能把叉乘写成矩阵乘法。","explanation":"反对称矩阵满足 Aᵀ = −A，对角线全为 0。机器人学里最常用的是 3×3 的情形：给定向量 ω = (ω₁, ω₂, ω₃)，构造矩阵 [ω] = [[0, −ω₃, ω₂], [ω₃, 0, −ω₁], [−ω₂, ω₁, 0]]，则 [ω]v 恰好等于叉乘 ω×v。把向量变成这个矩阵的操作叫 hat（记作 ω^ 或 [ω]×），反过来从矩阵取回向量叫 vee。它的重要性在于：所有 3×3 反对称矩阵组成旋转群 SO(3) 的李代数 so(3)，可以理解为「无穷小旋转」；对它取矩阵指数就得到旋转矩阵，闭式结果就是罗德里格斯公式。推导角速度、旋转矩阵的导数、雅可比矩阵时都会反复用到它。","example":"取 ω = (0,0,1)（绕 z 轴的单位角速度），v = (1,0,0)：[ω]v = (0,1,0)，和叉乘 ω×v 结果相同，意思是 x 轴上那个点此刻正朝 y 方向运动。","related":["罗德里格斯公式","旋转矩阵","特殊正交群 SO(3)","李群","指数映射","旋量理论"]},{"id":"lie-group","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Lie group","url":"https://en.wikipedia.org/wiki/Lie_group"},{"title":"Solà et al., A micro Lie theory for state estimation in robotics (arXiv:1812.01537)","url":"https://arxiv.org/abs/1812.01537"},{"title":"Lynch & Park, Modern Robotics（2017）第 3 章：SO(3)、SE(3) 与李代数","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["special-orthogonal-group-so","exponential-map","skew-symmetric-matrix","adjoint-representation","product-of-exponentials-formula","screw-theory"],"name":"李群","alt":"Lie Group","abbr":"","aliases":["矩阵李群","连续变换群"],"one_liner":"既是群又是光滑流形的数学对象，机器人里的旋转和位姿都属于李群。","explanation":"李群以挪威数学家 Sophus Lie（1842–1899）命名，指一个同时也是光滑流形的群，而且乘法和求逆都是光滑运算。「群」保证元素能相乘（两次旋转合成一次）、能求逆；「流形」（局部看像平直空间的曲面）保证能求导、做优化。机器人最常用两个：SO(3)，全体三维旋转矩阵；SE(3)，旋转加平移的刚体位姿。它们在单位元处的切空间叫李代数，如 SO(3) 对应由反对称矩阵组成的 so(3)，两者用指数映射互相转换。好处是可以在三维向量上做加减和梯度下降，再映射回旋转，保证结果仍是合法旋转。SLAM、视觉里程计、状态估计、位姿优化和指数积公式都建立在它上面。","example":"视觉 SLAM 优化相机朝向时，不直接改旋转矩阵 R 的 9 个数，而是求一个三维小增量 δ，再用 R ← R·exp([δ]×) 更新（[δ]× 是 δ 对应的反对称矩阵，exp 是矩阵指数），更新后 R 仍是合法的旋转矩阵。","related":["特殊正交群 SO(3)","指数映射","反对称矩阵","伴随变换","指数积公式","旋量理论"]},{"id":"exponential-map","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Solà, Deray, Atchuthan: A micro Lie theory for state estimation in robotics","url":"https://arxiv.org/abs/1812.01537"},{"title":"Lynch & Park, Modern Robotics（Ch. 3 exponential coordinates / matrix logarithm）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Wikipedia: Exponential map (Lie theory)","url":"https://en.wikipedia.org/wiki/Exponential_map_(Lie_theory)"}],"as_of":"","related_ids":["lie-group","rotation-matrix","axis-angle-representation","rodrigues-rotation-formula","product-of-exponentials-formula","skew-symmetric-matrix"],"name":"指数映射","alt":"Exponential Map","abbr":"","aliases":["对数映射","Log Map","exp/log 映射","Exp/Log","Logarithmic Map"],"one_liner":"把「转轴×转角」这类向量变成旋转或位姿的映射，对数映射反过来。","explanation":"指数映射来自李群理论，把李代数（群在单位元处的切空间，可理解为「速度」所在的线性空间）中的元素映到李群本身；对矩阵李群，它就是矩阵指数 exp(X) = I + X + X²/2! + …。对数映射是它在单位元附近的逆。机器人里最常用的是旋转：把单位转轴 ω̂ 和转角 θ 合成三维向量 ω̂θ（指数坐标，也叫旋转向量），写成反对称矩阵 [ω̂]θ 后取指数得到旋转矩阵 R，闭式结果就是罗德里格斯公式；对 R 取对数又得回 ω̂θ。同理，se(3) 到 SE(3) 的指数映射把旋量变成齐次变换，是指数积公式的基础。状态估计和优化里常在平直的切空间做加减，再用 exp 映回旋转，避免直接加减旋转矩阵破坏正交性。","example":"ω̂ = (0, 0, 1)、θ = π/2，指数映射得到绕 z 轴转 90° 的旋转矩阵；对这个矩阵取对数，又得到向量 (0, 0, π/2)。","related":["李群","旋转矩阵","轴角","罗德里格斯公式","指数积公式","反对称矩阵"]},{"id":"screw-theory","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Screw theory","url":"https://en.wikipedia.org/wiki/Screw_theory"},{"title":"Wikipedia: Product of exponentials formula","url":"https://en.wikipedia.org/wiki/Product_of_exponentials_formula"},{"title":"Modern Robotics: Mechanics, Planning, and Control (Lynch & Park)","url":"http://hades.mech.northwestern.edu/index.php/Modern_Robotics"}],"as_of":"","related_ids":["twist","wrench","product-of-exponentials-formula","lie-group","exponential-map","adjoint-representation"],"name":"旋量理论","alt":"Screw Theory","abbr":"","aliases":["螺旋理论","旋量","螺旋轴","Screw Axis","Theory of Screws"],"one_liner":"把刚体任意运动看成绕某根轴转动、同时沿该轴平移的数学框架。","explanation":"旋量理论研究刚体运动和受力的几何。1763 年 Mozzi 证明，任何刚体运动都可以看成绕一根轴转动、同时沿这根轴平移，像拧螺丝一样，这根轴叫螺旋轴（这一结论后来称为 Chasles 定理）；1876 年 Robert Ball 出版《旋量理论》，把它系统化。核心是两个 6 维量：运动旋量（twist，角速度 ω 和线速度 v 拼在一起）描述刚体速度，力旋量（wrench，力矩和力拼在一起）描述受力。好处是转动关节和移动关节都能统一写成一根螺旋轴，不必像 DH 参数那样在每个连杆上都建坐标系。Brockett 在 1983–1984 年据此提出指数积公式；Lynch 与 Park 的教材《Modern Robotics》（2017）用这套语言讲运动学、雅可比和动力学。","example":"拧螺丝时螺丝刀每转一圈，螺钉沿轴前进一个螺距，这就是一次旋量运动。机械臂的转动关节是螺距为 0 的旋量（只转不移），移动关节可看成螺距无穷大的旋量（只移不转）。","related":["运动旋量（速度旋量）","力旋量","指数积公式","李群","指数映射","伴随变换"]},{"id":"plucker-coordinates","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Plücker coordinates","url":"https://en.wikipedia.org/wiki/Pl%C3%BCcker_coordinates"},{"title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation (arXiv 2404.02101)","url":"https://arxiv.org/html/2404.02101"},{"title":"Roy Featherstone: Spatial vector teaching materials（Plücker Basis Vectors）","url":"https://royfeatherstone.org/teaching/"}],"as_of":"","related_ids":["screw-theory","spatial-vector-algebra","camera-extrinsics","camera-intrinsics","video-generation-model","world-model"],"name":"Plücker 坐标（Plücker 射线嵌入）","alt":"Plücker Coordinates (Plücker Ray Embedding)","abbr":"","aliases":["普吕克坐标","Plücker 嵌入","Plücker Embedding","Plücker Ray Map"],"one_liner":"用方向加矩共 6 个数表示空间直线，也常用来编码每个像素的相机射线。","explanation":"Plücker 坐标由 19 世纪德国数学家 Julius Plücker 提出，用 6 个数描述三维空间里的一条直线：方向 d，和矩 m = p × d（p 是直线上任意一点，× 是叉乘）。p 取直线上哪一点 m 都不变，且 d·m = 0。它在机器人学里很基础：旋量理论里的关节轴、Featherstone 的空间向量动力学都建立在 Plücker 坐标上。近年它以「Plücker 射线嵌入」出现在生成模型里：对图像每个像素，用相机中心 o 和该像素的射线方向 d 算出 (o × d, d)，得到 6 通道的图，作为相机位姿条件输入。CameraCtrl（2024）沿用 Light Field Networks（2021）的做法，认为这比直接输入内外参矩阵更容易让网络把相机信息和像素对应起来，带相机控制的视频生成和世界模型常用它。","example":"相机在原点、朝 z 轴看，图像中心像素的射线方向 d = (0, 0, 1)，o × d = 0，嵌入为 (0, 0, 0, 0, 0, 1)；相机向侧面平移后 o 改变，同一像素的 o × d 随之变化，网络由此感知相机移动。","related":["旋量理论","空间向量代数","相机外参","相机内参","视频生成模型","世界模型"]},{"id":"dual-quaternion","category":"mechanics","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Dual quaternion","url":"https://en.wikipedia.org/wiki/Dual_quaternion"},{"title":"DQ Robotics（dual quaternion robot modelling and control library）","url":"https://dqrobotics.github.io/"}],"as_of":"","related_ids":["quaternion","homogeneous-transformation-matrix","screw-theory","pose","lie-group","spherical-linear-interpolation"],"name":"对偶四元数","alt":"Dual Quaternion","abbr":"","aliases":["双四元数","Dual Quaternions","单位对偶四元数"],"one_liner":"用 8 个数同时表示三维旋转和平移的代数工具。","explanation":"对偶四元数是系数为对偶数的四元数，写成 q = r + εd：r、d 都是普通四元数，ε 是满足 ε² = 0 的对偶单位，共 8 个实数分量。Study 在 1891 年指出这套代数适合描述三维空间的刚体运动，Kotelnikov 在 1895 年也独立提出。就像单位四元数表示旋转，单位对偶四元数能表示一个完整的刚体变换（位姿）：r 表示旋转，d = ½·t·r 编码平移 t。两个变换的复合就是对偶四元数相乘，比 4×4 齐次变换矩阵更紧凑，也便于在两个位姿之间插值。机器人学里 DQ Robotics 等开源库用它做机械臂运动学建模和控制，计算机图形学中也有应用。","example":"先绕 z 轴转 90° 再平移 (1, 0, 0)：r = (cos45°, 0, 0, sin45°)，t 写成纯四元数 (0, 1, 0, 0)，算出 d = ½·t·r，r 和 d 合起来 8 个数就表示这个位姿。","related":["四元数","齐次变换矩阵","旋量理论","位姿","李群","球面线性插值"]},{"id":"link","category":"mechanics","sec":2,"tier":1,"sources":[{"title":"Modern Robotics (Lynch & Park, 2017), Ch.2 Configuration Space","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"},{"title":"Wikipedia: Robot kinematics","url":"https://en.wikipedia.org/wiki/Robot_kinematics"},{"title":"ros/urdf_tutorial: 07-physics.urdf","url":"https://raw.githubusercontent.com/ros/urdf_tutorial/ros2/urdf/07-physics.urdf"}],"as_of":"","related_ids":["revolute-joint","prismatic-joint","kinematic-chain","rigid-body","unified-robot-description-format","degrees-of-freedom"],"name":"连杆","alt":"Link","abbr":"","aliases":["杆件","Robot Link"],"one_liner":"机器人身上被关节连起来的一节节刚性部件。","explanation":"连杆是机器人机械结构的基本单元：机器人由若干连杆通过关节（允许相对运动的连接处）串起来，电机驱动关节，带动连杆运动。建模时连杆通常当成刚体，也就是受力不变形的物体。在机器人描述文件 URDF 里，每个 link 标签记录一节连杆的外观网格、碰撞检测用的简化形状，以及质量和转动惯量；关节标签则写明父连杆、子连杆和转轴。正运动学就是从基座开始，沿「连杆—关节—连杆」这条链逐节累乘坐标变换，算出末端在哪里。连杆长度直接决定机械臂能伸多远。","example":"串联机械臂有 n 个关节时就有 n+1 个连杆（含底座），6 轴机械臂即 7 个连杆；人的上臂和前臂相当于两节连杆，肘关节把它们连起来。","related":["转动关节","移动关节","运动链","刚体","统一机器人描述格式","自由度"]},{"id":"revolute-joint","category":"mechanics","sec":2,"tier":1,"sources":[{"title":"Wikipedia: Revolute joint","url":"https://en.wikipedia.org/wiki/Revolute_joint"},{"title":"Modern Robotics (Lynch & Park, 2017), 2.2.1 Robot Joints","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"},{"title":"ros/urdf_tutorial: 07-physics.urdf","url":"https://raw.githubusercontent.com/ros/urdf_tutorial/ros2/urdf/07-physics.urdf"}],"as_of":"","related_ids":["link","prismatic-joint","spherical-joint","joint-limits","degrees-of-freedom","rotary-encoder"],"name":"转动关节","alt":"Revolute Joint","abbr":"","aliases":["旋转关节","回转关节","铰链关节","Hinge Joint","R 关节"],"one_liner":"只允许两节连杆绕一根固定轴相对转动的关节，1 个自由度。","explanation":"转动关节（常记为 R）又叫铰链关节，连接两节连杆，只允许它们绕同一根轴相对转动、不能滑动，所以只有 1 个自由度。它是机械臂和人形机器人最常见的关节：电机经减速器带动输出端转动，编码器测出转角，这个转角就是关节角。与之对应的是移动关节（P），只允许沿轴线平移。URDF 里 revolute 类型的关节要写转轴方向和限位，即上下限角度（单位弧度）、最大力矩和最大速度；不限角度、能一直转的写成 continuous，比如轮子。常说的「6 轴机械臂」一般就是 6 个转动关节串联。","example":"门的合页就是一个转动关节；Franka Research 3 的 7 个关节都是转动关节，控制器读到的 q1 到 q7 就是它们各自的转角（弧度）。","related":["连杆","移动关节","球关节","关节限位","自由度","编码器"]},{"id":"prismatic-joint","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"Wikipedia: Prismatic joint","url":"https://en.wikipedia.org/wiki/Prismatic_joint"},{"title":"Wikipedia: Linear actuator","url":"https://en.wikipedia.org/wiki/Linear_actuator"}],"as_of":"","related_ids":["revolute-joint","linear-actuator","cartesian-robot","selective-compliance-assembly-robot-arm","kinematic-pair","unified-robot-description-format"],"name":"移动关节","alt":"Prismatic Joint","abbr":"","aliases":["平移关节","滑动关节","直线关节","移动副","滑动副","P 关节","Slider Joint","Sliding Pair"],"one_liner":"只允许两个部件沿一根轴直线相对滑动、不能转动的单自由度关节。","explanation":"移动关节是机器人最基本的两种关节之一（另一种是转动关节）：它把两根连杆约束成只能沿同一轴线相对滑动、不能转动，提供 1 个平移自由度，关节变量是位移而不是角度。在机构学里它属于低副，也叫移动副；描述构型时常记作 P，比如 RRP 表示两个转动关节加一个移动关节。它通常由直线执行器驱动，如电机加滚珠丝杠的电动缸、液压缸或直线电机。直角坐标机器人的三根轴、SCARA 机器人的升降轴、复合机器人的升降柱、平行二指夹爪的开合都是移动关节。在 URDF 中关节类型写作 prismatic，并要给出运动轴方向和行程上下限。","example":"SCARA 机器人通常是两个水平转动关节加一个竖直移动关节：转动关节负责在平面内定位，移动关节负责把工具上下插入或提起。","related":["转动关节","线性执行器（直线执行器 / 电缸）","直角坐标机器人","SCARA 机器人","运动副（转动副 / 移动副 / 低副 / 高副）","统一机器人描述格式"]},{"id":"spherical-joint","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"Modern Robotics (Lynch & Park), Ch.2.2 Joints","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"MuJoCo XML Reference: body/joint type","url":"https://mujoco.readthedocs.io/en/stable/XMLreference.html#body-joint"},{"title":"urdfdom_headers: joint.hpp (URDF joint types)","url":"https://github.com/ros/urdfdom_headers/blob/rolling/include/urdf_model/joint.hpp"}],"as_of":"","related_ids":["revolute-joint","spherical-wrist","parallel-mechanism","degrees-of-freedom","mujoco","unified-robot-description-format"],"name":"球关节","alt":"Spherical Joint","abbr":"","aliases":["球铰","Ball Joint","球窝关节","Ball-and-Socket Joint","S 副"],"one_liner":"允许绕一个固定点向任意方向转动、但不能平移的三自由度关节。","explanation":"球关节又叫球铰或球窝关节：一个构件的球头嵌在另一个构件的球窝里，两者可绕球心向任意方向转动，但不能相对平移，因此有 3 个转动自由度，功能类似人的肩关节和髋关节，机构学里常记作 S。Stewart 平台等并联机构的支链里大量使用被动球铰。真实机械臂很少用单个电机驱动球关节，而是用三个轴线交于一点的转动关节来等效，例如球形手腕。仿真里，MuJoCo 提供 ball 类型关节，用单位四元数表示转角，所以 qpos 占 4 个数、qvel 占 3 个数；ROS 的 URDF 没有球关节类型，通常用三个转动关节串起来近似。","example":"在 MuJoCo 里给人形机器人的肩部设一个 ball 关节，用一个四元数就能描述上臂朝向；导出成 URDF 给 ROS 用时，需要拆成肩部俯仰、横滚、偏航三个 revolute 关节。","related":["转动关节","球形手腕","并联机构","自由度","MuJoCo","统一机器人描述格式"]},{"id":"kinematic-pair","category":"mechanics","sec":2,"tier":3,"sources":[{"title":"Wikipedia: Kinematic pair","url":"https://en.wikipedia.org/wiki/Kinematic_pair"},{"title":"Lynch & Park, Modern Robotics（2017）2.2 节 Grübler 公式；参考文献 Denavit & Hartenberg 1955","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["revolute-joint","prismatic-joint","spherical-joint","degrees-of-freedom","grubler-s-formula","four-bar-linkage"],"name":"运动副（转动副 / 移动副 / 低副 / 高副）","alt":"Kinematic Pair (Revolute / Prismatic Pair; Lower / Higher Pair)","abbr":"","aliases":["关节","R 副 / P 副","低副 / 高副"],"one_liner":"两个构件直接接触又能相对运动的连接，如铰链、滑轨、齿轮啮合。","explanation":"运动副是机械原理的基本概念，由德国工程师 Reuleaux 提出，指两个构件之间既保持接触、又只允许特定相对运动的连接。按接触方式分两类：低副是面接触，常见的有转动副（R，铰链，1 个转动自由度）、移动副（P，滑块，1 个移动自由度）、螺旋副、圆柱副（2 自由度）、球面副（3 自由度）；高副是点或线接触，如凸轮与从动件、齿轮啮合、车轮在地面上滚动。机器人学里的「关节」就是运动副，转动关节对应转动副，移动关节对应移动副。计算机构自由度的 Grübler 公式，就是用构件的总自由度减去各运动副引入的约束。DH 参数的原始论文题目就叫「基于矩阵的低副机构运动学记法」。","example":"平面四连杆机构：连同机架共 4 个构件、4 个转动副，按平面 Grübler 公式，自由度 = 3×(4−1−4) + 4×1 = 1，所以只需一个电机就能驱动整个机构。","related":["转动关节","移动关节","球关节","自由度","Grübler 公式","四连杆机构"]},{"id":"flexion-extension-and-abduction-adduction","category":"mechanics","sec":2,"tier":3,"sources":[{"title":"Wikipedia: Anatomical terms of motion","url":"https://en.wikipedia.org/wiki/Anatomical_terms_of_motion"},{"title":"Shaw, Agarwal, Pathak: LEAP Hand（universal abduction-adduction mechanism）","url":"https://arxiv.org/abs/2309.06440"},{"title":"灵心巧手 Linker Hand 官网（产品参数：拇指侧摆、四指弯曲）","url":"https://www.linkerbot.cn/"}],"as_of":"","related_ids":["dexterous-hand","metacarpophalangeal-proximal-and-distal-interphalangeal-join","thumb-opposition","degrees-of-freedom","leap-hand","motion-retargeting"],"name":"屈伸与侧摆（外展/内收）","alt":"Flexion/Extension and Abduction/Adduction (Lateral Swing)","abbr":"","aliases":["屈曲/伸展","外展/内收","侧摆","弯曲","Flexion/Extension","Abduction/Adduction"],"one_liner":"关节的两类基本动作：屈伸是弯曲和伸直，侧摆是左右张开和并拢。","explanation":"这是解剖学描述关节运动的术语，灵巧手、外骨骼和人体动捕都沿用。屈（flexion）是减小相邻两节夹角的弯曲动作，如握拳；伸（extension）相反，是伸直。外展（abduction）是远离身体或手的中线，对手指就是张开；内收（adduction）是向中线靠拢，即并拢。人手每根手指根部的掌指关节（MCP）既能屈伸又能外展/内收，是两个自由度；中间和末端的指间关节（PIP、DIP）只能屈伸。中文灵巧手参数表常把外展/内收叫「侧摆」、屈伸叫「弯曲」，如灵心巧手的规格里有「拇指侧摆」「四指弯曲」。有的灵巧手为简化结构四指只保留屈伸；LEAP Hand 则专门设计了在各种姿态下都能外展/内收的掌指关节，方便把人手动作重定向过去。","example":"五指张开成扇形是四指外展，再并拢成一片是内收；握拳是各指屈，把手掌摊平是伸。","related":["灵巧手","掌指关节 / 指间关节（MCP / PIP / DIP）","拇指对掌","自由度","LEAP Hand","动作重定向"]},{"id":"joint-limits","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"Modern Robotics (Lynch & Park) preprint PDF, Ch. 4 URDF 与 Ch. 9 Fig. 9.1","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"legged_gym: legged_robot_config.py (soft_dof_pos_limit)","url":"https://raw.githubusercontent.com/leggedrobotics/legged_gym/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["soft-limits","configuration-space","inverse-kinematics","torque-limiting","unified-robot-description-format","workspace"],"name":"关节限位","alt":"Joint Limits","abbr":"","aliases":["关节极限","关节范围","关节行程","Joint Range","Joint Position Limits"],"one_liner":"每个关节允许转动或移动的范围，广义上还包括速度和力矩上限。","explanation":"关节限位指关节变量允许的取值范围，比如某转动关节只能在 −90° 到 90° 之间转，多由机械结构决定；广义上还包括速度和力矩上限。URDF 里转动关节（revolute）和移动关节（prismatic）用 limit 标签写 lower、upper、velocity、effort 四个值，不限转角的转动关节单独标为 continuous。限位影响很多环节：逆运动学的解要检查是否越限；运动规划时构型空间会被限位截掉一部分；实机控制器常设比机械硬限位更小的软限位留余量。强化学习训练常惩罚接近限位的状态，如 legged_gym 的 soft_dof_pos_limit 按 URDF 限位的百分比设惩罚阈值。","example":"《Modern Robotics》里的 2R 机械臂限定 0°≤θ1≤180°、0°≤θ2≤150°：关节空间里走直线没问题，但让末端在任务空间走直线的那条路径会超出关节限位。","related":["软限位","构型空间","逆运动学","力矩限幅","统一机器人描述格式","工作空间"]},{"id":"kinematic-chain","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"Kinematic chain - Wikipedia","url":"https://en.wikipedia.org/wiki/Kinematic_chain"},{"title":"Modern Robotics (Lynch & Park) preprint PDF, Ch. 1–2 与 Ch. 7 Closed Chains","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["serial-mechanism","parallel-mechanism","kinematic-tree","grubler-s-formula","degrees-of-freedom","parallel-ankle-mechanism"],"name":"运动链","alt":"Kinematic Chain","abbr":"","aliases":["开链","闭链","Open Chain","Closed Chain","运动学链"],"one_liner":"用关节把刚体连杆一节节连起来形成的机构模型，分开链和闭链。","explanation":"运动链是由关节连接的一组刚体（连杆），用来描述机构能怎样运动，Reuleaux 在 1876 年的《机构运动学》中把它系统化。连杆依次相连、不形成回路的叫开链（串联链），典型是普通机械臂，每个关节都装电机驱动；连杆围成一个或多个封闭回路的叫闭链，如 Stewart 平台、Delta 并联机器人、人形机器人的并联踝关节，闭链里通常只有部分关节被驱动。机构自由度可用 Grübler 公式估算：M = d(N−1−j) + Σf_i，d 在平面取 3、空间取 6，N 是连杆数（含地面），j 是关节数，f_i 是第 i 个关节的自由度。开链正运动学简单、逆解难；闭链常常反过来。","example":"桌面上的 6 轴机械臂从底座到夹爪是一条开链；Delta 并联机器人的三条支链在动平台处汇合，形成闭链。","related":["串联机构","并联机构","运动学树","Grübler 公式","自由度","并联踝关节"]},{"id":"serial-mechanism","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"Wikipedia: Serial manipulator","url":"https://en.wikipedia.org/wiki/Serial_manipulator"},{"title":"Modern Robotics (Lynch & Park), Ch.2 Configuration Space","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["parallel-mechanism","kinematic-chain","link","forward-kinematics","robotic-arm","6-axis-robot-arm"],"name":"串联机构","alt":"Serial Mechanism","abbr":"","aliases":["串联机器人","Serial Manipulator","开链机构","Open-chain Mechanism","串联机械臂"],"one_liner":"连杆用关节首尾依次相连、从底座到末端不形成闭环的机构。","explanation":"串联机构又叫开链机构，指一串连杆（刚性杆件）用关节首尾依次相连，从固定底座一直延伸到末端执行器，中间不形成闭环。每个关节一般各由一个电机驱动，末端位姿是沿链逐个叠加各关节变换的结果，所以正运动学（由关节角算末端位姿）有唯一解，逆运动学则可能多解。六轴工业臂、七自由度协作臂、SCARA 以及人形机器人的单条手臂都是串联结构。优点是工作空间相对占地大、结构直观；缺点是误差和变形沿链逐级累积，远端电机的重量要由近端关节扛着，刚度和负载能力不如并联机构（多条支链同时连到末端、形成闭环，如 Delta 机器人和 Stewart 平台）。","example":"UR5e 的六个关节依次是底座、肩、肘和三个腕关节，一个接一个串起来，是典型的串联机构；而人双脚站在地上时，从地面经一条腿、腰、另一条腿回到地面构成闭环，就属于闭链机构。","related":["并联机构","运动链","连杆","正运动学","机械臂","六轴机械臂"]},{"id":"parallel-mechanism","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"Wikipedia: Parallel manipulator","url":"https://en.wikipedia.org/wiki/Parallel_manipulator"},{"title":"Wikipedia: Delta robot","url":"https://en.wikipedia.org/wiki/Delta_robot"}],"as_of":"","related_ids":["serial-mechanism","delta-robot","parallel-ankle-mechanism","kinematic-chain","singular-configuration","four-bar-linkage"],"name":"并联机构","alt":"Parallel Mechanism","abbr":"","aliases":["并联机器人","并联机械手","Parallel Manipulator","Parallel Robot"],"one_liner":"用多条运动链同时连接基座和末端平台的机构，刚度高、速度快但工作空间小。","explanation":"并联机构指末端平台由两条或更多条独立运动链同时连到基座，形成闭环；与之相对，串联机构是一根链从基座连到末端，普通六轴机械臂就是串联。典型例子有六根伸缩杆撑起平台的 Stewart 平台（用于飞行模拟器），以及 20 世纪 80 年代初瑞士洛桑联邦理工学院 Reymond Clavel 团队发明的 Delta 机器人（俗称「蜘蛛手」），常用于食品、电子产品的高速分拣。并联机构的电机多装在基座上，运动部分轻，各支链分担负载，所以刚度高、精度高、速度快；代价是工作空间小、正运动学难解，并且有串联臂没有的额外奇异位形。不少人形机器人的踝关节也采用并联结构。","example":"Delta 机器人的三根主动臂各带一组平行四边形连杆，末端平台只平移不转动；据维基百科介绍，它每分钟可完成最多约 300 次拣放。","related":["串联机构","Delta 并联机器人（蜘蛛手）","并联踝关节","运动链","奇异位形","四连杆机构"]},{"id":"four-bar-linkage","category":"mechanics","sec":2,"tier":3,"sources":[{"title":"Wikipedia: Four-bar linkage","url":"https://en.wikipedia.org/wiki/Four-bar_linkage"},{"title":"Wikipedia: Grashof condition","url":"https://en.wikipedia.org/wiki/Grashof_condition"},{"title":"Lynch & Park, Modern Robotics（预印本 PDF，第 2 章 Example 2.3）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["grubler-s-formula","linkage-transmission","parallel-mechanism","parallel-ankle-mechanism","degrees-of-freedom","link"],"name":"四连杆机构","alt":"Four-Bar Linkage","abbr":"","aliases":["四杆机构","铰链四杆机构","平面四连杆"],"one_liner":"四根杆用四个转动关节首尾连成闭环、只有 1 个自由度的机构。","explanation":"四连杆机构由四根杆（其中一根固定，叫机架）用四个转动关节首尾相连成一个闭环，是最简单的可动闭链机构，平面情况下只有 1 个自由度：转动其中一根杆，其余杆的位置就全部确定。和机架相连、能转整圈的杆叫曲柄，只能来回摆的叫摇杆，中间浮动的那根叫连杆。能否整圈转由 Grashof 条件判断：最短杆与最长杆长度之和不大于另外两杆之和时，最短杆能相对相邻杆整圈转动，据此可分出曲柄摇杆、双曲柄、双摇杆等类型。它的作用是把一个电机的简单转动变成想要的输出轨迹或角度关系，雨刮器、汽车悬架都用它；机器人里常借它把电机放在靠近躯干的位置、再经连杆去驱动膝或踝，平行四边形四连杆还能让夹爪指面始终保持平行。","example":"汽车雨刮器：电机带着曲柄连续转圈，通过连杆带动摇杆来回摆动，刮片就在挡风玻璃上左右扫。","related":["Grübler 公式","连杆传动","并联机构","并联踝关节","自由度","连杆"]},{"id":"grubler-s-formula","category":"mechanics","sec":2,"tier":3,"sources":[{"title":"Wikipedia: Chebychev–Grübler–Kutzbach criterion","url":"https://en.wikipedia.org/wiki/Chebychev%E2%80%93Gr%C3%BCbler%E2%80%93Kutzbach_criterion"},{"title":"Lynch & Park, Modern Robotics（预印本 PDF，2.2.2 节 Grübler's Formula）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["degrees-of-freedom","four-bar-linkage","parallel-mechanism","kinematic-pair","configuration-space","underactuation"],"name":"Grübler 公式","alt":"Grübler's Formula (Chebychev–Grübler–Kutzbach Criterion)","abbr":"","aliases":["Kutzbach-Grübler 公式","Kutzbach 准则","机构自由度计算公式","活动度公式","Mobility Formula"],"one_liner":"用连杆数、关节数和各关节自由度，算出一个机构有几个自由度的公式。","explanation":"Grübler 公式也叫 Chebychev–Grübler–Kutzbach 准则，以三位提出者命名，用来数一个由连杆和关节组成的机构有几个自由度：dof = m(N − 1 − J) + Σfᵢ。其中 m 是单个刚体的自由度（平面机构取 3，空间机构取 6），N 是连杆数（地面也算一根），J 是关节数，fᵢ 是第 i 个关节提供的自由度（转动关节、移动关节为 1，球关节为 3）。思路是：每根活动杆本来有 m 个自由度，每个关节扣掉 m − fᵢ 个约束。它适合快速判断并联机构、闭链腿部或手指机构需要几个电机。局限是公式默认各约束相互独立；若几何尺寸特殊（平行、等长等），约束会冗余，实际自由度可能比算出来的多，这类机构叫过约束机构，此时公式只给出下界。","example":"平面四连杆：m=3，N=4（含地面），J=4 个转动关节各 1 个自由度，dof = 3×(4−1−4) + 4 = 1，转动一根曲柄整个机构就确定了。","related":["自由度","四连杆机构","并联机构","运动副（转动副 / 移动副 / 低副 / 高副）","构型空间","欠驱动"]},{"id":"parallel-ankle-mechanism","category":"mechanics","sec":2,"tier":3,"sources":[{"title":"unitree_sdk2 example: g1_ankle_swing_example.cpp（PR: Series Control for Pitch/Roll Joints; AB: Parallel Control for A/B Joints）","url":"https://raw.githubusercontent.com/unitreerobotics/unitree_sdk2/main/example/g1/low_level/g1_ankle_swing_example.cpp"},{"title":"Wikipedia: Parallel manipulator","url":"https://en.wikipedia.org/wiki/Parallel_manipulator"}],"as_of":"","related_ids":["parallel-mechanism","serial-mechanism","unified-robot-description-format","unitree-g1","bipedal-robot","reflected-inertia"],"name":"并联踝关节","alt":"Parallel Ankle Mechanism (Closed-Chain Ankle)","abbr":"","aliases":["并联脚踝","闭链踝关节","Parallel Ankle"],"one_liner":"由两台电机经连杆共同驱动脚踝俯仰和侧摆的闭链脚踝结构。","explanation":"并联踝关节是人形和双足机器人常见的脚踝结构：脚踝的俯仰（pitch，脚尖上下）和侧摆（roll，脚掌左右翻）两个自由度，不是两台电机各管一个，而是两台电机通过连杆一起推拉脚板，形成闭合的运动链。好处是电机可以上移到小腿靠膝处，腿末端变轻、摆腿惯量小；两台电机同时出力，扭矩可以叠加。代价是电机角度和脚踝角度之间是非线性耦合，要靠机构的正逆运动学来回换算，力矩也要经雅可比换算；URDF 只能描述树状结构，仿真里常把它简化成串联的俯仰、侧摆两个关节。宇树 G1 的 SDK 就提供两种模式：PR 模式按串联俯仰/侧摆关节下指令，AB 模式直接控制两台并联电机。","example":"典型的左右对称双连杆脚踝：两台电机同向转，脚掌做俯仰；反向转，脚掌做侧摆；其他转法是两者的叠加。","related":["并联机构","串联机构","统一机器人描述格式","宇树 G1","双足机器人","反射惯量"]},{"id":"kinematic-tree","category":"mechanics","sec":2,"tier":3,"sources":[{"title":"Lynch & Park, Modern Robotics（2017）4.2 节：URDF 可表示任何树形结构机器人","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"MuJoCo 文档 Overview：Kinematic tree（不允许运动学回路，用等式约束建模）","url":"https://mujoco.readthedocs.io/en/stable/overview.html"},{"title":"Pinocchio（GitHub）：利用运动学树稀疏性的刚体动力学算法库","url":"https://github.com/stack-of-tasks/pinocchio"}],"as_of":"","related_ids":["kinematic-chain","serial-mechanism","parallel-mechanism","unified-robot-description-format","floating-base","articulated-body-algorithm"],"name":"运动学树","alt":"Kinematic Tree","abbr":"","aliases":["运动树","树形运动链","树形结构"],"one_liner":"以连杆为节点、关节为边的树形结构，从根部一路分叉到各个末端。","explanation":"运动学树是描述多连杆机器人结构的方式：连杆是节点，关节是连接父连杆与子连杆的边；每个连杆只有一个父节点、没有闭合回路，从根节点（固定底座，或人形机器人的骨盆）一路分叉到各个末端。单条机械臂是只有一根枝的特例（串联链），人形、灵巧手、四足则是多分支的树。URDF（统一机器人描述格式）只能描述树形结构，无法直接表示 Stewart 平台这类闭链；MuJoCo 也把所有刚体组织成以 world 为根的树、不允许回路，四连杆、并联踝关节等闭环要用额外的等式约束补上。Pinocchio 等动力学库沿这棵树递推计算，并利用树结构带来的稀疏性加速。","example":"人形机器人的 URDF 里，骨盆是根，往下分出左右两条腿，往上经腰到躯干，再分出双臂和头部；每只灵巧手又分出五根手指，整体是一棵多级分叉的树。","related":["运动链","串联机构","并联机构","统一机器人描述格式","浮动基","铰接体算法"]},{"id":"floating-base","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"MuJoCo Documentation - Overview (joint types, free joint)","url":"https://mujoco.readthedocs.io/en/stable/overview.html"},{"title":"MuJoCo Menagerie - unitree_g1/g1.xml","url":"https://github.com/google-deepmind/mujoco_menagerie/blob/main/unitree_g1/g1.xml"},{"title":"Underactuated Robotics (MIT) - Multi-Body Dynamics","url":"https://underactuated.csail.mit.edu/multibody.html"}],"as_of":"","related_ids":["generalized-coordinates","underactuation","centroidal-dynamics","whole-body-control","state-estimation","mjcf"],"name":"浮动基","alt":"Floating Base","abbr":"","aliases":["浮动基座","浮动基动力学","自由关节","Free Joint","Free-flyer Joint"],"one_liner":"机器人躯干不固定在地上，本身还有 6 个可自由移动和转动的自由度。","explanation":"固定在桌上的机械臂叫固定基，底座不动，只用关节角就能描述姿态。人形、四足、无人机的躯干（base）不和世界相连，除了关节还要多 6 个自由度描述躯干在空间中的位置和朝向，这就是浮动基。建模时通常在世界和躯干之间加一个虚拟的「自由关节」：MuJoCo 叫 free joint，位置用 7 个数（3 维位置 + 4 维单位四元数），速度用 6 个数（3 维线速度 + 3 维角速度）。难点在于这 6 个自由度没有电机直接驱动，只能靠脚与地面的接触力间接推动躯干，属于欠驱动；因此浮动基机器人的控制离不开接触力、摩擦锥和状态估计，躯干位姿要靠 IMU 和腿式里程计估出来。","example":"MuJoCo Menagerie 里的宇树 G1 模型，根节点 pelvis 带一个名为 floating_base_joint 的 freejoint，所以 qpos 前 7 维是骨盆位置和四元数，后面才是各关节角。","related":["广义坐标","欠驱动","质心动力学","全身控制","状态估计","MJCF"]},{"id":"configuration-space","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"Modern Robotics（Lynch & Park, 2017 预印本）第 2 章 Configuration Space","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Motion planning - Wikipedia","url":"https://en.wikipedia.org/wiki/Motion_planning"},{"title":"Configuration space (physics) - Wikipedia","url":"https://en.wikipedia.org/wiki/Configuration_space_(physics)"}],"as_of":"","related_ids":["degrees-of-freedom","joint-space","motion-planning","sampling-based-planning","collision-checking","generalized-coordinates"],"name":"构型空间","alt":"Configuration Space","abbr":"C-space","aliases":["位形空间","C空间","构型","Configuration","配置空间"],"one_liner":"机器人所有可能姿态组成的空间，其中每个点对应一种完整姿态。","explanation":"构型（configuration）是能唯一确定机器人各部位位置的一组数，构型空间就是全部可能构型的集合，维数等于自由度数。例如平面上能平移和转动的物体是 3 维 (x, y, θ)，空间刚体是 6 维，n 个转动关节的固定基座机械臂是 n 维、直接用关节角作坐标。据《Modern Robotics》，Lozano-Pérez 在 1980 年的 MIT 报告中把它引入运动规划：把会与障碍物相撞的构型标成障碍区，其余叫自由空间，于是「让有形状的机器人绕开障碍」变成「让一个点在构型空间里找路」。RRT、PRM 等采样式规划器都在构型空间里工作。","example":"平面两连杆机械臂的构型空间由两个关节角 (θ1, θ2) 组成（严格说是一个环面）；桌上的杯子在这张图上会变成一块不规则禁区，规划路径就是在图上从起点连到终点并绕开禁区。","related":["自由度","关节空间","运动规划","基于采样的规划","碰撞检查","广义坐标"]},{"id":"generalized-coordinates","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"Generalized coordinates - Wikipedia","url":"https://en.wikipedia.org/wiki/Generalized_coordinates"},{"title":"MuJoCo Documentation - Overview (qpos / qvel, nq / nv)","url":"https://mujoco.readthedocs.io/en/stable/overview.html"},{"title":"ros2/common_interfaces - sensor_msgs/msg/JointState.msg","url":"https://github.com/ros2/common_interfaces/blob/rolling/sensor_msgs/msg/JointState.msg"}],"as_of":"","related_ids":["degrees-of-freedom","configuration-space","euler-lagrange-equations","floating-base","joint-space","proprioception"],"name":"广义坐标","alt":"Generalized Coordinates","abbr":"","aliases":["广义速度","广义力","qpos / qvel","关节状态","Joint State","joint_states","关节位置/速度/力矩"],"one_liner":"用一组最少的独立变量（如各关节角）唯一描述机器人整体构型。","explanation":"描述多连杆机器人，可以记下每个连杆在空间的位置和朝向，但它们受关节约束，变量大量冗余。广义坐标只取一组能唯一确定构型的独立参数，对串联机械臂就是各关节角 q，个数通常等于自由度数。它对时间的导数 q̇ 叫广义速度；与每个坐标配对、沿该坐标做功的力叫广义力，对转动关节就是关节力矩。拉格朗日方程、质量矩阵和多数仿真器都在广义坐标下工作。落到代码里：MuJoCo 用 qpos、qvel 存位置和速度，含自由关节或球关节时姿态用四元数，所以位置维数 nq 可大于速度维数 nv；ROS 的 sensor_msgs/JointState（话题常叫 /joint_states）按关节名发布 position、velocity、effort 三组数组，也是很多机器人数据集里「关节状态」的来源。","example":"固定在桌上的 7 自由度机械臂，q 就是 7 个关节角；四足机器人宇树 Go2 在 MuJoCo 里 qpos 是 7（躯干位置 + 四元数）+ 12（腿关节）= 19 维，qvel 是 6 + 12 = 18 维。","related":["自由度","构型空间","拉格朗日方程","浮动基","关节空间","本体感知"]},{"id":"active-dof-passive-dof","category":"mechanics","sec":2,"tier":3,"sources":[{"title":"Parallel manipulator - Wikipedia","url":"https://en.wikipedia.org/wiki/Parallel_manipulator"},{"title":"Inspire RH56DFX Dexterous Hand (product page)","url":"https://en.inspire-robots.com/product/rh56dfx"},{"title":"Shadow Dexterous Hand Series (Shadow Robot)","url":"https://www.shadowrobot.com/dexterous-hand-series/"}],"as_of":"2026-09","related_ids":["degrees-of-freedom","underactuation","parallel-mechanism","dexterous-hand","adaptive-gripper","linkage-transmission"],"name":"主动自由度 / 被动自由度","alt":"Active DoF / Passive DoF","abbr":"","aliases":["主动关节","被动关节","驱动关节","从动关节","Actuated / Passive Joint"],"one_liner":"有电机独立驱动的自由度叫主动，没有独立驱动、靠联动或外力跟着动的叫被动。","explanation":"主动自由度指由执行器（电机、液压缸等）直接、独立驱动的关节自由度；被动自由度指没有独立驱动，运动由机构约束、联动或外力决定的关节。被动关节常见两类：一是并联机构里的球铰、万向节，比如 Stewart 平台由 6 个直线缸驱动，球铰完全被动，位置由整个闭链决定；二是灵巧手、欠驱动夹爪里用连杆或腱绳与主动关节耦合的指节。所以看灵巧手参数要分清「自由度」和「关节数」：前者一般指主动自由度，决定策略能独立控制几个维度，也就是动作空间多大；后者还包括跟着联动的被动关节。被动关节在仿真建模（URDF 的 mimic 关节、闭链约束）和遥操作重定向时都要单独处理。","example":"因时 RH56DFX 灵巧手标称 6 个主动自由度、12 个关节：6 个电机各管一个维度，其余关节靠连杆跟着联动；Shadow 灵巧手则是 20 个主动自由度加 4 个欠驱动耦合关节，共 24 个关节。","related":["自由度","欠驱动","并联机构","灵巧手","自适应夹爪","连杆传动"]},{"id":"underactuation","category":"mechanics","sec":2,"tier":2,"sources":[{"title":"Underactuated Robotics (Russ Tedrake, MIT): Fully-actuated vs Underactuated Systems","url":"https://underactuated.mit.edu/intro.html"},{"title":"Underactuation - Wikipedia","url":"https://en.wikipedia.org/wiki/Underactuation"}],"as_of":"","related_ids":["floating-base","degrees-of-freedom","active-dof-passive-dof","inverted-pendulum-model","adaptive-gripper","nonholonomic-constraint"],"name":"欠驱动","alt":"Underactuation","abbr":"","aliases":["欠驱动系统","Underactuated System","欠驱动机器人"],"one_liner":"电机没法直接产生任意方向的加速度，典型情况是驱动器比自由度少。","explanation":"欠驱动指机械系统不能被直接命令去跟踪任意轨迹。MIT 的 Russ Tedrake 在《Underactuated Robotics》中这样定义：把动力学写成 q̈ = f₁(q, q̇) + f₂(q, q̇)u（q 是广义坐标，u 是控制输入），若 f₂ 的秩小于 q 的维数就是欠驱动，即某些方向的加速度电机直接给不出来。最常见的是驱动器比自由度少，如倒立摆小车、四旋翼。足式和人形也是欠驱动：N 个电机只管 N 个关节，机身在空间中的 6 个自由度没有电机，只能借脚与地面的接触力间接控制，这是行走难的根源。欠驱动手爪则反过来利用这一点，用少量电机带动更多关节去自适应包裹物体。","example":"Acrobot 是只在肘关节装电机的两节摆臂：肩关节完全没有驱动，要把它从下垂甩到倒立，只能靠肘部电机来回摆，把能量一点点「泵」进整个系统。","related":["浮动基","自由度","主动自由度 / 被动自由度","倒立摆模型","自适应夹爪","非完整约束"]},{"id":"kinematics","category":"mechanics","sec":3,"tier":1,"sources":[{"title":"Wikipedia: Kinematics","url":"https://en.wikipedia.org/wiki/Kinematics"},{"title":"Wikipedia: Robot kinematics","url":"https://en.wikipedia.org/wiki/Robot_kinematics"}],"as_of":"","related_ids":["forward-kinematics","inverse-kinematics","differential-kinematics","jacobian-matrix","dynamics","kinematic-chain"],"name":"运动学","alt":"Kinematics","abbr":"","aliases":["机器人运动学","Robot Kinematics"],"one_liner":"只研究运动的几何关系（位置、速度、加速度），不管运动是什么力引起的。","explanation":"运动学是经典力学的分支，研究点和物体如何运动（位置、速度、加速度），不考虑引起运动的力，所以也叫「运动的几何学」；这个词源自安培造的法语词 cinématique。机器人运动学研究关节变量与各连杆、末端位姿之间的几何关系，主要包括正运动学（关节角→末端位姿）、逆运动学（末端位姿→关节角）和微分运动学（关节速度→末端速度，用雅可比矩阵描述）。它只需要连杆长度、关节轴方向等几何参数，不需要质量和惯性；考虑力和力矩的是动力学。轨迹规划、遥操作映射、动作重定向都建立在运动学之上。","example":"已知机械臂每个关节转了多少度，就能算出夹爪现在在哪；这个计算只用到连杆尺寸，和夹爪里东西多重无关，所以属于运动学。","related":["正运动学","逆运动学","微分运动学","雅可比矩阵","动力学","运动链"]},{"id":"joint-space","category":"mechanics","sec":3,"tier":1,"sources":[{"title":"Wikipedia: Configuration space (physics)（Robotic arm / joint space）","url":"https://en.wikipedia.org/wiki/Configuration_space_(physics)"},{"title":"libfranka robot_state.h（q: measured joint position）","url":"https://raw.githubusercontent.com/frankarobotics/libfranka/main/include/franka/robot_state.h"},{"title":"robosuite Documentation: Controllers（Joint Position / Velocity / Torque）","url":"https://robosuite.ai/docs/modules/controllers.html"}],"as_of":"","related_ids":["task-space","configuration-space","forward-kinematics","inverse-kinematics","degrees-of-freedom","action-space"],"name":"关节空间","alt":"Joint Space","abbr":"","aliases":["关节坐标空间","关节角空间"],"one_liner":"把全部关节角（或位移）当坐标的空间，一个点就是机器人的一种关节摆法。","explanation":"关节空间把机器人所有关节变量排成一个向量 q = (q₁, …, qₙ)，n 是关节数，转动关节取角度，移动关节取位移，q 所有可能的取值就构成关节空间。与之相对的是任务空间（也叫笛卡尔空间），用末端位姿描述机器人，两者靠正、逆运动学换算。在关节空间里规划和控制最直接，电机本来就按关节角执行，也没有逆解多解的问题，但末端在空间里走出的路径不直观。用关节角记录的示教数据能在同型号机器人上精确复现，换成结构不同的机器人就不能直接用，所以不少跨本体工作改用末端位姿作动作。","example":"libfranka 读出的 q 是 7 个关节角（单位弧度），就是 Franka 机械臂在关节空间中的一个点；同一时刻的 O_T_EE 则是它在任务空间中的表示。","related":["任务空间","构型空间","正运动学","逆运动学","自由度","动作空间"]},{"id":"task-space","category":"mechanics","sec":3,"tier":1,"sources":[{"title":"Modern Robotics (Lynch & Park, 2017), 2.5 Task Space and Workspace","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"},{"title":"Wikipedia: Robot kinematics","url":"https://en.wikipedia.org/wiki/Robot_kinematics"},{"title":"Wikipedia: Oussama Khatib（operational space formulation, 1980）","url":"https://en.wikipedia.org/wiki/Oussama_Khatib"}],"as_of":"","related_ids":["joint-space","workspace","end-effector-pose","inverse-kinematics","operational-space-control","jacobian-matrix"],"name":"任务空间","alt":"Task Space","abbr":"","aliases":["笛卡尔空间","操作空间","Cartesian Space","Operational Space"],"one_liner":"直接描述任务关心的量的空间，通常指末端的位置和朝向。","explanation":"任务空间和关节空间相对。关节空间用各关节角描述机器人，任务空间直接描述任务关心的量，默认是末端执行器（夹爪等末端工具）的位置和朝向。按 Lynch 与 Park 的《Modern Robotics》，任务空间怎么定义由任务决定、与机器人无关：在纸上画图只需平面二维坐标，操作刚体则要 6 维位姿。因为常用笛卡尔坐标 xyz 表示，也叫笛卡尔空间；Khatib 1980 年提出操作空间控制（代表论文 1987 年发表）时称之为操作空间。关节角到任务空间用正运动学，反过来用逆运动学。VLA 的动作有的定义在任务空间，有的直接在关节空间。","example":"OpenVLA 输出 3 维末端平移 + 3 维旋转 + 1 维夹爪开合，是任务空间动作；ALOHA 上的 ACT 直接输出两条臂共 14 维的关节目标，是关节空间动作。","related":["关节空间","工作空间","末端位姿","逆运动学","操作空间控制","雅可比矩阵"]},{"id":"end-effector-pose","category":"mechanics","sec":3,"tier":1,"sources":[{"title":"robosuite Documentation: Controllers（OSC_POSE）","url":"https://robosuite.ai/docs/modules/controllers.html"},{"title":"libfranka robot_state.h（O_T_EE）","url":"https://raw.githubusercontent.com/frankarobotics/libfranka/main/include/franka/robot_state.h"},{"title":"Wikipedia: Robot end effector","url":"https://en.wikipedia.org/wiki/Robot_end_effector"}],"as_of":"","related_ids":["end-effector","pose","tool-center-point","task-space","inverse-kinematics","delta-action-vs-absolute-action"],"name":"末端位姿","alt":"End-Effector Pose","abbr":"EEF Pose","aliases":["末端执行器位姿","EE Pose","TCP Pose"],"one_liner":"机械臂末端夹爪或工具在空间中的位置加朝向，通常相对基坐标系表示。","explanation":"末端执行器是机械臂最末端、直接和环境打交道的部件，如夹爪、吸盘、焊枪；末端位姿就是它的位置 (x, y, z) 加朝向，合起来 6 个自由度，一般以基坐标系为参照。朝向可用旋转矩阵、四元数、欧拉角或轴角表示，所以不同数据集里末端位姿的维数可能是 6、7 或更多。它连接「任务」和「电机」：人和视觉模型关心夹爪到哪、朝哪，电机只认关节角，两者靠正、逆运动学换算。不少 VLA 和模仿学习策略直接输出末端位姿或其增量，再由控制器解算成关节指令。","example":"robosuite 的 OSC_POSE 控制器接收 6 维动作：前 3 维是末端位置增量，后 3 维是轴角形式的朝向增量；Franka 的 libfranka 接口里，O_T_EE 就是末端在基坐标系下的 4×4 位姿矩阵。","related":["末端执行器","位姿","工具中心点","任务空间","逆运动学","增量动作 / 绝对动作"]},{"id":"tool-center-point","category":"mechanics","sec":3,"tier":2,"sources":[{"title":"RoboDK Documentation: General Tips (Tool Center Point)","url":"https://robodk.com/doc/en/General.html"},{"title":"libfranka robot_state.h (F_T_EE, O_T_EE)","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/robot_state.h"}],"as_of":"","related_ids":["end-effector","tool-flange","end-effector-pose","homogeneous-transformation-matrix","hand-eye-calibration","absolute-positioning-accuracy"],"name":"工具中心点","alt":"Tool Center Point","abbr":"TCP","aliases":["工具坐标系","Tool Frame","末端坐标系","TCP 点"],"one_liner":"末端工具上真正干活的那个参考点，机器人按它而不是法兰去对准目标。","explanation":"工具中心点是定义在末端工具上的参考点，同时带一个坐标系，比如夹爪两指中间、焊枪尖端、吸盘中心。机械臂本身只知道法兰（末端安装面）在哪，装上工具后要设置一个从法兰到 TCP 的固定变换（位置 xyz 加姿态），控制器才能让工具尖去到目标位姿、走直线或绕某点旋转。TCP 设错了，末端会整体偏移，绕点旋转时最明显，所以换工具后通常要重新标定 TCP。具身智能里，数据集和策略输出的「末端位姿」指的是法兰还是 TCP，各家约定不同，跨本体训练时要统一；Franka 的 libfranka 就把法兰坐标系和末端（EE）坐标系分开给出。","example":"给机械臂装上平行夹爪后，把 TCP 设在两指指尖中点：让机器人「绕 TCP 旋转」时，指尖位置不动、只改变夹爪朝向；如果 TCP 还停在法兰上，指尖会甩出一段圆弧。","related":["末端执行器","工具法兰","末端位姿","齐次变换矩阵","手眼标定","绝对定位精度"]},{"id":"forward-kinematics","category":"mechanics","sec":3,"tier":1,"sources":[{"title":"Wikipedia: Forward kinematics","url":"https://en.wikipedia.org/wiki/Forward_kinematics"},{"title":"Modern Robotics（Lynch & Park）Ch.4 Forward Kinematics","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"}],"as_of":"","related_ids":["inverse-kinematics","denavit-hartenberg-parameters","homogeneous-transformation-matrix","kinematic-chain","product-of-exponentials-formula","joint-space"],"name":"正运动学","alt":"Forward Kinematics","abbr":"FK","aliases":["正解","运动学正解","正向运动学"],"one_liner":"已知各关节角度，算出机械臂末端在空间中的位置和朝向。","explanation":"正运动学利用机器人的几何结构（连杆长度、关节轴方向），从关节角算出末端位姿。做法是从基座出发，每经过一个关节和一根连杆就乘一个 4×4 变换矩阵，一路乘到末端，结果就是末端在基坐标系下的位姿。描述每段变换的经典方法是 Denavit 和 Hartenberg 在 1955 年提出的 DH 参数，每个关节用 4 个参数；也可以用指数积公式。串联机械臂的正运动学解唯一，几次矩阵乘法就能算完。它用于由编码器读数显示末端位置、仿真渲染机器人、把关节数据转成末端位姿标签，也是求逆运动学的基础。","example":"平面两连杆臂，连杆长 l₁、l₂，关节角 θ₁、θ₂，末端坐标为 x = l₁cosθ₁ + l₂cos(θ₁+θ₂)，y = l₁sinθ₁ + l₂sin(θ₁+θ₂)。","related":["逆运动学","DH参数","齐次变换矩阵","运动链","指数积公式","关节空间"]},{"id":"inverse-kinematics","category":"mechanics","sec":3,"tier":1,"sources":[{"title":"Wikipedia: Inverse kinematics","url":"https://en.wikipedia.org/wiki/Inverse_kinematics"},{"title":"MathWorks: Inverse Kinematics Algorithms","url":"https://www.mathworks.com/help/robotics/ug/inverse-kinematics-algorithms.html"}],"as_of":"","related_ids":["forward-kinematics","analytical-inverse-kinematics","numerical-inverse-kinematics","jacobian-matrix","singular-configuration","kinematic-redundancy"],"name":"逆运动学","alt":"Inverse Kinematics","abbr":"IK","aliases":["逆解","运动学逆解","反向运动学"],"one_liner":"已知末端要到达的位置和朝向，反推各关节应转到的角度。","explanation":"逆运动学是正运动学的反问题：给定目标末端位姿，求关节角。它难得多：方程非线性，可能有多组解（如肘部朝上或朝下都能到同一点）；7 自由度等冗余机械臂有无穷多解；目标超出工作空间则无解，靠近奇异位形（末端在某些方向上动不了的关节姿势）时数值不稳。求法分两类：解析逆解用封闭公式直接算，快，但只适用于特定结构；数值逆解用雅可比矩阵（关节速度到末端速度的映射）迭代逼近，通用但依赖初值、可能不收敛。VLA 输出末端位姿时，常靠 IK 转成关节指令；动画里拖动角色的手、肩肘自动跟随也是 IK。","example":"让夹爪移到杯子正上方 10 厘米、爪口朝下，IK 求出各关节角；MATLAB 的 Robotics System Toolbox 中，inverseKinematics 默认用 BFGS 梯度投影法数值求解，初值不好时可能只返回近似解。","related":["正运动学","解析逆解","数值逆解","雅可比矩阵","奇异位形","运动学冗余"]},{"id":"workspace","category":"mechanics","sec":3,"tier":1,"sources":[{"title":"Modern Robotics (Lynch & Park, 2017), 2.5 Task Space and Workspace","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"},{"title":"Wikipedia: Work envelope","url":"https://en.wikipedia.org/wiki/Work_envelope"},{"title":"UPenn MEAM 520 讲义: Manipulators（reachable / dexterous workspace）","url":"https://medesign.seas.upenn.edu/uploads/Courses/520-12A-T02.pdf"},{"title":"Franka Robotics: Franka Research 3","url":"https://franka.de/franka-research-3"}],"as_of":"","related_ids":["task-space","configuration-space","reach","reachability-map-inverse-reachability-map","singular-configuration","joint-limits"],"name":"工作空间","alt":"Workspace","abbr":"","aliases":["可达空间","可达工作空间","Reachable Workspace","工作范围","Work Envelope"],"one_liner":"机器人末端能到达的所有位置（和朝向）构成的区域。","explanation":"工作空间是机器人末端执行器能到达的位置（有时连同朝向）的集合，由连杆长度、关节类型和关节限位等结构决定，与具体任务无关；工业机器人规格书常把它画成侧视和俯视的包络图。按《Modern Robotics》的说法，工作空间里的每个点至少有一种关节构型能到达，而任务空间里的点不一定够得着。教材里还常细分：末端至少能以一种朝向到达的点构成可达工作空间，能以任意朝向到达的点构成灵巧工作空间（dexterous workspace），后者只是前者的一部分，两者不能混称。摆放机器人和桌子、选相机视野、生成仿真任务时，都要先确认目标落在工作空间内。","example":"两节连杆长度都为 L 的平面二连杆机械臂，关节不设限位、能转满一圈时，末端工作空间是半径 2L 的圆盘；Franka Research 3 臂展 855 mm，离基座明显超过这个距离的物体就抓不到。","related":["任务空间","构型空间","臂展（工作半径）","可达性地图 / 逆可达性地图","奇异位形","关节限位"]},{"id":"reach","category":"mechanics","sec":3,"tier":2,"sources":[{"title":"Franka Robotics: Franka Research 3","url":"https://franka.de/franka-research-3"},{"title":"Modern Robotics (Lynch & Park), Ch.2 Task Space and Workspace","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"2026-09","related_ids":["workspace","robotic-arm","payload","singular-configuration","reachability-map-inverse-reachability-map","degrees-of-freedom"],"name":"臂展（工作半径）","alt":"Reach (Arm Reach / Working Radius)","abbr":"","aliases":["工作半径","最大臂展","Arm Reach","Working Radius","Max Reach"],"one_liner":"机械臂伸展开时从底座中心能够到的最远距离，是选型基本参数。","explanation":"臂展是机械臂规格书上的基本参数，一般指从底座旋转中心到手腕中心或法兰（末端安装工具的接口）的最大距离，具体测量点以各厂商规格书为准。它大致给出工作空间（末端能到达的全部位置）的外边界：臂展 0.85 m 的臂，大约能覆盖以底座为中心、半径 0.85 m 的范围。但臂展不等于好用的范围：手臂接近伸直时会靠近奇异位形（末端在某些方向上动不了的姿态），灵活度下降、末端朝向受限；实际还要算上夹爪长度和负载带来的力矩限制。做桌面操作或移动操作时，臂展决定了桌子能多深、底盘要停多近，也常用来比较人形机器人手臂和人手臂的尺寸。","example":"Franka Research 3 官网标注臂展 855 mm、负载 3 kg、7 个自由度；把它装在桌边，桌子远端约 1 米处的物体大概率够不着，需要移动底座或把物体挪近。","related":["工作空间","机械臂","负载","奇异位形","可达性地图 / 逆可达性地图","自由度"]},{"id":"denavit-hartenberg-parameters","category":"mechanics","sec":3,"tier":2,"sources":[{"title":"Denavit–Hartenberg parameters - Wikipedia","url":"https://en.wikipedia.org/wiki/Denavit%E2%80%93Hartenberg_parameters"},{"title":"DH Parameters for calculations of kinematics and dynamics - Universal Robots","url":"https://www.universal-robots.com/articles/ur/application-installation/dh-parameters-for-calculations-of-kinematics-and-dynamics/"}],"as_of":"","related_ids":["modified-denavit-hartenberg-parameters","forward-kinematics","homogeneous-transformation-matrix","product-of-exponentials-formula","unified-robot-description-format","link"],"name":"DH参数","alt":"Denavit-Hartenberg Parameters","abbr":"DH","aliases":["DH 参数法","D-H 参数","标准 DH","DH 约定","DH 参数表"],"one_liner":"每个关节只用四个数描述相邻连杆坐标系关系的机械臂建模约定。","explanation":"DH 参数是 Denavit 和 Hartenberg 1955 年在《Journal of Applied Mechanics》上提出的约定：按固定规则给每个连杆绑一个坐标系，相邻坐标系之间的变换就只需 4 个数——沿前一 z 轴的偏移 d、绕前一 z 轴的转角 θ、两关节轴公垂线的长度 a（连杆长度）、绕公垂线的扭角 α。转动关节的 θ 就是关节变量，其余三个是常数。把各关节的 4×4 齐次变换矩阵依次相乘，就得到从基座到末端的正运动学。1981 年 Richard Paul 把它推广到机器人学。Craig 教材的「改进 DH」坐标系位置和变换顺序不同，两种参数表不能混用。","example":"优傲 UR5e 官方公布的标准 DH 参数：关节 1 的 d=0.1625 m、α=π/2；关节 2、3 的 a 分别为 −0.425 m 和 −0.3922 m（大臂、小臂长度）；关节 4–6 的 d 分别为 0.1333、0.0997、0.0996 m。代入公式就能由 6 个关节角算出末端位姿。","related":["改进 DH 参数","正运动学","齐次变换矩阵","指数积公式","统一机器人描述格式","连杆"]},{"id":"modified-denavit-hartenberg-parameters","category":"mechanics","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Denavit–Hartenberg parameters（Modified DH parameters 一节）","url":"https://en.wikipedia.org/wiki/Denavit%E2%80%93Hartenberg_parameters"},{"title":"Franka Robotics 文档：Robot and interface specifications（DH 参数，遵循 Craig 约定）","url":"https://frankarobotics.github.io/docs/robot_specifications.html"},{"title":"Lynch & Park, Modern Robotics（2017）附录 C：Denavit–Hartenberg Parameters","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["denavit-hartenberg-parameters","homogeneous-transformation-matrix","forward-kinematics","product-of-exponentials-formula","kinematic-calibration","franka-emika-panda-franka-research-3"],"name":"改进 DH 参数","alt":"Modified Denavit-Hartenberg Parameters","abbr":"MDH","aliases":["修正 DH","Craig DH","Craig 约定","Modified DH"],"one_liner":"DH 参数的一种变体：连杆坐标系放在连杆近端的关节轴上，变换顺序也不同。","explanation":"改进 DH 参数是 John J. Craig 在教材《Introduction to Robotics: Mechanics and Control》里采用的约定。它和 1955 年 Denavit、Hartenberg 提出的标准 DH 一样，每个关节用 4 个参数（连杆长度 a、扭角 α、偏距 d、关节角 θ）描述相邻两个坐标系的关系。区别在于：坐标系 i 放在关节 i 的轴上（连杆近端），标准 DH 放在关节 i+1 的轴上（远端）；变换顺序变为 Rot_x(α_{i−1})·Trans_x(a_{i−1})·Rot_z(θ_i)·Trans_z(d_i)，即先绕、沿上一个 x 轴，再绕、沿本关节 z 轴，所以表里 a、α 的下标比 θ、d 小 1。两套参数表不能混用，否则正运动学会算错。《Modern Robotics》附录 C 也用这种约定。","example":"Franka Research 3 官方文档的 DH 表注明「遵循 Craig 约定」，例如关节 1 为 a = 0、d = 0.333 m、α = 0，关节 4 为 a = 0.0825 m、d = 0、α = π/2。把这张表直接套进标准 DH 公式，算出的末端位姿会是错的。","related":["DH参数","齐次变换矩阵","正运动学","指数积公式","运动学标定","Franka 机械臂（Panda / FR3）"]},{"id":"product-of-exponentials-formula","category":"mechanics","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Product of exponentials formula","url":"https://en.wikipedia.org/wiki/Product_of_exponentials_formula"},{"title":"Modern Robotics (Lynch & Park), Sec. 4.1 Product of Exponentials Formula","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["screw-theory","denavit-hartenberg-parameters","forward-kinematics","exponential-map","lie-group","kinematic-calibration"],"name":"指数积公式","alt":"Product of Exponentials Formula","abbr":"PoE","aliases":["指数积","PoE 公式","POE"],"one_liner":"把每个关节看作绕旋量轴的运动，连乘各关节矩阵指数得到末端位姿。","explanation":"指数积公式由 Roger Brockett 在 1984 年提出，是描述串联机械臂正运动学的一种方法，Lynch 和 Park 的教材 Modern Robotics 以它为主线。空间形式写作 T(θ) = e^[S₁]θ₁ ⋯ e^[Sₙ]θₙ M：M 是所有关节为零时末端的位姿，Sᵢ 是第 i 个关节在固定基坐标系下的旋量轴（6 维，含转动方向和线速度部分），θᵢ 是关节角或位移，e^[S]θ 表示沿该旋量轴运动 θ 得到的刚体变换。另有把旋量轴写在末端坐标系的物体形式 T = M e^[B₁]θ₁ ⋯。和 DH 参数相比，它只需基座和末端两个坐标系，转动和移动关节统一处理，几何含义直观；代价是参数不是最少的。雅可比、逆运动学和运动学标定都能在它上面推导。","example":"单关节平面臂：连杆长 L，绕基座 z 轴转动。零位时末端在 (L, 0, 0)，即 M；旋量轴 S = (0, 0, 1, 0, 0, 0)。T(θ) = e^[S]θ M 给出末端位置 (L·cosθ, L·sinθ, 0)。","related":["旋量理论","DH参数","正运动学","指数映射","李群","运动学标定"]},{"id":"numerical-inverse-kinematics","category":"mechanics","sec":3,"tier":2,"sources":[{"title":"Modern Robotics 6.2: Numerical Inverse Kinematics (Part 1 of 2)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/6-2-numerical-inverse-kinematics-part-1-of-2/"},{"title":"Modern Robotics 6.2: Numerical Inverse Kinematics (Part 2 of 2)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/6-2-numerical-inverse-kinematics-part-2-of-2/"},{"title":"Wikipedia: Inverse kinematics","url":"https://en.wikipedia.org/wiki/Inverse_kinematics"}],"as_of":"","related_ids":["inverse-kinematics","analytical-inverse-kinematics","jacobian-pseudoinverse","damped-least-squares","jacobian-transpose-method","trac-ik"],"name":"数值逆解","alt":"Numerical Inverse Kinematics","abbr":"","aliases":["数值逆运动学","数值 IK","迭代法逆解","Numerical IK","Iterative IK"],"one_liner":"从初始猜测出发反复迭代修正关节角，逼近目标末端位姿的逆运动学解法。","explanation":"逆运动学要根据期望的末端位姿求关节角。解析逆解靠推导闭式公式，只适用于结构特殊的机械臂；数值逆解更通用：从一个初始关节角出发，用正运动学算出当前末端与目标的误差，再借助雅可比矩阵把误差换算成关节角修正量，反复迭代直到误差足够小。最基本的是牛顿-拉夫森法配雅可比伪逆，常见改进有阻尼最小二乘（在奇异附近防止关节角暴跳）、雅可比转置法，以及把关节限位、避障写成约束的优化式求解。缺点是只收敛到离初值较近的一个解，也可能不收敛或陷入局部最优。实时控制中用上一时刻的关节角作初值，通常几步就收敛。KDL、TRAC-IK、mink 等库都提供数值 IK。","example":"VR 遥操作时，每帧把头显手柄的位姿作为机械臂末端目标，以上一帧的关节角为初值迭代几步数值 IK，就能实时得到各关节角。","related":["逆运动学","解析逆解","雅可比伪逆","阻尼最小二乘法","雅可比转置法","TRAC-IK"]},{"id":"analytical-inverse-kinematics","category":"mechanics","sec":3,"tier":2,"sources":[{"title":"Modern Robotics: Mechanics, Planning, and Control（Lynch & Park, 2017 预印本）第 6 章 Inverse Kinematics","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Inverse kinematics - Wikipedia","url":"https://en.wikipedia.org/wiki/Inverse_kinematics"},{"title":"IKFast Kinematics Solver - MoveIt Documentation","url":"https://moveit.picknik.ai/main/doc/examples/ikfast/ikfast_tutorial.html"}],"as_of":"","related_ids":["inverse-kinematics","numerical-inverse-kinematics","forward-kinematics","spherical-wrist","ikfast","kinematic-redundancy"],"name":"解析逆解","alt":"Analytical Inverse Kinematics","abbr":"","aliases":["闭式解","封闭解","Closed-form IK","解析逆运动学","Analytic IK"],"one_liner":"事先推好公式，代入末端位姿就直接算出全部关节角的逆运动学解法。","explanation":"逆运动学（已知末端位姿求各关节角）有两类解法：数值法靠迭代逼近，解析法则事先推出公式，代入末端位姿一次算出所有关节角。解析解只对特定结构存在，典型条件是 6 轴臂的后三个关节轴交于一点（球形手腕），这时位置和姿态可以拆开分别求，PUMA 型臂就是这种结构。它的好处是快、稳定，而且能列出全部解：《Modern Robotics》指出一般 6R 串联臂最多有 16 组解，带偏置的 PUMA 型臂仅位置部分就有 4 组。缺点是换一种构型就得重新推导。工具 IKFast 能自动分析运动链并生成解析解的 C++ 代码，求解一次只需几微秒。","example":"PUMA 型 6 轴臂先由腕心位置解出前三个关节（肩左/右 × 肘上/下共 4 种组合），再由末端姿态解出后三个腕关节，腕部还可翻转；这类带球形手腕的臂对同一个末端位姿最多有 8 组解，控制器通常挑离当前关节角最近的一组执行。","related":["逆运动学","数值逆解","正运动学","球形手腕","IKFast","运动学冗余"]},{"id":"spherical-wrist","category":"mechanics","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Donald L. Pieper","url":"https://en.wikipedia.org/wiki/Donald_L._Pieper"},{"title":"Wikipedia: Inverse kinematics","url":"https://en.wikipedia.org/wiki/Inverse_kinematics"}],"as_of":"","related_ids":["inverse-kinematics","analytical-inverse-kinematics","6-axis-robot-arm","ikfast","denavit-hartenberg-parameters","singular-configuration"],"name":"球形手腕","alt":"Spherical Wrist","abbr":"","aliases":["球腕","三轴交于一点手腕","Pieper 准则","321 构型"],"one_liner":"机械臂最后三个转动关节的轴线交于一点的手腕结构。","explanation":"球形手腕指 6 自由度机械臂最后三个转动关节的轴线交于同一点（腕心），效果类似一个球关节：只改变末端朝向，不改变腕心位置。Donald Pieper 在 1968 年的斯坦福博士论文中证明，有 6 个转动关节、且其中三个相邻关节轴线交于一点的串联机械臂，逆运动学可以写出闭式解（后人称为 Pieper 准则）。原因是位置和姿态可以解耦：先由目标位姿倒推出腕心位置，用前三个关节把腕心送到位；再用后三个关节凑出要求的朝向。这样逆解能直接用公式算，不必迭代，还能列出全部解（这类构型最多可达 8 组）。许多工业六轴机械臂都采用「正交平行基座 + 球形手腕」的布局，PUMA 560 是经典例子。","example":"给这类机械臂一个目标位姿：先沿末端工具方向往回退一段固定长度，得到腕心应在的位置，用前三个关节把腕心送过去；再算后三个关节角，把夹爪转到要求的朝向。","related":["逆运动学","解析逆解","六轴机械臂","IKFast","DH参数","奇异位形"]},{"id":"reachability-map-inverse-reachability-map","category":"mechanics","sec":3,"tier":3,"sources":[{"title":"RM4D: A Combined Reachability and Inverse Reachability Map for Common 6-/7-axis Robot Arms (arXiv 2410.06968)","url":"https://arxiv.org/html/2410.06968"}],"as_of":"","related_ids":["workspace","inverse-kinematics","mobile-manipulation","mobile-manipulator","grasp-planning","manipulability"],"name":"可达性地图 / 逆可达性地图","alt":"Reachability Map / Inverse Reachability Map","abbr":"RM / IRM","aliases":["能力图","Capability Map","逆能力图","Inverse Capability Map"],"one_liner":"离线预存机械臂能到达哪些末端位姿；逆图反查底座放哪能够到目标。","explanation":"可达性地图是对机械臂工作空间的离线预计算：把末端周围的空间划成三维体素，每个体素里再采样若干朝向，用逆运动学逐一检查能否到达，把结果（常用可达朝向的比例表示可达程度）存成表，用时直接查，不必现场反复求逆解。Zacharias 等人在 2007 年提出了这种「能力图」。逆可达性地图把每个可达位姿取逆，得到「以目标末端位姿为原点，底座可以放在哪里」的分布，Vahrenkamp 等人在 2013 年用它解决移动操作机器人的底座摆放问题。它们常用于抓取规划里筛掉够不着的抓取、移动操作里选站位，以及评估机器人设计和安装位置；2024 年的 RM4D 把两者压缩进同一个四维数据结构。","example":"移动机器人去桌边拿杯子：以候选抓取位姿为中心查逆可达性地图，得到地面上一片「站在这里能够到」的区域，去掉会撞桌子或不可通行的位置，再选可达程度最高的点作为导航目标。","related":["工作空间","逆运动学","移动操作","复合机器人","抓取规划","可操作度"]},{"id":"joint-zero-position-calibration","category":"mechanics","sec":3,"tier":2,"sources":[{"title":"Incremental encoder - Wikipedia","url":"https://en.wikipedia.org/wiki/Incremental_encoder"},{"title":"ROBOTIS e-Manual: XM430-W350 (Homing Offset)","url":"https://emanual.robotis.com/docs/en/dxl/x/xm430-w350/"},{"title":"LeRobot Docs: SO-101 (Calibrate)","url":"https://huggingface.co/docs/lerobot/so101"}],"as_of":"","related_ids":["rotary-encoder","incremental-encoder","absolute-encoder","kinematic-calibration","joint-limits","leader-follower-teleoperation"],"name":"零位标定（零点标定）","alt":"Joint Zero-Position Calibration (Homing / Offset Calibration)","abbr":"","aliases":["零点标定","回零","关节零位标定","Homing","Zero Offset Calibration","Homing Offset"],"one_liner":"测出每个关节读数为零时实际在哪个角度，让软件模型和实物对上号。","explanation":"机器人的正运动学和 URDF 模型都约定，所有关节角为 0 时对应一个确定姿态（零位）。但编码器装上去时读数原点是随意的，装配误差、更换电机都会让读数和模型角度差一个固定偏移。零位标定就是测出这个偏移并存下来，之后每次读数都据此修正。用增量式编码器（只记录相对变化）的关节每次上电都要回零：把关节转到机械限位、限位开关或编码器索引信号处，重新设定计数；绝对值编码器通常只需标定一次。舵机也有类似参数，如 Dynamixel 的 Homing Offset。零位不准会让末端位置出现系统误差，也会让同一个策略换一台机器人就不好用。","example":"组装好 LeRobot 的 SO-101 机械臂后要运行 lerobot-calibrate：先把所有关节摆到各自行程中间，再逐个转满全行程。官方文档说明，这一步是为了让主臂和从臂在相同物理姿态下读数一致，训练出的模型才能换到另一台机器上用。","related":["编码器","增量式编码器","绝对值编码器","运动学标定","关节限位","主从臂遥操作"]},{"id":"kinematic-calibration","category":"mechanics","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Robot calibration","url":"https://en.wikipedia.org/wiki/Robot_calibration"},{"title":"A Visual Kinematics Calibration Method for Manipulator Based on Nonlinear Optimization (arXiv:2005.08420)","url":"https://arxiv.org/abs/2005.08420"},{"title":"Bayesian Optimal Experimental Design for Robot Kinematic Calibration (arXiv:2409.10802)","url":"https://arxiv.org/abs/2409.10802"}],"as_of":"","related_ids":["denavit-hartenberg-parameters","modified-denavit-hartenberg-parameters","joint-zero-position-calibration","absolute-positioning-accuracy","pose-repeatability","hand-eye-calibration"],"name":"运动学标定","alt":"Kinematic Calibration","abbr":"","aliases":["DH 参数标定","几何参数标定","机器人标定"],"one_liner":"实测机器人末端位置，反推并修正模型里的连杆长度、关节零位等几何参数。","explanation":"控制器用一套名义运动学参数（如 DH 参数：连杆长度、扭角、偏距、关节零位）算末端位置，但加工装配公差和磨损会让真实参数偏离图纸，结果是重复定位精度（回到同一点）高、绝对定位精度（到达指定坐标）差。运动学标定就是修正这套参数：让机器人摆出多组姿态，用激光跟踪仪、相机等外部设备测出末端真实位置，与模型预测对比，用最小二乘等优化反解出参数误差，再写回控制器补偿。通常分三级：一级只标关节零位（编码器读数与真实角度的偏差），二级标全部几何参数，三级再加上关节柔性、摩擦等非几何误差。据维基百科，六轴工业机器人标定后绝对精度可提高约一个数量级，多数情况下误差降到 1 毫米以内。","example":"离线编程或多台同型号机械臂共用一套轨迹时，未标定的机器落点会各不相同。一种做法是在末端装标定板，用单目相机在几十个姿态下拍照，以像素重投影误差为目标优化出修正后的 DH 参数（arXiv:2005.08420）。","related":["DH参数","改进 DH 参数","零位标定（零点标定）","绝对定位精度","重复定位精度","手眼标定"]},{"id":"absolute-positioning-accuracy","category":"mechanics","sec":3,"tier":3,"sources":[{"title":"Robot calibration - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_calibration"},{"title":"RoboDK Documentation: Robot Calibration (Laser Tracker)","url":"https://robodk.com/doc/en/Robot-Calibration-LaserTracker.html"}],"as_of":"","related_ids":["pose-repeatability","kinematic-calibration","offline-programming","tool-center-point","hand-eye-calibration","digital-twin"],"name":"绝对定位精度","alt":"Absolute Positioning Accuracy","abbr":"","aliases":["绝对精度","位姿准确度","Pose Accuracy","Absolute Accuracy"],"one_liner":"让机器人去一个算出来的坐标，它实际到达的位置和目标差多少。","explanation":"绝对定位精度衡量末端实际到达的位置与指令给出的理论位置有多接近，ISO 9283 标准里对应位姿准确度（AP）。它和重复定位精度（RP，多次回到同一点的离散程度）是两回事：工业机械臂通常「重复性很好、绝对精度不高」，因为连杆长度、关节零位的制造误差，以及受载变形、温度等，会让控制器里的运动学模型和真机对不上。用示教器手动示教点位时，重复性好就够用；而离线编程、从仿真或相机算出坐标直接下发时，绝对精度就成了瓶颈。常用办法是运动学标定：用激光跟踪仪等测出真实位姿，辨识模型误差，六轴工业机器人的绝对精度通常能提高数倍到十倍，多数情况可降到 1 毫米以内。","example":"在仿真里离线规划好一串抓取点，直接发给真机：机械臂每次都能稳定回到同一个位置（重复性好），但这个位置和仿真里的目标点整体偏开一截，这个偏差就是绝对定位误差；做视觉引导抓取时，它还会和手眼标定误差叠加。","related":["重复定位精度","运动学标定","离线编程","工具中心点","手眼标定","数字孪生"]},{"id":"differential-kinematics","category":"mechanics","sec":4,"tier":2,"sources":[{"title":"Robotic Manipulation (MIT, Russ Tedrake) - Basic Pick and Place: Differential kinematics","url":"https://manipulation.csail.mit.edu/pick.html"},{"title":"kevinzakka/mink - GitHub","url":"https://github.com/kevinzakka/mink"},{"title":"stephane-caron/pink - GitHub","url":"https://github.com/stephane-caron/pink"}],"as_of":"","related_ids":["jacobian-matrix","inverse-kinematics","jacobian-pseudoinverse","damped-least-squares","singular-configuration","mink"],"name":"微分运动学","alt":"Differential Kinematics","abbr":"","aliases":["速度运动学","Velocity Kinematics","微分逆运动学","Differential Inverse Kinematics","Diff IK"],"one_liner":"用雅可比矩阵把关节速度和末端速度联系起来的运动学。","explanation":"正运动学回答「关节角是多少时末端在哪」，微分运动学回答「关节转多快时末端动多快」。桥梁是雅可比矩阵 J(q)，即正运动学对关节角 q 的偏导：V = J(q)·q̇，V 是末端 6 维空间速度（3 维线速度 + 3 维角速度），q̇ 是各关节速度。反过来用就是微分逆运动学：给定期望末端速度 V_d，用伪逆（非方阵上的「求逆」）算 q̇ = J⁺V_d，再积分成关节角指令，每个控制周期重复一次。它不必一次性求解析逆解，很适合遥操作和输出末端增量动作的策略；但在奇异位形（J 降秩）附近伪逆会爆大，实际常用阻尼最小二乘，或写成带关节限位的二次规划。Pink、mink 都是这类库。","example":"VR 遥操作时，每个控制周期把手柄的位移换算成末端期望速度，用 q̇ = J⁺V_d 求出 7 个关节该转多快，机械臂末端就平滑地跟着手走。","related":["雅可比矩阵","逆运动学","雅可比伪逆","阻尼最小二乘法","奇异位形","mink"]},{"id":"jacobian-matrix","category":"mechanics","sec":4,"tier":2,"sources":[{"title":"Modern Robotics 5.1.1: Space Jacobian (Northwestern)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/5-1-1-space-jacobian/"},{"title":"Modern Robotics (Lynch & Park) preprint PDF, Ch. 5 Velocity Kinematics and Statics","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["differential-kinematics","jacobian-pseudoinverse","singular-configuration","inverse-kinematics","manipulability","geometric-vs-analytical-jacobian"],"name":"雅可比矩阵","alt":"Jacobian Matrix","abbr":"J","aliases":["雅可比","Jacobian","速度雅可比","空间雅可比","物体雅可比"],"one_liner":"把各关节转速换算成末端执行器速度的矩阵，随机器人姿态变化。","explanation":"数学上，雅可比矩阵是多元函数一阶偏导数排成的矩阵。在机器人学里，它描述关节速度和末端速度的线性关系：V = J(θ)·θ̇。θ̇ 是 n 个关节的速度；V 是末端的 6 维速度（3 维角速度加 3 维线速度，又叫运动旋量）；J 是 6×n 矩阵，第 i 列表示只让第 i 个关节以单位速度转动时末端怎么动。J 依赖当前关节角 θ，姿态一变就要重算。它有三个主要用途：用 J 的逆或伪逆由期望末端速度反推关节速度，这是数值逆运动学的基础；判断奇异位形，J 掉秩时末端在某些方向上动不了；静力映射 τ = Jᵀ·F，把末端要施加的力 F 换算成关节力矩 τ，力控和阻抗控制都靠它。","example":"平面两连杆机械臂完全伸直时，两个关节无论怎么转，末端都无法沿手臂方向继续往外走，此时 J 掉秩，机械臂处于奇异位形。","related":["微分运动学","雅可比伪逆","奇异位形","逆运动学","可操作度","几何雅可比与解析雅可比"]},{"id":"twist","category":"mechanics","sec":4,"tier":2,"sources":[{"title":"Modern Robotics 3.3.2: Twists","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/3-3-2-twists-part-1-of-2/"},{"title":"ROS 2 geometry_msgs/Twist.msg","url":"https://raw.githubusercontent.com/ros2/common_interfaces/rolling/geometry_msgs/msg/Twist.msg"}],"as_of":"","related_ids":["wrench","screw-theory","jacobian-matrix","adjoint-representation","product-of-exponentials-formula","cmd-vel-topic"],"name":"运动旋量（速度旋量）","alt":"Twist (Spatial Velocity)","abbr":"","aliases":["Twist","速度旋量","空间速度","六维速度"],"one_liner":"把刚体的角速度和线速度拼成一个 6 维向量，统一描述它怎么动。","explanation":"运动旋量是描述刚体瞬时速度的 6 维向量 V = (ω, v)：ω 是 3 维角速度，v 是 3 维线速度，在同一坐标系下表示。它来自旋量理论：任何刚体运动都可看成绕某根螺旋轴的转动加沿轴平移，运动旋量就是这根轴乘以转速。在世界系下表示叫空间旋量，在刚体自身坐标系下表示叫物体旋量，两者可用伴随变换互转。机械臂的雅可比矩阵做的事，就是把关节速度映射成末端的运动旋量。注意顺序约定：Lynch 和 Park 的《现代机器人学》写成（角速度，线速度），ROS 的 geometry_msgs/Twist 则先 linear 后 angular。","example":"ROS 里给移动底盘发 cmd_vel 指令就是发一条 Twist 消息：linear.x = 0.5 表示以 0.5 m/s 向前开，angular.z = 0.3 表示同时以 0.3 rad/s 绕竖直轴向左转，其余 4 个分量为 0。","related":["力旋量","旋量理论","雅可比矩阵","伴随变换","指数积公式","cmd_vel 速度指令话题（Twist 消息）"]},{"id":"geometric-vs-analytical-jacobian","category":"mechanics","sec":4,"tier":3,"sources":[{"title":"Lynch & Park, Modern Robotics（预印本 PDF，5.1.5 节 Alternative Notions of the Jacobian）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["jacobian-matrix","differential-kinematics","euler-angles","gimbal-lock","twist","singular-configuration"],"name":"几何雅可比与解析雅可比","alt":"Geometric vs. Analytical Jacobian","abbr":"","aliases":["几何雅可比","解析雅可比","Geometric Jacobian","Analytic Jacobian"],"one_liner":"都把关节速度映射到末端速度，区别是姿态部分用角速度还是姿态坐标的导数。","explanation":"雅可比矩阵描述关节速度 q̇ 与末端速度的线性关系，按末端速度怎么表示分两种。几何雅可比输出末端线速度和角速度 ω（《Modern Robotics》里对应空间 / 本体雅可比；Siciliano 等教材的定义略有不同，叫法不完全统一）。解析雅可比先用一组最少坐标描述末端位姿，如位置加欧拉角，再对这组坐标求导，得到 ẋ = J_a q̇。角速度并不等于欧拉角的导数，两者差一个取决于姿态表示的变换矩阵；它在某些姿态下不可逆（如万向节死锁），此时解析雅可比失效，哪怕机械臂并不在奇异位形。速度控制和静力学（τ = JᵀF）一般用几何雅可比，在欧拉角等坐标上做误差反馈或轨迹优化时用解析雅可比。","example":"用 ZYX 欧拉角描述末端姿态时，俯仰角到 ±90° 会出现万向节死锁，某些方向的角速度无法用有限的欧拉角导数表示，解析雅可比不可逆；几何雅可比在同一姿态下仍然正常。","related":["雅可比矩阵","微分运动学","欧拉角","万向节死锁","运动旋量（速度旋量）","奇异位形"]},{"id":"singular-configuration","category":"mechanics","sec":4,"tier":2,"sources":[{"title":"Modern Robotics 5.3: Singularities (Northwestern)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/5-3-singularities/"},{"title":"Modern Robotics 6.2: Numerical Inverse Kinematics (Part 1 of 2)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/6-2-numerical-inverse-kinematics-part-1-of-2/"}],"as_of":"","related_ids":["jacobian-matrix","manipulability","damped-least-squares","jacobian-pseudoinverse","spherical-wrist","workspace"],"name":"奇异位形","alt":"Kinematic Singularity","abbr":"","aliases":["奇异点","奇异构型","奇异性","运动学奇异","Singularity","Singular Configuration","腕部奇异","边界奇异"],"one_liner":"雅可比矩阵降秩、末端在某些方向上动不了的机械臂姿态。","explanation":"奇异位形是机械臂的一类特殊姿态。雅可比矩阵（把关节速度换算成末端速度的矩阵）在多数姿态下满秩，到了奇异位形会降秩，末端在某个方向上无论关节怎么转都动不了。常见两类：边界奇异是手臂完全伸直、末端到了工作空间边缘；腕部奇异是六轴臂的两根腕部关节轴线转到共线，少了一个有效自由度。靠近奇异时，末端走一小段直线可能要求某些关节转得极快，逆解也容易发散。所以轨迹规划要避开它，数值逆解常用阻尼最小二乘压住关节速度，可操作度则用来衡量离奇异还有多远。","example":"平面两连杆臂完全伸直时，末端只能沿垂直于手臂的方向运动，沿手臂方向继续向外的速度无论如何都产生不了；此时沿手臂方向的外力由结构直接承受，关节不用出力。","related":["雅可比矩阵","可操作度","阻尼最小二乘法","雅可比伪逆","球形手腕","工作空间"]},{"id":"manipulability","category":"mechanics","sec":4,"tier":3,"sources":[{"title":"Lynch & Park, Modern Robotics（2017）5.4 节：Manipulability","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Wikipedia: Manipulability ellipsoid","url":"https://en.wikipedia.org/wiki/Manipulability_ellipsoid"},{"title":"Buss 逆运动学综述（参考文献列出 Yoshikawa, Manipulability of robotic mechanisms, IJRR 1985）","url":"https://mathweb.ucsd.edu/~sbuss/ResearchWeb/ikmethods/iksurvey.pdf"}],"as_of":"","related_ids":["jacobian-matrix","singular-configuration","kinematic-redundancy","null-space","jacobian-pseudoinverse"],"name":"可操作度","alt":"Manipulability","abbr":"","aliases":["可操作性","可操作度椭球","Manipulability Ellipsoid","Yoshikawa 可操作度"],"one_liner":"衡量机械臂在当前姿态下末端往各方向动有多容易、离奇异有多远的指标。","explanation":"可操作度由 T. Yoshikawa 在 1985 年发表于 IJRR 的论文中首次定量提出。给定雅可比矩阵 J（把关节速度映射成末端速度），让关节速度取遍单位球 ‖θ̇‖ = 1，对应的末端速度会构成一个椭球，叫可操作度椭球：主轴方向是 JJᵀ 的特征向量，半轴长是对应特征值的平方根。椭球在某方向越长，末端越容易往那个方向动；某方向被压扁，说明正在靠近奇异位形（某方向失去运动能力的姿态），到奇异时椭球塌成线段或平面。常用标量指标 w = √det(JJᵀ)，与椭球体积成正比，奇异时为 0。它用于挑选作业姿态和设计结构，也常作为冗余机械臂零空间运动的优化目标，让手臂主动远离奇异。","example":"平面二连杆臂（连杆长 L1、L2）的可操作度 w = L1·L2·|sin θ2|，θ2 是肘关节角：手臂伸直（θ2 = 0）时 w = 0，末端沿手臂方向无法再伸；肘部弯成 90° 时 w 最大，末端往各方向都好动。","related":["雅可比矩阵","奇异位形","运动学冗余","零空间","雅可比伪逆"]},{"id":"jacobian-pseudoinverse","category":"mechanics","sec":4,"tier":3,"sources":[{"title":"Buss, Introduction to Inverse Kinematics with Jacobian Transpose, Pseudoinverse and Damped Least Squares methods","url":"https://mathweb.ucsd.edu/~sbuss/ResearchWeb/ikmethods/iksurvey.pdf"},{"title":"Wikipedia: Moore–Penrose inverse","url":"https://en.wikipedia.org/wiki/Moore%E2%80%93Penrose_inverse"},{"title":"Lynch & Park, Modern Robotics（2017）6.2 节：数值逆运动学","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["jacobian-matrix","numerical-inverse-kinematics","damped-least-squares","null-space","singular-configuration","kinematic-redundancy"],"name":"雅可比伪逆","alt":"Jacobian Pseudoinverse","abbr":"","aliases":["Moore-Penrose 伪逆","广义逆","J⁺","J†"],"one_liner":"雅可比矩阵不可逆时用的「替代逆」，给出误差最小、关节动得最少的解。","explanation":"雅可比矩阵 J 把关节速度 θ̇ 映射成末端速度 ẋ：ẋ = Jθ̇。反求关节速度要用 J 的逆，但 J 常不是方阵（7 关节臂的 J 是 6×7），或在奇异位形（某些方向动不了的姿态）附近不可逆。这时改用 Moore-Penrose 伪逆 J⁺（Moore 1920 年、Bjerhammar 1951 年、Penrose 1955 年各自独立提出）：有精确解时，它给出所有解里关节动得最少（范数最小）的那个；没有精确解时，给出误差最小的最小二乘解。J 满秩且关节多于任务维度时 J⁺ = Jᵀ(JJᵀ)⁻¹。它是数值逆运动学的基本工具，但接近奇异时解会暴涨，实践中常改用阻尼最小二乘法。","example":"7 自由度机械臂按 θ̇ = J⁺ẋ + (I − J⁺J)φ 求关节速度：前一项让末端跟上期望速度 ẋ；后一项把任意向量 φ 投影到零空间，只改肘部等姿态、不影响末端，可用来避开关节限位（这种用法由 Liégeois 1977 年提出）。","related":["雅可比矩阵","数值逆解","阻尼最小二乘法","零空间","奇异位形","运动学冗余"]},{"id":"damped-least-squares","category":"mechanics","sec":4,"tier":3,"sources":[{"title":"Buss: Introduction to Inverse Kinematics with Jacobian Transpose, Pseudoinverse and Damped Least Squares methods","url":"https://mathweb.ucsd.edu/~sbuss/ResearchWeb/ikmethods/iksurvey.pdf"},{"title":"Wikipedia: Levenberg–Marquardt algorithm","url":"https://en.wikipedia.org/wiki/Levenberg%E2%80%93Marquardt_algorithm"}],"as_of":"","related_ids":["inverse-kinematics","numerical-inverse-kinematics","jacobian-matrix","jacobian-pseudoinverse","singular-configuration","jacobian-transpose-method"],"name":"阻尼最小二乘法","alt":"Damped Least Squares","abbr":"DLS","aliases":["阻尼伪逆","Levenberg-Marquardt 逆解","LM 法","奇异鲁棒逆"],"one_liner":"数值逆解时给雅可比求逆加阻尼项，让机械臂在奇异位形附近不乱动。","explanation":"阻尼最小二乘法是迭代求逆运动学的方法，也叫 Levenberg-Marquardt 方法，1986 年 Wampler 和 Nakamura、Hanafusa 分别把它用于逆运动学。每步关节增量 Δθ = Jᵀ(JJᵀ + λ²I)⁻¹e：J 是雅可比矩阵（关节速度到末端速度的映射），e 是末端当前位姿与目标的误差，λ 是阻尼系数，I 是单位矩阵。它等价于最小化 ‖JΔθ − e‖² + λ²‖Δθ‖²，既要减小误差，又不让关节一步走太大。直接用伪逆时，接近奇异位形（末端某个方向动不了的姿态）会算出极大的关节速度；加了 λ 后分母不再趋零，动作平稳。代价是 λ 太大收敛变慢，所以常按离奇异的远近动态调整 λ。","example":"机械臂伸直时接近奇异，伪逆可能要求某关节瞬间转很多圈；把 λ 设为 0.05 左右后，该方向误差收敛慢一点，但关节速度保持在正常范围。","related":["逆运动学","数值逆解","雅可比矩阵","雅可比伪逆","奇异位形","雅可比转置法"]},{"id":"jacobian-transpose-method","category":"mechanics","sec":4,"tier":3,"sources":[{"title":"Buss, Introduction to Inverse Kinematics with Jacobian Transpose, Pseudoinverse and Damped Least Squares methods","url":"https://mathweb.ucsd.edu/~sbuss/ResearchWeb/ikmethods/iksurvey.pdf"},{"title":"Lynch & Park, Modern Robotics（2017）5.2 节：开链静力学 τ = JᵀF","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["jacobian-matrix","numerical-inverse-kinematics","jacobian-pseudoinverse","damped-least-squares","cartesian-impedance-control","principle-of-virtual-work"],"name":"雅可比转置法","alt":"Jacobian Transpose Method","abbr":"","aliases":["Jᵀ 法","转置雅可比法"],"one_liner":"用雅可比矩阵的转置代替逆来迭代求逆运动学，计算便宜但收敛较慢。","explanation":"雅可比转置法是一种数值逆运动学方法，1984 年由 Balestrino 等人和 Wolovich、Elliott 分别用于逆解。每步令 Δθ = αJᵀe：e 是末端到目标的位置误差，Jᵀ 是雅可比矩阵的转置，α 是小步长。依据来自静力学关系 τ = JᵀF：设想一根虚拟弹簧把末端拉向目标、产生力 F，折算到各关节的力矩就是 JᵀF，关节顺着它动，步长够小时误差一定下降（因为 ⟨JJᵀe, e⟩ = ‖Jᵀe‖² ≥ 0）。它不用求逆，每步计算极快，接近奇异也不会数值爆炸，代价是收敛慢、易振荡。同样的 Jᵀ 映射也是笛卡尔阻抗控制的核心：末端虚拟弹簧力经 Jᵀ 变成关节力矩。","example":"让动画角色或机械臂的手去够一个目标点：每次迭代算一次 Δθ = αJᵀe 更新关节角，几十步后手逐渐贴近目标。Buss 的对比测试里，它在单末端场景可用，在 Y 形分叉的多末端场景效果明显差于阻尼最小二乘法。","related":["雅可比矩阵","数值逆解","雅可比伪逆","阻尼最小二乘法","笛卡尔阻抗控制","虚功原理"]},{"id":"kinematic-redundancy","category":"mechanics","sec":4,"tier":2,"sources":[{"title":"Modern Robotics (Lynch & Park) preprint PDF, Example 4.7 与 Ch. 5–6","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["null-space","jacobian-pseudoinverse","7-dof-robot-arm","swivel-angle","null-space-control","inverse-kinematics"],"name":"运动学冗余","alt":"Kinematic Redundancy","abbr":"","aliases":["冗余自由度","冗余度","冗余分辨","Redundancy Resolution","冗余机械臂","Redundant Manipulator"],"one_liner":"关节数多于任务所需自由度，同一个末端位姿对应无数种关节构型。","explanation":"如果机器人的关节数 n 大于任务空间维度 m，就说它对这个任务运动学冗余，多出的 n−m 个自由度叫冗余度。末端完整位姿是 6 维，所以 7 轴机械臂有 1 个冗余自由度：末端固定时，肘部仍能在一定范围内移动。这种不影响末端的内部运动叫自运动，对应雅可比矩阵的零空间。冗余意味着同一目标有无穷多组关节解，冗余分辨就是按某个准则从中挑一个：最常用的雅可比伪逆给出关节速度平方和最小的解，还可在零空间里叠加避障、远离关节限位或奇异位形等次要任务。代价是逆运动学没有唯一解，需要额外优化。冗余是相对任务而言的：只关心末端位置（3 维）时，6 轴臂也算冗余。","example":"把手掌平放在桌上不动，你仍能抬高或放低肘部，这就是人手臂的冗余自由度；7 轴机械臂也能在末端不动时调整肘部位置，绕开旁边的障碍物。","related":["零空间","雅可比伪逆","七自由度机械臂","臂型角（肘部自运动角）","零空间控制","逆运动学"]},{"id":"null-space","category":"mechanics","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Kernel (linear algebra)","url":"https://en.wikipedia.org/wiki/Kernel_(linear_algebra)"},{"title":"StudyWolf: Robot control part 5 – Controlling in the null space","url":"https://studywolf.wordpress.com/2013/09/17/robot-control-5-controlling-in-the-null-space/"}],"as_of":"","related_ids":["kinematic-redundancy","null-space-control","jacobian-pseudoinverse","task-prioritization","swivel-angle","jacobian-matrix"],"name":"零空间","alt":"Null Space","abbr":"","aliases":["核空间","雅可比零空间","零空间运动","自运动","Kernel","Jacobian Null Space","Self-Motion"],"one_liner":"让矩阵输出为零的全部输入；对冗余机械臂，指不改变末端位姿的关节运动。","explanation":"零空间本是线性代数概念：矩阵 A 的零空间是所有满足 Ax = 0 的向量 x。机器人里常说的是雅可比矩阵 J 的零空间：J 把关节速度换算成末端速度，落在零空间里的关节速度不会让末端移动或转动。关节数多于任务所需自由度的冗余机械臂（如 7 轴臂做 6 维位姿任务）始终存在这种运动，叫自运动；非冗余臂只在奇异位形才出现。零空间控制就利用这一点：主任务保证末端跟踪目标，次要目标（避开关节限位、避障、远离奇异）通过投影矩阵 (I − J⁺J) 投到零空间执行，J⁺ 是雅可比伪逆，这样不干扰主任务。人形机器人全身控制里的任务优先级也靠层层零空间投影实现。","example":"7 轴机械臂把末端固定在杯子正上方不动，肘部仍能绕肩-腕连线画圈（臂型角变化），这就是一维自运动，可以用来让肘部躲开旁边的障碍物。","related":["运动学冗余","零空间控制","雅可比伪逆","任务优先级","臂型角（肘部自运动角）","雅可比矩阵"]},{"id":"swivel-angle","category":"mechanics","sec":4,"tier":3,"sources":[{"title":"Kreutz-Delgado, Long, Seraji: Kinematic Analysis of 7-DOF Manipulators (IJRR, 1992)","url":"https://doi.org/10.1177/027836499201100504"},{"title":"Shimizu et al.: Analytical Inverse Kinematic Computation for 7-DOF Redundant Manipulators With Joint Limits (IEEE T-RO, 2008)","url":"https://doi.org/10.1109/tro.2008.2003266"},{"title":"Kim & Rosen: Redundancy Resolution of the Human Arm and an Upper Limb Exoskeleton (IEEE TBME, 2012)","url":"https://doi.org/10.1109/tbme.2012.2194489"}],"as_of":"","related_ids":["7-dof-robot-arm","kinematic-redundancy","null-space","analytical-inverse-kinematics","inverse-kinematics","motion-retargeting"],"name":"臂型角（肘部自运动角）","alt":"Arm Angle / Swivel Angle (7-DoF Redundancy Parameter)","abbr":"","aliases":["臂型角","肘部自运动角","肘部摆角","Swivel Angle","Elbow Swivel Angle"],"one_liner":"7 自由度手臂在手的位姿固定时，肘部绕肩-腕连线转过的角度","explanation":"描述 7 自由度手臂冗余度的一个标量参数。Kreutz-Delgado 等人 1992 年在 IJRR 论文中用「手臂平面与参考平面的夹角」来参数化冗余，手臂平面由肩、肘、腕三点确定。确定末端位姿只需 6 个自由度，多出的 1 个表现为：手不动时，肘部还能绕肩-腕连线画圆，这种末端不动、关节在动的运动叫自运动。把臂型角定下来，逆运动学就有唯一的闭式解；Shimizu 等人 2008 年据此给出了考虑关节限位的 7 自由度解析逆解。人的手臂也有同样的冗余，外骨骼和遥操作研究常称之为 swivel angle。","example":"遥操作 7 自由度机械臂时，先用动捕测出操作者手臂的臂型角，再把它和手的目标位姿一起交给机械臂逆解，让机械臂的肘部姿态跟人一致；已有研究在 KUKA LWR4+ 的遥操作中这样利用人手臂的肘部臂型角。","related":["七自由度机械臂","运动学冗余","零空间","解析逆解","逆运动学","动作重定向"]},{"id":"whole-body-inverse-kinematics","category":"mechanics","sec":4,"tier":3,"sources":[{"title":"mink: Python inverse kinematics based on MuJoCo (GitHub)","url":"https://github.com/kevinzakka/mink"},{"title":"GMR: General Motion Retargeting (GitHub)","url":"https://github.com/YanjieZe/GMR"}],"as_of":"2026-09","related_ids":["inverse-kinematics","motion-retargeting","general-motion-retargeting","whole-body-control","jacobian-pseudoinverse","task-prioritization"],"name":"全身逆运动学","alt":"Whole-Body Inverse Kinematics","abbr":"WBIK","aliases":["全身 IK","Whole-Body IK","全身逆解"],"one_liner":"一次解出机器人全身关节角，让手、脚、躯干等多个部位同时到达目标。","explanation":"普通逆运动学通常只管一条手臂：给定末端位姿，求这条链上的关节角。全身逆运动学把对象扩大到整台机器人（人形、带臂四足、双臂移动底盘等），同时满足多个目标：双手到哪、双脚踩哪、躯干朝向、质心落在支撑区域内，还要遵守关节限位、避免自碰撞。关节多、目标常互相冲突，一般没有解析解，常见做法是把每个目标写成一个「任务」，用雅可比矩阵把关节速度和任务误差联系起来，再用加权最小二乘或二次规划迭代求解（即微分逆运动学）；冲突时靠权重或任务优先级取舍。它只算关节角、不管力和力矩，这是它和全身控制的区别。具身智能里常用于把人体动捕数据重定向到人形机器人、做全身遥操作、给强化学习生成参考动作。","example":"GMR 通用动作重定向把人体动作映射到宇树 G1、Booster T1 等十多款人形机器人：每一帧用基于 mink（基于 MuJoCo 的微分 IK 库）的全身 IK，同时让机器人的手、脚、骨盆等部位对齐人体对应部位并满足关节限位，解出关节角序列，官方称可在 CPU 上实时运行。","related":["逆运动学","动作重定向","GMR 通用动作重定向","全身控制","雅可比伪逆","任务优先级"]},{"id":"differential-drive-kinematics","category":"mechanics","sec":4,"tier":2,"sources":[{"title":"Differential wheeled robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Differential_wheeled_robot"},{"title":"ros2_control: diff_drive_controller 文档","url":"https://control.ros.org/master/doc/ros2_controllers/diff_drive_controller/doc/userdoc.html"}],"as_of":"","related_ids":["nonholonomic-constraint","differential-drive-base","wheel-odometry","cmd-vel-topic","mobile-base","forward-kinematics"],"name":"差速驱动运动学","alt":"Differential Drive Kinematics","abbr":"","aliases":["差速模型","独轮车模型","Unicycle Model","差速运动学"],"one_liner":"描述左右两轮转速如何决定底盘前进速度和转弯角速度的公式。","explanation":"差速驱动是最常见的移动底盘结构：左右各一个独立电机驱动的轮子，再配万向脚轮防倾，靠两轮转速差转向，不需要单独的转向机构。它的运动学只有两条式子：线速度 v = (v_R + v_L)/2，角速度 ω = (v_R − v_L)/b，其中 v_R、v_L 是右、左轮的线速度（轮角速度乘轮半径 r），b 是两轮间距。反过来，给定想要的 v 和 ω 就能算出每个轮子该转多快。于是底盘在平面上等价于只能「往前走 + 原地转」的点，即独轮车模型；它不能直接横移，这种只约束速度的限制叫非完整约束。ROS 的 diff_drive_controller 就按这两条式子把 cmd_vel 换成左右轮指令，并用轮子反馈反算里程计。","example":"扫地机器人要原地左转时，让右轮以速度 u 向前、左轮以同样速度向后：v = 0，ω = 2u/b，机身绕两轮中点原地旋转。","related":["非完整约束","差速底盘","轮式里程计","cmd_vel 速度指令话题（Twist 消息）","移动底盘","正运动学"]},{"id":"nonholonomic-constraint","category":"mechanics","sec":4,"tier":3,"sources":[{"title":"Wikipedia: Nonholonomic system","url":"https://en.wikipedia.org/wiki/Nonholonomic_system"},{"title":"Modern Robotics (Lynch & Park), Sec. 2.4 Holonomic and nonholonomic constraints","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["differential-drive-kinematics","configuration-space","generalized-coordinates","hybrid-a-star","mecanum-wheel","kinodynamic-planning"],"name":"非完整约束","alt":"Nonholonomic Constraint","abbr":"","aliases":["非完整系统","Nonholonomic System","不可积约束","Nonintegrable Constraint"],"one_liner":"只限制速度方向、又不能积分成位置限制的约束，典型如轮子不能横移。","explanation":"非完整约束是对系统速度的限制，而且这种限制无法积分成只含位置的方程；「完整」一词由赫兹在 1894 年引入。最常见的来源是轮子纯滚动不打滑：差速小车在位姿 (x, y, θ) 下必须满足 ẋ·sinθ − ẏ·cosθ = 0，x、y 是位置，θ 是朝向，意思是任何瞬间都不能横着走。它减少了每一刻可选的速度方向，却不减少能到达的位姿：车照样能停进任何车位，只是要像侧方停车那样前后倒几把。所以轮式底盘的规划不能直接做直线插值，要用混合 A* 这类考虑转向约束的方法；想摆脱它就换麦克纳姆轮等全向底盘。手指在物体表面滚动的抓取接触也属于这类约束。","example":"扫地机器人想往正左方平移 20 厘米，不能直接横移，只能原地转 90° 再前进，或者前后倒车调整，这就是非完整约束在起作用。","related":["差速驱动运动学","构型空间","广义坐标","混合 A*","麦克纳姆轮","动力学约束规划"]},{"id":"jerk","category":"mechanics","sec":4,"tier":2,"sources":[{"title":"Jerk (physics) - Wikipedia","url":"https://en.wikipedia.org/wiki/Jerk_(physics)"},{"title":"Modern Robotics (Lynch & Park) preprint PDF, Ch. 9 Trajectory Generation","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["minimum-jerk-trajectory","s-curve-velocity-profile","quintic-polynomial-interpolation","trajectory-planning","action-smoothing","trapezoidal-velocity-profile"],"name":"加加速度","alt":"Jerk","abbr":"","aliases":["急动度","跃度","加速度变化率","Jolt"],"one_liner":"加速度随时间的变化率，也就是位置对时间的三阶导数，单位 m/s³。","explanation":"加加速度 j 是加速度 a 对时间的导数：j = da/dt = d³x/dt³（x 是位置），单位 m/s³，衡量加速度变化得有多突然。加速度突变意味着 jerk 很大，会让人感到顿挫，也会激起机械振动、加速磨损。所以机器人轨迹规划常限制 jerk：三次多项式时间缩放在起点和终点加速度会突变，相当于 jerk 无穷大；S 型速度曲线分七段把 jerk 限制在有限值内；最小加加速度轨迹则让整段运动的 jerk 平方积分最小。Flash 与 Hogan 1985 年发现人手臂的自然运动近似满足最小 jerk 原则。强化学习运控也有类似做法，奖励函数常惩罚相邻两步动作之差，让动作更平滑。","example":"电梯启动时若加速度从 0 瞬间跳到设定值，人会感到猛地一顿；实际电梯让加速度在一段时间内逐渐升高，就是在限制 jerk。","related":["最小加加速度轨迹","S 型速度曲线","五次多项式插值","轨迹规划","动作平滑","梯形速度曲线"]},{"id":"torque","category":"mechanics","sec":5,"tier":1,"sources":[{"title":"Wikipedia: Torque","url":"https://en.wikipedia.org/wiki/Torque"},{"title":"Modern Robotics (Lynch & Park, 2017)","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"}],"as_of":"","related_ids":["wrench","torque-control","joint-torque-sensor","peak-torque","gravity-compensation","moment-of-inertia"],"name":"力矩","alt":"Torque","abbr":"","aliases":["扭矩","转矩","Moment of Force"],"one_liner":"力让物体绕轴转动的效果，大小等于力乘力臂，单位牛·米。","explanation":"力矩描述力让物体绕某点或某轴转动的效果。定义为 τ = r × F：r 是从转轴上一点指向受力点的位置向量，F 是力；大小 τ = rF·sinθ，θ 是 r 与 F 的夹角，r·sinθ 就是力臂，即转轴到力的作用线的垂直距离；单位牛·米（N·m）。力臂越长，同样的力产生的力矩越大。绕固定轴转动时 τ = Iα（I 是转动惯量，α 是角加速度），是转动版的牛顿第二定律。机器人每个转动关节的电机输出的就是绕自身转轴的力矩，工程上常叫扭矩或转矩，与力矩基本通用：关节要克服重力、惯性和接触力所需的力矩决定了电机和减速器选型，关节模组规格表会标额定扭矩和峰值扭矩，力矩控制则直接给每个关节下力矩指令。","example":"机械臂水平伸出，在离肩关节 0.5 m 处拿着 1 kg 的物体，仅这个物体就要求肩关节提供约 1 × 9.8 × 0.5 ≈ 4.9 N·m 的力矩（不算手臂自重）。","related":["力旋量","力矩控制","关节力矩传感器","峰值扭矩","重力补偿","转动惯量"]},{"id":"payload","category":"mechanics","sec":5,"tier":1,"sources":[{"title":"Wikipedia: Industrial robot（Technical description）","url":"https://en.wikipedia.org/wiki/Industrial_robot"},{"title":"Franka Robotics: Franka Research 3","url":"https://franka.de/franka-research-3"}],"as_of":"2026-09","related_ids":["payload-to-weight-ratio","end-effector","torque","peak-torque","workspace","robotic-arm"],"name":"负载","alt":"Payload","abbr":"","aliases":["有效载荷","负载能力","负重","额定负载","Rated Payload"],"one_liner":"机器人末端能稳定带着干活的最大质量，一般用千克标注。","explanation":"负载是机器人规格表上的核心参数，指机械臂末端在正常工作的速度和加速度下能可靠携带的最大质量，单位一般是 kg。有两个常被忽略的细节：一是装在末端的夹爪、相机、力传感器等工具本身的重量也算在负载里，留给被抓物体的余量会更少；二是厂家数值通常假定负载重心离末端法兰（机械臂末端安装工具的接口面）不远，重心偏得越远，产生的力矩越大，实际能带的质量越小。负载除以机器人自重得到负载自重比，常用来比较轻量化水平。人形机器人还常分别标单臂负载和整机搬运负载。","example":"Franka Research 3 官网标注负载 3 kg、臂展 855 mm；末端装上夹爪后，能抓起的物体质量要从这 3 kg 里扣掉夹爪自重。","related":["负载自重比","末端执行器","力矩","峰值扭矩","工作空间","机械臂"]},{"id":"wrench","category":"mechanics","sec":5,"tier":2,"sources":[{"title":"Modern Robotics 3.4: Wrenches","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/3-4-wrenches/"},{"title":"ROS 2 geometry_msgs/Wrench.msg","url":"https://raw.githubusercontent.com/ros2/common_interfaces/rolling/geometry_msgs/msg/Wrench.msg"},{"title":"Modern Robotics: Mechanics, Planning, and Control (Lynch & Park, free preprint)","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"}],"as_of":"","related_ids":["twist","six-axis-force-torque-sensor","statics","torque","grasp-matrix","adjoint-representation"],"name":"力旋量","alt":"Wrench","abbr":"","aliases":["力螺旋","六维力/力矩","力/力矩旋量","Force-Torque"],"one_liner":"把三维力和三维力矩打包成一个 6 维向量，描述刚体受到的完整载荷。","explanation":"力旋量是 6 维向量 F = (m, f)：f 是 3 维力，m 是 3 维力矩，在同一坐标系下表示。它和运动旋量是一对，两者点乘 Vᵀ F 等于功率，功率与坐标系无关，由此能推出力旋量换坐标系的规则。机器人里凡是问「受了多大力」都会用到它：腕部六维力传感器读出的就是力旋量；静力学公式 τ = Jᵀ F 把末端力旋量换算成关节力矩；抓取分析把各指尖接触力合成物体受到的总力旋量。顺序约定不统一：Lynch 和 Park 的教材写成（力矩，力），ROS 的 geometry_msgs/Wrench 和 libfranka 则是先力后力矩。","example":"《现代机器人学》里的例子（取 g = 10 m/s²）：0.5 kg 的机械手握着 0.1 kg 的苹果，腕部六维力传感器读到的不只是 6 N 的重力，还有 0.75 N·m 的力矩，因为手和苹果的重心都伸出在传感器之外。","related":["运动旋量（速度旋量）","六维力传感器","静力学","力矩","抓取矩阵","伴随变换"]},{"id":"adjoint-representation","category":"mechanics","sec":5,"tier":3,"sources":[{"title":"Modern Robotics（Lynch & Park）预印本，3.3.2 节 Definition 3.20 与 Proposition 3.27","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["screw-theory","twist","wrench","homogeneous-transformation-matrix","lie-group","product-of-exponentials-formula"],"name":"伴随变换","alt":"Adjoint Map","abbr":"Ad","aliases":["伴随表示","伴随映射","Adjoint Representation"],"one_liner":"把速度旋量、力旋量从一个坐标系换到另一个坐标系的 6×6 矩阵","explanation":"旋量理论里的基本工具，Lynch 与 Park 的教材《Modern Robotics》把它作为刚体运动一章的核心定义。给定位姿 T=(R,p)（R 是旋转矩阵，p 是平移向量），伴随表示 [Ad_T] 是一个 6×6 矩阵：左上、右下两块是 R，左下是 [p]R（[p] 是 p 的反对称矩阵），右上是 0。它的用途是换坐标系：同一个运动旋量（角速度加线速度）在 {a}、{b} 两个坐标系下满足 V_a = [Ad_Tab]·V_b；力旋量（力矩加力）则用它的转置来换算。指数积公式、雅可比推导和动力学递推里都频繁用到它。","example":"腕部六维力传感器读到的力旋量 F_s 是在传感器坐标系下表示的；要得到工具中心点坐标系下的力，用 F_tcp = [Ad_T]ᵀ·F_s 一步换算，其中 T 是工具中心点坐标系相对传感器坐标系的位姿。","related":["旋量理论","运动旋量（速度旋量）","力旋量","齐次变换矩阵","李群","指数积公式"]},{"id":"statics","category":"mechanics","sec":5,"tier":2,"sources":[{"title":"Statics - Wikipedia","url":"https://en.wikipedia.org/wiki/Statics"},{"title":"Modern Robotics 5.2: Statics of Open Chains","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/5-2-statics-of-open-chains/"}],"as_of":"","related_ids":["wrench","jacobian-matrix","gravity-compensation","principle-of-virtual-work","quasi-static-assumption","dynamics"],"name":"静力学","alt":"Statics","abbr":"","aliases":["机器人静力学","静力分析"],"one_liner":"研究物体静止或匀速时，各个力和力矩如何相互平衡的力学分支。","explanation":"静力学是经典力学里研究「没有加速度」的系统受力的分支，平衡条件是合力为零、合力矩为零：ΣF = 0，ΣM = 0。放到机器人上，最常用的结论是 τ = Jᵀ(θ)F：τ 是各关节力矩，J 是雅可比矩阵（把关节速度映射成末端速度），θ 是当前关节角，F 是末端对外施加的力旋量（三维力加三维力矩）。这个式子由功率守恒推出，回答的是「末端要推出这么大的力，每个电机该出多少力矩」；机器人还要撑住自身重量时，再叠加抵消重力的力矩。力控、重力补偿、抓取受力分析都建立在静力学上，一旦运动变快、惯性力不能忽略，就要改用动力学。","example":"机械臂末端静止压在桌面上、要向下施加 10 N 的力：先算出当前姿态的雅可比矩阵 J，再用 τ = Jᵀ F 得到每个关节该输出的力矩，最后叠加抵消手臂自重的重力补偿力矩。","related":["力旋量","雅可比矩阵","重力补偿","虚功原理","准静态假设","动力学"]},{"id":"principle-of-virtual-work","category":"mechanics","sec":5,"tier":3,"sources":[{"title":"Wikipedia: Virtual work","url":"https://en.wikipedia.org/wiki/Virtual_work"},{"title":"Modern Robotics (Lynch & Park), Sec. 5.2 Statics of open chains","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["jacobian-matrix","wrench","statics","gravity-compensation","contact-jacobian","euler-lagrange-equations"],"name":"虚功原理","alt":"Principle of Virtual Work","abbr":"","aliases":["虚位移原理","Principle of Virtual Displacements","虚速度原理"],"one_liner":"系统静平衡，当且仅当主动力在任意允许的微小虚位移上做功之和为零。","explanation":"虚功原理是分析力学的基本原理：设想系统在约束允许的范围内做一个假想的无穷小位移（虚位移），如果所有主动力做的功（虚功）之和为零，系统就处于静平衡。Johann Bernoulli 在 1715 年与 Varignon 的通信中系统表述了它，Lagrange 后来以它为基础建立分析力学。它的好处是理想约束的反力（如关节里的支反力）做的虚功为零，不用逐个去求。机器人里最常用的结论是 τ = Jᵀ(θ)F：末端对外施加力或力旋量 F 时，关节需要的力矩 τ 等于雅可比矩阵 J 的转置乘 F，依据就是关节和末端做的虚功（或功率）相等。力控、阻抗控制、重力补偿，以及腿足机器人把足端接触力 f 换算成关节力矩 τ = J_cᵀf，都建立在这个关系上。","example":"平面两连杆机械臂要在某个姿态下用末端向墙面水平推 10 N，把 F = (10, 0) 代入 τ = JᵀF，就得到两个关节各要出的力矩，无需分析连杆内部受力。","related":["雅可比矩阵","力旋量","静力学","重力补偿","接触雅可比","拉格朗日方程"]},{"id":"quasi-static-assumption","category":"mechanics","sec":5,"tier":2,"sources":[{"title":"Modern Robotics: Mechanics, Planning, and Control (Lynch & Park), Ch.12 Grasping and Manipulation","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Robotic Manipulation (Russ Tedrake, MIT): Force Control","url":"https://manipulation.csail.mit.edu/force.html"}],"as_of":"","related_ids":["statics","rigid-body-dynamics","coulomb-friction","friction-cone","non-prehensile-manipulation","slip"],"name":"准静态假设","alt":"Quasi-static Assumption","abbr":"","aliases":["准静态近似","准静态模型","Quasistatic Approximation"],"one_liner":"假设运动足够慢，忽略惯性力，每一刻都按力平衡来分析。","explanation":"准静态假设是机器人操作分析里常用的简化：物体的速度和加速度都很小，惯性力（质量乘加速度那一项）可以忽略，于是每一时刻外力与接触力都处于平衡，动力学方程退化成静力平衡，即所有力与力矩之和为零。Lynch 与 Park 的教材《Modern Robotics》在抓取与操作一章就用它分析托、夹、推等任务。好处是不必对动力学做时间积分，只需判断每个接触是黏住还是打滑、接触力是否落在摩擦锥（摩擦力允许的范围）内，慢速推物体、插装和抓取稳定性分析大多基于它。代价是动作一快就失效：甩、抛、快速翻转这类动态操作必须回到完整的刚体动力学。","example":"「米尺把戏」：用两根食指水平托住一根长尺，慢慢把两指并拢，尺子会先在一根手指上滑、再在两根上一起滑，质心始终留在两指之间，尺子不会掉；按准静态力平衡就能预测哪根手指打滑。手指动得太快时这个分析不再成立，尺子会掉。","related":["静力学","刚体动力学","库仑摩擦","摩擦锥","非抓取操作","打滑"]},{"id":"center-of-mass","category":"mechanics","sec":5,"tier":1,"sources":[{"title":"Wikipedia: Center of mass","url":"https://en.wikipedia.org/wiki/Center_of_mass"},{"title":"Wikipedia: Support polygon","url":"https://en.wikipedia.org/wiki/Support_polygon"}],"as_of":"","related_ids":["support-polygon","zero-moment-point","centroidal-dynamics","static-stability","inertial-parameters","payload"],"name":"质心","alt":"Center of Mass","abbr":"CoM","aliases":["质量中心","重心","Center of Gravity","CoG"],"one_liner":"各部分位置按质量加权平均得到的点，分析整体平移运动时可当作全部质量集中于此。","explanation":"质心是按质量加权的位置平均：r_c = Σmᵢrᵢ / Σmᵢ，mᵢ 是第 i 部分的质量，rᵢ 是它的位置。在均匀重力场里质心和重心重合，所以工程上常混用。对机器人，质心决定平衡：静止站立时，质心在地面上的投影要落在支撑多边形（脚底接触区域围成的范围）内才可能不倒，人形和四足的步态控制、零力矩点分析都围绕质心轨迹展开。机械臂抓重物时，负载质心离末端法兰（机械臂末端安装工具的接口面）越远，关节要扛的力矩越大。URDF 等模型文件里每个连杆都要填质量和质心位置，填错会让仿真和真机表现不一致。","example":"1 kg 和 3 kg 两个小球分别放在 x=0 和 x=4 米处，质心在 (1×0+3×4)/(1+3)=3 米处，偏向重的那个。","related":["支撑多边形","零力矩点","质心动力学","静态稳定","惯性参数","负载"]},{"id":"moment-of-inertia","category":"mechanics","sec":5,"tier":2,"sources":[{"title":"Wikipedia: Moment of inertia","url":"https://en.wikipedia.org/wiki/Moment_of_inertia"},{"title":"Modern Robotics 8.2: Dynamics of a Single Rigid Body (Part 1 of 2)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/8-2-dynamics-of-a-single-rigid-body-part-1-of-2/"}],"as_of":"","related_ids":["inertia-tensor","torque","parallel-axis-theorem","inertial-parameters","rigid-body-dynamics","reflected-inertia"],"name":"转动惯量","alt":"Moment of Inertia","abbr":"","aliases":["惯量","质量惯性矩","Rotational Inertia","Mass Moment of Inertia"],"one_liner":"物体绕某根轴转起来或停下来有多难的量，I = Σmr²。","explanation":"转动惯量描述物体绕某根轴转动时的惯性，定义为各部分质量乘以到转轴距离的平方再求和，I = Σmr²，单位 kg·m²；这个名称由欧拉在 1765 年提出。它在转动中的作用相当于平动中的质量：τ = Iα，τ 是力矩，α 是角加速度。质量相同时，分布离轴越远转动惯量越大：细杆绕中点是 ml²/12，绕端点变成 ml²/3。三维刚体要用 3×3 的惯性张量描述各方向的转动惯量。机器人设计常把电机往躯干方向放、用轻材料做小腿和手指，就是为了减小远端连杆的转动惯量，让摆动更快更省力。注意材料力学里的「截面惯性矩」是另一个量。","example":"不少双足和四足机器人把膝关节电机装在大腿根部附近，再通过连杆或皮带驱动膝关节，让小腿变轻、摆腿时的转动惯量变小。","related":["惯性张量","力矩","平行轴定理","惯性参数","刚体动力学","反射惯量"]},{"id":"inertia-tensor","category":"mechanics","sec":5,"tier":3,"sources":[{"title":"Wikipedia: Moment of inertia（Inertia tensor）","url":"https://en.wikipedia.org/wiki/Moment_of_inertia"},{"title":"Lynch & Park, Modern Robotics（预印本 PDF，8.2 节 Dynamics of a Single Rigid Body；4.2 节 URDF）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["moment-of-inertia","inertial-parameters","parallel-axis-theorem","center-of-mass","unified-robot-description-format","dynamic-parameter-identification"],"name":"惯性张量","alt":"Inertia Tensor","abbr":"","aliases":["惯量张量","惯量矩阵","转动惯量矩阵","3×3 惯量矩阵","Rotational Inertia Matrix"],"one_liner":"一个 3×3 对称矩阵，描述刚体绕任意方向转动时有多难转。","explanation":"惯性张量（也叫惯量矩阵）是刚体转动惯性的完整描述，为 3×3 对称正定矩阵。对角元 Ixx、Iyy、Izz 是绕 x、y、z 轴的转动惯量，如 Ixx = Σm(y² + z²)；非对角元叫惯性积，如 Ixy = −Σm·x·y（符号约定因书而异），反映绕一个轴转时会不会牵动另一个轴。它联系角速度 ω 和角动量：L = Iω，转动动能 K = ½ωᵀIω。换坐标朝向时 I' = RᵀIR，换参考点用平行轴定理；特征分解得到主轴，主轴坐标下惯性积全为零。URDF 的 inertial 标签要为每根连杆填质量、质心位置和惯性张量的六个独立元素，填错会让动力学仿真和力矩控制都出问题。","example":"一个 2 kg 的质点位于 (0.1, 0, 0) m：Ixx = 0，Iyy = Izz = 2×0.1² = 0.02 kg·m²，惯性积全为 0，说明绕穿过质点的 x 轴转不费力，绕 y、z 轴转则要克服 0.02 kg·m² 的惯量。","related":["转动惯量","惯性参数","平行轴定理","质心","统一机器人描述格式","动力学参数辨识"]},{"id":"parallel-axis-theorem","category":"mechanics","sec":5,"tier":3,"sources":[{"title":"Wikipedia: Parallel axis theorem","url":"https://en.wikipedia.org/wiki/Parallel_axis_theorem"},{"title":"Modern Robotics (Lynch & Park), Theorem 8.2 Steiner's theorem","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["moment-of-inertia","inertia-tensor","inertial-parameters","center-of-mass","dynamic-parameter-identification","unified-robot-description-format"],"name":"平行轴定理","alt":"Parallel Axis Theorem","abbr":"","aliases":["惠更斯-斯坦纳定理","Huygens–Steiner Theorem","Steiner's Theorem","移轴定理"],"one_liner":"由过质心轴的转动惯量求任一平行轴转动惯量的公式：I = I_c + md²。","explanation":"平行轴定理又叫惠更斯-斯坦纳定理：刚体绕某轴的转动惯量 I，等于绕过质心且与之平行的轴的转动惯量 I_c，加上质量 m 乘以两轴距离 d 的平方，即 I = I_c + m·d²。可见绕质心轴转动惯量最小，轴离质心越远越难转。三维有矩阵版（Modern Robotics 称为 Steiner 定理）：I_q = I_b + m(qᵀq·E − q·qᵀ)，I_b 是质心处的惯性张量，q 是新参考点相对质心的位置，E 是 3×3 单位阵。机器人里用得很频繁：URDF 要求惯量参考系原点放在质心，动力学库在关节坐标系下计算时要把它平移过去；给法兰加装夹爪或负载时，要把负载惯量平移后再合并；动力学参数辨识也要用它在不同参考点间换算。","example":"质量 m、长 L 的均匀细杆，绕中点转动惯量为 mL²/12；绕一端转（相当于连杆绕关节转），d = L/2，I = mL²/12 + m(L/2)² = mL²/3，是前者的 4 倍。","related":["转动惯量","惯性张量","惯性参数","质心","动力学参数辨识","统一机器人描述格式"]},{"id":"inertial-parameters","category":"mechanics","sec":5,"tier":2,"sources":[{"title":"Modern Robotics (Lynch & Park) preprint PDF, Ch. 4 URDF 与 Ch. 8 动力学","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Linear Matrix Inequalities for Physically-Consistent Inertial Parameter Identification (Wensing, Kim, Slotine)","url":"https://arxiv.org/abs/1701.04395"},{"title":"legged_gym: legged_robot_config.py","url":"https://raw.githubusercontent.com/leggedrobotics/legged_gym/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["mass-matrix","inertia-tensor","center-of-mass","dynamic-parameter-identification","unified-robot-description-format","dynamics-randomization"],"name":"惯性参数","alt":"Inertial Parameters","abbr":"","aliases":["质量属性","Mass Properties","连杆惯性参数","Inertia Parameters"],"one_liner":"描述一个刚体有多重、重心在哪、绕各轴有多难转动的一组参数。","explanation":"惯性参数是每根刚体连杆的质量分布信息，常见写法共 10 个数：质量 m（1 个），质心位置 c 或一阶质量矩 m·c（3 个），惯性张量 I（3×3 对称矩阵，6 个独立元素，描述绕各轴转动的难易）。URDF、MJCF 等机器人描述文件里每个连杆的 inertial 字段写的就是它们。运动学只管几何，一涉及动力学，比如重力补偿、逆动力学、力矩控制、物理仿真，就离不开惯性参数。CAD 导出的值常和实物有偏差（线缆、螺丝等没算进去），所以要做动力学参数辨识，并保证物理一致性，如质量为正、惯性张量正定。惯性参数不准是虚实差距的来源之一，域随机化常随机扰动连杆质量。","example":"URDF 里一个连杆的 inertial 标签包含 mass、origin（质心位置）和 inertia 的 ixx、ixy、ixz、iyy、iyz、izz 六个值；legged_gym 提供 added_mass_range 参数，训练时给机身随机加减质量。","related":["质量矩阵","惯性张量","质心","动力学参数辨识","统一机器人描述格式","动力学随机化"]},{"id":"angular-momentum","category":"mechanics","sec":5,"tier":2,"sources":[{"title":"Angular momentum - Wikipedia","url":"https://en.wikipedia.org/wiki/Angular_momentum"}],"as_of":"","related_ids":["moment-of-inertia","centroidal-dynamics","centroidal-momentum-matrix","torque","rigid-body-dynamics","balance-control"],"name":"角动量","alt":"Angular Momentum","abbr":"","aliases":["动量矩"],"one_liner":"衡量物体转动「冲劲」的量，刚体绕轴时等于转动惯量乘角速度。","explanation":"角动量是线动量 p=mv 在转动上的对应量：质点绕某点的角动量 L = r × p（r 是从该点指向质点的位置矢量，× 为叉乘）；刚体绕固定轴转动时 L = Iω（I 是转动惯量，ω 是角速度），单位 kg·m²/s。它的变化率等于外力矩，dL/dt = τ；没有外力矩时角动量守恒，花样滑冰运动员收臂后越转越快就是这个道理。腿足和人形机器人常看整机绕质心的角动量：腾空时重力不产生绕质心的力矩，它保持不变，只能靠摆臂、收腿在身体各部分间重新分配；着地后才能由接触力改变。平衡、跳跃和空翻的规划都要考虑它。","example":"人形机器人做后空翻：必须在蹬地离开地面前获得足够的绕质心角动量；腾空后总角动量不变，只能收腿缩小转动惯量来加快翻转，落地前再伸腿减慢转速。","related":["转动惯量","质心动力学","质心动量矩阵","力矩","刚体动力学","平衡控制"]},{"id":"dynamics","category":"mechanics","sec":6,"tier":1,"sources":[{"title":"Wikipedia: Dynamics (mechanics)","url":"https://en.wikipedia.org/wiki/Dynamics_(mechanics)"},{"title":"MIT Underactuated Robotics: Multi-Body Dynamics（manipulator equations）","url":"https://underactuated.mit.edu/multibody.html"},{"title":"MuJoCo Documentation: Computation（forward / inverse dynamics）","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"}],"as_of":"","related_ids":["forward-dynamics","inverse-dynamics","mass-matrix","rigid-body-dynamics","kinematics","physics-engine"],"name":"动力学","alt":"Dynamics","abbr":"","aliases":["机器人动力学","Robot Dynamics"],"one_liner":"研究力和力矩如何产生运动，回答「给多大力矩会有什么加速度」。","explanation":"动力学是经典力学的分支，研究力与运动的关系，根基是牛顿第二定律 F=ma。机器人动力学把它推广到多关节系统，常写成 M(q)q̈ + C(q,q̇)q̇ + g(q) = τ：q 是关节角，q̇、q̈ 是关节速度和加速度，M 是质量矩阵（各连杆惯性折算到关节上），C 项是科里奥利力和离心力，g 是重力项，τ 是关节力矩。已知力矩求加速度叫正动力学，物理引擎每一步都在算；已知期望运动求所需力矩叫逆动力学，用于重力补偿和力矩控制。运动学只管几何，抓重物、快速运动、腿足平衡则离不开动力学。","example":"机械臂举着物体静止不动时 q̇、q̈ 都为 0，方程只剩 g(q)=τ，逆动力学算出的就是各关节抵消重力（含物体重量）所需的力矩。","related":["正动力学","逆动力学","质量矩阵","刚体动力学","运动学","物理引擎"]},{"id":"rigid-body-dynamics","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"Wikipedia: Rigid body dynamics","url":"https://en.wikipedia.org/wiki/Rigid_body_dynamics"},{"title":"Modern Robotics (Lynch & Park), Ch.8 Dynamics of Open Chains","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"MuJoCo Documentation: Computation","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"}],"as_of":"","related_ids":["newton-euler-equations","euler-lagrange-equations","mass-matrix","forward-dynamics","inverse-dynamics","physics-engine"],"name":"刚体动力学","alt":"Rigid Body Dynamics","abbr":"","aliases":["多刚体动力学","Rigid-Body Dynamics"],"one_liner":"研究力和力矩如何让一个或多个相连刚体产生加速与转动。","explanation":"刚体动力学研究一个或多个用关节相连的刚体，在外力和力矩作用下如何运动。单个刚体遵循牛顿-欧拉方程：F=ma 管平移（F 为合力，m 为质量，a 为质心加速度），τ=Iα+ω×(Iω) 管转动（τ 为合力矩，I 为惯性张量，α 为角加速度，ω 为角速度）。机械臂这类多刚体系统通常写成 M(q)q̈+c(q,q̇)+g(q)=τ：q 是关节角，M 是质量矩阵，c 是科里奥利力与离心力项，g 是重力项，τ 是关节力矩。已知力矩求运动叫正动力学，物理仿真器每一步都在算；已知运动求力矩叫逆动力学，用于力矩控制和重力补偿。Featherstone 的《Rigid Body Dynamics Algorithms》是标准参考，MuJoCo 的相关算法即基于它。","example":"机械臂端着水杯静止不动时 q̇ 和 q̈ 都为零，方程只剩 g(q)=τ，算出的就是各关节为抵消重力需要输出的力矩，这就是重力补偿。","related":["牛顿-欧拉方程","拉格朗日方程","质量矩阵","正动力学","逆动力学","物理引擎"]},{"id":"multibody-dynamics","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Multibody system","url":"https://en.wikipedia.org/wiki/Multibody_system"},{"title":"Lynch & Park, Modern Robotics（2017）第 8 章：机器人动力学是多体系统动力学的子领域","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"MuJoCo 文档 Overview：广义坐标表示","url":"https://mujoco.readthedocs.io/en/stable/overview.html"}],"as_of":"","related_ids":["rigid-body-dynamics","generalized-coordinates","recursive-newton-euler-algorithm","articulated-body-algorithm","physics-engine","kinematic-tree"],"name":"多体动力学","alt":"Multibody Dynamics","abbr":"","aliases":["多体系统动力学","Multibody System Dynamics"],"one_liner":"研究多个由关节相连的刚体或柔性体在受力下如何运动的学科。","explanation":"多体动力学研究多个由关节相连、可能大幅平移和转动的刚体或柔性体如何运动，用于航空航天、车辆、生物力学和机器人。空间中每个刚体有 6 个自由度（3 平移、3 转动），关节约束掉其中一部分。建模有两种思路：冗余坐标，每个物体用完整位姿描述，再加约束方程把它们连起来；最小坐标（广义坐标），直接用关节角等独立变量，约束自动满足。机器人动力学是它的一个分支，结果是 M(q)q̈ + C(q,q̇)q̇ + g(q) = τ 这类方程（q 为关节角，M 为质量矩阵，C 为科里奥利与离心项，g 为重力项，τ 为关节力矩）。MuJoCo、Pinocchio 都基于广义坐标计算。","example":"一台 12 个关节的四足机器人有 13 个刚体（机身加 12 段腿）。用广义坐标只需 6（机身浮动基）+ 12（关节角）= 18 个变量；用冗余坐标则是 13×6 = 78 个变量，再靠 12 个转动副各 5 个、共 60 个约束方程消掉多余部分。","related":["刚体动力学","广义坐标","递归牛顿-欧拉算法","铰接体算法","物理引擎","运动学树"]},{"id":"forward-dynamics","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"MuJoCo Documentation - Computation","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"Inverse dynamics - Wikipedia","url":"https://en.wikipedia.org/wiki/Inverse_dynamics"},{"title":"Featherstone's algorithm - Wikipedia","url":"https://en.wikipedia.org/wiki/Featherstone%27s_algorithm"}],"as_of":"","related_ids":["inverse-dynamics","euler-lagrange-equations","mass-matrix","articulated-body-algorithm","physics-engine","forward-dynamics-model"],"name":"正动力学","alt":"Forward Dynamics","abbr":"","aliases":["动力学正问题","前向动力学"],"one_liner":"已知当前状态和施加的力矩，算出机器人此刻的加速度和接下来的运动。","explanation":"动力学研究力和运动的关系，分正、逆两个方向。正动力学是已知关节位置 q、速度 q̇ 和施加的力矩 τ，求加速度 q̈：由 M(q)q̈ + c(q,q̇) = τ 解出 q̈ = M⁻¹(τ − c)，其中 M 是质量矩阵，c 汇总了科里奥利力、离心力和重力。把 q̈ 按时间步长积分，就得到机器人接下来的轨迹，这正是物理仿真器每一步做的事，MuJoCo、Isaac Sim 等还要在此基础上求解接触力和摩擦。逆动力学方向相反：给定想要的运动求所需力矩，多用于控制。正动力学的经典高效算法是 Featherstone 的铰接体算法。注意它和学习领域的「正向动力学模型」不同，后者是用神经网络学习预测下一状态。","example":"在 MuJoCo 里给机械臂所有关节施加 0 力矩后反复调用 mj_step，仿真器按正动力学算出重力带来的加速度，机械臂就会自然下垂、来回摆动。","related":["逆动力学","拉格朗日方程","质量矩阵","铰接体算法","物理引擎","正向动力学模型"]},{"id":"inverse-dynamics","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"Modern Robotics (Lynch & Park) preprint PDF, Ch. 8 Dynamics of Open Chains","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Inverse dynamics - Wikipedia","url":"https://en.wikipedia.org/wiki/Inverse_dynamics"}],"as_of":"","related_ids":["forward-dynamics","recursive-newton-euler-algorithm","mass-matrix","computed-torque-control","gravity-compensation","inverse-dynamics-model"],"name":"逆动力学","alt":"Inverse Dynamics","abbr":"","aliases":["动力学逆问题","逆向动力学","Inverse Dynamics Problem"],"one_liner":"已知想要的运动（角度、速度、加速度），反算各关节需要出多大力矩。","explanation":"机器人动力学方程可写成 τ = M(θ)θ̈ + h(θ, θ̇)：θ 是关节角，θ̇、θ̈ 是关节速度和加速度，M 是质量矩阵，h 汇总重力、科里奥利力和离心力等项，τ 是关节力矩。给定 θ、θ̇、θ̈ 求 τ 叫逆动力学；反过来给定 τ 求 θ̈ 叫正动力学，仿真器每一步做的就是后者。逆动力学常用递归牛顿-欧拉算法：先从基座往末端传递速度和加速度，再从末端往基座回推各连杆受力。它是计算力矩控制、重力补偿、全身控制的核心，生物力学也用它由动捕数据和地面反作用力反推关节力矩。它不同于只求关节角的逆运动学，也不同于具身学习里由前后两帧推动作的「逆动力学模型」。","example":"机械臂要按规划好的加速度举起 2 kg 的物体，控制器先用逆动力学算出此刻各关节所需力矩作为前馈，再叠加 PD 反馈修正误差，这就是计算力矩控制。","related":["正动力学","递归牛顿-欧拉算法","质量矩阵","计算力矩控制","重力补偿","逆动力学模型"]},{"id":"newton-euler-equations","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"Wikipedia: Newton–Euler equations","url":"https://en.wikipedia.org/wiki/Newton%E2%80%93Euler_equations"},{"title":"Modern Robotics 8.3: Newton-Euler Inverse Dynamics (Northwestern)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/8-3-newton-euler-inverse-dynamics/"}],"as_of":"","related_ids":["recursive-newton-euler-algorithm","euler-lagrange-equations","inverse-dynamics","rigid-body-dynamics","inertia-tensor","computed-torque-control"],"name":"牛顿-欧拉方程","alt":"Newton-Euler Equations","abbr":"","aliases":["牛顿-欧拉法","牛顿-欧拉动力学方程","Newton-Euler Formulation","Newton-Euler Equations of Motion"],"one_liner":"同时描述刚体平动（F = ma）和转动（欧拉方程）的一组动力学方程。","explanation":"牛顿-欧拉方程把牛顿第二定律和欧拉的刚体转动方程合在一起，描述刚体在力和力矩作用下的平动与转动：F = ma，τ = Iα + ω×(Iω)。F 是合外力，m 是质量，a 是质心加速度；τ 是绕质心的合力矩，I 是惯性张量，α 是角加速度，ω 是角速度，ω×(Iω) 是转动带来的陀螺项。机器人由多根连杆组成，每根都满足这组方程。经典的递归牛顿-欧拉算法先从基座到末端逐级算各连杆的速度和加速度，再从末端往回逐级算力和力矩，得到每个关节所需力矩，计算量随关节数线性增长。它与拉格朗日方程是建立机器人动力学的两条主要路线。","example":"已知机械臂此刻的关节角、角速度和想要的角加速度，用递归牛顿-欧拉算法即可算出每个电机该输出的力矩，这正是计算力矩控制里的前馈项。","related":["递归牛顿-欧拉算法","拉格朗日方程","逆动力学","刚体动力学","惯性张量","计算力矩控制"]},{"id":"euler-lagrange-equations","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"Lagrangian mechanics - Wikipedia","url":"https://en.wikipedia.org/wiki/Lagrangian_mechanics"},{"title":"Underactuated Robotics (MIT) - Multi-Body Dynamics","url":"https://underactuated.csail.mit.edu/multibody.html"}],"as_of":"","related_ids":["newton-euler-equations","generalized-coordinates","mass-matrix","coriolis-and-centrifugal-terms","forward-dynamics","inverse-dynamics"],"name":"拉格朗日方程","alt":"Euler-Lagrange Equations","abbr":"","aliases":["拉格朗日动力学","拉格朗日法","欧拉-拉格朗日方程","第二类拉格朗日方程","Lagrangian Dynamics"],"one_liner":"从动能和势能出发推导机器人运动方程的方法，不必逐个分析约束力。","explanation":"拉格朗日力学由拉格朗日提出，集中写在他 1788 年的《分析力学》里。做法是先写拉格朗日量 L = T − V（T 为动能，V 为势能），再对每个广义坐标 q_i（如关节角）列方程 d/dt(∂L/∂q̇_i) − ∂L/∂q_i = τ_i，τ_i 是作用在该坐标上的广义力（如电机力矩）。好处是只算能量，关节间的约束力自动消掉，方程个数等于自由度数。对机械臂整理后得到标准形式 M(q)q̈ + C(q,q̇)q̇ + g(q) = τ：M 是质量矩阵，C 项含科里奥利力和离心力，g 是重力项。这组方程是计算力矩控制、重力补偿、模型预测控制和物理仿真的基础；手推适合两三个关节的教学例子，大型机器人实际用递归牛顿-欧拉等算法数值计算。","example":"单摆：摆长 l、质量 m、摆角 θ，动能 T = ½ml²θ̇²，势能 V = −mgl·cosθ，代入得 ml²θ̈ + mgl·sinθ = τ，就是熟悉的单摆方程。","related":["牛顿-欧拉方程","广义坐标","质量矩阵","科里奥利力与离心力项","正动力学","逆动力学"]},{"id":"mass-matrix","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"Modern Robotics 8.1.3: Understanding the Mass Matrix (Northwestern)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/8-1-3-understanding-the-mass-matrix/"},{"title":"Wikipedia: Mass matrix","url":"https://en.wikipedia.org/wiki/Mass_matrix"}],"as_of":"","related_ids":["rigid-body-dynamics","coriolis-and-centrifugal-terms","composite-rigid-body-algorithm","inverse-dynamics","forward-dynamics","euler-lagrange-equations"],"name":"质量矩阵","alt":"Mass Matrix","abbr":"","aliases":["惯性矩阵","关节空间惯性矩阵","广义质量矩阵","Inertia Matrix","Joint-Space Inertia Matrix","JSIM","M(q)"],"one_liner":"机器人动力学方程里描述各关节有多难被加速的矩阵 M(q)。","explanation":"质量矩阵出现在机器人标准动力学方程 τ = M(q)q̈ + c(q, q̇) + g(q) 中：τ 是关节力矩，q、q̇、q̈ 是关节角及其一、二阶导数，c 是科里奥利力和离心力项，g 是重力项。M(q) 是 n×n 矩阵（n 为关节数），决定一组关节加速度需要多大力矩，动能也可写成 T = ½q̇ᵀM(q)q̇。它对称、正定，并随姿态变化：手臂伸直时肩关节要带动的惯性更大。非对角元表示关节间的惯性耦合，只加速肘关节，肩关节也会受到反作用力矩。计算力矩控制、操作空间控制和正动力学仿真都要用到它，Pinocchio、MuJoCo 等库可直接算出。","example":"平面两连杆臂：肘关节伸直时，质量矩阵里对应肩关节的对角元最大；同样的肩部力矩，伸直时产生的角加速度比肘部弯曲时小。","related":["刚体动力学","科里奥利力与离心力项","复合刚体算法","逆动力学","正动力学","拉格朗日方程"]},{"id":"coriolis-and-centrifugal-terms","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"Lynch & Park, Modern Robotics（Ch. 8 Dynamics of Open Chains）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Wikipedia: Coriolis force","url":"https://en.wikipedia.org/wiki/Coriolis_force"}],"as_of":"","related_ids":["euler-lagrange-equations","mass-matrix","rigid-body-dynamics","inverse-dynamics","computed-torque-control","recursive-newton-euler-algorithm"],"name":"科里奥利力与离心力项","alt":"Coriolis and Centrifugal Terms","abbr":"","aliases":["科氏力项","C(q, q̇)","非线性项","科里奥利矩阵","Coriolis Matrix","向心项"],"one_liner":"机器人动力学方程里与关节速度平方或速度乘积有关的力矩项。","explanation":"机械臂动力学常写成 M(q)q̈ + C(q,q̇)q̇ + g(q) = τ：q 是关节角，q̇、q̈ 是角速度、角加速度，M 是质量矩阵，g 是重力项，τ 是关节力矩。C(q,q̇)q̇ 就是科里奥利力与离心力项。《Modern Robotics》把只含某个关节速度平方 q̇ᵢ² 的叫离心（向心）项，含两个关节速度乘积 q̇ᵢq̇ⱼ 的叫科里奥利项。它出现是因为关节坐标不是惯性系：即使各关节匀速转动（q̈=0），连杆质量仍在做圆周运动，需要力矩维持。低速时这项很小常被忽略，高速运动不补偿会有明显跟踪误差。逆动力学和计算力矩控制都要算它，Ṁ−2C 反对称的性质也常用来证明控制器稳定。","example":"平面两连杆臂在第二关节成 90° 时，两个关节同时正向匀速转动，末端质量被拉近关节 1，关节 1 反而要输出负力矩才能保持转速——这就是科里奥利项。","related":["拉格朗日方程","质量矩阵","刚体动力学","逆动力学","计算力矩控制","递归牛顿-欧拉算法"]},{"id":"recursive-newton-euler-algorithm","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"Modern Robotics (Lynch & Park), Sec. 8.3 Newton–Euler Inverse Dynamics","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"MuJoCo Documentation: Computation（bias force via RNE with acceleration set to 0）","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"Pinocchio documentation（Recursive Newton-Euler algorithm, pinocchio::rnea）","url":"https://gepettoweb.laas.fr/doc/stack-of-tasks/pinocchio/master/doxygen-html/"}],"as_of":"","related_ids":["inverse-dynamics","newton-euler-equations","articulated-body-algorithm","composite-rigid-body-algorithm","computed-torque-control","pinocchio"],"name":"递归牛顿-欧拉算法","alt":"Recursive Newton-Euler Algorithm","abbr":"RNEA","aliases":["递推牛顿-欧拉算法","RNE","牛顿-欧拉逆动力学"],"one_liner":"先由基座向末端推速度加速度，再由末端往回推力，算出关节力矩的逆动力学算法。","explanation":"递归牛顿-欧拉算法用来算逆动力学：已知关节位置 q、速度 q̇、加速度 q̈，求所需关节力矩 τ = M(q)q̈ + C(q,q̇)q̇ + g(q)，M 是质量矩阵，C 项是科里奥利力和离心力，g 是重力项。它分两趟：前向从基座到末端，逐个连杆算速度和加速度；反向从末端回到基座，对每个连杆用牛顿-欧拉方程求它受的力和力矩，投影到关节轴上就是 τ。计算量随关节数线性增长，比展开拉格朗日方程高效得多。1980 年 Luh、Walker、Paul 的在线计算方案是其经典形式，Featherstone 用 6 维空间向量给出了统一写法。Pinocchio 的 rnea()、MuJoCo 的 mj_rne 都实现了它；把加速度设为 0 就得到重力、科氏力等偏置力，常用于重力补偿、计算力矩控制和基于模型的碰撞检测。","example":"用 Pinocchio 时，pinocchio.rnea(model, data, q, v, a) 直接返回关节力矩；令 v 和 a 为零，得到的就是让机械臂在当前姿态停住所需的重力补偿力矩。","related":["逆动力学","牛顿-欧拉方程","铰接体算法","复合刚体算法","计算力矩控制","Pinocchio"]},{"id":"composite-rigid-body-algorithm","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"MuJoCo 文档: Computation","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"Walker & Orin: Efficient Dynamic Computer Simulation of Robotic Mechanisms (1982)","url":"https://doi.org/10.1115/1.3139699"},{"title":"Pinocchio 项目主页（CRBA 等算法列表）","url":"https://stack-of-tasks.github.io/pinocchio/"}],"as_of":"","related_ids":["mass-matrix","articulated-body-algorithm","recursive-newton-euler-algorithm","forward-dynamics","kinematic-tree","mujoco"],"name":"复合刚体算法","alt":"Composite Rigid Body Algorithm","abbr":"CRBA","aliases":["组合刚体算法","CRB 算法","Composite-Rigid-Body Algorithm"],"one_liner":"把关节外侧连杆合成一个刚体来高效计算质量矩阵的算法","explanation":"用来计算关节空间质量矩阵 M(q) 的递推算法，M 描述关节加速度与所需关节力矩之间的惯性关系，方法一般追溯到 Walker 与 Orin 1982 年的论文。核心想法是：对第 i 个关节，把它外侧的所有连杆看成锁死在一起的复合刚体，这个复合体的惯量直接给出 M 中与该关节相关的元素；复合惯量可以从末端往根部逐级累加。算出 M 后，再用递归牛顿-欧拉算法求出科里奥利、离心和重力项 c，解 M·q̈ = τ − c 就完成正动力学。它和铰接体算法是正动力学的两条常见路线。","example":"MuJoCo 每个仿真步用 CRB 算法得到关节空间质量矩阵 M，用 RNE 算法（加速度置零）得到包含科里奥利、离心和重力的偏置力，再结合约束求解得到加速度；Pinocchio 里对应的函数是 crba。","related":["质量矩阵","铰接体算法","递归牛顿-欧拉算法","正动力学","运动学树","MuJoCo"]},{"id":"articulated-body-algorithm","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"Featherstone: The Calculation of Robot Dynamics Using Articulated-Body Inertias (IJRR, 1983)","url":"https://doi.org/10.1177/027836498300200102"},{"title":"Wikipedia: Featherstone's algorithm","url":"https://en.wikipedia.org/wiki/Featherstone%27s_algorithm"},{"title":"Pinocchio GitHub README","url":"https://github.com/stack-of-tasks/pinocchio"}],"as_of":"","related_ids":["forward-dynamics","composite-rigid-body-algorithm","recursive-newton-euler-algorithm","spatial-vector-algebra","mass-matrix","physics-engine"],"name":"铰接体算法","alt":"Articulated Body Algorithm","abbr":"ABA","aliases":["Featherstone 算法","关节体算法","Articulated-Body Algorithm","Featherstone's Algorithm"],"one_liner":"已知关节力矩求关节加速度的 O(n) 递推算法，正动力学的经典解法","explanation":"Roy Featherstone 1983 年在 IJRR 论文中提出，也叫 Featherstone 算法。它解决正动力学：给定关节角、关节速度和关节力矩，求关节加速度。ABA 引入「铰接体惯量」，即某个连杆连同它外侧所有连杆作为一个带关节的整体所表现出的惯性，沿运动链先由根向外算速度、再由外向内累积铰接体惯量、最后由内向外算加速度，计算量只随关节数 n 线性增长。Pinocchio 等刚体动力学库都实现了它。","example":"仿真一台 7 轴机械臂的每个时间步：已知当前关节角、速度和电机输出力矩，调用 ABA（例如 Pinocchio 的 aba 函数）得到关节加速度，再做数值积分得到下一时刻的状态。","related":["正动力学","复合刚体算法","递归牛顿-欧拉算法","空间向量代数","质量矩阵","物理引擎"]},{"id":"spatial-vector-algebra","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"Roy Featherstone: Spatial Vectors and Rigid-Body Dynamics","url":"https://royfeatherstone.org/spatial/"},{"title":"Roy Featherstone: spatial_v2 software (accompanies Rigid Body Dynamics Algorithms)","url":"https://royfeatherstone.org/spatial/v2/index.html"},{"title":"Pinocchio (GitHub)","url":"https://github.com/stack-of-tasks/pinocchio"}],"as_of":"","related_ids":["recursive-newton-euler-algorithm","articulated-body-algorithm","composite-rigid-body-algorithm","twist","wrench","pinocchio"],"name":"空间向量代数","alt":"Spatial Vector Algebra","abbr":"","aliases":["空间向量","6D 空间向量","空间代数","Spatial Algebra"],"one_liner":"把角量和线量合成 6 维向量来算多刚体动力学的记号体系。","explanation":"空间向量代数由 Roy Featherstone 系统整理，是他的著作《Rigid Body Dynamics Algorithms》的数学基础。做法是把刚体的角速度和线速度拼成一个 6 维「运动向量」，把力矩和力拼成一个 6 维「力向量」，惯性也写成 6×6 的空间惯量矩阵，于是描述平动的牛顿方程和描述转动的欧拉方程可以合并成一条 6 维方程。运动向量和力向量是两类不同的量，各有对应的叉乘运算；它们和旋量理论里的运动旋量、力旋量本质相同。好处是公式短、坐标变换统一，递归算法写起来很规整：递归牛顿-欧拉算法（RNEA，算逆动力学）、铰接体算法（ABA，算正动力学）、复合刚体算法（CRBA，算质量矩阵）都用这套记号。Pinocchio 等动力学库都建立在 Featherstone 的算法之上。","example":"一个正在空中翻转的机身，速度写成 6 维向量：按 Featherstone 的约定前 3 维是角速度、后 3 维是线速度（有的库顺序相反，读代码时要留意）。从父连杆坐标系换到子连杆坐标系时，只需乘一个 6×6 变换矩阵，角速度和线速度一起换好。","related":["递归牛顿-欧拉算法","铰接体算法","复合刚体算法","运动旋量（速度旋量）","力旋量","Pinocchio"]},{"id":"dynamic-parameter-identification","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"Atkeson, An, Hollerbach: Estimation of Inertial Parameters of Manipulator Loads and Links (IJRR 1986)","url":"https://doi.org/10.1177/027836498600500306"},{"title":"Swevers et al.: Optimal robot excitation and identification (IEEE TRA 1997)","url":"https://doi.org/10.1109/70.631234"},{"title":"Wensing, Kim, Slotine: Linear Matrix Inequalities for Physically-Consistent Inertial Parameter Identification","url":"https://arxiv.org/abs/1701.04395"}],"as_of":"","related_ids":["inertial-parameters","system-identification","rigid-body-dynamics","gravity-compensation","friction-compensation","payload"],"name":"动力学参数辨识","alt":"Dynamic Parameter Identification","abbr":"","aliases":["惯性参数辨识","负载辨识","动力学辨识","Inertial Parameter Identification"],"one_liner":"让机器人按特定轨迹运动，从力矩数据反推各连杆的质量和惯量。","explanation":"动力学参数辨识指用实测数据估计机器人动力学模型的参数：每个连杆的质量、一阶质量矩（与质心位置有关）和惯性张量，共 10 个惯性参数，常再加关节摩擦等。Atkeson、An、Hollerbach 1986 年指出，牛顿-欧拉方程可改写成关节力矩对这些参数线性的形式 τ = Y(q,q̇,q̈)π，Y 是只依赖关节角、速度、加速度的回归矩阵，π 是参数向量，于是用最小二乘即可求解。为让每个参数都被数据充分激发，常让机械臂跑一段按傅里叶级数优化的激励轨迹（Swevers 等 1997）。CAD 给的参数往往不准，加负载后还会变；辨识准了，重力补偿、计算力矩控制和仿真对齐才可靠。Wensing 等 2017 年又用线性矩阵不等式约束保证结果物理上合理。","example":"机械臂末端换上一个没有参数的新夹爪后，让各关节跑几十秒周期运动，记录关节角和力矩（或电流），用最小二乘解出负载的质量和质心，再填回重力补偿模型。","related":["惯性参数","系统辨识","刚体动力学","重力补偿","摩擦补偿","负载"]},{"id":"stiffness","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"Stiffness - Wikipedia","url":"https://en.wikipedia.org/wiki/Stiffness"},{"title":"legged_gym: anymal_c_rough_config.py","url":"https://raw.githubusercontent.com/leggedrobotics/legged_gym/master/legged_gym/envs/anymal_c/mixed_terrains/anymal_c_rough_config.py"},{"title":"Modern Robotics: Mechanics, Planning, and Control (Lynch & Park, free preprint)","url":"https://hades.mech.northwestern.edu/index.php/Modern_Robotics"}],"as_of":"","related_ids":["compliance","damping","impedance-control","stiffness-and-damping-gains","proportional-derivative-control","mass-spring-damper-system"],"name":"刚度","alt":"Stiffness","abbr":"","aliases":["劲度","刚性","劲度系数","Rigidity"],"one_liner":"物体或关节抵抗变形的能力：受同样的力，变形越小刚度越大。","explanation":"刚度定义为力与所产生位移之比，k = F/δ（F 是力，δ 是沿力方向的位移），单位 N/m；转动方向用力矩除以转角，单位 N·m/rad。它的倒数叫柔度。机器人里这个词有两层意思：一是结构刚度，连杆、减速器、皮带受力都会弯、会扭，直接影响末端精度；二是控制刚度，即控制器「装」出来的虚拟弹簧，比如 PD 控制的比例增益、阻抗控制里的刚度矩阵 K。刚度高，跟踪准、抗干扰强，但碰到东西冲击大；刚度低更柔顺安全，适合接触任务。强化学习运控配置里的 stiffness / damping，指的就是关节 PD 的刚度和阻尼增益。","example":"legged_gym 给 ANYmal C 每个关节设 stiffness = 80 N·m/rad：策略给出的目标角和实际关节角差 0.1 rad 时，关节会产生约 8 N·m 的回复力矩，再减去阻尼项。","related":["柔顺性","阻尼","阻抗控制","刚度与阻尼增益","PD 控制","质量-弹簧-阻尼系统"]},{"id":"compliance","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"Stiffness - Wikipedia（Compliance 为刚度的倒数）","url":"https://en.wikipedia.org/wiki/Stiffness"},{"title":"Remote center compliance - Wikipedia","url":"https://en.wikipedia.org/wiki/Remote_center_compliance"},{"title":"Modern Robotics（Lynch & Park, 2017 预印本）第 11 章 Robot Control","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["stiffness","impedance-control","admittance-control","compliance-control","series-elastic-actuator","peg-in-hole-insertion"],"name":"柔顺性","alt":"Compliance","abbr":"","aliases":["柔顺","顺应性","柔度"],"one_liner":"机器人受外力时能顺势退让的程度，数值上是刚度的倒数。","explanation":"柔顺性在力学里是刚度的倒数：刚度 k 表示产生单位变形要多大的力（N/m），柔顺性 1/k 表示单位力能造成多大变形（m/N）。机器人领域用它描述手臂或关节受外力时是否会让位：纯位置控制的机械臂很「硬」，碰到桌面或人会产生很大的力；柔顺的机器人则会像弹簧一样退让。柔顺可以是被动的，来自机构本身的弹性，例如串联弹性驱动器、谐波减速器柔轮的扭转变形，或 Draper 实验室 1970 年代发明的远中心柔顺装置（RCC）；也可以是主动的，用阻抗控制、导纳控制在软件里模拟一根虚拟弹簧。插孔装配、擦桌子、与人协作这类接触任务都离不开它。","example":"轴孔装配时孔位稍有偏差，刚性手臂会让轴卡在孔边；在手腕和夹爪之间加一个 RCC，轴碰到孔口倒角后会被推着横向移动、自动对正滑进孔里。","related":["刚度","阻抗控制","导纳控制","柔顺控制","串联弹性驱动器","轴孔装配"]},{"id":"damping","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"Damping - Wikipedia","url":"https://en.wikipedia.org/wiki/Damping"},{"title":"Modern Robotics（Lynch & Park, 2017 预印本）第 11 章 Robot Control","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Actuators - Isaac Lab Documentation","url":"https://isaac-sim.github.io/IsaacLab/main/source/overview/core-concepts/actuators.html"}],"as_of":"","related_ids":["damping-ratio","stiffness","mass-spring-damper-system","proportional-derivative-control","stiffness-and-damping-gains","impedance-control"],"name":"阻尼","alt":"Damping","abbr":"","aliases":["阻尼系数","阻尼力","Damping Coefficient"],"one_liner":"把运动或振动的能量逐渐耗散掉，让系统慢下来、稳下来的作用。","explanation":"阻尼指振动或运动系统里把能量耗散掉的作用，如流体黏滞、摩擦等。最常用的线性（黏性）模型是阻尼力 = −b·v，v 是速度，b 是阻尼系数，速度越快阻力越大。在质量-弹簧-阻尼系统 m·ẍ + b·ẋ + k·x = f 中（m 质量、k 刚度、f 外力），阻尼比 ζ 决定响应形态：ζ<1 欠阻尼，来回振荡；ζ=1 临界阻尼，最快回到平衡且不过冲；ζ>1 过阻尼，回得慢。机器人里 PD 控制的 D 增益相当于给关节加了虚拟阻尼器，Isaac Lab 等仿真器里的关节控制参数就直接叫 stiffness 和 damping；关节本身的机械阻尼也要辨识后写进仿真模型。","example":"腿足机器人关节常用 PD 控制 τ = kp·(q_des − q) + kd·(q̇_des − q̇)，kd 就是阻尼增益：取太小关节会抖动、过冲，取太大响应迟缓。《Modern Robotics》建议把增益选在临界阻尼 ζ=1 附近。","related":["阻尼比","刚度","质量-弹簧-阻尼系统","PD 控制","刚度与阻尼增益","阻抗控制"]},{"id":"mass-spring-damper-system","category":"mechanics","sec":6,"tier":2,"sources":[{"title":"Wikipedia: Mass-spring-damper model","url":"https://en.wikipedia.org/wiki/Mass-spring-damper_model"}],"as_of":"","related_ids":["damping-ratio","natural-frequency","stiffness","damping","impedance-control","proportional-derivative-control"],"name":"质量-弹簧-阻尼系统","alt":"Mass-Spring-Damper System","abbr":"","aliases":["质量-弹簧-阻尼模型","弹簧阻尼模型","弹簧-质量-阻尼系统","Mass-Spring-Damper Model","Spring-Mass-Damper System"],"one_liner":"由质量、弹簧、阻尼器组成的最基础振动模型，控制和接触问题常用它近似。","explanation":"质量-弹簧-阻尼系统是力学和控制里最基础的动态模型：质量块 m 连着刚度为 k 的弹簧和阻尼系数为 c 的阻尼器，运动方程为 mẍ + cẋ + kx = F，x 是偏离平衡点的位移，F 是外力。弹簧把质量拉回平衡点，阻尼器消耗能量。由它定义固有频率 ωn = √(k/m) 和阻尼比 ζ = c/(2√(km))：ζ<1 会振荡着停下（欠阻尼），ζ=1 最快回到平衡且不超调（临界阻尼），ζ>1 慢慢爬回去（过阻尼）。机器人里到处是它：关节 PD 控制相当于虚拟弹簧加阻尼，阻抗控制让末端表现成期望的质量-弹簧-阻尼，不少仿真器的软接触也按弹簧-阻尼计算接触力。","example":"关节 PD 控制 τ = Kp(q_target − q) − Kd·q̇ 中，Kp 相当于弹簧刚度 k，Kd 相当于阻尼 c：Kd 取太小关节会来回晃，取太大动作会变迟钝。","related":["阻尼比","固有频率","刚度","阻尼","阻抗控制","PD 控制"]},{"id":"natural-frequency","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Natural frequency","url":"https://en.wikipedia.org/wiki/Natural_frequency"},{"title":"Lynch & Park, Modern Robotics（2017）11.2–11.4 节：二阶误差动力学与 PD 增益","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["damping-ratio","mass-spring-damper-system","stiffness","flexible-joint","proportional-derivative-control","control-bandwidth"],"name":"固有频率","alt":"Natural Frequency","abbr":"","aliases":["自然频率","本征频率","ωn"],"one_liner":"系统不受持续外力时自由振动的频率，外力频率接近它就会共振。","explanation":"固有频率是振动系统在没有持续外部激励时自行振荡的频率。最简单的质量-弹簧系统里 ω₀ = √(k/m)：k 是弹簧刚度，m 是质量，单位是 rad/s，除以 2π 换成赫兹。刚度越大、质量越小，振得越快。外力频率接近固有频率时振幅会显著放大，这就是共振。它对机器人有两层意义：一是结构，谐波减速器、细长连杆、柔性关节都有弹性，整机存在固有频率，控制增益过高或轨迹加速度突变都可能激起振动；二是控制，关节做 PD 控制时误差满足二阶方程，其固有频率 ωn = √(Kp/M)（Kp 为比例增益，M 为转动惯量），和阻尼比一起决定响应快慢与超调。","example":"关节惯量 M = 0.1 kg·m²、比例增益 Kp = 10 N·m/rad 时，ωn = √(10/0.1) = 10 rad/s，约 1.6 Hz；把 Kp 调到 40，ωn 翻倍到 20 rad/s，响应更快，但也更容易激起未建模柔性带来的结构振动。","related":["阻尼比","质量-弹簧-阻尼系统","刚度","柔性关节","PD 控制","控制带宽"]},{"id":"damping-ratio","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Damping（damping ratio）","url":"https://en.wikipedia.org/wiki/Damping"},{"title":"MuJoCo Documentation: Modeling – Solver parameters（solref: timeconst, dampratio）","url":"https://mujoco.readthedocs.io/en/stable/modeling.html"}],"as_of":"","related_ids":["damping","mass-spring-damper-system","natural-frequency","proportional-derivative-control","stiffness-and-damping-gains","step-response-metrics"],"name":"阻尼比","alt":"Damping Ratio","abbr":"","aliases":["临界阻尼","Critical Damping","欠阻尼/过阻尼","ζ"],"one_liner":"衡量振动衰减快慢的无量纲数，决定系统回到平衡时会不会来回晃。","explanation":"阻尼比 ζ 描述二阶系统（如质量-弹簧-阻尼系统）的阻尼程度：ζ = c / (2√(km))，m 是质量，k 是弹簧刚度，c 是阻尼系数，分母 2√(km) 叫临界阻尼。运动方程可写成 ẍ + 2ζωₙẋ + ωₙ²x = 0，ωₙ = √(k/m) 是固有频率。ζ<1 为欠阻尼，会冲过目标再回来、来回振荡；ζ=1 为临界阻尼，不超调且回到平衡最快；ζ>1 为过阻尼，不振荡但回得慢。关节 PD 控制可看成虚拟弹簧（Kp）加阻尼（Kd），调增益就是在调刚度和阻尼比。MuJoCo 的接触参数 solref 也用时间常数和阻尼比来设，阻尼比通常取 1（临界阻尼）。","example":"把关节看成转动惯量 0.1 kg·m² 的转子，Kp=40 N·m/rad，要临界阻尼就取 Kd = 2√(40×0.1) = 4 N·m·s/rad；Kd 再小，关节到位时就会晃。","related":["阻尼","质量-弹簧-阻尼系统","固有频率","PD 控制","刚度与阻尼增益","阶跃响应指标（超调 / 调节时间 / 稳态误差）"]},{"id":"flexible-joint","category":"mechanics","sec":6,"tier":3,"sources":[{"title":"Spong: Modeling and Control of Elastic Joint Robots (J. Dyn. Sys., Meas., Control 1987)","url":"https://doi.org/10.1115/1.3143860"},{"title":"Lynch & Park, Modern Robotics（8.9.5 Joint and Link Flexibility）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["strain-wave-gear","series-elastic-actuator","stiffness","compliance","actuator-modeling","joint-torque-sensor"],"name":"柔性关节","alt":"Flexible Joint","abbr":"","aliases":["弹性关节","Elastic Joint","关节柔性","Joint Flexibility"],"one_liner":"电机和连杆之间有明显弹性的关节，电机转角不等于连杆实际转角。","explanation":"柔性关节指电机与所驱动连杆之间存在不可忽略弹性的关节。常见来源是谐波减速器：它的柔轮靠自身变形换来近乎零背隙，也带来扭转弹性。Spong 1987 年的经典模型把这种关节看成电机侧和连杆侧之间串了一根扭簧，τ = K(θ − q)：θ 是换算到输出端的电机转角，q 是连杆转角，K 是关节刚度，τ 是传过去的力矩。这样每个关节多出一组状态，动力学阶数升高，带来两个问题：电机编码器读数不等于连杆真实角度，末端会有位置偏差；低频振动模态让高增益控制容易抖。也有设计主动引入柔性，比如串联弹性驱动器，用弹簧变形测力并提高碰撞安全性。","example":"轻量机械臂带着负载快速停下时，末端常会轻微来回晃几下才停稳，谐波减速器带来的关节柔性是原因之一。","related":["谐波减速器","串联弹性驱动器","刚度","柔顺性","执行器建模","关节力矩传感器"]},{"id":"contact-force","category":"mechanics","sec":7,"tier":2,"sources":[{"title":"Contact force - Wikipedia","url":"https://en.wikipedia.org/wiki/Contact_force"},{"title":"Contact Sensor - Isaac Lab Documentation","url":"https://isaac-sim.github.io/IsaacLab/main/source/overview/core-concepts/sensors/contact_sensor.html"}],"as_of":"","related_ids":["normal-force-and-tangential-force","coulomb-friction","friction-cone","ground-reaction-force","contact-model","six-axis-force-torque-sensor"],"name":"接触力","alt":"Contact Force","abbr":"","aliases":[],"one_liner":"两个物体接触时相互施加的力，可拆成法向压力和切向摩擦力。","explanation":"接触力是两个物体因相互接触而产生的力，与重力、电磁力这类隔空作用的力相对。它通常分解成两部分：垂直于接触面的法向力（压紧力，只能推不能拉）和平行于接触面的切向力（摩擦力），后者的大小受摩擦系数和法向力限制，见库仑摩擦。机器人的走、抓、推、插都靠接触力完成：腿足机器人靠脚底的地面反作用力支撑和前进，夹爪靠指尖的法向力和摩擦力把物体提起来。物理引擎要在每个仿真步求解接触力；实物上则用六维力传感器、足底力传感器或触觉传感器测量；控制器里常把「接触力不超出摩擦锥」写成约束。","example":"在 Isaac Lab 里训练四足行走时，给每只脚挂一个接触传感器读取 net_forces_w（世界坐标下这只脚受到的总接触力）；读数接近零说明脚已离地，可以据此判断步态、设计奖励。","related":["法向力与切向力（剪切力）","库仑摩擦","摩擦锥","地面反作用力","接触模型","六维力传感器"]},{"id":"normal-force-and-tangential-force","category":"mechanics","sec":7,"tier":2,"sources":[{"title":"Wikipedia: Normal force","url":"https://en.wikipedia.org/wiki/Normal_force"},{"title":"Wikipedia: Friction","url":"https://en.wikipedia.org/wiki/Friction"}],"as_of":"","related_ids":["contact-force","coulomb-friction","friction-cone","friction-coefficient","slip-detection","tactile-sensor"],"name":"法向力与切向力（剪切力）","alt":"Normal Force and Tangential (Shear) Force","abbr":"","aliases":["法向力","切向力","剪切力","正压力","Normal Force","Tangential Force","Shear Force"],"one_liner":"接触力垂直于接触面的分量叫法向力，平行于接触面的分量叫切向力（剪切力）。","explanation":"两个物体接触时，接触力可以分解成两部分：垂直于接触面的法向力，负责「压住」、防止穿透；平行于接触面的切向力，也叫剪切力，一般由摩擦提供，负责阻止相对滑动。二者由库仑摩擦定律联系：|f_t| ≤ μf_n，f_t 是切向力，f_n 是法向力，μ 是摩擦系数。需要的切向力超过 μ 倍法向力就会打滑，这个约束在三维里就是摩擦锥。机器人从侧面夹杯子时，杯子的重量全靠指尖的切向摩擦力托住，夹紧力（法向力）不够就会滑落。所以触觉传感器通常同时测法向力和剪切力，剪切力的变化是判断即将滑移的重要信号；足式机器人也要让地面反作用力留在摩擦锥内。","example":"两指夹爪从侧面夹起 0.3 kg 的杯子，摩擦系数 0.5：每根手指要提供约 1.5 N 向上的切向力，所以每指法向夹紧力至少约 3 N，实际还要留余量。","related":["接触力","库仑摩擦","摩擦锥","摩擦系数","滑移检测","触觉传感器"]},{"id":"friction-coefficient","category":"mechanics","sec":7,"tier":2,"sources":[{"title":"Friction - Wikipedia","url":"https://en.wikipedia.org/wiki/Friction"},{"title":"MuJoCo Documentation - Computation (contact, friction)","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"}],"as_of":"","related_ids":["coulomb-friction","friction-cone","normal-force-and-tangential-force","slip","static-friction-and-stribeck-effect","dynamics-randomization"],"name":"摩擦系数","alt":"Friction Coefficient (Coefficient of Friction)","abbr":"μ","aliases":["静摩擦系数","动摩擦系数","Coefficient of Friction"],"one_liner":"最大摩擦力与法向压力之比，决定接触面多不容易打滑。","explanation":"按库仑摩擦定律，两接触面间的摩擦力 f 不超过摩擦系数 μ 乘以法向力 N（垂直于接触面的压力）：f ≤ μN。μ 是无量纲数，取决于两种材料和表面状态，与接触面积基本无关，只能靠实验测量。它分两种：静摩擦系数 μ_s 决定物体开始滑动前能承受的最大切向力，动摩擦系数 μ_k 对应已经滑动时的摩擦，通常 μ_s 大于 μ_k。常见干燥材料多在 0.3–0.6 之间，橡胶对混凝土约 0.6–0.85，冰对冰只有 0.02–0.09。在机器人里，μ 决定夹爪要多大握力才不掉东西、脚踩地时能用多大水平力而不打滑；MuJoCo 为每个接触设滑动、扭转、滚动三种摩擦参数，训练时常对 μ 做随机化以缩小虚实差距。","example":"两指夹爪夹 0.5 kg 的杯子，每指法向力 N、μ = 0.5 时，两侧摩擦最多 2×0.5×N，要托住约 4.9 N 的重力，N 至少约 4.9 N；换成 μ = 0.25 的光滑杯面，所需握力翻倍到约 9.8 N。","related":["库仑摩擦","摩擦锥","法向力与切向力（剪切力）","打滑","静摩擦与 Stribeck 效应","动力学随机化"]},{"id":"coulomb-friction","category":"mechanics","sec":7,"tier":2,"sources":[{"title":"Modern Robotics（Lynch & Park, 2017 预印本）12.2 节 Friction","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Friction - Wikipedia","url":"https://en.wikipedia.org/wiki/Friction"}],"as_of":"","related_ids":["friction-coefficient","friction-cone","static-friction-and-stribeck-effect","viscous-friction","contact-model","slip"],"name":"库仑摩擦","alt":"Coulomb Friction","abbr":"","aliases":["库仑摩擦模型","干摩擦","库仑摩擦定律","Coulomb friction model"],"one_liner":"摩擦力不超过摩擦系数乘法向力、且与滑动速度无关的经典摩擦模型。","explanation":"库仑摩擦是描述两个干燥固体接触的经验定律：切向摩擦力 f_t ≤ μ·f_n，f_n 是法向压力，μ 是摩擦系数，常见在 0.1–1 之间。不滑动时，摩擦力可在这个上限内取任意值来阻止滑动；一旦滑动，摩擦力等于 μ·f_n、方向与滑动相反，且与滑动速度和名义接触面积无关。常再区分静摩擦系数 μs 和略小的动摩擦系数 μk。规律由 Amontons 于 1699 年总结、Coulomb 于 1785 年深入研究。它只是近似，却是抓取分析和物理引擎的基础：把 f_t ≤ μ·f_n 画成三维图形就是摩擦锥，判断会不会打滑就看接触力是否落在锥内。","example":"两指夹爪各用 10 N 压住杯子两侧，若 μ=0.5，每个接触点最多提供 5 N 摩擦力，合计 10 N，大约能提起重约 1 kg（重力约 9.8 N）的杯子；杯子再重就会从指间滑落。","related":["摩擦系数","摩擦锥","静摩擦与 Stribeck 效应","黏性摩擦","接触模型","打滑"]},{"id":"slip","category":"mechanics","sec":7,"tier":2,"sources":[{"title":"Modern Robotics (Lynch & Park), Ch.12.2 Contact Forces and Friction","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Humanoid-Gym: humanoid_env.py (_reward_foot_slip)","url":"https://github.com/roboterax/humanoid-gym/blob/main/humanoid/envs/custom/humanoid_env.py"}],"as_of":"","related_ids":["coulomb-friction","friction-cone","friction-coefficient","slip-detection","force-closure","stance-phase-swing-phase"],"name":"打滑","alt":"Slip","abbr":"","aliases":["滑移","滑动","Sliding","Slippage","脚底打滑","Foot Slip"],"one_liner":"接触面之间出现相对滑动，通常因切向力超过摩擦力上限。","explanation":"打滑指两个接触的物体在接触点出现相对滑动，与之相对的状态叫黏着（接触点相对静止）。按最常用的库仑摩擦模型，切向摩擦力 f_t 须满足 f_t ≤ μf_n（μ 是摩擦系数，f_n 是法向压力）；所需的切向力一旦超过这个上限，接触就由黏着转为滑动，此时摩擦力等于 μf_n、方向与滑动方向相反，几何上相当于接触力跑出了摩擦锥。操作中，抓取打滑会让物体从手里滑落或转动，对策是加大握力或用触觉传感器做滑移检测；腿足机器人里支撑脚打滑容易摔倒，强化学习训练常对着地脚的水平速度加惩罚。有意控制的滑动也是技能，比如推着物体在桌面滑动、让物体在指间滑转。","example":"两指夹爪竖直夹起 0.5 kg 的杯子，约 4.9 N 的重力由两个接触点的摩擦力分担；若 μ=0.5，每根手指至少要压出约 4.9 N 的法向力（2×0.5×4.9≈4.9 N），否则杯子会往下滑。Humanoid-Gym 的 foot_slip 奖励项就是在脚接触地面时惩罚脚的水平速度。","related":["库仑摩擦","摩擦锥","摩擦系数","滑移检测","力封闭","支撑相 / 摆动相"]},{"id":"friction-cone","category":"mechanics","sec":7,"tier":2,"sources":[{"title":"Robotic Manipulation (MIT, Russ Tedrake) - Bin Picking: friction cone","url":"https://manipulation.csail.mit.edu/clutter.html"},{"title":"MuJoCo Documentation - Computation (pyramidal / elliptic cones)","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"Friction - Wikipedia","url":"https://en.wikipedia.org/wiki/Friction"}],"as_of":"","related_ids":["friction-coefficient","coulomb-friction","friction-pyramid","force-closure","ground-reaction-force","contact-force-optimization"],"name":"摩擦锥","alt":"Friction Cone","abbr":"","aliases":["摩擦圆锥"],"one_liner":"一个接触点在不打滑前提下能施加的全部力，构成一个圆锥形集合。","explanation":"由库仑摩擦定律，接触力沿表面的切向分量不能超过垂直表面的法向分量乘摩擦系数 μ，写成 √(f_x² + f_y²) ≤ μ·f_z，其中 f_z 是法向力，f_x、f_y 是两个切向分量。满足这个不等式的所有力在三维空间里恰好组成以接触法线为轴的圆锥，半顶角 θ 满足 tanθ = μ。力在锥内就不打滑，出了锥就会滑动。摩擦锥是接触计算的基本约束：抓取分析用它判断力封闭，腿足机器人的模型预测控制和全身控制要求每只脚的地面反作用力留在锥内，物理引擎也用它约束接触力。圆锥是非线性约束，优化时常用多棱锥（摩擦金字塔）近似成线性不等式；MuJoCo 同时提供棱锥和椭圆锥两种选项。","example":"四足机器人在 μ 约 0.6 的地面上行走，控制器要求每只脚的水平力不超过竖直力的 0.6 倍；到了湿滑瓷砖上 μ 变小、锥变窄，就得缩小步幅、减小蹬地的水平力。","related":["摩擦系数","库仑摩擦","摩擦金字塔","力封闭","地面反作用力","接触力优化"]},{"id":"friction-pyramid","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Lynch & Park, Modern Robotics（预印本 PDF，12.2.1 节 Figure 12.18）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"MuJoCo Documentation: Computation（Friction cones）","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"}],"as_of":"","related_ids":["friction-cone","coulomb-friction","friction-coefficient","convex-mpc","linear-complementarity-problem","mujoco"],"name":"摩擦金字塔","alt":"Friction Pyramid","abbr":"","aliases":["线性化摩擦锥","多面体摩擦锥","棱锥摩擦锥","Pyramidal Friction Cone"],"one_liner":"用多棱锥近似圆形摩擦锥，把摩擦约束变成线性不等式。","explanation":"按库仑摩擦，接触点的切向力不能超过摩擦系数 μ 乘以法向力，所有允许的接触力在三维里构成一个圆锥，即摩擦锥。圆锥约束是非线性的，于是常用多棱锥代替它，这就是摩擦金字塔：最简单的四棱锥由 (μ,0,1)、(−μ,0,1)、(0,μ,1)、(0,−μ,1) 四条棱张成，棱越多越贴近圆锥。内接棱锥会低估可用摩擦，外接会高估，抓取分析里一般取保守的内接。好处是摩擦约束全变成线性不等式，接触问题可以用线性规划、二次规划或线性互补问题来解。四足机器人凸 MPC 里常见的 |fx| ≤ μfz、|fy| ≤ μfz 就是外接四棱锥；MuJoCo 也提供 pyramidal（棱锥）和 elliptic（椭圆锥）两种全局设置，前者让求解器面对的对偶问题变成带盒约束的凸二次规划。","example":"μ=0.5、法向力 fz=100 N 时，真实摩擦锥允许任意方向最多 50 N 的切向力；用 |fx|≤50、|fy|≤50 的外接四棱锥时，fx=fy=50 N 也被允许，合力约 70.7 N，超出真实上限，所以想保守时常把 μ 换成 μ/√2。","related":["摩擦锥","库仑摩擦","摩擦系数","凸 MPC","线性互补问题","MuJoCo"]},{"id":"torsional-and-rolling-friction","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"MuJoCo Documentation: Computation (Contact / Friction)","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"MuJoCo Documentation: XML Reference (geom friction, condim)","url":"https://mujoco.readthedocs.io/en/stable/XMLreference.html"},{"title":"Wikipedia: Rolling resistance","url":"https://en.wikipedia.org/wiki/Rolling_resistance"}],"as_of":"","related_ids":["coulomb-friction","friction-coefficient","friction-cone","contact-model","mujoco","grasping"],"name":"扭转摩擦与滚动摩擦","alt":"Torsional and Rolling Friction","abbr":"","aliases":["扭转摩擦","自旋摩擦","Spin Friction","滚动摩擦","滚动阻力","Rolling Resistance"],"one_liner":"分别阻止物体绕接触法线自转、阻止物体在表面上滚动的两种摩擦。","explanation":"常说的滑动摩擦阻止两个面相对滑动，此外还有两种：扭转摩擦阻止物体绕接触点的法线方向自转，前提是接触不是理想的一个点，而是有一小块面积；滚动摩擦（又称滚动阻力）阻止物体在表面上滚动，主要来自接触处材料反复变形时损失的能量（滞回），通常比滑动摩擦小得多，比如钢轮在钢轨上的滚阻系数约 0.0003–0.0004，汽车轮胎在混凝土路面上约 0.01–0.015。抓取分析里，能提供扭转摩擦的接触叫「软指接触」，比点接触多抵抗一个方向的力矩。仿真器里它们是可调参数：MuJoCo 每个几何体的 friction 有三个系数，依次是滑动、扭转、滚动，默认 1、0.005、0.0001；condim 设为 4 才启用扭转摩擦，设为 6 再加上滚动摩擦。","example":"在 MuJoCo 里把一个球放在平面上轻推：condim 只设为 3（只有滑动摩擦）时，球会一直滚下去；设为 6 并给出滚动摩擦系数，球会逐渐停下。同理，两指捏住瓶子不让它在指间打转，靠的是指腹与瓶身之间的扭转摩擦。","related":["库仑摩擦","摩擦系数","摩擦锥","接触模型","MuJoCo","抓取"]},{"id":"static-friction-and-stribeck-effect","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Wikipedia: Stribeck curve","url":"https://en.wikipedia.org/wiki/Stribeck_curve"},{"title":"Wikipedia: Stiction","url":"https://en.wikipedia.org/wiki/Stiction"},{"title":"Sorrentino et al., Physics-Informed Learning for the Friction Modeling of High-Ratio Harmonic Drives (arXiv:2410.12685)","url":"https://arxiv.org/abs/2410.12685"}],"as_of":"","related_ids":["coulomb-friction","viscous-friction","friction-compensation","strain-wave-gear","system-identification","friction-coefficient"],"name":"静摩擦与 Stribeck 效应","alt":"Static Friction (Stiction) and Stribeck Effect","abbr":"","aliases":["Stiction","最大静摩擦","Stribeck 曲线","斯特里贝克效应","Stribeck 摩擦"],"one_liner":"起动前要先克服较大的静摩擦，刚动起来后摩擦反而先变小。","explanation":"静摩擦（stiction，static 与 friction 的合成词）指两个接触面相对静止时，要让它们开始相对运动必须克服的那股力；最大静摩擦通常比滑动起来之后的动摩擦大。Stribeck 效应得名于德国工程师 Richard Stribeck，他在 1901–1902 年发表的润滑轴承实验表明：有润滑的接触里，摩擦力并不随速度保持恒定，而是从静止起先下降，到某个速度降到最低，再随速度上升（上升段主要来自黏性摩擦）。画成摩擦-速度图就是 Stribeck 曲线。对机器人来说，减速器和关节在低速、换向时摩擦变化最剧烈，容易出现「卡住—突然冲出—再卡住」的黏滑现象，造成低速爬行和小幅定位误差。做关节摩擦补偿或参数辨识时，常用「库仑 + 黏性 + Stribeck」模型拟合，例如 ergoCub 人形机器人谐波减速关节的摩擦辨识研究就把它当作基线模型。","example":"给谐波减速关节一个很小的速度指令：起初电机电流升高、关节却不动（静摩擦还没被克服）；一旦突破，摩擦骤降，关节一下子冲过头，控制器再把它拉回，如此反复，编码器读数呈锯齿状，这就是低速黏滑。","related":["库仑摩擦","黏性摩擦","摩擦补偿","谐波减速器","系统辨识","摩擦系数"]},{"id":"viscous-friction","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Sorrentino et al., Physics-Informed Learning for the Friction Modeling of High-Ratio Harmonic Drives (arXiv:2410.12685)","url":"https://arxiv.org/abs/2410.12685"},{"title":"MuJoCo Documentation: Computation (Passive forces / damping)","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"Wikipedia: Friction","url":"https://en.wikipedia.org/wiki/Friction"}],"as_of":"","related_ids":["coulomb-friction","static-friction-and-stribeck-effect","damping","friction-compensation","dynamic-parameter-identification","dynamics-randomization"],"name":"黏性摩擦","alt":"Viscous Friction","abbr":"","aliases":["粘滞摩擦","黏滞摩擦","粘性摩擦","黏性阻尼","Viscous Damping"],"one_liner":"大小与相对速度成正比的摩擦，转得越快阻力越大。","explanation":"黏性摩擦是一种与速度成正比的阻力，最简单的写法是 F = −b·v：v 是相对速度（关节里就是角速度），b 是黏性摩擦系数，负号表示方向与运动相反。它来自润滑油等流体层之间的内摩擦（黏度），速度为零时它也为零，这点和库仑摩擦不同，后者大小基本与速度无关、只看正压力。机器人关节里，电机、减速器和轴承的摩擦通常拆成几部分建模：库仑摩擦加黏性摩擦，低速段再加 Stribeck 效应。辨识出 b 后可以在控制器里做前馈补偿，让关节力矩控制更准。仿真器也用它模拟关节耗能：MuJoCo 关节的 damping 参数就是黏性阻尼系数，产生与关节速度方向相反的被动力；做仿真到现实迁移时，这个系数常要按真机辨识或做随机化。","example":"若某关节的黏性系数 b = 0.2 N·m·s/rad，以 1 rad/s 转动时黏性摩擦力矩是 0.2 N·m，以 2 rad/s 转动时就是 0.4 N·m；而库仑摩擦那部分在两个速度下几乎一样。","related":["库仑摩擦","静摩擦与 Stribeck 效应","阻尼","摩擦补偿","动力学参数辨识","动力学随机化"]},{"id":"impact","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Wikipedia: Impact (mechanics)","url":"https://en.wikipedia.org/wiki/Impact_(mechanics)"},{"title":"Wikipedia: Coefficient of restitution","url":"https://en.wikipedia.org/wiki/Coefficient_of_restitution"},{"title":"Wensing et al. 2017, Proprioceptive Actuator Design in the MIT Cheetah: Impact Mitigation and High-Bandwidth Physical Interaction（IEEE T-RO）","url":"https://doi.org/10.1109/TRO.2016.2640183"}],"as_of":"","related_ids":["coefficient-of-restitution","backdrivability","reflected-inertia","quasi-direct-drive","contact-model","ground-reaction-force"],"name":"碰撞冲击","alt":"Impact","abbr":"","aliases":["冲击","撞击","碰撞","Collision Impact"],"one_liner":"两个物体相撞时，极短时间内出现很大接触力、使速度突变的过程。","explanation":"冲击指两个物体碰撞时，力在极短时间里升到很大，速度随之几乎瞬间改变。刚体仿真和控制里常把它当作瞬时事件：冲量（力对时间的积分）等于动量变化，再用恢复系数 e 决定反弹多少，e=0 完全不弹，e=1 没有能量损失。机器人里冲击很常见：足式机器人每步落地、跳跃着陆、机械臂撞到人或桌面。峰值冲击力可能损坏减速器和传感器，也会让脚打滑、控制失稳。硬件上靠降低折算到输出端的电机惯量、提高反驱性来缓冲；Wensing 等人 2017 年为 MIT Cheetah 提出冲击缓解因子（IMF）量化这种能力，该机器人跳跃步态奔跑时接触时间短至 85 ms、峰值力超过 450 N。","example":"1 kg 的球以 2 m/s 竖直落地，恢复系数 0.5，就以 1 m/s 反弹；动量从 −2 变为 +1 kg·m/s，冲量 3 N·s，若接触只持续 10 ms，平均接触力约 300 N，约为球重的 30 倍。","related":["恢复系数","反驱性","反射惯量","准直驱","接触模型","地面反作用力"]},{"id":"coefficient-of-restitution","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Wikipedia: Coefficient of restitution","url":"https://en.wikipedia.org/wiki/Coefficient_of_restitution"},{"title":"Isaac Lab API: isaaclab.envs.mdp（randomize_rigid_body_material）","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.envs.mdp.html"},{"title":"Isaac Lab API: isaaclab.sim.spawners（RigidBodyMaterialCfg.restitution）","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.sim.spawners.html"}],"as_of":"","related_ids":["impact","physics-engine","contact-model","domain-randomization","dynamics-randomization","friction-coefficient"],"name":"恢复系数","alt":"Coefficient of Restitution","abbr":"COR","aliases":["碰撞恢复系数","Restitution"],"one_liner":"碰撞后分离速度与碰撞前接近速度之比，衡量碰撞有多「弹」","explanation":"描述碰撞弹性的经验参数，常记作 e，一般追溯到牛顿提出的碰撞定律：e = 碰撞后两物体的相对分离速度 ÷ 碰撞前的相对接近速度。e = 1 是完全弹性碰撞，动能不损失；e = 0 是完全非弹性碰撞，物体不反弹；实际碰撞介于两者之间。在机器人里它主要出现在两处：一是足式机器人落脚、机械手抓取瞬间的碰撞建模；二是物理引擎的材质参数，Isaac Lab 的刚体材质就有 restitution 一项，与静摩擦、动摩擦系数并列，训练时常一起做域随机化，避免策略只适应某一种弹性的地面或物体。","example":"小球从 1 m 高处落到地面、弹回 0.64 m，则 e = √(0.64/1) = 0.8。Isaac Lab 的 randomize_rigid_body_material 会在给定范围内随机采样静摩擦、动摩擦和恢复系数。","related":["碰撞冲击","物理引擎","接触模型","域随机化","动力学随机化","摩擦系数"]},{"id":"grasp-taxonomy","category":"mechanics","sec":7,"tier":2,"sources":[{"title":"A comprehensive grasp taxonomy (Feix et al., RSS 2009 Workshop)","url":"https://www.csc.kth.se/grasp/taxonomyGRASP.pdf"},{"title":"The GRASP Taxonomy of Human Grasp Types (Feix et al., IEEE THMS 2016)","url":"https://doi.org/10.1109/THMS.2015.2470657"},{"title":"On grasp choice, grasp models, and the design of hands for manufacturing tasks (Cutkosky, 1989)","url":"https://doi.org/10.1109/70.34763"}],"as_of":"","related_ids":["grasping","dexterous-hand","dexterous-manipulation","hand-synergies","thumb-opposition","grasp-planning"],"name":"抓取分类（强力抓取 / 精确抓取 / 捏取）","alt":"Grasp Taxonomy (Power Grasp vs. Precision Grasp / Pinch)","abbr":"","aliases":["抓握分类","强力抓握","精确抓握","精细捏取","Power Grasp","Precision Grasp","Pinch Grasp","Cutkosky 抓取分类","GRASP 分类法"],"one_liner":"按手和物体怎么接触来给抓法分类，最粗一层分强力抓取和精确抓取。","explanation":"抓取分类是把人手或机械手抓东西的方式整理成类别体系。1956 年 Napier 把人手抓握分成两大类：强力抓取靠手掌和四指把物体包住，求稳、出力大；精确抓取主要靠拇指和其他手指的指腹相对，便于微调位置。捏取属于精确抓取，只用指尖或指侧夹住小物体。1989 年 Cutkosky 观察制造业工人用工具，提出面向机器人手设计的抓取分类树；Feix 等人汇总十几种文献，整理出 33 种抓取类型，再按对掌方式（手掌、指腹、指侧）和拇指姿态细分，2016 年正式发表为 GRASP 分类法。它常用来决定灵巧手要保留哪些自由度，也用作抓取数据集的类别标签。","example":"握锤柄敲钉子是强力抓取；用拇指和食指指尖捏起一颗螺丝是捏取，属于精确抓取。评测一只新灵巧手时，常逐一检查它能否做出这些典型抓法。","related":["抓取","灵巧手","灵巧操作","手部协同","拇指对掌","抓取规划"]},{"id":"antipodal-grasp","category":"mechanics","sec":7,"tier":2,"sources":[{"title":"Modern Robotics（Lynch & Park, 2017 预印本）第 12 章 Grasping and Manipulation","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Dex-Net 2.0: Deep Learning to Plan Robust Grasps with Synthetic Point Clouds and Analytic Grasp Metrics (arXiv 1703.09312)","url":"https://arxiv.org/abs/1703.09312"}],"as_of":"","related_ids":["force-closure","friction-cone","parallel-jaw-gripper","grasp-pose-detection","dex-net-2-0","grasp-quality-metric"],"name":"对跖抓取","alt":"Antipodal Grasp","abbr":"","aliases":["对径抓取","两指对抓","对跖点抓取"],"one_liner":"两个接触点正面相对、连线落在两处摩擦锥内的两指夹持抓取。","explanation":"对跖（antipodal，意为「位于相对两端」）抓取指用两个接触点从相对方向夹住物体，且两点连线同时落在两处的摩擦锥（接触力不打滑时允许的方向范围）之内。据《Modern Robotics》，平面情形下满足这一条件的两个摩擦接触就构成力封闭，能抵抗任意方向的外力和力矩；三维中两个理想点接触挡不住绕两点连线的转动，实际靠指面的扭转摩擦补足。1993 年 Chen 与 Burdick 给出了在不规则物体上找对跖点对的算法。平行二指夹爪做的就是这种抓取，所以很多学习式抓取方法先在点云或深度图上采样对跖点对当候选，再用网络打分。","example":"Dex-Net 2.0（2017）在深度图上找对跖点对，生成几百个平行夹爪抓取候选，再用卷积网络 GQ-CNN 评估哪个最稳，在 ABB YuMi 上对已知物体的抓取成功率为 93%。","related":["力封闭","摩擦锥","二指夹爪","抓取位姿检测","Dex-Net","抓取质量指标"]},{"id":"force-closure","category":"mechanics","sec":7,"tier":2,"sources":[{"title":"Robotic Manipulation (MIT, Russ Tedrake) - Bin Picking: contact wrench cone, force closure","url":"https://manipulation.csail.mit.edu/clutter.html"}],"as_of":"","related_ids":["form-closure","friction-cone","wrench","antipodal-grasp","grasp-quality-metric","grasp-matrix"],"name":"力封闭","alt":"Force Closure","abbr":"","aliases":["力闭合"],"one_liner":"抓取点借助摩擦能抵抗任意方向的外力和力矩，物体不会被扯脱。","explanation":"力封闭是抓取力学里判断「抓没抓牢」的经典标准。每个接触点在摩擦作用下能施加的力是一个摩擦锥；把所有接触点能产生的力和力矩（合称力旋量，共 6 维）叠加起来，若能覆盖整个 6 维空间，就称这个抓取力封闭：无论外界往哪个方向推、拧，手指只要调整用力都能抵消。与之相对的是形封闭，只靠接触几何把物体卡死、不依赖摩擦，通常需要更多接触点。力封闭依赖摩擦系数，同样的指尖位置，抓干燥纸盒可能满足，抓沾油的玻璃杯就可能不满足。它是传统抓取规划和抓取质量指标的出发点；平面问题中两指抓取满足力封闭的条件是两接触点连线同时落在两个摩擦锥内。","example":"两指夹爪夹一块积木，两侧接触面平行、法线正对（对跖抓取）：只要两点连线在两个摩擦锥内，积木往上拉、往侧推都能被夹住，在平面意义上就是力封闭。","related":["形封闭","摩擦锥","力旋量","对跖抓取","抓取质量指标","抓取矩阵"]},{"id":"form-closure","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Lynch & Park, Modern Robotics（12.1.7 Form Closure, Theorem 12.6）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["force-closure","grasping","friction-cone","grasp-quality-metric","grasp-matrix","contact-force"],"name":"形封闭","alt":"Form Closure","abbr":"","aliases":["几何封闭","形闭合","Form-Closure Grasp","形封闭抓取"],"one_liner":"只靠接触点的几何位置把物体卡死，完全不依赖摩擦的约束状态。","explanation":"形封闭指一组固定不动的约束（手指、夹具、定位销等）在几何上阻止了物体的一切运动：物体朝任何方向平移或转动都会顶进约束里。由机器人手指实现时叫形封闭抓取。它不依赖摩擦，这是与力封闭的区别：力封闭要靠接触处的摩擦力才能抵抗任意方向的外力。Lynch 与 Park 的《Modern Robotics》给出结论：按一阶分析，平面物体至少需要 4 个点接触，空间物体至少需要 7 个（刚体自由度数加 1）。圆盘、球这类旋转对称的物体加多少点接触都做不到形封闭，因为总能绕中心转。形封闭常用于夹具和工装设计；机械臂抓取中摩擦通常可用，更多按力封闭来分析。","example":"方形零件放进四周有定位销的平面夹具里，从哪个方向推都动不了，表面涂了油也一样，这是形封闭；用平行夹爪夹住同一零件则靠摩擦，属于力封闭。","related":["力封闭","抓取","摩擦锥","抓取质量指标","抓取矩阵","接触力"]},{"id":"contact-jacobian","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Underactuated Robotics（Tedrake）: Multi-Body Dynamics 一章","url":"https://underactuated.mit.edu/multibody.html"},{"title":"MuJoCo 文档: Computation","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"}],"as_of":"","related_ids":["jacobian-matrix","contact-force","ground-reaction-force","whole-body-control","contact-force-optimization","floating-base"],"name":"接触雅可比","alt":"Contact Jacobian","abbr":"","aliases":["约束雅可比","Constraint Jacobian"],"one_liner":"把关节速度映射成接触点速度、把接触力映射回关节力矩的矩阵","explanation":"雅可比矩阵在接触点上的特例，常记作 J_c(q)。它有两种用法：一是 v_c = J_c(q)·q̇，由关节（含浮动基）速度 q̇ 得到接触点速度，脚掌不打滑就意味着 J_c·q̇ = 0；二是它的转置把接触力 λ 换算成各关节上的广义力，出现在动力学方程 M(q)·q̈ + C(q,q̇)·q̇ = τ_g(q) + B·u + J_cᵀ·λ 中（M 为质量矩阵，C 为科里奥利与离心项，τ_g 为重力项，B·u 为电机输入）。物理引擎里对应更一般的约束雅可比，MuJoCo 文档说它把关节空间的运动量映射到约束空间。全身控制和仿真接触求解都要用到它。","example":"四足机器人支撑相时，控制器先规划出每只支撑脚应提供的地面反作用力，再乘以这条腿接触雅可比的转置，换算成髋、膝关节该输出的力矩（这是忽略腿部质量时的常用近似）。","related":["雅可比矩阵","接触力","地面反作用力","全身控制","接触力优化","浮动基"]},{"id":"grasp-matrix","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Murray, Li & Sastry, A Mathematical Introduction to Robotic Manipulation（第 5 章 The grasp map）","url":"https://www.cds.caltech.edu/~murray/books/MLS/pdf/mls94-complete.pdf"}],"as_of":"","related_ids":["force-closure","form-closure","wrench","friction-cone","contact-jacobian","grasp-quality-metric"],"name":"抓取矩阵","alt":"Grasp Matrix","abbr":"G","aliases":["抓取映射","Grasp Map"],"one_liner":"把各接触点的接触力汇总成物体所受合力与合力矩的线性映射。","explanation":"抓取矩阵 G（Murray、Li、Sastry 的教材里叫 grasp map）描述多指抓取时手指在接触点施加的力，和物体受到的合力旋量之间的关系：F_o = G·f_c。其中 f_c 是所有接触力拼成的长向量，F_o 是物体受到的 6 维力旋量（3 维力加 3 维力矩）。每个接触点在 G 里占一块，由接触点位置、接触法向和接触类型（无摩擦点接触、有摩擦点接触、软指接触）决定。反过来，Gᵀ 把物体的速度映射成各接触点的速度。G 的零空间就是内力：几根手指互相挤压、但物体合力为零的那部分力，手指靠它捏紧物体而不推动物体。力封闭可以表述为：在摩擦锥约束下 G 能生成任意方向的力旋量；再结合手部雅可比 J_h（τ = J_hᵀ f_c），就能从物体需要的力反推各关节力矩。","example":"两指从左右两侧各用 10 N 水平夹住一个盒子：两个接触力经 G 相加后合力为零，这组力落在 G 的零空间里，是纯内力；要托住盒子不掉，还得在摩擦锥范围内加上向上的摩擦力分量，让 G·f_c 抵消重力。","related":["力封闭","形封闭","力旋量","摩擦锥","接触雅可比","抓取质量指标"]},{"id":"grasp-quality-metric","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Lynch & Park, Modern Robotics（预印本 PDF，12.1.7.3 节 Measuring the Quality of a Form-Closure Grasp）","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Ferrari & Canny, Planning optimal grasps（ICRA 1992）","url":"https://doi.org/10.1109/ROBOT.1992.219918"},{"title":"Mahler et al., Dex-Net 2.0（arXiv 1703.09312）","url":"https://arxiv.org/abs/1703.09312"}],"as_of":"","related_ids":["force-closure","wrench","grasp-matrix","grasp-planning","dex-net-2-0","friction-cone"],"name":"抓取质量指标","alt":"Grasp Quality Metric","abbr":"","aliases":["抓取质量","抓取质量度量","ε 指标","Epsilon Quality","Ferrari-Canny 指标"],"one_liner":"给一个抓取打分的数值，衡量它能多好地抵抗外来扰动。","explanation":"抓取质量指标把一组接触点（或一个手部姿态）映射成一个数，数越大抓得越好，用来给大量候选抓取排序。最常用的是 Ferrari 与 Canny 1992 年提出的 ε 指标：在接触力受限、且位于摩擦锥内的条件下，收集各接触点能施加的力旋量（力加力矩）求凸包，ε 是以原点为中心、能放进凸包的最大球半径，即任意方向都能抵抗的最小扰动大小；不满足力封闭时指标为零或负。力和力矩单位不同，通常用物体特征长度把力矩换算成力。Roa 与 Suárez 的综述把指标分为看接触点位置和看手部构型两类。Dex-Net 2.0 在位姿和摩擦不确定下算鲁棒 ε 指标，给约 670 万个合成样本打标签，训练抓取质量网络 GQ-CNN。","example":"同样用三根手指抓一个圆盘，三指均匀分布在圆周上时，力旋量凸包大致对称，内切球大，ε 高；三指挤在一侧时，凸包偏向一边，某个方向的推力几乎无法抵抗，ε 很小。","related":["力封闭","力旋量","抓取矩阵","抓取规划","Dex-Net","摩擦锥"]},{"id":"hand-synergies","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Santello, Flanders & Soechting 1998, Postural Hand Synergies for Tool Use（J Neurosci，PMC 全文）","url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC6793309/"},{"title":"GraspIt! Documentation: Eigengrasps","url":"https://graspit-simulator.github.io/build/html/eigengrasps.html"},{"title":"qbrobotics: qb SoftHand Research","url":"https://qbrobotics.com/product/qb-softhand-research/"}],"as_of":"","related_ids":["dexterous-hand","underactuation","tendon-driven-actuation","motion-retargeting","grasp-taxonomy","data-glove"],"name":"手部协同","alt":"Hand Synergies","abbr":"","aliases":["姿态协同","Postural Synergies","Eigengrasps","本征抓取","手部协同效应"],"one_liner":"人手众多关节常按少数固定组合一起动，可用几个协同参数描述手型。","explanation":"手部协同的说法来自神经科学：Santello、Flanders 和 Soechting 1998 年让受试者想象抓握 57 种常见物体，测量手指和拇指的 15 个关节角，做主成分分析（PCA）后发现前两个主成分就解释了超过 80% 的方差。也就是说，人手自由度虽多，抓握姿态大多落在一个低维子空间里，高阶成分只负责细调。机器人借用了这个思路：GraspIt! 仿真器的 eigengrasp（本征抓取）用几个协同幅值代替全部关节角来搜索抓取；硬件上有按「自适应协同」设计的 Pisa/IIT SoftHand（Catalano 等，2014），同类产品 qb SoftHand Research 只用一个电机驱动 19 个仿人自由度。学灵巧操作时，协同也可用来压缩动作空间。","example":"qb SoftHand 只有一个电机，控制量只有「握紧多少」这一个数，五指按腱绳设计好的比例一起合拢，就能抓起不同形状的物体。","related":["灵巧手","欠驱动","腱绳驱动","动作重定向","抓握分类（强力抓握 / 精细捏取）","数据手套"]},{"id":"finger-gaiting","category":"mechanics","sec":7,"tier":3,"sources":[{"title":"Khandate, Haas-Heger, Ciocarlie: On the Feasibility of Learning Finger-gaiting In-hand Manipulation with Intrinsic Sensing (ICRA 2022)","url":"https://arxiv.org/abs/2109.12720"}],"as_of":"","related_ids":["in-hand-manipulation","dexterous-manipulation","dexterous-hand","force-closure","dactyl","tactile-sensor"],"name":"指步态","alt":"Finger Gaiting","abbr":"","aliases":["Finger Gait","Grasp Gait","手指交替换位"],"one_liner":"手指轮流松开换位、其余手指保持抓牢，从而在手里大角度转动物体。","explanation":"指步态是一种手内操作方式：多指手握住物体时，每次只让一根或几根手指离开物体、挪到新位置重新接触，其余手指继续维持抓取，像腿足轮流迈步一样交替进行。不松手的手内操作受手指关节活动范围限制，物体只能转小角度；指步态靠不断断开和重建接触，理论上能让物体转任意大的角度。1990 年代 Leveroni 与 Salisbury、Han 与 Trinkle 等做过基于模型的研究，但瞬时接触让模型高度非线性，难以用在真手上。近年多用强化学习：OpenAI 的 Dactyl 工作学出了指步态；哥伦比亚大学 Khandate 等 2021 年只用本体感知和触觉，学到了指尖精确抓取下的指步态。","example":"灵巧手用指尖捏住立方体绕竖直轴连续转好几圈：三指捏稳时第四指抬起、挪到新位置落下，再换另一根手指抬起，循环往复，物体就能一直转下去。","related":["手内操作","灵巧操作","灵巧手","力封闭","Dactyl（OpenAI 魔方灵巧手）","触觉传感器"]},{"id":"support-polygon","category":"mechanics","sec":8,"tier":2,"sources":[{"title":"Support polygon - Wikipedia","url":"https://en.wikipedia.org/wiki/Support_polygon"},{"title":"Underactuated Robotics (Tedrake), Ch. Simple Models of Walking: CoP and ZMP","url":"https://underactuated.mit.edu/humanoids.html"}],"as_of":"","related_ids":["static-stability","zero-moment-point","center-of-pressure","center-of-mass","double-support-phase","trot-gait"],"name":"支撑多边形","alt":"Support Polygon","abbr":"","aliases":["支撑域","支撑区域","支撑三角形","Support Region","Base of Support"],"one_liner":"机器人所有触地点在地面上围成的凸区域，各种平衡判据都以它为边界。","explanation":"支撑多边形是机器人与地面所有接触点在水平面上围成的凸区域：人形单脚站立时约等于一只脚掌，双脚着地时是两只脚连起来的外轮廓，四足三条腿着地时是一个三角形，所以也叫支撑三角形。它是平衡判据的边界：静态稳定要求质心投影落在其内；动态行走要求压力中心（地面反力合力的作用点）即零力矩点落在其内，因为压力中心在几何上不可能跑出接触区域。支撑多边形越大，允许的质心加速度范围越大，这也是四足慢走要保持三足着地、人形要做足够大脚掌的原因。","example":"四足机器人小跑（trot）时只有对角两条腿着地，支撑多边形退化成一条线段，质心投影几乎不可能恰好落在线上，所以小跑不是静态稳定的，要靠不停调整步伐来维持平衡。","related":["静态稳定","零力矩点","压力中心","质心","双支撑期","对角小跑步态"]},{"id":"static-stability","category":"mechanics","sec":8,"tier":2,"sources":[{"title":"Legged robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Legged_robot"},{"title":"Support polygon - Wikipedia","url":"https://en.wikipedia.org/wiki/Support_polygon"}],"as_of":"","related_ids":["support-polygon","dynamic-stability","center-of-mass","zero-moment-point","quasi-static-assumption","quadruped-robot"],"name":"静态稳定","alt":"Static Stability","abbr":"","aliases":["静态平衡","静稳定","静态稳定性","Statically Stable"],"one_liner":"质心的竖直投影落在支撑多边形内，机器人停在当前姿态也不会倒。","explanation":"静态稳定指机器人在速度、加速度都接近零时靠自身支撑就能保持平衡。判据很简单：把质心（整体重心）竖直投影到地面，这个点要落在支撑多边形（所有触地点围成的凸区域）里面。投影离边界越远越稳，这段最短距离常叫稳定裕度。它的好处是随时能停下，不依赖控制器实时纠正，所以早期多足机器人和慢速步行的人形都按它设计，比如四足慢走时每次只抬一条腿，始终留三条腿撑成三角形。代价是走不快：要快走或奔跑，就得允许质心暂时越出支撑区域，改用零力矩点、捕获点这类动态稳定判据。","example":"六足机器人走三角步态时，每次抬起三条腿，另外三条腿撑成一个三角形，只要质心投影一直落在这个三角形里，任何时刻让它停住都不会倒。","related":["支撑多边形","动态稳定","质心","零力矩点","准静态假设","四足机器人"]},{"id":"dynamic-stability","category":"mechanics","sec":8,"tier":2,"sources":[{"title":"Legged robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Legged_robot"},{"title":"Zero moment point - Wikipedia","url":"https://en.wikipedia.org/wiki/Zero_moment_point"},{"title":"Underactuated Robotics (MIT) - Humanoid Robots","url":"https://underactuated.csail.mit.edu/humanoids.html"}],"as_of":"","related_ids":["static-stability","support-polygon","zero-moment-point","capture-point","inverted-pendulum-model","balance-control"],"name":"动态稳定","alt":"Dynamic Stability","abbr":"","aliases":["动态平衡","Dynamic Balance"],"one_liner":"重心可暂时越出支撑范围，靠持续运动和下一步落脚把平衡找回来。","explanation":"足式机器人的「稳」有两种。静态稳定要求重心在地面的投影始终落在支撑多边形（各着地脚围成的凸区域）内，任何时刻停下都不会倒，比如六足机器人三条腿轮流支撑慢慢爬。动态稳定放宽了这一要求：重心可以短时间跑出支撑区，只要能通过下一步落脚、调整地面力让运动不发散到摔倒即可，人走路和跑步都属于这种。1980 年代 Raibert 的单腿跳跃机器人证明，只靠不停跳跃也能站稳。衡量动态稳定常用零力矩点（ZMP，脚底反力不产生水平力矩的点，须留在支撑区内）、捕获点（能让机器人停下来的落脚位置）等；如今人形机器人的强化学习运控则直接在仿真中学会动态平衡。","example":"人形机器人快走时，单脚支撑阶段重心已经前倾到支撑脚之外，靠下一步及时落地接住身体，这是动态稳定；如果每步都先把重心挪到支撑脚正上方再迈腿，就是静态稳定走法，会慢很多。","related":["静态稳定","支撑多边形","零力矩点","捕获点","倒立摆模型","平衡控制"]},{"id":"ground-reaction-force","category":"mechanics","sec":8,"tier":2,"sources":[{"title":"Ground reaction force - Wikipedia","url":"https://en.wikipedia.org/wiki/Ground_reaction_force"},{"title":"Inverse dynamics - Wikipedia","url":"https://en.wikipedia.org/wiki/Inverse_dynamics"}],"as_of":"","related_ids":["contact-force","friction-cone","zero-moment-point","center-of-pressure","foot-force-sensor","centroidal-dynamics"],"name":"地面反作用力","alt":"Ground Reaction Force","abbr":"GRF","aliases":["地面反力","足底力","地面支反力"],"one_liner":"地面反推在脚或足端上的力，腿足机器人站立、行走、跳跃都靠它。","explanation":"地面反作用力是地面作用在与它接触的物体上的力。按牛顿第三定律，脚踩地面多大力，地面就反推回多大力。它分两部分：垂直分量是支撑力（法向力），水平分量是摩擦力，走路向前蹬、转弯侧推都靠水平分量。生物力学用测力台测它，再结合动捕数据反推人体关节力矩。对腿足机器人来说，除重力外，能让身体质心加速的外力主要就是 GRF，而机器人只能通过关节力矩间接调节它。所以很多四足、人形控制器（如 MPC、全身控制）直接把每只脚的 GRF 当优化变量，并要求它落在摩擦锥内，即水平力不超过摩擦系数乘以垂直力，否则脚会打滑。","example":"体重 60 kg 的人双脚静止站立时，两脚所受垂直地面反作用力之和约等于体重，即 60×9.8≈588 N；跑步蹬地的瞬间，这个力会超过体重。","related":["接触力","摩擦锥","零力矩点","压力中心","足底力传感器","质心动力学"]},{"id":"center-of-pressure","category":"mechanics","sec":8,"tier":2,"sources":[{"title":"Center of pressure (terrestrial locomotion) - Wikipedia","url":"https://en.wikipedia.org/wiki/Center_of_pressure_(terrestrial_locomotion)"},{"title":"Zero-tilting moment point - Stéphane Caron","url":"https://scaron.info/robotics/zero-tilting-moment-point.html"}],"as_of":"","related_ids":["zero-moment-point","support-polygon","ground-reaction-force","foot-force-sensor","center-of-mass","balance-control"],"name":"压力中心","alt":"Center of Pressure","abbr":"CoP","aliases":["足底压力中心","压心","COP"],"one_liner":"地面对脚底所有支撑力合成后的作用点，常用来判断是否站得稳。","explanation":"脚踩在地上时，脚底各处都受到地面的支撑力，压力中心就是把这些分布力合成为一个地面反作用力后所在的作用点。生物力学里用测力台测量它：人站立时它随身体微微晃动，走路时从脚跟移到脚尖。按定义它只能落在支撑多边形（所有着地点围成的凸区域）以内，移到边缘就意味着脚掌即将绕边缘翘起。它和零力矩点（ZMP）来源不同：CoP 由接触力算出，ZMP 由整机运动的加速度推算；但只有一个接触面或在平地行走时二者是同一点，所以传统人形步行控制常以「ZMP/CoP 保持在支撑多边形内」作为稳定判据，并用脚底的六维力传感器实时测 CoP。","example":"人站立时身体前倾，压力中心会从脚掌中部移向前脚掌；前倾太多它到达脚尖边缘后无法再前移，此时只能迈一步，否则就会向前摔倒。","related":["零力矩点","支撑多边形","地面反作用力","足底力传感器","质心","平衡控制"]},{"id":"zero-moment-point","category":"mechanics","sec":8,"tier":2,"sources":[{"title":"Zero moment point - Wikipedia","url":"https://en.wikipedia.org/wiki/Zero_moment_point"},{"title":"Underactuated Robotics (Tedrake), Ch. Simple Models of Walking: CoP and ZMP","url":"https://underactuated.mit.edu/humanoids.html"}],"as_of":"","related_ids":["center-of-pressure","support-polygon","linear-inverted-pendulum-model","zmp-preview-control","capture-point","bipedal-locomotion"],"name":"零力矩点","alt":"Zero Moment Point","abbr":"ZMP","aliases":["零力矩点判据","ZMP 判据","零矩点"],"one_liner":"地面反力在水平方向不产生力矩的那个点，双足行走最经典的平衡判据。","explanation":"零力矩点由 Miomir Vukobratović 和 Davor Juričić 于 1968 年提出，指地面反力在该点不产生水平方向力矩的位置，在平地上就是压力中心（地面反力合力的作用点）。压力中心只能落在支撑多边形内，所以 ZMP 判据要求规划出的 ZMP 始终留在脚底支撑区域里，否则机器人会绕脚掌边缘翻倒。质心高度不变时有 p = x − (z/g)ẍ：p 是 ZMP 水平位置，x、z 是质心水平位置和高度，ẍ 是质心水平加速度，g 是重力加速度。据此可以先定落脚点和 ZMP 轨迹，再反推质心轨迹，本田 ASIMO 等上一代人形就是这样走路的；如今的强化学习运控一般不显式计算 ZMP。","example":"机器人静止站立时 ẍ = 0，ZMP 就在质心的竖直投影上；想向前加速时，ZMP 会移向脚后跟，加速越猛移得越远，一旦越过脚后跟边缘，脚尖就会翘起、整个机器人向后翻。","related":["压力中心","支撑多边形","线性倒立摆模型","ZMP 预观控制","捕获点","双足行走"]},{"id":"point-foot-vs-flat-foot","category":"mechanics","sec":8,"tier":3,"sources":[{"title":"LimX Dynamics TRON 1 产品页（Point-Foot / Sole / Wheeled 足端）","url":"https://www.limxdynamics.com/en/products/tron1"},{"title":"Assessing Whole-Body Operational Space Control in a Point-Foot Series Elastic Biped (arXiv 1501.02855)","url":"https://arxiv.org/abs/1501.02855"},{"title":"Wikipedia: Support polygon","url":"https://en.wikipedia.org/wiki/Support_polygon"}],"as_of":"","related_ids":["zero-moment-point","center-of-pressure","support-polygon","underactuation","limx-dynamics-tron-1","parallel-ankle-mechanism"],"name":"点足 / 平足（足端形态）","alt":"Point Foot vs. Flat Foot (Sole)","abbr":"","aliases":["点接触足","平底足","Point-Foot","Sole Foot"],"one_liner":"足端和地面是点接触还是脚掌面接触，决定能否靠踝力矩保持平衡。","explanation":"足端形态指腿式机器人脚底和地面怎么接触。点足是一个小球或橡胶头，接触近似一个点，脚踝无法借地面产生力矩，压力中心就固定在接触点上，因此点足双足机器人是欠驱动的（可控的量少于要控制的自由度），不能静止站立，要靠不停踏步、调整落脚点来平衡；四足机器人的脚端大多也是点足，但多条腿同时着地仍能站稳。平足带一块脚掌，压力中心可以在脚底范围内移动，脚踝能施加力矩，支撑多边形更大，可以静止站立，也能用零力矩点（ZMP）方法规划步态；代价是脚踝要多装电机，腿末端更重。逐际动力 TRON 1 的足端可在点足、平足和轮足之间快拆切换，官方称点足是最简单、最易控制的腿式形态。","example":"2015 年论文里的点足双足机器人 Hume 要靠实时选择落脚点、持续踏步才能保持平衡；宇树 G1 这类平足人形则可以双脚并拢站着不动。","related":["零力矩点","压力中心","支撑多边形","欠驱动","逐际动力 TRON 1","并联踝关节"]},{"id":"inverted-pendulum-model","category":"mechanics","sec":8,"tier":2,"sources":[{"title":"Inverted pendulum - Wikipedia","url":"https://en.wikipedia.org/wiki/Inverted_pendulum"},{"title":"The 3D linear inverted pendulum mode: a simple modeling for a biped walking pattern generation (Kajita et al., IROS 2001)","url":"https://doi.org/10.1109/IROS.2001.973365"}],"as_of":"","related_ids":["linear-inverted-pendulum-model","zero-moment-point","capture-point","center-of-mass","spring-loaded-inverted-pendulum","balance-control"],"name":"倒立摆模型","alt":"Inverted Pendulum Model","abbr":"IPM","aliases":["倒立摆","Inverted Pendulum","小车倒立摆","Cart-Pole"],"one_liner":"把机器人简化成支在地上的一根杆顶着一个质点，用来分析和控制平衡。","explanation":"倒立摆是质心在支点上方的摆，处于不稳定平衡，稍受扰动就会倒，必须主动控制，把支点挪回质心下方才能保持直立。人站立时近似一个以脚为支点的倒立摆，Segway 平衡车也是同一原理。双足和人形机器人研究中，常把全身质量集中到质心处的一个点，把腿看成无质量的杆，就得到倒立摆模型，用很少的方程描述身体往哪倒、脚该落在哪。2001 年 Kajita 等人再假设质心高度 z_c 不变，得到线性倒立摆模型（LIPM）：水平方向满足 ẍ = (g/z_c)·x，x 是质心相对支点的水平位移，g 是重力加速度。方程变成线性后便于实时规划步态，ZMP 预观控制、捕获点等方法都建立在它之上。","example":"强化学习入门常用的 CartPole 环境就是小车倒立摆：智能体只能向左或向右推小车，目标是让杆一直竖着不倒。","related":["线性倒立摆模型","零力矩点","捕获点","质心","弹簧负载倒立摆","平衡控制"]},{"id":"linear-inverted-pendulum-model","category":"mechanics","sec":8,"tier":2,"sources":[{"title":"Kajita et al., The 3D Linear Inverted Pendulum Mode: A Simple Modeling for a Biped Walking Pattern Generation (IROS 2001)","url":"https://doi.org/10.1109/IROS.2001.973365"},{"title":"Kajita & Tani, Study of Dynamic Biped Locomotion on Rugged Terrain: Derivation and Application of the Linear Inverted Pendulum Mode (ICRA 1991)","url":"https://doi.org/10.1109/ROBOT.1991.131811"},{"title":"Underactuated Robotics (MIT, Tedrake): Simple Models of Walking and Running / Humanoids","url":"https://underactuated.mit.edu/humanoids.html"}],"as_of":"","related_ids":["inverted-pendulum-model","zero-moment-point","capture-point","cart-table-model","zmp-preview-control","center-of-mass"],"name":"线性倒立摆模型","alt":"Linear Inverted Pendulum Model","abbr":"LIPM","aliases":["线性倒立摆","线性倒立摆模式","Linear Inverted Pendulum Mode","LIP","3D-LIPM","三维线性倒立摆"],"one_liner":"把双足机器人简化成质心高度不变的倒立摆，用来快速规划行走。","explanation":"线性倒立摆模型是双足行走最常用的简化模型，由梶田秀司（Shuuji Kajita）等人提出：1991 年在 ICRA 发表平面版本，2001 年在 IROS 发表三维版本 3D-LIPM。它把机器人看成集中在质心的一个质点加一根无质量的腿，并假设质心高度不变，原本非线性的倒立摆方程就变成线性的 ẍ = (g/z_c)(x − p)。x 是质心水平位置，p 是支撑点（压力中心，即 ZMP）位置，g 是重力加速度，z_c 是质心高度。线性方程有解析解、算得快，适合实时生成步态和做 ZMP 预观控制，捕获点也由它推出。代价是忽略了腿的质量和上身转动。","example":"质心高度 z_c = 0.8 m 时，g/z_c ≈ 12.3 s⁻²；质心若在支撑点前方 5 cm，水平加速度约 0.6 m/s²，并且越倒越快，机器人必须及时迈出下一步，把支撑点挪到前面。","related":["倒立摆模型","零力矩点","捕获点","小车-桌子模型","ZMP 预观控制","质心"]},{"id":"cart-table-model","category":"mechanics","sec":8,"tier":3,"sources":[{"title":"Kajita et al.: Biped walking pattern generation by using preview control of zero-moment point (ICRA 2003)","url":"https://doi.org/10.1109/robot.2003.1241826"},{"title":"Stéphane Caron: Linear inverted pendulum model","url":"https://scaron.info/robotics/linear-inverted-pendulum-model.html"}],"as_of":"","related_ids":["zero-moment-point","linear-inverted-pendulum-model","zmp-preview-control","bipedal-locomotion","support-polygon","center-of-mass"],"name":"小车-桌子模型","alt":"Cart-Table Model","abbr":"","aliases":["桌子-小车模型","桌上小车模型","Cart-on-a-Table Model"],"one_liner":"把双足机器人看成桌面上跑的小车，用来联系质心运动和零力矩点","explanation":"梶田秀司（Shuuji Kajita）等人 2003 年在 ICRA 论文中提出，用于零力矩点预观控制的步行模式生成。模型把机器人质量集中成一辆在水平桌面上跑的小车，桌子没有质量、只有一条细腿，桌腿底面相当于脚掌。零力矩点（地面反力产生的水平力矩为零的点）满足 p = x − (z_c/g)·ẍ：x 是小车即质心的水平位置，z_c 是质心高度，g 是重力加速度，ẍ 是水平加速度。小车加速太猛，零力矩点跑出桌腿底面，桌子就会翻。它和线性倒立摆是同一组方程，但写成「给定零力矩点参考求质心轨迹」，便于用预观控制利用未来的参考值。","example":"Kajita 等人在论文中用「小车-桌子模型 + 预观控制」生成步行轨迹，并用多体模型补偿简化带来的零力矩点误差，在仿真里让双足机器人走上了螺旋楼梯。","related":["零力矩点","线性倒立摆模型","ZMP 预观控制","双足行走","支撑多边形","质心"]},{"id":"capture-point","category":"mechanics","sec":8,"tier":3,"sources":[{"title":"Pratt et al.: Capture Point: A Step toward Humanoid Push Recovery (Humanoids 2006)","url":"https://doi.org/10.1109/ichr.2006.321385"},{"title":"Stéphane Caron: Capture point","url":"https://scaron.info/robotics/capture-point.html"}],"as_of":"","related_ids":["linear-inverted-pendulum-model","divergent-component-of-motion","zero-moment-point","push-recovery","support-polygon","centroidal-moment-pivot"],"name":"捕获点","alt":"Capture Point","abbr":"CP","aliases":["瞬时捕获点","捕捉点","Instantaneous Capture Point","ICP"],"one_liner":"机器人此刻一步踩到那里就能完全停住的地面点","explanation":"由 Pratt、Carff、Drakunov、Goswami 在 2006 年 Humanoids 会议论文中提出，回答被推时「往哪儿迈一步才能停下」。在线性倒立摆模型（把机器人看成质心高度不变、支在一点上的质点）里，捕获点 ξ = x + ẋ/ω：x 是质心水平位置，ẋ 是质心水平速度，ω = √(g/h)，g 是重力加速度，h 是质心高度。它正是这个模型里会发散的那部分运动：把零力矩点放在捕获点上，质心会逐渐停下；捕获点落在脚掌以外，就必须迈步。后续工作把它发展成双足行走控制方法和「可捕获性」分析框架。","example":"设质心高 0.9 m，则 ω ≈ 3.3 /s；被推后质心以 0.5 m/s 向前运动，捕获点约在质心地面投影前方 0.15 m。若这个点已超出支撑脚掌，机器人就要往前迈一步，把脚落在捕获点附近。","related":["线性倒立摆模型","发散运动分量","零力矩点","推恢复","支撑多边形","质心力矩枢轴点"]},{"id":"divergent-component-of-motion","category":"mechanics","sec":8,"tier":3,"sources":[{"title":"Takenaka et al., Real time motion generation and control for biped robot – 1st report (IROS 2009)","url":"https://doi.org/10.1109/IROS.2009.5354662"},{"title":"Englsberger, Ott, Albu-Schäffer: Three-Dimensional Bipedal Walking Control Based on Divergent Component of Motion (IEEE T-RO 2015)","url":"https://doi.org/10.1109/TRO.2015.2405592"},{"title":"Stéphane Caron: Capture point","url":"https://scaron.info/robotics/capture-point.html"}],"as_of":"","related_ids":["capture-point","linear-inverted-pendulum-model","zero-moment-point","centroidal-moment-pivot","bipedal-locomotion","balance-control"],"name":"发散运动分量","alt":"Divergent Component of Motion","abbr":"DCM","aliases":["Capture Point","捕获点（与之等价）","发散分量"],"one_liner":"双足质心运动中会指数发散的那部分，控住它就能保持平衡。","explanation":"发散运动分量是双足行走控制的状态量：ξ = x + ẋ/ω，x 是质心位置，ẋ 是质心速度，ω = √(g/z₀)，g 是重力加速度，z₀ 是质心高度。本田 Takenaka 等人在 2009 年的实时步态生成工作中提出这一名称。在线性倒立摆模型（把机器人简化成质心高度不变的倒立摆）里，运动可拆成两部分：质心会自动收敛到 ξ，而 ξ 会以指数速度远离零力矩点（脚底合力作用点）。所以只需规划和控制 ξ，质心自然跟上。它与 Pratt 等人 2006 年提出的捕获点是同一个点。德国宇航中心 Englsberger 等人 2013–2015 年把它推广到三维，并引入 eCMP、VRP 两个辅助点。","example":"质心高 0.8 m 时 ω = √(9.8/0.8) ≈ 3.5 s⁻¹；质心在支撑点正上方以 0.35 m/s 前进，ξ 在前方 0.35/3.5 = 0.1 m 处。若脚掌前缘够不到那里，就必须迈步。","related":["捕获点","线性倒立摆模型","零力矩点","质心力矩枢轴点","双足行走","平衡控制"]},{"id":"centroidal-moment-pivot","category":"mechanics","sec":8,"tier":3,"sources":[{"title":"Popovic, Goswami, Herr: Ground Reference Points in Legged Locomotion（IntechOpen 开放获取版）","url":"https://www.intechopen.com/chapters/50"},{"title":"Popovic, Goswami, Herr: Ground Reference Points in Legged Locomotion (IJRR, 2005)","url":"https://doi.org/10.1177/0278364905058363"}],"as_of":"","related_ids":["zero-moment-point","center-of-pressure","angular-momentum","capture-point","centroidal-dynamics","push-recovery"],"name":"质心力矩枢轴点","alt":"Centroidal Moment Pivot","abbr":"CMP","aliases":["质心力矩支点"],"one_liner":"过质心作地面反作用力的平行线，与地面的交点","explanation":"由 Herr、Hofmann、Popovic 等人在 2003–2004 年提出（Goswami 等人独立提出过同一个点），2005 年的 IJRR 论文统一了定义：过质心作一条平行于地面反作用力的直线，它与地面的交点就是 CMP。若地面反作用力正好穿过质心（绕质心力矩为零），CMP 与零力矩点重合；两者分开，说明身体绕质心受到力矩、整体角动量在变，分开的距离等于该力矩的水平分量除以地面反力的竖直分量。零力矩点不能离开支撑区域，CMP 可以，所以它常用来描述挥臂、转体这类靠角动量保持平衡的策略。","example":"Popovic 等人测量人在平地上正常行走，发现 CMP 始终没有离开支撑区域，与零力矩点的平均距离只有脚长的 14% 左右，说明人走路时会把绕质心的角动量控制得很小。","related":["零力矩点","压力中心","角动量","捕获点","质心动力学","推恢复"]},{"id":"centroidal-dynamics","category":"mechanics","sec":8,"tier":3,"sources":[{"title":"Orin, Goswami, Lee: Centroidal dynamics of a humanoid robot (Autonomous Robots, 2013)","url":"https://doi.org/10.1007/s10514-013-9341-4"},{"title":"Underactuated Robotics（Tedrake）: Highly-articulated Legged Robots 一章","url":"https://underactuated.mit.edu/humanoids.html"}],"as_of":"","related_ids":["centroidal-momentum-matrix","single-rigid-body-dynamics-model","angular-momentum","whole-body-control","model-predictive-control","contact-force"],"name":"质心动力学","alt":"Centroidal Dynamics","abbr":"","aliases":["质心动量动力学","Centroidal Momentum Dynamics"],"one_liner":"只描述机器人质心和整体动量如何随外力变化的动力学","explanation":"Orin、Goswami 与 Lee 2013 年在《Autonomous Robots》论文中系统整理了这一概念：把所有连杆的动量都换算到整机质心处叠加，得到 6 维的质心动量（3 维线动量加 3 维绕质心的角动量）。它的变化率只由外力决定：线动量的变化等于各接触力之和加重力，角动量的变化等于各接触力对质心的力矩之和。这组方程对整机是精确的，不是近似，只是没把关节力矩上限、腿能伸多远等限制算进去。因为维度低，人形和四足的规划与模型预测控制常先在它上面算接触力和质心轨迹，再交给全身控制器落到每个关节。","example":"规划一次原地起跳：先在质心动力学模型里算出每只脚要蹬出多大的地面反作用力、质心和角动量怎么变化，再由全身控制器把这些目标换算成各关节的力矩。","related":["质心动量矩阵","单刚体动力学模型","角动量","全身控制","模型预测控制","接触力"]},{"id":"centroidal-momentum-matrix","category":"mechanics","sec":8,"tier":3,"sources":[{"title":"Orin & Goswami: Centroidal Momentum Matrix of a humanoid robot: Structure and properties (IROS 2008)","url":"https://doi.org/10.1109/iros.2008.4650772"},{"title":"Underactuated Robotics（Tedrake）: Highly-articulated Legged Robots 一章","url":"https://underactuated.mit.edu/humanoids.html"}],"as_of":"","related_ids":["centroidal-dynamics","angular-momentum","jacobian-matrix","mass-matrix","whole-body-control","floating-base"],"name":"质心动量矩阵","alt":"Centroidal Momentum Matrix","abbr":"CMM","aliases":["A_G 矩阵"],"one_liner":"把全身关节速度映射成质心线动量和角动量的矩阵","explanation":"Orin 与 Goswami 2008 年在 IROS 论文中专门分析了它的结构：机器人的质心动量 h_G（线动量加绕质心的角动量，共 6 维）是广义速度 q̇ 的线性函数，h_G = A_G(q)·q̇，A_G 就是质心动量矩阵，q 是包括浮动基在内的全部广义坐标。它曾被分别叫作雅可比矩阵和惯性矩阵，论文指出它其实是两者的乘积。对 h_G 求导得 ḣ_G = A_G·q̈ + Ȧ_G·q̇，全身控制就能把期望的动量变化写成关节加速度的线性约束，放进二次规划求解。Pinocchio 里用 ccrba 函数计算它。","example":"一台有 30 个关节的人形机器人，加上浮动基的 6 个自由度，q̇ 是 36 维，A_G 就是 6×36 的矩阵；平衡控制时要求 A_G·q̈ + Ȧ_G·q̇ 等于期望的动量变化率，再和其他任务一起交给二次规划求解。","related":["质心动力学","角动量","雅可比矩阵","质量矩阵","全身控制","浮动基"]},{"id":"single-rigid-body-dynamics-model","category":"mechanics","sec":8,"tier":3,"sources":[{"title":"Di Carlo et al., Dynamic Locomotion in the MIT Cheetah 3 Through Convex Model-Predictive Control (IROS 2018)","url":"https://www.semanticscholar.org/paper/608d53fcd69173d30914e29d9b8ca4b37efe9ac4"},{"title":"Lin et al., Learning Near-global-optimal Strategies for Hybrid Non-convex MPC of Single Rigid Body Locomotion (arXiv:2207.07846)","url":"https://arxiv.org/abs/2207.07846"},{"title":"Kim et al., Highly Dynamic Quadruped Locomotion via Whole-Body Impulse Control and Model Predictive Control (arXiv:1909.06586)","url":"https://arxiv.org/abs/1909.06586"}],"as_of":"","related_ids":["convex-mpc","model-predictive-control","centroidal-dynamics","ground-reaction-force","whole-body-control","linear-inverted-pendulum-model"],"name":"单刚体动力学模型","alt":"Single Rigid Body Dynamics Model","abbr":"SRBD","aliases":["单刚体模型","SRB 模型","SRBM","Single Rigid Body Model"],"one_liner":"把腿足机器人整机当成一个刚体、忽略腿部质量的简化动力学模型。","explanation":"单刚体动力学模型是腿足机器人控制里最常用的简化模型之一：假设腿很轻，把整机当成一个有质量和转动惯量的刚体，只受重力和几只脚上的地面反作用力。状态通常取机身的位置、姿态、线速度和角速度（共 12 维），控制量是各脚的接触力。完整模型有几十个关节、方程高度非线性，SRBD 把它压缩成少数几个方程，便于实时优化。代表工作是 MIT 的 Di Carlo 等人 2018 年在 Cheetah 3 上做的凸 MPC：再假设姿态转角较小，把地面反作用力规划写成凸优化，以 20–30 Hz 的频率规划未来最多 0.5 秒，单次求解不到 1 毫秒；算出的力再交给全身控制或关节控制去执行。它比倒立摆模型多考虑了姿态和转动，但不管腿怎么摆。","example":"MIT Cheetah 3 用单刚体凸 MPC 实现了站立、小跑、飞跑、四足齐跳（pronk）、跳跃步态（bound）、踱步、三足步态和三维疾驰，前进速度最高 3 m/s，全部用同一组增益和权重（Di Carlo 等，IROS 2018）。","related":["凸 MPC","模型预测控制","质心动力学","地面反作用力","全身控制","线性倒立摆模型"]},{"id":"stance-phase-swing-phase","category":"mechanics","sec":9,"tier":2,"sources":[{"title":"Wikipedia: Gait (human)","url":"https://en.wikipedia.org/wiki/Gait_(human)"},{"title":"Humanoid-Gym: humanoid_env.py (_get_gait_phase)","url":"https://github.com/roboterax/humanoid-gym/blob/main/humanoid/envs/custom/humanoid_env.py"}],"as_of":"","related_ids":["gait","gait-cycle-and-duty-factor","double-support-phase","flight-phase","gait-planning","swing-foot-trajectory-planning"],"name":"支撑相 / 摆动相","alt":"Stance Phase / Swing Phase","abbr":"","aliases":["支撑期","摆动期","站立相","Stance","Swing"],"one_liner":"步态中脚着地承重的阶段叫支撑相，脚离地前摆的阶段叫摆动相。","explanation":"支撑相和摆动相是描述步态的基本概念，对人和腿足机器人都适用：某条腿的脚与地面接触、承担体重并推动身体前进的阶段叫支撑相；脚离地、向前摆到下一个落脚点的阶段叫摆动相，两者合起来是这条腿的一个步态周期。成年人正常步行约 60% 时间处于支撑相、40% 处于摆动相，两脚同时着地的时段叫双支撑期；跑步时则会出现两脚都离地的腾空相。支撑相占周期的比例叫占空比，四足的对角小跑等不同步态，本质就是各条腿的支撑相怎样错开。控制上两段任务不同：支撑腿要产生地面反作用力、维持平衡且不能打滑，摆动腿要抬脚避障、选落脚点，所以 MPC 和强化学习运控都要知道每条腿当前处于哪一相。","example":"Humanoid-Gym 用一个正弦相位时钟生成每只脚的支撑掩码：正弦值为正时左脚处于支撑相，为负时右脚处于支撑相，接近零时两脚都算支撑（双支撑期）；奖励函数据此要求该着地的脚着地、该摆动的脚离地。","related":["步态","步态周期与占空比","双支撑期","腾空相","接触时序（步态调度器）","足端轨迹规划"]},{"id":"flight-phase","category":"mechanics","sec":9,"tier":2,"sources":[{"title":"Running - Wikipedia","url":"https://en.wikipedia.org/wiki/Running"},{"title":"Legged robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Legged_robot"}],"as_of":"","related_ids":["stance-phase-swing-phase","gait","gait-cycle-and-duty-factor","spring-loaded-inverted-pendulum","bound-gait","gallop-gait"],"name":"腾空相","alt":"Flight Phase (Aerial Phase)","abbr":"","aliases":["腾空期","飞行相","Aerial Phase"],"one_liner":"步态中所有脚同时离地、身体在空中的那一段时间。","explanation":"腿足运动按时间可切成几段：脚着地承重叫支撑相，脚在空中前摆叫摆动相；如果某段时间所有脚都不接触地面，这段就叫腾空相。它是区分走和跑的关键：走路时至少有一只脚始终在地上，跑步则有腾空相。对机器人来说，腾空时只有重力作用，重心沿抛物线飞行，控制器无法借地面力改变整体动量，只能调整腿的姿态为落地做准备，落地瞬间还要承受冲击，所以跑、跳、跑酷比走路难得多。Raibert 的单腿跳跃机器人就把一个周期拆成支撑和腾空分别控制，腾空时摆腿选落脚点；四足的跳跃步态、疾驰步态以及人形机器人奔跑和空翻都包含腾空相。","example":"人形机器人慢跑时，一只脚蹬地离开、另一只脚还没落地的那一小段时间就是腾空相，此时策略只能调整摆腿姿态，为下一次落地做准备。","related":["支撑相 / 摆动相","步态","步态周期与占空比","弹簧负载倒立摆","跳跃步态","疾驰步态"]},{"id":"gait-cycle-and-duty-factor","category":"mechanics","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Gait","url":"https://en.wikipedia.org/wiki/Gait"}],"as_of":"","related_ids":["gait","stance-phase-swing-phase","trot-gait","gait-planning","gait-phase","flight-phase"],"name":"步态周期与占空比","alt":"Gait Cycle and Duty Factor","abbr":"","aliases":["步态周期","步幅周期","占空比","负荷因子","Stride","Duty factor"],"one_liner":"步态周期是腿从着地到下次着地的一整轮，占空比是其中着地时间的占比。","explanation":"步态周期（stride）指同一只脚从一次着地到下一次着地的完整循环，分为支撑相（脚踩地、承重推进）和摆动相（脚抬起向前迈）。占空比（duty factor）β = 支撑时间 ÷ 周期时间。生物力学里常以 0.5 为界：占空比大于 50% 算「走」，任何时刻至少有一只脚着地；小于 50% 算「跑」，会出现腾空。对四足和人形机器人，一个周期性步态可以用三组量描述：周期、每条腿的占空比、各腿之间的相位差，比如对角小跑是两组对角腿相差半个周期。基于模型的控制器用这些量排出每条腿何时着地（步态调度），强化学习运控也常把相位时钟放进观测或奖励里，引导策略踩出想要的节奏。","example":"一条腿每个周期 0.5 s，其中着地 0.3 s，占空比 0.6，大于 0.5，属于走；若着地只有 0.2 s，占空比 0.4，就是跑，会出现腾空。","related":["步态","支撑相 / 摆动相","对角小跑步态","接触时序（步态调度器）","步态相位（相位时钟）","腾空相"]},{"id":"pace-gait","category":"mechanics","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Horse gait (Pace)","url":"https://en.wikipedia.org/wiki/Horse_gait"},{"title":"Walk These Ways: Tuning Robot Control for Generalization with Multiplicity of Behavior (arXiv 2212.03238)","url":"https://arxiv.org/html/2212.03238"}],"as_of":"","related_ids":["trot-gait","bound-gait","gallop-gait","gait-cycle-and-duty-factor","gait-phase","walk-these-ways"],"name":"踱步步态","alt":"Pace Gait","abbr":"","aliases":["同侧步态","Pacing"],"one_liner":"四足同侧前后两腿同时迈、左右两侧轮流支撑的两拍步态。","explanation":"踱步是四足动物的一种两拍步态：左前腿和左后腿一起迈，接着右前腿和右后腿一起迈。它和对角小跑（trot，对角两条腿成对）的区别只在配对方式。马里有专门跑踱步的竞赛品系（Standardbred 中的踱步马），骆驼天生就这样走。对机器人来说，同侧两腿着地时支撑线落在身体一侧，质心不在支撑线上方，躯干容易左右晃，所以四足机器人日常更多用小跑。强化学习运控里常用各腿之间的相位差描述步态：Walk These Ways（2022）用三个时间偏移参数，(0, 0, 0.5) 是踱步，(0.5, 0, 0) 是小跑；他们在随机平台地形上的测试中，踱步的平均存活时间最长。","example":"在 Walk These Ways 的控制器里把步态偏移设为 (0, 0, 0.5)，机器狗会左侧两腿、右侧两腿轮流着地，身体随之左右摆动。","related":["对角小跑步态","跳跃步态","疾驰步态","步态周期与占空比","步态相位（相位时钟）","Walk These Ways"]},{"id":"bound-gait","category":"mechanics","sec":9,"tier":3,"sources":[{"title":"Yang & Bhounsule: Koopman Operator Based Linear MPC for 2D Quadruped Trotting, Bounding, and Gait Transition (arXiv 2507.14605)","url":"https://arxiv.org/abs/2507.14605"},{"title":"Park, Wensing, Kim: High-speed bounding with the MIT Cheetah 2 (IJRR, 2017), MIT DSpace","url":"https://dspace.mit.edu/handle/1721.1/119686"},{"title":"Margolis & Agrawal: Walk These Ways (arXiv 2212.03238)","url":"https://arxiv.org/abs/2212.03238"}],"as_of":"","related_ids":["gait","trot-gait","pace-gait","gallop-gait","flight-phase","quadruped-robot"],"name":"跳跃步态","alt":"Bound Gait","abbr":"","aliases":["跳跑步态","Bounding","Bounding Gait"],"one_liner":"四足两条前腿一起着地、两条后腿一起着地，前后交替的奔跑步态","explanation":"四足动物和四足机器人的一种对称步态。四条腿分成前后两对：两条前腿同时着地、同时抬起，两条后腿也一样，前后两对交替支撑，中间通常夹着全身离地的腾空相，一个周期依次是前腿支撑、腾空、后腿支撑、腾空。它常和对角小跑（对角两条腿成对）、踱步（同侧两条腿成对）、弹跳（四条腿同步）放在一起比较，控制时身体会有明显的俯仰摆动。它适合高速奔跑，MIT Cheetah 2 就用它做过高速实验；强化学习运控里也常把它作为可以用指令切换的步态之一。","example":"MIT Cheetah 2 在 2017 年 IJRR 论文中用跳跃步态在不拴线的三维实验里跑到最高 6.4 m/s；Walk These Ways 策略可以按指令在对角小跑、弹跳、踱步和跳跃步态之间切换。","related":["步态","对角小跑步态","踱步步态","疾驰步态","腾空相","四足机器人"]},{"id":"gallop-gait","category":"mechanics","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Horse gait（Gallop）","url":"https://en.wikipedia.org/wiki/Horse_gait"},{"title":"Wikipedia: Greyhound（double suspension rotary gallop）","url":"https://en.wikipedia.org/wiki/Greyhound"},{"title":"Kim et al. 2019, Highly Dynamic Quadruped Locomotion via Whole-Body Impulse Control and Model Predictive Control","url":"https://arxiv.org/abs/1909.06586"}],"as_of":"","related_ids":["gait","bound-gait","trot-gait","flight-phase","quadruped-robot","mit-mini-cheetah"],"name":"疾驰步态","alt":"Gallop Gait","abbr":"","aliases":["奔跑步态","袭步","Gallop","旋转疾驰","Rotary Gallop"],"one_liner":"四足最快的步态：四只脚依次错开落地，并带有全身腾空的阶段。","explanation":"疾驰（gallop，马术里也叫袭步）是四足动物的高速非对称步态：同一对前腿或后腿不同时落地，而是稍微错开，形成四拍落地节奏，每个周期还有四脚同时离地的腾空期。它是马最快的步态，平均约 40–48 km/h，速度越快腾空期越长；灵缇犬的「双腾空旋转疾驰」在一个周期里有收缩和伸展两次腾空，靠脊柱大幅弯曲加长步幅。它和跳跃步态（bound，两前腿一起、两后腿一起）的区别就在左右腿是否错开。对机器人来说，疾驰腾空时间长、每条腿着地时间短，躯干质心在腾空期无法直接控制，难度高于对角小跑。MIT 的 Mini Cheetah 用 MPC 加全身冲量控制，实测了包括疾驰在内的六种步态。","example":"马以右前腿领先疾驰时，落地顺序为左后→右后→左前→右前，接着四脚同时腾空，再进入下一个周期。","related":["步态","跳跃步态","对角小跑步态","腾空相","四足机器人","MIT Mini Cheetah"]},{"id":"spring-loaded-inverted-pendulum","category":"mechanics","sec":9,"tier":3,"sources":[{"title":"Truax et al., Optimizing Design and Control of Running Robots Abstracted as TD-SLIP (arXiv:2407.12120)","url":"https://arxiv.org/abs/2407.12120"},{"title":"Chen, Wensing, Zhang, Optimal Control of a Differentially Flat 2D Spring-Loaded Inverted Pendulum Model (arXiv:1911.07168)","url":"https://arxiv.org/abs/1911.07168"}],"as_of":"","related_ids":["inverted-pendulum-model","linear-inverted-pendulum-model","bipedal-locomotion","flight-phase","gait","passive-dynamic-walking"],"name":"弹簧负载倒立摆","alt":"Spring-Loaded Inverted Pendulum","abbr":"SLIP","aliases":["弹簧倒立摆","弹簧-质量模型","Spring-Mass Model","SLIP 模型"],"one_liner":"用一个质点加一根无质量弹簧腿来描述跑和跳的简化模型。","explanation":"弹簧负载倒立摆是描述跑步、跳跃的经典简化模型：身体缩成一个质点，腿是一根没有质量的弹簧。着地的支撑相里，弹簧先被压缩储能、再伸长把身体弹起；离地的腾空相里，质点只受重力做抛体运动，两相交替。生物力学研究（如 Blickhan 与 Full 1993 年的工作）发现，从昆虫到人类，多种动物奔跑时的质心运动都能用它描述。它和普通倒立摆的区别在于腿长可变、能储存和释放弹性能，所以能表现带腾空的跑跳，而线性倒立摆更适合描述步行。在机器人里，SLIP 常被当作「模板」：先在这个低维模型上规划着地角、腿刚度等参数，再映射到真实机器人；RHex 等腿足机器人的设计就参考了 SLIP 动力学。","example":"人跑步时，脚着地后膝踝弯曲、重心下沉（相当于弹簧被压缩），随后蹬伸把身体送进腾空；SLIP 只用质量、腿长、弹簧刚度和着地角几个参数，就能复现这种一沉一起的重心轨迹。","related":["倒立摆模型","线性倒立摆模型","双足行走","腾空相","步态","被动动力学行走"]},{"id":"straight-knee-walking","category":"mechanics","sec":9,"tier":3,"sources":[{"title":"Griffin et al., Straight-Leg Walking Through Underconstrained Whole-Body Control (arXiv:1709.03660)","url":"https://arxiv.org/abs/1709.03660"},{"title":"Fasano et al., Efficient, Dynamic Locomotion through Step Placement with Straight Legs and Rolling Contacts (arXiv:2310.13134)","url":"https://arxiv.org/abs/2310.13134"}],"as_of":"","related_ids":["bipedal-locomotion","linear-inverted-pendulum-model","singular-configuration","zero-moment-point","whole-body-control","human-like-gait"],"name":"直膝行走","alt":"Straight-Knee Walking (vs. Bent-Knee / Crouched Gait)","abbr":"","aliases":["直腿行走","Straight-Leg Walking","伸膝步态"],"one_liner":"人形机器人支撑腿接近伸直地走路，而不是一直弯着膝盖「蹲着走」。","explanation":"直膝行走指双足机器人在支撑阶段让膝关节接近伸直，配合脚跟着地、脚尖蹬离，更像人走路；与之相对的是许多人形机器人常见的屈膝步态，全程半蹲着走。机器人为什么习惯屈膝，IHMC 的 Griffin 等人 2017 年的论文总结了三点：常用的线性倒立摆模型假设质心高度不变，腿得弯着才能吸收高度变化；腿伸直后膝关节几乎无法再调节地面反作用力；腿完全伸直正好是奇异位形，雅可比矩阵掉秩，基于逆运动学或逆动力学的控制器会出问题。屈膝的代价是膝关节长期承受大力矩、耗电多，离地间隙也更小。实现直膝行走需要控制器允许质心高度起伏并处理好奇异点，IHMC 先后在 Atlas 和 Nadia 两台人形机器人上做过验证。","example":"看人形机器人走路视频时，如果膝盖一直弯着、身体高度几乎不变，是典型的屈膝步态；如果支撑腿接近伸直、躯干每一步有轻微起伏、脚跟先着地再滚到脚尖，就接近直膝行走。","related":["双足行走","线性倒立摆模型","奇异位形","零力矩点","全身控制","拟人步态（直膝行走 / 足跟-足尖行走）"]},{"id":"passive-dynamic-walking","category":"mechanics","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Passive dynamics（含 McGeer 1990 与 Collins et al. 2005 Science 引用）","url":"https://en.wikipedia.org/wiki/Passive_dynamics"}],"as_of":"","related_ids":["bipedal-locomotion","limit-cycle","cost-of-transport","morphological-computation","inverted-pendulum-model","honda-asimo"],"name":"被动动力学行走","alt":"Passive Dynamic Walking","abbr":"","aliases":["被动行走","被动步行","Passive Dynamic Walker"],"one_liner":"不用电机，只靠重力和腿的自然摆动沿缓坡走下去的双足行走方式。","explanation":"被动动力学行走由 Tad McGeer 在 1980 年代末提出，代表论文是 1990 年发表在 IJRR 的《Passive Dynamic Walking》：一个没有电机和控制器的双腿机构放在缓坡上，靠重力提供能量、靠腿像钟摆一样自然摆动，就能走出稳定的周期步态，每步损失的能量正好由下坡补回，步态收敛到一个极限环（稳定的周期运动）。它说明行走的稳定性很大一部分来自机构本身的动力学，不必每个关节都精确控制。2005 年 Collins 等人在 Science 上展示了在它基础上只加少量驱动、能在平地行走的机器人，单位运输成本约 0.2，与人接近，而 ASIMO 约 3.2。它是理解低能耗步态、极限环稳定性和形态计算的经典例子。","example":"McGeer 式被动行走机：两条带膝盖的腿、没有任何电机，放在很缓的斜坡上轻推一下，就能自己一步一步走到坡底。","related":["双足行走","极限环","运输成本","形态计算","倒立摆模型","本田 ASIMO"]},{"id":"limit-cycle","category":"mechanics","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Limit cycle","url":"https://en.wikipedia.org/wiki/Limit_cycle"},{"title":"Tedrake, Underactuated Robotics: Simple Models of Walking and Running","url":"https://underactuated.mit.edu/simple_legs.html"}],"as_of":"","related_ids":["passive-dynamic-walking","gait","central-pattern-generator","hybrid-zero-dynamics","lyapunov-stability","gait-phase"],"name":"极限环","alt":"Limit Cycle","abbr":"","aliases":["稳定周期轨道","吸引性周期轨道"],"one_liner":"非线性系统里一条孤立的闭合周期轨迹，附近的状态会被吸引过去并绕它循环。","explanation":"极限环是非线性动力学的概念，系统研究始于庞加莱：在状态空间（如角度-角速度平面）里，它是一条闭合的周期轨迹，附近的轨迹随时间螺旋靠近它（稳定极限环）或远离它（不稳定极限环）。稳定极限环意味着系统会自发维持固定节奏的振荡，受扰后还会回到原节奏，经典例子是 Van der Pol 振荡器。步行机器人研究把一个稳定的周期步态看成稳定极限环：McGeer 的被动动力学行走机器人没有电机，靠重力就能沿斜坡稳定行走。分析时取每次脚落地时刻的状态构成庞加莱映射（回归映射），把「步态稳不稳」转化为这个离散映射的不动点稳不稳。","example":"无动力的「无辐轮」（只有一圈辐条、没有轮圈的轮子）放在斜坡上，在相当大范围的初速度下都会很快收敛到同一个稳定的滚动节奏，这就是一个稳定极限环（Tedrake《Underactuated Robotics》中的经典例子）。","related":["被动动力学行走","步态","中枢模式发生器","混合零动态","李雅普诺夫稳定性","步态相位（相位时钟）"]},{"id":"cost-of-transport","category":"mechanics","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Cost of transport","url":"https://en.wikipedia.org/wiki/Cost_of_transport"},{"title":"Wikipedia: Passive dynamics（Cornell biped 0.20、ASIMO 3.23）","url":"https://en.wikipedia.org/wiki/Passive_dynamics"}],"as_of":"","related_ids":["passive-dynamic-walking","bipedal-locomotion","legged-locomotion","gait","battery-runtime"],"name":"运输成本","alt":"Cost of Transport","abbr":"CoT","aliases":["运输代价","能耗比","比运输成本","Specific Cost of Transport","比阻力","Specific Resistance"],"one_liner":"单位重量移动单位距离消耗的能量，衡量走路跑步有多省能。","explanation":"运输成本是无量纲的移动能效指标：CoT = E/(mgd) = P/(mgv)，E 是消耗的能量，m 是质量，g 是重力加速度，d 是移动距离，P 是功率，v 是速度。数值越小越省能；因为除掉了体重和距离，可以在动物、车辆和机器人之间横向比较。Collins、Ruina、Tedrake、Wisse 2005 年在《Science》上报告，基于被动动力学行走设计的 Cornell 双足机器人比运输成本约 0.2，与人步行相当，而本田 ASIMO 约 3.2。对腿足和人形机器人，它直接关系续航。比较数值时要看清 E 算的是电机机械功、电池总电能还是人体代谢能，口径不同差别很大。","example":"维基百科的例子：70 kg 的人以 1 m/s 步行，代谢功率约 231 W，CoT ≈ 231 /(70×9.8×1) ≈ 0.34。","related":["被动动力学行走","双足行走","腿足运动","步态","续航"]},{"id":"locomotion-control","category":"control","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Motion control","url":"https://en.wikipedia.org/wiki/Motion_control"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv:2109.11978)","url":"https://arxiv.org/abs/2109.11978"},{"title":"qiayuanl/legged_control（NMPC + WBC 足式运控框架）","url":"https://github.com/qiayuanl/legged_control"}],"as_of":"","related_ids":["rl-based-locomotion-control","whole-body-control","model-predictive-control","balance-control","robot-cerebellum","motion-planning"],"name":"运动控制","alt":"Motion Control / Locomotion Control","abbr":"","aliases":["运控","运动控制算法","运控算法"],"one_liner":"让机器人按期望稳定地动起来的控制技术，具身圈常特指腿足行走与平衡。","explanation":"运动控制原是自动化领域的通用概念，指让机器部件按要求运动，控制对象是位置、速度或力，由控制器、驱动器、电机和编码器组成闭环。在具身智能和人形机器人语境里，「运控」多特指腿足机器人的行走、奔跑、平衡、摔倒起身等全身运动能力，是「小脑」的核心。主要有两条路线：基于模型的方法，用简化动力学模型加模型预测控制和全身控制实时求解；基于学习的方法，在 GPU 并行仿真里用强化学习训练策略，再迁移到真机。近年后者在四足和人形上用得越来越多，也常与前者结合。运动控制管「怎么稳稳地动」，运动规划管「走哪条路」，两者分工不同。","example":"Rudin 等人 2021 年用单块 GPU 上数千个并行仿真机器人训练 ANYmal 四足的行走策略，平地不到 4 分钟、崎岖地形约 20 分钟就能训完，并部署到了真机。","related":["强化学习运控","全身控制","模型预测控制","平衡控制","大脑-小脑架构（小脑）","运动规划"]},{"id":"hierarchical-control","category":"control","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Hierarchical control system","url":"https://en.wikipedia.org/wiki/Hierarchical_control_system"},{"title":"Highly Dynamic Quadruped Locomotion via Whole-Body Impulse Control and Model Predictive Control (arXiv:1909.06586)","url":"https://arxiv.org/abs/1909.06586"},{"title":"legged_gym: legged_robot.py（_compute_torques，PD 控制）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"}],"as_of":"","related_ids":["hierarchical-architecture","robot-cerebellum","model-predictive-control","whole-body-control","proportional-derivative-control","cascade-control"],"name":"分层控制","alt":"Hierarchical Control","abbr":"","aliases":["高层控制器","低层控制器","上层控制/底层控制","High-level controller","Low-level controller","分层控制系统"],"one_liner":"把控制拆成多层：上层低频定目标，下层高频跟踪目标并直接驱动电机。","explanation":"分层控制是控制工程里的经典做法：把复杂的控制问题拆成几层，上层看得远、更新慢，下层看得近、跑得快。上层控制器按较长周期输出参考量，比如目标速度、落足点、接触力或关节目标角；下层控制器以高得多的频率跟踪这些参考量，并处理扰动和硬件细节，上层一般不干预下层怎么执行。好处是每层都能用简单的模型、在自己的时间尺度上求解，也方便单独替换和调试。它和「分层架构」「大脑-小脑」一脉相承，后两者多指模型层面任务规划与动作生成的分工，分层控制更强调各级控制回路之间的频率和接口。","example":"MIT Mini Cheetah 的控制分两层：MPC 用简化模型在较长时间窗内优化足底反作用力，全身冲量控制（WBIC）再把这些力换算成关节指令。强化学习运控也类似：策略以 50 Hz 输出关节目标角，底层 PD 控制器以更高频率把它变成力矩。","related":["分层架构","大脑-小脑架构（小脑）","模型预测控制","全身控制","PD 控制","串级控制"]},{"id":"robot-cerebellum","category":"control","sec":0,"tier":1,"sources":[{"title":"RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration (arXiv:2505.03673)","url":"https://arxiv.org/abs/2505.03673"},{"title":"Figure: Helix — A Vision-Language-Action Model for Generalist Humanoid Control","url":"https://www.figure.ai/news/helix"}],"as_of":"2025-05","related_ids":["braincerebellum-architecture","dual-system-architecture","hierarchical-control","locomotion-control","whole-body-control","robobrain"],"name":"大脑-小脑架构（小脑）","alt":"Brain-Cerebellum Architecture (Cerebellum = motion-control layer)","abbr":"","aliases":["小脑","运动小脑","大小脑架构","Robot Cerebellum","Cerebellum Skill Library"],"one_liner":"大小脑架构里的「小脑」：把上层指令变成高频、稳定关节动作的那一层。","explanation":"「大脑-小脑」是国内具身智能圈对分层系统的通俗叫法，这一条专讲「小脑」。大脑多是多模态大模型，每秒只做几次决策，负责理解指令、拆解任务；小脑接住「往前走半米」「抓起杯子」这类子任务，以每秒几十到几百次的频率输出关节指令，同时保持平衡、应对扰动。它可以是强化学习训练的运控策略、MPC 加全身控制这类传统控制器，也可以是技能库或 VLA 里的快速动作模块。各家对边界说法不一：窄义只指行走、平衡等运动控制，广义把抓取等操作技能也算进去。智源的 RoboOS 就把可插拔的技能库称为「小脑技能库」。","example":"Figure 的 Helix 虽然不叫「小脑」，结构上与之对应：负责理解场景和语言的 System 2 以 7–9 Hz 运行，负责出动作的 System 1 作为独立实时进程，以 200 Hz 输出 35 个自由度的连续动作。","related":["大脑-小脑架构（大小脑）","快慢双系统","分层控制","运动控制","全身控制","智源 RoboBrain（具身大脑）"]},{"id":"control-frequency","category":"control","sec":0,"tier":1,"sources":[{"title":"libfranka robot.h（Since the robot is controlled with a 1 kHz frequency…）","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/robot.h"},{"title":"Franka FCI Docs: Minimum system and network requirements（RTT + 控制回路 + 机器人处理 < 1 ms；连续丢 20 包即停机）","url":"https://frankarobotics.github.io/docs/doc/libfranka/docs/system_requirements.html"},{"title":"legged_gym: legged_robot_config.py（sim dt = 0.005, decimation = 4）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"},{"title":"Figure: Helix（System 1 200 Hz / System 2 7–9 Hz）","url":"https://www.figure.ai/news/helix"}],"as_of":"","related_ids":["policy-inference-frequency","control-latency","control-decimation","real-time-control","control-bandwidth","proportional-derivative-control"],"name":"控制频率","alt":"Control Frequency","abbr":"","aliases":["控制周期","控制步长","控制回路频率","Control cycle","Control period","Control rate"],"one_liner":"控制器每秒发出多少次指令，单位 Hz；它的倒数就是控制周期。","explanation":"控制频率指控制器每秒完成「读传感器、计算、发指令」这一循环的次数，单位赫兹（Hz），倒数是控制周期，比如 1 kHz 对应每 1 毫秒一次。机器人里通常是几层回路嵌套，越靠近电机越快：大模型或 VLA 策略每秒出几次到几十次动作，关节位置或力矩回路要几百到上千赫兹，驱动器里的电流环更快。频率太低，机器人对扰动反应慢，容易抖动甚至摔倒；太高则算力和通信跟不上，指令没按时算完会被控制器拒收或报错。它和「策略推理频率」「控制延迟」相关但不同：前者只看模型多快出结果，后者是从感知到动作生效要多久。仿真训练时的控制频率要和真机一致，否则会加大虚实差距。","example":"Franka 机械臂的 FCI 接口以 1 kHz 运行：网络往返、用户回调计算和机器人处理三者加起来必须在 1 毫秒内完成，超时的那一拍指令会被丢弃，连续丢 20 拍就报错停机；legged_gym 里的四足策略则是 50 Hz，每 20 毫秒出一次动作。","related":["策略推理频率","控制延迟","控制降频","实时控制","控制带宽","PD 控制"]},{"id":"policy-inference-frequency","category":"control","sec":0,"tier":2,"sources":[{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/html/2410.24164v1"},{"title":"Figure: Helix（System 2 7–9 Hz / System 1 200 Hz）","url":"https://www.figure.ai/news/helix"},{"title":"Real-Time Execution of Action Chunking Flow Policies (arXiv:2506.07339)","url":"https://arxiv.org/abs/2506.07339"}],"as_of":"2025-06","related_ids":["control-frequency","inference-latency","action-chunking","asynchronous-inference","real-time-chunking","dual-system-architecture"],"name":"策略推理频率","alt":"Policy Inference Frequency","abbr":"","aliases":["推理频率","策略频率","模型调用频率"],"one_liner":"学习型策略每秒被调用、算出新动作的次数，常低于底层控制频率。","explanation":"策略推理频率指神经网络策略每秒做几次前向计算、给出新动作（或新动作块），单位 Hz。它和控制频率不是一回事：控制频率是执行器每秒收几次指令，关节控制环常在数百到上千 Hz。大模型算得慢，通常一次预测一整段动作（动作分块），两次推理之间把这段动作依次执行，所以推理频率远低于控制频率。以 π0 为例，它一次输出 50 步动作，在 50 Hz 的机器人上执行 25 步才重新推理，约合 2 Hz，单次推理在 RTX 4090 上约 73 毫秒。推理频率越低，对突发变化反应越慢，动作块衔接处也易卡顿，于是有了异步推理、实时动作分块和快慢双系统（如 Figure Helix 慢系统 7–9 Hz、快系统 200 Hz）。","example":"π0 在 20 Hz 控制的 UR5e、Franka 上每执行 16 步（0.8 秒）推理一次，在 50 Hz 控制的机器人上每执行 25 步（0.5 秒）推理一次。","related":["控制频率","推理延迟","动作分块","异步推理","实时动作分块","快慢双系统"]},{"id":"proportional-integral-derivative-control","category":"control","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Proportional–integral–derivative controller","url":"https://en.wikipedia.org/wiki/Proportional%E2%80%93integral%E2%80%93derivative_controller"},{"title":"legged_gym legged_robot_config.py（PD 刚度/阻尼与 action_scale 配置）","url":"https://raw.githubusercontent.com/leggedrobotics/legged_gym/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["proportional-derivative-control","cascade-control","stiffness-and-damping-gains","integral-windup-anti-windup","step-response-metrics","position-control"],"name":"PID 控制","alt":"Proportional-Integral-Derivative Control","abbr":"PID","aliases":["PID控制器","比例-积分-微分控制","PID controller"],"one_liner":"按误差的当前值、累积值和变化快慢三部分算控制量的经典反馈控制器。","explanation":"PID 控制是最常用的反馈控制方法，1922 年 Minorsky 研究美国海军船舶自动舵时给出了它的形式化控制律。控制量 u = Kp·e + Ki·∫e dt + Kd·de/dt，e 是目标值减测量值（误差），Kp、Ki、Kd 是三个待调增益。比例项按当前误差出力；积分项累加过去的误差，消除只用比例项时残留的稳态误差；微分项看误差变化多快，起阻尼作用、减少超调（冲过目标），但会放大测量噪声。去掉积分项就是 PD 控制，去掉微分项就是 PI 控制。关节电机、云台、无人机姿态环里都有它；强化学习运控策略通常只输出目标关节角，由底层 PD 控制器换算成力矩。电机出力已经顶到上限、积分项却还在继续累加，导致明显冲过头，这叫积分饱和，需要做抗饱和处理。","example":"机械臂关节要转到 30°，当前 25°：P 项按 5° 的误差出力；若因为重力一直停在 29.5° 到不了位，I 项把这 0.5° 越积越大直到补上；快到目标时 D 项看到误差在迅速缩小，提前收力，避免冲过 30°。","related":["PD 控制","串级控制","刚度与阻尼增益","积分饱和与抗饱和","阶跃响应指标（超调 / 调节时间 / 稳态误差）","位置控制"]},{"id":"proportional-derivative-control","category":"control","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Proportional–integral–derivative controller","url":"https://en.wikipedia.org/wiki/Proportional%E2%80%93integral%E2%80%93derivative_controller"},{"title":"legged_gym: legged_robot.py（_compute_torques）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"},{"title":"legged_gym: legged_robot_config.py（PD Drive parameters）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["proportional-integral-derivative-control","stiffness-and-damping-gains","position-control","gravity-compensation","mit-mode","control-decimation"],"name":"PD 控制","alt":"Proportional-Derivative Control","abbr":"PD","aliases":["PD控制器","PD 控制器","比例-微分控制","关节 PD 控制"],"one_liner":"按「偏差有多大」和「变化有多快」算输出的反馈控制，即去掉积分项的 PID。","explanation":"PD 控制是 PID 控制去掉积分项后的形式。PID 输出 u = Kp·e + Ki·∫e dt + Kd·de/dt，e 是目标值与实测值之差，Kp、Ki、Kd 是三个增益；PD 只留比例项（偏差越大出力越大）和微分项（按偏差变化快慢出力，抑制超调和振荡）。机器人关节上常写成 τ = Kp(q* − q) − Kd·q̇：τ 是电机力矩，q* 是目标角，q、q̇ 是实测角度和角速度，Kp、Kd 在力学上等效于弹簧刚度和阻尼。缺了积分项会留下稳态误差，比如关节受重力时停在略低于目标处，要靠重力补偿或上层策略抵消；微分项对噪声敏感，速度信号常需滤波。强化学习运控和 VLA 部署时，底层关节控制器最常用的就是它。","example":"legged_gym 把策略输出乘 0.5 再加默认关节角作为 q*，按 τ = Kp(q* − q) − Kd·q̇ 算力矩；示例配置里 Kp 取 10–15 N·m/rad，Kd 取 1–1.5 N·m·s/rad。","related":["PID 控制","刚度与阻尼增益","位置控制","重力补偿","MIT 模式","控制降频"]},{"id":"step-response-metrics","category":"control","sec":0,"tier":2,"sources":[{"title":"MATLAB stepinfo 文档（RiseTime / SettlingTime / Overshoot 定义）","url":"https://www.mathworks.com/help/control/ref/dynamicsystem.stepinfo.html"},{"title":"Wikipedia: Settling time","url":"https://en.wikipedia.org/wiki/Settling_time"},{"title":"Wikipedia: Steady-state error","url":"https://en.wikipedia.org/wiki/Steady-state_error"}],"as_of":"","related_ids":["proportional-integral-derivative-control","proportional-derivative-control","stiffness-and-damping-gains","damping-ratio","integral-windup-anti-windup","control-bandwidth"],"name":"阶跃响应指标（超调 / 调节时间 / 稳态误差）","alt":"Step Response Metrics (Overshoot / Settling Time / Steady-State Error)","abbr":"","aliases":["超调量","调节时间","稳态误差","上升时间","阶跃响应性能指标"],"one_liner":"目标突然改变时，衡量输出多快、多稳、多准到达目标的几个数。","explanation":"阶跃响应指标用来评价闭环控制器调得好不好：把目标值突然从一个值改成另一个值（阶跃输入），记录输出随时间的变化，读出几个数。上升时间：输出从变化量的 10% 升到 90% 所用时间；超调量：输出冲过最终值的最大幅度占变化量的百分比；调节时间：输出此后一直停在最终值附近 2%（有时取 5%）范围内所需的时间；稳态误差：足够长时间后输出与目标之差。这几项互相牵制：加大 Kp 响应更快但超调变大，加大阻尼能压住超调但变慢；纯比例控制常留稳态误差，加积分项可以消除。调关节 PD 增益、对比仿真与真机响应时都看这几项。","example":"让关节从 0 rad 转到 1 rad：输出最高冲到 1.13 rad，比最终稳定值 0.98 rad 高出约 15%，即超调约 15%；0.3 秒后输出一直在 0.98 rad 上下 2% 以内，调节时间约 0.3 秒；最终差目标 0.02 rad，就是稳态误差。","related":["PID 控制","PD 控制","刚度与阻尼增益","阻尼比","积分饱和与抗饱和","控制带宽"]},{"id":"integral-windup-anti-windup","category":"control","sec":0,"tier":3,"sources":[{"title":"Wikipedia: Integral windup","url":"https://en.wikipedia.org/wiki/Integral_windup"}],"as_of":"","related_ids":["proportional-integral-derivative-control","torque-limiting","step-response-metrics","cascade-control","active-disturbance-rejection-control"],"name":"积分饱和与抗饱和","alt":"Integral Windup / Anti-windup","abbr":"","aliases":["积分饱和","积分器饱和","抗积分饱和","Integrator Windup","Reset Windup"],"one_liner":"执行器顶到上限时积分项仍在累加导致超调；抗饱和就是在饱和时管住积分项。","explanation":"积分饱和出现在带积分项的控制器（PI、PID）里。执行器有物理上限，电机力矩、电流都不能无限大。当误差很大，比如设定值突变或关节被外物挡住，控制器要的输出超过上限，实际只能输出上限，误差消得慢，积分项 K_i·∫e dt 却一直累加。等误差反号，积分项要很久才能放掉，于是出现大超调和长时间振荡。常见抗饱和办法：限幅，把积分项钳在上下界内；条件积分，输出饱和时暂停积分；反算法，把饱和前后输出之差乘一个增益反馈给积分器，让它跟着实际输出走。机器人关节的速度环、电流环都要处理这个问题。","example":"机械臂关节被人手按住，速度环输出一直顶在力矩上限，积分项不断累加；松手瞬间关节会猛地甩过目标位置。给积分器加上限幅或反算抗饱和后，松手时关节能平稳回到指令轨迹。","related":["PID 控制","力矩限幅","阶跃响应指标（超调 / 调节时间 / 稳态误差）","串级控制","自抗扰控制"]},{"id":"feedforward-control","category":"control","sec":0,"tier":2,"sources":[{"title":"Wikipedia: Feed forward (control)","url":"https://en.wikipedia.org/wiki/Feed_forward_(control)"},{"title":"unitree_sdk2 G1 底层示例 g1_ankle_swing_example.cpp（tau_ff / kp / kd 字段）","url":"https://github.com/unitreerobotics/unitree_sdk2/blob/main/example/g1/low_level/g1_ankle_swing_example.cpp"}],"as_of":"","related_ids":["gravity-compensation","friction-compensation","computed-torque-control","proportional-derivative-control","mit-mode","inverse-dynamics"],"name":"前馈控制","alt":"Feedforward Control","abbr":"","aliases":["前馈力矩","前馈补偿","Feedforward torque","τff"],"one_liner":"不等误差出现，按模型提前算出所需控制量直接加上去的控制方式。","explanation":"前馈控制根据已知的目标轨迹或可测扰动，用系统模型事先算出需要的控制量，直接叠加到输出上；反馈控制则是测到实际误差后再纠正。纯前馈是开环的，模型不准或有测不到的扰动时误差没人管，所以实际多用「前馈＋反馈」：前馈扛大头，反馈只修剩下的小误差，这样跟得快，反馈增益也可以调小，关节更柔顺。机器人里典型的前馈项有重力补偿、摩擦补偿，以及用逆动力学按期望加速度算出的力矩（计算力矩控制就建立在这上面）。关节电机常用指令 τ = τff + kp(q目标−q) + kd(q̇目标−q̇) 中，τff 就是前馈力矩，后两项是 PD 反馈。","example":"机械臂水平伸出，距肩关节 0.5 m 处挂 1 kg 负载，仅负载产生的重力力矩约 9.8×0.5≈4.9 N·m。把它预先算好填进 τff，PD 反馈就不用靠拉大位置误差去撑住负载，跟踪误差会明显变小。","related":["重力补偿","摩擦补偿","计算力矩控制","PD 控制","MIT 模式","逆动力学"]},{"id":"control-bandwidth","category":"control","sec":0,"tier":3,"sources":[{"title":"MathWorks: bandwidth（增益首次低于直流值 70.79%，即 −3 dB 的频率）","url":"https://www.mathworks.com/help/control/ref/dynamicsystem.bandwidth.html"},{"title":"Wikipedia: Bandwidth (signal processing)","url":"https://en.wikipedia.org/wiki/Bandwidth_(signal_processing)"},{"title":"Wensing et al., Proprioceptive Actuator Design in the MIT Cheetah: Impact Mitigation and High-Bandwidth Physical Interaction (IEEE T-RO 2017)","url":"https://ieeexplore.ieee.org/document/7827048"}],"as_of":"","related_ids":["control-frequency","control-latency","cascade-control","proprioceptive-actuator","force-control","step-response-metrics"],"name":"控制带宽","alt":"Control Bandwidth","abbr":"","aliases":["闭环带宽","-3 dB 带宽","Closed-loop Bandwidth","力控带宽","电流环带宽"],"one_liner":"闭环系统能跟得上的最高信号频率，通常取增益下降 3 dB 处。","explanation":"给闭环控制系统输入不同频率的正弦指令：低频时输出能完整跟上，频率越高，输出幅值越小、滞后越大；幅值降到低频时约 70.7%（即 −3 dB）的那个频率就是闭环带宽。带宽越高，系统响应越快，也越能压住快速扰动。它和控制频率不是一回事：控制频率是每秒算几次指令，带宽是系统实际能跟上多快的变化，前者通常要比后者高出好几倍，带宽才有保证。串级控制里内环带宽要明显高于外环，比如电流环快于速度环、速度环快于位置环。腿足机器人落地接触时间很短，需要高带宽的力控；弹性元件、低刚度传动和通信延迟都会限制能达到的带宽。","example":"一阶系统 G(s)=1/(τs+1)，τ=16 毫秒时带宽为 1/τ=62.5 rad/s，约 10 Hz：给它 2 Hz 的正弦指令几乎完整跟上，30 Hz 时幅值只剩约三成。实际机器人里，MIT Cheetah 奔跑时单次触地可短到约 85 毫秒，其本体感受式执行器就把「高带宽力控」列为设计目标。","related":["控制频率","控制延迟","串级控制","本体感受式执行器","力控","阶跃响应指标（超调 / 调节时间 / 稳态误差）"]},{"id":"real-time-control","category":"control","sec":0,"tier":2,"sources":[{"title":"Wikipedia: Real-time computing","url":"https://en.wikipedia.org/wiki/Real-time_computing"},{"title":"Franka FCI 文档：libfranka Overview（1 kHz 控制回路、丢包处理）","url":"https://frankarobotics.github.io/docs/doc/libfranka/docs/overview.html"},{"title":"Franka FCI 文档：Setting up the Real-Time Kernel","url":"https://frankarobotics.github.io/docs/doc/libfranka/docs/real_time_kernel.html"}],"as_of":"","related_ids":["control-frequency","hard-real-time","real-time-operating-system","preempt-rt","jitter","control-latency"],"name":"实时控制","alt":"Real-Time Control","abbr":"","aliases":["实时控制回路","实时控制循环"],"one_liner":"控制程序按固定周期读传感器、算指令、发给电机，每一拍都必须准时完成。","explanation":"实时控制指控制程序按固定周期（如每 1 毫秒）读取传感器、计算指令并下发给电机，而且每个周期都必须在截止时间前完成。这里的实时强调准时、可预期，而不是算得快：硬实时系统错过一次截止时间就算失败，软实时只会让效果变差。例如 Franka 机械臂的 libfranka 以 1 kHz 执行用户的控制回调，官方要求工作站使用 PREEMPT_RT 实时内核、以实时优先级运行控制程序。具身智能系统里常见的分工是：VLA 等大模型以几到几十 Hz 推理出目标，底层关节控制在实时回路里以数百到上千 Hz 跟踪。","example":"用 libfranka 给 Franka FR3 做力矩控制时，回调函数每 1 毫秒被调用一次，读入机器人状态、返回 7 个关节力矩；如果电脑卡顿导致连续 20 个以上数据包丢失，控制回路会抛出 communication_constraints_violation 并停止。","related":["控制频率","硬实时","实时操作系统","实时内核补丁","时间抖动","控制延迟"]},{"id":"control-latency","category":"control","sec":0,"tier":2,"sources":[{"title":"Real-Time Execution of Action Chunking Flow Policies (Black, Galliker, Levine, arXiv 2506.07339)","url":"https://arxiv.org/abs/2506.07339"},{"title":"Wikipedia: Smith predictor","url":"https://en.wikipedia.org/wiki/Smith_predictor"}],"as_of":"2025-12","related_ids":["inference-latency","control-frequency","real-time-chunking","asynchronous-inference","action-chunking","jitter"],"name":"控制延迟","alt":"Control Latency","abbr":"","aliases":["端到端延迟","执行延迟","感知-动作延迟","End-to-end Latency"],"one_liner":"从传感器拿到数据，到电机真正执行对应动作之间的时间差。","explanation":"控制延迟指一次「感知→计算→执行」走完所需的时间：相机曝光与传输、模型推理、网络与总线通信、电机驱动响应都算在内，端到端就是从拿到观测到对应动作落到关节上的间隔。反馈控制靠「看到误差再纠正」，延迟越大，控制器用的信息越旧，轻则动作迟钝、超调，重则来回振荡失稳；1957 年 O. J. M. Smith 提出的 Smith 预估器就是对付纯延迟的经典办法。VLA 推理一次常要几十到上百毫秒，远长于底层控制周期，于是有了动作分块、异步推理和实时动作分块（RTC）等做法。它比推理延迟范围更大，后者只算模型前向计算那一段。","example":"Physical Intelligence 的实时动作分块论文里，π0.5 在 RTX 4090 上推理一次约 76 ms，而机器人按 50 Hz 执行（每步 20 ms），等新动作算出来，机器人已经又走了约 3 步；不做处理，块与块交接处就会出现停顿或跳变。","related":["推理延迟","控制频率","实时动作分块","异步推理","动作分块","时间抖动"]},{"id":"jitter","category":"control","sec":0,"tier":3,"sources":[{"title":"ROS 2 Design: Introduction to Real-time Systems","url":"https://design.ros2.org/articles/realtime_background.html"},{"title":"libfranka include/franka/robot.h（1 kHz 控制回调说明）","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/robot.h"}],"as_of":"","related_ids":["real-time-control","control-frequency","control-latency","preempt-rt","ethercat","hard-real-time"],"name":"时间抖动","alt":"Jitter (Timing Jitter)","abbr":"","aliases":["抖动","周期抖动","调度抖动","timing jitter"],"one_liner":"周期性任务的实际执行时刻偏离理想节拍的波动，是衡量实时性的关键指标。","explanation":"抖动指本该按固定周期发生的事件，实际发生时刻相对理想时刻的偏差和波动。机器人里最常说的是控制回路的调度抖动：比如 1 kHz 的关节控制回路，理想情况下每 1 ms 执行一次，实际间隔却可能忽长忽短。它和控制延迟不是一回事：延迟是从读传感器到发出指令隔了多久，抖动是这段时间每次是否一样。离散控制器通常假定采样周期固定，抖动会让积分、微分项算偏，轻则振动，重则失稳；指令没按时送到驱动器还可能触发报错停机。所以实时系统追求的是确定性而不只是快，ROS 2 设计文档就强调实时系统靠确定的调度来定义，而不是低延迟。常用 cyclictest 测量线程唤醒时刻的波动，降低抖动的手段包括 PREEMPT_RT 实时内核、CPU 隔离、EtherCAT 这类确定性总线。","example":"Franka 机械臂的底层控制以 1 kHz 运行，libfranka 要求用户的控制回调在很短的时间窗内算完，否则这一周期的指令不被接受；因此跑力矩控制时一般要装实时内核，并避免在控制线程里做打印、动态分配内存这类耗时不定的操作。","related":["实时控制","控制频率","控制延迟","实时内核补丁","EtherCAT 总线","硬实时"]},{"id":"model-based-control","category":"control","sec":0,"tier":2,"sources":[{"title":"Modern Robotics 11.4: Motion Control with Torque or Force Inputs (Part 3 of 3)（计算力矩控制）","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/11-4-motion-control-with-torque-or-force-inputs-part-3-of-3/"},{"title":"Dynamic Locomotion in the MIT Cheetah 3 Through Convex Model-Predictive Control (IROS 2018, MIT DSpace)","url":"https://dspace.mit.edu/handle/1721.1/138000"}],"as_of":"","related_ids":["learning-based-control","computed-torque-control","model-predictive-control","whole-body-control","system-identification","dynamics"],"name":"基于模型的控制","alt":"Model-Based Control","abbr":"","aliases":["传统模型控制","模型驱动控制","基于动力学模型的控制"],"one_liner":"先写出机器人和环境的数学模型，再据此推导或优化出控制指令。","explanation":"指依赖显式数学模型设计控制器的一大类方法。模型包括运动学和动力学，如机械臂方程 M(q)q̈ + c(q, q̇) + g(q) = τ：M 为质量矩阵，c 为科氏力和离心力项，g 为重力项，τ 为关节力矩。常见做法有重力补偿、计算力矩控制（用模型抵消非线性）、操作空间控制、模型预测控制（MPC，每个周期用模型预测未来一小段并优化动作）和基于二次规划的全身控制。优点是可解释、无需训练数据、能做稳定性分析；缺点是模型要够准，接触、摩擦、柔性物体难建模，复杂任务需大量人工设计。它与基于学习的控制相对，现在常两者结合。注意它不同于基于模型的强化学习，后者的模型是学出来的。","example":"MIT Cheetah 3 把机身动力学简化后构造凸 MPC，以 20–30 Hz 求解足端地面反作用力、每次不到 1 毫秒，用同一套参数实现小跑、疾驰、跳跃（bound）等步态，前进速度最高 3 m/s。","related":["基于学习的控制","计算力矩控制","模型预测控制","全身控制","系统辨识","动力学"]},{"id":"learning-based-control","category":"control","sec":0,"tier":2,"sources":[{"title":"Safe Learning in Robotics: From Learning-Based Control to Safe Reinforcement Learning (Brunke et al., arXiv 2108.06266)","url":"https://arxiv.org/abs/2108.06266"},{"title":"Learning Agile and Dynamic Motor Skills for Legged Robots (Hwangbo et al., Science Robotics 2019, arXiv 1901.08652)","url":"https://arxiv.org/abs/1901.08652"}],"as_of":"","related_ids":["model-based-control","rl-based-locomotion-control","reinforcement-learning","imitation-learning","safe-reinforcement-learning","learning-based-whole-body-control"],"name":"基于学习的控制","alt":"Learning-Based Control","abbr":"","aliases":["学习型控制","数据驱动控制","Data-driven Control"],"one_liner":"用数据和机器学习得到控制器或其中的模型，而不全靠人工推公式和调参。","explanation":"泛指用数据学习来构造或改进控制器的方法，与依赖人工建模的基于模型的控制相对。典型做法有三类：学习动力学模型或其误差，再交给 MPC 等传统控制器；用强化学习或模仿学习直接训练神经网络策略，从观测输出关节目标或力矩；在线学习调整控制参数。Brunke 等人 2022 年在《Annual Review of Control, Robotics, and Autonomous Systems》的综述，把学习不确定动力学以安全提升性能的方法称为基于学习的控制，并与安全强化学习对照。它擅长处理难建模的接触、摩擦和电机特性，代价是需要大量数据或仿真，也难做严格的稳定性保证。如今四足和人形运控多用仿真训练的强化学习策略。","example":"Hwangbo 等人 2019 年发表于 Science Robotics 的工作，先用真机数据训练模拟电机特性的执行器网络，再在仿真中用强化学习训练 ANYmal 四足的策略，迁移到真机后比此前方法跑得更快，还能从复杂姿态摔倒后自己爬起。","related":["基于模型的控制","强化学习运控","强化学习","模仿学习","安全强化学习","学习型全身控制"]},{"id":"position-control","category":"control","sec":1,"tier":1,"sources":[{"title":"ROBOTIS e-Manual: XM430-W350（Operating Mode）","url":"https://emanual.robotis.com/docs/en/dxl/x/xm430-w350/"},{"title":"legged_gym: legged_robot.py（_compute_torques：P / V / T 三种控制类型）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"}],"as_of":"","related_ids":["velocity-control","torque-control","proportional-derivative-control","cascade-control","stiffness-and-damping-gains","mit-mode"],"name":"位置控制","alt":"Position Control","abbr":"","aliases":["位控","位置模式","关节位置控制","Position mode"],"one_liner":"给电机或关节一个目标角度或位置，由控制器让它到达并保持住。","explanation":"位置控制是最常见的电机控制模式：上层只给目标位置，比如让关节转到 30 度，驱动器内部的闭环根据编码器读数与目标的偏差算出电流，把关节拉到目标并保持。舵机和工业机械臂大多默认用这种模式，精度高、用起来简单。它的另一面是「硬」：增益高时，关节会用很大的力去追目标，碰到人或意外障碍也不退让，所以需要接触的场景常改用力矩控制、阻抗控制或力控。强化学习运控里，策略输出的通常也是关节目标角，再由 PD 控制器换算成力矩，只是刚度调得较低，给关节留出柔顺性。和它并列的还有速度模式、力矩（电流）模式。","example":"ROBOTIS 的 Dynamixel XM430 舵机有 6 种工作模式，把 Operating Mode 设为 3 就是位置控制模式，写入目标位置后舵机用内部的位置 PID 转过去并保持住。","related":["速度控制","力矩控制","PD 控制","串级控制","刚度与阻尼增益","MIT 模式"]},{"id":"velocity-control","category":"control","sec":1,"tier":2,"sources":[{"title":"Lynch & Park, Modern Robotics (2017 preprint), 11.3 Motion Control with Velocity Inputs","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"ros2_controllers: diff_drive_controller","url":"https://control.ros.org/master/doc/ros2_controllers/diff_drive_controller/doc/userdoc.html"},{"title":"Diffusion Policy（velocity control is more affected by latency than position control）","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["position-control","torque-control","cascade-control","cyclic-synchronous-position-velocity-torque-modes","differential-drive-kinematics","velocity-command-tracking"],"name":"速度控制","alt":"Velocity Control","abbr":"","aliases":["速度模式","Velocity mode","Speed control"],"one_liner":"上层给出期望速度，由驱动器让电机或机器人按这个速度运动。","explanation":"速度控制指上层给出期望速度，底层负责跟上，分两个层面。关节层面，伺服驱动器的速度模式（如 CiA 402 协议里的 CSV 模式）接收目标转速，在内部闭速度环；步进电机的转速则直接由脉冲频率决定。任务层面，可给末端一个期望速度，用雅可比伪逆换成各关节速度；移动底盘接收线速度和角速度，再按轮距、轮半径换成左右轮转速。和位置控制比，它不直接管最终停在哪，位置偏差要靠上层闭环纠正，因而对延迟更敏感，Diffusion Policy 的消融实验也观察到这一点；和力矩控制比，它不直接管出力大小，接触时不够柔顺。","example":"ROS 2 的 diff_drive_controller：订阅 cmd_vel 速度指令，取线速度的 x 分量和角速度的 z 分量，按轮距和轮半径换算后，写入左右轮关节的速度命令接口。","related":["位置控制","力矩控制","串级控制","周期同步位置 / 速度 / 力矩模式（CSP / CSV / CST）","差速驱动运动学","速度指令跟踪"]},{"id":"torque-control","category":"control","sec":1,"tier":2,"sources":[{"title":"Lynch & Park, Modern Robotics (2017 preprint), Fig. 11.1 与 11.5 Force Control","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"libfranka robot.h（torque control / 1 kHz / without gravity and friction）","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/robot.h"},{"title":"legged_gym: legged_robot.py（control_type P / V / T）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"}],"as_of":"","related_ids":["position-control","velocity-control","impedance-control","gravity-compensation","joint-torque-sensor","cascade-control"],"name":"力矩控制","alt":"Torque Control","abbr":"","aliases":["扭矩控制","力矩模式","电流控制（电机层）","Effort control","Torque mode"],"one_liner":"直接给关节下达「出多大力矩」的指令，而不是「转到哪个角度」。","explanation":"力矩控制指控制器的输出就是关节力矩 τ（单位 N·m），由驱动器负责让电机真的产生这个力矩。电机力矩和绕组电流近似成正比，所以电机层常靠电流闭环实现，这也是它又叫电流控制的原因；减速比大的关节齿轮摩擦大，只控电流不准，就要在输出端装关节力矩传感器再闭环。和位置控制（驱动器内部硬把角度拉到目标）相比，力矩控制把「多硬、多软」交给上层算法决定，是阻抗控制、全身控制、操作空间控制的基础，接触或被撞时更柔顺；代价是上层要自己补偿重力、摩擦，模型不准就会下垂或漂移。legged_gym 等仿真框架也把它列为与位置、速度并列的动作类型。","example":"Franka 机械臂的 libfranka 提供 1 kHz 的关节力矩接口：用户回调里算出 7 个关节力矩，文档注明发送的是「不含重力和摩擦」的力矩，重力与摩擦补偿由机器人自己叠加。","related":["位置控制","速度控制","阻抗控制","重力补偿","关节力矩传感器","串级控制"]},{"id":"cascade-control","category":"control","sec":1,"tier":2,"sources":[{"title":"ODrive Documentation: Control Structure and Tuning","url":"https://docs.odriverobotics.com/v/latest/manual/control.html"},{"title":"Wikipedia: Proportional–integral–derivative controller","url":"https://en.wikipedia.org/wiki/Proportional%E2%80%93integral%E2%80%93derivative_controller"}],"as_of":"","related_ids":["proportional-integral-derivative-control","position-control","velocity-control","torque-control","field-oriented-control","mit-mode"],"name":"串级控制","alt":"Cascade Control (Position / Velocity / Current Loops)","abbr":"","aliases":["三环控制","三闭环","位置环/速度环/电流环","级联控制"],"one_liner":"位置环套速度环、速度环套电流环，外环输出当内环目标的多层反馈控制。","explanation":"串级控制把几个反馈回路嵌套起来，外环的输出作为内环的目标值。电机和关节模组里最典型的是三环：最外层位置环比较目标角度与编码器读数，输出目标速度；中间的速度环输出目标电流；最内层电流环调节绕组电压，而电机电流近似正比于输出力矩。以开源驱动器 ODrive 为例，位置环是 P 控制，速度环和电流环都是 PI 控制；跳过位置环就是速度模式，只留电流环就是力矩模式。设计原则是内环比外环快得多，负载突变、电源波动这类扰动先在内环被压住，外环可以把内环近似看成理想执行器。机器人里说的位置控制、速度控制、力矩控制，本质上就是指令从这三环中的哪一层进入；MIT 模式等关节接口则把位置和速度的 PD 项与前馈力矩合成一个力矩指令。","example":"关节模组收到「转到 90°」：位置环算出「以 2 rad/s 转」，速度环算出「需要 3A 电流」，电流环调电压把电流稳在 3A；负载突然变重时，电流环和速度环先把扰动吃掉，位置环几乎察觉不到。","related":["PID 控制","位置控制","速度控制","力矩控制","磁场定向控制","MIT 模式"]},{"id":"joint-space-control","category":"control","sec":1,"tier":2,"sources":[{"title":"Modern Robotics 11.4: Motion Control with Torque or Force Inputs (Part 3 of 3)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/11-4-motion-control-with-torque-or-force-inputs-part-3-of-3/"},{"title":"ros2_controllers: joint_trajectory_controller 文档","url":"https://control.ros.org/rolling/doc/ros2_controllers/joint_trajectory_controller/doc/userdoc.html"}],"as_of":"","related_ids":["joint-space","task-space-control","proportional-derivative-control","computed-torque-control","inverse-kinematics","ros2-control"],"name":"关节空间控制","alt":"Joint-Space Control","abbr":"","aliases":["关节层控制","关节级控制","Joint-Level Control"],"one_liner":"以各关节角度为目标和误差来控制机器人，每个关节跟踪自己的期望轨迹。","explanation":"关节空间控制把目标写成关节角随时间的序列 q_d(t)，逐个比较实际角度 q 与目标，按误差输出力矩或速度。最简单的是各关节独立 PD：τ = Kp(q_d − q) + Kd(q̇_d − q̇)，Kp、Kd 分别是刚度和阻尼增益；计算力矩控制还会用动力学模型补上惯性、科氏力和重力。与之相对的任务空间控制直接以末端位姿误差为对象，经雅可比矩阵换算成关节力矩，便于规定末端走直线或施加接触力。关节空间控制实现简单、不怕奇异位形，但末端路径要先由逆运动学或规划器转成关节轨迹。足式和人形的强化学习策略输出关节目标位置，也属于这一层。","example":"MoveIt 规划出关节轨迹后交给 ros2_control 的 joint_trajectory_controller，它在路点之间按时间插值，每个周期把各关节的目标位置（或经 PID 换算的力矩）发给驱动器。","related":["关节空间","任务空间控制","PD 控制","计算力矩控制","逆运动学","ros2_control"]},{"id":"stiffness-and-damping-gains","category":"control","sec":1,"tier":2,"sources":[{"title":"legged_gym legged_robot.py：_compute_torques（PD 力矩公式）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"},{"title":"unitree_rl_gym：Go2 配置","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/legged_gym/envs/go2/go2_config.py"},{"title":"unitree_rl_gym：G1 配置","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/legged_gym/envs/g1/g1_config.py"}],"as_of":"2026-09","related_ids":["proportional-derivative-control","mit-mode","impedance-control","rl-based-locomotion-control","step-response-metrics","mass-spring-damper-system"],"name":"刚度与阻尼增益","alt":"Stiffness and Damping Gains","abbr":"Kp/Kd","aliases":["PD 增益","kp/kd","P增益/D增益","stiffness/damping"],"one_liner":"关节 PD 控制里决定关节有多硬、多稳的两个系数 Kp 和 Kd。","explanation":"刚度与阻尼增益是关节 PD 控制律 τ = Kp(q* − q) + Kd(q̇* − q̇) 里的两个系数：τ 是电机输出力矩，q*、q 是目标与实际关节角，q̇*、q̇ 是目标与实际角速度。Kp（单位 N·m/rad）越大，关节偏离目标时回拉的力越大，跟踪更准但更硬、碰撞冲击也更大；Kd（单位 N·m·s/rad）按速度施加阻力，抑制振荡和超调，过大会反应迟钝并放大速度噪声。这条控制律在力学上等价于关节上并联一根弹簧和一个阻尼器，所以仿真器常直接叫 stiffness / damping。强化学习运控里策略通常只输出目标角度，力矩由 PD 算出，Kp/Kd 的取值会直接影响仿真到真机的迁移。","example":"unitree_rl_gym 里宇树 Go2 所有关节取 Kp=20 N·m/rad、Kd=0.5 N·m·s/rad；G1 人形的髋关节 Kp=100、膝关节 Kp=150、踝关节 Kp=40，承重大的关节给更高刚度。","related":["PD 控制","MIT 模式","阻抗控制","强化学习运控","阶跃响应指标（超调 / 调节时间 / 稳态误差）","质量-弹簧-阻尼系统"]},{"id":"mit-mode","category":"control","sec":1,"tier":2,"sources":[{"title":"bgkatz/motorcontrol 固件 foc.c（torque_control: kp·(p_des−θ) + kd·(v_des−ω) + t_ff）","url":"https://github.com/bgkatz/motorcontrol/blob/master/Core/Src/foc.c"},{"title":"DAMIAO DM-J4310-2EC V1.1 手册（Operating modes: MIT mode）","url":"https://github.com/enactic/damiao/blob/main/website/i18n/en/docusaurus-plugin-content-docs/current/products/hardware/dm-j4310-2ec-v1.1.mdx"},{"title":"Xiaomi CyberGear 说明书英译版（Operation control mode 五参数指令）","url":"https://github.com/belovictor/cybergear-docs/blob/main/instructionmanual/instructionmanual.md"}],"as_of":"","related_ids":["proportional-derivative-control","stiffness-and-damping-gains","mit-mini-cheetah-actuator","damiao-dm-j4310-2ec-joint-motor","xiaomi-cybergear-micro-motor","torque-control"],"name":"MIT 模式","alt":"MIT Mode (MIT Cheetah-style Joint Motor Command)","abbr":"","aliases":["MIT 控制模式","力位混控模式（电机）","运控模式（小米 CyberGear）","MIT mode"],"one_liner":"一帧指令给出目标位置、速度、Kp、Kd、前馈力矩，驱动器按 PD 公式算力矩。","explanation":"这种关节电机指令格式来自 MIT 仿生机器人实验室 Mini Cheetah 四足的电机控制器（Ben Katz 的开源固件），达妙等国产电机沿用并兼容，小米 CyberGear 称运控模式。上位机一帧 CAN 报文给出目标位置 p_des、目标速度 v_des、刚度 Kp、阻尼 Kd 和前馈力矩 τ_ff，驱动器内部循环计算 τ = Kp(p_des − p) + Kd(v_des − v) + τ_ff（p、v 为实测值）再交给电流环。改参数即可切换行为：Kp 大近似位置控制，Kp=0 为速度或阻尼控制，Kp=Kd=0 为纯力矩控制。足式和人形的强化学习策略输出关节目标位置，常经它配固定 Kp、Kd 执行。它是单关节 PD 加前馈，并非按方向拆分的力位混合控制。","example":"达妙 DM-J4310 手册写明：Kp=0、Kd≠0 时给定 v_des 可让电机匀速转动；Kp=Kd=0 时给定 τ_ff 即输出指定力矩；做位置控制时 Kd 不能设为 0，否则电机会振荡甚至失控。","related":["PD 控制","刚度与阻尼增益","MIT Cheetah 执行器","达妙 DM-J4310 关节电机","小米 CyberGear 微电机","力矩控制"]},{"id":"servo-enable","category":"control","sec":1,"tier":2,"sources":[{"title":"ethercat_driver_ros2: CANopen over EtherCAT for electrical drives（CiA402 状态机）","url":"https://icube-robotics.github.io/ethercat_driver_ros2/developer_guide/cia402_drive.html"}],"as_of":"","related_ids":["canopen-cia-402-drive-profile","servo-drive","holding-brake","safe-torque-off","cyclic-synchronous-position-velocity-torque-modes","safety-gantry"],"name":"伺服使能（上使能 / 下使能）","alt":"Servo Enable (Servo ON / OFF)","abbr":"","aliases":["使能","上使能","下使能","Servo ON","Enable Operation"],"one_liner":"让电机驱动器进入可出力状态（上使能）或切断输出（下使能）的操作。","explanation":"伺服使能指让电机驱动器从通电但不出力，切换到闭环工作、按指令输出力矩的状态，俗称上使能；反过来断开输出叫下使能。以工业总线常用的 CiA 402 驱动规范为例，驱动器内部有一个状态机，上位机要通过控制字依次发出 Shutdown、Switch on、Enable operation 命令，驱动器进入 Operation enabled 后才接受位置、速度或力矩设定值；出错会进入 Fault 状态，需先复位。显式使能是为了防止上电瞬间电机乱动。下使能后电机不再出力，没有抱闸的关节会在重力下落下，所以人形和腿足机器人上下使能时通常挂在吊架上。","example":"调试 EtherCAT 关节模组时，上位机先读状态字确认处于 Switch on disabled，再依次发 Shutdown、Switch on、Enable operation，状态字变为 Operation enabled 后开始周期性发送目标位置；调试结束先让关节回到安全姿态，再下使能。","related":["CANopen / CiA 402 驱动协议","电机驱动器","抱闸","安全扭矩关断","周期同步位置 / 速度 / 力矩模式（CSP / CSV / CST）","吊装架（安全吊架）"]},{"id":"homing-zero-offset-calibration","category":"control","sec":1,"tier":2,"sources":[{"title":"LinuxCNC Docs: Homing Configuration","url":"https://linuxcnc.org/docs/html/config/ini-homing.html"},{"title":"ROBOTIS e-Manual: XM430-W350 (Homing Offset)","url":"https://emanual.robotis.com/docs/en/dxl/x/xm430-w350/"},{"title":"Xiaomi CyberGear 微电机说明书（英译版，含零位设置与控制模式）","url":"https://github.com/belovictor/cybergear-docs/blob/main/instructionmanual/instructionmanual.md"}],"as_of":"","related_ids":["joint-zero-position-calibration","joint-zero-calibration","incremental-encoder","absolute-encoder","soft-limits","forward-kinematics"],"name":"回零 / 零位标定","alt":"Homing / Joint Zero-Offset Calibration","abbr":"","aliases":["回零","零位标定","零点标定","Homing","Zero Calibration","Homing Offset"],"one_liner":"让每个关节的编码器读数和模型里的「0 度」对上，确立角度基准。","explanation":"URDF 等机器人模型约定关节角全为 0 时对应一个确定姿态，但编码器装上去时读数原点是任意的。零位标定就是测出读数与模型角度之间的固定偏移并保存，以后每次读数都据此修正；回零指让关节运动到参考点来建立这个基准的过程。用增量式编码器（只记相对转动量）的关节断电即丢失位置，每次上电都要回零：先慢速走向限位开关或硬限位，再用编码器的索引脉冲精确定位，符合 CiA 402 规范的伺服驱动器可自行完成。绝对值编码器上电就知道位置，通常只需标定一次。软限位等安全功能以零位为基准，零位偏了，末端会有系统误差，同一个策略换台机器人也会不好用。","example":"小米 CyberGear 微电机有「设置机械零位」命令（通信类型 6），把当前位置设为零点，但断电后失效；Dynamixel 舵机用 Homing Offset 参数，读数 = 实际位置 + 偏移量。","related":["零位标定（零点标定）","关节零位标定（回零）","增量式编码器","绝对值编码器","软限位","正运动学"]},{"id":"cyclic-synchronous-position-velocity-torque-modes","category":"control","sec":1,"tier":3,"sources":[{"title":"CAN in Automation: CiA 402 series – CANopen device profile for drives and motion control","url":"https://www.can-cia.org/can-knowledge/cia-402-series-canopen-device-profile-for-drives-and-motion-control"},{"title":"ethercat_driver_ros2: Configuring a CiA402 drive（0x6060，模式 8/9/10）","url":"https://icube-robotics.github.io/ethercat_driver_ros2/user_guide/config_cia402_drive.html"},{"title":"ros2_canopen: canopen_402_driver OperationMode 枚举","url":"https://raw.githubusercontent.com/ros-industrial/ros2_canopen/master/canopen_402_driver/include/canopen_402_driver/base.hpp"}],"as_of":"","related_ids":["canopen-cia-402-drive-profile","ethercat","servo-drive","torque-control","cascade-control","mit-mode"],"name":"周期同步位置 / 速度 / 力矩模式（CSP / CSV / CST）","alt":"Cyclic Synchronous Position / Velocity / Torque Modes (CiA 402)","abbr":"CSP / CSV / CST","aliases":["CSP","CSV","CST","循环同步位置模式","循环同步速度模式","循环同步力矩模式","周期同步位置模式"],"one_liner":"CiA 402 里主站每个通信周期发一次位置、速度或力矩设定值的三种模式。","explanation":"CiA 402 是 CAN in Automation 制定的 CANopen 电机驱动器行规（对应国际标准 IEC 61800-7-201），也通过 CoE 方式用在 EtherCAT 上，规定了驱动器的状态机和一组工作模式，用对象 0x6060 选择。周期同步模式的编号是 8、9、10：CSP 下主站每个周期发目标位置，驱动器内部闭合位置、速度、电流三个环；CSV 只发目标速度，位置环放在主站；CST 只发目标力矩，驱动器只管电流（力矩）环，其余都由主站计算。和轨迹位置模式（PP，编号 1）不同，这三种模式下轨迹由主站自己插补，驱动器不再生成轨迹，所以要求通信周期固定、各轴严格同步。机器人做阻抗控制、全身控制或让强化学习策略直接输出力矩时多用 CST；传统工业轨迹跟踪多用 CSP。","example":"假设用 EtherCAT 以 1 kHz 控制人形机器人的关节模组：驱动器设为 CST（0x6060 写 10）时，上位机每毫秒算出一个力矩写给驱动器；设为 CSP（写 8）时，每毫秒写一个插补好的目标位置。ROS 2 的 ethercat_driver_ros2 的 CiA 402 插件就支持在 8、9、10 等模式间切换。腿足圈常见的 MIT 模式则是另一套 CAN 私有协议，一条指令同时带目标位置、速度、刚度、阻尼和前馈力矩。","related":["CANopen / CiA 402 驱动协议","EtherCAT 总线","电机驱动器","力矩控制","串级控制","MIT 模式"]},{"id":"streaming-servo-control","category":"control","sec":1,"tier":3,"sources":[{"title":"Universal Robots 支持文章：servoj command","url":"https://www.universal-robots.com/articles/ur/programming/servoj-command/"},{"title":"睿尔曼 RM_API2 Python 接口（rm_movej_canfd / rm_movep_canfd 角度、位姿透传说明）","url":"https://github.com/RealManRobot/RM_API2/blob/main/Python/Robotic_Arm/rm_robot_interface.py"}],"as_of":"2026-09","related_ids":["movej-movel","rtde","control-frequency","trajectory-interpolation","real-time-control","visual-servoing"],"name":"透传控制","alt":"Streaming Servo Control (Pass-through Mode, e.g. UR servoj)","abbr":"","aliases":["角度透传","位姿透传","伺服模式","servoJ","流式伺服控制"],"one_liner":"上位机按固定周期逐点下发目标关节角或位姿，控制器不再规划、直接跟随。","explanation":"机械臂常见两种指令方式：MoveJ/MoveL 只给终点，由控制器自己规划整段轨迹；透传（也叫伺服模式、流式控制）由上位机按固定周期连续发送密集的目标点，控制器基本不做轨迹规划，收到就跟随。国内厂商常分为角度透传（发关节角）和位姿透传（发末端位姿，控制器先做逆解）。它适合目标在线变化的场景：视觉伺服、遥操作，以及 VLA 或强化学习策略实时输出动作。由于控制器不再帮你平滑，轨迹连续性和发送周期的稳定性都要由上位机负责，周期抖动或相邻点跳变过大会引起振动甚至触发保护，所以通常先把策略输出插值成高频平滑轨迹再下发。UR 的 servoj 是最常被引用的接口。","example":"UR 的 servoj(q, a, v, t, lookahead_time, gain) 要在每个时间步调用一次：e-Series 取 t=0.002 s（500 Hz），CB3 取 0.008 s；lookahead_time 取 0.03–0.2 s，用于平滑、减少超调；gain 取 100–2000，越大响应越快也越容易振动。睿尔曼机械臂的 rm_movej_canfd 在高跟随模式下要求透传周期不超过 10 ms。","related":["关节运动与直线运动（MoveJ / MoveL）","RTDE","控制频率","轨迹插值","实时控制","视觉伺服"]},{"id":"field-oriented-control","category":"control","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Vector control (motor)","url":"https://en.wikipedia.org/wiki/Vector_control_(motor)"},{"title":"SimpleFOC docs: FOC theory","url":"https://docs.simplefoc.com/foc_theory"}],"as_of":"","related_ids":["permanent-magnet-synchronous-motor","brushless-dc-motor","servo-drive","mit-mode","magnetic-encoder","torque-constant"],"name":"磁场定向控制","alt":"Field-Oriented Control","abbr":"FOC","aliases":["矢量控制","Vector control","磁场导向控制","场定向控制"],"one_liner":"把三相电流换到随转子旋转的坐标系里，分别控制产生磁通和产生力矩的电流。","explanation":"磁场定向控制又叫矢量控制，由达姆施塔特工业大学的 K. Hasse 和西门子的 F. Blaschke 在 1968 年到 70 年代初提出，现在是永磁同步电机、无刷电机的主流驱动方法，机器人关节模组的驱动器普遍采用。电机的三相电流是交流量，直接调节很难。FOC 先用 Clarke 变换把三相换成两相静止坐标（α、β），再用 Park 变换按转子电角度旋转到随转子转动的 d-q 坐标：d 轴电流 i_d 产生与永磁体同向的磁通，q 轴电流 i_q 产生力矩，两者都变成直流量，各用一个 PI 控制器调节。对永磁电机通常令 i_d = 0，力矩约等于力矩常数 K_t 乘以 i_q。因此 FOC 需要实时知道转子角度，一般靠编码器，也可用无感观测器估算。与方波六步换相相比，它的力矩更平稳；与 V/f 标量控制相比，动态性能更好。","example":"足式机器人常用的准直驱关节：上位机按 MIT 模式发来目标位置、速度、刚度、阻尼和前馈力矩，驱动器算出期望力矩 τ，除以 K_t 得到 i_q 指令并令 i_d = 0，然后在高频电流环里完成 Clarke/Park 变换、PI 调节、反变换和 PWM 输出三相电压。开源的 SimpleFOC 库实现的也是这套流程。","related":["永磁同步电机","无刷直流电机","电机驱动器","MIT 模式","磁编码器","力矩常数（Kt）"]},{"id":"gravity-compensation","category":"control","sec":1,"tier":2,"sources":[{"title":"Modern Robotics 11.5: Force Control（τ = g(θ) + JᵀF_tip，含重力模型）","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/11-5-force-control/"},{"title":"Modern Robotics 11.4: Motion Control with Torque or Force Inputs (Part 3 of 3)","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/11-4-motion-control-with-torque-or-force-inputs-part-3-of-3/"},{"title":"libfranka robot.h（joint-level torque commands without gravity and friction）","url":"https://github.com/frankaemika/libfranka/blob/master/include/franka/robot.h"}],"as_of":"","related_ids":["zero-force-drag","proportional-derivative-control","feedforward-control","computed-torque-control","kinesthetic-teaching","friction-compensation"],"name":"重力补偿","alt":"Gravity Compensation","abbr":"","aliases":["重力补偿模式","重力矩补偿","Gravity Comp"],"one_liner":"按模型算出托住机器人自重所需的关节力矩并提前加上，让手臂不因重力下垂。","explanation":"机械臂每个关节都要持续出力托住后面连杆的重量，所需力矩随姿态变化，记作 g(q)（q 为关节角）。重力补偿就是用各连杆质量、质心等模型参数实时算出 g(q)，作为前馈量（不等误差出现就提前给出的量）加到控制输出上。只用 PD 控制时，要靠残留的位置误差才能产生抵抗重力的力矩，末端会略微下垂，加上重力补偿即可消除。若只输出 g(q)、不加位置反馈，手臂能停在任意位置，人一推就动，这就是协作臂的重力补偿模式，也是拖动示教的基础。装了夹爪或抓着重物时要把负载质量和质心告诉控制器，否则补偿不准。","example":"Franka 机械臂的 libfranka 接口里，用户发送的关节力矩指令不含重力和摩擦项，由控制器内部补上；其模型库的 gravity() 函数算重力矩时要传入末端负载的质量和质心位置。","related":["零力拖动","PD 控制","前馈控制","计算力矩控制","拖动示教","摩擦补偿"]},{"id":"friction-compensation","category":"control","sec":1,"tier":3,"sources":[{"title":"Bona & Indri, Friction Compensation in Robotics: an Overview (CDC-ECC 2005)","url":"https://skoge.folk.ntnu.no/prost/proceedings/cdc-ecc05/pdffiles/papers/0934.pdf"},{"title":"BME Robot Applications, Chapter 8: Models of Friction","url":"https://www.mogi.bme.hu/TAMOP/robot_applications/ch07.html"}],"as_of":"","related_ids":["gravity-compensation","feedforward-control","zero-force-drag","coulomb-friction","static-friction-and-stribeck-effect","system-identification"],"name":"摩擦补偿","alt":"Friction Compensation","abbr":"","aliases":["摩擦力补偿"],"one_liner":"估算关节里的摩擦力矩，提前加进控制指令把它抵消掉。","explanation":"关节里的电机、减速器和轴承都有摩擦，会让机器人低速时跟不准、换向时卡顿（黏滑）；Bona 与 Indri 2005 年的综述指出它对工业机器人尤其关键。最常用的模型是 τ_f = F_c·sgn(q̇) + F_v·q̇：F_c 为库仑摩擦，大小恒定、方向与运动相反；F_v 为黏性摩擦系数，力矩与关节速度 q̇ 成正比；更细的模型还会加 Stribeck 效应（起步时静摩擦偏大）或 LuGre 等动态模型。做法是先辨识这些参数，再把估计的摩擦力矩作为前馈叠加到电机指令上，或用观测器在线估计。它按模型主动抵消，不同于等误差出现后才纠正的积分项；零力拖动、无传感器力估计、执行器建模都离不开它。","example":"协作臂进入拖动示教模式时，控制器在重力补偿之外再补上各关节估计的摩擦力矩，人推机械臂时才会感觉轻而均匀，不会一顿一顿。","related":["重力补偿","前馈控制","零力拖动","库仑摩擦","静摩擦与 Stribeck 效应","系统辨识"]},{"id":"zero-force-drag","category":"control","sec":1,"tier":2,"sources":[{"title":"libfranka robot.h（setGuidingMode：Guiding mode can be enabled by pressing the two opposing buttons near the robot's flange）","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/robot.h"},{"title":"Universal Robots ROS 2 Driver: ur_controllers 文档（FreedriveModeController / ForceModeController）","url":"https://github.com/UniversalRobots/Universal_Robots_ROS2_Driver/blob/main/ur_controllers/doc/index.rst"},{"title":"Enabling Scalable Kinesthetic Teaching via Observer-based Hand-guiding with Active Support (arXiv:2608.10847)","url":"https://arxiv.org/abs/2608.10847"}],"as_of":"2026-09","related_ids":["kinesthetic-teaching","gravity-compensation","friction-compensation","admittance-control","joint-torque-sensor","demonstration-data"],"name":"零力拖动","alt":"Zero-Force Drag (Free-Drive / Hand Guiding Mode)","abbr":"","aliases":["拖动模式","自由驱动模式","零力控制","手动引导","Hand guiding","Freedrive","Guiding mode"],"one_liner":"让机械臂抵消自身重力和摩擦，人用很小的力就能推着它走。","explanation":"零力拖动是协作机械臂的一种手动引导模式，UR 叫 Freedrive，Franka 叫 Guiding mode。开启后，控制器实时输出抵消自身重力（重力补偿）和关节摩擦（摩擦补偿）所需的力矩，机械臂像失重一样停在原处，人轻轻一推就跟着动。实现大致有三种：带关节力矩传感器的臂直接在力矩模式下做补偿；不少没有力矩传感器的协作臂靠电机电流估计外力；传统工业臂则在腕部装六维力传感器，用导纳控制把测到的力换成运动。它最主要的用途是拖动示教：人手把手带着机械臂做一遍动作，控制器记下轨迹或存成演示数据。「零力」指人需要施加的力接近零，并不是电机不出力。","example":"Franka 机械臂按住法兰附近两个相对的按钮即可进入引导模式，libfranka 的 setGuidingMode 还能只放开部分方向（比如只允许平移、锁住转动）；UR 的 ROS 2 驱动提供 freedrive_mode_controller，需要持续发布 True 消息，默认 1 秒收不到就自动退出。","related":["拖动示教","重力补偿","摩擦补偿","导纳控制","关节力矩传感器","演示数据"]},{"id":"system-identification","category":"control","sec":1,"tier":2,"sources":[{"title":"Wikipedia: System identification","url":"https://en.wikipedia.org/wiki/System_identification"},{"title":"Learning agile and dynamic motor skills for legged robots（执行器网络）","url":"https://arxiv.org/abs/1901.08652"}],"as_of":"","related_ids":["dynamic-parameter-identification","actuator-modeling","sim-to-real-gap","domain-randomization","real-to-sim","inertial-parameters"],"name":"系统辨识","alt":"System Identification","abbr":"SysID","aliases":["系统辨识建模","模型辨识","参数辨识"],"one_liner":"用实测的输入输出数据，反推出系统的数学模型和参数。","explanation":"系统辨识是根据实测的输入、输出数据，用统计方法建立动态系统数学模型的学问，也包括如何设计实验以采到信息量足的数据。按先验知识多少分三类：白箱（完全由物理定律推导）、灰箱（结构已知、参数靠数据拟合，如辨识连杆质量、惯量和关节摩擦）、黑箱（只拟合输入输出关系，如用神经网络）。在具身智能里它是缩小虚实差距的主要手段之一：把真机测得的参数写回仿真器，或学一个模型补上仿真缺失的部分。Hwangbo 等人 2019 年在 ANYmal 上先辨识机器人物理参数，再用真机数据训练执行器网络来模拟电机与底层软件的动态。它和域随机化互补：前者让仿真更准，后者让策略对剩余误差更鲁棒。","example":"给机器人某个关节施加正弦扫频力矩，记录角度和角速度，用最小二乘拟合出转动惯量、黏性摩擦和库仑摩擦系数，再写回 MuJoCo 模型，让仿真里同一指令下的关节轨迹与真机对齐。","related":["动力学参数辨识","执行器建模","虚实差距","域随机化","现实到仿真","惯性参数"]},{"id":"computed-torque-control","category":"control","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Computed torque control","url":"https://en.wikipedia.org/wiki/Computed_torque_control"},{"title":"Pinocchio rnea.hpp（computes the inverse dynamics, aka the joint torques）","url":"https://github.com/stack-of-tasks/pinocchio/blob/master/include/pinocchio/algorithm/rnea.hpp"}],"as_of":"","related_ids":["inverse-dynamics","feedback-linearization","feedforward-control","gravity-compensation","operational-space-control","recursive-newton-euler-algorithm"],"name":"计算力矩控制","alt":"Computed Torque Control","abbr":"CTC","aliases":["逆动力学控制","Inverse dynamics control","计算转矩控制"],"one_liner":"用动力学模型算出所需力矩，抵消非线性后再做 PD 控制。","explanation":"计算力矩控制是经典的基于模型的机械臂运动控制方法，也叫逆动力学控制。机械臂动力学写作 τ = M(q)q̈ + C(q,q̇)q̇ + g(q)，M 是质量矩阵，C 项对应科氏力和离心力，g 是重力。控制律取 τ = M̂(q)(q̈_d + K_d·ė + K_p·e) + Ĉq̇ + ĝ，其中 q̈_d 是期望加速度，e 是期望与实际关节角之差，带帽的是模型估计值。模型准确时非线性项被抵消，误差满足 ë + K_d·ė + K_p·e = 0，每个关节变成互不耦合的线性二阶系统，按期望响应选增益即可。它是反馈线性化在机器人上的典型应用。和「PD + 重力补偿」相比，它还补偿惯性和科氏力，高速跟踪更准；代价是依赖准确的动力学参数，模型不准时性能下降，于是有了自适应和鲁棒版本。任务空间的对应做法是操作空间控制。","example":"用 Pinocchio 的 rnea（递归牛顿-欧拉算法）函数，把当前 q、q̇ 和「期望加速度 + PD 修正项」作为加速度输入，一次调用就能算出计算力矩控制所需的关节力矩。","related":["逆动力学","反馈线性化","前馈控制","重力补偿","操作空间控制","递归牛顿-欧拉算法"]},{"id":"feedback-linearization","category":"control","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Feedback linearization","url":"https://en.wikipedia.org/wiki/Feedback_linearization"}],"as_of":"","related_ids":["computed-torque-control","inverse-dynamics","hybrid-zero-dynamics","operational-space-control","mass-matrix","lyapunov-stability"],"name":"反馈线性化","alt":"Feedback Linearization","abbr":"","aliases":["反馈线性化控制","精确线性化","输入-输出线性化","Exact Linearization"],"one_liner":"用状态反馈把非线性项精确抵消，让系统变成线性系统后再设计控制器。","explanation":"反馈线性化是非线性控制的基本方法：设计控制律 u = a(x) + b(x)·v，其中 a、b 由系统模型算出，用来把非线性项精确抵消，再配合坐标变换，使新输入 v 到输出之间变成简单的线性关系（常见是几个积分器串联），然后就能用 PD、极点配置等线性方法来设计 v。它和常见的「在工作点附近做泰勒展开（雅可比线性化）」不同：后者只是近似，只在工作点附近有效；反馈线性化是精确变换，适用范围大得多，但前提是模型准确，模型有误差时抵消不干净，鲁棒性差。机械臂的计算力矩控制就是它的特例。只让输出变线性时，剩下看不见的内部动态叫零动态，必须是稳定的；双足行走的混合零动态（HZD）控制就建立在这种输入-输出线性化之上。","example":"机械臂动力学 M(q)q̈ + C(q, q̇)q̇ + g(q) = τ（M 是质量矩阵，C 项是科里奥利力和离心力，g 是重力，τ 是关节力矩）。取 τ = M(q)v + C(q, q̇)q̇ + g(q) 代入，得到 q̈ = v，每个关节变成独立的双积分器；再令 v = q̈_d + K_d(q̇_d − q̇) + K_p(q_d − q)，跟踪误差就按线性二阶系统收敛。","related":["计算力矩控制","逆动力学","混合零动态","操作空间控制","质量矩阵","李雅普诺夫稳定性"]},{"id":"disturbance-observer","category":"control","sec":1,"tier":3,"sources":[{"title":"Sariyildiz, Oboe, Ohnishi: Disturbance Observer-based Robust Control and Its Applications: 35th Anniversary Overview (arXiv:1902.09032)","url":"https://arxiv.org/abs/1902.09032"},{"title":"Hyungbo Shim: Disturbance Observer (arXiv:2101.02859)","url":"https://arxiv.org/abs/2101.02859"}],"as_of":"","related_ids":["state-observer","generalized-momentum-observer","active-disturbance-rejection-control","sensorless-force-estimation","robust-control","friction-compensation"],"name":"扰动观测器","alt":"Disturbance Observer","abbr":"DOB","aliases":["干扰观测器","DOb","DOBC","基于扰动观测器的控制"],"one_liner":"用名义模型反推出摩擦、负载等未知扰动，再在控制输入里把它抵消掉。","explanation":"扰动观测器是运动控制里最常用的鲁棒控制工具之一，由大西公平（Kouhei Ohnishi）等人在 1983 年提出。思路是把摩擦、负载变化、模型参数误差和外力统统合成一个「集总扰动」，用简单的名义模型反推出来。以电机为例，名义上 J·θ̈ = K_t·i（J 是转动惯量，θ̈ 是角加速度，K_t 是力矩常数，i 是电流），实测的加速度和电流对不上，差出来的就是扰动力矩；再过一个低通滤波器得到估计值（截止频率决定估计带宽，太高会放大噪声），加回电流指令里抵消掉。这样被控对象表现得接近名义模型：外环 PD 只管跟踪性能，鲁棒性交给 DOB，两者可分开调。机器人碰撞检测用的动量观测器、自抗扰控制里的扩张状态观测器，思路都与它相近。","example":"给关节电机加 DOB、外面套 PD 位置环：机械臂末端从空载变成挂上重物时，DOB 很快估计出多出来的负载力矩并补进电流指令，位置误差基本不受影响。把估计值里已知的重力、摩擦项扣掉，剩下的部分还能当作外力估计，这是不装力传感器做力控和碰撞检测的常见做法。","related":["状态观测器","动量观测器","自抗扰控制","无传感器力估计","鲁棒控制","摩擦补偿"]},{"id":"active-disturbance-rejection-control","category":"control","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Active disturbance rejection control","url":"https://en.wikipedia.org/wiki/Active_disturbance_rejection_control"},{"title":"Han J. From PID to Active Disturbance Rejection Control. IEEE Transactions on Industrial Electronics, 2009","url":"https://doi.org/10.1109/TIE.2008.2011621"},{"title":"Herbst G. Transfer Function Analysis and Implementation of Active Disturbance Rejection Control (arXiv:2011.01044)","url":"https://arxiv.org/abs/2011.01044"}],"as_of":"","related_ids":["proportional-integral-derivative-control","disturbance-observer","state-observer","robust-control","adaptive-control"],"name":"自抗扰控制","alt":"Active Disturbance Rejection Control","abbr":"ADRC","aliases":["自抗扰控制器","线性自抗扰控制","LADRC","扩展状态观测器控制"],"one_liner":"把模型误差和外部干扰合成「总扰动」，实时估计出来再抵消的控制方法。","explanation":"自抗扰控制由中国学者韩京清在 1990 年代提出，2009 年以英文论文《From PID to Active Disturbance Rejection Control》系统介绍。它不追求精确建模，只需知道系统阶数和控制增益的大致值 b₀，把未建模动力学、参数变化、外力等统统看作一个「总扰动」f，当成额外状态交给扩展状态观测器（ESO，一种根据输入输出估计内部状态的算法）实时估出，再在控制量里减掉：u = (u₀ − f̂) / b₀。抵消后对象近似变成积分器串联，用简单的 PD 就能控好。原始版本还含跟踪微分器和非线性反馈；后来常用的线性 ADRC 只需调观测器带宽和控制器带宽，这种按带宽整定的思路来自 Zhiqiang Gao 2003 年的工作。它与扰动观测器思路相近，但后者通常需要名义模型；与自适应控制的区别是不去估计具体参数。","example":"关节电机换了负载、摩擦随温度变化时，PID 往往要重新调参；ADRC 把这些变化都算进总扰动由 ESO 估计补偿，线性版本主要只调观测器带宽 ω_o 和控制器带宽 ω_c 两个参数。","related":["PID 控制","扰动观测器","状态观测器","鲁棒控制","自适应控制"]},{"id":"adaptive-control","category":"control","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Adaptive control","url":"https://en.wikipedia.org/wiki/Adaptive_control"},{"title":"Slotine J.-J. E., Li W. On the Adaptive Control of Robot Manipulators. IJRR, 1987","url":"https://doi.org/10.1177/027836498700600303"}],"as_of":"","related_ids":["robust-control","computed-torque-control","dynamic-parameter-identification","system-identification","rapid-motor-adaptation","active-disturbance-rejection-control"],"name":"自适应控制","alt":"Adaptive Control","abbr":"","aliases":["模型参考自适应控制","MRAC","自校正控制","Self-tuning control"],"one_liner":"运行中在线估计未知或变化的参数，并据此自动调整控制器。","explanation":"自适应控制指控制器在运行中根据实际响应在线估计未知或变化的参数，并随之调整自己，基础是参数估计。常见形式有模型参考自适应控制（MRAC，让系统去跟随一个理想参考模型的响应）和自校正控制，又分直接法（直接调控制器参数）和间接法（先估对象参数再算控制器）。它和鲁棒控制的区别：鲁棒控制事先给参数变化划定范围，用一套固定控制器扛住最坏情况；自适应控制不需要预知范围，边运行边修正。机器人里的经典是 Slotine 与 Li 1987 年的算法：PD 反馈加完整动力学前馈，负载等未知参数在线估计；它利用机械臂动力学的结构，不需测关节加速度，也不用对估计的质量矩阵求逆。强化学习运控里的快速运动适应（RMA）是用学习方法做类似的事。","example":"机械臂抓起一个质量未知的工件，按旧模型算力矩的控制器会出现跟踪误差；自适应控制器根据误差在线更新负载质量等参数，重复几次运动后误差逐渐减小。","related":["鲁棒控制","计算力矩控制","动力学参数辨识","系统辨识","快速运动适应","自抗扰控制"]},{"id":"robust-control","category":"control","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Robust control","url":"https://en.wikipedia.org/wiki/Robust_control"},{"title":"Wikipedia: H-infinity methods in control theory","url":"https://en.wikipedia.org/wiki/H-infinity_methods_in_control_theory"}],"as_of":"","related_ids":["adaptive-control","sliding-mode-control","lyapunov-stability","disturbance-observer","active-disturbance-rejection-control","domain-randomization"],"name":"鲁棒控制","alt":"Robust Control","abbr":"","aliases":["稳健控制"],"one_liner":"在模型不准、参数有界变化和外部扰动下，仍保证稳定和性能的控制设计方法。","explanation":"鲁棒控制是 1970 年代末起成形的一类控制理论，核心是在设计阶段就明确承认模型有误差：先给出不确定性的范围，比如负载质量在某个区间内、存在未建模的柔性或摩擦，再设计一个固定的控制器，保证范围内任何情况都稳定、性能不低于某个下限。代表方法有 Zames 等人开创的 H∞ 控制（让扰动对输出的最坏影响最小）、滑模控制等。它和自适应控制的区别是：鲁棒控制器参数固定，靠留余量扛住不确定性；自适应控制边运行边估计参数、调整控制器。代价是设计往往偏保守，也需要一个大致准确的模型。机器人上，负载变化、关节摩擦、地面软硬不同都是典型的不确定性；强化学习里用域随机化训练对参数变化不敏感的策略，追求的也是类似的鲁棒性。","example":"机械臂要搬 0–3 kg 之间任意重量的工件：鲁棒控制按「负载可能是区间内任意值」一次设计好控制器，保证每种情况都稳定、跟踪误差不超过界限；自适应控制则在抓起后在线估计实际质量，再调整控制参数。","related":["自适应控制","滑模控制","李雅普诺夫稳定性","扰动观测器","自抗扰控制","域随机化"]},{"id":"sliding-mode-control","category":"control","sec":1,"tier":3,"sources":[{"title":"Sliding mode control - Wikipedia","url":"https://en.wikipedia.org/wiki/Sliding_mode_control"},{"title":"Variable structure control - Wikipedia","url":"https://en.wikipedia.org/wiki/Variable_structure_control"}],"as_of":"","related_ids":["robust-control","adaptive-control","lyapunov-stability","feedback-linearization","active-disturbance-rejection-control","disturbance-observer"],"name":"滑模控制","alt":"Sliding Mode Control","abbr":"SMC","aliases":["滑模变结构控制","滑动模态控制"],"one_liner":"用切换控制把状态强行压到预设的「滑模面」上并沿它滑向目标，抗扰能力强。","explanation":"滑模控制属于变结构控制，20 世纪 50 年代初由苏联学者 Emelyanov 等开始研究，后经 Utkin 等人系统化。先设计滑模面，如用跟踪误差 e 构造 s = ė + λe（λ>0）：一旦 s=0，误差就按 e(0)·exp(−λt) 衰减到零。控制律由等效控制（按名义模型维持在面上）和切换项 −k·sign(s)（偏离时强行推回）组成，先到达滑模面，再沿面滑动。只要 k 大于扰动上界，从控制通道进入的扰动和模型误差都不改变滑动阶段的行为，所以比 PID、计算力矩控制更鲁棒。代价是抖振：执行器延迟和离散采样让 sign 来回切换，产生高频抖动，常用边界层（把 sign 换成饱和函数）或超螺旋等高阶滑模缓解。","example":"负载未知的机械臂关节做位置跟踪：取 s = ė + λe，力矩 τ = τ_eq − k·sat(s/φ)。τ_eq 是按名义模型算出的力矩，k 取得足以覆盖摩擦和负载误差的上界，sat 是饱和函数，φ 是边界层厚度，用来抑制抖振。","related":["鲁棒控制","自适应控制","李雅普诺夫稳定性","反馈线性化","自抗扰控制","扰动观测器"]},{"id":"task-space-control","category":"control","sec":2,"tier":2,"sources":[{"title":"Lynch & Park, Modern Robotics (2017 preprint), 11.3.3 / 11.4.3 Task-Space Motion Control","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Khatib, A unified approach for motion and force control of robot manipulators: The operational space formulation (IEEE J. Robotics & Automation, 1987)","url":"https://doi.org/10.1109/JRA.1987.1087068"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion（附录 Franka Robot Station）","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["task-space","joint-space-control","operational-space-control","jacobian-pseudoinverse","inverse-kinematics","cartesian-impedance-control"],"name":"任务空间控制","alt":"Task-Space Control","abbr":"","aliases":["笛卡尔空间控制","末端控制","Cartesian-space control","Cartesian control"],"one_liner":"以末端执行器的位置和姿态为目标来算误差、下指令的控制方式。","explanation":"任务空间控制把目标写在末端执行器（夹爪、工具）的位姿上，而不是每个关节的角度上：给定期望末端轨迹，算出实际末端与它的偏差，再换算成关节指令。换算常见两条路。速度层面用雅可比矩阵 J（关节速度到末端速度的映射）的伪逆：θ̇ = J⁺(θ)·V，θ̇ 是关节速度，V 是期望末端速度。力矩层面用 τ = Jᵀ(θ)·F，把末端要施加的力 F 换成关节力矩 τ；Khatib 1987 年提出的操作空间控制属于这一类，还计入了末端的等效惯量。它比关节空间控制更贴合「把杯子移到这里」这类任务描述；代价是要处理奇异位形（某些方向突然动不了）和冗余自由度。","example":"Diffusion Policy 的 Franka 实验台：策略以 10 Hz 输出期望末端位姿，中层控制器约 1 kHz 运行，每步解一个二次规划，求出能让末端跟上目标速度的关节速度，积分成关节位置后交给机械臂自带的关节控制器；避碰和关节限位写成约束，多出来的自由度放在零空间里调节。","related":["任务空间","关节空间控制","操作空间控制","雅可比伪逆","逆运动学","笛卡尔阻抗控制"]},{"id":"operational-space-control","category":"control","sec":2,"tier":2,"sources":[{"title":"Lynch & Park, Modern Robotics（§8.6 Dynamics in the Task Space；引 Khatib 1987, IEEE J. Robotics and Automation 3(1):43–53）","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"robosuite Docs: Controllers（OSC_POSE）","url":"https://robosuite.ai/docs/modules/controllers.html"}],"as_of":"","related_ids":["task-space-control","impedance-control","jacobian-matrix","null-space-control","mass-matrix","whole-body-control"],"name":"操作空间控制","alt":"Operational Space Control","abbr":"OSC","aliases":["操作空间公式","Operational Space Formulation","OSC_POSE","任务空间动力学控制"],"one_liner":"直接在末端空间算期望加速度和力，再用动力学换成关节力矩的控制方法。","explanation":"操作空间控制由斯坦福的 Oussama Khatib 于 1987 年提出。它把机械臂动力学改写到末端所在的「操作空间」：F = Λ(q)·ẍ + η，其中 ẍ 是末端加速度，Λ 是末端感受到的等效惯量矩阵，η 汇总科里奥利力、重力等项，F 是末端要施加的力和力矩。控制器先按位姿误差用 PD 算出期望 ẍ，代入得 F，再用 τ = Jᵀ·F（J 为雅可比矩阵）换成关节力矩。好处是能直接在末端空间设刚度和阻尼，同时补偿机械臂自身惯性。和「逆运动学 + 关节位置控制」不同，它直接输出力矩，因此需要较准的动力学模型。仿真框架 robosuite 的 OSC_POSE 控制器就是它的实现。","example":"在 robosuite 里用 OSC_POSE 控制 Panda 机械臂，策略每步只输出末端的位移增量和轴角旋转增量，控制器内部换算成 7 个关节的力矩。","related":["任务空间控制","阻抗控制","雅可比矩阵","零空间控制","质量矩阵","全身控制"]},{"id":"force-control","category":"control","sec":2,"tier":1,"sources":[{"title":"Wikipedia: Force control","url":"https://en.wikipedia.org/wiki/Force_control"}],"as_of":"","related_ids":["impedance-control","admittance-control","hybrid-force-position-control","six-axis-force-torque-sensor","joint-torque-sensor","contact-rich-manipulation"],"name":"力控","alt":"Force Control","abbr":"","aliases":["力控制","力觉控制"],"one_liner":"以接触力为控制目标，让机器人按指定的力去推、压、贴合物体。","explanation":"力控指控制机器人对物体或环境施加多大的力，而不只是让它走到某个位置。纯位置控制遇到偏差会不断加大电流去追目标位置，碰到比预想更高的表面就可能压坏工件；力控则让接触力保持在设定值附近。实现上分两类：直接力控把目标力当作反馈回路的设定值，典型是力位混合控制，按方向划分哪些轴控力、哪些轴控位置；间接力控即阻抗控制和导纳控制，通过设定刚度、阻尼、惯量来决定机器人被推时有多「软」。力控需要知道实际受力，靠末端六维力传感器、关节力矩传感器或电机电流估算。打磨、装配、擦桌子、插插头这类接触丰富的任务都离不开它。","example":"机械臂擦白板：用位置控制时，高度差几毫米就会擦不到或压得太重；改用力控，把垂直板面方向的压力设成定值，板面不平也能一直贴着擦。","related":["阻抗控制","导纳控制","力位混合控制","六维力传感器","关节力矩传感器","接触丰富操作"]},{"id":"compliance-control","category":"control","sec":2,"tier":2,"sources":[{"title":"Wikipedia: Force control（passive / active compliance）","url":"https://en.wikipedia.org/wiki/Force_control"},{"title":"Wikipedia: Impedance control","url":"https://en.wikipedia.org/wiki/Impedance_control"},{"title":"Hogan, Impedance Control: An Approach to Manipulation, Part I (1985)","url":"https://doi.org/10.1115/1.3140702"}],"as_of":"","related_ids":["impedance-control","admittance-control","hybrid-force-position-control","compliance","remote-center-compliance-device","series-elastic-actuator"],"name":"柔顺控制","alt":"Compliance Control","abbr":"","aliases":["顺应控制","Compliant control","主动柔顺控制"],"one_liner":"让机器人接触环境时不硬顶、能按设定程度顺着外力让步的一类控制方法。","explanation":"柔顺控制是让机器人接触环境时能按设定程度顺应外力的一类方法的统称。纯位置控制的机械臂很「硬」：轴孔装配时差一点就可能卡死或压坏零件。柔顺分两类。被动柔顺靠机械结构，如装在手腕上的远中心柔顺装置（RCC）、串联弹性驱动器里的弹簧，不需要传感和计算，但特性做好后改不了。主动柔顺靠力或力矩测量加反馈控制，常见形式有阻抗控制（让机器人表现得像一个参数可调的质量-弹簧-阻尼系统）、导纳控制（测力后修正位置指令）和力位混合控制（一部分方向控力、另一部分方向控位置），参数可以随任务调整。Hogan 1985 年指出只控位置或只控力都不够，应控制两者之间的动态关系，这是主动柔顺的理论基础。打磨、装配、擦桌子、人机协作都离不开它。","example":"轴孔装配时，机械臂沿插入方向保持位置控制，垂直方向把刚度调低：轴碰到孔边被侧向推开后顺势滑进孔里，而不是卡住或把零件压坏。","related":["阻抗控制","导纳控制","力位混合控制","柔顺性","远中心柔顺装置（RCC）","串联弹性驱动器"]},{"id":"impedance-control","category":"control","sec":2,"tier":2,"sources":[{"title":"Hogan, Impedance Control: An Approach to Manipulation, Part I—Theory, J. Dyn. Sys., Meas., Control 107 (1985)","url":"https://doi.org/10.1115/1.3140702"},{"title":"Wikipedia: Impedance control","url":"https://en.wikipedia.org/wiki/Impedance_control"},{"title":"libfranka examples/cartesian_impedance_control.cpp","url":"https://github.com/frankaemika/libfranka/blob/master/examples/cartesian_impedance_control.cpp"}],"as_of":"","related_ids":["admittance-control","cartesian-impedance-control","joint-impedance-control","variable-impedance-control","hybrid-force-position-control","mass-spring-damper-system"],"name":"阻抗控制","alt":"Impedance Control","abbr":"","aliases":["Impedance controller","阻抗控制器"],"one_liner":"让机器人受力时像弹簧加阻尼器一样顺从，而不是硬顶着目标位置不放。","explanation":"MIT 的 Neville Hogan 于 1984–1985 年系统提出。纯位置控制碰到桌面或人会硬顶到底，纯力控制又没法在空中跟踪轨迹。阻抗控制规定的是力和运动偏差的关系，常见形式为 F = K(x_d − x) + D(ẋ_d − ẋ)：x_d 为期望位置，x 为实际位置，K 为刚度（偏离 1 米产生多少牛的力），D 为阻尼（抑制晃动）。K 大则硬、跟踪准；K 小则软，碰到障碍只产生有限的力。它通常要求机器人能直接控制力矩；导纳控制方向相反，先测力再算位置修正，适合只收位置指令的工业臂。可在关节或笛卡尔空间实现，常用于擦拭、插孔装配和人机协作。","example":"libfranka 自带的笛卡尔阻抗示例把平移刚度设为 150 N/m、转动刚度 10 N·m/rad，阻尼取 2√K（临界阻尼）；运行后可以用手推动机械臂，松手后它会弹回原位。","related":["导纳控制","笛卡尔阻抗控制","关节阻抗控制","变阻抗控制","力位混合控制","质量-弹簧-阻尼系统"]},{"id":"admittance-control","category":"control","sec":2,"tier":2,"sources":[{"title":"ros2_controllers: Admittance Controller","url":"https://control.ros.org/master/doc/ros2_controllers/admittance_controller/doc/userdoc.html"},{"title":"Wikipedia: Impedance control","url":"https://en.wikipedia.org/wiki/Impedance_control"},{"title":"Hogan, Impedance Control: An Approach to Manipulation, Part I (1985)","url":"https://doi.org/10.1115/1.3140702"}],"as_of":"","related_ids":["impedance-control","compliance-control","six-axis-force-torque-sensor","zero-force-drag","force-control","position-control"],"name":"导纳控制","alt":"Admittance Control","abbr":"","aliases":["Admittance controller","导纳控制器"],"one_liner":"测到外力后按设定的质量-阻尼-弹簧关系算出该怎么动，再交给位置环执行。","explanation":"导纳控制是一种让机器人对外力「顺从」的交互控制方法，理论上源自 Hogan 1985 年阻抗控制论文中阻抗与导纳的对偶关系。它的输入是力、输出是运动：末端六维力传感器测到外力 F，控制器按 F = M·a + D·v + K·(x − x_d) 反算出机器人该如何移动（M、D、K 为虚拟质量、阻尼、刚度，x_d 为原定目标位置），再把修正后的位置或速度指令交给机器人自带的位置环。阻抗控制方向相反：输入位置偏差、输出力或力矩，要求关节能直接控力矩。因此导纳控制适合只开放位置接口、减速比大、本身很「硬」的工业臂；但接触很硬的环境时容易振荡。ROS 2 的 ros2_controllers 自带 admittance_controller，可以做零力拖动。","example":"在工业臂末端装六维力传感器，开启导纳控制并把刚度 K 设为 0：人手推末端，机器人顺着推力方向移动，松手后在阻尼作用下停住，这就是拖动示教的一种实现。","related":["阻抗控制","柔顺控制","六维力传感器","零力拖动","力控","位置控制"]},{"id":"hybrid-force-position-control","category":"control","sec":2,"tier":2,"sources":[{"title":"Raibert & Craig, Hybrid Position/Force Control of Manipulators, J. Dyn. Sys., Meas., Control 103 (1981)","url":"https://doi.org/10.1115/1.3139652"},{"title":"Modern Robotics 11.6: Hybrid Motion-Force Control","url":"https://modernrobotics.northwestern.edu/nu-gm-book-resource/11-6-hybrid-motion-force-control/"}],"as_of":"","related_ids":["impedance-control","force-control","admittance-control","task-space-control","constant-force-control","contact-rich-manipulation"],"name":"力位混合控制","alt":"Hybrid Force/Position Control","abbr":"","aliases":["力位混控","混合力/位控制","Hybrid position/force control","混合运动-力控制","Hybrid Motion-Force Control"],"one_liner":"接触任务中把方向拆开：受约束的方向控力，自由的方向控位置。","explanation":"Raibert 和 Craig 1981 年提出。机器人接触物体时，环境会限制某些方向的运动，比如擦白板时板擦不能穿进板面，却能在板面内滑动。做法是在任务坐标系里用对角元为 1 或 0 的选择矩阵 S 把 6 个方向分成两组：S 选中的方向跟踪期望位置，其余方向（I−S）跟踪期望接触力，两路输出合成后换算成关节力矩。它要求预先知道约束方向，法线估错会压出很大的力。阻抗控制则不划分方向，在所有方向上规定力和位置偏差的关系。电机厂商说的「力位混控模式」多指单关节的 MIT 模式，与此不同。","example":"擦白板：板面内的 x、y 方向做位置控制，按轨迹移动板擦；垂直板面的 z 方向做力控制，保持恒定的压紧力。","related":["阻抗控制","力控","导纳控制","任务空间控制","恒力控制","接触丰富操作"]},{"id":"constant-force-control","category":"control","sec":2,"tier":3,"sources":[{"title":"Seraji H., Colbaugh R. Force Tracking in Impedance Control. IJRR, 1997","url":"https://doi.org/10.1177/027836499701600107"},{"title":"Universal Robots ROS 2 Driver: ForceModeController 文档","url":"https://github.com/UniversalRobots/Universal_Robots_ROS2_Driver/blob/main/ur_controllers/doc/index.rst"}],"as_of":"","related_ids":["force-control","impedance-control","admittance-control","hybrid-force-position-control","six-axis-force-torque-sensor","contact-rich-manipulation"],"name":"恒力控制","alt":"Constant Force Control (Force Tracking)","abbr":"","aliases":["力跟踪控制","恒力跟踪","恒力打磨","Force tracking control"],"one_liner":"让机器人末端对接触面保持设定的恒定压力，比如持续压 10 牛。","explanation":"恒力控制也叫力跟踪控制，指让末端与环境之间的接触力跟随一个设定值，常用于打磨、抛光、去毛刺、擦拭和超声扫查等需要稳定压力的任务。难点在于环境的位置和刚度往往不准：纯位置控制下，工件位置差 1 毫米，压在硬表面上的力就可能差很多。常见做法有：直接对力误差做 PI 控制（显式力控）；力位混合控制，法向控力、切向控位置；在阻抗或导纳控制外面再套一层力环，按力误差在线修正参考位置，Seraji 和 Colbaugh 1997 年就用自适应方法做到了在环境刚度和位置都未知时跟踪期望力。它和普通阻抗控制的区别是：阻抗控制只规定「偏多少、出多少力」，实际接触力取决于环境；恒力控制以力本身为目标。通常需要六维力传感器或关节力矩传感器测力。","example":"UR 机械臂的 Force Mode 可在任务坐标系里把 z 轴设为柔顺轴并给定目标力（如向下 10 N），x、y 方向照常按程序走位置，从而沿平面移动时保持恒定压力；UR 文档特别说明它不是导纳控制，被设为力控的方向会覆盖该方向的运动指令。","related":["力控","阻抗控制","导纳控制","力位混合控制","六维力传感器","接触丰富操作"]},{"id":"joint-impedance-control","category":"control","sec":2,"tier":3,"sources":[{"title":"Impedance control - Wikipedia","url":"https://en.wikipedia.org/wiki/Impedance_control"},{"title":"libfranka robot.h（setJointImpedance / ControllerMode::kJointImpedance）","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/robot.h"},{"title":"franka_ros joint_impedance_example_controller.cpp","url":"https://github.com/frankaemika/franka_ros/blob/develop/franka_example_controllers/src/joint_impedance_example_controller.cpp"}],"as_of":"","related_ids":["impedance-control","cartesian-impedance-control","admittance-control","torque-control","proportional-derivative-control","gravity-compensation"],"name":"关节阻抗控制","alt":"Joint Impedance Control","abbr":"","aliases":["关节空间阻抗控制","Joint-space Impedance Control"],"one_liner":"让机器人每个关节表现得像弹簧加阻尼器，被推时顺从让开而不是硬顶。","explanation":"阻抗控制由 MIT 的 Neville Hogan 在 1984–1985 年的论文中系统提出，目标不是死死跟住某个位置或力，而是规定机器人受外力时有多「软」。关节阻抗控制把这种弹簧-阻尼行为设在每个关节上，典型控制律是 τ = K(q_d − q) + D(q̇_d − q̇) + 重力与科氏力补偿，其中 τ 是关节力矩，q、q_d 是实际和期望关节角，K 是刚度，D 是阻尼。形式上像 PD 控制，区别在于它要求关节能直接输出力矩并补偿动力学，K 往往刻意调小，让机器人碰到人或物体时被推开，而不是硬顶。与之相近的笛卡尔阻抗控制把弹簧设在末端的 x、y、z 和姿态上，更直观地规定手在哪个方向软；导纳控制则反过来，先测外力再算出该怎么动，适合本身很硬的位置控制型机械臂。","example":"Franka 机械臂的内置控制器默认就是关节阻抗模式，libfranka 可用 setJointImpedance 设置各关节刚度；franka_ros 的示例控制器按「科氏补偿 + k·(q_d − q) + d·(q̇_d − q̇)」计算每个关节的指令力矩，让机械臂一边画圆一边保持柔顺。","related":["阻抗控制","笛卡尔阻抗控制","导纳控制","力矩控制","PD 控制","重力补偿"]},{"id":"cartesian-impedance-control","category":"control","sec":2,"tier":3,"sources":[{"title":"Hogan N. Impedance Control: An Approach to Manipulation: Part II—Implementation. ASME JDSMC, 1985","url":"https://doi.org/10.1115/1.3140713"},{"title":"franka_ros: cartesian_impedance_example_controller.cpp","url":"https://github.com/frankaemika/franka_ros/blob/develop/franka_example_controllers/src/cartesian_impedance_example_controller.cpp"},{"title":"Mayr, Salt-Ducaju. A C++ Implementation of a Cartesian Impedance Controller for Robotic Manipulators (arXiv:2212.11215)","url":"https://arxiv.org/abs/2212.11215"}],"as_of":"","related_ids":["impedance-control","joint-impedance-control","admittance-control","hybrid-force-position-control","null-space-control","operational-space-control"],"name":"笛卡尔阻抗控制","alt":"Cartesian Impedance Control","abbr":"","aliases":["任务空间阻抗控制","末端阻抗控制","Task-space impedance control"],"one_liner":"让机械臂末端像挂在弹簧阻尼上：被推会让开，松手会回位。","explanation":"阻抗控制由 Hogan 在 1984–1985 年提出，笛卡尔阻抗控制是它在任务空间（末端位姿空间）的形式：不硬锁末端位置，而是规定末端偏离目标时产生多大的回复力，F = K·e + D·ė，e 是目标位姿与实际位姿之差，K 是刚度（每偏 1 米回多少牛），D 是阻尼（抑制晃动）；再用雅可比转置换成关节力矩 τ = JᵀF，并补偿科氏力和重力。K 可按方向设置，比如插孔时让垂直于孔轴的方向软一些，便于自动对中。和关节阻抗控制相比，它的弹簧定义在末端而不是每个关节；和导纳控制相反，阻抗是「测位置、出力」，适合 Franka、KUKA iiwa 这类能直接控力矩的臂，导纳是「测力、出位置」，适合只接收位置指令的工业臂。7 自由度臂还会加零空间项管住多余的自由度。","example":"franka_ros 的笛卡尔阻抗示例控制器按 τ = Jᵀ(−K·e − D·J·q̇) + 零空间项 + 科氏力补偿 计算关节力矩，平移刚度默认 200 N/m：末端被推偏 1 厘米，约产生 2 N 的回复力，刚度可在运行时动态调节。","related":["阻抗控制","关节阻抗控制","导纳控制","力位混合控制","零空间控制","操作空间控制"]},{"id":"variable-impedance-control","category":"control","sec":2,"tier":3,"sources":[{"title":"Abu-Dakka, Saveriano: Variable Impedance Control and Learning—A Review (Frontiers in Robotics and AI, 2020)","url":"https://www.frontiersin.org/articles/10.3389/frobt.2020.590681/full"},{"title":"Martín-Martín et al.: Variable Impedance Control in End-Effector Space: An Action Space for RL in Contact-Rich Tasks (arXiv:1906.08880)","url":"https://arxiv.org/abs/1906.08880"}],"as_of":"","related_ids":["impedance-control","compliance-control","admittance-control","cartesian-impedance-control","force-aware-compliant-policy-learning","peg-in-hole-insertion"],"name":"变阻抗控制","alt":"Variable Impedance Control","abbr":"VIC","aliases":["可变阻抗控制","时变阻抗控制"],"one_liner":"让阻抗控制的刚度、阻尼随任务阶段或感知实时变化，该硬时硬、该软时软。","explanation":"阻抗控制让机器人末端表现得像弹簧加阻尼器：F = K(x_d − x) + D(ẋ_d − ẋ)，x_d 是期望位置，x 是实际位置，K 是刚度（越大越「硬」），D 是阻尼。普通阻抗控制的 K、D 固定；变阻抗控制让它们随时间、任务阶段或力觉反馈改变，思路来自人类会主动调节手臂刚度。这样能兼顾精度和安全：自由空间里调硬以准确跟踪，接触时调软以免顶坏物体。难点是刚度随时间变化可能向系统注入能量、破坏稳定，常用无源性理论和「能量罐」加以约束。K、D 可以手工设计、从示教中学，也可以作为强化学习的动作输出：2019 年的 VICES 让策略同时输出末端运动和阻抗增益，在擦拭、开门等接触丰富任务上比固定阻抗更省样本、更安全。Abu-Dakka 与 Saveriano 2020 年写过系统综述。","example":"轴孔装配：机械臂搬运销钉时用高刚度快速定位；销钉碰到孔口后调低横向刚度，让它顺着倒角滑进孔里，插入方向保持较高刚度继续推进。","related":["阻抗控制","柔顺控制","导纳控制","笛卡尔阻抗控制","力感知策略 / 柔顺策略学习","轴孔装配"]},{"id":"passivity-based-control","category":"control","sec":2,"tier":3,"sources":[{"title":"Borja & Ortega, Introduction to Passivity-Based Control (arXiv 2608.15222)","url":"https://arxiv.org/abs/2608.15222"},{"title":"Passivity-based control for haptic teleoperation of a legged manipulator in presence of time-delays (arXiv 2108.07658)","url":"https://arxiv.org/abs/2108.07658"},{"title":"Wikipedia: Passivity (engineering)","url":"https://en.wikipedia.org/wiki/Passivity_(engineering)"}],"as_of":"","related_ids":["impedance-control","lyapunov-stability","bilateral-teleoperation","computed-torque-control","gravity-compensation","physical-human-robot-interaction"],"name":"无源性控制","alt":"Passivity-Based Control","abbr":"PBC","aliases":["基于无源性的控制","无源控制"],"one_liner":"从能量角度设计控制器，让闭环系统只耗能、不凭空产生能量，从而稳定。","explanation":"无源性控制是一类从能量出发设计非线性控制器的方法，这个名称由 Ortega 和 Spong 在 1989 年关于刚性机械臂自适应控制的综述中提出。系统「无源」指它储存能量的增加不超过外界输入的能量：存在储能函数 H ≥ 0，使 dH/dt ≤ uᵀy，其中 u 是输入、y 是对应的输出（如力和速度），uᵀy 就是输入功率。两个无源系统按功率守恒方式连接后仍然无源，因此机器人与人、与未知环境接触时更容易保证稳定。设计通常分两步：能量整形，把闭环储能函数改造成在目标状态处取最小值；阻尼注入，加入耗能项让能量持续下降并停在目标处。它不靠把非线性全部抵消（计算力矩控制的做法），往往对模型误差更稳健。遥操作、阻抗控制、人机协作里常用「能量罐」记账，防止通信延迟或变刚度破坏无源性。","example":"ETH 的 Risiglione 等人（2021）给带机械臂的四足做力反馈遥操作：主从两端各设一个虚拟能量罐记录交换的能量，从端全身控制器把「罐内能量保持为正」作为约束，网络有延迟时整个回路仍保持无源、不致失稳。","related":["阻抗控制","李雅普诺夫稳定性","双边遥操作","计算力矩控制","重力补偿","物理人机交互"]},{"id":"force-aware-compliant-policy-learning","category":"control","sec":2,"tier":3,"sources":[{"title":"Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control (arXiv:2410.09309)","url":"https://arxiv.org/abs/2410.09309"},{"title":"FoAR: Force-Aware Reactive Policy for Contact-Rich Robotic Manipulation (arXiv:2411.15753)","url":"https://arxiv.org/abs/2411.15753"},{"title":"Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation (arXiv:2503.02881)","url":"https://arxiv.org/abs/2503.02881"}],"as_of":"2025-05","related_ids":["force-control","impedance-control","variable-impedance-control","contact-rich-manipulation","six-axis-force-torque-sensor","force-aware-vision-language-action-model"],"name":"力感知策略 / 柔顺策略学习","alt":"Force-aware / Compliant Policy Learning","abbr":"","aliases":["力觉策略","力感知操作策略","柔顺策略","Force-aware Policy","Compliance Policy"],"one_liner":"让学出来的操作策略感知接触力或输出刚度，接触时既贴得住又不用力过猛。","explanation":"这是让学习型操作策略处理接触力的一类方法的统称。常见的视觉运动策略（如扩散策略）只输出目标位置，交给刚性的位置控制器执行，一接触就容易用力过猛或贴不住。改进主要有两条路。一是「力感知」：把六维力/力矩传感器、触觉等信号作为输入，与图像融合后再出动作，例如上海交通大学卢策吾团队的 FoAR（2024）按预测的接触状态调节力信号的权重，同组的 RDP（2025）用低频扩散策略加高频触觉反馈回路，ForceVLA（2025）在 VLA 里加入力感知的混合专家模块。二是「柔顺」：让策略同时输出刚度等参数，交给阻抗或导纳类柔顺控制器执行，例如斯坦福与丰田研究院的自适应柔顺策略 ACP（2024）输出参考位姿、虚拟目标位姿和刚度。难点是多数遥操作系统没有力反馈，示教数据里很难得到合适的力和刚度标签。","example":"ACP 的擦花瓶任务：策略根据图像和力信号实时给出参考位姿、虚拟目标位姿和柔顺方向上的刚度，交给柔顺控制器执行，让机器人持续贴住弧形瓶面擦拭又不至于用力过大；论文报告在接触丰富任务上比只输出位置的视觉运动策略提升 50% 以上。","related":["力控","阻抗控制","变阻抗控制","接触丰富操作","六维力传感器","力觉 VLA"]},{"id":"visual-servoing","category":"control","sec":2,"tier":2,"sources":[{"title":"Chaumette & Hutchinson, Visual Servo Control Part I: Basic Approaches (IEEE RAM, 2006)","url":"https://www.irisa.fr/lagadic/pdf/2006_ieee_ram_chaumette.pdf"},{"title":"Wikipedia: Visual servoing","url":"https://en.wikipedia.org/wiki/Visual_servoing"}],"as_of":"","related_ids":["image-based-visual-servoing","position-based-visual-servoing","eye-in-hand","eye-to-hand","visuomotor-policy","closed-loop-control"],"name":"视觉伺服","alt":"Visual Servoing","abbr":"","aliases":["视觉伺服控制","基于视觉的机器人控制","Visual servo control","Vision-based robot control"],"one_liner":"把相机看到的图像误差直接放进控制回路，边看边调整机器人运动。","explanation":"视觉伺服是用视觉信息做反馈、实时驱动机器人运动的控制方法，相关研究可追溯到 1979 年前后，「visual servo」这个词 1987 年才出现。核心是让误差 e = s − s* 趋于零：s 是当前从图像提取的特征（如几个角点的像素坐标），s* 是期望特征。经典控制律 v = −λL⁺e，v 是相机速度，λ 是增益，L 是交互矩阵（描述特征随相机运动如何变化），L⁺ 是它的伪逆。按特征分两类：基于图像的（IBVS）直接用像素特征，不必估计三维位姿；基于位置的（PBVS）先估计目标三维位姿再控制。相机可以装在手上（眼在手上），也可以固定在外面（眼在手外）。","example":"Chaumette 与 Hutchinson 2006 年教程中的典型例子：手上相机对着排成正方形的 4 个点，以它们当前与期望的像素坐标之差为误差，按 v = −λL⁺e 算相机速度，直到 4 个点在图像中落到期望位置，相机也就到了目标位姿。","related":["基于图像的视觉伺服","基于位置的视觉伺服","眼在手上","眼在手外","视觉运动策略","闭环"]},{"id":"image-based-visual-servoing","category":"control","sec":2,"tier":3,"sources":[{"title":"Wikipedia: Visual servoing","url":"https://en.wikipedia.org/wiki/Visual_servoing"},{"title":"Chaumette & Hutchinson: Visual servo control, Part II: Advanced approaches (IEEE RAM 2007，含 Part I 基本公式回顾)","url":"https://inria.hal.science/inria-00350638v1/document"}],"as_of":"","related_ids":["visual-servoing","position-based-visual-servoing","jacobian-matrix","eye-in-hand","camera-intrinsics","closed-loop-control"],"name":"基于图像的视觉伺服","alt":"Image-Based Visual Servoing","abbr":"IBVS","aliases":["图像视觉伺服","2D 视觉伺服","2D Visual Servoing"],"one_liner":"直接用图像里特征点的像素误差来计算相机或机械臂速度的视觉闭环控制。","explanation":"视觉伺服是用相机反馈闭环控制机器人，分基于图像（IBVS）和基于位置（PBVS）两类，前者由 Weiss 和 Sanderson 在 1980 年代提出。IBVS 不重建目标三维位姿，直接在图像上定义误差 e = s − s*，s 是当前特征（如角点像素坐标），s* 是期望值。特征速度与相机速度 v 满足 ṡ = L·v，L 叫交互矩阵（图像雅可比），与像素坐标和深度 Z 有关。控制律 v = −λ·L⁺·e（L⁺ 为伪逆，λ 为增益）让误差近似指数衰减。它不需要物体模型、对标定误差较鲁棒；缺点是深度只能估计，大角度绕光轴转时相机会先后退，也可能陷入局部极小。PBVS 先估位姿再在三维空间控制，更依赖标定和模型。","example":"腕部相机对准装配件上的 4 个标记角点：先在对准位置拍图，记下 4 个角点的像素坐标作为 s*；运行时控制器不断比较当前与期望像素，输出相机的 6 维速度，直到四点重合，夹爪也就对准了插孔。","related":["视觉伺服","基于位置的视觉伺服","雅可比矩阵","眼在手上","相机内参","闭环"]},{"id":"position-based-visual-servoing","category":"control","sec":2,"tier":3,"sources":[{"title":"Chaumette & Hutchinson, Visual Servo Control Part I: Basic Approaches (IEEE RAM, 2006)","url":"https://www.irisa.fr/lagadic/pdf/2006_ieee_ram_chaumette.pdf"},{"title":"Wikipedia: Visual servoing","url":"https://en.wikipedia.org/wiki/Visual_servoing"}],"as_of":"","related_ids":["visual-servoing","image-based-visual-servoing","6d-object-pose-estimation","camera-calibration","hand-eye-calibration","eye-in-hand"],"name":"基于位置的视觉伺服","alt":"Position-Based Visual Servoing","abbr":"PBVS","aliases":["基于位姿的视觉伺服","3D 视觉伺服","Pose-Based Visual Servoing"],"one_liner":"先从图像估出目标的 3D 位姿，再按位姿误差控制机器人运动的视觉伺服。","explanation":"视觉伺服指把相机图像直接放进控制回路，Chaumette 与 Hutchinson 2006 年的经典教程把它分成 PBVS 和 IBVS（基于图像的视觉伺服）两类。PBVS 先用相机内参和物体 3D 模型从图像里估出相机相对目标的位姿，把它与期望位姿之差作为误差 e（常用平移 t 加轴角 θu 表示），再按 v = −λL⁺e 算相机速度：λ 是增益，L⁺ 是交互矩阵（误差随相机速度变化的关系）的伪逆。优点是误差定义在三维空间，相机在空间里走的路线直观、接近直线；缺点是严重依赖标定和位姿估计，估偏了最终就停在偏的位置，而且目标可能在运动中移出画面。IBVS 直接比较图像上的特征点，对标定误差更宽容。","example":"腕部相机（眼在手上）看到桌上的零件，每帧用位姿估计算出零件相对相机的 6D 位姿，与「相机应处的预抓取位姿」相减得到误差，持续修正末端速度，误差收敛到零后再下爪。","related":["视觉伺服","基于图像的视觉伺服","6D位姿估计","相机标定","手眼标定","眼在手上"]},{"id":"trajectory-planning","category":"control","sec":3,"tier":2,"sources":[{"title":"Lynch & Park, Modern Robotics (2017 preprint), Ch.9 Trajectory Generation","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"MoveIt Docs: Time Parameterization","url":"https://moveit.picknik.ai/main/doc/examples/time_parameterization/time_parameterization_tutorial.html"}],"as_of":"","related_ids":["path-planning","motion-planning","time-parameterization","time-optimal-path-parameterization","trapezoidal-velocity-profile","trajectory-tracking"],"name":"轨迹规划","alt":"Trajectory Planning","abbr":"","aliases":["轨迹生成","Trajectory generation"],"one_liner":"决定机器人每个时刻该在哪、多快：路径再加上时间安排。","explanation":"轨迹规划回答「什么时刻到哪里、速度多大」。《Modern Robotics》把轨迹拆成两部分：路径是纯几何的一串构型，只管经过哪些位置；时间缩放 s(t) 规定每个时刻走到路径的哪一处。二者合起来就是轨迹 θ(t)，它要足够平滑，并满足关节速度、加速度和力矩上限。它与路径规划、运动规划相关但不同：路径规划重在绕开障碍找到可行路线，不管时间；轨迹规划在路线上加入时间和动力学约束。常用做法有多项式时间缩放、梯形或 S 型速度曲线、经过路点的样条，以及考虑执行器上限的时间最优参数化。","example":"MoveIt 的流程：规划器先给出一串不带时间信息的无碰撞关节路点，再由时间参数化（主要用 TOTG 算法，可再用 Ruckig 限制加加速度）按关节速度、加速度上限补上时间，得到可执行的轨迹。","related":["路径规划","运动规划","时间参数化","时间最优路径参数化","梯形速度曲线","轨迹跟踪"]},{"id":"waypoint","category":"control","sec":3,"tier":2,"sources":[{"title":"Lynch & Park, Modern Robotics (2017 preprint), 9.3 Polynomial Via Point Trajectories","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"MoveIt Docs: Move Group C++ Interface（Cartesian Paths）","url":"https://moveit.picknik.ai/main/doc/examples/move_group_interface/move_group_interface_tutorial.html"},{"title":"Wikipedia: Waypoint","url":"https://en.wikipedia.org/wiki/Waypoint"}],"as_of":"","related_ids":["trajectory-interpolation","trajectory-planning","movej-movel","moveit-motion-planning-framework","cubic-spline-interpolation","navigation"],"name":"路点","alt":"Waypoint","abbr":"","aliases":["航点","途经点","Via-point","Via point"],"one_liner":"运动过程中指定要经过的中间点，用来约束机器人走哪条路。","explanation":"路点是运动过程中指定要经过或到达的中间位置，可以是一组关节角，也可以是末端或机体的位姿，有时还附带期望到达时刻和速度。这个词来自航海、航空和 GPS 导航里的「途经点」。在机器人里，用户或规划器先给出一串路点，再由轨迹插值和时间参数化把它们连成平滑、可执行的轨迹；路点之间走成什么形状取决于插值方式，比如三次多项式只保证速度连续，B 样条则不一定精确过点。移动机器人导航和无人机任务也常用路点序列描述路线，工业机械臂示教时记录的一个个示教点本质上也是路点。","example":"MoveIt 规划笛卡尔路径：把几个末端位姿放进 waypoints 列表，调用 computeCartesianPath 并设 eef_step = 0.01，即每 1 cm 插一个点；返回的 fraction 表示有多大比例的路径规划成功，速度则要另外做时间参数化。","related":["轨迹插值","轨迹规划","关节运动与直线运动（MoveJ / MoveL）","MoveIt","三次样条插值","导航"]},{"id":"trajectory-interpolation","category":"control","sec":3,"tier":2,"sources":[{"title":"Lynch & Park, Modern Robotics (2017 preprint), 9.3 Polynomial Via Point Trajectories","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion（附录 UR5 robot station）","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["waypoint","cubic-spline-interpolation","quintic-polynomial-interpolation","spherical-linear-interpolation","time-parameterization","action-chunking"],"name":"轨迹插值","alt":"Trajectory Interpolation","abbr":"","aliases":["插补","轨迹插补","Motion interpolation"],"one_liner":"已知几个关键点，按时间把它们之间的位置补全成连续轨迹。","explanation":"轨迹插值是在给定的若干点（起点、终点、路点）之间，按时间算出每个控制周期该到的位置，必要时还给出速度和加速度。最简单的是线性插值，速度会在路点处突变；三次多项式能让速度连续，但加速度仍可能跳变；五次多项式再保证加速度连续，运动更平顺。B 样条不一定精确经过每个点，但轨迹保证落在这些点围成的凸包里，便于守住关节限位。姿态不能直接对欧拉角线性插值，常用四元数的球面线性插值。它的另一个用途是「升频」：模型或遥操作出点慢，底层控制器要求指令快，中间靠插值补齐。","example":"Diffusion Policy 在 UR5 上做推 T 任务时，策略每秒给出 10 个末端位置指令，控制器把它们线性插值到机器人要求的 125 Hz，同时把末端速度限制在 0.43 m/s 以下、位置限制在桌面以上 1 cm 的区域内。","related":["路点","三次样条插值","五次多项式插值","球面线性插值","时间参数化","动作分块"]},{"id":"movej-movel","category":"control","sec":3,"tier":2,"sources":[{"title":"The URScript Programming Language for e-Series, SW 5.11（movej / movel）","url":"https://s3-eu-west-1.amazonaws.com/ur-support-site/115824/scriptManual_SW5.11.pdf"},{"title":"ur_rtde: rtde_control_interface.h（moveJ linear in joint-space / moveL linear in tool-space）","url":"https://gitlab.com/sdurobotics/ur_rtde/-/raw/master/include/ur_rtde/rtde_control_interface.h"}],"as_of":"","related_ids":["joint-space","task-space","inverse-kinematics","tool-center-point","trapezoidal-velocity-profile","pre-grasp-pose"],"name":"关节运动与直线运动（MoveJ / MoveL）","alt":"MoveJ / MoveL (Joint Move / Linear Move Commands)","abbr":"","aliases":["MoveJ","MoveL","movej","movel","关节插补","直线插补"],"one_liner":"机械臂最常用的两条运动指令：按关节空间走，或让末端走直线。","explanation":"MoveJ 和 MoveL 是工业/协作机械臂编程里的两条基础指令，优傲（UR）的 URScript 里写作 movej、movel，其他厂商也有类似指令。MoveJ 在关节空间插补：各关节从当前角度同步转到目标角度，末端走出的通常是一条曲线，但不用沿途解逆运动学，速度快，也不怕中途碰上奇异位形（某些方向动不了的姿态）。MoveL 在笛卡尔空间插补：让工具中心点沿直线走到目标位姿，控制器要沿途解逆运动学，路线可预测，适合靠近物体、插入、涂胶。两者的速度都按梯形速度曲线执行。常见用法是先 MoveJ 到预抓取位姿，再 MoveL 直线接近物体。","example":"URScript 中 movej([0,1.57,-1.57,3.14,-1.57,1.57], a=1.4, v=1.05) 让六个关节以领头关节 1.05 rad/s 的速度转到这组角度；movel(pose, a=1.2, v=0.25) 让末端以 0.25 m/s 沿直线移到 pose。","related":["关节空间","任务空间","逆运动学","工具中心点","梯形速度曲线","预抓取位姿"]},{"id":"offline-programming","category":"control","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Off-line programming (robotics)","url":"https://en.wikipedia.org/wiki/Off-line_programming_(robotics)"},{"title":"RoboDK: Offline Programming","url":"https://robodk.com/offline-programming"}],"as_of":"2026-09","related_ids":["teach-and-playback-programming","teach-pendant","industrial-robot","digital-twin","simulator","kinematic-calibration"],"name":"离线编程","alt":"Offline Programming","abbr":"OLP","aliases":["Off-line Programming","机器人离线编程"],"one_liner":"在电脑三维仿真里写好并验证机器人程序，再下载到真机执行。","explanation":"离线编程是工业机器人的一种编程方式：在电脑上建立工作站的三维模型（机器人、工装、工件的 CAD），在仿真软件里生成和调整运动轨迹，检查可达性、碰撞和节拍（做完一个工件的时间），确认后由「后处理器」把轨迹翻译成对应品牌控制器的机器人语言（如 ABB 的 RAPID），再下载到真机。与之相对的是在线编程：工程师在现场拿示教器一个点一个点地教，期间产线要停。离线编程不占用生产时间，适合轨迹复杂或经常换型的任务，据维基百科，新程序的导入时间可从几周缩短到一天。难点是仿真模型和现场存在误差，通常要对机器人和工件做标定来修正。常见软件有 RoboDK、ABB RobotStudio 等，RoboDK 称支持 80 多个品牌、1400 多款机器人。","example":"产线换新工件前，工程师在 RoboDK 里导入工件 CAD，生成焊枪或打磨头沿工件边缘的路径，仿真检查碰撞和节拍，后处理成 ABB RAPID 程序下载到机器人，现场只需少量点位修正。","related":["示教再现","示教器","工业机器人","数字孪生","仿真器","运动学标定"]},{"id":"trapezoidal-velocity-profile","category":"control","sec":3,"tier":3,"sources":[{"title":"MATLAB Robotics System Toolbox: trapveltraj（Generate trajectories with trapezoidal velocity profiles）","url":"https://www.mathworks.com/help/robotics/ref/trapveltraj.html"}],"as_of":"","related_ids":["s-curve-velocity-profile","minimum-jerk-trajectory","jerk","movej-movel","time-parameterization","trajectory-interpolation"],"name":"梯形速度曲线","alt":"Trapezoidal Velocity Profile","abbr":"","aliases":["梯形加减速","梯形速度规划","T 型速度曲线","Trapezoidal Profile"],"one_liner":"匀加速、匀速、匀减速三段组成的速度规划，速度-时间图呈梯形。","explanation":"梯形速度曲线是电机和机械臂点到点运动里最基础的速度规划：先以恒定加速度 a 从 0 加速到最大速度 v_max，匀速巡航，再以同样大小的加速度减速到 0，速度-时间图像是梯形。加速段用时 t_a = v_max / a，走过 v_max²/(2a) 的距离；如果总距离 L 小于 v_max²/a，来不及加到最大速度，就退化成三角形，峰值速度为 √(aL)。它计算简单，工业机械臂的 MoveJ、MoveL 等指令和许多驱动器都用它。缺点是加速度在各段交界处突变，加加速度（jerk，加速度的变化率）理论上无穷大，会激起振动和冲击；要求更平稳时改用 S 型速度曲线或最小加加速度轨迹。多关节同步运动时，通常先算最慢关节需要的时间，再让其他关节按比例放慢，保证同时到达。","example":"让一个直线轴移动 L = 1 m，限速 v_max = 0.5 m/s、加速度 a = 1 m/s²：加速 0.5 s（走 0.125 m），匀速 1.5 s（走 0.75 m），减速 0.5 s（走 0.125 m），共 2.5 s。","related":["S 型速度曲线","最小加加速度轨迹","加加速度","关节运动与直线运动（MoveJ / MoveL）","时间参数化","轨迹插值"]},{"id":"s-curve-velocity-profile","category":"control","sec":3,"tier":3,"sources":[{"title":"Jerk-limited Real-time Trajectory Generation with Arbitrary Target States (Berscheid & Kröger, RSS 2021, arXiv 2105.04830)","url":"https://arxiv.org/abs/2105.04830"},{"title":"Ruckig GitHub（Motion Generation for Robots and Machines）","url":"https://github.com/pantor/ruckig"}],"as_of":"","related_ids":["trapezoidal-velocity-profile","jerk","time-parameterization","trajectory-planning","ruckig","minimum-jerk-trajectory"],"name":"S 型速度曲线","alt":"S-Curve Velocity Profile","abbr":"","aliases":["S型加减速","七段式速度曲线","S 曲线加减速","限加加速度速度曲线","Jerk-limited velocity profile"],"one_liner":"限制加加速度、让加速度连续变化的速度规划，速度随时间的曲线呈 S 形。","explanation":"点到点运动最简单的是梯形速度曲线：匀加速、匀速、匀减速。但加速度在段与段交界处突变，加加速度（jerk，加速度的变化率）理论上无穷大，容易激起机械臂振动和冲击。S 型曲线再给 jerk 设上限：加速段拆成加加速、匀加速、减加速三段，减速段同理，加上中间匀速段共七段，所以又叫七段式；每段 jerk 只取 +J、0 或 −J，速度曲线在起止处变成平滑的 S 形。代价是比梯形曲线稍慢、计算更复杂，行程短时有的段长度为零。工业机器人控制器和数控机床普遍使用；KIT 的 Berscheid 与 Kröger 在 RSS 2021 发表的开源库 Ruckig，能在每个控制周期实时算出时间最优的限 jerk 轨迹。","example":"Ruckig 把单个关节的最快轨迹写成最多 7 段恒定 jerk 的组合，并让多个关节同时到达目标；MoveIt 2、CoppeliaSim、LinuxCNC 和 Franka 机械臂的 Frankx 库都用它生成限加加速度轨迹。","related":["梯形速度曲线","加加速度","时间参数化","轨迹规划","Ruckig","最小加加速度轨迹"]},{"id":"bezier-curve-trajectory","category":"control","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Bézier curve","url":"https://en.wikipedia.org/wiki/B%C3%A9zier_curve"},{"title":"MIT Cheetah-Software: FootSwingTrajectory.cpp（Currently uses Bezier curves like Cheetah 3 does）","url":"https://github.com/mit-biomimetics/Cheetah-Software/blob/master/common/src/Controllers/FootSwingTrajectory.cpp"}],"as_of":"","related_ids":["swing-foot-trajectory-planning","cubic-spline-interpolation","quintic-polynomial-interpolation","minimum-jerk-trajectory","waypoint","hybrid-zero-dynamics"],"name":"贝塞尔曲线轨迹","alt":"Bézier Curve Trajectory","abbr":"","aliases":["贝塞尔曲线","Bezier curve","贝塞尔多项式"],"one_liner":"用几个控制点决定形状的光滑多项式曲线，常用来描述机器人轨迹。","explanation":"贝塞尔曲线由雷诺公司工程师 Pierre Bézier 在 1960 年代推广用于车身设计，雪铁龙的 de Casteljau 更早独立提出了它的计算方法。n 阶曲线由 n+1 个控制点 P₀…Pₙ 决定：B(s) = Σᵢ C(n,i)(1−s)ⁿ⁻ⁱ sⁱ Pᵢ，参数 s 从 0 走到 1，C(n,i) 是组合数。它适合做轨迹有三点原因：曲线必过首尾控制点；起点和终点的切线方向由相邻控制点决定，便于和前后段衔接；整条曲线落在控制点围成的凸包内，控制点避开障碍，曲线就不会越界。中间控制点不在曲线上，只负责拉动形状。机器人里常用于足端摆动轨迹和末端路径平滑，混合零动态方法也用贝塞尔多项式描述步态参考轨迹。长路径一般用多段低阶曲线拼接，而不是一条高阶曲线。","example":"MIT 开源的 Cheetah-Software 用三次贝塞尔曲线生成摆动腿轨迹：水平方向从起点平滑过渡到落脚点，竖直方向前半段升到抬腿高度、后半段落回地面，再对曲线求导直接得到足端速度和加速度。","related":["足端轨迹规划","三次样条插值","五次多项式插值","最小加加速度轨迹","路点","混合零动态"]},{"id":"cubic-spline-interpolation","category":"control","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Spline interpolation","url":"https://en.wikipedia.org/wiki/Spline_interpolation"},{"title":"ros2_control: joint_trajectory_controller 轨迹表示与插值","url":"https://control.ros.org/master/doc/ros2_controllers/joint_trajectory_controller/doc/trajectory.html"}],"as_of":"","related_ids":["trajectory-interpolation","quintic-polynomial-interpolation","waypoint","time-parameterization","minimum-jerk-trajectory","jerk"],"name":"三次样条插值","alt":"Cubic Spline Interpolation","abbr":"","aliases":["三次样条","三次样条曲线","Cubic Spline"],"one_liner":"用分段三次多项式把一串路点连成位置、速度都连续的平滑曲线。","explanation":"三次样条插值是数值分析里的经典方法：给定一串路点，每两个相邻路点之间用一段三次多项式 q(t) = a₀ + a₁t + a₂t² + a₃t³ 连接，要求相邻两段在连接处位置和速度（一阶导）连续；标准三次样条还要求加速度（二阶导）连续，再配上端点条件，例如自然样条令两端二阶导为零，夹持样条指定两端速度。比起用一个高次多项式穿过所有点，它不会出现龙格现象那种剧烈振荡。机器人里常用它把规划器或策略给出的稀疏路点插值成控制器每个周期需要的密集指令。若只给定每段首末的位置和速度，段与段之间的加速度可能跳变，对应很大的加加速度，引起冲击，这时会改用五次多项式。","example":"关节在 2 秒内从 0 转到 1 弧度、起止速度都为 0，单段三次多项式为 q(t) = 3(t/2)² − 2(t/2)³，中点 t = 1 秒时速度最大，为 0.75 rad/s。ROS 2 的 joint_trajectory_controller 按路点信息选插值方式：只给位置时线性插值，给位置和速度时用三次样条，再给加速度时用五次样条。","related":["轨迹插值","五次多项式插值","路点","时间参数化","最小加加速度轨迹","加加速度"]},{"id":"quintic-polynomial-interpolation","category":"control","sec":3,"tier":3,"sources":[{"title":"Lynch & Park, Modern Robotics, Section 9.2 Polynomial Time Scaling (preprint PDF)","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Robotics Toolbox for Python: Trajectories (quintic / jtraj / mtraj)","url":"https://petercorke.github.io/robotics-toolbox-python/arm_trajectory.html"}],"as_of":"","related_ids":["trajectory-interpolation","cubic-spline-interpolation","minimum-jerk-trajectory","jerk","trapezoidal-velocity-profile","time-parameterization"],"name":"五次多项式插值","alt":"Quintic Polynomial Interpolation","abbr":"","aliases":["五次多项式轨迹","五次多项式时间缩放","Quintic Polynomial Trajectory","Quintic Time Scaling"],"one_liner":"用五次多项式连接起点和终点，同时对齐两端的位置、速度和加速度。","explanation":"五次多项式插值是机器人点到点轨迹规划最基础的方法之一。把关节角或位置写成 q(t) = a₀ + a₁t + … + a₅t⁵，六个系数正好由六个边界条件唯一确定：起点和终点各自的位置、速度、加速度。三次多项式只能约束两端位置和速度，起止瞬间加速度会突变，加加速度（jerk，加速度的变化率）在理论上无穷大，容易引起振动；五次多项式能让两端加速度也为零，全程加速度连续、加加速度有限，起停更平稳。代价是同样时长下峰值速度更高，需检查是否超出关节限速。两端速度、加速度都为零时，归一化形式为 s(τ) = 10τ³ − 15τ⁴ + 6τ⁵（τ = t/T，T 为总时长），与最小加加速度轨迹一致。经过多个路点时可逐段拼接，保证路点处加速度也连续。","example":"Peter Corke 的 Robotics Toolbox for Python 中，jtraj() 用五次多项式生成关节空间轨迹，默认起止速度和加速度为零；quintic() 生成单个变量的同类轨迹。","related":["轨迹插值","三次样条插值","最小加加速度轨迹","加加速度","梯形速度曲线","时间参数化"]},{"id":"minimum-jerk-trajectory","category":"control","sec":3,"tier":3,"sources":[{"title":"Flash & Hogan (1985), The coordination of arm movements: an experimentally confirmed mathematical model, J. Neurosci. 5(7):1688–1703","url":"https://doi.org/10.1523/JNEUROSCI.05-07-01688.1985"}],"as_of":"","related_ids":["jerk","quintic-polynomial-interpolation","s-curve-velocity-profile","trajectory-planning","minimum-snap-trajectory-differential-flatness","time-parameterization"],"name":"最小加加速度轨迹","alt":"Minimum-Jerk Trajectory","abbr":"","aliases":["最小急动度轨迹","最小 jerk 轨迹","Minimum Jerk"],"one_liner":"让加加速度（加速度的变化率）平方积分最小的轨迹，运动平滑、接近人手动作。","explanation":"Jerk（加加速度、急动度）是加速度对时间的导数，jerk 大意味着运动突兀、冲击大。最小加加速度轨迹就是在给定起点、终点和时长时，让 jerk 平方的积分最小的轨迹。最有名的出处是 Flash 与 Hogan 1985 年发表在 Journal of Neuroscience 的论文：人手在平面上的点到点伸手动作近似直线、速度曲线呈钟形，与这个模型的预测一致。一维、起止速度和加速度都为 0 时，解是一个五次多项式：x(t) = x₀ + (x_f − x₀)(10τ³ − 15τ⁴ + 6τ⁵)，x₀、x_f 是起点和终点，τ = t/T 是归一化时间，T 是总时长。所以它正是五次多项式插值在边界速度、加速度为零时的特例。机器人里常用它生成点到点运动或平滑插值，减少对电机和减速器的冲击。若改为限制 jerk 的最大值而非最小化其积分，就是 S 型速度曲线的思路。","example":"机械臂把杯子从桌面一处移到另一处、总时长 2 秒：按上面的公式插值，末端速度从 0 平滑升到中点时最大、再平滑降回 0，起步和停下都没有顿挫。","related":["加加速度","五次多项式插值","S 型速度曲线","轨迹规划","最小 Snap 轨迹（微分平坦）","时间参数化"]},{"id":"minimum-snap-trajectory-differential-flatness","category":"control","sec":3,"tier":3,"sources":[{"title":"Richter, Bry, Roy: Polynomial Trajectory Planning for Aggressive Quadrotor Flight in Dense Indoor Environments (ISRR 2013)","url":"https://groups.csail.mit.edu/rrg/papers/Richter_ISRR13.pdf"},{"title":"Mellinger & Kumar: Minimum snap trajectory generation and control for quadrotors (ICRA 2011)","url":"https://doi.org/10.1109/ICRA.2011.5980409"},{"title":"Flatness (systems theory) - Wikipedia","url":"https://en.wikipedia.org/wiki/Flatness_(systems_theory)"}],"as_of":"","related_ids":["minimum-jerk-trajectory","trajectory-optimization","quadratic-programming","kinodynamic-planning","unmanned-aerial-vehicle","jerk"],"name":"最小 Snap 轨迹（微分平坦）","alt":"Minimum-Snap Trajectory / Differential Flatness","abbr":"","aliases":["Minimum Snap","最小 snap 轨迹","微分平坦","Differential Flatness"],"one_liner":"让位置四阶导数（snap）平方积分最小的分段多项式轨迹，常用于四旋翼无人机。","explanation":"Snap 是位置对时间的四阶导数，即 jerk 再求一次导。这个方法和微分平坦性绑在一起：微分平坦由 Fliess 等人 1995 年提出，指系统存在一组「平坦输出」，全部状态和控制输入都能写成这组输出及其各阶导数的函数。Mellinger 与 Kumar 在 ICRA 2011 的论文中利用四旋翼的微分平坦性，平坦输出取位置 x、y、z 和偏航角 ψ。这样只要在这四个量上规划出足够光滑的曲线，就能直接算出姿态和电机指令，不必在高维状态空间里采样搜索、反复模拟。电机指令和姿态角加速度与 snap 成正比，所以最小化 snap 能让指令变化平缓、可执行。具体做法是用分段多项式穿过一串航点，把 snap 平方积分写成二次规划求多项式系数；Richter 等人 2013 年把它改写成数值稳定的无约束二次规划，并和几何路径规划结合。","example":"Richter、Bry、Roy 2013 年用这套方法，先找出避障的航点，再生成最小 snap 多项式轨迹，让四旋翼在密集的室内环境中自主飞行，速度最高达 8 m/s。","related":["最小加加速度轨迹","轨迹优化","二次规划","动力学约束规划","无人机（空中机器人）","加加速度"]},{"id":"time-parameterization","category":"control","sec":3,"tier":3,"sources":[{"title":"MoveIt Documentation: Time Parameterization","url":"https://moveit.picknik.ai/main/doc/examples/time_parameterization/time_parameterization_tutorial.html"},{"title":"Kunz, Stilman: Time-Optimal Trajectory Generation for Path Following with Bounded Acceleration and Velocity (RSS 2012)","url":"https://www.roboticsproceedings.org/rss08/p27.html"}],"as_of":"","related_ids":["time-optimal-path-parameterization","topp-ra","ruckig","trajectory-planning","trapezoidal-velocity-profile","moveit-motion-planning-framework"],"name":"时间参数化","alt":"Time Parameterization","abbr":"","aliases":["轨迹时间参数化","Trajectory Time Parameterization","轨迹重定时","Retiming"],"one_liner":"给只有几何形状的路径配上时间表，决定每个点何时到达、速度多大。","explanation":"很多运动规划器（如 MoveIt 调用的 OMPL 采样式规划器）只输出一串没有时间的关节路点，也就是纯几何路径 q(s)，s 是从 0 到 1 的路径进度。时间参数化就是再找一个函数 s(t)，给每个路点配上时间戳、速度和加速度，机器人才能真正执行。由链式法则 q̇ = q′(s)·ṡ、q̈ = q′(s)·s̈ + q″(s)·ṡ²，关节速度、加速度的上限都能换算成对 ṡ、s̈ 的约束。它只决定「走多快」，不改「走哪条路」，这是它和轨迹优化的区别。常见算法有迭代抛物线法、时间最优轨迹生成 TOTG（Kunz 与 Stilman，RSS 2012）、TOPP-RA，以及限制加加速度的 Ruckig。MoveIt 当前默认用 TOTG，并提供 0–1 的速度、加速度缩放因子来整体放慢。","example":"用 MoveIt 规划机械臂从 A 到 B，OMPL 返回一串没有时间的关节路点；TOTG 按 joint_limits.yaml 里的速度、加速度上限给它们配上时间戳。把速度缩放因子设为 0.1，关节速度上限就按原来的 10% 计算。","related":["时间最优路径参数化","TOPP-RA","Ruckig","轨迹规划","梯形速度曲线","MoveIt"]},{"id":"time-optimal-path-parameterization","category":"control","sec":3,"tier":3,"sources":[{"title":"Pham, Pham: A New Approach to Time-Optimal Path Parameterization based on Reachability Analysis (arXiv:1707.07239, IEEE T-RO 2018)","url":"https://arxiv.org/abs/1707.07239"},{"title":"Bobrow, Dubowsky, Gibson: Time-Optimal Control of Robotic Manipulators Along Specified Paths (IJRR 1985)","url":"https://doi.org/10.1177/027836498500400301"},{"title":"toppra: Time-Optimal Path Parameterization library (GitHub)","url":"https://github.com/hungpham2511/toppra"}],"as_of":"","related_ids":["time-parameterization","topp-ra","trajectory-planning","trapezoidal-velocity-profile","convex-optimization","joint-limits"],"name":"时间最优路径参数化","alt":"Time-Optimal Path Parameterization","abbr":"TOPP","aliases":["时间最优路径跟踪","Time-Optimal Path Tracking","最短时间轨迹规划"],"one_liner":"路径固定不变，求在速度、加速度、力矩限制下走完它的最快时间表。","explanation":"TOPP 是时间参数化里追求「最快」的版本：给定一条几何路径 q(s)，求使总时间 T = ∫ds/ṡ 最小的 s(t)（ṡ 是沿路径前进的速度），同时满足关节速度、加速度、力矩等约束。经典做法是 1985 年 Bobrow、Dubowsky、Gibson 等提出的数值积分法：在 (s, ṡ) 相平面上交替按最大加速、最大减速积分，找到切换点，结果是「一会儿全力加速、一会儿全力减速」的 bang-bang 形态。它算得快，但切换点难找、实现容易出数值问题；另一类凸优化法稳但慢。2018 年 Hung Pham 与 Quang-Cuong Pham 在 IEEE T-RO 发表 TOPP-RA，在路径的离散点上逐个解小线性规划，求可达集与可控集，兼顾了速度和稳健，开源库 toppra 很常用。工业机械臂压缩节拍、快速搬运时常靠它。","example":"机械臂沿一条固定的焊缝路径移动：把路径离散成若干点，TOPP-RA 逐点算出最多能走多快，直线段贴着速度上限走，拐弯处因为加速度约束自动减速。","related":["时间参数化","TOPP-RA","轨迹规划","梯形速度曲线","凸优化","关节限位"]},{"id":"trajectory-tracking","category":"control","sec":3,"tier":2,"sources":[{"title":"Lynch & Park, Modern Robotics (2017 preprint), Ch.11 Robot Control 与 13.3 Trajectory tracking","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"},{"title":"Russ Tedrake, Underactuated Robotics: Trajectory Optimization（沿轨迹的 LQR 稳定）","url":"https://underactuated.mit.edu/trajopt.html"}],"as_of":"","related_ids":["trajectory-planning","proportional-derivative-control","feedforward-control","computed-torque-control","motion-tracking","linear-quadratic-regulator"],"name":"轨迹跟踪","alt":"Trajectory Tracking","abbr":"","aliases":["轨迹跟随","Trajectory following"],"one_liner":"让机器人的实际运动紧跟一条随时间变化的参考轨迹，误差趋于零。","explanation":"轨迹跟踪是一个控制问题：给定参考轨迹 qd(t)，让实际状态 q(t) 与它的误差 qd(t) − q(t) 随时间趋于零。典型做法是「前馈 + 反馈」：前馈按模型预先算出沿轨迹所需的速度或力矩，反馈（如 PD）根据当前误差修正，计算力矩控制就是两者结合。效果看稳态误差、超调和调节时间。它与路径跟踪不同：路径跟踪只要求沿几何曲线走，快慢可以自己调；轨迹跟踪对每个时刻的位置都有要求。参考轨迹最好别让执行器用到极限，要给纠偏留余量。人形机器人模仿人类动作的「运动跟踪」也是同一思路。","example":"《Modern Robotics》第 11 章对同一条关节轨迹做仿真对比：只用前馈或只用 PID 反馈都有明显偏差，计算力矩控制（前馈加反馈）跟得最好。","related":["轨迹规划","PD 控制","前馈控制","计算力矩控制","运动跟踪","线性二次调节器"]},{"id":"iterative-learning-control","category":"control","sec":3,"tier":3,"sources":[{"title":"Iterative learning control - Wikipedia","url":"https://en.wikipedia.org/wiki/Iterative_learning_control"}],"as_of":"","related_ids":["feedforward-control","proportional-integral-derivative-control","trajectory-tracking","adaptive-control","teach-and-playback-programming"],"name":"迭代学习控制","alt":"Iterative Learning Control","abbr":"ILC","aliases":["ILC","迭代学习"],"one_liner":"让重复做同一动作的系统，用上一次的跟踪误差修正下一次的控制输入。","explanation":"迭代学习控制针对反复执行同一任务的系统，比如机械臂每个工作节拍都走同一条轨迹。通常认为它由 Arimoto、Kawamura、Miyazaki 在 1984 年的论文《Bettering operation of robots by learning》中提出。思路很直接：第 k 次执行完，记下每个时刻的跟踪误差 e_k(t)，下一次的输入改成 u_{k+1}(t) = u_k(t) + L·e_k(t)，u 是控制输入，L 是人为设计的学习增益，实际中常再加一个低通滤波，防止噪声被逐轮放大。普通反馈控制只能在误差出现之后纠正，ILC 则把上一轮的误差提前写进下一轮的前馈，因此能把模型不准、摩擦这类每次都一样的误差逐轮压下去。前提是每次的初始状态和参考轨迹基本相同，对随机扰动和从没做过的新任务帮不上忙，所以常与 PID 反馈一起用。","example":"工业机械臂每个节拍重复同一条焊接轨迹：第 1 轮记录下关节在拐角处的滞后，第 2 轮在对应时刻提前多给一点力矩，如此逐轮修正，拐角处的跟踪误差越来越小。","related":["前馈控制","PID 控制","轨迹跟踪","自适应控制","示教再现"]},{"id":"input-shaping","category":"control","sec":3,"tier":3,"sources":[{"title":"Zaber: Input Shaping for Vibration Reduction（引 Singer & Seering 1990）","url":"https://www.zaber.com/articles/input-shaping-for-vibration-reduction"},{"title":"Klipper documentation: Resonance Compensation","url":"https://www.klipper3d.org/Resonance_Compensation.html"}],"as_of":"","related_ids":["natural-frequency","damping-ratio","flexible-joint","feedforward-control","s-curve-velocity-profile","trajectory-planning"],"name":"输入整形（振动抑制）","alt":"Input Shaping (Residual Vibration Suppression)","abbr":"","aliases":["指令整形","Command Shaping","ZV 整形器","残余振动抑制"],"one_liner":"把运动指令拆成几段在时间上错开的指令，让它们激起的振动互相抵消。","explanation":"输入整形是一种前馈的振动抑制方法，现代形式由 MIT 的 Singer 和 Seering 在 1990 年提出。细长机械臂、吊车吊绳、皮带传动轴等柔性系统，运动结束后会在固有频率上残余振动。做法是把原指令与一串脉冲做卷积：最简单的 ZV（零振动）整形器用两个脉冲，间隔半个振动周期，幅值按阻尼比分配（无阻尼时各占一半），第一个脉冲激起的振动恰好被第二个抵消。代价是运动多花约半个周期，且对频率估计误差敏感，于是有 ZVD、EI 等更鲁棒但更慢的版本。它只需知道频率和阻尼比、不需额外传感器，可与 S 型速度曲线等平滑轨迹叠加使用。","example":"开源 3D 打印机固件 Klipper 用输入整形消除打印件表面的「振纹」：先测出机架的共振频率，再选 ZV、MZV、EI 等整形器；其中 ZV 只延迟半个周期，但对频率误差最敏感。","related":["固有频率","阻尼比","柔性关节","前馈控制","S 型速度曲线","轨迹规划"]},{"id":"action-smoothing","category":"control","sec":3,"tier":2,"sources":[{"title":"Regularizing Action Policies for Smooth Control with Reinforcement Learning (CAPS, arXiv 2012.06644)","url":"https://arxiv.org/abs/2012.06644"},{"title":"Wikipedia: Low-pass filter","url":"https://en.wikipedia.org/wiki/Low-pass_filter"},{"title":"legged_gym legged_robot_config.py（action_rate 奖励项）","url":"https://raw.githubusercontent.com/leggedrobotics/legged_gym/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["action-chunking","temporal-ensembling","control-frequency","jerk","real-time-chunking","proportional-derivative-control"],"name":"动作平滑","alt":"Action Smoothing (Low-pass Filtering)","abbr":"","aliases":["低通滤波","动作滤波","动作平滑正则"],"one_liner":"对策略输出的动作滤波或加惩罚，去掉高频抖动，让关节运动连贯。","explanation":"动作平滑是部署学习型策略时的常见处理。神经网络每一步独立输出动作，相邻两步可能跳变，电机来回抖、费电、发热。常见做法有三类：一是下发前过低通滤波器（只放行低频变化），最简单的是指数移动平均 y_t = α·x_t + (1−α)·y_{t−1}，x 是策略新输出的动作，y 是实际下发的动作，α 越小越平滑；二是训练时加惩罚，如 legged_gym 默认奖励中的 action_rate 项惩罚相邻两步动作之差，CAPS 方法（ICRA 2021）加时间与空间平滑正则，作者报告在四旋翼上功耗降低近 80%；三是一次预测一段动作（动作分块），再做时序集成或插值。代价是滤波会引入延迟（相位滞后），机器人对扰动反应变慢，α 要在平滑和响应之间权衡。","example":"四足机器人的强化学习策略以 50Hz 输出目标关节角，上真机后腿部高频抖动；加一阶低通滤波后抖动明显减小，但被推时的反应也慢了一点，需要重新调 α。","related":["动作分块","时序集成","控制频率","加加速度","实时动作分块","PD 控制"]},{"id":"motion-primitives","category":"control","sec":3,"tier":3,"sources":[{"title":"Movement Primitives in Robotics: A Comprehensive Survey (arXiv 2601.02379)","url":"https://arxiv.org/abs/2601.02379"},{"title":"Spatio-Temporal Lattice Planning Using Optimal Motion Primitives (arXiv 2107.11467)","url":"https://arxiv.org/abs/2107.11467"}],"as_of":"","related_ids":["dynamic-movement-primitives","probabilistic-movement-primitives","skill-primitive","imitation-learning","kinodynamic-planning","a-star-search"],"name":"运动基元","alt":"Motion Primitives","abbr":"","aliases":["运动原语","动作基元","Movement Primitives"],"one_liner":"把复杂动作拆成可复用、可调参数的一小段标准动作，用时再组合拼接。","explanation":"运动基元指一小段可以反复调用的基础动作，比如「伸手到某处」「抓起」「前进一段再左转」。这个想法受生物学启发：人和动物的连续动作可以看成若干基本片段的串联。机器人里主要有两类用法。一类在操作和模仿学习里，用带参数的模型表示一段轨迹，从演示中学出来，执行时只改目标点、时长等参数就能迁移到新情况，代表是动态运动基元（DMP，用弹簧-阻尼系统加一个可学习的驱动项生成轨迹）和概率运动基元（ProMP，从多条演示学出轨迹的分布）。另一类在移动机器人和自动驾驶的规划里：预先算好一组满足车辆动力学的短轨迹，在线用 A* 等图搜索把它们首尾拼接，这叫状态格（lattice）规划。和原子技能相比，运动基元偏轨迹层，原子技能多指语义层面的完整子任务。","example":"自动泊车：规划器预先存好一组车辆一定走得出来的短轨迹，比如「直行一小段」「方向盘打满倒车转 90°」，在线用 A* 搜索把它们串成一条从当前位置到车位的路线。","related":["动态运动基元","概率运动基元","原子技能","模仿学习","动力学约束规划","A* 算法"]},{"id":"dynamic-movement-primitives","category":"control","sec":3,"tier":3,"sources":[{"title":"Saveriano et al.: Dynamic Movement Primitives in Robotics: A Tutorial Survey (arXiv:2102.03861)","url":"https://arxiv.org/abs/2102.03861"}],"as_of":"","related_ids":["motion-primitives","probabilistic-movement-primitives","imitation-learning","kinesthetic-teaching","gaussian-mixture-regression-task-parameterized-gmm"],"name":"动态运动基元","alt":"Dynamic Movement Primitives (Dynamical Movement Primitives)","abbr":"DMP","aliases":["动态运动原语","动态运动基元","Dynamical Movement Primitives","DMPs"],"one_liner":"把一条示教轨迹编码成「弹簧阻尼 + 可学习力项」的动力系统，可改终点和速度复现。","explanation":"DMP 是 Ijspeert、Nakanishi 和 Schaal 在 2001–2002 年提出的轨迹表示方法，2013 年发表了系统总结。核心是一个二阶「弹簧-阻尼」系统加一个可学习的力项：τ·ż = α(β(g − y) − z) + f(x)，τ·ẏ = z。其中 y 是位置，z 是缩放后的速度，g 是目标点，τ 控制快慢，α、β 是固定增益；f(x) 是若干高斯基函数的加权和，权重可以用线性回归从一次示教里直接拟合出来；x 来自一个随时间衰减到 0 的「相位」系统 τ·ẋ = −αₓx，保证力项最后消失、系统稳定收敛到 g。因此改 g 就能换终点，改 τ 就能变速，中途被推一下也会自己回到轨迹上。它长期是模仿学习新手的入门工具。局限是只表示一条确定的轨迹，描述不了同一任务有多种做法的情况，概率运动基元（ProMP）等方法在此基础上加入了分布建模。","example":"用拖动示教录一次「把杯子从 A 点端到 B 点」的机械臂轨迹，拟合出 DMP 权重；要改放到 C 点时只需把 g 换成 C 的坐标，想放慢就调大 τ，机械臂会生成形状相似的新轨迹，不必重新示教。","related":["运动基元","概率运动基元","模仿学习","拖动示教","高斯混合回归 / 任务参数化 GMM"]},{"id":"probabilistic-movement-primitives","category":"control","sec":3,"tier":3,"sources":[{"title":"Paraschos et al., Probabilistic Movement Primitives (NIPS 2013) — abstract","url":"https://proceedings.neurips.cc/paper/2013/hash/e53a0a2978c28872a4505bdb51db06dc-Abstract.html"},{"title":"Paraschos et al., Probabilistic Movement Primitives (NIPS 2013) — PDF","url":"https://proceedings.neurips.cc/paper_files/paper/2013/file/e53a0a2978c28872a4505bdb51db06dc-Paper.pdf"}],"as_of":"","related_ids":["dynamic-movement-primitives","motion-primitives","imitation-learning","gaussian-mixture-regression-task-parameterized-gmm","demonstration-data","kinesthetic-teaching"],"name":"概率运动基元","alt":"Probabilistic Movement Primitives","abbr":"ProMP","aliases":["概率运动原语","ProMPs","Probabilistic Movement Primitive"],"one_liner":"用高斯分布描述一类示范轨迹的运动基元，可按经过点或目标条件化调整。","explanation":"ProMP 由 Paraschos、Daniel、Peters、Neumann 在 NIPS 2013 提出。每条轨迹写成 y_t = Φ_tᵀw + ε：Φ_t 是按时间排布的基函数（常用径向基函数），w 是权重，ε 是噪声。每次示范拟合出一个 w，再对这些 w 拟合一个高斯分布：均值代表典型动作，协方差记录示范之间的变化幅度和各关节之间的耦合，所以它表示的是「一族轨迹」而不是一条。要求某时刻经过某点时，用高斯条件化就能解析地得到新分布；几个 ProMP 还能同时激活、相互混合切换。论文还推导了能复现该轨迹分布的随机反馈控制器。和 DMP（动态运动基元）相比，DMP 用带吸引子的微分方程表示单条轨迹，ProMP 直接对轨迹分布建模，更擅长表达示范中的差异。","example":"原论文在 7 自由度 KUKA 轻量臂上打冰球：两组各 10 次示范，分别只改射门距离或只改角度；两个 ProMP 组合后只打中间、中等距离，对射门角度做条件化后就能按指定方向射门。","related":["动态运动基元","运动基元","模仿学习","高斯混合回归 / 任务参数化 GMM","演示数据","拖动示教"]},{"id":"gaussian-mixture-regression-task-parameterized-gmm","category":"control","sec":3,"tier":3,"sources":[{"title":"Calinon, A Tutorial on Task-Parameterized Movement Learning and Retrieval (Intelligent Service Robotics, 2016)","url":"https://calinon.ch/papers/Calinon-JIST2015.pdf"}],"as_of":"","related_ids":["gaussian-mixture-model","dynamic-movement-primitives","probabilistic-movement-primitives","imitation-learning","demonstration-data","coordinate-frame"],"name":"高斯混合回归 / 任务参数化 GMM","alt":"Gaussian Mixture Regression / Task-Parameterized GMM","abbr":"GMR / TP-GMM","aliases":["GMR","TP-GMM","任务参数化高斯混合模型"],"one_liner":"用几个高斯分布概括示教轨迹，再按新的物体位置生成对应动作。","explanation":"两者是示教学习里的经典概率方法，Sylvain Calinon 在 2016 年的教程论文中做了系统整理。GMM（高斯混合模型）先把几条示教轨迹中「时间+位置」的数据点拟合成若干高斯分量；GMR 对给定输入（如时间 t）求条件分布，输出平滑轨迹及其方差，方差大说明几次示教差异大、执行时可以放松。TP-GMM 把起点、目标物体等坐标系当作「任务参数」，在每个坐标系下各学一个 GMM，遇到新场景时把它们变换到新坐标系，再用高斯乘积融合，因此几条示教就能适应新的物体位置。它数据需求小、可解释，但表达复杂多峰动作的能力不如扩散策略等深度生成方法。","example":"示教 5 次把杯子放到托盘上：在「杯子坐标系」和「托盘坐标系」下各学一个 GMM，换了摆放位置后把两者相乘，就得到经过新杯子位置、落到新托盘上的轨迹。","related":["高斯混合模型","动态运动基元","概率运动基元","模仿学习","演示数据","坐标系"]},{"id":"optimal-control","category":"control","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Optimal control","url":"https://en.wikipedia.org/wiki/Optimal_control"},{"title":"Underactuated Robotics（Tedrake）: Linear Quadratic Regulators","url":"https://underactuated.mit.edu/lqr.html"},{"title":"Apollo Control 模块说明（README_cn）","url":"https://raw.githubusercontent.com/ApolloAuto/apollo/master/modules/control/control_component/README_cn.md"}],"as_of":"","related_ids":["linear-quadratic-regulator","model-predictive-control","trajectory-optimization","iterative-linear-quadratic-regulator","differential-dynamic-programming","reinforcement-learning"],"name":"最优控制","alt":"Optimal Control","abbr":"","aliases":["最优控制问题","OCP","Optimal Control Problem"],"one_liner":"在满足系统动力学的前提下，找一串控制输入让总代价最小。","explanation":"最优控制是控制理论的一个分支，研究在一段时间里怎样选控制输入，使目标函数最优。标准写法是 min J = φ(x(T)) + ∫ L(x, u) dt，约束 ẋ = f(x, u)：x 是状态（如关节角和角速度），u 是控制输入（如力矩），L 是每一时刻的代价（偏离目标、耗能），φ 是终点代价，f 是动力学模型。理论基础是 20 世纪 50 年代的庞特里亚金极大值原理和贝尔曼动态规划。线性动力学加二次代价的特例就是 LQR，解出来是线性反馈 u = −Kx。机器人里的轨迹优化、iLQR/DDP、模型预测控制（每个周期重解一次有限时域最优控制）都属于这一类；强化学习可看作在模型未知时求解同类问题。","example":"百度 Apollo 自动驾驶的横向控制用 LQR 算转向：把「偏离参考轨迹」和「转向幅度」按权重加成代价，求出使总代价最小的反馈增益。","related":["线性二次调节器","模型预测控制","轨迹优化","迭代线性二次调节器","微分动态规划","强化学习"]},{"id":"trajectory-optimization","category":"control","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Trajectory optimization","url":"https://en.wikipedia.org/wiki/Trajectory_optimization"},{"title":"Russ Tedrake, Underactuated Robotics: Trajectory Optimization","url":"https://underactuated.mit.edu/trajopt.html"},{"title":"Lynch & Park, Modern Robotics (2017 preprint), 10.7 Nonlinear Optimization","url":"https://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["optimal-control","direct-collocation","multiple-shooting","model-predictive-control","iterative-linear-quadratic-regulator","contact-implicit-trajectory-optimization"],"name":"轨迹优化","alt":"Trajectory Optimization","abbr":"TO","aliases":["轨迹最优化","Trajectory optimisation"],"one_liner":"把找轨迹写成优化问题：满足动力学和约束，同时让代价最小。","explanation":"轨迹优化把「怎么动」写成数学优化问题：决策变量是一段时间内的状态和控制输入，目标是最小化代价（耗能、用时、偏离目标等），约束包括动力学方程、力矩和关节限位、避障、起终点条件。它本质上是求开环最优控制，只针对一个初始状态求解，比求整个状态空间的反馈律省事得多。数值上多用直接法：直接打靶只优化控制量，状态靠仿真推出；直接配点把状态和控制都当变量，只在配点处强制满足动力学；多重打靶介于两者之间。梯度类方法通常只找到局部最优，初值很关键。每个控制周期重解一次、只执行第一步，就是模型预测控制（MPC）。","example":"Srinivasan 与 Ruina 2006 年发表在 Nature 的研究，用轨迹优化求一个简化双足模型最省能的移动方式，结果低速时「走」更省能、高速时「跑」更省能。","related":["最优控制","直接配点法","多重打靶法","模型预测控制","迭代线性二次调节器","接触隐式轨迹优化"]},{"id":"model-predictive-control","category":"control","sec":4,"tier":1,"sources":[{"title":"Wikipedia: Model predictive control（含 MPC vs. LQR）","url":"https://en.wikipedia.org/wiki/Model_predictive_control"},{"title":"Qin & Badgwell, A survey of industrial model predictive control technology (Control Engineering Practice, 2003)","url":"https://doi.org/10.1016/S0967-0661(02)00186-7"},{"title":"Highly Dynamic Quadruped Locomotion via Whole-Body Impulse Control and Model Predictive Control (arXiv:1909.06586)","url":"https://arxiv.org/abs/1909.06586"},{"title":"qiayuanl/legged_control (GitHub)","url":"https://github.com/qiayuanl/legged_control"}],"as_of":"","related_ids":["convex-mpc","nonlinear-model-predictive-control","sampling-based-mpc","whole-body-control","linear-quadratic-regulator","trajectory-optimization"],"name":"模型预测控制","alt":"Model Predictive Control","abbr":"MPC","aliases":["滚动时域控制","滚动时域优化","Receding Horizon Control","Receding horizon optimization"],"one_liner":"每步用模型预测未来一小段、解优化选出最优动作，只执行第一步再重算。","explanation":"模型预测控制起源于 20 世纪 70 年代的炼油、化工等流程工业，80 年代在这些行业普及。每个控制周期它做同一件事：用系统模型 x_{k+1} = f(x_k, u_k)（x 是状态，u 是控制输入）往后预测 N 步，在关节限位、力矩上限等约束下，求出让代价（如跟踪误差加能耗）最小的一串输入；只执行第一个输入，下个周期用新测量重新求解，所以也叫滚动时域控制。和 PID 只对已经出现的误差做反应相比，它能提前考虑未来和约束；和线性二次调节器（LQR）离线一次算好反馈增益相比，它每步在线重新优化，能直接处理约束和非线性模型。代价是要在线解优化，吃算力、依赖模型精度。足式机器人上常用简化模型规划足底力，再交给全身控制执行。","example":"MIT Mini Cheetah 用 MPC 优化足底反作用力，配合全身冲量控制跑到 3.7 m/s；开源框架 legged_control 用非线性 MPC 控制宇树 A1，作者称在第 11 代 NUC 迷你主机上求解频率接近 200 Hz。","related":["凸 MPC","非线性模型预测控制","采样式 MPC","全身控制","线性二次调节器","轨迹优化"]},{"id":"convex-optimization","category":"control","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Convex optimization","url":"https://en.wikipedia.org/wiki/Convex_optimization"},{"title":"Boyd & Vandenberghe: Convex Optimization（官方免费电子版页面）","url":"https://web.stanford.edu/~boyd/cvxbook/"},{"title":"Dynamic Locomotion in the MIT Cheetah 3 Through Convex Model-Predictive Control (IROS 2018)","url":"https://dspace.mit.edu/handle/1721.1/138000"}],"as_of":"","related_ids":["quadratic-programming","convex-mpc","model-predictive-control","trajectory-optimization","sequential-quadratic-programming","osqp"],"name":"凸优化","alt":"Convex Optimization","abbr":"","aliases":["凸规划","Convex Programming"],"one_liner":"目标是凸函数、可行域是凸集的优化问题，找到的局部最优就是全局最优。","explanation":"凸优化研究在凸集上最小化凸函数：min f(x)，约束 x∈C。f 是凸函数（图像像一只碗，任意两点的连线都在曲线上方），C 是凸集（集合里任意两点的连线仍在集合内）。它最重要的性质是局部最优即全局最优；线性规划、二次规划、二阶锥规划、半定规划等类型都有多项式时间算法（如内点法），求解快且稳定。机器人实时控制大量依赖它：凸 MPC、全身控制里的二次规划、接触力分配，都是有意把问题写成凸的，好在毫秒级可靠求解。非凸问题（如一般的轨迹优化）常用序列二次规划拆成一串凸子问题来近似。","example":"MIT Cheetah 3（2018）把四足机器人简化成单个刚体，把未来最长 0.5 s 的地面反作用力规划写成凸的二次规划，每次求解不到 1 ms，以 20–30 Hz 反复重算，跑出了小跑、疾驰、四足齐跳等步态。","related":["二次规划","凸 MPC","模型预测控制","轨迹优化","序列二次规划","OSQP"]},{"id":"quadratic-programming","category":"control","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Quadratic programming","url":"https://en.wikipedia.org/wiki/Quadratic_programming"},{"title":"OSQP Documentation","url":"https://osqp.org/docs/"},{"title":"Highly Dynamic Quadruped Locomotion via Whole-Body Impulse Control and Model Predictive Control (arXiv:1909.06586)","url":"https://arxiv.org/abs/1909.06586"}],"as_of":"","related_ids":["convex-optimization","whole-body-control","model-predictive-control","hierarchical-quadratic-programming","osqp","friction-cone"],"name":"二次规划","alt":"Quadratic Programming","abbr":"QP","aliases":["QP 求解","二次规划问题","凸二次规划"],"one_liner":"目标是二次函数、约束是线性等式或不等式的优化问题，控制里极常用。","explanation":"二次规划是一类数学优化问题：min ½xᵀQx + cᵀx，约束 Ax ≤ b。x 是待求变量（如关节加速度、力矩、接触力），Q 和 c 描述目标（常是「与期望值的偏差平方」），A、b 表示线性约束（力矩上限、摩擦锥的线性近似等）。Q 半正定时问题是凸的，有全局最优解，可用内点法、有效集法等快速求解，OSQP、qpOASES 是机器人里常用的开源求解器；Q 不满足这一条件时一般是 NP 难。它在机器人控制里常见，是因为「跟踪误差平方最小 + 物理限制」天然就是这种形式：全身控制每个周期解一次 QP 来分配力矩和接触力，凸 MPC 也常写成 QP。","example":"MIT Mini Cheetah 的控制器里，MPC 以 30 Hz 解 QP 规划足端反作用力，全身冲量控制再以 500 Hz 解一个小 QP 修正反作用力，最后得到关节力矩。","related":["凸优化","全身控制","模型预测控制","分层二次规划","OSQP","摩擦锥"]},{"id":"sequential-quadratic-programming","category":"control","sec":4,"tier":3,"sources":[{"title":"Sequential quadratic programming - Wikipedia","url":"https://en.wikipedia.org/wiki/Sequential_quadratic_programming"},{"title":"OCS2 Toolbox 文档（SLQ / iLQR / SQP / IPM 求解器）","url":"https://leggedrobotics.github.io/ocs2/"},{"title":"SciPy minimize(method='SLSQP') 文档","url":"https://docs.scipy.org/doc/scipy/reference/optimize.minimize-slsqp.html"}],"as_of":"","related_ids":["quadratic-programming","trajectory-optimization","nonlinear-model-predictive-control","multiple-shooting","ocs2","acados"],"name":"序列二次规划","alt":"Sequential Quadratic Programming","abbr":"SQP","aliases":["拉格朗日-牛顿法","Lagrange-Newton method"],"one_liner":"把非线性约束优化问题反复近似成二次规划来求解的迭代算法。","explanation":"SQP 用来解目标和约束都是光滑非线性函数的优化问题。每轮迭代在当前解附近，把拉格朗日函数（目标加上乘子乘约束）近似成二次函数、把约束线性化，得到一个二次规划（QP）子问题；解出搜索方向后更新，再重复，直到满足最优性条件（KKT 条件）。它相当于把牛顿法推广到有约束的情形，收敛快，但只保证局部最优，依赖好的初值，还要配合线搜索或信赖域防止走偏。机器人的轨迹优化和非线性 MPC 大量用它：把动力学、关节限位、避障写成约束；在线 MPC 可以用上一周期的解热启动，实时迭代（RTI）方案甚至每周期只做一轮 SQP。与之并列的另一大类是内点法（如 Ipopt）。","example":"ETH 开源的最优控制库 OCS2 提供基于 HPIPM 的多重打靶 SQP 求解器，用于四足和移动操作臂的非线性 MPC；SciPy 的 minimize(method='SLSQP') 也是一种 SQP，可以直接拿来解小规模的逆运动学或参数拟合问题。","related":["二次规划","轨迹优化","非线性模型预测控制","多重打靶法","OCS2","acados"]},{"id":"linear-quadratic-regulator","category":"control","sec":4,"tier":3,"sources":[{"title":"Underactuated Robotics (Russ Tedrake), Ch. Linear Quadratic Regulators","url":"https://underactuated.mit.edu/lqr.html"},{"title":"Linear–quadratic regulator - Wikipedia","url":"https://en.wikipedia.org/wiki/Linear%E2%80%93quadratic_regulator"}],"as_of":"","related_ids":["linear-quadratic-gaussian-control","iterative-linear-quadratic-regulator","optimal-control","model-predictive-control","proportional-integral-derivative-control","inverted-pendulum-model"],"name":"线性二次调节器","alt":"Linear Quadratic Regulator","abbr":"LQR","aliases":["LQR 控制","线性二次型调节器"],"one_liner":"线性系统的最优反馈控制：权衡状态误差和控制代价，解出固定增益 u = −Kx。","explanation":"LQR 是最基础的最优控制方法，理论在 1960 年前后由卡尔曼等人奠定。它假设系统是线性的：ẋ = Ax + Bu，x 是状态，u 是控制输入，矩阵 A、B 描述系统；代价是二次型，即对时间积分 xᵀQx + uᵀRu。Q 表示多在意状态偏离目标，R 表示多在意控制用力，二者由人来调。求解一个 Riccati 方程就得到增益矩阵 K，最优控制是 u = −Kx，运行时只是一次矩阵乘法。和 PID 相比，LQR 天然处理多输入多输出，并直接在「误差」和「用力」之间权衡；和 MPC 相比，它处理不了力矩上限这类约束。机器人是非线性的，常见做法是在平衡点附近线性化再用 LQR，只在该点附近有效；沿一条轨迹逐点线性化就得到时变 LQR，这也是 iLQR 的基础。","example":"把倒立摆或 Acrobot（两连杆体操机器人）在竖直向上的平衡点附近线性化，用 LQR 算出增益，就能把它稳稳顶在倒立位置；两轮平衡车的平衡控制也常用这一套。","related":["线性二次高斯控制","迭代线性二次调节器","最优控制","模型预测控制","PID 控制","倒立摆模型"]},{"id":"state-observer","category":"control","sec":4,"tier":3,"sources":[{"title":"State observer - Wikipedia","url":"https://en.wikipedia.org/wiki/State_observer"}],"as_of":"","related_ids":["kalman-filter","disturbance-observer","generalized-momentum-observer","state-estimation","extended-kalman-filter","linear-quadratic-gaussian-control"],"name":"状态观测器","alt":"State Observer","abbr":"","aliases":["观测器","状态估计器","Luenberger observer","龙伯格观测器"],"one_liner":"用系统模型加上可测的输入和输出，实时推算测不到的内部状态。","explanation":"很多控制器需要完整状态（如关节速度、机身速度），但传感器只测到一部分。状态观测器按系统模型同步推演一份估计 x̂，再用实测输出 y 与预测输出 Cx̂ 的差来纠正：dx̂/dt = A x̂ + B u + L (y − C x̂)，其中 A、B、C 是线性模型矩阵，u 是控制输入，L 是观测器增益，L 越大纠正越快，也越放大噪声。这就是 David Luenberger 提出的 Luenberger 观测器，前提是系统可观，即能从输出唯一推断状态；按分离原理，状态反馈和观测器可分开设计。卡尔曼滤波可看作按噪声统计最优选取 L 的观测器；机器人里的扰动观测器、动量观测器则是专门估计外力的变体。","example":"电机只有编码器测位置 θ：把状态设为 [θ, ω]（ω 为角速度），把电流对应的力矩当作输入 u，观测器在修正位置估计的同时给出 ω 的估计，比直接对位置做差分得到的速度噪声更小。","related":["卡尔曼滤波","扰动观测器","动量观测器","状态估计","扩展卡尔曼滤波","线性二次高斯控制"]},{"id":"kalman-filter","category":"control","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Kalman filter","url":"https://en.wikipedia.org/wiki/Kalman_filter"},{"title":"Kalman, A New Approach to Linear Filtering and Prediction Problems, J. Basic Engineering 82 (1960)","url":"https://doi.org/10.1115/1.3662552"},{"title":"MIT Cheetah-Software: PositionVelocityEstimator.h（LinearKFPositionVelocityEstimator）","url":"https://github.com/mit-biomimetics/Cheetah-Software/blob/master/common/include/Controllers/PositionVelocityEstimator.h"}],"as_of":"","related_ids":["extended-kalman-filter","unscented-kalman-filter","state-estimation","multi-sensor-fusion","inertial-measurement-unit","leg-odometry"],"name":"卡尔曼滤波","alt":"Kalman Filter","abbr":"KF","aliases":["卡尔曼滤波器","线性卡尔曼滤波","Linear Kalman Filter"],"one_liner":"把模型预测和带噪声的测量按各自可信度加权融合，逐步估计系统状态。","explanation":"Rudolf Kálmán 1960 年在论文《A New Approach to Linear Filtering and Prediction Problems》中提出，后用于阿波罗计划的轨道估计。每个周期分两步：预测，用运动模型推出当前状态及其不确定性（协方差）；更新，拿到测量 z 后按 x̂ = x̂⁻ + K(z − Hx̂⁻) 修正，x̂⁻ 为预测值，H 把状态换算成应有的测量，K 为卡尔曼增益，测量越可信 K 越大。线性模型、高斯噪声且噪声协方差已知时，它是最优估计。机器人模型多为非线性，常用扩展卡尔曼滤波（EKF）、无迹卡尔曼滤波（UKF）等变体，融合 IMU、编码器、视觉估计机身位姿和速度。","example":"MIT Cheetah 3 和 Mini Cheetah 的开源控制代码用线性卡尔曼滤波估计机身位置和速度：IMU 加速度用于预测，支撑腿运动学算出的足端相对位置和速度作为测量，并按触地状态调整对每条腿的信任度。","related":["扩展卡尔曼滤波","无迹卡尔曼滤波","状态估计","多传感器融合","惯性测量单元","腿式里程计"]},{"id":"extended-kalman-filter","category":"control","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Extended Kalman filter","url":"https://en.wikipedia.org/wiki/Extended_Kalman_filter"},{"title":"robot_localization 文档首页（ekf_localization_node，15 维状态）","url":"https://github.com/cra-ros-pkg/robot_localization/blob/ros2/doc/index.rst"},{"title":"State Estimation for Legged Robots - Consistent Fusion of Leg Kinematics and IMU (Bloesch et al., RSS 2012)","url":"https://www.roboticsproceedings.org/rss08/p03.pdf"}],"as_of":"","related_ids":["kalman-filter","unscented-kalman-filter","error-state-kalman-filter","state-estimation","leg-odometry","multi-sensor-fusion"],"name":"扩展卡尔曼滤波","alt":"Extended Kalman Filter","abbr":"EKF","aliases":["扩展卡尔曼滤波器"],"one_liner":"把非线性系统在当前估计点线性化，再套用卡尔曼滤波做状态估计的方法。","explanation":"扩展卡尔曼滤波是卡尔曼滤波在非线性系统上的推广，20 世纪 60 年代主要在 NASA 艾姆斯研究中心为导航问题发展起来。标准卡尔曼滤波只适用于线性模型；EKF 每一步用雅可比矩阵（各输出对各状态的偏导数）把非线性的运动模型和观测模型在当前估计点做一阶泰勒展开，再照常执行「预测—更新」：先用运动模型推算新状态和不确定度，再用传感器读数修正。它计算量小、实现成熟，是导航领域的事实标准；但它只是近似，非线性很强时可能发散，这时可换无迹卡尔曼滤波或误差状态卡尔曼滤波。足式机器人常用它融合 IMU 和腿部运动学，估计机身位姿和速度。","example":"ROS 的 robot_localization 包提供 ekf_localization_node，可把轮式里程计、IMU、GPS 等任意多路数据融合，输出 15 维状态：三维位置、姿态（横滚/俯仰/偏航）、线速度、角速度和线加速度。","related":["卡尔曼滤波","无迹卡尔曼滤波","误差状态卡尔曼滤波","状态估计","腿式里程计","多传感器融合"]},{"id":"linear-quadratic-gaussian-control","category":"control","sec":4,"tier":3,"sources":[{"title":"Linear–quadratic–Gaussian control - Wikipedia","url":"https://en.wikipedia.org/wiki/Linear%E2%80%93quadratic%E2%80%93Gaussian_control"}],"as_of":"","related_ids":["linear-quadratic-regulator","kalman-filter","state-estimation","optimal-control","robust-control","state-observer"],"name":"线性二次高斯控制","alt":"Linear Quadratic Gaussian Control","abbr":"LQG","aliases":["LQG 控制","线性二次高斯"],"one_liner":"状态测不全且有噪声时，先用卡尔曼滤波估计状态、再用 LQR 求控制的最优方法。","explanation":"LQG 是一个经典最优控制问题：系统是线性的，过程和测量都带高斯白噪声，状态不能全部直接测到，目标是让二次型代价的期望值最小。它的解由两块拼成：卡尔曼滤波器从带噪声的传感器读数里估计当前状态 x̂，LQR 再用这个估计值算控制量 u = −K·x̂（K 是 LQR 增益）。两块可以分开设计、各自最优，拼在一起仍是整体最优，这叫分离原理。和 LQR 的区别在于：LQR 假设状态全部精确已知，LQG 面对的是测量不全、有噪声的现实情况。要注意 LQR 自带不错的稳定裕度，LQG 却没有这种保证，Doyle 1978 年的论文专门指出了这一点，所以工程上还要另外检查鲁棒性。它是理解机器人「状态估计 + 控制」分工的基础模型。","example":"倒立摆小车只装了测小车位置和摆角的编码器，速度需要估计且读数有噪声：用卡尔曼滤波估计位置、速度、摆角、角速度四个状态，再乘上 LQR 增益算出电机指令，就构成一个 LQG 控制器。","related":["线性二次调节器","卡尔曼滤波","状态估计","最优控制","鲁棒控制","状态观测器"]},{"id":"iterative-linear-quadratic-regulator","category":"control","sec":4,"tier":3,"sources":[{"title":"Underactuated Robotics (Russ Tedrake), Ch. Trajectory Optimization: Iterative LQR and DDP","url":"https://underactuated.mit.edu/trajopt.html"},{"title":"Differential dynamic programming - Wikipedia","url":"https://en.wikipedia.org/wiki/Differential_dynamic_programming"},{"title":"MuJoCo MPC (MJPC) README","url":"https://github.com/google-deepmind/mujoco_mpc"}],"as_of":"","related_ids":["linear-quadratic-regulator","differential-dynamic-programming","trajectory-optimization","model-predictive-control","nonlinear-model-predictive-control","mujoco-mpc"],"name":"迭代线性二次调节器","alt":"Iterative Linear Quadratic Regulator","abbr":"iLQR","aliases":["迭代 LQR","Iterative LQR"],"one_liner":"把非线性系统沿当前轨迹反复线性化、每轮用 LQR 求修正量的轨迹优化算法。","explanation":"iLQR 是一种轨迹优化算法，一般以 Li 与 Todorov 2004 年的论文为出处。LQR 只能处理线性系统，而机器人动力学是非线性的。iLQR 的做法是：先给一条初始控制序列并模拟出轨迹；在轨迹的每个时刻把动力学线性化、把代价函数做二次近似，得到一个时变 LQR 问题；从终点往回做一遍 Riccati 递推（反向传播），求出每一步的修正量和反馈增益，再从起点往前模拟出新轨迹（正向传播）；重复直到收敛。它是微分动态规划（DDP，Mayne 1966 年提出）的简化版：DDP 还用到动力学的二阶导数，iLQR 省掉这一项，实践中通常收敛得差不多快、计算更省。结果除了一条轨迹，还附带沿途的反馈增益。和 MPC 结合时，每个控制周期从当前状态重解一遍；考虑噪声的扩展版叫 iLQG。","example":"DeepMind 开源的 MuJoCo MPC（MJPC）内置了 iLQG 规划器：每个控制周期以当前状态为起点，重新优化一段未来的控制序列，用来实时控制仿真中的机器人模型。","related":["线性二次调节器","微分动态规划","轨迹优化","模型预测控制","非线性模型预测控制","MuJoCo MPC"]},{"id":"differential-dynamic-programming","category":"control","sec":4,"tier":3,"sources":[{"title":"Wikipedia: Differential dynamic programming","url":"https://en.wikipedia.org/wiki/Differential_dynamic_programming"},{"title":"loco-3d/crocoddyl（solvers based on DDP algorithms）","url":"https://github.com/loco-3d/crocoddyl"}],"as_of":"","related_ids":["iterative-linear-quadratic-regulator","linear-quadratic-regulator","trajectory-optimization","model-predictive-control","optimal-control","crocoddyl"],"name":"微分动态规划","alt":"Differential Dynamic Programming","abbr":"DDP","aliases":["DDP 算法"],"one_liner":"沿当前轨迹做二阶近似、反复前后扫描，逐步改进控制序列的轨迹优化方法。","explanation":"DDP 是求解非线性最优控制的迭代算法，由 David Mayne 在 1966 年提出，后经 Jacobson 与 Mayne 的同名专著系统化。给定一条初始控制序列，它反复做两步：反向扫描时，在当前轨迹附近把动力学和代价做二阶展开，从终点往回算出每一步的修正量 k = −Q_uu⁻¹Q_u 和反馈增益 K = −Q_uu⁻¹Q_ux，其中 Q 是「这一步选控制 u、之后都按最优走」的总代价，下标表示对 u 或状态 x 求导；正向扫描时按 u = ū + αk + K(x − x̄) 重新仿真出新轨迹（ū、x̄ 是旧轨迹，α 是线搜索步长）。它在最优解附近二次收敛，还顺带给出反馈增益，适合做 MPC。把动力学的二阶导项丢掉，就是更常用的 iLQR。它属于打靶类方法，状态靠仿真得到，处理状态约束不如配点法方便。","example":"开源库 Crocoddyl 以 DDP 及其变体 FDDP 为核心求解器，借助 Pinocchio 的解析导数，为足式机器人等计算带接触序列的最优轨迹和对应的反馈增益。","related":["迭代线性二次调节器","线性二次调节器","轨迹优化","模型预测控制","最优控制","Crocoddyl"]},{"id":"direct-collocation","category":"control","sec":4,"tier":3,"sources":[{"title":"Underactuated Robotics (Tedrake), Ch. Trajectory Optimization","url":"https://underactuated.mit.edu/trajopt.html"},{"title":"Drake: DirectCollocation Class Reference","url":"https://drake.mit.edu/doxygen_cxx/classdrake_1_1planning_1_1trajectory__optimization_1_1_direct_collocation.html"},{"title":"Matthew Kelly: Trajectory Optimization tutorials","url":"https://www.matthewpeterkelly.com/tutorials/trajectoryOptimization/index.html"}],"as_of":"","related_ids":["trajectory-optimization","multiple-shooting","sequential-quadratic-programming","contact-implicit-trajectory-optimization","drake","interior-point-optimizer"],"name":"直接配点法","alt":"Direct Collocation","abbr":"","aliases":["配点法","直接配置法","Collocation method"],"one_liner":"把轨迹切成节点，把动力学写成节点间的约束，转成一个大优化问题来求解。","explanation":"直接配点法是轨迹优化里最常用的「转写」方法之一，由 Hargraves 和 Paris 在 1987 年提出，作用是把连续时间的最优控制问题变成有限维的非线性规划（NLP）。做法是把时间切成 N 段，每个节点上的状态 x_k 和控制 u_k 都当优化变量，节点之间用多项式连起来（常见是控制分段线性、状态用三次样条），再要求多项式在配点（如区间中点）处的导数等于动力学 ẋ = f(x, u)，用这些等式约束保证轨迹符合物理。打靶法只优化控制、状态靠仿真积分得到，时域一长就对初值很敏感；配点法把状态也当变量，初值可以随手画一条，状态约束好加，问题稀疏，适合交给 IPOPT、SNOPT 等求解器。缺点是变量多，迭代中途的轨迹不一定满足动力学。多重打靶法介于两者之间。","example":"小车倒立摆摆起：把整段时间切成若干节点，以每个节点的小车位置、摆角、速度和推力为变量，约束相邻节点满足动力学、终点摆杆竖直，目标是推力平方和最小，求解后得到一条摆起轨迹。Matthew Kelly 发表在 SIAM Review 的入门教程专讲这一方法，Drake 里也有现成的 DirectCollocation 类。","related":["轨迹优化","多重打靶法","序列二次规划","接触隐式轨迹优化","Drake","Ipopt"]},{"id":"multiple-shooting","category":"control","sec":4,"tier":3,"sources":[{"title":"Wikipedia: Direct multiple shooting method","url":"https://en.wikipedia.org/wiki/Direct_multiple_shooting_method"},{"title":"Perceptive Locomotion through Nonlinear Model Predictive Control (arXiv 2208.08373)","url":"https://arxiv.org/abs/2208.08373"}],"as_of":"","related_ids":["direct-collocation","trajectory-optimization","sequential-quadratic-programming","nonlinear-model-predictive-control","optimal-control","acados"],"name":"多重打靶法","alt":"Multiple Shooting","abbr":"","aliases":["多重打靶","直接多重打靶法","Direct Multiple Shooting"],"one_liner":"把长轨迹切成多段分别积分、再用衔接约束拼接起来的最优控制求解方法。","explanation":"多重打靶法是求解轨迹优化和最优控制问题的一种转录方法，即把连续时间问题变成有限个变量的非线性规划。先看单重打靶：只把控制量当优化变量，从初始状态一口气积分到终点，看是否「打中」目标再调整控制；轨迹一长或系统不稳定，初值的小变化会被放大，很难收敛。多重打靶把时间切成若干段，每段起点的状态也作为优化变量，各段分别积分，再加衔接条件：上一段积分到末尾的状态必须等于下一段的起始状态。这样非线性被分散到短段里，数值上稳定得多，各段还能并行计算。1984 年 Bock 和 Plitt 把它用于最优控制。它和直接配点法是两种主流转录方式，形成的问题常用序列二次规划（SQP）求解，OCS2、acados 等 NMPC 工具都支持。","example":"ANYmal 四足的感知式 NMPC（Grandia 等人，2022）用多重打靶离散未来一段时间的运动，再用 SQP 以 100 Hz 求解，实时生成跨沟壑、踩踏脚石的动作。","related":["直接配点法","轨迹优化","序列二次规划","非线性模型预测控制","最优控制","acados"]},{"id":"contact-implicit-trajectory-optimization","category":"control","sec":4,"tier":3,"sources":[{"title":"Posa, Cantu, Tedrake: A Direct Method for Trajectory Optimization of Rigid Bodies Through Contact","url":"https://groups.csail.mit.edu/robotics-center/public_papers/Posa13.pdf"},{"title":"Le Cleac'h et al., Fast Contact-Implicit Model-Predictive Control (arXiv:2107.05616)","url":"https://arxiv.org/abs/2107.05616"}],"as_of":"","related_ids":["trajectory-optimization","linear-complementarity-problem","sequential-quadratic-programming","direct-collocation","multi-contact-planning","gait-planning"],"name":"接触隐式轨迹优化","alt":"Contact-Implicit Trajectory Optimization","abbr":"","aliases":["接触隐式优化","接触隐式 MPC","Contact-implicit MPC","CI-MPC","Through-contact Trajectory Optimization"],"one_liner":"不预先规定接触顺序，让优化器自己决定何时、何处与环境接触。","explanation":"传统轨迹优化把「脚着地」「手碰到物体」当成离散模式，要先人工指定模式顺序（先左脚再右脚），再在每段内优化。对多指操作这类接触频繁变化的任务，这个顺序根本没法事先写。MIT 的 Posa、Cantu 与 Tedrake 提出的直接法（2012 年 WAFR 初版，2014 年发表于 IJRR）把接触力也设为决策变量，用互补约束描述接触：距离 φ ≥ 0、法向力 λ ≥ 0 且 φ·λ = 0，意思是「不接触就没有力，有力就必须贴着」，再用序列二次规划求解，接触时序和轨迹一并得出。这套约束来自物理引擎里的线性互补问题。代价是问题非凸、难收敛，常需松弛或平滑处理；后来又发展出可在线运行的接触隐式 MPC。","example":"Posa 等人用同一套方法规划了手指转动固定轴物体、简单抓取与操作、Spring Flamingo 平面行走和 FastRunner 双足高速奔跑，全程没有指定接触顺序；Le Cleac'h 等人 2021 年提出的快速接触隐式 MPC 在四足机器人真机上实时生成了非周期动作。","related":["轨迹优化","线性互补问题","序列二次规划","直接配点法","多接触规划","接触时序（步态调度器）"]},{"id":"nonlinear-model-predictive-control","category":"control","sec":4,"tier":3,"sources":[{"title":"Wikipedia: Model predictive control","url":"https://en.wikipedia.org/wiki/Model_predictive_control"},{"title":"GitHub: qiayuanl/legged_control","url":"https://github.com/qiayuanl/legged_control"},{"title":"Perceptive Locomotion through Nonlinear Model Predictive Control (arXiv 2208.08373)","url":"https://arxiv.org/abs/2208.08373"}],"as_of":"","related_ids":["model-predictive-control","convex-mpc","multiple-shooting","sequential-quadratic-programming","whole-body-control","legged-control"],"name":"非线性模型预测控制","alt":"Nonlinear Model Predictive Control","abbr":"NMPC","aliases":["非线性MPC","Nonlinear MPC"],"one_liner":"用非线性动力学模型预测未来、每个周期在线求解优化问题的 MPC。","explanation":"模型预测控制（MPC）的做法是：每个控制周期用系统模型预测未来一段时间的状态，求解一个优化问题，得到让代价最小且满足约束的一串控制量，只执行第一个，下个周期用新的测量值重算，称为滚动时域。NMPC 是模型或约束为非线性的 MPC，例如直接用机器人的全身刚体动力学或质心动力学，而不先做线性化。好处是在大幅度、快速运动中预测更准，能直接处理摩擦锥、落足区域、避障等非线性约束；代价是优化问题非凸，计算量大，也不保证找到全局最优。实际中常用多重打靶或直接配点离散问题，用序列二次规划（SQP）求解，并采用「实时迭代」：每个周期只迭代一两步、不追求完全收敛，以赶上控制频率。常用工具有 acados、OCS2、CasADi。凸 MPC 则把模型简化成线性、问题是凸的，更快但适用范围窄。","example":"legged_control 开源框架在宇树 A1 四足上用 NMPC（基于 OCS2，多重打靶 + SQP 求解）把期望的躯干速度转成未来的状态轨迹，再交给全身控制器算关节力矩。","related":["模型预测控制","凸 MPC","多重打靶法","序列二次规划","全身控制","legged_control"]},{"id":"sampling-based-mpc","category":"control","sec":4,"tier":3,"sources":[{"title":"Predictive Sampling: Real-time Behaviour Synthesis with MuJoCo (Howell et al., arXiv 2212.00541)","url":"https://arxiv.org/abs/2212.00541"},{"title":"Information Theoretic Model Predictive Control: Theory and Applications to Autonomous Driving (Williams et al., arXiv 1707.02342)","url":"https://arxiv.org/abs/1707.02342"},{"title":"Full-Order Sampling-Based MPC for Torque-Level Locomotion Control via Diffusion-Style Annealing (DIAL-MPC, arXiv 2409.15610)","url":"https://arxiv.org/abs/2409.15610"}],"as_of":"","related_ids":["model-predictive-control","model-predictive-path-integral-control","cross-entropy-method","dial-mpc","mujoco-mpc","trajectory-optimization"],"name":"采样式 MPC","alt":"Sampling-based MPC","abbr":"","aliases":["基于采样的MPC","采样MPC","Sampling-based Model Predictive Control"],"one_liner":"每个周期随机采样一批动作序列，在模型里推演打分，挑最好的执行第一步。","explanation":"模型预测控制（MPC）每个周期都优化未来一小段的动作序列，只执行第一步再重算。传统求解靠梯度或二次规划，要求模型可导、代价光滑。采样式 MPC 改为：在上一轮最优序列附近加噪声采出几十到上千条候选，用动力学模型（常是物理仿真器）并行推演并算代价，再挑最好的一条或按代价加权平均出新序列。代表方法有 MPPI（权重正比于 exp(−代价/λ)，λ 为温度系数）、交叉熵方法 CEM（保留代价最低的一批重新拟合采样分布），以及 DeepMind 2022 年随 MuJoCo MPC 发布的最简版 Predictive Sampling。它不需要导数、能处理接触这类不光滑动力学、易于 GPU 并行，缺点是动作维度高时采样效率下降。","example":"CMU 等 2024 年提出的 DIAL-MPC 借鉴扩散模型逐步降噪的退火思路，不经训练直接在四足全阶动力学上做力矩级采样优化，论文报告跟踪误差比标准 MPPI 低 13.4 倍，并在真机上完成带负载的精准跳跃。","related":["模型预测控制","模型预测路径积分控制","交叉熵方法","DIAL-MPC","MuJoCo MPC","轨迹优化"]},{"id":"model-predictive-path-integral-control","category":"control","sec":4,"tier":3,"sources":[{"title":"Williams et al.: Information Theoretic Model Predictive Control: Theory and Applications to Autonomous Driving (arXiv:1707.02342, T-RO)","url":"https://arxiv.org/abs/1707.02342"},{"title":"Williams, Aldrich, Theodorou: Model Predictive Path Integral Control using Covariance Variable Importance Sampling (arXiv:1509.01149)","url":"https://arxiv.org/abs/1509.01149"},{"title":"Nav2 MPPI Controller README","url":"https://github.com/ros-navigation/navigation2/blob/main/nav2_mppi_controller/README.md"}],"as_of":"2026-09","related_ids":["model-predictive-control","sampling-based-mpc","cross-entropy-method","dial-mpc","ros-2-navigation-stack","optimal-control"],"name":"模型预测路径积分控制","alt":"Model Predictive Path Integral Control","abbr":"MPPI","aliases":["MPPI 控制","信息论 MPC","IT-MPC"],"one_liner":"每个周期随机采样大量控制序列并模拟，按代价加权平均出动作的采样式 MPC。","explanation":"MPPI 是一种基于采样的模型预测控制，由佐治亚理工的 Grady Williams、Evangelos Theodorou 等人在 2015–2017 年间提出，理论来自路径积分最优控制和信息论。和普通 MPC 一样，它每个周期只执行优化结果的第一步，然后从新状态重来。不同在于求解方式：以上一轮的控制序列为中心加随机噪声，采样成百上千条候选控制序列，用动力学模型把每条向前模拟，算出各自的代价 S，再按 exp(−S/λ) 加权平均得到新的控制序列，λ 是温度参数，越小越偏向代价最低的几条。它不需要求梯度或线性化，代价函数可以不光滑（比如碰撞惩罚），动力学也可以是神经网络，各条样本互相独立，适合 GPU 并行。缺点是需要大量样本，动作维度高时效率下降。和交叉熵方法相比，后者只用代价最低的一批样本更新，MPPI 则按指数权重用上全部样本。","example":"在 1:5 比例的 AutoRally 越野车上，MPPI 在 GPU 上并行模拟几千条 2–3 秒长的轨迹，控制频率 40–60 Hz，完成泥地赛道上的激进驾驶；ROS 2 导航框架 Nav2 也内置了 MPPI 控制器，默认每周期采样 1000 条轨迹，在普通 CPU 上可跑到 50 Hz 以上。","related":["模型预测控制","采样式 MPC","交叉熵方法","DIAL-MPC","Nav2","最优控制"]},{"id":"cross-entropy-method","category":"control","sec":4,"tier":3,"sources":[{"title":"Wikipedia: Cross-entropy method","url":"https://en.wikipedia.org/wiki/Cross-entropy_method"},{"title":"Hafner et al., Learning Latent Dynamics for Planning from Pixels (PlaNet, arXiv:1811.04551)","url":"https://arxiv.org/abs/1811.04551"},{"title":"Kalashnikov et al., QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation (arXiv:1806.10293)","url":"https://arxiv.org/abs/1806.10293"}],"as_of":"","related_ids":["sampling-based-mpc","model-predictive-path-integral-control","model-predictive-control","model-based-reinforcement-learning","planet","qt-opt"],"name":"交叉熵方法","alt":"Cross-Entropy Method","abbr":"CEM","aliases":["交叉熵法","CEM 规划","CEM 优化"],"one_liner":"反复「采样一批、留下最好的、据此更新分布」的无梯度优化方法。","explanation":"交叉熵方法由 Rubinstein 在 1990 年代末提出，最初用于估计罕见事件的概率，后来成为通用的随机优化方法。流程是：从一个分布（通常是高斯）采样一批候选解，逐个打分，保留最好的一小部分（叫精英样本），用精英样本的均值和方差重新拟合分布，再采样；迭代几轮后分布就集中到好解附近。它不需要梯度、容易并行，适合目标是仿真器或神经网络这类黑箱的情况。机器人里常见两种用法：一是作为采样式 MPC，对未来一串动作做 CEM，只执行第一步再重新规划；二是在连续动作空间里找让 Q 函数最大的动作。它和 MPPI 的区别在于：CEM 只用精英样本且等权平均，MPPI 按代价的指数权重使用全部样本。","example":"PlaNet 在学到的世界模型里用 CEM 规划：时域 12 步，每轮采样 1000 条动作序列、保留最好的 100 条，迭代 10 轮；QT-Opt 用 CEM 在 Q 函数上找最佳抓取动作，每轮采样 64 个、保留 6 个，迭代 2 轮，训练时算目标值和真机执行时选动作都靠它。","related":["采样式 MPC","模型预测路径积分控制","模型预测控制","基于模型的强化学习","PlaNet","QT-Opt"]},{"id":"visual-foresight","category":"control","sec":4,"tier":3,"sources":[{"title":"Finn, Levine: Deep Visual Foresight for Planning Robot Motion (arXiv:1610.00696, ICRA 2017)","url":"https://arxiv.org/abs/1610.00696"},{"title":"Ebert et al.: Visual Foresight: Model-Based Deep RL for Vision-Based Robotic Control (arXiv:1812.00568)","url":"https://arxiv.org/abs/1812.00568"},{"title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning (arXiv:2411.04983)","url":"https://arxiv.org/abs/2411.04983"}],"as_of":"2025-06","related_ids":["world-model","video-prediction-model","model-predictive-control","cross-entropy-method","dino-wm","v-jepa-2"],"name":"视觉预见 / 基于学习模型的规划","alt":"Visual Foresight / Planning with Learned (World) Models","abbr":"","aliases":["Visual Foresight","Visual MPC","视觉模型预测控制","Planning with Learned World Models"],"one_liner":"先学会预测「做这个动作后画面会变成什么样」，再在想象里挑最好的动作。","explanation":"视觉预见由 UC Berkeley 的 Chelsea Finn 与 Sergey Levine 在 ICRA 2017 提出（Deep Visual Foresight），2018 年 Ebert、Finn 等整理成完整框架。它分两步：先用机器人自主推动物体收集的无标注数据，训练一个以动作为条件的视频预测模型，输入当前画面和一串候选动作，输出未来几帧画面；再做视觉模型预测控制（MPC）：采样大量候选动作序列（常用交叉熵方法迭代优化），让模型「想象」结果，按离目标有多近打分，只执行最优序列的第一步，然后重新规划。目标可以是「把某个像素移到某处」、一张目标图片或一个分类器。它不需要奖励函数和人工标注，能用在没见过的物体上。这就是今天「世界模型 + 规划」路线的前身：DINO-WM、V-JEPA 2-AC 等把预测从像素搬到预训练特征空间，仍用 MPC 选动作。","example":"在机器人相机画面上点出桌面某个物体上的一个像素，再指定它该去的位置；机器人在想象中试推大量动作序列，选出预测中把该像素推得最近的那组，执行一步后重新规划。","related":["世界模型","视频预测模型","模型预测控制","交叉熵方法","DINO-WM","V-JEPA 2"]},{"id":"gait","category":"control","sec":5,"tier":1,"sources":[{"title":"Wikipedia: Gait（duty factor, symmetrical/asymmetrical gaits）","url":"https://en.wikipedia.org/wiki/Gait"},{"title":"Walk These Ways: Tuning Robot Control for Generalization with Multiplicity of Behavior (arXiv:2212.03238)","url":"https://arxiv.org/html/2212.03238"}],"as_of":"","related_ids":["trot-gait","pace-gait","bound-gait","gait-cycle-and-duty-factor","gait-planning","legged-locomotion"],"name":"步态","alt":"Gait","abbr":"","aliases":["步态模式","Gait pattern","Locomotion gait"],"one_liner":"腿足动物或机器人移动时，各条腿抬起、落地的先后顺序和节奏。","explanation":"步态指腿足运动中各条腿何时着地、何时抬起的时序模式。描述它常用两个量：占空比，即一条腿在一个步态周期里着地时间的占比，超过 50% 一般算走、低于 50% 算跑；以及各腿之间的相位差。四足常见步态有对角小跑（trot，对角两腿同时着地）、踱步（pace，同侧两腿同步）、跳跃（bound，前两腿、后两腿各自同步）、四腿齐跳（pronk）和疾驰（gallop）；人形机器人主要是双足交替的走和跑。传统控制器通常先规定步态时序，再据此规划落足点和支撑力；强化学习运控可以只给速度指令让步态自然形成，也可以把步频、相位差作为指令输入来指定步态。","example":"Walk These Ways 用三个脚间相位差来指定四足步态：(0.5, 0, 0) 是对角小跑，(0, 0.5, 0) 是跳跃，(0, 0, 0.5) 是踱步，全为 0 是四腿齐跳；同一个策略改一下输入就能换步态。","related":["对角小跑步态","踱步步态","跳跃步态","步态周期与占空比","步态规划","腿足运动"]},{"id":"trot-gait","category":"control","sec":5,"tier":2,"sources":[{"title":"Wikipedia: Trot","url":"https://en.wikipedia.org/wiki/Trot"},{"title":"Walk These Ways: Tuning Robot Control for Generalization with Multiplicity of Behavior (arXiv:2212.03238)","url":"https://arxiv.org/abs/2212.03238"}],"as_of":"","related_ids":["gait","pace-gait","bound-gait","gallop-gait","gait-cycle-and-duty-factor","support-polygon"],"name":"对角小跑步态","alt":"Trot Gait","abbr":"","aliases":["小跑步态","对角步态","Trot","Trotting"],"one_liner":"四足动物或机器人对角两条腿成对同时落地、两组交替迈步的步态。","explanation":"对角小跑（trot）原指马的步态：左前腿与右后腿为一组，右前腿与左后腿为另一组，两组交替落地，是两拍节奏；马小跑时两拍之间还有四蹄离地的腾空瞬间。它也是四足机器人上常见的基础步态。和其他两拍步态相比：踱步（pace）是同侧两腿一起动，跳跃（bound）是前两腿、后两腿各为一组，四腿同时起落则叫 pronk。小跑时多数时刻只有两只脚着地，支撑多边形退化成一条对角线，停在原地站不稳，要靠持续迈步维持动态平衡；好处是前后、左右都对称，适用的速度范围宽。","example":"MIT 的 Walk These Ways（2022）在宇树 Go1 上用一个策略切换多种步态：用三个相位偏移描述各腿落地时刻，(0.5, 0, 0) 对应小跑，(0, 0, 0) 是四腿同步的 pronk，(0, 0.5, 0) 是跳跃，(0, 0, 0.5) 是踱步；另有步频参数，3 Hz 表示每只脚每秒着地 3 次。","related":["步态","踱步步态","跳跃步态","疾驰步态","步态周期与占空比","支撑多边形"]},{"id":"gait-planning","category":"control","sec":5,"tier":2,"sources":[{"title":"MIT Cheetah-Software ConvexMPCLocomotion.cpp（步态偏移与时长定义）","url":"https://github.com/mit-biomimetics/Cheetah-Software/blob/master/user/MIT_Controller/Controllers/convexMPC/ConvexMPCLocomotion.cpp"},{"title":"Walk These Ways: Tuning Robot Control for Generalization with Multiplicity of Behavior (arXiv 2212.03238)","url":"https://arxiv.org/abs/2212.03238"},{"title":"Dynamic Locomotion in the MIT Cheetah 3 Through Convex Model-Predictive Control (IROS 2018)","url":"https://dspace.mit.edu/handle/1721.1/138000"}],"as_of":"","related_ids":["gait","gait-planning","gait-cycle-and-duty-factor","footstep-planning","convex-mpc","central-pattern-generator"],"name":"步态规划","alt":"Gait Planning","abbr":"","aliases":["步态调度","步态生成","Gait scheduler","接触时序规划"],"one_liner":"决定腿足机器人每条腿何时着地、何时抬起以及迈步节奏的规划。","explanation":"步态规划决定腿足机器人各条腿的接触时序：一个步态周期里每条腿何时着地（支撑相）、何时抬起（摆动相），着地时间占周期的比例（占空比），各腿之间的相位差和步频。不同组合对应不同步态：四足对角两腿同步是小跑，同侧两腿同步是踱步，前后腿成对是跳跃步态，四腿同时起落是齐跳。模型化控制里，步态调度器先给出这张接触时间表，MPC 再据此给支撑腿分配地面反作用力，落足点规划决定摆动腿落在哪。强化学习运控常用相位时钟信号或奖励项引导步态，也可以让步态自己涌现。它和落足点规划互补：一个管什么时候踩，一个管踩在哪。","example":"MIT Cheetah 开源代码把一个步态周期分成 10 段，小跑写成四条腿相位偏移 (0,5,5,0)、各支撑 5 段，即对角腿同步、每条腿一半时间着地；齐跳则四条腿偏移全为 0。Walk These Ways（2022）把这类相位偏移做成策略的输入指令，(0.5,0,0) 对应小跑，(0,0.5,0) 对应跳跃步态。","related":["步态","接触时序（步态调度器）","步态周期与占空比","落足点规划","凸 MPC","中枢模式发生器"]},{"id":"gait-phase","category":"control","sec":5,"tier":3,"sources":[{"title":"Siekmann et al., Sim-to-Real Learning of All Common Bipedal Gaits via Periodic Reward Composition (arXiv 2011.01387, ICRA 2021)","url":"https://arxiv.org/abs/2011.01387"},{"title":"unitree_rl_gym: legged_gym/envs/g1/g1_env.py","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/legged_gym/envs/g1/g1_env.py"}],"as_of":"","related_ids":["gait","stance-phase-swing-phase","gait-cycle-and-duty-factor","gait-planning","trot-gait","gait-phase-variable-clock-input"],"name":"步态相位（相位时钟）","alt":"Gait Phase (Phase Clock / Periodic Gait Signal)","abbr":"","aliases":["相位时钟","步态时钟","gait phase"],"one_liner":"用一个在 0 到 1 之间循环的数，表示当前处在步态周期的哪一刻。","explanation":"足式行走是周期运动，每条腿在支撑相（着地承重）和摆动相（离地前摆）之间交替。步态相位 φ 把一个周期归一化到 [0,1)：φ = (t mod T)/T，t 是时间，T 是步态周期。给各条腿加相位偏移就定义了步态，例如双足左右腿相差 0.5 就是交替迈步，四足对角腿同相就是小跑。模型控制里它由步态调度器给出，决定何时切换接触；强化学习里，Siekmann 等人（ICRA 2021）用它构造周期奖励——支撑相惩罚脚的速度、摆动相惩罚脚的受力，不用参考动作就在 Cassie 双足上学出走、跑、跳等步态。","example":"unitree_rl_gym 的 G1 行走环境取周期 0.8 秒、左右腿相位差 0.5，某条腿相位小于 0.55 时视为应当支撑，并奖励实际触地状态与之一致。","related":["步态","支撑相 / 摆动相","步态周期与占空比","接触时序（步态调度器）","对角小跑步态","步态相位（相位时钟输入）"]},{"id":"central-pattern-generator","category":"control","sec":5,"tier":3,"sources":[{"title":"Wikipedia: Central pattern generator","url":"https://en.wikipedia.org/wiki/Central_pattern_generator"},{"title":"Ijspeert A. J. Central pattern generators for locomotion control in animals and robots: a review. Neural Networks, 2008","url":"https://europepmc.org/article/MED/18555958"},{"title":"Bellegarda, Ijspeert. CPG-RL: Learning Central Pattern Generators for Quadruped Locomotion (arXiv:2211.00458)","url":"https://arxiv.org/abs/2211.00458"}],"as_of":"","related_ids":["gait","gait-phase","legged-locomotion","bio-inspired-robot","rl-based-locomotion-control","limit-cycle"],"name":"中枢模式发生器","alt":"Central Pattern Generator","abbr":"CPG","aliases":["中央模式发生器","中枢模式生成器","CPG 振荡器"],"one_liner":"无需节律输入就能自己产生节律信号、用来驱动步态的神经回路或振荡器。","explanation":"中枢模式发生器原是神经科学概念：脊髓等处的神经回路在没有节律性输入时也能自行产生有节奏的输出，驱动行走、游泳和呼吸。Graham Brown 1911 年的实验最早表明脊髓能独立产生踏步模式，七鳃鳗和猫是经典研究对象。机器人借用这一思路，用一组相互耦合的振荡器给每条腿或每个关节生成周期信号：调幅值改步幅，调频率改步速，调振荡器之间的相位差就能切换步态。Ijspeert 团队 2007 年在 Science 发表的蝾螈机器人，用脊髓 CPG 模型实现了从游泳到行走的切换。CPG 节律稳定、参数少，但适应复杂地形要另加感觉反馈。强化学习运控里常用的步态相位时钟与之类似，CPG-RL 等工作则让神经网络去调制振荡器参数。","example":"EPFL 的 CPG-RL（2022）给四足每条腿配一个振荡器，强化学习策略只输出各振荡器的幅值和频率；部署到宇树 A1 上后，能承受相当于机器人自重 115% 的 13.75 kg 附加负载。","related":["步态","步态相位（相位时钟）","腿足运动","仿生机器人","强化学习运控","极限环"]},{"id":"footstep-planning","category":"control","sec":5,"tier":2,"sources":[{"title":"Footstep Planning on Uneven Terrain with Mixed-Integer Convex Optimization (Deits & Tedrake, 2014)","url":"https://groups.csail.mit.edu/robotics-center/public_papers/Deits14a.pdf"}],"as_of":"","related_ids":["gait-planning","swing-foot-trajectory-planning","raibert-heuristic","perceptive-locomotion","elevation-map","multi-contact-planning"],"name":"落足点规划","alt":"Footstep Planning","abbr":"","aliases":["足步规划","落脚点规划","脚步规划","Foothold Planning"],"one_liner":"为腿足机器人算出接下来每一步踩在哪、脚朝哪个方向。","explanation":"落足点规划要为双足或四足机器人找出一串能安全踩踏的脚位（位置和朝向），让它从当前位置走到目标，同时满足相邻两步的间距在腿够得着的范围内、不踩障碍和悬空处等约束。它是接触运动规划的简化版：全身动力学先粗略处理，只决定脚放哪，身体具体怎么动交给后面的控制器。方法大致两类：一类是离散搜索，把可能的步子做成动作集合，用 A* 等方法在树上搜；另一类是连续优化，例如 MIT 的 Deits 与 Tedrake 2014 年把可落脚区域分解成若干凸区域，用混合整数凸优化求出全局最优的脚步序列。强化学习运控策略则通常隐式决定落脚点。","example":"Deits 与 Tedrake 的规划器让 Atlas 人形机器人走过一排踏脚石；拿掉其中一块后，它会自动改走更长的绕行路线。几步的短序列不到 1 秒可解，10–30 步的序列在笔记本电脑上要几十秒到几分钟。","related":["步态规划","足端轨迹规划","Raibert 启发式","感知行走","高程图","多接触规划"]},{"id":"raibert-heuristic","category":"control","sec":5,"tier":3,"sources":[{"title":"MIT Leg Laboratory: 3D One-Leg Hopper (1983–1984)","url":"http://www.ai.mit.edu/projects/leglab/robots/3D_hopper/3D_hopper.html"},{"title":"mit-biomimetics/Cheetah-Software: ConvexMPCLocomotion.cpp（footstep placement）","url":"https://github.com/mit-biomimetics/Cheetah-Software/blob/master/user/MIT_Controller/Controllers/convexMPC/ConvexMPCLocomotion.cpp"},{"title":"Di Carlo et al., Dynamic Locomotion in the MIT Cheetah 3 Through Convex Model-Predictive Control (2018)","url":"https://dspace.mit.edu/handle/1721.1/138000"}],"as_of":"","related_ids":["footstep-planning","swing-foot-trajectory-planning","convex-mpc","capture-point","spring-loaded-inverted-pendulum","quadruped-robot"],"name":"Raibert 启发式","alt":"Raibert Heuristic","abbr":"","aliases":["Raibert 落足点公式","Raibert 落脚点启发式","Raibert Foot Placement"],"one_liner":"按身体速度把脚落在中性点前后，以此调节腿式机器人前进速度的落足规则。","explanation":"Raibert 启发式来自 Marc Raibert 1980 年代初在卡内基梅隆大学做的单腿跳跃机器人（他的实验室后来迁到 MIT，称 Leg Lab）。他把跳跃控制拆成三块独立处理：跳跃高度、身体姿态、前进速度，其中前进速度靠落脚位置来调。落脚点（相对髋部）取 x_f = ẋ·T_s/2 + k·(ẋ − ẋ_d)：ẋ 是当前前进速度，T_s 是支撑相时长，ẋ_d 是期望速度，k 是反馈增益。第一项叫「中性点」，脚踩在这里时，支撑期内身体前后对称地越过脚，速度基本不变；第二项是修正，跑得比期望快就把脚往前放来减速，反之往后放来加速。它不需要完整动力学模型，MIT Cheetah 等四足控制器至今仍用它的变体规划摆动腿落点，再交给 MPC 或全身控制算支撑力。","example":"MIT 开源的 Cheetah-Software 在凸 MPC 步态控制中，摆动腿落点取「速度 × 支撑时长 × 0.5 + 0.03 ×（实际速度 − 期望速度）」，再加一项转弯修正，正是 Raibert 公式的变体。","related":["落足点规划","足端轨迹规划","凸 MPC","捕获点","弹簧负载倒立摆","四足机器人"]},{"id":"swing-foot-trajectory-planning","category":"control","sec":5,"tier":3,"sources":[{"title":"MIT Cheetah-Software：FootSwingTrajectory.cpp（Bezier 摆动轨迹）","url":"https://github.com/mit-biomimetics/Cheetah-Software/blob/master/common/src/Controllers/FootSwingTrajectory.cpp"},{"title":"MIT Cheetah-Software：ConvexMPCLocomotion.cpp（落足点与抬脚高度）","url":"https://github.com/mit-biomimetics/Cheetah-Software/blob/master/user/MIT_Controller/Controllers/convexMPC/ConvexMPCLocomotion.cpp"},{"title":"Humanoid-Gym humanoid_env.py（_reward_feet_clearance 抬脚高度奖励）","url":"https://github.com/roboterax/humanoid-gym/blob/main/humanoid/envs/custom/humanoid_env.py"}],"as_of":"","related_ids":["footstep-planning","raibert-heuristic","stance-phase-swing-phase","gait-planning","bezier-curve-trajectory","whole-body-control"],"name":"足端轨迹规划","alt":"Swing Foot Trajectory Planning","abbr":"","aliases":["摆动腿轨迹规划","摆动相足端轨迹规划","Swing leg trajectory"],"one_liner":"为腿足机器人的摆动腿规划从抬脚到落地的足端空间曲线。","explanation":"腿足机器人行走时，每条腿交替处于支撑相（脚着地承重）和摆动相（脚在空中迈向下一个落点）。足端轨迹规划负责摆动相：已知抬脚位置、落足点（通常由落足点规划或 Raibert 启发式按机身速度算出）和摆动时长，生成中间每一时刻的足端位置、速度和加速度。要求是抬得够高、不蹭地，能跨过台阶；起止平滑，落地前速度接近零以减小冲击；摆动途中还能按新的速度指令更新落点。常用摆线、样条或贝塞尔曲线，水平和竖直方向常分开设计。生成的足端轨迹再经逆运动学、足端笛卡尔 PD 或全身控制转成关节指令。基于强化学习的运控一般不显式规划这条曲线，而是用抬脚高度、腾空时间等奖励项间接塑造。","example":"MIT Cheetah 开源控制代码中，水平方向用一段三次贝塞尔曲线把抬脚点连到落足点，竖直方向分上升、下降两段贝塞尔曲线，凸 MPC 步态里的抬脚高度设为 6 cm；落足点按髋关节位置加上与速度相关的修正项计算，再由足端笛卡尔 PD 跟踪。","related":["落足点规划","Raibert 启发式","支撑相 / 摆动相","步态规划","贝塞尔曲线轨迹","全身控制"]},{"id":"balance-control","category":"control","sec":5,"tier":2,"sources":[{"title":"Wikipedia: Zero moment point","url":"https://en.wikipedia.org/wiki/Zero_moment_point"},{"title":"Pratt et al., Capture Point: A Step toward Humanoid Push Recovery (Humanoids 2006)","url":"https://doi.org/10.1109/ICHR.2006.321385"}],"as_of":"","related_ids":["zero-moment-point","capture-point","push-recovery","support-polygon","linear-inverted-pendulum-model","ankle-hip-and-stepping-strategies"],"name":"平衡控制","alt":"Balance Control","abbr":"","aliases":["平衡保持","姿态平衡控制"],"one_liner":"让足式或人形机器人在站立、行走和被推时保持不倒的控制。","explanation":"平衡控制是腿足机器人最底层的能力：在重力和地面反作用力作用下保证身体不翻倒。传统方法基于简化模型：零力矩点（ZMP，Vukobratović 1968 年引入）是地面反作用力不产生水平力矩的点，只要它留在支撑多边形（着地的脚围成的区域）内，机器人就不会绕脚边翻倒，本田 ASIMO 等早期人形用它规划步态；Pratt 等人 2006 年提出捕获点，回答「被推后脚该落在哪里才能停下来」。受到扰动时，按力度由小到大可以依次用脚踝调整、髋部摆动、迈步来恢复。现在的人形和四足多用强化学习：仿真里随机推机器人，让策略自己学会站稳和迈步，再迁移到真机。在全身控制里，平衡通常是优先级最高的任务之一。","example":"人形机器人站立时被人从侧面推一把：推力小时靠脚踝发力把重心拉回；推力大到脚踝兜不住时，它向侧面迈一步，把脚落在捕获点附近再站稳。","related":["零力矩点","捕获点","推恢复","支撑多边形","线性倒立摆模型","踝策略/髋策略/跨步策略"]},{"id":"push-recovery","category":"control","sec":5,"tier":2,"sources":[{"title":"Pratt et al.: Capture Point: A Step toward Humanoid Push Recovery (Humanoids 2006)","url":"https://doi.org/10.1109/ICHR.2006.321385"},{"title":"Stéphane Caron: Capture point","url":"https://scaron.info/robotics/capture-point.html"},{"title":"legged_gym: legged_robot_config.py（push_robots / push_interval_s / max_push_vel_xy）","url":"https://raw.githubusercontent.com/leggedrobotics/legged_gym/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["capture-point","ankle-hip-and-stepping-strategies","balance-control","zero-moment-point","domain-randomization","fall-recovery"],"name":"推恢复","alt":"Push Recovery","abbr":"","aliases":["抗推","抗扰动恢复","推扰恢复"],"one_liner":"机器人被推或被撞后调整姿态或迈步，重新站稳不摔倒的能力。","explanation":"推恢复指足式机器人（尤其是双足和人形）受到外力推搡、碰撞后恢复平衡。经典思路按扰动大小分三级：小推靠踝关节力矩移动压力中心（踝策略），大一些靠弯髋、摆上身产生角动量（髋策略），再大就必须迈一步（跨步策略）。2006 年 Pratt 等人提出捕获点：根据质心位置和速度算出「一步踩到那里就能完全停住」的地面点，给出了往哪迈步的依据。如今的强化学习运控则在仿真训练中随机推机器人，让策略自己学会抗推，这也是域随机化的一种。它和跌倒恢复不同：后者是已经摔倒后再爬起来。","example":"开源框架 legged_gym 训练时默认每 15 秒把机器人躯干的水平速度随机设为最多 1 m/s，模拟一次猛推，策略由此学会被推后迈步稳住。","related":["捕获点","踝策略/髋策略/跨步策略","平衡控制","零力矩点","域随机化","跌倒恢复（摔倒起身）"]},{"id":"ankle-hip-and-stepping-strategies","category":"control","sec":5,"tier":3,"sources":[{"title":"Horak F. B., Nashner L. M. Central programming of postural movements: adaptation to altered support-surface configurations. J Neurophysiol, 1986","url":"https://europepmc.org/article/MED/3734861"},{"title":"Stephens B. Humanoid push recovery. IEEE-RAS Humanoids, 2007","url":"https://doi.org/10.1109/ICHR.2007.4813931"},{"title":"Push Recovery of a Position-Controlled Humanoid Robot Based on Capture Point Feedback Control (arXiv:1710.10598)","url":"https://arxiv.org/abs/1710.10598"}],"as_of":"","related_ids":["push-recovery","balance-control","capture-point","center-of-pressure","centroidal-moment-pivot","support-polygon"],"name":"踝策略/髋策略/跨步策略","alt":"Ankle, Hip and Stepping Strategies","abbr":"","aliases":["踝关节策略","髋关节策略","跨步策略","Ankle strategy","Hip strategy","Stepping strategy"],"one_liner":"受推后保持平衡的三级手段：动脚踝、甩上身、迈一步。","explanation":"这组概念来自人体姿势控制研究。Horak 和 Nashner 1986 年让受试者站在会突然平移的支撑面上，发现正常站立时人主要绕踝关节转动身体恢复平衡，称为踝策略；站在比脚掌还短的窄面上时，改为以髋关节为主的屈伸，称为髋策略；扰动更大时人会迈步重建支撑，即跨步策略。人形机器人的推恢复借用了这套分级：踝策略相当于在脚底范围内调节压力中心（CoP）；髋策略靠上身快速转动产生角动量，相当于调节质心力矩枢轴点（CMP）；当捕获点（要停稳必须踩到的地面点）落到支撑多边形之外，就只能跨步。Stephens 2007 年按这三种策略推导了判断不迈步是否必然跌倒的解析边界。","example":"人形机器人站立时被轻推一下，只调脚踝力矩就能站稳；推力加大，上身前后甩动或挥臂吸收冲量；再大就朝受力方向迈出一步。","related":["推恢复","平衡控制","捕获点","压力中心","质心力矩枢轴点","支撑多边形"]},{"id":"double-support-phase","category":"control","sec":5,"tier":3,"sources":[{"title":"Wikipedia: Gait (human)","url":"https://en.wikipedia.org/wiki/Gait_(human)"},{"title":"Phase-based NMPC for Humanoid Walking Stabilization with Single and Double Support Time Adjustments (arXiv:2506.03856)","url":"https://arxiv.org/abs/2506.03856"},{"title":"Hybrid Zero Dynamics Control for Bipedal Walking with a Non-Instantaneous Double Support Phase (arXiv:2303.05165)","url":"https://arxiv.org/abs/2303.05165"}],"as_of":"","related_ids":["gait","support-polygon","zero-moment-point","stance-phase-swing-phase","flight-phase","gait-cycle-and-duty-factor"],"name":"双支撑期","alt":"Double Support Phase","abbr":"DSP","aliases":["双足支撑相","双腿支撑期","双支撑相","Double Stance","Double Limb Support"],"one_liner":"步行中两只脚同时着地的那一段，身体的支撑在这段从后脚移到前脚。","explanation":"双支撑期是双足步行中两只脚同时着地的阶段，出现在前脚刚落地、后脚还没离地之间，每个步态周期有两次，其余时间是只有一只脚着地的单支撑期。按维基百科给出的人类步行「站立相约占 60%、摆动相约占 40%」推算，两次双支撑合计约占周期的 20%；走得越快这段越短，跑步时则没有双支撑，换成双脚都离地的腾空相。对人形机器人来说，这段时间支撑多边形覆盖两只脚，最稳；零力矩点（ZMP）要在这段从后脚移到前脚；两腿和地面构成闭链，驱动多于自由度，需要决定两只脚各出多少力；落地冲击和接触切换也发生在它的前后。不少简化模型把双支撑期当成瞬间完成，更精细的步态规划会显式优化它的时长。","example":"首尔大学团队 2025 年提出的相位式非线性 MPC，把 ZMP 调节、落脚点、单支撑时长和双支撑时长放进同一个优化问题联合求解，并在双支撑期内禁止更新落脚点，在外力推搡下提升了人形机器人的行走平衡。","related":["步态","支撑多边形","零力矩点","支撑相 / 摆动相","腾空相","步态周期与占空比"]},{"id":"zmp-preview-control","category":"control","sec":5,"tier":3,"sources":[{"title":"Kajita et al.: Biped walking pattern generation by using preview control of zero-moment point (ICRA 2003)","url":"https://doi.org/10.1109/robot.2003.1241826"},{"title":"Stéphane Caron: Linear inverted pendulum model","url":"https://scaron.info/robotics/linear-inverted-pendulum-model.html"}],"as_of":"","related_ids":["zero-moment-point","cart-table-model","linear-inverted-pendulum-model","gait-planning","model-predictive-control","support-polygon"],"name":"ZMP 预观控制","alt":"ZMP Preview Control","abbr":"","aliases":["预见控制","预观控制","Kajita 预观控制","Preview control of ZMP"],"one_liner":"参考未来一段 ZMP 目标轨迹，提前算好质心怎么动，生成双足稳定步态。","explanation":"ZMP 预观控制由日本产业技术综合研究所（AIST）的梶田秀司（Shuuji Kajita）等在 ICRA 2003 提出，是人形机器人行走模式生成的经典方法。零力矩点（ZMP）是地面反作用力的合力矩水平分量为零的点，它留在支撑多边形（脚底接触区域）内，脚就不会翻。先按落脚点排出 ZMP 参考轨迹，问题变成：质心怎么走，实际 ZMP 才能跟上参考？论文用「小车-桌子模型」，ZMP 与质心满足 p = x − (z_c/g)·ẍ，p 是 ZMP 位置，x 是质心水平位置，z_c 是恒定的质心高度，g 是重力加速度。质心加速度只能靠 ZMP 与质心的偏差产生，质心必须提前动起来，只看当前参考来不及，所以要「预观」。控制器以质心加加速度为输入，最小化 ZMP 跟踪误差，并对预观窗口内的未来参考 ZMP 加权前馈；增益可离线算好，在线计算很轻。后来的 ZMP 模型预测控制在此基础上加入了约束。","example":"双足机器人走四步：先按落脚点排出阶梯状的 ZMP 参考（每步跳到新支撑脚中心），预观控制器看到下一级台阶，让质心提前向下一只支撑脚平滑侧移，实际 ZMP 始终留在脚底范围内。","related":["零力矩点","小车-桌子模型","线性倒立摆模型","步态规划","模型预测控制","支撑多边形"]},{"id":"human-like-gait","category":"control","sec":5,"tier":3,"sources":[{"title":"Ogura et al.: Human-like Walking with Knee Stretched, Heel-contact and Toe-off Motion by a Humanoid Robot (IROS 2006)","url":"https://gaoyichao.com/Xiaotu/robot_cases/papers/2006%20-%20Human-like%20walking%20with%20knee%20stretched,%20heel-contact%20and%20toe-off%20motion%20by%20a%20humanoid%20robot%20-%20Ogura%20et%20al.pdf"},{"title":"Figure: Natural Humanoid Walk Using Reinforcement Learning (2025-03)","url":"https://www.figure.ai/news/reinforcement-learning-walking"},{"title":"科创板日报：深圳人形机器人行走视频走红 拟人步态震惊英伟达科学家（2025-01）","url":"https://www.cls.cn/detail/1915921"}],"as_of":"2025-03","related_ids":["straight-knee-walking","gait","zero-moment-point","bipedal-locomotion","adversarial-motion-priors","stance-phase-swing-phase"],"name":"拟人步态（直膝行走 / 足跟-足尖行走）","alt":"Human-like Gait (Straight-knee Walking / Heel-to-toe Walking)","abbr":"","aliases":["仿人步态","类人步态","Human-like Walking","Heel-strike / Toe-off","Heel-contact and Toe-off Walking"],"one_liner":"让人形机器人像人一样伸直膝盖、脚跟先着地、再用脚尖蹬离地面的走法。","explanation":"拟人步态是人形机器人行业的常用说法，指走路姿态接近人：支撑腿膝盖基本伸直，脚跟先着地，重心滚过脚掌后用脚尖蹬离，双臂与腿反向摆动。早期基于零力矩点（ZMP）的人形机器人多屈膝、平足、腰高不变地走，原因之一是膝盖伸直时腿接近奇异位形，难以控制髋部高度。2006 年早稻田大学的 WABIAN-2R 借腰部运动避开奇异、在脚上加被动脚趾关节，较早实现了直膝加足跟-足尖行走。近年多用强化学习实现：奖励里加入模仿人类步行参考轨迹的项，同时兼顾速度跟踪和能耗。","example":"2025 年 3 月 Figure 公布 Figure 02 的强化学习行走控制器：在 GPU 仿真里奖励机器人模仿人类步行参考轨迹，学到脚跟着地、脚尖蹬离和与腿同步的摆臂，再零样本迁移到真机。国内众擎 2024 年 10 月发布的 SE01 也以直膝步态为主要卖点（据报道）。","related":["直膝行走","步态","零力矩点","双足行走","对抗运动先验","支撑相 / 摆动相"]},{"id":"hybrid-zero-dynamics","category":"control","sec":5,"tier":3,"sources":[{"title":"Grizzle & Chevallereau: Virtual Constraints and Hybrid Zero Dynamics for Realizing Underactuated Bipedal Locomotion (arXiv:1706.01127)","url":"https://arxiv.org/abs/1706.01127"},{"title":"Gong et al.: Feedback Control of a Cassie Bipedal Robot: Walking, Standing, and Riding a Segway (arXiv:1809.07279)","url":"https://arxiv.org/abs/1809.07279"}],"as_of":"","related_ids":["underactuation","bipedal-locomotion","limit-cycle","zero-moment-point","agility-robotics-cassie","gait-phase"],"name":"混合零动态","alt":"Hybrid Zero Dynamics","abbr":"HZD","aliases":["虚拟约束","Virtual Constraints","HZD 控制"],"one_liner":"用「虚拟约束」把双足步行压成低维系统，再设计并证明步态稳定的控制理论。","explanation":"混合零动态由 Westervelt、Grizzle、Koditschek 于 2003 年提出，面向欠驱动双足机器人，比如点足机器人无法靠脚踝对地施加力矩。步行是「混合」系统：摆腿时是连续动力学，落地瞬间有碰撞和换腿，是离散跳变。先选一个随步态单调前进的相位变量 θ，用反馈让每个驱动关节角 q_a 跟踪指定函数 h(θ)，即强制 y = q_a − h(θ) = 0，这叫虚拟约束；机器人被压到低维曲面上，剩下的欠驱动部分就是零动态。再用庞加莱映射检查它每步碰撞后能否回到同一周期轨道（极限环），据此证明步态稳定。它不要求脚掌平贴地面，这是与 ZMP 方法的主要区别。","example":"密歇根大学 Grizzle 团队 2018 年用虚拟约束加步态库控制 Cassie，收到机器人约六周后，就让它在人行道、草地、雪地和沙地上行走，还能站在赛格威平衡车上保持平衡。","related":["欠驱动","双足行走","极限环","零力矩点","Agility Cassie","步态相位（相位时钟）"]},{"id":"virtual-model-control","category":"control","sec":5,"tier":3,"sources":[{"title":"Pratt, Chew, Torres, Dilworth, Pratt: Virtual Model Control: An Intuitive Approach for Bipedal Locomotion (IJRR 2001)","url":"https://doi.org/10.1177/02783640122067309"}],"as_of":"","related_ids":["jacobian-transpose-method","impedance-control","torque-control","bipedal-locomotion","whole-body-control","raibert-heuristic"],"name":"虚拟模型控制","alt":"Virtual Model Control","abbr":"VMC","aliases":["Virtual Model Control","虚拟弹簧阻尼控制"],"one_liner":"在机器人身上假想挂上弹簧阻尼器，把它们产生的力换算成关节力矩来控制。","explanation":"虚拟模型控制由 MIT 腿足实验室的 Jerry Pratt 等提出，2001 年发表于 IJRR，最早用于平面双足机器人行走。做法是：在机器人身体和某个参考点之间假想挂上弹簧、阻尼器等「虚拟构件」，比如在躯干上挂一个把它拉到目标高度的弹簧，按弹簧阻尼公式算出虚拟力 F，再用雅可比转置 τ = Jᵀ F 换算成支撑腿各关节的力矩 τ（J 是关节速度到身体速度的映射矩阵）。它不需要完整的动力学模型，也不用解逆运动学，参数有直观的物理含义，调起来像调弹簧软硬。论文里的机器人只靠脚底接触检测，就能在事先不知道坡度的情况下走过斜坡和起伏地面。它忽略了腿本身的惯性，属于准静态近似，动作越激烈误差越大。后来也常用于四足、轮足机器人的腿部力控。","example":"双足机器人在支撑相：躯干上挂一个竖直虚拟弹簧阻尼器维持身高，一个扭簧维持躯干直立，一个水平阻尼器控制前进速度；三个虚拟力经 τ = Jᵀ F 换成髋、膝、踝的力矩。","related":["雅可比转置法","阻抗控制","力矩控制","双足行走","全身控制","Raibert 启发式"]},{"id":"convex-mpc","category":"control","sec":5,"tier":3,"sources":[{"title":"Di Carlo et al., Dynamic Locomotion in the MIT Cheetah 3 Through Convex Model-Predictive Control (IROS 2018)","url":"https://dspace.mit.edu/handle/1721.1/138000"},{"title":"Kim et al., Highly Dynamic Quadruped Locomotion via Whole-Body Impulse Control and Model Predictive Control (arXiv:1909.06586)","url":"https://arxiv.org/abs/1909.06586"}],"as_of":"","related_ids":["model-predictive-control","single-rigid-body-dynamics-model","nonlinear-model-predictive-control","contact-force-optimization","gait-planning","whole-body-control"],"name":"凸 MPC","alt":"Convex MPC","abbr":"","aliases":["凸模型预测控制","基于单刚体模型的凸MPC","Convex MPC (MIT Cheetah 3)","单刚体 MPC"],"one_liner":"把腿足机器人简化成单刚体，让 MPC 变成能快速求到全局最优的二次规划。","explanation":"凸 MPC 一般指 MIT 仿生机器人实验室 Di Carlo、Wensing、Kim 等人 2018 年在 IROS 发表的四足控制方法。模型预测控制要在每个周期求解带动力学约束的优化，全身模型非线性、太慢；他们把机器人看成一个被地面反力推动的单刚体（忽略腿的质量），再做三点近似：横滚和俯仰角小、状态接近指令轨迹（用指令偏航角和预定落脚点做线性化）、忽略与角速度相关的非线性项。每只脚何时着地由步态调度器事先给定，决策变量只剩地面反力，加上摩擦锥约束，就成了凸二次规划：一定能求到全局最优，且解得很快。它输出未来一段时间的反力，再由关节力矩控制或全身控制执行。大角度翻滚等情形下近似会失效，这时要用非线性 MPC。","example":"在 Cheetah 3 上，预测时域最长 0.5 秒的反力规划不到 1 毫秒解完，以 20–30 Hz 运行，用同一组增益实现了站立、小跑、飞行小跑、弹跳、跳跃、踱步、三足步态和三维疾驰，前进速度达 3 m/s；2019 年移植到 Mini Cheetah 后与 500 Hz 的全身冲量控制（WBIC）配合，跑到 3.7 m/s。","related":["模型预测控制","单刚体动力学模型","非线性模型预测控制","接触力优化","接触时序（步态调度器）","全身控制"]},{"id":"contact-force-optimization","category":"control","sec":5,"tier":3,"sources":[{"title":"MIT Cheetah-Software: BalanceController.cpp（接触力 QP，qpOASES）","url":"https://raw.githubusercontent.com/mit-biomimetics/Cheetah-Software/master/user/MIT_Controller/Controllers/BalanceController/BalanceController.cpp"},{"title":"Kim et al., Highly Dynamic Quadruped Locomotion via Whole-Body Impulse Control and Model Predictive Control (arXiv:1909.06586)","url":"https://arxiv.org/abs/1909.06586"}],"as_of":"","related_ids":["quadratic-programming","friction-cone","friction-pyramid","ground-reaction-force","convex-mpc","whole-body-control"],"name":"接触力优化","alt":"Contact Force Optimization (Force Distribution)","abbr":"","aliases":["力分配","地面反力分配","接触力分配","Force Distribution","Ground Reaction Force Distribution"],"one_liner":"已知机身需要的总力和力矩，求每只脚或每根手指各出多大力。","explanation":"接触力优化也叫力分配：机器人同时有多个接触点受力时（四足站立、双手抱箱、多指抓取），先由上层控制器算出机身需要的总力和总力矩（合称力旋量），再解一个优化问题把它分给各接触点。以四脚着地为例，每只脚 3 个力分量共 12 个未知数，平衡方程只有 6 个，解有无穷多组，所以要加目标来挑：尽量贴合期望力旋量、力尽量小；同时满足约束：切向力不超过摩擦系数乘法向力（摩擦锥，常线性化成摩擦金字塔）、法向力在上下限之间、腾空脚的力为零。它通常是每个控制周期解一次的二次规划，解出的力再经足端雅可比转置换成关节力矩。它只看当前一瞬间；凸 MPC 相当于把同一问题沿时间展开，全身控制则进一步纳入完整动力学。","example":"MIT Cheetah 开源代码里的 BalanceController：给定期望的机身线加速度和角加速度，求 4 只脚共 12 个力分量，约束是线性化的摩擦锥和每只脚的法向力上下限（腾空脚上下限直接设为 0），用 qpOASES 求解并用上一次的解热启动；文件注释写明方法参考了 Focchi 等人 2016 年关于陡坡行走的论文。","related":["二次规划","摩擦锥","摩擦金字塔","地面反作用力","凸 MPC","全身控制"]},{"id":"multi-contact-planning","category":"control","sec":5,"tier":3,"sources":[{"title":"Simultaneous Contact Sequence and Patch Planning for Dynamic Locomotion (arXiv 2508.12928)","url":"https://arxiv.org/abs/2508.12928"},{"title":"Online Multi-Contact Receding Horizon Planning via Value Function Approximation (arXiv 2306.04732)","url":"https://arxiv.org/abs/2306.04732"}],"as_of":"","related_ids":["footstep-planning","gait-planning","centroidal-dynamics","friction-cone","contact-implicit-trajectory-optimization","monte-carlo-tree-search"],"name":"多接触规划","alt":"Multi-contact Planning","abbr":"","aliases":["多接触运动规划","接触规划","Contact Planning"],"one_liner":"规划机器人用脚、手、膝等部位按什么顺序、在哪里接触环境来借力。","explanation":"多接触规划指为腿足或人形机器人决定「身体哪个部位、什么时候、接触环境的哪个位置」，并让整段动作在力学上做得到。普通双足行走只用两只脚交替着地；爬陡坡、钻狭窄空间、翻越障碍或摔倒保护时，机器人还要用手扶墙、膝盖着地等，接触点的数量和顺序都不固定。难点在于它同时含离散决策（用哪条肢体、什么顺序、落在哪块表面）和连续决策（身体轨迹、接触力要落在摩擦锥内等约束），是混合离散-连续优化问题。传统做法分层：先规划接触序列和位置，再用质心动力学或全身轨迹优化生成动作；近年的工作用蒙特卡洛树搜索、学到的价值函数把两层联合起来，并做成滚动时域在线重规划。它和落足点规划同类，但不限定周期性步态。","example":"人形机器人 Talos 在陡到无法保持静态平衡的斜坡上行走：Wang 等人 2023 年的方法用学到的价值函数近似远期影响，在线滚动地规划下一步接触和身体运动。","related":["落足点规划","步态规划","质心动力学","摩擦锥","接触隐式轨迹优化","蒙特卡洛树搜索"]},{"id":"whole-body-control","category":"control","sec":5,"tier":1,"sources":[{"title":"Sentis & Khatib, Synthesis of Whole-Body Behaviors through Hierarchical Control of Behavioral Primitives (IJHR 2005)","url":"https://doi.org/10.1142/S0219843605000594"},{"title":"HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots (arXiv 2410.21229)","url":"https://arxiv.org/abs/2410.21229"},{"title":"A Survey of Behavior Foundation Model: Next-Generation Whole-Body Control System of Humanoid Robots (arXiv 2506.20487)","url":"https://arxiv.org/abs/2506.20487"}],"as_of":"2025-03","related_ids":["learning-based-whole-body-control","task-prioritization","hierarchical-quadratic-programming","null-space-control","operational-space-control","hover"],"name":"全身控制","alt":"Whole-Body Control","abbr":"WBC","aliases":["全身运动控制","Whole-body controller","全身控制器"],"one_liner":"把人形或足式机器人全身关节放在一起统一计算，同时完成多个任务的控制方法。","explanation":"全身控制指把浮动基机器人（身体不固定在地面上，如人形、四足）的所有关节放在一起统一算指令，而不是腿和手臂各管各的。经典框架来自 Sentis 与 Khatib 2005 年的论文：把重心、手、脚、关节限位、接触等写成「任务」或约束并排出优先级，高优先级（如不超限位、不摔倒）优先保证，低优先级只利用剩余的冗余自由度尽量完成；工程上常写成二次规划（QP）或分层 QP，在每个控制周期求解。它重要是因为人形一伸手重心就会移动，腿和躯干必须同时补偿。2024 年前后学习型 WBC 兴起，如 HOVER（ICRA 2025）用一个神经网络策略统一导航、移动操作、桌面操作等多种控制模式。上层 VLA 或遥操作给目标，WBC 负责把它变成全身关节指令。","example":"人形机器人单手从地上捡箱子：WBC 同时满足「手到箱子」「重心投影留在双脚支撑区内」「关节不超限位」，于是自动弯腰、屈膝，另一只手臂向后摆来配重。","related":["学习型全身控制","任务优先级","分层二次规划","零空间控制","操作空间控制","HOVER"]},{"id":"null-space-control","category":"control","sec":5,"tier":3,"sources":[{"title":"franka_ros cartesian_impedance_example_controller.cpp（零空间力矩实现）","url":"https://raw.githubusercontent.com/frankaemika/franka_ros/develop/franka_example_controllers/src/cartesian_impedance_example_controller.cpp"},{"title":"StudyWolf: Robot control part 5 - Controlling in the null space","url":"https://studywolf.wordpress.com/2013/09/17/robot-control-5-controlling-in-the-null-space/"},{"title":"Implicit Null-space Manifold Generation for Redundant Robotic Systems (arXiv 2605.25770)","url":"https://arxiv.org/abs/2605.25770"}],"as_of":"","related_ids":["kinematic-redundancy","null-space","jacobian-pseudoinverse","operational-space-control","task-prioritization","hierarchical-quadratic-programming"],"name":"零空间控制","alt":"Null-Space Control","abbr":"","aliases":["零空间投影","冗余度控制","Null-Space Projection"],"one_liner":"利用冗余自由度，在不干扰主任务的前提下完成次要目标的控制方法。","explanation":"当机器人关节数多于任务需要的维度时（比如 7 自由度机械臂只要求末端 6 维位姿），同一个末端位姿对应无数种关节构型，这叫运动学冗余。雅可比矩阵 J 把关节速度 q̇ 映射成末端速度，满足 J·q̇ = 0 的关节运动构成 J 的零空间：关节在动，末端却不动，比如手不动而肘部画圈。零空间控制把次要任务的指令先乘投影矩阵 N = I − J⁺J（J⁺ 为 J 的伪逆）过滤，再叠加到主任务上，保证次要任务不干扰主任务。常见次要任务有远离关节限位、避开奇异位形、肘部避障、保持舒适姿态。在力矩层面，Khatib 1987 年提出的操作空间控制使用考虑质量矩阵的「动力学一致」伪逆，否则次要力矩仍会引起末端加速度。多个任务逐层投影，就得到任务优先级和分层二次规划。","example":"Franka 机械臂的笛卡尔阻抗控制示例：主任务让末端跟随目标位姿，另外把一个「拉回启动时关节姿态」的弹簧-阻尼力矩乘上 (I − Jᵀ(Jᵀ)⁺) 再叠加，肘部被推开会自己回来，末端跟踪不受影响。","related":["运动学冗余","零空间","雅可比伪逆","操作空间控制","任务优先级","分层二次规划"]},{"id":"task-prioritization","category":"control","sec":5,"tier":3,"sources":[{"title":"Nakamura, Hanafusa, Yoshikawa: Task-Priority Based Redundancy Control of Robot Manipulators (IJRR 1987)","url":"https://doi.org/10.1177/027836498700600201"},{"title":"Siciliano, Slotine: A general framework for managing multiple tasks in highly redundant robotic systems (ICAR 1991)","url":"https://doi.org/10.1109/icar.1991.240390"}],"as_of":"","related_ids":["null-space","null-space-control","kinematic-redundancy","jacobian-pseudoinverse","hierarchical-quadratic-programming","whole-body-control"],"name":"任务优先级","alt":"Task Prioritization","abbr":"","aliases":["多任务优先级控制","Prioritized task control","Task-priority control","任务优先级冗余控制"],"one_liner":"机器人同时做多件事时按重要性排序，低优先级任务不能干扰高优先级任务。","explanation":"冗余机器人（关节数多于任务需要的自由度，如 7 轴臂、人形机器人）常要同时满足多个目标：手到达目标、保持平衡、避开关节限位、姿态自然。任务优先级方法把这些任务排成层级：1987 年 Nakamura 等提出基于雅可比伪逆的任务优先级冗余控制，1991 年 Siciliano 与 Slotine 推广到任意多个任务。核心公式是 q̇ = J₁⁺ẋ₁ + (I − J₁⁺J₁)q̇₀：J₁ 是主任务的雅可比矩阵（把关节速度映射成任务速度），J₁⁺ 是它的伪逆，(I − J₁⁺J₁) 把次要任务想要的关节速度 q̇₀ 投影到主任务的零空间，保证它不改变主任务的结果。它和「加权求和」不同：加权法让各任务互相妥协，优先级法保证高层严格优先。现代全身控制多用分层二次规划实现，还能处理不等式约束。","example":"人形机器人伸手取杯子：第一优先级让质心留在支撑区内不摔倒，第二优先级让手到达杯子，第三优先级让关节靠近舒适姿态；手的目标和平衡冲突时，控制器牺牲一部分手的精度，而不动平衡。","related":["零空间","零空间控制","运动学冗余","雅可比伪逆","分层二次规划","全身控制"]},{"id":"hierarchical-quadratic-programming","category":"control","sec":5,"tier":3,"sources":[{"title":"Escande, Mansard, Wieber, Hierarchical Quadratic Programming: Fast Online Humanoid-Robot Motion Generation (IJRR 2014)","url":"https://gepettoweb.laas.fr/uploads/Publications/2014_escande_ijrr.pdf"}],"as_of":"","related_ids":["task-prioritization","whole-body-control","quadratic-programming","null-space-control","operational-space-control","inverse-kinematics"],"name":"分层二次规划","alt":"Hierarchical Quadratic Programming","abbr":"HQP","aliases":["分层QP","层级二次规划","hierarchical QP"],"one_liner":"把多个控制目标按优先级排队逐层求解，低优先级绝不干扰高优先级。","explanation":"机器人常要同时满足多个可能冲突的目标：不摔倒、脚不打滑、手到目标、关节不超限。加权 QP 把它们乘上权重加成一个代价，只能折中，重要任务仍可能被牺牲。HQP 则严格排序：先解最高优先级的二次规划，把其最优解集作为约束，再在剩余自由度（零空间）里解下一层，所以下层永远不会破坏上层结果。它是经典零空间投影法的推广，区别在于每层都能带不等式约束（如关节限位、摩擦锥）。Escande、Mansard、Wieber 在 2014 年的 IJRR 论文中给出同时支持等式和不等式的快速求解器，能在控制频率下为 HRP-2 人形生成全身运动；它常用于全身控制中的逆运动学或逆动力学求解。","example":"人形机器人伸手取远处物体：第 1 层保证支撑脚不动、质心在支撑多边形内，第 2 层让手到达目标，第 3 层让头朝向物体、其余关节回默认姿态；够不着时被牺牲的是下层任务，而不是平衡。","related":["任务优先级","全身控制","二次规划","零空间控制","操作空间控制","逆运动学"]},{"id":"rl-based-locomotion-control","category":"control","sec":5,"tier":2,"sources":[{"title":"Learning agile and dynamic motor skills for legged robots (Hwangbo et al., Science Robotics 2019)","url":"https://arxiv.org/abs/1901.08652"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (Rudin et al.)","url":"https://arxiv.org/abs/2109.11978"},{"title":"unitree_rl_gym：Go2 训练配置","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/legged_gym/envs/go2/go2_config.py"}],"as_of":"2026-09","related_ids":["legged-locomotion","sim-to-real-transfer","domain-randomization","proximal-policy-optimization","stiffness-and-damping-gains","velocity-command-tracking"],"name":"强化学习运控","alt":"RL-based Locomotion Control","abbr":"","aliases":["RL 运控","基于强化学习的运动控制"],"one_liner":"在仿真里用强化学习训练神经网络，直接控制腿足机器人行走的方法。","explanation":"强化学习运控指用强化学习（在试错中最大化奖励）训练神经网络控制器，让四足、人形等腿足机器人行走、奔跑、摔倒后起身。典型流程是：在 Isaac Gym、Isaac Lab 等 GPU 仿真器里并行跑数千个机器人，用 PPO 训练；策略以约 50 Hz 输出关节目标角度，由关节 PD 控制器换算成力矩；再借域随机化、执行器建模等手段跨过虚实差距部署到真机。ETH 的 Hwangbo 等人 2019 年在 ANYmal 四足上验证了这条路线，Rudin 等人 2021 年用单块 GPU 把平地行走的训练缩短到 4 分钟以内。相比 MPC 加全身控制等基于模型的方法，它不用手写步态和精确模型、对复杂地形更鲁棒，但依赖奖励设计和大量调参。","example":"在宇树开源的 unitree_rl_gym 里训练 Go2：仿真步长 5 毫秒、每 4 步更新一次动作，即策略每 20 毫秒输出 12 个关节的目标角度，底层用 Kp=20、Kd=0.5 的 PD 控制跟踪，训练好后导出网络部署到真机。","related":["腿足运动","仿真到现实迁移","域随机化","近端策略优化","刚度与阻尼增益","速度指令跟踪"]},{"id":"velocity-command-tracking","category":"control","sec":5,"tier":2,"sources":[{"title":"legged_gym: legged_robot.py（_reward_tracking_lin_vel / _resample_commands）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"},{"title":"legged_gym: legged_robot_config.py（commands / rewards）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"},{"title":"Walk These Ways (arXiv:2212.03238)","url":"https://arxiv.org/abs/2212.03238"}],"as_of":"","related_ids":["rl-based-locomotion-control","reward-function","cmd-vel-topic","legged-gym","walk-these-ways","terrain-curriculum"],"name":"速度指令跟踪","alt":"Velocity Command Tracking","abbr":"","aliases":["速度跟踪","指令跟踪","Velocity tracking","Command tracking"],"one_liner":"足式机器人按给定的前进、横移和转向速度走路的标准训练任务。","explanation":"速度指令跟踪是足式机器人强化学习运控里最基本的任务设定：每隔一段时间随机给机器人一个目标速度，通常是机身前进速度 vx、横移速度 vy 和绕竖直轴的转向角速度 ωz，策略输出关节动作，让机身实际速度尽量贴近指令。奖励常写成 exp(−‖v指令 − v实际‖²/σ)，误差越小越接近 1，σ 控制容忍度。训练好的策略部署时接手柄或上层导航模块发来的速度指令，上层只管「往哪走、多快」，步态和平衡交给策略。它和电机层的「速度控制」不是一回事：后者控制的是单个关节的转速。","example":"legged_gym 的默认配置：指令共 4 维（vx、vy、ωz 和朝向），每 10 秒重新采样一次，线速度范围 ±1 m/s；线速度跟踪奖励权重 1.0、角速度 0.5，σ = 0.25；平移指令幅值不超过 0.2 m/s 时直接置零。","related":["强化学习运控","奖励函数","cmd_vel 速度指令话题（Twist 消息）","legged_gym","Walk These Ways","地形课程"]},{"id":"gait-phase-variable-clock-input","category":"control","sec":5,"tier":3,"sources":[{"title":"unitree_rl_gym: legged_gym/envs/g1/g1_env.py","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/legged_gym/envs/g1/g1_env.py"},{"title":"Siekmann et al., Periodic Reward Composition (arXiv 2011.01387)","url":"https://arxiv.org/abs/2011.01387"}],"as_of":"","related_ids":["gait-phase","rl-based-locomotion-control","walk-these-ways","observation","stance-phase-swing-phase","positional-encoding"],"name":"步态相位（相位时钟输入）","alt":"Gait Phase Variable / Clock Input (sin/cos phase)","abbr":"","aliases":["时钟输入","相位观测","clock input","sin/cos 相位编码"],"one_liner":"把步态相位编码成 sin、cos 两个数输入策略网络，让它知道节拍。","explanation":"这是步态相位在学习型运控里的具体用法：训练强化学习行走策略时，在关节角、角速度、速度指令等观测之外，再输入 sin(2πφ) 和 cos(2πφ)，φ 为 0–1 循环的相位。不直接输入 φ，是因为 φ 从 0.99 跳回 0 时数值突变，而 sin/cos 对应圆上一点、始终连续，网络能看出这两个时刻其实相邻。有了这个外部节拍，没有记忆的前馈网络也能输出稳定的周期步态，并和周期奖励里的支撑、摆动时间表对齐。Walk These Ways（Margolis 与 Agrawal）为四条腿各输入一个 sin 时序信号，并把步频和腿间相位偏移作为指令，从而在线切换小跑、踱步、跳跃等步态。","example":"unitree_rl_gym 的 G1 环境把 sin(2πφ)、cos(2πφ) 拼在观测向量末尾，与角速度、投影重力、速度指令、关节位置和速度、上一步动作一起送进策略网络。","related":["步态相位（相位时钟）","强化学习运控","Walk These Ways","观测","支撑相 / 摆动相","位置编码"]},{"id":"learning-based-whole-body-control","category":"control","sec":5,"tier":2,"sources":[{"title":"HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots (arXiv 2410.21229)","url":"https://arxiv.org/abs/2410.21229"},{"title":"HOVER 全文（HTML 版，动作空间与 DAgger 蒸馏细节）","url":"https://arxiv.org/html/2410.21229"},{"title":"A Survey of Behavior Foundation Model: Next-Generation Whole-Body Control System of Humanoid Robots (arXiv 2506.20487)","url":"https://arxiv.org/abs/2506.20487"}],"as_of":"2025-11","related_ids":["whole-body-control","hover","motion-tracking","teacher-student-distillation","rl-based-locomotion-control","braincerebellum-architecture"],"name":"学习型全身控制","alt":"Learning-based Whole-Body Control (Neural WBC)","abbr":"","aliases":["神经全身控制器","强化学习全身控制","RL WBC","Neural Whole-Body Controller","Neural WBC"],"one_liner":"用仿真里强化学习训出的神经网络，统一协调人形机器人全身关节。","explanation":"传统全身控制（WBC）每个控制周期都用动力学模型求解一个带任务优先级的二次规划，得出全身关节力矩，依赖精确模型和大量调参。学习型全身控制改为在仿真中用强化学习训练一个神经网络策略：输入本体状态和上层指令（行走速度、关节角、手和头的目标位置或一段人体动作），输出全身关节目标位置，再由各关节 PD 控制器执行，训练时常加域随机化以便迁移到真机。训练用的动作多来自重定向到机器人上的人体动捕数据，如 AMASS。代表工作有 ExBody、OmniH2O、HOVER、SONIC。它常充当「小脑」，接收 VLA 或遥操作给出的高层指令。","example":"HOVER（Tairan He 等，ICRA 2025）在 19 自由度的宇树 H1 上，用掩码把根部速度跟踪、局部关节角跟踪、关键点位置跟踪几种指令模式统一进一个策略，经 DAgger 从特权教师策略蒸馏而来；每种模式下 12 项指标中至少 7 项优于专用控制器。","related":["全身控制","HOVER","运动跟踪","教师-学生蒸馏","强化学习运控","大脑-小脑架构（大小脑）"]},{"id":"decoupled-whole-body-control","category":"control","sec":5,"tier":3,"sources":[{"title":"NVlabs/GR00T-WholeBodyControl（Decoupled WBC: RL for lower body, IK for upper body）","url":"https://github.com/NVlabs/GR00T-WholeBodyControl"},{"title":"HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit (arXiv:2502.13013)","url":"https://arxiv.org/abs/2502.13013"}],"as_of":"2026-05","related_ids":["whole-body-control","learning-based-whole-body-control","inverse-kinematics","rl-based-locomotion-control","loco-manipulation","sonic"],"name":"解耦全身控制","alt":"Decoupled Whole-Body Control","abbr":"Decoupled WBC","aliases":["上下肢分开控制","上下肢解耦控制","上身 IK + 下身 RL","上下身解耦控制"],"one_liner":"人形机器人下半身用强化学习管走路和平衡，上半身用逆运动学管手臂。","explanation":"这是人形机器人全身控制的一种工程化做法：把上下半身拆成两个控制器。下半身是在仿真里用强化学习训练的行走策略，接收前进速度、转向、身体高度等指令，负责走路、蹲起和保持平衡，训练时通常会随机采样上半身姿态，让它学会把手臂动作当作扰动来适应；上半身用逆运动学（IK，由手的目标位姿反算关节角）或遥操作设备的关节映射直接控制手臂。好处是分工清楚、手臂定位准，方便遥操作采数据和接 VLA；代价是上下身不协同，弯腰够地面、身体前倾扩大够取范围、全身发力搬重物这类动作做不好。英伟达 GR00T N1.5 和 N1.6 在宇树 G1 上用的就是这种控制器（下身 RL、上身 IK），2026 年起其官方 VLA 流程改为配合统一的全身控制器 SONIC。","example":"HOMIE（上海人工智能实验室等，2025）：操作员脚踩踏板给下半身 RL 策略发走、转、蹲的指令，双臂由同构外骨骼按关节一一映射控制，手部用动作手套，于是一个人就能遥操作人形机器人边走边做操作，并积累训练数据。","related":["全身控制","学习型全身控制","逆运动学","强化学习运控","运动操作一体化","SONIC"]},{"id":"motion-tracking","category":"control","sec":5,"tier":2,"sources":[{"title":"DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills (arXiv:1804.02717)","url":"https://arxiv.org/abs/1804.02717"},{"title":"BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion (arXiv:2508.08241)","url":"https://arxiv.org/abs/2508.08241"},{"title":"GMT: General Motion Tracking for Humanoid Whole-Body Control (arXiv:2506.14770)","url":"https://arxiv.org/abs/2506.14770"}],"as_of":"2025-11","related_ids":["motion-retargeting","deepmimic","beyondmimic","gmt","whole-body-control","motion-capture"],"name":"运动跟踪","alt":"Motion Tracking","abbr":"","aliases":["动作跟踪","动作追踪","Motion Imitation (tracking)","参考动作跟踪"],"one_liner":"让机器人实时复现一段参考动作（如人类动捕）的全身控制任务。","explanation":"在人形机器人领域，运动跟踪指给策略一段参考动作（通常是人类动捕数据，经动作重定向换算成机器人关节角），让机器人在不摔倒、满足物理约束的前提下逐帧复现。主流做法沿用 2018 年 DeepMimic 的思路：在仿真里用强化学习训练，奖励按机器人各身体部位与参考姿态的差距计算，训练好再迁移到真机。它是人形「学人类动作」的基础能力，遥操作、舞蹈、武术表演和不少通用全身控制器（如 GMT、BeyondMimic）都建在它上面。注意别和计算机视觉里的目标跟踪、动作捕捉混淆：那两者是「看」，运动跟踪是「做」。","example":"BeyondMimic 用 LAFAN1 动捕数据训练跟踪策略，一套超参数就让人形机器人在实机上做出侧手翻、旋踢和冲刺。","related":["动作重定向","DeepMimic","BeyondMimic","GMT","全身控制","动作捕捉"]},{"id":"fall-mitigation-and-fall-recovery","category":"control","sec":5,"tier":2,"sources":[{"title":"Unified Humanoid Fall-Safety Policy from a Few Demonstrations (arXiv 2511.07407)","url":"https://arxiv.org/abs/2511.07407"},{"title":"Learning Humanoid Standing-up Control across Diverse Postures (HoST, arXiv 2502.08378)","url":"https://arxiv.org/abs/2502.08378"},{"title":"Unified Multi-Contact Fall Mitigation Planning for Humanoids via Contact Transition Tree Optimization (arXiv 1807.08667)","url":"https://arxiv.org/abs/1807.08667"}],"as_of":"2025-11","related_ids":["fall-recovery","host","push-recovery","balance-control","damping-mode","humanoid-robot"],"name":"跌倒保护与摔倒恢复","alt":"Fall Mitigation / Fall Recovery (Humanoid Fall Safety)","abbr":"","aliases":["摔倒保护","跌倒保护","跌倒恢复","摔倒起身","Humanoid Fall Safety","Fall Protection"],"one_liner":"人形机器人摔倒时尽量减小损伤、倒地后自己爬起来的两类能力。","explanation":"人形机器人质心高、支撑面小，被推、踩空、打滑都可能摔倒，一次重摔就可能损坏关节、相机和外壳。跌倒安全一般分三段：能不倒就先靠平衡控制和跨步化解（推恢复）；倒下已不可避免时做跌倒保护，比如屈膝降低重心、伸手或迈步提前接触地面、调整姿态，把冲击分散到耐撞的部位；倒地后做摔倒恢复，即从各种姿势重新站起来。早期多靠手工设计的动作序列和轨迹优化，例如 2018 年 Wang 与 Hauser 用接触序列树搜索规划跨步、手撑等多接触保护动作；近两年的主流是在仿真里用强化学习训练策略再迁移到真机，并开始把三段合进同一个策略。","example":"HoST（RSS 2025）用强化学习在仿真里训练宇树 G1 从多种倒地姿势起身，不依赖预设动作轨迹，直接部署到真机的室内外场景；2025 年 11 月的另一项工作在 G1 上用少量人类示范加强化学习，把防摔、减冲击和起身统一到一个策略里。","related":["跌倒恢复（摔倒起身）","HoST（人形起身）","推恢复","平衡控制","阻尼模式","人形机器人"]},{"id":"planning-and-control","category":"control","sec":6,"tier":2,"sources":[{"title":"Apollo Planning 模块说明（README_cn）","url":"https://raw.githubusercontent.com/ApolloAuto/apollo/master/modules/planning/planning_component/README_cn.md"},{"title":"Apollo Control 模块说明（README_cn）","url":"https://raw.githubusercontent.com/ApolloAuto/apollo/master/modules/control/control_component/README_cn.md"}],"as_of":"","related_ids":["motion-planning","trajectory-planning","model-predictive-control","whole-body-control","braincerebellum-architecture","autonomous-driving"],"name":"规控（规划与控制）","alt":"Planning and Control (PnC)","abbr":"PnC","aliases":["规划控制","规划与控制","决策规划与控制"],"one_liner":"把「决定怎么走」和「让执行器照着走」合在一起的技术模块与岗位方向。","explanation":"规控是中文工业界的常用简称，对应英文 Planning and Control（PnC），指感知之后、执行器之前的那一层。规划部分根据定位、感知结果和任务目标，生成路径和带速度的轨迹；控制部分根据当前状态算出电机或执行器指令，让机器人跟上这条轨迹。这个说法在自动驾驶行业很常见，百度 Apollo 就把系统拆成规划模块（输出轨迹）和控制模块（用 LQR、PID 或 MPC 算出转向、油门、刹车指令）。在机器人公司，规控方向通常负责运动规划、轨迹优化、MPC、全身控制等，大致对应「大脑-小脑架构」里的小脑。端到端模型把一部分规划交给了网络，但底层控制和安全约束多数仍靠规控。","example":"Apollo 中规划模块输出一条带速度和加速度的行驶轨迹，控制模块用 LQR 算横向转向、用 PID 算纵向油门和刹车，让车跟上这条轨迹。","related":["运动规划","轨迹规划","模型预测控制","全身控制","大脑-小脑架构（大小脑）","自动驾驶"]},{"id":"motion-planning","category":"control","sec":6,"tier":1,"sources":[{"title":"Wikipedia: Motion planning","url":"https://en.wikipedia.org/wiki/Motion_planning"},{"title":"MoveIt Docs: Motion Planning","url":"https://moveit.picknik.ai/main/doc/concepts/motion_planning.html"}],"as_of":"","related_ids":["path-planning","trajectory-planning","configuration-space","rapidly-exploring-random-tree","collision-checking","moveit-motion-planning-framework"],"name":"运动规划","alt":"Motion Planning","abbr":"","aliases":["运动规划器","Motion planner"],"one_liner":"在不碰撞、满足约束的前提下，算出机器人从起点到目标的一串姿态或轨迹。","explanation":"运动规划回答「机器人怎么从当前状态动到目标状态」：在不碰障碍物、不自撞、不超关节限位的前提下，找出一串连续可行的构型，经典表述叫「搬钢琴问题」。规划通常在构型空间里做，即机器人所有关节取值组成的空间，六轴机械臂就是 6 维。常用方法有栅格搜索（如 A*），适合低维；基于采样的规划（如 RRT、PRM），在高维空间随机撒点连成路径，是机械臂的主流；人工势场法；以及把平滑度、耗时当代价的轨迹优化。得到的几何路径再做时间参数化，满足速度、加速度限制，变成轨迹交给运动控制去跟踪。端到端 VLA 直接输出动作，跳过了显式规划，但工业和导航场景里规划器仍是主力。","example":"用 MoveIt 让机械臂从柜子里取杯子：OMPL 里的采样规划器在关节空间找到一条绕开柜门的无碰撞路径，再按各关节的速度、加速度上限做时间参数化后下发执行。","related":["路径规划","轨迹规划","构型空间","快速扩展随机树","碰撞检查","MoveIt"]},{"id":"path-planning","category":"control","sec":6,"tier":2,"sources":[{"title":"Wikipedia: Motion planning","url":"https://en.wikipedia.org/wiki/Motion_planning"},{"title":"Lynch & Park, Modern Robotics（§9.1 path 与 trajectory 的定义；第 10 章 Motion Planning）","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["motion-planning","trajectory-planning","a-star-search","rapidly-exploring-random-tree","probabilistic-roadmap","configuration-space"],"name":"路径规划","alt":"Path Planning","abbr":"","aliases":["路径搜索","寻路（Pathfinding）","钢琴搬运工问题"],"one_liner":"在不碰撞的前提下，找出从起点到终点要经过的一串位置或姿态。","explanation":"路径规划是给定环境、起点和终点，算出一条无碰撞几何路线的问题，常与「运动规划」混用，也被称为「钢琴搬运工问题」。严格说，路径只描述依次经过哪些位形（位置和姿态的组合），不含时间；给路径配上每一时刻的速度和加速度才是轨迹，这一步叫轨迹规划或时间参数化。常见算法分三类：栅格搜索（A*、Dijkstra），适合二维地图导航；基于采样的方法（PRM、RRT），适合机械臂这类高维构型空间；人工势场法，简单但容易困在局部极小值。移动机器人通常先做全局路径规划，再让局部规划器边走边避障。","example":"移动机器人在栅格地图上用 A* 搜出一条从充电座到门口、绕开家具的折线路径，再交给轨迹规划和底盘控制去执行。","related":["运动规划","轨迹规划","A* 算法","快速扩展随机树","概率路线图","构型空间"]},{"id":"obstacle-avoidance","category":"control","sec":6,"tier":1,"sources":[{"title":"Wikipedia: Obstacle avoidance","url":"https://en.wikipedia.org/wiki/Obstacle_avoidance"},{"title":"Wikipedia: Motion planning","url":"https://en.wikipedia.org/wiki/Motion_planning"}],"as_of":"","related_ids":["motion-planning","collision-checking","costmap","dynamic-window-approach","control-barrier-function","collision-detection"],"name":"避障","alt":"Obstacle Avoidance","abbr":"","aliases":["碰撞避免","Collision avoidance","障碍物规避"],"one_liner":"机器人感知到障碍物后提前调整路线或动作，不让自己撞上去。","explanation":"避障指机器人在运动中发现障碍物并绕开，仍能到达目标。它是一个实时的「感知-决策-执行」过程：激光雷达、深度相机、超声波等传感器发现障碍，规划或控制模块调整路线。做法大致三类：在全局规划阶段就用 A*、RRT 等算法算出无碰撞路线；在局部实时反应，比如移动机器人用代价地图和动态窗口法，机械臂做碰撞检查或加控制障碍函数；以及用强化学习等方法直接从传感器数据学出避让动作。它和「碰撞检测（本体安全）」不同：避障在碰撞发生前绕开，碰撞检测是撞上之后及时发现并停下或退让。走动的人这类动态障碍比静态障碍难得多，还需要预测对方怎么动。","example":"扫地机器人按规划路线清扫时，遇到新放在地上的拖鞋，局部规划器根据激光雷达数据实时绕行，并把它更新到地图里。","related":["运动规划","碰撞检查","代价地图","动态窗口法","控制障碍函数","碰撞检测（本体安全）"]},{"id":"costmap","category":"control","sec":6,"tier":2,"sources":[{"title":"Nav2 Docs: Environmental Representation","url":"https://docs.nav2.org/rolling/getting_started/navigation_concepts/environmental_representation/"},{"title":"Nav2 Docs: Costmap 2D 配置（含 local_costmap 示例）","url":"https://docs.nav2.org/rolling/configuration_and_development/configuration_guide/core_servers/costmap_2d/"},{"title":"navigation2 源码 cost_values.hpp（代价取值定义）","url":"https://github.com/ros-navigation/navigation2/blob/main/nav2_costmap_2d/include/nav2_costmap_2d/cost_values.hpp"}],"as_of":"2026-09","related_ids":["occupancy-grid-map","global-planning-and-local-planning","ros-2-navigation-stack","path-planning","obstacle-avoidance","dynamic-window-approach"],"name":"代价地图","alt":"Costmap","abbr":"","aliases":["代价栅格地图","costmap_2d","Cost Map"],"one_liner":"把地面切成栅格、每格标上通行代价的二维地图，供导航规划和避障使用。","explanation":"代价地图是移动机器人导航最常用的环境表示，ROS 的 costmap_2d 和 Nav2 都以它为核心。它把地面划成规则的二维栅格，每格存一个 0–255 的代价：Nav2 里 0 是空闲，254 是致命障碍，253 表示机器人中心进到这格就必然碰撞（内切膨胀），255 是未知。地图由多个图层叠加而成：静态层来自事先建好的地图，障碍物层和体素层实时写入传感器看到的障碍，膨胀层在障碍周围按指数衰减加上代价，让路径自动和障碍保持距离。全局规划在覆盖全图的全局代价地图上找路，局部控制器在跟着机器人走的小范围局部代价地图上避障。","example":"Nav2 示例配置里的局部代价地图以机器人为中心，是 3 m×3 m、分辨率 0.05 m 的滚动窗口，也就是 60×60 个格子，随机器人移动不断刷新。","related":["占据栅格地图","全局规划与局部规划","Nav2","路径规划","避障","动态窗口法"]},{"id":"global-planning-and-local-planning","category":"control","sec":6,"tier":2,"sources":[{"title":"Nav2 Docs: Navigation Servers（planner 与 controller）","url":"https://docs.nav2.org/rolling/getting_started/navigation_concepts/navigation_servers/"},{"title":"Nav2 Docs: Controller Server 配置（controller_frequency 默认 20 Hz）","url":"https://docs.nav2.org/rolling/configuration_and_development/configuration_guide/core_servers/controller_server/"}],"as_of":"2026-09","related_ids":["costmap","ros-2-navigation-stack","a-star-search","dynamic-window-approach","timed-elastic-band","path-planning"],"name":"全局规划与局部规划","alt":"Global Planning and Local Planning","abbr":"","aliases":["全局规划器","局部规划器","局部控制器","Global Planner","Local Planner"],"one_liner":"导航分两层：全局规划在整张地图上找路，局部规划实时跟路并避开眼前障碍。","explanation":"移动机器人导航通常把规划拆成两层。全局规划器（Nav2 里叫 planner）在覆盖整张地图的全局代价地图上，用 Dijkstra、A*、Hybrid-A* 等算法算出从当前位置到目标的完整路径，更新频率较低。局部规划器（Nav2 里叫 controller）只看机器人周围几米、跟着机器人移动的局部代价地图，以较高频率（Nav2 默认 20 Hz）算出速度指令去跟随全局路径，同时避开行人、推车等临时障碍，常见算法有动态窗口法、时间弹性带、MPPI 和纯追踪。这样分工是因为全图搜索太慢，做不到实时；只看局部又容易陷进死胡同。","example":"仓库里的 AMR 送货：全局规划器先在全局地图上沿货架通道规划出去 3 号库位的路线；途中有人推着推车横穿过道，局部控制器在局部代价地图里看到新障碍，减速绕开后再回到原路线。","related":["代价地图","Nav2","A* 算法","动态窗口法","时间弹性带","路径规划"]},{"id":"dijkstra-s-algorithm","category":"control","sec":6,"tier":2,"sources":[{"title":"Wikipedia: Dijkstra's algorithm","url":"https://en.wikipedia.org/wiki/Dijkstra%27s_algorithm"},{"title":"Nav2 Docs: NavFn Planner（wavefront Dijkstra or A*）","url":"https://docs.nav2.org/rolling/configuration_and_development/configuration_guide/planners_plugins/configuring_navfn/"}],"as_of":"","related_ids":["a-star-search","path-planning","costmap","global-planning-and-local-planning","hybrid-a-star"],"name":"Dijkstra 算法","alt":"Dijkstra's Algorithm","abbr":"","aliases":["迪杰斯特拉算法","狄克斯特拉算法"],"one_liner":"在边权非负的图上，求起点到其余各点最短路径的经典算法。","explanation":"Dijkstra 算法由荷兰学者 Edsger Dijkstra 于 1956 年构想、1959 年发表，用来在边权（通行代价）非负的图上求单源最短路。做法是记下每个节点当前已知的最短距离，每次取出距离最小、还没确定的节点，用它更新邻居。它保证找到最优解，用二叉堆实现时复杂度约为 O((V+E)logV)，V、E 分别是节点数和边数。A* 是它的推广：多加一个「离终点还有多远」的估计（启发函数），优先朝目标方向搜，展开的节点更少。机器人导航里，栅格地图的每个格子是节点，代价地图的值是边权，Nav2 默认的 NavFn 规划器可选 Dijkstra 或 A* 扩展。","example":"三个点 A、B、C：A→B 代价 1，B→C 代价 2，A→C 直连代价 4。算法先确定 B（距离 1），再经 B 把 C 的距离从 4 更新为 3，最终最短路是 A→B→C。","related":["A* 算法","路径规划","代价地图","全局规划与局部规划","混合 A*"]},{"id":"a-star-search","category":"control","sec":6,"tier":2,"sources":[{"title":"Wikipedia: A* search algorithm","url":"https://en.wikipedia.org/wiki/A*_search_algorithm"}],"as_of":"","related_ids":["dijkstra-s-algorithm","hybrid-a-star","path-planning","costmap","global-planning-and-local-planning","rapidly-exploring-random-tree"],"name":"A* 算法","alt":"A* Search","abbr":"A*","aliases":["A星算法","A-star","A* 搜索"],"one_liner":"按「已走代价 + 到终点的估计代价」挑下一步的最短路径搜索算法。","explanation":"A* 是在图或栅格地图上找最短路径的搜索算法，1968 年由斯坦福研究院的 Hart、Nilsson、Raphael 为 Shakey 移动机器人项目提出。它每次扩展 f(n)=g(n)+h(n) 最小的节点：g(n) 是从起点走到节点 n 已花的实际代价，h(n) 是从 n 到终点的估计代价（启发函数，如直线距离）。只要 h 从不高估真实代价（称为可采纳），A* 保证找到最短路；h 恒为 0 时退化成 Dijkstra 算法，会向四面八方均匀搜索。它常用于移动机器人全局路径规划和游戏寻路；机械臂的高维关节空间一般改用 RRT 等基于采样的规划。考虑车辆转弯约束的变体叫混合 A*。","example":"扫地机器人在 5 厘米一格的占据栅格地图上从客厅去卧室：每走一格代价为 1，h 取当前格到卧室的直线距离，A* 绕开被占据的格子得到最短路线，再交给局部规划器去跟踪。","related":["Dijkstra 算法","混合 A*","路径规划","代价地图","全局规划与局部规划","快速扩展随机树"]},{"id":"hybrid-a-star","category":"control","sec":6,"tier":3,"sources":[{"title":"Dolgov, Thrun, Montemerlo, Diebel: Practical Search Techniques in Path Planning for Autonomous Driving (2008)","url":"https://ai.stanford.edu/~ddolgov/papers/dolgov_gpp_stair08.pdf"},{"title":"Open Robotics Discourse: [Nav2] SmacPlanner (Hybrid-A*, 2D A*) Now Available (2020-10)","url":"https://discourse.openrobotics.org/t/nav2-smacplanner-hybrid-a-2d-a-now-available-reminder-meeting-oct-15-cancelled/16759"}],"as_of":"","related_ids":["a-star-search","nonholonomic-constraint","path-planning","kinodynamic-planning","path-smoothing","autonomous-driving"],"name":"混合 A*","alt":"Hybrid A*","abbr":"","aliases":["Hybrid A星","Hybrid-A*","混合A星"],"one_liner":"在栅格上搜索、但记录车辆连续位置和朝向，保证路径车能开出来的 A* 变体。","explanation":"混合 A* 由 Dolgov、Thrun 等人为斯坦福无人车 Junior 参加 2007 年 DARPA 城市挑战赛设计。普通 A* 只在栅格中心间跳，折线路径汽车开不出来，因为车不能原地转向（非完整约束）。混合 A* 在位置 x、y 和朝向 θ 上搜索：格子仍用来给节点去重，但节点记着车真实的连续位姿；扩展时按几种固定方向盘转角（含倒车）模拟开一小段，每段都满足车辆运动学。启发值取两者较大者：忽略障碍、按车辆转弯能力算的最短距离，和考虑障碍、忽略朝向的网格最短距离；最后用数值优化把路径磨平。常用于泊车、掉头等场景。","example":"Junior 在比赛中用它在停车场里倒车入位、在堵路上掉头，论文报告整轮重规划耗时约 50–300 毫秒。ROS 2 导航框架 Nav2 的 Smac Planner 也提供 Hybrid-A* 实现，面向阿克曼转向的车式底盘。","related":["A* 算法","非完整约束","路径规划","动力学约束规划","路径平滑","自动驾驶"]},{"id":"replanning","category":"control","sec":6,"tier":2,"sources":[{"title":"Nav2 默认行为树 navigate_to_pose_w_replanning_and_recovery.xml（1 Hz 重规划）","url":"https://github.com/ros-navigation/navigation2/blob/main/nav2_bt_navigator/behavior_trees/navigate_to_pose_w_replanning_and_recovery.xml"},{"title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","url":"https://arxiv.org/abs/2207.05608"}],"as_of":"","related_ids":["failure-recovery","model-predictive-control","d-star-d-star-lite","closed-loop-control","behavior-tree","llm-based-task-planning"],"name":"重规划","alt":"Replanning","abbr":"","aliases":["在线重规划","动态重规划"],"one_liner":"执行途中根据新情况重新计算路径或步骤，而不是按原计划一条路走到底。","explanation":"重规划指机器人在执行过程中因环境变化、执行出错或获得新信息，重新计算剩余的路径、轨迹或任务步骤。事先算好的计划默认世界不变，但现实中会冒出新障碍、物体被碰歪、抓取失败，照原计划走下去就会失败。它出现在各个层级：导航中，ROS 2 导航栈 Nav2 的默认行为树以 1 Hz 周期性重算全局路径；控制中，模型预测控制每个周期都重新求解一小段未来动作，可以看作高频的重规划；任务层面，Inner Monologue 把成功检测、场景描述等反馈交给大语言模型，让它在失败后调整下一步。","example":"用 Nav2 导航的移动机器人按路径去厨房，途中有人把椅子挪进走廊；代价地图更新后，下一轮重规划给出绕开椅子的新路径，路径算不出来时再触发清空代价地图、原地旋转、后退等恢复动作。","related":["失败恢复","模型预测控制","D* / D* Lite","闭环","行为树","大模型任务规划"]},{"id":"d-star-d-star-lite","category":"control","sec":6,"tier":3,"sources":[{"title":"Wikipedia: D*","url":"https://en.wikipedia.org/wiki/D*"},{"title":"Koenig & Likhachev, D* Lite (AAAI 2002)","url":"https://idm-lab.org/bib/abstracts/Koen02e.html"}],"as_of":"","related_ids":["a-star-search","dijkstra-s-algorithm","replanning","path-planning","global-planning-and-local-planning","costmap"],"name":"D* / D* Lite","alt":"D* / D* Lite (Incremental Replanning)","abbr":"","aliases":["D*","D* Lite","Dynamic A*","Focused D*","增量式重规划算法"],"one_liner":"地图边走边变时，只修补受影响的部分、快速重算最短路径的图搜索算法。","explanation":"D* 是 Anthony Stentz 在 1994 年提出的增量式路径搜索算法，名字来自 Dynamic A*；2002 年 Sven Koenig 和 Maxim Likhachev 在 LPA* 的基础上提出更简洁的 D* Lite，如今用得更多。它解决「地图不完全已知」的导航：机器人先按已知信息规划一条路（未知区域通常先当作可通行），边走边用传感器发现新障碍。普通 A* 每次都要从头搜索；D* 系列从终点往起点反向搜索，并保留上一轮算出的代价值，某些边的代价一变，只修补受影响的节点，所以重规划很快。据维基百科，基于它的导航系统曾在火星车 Spirit 和 Opportunity 上做过原型测试，也用在 CMU 赢得 DARPA 城市挑战赛的无人车上。它属于全局规划，常和 DWA 等局部规划器搭配。","example":"仓库里的移动机器人按旧地图规划了一条穿过某条通道的路线，走到一半激光雷达发现通道被托盘堵住。D* Lite 只更新被堵格子附近节点的代价，就能给出绕行路线，不必对整张地图重跑一遍 A*。","related":["A* 算法","Dijkstra 算法","重规划","路径规划","全局规划与局部规划","代价地图"]},{"id":"artificial-potential-field","category":"control","sec":6,"tier":2,"sources":[{"title":"Khatib, Real-Time Obstacle Avoidance for Manipulators and Mobile Robots (IJRR 1986)","url":"https://doi.org/10.1177/027836498600500106"},{"title":"Wikipedia: Motion planning（Artificial potential fields 一节）","url":"https://en.wikipedia.org/wiki/Motion_planning"}],"as_of":"","related_ids":["obstacle-avoidance","path-planning","rapidly-exploring-random-tree","a-star-search","riemannian-motion-policies","control-barrier-function"],"name":"人工势场法","alt":"Artificial Potential Field","abbr":"APF","aliases":["势场法","Potential field method"],"one_liner":"目标产生吸引力、障碍物产生排斥力，机器人顺着合力走的实时避障方法。","explanation":"人工势场法由 Khatib 在 1985 年 ICRA、1986 年 IJRR 的论文中提出，用于机械臂和移动机器人的实时避障，当时在 PUMA 560 机械臂上实现。它把空间看成一张势能图：目标处势能最低、产生吸引力，障碍物附近势能高、产生排斥力（通常只在一定距离内生效）。每个控制周期计算势能下降最快的方向（负梯度，即合力方向），让机器人朝这个方向走一小步。优点是计算量很小、能随传感器数据实时更新，也能处理移动障碍；主要缺陷是会陷入局部极小值——吸引力和排斥力恰好抵消时机器人停住或来回震荡，而且不保证路径最短。所以它多用作局部避障层，与 A*、RRT 等全局规划器配合；后来的黎曼运动策略等反应式方法思路与之相近。","example":"移动机器人要穿过一扇窄门，门框两侧各有排斥场、门后目标有吸引场；门太窄时两侧排斥力加起来抵消了吸引力，机器人停在门前不动，这就是局部极小值。","related":["避障","路径规划","快速扩展随机树","A* 算法","黎曼运动策略","控制障碍函数"]},{"id":"dynamic-window-approach","category":"control","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Dynamic window approach","url":"https://en.wikipedia.org/wiki/Dynamic_window_approach"},{"title":"Nav2 DWB Controller README（successor to DWA in ROS 1）","url":"https://github.com/ros-navigation/navigation2/tree/main/nav2_dwb_controller"}],"as_of":"","related_ids":["global-planning-and-local-planning","timed-elastic-band","artificial-potential-field","costmap","ros-2-navigation-stack","obstacle-avoidance"],"name":"动态窗口法","alt":"Dynamic Window Approach","abbr":"DWA","aliases":["动态窗口算法","动态窗口避障","dwa_local_planner"],"one_liner":"在机器人下一刻能达到的速度里采样、模拟、打分，选出最优速度的局部避障法。","explanation":"动态窗口法由 Dieter Fox、Wolfram Burgard 和 Sebastian Thrun 在 1997 年提出，是移动机器人最经典的局部避障算法之一。它直接在速度空间里找控制指令，对差速底盘来说，候选就是线速度 v 和角速度 ω 的组合。「动态窗口」指按最大加减速度，下一个控制周期内实际能达到的那一小块速度范围；再剔掉刹车来不及、会撞上障碍的速度。对剩下的每组 (v, ω) 前向模拟一小段圆弧轨迹，用 G = α·朝向目标程度 + β·离障碍物距离 + γ·速度大小 打分，执行得分最高的一组。它考虑了机器人的加速度限制，计算量小；但只看眼前一小段，遇到 U 形障碍容易卡住，所以通常需要 A*、D* 等全局规划器先给出大致路线。ROS 1 的 dwa_local_planner 和 Nav2 的 DWB 控制器都源自这一思路。","example":"一台差速底盘机器人在 ROS 导航栈里运行：全局规划器给出一条路线，每个控制周期局部规划器采样一批 (v, ω)，模拟未来一小段时间的轨迹，丢掉会碰到代价地图障碍的，再从剩下的里面选既贴近路线又走得快的一组发给底盘。","related":["全局规划与局部规划","时间弹性带","人工势场法","代价地图","Nav2","避障"]},{"id":"timed-elastic-band","category":"control","sec":6,"tier":3,"sources":[{"title":"teb_local_planner README（rst-tu-dortmund, GitHub）","url":"https://github.com/rst-tu-dortmund/teb_local_planner"},{"title":"Quinlan, Khatib: Elastic bands: connecting path planning and control (ICRA 1993)","url":"https://doi.org/10.1109/robot.1993.291936"}],"as_of":"","related_ids":["global-planning-and-local-planning","dynamic-window-approach","costmap","trajectory-optimization","ackermann-steering-chassis","ros-2-navigation-stack"],"name":"时间弹性带","alt":"Timed Elastic Band","abbr":"TEB","aliases":["teb_local_planner","TEB 局部规划器","时变弹性带"],"one_liner":"把局部轨迹当作带时间间隔的「橡皮筋」实时优化的移动机器人局部规划方法。","explanation":"TEB 由德国多特蒙德工业大学的 Christoph Rösmann 等在 2012 年提出，开源实现 teb_local_planner 是 ROS 导航栈里常用的局部规划插件。它继承了 1993 年 Quinlan 与 Khatib 的「弹性带」思路：把全局路径看成一条会被障碍物推开、又会自己拉紧的橡皮筋。TEB 的改动是在相邻位姿之间加入时间间隔 ΔT，于是能同时优化总耗时、与障碍物的距离，以及速度、加速度、最小转弯半径等运动学与动力学约束。每项目标只牵涉相邻几个位姿，问题很稀疏，用 g2o 图优化库可以实时求解。后续版本会在拓扑不同的多条路线（从障碍左边绕或右边绕）上并行优化再择优，并支持阿克曼转向的类车机器人。和动态窗口法只采样下一时刻速度不同，TEB 显式规划一整段带时间的轨迹，在窄通道和类车底盘上更好用。","example":"阿克曼底盘的巡检小车在走廊里遇到障碍：TEB 同时优化「从左绕」和「从右绕」两条候选轨迹，选出耗时更短且满足最小转弯半径的那条，每个控制周期再按新的代价地图重新优化。","related":["全局规划与局部规划","动态窗口法","代价地图","轨迹优化","阿克曼底盘","Nav2"]},{"id":"pure-pursuit","category":"control","sec":6,"tier":3,"sources":[{"title":"R. C. Coulter, Implementation of the Pure Pursuit Path Tracking Algorithm (CMU-RI-TR-92-01, 1992)","url":"https://publications.ri.cmu.edu/storage/publications/pub_files/pub3/coulter_r_craig_1992_1/coulter_r_craig_1992_1.pdf"},{"title":"Nav2 Regulated Pure Pursuit Controller README","url":"https://github.com/ros-navigation/navigation2/tree/main/nav2_regulated_pure_pursuit_controller"}],"as_of":"","related_ids":["trajectory-tracking","path-planning","global-planning-and-local-planning","dynamic-window-approach","timed-elastic-band","ros-2-navigation-stack"],"name":"纯追踪算法","alt":"Pure Pursuit","abbr":"","aliases":["纯跟踪","纯追踪","Pure Pursuit Controller"],"one_liner":"在路径前方取一个预瞄点，算出开过去所需圆弧曲率的路径跟踪方法。","explanation":"纯追踪是一种几何路径跟踪算法，卡内基梅隆大学 1980 年代先把它用在 Terragator 移动机器人上，后用于 NavLab 自动驾驶车，Coulter 1992 年的技术报告给出了标准推导。做法是：在路径上找离车一个「预瞄距离」L 的目标点，作一条从车当前位置出发、与车头方向相切并经过目标点的圆弧，其曲率 κ = 2x/L²，x 是目标点在车体坐标系下的横向偏移；再把曲率换算成转向角或角速度。唯一的参数就是 L：L 大，回到路径更平缓、不易来回摆，但弯道会切弯；L 小，跟得紧但容易振荡。它只管几何，不考虑动力学和障碍物，通常与全局规划、局部避障配合使用。","example":"ROS 2 导航栈 Nav2 自带 Regulated Pure Pursuit 控制器，适用于差速、阿克曼转向和足式机器人：它让预瞄距离随速度变化，并在急弯处或靠近障碍物时自动降速。","related":["轨迹跟踪","路径规划","全局规划与局部规划","动态窗口法","时间弹性带","Nav2"]},{"id":"velocity-obstacles","category":"control","sec":6,"tier":3,"sources":[{"title":"Fiorini, Shiller: Motion Planning in Dynamic Environments Using Velocity Obstacles (IJRR 1998)","url":"https://doi.org/10.1177/027836499801700706"},{"title":"ORCA: Optimal Reciprocal Collision Avoidance（UNC GAMMA 项目页）","url":"https://gamma.cs.unc.edu/ORCA/"},{"title":"RVO2 Library: Reciprocal Collision Avoidance for Real-Time Multi-Agent Simulation","url":"https://gamma.cs.unc.edu/RVO2/"}],"as_of":"","related_ids":["obstacle-avoidance","social-navigation","multi-agent-path-finding","multi-robot-collaboration","dynamic-window-approach","autonomous-mobile-robot"],"name":"速度障碍法 / ORCA","alt":"Velocity Obstacles / Optimal Reciprocal Collision Avoidance","abbr":"","aliases":["速度障碍","Velocity Obstacle","VO","互惠速度障碍","RVO","ORCA","最优互惠避碰","RVO2"],"one_liner":"在速度空间里划出「会撞」的速度集合，选一个不撞且最接近期望的速度。","explanation":"速度障碍（VO）由 Fiorini 与 Shiller 提出，1998 年发表于 IJRR：假设障碍物保持当前速度，把本机器人所有会在未来某时刻与它相撞的速度收集起来，在速度空间里形成一个锥形区域，只要选锥外的速度就不会撞。多个机器人都这么做时，双方会同时躲开、又同时回来，来回摆动。2008 年 van den Berg 等提出互惠速度障碍（RVO），假设对方也会躲；之后 van den Berg、Guy、Lin、Manocha 提出 ORCA（最优互惠避碰，论文 2011 年正式出版），规定每一对智能体各承担一半避让责任，把每个邻居的约束写成速度空间里的一个半平面，再解一个低维线性规划，选出离期望速度最近的可行速度。它不需要通信，能实时处理上千个智能体，开源库 RVO2 被用于人群仿真、游戏和多机器人导航。它只考虑速度和几何形状，不处理复杂动力学。","example":"仓库里几台 AMR 在交叉口相遇：每台各自按 ORCA 计算，对每个邻居只让出一半的避让量，结果都略微偏转、减速后错开通过，不需要中央调度。","related":["避障","社交导航","多智能体路径规划","多机器人协作","动态窗口法","自主移动机器人"]},{"id":"multi-agent-path-finding","category":"control","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Multi-agent pathfinding","url":"https://en.wikipedia.org/wiki/Multi-agent_pathfinding"},{"title":"Multi-Agent Pathfinding: Definitions, Variants, and Benchmarks (arXiv 1906.08291)","url":"https://arxiv.org/abs/1906.08291"}],"as_of":"","related_ids":["path-planning","multi-robot-collaboration","a-star-search","fleet-management-system","velocity-obstacles","autonomous-mobile-robot"],"name":"多智能体路径规划","alt":"Multi-Agent Path Finding","abbr":"MAPF","aliases":["多智能体寻路","多机器人路径规划","Multi-Agent Pathfinding"],"one_liner":"给一群机器人同时规划各自到目标的路线，并保证彼此不相撞。","explanation":"多智能体路径规划研究的是：地图上有多个智能体（机器人、AGV 等），各有起点和终点，要一起算出互不碰撞的路径。经典设定把地图离散成栅格或图、时间离散成步，每步每个智能体可以移到相邻格或原地等待。冲突主要有两种：同一时刻占同一格（顶点冲突），或相邻两个互换位置（交换冲突）。优化目标常用所有智能体到达时间之和，或最后一个到达的时间（makespan）。求最优解是 NP 难问题，常见算法有冲突搜索 CBS（先各自规划，发现冲突再加约束重规划）和优先级规划（按顺序规划，后规划的避让先规划的）。2019 年 Stern 等人的综述统一了各种变体的定义并给出栅格基准。它是仓储机器人集群调度的核心问题，和单机路径规划、局部避障（如 ORCA）互补。","example":"电商仓库里大量搬运机器人把货架送到拣货台（亚马逊的 Kiva 系统是典型场景），调度系统每接到新任务都要给这些机器人重新分配互不冲突的路径。","related":["路径规划","多机器人协作","A* 算法","多机调度系统","速度障碍法 / ORCA","自主移动机器人"]},{"id":"frontier-based-exploration","category":"control","sec":6,"tier":3,"sources":[{"title":"Yamauchi, A Frontier-Based Approach for Autonomous Exploration (IEEE CIRA 1997)","url":"https://www.cs.cmu.edu/~motionplanning/papers/sbp_papers/integrated1/yamauchi_frontiers.pdf"}],"as_of":"","related_ids":["active-exploration","occupancy-grid-map","simultaneous-localization-and-mapping","object-goal-navigation","vlfm","next-best-view-planning"],"name":"前沿探索","alt":"Frontier-based Exploration","abbr":"","aliases":["边界探索","基于前沿的探索"],"one_liner":"机器人反复开向「已知空地与未知区域的交界」，边走边把地图建完。","explanation":"由美国海军研究实验室的 Brian Yamauchi 在 1997 年提出（IEEE CIRA 会议），回答的是：在陌生环境里，下一步去哪能获得最多新信息？做法是在占据栅格地图（把空间切成格子，标为空闲、障碍或未知）上找「前沿」——与未知格相邻的已知空闲格，把相邻前沿格聚成区域，选一个（原文取最近的）导航过去，到达后用传感器更新地图，再找新前沿，直到前沿消失。它简单、不假设墙面走向或房间形状，至今仍是移动机器人自主建图和目标导航的常用基线；后续工作把「最近」换成信息增益，或让视觉语言模型给前沿打分（如 VLFM）。","example":"四足机器人被放进一栋没有预置地图的办公楼：它一边用激光 SLAM 建占据栅格，一边开向最近的前沿，走廊和房间逐个探完后不再有前沿，探索结束。","related":["主动探索","占据栅格地图","同步定位与建图","物体目标导航","VLFM（视觉语言前沿地图）","下一最佳视角"]},{"id":"coverage-path-planning","category":"control","sec":6,"tier":3,"sources":[{"title":"Mier et al., Fields2Cover: An Open-Source Coverage Path Planning Library for Unmanned Agricultural Vehicles (arXiv:2210.07838)","url":"https://arxiv.org/abs/2210.07838"},{"title":"open-navigation/opennav_coverage（Nav2 全覆盖任务服务器）","url":"https://github.com/open-navigation/opennav_coverage"},{"title":"Choset & Pignon: Coverage Path Planning: The Boustrophedon Cellular Decomposition (1998)","url":"https://publications.ri.cmu.edu/coverage-path-planning-the-boustrophedon-cellular-decomposition/"}],"as_of":"","related_ids":["path-planning","global-planning-and-local-planning","occupancy-grid-map","robot-vacuum-cleaner","ros-2-navigation-stack","multi-agent-path-finding"],"name":"覆盖路径规划","alt":"Coverage Path Planning","abbr":"CPP","aliases":["全覆盖路径规划","完全覆盖路径规划","覆盖规划","Complete Coverage Path Planning"],"one_liner":"规划一条让机器人（或它的工具）扫过整片区域每一处的路径。","explanation":"普通路径规划只管从 A 到 B；覆盖路径规划要求机器人的作业范围（吸口、割刀、喷头）扫过目标区域里所有无障碍的地方，同时尽量减少重复覆盖、转弯次数和总时间。经典方法有三类：单元分解，最常用的是 Choset 与 Pignon 1998 年提出的牛耕式（boustrophedon）分解，按障碍把区域切成若干块，每块内像犁地一样来回平行走；栅格法，把地图划成格子逐格访问；以及螺旋式等。按是否事先知道地图，又分离线和在线两类。Galceran 与 Carreras 2013 年在 Robotics and Autonomous Systems 上的综述对这些方法做了系统梳理。典型应用有扫地机器人、割草机器人、农机、喷洒无人机，以及机械臂对曲面的喷涂和打磨。","example":"面向农机的开源库 Fields2Cover 把规划拆成地头生成、作业条带生成、条带排序和最终路径四步；Nav2 的 opennav_coverage 基于它开发，支持牛耕式、蛇形、螺旋等条带顺序，可让 ROS 2 机器人直接执行全覆盖任务。","related":["路径规划","全局规划与局部规划","占据栅格地图","扫地机器人","Nav2","多智能体路径规划"]},{"id":"collision-checking","category":"control","sec":7,"tier":2,"sources":[{"title":"Wikipedia: Motion planning（collision detection 与采样规划）","url":"https://en.wikipedia.org/wiki/Motion_planning"},{"title":"FCL: The Flexible Collision Library (GitHub)","url":"https://github.com/flexible-collision-library/fcl"},{"title":"MoveIt 2 Docs: Planning Scene tutorial（collision checking）","url":"https://moveit.picknik.ai/main/doc/examples/planning_scene/planning_scene_tutorial.html"}],"as_of":"","related_ids":["self-collision-checking","collision-detection-2","flexible-collision-library","moveit-motion-planning-framework","sampling-based-planning","bounding-volume"],"name":"碰撞检查","alt":"Collision Checking","abbr":"","aliases":["碰撞检查（规划用）","碰撞查询","Collision query"],"one_liner":"规划时查询某个姿态或某段路径会不会让机器人撞到自己或环境。","explanation":"碰撞检查是运动规划里的几何查询：给定机器人的一组关节角（一个构型），先用正运动学算出每根连杆在空间中的位置，再判断这些几何体是否与环境障碍物或机器人自身其他部位相交，也可以返回最近距离和接触点。RRT、PRM 等基于采样的规划器每采一个点、连一条边都要调用它，所以它常占规划耗时的很大一部分。为了快，通常先用包围盒层次结构粗筛，再对凸体用 GJK 等算法精算。开源库 FCL 支持碰撞、距离、连续碰撞检测等查询；MoveIt 同时检查自碰撞和环境碰撞，并用「允许碰撞矩阵」忽略相邻连杆这类必然接触的部位。要区分三个概念：碰撞检查在动作执行前、对模型做；物理引擎里的碰撞检测用于仿真接触；本体安全里的碰撞检测是在真机运动中发现意外撞击。","example":"机械臂要把杯子放进柜子，RRT 采到一组关节角后做碰撞检查：前臂的胶囊体和柜门的盒子相交，这个点被丢弃；两个合法点之间的连线也要按小步长插值、逐点检查。","related":["自碰撞检测","碰撞检测（物理引擎）","FCL","MoveIt","基于采样的规划","包围盒"]},{"id":"self-collision-checking","category":"control","sec":7,"tier":2,"sources":[{"title":"MoveIt Setup Assistant Tutorial: Generate Self-Collision Matrix","url":"https://moveit.picknik.ai/main/doc/examples/setup_assistant/setup_assistant_tutorial.html"},{"title":"Franka FCI 文档：franka_selfcollision","url":"https://frankarobotics.github.io/docs/doc/franka_ros2_jazzy/franka_selfcollision/doc/index.html"}],"as_of":"2026-09","related_ids":["collision-checking","collision-detection","semantic-robot-description-format","collision-geometry","bimanual-manipulation","moveit-motion-planning-framework"],"name":"自碰撞检测","alt":"Self-Collision Checking","abbr":"","aliases":["自碰撞","自碰撞检查"],"one_liner":"判断机器人在某个姿态下，自己的连杆之间会不会相互撞上。","explanation":"自碰撞检测是碰撞检查的一种，只判断机器人自身各连杆之间在某个关节构型下是否相交，比如双臂互撞、手臂打到躯干、两腿相碰。它与对环境障碍物的检查一起用在运动规划、逆运动学求解和遥操作中，也可作为运行时的安全监控。为节省计算，通常先用允许碰撞矩阵排除不必检查的连杆对：MoveIt Setup Assistant 默认随机采样 10000 个构型，把相邻、永不相碰、总是相碰的连杆对标记出来写入 SRDF。它与碰撞检测（本体安全）不同：后者靠力矩或动量观测器发现已经发生的碰撞，自碰撞检测是在几何上提前判断。","example":"Franka 的 FR3 Duo 双臂配置启动时会自动运行自碰撞监控节点，默认在连杆周围留 0.045 米安全余量，两臂靠得过近就在 collision_detected 话题上发布警报，并打印是哪两个连杆。","related":["碰撞检查","碰撞检测（本体安全）","语义机器人描述格式","碰撞体","双臂操作","MoveIt"]},{"id":"bounding-volume","category":"control","sec":7,"tier":3,"sources":[{"title":"Wikipedia: Bounding volume","url":"https://en.wikipedia.org/wiki/Bounding_volume"},{"title":"Wikipedia: Bounding volume hierarchy","url":"https://en.wikipedia.org/wiki/Bounding_volume_hierarchy"},{"title":"FCL (Flexible Collision Library) README","url":"https://github.com/flexible-collision-library/fcl"}],"as_of":"","related_ids":["collision-checking","broad-phase-narrow-phase-collision-detection","gilbert-johnson-keerthi-algorithm","collision-geometry","convex-decomposition","flexible-collision-library"],"name":"包围盒","alt":"Bounding Volume (AABB / OBB)","abbr":"AABB/OBB","aliases":["包围体","轴对齐包围盒","有向包围盒","包围体层次 BVH","Bounding Volume Hierarchy"],"one_liner":"用盒子、球等简单形状包住复杂物体，先粗筛再精算碰撞。","explanation":"包围体是能完全包住一个物体的简单几何体，用来加速碰撞检测：两个包围体不相交，里面的物体一定不碰，可直接跳过精确计算。最常用的是 AABB（轴对齐包围盒，各边平行于世界坐标轴，相交判断只需逐轴比较最小和最大坐标，但物体一转就要重算，还可能包进大片空白）和 OBB（有向包围盒，跟着物体自身坐标系旋转，包得更紧，判断更费时）；此外还有包围球、胶囊体、k-DOP 和凸包。把大量包围体组织成树就是包围体层次（BVH）：父节点不相交，子节点都不用再查，查询量从线性降到对数级。物理引擎和运动规划里，通常先用 AABB 做宽相粗筛出可能相撞的物体对，再在窄相用 GJK 等算法精确计算。","example":"碰撞检测库 FCL 的宽相管理器一般推荐动态 AABB 树；对三角网格模型，它默认建立 OBBRSS（OBB 与矩形扫掠球的组合）类型的 BVH 做窄相查询。","related":["碰撞检查","宽相 / 窄相碰撞检测","GJK 算法","碰撞体","凸分解","FCL"]},{"id":"gilbert-johnson-keerthi-algorithm","category":"control","sec":7,"tier":3,"sources":[{"title":"Wikipedia: Gilbert–Johnson–Keerthi distance algorithm","url":"https://en.wikipedia.org/wiki/Gilbert%E2%80%93Johnson%E2%80%93Keerthi_distance_algorithm"},{"title":"MuJoCo documentation: Computation (collision detection pipelines)","url":"https://github.com/google-deepmind/mujoco/blob/main/doc/computation/index.rst"}],"as_of":"","related_ids":["collision-detection-2","collision-checking","convex-decomposition","broad-phase-narrow-phase-collision-detection","collision-geometry","flexible-collision-library"],"name":"GJK 算法","alt":"Gilbert-Johnson-Keerthi Algorithm","abbr":"GJK","aliases":["GJK 距离算法","Gilbert–Johnson–Keerthi distance algorithm"],"one_liner":"判断两个凸形状是否相交、并算出它们最近距离的经典迭代算法。","explanation":"由 Elmer Gilbert、Daniel Johnson 和 S. Sathiya Keerthi 于 1988 年发表。它只需要每个凸形状的「支撑函数」：给定一个方向，返回形状上沿该方向最远的点，所以球、盒子、胶囊、凸网格都能统一处理。核心事实是：两个凸体相交，当且仅当它们的闵可夫斯基差（A 中每点减 B 中每点得到的集合）包含原点。算法在差集里迭代构造点、线段、三角形、四面体等单纯形，逐步逼近离原点最近的点，从而得到最近距离或判定相交。它快且省内存，是物理引擎窄相碰撞检测的常用核心，MuJoCo 的默认碰撞管线就基于 GJK 加 EPA（扩展多面体算法，用来算穿透深度）。非凸物体要先做凸分解。","example":"运动规划时检查机械臂某根连杆（用凸包表示）与桌上盒子的最近距离，GJK 迭代几步就给出距离值，规划器据此判断这段路径是否留有足够余量。","related":["碰撞检测（物理引擎）","碰撞检查","凸分解","宽相 / 窄相碰撞检测","碰撞体","FCL"]},{"id":"sampling-based-planning","category":"control","sec":7,"tier":2,"sources":[{"title":"LaValle, Planning Algorithms, Chapter 5: Sampling-Based Motion Planning","url":"https://lavalle.pl/planning/ch5.pdf"},{"title":"OMPL: Available Planners","url":"https://ompl.kavrakilab.org/planners.html"}],"as_of":"","related_ids":["motion-planning","rapidly-exploring-random-tree","probabilistic-roadmap","probabilistic-completeness","configuration-space","open-motion-planning-library"],"name":"基于采样的规划","alt":"Sampling-Based Planning","abbr":"","aliases":["采样式规划","基于采样的运动规划"],"one_liner":"在构型空间里随机撒点、用碰撞检测筛选后连成无碰路径的一类运动规划方法。","explanation":"基于采样的规划是运动规划（找一条从起点到终点且不碰撞的运动）中的主流方法之一。LaValle 的教材《Planning Algorithms》把它的思路概括为：不显式构造会碰撞的构型集合，而是在构型空间（所有关节角组成的空间）里随机采样，把每个点和每段连线交给碰撞检测模块当黑箱判断。代表算法有先建路网、可反复查询的概率路线图 PRM，从起点长树、单次查询的快速扩展随机树 RRT，以及渐近最优的 RRT*、PRM*。它擅长 6–7 自由度机械臂这类高维问题，但只有概率完备性（采样足够多时找到解的概率趋于 1），路径往往曲折，需要再做平滑和时间参数化。开源库 OMPL 实现了其中大部分算法。","example":"让 7 自由度机械臂把手从桌面上方伸进柜子：RRT-Connect 从起点和终点各长一棵随机树，两棵树接上即得到一条无碰路径，再经路径平滑去掉多余拐弯后执行。","related":["运动规划","快速扩展随机树","概率路线图","概率完备性","构型空间","OMPL"]},{"id":"probabilistic-completeness","category":"control","sec":7,"tier":3,"sources":[{"title":"S. M. LaValle, Planning Algorithms, Chapter 5: Sampling-Based Motion Planning","url":"http://lavalle.pl/planning/ch5.pdf"},{"title":"Karaman & Frazzoli, Sampling-based Algorithms for Optimal Motion Planning (arXiv:1105.1186, IJRR 2011)","url":"https://arxiv.org/abs/1105.1186"}],"as_of":"","related_ids":["sampling-based-planning","rapidly-exploring-random-tree","rapidly-exploring-random-tree","probabilistic-roadmap","configuration-space","motion-planning"],"name":"概率完备性","alt":"Probabilistic Completeness","abbr":"","aliases":["概率完备","Probabilistically Complete"],"one_liner":"只要解存在，采样越多、找到可行路径的概率就越趋近 1 的算法性质。","explanation":"运动规划里的「完备」指：有解就在有限时间内找到，无解就报告无解，只有组合式的精确规划能做到。PRM、RRT 这类基于随机采样的规划器做不到，退而保证概率完备：LaValle《Planning Algorithms》的说法是，只要解存在，随着采样点增多，找到解的概率收敛到 1。Karaman 与 Frazzoli 2011 年给出严格定义，并指出 RRT、PRM 找不到解的概率随样本数指数下降。它有两个局限：可行路径得离障碍留出一点余量，极窄的通道几乎采不到；无解时算法会一直跑，无法宣布无解。它常和「渐近最优性」一起出现，后者更强：样本无限增多时路径代价几乎必然收敛到最优。RRT 只有前者，RRT* 两者都有。","example":"MoveIt 调用 OMPL 规划器时要设规划时限：概率完备的算法给的时间越多越可能找到解；但如果目标位姿被障碍物完全包住，它不会报告「无解」，只会跑到超时返回失败。","related":["基于采样的规划","快速扩展随机树","RRT*","概率路线图","构型空间","运动规划"]},{"id":"probabilistic-roadmap","category":"control","sec":7,"tier":2,"sources":[{"title":"Wikipedia: Probabilistic roadmap","url":"https://en.wikipedia.org/wiki/Probabilistic_roadmap"},{"title":"Lynch & Park, Modern Robotics（§10.5.2 The PRM Algorithm）","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["rapidly-exploring-random-tree","sampling-based-planning","probabilistic-completeness","configuration-space","path-planning","a-star-search"],"name":"概率路线图","alt":"Probabilistic Roadmap","abbr":"PRM","aliases":["概率路图法","概率路线图法","PRM 规划器"],"one_liner":"先在空间里随机撒点连成路网，再在路网上查起点到终点路径的规划算法。","explanation":"概率路线图是一种基于采样的运动规划算法，一般认为由 Lydia Kavraki 等人在 1996 年的论文中提出。它分两个阶段：构建阶段在构型空间（机器人所有可能姿态组成的空间）里随机采样无碰撞的点，把相互间能直线连通、不撞障碍的近邻点连起来，形成一张图，即「路线图」；查询阶段把起点和终点接入这张图，再用 Dijkstra 或 A* 搜出路径。它的优点是路线图建一次可反复查询（多查询），适合环境基本不变、要频繁规划的场合；弱点是狭窄通道里很难采到点。它具有概率完备性：采样足够多时，只要路径存在，找到的概率趋近 1。与之相对，RRT 每次从起点现长一棵树，更适合单次查询。","example":"工位上固定的机械臂，事先在关节空间建好一张 PRM 路线图；之后每换一组取放目标，只需把新的起点和终点接入路网搜索，不必从头规划。","related":["快速扩展随机树","基于采样的规划","概率完备性","构型空间","路径规划","A* 算法"]},{"id":"rapidly-exploring-random-tree","category":"control","sec":7,"tier":2,"sources":[{"title":"Wikipedia: Rapidly exploring random tree","url":"https://en.wikipedia.org/wiki/Rapidly_exploring_random_tree"},{"title":"Lynch & Park, Modern Robotics（§10.5.1 The RRT Algorithm）","url":"http://hades.mech.northwestern.edu/images/7/7f/MR.pdf"}],"as_of":"","related_ids":["rapidly-exploring-random-tree","rrt-connect","probabilistic-roadmap","sampling-based-planning","path-smoothing","collision-checking"],"name":"快速扩展随机树","alt":"Rapidly-exploring Random Tree","abbr":"RRT","aliases":["快速探索随机树","快速搜索随机树","RRT 算法"],"one_liner":"从起点出发随机撒点、不断向新点长枝，直到树枝够到终点的规划算法。","explanation":"快速扩展随机树由 Steven LaValle 于 1998 年提出，后与 James Kuffner 进一步发展，是最常用的基于采样的规划算法之一。每一轮做四件事：在构型空间里随机采一个点；找树上离它最近的节点；从该节点朝采样点走一小步；这一步不碰撞就把新点加进树。大片空白区域更容易被采中，所以树会自然地往未探索的方向快速伸展。它只需碰撞检测，不必显式算出整个无碰撞空间，适合六七个自由度的机械臂，也能处理带动力学约束的系统。基础 RRT 概率完备，但路径通常曲折、不是最优，常见改进有双向生长的 RRT-Connect 和渐近最优的 RRT*，结果一般还要再做路径平滑。","example":"在二维迷宫里，RRT 从入口开始随机长枝，某根树枝进入出口附近后，沿树回溯到根就得到一条折线路径，再用捷径平滑把它拉直缩短。","related":["RRT*","RRT-Connect","概率路线图","基于采样的规划","路径平滑","碰撞检查"]},{"id":"rrt-star","category":"control","sec":7,"tier":3,"sources":[{"title":"Karaman & Frazzoli, Sampling-based Algorithms for Optimal Motion Planning (arXiv:1105.1186, IJRR 2011)","url":"https://arxiv.org/abs/1105.1186"},{"title":"OMPL: ompl::geometric::RRTstar","url":"https://ompl.kavrakilab.org/classompl_1_1geometric_1_1RRTstar.html"},{"title":"MoveIt 2 Documentation: OMPL Planner","url":"https://moveit.picknik.ai/main/doc/examples/ompl_interface/ompl_interface_tutorial.html"}],"as_of":"","related_ids":["rapidly-exploring-random-tree","informed-rrt-star","batch-informed-trees","probabilistic-completeness","probabilistic-roadmap","rrt-connect"],"name":"RRT*","alt":"RRT* (Asymptotically Optimal RRT)","abbr":"RRT*","aliases":["RRT-star","RRTstar","最优 RRT","Optimal RRT"],"one_liner":"在 RRT 上加入选父节点和重连两步，使路径随采样增多收敛到最优。","explanation":"RRT* 由 MIT 的 Karaman 和 Frazzoli 提出，系统论述见 2011 年的 IJRR 论文。他们证明普通 RRT 返回的路径代价几乎必然收敛到一个非最优值，于是在 RRT 上改了两步：新节点加入时，在一定半径内的邻居里挑一个使「起点到新节点总代价」最小的当父节点；再检查这些邻居，若改经新节点到达更便宜，就把它们重连到新节点下。邻域半径随节点数 n 按 γ(log n / n)^{1/d} 缩小，d 是空间维数，γ 是与空间大小有关的常数。这样路径代价会随采样增多几乎必然收敛到最优，即渐近最优，而计算量只比 RRT 多常数倍。缺点是收敛可能很慢，实际常给固定时间、用到超时为止。Informed RRT*、BIT* 等后续方法专门加速这一收敛。","example":"OMPL 的 RRTstar 规划器找到第一条可行路径后不会马上返回，而是继续采样、重连，在给定时间内不断缩短路径；如果设置了代价阈值，路径代价降到阈值以下就提前结束。","related":["快速扩展随机树","Informed RRT*","BIT*","概率完备性","概率路线图","RRT-Connect"]},{"id":"informed-rrt-star","category":"control","sec":7,"tier":3,"sources":[{"title":"Gammell, Srinivasa, Barfoot: Informed RRT* (arXiv:1404.2334, IROS 2014)","url":"https://arxiv.org/abs/1404.2334"},{"title":"OMPL: ompl::geometric::InformedRRTstar Class Reference","url":"https://ompl.kavrakilab.org/classompl_1_1geometric_1_1InformedRRTstar.html"}],"as_of":"","related_ids":["rapidly-exploring-random-tree","rapidly-exploring-random-tree","batch-informed-trees","sampling-based-planning","open-motion-planning-library","probabilistic-completeness"],"name":"Informed RRT*","alt":"Informed RRT* (Informed Sampling)","abbr":"","aliases":["知情 RRT*","启发式采样 RRT*","Informed Sampling"],"one_liner":"找到一条路径后，只在「可能更短」的椭球区域里采样，从而更快收敛的 RRT*。","explanation":"Informed RRT* 由 Gammell、Srinivasa、Barfoot 在 IROS 2014 提出。RRT* 找到可行路径后会继续采样、重连树枝，让路径逼近最短，但它仍在全空间均匀撒点，多数样本不可能改进结果。设当前最好路径长 c_best，能让路径变短的点 x 必须满足 ‖x−x_s‖ + ‖x−x_g‖ < c_best（x_s、x_g 为起点、终点），这在二维是以起终点为焦点的椭圆，高维是长椭球。Informed RRT* 只在该椭球内采样并剪掉椭球外节点；路径越短椭球越瘦，搜索越集中。它保留 RRT* 的渐近最优性，在高维和大地图中收敛更快，BIT* 等后续算法沿用了这一思路。","example":"开源运动规划库 OMPL 提供 InformedRRTstar 规划器，可通过 OMPL 接入 MoveIt 等框架，让机械臂在找到可行轨迹后继续在剩余时间内缩短路径。","related":["RRT*","快速扩展随机树","BIT*","基于采样的规划","OMPL","概率完备性"]},{"id":"batch-informed-trees","category":"control","sec":7,"tier":3,"sources":[{"title":"Gammell, Srinivasa, Barfoot. Batch Informed Trees (BIT*) (arXiv:1405.5848, ICRA 2015)","url":"https://arxiv.org/abs/1405.5848"},{"title":"OMPL: ompl::geometric::BITstar Class Reference","url":"https://ompl.kavrakilab.org/classompl_1_1geometric_1_1BITstar.html"}],"as_of":"","related_ids":["informed-rrt-star","rapidly-exploring-random-tree","a-star-search","sampling-based-planning","probabilistic-completeness","open-motion-planning-library"],"name":"BIT*","alt":"Batch Informed Trees","abbr":"BIT*","aliases":["批量知情树","BITstar"],"one_liner":"分批撒采样点、再按启发式顺序搜索最优路径的运动规划算法。","explanation":"BIT*（批量知情树）是 Gammell、Srinivasa、Barfoot 提出的基于采样的运动规划算法，2015 年发表于 ICRA，完整版 2020 年刊于 IJRR。RRT* 一类算法每次加一个随机点逐步长树；BIT* 则一次撒一批点，把它们看成一张隐式随机几何图（边不预先连好，用到才做碰撞检查），再像 A* 那样按「经过这条边的路径最短可能多长」的启发式顺序搜索。找到第一条解后，只在能改进当前解的椭球区域里撒下一批点（沿用 Informed RRT* 的做法），逐轮细化。它随时能给出当前最好解、越跑越优，并且概率完备、渐近最优；论文实验中，尤其在高维问题上，它比 RRT*、Informed RRT*、FMT* 更快找到更好的解。OMPL 已内置 BIT*，后续还有 ABIT*、AIT*、EIT* 等变体。","example":"给 7 自由度机械臂规划绕过货架隔板的路径时，可在 OMPL 里把规划器从 RRTConnect 换成 BITstar：前者只求尽快找到一条能用的路径，后者在给定时间内持续把路径缩短。","related":["Informed RRT*","RRT*","A* 算法","基于采样的规划","概率完备性","OMPL"]},{"id":"rrt-connect","category":"control","sec":7,"tier":3,"sources":[{"title":"OMPL: ompl::geometric::RRTConnect（Kuffner & LaValle, ICRA 2000, pp. 995–1001）","url":"https://ompl.kavrakilab.org/classompl_1_1geometric_1_1RRTConnect.html"},{"title":"S. M. LaValle, Planning Algorithms, Chapter 5（bidirectional RDT/RRT）","url":"http://lavalle.pl/planning/ch5.pdf"},{"title":"moveit_resources: panda_moveit_config/config/ompl_planning.yaml","url":"https://github.com/moveit/moveit_resources/blob/ros2/panda_moveit_config/config/ompl_planning.yaml"}],"as_of":"","related_ids":["rapidly-exploring-random-tree","rapidly-exploring-random-tree","sampling-based-planning","probabilistic-completeness","open-motion-planning-library","path-smoothing"],"name":"RRT-Connect","alt":"RRT-Connect (Bidirectional RRT)","abbr":"","aliases":["双向RRT","RRTConnect","Bidirectional RRT"],"one_liner":"从起点和终点各长一棵随机树，并贪心地把两棵树接起来的路径规划算法。","explanation":"RRT-Connect 由 Kuffner 和 LaValle 在 ICRA 2000 提出，是快速扩展随机树（RRT）的双向版本。普通 RRT 只从起点长一棵树，偶尔试着连向终点；RRT-Connect 从起点和终点各长一棵树：每轮先让一棵树朝随机采样点扩展一步得到新节点，再让另一棵树朝这个新节点一步接一步地延伸，直到接上或被障碍挡住（CONNECT 启发式），接上就找到了路径，然后两棵树交换角色。这种贪心连接在障碍不太密的空间里通常很快，适合机械臂这类六七个自由度、只需回答一次「从 A 到 B」的单次查询。它是概率完备的，但不追求最短，路径往往曲折，需要后处理平滑。开源规划库 OMPL 把它实现为 RRTConnect，MoveIt 可直接调用。","example":"MoveIt 官方的 Panda 机械臂配置里，OMPL 规划器列表包含 RRTConnectkConfigDefault；选它规划出无碰路径后，一般还要经过路径平滑和时间参数化才下发执行。","related":["快速扩展随机树","RRT*","基于采样的规划","概率完备性","OMPL","路径平滑"]},{"id":"path-smoothing","category":"control","sec":7,"tier":3,"sources":[{"title":"OMPL: ompl::geometric::PathSimplifier Class Reference","url":"https://ompl.kavrakilab.org/classompl_1_1geometric_1_1PathSimplifier.html"},{"title":"Hauser & Ng-Thow-Hing, Fast Smoothing of Manipulator Trajectories using Optimal Bounded-Acceleration Shortcuts (ICRA 2010)","url":"https://motion.cs.illinois.edu/papers/icra10-smoothing.pdf"}],"as_of":"","related_ids":["rapidly-exploring-random-tree","probabilistic-roadmap","collision-checking","time-parameterization","trajectory-optimization","open-motion-planning-library"],"name":"路径平滑","alt":"Path Smoothing (Shortcutting)","abbr":"","aliases":["捷径化","路径捷径","路径简化","Shortcutting","Path Simplification"],"one_liner":"对规划出的曲折路径做后处理，删掉绕路、磨平拐角，让机器人走得更短更顺。","explanation":"路径平滑是运动规划的后处理步骤。RRT、PRM 这类采样式规划器给出的是很多路点连成的折线，常绕远路、来回抖动，照着执行既慢又不自然。最常用的是随机捷径化：反复在路径上随机挑两个点，试着用一段更短的直线（或满足速度、加速度上限的平滑曲线）直接相连，若这段不碰撞，就替换掉两点之间的原路径；重复多次，路径越来越短。其他做法还有删除多余路点、B 样条拟合等，开源规划库 OMPL 的 PathSimplifier 就提供了捷径、删点、B 样条平滑等函数。平滑之后通常还要做时间参数化，给路径分配速度和时间，才成为可执行的轨迹。它和轨迹优化的区别是：只在已有可行解上做局部改进，计算便宜，但不保证最优。","example":"Hauser 与 Ng-Thow-Hing（2010）让机械臂伸到桌下抓杯子，对采样规划器给出的折线路径随机尝试 100 次满足速度、加速度上限的平滑捷径，执行时间从 9.4 秒降到 4.0 秒。","related":["快速扩展随机树","概率路线图","碰撞检查","时间参数化","轨迹优化","OMPL"]},{"id":"kinodynamic-planning","category":"control","sec":7,"tier":3,"sources":[{"title":"Kinodynamic planning - Wikipedia","url":"https://en.wikipedia.org/wiki/Kinodynamic_planning"},{"title":"Rapidly exploring random tree - Wikipedia（引 LaValle & Kuffner 2001, Randomized Kinodynamic Planning, IJRR）","url":"https://en.wikipedia.org/wiki/Rapidly_exploring_random_tree"}],"as_of":"","related_ids":["motion-planning","rapidly-exploring-random-tree","trajectory-optimization","time-optimal-path-parameterization","nonholonomic-constraint","state-space"],"name":"动力学约束规划","alt":"Kinodynamic Planning","abbr":"","aliases":["运动动力学规划","动力学规划","Kinodynamic Motion Planning"],"one_liner":"规划时同时满足避障和速度、加速度、力矩等动力学限制，直接给出可执行轨迹。","explanation":"普通路径规划只管几何：从 A 到 B 找一条不撞障碍的路，走多快另算。动力学约束规划由 Donald、Xavier、Canny、Reif 在 1993 年命名，要求结果同时满足运动学约束（避障、关节限位）和动力学约束（速度、加速度、力或力矩上限）。因此它通常在状态空间里搜索，状态同时包含位置和速度，而且只能沿系统真正做得出的运动去扩展，比如汽车不能横移。代表方法是 LaValle 与 Kuffner 2001 年的随机动力学规划：扩展 RRT 搜索树时不直接连直线，而是施加一个控制输入、按动力学模型积分一小段得到新状态。另一条常见路线是先规划几何路径、再做时间参数化，更简单，但对跑、跳、高速飞行这类强动力学任务可能找不到可行解。轨迹优化和 MPC 也常用来求解这类问题。","example":"让四足机器人跳上台阶，只算出几何上的落脚路线不够：还要保证起跳时关节力矩够用、腾空时质心沿抛物线运动、落地速度不超限，这就要把动力学约束放进规划里一起求解。","related":["运动规划","快速扩展随机树","轨迹优化","时间最优路径参数化","非完整约束","状态空间"]},{"id":"euclidean-signed-distance-field","category":"control","sec":7,"tier":3,"sources":[{"title":"Voxblox: Incremental 3D Euclidean Signed Distance Fields for On-Board MAV Planning (arXiv:1611.03631)","url":"https://arxiv.org/abs/1611.03631"},{"title":"EGO-Planner: An ESDF-free Gradient-based Local Planner for Quadrotors (arXiv:2008.08835)","url":"https://arxiv.org/abs/2008.08835"}],"as_of":"","related_ids":["signed-distance-field-function","truncated-signed-distance-function","nvblox","covariant-hamiltonian-optimization-for-motion-planning","collision-checking","occupancy-grid-map"],"name":"欧氏符号距离场","alt":"Euclidean Signed Distance Field","abbr":"ESDF","aliases":["欧几里得符号距离场","欧式符号距离场","ESDF 地图"],"one_liner":"三维栅格里每一格都存着到最近障碍物的真实距离，外正内负，还能求梯度。","explanation":"欧氏符号距离场是一种三维地图表示：把空间切成体素（小立方格），每个体素存它到最近障碍物表面的欧氏距离，在障碍外为正、在障碍内为负。它和 TSDF（截断符号距离函数）不同：TSDF 只在物体表面附近有值，且距离沿相机视线估算；ESDF 在整张地图上给出真实的最近距离，并且可以求梯度，梯度方向就是「离障碍更远」的方向。这让它很适合基于梯度的轨迹优化，比如 CHOMP 和许多无人机局部规划器：把机器人近似成一串小球，只要各球心处的距离大于球半径就不碰撞，碰撞代价的梯度会直接把轨迹推离障碍。ETH 的 Voxblox（2016）提出从 TSDF 增量构建 ESDF，英伟达 nvblox 把这类建图放到 GPU 上。缺点是维护整张距离场很耗算力，所以 EGO-Planner 等工作干脆不用 ESDF。","example":"Voxblox 的实验：无人机边飞边用机载传感器建 TSDF，再增量转成 ESDF，局部轨迹优化器读取距离和梯度，在机载单个 CPU 核上实时完成建图和重规划。","related":["符号距离场","截断符号距离函数","nvblox","CHOMP","碰撞检查","占据栅格地图"]},{"id":"covariant-hamiltonian-optimization-for-motion-planning","category":"control","sec":7,"tier":3,"sources":[{"title":"Ratliff, Zucker, Bagnell, Srinivasa: CHOMP: Gradient Optimization Techniques for Efficient Motion Planning (ICRA 2009)","url":"https://publications.ri.cmu.edu/storage/publications/pub_files/2009/5/icra09-chomp.pdf"},{"title":"Zucker et al., CHOMP: Covariant Hamiltonian Optimization for Motion Planning (IJRR 2013)","url":"https://publications.ri.cmu.edu/chomp-covariant-hamiltonian-optimization-for-motion-planning/"},{"title":"MoveIt: CHOMP Planner 教程","url":"https://moveit.picknik.ai/main/doc/how_to_guides/chomp_planner/chomp_planner_tutorial.html"}],"as_of":"","related_ids":["trajectory-optimization","stomp","trajopt","signed-distance-field-function","moveit-motion-planning-framework","path-smoothing"],"name":"CHOMP","alt":"Covariant Hamiltonian Optimization for Motion Planning","abbr":"CHOMP","aliases":["协变哈密顿运动规划优化","CHOMP 规划器"],"one_liner":"用梯度下降把初始轨迹推离障碍物、同时保持平滑的轨迹优化规划器。","explanation":"CHOMP 由 CMU 的 Ratliff、Zucker、Bagnell 与 Srinivasa 在 2009 年 ICRA 提出，扩展版 2013 年发表于 IJRR。它把轨迹离散成一串路点，代价分两项：平滑项（用差分算出的速度、加速度的平方和），障碍项（把机器人近似成一串小球，查环境的符号距离场，离障碍越近代价越高）。「协变」指梯度更新前先乘上平滑度量矩阵的逆，让一次修改平滑地分摊到整条轨迹，而不是把单个路点硬拽走；名字里的「哈密顿」指用哈密顿蒙特卡洛加随机扰动以跳出局部最优。它不要求初始轨迹无碰撞，从穿过障碍物的直线出发也能收敛。缺点是会陷入局部最优，偶尔直接穿过薄障碍，因此常用 OMPL 等采样规划器先给一条无碰撞初值。它与 STOMP、TrajOpt 同属基于优化的运动规划。","example":"原论文在 Barrett WAM 机械臂上做操作规划，也用它为 LittleDog 四足机器人生成行走轨迹。MoveIt 集成了 CHOMP，可通过 smoothness_cost_weight 和 obstacle_cost_weight 两个参数调节平滑与避障的权重。","related":["轨迹优化","STOMP","TrajOpt","符号距离场","MoveIt","路径平滑"]},{"id":"stomp","category":"control","sec":7,"tier":3,"sources":[{"title":"MoveIt 2 文档：STOMP Planner","url":"https://moveit.picknik.ai/main/doc/how_to_guides/stomp_planner/stomp_planner.html"},{"title":"MoveIt 1 教程：STOMP Planner（引用 Kalakrishnan et al. ICRA 2011）","url":"https://moveit.github.io/moveit_tutorials/doc/stomp_planner/stomp_planner_tutorial.html"}],"as_of":"","related_ids":["covariant-hamiltonian-optimization-for-motion-planning","trajopt","trajectory-optimization","motion-planning","moveit-motion-planning-framework","model-predictive-path-integral-control"],"name":"STOMP","alt":"Stochastic Trajectory Optimization for Motion Planning","abbr":"STOMP","aliases":["随机轨迹优化运动规划","STOMP 规划器"],"one_liner":"在初始轨迹附近撒一批带噪声的轨迹、按代价加权更新的无梯度轨迹优化器。","explanation":"STOMP 是 Kalakrishnan、Chitta、Theodorou、Pastor、Schaal 在 ICRA 2011 提出的运动规划方法，属于轨迹优化。它从一条初始轨迹（可以直接穿过障碍物）出发，每轮在周围加噪声生成若干条候选轨迹，逐个路点计算碰撞、约束违反、平滑度等代价，再按代价越低权重越大的方式把噪声加权合成更新量，迭代出平滑、无碰撞的轨迹。它源自强化学习里的路径积分方法 PI²，不需要代价函数的梯度，所以能加入力矩、能耗、末端姿态这类难求导的代价。和依赖代价梯度的 CHOMP 相比，STOMP 借助随机性更不易卡在局部最优，调参也更少；和 OMPL 里的采样式规划器相比，它通常更慢，但轨迹更平滑，往往不需要再做平滑后处理。","example":"MoveIt 把 STOMP 做成规划器插件，配置里的 num_rollouts（每轮生成多少条噪声轨迹）、stddev（各关节噪声幅度）以及 CollisionCheck、ObstacleDistanceGradient 等代价函数决定它的行为。","related":["CHOMP","TrajOpt","轨迹优化","运动规划","MoveIt","模型预测路径积分控制"]},{"id":"trajopt","category":"control","sec":7,"tier":3,"sources":[{"title":"Schulman et al.: Finding Locally Optimal, Collision-Free Trajectories with Sequential Convex Optimization (RSS 2013)","url":"https://www.roboticsproceedings.org/rss09/p31.html"},{"title":"TrajOpt documentation (UC Berkeley RLL)","url":"https://rll.berkeley.edu/trajopt/doc/sphinx_build/html/"},{"title":"tesseract-robotics/trajopt (GitHub)","url":"https://github.com/tesseract-robotics/trajopt"}],"as_of":"","related_ids":["trajectory-optimization","sequential-quadratic-programming","covariant-hamiltonian-optimization-for-motion-planning","stomp","collision-checking","open-motion-planning-library"],"name":"TrajOpt","alt":"TrajOpt (Sequential Convex Trajectory Optimization)","abbr":"","aliases":["序列凸优化轨迹规划","trajopt_ros","Tesseract TrajOpt"],"one_liner":"用序列凸优化求局部最优、无碰撞机器人轨迹的运动规划方法和开源库。","explanation":"TrajOpt 由 UC Berkeley 的 John Schulman、Pieter Abbeel 等在 RSS 2013 提出，2014 年扩展版发表于 IJRR。它把运动规划写成轨迹优化：决策变量是一串关节路点，目标是路径短而平滑，约束是关节限位和不碰撞。碰撞约束是非凸的，TrajOpt 用序列凸优化处理：每轮在当前轨迹附近把代价和约束线性化成凸的二次规划，在信赖域里求解，反复迭代。碰撞用有符号距离（穿透时为负）加铰链惩罚表示，惩罚不够就在外层循环加大系数；它还把相邻两个时刻机器人形状的凸包拿来检查，保证连续时间内也不会「穿过」薄障碍。论文中它比 OMPL 的采样式规划器和 CHOMP 更快、解出的问题更多。缺点是只保证局部最优，初始轨迹太差时可能失败。现在 ROS-Industrial 旗下的 Tesseract 项目维护着它的 C++ 版本。","example":"让 7 轴机械臂把手伸进书架隔层取物：先给一条关节空间直线插值的初始轨迹（会穿过隔板），TrajOpt 迭代把碰撞的路点推离隔板，同时保持轨迹平滑。","related":["轨迹优化","序列二次规划","CHOMP","STOMP","碰撞检查","OMPL"]},{"id":"graphs-of-convex-sets","category":"control","sec":7,"tier":3,"sources":[{"title":"Marcucci et al., Motion Planning around Obstacles with Convex Optimization (arXiv 2205.04422)","url":"https://arxiv.org/abs/2205.04422"},{"title":"Marcucci et al., Shortest Paths in Graphs of Convex Sets (arXiv 2101.11565, SIAM J. Optim. 2024)","url":"https://arxiv.org/abs/2101.11565"},{"title":"Drake: GcsTrajectoryOptimization","url":"https://drake.mit.edu/doxygen_cxx/classdrake_1_1planning_1_1trajectory__optimization_1_1_gcs_trajectory_optimization.html"}],"as_of":"","related_ids":["motion-planning","rapidly-exploring-random-tree","probabilistic-roadmap","convex-optimization","trajectory-optimization","drake"],"name":"凸集图规划","alt":"Graphs of Convex Sets (GCS)","abbr":"GCS","aliases":["凸集图","Graph of Convex Sets","GCS 运动规划"],"one_liner":"把无碰撞空间拆成凸块连成图，用凸优化求出全局较优的平滑轨迹。","explanation":"由 MIT Russ Tedrake 组的 Tobia Marcucci 等人提出：「凸集图上的最短路」理论发表于 SIAM Journal on Optimization（2024），运动规划应用发表于 Science Robotics（2023）。先把构型空间里的无碰撞区域分解成若干凸区域，每块是图的一个节点，相互重叠的块之间连边；再在每块内用贝塞尔曲线表示一段轨迹，同时决定走哪些块和曲线的形状。这本是混合整数优化，但它的凸松弛很紧，解一次凸优化再做简单取整，通常就能得到全局最优或接近最优的轨迹，并附带最优性界。相比 RRT、PRM 等采样式规划，轨迹更平滑、质量更高；代价是要预先做凸分解。Drake 中已有实现。","example":"用 Drake 的 GcsTrajectoryOptimization：给出机械臂在货架间的若干无碰撞凸区域，求解器输出一条穿过这些区域、满足速度限制、用时尽量短的平滑轨迹。","related":["运动规划","快速扩展随机树","概率路线图","凸优化","轨迹优化","Drake"]},{"id":"riemannian-motion-policies","category":"control","sec":7,"tier":3,"sources":[{"title":"Ratliff et al., Riemannian Motion Policies (arXiv:1801.02854)","url":"https://arxiv.org/abs/1801.02854"},{"title":"Cheng et al., RMPflow: A Computational Graph for Automatic Motion Policy Generation (arXiv:1811.07049, WAFR 2018)","url":"https://arxiv.org/abs/1811.07049"},{"title":"Isaac Sim Documentation: RMPflow","url":"https://docs.isaacsim.omniverse.nvidia.com/latest/manipulators/concepts/rmpflow.html"}],"as_of":"2026-09","related_ids":["geometric-fabrics","operational-space-control","obstacle-avoidance","artificial-potential-field","nvidia-isaac-sim","curobo"],"name":"黎曼运动策略","alt":"Riemannian Motion Policies","abbr":"RMP","aliases":["RMPflow","Riemannian Motion Policy","黎曼运动策略流"],"one_liner":"每个子目标给出期望加速度和重要性矩阵，按矩阵加权合成整机动作的反应式框架。","explanation":"RMP 由 NVIDIA 的 Ratliff、Fox 等人 2018 年提出。一个 RMP 是一对 (a, M)：a 是某个任务空间里的期望加速度，比如末端奔向目标、某个连杆远离障碍、关节远离限位；M 是黎曼度量，可理解为「这个子目标在各个方向上有多重要」。各子策略在自己的空间里定义，经雅可比矩阵「拉回」到关节空间，再按 M 加权合成一个关节加速度。这样互相冲突的要求能统一处理，权重还随状态变化，离障碍越近避障越占上风。同年的 RMPflow 把组合过程组织成计算图自动完成，并给出稳定性条件。它每个控制周期即时计算，能应对移动的目标和障碍，但只是局部方法，复杂场景要配合全局规划器。NVIDIA 后续的 Geometric Fabrics 是它的延续。","example":"Isaac Sim 的 Lula 运动生成工具以 RMPflow 为核心，组合目标、避碰、关节限位、阻尼等多个 RMP，让机械臂末端实时追随移动目标并绕开障碍。截至 2026 年 9 月，官方文档建议新开发改用实验性的 Robot Motion API。","related":["Geometric Fabrics","操作空间控制","避障","人工势场法","Isaac Sim","cuRobo"]},{"id":"geometric-fabrics","category":"control","sec":7,"tier":3,"sources":[{"title":"Van Wyk et al., Geometric Fabrics: Generalizing Classical Mechanics to Capture the Physics of Behavior (arXiv 2109.10443)","url":"https://arxiv.org/abs/2109.10443"},{"title":"NVlabs/FABRICS (GitHub)","url":"https://github.com/NVlabs/FABRICS"},{"title":"DextrAH-G: Pixels-to-Action Dexterous Arm-Hand Grasping with Geometric Fabrics","url":"https://arxiv.org/html/2407.02274v2"}],"as_of":"2026-09","related_ids":["riemannian-motion-policies","dextrah-g","obstacle-avoidance","joint-limits","motion-planning","operational-space-control"],"name":"Geometric Fabrics","alt":"Geometric Fabrics (NVIDIA reactive motion generation)","abbr":"","aliases":["几何织物","fabrics"],"one_liner":"NVIDIA 提出的反应式运动生成框架，实时合成避障、限位等行为且可证稳定。","explanation":"由 NVIDIA 研究院的 Karl Van Wyk、Nathan Ratliff 等人提出（IEEE RA-L 2022），是黎曼运动策略（RMP）的后继。它不预先规划整条轨迹，而是每个控制周期直接算出关节加速度：把趋近目标、避障、远离关节限位、保持姿态等行为各写成所在空间的二阶微分方程，再经雅可比映射合成到关节空间。相比 RMP，它用更一般的 Finsler 几何，在保证稳定的前提下允许更灵活地塑造行为。它常被当作强化学习的安全动作空间：DextrAH-G 让策略只输出手掌目标等低维指令，避碰和关节约束交给 fabric；NVIDIA 已在 GitHub 开源基于 Warp、可 GPU 并行的 FABRICS 库。","example":"DextrAH-G 中，Kuka 臂加 Allegro 手共 23 个电机，RL 策略输出手掌目标和手指低维指令，fabric 以 60 Hz 把它们转成关节指令，并自动避开桌面和自碰撞。","related":["黎曼运动策略","DextrAH-G","避障","关节限位","运动规划","操作空间控制"]},{"id":"neural-motion-planning","category":"control","sec":7,"tier":3,"sources":[{"title":"Neural MP: A Generalist Neural Motion Planner (arXiv 2409.05864)","url":"https://arxiv.org/abs/2409.05864"},{"title":"Motion Policy Networks (arXiv 2210.12209)","url":"https://arxiv.org/abs/2210.12209"},{"title":"Motion Planning Networks (arXiv 1806.05767)","url":"https://arxiv.org/abs/1806.05767"}],"as_of":"2024-09","related_ids":["motion-planning","motion-policy-networks","rapidly-exploring-random-tree","imitation-learning","collision-checking","curobo"],"name":"神经运动规划","alt":"Neural Motion Planning","abbr":"","aliases":["学习型运动规划","神经运动规划器","Learning-based Motion Planning"],"one_liner":"用神经网络从海量规划样例中学会直接生成无碰撞运动的方法。","explanation":"神经运动规划指用神经网络完成或辅助运动规划：输入场景观测（常为点云）、当前和目标构型，输出无碰撞的路径或下一步动作。传统采样式规划器（如 RRT）和轨迹优化每遇到新问题都从零计算，杂乱场景有时要算几分钟，还依赖精确的场景几何模型。神经方法先用传统规划器在仿真里大量生成专家解，再用模仿学习蒸馏进网络，推理时前向计算即可出动作。代表工作有 2018 年的 MPNet（编码障碍物点云、逐步预测下一构型，可与 RRT* 结合保证成功）、2022 年英伟达与华盛顿大学的 MπNets（在 50 万个以上环境、300 万个以上规划问题上训练，直接从深度相机点云出动作），以及 2024 年 CMU 的 Neural MP（程序化生成大量场景训练通用策略，部署时再加轻量优化保证安全）。难点是网络输出本身没有无碰撞保证，通常要配碰撞检查或回退机制。","example":"Neural MP 在真实世界 4 类环境、64 个任务上测试，从场景点云直接生成机械臂运动，成功率比采样式、优化式、学习式基线分别提升 23%、17%、79%。","related":["运动规划","运动策略网络","快速扩展随机树","模仿学习","碰撞检查","cuRobo"]},{"id":"grasp-planning","category":"control","sec":7,"tier":2,"sources":[{"title":"Data-Driven Grasp Synthesis - A Survey (Bohg et al., IEEE T-RO 2014, arXiv 1309.2660)","url":"https://arxiv.org/abs/1309.2660"},{"title":"Dex-Net 2.0: Deep Learning to Plan Robust Grasps with Synthetic Point Clouds and Analytic Grasp Metrics (arXiv 1703.09312)","url":"https://arxiv.org/abs/1703.09312"}],"as_of":"","related_ids":["grasping","grasp-pose-detection","pre-grasp-pose","force-closure","grasp-quality-metric","motion-planning"],"name":"抓取规划","alt":"Grasp Planning","abbr":"","aliases":["抓取合成","Grasp Synthesis","抓取位姿规划"],"one_liner":"算出夹爪或灵巧手该从物体哪里、以什么姿态和手指构型去抓。","explanation":"抓取规划（也叫抓取合成）回答「抓哪里、怎么抓」：输出夹爪的 6D 抓取位姿（位置加朝向）和开口宽度，灵巧手还要给出各手指关节角；之后再由运动规划生成一条不碰撞的路径，先到预抓取位姿再合拢。早期用解析方法：已知物体模型和摩擦系数，按力封闭（接触力能抵抗任意方向外力）等抓取质量指标搜索。Bohg 等人 2014 年的综述把数据驱动方法按物体是否见过分成已知、相似、未知三类。后来深度学习直接从深度图或点云预测抓取，如 Dex-Net、Contact-GraspNet、AnyGrasp。端到端 VLA 通常不单列这一步，工业分拣和模块化系统里仍很常用。","example":"UC 伯克利的 Dex-Net 2.0 用 670 万个合成点云及解析抓取指标训练抓取质量网络 GQ-CNN，在 ABB YuMi 上约 0.8 秒规划一次抓取，对 8 个已知物体成功率 93%。","related":["抓取","抓取位姿检测","预抓取位姿","力封闭","抓取质量指标","运动规划"]},{"id":"pre-grasp-pose","category":"control","sec":7,"tier":2,"sources":[{"title":"MoveIt Tutorials: Pick and Place","url":"https://moveit.github.io/moveit_tutorials/doc/pick_place/pick_place_tutorial.html"},{"title":"moveit_msgs/Grasp.msg","url":"https://raw.githubusercontent.com/moveit/moveit_msgs/master/msg/Grasp.msg"}],"as_of":"","related_ids":["grasp-planning","grasp-pose-detection","movej-movel","moveit-motion-planning-framework","end-effector-pose","grasping"],"name":"预抓取位姿","alt":"Pre-grasp Pose","abbr":"","aliases":["预抓取点","接近位姿","Approach Pose","Pregrasp Pose"],"one_liner":"真正抓取前，夹爪先停在物体附近、对准抓取方向的那个中间位姿。","explanation":"机械臂抓取通常分几步：先移动到预抓取位姿，再沿接近方向直线靠近到抓取位姿，合上夹爪，最后抬起撤离。预抓取位姿一般由抓取位姿沿接近方向（多为夹爪朝向）往后退一小段得到，同时把夹爪提前张开到合适开度。这样做是把「大范围移动」和「贴近物体的精细动作」分开：前一段交给运动规划快速走，后一段短而直，不容易蹭倒物体或撞到周围。ROS 的 MoveIt 在 Grasp 消息里用 pre_grasp_approach（接近方向和距离）和 pre_grasp_posture（抓取前的手型）描述这一过程。灵巧手研究里，「预抓取」也常指合手前手指摆出的形态。","example":"MoveIt 抓取教程中，Panda 先停在距抓取位姿约 11.5 厘米处（desired_distance 0.115 米）并张开夹爪，再沿 x 方向直线接近、抓取，之后沿 z 方向向上撤离约 25 厘米。","related":["抓取规划","抓取位姿检测","关节运动与直线运动（MoveJ / MoveL）","MoveIt","末端位姿","抓取"]},{"id":"finite-state-machine","category":"control","sec":8,"tier":2,"sources":[{"title":"Wikipedia: Finite-state machine","url":"https://en.wikipedia.org/wiki/Finite-state_machine"},{"title":"unitree_sdk2 g1_loco_client.hpp（SetFsmId / Damp / ZeroTorque）","url":"https://github.com/unitreerobotics/unitree_sdk2/blob/main/include/unitree/robot/g1/loco/g1_loco_client.hpp"},{"title":"Behavior Trees in Robotics and AI: An Introduction (arXiv 1709.00084)","url":"https://arxiv.org/abs/1709.00084"}],"as_of":"","related_ids":["behavior-tree","damping-mode","task-planning","hierarchical-control","behaviortree-cpp","unitree-sdk2"],"name":"有限状态机","alt":"Finite State Machine","abbr":"FSM","aliases":["状态机","有限自动机","State Machine"],"one_liner":"系统任一时刻处于有限个状态之一，收到事件就按规则切换状态的模型。","explanation":"有限状态机是一种计算模型：系统在任意时刻只处于有限个状态中的一个，收到某个输入或事件后按事先定好的规则跳到另一个状态，每个状态对应一套固定行为。经典例子是地铁闸机：「锁定」时投币变「解锁」，人推过去后又变回「锁定」。机器人里它常用来管运行模式和任务流程，比如上电后零力矩→站立→行走→阻尼的切换，或抓取流程里「接近→抓取→抬起→放置」的顺序，好处是逻辑清楚、容易检查。缺点是状态和跳转一多就难维护，所以复杂任务越来越多改用行为树，后者更模块化，也更容易随时响应新情况。","example":"宇树 G1 的高层运动接口直接用状态机编号管理模式：0 是零力矩，1 是阻尼，2 是蹲下，3 是坐下，4 是起立，500 是开始运动；SDK 里调用 Damp() 实际就是把状态机切到 1 号状态。","related":["行为树","阻尼模式","任务规划","分层控制","BehaviorTree.CPP","宇树 SDK"]},{"id":"behavior-tree","category":"control","sec":8,"tier":2,"sources":[{"title":"Wikipedia: Behavior tree (artificial intelligence, robotics and control)","url":"https://en.wikipedia.org/wiki/Behavior_tree_(artificial_intelligence,_robotics_and_control)"},{"title":"Colledanchise & Ögren, Behavior Trees in Robotics and AI: An Introduction (arXiv 1709.00084)","url":"https://arxiv.org/abs/1709.00084"},{"title":"ros-navigation/navigation2 README","url":"https://github.com/ros-navigation/navigation2"}],"as_of":"","related_ids":["finite-state-machine","behaviortree-cpp","ros-2-navigation-stack","task-planning","skill-primitive","failure-recovery"],"name":"行为树","alt":"Behavior Tree","abbr":"BT","aliases":["Behaviour Tree","行为树框架"],"one_liner":"用树形结构组织动作和条件、决定机器人下一步做什么的任务编排方式。","explanation":"行为树是组织机器人或游戏角色在多个任务之间切换的一种结构。它先在游戏业流行（2005 年 Damian Isla 在 GDC 讲《光环 2》的 AI 后被广泛采用），后来进入机器人领域。根节点周期性向下发 tick 信号，每个节点返回成功、失败或运行中。叶子是动作节点（如「抓杯子」）和条件节点（如「杯子在视野里吗」）；顺序节点从左到右执行子节点，有一个失败就返回失败；回退（选择）节点从左到右尝试，有一个成功就返回成功，适合写「先试 A，不行再做补救 B」。与有限状态机相比，它不必为每对状态写跳转，增删子树更方便。ROS 2 导航框架 Nav2 就用行为树编排导航与恢复动作，常用 C++ 库是 BehaviorTree.CPP。","example":"送水机器人的根节点是顺序节点：「导航到桌边」→「检测杯子」→ 回退节点（先「抓杯子」，失败则「调整位置后重抓」）→「递给用户」；某一步返回运行中，下一次 tick 就继续执行这一步。","related":["有限状态机","BehaviorTree.CPP","Nav2","任务规划","原子技能","失败恢复"]},{"id":"task-planning","category":"control","sec":8,"tier":2,"sources":[{"title":"Wikipedia: Automated planning and scheduling","url":"https://en.wikipedia.org/wiki/Automated_planning_and_scheduling"},{"title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances (SayCan)","url":"https://arxiv.org/abs/2204.01691"}],"as_of":"","related_ids":["task-and-motion-planning","planning-domain-definition-language","hierarchical-task-network","symbolic-planning","llm-based-task-planning","saycan"],"name":"任务规划","alt":"Task Planning","abbr":"","aliases":["自动规划","AI 规划","高层规划"],"one_liner":"给定当前状态和目标，找出一串能达成目标的高层动作步骤。","explanation":"任务规划是人工智能中自动规划在机器人上的应用：已知初始状态、目标和一组可用动作（每个动作有前提条件和执行效果），求出一串动作，执行完后目标成立。经典做法用 STRIPS 或 PDDL（规划领域定义语言）描述问题，交给通用规划器搜索；分层任务网络（HTN）则把大任务逐层拆成子任务。它只决定做什么、按什么顺序，不管手臂具体怎么动，后者交给运动规划，两者合起来就是任务与运动规划。近年常用大语言模型做任务规划，例如 SayCan 让语言模型提出候选技能，再用各技能的价值函数判断在当前场景下能否做成，把语言知识落到真实机器人上。","example":"指令「把桌上的可乐放进冰箱」：任务规划给出走到桌边 → 抓起可乐 → 走到冰箱 → 打开冰箱门 → 放入可乐 → 关门，每一步再交给导航、抓取等底层技能执行。","related":["任务与运动规划","规划领域定义语言","分层任务网络","符号规划","大模型任务规划","SayCan"]},{"id":"symbolic-planning","category":"control","sec":8,"tier":3,"sources":[{"title":"Stanford Research Institute Problem Solver (STRIPS) - Wikipedia","url":"https://en.wikipedia.org/wiki/Stanford_Research_Institute_Problem_Solver"},{"title":"Automated planning and scheduling - Wikipedia（经典规划的假设与求解方法）","url":"https://en.wikipedia.org/wiki/Automated_planning_and_scheduling"},{"title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency (arXiv 2304.11477)","url":"https://arxiv.org/abs/2304.11477"}],"as_of":"","related_ids":["planning-domain-definition-language","task-planning","task-and-motion-planning","hierarchical-task-network","llm-based-task-planning","pddlstream"],"name":"符号规划","alt":"Symbolic Planning","abbr":"","aliases":["经典规划","STRIPS","Classical planning","自动规划"],"one_liner":"用逻辑符号描述状态和动作的前提与效果，搜索出达成目标的动作序列。","explanation":"符号规划把世界抽象成一组逻辑命题，如 (on cup table)、(handempty)，把每个动作写成「前提条件 + 效果（新增、删除哪些事实）」，再从初始状态搜索一串动作，使目标命题全部成立。源头是 SRI 的 Fikes 与 Nilsson 1971 年为 Shakey 机器人开发的 STRIPS，今天通用的描述语言 PDDL 建立在它之上，求解常用带启发式的状态空间搜索。经典规划假设初始状态已知、动作结果确定，所以结果可验证、可解释；但感知到的物体如何变成符号、符号动作如何落到连续运动上，要靠任务与运动规划另行处理。大模型时代出现了让 LLM 把自然语言译成 PDDL、再交给经典规划器求解的做法，如 LLM+P（2023）。","example":"PDDL 里的「拿起」动作可写成：参数 ?o（物体）、?l（位置）；前提 (at robot ?l)、(on ?o ?l)、(handempty)；效果新增 (holding ?o)，删除 (on ?o ?l) 和 (handempty)。规划器据此自动排出「走到桌边→拿起杯子→走到水槽→放下」这样的顺序。","related":["规划领域定义语言","任务规划","任务与运动规划","分层任务网络","大模型任务规划","PDDLStream"]},{"id":"planning-domain-definition-language","category":"control","sec":8,"tier":3,"sources":[{"title":"Wikipedia: Planning Domain Definition Language","url":"https://en.wikipedia.org/wiki/Planning_Domain_Definition_Language"},{"title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency (arXiv 2304.11477)","url":"https://arxiv.org/abs/2304.11477"},{"title":"PDDLStream: Integrating Symbolic Planners and Blackbox Samplers (arXiv 1802.08705)","url":"https://arxiv.org/abs/1802.08705"}],"as_of":"","related_ids":["task-planning","symbolic-planning","task-and-motion-planning","pddlstream","llm-based-task-planning","hierarchical-task-network"],"name":"规划领域定义语言","alt":"Planning Domain Definition Language","abbr":"PDDL","aliases":[],"one_liner":"用统一格式写下动作的前提、效果和任务目标，交给通用规划器求解的语言。","explanation":"PDDL 是经典 AI 规划的标准描述语言，1998 年由 Drew McDermott 等人为国际规划竞赛（IPC）制定，借鉴了 STRIPS 和 ADL 等早期规划形式。它把规划问题拆成两部分：领域文件定义谓词（描述世界状态的真假命题，如「积木 A 在 B 上」）和动作（每个动作的前提条件与执行后的效果）；问题文件给出具体物体、初始状态和目标。写好后交给通用规划器自动搜索出动作序列。后续版本加入了数值与持续时间动作（PDDL2.1）、连续过程与事件（PDDL+）、偏好与轨迹约束（PDDL3.0）等。机器人里它常作任务规划层的符号接口：任务与运动规划框架 PDDLStream 把抓取位姿、放置位置等连续参数的采样器接进 PDDL；LLM+P 让大语言模型把自然语言指令翻成 PDDL，再用经典规划器求出正确计划，弥补大模型直接做长程规划容易出错的问题。","example":"「把桌上的杯子放进柜子」可写成 PDDL：动作 pick(?obj) 的前提是「手空」且「物体可达」，效果是「手里拿着物体」；再定义 open(?door)、place(?obj ?loc)，给出初始状态和目标「杯子在柜子里」，规划器就输出「开柜门 → 抓杯子 → 放进柜子」。","related":["任务规划","符号规划","任务与运动规划","PDDLStream","大模型任务规划","分层任务网络"]},{"id":"hierarchical-task-network","category":"control","sec":8,"tier":3,"sources":[{"title":"Erol, Hendler, Nau: HTN Planning: Complexity and Expressivity (AAAI 1994)","url":"https://www.cs.umd.edu/~nau/papers/erol1994htn.pdf"},{"title":"Nau et al.: SHOP2: An HTN Planning System (JAIR 2003)","url":"https://www.jair.org/index.php/jair/article/view/10362"},{"title":"Höller et al.: HDDL: An Extension to PDDL for Expressing Hierarchical Planning Problems (AAAI 2020)","url":"https://ojs.aaai.org/index.php/AAAI/article/view/6542"}],"as_of":"","related_ids":["task-planning","planning-domain-definition-language","symbolic-planning","llm-based-task-planning","behavior-tree","long-horizon-task"],"name":"分层任务网络","alt":"Hierarchical Task Network","abbr":"HTN","aliases":["HTN 规划","层次任务网络","HTN Planning"],"one_liner":"按人写好的「拆解方法」把大任务一层层拆成可直接执行的动作序列的规划方法。","explanation":"分层任务网络是经典 AI 规划的一种形式，思想源自 1970 年代的 NOAH 等规划器，1994 年 Erol、Hendler、Nau 给出形式化定义。任务分两类：原子任务可直接执行，复合任务需继续拆。领域专家为每个复合任务写好「方法」，规定在什么条件下拆成哪些子任务、按什么顺序；规划器从顶层任务反复拆解，直到只剩原子动作序列。与 PDDL 只给目标、让规划器自己搜索动作组合相比，HTN 借助人写的知识，搜得更快、结果更可控，代价是方法要人工编写。代表系统有 SHOP2。机器人里常用于长程任务的上层拆解，也常与大模型任务规划、行为树配合。","example":"「收拾餐桌」拆成「收餐具」和「擦桌子」；「收餐具」的方法再拆成「移动到桌边→识别碗→抓起碗→放进水槽」，桌上还有餐具就重复，最底层每一步都对应机器人已有的技能。","related":["任务规划","规划领域定义语言","符号规划","大模型任务规划","行为树","长程任务"]},{"id":"monte-carlo-tree-search","category":"control","sec":8,"tier":3,"sources":[{"title":"Wikipedia: Monte Carlo tree search","url":"https://en.wikipedia.org/wiki/Monte_Carlo_tree_search"},{"title":"Simultaneous Contact Sequence and Patch Planning for Dynamic Locomotion (arXiv 2508.12928)","url":"https://arxiv.org/abs/2508.12928"}],"as_of":"","related_ids":["task-planning","exploration-vs-exploitation","partially-observable-markov-decision-process","muzero","multi-contact-planning","value-function"],"name":"蒙特卡洛树搜索","alt":"Monte Carlo Tree Search","abbr":"MCTS","aliases":["蒙特卡罗树搜索"],"one_liner":"靠大量随机模拟估计每个选择的好坏、边搜边长出搜索树的决策算法。","explanation":"蒙特卡洛树搜索用来在「一步步做选择」的问题里找好决策。2006 年 Rémi Coulom 起了这个名字，同年 Kocsis 和 Szepesvári 提出了最常用的 UCT 版本。每轮迭代四步：选择（从根节点往下挑当前最值得试的分支）、扩展（加一个新节点）、模拟（从新节点随机或按策略推演到结束，得到一个结果）、回传（把结果沿路径更新到各节点的统计）。选择时常用 UCB 公式 w/n + c·√(ln N / n)：w/n 是该分支的平均得分，n 是它被试过的次数，N 是父节点的访问次数，c 调节偏向探索新分支还是利用已知好分支。它不需要人工写局面评估函数，搜到一半也能给出当前最好的答案。2016 年击败李世石的 AlphaGo 把它和神经网络结合；机器人里用于任务规划、部分可观测下的决策和接触序列规划。","example":"足式机器人跨越踏脚石：Dhédin 等人 2025 年的工作用 MCTS 在离散层面搜索「哪条腿、按什么顺序、踩哪块落脚区」，每个候选序列交给全身轨迹优化检验能否做到，再用结果更新搜索树。","related":["任务规划","探索与利用","部分可观测马尔可夫决策过程","MuZero","多接触规划","价值函数"]},{"id":"task-and-motion-planning","category":"control","sec":8,"tier":2,"sources":[{"title":"Integrated Task and Motion Planning (Garrett et al., Annual Review of Control, Robotics, and Autonomous Systems 2021)","url":"https://arxiv.org/abs/2010.01083"},{"title":"PDDLStream: Integrating Symbolic Planners and Blackbox Samplers via Optimistic Adaptive Planning","url":"https://arxiv.org/abs/1802.08705"}],"as_of":"","related_ids":["task-planning","motion-planning","planning-domain-definition-language","pddlstream","long-horizon-task","llm-based-task-planning"],"name":"任务与运动规划","alt":"Task and Motion Planning","abbr":"TAMP","aliases":["集成任务与运动规划","任务-运动联合规划"],"one_liner":"把先做哪些动作和每个动作具体怎么动放在一起联合求解的规划方法。","explanation":"任务与运动规划（TAMP）同时决定两类问题：离散的任务层（先动哪个物体、放到哪、按什么顺序）和连续的运动层（抓取位姿、放置位置、无碰撞的手臂轨迹）。Garrett、Kaelbling、Lozano-Pérez 等人 2021 年发表的综述指出，它横跨离散任务规划、离散-连续数学规划和连续运动规划，单靠其中任何一个领域都解决不好。原因是两层相互依赖：符号上可行的计划可能因为够不着或被挡住而执行不了，只做运动规划又处理不了长序列决策。代表工具 PDDLStream 在 PDDL 上扩展出「流」，把逆运动学、抓取采样、碰撞检查等过程当作黑箱采样器调用。","example":"让机器人把绿色方块放进柜子，但柜门口挡着一个红色方块：纯任务规划不知道红块碍事，纯运动规划找不到可行路径；TAMP 会得出先把红块挪开的计划，并同时算出挪到哪里、怎么抓、手臂怎么走。","related":["任务规划","运动规划","规划领域定义语言","PDDLStream","长程任务","大模型任务规划"]},{"id":"llm-based-task-planning","category":"control","sec":8,"tier":2,"sources":[{"title":"SayCan 项目主页 (Do As I Can, Not As I Say)","url":"https://say-can.github.io/"},{"title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances (arXiv 2204.01691)","url":"https://arxiv.org/abs/2204.01691"},{"title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency (arXiv 2304.11477)","url":"https://arxiv.org/abs/2304.11477"}],"as_of":"2025-09","related_ids":["task-planning","saycan","code-as-policies","planning-domain-definition-language","gemini-robotics-er","dual-system-architecture"],"name":"大模型任务规划","alt":"LLM-based Task Planning","abbr":"","aliases":["LLM 规划","VLM 规划","大模型规划"],"one_liner":"让大语言模型或视觉语言模型把一句高层指令拆成机器人能执行的子任务序列。","explanation":"任务规划决定先做什么、后做什么。传统方法要人工写 PDDL（规划领域定义语言）这类形式化描述，换个场景就得重写。2022 年起，研究者让大语言模型直接读指令生成步骤：谷歌的 SayCan 让 LLM 给候选技能打分，再乘上技能价值函数估计的「当前能否做成」来选下一步；代码即策略让模型写调用感知和控制接口的程序；Inner Monologue 把执行反馈写回提示，实现闭环重规划。LLM 容易给出看似合理却执行不了的步骤，LLM+P 因此只让模型把自然语言翻成 PDDL，再交给经典规划器求解。现在多用 VLM 看图规划，如 Gemini Robotics-ER，把子任务交给 VLA 执行。","example":"对「我把可乐洒了，能拿个东西来清理吗」，SayCan 在移动机械臂上依次选出「找到海绵」「拿起海绵」「拿给你」「完成」；项目页报告 101 条指令的规划成功率 84%、执行成功率 74%。","related":["任务规划","SayCan","代码即策略","规划领域定义语言","Gemini Robotics-ER","快慢双系统"]},{"id":"shared-autonomy","category":"control","sec":8,"tier":3,"sources":[{"title":"Shared Autonomy via Hindsight Optimization (Javdani, Srinivasa, Bagnell, arXiv 1503.07619)","url":"https://arxiv.org/abs/1503.07619"},{"title":"Shared Autonomy via Deep Reinforcement Learning (Reddy, Dragan, Levine, RSS 2018, arXiv 1802.01744)","url":"https://arxiv.org/abs/1802.01744"}],"as_of":"","related_ids":["teleoperation","human-in-the-loop","human-robot-collaboration","human-robot-interaction","intent-understanding","partially-observable-markov-decision-process"],"name":"共享自主","alt":"Shared Autonomy","abbr":"","aliases":["共享控制","Shared control"],"one_liner":"人和机器人同时出力：机器人推断人的意图，把人的指令和自主动作融合后执行。","explanation":"共享自主介于纯遥操作和全自主之间：人通过摇杆、脑机接口等给出粗略、带噪声的指令，机器人一边执行一边推断人想达成的目标，再把人的输入和自己的自主动作融合，常见做法是按意图置信度加权混合（称为仲裁或策略混合）。它最早用于助残机械臂、智能轮椅和遥操作，目的是减轻操作负担又不剥夺人的控制权。CMU 的 Javdani 等人 2015 年把它建模成目标未知的部分可观测马尔可夫决策过程（POMDP），用逆最优控制从人的历史输入推断目标分布；用户完成更快、输入更少，但也有人反映失去了控制感。Reddy、Dragan、Levine 2018 年用深度强化学习做到不必预先知道目标集合。它与遥操作、人在回路纠偏关系密切。","example":"Reddy 等人的实验中，人玩登月舱着陆游戏（Lunar Lander），辅助智能体先剔除 Q 值低于阈值的动作，再从剩下的动作里挑最接近人输入的那个执行，在不知道目标着陆点的情况下帮人更稳地着陆。","related":["遥操作","人在回路","人机协作","人机交互","意图理解（隐式指令）","部分可观测马尔可夫决策过程"]},{"id":"emergency-stop","category":"control","sec":9,"tier":1,"sources":[{"title":"Wikipedia (de): Not-Halt（停止类别 0/1/2、ISO 13850、急停按钮形态）","url":"https://de.wikipedia.org/wiki/Not-Halt"},{"title":"Wikipedia: Kill switch（emergency stop, ISO 13850）","url":"https://en.wikipedia.org/wiki/Kill_switch"}],"as_of":"","related_ids":["protective-stop","functional-safety","safe-torque-off","damping-mode","watchdog","collision-detection"],"name":"急停","alt":"Emergency Stop","abbr":"E-stop","aliases":["紧急停止","急停按钮","停止类别 0/1/2","Stop Category 0/1/2","E-Stop button"],"one_liner":"危险时一个动作就让机器停下的安全功能，典型形态是黄底红色蘑菇头按钮。","explanation":"急停是机器必备的安全功能，国际标准 ISO 13850 要求在场任何人不用多想、一个动作就能让机器停下。典型急停按钮是黄底红色蘑菇头，按下后机械锁住，必须人为复位才能解除，而且复位本身不能让机器自行重启。IEC 60204-1 把停机分三类：0 类立即切断驱动电源；1 类先受控停稳，再断电；2 类受控停下但保持供电。急停只能用 0 类或 1 类。选哪一类要看直接断电会不会更危险：腿足和人形机器人一断电就会当场瘫倒，所以调试时常配安全吊架，急停之外再设阻尼模式等软停止。急停是最后一道防线，不能替代碰撞检测、限速等其他安全措施。","example":"协作机械臂的示教器上通常自带急停按钮；做 VLA 真机实验时，操作员手边一般再放一个独立急停，策略一出现异常动作就立刻拍下。","related":["保护性停止","功能安全","安全扭矩关断","阻尼模式","看门狗","碰撞检测（本体安全）"]},{"id":"protective-stop","category":"control","sec":9,"tier":3,"sources":[{"title":"Universal Robots: Safety FAQ（stop categories, protective stop, monitored standstill）","url":"https://www.universal-robots.com/articles/ur/safety/safety-faq/"},{"title":"OSHA Technical Manual, Section IV Chapter 4: Industrial Robot Systems and Industrial Robot System Safety","url":"https://www.osha.gov/otm/section-4-safety-hazards/chapter-4"}],"as_of":"2026-05","related_ids":["emergency-stop","functional-safety","collision-detection","collision-reaction","power-and-force-limiting","speed-and-separation-monitoring"],"name":"保护性停止","alt":"Protective Stop","abbr":"","aliases":["保护停止","安全停止"],"one_liner":"安全功能检测到超限或危险时，让机器人自动、受控地停下来的停止方式。","explanation":"保护性停止是工业和协作机器人安全标准 ISO 10218 里的基本安全功能：碰撞检测触发、力或速度超出安全设置、防护门被打开、光幕被遮挡时，控制器让机器人有序停下。它和急停不同：急停是人拍下红色按钮，只用于紧急情况，UR 的急停是先受控停稳再切断驱动电源；保护性停止多由系统自动触发。IEC 60204-1 把停止分成三类：0 类立即断电，1 类先停稳再断电，2 类停稳后不断电、原地保持，恢复最快。相近的还有协作模式里的「安全级监控停止」：人进入协作区时机器人停住等待，人离开后自动继续；据 UR 资料，ISO 10218-1:2025 已把它改称「监控静止」（monitored standstill）。","example":"UR 协作臂运行中撞到障碍物，任何力或力矩参数超出安全设置时都会自动触发保护性停止，需要操作员排除原因、确认后才能恢复运行。","related":["急停","功能安全","碰撞检测（本体安全）","碰撞反应","功率与力限制","速度与分离监控"]},{"id":"damping-mode","category":"control","sec":9,"tier":2,"sources":[{"title":"unitree_rl_gym 真机部署说明（中文 README）","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/deploy/deploy_real/README.zh.md"},{"title":"unitree_rl_gym command_helper.py（create_damping_cmd）","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/deploy/deploy_real/common/command_helper.py"},{"title":"unitree_sdk2 g1_loco_client.hpp（Damp / ZeroTorque 接口）","url":"https://github.com/unitreerobotics/unitree_sdk2/blob/main/include/unitree/robot/g1/loco/g1_loco_client.hpp"}],"as_of":"2026-09","related_ids":["damping","stiffness-and-damping-gains","mit-mode","emergency-stop","protective-stop","unitree-sdk2"],"name":"阻尼模式","alt":"Damping Mode","abbr":"","aliases":["阻尼保护模式","阻尼状态","Damp 模式"],"one_liner":"关节不再追目标位置，只产生与转速相反的阻力，让机器人缓慢卸力的保护状态。","explanation":"阻尼模式是关节电机的一种保护状态，宇树的 SDK 和遥控器都直接提供。关节电机常按 τ = kp(q目标−q) + kd(q̇目标−q̇) + τff 计算输出力矩，q 是关节角，q̇ 是角速度，kp、kd 是刚度和阻尼增益，τff 是前馈力矩。阻尼模式把 kp、τff 和目标速度都设为 0，只保留 kd，于是 τ = −kd·q̇：关节静止时不出力，一转动就被反向拖住。和零力矩模式（kd 也为 0，关节完全松软）相比，它让机器人慢慢瘫下而不是突然砸落，所以常作为程序退出或出现异常时的安全兜底状态。","example":"宇树 unitree_rl_gym 的真机部署流程里，运动控制时按遥控器 select 键，机器人进入阻尼模式倒下、程序退出；代码里的阻尼指令就是每个电机 kp=0、kd=8、前馈力矩 0，即 τ = −8·q̇。","related":["阻尼","刚度与阻尼增益","MIT 模式","急停","保护性停止","宇树 SDK"]},{"id":"soft-limits","category":"control","sec":9,"tier":2,"sources":[{"title":"ros2_control joint_limits.hpp：SoftJointLimits（来自 URDF safety_controller）","url":"https://github.com/ros-controls/ros2_control/blob/master/joint_limits/include/joint_limits/joint_limits.hpp"},{"title":"legged_gym legged_robot_config.py：soft_dof_pos_limit","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["joint-limits","torque-limiting","protective-stop","workspace","unified-robot-description-format","functional-safety"],"name":"软限位","alt":"Soft Limits (Software Joint Limits)","abbr":"","aliases":["软件限位","虚拟墙","工作空间限制"],"one_liner":"在机械极限之内由软件设定的更保守的运动边界，先于机械止挡拦住机器人。","explanation":"软限位是控制软件设定的运动边界，比关节机械极限（硬限位、限位块）更靠里，让机器人在撞到机械止挡前就被软件拦下。关节层面，URDF 可在 safety_controller 标签里写 soft_lower_limit / soft_upper_limit，ros2_control 的说明是：关节到达这个边界时安全控制器开始限制其位置，k_position、k_velocity 决定允许的速度和力矩收紧得多快。笛卡尔层面，很多机械臂控制器支持设定末端不能越过的平面或区域，俗称虚拟墙。强化学习运控里，legged_gym 用 soft_dof_pos_limit 按比例缩小 URDF 的关节范围，超出部分给负奖励，让策略学会远离极限。","example":"某关节机械范围是 ±170°，软件把软限位设为 ±165°；遥操作时操作员把手柄推到底，关节也会在 165° 附近停住，不会撞上机械止挡。","related":["关节限位","力矩限幅","保护性停止","工作空间","统一机器人描述格式","功能安全"]},{"id":"torque-limiting","category":"control","sec":9,"tier":2,"sources":[{"title":"legged_gym: legged_robot.py（_compute_torques 中的 torch.clip）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"},{"title":"Isaac Lab Docs: Actuators（ideal PD actuator clipping）","url":"https://isaac-sim.github.io/IsaacLab/main/source/overview/core-concepts/actuators.html"},{"title":"libfranka rate_limiting.h（kMaxTorqueRate）","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/rate_limiting.h"}],"as_of":"","related_ids":["peak-torque","rated-torque","torque-speed-curve","integral-windup-anti-windup","soft-limits","torque-control"],"name":"力矩限幅","alt":"Torque Limiting (Saturation)","abbr":"","aliases":["力矩饱和","输出限幅","扭矩限幅","Torque clipping","Actuator saturation"],"one_liner":"把控制器算出的力矩截断在电机允许的范围内，超出部分不执行。","explanation":"力矩限幅是控制链路最后一道裁剪：不管上层算出多大力矩，送给电机前都截到 [−τmax, τmax] 之间。τmax 由电机峰值扭矩、驱动器电流上限和减速器强度决定，实际上还会随转速升高而下降。它防止烧电机、打坏齿轮，也让仿真里的机器人不能「无限用力」。副作用是，一旦饱和，控制器以为发出去的和实际执行的不一致：PID 的积分项会越攒越大（积分饱和），脱离饱和后产生大超调，需要做抗饱和处理；仿真训练用的限幅值也应与真机一致，否则策略学到的动作上机会走样。除了幅值，有的系统还会限制力矩的变化率。","example":"legged_gym 的 _compute_torques 函数：策略输出关节目标角，经 PD 公式算出力矩后，最后一行用 torch.clip 截到 ±torque_limits 再交给仿真器；libfranka 则额外限制力矩变化率，每个关节约 1000 N·m/s。","related":["峰值扭矩","额定扭矩","扭矩-转速曲线（T-N 曲线）","积分饱和与抗饱和","软限位","力矩控制"]},{"id":"watchdog","category":"control","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Watchdog timer","url":"https://en.wikipedia.org/wiki/Watchdog_timer"},{"title":"ur_rtde: rtde_control_interface.h（setWatchdog / kickWatchdog）","url":"https://gitlab.com/sdurobotics/ur_rtde/-/raw/master/include/ur_rtde/rtde_control_interface.h"},{"title":"ros2_controllers: diff_drive_controller（cmd_vel_timeout）","url":"https://control.ros.org/rolling/doc/ros2_controllers/diff_drive_controller/doc/userdoc.html"}],"as_of":"","related_ids":["emergency-stop","protective-stop","damping-mode","real-time-control","control-latency","functional-safety"],"name":"看门狗","alt":"Watchdog","abbr":"","aliases":["通信超时保护","Watchdog timer","WDT","看门狗定时器"],"one_liner":"要求程序定时「报平安」，超时没收到就判定出错，让机器人进入安全状态。","explanation":"看门狗原本是嵌入式系统里的硬件或软件定时器：程序正常运行时要周期性地「喂狗」（kick，重置计时），一旦程序卡死、崩溃没能按时喂狗，计时器超时就触发纠正动作，通常是把输出置于安全状态（关电机、断高压）再重启。在机器人里，它最常见的用途是通信超时保护：上位机或策略进程必须以不低于某个频率发送指令，超时就刹停、进入阻尼模式或保护性停止，防止网络断开、程序崩溃时机器人按最后一条指令继续动。例如 ur_rtde 库提供 setWatchdog 和 kickWatchdog 接口，默认要求至少 10 Hz 的更新，否则关闭控制；ROS 2 的差速底盘控制器 diff_drive_controller 有 cmd_vel_timeout 参数，默认 0.5 秒收不到新速度指令就视为过期。把学习到的策略部署到真机时，底层一般都要配好看门狗。","example":"用笔记本通过 Wi-Fi 遥控移动底盘，信号突然中断；底盘控制器 0.5 秒没收到新的 cmd_vel，旧指令被判为过期，底盘停下，而不是继续按最后的前进速度走。","related":["急停","保护性停止","阻尼模式","实时控制","控制延迟","功能安全"]},{"id":"collision-detection","category":"control","sec":9,"tier":2,"sources":[{"title":"Haddadin, De Luca, Albu-Schäffer, Robot Collisions: A Survey on Detection, Isolation, and Identification (IEEE T-RO 2017)","url":"https://doi.org/10.1109/TRO.2017.2723903"},{"title":"libfranka robot.h（setCollisionBehavior / automaticErrorRecovery）","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/robot.h"}],"as_of":"","related_ids":["generalized-momentum-observer","collision-reaction","power-and-force-limiting","protective-stop","joint-torque-sensor","iso-ts-15066-robots-and-robotic-devices-collaborative-robots"],"name":"碰撞检测（本体安全）","alt":"Collision Detection (Robot Safety)","abbr":"","aliases":["碰撞保护","无传感器碰撞检测","Sensorless collision detection","碰撞灵敏度"],"one_liner":"机器人运动中实时发现自己撞到人或物体，并立即停止或退让的安全功能。","explanation":"这里的碰撞检测是机器人运行时的安全功能：机身一旦意外撞到人或物体，控制器要尽快发现并做出反应，如停止、退让或切到柔顺模式。协作机器人大多不靠皮肤传感器，而是只用本体感知：用动力学模型预测正常运动所需的关节力矩，与电机电流或关节力矩传感器测到的实际力矩比较，差值超过阈值就判为碰撞。De Luca、Haddadin 等人使用的广义动量观测器是经典方法，他们 2017 年在 IEEE T-RO 发表的综述把流程分为检测、定位（哪根连杆被撞）、辨识（撞击力多大）等阶段。厂商界面里的「碰撞灵敏度」就是在调这个阈值：太低容易误报停机，太高则撞人时的力更大。例如 Franka 的 libfranka 可按关节设接触、碰撞两级阈值，超过碰撞阈值机器人停止运动。","example":"协作臂搬运时手肘碰到旁边工人的肩膀，关节实测力矩比模型预测高出一截并超过阈值，机器人触发停止，工人只感到被轻推了一下；随后需要复位错误才能继续运行。","related":["动量观测器","碰撞反应","功率与力限制","保护性停止","关节力矩传感器","ISO/TS 15066 协作机器人安全标准"]},{"id":"generalized-momentum-observer","category":"control","sec":9,"tier":3,"sources":[{"title":"Haddadin, De Luca, Albu-Schäffer, Robot Collisions: A Survey on Detection, Isolation, and Identification (IEEE T-RO 2017)","url":"https://portal.fis.tum.de/en/publications/robot-collisions-a-survey-on-detection-isolation-and-identificati"},{"title":"Collision detection and external force estimation for robot manipulators using a composite momentum observer (AIMS Electronics and Electrical Engineering, 2024)","url":"https://www.aimspress.com/article/doi/10.3934/electreng.2024011?viewType=HTML"}],"as_of":"","related_ids":["collision-detection","collision-reaction","disturbance-observer","sensorless-force-estimation","mass-matrix","friction-compensation"],"name":"动量观测器","alt":"Generalized Momentum Observer","abbr":"","aliases":["广义动量观测器","Momentum observer","动量残差","GMO"],"one_liner":"只用关节位置、速度和电机力矩，估计机器人身上受到的外力矩。","explanation":"由 Alessandro De Luca 等人在 2003 年前后提出（最初用于执行器故障检测），2006 年用于 DLR-III 轻型臂的碰撞检测，是协作机器人不装力传感器也能感知碰撞的经典方法。它盯着广义动量 p = M(q)q̇（M 为质量矩阵，q̇ 为关节速度），把按动力学模型预测的动量变化与实测比较，得到残差 r，满足 ṙ = K(τ_ext − r)：r 就是外力矩 τ_ext 经一阶低通滤波后的估计，增益 K 越大响应越快、也越怕噪声。它不需要关节加速度，也不用求质量矩阵的逆。残差超过阈值即判定碰撞并触发碰撞反应；摩擦等模型误差会混进残差，所以常与摩擦补偿配合。","example":"机械臂运动中被人手挡住，前几个关节的动量残差迅速超过阈值，控制器随即判定碰撞，停止原轨迹并切换到柔顺或退让模式。","related":["碰撞检测（本体安全）","碰撞反应","扰动观测器","无传感器力估计","质量矩阵","摩擦补偿"]},{"id":"collision-reaction","category":"control","sec":9,"tier":3,"sources":[{"title":"Haddadin, De Luca, Albu-Schäffer. Robot Collisions: A Survey on Detection, Isolation, and Identification. IEEE T-RO, 2017","url":"https://doi.org/10.1109/TRO.2017.2723903"},{"title":"De Luca et al. Collision Detection and Safe Reaction with the DLR-III Lightweight Manipulator Arm. IROS 2006","url":"https://doi.org/10.1109/IROS.2006.282053"},{"title":"libfranka robot.h（setCollisionBehavior / automaticErrorRecovery）","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/robot.h"}],"as_of":"","related_ids":["collision-detection","generalized-momentum-observer","protective-stop","power-and-force-limiting","damping-mode","physical-human-robot-interaction"],"name":"碰撞反应","alt":"Collision Reaction","abbr":"","aliases":["碰撞后反应策略","碰撞反射","Collision reflex"],"one_liner":"机器人检测到碰撞后，决定停下、变软还是退让的应对策略。","explanation":"碰撞反应是机器人碰撞处理的最后一步。Haddadin、De Luca 等人 2017 年的综述把它放在一条碰撞事件流水线里：先检测是否撞了，再定位撞在哪个连杆、估计碰撞力的大小和方向，判断是意外碰撞还是有意接触，最后才决定怎么反应。常见反应有：立即停止（保护性停止）；切到只补偿重力的力矩模式，让臂变软、可被推开；沿碰撞力方向主动退让；切换成阻抗或导纳控制，以柔顺方式继续。De Luca 等人 2006 年在 DLR-III 轻型臂上用基于广义动量的方法，只靠机器人自身传感器检测碰撞，并给出碰撞方向，供不同反应策略使用。如果人被夹在机器人和桌面之间，单纯刹停不能解除挤压，所以协作场景很看重退让、变软这类反应。","example":"Franka 机械臂可用 setCollisionBehavior 为各关节和末端各方向分别设「接触」和「碰撞」两级阈值：力在两者之间只记为接触，超过碰撞阈值机器人立即停止运动，要调用 automaticErrorRecovery 复位后才能继续。","related":["碰撞检测（本体安全）","动量观测器","保护性停止","功率与力限制","阻尼模式","物理人机交互"]},{"id":"power-and-force-limiting","category":"control","sec":9,"tier":3,"sources":[{"title":"OSHA Technical Manual, Section IV Chapter 4: Industrial Robot Systems and Industrial Robot System Safety","url":"https://www.osha.gov/otm/section-4-safety-hazards/chapter-4"},{"title":"3D Collision-Force-Map for Safe Human-Robot Collaboration (arXiv:2009.01036, ICRA 2021)","url":"https://arxiv.org/abs/2009.01036"},{"title":"Universal Robots: Safety FAQ","url":"https://www.universal-robots.com/articles/ur/safety/safety-faq/"}],"as_of":"2026-05","related_ids":["collaborative-robot","iso-ts-15066-robots-and-robotic-devices-collaborative-robots","speed-and-separation-monitoring","protective-stop","collision-detection","physical-human-robot-interaction"],"name":"功率与力限制","alt":"Power and Force Limiting","abbr":"PFL","aliases":["功率和力限制","力与功率限制","PFL 协作模式"],"one_liner":"允许机器人碰到人，但把接触力和压强限制在不致伤阈值内的协作安全方式。","explanation":"PFL 是 ISO 10218 系列和 ISO/TS 15066 规定的几种协作方式之一（其余是安全级监控停止、手动引导、速度与分离监控），协作机器人不加围栏和人共处主要靠它。它不回避接触，而是限制接触后果：TS 15066 按身体部位给出允许的力和压强，并区分瞬态接触（人能被撞开）和准静态接触（被夹住），后者阈值更低。实现上靠本体轻、慢，或靠关节力矩传感器等安全功能在超限时减速、停车。TS 15066 给了估算允许速度的简化公式 v ≤ F_max/√k · √(1/m_R + 1/m_H)：F_max 是该部位允许的最大力，k 是该部位的等效刚度，m_R、m_H 是机器人等效质量和人体部位质量。据 UR 官方资料，2025 版 ISO 10218 已吸收 TS 15066 的大部分内容。","example":"按 TS 15066，手背被夹住（准静态接触）时允许 140 N，不夹住的瞬态接触可放宽到 280 N。一篇 ICRA 2021 论文据此公式算出：有夹手风险时，UR10e 末端速度要限制在约 0.13 m/s。","related":["协作机器人","ISO/TS 15066 协作机器人安全标准","速度与分离监控","保护性停止","碰撞检测（本体安全）","物理人机交互"]},{"id":"speed-and-separation-monitoring","category":"control","sec":9,"tier":3,"sources":[{"title":"Implementing Speed and Separation Monitoring in Collaborative Robot Workcells (Marvel & Norcross, NIST, Robot Comput Integr Manuf 2017)","url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC5117641/"},{"title":"NIST 出版物页面：Implementing Speed and Separation Monitoring in Collaborative Robot Workcells","url":"https://www.nist.gov/publications/implementing-speed-and-separation-monitoring-collaborative-robot-workcells"}],"as_of":"","related_ids":["iso-ts-15066-robots-and-robotic-devices-collaborative-robots","power-and-force-limiting","collaborative-robot","protective-stop","safety-laser-scanner-safety-light-curtain","human-robot-collaboration"],"name":"速度与分离监控","alt":"Speed and Separation Monitoring","abbr":"SSM","aliases":["速度和间距监控","速度和分离监控"],"one_liner":"协作机器人实时监测人机距离，一旦小于安全距离就减速或停机的防护方式。","explanation":"速度与分离监控是 ISO 10218 与 ISO/TS 15066 规定的人机协作方式之一（其余为安全级监控停止、手动引导、功率与力限制）。外部传感器（安全激光扫描仪、3D 相机等）持续跟踪人和机器人，系统实时计算保护距离 S = S_h + S_r + S_s + C + Z_S + Z_R：S_h 是机器人反应和制动期间人走过的距离（人朝机器人的速度通常取 1.6 m/s），S_r、S_s 是机器人在反应时间内和制动过程中移动的距离，C 是人手可能伸入的余量，Z_S、Z_R 是人和机器人位置的测量不确定度。实际距离小于 S 就触发安全级受控停止，机器人越慢，S 越小，人就能靠得越近。它与功率与力限制的区别是：后者允许有限接触，SSM 则力求不接触。","example":"假设机器人反应 0.1 s、制动 0.3 s，人以 1.6 m/s 走近，仅 S_h 一项就是 1.6×(0.1+0.3)=0.64 m，再加上机器人自身走过的距离、伸入余量和测量误差，才是必须保持的最小距离；机器人降速后制动更快、移动更少，人就可以站得更近。","related":["ISO/TS 15066 协作机器人安全标准","功率与力限制","协作机器人","保护性停止","安全激光扫描仪 / 安全光幕","人机协作"]},{"id":"functional-safety","category":"control","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Functional safety","url":"https://en.wikipedia.org/wiki/Functional_safety"},{"title":"Wikipedia: IEC 61508","url":"https://en.wikipedia.org/wiki/IEC_61508"},{"title":"Wikipedia: ISO 13849","url":"https://en.wikipedia.org/wiki/ISO_13849"}],"as_of":"2023","related_ids":["emergency-stop","protective-stop","safe-torque-off","iso-13849-performance-level-safety-integrity-level","iso-10218-1-2-2025-robotics-safety-requirements","embodied-safety"],"name":"功能安全","alt":"Functional Safety","abbr":"","aliases":["IEC 61508","ISO 13849"],"one_liner":"靠自动保护功能在故障时仍把设备带到安全状态，并量化这种可靠性。","explanation":"功能安全指整体安全中依赖自动保护功能正确动作的那部分，如急停、安全扭矩关断、速度监控。通用母标准是 IEC 61508（第一版 1998–2000 年，第二版 2010 年），用安全完整性等级 SIL 1–4 表示可靠程度，等级越高允许的危险失效概率越低；机械领域的 IEC 62061、汽车的 ISO 26262 都由它派生。机器人更常引用 ISO 13849-1（2023 年第四版），用性能等级 PL a–e 和架构类别 B、1–4 表示，类别 3、4 要求双通道冗余。流程是危害分析→确定每个安全功能的目标等级→用冗余、自诊断和验证证明达标。它管的是硬件和控制系统出故障时能否可靠停下，和讨论大模型「做错事」的具身安全不是一回事。","example":"许多协作机械臂把急停、保护性停止等安全功能按 ISO 13849-1 的 PL d、类别 3 设计：两路独立通道互相比对，任一路出故障都能切断电机力矩。","related":["急停","保护性停止","安全扭矩关断","ISO 13849 性能等级 PL（安全完整性等级 SIL）","ISO 10218 工业机器人安全标准（2025 版）","具身安全"]},{"id":"iso-13849-performance-level-safety-integrity-level","category":"control","sec":9,"tier":3,"sources":[{"title":"ISO 13849-1:2023 Safety of machinery — Safety-related parts of control systems — Part 1","url":"https://www.iso.org/standard/73481.html"},{"title":"Spilma: ISO 13849 and IEC 62061: machinery functional safety","url":"https://www.spilma.com/en/guides/iec-62061-iso-13849-machinery-functional-safety"},{"title":"IBF Solutions: New standards for industrial robots EN ISO 10218-1 and -2","url":"https://www.ibf-solutions.com/en/seminars-and-news/news/new-standards-for-industrial-robots-en-iso-10218-1-and-2"}],"as_of":"2025-02","related_ids":["functional-safety","safe-torque-off","emergency-stop","protective-stop","iso-10218-1-2-2025-robotics-safety-requirements","iso-25785-1"],"name":"ISO 13849 性能等级 PL（安全完整性等级 SIL）","alt":"ISO 13849 Performance Level (PL a–e, Category B–4) / Safety Integrity Level (SIL, IEC 62061/61508)","abbr":"PL / SIL","aliases":["性能等级","安全完整性等级","Performance Level","Safety Integrity Level","ISO 13849-1:2023","IEC 62061","IEC 61508","PL d","SIL 2"],"one_liner":"衡量机器安全功能有多可靠的分级：ISO 13849 的 PL a–e 与 IEC 体系的 SIL。","explanation":"功能安全关心急停、保护性停止、限速这类安全功能在需要时能否可靠执行。ISO 13849-1（现行 2023 版）用性能等级 PL 衡量，a 到 e 递增，对应每小时危险失效概率 PFHd，如 PL d 为 10⁻⁷～10⁻⁶。先按伤害严重度、暴露频率、能否躲开定出所需等级 PLr，再由架构类别（Category B、1、2、3、4，3 和 4 要求单个故障不丢失安全功能）、元件平均危险失效时间 MTTFd 和诊断覆盖率 DC 算出实际 PL，要求不低于 PLr。另一套是 IEC 61508 的 SIL 1–4，其机械行业版 IEC 62061 用 SIL 1–3。两者按 PFHd 大致对应：PL b、c≈SIL 1，PL d≈SIL 2，PL e≈SIL 3。","example":"ISO 10218-1 的 2011 版要求工业机器人的安全相关控制功能一律达到 PL d、Category 3；2025 版改为按功能给默认等级，例如保护性停止默认 PL d 或 SIL 2，风险评估允许时可以调整。","related":["功能安全","安全扭矩关断","急停","保护性停止","ISO 10218 工业机器人安全标准（2025 版）","ISO 25785-1 动态稳定移动机器人安全标准"]},{"id":"iso-10218-1-2-2025-robotics-safety-requirements","category":"control","sec":9,"tier":3,"sources":[{"title":"ISO 10218-1:2025 Robotics — Safety requirements — Part 1: Industrial robots","url":"https://www.iso.org/standard/73933.html"},{"title":"ISO 10218-2:2025 Part 2: Industrial robot applications and robot cells","url":"https://www.iso.org/standard/73934.html"},{"title":"IBF Solutions: New standards for industrial robots EN ISO 10218-1 and -2","url":"https://www.ibf-solutions.com/en/seminars-and-news/news/new-standards-for-industrial-robots-en-iso-10218-1-and-2"}],"as_of":"2025-02","related_ids":["iso-ts-15066-robots-and-robotic-devices-collaborative-robots","power-and-force-limiting","speed-and-separation-monitoring","collaborative-robot","industrial-robot","iso-13849-performance-level-safety-integrity-level"],"name":"ISO 10218 工业机器人安全标准（2025 版）","alt":"ISO 10218-1/-2:2025 Robotics — Safety Requirements (Part 1: Industrial Robots; Part 2: Industrial Robot Applications and Robot Cells)","abbr":"","aliases":["ISO 10218:2025","ISO 10218-1:2025","ISO 10218-2:2025","ANSI/A3 R15.06-2025"],"one_liner":"国际上管工业机器人本体设计和集成应用的核心安全标准，2025 年发布新版。","explanation":"ISO 10218 由 ISO/TC 299 机器人技术委员会制定，第 1 部分管工业机器人本体设计，第 2 部分管把机器人集成进应用和工作单元。2025 年 2 月发布的新版取代 2011 版，主要变化：原先单独的协作机器人规范 ISO/TS 15066 被并入，人体接触力和压力限值放进第 2 部分；分析对象改为包含工件、程序和周边设备的「机器人应用」；功能安全不再统一要求 PL d、Category 3，而是按每项安全功能给默认等级；按危险程度把机器人分为 1 类和 2 类；新增网络安全要求。它不适用于公众可接触的服务机器人、医疗和载人等场合，这些归 ISO 13482 等标准。","example":"工厂里一台协作机械臂和工人共用工位拧螺丝，集成商要按 ISO 10218-2:2025 做风险评估；若采用功率与力限制，就要验证机械臂可能碰到的各人体部位的接触力和压力不超过标准给出的限值。","related":["ISO/TS 15066 协作机器人安全标准","功率与力限制","速度与分离监控","协作机器人","工业机器人","ISO 13849 性能等级 PL（安全完整性等级 SIL）"]},{"id":"iso-ts-15066-robots-and-robotic-devices-collaborative-robots","category":"control","sec":9,"tier":3,"sources":[{"title":"OSHA Technical Manual, Section IV Chapter 4: Industrial Robot Systems and Industrial Robot System Safety","url":"https://www.osha.gov/otm/section-4-safety-hazards/chapter-4"},{"title":"ISO 10218 - Wikipedia","url":"https://en.wikipedia.org/wiki/ISO_10218"}],"as_of":"2025","related_ids":["collaborative-robot","power-and-force-limiting","speed-and-separation-monitoring","iso-10218-1-2-2025-robotics-safety-requirements","human-robot-collaboration","physical-human-robot-interaction"],"name":"ISO/TS 15066 协作机器人安全标准","alt":"ISO/TS 15066 Robots and Robotic Devices — Collaborative Robots","abbr":"ISO/TS 15066","aliases":["ISO/TS 15066:2016","TS 15066","协作机器人安全技术规范"],"one_liner":"ISO 2016 年发布的协作机器人安全技术规范，规定人机接触时的力和压强上限。","explanation":"ISO/TS 15066 是国际标准化组织 2016 年发布的技术规范（TS），用来补充工业机器人安全标准 ISO 10218，专讲人和机器人不隔围栏、共用工作空间时怎么保证安全。它细化了四种协作方式：安全级监控停止（人进入协作区时机器人停住并受监控）、手动引导（人手推着机器人走）、速度与分离监控（人越近机器人越慢，太近就停）、功率与力限制（允许接触，但限制撞击的力）。最常被引用的是按身体部位给出的力和压强上限，分瞬态接触（人被撞后能自由躲开）和准静态接触（人被夹在机器人和固定物之间）两种情形，面部、太阳穴、咽喉等敏感部位要避免接触。美国对应的技术报告是 RIA TR R15.606-2016。据报道，2025 年修订的 ISO 10218-2 已把协作应用的相关要求并入正文。","example":"协作臂和工人在同一张装配台上干活时，集成商通常按「功率与力限制」方式配置，再用专用测力装置在工人手部等可能被碰到的位置实测碰撞力和压强，确认低于规范给出的对应限值后才能投用。","related":["协作机器人","功率与力限制","速度与分离监控","ISO 10218 工业机器人安全标准（2025 版）","人机协作","物理人机交互"]},{"id":"iso-13482","category":"control","sec":9,"tier":3,"sources":[{"title":"ISO 13482:2014 Robots and robotic devices — Safety requirements for personal care robots","url":"https://www.iso.org/standard/53820.html"},{"title":"ISO/FDIS 13482 Robotics — Safety requirements for service robots","url":"https://www.iso.org/standard/83498.html"},{"title":"CYBERDYNE: HAL received the world-first certificates of ISO 13482 (2014-11)","url":"https://www.cyberdyne.jp/en/news/1441.html"}],"as_of":"2026-09","related_ids":["service-robot","exoskeleton","iso-10218-1-2-2025-robotics-safety-requirements","functional-safety","physical-human-robot-interaction","embodied-safety"],"name":"ISO 13482 个人护理机器人安全标准","alt":"ISO 13482 (Safety Requirements for Personal Care Robots)","abbr":"","aliases":["ISO 13482:2014","ISO/FDIS 13482","服务机器人安全要求","Safety requirements for service robots"],"one_liner":"针对移动服务、穿戴助力、载人这类贴近人日常生活的机器人的国际安全标准。","explanation":"ISO 13482 于 2014 年 2 月发布，针对三类在非工业、非医疗场合与人近距离接触的地面机器人：移动服务机器人（如送物机器人）、身体助力机器人（如穿戴式助力外骨骼）和载人机器人。它规定本质安全设计、防护措施和使用说明，允许人与机器人有物理接触。不适用于时速超过 20 公里的机器人、玩具、水下和飞行机器人、工业机器人（归 ISO 10218）、医疗器械和军警用途；标准也注明发布时国际上还没有公认的碰撞疼痛或受伤限值。据 ISO 官网，修订稿 ISO/FDIS 13482 已到最终草案阶段，标题改为「服务机器人安全要求」，范围扩大到个人和专业/商用服务机器人。","example":"2014 年 11 月，Cyberdyne 的腰部助力外骨骼 HAL for Labor Support 和 HAL for Care Support 获得日本质量保证机构（JQA）依据 ISO 13482:2014 颁发的证书，官方称是全球首批。","related":["服务机器人","外骨骼","ISO 10218 工业机器人安全标准（2025 版）","功能安全","物理人机交互","具身安全"]},{"id":"iso-25785-1","category":"control","sec":9,"tier":3,"sources":[{"title":"ISO/CD 25785-1 Robotics — Safety requirements for dynamically stable industrial mobile robots — Part 1: Robots","url":"https://www.iso.org/standard/91469.html"},{"title":"Synapticon: ISO 25785-1: Safety Standard for Dynamically Stable Robots","url":"https://www.synapticon.com/en/newslist/iso-25785-sicherheit-dynamisch-stabile-roboter"},{"title":"Provael: ISO 25785-1 crosswalk（CD 于 2026-05-08 登记）","url":"https://www.provael.com/compliance/iso-25785"}],"as_of":"2026-09","related_ids":["humanoid-robot","dynamic-stability","safe-torque-off","fall-mitigation-and-fall-recovery","iso-10218-1-2-2025-robotics-safety-requirements","quadruped-robot"],"name":"ISO 25785-1 动态稳定移动机器人安全标准","alt":"ISO 25785-1 (Safety Requirements for Dynamically Stable Industrial Mobile Robots, i.e. with Actively Controlled Stability, e.g. legged/humanoid — Part 1: Robots)","abbr":"","aliases":["ISO/CD 25785-1","人形机器人安全标准","动态稳定机器人安全标准","Actively Controlled Stability"],"one_liner":"专为人形、四足等需主动平衡才站得住的工业移动机器人制定的安全标准，仍在起草。","explanation":"ISO 25785-1 由 ISO/TC 299 第 12 工作组起草，2025 年 5 月立项，Agility Robotics、波士顿动力和美国自动化协会 A3 的专家参与牵头。它针对「主动控制稳定性」的工业移动机器人，即断电或控制失效就可能倒下的双足人形、四足和轮式自平衡机器人（可带手臂），场景限于公众不能随意进入的工业环境。传统机器人遇险就切断电机力矩（安全扭矩关断），停住即安全；主动平衡的机器人一断电反而会倒下，所以跌倒、质心越出支撑范围等要作为专门危险处理。第 1 部分管机器人本体，第 2 部分将另行制定、管集成应用。2026 年 5 月进入委员会草案（ISO/CD）阶段，截至 2026 年 9 月尚未发布。","example":"仓库里一台人形机器人搬箱时检测到故障，若像传统机械臂那样立即切断关节力矩，它会整个倒下；按该标准草案的思路，要先评估它可能倒向哪里、冲击多大，设计受控的停机或蹲坐动作，并划定可能的跌倒区域。","related":["人形机器人","动态稳定","安全扭矩关断","跌倒保护与摔倒恢复","ISO 10218 工业机器人安全标准（2025 版）","四足机器人"]},{"id":"lyapunov-stability","category":"control","sec":9,"tier":3,"sources":[{"title":"Lyapunov stability - Wikipedia","url":"https://en.wikipedia.org/wiki/Lyapunov_stability"}],"as_of":"","related_ids":["control-lyapunov-function","control-barrier-function","passivity-based-control","impedance-control","dynamic-stability","robust-control"],"name":"李雅普诺夫稳定性","alt":"Lyapunov Stability","abbr":"","aliases":["李雅普诺夫函数","Lyapunov function","李雅普诺夫第二方法","李雅普诺夫直接法"],"one_liner":"判断系统受扰后能否回到平衡点的理论，常用一个只减不增的「能量函数」来证明。","explanation":"李雅普诺夫稳定性来自俄国数学家李雅普诺夫 1892 年的博士论文，是分析非线性系统稳定性的基础。它分几档：从平衡点附近出发的状态始终不跑远，叫李雅普诺夫稳定；不但不跑远，最终还回到平衡点，叫渐近稳定；回去的速度至少按指数衰减，叫指数稳定。最常用的是第二方法（直接法）：不去解微分方程，而是找一个函数 V(x)，在平衡点等于 0、其他地方大于 0，并且沿系统轨迹随时间不增加（dV/dt ≤ 0），就能证明稳定；严格减小则渐近稳定。V 可以理解为广义能量，但不必是真实的物理能量。难点在于没有通用方法构造 V。机器人里 PD 加重力补偿、阻抗控制、无源性控制的稳定性证明都靠它，控制李雅普诺夫函数、控制障碍函数也是在它基础上发展出来的。","example":"带阻尼的单摆：取 V = 动能 + 势能（以最低点为零），可以算出沿运动轨迹 dV/dt = −b·θ̇²（b 是阻尼系数，θ̇ 是角速度），能量只减不增，于是不用解出摆的运动方程就知道最低点是稳定的；再配合 LaSalle 不变性原理，还能证明摆最终停在最低点。","related":["控制李雅普诺夫函数","控制障碍函数","无源性控制","阻抗控制","动态稳定","鲁棒控制"]},{"id":"control-lyapunov-function","category":"control","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Control-Lyapunov function","url":"https://en.wikipedia.org/wiki/Control-Lyapunov_function"},{"title":"Ames, Galloway, Sreenath, Grizzle: Rapidly Exponentially Stabilizing Control Lyapunov Functions and Hybrid Zero Dynamics (IEEE TAC 2014)","url":"https://ieeexplore.ieee.org/document/6709752"},{"title":"Ames et al., Control Barrier Functions: Theory and Applications（CLF-CBF-QP 一节）","url":"https://arxiv.org/abs/1903.11199"}],"as_of":"","related_ids":["lyapunov-stability","control-barrier-function","quadratic-programming","hybrid-zero-dynamics","feedback-linearization","optimal-control"],"name":"控制李雅普诺夫函数","alt":"Control Lyapunov Function","abbr":"CLF","aliases":["控制李亚普诺夫函数","控制 Lyapunov 函数","CLF-QP"],"one_liner":"一个类似能量的函数：只要总能选出控制让它下降，系统就能被稳到目标。","explanation":"李雅普诺夫函数 V(x) 类似系统的「能量」：在目标点为 0，其他地方为正。普通李雅普诺夫函数用来分析一个设计好的闭环是否稳定；控制李雅普诺夫函数面向还没定控制律、带输入 u 的系统：若在每个非目标状态都存在某个 u 使 V̇ < 0，系统就能被镇定到目标。这一理论在 1980 年代由 Artstein 和 Sontag 提出并发展，Sontag 还给出了直接由 CLF 构造控制律的通用公式。机器人中常用 CLF-QP：每个控制周期求一个满足 V̇ ≤ −λV（按指数速度收敛）且力矩尽量小的 u，方便同时加上力矩上限、摩擦锥等约束。Ames 等人把它用于双足行走；它也常和控制障碍函数放进同一个二次规划，安全约束为硬约束，收敛约束加松弛变量作软约束。","example":"一阶系统 ẋ = u，取 V = x²/2，则 V̇ = x·u。要求 V̇ ≤ −V（即 λ = 1）：在 x = 2 时条件化为 2u ≤ −2，即 u ≤ −1。CLF-QP 在满足条件的 u 里挑绝对值最小的 u = −1，状态随之按指数速度收敛到 0。","related":["李雅普诺夫稳定性","控制障碍函数","二次规划","混合零动态","反馈线性化","最优控制"]},{"id":"control-barrier-function","category":"control","sec":9,"tier":3,"sources":[{"title":"Ames et al., Control Barrier Functions: Theory and Applications (arXiv:1903.11199)","url":"https://arxiv.org/abs/1903.11199"},{"title":"Ames, Xu, Grizzle, Tabuada: Control Barrier Function Based Quadratic Programs for Safety Critical Systems (arXiv:1609.06408)","url":"https://arxiv.org/abs/1609.06408"}],"as_of":"","related_ids":["control-lyapunov-function","safety-filter","quadratic-programming","hamilton-jacobi-reachability-analysis","safe-reinforcement-learning","artificial-potential-field"],"name":"控制障碍函数","alt":"Control Barrier Function","abbr":"CBF","aliases":["控制屏障函数","CBF-QP","障碍函数","Barrier Function"],"one_liner":"把「别越界」写成约束，只在快要不安全时才最小限度地改动控制指令。","explanation":"控制障碍函数用一个函数 h(x) 定义安全集：h(x) ≥ 0 就算安全（x 是系统状态，如位置和速度）。核心条件是 ḣ ≥ −α·h（α 为正的系数）：离边界越近、h 越小，允许 h 继续减小的速度就越慢，贴到边界时就不能再往外走，状态因此一直留在安全集里。Ames、Tabuada 等人把它和二次规划结合（arXiv 2016 年，期刊版发表于 IEEE TAC）：在满足该条件的控制量里找离原指令 u_des 最近的一个，即 CBF-QP。因为只在必要时改指令，它常被当作安全滤波器，套在遥操作或学习得到的策略外面。它和控制李雅普诺夫函数正好相对：CLF 保证「收敛到目标」，CBF 保证「不离开安全区」；比起人工势场法，它能给出形式化的安全保证。","example":"一维小车以 ẋ = u 向 x = 5 米处的墙移动，取 h = 5 − x、α = 2，条件化为 u ≤ 2(5 − x)。在 x = 4 时速度上限是 2 m/s，原指令 1 m/s 不受影响；到 x = 4.9 时上限降到 0.2 m/s，CBF-QP 就把指令压到 0.2 m/s。车越靠近墙越慢，始终撞不上。","related":["控制李雅普诺夫函数","安全滤波器","二次规划","HJ 可达性分析","安全强化学习","人工势场法"]},{"id":"safety-filter","category":"control","sec":9,"tier":3,"sources":[{"title":"The Safety Filter: A Unified View of Safety-Critical Control in Autonomous Systems (Hsu, Hu, Fisac, arXiv 2309.05837)","url":"https://arxiv.org/abs/2309.05837"},{"title":"Control Barrier Functions: Theory and Applications (Ames et al., arXiv 1903.11199)","url":"https://arxiv.org/abs/1903.11199"}],"as_of":"","related_ids":["control-barrier-function","hamilton-jacobi-reachability-analysis","model-predictive-control","safe-reinforcement-learning","embodied-safety","quadratic-programming"],"name":"安全滤波器","alt":"Safety Filter","abbr":"","aliases":["安全过滤器","安全屏蔽","Safety shield"],"one_liner":"夹在策略和执行器之间，只在动作会导致危险时才最小限度地改动它。","explanation":"安全滤波器把「完成任务」和「保证安全」拆成两层：任务策略（手写控制器、强化学习或 VLA 模型）先给出名义动作，滤波器判断执行后系统还能否留在安全集合内，安全就原样放行，不安全才换成最接近的安全动作。常见实现有三类：控制障碍函数（CBF）每步解一个小二次规划，找离名义动作最近、又不让安全函数 h(x) 降到 0 以下的动作；HJ 可达性分析预先算出哪些状态无论怎么控制都会出事；MPC 屏蔽则在线预测未来轨迹能否退回安全区。Hsu、Hu、Fisac 2023 年的综述把它们统一成「监控 + 干预」框架。学习型策略本身没有安全保证，外面加这一层就能提供可证明的约束。","example":"移动机器人避人：定义 h(x)=‖p−p_人‖²−d²（p 为机器人位置，d 为允许的最小距离，h≥0 即安全），每个周期求解 min‖u−u_nom‖²，约束 ḣ ≥ −α·h；u_nom 是导航策略给的速度，α>0 决定靠近时减速多早。离人远时约束不起作用，u 就等于 u_nom。","related":["控制障碍函数","HJ 可达性分析","模型预测控制","安全强化学习","具身安全","二次规划"]},{"id":"hamilton-jacobi-reachability-analysis","category":"control","sec":9,"tier":3,"sources":[{"title":"Bansal, Chen, Herbert, Tomlin, Hamilton-Jacobi Reachability: A Brief Overview and Recent Advances (arXiv 1709.07523)","url":"https://arxiv.org/abs/1709.07523"}],"as_of":"","related_ids":["control-barrier-function","safety-filter","safe-reinforcement-learning","optimal-control","value-function","embodied-safety"],"name":"HJ 可达性分析","alt":"Hamilton-Jacobi Reachability Analysis","abbr":"HJ reachability","aliases":["哈密顿-雅可比可达性分析","HJ 可达性","Hamilton-Jacobi reachability"],"one_liner":"解一个偏微分方程，算出「从哪些状态出发能保证避开危险」的安全区域。","explanation":"一种形式化安全验证方法，Claire Tomlin 等人长期推动，Bansal、Chen、Herbert、Tomlin 2017 年写过综述。给定系统动力学、有界扰动和一个「失败集」（如已碰撞的状态），求解哈密顿-雅可比偏微分方程得到价值函数 V(x)，它的符号划出后向可达集：从这些状态出发，在最坏扰动下怎么控制都会进入失败集；其余状态就是安全集，同时还能得到边界上的最优安全控制。它支持非线性动力学并给出严格保证，但计算量随状态维度指数增长（维数灾难），只适合低维模型。常用作安全滤波器：平时由学习策略控制，接近安全集边界时切换到安全控制。与控制障碍函数相比，它直接算出安全集，而 CBF 通常要人先给出候选函数。","example":"两架无人机对飞：以相对位置和航向为状态算出后向可达集，相对状态还在集合外时放任原控制器，一旦碰到边界就立刻执行 HJ 给出的规避动作。","related":["控制障碍函数","安全滤波器","安全强化学习","最优控制","价值函数","具身安全"]},{"id":"proprioception","category":"perception","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Proprioception","url":"https://en.wikipedia.org/wiki/Proprioception"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/html/2410.24164v1"},{"title":"unitree_rl_gym g1_env.py（G1 策略观测定义）","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/legged_gym/envs/g1/g1_env.py"}],"as_of":"","related_ids":["exteroception","rotary-encoder","state-proprioception-encoder","state-estimation","blind-locomotion","inertial-measurement-unit"],"name":"本体感知","alt":"Proprioception","abbr":"","aliases":["本体感觉","本体感受","本体状态","机器人本体状态感知","Proprioceptive State"],"one_liner":"机器人对自身关节位置、速度、受力和姿态的感知，不看外部环境。","explanation":"本体感知原是生理学术语，指对自身肢体位置、运动和用力的感觉，1906 年英国生理学家谢灵顿（Sherrington）在著作中使用了这个词，与感知外部世界的外部感知相对。机器人里指对自身状态的测量：编码器给出关节角和速度，电机电流或力矩传感器给出受力，IMU 给出机身姿态和角速度，夹爪开合宽度也常算在内。这类数据维度低、噪声小、频率高，几乎所有策略都会用。比如 π0 的观测由多路图像、语言指令和关节角组成的本体状态构成，本体状态经线性层投影后和其他 token 一起送入模型。只靠本体感知、不用相机的足式行走叫盲走。","example":"宇树 unitree_rl_gym 的 G1 行走策略，观测里的 IMU 角速度、投影重力、各关节相对默认姿态的角度和关节速度都属于本体感知，另外再拼上速度指令、上一步动作和步态相位；机身线速度真机上难以直接测准，只放在仿真训练才有的特权观测里。","related":["外部感知","编码器","状态编码器","状态估计","盲走","惯性测量单元"]},{"id":"exteroception","category":"perception","sec":0,"tier":3,"sources":[{"title":"Wikipedia: Exteroception","url":"https://en.wikipedia.org/wiki/Exteroception"},{"title":"Learning robust perceptive locomotion for quadrupedal robots in the wild (Science Robotics 2022)","url":"https://arxiv.org/abs/2201.08117"}],"as_of":"","related_ids":["proprioception","multi-sensor-fusion","perceptive-locomotion","blind-locomotion","state-estimation","lidar"],"name":"外部感知","alt":"Exteroception","abbr":"","aliases":["外感受","环境感知","外部传感","Exteroceptive Sensing"],"one_liner":"机器人用相机、激光雷达等传感器获取自身以外环境信息的感知。","explanation":"外部感知一词来自生理学，指生物感受身体以外刺激（如视觉、听觉、皮肤触觉）的能力，与感知自身肢体位置和运动的本体感知（proprioception）相对。机器人学沿用这个区分：相机、深度相机、激光雷达、超声波、触觉传感器等测量环境的属于外部感知；关节编码器、IMU、电机电流等测量机器人自身状态的属于本体感知。外部感知能让机器人提前看到台阶、障碍和目标物体，但容易受光照、遮挡、反光和噪声影响；本体感知稳定，却只能在接触发生后才察觉地形。所以腿足机器人常把两者融合：外部信息可靠时提前调整步态，不可靠时退回依赖本体感知。","example":"苏黎世联邦理工的四足行走工作（Science Robotics 2022）用一个带注意力的循环编码器端到端融合外部感知与本体感知，机器人在接触地形前就能调整步态，并以人类推荐用时走完一段阿尔卑斯山徒步路线。","related":["本体感知","多传感器融合","感知行走","盲走","状态估计","激光雷达"]},{"id":"multimodal-perception","category":"perception","sec":0,"tier":2,"sources":[{"title":"See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation (CoRL 2022)","url":"https://arxiv.org/abs/2212.03858"},{"title":"Making Sense of Vision and Touch: Self-Supervised Learning of Multimodal Representations for Contact-Rich Tasks (ICRA 2019)","url":"https://arxiv.org/abs/1810.10191"}],"as_of":"","related_ids":["multi-sensor-fusion","visuo-tactile-fusion","proprioception","tactile-sensor","contact-rich-manipulation","vision-tactile-language-action-model"],"name":"多模态感知","alt":"Multimodal Perception","abbr":"","aliases":["多模态传感","多感官感知"],"one_liner":"同时用视觉、触觉、力觉、声音等多种感官信息来理解环境。","explanation":"多模态感知指机器人不只靠相机，还同时用触觉、力/力矩、声音、本体感知（关节角、电机电流等对自身状态的感知），甚至语言指令来理解场景和任务进展。原因是各模态擅长的东西不同：2022 年的 See, Hear, and Feel 工作总结，视觉能看到全局但常被遮挡，声音能及时反映看不见的关键时刻，触觉提供精确的局部几何。难点在于各模态的频率、维度和噪声差别很大，需要为每种模态设计编码器，再选拼接、注意力等方式融合，数据采集也更麻烦。多项研究显示，在插孔、倒水这类接触丰富的操作中，加入触觉和力觉比只用视觉更稳。","example":"See, Hear, and Feel（CoRL 2022）让机械臂用相机、接触式麦克风和视触觉传感器完成密集装箱和倒水，三路信号用自注意力融合，效果好于只用一两种模态。","related":["多传感器融合","视触觉融合","本体感知","触觉传感器","接触丰富操作","视觉-触觉-语言-动作模型"]},{"id":"computer-vision","category":"perception","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Computer vision","url":"https://en.wikipedia.org/wiki/Computer_vision"},{"title":"Richard Szeliski, Computer Vision: Algorithms and Applications (2nd ed., 2022)","url":"https://szeliski.org/Book/"}],"as_of":"","related_ids":["object-detection","semantic-segmentation","3d-vision","vision-foundation-model","depth-estimation","vision-encoder"],"name":"计算机视觉","alt":"Computer Vision","abbr":"CV","aliases":["机器视觉（广义）","CV"],"one_liner":"让计算机从图像和视频中提取有用信息、理解场景的学科。","explanation":"计算机视觉研究怎样让计算机从单张图像或视频序列中自动提取、分析和理解信息，典型任务有图像分类、目标检测、分割、跟踪、位姿估计和三维重建。它起步于 20 世纪 60 年代末的人工智能实验室，1966 年还有人以为给计算机接上相机、让它「描述看到了什么」只需一个本科生暑期项目，结果这个问题研究了半个多世纪。深度学习兴起后，卷积网络、视觉 Transformer 以及 CLIP、DINOv2、SAM 这类视觉基础模型成为主流。具身智能里，相机是机器人获取外部信息的主要来源，VLA 的视觉编码器大多直接沿用计算机视觉领域预训练好的模型。","example":"机器人收拾桌子前，先用目标检测找到杯子，用分割抠出杯子轮廓，再结合深度图算出它的三维位置，这几步都属于计算机视觉。","related":["目标检测","语义分割","3D视觉","视觉基础模型","深度估计","视觉编码器"]},{"id":"machine-vision","category":"perception","sec":0,"tier":2,"sources":[{"title":"Machine vision - Wikipedia","url":"https://en.wikipedia.org/wiki/Machine_vision"}],"as_of":"","related_ids":["computer-vision","3d-vision-guided-robotics","bin-picking","quality-inspection","structured-light","mech-mind-robotics"],"name":"机器视觉（工业视觉）","alt":"Machine Vision (Industrial Vision)","abbr":"","aliases":["工业视觉","工业机器视觉"],"one_liner":"用相机和软件在产线上自动检测、测量、识别，并引导机器人。","explanation":"机器视觉指在工业现场用相机、镜头、光源、处理器和图像软件，自动完成检测、测量、识别和定位，把图像直接变成「合格 / 不合格」「零件在哪」这类可执行的结论。典型应用有：外观缺陷检测和分拣、尺寸测量、读码识别，以及给机械臂提供工件位置和朝向的视觉引导。它和计算机视觉的关系是：计算机视觉是研究图像理解的学科，机器视觉更偏系统工程，重视打光设计、节拍和长期稳定性，常以规则算法为主、深度学习为辅。随着 3D 相机普及，3D 视觉引导的无序抓取、上下料已成为工业机器人的常见配置，也是具身智能进工厂时绕不开的参照方案。","example":"产线上相机逐个拍下经过的零件，软件判断有无划痕并触发剔除；隔壁工位的 3D 相机识别料框里乱放的零件位姿，引导机械臂逐个抓取上料。","related":["计算机视觉","3D 视觉引导","无序抓取","质检","结构光","梅卡曼德"]},{"id":"rgb-camera","category":"perception","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Bayer filter","url":"https://en.wikipedia.org/wiki/Bayer_filter"},{"title":"ALOHA / ACT project page (Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware)","url":"https://tonyzhaozh.github.io/aloha/"},{"title":"arXiv 2304.13705: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["depth-camera","stereo-camera","wrist-camera","monocular-depth-estimation","camera-intrinsics","global-shutter-rolling-shutter"],"name":"RGB相机","alt":"RGB Camera","abbr":"","aliases":["彩色相机","单目相机","Monocular Camera","彩色摄像头"],"one_liner":"输出彩色图像的普通相机，每个像素记录红、绿、蓝三个亮度值。","explanation":"RGB 相机就是最常见的彩色相机：图像传感器前覆一层颜色滤镜阵列，最常用的是柯达工程师 Bryce Bayer 1976 年取得专利的拜耳滤镜，一半像素感绿、红和蓝各占四分之一，再用去马赛克算法插值出每个像素完整的 R、G、B 值。它便宜、分辨率高、信息丰富，是多数模仿学习策略和 VLA 的主要输入。局限是单个 RGB 相机（单目）只拍到三维世界的二维投影，不知道物体离多远；要拿到深度得配深度相机、双目相机，或用单目深度估计模型去推。装机时还要考虑视场角、帧率，以及是全局快门（整幅画面同时曝光）还是卷帘快门（逐行曝光，快速运动时画面会歪斜）。","example":"初代 ALOHA 双臂平台装了 4 个普通网络摄像头：两个装在手腕上，一个在正前方、一个在顶部俯拍。ACT 策略只用这些彩色图像加上关节角，不用深度，靠约 10 分钟的示范就学会了打开半透明调料杯、插电池等动作，成功率 80–90%。","related":["深度相机","双目相机","腕部相机","单目深度估计","相机内参","全局快门 / 卷帘快门"]},{"id":"wrist-camera","category":"perception","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Visual servoing (eye-in-hand vs. eye-to-hand)","url":"https://en.wikipedia.org/wiki/Visual_servoing"},{"title":"DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset (project page)","url":"https://droid-dataset.github.io/"},{"title":"ALOHA project page","url":"https://tonyzhaozh.github.io/aloha/"}],"as_of":"","related_ids":["eye-in-hand","third-person-camera","head-camera","hand-eye-calibration","multi-view","occlusion"],"name":"腕部相机","alt":"Wrist Camera","abbr":"","aliases":["手腕相机","手眼相机","Wrist-mounted Camera","眼在手上相机"],"one_liner":"装在机械臂手腕或夹爪上、跟着手一起移动的相机，专看手边近景。","explanation":"腕部相机固定在机械臂末端靠近夹爪的位置，属于视觉伺服里说的「眼在手上」配置：相机随手移动，看的是手与目标的相对位置；与之相对的是固定在环境里的第三视角相机，即「眼在手外」。它的好处是抓取、插入的最后几厘米看得最清楚，不容易被机械臂自己挡住，物体在画面中的位置也和夹爪直接对应，所以模仿学习和 VLA 的数据采集大多会配一个，与一两个第三视角相机一起输入策略。缺点是视角随动作剧烈变化、看不到全局，距离太近时深度相机可能测不准；要用它的图像做几何计算，还得先做手眼标定。","example":"DROID 数据集在每台 Franka 机械臂上装了 3 个相机：2 个位置可调的外部 ZED 2 双目相机，加 1 个装在手腕上的 ZED Mini。","related":["眼在手上","第三视角相机","头部相机","手眼标定","多视角","遮挡"]},{"id":"third-person-camera","category":"perception","sec":0,"tier":2,"sources":[{"title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","url":"https://arxiv.org/abs/2403.12945"}],"as_of":"","related_ids":["wrist-camera","head-camera","eye-to-hand","camera-extrinsics","multi-view","droid"],"name":"第三视角相机","alt":"Third-Person (Static) Camera","abbr":"","aliases":["固定相机","外部相机","全局相机","Exterior Camera","3rd-person Camera"],"one_liner":"固定在机器人身体之外、从旁边看整个工作区的相机。","explanation":"第三视角相机装在三脚架、墙面或桌边，不随机械臂移动，和腕部相机、头部相机相对。它视野大，能同时拍到机器人、物体和环境，提供全局位置信息；缺点是远处细节看不清，手臂和物体容易互相遮挡，所以操作数据集通常把它和腕部相机搭配使用。这种布置属于「眼在手外」，要先标定相机外参，才能把图像位置换算到机器人基坐标系。相机一挪位置，策略看到的画面就变了，成功率常会下降，视角泛化因此是常见评测项。论文里也写作 exterior camera 或 3rd person camera。","example":"DROID 数据集的每台采集平台配两台可调位置的 ZED 2 双目相机作第三视角、一台 ZED Mini 装在手腕上；每换一个场景，采集员重新摆放第三视角相机，并用棋盘格标定外参。","related":["腕部相机","头部相机","眼在手外","相机外参","多视角","DROID 数据集"]},{"id":"head-camera","category":"perception","sec":0,"tier":2,"sources":[{"title":"Mobile ALOHA (arXiv:2401.02117)","url":"https://arxiv.org/html/2401.02117"},{"title":"Open-TeleVision (arXiv:2407.01512)","url":"https://arxiv.org/html/2407.01512"},{"title":"Unitree G1 产品页","url":"https://www.unitree.com/g1"}],"as_of":"","related_ids":["wrist-camera","third-person-camera","egocentric-video","open-television","multi-view","camera-extrinsics"],"name":"头部相机","alt":"Head Camera","abbr":"","aliases":["头部视角","Head-mounted Camera","头戴相机","顶部相机"],"one_liner":"装在机器人头部或机身顶部、提供接近人眼第一人称视角的相机。","explanation":"头部相机指装在人形机器人头部、或移动操作平台上方的相机，视角接近人从自己眼睛往前看。它通常和腕部相机、第三视角固定相机配合：头部相机看全局场景和双手位置，腕部相机看夹爪附近的细节。例如 Mobile ALOHA 用两个腕部相机加一个朝前的顶部相机；宇树 G1 头部装有深度相机和 3D 激光雷达。头能转动时，相机外参随颈部关节变化，要用运动学实时换算。遥操作里还有「主动头部相机」：Open-TeleVision 把 ZED Mini 双目相机装在两自由度云台上，跟随操作员在 Apple Vision Pro 里的头部转动并回传立体画面。采人类数据时，戴在人头上的相机或眼镜也叫头戴相机，拍的就是第一人称视频。","example":"训练双臂叠衣服的策略时输入三路图像：头部相机看整件衣服铺开的状态，两个腕部相机看夹爪有没有夹住衣角。","related":["腕部相机","第三视角相机","第一人称视频","Open-TeleVision","多视角","相机外参"]},{"id":"palm-camera","category":"perception","sec":0,"tier":3,"sources":[{"title":"Introducing Figure 03 (Figure AI, 2025-10-09)","url":"https://www.figure.ai/news/introducing-figure-03"},{"title":"DexWild 项目主页","url":"https://dexwild.github.io/"}],"as_of":"2025-10","related_ids":["wrist-camera","head-camera","occlusion","dexwild","figure-03","cross-embodiment-data"],"name":"手掌相机","alt":"Palm Camera","abbr":"","aliases":["掌心相机","掌部相机"],"one_liner":"装在机器人手掌上的相机，抓取时近距离看清手和物体。","explanation":"手掌相机指嵌在机器人手掌、或手持采集设备掌心位置的小型相机，比腕部相机更靠近接触点。头部相机在手伸进柜子、被物体或手臂挡住时常看不到接触部位，手掌相机在抓取的最后几厘米仍能拍到物体。Figure AI 2025 年 10 月发布的 Figure 03 每只手都带一个广角、低延迟的掌心相机，官方说用于在主相机被挡时提供冗余的近距离视觉反馈。卡内基梅隆大学的 DexWild（RSS 2025）在人手采集设备和机器人手上装同样的手掌相机：这个视角主要拍任务和环境、很少拍到手本身，人和机器人的数据更容易放在一起训练。","example":"Figure 03 伸手进橱柜取杯子时，头部相机被柜门挡住，靠掌心相机的画面继续调整手指位置。","related":["腕部相机","头部相机","遮挡","DexWild","Figure 03","跨本体数据"]},{"id":"occlusion","category":"perception","sec":0,"tier":2,"sources":[{"title":"Occlusion Handling in Generic Object Detection: A Review (SAMI 2021)","url":"https://arxiv.org/abs/2101.08845"},{"title":"See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation（视觉易受遮挡）","url":"https://arxiv.org/abs/2212.03858"},{"title":"Vision-Based Manipulators Need to Also See from Their Hands (ICLR 2022)","url":"https://arxiv.org/abs/2203.12677"}],"as_of":"","related_ids":["multi-view","wrist-camera","active-perception","point-cloud-completion-shape-completion","visuo-tactile-fusion","object-tracking"],"name":"遮挡","alt":"Occlusion","abbr":"","aliases":["自遮挡","Self-occlusion","相互遮挡"],"one_liner":"目标被别的物体或机器人自己挡住，传感器看不全。","explanation":"遮挡指目标的一部分或全部被其他东西挡住，相机或深度传感器因此看不到。机器人场景里常见三种：物体之间互相挡（杂乱堆放的零件）、机器人自身挡住视线（机械臂伸到物体前面，或灵巧手的手指挡住掌心的物体，常称自遮挡），以及操作过程中手和物体互相挡。遮挡会让检测、分割、位姿估计和深度出现缺失或错误，被挡住的物体也可能从策略的输入里「消失」，导致误判。遮挡出现的位置、大小、比例都不固定，是检测模型离人类水平还有差距的主要原因之一。常见应对是多视角相机、腕部相机、主动移动视角（主动感知）、加入触觉或声音，或让模型对被挡部分做补全和记忆。","example":"机械臂只靠顶部相机去抓杯子，末端靠近时手臂正好挡住杯子，策略看不到杯子的位置变化；加一台腕部相机就能补上这段画面。","related":["多视角","腕部相机","主动感知","点云补全 / 形状补全","视触觉融合","目标跟踪"]},{"id":"multi-view","category":"perception","sec":0,"tier":2,"sources":[{"title":"DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset","url":"https://droid-dataset.github.io/"},{"title":"Vision-Based Manipulators Need to Also See from Their Hands (ICLR 2022)","url":"https://arxiv.org/abs/2203.12677"}],"as_of":"","related_ids":["wrist-camera","head-camera","third-person-camera","multi-view-stereo","occlusion","camera-extrinsics"],"name":"多视角","alt":"Multi-View","abbr":"","aliases":["多视图","多相机","多机位"],"one_liner":"用多台相机或多个角度同时观察同一个场景。","explanation":"多视角指从两个及以上的位置观察同一场景，可以是多台相机同时拍，也可以是一台相机边移动边拍。它主要出现在两类地方：一是三维视觉，利用多张不同角度的图做三角化、多视图立体重建或训练 NeRF；二是机器人学习，一台机器人常同时接头部相机、腕部相机（装在手腕上，近距离看夹爪和物体）和固定的第三视角相机，策略把几路画面一起当输入。好处是减少遮挡、补上单张图缺失的深度信息，研究还发现加入腕部视角能提升训练效率和对新场景的泛化；代价是标定、同步和算力开销变大，每路相机的内外参都要记录好。","example":"DROID 数据集的每台采集站配两台可调位置的 ZED 2 双目相机加一台腕部 ZED Mini，共采了 7.6 万条轨迹，覆盖 1417 个相机视角。","related":["腕部相机","头部相机","第三视角相机","多视图立体","遮挡","相机外参"]},{"id":"pinhole-camera-model","category":"perception","sec":0,"tier":2,"sources":[{"title":"Wikipedia: Pinhole camera model","url":"https://en.wikipedia.org/wiki/Pinhole_camera_model"},{"title":"Intel RealSense Wiki: Projection in RealSense SDK 2.0","url":"https://github.com/IntelRealSense/librealsense/wiki/Projection-in-RealSense-SDK-2.0"}],"as_of":"","related_ids":["camera-intrinsics","camera-extrinsics","lens-distortion","projection-back-projection","camera-calibration","camera-coordinate-frame"],"name":"针孔相机模型","alt":"Pinhole Camera Model","abbr":"","aliases":["小孔成像模型","针孔模型","透视投影模型"],"one_liner":"把相机看成一个理想小孔，三维点沿直线穿过小孔投到成像平面上的数学模型。","explanation":"针孔相机模型是计算机视觉描述「三维点如何成像为像素」的标准模型：假设所有光线都经过一个理想小孔（光心），相机坐标系下的点 (X, Y, Z) 落在图像上的位置为 u = fx·X/Z + cx、v = fy·Y/Z + cy。fx、fy 是以像素计的焦距，(cx, cy) 是主点，这四个数合称相机内参；除以 Z 就是近大远小。它忽略镜头畸变和虚焦模糊，只是一阶近似，实际使用时先标定出畸变系数把图像校正，再套用针孔模型。机器人里把深度图变成点云、把像素位置换算成三维抓取点、做手眼标定，底层都是这套公式。","example":"设一台相机 fx = fy = 600 像素、主点 (320, 240)。相机正前方 1 米、向右偏 0.1 米的点落在第 600×0.1/1 + 320 = 380 列；同一点挪到 2 米远，就落在第 350 列，更靠近图像中心。","related":["相机内参","相机外参","镜头畸变","投影与反投影","相机标定","相机坐标系"]},{"id":"camera-coordinate-frame","category":"perception","sec":0,"tier":2,"sources":[{"title":"ROS REP 103: Standard Units of Measure and Coordinate Conventions","url":"https://raw.githubusercontent.com/ros-infrastructure/rep/master/rep-0103.rst"},{"title":"MATLAB: What Is Camera Calibration?","url":"https://www.mathworks.com/help/vision/ug/camera-calibration.html"}],"as_of":"","related_ids":["coordinate-frame","camera-extrinsics","projection-back-projection","right-handed-frame-and-axis-conventions","tf-tf2-transform-tree","pinhole-camera-model"],"name":"相机坐标系","alt":"Camera Coordinate Frame","abbr":"","aliases":["相机系","Camera Frame","光学坐标系","Camera Optical Frame"],"one_liner":"以相机光心为原点、光轴为 z 轴的三维坐标系，描述物体相对相机的位置。","explanation":"相机坐标系以相机光心为原点，按计算机视觉惯例 z 轴沿光轴朝前、x 轴指向图像右侧、y 轴指向图像下方。深度图反投影得到的点云、用 PnP 求出的标签位姿，最初都表达在这个坐标系下；再乘上相机外参（相机到基座或世界的变换），才能换算到机械臂基坐标系里用。常见的坑是约定不一致：ROS 的 REP 103 规定机器人本体坐标系是 x 前、y 左、z 上，而名字带 _optical 后缀的相机光学坐标系是 z 前、x 右、y 下，两者差一个固定旋转；OpenGL 等图形库的相机又是 -z 朝前、y 朝上。混用会让点云方向整体错乱。","example":"RealSense 的 ROS 驱动同时发布 camera_link（x 朝前）和带 _optical 后缀的光学坐标系，点云消息的 frame_id 是后者，直接当成 x 朝前使用就会出错。","related":["坐标系","相机外参","投影与反投影","右手坐标系与轴向约定","TF 坐标树","针孔相机模型"]},{"id":"camera-intrinsics","category":"perception","sec":0,"tier":1,"sources":[{"title":"OpenCV calib3d.hpp：camera intrinsic matrix（fx、fy、cx、cy）","url":"https://raw.githubusercontent.com/opencv/opencv/4.x/modules/calib3d/include/opencv2/calib3d.hpp"},{"title":"RealSense SDK rs_types.h：rs2_intrinsics 结构体","url":"https://github.com/realsenseai/librealsense/blob/master/include/librealsense2/h/rs_types.h"},{"title":"Wikipedia: Camera resectioning","url":"https://en.wikipedia.org/wiki/Camera_resectioning"}],"as_of":"","related_ids":["camera-extrinsics","pinhole-camera-model","lens-distortion","projection-back-projection","camera-calibration","calibration-board"],"name":"相机内参","alt":"Camera Intrinsics","abbr":"","aliases":["内参","内参矩阵","K 矩阵","焦距与主点","Intrinsic Parameters"],"one_liner":"描述相机自身成像方式的参数，决定三维点落在图像哪个像素上。","explanation":"相机内参通常写成 3×3 矩阵 K，包含以像素为单位的焦距 fx、fy 和主点 cx、cy（光轴与成像平面的交点，一般接近图像中心），镜头畸变系数通常另外单列。它描述相机坐标系下的三维点怎样投影到像素上，只取决于相机和镜头本身，与拍什么无关，焦距不变就能一直复用。内参可以用棋盘格标定（张正友标定法）求得，RealSense 等深度相机出厂已标好，能从 SDK 直接读出。常见的坑：图像缩放或裁剪后再送进模型，内参也要按同样的比例和偏移修改，否则反投影出的点云会错位。","example":"640×480 图像，fx=fy=600、cx=320、cy=240；像素 (420, 240) 处深度 1 米，则该点在相机坐标系下 X=(420−320)×1/600≈0.17 米、Y=0、Z=1 米。","related":["相机外参","针孔相机模型","镜头畸变","投影与反投影","相机标定","标定板"]},{"id":"camera-extrinsics","category":"perception","sec":0,"tier":1,"sources":[{"title":"OpenCV calib3d.hpp：针孔相机模型与外参 R、t 的定义","url":"https://raw.githubusercontent.com/opencv/opencv/4.x/modules/calib3d/include/opencv2/calib3d.hpp"},{"title":"Wikipedia: Camera resectioning","url":"https://en.wikipedia.org/wiki/Camera_resectioning"},{"title":"DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset","url":"https://droid-dataset.github.io/"}],"as_of":"","related_ids":["camera-intrinsics","hand-eye-calibration","homogeneous-transformation-matrix","coordinate-transformation","perspective-n-point","camera-calibration"],"name":"相机外参","alt":"Camera Extrinsics","abbr":"","aliases":["外参","外参矩阵","相机位姿","Extrinsic Parameters"],"one_liner":"描述相机在空间中放在哪、朝向哪的旋转加平移参数。","explanation":"相机外参由一个 3×3 旋转矩阵 R 和一个平移向量 t 组成，常合写成 4×4 齐次变换矩阵，说明相机相对世界坐标系或机器人基坐标系的位置和朝向。OpenCV 的约定是外参把世界坐标系下的点变换到相机坐标系；不少机器人代码库存的却是反方向的「相机位姿」（相机到世界），用别人的数据前要先确认方向。外参一般用标定板配合 PnP 或手眼标定求得，相机被碰歪后就得重标。有了外参，才能把多台相机的点云拼到同一个坐标系，或把相机里看到的物体位置换算成机械臂能用的坐标。","example":"DROID 数据集用两台外部 ZED 2 相机加一台腕部 ZED Mini 采集，共覆盖 1417 个相机视角，并随数据附带每个视角的内参和外参标定结果。","related":["相机内参","手眼标定","齐次变换矩阵","坐标变换","PnP（透视n点）","相机标定"]},{"id":"projection-back-projection","category":"perception","sec":0,"tier":2,"sources":[{"title":"Intel RealSense Wiki: Projection in RealSense SDK 2.0","url":"https://github.com/IntelRealSense/librealsense/wiki/Projection-in-RealSense-SDK-2.0"},{"title":"Open3D API: open3d.geometry.PointCloud (create_from_depth_image)","url":"https://www.open3d.org/docs/release/python_api/open3d.geometry.PointCloud.html"}],"as_of":"","related_ids":["pinhole-camera-model","camera-intrinsics","depth-map","point-cloud","depth-to-color-alignment","camera-extrinsics"],"name":"投影与反投影","alt":"Projection / Back-Projection","abbr":"","aliases":["深度图转点云","反投影","Unprojection","Deprojection"],"one_liner":"投影把三维点算到图像像素上，反投影用像素加深度算回三维点。","explanation":"投影与反投影是针孔相机模型的正反两个方向。投影：已知相机坐标系下的三维点 (X, Y, Z) 和内参，算出它落在哪个像素 (u, v)。反投影：单个像素只对应一条射线，再给出该像素的深度 Z 才能还原三维点：X = (u − cx)·Z/fx，Y = (v − cy)·Z/fy。对深度图每个像素都这样算就得到点云，Open3D 和 RealSense SDK 都有现成函数。实操注意三点：深度原始值多为整数（RealSense D400 默认 1 单位 = 1 毫米），要换算成米；彩色和深度来自不同传感器时要先对齐；再乘相机外参才能转到机器人基坐标系。","example":"VLM 在彩色图上指出杯把手在像素 (412, 305)，查对齐后的深度为 0.52 米，用内参反投影得到相机坐标系下的三维点，再用手眼标定得到的外参换到机械臂基坐标系，作为抓取目标。","related":["针孔相机模型","相机内参","深度图","点云","深度与彩色对齐","相机外参"]},{"id":"lens-distortion","category":"perception","sec":0,"tier":2,"sources":[{"title":"OpenCV Tutorial: Camera Calibration","url":"https://raw.githubusercontent.com/opencv/opencv/4.x/doc/py_tutorials/py_calib3d/py_calibration/py_calibration.markdown"},{"title":"Distortion (optics) - Wikipedia","url":"https://en.wikipedia.org/wiki/Distortion_(optics)"}],"as_of":"","related_ids":["camera-calibration","camera-intrinsics","pinhole-camera-model","fisheye-camera","calibration-board","opencv"],"name":"镜头畸变","alt":"Lens Distortion","abbr":"","aliases":["径向畸变","切向畸变","去畸变"],"one_liner":"真实镜头成像偏离理想针孔模型，把直线拍弯的现象。","explanation":"针孔相机模型假设空间中的直线拍出来仍是直线，真实镜头却会让图像变形，这就是镜头畸变。径向畸变越靠画面边缘越严重，广角和鱼眼镜头常见向外鼓的桶形畸变，长焦镜头常见向内收的枕形畸变；切向畸变来自镜片没和感光面装平行。常用 Brown–Conrady 模型描述，OpenCV 用 k1、k2、k3 三个径向系数和 p1、p2 两个切向系数表示，和焦距、主点等内参一起通过棋盘格相机标定求出，再用去畸变函数把图像拉直。机器人从像素反算 3D 位置、做手眼标定或视觉 SLAM 前都要先去畸变，否则画面边缘误差会明显变大。","example":"腕部相机的广角镜头把桌子边缘拍成弧线；标定出畸变系数后调用 OpenCV 的 cv.undistort，桌边重新变直，边缘物体的像素坐标才能准确换算到机械臂坐标系。","related":["相机标定","相机内参","针孔相机模型","鱼眼相机","标定板","OpenCV"]},{"id":"field-of-view","category":"perception","sec":0,"tier":2,"sources":[{"title":"Field of view - Wikipedia","url":"https://en.wikipedia.org/wiki/Field_of_view"},{"title":"Universal Manipulation Interface (arXiv:2402.10329)","url":"https://arxiv.org/html/2402.10329"}],"as_of":"","related_ids":["pinhole-camera-model","camera-intrinsics","fisheye-camera","lens-distortion","wrist-camera","depth-camera"],"name":"视场角","alt":"Field of View","abbr":"FoV","aliases":["视野","FOV","视角","Angle of View"],"one_liner":"相机或传感器一次能看到的角度范围，常按水平、垂直、对角给出。","explanation":"视场角是相机或传感器某一时刻能覆盖的角度范围，通常分水平、垂直、对角线三种，单位是度。对普通针孔相机，它由传感器尺寸 s 和焦距 f 决定：FoV = 2·arctan(s/2f)，焦距越短，视场越宽。激光雷达、深度相机的规格书也会分别标水平和垂直视场角。在具身智能里，视场角决定相机能看到多少：腕部相机离物体很近，视场窄了就看不到周围环境，所以 UMI 给腕部 GoPro 加了 155° 鱼眼镜头；反过来，视场越宽，边缘畸变越大，每度分到的像素越少。换相机或镜头会改变图像分布，已训练的视觉策略往往要补数据。","example":"传感器宽 36 mm、焦距 18 mm 的相机，水平视场角是 2·arctan(36/36) = 90°；焦距换成 36 mm，视场角就缩到约 53°。","related":["针孔相机模型","相机内参","鱼眼相机","镜头畸变","腕部相机","深度相机"]},{"id":"fisheye-camera","category":"perception","sec":0,"tier":2,"sources":[{"title":"Fisheye lens - Wikipedia","url":"https://en.wikipedia.org/wiki/Fisheye_lens"},{"title":"Kalibr: Supported camera and distortion models","url":"https://github.com/ethz-asl/kalibr/wiki/supported-models"},{"title":"Universal Manipulation Interface (arXiv:2402.10329)","url":"https://arxiv.org/html/2402.10329"}],"as_of":"","related_ids":["field-of-view","lens-distortion","camera-calibration","universal-manipulation-interface","wrist-camera","visual-slam"],"name":"鱼眼相机","alt":"Fisheye Camera","abbr":"","aliases":["广角相机","鱼眼镜头","Fisheye Lens"],"one_liner":"装超广角鱼眼镜头的相机，视场常达 180° 左右，画面边缘明显弯曲。","explanation":"鱼眼相机用超广角镜头，视场角一般在 100°–180°，有的超过 180°。它不像普通镜头那样让直线保持笔直，而是按等距、等立体角等特定映射把大范围景物压进一张图，所以画面呈外凸的桶形畸变；「鱼眼」一词是物理学家 Robert W. Wood 在 1906 年提出的。普通针孔模型描述不了这么大的畸变，标定时要换专门模型，比如 Kalibr 支持的等距（equi）、双球（ds）、全向（omni）模型。机器人里常见两种用法：视觉 SLAM 和全景感知用它扩大视野、减少跟丢；腕部相机用它补足近距离下的环境信息，UMI 论文指出鱼眼能保留中心分辨率，同时把外围信息压缩进画面。","example":"UMI 手持夹爪在腕部 GoPro 上加装 155° 鱼眼镜头，夹爪贴近物体时，画面里仍能看到足够的周围桌面。","related":["视场角","镜头畸变","相机标定","通用操作接口","腕部相机","视觉SLAM"]},{"id":"cmos-image-sensor","category":"perception","sec":0,"tier":3,"sources":[{"title":"Active-pixel sensor - Wikipedia","url":"https://en.wikipedia.org/wiki/Active-pixel_sensor"}],"as_of":"","related_ids":["rgb-camera","global-shutter-rolling-shutter","image-signal-processor","event-camera","depth-camera","mipi-csi-2"],"name":"CMOS 图像传感器","alt":"CMOS Image Sensor","abbr":"CIS","aliases":["CMOS 传感器","有源像素传感器","Active-Pixel Sensor"],"one_liner":"相机里把光变成数字图像的芯片，每个像素自带放大电路，是当今相机的主流。","explanation":"CMOS 图像传感器是用 CMOS 工艺制造的有源像素传感器：每个像素有一个光电二极管收集光生电荷，再由几颗晶体管就地放大、读出（常见 4T 结构）。20 世纪 90 年代初，三菱电机和 NASA 喷气推进实验室（Eric Fossum 等）先后做出 CMOS 有源像素传感器；它成本低、功耗低，还能把模数转换和图像处理集成在同一芯片上，2007 年销量超过 CCD，如今占绝对主流。索尼是最大厂商。对机器人来说，它决定相机的分辨率、帧率、弱光噪声和动态范围，也决定快门类型：多数 CMOS 用卷帘快门逐行曝光，快速运动时画面会歪斜，VIO、高速抓取等场景常选全局快门型号。","example":"给机械臂选腕部相机时，看参数表里的快门类型、像素尺寸和帧率；手臂运动很快时选全局快门 CMOS，拍出的物体边缘不会被拉斜。","related":["RGB相机","全局快门 / 卷帘快门","ISP（图像信号处理器）","事件相机","深度相机","MIPI CSI-2 相机接口"]},{"id":"image-signal-processor","category":"perception","sec":0,"tier":3,"sources":[{"title":"Wikipedia: Image processor","url":"https://en.wikipedia.org/wiki/Image_processor"},{"title":"NVIDIA Jetson Linux Developer Guide: Camera Software Development Solution","url":"https://docs.nvidia.com/jetson/archives/r36.4/DeveloperGuide/SD/CameraDevelopment/CameraSoftwareDevelopmentSolution.html"}],"as_of":"","related_ids":["cmos-image-sensor","mipi-csi-2","rgb-camera","nvidia-jetson","global-shutter-rolling-shutter"],"name":"ISP（图像信号处理器）","alt":"Image Signal Processor","abbr":"ISP","aliases":["图像信号处理器","图像处理器","Image Processor"],"one_liner":"把图像传感器输出的原始数据加工成正常彩色图像的处理单元。","explanation":"ISP 是相机成像链路里的专用处理器，可以是独立芯片，更常见的是集成在手机、Jetson 等片上系统（SoC）里。CMOS 图像传感器输出的是 Bayer 格式原始数据，每个像素只记录红、绿、蓝中的一种；ISP 依次做去马赛克（插值还原全彩）、降噪、白平衡、自动曝光、伽马与色彩校正、锐化等，输出 RGB 或 YUV 图像。机器人上接 MIPI 接口的裸传感器时，要靠主控芯片的 ISP 处理并调参；USB 相机和部分自带 ISP 的相机模组则直接输出处理好的图像。自动曝光、自动白平衡会让同一场景的亮度和颜色随时间变化，影响训练数据的一致性，采集数据时常把它们手动固定。","example":"英伟达 Jetson 开发套件的 OV5693 摄像头模组本身没有 ISP，用 V4L2 直接读出的是原始 Bayer 数据；走 libargus（nvarguscamerasrc）才会经过 Jetson 内置 ISP，输出正常彩色图像。","related":["CMOS 图像传感器","MIPI CSI-2 相机接口","RGB相机","英伟达 Jetson","全局快门 / 卷帘快门"]},{"id":"global-shutter-rolling-shutter","category":"perception","sec":0,"tier":3,"sources":[{"title":"Wikipedia: Rolling shutter","url":"https://en.wikipedia.org/wiki/Rolling_shutter"}],"as_of":"","related_ids":["cmos-image-sensor","rgb-camera","visual-inertial-odometry","wrist-camera","event-camera","camera-calibration"],"name":"全局快门 / 卷帘快门","alt":"Global Shutter / Rolling Shutter","abbr":"","aliases":["全局曝光","卷帘曝光","果冻效应"],"one_liner":"相机同时曝光全部像素，还是一行一行依次曝光的两种方式","explanation":"图像传感器的两种曝光和读出方式。全局快门让所有像素在同一时刻曝光；卷帘快门从上到下逐行曝光、读出，上下行之间有时间差。许多 CMOS 相机用卷帘快门，因为结构简单、成本低、感光好。但拍快速运动的物体，或者相机自己在晃，画面就会歪斜、扭曲、抖动，这就是「果冻效应」；闪光灯下还可能只有一部分画面被照亮。对机器人来说，腕部相机跟着机械臂移动、足式机器人走路时机身抖动，卷帘快门会给 SLAM、视觉惯性里程计、相机标定带来误差，所以这类场景常选全局快门相机，或者在算法里对卷帘快门的逐行时间差建模补偿。","example":"用卷帘快门相机拍高速旋转的螺旋桨，桨叶会被拍成弯曲甚至断开的奇怪形状；换成全局快门相机就不会。","related":["CMOS 图像传感器","RGB相机","视觉惯性里程计","腕部相机","事件相机","相机标定"]},{"id":"mipi-csi-2","category":"perception","sec":0,"tier":3,"sources":[{"title":"MIPI CSI-2 Specification - MIPI Alliance","url":"https://www.mipi.org/specifications/csi-2"}],"as_of":"","related_ids":["gigabit-multimedia-serial-link","cmos-image-sensor","image-signal-processor","nvidia-jetson","embedded-system"],"name":"MIPI CSI-2 相机接口","alt":"MIPI Camera Serial Interface 2","abbr":"MIPI CSI-2","aliases":["CSI-2","MIPI 相机接口","CSI 摄像头"],"one_liner":"图像传感器和处理器之间传图像数据的高速串行接口标准。","explanation":"MIPI CSI-2 是 MIPI 联盟制定的相机串行接口规范，规定图像传感器怎样把原始像素数据高速送给处理器（SoC，片上系统）。手机摄像头几乎都用它，英伟达 Jetson、树莓派等嵌入式板也提供 CSI 接口。它延迟低、功耗小、能直连芯片内部的 ISP（图像信号处理器），但线缆只能很短，所以机器人和汽车上相机离主控较远时，常用 GMSL 等串行器把信号拉长距离传输。","example":"在 Jetson Orin 开发板上用排线接一颗 CSI 摄像头模组，图像直接进板载 ISP 处理。","related":["GMSL 相机接口","CMOS 图像传感器","ISP（图像信号处理器）","英伟达 Jetson","嵌入式系统"]},{"id":"gigabit-multimedia-serial-link","category":"perception","sec":0,"tier":3,"sources":[{"title":"Wikipedia: Gigabit Multimedia Serial Link","url":"https://en.wikipedia.org/wiki/Gigabit_Multimedia_Serial_Link"},{"title":"NVIDIA Jetson 开发者指南：Jetson Virtual Channel with GMSL Camera Framework","url":"https://docs.nvidia.com/jetson/archives/r36.4/DeveloperGuide/SD/CameraDevelopment/JetsonVirtualChannelWithGmslCameraFramework.html"}],"as_of":"2024","related_ids":["mipi-csi-2","nvidia-jetson","multi-sensor-time-synchronization","cmos-image-sensor","autonomous-driving","rgb-camera"],"name":"GMSL 相机接口","alt":"Gigabit Multimedia Serial Link","abbr":"GMSL","aliases":["GMSL2","GMSL3","千兆多媒体串行链路"],"one_liner":"用一根同轴线给相机供电并高速传图的车规级串行链路","explanation":"GMSL 是 Maxim 公司 2008 年推出的车载串行传输技术，2021 年 Maxim 被亚德诺（ADI）收购后归其所有。相机端的串行器把图像数据打包，经一根同轴线或屏蔽双绞线送到主机端的解串器，再转成 MIPI CSI-2 接入处理器；同一根线还能供电、传双向控制信号，线长可达 15 米。GMSL2 带宽 6 Gb/s，GMSL3 为 12 Gb/s。USB 相机线短、接头易松、抗干扰差；GMSL 出自汽车辅助驾驶，抗电磁干扰好，多路相机还能汇进同一个解串器，所以自动驾驶以及人形、移动机器人的多相机方案常用它接 Jetson 等主控。","example":"在 Jetson AGX Orin 上，多台 GMSL 相机经解串器接入同一个 CSI 端口，靠虚拟通道区分各路图像；英伟达文档称 AGX Orin 系列在使用 ISP 时最多支持 16 路虚拟通道。","related":["MIPI CSI-2 相机接口","英伟达 Jetson","多传感器时间同步","CMOS 图像传感器","自动驾驶","RGB相机"]},{"id":"event-camera","category":"perception","sec":0,"tier":3,"sources":[{"title":"Event-based Vision: A Survey (Gallego et al., TPAMI 2020)","url":"https://arxiv.org/abs/1904.08405"},{"title":"Wikipedia: Event camera","url":"https://en.wikipedia.org/wiki/Event_camera"},{"title":"Event-based Agile Object Catching with a Quadrupedal Robot (ICRA 2023)","url":"https://arxiv.org/abs/2303.17479"}],"as_of":"","related_ids":["rgb-camera","global-shutter-rolling-shutter","visual-odometry","optical-flow","exteroception","multi-sensor-fusion"],"name":"事件相机","alt":"Event Camera (Dynamic Vision Sensor)","abbr":"DVS","aliases":["动态视觉传感器","神经形态相机","Neuromorphic Camera","硅视网膜","Silicon Retina"],"one_liner":"每个像素只在亮度变化时独立输出「事件」、不拍整帧图像的相机。","explanation":"事件相机是一种仿生视觉传感器，又叫动态视觉传感器（DVS）或神经形态相机。普通相机按固定帧率输出整幅图像；事件相机的每个像素独立、异步工作，只有亮度变化超过阈值时才输出一个事件，内容是像素坐标、时间戳和变亮还是变暗（极性）。Gallego 等人 2020 年发表在 TPAMI 的综述总结了它的优点：时间分辨率达微秒级、动态范围约 140 dB（普通相机约 60 dB）、功耗低、几乎没有运动模糊。代价是画面静止时几乎没有输出，也没有颜色和完整亮度信息，需要专门的算法处理。它适合高速运动和明暗剧烈变化的场景，如无人机避障、高速抓取和视觉里程计。","example":"苏黎世大学与苏黎世联邦理工的研究者（ICRA 2023）给四足机器人装上事件相机接球，能接住从 4 米外以最高 15 m/s 飞来的物体，成功率 83%，算法在 Jetson Orin 上以 100 Hz 运行。","related":["RGB相机","全局快门 / 卷帘快门","视觉里程计","光流","外部感知","多传感器融合"]},{"id":"thermal-camera","category":"perception","sec":0,"tier":3,"sources":[{"title":"Thermographic camera (Wikipedia)","url":"https://en.wikipedia.org/wiki/Thermographic_camera"}],"as_of":"","related_ids":["inspection-robot","rgb-camera","multi-sensor-fusion","exteroception","special-purpose-robot"],"name":"热成像相机（红外热像仪）","alt":"Thermal (Infrared) Camera","abbr":"","aliases":["红外热像仪","热像仪","长波红外相机"],"one_liner":"拍的不是可见光，而是物体发出的红外热辐射，能看出温度分布。","explanation":"热成像相机接收物体自身发出的红外辐射（民用多为长波红外），把温度差异转成图像，常见的非制冷型用微测辐射热计（microbolometer）做传感器。因为不依赖环境光，它在全黑、烟雾、部分雾气中也能成像，而且对发热的人和动物很敏感。机器人里常用于巡检（找过热的电气设备、管道泄漏）、搜救和安防中检测人员，也有研究把它和 RGB、深度相机融合来提升夜间感知。需要注意：普通玻璃对长波红外不透明，热像仪隔着玻璃看不到后面；它的分辨率通常低于 RGB 相机，而且量出的温度受物体发射率影响。","example":"变电站巡检机器人用热成像相机扫描开关柜，发现某个接头温度明显高于周围，自动报警提示接触不良。","related":["巡检机器人","RGB相机","多传感器融合","外部感知","特种机器人"]},{"id":"3d-vision","category":"perception","sec":1,"tier":2,"sources":[{"title":"Wikipedia: 3D reconstruction","url":"https://en.wikipedia.org/wiki/3D_reconstruction"},{"title":"Wikipedia: Computer stereo vision","url":"https://en.wikipedia.org/wiki/Computer_stereo_vision"}],"as_of":"","related_ids":["point-cloud","depth-camera","stereo-camera","6d-object-pose-estimation","feed-forward-3d-reconstruction","3d-vla"],"name":"3D视觉","alt":"3D Vision","abbr":"","aliases":["三维视觉","3D 感知","三维感知"],"one_liner":"让机器从图像或传感器数据中获得物体和场景三维几何信息的技术总称。","explanation":"3D 视觉是计算机视觉里研究三维几何的分支，目标是得到深度、点云、网格、物体位姿这类「东西在哪、长什么形状」的信息。获取方式分两类：主动式自己发光测距，如结构光、飞行时间相机、激光雷达；被动式只用普通相机，如双目视差、多视角运动恢复结构，以及用神经网络从单张图估计深度。常见任务有深度估计、三维重建、点云分割与配准、6D 位姿估计、3D 目标检测。机器人伸手、避障、放东西都要精确距离，纯二维图像给不了，所以抓取规划、3D 扩散策略、3D VLA 都依赖它；DUSt3R、VGGT 等前馈重建模型让它更易用。","example":"机械臂抓杯子前，深度相机把画面转成点云，算法在点云里分割出杯子、估计杯把的位置和朝向，再换算成夹爪要到达的三维坐标。","related":["点云","深度相机","双目相机","6D位姿估计","前馈式三维重建","3D VLA"]},{"id":"depth-map","category":"perception","sec":1,"tier":1,"sources":[{"title":"Wikipedia: Depth map","url":"https://en.wikipedia.org/wiki/Depth_map"},{"title":"RealSense SDK 文档：Depth from Stereo（视差转深度与深度单位）","url":"https://github.com/realsenseai/librealsense/blob/master/doc/depth-from-stereo.md"}],"as_of":"","related_ids":["depth-camera","point-cloud","projection-back-projection","depth-holes","monocular-depth-estimation","depth-to-color-alignment"],"name":"深度图","alt":"Depth Map","abbr":"","aliases":["深度图像","Depth Image","距离图像","Range Image"],"one_liner":"每个像素存的不是颜色，而是该点离相机有多远的图像。","explanation":"深度图是单通道图像，每个像素值表示对应场景点到相机的距离，一般指沿相机光轴（Z 轴）方向的距离，而不是到镜头的直线距离。它可以由深度相机直接测出，也可以用 Depth Anything 这类单目深度估计模型从普通彩色图预测，后者有的只给相对远近，有的能给出以米为单位的度量深度。实际存储常用 16 位整数，乘以深度单位才得到米。深度图配合相机内参可以逐像素反投影成点云。常见问题有测不到的空洞（值为 0）、物体边缘的飞点，以及深度图和彩色图视角不一致，需要先对齐再一起用。","example":"若深度单位是 1 毫米，深度图里某像素值为 850，就表示该点沿光轴离相机 0.85 米；值为 0 通常表示这里没测到。","related":["深度相机","点云","投影与反投影","深度空洞","单目深度估计","深度与彩色对齐"]},{"id":"point-cloud","category":"perception","sec":1,"tier":1,"sources":[{"title":"Wikipedia: Point cloud","url":"https://en.wikipedia.org/wiki/Point_cloud"},{"title":"PCL 文档：The PCD (Point Cloud Data) file format","url":"https://pointclouds.org/documentation/tutorials/pcd_file_format.html"},{"title":"3D Diffusion Policy 项目页","url":"https://3d-diffusion-policy.github.io/"}],"as_of":"","related_ids":["depth-map","point-cloud-encoder","farthest-point-sampling","iterative-closest-point","pointnet-pointnet-plus-plus","3d-diffusion-policy"],"name":"点云","alt":"Point Cloud","abbr":"","aliases":["3D 点云","PCD","三维点云"],"one_liner":"由大量三维坐标点组成、用来表示物体或场景形状的数据。","explanation":"点云是三维空间中一组离散点的集合，每个点有 X、Y、Z 坐标，还可以附带颜色、法向量、时间戳等信息。它通常来自激光雷达、深度相机（深度图配合内参反投影）或多视角三维重建。点云无序、稀疏、点数不固定，不能直接套用处理图片的卷积网络，于是有了 PointNet 等专门的点云网络。常见处理包括体素降采样或最远点采样（减少点数）、用 ICP（迭代最近点）把两片点云对齐（配准）、分割出目标物体；开源库 PCL 定义了常用的 PCD 文件格式。具身智能里，3D 扩散策略（DP3）以单视角点云作为策略输入，AnyGrasp 等抓取检测方法也直接在点云上预测抓取位姿。","example":"一张 640×480 的深度图最多能反投影出 30 多万个点，做 3D 策略时通常先裁掉桌面以外的区域，再用最远点采样降到几百到几千个点送进编码器。","related":["深度图","点云编码器","最远点采样","迭代最近点","PointNet","3D 扩散策略"]},{"id":"depth-camera","category":"perception","sec":1,"tier":1,"sources":[{"title":"Wikipedia: Range imaging（深度相机的几类原理）","url":"https://en.wikipedia.org/wiki/Range_imaging"},{"title":"RealSense 白皮书：Projectors for D400 series（主动双目与红外投射器）","url":"https://dev.realsenseai.com/docs/projectors"},{"title":"RealSense D435i 产品页","url":"https://www.realsenseai.com/stereo-depth-cameras/depth-camera-d435i/"}],"as_of":"","related_ids":["depth-map","active-stereo","structured-light","time-of-flight","point-cloud","realsense-depth-camera"],"name":"深度相机","alt":"Depth Camera (RGB-D Camera)","abbr":"RGB-D","aliases":["RGB-D 相机","RGBD 相机","3D 相机","距离相机","Range Camera"],"one_liner":"除了彩色图像，还能给出每个像素到相机距离的相机。","explanation":"深度相机也叫 RGB-D 相机，在普通彩色图（RGB）之外同时输出一张深度图（D）。主流测距原理有三类：双目立体，用两颗镜头看同一点的视差按三角关系算距离，常加红外投射器往场景打随机纹理，帮白墙这类无纹理表面完成匹配，叫主动双目；结构光，投射已知图案，根据图案变形算深度；飞行时间（ToF），测光发出到返回的时间。它比激光雷达便宜、体积小，近距离精度高，但距离越远误差越大，透明和镜面物体容易测不准。机器人上常装在头部或手腕，用来生成点云、做抓取和避障，常见品牌有 RealSense、奥比中光、ZED 等。","example":"RealSense D435i 属于主动双目方案，官方标称理想工作距离 0.3–3 米、2 米处误差小于 2%，在桌面操作和移动机器人研究里很常用。","related":["深度图","主动双目","结构光","飞行时间法","点云","RealSense 深度相机（D435i / D405）"]},{"id":"stereo-camera","category":"perception","sec":1,"tier":1,"sources":[{"title":"Wikipedia: Computer stereo vision","url":"https://en.wikipedia.org/wiki/Computer_stereo_vision"},{"title":"Stereolabs ZED 2i product page","url":"https://www.stereolabs.com/products/zed-2"}],"as_of":"","related_ids":["disparity","stereo-matching","stereo-baseline","active-stereo","depth-camera","foundationstereo"],"name":"双目相机","alt":"Stereo Camera","abbr":"","aliases":["双目视觉","立体相机","Stereo Vision","被动双目","双目深度相机"],"one_liner":"两个并排的相机同时拍照，靠左右图像的差异算出每个点的距离。","explanation":"双目相机把两个相机隔开固定距离（基线）并排安装，模仿人的双眼。同一物点在左右图中的水平位置差叫视差；经过标定和极线校正，用立体匹配找出对应点，就能按 Z = f·B / d 算深度（f 为焦距，B 为基线，d 为视差）：视差越大越近，基线越长远处越准。只靠环境光的叫被动双目，在白墙、光滑桌面这类缺少纹理的区域容易匹配失败，所以 RealSense D435、D455 这类主动双目会额外投射红外散斑。近年也有用深度网络做匹配的，如 FoundationStereo。它常作为机器人头部或腕部的深度传感器。","example":"焦距 700 像素、基线 0.12 米的双目相机看到某点视差为 42 像素，则深度 Z = 700 × 0.12 ÷ 42 = 2 米。Stereolabs ZED 2i 的基线就是 120 mm。","related":["视差","立体匹配","基线","主动双目","深度相机","FoundationStereo"]},{"id":"disparity","category":"perception","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Computer stereo vision","url":"https://en.wikipedia.org/wiki/Computer_stereo_vision"}],"as_of":"","related_ids":["stereo-camera","stereo-matching","stereo-baseline","depth-map","epipolar-geometry","foundationstereo"],"name":"视差","alt":"Disparity","abbr":"","aliases":["视差图","Disparity Map","双目视差"],"one_liner":"同一个点在左右两张图里的横向位置差，物体越近视差越大。","explanation":"视差是双目立体视觉的基本量：两台相机并排摆放，图像经过校正（让同一点落在同一行）后，空间中同一点在左图的横坐标 xL 与右图横坐标 xR 之差 d = xL − xR 就是视差。视差与深度成反比：深度 Z = f × B / d，f 是以像素计的焦距，B 是两相机之间的基线长度。逐像素算出视差就得到视差图，再按公式换算即为深度图。求视差的过程叫立体匹配，传统方法有 OpenCV 的 StereoBM、SGBM，近年有 RAFT-Stereo、FoundationStereo 等深度学习方法。由于反比关系，远处物体的视差只有几个甚至不到一个像素，匹配差一点深度就差很多，所以双目测距精度随距离迅速下降，加长基线能改善远处精度。","example":"设焦距 f = 640 像素、基线 B = 5 厘米，某点视差为 16 像素，则深度 Z = 640 × 0.05 / 16 = 2 米；若视差量错 1 个像素变成 15，算出的深度就成了约 2.13 米。","related":["双目相机","立体匹配","基线","深度图","对极几何","FoundationStereo"]},{"id":"stereo-baseline","category":"perception","sec":1,"tier":3,"sources":[{"title":"Depth Map from Stereo Images - OpenCV","url":"https://docs.opencv.org/4.x/dd/d53/tutorial_py_depthmap.html"}],"as_of":"","related_ids":["stereo-camera","disparity","stereo-matching","triangulation","camera-extrinsics","depth-camera"],"name":"基线","alt":"Stereo Baseline","abbr":"","aliases":["双目基线"],"one_liner":"双目相机两个镜头光心之间的距离，决定能测多远、测多准。","explanation":"基线是双目相机左右两个相机光心的距离。双目测深的公式是深度 = 焦距 × 基线 / 视差（视差是同一点在左右图像中的横向像素差）。基线越长，同一深度下视差越大，远处测得越准，但近处盲区变大、左右图像重叠区域变小；基线短则适合近距离。所以选相机时要按工作距离挑基线：腕部相机多用短基线，移动机器人看远处用长基线。深度误差大致随距离平方增长、与基线成反比。结构光和主动双目相机里，投影器与相机之间的距离也起类似作用。","example":"ZED 2i 的基线约 12 cm，适合看几米到十几米的场景；腕部用的 RealSense D405 基线很短，适合几十厘米内的近距离。","related":["双目相机","视差","立体匹配","三角化","相机外参","深度相机"]},{"id":"stereo-matching","category":"perception","sec":1,"tier":3,"sources":[{"title":"Middlebury Stereo Vision Page","url":"https://vision.middlebury.edu/stereo/"}],"as_of":"","related_ids":["disparity","stereo-baseline","stereo-camera","epipolar-geometry","foundationstereo","depth-estimation"],"name":"立体匹配","alt":"Stereo Matching","abbr":"","aliases":["双目匹配","双目深度估计"],"one_liner":"在左右两张图里找同一点的对应位置，算出视差再换成深度。","explanation":"立体匹配是双目测深的核心步骤：先把左右图像校正到同一水平线上（极线校正），然后对左图每个像素在右图同一行上找最像的点，二者横向距离就是视差，再按深度 = 焦距 × 基线 / 视差换成深度。传统方法有块匹配和半全局匹配（SGM）；深度学习方法用神经网络构建代价体或迭代更新（如 RAFT-Stereo），近年的 FoundationStereo 等模型能零样本泛化到新场景。难点在无纹理区域、反光和透明表面、遮挡边界。它决定了双目相机深度图的质量，也是机器人抓取透明物体时常被改进的环节。","example":"把 ZED 或 RealSense 的左右红外图输入 FoundationStereo，得到比相机自带算法更完整的深度图。","related":["视差","基线","双目相机","对极几何","FoundationStereo","深度估计"]},{"id":"active-stereo","category":"perception","sec":1,"tier":3,"sources":[{"title":"Intel RealSense Stereoscopic Depth Cameras (Keselman et al., arXiv:1705.05548)","url":"https://arxiv.org/abs/1705.05548"},{"title":"Orbbec Gemini 335 产品页","url":"https://www.orbbec.com/products/stereo-vision-camera/gemini-335/"}],"as_of":"","related_ids":["stereo-camera","structured-light","speckle-structured-light","depth-camera","stereo-matching","realsense-depth-camera"],"name":"主动双目","alt":"Active Stereo (IR-Projected Stereo)","abbr":"","aliases":["红外主动立体","主动立体视觉","投射纹理双目","Projected Texture Stereo"],"one_liner":"双目相机加一个红外投射器打出散斑纹理，帮左右图像匹配算出深度。","explanation":"主动双目是一种深度相机方案：两颗红外相机像普通双目一样按视差三角测距，同时由红外投射器往场景打出随机点状图案。普通（被动）双目靠两张图里的纹理做匹配，白墙、纯色桌面这类无纹理表面会匹配失败，出现深度空洞；投射的散斑给这些表面人为加上纹理，让匹配不再有歧义。英特尔 RealSense 的 R200、D400 系列走的就是这条路线，其技术论文指出投射图案不需要事先知道结构，只要纹理稠密、在匹配方向上不重复即可，这是它和要解码已知图案的结构光的区别。由于相机也能利用阳光照亮的自然纹理，这类相机在室外仍可工作。奥比中光 Gemini 330 系列也宣传主动加被动双目结合。","example":"RealSense D435 这类相机拍纯白桌面时，打开红外投射器后桌面上布满散斑，深度图不再是大片空洞。","related":["双目相机","结构光","散斑结构光","深度相机","立体匹配","RealSense 深度相机（D435i / D405）"]},{"id":"realsense-depth-camera","category":"perception","sec":1,"tier":1,"sources":[{"title":"PR Newswire: Cognex to Acquire RealSense（2026-09-22）","url":"https://www.prnewswire.com/news-releases/cognex-to-acquire-realsense-expanding-machine-vision-leadership-into-high-growth-robotic-perception-market-302885738.html"},{"title":"RealSense completes spin-out from Intel, raises $50 million","url":"https://www.realsenseai.com/cn/news-insights/news/realsense-completes-spin-out-from-intel-raises-50-million-to-accelerate-ai-powered-vision-for-robotics-and-biometrics/"},{"title":"RealSense D435i 产品页","url":"https://www.realsenseai.com/stereo-depth-cameras/depth-camera-d435i/"}],"as_of":"2026-09","related_ids":["depth-camera","active-stereo","inertial-measurement-unit","intel-realsense-sdk-2-0","orbbec-gemini-330-series","wrist-camera"],"name":"RealSense 深度相机（D435i / D405）","alt":"RealSense Depth Camera (D435i / D405)","abbr":"","aliases":["英特尔实感","Intel RealSense","英特尔 RealSense","RealSense","RealSense, Inc.","D435","D435i","D455","D405","D555"],"one_liner":"原英特尔旗下的双目深度相机系列，机器人研究和产品里很常用。","explanation":"RealSense 起源于英特尔 2014 年的 3D 相机项目，D400 系列用双目加板载芯片直接算出深度图。2025 年 7 月 11 日从英特尔分拆为独立公司，完成 5000 万美元 A 轮融资；2026 年 9 月 22 日，机器视觉公司康耐视（Cognex）宣布以约 5 亿美元现金收购它，预计当年第四季度完成交割。具身圈最常见两款：D435i 是带红外投射器和 IMU 的主动双目相机，理想距离 0.3–3 米，常装在头部或当第三视角；D405 专为 7–50 厘米近距离设计，常装在手腕上。开源的 RealSense SDK 提供驱动、深度滤波和 ROS 2 接口。","example":"ALOHA 2 双臂平台把初代用的消费级网络摄像头换成了 RealSense D405，理由是视场更大、带深度、全局快门，体积也更小。","related":["深度相机","主动双目","惯性测量单元","RealSense SDK","奥比中光 Gemini 330 系列","腕部相机"]},{"id":"orbbec-gemini-330-series","category":"perception","sec":1,"tier":2,"sources":[{"title":"Orbbec Unveils Gemini 330 Series of Stereo Vision 3D Cameras（2024-04-30）","url":"https://www.orbbec.com/news/orbbec-unveils-gemini-330-series-of-stereo-vision-3d-cameras-powered-by-latest-asic-for-outdoor-and-indoor-performance/"},{"title":"Orbbec Gemini 335 产品页","url":"https://www.orbbec.com/products/stereo-vision-camera/gemini-335/"},{"title":"Orbbec Gemini 335L 产品页","url":"https://www.orbbec.com/products/stereo-vision-camera/gemini-335l/"}],"as_of":"2026-03","related_ids":["depth-camera","active-stereo","stereo-camera","realsense-depth-camera","orbbec","inertial-measurement-unit"],"name":"奥比中光 Gemini 330 系列","alt":"Orbbec Gemini 330 Series (Gemini 335 / 335L / 336)","abbr":"","aliases":["奥比中光 Gemini 335","Gemini 335L","Gemini 336","Gemini 336L","Gemini 335Lg"],"one_liner":"奥比中光的双目立体深度相机系列，室内外都能用，常装在机器人上。","explanation":"Gemini 330 系列是奥比中光（Orbbec）2024 年 4 月 30 日发布的双目立体深度相机，首批为 Gemini 335 和 335L，后续又有 336、336L 以及 GMSL2 接口的 335Lg。它采用主动加被动的混合双目：既能靠环境光做被动匹配，也能用红外投射给弱纹理表面补纹理；深度由自研 MX6800 芯片在相机内算好，USB 一根线供电和传数据，内置 IMU，支持硬件触发同步。335 基线 50 毫米，最佳范围 0.26–3 米；335L 基线 95 毫米，最佳范围 0.25–6 米，IP65 防护；336 加了只透红外的滤光片，适合强光和反光场景。2024 年 6 月接入英伟达 Isaac Perceptor，据奥比中光 2026 年 3 月新闻，荣耀首款人形机器人也用了该系列相机。","example":"奥比中光配合英伟达 Isaac Perceptor 的开发套件用 4 台 Gemini 335L 硬件同步，拼出 AMR（自主移动机器人）的 360 度环视深度感知。","related":["深度相机","主动双目","双目相机","RealSense 深度相机（D435i / D405）","奥比中光","惯性测量单元"]},{"id":"stereolabs-zed","category":"perception","sec":1,"tier":3,"sources":[{"title":"ZED 2i | Stereo Camera | Stereolabs","url":"https://www.stereolabs.com/store/products/zed-2i"},{"title":"ZED X - AI Stereo Camera for Robotics | Stereolabs","url":"https://www.stereolabs.com/products/zed-x"}],"as_of":"2026-09","related_ids":["stereo-camera","stereolabs","stereo-baseline","stereo-matching","gigabit-multimedia-serial-link","realsense-depth-camera"],"name":"ZED 双目相机","alt":"Stereolabs ZED Stereo Camera (ZED 2i / ZED X)","abbr":"","aliases":["ZED 2i","ZED X","ZED Mini"],"one_liner":"法国 Stereolabs 出的被动双目深度相机系列，常见于移动机器人和数据采集。","explanation":"ZED 是 Stereolabs 公司的双目相机产品线，靠两个 RGB 镜头做立体匹配测深，不主动投光，因此在室外阳光下也能工作，量程比结构光相机远。ZED 2i 基线 12 cm、USB 连接、内置 IMU、气压计和磁力计，IP66 防护；ZED X 面向机器人，采用全局快门和 GMSL2 接口（车规级相机串行链路，适合接 Jetson），IP67 防护；ZED Mini 基线更短，适合近距离。配套 ZED SDK 提供深度图、点云、视觉惯性定位、目标检测，并有 ROS 2 驱动。具身智能里常用作头部或第三视角相机，也用于遥操作和移动机器人建图。","example":"在轮式人形机器人头部装一台 ZED X，接 Jetson Orin 输出点云给导航和抓取模块。","related":["双目相机","Stereolabs","基线","立体匹配","GMSL 相机接口","RealSense 深度相机（D435i / D405）"]},{"id":"luxonis-oak-d","category":"perception","sec":1,"tier":3,"sources":[{"title":"Luxonis Docs: OAK-D","url":"https://docs.luxonis.com/hardware/products/OAK-D"},{"title":"Luxonis Docs: RVC4 平台（OAK 4 系列）","url":"https://docs.luxonis.com/hardware/platform/rvc/rvc4"},{"title":"GitHub: luxonis/depthai-core","url":"https://github.com/luxonis/depthai-core"}],"as_of":"2026-09","related_ids":["depth-camera","stereo-camera","realsense-depth-camera","orbbec-gemini-330-series","stereolabs-zed","on-device-edge-deployment"],"name":"Luxonis OAK-D 相机","alt":"Luxonis OAK-D / OAK 4 (DepthAI)","abbr":"","aliases":["OAK-D","OAK 4 D","OpenCV AI Kit","DepthAI 相机"],"one_liner":"Luxonis 出的自带 AI 芯片的双目深度相机，神经网络可直接在相机里跑。","explanation":"OAK 是 Luxonis 公司的相机产品线，OAK-D 是最常见的一款：两颗全局快门黑白相机做双目测深（基线 7.5 厘米，官方给的理想测距约 0.8–12 米），中间一颗彩色相机，内置 9 轴 IMU，经 USB 接电脑。它的特点是相机里自带计算芯片（RVC2 平台，官方标 4 TOPS，其中 1.4 TOPS 用于 AI），深度计算和目标检测等神经网络可以在相机端算完，只把结果传给主机，适合算力紧张的小机器人。新一代 OAK 4 系列换成高通 QCS8550 芯片（RVC4 平台，48 INT8 TOPS），带 6 核 ARM CPU 跑 Linux，可以脱离主机独立运行。配套开源库叫 DepthAI（C++ 编写，带 Python 绑定，MIT 协议），另有官方 ROS 驱动 depthai-ros。","example":"在低成本移动机器人上装一台 OAK-D，用官方 ROS 驱动把彩色图和深度图发到 ROS 话题，同时在相机端跑目标检测网络，主机只接收检测结果，省下主控算力。","related":["深度相机","双目相机","RealSense 深度相机（D435i / D405）","奥比中光 Gemini 330 系列","ZED 双目相机","端侧部署"]},{"id":"structured-light","category":"perception","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Structured-light 3D scanner","url":"https://en.wikipedia.org/wiki/Structured-light_3D_scanner"},{"title":"Wikipedia: Kinect（初代结构光与 Xbox One 版 ToF）","url":"https://en.wikipedia.org/wiki/Kinect"}],"as_of":"","related_ids":["speckle-structured-light","active-stereo","time-of-flight","depth-camera","triangulation","transparent-and-reflective-object-perception"],"name":"结构光","alt":"Structured Light","abbr":"","aliases":["结构光相机","编码结构光","结构光三维扫描"],"one_liner":"向物体投射已知图案，根据图案的变形算出深度的测距方法。","explanation":"结构光是一种主动三维测量方法：投影器向场景打出已知图案（条纹、编码图案或红外点阵），相机从另一角度拍摄；表面起伏让图案变形错位，结合已知的投影器与相机相对位置，按三角测量逐点算出深度。它不依赖物体纹理，白墙也能测，近距离精度高。代表有 2010 年的初代 Kinect（投射近红外点阵）和 iPhone 的 Face ID（投射 3 万多个红外点）。反光、透明表面会让图案丢失，强日光下投射图案对比度下降，所以多用于室内中近距离。主动双目也投散斑，但深度靠两台相机做立体匹配算出，这是两者的区别。","example":"初代 Kinect 把一片近红外点阵投到客厅里，红外相机拍到点阵随人体和家具发生的偏移，据此算出每个像素的深度，生成深度图用于体感游戏。","related":["散斑结构光","主动双目","飞行时间法","深度相机","三角化","透明/反光物体感知"]},{"id":"speckle-structured-light","category":"perception","sec":1,"tier":3,"sources":[{"title":"Structured-light 3D scanner - Wikipedia","url":"https://en.wikipedia.org/wiki/Structured-light_3D_scanner"}],"as_of":"","related_ids":["structured-light","active-stereo","depth-camera","triangulation","time-of-flight"],"name":"散斑结构光","alt":"Speckle Structured Light","abbr":"","aliases":["激光散斑","Speckle Projection"],"one_liner":"向场景投射随机红外光斑，靠光斑变形或匹配来算深度。","explanation":"散斑结构光是结构光的一种：用红外激光经衍射元件投射出一片伪随机的光斑图案，相机拍下光斑在物体表面的位置，与预先标定的参考图案比对，按三角测量原理算出每个点的深度。因为每一小块光斑图案都是独特的，所以只需一帧就能做匹配，适合动态场景。第一代 Kinect（PrimeSense 方案）和很多手机人脸识别模组都用这种方式。主动双目相机（如 RealSense D400）也投散斑，但作用是给无纹理表面「加纹理」，深度仍靠双目匹配。缺点是室外强光下光斑容易被淹没，远距离精度下降。","example":"第一代 Microsoft Kinect 用红外散斑投射 + 单个红外相机输出深度图。","related":["结构光","主动双目","深度相机","三角化","飞行时间法"]},{"id":"laser-triangulation","category":"perception","sec":1,"tier":3,"sources":[{"title":"Wikipedia: 3D scanning（Triangulation 一节）","url":"https://en.wikipedia.org/wiki/3D_scanning"},{"title":"KEYENCE LJ-X8000 2D/3D Laser Profiler","url":"https://www.keyence.com/products/measure/laser-2d/lj-x8000/"},{"title":"Micro-Epsilon scanCONTROL Laser Profile Scanners","url":"https://www.micro-epsilon.com/2d-3d-measurement/laser-profile-scanners"}],"as_of":"2026-09","related_ids":["structured-light","triangulation","machine-vision","3d-vision-guided-robotics","point-cloud","time-of-flight"],"name":"激光三角测量（线激光轮廓扫描）","alt":"Laser Triangulation / Line-Laser Profiler","abbr":"","aliases":["三角测距","线激光轮廓仪","激光轮廓扫描仪","线激光传感器","Laser Profiler"],"one_liner":"激光打点或打线，相机从侧面看光斑位置，按三角几何算出距离和轮廓。","explanation":"激光三角测量是一种主动光学测距方法：激光器向物体投一个点或一条线，与激光器隔开一段已知距离的相机从另一个角度拍到光斑，激光器、相机和光斑构成三角形，由光斑在图像中的位置就能算出距离。把点换成一条线就是线激光轮廓扫描，一次得到整条截面轮廓；物体在传送带上移动，或传感器随机械臂扫过，就能拼成三维点云。它精度高，可达数十微米量级，但量程一般只有几米以内，且怕遮挡和高反光表面。工业上用于尺寸测量、缺陷检测和焊缝跟踪，是机器视觉和 3D 视觉引导的常见方案；结构光相机也基于同样的三角原理。","example":"焊接机器人在焊枪前装一台线激光轮廓扫描仪（如 Micro-Epsilon scanCONTROL 8x00，每条轮廓 4224 个点、轮廓频率 10 kHz），实时测出焊缝截面位置，引导机械臂沿焊缝修正轨迹。","related":["结构光","三角化","机器视觉（工业视觉）","3D 视觉引导","点云","飞行时间法"]},{"id":"time-of-flight","category":"perception","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Time-of-flight camera","url":"https://en.wikipedia.org/wiki/Time-of-flight_camera"},{"title":"Azure Kinect DK depth camera（Microsoft Learn）","url":"https://learn.microsoft.com/en-us/previous-versions/azure/kinect-dk/depth-camera"}],"as_of":"","related_ids":["direct-time-of-flight","indirect-time-of-flight","lidar","structured-light","flying-pixels","depth-camera"],"name":"飞行时间法","alt":"Time of Flight","abbr":"ToF","aliases":["ToF 相机","TOF 深度相机","飞行时间相机"],"one_liner":"测量光从发出到被物体反射回来所用的时间，换算成距离。","explanation":"飞行时间法靠测光的往返时间测距：距离等于光速乘往返时间再除以 2。ToF 相机自带近红外光源，每个像素各测一个距离，直接输出深度图。直接飞行时间（dToF）发短脉冲直接计时，激光雷达多用它；间接飞行时间（iToF）发调制光、测回波相位差再换算，Kinect for Xbox One 和 Azure Kinect 属于这类。它不依赖物体纹理，模组紧凑；常见问题是多路径干扰（光在墙角多次反射使测距偏大）、物体边缘的飞点，以及强日光或深色表面导致回波太弱。机器人上常用于近距离避障和桌面深度感知。","example":"Azure Kinect 用调幅连续波 iToF：发出调制的近红外光，按回波相位算深度；拍墙角时光在两面墙之间来回反射，这些像素会被判为无效，深度值记为 0。","related":["直接飞行时间","间接飞行时间","激光雷达","结构光","飞点","深度相机"]},{"id":"direct-time-of-flight","category":"perception","sec":1,"tier":3,"sources":[{"title":"Sony Semiconductor Solutions: ToF image sensors (dToF vs iToF)","url":"https://www.sony-semicon.com/en/technology/industry/tof.html"},{"title":"Wikipedia: Time-of-flight camera","url":"https://en.wikipedia.org/wiki/Time-of-flight_camera"},{"title":"Apple Newsroom: Apple unveils new iPad Pro with LiDAR Scanner (2020-03)","url":"https://www.apple.com/newsroom/2020/03/apple-unveils-new-ipad-pro-with-lidar-scanner-and-trackpad-support-in-ipados/"}],"as_of":"","related_ids":["time-of-flight","indirect-time-of-flight","single-photon-avalanche-diode","lidar","depth-camera","vertical-cavity-surface-emitting-laser"],"name":"直接飞行时间","alt":"Direct Time of Flight","abbr":"dToF","aliases":["dTOF","直接 ToF","脉冲式 ToF"],"one_liner":"发出光脉冲并直接计时回波，用往返时间算距离的深度测量方式。","explanation":"直接飞行时间是飞行时间法（ToF）的一种：传感器发出极短的激光脉冲，直接测量光打到物体再反射回来的时间 t，距离等于光速乘 t 再除以 2。目标在 1 米外时光往返只需约 6.7 纳秒，因此需要能分辨极短时间的电路：现在常用单光子雪崩二极管（SPAD，单个光子就能触发信号）做像素，配合时间数字转换器对大量脉冲计时并统计成直方图，取峰值作为回波时间。和间接飞行时间（iToF，比较调制光的相位差来算距离）相比，dToF 测得更远、更抗环境光，室内外都能用，是很多激光雷达的测距原理；代价是像素电路更复杂，分辨率通常不如 iToF 高。","example":"苹果 2020 款 iPad Pro 的 LiDAR 扫描仪可测 5 米内的距离、室内外都能用，官方称其在光子级别、纳秒速度下工作；据报道它采用的就是 SPAD 接收的 dToF 方案。","related":["飞行时间法","间接飞行时间","SPAD（单光子雪崩二极管）","激光雷达","深度相机","VCSEL（垂直腔面发射激光器）"]},{"id":"indirect-time-of-flight","category":"perception","sec":1,"tier":3,"sources":[{"title":"Wikipedia: Time-of-flight camera","url":"https://en.wikipedia.org/wiki/Time-of-flight_camera"},{"title":"Orbbec Femto Bolt 产品页","url":"https://www.orbbec.com/products/tof-camera/femto-bolt/"}],"as_of":"","related_ids":["time-of-flight","direct-time-of-flight","depth-camera","flying-pixels","orbbec-femto-bolt","azure-kinect-dk"],"name":"间接飞行时间","alt":"Indirect Time of Flight","abbr":"iToF","aliases":["iTOF","相位式 ToF","连续波 ToF","CW-ToF","AMCW ToF"],"one_liner":"发射调制光、通过测回波相位差来算距离的深度测量方式。","explanation":"间接飞行时间（iToF）是飞行时间法的一种：光源发出按一定频率调制的连续红外光，传感器每个像素测出回波相对发射信号的相位差，由相位换算往返时间，再得到距离。与直接测光脉冲往返时间的 dToF 相比，iToF 像素结构简单，容易做到高分辨率深度图，近距离精度好，常用在深度相机和手机上。它有几个局限：相位每过 2π 就重复，超过无模糊距离（c/2f，f 为调制频率）的物体会被算成近处，要用多个调制频率组合来解缠；强日光会淹没调制信号，户外效果差；光在多个表面间来回反射的多径干扰，以及物体边缘前后景混在同一像素产生的飞点，都会引入误差。","example":"微软 Azure Kinect 和奥比中光 Femto Bolt 都用微软的 iToF 深度方案：100 万像素深度传感器，宽视场模式最高 1024×1024@15fps，工作距离随模式约 0.25–5.46 m。","related":["飞行时间法","直接飞行时间","深度相机","飞点","奥比中光 Femto Bolt","Azure Kinect 深度相机"]},{"id":"azure-kinect-dk","category":"perception","sec":1,"tier":3,"sources":[{"title":"Microsoft ending production of Azure Kinect Developer Kit - The Robot Report","url":"https://www.therobotreport.com/microsoft-ending-production-of-azure-kinect-developer-kit/"},{"title":"Femto Bolt Comparison with Azure Kinect DK - Orbbec","url":"https://www.orbbec.com/documentation/comparison-with-azure-kinect-dk/"},{"title":"Azure Kinect - Wikipedia","url":"https://en.wikipedia.org/wiki/Azure_Kinect"}],"as_of":"2026-09","related_ids":["depth-camera","indirect-time-of-flight","orbbec-femto-bolt","human-pose-estimation","microphone-array","inertial-measurement-unit"],"name":"Azure Kinect 深度相机","alt":"Microsoft Azure Kinect DK","abbr":"","aliases":["Kinect","微软 Kinect","Azure Kinect DK"],"one_liner":"微软推出的开发者版 RGB-D 相机，集成深度、彩色、麦克风阵列和 IMU。","explanation":"Azure Kinect DK 是微软 2019 年推出的开发者套件，把 ToF（飞行时间，靠测光的往返时间算距离）深度相机、高分辨率彩色相机、7 麦克风阵列和 IMU（惯性测量单元）装在一个盒子里，并配有传感器 SDK 和人体追踪 SDK。它深度质量好、带骨架追踪，曾被很多机器人和人体动作研究用作标准 RGB-D 传感器。微软于 2023 年 8 月宣布停产；奥比中光的 Femto Bolt 沿用同一套 iToF 深度技术并兼容其 SDK 接口，被官方指为替代品。","example":"用 Azure Kinect 的人体追踪 SDK 实时拿到人体骨架关节点，做人机交互里的姿态识别。","related":["深度相机","间接飞行时间","奥比中光 Femto Bolt","人体姿态估计","麦克风阵列","惯性测量单元"]},{"id":"orbbec-femto-bolt","category":"perception","sec":1,"tier":3,"sources":[{"title":"Orbbec Femto Bolt 产品页","url":"https://www.orbbec.com/products/tof-camera/femto-bolt/"},{"title":"orbbec/OrbbecSDK-K4A-Wrapper (GitHub)","url":"https://github.com/orbbec/OrbbecSDK-K4A-Wrapper"}],"as_of":"2026-09","related_ids":["azure-kinect-dk","indirect-time-of-flight","depth-camera","orbbec","orbbec-gemini-330-series","third-person-camera"],"name":"奥比中光 Femto Bolt","alt":"Orbbec Femto Bolt (iToF RGB-D Camera)","abbr":"","aliases":["Femto Bolt"],"one_liner":"奥比中光的间接飞行时间 RGB-D 相机，可接替微软 Azure Kinect。","explanation":"Femto Bolt 是奥比中光（Orbbec）的 RGB-D 深度相机，采用微软的间接飞行时间（iToF，靠发射红外光与回波的相位差算距离）技术。官网称其深度工作模式和性能与微软 Azure Kinect DK 一致，并提供 K4A 兼容封装 SDK，为 Azure Kinect 写的程序基本不用改。深度有窄视场 640×576@30fps、宽视场最高 1024×1024@15fps 等模式，量程约 0.25–5.46 米；彩色最高 4K，内置六轴 IMU，USB-C 供电传数据，仅限室内使用。实验室常把它当固定的第三视角相机采点云。","example":"实验室把旧的 Azure Kinect 换成 Femto Bolt，装上官方 K4A Wrapper 后，原来的点云采集脚本照常运行。","related":["Azure Kinect 深度相机","间接飞行时间","深度相机","奥比中光","奥比中光 Gemini 330 系列","第三视角相机"]},{"id":"vertical-cavity-surface-emitting-laser","category":"perception","sec":1,"tier":3,"sources":[{"title":"Vertical-cavity surface-emitting laser - Wikipedia","url":"https://en.wikipedia.org/wiki/Vertical-cavity_surface-emitting_laser"}],"as_of":"","related_ids":["structured-light","speckle-structured-light","time-of-flight","lidar","single-photon-avalanche-diode","depth-camera"],"name":"VCSEL（垂直腔面发射激光器）","alt":"Vertical-Cavity Surface-Emitting Laser","abbr":"VCSEL","aliases":["垂直腔面发射激光器","面发射激光器"],"one_liner":"垂直于芯片表面出光的半导体激光器，是深度相机和激光雷达的常用光源。","explanation":"一种半导体激光器，由东京工业大学伊贺健一在 1977 年提出。普通边发射激光器从切开的芯片侧面出光，VCSEL 则是在上下两层分布式布拉格反射镜之间夹一层发光区，光垂直于芯片表面射出。好处是切割前就能在整片晶圆上测试，一片晶圆可同时做出上万颗，也容易排成二维阵列，成本低、一致性好。在具身智能相关硬件里，它是许多红外主动光源的核心：iPhone Face ID 的结构光点阵投射器、飞行时间（ToF）深度相机、手机和汽车上的激光雷达都有用 VCSEL 发光的。","example":"结构光深度相机里，VCSEL 阵列把成千上万个红外光点投到物体上，相机根据光点的位置偏移算出每处的深度。","related":["结构光","散斑结构光","飞行时间法","激光雷达","SPAD（单光子雪崩二极管）","深度相机"]},{"id":"single-photon-avalanche-diode","category":"perception","sec":1,"tier":3,"sources":[{"title":"Single-photon avalanche diode - Wikipedia","url":"https://en.wikipedia.org/wiki/Single-photon_avalanche_diode"}],"as_of":"","related_ids":["direct-time-of-flight","solid-state-lidar","vertical-cavity-surface-emitting-laser","lidar","adaps-photonics"],"name":"SPAD（单光子雪崩二极管）","alt":"Single-Photon Avalanche Diode","abbr":"SPAD","aliases":["单光子雪崩二极管"],"one_liner":"灵敏到能探测单个光子的光电器件，dToF 激光雷达和测距芯片的核心。","explanation":"SPAD 是一种工作在盖革模式（反向偏压高于击穿电压）的光电二极管，单个光子打进来就能触发一次雪崩电流，从而记录下光子到达的精确时刻。它是直接飞行时间（dToF，发出激光脉冲、直接测回波往返时间）测距的关键器件：配合时间数字转换电路，把大量光子到达时间做成直方图就能算出距离。SPAD 阵列让激光雷达可以做成芯片化、固态化，成本和体积下降，因此出现在车载激光雷达、手机测距模组和机器人用的小型 dToF 传感器里。","example":"不少固态和半固态激光雷达的接收端用 SPAD 阵列芯片，配合 VCSEL 发射端做 dToF 测距。","related":["直接飞行时间","固态激光雷达","VCSEL（垂直腔面发射激光器）","激光雷达","灵明光子"]},{"id":"robosense-ac1","category":"perception","sec":1,"tier":3,"sources":[{"title":"RoboSense AC1 产品页（英文）","url":"https://www.robosense.ai/en/rslidar/AC1"},{"title":"速腾聚创 AC1 产品页（中文）","url":"https://www.robosense.cn/rslidar/AC1"},{"title":"RoboSense-Robotics GitHub（AC 驱动、标定、SLAM 开源仓库）","url":"https://github.com/RoboSense-Robotics"}],"as_of":"2026-09","related_ids":["depth-camera","direct-time-of-flight","single-photon-avalanche-diode","inertial-measurement-unit","multi-sensor-fusion","robosense"],"name":"速腾聚创 AC1 主动相机","alt":"RoboSense AC1 Active Camera","abbr":"","aliases":["RoboSense AC1","Active Camera AC1"],"one_liner":"速腾聚创把深度传感、彩色相机和 IMU 集成在一起的机器人视觉传感器","explanation":"AC1 是激光雷达厂商速腾聚创（RoboSense）「主动相机」（Active Camera）系列的首款产品。它把全固态深度传感模块（VCSEL 激光发射加 SPAD 单光子探测芯片）、RGB 彩色相机和 IMU（惯性测量单元）做进一个模组，硬件层面完成同步融合，直接输出对齐的深度、图像和姿态数据。官网参数：最远测距 70 米，5 米内深度精度约 1 厘米，深度视场角 120°×60°，抗 100 kLux 强光。它针对的是机器人自己拼装雷达、相机、IMU 时标定同步麻烦，以及普通深度相机在室外强光下失效的问题。配套 AI-Ready 生态开源了驱动、标定、SLAM 和感知算法；后续型号 AC2 侧重近距离操作。","example":"给室外巡检机器人装一台 AC1，用官方开源的 robosense_ac_slam 同时利用深度、图像和 IMU 数据做激光-惯性-视觉里程计与建图。","related":["深度相机","直接飞行时间","SPAD（单光子雪崩二极管）","惯性测量单元","多传感器融合","速腾聚创"]},{"id":"depth-holes","category":"perception","sec":1,"tier":3,"sources":[{"title":"RealSense: Depth Post-Processing for Intel RealSense Depth Camera D400 Series","url":"https://dev.realsenseai.com/docs/depth-post-processing-for-intel-realsense-depth-camera-d400-series/"},{"title":"librealsense: Post-processing filters","url":"https://github.com/realsenseai/librealsense/blob/master/doc/post-processing-filters.md"}],"as_of":"","related_ids":["depth-completion","depth-camera","active-stereo","flying-pixels","occlusion","transparent-and-reflective-object-perception"],"name":"深度空洞","alt":"Depth Holes (Missing Depth)","abbr":"","aliases":["深度缺失","无效深度","深度图空洞","Invalid Depth Pixels"],"one_liner":"深度相机测不出距离的像素，在深度图上通常记为 0。","explanation":"深度空洞指深度图里没有有效测量值的像素，RealSense 等相机把它们记为 0，显示成黑色斑块。以双目类深度相机为例，RealSense 官方白皮书列出的成因有：遮挡（左右相机看不到同一处）、表面缺乏纹理、重复图案造成多重匹配、曝光过度或不足、物体比最小工作距离还近；透明、镜面反光和很远的表面也常测不出。空洞会直接影响下游：点云缺块让抓取检测和避障误判；把 0 当成真实距离送进网络，会被理解成物体贴着相机。常见应对有后处理滤波（按邻近像素填洞、用前几帧的值补）、学习型深度补全，或在训练时把缺失区域掩掉。","example":"用双目深度相机拍桌上的不锈钢勺子和玻璃杯，勺子高光处和杯身区域在深度图上往往是一片 0，转成点云后这两件物体几乎缺失。","related":["深度补全","深度相机","主动双目","飞点","遮挡","透明/反光物体感知"]},{"id":"flying-pixels","category":"perception","sec":1,"tier":3,"sources":[{"title":"Azure Kinect DK depth camera（Invalidation / Multi-path 一节）","url":"https://learn.microsoft.com/en-us/previous-versions/azure/kinect-dk/depth-camera"},{"title":"Pixel-Perfect Depth with Semantics-Prompted Diffusion Transformers","url":"https://arxiv.org/abs/2510.07316"}],"as_of":"","related_ids":["depth-camera","time-of-flight","depth-map","point-cloud","depth-holes","monocular-depth-estimation"],"name":"飞点","alt":"Flying Pixels","abbr":"","aliases":["边缘飞点","Flying Points","混合像素","Mixed Pixels"],"one_liner":"深度图在物体边缘处出现、悬在前景和背景之间的错误深度点。","explanation":"飞点是深度数据在物体轮廓处常见的伪影：本该属于前景或背景的边缘像素，被赋予了介于两者之间的深度值，转成点云后就成了悬在空中的一串散点，像物体边缘拖出的一层「面纱」。在 ToF（飞行时间）深度相机里，原因是一个像素同时收到前景和背景反射回来的光，测到的是混合信号，微软 Azure Kinect 文档就把这类边缘像素算作多路径问题并置为无效；在双目匹配和深度估计网络里，回归输出在深度突变处被平滑，同样会产生飞点。飞点会让抓取位姿和碰撞检测出错，常见处理是按深度梯度或邻域一致性把可疑的边缘点滤掉。","example":"Pixel-Perfect Depth（NeurIPS 2025）指出，先用 VAE 把深度图压进潜空间的生成式深度模型会在边缘和细节处引入飞点，于是改为直接在像素空间做扩散生成，得到几乎没有飞点的点云。","related":["深度相机","飞行时间法","深度图","点云","深度空洞","单目深度估计"]},{"id":"lidar","category":"perception","sec":1,"tier":1,"sources":[{"title":"Wikipedia: Lidar","url":"https://en.wikipedia.org/wiki/Lidar"},{"title":"Livox Mid-360 产品页","url":"https://www.livoxtech.com/mid-360"}],"as_of":"","related_ids":["point-cloud","lidar-channels","solid-state-lidar","lidar-slam","time-of-flight","livox-mid-360"],"name":"激光雷达","alt":"LiDAR (Light Detection and Ranging)","abbr":"LiDAR","aliases":["3D 激光雷达","Lidar","光学雷达","激光扫描仪"],"one_liner":"发射激光并测回波时间来测距，扫出周围三维点云的传感器。","explanation":"激光雷达向外发射激光，测量光打到物体再反射回来所用的时间来算距离，再通过旋转或扫描覆盖大片视场，输出周围环境的三维点云。第一台类似系统由休斯飞机公司在 1961 年、激光发明后不久做出。按结构可分为整体旋转的机械式、靠转镜或微振镜扫描的半固态式和没有运动部件的纯固态式，按线束可分为只扫一个平面的 2D 单线雷达和多线的 3D 雷达。和深度相机比，激光雷达测得远、远处精度高、受环境光影响小，室外阳光下也能稳定工作，但点比较稀疏、没有颜色、价格更高。在机器人上主要用于 SLAM 建图定位、导航避障和地形感知，自动驾驶汽车、四足和人形机器人上都很常见。","example":"览沃（Livox）Mid-360 是移动机器人上常见的 3D 激光雷达，水平 360°、垂直 59° 视场，对 10% 反射率的目标能测到 40 米，最近可测 0.1 米。","related":["点云","激光雷达线数","固态激光雷达","激光SLAM","飞行时间法","览沃 Mid-360"]},{"id":"2d-lidar","category":"perception","sec":1,"tier":2,"sources":[{"title":"SLAMTEC RPLIDAR A1","url":"http://www.slamtec.com/en/lidar/a1"},{"title":"Wikipedia: Lidar","url":"https://en.wikipedia.org/wiki/Lidar"}],"as_of":"","related_ids":["lidar","lidar-slam","adaptive-monte-carlo-localization","occupancy-grid-map","costmap","robot-vacuum-cleaner"],"name":"2D激光雷达","alt":"2D LiDAR (Single-Line Laser Scanner)","abbr":"","aliases":["单线激光雷达","2D 激光扫描仪","Laser Scanner","二维激光雷达","平面激光雷达"],"one_liner":"旋转扫描一个水平面，测出四周各方向障碍物距离的激光测距仪。","explanation":"2D 激光雷达也叫单线激光雷达，只有一束测距激光，靠电机或转镜在一个水平面内旋转扫描，每圈输出一串「角度—距离」读数，画出来是一圈轮廓线。测距用飞行时间法（d = c·t / 2，c 为光速，t 为往返时间），低成本产品也有用三角测距的。它便宜、数据量小、精度稳定，是扫地机、仓储 AMR、AGV 做 2D 激光 SLAM、AMCL 定位和避障的常用配置，ROS 里对应 LaserScan 消息。局限是只看得到安装高度那一个平面，桌面、悬空横杆等不在扫描面上的障碍会漏掉，需要深度相机或多线激光雷达补充。","example":"思岚 RPLIDAR A1 做 360° 扫描，每秒测距 8000 多次，扫描频率 2–10 Hz 可调，采用三角测距，官方定位是用于 SLAM 建图、机器人导航和扫地机。","related":["激光雷达","激光SLAM","AMCL 自适应蒙特卡洛定位","占据栅格地图","代价地图","扫地机器人"]},{"id":"lidar-channels","category":"perception","sec":1,"tier":3,"sources":[{"title":"Ouster OS1 Lidar Sensor","url":"https://ouster.com/products/hardware/os1-lidar-sensor"},{"title":"Hesai JT128 产品页","url":"https://www.hesaitech.com/product/jt128/"},{"title":"Wikipedia: Velodyne Lidar","url":"https://en.wikipedia.org/wiki/Velodyne_Lidar"}],"as_of":"2026-09","related_ids":["lidar","solid-state-lidar","field-of-view","point-cloud","hesai-jt128","livox-mid-360"],"name":"激光雷达线数","alt":"LiDAR Channels (Beams)","abbr":"","aliases":["线束","16 线 / 32 线 / 128 线","通道数","Beams / Lines","等效线数"],"one_liner":"多线激光雷达竖直方向上激光通道的数量，决定点云上下方向的疏密。","explanation":"线数（channels）指多线激光雷达在竖直方向排布的激光收发通道数。传统机械旋转雷达把多路激光按不同俯仰角排成一列，整体水平旋转，每一路扫出一圈「扫描线」，所以 16 线雷达一帧里就是 16 圈环。线数越多，竖直分辨率越高，远处物体被打中的点越多，但价格、数据量和算力需求也越高。Velodyne 2007 年前后推出的 HDL-64E 旋转 64 路激光，每秒约一百万个点；Ouster OS1 最高 128 线、竖直视场 45°。固态或非重复扫描雷达没有固定的环，厂商常用「等效线数」描述点云密度，如览沃 Mid-360 标称 40 线点云密度。","example":"禾赛 JT128 是面向机器人的 128 线激光雷达：水平 360°、竖直 189° 视场，竖直角分辨率 0.74°，单回波每秒约 115 万点，重 265 克。","related":["激光雷达","固态激光雷达","视场角","点云","禾赛 JT128","览沃 Mid-360"]},{"id":"solid-state-lidar","category":"perception","sec":1,"tier":3,"sources":[{"title":"Lidar - Wikipedia","url":"https://en.wikipedia.org/wiki/Lidar"}],"as_of":"","related_ids":["lidar","single-photon-avalanche-diode","direct-time-of-flight","lidar-channels","field-of-view","frequency-modulated-continuous-wave-lidar"],"name":"固态激光雷达","alt":"Solid-State LiDAR","abbr":"","aliases":["半固态激光雷达","混合固态激光雷达","机械旋转式激光雷达（对照）"],"one_liner":"没有整体旋转部件、靠电子或微小机构扫描的激光雷达。","explanation":"传统机械旋转式激光雷达靠电机带着整排收发模块转一圈来扫描，视野 360° 但体积大、成本高、寿命受转动部件限制。固态激光雷达去掉了宏观运动部件，常见路线有 Flash（一次照亮整个视场）和 OPA（光学相控阵，用电控相位改变光束方向）。介于两者之间的叫半固态或混合固态，只保留转镜、MEMS 微振镜或棱镜等小型运动部件。固态化带来体积小、易量产、更耐振动，但视场角通常比旋转式窄。机器人和汽车上现在大量用的是半固态产品，纯固态多用于近距离补盲。","example":"","related":["激光雷达","SPAD（单光子雪崩二极管）","直接飞行时间","激光雷达线数","视场角","FMCW 激光雷达（调频连续波激光雷达）"]},{"id":"frequency-modulated-continuous-wave-lidar","category":"perception","sec":1,"tier":3,"sources":[{"title":"Aurora: FMCW Lidar — The Self-Driving Game-Changer","url":"https://aurora.tech/blog/fmcw-lidar-the-self-driving-game-changer"},{"title":"Aeva 官网（FMCW 4D LiDAR）","url":"https://www.aeva.com/"},{"title":"Wikipedia: Continuous-wave radar（FMCW 原理）","url":"https://en.wikipedia.org/wiki/Continuous-wave_radar"}],"as_of":"2026-09","related_ids":["lidar","time-of-flight","solid-state-lidar","millimeter-wave-radar","autonomous-driving","multi-sensor-fusion"],"name":"FMCW 激光雷达（调频连续波激光雷达）","alt":"Frequency-Modulated Continuous-Wave LiDAR","abbr":"FMCW","aliases":["FMCW LiDAR","调频连续波激光雷达","相干激光雷达","4D 激光雷达"],"one_liner":"连续发射调频激光，每个点同时测出距离和速度的激光雷达","explanation":"激光雷达的一种测距体制。常见的飞行时间（ToF）雷达发射短脉冲，计算回波往返时间；FMCW 雷达连续发射频率随时间周期变化的激光，把回波和本地光做相干混频，频率差对应距离，多普勒频移直接给出该点沿视线方向的速度，所以厂商常称它为 4D 激光雷达。它只响应和自身频率、波长匹配的光，受阳光和其他雷达串扰的影响小；多工作在 1550 nm 波段，人眼安全限值允许更高功率。代价是要用相干收发器件，结构复杂、成本高。目前主要用在自动驾驶，代表厂商有 Aeva、Aurora 等；机器人上常见的仍是 ToF 激光雷达。","example":"Aeva 的 FMCW 激光雷达每个点除了三维坐标还带一个速度值，单帧就能把正在走动的行人和静止的柱子分开，不必比较前后两帧。","related":["激光雷达","飞行时间法","固态激光雷达","毫米波雷达","自动驾驶","多传感器融合"]},{"id":"livox-mid-360","category":"perception","sec":1,"tier":2,"sources":[{"title":"Livox Mid-360 规格参数","url":"https://www.livoxtech.com/mid-360/specs"},{"title":"Livox Mid-360 产品页","url":"https://www.livoxtech.com/mid-360"},{"title":"livox_ros_driver2 README","url":"https://raw.githubusercontent.com/Livox-SDK/livox_ros_driver2/master/README.md"}],"as_of":"2026-09","related_ids":["lidar","lidar-slam","solid-state-lidar","lidar-inertial-odometry","fast-lio2","livox"],"name":"览沃 Mid-360","alt":"Livox Mid-360","abbr":"","aliases":["MID-360","Mid360","Livox MID-360"],"one_liner":"览沃科技的小型 360° 混合固态激光雷达，自带 IMU，常用于移动机器人。","explanation":"Mid-360 是览沃科技（Livox）面向移动机器人推出的混合固态激光雷达。官方参数：水平 360°、垂直 -7°～52° 视场，对 10% 反射率目标测距 40 米、最近 0.1 米，每秒 20 万点，重 265 克，内置 ICM40609 型 IMU（惯性测量单元）。它的角分辨率随积分时间提高，停留越久点云越密，官方标称密度相当于 40 线。官方定位是替代 2D 雷达、RGB-D 相机和超声波做室内导航避障；驱动 livox_ros_driver2 支持 ROS 1 和 ROS 2，自带 IMU 也便于直接跑激光惯性里程计。","example":"给一台轮式或足式机器人装上 Mid-360，用 livox_ros_driver2 发布点云和 IMU 话题，接入 FAST-LIO2 建图，再交给导航栈做避障和路径规划。","related":["激光雷达","激光SLAM","固态激光雷达","激光惯性里程计","FAST-LIO / FAST-LIO2","览沃科技"]},{"id":"hesai-jt128","category":"perception","sec":1,"tier":3,"sources":[{"title":"Hesai JT128/64P 产品页","url":"https://www.hesaitech.com/product/jt128/"},{"title":"Hesai Newsroom（含 2025-05 JT 系列产品介绍）","url":"https://www.hesaitech.com/news/"}],"as_of":"2026-09","related_ids":["lidar","lidar-channels","field-of-view","hesai-technology","livox-mid-360","robosense-airy"],"name":"禾赛 JT128","alt":"Hesai JT128","abbr":"","aliases":["禾赛 JT 系列","Hesai JT Series","JT128/64P"],"one_liner":"禾赛科技面向机器人的 128 线小体积、超广视场 3D 激光雷达。","explanation":"JT128 是禾赛科技 JT 系列激光雷达中的 128 线型号，同系列还有 JT64P、JT16 等。「线数」指竖直方向的激光通道数，线数越多点云越密。按禾赛官网参数，JT128 视场为 360°×189°，覆盖范围超过一个半球；10% 反射率下测距 40 m，最远 60 m；单回波每秒约 115.2 万点；直径 62.5 mm、高 73 mm，重 265 g，防护等级 IPX7。传统旋转式雷达的竖直视场多为几十度，装在机器人上容易留下盲区；JT 系列用超广竖直视场减少盲区。官网列出的应用包括具身智能机器人、配送机器人、AGV/AMR 和清洁机器人，可用于建图定位、避障和地形感知。","example":"","related":["激光雷达","激光雷达线数","视场角","禾赛科技","览沃 Mid-360","速腾聚创 Airy"]},{"id":"robosense-airy","category":"perception","sec":1,"tier":3,"sources":[{"title":"RoboSense Airy 产品页","url":"https://www.robosense.ai/en/rslidar/Airy"}],"as_of":"2026-09","related_ids":["lidar","lidar-channels","field-of-view","lidar-slam","livox-mid-360","robosense"],"name":"速腾聚创 Airy","alt":"RoboSense Airy","abbr":"","aliases":["速腾 Airy","RoboSense Airy 半球激光雷达"],"one_liner":"速腾聚创面向机器人的半球视场数字激光雷达，360°×90° 一颗覆盖","explanation":"Airy 是速腾聚创推出的机器人用激光雷达，官方称为首款「数字化半球激光雷达」。体积约乒乓球大小（直径 60 毫米、高 63 毫米），重量不到 240 克；水平视场 360°、垂直视场 90°，有 192 线和 96 线版本；测距半径 60 米（10% 反射率目标约 30 米），测距精度约 1 厘米。传统旋转式激光雷达垂直视场窄，装在机器人上容易看不到脚下和身边近处，常要多颗拼接；半球视场让一颗雷达同时覆盖四周和近处地面。它采用芯片化收发和数字化探测方案，面向四足、人形、庭院机器人、AMR 和无人叉车，用于 SLAM 建图、避障和可通行性判断。","example":"四足机器狗头部装一颗 Airy，既能看到前方障碍，也能看到脚下台阶，减少避障和建图时的盲区。","related":["激光雷达","激光雷达线数","视场角","激光SLAM","览沃 Mid-360","速腾聚创"]},{"id":"unitree-4d-lidar-l1-l2","category":"perception","sec":1,"tier":3,"sources":[{"title":"Unitree 4D LiDAR L2 官网","url":"https://www.unitree.com/L2"},{"title":"Unitree 4D LiDAR L1 官网","url":"https://www.unitree.com/LiDAR"},{"title":"Unitree Go2 官网","url":"https://www.unitree.com/go2"}],"as_of":"2026-09","related_ids":["lidar","livox-mid-360","unitree-go2","lidar-inertial-odometry","unitree-robotics","inertial-measurement-unit"],"name":"宇树 4D 激光雷达 L1 / L2","alt":"Unitree 4D LiDAR L1 / L2","abbr":"","aliases":["Unitree L1","Unitree L2","宇树 L2 激光雷达"],"one_liner":"宇树自研的低价半球视场激光雷达，每个点带三维坐标加灰度。","explanation":"宇树科技自研的小型激光雷达（用激光测距、扫出周围三维点云的传感器）。「4D」指每个点输出三维位置加一维灰度（反射强度）。官网参数：L1 视场 360°×90°，每秒约 2.16 万点，起价 249 美元；L2 视场 360°×96°，每秒 6.4 万点，量程 30 m（90% 反射率），近处盲区 0.05 m，重 230 g，售价 419 美元。两者都内置 IMU，采用非重复扫描。价格远低于传统激光雷达，宇树 Go2 四足官网写明搭载 L2，官方也提供基于 Point-LIO 的开源建图方案，常被用来做 SLAM 和避障。","example":"在宇树 Go2 上用头部 L2 的点云加内置 IMU 跑 Point-LIO，边走边建出室内三维地图，供导航避障使用。","related":["激光雷达","览沃 Mid-360","宇树 Go2","激光惯性里程计","宇树科技","惯性测量单元"]},{"id":"millimeter-wave-radar","category":"perception","sec":1,"tier":3,"sources":[{"title":"The fundamentals of millimeter wave radar sensors - Texas Instruments","url":"https://www.ti.com/lit/wp/spyy005a/spyy005a.pdf"}],"as_of":"","related_ids":["lidar","multi-sensor-fusion","autonomous-driving","ultrasonic-sensor","exteroception"],"name":"毫米波雷达","alt":"Millimeter-Wave Radar","abbr":"mmWave Radar","aliases":["mmWave","4D 毫米波雷达","毫米波雷达传感器"],"one_liner":"发射毫米级波长电磁波，测目标距离、速度和方位的雷达。","explanation":"毫米波雷达工作在约 30–300 GHz 频段，车载常用 77 GHz 附近。它发射调频电磁波，由回波算出目标的距离、径向速度（多普勒效应）和方位角。优点是不怕雨雾、黑夜和强光，能直接测速度；缺点是角分辨率低、点云稀疏，难以看清物体形状。4D 毫米波雷达额外测俯仰角，点云更密。它在自动驾驶中和相机、激光雷达做多传感器融合，在机器人里多用于安全防护和人员检测。","example":"汽车前向 77 GHz 雷达在雨雾天仍能测出前车距离和相对速度，用于自适应巡航。","related":["激光雷达","多传感器融合","自动驾驶","超声波传感器","外部感知"]},{"id":"ultrasonic-sensor","category":"perception","sec":1,"tier":3,"sources":[{"title":"Ultrasonic transducer - Wikipedia","url":"https://en.wikipedia.org/wiki/Ultrasonic_transducer"},{"title":"Parking sensor - Wikipedia","url":"https://en.wikipedia.org/wiki/Parking_sensor"}],"as_of":"","related_ids":["vision-only-approach","proximity-sensor","time-of-flight","obstacle-avoidance","millimeter-wave-radar","transparent-and-reflective-object-perception"],"name":"超声波传感器","alt":"Ultrasonic Sensor","abbr":"USS","aliases":["超声波雷达","USS","超声波测距传感器"],"one_liner":"发出超声波、听回声来测距的低成本近距离传感器。","explanation":"发射频率高于 20 kHz（人耳听不到）的声波脉冲，测回波返回所用的时间，用声速乘以时间的一半得到障碍物距离。它便宜，而且不依赖光，目标的颜色和反光程度不影响测量，能发现玻璃门这类相机和激光雷达容易漏掉的障碍，所以常用于汽车倒车雷达和移动机器人的近距离避障。缺点是波束宽、分辨不出方向细节，量程一般只有几米；遇到吸音材料或倾斜平面时回波弱，容易漏检。车上常叫「超声波雷达」，据报道特斯拉 2022 年起在部分车型上取消了它，改走纯视觉方案。","example":"倒车时保险杠上的超声波探头测到后方障碍越来越近，提示音从间断变急促，最后变成长鸣。","related":["纯视觉方案","接近觉传感器","飞行时间法","避障","毫米波雷达","透明/反光物体感知"]},{"id":"proximity-sensor","category":"perception","sec":1,"tier":3,"sources":[{"title":"Proximity sensor - Wikipedia","url":"https://en.wikipedia.org/wiki/Proximity_sensor"},{"title":"Proximity Perception in Human-Centered Robotics: A Survey on Sensing Systems and Applications (arXiv 2108.07206)","url":"https://arxiv.org/abs/2108.07206"}],"as_of":"","related_ids":["tactile-sensor","electronic-skin","time-of-flight","ultrasonic-sensor","human-robot-collaboration","speed-and-separation-monitoring"],"name":"接近觉传感器","alt":"Proximity Sensor","abbr":"","aliases":["接近传感器","近距离感知","接近觉"],"one_liner":"不用接触，就能感知附近有没有物体、离得多近的传感器。","explanation":"接近觉传感器在不接触的情况下检测附近物体的存在或距离，常见原理有电容式（物体靠近改变电场）、电感式（只对金属敏感）、红外等光学式、飞行时间式（测光的往返时间）和超声波式。手机通话时贴近耳朵自动熄屏，用的就是它。在机器人上，它填补了视觉和触觉之间的空档：相机在近距离常被手臂或物体本身挡住，触觉又必须碰上才有信号。常见用法有两类：一是贴在机械臂外壳上做「感知皮肤」，人靠近时减速或避让，服务人机协作安全；二是装在夹爪指尖，在接触前最后一小段距离里微调手指位置。Navarro 等人 2021 年的综述系统整理了这类系统。","example":"协作机械臂外壳贴一圈电容式接近觉传感器，工人的手靠近到一定距离时，机械臂自动减速停下。","related":["触觉传感器","电子皮肤","飞行时间法","超声波传感器","人机协作","速度与分离监控"]},{"id":"safety-laser-scanner-safety-light-curtain","category":"perception","sec":1,"tier":3,"sources":[{"title":"Light curtain - Wikipedia","url":"https://en.wikipedia.org/wiki/Light_curtain"},{"title":"SICK Safety laser scanners","url":"https://www.sick.com/us/en/catalog/products/safety-systems-and-solutions/safety-laser-scanners/c/g187234"}],"as_of":"","related_ids":["functional-safety","speed-and-separation-monitoring","protective-stop","2d-lidar","autonomous-mobile-robot","iso-10218-1-2-2025-robotics-safety-requirements"],"name":"安全激光扫描仪 / 安全光幕","alt":"Safety Laser Scanner / Safety Light Curtain","abbr":"","aliases":["安全激光雷达","安全光栅","电敏保护设备","ESPE"],"one_liner":"经过安全认证的人员闯入检测设备，有人进入危险区就让机器停下","explanation":"两者都属于电敏保护设备（ESPE），是工业现场让机器「看见人就停」的安全传感器，需按 IEC 61496 等标准认证，输出的是安全级停机信号，而不是给算法用的普通数据。安全光幕由一对发射柱和接收柱组成，发射端向接收端打出一排平行红外光束，任一束被挡住就触发停机，常装在机床或机器人工作站入口。安全激光扫描仪是带安全认证的 2D 激光扫描设备，可在扫描平面内划出「警告区」和「保护区」：有人进入警告区时减速或报警，进入保护区就停机。它们让机器人不必全部用实体围栏隔开，也是 AMR 防撞和人机协作中速度与分离监控的常用硬件。","example":"机械臂上下料工位入口装一对安全光幕，工人伸手进去取料时光束被挡，机械臂立即保护性停止。","related":["功能安全","速度与分离监控","保护性停止","2D激光雷达","自主移动机器人","ISO 10218 工业机器人安全标准（2025 版）"]},{"id":"vision-only-approach","category":"perception","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Tesla Autopilot hardware（Tesla Vision：2021 年去毫米波雷达、2022 年去超声波雷达）","url":"https://en.wikipedia.org/wiki/Tesla_Autopilot_hardware"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model（局限：仅支持单图输入）","url":"https://arxiv.org/abs/2406.09246"}],"as_of":"2022-10","related_ids":["rgb-camera","lidar","depth-camera","multi-sensor-fusion","visuo-tactile-fusion","autonomous-driving"],"name":"纯视觉方案","alt":"Vision-Only Approach","abbr":"","aliases":["纯视觉","纯视觉路线","Camera-Only"],"one_liner":"只靠摄像头感知环境，不用激光雷达、毫米波雷达等测距传感器。","explanation":"纯视觉方案指感知只用摄像头（通常是普通 RGB 相机），距离和三维结构都由算法从图像推出，不用激光雷达、毫米波雷达、超声波等测距传感器。最有名的是特斯拉：2021 年 5 月起北美产 Model 3/Y 去掉毫米波雷达，称「Tesla Vision」，2022 年 10 月又宣布取消超声波雷达。优点是硬件便宜、数据易规模化；代价是深度只能估计，暗光、逆光和透明反光物体上更易出错。具身领域里「纯视觉」也指策略只看图像、不接触觉力觉，如 OpenVLA 只输入一张 RGB 图和语言指令。它和多传感器融合路线孰优孰劣仍有争论。","example":"OpenVLA 只接收单张 RGB 图像和一句指令，不输入深度、力觉或本体状态，直接输出机械臂末端的动作。","related":["RGB相机","激光雷达","深度相机","多传感器融合","视触觉融合","自动驾驶"]},{"id":"rotary-encoder","category":"perception","sec":2,"tier":1,"sources":[{"title":"Wikipedia: Rotary encoder","url":"https://en.wikipedia.org/wiki/Rotary_encoder"}],"as_of":"","related_ids":["absolute-encoder","incremental-encoder","magnetic-encoder","dual-encoder","proprioception","joint-actuator-module"],"name":"编码器","alt":"Rotary Encoder","abbr":"","aliases":["关节编码器","Joint Encoder","角度编码器","旋转编码器"],"one_liner":"装在电机或关节上、把转轴角度转换成电信号的位置传感器。","explanation":"旋转编码器是把转轴的角位置或转动量转换成模拟或数字信号的机电器件，机器人每个关节至少装一个，告诉控制器「现在转到了多少度」。按输出分两类：增量式只报告转了多少，通常输出相位差 90° 的 A、B 两路方波来判断方向，断电后要回零才知道绝对位置；绝对值式直接给出当前角度，断电也不丢。按原理有光电、磁、电容、电感等。分辨率用每圈脉冲数或位数表示。关节模组常在电机端和减速器输出端各装一个（双编码器），直接测出输出端的真实角度，减小减速器背隙（齿轮之间的空程间隙）带来的误差。策略输入里的关节角这类本体感知信息，就来自编码器读数。","example":"一个 14 位绝对值磁编码器把一圈分成 2^14 = 16384 份，角分辨率约 360° ÷ 16384 ≈ 0.022°。","related":["绝对值编码器","增量式编码器","磁编码器","双编码器","本体感知","关节模组"]},{"id":"inertial-measurement-unit","category":"perception","sec":2,"tier":1,"sources":[{"title":"Wikipedia: Inertial measurement unit","url":"https://en.wikipedia.org/wiki/Inertial_measurement_unit"},{"title":"unitree_rl_gym deploy_real.py（IMU 角速度与投影重力作为观测）","url":"https://github.com/unitreerobotics/unitree_rl_gym/blob/main/deploy/deploy_real/deploy_real.py"}],"as_of":"","related_ids":["sensor-drift","projected-gravity","state-estimation","visual-inertial-odometry","proprioception","camera-imu-calibration"],"name":"惯性测量单元","alt":"Inertial Measurement Unit","abbr":"IMU","aliases":["陀螺仪 + 加速度计","六轴 IMU","九轴 IMU","惯性传感器","惯导（口语）"],"one_liner":"用加速度计和陀螺仪测量物体加速度和转动快慢的传感器。","explanation":"惯性测量单元（IMU）由加速度计和陀螺仪组成，分别测三个方向的加速度（静止时读到的就是重力，所以能判断哪边朝下）和绕三个轴的角速度，合称六轴；再加三轴磁力计就是九轴。手机、无人机、VR 头显里都有它。对机器人来说，IMU 给出机身朝向（尤其是重力方向）和转动速度，是足式和人形机器人保持平衡的基本输入。它的读数带零偏和噪声，积分算角度和位置时误差会随时间累积（漂移），所以常和相机、激光雷达或腿式里程计融合使用。口语里有人把 IMU 叫「惯导」，严格说惯性导航系统是在 IMU 读数上再积分解算出位置、速度的整套系统。","example":"宇树开源的 unitree_rl_gym 里，G1 行走策略的观测前 6 维就是 IMU 陀螺仪测的机身角速度，加上由 IMU 姿态四元数算出的投影重力方向。","related":["传感器漂移（零漂）","投影重力","状态估计","视觉惯性里程计","本体感知","相机-IMU联合标定"]},{"id":"attitude-estimation","category":"perception","sec":2,"tier":3,"sources":[{"title":"Wikipedia: Attitude and heading reference system","url":"https://en.wikipedia.org/wiki/Attitude_and_heading_reference_system"},{"title":"x-io Technologies: Open source IMU and AHRS algorithms (Madgwick / Fusion)","url":"https://x-io.co.uk/open-source-imu-and-ahrs-algorithms/"}],"as_of":"","related_ids":["inertial-measurement-unit","complementary-filter","kalman-filter","projected-gravity","roll-pitch-yaw","quaternion"],"name":"姿态解算（AHRS 航姿参考系统）","alt":"Attitude Estimation / Attitude and Heading Reference System","abbr":"AHRS","aliases":["姿态估计","航姿参考系统","IMU 姿态融合"],"one_liner":"融合陀螺仪、加速度计（和磁力计）数据，实时算出横滚、俯仰、偏航角。","explanation":"姿态解算指用惯性传感器数据算出物体在空间中的朝向，常用横滚、俯仰、偏航角或四元数表示。AHRS（航姿参考系统）原是航空仪表，由三轴陀螺仪、加速度计、磁力计加机载计算组成，直接输出姿态和航向；IMU 通常只输出原始角速度和加速度。原理上，陀螺仪积分得到角度，短时准但会漂移；加速度计能测出重力方向，可校正横滚和俯仰；偏航角没有重力参考，要靠磁力计或视觉等其他来源校正。常用融合算法有卡尔曼滤波、互补滤波，以及 Madgwick 算法（2009 年博士研究期间提出，现以 Fusion 为名开源）和 Mahony 滤波。足式和人形机器人的控制策略常把解算出的姿态（或投影重力）和角速度作为输入，姿态误差会直接影响平衡控制。","example":"四足机器人侧面被推一下，IMU 姿态解算实时给出机身横滚角的变化，运动控制策略据此迈步恢复平衡。","related":["惯性测量单元","互补滤波","卡尔曼滤波","投影重力","横滚-俯仰-偏航角","四元数"]},{"id":"complementary-filter","category":"perception","sec":2,"tier":3,"sources":[{"title":"Complementary Filter - AHRS 文档","url":"https://ahrs.readthedocs.io/en/latest/filters/complementary.html"},{"title":"complementaryFilter - MATLAB Sensor Fusion and Tracking Toolbox","url":"https://www.mathworks.com/help/fusion/ref/complementaryfilter-system-object.html"}],"as_of":"","related_ids":["inertial-measurement-unit","kalman-filter","extended-kalman-filter","attitude-estimation","sensor-drift","state-estimation"],"name":"互补滤波","alt":"Complementary Filter","abbr":"","aliases":["互补滤波器","Mahony 互补滤波"],"one_liner":"陀螺仪管短期、加速度计管长期，按比例混合两者来估计姿态角的简单滤波方法。","explanation":"互补滤波是 IMU 姿态估计里最常用的简单方法。陀螺仪测角速度，积分得到角度，短时间内平滑准确，但零偏会让误差随时间累积成漂移（低频误差）；加速度计借助重力方向能直接算出俯仰和横滚角，长期不漂，但受振动和运动加速度干扰、噪声大（高频误差），偏航角可再借助磁力计。互补滤波让陀螺仪积分结果走高通、加速度计结果走低通再相加，常见写法是：角度 = α ×（上一时刻角度 + 角速度 × Δt）+（1 − α）× 加速度计角度，α 取接近 1 的值。计算量极小，适合单片机；Mahony 等人 2008 年在 IEEE TAC 上把它推广到三维旋转（SO(3)），即常用的 Mahony 滤波。它不需要噪声模型，但权重需手调。","example":"自平衡小车的主控每个控制周期读一次 IMU，用 α = 0.98 的互补滤波算出车身俯仰角，作为平衡控制的反馈量。","related":["惯性测量单元","卡尔曼滤波","扩展卡尔曼滤波","姿态解算（AHRS 航姿参考系统）","传感器漂移（零漂）","状态估计"]},{"id":"sensor-drift","category":"perception","sec":2,"tier":3,"sources":[{"title":"Inertial measurement unit - Wikipedia","url":"https://en.wikipedia.org/wiki/Inertial_measurement_unit"}],"as_of":"","related_ids":["inertial-measurement-unit","kalman-filter","allan-variance","visual-inertial-odometry","six-axis-force-torque-sensor","state-estimation"],"name":"传感器漂移（零漂）","alt":"Sensor Drift (Zero Drift / Bias Drift)","abbr":"","aliases":["零点漂移","温漂","IMU 漂移","Bias"],"one_liner":"传感器在输入不变时，读数仍随时间或温度缓慢偏移的现象","explanation":"理想传感器没有输入时应输出 0，实际读数总带一个偏置（bias），而且这个偏置会随时间、温度和每次上电缓慢变化，这就是漂移，也叫零点漂移、温漂。机器人上最典型的是 IMU（惯性测量单元）漂移：姿态、速度、位置都靠对陀螺仪和加速度计读数积分得到，微小偏置会不断累积，陀螺仪的恒定偏置会让速度误差按时间二次方增长、位置误差按三次方增长，所以纯靠 IMU 推算位置很快就会发散。六维力传感器、关节力矩传感器也有零漂，使用前通常要重新置零。应对办法包括标定、温度补偿、用 Allan 方差表征噪声，以及与相机、激光雷达、GPS 融合，在卡尔曼滤波里把偏置当作状态在线估计。","example":"人形机器人原地站着不动，只用 IMU 积分出的偏航角也会慢慢变化，需要靠视觉惯性里程计或腿式里程计融合来修正。","related":["惯性测量单元","卡尔曼滤波","Allan 方差（IMU 噪声标定）","视觉惯性里程计","六维力传感器","状态估计"]},{"id":"allan-variance","category":"perception","sec":2,"tier":3,"sources":[{"title":"Kalibr Wiki: IMU Noise Model","url":"https://github.com/ethz-asl/kalibr/wiki/IMU-Noise-Model"},{"title":"Wikipedia: Allan variance","url":"https://en.wikipedia.org/wiki/Allan_variance"}],"as_of":"","related_ids":["inertial-measurement-unit","sensor-drift","camera-imu-calibration","kalibr","visual-inertial-odometry","kalman-filter"],"name":"Allan 方差（IMU 噪声标定）","alt":"Allan Variance","abbr":"","aliases":["阿伦方差","艾伦方差","Allan 偏差","Allan Deviation","双样本方差","AVAR"],"one_liner":"看传感器噪声随平均时长怎么变的统计方法，常用来标定 IMU 噪声参数。","explanation":"Allan 方差是 David W. Allan 在 1966 年为衡量原子钟、晶振频率稳定度提出的「双样本方差」，后来成为陀螺仪、加速度计噪声标定的标准方法，IEEE Std 952-1997（光纤陀螺测试规范）给出了从中读取噪声参数的做法。具体做法是让 IMU 静止采集很长一段数据，按不同平均时长 τ 分段求均值，再算相邻段均值之差的方差，画成双对数曲线。曲线上斜率 −1/2 的段对应白噪声（噪声密度），斜率 +1/2 的段对应零偏随机游走。Kalibr 的 IMU 噪声模型文档建议静止录 15 到 24 小时，在 τ=1 秒处读白噪声、在 τ=3 秒处读随机游走线。读出的参数要填进视觉惯性里程计、相机-IMU 联合标定和卡尔曼滤波的配置，填错会让融合算法过分相信或过分怀疑 IMU。","example":"做相机-IMU 联合标定前，把 IMU 静置录一整晚数据，用 allan_variance_ros 画出曲线，读出陀螺仪和加速度计的噪声密度、随机游走，再写进 Kalibr 的 IMU 配置文件。","related":["惯性测量单元","传感器漂移（零漂）","相机-IMU联合标定","Kalibr","视觉惯性里程计","卡尔曼滤波"]},{"id":"six-axis-force-torque-sensor","category":"perception","sec":2,"tier":1,"sources":[{"title":"ATI Industrial Automation: Multi-Axis Force/Torque Sensors","url":"https://www.ati-ia.com/products/ft/sensors.aspx"},{"title":"Robotiq FT 300-S Force Torque Sensor","url":"https://robotiq.com/products/ft-300-force-torque-sensor"},{"title":"Wikipedia: Strain gauge","url":"https://en.wikipedia.org/wiki/Strain_gauge"}],"as_of":"","related_ids":["strain-gauge","force-control","impedance-control","peg-in-hole-insertion","crosstalk","joint-torque-sensor"],"name":"六维力传感器","alt":"Six-Axis Force/Torque Sensor","abbr":"F/T","aliases":["力/力矩传感器","F/T 传感器","六轴力传感器","六维力矩传感器","Force/Torque Sensor","多轴力传感器"],"one_liner":"同时测三个方向的力和绕三根轴的力矩，常装在机械臂手腕上。","explanation":"六维力传感器一次测出 6 个量：沿 x、y、z 三个方向的力 Fx、Fy、Fz，和绕这三根轴的力矩 Tx、Ty、Tz。常见结构是在金属弹性体上贴应变片，受力后的微小形变让电阻变化，经惠斯通电桥和标定换算成六个分量，也有电容式等方案。在机械臂上它通常夹在手腕法兰和夹爪之间，让控制器知道末端被推了多大劲、往哪边拧，是力控、阻抗控制、轴孔装配、打磨、拖动示教和碰撞检测的基础。代表厂商有 ATI、Robotiq，国内有宇立仪器、坤维科技等。也有机械臂不装它，改用各关节力矩传感器间接估算末端受力。","example":"Robotiq FT 300-S 装在协作臂手腕和夹爪之间，量程为力 ±300 N、力矩 ±30 N·m，以 100 Hz 输出数据，常用于插孔装配和表面打磨。","related":["应变片","力控","阻抗控制","轴孔装配","维间耦合","关节力矩传感器"]},{"id":"joint-torque-sensor","category":"perception","sec":2,"tier":2,"sources":[{"title":"KUKA LBR iiwa 产品页","url":"https://www.kuka.com/en-us/products/robotics-systems/industrial-robots/lbr-iiwa"},{"title":"libfranka robot_state.h（tau_J: measured link-side joint torque sensor signals）","url":"https://raw.githubusercontent.com/frankaemika/libfranka/master/include/franka/robot_state.h"}],"as_of":"","related_ids":["six-axis-force-torque-sensor","strain-gauge","sensorless-force-estimation","torque-control","impedance-control","collision-detection"],"name":"关节力矩传感器","alt":"Joint Torque Sensor","abbr":"","aliases":["关节扭矩传感器","一维力矩传感器"],"one_liner":"装在机器人关节里、直接测量该关节实际输出扭矩的传感器。","explanation":"关节力矩传感器装在关节减速器输出端和连杆之间，只测绕关节转轴这一个方向的扭矩，所以也叫一维力矩传感器，多基于应变片原理，靠弹性体的微小形变换算扭矩。电机电流也能推算扭矩，但减速器摩擦会让估计不准；在输出端直接测，机器人才能察觉很轻的外力。KUKA LBR iiwa 七个轴都装了这种传感器，官方称能立即察觉接触并降低力和速度，可以不加护栏与人协作；Franka 的控制接口也直接给出各关节实测扭矩 tau_J。它是碰撞检测、力矩控制、阻抗控制和拖动示教的基础，代价是成本更高、关节结构更复杂。","example":"人用手推一下正在运动的 iiwa 机械臂，关节力矩传感器读数超出动力学模型的预测值，控制器判定发生碰撞，立刻停下或顺着推力让开。","related":["六维力传感器","应变片","无传感器力估计","力矩控制","阻抗控制","碰撞检测（本体安全）"]},{"id":"strain-gauge","category":"perception","sec":2,"tier":3,"sources":[{"title":"Strain gauge - Wikipedia","url":"https://en.wikipedia.org/wiki/Strain_gauge"}],"as_of":"","related_ids":["six-axis-force-torque-sensor","joint-torque-sensor","foot-force-sensor","sensor-drift","crosstalk"],"name":"应变片","alt":"Strain Gauge","abbr":"","aliases":["电阻应变片","应变式力传感"],"one_liner":"贴在金属上、受力变形时电阻跟着变的小元件，力传感器的基本单元。","explanation":"应变片是一种把微小形变转成电阻变化的传感元件，通常是印在绝缘基底上的金属箔栅或半导体。把它粘在弹性体表面，弹性体受力发生微小拉伸或压缩，应变片电阻随之改变，再用惠斯通电桥（一种把小电阻变化放大成电压信号的电路）读出。六维力传感器、关节力矩传感器、足底力传感器和称重传感器大多基于应变片：在专门设计的弹性结构上贴多片，解算出各方向的力和力矩。它精度高、成本低，但对温度敏感、会有零漂，需要温度补偿和定期标定。","example":"机械臂末端的六维力传感器内部在十字梁弹性体上贴多组应变片，测出三向力和三向力矩。","related":["六维力传感器","关节力矩传感器","足底力传感器","传感器漂移（零漂）","维间耦合"]},{"id":"crosstalk","category":"perception","sec":2,"tier":3,"sources":[{"title":"A Novel 6-axis Force/Torque Sensor Using Inductance Sensors (arXiv 2505.09069)","url":"https://arxiv.org/abs/2505.09069"},{"title":"ATI Industrial Automation: Six-Axis F/T Transducer Installation and Operation Manual","url":"https://www.ati-ia.com/app_content/documents/9620-05-transducer%20section.pdf"}],"as_of":"","related_ids":["six-axis-force-torque-sensor","strain-gauge","wrench","sensor-drift","force-control","joint-torque-sensor"],"name":"维间耦合","alt":"Crosstalk (Inter-axis Coupling) of Multi-axis Force Sensors","abbr":"","aliases":["串扰","交叉耦合","维间干扰","Cross-axis Coupling"],"one_liner":"多维力传感器只受一个方向的力，其他方向的读数也跟着变的现象。","explanation":"维间耦合是评价多维力传感器（如六维力传感器）的一项指标：只沿一个轴加载，比如单纯竖直下压，本应为零的其他通道（Fx、Fy 和各向力矩）也出现读数。原因是传感器内部的应变片会同时感受多个方向的载荷，再加上弹性体加工和贴片的误差。厂家通常通过标定求出一个解耦矩阵，把各路原始信号换算成三个力和三个力矩；标定后剩下的串扰一般用占满量程的百分比（%FS）表示，测试时分别做单轴加载和多轴同时加载。它直接影响力控精度：在装配、打磨这类任务里，耦合误差会让机器人以为受到了并不存在的侧向力，做出错误的柔顺动作。","example":"六维力传感器只受竖直向下 100 N 的力，Fx 通道却读出 1 N；如果 Fx 的量程是 100 N，这一项维间耦合就是 1%FS。","related":["六维力传感器","应变片","力旋量","传感器漂移（零漂）","力控","关节力矩传感器"]},{"id":"sensorless-force-estimation","category":"perception","sec":2,"tier":3,"sources":[{"title":"arXiv 2512.13009: K-VARK for Sensorless Force Estimation in Collaborative Robots","url":"https://arxiv.org/abs/2512.13009"},{"title":"arXiv 2609.13779: Force-Aware RL with Hybrid Sensorless Force Estimation for Wheeled-Legged Loco-Manipulation","url":"https://arxiv.org/abs/2609.13779"}],"as_of":"2026-09","related_ids":["generalized-momentum-observer","torque-constant","collision-detection","friction-compensation","proprioceptive-actuator","six-axis-force-torque-sensor"],"name":"无传感器力估计","alt":"Sensorless Force Estimation","abbr":"","aliases":["电流估力","基于电机电流的力估计"],"one_liner":"不装力传感器，用电机电流和动力学模型推算机器人受到的外力","explanation":"无传感器力估计指不安装专门的六维力传感器或关节力矩传感器，而是用电机电流（乘以力矩常数约等于电机输出力矩）、关节位置和速度，加上机器人动力学模型，推算机器人与外界接触时受的力。思路是：模型预测「没有外力时需要多少力矩」，实测力矩与预测值的差就归因于外力。常用工具是广义动量观测器，它不需要对加速度求导，噪声较小。好处是省掉昂贵易损的力传感器，低成本机械臂、四足和人形机器人都能借此做碰撞检测和粗略力控；难点是减速器摩擦、模型误差和温度变化会带来较大偏差，精度一般不如专用传感器。近年常用学习方法补偿残差力矩，如 2025 年的 K-VARK 和 2026 年用于轮腿机器人的混合估计方法。","example":"没有力传感器的机械臂比较电机电流与动力学模型预测值，发现关节力矩突然出现大偏差，判定撞到了人并立即停下。","related":["动量观测器","力矩常数（Kt）","碰撞检测（本体安全）","摩擦补偿","本体感受式执行器","六维力传感器"]},{"id":"contact-detection","category":"perception","sec":2,"tier":2,"sources":[{"title":"Multimodal Contact Detection using Auditory and Force Features for Reliable Object Placing in Household Environments (arXiv 2012.01583)","url":"https://arxiv.org/abs/2012.01583"},{"title":"Tactile sensor（Wikipedia）","url":"https://en.wikipedia.org/wiki/Tactile_sensor"}],"as_of":"","related_ids":["tactile-sensor","six-axis-force-torque-sensor","slip-detection","extrinsic-contact-sensing","sensorless-force-estimation","contact-estimation"],"name":"接触检测","alt":"Contact Detection","abbr":"","aliases":["接触感知","触碰检测","Contact Sensing"],"one_liner":"判断机器人是否、何时、在哪里碰到了物体或环境。","explanation":"接触检测是判断机器人某个部位（手指、夹爪、工具或机身）是否已经和物体或环境接触，进一步给出接触时刻和位置。信号来源主要有三类：触觉传感器或电子皮肤的读数变化；腕部六维力传感器的力、力矩突变；没有专门传感器时，比较电机电流或关节力矩与动力学模型预测值之间的残差。只靠视觉往往不可靠，因为接触瞬间手常挡住物体。它是许多操作流程的触发条件，比如夹爪闭合到接触就停、下探到碰到桌面再松手、装配时判断是否到位。固定阈值在家居场景容易误判，因此也有融合声音与力信号、或用学习方法检测的工作。腿足机器人判断脚是否着地一般另称「接触估计」。","example":"放杯子时机械臂缓慢下降，腕部力传感器测得竖直方向的力突然超过阈值，就判定杯底已碰到桌面，随即张开夹爪。","related":["触觉传感器","六维力传感器","滑移检测","外部接触感知","无传感器力估计","接触估计"]},{"id":"foot-force-sensor","category":"perception","sec":2,"tier":3,"sources":[{"title":"Unitree Go2 产品页（规格表：足端力传感器仅 EDU 版）","url":"https://www.unitree.com/go2"},{"title":"unitree_legged_sdk comm.h（LowState footForce 字段）","url":"https://github.com/unitreerobotics/unitree_legged_sdk/blob/master/include/unitree_legged_sdk/comm.h"}],"as_of":"2026-09","related_ids":["contact-estimation","six-axis-force-torque-sensor","ground-reaction-force","zero-moment-point","leg-odometry","sensorless-force-estimation"],"name":"足底力传感器","alt":"Foot Force Sensor","abbr":"","aliases":["足端力传感器","足底压力传感器","Foot Contact Sensor"],"one_liner":"装在足式机器人脚底或脚踝，测脚和地面之间接触力的传感器","explanation":"足式机器人脚端用来测触地力的传感器，常见形式有：四足足端的单轴力或压力传感器、人形机器人脚踝处的六维力传感器、铺在脚掌上的压力阵列。它回答两个问题：这只脚着地没有，地面反作用力有多大。前一个用于接触估计和腿式里程计（知道哪只脚在支撑，才能推算机身怎么移动），后一个可以算出压力中心、零力矩点，用来判断平衡。脚端每一步都受冲击，传感器容易磨损、读数也会漂移，所以不少四足产品不装它，改用关节力矩或电机电流做无传感器力估计。以宇树 Go2 为例，只有 EDU 版配足端力传感器。","example":"宇树 Go1 等四足的旧版 SDK（unitree_legged_sdk）在底层状态 LowState 里用 footForce 字段给出四只脚各一个力读数，控制程序可以据此判断每只脚的触地时刻。","related":["接触估计","六维力传感器","地面反作用力","零力矩点","腿式里程计","无传感器力估计"]},{"id":"contact-estimation","category":"perception","sec":2,"tier":3,"sources":[{"title":"Legged Robot State Estimation using Invariant Kalman Filtering and Learned Contact Events (arXiv 2106.15713, CoRL 2021)","url":"https://arxiv.org/abs/2106.15713"}],"as_of":"","related_ids":["leg-odometry","invariant-extended-kalman-filter","state-estimation","foot-force-sensor","learned-state-estimator","stance-phase-swing-phase"],"name":"接触估计","alt":"Contact Estimation (Touchdown Detection)","abbr":"","aliases":["触地检测","足端接触估计","Foot Contact Estimation"],"one_liner":"判断足式机器人每只脚此刻是踩在地上，还是悬在空中。","explanation":"接触估计是足式机器人状态估计中的一个子问题：每个控制周期判断各条腿是否触地，常输出一个接触概率。做法大致有几类：读足底力传感器并设阈值；用关节力矩和动力学模型反推地面反作用力；结合步态相位、足端高度做概率融合；或像 Lin 等人（CoRL 2021）那样，用神经网络从关节编码器、IMU（惯性测量单元）等本体感知数据学出触地事件，不需要额外的接触传感器。下游模块都依赖这个判断：腿式里程计假设触地的脚不动，以此反推机身速度，判错就会漂移；控制器也要据此切换支撑相和摆动相。","example":"四足机器人在碎石上小跑时，如果把一只正在打滑的脚判成「稳定触地」，基于不变扩展卡尔曼滤波的腿式里程计就会把打滑误当成机身移动，位置估计随之漂走。","related":["腿式里程计","不变扩展卡尔曼滤波","状态估计","足底力传感器","学习型状态估计器","支撑相 / 摆动相"]},{"id":"tactile-sensor","category":"perception","sec":3,"tier":1,"sources":[{"title":"Wikipedia: Tactile sensor","url":"https://en.wikipedia.org/wiki/Tactile_sensor"},{"title":"arXiv 2005.14679: DIGIT: A Novel Design for a Low-Cost Compact High-Resolution Tactile Sensor","url":"https://arxiv.org/abs/2005.14679"}],"as_of":"","related_ids":["vision-based-tactile-sensor","electronic-skin","gelsight","digit","slip-detection","visuo-tactile-fusion"],"name":"触觉传感器","alt":"Tactile Sensor","abbr":"","aliases":["触觉感知","Tactile Sensing","触觉"],"one_liner":"让机器人感知接触的传感器，测压力分布、接触位置、剪切力和滑动。","explanation":"触觉传感器测量机器人与物体接触时产生的信息，包括压力分布、接触位置、法向力和剪切力、振动与滑移，有的还能感知纹理和温度。按原理有压阻式、电容式、压电式、磁性式，以及视触觉式：在透明弹性体后放一个小相机，拍下接触时胶面的形变，代表有 MIT 起源的 GelSight，和 Facebook AI 等 2020 年发表的开源低成本传感器 DIGIT。相机看不到手指和物体贴合的那一小块，也测不出重量、软硬和摩擦，而拧瓶盖、插线、捏鸡蛋恰恰依赖这些。触觉数据常以触觉图像或触元（taxel，单个触觉感应点）阵列的形式和视觉一起输入策略。","example":"DIGIT 论文中，研究者给多指机械手装上 DIGIT，用触觉信号训练神经网络控制器，让手在掌中拨动玻璃弹珠。","related":["视触觉传感器","电子皮肤","GelSight","DIGIT 视触觉传感器","滑移检测","视触觉融合"]},{"id":"electronic-skin","category":"perception","sec":3,"tier":2,"sources":[{"title":"Electronic skin（Wikipedia）","url":"https://en.wikipedia.org/wiki/Electronic_skin"},{"title":"ReSkin: versatile, replaceable, lasting tactile skins (arXiv 2111.00071)","url":"https://arxiv.org/abs/2111.00071"},{"title":"Meta AI: Teaching robots to perceive, understand, and interact through touch","url":"https://ai.meta.com/blog/teaching-robots-to-perceive-understand-and-interact-through-touch/"}],"as_of":"","related_ids":["tactile-sensor","piezoresistive-tactile-sensing","capacitive-tactile-sensing","taxel","reskin-anyskin","vision-based-tactile-sensor"],"name":"电子皮肤","alt":"Electronic Skin","abbr":"E-skin","aliases":["机器人皮肤","柔性触觉传感器","Robot Skin"],"one_liner":"贴在机器人表面、柔软可弯的大面积触觉传感层，模仿人的皮肤。","explanation":"电子皮肤指柔性、可拉伸、能贴合曲面的电子传感层，模仿人或动物皮肤感知压力、温度、应变等刺激，部分材料还能自修复。感压原理常见压阻式、电容式、压电式和磁性式，由大量触元（感压小单元）排成阵列。它起源于柔性电子和材料研究，也用于假肢和可穿戴健康监测。在机器人上，它能覆盖手掌、手臂乃至全身，感知接触位置、人机碰撞和握力分布，这是指尖大小的视触觉传感器做不到的；难点是耐磨、布线与串扰、单元一致性和标定。代表工作如 Meta 与卡内基梅隆大学的 ReSkin（CoRL 2021），用磁性原理让皮肤表层可以更换。","example":"在灵巧手手掌贴一层压阻式电子皮肤，抓握时读出每个触元的压力，得到一张压力分布图，判断物体压在手掌哪个区域、用了多大力。","related":["触觉传感器","压阻式触觉传感","电容式触觉传感","触觉单元（触元）","ReSkin / AnySkin","视触觉传感器"]},{"id":"tactile-array","category":"perception","sec":3,"tier":3,"sources":[{"title":"Tactile Sensing—From Humans to Humanoids (Dahiya et al., IEEE T-RO 2010)","url":"https://doi.org/10.1109/TRO.2009.2033627"}],"as_of":"","related_ids":["taxel","tactile-image","tactile-sensor","electronic-skin","piezoresistive-tactile-sensing","capacitive-tactile-sensing"],"name":"触觉阵列","alt":"Tactile Array","abbr":"","aliases":["触觉阵列传感器","阵列式触觉传感器"],"one_liner":"把很多个小触觉感应单元排成网格，测出接触面上各处的压力分布。","explanation":"触觉阵列是把许多触觉单元（taxel，每个能测一点压力）按行列排布在一块柔性电路或皮肤上的传感器。单个力传感器只能告诉你「总共受了多大力」，阵列则能给出压力在接触面上的分布：哪里在接触、接触面多大、形状如何、力的中心在哪。感应原理常见压阻式、电容式、压电式和磁性式，读出时一般按行列逐个扫描。它常装在灵巧手指尖、指腹和手掌，或做成大面积电子皮肤。设计上要在单元密度（空间分辨率）、采样速率、走线数量、耐磨性之间权衡。和用相机看凝胶变形的视触觉传感器相比，阵列式更薄、更容易贴在曲面上，但分辨率通常更低。","example":"在灵巧手每个指尖贴一片 4×4 的电容式触觉阵列，抓鸡蛋时能看到压力集中在哪几个单元，据此判断是否快要滑落。","related":["触觉单元（触元）","触觉图像","触觉传感器","电子皮肤","压阻式触觉传感","电容式触觉传感"]},{"id":"taxel","category":"perception","sec":3,"tier":3,"sources":[{"title":"Tactile Sensing—From Humans to Humanoids (Dahiya et al., IEEE T-RO 2010)","url":"https://doi.org/10.1109/TRO.2009.2033627"}],"as_of":"","related_ids":["tactile-array","tactile-image","tactile-sensor","electronic-skin","piezoresistive-tactile-sensing","uskin"],"name":"触觉单元（触元）","alt":"Taxel (Tactile Pixel)","abbr":"","aliases":["触点","触觉像素","taxel"],"one_liner":"触觉阵列里最小的感应单元，相当于触觉版的「像素」。","explanation":"Taxel 是 tactile（触觉）和 pixel（像素）的合成词，指触觉阵列中能独立输出读数的最小感应单元。就像图像由像素组成，触觉阵列由许多触元组成，每个触元测它所在那一小块区域的压力（有的还能测三个方向的力）。触元的数量和间距决定了触觉的空间分辨率：间距越小，越能分辨细小的形状和边缘；但触元越多，走线、读出电路和数据量也越大。描述一款触觉传感器时，常用「多少个触元」「触元间距多少毫米」来说明它的精细程度。视触觉传感器没有离散触元，通常用相机像素或标记点数量来类比。","example":"一片 16×16 的指尖触觉阵列有 256 个触元，每个触元输出一个压力值，拼起来就是一张 16×16 的触觉图像。","related":["触觉阵列","触觉图像","触觉传感器","电子皮肤","压阻式触觉传感","uSkin"]},{"id":"piezoresistive-tactile-sensing","category":"perception","sec":3,"tier":3,"sources":[{"title":"Piezoresistive effect - Wikipedia","url":"https://en.wikipedia.org/wiki/Piezoresistive_effect"},{"title":"Force-sensing resistor - Wikipedia","url":"https://en.wikipedia.org/wiki/Force-sensing_resistor"},{"title":"3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing (arXiv 2410.24091)","url":"https://arxiv.org/abs/2410.24091"}],"as_of":"","related_ids":["tactile-sensor","tactile-array","piezoelectric-tactile-sensing","capacitive-tactile-sensing","strain-gauge","3d-vitac"],"name":"压阻式触觉传感","alt":"Piezoresistive Tactile Sensing","abbr":"","aliases":["压阻式传感器","压阻式触觉阵列","力敏电阻（FSR）"],"one_liner":"靠材料受压后电阻变化来测压力，便宜、易做成大面积阵列。","explanation":"压阻效应指材料受力变形后电阻率改变，1856 年开尔文勋爵最早在金属中观察到，1954 年 Smith 发现硅、锗中的效应要大得多。压阻式触觉传感器把这一效应用在导电橡胶、导电聚合物薄膜或硅应变元件上：受压时电阻变化，测电阻就得压力；许多单元用行列电极交叉排成阵列，就能输出一张压力分布图。它结构简单、便宜、薄而柔软，能测静态力，是最常见的触觉方案之一，力敏电阻（FSR）即属此类；缺点是迟滞和漂移较大，精度偏低。3D-ViTac（2024）就把 Velostat 压阻膜夹在导电纱线之间，做成 16×16 的触觉垫。","example":"3D-ViTac 在夹爪手指上贴压阻触觉垫，单片连读取板成本约 20 美元，给策略提供每个触点的压力值。","related":["触觉传感器","触觉阵列","压电式触觉传感","电容式触觉传感","应变片","3D-ViTac"]},{"id":"capacitive-tactile-sensing","category":"perception","sec":3,"tier":3,"sources":[{"title":"A Flexible and Robust Large Scale Capacitive Tactile System for Robots (arXiv 1411.6837)","url":"https://arxiv.org/abs/1411.6837"},{"title":"Tactile sensor - Wikipedia","url":"https://en.wikipedia.org/wiki/Tactile_sensor"},{"title":"Capacitive sensing - Wikipedia","url":"https://en.wikipedia.org/wiki/Capacitive_sensing"}],"as_of":"","related_ids":["tactile-sensor","piezoresistive-tactile-sensing","piezoelectric-tactile-sensing","electronic-skin","taxel","proximity-sensor"],"name":"电容式触觉传感","alt":"Capacitive Tactile Sensing","abbr":"","aliases":["电容式传感器","电容式触觉传感器","电容皮肤"],"one_liner":"按压改变电极间距或介电层，用测到的电容变化推算接触力的触觉传感方式。","explanation":"电容式触觉传感是触觉传感器的主要原理之一，与压阻式、压电式、磁性式和视触觉并列。基本结构是两层电极夹一层可压缩的介电材料：受压时电极间距或重叠面积变化，电容随之改变，读出电路把它换算成压力；许多这样的单元（触元）排成阵列，就能给出接触压力的分布。优点是灵敏度高、可以做得小而薄且柔性、便于铺满大面积表面，还能感知人体靠近；缺点是易受寄生电容和电磁干扰、有温度漂移，弹性介电层会带来迟滞。典型例子是意大利理工学院（IIT）为 iCub 人形机器人做的大面积电容皮肤，改进版用 3D 织物做介电层来降低迟滞。","example":"在协作机械臂外壳上贴一层电容触觉皮肤，人手碰到或靠近某块区域时电容突变，控制器据此立刻减速或停机。","related":["触觉传感器","压阻式触觉传感","压电式触觉传感","电子皮肤","触觉单元（触元）","接近觉传感器"]},{"id":"piezoelectric-tactile-sensing","category":"perception","sec":3,"tier":3,"sources":[{"title":"Piezoelectric sensor - Wikipedia","url":"https://en.wikipedia.org/wiki/Piezoelectric_sensor"},{"title":"Tactile Robotics: An Outlook (arXiv 2508.11261)","url":"https://arxiv.org/abs/2508.11261"},{"title":"A-SLIP: Acoustic Sensing for Continuous In-hand Slip Estimation (arXiv 2604.08528)","url":"https://arxiv.org/abs/2604.08528"}],"as_of":"2026-04","related_ids":["tactile-sensor","piezoresistive-tactile-sensing","capacitive-tactile-sensing","slip-detection","contact-microphone","electronic-skin"],"name":"压电式触觉传感","alt":"Piezoelectric Tactile Sensing","abbr":"","aliases":["压电传感器","压电触觉传感器","PVDF 触觉"],"one_liner":"利用材料受力产生电荷的压电效应，感知接触和振动。","explanation":"压电式触觉传感利用压电效应：石英、锆钛酸铅（PZT）陶瓷或聚偏氟乙烯（PVDF）薄膜受力变形时表面会产生电荷，读出电信号就能感知力的变化。它响应快、频带宽，对滑动、碰撞、摩擦纹理产生的高频振动很敏感；但电荷会慢慢泄漏，测不了恒定的静态压力，所以常和压阻式或电容式单元搭配使用。它与压阻式、电容式、磁性式、光学式并列为主要触觉原理。近年不少机器人工作把压电麦克风当触觉用，例如 2026 年的 A-SLIP 在夹爪硅胶垫后放多个压电麦克风，用神经网络估计是否打滑以及滑移方向和大小。","example":"A-SLIP 在平行夹爪的纹理硅胶垫后装 4 个压电麦克风，物体开始下滑时的振动被识别出来，控制器随即加大夹持力。","related":["触觉传感器","压阻式触觉传感","电容式触觉传感","滑移检测","接触式麦克风（音频触觉）","电子皮肤"]},{"id":"magnetic-tactile-sensing","category":"perception","sec":3,"tier":3,"sources":[{"title":"ReSkin: versatile, replaceable, lasting tactile skins (CoRL 2021)","url":"https://arxiv.org/abs/2111.00071"},{"title":"AnySkin: Plug-and-play Skin Sensing for Robotic Touch","url":"https://arxiv.org/abs/2409.08276"}],"as_of":"2024-09","related_ids":["tactile-sensor","reskin-anyskin","uskin","vision-based-tactile-sensor","electronic-skin","slip-detection"],"name":"磁性触觉传感","alt":"Magnetic Tactile Sensing","abbr":"","aliases":["磁敏式触觉","霍尔式触觉传感","磁性触觉皮肤","Magnetic Tactile Skin"],"one_liner":"在软胶里掺磁性颗粒，用磁力计测变形引起的磁场变化来感知接触。","explanation":"磁性触觉传感是触觉传感器的一类做法：把磁化颗粒或小磁铁埋进柔软的弹性体，下方放霍尔传感器或磁力计。碰到物体时弹性体变形，磁源跟着移动，磁场读数随之改变，再用标定或机器学习把读数换算成接触位置、压力和剪切力（沿表面方向的力）。好处是软胶层和电路板分开，胶皮磨坏了可以直接换，成本低、形状容易做；缺点是易受外部磁场和附近电机干扰，空间分辨率通常不如视触觉传感器。代表工作有卡内基梅隆大学与 Meta 合作的 ReSkin（CoRL 2021），以及 Lerrel Pinto 团队的 AnySkin（2024），后者主打换一块新皮肤后，已学好的操作策略不用重新标定也能继续用。","example":"AnySkin 论文把磁性皮肤装在夹爪指尖上做滑移检测和策略学习，并展示了换上另一块新皮肤后策略仍可直接使用。","related":["触觉传感器","ReSkin / AnySkin","uSkin","视触觉传感器","电子皮肤","滑移检测"]},{"id":"reskin-anyskin","category":"perception","sec":3,"tier":3,"sources":[{"title":"ReSkin: versatile, replaceable, lasting tactile skins (arXiv 2111.00071)","url":"https://arxiv.org/abs/2111.00071"},{"title":"ReSkin 项目主页","url":"https://reskin.dev/"},{"title":"AnySkin: Plug-and-play Skin Sensing for Robotic Touch 项目主页","url":"https://any-skin.github.io/"}],"as_of":"2024-09","related_ids":["tactile-sensor","magnetic-tactile-sensing","electronic-skin","slip-detection","tactile-representation-learning","vision-based-tactile-sensor"],"name":"ReSkin / AnySkin","alt":"ReSkin / AnySkin","abbr":"","aliases":["ReSkin","AnySkin"],"one_liner":"磁性触觉皮肤：软皮里掺磁粉，下方磁力计读磁场变化来感知接触。","explanation":"ReSkin 由卡内基梅隆大学和 Meta AI（FAIR）的 Bhirangi、Hellebrekers、Majidi、Gupta 提出，发表于 CoRL 2021。它在弹性体里混入磁化颗粒，受压变形时磁场改变，由下方的磁力计电路测出，据此估计接触位置和力。软皮易磨损但与电路分离，可直接换新，再用自监督学习适应新皮肤。2024 年纽约大学 Lerrel Pinto 组等推出 AnySkin，简化制作和安装，像套手机壳一样装到夹爪或灵巧手上，并让不同皮肤个体的信号更一致：同一操作策略换皮后性能下降约 13%，ReSkin 约为 43%。AnySkin 开源了设计文件，也有商业渠道可购买。","example":"在 Franka 夹爪指面装上 AnySkin，用触觉信号学插 USB，换一片新皮肤后策略仍基本可用。","related":["触觉传感器","磁性触觉传感","电子皮肤","滑移检测","触觉表征学习","视触觉传感器"]},{"id":"uskin","category":"perception","sec":3,"tier":3,"sources":[{"title":"XELA Robotics 官网","url":"https://www.xelarobotics.com/"},{"title":"Self-supervised perception for tactile skin covered dexterous hands (Sparsh-skin, arXiv:2505.11420)","url":"https://arxiv.org/abs/2505.11420"}],"as_of":"2026-09","related_ids":["tactile-sensor","magnetic-tactile-sensing","electronic-skin","allegro-hand","slip-detection","xela-robotics"],"name":"uSkin","alt":"uSkin (XELA Robotics)","abbr":"","aliases":["XELA uSkin","Xela 触觉皮肤"],"one_liner":"XELA 的磁性触觉皮肤，每个触点能同时测压力和剪切力。","explanation":"日本 XELA Robotics 的触觉传感器产品线；XELA 2018 年从早稻田大学分拆成立，总部在东京。uSkin 属于磁性触觉传感：柔软表层受力变形时内部磁场改变，磁传感器读出磁通变化，每个触元（一个感应单元）给出法向压力和切向剪切力。它有贴夹爪、贴灵巧手和贴任意表面的版本，研究中常装在 Allegro 灵巧手的指尖、指节和手掌上，用来做滑移检测和接触力估计。磁信号难解读、标定麻烦，2025 年 Akash Sharma 等人的 Sparsh-skin 就是用自监督学习给这类手部磁性触觉皮肤训练通用表征。","example":"Allegro 灵巧手的指尖贴上 uSkin，抓杯子时根据剪切力的突变判断物体快要滑落，随即加大握力。","related":["触觉传感器","磁性触觉传感","电子皮肤","Allegro 灵巧手","滑移检测","XELA Robotics"]},{"id":"paxini-px-6ax","category":"perception","sec":3,"tier":3,"sources":[{"title":"帕西尼 PX6AX GEN4 产品页","url":"https://www.paxini.com/cn/ax/gen4"},{"title":"帕西尼 PX6AX GEN3 产品页","url":"https://www.paxini.com/cn/ax/gen3"},{"title":"帕西尼感知官网","url":"https://www.paxini.com/cn"}],"as_of":"2026-09","related_ids":["tactile-sensor","paxini-tech","paxini-tora-one","dexterous-hand","normal-force-and-tangential-force","slip-detection"],"name":"帕西尼 PX-6AX 多维触觉传感器","alt":"PaXini PX-6AX Multi-dimensional Tactile Sensor","abbr":"","aliases":["PX6AX","PX6AX GEN3","PX6AX GEN4"],"one_liner":"帕西尼感知的多维触觉传感器，能输出分布力、合力和力矩。","explanation":"PX-6AX 是帕西尼感知（PaXini）的触觉传感器系列，官网称为 ITPU 多维触觉传感单元，已出到第四代 GEN4，换能原理未详细公开。它输出三维阵列分布力、三维合力和三维力矩，官方称可解析 15 种以上触觉参数。据官网参数：法向量程 0–25 N、切向 ±10 N，空间分辨率 0.1 mm，最大输出频率 1000 Hz，IP68 防护，并强调芯片级抗磁；最小可识别力 GEN3 为 0.01 N、GEN4 为 0.005 N。有指尖到手掌垫片多种尺寸，用于灵巧手指尖、夹爪和机器人皮肤，帕西尼自家的 DexH13 灵巧手和 TORA-ONE 人形机器人都主打这类触觉。","example":"把 PX-6AX 装在灵巧手指尖，捏取鸡蛋时同时读出法向压力和切向力，切向力突然变大就提示将要打滑。","related":["触觉传感器","帕西尼感知","帕西尼 TORA-ONE","灵巧手","法向力与切向力（剪切力）","滑移检测"]},{"id":"biotac","category":"perception","sec":3,"tier":3,"sources":[{"title":"Interpreting and Predicting Tactile Signals for the SynTouch BioTac (NVIDIA, arXiv:2101.05452)","url":"https://arxiv.org/abs/2101.05452"},{"title":"ACROSS: A Deformation-Based Cross-Modal Representation for Robotic Tactile Perception (arXiv:2411.08533)","url":"https://arxiv.org/abs/2411.08533"}],"as_of":"2024-11","related_ids":["tactile-sensor","slip-detection","electronic-skin","vision-based-tactile-sensor","gelsight","dexterous-hand"],"name":"BioTac","alt":"BioTac (SynTouch biomimetic fingertip tactile sensor)","abbr":"","aliases":["SynTouch BioTac","BioTac SP","仿生指尖触觉传感器"],"one_liner":"SynTouch 公司的仿人指尖触觉传感器，可感知接触力、微振动和温度。","explanation":"BioTac 是美国 SynTouch 公司推出的指尖形触觉传感器，源自 Gerald Loeb 团队（Wettels、Fishel 等）的仿生触觉研究。它的结构是刚性内核外包橡胶皮肤，中间充有导电液体；内核表面布有 19 个感测电极和 4 个激励电极，接触时液层变形，各电极电压随之变化，可据此推断接触位置、力的大小和方向。它还能感知微振动和温度，前者可用于识别纹理、检测打滑，后者可用于区分材料。BioTac 曾是机器人触觉研究的高端标杆，常装在灵巧手指尖，积累了滑移方向、抓取稳定性等公开数据集。它的问题是电极信号与形变的关系复杂、难以解释，英伟达 2021 年的论文专门为此建模。据 2024 年的相关论文描述，该传感器已停产，这些数据集也随之难以复用。","example":"BioTac SP 滑移方向数据集：把 BioTac 装在机械手指尖，记录抓取过程中的电极信号，用来训练模型判断物体正朝哪个方向滑动。","related":["触觉传感器","滑移检测","电子皮肤","视触觉传感器","GelSight","灵巧手"]},{"id":"vision-based-tactile-sensor","category":"perception","sec":3,"tier":2,"sources":[{"title":"GelSight: High-Resolution Robot Tactile Sensors for Estimating Geometry and Force (Sensors 2017)","url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC5751610/"},{"title":"DIGIT: A Novel Design for a Low-Cost Compact High-Resolution Tactile Sensor (RA-L 2020)","url":"https://arxiv.org/abs/2005.14679"}],"as_of":"","related_ids":["gelsight","digit","tactile-sensor","photometric-stereo","marker-tracking","tactile-image"],"name":"视触觉传感器","alt":"Vision-Based Tactile Sensor","abbr":"VBTS","aliases":["视觉触觉传感器","光学触觉传感器","Optical Tactile Sensor","GelSight 类传感器","Visuotactile Sensor"],"one_liner":"用内置相机拍软胶表面的形变，把触觉转成图像的触觉传感器。","explanation":"视触觉传感器在透明弹性胶体表面涂反光膜，内部放 LED 和微型相机；物体压上来时胶面变形，相机拍到的就是「触觉图像」。借助光度立体（由不同方向光照下的明暗反推表面法向）可重建接触面的细微几何，胶面标记点的位移则反映剪切力和滑移。代表是 MIT 的 GelSight（2009 年做出首个原型）和 Meta 2020 年开源设计的小型低成本 DIGIT，后者能装在灵巧手指尖。优点是分辨率高、输出就是图像，可直接用视觉网络处理；不足是胶面会磨损、传感器有一定厚度，力的数值还需额外标定。","example":"研究者把两个 DIGIT 装在 Allegro 灵巧手的两根手指上，根据触觉图像预测接触变化，用触觉模型预测控制在两指之间拨动玻璃弹珠。","related":["GelSight","DIGIT 视触觉传感器","触觉传感器","光度立体","标记点跟踪","触觉图像"]},{"id":"photometric-stereo","category":"perception","sec":3,"tier":3,"sources":[{"title":"Photometric stereo - Wikipedia","url":"https://en.wikipedia.org/wiki/Photometric_stereo"},{"title":"GelSight: High-Resolution Robot Tactile Sensors for Estimating Geometry and Force (Sensors 2017, PMC)","url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC5751610/"}],"as_of":"","related_ids":["vision-based-tactile-sensor","gelsight","tactile-image","surface-normal-estimation","digit","taxim-an-example-based-simulation-model-for-gelsight-tactile"],"name":"光度立体","alt":"Photometric Stereo","abbr":"","aliases":["光度立体法","光度立体视觉"],"one_liner":"相机不动、从多个方向打光拍照，由明暗反推表面朝向和形状。","explanation":"光度立体由 Woodham 于 1980 年提出。相机位置固定，从至少三个已知方向照亮物体；在朗伯反射（表面向各方向均匀漫反射）假设下，每个像素的亮度只取决于表面法向和光照方向，解一个小线性方程就得到该点法向，再把法向积分成深度图。它能恢复很细的表面起伏，但对金属、玻璃这类高光或透明表面效果差。在具身智能里，它最重要的用途是视触觉传感器：GelSight 用红、绿、蓝三色 LED 从不同方向照亮弹性胶面，相机拍一张图，就能靠标定好的查找表把颜色映射成法向，重建出接触面的三维形状。","example":"GelSight 指尖按在一枚硬币上，光度立体重建出的高度图能看出硬币表面的浮雕纹路。","related":["视触觉传感器","GelSight","触觉图像","法向量估计","DIGIT 视触觉传感器","Taxim"]},{"id":"gelsight","category":"perception","sec":3,"tier":2,"sources":[{"title":"Improved GelSight Tactile Sensor for Measuring Geometry and Slip (arXiv:1708.00922)","url":"https://arxiv.org/abs/1708.00922"},{"title":"GelSight 官网","url":"https://www.gelsight.com/"},{"title":"GelSight Mini 产品页","url":"https://www.gelsight.com/gelsightmini/"}],"as_of":"2026-09","related_ids":["vision-based-tactile-sensor","gelsight-mini","digit","photometric-stereo","marker-tracking","tactile-image"],"name":"GelSight","alt":"GelSight","abbr":"","aliases":["GelSight 视触觉传感器","GelSight Inc.","GelSight公司"],"one_liner":"用相机拍弹性胶体形变来测触觉的视触觉传感器，也是同名公司。","explanation":"GelSight 是一类视触觉传感器：一块表面覆有反光膜的弹性胶体，内部用 LED 从不同方向打光，相机从背面拍胶体被压出的形变，再用光度立体（根据不同方向光照下的明暗反推表面朝向）重建接触面的三维形状。它源自 MIT Edward Adelson 组，最早见于 Johnson 与 Adelson 2009 年的 CVPR 论文；后来在胶面上加标记点，通过点的移动测剪切力和滑移。GelSight 也是由此创办的公司 GelSight Inc.（美国马萨诸塞州沃尔瑟姆），产品有面向机器人的 GelSight Mini（支持 ROS/ROS2 和 PyTouch）和工业测量用的 Mobile、Modulus 等。DIGIT、GelSlim、9DTact 等都走同一条「相机看胶体」路线。","example":"夹爪指尖装上 GelSight Mini 抓起一颗螺丝，触觉图像里能看清螺纹压痕，可据此判断螺丝在手里的朝向，以及它有没有在滑动。","related":["视触觉传感器","GelSight Mini","DIGIT 视触觉传感器","光度立体","标记点跟踪","触觉图像"]},{"id":"gelsight-mini","category":"perception","sec":3,"tier":3,"sources":[{"title":"GelSight Mini 官方产品页","url":"https://www.gelsight.com/gelsightmini/"},{"title":"gelsightinc/gsrobotics GitHub（Mini SDK 与 FAQ）","url":"https://github.com/gelsightinc/gsrobotics"}],"as_of":"2026-09","related_ids":["gelsight","vision-based-tactile-sensor","photometric-stereo","marker-tracking","tactile-image","slip-detection"],"name":"GelSight Mini","alt":"GelSight Mini","abbr":"","aliases":[],"one_liner":"GelSight 公司的商用小型视触觉传感器，插 USB 即可用","explanation":"GelSight 公司推出的小型视触觉传感器，这家公司源自 MIT Edward Adelson 组的 GelSight 技术。传感器内部的相机拍摄软硅胶被按压后的形变，用光度立体恢复接触面的三维形状；胶面带标记点时，可以跟踪标记点位移来估计剪切力和滑动。官方称它是首款空间分辨率超过人类触觉的商用触觉传感器。据官方 GitHub，它用一根 USB 3 线同时供电和传数据，帧率 25 FPS，并提供 Python 示例做三维点云重建和标记点跟踪。它体积小、价格面向科研和爱好者，适合直接装在夹爪指尖，是实验室里常用的视触觉传感器之一。","example":"把两块 GelSight Mini 装在二指夹爪的两个指尖上，抓起物体后用触觉图像看接触区域和标记点位移，判断物体是否开始滑动。","related":["GelSight","视触觉传感器","光度立体","标记点跟踪","触觉图像","滑移检测"]},{"id":"digit","category":"perception","sec":3,"tier":2,"sources":[{"title":"DIGIT: A Novel Design for a Low-Cost Compact High-Resolution Tactile Sensor (arXiv 2005.14679)","url":"https://arxiv.org/abs/2005.14679"},{"title":"Meta AI: Teaching robots to perceive, understand, and interact through touch","url":"https://ai.meta.com/blog/teaching-robots-to-perceive-understand-and-interact-through-touch/"}],"as_of":"","related_ids":["vision-based-tactile-sensor","gelsight","digit-360","tacto-a-fast-flexible-and-open-source-simulator-for-high-res","tactile-image","agility-robotics-digit"],"name":"DIGIT 视触觉传感器","alt":"DIGIT","abbr":"","aliases":["Meta DIGIT","DIGIT tactile sensor"],"one_liner":"Meta 开源的低成本指尖大小视触觉传感器，用相机拍凝胶变形来感知接触。","explanation":"DIGIT 是 Facebook AI Research（现 Meta FAIR）2020 年在 IEEE RA-L 发表并开源的视触觉传感器。原理和 GelSight 类似：内部摄像头透过一层弹性凝胶拍摄，物体压上时凝胶变形，图像记下接触区域的形状和纹理，形成「触觉图像」。它小巧、便宜、易于制造，能装在多指灵巧手指尖，论文演示了在手中拨动玻璃弹珠。2021 年 Meta 宣布与 GelSight 合作量产，并开源了触觉库 PyTouch 和仿真器 TACTO；新一代是 Digit 360。它和 Agility Robotics 的人形机器人 Digit 只是同名，毫无关系。","example":"在夹爪两指各装一个 DIGIT，抓握时根据触觉图像里接触区域的位置判断物体是否夹正，或通过凝胶的剪切变形提前发现物体要滑落。","related":["视触觉传感器","GelSight","Digit 360","TACTO","触觉图像","Agility Digit 人形机器人"]},{"id":"digit-360","category":"perception","sec":3,"tier":3,"sources":[{"title":"Meta AI blog: Advancing embodied AI through progress in touch perception, dexterity, and human-robot interaction","url":"https://ai.meta.com/blog/fair-robotics-open-source/"},{"title":"arXiv 2411.02479: Digitizing Touch with an Artificial Multimodal Fingertip","url":"https://arxiv.org/abs/2411.02479"}],"as_of":"2024-11","related_ids":["vision-based-tactile-sensor","digit","gelsight","sparsh","taxel","meta-fundamental-ai-research"],"name":"Digit 360","alt":"Digit 360","abbr":"","aliases":["Meta Digit 360"],"one_liner":"Meta 发布的指尖形多模态触觉传感器，能感知力、振动、温度等。","explanation":"Digit 360 是 Meta FAIR 在 2024 年 10 月底发布的仿人指尖触觉传感器，由 GelSight 公司负责生产销售。它延续 DIGIT 这类视触觉传感器的原理（内部相机拍软胶表面的形变），但做成半球形指尖，能感受各个方向的接触。论文报告约 830 万个触元（触觉像素），可分辨 7 微米的表面细节，法向力和切向力分辨率约 1 mN，能感受最高 10 kHz 的振动，还能感知温度甚至气味；指尖内置 AI 加速芯片，可在本地做类似人类反射弧的快速处理。Meta 同时发布了触觉编码器 Sparsh 和把多种触觉传感器接到同一只手上的 Digit Plexus 平台。","example":"Meta 的 Digit Plexus 平台可以把 Digit 360、DIGIT、ReSkin 等触觉传感器装到同一只机械手上，只用一根线把数据传回主机，方便采集灵巧操作的触觉数据。","related":["视触觉传感器","DIGIT 视触觉传感器","GelSight","Sparsh","触觉单元（触元）","Meta FAIR"]},{"id":"gelslim","category":"perception","sec":3,"tier":3,"sources":[{"title":"GelSlim: A High-Resolution, Compact, Robust, and Calibrated Tactile-sensing Finger (arXiv 1803.00628)","url":"https://arxiv.org/abs/1803.00628"},{"title":"GelSlim3.0: High-Resolution Measurement of Shape, Force and Slip in a Compact Tactile-Sensing Finger (arXiv 2103.12269)","url":"https://arxiv.org/abs/2103.12269"}],"as_of":"2021-03","related_ids":["gelsight","vision-based-tactile-sensor","slip-detection","bin-picking","parallel-jaw-gripper","gelsight-mini"],"name":"GelSlim","alt":"GelSlim","abbr":"","aliases":["GelSlim 3.0"],"one_liner":"MIT 做的细长手指形视触觉传感器，能装在夹爪上抓东西","explanation":"MIT Alberto Rodriguez 课题组（MCube 实验室）与 Edward Adelson 等合作的一系列手指形视触觉传感器，属于 GelSight 家族。原版 GelSight 光路长、体积大，难以伸进杂乱环境；2018 年的初代 GelSlim（Donlon 等）用镜面和导光改造光路，把传感器做成细长手指，换上更耐磨的胶和织物表皮，并用标定保持成像稳定。2021 年的 GelSlim 3.0（Taylor、Dong、Rodriguez）进一步缩小，能实时测接触形状、估计三维接触力分布、检测初始滑移，指尖模块卡扣可换，设计和软件开源。","example":"把 GelSlim 3.0 装在小型平行夹爪上做料箱里的无序抓取，用触觉图像估计物体在手里的位置并检测是否开始打滑。","related":["GelSight","视触觉传感器","滑移检测","无序抓取","二指夹爪","GelSight Mini"]},{"id":"9dtact","category":"perception","sec":3,"tier":3,"sources":[{"title":"9DTact: A Compact Vision-Based Tactile Sensor for Accurate 3D Shape Reconstruction and Generalizable 6D Force Estimation (arXiv 2308.14277)","url":"https://arxiv.org/abs/2308.14277"},{"title":"9DTact project page","url":"https://linchangyi1.github.io/9DTact/"},{"title":"9DTact GitHub repository","url":"https://github.com/linchangyi1/9DTact"}],"as_of":"2024-05","related_ids":["vision-based-tactile-sensor","gelsight","digit","six-axis-force-torque-sensor","photometric-stereo","slip-detection"],"name":"9DTact","alt":"9DTact","abbr":"","aliases":["9DTact 视触觉传感器"],"one_liner":"清华许华哲团队等开源的小型视触觉传感器，能测接触形状和六维力。","explanation":"9DTact 是清华大学许华哲团队与上海期智研究院等机构提出的视触觉传感器，论文发表于 IEEE RA-L，并在 ICRA 2024 报告；名字里的「9D」指 3D 形状加 6D 力。它属于 GelSight 一类设计：内部摄像头拍一块软凝胶的背面，物体压上去时凝胶变形、反光变弱，图像明暗就反映接触深度。它利用半透明凝胶的光学特性，不需要在胶面加标记点，就能用神经网络从图像估计三个方向的力和三个方向的力矩；训练用了约 10 万对图像-力数据、来自 175 个物体，可泛化到没见过的物体。尺寸约 32.5×25.5×25.5 毫米，形状重建平均误差约 0.046 毫米。软硬件全部开源并附制作教程。","example":"把 9DTact 装在夹爪指尖，抓取时读出指尖受到的法向力和切向力，可用来判断物体是否开始打滑、要不要加大夹持力。","related":["视触觉传感器","GelSight","DIGIT 视触觉传感器","六维力传感器","光度立体","滑移检测"]},{"id":"daimon-dm-tac-visuotactile-sensor","category":"perception","sec":3,"tier":3,"sources":[{"title":"戴盟机器人：DM-Tac W2 通用视触觉传感器","url":"https://www.dmrobot.com/devices/dm-tac-w2.html"},{"title":"戴盟机器人：DM-Tac F 指尖视触觉传感器","url":"https://www.dmrobot.com/devices/dm-tac-f.html"},{"title":"戴盟机器人：关于我们","url":"https://www.dmrobot.com/about.html"}],"as_of":"2026-09","related_ids":["vision-based-tactile-sensor","daimon-robotics","daimon-infinity","gelsight","vision-tactile-language-action-model","tactile-data"],"name":"戴盟 DM-Tac 视触觉传感器","alt":"Daimon DM-Tac Visuotactile Sensor","abbr":"","aliases":["戴盟视触觉传感器","DM-Tac W2","DM-Tac X","DM-Tac F"],"one_liner":"戴盟机器人的视触觉传感器系列，靠内置相机拍接触面形变来感知力。","explanation":"DM-Tac 是深圳戴盟机器人的视触觉传感器产品线，公司孵化于香港科技大学，2023 年正式运营。视触觉传感器在弹性接触面后放一个小相机，通过拍摄接触面的形变推算接触形状和受力。据官网（2026 年）信息，系列包括通用款 DM-Tac W2（分 W2L、W2M 两种尺寸）、28° 尖头的锋刃款 DM-Tac X、装在灵巧手指尖的 DM-Tac F（覆盖指腹、指侧和指尖），以及集成传感器的二指夹爪 DM-Tac G。W2 和 X 的感知分辨率为 384×288（约 11 万个有效感知点）、采样频率 120Hz，官方称可输出接触形貌、三维形变场、三维分布力和六维集中力。戴盟也用这些传感器采集含触觉的机器人数据集。","example":"把两只 DM-Tac W2 装在二指夹爪两侧去夹鸡蛋，传感器实时给出接触面的形变和分布力，控制器据此调节夹持力，避免捏碎或滑落。","related":["视触觉传感器","戴盟机器人","戴盟 Daimon-Infinity 数据集","GelSight","视觉-触觉-语言-动作模型","触觉数据"]},{"id":"tactip","category":"perception","sec":3,"tier":3,"sources":[{"title":"The TacTip Family: Soft Optical Tactile Sensors with 3D-Printed Biomimetic Morphologies (Ward-Cherrier et al., Soft Robotics 2018)","url":"https://doi.org/10.1089/soro.2017.0052"}],"as_of":"","related_ids":["vision-based-tactile-sensor","marker-tracking","gelsight","tactile-sensor","slip-detection","tactile-image"],"name":"TacTip","alt":"TacTip","abbr":"","aliases":["仿生指尖触觉传感器","TacTip 家族"],"one_liner":"英国布里斯托机器人实验室做的仿生光学触觉指尖，用相机看内部标记针的移动。","explanation":"TacTip 是英国布里斯托机器人实验室（Bristol Robotics Laboratory）开发的一类光学触觉传感器，最早的版本在 2009 年前后发表。它模仿人类指尖皮肤下的真皮乳头结构：外面是一层柔软的半球形皮肤，内侧长着一排排带白色尖头的小针（标记点），中间填充透明凝胶，里面装一个相机。手指接触物体时皮肤变形，带动小针移动，相机追踪这些标记点的位移，就能推断接触位置、形状、边缘和剪切方向。它大部分零件可以 3D 打印，成本较低，后来衍生出不同尺寸和形状的「TacTip 家族」，可装在机械手指或夹爪上。与 GelSight 靠光照拍表面纹理不同，TacTip 走的是标记点跟踪路线。","example":"把 TacTip 装在机械臂末端，让它沿物体轮廓滑动，靠标记针的位移判断边缘方向，从而描出物体外形。","related":["视触觉传感器","标记点跟踪","GelSight","触觉传感器","滑移检测","触觉图像"]},{"id":"marker-tracking","category":"perception","sec":3,"tier":3,"sources":[{"title":"GelSight: High-Resolution Robot Tactile Sensors for Estimating Geometry and Force (Sensors 2017)","url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC5751610/"}],"as_of":"","related_ids":["vision-based-tactile-sensor","gelsight","slip-detection","photometric-stereo","normal-force-and-tangential-force","tactile-image"],"name":"标记点跟踪","alt":"Marker Tracking (Tactile Markers)","abbr":"","aliases":["标记点位移","凝胶标记点","Marker Displacement","Marker Flow"],"one_liner":"在视触觉传感器的软胶上印点阵，跟踪点的位移来估计剪切力和滑移。","explanation":"标记点跟踪是视触觉传感器（用相机拍软胶变形的触觉传感器，如 GelSight）常用的信号处理方法：在弹性体和反光涂层之间印上一排排黑点，接触时相机拍到这些点随胶面横向移动，逐点跟踪就得到一张位移场。Yuan、Dong、Adelson 2017 年的 GelSight 论文总结了读法：受法向压力时标记点从接触中心向外散开，受剪切力时整体朝剪切方向移动，出现旋转图案说明有面内扭矩，位移大小大致与力成正比；物体将要滑动时，接触区边缘的点先动而中心不动，这种不均匀可用来提前判断滑移。只看胶面凹凸（光度立体）只能得到形状，标记点补上了切向力信息。TacTip 这类传感器则以内壁标记针的位移作为主要信号。","example":"用装了 GelSight Mini 的夹爪夹杯子时，若外圈标记点开始朝同一方向移动、中心点基本不动，就说明杯子快要滑落，可以让夹爪加大握力。","related":["视触觉传感器","GelSight","滑移检测","光度立体","法向力与切向力（剪切力）","触觉图像"]},{"id":"slip-detection","category":"perception","sec":3,"tier":3,"sources":[{"title":"Slip Detection with Combined Tactile and Visual Information (arXiv)","url":"https://arxiv.org/abs/1802.10153"}],"as_of":"","related_ids":["tactile-sensor","vision-based-tactile-sensor","slip","friction-cone",null,"contact-detection"],"name":"滑移检测","alt":"Slip Detection","abbr":"","aliases":["打滑检测","滑动检测"],"one_liner":"判断手里抓着的物体是不是正在滑动，好及时加力或调整。","explanation":"滑移检测是在抓取和操作过程中，实时判断物体相对手指是否开始滑动（包括将要滑动的初期滑移）。常用信号有：触觉传感器上的切向力突变和振动、视触觉传感器（如 GelSight）表面标记点的位移场变化、力传感器中切向力与法向力之比逼近摩擦系数等。它解决的是「抓得太松会掉、抓得太紧会捏坏」的问题：检测到滑移后，控制器可以增大握力或调整姿态。对易碎、易变形或重量未知的物体，以及手内操作，这项能力很重要，也是触觉在机器人里最直接的用途之一。","example":"用 GelSight 观测接触面标记点，发现标记点整体位移变得不均匀时判定为开始打滑，夹爪随即加力。","related":["触觉传感器","视触觉传感器","打滑","摩擦锥","标记点跟踪（Tactile Markers）","接触检测"]},{"id":"extrinsic-contact-sensing","category":"perception","sec":3,"tier":3,"sources":[{"title":"Extrinsic Contact Sensing with Relative-Motion Tracking from Distributed Tactile Measurements (ICRA 2021)","url":"https://arxiv.org/abs/2103.08108"},{"title":"Perceiving Extrinsic Contacts from Touch Improves Learning Insertion Policies","url":"https://arxiv.org/abs/2309.16652"}],"as_of":"","related_ids":["contact-detection","tactile-sensor","peg-in-hole-insertion","contact-rich-manipulation","tool-use","extrinsic-dexterity"],"name":"外部接触感知","alt":"Extrinsic Contact Sensing","abbr":"","aliases":["外接触估计","外部接触估计","工具-环境接触感知","Extrinsic Contact Estimation"],"one_liner":"推断手中物体与外部环境在哪里、以什么方式接触的感知任务。","explanation":"机器人抓着物体干活时有两类接触：手指与物体之间的叫内部接触（intrinsic contact），被抓物体与桌面、孔壁等环境之间的叫外部接触（extrinsic contact）。外部接触发生在手外，往往被遮挡，手指也摸不到，只能间接推断。MIT 的 Ma、Dong、Rodriguez 在 ICRA 2021 论文中用分布式触觉传感器跟踪物体在手里的细微相对运动，结合不穿透、摩擦等刚体约束，估计出点接触或线接触的位置，并指出分布式触觉比只看六维力传感器的合力更适合做这件事。后续工作也用神经网络从触觉、视觉甚至声音推断接触位置。它对插孔装配、工具使用等接触丰富的任务很关键：知道哪里碰到了，才知道往哪边调整。","example":"Higuera 等人的 NCF-v2 从夹爪触觉推断被抓物体与环境的接触，接入插入策略后，把杯子放进杯托的成功率提高 33%、执行快 1.36 倍，把碗放进碗架的成功率提高 13%。","related":["接触检测","触觉传感器","轴孔装配","接触丰富操作","工具使用","外在灵巧性"]},{"id":"tactile-image","category":"perception","sec":3,"tier":3,"sources":[{"title":"GelSight: High-Resolution Robot Tactile Sensors for Estimating Geometry and Force (Yuan et al., Sensors 2017)","url":"https://www.mdpi.com/1424-8220/17/12/2762"}],"as_of":"","related_ids":["tactile-array","vision-based-tactile-sensor","gelsight","visuo-tactile-fusion","tactile-representation-learning","photometric-stereo"],"name":"触觉图像","alt":"Tactile Image","abbr":"","aliases":["触觉图","压力分布图"],"one_liner":"把触觉传感器的读数排成二维图像，方便直接用视觉模型处理。","explanation":"触觉图像指把触觉信号组织成二维图像的形式。它有两种来源：一是触觉阵列，每个触觉单元的读数当作一个像素，得到一张低分辨率的压力分布图；二是 GelSight、DIGIT 这类视触觉传感器，内部相机直接拍下软胶被压变形后的画面，本身就是一张彩色图像，能看清接触物体的纹理和形状。做成图像的好处是可以直接套用卷积网络、ViT 等现成视觉模型，也便于和相机画面一起输入策略做视触觉融合。连续采样的多帧触觉图像还能反映接触的变化过程，用来判断滑移或估计剪切力。","example":"用 GelSight 按压一枚硬币，得到的触觉图像能清楚看到硬币表面的浮雕纹路，再用光度立体法恢复出局部三维形状。","related":["触觉阵列","视触觉传感器","GelSight","视触觉融合","触觉表征学习","光度立体"]},{"id":"sparsh","category":"perception","sec":3,"tier":3,"sources":[{"title":"Sparsh: Self-supervised touch representations for vision-based tactile sensing (arXiv)","url":"https://arxiv.org/abs/2410.24090"},{"title":"facebookresearch/sparsh (GitHub)","url":"https://github.com/facebookresearch/sparsh"}],"as_of":"2024-10","related_ids":["tactile-representation-learning","vision-based-tactile-sensor","digit","self-supervised-learning","joint-embedding-predictive-architecture","anytouch"],"name":"Sparsh","alt":"Sparsh: Self-supervised Touch Representations for Vision-based Tactile Sensing (Meta)","abbr":"","aliases":[],"one_liner":"Meta 发布的视触觉通用表征模型，用自监督在大量触觉图像上预训练。","explanation":"Sparsh 是 Meta FAIR 等在 CoRL 2024 发表的一组触觉编码器，面向视触觉传感器（用相机拍软胶表面形变来感知接触的传感器）。以往每种传感器、每个任务都要单独标注数据训练；Sparsh 改用自监督学习，在 46 万张以上的无标注触觉图像上用 MAE、DINO、JEPA 等方法预训练，得到可跨 DIGIT、GelSight 2017、GelSight Mini 等传感器通用的表征。作者同时发布 TacBench 基准（六类任务，从识别触觉属性到力估计、滑移检测和操作规划）。论文报告，在 TacBench 上自监督预训练平均比针对任务和传感器的端到端训练高 95.1%。代码和权重已开源。","example":"把 Sparsh 编码器接在 DIGIT 传感器后面，只用少量标注数据就能训练出力估计或滑移检测头。","related":["触觉表征学习","视触觉传感器","DIGIT 视触觉传感器","自监督学习","联合嵌入预测架构","AnyTouch"]},{"id":"anytouch","category":"perception","sec":3,"tier":3,"sources":[{"title":"AnyTouch (ICLR 2025, arXiv:2502.12191)","url":"https://arxiv.org/abs/2502.12191"},{"title":"AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception (arXiv:2602.09617)","url":"https://arxiv.org/abs/2602.09617"}],"as_of":"2026-02","related_ids":["vision-based-tactile-sensor","tactile-representation-learning","gelsight-mini","digit","sparsh","visuo-tactile-fusion"],"name":"AnyTouch","alt":"AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors","abbr":"","aliases":["AnyTouch 2（后续版本）"],"one_liner":"人大胡迪团队等提出的跨多种视触觉传感器的统一触觉表征模型，兼顾静态和动态。","explanation":"AnyTouch 是中国人民大学胡迪团队联合北京邮电大学方斌等人提出的视触觉表征学习框架，发表于 ICLR 2025。视触觉传感器用相机拍弹性胶层的形变，但不同型号成像差别大，数据和模型难以通用。作者先采集 TacQuad 数据集：用 GelSight Mini、DIGIT、自制的 DuraGel 和 Tac3D 四种传感器触碰同一物体的同一位置，得到 72,606 帧对齐的接触数据，并配有视觉图像和触觉属性的文字描述。模型同时接收触觉图像和触觉视频，用掩码建模学像素级细节，再通过与视觉、语言对齐以及跨传感器匹配，学出与传感器无关的语义特征。团队 2026 年 2 月又发布 AnyTouch 2，重点转向带力信息的动态触觉感知。","example":"论文的真机实验中，机械臂只凭触觉反馈从圆筒里倒出 60 克小珠，用倒出质量与目标质量的误差评估不同触觉表征的效果。","related":["视触觉传感器","触觉表征学习","GelSight Mini","DIGIT 视触觉传感器","Sparsh","视触觉融合"]},{"id":"contact-microphone","category":"perception","sec":3,"tier":3,"sources":[{"title":"Hearing Touch: Audio-Visual Pretraining for Contact-Rich Manipulation (arXiv 2405.08576)","url":"https://arxiv.org/abs/2405.08576"},{"title":"ManiWAV: Learning Robot Manipulation from In-the-Wild Audio-Visual Data (arXiv 2406.19464)","url":"https://arxiv.org/abs/2406.19464"}],"as_of":"","related_ids":["tactile-sensor","multimodal-perception","universal-manipulation-interface","contact-rich-manipulation","visuo-tactile-fusion","microphone-array"],"name":"接触式麦克风（音频触觉）","alt":"Contact Microphone (Audio as Tactile Signal)","abbr":"","aliases":["接触麦克风","压电接触式麦克风","Piezo Contact Microphone"],"one_liner":"贴在夹爪或物体上拾取接触振动的麦克风，被当作廉价的触觉传感器。","explanation":"接触式麦克风不收空气中的声音，而是贴在固体表面拾取振动，常见的是压电式。机器人领域把它当作便宜、耐用的触觉替代品：刮擦、碰撞、摩擦、摇晃时的高频振动，能反映接触是否发生、表面是什么材质、容器里有没有东西，这些往往是摄像头看不到的。Hearing Touch（ICRA 2024）用接触式麦克风充当触觉，并借助大规模音视频预训练得到的表征提升操作策略；ManiWAV（CoRL 2024）在 UMI 手持夹爪的一根手指里埋入压电接触式麦克风，让采集的人类演示同时带画面和声音。局限是交互本身不出声时它帮不上忙。","example":"ManiWAV 的倒骰子任务里，机器人先摇一摇杯子，靠接触式麦克风听有没有骰子撞击的振动，判断杯子是否已经倒空。","related":["触觉传感器","多模态感知","通用操作接口","接触丰富操作","视触觉融合","麦克风阵列"]},{"id":"visuo-tactile-fusion","category":"perception","sec":3,"tier":3,"sources":[{"title":"Making Sense of Vision and Touch: Self-Supervised Learning of Multimodal Representations for Contact-Rich Tasks (arXiv)","url":"https://arxiv.org/abs/1810.10191"},{"title":"3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing (arXiv)","url":"https://arxiv.org/abs/2410.24091"}],"as_of":"","related_ids":["multimodal-fusion","tactile-sensor","vision-based-tactile-sensor","3d-vitac","contact-rich-manipulation","vision-tactile-language-action-model"],"name":"视触觉融合","alt":"Visuo-Tactile Fusion","abbr":"","aliases":["视觉-触觉融合","Visual-Tactile Fusion"],"one_liner":"把相机看到的和触觉传感器摸到的信息合起来使用","explanation":"视触觉融合指在感知或策略里同时用视觉和触觉信号，并把两者合成一个统一表示。视觉擅长看全局、找目标，但手指一碰到物体常被遮挡，也看不出力的大小和是否打滑；触觉传感器正好补上接触位置、压力分布和滑移信息。常见做法有：两路分别编码后拼接特征、用注意力做跨模态融合，或把触觉读数投到三维点云里和视觉点云合并。斯坦福团队 ICRA 2019 用自监督学习融合视觉与力觉完成轴孔插入；CoRL 2024 的 3D-ViTac 把柔性触觉阵列并入点云、配合扩散策略处理易碎物体，明显好于只用视觉。注意别和「视触觉传感器」混淆，后者是一种用摄像头拍弹性膜的触觉传感器。","example":"机械手抓鸡蛋时，相机负责找到鸡蛋并引导手靠近，接触后由触觉阵列反馈压力分布，策略据此把握力控制在不捏碎的范围内。","related":["多模态融合","触觉传感器","视触觉传感器","3D-ViTac","接触丰富操作","视觉-触觉-语言-动作模型"]},{"id":"camera-calibration","category":"perception","sec":4,"tier":2,"sources":[{"title":"Zhang, A Flexible New Technique for Camera Calibration (IEEE TPAMI 2000)","url":"https://www.microsoft.com/en-us/research/publication/a-flexible-new-technique-for-camera-calibration/"},{"title":"MATLAB: What Is Camera Calibration?","url":"https://www.mathworks.com/help/vision/ug/camera-calibration.html"}],"as_of":"","related_ids":["camera-intrinsics","camera-extrinsics","lens-distortion","calibration-board","hand-eye-calibration","pinhole-camera-model"],"name":"相机标定","alt":"Camera Calibration","abbr":"","aliases":["内参标定","张正友标定法"],"one_liner":"求出相机内参、畸变系数和外参，让像素和三维坐标能互相换算。","explanation":"相机标定是估计相机成像参数的过程，包括内参（焦距、主点即光轴落在图像上的位置）、镜头畸变系数（径向和切向），以及外参（相机相对某参考系的旋转和平移）。最常用的是张正友 2000 年发表在 IEEE TPAMI 的方法：拿平面标定板在至少两个不同姿态下拍摄，先求闭式解，再用最大似然优化统一细化。标定好坏常看重投影误差，即把三维点按估计参数投回图像后与实际检测点的像素距离。没有准确的内外参，机器人就无法把深度图变成点云，也无法把视觉结果换算到机械臂坐标系；深度相机出厂一般带内参，但相机与机械臂的关系仍要自己标。","example":"用 OpenCV 的 calibrateCamera 处理二十来张棋盘格照片，得到 fx、fy（以像素计的焦距）、主点 cx、cy 和一组畸变系数，同时报告平均重投影误差，数值越小说明标定越好。","related":["相机内参","相机外参","镜头畸变","标定板","手眼标定","针孔相机模型"]},{"id":"calibration-board","category":"perception","sec":4,"tier":2,"sources":[{"title":"OpenCV Tutorial: Detection of ChArUco Boards","url":"https://raw.githubusercontent.com/opencv/opencv/4.x/doc/tutorials/objdetect/charuco_detection/charuco_detection.markdown"},{"title":"MATLAB: What Is Camera Calibration?","url":"https://www.mathworks.com/help/vision/ug/camera-calibration.html"}],"as_of":"","related_ids":["camera-calibration","hand-eye-calibration","aruco-marker","apriltag","camera-intrinsics","lens-distortion"],"name":"标定板","alt":"Calibration Board (Checkerboard / ChArUco)","abbr":"","aliases":["棋盘格","ChArUco 板","圆点标定板","标定靶","Calibration Target"],"one_liner":"印有已知尺寸图案的平板，给相机标定提供精确的参考点。","explanation":"标定板是做相机标定、手眼标定时用的平面靶标，图案尺寸事先精确已知。最常见的是黑白棋盘格：检测方格交界的内角点，能达到亚像素精度，但通常要求整块板完整出现在画面里。圆点阵列板用圆心作特征点。ChArUco 板把 ArUco 码嵌进棋盘格的白格，靠码识别每个角点的编号，所以被遮挡或只拍到一部分时仍可用，同时保留棋盘角点的精度，OpenCV 有现成支持。使用时要保证打印尺寸准确、板面平整（常用铝板或玻璃基板），并从多个角度和距离拍摄，让角点覆盖画面各处。","example":"用 OpenCV 生成一张 ChArUco 板，打印后贴在平整铝板上并量准方格边长，手持相机从十几个不同角度拍摄，再交给标定函数求内参和畸变。","related":["相机标定","手眼标定","ArUco码","AprilTag","相机内参","镜头畸变"]},{"id":"reprojection-error","category":"perception","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Reprojection error","url":"https://en.wikipedia.org/wiki/Reprojection_error"},{"title":"MathWorks: Evaluating the Accuracy of Single Camera Calibration","url":"https://www.mathworks.com/help/vision/ug/evaluating-the-accuracy-of-single-camera-calibration.html"},{"title":"Wikipedia: Bundle adjustment","url":"https://en.wikipedia.org/wiki/Bundle_adjustment"}],"as_of":"","related_ids":["camera-calibration","bundle-adjustment","perspective-n-point","triangulation","pinhole-camera-model","hand-eye-calibration"],"name":"重投影误差","alt":"Reprojection Error","abbr":"","aliases":["重投影残差","Re-projection Error"],"one_liner":"把估计的三维点按相机参数投回图像，与实际观测像素之间的距离。","explanation":"重投影误差衡量相机参数、相机位姿和三维点估计得准不准：把估计出的三维点按估计的内外参重新投影到图像上，与图像中实际观测到的对应像素相比，两者距离就是重投影误差，单位是像素。它是几何视觉里最常用的优化目标和质量指标：相机标定时，标定板角点的平均重投影误差越小越好，MATLAB 文档示例为 0.19 像素，偏大时可剔除误差最大的图片重新标定；光束法平差就是联合调整所有相机和三维点，使总重投影误差最小；PnP 求位姿、三角化、SLAM 后端也都围绕它优化。","example":"用棋盘格标定腕部相机，OpenCV 的 calibrateCamera 会返回整体 RMS 重投影误差；若发现某几张图的误差明显偏大（常是角点检测错位），删掉后重新标定。","related":["相机标定","光束法平差","PnP（透视n点）","三角化","针孔相机模型","手眼标定"]},{"id":"apriltag","category":"perception","sec":4,"tier":2,"sources":[{"title":"AprilTag（University of Michigan APRIL Lab）","url":"https://april.eecs.umich.edu/software/apriltag"},{"title":"AprilRobotics/apriltag（AprilTag 3）","url":"https://github.com/AprilRobotics/apriltag"}],"as_of":"","related_ids":["aruco-marker","hand-eye-calibration","perspective-n-point","camera-extrinsics","6d-object-pose-estimation","calibration-board"],"name":"AprilTag","alt":"AprilTag","abbr":"","aliases":["视觉标记","视觉基准标记","Fiducial Marker","AprilTag 3"],"one_liner":"印出来贴上的黑白方块码，相机看到就能算出它的编号和 6D 位姿。","explanation":"AprilTag 是密歇根大学 Edwin Olson 团队（APRIL 实验室）2011 年在 ICRA 提出的视觉基准标记系统，外观像简化的二维码。它只编码一个编号，不存大段信息，但检测器能稳定找到标签的四个角点，结合相机内参和标签实际边长，用 PnP 算出它相对相机的位置和朝向。机器人里常用它做手眼标定、给物体或工作台提供位姿真值、对齐多相机外参。当前开源版本是 AprilTag 3（C 实现，BSD 许可），提供 tag36h11、tagStandard41h12 等多个标签族，也能检测 ArUco 码。","example":"在工作台四角贴 tag36h11 标签，固定的第三视角相机检测到后即可求出台面相对相机的位姿，用它把几台相机统一到同一坐标系。","related":["ArUco码","手眼标定","PnP（透视n点）","相机外参","6D位姿估计","标定板"]},{"id":"aruco-marker","category":"perception","sec":4,"tier":3,"sources":[{"title":"OpenCV 教程：Detection of ArUco Markers","url":"https://github.com/opencv/opencv/blob/4.x/doc/tutorials/objdetect/aruco_detection/aruco_detection.markdown"},{"title":"ArUco 项目页（University of Córdoba, AVA group）","url":"https://www.uco.es/investiga/grupos/ava/portfolio/aruco/"}],"as_of":"","related_ids":["apriltag","calibration-board","hand-eye-calibration","perspective-n-point","camera-calibration","opencv"],"name":"ArUco码","alt":"ArUco Marker","abbr":"","aliases":["ArUco","ArUco 标记","方形基准标记","Fiducial Marker"],"one_liner":"黑边包着黑白方格编码的方形标签，相机识别它就能算出自己相对标签的位姿。","explanation":"ArUco 是西班牙科尔多瓦大学 AVA 研究组（Rafael Muñoz、Sergio Garrido 等）开发的方形基准标记及其开源检测库。每个标记外圈是粗黑边，内部是黑白方格组成的二进制矩阵，编码一个 ID：黑边便于在图像里快速找到，二进制编码可做错误检测和纠正，也能判断标记转了多少度。一组可用的编码叫字典，比如 4×4 标记含 16 位。一个标记的四个角点就足以用 PnP 求出相机相对标记的 6D 位姿。OpenCV 的 aruco 模块基于这个库，4.7 版起放进 objdetect 模块。机器人里常用于手眼标定、ChArUco 标定板（把 ArUco 嵌进棋盘格），或贴在物体、工作台上快速拿到位姿真值。它和 AprilTag 是同一类技术。","example":"采集数据时在桌角贴一个 ArUco 码，腕部相机每帧检测它，就能把相机位姿换算到桌面坐标系下，顺便检查手眼标定准不准。","related":["AprilTag","标定板","手眼标定","PnP（透视n点）","相机标定","OpenCV"]},{"id":"perspective-n-point","category":"perception","sec":4,"tier":3,"sources":[{"title":"Perspective-n-Point - Wikipedia","url":"https://en.wikipedia.org/wiki/Perspective-n-Point"}],"as_of":"","related_ids":["camera-intrinsics","6d-object-pose-estimation","random-sample-consensus","aruco-marker","hand-eye-calibration","opencv"],"name":"PnP（透视n点）","alt":"Perspective-n-Point","abbr":"PnP","aliases":["PnP 问题","透视 n 点问题","solvePnP"],"one_liner":"已知若干三维点和它们在图像中的位置，反求相机位姿。","explanation":"PnP 是计算机视觉的经典问题：相机内参已知时，给定 n 个三维点的坐标和它们在图像上的二维投影，求相机相对这些点的旋转和平移，共 6 个自由度。最少需要 3 对点（P3P），但 3 点最多有 4 个解，通常要第 4 个点消歧；Lepetit 等 2009 年提出的 EPnP 借 4 个虚拟控制点求解，计算量随点数线性增长。实际匹配常有错点，所以一般配合随机采样一致性（RANSAC）剔除外点，OpenCV 的 solvePnP、solvePnPRansac 是最常用的实现。机器人里常用它从标定板或 ArUco 码角点求位姿。","example":"相机拍到一个边长已知的 ArUco 码，把 4 个角点的三维坐标和检测到的像素坐标交给 solvePnP，就得到这个码相对相机的位置和朝向。","related":["相机内参","6D位姿估计","随机采样一致性","ArUco码","手眼标定","OpenCV"]},{"id":"hand-eye-calibration","category":"perception","sec":4,"tier":1,"sources":[{"title":"OpenCV calib3d.hpp：calibrateHandEye 与 AX=XB 说明","url":"https://raw.githubusercontent.com/opencv/opencv/4.x/modules/calib3d/include/opencv2/calib3d.hpp"},{"title":"Wikipedia: Hand eye calibration problem","url":"https://en.wikipedia.org/wiki/Hand_eye_calibration_problem"}],"as_of":"","related_ids":["eye-in-hand","eye-to-hand","camera-extrinsics","calibration-board","homogeneous-transformation-matrix","wrist-camera"],"name":"手眼标定","alt":"Hand-Eye Calibration","abbr":"","aliases":["AX=XB","相机-机械臂标定","手眼矩阵标定"],"one_liner":"求出相机和机械臂之间那个固定坐标变换的标定过程。","explanation":"手眼标定求的是「眼」（相机）和「手」（机械臂）之间固定不变的变换，分两种配置：眼在手上，相机装在末端，求相机相对末端法兰的位姿；眼在手外，相机固定在旁边，求相机相对机器人基座的位姿。做法是让机械臂换多个姿态，每次同时记录末端位姿和相机看到的标定板位姿，问题可写成 AX=XB，X 就是要求的变换。Tsai-Lenz（1989）等经典解法都已在 OpenCV 的 calibrateHandEye 里实现。至少要两次旋转轴不平行的运动，即至少 3 个姿态，实际应多采一些。标定不准，相机看到的物体换算到机械臂坐标就会偏，抓取直接失败。","example":"腕部相机标定：机械臂带着相机从十几个角度拍一块固定的 ChArUco 标定板，用正运动学读末端位姿、用 PnP 算标定板相对相机的位姿，再调用 OpenCV 的 calibrateHandEye 解出相机相对法兰的变换。","related":["眼在手上","眼在手外","相机外参","标定板","齐次变换矩阵","腕部相机"]},{"id":"eye-in-hand","category":"perception","sec":4,"tier":2,"sources":[{"title":"MoveIt: Hand-Eye Calibration Tutorial","url":"https://moveit.picknik.ai/main/doc/examples/hand_eye_calibration/hand_eye_calibration_tutorial.html"},{"title":"DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset","url":"https://droid-dataset.github.io/"}],"as_of":"","related_ids":["eye-to-hand","hand-eye-calibration","wrist-camera","visual-servoing","third-person-camera","forward-kinematics"],"name":"眼在手上","alt":"Eye-in-Hand","abbr":"","aliases":["相机装在末端","手上眼","Eye-in-Hand Camera"],"one_liner":"把相机固定在机械臂末端、随手一起运动的安装方式。","explanation":"眼在手上是手眼系统的一种相机安装方式：相机固定在机械臂末端或夹爪上，随末端一起运动；相对的是相机固定在环境中的「眼在手外」。好处是能近距离看目标、不易被手臂挡住，适合精细对准和视觉伺服；缺点是视野窄、看不到全局，且每一时刻都要用正运动学算出的末端位姿，乘上一次性标好的相机到末端变换，才能把观测换到基坐标系。这个变换由手眼标定求出（经典形式 AX=XB）。学习型策略里的腕部相机就是这种配置，常与第三视角相机一起输入，例如 DROID 平台在 Franka 手腕上装了 ZED Mini 双目相机。","example":"抓取时先用固定的第三视角相机粗略定位物体，机械臂靠近后改看腕部相机的近距离图像，微调夹爪位置再闭合。","related":["眼在手外","手眼标定","腕部相机","视觉伺服","第三视角相机","正运动学"]},{"id":"eye-to-hand","category":"perception","sec":4,"tier":2,"sources":[{"title":"easy_handeye: eye-in-hand and eye-on-base calibration (GitHub)","url":"https://github.com/IFL-CAMP/easy_handeye"},{"title":"MoveIt 2 Hand-Eye Calibration Tutorial","url":"https://moveit.picknik.ai/main/doc/examples/hand_eye_calibration/hand_eye_calibration_tutorial.html"}],"as_of":"","related_ids":["hand-eye-calibration","eye-in-hand","camera-extrinsics","calibration-board","third-person-camera","aruco-marker"],"name":"眼在手外","alt":"Eye-to-Hand","abbr":"","aliases":["固定相机标定","眼在手外标定","Eye-on-Base","Eye-to-Hand Calibration"],"one_liner":"相机固定在机器人外部、不随机械臂运动的安装方式，及对应的手眼标定。","explanation":"手眼标定的两种配置之一：相机装在三脚架、桌边或支架上，相对机器人底座固定，不跟着机械臂动；另一种是「眼在手上」，相机装在末端随手运动。眼在手外要求的是相机到机器人基坐标系的固定变换（相机外参），有了它，相机里看到的物体位置才能换算成机械臂能执行的坐标。标定时把标定板或 ArUco 码固定在末端，让机械臂摆出多组姿态、相机逐一拍摄，再解 AX=XB 形式的方程，常用 Tsai-Lenz 等算法，MoveIt、easy_handeye 都有现成工具。它的好处是视野稳定、能看全工作台；缺点是容易被手臂挡住，相机一被碰动就得重标。","example":"桌边三脚架上放一台深度相机俯视工作台，把 ChArUco 标定板夹在机械臂末端，让手臂换十几个姿态各拍一张，解出相机相对基座的位姿；之后相机检测到的杯子坐标就能直接发给机械臂去抓。","related":["手眼标定","眼在手上","相机外参","标定板","第三视角相机","ArUco码"]},{"id":"depth-to-color-alignment","category":"perception","sec":4,"tier":3,"sources":[{"title":"librealsense rs-align example (IntelRealSense GitHub)","url":"https://github.com/IntelRealSense/librealsense/tree/master/examples/align"},{"title":"realsense-ros README (align_depth.enable)","url":"https://github.com/IntelRealSense/realsense-ros"}],"as_of":"","related_ids":["depth-camera","camera-intrinsics","camera-extrinsics","projection-back-projection","point-cloud","realsense-depth-camera"],"name":"深度与彩色对齐","alt":"Depth-to-Color Alignment (Depth Registration)","abbr":"","aliases":["RGB-D 对齐","深度配准","align_depth","深度图对齐到彩色图"],"one_liner":"把深度图重投影到彩色相机的视角，让两张图的像素一一对应。","explanation":"RGB-D 相机里测深度的传感器和彩色镜头装在机身不同位置，内参和视角都不同，直接叠在一起时同一像素并不对应同一个点。对齐的做法是：用深度相机内参把每个深度像素反投影成三维点，用两颗传感器间的外参把点变换到彩色相机坐标系，再用彩色相机内参投影到彩色图平面。得到的深度图和彩色图分辨率、视角一致，在彩色图上检测出的框、分割出的掩码就能直接取深度、生成带颜色的点云。英特尔 RealSense SDK 的 rs2::align 和 ROS 2 驱动的 align_depth.enable 参数做的就是这件事。对齐结果是计算出的近似：换视角会引入重采样，被遮挡区域会出现空洞或错位，物体边缘尤其明显。","example":"在 ROS 2 里启动 RealSense 驱动并打开 align_depth.enable，会多发布 /camera/camera/aligned_depth_to_color/image_raw 话题；抓取程序在彩色图上框出杯子后，按同一像素坐标去这张深度图取值，再反投影得到杯子的三维位置。","related":["深度相机","相机内参","相机外参","投影与反投影","点云","RealSense 深度相机（D435i / D405）"]},{"id":"camera-imu-calibration","category":"perception","sec":4,"tier":3,"sources":[{"title":"ethz-asl/kalibr（GitHub）","url":"https://github.com/ethz-asl/kalibr"},{"title":"Online Temporal Calibration for Monocular Visual-Inertial Systems (arXiv 1808.00692, IROS 2018)","url":"https://arxiv.org/abs/1808.00692"}],"as_of":"","related_ids":["visual-inertial-odometry","kalibr","inertial-measurement-unit","camera-extrinsics","multi-sensor-time-synchronization-timestamp-alignment","allan-variance"],"name":"相机-IMU联合标定","alt":"Camera-IMU Calibration","abbr":"","aliases":["视觉惯性标定","相机 IMU 外参与时延标定","Visual-Inertial Calibration"],"one_liner":"求出相机与 IMU 之间的相对位姿和时间偏移，让两路数据能对齐融合。","explanation":"视觉惯性里程计（VIO，用相机加 IMU 估计自身运动）要把两种传感器的数据放在一起算，前提是知道它们的空间外参（IMU 相对相机的旋转和平移）和时间偏移（两者时间戳之间因触发、传输造成的固定延迟），求这两样就是相机-IMU 联合标定。最常用的离线工具是 ETH 开源的 Kalibr，方法来自 Furgale 等人 IROS 2013 的工作：用连续时间 B 样条表示运动轨迹，对着 Aprilgrid 标定板把设备沿各个轴充分晃动，同时优化外参和时间偏移；IMU 的噪声参数通常先用 Allan 方差测好作为输入。VINS-Mono 等系统还能在运行中在线估计时间偏移（Qin 与 Shen，IROS 2018）。标定不准时，VIO 会明显漂移甚至发散。","example":"给手持数据采集设备上的 RealSense D435i 做标定：录一段对着 Aprilgrid 做平移和旋转的数据包，用 Kalibr 求出相机到 IMU 的变换矩阵和时间偏移（通常是毫秒级），写进 VINS-Fusion 的配置文件。","related":["视觉惯性里程计","Kalibr","惯性测量单元","相机外参","多传感器时间同步（时间戳对齐）","Allan 方差（IMU 噪声标定）"]},{"id":"camera-lidar-extrinsic-calibration","category":"perception","sec":4,"tier":3,"sources":[{"title":"What Is Lidar-Camera Calibration? - MATLAB & Simulink","url":"https://www.mathworks.com/help/lidar/ug/lidar-and-camera-calibration.html"},{"title":"koide3/direct_visual_lidar_calibration（GitHub）","url":"https://github.com/koide3/direct_visual_lidar_calibration"}],"as_of":"","related_ids":["camera-extrinsics","lidar","multi-sensor-fusion","calibration-board","camera-calibration","birds-eye-view"],"name":"相机-激光雷达联合标定","alt":"Camera-LiDAR Extrinsic Calibration","abbr":"","aliases":["相机雷达外参标定","激光雷达-相机标定","LiDAR-Camera Calibration"],"one_liner":"求出激光雷达与相机之间的旋转和平移，让点云能准确投影到图像上。","explanation":"机器人和自动驾驶车常同时装激光雷达和相机：雷达给准确距离，相机给颜色和纹理。要融合二者，先要知道雷达坐标系相对相机坐标系的刚体变换（3 个旋转加 3 个平移参数），即外参。有标定板的方法用棋盘格、ChArUco 或 Aprilgrid，在图像里检测角点，在点云里拟合平面找到对应角点，再解出变换；无标定板的方法直接利用环境的结构和纹理配准，例如日本产综研（AIST）Koide 等人 ICRA 2023 开源的工具，也支持 Livox 这类非重复扫描雷达。结果用于给点云上色、把点云投到图像上辅助检测，或作为 BEV 融合感知的输入；常用的检查办法是看投影后的点云边缘是否与图像中物体边缘重合。","example":"四足机器人上装一台 Livox Mid-360 和一台 RGB 相机，标定后把点云投到图像上，检查台阶边缘的点是否落在图像里的台阶轮廓上，再用这组外参给点云上色建彩色地图。","related":["相机外参","激光雷达","多传感器融合","标定板","相机标定","鸟瞰图"]},{"id":"multi-sensor-time-synchronization","category":"perception","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Precision Time Protocol","url":"https://en.wikipedia.org/wiki/Precision_Time_Protocol"},{"title":"ROS 2 message_filters 文档（ExactTime / ApproximateTime 同步策略）","url":"https://raw.githubusercontent.com/ros2/message_filters/rolling/doc/index.rst"},{"title":"Orbbec Gemini 335L（硬件触发与多机统一硬件时间戳）","url":"https://www.orbbec.com/products/stereo-vision-camera/gemini-335l/"}],"as_of":"","related_ids":["multi-sensor-fusion","precision-time-protocol","camera-imu-calibration","observation-action-pair","visual-inertial-odometry","ros-bag"],"name":"多传感器时间同步","alt":"Multi-Sensor Time Synchronization (Hardware Trigger / Timestamp Alignment)","abbr":"","aliases":["时间戳对齐","硬件同步","硬同步 / 软同步","Time Synchronization"],"one_liner":"让不同传感器的数据按同一时刻对齐，不把不同时间采到的数据拼在一起。","explanation":"机器人上的相机、深度相机、激光雷达、IMU、关节编码器各有自己的时钟和采样频率，时间同步就是保证一起参与计算的那几份数据确实是同一时刻采到的。做法分两层：一是硬件同步，用触发线让多台设备同时曝光，或用 PTP（IEEE 1588 精确时间协议，局域网内可达亚微秒级）让设备共用一个时钟；二是软件对齐，给每条数据打时间戳，再按时间戳配对或插值，如 ROS message_filters 的精确匹配和近似匹配策略。即使只差几十毫秒，机器人快速运动时也会让点云和图像错位、降低视觉惯性里程计精度，还会让采集的观测-动作对错开，训出的策略动作滞后。它是多传感器融合、标定和数据采集的前提。","example":"双臂遥操作采集时，几路相机以 30 Hz 出图，关节状态以更高频率上报；保存数据时要按每帧图像的时间戳去找最接近的关节读数，否则动作标签会和画面错开。","related":["多传感器融合","精确时间协议","相机-IMU联合标定","观测-动作对","视觉惯性里程计","rosbag"]},{"id":"object-detection","category":"perception","sec":5,"tier":1,"sources":[{"title":"Wikipedia: Object detection","url":"https://en.wikipedia.org/wiki/Object_detection"},{"title":"You Only Look Once: Unified, Real-Time Object Detection (arXiv 1506.02640)","url":"https://arxiv.org/abs/1506.02640"},{"title":"Grounding DINO (arXiv 2303.05499)","url":"https://arxiv.org/abs/2303.05499"}],"as_of":"","related_ids":["bounding-box","open-vocabulary-object-detection","yolo","grounding-dino","intersection-over-union","instance-segmentation"],"name":"目标检测","alt":"Object Detection","abbr":"","aliases":["物体检测","物体识别与定位"],"one_liner":"在图像里找出物体是什么、在哪里，并用方框标出来的任务。","explanation":"目标检测是计算机视觉的基础任务：输入一张图，输出其中每个物体的类别、边界框（包住物体的矩形框）和置信度。早期代表是基于手工特征的 Viola-Jones 人脸检测；深度学习后出现 R-CNN 系列两阶段检测器，以及 2015 年提出的 YOLO，它把检测直接当成对边界框和类别概率的回归问题，能实时运行。评估时用交并比（IoU，两框重叠面积占合并面积的比例）判断预测框是否对上，再汇总成 mAP（各类别平均精度的均值）。传统检测器只认识训练时见过的类别，Grounding DINO 这类开放词汇检测器可以用任意文字描述去找物体。机器人里，检测常是模块化流程的第一步：先框出目标，再分割、估位姿、规划抓取。","example":"用户说「把红色杯子拿给我」，系统先把「red cup」输入 Grounding DINO 得到边界框，再交给 SAM 抠出掩码，结合深度图算出杯子的三维位置，交给机械臂去抓。","related":["检测框（边界框）","开放词汇检测","YOLO","Grounding DINO","交并比","实例分割"]},{"id":"bounding-box","category":"perception","sec":5,"tier":2,"sources":[{"title":"Dive into Deep Learning: Object Detection and Bounding Boxes","url":"https://d2l.ai/chapter_computer-vision/bounding-box.html"}],"as_of":"","related_ids":["object-detection","intersection-over-union","non-maximum-suppression","3d-object-detection","grounding-dino","mask"],"name":"检测框（边界框）","alt":"Bounding Box (Detection)","abbr":"BBox","aliases":["边界框","包围框","检测框"],"one_liner":"目标检测中框住物体的矩形，用几个坐标标出物体在图里的位置。","explanation":"检测框是目标检测模型最常见的输出：一个把物体框住的矩形，通常附带类别和置信度。常见表示有两种：左上角加右下角坐标 (x1, y1, x2, y2)，或中心点加宽高 (cx, cy, w, h)；不同数据集格式约定不同，混用是常见 bug。预测框准不准用交并比（IoU，两框交集面积除以并集面积）衡量，重复框用非极大值抑制去掉。扩展形式有带角度的旋转框和三维的 3D 检测框。在具身智能里它多是中间结果：先用开放词汇检测器按文字找到目标框，再交给 SAM 出掩码或裁出区域做抓取。它和物理引擎里做碰撞检查的「包围盒」不是一回事。","example":"指令是「拿起红色杯子」，Grounding DINO 在图中给出一个框和 0.6 左右的置信度，后续模块只在这个框内分割物体、找抓取点。","related":["目标检测","交并比","非极大值抑制","3D目标检测","Grounding DINO","掩码"]},{"id":"yolo","category":"perception","sec":5,"tier":2,"sources":[{"title":"You Only Look Once: Unified, Real-Time Object Detection (arXiv 1506.02640)","url":"https://arxiv.org/abs/1506.02640"},{"title":"Ultralytics Docs: Models Supported by Ultralytics","url":"https://docs.ultralytics.com/models/"}],"as_of":"2026-01","related_ids":["object-detection","bounding-box","non-maximum-suppression","yolo-world","mean-average-precision"],"name":"YOLO","alt":"You Only Look Once","abbr":"YOLO","aliases":["YOLO 系列","YOLOv8","YOLO11","YOLO26"],"one_liner":"整张图只过一遍网络就框出所有物体的实时目标检测模型系列。","explanation":"YOLO 由 Joseph Redmon 等人在 2015 年提出（CVPR 2016 发表），把目标检测当成回归问题：整张图只过一遍网络，同时输出所有检测框的位置和类别，基础版当时每秒能跑 45 帧，比先生成候选框再逐个分类的两阶段方法快得多。之后 YOLO 演化成由不同团队接力发布的大家族，Ultralytics 维护的 YOLOv5、YOLOv8、YOLO11 用得最广；据其文档，2026 年 1 月发布的 YOLO26 可选去掉非极大值抑制（NMS，删除重复框的后处理），并支持分割、姿态、旋转框等任务。机器人上常用它做快速 2D 检测，再结合深度图得到物体三维位置；要按文字找任意类别物体时可用开放词汇版 YOLO-World。","example":"桌面分拣：腕部相机图像送进 YOLO 得到「杯子」的检测框，取框内对应的深度像素反投影成三维点，作为机械臂抓取的目标位置。","related":["目标检测","检测框（边界框）","非极大值抑制","YOLO-World","平均精度均值"]},{"id":"intersection-over-union","category":"perception","sec":5,"tier":2,"sources":[{"title":"Jaccard index - Wikipedia","url":"https://en.wikipedia.org/wiki/Jaccard_index"},{"title":"COCO Detection Evaluation","url":"https://raw.githubusercontent.com/cocodataset/cocodataset.github.io/master/dataset/detection-eval.htm"}],"as_of":"","related_ids":["object-detection","bounding-box","mean-average-precision","non-maximum-suppression","instance-segmentation","precision-recall"],"name":"交并比","alt":"Intersection over Union","abbr":"IoU","aliases":["Jaccard 指数","杰卡德系数"],"one_liner":"两个区域的重叠面积除以合并面积，衡量预测框或掩码准不准。","explanation":"交并比衡量两个区域的重合程度：交集面积除以并集面积，完全重合为 1，毫无交叠为 0，数学上就是 Paul Jaccard 1901 年提出的 Jaccard 指数。视觉任务用它判断检测框或分割掩码准不准：预测结果和人工标注（真值）的 IoU 超过阈值才算检测正确。PASCAL VOC 的阈值取 0.5；COCO 更严，在 0.50 到 0.95 之间每隔 0.05 取一个阈值分别算平均精度（AP）再取平均，常说的 AP50、AP75 就是阈值 0.5 和 0.75 下的结果。分割任务算法相同，只是把框换成掩码像素。","example":"标注框和预测框面积都是 100，重叠 60，并集就是 140，IoU≈0.43，低于 0.5，按 VOC 标准这次检测不算对。","related":["目标检测","检测框（边界框）","平均精度均值","非极大值抑制","实例分割","精确率 / 召回率"]},{"id":"non-maximum-suppression","category":"perception","sec":5,"tier":3,"sources":[{"title":"torchvision.ops.nms - PyTorch Documentation","url":"https://pytorch.org/vision/stable/generated/torchvision.ops.nms.html"}],"as_of":"","related_ids":["object-detection","bounding-box","intersection-over-union","yolo","detr","grasp-pose-detection"],"name":"非极大值抑制","alt":"Non-Maximum Suppression","abbr":"NMS","aliases":["NMS 后处理"],"one_liner":"从一堆重叠的检测框里只留下分数最高那个的后处理步骤。","explanation":"目标检测器常对同一个物体输出多个互相重叠的候选框。非极大值抑制按置信度排序，先保留分数最高的框，再删掉与它交并比（IoU，两框重叠面积占并集的比例）超过阈值的其他框，重复直到处理完。它是 YOLO、Faster R-CNN 等检测器的标准后处理，也用于抓取位姿检测中去掉重复的抓取候选。阈值太高会留下重复框，太低会误删挨得很近的真实物体；DETR 等端到端检测器设计上不需要 NMS。","example":"检测器对同一个杯子输出 5 个重叠框，NMS 保留分数最高的一个，删掉与它 IoU 超过 0.5 的其余框。","related":["目标检测","检测框（边界框）","交并比","YOLO","DETR","抓取位姿检测"]},{"id":"detr","category":"perception","sec":5,"tier":3,"sources":[{"title":"arXiv 2005.12872: End-to-End Object Detection with Transformers","url":"https://arxiv.org/abs/2005.12872"},{"title":"ECCV 2020 paper page: End-to-End Object Detection with Transformers","url":"https://www.ecva.net/papers/eccv_2020/papers_ECCV/html/832_ECCV_2020_paper.php"},{"title":"facebookresearch/detr (GitHub)","url":"https://github.com/facebookresearch/detr"}],"as_of":"","related_ids":["object-detection","transformer","bounding-box","non-maximum-suppression","grounding-dino","learnable-query"],"name":"DETR","alt":"DEtection TRansformer","abbr":"","aliases":["End-to-End Object Detection with Transformers"],"one_liner":"用 Transformer 把目标检测直接当作「集合预测」来做的端到端检测器。","explanation":"DETR 是 Facebook AI（现 Meta）的 Nicolas Carion 等人提出的目标检测模型，发表于 ECCV 2020。此前的检测器如 Faster R-CNN 要先铺大量锚框（预设的候选框），最后用非极大值抑制删掉重复框。DETR 先用 CNN 提取图像特征，送进 Transformer 编码器-解码器，解码器用固定数量的可学习「物体查询」各自输出一个框和类别；训练时用二分图匹配把预测与真值一对一配对，因此不再需要锚框和 NMS。它在 COCO 上精度与调优过的 Faster R-CNN 相当，但训练收敛慢。后来的 Deformable DETR、Grounding DINO、DINO-X 都沿这条路线发展；具身领域的 ACT 用可学习查询解码动作，代码也改自 DETR。","example":"官方 DETR（ResNet-50 骨干）在 COCO 2017 验证集上训练 500 轮达到 42.0 AP，与同骨干的 Faster R-CNN 相当，计算量约为其一半。","related":["目标检测","Transformer","检测框（边界框）","非极大值抑制","Grounding DINO","可学习查询"]},{"id":"precision-recall","category":"perception","sec":5,"tier":2,"sources":[{"title":"Wikipedia: Precision and recall","url":"https://en.wikipedia.org/wiki/Precision_and_recall"},{"title":"scikit-learn: Precision, recall and F-measures","url":"https://scikit-learn.org/stable/modules/model_evaluation.html"}],"as_of":"","related_ids":["intersection-over-union","mean-average-precision","object-detection","non-maximum-suppression","success-detector"],"name":"精确率 / 召回率","alt":"Precision / Recall (F1)","abbr":"","aliases":["查准率","查全率","F1 分数","F1 Score"],"one_liner":"精确率看报出来的有多少是对的，召回率看该找的找回了多少。","explanation":"精确率和召回率是评价检测、分类、检索类任务的一对基本指标。把结果分为真正例 TP（报了且对）、假正例 FP（报了但错，即误检）、假负例 FN（该报没报，即漏检），则精确率 = TP/(TP+FP)，召回率 = TP/(TP+FN)。两者通常此消彼长：调低置信度阈值能找回更多目标，误检也会随之增多。F1 是二者的调和平均 2PR/(P+R)，用一个数兼顾两边。目标检测中先用交并比（IoU）判断预测框算不算命中，再计算二者；扫遍阈值画出 PR 曲线，曲线下面积就是 AP，多类别平均得 mAP。机器人里也用它们评估抓取检测、接触检测和成功检测器。","example":"杯子检测器在测试集上报了 100 个框，其中 80 个对上真实杯子，而测试集一共有 120 个杯子：精确率 80%，召回率约 67%，F1 约 0.73。","related":["交并比","平均精度均值","目标检测","非极大值抑制","成功检测器"]},{"id":"mean-average-precision","category":"perception","sec":5,"tier":3,"sources":[{"title":"COCO Detection Evaluation（官方评测说明）","url":"https://raw.githubusercontent.com/cocodataset/cocodataset.github.io/master/dataset/detection-eval.htm"},{"title":"Ultralytics: Performance Metrics Deep Dive","url":"https://docs.ultralytics.com/guides/yolo-performance-metrics/"}],"as_of":"","related_ids":["intersection-over-union","precision-recall","object-detection","coco-lvis","non-maximum-suppression","mask-r-cnn"],"name":"平均精度均值","alt":"mean Average Precision","abbr":"mAP","aliases":["AP","mAP50","mAP50-95","mAP@[.5:.95]"],"one_liner":"目标检测和分割最常用的精度指标：各类别平均精度（AP）再取平均。","explanation":"平均精度均值（mAP）是目标检测、实例分割最常用的综合指标。先对某一类别把所有预测按置信度排序，只有与真值框的交并比（IoU，两框重叠面积除以并集面积）超过阈值才算对，由此画出精确率-召回率曲线，曲线下面积就是这一类的 AP；再对所有类别取平均即为 mAP。阈值不同数值差别很大：PASCAL VOC 时代常用 IoU=0.5（mAP50）；COCO 则在 0.5 到 0.95、每隔 0.05 的 10 个阈值上各算一次再平均（mAP50-95），对定位精度要求更严。要注意 COCO 论文和排行榜里写的「AP」已经对类别取过平均，官方明确说不区分 AP 和 mAP。读机器人感知论文时，先确认报告的是哪种阈值、在哪个数据集上。","example":"Mask R-CNN 论文报告 ResNet-101-FPN 版本在 COCO 上的掩码 AP 为 35.7，这里的 AP 就是在 10 个 IoU 阈值和全部类别上平均后的 mAP。","related":["交并比","精确率 / 召回率","目标检测","COCO / LVIS 数据集","非极大值抑制","Mask R-CNN"]},{"id":"semantic-segmentation","category":"perception","sec":5,"tier":2,"sources":[{"title":"Fully Convolutional Networks for Semantic Segmentation (Long, Shelhamer, Darrell, CVPR 2015)","url":"https://arxiv.org/abs/1411.4038"},{"title":"Wikipedia: Image segmentation","url":"https://en.wikipedia.org/wiki/Image_segmentation"}],"as_of":"","related_ids":["instance-segmentation","panoptic-segmentation","open-vocabulary-segmentation","mask","semantic-map","segment-anything-model"],"name":"语义分割","alt":"Semantic Segmentation","abbr":"","aliases":["像素级分类","Semantic Seg"],"one_liner":"给图像里每个像素标上类别，如「桌子」「杯子」「地面」。","explanation":"语义分割是计算机视觉的基础任务：判断图像中每个像素属于哪一类，输出一张和原图一样大的类别图。它只管「是什么类」，不区分同类的不同个体，两只杯子会被标成同一片「杯子」；要把个体分开用实例分割，两者合起来叫全景分割。2015 年 Long 等人提出全卷积网络（FCN），让网络端到端直接做逐像素预测，之后成为主流做法。机器人用它找出可抓取物体所在的区域、可通行的地面，或把类别投到三维点云上建语义地图。早期模型只认训练集里的固定类别，现在常用开放词汇分割，按文字描述去分任意类别。","example":"输入一张厨房照片，桌面像素标成「桌子」，两只杯子都标成「杯子」，其余为「背景」；机器人据此取出「杯子」区域对应的点云来规划抓取。","related":["实例分割","全景分割","开放词汇分割","掩码","语义地图","分割一切模型"]},{"id":"instance-segmentation","category":"perception","sec":5,"tier":2,"sources":[{"title":"Mask R-CNN (arXiv:1703.06870)","url":"https://arxiv.org/abs/1703.06870"},{"title":"Panoptic Segmentation (arXiv:1801.00868)","url":"https://arxiv.org/abs/1801.00868"}],"as_of":"","related_ids":["semantic-segmentation","panoptic-segmentation","mask","object-detection","mask-r-cnn","segment-anything-model"],"name":"实例分割","alt":"Instance Segmentation","abbr":"","aliases":["实例级分割"],"one_liner":"把图中每个物体逐像素抠出来，同类的几个物体也要分开。","explanation":"实例分割要同时回答「这是什么」和「这是哪一个」：给图中每个可数物体（论文里叫 things）生成一张独立的像素级掩码并标上类别。它和语义分割的区别在于：语义分割只给每个像素贴类别，桌上三个杯子会连成一片「杯子」区域；实例分割会拆成杯子 1、2、3。代表方法是何恺明等人 2017 年的 Mask R-CNN，在目标检测框的基础上并行加一个预测掩码的分支；2018 年提出的全景分割又把天空、地面这类不可数背景（stuff）一起纳入。机器人抓取常先用实例分割抠出目标物体，再裁出对应点云计算抓取位姿。","example":"桌上并排放着两个同款苹果，语义分割只给出一片「苹果」区域，实例分割输出两张独立掩码，机器人才能按指令只抓左边那一个。","related":["语义分割","全景分割","掩码","目标检测","Mask R-CNN","分割一切模型"]},{"id":"panoptic-segmentation","category":"perception","sec":5,"tier":3,"sources":[{"title":"Panoptic Segmentation (arXiv 1801.00868)","url":"https://arxiv.org/abs/1801.00868"}],"as_of":"","related_ids":["semantic-segmentation","instance-segmentation","mask","scene-understanding","semantic-map","mask-r-cnn"],"name":"全景分割","alt":"Panoptic Segmentation","abbr":"","aliases":[],"one_liner":"给每个像素标类别，同时把每个物体个体区分开的分割任务。","explanation":"全景分割由 Alexander Kirillov、何恺明等人在 2018 年提出（CVPR 2019）。它把两类任务合在一起：语义分割给每个像素一个类别，但不区分同类的不同个体；实例分割区分每个物体个体，却不管天空、地面这类没有明确形状的背景类（论文称 stuff）。全景分割要求每个像素都有类别，属于可数物体（things）的还要有实例编号，输出一张完整、互不重叠的场景解析图，并用新提出的全景质量 PQ 统一评测。对机器人来说，它同时回答「哪里是地面、台面」和「这是第几个杯子」，常用于场景理解和语义建图。","example":"一张厨房图像里，地板、墙、台面按类别整块标出，三个碗则分别标成碗 1、碗 2、碗 3。","related":["语义分割","实例分割","掩码","场景理解","语义地图","Mask R-CNN"]},{"id":"mask","category":"perception","sec":5,"tier":2,"sources":[{"title":"Segment Anything (arXiv:2304.02643)","url":"https://arxiv.org/abs/2304.02643"},{"title":"COCO Data Format（segmentation: polygon / RLE）","url":"https://raw.githubusercontent.com/cocodataset/cocodataset.github.io/master/dataset/format-data.htm"}],"as_of":"","related_ids":["instance-segmentation","semantic-segmentation","segment-anything-model","grounded-sam","attention-mask","point-cloud-segmentation"],"name":"掩码","alt":"Mask","abbr":"","aliases":["分割掩码","Segmentation Mask","二值掩码"],"one_liner":"与图像同尺寸的逐像素标记图，标出哪些像素属于某个物体。","explanation":"掩码是一张和原图大小相同的图，每个像素取 0 或 1（或类别编号），用来标出哪些像素属于目标。分割模型的输出本质上就是掩码：语义分割每类一张，实例分割每个物体一张。它比检测框精确，框里常混着背景，掩码则贴着物体轮廓。存储时，COCO 数据集对单个物体用多边形顶点，对成群物体用游程编码（RLE）压缩。Meta 的 SAM 在 1100 万张图上标注了超过 10 亿个掩码，点一下或框一下就能得到任意物体的掩码。机器人里常用掩码从深度图或点云中只取出目标物体再算抓取。Transformer 里的注意力掩码是另一个概念，别混淆。","example":"指令「抓红色杯子」：先用 Grounded-SAM 得到杯子的掩码，叠到对齐后的深度图上，只把杯子对应的像素反投影成点云，再交给抓取检测网络。","related":["实例分割","语义分割","分割一切模型","Grounded-SAM","注意力掩码","点云分割"]},{"id":"mask-r-cnn","category":"perception","sec":5,"tier":3,"sources":[{"title":"arXiv: Mask R-CNN","url":"https://arxiv.org/abs/1703.06870"},{"title":"GitHub: facebookresearch/Detectron（注明 Marr Prize at ICCV 2017）","url":"https://github.com/facebookresearch/Detectron"}],"as_of":"","related_ids":["instance-segmentation","object-detection","mask","segment-anything-model","grounded-sam","mean-average-precision"],"name":"Mask R-CNN","alt":"Mask R-CNN","abbr":"","aliases":["Mask RCNN"],"one_liner":"何恺明等 2017 年提出的实例分割模型，同时输出检测框和每个物体的掩码。","explanation":"Mask R-CNN 由 Facebook AI Research 的何恺明、Gkioxari、Dollár、Girshick 于 2017 年提出，获 ICCV 2017 马尔奖（最佳论文）。它在两阶段检测器 Faster R-CNN 上，给每个候选区域并行加了一个预测像素级掩码的分支，一个网络同时完成目标检测和实例分割（分出每个物体各占哪些像素），再加分支还能做人体关键点检测。论文提出的 RoIAlign 用双线性插值取代 RoIPool 的取整，消除特征与像素的错位，对掩码精度提升明显。ResNet-101-FPN 版本在 COCO 上掩码 AP 为 35.7，约 5 帧/秒。在机器人领域，它长期是抓取、拣选流程里分割物体的常用基线，如今常被 SAM 系列、Grounded-SAM 等开放词汇方法替代或配合使用。","example":"无序抓取流程中，先用在自家零件图片上微调过的 Mask R-CNN 分出料箱里每个零件的掩码，再把掩码对应的点云交给抓取位姿检测模块。","related":["实例分割","目标检测","掩码","分割一切模型","Grounded-SAM","平均精度均值"]},{"id":"segment-anything-model","category":"perception","sec":5,"tier":2,"sources":[{"title":"Segment Anything (arXiv 2304.02643)","url":"https://arxiv.org/abs/2304.02643"},{"title":"GitHub: facebookresearch/segment-anything","url":"https://github.com/facebookresearch/segment-anything"},{"title":"Meta AI Blog: Segment Anything Model 3","url":"https://ai.meta.com/blog/segment-anything-model-3/"}],"as_of":"2025-11","related_ids":["sam-2","sam-3","grounded-sam","instance-segmentation","mask","foundation-model"],"name":"分割一切模型","alt":"Segment Anything Model","abbr":"SAM","aliases":["分割一切","Segment Anything","SAM 2","SAM 3"],"one_liner":"Meta 2023 年发布的可提示分割基础模型，给个点或框就能分割出对应物体。","explanation":"分割一切模型（SAM）是 Meta AI 于 2023 年 4 月发布的图像分割基础模型，提出「可提示分割」任务：用户给出点、框或粗掩码作为提示，模型输出对应物体的掩码，没见过的物体也能直接用，还能自动分割全图。大号 ViT 图像编码器每张图只算一次，轻量解码器可对多个提示快速出结果。训练数据 SA-1B 含 1100 万张图、超过 11 亿个掩码，代码和权重以 Apache 2.0 开源。原版 SAM 只给掩码、不识别类别，常与 Grounding DINO 组合成 Grounded-SAM 按文字分割。后续有面向视频的 SAM 2（2024）和支持名词短语提示的 SAM 3（2025）。","example":"在工作台图像上点一下螺丝刀，SAM 返回它的像素掩码；把掩码内的深度像素反投影，就得到只含螺丝刀的点云，供抓取检测使用。","related":["SAM 2（视频分割一切）","SAM 3（可提示概念分割）","Grounded-SAM","实例分割","掩码","基础模型"]},{"id":"keypoint-detection","category":"perception","sec":5,"tier":2,"sources":[{"title":"COCO Data Format（keypoints 标注格式）","url":"https://raw.githubusercontent.com/cocodataset/cocodataset.github.io/master/dataset/format-data.htm"},{"title":"kPAM: KeyPoint Affordances for Category-Level Robotic Manipulation (arXiv:1903.06684)","url":"https://arxiv.org/abs/1903.06684"}],"as_of":"","related_ids":["human-pose-estimation","semantic-keypoints","feature-points","6d-object-pose-estimation","rekep","tracking-any-point"],"name":"关键点检测","alt":"Keypoint Detection","abbr":"","aliases":["关键点","关键点定位"],"one_liner":"在图像里定位几个事先约定含义的点，如手腕、杯把手或箱子角。","explanation":"关键点检测在图像中输出若干个含义事先约定好的点的坐标，每个点对应固定部位，比如人的左手腕、杯子把手、纸箱的角。它比检测框精细，比分割掩码轻量；和 SIFT、ORB 这类特征点不同，特征点只求局部纹理好认，没有固定含义。最常见的是人体关键点：COCO 为每个点标「未标注 / 被遮挡 / 可见」，用 OKS 相似度打分。机器人操作里，MIT 的 kPAM（2019）用几个 3D 语义关键点表示一类物体，换一个形状不同的杯子也能按同样规则挂上架子，比只估 6D 位姿更能应对同类物体的形状差异。","example":"让机器人把各种杯子挂到杯架上：先检测杯底、杯口和把手几个 3D 关键点，再规划动作让把手对准挂钩，杯子大小形状不同也能用同一套规则。","related":["人体姿态估计","语义关键点","特征点","6D位姿估计","ReKep","任意点跟踪"]},{"id":"object-tracking","category":"perception","sec":5,"tier":2,"sources":[{"title":"Wikipedia: Video tracking","url":"https://en.wikipedia.org/wiki/Video_tracking"},{"title":"Simple Online and Realtime Tracking (SORT, ICIP 2016)","url":"https://arxiv.org/abs/1602.00763"}],"as_of":"","related_ids":["object-detection","kalman-filter","video-object-segmentation","tracking-any-point","embodied-visual-tracking","pose-tracking"],"name":"目标跟踪","alt":"Object Tracking","abbr":"","aliases":["多目标跟踪","MOT","单目标跟踪","视觉跟踪","Video Tracking"],"one_liner":"在连续视频帧里持续找到同一个物体，并给它保持同一个编号。","explanation":"目标跟踪是在视频中逐帧定位一个或多个目标，并判断「这一帧的它就是上一帧的它」。单目标跟踪给定第一帧的框后一路跟下去；多目标跟踪（MOT）要同时跟很多个目标并保持各自的 ID。常见套路是「先检测后关联」：每帧先跑检测器，再用卡尔曼滤波预测目标运动、用匈牙利算法把新检测框和已有轨迹配对，2016 年的 SORT 就是这种做法。难点在遮挡、外观变化、快速运动和相似物体混淆。机器人里用它持续锁定要抓的物体、跟随行人，或在人类视频里追踪手在操作的物体；SAM 2 这类视频分割模型也能以掩码形式做跟踪。","example":"分拣线上包裹随传送带不断移动，系统每帧检测包裹并用跟踪维持编号，机械臂才能在正确时刻抓到指定的那一件。","related":["目标检测","卡尔曼滤波","视频目标分割","任意点跟踪","具身视觉跟踪（目标跟随）","位姿跟踪"]},{"id":"video-object-segmentation","category":"perception","sec":5,"tier":3,"sources":[{"title":"DAVIS: Densely Annotated VIdeo Segmentation","url":"https://davischallenge.org/"},{"title":"SAM 2: Segment Anything in Images and Videos (arXiv:2408.00714)","url":"https://arxiv.org/abs/2408.00714"}],"as_of":"2024-10","related_ids":["instance-segmentation","object-tracking","sam-2","segment-anything-model","mask","auto-labeling"],"name":"视频目标分割","alt":"Video Object Segmentation","abbr":"VOS","aliases":["视频分割","视频物体分割"],"one_liner":"在视频的每一帧里持续抠出指定物体的像素掩码。","explanation":"给定一段视频，在每一帧输出目标物体的像素级掩码（标出哪些像素属于它），并在物体移动、变形、被遮挡后仍认出是同一个物体。按人给的提示多少分几类：半监督 VOS 在第一帧给出目标掩码，算法往后传播；无监督 VOS 不给提示，自动找出主要物体；交互式 VOS 允许用户中途点击修正。DAVIS 是经典评测基准。2024 年 Meta 的 SAM 2 用带记忆的 Transformer 把图像和视频分割统一起来，点一下就能在整段视频里跟住物体。机器人里常用它给操作目标持续打掩码、做数据自动标注，或给策略提供以物体为中心的输入。","example":"在第一帧点一下桌上的杯子，SAM 2 就在机械臂抓取的全过程中逐帧给出杯子的掩码，杯子被夹爪挡住一部分也能跟住。","related":["实例分割","目标跟踪","SAM 2（视频分割一切）","分割一切模型","掩码","自动标注"]},{"id":"sam-2","category":"perception","sec":5,"tier":2,"sources":[{"title":"SAM 2: Segment Anything in Images and Videos (arXiv 2408.00714)","url":"https://arxiv.org/abs/2408.00714"},{"title":"Meta AI Blog: Introducing SAM 2","url":"https://ai.meta.com/blog/segment-anything-2/"},{"title":"GitHub: IDEA-Research/Grounded-SAM-2","url":"https://github.com/IDEA-Research/Grounded-SAM-2"}],"as_of":"2024-10","related_ids":["segment-anything-model","sam-3","video-object-segmentation","object-tracking","grounded-sam","mask"],"name":"SAM 2（视频分割一切）","alt":"SAM 2: Segment Anything in Images and Videos","abbr":"","aliases":["SAM 2","SAM 2.1","Segment Anything 2"],"one_liner":"Meta 的图像与视频通用分割模型，点一下目标就能在整段视频里持续分割跟踪。","explanation":"SAM 2 是 Meta FAIR 于 2024 年 7 月发布的第二代「分割一切」模型，把 SAM 从单张图片扩展到视频：在某一帧用点、框或掩码指定目标，模型在后续各帧持续输出该目标的掩码。核心是流式记忆：逐帧处理时把之前帧的目标信息存入记忆库供当前帧参考，并用遮挡头判断目标当前是否可见。配套发布 SA-V 数据集（约 5.1 万段视频、60 万余个时空掩码）。论文称视频分割所需交互比以往少 3 倍，图像分割比 SAM 更准且快 6 倍。代码和权重以 Apache 2.0 开源。机器人里常与 Grounding DINO 组合，先按文字找到物体再全程跟踪其掩码。","example":"Grounded-SAM-2 流程：先用 Grounding DINO 按「红色杯子」在第一帧检出框，交给 SAM 2 在整段操作视频中跟踪杯子的掩码，用于数据标注或给策略提供目标掩码。","related":["分割一切模型","SAM 3（可提示概念分割）","视频目标分割","目标跟踪","Grounded-SAM","掩码"]},{"id":"optical-flow","category":"perception","sec":5,"tier":2,"sources":[{"title":"Wikipedia: Optical flow","url":"https://en.wikipedia.org/wiki/Optical_flow"},{"title":"RAFT: Recurrent All-Pairs Field Transforms for Optical Flow","url":"https://arxiv.org/abs/2003.12039"}],"as_of":"","related_ids":["raft","scene-flow","tracking-any-point","visual-odometry","event-camera","feature-matching"],"name":"光流","alt":"Optical Flow","abbr":"","aliases":["稠密光流","稀疏光流"],"one_liner":"相邻两帧图像之间，每个像素往哪个方向移动了多少。","explanation":"光流描述相机和场景相对运动时，图像上亮度图案的表观运动，结果通常是一张和图像同尺寸的二维位移场。经典方法基于「亮度恒定」假设，即同一个点在相邻帧里亮度不变；但一个方程解不出两个未知数（孔径问题），于是 1981 年的 Lucas–Kanade 假设局部小窗口内运动一致，Horn–Schunck 则加入全局平滑约束。深度学习时代的代表是 RAFT（ECCV 2020），用所有像素对之间的相关性体加循环迭代来估计稠密光流。只算部分特征点的叫稀疏光流，逐像素的叫稠密光流。机器人里光流用于视觉里程计、避障和运动分割，也被当作动作的中间表示：有些操作策略先预测物体上各点怎么动，再换算成机器人动作。","example":"无人机向前飞时，前方物体在画面中向外扩散，越近的物体光流越大，可以据此判断是否快要撞上。","related":["RAFT 光流","场景流","任意点跟踪","视觉里程计","事件相机","特征匹配"]},{"id":"raft","category":"perception","sec":5,"tier":3,"sources":[{"title":"RAFT: Recurrent All-Pairs Field Transforms for Optical Flow (arXiv 2003.12039)","url":"https://arxiv.org/abs/2003.12039"},{"title":"princeton-vl/RAFT (GitHub)","url":"https://github.com/princeton-vl/RAFT"}],"as_of":"","related_ids":["optical-flow","scene-flow","tracking-any-point","stereo-matching","droid-slam","recurrent-neural-network"],"name":"RAFT 光流","alt":"RAFT: Recurrent All-Pairs Field Transforms for Optical Flow","abbr":"RAFT","aliases":["RAFT"],"one_liner":"经典光流网络：算全部像素间的相关性，再用循环单元反复迭代细化光流。","explanation":"RAFT 由普林斯顿大学的 Zachary Teed 和邓嘉于 2020 年提出，发表于 ECCV 2020（据报道获当届最佳论文奖）。光流指相邻两帧之间每个像素移动了多少。RAFT 先对两帧所有像素两两计算特征相关性，得到 4D 相关体，再用基于 GRU（一种循环神经网络单元）的模块在单一高分辨率上反复迭代修正光流，取代传统的由粗到细金字塔。据论文，它在 KITTI 和 Sintel 上分别把误差降低 16% 和 30%，至今仍是常用基线。同团队的 RAFT-Stereo 和 DROID-SLAM 都沿用了这种迭代更新思路。机器人研究中，光流常用来估计物体运动，或从无动作标签视频里推断运动。","example":"输入机械臂推方块前后的两帧图像，RAFT 输出每个像素的位移，能看出方块和机械臂各往哪边移动。","related":["光流","场景流","任意点跟踪","立体匹配","DROID-SLAM","循环神经网络"]},{"id":"scene-flow","category":"perception","sec":5,"tier":3,"sources":[{"title":"Three-Dimensional Scene Flow (Vedula et al., CMU RI)","url":"https://publications.ri.cmu.edu/three-dimensional-scene-flow/"},{"title":"arXiv 1806.01411: FlowNet3D","url":"https://arxiv.org/abs/1806.01411"},{"title":"arXiv 1612.02590: Scene Flow Estimation: A Survey","url":"https://arxiv.org/abs/1612.02590"}],"as_of":"","related_ids":["optical-flow","tracking-any-point","point-cloud","intermediate-representation","raft","4d-reconstruction"],"name":"场景流","alt":"Scene Flow","abbr":"","aliases":["3D 光流","3D flow"],"one_liner":"场景中每个 3D 点在相邻两帧之间的三维运动向量","explanation":"场景流是光流的三维版本：光流描述图像上每个像素在两帧之间的 2D 位移，场景流描述真实世界里每个点的 3D 位移。这个概念由 CMU 的 Vedula、Kanade 等人在 1999 年提出（2005 年发表于 TPAMI 的期刊版）。早期方法从多视角或双目图像求解，深度相机和激光雷达普及后，出现了直接在两帧点云上学习的网络，如 2018 年的 FlowNet3D。它能告诉系统「哪些东西在动、往哪动、动多快」，用于自动驾驶的运动分割和动态物体跟踪。在机器人操作中，预测物体上各点未来的 3D 运动轨迹（常称 3D flow）也被当作一种与本体无关的中间表示，用来从人类视频学技能再迁移到机器人。","example":"General Flow（2024）用人类 RGB-D 视频训练模型，按语言指令预测物体上各点未来的 3D 轨迹，再转成机器人动作，实现零样本技能迁移。","related":["光流","任意点跟踪","点云","中间表示","RAFT 光流","4D重建"]},{"id":"tracking-any-point","category":"perception","sec":5,"tier":3,"sources":[{"title":"TAP-Vid: A Benchmark for Tracking Any Point in a Video (arXiv 2211.03726)","url":"https://arxiv.org/abs/2211.03726"},{"title":"CoTracker: It is Better to Track Together (arXiv 2307.07635)","url":"https://arxiv.org/abs/2307.07635"}],"as_of":"","related_ids":["tapir","cotracker","optical-flow","scene-flow","atm","3d-point-tracking"],"name":"任意点跟踪","alt":"Tracking Any Point","abbr":"TAP","aliases":["点跟踪","Point Tracking","长时点跟踪"],"one_liner":"给视频里任意一个点，输出它在之后每一帧的位置和是否被遮挡。","explanation":"任意点跟踪是 Google DeepMind 在 2022 年随 TAP-Vid 基准正式提出的视觉任务：用户在视频某一帧上指定任意一个点（可以在物体表面、布料上、背景里），模型要给出这个点在其他所有帧里的像素位置，并判断它是否被遮挡。它和光流的区别是光流只算相邻两帧之间的运动，长时间累积会漂移，也处理不了遮挡后再出现；和目标跟踪的区别是它跟的是点而不是整个物体的框。代表模型有 TAPIR、CoTracker 等。在机器人里，点轨迹是一种与本体无关的中间表示：可以从人类视频里提取物体上点的运动，用来指导策略学习（如 ATM）或做视觉伺服。","example":"在人倒水的视频里点选杯把手上的几个点，跟踪出它们随时间的轨迹，机器人策略学习时就以这些轨迹作为「杯子该怎么动」的目标。","related":["TAPIR","CoTracker","光流","场景流","ATM（任意点轨迹建模）","3D 点跟踪"]},{"id":"tapir","category":"perception","sec":5,"tier":3,"sources":[{"title":"TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement (arXiv 2306.08637)","url":"https://arxiv.org/abs/2306.08637"}],"as_of":"2023-06","related_ids":["tracking-any-point","cotracker","optical-flow","atm","keypoint-detection","occlusion"],"name":"TAPIR","alt":"TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement","abbr":"","aliases":["TAPNet"],"one_liner":"DeepMind 的任意点跟踪模型：先逐帧找候选匹配，再沿时间精修轨迹。","explanation":"TAPIR 是 Google DeepMind 与牛津大学 VGG 组在 2023 年提出的点跟踪模型（ICCV 2023），用于「任意点跟踪」任务：给定视频里某一帧上的任意一个点，输出它在其余每一帧中的位置，以及是否被遮挡。方法分两阶段：匹配阶段在每一帧上独立寻找和查询点最像的候选位置，作为初始化；精修阶段利用局部相关性，沿时间方向反复更新整条轨迹和查询特征。论文在 TAP-Vid 基准上较此前方法有明显提升。TAPNet 是同团队在 TAP-Vid 论文里给出的早期基线，代码仓库沿用 tapnet 这个名字。机器人上它被用来跟踪物体或夹爪上的关键点，比如 DeepMind 的 RoboTAP 就用点轨迹来做少样本模仿。","example":"在一段机械臂叠毛巾的视频里点选毛巾的一个角，TAPIR 能输出这个角在后续每一帧的像素坐标，即使中途被夹爪短暂挡住也能接回来。","related":["任意点跟踪","CoTracker","光流","ATM（任意点轨迹建模）","关键点检测","遮挡"]},{"id":"cotracker","category":"perception","sec":5,"tier":3,"sources":[{"title":"CoTracker: It is Better to Track Together (arXiv 2307.07635)","url":"https://arxiv.org/abs/2307.07635"},{"title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos (arXiv 2410.11831)","url":"https://arxiv.org/abs/2410.11831"},{"title":"facebookresearch/co-tracker (GitHub)","url":"https://github.com/facebookresearch/co-tracker"}],"as_of":"2025-01","related_ids":["tracking-any-point","tapir","optical-flow","atm","3d-point-tracking","occlusion"],"name":"CoTracker","alt":"CoTracker: It is Better to Track Together","abbr":"","aliases":["CoTracker3","CoTracker2"],"one_liner":"Meta 开源的视频点跟踪模型，能联合跟踪大量像素点，包括被遮挡的点。","explanation":"CoTracker 由 Meta AI 与牛津大学 VGG 组的 Karaev 等人提出，2023 年 7 月上 arXiv，发表于 ECCV 2024。它属于任意点跟踪：给定视频里任意像素，输出它在后续每一帧的位置和是否可见。以往方法大多逐点独立跟踪，CoTracker 用 Transformer 把大量点放在一起联合跟踪，利用点与点之间的相关性，对遮挡和移出画面的点更稳，并按短时间窗口滑动处理，可以在线运行。2024 年 10 月的 CoTracker3 简化了结构，改用已有模型给无标注真实视频生成伪标签来训练，所用训练数据比此前方法少约 1000 倍。机器人学习里常用它给演示视频自动标注点轨迹。","example":"ATM（任意点轨迹建模）用 CoTracker 在演示视频上生成点轨迹，作为真值训练一个轨迹预测模型，再让预测出的未来轨迹去指导机器人策略。","related":["任意点跟踪","TAPIR","光流","ATM（任意点轨迹建模）","3D 点跟踪","遮挡"]},{"id":"3d-point-tracking","category":"perception","sec":5,"tier":3,"sources":[{"title":"SpatialTrackerV2: 3D Point Tracking Made Easy (arXiv 2507.12462)","url":"https://arxiv.org/abs/2507.12462"},{"title":"TAPVid-3D: A Benchmark for Tracking Any Point in 3D (arXiv 2407.05921)","url":"https://arxiv.org/abs/2407.05921"},{"title":"General Flow as Foundation Affordance for Scalable Robot Learning (arXiv 2401.11439)","url":"https://arxiv.org/abs/2401.11439"}],"as_of":"2025-10","related_ids":["tracking-any-point","cotracker","scene-flow","monocular-depth-estimation","4d-reconstruction"],"name":"3D 点跟踪","alt":"3D Point Tracking","abbr":"","aliases":["三维点跟踪","TAP-3D","Tracking Any Point in 3D","SpatialTrackerV2"],"one_liner":"在视频里持续追踪任意像素点，给出它在三维空间中的运动轨迹。","explanation":"3D 点跟踪是任意点跟踪（在视频里跟踪任意指定像素）的三维版本：给定视频和若干查询点，输出每个点在每一帧的三维坐标以及是否被遮挡。2D 跟踪分不清是物体在动还是相机在动，也没有深度；3D 轨迹能直接描述物体在空间里怎样移动和旋转。SpatialTracker（CVPR 2024）借单目深度估计把像素抬到三维再跟踪；后续的 SpatialTrackerV2（ICCV 2025）把点跟踪、单目深度和相机位姿估计合进一个前馈模型，只用单目视频即可工作。评测基准有 TAPVid-3D。在机器人学习里，3D 点轨迹可作为人类视频到机器人动作的中间表示，例如 General Flow 按语言指令预测物体上各点的未来 3D 轨迹来指导操作。","example":"拍一段人拉开抽屉的视频，用 SpatialTrackerV2 跟踪把手上的点，得到它沿直线外移的 3D 轨迹，可据此推断抽屉的滑动方向，再让机器人沿同一方向拉。","related":["任意点跟踪","CoTracker","场景流","单目深度估计","4D重建"]},{"id":"open-vocabulary-object-detection","category":"perception","sec":5,"tier":2,"sources":[{"title":"Open-Vocabulary Object Detection Using Captions (CVPR 2021)","url":"https://arxiv.org/abs/2011.10678"},{"title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","url":"https://arxiv.org/abs/2303.05499"}],"as_of":"","related_ids":["open-vocabulary","grounding-dino","owl-vit-owlv2","yolo-world","grounded-sam","object-detection"],"name":"开放词汇检测","alt":"Open-Vocabulary Object Detection","abbr":"OVD","aliases":["开放词汇目标检测","开集检测","Open-Set Detection","文本引导检测"],"one_liner":"用文字说出要找什么，检测器就能框出来，不限于训练时的固定类别。","explanation":"传统检测器只认训练时标过框的固定类别（如 COCO 的 80 类）。开放词汇检测让检测器接受任意文字描述，也能框出训练时没有框标注的新类别。这个设定由 Zareian 等人在 CVPR 2021 的论文中明确提出：用少量基础类别的框标注，加上大量图文对学到的视觉-语言对齐，去检测新类别。之后的 OWL-ViT、Grounding DINO、YOLO-World 都走这条路，Grounding DINO 在没用 COCO 训练的情况下零样本拿到 52.5 AP。对机器人很实用：用户说「把蓝色马克杯拿过来」，可以直接拿这句话去框物体。严格说「开集检测」原指把没见过的物体识别为「未知」，但现在常和开放词汇混用。","example":"Grounded-SAM 流水线：先用 Grounding DINO 按文本「香蕉」框出目标，再把框交给 SAM 得到像素级掩码，机器人据此计算抓取点。","related":["开放词汇","Grounding DINO","OWL-ViT / OWLv2","YOLO-World","Grounded-SAM","目标检测"]},{"id":"grounding-dino","category":"perception","sec":5,"tier":2,"sources":[{"title":"Grounding DINO (arXiv:2303.05499)","url":"https://arxiv.org/abs/2303.05499"},{"title":"IDEA-Research/GroundingDINO (GitHub)","url":"https://github.com/IDEA-Research/GroundingDINO"},{"title":"IDEA-Research/Grounding-DINO-1.5-API (GitHub)","url":"https://github.com/IDEA-Research/Grounding-DINO-1.5-API"}],"as_of":"2024-07","related_ids":["open-vocabulary-object-detection","grounded-sam","segment-anything-model","owl-vit-owlv2","yolo-world","dino-x"],"name":"Grounding DINO","alt":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","abbr":"","aliases":["GroundingDINO"],"one_liner":"输入图片和一段文字，就能框出文字所指物体的开放词汇目标检测模型。","explanation":"Grounding DINO 是 IDEA 研究院联合清华等团队 2023 年 3 月发布的开放集目标检测模型，论文后被 ECCV 2024 接收。传统检测器只认训练时固定的那几十类；它把 Transformer 检测器 DINO 和文本编码器结合，在图像和文本特征之间做多层融合，用户输入类别名或一句描述（如「红色杯子」），就输出对应的检测框和匹配的词。论文报告在不用 COCO 训练数据时，COCO 零样本检测达到 52.5 AP。代码以 Apache 2.0 开源，已接入 Hugging Face Transformers。它常和分割模型 SAM 串成 Grounded-SAM：先按文字框出物体，再抠出掩码，是机器人「按指令找东西」的常用前端。后续的 Grounding DINO 1.5/1.6 只通过 API 提供。","example":"用户说「把香蕉放进碗里」，系统用 Grounding DINO 以「banana. bowl.」为提示框出两个物体，再用 SAM 得到掩码，结合深度图算出抓取点和放置点。","related":["开放词汇检测","Grounded-SAM","分割一切模型","OWL-ViT / OWLv2","YOLO-World","DINO-X（开放世界检测）"]},{"id":"owl-vit-owlv2","category":"perception","sec":5,"tier":3,"sources":[{"title":"Simple Open-Vocabulary Object Detection with Vision Transformers (arXiv 2205.06230)","url":"https://arxiv.org/abs/2205.06230"},{"title":"Scaling Open-Vocabulary Object Detection (arXiv 2306.09683)","url":"https://arxiv.org/abs/2306.09683"},{"title":"Hugging Face Transformers: OWLv2","url":"https://huggingface.co/docs/transformers/model_doc/owlv2"}],"as_of":"","related_ids":["open-vocabulary-object-detection","clip","grounding-dino","yolo-world","vision-transformer","ok-robot"],"name":"OWL-ViT / OWLv2","alt":"OWL-ViT / OWLv2 (Open-World Localization Vision Transformer)","abbr":"","aliases":["OWL-ViT","OWLv2","OWL-ST"],"one_liner":"谷歌提出的开放词汇目标检测模型，可用文字或示例图查找物体。","explanation":"OWL-ViT 由 Google 的 Matthias Minderer 等人提出，发表于 ECCV 2022。做法是先用 CLIP 式图文对比学习预训练视觉 Transformer，再端到端微调成检测器：图像每个小块输出一个框和一个特征，与文字特征比相似度，就能检测没见过的类别；也支持给一张示例图做单样本检测。2023 年的 OWLv2 用自训练扩数据：拿现有检测器给网上图文对自动生成伪框标注，规模超过 10 亿例，LVIS 稀有类 AP 从 31.2% 升到 44.6%。两者已进入 Hugging Face Transformers，常被机器人系统用来按语言指令定位物体。","example":"输入一张桌面图像和文字「a red mug」，OWLv2 返回杯子的检测框和置信度，机器人再用框内的深度估计抓取位置。","related":["开放词汇检测","CLIP","Grounding DINO","YOLO-World","视觉 Transformer","OK-Robot"]},{"id":"yolo-world","category":"perception","sec":5,"tier":3,"sources":[{"title":"YOLO-World: Real-Time Open-Vocabulary Object Detection (arXiv)","url":"https://arxiv.org/abs/2401.17270"},{"title":"AILab-CVC/YOLO-World (GitHub)","url":"https://github.com/AILab-CVC/YOLO-World"}],"as_of":"2025-02","related_ids":["open-vocabulary-object-detection","yolo","grounding-dino","owl-vit-owlv2","object-detection","clip"],"name":"YOLO-World","alt":"YOLO-World: Real-Time Open-Vocabulary Object Detection","abbr":"","aliases":[],"one_liner":"输入文字类别名就能实时检测对应物体的开放词汇检测器","explanation":"YOLO-World 是腾讯 AI Lab、ARC Lab 与华中科技大学 2024 年提出的开放词汇目标检测器，发表于 CVPR 2024。传统 YOLO 只能检测训练时定死的类别；YOLO-World 给 YOLO 接上文本编码器，用 RepVL-PAN 网络让图像特征和文字特征互相交互，再用区域-文本对比损失做大规模预训练，用户输入任意类别名就能检测。它采用「先提示后检测」：把用户词表预先编码并重参数化进网络，推理时不再跑文本编码器，所以速度接近普通 YOLO。论文报告在 LVIS 零样本上 35.4 AP、V100 上 52 FPS。机器人里常用它按语言指令实时找目标，再交给抓取或导航模块。","example":"指令是「把红色马克杯拿过来」，程序把 red mug 设为 YOLO-World 的词表，从腕部相机画面实时框出马克杯，再交给抓取位姿检测模块。","related":["开放词汇检测","YOLO","Grounding DINO","OWL-ViT / OWLv2","目标检测","CLIP"]},{"id":"dino-x","category":"perception","sec":5,"tier":3,"sources":[{"title":"arXiv 2411.14347: DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding","url":"https://arxiv.org/abs/2411.14347"},{"title":"IDEA-Research/DINO-X-API (GitHub)","url":"https://github.com/IDEA-Research/DINO-X-API"}],"as_of":"2025-07","related_ids":["grounding-dino","open-vocabulary-object-detection","detr","object-detection","segment-anything-model","grounded-sam"],"name":"DINO-X（开放世界检测）","alt":"DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding (IDEA)","abbr":"","aliases":["DINO-X","DINO-X Pro","DINO-X Edge"],"one_liner":"IDEA 研究院的开放世界检测模型，可按文字、示例或无提示框出物体。","explanation":"DINO-X 是粤港澳大湾区数字经济研究院（IDEA）2024 年 11 月发布的以物体为中心的视觉模型，架构沿用 Grounding DINO 1.5 的 Transformer 编码器-解码器。它支持文字提示、视觉提示（给示例框）和定制提示，其中「通用物体提示」让模型不给提示也能把图中物体都框出来。训练用了团队整理的 1 亿多条定位样本 Grounding-100M。检测头之外还挂了分割、关键点和物体描述等头，可同时输出框、掩码、姿态和文字描述。论文报告 DINO-X Pro 在 COCO 零样本检测上达到 56.0 AP；另有面向边缘设备的 DINO-X Edge。它主要通过 API 提供，机器人里可用它按一句指令找到目标，再交给分割和抓取模块。","example":"把一张桌面照片和提示词「cup」发给 DINO-X API，返回每个杯子的检测框和置信度；再把框交给 SAM 2 得到像素级掩码，就能配合深度图算出杯子位置去抓取。","related":["Grounding DINO","开放词汇检测","DETR","目标检测","分割一切模型","Grounded-SAM"]},{"id":"open-vocabulary-segmentation","category":"perception","sec":5,"tier":3,"sources":[{"title":"Language-driven Semantic Segmentation (LSeg, arXiv 2201.03546)","url":"https://arxiv.org/abs/2201.03546"},{"title":"Towards Open Vocabulary Learning: A Survey (arXiv 2306.15880)","url":"https://arxiv.org/abs/2306.15880"}],"as_of":"","related_ids":["open-vocabulary-object-detection","semantic-segmentation","clip","grounded-sam","sam-3","open-vocabulary"],"name":"开放词汇分割","alt":"Open-Vocabulary Segmentation","abbr":"","aliases":["开集分割","开放词汇语义分割"],"one_liner":"用任意文字描述类别，模型就能把对应的像素分割出来。","explanation":"传统分割模型只能分出训练时定好的那几十上百个类别；开放词汇分割允许测试时用任意文字指定类别，比如「蓝色的洗碗海绵」，模型输出对应的像素掩码。它的底子是 CLIP 这类图文对比预训练模型：把图像每个像素或区域的特征和文字特征放进同一个空间，按相似度决定归属。代表工作有 ICLR 2022 的 LSeg，后来有把开放词汇检测器和 SAM 拼起来的 Grounded-SAM，以及直接接受名词短语提示的 SAM 3。对机器人来说，它让「把桌上某样东西找出来」不必为每个新物体重新标数据、重新训练。","example":"用户说「把充电线收起来」，机器人把「充电线」作为文本输入分割模型，拿到线的像素掩码，再结合深度图算抓取点。","related":["开放词汇检测","语义分割","CLIP","Grounded-SAM","SAM 3（可提示概念分割）","开放词汇"]},{"id":"grounded-sam","category":"perception","sec":5,"tier":3,"sources":[{"title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks (arXiv 2401.14159)","url":"https://arxiv.org/abs/2401.14159"},{"title":"IDEA-Research/Grounded-Segment-Anything GitHub","url":"https://github.com/IDEA-Research/Grounded-Segment-Anything"}],"as_of":"2024-01","related_ids":["grounding-dino","segment-anything-model","open-vocabulary-segmentation","open-vocabulary-object-detection","sam-2","auto-labeling"],"name":"Grounded-SAM","alt":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","abbr":"","aliases":["Grounded SAM","Grounded-Segment-Anything"],"one_liner":"用一句文字就能把图里对应物体框出来并精细分割的开源流水线","explanation":"IDEA 研究院开源的开放世界视觉流水线，2024 年 1 月发布技术报告。核心是把两个模型串起来：Grounding DINO 按文字描述找物体、输出检测框，SAM（分割一切模型）拿到框后输出像素级掩码。这样输入任意文字，比如「红色杯子」，就能得到对应物体的掩码，不用为新类别重新训练；它还能接 RAM、BLIP 自动打标签，接 Stable Diffusion 做图像编辑。报告称其在 SegInW 零样本分割基准上达到 48.7 mAP。机器人里常用它按语言指定目标、抠出物体点云再做抓取或位姿估计，也用来自动标注数据；后续的 Grounded SAM 2 接入 SAM 2，能在视频里跟踪物体。","example":"机器人收到「把香蕉放进碗里」，先用 Grounded-SAM 分别分割出 banana 和 bowl 的掩码，再结合深度图算出两者的三维位置，交给抓取和运动规划模块。","related":["Grounding DINO","分割一切模型","开放词汇分割","开放词汇检测","SAM 2（视频分割一切）","自动标注"]},{"id":"sam-3","category":"perception","sec":5,"tier":2,"sources":[{"title":"SAM 3: Segment Anything with Concepts (arXiv 2511.16719)","url":"https://arxiv.org/abs/2511.16719"},{"title":"Meta AI Blog: Segment Anything Model 3","url":"https://ai.meta.com/blog/segment-anything-model-3/"},{"title":"GitHub: facebookresearch/sam3","url":"https://github.com/facebookresearch/sam3"}],"as_of":"2026-03","related_ids":["segment-anything-model","sam-2","open-vocabulary-segmentation","sam-3d","grounding-dino","instance-segmentation"],"name":"SAM 3（可提示概念分割）","alt":"SAM 3: Segment Anything with Concepts (Promptable Concept Segmentation)","abbr":"","aliases":["SAM 3","SAM 3.1","可提示概念分割","Promptable Concept Segmentation"],"one_liner":"Meta 第三代分割模型，给一个名词短语或示例图，就能分割出所有同类物体。","explanation":"SAM 3 是 Meta 于 2025 年 11 月发布的分割模型，提出「可提示概念分割」任务：给一个简短名词短语（如「黄色校车」）、一个示例图块或两者组合，模型在图像或视频中找出所有符合该概念的实例，输出各自的掩码和身份 ID 并持续跟踪。此前 SAM、SAM 2 一次只分割用户点选的单个目标，也不接受文字提示。SAM 3 约 8.48 亿参数，由 DETR 式检测器和记忆式视频跟踪器共享视觉编码器，另设「存在性头」把「有没有」和「在哪里」分开判断。配套开源 SA-Co 基准，覆盖约 27 万个概念。2026 年 3 月发布的 SAM 3.1 加快了多目标视频跟踪。","example":"给 SAM 3 输入一段厨房视频和文本「杯子」，它分割并持续跟踪画面里的每个杯子、各给一个 ID；取其中一个杯子的掩码配合深度图得到点云，再做抓取位姿估计。","related":["分割一切模型","SAM 2（视频分割一切）","开放词汇分割","SAM 3D","Grounding DINO","实例分割"]},{"id":"visual-grounding","category":"perception","sec":5,"tier":2,"sources":[{"title":"Modeling Context in Referring Expressions (RefCOCO / RefCOCO+ / RefCOCOg, ECCV 2016)","url":"https://arxiv.org/abs/1608.00272"},{"title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","url":"https://arxiv.org/abs/2303.05499"}],"as_of":"","related_ids":["referring-expression-segmentation","3d-visual-grounding","grounding-dino","open-vocabulary-object-detection","pointing","vision-language-model"],"name":"视觉定位（Grounding）","alt":"Visual Grounding","abbr":"","aliases":["短语定位","指代表达理解","REC","Referring Expression Comprehension","Phrase Grounding"],"one_liner":"根据一句话描述，在图像里找出它所指物体的位置。","explanation":"视觉定位（visual grounding）把语言和图像区域对应起来：输入图片和一段文字，输出所指物体的框、掩码或点。给短语找区域叫短语定位；给「左边那只红杯子」这类只指向唯一目标的描述叫指代表达理解（REC），常用 RefCOCO 系列数据集评测。它比普通检测多了理解属性和空间关系的要求。2023 年 IDEA 研究院的 Grounding DINO 能按任意文字找物体，如今多数视觉语言模型也能直接输出框或点坐标。机器人按指令抓东西，第一步往往就是 grounding。注意中文「视觉定位」也常指机器人用相机确定自身位置（visual localization），两者不是一回事。","example":"指令是「把左边那只红色杯子递给我」，模型先在相机图像里框出这一只杯子（旁边的蓝杯子不算），再把框内的深度点投到三维空间，交给抓取模块。","related":["指代表达分割","3D视觉定位","Grounding DINO","开放词汇检测","指向（点预测）","视觉语言模型"]},{"id":"referring-expression-segmentation","category":"perception","sec":5,"tier":3,"sources":[{"title":"Segmentation from Natural Language Expressions (arXiv 1603.06180)","url":"https://arxiv.org/abs/1603.06180"}],"as_of":"","related_ids":["visual-grounding","open-vocabulary-segmentation","instance-segmentation","mask","grounded-sam","language-grounding"],"name":"指代表达分割","alt":"Referring Expression Segmentation","abbr":"RES","aliases":["指代分割","指代图像分割","Referring Image Segmentation"],"one_liner":"根据一句描述某个物体的话，在图中把那个物体精确抠出来。","explanation":"指代表达分割的输入是一张图和一句自然语言描述（如「右边长椅上坐着的两个人」），输出描述所指物体的像素级掩码。它比开放词汇分割更细：后者按类别名分出所有同类物体，指代分割则要依据颜色、位置、相互关系等描述挑出特定的那一个。2016 年 Hu 等人提出了较早的端到端方法：用 LSTM 编码句子，与卷积网络的特征图融合后逐像素预测。常用基准有 RefCOCO、RefCOCO+ 和 G-Ref。如今多由多模态大模型或文本定位模型配合 SAM 类分割模型完成。机器人听到「把左边那个红杯子递给我」时，就要先靠它找出目标的像素区域，再结合深度得到 3D 位置去抓。","example":"指令为「拿桌上最左边的蓝色积木」，模型在腕部相机图像中输出那一块积木的掩码。","related":["视觉定位（Grounding）","开放词汇分割","实例分割","掩码","Grounded-SAM","语言接地"]},{"id":"depth-estimation","category":"perception","sec":6,"tier":2,"sources":[{"title":"Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer (MiDaS, arXiv 1907.01341)","url":"https://arxiv.org/abs/1907.01341"},{"title":"Depth Anything V2 (arXiv 2406.09414)","url":"https://arxiv.org/abs/2406.09414"}],"as_of":"","related_ids":["monocular-depth-estimation","stereo-matching","depth-camera","metric-depth-relative-depth","depth-completion","depth-anything"],"name":"深度估计","alt":"Depth Estimation","abbr":"","aliases":["深度预测"],"one_liner":"推断图像里每个像素离相机有多远，输出一张深度图。","explanation":"深度估计是从图像推断场景各点到相机距离的任务，结果通常是一张与图像同尺寸的深度图。做法大致三类：双目立体匹配，按两台相机的视差用三角关系计算；主动测距，如结构光、ToF 深度相机和激光雷达；单目深度估计，用神经网络从单张图推断。单目天然有尺度歧义，早期模型多只给相对深度，MiDaS（TPAMI 2020）靠混合多数据集训练提升了跨场景泛化，近年的 Depth Pro、Metric3D 等可直接输出以米为单位的度量深度。对机器人，深度是把像素变成点云、做抓取和避障的基础，学习型方法还能弥补深度相机在透明、反光物体上的空洞。","example":"深度相机拍玻璃杯时杯身区域深度大片缺失，用学习型模型从 RGB 图估计深度把洞补上，才能生成完整点云供抓取检测使用。","related":["单目深度估计","立体匹配","深度相机","度量深度 / 相对深度","深度补全","Depth Anything"]},{"id":"monocular-depth-estimation","category":"perception","sec":6,"tier":2,"sources":[{"title":"Depth Map Prediction from a Single Image using a Multi-Scale Deep Network (arXiv:1406.2283)","url":"https://arxiv.org/abs/1406.2283"},{"title":"Depth Anything V2 (arXiv:2406.09414)","url":"https://arxiv.org/abs/2406.09414"}],"as_of":"","related_ids":["depth-estimation","metric-depth-relative-depth","depth-anything","depth-pro","depth-map","stereo-matching"],"name":"单目深度估计","alt":"Monocular Depth Estimation","abbr":"MDE","aliases":["单目深度","单图深度估计"],"one_liner":"只用一张普通彩色图像，预测每个像素离相机有多远。","explanation":"单目深度估计只凭一台普通 RGB 相机拍的单张图像，预测每个像素的深度，输出一张深度图。它天生有歧义：同一张照片可能是近处的小物体，也可能是远处的大物体，尺度最难定，模型只能靠从数据中学到的物体大小、透视、遮挡等线索。纽约大学 Eigen 等人 2014 年最早用深度网络由粗到细预测深度；Depth Anything V2（NeurIPS 2024）用合成数据加大量伪标注真实图像训练。输出分相对深度（只知远近顺序）和度量深度（以米为单位）。对机器人，它能在没有深度相机时补上 3D 信息，也常用来从互联网视频中恢复场景几何。","example":"机械臂只有一个腕部 RGB 相机，用 Depth Anything V2 的度量深度版本从每帧图像估出深度图，再用相机内参反投影成点云，供抓取规划使用。","related":["深度估计","度量深度 / 相对深度","Depth Anything","Depth Pro","深度图","立体匹配"]},{"id":"metric-depth-relative-depth","category":"perception","sec":6,"tier":3,"sources":[{"title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","url":"https://arxiv.org/abs/2302.12288"},{"title":"MiDaS: Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer","url":"https://arxiv.org/abs/1907.01341"}],"as_of":"","related_ids":["monocular-depth-estimation","depth-estimation","metric3d","depth-anything","depth-pro","depth-camera"],"name":"度量深度 / 相对深度","alt":"Metric Depth / Relative Depth","abbr":"","aliases":["绝对深度","尺度不确定性","Scale Ambiguity","仿射不变深度","Affine-invariant Depth"],"one_liner":"度量深度以米给出真实距离；相对深度只给远近关系，差一个未知缩放和偏移。","explanation":"深度估计的输出分两种。度量深度（也叫绝对深度）给出每个像素到相机的真实距离，单位是米，深度相机、激光雷达测到的就是这种；相对深度只告诉你哪里近哪里远，数值和真实距离之间差一个未知的缩放和偏移。单目图像天生有尺度不确定性：同一张照片可能是近处的模型，也可能是远处的真房子，加上不同相机焦距不同，混在一起训练会互相矛盾。所以 MiDaS 这类方法用对尺度和偏移不敏感的损失，在大量混合数据上训练相对深度，泛化好但没有米制尺度；ZoeDepth、Metric3D、Depth Pro 等则设法直接输出度量深度。机器人抓取、避障要知道物体到底多远，因此需要度量深度，或用少量真实测距点把相对深度对齐到真实尺度。","example":"同一张桌面照片，相对深度模型只能告诉你杯子比后面的墙近；度量深度模型会给出杯子离相机大约多少米，机械臂才能据此规划抓取。","related":["单目深度估计","深度估计","Metric3D","Depth Anything","Depth Pro","深度相机"]},{"id":"depth-anything","category":"perception","sec":6,"tier":2,"sources":[{"title":"Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data (arXiv 2401.10891)","url":"https://arxiv.org/abs/2401.10891"},{"title":"Depth Anything V2 (arXiv 2406.09414)","url":"https://arxiv.org/abs/2406.09414"},{"title":"DepthAnything/Depth-Anything-V2（GitHub）","url":"https://github.com/DepthAnything/Depth-Anything-V2"}],"as_of":"2025-01","related_ids":["monocular-depth-estimation","metric-depth-relative-depth","depth-estimation","depth-anything-3","prompt-depth-anything","vision-foundation-model"],"name":"Depth Anything","alt":"Depth Anything (V1 / V2)","abbr":"","aliases":["Depth Anything V2","Depth Anything V1"],"one_liner":"港大与 TikTok 推出的单目深度估计基础模型，一张照片就能出深度图。","explanation":"Depth Anything 是香港大学与 TikTok 研究团队提出的单目深度估计模型系列。V1（CVPR 2024）在约 150 万张有标注图像之外，用约 6200 万张无标注图像做伪标签训练，泛化很强，输出相对深度。V2（NeurIPS 2024）改用合成数据训练大教师模型，再用大规模伪标注真实图像训练学生模型，细节更清晰，提供约 2500 万到 13 亿参数的多个尺寸，另有度量深度微调版；Small 版为 Apache-2.0 许可，更大的版本限非商用。机器人里常用它补足深度相机，为 3D 感知、导航和数据生成提供深度先验。后续有 Depth Anything 3 等。","example":"给腕部相机的一帧 RGB 图跑 Depth Anything V2-Small，得到逐像素相对深度，再用少量深度相机测得的点拟合尺度和偏移，恢复出以米为单位的深度。","related":["单目深度估计","度量深度 / 相对深度","深度估计","Depth Anything 3","Prompt Depth Anything","视觉基础模型"]},{"id":"depth-pro","category":"perception","sec":6,"tier":3,"sources":[{"title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second (arXiv 2410.02073)","url":"https://arxiv.org/abs/2410.02073"},{"title":"apple/ml-depth-pro (GitHub)","url":"https://github.com/apple/ml-depth-pro"}],"as_of":"2025-04","related_ids":["monocular-depth-estimation","metric-depth-relative-depth","depth-anything","metric3d","moge","camera-intrinsics"],"name":"Depth Pro","alt":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second (Apple)","abbr":"","aliases":["Apple Depth Pro"],"one_liner":"苹果开源的单目度量深度模型，一张图输出以米为单位的清晰深度图。","explanation":"Depth Pro 由苹果的 Bochkovskii、Koltun 等人提出，2024 年 10 月公开论文、代码和权重，发表于 ICLR 2025。它做零样本单目度量深度估计：只给一张图，不需要相机内参等元数据，就输出以米为单位的绝对深度，同时估计相机焦距。主打边缘锐利、细节丰富，论文称在普通 GPU 上 0.3 秒生成一张 225 万像素的深度图。技术上用了高效的多尺度视觉 Transformer 做稠密预测，训练混合真实与合成数据，并提出了专门衡量深度边界准确度的指标。相对深度只知道谁远谁近，度量深度带真实尺度，才能直接反投影成点云给机器人用。","example":"给一张网上下载、没有拍摄参数的厨房照片，Depth Pro 输出每个像素离相机多少米以及估计的焦距，按针孔相机模型就能还原出有真实尺度的点云。","related":["单目深度估计","度量深度 / 相对深度","Depth Anything","Metric3D","MoGe","相机内参"]},{"id":"metric3d","category":"perception","sec":6,"tier":3,"sources":[{"title":"arXiv: Metric3D: Towards Zero-shot Metric 3D Prediction from A Single Image","url":"https://arxiv.org/abs/2307.10984"},{"title":"arXiv: Metric3Dv2: A Versatile Monocular Geometric Foundation Model","url":"https://arxiv.org/abs/2404.15506"},{"title":"GitHub: YvanYin/Metric3D","url":"https://github.com/YvanYin/Metric3D"}],"as_of":"2025-01","related_ids":["monocular-depth-estimation","metric-depth-relative-depth","camera-intrinsics","depth-anything","depth-pro","moge"],"name":"Metric3D","alt":"Metric3D: Towards Zero-shot Metric 3D Prediction from a Single Image","abbr":"","aliases":["Metric3D v2","Metric3Dv2"],"one_liner":"从单张图片估计米制深度的模型，靠标准相机空间变换消除不同相机的尺度歧义。","explanation":"Metric3D 由尹伟、沈春华等人提出，发表于 ICCV 2023，目标是从单张照片零样本估计带真实尺度的深度。难点在于不同相机焦距不同，同样大小的物体在图上显得远近不一，把各种相机拍的数据混在一起训练，尺度会互相冲突。它的做法是「标准相机空间变换」：训练时把所有样本按焦距统一换算到一个虚拟的标准相机下，推理时再按真实相机内参换算回去。这样能用 800 多万张、来自上千种相机的图片训练，对没见过的相机也能给出米制深度，在 7 个零样本基准上取得当时最好成绩。2024 年的 Metric3D v2（TPAMI）换用 DINOv2 骨干，训练数据增至 1600 多万张，并增加表面法向量估计。代码以 BSD 协议开源。","example":"单目 SLAM 只靠一个普通相机，不知道场景真实尺度；Metric3D 仓库推荐了一个把它预测的深度接入 DROID-SLAM 的开源实现，用来得到米制尺度的建图结果。","related":["单目深度估计","度量深度 / 相对深度","相机内参","Depth Anything","Depth Pro","MoGe"]},{"id":"moge","category":"perception","sec":6,"tier":3,"sources":[{"title":"microsoft/MoGe - GitHub","url":"https://github.com/microsoft/moge"},{"title":"CVPR 2025 Oral: MoGe","url":"https://cvpr.thecvf.com/virtual/2025/oral/35291"}],"as_of":"2025-06","related_ids":["monocular-depth-estimation","pointmap","metric-depth-relative-depth","depth-anything","dust3r","depth-pro"],"name":"MoGe","alt":"MoGe (Monocular Geometry Estimation)","abbr":"","aliases":["MoGe-2","MoGe 单目几何估计"],"one_liner":"微软研究院的单图 3D 几何估计模型，输出每个像素的 3D 点。","explanation":"MoGe 是微软研究院提出的单目几何估计模型，论文为 CVPR 2025 口头报告。它从一张普通照片直接预测点图（每个像素对应的 3D 坐标），并同时给出深度图和相机视场角。初版预测的是尺度和平移不定的仿射不变点图，配合专门设计的全局对齐和多尺度局部几何损失来训练。2025 年 6 月发布的 MoGe-2 能输出真实米制尺度的点图，并加入法向量估计。机器人可用它从单个相机图像恢复场景几何。","example":"给一张网上找来的厨房照片，MoGe 输出每个像素的 3D 坐标和相机视场角，可直接转成点云。","related":["单目深度估计","点图","度量深度 / 相对深度","Depth Anything","DUSt3R","Depth Pro"]},{"id":"foundationstereo","category":"perception","sec":6,"tier":3,"sources":[{"title":"FoundationStereo: Zero-Shot Stereo Matching (arXiv 2501.09898)","url":"https://arxiv.org/abs/2501.09898"},{"title":"NVlabs/FoundationStereo GitHub","url":"https://github.com/NVlabs/FoundationStereo"}],"as_of":"2025-12","related_ids":["stereo-matching","disparity","stereo-camera","depth-estimation","foundationpose","depth-anything"],"name":"FoundationStereo","alt":"FoundationStereo: Zero-Shot Stereo Matching","abbr":"","aliases":["Fast-FoundationStereo"],"one_liner":"英伟达的双目立体匹配基础模型，换场景不用微调也能出深度","explanation":"英伟达 Bowen Wen 等人提出的立体匹配模型，发表于 CVPR 2025。输入左右两张相机图像，输出稠密视差图，再用基线和焦距换算成深度或点云。以往的立体匹配网络换到新场景往往要重新微调；FoundationStereo 用约 100 万对高真实感合成双目图（FSD 数据集）训练，并通过旁路微调（side-tuning）引入视觉基础模型的单目深度先验，缩小仿真与真实的差距，做到零样本泛化，官方称发布时在 Middlebury 和 ETH3D 榜单排第一。机器人里常用它从双目图像得到更完整的深度，供抓取和位姿估计使用；2025 年 12 月又推出实时版 Fast-FoundationStereo。","example":"用双目相机拍下桌面的左右两张图，送进 FoundationStereo 得到深度图和点云，再交给 FoundationPose 估计目标物体的 6D 位姿。","related":["立体匹配","视差","双目相机","深度估计","FoundationPose","Depth Anything"]},{"id":"prompt-depth-anything","category":"perception","sec":6,"tier":3,"sources":[{"title":"Prompt Depth Anything 项目主页","url":"https://promptda.github.io/"},{"title":"DepthAnything/PromptDA (GitHub)","url":"https://github.com/DepthAnything/PromptDA"},{"title":"Prompting Depth Anything for 4K Resolution Accurate Metric Depth Estimation (arXiv 2412.14015)","url":"https://arxiv.org/abs/2412.14015"}],"as_of":"2025-06","related_ids":["depth-anything","monocular-depth-estimation","metric-depth-relative-depth","depth-completion","lidar","transparent-and-reflective-object-perception"],"name":"Prompt Depth Anything","alt":"Prompt Depth Anything","abbr":"","aliases":["PromptDA","Prompting Depth Anything for 4K Resolution Accurate Metric Depth Estimation"],"one_liner":"把低成本激光雷达的稀疏深度当「提示」，让深度大模型输出 4K 米制深度。","explanation":"Prompt Depth Anything 由浙江大学、字节跳动 Seed 等团队提出，发表于 CVPR 2025，代码和模型以 Apache-2.0 协议开源。单目深度模型（如 Depth Anything）边缘细节好，但不知道真实尺度；iPhone 等设备上的低成本激光雷达能给出真实距离，但分辨率极低（论文示例为 24×24）。它把激光雷达深度当作提示，在解码器多个尺度上融合进 Depth Anything，输出最高 4K 分辨率、以米为单位的度量深度。论文在宇树 H1 上做了抓取实验：策略只在漫反射物体上训练，换用它的深度后能抓透明和反光物体，优于只用 RGB 或只用激光雷达。","example":"用 iPhone 同时录下 RGB 和激光雷达数据，经 Prompt Depth Anything 得到高分辨率深度，再转成点云供抓取策略使用。","related":["Depth Anything","单目深度估计","度量深度 / 相对深度","深度补全","激光雷达","透明/反光物体感知"]},{"id":"depth-completion","category":"perception","sec":6,"tier":3,"sources":[{"title":"Deep Depth Completion of a Single RGB-D Image (arXiv 1803.09326, CVPR 2018)","url":"https://arxiv.org/abs/1803.09326"},{"title":"ClearGrasp: 3D Shape Estimation of Transparent Objects for Manipulation (arXiv 1910.02550)","url":"https://arxiv.org/abs/1910.02550"}],"as_of":"","related_ids":["depth-holes","depth-camera","transparent-and-reflective-object-perception","monocular-depth-estimation","prompt-depth-anything","lingbot-depth"],"name":"深度补全","alt":"Depth Completion","abbr":"","aliases":["深度修复","深度图补全","Depth Inpainting"],"one_liner":"把深度图里缺失或稀疏的像素补齐，得到完整、稠密的深度。","explanation":"深度补全指给定一张不完整的深度图（有空洞，或像激光雷达那样只有稀疏点），通常再配上对应的彩色图，预测出每个像素都有值的稠密深度。机器人常用的 RGB-D 深度相机碰到透明、反光、过亮或太远的表面时经常测不出深度，而抓取、避障又依赖完整几何，所以补全是常见的预处理。最简单的做法是用邻近像素插值填洞；Zhang 与 Funkhouser 在 CVPR 2018 提出先用彩色图预测表面法向和遮挡边界，再与原始深度联合求解出完整深度；ClearGrasp（2019）专门补全透明物体的深度来支持抓取。近年也有用单目深度基础模型结合稀疏深度来做补全的方法。","example":"夹爪要抓桌上的玻璃杯，但深度相机在杯子区域几乎全是无效值；先用 ClearGrasp 这类方法补出杯子表面的深度，再交给抓取检测网络。","related":["深度空洞","深度相机","透明/反光物体感知","单目深度估计","Prompt Depth Anything","蚂蚁灵波 LingBot-Depth"]},{"id":"lingbot-depth","category":"perception","sec":6,"tier":3,"sources":[{"title":"Masked Depth Modeling for Spatial Perception (arXiv 2601.17895)","url":"https://arxiv.org/abs/2601.17895"},{"title":"GitHub: Robbyant/lingbot-depth","url":"https://github.com/Robbyant/lingbot-depth"},{"title":"Robbyant 官网：LingBot-Depth","url":"https://technology.robbyant.com/lingbot-depth"}],"as_of":"2026-09","related_ids":["depth-completion","depth-camera","transparent-and-reflective-object-perception","depth-holes","masked-autoencoder","robbyant"],"name":"蚂蚁灵波 LingBot-Depth","alt":"LingBot-Depth (Masked Depth Modeling for Spatial Perception)","abbr":"","aliases":["LingBot-Depth","Masked Depth Modeling","掩码深度建模"],"one_liner":"蚂蚁灵波开源的深度补全模型，用彩色图修补深度相机的空洞和噪声。","explanation":"LingBot-Depth 是蚂蚁集团旗下具身智能公司蚂蚁灵波（Robbyant）2026 年 1 月发布并开源的深度模型，论文为《Masked Depth Modeling for Spatial Perception》，GitHub 说明已被 ECCV 2026 接收。RGB-D 深度相机在透明、反光表面上常测不出深度，留下空洞和噪点。它把这些缺失区域当作天然的「掩码」：输入彩色图、原始深度和相机内参，用 ViT-Large 骨干融合两种模态，输出补全后的度量深度图和相机坐标系点云。训练用约 300 万对 RGB-D 数据（约 200 万真实、100 万合成）。官方称其深度补全误差比现有最好方法降低 40%–50%。代码、权重和数据集均已开源。","example":"官方抓取实验中，用 LingBot-Depth 修补后的深度去抓难测物体：透明收纳盒成功率从 0% 提到 50%，玻璃杯从 60% 提到 80%，钢杯从 65% 提到 85%。","related":["深度补全","深度相机","透明/反光物体感知","深度空洞","掩码自编码器","蚂蚁灵波"]},{"id":"camera-depth-models","category":"perception","sec":6,"tier":3,"sources":[{"title":"Manipulation as in Simulation: Enabling Accurate Geometry Perception in Robots (arXiv 2509.02530)","url":"https://arxiv.org/abs/2509.02530"},{"title":"Manipulation as in Simulation 项目页","url":"https://manipulation-as-in-simulation.github.io/"}],"as_of":"2025-09","related_ids":["depth-completion","sim-to-real-transfer","sim-to-real-gap","depth-camera","transparent-and-reflective-object-perception","lingbot-depth"],"name":"CDM 相机深度模型","alt":"Camera Depth Models","abbr":"CDM","aliases":["Camera Depth Model","Manipulation as in Simulation"],"one_liner":"字节 Seed 提出的深度修复模型，把深度相机的噪声深度修成接近仿真的精确深度。","explanation":"CDM 出自 2025 年 9 月字节跳动 Seed 联合上海交大、浙大、清华发布的论文「Manipulation as in Simulation」。普通深度相机在反光、透明、细长物体和边缘处噪声大、缺失多，用深度或点云训练的策略很难从仿真直接迁到真机。CDM 是接在相机后面的软件插件：输入 RGB 图和原始深度，输出去噪后的度量深度（真实米制尺度）。训练数据来自作者的「神经数据引擎」，通过模拟各款相机的深度噪声模式批量生成成对数据；按相机型号提供模型，覆盖 RealSense 多个型号、Azure Kinect 和 ZED 2i，模型和 ByteCameraDepth 数据集均已开源。论文显示，只用仿真深度训练的操作策略接上 CDM 后，不加噪声、不微调就能在真机上处理铰接、反光和细长物体。","example":"在仿真里只用干净深度图训练「把碗放进微波炉」的策略，部署时先把 RealSense 的原始深度送进对应型号的 CDM，再把输出的深度喂给策略，不用真机数据微调。","related":["深度补全","仿真到现实迁移","虚实差距","深度相机","透明/反光物体感知","蚂蚁灵波 LingBot-Depth"]},{"id":"transparent-and-reflective-object-perception","category":"perception","sec":6,"tier":3,"sources":[{"title":"ClearGrasp: 3D Shape Estimation of Transparent Objects for Manipulation (arXiv:1910.02550)","url":"https://arxiv.org/abs/1910.02550"}],"as_of":"","related_ids":["depth-completion","depth-holes","depth-camera","surface-normal-estimation","grasp-pose-detection","active-stereo"],"name":"透明/反光物体感知","alt":"Transparent & Reflective Object Perception","abbr":"","aliases":["透明物体深度估计","高反光物体感知","透明物体感知"],"one_liner":"让机器人看清玻璃杯、金属件这类深度相机「看不准」的物体。","explanation":"指针对玻璃、透明塑料、镜面金属等物体的检测、分割和三维形状估计。常见深度相机靠红外光的反射来测距，光线会穿过透明物体或被镜面反射走，结果是深度图里出现空洞（没有读数的像素），或者读到的是物体背后桌面的距离，机器人照此去抓就会落空。典型做法是用神经网络从彩色图预测透明区域的掩码、表面法向和遮挡边界，再做深度补全（把缺失的深度填上）；Sajjan、Andy Zeng、宋舒然等人 2019 年的 ClearGrasp 是代表工作。家务、实验室、零售场景里玻璃杯、瓶子很多，这是抓取落地绕不开的问题。","example":"ClearGrasp 从单张 RGB-D 图像估计透明物体的表面法向、掩码和遮挡边界，修正深度后再交给抓取算法，提升了机械臂抓透明物体的成功率。","related":["深度补全","深度空洞","深度相机","法向量估计","抓取位姿检测","主动双目"]},{"id":"transparent-and-reflective-object-perception-datasets-and-be","category":"perception","sec":6,"tier":3,"sources":[{"title":"ClearGrasp: 3D Shape Estimation of Transparent Objects for Manipulation (arXiv)","url":"https://arxiv.org/abs/1910.02550"},{"title":"TransCG: A Large-Scale Real-World Dataset for Transparent Object Depth Completion and a Grasping Baseline (arXiv)","url":"https://arxiv.org/abs/2202.08471"},{"title":"TransCG 数据集主页 (GraspNet)","url":"https://graspnet.net/transcg"}],"as_of":"2022","related_ids":["transparent-and-reflective-object-perception","depth-completion","depth-holes","depth-camera","grasp-pose-detection","realsense-depth-camera"],"name":"透明/反光物体感知（数据集基准）","alt":"Transparent & Reflective Object Perception Datasets and Benchmarks","abbr":"","aliases":["透明物体深度补全数据集","ClearGrasp","TransCG"],"one_liner":"专为玻璃、金属等深度相机难测物体收集的深度与分割数据集","explanation":"这类数据集专门针对玻璃杯、塑料瓶、不锈钢餐具等透明或高反光物体。普通深度相机依赖光线正常反射回来，遇到它们会出现深度空洞，或把背后的桌面当成物体表面，导致抓取失败。代表工作有 2019 年发布的 ClearGrasp：提供 5 万多张合成 RGB-D 图和 286 张带真值的真实图，并通过预测表面法向、透明区域掩码和遮挡边界来修复深度；以及上海交大卢策吾团队的 TransCG（RA-L 2022）：用两台 RealSense 相机在 130 个场景采了 57715 张真实 RGB-D 图，覆盖 60 个透明物体，附真值深度、法向和掩码。它们主要用于训练和评测深度补全网络，补好的深度再交给抓取算法。","example":"腕部 RealSense 拍到的厨房画面里，玻璃杯区域深度几乎全是空洞；用在 TransCG 上训练的深度补全网络补齐后，抓取检测才能给出可用的抓取位姿。","related":["透明/反光物体感知","深度补全","深度空洞","深度相机","抓取位姿检测","RealSense 深度相机（D435i / D405）"]},{"id":"feature-points","category":"perception","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Scale-invariant feature transform","url":"https://en.wikipedia.org/wiki/Scale-invariant_feature_transform"},{"title":"Wikipedia: Oriented FAST and rotated BRIEF","url":"https://en.wikipedia.org/wiki/Oriented_FAST_and_rotated_BRIEF"},{"title":"ORB-SLAM: a Versatile and Accurate Monocular SLAM System","url":"https://arxiv.org/abs/1502.00956"}],"as_of":"","related_ids":["feature-matching","visual-slam","orb-slam3","superpoint-superglue-lightglue","keypoint-detection","structure-from-motion"],"name":"特征点","alt":"Feature Points (SIFT / ORB)","abbr":"","aliases":["局部特征","兴趣点","SIFT","ORB","Local Features"],"one_liner":"图像中角点、斑点等容易被重复找到的点，外加一个描述其周围外观的向量。","explanation":"特征点是图像中纹理明显、换个视角或光照还能被重复找到的点，如角点和斑点。一个特征点包含两部分：位置（有时还带尺度和方向），以及描述子，即概括周围小块图像外观的向量，用来和其他图像比对。SIFT 由 David Lowe 于 1999 年提出、2004 年发表完整论文，对缩放、旋转和光照变化不敏感，描述子是 128 维浮点向量，专利已于 2020 年到期；ORB 由 Rublee 等人 2011 年提出，结合 FAST 角点检测和改进的 BRIEF 二进制描述子，比 SIFT 快得多，适合实时系统。特征点是视觉 SLAM、运动恢复结构和图像拼接的基础，深度学习时代也出现了 SuperPoint 等学习型特征点。","example":"ORB-SLAM（IEEE T-RO 2015）在跟踪、建图、重定位和回环检测四个环节都使用同一套 ORB 特征。","related":["特征匹配","视觉SLAM","ORB-SLAM3","SuperPoint / LightGlue","关键点检测","运动恢复结构"]},{"id":"feature-matching","category":"perception","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Scale-invariant feature transform（含 Lowe 比值检验）","url":"https://en.wikipedia.org/wiki/Scale-invariant_feature_transform"},{"title":"LightGlue: Local Feature Matching at Light Speed","url":"https://arxiv.org/abs/2306.13643"}],"as_of":"","related_ids":["feature-points","random-sample-consensus","superpoint-superglue-lightglue","structure-from-motion","visual-slam","epipolar-geometry"],"name":"特征匹配","alt":"Feature Matching","abbr":"","aliases":["特征点匹配","对应点匹配","Keypoint Matching","Correspondence Matching"],"one_liner":"在两张图像之间找出对应同一个物理点的特征点配对。","explanation":"特征匹配是在两幅图像（或两片点云）之间找出对应同一物理点的特征对。经典流程是：先在每张图上提取特征点和描述子（如 SIFT、ORB）；再按描述子距离找最近邻，浮点描述子用欧氏距离，ORB 这类二进制描述子用汉明距离；接着用 David Lowe 提出的比值检验去掉模棱两可的匹配，即最近邻与次近邻的距离比太大就丢弃；最后用 RANSAC 拟合几何模型，剔除不符合的外点。近年 SuperGlue、LightGlue 等用注意力网络直接学习匹配，在视角和光照变化大时更可靠。匹配结果是相机位姿估计、三角化、视觉 SLAM 和运动恢复结构的基础。","example":"苏黎世联邦理工的 LightGlue（ICCV 2023）在 SuperGlue 基础上改进，能根据图像对的难易自适应提前结束计算，两张图重叠多、外观变化小时匹配明显更快。","related":["特征点","随机采样一致性","SuperPoint / LightGlue","运动恢复结构","视觉SLAM","对极几何"]},{"id":"superpoint-superglue-lightglue","category":"perception","sec":6,"tier":3,"sources":[{"title":"LightGlue: Local Feature Matching at Light Speed (arXiv 2306.13643)","url":"https://arxiv.org/abs/2306.13643"},{"title":"SuperPoint: Self-Supervised Interest Point Detection and Description (arXiv 1712.07629)","url":"https://arxiv.org/abs/1712.07629"},{"title":"SuperGlue: Learning Feature Matching with Graph Neural Networks (arXiv 1911.11763)","url":"https://arxiv.org/abs/1911.11763"}],"as_of":"2023-06","related_ids":["feature-points","feature-matching","structure-from-motion","visual-slam","relocalization","random-sample-consensus"],"name":"SuperPoint / LightGlue","alt":"SuperPoint / SuperGlue / LightGlue (Learned Feature Matching)","abbr":"","aliases":["SuperPoint","SuperGlue","LightGlue","学习型特征匹配"],"one_liner":"一组用神经网络做特征点检测和跨图匹配的模型，替代 SIFT 等手工方法。","explanation":"这是一条学习型特征匹配的技术线。SuperPoint 由 Magic Leap 在 2018 年提出，用一个网络同时输出图像里的关键点位置和描述子（描述该点周围样子的向量），替代 SIFT、ORB 这类手工设计的特征。SuperGlue（2020）用图神经网络和注意力机制，在两张图的关键点之间做匹配，并能判断哪些点在另一张图里没有对应。LightGlue（2023，ETH 苏黎世）是 SuperGlue 的改进版，论文称更省显存和计算、更准、也更容易训练，还能按匹配难度自适应地提前结束推理。它们常被接在 SfM、视觉 SLAM、重定位的前端，用来在光照变化、视角变化大时仍找到可靠对应点。","example":"在 hloc 或 COLMAP 流程里用 SuperPoint 提点、LightGlue 匹配，替换默认的 SIFT，可以在白天和夜晚拍的照片之间找到更多正确匹配。","related":["特征点","特征匹配","运动恢复结构","视觉SLAM","重定位","随机采样一致性"]},{"id":"dense-correspondence","category":"perception","sec":6,"tier":3,"sources":[{"title":"Dense Object Nets: Learning Dense Visual Object Descriptors By and For Robotic Manipulation (arXiv 1806.08756)","url":"https://arxiv.org/abs/1806.08756"},{"title":"Emergent Correspondence from Image Diffusion (DIFT, arXiv 2306.03881)","url":"https://arxiv.org/abs/2306.03881"}],"as_of":"","related_ids":["feature-matching","semantic-keypoints","optical-flow","dinov2","keypoint-detection","neural-descriptor-fields"],"name":"稠密对应","alt":"Dense Correspondence (Semantic Correspondence)","abbr":"","aliases":["稠密匹配","语义对应","Dense Matching"],"one_liner":"为一张图里的每个像素，找到它在另一张图里对应的位置。","explanation":"稠密对应指在两张图像之间为每个像素（或绝大多数像素）找到匹配点，区别于只匹配少量特征点的稀疏匹配。它分两类：几何对应找同一个物理点在不同视角或时刻的位置，相邻帧的光流就是一种；语义对应找不同物体上意义相同的部位，比如两只外形不同的杯子的杯柄。近年常直接用预训练视觉模型的特征做最近邻匹配，例如 DINO 系列特征，或 NeurIPS 2023 的 DIFT 从扩散模型里提取的特征，不需要专门训练。在机器人里，它可以把演示中的抓取点、关键点迁移到新物体上；MIT 2018 年的 Dense Object Nets 就用自监督学到的稠密描述子，实现同类物体之间的抓取迁移。","example":"演示时人抓的是一只红杯子的杯柄；换成一只没见过的蓝色马克杯后，用 DINOv2 特征做语义对应，找到蓝杯子上对应的杯柄像素，再结合深度得到抓取位置。","related":["特征匹配","语义关键点","光流","DINOv2","关键点检测","神经描述子场"]},{"id":"random-sample-consensus","category":"perception","sec":6,"tier":3,"sources":[{"title":"Random sample consensus - Wikipedia","url":"https://en.wikipedia.org/wiki/Random_sample_consensus"}],"as_of":"","related_ids":["feature-matching","homography","perspective-n-point","point-cloud-registration","epipolar-geometry","point-cloud-segmentation"],"name":"随机采样一致性","alt":"Random Sample Consensus","abbr":"RANSAC","aliases":["RANSAC 算法"],"one_liner":"反复随机抽少量数据拟合模型，留下最多数据支持的那个，以剔除异常值。","explanation":"随机采样一致性（RANSAC）由 SRI 的 Fischler 和 Bolles 于 1981 年提出。真实数据里常混着大量错误点（外点），直接用最小二乘拟合会被带偏。RANSAC 的做法是：随机抽取拟合所需的最少样本（比如拟合平面取 3 个点）算出一个模型；统计有多少数据落在误差阈值内（内点）；重复多次，保留内点最多的模型，最后用全部内点再精修一次。它是计算机视觉的基础工具，常用于特征匹配后估计单应性矩阵和基础矩阵、配合 PnP 求相机位姿、给点云配准做粗对齐。在机器人桌面场景里，常先用它拟合出桌面平面并删掉，剩下的点就是桌上的物体。","example":"对 RGB-D 点云跑 RANSAC 平面拟合，找出桌面并删除，剩余点再聚类，就得到桌上各个物体。","related":["特征匹配","单应性矩阵","PnP（透视n点）","点云配准","对极几何","点云分割"]},{"id":"epipolar-geometry","category":"perception","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Epipolar geometry","url":"https://en.wikipedia.org/wiki/Epipolar_geometry"},{"title":"Wikipedia: Essential matrix","url":"https://en.wikipedia.org/wiki/Essential_matrix"}],"as_of":"","related_ids":["triangulation","stereo-matching","homography","camera-calibration","structure-from-motion","random-sample-consensus"],"name":"对极几何","alt":"Epipolar Geometry","abbr":"","aliases":["本质矩阵","基础矩阵","Essential Matrix","Fundamental Matrix","极线约束"],"one_liner":"两台相机看同一场景时，对应点必须落在特定直线上的几何关系。","explanation":"对极几何描述两个视角之间的几何约束。空间点 X 与两个相机光心构成一个平面（对极平面），它与两张图像平面的交线叫极线；一个相机的光心在另一张图上的投影叫极点。核心结论是：左图某点的对应点一定落在右图的一条极线上，所以找匹配点只需沿这条线搜索，从二维搜索降为一维。数学上用 3×3 的基础矩阵 F 表达，对应点 x、x′ 满足 x′ᵀFx = 0；已知两相机内参 K、K′ 时可写成本质矩阵 E = K′ᵀFK，E 编码两相机间的旋转和只知方向、不知长度的平移，由 Longuet-Higgins 1981 年引入计算机视觉。通常用八点法等算法配合 RANSAC 从匹配点估计 F 或 E，再分解出相对位姿。它是双目校正、立体匹配、三角化、运动恢复结构和视觉 SLAM 初始化的基础。","example":"双目相机的立体校正，就是把两张图变换到极线全部水平且同行对齐的状态，这样立体匹配只需在同一行里左右搜索即可求出视差。","related":["三角化","立体匹配","单应性矩阵","相机标定","运动恢复结构","随机采样一致性"]},{"id":"homography","category":"perception","sec":6,"tier":3,"sources":[{"title":"Wikipedia: Homography (computer vision)","url":"https://en.wikipedia.org/wiki/Homography_(computer_vision)"},{"title":"Zhang: A Flexible New Technique for Camera Calibration（IEEE TPAMI 2000）","url":"https://www.microsoft.com/en-us/research/publication/a-flexible-new-technique-for-camera-calibration/"}],"as_of":"","related_ids":["pinhole-camera-model","camera-calibration","epipolar-geometry","feature-matching","random-sample-consensus","birds-eye-view"],"name":"单应性矩阵","alt":"Homography","abbr":"","aliases":["单应矩阵","H 矩阵","单应变换","Homography Matrix"],"one_liner":"描述同一平面在两张图像之间像素对应关系的 3×3 矩阵。","explanation":"单应性矩阵 H 是一个 3×3 矩阵，整体缩放不改变映射，所以只有 8 个自由度。在针孔相机模型下，同一个平面被两个视角拍到时，两张图的对应像素满足 x' ∝ Hx（x 用齐次坐标表示）；相机只绕光心旋转、不平移时，任意场景的两张图也满足单应关系。求 H 至少需要 4 对对应点，常用直接线性变换（DLT）求解，再用 RANSAC 剔除误匹配。它用于图像拼接、透视校正、把地面或桌面图像变成俯视图，也用于相机标定：张正友标定法先求棋盘格平面到每张图像的单应，再从中分解出相机内参。拍一般三维场景且相机有平移时，就要改用对极几何中的基础矩阵或本质矩阵。","example":"桌面操作实验里，在桌面四角贴标记并量出它们在桌面上的坐标，就能求出图像到桌面平面的单应，把检测到的物体像素位置直接换算成桌面上的 x、y 坐标。","related":["针孔相机模型","相机标定","对极几何","特征匹配","随机采样一致性","鸟瞰图"]},{"id":"triangulation","category":"perception","sec":6,"tier":3,"sources":[{"title":"Triangulation (computer vision) - Wikipedia","url":"https://en.wikipedia.org/wiki/Triangulation_(computer_vision)"}],"as_of":"","related_ids":["epipolar-geometry","camera-intrinsics","camera-extrinsics","stereo-camera","structure-from-motion","reprojection-error"],"name":"三角化","alt":"Triangulation","abbr":"","aliases":["三角测量"],"one_liner":"已知两台相机的位置和同一点在两张图上的像，反算出该点的三维坐标。","explanation":"计算机视觉里的基本几何操作：一个三维点在两张或多张图像上各有一个投影，已知每台相机的投影矩阵（由内参和外参决定），从每个相机光心穿过对应像点连一条射线，射线的交点就是这个点的三维位置。实际中由于镜头畸变、特征点定位误差，射线往往不会严格相交，所以要用中点法、线性求解（DLT）或最小化重投影误差（把三维点投回图像后与观测点的偏差）来求最优解。双目测深、运动恢复结构（SfM）、视觉 SLAM 建图都靠它把二维匹配点变成三维点。","example":"双目相机在左右两张图中匹配到同一个杯口角点，已知两镜头的内参和相对位姿，三角化即可算出这个角点离相机多远。","related":["对极几何","相机内参","相机外参","双目相机","运动恢复结构","重投影误差"]},{"id":"bundle-adjustment","category":"perception","sec":6,"tier":3,"sources":[{"title":"Bundle adjustment - Wikipedia","url":"https://en.wikipedia.org/wiki/Bundle_adjustment"}],"as_of":"","related_ids":["structure-from-motion","reprojection-error","simultaneous-localization-and-mapping","slam-front-end-back-end","factor-graph-optimization","ceres-solver"],"name":"光束法平差","alt":"Bundle Adjustment","abbr":"BA","aliases":["捆绑调整","束调整","集束调整"],"one_liner":"同时微调所有相机位姿和三维点坐标，让重投影误差最小的优化步骤。","explanation":"光束法平差源自 20 世纪 50 年代的摄影测量，「光束」指从各个三维点射向相机光心的光线束。给定多张图像中匹配好的特征点，它把所有相机的位姿（有时连内参和畸变）以及所有三维点坐标一起当未知量，最小化重投影误差，也就是三维点按当前参数投影回图像后与实际观测位置之间距离的平方和；图像噪声为零均值高斯时，这等价于最大似然估计。通常用 Levenberg–Marquardt 等非线性最小二乘方法求解，并利用问题的稀疏结构加速。它是运动恢复结构（SfM）和视觉 SLAM 后端的核心步骤，COLMAP 重建、ORB-SLAM 的局部与全局优化都在做 BA，常用求解库有 Ceres、g2o、GTSAM。","example":"用手机绕桌子拍几十张照片，SfM 先粗估每张照片的相机位姿并三角化出稀疏点云，再跑一次 BA 统一微调，重投影误差下降，点云和相机轨迹都更准。","related":["运动恢复结构","重投影误差","同步定位与建图","SLAM 前端 / 后端","因子图优化","Ceres Solver"]},{"id":"structure-from-motion","category":"perception","sec":6,"tier":3,"sources":[{"title":"Structure-from-Motion Revisited (Schönberger & Frahm, CVPR 2016)","url":"https://openaccess.thecvf.com/content_cvpr_2016/html/Schonberger_Structure-From-Motion_Revisited_CVPR_2016_paper.html"},{"title":"COLMAP 官方文档","url":"https://colmap.github.io/"}],"as_of":"","related_ids":["bundle-adjustment","feature-matching","triangulation","colmap","multi-view-stereo","feed-forward-3d-reconstruction"],"name":"运动恢复结构","alt":"Structure from Motion","abbr":"SfM","aliases":["从运动恢复结构"],"one_liner":"从一堆不同角度拍的照片里，同时算出相机位姿和场景三维点。","explanation":"运动恢复结构是经典的三维重建方法：输入同一场景从多个视角拍的照片（可以是无序的），输出每张照片的相机位姿（位置和朝向）和一个稀疏三维点云。标准流程是先提取特征点并做跨图匹配，再用对极几何剔除错误匹配，然后逐张加入图像、三角化出三维点，最后用光束法平差（同时微调所有位姿和三维点，让重投影误差最小）整体优化。它和 SLAM 的区别是通常离线运行、不要求图像按时间顺序。开源工具 COLMAP 是最常用的实现；做 NeRF、3D 高斯泼溅或真实场景搬进仿真（Real-to-Sim）时，第一步往往就是用 SfM 算相机位姿。近年 DUSt3R、VGGT 等前馈模型尝试一次性直接输出位姿和几何。","example":"用手机绕桌上的杯子拍 50 张照片，丢进 COLMAP，得到每张照片的相机位姿和杯子的稀疏点云，再拿去训练 3D 高斯泼溅。","related":["光束法平差","特征匹配","三角化","COLMAP","多视图立体","前馈式三维重建"]},{"id":"multi-view-stereo","category":"perception","sec":6,"tier":3,"sources":[{"title":"COLMAP Tutorial","url":"https://colmap.github.io/tutorial.html"},{"title":"MVSNet: Depth Inference for Unstructured Multi-view Stereo (arXiv)","url":"https://arxiv.org/abs/1804.02505"}],"as_of":"","related_ids":["structure-from-motion","colmap","triangulation","bundle-adjustment","neural-radiance-fields","3d-gaussian-splatting"],"name":"多视图立体","alt":"Multi-View Stereo","abbr":"MVS","aliases":["多视角立体重建","多视图立体重建"],"one_liner":"用多张已知位姿的照片恢复场景稠密三维结构的方法。","explanation":"多视图立体是经典三维重建技术：已知每张照片的相机内外参（通常由运动恢复结构 SfM 先求出），在多张图之间找同一点的对应，再通过三角化算出深度，得到稠密深度图或点云，进一步可生成网格。SfM 只给出稀疏特征点，MVS 负责把它补成稠密模型。代表工具有 COLMAP；2018 年起 MVSNet 等深度学习方法用神经网络直接回归深度。它是数字孪生、仿真资产扫描和新视角合成的基础步骤之一。","example":"用 COLMAP 先对一组环绕物体拍的照片做 SfM 求相机位姿，再跑 MVS 得到稠密点云。","related":["运动恢复结构","COLMAP","三角化","光束法平差","神经辐射场","3D高斯泼溅"]},{"id":"feed-forward-3d-reconstruction","category":"perception","sec":6,"tier":3,"sources":[{"title":"DUSt3R: Geometric 3D Vision Made Easy","url":"https://arxiv.org/abs/2312.14132"},{"title":"VGGT: Visual Geometry Grounded Transformer","url":"https://arxiv.org/abs/2503.11651"},{"title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","url":"https://arxiv.org/abs/2509.13414"}],"as_of":"2025-09","related_ids":["dust3r","vggt","pi3","mapanything","pointmap","structure-from-motion"],"name":"前馈式三维重建","alt":"Feed-Forward 3D Reconstruction","abbr":"","aliases":["前馈重建","3D 重建基础模型","前馈式 3D 重建","Feed-forward Reconstruction"],"one_liner":"一次网络前向计算就从图像直接输出相机参数、深度和点云的三维重建方法。","explanation":"传统三维重建走运动恢复结构（SfM）加多视图立体（MVS）的流程：先匹配特征点、估计相机位姿，再用光束法平差反复迭代优化，步骤多、耗时长，纹理少或视角少时容易失败。前馈式三维重建用在大规模三维数据上训练的大网络（多为 Transformer），输入一张或多张图像，一次前向计算就直接输出点图（每个像素对应的三维坐标）、深度、相机内外参等。代表工作有 Naver 的 DUSt3R（CVPR 2024，不需要事先标定相机）、Meta 与牛津大学的 VGGT（CVPR 2025 最佳论文）、π³ 和 MapAnything。对机器人来说，它能从普通 RGB 图像快速得到场景几何，可用于建图、位姿估计，或给策略提供三维输入。","example":"VGGT 输入同一场景的一张到几百张照片，据论文可在一秒内直接预测出相机参数、深度图、点图和三维点轨迹，不再依赖光束法平差等后处理优化。","related":["DUSt3R","VGGT","π³（Pi3）","MapAnything","点图","运动恢复结构"]},{"id":"pointmap","category":"perception","sec":6,"tier":3,"sources":[{"title":"DUSt3R: Geometric 3D Vision Made Easy (arXiv 2312.14132)","url":"https://arxiv.org/abs/2312.14132"}],"as_of":"","related_ids":["feed-forward-3d-reconstruction","dust3r","vggt","depth-map","point-cloud","camera-intrinsics"],"name":"点图","alt":"Pointmap","abbr":"","aliases":["Point Map","逐像素 3D 点图"],"one_liner":"和图像同尺寸的数组，每个像素存的是一个 3D 坐标而不是颜色。","explanation":"点图把图像每个像素对应的 3D 点坐标 (x, y, z) 排成 H×W×3 的数组，像素和 3D 点一一对应。2023 年 Naver Labs Europe 等提出的 DUSt3R 把它作为核心输出：输入两张图，网络直接回归两张点图，并统一表达在第一张图的相机坐标系里，因此不需要事先知道相机内参（焦距等）和相机位姿。和深度图相比，点图同时隐含了深度、相机参数和两图之间的像素对应，可以从中反推出焦距、相对位姿和匹配点。之后的 MASt3R、VGGT、π³ 等前馈式三维重建模型都沿用或兼容这种表示，机器人可以借此从普通 RGB 图像快速得到场景的 3D 结构。","example":"两张手机拍的桌面照片送入 DUSt3R，得到两张点图，合起来就是桌面场景的稠密点云。","related":["前馈式三维重建","DUSt3R","VGGT","深度图","点云","相机内参"]},{"id":"dust3r","category":"perception","sec":6,"tier":3,"sources":[{"title":"arXiv 2312.14132: DUSt3R: Geometric 3D Vision Made Easy","url":"https://arxiv.org/abs/2312.14132"},{"title":"naver/dust3r (GitHub)","url":"https://github.com/naver/dust3r"}],"as_of":"2024-06","related_ids":["pointmap","mast3r","vggt","feed-forward-3d-reconstruction","structure-from-motion","multi-view-stereo"],"name":"DUSt3R","alt":"DUSt3R: Geometric 3D Vision Made Easy","abbr":"","aliases":["Dense and Unconstrained Stereo 3D Reconstruction"],"one_liner":"无需相机参数，直接从两张图回归逐像素三维点图的前馈式重建模型。","explanation":"DUSt3R 是 Naver Labs Europe 与阿尔托大学的 Shuzhe Wang 等人提出的三维重建模型，发表于 CVPR 2024。传统流程（运动恢复结构 SfM 加多视图立体 MVS）要先估计相机内外参，再三角化匹配点，步骤多且容易失败。DUSt3R 反过来：把两张图送进 Transformer 编码器-解码器，直接为每个像素回归一个三维坐标，称为点图（pointmap），两张图的点都表示在第一张图的相机坐标系里，并附带置信度；深度、像素匹配、相对位姿和焦距都能从点图里读出。多于两张图时，再用全局对齐把各对结果统一到同一坐标系。它是「前馈式三维重建」的代表工作，后续的 MASt3R、VGGT、π³ 等都在这条路线上。代码采用 CC BY-NC-SA 4.0 非商用许可。","example":"用手机随手拍两张桌面照片、不做相机标定，DUSt3R 就能输出两张图对应的三维点云和两台相机的相对位姿，可用来快速重建机器人工作台。","related":["点图","MASt3R","VGGT","前馈式三维重建","运动恢复结构","多视图立体"]},{"id":"mast3r","category":"perception","sec":6,"tier":3,"sources":[{"title":"arXiv: Grounding Image Matching in 3D with MASt3R","url":"https://arxiv.org/abs/2406.09756"},{"title":"GitHub: naver/mast3r","url":"https://github.com/naver/mast3r"}],"as_of":"","related_ids":["dust3r","mast3r-slam","feature-matching","pointmap","feed-forward-3d-reconstruction","vggt"],"name":"MASt3R","alt":"MASt3R: Grounding Image Matching in 3D","abbr":"","aliases":["Grounding Image Matching in 3D with MASt3R"],"one_liner":"Naver 在 DUSt3R 上加匹配头的模型，同时输出三维点图和稠密匹配特征。","explanation":"MASt3R 由 Naver 的 Vincent Leroy、Yohann Cabon、Jérôme Revaud 于 2024 年提出，发表于 ECCV 2024。它的出发点是：图像匹配（找两张图里对应同一物理点的像素）本质上是三维问题，和相机位姿、场景几何紧密相关。它以 DUSt3R 为底座——DUSt3R 输入两张图，直接回归每个像素的三维坐标（点图），对大视角变化很鲁棒但匹配精度有限——再加一个输出稠密局部特征的新头，用额外的匹配损失训练，并配一套快速互为最近邻匹配算法，把匹配速度提高了几个数量级。它在多个匹配基准上大幅领先，在 Map-free 定位数据集上 VCRE AUC 绝对提升 30%。MASt3R-SfM、MASt3R-SLAM 都以它为核心。代码采用 CC BY-NC-SA 4.0 协议，仅限非商业使用。","example":"给机器人两张视角相差很大的桌面照片，MASt3R 能直接给出两图之间的像素对应和各自的三维点图，据此可以算出两个视角的相对位姿。","related":["DUSt3R","MASt3R-SLAM","特征匹配","点图","前馈式三维重建","VGGT"]},{"id":"vggt","category":"perception","sec":6,"tier":3,"sources":[{"title":"VGGT: Visual Geometry Grounded Transformer (arXiv)","url":"https://arxiv.org/abs/2503.11651"},{"title":"facebookresearch/vggt (GitHub)","url":"https://github.com/facebookresearch/vggt"}],"as_of":"2025-07","related_ids":["feed-forward-3d-reconstruction","dust3r","pi3","structure-from-motion","pointmap","bundle-adjustment"],"name":"VGGT","alt":"VGGT: Visual Geometry Grounded Transformer","abbr":"VGGT","aliases":["VGGT-1B"],"one_liner":"一次前向就从多张图算出相机参数、深度和点云的三维视觉模型","explanation":"VGGT 是牛津大学视觉几何组（VGG）和 Meta AI 提出的前馈式三维重建模型，约 10 亿参数，获 CVPR 2025 最佳论文。输入一张、几张到上百张图，它一次前向推理就输出每张图的相机参数、深度图、点图（每个像素对应的 3D 坐标）和 3D 点跟踪，通常不到一秒，不需要再做光束法平差（传统重建里反复优化相机和三维点的步骤）。过去要靠 COLMAP 等多阶段流程完成的重建，被压成一个网络。具身智能里常用它从多视角图像快速拿到场景几何。原始权重仅限非商用，2025 年 7 月另发了可商用权重并开放训练代码。","example":"用手机围着桌面拍 20 张照片输入 VGGT，约一秒得到每张照片的相机位姿和整张桌面的稠密点云。","related":["前馈式三维重建","DUSt3R","π³（Pi3）","运动恢复结构","点图","光束法平差"]},{"id":"pi3","category":"perception","sec":6,"tier":3,"sources":[{"title":"π³: Permutation-Equivariant Visual Geometry Learning (arXiv)","url":"https://arxiv.org/abs/2507.13347"},{"title":"yyfz/Pi3 (GitHub)","url":"https://github.com/yyfz/Pi3"}],"as_of":"2025-12","related_ids":["vggt","dust3r","feed-forward-3d-reconstruction","pointmap","camera-extrinsics","shanghai-artificial-intelligence-laboratory"],"name":"π³（Pi3）","alt":"π³: Permutation-Equivariant Visual Geometry Learning","abbr":"","aliases":["Pi3","Pi3X"],"one_liner":"不设参考视角、不受输入顺序影响的前馈式三维重建模型","explanation":"π³ 是上海人工智能实验室、浙江大学等机构 2025 年 7 月发布的前馈式三维重建模型，仓库标注为 ICLR 2026。此前的 DUSt3R、VGGT 等方法要指定一张图作参考视角，所有结果都放在它的坐标系下，参考图选得不好重建就会变差。π³ 改用完全置换等变的结构（打乱输入顺序，输出只跟着换顺序、内容不变），不需要参考帧，为每张图直接预测仿射不变的相机位姿和尺度不变的局部点图。论文报告在相机位姿估计、单目与视频深度估计、稠密点图重建上达到当时最好水平。2025 年 12 月发布升级版 Pi3X，可输入已知位姿、内参或深度，并给出近似真实尺度。代码为 BSD 协议，权重仅限非商用。","example":"把同一组 10 张室内照片按不同顺序输入 π³，得到的点云和相对相机位姿基本一致；以首帧为参考的方法，结果会随首帧的选择而变化。","related":["VGGT","DUSt3R","前馈式三维重建","点图","相机外参","上海人工智能实验室"]},{"id":"cut3r","category":"perception","sec":6,"tier":3,"sources":[{"title":"Continuous 3D Perception Model with Persistent State (arXiv 2501.12387)","url":"https://arxiv.org/abs/2501.12387"},{"title":"CUT3R project page","url":"https://cut3r.github.io/"}],"as_of":"2025-06","related_ids":["dust3r","pointmap","feed-forward-3d-reconstruction","4d-reconstruction","vggt","mast3r-slam"],"name":"CUT3R","alt":"CUT3R: Continuous 3D Perception Model with Persistent State","abbr":"","aliases":["Continuous Updating Transformer for 3D Reconstruction"],"one_liner":"带持续记忆状态的 3D 重建模型，逐帧读图、在线更新整个场景。","explanation":"CUT3R 全称 Continuous Updating Transformer for 3D Reconstruction，由 UC Berkeley 和 Google DeepMind 的研究者提出，是 CVPR 2025 口头报告论文。它沿用 DUSt3R 一类「直接从图像回归点图」（每个像素对应一个 3D 点）的思路，但多了一个持续更新的状态：每进来一张图，模型先用它更新状态，再输出这张图在统一坐标系下、带真实尺度的点图，重建随输入增多逐步完善，不需要针对每段视频做优化。它既能处理视频流，也能处理无序照片，支持有运动物体的动态场景，还能在没拍到的虚拟视角上推测看不见的区域。","example":"把机器人头部相机拍的视频逐帧喂给 CUT3R，每来一帧就得到一张对齐到同一坐标系的点图，累积起来就是一份不断变完整的房间点云。","related":["DUSt3R","点图","前馈式三维重建","4D重建","VGGT","MASt3R-SLAM"]},{"id":"mapanything","category":"perception","sec":6,"tier":3,"sources":[{"title":"arXiv: MapAnything: Universal Feed-Forward Metric 3D Reconstruction","url":"https://arxiv.org/abs/2509.13414"},{"title":"MapAnything 项目主页","url":"https://map-anything.github.io/"}],"as_of":"2026-01","related_ids":["feed-forward-3d-reconstruction","dust3r","vggt","mast3r","structure-from-motion","metric-depth-relative-depth"],"name":"MapAnything","alt":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","abbr":"","aliases":["Map Anything"],"one_liner":"Meta 与 CMU 的通用前馈三维重建模型，直接输出带真实尺度的场景结构。","explanation":"MapAnything 由 Meta Reality Labs 与卡内基梅隆大学在 2025 年 9 月发布，是基于 Transformer 的前馈式三维重建模型：输入一张或多张图片，还可按需附上相机内参、位姿、深度或部分重建结果，一次前向计算就输出每张图的深度图、局部射线图、相机位姿和统一的度量尺度因子，合起来就是带米制尺度的三维场景。过去未标定运动恢复结构、多视图立体、单目深度估计、相机定位、深度补全等任务各用一套算法，它用一个模型全部覆盖。它与 DUSt3R、VGGT 属于同一条前馈重建路线，代码和权重已开源（含 Apache 协议版本）。对机器人来说，可以从几张照片快速得到能直接用于规划的米制点云。","example":"用手机围着桌面拍几张照片、不给任何相机参数，MapAnything 就能输出带米制尺度的点云和每张照片的相机位姿；如果已知相机内参，也可以一并输入作为约束。","related":["前馈式三维重建","DUSt3R","VGGT","MASt3R","运动恢复结构","度量深度 / 相对深度"]},{"id":"depth-anything-3","category":"perception","sec":6,"tier":3,"sources":[{"title":"Depth Anything 3: Recovering the Visual Space from Any Views (arXiv 2511.10647)","url":"https://arxiv.org/abs/2511.10647"},{"title":"ByteDance-Seed/Depth-Anything-3 (GitHub)","url":"https://github.com/ByteDance-Seed/Depth-Anything-3"}],"as_of":"2025-12","related_ids":["depth-anything","vggt","feed-forward-3d-reconstruction","monocular-depth-estimation","3d-gaussian-splatting","dinov2"],"name":"Depth Anything 3","alt":"Depth Anything 3: Recovering the Visual Space from Any Views","abbr":"DA3","aliases":["DA3"],"one_liner":"字节 Seed 的几何模型，从任意张图恢复深度和相机位姿，位姿可给可不给。","explanation":"Depth Anything 3 由字节跳动 Seed 团队于 2025 年 11 月发布，是 Depth Anything 系列第三代。前两代只做单张图的深度估计，DA3 扩展到任意数量的输入图像，相机位姿已知或未知都行，输出空间上一致的深度和相机参数，并可进一步得到点云或 3D 高斯。设计上很简洁：骨干就是一个普通 Transformer（原版 DINO 编码器），训练目标统一成「深度 + 光线」预测。论文在自建的视觉几何基准上报告，相机位姿精度平均比此前最好的 VGGT 高 44.3%，几何精度高 25.1%。模型从 Small（0.08B）到 Giant（1.15B）有多个尺寸，另有度量深度和单目专用版本。","example":"手机绕着桌子拍 5 张照片、不提供任何相机参数，DA3 一次前向就给出每张图的深度和相机位姿，融合成一份桌面点云。","related":["Depth Anything","VGGT","前馈式三维重建","单目深度估计","3D高斯泼溅","DINOv2"]},{"id":"voxel","category":"perception","sec":7,"tier":2,"sources":[{"title":"Wikipedia: Voxel","url":"https://en.wikipedia.org/wiki/Voxel"},{"title":"Open3D Tutorial: Point cloud (Voxel downsampling)","url":"https://www.open3d.org/docs/release/tutorial/geometry/pointcloud.html"},{"title":"PerAct: Perceiver-Actor project page","url":"https://peract.github.io/"}],"as_of":"","related_ids":["point-cloud","occupancy-grid-map","octomap","truncated-signed-distance-function","point-cloud-filtering-and-voxel-downsampling","peract"],"name":"体素","alt":"Voxel","abbr":"","aliases":["体素网格","Voxel Grid","体素下采样","体积像素"],"one_liner":"三维空间里的小立方格，相当于立体版的像素。","explanation":"体素（voxel，由 volume 和 pixel 合成）是把三维空间切成规则网格后的一个小立方格，每格可以存是否被占据、颜色、到表面的距离或一个特征向量，就像二维图片里的像素。和点云（一堆散乱的三维点）相比，体素排列规整，能直接用 3D 卷积处理，也方便查询某处有没有障碍；代价是分辨率一高内存涨得很快，格子边长减半，格数变 8 倍。机器人里常见用法有：占据栅格地图和八叉树地图用体素标记哪里能走；截断符号距离函数（TSDF）在体素里存距离值来做三维重建；点云体素降采样把同一格里的点合并成一个均值点。操作策略 PerAct 把工作空间切成 100×100×100 的体素，直接预测夹爪下一步去哪个格子。","example":"Open3D 里一行 pcd.voxel_down_sample(voxel_size=0.05) 就能把稠密点云按每 5 厘米一格（坐标单位为米时）降采样，点数大幅减少，再送去做配准或抓取检测。","related":["点云","占据栅格地图","八叉树地图","截断符号距离函数","点云滤波与降采样（体素降采样 / 离群点去除）","PerAct"]},{"id":"point-cloud-filtering-and-voxel-downsampling","category":"perception","sec":7,"tier":2,"sources":[{"title":"Open3D: Point cloud outlier removal","url":"https://www.open3d.org/docs/release/tutorial/geometry/pointcloud_outlier_removal.html"},{"title":"PCL Tutorial: Downsampling a PointCloud using a VoxelGrid filter","url":"https://pcl.readthedocs.io/projects/tutorials/en/latest/voxel_grid.html"},{"title":"3D Diffusion Policy (arXiv 2403.03954)","url":"https://arxiv.org/html/2403.03954"}],"as_of":"","related_ids":["point-cloud","voxel","farthest-point-sampling","point-cloud-registration","flying-pixels","3d-diffusion-policy"],"name":"点云滤波与降采样（体素降采样 / 离群点去除）","alt":"Point Cloud Filtering & Voxel Downsampling","abbr":"","aliases":["体素降采样","体素滤波","离群点去除","Voxel Grid Filter","Outlier Removal"],"one_liner":"给原始点云裁掉无关区域、去掉噪点、减少点数的预处理步骤。","explanation":"深度相机或激光雷达直接给出的点云往往有几十万个点，夹杂测量误差造成的零星离群点，还混着桌面、地面等无关区域，直接送进后续算法既慢又不稳，所以先做预处理。常见做法：按包围盒裁剪，只保留工作区域；体素降采样，把空间划分成固定边长的小立方体（体素），每个体素内的点合并为一个点（PCL 取质心，Open3D 同时平均颜色和法向），点数大降且密度更均匀；离群点去除，统计法删掉「到 k 个邻居的平均距离」偏离全局均值过多的点，半径法删掉给定半径内邻居太少的点。PCL、Open3D 都有现成函数。","example":"PCL 教程用 1 厘米体素对一帧扫描降采样，点数从 460,400 降到 41,049；3D 扩散策略（DP3）则先按包围盒裁掉桌面和背景点，再用最远点采样只保留 512 或 1024 个点。","related":["点云","体素","最远点采样","点云配准","飞点","3D 扩散策略"]},{"id":"farthest-point-sampling","category":"perception","sec":7,"tier":3,"sources":[{"title":"PointNet++: Deep Hierarchical Feature Learning on Point Sets in a Metric Space","url":"https://arxiv.org/abs/1706.02413"},{"title":"3D Diffusion Policy (DP3)","url":"https://arxiv.org/html/2403.03954"}],"as_of":"","related_ids":["point-cloud","pointnet-pointnet-plus-plus","point-cloud-filtering-and-voxel-downsampling","3d-diffusion-policy","point-cloud-encoder","depth-camera"],"name":"最远点采样","alt":"Farthest Point Sampling","abbr":"FPS","aliases":["最远点下采样","Furthest Point Sampling"],"one_liner":"每次挑离已选点最远的点，把点云均匀降到固定点数的下采样方法。","explanation":"最远点采样是一种点云下采样算法：先选一个起点，然后反复从剩余点里挑出「到已选点集合的最近距离最大」的那个点，直到选够设定的数量。和随机采样相比，同样的点数能更均匀地覆盖整个物体或场景，不容易丢掉稀疏区域的结构；缺点是需要逐点迭代，点很多时比随机采样和体素降采样慢，而且结果取决于起始点。PointNet++（NeurIPS 2017）用它为每一层挑选局部区域的中心点，之后大量点云网络沿用了这一做法。机器人策略用点云作输入时，通常先裁掉桌面和背景，再用最远点采样降到几百到几千个点，以控制计算量。","example":"3D 扩散策略 DP3（RSS 2024）先裁剪深度相机生成的点云，再用最远点采样降到 512 或 1024 个点，作者称这个数量对仿真和真机任务都够用。","related":["点云","PointNet","点云滤波与降采样（体素降采样 / 离群点去除）","3D 扩散策略","点云编码器","深度相机"]},{"id":"surface-normal-estimation","category":"perception","sec":7,"tier":3,"sources":[{"title":"PCL Tutorial: Estimating Surface Normals in a PointCloud","url":"https://pcl.readthedocs.io/projects/tutorials/en/latest/normal_estimation.html"},{"title":"Open3D Point Cloud Tutorial (Vertex normal estimation)","url":"https://www.open3d.org/docs/release/tutorial/geometry/pointcloud.html"}],"as_of":"","related_ids":["point-cloud","point-cloud-registration","fast-point-feature-histograms","grasp-pose-detection","vacuum-suction-cup","point-cloud-library"],"name":"法向量估计","alt":"Surface Normal Estimation","abbr":"","aliases":["点云法向量","表面法向","法线估计"],"one_liner":"算出物体表面每一点朝哪个方向，也就是垂直于表面的那根向量。","explanation":"法向量是垂直于物体表面某一点的单位向量，表示这块表面朝哪边。点云本身只有一堆坐标，没有「表面」的概念，所以要估计：最常见的做法是取每个点附近的 k 个邻居，做主成分分析（PCA），方差最小的那个方向就是法向；因为正反方向无法区分，还要统一朝向相机或朝外。也有用神经网络直接从单张 RGB 图预测每个像素法向的方法。机器人里它用得很多：吸盘抓取要让吸盘垂直贴住表面，二指抓取常沿法向接近物体；点到平面的 ICP 配准、FPFH 点云特征、泊松表面重建也都依赖法向。点云噪声大、邻域取得不合适时，法向会明显抖动。","example":"Open3D 里对点云调用 estimate_normals，再用 orient_normals_towards_camera_location 统一朝向，就能给吸盘抓取算出每个候选点的接近方向。","related":["点云","点云配准","FPFH 点云特征","抓取位姿检测","真空吸盘","点云库"]},{"id":"fast-point-feature-histograms","category":"perception","sec":7,"tier":3,"sources":[{"title":"PCL Tutorials: Fast Point Feature Histograms (FPFH) descriptors","url":"https://pcl.readthedocs.io/projects/tutorials/en/latest/fpfh_estimation.html"},{"title":"Open3D: Global registration","url":"https://www.open3d.org/docs/release/tutorial/pipelines/global_registration.html"}],"as_of":"","related_ids":["point-cloud-registration","surface-normal-estimation","iterative-closest-point","random-sample-consensus","point-cloud-library","open3d"],"name":"FPFH 点云特征","alt":"Fast Point Feature Histograms","abbr":"FPFH","aliases":["快速点特征直方图","FPFH 描述子"],"one_liner":"用邻域内法向量几何关系的统计直方图，描述每个点局部形状的手工特征。","explanation":"FPFH 由 Radu Rusu、Nico Blodow 和 Michael Beetz 在 ICRA 2009 提出，是 PFH（点特征直方图）的加速版。做法是先为每个点估计法向量，再计算它与邻域点之间的几个角度关系，统计成直方图作为描述子。PFH 要计算邻域内所有点对，复杂度 O(nk²)；FPFH 只算中心点与各邻居的关系，再按距离加权合并邻居的结果，复杂度降到 O(nk)，区分能力损失不大。PCL 和 Open3D 的默认实现都是 33 维。它不需要训练，最典型的用途是全局点云配准：先用 FPFH 在两片点云间找对应点，再用 RANSAC 求粗略位姿，最后交给 ICP 精配准。","example":"Open3D 的全局配准教程先对两片点云做体素降采样和法向量估计，计算 33 维 FPFH 后用 RANSAC 求初始位姿，再用 ICP 细化。","related":["点云配准","法向量估计","迭代最近点","随机采样一致性","点云库","Open3D"]},{"id":"point-cloud-registration","category":"perception","sec":7,"tier":2,"sources":[{"title":"Wikipedia: Point-set registration","url":"https://en.wikipedia.org/wiki/Point-set_registration"},{"title":"Open3D: ICP registration","url":"https://www.open3d.org/docs/release/tutorial/pipelines/icp_registration.html"}],"as_of":"","related_ids":["iterative-closest-point","fast-point-feature-histograms","random-sample-consensus","normal-distributions-transform","6d-object-pose-estimation","simultaneous-localization-and-mapping"],"name":"点云配准","alt":"Point Cloud Registration","abbr":"","aliases":["点云对齐","扫描匹配","Scan Matching","Point Set Registration"],"one_liner":"求一个旋转加平移，把两份点云对齐到同一个坐标系里。","explanation":"点云配准是求一个空间变换，把源点云对齐到目标点云上；刚性配准只含旋转和平移，非刚性配准还允许形变。从不同视角或不同时刻扫描同一场景，各帧坐标系不同，要拼出完整模型、在激光里程计中估计机器人移动了多少（此时常叫扫描匹配），或把物体模型对到观测点云上求位姿，都要做配准。常见流程分两步：先用 FPFH 等局部特征找对应点、配合 RANSAC 剔除错配做全局粗配准；再用迭代最近点（ICP）精配准，它反复「找最近点、解最优变换」，但依赖较好的初值，否则会陷入局部最优。Open3D 的 ICP 会同时给出重叠比例 fitness 和内点均方根误差，用来判断结果好坏。","example":"腕部相机从两个角度拍同一个杯子，先用 FPFH + RANSAC 把两帧点云粗对齐，再跑 ICP 精修，拼出更完整的杯子形状。","related":["迭代最近点","FPFH 点云特征","随机采样一致性","NDT 配准（正态分布变换）","6D位姿估计","同步定位与建图"]},{"id":"iterative-closest-point","category":"perception","sec":7,"tier":3,"sources":[{"title":"Wikipedia: Iterative closest point","url":"https://en.wikipedia.org/wiki/Iterative_closest_point"},{"title":"Open3D Tutorial: ICP registration","url":"https://www.open3d.org/docs/release/tutorial/pipelines/icp_registration.html"}],"as_of":"","related_ids":["point-cloud-registration","point-cloud","fast-point-feature-histograms","normal-distributions-transform","6d-object-pose-estimation","loam"],"name":"迭代最近点","alt":"Iterative Closest Point","abbr":"ICP","aliases":["ICP 配准","ICP 算法","点到点 ICP","点到面 ICP"],"one_liner":"反复找最近点对、求旋转和平移，把两片点云对齐的经典配准算法。","explanation":"迭代最近点是点云配准（把两片点云对齐到同一坐标系）的经典算法，由 Chen 与 Medioni（1991）和 Besl 与 McKay（1992）分别独立提出。它循环做四步：给源点云每个点在目标点云里找最近点作为对应；求一组让对应点距离平方和最小的旋转和平移；把源点云按它变换；重复直到误差不再下降。常用变体有点到点和利用法向量的点到面，后者通常收敛更快。ICP 只做局部精对齐，需要大致正确的初始位姿，否则容易陷入局部最优，所以常先做全局粗配准。它广泛用于激光里程计、多次扫描拼接和物体位姿精修，PCL、Open3D 都有现成实现。","example":"用 Open3D 精修物体位姿：先用 FPFH 特征加 RANSAC 做全局粗配准，把结果作为初值交给点到面 ICP，输出 4×4 变换矩阵，以及衡量重叠程度的 fitness 和对应点误差 inlier_rmse。","related":["点云配准","点云","FPFH 点云特征","NDT 配准（正态分布变换）","6D位姿估计","LOAM 系列激光里程计"]},{"id":"normal-distributions-transform","category":"perception","sec":7,"tier":3,"sources":[{"title":"How to use Normal Distributions Transform - PCL Tutorials","url":"https://pointclouds.org/documentation/tutorials/normal_distributions_transform.html"}],"as_of":"","related_ids":["point-cloud-registration","iterative-closest-point","lidar-slam","relocalization","point-cloud-library","lidar"],"name":"NDT 配准（正态分布变换）","alt":"Normal Distributions Transform","abbr":"NDT","aliases":["正态分布变换","NDT 点云配准"],"one_liner":"把点云划成格子、每格用正态分布描述，再据此对齐两帧点云。","explanation":"NDT 是一种点云配准方法，2003 年由 Biber 和 Straßer 提出用于二维激光扫描匹配，后来被扩展到三维。它把参考点云划分成体素网格，每个格子用均值和协方差表示成一个正态分布，然后优化当前点云的位姿，让变换后的点落在这些分布中的概率最大。相比迭代最近点（ICP）逐点找对应，NDT 不需要最近邻搜索，对初值和噪声更稳。常用于激光雷达在预建地图中的定位，点云库 PCL 和 Autoware 都有实现。","example":"自动驾驶车辆用 NDT 把当前激光雷达扫描和预先建好的点云地图配准，得到车在地图里的位置。","related":["点云配准","迭代最近点","激光SLAM","重定位","点云库","激光雷达"]},{"id":"chamfer-distance","category":"perception","sec":7,"tier":3,"sources":[{"title":"A Point Set Generation Network for 3D Object Reconstruction from a Single Image (arXiv 1612.00603)","url":"https://arxiv.org/abs/1612.00603"},{"title":"pytorch3d.loss.chamfer_distance 文档","url":"https://pytorch3d.readthedocs.io/en/latest/modules/loss.html"}],"as_of":"","related_ids":["point-cloud","point-cloud-completion-shape-completion","single-image-3d-reconstruction","loss-function","pointnet-pointnet-plus-plus","feed-forward-3d-reconstruction"],"name":"倒角距离","alt":"Chamfer Distance","abbr":"CD","aliases":["Chamfer 距离"],"one_liner":"两组点云互相找最近点并把距离平均，用来衡量两个形状有多接近。","explanation":"倒角距离衡量两个点集的相似程度：对点集 A 中每个点找 B 里最近的点，求距离（常用平方欧氏距离）的平均；再反过来对 B 做一遍，两项相加。它不要求两组点数相同，也不需要点与点一一对应，只用最近邻搜索，几乎处处可微，适合当损失函数。名字来自早期图像匹配中的 chamfer matching。Fan、Su、Guibas 在 CVPR 2017 的单图生成点云工作中，把它和推土机距离（EMD）一起作为点云生成的损失，此后它成为三维重建、点云补全和形状生成的标准损失与评测指标，PyTorch3D 等库直接提供实现。缺点是对点的分布密度不敏感，预测点可能扎堆，所以论文里常与 EMD、F-score 一起报告。","example":"点云补全网络输入只拍到半边的椅子点云，输出一组完整的椅子点；训练时用输出与真实完整点云之间的倒角距离作损失，距离越小说明补得越像。","related":["点云","点云补全 / 形状补全","单图生成3D","损失函数","PointNet","前馈式三维重建"]},{"id":"pointnet-pointnet-plus-plus","category":"perception","sec":7,"tier":2,"sources":[{"title":"PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation (arXiv 1612.00593)","url":"https://arxiv.org/abs/1612.00593"},{"title":"PointNet++: Deep Hierarchical Feature Learning on Point Sets in a Metric Space (arXiv 1706.02413)","url":"https://arxiv.org/abs/1706.02413"},{"title":"3D Diffusion Policy (arXiv 2403.03954)","url":"https://arxiv.org/html/2403.03954"}],"as_of":"","related_ids":["point-cloud","point-cloud-encoder","farthest-point-sampling","point-cloud-segmentation","point-transformer-v3","3d-diffusion-policy"],"name":"PointNet","alt":"PointNet / PointNet++","abbr":"","aliases":["PointNet++"],"one_liner":"直接处理无序点云做分类和分割的开创性网络，PointNet++ 是其分层升级版。","explanation":"PointNet 由斯坦福大学 Charles R. Qi、Leonidas Guibas 等人提出，发表于 CVPR 2017。此前点云多先转成体素或多视角图片再处理，损失细节。PointNet 对每个点用共享的多层感知机提取特征，再用最大池化汇总成全局特征；最大池化与输入顺序无关，所以点的顺序打乱结果不变（置换不变性），可直接做物体分类、部件分割和场景语义分割。不足是没有建模局部邻域。PointNet++（NeurIPS 2017）先用最远点采样选出中心点，在其邻域内递归套用 PointNet，逐层提取多尺度局部特征，并能适应点密度不均。两者至今仍是点云编码器的常用基线。","example":"3D 扩散策略（DP3）的点云编码器沿用「逐点 MLP + 最大池化」思路，只用三层 MLP；论文对比发现 PointNet、PointNet++ 等更复杂的编码器在其操作任务上都不如这个小编码器。","related":["点云","点云编码器","最远点采样","点云分割","Point Transformer V3","3D 扩散策略"]},{"id":"point-transformer-v3","category":"perception","sec":7,"tier":3,"sources":[{"title":"Point Transformer V3: Simpler, Faster, Stronger (arXiv 2312.10035)","url":"https://arxiv.org/abs/2312.10035"},{"title":"Pointcept/PointTransformerV3 (GitHub)","url":"https://github.com/Pointcept/PointTransformerV3"}],"as_of":"2024-06","related_ids":["point-cloud-encoder","point-cloud-segmentation","pointnet-pointnet-plus-plus","transformer","backbone-network","self-attention"],"name":"Point Transformer V3","alt":"Point Transformer V3: Simpler, Faster, Stronger","abbr":"PTv3","aliases":["PTv3"],"one_liner":"处理点云的 Transformer 骨干网络，靠「序列化」变得更快、看得更广。","explanation":"Point Transformer V3（PTv3）由吴小阳（Xiaoyang Wu）、赵恒爽等来自香港大学、上海人工智能实验室等机构的研究者提出，是 CVPR 2024 口头报告论文，代码集成在开源点云框架 Pointcept 中。以往点云 Transformer 要给每个点找近邻、算复杂的相对位置编码，又慢又占显存。PTv3 先用空间填充曲线把无序点排成一维序列（序列化），再在序列分块内做注意力。据论文，它比 PTv2 快约 3 倍、省约 10 倍显存，感受野从 16 个点扩到 1024 个点，在 20 多个室内外任务上取得当时最好结果。它常被用作点云编码器，自监督预训练模型 Sonata 也以它为骨干。","example":"把 RGB-D 相机得到的室内点云送入 PTv3，输出每个点的语义类别（墙、地面、椅子等）。","related":["点云编码器","点云分割","PointNet","Transformer","骨干网络","自注意力"]},{"id":"point-cloud-segmentation","category":"perception","sec":7,"tier":3,"sources":[{"title":"PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation (arXiv 1612.00593)","url":"https://arxiv.org/abs/1612.00593"},{"title":"Point Transformer V3: Simpler, Faster, Stronger (arXiv 2312.10035)","url":"https://arxiv.org/abs/2312.10035"}],"as_of":"","related_ids":["point-cloud","semantic-segmentation","instance-segmentation","pointnet-pointnet-plus-plus","point-transformer-v3","grasp-pose-detection"],"name":"点云分割","alt":"Point Cloud Segmentation","abbr":"","aliases":["3D 语义分割","3D 实例分割","点云语义分割"],"one_liner":"给点云里的每个点打标签，分出它属于哪类物体或哪一个物体。","explanation":"点云分割是 2D 图像分割在 3D 上的对应：语义分割给每个点一个类别（桌子、杯子、地面），实例分割进一步区分同类的不同个体（杯子 1、杯子 2），部件分割把一个物体拆成把手、盖子等部件。2017 年斯坦福的 PointNet 首次让神经网络直接处理无序点集来做分类和分割，之后出现了 PointNet++、Point Transformer 系列等骨干网络。常用基准有室内的 ScanNet、S3DIS 和室外的 SemanticKITTI。机械臂抓取前通常先把目标物体的点分出来，再做位姿估计或抓取检测；移动机器人则用它分出地面、障碍物和可通行区域。","example":"在桌面场景的点云中把「杯子」的点单独分出来，只把这部分送入抓取检测网络。","related":["点云","语义分割","实例分割","PointNet","Point Transformer V3","抓取位姿检测"]},{"id":"3d-object-detection","category":"perception","sec":7,"tier":3,"sources":[{"title":"KITTI 3D Object Detection Evaluation 2017","url":"https://www.cvlibs.net/datasets/kitti/eval_object.php?obj_benchmark=3d"},{"title":"Omni3D: A Large Benchmark and Model for 3D Object Detection in the Wild (arXiv 2207.10660)","url":"https://arxiv.org/abs/2207.10660"}],"as_of":"","related_ids":["object-detection","point-cloud","lidar","birds-eye-view","intersection-over-union","6d-object-pose-estimation"],"name":"3D目标检测","alt":"3D Object Detection","abbr":"","aliases":["三维目标检测","3D 包围框检测","3D Detection"],"one_liner":"在三维空间里找出物体，给出类别和带朝向的立体框。","explanation":"3D 目标检测是 2D 目标检测在三维空间的延伸：输入可以是激光雷达点云、RGB-D 图像，甚至单张彩色图，输出每个物体的类别和一个三维包围框，通常用中心坐标、长宽高和朝向角描述。2D 框只说明物体占了画面哪块像素，机器人要抓取、避障、导航，需要的是物体在真实空间里的位置、大小和朝向。自动驾驶是主要推动者，经典基准 KITTI 有 7481 张训练图及对应点云，评测车、行人、骑车人三类，车的 3D 框交并比（IoU）要达到 0.7 才算检对。面向室内和通用场景的有 Omni3D 基准（23.4 万张图、98 类）及配套的 Cube R-CNN 模型。它常和 6D 位姿估计对照：后者更精细，要给出物体完整的三维旋转。","example":"仓储机器人用激光雷达点云做 3D 检测，得到每个货箱的中心位置、尺寸和朝向，据此规划叉取或抓取的位置。","related":["目标检测","点云","激光雷达","鸟瞰图","交并比","6D位姿估计"]},{"id":"point-cloud-completion-shape-completion","category":"perception","sec":7,"tier":3,"sources":[{"title":"PCN: Point Completion Network (arXiv 1808.00671)","url":"https://arxiv.org/abs/1808.00671"},{"title":"Shape Completion Enabled Robotic Grasping (arXiv 1609.08546)","url":"https://arxiv.org/abs/1609.08546"}],"as_of":"","related_ids":["point-cloud","occlusion","single-image-3d-reconstruction","chamfer-distance","grasp-planning","point-cloud-encoder"],"name":"点云补全 / 形状补全","alt":"Point Cloud Completion / Shape Completion","abbr":"","aliases":["点云补全","形状补全","3D 形状补全"],"one_liner":"输入残缺的点云，推测并补出物体被遮挡或没扫到的部分。","explanation":"相机或激光雷达只能看到物体朝向自己的一面，得到的点云（一堆带 3D 坐标的点）总是残缺的。点云补全就是输入这种残缺点云、输出完整形状的任务；输出是点云时常叫点云补全，输出网格或体素时也叫形状补全。2018 年卡内基梅隆大学的 PCN 是较早直接在点集上做补全的深度网络，先生成粗糙形状再逐步加密细化。对机器人来说，补全后能估计物体背面的几何，抓取规划更可靠：2016 年 Varley 等人就用 3D 卷积网络补全单视角点云，再据此规划抓取，并在真机上验证。评测常用倒角距离（两组点之间平均最近距离）。","example":"腕部相机只拍到杯子正面，补全网络推测出杯子背面和杯柄的形状，抓取规划器据此选择夹持位置。","related":["点云","遮挡","单图生成3D","倒角距离","抓取规划","点云编码器"]},{"id":"triangle-mesh","category":"perception","sec":7,"tier":2,"sources":[{"title":"Wikipedia: Polygon mesh","url":"https://en.wikipedia.org/wiki/Polygon_mesh"},{"title":"MuJoCo XML Reference: asset/mesh（「collision detection works with the convex hull of the mesh」）","url":"https://raw.githubusercontent.com/google-deepmind/mujoco/main/doc/XMLreference.rst"}],"as_of":"","related_ids":["point-cloud","voxel","mesh-file","collision-geometry","convex-decomposition","unified-robot-description-format"],"name":"网格（三角网格）","alt":"Triangle Mesh","abbr":"","aliases":["Mesh","网格模型","三角面片","多边形网格"],"one_liner":"用顶点和三角形面片拼出物体表面的三维表示方式。","explanation":"三角网格是三维图形里最常用的表面表示：一组顶点坐标，加上每个三角形由哪三个顶点组成的索引，拼出物体表面，还可带法向、颜色和贴图坐标。GPU 渲染以三角形为单位，所以大多数 3D 资产用网格存储，常见格式有 OBJ、STL、PLY、DAE、glTF。和点云相比，它有面和连接关系，能直接渲染、做碰撞。机器人的 URDF、MJCF 文件用网格描述连杆的外观和碰撞形状；但 MuJoCo 等引擎碰撞时只用网格的凸包，杯、碗这类凹形物体要先做凸分解。三维重建和 SMPL 人体模型的输出也是网格。","example":"把马克杯的 OBJ 模型直接导入 MuJoCo 做碰撞，会按凸包处理，杯口相当于被「封」住，小球放不进去；用 CoACD 把它分解成若干凸块后，才能正常往杯里装东西。","related":["点云","体素","网格文件","碰撞体","凸分解","统一机器人描述格式"]},{"id":"truncated-signed-distance-function","category":"perception","sec":7,"tier":3,"sources":[{"title":"Open3D: RGBD integration (TSDF volume)","url":"https://www.open3d.org/docs/release/tutorial/pipelines/rgbd_integration.html"}],"as_of":"","related_ids":["signed-distance-field-function","voxel","triangle-mesh","euclidean-signed-distance-field","nvblox","depth-map"],"name":"截断符号距离函数","alt":"Truncated Signed Distance Function","abbr":"TSDF","aliases":["TSDF 融合","截断有向距离场"],"one_liner":"在体素网格里存到最近表面的带符号距离，用来融合多帧深度图重建三维。","explanation":"一种三维场景表示：把空间切成小立方体（体素），每个体素存它到最近物体表面的距离，在表面前方为正、后方为负，离表面太远的值截断成固定上限，只保留表面附近的信息。Curless 和 Levoy 1996 年提出用这种体积方法融合多幅深度图，2011 年 KinectFusion 用 GPU 把它做到实时。每来一帧深度图，按相机位姿把新观测加权平均进体素，噪声随帧数增加被平滑；最后用 Marching Cubes 算法提取距离为零的曲面，得到三角网格。机器人建图、避障和抓取常用它，Open3D、英伟达 nvblox 都有实现。","example":"手持 RGB-D 相机绕桌子扫一圈，Open3D 按每帧位姿把深度融合进 TSDF 体积，最后导出整张桌面和上面物体的网格模型。","related":["符号距离场","体素","网格（三角网格）","欧氏符号距离场","nvblox","深度图"]},{"id":"implicit-vs-explicit-3d-representation","category":"perception","sec":7,"tier":3,"sources":[{"title":"arXiv 2003.08934: NeRF（ECCV 2020）","url":"https://arxiv.org/abs/2003.08934"},{"title":"arXiv 1901.05103: DeepSDF","url":"https://arxiv.org/abs/1901.05103"},{"title":"3D Gaussian Splatting for Real-Time Radiance Field Rendering（SIGGRAPH 2023）","url":"https://repo-sam.inria.fr/fungraph/3d-gaussian-splatting/"}],"as_of":"","related_ids":["neural-radiance-fields","3d-gaussian-splatting","signed-distance-field-function","truncated-signed-distance-function","point-cloud","voxel"],"name":"隐式表示 / 显式表示","alt":"Implicit vs. Explicit 3D Representation","abbr":"","aliases":["隐式表征","显式表征","神经隐式表示","Implicit Neural Representation"],"one_liner":"3D 场景是直接存几何元素，还是存成一个可按坐标查询的函数。","explanation":"显式表示直接存几何元素：点云存点，网格存顶点和三角面，体素存每个格子的值，3D 高斯泼溅（3DGS）存大量带颜色和透明度的 3D 高斯椭球。隐式表示把场景写成函数，输入空间坐标、输出该点的属性，表面藏在函数的某个等值面里：符号距离函数（SDF）输出到表面的有符号距离，值为 0 处就是表面；DeepSDF、神经辐射场（NeRF）用神经网络拟合这类函数。隐式表示连续、紧凑，分辨率不受网格限制，但取表面或渲染要反复查询网络，比较慢；显式表示渲染和编辑快，精度受离散化限制。机器人规划和物理仿真通常还是要网格或体素，隐式重建后常再提取成网格。","example":"NeRF 用一个全连接网络把 5D 坐标（3D 位置加观察方向）映射为密度和颜色，是典型的隐式表示；3DGS 直接存一堆 3D 高斯并用光栅化渲染，是显式表示，所以能实时渲染。","related":["神经辐射场","3D高斯泼溅","符号距离场","截断符号距离函数","点云","体素"]},{"id":"neural-radiance-fields","category":"perception","sec":7,"tier":2,"sources":[{"title":"NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis (ECCV 2020)","url":"https://arxiv.org/abs/2003.08934"},{"title":"Dex-NeRF (CoRL 2021, arXiv 2110.14217)","url":"https://arxiv.org/abs/2110.14217"},{"title":"LERF: Language Embedded Radiance Fields (ICCV 2023)","url":"https://www.lerf.io/"}],"as_of":"","related_ids":["3d-gaussian-splatting","novel-view-synthesis","distilled-feature-fields","lerf","f3rm","multilayer-perceptron"],"name":"神经辐射场","alt":"Neural Radiance Fields","abbr":"NeRF","aliases":["NeRF","辐射场"],"one_liner":"用神经网络记住场景里每个点的颜色和密度，能渲染出任意新视角的图像。","explanation":"神经辐射场由 Mildenhall 等人在 ECCV 2020 提出，用一个多层感知机表示整个场景：输入空间位置 (x, y, z) 和观察方向，输出该点的体密度和颜色，再沿相机光线做体渲染合成图像。训练只需要一组已知相机位姿的照片，因为渲染过程可微，拿渲染图和真实照片比误差就能优化网络。它最初用于新视角合成，后来被用于三维重建和机器人：Dex-NeRF 用它恢复深度相机测不准的透明物体几何来做抓取，LERF、F3RM 把 CLIP 等语义特征嵌进辐射场，支持用语言在三维场景里找物体。缺点是每个场景都要单独优化、渲染较慢，2023 年出现的 3D 高斯泼溅渲染快得多，此后不少工作转向它。","example":"Dex-NeRF（CoRL 2021）对透明玻璃器皿多角度拍照训练 NeRF，从中渲染出深度再交给 Dex-Net 规划抓取，在 ABB YuMi 上的抓取成功率达到 90% 到 100%。","related":["3D高斯泼溅","新视角合成","蒸馏特征场","LERF","F3RM","多层感知机"]},{"id":"3d-gaussian-splatting","category":"perception","sec":7,"tier":2,"sources":[{"title":"3D Gaussian Splatting for Real-Time Radiance Field Rendering (project page, Inria)","url":"https://repo-sam.inria.fr/fungraph/3d-gaussian-splatting/"},{"title":"arXiv 2308.04079: 3D Gaussian Splatting for Real-Time Radiance Field Rendering","url":"https://arxiv.org/abs/2308.04079"}],"as_of":"","related_ids":["neural-radiance-fields","novel-view-synthesis","structure-from-motion","gaussian-splatting-based-simulation","gaussian-splatting-slam","real-to-sim"],"name":"3D高斯泼溅","alt":"3D Gaussian Splatting","abbr":"3DGS","aliases":["高斯泼溅","3D 高斯","Gaussian Splatting","GS","高斯溅射"],"one_liner":"用大量带颜色的三维高斯椭球表示场景，可实时渲染任意新视角。","explanation":"3D 高斯泼溅由 Inria 等机构的 Kerbl 等人提出，发表于 SIGGRAPH 2023。它把场景表示成大量三维高斯分布，可想成半透明的彩色椭球，每个都有位置、形状与朝向、不透明度和随视角变化的颜色。先对多视角照片做运动恢复结构，得到相机位姿和稀疏点云作初始化，再用可微光栅化反复比对渲染图和真实照片来优化这些高斯。论文报告在 1080p 下能以不低于 30 帧每秒实时合成新视角，比神经辐射场（NeRF）快得多。具身智能里常用它把真实场景搬进仿真、做高斯泼溅 SLAM，或渲染新视角做数据增强。","example":"绕一张桌子拍一圈照片，用 COLMAP 求出相机位姿和稀疏点，再训练 3DGS，就能在电脑上从任意角度实时查看这张桌子。","related":["神经辐射场","新视角合成","运动恢复结构","高斯泼溅仿真","高斯泼溅 SLAM","现实到仿真"]},{"id":"novel-view-synthesis","category":"perception","sec":7,"tier":3,"sources":[{"title":"NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis (arXiv)","url":"https://arxiv.org/abs/2003.08934"}],"as_of":"","related_ids":["neural-radiance-fields","3d-gaussian-splatting","multi-view-stereo","real-to-sim","gaussian-splatting-based-simulation","video-generation-model"],"name":"新视角合成","alt":"Novel View Synthesis","abbr":"NVS","aliases":["新视图合成","新视点合成"],"one_liner":"根据已有几张照片，生成场景在没拍过的视角下的样子。","explanation":"新视角合成指给定一个场景的若干张图像（通常带相机位姿），渲染出从新相机位置看过去的图像。传统方法依赖多视图立体重建出几何再贴图；2020 年的神经辐射场（NeRF）用神经网络表示场景并做体渲染，大幅提升了质量；2023 年的 3D 高斯泼溅用大量三维高斯显式表示场景，可实时渲染。近年也有视频生成模型直接生成新视角。在具身智能中，它用于把真实场景搬进仿真（现实到仿真）、给策略做视角数据增强。","example":"用手机绕一个物体拍几十张照片训练 3D 高斯泼溅，再渲染出任意新角度的图像。","related":["神经辐射场","3D高斯泼溅","多视图立体","现实到仿真","高斯泼溅仿真","视频生成模型"]},{"id":"4d-reconstruction","category":"perception","sec":7,"tier":3,"sources":[{"title":"4D Gaussian Splatting for Real-Time Dynamic Scene Rendering (arXiv 2310.08528)","url":"https://arxiv.org/abs/2310.08528"},{"title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion (arXiv 2410.03825)","url":"https://arxiv.org/abs/2410.03825"},{"title":"Dynamic 3D Gaussians: Tracking by Persistent Dynamic View Synthesis (arXiv 2308.09713)","url":"https://arxiv.org/abs/2308.09713"}],"as_of":"","related_ids":["3d-gaussian-splatting","neural-radiance-fields","feed-forward-3d-reconstruction","dust3r","3d-point-tracking","4d-world-model"],"name":"4D重建","alt":"4D Reconstruction (Dynamic Scene Reconstruction)","abbr":"","aliases":["动态场景重建","4D 高斯","4D Gaussian Splatting","动态三维重建"],"one_liner":"重建会动的三维场景：三维几何加上它随时间的变化。","explanation":"4D 重建指从视频（单目或多视角）恢复随时间变化的三维场景，第四维是时间：既要知道场景长什么样，也要知道人、手和物体在每一时刻的形状与位置。NeRF、3D 高斯泼溅等静态重建默认场景不动，遇到运动物体会出现重影。一类做法是逐场景优化，如 Dynamic 3D Gaussians 让高斯点随时间移动旋转，4D Gaussian Splatting（CVPR 2024）用形变场预测每个时刻高斯的位移，在 RTX 3090 上以 82 FPS 渲染 800×800 画面；另一类是前馈式，如 MonST3R（ICLR 2025）把静态重建模型 DUSt3R 扩展到动态视频，逐帧直接输出点图。具身智能里，它用于从人类视频恢复手物交互的三维运动、构建可回放的数字孪生。","example":"用手机拍一段人倒水的视频，经 4D 重建得到每一帧手、杯子和水壶的三维形状，可从任意视角回放，也能提取杯子的运动轨迹给机器人模仿。","related":["3D高斯泼溅","神经辐射场","前馈式三维重建","DUSt3R","3D 点跟踪","4D 世界模型"]},{"id":"single-image-3d-reconstruction","category":"perception","sec":7,"tier":3,"sources":[{"title":"Zero-1-to-3: Zero-shot One Image to 3D Object (arXiv)","url":"https://arxiv.org/abs/2303.11328"}],"as_of":"","related_ids":["hunyuan3d","sam-3d","simulation-assets","real-to-sim","point-cloud-completion-shape-completion","diffusion-model"],"name":"单图生成3D","alt":"Single-Image 3D Reconstruction (Image-to-3D)","abbr":"","aliases":["图生 3D","Image-to-3D","单视图重建"],"one_liner":"只给一张照片，让模型补全出物体完整的三维形状和纹理。","explanation":"单图生成3D指输入一张 RGB 图片，输出物体或场景的三维网格、点云或高斯表示。一张图只拍到正面，背面和被挡住的部分要靠模型从大量 3D 数据里学到的先验去「猜」，所以近年主流做法是用扩散模型（逐步去噪生成数据的模型）先生成多视角图像再重建，或直接生成 3D 表示。对具身智能来说，它能把真实照片里的物体快速变成仿真资产（仿真器里可用的 3D 模型），用于数字孪生、Real-to-Sim 和合成数据；也能帮机器人估计没看到的物体背面形状，辅助抓取规划。","example":"拍一张桌上马克杯的照片，用混元3D 生成带纹理的网格，再导入 Isaac Sim 当抓取训练的物体。","related":["混元3D（Hunyuan3D）","SAM 3D","仿真资产","现实到仿真","点云补全 / 形状补全","扩散模型"]},{"id":"hunyuan3d","category":"perception","sec":7,"tier":3,"sources":[{"title":"GitHub: Tencent-Hunyuan/Hunyuan3D-2（含版本时间线）","url":"https://github.com/Tencent-Hunyuan/Hunyuan3D-2"},{"title":"GitHub: Tencent-Hunyuan/Hunyuan3D-2.1","url":"https://github.com/Tencent-Hunyuan/Hunyuan3D-2.1"},{"title":"arXiv 2506.16504: Hunyuan3D 2.5","url":"https://arxiv.org/abs/2506.16504"}],"as_of":"2025-06","related_ids":["single-image-3d-reconstruction","simulation-assets","triangle-mesh","physically-based-rendering","convex-decomposition","hunyuanworld"],"name":"混元3D（Hunyuan3D）","alt":"Hunyuan3D (Tencent image-to-3D asset generation, 2.0 / 2.1 / 2.5)","abbr":"","aliases":["Hunyuan3D 2.0","Hunyuan3D-2.1","Hunyuan3D 2.5","腾讯混元3D"],"one_liner":"腾讯开源的图生 3D 资产模型系列，能从图片生成带贴图的 3D 网格。","explanation":"混元3D 是腾讯混元团队的 3D 资产生成模型系列。2.0 版于 2025 年 1 月开源，分两步：先用基于流匹配的扩散 Transformer（Hunyuan3D-DiT）按输入图片生成几何形状，再用 Hunyuan3D-Paint 给网格生成贴图。2025 年 6 月开源的 2.1 版把贴图升级为 PBR 材质（基于物理的渲染材质，含金属度、粗糙度等），形状模型 3.3B 参数、贴图模型 2B 参数，并公开了训练代码；同月发布的 2.5 技术报告把形状模型扩大到最高 10B 参数。在具身智能里，这类模型能从一张照片快速得到物体网格，用来扩充仿真资产库；不过生成结果还要补上质量、摩擦等物理属性并处理碰撞体，才能放进物理仿真。","example":"拍一张马克杯照片交给 Hunyuan3D-2.1，得到带 PBR 贴图的 GLB 网格；转换格式、用凸分解生成碰撞体并设定质量后，就能导入 Isaac Sim 当抓取物体。","related":["单图生成3D","仿真资产","网格（三角网格）","基于物理的渲染","凸分解","腾讯混元世界模型"]},{"id":"sam-3d","category":"perception","sec":7,"tier":3,"sources":[{"title":"Meta AI Blog: Introducing SAM 3D","url":"https://ai.meta.com/blog/sam-3d/"},{"title":"facebookresearch/sam-3d-objects","url":"https://github.com/facebookresearch/sam-3d-objects"},{"title":"facebookresearch/sam-3d-body","url":"https://github.com/facebookresearch/sam-3d-body"}],"as_of":"2026-06","related_ids":["segment-anything-model","sam-3","single-image-3d-reconstruction","human-mesh-recovery","simulation-assets","smpl"],"name":"SAM 3D","alt":"SAM 3D (SAM 3D Objects / SAM 3D Body)","abbr":"","aliases":["SAM 3D Objects","SAM 3D Body"],"one_liner":"Meta 开源的单张图片 3D 重建模型，分物体版和人体版","explanation":"SAM 3D 是 Meta 于 2025 年 11 月 19 日发布的一组单图 3D 重建模型，属于「分割一切」（SAM）系列。SAM 3D Objects 输入一张图和目标物体的掩码，输出该物体完整的 3D 形状、纹理和在场景中的位置姿态，能处理遮挡、侧视等真实照片；SAM 3D Body 从单张图估计人体 3D 姿态和体型，输出 Meta 提出的 MHR（Momentum Human Rig）参数化人体网格，可用 2D 关键点或掩码做提示。权重、推理代码和评测集已按 SAM License 开放。对具身智能来说，它能把照片里的物体快速变成仿真资产，也能从人类图像和视频中提取人体姿态。","example":"拍一张桌上杯子的照片，先用 SAM 3 分割出杯子，再交给 SAM 3D Objects 生成带纹理的 3D 网格，导入仿真器作抓取训练资产。","related":["分割一切模型","SAM 3（可提示概念分割）","单图生成3D","人体网格恢复","仿真资产","SMPL 人体模型"]},{"id":"6d-object-pose-estimation","category":"perception","sec":8,"tier":2,"sources":[{"title":"BOP: Benchmark for 6D Object Pose Estimation","url":"https://bop.felk.cvut.cz/home/"},{"title":"arXiv 2312.08344: FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects","url":"https://arxiv.org/abs/2312.08344"}],"as_of":"","related_ids":["pose","foundationpose","bop","category-level-pose-estimation","pose-tracking","average-distance-of-model-points"],"name":"6D位姿估计","alt":"6D Object Pose Estimation","abbr":"6DoF Pose","aliases":["物体位姿估计","6DoF 位姿估计","物体六自由度位姿估计","Object Pose Estimation"],"one_liner":"从图像中算出物体相对相机的三维位置和三维朝向，共六个自由度。","explanation":"6D 位姿估计是给定 RGB 或 RGB-D 图像，求刚体物体相对相机的 3 个平移量和 3 个旋转量，通常输出旋转矩阵加平移向量。按对物体了解多少，分实例级（见过这个具体物体及其 CAD 模型）、类别级（只知道它属于「杯子」这类）和面向新物体的方法，后者又分给 CAD 模型的 model-based 和只给参考图的 model-free。基准 BOP 自 2018 年起组织评测。英伟达 2023 年的 FoundationPose 用一个框架兼顾两种设定，还能连续跟踪。抓取、装配和 AR 都要用它：知道物体在哪、朝哪，才能算出夹爪该去哪。","example":"桌上有一把已知 CAD 模型的电钻，位姿估计模型从 RGB-D 图像求出它在相机坐标系下的位置和朝向，再结合手眼标定结果，就能算出机械臂去抓握把的目标位姿。","related":["位姿","FoundationPose","BOP 位姿估计基准","类别级位姿估计","位姿跟踪","ADD / ADD-S 位姿误差指标"]},{"id":"foundationpose","category":"perception","sec":8,"tier":2,"sources":[{"title":"FoundationPose (arXiv:2312.08344)","url":"https://arxiv.org/abs/2312.08344"},{"title":"NVlabs/FoundationPose (GitHub)","url":"https://github.com/NVlabs/FoundationPose"}],"as_of":"2024-03","related_ids":["6d-object-pose-estimation","pose-tracking","bop","megapose","sam-6d","nvidia"],"name":"FoundationPose","alt":"FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects","abbr":"","aliases":["NVIDIA FoundationPose"],"one_liner":"英伟达的通用 6D 位姿模型，新物体不用再训练就能估计和跟踪位姿。","explanation":"FoundationPose 是英伟达 Bowen Wen 等人提出的物体 6D 位姿（三维位置加三维朝向）估计与跟踪模型，发表于 CVPR 2024（Highlight）。它面向训练时没见过的物体，测试时不微调：给一个 CAD 模型，或约 16 张该物体的参考照片，再加上 RGB-D 图像和检测出的物体区域，就能输出位姿。做法是先在物体周围均匀撒大量初始位姿，拿渲染图和实拍图对比逐个修正，再用排序网络挑出最好的；后续帧只做修正，跟踪约 32 Hz。训练数据是借助大语言模型生成的大规模合成数据。截至 2024 年 3 月，它在 BOP 榜单基于模型的新物体位姿估计上排第一，另有 Isaac ROS 版本。","example":"机械臂要把一个没训练过的工件插进夹具：先扫出工件的 CAD 模型，第一帧用分割模型框出工件，FoundationPose 估出 6D 位姿并持续跟踪，规划器据此算抓取和插入轨迹。","related":["6D位姿估计","位姿跟踪","BOP 位姿估计基准","MegaPose","SAM-6D","英伟达"]},{"id":"megapose","category":"perception","sec":8,"tier":3,"sources":[{"title":"arXiv: MegaPose: 6D Pose Estimation of Novel Objects via Render & Compare","url":"https://arxiv.org/abs/2212.06870"}],"as_of":"","related_ids":["6d-object-pose-estimation","foundationpose","sam-6d","bop","ycb-object-and-model-set","pose-tracking"],"name":"MegaPose","alt":"MegaPose: 6D Pose Estimation of Novel Objects via Render & Compare","abbr":"","aliases":[],"one_liner":"只要物体的 CAD 模型、不用重新训练，就能估计新物体 6D 位姿的方法。","explanation":"MegaPose 由 Inria、NVIDIA 等机构的 Yann Labbé、Dieter Fox、Josef Sivic 等人提出，发表于 CoRL 2022。6D 位姿估计要算出物体在相机坐标系下的三维位置和朝向，以往方法多要为每个物体单独训练，换个新零件就得重来。MegaPose 采用「渲染-比较」思路：给定图中物体所在区域和它的 CAD 模型，先粗估一个位姿，用模型渲染出该位姿下的合成图，与真实图像对比，由网络预测如何修正位姿，反复迭代。它在包含数千种物体的大规模逼真合成数据上训练，论文指出物体多样性是泛化的关键，因此能不重训练直接用于数百种新物体，在 YCB-Video、BOP 等基准上结果有竞争力。后来英伟达的 FoundationPose 也用了类似的渲染比较精修，并与它做了对比。","example":"工厂新到一种零件，只要有它的 CAD 文件，先用检测器框出零件，再交给 MegaPose 估出 6D 位姿供机械臂抓取，不必为这个零件专门采数据训练。","related":["6D位姿估计","FoundationPose","SAM-6D","BOP 位姿估计基准","YCB 物体集","位姿跟踪"]},{"id":"sam-6d","category":"perception","sec":8,"tier":3,"sources":[{"title":"arXiv 2311.15707: SAM-6D","url":"https://arxiv.org/abs/2311.15707"},{"title":"JiehongLin/SAM-6D GitHub","url":"https://github.com/JiehongLin/SAM-6D"}],"as_of":"2024-06","related_ids":["6d-object-pose-estimation","segment-anything-model","foundationpose","megapose","bop","point-cloud-registration"],"name":"SAM-6D","alt":"SAM-6D: Segment Anything Model Meets Zero-Shot 6D Object Pose Estimation","abbr":"","aliases":[],"one_liner":"借助 SAM 分割，对没见过的物体零样本估计 6D 位姿的方法","explanation":"SAM-6D 是 Jiehong Lin、贾奎等人（香港中文大学（深圳）、华南理工大学等）2023 年提出、发表于 CVPR 2024 的零样本 6D 物体位姿估计方法。6D 位姿指物体的 3D 位置加 3D 朝向，抓取和装配都离不开它；「零样本」指对训练时没见过的新物体，给出 CAD 模型即可估计，不用重新训练。方法分两步：先用 SAM 生成所有候选区域，按语义、外观、几何打分筛出目标物体；再把位姿估计看作模型点云与观测点云「部分对部分」的点匹配，粗到细两阶段求出位姿。输入为 RGB-D 图像、相机内参和 CAD 模型，论文报告在 BOP 基准 7 个核心数据集上超过当时已有方法。","example":"给定一个零件的 CAD 模型，SAM-6D 在杂乱料框的 RGB-D 图像里找出该零件并给出 6D 位姿，交给机械臂抓取。","related":["6D位姿估计","分割一切模型","FoundationPose","MegaPose","BOP 位姿估计基准","点云配准"]},{"id":"pose-tracking","category":"perception","sec":8,"tier":3,"sources":[{"title":"FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects (arXiv 2312.08344)","url":"https://arxiv.org/abs/2312.08344"},{"title":"FoundationPose 项目主页 (NVIDIA)","url":"https://nvlabs.github.io/FoundationPose/"}],"as_of":"2024-06","related_ids":["6d-object-pose-estimation","foundationpose","visual-servoing","in-hand-manipulation","occlusion","pose"],"name":"位姿跟踪","alt":"Pose Tracking","abbr":"","aliases":["6D 位姿跟踪","物体位姿跟踪"],"one_liner":"在连续视频帧里持续估计物体的 3D 位置和朝向。","explanation":"位姿指物体的 3D 位置加 3D 朝向，共 6 个自由度，所以也叫 6D 位姿。6D 位姿估计通常对单帧从零算出位姿；位姿跟踪则利用上一帧的结果，在新一帧里只做小幅修正，因此更快、更平滑，适合实时闭环控制。英伟达的 FoundationPose（CVPR 2024 Highlight）把估计和跟踪统一在一个框架里：输入 RGB-D 图像，对没见过的物体只需 CAD 模型或少量参考图，用「渲染-比较」迭代细化位姿。机器人抓取移动物体、手内调整物体、视觉伺服时都依赖它；物体被遮挡或运动过快时容易跟丢，需要重新做全局估计。SLAM 里估计相机自身位姿也叫跟踪，对象不同。","example":"机器人拧瓶盖时，每帧用 FoundationPose 跟踪瓶子的 6D 位姿，控制器据此调整夹爪位置。","related":["6D位姿估计","FoundationPose","视觉伺服","手内操作","遮挡","位姿"]},{"id":"category-level-pose-estimation","category":"perception","sec":8,"tier":3,"sources":[{"title":"Normalized Object Coordinate Space for Category-Level 6D Object Pose and Size Estimation (arXiv 1901.02970, CVPR 2019)","url":"https://arxiv.org/abs/1901.02970"}],"as_of":"","related_ids":["6d-object-pose-estimation","normalized-object-coordinate-space","foundationpose","pose-tracking","object-generalization","bop"],"name":"类别级位姿估计","alt":"Category-Level Pose Estimation","abbr":"","aliases":["类别级 6D 位姿","类别级 6D 位姿与尺寸估计","Category-Level 6D Object Pose and Size Estimation"],"one_liner":"不需要具体物体的 CAD 模型，对某一类里没见过的物体估计 6D 位姿和尺寸。","explanation":"实例级 6D 位姿估计要求事先有每个物体精确的 3D 模型，只能处理训练时见过的那几个物体。类别级位姿估计把条件放宽为：只知道物体属于哪一类（杯子、碗、笔记本电脑等），对这一类里没见过的新实例估计位置、朝向和三维尺寸。难点是同类物体形状差别大。斯坦福 Guibas 组王鹤等人在 CVPR 2019 提出 NOCS（归一化物体坐标空间），让网络把每个像素映射到该类别共享的标准坐标，再结合深度图求出位姿和尺寸，并发布了 CAMERA（合成）和 REAL275（真实）两个常用数据集。它适合「拿起任意一个杯子」这类家庭任务；FoundationPose 等零样本方法则换了思路，需要新物体的模型或参考图像。","example":"机器人看到桌上一只从没见过的马克杯，网络把杯子像素映射到「杯子」类的标准坐标，再和深度点云对齐，算出杯子的位置、朝向和尺寸，据此规划抓杯柄的位姿。","related":["6D位姿估计","NOCS 归一化物体坐标空间","FoundationPose","位姿跟踪","物体泛化","BOP 位姿估计基准"]},{"id":"normalized-object-coordinate-space","category":"perception","sec":8,"tier":3,"sources":[{"title":"Normalized Object Coordinate Space for Category-Level 6D Object Pose and Size Estimation (arXiv)","url":"https://arxiv.org/abs/1901.02970"}],"as_of":"","related_ids":["category-level-pose-estimation","6d-object-pose-estimation","instance-segmentation","mask-r-cnn","depth-camera"],"name":"NOCS 归一化物体坐标空间","alt":"Normalized Object Coordinate Space","abbr":"NOCS","aliases":["归一化物体坐标空间","NOCS 图"],"one_liner":"给同类物体定一个统一的标准坐标系，用来估计没见过物体的位姿和尺寸。","explanation":"NOCS 由斯坦福王鹤等人在 CVPR 2019 提出，用于类别级位姿估计（对同一类别里没见过的具体物体估计位姿）。做法是把同一类物体统一摆正、缩放到单位立方体内，形成共享的标准坐标空间；网络在 Mask R-CNN 基础上为每个像素预测它在该空间里的坐标（NOCS 图），再与深度图做相似变换对齐，一次求出物体的 6D 位姿和三维尺寸。它不需要该物体的 CAD 模型，是类别级位姿估计的代表性表示。","example":"桌上放一个训练时没见过的马克杯，模型分割出它并预测 NOCS 图，结合深度图算出杯子的位置、朝向和大小。","related":["类别级位姿估计","6D位姿估计","实例分割","Mask R-CNN","深度相机"]},{"id":"average-distance-of-model-points","category":"perception","sec":8,"tier":3,"sources":[{"title":"PoseCNN: A Convolutional Neural Network for 6D Object Pose Estimation in Cluttered Scenes (arXiv:1711.00199)","url":"https://arxiv.org/abs/1711.00199"},{"title":"BOP Challenge 2019：pose-error functions","url":"https://bop.felk.cvut.cz/challenges/bop-challenge-2019/"}],"as_of":"","related_ids":["6d-object-pose-estimation","bop","foundationpose","ycb-object-and-model-set","chamfer-distance","pose"],"name":"ADD / ADD-S 位姿误差指标","alt":"Average Distance of Model Points (ADD / ADD-S)","abbr":"ADD / ADD-S","aliases":["ADD","ADD-S","ADI","平均模型点距离"],"one_liner":"把物体模型分别按真值和预测位姿摆好，算点的平均距离，用来评 6D 位姿估计。","explanation":"ADD 是 6D 物体位姿估计最常用的误差指标，由 Hinterstoisser 等人在 ACCV 2012 随 LINEMOD 数据集提出。做法是取物体 3D 模型上的点，分别用真值位姿和预测位姿变换，求对应点距离的平均值；常见判定是平均距离小于模型直径的 10% 就算估计正确，报告正确率。对称物体（碗、罐头）转个角度看起来一样，逐点对应会冤枉合理的预测，于是改用 ADD-S：每个点去找另一组里最近的点再求平均，BOP 基准里称为 ADI。PoseCNN（2018）在 YCB-Video 上把阈值从 0 扫到 10 厘米，报告准确率-阈值曲线下面积（AUC），后来成为常见写法。BOP 基准指出 ADI 可能给视觉上明显没对齐的位姿打出很低误差，所以改用 VSD、MSSD、MSPD 三个指标。","example":"一个直径 20 厘米的锅，按 10% 直径规则阈值是 2 厘米：预测位姿下模型点与真值点平均偏离 1.5 厘米算正确，偏离 3 厘米算错误。","related":["6D位姿估计","BOP 位姿估计基准","FoundationPose","YCB 物体集","倒角距离","位姿"]},{"id":"bop","category":"perception","sec":8,"tier":3,"sources":[{"title":"BOP: Benchmark for 6D Object Pose Estimation（官网）","url":"https://bop.felk.cvut.cz/home/"},{"title":"BOP: Benchmark for 6D Object Pose Estimation (arXiv 1808.08319, ECCV 2018)","url":"https://arxiv.org/abs/1808.08319"},{"title":"BOP Challenge 2024 on Model-Based and Model-Free 6D Object Pose Estimation (arXiv 2504.02812)","url":"https://arxiv.org/abs/2504.02812"}],"as_of":"2025-11","related_ids":["6d-object-pose-estimation","foundationpose","megapose","sam-6d","ycb-object-and-model-set","average-distance-of-model-points"],"name":"BOP 位姿估计基准","alt":"BOP: Benchmark for 6D Object Pose Estimation","abbr":"BOP","aliases":["BOP Challenge","BOP 挑战赛"],"one_liner":"捷克理工大学维护的 6D 物体位姿估计公开基准和年度挑战赛。","explanation":"BOP 由 Tomáš Hodaň 等人在 ECCV 2018 提出，由布拉格的捷克理工大学维护。它把 LM-O、T-LESS、YCB-V 等多个物体位姿数据集统一成同一格式，给出统一的误差函数（能处理对称物体的位姿歧义）和在线评测系统，并在 2019、2020、2022–2025 年举办挑战赛，配套 R6D 等研讨会。任务从「已见物体」扩展到「未见物体」：2023 年要求方法只凭 CAD 模型快速上手新物体，2024 年加入只给参考视频的无模型任务和 BOP-H3 数据集，2025 年加入面向工业场景的 BOP-Industrial 数据集。2024 年报告指出，未见物体的 2D 检测仍比已见物体低约 35%，是主要瓶颈。FoundationPose、MegaPose、SAM-6D 等方法都在这里比成绩。","example":"新提出的零样本位姿估计方法在 BOP-Classic-Core 数据集上跑出结果，上传到 BOP 在线评测系统拿到 AR 分数，再和 FoundationPose 等方法在排行榜上对比。","related":["6D位姿估计","FoundationPose","MegaPose","SAM-6D","YCB 物体集","ADD / ADD-S 位姿误差指标"]},{"id":"3d-vision-guided-robotics","category":"perception","sec":8,"tier":3,"sources":[{"title":"Wikipedia: Machine vision","url":"https://en.wikipedia.org/wiki/Machine_vision"},{"title":"Wikipedia: Bin picking","url":"https://en.wikipedia.org/wiki/Bin_picking"},{"title":"Mech-Mind Robotics 官网（3D 相机与视觉引导应用）","url":"https://www.mech-mind.com/"}],"as_of":"","related_ids":["bin-picking","machine-vision","structured-light","hand-eye-calibration","6d-object-pose-estimation","mech-mind-robotics"],"name":"3D 视觉引导","alt":"3D Vision-Guided Robotics","abbr":"","aliases":["3D 视觉引导机器人","视觉引导机器人","VGR","3D 视觉定位引导"],"one_liner":"用 3D 相机识别工件的位置和姿态，引导工业机器人去抓取或加工。","explanation":"3D 视觉引导是工业自动化里的叫法：在机器人工作站装 3D 相机（常用结构光、双目或激光三角测量），拍下工件点云，经识别和位姿估计得到每个工件的三维位置与朝向，再通过手眼标定换算到机器人坐标系，引导机械臂去抓、放、装配或打磨。传统工业机器人靠示教再现，要求工件每次摆在同一位置；加上 3D 视觉后，它能处理位置随机、堆叠杂乱的情况。典型应用有无序抓取（从料框里取散乱零件）、混箱拆垛、机床上下料和定位装配，国内有梅卡曼德、图漾等厂商提供相机和软件。它可以看作「感知→抓取」流程在工厂里的成熟工程版，但物体种类和任务通常事先限定。","example":"零部件工厂里，3D 相机拍下料框中杂乱堆放的金属件，软件把点云和零件 CAD 模型匹配，算出每个零件的位姿和可抓点，引导机械臂逐个取出放上机床，这就是无序抓取上下料。","related":["无序抓取","机器视觉（工业视觉）","结构光","手眼标定","6D位姿估计","梅卡曼德"]},{"id":"grasp-pose-detection","category":"perception","sec":8,"tier":2,"sources":[{"title":"Grasp Pose Detection in Point Clouds (arXiv:1706.09911)","url":"https://arxiv.org/abs/1706.09911"},{"title":"GraspNet-1Billion 官网","url":"https://graspnet.net/"}],"as_of":"","related_ids":["grasping","6d-object-pose-estimation","anygrasp","contact-graspnet","graspnet-1billion","bin-picking"],"name":"抓取位姿检测","alt":"Grasp Pose Detection","abbr":"","aliases":["抓取检测","抓取位姿估计","Grasp Detection","6-DoF Grasp Detection"],"one_liner":"从图像或点云直接算出夹爪该放在哪、朝哪个方向去抓的感知任务。","explanation":"抓取位姿检测是机器人抓取的感知环节：输入 RGB-D 图像或点云，输出一批可行抓取位姿及打分。平面抓取常用带朝向的矩形表示夹爪在图上的位置、角度和张开宽度；6-DoF 抓取则给出夹爪在三维空间的位置、接近方向、旋转和张开宽度，可以从侧面或斜上方抓。和 6D 位姿估计不同，它不需要物体模型，也不必认出物体是什么，适合在杂乱场景里抓没见过的东西。2017 年 ten Pas 等人的 GPD 把它当作类似目标检测的问题：先采样候选抓取，再逐个分类。GraspNet-1Billion 提供了 88 个物体、190 个场景、超过 11 亿个抓取标注的基准，AnyGrasp、Contact-GraspNet、GraspGen 是常用模型，检测结果再交给运动规划执行。","example":"料箱里堆着各种零件，深度相机拍一帧点云，AnyGrasp 输出几十个带分数的二指夹爪位姿，系统挑出分数最高且不会碰到箱壁的那个，交给运动规划执行。","related":["抓取","6D位姿估计","AnyGrasp","Contact-GraspNet","GraspNet-1Billion 数据集","无序抓取"]},{"id":"anygrasp","category":"perception","sec":8,"tier":2,"sources":[{"title":"AnyGrasp (arXiv 2212.08333, IEEE T-RO)","url":"https://arxiv.org/abs/2212.08333"},{"title":"AnyGrasp 项目页（SJTU MVIG）","url":"https://graspnet.net/anygrasp.html"},{"title":"graspnet/anygrasp_sdk","url":"https://github.com/graspnet/anygrasp_sdk"}],"as_of":"2026-07","related_ids":["grasp-pose-detection","bin-picking","graspnet-1billion","contact-graspnet","ok-robot","point-cloud"],"name":"AnyGrasp","alt":"AnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal Domains","abbr":"","aliases":["AnyGrasp SDK"],"one_liner":"上海交大提出的通用抓取检测模型，从点云直接给出大量可用抓取位姿。","explanation":"AnyGrasp 是上海交通大学卢策吾团队（MVIG）提出的抓取感知系统，论文发表于 IEEE T-RO（2023）。输入深度相机得到的点云，输出场景中密集的 7 自由度抓取位姿（夹爪位置、朝向和张开宽度）并逐个打分；它对深度噪声较鲁棒，还能在连续帧间对应同一个抓取，从而跟踪移动物体。论文报告单臂系统每小时可完成 900 次以上抓取。它常被当作现成的抓取模块接入更大的系统，例如 OK-Robot 就用它决定怎么抓。SDK 在 GitHub 发布，但核心库需按机器申请许可证。","example":"在杂乱桌面拍一帧 RGB-D，AnyGrasp 给出上百个候选抓取，用目标物体的分割掩码筛掉不在目标上的，再取分数最高的一个交给机械臂执行。","related":["抓取位姿检测","无序抓取","GraspNet-1Billion 数据集","Contact-GraspNet","OK-Robot","点云"]},{"id":"contact-graspnet","category":"perception","sec":8,"tier":3,"sources":[{"title":"Contact-GraspNet: Efficient 6-DoF Grasp Generation in Cluttered Scenes (arXiv 2103.14127)","url":"https://arxiv.org/abs/2103.14127"},{"title":"NVlabs/contact_graspnet (GitHub)","url":"https://github.com/NVlabs/contact_graspnet"}],"as_of":"2021-03","related_ids":["grasp-pose-detection","anygrasp","acronym-a-large-scale-grasp-dataset-based-on-simulation","graspnet-1billion","point-cloud","parallel-jaw-gripper"],"name":"Contact-GraspNet","alt":"Contact-GraspNet: Efficient 6-DoF Grasp Generation in Cluttered Scenes","abbr":"","aliases":["Contact GraspNet"],"one_liner":"英伟达的抓取网络，从深度点云直接生成杂乱场景中的 6 自由度抓取。","explanation":"Contact-GraspNet 由 NVIDIA 的 Sundermeyer、Mousavian、Triebel 和 Fox 提出，发表于 ICRA 2021。它面向二指平行夹爪：输入深度图加相机内参（或直接输入点云），可选物体分割掩码，端到端输出一批带置信度的 6 自由度抓取位姿。关键设计是把观测到的每个 3D 点都当作可能的指尖接触点，于是只需再预测夹爪的三维朝向和张开宽度共 4 个自由度，学习难度大为降低。模型不区分物体类别，在 1700 万个仿真抓取上训练（抓取标注来自 ACRONYM 数据集）；论文报告在真机杂乱场景中抓取未见过物体，成功率超过 90%。它常作为抓取模块接在分割或开放词汇检测之后。","example":"桌上堆着杯子、盒子和玩具，先用分割模型抠出目标杯子，把深度图和杯子的掩码一起送进 Contact-GraspNet，从落在杯子上的候选里取置信度最高的抓取，交给运动规划执行。","related":["抓取位姿检测","AnyGrasp","ACRONYM 抓取数据集","GraspNet-1Billion 数据集","点云","二指夹爪"]},{"id":"graspgen","category":"perception","sec":8,"tier":3,"sources":[{"title":"GraspGen (arXiv 2507.13097)","url":"https://arxiv.org/abs/2507.13097"},{"title":"GraspGen 项目主页","url":"https://graspgen.github.io/"}],"as_of":"2025-07","related_ids":["grasp-pose-detection","diffusion-model","contact-graspnet","anygrasp","grasp-planning","curobo"],"name":"GraspGen","alt":"GraspGen: A Diffusion-based Framework for 6-DOF Grasping with On-Generator Training","abbr":"","aliases":[],"one_liner":"英伟达用扩散模型生成 6 自由度抓取位姿、再打分筛选的框架","explanation":"英伟达 2025 年 7 月公开的 6 自由度抓取生成框架（Murali、Fox、Eppner 等）。输入物体点云，先用扩散 Transformer 生成大量候选抓取位姿（夹爪的三维位置加朝向），再用判别器给每个抓取打分、筛掉差的；判别器直接用生成器采样出的抓取来训练（论文称 on-generator training）。它同时发布了超过 5300 万个仿真抓取的数据集，覆盖 Franka 夹爪、Robotiq 2F-140、吸盘等末端执行器，针对的是学习型抓取换夹爪、换真实场景就不好用的问题。论文报告它在 FetchBench 仿真基准上达到最好水平，真机上面对有噪声的点云也能工作。","example":"先用分割模型从深度点云里抠出目标物体，把物体点云交给 GraspGen 得到一批带分数的抓取位姿，挑分数最高且可达的一个，交给 cuRobo 规划机械臂轨迹去执行。","related":["抓取位姿检测","扩散模型","Contact-GraspNet","AnyGrasp","抓取规划","cuRobo"]},{"id":"semantic-keypoints","category":"perception","sec":8,"tier":3,"sources":[{"title":"arXiv 1903.06684: kPAM: KeyPoint Affordances for Category-Level Robotic Manipulation","url":"https://arxiv.org/abs/1903.06684"}],"as_of":"","related_ids":["keypoint-detection","rekep","omnimanip","6d-object-pose-estimation","category-level-pose-estimation","affordance"],"name":"语义关键点","alt":"Semantic Keypoints","abbr":"","aliases":["任务关键点","语义 3D 关键点"],"one_liner":"用物体上几个有含义的点（如杯把、壶嘴）来表示物体，方便规划操作","explanation":"语义关键点是物体上带有明确含义的少数几个 3D 点，比如马克杯的把手中心、杯底中心，鞋子的鞋跟。和 6D 位姿相比，它不要求每个物体都有精确的 CAD 模板，同一类中形状差别很大的物体也能找到对应的点，因此适合类别级泛化。2019 年 MIT Tedrake 组的 kPAM 把它用于机器人操作：先检测语义 3D 关键点，再把任务写成关于这些点的几何约束（如「杯把挂到挂钩上」「杯底贴住桌面」），用优化求出机械臂的目标位姿，从而操作没见过的新物体。近年的 ReKep、OmniManip 等工作让视觉语言模型直接在图像上提出关键点和约束，所以也常被称为任务关键点。","example":"kPAM 中，对形状各异、没见过的马克杯，只检测杯把、杯底等几个关键点，就能规划出把杯子挂到杯架上的动作。","related":["关键点检测","ReKep","OmniManip","6D位姿估计","类别级位姿估计","可供性"]},{"id":"affordance-detection","category":"perception","sec":8,"tier":3,"sources":[{"title":"AffordanceNet: An End-to-End Deep Learning Approach for Object Affordance Detection (arXiv:1709.07326)","url":"https://arxiv.org/abs/1709.07326"},{"title":"Learning Affordance Grounding from Exocentric Images (CVPR 2022, arXiv:2203.09905)","url":"https://arxiv.org/abs/2203.09905"}],"as_of":"","related_ids":["affordance","grasp-pose-detection","task-oriented-grasping","robopoint","vrb","intermediate-representation"],"name":"可供性检测","alt":"Affordance Detection / Affordance Grounding","abbr":"","aliases":["可供性预测","可供性定位","可供性图","Affordance Map","功能区域检测"],"one_liner":"从图像或点云里找出物体哪里能握、能按、能倒，并标到具体区域上。","explanation":"可供性指物体为行动者提供的动作可能，比如杯柄可握、按钮可按。可供性检测就是把这种可能落到具体像素或点上：输入 RGB 图、深度图或点云，输出每个区域对应的动作标签或热力图（可供性图）。早期代表 AffordanceNet（Do 等，ICRA 2018）一边检测物体，一边给物体上每个像素分配最可能的可供性标签。「可供性定位」更强调按给定动作词找区域，如 Luo 等人在 CVPR 2022 提出的 AGD20K 数据集（2 万多张图、36 类可供性），从第三人称的人-物交互图里学习，再迁移到物体图上。它补上了「认出物体」到「知道怎么操作」之间的缺口，结果常作为中间表示交给抓取规划或策略。近年也有用视觉语言模型直接预测可操作点的做法，如 RoboPoint。","example":"指令是「倒杯水」时，可供性检测在水壶图上把把手标成「握持」区域、壶嘴标成「倾倒」区域，抓取模块只在把手上采样抓取位姿。","related":["可供性","抓取位姿检测","任务导向抓取（功能性抓取）","RoboPoint","VRB（从人类视频学可供性）","中间表示"]},{"id":"articulation-estimation","category":"perception","sec":8,"tier":3,"sources":[{"title":"Category-Level Articulated Object Pose Estimation (ANCSH, arXiv:1912.11913)","url":"https://arxiv.org/abs/1912.11913"},{"title":"Ditto: Building Digital Twins of Articulated Objects from Interaction (arXiv:2202.08227)","url":"https://arxiv.org/abs/2202.08227"}],"as_of":"","related_ids":["articulated-object","articulated-object-manipulation","partnet-mobility","interactive-perception","digital-twin","6d-object-pose-estimation"],"name":"铰接结构估计","alt":"Articulation Estimation","abbr":"","aliases":["关节参数估计","铰接模型估计","铰接物体位姿估计","Articulated Object Pose Estimation"],"one_liner":"从观测中推断物体有哪些部件、靠什么关节相连、绕哪根轴动、现在开了多少。","explanation":"铰接物体（柜门、抽屉、笔记本电脑、剪刀）由多个刚性部件通过关节连接。铰接结构估计要从图像或点云中推断：部件怎么划分，每个关节是转动还是平移，关节轴的位置和方向，以及当前关节状态（比如门开了多少度）。机器人开门、拉抽屉前需要这些信息，用力方向不对就会卡住甚至损坏物体。代表工作有 Xiaolong Li、王鹤、Shuran Song 等提出的 ANCSH，能从单帧深度点云估计同类别未见物体的部件位姿、关节参数和关节状态；Ditto（Zhenyu Jiang、Yuke Zhu 等，CVPR 2022）利用交互前后两次观测，重建部件几何并估计关节模型，结果可以放进物理仿真，相当于给铰接物体建数字孪生。","example":"机器人面对一个没见过的橱柜，先推一下柜门，对比推前推后的点云，估计出门轴是竖直转轴、位于柜体左边缘，再沿圆弧轨迹把门拉开。","related":["铰接物体","铰接物体操作","PartNet-Mobility 数据集","交互式感知","数字孪生","6D位姿估计"]},{"id":"human-pose-estimation","category":"perception","sec":9,"tier":2,"sources":[{"title":"Realtime Multi-Person 2D Pose Estimation using Part Affinity Fields (OpenPose, arXiv:1611.08050)","url":"https://arxiv.org/abs/1611.08050"},{"title":"COCO Keypoint Evaluation (OKS)","url":"https://raw.githubusercontent.com/cocodataset/cocodataset.github.io/master/dataset/keypoints-eval.htm"},{"title":"MediaPipe Pose Landmarker 官方文档","url":"https://developers.google.com/edge/mediapipe/solutions/vision/pose_landmarker"}],"as_of":"","related_ids":["keypoint-detection","markerless-motion-capture","motion-retargeting","smpl","hand-pose-estimation","mediapipe"],"name":"人体姿态估计","alt":"Human Pose Estimation","abbr":"HPE","aliases":["人体关键点检测","人体动作捕捉（视觉）"],"one_liner":"从图像或视频里找出人的各个关节位置，连成一副骨架。","explanation":"人体姿态估计的输入是图片或视频，输出是人身上肩、肘、腕、髋、膝、踝等关节的 2D 像素坐标或 3D 位置，连起来就是一副骨架。COCO 数据集按每人 17 个关键点标注，用 OKS（按人体尺度归一化的关键点相似度）打分；卡内基梅隆的 OpenPose（CVPR 2017）先找出画面里所有关节再分配给各人，多人也能实时；谷歌 MediaPipe 可输出 33 个身体点。对具身智能，它是把人的动作变成机器人数据的第一步：遥操作时实时读取操作者姿态，或从人类视频中提取动作，再经动作重定向（映射到机器人关节）交给机器人。","example":"斯坦福的 HumanPlus 只用一个 RGB 摄像头实时估计操作者的身体和手部姿态，让自制的 33 自由度人形机器人同步模仿，并借此遥操作采集演示数据。","related":["关键点检测","无标记动捕","动作重定向","SMPL 人体模型","手部姿态估计","MediaPipe（手部/人体关键点）"]},{"id":"hand-pose-estimation","category":"perception","sec":9,"tier":2,"sources":[{"title":"HaMeR: Reconstructing Hands in 3D with Transformers (arXiv:2312.05251)","url":"https://arxiv.org/abs/2312.05251"},{"title":"MANO 官网","url":"https://mano.is.tue.mpg.de/"},{"title":"Open-TeleVision (arXiv:2407.01512)","url":"https://arxiv.org/html/2407.01512"}],"as_of":"","related_ids":["mano","hamer","mediapipe","motion-retargeting","hand-object-interaction","human-pose-estimation"],"name":"手部姿态估计","alt":"Hand Pose Estimation","abbr":"","aliases":["手势估计","手部追踪","Hand Tracking","手部网格重建","Hand Mesh Recovery"],"one_liner":"从图像或传感器数据估计人手各关节位置和手指弯曲姿态的任务。","explanation":"手部姿态估计是从图像、深度图或头显传感器数据中估计人手各关节的位置和手指姿态。常见输出有两种：一是 21 个二维或三维关键点（手腕加每根手指 4 个点），MediaPipe 输出的就是这种；二是参数化手部网格，最常用 MANO 模型（2017 年提出，778 个顶点，由姿态和形状参数控制），HaMeR 就用大规模 ViT 从单张图片直接回归 MANO 网格。难点是手指细、自遮挡多，握东西时还被物体挡住。对具身智能，它是把人手动作变成机器人动作的第一步：遥操作时由头显手部追踪提供实时关键点，再经动作重定向驱动灵巧手；从人类视频学操作时，也要先估出手的轨迹作为伪动作标签。","example":"Open-TeleVision 用 Apple Vision Pro 实时获取操作员的手部关键点，经 dex-retargeting 优化成灵巧手关节角，操作员握拳，Unitree H1 的手也跟着握拳。","related":["MANO 手部模型","HaMeR","MediaPipe（手部/人体关键点）","动作重定向","手物交互","人体姿态估计"]},{"id":"mediapipe","category":"perception","sec":9,"tier":2,"sources":[{"title":"MediaPipe Hand Landmarker guide","url":"https://developers.google.com/edge/mediapipe/solutions/vision/hand_landmarker"},{"title":"MediaPipe Pose Landmarker guide","url":"https://developers.google.com/edge/mediapipe/solutions/vision/pose_landmarker"},{"title":"google-ai-edge/mediapipe (GitHub)","url":"https://github.com/google-ai-edge/mediapipe"}],"as_of":"2026-09","related_ids":["hand-pose-estimation","human-pose-estimation","keypoint-detection","motion-retargeting","hamer","dex-retargeting"],"name":"MediaPipe（手部/人体关键点）","alt":"Google MediaPipe (Hand Landmarker / Pose Landmarker)","abbr":"","aliases":["MediaPipe Hands","MediaPipe Pose","Hand Landmarker","Pose Landmarker","BlazePose"],"one_liner":"谷歌开源的端侧视觉工具，能从普通摄像头画面实时提取手和人体关键点。","explanation":"MediaPipe 是谷歌开源（Apache 2.0）的跨平台端侧机器学习框架，其中 MediaPipe Tasks 提供现成的视觉任务。和具身关系最近的有两个：Hand Landmarker 先用手掌检测模型找到手，再在裁出的区域回归 21 个手部关键点，输出图像坐标、以米为单位的世界坐标和左右手判断；Pose Landmarker 基于 BlazePose，输出人体 33 个关键点。它们在手机 CPU 上就能实时运行，支持移动端、Web 和 Python。因为只需一个普通 RGB 摄像头，常用来做低成本手势遥操作、把人手动作重定向到灵巧手，或给人类视频标关键点；对遮挡和复杂手势的三维精度有限，要求高时常换用 HaMeR 等三维手部重建模型。旧版 Solutions 接口已于 2023 年 3 月停止支持。","example":"dex-retargeting 的示例程序用 MediaPipe 从电脑摄像头实时检测人手关键点，再把它重定向成 Allegro 灵巧手的关节角，让仿真里的机械手跟着人手动。","related":["手部姿态估计","人体姿态估计","关键点检测","动作重定向","HaMeR","dex-retargeting"]},{"id":"markerless-motion-capture","category":"perception","sec":9,"tier":2,"sources":[{"title":"OpenCap: Human movement dynamics from smartphone videos (PLOS Computational Biology, 2023)","url":"https://journals.plos.org/ploscompbiol/article?id=10.1371/journal.pcbi.1011462"},{"title":"GVHMR: World-Grounded Human Motion Recovery via Gravity-View Coordinates (arXiv:2409.06662)","url":"https://arxiv.org/abs/2409.06662"}],"as_of":"","related_ids":["motion-capture","optical-motion-capture","human-pose-estimation","human-mesh-recovery","smpl","motion-retargeting"],"name":"无标记动捕","alt":"Markerless Motion Capture","abbr":"","aliases":["无标记点动作捕捉","视频动捕","视觉动捕"],"one_liner":"不在身上贴标记点，直接从普通视频里恢复人体三维动作。","explanation":"传统光学动捕要在人身上贴反光标记点，由多台红外相机跟踪，精度高但设备贵、只能在专门场地用。无标记动捕去掉标记点，靠人体姿态估计从一台或几台普通相机的视频里找出关节，再拟合成 3D 骨架或 SMPL 这类参数化人体模型。斯坦福 2023 年的 OpenCap 用两台以上 iPhone 录像，关节角平均误差约 4.5°；浙大的 GVHMR（SIGGRAPH Asia 2024）只用单目视频就能恢复世界坐标系下的人体运动。它在遮挡、快速动作和手指细节上仍不如光学动捕。对具身智能，它让大量人类视频能变成人形机器人的动作参考。","example":"用手机拍一段人跳舞的视频，经 GVHMR 恢复成世界坐标系下的 SMPL 动作序列，再重定向到人形机器人的关节上，作为强化学习运动跟踪的参考动作。","related":["动作捕捉","光学动捕","人体姿态估计","人体网格恢复","SMPL 人体模型","动作重定向"]},{"id":"smpl","category":"perception","sec":9,"tier":2,"sources":[{"title":"SMPL 官方项目页（Max Planck Institute for Intelligent Systems）","url":"https://smpl.is.tue.mpg.de/"},{"title":"Expressive Body Capture: 3D Hands, Face, and Body from a Single Image（SMPL-X，CVPR 2019）","url":"https://arxiv.org/abs/1904.05866"},{"title":"Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation（H2O）","url":"https://arxiv.org/abs/2403.04436"}],"as_of":"","related_ids":["mano","amass","motion-retargeting","human-mesh-recovery","human-pose-estimation","h2o"],"name":"SMPL 人体模型","alt":"Skinned Multi-Person Linear Model","abbr":"SMPL","aliases":["SMPL-X","SMPL+H","蒙皮多人线性模型"],"one_liner":"用少量形状和姿态参数生成三维人体网格的参数化人体模型。","explanation":"SMPL 是德国马普智能系统研究所 Michael Black 团队 2015 年发表的参数化人体模型，从数千个人体扫描中学出。给定形状参数 β（常用 10 维，管高矮胖瘦）和姿态参数 θ（23 个关节的旋转加全局朝向），就能生成一个 6890 个顶点的三角网格，关节弯曲时靠线性混合蒙皮和修正形变保持自然。2019 年的 SMPL-X 并入 MANO 手和 FLAME 脸，共 10475 个顶点。它是人体动作数据的通用格式：AMASS 把 15 个动捕数据集统一成 SMPL 参数，人形机器人做动作重定向也多从 SMPL 动作出发。模型仅限科研免费使用，商用需授权。","example":"H2O 先优化 SMPL 的形状参数，让人体骨架比例贴近宇树 H1，再把 AMASS 中约 1 万条 SMPL 动作重定向到 H1，用来训练全身动作跟踪策略。","related":["MANO 手部模型","AMASS 人体动捕数据集","动作重定向","人体网格恢复","人体姿态估计","H2O（人到人形）"]},{"id":"human-mesh-recovery","category":"perception","sec":9,"tier":3,"sources":[{"title":"arXiv 1712.06584: End-to-end Recovery of Human Shape and Pose（HMR, CVPR 2018）","url":"https://arxiv.org/abs/1712.06584"},{"title":"4D-Humans / HMR 2.0 项目主页（ICCV 2023）","url":"https://shubham-goel.github.io/4dhumans/"}],"as_of":"","related_ids":["smpl","gvhmr","hamer","human-pose-estimation","markerless-motion-capture","motion-retargeting"],"name":"人体网格恢复","alt":"Human Mesh Recovery","abbr":"HMR","aliases":["人体网格重建","3D 人体姿态与形状估计","Human Mesh Reconstruction"],"one_liner":"从图像或视频估计人体完整 3D 网格（姿态加体型）的任务。","explanation":"人体网格恢复指从 RGB 图像或视频中估计人的完整 3D 身体表面，而不只是十几个关节点。通常做法是回归 SMPL 这类参数化人体模型的参数：姿态参数描述各关节旋转，形状参数描述高矮胖瘦，代入模型就得到一个人体网格。这个名字来自 Kanazawa、Black、Malik 等人 CVPR 2018 的论文 HMR，它直接从图像像素回归 SMPL 参数，并用对抗判别器约束结果像真实人体。后续 HMR 2.0 / 4D-Humans 换成 ViT 骨干并加入跨帧跟踪，GVHMR 等方法进一步恢复人在世界坐标系里的运动轨迹，手部对应的方法有 HaMeR。在具身智能里，它是从人类视频获取全身动作、再重定向给人形机器人的关键一环。","example":"4D-Humans 能从一段多人视频里逐帧重建每个人的 SMPL 网格并跨帧跟踪身份，结果可交给动作重定向工具转成人形机器人的关节轨迹。","related":["SMPL 人体模型","GVHMR","HaMeR","人体姿态估计","无标记动捕","动作重定向"]},{"id":"gvhmr","category":"perception","sec":9,"tier":3,"sources":[{"title":"arXiv 2409.06662: World-Grounded Human Motion Recovery via Gravity-View Coordinates","url":"https://arxiv.org/abs/2409.06662"},{"title":"GVHMR 项目主页（ZJU3DV）","url":"https://zju3dv.github.io/gvhmr/"},{"title":"GMR: General Motion Retargeting（GitHub README）","url":"https://github.com/YanjieZe/GMR"}],"as_of":"2024-12","related_ids":["human-mesh-recovery","smpl","markerless-motion-capture-2","general-motion-retargeting","motion-retargeting","visual-odometry"],"name":"GVHMR","alt":"GVHMR: World-Grounded Human Motion Recovery via Gravity-View Coordinates","abbr":"","aliases":[],"one_liner":"从单目视频恢复人在世界坐标系里 3D 动作的方法。","explanation":"GVHMR 是浙江大学 ZJU3DV 团队发表于 SIGGRAPH Asia 2024 的方法：输入单目视频，输出 SMPL-X 人体参数（一种参数化人体模型）和人在世界坐标系里的运动轨迹。难点在于相机本身也在动，只在相机坐标系里估姿态，说不清人往哪走、身体是否竖直。它为每帧定义「重力-视角」坐标系：一根轴对齐重力，另一根参考相机视线，在其中预测人体朝向，再用视觉里程计或陀螺仪得到的相机相对旋转换回世界坐标。它逐帧并行预测，避免了 WHAM 这类自回归方法在长视频上的误差累积。具身领域常用它从网络视频里提取人体动作，再重定向给人形机器人。","example":"GMR 通用动作重定向工具支持先用 GVHMR 从一段单目视频里提取人体动作，再重定向到人形机器人上。","related":["人体网格恢复","SMPL 人体模型","视频动捕（无标记动捕）","GMR 通用动作重定向","动作重定向","视觉里程计"]},{"id":"hamer","category":"perception","sec":9,"tier":3,"sources":[{"title":"arXiv 2312.05251: Reconstructing Hands in 3D with Transformers","url":"https://arxiv.org/abs/2312.05251"},{"title":"HaMeR 项目主页","url":"https://geopavlakos.github.io/hamer/"},{"title":"OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation","url":"https://arxiv.org/html/2410.11792"}],"as_of":"2024-06","related_ids":["mano","hand-pose-estimation","wilor","human-mesh-recovery","okami","human-video-data"],"name":"HaMeR","alt":"HaMeR (Hand Mesh Recovery)","abbr":"","aliases":["Reconstructing Hands in 3D with Transformers"],"one_liner":"从单张 RGB 图像重建 3D 手部网格的 Transformer 模型。","explanation":"HaMeR 由 UC Berkeley、密歇根大学、纽约大学的研究者提出，发表于 CVPR 2024。它用 ViT-H 视觉 Transformer 作骨干，从图像中的手部区域回归 MANO 手部模型参数（MANO 用少量姿态和形状参数描述一只手的 3D 网格）以及相机参数。作者把 10 个带 2D 或 3D 手部标注的数据集合并成约 270 万个训练样本，还从 Ego4D 等视频里标注了 HInt 评测集，专门考察真实场景中的手。它是单帧方法，但用在视频上结果也比较平滑。在具身智能里，它是从人类视频提取手指姿态的常用工具，结果可重定向给灵巧手或夹爪，作为模仿学习的动作来源。","example":"OKAMI 从一段人类演示视频教人形机器人做操作时，身体动作用 SLAHMR 重建，手部姿态则对每只手用 HaMeR 估计。","related":["MANO 手部模型","手部姿态估计","WiLoR","人体网格恢复","OKAMI","人类视频数据"]},{"id":"wilor","category":"perception","sec":9,"tier":3,"sources":[{"title":"WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild (arXiv)","url":"https://arxiv.org/abs/2409.12259"},{"title":"WiLoR 项目主页","url":"https://rolpotamias.github.io/WiLoR/"}],"as_of":"2025-03","related_ids":["mano","hand-pose-estimation","hamer","motion-retargeting","human-video-data","egocentric-video"],"name":"WiLoR","alt":"WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild","abbr":"","aliases":[],"one_liner":"从图像中快速找出多只手，并重建成三维手部网格","explanation":"WiLoR 是帝国理工学院与上海交通大学团队提出的三维手部重建方法，发表于 CVPR 2025。它分两步：先用实时的全卷积网络在图里检测出所有手，再用基于 Vision Transformer 的重建网络，对每只手由粗到精地回归 MANO 参数（一种用少量参数描述手形和手势的参数化手模型）和相机参数，得到三维手部网格。作者还整理了超过 200 万张野外手部图像的数据集 WHIM。不加任何时序模块，它就能从单目视频逐帧得到较平滑的手部跟踪；代码、模型和数据均已开源。在具身智能里，可用它从人类视频中提取手的三维姿态，再重定向到灵巧手上作为模仿学习数据。","example":"把一段人类叠衣服的第一人称视频逐帧送入 WiLoR，得到每帧双手的 MANO 姿态和指尖三维位置，再重定向成灵巧手的关节目标。","related":["MANO 手部模型","手部姿态估计","HaMeR","动作重定向","人类视频数据","第一人称视频"]},{"id":"hand-object-interaction","category":"perception","sec":9,"tier":2,"sources":[{"title":"HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction (arXiv:2203.01577)","url":"https://arxiv.org/abs/2203.01577"},{"title":"DexYCB: A Benchmark for Capturing Hand Grasping of Objects (arXiv:2104.04631)","url":"https://arxiv.org/abs/2104.04631"}],"as_of":"","related_ids":["hand-pose-estimation","6d-object-pose-estimation","dexycb","hoi4d","arctic-a-dataset-for-dexterous-bimanual-hand-object-manipula","human-video-data"],"name":"手物交互","alt":"Hand-Object Interaction","abbr":"","aliases":["手-物交互","手与物体交互","HOI（手物交互）"],"one_liner":"研究人手怎样接触、抓握和操作物体，包括估计手和物体的三维姿态与接触。","explanation":"手物交互是视觉和机器人领域专门研究「人手如何接触、抓握和摆弄物体」的方向，比泛指全身的人-物交互更聚焦在手上。典型任务有：同时估计手的姿态（常用 MANO 网格）和物体的 6D 位姿、推断接触区域和抓握类型、识别手在做什么动作，以及生成合理的抓握。代表数据集有 DexYCB（CVPR 2021，标注手抓 YCB 物体时的 MANO 手姿和物体 6D 位姿）、HOI4D（CVPR 2022，240 万帧第一人称 RGB-D 视频，16 类物体共 800 个实例）、ARCTIC、OakInk 等。对机器人来说，人手是现成的灵巧操作示范：从人类视频里提取手和物体的轨迹，可以转成灵巧手动作或抓取目标；DexYCB 还专门面向人把物体递给机器人的交接场景。","example":"从一段第一人称做饭视频里，用 HaMeR 重建手的三维姿态、用 FoundationPose 跟踪锅铲位姿，得到手握铲柄的位置和翻炒轨迹，再重定向成灵巧手的示范数据。","related":["手部姿态估计","6D位姿估计","DexYCB 数据集","HOI4D 数据集","ARCTIC 数据集","人类视频数据"]},{"id":"gesture-recognition","category":"perception","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Gesture recognition","url":"https://en.wikipedia.org/wiki/Gesture_recognition"},{"title":"MediaPipe Gesture Recognizer 官方文档","url":"https://developers.google.com/edge/mediapipe/solutions/vision/gesture_recognizer"}],"as_of":"","related_ids":["hand-pose-estimation","human-robot-interaction","keypoint-detection","mediapipe","data-glove","teleoperation"],"name":"手势识别","alt":"Gesture Recognition","abbr":"","aliases":["手势检测","Hand Gesture Recognition"],"one_liner":"让机器从图像或传感器信号里认出人做的手势并理解其含义","explanation":"计算机视觉和人机交互里的一个任务：从普通相机、深度相机、数据手套或肌电信号中识别人的手势（如握拳、竖大拇指、指向某处）。静态手势只看某一时刻的手形，动态手势要看一段动作轨迹（如挥手）。现在常见的做法是先检测手部关键点，再根据关键点分类。它和手部姿态估计的区别是：后者恢复完整的三维手形，手势识别只输出类别。在具身智能里，手势识别用于人机交互，比如用手势让机器人停下、跟随或去拿指向的物体；遥操作系统也会把特定手势映射成控制命令，如张合夹爪、切换模式。","example":"谷歌 MediaPipe Gesture Recognizer 默认能识别握拳、张开手掌、竖起食指、拇指向上、拇指向下、比 V 等手势，同时输出手部关键点，可以用来实现「张开手掌让机器人停下」。","related":["手部姿态估计","人机交互","关键点检测","MediaPipe（手部/人体关键点）","数据手套","遥操作"]},{"id":"eye-tracking-gaze-estimation","category":"perception","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Eye tracking","url":"https://en.wikipedia.org/wiki/Eye_tracking"},{"title":"Gaze-based dual resolution deep imitation learning for high-precision dexterous robot manipulation (RA-L 2021)","url":"https://arxiv.org/abs/2102.01295"},{"title":"Project Aria Gen 1 hardware specifications","url":"https://facebookresearch.github.io/projectaria_tools/docs/tech_spec/hardware_spec"}],"as_of":"","related_ids":["egocentric-video","project-aria-glasses","human-robot-interaction","intent-understanding","imitation-learning","active-perception"],"name":"眼动追踪 / 注视估计","alt":"Eye Tracking / Gaze Estimation","abbr":"","aliases":["视线追踪","视线估计","注视点估计","Gaze Tracking"],"one_liner":"测量人眼转动，并估计这个人此刻正在看哪里。","explanation":"眼动追踪测量眼球相对头部的运动，注视估计则进一步算出视线落点，也就是人在看哪里。主流方法是用红外光照射眼睛，用相机同时拍下瞳孔中心和角膜上的反光点，由两者的相对位置推算视线方向；另一类方法用神经网络直接从普通图像回归视线。在具身智能里它主要有两种用途：一是采集示教数据时记录示教者的注视点，作为「该关注画面哪里」的额外信号，帮助策略把计算集中在关键区域；二是在人机交互中判断人的意图和注意对象。Meta 的 Project Aria 眼镜等头戴设备内置眼动追踪相机，采第一人称数据时可以一并录下注视信息。","example":"Kim 等人（RA-L 2021）在遥操作时记录操作者注视点，训练出的策略在注视点附近用高分辨率图像、在周边用低分辨率图像，完成了机器人穿针这类高精度任务。","related":["第一人称视频","Project Aria 眼镜","人机交互","意图理解（隐式指令）","模仿学习","主动感知"]},{"id":"microphone-array","category":"perception","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Microphone array","url":"https://en.wikipedia.org/wiki/Microphone_array"},{"title":"Unitree G1 产品页（规格表：4 Microphone Array）","url":"https://www.unitree.com/g1"}],"as_of":"2026-09","related_ids":["automatic-speech-recognition","audio-visual-navigation","multimodal-perception","human-robot-interaction","multi-sensor-fusion","contact-microphone"],"name":"麦克风阵列","alt":"Microphone Array","abbr":"","aliases":["声源定位","多麦阵列","Sound Source Localization","波束成形","Beamforming"],"one_liner":"多个麦克风按固定几何排布协同工作，用来定向拾音、判断声音从哪来。","explanation":"麦克风阵列是把多个麦克风按已知的几何位置（线形、环形等）排在一起，同时采集、联合处理信号。声音到达各个麦克风的时间有细微差别，据此可以估计声源方向（声源定位，也叫到达方向 DOA 估计）；对各路信号做延时加权合成，就能只增强某个方向的声音、压低其他方向的噪声，这叫波束成形。单个麦克风做不到这两件事。它广泛用于电话、智能音箱、助听器和语音识别前端。对机器人来说，麦克风阵列让它在嘈杂环境里听清指令、判断说话人在哪并转头看过去，也是视听导航这类「听声找目标」研究的硬件基础。不少人形机器人把它当标准配置，例如宇树 G1 的规格表写明配有 4 麦克风阵列。","example":"用户在客厅另一头喊机器人的名字，机器人用麦克风阵列估出声源方位后转身朝向用户，再用波束成形增强这个方向的语音，送去做语音识别。","related":["语音识别","视听导航","多模态感知","人机交互","多传感器融合","接触式麦克风（音频触觉）"]},{"id":"automatic-speech-recognition","category":"perception","sec":9,"tier":3,"sources":[{"title":"Robust Speech Recognition via Large-Scale Weak Supervision (Whisper, arXiv:2212.04356)","url":"https://arxiv.org/abs/2212.04356"},{"title":"Wikipedia: Speech recognition","url":"https://en.wikipedia.org/wiki/Speech_recognition"}],"as_of":"","related_ids":["microphone-array","large-language-model","instruction-following","human-robot-interaction","native-multimodal","vision-language-action-model"],"name":"语音识别","alt":"Automatic Speech Recognition","abbr":"ASR","aliases":["自动语音识别","语音转文字","Speech-to-Text","STT"],"one_liner":"把人说的话自动转成文字，是机器人听懂口头指令的第一步。","explanation":"语音识别是把语音信号转换成文字的技术，也叫语音转文字（STT）。常用评测指标是词错误率 WER，即（替换数＋删除数＋插入数）除以参考词数，中文一般按字计算，称字错误率 CER。近年的代表模型是 OpenAI 2022 年发布的 Whisper，用 68 万小时弱监督的多语种音频训练，在多个标准基准上不经微调就接近有监督方法的成绩，模型和推理代码都已开源。在具身智能系统里，语音识别通常是交互链路的入口：麦克风阵列拾音、降噪后交给 ASR 转成文字，再送进大语言模型或 VLA 生成计划和动作，最后用语音合成（TTS）回话。也有原生多模态模型直接输入音频、不经过文字中转。机器人上还要应对电机噪声、远场拾音等问题。","example":"用户说「把桌上的红杯子递给我」，Whisper 之类的 ASR 模型先把它转成文字，再作为语言指令交给 VLA 模型执行。","related":["麦克风阵列","大语言模型","指令跟随","人机交互","原生多模态","视觉-语言-动作模型"]},{"id":"state-estimation","category":"perception","sec":10,"tier":2,"sources":[{"title":"Timothy Barfoot 主页：State Estimation for Robotics（第二版 2024，含免费 PDF 与中译本信息）","url":"https://asrl.utias.utoronto.ca/~tdb/"},{"title":"Contact-Aided Invariant Extended Kalman Filtering for Legged Robot State Estimation (RSS 2018)","url":"https://arxiv.org/abs/1805.10410"}],"as_of":"","related_ids":["kalman-filter","invariant-extended-kalman-filter","leg-odometry","inertial-measurement-unit","proprioception","learned-state-estimator"],"name":"状态估计","alt":"State Estimation","abbr":"","aliases":["机器人状态估计","位姿与速度估计"],"one_liner":"用带噪声的传感器读数，推算机器人此刻的位置、姿态和速度。","explanation":"状态估计是根据传感器测量和运动模型，推断不能直接读出的状态量，如机身位姿、速度和传感器零偏。各种传感器都有噪声和漂移，要按可信度融合，常用卡尔曼滤波家族、粒子滤波或因子图优化。以腿足机器人为例：IMU 测角速度和加速度，关节编码器配合腿部运动学算出脚相对机身的位置，再假设支撑脚不打滑，就能估出机身速度；密歇根大学 2018 年的接触辅助不变 EKF 在 Cassie 双足上验证了这种做法。强化学习运控策略需要的机身线速度就来自状态估计器，也有工作直接用神经网络学它。","example":"四足机器人盲走时，把 IMU 读数、各关节角和足端触地状态送入扩展卡尔曼滤波，每个控制周期输出机身姿态和线速度，供运控策略使用。","related":["卡尔曼滤波","不变扩展卡尔曼滤波","腿式里程计","惯性测量单元","本体感知","学习型状态估计器"]},{"id":"multi-sensor-fusion","category":"perception","sec":10,"tier":2,"sources":[{"title":"Wikipedia: Sensor fusion","url":"https://en.wikipedia.org/wiki/Sensor_fusion"},{"title":"ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial and Multi-Map SLAM (arXiv 2007.11898)","url":"https://arxiv.org/abs/2007.11898"}],"as_of":"","related_ids":["multimodal-perception","kalman-filter","extended-kalman-filter","tightly-coupled-vs-loosely-coupled-fusion","visual-inertial-odometry","multi-sensor-time-synchronization"],"name":"多传感器融合","alt":"Multi-Sensor Fusion","abbr":"","aliases":["传感器融合","Sensor Fusion","前融合 / 后融合","数据级 / 特征级 / 决策级融合"],"one_liner":"把相机、激光雷达、IMU 等多个传感器的数据合起来，得到更准更稳的估计。","explanation":"多传感器融合是把相机、激光雷达、IMU（惯性测量单元，测加速度和角速度）、关节编码器、触觉等多个传感器的数据合在一起估计同一件事，使结果的不确定性比单用任何一个都小。按合并发生的阶段，常分为数据级（前融合，直接合并原始数据）、特征级（各自提特征后再合并）和决策级（后融合，各自给出结果再投票或加权）。经典做法是卡尔曼滤波一类的概率估计，现在也常用神经网络直接学怎么融合。它重要是因为每种传感器都有盲区：相机怕暗和反光，IMU 会漂移，激光雷达看不出颜色。机器人状态估计、SLAM、自动驾驶感知都靠它，前提是各传感器已做好标定和时间同步。","example":"四足机器人估计自身速度：IMU 提供高频的加速度和角速度，关节编码器配合足端触地判断算出腿式里程计，两者用扩展卡尔曼滤波合并，减少单用任一来源时的漂移。","related":["多模态感知","卡尔曼滤波","扩展卡尔曼滤波","紧耦合 / 松耦合融合","视觉惯性里程计","多传感器时间同步"]},{"id":"wheel-odometry","category":"perception","sec":10,"tier":2,"sources":[{"title":"Wikipedia: Odometry","url":"https://en.wikipedia.org/wiki/Odometry"},{"title":"ros2_controllers: diff_drive_controller user documentation","url":"https://control.ros.org/rolling/doc/ros2_controllers/diff_drive_controller/doc/userdoc.html"}],"as_of":"","related_ids":["rotary-encoder","differential-drive-kinematics","visual-odometry","leg-odometry","extended-kalman-filter","slip"],"name":"轮式里程计","alt":"Wheel Odometry","abbr":"","aliases":["车轮里程计","编码器里程计","Wheel Encoder Odometry"],"one_liner":"数轮子转了多少，推算机器人走了多远、转了多少角度。","explanation":"轮式里程计是最基础的相对定位方法：在驱动轮上装编码器，读出每个轮子转过的角度，乘以轮子半径得到行驶距离；对差速底盘，再用左右轮距离之差除以轮距算出车身转过的角度，逐帧累加就得到机器人相对出发点的位姿。它便宜、频率高、不受光照影响，几乎所有轮式底盘都自带。缺点是误差只增不减：轮子打滑、地面不平、轮径标定不准都会让估计越跑越偏（漂移），所以通常和 IMU、激光雷达或视觉里程计融合（如用扩展卡尔曼滤波），再由 SLAM 或定位算法纠偏。ROS 2 的 diff_drive_controller 就是根据左右轮反馈计算并发布 odom 话题。","example":"差速小车轮距 0.4 米，某段时间左轮走了 1.0 米、右轮走了 1.2 米：车身中心前进约 1.1 米，同时向左转 (1.2−1.0)/0.4 = 0.5 弧度，约 29°。","related":["编码器","差速驱动运动学","视觉里程计","腿式里程计","扩展卡尔曼滤波","打滑"]},{"id":"leg-odometry","category":"perception","sec":10,"tier":3,"sources":[{"title":"State Estimation for Legged Robots - Consistent Fusion of Leg Kinematics and IMU (Bloesch et al., RSS 2012)","url":"https://www.roboticsproceedings.org/rss08/p03.html"},{"title":"Contact-Aided Invariant Extended Kalman Filtering for Robot State Estimation (arXiv 1904.09251)","url":"https://arxiv.org/abs/1904.09251"},{"title":"MIT Cheetah-Software: PositionVelocityEstimator.h","url":"https://github.com/mit-biomimetics/Cheetah-Software/blob/master/common/include/Controllers/PositionVelocityEstimator.h"}],"as_of":"","related_ids":["state-estimation","proprioception","contact-estimation","extended-kalman-filter","invariant-extended-kalman-filter","wheel-odometry"],"name":"腿式里程计","alt":"Leg Odometry (Proprioceptive Odometry)","abbr":"","aliases":["腿足里程计","本体感知里程计","运动学里程计","Kinematic Odometry"],"one_liner":"靠关节编码器、IMU 和触地判断，推算足式机器人走了多远、朝哪走。","explanation":"腿式里程计是足式机器人只用自身传感器（本体感知）估计机身位置和速度的方法。基本思路：支撑腿的脚踩在地上不动，用关节编码器读数和正运动学算出脚相对机身的位置，就能反推机身怎么移动；再与 IMU 的加速度和角速度融合，通常用卡尔曼滤波一类方法。ETH 的 Bloesch 等人在 RSS 2012 提出把落脚点位置也放进扩展卡尔曼滤波状态里，不需要对地形做假设，并在四足机器人上验证；后来的不变扩展卡尔曼滤波在 Cassie 双足上收敛更稳。它不受光照和纹理影响、频率高，是运动控制的基础输入；但脚打滑或触地判断出错会引入误差，长时间会漂移，常结合视觉或激光里程计修正。","example":"MIT Cheetah 3 和 Mini Cheetah 开源代码里的 LinearKFPositionVelocityEstimator 用线性卡尔曼滤波估计机身位置和速度，以 IMU 做预测，以腿部运动学算出的足端位置和速度做观测。","related":["状态估计","本体感知","接触估计","扩展卡尔曼滤波","不变扩展卡尔曼滤波","轮式里程计"]},{"id":"learned-state-estimator","category":"perception","sec":10,"tier":3,"sources":[{"title":"Concurrent Training of a Control Policy and a State Estimator for Dynamic and Robust Legged Locomotion (Ji et al., RA-L 2022, arXiv 2202.05481)","url":"https://arxiv.org/abs/2202.05481"}],"as_of":"","related_ids":["state-estimation","rl-based-locomotion-control","privileged-information","leg-odometry","dreamwaq","him"],"name":"学习型状态估计器","alt":"Learned State Estimator (Concurrent Estimator Network)","abbr":"","aliases":["状态估计网络","估计器网络","Estimator Network","策略与估计器联合训练"],"one_liner":"用神经网络从关节和 IMU 数据估出机身速度等量，常与运控策略一起训练。","explanation":"学习型状态估计器指用神经网络代替或补充卡尔曼滤波，从本体感知数据（关节角、关节速度、IMU 读数的历史）直接回归难以直接测到的状态。代表工作是韩国 KAIST Hwangbo 团队 2022 年发表于 RA-L 的论文：在仿真里同时训练控制策略和估计网络，策略用 PPO 强化学习，估计器用仿真真值做监督学习，估出机身线速度、足端高度和触地概率，再作为策略的输入。这样不需要预设步态，也不需要足底接触传感器，估计器在训练中见过大量随机化的打滑、崎岖场景。论文中四足机器人平地最高速度 3.75 m/s，在摩擦系数 0.22 的湿滑面上达到 3.54 m/s。后续不少足式强化学习运控工作沿用了类似的估计网络。","example":"Ji 等人的系统在真机上：估计网络先由本体感知历史估出机身线速度、足端高度和触地概率，策略网络再据此输出期望关节位置，在山坡、湿滑板和颠簸路面上完成了高速行走。","related":["状态估计","强化学习运控","特权信息","腿式里程计","DreamWaQ","HIM（混合内部模型）"]},{"id":"visual-odometry","category":"perception","sec":10,"tier":2,"sources":[{"title":"Scaramuzza & Fraundorfer, Visual Odometry Part I: The First 30 Years and Fundamentals (IEEE RAM 2011)","url":"https://rpg.ifi.uzh.ch/docs/VO_Part_I_Scaramuzza.pdf"},{"title":"Wikipedia: Visual odometry","url":"https://en.wikipedia.org/wiki/Visual_odometry"}],"as_of":"","related_ids":["visual-inertial-odometry","visual-slam","simultaneous-localization-and-mapping","loop-closure-detection","feature-points","wheel-odometry"],"name":"视觉里程计","alt":"Visual Odometry","abbr":"VO","aliases":["视觉测程"],"one_liner":"比较相邻帧图像，逐帧推算相机走了多远、转了多少。","explanation":"视觉里程计用一台或多台相机连续拍摄的图像，逐帧估计相机的相对运动，再累加成轨迹。这个名字由 Nistér 等人 2004 年提出，借自轮式里程计（累加车轮转数估位移）；它不受车轮打滑影响，NASA 的两台火星探测车就用过。做法分两类：特征点法提取特征并跨帧匹配，直接法用像素亮度误差求运动。单目只能恢复比例未知的轨迹，双目或加 IMU（即视觉惯性里程计）才有真实尺度。它只管相邻帧的局部跟踪，误差越积越大形成漂移；加上回环检测和全局优化，就构成视觉 SLAM。","example":"四足机器人在走廊里前进，前视双目相机每帧匹配特征点，估出相对上一帧前进了多少、转了多少度并累加成轨迹；绕一大圈回到起点时，估计的终点往往和起点对不上，这就是漂移。","related":["视觉惯性里程计","视觉SLAM","同步定位与建图","回环检测","特征点","轮式里程计"]},{"id":"simultaneous-localization-and-mapping","category":"perception","sec":10,"tier":1,"sources":[{"title":"Wikipedia: Simultaneous localization and mapping","url":"https://en.wikipedia.org/wiki/Simultaneous_localization_and_mapping"},{"title":"Cartographer documentation","url":"https://google-cartographer.readthedocs.io/en/latest/"},{"title":"Durrant-Whyte & Bailey, Simultaneous Localisation and Mapping (SLAM): Part I (IEEE RAM 2006)，含 SLAM 缩写 1995 年在 ISRR 提出的说明","url":"https://people.eecs.berkeley.edu/~pabbeel/cs287-fa09/readings/Durrant-Whyte_Bailey_SLAM-tutorial-I.pdf"}],"as_of":"","related_ids":["visual-slam","lidar-slam","loop-closure-detection","visual-inertial-odometry","occupancy-grid-map","adaptive-monte-carlo-localization"],"name":"同步定位与建图","alt":"Simultaneous Localization and Mapping","abbr":"SLAM","aliases":["SLAM 建图定位","同时定位与地图构建","即时定位与地图构建"],"one_liner":"机器人在陌生环境里一边画地图、一边算出自己在地图上的位置。","explanation":"同步定位与建图指机器人进入未知环境时，同时构建地图并估计自己在图中的位姿。难点是两件事互相依赖：定位要有地图，建图又要先知道自己在哪。源头可追溯到 Smith 和 Cheeseman 1986 年关于空间不确定性的工作和 Durrant-Whyte 团队 90 年代初的研究，SLAM 这个缩写则是 1995 年在国际机器人研究研讨会（ISRR）的一篇综述论文里首次提出。经典解法有扩展卡尔曼滤波、粒子滤波和图优化；按传感器分激光 SLAM、视觉 SLAM 等，开源实现有谷歌 Cartographer、ORB-SLAM3。扫地机和仓储自主移动机器人（AMR）的导航、AR 头显的空间定位，很多都靠它。","example":"扫地机第一次进新家，一边走一边用激光雷达扫出户型图，同时实时算出自己在图上的坐标，之后的清扫就按这张图规划路线。","related":["视觉SLAM","激光SLAM","回环检测","视觉惯性里程计","占据栅格地图","AMCL 自适应蒙特卡洛定位"]},{"id":"slam-front-end-back-end","category":"perception","sec":10,"tier":3,"sources":[{"title":"Past, Present, and Future of Simultaneous Localization And Mapping (Cadena et al., arXiv)","url":"https://arxiv.org/abs/1606.05830"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","visual-odometry","factor-graph-optimization","bundle-adjustment","loop-closure-detection","orb-slam3"],"name":"SLAM 前端 / 后端","alt":"SLAM Front-end / Back-end","abbr":"","aliases":["前端里程计","后端优化"],"one_liner":"SLAM 系统的两段分工：前端处理传感器数据估运动，后端全局优化纠误差。","explanation":"同步定位与建图（SLAM）通常拆成两部分。前端直接处理传感器数据：提取和匹配特征点、跟踪相邻帧、估计相机或机器人的相对运动，并做数据关联（判断哪些观测对应同一个地图点）和回环检测候选。后端拿到前端给出的约束，用因子图优化、光束法平差或滤波方法（如卡尔曼滤波）做全局估计，把累积漂移摊平、保证地图一致。这个划分由 Cadena 等人 2016 年的 SLAM 综述系统总结。读 ORB-SLAM3、VINS、FAST-LIO 这类代码时，先分清哪部分是前端、哪部分是后端，会好理解得多。","example":"ORB-SLAM3 里提取 ORB 特征做帧间跟踪属于前端，局部与全局光束法平差属于后端。","related":["同步定位与建图","视觉里程计","因子图优化","光束法平差","回环检测","ORB-SLAM3"]},{"id":"loop-closure-detection","category":"perception","sec":10,"tier":3,"sources":[{"title":"Wikipedia: Simultaneous localization and mapping（Loop closure 一节）","url":"https://en.wikipedia.org/wiki/Simultaneous_localization_and_mapping"},{"title":"GitHub: dorian3d/DBoW2","url":"https://github.com/dorian3d/DBoW2"},{"title":"GitHub: gisbi-kim/scancontext (Scan Context, IROS 2018)","url":"https://github.com/gisbi-kim/scancontext"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","visual-place-recognition","relocalization","factor-graph-optimization","iterative-closest-point","slam-front-end-back-end"],"name":"回环检测","alt":"Loop Closure Detection","abbr":"","aliases":["闭环检测","Loop Closure","回环","地点识别"],"one_liner":"让机器人认出自己回到了到过的地方，用来消除 SLAM 的累积漂移。","explanation":"回环检测是 SLAM（同步定位与建图）中的一个环节：判断机器人当前看到的场景是不是以前到过的地方。里程计每一步都有小误差，走得越远累积漂移越大，绕一圈回到起点时地图会对不上。一旦确认回到了老地方，就在两次位姿之间加一条约束，交给后端的位姿图或因子图优化，把整条轨迹和地图拉回一致。视觉 SLAM 常用词袋模型比较图像特征，如 ORB-SLAM 系列所用的 DBoW2；激光 SLAM 常用 Scan Context 这类点云全局描述子找候选，再用 ICP 精确对齐。误检代价很大，一次错误回环可能让整张地图扭曲，所以通常还要做几何一致性校验。","example":"DBoW2 把图像的 ORB 或 BRIEF 特征转成词袋向量；据其 README，处理 BRIEF 特征每张图约 3 毫秒，可在数万张图的数据库里检索可能的回环候选。","related":["同步定位与建图","视觉位置识别","重定位","因子图优化","迭代最近点","SLAM 前端 / 后端"]},{"id":"visual-place-recognition","category":"perception","sec":10,"tier":3,"sources":[{"title":"Where is your place, Visual Place Recognition? (Garg et al., IJCAI 2021)","url":"https://arxiv.org/abs/2103.06443"},{"title":"NetVLAD: CNN architecture for weakly supervised place recognition (CVPR 2016)","url":"https://arxiv.org/abs/1511.07247"}],"as_of":"","related_ids":["loop-closure-detection","relocalization","visual-slam","topological-map","feature-matching","navigation"],"name":"视觉位置识别","alt":"Visual Place Recognition","abbr":"VPR","aliases":["视觉地点识别","地点识别"],"one_liner":"看一张图，判断这是哪个地方、之前是否来过","explanation":"视觉位置识别（VPR）指给定一张当前拍到的图像，从事先存好的、带位置信息的图像库里找出它拍的是哪个地方，本质上是一个图像检索问题。难点在于同一地点会因光照、季节、昼夜和拍摄视角不同而看起来差别很大。常见做法是把图像的局部特征聚合成一个全局描述向量再比对相似度，CVPR 2016 的 NetVLAD 用可训练的聚合层和谷歌街景不同年份的图像做弱监督训练，是常用基线。在机器人里，VPR 主要服务于 SLAM 的回环检测和跟丢后的重定位（重新确定自己在地图里的位置），也用于基于拓扑地图的导航。","example":"扫地机器人被人抱到另一个房间放下后，拿当前画面和建图时存下的关键帧逐一比对，找到最像的那一帧，从而知道自己在哪个房间。","related":["回环检测","重定位","视觉SLAM","拓扑地图","特征匹配","导航"]},{"id":"relocalization","category":"perception","sec":10,"tier":3,"sources":[{"title":"ORB-SLAM: a Versatile and Accurate Monocular SLAM System (arXiv 1502.00956)","url":"https://arxiv.org/abs/1502.00956"},{"title":"PoseNet: A Convolutional Network for Real-Time 6-DOF Camera Relocalization (arXiv 1505.07427)","url":"https://arxiv.org/abs/1505.07427"},{"title":"UZ-SLAMLab/ORB_SLAM3 (GitHub)","url":"https://github.com/UZ-SLAMLab/ORB_SLAM3"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","loop-closure-detection","visual-place-recognition","perspective-n-point","random-sample-consensus","adaptive-monte-carlo-localization"],"name":"重定位","alt":"Relocalization","abbr":"","aliases":["重新定位","相机重定位","Camera Relocalization"],"one_liner":"机器人跟丢或重启后，在已有地图里重新确定自己在哪、朝哪。","explanation":"重定位是 SLAM（同步定位与建图）和视觉定位中的一个环节：当跟踪因快速运动、遮挡或光照变化而丢失，或者机器人重启、被人搬到别处（所谓「绑架」问题）时，系统只凭当前观测，在已建好的地图里找回自己的位姿。经典做法如 ORB-SLAM：用词袋模型（DBoW2）检索与当前图像最相似的关键帧，做特征匹配，再用 PnP 加 RANSAC 解出相机位姿。学习方法中，2015 年剑桥大学的 PoseNet 首次用卷积网络直接从单张图像回归 6 自由度相机位姿。它与回环检测所用技术相近，区别在于回环检测用来修正累积误差，重定位用来找回丢失的位置。","example":"扫地机器人被人抱到另一个房间放下后，对比当前画面和已存地图，重新确定位置后继续清扫。","related":["同步定位与建图","回环检测","视觉位置识别","PnP（透视n点）","随机采样一致性","自适应蒙特卡洛定位"]},{"id":"visual-slam","category":"perception","sec":10,"tier":2,"sources":[{"title":"MathWorks: What Is SLAM (Simultaneous Localization and Mapping)?","url":"https://www.mathworks.com/discovery/slam.html"},{"title":"ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial and Multi-Map SLAM (arXiv 2007.11898)","url":"https://arxiv.org/abs/2007.11898"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","visual-odometry","visual-inertial-odometry","loop-closure-detection","orb-slam3","absolute-trajectory-error-relative-pose-error"],"name":"视觉SLAM","alt":"Visual SLAM","abbr":"vSLAM","aliases":["VSLAM","视觉同步定位与建图"],"one_liner":"只靠相机，边估计自己在哪、边把周围环境建成地图。","explanation":"视觉SLAM 是同步定位与建图（SLAM）里以相机为主要传感器的一类，相机可以是单目、双目或 RGB-D 深度相机，常再融合 IMU（惯性测量单元）。系统一般分前端和后端：前端从图像提特征点、跨帧匹配，估计相机运动（这部分也叫视觉里程计）；后端用图优化或光束法平差压低累计误差，并靠回环检测（认出回到了去过的地方）消除漂移。相机便宜、信息量大，但单目看不出绝对尺度，弱纹理、反光和快速运动也容易跟丢。开源代表有支持单目、双目、RGB-D 和视觉惯性的 ORB-SLAM3，以及基于学习的 DROID-SLAM；移动机器人、AR 眼镜和无人机的定位导航常用它。","example":"ORB-SLAM3 论文报告：在无人机数据集 EuRoC 上用双目加 IMU 运行，估计轨迹的平均误差约 3.6 厘米；输入是图像序列，输出是每帧相机位姿和一张稀疏的地图点云。","related":["同步定位与建图","视觉里程计","视觉惯性里程计","回环检测","ORB-SLAM3","ATE / RPE（绝对 / 相对轨迹误差）"]},{"id":"orb-slam3","category":"perception","sec":10,"tier":2,"sources":[{"title":"ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial and Multi-Map SLAM (IEEE T-RO 2021)","url":"https://arxiv.org/abs/2007.11898"},{"title":"GitHub: UZ-SLAMLab/ORB_SLAM3","url":"https://github.com/UZ-SLAMLab/ORB_SLAM3"}],"as_of":"2021-12","related_ids":["simultaneous-localization-and-mapping","visual-slam","visual-inertial-odometry","feature-points","loop-closure-detection","bundle-adjustment"],"name":"ORB-SLAM3","alt":"ORB-SLAM3","abbr":"","aliases":["ORB_SLAM3","ORB-SLAM 系列"],"one_liner":"萨拉戈萨大学开源的经典视觉 SLAM 系统，支持单目、双目、RGB-D 和 IMU。","explanation":"ORB-SLAM3 是西班牙萨拉戈萨大学 Tardós、Montiel 团队开源的 SLAM（同步定位与建图）库，论文 2021 年发表于 IEEE T-RO。它用 ORB 特征点（一种计算很快的角点特征）做跟踪和建图，支持单目、双目、RGB-D 相机和针孔、鱼眼镜头，并能与 IMU 紧耦合。多地图系统 Atlas 让它跟丢后开新地图，回到旧区域时再自动合并。论文报告双目加 IMU 在 EuRoC 无人机数据集上平均误差 3.6 厘米。代码以 GPLv3 开源，常被当作视觉 SLAM 的基线和入门教材；它建的是稀疏特征点地图，不能直接拿来避障，在弱纹理、光照剧变场景下也有特征点方法共同的跟丢问题。","example":"在装有带 IMU 深度相机（如 RealSense D435i）的移动机器人上跑 ORB-SLAM3 的双目加 IMU 或 RGB-D 模式，实时输出相机轨迹，作为导航或数据采集时的位姿来源。","related":["同步定位与建图","视觉SLAM","视觉惯性里程计","特征点","回环检测","光束法平差"]},{"id":"lidar-slam","category":"perception","sec":10,"tier":2,"sources":[{"title":"LOAM: Lidar Odometry and Mapping in Real-time (RSS 2014)","url":"https://www.roboticsproceedings.org/rss10/p07.html"},{"title":"FAST-LIO2: Fast Direct LiDAR-inertial Odometry (arXiv:2107.06829)","url":"https://arxiv.org/abs/2107.06829"},{"title":"Cartographer 官方文档","url":"https://google-cartographer.readthedocs.io/en/latest/"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","lidar","lidar-inertial-odometry","fast-lio2","visual-slam","loop-closure-detection"],"name":"激光SLAM","alt":"LiDAR SLAM","abbr":"","aliases":["激光雷达 SLAM"],"one_liner":"用激光雷达扫描的点云，一边给机器人定位，一边建环境地图。","explanation":"激光 SLAM 是以激光雷达为主传感器的同步定位与建图：机器人边走边把每帧点云和已有地图对齐，推算自己的位置，同时把新点云拼进地图。激光雷达直接测距、不怕暗光，在大场景和暗处比视觉 SLAM 稳，但拿不到颜色纹理。2D 方案多见于扫地机和仓储 AGV，谷歌开源的 Cartographer 同时支持 2D 和 3D；3D 方面，卡内基梅隆 2014 年的 LOAM 把问题拆成高频里程计和低频建图，港大 MARS 实验室的 FAST-LIO2 再融合 IMU，最高能以 100 Hz 运行，也适配视场小的固态雷达。","example":"四足机器人背上装一个 3D 激光雷达，遥控它在园区走一圈，用 FAST-LIO2 建出点云地图；之后自主导航时，把实时点云和这张地图配准就知道自己在哪。","related":["同步定位与建图","激光雷达","激光惯性里程计","FAST-LIO / FAST-LIO2","视觉SLAM","回环检测"]},{"id":"loam","category":"perception","sec":10,"tier":3,"sources":[{"title":"LOAM: Lidar Odometry and Mapping in Real-time (Zhang & Singh, RSS 2014)","url":"https://www.roboticsproceedings.org/rss10/p07.html"},{"title":"GitHub: RobustFieldAutonomyLab/LeGO-LOAM","url":"https://github.com/RobustFieldAutonomyLab/LeGO-LOAM"}],"as_of":"","related_ids":["lidar-slam","lio-sam","lidar-inertial-odometry","iterative-closest-point","loop-closure-detection","fast-lio2"],"name":"LOAM 系列激光里程计","alt":"LOAM (LiDAR Odometry and Mapping) / LeGO-LOAM","abbr":"","aliases":["LOAM","LeGO-LOAM","A-LOAM","激光里程计与建图"],"one_liner":"把激光 SLAM 拆成高频里程计和低频建图的经典方法，及其轻量化变体。","explanation":"LOAM 是卡内基梅隆大学 Ji Zhang 和 Sanjiv Singh 在 RSS 2014 提出的激光里程计与建图方法。核心是拆成两个频率相差约一个数量级的部分：里程计高频、粗略地估计雷达运动，建图低频地把点云精细配准进地图。它从每帧点云中按局部曲率挑出边缘点和平面点作为特征，只用这些点匹配，计算量小；不需要 IMU 也能做到低漂移，在 KITTI 里程计基准上精度接近离线批处理方法。2018 年 Tixiao Shan 和 Brendan Englot 在 IROS 发表的 LeGO-LOAM 面向地面车辆做了轻量化：先分割出地面点再提特征，再分两步求 6 自由度位姿，并加入基于 ICP 的回环。之后的 LIO-SAM 又紧耦合了 IMU。","example":"LeGO-LOAM 的原始配置面向 Clearpath Jackal 小车：一个水平安装的 Velodyne VLP-16 雷达加可选 IMU，实时输出 6 自由度位姿；README 也提醒，里程计漂移太大时它简单的 ICP 回环常会失败。","related":["激光SLAM","LIO-SAM","激光惯性里程计","迭代最近点","回环检测","FAST-LIO / FAST-LIO2"]},{"id":"occupancy-grid-map","category":"perception","sec":10,"tier":2,"sources":[{"title":"Wikipedia: Occupancy grid mapping","url":"https://en.wikipedia.org/wiki/Occupancy_grid_mapping"},{"title":"ROS 2 nav_msgs/OccupancyGrid 消息定义","url":"https://raw.githubusercontent.com/ros2/common_interfaces/rolling/nav_msgs/msg/OccupancyGrid.msg"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","costmap","octomap","occupancy-network","path-planning","lidar-slam"],"name":"占据栅格地图","alt":"Occupancy Grid Map","abbr":"","aliases":["栅格地图","占用栅格","占据栅格","Occupancy Grid"],"one_liner":"把环境切成小格子，每格记录被障碍物占着的概率。","explanation":"占据栅格地图由 Moravec 和 Elfes 在 1985 年提出，是移动机器人最常用的地图形式之一。它把平面（或空间）均匀划成格子，每个格子存一个被占据的概率，使用时通常分成空闲、占据、未知三类。激光雷达或深度相机每来一帧，就用二值贝叶斯滤波逐格更新，实现时常用对数几率（log-odds）方便累加。经典算法假设机器人位姿已知，所以常与 SLAM（同步定位与建图）配合。路径规划和避障可以直接在它上面算：ROS 的 nav_msgs/OccupancyGrid 消息就是这种地图，-1 表示未知；三维版本有 OctoMap 这样的八叉树地图，自动驾驶里的占用网络则是用神经网络直接预测三维占据。","example":"扫地机器人用激光雷达边走边建一张平面栅格图：墙和家具处标为占据，走过的地面标为空闲，还没探到的区域标为未知，再在空闲格子上规划清扫路线。","related":["同步定位与建图","代价地图","八叉树地图","占用网络","路径规划","激光SLAM"]},{"id":"particle-filter","category":"perception","sec":10,"tier":3,"sources":[{"title":"Particle filter - Wikipedia","url":"https://en.wikipedia.org/wiki/Particle_filter"},{"title":"Monte Carlo localization - Wikipedia","url":"https://en.wikipedia.org/wiki/Monte_Carlo_localization"},{"title":"Nav2 nav2_amcl README","url":"https://github.com/ros-navigation/navigation2/blob/main/nav2_amcl/README.md"}],"as_of":"","related_ids":["kalman-filter","extended-kalman-filter","adaptive-monte-carlo-localization","state-estimation","simultaneous-localization-and-mapping","importance-sampling"],"name":"粒子滤波","alt":"Particle Filter","abbr":"PF","aliases":["序贯蒙特卡洛方法","Sequential Monte Carlo"],"one_liner":"用一大群带权重的随机样本近似状态分布的递推估计方法。","explanation":"粒子滤波又叫序贯蒙特卡洛方法，1993 年 Gordon 等人提出的 bootstrap 滤波是其经典起点。它用许多「粒子」（每个代表一种可能的状态，比如机器人位姿）和各自的权重表示不确定性，每一步做三件事：按运动模型推动粒子并加噪声（预测），按传感器观测给粒子重新打分（更新），丢掉低权重粒子、复制高权重粒子（重采样）。卡尔曼滤波只能表示单峰高斯，粒子滤波能处理非线性、非高斯和多峰情况，比如机器人不确定自己在两条相似走廊中的哪一条。机器人上最典型的应用是 1999 年提出的蒙特卡洛定位及其自适应版本 AMCL。","example":"移动机器人开机时把粒子撒满整张地图，走几步后与激光扫描吻合的粒子被保留，粒子云逐渐收缩到它的真实位置。","related":["卡尔曼滤波","扩展卡尔曼滤波","自适应蒙特卡洛定位","状态估计","同步定位与建图","重要性采样"]},{"id":"adaptive-monte-carlo-localization","category":"perception","sec":10,"tier":2,"sources":[{"title":"ROS amcl package.xml (ros-planning/navigation, noetic-devel)","url":"https://raw.githubusercontent.com/ros-planning/navigation/noetic-devel/amcl/package.xml"},{"title":"Nav2 nav2_amcl README","url":"https://raw.githubusercontent.com/ros-navigation/navigation2/main/nav2_amcl/README.md"},{"title":"Wikipedia: Monte Carlo localization","url":"https://en.wikipedia.org/wiki/Monte_Carlo_localization"}],"as_of":"","related_ids":["particle-filter","simultaneous-localization-and-mapping","2d-lidar","wheel-odometry","occupancy-grid-map","ros-2-navigation-stack"],"name":"AMCL 自适应蒙特卡洛定位","alt":"Adaptive Monte Carlo Localization","abbr":"AMCL","aliases":["自适应蒙特卡洛定位","KLD 采样蒙特卡洛定位","amcl","nav2_amcl"],"one_liner":"在已知地图上用粒子滤波和激光扫描估计机器人位置的 ROS 定位模块。","explanation":"AMCL 是 ROS 导航栈里的二维定位包，实现 Dieter Fox 提出的自适应（KLD 采样）蒙特卡洛定位；ROS 1 版作者署名 Brian Gerkey，Nav2 将它原样移植为 nav2_amcl。蒙特卡洛定位由 Dellaert、Fox、Burgard、Thrun 于 1999 年提出，用一群粒子表示机器人可能的位置：移动时按里程计推动粒子并加噪声，激光扫描到来时给与地图吻合的粒子更高权重，再按权重重采样，粒子逐渐聚到真实位置。「自适应」指粒子数随不确定程度自动增减。它只管定位，地图要先用 SLAM 建好。","example":"仓库 AMR 开机后，操作员在 RViz 里用「2D Pose Estimate」大致点出初始位置，机器人开始移动，AMCL 的粒子云从一大片逐渐收缩成一小团，位置就锁定了。","related":["粒子滤波","同步定位与建图","2D激光雷达","轮式里程计","占据栅格地图","Nav2"]},{"id":"gnss-real-time-kinematic-positioning","category":"perception","sec":10,"tier":3,"sources":[{"title":"Wikipedia: Real-time kinematic positioning","url":"https://en.wikipedia.org/wiki/Real-time_kinematic_positioning"}],"as_of":"","related_ids":["inertial-measurement-unit","multi-sensor-fusion","state-estimation","lidar-slam","inspection-robot","autonomous-driving"],"name":"GNSS / RTK 定位","alt":"GNSS / Real-Time Kinematic Positioning","abbr":"GNSS / RTK","aliases":["RTK","实时动态差分定位","载波相位差分","卫星定位"],"one_liner":"用卫星导航加基准站差分校正，在户外做到厘米级定位","explanation":"GNSS 是全球卫星导航系统的统称，包括 GPS、北斗、GLONASS、伽利略等，单独使用时定位误差一般在米级。RTK（实时动态差分）在已知坐标的位置架一个基准站，把它观测到的卫星载波相位实时发给移动端，两边做差分消去大部分公共误差，再解出载波的整周数，精度可达厘米级；网络 RTK 用多个基准站扩大覆盖范围。它的局限是需要看得见天空，在室内、楼宇之间和树荫下会因遮挡和多路径反射失效，所以实际系统通常和 IMU、轮式里程计、激光 SLAM 融合。具身智能里主要用在户外机器人上，如巡检四足、农业和割草机器人、无人机、自动驾驶车辆。","example":"户外巡检四足机器人背上装 RTK 天线，和 IMU、激光雷达融合定位，按预先设定的经纬度路点在园区里自主巡逻。","related":["惯性测量单元","多传感器融合","状态估计","激光SLAM","巡检机器人","自动驾驶"]},{"id":"ultra-wideband-positioning","category":"perception","sec":10,"tier":3,"sources":[{"title":"Ultra-wideband - Wikipedia","url":"https://en.wikipedia.org/wiki/Ultra-wideband"}],"as_of":"","related_ids":["multi-sensor-fusion","state-estimation","wheel-odometry","gnss-real-time-kinematic-positioning","autonomous-mobile-robot","kalman-filter"],"name":"UWB 定位（超宽带）","alt":"Ultra-Wideband Positioning","abbr":"UWB","aliases":["超宽带定位","UWB 测距"],"one_liner":"用极短的无线电脉冲测信号飞行时间，在室内做厘米级测距定位。","explanation":"超宽带是一种占用很宽频段的低功率无线电技术，美国 FCC 定义为带宽超过 500 MHz 或中心频率的 20%（取较小者）。它的脉冲极窄，能精确测出信号飞行时间，因此适合测距：常用双向测距（TWR）或到达时间差（TDoA），让带标签的设备和多个固定基站测距，再用几何方法解算坐标，精度可到厘米级，但遇到遮挡和多径反射会变差。GPS 在室内不可用，所以 UWB 常用于仓储机器人定位、跟随机器人和多机器人相对定位；苹果 iPhone 11 起的手机和 AirTag 也内置了 UWB。","example":"仓库四角装 UWB 基站，搬运机器人背一个 UWB 标签，实时测到各基站的距离并解算出自己在库里的位置，再与轮式里程计融合。","related":["多传感器融合","状态估计","轮式里程计","GNSS / RTK 定位","自主移动机器人","卡尔曼滤波"]},{"id":"tightly-coupled-vs-loosely-coupled-fusion","category":"perception","sec":10,"tier":3,"sources":[{"title":"VINS-Mono: A Robust and Versatile Monocular Visual-Inertial State Estimator (arXiv 1708.03852)","url":"https://arxiv.org/abs/1708.03852"},{"title":"LIO-SAM: Tightly-coupled Lidar Inertial Odometry via Smoothing and Mapping (arXiv 2007.00258)","url":"https://arxiv.org/abs/2007.00258"}],"as_of":"","related_ids":["multi-sensor-fusion","visual-inertial-odometry","lidar-inertial-odometry","imu-preintegration","vins-mono-vins-fusion","extended-kalman-filter"],"name":"紧耦合 / 松耦合融合","alt":"Tightly-coupled vs. Loosely-coupled Fusion","abbr":"","aliases":["紧耦合","松耦合"],"one_liner":"多传感器融合的两种方式：融合原始测量，还是各算各的结果再合并。","explanation":"这是多传感器融合（如相机+IMU、激光雷达+IMU）里常说的两种架构。松耦合指每个传感器先各自独立算出一个结果，比如视觉里程计先算出一个位姿，再和 IMU 积分出的位姿在滤波器里加权合并；实现简单、模块可替换，但某个传感器单独失效（如纹理太少跟丢）时，它给出的错误结果会直接进入融合。紧耦合则把原始测量，比如图像特征点的重投影误差和 IMU 预积分量，放进同一个状态估计器里联合优化或滤波，信息利用更充分、精度和鲁棒性通常更好，代价是实现复杂、计算量更大。VINS-Mono、OKVIS、FAST-LIO2、LIO-SAM 这类系统都属于紧耦合方案。","example":"无人机在白墙前飞时相机特征很少：松耦合方案里视觉位姿可能直接跑飞；紧耦合方案仍能用仅有的几个特征点加 IMU 约束维持估计。","related":["多传感器融合","视觉惯性里程计","激光惯性里程计","IMU 预积分","VINS-Mono / VINS-Fusion","扩展卡尔曼滤波"]},{"id":"error-state-kalman-filter","category":"perception","sec":10,"tier":3,"sources":[{"title":"Joan Solà: Quaternion kinematics for the error-state Kalman filter (arXiv 1711.02508)","url":"https://arxiv.org/abs/1711.02508"},{"title":"PX4 Docs: Using PX4's Navigation Filter (EKF2)","url":"https://docs.px4.io/main/en/advanced_config/tuning_the_ecl_ekf"}],"as_of":"","related_ids":["kalman-filter","extended-kalman-filter","inertial-measurement-unit","imu-preintegration","quaternion","multi-sensor-fusion"],"name":"误差状态卡尔曼滤波","alt":"Error-State Kalman Filter","abbr":"ESKF","aliases":["误差状态 EKF","ES-EKF","Error-State EKF"],"one_liner":"不直接估计状态本身，而是估计「名义值与真值之差」的卡尔曼滤波写法。","explanation":"误差状态卡尔曼滤波是扩展卡尔曼滤波（EKF，把非线性系统局部线性化后套用卡尔曼滤波）的一种写法，常用于 IMU（惯性测量单元）与相机、激光雷达、GPS 的融合。它把状态拆成两部分：用 IMU 读数高频积分出的「名义状态」，和一个小的「误差状态」。滤波器只估计误差，每次观测更新后把误差并回名义状态再清零。好处是误差始终很小、线性化更准；姿态误差可用 3 维旋转向量表示，避开四元数用 4 个数表示 3 个自由度导致的协方差奇异。Joan Solà 2017 年的讲义是最常被引用的推导参考。","example":"PX4 飞控的 EKF2 估计器融合 IMU、GPS、磁力计等数据，官方文档说明它采用「误差状态」形式，以便把旋转的不确定性表示成 3 维向量。","related":["卡尔曼滤波","扩展卡尔曼滤波","惯性测量单元","IMU 预积分","四元数","多传感器融合"]},{"id":"unscented-kalman-filter","category":"perception","sec":10,"tier":3,"sources":[{"title":"Unscented transform - Wikipedia","url":"https://en.wikipedia.org/wiki/Unscented_transform"},{"title":"robot_localization: State Estimation Nodes","url":"https://raw.githubusercontent.com/cra-ros-pkg/robot_localization/ros2/doc/state_estimation_nodes.rst"}],"as_of":"","related_ids":["kalman-filter","extended-kalman-filter","particle-filter","state-estimation","multi-sensor-fusion","error-state-kalman-filter"],"name":"无迹卡尔曼滤波","alt":"Unscented Kalman Filter","abbr":"UKF","aliases":["无味卡尔曼滤波","Sigma 点卡尔曼滤波"],"one_liner":"用一小组采样点代替求导，来处理非线性系统的卡尔曼滤波。","explanation":"卡尔曼滤波的非线性版本之一，由 Julier 和 Uhlmann 在 1990 年代中后期提出。扩展卡尔曼滤波（EKF）遇到非线性就在当前点求雅可比矩阵做线性化，非线性强时误差大，还要手推导数。UKF 换了思路：按当前均值和协方差挑一小组确定的采样点（sigma 点），把每个点直接送进真实的运动模型或观测模型，再用变换后的点重新算均值和协方差，这一步叫无迹变换。它不需要雅可比，强非线性下通常比 EKF 准，代价是计算量更大。机器人里用于融合 IMU、轮速、GPS 等做状态估计，ROS 的 robot_localization 包同时提供 EKF 和 UKF 节点。","example":"用 robot_localization 的 ukf_localization_node 融合轮式里程计和 IMU，得到移动底盘平滑连续的位姿估计。","related":["卡尔曼滤波","扩展卡尔曼滤波","粒子滤波","状态估计","多传感器融合","误差状态卡尔曼滤波"]},{"id":"invariant-extended-kalman-filter","category":"perception","sec":10,"tier":3,"sources":[{"title":"Contact-Aided Invariant Extended Kalman Filtering for Robot State Estimation (Hartley et al., arXiv 1904.09251)","url":"https://arxiv.org/abs/1904.09251"},{"title":"The Invariant Extended Kalman Filter as a Stable Observer (Barrau & Bonnabel, arXiv 1410.1465)","url":"https://arxiv.org/abs/1410.1465"},{"title":"GitHub: RossHartley/invariant-ekf","url":"https://github.com/RossHartley/invariant-ekf"}],"as_of":"","related_ids":["extended-kalman-filter","error-state-kalman-filter","lie-group","leg-odometry","state-estimation","inertial-measurement-unit"],"name":"不变扩展卡尔曼滤波","alt":"Invariant Extended Kalman Filter","abbr":"InEKF","aliases":["IEKF","不变 EKF","接触辅助 InEKF","Contact-aided InEKF"],"one_liner":"在李群上定义误差的扩展卡尔曼滤波，收敛更稳，常用于足式机器人状态估计。","explanation":"不变扩展卡尔曼滤波由法国学者 Barrau 和 Bonnabel 在 2014 年前后系统提出，是扩展卡尔曼滤波（EKF）的一种变体。普通 EKF 要在当前估计值处做线性化，估计一旦偏得远，线性化就不准，可能发散。InEKF 把姿态、速度、位置等状态放在李群（描述旋转和平移的数学结构）上，并按群运算定义误差；对一大类系统，误差的演化不再依赖当前估计值，因此收敛范围更大、更稳。密歇根大学 Hartley、Grizzle 等人 2019 年的论文把它用于融合 IMU 与腿部运动学和触地信息，在 Cassie 系列双足机器人上表现优于基于四元数的 EKF，并开源了 C++ 实现。","example":"密歇根大学开源的 invariant-ekf 库（C++，依赖 Eigen，BSD-3 许可）以 IMU 为运动模型，接入关节运动学和触地测量，估计机身三维位姿、速度和 IMU 零偏，可用于双足或四足机器人。","related":["扩展卡尔曼滤波","误差状态卡尔曼滤波","李群","腿式里程计","状态估计","惯性测量单元"]},{"id":"factor-graph-optimization","category":"perception","sec":10,"tier":3,"sources":[{"title":"GTSAM: Factor Graphs and GTSAM tutorial","url":"https://gtsam.org/tutorials/intro.html"},{"title":"Dellaert & Kaess: Factor Graphs for Robot Perception (Foundations and Trends in Robotics, 2017)","url":"https://www.cs.cmu.edu/~kaess/pub/Dellaert17fnt.html"},{"title":"LIO-SAM: Tightly-coupled Lidar Inertial Odometry via Smoothing and Mapping","url":"https://arxiv.org/abs/2007.00258"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","gtsam","bundle-adjustment","imu-preintegration","loop-closure-detection","multi-sensor-fusion"],"name":"因子图优化","alt":"Factor Graph Optimization","abbr":"","aliases":["因子图","Factor Graph","图优化"],"one_liner":"把各种测量约束画成「变量-因子」图，再用最小二乘求最可能状态的方法。","explanation":"因子图是一种二分图：一类节点是待估计的变量，如机器人各时刻的位姿、路标的三维坐标；另一类节点是因子，每个因子代表一条测量或先验带来的概率约束，比如 IMU 给出两帧之间的相对运动，相机给出某个路标的观测。求最大后验估计（在所有观测下最可能的状态）等价于最小化所有因子误差的平方和，可以用高斯-牛顿、Levenberg-Marquardt 等非线性最小二乘方法求解，并利用图的稀疏性加速。Frank Dellaert 与 Michael Kaess 2017 年的综述系统阐述了这套框架，佐治亚理工开源的 GTSAM 是常用实现。它是现代 SLAM 和多传感器融合后端的主流写法，加一种新传感器只需加一种因子。","example":"LIO-SAM（IROS 2020）把激光雷达里程计、IMU 预积分和回环检测都作为因子加入同一个因子图，统一优化机器人轨迹，并用优化结果估计 IMU 零偏。","related":["同步定位与建图","GTSAM","光束法平差","IMU 预积分","回环检测","多传感器融合"]},{"id":"imu-preintegration","category":"perception","sec":10,"tier":3,"sources":[{"title":"arXiv 1512.02363: On-Manifold Preintegration for Real-Time Visual-Inertial Odometry（IEEE T-RO 2016）","url":"https://arxiv.org/abs/1512.02363"},{"title":"arXiv 1708.03852: VINS-Mono","url":"https://arxiv.org/abs/1708.03852"}],"as_of":"","related_ids":["inertial-measurement-unit","visual-inertial-odometry","factor-graph-optimization","vins-mono-vins-fusion","tightly-coupled-vs-loosely-coupled-fusion","lidar-inertial-odometry"],"name":"IMU 预积分","alt":"IMU Preintegration","abbr":"","aliases":["IMU 预积分因子","惯性预积分","IMU Pre-integration"],"one_liner":"把两帧之间的大量 IMU 读数预先积成一条相对运动约束的技术。","explanation":"IMU（惯性测量单元）以几百赫兹输出角速度和加速度，而相机、激光雷达关键帧只有十几到几十赫兹。优化式的视觉惯性里程计要在相邻关键帧间加一条 IMU 约束，但直接积分依赖起点的位姿和速度，每次优化改了起点就得重新积分，很慢。预积分把这段 IMU 数据在起点的机体坐标系下积成相对旋转、速度和位置增量，与全局位姿无关，只需算一次；零偏（IMU 的系统性偏移）估计值变化时，用一阶近似修正即可，不必重算。Forster 等人 2016 年在 IEEE T-RO 上给出了在旋转流形 SO(3) 上的完整推导，这套方法成了 VINS-Mono、LIO-SAM 等视觉/激光惯性里程计和 GTSAM 因子图库里的标准组件。","example":"VINS-Mono 在紧耦合非线性优化中，把相邻关键帧之间的 IMU 数据预积分成一条约束，和视觉特征观测一起求解相机轨迹。","related":["惯性测量单元","视觉惯性里程计","因子图优化","VINS-Mono / VINS-Fusion","紧耦合 / 松耦合融合","激光惯性里程计"]},{"id":"visual-inertial-odometry","category":"perception","sec":10,"tier":3,"sources":[{"title":"Visual odometry (Wikipedia)","url":"https://en.wikipedia.org/wiki/Visual_odometry"},{"title":"VINS-Mono: A Robust and Versatile Monocular Visual-Inertial State Estimator (arXiv)","url":"https://arxiv.org/abs/1708.03852"}],"as_of":"","related_ids":["visual-odometry","inertial-measurement-unit","vins-mono-vins-fusion","imu-preintegration","tightly-coupled-vs-loosely-coupled-fusion","visual-slam"],"name":"视觉惯性里程计","alt":"Visual-Inertial Odometry","abbr":"VIO","aliases":["VINS","视觉惯性导航"],"one_liner":"融合相机和IMU，连续推算设备自身的运动轨迹","explanation":"视觉惯性里程计（VIO）是把相机图像和 IMU（惯性测量单元）读数融合起来，连续估计设备自身位置和姿态的方法；只用相机的叫视觉里程计（VO）。两种传感器互补：IMU 频率高、剧烈运动时也能测，但积分后很快漂移；相机能约束漂移，却怕运动模糊和缺少纹理，单目相机还不知道真实尺度，IMU 测到的重力和加速度能把尺度补回来。实现上分滤波法和优化法（如 VINS-Mono），也分松耦合和紧耦合。VIO 只做局部估计，跑久了仍会累积误差，加上回环检测和全局优化就成了视觉惯性 SLAM。它常用于无人机、AR 设备和腿足机器人，在没有 GPS 的环境中定位。","example":"无人机在室内仓库飞行，收不到 GPS，靠机载相机和 IMU 跑 VIO 实时知道自己飞到了哪里。","related":["视觉里程计","惯性测量单元","VINS-Mono / VINS-Fusion","IMU 预积分","紧耦合 / 松耦合融合","视觉SLAM"]},{"id":"vins-mono-vins-fusion","category":"perception","sec":10,"tier":3,"sources":[{"title":"VINS-Mono: A Robust and Versatile Monocular Visual-Inertial State Estimator (arXiv)","url":"https://arxiv.org/abs/1708.03852"},{"title":"HKUST-Aerial-Robotics/VINS-Mono (GitHub)","url":"https://github.com/HKUST-Aerial-Robotics/VINS-Mono"},{"title":"HKUST-Aerial-Robotics/VINS-Fusion (GitHub)","url":"https://github.com/HKUST-Aerial-Robotics/VINS-Fusion"}],"as_of":"2019-01","related_ids":["visual-inertial-odometry","visual-slam","inertial-measurement-unit","imu-preintegration","loop-closure-detection","camera-imu-calibration"],"name":"VINS-Mono / VINS-Fusion","alt":"VINS-Mono / VINS-Fusion (Visual-Inertial Navigation System)","abbr":"","aliases":["VINS"],"one_liner":"港科大开源的视觉惯性定位系统，用相机加IMU实时估计位姿","explanation":"VINS-Mono 是香港科技大学沈劭劼团队（Aerial Robotics Group）开源的单目视觉惯性状态估计器，论文发表于 IEEE T-RO。它只用一个相机加一个 IMU（惯性测量单元，测加速度和角速度），就能实时算出设备的位置和姿态。做法是用非线性优化把预积分后的 IMU 数据和图像特征点紧耦合求解，并带自动初始化、相机与 IMU 外参在线标定、回环检测和 4 自由度位姿图优化。2019 年发布的 VINS-Fusion 是扩展版，支持单目+IMU、双目、双目+IMU，还演示了和 GPS 融合。两者基于 ROS、以 GPLv3 开源，常被当作无人机和移动机器人定位的基线方案。","example":"给四足机器狗装一个带 IMU 的双目相机，跑 VINS-Fusion，就能在没有 GPS 的室内实时输出机身轨迹。","related":["视觉惯性里程计","视觉SLAM","惯性测量单元","IMU 预积分","回环检测","相机-IMU联合标定"]},{"id":"lidar-inertial-odometry","category":"perception","sec":10,"tier":3,"sources":[{"title":"FAST-LIO2: Fast Direct LiDAR-inertial Odometry (arXiv 2107.06829)","url":"https://arxiv.org/abs/2107.06829"},{"title":"LIO-SAM: Tightly-coupled Lidar Inertial Odometry via Smoothing and Mapping (arXiv 2007.00258)","url":"https://arxiv.org/abs/2007.00258"}],"as_of":"","related_ids":["lidar-slam","fast-lio2","lio-sam","imu-preintegration","tightly-coupled-vs-loosely-coupled-fusion","visual-inertial-odometry"],"name":"激光惯性里程计","alt":"LiDAR-Inertial Odometry","abbr":"LIO","aliases":["激光雷达-IMU 融合里程计","激光-惯性里程计","LiDAR-IMU 里程计"],"one_liner":"把激光雷达点云和 IMU 读数融合，实时估计机器人位姿并建点云地图。","explanation":"激光惯性里程计把激光雷达和 IMU（惯性测量单元）融合起来估计自身运动，是激光 SLAM 的核心部分。两者互补：一帧点云要扫描一段时间（常见 10 Hz 即 0.1 秒），机器人在此期间的运动会让点云变形，高频的 IMU 能推算这段运动把点云校正回来（去畸变），并给配准提供初值；点云与地图配准又能纠正 IMU 积分的漂移。按融合方式分松耦合和紧耦合，目前主流是紧耦合。代表系统有 Tixiao Shan 等人 IROS 2020 的 LIO-SAM（因子图优化）和港大 MARS 实验室的 FAST-LIO / FAST-LIO2（迭代卡尔曼滤波），后者不提特征、直接用原始点配准，最高可达 100 Hz，也适配固态雷达。","example":"手持一台带 IMU 的激光雷达在楼里走一圈，FAST-LIO2 能实时输出轨迹和点云地图；论文测试中，传感器以最高约 1000°/s 的角速度快速转动时，位姿估计仍保持可靠。","related":["激光SLAM","FAST-LIO / FAST-LIO2","LIO-SAM","IMU 预积分","紧耦合 / 松耦合融合","视觉惯性里程计"]},{"id":"fast-lio2","category":"perception","sec":10,"tier":2,"sources":[{"title":"FAST-LIO2: Fast Direct LiDAR-inertial Odometry (arXiv:2107.06829)","url":"https://arxiv.org/abs/2107.06829"},{"title":"hku-mars/FAST_LIO (GitHub)","url":"https://github.com/hku-mars/FAST_LIO"}],"as_of":"2021-07","related_ids":["lidar-inertial-odometry","lidar","inertial-measurement-unit","lidar-slam","lio-sam","solid-state-lidar"],"name":"FAST-LIO / FAST-LIO2","alt":"FAST-LIO2: Fast Direct LiDAR-inertial Odometry","abbr":"","aliases":["FAST-LIO","FAST-LIO2","Fast LiDAR-Inertial Odometry"],"one_liner":"港大 MARS 实验室开源的激光雷达加 IMU 里程计，快，适配多种雷达。","explanation":"FAST-LIO 是香港大学 MARS 实验室（张富团队）开源的激光惯性里程计：把激光雷达点云和 IMU（测加速度、角速度的惯性测量单元）融合，实时估计机器人自身位姿，同时建出点云地图。第一代用紧耦合的迭代扩展卡尔曼滤波融合两种传感器。2021 年 7 月公开的 FAST-LIO2 有两处关键改动：不再手工提取边缘、平面特征，而是把原始点直接配准到地图上，所以旋转式（Velodyne、Ouster）和固态（Livox）雷达都能用；用自研的增量 kd 树 ikd-Tree 维护地图，论文报告大场景下可达 100 Hz。它是四足、无人机、人形上做定位建图的常用开源基线，GPL-2.0 许可，能跑在 ARM 板上。","example":"四足机器人背上装一台 Livox 固态激光雷达，跑 FAST-LIO2 实时输出自身位姿和点云地图，再交给导航模块做路径规划。","related":["激光惯性里程计","激光雷达","惯性测量单元","激光SLAM","LIO-SAM","固态激光雷达"]},{"id":"lio-sam","category":"perception","sec":10,"tier":3,"sources":[{"title":"LIO-SAM: Tightly-coupled Lidar Inertial Odometry via Smoothing and Mapping (IROS 2020, arXiv 2007.00258)","url":"https://arxiv.org/abs/2007.00258"},{"title":"GitHub: TixiaoShan/LIO-SAM","url":"https://github.com/TixiaoShan/LIO-SAM"}],"as_of":"","related_ids":["lidar-inertial-odometry","factor-graph-optimization","imu-preintegration","gtsam","loop-closure-detection","loam"],"name":"LIO-SAM","alt":"LIO-SAM (LiDAR Inertial Odometry via Smoothing and Mapping)","abbr":"","aliases":["LIO_SAM"],"one_liner":"基于因子图优化的紧耦合激光惯性里程计与建图开源系统。","explanation":"LIO-SAM 是 Tixiao Shan、Brendan Englot、Daniela Rus 等人发表于 IROS 2020 的激光惯性 SLAM 系统，Shan 和 Englot 此前做过 LeGO-LOAM。它把定位建图写成因子图（把各种测量当作约束、联合优化一串位姿的图模型），可加入四类因子：IMU 预积分、激光里程计、GPS 和回环。IMU 预积分既给点云去畸变，也给配准提供初值。为保证实时，它只挑选关键帧，并把新关键帧与附近固定数量的历史关键帧组成的局部地图配准，而不是和全局地图匹配。后端基于 GTSAM 库。代码以 BSD-3 许可开源，有 ROS 1 版本和 ROS 2 分支。","example":"README 提示：LIO-SAM 只适用于能给出横滚、俯仰、偏航角的 9 轴 IMU，建议频率至少 200 Hz；用 Ouster 雷达时其内置 6 轴 IMU 不够，需要另配外置 9 轴 IMU。","related":["激光惯性里程计","因子图优化","IMU 预积分","GTSAM","回环检测","LOAM 系列激光里程计"]},{"id":"rtab-map","category":"perception","sec":10,"tier":3,"sources":[{"title":"RTAB-Map 官方主页（IntRoLab）","url":"https://introlab.github.io/rtabmap/"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","visual-slam","loop-closure-detection","occupancy-grid-map","common-ros-slam-packages","depth-camera"],"name":"RTAB-Map","alt":"RTAB-Map (Real-Time Appearance-Based Mapping)","abbr":"","aliases":["rtabmap","rtabmap_ros"],"one_liner":"开源的图优化 SLAM 库，支持 RGB-D、双目和激光雷达建图定位","explanation":"RTAB-Map（实时基于外观的建图）是加拿大舍布鲁克大学 IntRoLab 的 Mathieu Labbé 与 François Michaud 开发的开源 SLAM（同步定位与建图）库。它把走过的位置组织成位姿图，用词袋模型（把图像特征量化成「视觉单词」来比对）做回环检测：认出「这里来过」就往图里加一条约束，再用图优化消除累积误差。它的内存管理机制只让一部分地点参与实时检测和优化，所以大场景、长时间运行也能保持实时。支持 RGB-D 相机、双目、3D 激光雷达和 2D 激光，通过 rtabmap_ros 接入 ROS，是移动机器人建图导航最常用的现成方案之一。","example":"在 ROS 2 里用一台 RGB-D 相机跑 rtabmap_ros，推着机器人在实验室走一圈，得到 3D 点云地图和 2D 占据栅格，交给 Nav2 做导航。","related":["同步定位与建图","视觉SLAM","回环检测","占据栅格地图","ROS 常用 SLAM 建图包（GMapping / SLAM Toolbox / RTAB-Map）","深度相机"]},{"id":"droid-slam","category":"perception","sec":10,"tier":3,"sources":[{"title":"arXiv 2108.10869: DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D Cameras","url":"https://arxiv.org/abs/2108.10869"},{"title":"princeton-vl/DROID-SLAM (GitHub)","url":"https://github.com/princeton-vl/DROID-SLAM"}],"as_of":"","related_ids":["visual-slam","bundle-adjustment","raft","orb-slam3","mast3r-slam","visual-odometry"],"name":"DROID-SLAM","alt":"DROID-SLAM: Deep Visual SLAM","abbr":"","aliases":["DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D Cameras"],"one_liner":"普林斯顿提出的深度学习视觉 SLAM，循环迭代估计相机位姿和稠密深度。","explanation":"DROID-SLAM 是普林斯顿大学 Zachary Teed 和 Jia Deng 发表在 NeurIPS 2021 的视觉 SLAM（同步定位与建图）系统。它借用同组 RAFT 光流的结构，在相关帧之间计算稠密像素对应，由循环网络反复更新相机位姿和每个像素的深度，中间嵌入一个可微的稠密光束法平差层（BA，联合优化相机位姿和三维结构），把几何约束直接放进网络。它只在合成数据集 TartanAir 上用单目视频训练，测试时也能用双目或 RGB-D 输入，在 TartanAir、EuRoC、TUM-RGBD、ETH3D 上精度明显超过以往方法，灾难性失败也少得多。代价是依赖 GPU，推理需要至少 11 GB 显存。后来 MASt3R-SLAM 等深度 SLAM 工作常拿它作对比基线。","example":"给一段手持相机绕房间拍摄的视频，DROID-SLAM 输出每一帧的相机位姿和稠密深度，可拼成房间的点云，也可为人类示范视频恢复相机运动轨迹。","related":["视觉SLAM","光束法平差","RAFT 光流","ORB-SLAM3","MASt3R-SLAM","视觉里程计"]},{"id":"mast3r-slam","category":"perception","sec":10,"tier":3,"sources":[{"title":"arXiv: MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors","url":"https://arxiv.org/abs/2412.12392"},{"title":"GitHub: rmurai0610/MASt3R-SLAM","url":"https://github.com/rmurai0610/MASt3R-SLAM"}],"as_of":"2025-06","related_ids":["mast3r","dust3r","simultaneous-localization-and-mapping","visual-slam","droid-slam","pointmap"],"name":"MASt3R-SLAM","alt":"MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors","abbr":"","aliases":[],"one_liner":"以 MASt3R 为先验的实时单目稠密 SLAM，普通视频不标定也能建图定位。","explanation":"MASt3R-SLAM 由帝国理工学院 Andrew Davison 团队（Riku Murai、Eric Dexheimer 等）提出，发表于 CVPR 2025（Highlight）。它是实时的单目稠密 SLAM（同步定位与建图）系统，从底层围绕 MASt3R 这个两视图三维重建与匹配模型设计：新来一帧，就用 MASt3R 预测它与关键帧之间的点图和稠密匹配，再做相机跟踪、局部融合、回环检测和二阶全局优化，得到全局一致的相机轨迹和稠密三维几何，速度约 15 帧/秒。传统单目 SLAM 通常要先标定相机内参，它只假设相机有唯一光心，不依赖固定的参数化相机模型，未标定的视频也能跑；已知标定时稍作修改即可达到当时最好水平。开源代码支持 RealSense 实时输入、MP4 视频和图片文件夹。","example":"拿手机在室内录一段视频，不做相机标定，MASt3R-SLAM 就能估出相机轨迹并重建出房间的稠密点云。","related":["MASt3R","DUSt3R","同步定位与建图","视觉SLAM","DROID-SLAM","点图"]},{"id":"gaussian-splatting-slam","category":"perception","sec":10,"tier":3,"sources":[{"title":"SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM (arXiv 2312.02126)","url":"https://arxiv.org/abs/2312.02126"},{"title":"Gaussian Splatting SLAM / MonoGS (arXiv 2312.06741)","url":"https://arxiv.org/abs/2312.06741"}],"as_of":"2024-06","related_ids":["3d-gaussian-splatting","simultaneous-localization-and-mapping","visual-slam","neural-radiance-fields","novel-view-synthesis","real-to-sim"],"name":"高斯泼溅 SLAM","alt":"Gaussian Splatting SLAM (e.g. SplaTAM / MonoGS)","abbr":"","aliases":["3DGS SLAM","SplaTAM","MonoGS"],"one_liner":"用 3D 高斯泼溅当地图，边定位边建出能逼真渲染的场景","explanation":"一类把 3D 高斯泼溅（用大量带颜色和透明度的 3D 高斯椭球表示场景，渲染很快）当作地图表示的 SLAM 方法，2023 年底起集中出现。代表作有 SplaTAM（卡内基梅隆大学等，CVPR 2024，输入 RGB-D 视频）和 MonoGS（帝国理工 Andrew Davison 组，CVPR 2024，首个单目版本，约 3 帧每秒实时运行）。跟踪时把当前地图渲染成图像，和真实观测比较，反向优化相机位姿；建图时增加、删除和调整高斯。相比点云或 TSDF 地图，它在定位的同时得到能渲染任意新视角的稠密地图，适合机器人做现实到仿真、数字孪生和导航建图。","example":"SplaTAM 用一台手持 RGB-D 相机扫一遍房间，边估计相机轨迹边建出高斯地图，之后可以从没拍过的角度渲染出这个房间的图像。","related":["3D高斯泼溅","同步定位与建图","视觉SLAM","神经辐射场","新视角合成","现实到仿真"]},{"id":"absolute-trajectory-error-relative-pose-error","category":"perception","sec":10,"tier":3,"sources":[{"title":"TUM RGB-D Dataset: Useful tools (ATE / RPE evaluation)","url":"https://cvg.cit.tum.de/data/datasets/rgbd-dataset/tools"},{"title":"evo: Python package for the evaluation of odometry and SLAM","url":"https://github.com/MichaelGrupp/evo"}],"as_of":"","related_ids":["visual-slam","visual-odometry","ground-truth","trajectory","loop-closure-detection"],"name":"ATE / RPE（绝对 / 相对轨迹误差）","alt":"Absolute Trajectory Error / Relative Pose Error","abbr":"ATE / RPE","aliases":["绝对轨迹误差","相对位姿误差","APE","Absolute Pose Error"],"one_liner":"衡量 SLAM 或里程计估计的轨迹和真值差多少的两个标准指标。","explanation":"ATE 和 RPE 是评估视觉 SLAM、视觉里程计等定位算法最常用的两个指标，慕尼黑工业大学的 TUM RGB-D 基准给出了广泛沿用的定义和评测脚本。ATE（绝对轨迹误差）先按时间戳把估计轨迹和真值轨迹一一对应，再用一个刚体变换把两条轨迹整体对齐（单目 SLAM 还要额外估一个尺度），然后算各时刻位置差的均方根（RMSE，单位米），反映整条轨迹的全局一致性。RPE 严格说是「相对位姿误差」，比较固定时间或距离间隔内的相对运动，如每秒平移误差（m/s）和旋转误差（deg/s），反映局部漂移，适合评价没有回环的里程计。常用开源工具 evo 支持 TUM、KITTI、EuRoC 等格式，其中与 ATE 对应的指标叫 APE。","example":"用 evo_ape 对比某 SLAM 的输出轨迹和真值，若 ATE RMSE 为 0.02，表示对齐后整条轨迹平均偏差约 2 厘米；再用 evo_rpe 设 1 秒间隔，看每秒累积多少漂移。","related":["视觉SLAM","视觉里程计","真值","轨迹","回环检测"]},{"id":"scene-understanding","category":"perception","sec":11,"tier":2,"sources":[{"title":"ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes (arXiv 1702.04405)","url":"https://arxiv.org/abs/1702.04405"},{"title":"ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning (arXiv 2309.16650)","url":"https://arxiv.org/abs/2309.16650"}],"as_of":"","related_ids":["3d-scene-graph","semantic-map","3d-vision","semantic-segmentation","conceptgraphs","scannet"],"name":"场景理解","alt":"Scene Understanding","abbr":"","aliases":["3D 场景理解","3D Scene Understanding"],"one_liner":"从图像、深度或点云中弄清环境里有什么、在哪里、彼此是什么关系。","explanation":"场景理解是计算机视觉和机器人感知的总目标，不是单一算法：从图像、深度或点云里弄清场景的几何（物体在哪、多大、哪里能走）、语义（是什么）和关系（杯子在桌上、抽屉能拉开）。它由目标检测、语义与实例分割、深度估计、三维重建、位姿估计、可供性检测等任务拼成。机器人要在三维空间里导航和操作，所以具身智能更关心 3D 场景理解：ScanNet（2017）提供 1513 个室内场景、约 250 万帧 RGB-D 数据及语义标注；ConceptGraphs（2023）把 2D 基础模型的结果多视角融合成开放词汇 3D 场景图，供大模型按语言指令做规划。","example":"家务机器人进厨房后先建一张 3D 场景图：冰箱、餐桌、桌上的两只碗、碗在桌面上；接到「把碗放进水槽」时，据此查出碗和水槽的三维位置再规划动作。","related":["3D场景图","语义地图","3D视觉","语义分割","ConceptGraphs","ScanNet 数据集"]},{"id":"octomap","category":"perception","sec":11,"tier":3,"sources":[{"title":"OctoMap 官方主页","url":"https://octomap.github.io/"},{"title":"MoveIt Perception Pipeline Tutorial","url":"https://moveit.picknik.ai/main/doc/examples/perception_pipeline/perception_pipeline_tutorial.html"}],"as_of":"","related_ids":["occupancy-grid-map","voxel","point-cloud","truncated-signed-distance-function","moveit-motion-planning-framework","collision-checking"],"name":"八叉树地图","alt":"Octree Map (OctoMap)","abbr":"","aliases":["OctoMap","八叉树占据地图"],"one_liner":"用八叉树分层存储的三维概率占据地图，常用于机器人避障和规划。","explanation":"OctoMap 是德国弗莱堡大学 Armin Hornung、Kai M. Wurm 等人开发的开源 C++ 库，论文 2013 年发表于 Autonomous Robots。它把空间递归切成八个小立方体（八叉树），每个格子记录「被占据」的概率，能区分占据、空闲和未知三种状态，传感器噪声和环境变化靠概率更新逐步修正。和把整个空间切成等大体素相比，它只在有东西的地方细分，内存省得多，还能按需取粗或细的分辨率。深度相机或激光雷达的点云写进去后可直接做碰撞检查，MoveIt 的感知管线就用它表示机器人周围的障碍物。","example":"机械臂旁装一台深度相机，MoveIt 把点云持续写进 OctoMap，规划轨迹时自动绕开桌上新放的杂物。","related":["占据栅格地图","体素","点云","截断符号距离函数","MoveIt","碰撞检查"]},{"id":"nvblox","category":"perception","sec":11,"tier":3,"sources":[{"title":"nvblox: GPU-Accelerated Incremental Signed Distance Field Mapping (arXiv)","url":"https://arxiv.org/abs/2311.00626"},{"title":"nvblox Documentation","url":"https://nvidia-isaac.github.io/nvblox/v0.0.9/index.html"}],"as_of":"2024-05","related_ids":["truncated-signed-distance-function","euclidean-signed-distance-field","nvidia-isaac-ros","ros-2-navigation-stack","costmap","obstacle-avoidance"],"name":"nvblox","alt":"NVIDIA nvblox (GPU TSDF/ESDF Mapping)","abbr":"","aliases":["Isaac ROS nvblox","isaac_ros_nvblox"],"one_liner":"英伟达开源的 GPU 加速三维建图库，实时生成用于避障的距离场地图。","explanation":"nvblox 是英伟达开源的体素建图库，论文发表于 ICRA 2024。它在 GPU 上把 RGB-D 相机或激光雷达的数据增量融合成 TSDF（截断符号距离函数，记录每个体素离最近表面多远），并实时计算 ESDF（欧氏符号距离场），供路径规划做碰撞检查。论文报告表面重建最高提速 177 倍、距离场计算最高提速 31 倍。它提供 ROS 2 接口，属于 Isaac ROS 的一部分，可输出代价地图给 Nav2 导航栈使用。","example":"移动机器人一边走一边用 RGB-D 相机和 nvblox 在 GPU 上建图，把代价地图交给 Nav2 做避障导航。","related":["截断符号距离函数","欧氏符号距离场","Isaac ROS","Nav2","代价地图","避障"]},{"id":"occupancy-network","category":"perception","sec":11,"tier":3,"sources":[{"title":"Occupancy Networks: Learning 3D Reconstruction in Function Space (arXiv)","url":"https://arxiv.org/abs/1812.03828"}],"as_of":"","related_ids":["occupancy-grid-map","implicit-vs-explicit-3d-representation","birds-eye-view","autonomous-driving","vision-only-approach","tesla-ai-day"],"name":"占用网络","alt":"Occupancy Network","abbr":"","aliases":["Occupancy 网络","3D 占用预测","占据网络"],"one_liner":"用神经网络判断三维空间里每个位置是否被物体占据。","explanation":"占用网络最早指 Mescheder 等人 CVPR 2019 的工作：网络输入图像或点云，对任意三维点输出它在物体内部的概率，用这种隐式表示重建三维形状，分辨率不受体素网格限制。另一层含义来自自动驾驶：2022 年特斯拉公开介绍了用多路相机预测车辆周围每个体素是否被占用的占用网络，此后「3D 占用预测」成为热门任务。它的好处是不依赖预定义类别，能表示异形障碍物，和占据栅格地图、鸟瞰图感知关系密切。","example":"纯视觉的自动驾驶系统用多路相机预测周围体素是否被占用，从而避开检测类别表里没有的异形障碍物。","related":["占据栅格地图","隐式表示 / 显式表示","鸟瞰图","自动驾驶","纯视觉方案","特斯拉 AI Day"]},{"id":"birds-eye-view","category":"perception","sec":11,"tier":3,"sources":[{"title":"BEVFormer (arXiv 2203.17270, ECCV 2022)","url":"https://arxiv.org/abs/2203.17270"},{"title":"Lift, Splat, Shoot (arXiv 2008.05711, ECCV 2020)","url":"https://arxiv.org/abs/2008.05711"}],"as_of":"","related_ids":["autonomous-driving","3d-object-detection","occupancy-network","elevation-map","multi-sensor-fusion","semantic-map"],"name":"鸟瞰图","alt":"Bird's-Eye View","abbr":"BEV","aliases":["BEV 感知","BEV 表示","俯视图"],"one_liner":"从正上方往下看的二维栅格表示，把多个传感器的信息统一铺到地面平面上。","explanation":"鸟瞰图（BEV）是一种以地面为平面、从正上方俯视的二维网格表示，每个格子存该位置的特征或语义。自动驾驶最先大规模使用它：Lift-Splat-Shoot（NVIDIA，ECCV 2020）先给每个像素预测深度分布，再把图像特征「拍扁」到 BEV 网格；BEVFormer（ECCV 2022，上海人工智能实验室等）用 Transformer 的交叉注意力从多路相机特征中查询 BEV 特征，并融合历史帧。好处是多相机、激光雷达都能对齐到同一坐标系，检测、分割和路径规划直接在这张图上做。机器人导航用的占据栅格、高程图和语义地图本质上也是 BEV 形式；它压缩了高度信息，所以桌面操作等更依赖高度的任务通常改用点云或体素。","example":"自动驾驶车把 6 路环视相机的图像转成一张以自车为中心、前后左右各几十米范围的 BEV 特征图，在上面同时框出车辆、画出车道线，再交给规划模块。","related":["自动驾驶","3D目标检测","占用网络","高程图","多传感器融合","语义地图"]},{"id":"elevation-map","category":"perception","sec":11,"tier":3,"sources":[{"title":"ANYbotics/elevation_mapping (GitHub)","url":"https://github.com/ANYbotics/elevation_mapping"},{"title":"leggedrobotics/elevation_mapping_cupy (GitHub)","url":"https://github.com/leggedrobotics/elevation_mapping_cupy"}],"as_of":"","related_ids":["height-scan","traversability-estimation","perceptive-locomotion","occupancy-grid-map","rough-terrain-locomotion","anybotics-anymal"],"name":"高程图","alt":"Elevation Map","abbr":"","aliases":["2.5D 高程图","Elevation Mapping","高度图","Height Map"],"one_liner":"把地面划成网格、每格记一个高度值的 2.5D 地形图，常用于足式机器人。","explanation":"高程图是一种 2.5D 地图：把机器人周围地面在水平面上划成规则网格，每格只存一个高度（通常还带方差表示不确定度），而不是完整的三维体素。数据来自深度相机、激光雷达等测距传感器，结合机器人位姿估计不断融合更新。ETH 苏黎世 Péter Fankhauser 等人 2014 年起开发的 elevation_mapping 是常用开源实现，以机器人为中心建图并显式考虑位姿漂移的不确定性，现已不再维护；2022 年的 elevation_mapping_cupy 把计算搬到 GPU，并加入可通行性、语义等图层。高程图比点云紧凑、查询快，四足和人形机器人的感知行走常从中读取脚下一圈的地形高度作为策略输入。局限是每格只有一个高度，表示不了桌子底下、桥洞这类悬空结构。","example":"在 Isaac Lab 里训练足式运控时，常在机器人周围取一圈网格点的地形高度（高度扫描）作为观测；部署到真机上，这些高度就从实时构建的高程图里查出来。","related":["高度扫描","可通行性估计","感知行走","占据栅格地图","复杂地形行走","ANYmal 四足"]},{"id":"height-scan","category":"perception","sec":11,"tier":3,"sources":[{"title":"Isaac Lab velocity_env_cfg.py（height_scanner 与 height_scan 观测定义）","url":"https://raw.githubusercontent.com/isaac-sim/IsaacLab/main/source/isaaclab_tasks/isaaclab_tasks/manager_based/locomotion/velocity/velocity_env_cfg.py"},{"title":"Learning robust perceptive locomotion for quadrupedal robots in the wild（Science Robotics 2022）","url":"https://arxiv.org/html/2201.08117"},{"title":"legged_gym legged_robot_config.py（measured_points 配置）","url":"https://raw.githubusercontent.com/leggedrobotics/legged_gym/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["elevation-map","perceptive-locomotion","blind-locomotion","teacher-student-distillation","nvidia-isaac-lab","legged-gym"],"name":"高度扫描","alt":"Height Scan","abbr":"","aliases":["height_scan","足端周围高度采样","地形高度图","Height Samples"],"one_liner":"在机器人周围按固定图案采样地面高度，作为运控策略的地形输入。","explanation":"高度扫描是足式机器人强化学习运控里常用的地形观测：以机身为中心，在周围一片区域或每只脚周围按固定图案采样若干点的地面高度，拼成向量喂给策略网络。仿真里通常从机器人上方向下打射线，直接读出真值高度；真机没有这种上帝视角，要先用深度相机或激光雷达建高程图（2.5D 的地面高度栅格），再从图上采样。真机高程图有噪声和遮挡，常见做法是先用无噪高度训练教师策略，再蒸馏给读真实高程图的学生策略。只靠本体感知、不用高度扫描的策略叫盲走。","example":"Isaac Lab 的速度跟踪任务在机身挂一个射线投射传感器，以 0.1 m 间隔在 1.6 m × 1.0 m 的网格上测地面高度；Miki 等人 2022 年的 ANYmal 工作则在每只脚周围按 5 圈同心圆采 52 个点，四条腿共 208 维。","related":["高程图","感知行走","盲走","教师-学生蒸馏","Isaac Lab","legged_gym"]},{"id":"traversability-estimation","category":"perception","sec":11,"tier":3,"sources":[{"title":"Fast Traversability Estimation for Wild Visual Navigation (RSS 2023, arXiv:2305.08510)","url":"https://arxiv.org/abs/2305.08510"}],"as_of":"","related_ids":["elevation-map","costmap","perceptive-locomotion","rough-terrain-locomotion","navigation","semantic-segmentation"],"name":"可通行性估计","alt":"Traversability Estimation","abbr":"","aliases":["可通行区域分析","地形可通行性","可通行性分析"],"one_liner":"判断前方地形哪里能走、哪里不能走、走起来代价多大。","explanation":"轮式、足式等移动机器人在导航前要回答的问题：前方每一块地面能不能安全通过、通过难度多大。传统方法从高程图（记录每个网格地面高度的二维地图）算坡度、粗糙度和台阶高度来判断；这种纯几何方法会把高草、树枝误当成障碍，于是后来又加入语义信息（草地、泥地、水面）和从机器人自身行走经验里自监督学习的方法。结果通常输出成可通行性地图或代价地图，交给路径规划器选路。ETH 苏黎世与牛津团队 2023 年的 Wild Visual Navigation 让四足机器人 ANYmal 在现场训练不到 5 分钟就学会区分可踩的植被和真正的障碍。","example":"ANYmal 四足机器人用 Wild Visual Navigation，经人短暂带领后就能在林间穿过高草、绕开树干，并完成 1.4 km 的步道导航。","related":["高程图","代价地图","感知行走","复杂地形行走","导航","语义分割"]},{"id":"topological-map","category":"perception","sec":11,"tier":3,"sources":[{"title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs (arXiv 2407.07775)","url":"https://arxiv.org/abs/2407.07775"},{"title":"ViNT: A Foundation Model for Visual Navigation (arXiv 2306.14846)","url":"https://arxiv.org/abs/2306.14846"}],"as_of":"","related_ids":["navigation","occupancy-grid-map","semantic-map","a-star-search","vint","mobility-vla"],"name":"拓扑地图","alt":"Topological Map (Topological Graph)","abbr":"","aliases":["拓扑图","拓扑图地图"],"one_liner":"用「地点节点+连通边」表示环境的地图，只记哪里能到哪里，不记精确坐标。","explanation":"拓扑地图把环境表示成一张图：节点是有代表性的地点（如某个房间、路口，或一张关键帧图像），边表示两个地点之间可以直接走通。它和占据栅格这类度量地图不同，不要求每个位置都有精确的米制坐标，所以更省存储、规模可以很大，也更接近人描述路线的方式（「出门左转到走廊，再到厨房」）。导航时先在图上用 A* 等算法搜出节点序列，再由局部控制器或策略在相邻节点之间移动。近年的学习型导航大量使用它：ViNT、NoMaD 以图像为节点做长距离导航，Mobility VLA 则从一段带人参观的视频建出拓扑图，再结合视觉语言模型理解指令找到目标节点。","example":"让机器人先跟人在办公楼里走一圈并录像，每隔几秒存一张图作为节点，之后说「去打印机那」，它就在图里找到对应节点并规划一串节点走过去。","related":["导航","占据栅格地图","语义地图","A* 算法","ViNT","Mobility VLA"]},{"id":"semantic-map","category":"perception","sec":11,"tier":3,"sources":[{"title":"VLMaps 项目主页","url":"https://vlmaps.github.io/"},{"title":"arXiv 2210.05714: Visual Language Maps for Robot Navigation","url":"https://arxiv.org/abs/2210.05714"}],"as_of":"","related_ids":["semantic-slam","vlmaps","conceptgraphs","3d-scene-graph","object-goal-navigation","occupancy-grid-map"],"name":"语义地图","alt":"Semantic Map","abbr":"","aliases":["开放词汇语义地图","语言地图"],"one_liner":"在几何地图上标注「这里是什么」，能按物体或自然语言查询的地图","explanation":"普通 SLAM 地图只记录哪里有障碍、表面在哪；语义地图在此基础上给地图中的点、栅格或物体附上类别标签或特征，能回答「冰箱在哪」「厨房在哪」。早期做法是用固定类别的检测或分割网络打标签；近几年流行开放词汇语义地图，把 CLIP、LSeg 等视觉语言模型的特征直接存进地图，用任意自然语言查询。代表工作 VLMaps（2022，弗赖堡大学与谷歌等）从 RGB-D 视频提取像素级视觉语言特征，借助深度反投影到 3D，再存进俯视栅格地图，能执行「去沙发和电视之间」这类带空间关系的导航指令。语义地图也可组织成 3D 场景图，是物体目标导航、视觉语言导航和移动操作常用的中间表示。","example":"VLMaps 让 LoCoBot 和无人机共用同一张语言地图，按「移到椅子右边三米」这类指令导航。","related":["语义SLAM","VLMaps","ConceptGraphs","3D场景图","物体目标导航","占据栅格地图"]},{"id":"semantic-slam","category":"perception","sec":11,"tier":3,"sources":[{"title":"arXiv 1910.02490: Kimera","url":"https://arxiv.org/abs/1910.02490"},{"title":"arXiv 2505.12384: Is Semantic SLAM Ready for Embedded Systems?","url":"https://arxiv.org/abs/2505.12384"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","semantic-map","visual-slam","3d-scene-graph","gaussian-splatting-slam","conceptgraphs"],"name":"语义SLAM","alt":"Semantic SLAM","abbr":"","aliases":["度量-语义 SLAM","Metric-Semantic SLAM"],"one_liner":"在定位建图的同时识别物体类别，输出带语义标签的地图","explanation":"语义 SLAM 是在传统 SLAM（同步定位与建图）里加入语义信息的一类方法：一边估计自身位姿、构建几何地图，一边用检测或分割网络识别墙、桌子、椅子等，把类别写进地图。语义也能反过来帮 SLAM，比如剔除人、车等会动的物体，减少它们对位姿估计的干扰，或以物体为地标做回环检测。代表工作有 2013 年以物体为单位建图的 SLAM++，以及 MIT SPARK 实验室 2019 年开源的 Kimera，它用相机和 IMU 在 CPU 上实时生成带语义标签的三维网格。近年也有基于 NeRF、3D 高斯泼溅的语义 SLAM，但在嵌入式平台上开销仍大。它的输出就是语义地图。","example":"Kimera 用双目相机加 IMU 在室内走一圈，实时输出带「墙、地板、椅子」等语义标签的 3D 网格地图。","related":["同步定位与建图","语义地图","视觉SLAM","3D场景图","高斯泼溅 SLAM","ConceptGraphs"]},{"id":"3d-scene-graph","category":"perception","sec":11,"tier":3,"sources":[{"title":"3D Scene Graph: A Structure for Unified Semantics, 3D Space, and Camera (arXiv 1910.02527)","url":"https://arxiv.org/abs/1910.02527"},{"title":"Hydra: A Real-time Spatial Perception System for 3D Scene Graph Construction and Optimization (arXiv 2201.13360)","url":"https://arxiv.org/abs/2201.13360"},{"title":"ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning (arXiv 2309.16650)","url":"https://arxiv.org/abs/2309.16650"}],"as_of":"","related_ids":["conceptgraphs","sayplan","semantic-map","scene-understanding","llm-based-task-planning"],"name":"3D场景图","alt":"3D Scene Graph","abbr":"","aliases":["三维场景图","3DSG","3D Scene Graphs"],"one_liner":"用分层的图把三维场景里的楼层、房间、物体和它们的关系组织起来。","explanation":"3D 场景图是一种结构化的场景表示：节点是场景里的实体（建筑、楼层、房间、物体、相机位置等），边是它们之间的关系（「在……里」「在……上」「挨着」），节点上再挂类别、尺寸、三维位置等属性。Armeni 等人在 ICCV 2019 提出这一结构，分建筑、房间、物体、相机四层；MIT 的 Hydra（RSS 2022）让机器人边探索边实时构建分层场景图。相比稠密点云或网格，场景图体积小、语义清楚，能直接回答「冰箱在哪个房间」，也便于转成文本交给大语言模型做任务规划。ConceptGraphs 用 2D 基础模型构建开放词汇场景图，SayPlan 则让大模型在场景图上搜索、规划跨房间的长程任务。","example":"机器人收到「把厨房桌上的苹果拿到客厅」：先在场景图里沿 厨房→桌子→苹果 找到目标节点和客厅节点，再依次调用导航、抓取、放置技能。","related":["ConceptGraphs","SayPlan","语义地图","场景理解","大模型任务规划"]},{"id":"conceptgraphs","category":"perception","sec":11,"tier":3,"sources":[{"title":"ConceptGraphs (arXiv 2309.16650)","url":"https://arxiv.org/abs/2309.16650"},{"title":"ConceptGraphs 项目页","url":"https://concept-graphs.github.io/"}],"as_of":"2024-05","related_ids":["3d-scene-graph","open-vocabulary","semantic-map","clip","llm-based-task-planning","sayplan"],"name":"ConceptGraphs","alt":"ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning","abbr":"","aliases":["开放词汇 3D 场景图（ConceptGraphs）"],"one_liner":"把多视角图像融合成开放词汇的 3D 物体场景图，供大模型推理和机器人规划使用。","explanation":"ConceptGraphs 由 MIT、蒙特利尔大学、多伦多大学等团队提出（第一作者 Qiao Gu），发表于 ICRA 2024。它逐帧用通用分割模型切出物体区域，提取每块区域的 CLIP 特征，借助深度投影成 3D 点云，再跨视角把属于同一物体的区域合并，得到一组带语义特征的 3D 物体；随后用 LLaVA 为物体生成文字描述、用 GPT-4 推断物体间的空间关系作为边，构成 3D 场景图（节点是物体，边是关系）。全程不需要 3D 标注，也不微调模型。建好的图可转成文本交给大模型，回答「找一个篮球」这类查询；论文在 Jackal 等移动机器人上演示了物体检索、重定位，以及判断哪些障碍物可以推开的导航任务。","example":"机器人先在房子里转一圈建好场景图，用户说「找个能把手机垫高的东西」，大模型从图中物体描述里挑出「书」，机器人按该节点的 3D 位置导航过去。","related":["3D场景图","开放词汇","语义地图","CLIP","大模型任务规划","SayPlan"]},{"id":"distilled-feature-fields","category":"perception","sec":11,"tier":3,"sources":[{"title":"arXiv 2205.15585: Decomposing NeRF for Editing via Feature Field Distillation","url":"https://arxiv.org/abs/2205.15585"},{"title":"arXiv 2308.07931: Distilled Feature Fields Enable Few-Shot Language-Guided Manipulation","url":"https://arxiv.org/abs/2308.07931"},{"title":"F3RM project page","url":"https://f3rm.github.io/"}],"as_of":"","related_ids":["f3rm","lerf","neural-radiance-fields","clip","knowledge-distillation","3d-gaussian-splatting"],"name":"蒸馏特征场","alt":"Distilled Feature Fields","abbr":"DFF","aliases":["特征场","Feature Fields","语言嵌入场","特征场蒸馏"],"one_liner":"把 CLIP、DINO 等 2D 模型的特征蒸馏进 3D 场景，让每个空间点带语义。","explanation":"蒸馏特征场是在神经辐射场（NeRF，用多视角照片重建三维场景的神经表示）或高斯泼溅等 3D 表示里，除颜色和密度外再给空间每一点学一个特征向量，训练目标是让它渲染到各视角后与 CLIP、DINO 等 2D 基础模型提取的图像特征一致，相当于把 2D 模型的知识蒸馏进 3D。名称来自 Preferred Networks 与 MIT 的 Kobayashi、Sitzmann 等人 2022 年的 NeurIPS 论文，当时用来按文字或点击选中并编辑 NeRF 里的物体。它既有精确几何，又能用自然语言在三维空间里定位物体。机器人方面，MIT 的 F3RM 用 CLIP 蒸馏特征场做少样本、语言引导的 6 自由度抓取与放置，获 CoRL 2023 最佳论文；LERF 也属同类思路。","example":"F3RM 先对桌面拍一组多视角照片，重建出带 CLIP 特征的场景；抓杯口这类任务每个只示范两次，之后就能按文字指令去抓外形、类别都没见过的物体。","related":["F3RM","LERF","神经辐射场","CLIP","知识蒸馏","3D高斯泼溅"]},{"id":"lerf","category":"perception","sec":11,"tier":3,"sources":[{"title":"LERF: Language Embedded Radiance Fields (ICCV 2023 项目主页)","url":"https://www.lerf.io/"},{"title":"Language Embedded Radiance Fields for Zero-Shot Task-Oriented Grasping (LERF-TOGO, arXiv 2309.07970)","url":"https://arxiv.org/abs/2309.07970"}],"as_of":"","related_ids":["neural-radiance-fields","clip","distilled-feature-fields","f3rm","open-vocabulary","3d-visual-grounding"],"name":"LERF","alt":"Language Embedded Radiance Fields","abbr":"LERF","aliases":["语言嵌入辐射场","LERF-TOGO（抓取扩展）"],"one_liner":"把 CLIP 语言特征嵌进 NeRF，能用自然语言在三维场景里找东西。","explanation":"LERF 是 UC Berkeley 的 Justin Kerr、Chung Min Kim、Angjoo Kanazawa 等人提出的方法，发表于 ICCV 2023（口头报告）。它在神经辐射场（NeRF，用网络表示场景各点颜色和密度）之外，再学一个多尺度的语言场：空间中的点在不同尺度上对应一个 CLIP 向量，训练时用多视角图像金字塔上提取的 CLIP 特征监督，并用 DINO 特征做正则，让物体边界更清楚。建好后输入任意文字，就能在三维空间里渲染出相关度热图，不需要检测框、分割掩码或微调模型。它是把视觉语言模型的开放词汇能力搬进三维场景的早期代表，代码集成在 Nerfstudio 中。","example":"LERF-TOGO（2023）先用 LERF 在场景里定位「杯子的把手」这类物体部位，再给现成抓取规划器的候选抓取排序；在 31 个真实物体上，选对部位的比例为 81%，抓取成功率为 69%。","related":["神经辐射场","CLIP","蒸馏特征场","F3RM","开放词汇","3D视觉定位"]},{"id":"3d-visual-grounding","category":"perception","sec":11,"tier":3,"sources":[{"title":"ScanRefer: 3D Object Localization in RGB-D Scans using Natural Language (ECCV 2020)","url":"https://daveredrum.github.io/ScanRefer/"},{"title":"ReferIt3D: Neural Listeners for Fine-Grained 3D Object Identification in Real-World Scenes (ECCV 2020)","url":"https://referit3d.github.io/"}],"as_of":"","related_ids":["visual-grounding","scannet","3d-object-detection","3d-scene-graph","open-vocabulary-object-detection","language-grounding"],"name":"3D视觉定位","alt":"3D Visual Grounding","abbr":"","aliases":["3D Grounding","3D 视觉接地","3D 指代定位","3D Referring Expression Grounding"],"one_liner":"根据一句话的描述，在三维场景里找到它指的那个物体。","explanation":"3D 视觉定位把 2D 视觉定位（用文字在图片里框出目标）搬到三维场景：输入场景的点云或多视角图像，加一句描述，如「靠窗那把椅子旁边的垃圾桶」，输出目标物体的三维包围框。中文「视觉定位」也常指估计相机自身位置，这里指的是 grounding。难点是场景里常有多个同类物体，必须理解「左边」「最大的」「挨着门」这类空间关系才能区分。ScanRefer 和 ReferIt3D（均发表于 ECCV 2020）在 ScanNet 室内扫描上建立了基准，前者含约 5.2 万条描述、1.1 万个物体，后者含 Nr3D 自然描述和 Sr3D 空间关系描述两套数据。对机器人来说，它是把语言指令落到具体物体上的关键一步。","example":"用户说「把书桌上最右边那个蓝色杯子给我」，机器人先在重建好的房间点云里做 3D 视觉定位，得到那只杯子的三维框，再规划抓取。","related":["视觉定位（Grounding）","ScanNet 数据集","3D目标检测","3D场景图","开放词汇检测","语言接地"]},{"id":"visual-question-answering","category":"perception","sec":11,"tier":2,"sources":[{"title":"VQA: Visual Question Answering (ICCV 2015)","url":"https://arxiv.org/abs/1505.00468"},{"title":"VQA 官网（VQA v2 数据集与挑战赛）","url":"https://visualqa.org/"},{"title":"π0.5: a Vision-Language-Action Model with Open-World Generalization（协同训练用到 VQAv2 等网络数据）","url":"https://arxiv.org/abs/2504.16054"}],"as_of":"2025-04","related_ids":["vision-language-model","multimodal-large-language-model","embodied-question-answering","co-training","erqa","vsi-bench"],"name":"视觉问答","alt":"Visual Question Answering","abbr":"VQA","aliases":["图像问答"],"one_liner":"给一张图和一个自然语言问题，让模型用文字作答。","explanation":"视觉问答输入一张图和关于它的问题（如「桌上有几个杯子」），输出自然语言答案，需要同时理解画面、语言和常识。任务由 Antol、Agrawal 等人在 ICCV 2015 提出，VQA 数据集约 25 万张图、76 万个问题；2017 年的 VQA v2 做了平衡，减少模型不看图、只凭问题猜答案。如今视觉语言模型大多用问答形式训练和评测，ERQA、VSI-Bench 等具身与空间推理基准也是问答形式；训练 VLA 时常混入 VQA 数据协同训练，如 π0.5 用了 VQAv2 等网络数据来保住看图理解能力。和具身问答不同，VQA 只看给定图片，不需要机器人移动去找答案。","example":"给模型一张厨房台面照片，问「水槽左边的杯子是空的吗」，模型回答「是空的」；具身推理基准会把这类问题换成「机器人夹爪要先移到哪个物体上方」。","related":["视觉语言模型","多模态大语言模型","具身问答","协同训练","ERQA 具身推理问答基准","VSI-Bench 视觉空间智能基准"]},{"id":"pointing","category":"perception","sec":11,"tier":2,"sources":[{"title":"Molmo and PixMo (arXiv 2409.17146)","url":"https://arxiv.org/abs/2409.17146"},{"title":"RoboPoint (arXiv 2406.10721)","url":"https://arxiv.org/abs/2406.10721"},{"title":"Gemini API Docs: Gemini Robotics-ER overview","url":"https://ai.google.dev/gemini-api/docs/robotics-overview"}],"as_of":"2026-09","related_ids":["molmo","robopoint","gemini-robotics-er","visual-prompting","affordance-detection","projection-back-projection"],"name":"指向（点预测）","alt":"Pointing (2D Point Prediction)","abbr":"","aliases":["点预测","指点","Point Prediction"],"one_liner":"视觉语言模型按文字指令，直接输出图像上目标位置的像素坐标。","explanation":"指向是让视觉语言模型（VLM）用「在图上点一个点」来回答：输入图像和一句指令，输出一个或多个 2D 像素坐标。Ai2 的 Molmo（2024）专门采集了 PixMo-Points 指点数据，能指出并清点物体；RoboPoint（2024）用自动合成的数据微调 VLM，预测该在哪里抓、放到哪里的关键点；Google DeepMind 的 Gemini Robotics-ER 以 [y, x] 格式输出归一化到 0–1000 的坐标。点比框更精细，也比文字更便于下游使用：结合深度图反投影即得三维目标位置，可交给抓取、运动规划或 VLA 模型执行。","example":"对 Gemini Robotics-ER 说「指出图中所有香蕉」，它返回形如 point: [376, 508]、label: small banana 的列表，每个点对应一根香蕉的位置。","related":["Molmo","RoboPoint","Gemini Robotics-ER","视觉提示","可供性检测","投影与反投影"]},{"id":"visual-prompting","category":"perception","sec":11,"tier":3,"sources":[{"title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V (arXiv)","url":"https://arxiv.org/abs/2310.11441"},{"title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting (arXiv)","url":"https://arxiv.org/abs/2403.03174"}],"as_of":"","related_ids":["visual-prompting-2","moka","pivot","visual-grounding","segment-anything-model","vision-language-model"],"name":"视觉提示","alt":"Visual Prompting (e.g. Set-of-Mark)","abbr":"","aliases":["Set-of-Mark","SoM","标记式视觉提示"],"one_liner":"在图上画框、标编号，让多模态大模型按标记回答","explanation":"视觉提示指不改模型权重，直接在输入图像上叠加框、点、箭头、编号等标记，引导多模态大模型关注并指代特定区域。代表方法是微软团队 2023 年提出的 Set-of-Mark（SoM）：先用 SAM、SEEM 等分割模型把图切成若干区域，在每块上标数字、掩码或框，再让 GPT-4V 用编号作答；论文报告零样本下在 RefCOCOg 指代任务上超过全量微调的专用模型。它解决的是大模型能描述画面、却难以用文字精确说出像素位置的问题。机器人方向的 MOKA、PIVOT 等工作用这类标记让视觉语言模型挑出抓取点或移动方向，再交给底层控制执行。","example":"桌面照片上给每个物体标 1 到 8 号，问模型「哪个物体能用来舀汤」，模型回答「5 号」，程序再把 5 号区域换算成三维坐标交给机械臂。","related":["视觉提示（Set-of-Mark 标记提示）","MOKA（标记式视觉提示操作）","PIVOT（迭代视觉提示）","视觉定位（Grounding）","分割一切模型","视觉语言模型"]},{"id":"vsi-bench","category":"perception","sec":11,"tier":3,"sources":[{"title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces (arXiv)","url":"https://arxiv.org/abs/2412.14171"},{"title":"Thinking in Space 项目主页","url":"https://vision-x-nyu.github.io/thinking-in-space.github.io/"},{"title":"vision-x-nyu/thinking-in-space (GitHub)","url":"https://github.com/vision-x-nyu/thinking-in-space"}],"as_of":"2025-06","related_ids":["spatial-intelligence","spatial-reasoning","multimodal-large-language-model","benchmark","erqa","3d-vision"],"name":"VSI-Bench 空间智能基准","alt":"VSI-Bench (Thinking in Space: Visual-Spatial Intelligence Benchmark)","abbr":"VSI-Bench","aliases":["VSI-Bench 视觉空间智能基准","Thinking in Space"],"one_liner":"用室内视频考多模态大模型空间理解能力的评测基准","explanation":"VSI-Bench 出自论文 Thinking in Space，由纽约大学谢赛宁团队联合耶鲁、斯坦福（含李飞飞）于 2024 年 12 月发布，入选 CVPR 2025 口头报告。它从 ScanNet、ScanNet++、ARKitScenes 三个室内扫描数据集选了 288 段第一人称视频，构造 5000 多道问答，覆盖 8 类任务：物体计数、相对距离、相对方向、物体尺寸、绝对距离、房间大小、出现顺序和路线规划。作者测了 15 个支持视频输入的多模态大模型，普遍明显低于人类（人类平均约 79%），主要卡在空间推理；思维链这类语言提示反而会掉分，而先让模型画出「认知地图」能改善距离判断。","example":"给模型看一段绕客厅拍的视频，问「沙发和电视相距几米」「站在冰箱前面向水槽，炉灶在你左边还是右边」，按数值误差或选择题正确率打分。","related":["空间智能","空间推理","多模态大语言模型","基准测试","ERQA 具身推理问答基准","3D视觉"]},{"id":"active-perception","category":"perception","sec":11,"tier":3,"sources":[{"title":"Revisiting Active Perception (Bajcsy, Aloimonos, Tsotsos, arXiv:1603.02729)","url":"https://arxiv.org/abs/1603.02729"}],"as_of":"","related_ids":["interactive-perception","next-best-view-planning","active-exploration","perception-action-loop","embodied-perception","head-camera"],"name":"主动感知","alt":"Active Perception","abbr":"","aliases":["主动视觉","Active Vision","主动传感","Active Sensing"],"one_liner":"机器人为了看清、摸清目标，主动移动传感器或身体去获取信息。","explanation":"主动感知指智能体不只是被动接收传感器数据，而是根据任务和当前判断，主动决定看哪里、怎么看、什么时候看。这一思路由 Ruzena Bajcsy 在 1985 年提出、1988 年发表于《Proceedings of the IEEE》，同年 Aloimonos 等人提出「主动视觉」。2016 年 Bajcsy、Aloimonos、Tsotsos 的综述给出定义：智能体知道为什么要感知，再选择感知什么，并决定如何、何时、在哪里感知。它要解决的是单个视角信息不够的问题，比如遮挡、目标在视野外、光线差。具身智能里的常见形式有转头换视角、调整腕部相机、伸手摸一下确认材质，和下一最佳视角规划、交互式感知、主动探索关系密切。","example":"杯子被纸盒挡住一半，人形机器人转头、弯腰换个角度再拍一张，确认杯柄朝向后再去抓。","related":["交互式感知","下一最佳视角","主动探索","感知-行动闭环","具身感知","头部相机"]},{"id":"next-best-view-planning","category":"perception","sec":11,"tier":3,"sources":[{"title":"The determination of next best views (Connolly, ICRA 1985) - Semantic Scholar","url":"https://www.semanticscholar.org/paper/The-determination-of-next-best-views-Connolly/3d18fbad2b81c108955e8c293a51fe985b0e127e"}],"as_of":"","related_ids":["active-perception","active-exploration","occupancy-grid-map","octomap","occlusion","wrist-camera"],"name":"下一最佳视角","alt":"Next-Best-View (NBV) Planning","abbr":"NBV","aliases":["NBV 规划","最佳下一视角"],"one_liner":"根据已看到的内容，决定传感器下一步去哪个位置观察最划算。","explanation":"下一最佳视角规划研究的是：在已有的部分观测基础上，选出下一个相机或扫描仪位姿，使新增的信息最多、代价最小。最早可追溯到 1985 年 Connolly 在 ICRA 上的论文，他用部分八叉树模型评估候选视角。常见做法是在占据地图上统计每个候选视角能看到多少未知体素，再加上移动代价打分。它用于物体三维扫描、场景探索和被遮挡物体的抓取，是主动感知的核心问题之一。","example":"机械臂带着腕部相机扫描未知物体，每步都移到能看到最多未观测区域的位置，直到模型补全。","related":["主动感知","主动探索","占据栅格地图","八叉树地图","遮挡","腕部相机"]},{"id":"interactive-perception","category":"perception","sec":11,"tier":3,"sources":[{"title":"arXiv 1604.03670: Interactive Perception: Leveraging Action in Perception and Perception in Action（IEEE T-RO 2017）","url":"https://arxiv.org/abs/1604.03670"}],"as_of":"","related_ids":["active-perception","articulation-estimation","affordance","perception-action-loop","non-prehensile-manipulation","embodied-perception"],"name":"交互式感知","alt":"Interactive Perception","abbr":"","aliases":["交互感知"],"one_liner":"机器人主动推、拨、拉物体，借动作引起的变化来看懂环境。","explanation":"交互式感知指机器人通过与环境的物理接触（推、戳、拉、拿起翻看）改变场景，并利用动作带来的感官变化去理解环境。Bohg、Hausman、Brock、Kragic 等人 2017 年在 IEEE T-RO 发表的综述系统总结了这个方向，核心观点有两条：交互会产生静止观察得不到的信号；知道自己做了什么动作，就能更好地预测和解释随之而来的信号。它和主动感知不同：主动感知一般只移动相机、换视角，不改变环境；交互式感知则动手改变环境。典型用途有分割挤在一起的物体、估计抽屉或柜门的铰接轴、判断物体的质量和摩擦等物理属性。","example":"几块积木紧挨着，只看图像分不清边界；机器人推一下，一起移动的像素属于同一块积木，据此完成分割。拉开抽屉时跟踪把手的运动，也能估出抽屉的滑动方向。","related":["主动感知","铰接结构估计","可供性","感知-行动闭环","非抓取操作","具身感知"]},{"id":"python-and-c-plus-plus","category":"software","sec":0,"tier":1,"sources":[{"title":"Python official site","url":"https://www.python.org/"},{"title":"ROS 2 Client Libraries (rclcpp / rclpy)","url":"https://docs.ros.org/en/jazzy/Concepts/Basic/About-Client-Libraries.html"}],"as_of":"","related_ids":["pytorch","robot-operating-system-2","software-development-kit","torchscript-libtorch","real-time-control"],"name":"Python 与 C++（具身常用编程语言）","alt":"Python and C++","abbr":"","aliases":["Python","C++"],"one_liner":"具身智能最常用的两门语言：Python 做模型和实验，C++ 做实时控制","explanation":"具身智能开发基本离不开这两门语言，分工比较清楚。Python 写起来快、生态好，深度学习框架（PyTorch、JAX）、仿真训练（Isaac Lab、MuJoCo 的 Python 接口）、数据处理和 VLA 模型训练几乎都用它。C++ 运行效率高、时延可控，适合对实时性要求高的部分，如电机底层控制、全身控制、运动规划、传感器驱动，以及 ROS 里的高性能节点、机器人厂商的 SDK。常见做法是用 Python 训练策略，再导出模型在 C++ 里加载运行，或由 Python 上层调用 C++ 写的底层库。新人一般先熟练 Python，再按方向补 C++。","example":"用 Python 在 Isaac Lab 里训练四足行走策略，导出成 ONNX（通用的神经网络模型交换格式）后在 C++ 控制程序里以固定频率推理并下发电机指令。","related":["PyTorch","ROS 2","软件开发工具包","TorchScript / LibTorch（策略导出与 C++ 部署）","实时控制"]},{"id":"ubuntu-linux","category":"software","sec":0,"tier":2,"sources":[{"title":"About Ubuntu","url":"https://ubuntu.com/about"},{"title":"ROS 2 Jazzy Installation","url":"https://docs.ros.org/en/jazzy/Installation.html"}],"as_of":"2024-05","related_ids":["ros-distribution","robot-operating-system-2","nvidia-jetpack-sdk","windows-subsystem-for-linux-2","docker","preempt-rt"],"name":"Ubuntu","alt":"Ubuntu Linux","abbr":"","aliases":["乌班图"],"one_liner":"Canonical 公司维护的 Linux 发行版，机器人开发的默认操作系统","explanation":"Ubuntu 是英国 Canonical 公司维护的开源 Linux 发行版，2004 年首发，每两年在 4 月发布一个长期支持（LTS）版本。它是机器人开发事实上的标准系统：ROS 2 每个发行版都绑定一个 Ubuntu LTS（如 Humble 对应 22.04，Jazzy 对应 24.04），英伟达 Jetson 的 JetPack 系统也基于 Ubuntu，Isaac Sim、多数 GPU 训练服务器同样以它为主要支持平台。新手装环境时最常见的坑就是 Ubuntu 版本和 ROS 版本不匹配。","example":"想装 ROS 2 Humble，就先装 Ubuntu 22.04；用 Windows 电脑的同学可以先通过 WSL2 装一个 Ubuntu 来练习。","related":["ROS 发行版","ROS 2","JetPack","WSL2（Windows 下的 Linux 子系统）","Docker","实时内核补丁"]},{"id":"windows-subsystem-for-linux-2","category":"software","sec":0,"tier":3,"sources":[{"title":"What is Windows Subsystem for Linux (Microsoft Learn)","url":"https://learn.microsoft.com/en-us/windows/wsl/about"},{"title":"Comparing WSL Versions (Microsoft Learn)","url":"https://learn.microsoft.com/en-us/windows/wsl/compare-versions"},{"title":"CUDA on WSL User Guide (NVIDIA)","url":"https://docs.nvidia.com/cuda/wsl-user-guide/index.html"}],"as_of":"","related_ids":["ubuntu-linux","robot-operating-system-2","docker","cuda","conda","secure-shell"],"name":"WSL2（Windows 下的 Linux 子系统）","alt":"Windows Subsystem for Linux 2","abbr":"WSL2","aliases":["WSL 2"],"one_liner":"微软在 Windows 里跑完整 Linux 环境的官方功能，不用装双系统","explanation":"WSL2 是微软为 Windows 10/11 提供的 Linux 子系统第二版，用轻量虚拟机运行真正的 Linux 内核，比第一版的系统调用翻译兼容性更好、文件和编译速度更快。它解决的是「手上只有 Windows 电脑，但机器人软件几乎都跑在 Ubuntu 上」的问题：装好后可直接用 apt、Conda、Docker，并能通过 CUDA on WSL 调用 NVIDIA 显卡训练模型，还能显示 RViz 这类图形界面。缺点是 USB 设备、实时性和网络配置不如原生 Linux，接真机调试时常要额外处理。","example":"在 Windows 笔记本上执行 wsl --install 装好 Ubuntu 22.04，再在里面装 ROS 2 Humble，跑海龟仿真入门。","related":["Ubuntu","ROS 2","Docker","CUDA","Conda","SSH 远程登录"]},{"id":"github","category":"software","sec":0,"tier":1,"sources":[{"title":"GitHub Docs: What is GitHub?（Git 与 GitHub 的区别）","url":"https://docs.github.com/en/get-started/start-your-journey/what-is-github"}],"as_of":"","related_ids":["open-source-license","lerobot","arxiv-preprint","open-weight-model","hugging-face"],"name":"GitHub（代码托管平台）","alt":"GitHub","abbr":"","aliases":["GitHub 仓库"],"one_liner":"全球最大的代码托管平台，论文代码和开源项目基本都放在这里","explanation":"GitHub 是代码托管平台，2018 年被微软收购。它和 Git 不是一回事：Git 是在本地记录代码每次修改的版本控制工具，GitHub 把 Git 仓库放到云端，再加上协作功能。每个项目是一个「仓库」（repository），里面放代码、说明文档（README）、开源许可证和问题讨论（Issues）。具身智能领域的论文代码、模型训练框架、仿真环境、机器人 SDK 大多在 GitHub 开源，读论文后去看官方仓库是复现的第一步。常用操作是 git clone 把仓库拉到本地，按 README 装依赖、下权重、跑示例；遇到问题先搜 Issues，很多坑别人已经踩过。","example":"Hugging Face 的 LeRobot 代码在 github.com/huggingface/lerobot，git clone 后按 README 安装即可。","related":["开源许可证","LeRobot","arXiv 预印本","开放权重","Hugging Face"]},{"id":"conda","category":"software","sec":0,"tier":2,"sources":[{"title":"conda documentation","url":"https://docs.conda.io/"}],"as_of":"","related_ids":["uv","docker","pytorch","cuda","package-mirror-sources-in-china"],"name":"Conda","alt":"Conda","abbr":"","aliases":["Anaconda","Miniconda","Miniforge","conda 环境"],"one_liner":"Python 圈常用的包与虚拟环境管理器，隔离不同项目的依赖","explanation":"Conda 是开源的包管理和环境管理工具，最早由 Anaconda 公司推出。它能为每个项目建一个独立环境，各自装不同版本的 Python 和库，互不干扰；除了 Python 包，还能装 CUDA 工具包、编译器等非 Python 依赖。Anaconda 是自带大量科学计算包的完整发行版，Miniconda 是只带 conda 本体的精简版，Miniforge 是社区版本，默认从 conda-forge 源下载。具身项目依赖版本经常互相冲突（如仿真器要求特定 Python 版本），多数开源代码的安装说明都从建一个 conda 环境开始。","example":"conda create -n lerobot python=3.10，conda activate lerobot，然后按项目说明 pip install -e .。","related":["uv","Docker","PyTorch","CUDA","国内镜像源（换源：清华 TUNA / 阿里云等）"]},{"id":"uv","category":"software","sec":0,"tier":3,"sources":[{"title":"uv documentation","url":"https://docs.astral.sh/uv/"},{"title":"astral-sh/uv GitHub","url":"https://github.com/astral-sh/uv"}],"as_of":"","related_ids":["conda","docker","openpi","package-mirror-sources-in-china","lerobot"],"name":"uv","alt":"uv (Python package manager)","abbr":"","aliases":["astral uv"],"one_liner":"用 Rust 写的极快 Python 包与虚拟环境管理工具。","explanation":"uv 是 Astral 公司（也是代码检查工具 Ruff 的作者）在 2024 年开源的 Python 包管理器，用 Rust 实现。它把 pip（装包）、virtualenv（建虚拟环境）、pip-tools（锁版本）、pyenv（管 Python 版本）等工具的功能合到一个命令里，解析依赖和安装速度比 pip 快很多。项目用 pyproject.toml 声明依赖，uv 生成 uv.lock 锁定精确版本，换机器也能复现同一环境。具身开源代码依赖多、版本冲突常见，越来越多项目改用 uv 管环境。国内使用时可以给它配置镜像源加速。","example":"按 openpi 仓库说明，克隆代码后执行 uv sync 一次装好全部依赖，再用 uv run 运行训练脚本。","related":["Conda","Docker","openpi","国内镜像源（换源：清华 TUNA / 阿里云等）","LeRobot"]},{"id":"package-mirror-sources-in-china","category":"software","sec":0,"tier":2,"sources":[{"title":"清华大学开源软件镜像站 PyPI 帮助","url":"https://mirrors.tuna.tsinghua.edu.cn/help/pypi/"},{"title":"阿里云开源镜像站","url":"https://developer.aliyun.com/mirror/"}],"as_of":"","related_ids":["conda","docker","uv","hugging-face-mirror","modelscope","ubuntu-linux"],"name":"国内镜像源（换源：清华 TUNA / 阿里云等）","alt":"Package Mirror Sources in China (pip / conda / apt / Docker mirrors)","abbr":"","aliases":["换源","镜像源","清华源","阿里源"],"one_liner":"把 pip、conda、apt 等下载地址换成国内镜像，解决装包慢或失败。","explanation":"pip、conda、apt、Docker 等工具默认从海外服务器下载软件包，在国内常常很慢或直接超时。高校和云厂商维护了同步副本，如清华大学 TUNA 协会的开源镜像站、阿里云、中科大、上海交大等镜像站，把配置里的下载地址改到这些镜像就叫「换源」。具身智能环境依赖多（PyTorch、ROS、仿真器、各种 Python 包），换源几乎是配环境的第一步。要注意：镜像同步有延迟，最新版本可能暂时拿不到；据报道 2024 年起多家国内 Docker Hub 镜像停止服务，拉镜像需另找可用来源；Hugging Face 模型则另有 HF 镜像站和魔搭社区可用。","example":"pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple 把 pip 默认源换成清华镜像。","related":["Conda","Docker","uv","HF 镜像站","魔搭社区","Ubuntu"]},{"id":"cmake","category":"software","sec":0,"tier":2,"sources":[{"title":"CMake 官网","url":"https://cmake.org/"}],"as_of":"","related_ids":["colcon","ament","catkin","cross-compilation","python-and-c-plus-plus"],"name":"CMake","alt":"CMake","abbr":"","aliases":["CMakeLists.txt"],"one_liner":"C/C++ 项目的跨平台构建配置工具，写清楚「怎么编译」","explanation":"CMake 是 Kitware 公司主导开发的开源构建系统生成器。C/C++ 代码要经过编译、链接才能变成可执行程序，文件多了以后需要一份说明书告诉编译器先编哪个、依赖哪些库。CMake 读项目里的 CMakeLists.txt，生成对应平台的构建文件（如 Makefile 或 Ninja 文件），再由它们调用编译器。机器人里大量底层代码是 C++，ROS 1 的 catkin 和 ROS 2 的 ament_cmake 都建立在 CMake 之上，Pinocchio、OpenCV 等库从源码安装时也要用它。","example":"源码安装一个库的常见三步：mkdir build && cd build，cmake ..，make -j8。","related":["colcon","ament","catkin","交叉编译","Python 与 C++（具身常用编程语言）"]},{"id":"docker","category":"software","sec":0,"tier":2,"sources":[{"title":"Docker Docs: What is Docker?","url":"https://docs.docker.com/get-started/docker-overview/"}],"as_of":"","related_ids":["conda","ubuntu-linux","cuda","robot-operating-system-2","inference-deployment","autodl"],"name":"Docker","alt":"Docker","abbr":"","aliases":["容器","镜像","Dockerfile"],"one_liner":"把程序和运行环境打包成容器，换台机器也能原样跑","explanation":"Docker 是 Docker 公司推出的容器平台，2013 年开源。它把程序连同系统库、依赖、配置打包成一个「镜像」，镜像运行起来就是「容器」，容器与宿主机共享内核，比虚拟机轻量。镜像由 Dockerfile 脚本描述，可以上传到镜像仓库供别人拉取。机器人开发里常遇到 ROS 版本绑定特定 Ubuntu 版本、仿真器依赖复杂等问题，用 Docker 可以在同一台机器上跑不同环境；配合 NVIDIA Container Toolkit，容器里也能用 GPU。不少仿真器和部署工具链都提供官方 Docker 镜像。","example":"在 Ubuntu 24.04 主机上拉取 ROS 2 Humble 的官方镜像，在容器里编译运行需要 22.04 环境的驱动包。","related":["Conda","Ubuntu","CUDA","ROS 2","推理部署","AutoDL（GPU 算力租用平台）"]},{"id":"cuda","category":"software","sec":0,"tier":1,"sources":[{"title":"NVIDIA CUDA Toolkit","url":"https://developer.nvidia.com/cuda-toolkit"},{"title":"CUDA Programming Guide（NVIDIA 官方文档）","url":"https://docs.nvidia.com/cuda/cuda-programming-guide/"},{"title":"PyTorch Forums: Cuda versioning and pytorch compatibility（PyTorch 二进制包自带 CUDA 运行库，只需驱动支持）","url":"https://discuss.pytorch.org/t/cuda-versioning-and-pytorch-compatibility/189777"}],"as_of":"","related_ids":["cuda-deep-neural-network-library","pytorch","nvidia-tensorrt","gpu-memory","nvidia"],"name":"CUDA","alt":"Compute Unified Device Architecture","abbr":"CUDA","aliases":["CUDA Toolkit"],"one_liner":"英伟达的 GPU 通用计算平台，让深度学习能在显卡上跑","explanation":"CUDA 是英伟达推出的并行计算平台和编程模型，包括编译器、运行时库和数学库，让程序员能用 C/C++ 等语言直接调用英伟达 GPU 做通用计算。深度学习里的大量矩阵运算靠 GPU 并行加速，PyTorch 等框架在英伟达显卡上调用的就是 CUDA 及其配套库（如做神经网络算子的 cuDNN）。新人最常在装环境时碰到它：pip 装的 GPU 版 PyTorch 自带对应的 CUDA 运行库，只要显卡驱动够新、支持这个 CUDA 版本就能用，驱动太旧会报错或只能用 CPU；自己编译 CUDA 扩展时，本机 CUDA Toolkit 的版本才需要和 PyTorch 对上。仿真里的 GPU 并行（如 Isaac Lab）和部署加速（如 TensorRT）也都建立在 CUDA 之上。","example":"在 Python 里运行 torch.cuda.is_available()，返回 True 才说明 PyTorch 能用上 GPU。","related":["cuDNN","PyTorch","TensorRT","GPU 显存","英伟达"]},{"id":"secure-shell","category":"software","sec":0,"tier":2,"sources":[{"title":"OpenSSH","url":"https://www.openssh.com/"},{"title":"RFC 4251: The Secure Shell (SSH) Protocol Architecture","url":"https://www.rfc-editor.org/rfc/rfc4251"}],"as_of":"","related_ids":["ubuntu-linux","autodl","nvidia-jetson","docker","host-computer"],"name":"SSH 远程登录","alt":"Secure Shell (SSH)","abbr":"SSH","aliases":["ssh","OpenSSH"],"one_liner":"通过加密通道登录并操作另一台电脑命令行的网络协议","explanation":"SSH（安全外壳协议）是一种加密的远程登录协议，1995 年由芬兰的 Tatu Ylönen 提出，后由 IETF 标准化，最常用的实现是开源的 OpenSSH。它让你在自己电脑的终端里安全地登录另一台机器执行命令，还能传文件（scp、rsync）和做端口转发。具身智能开发中几乎天天用：登录机器人上的 Jetson 主控改代码、登录云端 GPU 服务器跑训练，VS Code、Cursor 的远程开发也基于 SSH。常见做法是配置密钥登录和 ~/.ssh/config 别名。","example":"机器人和笔记本连同一个 Wi-Fi 后，执行 ssh unitree@192.168.123.164 登录机载电脑，启动策略推理程序。","related":["Ubuntu","AutoDL（GPU 算力租用平台）","英伟达 Jetson","Docker","上位机"]},{"id":"robot-operating-system","category":"software","sec":1,"tier":1,"sources":[{"title":"ROS official site","url":"https://www.ros.org/"},{"title":"ROS Wiki: Introduction","url":"https://wiki.ros.org/ROS/Introduction"}],"as_of":"2025-05","related_ids":["robot-operating-system-2","node","topic","ros-distribution","rviz-rviz2","moveit-motion-planning-framework"],"name":"机器人操作系统","alt":"Robot Operating System","abbr":"ROS","aliases":["ROS 1","ROS1"],"one_liner":"机器人开发最通用的开源中间件框架，不是真正的操作系统","explanation":"ROS 名字叫操作系统，实际是一套运行在 Linux（多为 Ubuntu）之上的开源中间件和工具集合，起源于斯坦福，后由 Willow Garage 公司推动发展。它把机器人软件拆成一个个节点，用话题、服务等机制通信，并提供大量现成功能包：传感器驱动、坐标变换（TF）、可视化（RViz）、数据录制（rosbag）、导航和运动规划等。它的价值在于大家不用重复造轮子，学术界和产业界的很多机器人都有 ROS 接口。ROS 1 最后一个发行版 Noetic 已于 2025 年停止维护，新项目应使用 ROS 2，但大量老代码和教程仍是 ROS 1。","example":"用 roslaunch 一次启动相机驱动、机械臂驱动和 MoveIt 规划节点，再在 RViz 里拖动目标位姿让机械臂运动。","related":["ROS 2","节点","话题","ROS 发行版","RViz","MoveIt"]},{"id":"robot-operating-system-2","category":"software","sec":1,"tier":1,"sources":[{"title":"ROS 2 Documentation","url":"https://docs.ros.org/en/jazzy/index.html"},{"title":"ROS 2 Distributions（各发行版发布与停更时间）","url":"https://docs.ros.org/en/jazzy/Releases.html"},{"title":"Lyrical Luth Supported Platforms（平台支持等级与默认中间件）","url":"https://docs.ros.org/en/lyrical/Releases/lyrical/supported-platforms.html"}],"as_of":"2026-09","related_ids":["robot-operating-system","data-distribution-service","ros-2-quality-of-service","node","topic","colcon"],"name":"ROS 2","alt":"Robot Operating System 2","abbr":"ROS 2","aliases":["ROS2"],"one_liner":"ROS 的第二代重写版，底层通信默认用 DDS，是新项目的首选","explanation":"ROS 2 是对 ROS 1 的重新设计，由 Open Robotics（开源机器人基金会）主导开发。最大的变化是通信层默认改用工业界的 DDS（数据分发服务）中间件，不再需要一个中心主节点（roscore），节点能自动发现彼此；同时加入了服务质量（QoS）配置、更好的实时性和安全支持。官方一级支持 Ubuntu 和 Windows，macOS 只能自己从源码编译。它沿用了节点、话题、服务、动作等概念，但接口和构建工具（colcon、ament）与 ROS 1 不同，代码不能直接通用。目前仍在维护的长期支持版（LTS）是 Humble、Jazzy 和 2026 年 5 月发布、支持到 2031 年的 Lyrical。Nav2 导航、MoveIt 2、ros2_control 以及许多人形和四足机器人的 SDK 都已迁移到 ROS 2。","example":"在 Ubuntu 上装好 ROS 2 后运行 ros2 topic list，就能列出当前系统里所有活跃的话题。","related":["机器人操作系统","数据分发服务","服务质量","节点","话题","colcon"]},{"id":"ros-distribution","category":"software","sec":1,"tier":2,"sources":[{"title":"ROS 2 Documentation: Distributions","url":"https://docs.ros.org/en/rolling/Releases.html"},{"title":"ROS Wiki: Distributions","url":"https://wiki.ros.org/Distributions"}],"as_of":"2026-09","related_ids":["robot-operating-system-2","robot-operating-system","ubuntu-linux","fishros-one-click-installer","ros1-bridge"],"name":"ROS 发行版","alt":"ROS Distribution","abbr":"","aliases":["Noetic","Humble","Jazzy","Kilted","Lyrical Luth","ROS 版本"],"one_liner":"ROS 按版本打包发布的一整套软件集合，每版对应特定 Ubuntu。","explanation":"ROS 发行版是一组经过统一测试、版本固定的 ROS 核心库和功能包，每个版本有自己的代号，按字母顺序排列。ROS 2 每年 5 月发布一版，偶数年为长期支持版（LTS，约支持 5 年），并绑定当时的 Ubuntu LTS：Humble 对应 22.04，Jazzy 对应 24.04，Kilted Kaiju 为非 LTS 版，2026 年的 Lyrical Luth 为新 LTS；另有持续更新的开发版 Rolling。ROS 1 的最后一版 Noetic 已于 2025 年 5 月停止维护。选版本时要让系统、发行版和第三方包三者对得上，否则常出现依赖装不上；新项目一般选当前主流 LTS。","example":"Ubuntu 22.04 上装 ROS 2 Humble，用 source /opt/ros/humble/setup.bash 激活环境。","related":["ROS 2","机器人操作系统","Ubuntu","鱼香 ROS 一键安装","ros1_bridge"]},{"id":"fishros-one-click-installer","category":"software","sec":1,"tier":3,"sources":[{"title":"fishros/install (GitHub)","url":"https://github.com/fishros/install"},{"title":"鱼香ROS 社区","url":"https://fishros.org.cn/forum/"}],"as_of":"","related_ids":["robot-operating-system","robot-operating-system-2","ros-distribution","rosdep","ubuntu-linux","package-mirror-sources-in-china"],"name":"鱼香 ROS 一键安装","alt":"FishROS One-Click Installer","abbr":"","aliases":["fishros","小鱼一键安装"],"one_liner":"国内 ROS 社区「鱼香ROS」做的一行命令装 ROS 和配环境的脚本","explanation":"鱼香 ROS 一键安装是国内 ROS 中文社区「鱼香ROS」（作者网名小鱼）维护的开源安装脚本。新手在 Ubuntu 上装 ROS 常卡在软件源被墙、密钥失效、rosdep 初始化失败（rosdep 是自动装依赖的工具）这些步骤上；这个脚本用交互菜单把换国内镜像源、安装 ROS 1 / ROS 2 各发行版、装国内版 rosdepc、配 Docker 等操作打包起来，按提示选序号即可。它是国内入门 ROS 最常用的捷径之一，但装好后仍建议看懂官方安装步骤，出问题时才知道从哪查。","example":"在新装的 Ubuntu 22.04 上运行 wget http://fishros.com/install -O fishros && . fishros，按菜单选「一键安装 ROS」，再选 Humble 桌面版。","related":["机器人操作系统","ROS 2","ROS 发行版","rosdep","Ubuntu","国内镜像源（换源：清华 TUNA / 阿里云等）"]},{"id":"node","category":"software","sec":1,"tier":1,"sources":[{"title":"ROS 2 Documentation: Understanding nodes","url":"https://docs.ros.org/en/jazzy/Tutorials/Beginner-CLI-Tools/Understanding-ROS2-Nodes/Understanding-ROS2-Nodes.html"},{"title":"ROS Wiki: Nodes","url":"https://wiki.ros.org/Nodes"}],"as_of":"","related_ids":["topic","service","action","robot-operating-system-2","robot-operating-system","ros-client-library"],"name":"节点","alt":"Node (ROS)","abbr":"","aliases":["ROS 节点","node"],"one_liner":"ROS 里完成单一功能的程序单元，多个节点互相通信组成整套系统","explanation":"节点是 ROS（机器人操作系统）中最基本的执行单元，一般一个节点负责一件事，比如读相机、做目标检测、规划路径、驱动电机。节点之间不直接调用函数，而是通过话题（持续发布/订阅数据）、服务（一问一答）和动作（带进度反馈的长任务）交换消息。这样拆分的好处是模块可以独立开发、替换和调试，某个节点崩了不一定拖垮全系统，也方便把不同节点分布在多台电脑上运行。ROS 2 中节点用 rclpy（Python）或 rclcpp（C++）编写，常用 ros2 node list 查看当前运行的节点。","example":"一个相机驱动节点发布图像，一个检测节点订阅图像并发布物体位置，一个控制节点据此让机械臂去抓。","related":["话题","服务","动作","ROS 2","机器人操作系统","ROS 客户端库"]},{"id":"topic","category":"software","sec":1,"tier":1,"sources":[{"title":"ROS 2 Documentation: Understanding topics","url":"https://docs.ros.org/en/jazzy/Tutorials/Beginner-CLI-Tools/Understanding-ROS2-Topics/Understanding-ROS2-Topics.html"},{"title":"ROS Wiki: Topics","url":"https://wiki.ros.org/Topics"}],"as_of":"","related_ids":["node","service","action","message","publish-subscribe","cmd-vel-topic"],"name":"话题","alt":"Topic (ROS)","abbr":"","aliases":["ROS 话题","topic","话题/服务/动作通信"],"one_liner":"ROS 节点之间持续传数据的命名通道，按发布/订阅方式工作","explanation":"话题是 ROS 中最常用的通信方式。每个话题有一个名字和固定的消息类型，发布者节点往话题里不断发消息，订阅者节点收取消息，双方不需要知道彼此是谁，一个话题可以有多个发布者和订阅者。它适合传连续的数据流，如图像、激光点云、关节状态、速度指令。与之相对，服务是一问一答式的请求-响应调用（客户端发请求，服务端处理完回一个结果），适合查询或触发一次性操作；动作用于耗时较长、需要中途反馈进度或可取消的任务，如导航到某点。三者合起来是 ROS 通信的基础，新人应先搞清话题。","example":"底盘驱动节点订阅 /cmd_vel 话题（Twist 类型速度指令），键盘遥控节点往这个话题发布速度，底盘就会跟着动。","related":["节点","服务","动作","消息","发布/订阅","cmd_vel 速度指令话题（Twist 消息）"]},{"id":"publish-subscribe","category":"software","sec":1,"tier":2,"sources":[{"title":"ROS 2 Documentation: Understanding topics","url":"https://docs.ros.org/en/humble/Tutorials/Beginner-CLI-Tools/Understanding-ROS2-Topics/Understanding-ROS2-Topics.html"},{"title":"Publish–subscribe pattern - Wikipedia","url":"https://en.wikipedia.org/wiki/Publish%E2%80%93subscribe_pattern"}],"as_of":"","related_ids":["topic","node","service","data-distribution-service","ros-2-quality-of-service","middleware"],"name":"发布/订阅","alt":"Publish-Subscribe","abbr":"Pub/Sub","aliases":["发布订阅","发布者/订阅者","publisher/subscriber"],"one_liner":"发送方往话题里发消息、接收方订阅话题收消息，双方互不认识。","explanation":"发布/订阅是一种通信模式：发布者把消息发到某个命名的「话题」上，所有订阅了这个话题的接收者都会收到，发布者不需要知道谁在听，订阅者也不需要知道谁在发。这样模块之间是松耦合的，加一个新订阅者（比如录包或可视化）不用改原有代码。ROS / ROS 2 的话题机制就是典型的发布/订阅：相机驱动节点发布图像话题，感知节点和 RViz 同时订阅。它适合持续流动的数据（传感器、状态），需要一问一答时用服务，长时间任务用动作。ROS 2 底层靠 DDS 实现，并可通过 QoS 调整可靠性与缓存深度。","example":"激光雷达节点发布 /scan 话题，建图节点和 rosbag 录包同时订阅它。","related":["话题","节点","服务","数据分发服务","服务质量","中间件"]},{"id":"message","category":"software","sec":1,"tier":2,"sources":[{"title":"ROS 2 文档：About interfaces","url":"https://docs.ros.org/en/rolling/Concepts/Basic/About-Interfaces.html"}],"as_of":"","related_ids":["topic","service","action","publish-subscribe","robot-operating-system-2","cmd-vel-topic"],"name":"消息","alt":"Message (msg / srv / action interface)","abbr":"msg","aliases":["ROS 消息","接口类型","interface"],"one_liner":"ROS 节点之间传递数据时约定好的数据格式。","explanation":"ROS 里不同节点要交换数据，必须先约定数据长什么样，这个约定就是消息，ROS 2 统称为接口（interface）。接口有三种文件：.msg 定义话题上传的数据结构；.srv 定义服务的请求和应答，两部分用三条短横线隔开；.action 定义动作的目标、结果和中间反馈。文件里只写字段类型和名字，编译时由构建工具自动生成 C++ 和 Python 代码。常用的标准消息包有 std_msgs、geometry_msgs（如速度指令 Twist、位姿 Pose）、sensor_msgs（如图像 Image、关节状态 JointState、点云 PointCloud2）。能复用标准消息就别自己定义，方便和现成工具对接。","example":"ros2 interface show geometry_msgs/msg/Twist 可以看到它由 linear 和 angular 两个三维向量组成，底盘速度控制就用它。","related":["话题","服务","动作","发布/订阅","ROS 2","cmd_vel 速度指令话题（Twist 消息）"]},{"id":"cmd-vel-topic","category":"software","sec":1,"tier":3,"sources":[{"title":"geometry_msgs/msg/Twist.msg (ros2/common_interfaces)","url":"https://github.com/ros2/common_interfaces/blob/rolling/geometry_msgs/msg/Twist.msg"},{"title":"Nav2 Documentation","url":"https://docs.nav2.org/"}],"as_of":"","related_ids":["topic","message","robot-operating-system","robot-operating-system-2","ros-2-navigation-stack","differential-drive-kinematics"],"name":"cmd_vel 速度指令话题（Twist 消息）","alt":"cmd_vel Topic (geometry_msgs/Twist velocity command)","abbr":"","aliases":["/cmd_vel"],"one_liner":"ROS 里给移动机器人下发线速度和角速度的标准话题。","explanation":"ROS / ROS 2 中约定俗成的一个话题名（话题即发布-订阅的数据通道），消息类型是 geometry_msgs/Twist，内含线速度 linear 与角速度 angular 各三个分量。导航栈、遥操作和键盘控制程序都往 /cmd_vel 发，底盘驱动节点订阅后换算成左右轮转速或转向角。它的意义是把上层决策和下层底盘解耦：差速、麦克纳姆、阿克曼底盘对外都是同一个接口。Nav2 默认也发这个话题，近年还出现了带时间戳的 TwistStamped 用法。","example":"用 teleop_twist_keyboard 往 /cmd_vel 发指令，让 TurtleBot 以 0.2 m/s 前进、0.5 rad/s 原地转。","related":["话题","消息","机器人操作系统","ROS 2","Nav2","差速驱动运动学"]},{"id":"service","category":"software","sec":1,"tier":2,"sources":[{"title":"ROS 2 Docs: About services","url":"https://docs.ros.org/en/rolling/Concepts/Basic/About-Services.html"},{"title":"ROS 2 Tutorial: Understanding services","url":"https://docs.ros.org/en/humble/Tutorials/Beginner-CLI-Tools/Understanding-ROS2-Services/Understanding-ROS2-Services.html"}],"as_of":"","related_ids":["topic","action","node","message","publish-subscribe","robot-operating-system-2"],"name":"服务","alt":"Service (ROS)","abbr":"","aliases":["ROS 服务","service"],"one_liner":"ROS 中一问一答式的通信方式：客户端发请求，服务端回结果","explanation":"服务是 ROS 的三种基本通信方式之一（另两种是话题和动作）。一个节点作为服务端提供服务，其他节点作为客户端发送请求并等待响应，请求和响应的数据格式写在 .srv 文件里。它和话题的区别是：话题是持续的单向数据流，适合传感器数据；服务是一次性调用，适合「重置、开关夹爪、查询状态」这类很快完成的操作。耗时长、需要中途反馈或取消的任务应改用动作。","example":"命令行执行 ros2 service call /reset_world std_srvs/srv/Empty 让仿真环境复位；或写一个 /gripper/open 服务，调用一次就张开夹爪。","related":["话题","动作","节点","消息","发布/订阅","ROS 2"]},{"id":"action","category":"software","sec":1,"tier":2,"sources":[{"title":"ROS 2 Documentation: Understanding actions","url":"https://docs.ros.org/en/rolling/Tutorials/Beginner-CLI-Tools/Understanding-ROS2-Actions/Understanding-ROS2-Actions.html"}],"as_of":"","related_ids":["topic","service","node","message","ros-2-navigation-stack","moveit-motion-planning-framework"],"name":"动作","alt":"Action (ROS Action)","abbr":"","aliases":["ROS Action","action 通信","actionlib"],"one_liner":"ROS 里用于耗时任务的通信方式，可中途看进度、可取消","explanation":"动作是 ROS 的三种主要通信方式之一，另两种是话题（持续广播数据）和服务（一问一答）。它适合「要花一段时间才能做完」的任务：客户端发一个目标（goal），服务端执行过程中不断回传反馈（feedback），结束时返回结果（result），中途还能取消。ROS 1 里由 actionlib 库实现，ROS 2 里是内置机制，底层由几个服务和话题组合而成。导航到某个点、机械臂执行一段轨迹这类任务通常都做成动作接口。","example":"Nav2 的 NavigateToPose 动作：发一个目标点，机器人边走边回报剩余距离，到达后返回成功或失败。","related":["话题","服务","节点","消息","Nav2","MoveIt"]},{"id":"ros-parameter-server","category":"software","sec":1,"tier":3,"sources":[{"title":"ROS Wiki: Parameter Server","url":"http://wiki.ros.org/Parameter%20Server"},{"title":"ROS 2 文档：About parameters","url":"https://docs.ros.org/en/rolling/Concepts/Basic/About-Parameters.html"}],"as_of":"","related_ids":["robot-operating-system","robot-operating-system-2","ros-master","node","launch-file","topic"],"name":"参数服务器","alt":"Parameter Server","abbr":"","aliases":["ROS 参数","rosparam"],"one_liner":"ROS 1 里存放全局配置参数的共享字典，节点可随时读写","explanation":"参数服务器是 ROS 1 的一个机制：由 ROS 主节点（roscore）维护一个全局共享的键值字典，各节点通过网络接口读写其中的配置，比如控制增益、相机话题名、机器人尺寸。用 launch 文件或 YAML 批量加载，也可用 rosparam 命令行查看修改。它适合存放不常变的静态配置，不适合高频数据。ROS 2 取消了全局参数服务器，改为每个节点自己声明和持有参数，用 ros2 param 访问，并可在参数改变时触发回调。注意分布式机器学习里也有同名概念，指存放模型参数的服务器，与此不同。","example":"在 launch 文件里用 rosparam 加载 pid.yaml，控制节点启动时读取 /arm_controller/kp 等增益参数。","related":["机器人操作系统","ROS 2","ROS 主节点","节点","启动文件","话题"]},{"id":"launch-file","category":"software","sec":1,"tier":2,"sources":[{"title":"ROS 2 文档：Launch 教程","url":"https://docs.ros.org/en/rolling/Tutorials/Intermediate/Launch/Launch-Main.html"},{"title":"ROS Wiki: roslaunch","url":"http://wiki.ros.org/roslaunch"}],"as_of":"","related_ids":["robot-operating-system","robot-operating-system-2","node","package","ros-parameter-server","topic"],"name":"启动文件","alt":"Launch File","abbr":"","aliases":["launch 文件","roslaunch","ros2 launch"],"one_liner":"ROS 里一次性启动多个节点并配置参数的脚本文件。","explanation":"一个机器人系统通常要同时跑相机驱动、状态估计、规划、控制等十几个节点（ROS 中独立运行的程序），逐个在终端里启动既麻烦又容易出错。启动文件就是把「启动哪些节点、传什么参数、话题怎么重映射、放在哪个命名空间」写在一处，一条命令全部拉起。ROS 1 用 XML 格式的 .launch 文件，命令是 roslaunch；ROS 2 支持 Python（.launch.py）、XML 和 YAML 三种写法，命令是 ros2 launch，其中 Python 写法可以加条件判断和循环，最常见。启动文件一般放在功能包的 launch 目录下。","example":"ros2 launch realsense2_camera rs_launch.py 一条命令就能启动 RealSense 相机驱动并发布彩色图和深度图话题。","related":["机器人操作系统","ROS 2","节点","功能包","参数服务器","话题"]},{"id":"ros-client-library","category":"software","sec":1,"tier":3,"sources":[{"title":"ROS 2 Documentation: Client libraries","url":"https://docs.ros.org/en/rolling/Concepts/Basic/About-Client-Libraries.html"}],"as_of":"","related_ids":["robot-operating-system-2","robot-operating-system","node","ros-middleware-interface","ros-2-executor-and-callback-groups","python-and-c-plus-plus"],"name":"ROS 客户端库","alt":"ROS Client Library (rclcpp / rclpy)","abbr":"RCL","aliases":["rcl","rclcpp","rclpy","rospy","roscpp"],"one_liner":"写 ROS 节点时调用的编程接口，C++ 用 rclcpp，Python 用 rclpy","explanation":"客户端库是开发者写 ROS 程序时直接调用的 API，负责创建节点、发布和订阅话题、调用服务、读参数等。ROS 1 时代的主要客户端库是 roscpp（C++）和 rospy（Python）。ROS 2 改成分层设计：底层是用 C 写的通用库 rcl，上面再封装出各语言版本，官方维护 C++ 的 rclcpp 和 Python 的 rclpy，社区还有 Rust、Java 等版本。这样通信逻辑只写一遍，各语言行为一致。一般来说，对实时性要求高的控制节点多用 rclcpp，快速原型和接入深度学习模型多用 rclpy。","example":"在 Python 里 import rclpy，继承 rclpy.node.Node 写一个节点，订阅相机话题并把图像送进 VLA 模型推理。","related":["ROS 2","机器人操作系统","节点","ROS 中间件接口","ROS 2 执行器与回调组","Python 与 C++（具身常用编程语言）"]},{"id":"package","category":"software","sec":1,"tier":2,"sources":[{"title":"ROS 2 Documentation: Creating a package","url":"https://docs.ros.org/en/humble/Tutorials/Beginner-Client-Libraries/Creating-Your-First-ROS2-Package.html"}],"as_of":"","related_ids":["ros-workspace","colcon","rosdep","ament","node","launch-file"],"name":"功能包","alt":"Package (ROS)","abbr":"","aliases":["ROS 包","package","软件包"],"one_liner":"ROS 里组织代码的最小单位，一个包装一组相关的节点和配置。","explanation":"功能包是 ROS / ROS 2 中组织和分发代码的基本单元。一个包通常包含源代码、启动文件、消息定义、配置参数，以及一个描述包名、版本、依赖关系的 package.xml 清单文件；C++ 包还配 CMakeLists.txt，Python 包配 setup.py。ROS 2 里用 ros2 pkg create 新建包，用 colcon 在工作空间里统一编译。把代码按包拆开，别人就能单独复用你的相机驱动或导航模块，rosdep 也能根据 package.xml 自动装好依赖。新人读开源机器人项目时，先看有哪些包、每个包管什么，是最快的入门方式。","example":"ros2 pkg create my_robot_bringup --build-type ament_python 会生成一个 Python 功能包骨架。","related":["ROS 工作空间","colcon","rosdep","ament","节点","启动文件"]},{"id":"ros-workspace","category":"software","sec":1,"tier":3,"sources":[{"title":"ROS 2 Docs: Creating a workspace","url":"https://docs.ros.org/en/jazzy/Tutorials/Beginner-Client-Libraries/Creating-A-Workspace/Creating-A-Workspace.html"},{"title":"ROS Wiki: catkin workspaces","url":"http://wiki.ros.org/catkin/workspaces"}],"as_of":"","related_ids":["package","colcon","catkin","ament","rosdep","robot-operating-system-2"],"name":"ROS 工作空间","alt":"ROS Workspace","abbr":"","aliases":["工作区","catkin_ws","ros2_ws","colcon 工作空间"],"one_liner":"存放、编译和安装自己 ROS 功能包的一个目录","explanation":"工作空间是 ROS 组织代码的目录约定：顶层下建 src 放功能包（package，ROS 的最小代码单元）源码，编译后生成 build（中间文件）、install 或 devel（产物）、log 等目录。ROS 1 用 catkin 编译，习惯命名 catkin_ws；ROS 2 用 colcon 编译，常叫 ros2_ws。编译完要 source 对应的 setup 脚本，终端才找得到里面的包。工作空间可以叠加（overlay）：先 source 系统装的 ROS（underlay），再 source 自己的工作空间，同名包以上层为准。新人最常见的坑就是忘了 source，或 source 顺序错了。","example":"mkdir -p ~/ros2_ws/src，把代码 clone 进 src，在 ros2_ws 下执行 colcon build，再 source install/setup.bash，就能 ros2 run 自己写的节点。","related":["功能包","colcon","catkin","ament","rosdep","ROS 2"]},{"id":"colcon","category":"software","sec":1,"tier":2,"sources":[{"title":"colcon documentation","url":"https://colcon.readthedocs.io/"},{"title":"ROS 2 Documentation: Using colcon to build packages","url":"https://docs.ros.org/en/rolling/Tutorials/Beginner-Client-Libraries/Colcon-Tutorial.html"}],"as_of":"","related_ids":["ros-workspace","package","ament","catkin","cmake","rosdep"],"name":"colcon","alt":"colcon (collective construction)","abbr":"","aliases":["colcon build"],"one_liner":"ROS 2 推荐的编译工具，一条命令编译整个工作空间","explanation":"colcon 是 ROS 2 官方推荐的命令行构建工具，名字来自 collective construction（集体构建）。一个 ROS 工作空间里往往有很多功能包，彼此有依赖关系，colcon 会自动分析依赖顺序，逐个或并行调用各包自己的构建方式（C++ 包走 CMake/ament_cmake，Python 包走 setuptools），把产物装到 install 目录。它取代了 ROS 1 时代的 catkin_make 和 catkin_tools。编译完要先 source install/setup.bash，终端才能找到新编译的包。","example":"在 ~/ros2_ws 下执行 colcon build --symlink-install，再 source install/setup.bash，然后用 ros2 run 启动自己写的节点。","related":["ROS 工作空间","功能包","ament","catkin","CMake","rosdep"]},{"id":"ament","category":"software","sec":1,"tier":3,"sources":[{"title":"ROS 2 Docs: About the build system","url":"https://docs.ros.org/en/rolling/Concepts/Advanced/About-Build-System.html"},{"title":"ROS 2 Design: ament","url":"https://design.ros2.org/articles/ament.html"}],"as_of":"","related_ids":["robot-operating-system-2","colcon","catkin","package","ros-workspace","cmake"],"name":"ament（ROS 2 构建系统）","alt":"ament","abbr":"","aliases":["ament_cmake","ament_python"],"one_liner":"ROS 2 的包构建系统，ament_cmake 管 C++ 包，ament_python 管 Python 包","explanation":"ament 是 ROS 2 采用的构建系统，是 ROS 1 里 catkin 的后继。它规定了一个 ROS 2 功能包（package）怎么声明依赖、怎么编译、怎么安装以及怎么被其他包找到。常用的两种构建类型是 ament_cmake（基于 CMake，用于 C++ 包，也可以装 Python 脚本）和 ament_python（基于 Python 的 setuptools，用于纯 Python 包），在 package.xml 里用 build_type 指定。日常开发中大家不直接调用 ament，而是用 colcon 这个构建工具一次编译整个工作空间，colcon 会根据每个包的类型去调用对应的 ament 流程。新手在 ROS 2 里新建包时用 ros2 pkg create 选择 ament_cmake 或 ament_python 即可。","example":"ros2 pkg create my_controller --build-type ament_python 会生成一个带 setup.py 的 Python 包，再用 colcon build 编译整个工作空间。","related":["ROS 2","colcon","catkin","功能包","ROS 工作空间","CMake"]},{"id":"catkin","category":"software","sec":1,"tier":3,"sources":[{"title":"ROS Wiki: catkin","url":"http://wiki.ros.org/catkin"},{"title":"catkin_tools documentation","url":"https://catkin-tools.readthedocs.io/"}],"as_of":"2025-05","related_ids":["robot-operating-system","ament","colcon","ros-workspace","package","cmake"],"name":"catkin（ROS 1 构建系统）","alt":"catkin","abbr":"","aliases":["catkin_make","catkin build"],"one_liner":"ROS 1 的官方构建系统，基于 CMake 编译和管理工作空间里的功能包","explanation":"catkin 是 ROS 1 的官方构建系统，基于 CMake 扩展而来，负责把工作空间 src 目录下的各个功能包按依赖顺序编译，并生成 build、devel 等目录和让系统找到这些包的环境脚本（source devel/setup.bash）。常用的命令有两种：catkin_make 是 ROS 自带的，把所有包放在一个 CMake 工程里一次编译；catkin build 来自 catkin_tools，会逐包隔离编译，出错时更容易定位。到了 ROS 2，catkin 被 ament 和 colcon 取代。ROS 1 最后一个发行版 Noetic 已于 2025 年停止维护，但大量老代码和教程仍基于 catkin，读旧项目时仍会遇到。","example":"mkdir -p ~/catkin_ws/src，把功能包放进 src，在 catkin_ws 下执行 catkin_make，再 source devel/setup.bash。","related":["机器人操作系统","ament","colcon","ROS 工作空间","功能包","CMake"]},{"id":"rosdep","category":"software","sec":1,"tier":3,"sources":[{"title":"ROS 2 Docs: Managing Dependencies with rosdep","url":"https://docs.ros.org/en/jazzy/Tutorials/Intermediate/Rosdep.html"},{"title":"ROS Wiki: rosdep","url":"http://wiki.ros.org/rosdep"}],"as_of":"","related_ids":["ros-workspace","package","colcon","fishros-one-click-installer","package-mirror-sources-in-china","ubuntu-linux"],"name":"rosdep","alt":"rosdep","abbr":"","aliases":["rosdepc","rosdep init","rosdep update"],"one_liner":"按功能包声明自动安装系统依赖的 ROS 命令行工具","explanation":"rosdep 读取工作空间里各功能包 package.xml 声明的依赖，对照 rosdistro 仓库里的映射规则，把抽象的依赖名翻译成当前系统的具体包名（比如某个 apt 的 lib 开发包或 pip 包），再调用对应的包管理器安装。首次使用要先执行 sudo rosdep init 和 rosdep update，这两步需要访问 GitHub 上的规则文件，国内网络经常失败，于是鱼香 ROS 社区做了走国内镜像的 rosdepc 作替代。拿到别人的 ROS 仓库后，先 rosdep 再编译，是标准流程。","example":"把别人的 ROS 2 仓库 clone 到 src 后，执行 rosdep install --from-paths src --ignore-src -r -y 装齐依赖，再 colcon build。","related":["ROS 工作空间","功能包","colcon","鱼香 ROS 一键安装","国内镜像源（换源：清华 TUNA / 阿里云等）","Ubuntu"]},{"id":"ros-master","category":"software","sec":1,"tier":3,"sources":[{"title":"ROS Wiki: Master","url":"http://wiki.ros.org/Master"},{"title":"ROS Wiki: roscore","url":"http://wiki.ros.org/roscore"}],"as_of":"","related_ids":["robot-operating-system","node","topic","ros-parameter-server","robot-operating-system-2","data-distribution-service"],"name":"ROS 主节点","alt":"ROS Master (roscore)","abbr":"","aliases":["roscore","ROS Master","rosmaster"],"one_liner":"ROS 1 里负责登记节点、帮节点互相找到对方的中心进程","explanation":"ROS Master 是 ROS 1（第一代机器人操作系统）的中心协调进程，一般用 roscore 命令启动，roscore 会同时拉起 Master、参数服务器和日志节点 rosout。节点（完成单一功能的进程）启动时先向 Master 登记自己发布、订阅哪些话题（数据通道）、提供哪些服务；Master 只负责把发布者和订阅者的地址告诉对方，之后数据在节点之间点对点直连，不经过 Master。它的问题是单点依赖：Master 挂了，新节点就无法加入；多机通信还要设置 ROS_MASTER_URI。ROS 2 取消了 Master，改由底层 DDS 自动发现节点。","example":"在 ROS 1 里跑小车：先开一个终端执行 roscore，再用 rosrun 启动相机驱动和建图节点；另一台电脑要把 ROS_MASTER_URI 指向这台机器，才能看到它的话题。","related":["机器人操作系统","节点","话题","参数服务器","ROS 2","数据分发服务"]},{"id":"ros1-bridge","category":"software","sec":1,"tier":3,"sources":[{"title":"ros2/ros1_bridge (GitHub)","url":"https://github.com/ros2/ros1_bridge"}],"as_of":"2025-05","related_ids":["robot-operating-system","robot-operating-system-2","ros-master","topic","service","message"],"name":"ros1_bridge","alt":"ros1_bridge","abbr":"","aliases":["ROS 1/ROS 2 桥接","dynamic_bridge"],"one_liner":"让 ROS 1 和 ROS 2 节点互相收发话题和服务的桥接程序","explanation":"ros1_bridge 是 ROS 2 官方维护的功能包，运行时同时接入 ROS 1 的 Master 和 ROS 2 网络，把两边的消息做类型转换后转发，支持话题和服务。它主要用在迁移过渡期：老驱动还停留在 ROS 1，新算法已经写在 ROS 2。因为要为每种消息类型生成转换代码，通常需要在同时装有两代 ROS 的环境里从源码编译，自定义消息也要两边都编译进去。ROS 1 最后一个发行版 Noetic 已于 2025 年 5 月停止维护，这个桥更多被当作临时方案。","example":"运行 ros2 run ros1_bridge dynamic_bridge 后，ROS 1 激光雷达驱动发布的 /scan 话题，ROS 2 里的 Nav2 也能订阅到。","related":["机器人操作系统","ROS 2","ROS 主节点","话题","服务","消息"]},{"id":"guyuehome","category":"software","sec":1,"tier":3,"sources":[{"title":"古月居官网","url":"https://www.guyuehome.com/"}],"as_of":"","related_ids":["robot-operating-system","robot-operating-system-2","fishros-one-click-installer","ros-2-navigation-stack","moveit-motion-planning-framework"],"name":"古月居（ROS 中文社区）","alt":"Guyuehome (Chinese ROS community)","abbr":"","aliases":["古月居 ROS 社区"],"one_liner":"国内较早、较大的 ROS 机器人中文学习社区和教程网站","explanation":"古月居是由「古月」胡春旭创办的中文机器人技术社区，胡春旭也是《ROS机器人开发实践》一书的作者。网站以 ROS（机器人操作系统，一套机器人软件框架）为核心，汇集博客文章、问答、入门到进阶的视频课程（部分付费），内容覆盖 ROS 1/ROS 2、SLAM、导航、机械臂和移动机器人。对中文读者来说，它是查 ROS 报错、找入门教程的常用去处。它和鱼香 ROS 一键安装等工具一起，构成国内 ROS 学习生态的一部分。","example":"新手照古月居的 ROS 2 入门课，从写第一个发布者和订阅者节点开始学。","related":["机器人操作系统","ROS 2","鱼香 ROS 一键安装","Nav2","MoveIt"]},{"id":"unified-robot-description-format","category":"software","sec":2,"tier":1,"sources":[{"title":"ROS Wiki: urdf","url":"https://wiki.ros.org/urdf"},{"title":"ROS 2 Documentation: URDF tutorials","url":"https://docs.ros.org/en/jazzy/Tutorials/Intermediate/URDF/URDF-Main.html"},{"title":"Gazebo Classic tutorial: URDF in Gazebo（URDF 只能描述单个机器人、不能表达闭链等局限）","url":"https://classic.gazebosim.org/tutorials?tut=ros_urdf&cat=connect_ros"}],"as_of":"","related_ids":["xacro","mjcf","link","revolute-joint","kinematic-tree","mesh-file"],"name":"统一机器人描述格式","alt":"Unified Robot Description Format","abbr":"URDF","aliases":["urdf 文件"],"one_liner":"用 XML 描述机器人连杆、关节、外形和质量的标准文件格式","explanation":"URDF 是 ROS 生态中描述机器人模型的 XML 格式。文件里用 link（连杆）描述每个刚体的外观网格、碰撞形状和质量惯量，用 joint（关节）描述连杆之间怎么连接，包括关节类型（转动、移动、固定等）、转轴和运动范围，整体构成一棵运动学树。有了 URDF，RViz 能显示机器人，运动学和动力学库能据此算正逆运动学，Isaac Sim、MuJoCo、PyBullet 等仿真器也能导入它。它的局限是只能描述单个机器人、只能表达树状结构，不擅长闭链机构；手写起来又长又重复，所以常用 Xacro 宏来简化编写。MuJoCo 则有自己的 MJCF 格式，能写进更多仿真参数。","example":"机器人厂商通常随机器人提供 URDF 和网格文件，把它导入 Isaac Lab 就能在仿真里训练这台机器人的策略。","related":["Xacro","MJCF","连杆","转动关节","运动学树","网格文件"]},{"id":"xacro","category":"software","sec":2,"tier":2,"sources":[{"title":"ROS Wiki: xacro","url":"http://wiki.ros.org/xacro"},{"title":"ros/xacro (GitHub)","url":"https://github.com/ros/xacro"}],"as_of":"","related_ids":["unified-robot-description-format","semantic-robot-description-format","mjcf","robot-state-publisher","robot-operating-system-2","mesh-file"],"name":"Xacro（XML 宏）","alt":"Xacro (XML Macros)","abbr":"Xacro","aliases":[".xacro 文件"],"one_liner":"给 URDF 加上变量、宏和引用的 XML 宏语言，用来少写重复的机器人描述","explanation":"Xacro 是 ROS 生态里的一个 XML 宏语言和同名工具包，专门用来写 URDF（统一机器人描述格式，用 XML 描述连杆、关节、质量和外形）。纯 URDF 没有变量和函数，一台左右对称的双臂机器人要把几乎一样的连杆和关节抄两遍，改一个尺寸要改很多处。Xacro 允许定义属性（常量）、宏（带参数的模板）、做简单数学运算、按条件展开，并用 include 把多个文件拼起来。写好的 .xacro 文件在启动时由 xacro 命令展开成普通 URDF，再交给 robot_state_publisher、RViz、Gazebo 或 MoveIt 使用。多数厂商发布的 ROS 机器人描述包都以 .xacro 形式提供。","example":"给双臂机器人写一个 arm 宏，参数为 prefix 和安装位置，分别以 left_ 和 right_ 调用两次，就得到左右两条手臂的全部连杆和关节。","related":["统一机器人描述格式","语义机器人描述格式","MJCF","robot_state_publisher","ROS 2","网格文件"]},{"id":"semantic-robot-description-format","category":"software","sec":2,"tier":3,"sources":[{"title":"ROS Wiki: srdf","url":"http://wiki.ros.org/srdf"},{"title":"MoveIt Docs: URDF and SRDF","url":"https://moveit.picknik.ai/main/doc/examples/urdf_srdf/urdf_srdf_tutorial.html"}],"as_of":"","related_ids":["unified-robot-description-format","moveit-motion-planning-framework","xacro","self-collision-checking","motion-planning","mjcf"],"name":"语义机器人描述格式","alt":"Semantic Robot Description Format","abbr":"SRDF","aliases":["SRDF",".srdf 文件"],"one_liner":"给 URDF 补充规划分组、免检碰撞对等语义信息的配置文件","explanation":"SRDF 是 MoveIt（ROS 的运动规划框架）使用的 XML 格式，和 URDF（统一机器人描述格式，描述连杆、关节和外形）配套。URDF 只说明机器人长什么样，SRDF 补充运动规划需要的语义：规划组（比如 arm、gripper 各由哪些关节组成）、末端执行器、命名位姿（如 home、ready）、虚拟关节（把机器人固定到世界坐标系或移动底盘上）、被动关节，以及禁用碰撞检查的连杆对。相邻或永远碰不到的连杆不做自碰撞检查，能明显加快规划。通常用 MoveIt Setup Assistant 自动生成，再手工微调。","example":"为 Franka 机械臂生成 MoveIt 配置时，SRDF 里定义 panda_arm 组包含 7 个关节、一个名为 ready 的位姿，并列出相邻的 panda_link1 和 panda_link2 不检查碰撞。","related":["统一机器人描述格式","MoveIt","Xacro","自碰撞检测","运动规划","MJCF"]},{"id":"mjcf","category":"software","sec":2,"tier":2,"sources":[{"title":"MuJoCo 文档：XML Reference","url":"https://mujoco.readthedocs.io/en/stable/XMLreference.html"},{"title":"MuJoCo Menagerie GitHub","url":"https://github.com/google-deepmind/mujoco_menagerie"}],"as_of":"","related_ids":["mujoco","unified-robot-description-format","mujoco-menagerie","mesh-file","simulation-description-format","universal-scene-description"],"name":"MJCF","alt":"MuJoCo XML Format","abbr":"MJCF","aliases":["MuJoCo XML"],"one_liner":"MuJoCo 仿真器用来描述机器人和场景的 XML 模型格式。","explanation":"MJCF 是 MuJoCo 物理引擎的原生模型格式，用 XML 描述一个仿真场景：刚体按父子关系层层嵌套成一棵树，每个刚体下写关节、几何体（geom，可以是球、盒子或引用的网格文件）、质量惯量；另外还能写驱动器、传感器、腱绳、接触参数和仿真步长等。和 URDF 相比，它能表达更多仿真相关的细节，写法也更紧凑。MuJoCo 也能读 URDF，但通常会转成 MJCF 再补充参数。DeepMind 维护的 MuJoCo Menagerie 收录了大量调好参数的机器人 MJCF 模型，MJX、MuJoCo Playground 等工具也直接使用这种格式。","example":"MuJoCo Menagerie 里的 unitree_g1 目录提供了宇树 G1 的 MJCF 文件，可直接载入仿真做强化学习运控训练。","related":["MuJoCo","统一机器人描述格式","MuJoCo Menagerie","网格文件","SDFormat 仿真描述格式","通用场景描述"]},{"id":"mujoco-menagerie","category":"software","sec":2,"tier":3,"sources":[{"title":"mujoco_menagerie GitHub","url":"https://github.com/google-deepmind/mujoco_menagerie"}],"as_of":"","related_ids":[null,null,"mujoco-playground",null,null,null],"name":"MuJoCo Menagerie","alt":"MuJoCo Menagerie","abbr":"","aliases":[],"one_liner":"谷歌 DeepMind 整理的高质量 MuJoCo 机器人模型库。","explanation":"MuJoCo Menagerie 是谷歌 DeepMind 维护的开源模型合集，收录了大量常见机器人的 MJCF 模型（MuJoCo 的机器人描述文件），包括 Franka、UR5e 等机械臂，宇树 Go2、G1 等四足和人形，ALOHA 双臂平台以及 Shadow 等灵巧手。每个模型都整理过质量、惯量、关节限位、执行器和碰撞体，并附有来源和许可说明。自己从 URDF 转换常会遇到碰撞体不对、参数缺失等问题，直接用 Menagerie 能省掉这些工作，MuJoCo Playground、mink 等项目也以它为默认模型来源。","example":"从 Menagerie 下载 unitree_g1 目录，在 MuJoCo 查看器里直接加载 scene.xml 查看宇树 G1。","related":["MuJoCo(MuJoCo (Multi-Joint dynamics with Contact))","MJCF(MuJoCo XML Format)","MuJoCo Playground","mink(mink (MuJoCo inverse kinematics))","仿真资产(Simulation Assets)","谷歌 DeepMind(Google DeepMind)"]},{"id":"simulation-description-format","category":"software","sec":2,"tier":3,"sources":[{"title":"SDFormat 官网","url":"http://sdformat.org/"}],"as_of":"","related_ids":["unified-robot-description-format","gazebo","mjcf","universal-scene-description","xacro"],"name":"SDFormat 仿真描述格式","alt":"Simulation Description Format (SDFormat)","abbr":"SDF","aliases":["SDFormat","SDF 文件"],"one_liner":"Gazebo 用的 XML 格式，能描述机器人和整个仿真世界","explanation":"SDFormat 是一种基于 XML 的描述格式，最早为 Gazebo 仿真器设计，现由 Open Robotics 维护。和只描述单个机器人的 URDF（统一机器人描述格式）相比，它能在一个文件里描述整个「世界」：多个模型、灯光、地面、传感器、物理参数，还支持闭链机构（URDF 只能表达树状结构）。做 Gazebo 仿真时常用它写场景；很多流程是先有 URDF，再自动转换成 SDF 加载。注意它和「符号距离场」的缩写 SDF 不是一回事。","example":"在 Gazebo 里搭一个仓库场景：用一个 .sdf 文件放入货架、地面、光源和一台带激光雷达的移动机器人。","related":["统一机器人描述格式","Gazebo","MJCF","通用场景描述","Xacro"]},{"id":"universal-scene-description","category":"software","sec":2,"tier":2,"sources":[{"title":"OpenUSD 官网","url":"https://openusd.org/"},{"title":"Alliance for OpenUSD","url":"https://aousd.org/"}],"as_of":"","related_ids":["nvidia-isaac-sim","nvidia-omniverse","unified-robot-description-format","mjcf","simready-assets","simulation-assets"],"name":"通用场景描述","alt":"Universal Scene Description (OpenUSD)","abbr":"USD","aliases":["OpenUSD","Universal Scene Description","USD"],"one_liner":"皮克斯开源的 3D 场景描述格式，英伟达仿真平台的标准场景格式","explanation":"USD 是皮克斯动画工作室为电影制作开发、2016 年开源的 3D 场景描述框架，现称 OpenUSD。它不只存模型网格，还能描述材质、灯光、层级结构和物理属性，并支持多个文件分层叠加，便于多人协作修改同一个场景。2023 年皮克斯、苹果、Adobe、Autodesk、英伟达等成立 OpenUSD 联盟（AOUSD）推动标准化。英伟达 Omniverse 和 Isaac Sim 都以 USD 为核心格式，机器人的 URDF 导入后也会转成 USD，仿真资产、数字孪生场景基本以 .usd 文件流通。","example":"把机器人的 URDF 导入 Isaac Sim 后另存为 robot.usd，再和一个厨房场景的 USD 文件组合成仿真环境。","related":["Isaac Sim","Omniverse","统一机器人描述格式","MJCF","SimReady 资产","仿真资产"]},{"id":"mesh-file","category":"software","sec":2,"tier":2,"sources":[{"title":"Khronos glTF","url":"https://www.khronos.org/gltf/"},{"title":"ROS Wiki: URDF link（mesh 引用）","url":"http://wiki.ros.org/urdf/XML/link"}],"as_of":"","related_ids":["unified-robot-description-format","mjcf","collision-geometry","convex-decomposition","triangle-mesh","solidworks-to-urdf-exporter"],"name":"网格文件","alt":"Mesh File (STL / OBJ / DAE / glTF)","abbr":"","aliases":["STL","OBJ","DAE","glTF","模型文件"],"one_liner":"用大量三角形描述物体外形的 3D 文件，机器人模型的「外壳」。","explanation":"网格文件把一个零件或物体的表面拆成许多三角形，记录顶点坐标和三角面。常见格式：STL 只存几何形状，没有颜色，也不记单位；OBJ 存几何加贴图坐标，材质写在配套的 .mtl 文件；DAE（COLLADA）是 XML 格式，能带材质和颜色，ROS 里常用；glTF 是 Khronos 组织制定的较新格式，支持基于物理的材质，适合网页和渲染。URDF、MJCF 等机器人描述文件本身不存外形，而是引用这些网格文件分别作为显示用的外观和计算碰撞用的碰撞体。碰撞体一般要简化或做凸分解，否则仿真又慢又不稳；另一个常见坑是 STL 单位是毫米还是米弄错，导致模型大了一千倍。","example":"从 SolidWorks 导出的 URDF 里，每个连杆会引用一个 meshes/xxx.STL 文件作为外观和碰撞形状。","related":["统一机器人描述格式","MJCF","碰撞体","凸分解","网格（三角网格）","SolidWorks 转 URDF 插件"]},{"id":"cad-software","category":"software","sec":2,"tier":2,"sources":[{"title":"Onshape 官网","url":"https://www.onshape.com/"},{"title":"SolidWorks 官网","url":"https://www.solidworks.com/"}],"as_of":"","related_ids":["unified-robot-description-format","solidworks-to-urdf-exporter","onshape-to-robot","mesh-file","mjcf","3d-printing"],"name":"CAD 建模软件（SolidWorks / Onshape / Fusion 360）","alt":"CAD Software (SolidWorks / Onshape / Fusion 360; STEP files)","abbr":"CAD","aliases":["计算机辅助设计","SolidWorks","Onshape","Fusion 360","STEP 文件"],"one_liner":"画机械零件和整机三维模型的软件，机器人结构设计的起点","explanation":"CAD（计算机辅助设计）软件用来画零件和装配体的三维模型。机器人领域常见三款：达索系统的 SolidWorks（桌面端，工业界用得最多）、PTC 的 Onshape（浏览器里运行的云端 CAD，方便协作）、Autodesk 的 Fusion 360。不同软件之间交换模型一般用 STEP 格式，这是一种通用的中性三维文件格式。对具身智能来说，CAD 模型是做仿真的源头：用插件把装配体导出成 URDF 或 MJCF（描述连杆、关节、质量的机器人模型文件），再配上网格文件，就能放进 MuJoCo、Isaac Sim 里跑。","example":"用 onshape-to-robot 把 Onshape 里画好的开源机械臂装配体直接导出成 URDF，再加载进仿真器。","related":["统一机器人描述格式","SolidWorks 转 URDF 插件","onshape-to-robot","网格文件","MJCF","3D 打印（FDM / 光固化）"]},{"id":"solidworks-to-urdf-exporter","category":"software","sec":2,"tier":3,"sources":[{"title":"sw_urdf_exporter - ROS Wiki","url":"http://wiki.ros.org/sw_urdf_exporter"}],"as_of":"","related_ids":["unified-robot-description-format","cad-software","onshape-to-robot","mesh-file","inertial-parameters"],"name":"SolidWorks 转 URDF 插件","alt":"SolidWorks to URDF Exporter","abbr":"sw2urdf","aliases":["sw_urdf_exporter"],"one_liner":"把 SolidWorks 装配体一键导出成 URDF 机器人模型的插件","explanation":"这是 ROS 社区维护的一个 SolidWorks 插件。机械工程师通常在 SolidWorks（一款三维 CAD 建模软件）里设计机器人，而仿真和 ROS 需要 URDF 格式的模型描述。插件让用户在装配体里指定连杆、关节类型、转轴和坐标系，然后导出一个 ROS 功能包，里面有 URDF 文件、各连杆的 STL 网格和启动文件，质量和惯量也从 CAD 的质量属性里自动算出。导出结果通常还要人工检查关节方向、限位和惯量，再拿去 Isaac Sim、MuJoCo 等仿真器使用。","example":"在 SolidWorks 里画好一条六轴机械臂，用插件为每个关节设好参考轴，导出 URDF 后在 RViz 里检查关节转向。","related":["统一机器人描述格式","CAD 建模软件（SolidWorks / Onshape / Fusion 360）","onshape-to-robot","网格文件","惯性参数"]},{"id":"onshape-to-robot","category":"software","sec":2,"tier":3,"sources":[{"title":"Rhoban/onshape-to-robot (GitHub)","url":"https://github.com/Rhoban/onshape-to-robot"}],"as_of":"","related_ids":["unified-robot-description-format","mjcf","solidworks-to-urdf-exporter","cad-software","mesh-file","simulation-description-format"],"name":"onshape-to-robot","alt":"onshape-to-robot","abbr":"","aliases":[],"one_liner":"把 Onshape 里画好的机器人装配体导出成 URDF/MJCF 的开源工具","explanation":"onshape-to-robot 是法国波尔多大学 Rhoban 团队开源的 Python 工具。机器人结构常在 CAD 软件里设计，但仿真器和 ROS 需要的是 URDF、SDF、MJCF 这类机器人描述文件，手工转写连杆、关节、质量和惯量既费时又容易错。这个工具通过 Onshape（一款云端 CAD）的接口读取装配体，按命名约定识别关节，自动生成描述文件和网格，并带上质量、惯量信息。它常被开源硬件项目用来把设计直接送进 MuJoCo、PyBullet 等仿真器。","example":"在 Onshape 里把关节配合命名为 dof_knee 等，运行 onshape-to-robot 后直接得到可在 MuJoCo 里加载的 MJCF 文件和 STL 网格。","related":["统一机器人描述格式","MJCF","SolidWorks 转 URDF 插件","CAD 建模软件（SolidWorks / Onshape / Fusion 360）","网格文件","SDFormat 仿真描述格式"]},{"id":"blender","category":"software","sec":2,"tier":3,"sources":[{"title":"Blender 官网","url":"https://www.blender.org/"}],"as_of":"","related_ids":["mesh-file","simulation-assets","synthetic-data","unified-robot-description-format","photorealistic-rendering","path-tracing"],"name":"Blender","alt":"Blender","abbr":"","aliases":[],"one_liner":"免费开源的三维建模与渲染软件，常用来处理机器人模型和生成合成数据","explanation":"Blender 是由 Blender 基金会维护的免费开源三维创作软件，功能包括建模、材质、动画、渲染（内置 Cycles 路径追踪和 EEVEE 实时渲染器）等，并提供完整的 Python 接口，可以写脚本批量操作。它本身不是机器人软件，但在具身智能里用得很多：修整和简化机器人或物体的网格文件，再导出 STL、OBJ、glTF 给 URDF 或仿真器用；制作仿真场景和资产；用脚本批量渲染带标注的图像做合成数据，例如德国宇航中心开源的 BlenderProc 就基于 Blender。也有插件可以在 Blender 里编辑和导出 URDF。","example":"用 Blender 打开 CAD 导出的高面数夹爪网格，减面后导出为 OBJ，作为 URDF 中的可视化模型。","related":["网格文件","仿真资产","合成数据","统一机器人描述格式","照片级真实感渲染","路径追踪"]},{"id":"coacd","category":"software","sec":2,"tier":3,"sources":[{"title":"CoACD - GitHub","url":"https://github.com/SarahWeiii/CoACD"}],"as_of":"","related_ids":["convex-decomposition","collision-geometry","simulation-assets","mesh-file","unified-robot-description-format","mjcf"],"name":"CoACD 凸分解工具","alt":"CoACD (Collision-Aware Approximate Convex Decomposition)","abbr":"","aliases":["CoACD"],"one_liner":"把网格模型自动切成一组凸块，给物理引擎当碰撞体。","explanation":"一个开源的近似凸分解工具，来自加州大学圣迭戈分校 Hao Su 组（Wei 等，SIGGRAPH 2022）。物理引擎算碰撞时凸形状最快，但仿真资产多是任意形状的三角网格，直接用又慢又不稳；早先常用的 V-HACD 容易把关键凹结构（杯口、抽屉缝）填平，抓取和插入任务就没法仿真。CoACD 在切分时显式考虑碰撞感知的凹度，再用树搜索挑切法，把这些结构保留下来。用法是把 OBJ/STL 跑一遍，输出的多个凸块写进 URDF 或 MJCF 的碰撞字段。","example":"在 MuJoCo、Isaac Sim 里导入杯子或家具网格前先跑 CoACD 生成凸碰撞体，避免夹爪抓不进杯口。","related":["凸分解","碰撞体","仿真资产","网格文件","统一机器人描述格式","MJCF"]},{"id":"tf-tf2-transform-tree","category":"software","sec":2,"tier":2,"sources":[{"title":"ROS 2 Docs: About tf2","url":"https://docs.ros.org/en/rolling/Concepts/Intermediate/About-Tf2.html"},{"title":"ROS Wiki: tf2","url":"http://wiki.ros.org/tf2"}],"as_of":"","related_ids":["coordinate-transformation","coordinate-frame","robot-state-publisher","rep-105","rviz-rviz2","homogeneous-transformation-matrix"],"name":"TF 坐标树","alt":"TF / tf2 Transform Tree","abbr":"TF","aliases":["tf2","tf2坐标变换","TF 树","坐标变换树"],"one_liner":"ROS 用来记录和查询各坐标系之间实时变换关系的树状结构","explanation":"TF 是 ROS 的坐标变换库，现行版本是 tf2，最早由 Tully Foote 等人在 Willow Garage 开发。机器人身上有很多坐标系：地图、底盘、各个连杆、相机、夹爪，它们之间的相对位姿随时间变化。TF 把这些坐标系组织成一棵树，每条边是一个带时间戳的变换，由各节点发布到 /tf（动态）和 /tf_static（固定）话题。任何程序都能查询任意两个坐标系在某一时刻的变换，比如把相机看到的物体坐标换算到机械臂基座坐标系下去抓取。","example":"用 ros2 run tf2_ros tf2_echo base_link camera_link 查看相机相对底盘的位姿；robot_state_publisher 会根据 URDF 和关节角自动发布整条手臂的 TF。","related":["坐标变换","坐标系","robot_state_publisher","REP 105 坐标系约定（map / odom / base_link）","RViz","齐次变换矩阵"]},{"id":"robot-state-publisher","category":"software","sec":2,"tier":3,"sources":[{"title":"robot_state_publisher on GitHub","url":"https://github.com/ros/robot_state_publisher"},{"title":"ROS Wiki: robot_state_publisher","url":"http://wiki.ros.org/robot_state_publisher"}],"as_of":"","related_ids":["tf-tf2-transform-tree","unified-robot-description-format","rviz-rviz2","forward-kinematics","robot-operating-system-2","topic"],"name":"robot_state_publisher","alt":"robot_state_publisher","abbr":"","aliases":["joint_state_publisher"],"one_liner":"ROS 包：读 URDF 和关节角，算出并发布机器人各连杆的坐标变换","explanation":"robot_state_publisher 是 ROS 和 ROS 2 里的基础软件包。它读取机器人的 URDF 模型（通过 robot_description 参数），订阅 /joint_states 话题里的关节角，做一遍正运动学，把每个连杆相对父连杆的位姿发布到 TF 坐标树上。有了它，RViz 才能画出机器人当前的姿态，其他节点也能查询「夹爪相对底座在哪」。常和它配套出现的 joint_state_publisher 负责发布关节角：没有真机时可以用它的 GUI 版拖滑块手动设置关节角，方便调试模型。","example":"写完一个机械臂的 URDF 后，同时启动 robot_state_publisher、joint_state_publisher_gui 和 RViz，拖动滑块就能看到模型各关节跟着转。","related":["TF 坐标树","统一机器人描述格式","RViz","正运动学","ROS 2","话题"]},{"id":"rep-105","category":"software","sec":2,"tier":3,"sources":[{"title":"REP 105 -- Coordinate Frames for Mobile Platforms","url":"https://www.ros.org/reps/rep-0105.html"}],"as_of":"","related_ids":["tf-tf2-transform-tree","coordinate-frame","ros-2-navigation-stack","wheel-odometry","adaptive-monte-carlo-localization","right-handed-frame-and-axis-conventions"],"name":"REP 105 坐标系约定（map / odom / base_link）","alt":"REP 105: Coordinate Frames for Mobile Platforms","abbr":"","aliases":["REP 105","map-odom-base_link"],"one_liner":"ROS 规定移动机器人 map、odom、base_link 三个坐标系怎么定义、怎么连","explanation":"REP 105 是 ROS 社区的一份规范提案（ROS Enhancement Proposal），约定移动机器人常用坐标系的名字和含义：base_link 固定在机器人本体上；odom 是里程计坐标系，机器人位姿在里面连续平滑但会慢慢漂移；map 是全局地图坐标系，位姿不漂移但可能因定位修正而跳变。三者按 map → odom → base_link 串成一棵 TF 树，定位模块只负责发布 map → odom，里程计发布 odom → base_link。统一约定后，导航、SLAM、定位等不同软件包才能互相拼接，Nav2 等都按它来用。","example":"机器人用轮式里程计发布 odom → base_link，AMCL 定位算法根据激光匹配结果发布 map → odom，两者合起来就得到机器人在地图上的位置。","related":["TF 坐标树","坐标系","Nav2","轮式里程计","自适应蒙特卡洛定位","右手坐标系与轴向约定"]},{"id":"rviz-rviz2","category":"software","sec":2,"tier":2,"sources":[{"title":"ros2/rviz (GitHub)","url":"https://github.com/ros2/rviz"},{"title":"ROS Wiki: rviz","url":"http://wiki.ros.org/rviz"}],"as_of":"","related_ids":["robot-operating-system-2","tf-tf2-transform-tree","unified-robot-description-format","moveit-motion-planning-framework","rqt","foxglove-studio"],"name":"RViz","alt":"RViz / RViz2","abbr":"","aliases":["RViz2","rviz"],"one_liner":"ROS 自带的 3D 可视化工具，用来看机器人模型、坐标系和传感器数据","explanation":"RViz 是 ROS 的官方三维可视化工具，ROS 2 中的版本叫 RViz2。它订阅 ROS 话题，把机器人模型（来自 URDF）、TF 坐标系、激光雷达点云、相机图像、规划路径、自定义标记等画在同一个 3D 场景里。它本身不做仿真，只负责「显示机器人此刻认为世界是什么样」，所以是调试传感器标定、坐标变换和导航规划最常用的工具。MoveIt 和 Nav2 的交互界面都以 RViz 插件的形式提供。","example":"在 RViz2 里添加 RobotModel 和 PointCloud2 显示，检查深度相机点云是否和机械臂模型对齐，以此判断手眼标定对不对。","related":["ROS 2","TF 坐标树","统一机器人描述格式","MoveIt","rqt","Foxglove"]},{"id":"middleware","category":"software","sec":3,"tier":2,"sources":[{"title":"ROS 2 文档：Different ROS 2 middleware vendors","url":"https://docs.ros.org/en/rolling/Concepts/Intermediate/About-Different-Middleware-Vendors.html"}],"as_of":"","related_ids":["ros-middleware-interface","data-distribution-service","eprosima-fast-dds","eclipse-cyclone-dds","eclipse-zenoh","ros-2-quality-of-service"],"name":"中间件","alt":"Middleware","abbr":"","aliases":["通信中间件","机器人中间件"],"one_liner":"夹在操作系统和应用之间，负责程序间通信的软件层。","explanation":"中间件是位于操作系统和应用程序之间的一层软件，替开发者处理「程序之间怎么找到对方、数据怎么打包、怎么在进程或机器之间传输、丢包和延迟怎么处理」这些通用问题。机器人软件由很多独立进程组成，传感器数据量大、对延迟敏感，所以通信中间件很关键。ROS 2 本身不自己实现传输，而是通过 ROS 中间件接口（rmw）接入底层实现，默认是 DDS（数据分发服务）系列，如 Fast DDS、Cyclone DDS，也可以换成 Zenoh。ROS、LCM、dora-rs 这类框架有时也被整体叫作机器人中间件。","example":"设置环境变量 RMW_IMPLEMENTATION=rmw_cyclonedds_cpp，就能把 ROS 2 底层通信从默认的 Fast DDS 换成 Cyclone DDS。","related":["ROS 中间件接口","数据分发服务","Fast DDS","Cyclone DDS","Zenoh","服务质量"]},{"id":"data-distribution-service","category":"software","sec":3,"tier":2,"sources":[{"title":"OMG: Data Distribution Service specification","url":"https://www.omg.org/spec/DDS/"},{"title":"ROS 2 Documentation: Different ROS 2 middleware vendors","url":"https://docs.ros.org/en/rolling/Concepts/Intermediate/About-Different-Middleware-Vendors.html"}],"as_of":"","related_ids":["robot-operating-system-2","ros-middleware-interface","eprosima-fast-dds","eclipse-cyclone-dds","ros-2-quality-of-service","eclipse-zenoh"],"name":"数据分发服务","alt":"Data Distribution Service","abbr":"DDS","aliases":[],"one_liner":"OMG 制定的发布/订阅通信标准，ROS 2 默认的底层传输","explanation":"DDS 是对象管理组织（OMG）制定的实时发布/订阅通信中间件标准，最早用于军工、航空等对实时性和可靠性要求高的分布式系统。它的特点是没有中心节点，参与者在网络里自动发现彼此，并通过 QoS（服务质量）策略配置可靠传输还是尽力而为、保留多少历史消息等。ROS 2 放弃了 ROS 1 自研的通信层，改为通过 RMW（ROS 中间件接口）接入 DDS，常用实现有 eProsima Fast DDS、Eclipse Cyclone DDS 和 RTI Connext。多机通信不通、话题收不到，很多时候要从 DDS 配置查起。","example":"设置环境变量 RMW_IMPLEMENTATION=rmw_cyclonedds_cpp，把 ROS 2 的底层通信从默认的 Fast DDS 切换到 Cyclone DDS。","related":["ROS 2","ROS 中间件接口","Fast DDS","Cyclone DDS","服务质量","Zenoh"]},{"id":"ros-2-quality-of-service","category":"software","sec":3,"tier":3,"sources":[{"title":"Quality of Service settings (ROS 2 Documentation)","url":"https://docs.ros.org/en/rolling/Concepts/Intermediate/About-Quality-of-Service-Settings.html"}],"as_of":"","related_ids":["robot-operating-system-2","data-distribution-service","publish-subscribe","topic","middleware","ros-middleware-interface"],"name":"服务质量","alt":"Quality of Service","abbr":"QoS","aliases":["QoS 策略"],"one_liner":"ROS 2 里规定消息怎么传的一组策略，如是否可靠、保留几条","explanation":"服务质量（QoS）原本是网络通信里的通用概念。ROS 2 基于 DDS（数据分发服务）中间件，把它落到每个发布者和订阅者上，常用策略包括：可靠性（必达重传或尽力而为）、持久性（后加入的订阅者能否收到之前的消息）、历史（保留最近 N 条或全部）、队列深度，以及截止时间、存活性等。合理设置能在丢包与延迟之间取舍，例如高频传感器数据宁可丢帧也不要排队。新手常踩的坑是发布端与订阅端 QoS 不兼容，话题名对了却收不到任何消息。","example":"相机驱动用尽力而为发布图像，若订阅端设成可靠模式，两端不兼容，订阅节点就一帧也收不到。","related":["ROS 2","数据分发服务","发布/订阅","话题","中间件","ROS 中间件接口"]},{"id":"ros-2-domain-id","category":"software","sec":3,"tier":3,"sources":[{"title":"ROS 2 Documentation: The ROS_DOMAIN_ID","url":"https://docs.ros.org/en/rolling/Concepts/Intermediate/About-Domain-ID.html"}],"as_of":"","related_ids":["robot-operating-system-2","data-distribution-service","middleware","node","topic","ros-2-quality-of-service"],"name":"ROS_DOMAIN_ID（域 ID）","alt":"ROS 2 Domain ID","abbr":"","aliases":["ROS_DOMAIN_ID"],"one_liner":"ROS 2 的环境变量，决定哪些节点能互相发现和通信","explanation":"ROS 2 底层用 DDS 中间件通信，同一局域网里的节点会自动互相发现。ROS_DOMAIN_ID 是一个环境变量，用来给节点分组：只有域 ID 相同的节点才能看到彼此，默认值是 0。它由 DDS 的「域」概念而来，不同域 ID 会映射到不同的网络端口。官方文档建议在 0–101 之间取值，以免和系统端口冲突。实验室里多人、多台机器人共用一个网络时，如果不分开设置，就会收到别人的话题数据、互相干扰，这是新手常见的坑。","example":"两位同学在同一 Wi-Fi 下各调一台机器人，分别在终端执行 export ROS_DOMAIN_ID=11 和 export ROS_DOMAIN_ID=12，彼此的话题就不会串。","related":["ROS 2","数据分发服务","中间件","节点","话题","服务质量"]},{"id":"ros-middleware-interface","category":"software","sec":3,"tier":3,"sources":[{"title":"ROS 2 Docs: About different ROS 2 middleware vendors","url":"https://docs.ros.org/en/jazzy/Concepts/Intermediate/About-Different-Middleware-Vendors.html"},{"title":"ROS 2 Design: ROS 2 middleware interface","url":"https://design.ros2.org/articles/ros_middleware_interface.html"}],"as_of":"","related_ids":["robot-operating-system-2","middleware","data-distribution-service","eprosima-fast-dds","eclipse-cyclone-dds","eclipse-zenoh"],"name":"ROS 中间件接口","alt":"ROS Middleware Interface","abbr":"RMW","aliases":["rmw","RMW 实现"],"one_liner":"ROS 2 里把上层 API 和底层通信实现隔开的抽象接口层","explanation":"RMW 是 ROS 2 的一层 C 接口，位于客户端库（rclcpp、rclpy，经由 rcl）和具体通信中间件之间。ROS 2 默认基于 DDS（数据分发服务，一种发布/订阅通信标准）通信，而 DDS 有多家实现，RMW 让它们以插件形式接入，如 rmw_fastrtps_cpp（Fast DDS）、rmw_cyclonedds_cpp（Cyclone DDS），较新的发行版还加入了基于 Zenoh 的 rmw_zenoh_cpp。用户代码不用改，只要设置环境变量 RMW_IMPLEMENTATION 就能切换。遇到多机发现失败、大数据传输卡顿时，换一种 RMW 实现是常见排查手段；同一系统里的节点最好用同一种实现。","example":"export RMW_IMPLEMENTATION=rmw_cyclonedds_cpp 之后再 ros2 run，节点就改用 Cyclone DDS 收发消息。","related":["ROS 2","中间件","数据分发服务","Fast DDS","Cyclone DDS","Zenoh"]},{"id":"eprosima-fast-dds","category":"software","sec":3,"tier":3,"sources":[{"title":"Fast DDS 官方文档","url":"https://fast-dds.docs.eprosima.com/"},{"title":"Fast DDS GitHub","url":"https://github.com/eProsima/Fast-DDS"}],"as_of":"","related_ids":["data-distribution-service","eclipse-cyclone-dds","ros-middleware-interface","robot-operating-system-2","ros-2-quality-of-service","ros-distribution"],"name":"Fast DDS","alt":"eProsima Fast DDS","abbr":"","aliases":["Fast-RTPS","Fast RTPS"],"one_liner":"西班牙 eProsima 公司开源的 DDS 实现，多个 ROS 2 版本的默认中间件","explanation":"Fast DDS 是西班牙公司 eProsima 开发的开源 DDS（数据分发服务）实现，用 C++ 编写，旧名 Fast RTPS（RTPS 是 DDS 底层的线路传输协议）。ROS 2 通过 RMW 接口挂接具体的 DDS 实现，对应的包是 rmw_fastrtps_cpp；Humble、Jazzy 等主流 ROS 2 发行版默认就用 Fast DDS。它支持共享内存传输、发现服务器（Discovery Server，用于减少大规模网络中的节点发现流量）等功能。新手遇到话题收不到、跨机通信不通时，往往需要了解 Fast DDS 的配置 XML 和发现机制。","example":"多台机器人同时在线时发现流量过大，改用 Fast DDS 的 Discovery Server 模式，由一个服务器节点统一负责节点发现。","related":["数据分发服务","Cyclone DDS","ROS 中间件接口","ROS 2","服务质量","ROS 发行版"]},{"id":"eclipse-cyclone-dds","category":"software","sec":3,"tier":3,"sources":[{"title":"Eclipse Cyclone DDS 官网","url":"https://cyclonedds.io/"},{"title":"Cyclone DDS GitHub","url":"https://github.com/eclipse-cyclonedds/cyclonedds"}],"as_of":"","related_ids":["data-distribution-service","eprosima-fast-dds","ros-middleware-interface","eclipse-iceoryx","unitree-sdk2","robot-operating-system-2"],"name":"Cyclone DDS","alt":"Eclipse Cyclone DDS","abbr":"","aliases":["CycloneDDS"],"one_liner":"Eclipse 基金会的开源 DDS 实现，ROS 2 可选的底层通信中间件之一","explanation":"Cyclone DDS 是 Eclipse 基金会托管的开源 DDS（数据分发服务，一种工业界的发布/订阅通信标准）实现，用 C 语言编写，主打轻量和低延迟。ROS 2 本身不直接收发数据，而是通过 RMW（ROS 中间件接口）调用某个 DDS 实现，Cyclone DDS 就是官方支持的选项之一，对应 rmw_cyclonedds_cpp。它可借助 iceoryx 走共享内存实现零拷贝传输。不少机器人厂商的 SDK 直接基于它，例如宇树 SDK2 的通信层就用了 Cyclone DDS。遇到默认中间件发现慢、丢包等问题时，切换到 Cyclone DDS 是常见的排查手段。","example":"设置环境变量 RMW_IMPLEMENTATION=rmw_cyclonedds_cpp，让 ROS 2 节点改用 Cyclone DDS 通信。","related":["数据分发服务","Fast DDS","ROS 中间件接口","iceoryx","宇树 SDK","ROS 2"]},{"id":"eclipse-zenoh","category":"software","sec":3,"tier":3,"sources":[{"title":"Eclipse Zenoh 官网","url":"https://zenoh.io/"},{"title":"rmw_zenoh GitHub","url":"https://github.com/ros2/rmw_zenoh"}],"as_of":"","related_ids":["robot-operating-system-2","ros-middleware-interface","data-distribution-service","eclipse-cyclone-dds","publish-subscribe","dataflow-oriented-robotic-architecture"],"name":"Zenoh","alt":"Eclipse Zenoh","abbr":"","aliases":["rmw_zenoh"],"one_liner":"统一发布/订阅、存储和查询的开源通信协议，ROS 2 可用它替代 DDS","explanation":"Zenoh 是 Eclipse 基金会托管的开源通信协议和实现，主要由 ZettaScale 公司开发，核心用 Rust 编写。它把发布/订阅、数据存储和查询统一在一套接口里，设计上兼顾从微控制器到云端的各种设备，并能跨越路由器和广域网。DDS 在 Wi-Fi、多机器人或跨网段场景下常遇到节点发现流量大、配置复杂的问题，Zenoh 用路由器（zenohd）方式缓解这些问题。ROS 2 官方提供了 rmw_zenoh，可把 Zenoh 作为底层中间件替代 DDS；也有 zenoh-bridge 把现有 DDS 流量桥接出去。","example":"在 ROS 2 中先启动 Zenoh 路由器，再设置 RMW_IMPLEMENTATION=rmw_zenoh_cpp，让机器人和远程工作站跨网段互相收发话题。","related":["ROS 2","ROS 中间件接口","数据分发服务","Cyclone DDS","发布/订阅","dora-rs"]},{"id":"zero-copy","category":"software","sec":3,"tier":3,"sources":[{"title":"Eclipse iceoryx","url":"https://iceoryx.io/"},{"title":"Configure Zero Copy Loaned Messages (ROS 2 Documentation)","url":"https://docs.ros.org/en/rolling/How-To-Guides/Configure-ZeroCopy-loaned-messages.html"}],"as_of":"","related_ids":["eclipse-iceoryx","composable-nodes-and-intra-process-communication","robot-operating-system-2","data-distribution-service","middleware","control-latency"],"name":"零拷贝","alt":"Zero-Copy (Shared-Memory IPC)","abbr":"","aliases":["共享内存通信","零拷贝通信"],"one_liner":"进程间传大数据时不复制内容、只传共享内存位置的通信方式","explanation":"零拷贝指进程间通信（IPC）时，发送方把数据直接写进一块双方都能访问的共享内存，接收方拿到的是这块内存的引用，而不是再复制一份。机器人上相机图像、深度图、点云动辄每秒几十上百兆，如果每个订阅者都走序列化加复制，CPU 占用和延迟都会明显上升。Eclipse iceoryx 是专门做这件事的中间件；ROS 2 通过借用消息（loaned messages）配合 iceoryx、Fast DDS 共享内存等实现零拷贝，同一进程内还可用可组合节点的进程内通信。限制是一般只在同一台机器上有效，且消息最好是固定大小。","example":"在 ROS 2 中给相机驱动和检测节点开启 Fast DDS 共享内存传输，1080p 图像不再逐帧复制，端到端延迟下降。","related":["iceoryx","可组合节点 / 进程内通信","ROS 2","数据分发服务","中间件","控制延迟"]},{"id":"eclipse-iceoryx","category":"software","sec":3,"tier":3,"sources":[{"title":"Eclipse iceoryx 官网","url":"https://iceoryx.io/"},{"title":"iceoryx GitHub","url":"https://github.com/eclipse-iceoryx/iceoryx"}],"as_of":"","related_ids":["zero-copy","eclipse-cyclone-dds","middleware","robot-operating-system-2","dataflow-oriented-robotic-architecture"],"name":"iceoryx","alt":"Eclipse iceoryx","abbr":"","aliases":["iceoryx2"],"one_liner":"基于共享内存的零拷贝进程间通信库，常被 DDS 和 ROS 2 用来传大数据","explanation":"iceoryx 是 Eclipse 基金会托管的开源进程间通信（IPC）中间件，最初由博世团队为汽车软件开发。普通通信要把数据从发送方拷贝到接收方，图像、点云这类大消息拷贝一次就很耗时；iceoryx 让发送方直接把数据写在共享内存里，接收方只拿到一个指向它的引用，实现「零拷贝」，传输延迟基本与消息大小无关。它只管同一台机器内的进程，跨机器仍需 DDS 等网络协议。Cyclone DDS 可以用它作为本机共享内存传输层。后续推出了用 Rust 重写的 iceoryx2。","example":"在机器人主控上把 Cyclone DDS 配置为启用 iceoryx 共享内存，相机节点发给感知节点的高分辨率图像不再经过拷贝。","related":["零拷贝","Cyclone DDS","中间件","ROS 2","dora-rs"]},{"id":"composable-nodes-and-intra-process-communication","category":"software","sec":3,"tier":3,"sources":[{"title":"Intra-process Communications in ROS 2 (design.ros2.org)","url":"https://design.ros2.org/articles/intraprocess_communications.html"},{"title":"About Composition - ROS 2 Documentation","url":"https://docs.ros.org/en/rolling/Concepts/Intermediate/About-Composition.html"}],"as_of":"","related_ids":["node","robot-operating-system-2","middleware","data-distribution-service","zero-copy","ros-2-executor-and-callback-groups"],"name":"可组合节点 / 进程内通信","alt":"Composable Nodes (Components) & Intra-process Communication","abbr":"","aliases":["ROS 2 组件","Component"],"one_liner":"把多个 ROS 2 节点装进一个进程，通信直接传指针不拷数据。","explanation":"ROS 2 的组件机制：节点编译成共享库，运行时由一个容器进程按需加载多个，这样的节点叫可组合节点。同一进程内的发布订阅可以走进程内通信，消息以智能指针传递，省掉序列化和内存拷贝；跨进程则要经中间件（DDS）走网络栈。这对高带宽数据很关键——多路相机图像和点云若每一跳都拷一份，CPU 占用和延迟都吃不住。做法是写节点时注册为组件，再用启动文件把相机驱动、图像处理、推理节点放进同一个容器；Isaac ROS 等视觉流水线默认就这么组织。","example":"把相机驱动、去畸变、目标检测三个节点放进一个组件容器，图像在进程内零拷贝流转。","related":["节点","ROS 2","中间件","数据分发服务","零拷贝","ROS 2 执行器与回调组"]},{"id":"ros-2-executor-and-callback-groups","category":"software","sec":3,"tier":3,"sources":[{"title":"ROS 2 Documentation: Executors","url":"https://docs.ros.org/en/rolling/Concepts/Intermediate/About-Executors.html"},{"title":"ROS 2 Documentation: Using Callback Groups","url":"https://docs.ros.org/en/rolling/How-To-Guides/Using-callback-groups.html"}],"as_of":"","related_ids":["robot-operating-system-2","node","ros-client-library","composable-nodes-and-intra-process-communication","real-time-control","service"],"name":"ROS 2 执行器与回调组","alt":"ROS 2 Executor & Callback Groups","abbr":"","aliases":["Executor","Callback Group","MultiThreadedExecutor"],"one_liner":"ROS 2 里决定回调函数由谁、用几个线程、能否并发执行的机制","explanation":"ROS 2 节点里订阅、定时器、服务等收到事件后都会触发回调函数，执行器（Executor）负责调度这些回调：单线程执行器一次只跑一个，多线程执行器可以并行跑多个。回调组（Callback Group）进一步规定哪些回调能同时运行：互斥组里的回调不会并发，可重入组里的可以。它解决的是实时性和死锁问题，比如在一个回调里同步调用服务并等待结果，如果服务的响应回调被同一线程堵住，就会卡死；把它们放进不同回调组、再用多线程执行器即可避免。","example":"控制节点里 100 Hz 的定时器回调和慢速的相机图像处理回调放在不同回调组，用 MultiThreadedExecutor 运行，控制循环就不会被图像处理拖慢。","related":["ROS 2","节点","ROS 客户端库","可组合节点 / 进程内通信","实时控制","服务"]},{"id":"lifecycle-node","category":"software","sec":3,"tier":3,"sources":[{"title":"ROS 2 Design: Managed nodes","url":"https://design.ros2.org/articles/node_lifecycle.html"}],"as_of":"","related_ids":[null,null,null,null,null,"ros2-control"],"name":"生命周期节点","alt":"Lifecycle Node (Managed Node)","abbr":"","aliases":["托管节点","Managed Node","LifecycleNode"],"one_liner":"ROS 2 中带标准状态机的节点，可被外部按顺序配置、启动、暂停和关闭。","explanation":"生命周期节点是 ROS 2 引入的一种节点类型。普通节点一启动就开始工作，多个节点之间谁先就绪无法保证；生命周期节点则内置一个标准状态机，主要状态有未配置、未激活、激活、已终止，通过配置、激活、停用、清理、关闭等转换在状态间切换，每次转换都会调用开发者写好的回调（如在「配置」里读参数、分配资源，在「激活」里开始发布消息）。外部管理器可以按顺序把一组节点拉起，出错时统一停用，使系统启动和故障处理可控。Nav2 导航栈就用生命周期管理器来启动它的各个服务器节点。","example":"Nav2 的 lifecycle_manager 先把地图服务器、定位节点依次配置并激活，确认就绪后再激活规划器和控制器，避免控制器在没有地图时就开始输出速度。","related":["ROS 2(Robot Operating System 2)","节点(Node (ROS))","Nav2(ROS 2 Navigation Stack)","有限状态机(Finite State Machine)","启动文件(Launch File)","ros2_control"]},{"id":"lightweight-communications-and-marshalling","category":"software","sec":3,"tier":3,"sources":[{"title":"LCM 官方文档","url":"https://lcm-proj.github.io/lcm/"},{"title":"lcm-proj/lcm (GitHub)","url":"https://github.com/lcm-proj/lcm"}],"as_of":"","related_ids":[null,null,null,"drake","zeromq","mit-mini-cheetah"],"name":"LCM","alt":"Lightweight Communications and Marshalling","abbr":"LCM","aliases":["lcm-proj"],"one_liner":"一套轻量的发布/订阅消息库，基于 UDP 组播，延迟低，常用于实时机器人控制。","explanation":"LCM 是 MIT 团队在参加 DARPA 城市挑战赛（无人车比赛）期间开发并开源的消息传递库。开发者用 .lcm 文件定义消息结构，工具自动生成 C、C++、Python、Java 等语言的收发代码；消息通过 UDP 组播以发布/订阅方式传输，不需要中心节点，依赖少、延迟低。它还附带 lcm-spy（实时查看消息）和 lcm-logger（录制回放）等工具。相比 ROS，LCM 只管通信不管其他，因此常被用在对实时性要求高的控制回路里，例如 MIT Cheetah 系列四足、Drake 工具箱以及一些机器人厂商早期的 SDK。","example":"Drake 仿真里控制器与可视化程序之间通过 LCM 频道传递机器人状态，开发者用 lcm-spy 实时查看各频道的消息频率和内容。","related":["发布/订阅(Publish-Subscribe)","中间件(Middleware)","机器人操作系统(Robot Operating System)","Drake","ZeroMQ","MIT Mini Cheetah"]},{"id":"zeromq","category":"software","sec":3,"tier":3,"sources":[{"title":"ZeroMQ 官网","url":"https://zeromq.org/"},{"title":"ZeroMQ Guide (zguide)","url":"https://zguide.zeromq.org/"},{"title":"ZeroMQ - Wikipedia","url":"https://en.wikipedia.org/wiki/ZeroMQ"}],"as_of":"","related_ids":["policy-server","publish-subscribe","grpc-remote-procedure-calls","lightweight-communications-and-marshalling","protocol-buffers","middleware"],"name":"ZeroMQ","alt":"ZeroMQ","abbr":"ZMQ","aliases":["ØMQ","0MQ"],"one_liner":"轻量开源消息库，几行代码就能让程序之间收发数据","explanation":"ZeroMQ 是一个开源的异步消息库，由 iMatix 公司的 Pieter Hintjens、Martin Sustrik 等人发起，核心是 C++ 写的 libzmq，Python 里用 pyzmq。它不需要单独的消息服务器（broker），把常见通信模式封装成几类套接字：请求-应答（REQ/REP）、发布-订阅（PUB/SUB）、推-拉（PUSH/PULL）等，跨进程、跨机器都能用。具身智能里常用它搭轻量的策略服务器：GPU 机器跑模型，机器人端把观测发过去、取回动作，不必引入整套 ROS。它只管传字节，数据格式要自己用 msgpack、Protobuf 等序列化。","example":"机器人端用 REQ 套接字把相机图像和关节状态发给远程 GPU 服务器，服务器用 REP 套接字返回一段动作分块。","related":["策略服务器","发布/订阅","gRPC","LCM","Protobuf","中间件"]},{"id":"protocol-buffers","category":"software","sec":3,"tier":3,"sources":[{"title":"Protocol Buffers 官方文档","url":"https://protobuf.dev/"}],"as_of":"","related_ids":["grpc-remote-procedure-calls","message","mcap","middleware","zeromq","lightweight-communications-and-marshalling"],"name":"Protobuf","alt":"Protocol Buffers","abbr":"Protobuf","aliases":["Protocol Buffers","proto"],"one_liner":"谷歌开源的跨语言结构化数据序列化格式，体积小、解析快","explanation":"Protobuf（Protocol Buffers）是谷歌开发并于 2008 年开源的数据序列化机制。开发者先在 .proto 文件里定义消息结构（字段名、类型、编号），再用编译器 protoc 生成 C++、Python、Go 等语言的读写代码，数据以紧凑的二进制格式传输和存储。相比 JSON，它更省带宽、解析更快，并且新增字段后新旧版本仍能互相读取。它是 gRPC 的默认接口描述和编码格式，也被 MCAP 日志、Foxglove 等机器人工具支持，常用于机器人与云端、推理服务器之间的数据通信。","example":"把策略部署成远程推理服务时，用 .proto 定义「图像 + 关节状态 → 动作块」的请求和响应格式，再通过 gRPC 调用。","related":["gRPC","消息","MCAP 格式","中间件","ZeroMQ","LCM"]},{"id":"grpc-remote-procedure-calls","category":"software","sec":3,"tier":3,"sources":[{"title":"Introduction to gRPC","url":"https://grpc.io/docs/what-is-grpc/introduction/"}],"as_of":"","related_ids":["protocol-buffers","policy-server","websocket","zeromq","middleware"],"name":"gRPC","alt":"gRPC Remote Procedure Calls","abbr":"gRPC","aliases":[],"one_liner":"谷歌开源的远程过程调用框架，让不同机器上的程序像调函数一样通信","explanation":"gRPC 是谷歌开源的 RPC（远程过程调用）框架，现归云原生计算基金会 CNCF 托管。它用 Protobuf（一种二进制序列化格式）定义接口和消息，底层走 HTTP/2，支持双向流式传输，能自动生成 C++、Python、Go 等多种语言的客户端和服务端代码。在具身智能里它常用来连接「跑模型的 GPU 服务器」和「机器人本体」：机器人把图像和关节状态发给策略服务器，服务器返回动作，比自己拼 socket 协议省事、跨语言也方便。它不是实时控制总线，毫秒级的底层电机闭环仍交给 EtherCAT、CAN 等。","example":"波士顿动力 Spot 的官方 SDK 就是基于 gRPC 的接口，用 Python 远程下发指令和读取状态。","related":["Protobuf","策略服务器","WebSocket","ZeroMQ","中间件"]},{"id":"websocket","category":"software","sec":3,"tier":3,"sources":[{"title":"RFC 6455: The WebSocket Protocol","url":"https://datatracker.ietf.org/doc/html/rfc6455"},{"title":"The WebSocket API — MDN","url":"https://developer.mozilla.org/en-US/docs/Web/API/WebSockets_API"}],"as_of":"","related_ids":["policy-server","rosbridge","foxglove-studio","openpi","web-real-time-communication","grpc-remote-procedure-calls"],"name":"WebSocket","alt":"WebSocket","abbr":"","aliases":["WS"],"one_liner":"在一条 TCP 连接上双向实时收发消息的网络协议。","explanation":"WebSocket 是 IETF 在 2011 年发布的标准协议（RFC 6455）。普通 HTTP 是「客户端问一次、服务器答一次」，服务器不能主动推送。WebSocket 先用一次 HTTP 请求握手升级，之后双方在同一条 TCP 连接上随时互发消息，开销小、延迟低，浏览器和几乎所有语言都有现成库。机器人软件里用得很广：rosbridge 通过它把 ROS 话题开放给网页，Foxglove 的实时连接也基于它，一些 VLA 项目用它在 GPU 服务器与机器人之间传观测和动作。它基于 TCP，丢包时会重传等待，大码率视频流一般改用 WebRTC。","example":"openpi 在 GPU 服务器上起一个 WebSocket 策略服务器，机器人端每步把图像和关节状态发过去，收回一段动作块再执行。","related":["策略服务器","rosbridge","Foxglove","openpi","WebRTC 实时音视频传输","gRPC"]},{"id":"web-real-time-communication","category":"software","sec":3,"tier":3,"sources":[{"title":"WebRTC 官网","url":"https://webrtc.org/"},{"title":"WebRTC: Real-Time Communication in Browsers (W3C)","url":"https://www.w3.org/TR/webrtc/"}],"as_of":"","related_ids":["websocket","teleoperation","control-latency","vuer","ffmpeg"],"name":"WebRTC 实时音视频传输","alt":"Web Real-Time Communication","abbr":"WebRTC","aliases":[],"one_liner":"浏览器原生支持的低延迟点对点音视频与数据传输标准。","explanation":"WebRTC 是由 W3C（网页 API）和 IETF（网络协议）共同制定的开放标准，谷歌主导推动，2021 年成为 W3C 正式推荐标准。它让浏览器和应用之间不经服务器中转、直接点对点传音视频和任意数据，内置编解码、抖动缓冲和拥塞控制，端到端延迟通常可做到几百毫秒以内。两端常在不同局域网里，需要靠 ICE 流程配合 STUN/TURN 服务器打通 NAT（路由器地址转换）。在具身领域，它常用来把机器人相机画面实时传给远程操作员，也有机器人厂商用它做手机 App 与机器人的连接。","example":"远程遥操作时，机器人端把头部相机画面编码后用 WebRTC 推到操作员的浏览器或 VR 头显，操作指令再经它的数据通道回传。","related":["WebSocket","遥操作","控制延迟","Vuer（网页 3D / XR 可视化与遥操作工具）","FFmpeg（音视频编解码工具）"]},{"id":"rosbridge","category":"software","sec":3,"tier":3,"sources":[{"title":"RobotWebTools/rosbridge_suite (GitHub)","url":"https://github.com/RobotWebTools/rosbridge_suite"},{"title":"ROS Wiki: rosbridge_suite","url":"http://wiki.ros.org/rosbridge_suite"}],"as_of":"","related_ids":["robot-operating-system","robot-operating-system-2","websocket","topic","foxglove-studio",null],"name":"rosbridge","alt":"rosbridge","abbr":"","aliases":["rosbridge_suite","rosbridge_server"],"one_liner":"用 WebSocket 和 JSON 把 ROS 开放给网页和非 ROS 程序的桥","explanation":"rosbridge（功能包集叫 rosbridge_suite）定义了一套基于 JSON 的协议，并提供 WebSocket 服务器 rosbridge_server。浏览器页面、Unity、手机 App 等非 ROS 程序，只要能连 WebSocket、收发 JSON，就能订阅和发布话题、调用服务、读写参数，本机不用装 ROS。网页前端通常配合 roslibjs 使用。它同时支持 ROS 1 和 ROS 2。代价是 JSON 序列化开销大，传高频点云和图像效率低，更适合监控面板、远程遥控这类轻量场景。","example":"在机器人上启动 rosbridge_websocket 的 launch 文件，网页用 roslibjs 连 ws://机器人IP:9090，就能显示电量话题，并发布 cmd_vel 遥控底盘。","related":["机器人操作系统","ROS 2","WebSocket","话题","Foxglove","cmd_vel 速度指令话题"]},{"id":"model-context-protocol","category":"software","sec":3,"tier":3,"sources":[{"title":"Model Context Protocol 官网","url":"https://modelcontextprotocol.io/"},{"title":"ros-mcp-server GitHub","url":"https://github.com/robotmcp/ros-mcp-server"}],"as_of":"2026-09","related_ids":[null,"rosbridge",null,null,null],"name":"MCP / ROS-MCP-Server","alt":"Model Context Protocol (ROS MCP Server)","abbr":"MCP","aliases":["模型上下文协议","ros-mcp-server"],"one_liner":"让大模型通过统一协议调用 ROS 机器人接口的桥接工具。","explanation":"MCP（模型上下文协议）是 Anthropic 在 2024 年 11 月发布的开放标准，规定大模型应用如何以统一格式调用外部工具和数据源。ROS-MCP-Server 是社区开源项目，把 ROS 当作一个 MCP 工具：它通过 rosbridge（ROS 的 WebSocket 接口）连接机器人，让 Claude、GPT 等大模型能列出话题、读取传感器数据、发布速度指令或调用服务，而无需改动机器人原有代码，支持 ROS 1 和 ROS 2。它适合快速做自然语言控制原型，但大模型直接发指令缺少实时性与安全保证，不能替代底层控制。","example":"对大模型说「让小车往前走一米」，它经 ROS-MCP-Server 向 cmd_vel 话题发布速度消息。","related":["大语言模型(Large Language Model)","rosbridge","ROS 2(Robot Operating System 2)","大模型任务规划(LLM-based Task Planning)","cmd_vel 速度指令话题（Twist 消息）(cmd_vel Topic (geometry_msgs/Twist velocity command))"]},{"id":"dataflow-oriented-robotic-architecture","category":"software","sec":3,"tier":3,"sources":[{"title":"dora-rs GitHub","url":"https://github.com/dora-rs/dora"},{"title":"dora-rs 官网","url":"https://dora-rs.ai/"}],"as_of":"","related_ids":["robot-operating-system-2","middleware","zero-copy","eclipse-iceoryx","publish-subscribe","eclipse-zenoh"],"name":"dora-rs","alt":"Dataflow-Oriented Robotic Architecture","abbr":"dora","aliases":["dora"],"one_liner":"用 Rust 写的机器人数据流中间件，定位是更低延迟的 ROS 替代品","explanation":"dora-rs 是一个开源的机器人中间件框架，核心用 Rust 编写。它把机器人程序拆成若干节点，用一张数据流图描述谁把数据发给谁，节点之间通过共享内存和 Apache Arrow（一种列式内存数据格式）传递数据，尽量避免拷贝，从而降低相机图像、点云这类大数据的传输延迟。节点可以用 Python、Rust、C/C++ 编写，对跑 AI 模型的 Python 节点比较友好。它和 ROS 2 解决的是同一类问题（进程间通信和系统编排），并提供与 ROS 2 互通的桥接，常被拿来和 ROS 2 做延迟对比。","example":"用一个 YAML 文件声明「相机节点 → VLA 推理节点 → 机械臂控制节点」三段数据流，dora 负责启动各节点并在它们之间传图像和动作。","related":["ROS 2","中间件","零拷贝","iceoryx","发布/订阅","Zenoh"]},{"id":"aimrt","category":"software","sec":3,"tier":3,"sources":[{"title":"AimRT/AimRT (GitHub)","url":"https://github.com/AimRT/AimRT"}],"as_of":"2024","related_ids":["robot-operating-system-2","middleware","dataflow-oriented-robotic-architecture","agibot","grpc-remote-procedure-calls","data-distribution-service"],"name":"AimRT（智元机器人运行时框架）","alt":"AimRT (AgiBot robot runtime framework)","abbr":"","aliases":["智元 AimRT"],"one_liner":"智元开源的现代 C++ 机器人运行时框架，可与 ROS 2 等通信后端互通","explanation":"AimRT 是智元机器人于 2024 年开源的机器人运行时框架，用现代 C++ 编写，定位和 ROS 2 类似：把机器人软件拆成多个模块，负责模块的加载、调度、相互通信和日志配置。它的特点是核心轻量，通信后端和功能以插件形式接入，可以用 ROS 2、HTTP、gRPC 等作为传输方式，因此既能单独使用，也能和现有 ROS 2 节点互通，并支持从端侧到云端的部署。它想解决的是 ROS 2 在性能、资源占用和工程化部署上的一些痛点。对使用智元本体或想看国产机器人中间件的开发者有参考价值。","example":"","related":["ROS 2","中间件","dora-rs","智元机器人","gRPC","数据分发服务"]},{"id":"software-development-kit","category":"software","sec":4,"tier":1,"sources":[{"title":"unitree_sdk2 (GitHub)","url":"https://github.com/unitreerobotics/unitree_sdk2"},{"title":"Franka Robotics 文档：libfranka client library","url":"https://frankarobotics.github.io/docs/doc/libfranka/docs/index.html"}],"as_of":"","related_ids":["secondary-development","unitree-sdk2","libfranka-franka-control-interface","driver","robot-operating-system-2"],"name":"软件开发工具包","alt":"Software Development Kit","abbr":"SDK","aliases":["开发包"],"one_liner":"厂商提供的库、接口和示例，让开发者能用代码控制设备","explanation":"SDK 是软件或硬件厂商给开发者的一整套开发材料，通常包括程序库、接口（API）说明、示例代码、驱动和调试工具。在机器人领域，买来一台机械臂、四足或人形机器人后，要读取关节状态、下发位置或力矩指令、获取相机图像，一般都通过厂商 SDK 完成，也就是常说的「二次开发」。SDK 多提供 C++ 和 Python 接口，很多还带 ROS / ROS 2 封装。SDK 的开放程度直接决定了能否在这台机器人上跑自己的算法，比如是否开放底层关节力矩控制，还是只能调用高层的行走、动作指令。","example":"宇树 G1 通过 unitree_sdk2 读取各关节角度并下发电机指令，研究者据此部署自己训练的运动控制策略。","related":["二次开发","宇树 SDK","libfranka","驱动","ROS 2"]},{"id":"secondary-development","category":"software","sec":4,"tier":2,"sources":[{"title":"Software development kit - Wikipedia","url":"https://en.wikipedia.org/wiki/Software_development_kit"},{"title":"Unitree 开发者文档","url":"https://support.unitree.com/home/zh/developer"}],"as_of":"","related_ids":["software-development-kit","unitree-sdk2","edu-edition","driver","robot-operating-system-2","hardware-abstraction-layer"],"name":"二次开发","alt":"Secondary Development (custom development on SDK)","abbr":"","aliases":["开放接口","SDK 开发"],"one_liner":"在厂商开放的 SDK 或接口上，自己写程序定制机器人功能","explanation":"二次开发是国内工程圈的常用说法，指不改厂商的底层固件，而是调用厂商开放的 SDK、API 或 ROS 接口，自己编写上层程序来实现新功能。对具身智能研究来说，买来的机器人能不能二次开发很关键：只有能读到关节状态、相机数据，并能下发关节或速度指令，才能部署自己训练的策略。很多厂商因此区分普通版和开放底层接口的 EDU 版（科研教育版），开放程度和价格都不同。","example":"买宇树 G1 的 EDU 版本，用宇树 SDK 读取关节角并下发力矩指令，把自己在仿真里训练的强化学习行走策略部署到真机上。","related":["软件开发工具包","宇树 SDK","EDU 版（科研教育版）","驱动","ROS 2","硬件抽象层"]},{"id":"unitree-sdk2","category":"software","sec":4,"tier":2,"sources":[{"title":"unitreerobotics/unitree_sdk2 (GitHub)","url":"https://github.com/unitreerobotics/unitree_sdk2"},{"title":"unitreerobotics/unitree_ros2 (GitHub)","url":"https://github.com/unitreerobotics/unitree_ros2"}],"as_of":"","related_ids":["unitree-robotics","software-development-kit","secondary-development","eclipse-cyclone-dds","robot-operating-system-2","unitree-g1"],"name":"宇树 SDK","alt":"Unitree SDK2","abbr":"","aliases":["unitree_sdk2","unitree_sdk2_python","unitree_ros2"],"one_liner":"宇树官方开源的机器人开发包，用来读传感器、控制关节和运动","explanation":"宇树 SDK 指宇树科技在 GitHub 开源的 unitree_sdk2（C++）及其 Python 版 unitree_sdk2_python，适用于 Go2、B2、H1、G1 等机型。它基于 DDS 通信，提供两层接口：高层运动接口，直接发速度、姿态等指令让机器人走；底层接口，逐个关节下发目标位置、速度、刚度、阻尼和前馈力矩，并读取 IMU、关节状态，部署强化学习策略时用的就是这一层。因为 ROS 2 同样基于 DDS，配套的 unitree_ros2 能让 ROS 2 程序直接和机器人通信。","example":"用 unitree_sdk2_python 以 500 Hz 左右循环读取 G1 的关节状态，把策略网络输出的目标关节角配上 kp、kd 下发，就完成了一次 sim-to-real 部署。","related":["宇树科技","软件开发工具包","二次开发","Cyclone DDS","ROS 2","宇树 G1"]},{"id":"libfranka-franka-control-interface","category":"software","sec":4,"tier":3,"sources":[{"title":"Franka Control Interface 文档","url":"https://frankaemika.github.io/docs/"},{"title":"frankaemika/libfranka (GitHub)","url":"https://github.com/frankaemika/libfranka"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"libfranka","alt":"libfranka / Franka Control Interface","abbr":"FCI","aliases":["franka_ros","franka_ros2","Franka Control Interface"],"one_liner":"Franka 机械臂的官方 C++ 底层控制库，经 FCI 以 1 kHz 实时收发指令。","explanation":"libfranka 是 Franka 机械臂（Panda / FR3）官方开源的 C++ 控制库，通过以太网连接机器人的 Franka Control Interface（FCI）。用户在回调函数里每 1 毫秒读一次机器人状态（关节角、速度、外力估计等）并返回一次指令，可选关节力矩、关节位置/速度、笛卡尔位姿/速度等控制模式；因此运行的电脑需要实时内核（如 PREEMPT_RT）保证不丢周期。franka_ros、franka_ros2 是其 ROS 封装。很多机器人学习框架（如 Polymetis、Deoxys）底层都调用它来实现阻抗控制和策略执行。","example":"在装了 PREEMPT_RT 内核的主机上用 libfranka 写一个 1 kHz 力矩回调，实现笛卡尔阻抗控制，让 VLA 策略输出的末端目标位姿被柔顺地跟踪。","related":["Franka 机械臂（Panda / FR3）(Franka Emika Panda / Franka Research 3)","力矩控制(Torque Control)","笛卡尔阻抗控制(Cartesian Impedance Control)","实时内核补丁(PREEMPT_RT Real-Time Linux Patch)","RTDE(Real-Time Data Exchange (Universal Robots))","软件开发工具包(Software Development Kit)"]},{"id":"rtde","category":"software","sec":4,"tier":3,"sources":[{"title":"Universal Robots: Real-Time Data Exchange (RTDE) Guide","url":"https://www.universal-robots.com/articles/ur/interface-communication/real-time-data-exchange-rtde-guide/"},{"title":"ur_rtde documentation (SDU Robotics)","url":"https://sdurobotics.gitlab.io/ur_rtde/"}],"as_of":"","related_ids":["universal-robots-ur5e","universal-robots","streaming-servo-control","software-development-kit","libfranka-franka-control-interface","host-computer"],"name":"RTDE","alt":"Real-Time Data Exchange (Universal Robots)","abbr":"RTDE","aliases":["ur_rtde","UR RTDE 接口"],"one_liner":"优傲 UR 机械臂的实时数据交换接口，外部程序靠它读状态、发指令","explanation":"RTDE 是优傲机器人（Universal Robots）在控制器里提供的一种通信接口，外部电脑通过 TCP/IP 连上控制器，就能按固定频率同步读取关节角、末端位姿、力矩等状态，也能写入输入寄存器。e-Series 控制器最高支持 500 Hz。它解决的是「上位机要和机械臂高频、稳定地交换数据」的问题，比早期的 30001–30003 端口更规整。社区里最常用的是南丹麦大学开源的 ur_rtde 库（C++/Python），可以直接调用 moveL、servoJ 等指令，很多 VLA 真机部署都靠它控制 UR 机械臂。","example":"用 ur_rtde 的 RTDEReceiveInterface 以 500 Hz 读取 UR5e 当前关节角，再用 RTDEControlInterface 的 servoJ 把策略输出的目标关节角流式发给机械臂。","related":["UR5e 协作机械臂","优傲机器人","透传控制","软件开发工具包","libfranka","上位机"]},{"id":"intel-realsense-sdk-2-0","category":"software","sec":4,"tier":3,"sources":[{"title":"IntelRealSense/librealsense (GitHub)","url":"https://github.com/IntelRealSense/librealsense"},{"title":"IntelRealSense/realsense-ros (GitHub)","url":"https://github.com/IntelRealSense/realsense-ros"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"RealSense SDK","alt":"Intel RealSense SDK 2.0 (librealsense)","abbr":"","aliases":["librealsense","realsense-ros","pyrealsense2"],"one_liner":"RealSense 深度相机的官方开源驱动与开发库，负责取图、对齐和生成点云。","explanation":"RealSense SDK 2.0 即开源库 librealsense，是 RealSense 深度相机（如 D435i、D405）的官方软件开发包，最初由英特尔发布，支持 Linux、Windows、macOS。它负责连接相机并读取彩色、深度、红外和 IMU（惯性测量单元）数据流，提供深度与彩色对齐、点云生成、空洞填充等后处理滤波，附带可视化调试工具 realsense-viewer。C++ 为主，另有 Python 接口 pyrealsense2 和 ROS 封装 realsense-ros。具身智能实验室大量使用 RealSense 做腕部相机和第三视角相机，采数据和部署策略时几乎都会经过这个库。","example":"用 pyrealsense2 打开 D435i，把深度图对齐到彩色图后反投影成点云，送给 3D 扩散策略做输入。","related":["RealSense 深度相机（D435i / D405）(RealSense Depth Camera (D435i / D405))","深度相机(Depth Camera (RGB-D Camera))","深度与彩色对齐(Depth-to-Color Alignment (Depth Registration))","点云(Point Cloud)","相机内参(Camera Intrinsics)","驱动(Driver (device driver))"]},{"id":"driver","category":"software","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Device driver","url":"https://en.wikipedia.org/wiki/Device_driver"},{"title":"IntelRealSense/realsense-ros (GitHub)","url":"https://github.com/IntelRealSense/realsense-ros"}],"as_of":"","related_ids":["firmware","software-development-kit","hardware-abstraction-layer","ros2-control","intel-realsense-sdk-2-0","node"],"name":"驱动","alt":"Driver (device driver)","abbr":"","aliases":["驱动程序","ROS 驱动","设备驱动"],"one_liner":"让操作系统或上层程序能读写某个硬件的那层软件","explanation":"驱动是位于硬件和上层软件之间的程序，负责把「读一帧图像」「让电机转到某个角度」这类请求翻译成硬件能懂的底层指令，再把硬件返回的数据整理成程序能用的格式。它有两层含义：一是操作系统层面的设备驱动，如显卡驱动、USB 串口驱动；二是机器人软件里的「ROS 驱动」，即厂商或社区写的一个 ROS 节点，把相机、激光雷达、电机的数据发布成标准话题。新硬件接进系统时，先确认有没有可用的驱动，往往是第一步。","example":"安装 realsense-ros 驱动包后，启动它就能在 /camera/color/image_raw 等话题上收到 RealSense 相机的彩色图和深度图。","related":["固件","软件开发工具包","硬件抽象层","ros2_control","RealSense SDK","节点"]},{"id":"hardware-abstraction-layer","category":"software","sec":4,"tier":3,"sources":[{"title":"Hardware abstraction - Wikipedia","url":"https://en.wikipedia.org/wiki/Hardware_abstraction"},{"title":"ros2_control 官方文档","url":"https://control.ros.org/"}],"as_of":"","related_ids":["ros2-control","driver","software-development-kit","secondary-development","one-brain-multiple-robots"],"name":"硬件抽象层","alt":"Hardware Abstraction Layer","abbr":"HAL","aliases":[],"one_liner":"把具体硬件差异封装起来，给上层软件提供统一接口的一层代码","explanation":"硬件抽象层是操作系统和软件工程里的常见设计：在具体硬件（电机驱动器、相机、传感器）和上层程序之间加一层统一接口，上层只调「读关节角」「发力矩指令」这类标准函数，不关心底下是 CAN 还是 EtherCAT、是哪家的电机。这样换硬件时只需改或新增这一层驱动，控制算法和策略代码不用动。在机器人里，ROS 2 的 ros2_control 用「硬件接口」插件实现这件事；具身模型想做到「一脑多机」、同一套策略跑在不同本体上，也离不开清晰的 HAL。","example":"ros2_control 中给某款机械臂写一个 hardware interface 插件，上层 MoveIt 和控制器就能直接驱动它。","related":["ros2_control","驱动","软件开发工具包","二次开发","一脑多机"]},{"id":"ros2-control","category":"software","sec":4,"tier":2,"sources":[{"title":"ros2_control 官方文档","url":"https://control.ros.org/"},{"title":"ros-controls/ros2_control (GitHub)","url":"https://github.com/ros-controls/ros2_control"}],"as_of":"","related_ids":["robot-operating-system-2","hardware-abstraction-layer","moveit-motion-planning-framework","unified-robot-description-format","real-time-control","proportional-derivative-control"],"name":"ros2_control","alt":"ros2_control","abbr":"","aliases":["ros_control"],"one_liner":"ROS 2 里连接控制算法和真实电机硬件的标准控制框架","explanation":"ros2_control 是 ROS 2 官方生态里的机器人控制框架，由 ros-controls 社区维护，前身是 ROS 1 的 ros_control。它把系统拆成三层：硬件接口（写一次驱动，把电机的位置、速度、力矩读写统一成标准接口）、控制器管理器（按固定频率循环调度）、控制器（如关节轨迹控制器、差速底盘控制器）。好处是控制算法和具体硬件解耦，换一台机器人只需重写硬件接口，控制器可以直接复用。MoveIt 规划出的轨迹通常就是交给它来执行，仿真器 Gazebo 也有对应插件。","example":"给自制机械臂写一个 hardware_interface 插件，在 URDF 里声明关节接口，再加载 joint_trajectory_controller，就能让 MoveIt 规划的轨迹驱动真实电机。","related":["ROS 2","硬件抽象层","MoveIt","统一机器人描述格式","实时控制","PD 控制"]},{"id":"embedded-software-development","category":"software","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Embedded software","url":"https://en.wikipedia.org/wiki/Embedded_software"}],"as_of":"","related_ids":["microcontroller-unit","real-time-operating-system","firmware","cross-compilation","stmicroelectronics-stm32-mcu-family","controller-area-network"],"name":"嵌入式软件开发","alt":"Embedded Software Development","abbr":"","aliases":["嵌入式开发","单片机开发"],"one_liner":"给电机驱动板、传感器等设备里的芯片写程序","explanation":"嵌入式软件指运行在设备内部芯片上的程序，这类芯片通常是微控制器（MCU，如 STM32）或片上系统（SoC），资源有限，程序要长期稳定运行。开发一般用 C/C++，要么直接操作硬件寄存器（裸机），要么跑在 FreeRTOS 这类实时操作系统上；代码在电脑上交叉编译，再烧录进芯片，用 JTAG/SWD 调试器单步调试。机器人里的关节电机控制、传感器采集、电池管理、底层总线通信（CAN、EtherCAT）都属于这一层，它决定了控制是否实时可靠，也是具身公司里算法之外的重要岗位。","example":"在 STM32 上写一个电流环程序，以 20 kHz 频率读取编码器、计算 PWM 占空比，并通过 CAN 总线把关节角度回传给上位机。","related":["微控制器","实时操作系统","固件","交叉编译","STM32","CAN 总线"]},{"id":"cross-compilation","category":"software","sec":4,"tier":3,"sources":[{"title":"Cross compiler - Wikipedia","url":"https://en.wikipedia.org/wiki/Cross_compiler"},{"title":"cmake-toolchains(7) - CMake Documentation","url":"https://cmake.org/cmake/help/latest/manual/cmake-toolchains.7.html"}],"as_of":"","related_ids":["embedded-software-development","cmake","nvidia-jetson","docker","on-device-edge-deployment","firmware"],"name":"交叉编译","alt":"Cross-compilation","abbr":"","aliases":["交叉构建"],"one_liner":"在 x86 电脑上编出能在机器人 ARM 主控上跑的程序。","explanation":"指在一台机器（宿主机）上编译出另一种 CPU 架构或操作系统上运行的可执行文件。机器人上需要它的原因很实际：主控常是 Jetson、树莓派、瑞芯微这类 ARM 板子，算力内存都有限，直接在上面编译大工程（ROS 2 工作空间、OpenCV、推理引擎）要等很久甚至编不过，而开发机是 x86 的。做法是装目标架构的工具链（如 aarch64-linux-gnu-gcc）和目标系统的头文件与库，再配好 CMake 的 toolchain 文件；也常用 Docker 加 QEMU 模拟目标架构，绕开环境不一致。","example":"在 x86 工作站上用 aarch64 工具链编好 ROS 2 节点和推理程序，拷到 Jetson Orin 上直接运行。","related":["嵌入式软件开发","CMake","英伟达 Jetson","Docker","端侧部署","固件"]},{"id":"firmware","category":"software","sec":4,"tier":3,"sources":[{"title":"Firmware - Wikipedia","url":"https://en.wikipedia.org/wiki/Firmware"}],"as_of":"","related_ids":["driver","over-the-air-update","microcontroller-unit","embedded-system","servo-drive","embedded-software-development"],"name":"固件","alt":"Firmware","abbr":"","aliases":[],"one_liner":"烧写在硬件芯片里、直接控制设备底层行为的程序","explanation":"固件是存放在设备非易失存储（如 Flash）里的程序，通常跑在微控制器（MCU）上，负责最贴近硬件的工作。机器人里电机驱动器、灵巧手、IMU、相机、电池管理系统都有各自的固件：比如驱动器固件实现电流环、速度环控制和过流过温保护，相机固件负责曝光和深度计算。上层的 ROS 节点或 SDK 只是通过总线跟这些固件对话。固件版本不匹配常导致通信异常或功能缺失，所以拿到新设备或排查问题时，第一步往往是核对并升级固件，整机也可通过 OTA 远程更新。","example":"RealSense 相机深度图异常时，先用官方工具查看固件版本，升级到 SDK 推荐的版本后再测试。","related":["驱动","OTA 升级","微控制器","嵌入式系统","电机驱动器","嵌入式软件开发"]},{"id":"over-the-air-update","category":"software","sec":4,"tier":2,"sources":[{"title":"Over-the-air update - Wikipedia","url":"https://en.wikipedia.org/wiki/Over-the-air_update"}],"as_of":"","related_ids":["firmware","driver","mass-production","scaled-deployment","on-device-edge-deployment"],"name":"OTA 升级","alt":"Over-the-Air Update","abbr":"OTA","aliases":["OTA","空中升级","远程升级"],"one_liner":"通过网络远程给设备更新固件、系统或模型，不用拆机插线。","explanation":"OTA 升级指设备通过 Wi-Fi、蜂窝网络等无线方式下载并安装新版软件，最早常见于手机和汽车。对机器人来说，更新对象可以是底层固件（驱动板、关节电机里的程序）、上层操作系统，也可以是运动控制策略或大模型权重。它解决的是「机器已经卖出去、散落在各地，怎么持续修 bug、加功能」的问题：不用返厂，也不用工程师上门。做好 OTA 要考虑断电回滚、版本校验和分批推送，否则升级失败可能让机器人无法开机。量产和规模化部署阶段，OTA 能力往往被当作产品是否成熟的标志之一。","example":"人形机器人厂商给已交付的机器推送新版运控策略，用户在 App 里点升级，机器下载后重启即可获得新动作。","related":["固件","驱动","量产","规模化部署","端侧部署"]},{"id":"real-time-operating-system","category":"software","sec":4,"tier":2,"sources":[{"title":"Real-time operating system - Wikipedia","url":"https://en.wikipedia.org/wiki/Real-time_operating_system"},{"title":"FreeRTOS","url":"https://www.freertos.org/"}],"as_of":"","related_ids":["freertos","rt-thread","preempt-rt","xenomai","hard-real-time","jitter"],"name":"实时操作系统","alt":"Real-Time Operating System","abbr":"RTOS","aliases":["RTOS","实时系统"],"one_liner":"保证任务在规定时间内完成的操作系统，用于对时序敏感的控制。","explanation":"实时操作系统的核心不是「快」，而是「准时」：它通过优先级抢占调度等机制，保证关键任务在确定的截止时间内被执行，时间抖动小且可预测。普通桌面 Linux 为吞吐量优化，偶尔延迟几毫秒无所谓，但机器人关节电流环、力控环要求固定周期（如 1 kHz 甚至更高）稳定运行，错过周期可能导致抖动或失稳。常见方案有两类：微控制器上跑 FreeRTOS、RT-Thread、Zephyr 等轻量 RTOS；主控上用打了 PREEMPT_RT 补丁的 Linux 或 Xenomai 获得实时性。上层 AI 策略一般跑在非实时系统，底层控制放在实时系统，两者通过总线或共享内存交互。","example":"关节驱动板上的 MCU 跑 FreeRTOS，以固定周期执行电流环；主控用 PREEMPT_RT Linux 跑 1 kHz 的 EtherCAT 主站。","related":["FreeRTOS","RT-Thread","实时内核补丁","Xenomai","硬实时","时间抖动"]},{"id":"hard-real-time","category":"software","sec":4,"tier":3,"sources":[{"title":"Real-time computing - Wikipedia","url":"https://en.wikipedia.org/wiki/Real-time_computing"}],"as_of":"","related_ids":["real-time-operating-system","preempt-rt","xenomai","ethercat","control-frequency","jitter"],"name":"硬实时","alt":"Hard Real-Time","abbr":"","aliases":[],"one_liner":"每次都必须在截止时间前完成，错过一次就算系统失效","explanation":"硬实时是实时计算里最严格的一级：任务必须每次都在规定时限内完成，超时一次就视为错误，可能导致事故。与之相对的软实时允许偶尔超时，只是性能下降（比如视频偶尔掉帧）。机器人底层的电机电流环、关节力矩控制、总线通信通常要求硬实时，周期常在 1 kHz 甚至更高，因为算晚了一个周期电机就可能抖动或失控。实现硬实时一般要靠实时操作系统（RTOS）、打了 PREEMPT_RT 实时补丁的 Linux 或 Xenomai，再加上 EtherCAT 这类确定性总线；而大模型推理不满足硬实时，所以通常放在上层，底层留给实时控制器。","example":"人形机器人关节驱动器以 1 kHz 执行力矩环，每 1 毫秒必须按时算完并下发，不能靠普通 Python 进程来跑。","related":["实时操作系统","实时内核补丁","Xenomai","EtherCAT 总线","控制频率","时间抖动"]},{"id":"freertos","category":"software","sec":4,"tier":3,"sources":[{"title":"FreeRTOS 官网","url":"https://www.freertos.org/"},{"title":"FreeRTOS/FreeRTOS-Kernel (GitHub)","url":"https://github.com/FreeRTOS/FreeRTOS-Kernel"}],"as_of":"","related_ids":["real-time-operating-system","microcontroller-unit","stmicroelectronics-stm32-mcu-family","micro-ros","embedded-system","rt-thread"],"name":"FreeRTOS","alt":"FreeRTOS","abbr":"","aliases":[],"one_liner":"跑在单片机上的小型开源实时操作系统内核","explanation":"FreeRTOS 是 Richard Barry 在 2003 年前后发布的开源实时操作系统（RTOS，保证任务在规定时间内响应的操作系统）内核，2017 年起由亚马逊云（AWS）接管维护，采用 MIT 许可证。它非常小，能跑在只有几十 KB 内存的微控制器上，提供任务调度、队列、信号量、定时器等基本功能，让开发者把电机控制、传感器读取、通信等拆成多个按优先级运行的任务。机器人里的电机驱动板、IMU 板、灵巧手控制板等下位机常用它；乐鑫 ESP32 的官方开发框架也基于 FreeRTOS，micro-ROS 同样支持它。","example":"在 STM32 关节驱动板上用 FreeRTOS 建三个任务：1 kHz 电流环、CAN 通信收指令、低优先级温度监测。","related":["实时操作系统","微控制器","STM32","micro-ROS","嵌入式系统","RT-Thread"]},{"id":"rt-thread","category":"software","sec":4,"tier":3,"sources":[{"title":"RT-Thread 官网","url":"https://www.rt-thread.org/"},{"title":"RT-Thread/rt-thread (GitHub)","url":"https://github.com/RT-Thread/rt-thread"}],"as_of":"","related_ids":["real-time-operating-system","freertos","microcontroller-unit","stmicroelectronics-stm32-mcu-family","embedded-system","lower-level-controller"],"name":"RT-Thread","alt":"RT-Thread","abbr":"","aliases":["RT-Thread Nano","RT-Thread Smart"],"one_liner":"国内团队开发的开源嵌入式实时操作系统","explanation":"RT-Thread 是由上海睿赛德电子科技主导开发维护的开源嵌入式实时操作系统（RTOS，保证任务在规定时间内得到响应的系统），项目始于 2006 年，目前采用 Apache 2.0 许可。它有带驱动框架、文件系统、网络协议栈和软件包生态的标准版，面向资源极少单片机的 Nano 版，以及面向带内存管理单元处理器的 Smart 版，支持 ARM Cortex-M、RISC-V 等架构。在机器人里常跑在关节驱动板、传感器板、底盘控制器这类单片机上，负责电机控制和总线通信等硬实时任务，与跑 Linux 和 ROS 的上位机配合，定位和 FreeRTOS 相近。","example":"用 STM32 做轮式底盘控制板，在 RT-Thread 上开线程跑 1 kHz 的电机控制和 CAN 通信，再通过串口把里程计发给跑 ROS 2 的上位机。","related":["实时操作系统","FreeRTOS","微控制器","STM32","嵌入式系统","下位机"]},{"id":"micro-ros","category":"software","sec":4,"tier":3,"sources":[{"title":"micro-ROS 官网","url":"https://micro.ros.org/"}],"as_of":"","related_ids":[null,null,"freertos",null,null],"name":"micro-ROS","alt":"micro-ROS","abbr":"","aliases":[],"one_liner":"把 ROS 2 搬到单片机上运行的框架。","explanation":"micro-ROS 是让微控制器（单片机，内存只有几十到几百 KB）也能加入 ROS 2 系统的开源框架，起源于欧盟资助的项目，由 eProsima、Bosch 等参与开发，现由 ROS 官方工作组维护。单片机跑不动完整的 DDS 通信中间件，micro-ROS 改用轻量的 Micro XRCE-DDS，在 FreeRTOS、Zephyr 等实时操作系统上运行，再通过串口或 UDP 连到上位机上的 Agent，由 Agent 转发成标准 ROS 2 话题。这样电机驱动板、传感器板就能直接发布和订阅话题，省去自己写串口协议。","example":"在 ESP32 上跑 micro-ROS，把 IMU 数据发布成 ROS 2 话题，电脑上的节点直接订阅。","related":["ROS 2(Robot Operating System 2)","微控制器(Microcontroller Unit)","FreeRTOS","数据分发服务(Data Distribution Service)","下位机(Lower-level Controller (Slave Computer))"]},{"id":"preempt-rt","category":"software","sec":4,"tier":3,"sources":[{"title":"Real-Time Linux (Linux Foundation Wiki)","url":"https://wiki.linuxfoundation.org/realtime/start"}],"as_of":"2024-11","related_ids":["real-time-operating-system","hard-real-time","real-time-control","jitter","ethercat-master","xenomai"],"name":"实时内核补丁","alt":"PREEMPT_RT Real-Time Linux Patch","abbr":"PREEMPT_RT","aliases":["PREEMPT_RT 实时内核","RT-Linux","实时 Linux","RT 补丁"],"one_liner":"让 Linux 内核几乎处处可抢占、降低最坏延迟的实时化改造","explanation":"PREEMPT_RT 是 Linux 社区长期维护的实时化补丁集，把内核里大部分不可打断的代码改成可抢占，中断改为线程处理，自旋锁换成可睡眠的互斥锁，从而把高优先级任务的最坏响应延迟压到几十微秒量级。它于 2024 年并入主线内核（6.12 版），此前需要自己打补丁编译。机器人控制要求每个周期按时发指令，普通内核偶尔几毫秒的卡顿就可能让电机抖动或触发保护，所以 ros2_control、EtherCAT 主站、Franka 的 libfranka 等通常要求或推荐实时内核。","example":"用 libfranka 以 1 kHz 控制 Franka 机械臂前，先在 Ubuntu 上装 PREEMPT_RT 内核，否则容易出现通信超时报错。","related":["实时操作系统","硬实时","实时控制","时间抖动","EtherCAT 主站","Xenomai"]},{"id":"xenomai","category":"software","sec":4,"tier":3,"sources":[{"title":"Xenomai 官网","url":"https://xenomai.org/"},{"title":"Xenomai - Wikipedia","url":"https://en.wikipedia.org/wiki/Xenomai"}],"as_of":"","related_ids":["real-time-operating-system","preempt-rt","hard-real-time","ethercat-master","jitter","real-time-control"],"name":"Xenomai","alt":"Xenomai","abbr":"","aliases":[],"one_liner":"给 Linux 加上硬实时能力的开源框架，常用于机器人底层控制","explanation":"Xenomai 是一个开源的 Linux 实时扩展框架，最早由 Philippe Gerum 发起。它的经典做法是「双内核」：在普通 Linux 旁边挂一个实时内核（Cobalt），实时任务由它优先调度，Linux 只在空闲时运行，从而把控制循环的时间抖动（每次执行时刻的偏差）压到微秒级。机器人关节控制常要求 1 kHz 甚至更高、不能迟到的循环，普通 Linux 做不到稳定保证，所以 Xenomai 常和 EtherCAT 主站一起用在工控机上。另一条常见路线是给 Linux 打 PREEMPT_RT 补丁，配置更简单，但极限延迟通常不如双内核方案。","example":"工控机上用 Xenomai 跑 IgH EtherCAT 主站，以 1 kHz 周期给机械臂各关节驱动器下发位置指令。","related":["实时操作系统","实时内核补丁","硬实时","EtherCAT 主站","时间抖动","实时控制"]},{"id":"ethercat-master","category":"software","sec":4,"tier":3,"sources":[{"title":"SOEM GitHub","url":"https://github.com/OpenEtherCATsociety/SOEM"},{"title":"IgH EtherCAT Master（EtherLab）","url":"https://gitlab.com/etherlab.org/ethercat"}],"as_of":"","related_ids":["ethercat","preempt-rt","cyclic-synchronous-position-velocity-torque-modes","servo-drive","hard-real-time","canopen-cia-402-drive-profile"],"name":"EtherCAT 主站","alt":"EtherCAT Master (SOEM / IgH)","abbr":"","aliases":["SOEM","IgH EtherCAT Master"],"one_liner":"在 EtherCAT 总线上负责下发指令、收集数据的一端，通常跑在主控电脑上","explanation":"EtherCAT 是一种基于以太网的实时工业总线，网络里有一个主站和若干从站：从站是关节驱动器、传感器等设备，主站负责按固定周期发出数据帧、依次读写每个从站的数据。商业主站有倍福 TwinCAT 等，开源方案最常见的是两个：SOEM（Simple Open EtherCAT Master），一个用户态 C 库，容易上手；IgH EtherCAT Master（EtherLab 项目），以 Linux 内核模块形式运行，实时性更好。人形和足式机器人常在装有 PREEMPT_RT 实时补丁的 Linux 上跑 IgH 或 SOEM，以 1 kHz 左右的频率给各关节下发指令。","example":"在主控机上用 SOEM 扫描总线上的 12 个关节驱动器，把它们切到 CSP 模式，每 1 ms 下发一次目标位置并读回编码器值。","related":["EtherCAT 总线","实时内核补丁","周期同步位置 / 速度 / 力矩模式（CSP / CSV / CST）","电机驱动器","硬实时","CANopen / CiA 402 驱动协议"]},{"id":"socketcan","category":"software","sec":4,"tier":3,"sources":[{"title":"SocketCAN - Controller Area Network (Linux kernel docs)","url":"https://docs.kernel.org/networking/can.html"}],"as_of":"","related_ids":["controller-area-network","canopen-cia-402-drive-profile","servo-drive","host-computer","ubuntu-linux"],"name":"SocketCAN","alt":"SocketCAN (Linux CAN interface)","abbr":"","aliases":["can-utils"],"one_liner":"Linux 内核自带的 CAN 总线驱动，把 CAN 口当网卡用","explanation":"SocketCAN 是 Linux 内核里的 CAN 总线驱动和协议栈，最初由大众汽车研究部门贡献。它把 CAN 接口抽象成和网卡一样的网络接口（如 can0），程序用普通的 socket 接口就能收发 CAN 帧，不必依赖各家 USB-CAN 适配器的私有驱动。机器人上很多关节电机、夹爪、机械臂通过 CAN 总线（一种抗干扰强的串行总线）通信，上位机插一个 USB-CAN 设备，用 ip 命令设好波特率启用，再用 can-utils 里的 candump、cansend 调试，是搭桌面机械臂和电机驱动时的常见步骤。","example":"执行 ip link set can0 up type can bitrate 1000000 启用接口，再用 candump can0 查看电机回传的反馈帧。","related":["CAN 总线","CANopen / CiA 402 驱动协议","电机驱动器","上位机","Ubuntu"]},{"id":"precision-time-protocol","category":"software","sec":4,"tier":3,"sources":[{"title":"Precision Time Protocol (Wikipedia)","url":"https://en.wikipedia.org/wiki/Precision_Time_Protocol"},{"title":"The Linux PTP Project","url":"https://linuxptp.sourceforge.net/"}],"as_of":"","related_ids":["multi-sensor-time-synchronization-timestamp-alignment","multi-sensor-fusion","lidar","ethercat","preempt-rt"],"name":"精确时间协议","alt":"Precision Time Protocol","abbr":"PTP","aliases":["IEEE 1588","gPTP"],"one_liner":"通过以太网让多台设备时钟对齐到亚微秒级的同步协议","explanation":"精确时间协议（PTP）由 IEEE 1588 标准定义，用来在局域网内同步各设备的时钟。网络里选出一台主时钟，其他设备通过互发带时间戳的报文测出链路延迟和时钟偏差并自行校正；网卡支持硬件时间戳时，精度可达亚微秒级，远高于常见的 NTP。gPTP 是 IEEE 802.1AS 定义的精简版，多用于车载和时间敏感网络。机器人上相机、激光雷达、IMU 和主控各有各的时钟，不同步会让多传感器融合和数据采集错位，所以常用 PTP 统一时间基准；Linux 下常用 linuxptp（ptp4l、phc2sys）实现。","example":"数据采集平台上，主控作为 PTP 主时钟，激光雷达和工业相机作为从时钟，保证每帧点云和图像的时间戳可直接对齐。","related":["多传感器时间同步（时间戳对齐）","多传感器融合","激光雷达","EtherCAT 总线","实时内核补丁"]},{"id":"matlab-simulink","category":"software","sec":5,"tier":2,"sources":[{"title":"MATLAB 产品页","url":"https://www.mathworks.com/products/matlab.html"},{"title":"Simulink 产品页","url":"https://www.mathworks.com/products/simulink.html"}],"as_of":"","related_ids":["proportional-integral-derivative-control","field-oriented-control","system-identification","embedded-software-development","model-predictive-control","python-and-c-plus-plus"],"name":"MATLAB / Simulink","alt":"MATLAB / Simulink","abbr":"","aliases":["MATLAB","Simulink"],"one_liner":"MathWorks 的商业数值计算与图形化建模仿真软件，控制领域常用。","explanation":"MATLAB 是 MathWorks 公司的商业软件，既是编程语言也是计算环境，擅长矩阵运算、信号处理和画图；Simulink 是它配套的图形化工具，用拖方框、连线的方式搭建动态系统模型并仿真，还能把模型自动生成嵌入式 C 代码烧到控制器里。在机器人方向，它主要用于控制算法设计：电机电流环和磁场定向控制建模、PID 调参、系统辨识（从数据反推系统模型）、机械臂运动学计算等，有 Robotics System Toolbox、ROS Toolbox 等工具箱。很多控制和电机类课程、工程团队都用它；做学习型方法的研究者则更多用 Python。","example":"在 Simulink 里搭一个关节电机的电流环 + 速度环 + 位置环串级模型，调好 PID 参数后生成 C 代码下载到驱动板。","related":["PID 控制","磁场定向控制","系统辨识","嵌入式软件开发","模型预测控制","Python 与 C++（具身常用编程语言）"]},{"id":"robotics-toolbox-for-python","category":"software","sec":5,"tier":3,"sources":[{"title":"Robotics Toolbox for Python on GitHub","url":"https://github.com/petercorke/robotics-toolbox-python"}],"as_of":"","related_ids":["forward-kinematics","inverse-kinematics","denavit-hartenberg-parameters","jacobian-matrix","pinocchio","franka-emika-panda-franka-research-3"],"name":"Robotics Toolbox for Python（Peter Corke 机器人工具箱）","alt":"Robotics Toolbox for Python (Peter Corke)","abbr":"","aliases":["roboticstoolbox-python","RTB"],"one_liner":"Peter Corke 维护的 Python 机器人学工具箱，适合学运动学和动力学","explanation":"Robotics Toolbox for Python 是澳大利亚昆士兰科技大学 Peter Corke 教授团队开源的 Python 库，前身是他维护多年的 MATLAB 机器人工具箱，也是教材《Robotics, Vision and Control》的配套代码。它内置 Panda、UR5 等常见机械臂模型，可以用 DH 参数或 URDF 建模，提供正逆运动学、雅可比矩阵、动力学、轨迹生成等函数，并能用自带可视化工具画出机械臂动画。入门时用它把教材公式跑一遍，比自己从零写代码快得多。","example":"用 rtb.models.Panda() 加载 Franka 模型，调用 fkine 算末端位姿，再用 ikine_LM 求目标位姿的逆解。","related":["正运动学","逆运动学","DH参数","雅可比矩阵","Pinocchio","Franka 机械臂（Panda / FR3）"]},{"id":"eigen","category":"software","sec":5,"tier":3,"sources":[{"title":"Eigen 官网","url":"https://eigen.tuxfamily.org/"},{"title":"Eigen GitLab","url":"https://gitlab.com/libeigen/eigen"}],"as_of":"","related_ids":["pinocchio","rotation-matrix","quaternion","jacobian-matrix","python-and-c-plus-plus"],"name":"Eigen","alt":"Eigen (C++ linear algebra library)","abbr":"","aliases":[],"one_liner":"C++ 里最常用的开源线性代数库，矩阵、向量、旋转运算都靠它","explanation":"Eigen 是一个开源的 C++ 模板线性代数库，只有头文件、不用单独编译链接，引入即可使用。它提供矩阵和向量运算、矩阵分解、求解线性方程组，以及四元数、旋转矩阵、仿射变换等几何模块。机器人的 C++ 代码里几乎处处要算坐标变换、雅可比矩阵、动力学方程，Eigen 因此成了事实标准：ROS、Pinocchio、MoveIt、OCS2 等库都依赖它。它相当于 C++ 世界里的 NumPy，但要注意内存对齐和四元数分量顺序等细节，初学者常在这里踩坑。","example":"在控制器里用 Eigen::Quaterniond 表示末端姿态，用 Eigen::MatrixXd 存雅可比矩阵并求伪逆算关节速度。","related":["Pinocchio","旋转矩阵","四元数","雅可比矩阵","Python 与 C++（具身常用编程语言）"]},{"id":"pinocchio","category":"software","sec":5,"tier":2,"sources":[{"title":"stack-of-tasks/pinocchio - GitHub","url":"https://github.com/stack-of-tasks/pinocchio"}],"as_of":"","related_ids":["rigid-body-dynamics","recursive-newton-euler-algorithm","articulated-body-algorithm","crocoddyl","tsid","pink"],"name":"Pinocchio","alt":"Pinocchio","abbr":"","aliases":["pinocchio","pin"],"one_liner":"开源的刚体动力学库，快速算机器人的运动学、动力学及其导数。","explanation":"Pinocchio 是法国 LAAS-CNRS 与 INRIA 团队主导开发的开源 C++ 库，带 Python 接口。它读入 URDF 等机器人模型，高效实现正/逆运动学、雅可比矩阵、递归牛顿-欧拉算法（算逆动力学）、铰接体算法（算正动力学）、质量矩阵等，还能给出这些量对关节状态的解析导数。导数对轨迹优化和模型预测控制很关键，所以 Crocoddyl、TSID、Pink 等控制与规划库都建立在它之上。在人形和四足的全身控制、MPC 研究里它几乎是标配；做学习方法的同学也常用它算正运动学、做逆运动学重定向。","example":"用 Pinocchio 加载 G1 的 URDF，调用 forwardKinematics 得到手腕末端在世界坐标系下的位姿。","related":["刚体动力学","递归牛顿-欧拉算法","铰接体算法","Crocoddyl","TSID","Pink（基于 Pinocchio 的微分逆运动学库）"]},{"id":"rbdl","category":"software","sec":5,"tier":3,"sources":[{"title":"RBDL on GitHub","url":"https://github.com/rbdl/rbdl"}],"as_of":"","related_ids":["rigid-body-dynamics","recursive-newton-euler-algorithm","articulated-body-algorithm","pinocchio","orocos-kdl","unified-robot-description-format"],"name":"RBDL","alt":"Rigid Body Dynamics Library","abbr":"RBDL","aliases":[],"one_liner":"一个开源 C++ 刚体动力学库，高效算机器人的正逆动力学","explanation":"RBDL 是 Martin Felis 在德国海德堡大学期间开发的开源 C++ 库，实现了 Featherstone 教材里的经典刚体动力学算法，包括递归牛顿-欧拉算法（算逆动力学，已知运动求力矩）、铰接体算法（算正动力学，已知力矩求加速度）和复合刚体算法（算质量矩阵）。它还能从 URDF 或 Lua 文件加载模型，并提供 Python 绑定。多关节机器人的动力学方程手推很繁琐，这类库把它变成几行函数调用，常用于腿足机器人控制和运动优化研究。功能定位与 Pinocchio 相近。","example":"给定人形机器人的 URDF 和当前关节角、角速度、目标加速度，调用 RBDL 的 InverseDynamics 就能算出每个关节需要的力矩。","related":["刚体动力学","递归牛顿-欧拉算法","铰接体算法","Pinocchio","KDL","统一机器人描述格式"]},{"id":"orocos-kdl","category":"software","sec":5,"tier":3,"sources":[{"title":"Orocos KDL 官方页面","url":"https://www.orocos.org/kdl.html"},{"title":"orocos/orocos_kinematics_dynamics (GitHub)","url":"https://github.com/orocos/orocos_kinematics_dynamics"}],"as_of":"","related_ids":["forward-kinematics","inverse-kinematics","jacobian-matrix","trac-ik","moveit-motion-planning-framework","robot-state-publisher"],"name":"KDL","alt":"Orocos Kinematics and Dynamics Library","abbr":"KDL","aliases":["Orocos KDL"],"one_liner":"Orocos 项目的 C++ 运动学与动力学库，ROS 里算正逆解的老牌工具","explanation":"KDL 是开源机器人控制软件项目 Orocos 的一部分，最初由比利时鲁汶大学等机构开发，用 C++ 实现，也有 Python 绑定。它把机器人建模成由连杆和关节串起的运动链，提供正运动学、逆运动学、雅可比矩阵和逆动力学等求解器。KDL 在 ROS 生态里用得非常广：kdl_parser 把 URDF 转成 KDL 模型，robot_state_publisher 用它计算各连杆位姿，MoveIt 默认的运动学插件也基于它。它的数值逆解在关节限位附近容易失败，因此常被 TRAC-IK 等替代；新项目也常改用 Pinocchio。","example":"机械臂在 ROS 里发布关节角后，robot_state_publisher 调用 KDL 算出末端和各连杆的位姿，发布到 TF 坐标树。","related":["正运动学","逆运动学","雅可比矩阵","TRAC-IK","MoveIt","robot_state_publisher"]},{"id":"trac-ik","category":"software","sec":5,"tier":3,"sources":[{"title":"TRAC-IK — TRACLabs","url":"https://traclabs.com/projects/trac-ik/"},{"title":"trac_ik — ROS Wiki","url":"https://wiki.ros.org/trac_ik"}],"as_of":"","related_ids":["inverse-kinematics","numerical-inverse-kinematics","orocos-kdl","ikfast","moveit-motion-planning-framework","joint-limits"],"name":"TRAC-IK","alt":"TRAC-IK","abbr":"","aliases":["trac_ik"],"one_liner":"比 KDL 更稳更快的开源通用数值逆运动学求解库。","explanation":"TRAC-IK 是 TRACLabs 的 Patrick Beeson 和 Barrett Ames 在 2015 年 IEEE Humanoids 会议上发布的开源逆运动学库，用于根据末端目标位姿反求关节角。ROS 里常用的 KDL 求解器用牛顿法迭代，遇到关节限位容易卡在局部而失败。TRAC-IK 同时并行跑两种方法：一种是加了随机重启的 KDL 式雅可比迭代，另一种是把 IK 写成非线性优化用 SQP（序列二次规划）求解，谁先算出来就用谁，成功率和速度都明显提高。它提供 C++ 接口和 MoveIt 插件，适用于任意串联机械臂。","example":"在 MoveIt 的 kinematics.yaml 里把求解器从 KDL 换成 trac_ik_kinematics_plugin，七轴机械臂靠近关节限位时的 IK 失败次数减少。","related":["逆运动学","数值逆解","KDL","IKFast","MoveIt","关节限位"]},{"id":"ikfast","category":"software","sec":5,"tier":3,"sources":[{"title":"OpenRAVE ikfast 文档","url":"http://openrave.org/docs/latest_stable/openravepy/ikfast/"},{"title":"MoveIt IKFast Kinematics Solver 教程","url":"https://moveit.picknik.ai/main/doc/examples/ikfast/ikfast_tutorial.html"}],"as_of":"","related_ids":[null,null,null,"trac-ik","moveit-motion-planning-framework",null],"name":"IKFast","alt":"IKFast","abbr":"","aliases":["OpenRAVE IKFast"],"one_liner":"OpenRAVE 里的解析逆解生成器，为具体机械臂自动生成极快的 C++ 逆运动学代码。","explanation":"IKFast 是 Rosen Diankov 在 OpenRAVE 机器人规划框架中开发的逆运动学编译器。逆运动学指已知末端要到的位姿、反求各关节角度。数值方法靠迭代逼近，速度慢、可能不收敛；IKFast 则针对某一台机械臂的运动学结构，用符号推导离线生成一份解析解的 C++ 代码，运行时直接算出全部解，通常只需微秒级。它最适合 6 自由度机械臂；7 自由度的冗余臂需要指定一个「自由关节」离散采样。MoveIt 提供把 IKFast 生成代码封装成运动学插件的流程，常用来替换默认的数值求解器。","example":"为 UR5 机械臂用 IKFast 生成解析逆解并做成 MoveIt 插件，规划时每次求逆解从毫秒级降到微秒级，还能一次拿到全部 8 组解。","related":["逆运动学(Inverse Kinematics)","解析逆解(Analytical Inverse Kinematics)","数值逆解(Numerical Inverse Kinematics)","TRAC-IK","MoveIt","运动学冗余(Kinematic Redundancy)"]},{"id":"pink","category":"software","sec":5,"tier":3,"sources":[{"title":"stephane-caron/pink (GitHub)","url":"https://github.com/stephane-caron/pink"}],"as_of":"","related_ids":["pinocchio","mink","differential-kinematics","inverse-kinematics","quadratic-programming","whole-body-inverse-kinematics"],"name":"Pink（基于 Pinocchio 的微分逆运动学库）","alt":"Pink (Python inverse kinematics based on Pinocchio)","abbr":"","aliases":["pink"],"one_liner":"基于 Pinocchio 的 Python 微分逆运动学库，用任务加权求解关节速度","explanation":"Pink 是 Stéphane Caron 开发的开源 Python 库，底层用 Pinocchio（刚体动力学库）算运动学和雅可比矩阵。它走微分逆运动学路线：把「末端到某位姿」「保持姿态」「关节别超限」等写成带权重的任务和约束，每个控制周期解一个二次规划，得到关节速度，积分后更新关节角。好处是多个目标可以同时兼顾，并能处理冗余自由度和限位。常用于人形或机械臂的遥操作、动作重定向和全身逆运动学；在 MuJoCo 生态里对应的同类库是 mink。","example":"VR 遥操作人形机器人时，用 Pink 同时跟踪左右手腕位姿并约束躯干姿态，实时解出手臂各关节角。","related":["Pinocchio","mink","微分运动学","逆运动学","二次规划","全身逆运动学"]},{"id":"mink","category":"software","sec":5,"tier":3,"sources":[{"title":"mink GitHub","url":"https://github.com/kevinzakka/mink"}],"as_of":"","related_ids":[null,null,null,null,"mujoco-menagerie",null],"name":"mink","alt":"mink (MuJoCo inverse kinematics)","abbr":"","aliases":[],"one_liner":"基于 MuJoCo 的 Python 微分逆运动学库。","explanation":"mink 是 Kevin Zakka 开发的开源 Python 库，用 MuJoCo 的模型做逆运动学（已知末端位置反推关节角）。它采用微分逆运动学：每一步把「末端靠近目标、姿态保持、关节不超限、不碰撞」等要求写成一个二次规划问题，求出关节速度再积分，设计上参考了基于 Pinocchio 的 Pink 库。因为直接读 MJCF 模型，可以配合 MuJoCo Menagerie 里的机器人使用，常用于遥操作重定向、生成演示轨迹和人形全身 IK。","example":"用 mink 给 Menagerie 里的 Franka 模型设一个末端目标位姿，迭代求解出一串关节角。","related":["逆运动学(Inverse Kinematics)","微分运动学(Differential Kinematics)","MuJoCo(MuJoCo (Multi-Joint dynamics with Contact))","Pink（基于 Pinocchio 的微分逆运动学库）(Pink (Python inverse kinematics based on Pinocchio))","MuJoCo Menagerie","二次规划(Quadratic Programming)"]},{"id":"pyroki","category":"software","sec":5,"tier":3,"sources":[{"title":"chungmin99/pyroki (GitHub)","url":"https://github.com/chungmin99/pyroki"},{"title":"PyRoki: A Modular Toolkit for Robot Kinematic Optimization (arXiv)","url":"https://arxiv.org/abs/2505.03728"}],"as_of":"2025-05","related_ids":["inverse-kinematics","trajectory-optimization","motion-retargeting","jax","viser","pink"],"name":"PyRoki","alt":"Python Robot Kinematics","abbr":"PyRoki","aliases":[],"one_liner":"伯克利开源的 JAX 机器人运动学优化工具包","explanation":"PyRoki 是加州大学伯克利分校团队 2025 年开源的 Python 工具包，基于 JAX（谷歌的可自动求导、可编译到 GPU 的数值计算库）。它把逆运动学、轨迹优化、动作重定向等问题统一写成「代价项 + 约束」的非线性优化，用户按需组合碰撞、关节限位、末端位姿等模块即可求解，可在 CPU、GPU 上运行并支持批量计算。作者报告它在逆运动学上比部分已有工具更快。它常和同组的 Viser 可视化工具一起用，适合做人手或人体动作到机器人的重定向、数据生成等研究原型。","example":"把人手演示视频里估计出的手腕轨迹，用 PyRoki 优化成双臂机器人的关节轨迹，同时避免自碰撞。","related":["逆运动学","轨迹优化","动作重定向","JAX","Viser","Pink（基于 Pinocchio 的微分逆运动学库）"]},{"id":"open-motion-planning-library","category":"software","sec":5,"tier":2,"sources":[{"title":"The Open Motion Planning Library","url":"https://ompl.kavrakilab.org/"}],"as_of":"","related_ids":["moveit-motion-planning-framework","motion-planning","sampling-based-planning","rapidly-exploring-random-tree","probabilistic-roadmap","flexible-collision-library"],"name":"OMPL","alt":"Open Motion Planning Library","abbr":"OMPL","aliases":["开放运动规划库"],"one_liner":"莱斯大学开发的开源运动规划库，集成了大量基于采样的规划算法","explanation":"OMPL 是莱斯大学 Kavraki 实验室开发的开源 C++ 运动规划库（带 Python 接口），实现了 RRT、RRT-Connect、RRT*、PRM、BIT* 等几十种基于采样的规划算法。它只负责「在构型空间里找一条不碰撞的路径」，本身不管碰撞检测和机器人模型，需要外部提供「某个状态是否合法」的判断函数。正因为这种解耦，MoveIt 把它作为默认规划后端，机械臂避障规划很多时候底层跑的就是 OMPL。学运动规划时，用它对比不同算法最方便。","example":"在 MoveIt 里给 UR5e 规划绕开桌上杯子的轨迹，默认调用的是 OMPL 中的 RRTConnect。","related":["MoveIt","运动规划","基于采样的规划","快速扩展随机树","概率路线图","FCL"]},{"id":"flexible-collision-library","category":"software","sec":5,"tier":3,"sources":[{"title":"flexible-collision-library/fcl (GitHub)","url":"https://github.com/flexible-collision-library/fcl"},{"title":"coal-library/coal (GitHub)","url":"https://github.com/coal-library/coal"}],"as_of":"","related_ids":["collision-checking","bounding-volume","gilbert-johnson-keerthi-algorithm","moveit-motion-planning-framework","pinocchio","open-motion-planning-library"],"name":"FCL","alt":"Flexible Collision Library","abbr":"FCL","aliases":["hpp-fcl","Coal"],"one_liner":"机器人规划里最常用的开源 C++ 碰撞检测与距离计算库","explanation":"FCL 是 Jia Pan、Sachin Chitta、Dinesh Manocha 在 2012 年 ICRA 发表的开源 C++ 库，用来判断两个几何体是否碰撞、算最近距离和穿透深度，支持球、盒、圆柱、凸体、三角网格、八叉树地图等。运动规划要对成千上万个候选姿态做碰撞检查，速度和稳定性直接决定规划快慢，FCL 用包围盒层次结构（先粗略排除、再精细计算）加速。MoveIt 默认用它做碰撞检查。法国 LAAS/INRIA 团队维护的分支 hpp-fcl 做了性能改进，后来更名为 Coal，是 Pinocchio 的碰撞后端。","example":"在 MoveIt 里规划机械臂绕过桌上水杯，每个候选关节角都由 FCL 检查手臂网格和水杯、桌面是否相交。","related":["碰撞检查","包围盒","GJK 算法","MoveIt","Pinocchio","OMPL"]},{"id":"moveit-motion-planning-framework","category":"software","sec":5,"tier":2,"sources":[{"title":"MoveIt 官网","url":"https://moveit.ai/"},{"title":"MoveIt 2 文档","url":"https://moveit.picknik.ai/main/index.html"}],"as_of":"","related_ids":["open-motion-planning-library","motion-planning","inverse-kinematics","semantic-robot-description-format","rviz-rviz2","curobo"],"name":"MoveIt","alt":"MoveIt Motion Planning Framework","abbr":"","aliases":["MoveIt 2","MoveIt2"],"one_liner":"ROS 上最常用的开源机械臂运动规划框架。","explanation":"MoveIt 是基于 ROS 的开源机械臂运动规划框架，最早出自 Willow Garage，现在由 PickNik Robotics 牵头和社区维护，ROS 2 上的版本叫 MoveIt 2。它把机械臂上一套常用功能打包好：逆运动学求解（从末端位姿算关节角）、调用 OMPL 等规划器算出不碰撞的路径、用碰撞检测库检查自碰撞和环境碰撞、给路径加上速度和时间信息，再把轨迹发给控制器执行。配套的 Setup Assistant 能从 URDF 生成 SRDF 和配置包，RViz 插件可以拖动末端直接规划。传统示教、抓取流水线常用它；学习型策略直接输出动作时则常绕开它。","example":"用 MoveIt Setup Assistant 导入 Franka 的 URDF，生成配置包后在 RViz 里拖动末端标记，点 Plan & Execute 让机械臂避障移动到目标位姿。","related":["OMPL","运动规划","逆运动学","语义机器人描述格式","RViz","cuRobo"]},{"id":"topp-ra","category":"software","sec":5,"tier":3,"sources":[{"title":"A New Approach to Time-Optimal Path Parameterization based on Reachability Analysis (arXiv)","url":"https://arxiv.org/abs/1707.07239"},{"title":"toppra GitHub","url":"https://github.com/hungpham2511/toppra"}],"as_of":"","related_ids":["time-optimal-path-parameterization","time-parameterization","trajectory-planning","ruckig","drake","moveit-motion-planning-framework"],"name":"TOPP-RA","alt":"Time-Optimal Path Parameterization based on Reachability Analysis","abbr":"TOPP-RA","aliases":["toppra"],"one_liner":"给定路径，在速度、加速度限制下算出最快走法的开源算法库。","explanation":"TOPP-RA 是 Hung Pham 和 Quang-Cuong Pham 提出的时间最优路径参数化方法，论文发表在 IEEE T-RO（2018），并开源为 Python/C++ 库 toppra。问题是：运动规划器给出的往往只是一串几何路点，没有「每一刻走多快」。TOPP-RA 把路径离散成若干段，用可达性分析（逐段算出下一步速度可取的区间）把问题拆成一串小线性规划，在关节速度、加速度、力矩等约束下求出最短时间的速度曲线。它比早期基于数值积分的 TOPP 方法更稳，失败率低。Drake 等库内置了它，常接在路径规划之后生成可执行轨迹。","example":"RRT 为机械臂规划出一条避障路径后，用 toppra 按各关节的速度、加速度上限重新分配时间，得到能直接下发给控制器的轨迹。","related":["时间最优路径参数化","时间参数化","轨迹规划","Ruckig","Drake","MoveIt"]},{"id":"ruckig","category":"software","sec":5,"tier":3,"sources":[{"title":"pantor/ruckig (GitHub)","url":"https://github.com/pantor/ruckig"},{"title":"Jerk-limited Real-time Trajectory Generation with Arbitrary Target States (arXiv)","url":"https://arxiv.org/abs/2105.04830"}],"as_of":"","related_ids":["jerk","s-curve-velocity-profile","time-parameterization","time-optimal-path-parameterization","topp-ra","moveit-motion-planning-framework"],"name":"Ruckig","alt":"Ruckig (online jerk-limited trajectory generation)","abbr":"","aliases":["Ruckig Pro"],"one_liner":"每个控制周期实时生成限加加速度、时间最优轨迹的开源库","explanation":"Ruckig 是 Lars Berscheid 开发的开源 C++ 库（带 Python 接口），对应论文 2021 年发表于 RSS 会议。给定当前状态（位置、速度、加速度）、目标状态，以及每个关节的速度、加速度、加加速度（jerk，加速度的变化率）上限，它能在微秒级算出时间最优轨迹，因此可以在每个控制周期重新规划：目标突然变化时，机器人也能从当前运动状态平滑地转过去，这就是「在线」的含义。MoveIt 2 用它做轨迹平滑和实时伺服的限幅。社区版开源，另有支持中间路点等功能的商业版 Ruckig Pro。","example":"视觉伺服时目标位置每帧都在变，控制器每 1 ms 调一次 Ruckig，从当前速度和加速度出发重新规划到新目标，关节不会因目标跳变而抖动。","related":["加加速度","S 型速度曲线","时间参数化","时间最优路径参数化","TOPP-RA","MoveIt"]},{"id":"curobo","category":"software","sec":5,"tier":3,"sources":[{"title":"cuRobo Documentation","url":"https://curobo.org/"},{"title":"NVlabs/curobo - GitHub","url":"https://github.com/NVlabs/curobo"}],"as_of":"","related_ids":["motion-planning","inverse-kinematics","trajectory-optimization","nvidia-isaac-ros-cumotion","signed-distance-field-function","nvidia-isaac-ros"],"name":"cuRobo","alt":"cuRobo (NVIDIA GPU-accelerated motion planning)","abbr":"","aliases":["CuRobo"],"one_liner":"英伟达的 GPU 并行运动规划库，毫秒级出无碰撞轨迹。","explanation":"英伟达开源的机械臂运动生成库，把逆运动学、碰撞检查（对网格、点云、符号距离场）和轨迹优化都写成 GPU 并行 kernel，同时对成千上万条初始轨迹做优化，因此能在毫秒量级给出无碰撞、满足关节限位的平滑轨迹。它针对的是传统采样式规划（RRT 那一类）在机械臂抓取里太慢、结果抖动的问题，也常被大模型系统当成底层执行器：上层只给目标位姿，怎么走过去交给它。Isaac ROS 里的 cuMotion 就是它的封装。","example":"上层系统给出目标末端位姿后，用 cuRobo 在几十毫秒内解出避开桌面和箱子的关节轨迹。","related":["运动规划","逆运动学","轨迹优化","cuMotion","符号距离场","Isaac ROS"]},{"id":"nvidia-isaac-ros-cumotion","category":"software","sec":5,"tier":3,"sources":[{"title":"Isaac ROS cuMotion 文档","url":"https://nvidia-isaac-ros.github.io/repositories_and_packages/isaac_ros_cumotion/index.html"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"cuMotion","alt":"NVIDIA Isaac ROS cuMotion","abbr":"","aliases":["isaac_ros_cumotion"],"one_liner":"英伟达基于 cuRobo 的 GPU 机械臂运动规划 ROS 2 包。","explanation":"cuMotion 是英伟达 Isaac ROS 中的机械臂运动规划软件包，核心算法来自 cuRobo（英伟达的 GPU 并行运动规划库）。它以插件形式接入 MoveIt 2，替代或补充传统的基于采样的规划器，在 GPU 上并行优化大量候选轨迹，在较短时间内给出避障、平滑的关节轨迹。它还能结合 nvblox 构建的环境地图避障，并提供从深度图中分割掉机器人自身的功能，避免把自己的手臂误当障碍物。","example":"在 MoveIt 2 的 RViz 界面里选 cuMotion 规划器，让机械臂绕开桌上的障碍物去抓取。","related":["cuRobo(cuRobo (NVIDIA GPU-accelerated motion planning))","MoveIt(MoveIt Motion Planning Framework)","Isaac ROS(NVIDIA Isaac ROS)","运动规划(Motion Planning)","避障(Obstacle Avoidance)","nvblox(NVIDIA nvblox (GPU TSDF/ESDF Mapping))"]},{"id":"pddlstream","category":"software","sec":5,"tier":3,"sources":[{"title":"caelan/pddlstream (GitHub)","url":"https://github.com/caelan/pddlstream"},{"title":"PDDLStream: Integrating Symbolic Planners and Blackbox Samplers via Optimistic Adaptive Planning (arXiv)","url":"https://arxiv.org/abs/1802.08705"}],"as_of":"","related_ids":["task-and-motion-planning","planning-domain-definition-language","symbolic-planning","motion-planning","inverse-kinematics"],"name":"PDDLStream","alt":"PDDLStream","abbr":"","aliases":[],"one_liner":"把符号规划器和连续采样器接在一起做任务与运动规划的框架","explanation":"PDDLStream 是 MIT 的 Caelan Garrett 与 Tomás Lozano-Pérez、Leslie Kaelbling 提出的规划框架，论文发表于 ICAPS 2020，代码开源。它在 PDDL（规划领域定义语言）里加入「流」（stream）：一种条件采样器，按需生成抓取位姿、放置位置、逆运动学解、无碰路径等连续值。规划器先假设这些值存在、乐观地搜出一个符号计划，再调用采样器去验证填实，失败就回头重搜。它解决的是纯符号规划器处理不了连续几何、纯运动规划器又不懂任务顺序的问题，是任务与运动规划（TAMP）领域常用的基线工具。","example":"让机械臂把被挡住的杯子拿出来：PDDLStream 规划出「先移开前面的盒子，再抓杯子」，并用流采样出每一步的抓取位姿和无碰轨迹。","related":["任务与运动规划","规划领域定义语言","符号规划","运动规划","逆运动学"]},{"id":"drake","category":"software","sec":5,"tier":2,"sources":[{"title":"Drake 官网","url":"https://drake.mit.edu/"}],"as_of":"","related_ids":["mujoco","pinocchio","trajectory-optimization","multibody-dynamics","toyota-research-institute","inverse-kinematics"],"name":"Drake","alt":"Drake","abbr":"","aliases":["pydrake"],"one_liner":"MIT 与丰田研究院主导的基于模型的机器人仿真与优化工具箱","explanation":"Drake 是 MIT Russ Tedrake 团队发起、丰田研究院（TRI）深度参与开发的开源 C++ 工具箱，提供 Python 接口 pydrake。它的定位是「基于模型的设计与验证」：包含多体动力学计算、带接触的物理仿真、以及一套数学优化接口，可以直接写轨迹优化、逆运动学、控制器设计问题并调用各种求解器。和主打大规模并行训练的仿真器不同，Drake 更强调物理和数值上的严谨。Tedrake 的公开课《Underactuated Robotics》和《Robotic Manipulation》的配套代码都基于 Drake。","example":"用 pydrake 加载一个机械臂的 URDF，写一个逆运动学优化问题，求解让末端到达指定位姿的关节角。","related":["MuJoCo","Pinocchio","轨迹优化","多体动力学","丰田研究院","逆运动学"]},{"id":"casadi","category":"software","sec":5,"tier":3,"sources":[{"title":"CasADi 官网","url":"https://web.casadi.org/"},{"title":"casadi/casadi (GitHub)","url":"https://github.com/casadi/casadi"}],"as_of":"","related_ids":["acados","interior-point-optimizer","trajectory-optimization","model-predictive-control","direct-collocation","multiple-shooting"],"name":"CasADi","alt":"CasADi","abbr":"","aliases":[],"one_liner":"做数值优化和自动微分的开源符号工具，常用于 MPC 与轨迹优化建模","explanation":"CasADi 是一个开源的非线性优化与算法微分（自动求导）工具，由 Joel Andersson、Joris Gillis 和 Moritz Diehl 等人在比利时鲁汶大学开发，支持 Python、MATLAB 和 C++。用户先用它的符号表达式写出系统动力学、代价函数和约束，CasADi 会自动算出梯度、雅可比和海森矩阵，再调用 IPOPT、qpOASES、OSQP 等求解器去解，也能把整个问题生成 C 代码。它解决的是写最优控制问题时手推导数又慢又容易错的问题，因此成为搭建模型预测控制、轨迹优化和参数辨识的常用建模层，acados 也用它来描述模型。","example":"用 CasADi 的 Opti 接口写一个倒立摆摆起问题：状态和控制作为决策变量，用直接多重打靶法离散，调用 IPOPT 求出最优控制序列。","related":["acados","Ipopt","轨迹优化","模型预测控制","直接配点法","多重打靶法"]},{"id":"interior-point-optimizer","category":"software","sec":5,"tier":3,"sources":[{"title":"coin-or/Ipopt (GitHub)","url":"https://github.com/coin-or/Ipopt"},{"title":"Ipopt 官方文档","url":"https://coin-or.github.io/Ipopt/"}],"as_of":"","related_ids":[null,null,"casadi",null,null,"acados"],"name":"Ipopt","alt":"Interior Point OPTimizer","abbr":"Ipopt","aliases":["IPOPT"],"one_liner":"COIN-OR 开源的大规模非线性优化求解器，基于内点法，常用于轨迹优化。","explanation":"Ipopt 是 COIN-OR 开源社区维护的非线性规划求解器，核心算法由 Andreas Wächter 和 Lorenz Biegler 提出，用内点法（在可行域内部沿「障碍函数」逐步逼近最优解）求解带等式和不等式约束的大规模问题。机器人里的轨迹优化、非线性模型预测控制都要反复求这类问题：变量是一段时间内的状态和控制量，约束是动力学方程、关节限位、摩擦锥等。Ipopt 通常不单独使用，而是通过 CasADi、Drake、Pyomo 等建模工具调用；它需要搭配 MUMPS 或 HSL 等线性方程求解器。","example":"用 CasADi 写好四足机器人跳跃的直接配点法问题，再调用 nlpsol('solver', 'ipopt', nlp) 求出一条满足动力学和摩擦约束的起跳轨迹。","related":["轨迹优化(Trajectory Optimization)","非线性模型预测控制(Nonlinear Model Predictive Control)","CasADi","直接配点法(Direct Collocation)","序列二次规划(Sequential Quadratic Programming)","acados"]},{"id":"osqp","category":"software","sec":5,"tier":3,"sources":[{"title":"OSQP 官网","url":"https://osqp.org/"},{"title":"OSQP: an operator splitting solver for quadratic programs (arXiv)","url":"https://arxiv.org/abs/1711.08013"}],"as_of":"","related_ids":["quadratic-programming","model-predictive-control","convex-mpc","whole-body-control","qpoases","convex-optimization"],"name":"OSQP","alt":"Operator Splitting Quadratic Program solver","abbr":"OSQP","aliases":[],"one_liner":"基于算子分裂方法的开源二次规划求解器，常用于 MPC 和全身控制","explanation":"OSQP 是牛津大学与斯坦福大学研究者（Stellato、Banjac、Goulart、Bemporad、Boyd 等）开发的开源二次规划求解器，论文 2020 年发表。二次规划（QP）指目标是二次函数、约束是线性不等式的优化问题，机器人里的模型预测控制、全身控制、接触力分配都常写成 QP，而且要在每个控制周期（几毫秒）内解完。OSQP 用 ADMM（一种把大问题拆成简单子问题交替求解的算法），纯 C 实现、不依赖外部库，支持热启动（用上一时刻的解做初值）和生成嵌入式 C 代码，适合实时控制。它有 Python、MATLAB、C++ 等接口。","example":"四足机器人的凸 MPC 每个周期把未来十步的足底力优化写成一个 QP，用 OSQP 热启动求解，在几毫秒内得到结果。","related":["二次规划","模型预测控制","凸 MPC","全身控制","qpOASES","凸优化"]},{"id":"qpoases","category":"software","sec":5,"tier":3,"sources":[{"title":"coin-or/qpOASES (GitHub)","url":"https://github.com/coin-or/qpOASES"}],"as_of":"","related_ids":["quadratic-programming","model-predictive-control","convex-mpc","osqp","acados","casadi"],"name":"qpOASES","alt":"qpOASES","abbr":"","aliases":[],"one_liner":"基于在线有效集法的开源二次规划求解器，常用于 MPC","explanation":"qpOASES 是比利时鲁汶大学 Hans Joachim Ferreau 等人开发的开源 C++ 二次规划（QP）求解器，现托管在 COIN-OR。它采用参数化的在线有效集法：相邻两次求解的问题往往只差一点，它能沿用上一次哪些约束起作用的信息做「热启动」，因此特别适合每个控制周期都要解一次 QP 的模型预测控制（MPC）。它适合变量规模中小、较稠密的问题，提供 MATLAB、Python 接口，也被 CasADi、acados 等优化框架集成。腿足机器人的凸 MPC 实现里常见它的身影。","example":"四足机器人凸 MPC 每个周期要解出未来若干步的足端接触力，就可以交给 qpOASES 热启动求解。","related":["二次规划","模型预测控制","凸 MPC","OSQP","acados","CasADi"]},{"id":"acados","category":"software","sec":5,"tier":3,"sources":[{"title":"acados documentation","url":"https://docs.acados.org/"},{"title":"acados/acados (GitHub)","url":"https://github.com/acados/acados"}],"as_of":"","related_ids":["model-predictive-control","nonlinear-model-predictive-control","casadi","sequential-quadratic-programming","ocs2","crocoddyl"],"name":"acados","alt":"acados (fast embedded optimal control solver)","abbr":"","aliases":[],"one_liner":"面向实时模型预测控制的开源最优控制求解器，可生成嵌入式 C 代码","explanation":"acados 是一套开源的最优控制与模型预测控制（MPC，每个控制周期在线解一个未来一段时间的优化问题）求解软件，主要由德国弗莱堡大学 Moritz Diehl 课题组及合作者开发，可看作早年 ACADO 工具的后继。它的核心用 C 写成，底层依赖 BLASFEO（小矩阵线性代数库）和 HPIPM（结构化二次规划求解器），提供 SQP（序列二次规划）和实时迭代（RTI）等算法，目标是在毫秒级控制周期内解完非线性 MPC。用户通常在 Python 或 MATLAB 里用 CasADi 写系统动力学和代价函数，由 acados 生成 C 代码，再部署到工控机或嵌入式板卡上。在足式机器人、无人机、机械臂的 MPC 研究里很常见。","example":"在 Python 里用 CasADi 写好四旋翼动力学，用 acados 生成 C 求解器，以 100 Hz 左右的频率在机载计算机上跑非线性 MPC 做轨迹跟踪。","related":["模型预测控制","非线性模型预测控制","CasADi","序列二次规划","OCS2","Crocoddyl"]},{"id":"tsid","category":"software","sec":5,"tier":3,"sources":[{"title":"stack-of-tasks/tsid (GitHub)","url":"https://github.com/stack-of-tasks/tsid"}],"as_of":"","related_ids":["whole-body-control","inverse-dynamics","quadratic-programming","pinocchio","task-space-control","crocoddyl"],"name":"TSID","alt":"Task Space Inverse Dynamics library","abbr":"TSID","aliases":["任务空间逆动力学库"],"one_liner":"用二次规划做任务空间逆动力学全身控制的 C++ 库","explanation":"TSID 是法国 LAAS-CNRS 的 Andrea Del Prete 等人开发的开源 C++ 库（带 Python 接口），基于 Pinocchio 动力学库。它把全身控制写成一个二次规划（QP）问题：给定多个任务，比如保持质心、跟踪手的位置、维持姿态，再加上接触力要在摩擦锥内、关节力矩有上限等约束，每个控制周期求出满足约束、最接近各任务目标的关节加速度、力矩和接触力。常用于人形和四足机器人的基于模型的全身控制，也是学习 WBC 原理的常用教学代码。","example":"给人形机器人设三个任务：双脚接触、质心跟踪参考轨迹、右手跟踪目标点，用 TSID 每 1 毫秒求一次关节力矩。","related":["全身控制","逆动力学","二次规划","Pinocchio","任务空间控制","Crocoddyl"]},{"id":"crocoddyl","category":"software","sec":5,"tier":3,"sources":[{"title":"loco-3d/crocoddyl - GitHub","url":"https://github.com/loco-3d/crocoddyl"}],"as_of":"","related_ids":["differential-dynamic-programming","optimal-control","trajectory-optimization","model-predictive-control","pinocchio","ocs2"],"name":"Crocoddyl","alt":"Crocoddyl (Contact RObot COntrol by Differential DYnamic programming Library)","abbr":"","aliases":[],"one_liner":"面向接触的最优控制库，用微分动态规划解机器人轨迹。","explanation":"名字拼自 Contact RObot COntrol by Differential DYnamic programming Library，由爱丁堡大学与 LAAS-CNRS 的研究者（Mastalli 等）开源。它把带接触的多体动力学最优控制问题写成统一形式，再用 DDP、FDDP 这类求解器迭代出关节力矩和整条轨迹，速度快到可以做在线模型预测控制。腿足机器人绕不开这类工具：跳跃、上台阶要同时决定落足点、接触力和整机运动，光靠逆运动学做不出来。底层动力学用 Pinocchio，提供 C++ 和 Python 接口，常与 OCS2、acados 一起被比较。","example":"给四足机器人规划一段跳跃：在 Crocoddyl 里定义接触序列和代价函数，用 FDDP 解出力矩轨迹。","related":["微分动态规划","最优控制","轨迹优化","模型预测控制","Pinocchio","OCS2"]},{"id":"ocs2","category":"software","sec":5,"tier":3,"sources":[{"title":"leggedrobotics/ocs2 (GitHub)","url":"https://github.com/leggedrobotics/ocs2"}],"as_of":"","related_ids":["nonlinear-model-predictive-control","legged-control","eth-zurich-robotic-systems-lab","iterative-linear-quadratic-regulator","pinocchio","multiple-shooting"],"name":"OCS2","alt":"Optimal Control for Switched Systems","abbr":"OCS2","aliases":[],"one_liner":"苏黎世联邦理工开源的 C++ 最优控制工具箱，常用于足式机器人 MPC","explanation":"OCS2 是苏黎世联邦理工机器人系统实验室（RSL）开发的开源 C++ 工具箱，专门求解「切换系统」的最优控制问题。足式机器人每条腿在支撑和摆动间切换，动力学随接触状态改变，这就是一种切换系统。OCS2 提供 SLQ、iLQR、多重打靶 SQP 等算法，用自动微分生成导数，并接入 Pinocchio 做刚体动力学，能以实时速度运行非线性 MPC。它自带四足、移动机械臂等示例和 ROS 接口，是很多足式机器人 MPC 项目（如 legged_control）的基础。","example":"legged_control 用 OCS2 实现四足机器人的非线性 MPC，算出未来一段时间的质心轨迹和足底力，再交给全身控制器执行。","related":["非线性模型预测控制","legged_control","苏黎世联邦理工机器人系统实验室","迭代线性二次调节器","Pinocchio","多重打靶法"]},{"id":"legged-control","category":"software","sec":5,"tier":3,"sources":[{"title":"qiayuanl/legged_control (GitHub)","url":"https://github.com/qiayuanl/legged_control"}],"as_of":"","related_ids":[null,null,null,null,null,null],"name":"legged_control","alt":"legged_control (NMPC + WBC framework for legged robots)","abbr":"","aliases":["qiayuanl/legged_control"],"one_liner":"开源的足式机器人控制框架，用非线性 MPC 规划加全身控制跟踪，基于 OCS2 和 ROS。","explanation":"legged_control 是 Qiayuan Liao 开源的四足机器人传统运动控制框架，基于 ROS 和 ros_control。上层用 OCS2 库做非线性模型预测控制（NMPC：每个控制周期在线求解未来一段时间的最优轨迹），下层用基于分层二次规划的全身控制（WBC）把规划结果换算成各关节力矩，并配有融合腿式里程计与 IMU 的状态估计。它提供 Gazebo 仿真和 Unitree A1 等机器人的实机示例，是学习「基于模型的足式运控」时常被拿来跑通和改写的参考实现，也常作为强化学习运控的对照基线。","example":"在 Gazebo 里启动 Unitree A1 模型，用 legged_control 的 NMPC+WBC 控制器让机器人切换到对角小跑步态并跟随手柄速度指令。","related":["非线性模型预测控制(Nonlinear Model Predictive Control)","全身控制(Whole-Body Control)","OCS2(Optimal Control for Switched Systems)","分层二次规划(Hierarchical Quadratic Programming)","腿足运动(Legged Locomotion)","基于模型的控制(Model-Based Control)"]},{"id":"mujoco-mpc","category":"software","sec":5,"tier":3,"sources":[{"title":"mujoco_mpc GitHub","url":"https://github.com/google-deepmind/mujoco_mpc"},{"title":"Predictive Sampling: Real-time Behaviour Synthesis with MuJoCo (arXiv)","url":"https://arxiv.org/abs/2212.00541"}],"as_of":"","related_ids":[null,null,null,null,null],"name":"MuJoCo MPC","alt":"MuJoCo MPC","abbr":"MJPC","aliases":["MJPC"],"one_liner":"谷歌 DeepMind 开源的 MuJoCo 实时模型预测控制工具。","explanation":"MuJoCo MPC（MJPC）是谷歌 DeepMind 2022 年开源的交互式工具，用 MuJoCo 仿真器做模型预测控制（每个时刻向前推演一小段未来、优化动作序列、只执行第一步再重来）。它内置 iLQG、梯度下降和预测采样（Predictive Sampling）等规划器，用户在图形界面里调代价函数权重，就能实时看到机器人行为变化。它不用训练神经网络，适合快速生成四足、人形或灵巧手的动作，也常用作强化学习之外的基于模型控制基线。","example":"在 MJPC 界面里选四足任务，拖动目标点，机器人通过在线规划实时走过去。","related":["模型预测控制(Model Predictive Control)","采样式 MPC(Sampling-based MPC)","迭代线性二次调节器(Iterative Linear Quadratic Regulator)","MuJoCo(MuJoCo (Multi-Joint dynamics with Contact))","DIAL-MPC(Diffusion-Inspired Annealing for Legged MPC)"]},{"id":"opencv","category":"software","sec":6,"tier":2,"sources":[{"title":"OpenCV - Open Computer Vision Library","url":"https://opencv.org/"}],"as_of":"","related_ids":["camera-calibration","aruco-marker","perspective-n-point","feature-points","point-cloud-library","open3d"],"name":"OpenCV","alt":"Open Source Computer Vision Library","abbr":"OpenCV","aliases":["cv2"],"one_liner":"最常用的开源计算机视觉库，处理图像、相机和几何计算","explanation":"OpenCV 是一个开源计算机视觉库，最早由英特尔发起，核心用 C++ 写成，提供 Python 等接口，Python 里通过 import cv2 使用。它覆盖图像读写与缩放、颜色空间转换、滤波、特征点提取与匹配、相机标定、畸变校正、PnP 位姿求解、ArUco 码检测等传统视觉功能。深度学习模型接手了识别类任务后，OpenCV 在机器人里依然天天用：读相机帧、做预处理、标定相机内外参、画可视化结果，基本绕不开它。","example":"用 cv2.calibrateCamera 配合棋盘格标定板求腕部相机内参，再用 cv2.undistort 去畸变。","related":["相机标定","ArUco码","PnP（透视n点）","特征点","点云库","Open3D"]},{"id":"open3d","category":"software","sec":6,"tier":2,"sources":[{"title":"Open3D: A Modern Library for 3D Data Processing","url":"https://www.open3d.org/"},{"title":"Open3D paper (arXiv:1801.09847)","url":"https://arxiv.org/abs/1801.09847"}],"as_of":"","related_ids":["point-cloud","point-cloud-library","iterative-closest-point","truncated-signed-distance-function","opencv","3d-diffusion-policy"],"name":"Open3D","alt":"Open3D","abbr":"","aliases":[],"one_liner":"处理点云、网格和三维重建的开源 3D 数据处理库","explanation":"Open3D 是由英特尔实验室研究者发起的开源 3D 数据处理库，核心为 C++，提供易用的 Python 接口。它支持读写点云和网格、体素降采样、法向量估计、ICP 点云配准、RGB-D 融合重建（TSDF）和交互式可视化。相比功能更全但偏重的 PCL（点云库），Open3D 在 Python 里上手更快，因此常被用在机器人研究里：把深度相机数据转成点云、裁剪桌面区域、给 3D 策略准备输入，或检查标定结果。","example":"用 Open3D 把 RealSense 的彩色图和深度图合成点云，体素降采样后作为 3D 扩散策略的输入。","related":["点云","点云库","迭代最近点","截断符号距离函数","OpenCV","3D 扩散策略"]},{"id":"point-cloud-library","category":"software","sec":6,"tier":2,"sources":[{"title":"Point Cloud Library (PCL)","url":"https://pointclouds.org/"},{"title":"PointCloudLibrary/pcl - GitHub","url":"https://github.com/PointCloudLibrary/pcl"}],"as_of":"","related_ids":["point-cloud","open3d","iterative-closest-point","point-cloud-registration","point-cloud-segmentation","opencv"],"name":"点云库","alt":"Point Cloud Library","abbr":"PCL","aliases":["PCL"],"one_liner":"处理三维点云的开源 C++ 算法库，滤波、配准、分割都有。","explanation":"PCL 是一个开源的 C++ 点云处理库，最初由 Willow Garage 发起，2011 年在 ICRA 论文中正式介绍，采用 BSD 许可。它把点云处理的常见步骤封装成模块：体素降采样和离群点去除（滤波）、法向量和 FPFH 等特征计算、ICP / NDT 配准、RANSAC 平面拟合与聚类分割、表面重建等。深度相机和激光雷达出来的数据都是点云，PCL 长期是机器人三维感知的基础工具，ROS 里通过 perception_pcl 与消息格式互转。如果主要写 Python，Open3D 是更轻便的替代。","example":"用 PCL 的 RANSAC 拟合出桌面平面并删掉，剩下的点再做欧式聚类，得到桌上每个物体的点云。","related":["点云","Open3D","迭代最近点","点云配准","点云分割","OpenCV"]},{"id":"kalibr","category":"software","sec":6,"tier":3,"sources":[{"title":"ethz-asl/kalibr (GitHub)","url":"https://github.com/ethz-asl/kalibr"}],"as_of":"","related_ids":[null,null,"apriltag",null,null,"vins-mono-vins-fusion"],"name":"Kalibr","alt":"Kalibr","abbr":"","aliases":["ethz-asl/kalibr"],"one_liner":"苏黎世联邦理工开源的标定工具箱，专做多相机和相机-IMU 的内外参与时间标定。","explanation":"Kalibr 是苏黎世联邦理工学院自主系统实验室（ETH ASL）开源的传感器标定工具箱，基于 ROS 运行。它能完成多相机内参与外参标定、相机与 IMU 之间的空间外参和时间偏移标定、多 IMU 标定以及卷帘快门相机标定，常用 AprilGrid（由 AprilTag 组成的网格）作为标定板。视觉惯性里程计、SLAM 等算法要求准确知道相机与 IMU 的相对位姿和时间差，参数不准会直接导致漂移，Kalibr 是做这件事时最常用的工具之一。","example":"手持带 IMU 的 RealSense D435i 在 AprilGrid 前晃动录一段 rosbag，运行 kalibr_calibrate_imu_camera，得到相机到 IMU 的变换矩阵和两者的时间偏移，再填进 VINS-Fusion 的配置。","related":["相机-IMU联合标定(Camera-IMU Calibration)","相机标定(Camera Calibration)","AprilTag","视觉惯性里程计(Visual-Inertial Odometry)","相机外参(Camera Extrinsics)","VINS-Fusion"]},{"id":"colmap","category":"software","sec":6,"tier":3,"sources":[{"title":"COLMAP Documentation","url":"https://colmap.github.io/"},{"title":"colmap/colmap - GitHub","url":"https://github.com/colmap/colmap"}],"as_of":"","related_ids":["structure-from-motion","multi-view-stereo","3d-gaussian-splatting","neural-radiance-fields","bundle-adjustment","camera-extrinsics"],"name":"COLMAP","alt":"COLMAP","abbr":"","aliases":[],"one_liner":"开源的运动恢复结构加多视图立体三维重建工具。","explanation":"一套通用三维重建流水线，作者 Johannes Schönberger 等。它先做运动恢复结构（SfM，从多张照片同时求相机位姿和稀疏点云），再做多视图立体（MVS，稠密化出点云和网格）。之所以重要，是因为它几乎成了「从照片拿相机位姿」的事实标准：神经辐射场、3D 高斯泼溅的训练数据基本都靠 COLMAP 标位姿。有命令行和图形界面，也常被脚本自动调用；机器人这边常用它把绕物体或场景拍一圈的视频变成可用的三维资产。","example":"训练 3D 高斯泼溅前，把绕桌面拍的一圈图跑 COLMAP，得到相机内外参和稀疏点云。","related":["运动恢复结构","多视图立体","3D高斯泼溅","神经辐射场","光束法平差","相机外参"]},{"id":"nerfstudio-gsplat","category":"software","sec":6,"tier":3,"sources":[{"title":"Nerfstudio 官网","url":"https://docs.nerf.studio/"},{"title":"gsplat GitHub","url":"https://github.com/nerfstudio-project/gsplat"}],"as_of":"","related_ids":[null,null,null,null,"colmap",null],"name":"Nerfstudio / gsplat（NeRF 与高斯泼溅开源工具库）","alt":"Nerfstudio / gsplat","abbr":"","aliases":["Nerfstudio","gsplat"],"one_liner":"用照片重建三维场景的开源工具库，覆盖 NeRF 和高斯泼溅。","explanation":"Nerfstudio 是加州大学伯克利分校团队开源的神经辐射场（NeRF，用神经网络表示三维场景）框架，论文发表于 SIGGRAPH 2023，提供数据处理、训练和网页查看器，自带 Nerfacto 等方法。gsplat 是同一团队推出的 CUDA 加速 3D 高斯泼溅（用大量带颜色的三维高斯点表示场景）渲染与训练库，被 Nerfstudio 的 Splatfacto 等项目采用。具身方向常用它们把真实场景扫描成可渲染的三维资产，用于现实到仿真、高斯泼溅仿真和数据增强。","example":"用手机绕桌面拍一段视频，经 Nerfstudio 处理和训练，得到能从新视角渲染的高斯泼溅场景。","related":["神经辐射场(Neural Radiance Fields)","3D高斯泼溅(3D Gaussian Splatting)","现实到仿真(Real-to-Sim)","高斯泼溅仿真(Gaussian Splatting-based Simulation)","COLMAP","新视角合成(Novel View Synthesis)"]},{"id":"ceres-solver","category":"software","sec":6,"tier":3,"sources":[{"title":"Ceres Solver 官网","url":"http://ceres-solver.org/"},{"title":"ceres-solver/ceres-solver (GitHub)","url":"https://github.com/ceres-solver/ceres-solver"}],"as_of":"","related_ids":["bundle-adjustment","simultaneous-localization-and-mapping","g2o","gtsam","factor-graph-optimization","camera-calibration"],"name":"Ceres Solver","alt":"Ceres Solver","abbr":"","aliases":["Ceres"],"one_liner":"谷歌开源的 C++ 非线性最小二乘优化库，SLAM 和标定的常用后端","explanation":"Ceres Solver 是谷歌开源的 C++ 优化库，主要用来解非线性最小二乘问题（把一堆误差项的平方和降到最小），也能解一般的无约束优化。使用者只需写出每个误差项（残差）怎么计算，Ceres 可以自动求导，并提供 Levenberg-Marquardt、Dogleg 等算法和稀疏线性求解器，处理成千上万个变量的问题。机器人和三维视觉里很多问题都能写成这种形式，比如光束法平差、SLAM 的位姿图优化、相机和 IMU 标定、手眼标定。VINS-Mono、谷歌 Cartographer 等开源系统都用它做优化后端。它与 g2o、GTSAM 定位相近，是同一类工具。","example":"做相机标定时，把每个角点的重投影误差写成一个残差块，交给 Ceres 同时优化内参和各张图片的外参。","related":["光束法平差","同步定位与建图","g2o 图优化库","GTSAM","因子图优化","相机标定"]},{"id":"g2o","category":"software","sec":6,"tier":3,"sources":[{"title":"RainerKuemmerle/g2o (GitHub)","url":"https://github.com/RainerKuemmerle/g2o"}],"as_of":"","related_ids":["factor-graph-optimization","bundle-adjustment",null,"gtsam","ceres-solver","orb-slam3"],"name":"g2o 图优化库","alt":"g2o (General Graph Optimization)","abbr":"g2o","aliases":["g2o"],"one_liner":"用来解 SLAM 位姿图和光束法平差这类图优化问题的 C++ 库","explanation":"g2o 是 Rainer Kümmerle、Giorgio Grisetti、Kurt Konolige、Wolfram Burgard 等人在 2011 年 ICRA 发表的开源 C++ 框架，专门求解可以画成「图」的非线性最小二乘问题：节点是待估计的量（如相机位姿、地图点），边是它们之间的观测约束。SLAM（同时定位与建图）的后端优化、光束法平差都属于这类问题，g2o 利用问题的稀疏结构高效求解，并允许用户自定义节点和边类型。ORB-SLAM 系列的后端就用 g2o。同类工具有 GTSAM、Ceres Solver。","example":"ORB-SLAM3 检测到回环后，用 g2o 优化整张位姿图，把累积漂移分摊到整条轨迹上。","related":["因子图优化","光束法平差","同时定位与建图","GTSAM","Ceres Solver","ORB-SLAM3"]},{"id":"gtsam","category":"software","sec":6,"tier":3,"sources":[{"title":"GTSAM 官网","url":"https://gtsam.org/"},{"title":"borglab/gtsam (GitHub)","url":"https://github.com/borglab/gtsam"}],"as_of":"","related_ids":["factor-graph-optimization",null,"imu-preintegration","g2o","ceres-solver","lio-sam"],"name":"GTSAM","alt":"Georgia Tech Smoothing and Mapping","abbr":"GTSAM","aliases":[],"one_liner":"佐治亚理工开发的因子图优化库，SLAM 和传感器融合常用后端","explanation":"GTSAM 是佐治亚理工 Frank Dellaert 团队开发的开源 C++ 库（BSD 许可，带 Python 和 MATLAB 接口），用因子图表示估计问题：变量是位姿、速度等待估计量，因子是传感器测量带来的约束，再用非线性优化求最可能的解。它的特点是提供了 iSAM2 增量求解器，新测量到来时只更新受影响的部分，适合实时 SLAM；还内置了 IMU 预积分等常用因子。LIO-SAM 等激光惯性 SLAM 系统用它做后端。与 g2o、Ceres Solver 属同类工具，GTSAM 更偏概率建模。","example":"LIO-SAM 把激光里程计、IMU 预积分、GPS 和回环约束都作为因子加入 GTSAM，用 iSAM2 实时优化机器人轨迹。","related":["因子图优化","同时定位与建图","IMU 预积分","g2o 图优化库","Ceres Solver","LIO-SAM"]},{"id":"common-ros-slam-packages","category":"software","sec":6,"tier":3,"sources":[{"title":"slam_toolbox - GitHub","url":"https://github.com/SteveMacenski/slam_toolbox"},{"title":"gmapping - ROS Wiki","url":"https://wiki.ros.org/gmapping"},{"title":"RTAB-Map","url":"http://introlab.github.io/rtabmap/"}],"as_of":"","related_ids":["simultaneous-localization-and-mapping","lidar-slam","occupancy-grid-map","ros-2-navigation-stack","rtab-map","package"],"name":"ROS 常用 SLAM 建图包（GMapping / SLAM Toolbox / RTAB-Map）","alt":"Common ROS SLAM Packages (GMapping / SLAM Toolbox / RTAB-Map)","abbr":"","aliases":[],"one_liner":"ROS 生态里三个装上就能用的建图定位功能包。","explanation":"GMapping 是最老的 2D 激光 SLAM 包（基于粒子滤波，源自 OpenSLAM），ROS 1 时代教学小车的默认选择；SLAM Toolbox 由 Steve Macenski 开发，是 ROS 2 里 2D 激光建图的主力，走图优化，支持在已有地图上继续建图和大场景；RTAB-Map 由 Mathieu Labbé 开发，面向 RGB-D 和双目，自带基于外观的回环检测，能输出稠密三维地图。它们的价值是把 SLAM 变成改配置就能跑的功能包，配合 Nav2 直接产出可导航的栅格地图；代价是精度和鲁棒性不如针对场景专门调过的算法。","example":"给带 2D 激光雷达的移动底盘跑 SLAM Toolbox 建一张楼层栅格地图，再交给 Nav2 做导航。","related":["同步定位与建图","激光SLAM","占据栅格地图","Nav2","RTAB-Map","功能包"]},{"id":"google-cartographer","category":"software","sec":6,"tier":3,"sources":[{"title":"cartographer-project/cartographer (GitHub)","url":"https://github.com/cartographer-project/cartographer"},{"title":"Cartographer 文档","url":"https://google-cartographer.readthedocs.io/"}],"as_of":"","related_ids":["lidar-slam",null,"occupancy-grid-map","loop-closure-detection","2d-lidar","common-ros-slam-packages"],"name":"Cartographer","alt":"Google Cartographer","abbr":"","aliases":["Google Cartographer","cartographer_ros"],"one_liner":"谷歌开源的实时激光 SLAM 系统，支持 2D 和 3D 建图","explanation":"Cartographer 是谷歌在 2016 年开源的实时 SLAM（同时定位与建图）系统，配套论文是 Hess 等人的《Real-Time Loop Closure in 2D LIDAR SLAM》。它用激光雷达（可结合 IMU 和里程计）构建局部子图，通过扫描匹配定位，再用分支定界搜索做回环检测，消除长时间运行的累积漂移，支持 2D 和 3D。通过 cartographer_ros 可接入 ROS，曾是扫地机器人、服务机器人和 ROS 教学里最常用的激光建图方案之一。据社区反馈项目近年更新较少，ROS 2 用户也常改用 SLAM Toolbox。","example":"用装了 2D 激光雷达的 TurtleBot 在办公室走一圈，运行 Cartographer 生成占据栅格地图，供 Nav2 导航使用。","related":["激光SLAM","同时定位与建图","占据栅格地图","回环检测","2D激光雷达","ROS 常用 SLAM 建图包（GMapping / SLAM Toolbox / RTAB-Map）"]},{"id":"ros-2-navigation-stack","category":"software","sec":6,"tier":2,"sources":[{"title":"Nav2 Documentation","url":"https://docs.nav2.org/"},{"title":"ros-navigation/navigation2 - GitHub","url":"https://github.com/ros-navigation/navigation2"}],"as_of":"","related_ids":["navigation","costmap","adaptive-monte-carlo-localization","behavior-tree","global-planning-and-local-planning","robot-operating-system-2"],"name":"Nav2","alt":"ROS 2 Navigation Stack","abbr":"Nav2","aliases":["Navigation2","ROS 导航栈","move_base"],"one_liner":"ROS 2 官方导航框架，让移动机器人从 A 点自主走到 B 点。","explanation":"Nav2 是 ROS 2 的导航框架，接替 ROS 1 里以 move_base 为核心的 navigation 栈，由 Steve Macenski 等人主导维护。给定地图和目标点，它负责定位（常用 AMCL）、维护代价地图、全局路径规划（如 NavFn、Smac Planner）、局部轨迹跟踪（如 DWB、MPPI、Regulated Pure Pursuit），并用行为树编排整个流程，卡住时自动执行后退、旋转等恢复行为。各环节都是可替换插件。轮式底盘、四足机器人的室内导航大多以它为起点，搭配 SLAM 包先建图，再用 Nav2 跑点到点导航。","example":"在 RViz 里用「2D Goal Pose」点一个目标，Nav2 规划路径并驱动 TurtleBot 绕开障碍走过去。","related":["导航","代价地图","自适应蒙特卡洛定位","行为树","全局规划与局部规划","ROS 2"]},{"id":"behaviortree-cpp","category":"software","sec":6,"tier":3,"sources":[{"title":"BehaviorTree.CPP 官方文档","url":"https://www.behaviortree.dev/"},{"title":"BehaviorTree/BehaviorTree.CPP (GitHub)","url":"https://github.com/BehaviorTree/BehaviorTree.CPP"}],"as_of":"","related_ids":["behavior-tree","finite-state-machine","ros-2-navigation-stack","groot2","task-planning","robot-operating-system-2"],"name":"BehaviorTree.CPP（C++ 行为树库）","alt":"BehaviorTree.CPP","abbr":"BT.CPP","aliases":["BT.CPP","Groot 行为树编辑器"],"one_liner":"机器人领域最常用的 C++ 行为树库，用 XML 描述任务逻辑","explanation":"BehaviorTree.CPP 是一个开源的 C++ 行为树库，主要作者是 Davide Faconti。行为树是一种组织机器人任务逻辑的树状结构：叶子节点执行动作或检查条件，内部的顺序、选择、并行等控制节点决定先做什么、失败了换什么。相比有限状态机，行为树更容易拆分、复用和扩展。BT.CPP 让开发者用 C++ 写好各个动作节点，再用 XML 文件把它们拼成树，运行时加载执行，不改代码就能调整任务流程；配套的图形化编辑器 Groot / Groot2 可以拖拽编辑、实时监视树的运行状态。ROS 2 的导航框架 Nav2 就用它来编排导航行为。","example":"Nav2 默认的导航行为树：先计算路径，再跟随路径；中途失败时依次尝试清除代价地图、原地旋转、后退等恢复动作。","related":["行为树","有限状态机","Nav2","Groot2（行为树可视化编辑器，非英伟达 GR00T）","任务规划","ROS 2"]},{"id":"groot2","category":"software","sec":6,"tier":3,"sources":[{"title":"Groot2 - BehaviorTree.CPP 官方文档","url":"https://www.behaviortree.dev/groot/"},{"title":"BehaviorTree.CPP GitHub","url":"https://github.com/BehaviorTree/BehaviorTree.CPP"}],"as_of":"","related_ids":["behavior-tree","behaviortree-cpp","ros-2-navigation-stack","finite-state-machine","task-planning"],"name":"Groot2（行为树可视化编辑器，非英伟达 GR00T）","alt":"Groot2 (BehaviorTree.CPP IDE)","abbr":"","aliases":["Groot"],"one_liner":"给 BehaviorTree.CPP 配套的图形化行为树编辑和调试工具","explanation":"Groot2 是 BehaviorTree.CPP 作者团队做的桌面工具，上一代叫 Groot（开源）。行为树是把机器人任务写成「顺序、选择、条件、动作」节点组成的树，BehaviorTree.CPP 用 XML 文件描述这棵树。手写 XML 容易出错、也看不清执行到哪一步，Groot2 让你拖拽节点画树、导出 XML，并能连上正在运行的程序实时看每个节点是成功、失败还是运行中，还能回放日志。名字和英伟达人形模型 GR00T 很像，但两者毫无关系。ROS 2 导航栈 Nav2 的行为树也常用它查看和调试。","example":"在 Nav2 里用 Groot2 打开导航行为树 XML，看机器人卡住时是哪个恢复节点在反复失败。","related":["行为树","BehaviorTree.CPP","Nav2","有限状态机","任务规划"]},{"id":"autoware","category":"software","sec":6,"tier":3,"sources":[{"title":"Autoware Foundation","url":"https://autoware.org/"},{"title":"autowarefoundation/autoware (GitHub)","url":"https://github.com/autowarefoundation/autoware"}],"as_of":"","related_ids":["robot-operating-system-2","autonomous-driving","ros-2-navigation-stack","simultaneous-localization-and-mapping","carla","model-predictive-control"],"name":"Autoware（开源自动驾驶软件栈）","alt":"Autoware (open-source autonomous driving stack on ROS 2)","abbr":"","aliases":["Autoware Universe","Autoware Core"],"one_liner":"基于 ROS 2 的开源自动驾驶全栈软件，由 Autoware 基金会维护","explanation":"Autoware 是一套开源的自动驾驶软件栈，最早由日本名古屋大学加藤真平团队在 2015 年前后基于 ROS 1 发起（后以 Tier IV 公司为主要推动者），现由 Autoware 基金会维护，当前版本构建在 ROS 2 上。它把自动驾驶拆成定位、感知、规划、控制、地图、车辆接口等模块，每个模块是一组 ROS 2 节点，开发者可以替换其中任何一块。它的意义在于提供了一套可以直接跑起来的完整参考实现，高校和企业可以在其上做研究、开发小车和园区车。对具身智能方向来说，它是学习大型 ROS 2 系统如何组织、传感器如何融合、规划控制如何串起来的好样板。","example":"","related":["ROS 2","自动驾驶","Nav2","同步定位与建图","CARLA","模型预测控制"]},{"id":"px4-ardupilot","category":"software","sec":6,"tier":3,"sources":[{"title":"PX4 Autopilot 官网","url":"https://px4.io/"},{"title":"ArduPilot 官网","url":"https://ardupilot.org/"}],"as_of":"","related_ids":["unmanned-aerial-vehicle","aerial-vision-and-language-navigation","robot-operating-system-2","hardware-in-the-loop-software-in-the-loop-simulation","gazebo"],"name":"PX4 / ArduPilot","alt":"PX4 / ArduPilot (open-source flight control stacks)","abbr":"","aliases":["PX4","ArduPilot","开源飞控"],"one_liner":"两套主流开源飞控软件栈，用于无人机、固定翼和无人车船","explanation":"PX4 和 ArduPilot 是两大开源自动驾驶仪（飞控）软件。PX4 起源于苏黎世联邦理工学院，现由 Linux 基金会旗下的 Dronecode 基金会托管，采用 BSD 许可；ArduPilot 源自 Arduino 爱好者社区，采用 GPLv3 许可。两者都运行在飞控板上，负责姿态估计、姿态与位置控制、航点任务和失控保护，支持多旋翼、固定翼、垂直起降、地面车和船等载具，通过 MAVLink 协议与地面站或机载电脑通信，并提供软件在环仿真。做空中机器人或无人机导航研究时，通常用它们做底层控制，上层算法跑在机载电脑的 ROS 2 里。","example":"研究无人机视觉语言导航时，机载电脑上的策略输出速度指令，经 ROS 2 发给 PX4，由 PX4 完成底层姿态和电机控制。","related":["无人机（空中机器人）","空中视觉语言导航（无人机 VLN）","ROS 2","硬件在环 / 软件在环仿真","Gazebo"]},{"id":"fleet-management-system","category":"software","sec":6,"tier":3,"sources":[{"title":"Open-RMF 官网","url":"https://www.open-rmf.org/"},{"title":"open-rmf/rmf (GitHub)","url":"https://github.com/open-rmf/rmf"}],"as_of":"","related_ids":["multi-robot-collaboration","autonomous-mobile-robot","automated-guided-vehicle","multi-agent-path-finding","robot-operating-system-2","ros-2-navigation-stack"],"name":"多机调度系统","alt":"Fleet Management System (e.g. Open-RMF)","abbr":"FMS","aliases":["机器人调度系统","车队管理系统","Open-RMF"],"one_liner":"统一给一群机器人分任务、排路线、防冲突的上层管理软件","explanation":"多机调度系统管的是一群机器人：接收任务后决定派哪台去、规划各自路线、避免在走廊和路口相撞或死锁，并协调电梯、自动门、充电桩等设施。仓库 AGV/AMR（自动导引车 / 自主移动机器人）厂商通常各有私有调度系统，不同品牌混用时难以统一管理。Open-RMF（Robotics Middleware Framework）是 Open Robotics 主导的开源框架，基于 ROS 2，提供交通调度、任务分配、设施接口和各品牌机器人的适配层，让异构机器人在医院、楼宇等场景共同运行。它和单机导航（如 Nav2）是上下层关系。","example":"医院里送药机器人和清洁机器人来自不同厂商，用 Open-RMF 统一调度它们乘电梯、错开同一条走廊。","related":["多机器人协作","自主移动机器人","自动导引车","多智能体路径规划","ROS 2","Nav2"]},{"id":"ros-bag","category":"software","sec":7,"tier":2,"sources":[{"title":"ROS 2 Documentation: Recording and playing back data","url":"https://docs.ros.org/en/humble/Tutorials/Beginner-CLI-Tools/Recording-And-Playing-Back-Data/Recording-And-Playing-Back-Data.html"},{"title":"ros2/rosbag2 - GitHub","url":"https://github.com/ros2/rosbag2"}],"as_of":"","related_ids":["mcap","topic","trajectory-episode-replay","multi-sensor-time-synchronization-timestamp-alignment","lerobotdataset","foxglove-studio"],"name":"rosbag","alt":"ROS Bag","abbr":"","aliases":["ros2 bag","rosbag2","bag 包","bag 文件"],"one_liner":"ROS 的录包工具，把话题消息连同时间戳录下来，之后可回放。","explanation":"rosbag 是 ROS 自带的数据录制与回放工具。它订阅指定话题，把每条消息和时间戳写进文件；回放时按原来的时间顺序重新发布，下游节点感觉就像真机器人在运行。ROS 1 用 .bag 格式；ROS 2 对应 rosbag2（命令 ros2 bag），早期默认用 SQLite 存储，从 Iron 版本起默认改为 MCAP 格式。它用来复现 bug、离线调试算法、分享数据，也是很多机器人数据集的原始采集格式；做模仿学习时，常把 bag 里的图像和关节话题按时间对齐后转成 LeRobot、HDF5 等训练格式。","example":"ros2 bag record -a 录下所有话题，ros2 bag info 查看时长和消息数，ros2 bag play 回放。","related":["MCAP 格式","话题","轨迹回放","多传感器时间同步（时间戳对齐）","LeRobot 数据集格式","Foxglove"]},{"id":"ffmpeg","category":"software","sec":7,"tier":3,"sources":[{"title":"FFmpeg 官网","url":"https://ffmpeg.org/"},{"title":"LeRobot GitHub","url":"https://github.com/huggingface/lerobot"}],"as_of":"","related_ids":["lerobotdataset","data-cleaning","multi-sensor-time-synchronization-timestamp-alignment","demonstration-data"],"name":"FFmpeg（音视频编解码工具）","alt":"FFmpeg","abbr":"","aliases":[],"one_liner":"开源的音视频处理工具集，负责转码、剪切、抽帧和压缩","explanation":"FFmpeg 是一套开源的音视频处理工具和库，既有命令行程序 ffmpeg、ffprobe，也有 libavcodec 等编解码库，几乎支持所有常见的音视频格式。具身智能里，机器人数据集要存大量相机画面，逐帧存图片太占空间，常把画面编码成 MP4 等视频文件，训练时再解码回帧。LeRobot 数据集格式就把各路相机画面存成视频，编码和解码依赖 FFmpeg 或基于它的库。此外，抽帧做标注、对齐采样率、压缩演示视频也都会用到它。","example":"用 ffmpeg -i episode_0.mp4 -vf fps=10 frames/%05d.png 把一段 30 帧/秒的演示视频按 10 帧/秒抽成图片。","related":["LeRobot 数据集格式","数据清洗","多传感器时间同步（时间戳对齐）","演示数据"]},{"id":"rqt","category":"software","sec":7,"tier":3,"sources":[{"title":"ROS 2 Docs: Overview and usage of RQt","url":"https://docs.ros.org/en/jazzy/Concepts/Intermediate/About-RQt.html"},{"title":"ROS Wiki: rqt","url":"http://wiki.ros.org/rqt"}],"as_of":"","related_ids":["rviz-rviz2","plotjuggler","foxglove-studio","node","topic","qt"],"name":"rqt","alt":"rqt","abbr":"","aliases":["rqt_graph","rqt_plot","rqt_console","rqt_image_view"],"one_liner":"ROS 自带的插件式图形调试工具集","explanation":"rqt 是基于 Qt 的 ROS 图形界面框架，把各种调试小工具做成插件，可以在一个窗口里拼装，也可以单独启动。常用插件有：rqt_graph 画出节点和话题的连接关系，rqt_plot 实时画数值曲线，rqt_console 看日志，rqt_image_view 看相机画面，rqt_reconfigure 在线改参数，rqt_topic 看话题内容和频率。ROS 1 和 ROS 2 都有。它适合快速排查「数据发没发出来、谁连着谁」；三维可视化用 RViz，复杂的曲线分析常换成 PlotJuggler 或 Foxglove。","example":"节点收不到数据时运行 rqt_graph，发现订阅端的话题名多了个命名空间前缀，和发布端根本没连上。","related":["RViz","PlotJuggler","Foxglove","节点","话题","Qt"]},{"id":"plotjuggler","category":"software","sec":7,"tier":3,"sources":[{"title":"facontidavide/PlotJuggler (GitHub)","url":"https://github.com/facontidavide/PlotJuggler"},{"title":"PlotJuggler 官网","url":"https://plotjuggler.io/"}],"as_of":"","related_ids":["ros-bag","robot-operating-system-2","foxglove-studio","rerun","rviz-rviz2","topic"],"name":"PlotJuggler","alt":"PlotJuggler","abbr":"","aliases":[],"one_liner":"开源时间序列曲线查看工具，常用来看 ROS 话题和日志数据","explanation":"PlotJuggler 是 Davide Faconti 开发的开源桌面工具，基于 Qt，专门把时间序列画成曲线。它能读取 CSV、ROS/ROS 2 的 rosbag、PX4 的 ULog 等日志文件，也能通过插件实时订阅 ROS 话题、MQTT、ZeroMQ 等数据流。拖拽字段即可出图，支持多窗口联动缩放、自定义公式（例如对速度求导、算两路信号之差）。调机器人时最常用它看关节指令与实际位置是否跟得上、IMU 有没有噪声、控制频率是否稳定。","example":"调腿足机器人时，把期望关节角和编码器读数叠在同一张图上，一眼看出哪个关节跟踪滞后。","related":["rosbag","ROS 2","Foxglove","Rerun","RViz","话题"]},{"id":"foxglove-studio","category":"software","sec":7,"tier":3,"sources":[{"title":"Foxglove 官网","url":"https://foxglove.dev/"},{"title":"Foxglove Docs","url":"https://docs.foxglove.dev/"}],"as_of":"2024","related_ids":["rviz-rviz2","ros-bag","mcap","rerun","plotjuggler","robot-operating-system-2"],"name":"Foxglove","alt":"Foxglove Studio","abbr":"","aliases":["Foxglove Studio"],"one_liner":"看机器人数据的可视化工具，能回放 rosbag、画曲线、显示点云和图像","explanation":"Foxglove 是 Foxglove 公司开发的机器人数据可视化与调试工具，有网页版和桌面版。它能连接正在运行的 ROS 1 / ROS 2 系统，也能打开录好的 rosbag 和 MCAP 文件（MCAP 是 Foxglove 牵头推出的机器人日志格式），在一个界面里同时看相机画面、3D 点云、TF 坐标树、关节曲线和日志。相比 RViz，它不依赖本机装 ROS，布局可保存共享，适合团队一起回看数据。早期叫 Foxglove Studio 并开源，据报道 2024 年起改为闭源并统一称 Foxglove，免费版有使用限制；开源替代品有 Rerun、PlotJuggler。","example":"真机跑策略失败后，把录下的 MCAP 文件拖进 Foxglove，对照腕部相机画面和关节力矩曲线找出失败时刻。","related":["RViz","rosbag","MCAP 格式","Rerun","PlotJuggler","ROS 2"]},{"id":"rerun","category":"software","sec":7,"tier":2,"sources":[{"title":"Rerun documentation","url":"https://rerun.io/docs"},{"title":"rerun-io/rerun - GitHub","url":"https://github.com/rerun-io/rerun"}],"as_of":"","related_ids":["rviz-rviz2","foxglove-studio","plotjuggler","lerobot","viser"],"name":"Rerun","alt":"Rerun","abbr":"","aliases":["rerun.io","Rerun Viewer"],"one_liner":"开源的多模态时序数据可视化工具，看图像、点云、曲线同步回放。","explanation":"Rerun 是瑞典公司 Rerun 开发的开源可视化 SDK 和查看器，支持 Python、Rust、C++。开发者在代码里调用 rr.log 把图像、深度图、点云、三维位姿、标量曲线、文本等按时间戳记录下来，查看器会把它们放在同一条时间轴上，可以拖动、回放、对比。它不依赖 ROS，装一个 pip 包就能用，适合调试感知算法、检查数据集、看策略推理过程。Hugging Face 的 LeRobot 用它可视化数据集中的相机画面和关节轨迹，很多具身项目也用它代替 RViz 做快速调试。","example":"用 LeRobot 的数据集可视化脚本打开一条 episode，Rerun 里同时显示腕部相机画面和各关节角度曲线。","related":["RViz","Foxglove","PlotJuggler","LeRobot","Viser"]},{"id":"meshcat","category":"software","sec":7,"tier":3,"sources":[{"title":"meshcat GitHub","url":"https://github.com/meshcat-dev/meshcat"},{"title":"meshcat-python GitHub","url":"https://github.com/meshcat-dev/meshcat-python"}],"as_of":"","related_ids":["drake","pinocchio","viser",null,null],"name":"Meshcat","alt":"Meshcat","abbr":"","aliases":["meshcat-python"],"one_liner":"在浏览器里显示机器人和三维场景的轻量可视化工具。","explanation":"Meshcat 是 Robin Deits 在 MIT 读博期间开发的开源三维可视化工具，基于 WebGL（浏览器里的三维绘图接口）和 three.js。程序在后台通过 WebSocket 把网格、点云、坐标系和位姿发给一个网页，打开浏览器就能看到并旋转视角，不需要装桌面图形界面，适合远程服务器和 Jupyter。Drake 内置了 Meshcat，Pinocchio 等库也提供 Meshcat 接口，常用来检查逆运动学结果、回放轨迹或查看碰撞体。","example":"在 Jupyter 里用 Pinocchio 加载 URDF，调用 MeshcatVisualizer，在网页里看机械臂按关节角摆出的姿态。","related":["Drake","Pinocchio","Viser","RViz(RViz / RViz2)","统一机器人描述格式(Unified Robot Description Format)"]},{"id":"viser","category":"software","sec":7,"tier":3,"sources":[{"title":"Viser documentation","url":"https://viser.studio/"},{"title":"nerfstudio-project/viser GitHub","url":"https://github.com/nerfstudio-project/viser"}],"as_of":"","related_ids":["rerun","meshcat","nerfstudio-gsplat","pyroki","unified-robot-description-format","vuer"],"name":"Viser","alt":"Viser","abbr":"","aliases":["viser"],"one_liner":"在浏览器里显示 3D 场景和交互控件的 Python 可视化库。","explanation":"Viser 是 nerfstudio 团队（加州大学伯克利分校）开源的 Python 3D 可视化库。在 Python 里启动一个服务，它会在浏览器中打开一个 3D 视图，可以往里加点云、网格、相机视锥、坐标轴，也能加滑块、按钮等控件并在 Python 里接收回调。因为走网页，程序跑在远程 GPU 服务器上时，本地浏览器转发端口即可查看，不用装图形界面。它自带加载 URDF（机器人模型描述文件）的工具，nerfstudio 的查看器、PyRoki 等项目都用它做可视化和调试。","example":"在服务器上训练重建模型时，用 Viser 实时显示当前点云和机器人 URDF，并加一个滑块手动拖动关节角检查运动学是否正确。","related":["Rerun","Meshcat","Nerfstudio / gsplat（NeRF 与高斯泼溅开源工具库）","PyRoki","统一机器人描述格式","Vuer（网页 3D / XR 可视化与遥操作工具）"]},{"id":"vuer","category":"software","sec":7,"tier":3,"sources":[{"title":"vuer-ai/vuer GitHub","url":"https://github.com/vuer-ai/vuer"},{"title":"Vuer documentation","url":"https://docs.vuer.ai/"}],"as_of":"","related_ids":["open-television","vr-teleoperation","apple-vision-pro","unitree-xr-teleoperate","viser","web-real-time-communication"],"name":"Vuer（网页 3D / XR 可视化与遥操作工具）","alt":"Vuer","abbr":"","aliases":["vuer"],"one_liner":"用 Python 驱动、可在 VR 头显浏览器里运行的 3D 可视化框架。","explanation":"Vuer 是 Ge Yang（杨歌）开源的 Python 3D 可视化框架，基于网页技术，支持 WebXR（浏览器调用 VR/AR 设备的标准）。Python 端启动服务后，Apple Vision Pro、Meta Quest 等头显直接用浏览器打开页面即可进入 3D 场景，不需要开发原生 App。它能把画面推送到头显，同时把头部和手部关键点的位姿实时传回 Python。这正好是遥操作需要的双向通道，因此被 Open-TeleVision、宇树 xr_teleoperate 等项目用作 VR 遥操作的前端。","example":"Open-TeleVision 用 Vuer 在 Vision Pro 里显示机器人头部双目相机的画面，同时读取操作员手部关键点，重定向成人形机器人的手臂和灵巧手动作。","related":["Open-TeleVision","VR 遥操作","Apple Vision Pro","宇树 xr_teleoperate（XR 遥操作）","Viser","WebRTC 实时音视频传输"]},{"id":"qt","category":"software","sec":7,"tier":3,"sources":[{"title":"Qt 官网","url":"https://www.qt.io/"},{"title":"Qt Documentation","url":"https://doc.qt.io/"}],"as_of":"","related_ids":["host-computer","rviz-rviz2","rqt","plotjuggler","python-and-c-plus-plus"],"name":"Qt（上位机图形界面开发框架）","alt":"Qt","abbr":"","aliases":["PyQt","PySide"],"one_liner":"跨平台 C++ 图形界面框架，机器人上位机软件常用它做界面","explanation":"Qt 是一套跨平台的 C++ 应用开发框架，最初由挪威 Trolltech 公司于 1990 年代推出，现由 The Qt Company 维护，采用开源（GPL/LGPL）与商业双许可。它提供传统控件界面（Qt Widgets）和声明式界面（QML / Qt Quick），同一套代码可编译到 Windows、Linux、macOS 和嵌入式设备；Python 用户可通过 PyQt 或官方的 PySide 调用。机器人领域的上位机，比如调参面板、数据采集客户端、示教界面，经常用 Qt 写；ROS 的 RViz、rqt 和 PlotJuggler 也都基于 Qt。","example":"给自研机械臂写一个上位机：用 Qt 做界面，显示各关节角、电流曲线，并提供使能、回零、急停按钮。","related":["上位机","RViz","rqt","PlotJuggler","Python 与 C++（具身常用编程语言）"]},{"id":"pytorch","category":"software","sec":8,"tier":1,"sources":[{"title":"PyTorch official site","url":"https://pytorch.org/"},{"title":"PyTorch Foundation","url":"https://pytorch.org/foundation"}],"as_of":"","related_ids":["cuda","jax","lerobot","checkpoint","python-and-c-plus-plus","hugging-face-transformers"],"name":"PyTorch","alt":"PyTorch","abbr":"","aliases":["torch"],"one_liner":"目前最主流的深度学习框架，具身模型大多用它训练","explanation":"PyTorch 是由 Meta（原 Facebook）AI 研究团队开发的开源深度学习框架，现由 Linux 基金会旗下的 PyTorch 基金会托管。它以张量（多维数组）运算和自动求导为核心，写法接近普通 Python，调试方便，因此在学术界占主导。具身智能里的大多数模型，如扩散策略、ACT、OpenVLA、π0 的 PyTorch 版本、LeRobot 等都基于 PyTorch；它通过 CUDA 调用英伟达 GPU 加速。新人要掌握的核心是：张量操作、nn.Module 搭网络、DataLoader 读数据、优化器训练循环，以及保存和加载检查点。","example":"import torch 后用 model.to('cuda') 把网络放到 GPU 上训练，训练完用 torch.save 保存检查点。","related":["CUDA","JAX","LeRobot","检查点","Python 与 C++（具身常用编程语言）","Transformers 库"]},{"id":"jax","category":"software","sec":8,"tier":2,"sources":[{"title":"jax-ml/jax GitHub","url":"https://github.com/jax-ml/jax"},{"title":"Flax 文档","url":"https://flax.readthedocs.io/"}],"as_of":"","related_ids":["pytorch","tensorflow","mujoco-xla","brax","openpi","octo"],"name":"JAX","alt":"JAX","abbr":"","aliases":["Flax"],"one_liner":"谷歌的数值计算与深度学习框架，写法像 NumPy，能自动求导并编译加速。","explanation":"JAX 是谷歌开源的 Python 数值计算库，接口接近 NumPy，另外提供几个可组合的函数变换：grad 自动求导、jit 用 XLA 编译器把代码编译成高效的 GPU/TPU 程序、vmap 自动批量化。Flax 是建在 JAX 上的神经网络库，负责定义网络层和管理参数，二者常一起出现。具身领域里，JAX 在大规模并行仿真和谷歌系工作中用得多：MJX、Brax 用它把物理仿真放到 GPU 上跑，Octo 和 Physical Intelligence 的 openpi 最初也是 JAX 实现。和 PyTorch 比，它更偏函数式写法，入门门槛略高。","example":"openpi 仓库里的 π0 训练代码最早基于 JAX + Flax 编写。","related":["PyTorch","TensorFlow","MJX","Brax","openpi","Octo"]},{"id":"tensorflow","category":"software","sec":8,"tier":3,"sources":[{"title":"TensorFlow 官网","url":"https://www.tensorflow.org/"},{"title":"TensorFlow Datasets","url":"https://www.tensorflow.org/datasets"}],"as_of":"","related_ids":["pytorch","jax","tensorflow-datasets","rlds","tfrecord","open-x-embodiment"],"name":"TensorFlow","alt":"TensorFlow","abbr":"TF","aliases":[],"one_liner":"谷歌开源的深度学习框架，机器人数据集常用它的数据格式","explanation":"TensorFlow 是谷歌大脑团队 2015 年开源的深度学习框架，2.x 版本以 Keras 作为高层接口。如今学术界训练模型多转向 PyTorch 和 JAX，但它在机器人领域仍经常出现：谷歌的 RT-1 等工作基于它，Open X-Embodiment 等数据集用 RLDS 格式存成 TFRecord 文件，通过 TensorFlow Datasets（TFDS）读取；Octo、OpenVLA 的数据加载流程也依赖 tf.data。所以即便用 PyTorch 训练 VLA，通常也要装 TensorFlow 来读数据。","example":"用 tfds.builder 加载 Open X-Embodiment 里的 BridgeData V2 子集，再转成 PyTorch 张量喂给 OpenVLA 微调。","related":["PyTorch","JAX","TFDS（TensorFlow Datasets）","RLDS 格式","TFRecord 格式","Open X-Embodiment 数据集"]},{"id":"mindspore","category":"software","sec":8,"tier":3,"sources":[{"title":"昇思 MindSpore 官网","url":"https://www.mindspore.cn/"},{"title":"MindSpore GitHub","url":"https://github.com/mindspore-ai/mindspore"}],"as_of":"","related_ids":[null,"pytorch",null,null,null],"name":"昇思 MindSpore","alt":"MindSpore","abbr":"","aliases":["昇思","MindSpore"],"one_liner":"华为开源的深度学习框架，主要配合昇腾芯片使用。","explanation":"MindSpore（中文名昇思）是华为 2020 年开源的深度学习框架，定位与 PyTorch、TensorFlow 相同，用来定义网络、训练和推理。它支持 CPU、GPU，但主要针对华为昇腾 NPU 优化，底层通过昇腾 CANN（华为的芯片算子与编译软件栈）调用硬件。在国产算力环境里训练或部署模型时常会碰到它；具身方向若要在昇腾服务器或昇腾端侧芯片上跑 VLA 等模型，需要把 PyTorch 代码迁移到 MindSpore，或使用 PyTorch 的昇腾适配插件。","example":"","related":["昇腾 CANN(Compute Architecture for Neural Networks (Huawei Ascend))","PyTorch","华为(Huawei)","推理部署(Inference Deployment)","华为云 CloudRobo(Huawei Cloud CloudRobo Embodied AI Platform)"]},{"id":"nvidia-warp","category":"software","sec":8,"tier":3,"sources":[{"title":"NVIDIA/warp (GitHub)","url":"https://github.com/NVIDIA/warp"}],"as_of":"2025","related_ids":["newton-physics-engine","mujoco-warp","differentiable-simulation","cuda","gpu-accelerated-parallel-simulation","operator-kernel"],"name":"Warp","alt":"NVIDIA Warp","abbr":"","aliases":["NVIDIA Warp"],"one_liner":"英伟达的 Python 框架，把 Python 函数编译成 GPU 代码来写仿真","explanation":"Warp 是英伟达开源的 Python 框架，用来写高性能的仿真和图形计算代码。开发者用 Python 写函数并加上 @wp.kernel 标记，Warp 在运行时把它即时编译成 CUDA 或 CPU 代码并行执行，不必直接写 C++/CUDA。它还支持自动微分，写出来的仿真可以对输入求梯度，即可微仿真。Warp 内置了几何、碰撞、粒子等常用工具，并能和 PyTorch、JAX 交换数据。英伟达的 Newton 物理引擎和 MuJoCo Warp 都建立在它之上。","example":"用几十行 Warp 代码写一个布料仿真，在 GPU 上同时推进上千个并行环境，再把梯度传回 PyTorch 优化抓取轨迹。","related":["Newton 物理引擎","MuJoCo Warp","可微仿真","CUDA","GPU 并行仿真","算子"]},{"id":"taichi-programming-language-quadrants","category":"software","sec":8,"tier":3,"sources":[{"title":"taichi-dev/taichi (GitHub)","url":"https://github.com/taichi-dev/taichi"},{"title":"Genesis-Embodied-AI/Genesis (GitHub)","url":"https://github.com/Genesis-Embodied-AI/Genesis"}],"as_of":"2026-09","related_ids":["genesis","material-point-method","differentiable-simulation","nvidia-warp","gpu-accelerated-parallel-simulation"],"name":"Taichi（太极）/ Quadrants","alt":"Taichi Programming Language / Quadrants (Genesis fork)","abbr":"","aliases":["太极编程语言","Quadrants"],"one_liner":"嵌在 Python 里的高性能并行计算语言，Genesis 仿真器的底层","explanation":"Taichi 是嵌入 Python 的高性能并行编程语言，由胡渊鸣在 MIT 读博期间提出（SIGGRAPH Asia 2019）。用户用 Python 语法写计算核函数，Taichi 即时编译到 CUDA、Vulkan、Metal 或 CPU 上并行执行，特别适合写物质点法、流体、软体等物理仿真。Genesis 仿真器的物理计算建立在 Taichi 之上；据报道，Genesis 团队后来在 Taichi 基础上维护了自己的分支，命名为 Quadrants，以便继续改进和适配。对具身方向的同学，主要在读 Genesis 源码或写自定义仿真时接触到它。","example":"用 @ti.kernel 装饰一个 Python 函数，写一个百万粒子的物质点法仿真，直接在 GPU 上跑。","related":["Genesis","物质点法","可微仿真","Warp","GPU 并行仿真"]},{"id":"hugging-face-transformers","category":"software","sec":8,"tier":2,"sources":[{"title":"huggingface/transformers GitHub","url":"https://github.com/huggingface/transformers"},{"title":"Transformers 文档","url":"https://huggingface.co/docs/transformers/index"}],"as_of":"","related_ids":["hugging-face","transformer","vision-language-model","openvla","hugging-face-diffusers","hugging-face-mirror"],"name":"Transformers 库","alt":"Hugging Face Transformers","abbr":"","aliases":["transformers","🤗 Transformers"],"one_liner":"Hugging Face 的开源 Python 库，一行代码加载各种预训练模型。","explanation":"Transformers 是 Hugging Face 维护的开源库，收录了大量预训练模型的结构定义和加载代码，覆盖语言模型、视觉模型和视觉语言模型（VLM，能看图说话的模型）。它的核心接口是 AutoModel、AutoProcessor 和 from_pretrained：给一个模型名，就自动下载权重、配置和分词器（把文字切成 token 的工具）。具身方向里，很多 VLA 的骨干网络（PaliGemma、Qwen-VL、Llama 等）直接用它加载，OpenVLA 等模型也以 Transformers 兼容格式发布权重，所以它是读代码、做微调绕不开的基础库。","example":"OpenVLA 的官方示例用 AutoModelForVision2Seq.from_pretrained 加载 7B 权重，再调用 predict_action 输出机械臂动作。","related":["Hugging Face","Transformer","视觉语言模型","OpenVLA","Diffusers 库","HF 镜像站"]},{"id":"hugging-face-diffusers","category":"software","sec":8,"tier":3,"sources":[{"title":"Diffusers 官方文档","url":"https://huggingface.co/docs/diffusers/index"},{"title":"Diffusion Policy GitHub","url":"https://github.com/real-stanford/diffusion_policy"}],"as_of":"","related_ids":["diffusion-model","diffusion-policy","denoising-diffusion-probabilistic-model","denoising-diffusion-implicit-model","noise-schedule","hugging-face"],"name":"Diffusers 库","alt":"Hugging Face Diffusers","abbr":"","aliases":["diffusers"],"one_liner":"Hugging Face 开源的扩散模型工具库，含现成调度器、网络和生成流水线","explanation":"Diffusers 是 Hugging Face 开源的扩散模型库，基于 PyTorch。它把扩散模型拆成三块：调度器（scheduler，决定加噪和去噪的步骤，如 DDPM、DDIM）、模型（如 U-Net、扩散 Transformer）和把两者串起来的推理流水线（pipeline），可以直接加载很多公开的图像、视频生成模型。机器人领域常只借用它的调度器：扩散策略把「对图像去噪」换成「对动作序列去噪」，采样步骤与图像扩散一样，就不必自己重写。做世界模型、视频生成时也常用它加载预训练视频模型再微调。","example":"扩散策略（Diffusion Policy）官方代码直接调用 Diffusers 里的 DDPMScheduler 和 DDIMScheduler 来训练和采样动作。","related":["扩散模型","扩散策略","去噪扩散概率模型","去噪扩散隐式模型","噪声调度","Hugging Face"]},{"id":"safetensors","category":"software","sec":8,"tier":2,"sources":[{"title":"huggingface/safetensors (GitHub)","url":"https://github.com/huggingface/safetensors"},{"title":"Safetensors 文档","url":"https://huggingface.co/docs/safetensors"}],"as_of":"","related_ids":["checkpoint","pytorch","hugging-face","hugging-face-transformers","open-weight-model"],"name":"safetensors 权重格式","alt":"safetensors","abbr":"","aliases":[".safetensors"],"one_liner":"Hugging Face 推出的安全、加载快的模型权重文件格式","explanation":"safetensors 是 Hugging Face 开发并开源的张量存储格式，文件由一段 JSON 头（记录每个张量的名字、形状、数据类型和偏移）加连续的原始数据组成。它要解决的是 PyTorch 常用的 .pt/.bin 基于 pickle，加载时可能执行任意代码的安全问题；同时支持内存映射和按需读取单个张量，加载大模型更快。现在 Hugging Face 上的大多数开放权重，包括很多 VLA 模型检查点，都以 .safetensors 发布，用 transformers、LeRobot 等库可直接读取。","example":"下载一个 VLA 模型时看到 model.safetensors 文件，用 safetensors.torch.load_file 即可读出参数字典，无需担心文件里藏有恶意代码。","related":["检查点","PyTorch","Hugging Face","Transformers 库","开放权重"]},{"id":"open-weight-model","category":"software","sec":8,"tier":2,"sources":[{"title":"The Open Source AI Definition - Open Source Initiative","url":"https://opensource.org/ai/open-source-ai-definition"}],"as_of":"","related_ids":["open-source-license","openpi","pre-training","fine-tuning","llama","openvla"],"name":"开放权重","alt":"Open-weight Model","abbr":"","aliases":["权重开放","开源权重"],"one_liner":"公开了训练好的模型参数、可下载使用的模型，但不一定公开训练数据和代码","explanation":"开放权重模型指开发者公开发布训练好的参数文件，任何人都能下载、本地推理和微调。它和严格意义的「开源」不同：开放源代码促进会（OSI）的开源 AI 定义还要求提供训练数据信息和完整训练代码，而很多开放权重模型只给权重和推理代码，且许可证可能限制商用或用户规模。对具身研究者，开放权重意味着可以在自己的机器人数据上微调现成的 VLA，而不必从零预训练，这是近两年开源生态快速发展的基础。","example":"Physical Intelligence 通过 openpi 公开了 π0 的权重，研究者可以下载后在自家机械臂数据上微调。","related":["开源许可证","openpi","预训练","微调","Llama","OpenVLA"]},{"id":"open-source-license","category":"software","sec":8,"tier":2,"sources":[{"title":"Licenses - Open Source Initiative","url":"https://opensource.org/licenses"},{"title":"Choose an open source license","url":"https://choosealicense.com/"}],"as_of":"","related_ids":["open-weight-model","github","openpi","lerobot","open-source-hardware"],"name":"开源许可证","alt":"Open-Source License (Apache 2.0 / MIT / Non-commercial)","abbr":"","aliases":["开源协议","License"],"one_liner":"规定别人能否以及如何使用、修改、商用你公开的代码或模型的法律条款","explanation":"开源许可证是附在代码或模型上的授权条款，决定使用者能做什么、要履行什么义务。MIT 最宽松，保留版权声明即可随意使用和商用；Apache 2.0 同样允许商用，还明确包含专利授权并要求注明修改；GPL 要求衍生作品同样开源；而 CC BY-NC 或各家自定义的「非商业」许可只允许研究用途。具身智能里很多模型代码是 Apache 2.0，但权重或数据集可能另有限制，拿来做产品前要把代码、权重、数据三者的许可证分别看清。","example":"openpi 仓库代码按 Apache 2.0 发布，而部分数据集只允许非商业研究使用。","related":["开放权重","GitHub（代码托管平台）","openpi","LeRobot","开源硬件"]},{"id":"hugging-face-mirror","category":"software","sec":8,"tier":2,"sources":[{"title":"HF-Mirror","url":"https://hf-mirror.com/"},{"title":"Hugging Face Hub 环境变量文档（HF_ENDPOINT）","url":"https://huggingface.co/docs/huggingface_hub/package_reference/environment_variables"}],"as_of":"","related_ids":["hugging-face","hugging-face-transformers","modelscope","package-mirror-sources-in-china","lerobot","autodl"],"name":"HF 镜像站","alt":"Hugging Face Mirror (hf-mirror.com)","abbr":"","aliases":["hf-mirror","HF_ENDPOINT"],"one_liner":"国内访问 Hugging Face 模型和数据集的非官方镜像网站。","explanation":"hf-mirror.com 是社区维护的 Hugging Face 镜像，不是 Hugging Face 官方服务。国内直连 huggingface.co 经常下载失败或极慢，而 VLA、视觉编码器、LeRobot 数据集几乎都放在 Hugging Face 上，所以它成了国内复现论文的常用入口。用法很简单：设置环境变量 HF_ENDPOINT 指向镜像地址，transformers、huggingface-cli、LeRobot 等工具的下载请求就会自动走镜像。需要登录的受限模型（gated model）仍要先在官网申请权限并带上 token。","example":"export HF_ENDPOINT=https://hf-mirror.com 之后，再用 huggingface-cli download 下载 openvla/openvla-7b 权重。","related":["Hugging Face","Transformers 库","魔搭社区","国内镜像源（换源：清华 TUNA / 阿里云等）","LeRobot","AutoDL（GPU 算力租用平台）"]},{"id":"modelscope","category":"software","sec":8,"tier":2,"sources":[{"title":"ModelScope 魔搭社区","url":"https://modelscope.cn/"},{"title":"modelscope/modelscope GitHub","url":"https://github.com/modelscope/modelscope"}],"as_of":"","related_ids":["hugging-face","hugging-face-mirror","qwen-vl","llama-factory-ms-swift","hugging-face-transformers"],"name":"魔搭社区","alt":"ModelScope","abbr":"","aliases":["ModelScope","魔搭"],"one_liner":"阿里推出的国内开源模型与数据集社区，类似中文版 Hugging Face。","explanation":"魔搭社区（ModelScope）是阿里巴巴于 2022 年推出的开源模型平台，托管模型权重、数据集和在线演示，国内网络访问稳定，通义千问（Qwen）系列等国产模型通常在这里和 Hugging Face 同步发布。它提供 modelscope Python 库和命令行工具，可以直接下载模型，也配套了 ms-swift 等微调框架。对国内做具身的同学来说，下载 VLM 骨干或部分机器人数据集时，它和 HF 镜像站是两条常用路径。","example":"modelscope download --model Qwen/Qwen2.5-VL-7B-Instruct 在国内网络下拉取 Qwen2.5-VL 权重，作为 VLA 的视觉语言骨干。","related":["Hugging Face","HF 镜像站","通义千问 Qwen-VL","LLaMA-Factory / ms-swift（大模型与 VLM 微调框架）","Transformers 库"]},{"id":"llama-factory-ms-swift","category":"software","sec":8,"tier":3,"sources":[{"title":"LLaMA-Factory GitHub","url":"https://github.com/hiyouga/LLaMA-Factory"},{"title":"ms-swift GitHub","url":"https://github.com/modelscope/ms-swift"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"LLaMA-Factory / ms-swift（大模型与 VLM 微调框架）","alt":"LLaMA-Factory / ms-swift (ModelScope SWIFT)","abbr":"","aliases":["LlamaFactory","SWIFT","ms-swift"],"one_liner":"两个常用的开源大模型微调框架，改配置就能微调 LLM 和 VLM。","explanation":"LLaMA-Factory 是开发者 hiyouga（郑耀威等）维护的开源微调框架，论文发表于 ACL 2024 系统演示；ms-swift 是阿里魔搭（ModelScope）团队的对应框架。两者都把全参数微调、LoRA/QLoRA 这类参数高效微调、DPO、GRPO 等偏好对齐和强化学习方法封装成配置文件或命令行，支持 Qwen-VL、InternVL 等多模态模型。具身方向常用它们给 VLM 做监督微调，比如训练具身推理、空间问答或任务规划模型，再作为 VLA 的骨干或高层规划器。","example":"用 LLaMA-Factory 写一个 YAML，拿自己标注的机器人场景问答数据对 Qwen2.5-VL 做 LoRA 微调。","related":["微调(Fine-tuning)","低秩适配(Low-Rank Adaptation)","监督微调(Supervised Fine-Tuning)","通义千问 Qwen-VL(Qwen-VL series (Qwen2.5-VL / Qwen3-VL))","魔搭社区(ModelScope)","Transformers 库(Hugging Face Transformers)"]},{"id":"lerobot","category":"software","sec":8,"tier":1,"sources":[{"title":"huggingface/lerobot (GitHub)","url":"https://github.com/huggingface/lerobot"},{"title":"LeRobot documentation","url":"https://huggingface.co/docs/lerobot/index"}],"as_of":"","related_ids":["hugging-face","lerobotdataset","so-100-so-101-arm","smolvla","action-chunking-with-transformers","imitation-learning"],"name":"LeRobot","alt":"LeRobot (Hugging Face)","abbr":"","aliases":["lerobot"],"one_liner":"Hugging Face 开源的机器人学习工具库，覆盖采数据、训练、部署全流程","explanation":"LeRobot 是 Hugging Face 于 2024 年开源的 PyTorch 机器人学习库，目标是降低真实机器人学习的门槛。它提供统一的数据集格式（LeRobotDataset，数据托管在 Hugging Face Hub），内置 ACT、扩散策略、π0、SmolVLA 等策略的实现，还带有遥操作采集、训练、评测和上真机运行的脚本。它和低成本开源机械臂 SO-100/SO-101 等硬件配套，学生用几百到上千元的硬件就能走完「采集演示数据→模仿学习训练→真机部署」一整套流程，因此成了入门具身智能最常用的起点之一。","example":"用两台 SO-101 机械臂做主从遥操作录制几十条抓取演示，再用 LeRobot 训练一个 ACT 策略并在真机上运行。","related":["Hugging Face","LeRobot 数据集格式","SO-100 / SO-101 机械臂","SmolVLA","ACT","模仿学习"]},{"id":"lerobot-envhub","category":"software","sec":8,"tier":3,"sources":[{"title":"LeRobot 文档 EnvHub","url":"https://huggingface.co/docs/lerobot/envhub"},{"title":"huggingface/lerobot (GitHub)","url":"https://github.com/huggingface/lerobot"}],"as_of":"2026-09","related_ids":[null,"hugging-face",null,null,null],"name":"EnvHub","alt":"LeRobot EnvHub","abbr":"","aliases":["LeRobot EnvHub"],"one_liner":"LeRobot 的仿真环境共享机制，把环境代码放上 Hugging Face Hub 一行加载。","explanation":"EnvHub 是 Hugging Face 在 LeRobot 框架里提供的仿真环境共享功能。以往想用别人的仿真任务，需要克隆仓库、装依赖、按对方的接口改代码；EnvHub 让作者把环境代码作为一个 Hub 仓库发布，使用者在 LeRobot 中按仓库名加载，即可得到符合 Gymnasium 接口（reset/step）的环境，用于训练或评测策略。由于加载时会执行仓库里的代码，需要显式允许运行远程代码，因此只应加载可信来源。它与 LeRobot 数据集、模型托管在同一个 Hub 上，方便把数据、策略和评测环境放在一起共享。","example":"","related":["LeRobot(LeRobot (Hugging Face))","Hugging Face","Gymnasium(Gymnasium (formerly OpenAI Gym))","仿真评测(Simulation-based Evaluation)","LeRobot 数据集格式(LeRobotDataset)"]},{"id":"openpi","category":"software","sec":8,"tier":2,"sources":[{"title":"Physical-Intelligence/openpi - GitHub","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"2025-09","related_ids":["pi0","pi0-fast","pi0-5","physical-intelligence","lerobot","open-weight-model"],"name":"openpi","alt":"openpi (Physical Intelligence)","abbr":"","aliases":[],"one_liner":"Physical Intelligence 开源的 π 系列 VLA 模型代码与权重仓库","explanation":"openpi 是 Physical Intelligence 在 GitHub 上开源的代码库，于 2025 年发布，提供 π0、π0-FAST 以及后来加入的 π0.5 等模型的预训练权重、推理与微调代码，代码按 Apache 2.0 许可发布。仓库还给出 DROID、ALOHA、LIBERO 等平台上的微调示例，以及把策略作为远程服务调用的推理服务器。它让没有大规模机器人数据的团队也能在自家数据上微调现成的 VLA，是目前学界和创业公司最常用的 VLA 起点之一。","example":"把自己采集的 LeRobot 格式数据接入 openpi，微调 π0.5 基座模型，再用它的策略服务器驱动真机。","related":["π0","π0-FAST","π0.5","Physical Intelligence","LeRobot","开放权重"]},{"id":"dexbotic","category":"software","sec":8,"tier":3,"sources":[{"title":"Dexbotic GitHub","url":"https://github.com/Dexmal/dexbotic"}],"as_of":"2026-09","related_ids":["dexmal","vision-language-action-model","lerobot","openpi","starvla","fine-tuning"],"name":"Dexbotic","alt":"Dexbotic (Dexmal VLA toolbox)","abbr":"","aliases":[],"one_liner":"原力灵机开源的 VLA 训练与部署工具箱，把多种主流 VLA 放进同一套代码","explanation":"Dexbotic 是原力灵机（Dexmal）开源的一个基于 PyTorch 的 VLA（视觉-语言-动作模型）工具箱。不同论文的 VLA 各有各的代码仓库、数据格式和训练脚本，复现和对比很费事；Dexbotic 把若干主流 VLA 方法整合进统一框架，提供统一的数据接口、预训练权重、训练与评测流程，方便研究者换模型做实验，或在自己的机器人数据上微调后部署。它和 LeRobot、openpi、starVLA 属于同一类「VLA 代码底座」，具体支持哪些模型以官方仓库为准。","example":"在 Dexbotic 里把自己采集的双臂数据转成它的数据格式，选一个内置的 VLA 配置做微调，再用仓库提供的推理脚本部署到真机。","related":["原力灵机","视觉-语言-动作模型","LeRobot","openpi","starVLA","微调"]},{"id":"starvla","category":"software","sec":8,"tier":3,"sources":[{"title":"starVLA/starVLA (GitHub)","url":"https://github.com/starVLA/starVLA"}],"as_of":"2026-09","related_ids":["vision-language-action-model","action-head","qwen-vl","libero-benchmark","dexbotic","openpi"],"name":"starVLA","alt":"StarVLA","abbr":"","aliases":["StarVLA"],"one_liner":"像搭积木一样组装和训练 VLA 模型的开源代码库","explanation":"starVLA 是一个开源的视觉-语言-动作模型（VLA）开发代码库，自称「乐高式」设计：把视觉语言模型骨干和不同类型的动作头拆成可替换模块，研究者可以在同一套代码里组合出自回归离散动作、连续回归、流匹配等不同方案，再在统一的训练和评测流程下对比。据其项目页介绍，它以 Qwen-VL 系列作为主要骨干，并接入 LIBERO、SimplerEnv 等常用基准。适合想快速复现和比较 VLA 设计选择的新手。","example":"保持 Qwen-VL 骨干不变，只把动作头从离散 token 换成流匹配头，在 LIBERO 上比较两者成功率。","related":["视觉-语言-动作模型","动作头","通义千问 Qwen-VL","LIBERO","Dexbotic","openpi"]},{"id":"gemini-robotics-sdk","category":"software","sec":8,"tier":3,"sources":[{"title":"Gemini Robotics On-Device brings AI to local robotic devices (Google DeepMind)","url":"https://deepmind.google/discover/blog/gemini-robotics-on-device-brings-ai-to-local-robotic-devices/"}],"as_of":"2025-06","related_ids":["gemini-robotics-on-device","gemini-robotics","software-development-kit","mujoco","fine-tuning","google-deepmind"],"name":"Gemini Robotics SDK","alt":"Gemini Robotics SDK","abbr":"","aliases":[],"one_liner":"谷歌 DeepMind 给开发者评测和微调 Gemini Robotics 模型的开发工具包","explanation":"Gemini Robotics SDK 是谷歌 DeepMind 随 Gemini Robotics On-Device（能在机器人本地运行的 VLA 模型）在 2025 年 6 月推出的软件开发工具包，最初通过可信测试者计划向部分开发者开放。它的用途是让开发者在自己的任务上评估模型、在 MuJoCo 物理仿真里测试，并用少量示教数据（官方提到约 50–100 条）把模型适配到新任务或新机器人上。这意味着 Gemini Robotics 从论文和演示走向可供外部团队二次开发，但访问权限仍受控，并非公开下载。","example":"","related":["Gemini Robotics On-Device","Gemini Robotics","软件开发工具包","MuJoCo","微调","谷歌 DeepMind"]},{"id":"gymnasium","category":"software","sec":8,"tier":2,"sources":[{"title":"Gymnasium documentation","url":"https://gymnasium.farama.org/"}],"as_of":"","related_ids":["environment","reinforcement-learning","termination-vs-truncation","stable-baselines3","gym-gymnasium-mujoco-tasks","mujoco"],"name":"Gymnasium","alt":"Gymnasium (formerly OpenAI Gym)","abbr":"Gym","aliases":["OpenAI Gym","gym"],"one_liner":"强化学习环境的标准接口库，OpenAI Gym 的继任者","explanation":"Gymnasium 是 Farama 基金会维护的强化学习环境库，前身是 OpenAI 在 2016 年发布的 Gym，后者停止维护后由 Farama 接手并改名。它最重要的贡献是一套统一接口：env.reset() 开始一局并返回初始观测，env.step(action) 执行动作并返回新观测、奖励、terminated（任务自然结束）、truncated（因步数上限等被截断）和附加信息。它自带 CartPole、MuJoCo 连续控制等经典任务。大多数强化学习算法库都按这套接口写，很多机器人仿真环境也提供兼容接口，写好的算法可以换环境直接用。","example":"env = gymnasium.make(「HalfCheetah-v5」)，循环调用 env.step() 收集数据，再交给 Stable-Baselines3 的 PPO 训练。","related":["环境（Env）与 reset / step 接口","强化学习","终止与截断","Stable-Baselines3","Gym MuJoCo 连续控制任务","MuJoCo"]},{"id":"stable-baselines3","category":"software","sec":8,"tier":3,"sources":[{"title":"Stable-Baselines3 Docs","url":"https://stable-baselines3.readthedocs.io/"},{"title":"DLR-RM/stable-baselines3 (GitHub)","url":"https://github.com/DLR-RM/stable-baselines3"}],"as_of":"","related_ids":["reinforcement-learning","proximal-policy-optimization","soft-actor-critic","gymnasium","cleanrl","skrl"],"name":"Stable-Baselines3","alt":"Stable-Baselines3","abbr":"SB3","aliases":[],"one_liner":"基于 PyTorch 的经典强化学习算法库，接口简单、实现可靠","explanation":"Stable-Baselines3 是一个基于 PyTorch 的开源强化学习库，由德国宇航中心机器人所（DLR-RM）的 Antonin Raffin 等人维护，是 Stable Baselines（源自 OpenAI Baselines）的继任版本，相关论文 2021 年发表于 JMLR。它提供 PPO、SAC、TD3、DQN、A2C 等算法的可靠实现，几行代码就能在 Gymnasium 环境上训练，文档和测试完善，常被当作入门和对照基线。它主要面向单环境或少量并行环境，大规模 GPU 并行仿真训练时，人们更多用 rsl_rl、rl_games 等。","example":"model = PPO(「MlpPolicy」, env); model.learn(100000)，几行代码就能在 Gymnasium 的倒立摆任务上训出策略。","related":["强化学习","近端策略优化","软演员-评论家","Gymnasium","CleanRL","skrl"]},{"id":"cleanrl","category":"software","sec":8,"tier":3,"sources":[{"title":"vwxyzjn/cleanrl (GitHub)","url":"https://github.com/vwxyzjn/cleanrl"},{"title":"CleanRL (JMLR 2022)","url":"https://www.jmlr.org/papers/v23/21-1342.html"}],"as_of":"","related_ids":["reinforcement-learning","proximal-policy-optimization","stable-baselines3","gymnasium","rsl-rl","weights-and-biases"],"name":"CleanRL","alt":"CleanRL","abbr":"","aliases":[],"one_liner":"把每个深度强化学习算法写成单个文件的开源实现库，便于读懂和改","explanation":"CleanRL 是一个开源的深度强化学习算法库，主要作者是黄胜意（Shengyi Huang）等人，相关论文发表在 JMLR（2022）。它的特点是「单文件实现」：PPO、DQN、SAC、TD3、DDPG 等算法各自写在一个独立的 Python 文件里，从环境创建到网络、训练循环都在同一页，没有层层封装。好处是新手可以从头到尾读懂一个算法的全部细节，研究者也方便直接复制改动做实验；它还内置了用 Weights & Biases 和 TensorBoard 记录实验的功能。与 Stable-Baselines3 这类模块化库相比，它更适合学习和做研究原型，而不是当成通用工具包调用。","example":"运行 python cleanrl/ppo_continuous_action.py --env-id HalfCheetah-v4，就能在 MuJoCo 环境上训练 PPO 并在 TensorBoard 里看曲线。","related":["强化学习","近端策略优化","Stable-Baselines3","Gymnasium","rsl_rl","Weights & Biases"]},{"id":"rsl-rl","category":"software","sec":8,"tier":3,"sources":[{"title":"leggedrobotics/rsl_rl (GitHub)","url":"https://github.com/leggedrobotics/rsl_rl"}],"as_of":"","related_ids":["legged-gym","nvidia-isaac-lab","proximal-policy-optimization","massively-parallel-reinforcement-learning","eth-zurich-robotic-systems-lab","rl-games"],"name":"rsl_rl","alt":"RSL RL","abbr":"","aliases":["rsl-rl","rsl_rl_lib"],"one_liner":"ETH 机器人系统实验室开源、面向 GPU 并行仿真的强化学习库","explanation":"rsl_rl 是苏黎世联邦理工学院机器人系统实验室（RSL）开源的轻量 PyTorch 强化学习库，最早配合 legged_gym 在 Isaac Gym 里训练四足行走。核心是针对成千上万个并行环境优化的 PPO（近端策略优化）实现，采样和更新的数据都留在 GPU 上，省掉 CPU 来回拷贝。它现在是 Isaac Lab 自带支持的 RL 库之一，unitree_rl_gym 等足式、人形运控项目也在用；后续版本加入了循环网络策略、对称性增强、教师-学生蒸馏等功能。想复现一篇足式运控论文，基本绕不开它。","example":"在 Isaac Lab 里用 rsl_rl 的训练脚本训练宇树 Go2 的速度跟踪策略，几千个环境在 GPU 上并行采样，再交给 PPO 更新。","related":["legged_gym","Isaac Lab","近端策略优化","大规模并行强化学习","苏黎世联邦理工机器人系统实验室","rl_games"]},{"id":"rl-games","category":"software","sec":8,"tier":3,"sources":[{"title":"rl_games on GitHub","url":"https://github.com/Denys88/rl_games"}],"as_of":"","related_ids":["proximal-policy-optimization","massively-parallel-reinforcement-learning","nvidia-isaac-lab","isaac-gym","rsl-rl","skrl"],"name":"rl_games","alt":"rl_games","abbr":"","aliases":[],"one_liner":"为 GPU 大规模并行仿真优化的强化学习训练库，Isaac 系列常用","explanation":"rl_games 是 Denys Makoviichuk 等人开源的强化学习算法库，主要实现了 PPO（近端策略优化）和 SAC 等算法，特点是训练数据可以全程留在 GPU 上，适合配合 Isaac Gym 这类一次跑上千个并行环境的仿真器。英伟达的 IsaacGymEnvs 以它为默认训练后端，Isaac Lab 也把它列为可选的训练库之一，灵巧手、足式运动等不少论文的开源代码都基于它。和 rsl_rl 相比功能更多、配置项更复杂，通常用 YAML 文件写超参数。","example":"在 Isaac Lab 里运行 rl_games 的训练脚本，指定任务名，就能用 PPO 在数千个并行环境里训练机械手转方块。","related":["近端策略优化","大规模并行强化学习","Isaac Lab","Isaac Gym","rsl_rl","skrl"]},{"id":"skrl","category":"software","sec":8,"tier":3,"sources":[{"title":"skrl documentation","url":"https://skrl.readthedocs.io/"},{"title":"Toni-SM/skrl (GitHub)","url":"https://github.com/Toni-SM/skrl"}],"as_of":"","related_ids":["nvidia-isaac-lab","rsl-rl","rl-games","stable-baselines3","proximal-policy-optimization","gymnasium"],"name":"skrl","alt":"skrl","abbr":"","aliases":[],"one_liner":"模块化的 Python 强化学习库，可直接对接 Isaac Lab","explanation":"skrl 是一个开源的 Python 强化学习库，由 Antonio Serrano-Muñoz 发起，支持 PyTorch 和 JAX 两种后端。它把智能体、记忆（经验存储）、模型、训练器拆成独立模块，方便替换和改写；内置 PPO（近端策略优化）、SAC、TD3 等常见算法。它的特点是原生支持 Gymnasium 以及英伟达的 Isaac Gym、Isaac Lab 这类 GPU 并行环境，是 Isaac Lab 官方支持的几个强化学习库之一，和 rsl_rl、rl_games、Stable-Baselines3 并列可选。","example":"在 Isaac Lab 里训练四足行走时，把训练脚本的库参数从 rsl_rl 换成 skrl，用它的 PPO 实现跑同一个任务。","related":["Isaac Lab","rsl_rl","rl_games","Stable-Baselines3","近端策略优化","Gymnasium"]},{"id":"humanoidverse","category":"software","sec":8,"tier":3,"sources":[{"title":"LeCAR-Lab/HumanoidVerse GitHub","url":"https://github.com/LeCAR-Lab/HumanoidVerse"}],"as_of":"2025","related_ids":["asap","sim-to-sim-transfer","sim-to-real-transfer","isaac-gym","genesis","holosoma"],"name":"HumanoidVerse（多仿真器人形 sim2real 框架）","alt":"HumanoidVerse","abbr":"","aliases":[],"one_liner":"CMU LeCAR 实验室开源的多仿真器人形机器人学习框架","explanation":"HumanoidVerse 是卡内基梅隆大学 LeCAR 实验室（石冠亚组）开源的人形机器人学习框架。它把仿真器、任务和机器人三者解耦：同一个任务和训练代码可以切换 IsaacGym、Isaac Sim、Genesis 等不同仿真后端，也能换不同人形本体。这样做方便「仿真到仿真」验证（在一个仿真器训练、另一个里测试），提前发现过拟合某个物理引擎的问题，再迁移到真机。该组的 ASAP（对齐仿真与真实物理的敏捷全身技能）就基于它实现。","example":"用 HumanoidVerse 在 IsaacGym 里训练宇树 G1 的动作跟踪策略，再切到 Genesis 做 sim2sim 检查。","related":["ASAP","仿真到仿真迁移","仿真到现实迁移","Isaac Gym","Genesis","Holosoma（亚马逊人形 RL 训练部署框架）"]},{"id":"holosoma","category":"software","sec":8,"tier":3,"sources":[{"title":"amazon-far/holosoma GitHub","url":"https://github.com/amazon-far/holosoma"}],"as_of":"2025","related_ids":["amazon-frontier-ai-and-robotics","humanoidverse","rl-based-locomotion-control","sim-to-real-transfer","motion-tracking","unitree-g1"],"name":"Holosoma（亚马逊人形 RL 训练部署框架）","alt":"Holosoma (Amazon FAR humanoid RL framework)","abbr":"","aliases":[],"one_liner":"亚马逊 FAR 团队开源的人形机器人强化学习训练与部署框架","explanation":"Holosoma 是亚马逊前沿 AI 与机器人团队（Amazon FAR）在 GitHub 上开源的人形机器人框架。据其仓库介绍，它把「在仿真里用强化学习训练策略」和「把策略部署到真机」打通，覆盖速度指令行走和全身动作跟踪两类任务，可在多种仿真后端训练，并支持宇树 G1 等人形本体。人形 RL 项目常见的痛点是训练代码、仿真器和真机部署各写一套，换个机器人或仿真器就要重搭，这类框架的价值在于提供一条现成流水线。它和 HumanoidVerse、legged_gym 属于同一类工具。","example":"","related":["亚马逊前沿 AI 与机器人团队","HumanoidVerse","强化学习运控","仿真到现实迁移","运动跟踪","宇树 G1"]},{"id":"gr00t-wholebodycontrol","category":"software","sec":8,"tier":3,"sources":[{"title":"NVlabs/GR00T-WholeBodyControl (GitHub)","url":"https://github.com/NVlabs/GR00T-WholeBodyControl"}],"as_of":"2025-12","related_ids":["whole-body-control","decoupled-whole-body-control","nvidia-isaac-gr00t-n1","sonic","unitree-g1","nvidia-generalist-embodied-agent-research-lab"],"name":"GR00T 全身控制代码库","alt":"GR00T-WholeBodyControl","abbr":"GR00T WBC","aliases":["GR00T全身控制平台"],"one_liner":"英伟达开源的人形机器人全身控制器训练、评测与部署代码库","explanation":"GR00T-WholeBodyControl 是英伟达在 GitHub（NVlabs）开源的代码库，提供人形机器人全身控制器的模型权重，以及训练、评测和部署脚本。全身控制指协调腿、躯干和手臂一起动，让机器人边走边操作时保持平衡。据仓库说明，其中包含 GR00T N1.5、N1.6 在宇树 G1 上使用的解耦全身控制器（下肢用强化学习策略负责行走平衡，上肢用逆运动学跟踪手部目标），以及 SONIC 等基于大规模运动跟踪的控制器。它在 GR00T 体系里处在「小脑」一层：上层 VLA 给出目标，由它转成关节指令。","example":"GR00T N1.6 在宇树 G1 上输出行走速度和双手目标位姿，由该代码库里的解耦控制器转成全身关节指令。","related":["全身控制","解耦全身控制","GR00T N1 系列","SONIC","宇树 G1","英伟达 GEAR 实验室"]},{"id":"autodl","category":"software","sec":9,"tier":2,"sources":[{"title":"AutoDL 官网","url":"https://www.autodl.com/"},{"title":"AutoDL 帮助文档","url":"https://www.autodl.com/docs/"}],"as_of":"","related_ids":["secure-shell","docker","conda","package-mirror-sources-in-china","common-training-and-inference-gpus","hugging-face-mirror"],"name":"AutoDL（GPU 算力租用平台）","alt":"AutoDL GPU Cloud","abbr":"","aliases":["AutoDL 算力云"],"one_liner":"国内按小时租 GPU 服务器的云平台，学生跑实验常用","explanation":"AutoDL 是国内的 GPU 算力租用平台，用户在网页上选显卡型号和镜像，开一台带 GPU 的容器实例，按使用时长计费，通过 JupyterLab 或 SSH 登录使用。平台预置了 PyTorch、CUDA 等常用环境镜像，并提供数据盘、文件存储和面向学术网站的网络加速。没有实验室服务器、或者本地显卡不够时，很多同学用它来训练和微调模型、跑仿真。用完记得关机，否则会继续计费；数据要放在持久化的目录里，避免实例释放后丢失。","example":"租一张 RTX 4090，用官方 PyTorch 镜像开机，SSH 上去克隆 LeRobot 代码，微调一个 ACT 策略。","related":["SSH 远程登录","Docker","Conda","国内镜像源（换源：清华 TUNA / 阿里云等）","常用 GPU 型号（RTX 4090 / A100 / H100 / B200）","HF 镜像站"]},{"id":"tensorboard","category":"software","sec":9,"tier":2,"sources":[{"title":"TensorBoard 官方页面","url":"https://www.tensorflow.org/tensorboard"},{"title":"tensorflow/tensorboard (GitHub)","url":"https://github.com/tensorflow/tensorboard"}],"as_of":"","related_ids":["weights-and-biases","swanlab","loss-function","rsl-rl","tensorflow","pytorch"],"name":"TensorBoard","alt":"TensorBoard","abbr":"","aliases":["tensorboard"],"one_liner":"在浏览器里查看训练曲线、图像等日志的本地可视化工具","explanation":"TensorBoard 是 Google 随 TensorFlow 推出的开源训练可视化工具，但 PyTorch 也能通过 torch.utils.tensorboard 直接写日志。训练时程序把损失、奖励、学习率等标量以及图片、直方图写入日志目录，再运行 tensorboard --logdir 就能在浏览器里实时看曲线、对比多次实验。它完全本地运行、不需要账号，所以很多机器人强化学习框架（如 rsl_rl、Isaac Lab 的训练脚本）默认用它记录日志；需要云端协作和实验管理时，常换成 Weights & Biases 或 SwanLab。","example":"在 Isaac Lab 里训练四足行走策略时，打开 TensorBoard 观察平均奖励和回合长度曲线是否在上升，判断训练有没有收敛。","related":["Weights & Biases","SwanLab（国产训练实验追踪工具）","损失函数","rsl_rl","TensorFlow","PyTorch"]},{"id":"weights-and-biases","category":"software","sec":9,"tier":2,"sources":[{"title":"Weights & Biases 官网","url":"https://wandb.ai/site"},{"title":"W&B 文档","url":"https://docs.wandb.ai/"}],"as_of":"2025-05","related_ids":["tensorboard","swanlab","hyperparameter","checkpoint","lerobot"],"name":"Weights & Biases","alt":"Weights & Biases","abbr":"W&B","aliases":["wandb"],"one_liner":"在线记录和对比深度学习训练实验的云端平台","explanation":"Weights & Biases 是一家同名美国公司开发的机器学习实验管理平台，2025 年被云算力公司 CoreWeave 收购。在训练代码里加几行 wandb.init 和 wandb.log，损失曲线、超参数、GPU 占用、样例视频等就会实时上传到网页，可以随时在手机或浏览器上查看，也能把几十次实验放在一起对比、分享给合作者。具身智能的主流开源框架如 LeRobot、openpi 都内置了 wandb 日志。国内网络访问不稳时，常用本地的 TensorBoard 或国产的 SwanLab 代替。","example":"用 LeRobot 训练扩散策略时加上 --wandb.enable=true，就能在 wandb 网页上看到损失曲线和评估回合的视频。","related":["TensorBoard","SwanLab（国产训练实验追踪工具）","超参数","检查点","LeRobot"]},{"id":"swanlab","category":"software","sec":9,"tier":3,"sources":[{"title":"SwanHubX/SwanLab (GitHub)","url":"https://github.com/SwanHubX/SwanLab"}],"as_of":"","related_ids":["weights-and-biases","tensorboard","hyperparameter","llama-factory-ms-swift"],"name":"SwanLab（国产训练实验追踪工具）","alt":"SwanLab","abbr":"","aliases":["SwanLab"],"one_liner":"国产开源的训练实验记录与可视化工具，类似 W&B","explanation":"SwanLab 是国内团队开发的开源实验追踪工具，功能和 Weights & Biases 类似：训练时在代码里加几行，就能把损失曲线、超参数、图片、硬件占用等记录到网页面板，便于对比多次实验和团队共享。它提供云端版和可自行部署的版本，国内网络可直接访问，并与 PyTorch、Hugging Face Transformers、LLaMA-Factory 等常用框架有集成。在国内做模型训练、访问 W&B 不方便时是常见替代。","example":"在训练脚本里 swanlab.init 后每步调用 swanlab.log 记录 loss，在网页上对比三组学习率的曲线。","related":["Weights & Biases","TensorBoard","超参数","LLaMA-Factory / ms-swift（大模型与 VLM 微调框架）"]},{"id":"hydra","category":"software","sec":9,"tier":3,"sources":[{"title":"Hydra 官网","url":"https://hydra.cc/"},{"title":"facebookresearch/hydra (GitHub)","url":"https://github.com/facebookresearch/hydra"}],"as_of":"","related_ids":[null,null,null,"nvidia-isaac-lab","weights-and-biases"],"name":"Hydra 配置框架","alt":"Hydra (Meta configuration framework)","abbr":"","aliases":["facebookresearch/hydra"],"one_liner":"Meta 开源的 Python 配置管理框架，用 YAML 组合配置、命令行随时覆盖参数。","explanation":"Hydra 是 Meta（原 Facebook AI Research）开源的 Python 配置框架，底层用 OmegaConf 读写 YAML。它把一次实验的配置拆成多个可组合的小文件（模型、数据集、任务各一份），运行时按需拼装，并允许在命令行直接覆盖任意字段，还能用 multirun 一次扫一组超参数（超参数：训练前人为设定的值，如学习率）。机器人学习代码里参数多、实验多，Hydra 让「改一个参数重跑」不必改代码，并自动为每次运行建输出目录、保存当时的完整配置，便于复现。Diffusion Policy、Isaac Lab 等代码库都用它管理训练配置。","example":"在 Diffusion Policy 仓库里执行 python train.py --config-name=train_diffusion_unet_image_workspace task=pusht_image training.seed=42，就能在不改代码的情况下换任务、换随机种子。","related":["超参数(Hyperparameter)","随机种子与可复现性(Random Seed & Reproducibility)","扩散策略(Diffusion Policy)","Isaac Lab","Weights & Biases"]},{"id":"numerical-precision-formats","category":"software","sec":9,"tier":2,"sources":[{"title":"Wikipedia: bfloat16 floating-point format","url":"https://en.wikipedia.org/wiki/Bfloat16_floating-point_format"},{"title":"NVIDIA Transformer Engine: Using FP8","url":"https://docs.nvidia.com/deeplearning/transformer-engine/user-guide/examples/fp8_primer.html"}],"as_of":"","related_ids":["mixed-precision-training","post-training-quantization","quantization-aware-training","gpu-memory","on-device-edge-deployment","nvidia-tensorrt"],"name":"数值精度格式（FP32 / FP16 / BF16 / FP8 / INT8 / INT4）","alt":"Numerical Precision Formats (FP32 / FP16 / BF16 / FP8 / INT8 / INT4)","abbr":"","aliases":["FP32","FP16","BF16","FP8","INT8","INT4","半精度","单精度"],"one_liner":"模型参数和计算用多少位、什么格式存数字，决定显存、速度和精度。","explanation":"神经网络里的每个参数和中间结果都是数字，用多少位来存会直接影响显存、速度和精度。FP32 是 32 位单精度浮点，最稳但最占空间；FP16 半精度只有 16 位，数值范围小，训练时容易溢出，需要损失缩放；BF16 同样 16 位，但保留了和 FP32 一样的指数位，范围大、精度低，是现在大模型训练的默认选择；FP8 只有 8 位，需要 H100 这一代及以后的 GPU 支持；INT8、INT4 是整数格式，主要用于推理时的量化压缩。粗算显存：参数量乘每个数的字节数（FP32 为 4、BF16 为 2、INT8 为 1、INT4 为 0.5），所以 7B 模型用 BF16 存权重约需 14 GB，量化到 INT4 约 3.5 GB，这决定了 VLA 能否放进机载算力里跑。","example":"OpenVLA 这类 7B 模型用 BF16 加载约占 15 GB 显存，量化到 4 位后可以在显存更小的显卡上推理，但动作精度可能下降。","related":["混合精度训练","训练后量化","量化感知训练","GPU 显存","端侧部署","TensorRT"]},{"id":"distributed-data-parallel","category":"software","sec":9,"tier":3,"sources":[{"title":"PyTorch DDP 文档","url":"https://docs.pytorch.org/docs/stable/generated/torch.nn.parallel.DistributedDataParallel.html"}],"as_of":"","related_ids":["fully-sharded-data-parallel","deepspeed","distributed-training","batch-size","pytorch","gradient-accumulation"],"name":"分布式数据并行","alt":"Distributed Data Parallel","abbr":"DDP","aliases":["DistributedDataParallel"],"one_liner":"每张 GPU 存一份完整模型、各算一部分数据，再同步梯度的多卡训练方式","explanation":"分布式数据并行是最常用的多卡训练方法，PyTorch 中对应 torch.nn.parallel.DistributedDataParallel。做法是：每张 GPU（每个进程）都放一份完整的模型，把一个批次的数据切开分给各卡，各自前向和反向计算后，通过 all-reduce（所有卡把梯度求平均的一种集体通信）同步梯度，再各自更新参数，保证所有副本一致。它能让训练速度随卡数近似线性提升，但要求单卡放得下整个模型；模型太大时就要换成 FSDP 或 DeepSpeed ZeRO 这类把参数切分的方案。通常用 torchrun 启动。","example":"用 torchrun --nproc_per_node=8 train.py 在一台 8 卡机器上训练扩散策略，每卡批大小 32，等效总批大小 256。","related":["全分片数据并行","DeepSpeed","分布式训练（数据并行 / 模型并行）","批大小","PyTorch","梯度累积"]},{"id":"fully-sharded-data-parallel","category":"software","sec":9,"tier":3,"sources":[{"title":"PyTorch FSDP 文档","url":"https://pytorch.org/docs/stable/fsdp.html"},{"title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","url":"https://arxiv.org/abs/2304.11277"}],"as_of":"","related_ids":["distributed-data-parallel","deepspeed","distributed-training","pytorch","full-fine-tuning","mixed-precision-training"],"name":"全分片数据并行","alt":"Fully Sharded Data Parallel","abbr":"FSDP","aliases":["FSDP2","fully_shard"],"one_liner":"把模型参数、梯度和优化器状态切开分到多张卡上的数据并行训练方式","explanation":"FSDP 是 PyTorch 内置的分布式训练方案，思路来自微软 DeepSpeed 的 ZeRO-3。普通分布式数据并行（DDP）让每张 GPU 都存一整份模型参数、梯度和优化器状态，模型一大单卡就放不下。FSDP 把这三样切成片分给各卡，每层前向、反向计算前临时从其他卡收集完整参数，算完即释放，因此单卡显存只需容纳一部分，能训练远超单卡容量的模型，代价是更多卡间通信。几十亿参数的 VLA 和视频世界模型全参数微调常用 FSDP 或 DeepSpeed；新版 PyTorch 推荐按层包装的 FSDP2 接口。","example":"在 8 张 80GB GPU 上全参数微调一个约 30 亿参数的 VLA，用 DDP 显存不够，改用 FSDP 后可以跑起来。","related":["分布式数据并行","DeepSpeed","分布式训练（数据并行 / 模型并行）","PyTorch","全参数微调","混合精度训练"]},{"id":"deepspeed","category":"software","sec":9,"tier":3,"sources":[{"title":"DeepSpeed 官网","url":"https://www.deepspeed.ai/"},{"title":"DeepSpeed GitHub","url":"https://github.com/deepspeedai/DeepSpeed"}],"as_of":"","related_ids":["fully-sharded-data-parallel","distributed-data-parallel","mixed-precision-training","distributed-training","hugging-face-accelerate","pytorch"],"name":"DeepSpeed","alt":"DeepSpeed","abbr":"","aliases":[],"one_liner":"微软开源的大模型分布式训练加速库，以 ZeRO 显存优化出名","explanation":"DeepSpeed 是微软开源的深度学习训练与推理优化库，建立在 PyTorch 之上。它最有名的是 ZeRO（零冗余优化器）：把优化器状态、梯度甚至模型参数切分到多张 GPU 上，而不是每张卡都存一份完整副本，从而用有限显存训练更大的模型。此外还提供混合精度、梯度累积、CPU/NVMe 卸载、流水线并行等功能。训练参数量达数十亿的 VLA 或大语言模型时，单卡放不下，常用 DeepSpeed 或 PyTorch 自带的 FSDP 解决，两者思路相近。Hugging Face Accelerate 等框架也可以直接调用它。","example":"微调一个 7B 参数的 VLA 时，在训练脚本里打开 DeepSpeed ZeRO-2 或 ZeRO-3 配置，让 8 张卡分摊优化器状态和梯度。","related":["全分片数据并行","分布式数据并行","混合精度训练","分布式训练（数据并行 / 模型并行）","Accelerate 库","PyTorch"]},{"id":"hugging-face-accelerate","category":"software","sec":9,"tier":3,"sources":[{"title":"Accelerate 官方文档","url":"https://huggingface.co/docs/accelerate/index"}],"as_of":"","related_ids":["distributed-data-parallel","fully-sharded-data-parallel","deepspeed","mixed-precision-training","pytorch","hugging-face"],"name":"Accelerate 库","alt":"Hugging Face Accelerate","abbr":"","aliases":["accelerate"],"one_liner":"Hugging Face 的训练封装库，让同一份 PyTorch 代码轻松跑多卡","explanation":"Accelerate 是 Hugging Face 开源的 PyTorch 辅助库。写好的单卡训练脚本只需加几行（创建 Accelerator、用它包装模型、优化器和数据加载器），就能在单卡、多卡、多机、混合精度等环境下运行，并可切换到 DeepSpeed、FSDP（全分片数据并行）等分布式后端，不用自己写进程初始化和梯度同步。配套命令 `accelerate config` 生成配置，`accelerate launch` 启动训练。VLA 等大模型微调动辄需要多卡，很多开源机器人学习代码用它管理分布式训练。","example":"用 accelerate launch 在 8 张 GPU 上启动一个 VLA 微调脚本，并开启 bf16 混合精度。","related":["分布式数据并行","全分片数据并行","DeepSpeed","混合精度训练","PyTorch","Hugging Face"]},{"id":"slurm-workload-manager","category":"software","sec":9,"tier":3,"sources":[{"title":"Slurm Workload Manager - Documentation","url":"https://slurm.schedmd.com/documentation.html"}],"as_of":"","related_ids":["distributed-training","distributed-data-parallel","ray","docker","secure-shell"],"name":"Slurm 集群调度","alt":"Slurm Workload Manager","abbr":"","aliases":["Slurm","SLURM"],"one_liner":"GPU 集群上排队、分配显卡和提交训练任务的调度系统","explanation":"Slurm 是开源的 Linux 集群作业调度系统，最早出自美国劳伦斯利弗莫尔国家实验室，后由 SchedMD 公司主要维护，大量超算中心和高校、企业的 GPU 集群都用它。多人共用一批机器时，大家不直接登录某台机器跑程序，而是把任务提交给 Slurm，由它按资源和优先级排队、分配节点和显卡。常用命令有 sbatch（提交脚本）、srun（直接运行）、squeue（查看队列）、scancel（取消任务）。训练 VLA 这类大模型、做多机多卡分布式训练时基本绕不开它。","example":"写一个 train.sh，在开头声明需要 2 个节点、每节点 8 张 GPU，然后 sbatch train.sh 提交，用 squeue 看是否排上。","related":["分布式训练（数据并行 / 模型并行）","分布式数据并行","Ray 分布式框架","Docker","SSH 远程登录"]},{"id":"ray","category":"software","sec":9,"tier":3,"sources":[{"title":"Ray 官网","url":"https://www.ray.io/"},{"title":"Ray: A Distributed Framework for Emerging AI Applications (arXiv)","url":"https://arxiv.org/abs/1712.05889"}],"as_of":"","related_ids":["verl","distributed-training","actor-learner-architecture","slurm-workload-manager","massively-parallel-reinforcement-learning"],"name":"Ray 分布式框架","alt":"Ray","abbr":"","aliases":["Ray"],"one_liner":"把 Python 程序扩展到多机多卡运行的开源分布式计算框架","explanation":"Ray 起源于加州大学伯克利分校 RISELab，2018 年在 OSDI 发表论文，后由 Anyscale 公司主导开发，开源免费。它让普通 Python 函数和类只加一个装饰器，就能变成在集群上并行执行的任务（task）和有状态的执行体（actor），由 Ray 负责调度、传数据和容错。在此之上有 Ray Train（分布式训练）、Ray Tune（超参搜索）、RLlib（强化学习）、Ray Data、Ray Serve 等库。强化学习需要同时调度大量仿真环境、推理和训练进程，veRL 等大模型强化学习框架就用 Ray 编排这些组件。","example":"做 VLA 强化学习微调时，用 Ray actor 在多张 GPU 上分别跑仿真推演、策略推理和参数更新，由一个主进程统一调度。","related":["veRL","分布式训练（数据并行 / 模型并行）","Actor-Learner 分离架构","Slurm 集群调度","大规模并行强化学习"]},{"id":"verl","category":"software","sec":9,"tier":3,"sources":[{"title":"volcengine/verl GitHub","url":"https://github.com/volcengine/verl"},{"title":"HybridFlow: A Flexible and Efficient RLHF Framework (arXiv)","url":"https://arxiv.org/abs/2409.19256"}],"as_of":"","related_ids":["reinforcement-fine-tuning","group-relative-policy-optimization","proximal-policy-optimization","vllm","simplevla-rl","ray"],"name":"veRL","alt":"veRL (Volcano Engine Reinforcement Learning library)","abbr":"","aliases":["verl","HybridFlow"],"one_liner":"字节跳动开源的大模型强化学习训练框架，也被用于 VLA 的 RL。","explanation":"veRL 是字节跳动 Seed 团队（以火山引擎名义）开源的强化学习训练库，是论文 HybridFlow（EuroSys 2025）的开源实现。大模型做 RL 要反复执行两件事：用当前模型批量生成样本（rollout），再用这些样本更新参数，两边需要的并行方式不同。veRL 把生成交给 vLLM、SGLang 等推理引擎，训练交给 FSDP 或 Megatron，并负责两者之间的权重同步和调度，内置 PPO、GRPO 等算法。它原本面向语言模型，后来被具身领域借用来给 VLA 做在线强化学习微调。","example":"SimpleVLA-RL 基于 veRL 搭建，在 LIBERO 等仿真环境里并行 rollout，用任务成功与否作为奖励对 OpenVLA-OFT 做 GRPO 类强化学习。","related":["强化学习微调","组相对策略优化","近端策略优化","vLLM","SimpleVLA-RL","Ray 分布式框架"]},{"id":"rlinf","category":"software","sec":9,"tier":3,"sources":[{"title":"RLinf on GitHub","url":"https://github.com/RLinf/RLinf"}],"as_of":"2025-09","related_ids":["reinforcement-fine-tuning","vision-language-action-model","verl","simplevla-rl","maniskill","libero-benchmark"],"name":"RLinf","alt":"RLinf","abbr":"","aliases":[],"one_liner":"面向具身和智能体大模型的开源大规模强化学习训练框架","explanation":"RLinf 是 2025 年开源的强化学习基础设施，由清华大学等机构联合开发，目标是把大模型强化学习训练跑得又快又灵活。它把仿真、推理生成、训练等环节调度到同一批 GPU 上，按需切换或流水线并行，提高显卡利用率。在具身方向，它支持对 OpenVLA、OpenVLA-OFT、π0 等视觉-语言-动作模型在 ManiSkill、LIBERO 等仿真环境里做在线强化学习微调；也能用于大语言模型的推理类强化学习。适合想给 VLA 做强化学习后训练、又不想自己搭分布式系统的研究者。","example":"用 RLinf 提供的配置，在 ManiSkill 仿真里对 OpenVLA-OFT 做 PPO 或 GRPO 强化学习微调，提升抓取放置成功率。","related":["强化学习微调","视觉-语言-动作模型","veRL","SimpleVLA-RL","ManiSkill","LIBERO"]},{"id":"inference-deployment","category":"software","sec":10,"tier":1,"sources":[{"title":"NVIDIA TensorRT","url":"https://developer.nvidia.com/tensorrt"},{"title":"openpi (Physical Intelligence) - remote inference","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"","related_ids":["inference-latency","on-device-edge-deployment","policy-server","nvidia-tensorrt","post-training-quantization","inference"],"name":"推理部署","alt":"Inference Deployment","abbr":"","aliases":["模型部署","部署"],"one_liner":"把训练好的模型放到真实机器或服务器上跑起来、实时给出动作","explanation":"推理部署指把训练好的模型从训练环境搬到实际使用的硬件上运行，这里的「推理」指模型的前向计算，不是逻辑推理。在具身智能里，它意味着模型要接上相机、关节传感器等实时输入，按固定频率输出动作给控制器。难点在于延迟和算力：机器人本体上的主控（如 Jetson）算力有限，大模型往往需要量化、剪枝、用 TensorRT 等引擎加速，或者放在远端 GPU 服务器上、通过网络把动作发回机器人（策略服务器）。部署得好不好直接影响动作是否流畅、能否闭环纠错。","example":"把微调好的 π0 放在一台带 GPU 的工作站上跑策略服务器，机器人每隔一段时间发送图像和关节状态、取回一段动作。","related":["推理延迟","端侧部署","策略服务器","TensorRT","训练后量化","推理（前向计算）"]},{"id":"policy-server","category":"software","sec":10,"tier":2,"sources":[{"title":"Physical-Intelligence/openpi - GitHub","url":"https://github.com/Physical-Intelligence/openpi"},{"title":"LeRobot docs: Asynchronous Inference","url":"https://huggingface.co/docs/lerobot/async"}],"as_of":"","related_ids":["inference-deployment","asynchronous-inference","inference-latency","action-chunking","openpi","cloud-edge-device-collaboration"],"name":"策略服务器","alt":"Policy Server (Remote Inference)","abbr":"","aliases":["远程推理","server-client 部署","推理服务器"],"one_liner":"把模型放在 GPU 服务器上跑，机器人把观测发过去、拿回动作。","explanation":"策略服务器是一种部署方式：大模型策略（如 VLA）运行在带 GPU 的工作站或云端，机器人上的轻量客户端把相机图像、关节状态和指令通过网络发过去，服务器推理后返回一段动作，客户端再交给底层控制器执行。它解决的是机器人本体算力不够、装不下几十亿参数模型的问题，也方便多台机器人共用一套模型、换模型时不动机器人端代码。代价是网络延迟和抖动，所以常配合动作分块、异步推理，让机器人执行当前动作块的同时请求下一块。openpi 用 WebSocket 提供策略服务，LeRobot 也有基于 gRPC 的异步推理方案。","example":"在 4090 工作站上启动 openpi 的 serve_policy 脚本加载 π0，机械臂上的客户端每次发送观测、收回一段动作。","related":["推理部署","异步推理","推理延迟","动作分块","openpi","云边端协同"]},{"id":"on-device-edge-deployment","category":"software","sec":10,"tier":2,"sources":[{"title":"Edge computing - Wikipedia","url":"https://en.wikipedia.org/wiki/Edge_computing"}],"as_of":"","related_ids":["on-device-model","inference-latency","cloud-edge-device-collaboration","policy-server","post-training-quantization","nvidia-jetson"],"name":"端侧部署","alt":"On-Device / Edge Deployment","abbr":"","aliases":["边缘部署","本地部署","板端部署"],"one_liner":"把模型直接放在机器人自带的计算板上运行，而不是调用远程服务器","explanation":"端侧部署指模型推理在机器人本体或就近设备上完成，典型硬件是 Jetson、RK3588 等嵌入式板卡。与之相对的是把图像传到云端或实验室 GPU 服务器、算完再把动作传回来。端侧的好处是延迟低、不怕断网、数据不出设备；代价是算力、显存和功耗都受限，大模型往往要经过量化、剪枝、蒸馏，再用 TensorRT、RKNN 等工具编译后才能跑到足够帧率。实际系统常把两者结合：小脑运控在端侧，大模型推理放云端或边缘服务器，即云边端协同。","example":"Gemini Robotics On-Device 就是面向在机器人本地运行而优化的 VLA 版本。","related":["端侧模型","推理延迟","云边端协同","策略服务器","训练后量化","英伟达 Jetson"]},{"id":"cloud-edge-device-collaboration","category":"software","sec":10,"tier":3,"sources":[{"title":"Edge computing - Wikipedia","url":"https://en.wikipedia.org/wiki/Edge_computing"},{"title":"openpi (Physical Intelligence) - GitHub","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"","related_ids":["on-device-edge-deployment","policy-server","inference-latency","asynchronous-inference","on-device-model","onboard-compute-platform"],"name":"云边端协同","alt":"Cloud-Edge-Device Collaboration","abbr":"","aliases":["云端协同"],"one_liner":"把机器人的计算分到云、边缘和机身三层，各担一部分。","explanation":"一套把算力分层部署的做法：云端做训练和需要大显存的大模型推理，边缘服务器（放在厂区或楼里的本地机器）做低延迟的视觉与规划，机器人本体的主控只跑必须实时的控制环。这么分是因为具身大模型的算力需求和机身的功耗、散热、成本互相矛盾：全放机身跑不动，全放云端一旦网络抖动就失控。常见形态是策略服务器远程推理加本体端保底的运动控制，和端侧部署、推理延迟、异步推理这些词直接相关。","example":"π0 的开源实现 openpi 提供策略服务器与客户端：策略在带 GPU 的机器上推理，机器人端只发观测、收动作。","related":["端侧部署","策略服务器","推理延迟","异步推理","端侧模型","主控"]},{"id":"operator-kernel","category":"software","sec":10,"tier":3,"sources":[{"title":"PyTorch 文档：Custom C++ and CUDA Operators","url":"https://docs.pytorch.org/tutorials/advanced/cpp_custom_ops.html"}],"as_of":"","related_ids":["cuda","flashattention","nvidia-tensorrt","torch-compile","compute-architecture-for-neural-networks","cuda-graphs"],"name":"算子","alt":"Operator / Kernel","abbr":"","aliases":["kernel","核函数","CUDA kernel"],"one_liner":"神经网络里的基本计算单元，如矩阵乘、卷积、Softmax 及其硬件实现","explanation":"算子是深度学习框架中最小的计算操作，例如矩阵乘法、卷积、归一化、Softmax。一个模型的前向计算就是一张由算子连成的计算图。kernel（核函数）指某个算子在具体硬件上的实现代码，比如在 GPU 上运行的 CUDA kernel。模型推理快不快，很大程度取决于这些 kernel 写得好不好，以及能否把多个小算子「融合」成一个 kernel 以减少显存读写。TensorRT、torch.compile 做的主要就是算子融合和挑选最快的 kernel；国产芯片适配模型时说的「算子支持」，指该硬件是否有对应实现。","example":"FlashAttention 把注意力里的矩阵乘、Softmax、再乘值等多步融合进一个 CUDA kernel，显著减少显存访问，加快了长序列推理。","related":["CUDA","FlashAttention","TensorRT","torch.compile","昇腾 CANN","CUDA Graph"]},{"id":"cuda-deep-neural-network-library","category":"software","sec":10,"tier":3,"sources":[{"title":"NVIDIA cuDNN","url":"https://developer.nvidia.com/cudnn"},{"title":"NVIDIA cuDNN Documentation","url":"https://docs.nvidia.com/deeplearning/cudnn/"}],"as_of":"","related_ids":["cuda","pytorch","nvidia-tensorrt","operator-kernel","gpu-memory","mixed-precision-training"],"name":"cuDNN","alt":"CUDA Deep Neural Network Library","abbr":"cuDNN","aliases":["cuDNN"],"one_liner":"英伟达为深度学习常用算子做的 GPU 加速库。","explanation":"英伟达提供的深度学习原语加速库，把卷积、池化、归一化、注意力等常用算子（算子即神经网络里的基本计算单元）在各代 GPU 上做了高度优化的实现。PyTorch、TensorFlow 这些框架并不自己写这些底层 kernel，而是调 cuDNN，所以它装得对不对、版本与 CUDA 和驱动是否匹配，直接决定训练能不能跑、跑多快。它不是独立工具，而是随 CUDA 生态一起安装的库；实践中最常遇到的就是环境版本对齐问题，以及卷积算法自动选优导致头几个 batch 偏慢。","example":"PyTorch 里打开 torch.backends.cudnn.benchmark，让 cuDNN 为固定输入尺寸挑最快的卷积实现。","related":["CUDA","PyTorch","TensorRT","算子","GPU 显存","混合精度训练"]},{"id":"flashattention","category":"software","sec":10,"tier":3,"sources":[{"title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","url":"https://arxiv.org/abs/2205.14135"},{"title":"Dao-AILab/flash-attention (GitHub)","url":"https://github.com/Dao-AILab/flash-attention"}],"as_of":"","related_ids":["attention-mechanism","transformer","operator-kernel","cuda","inference-latency","mixed-precision-training"],"name":"FlashAttention","alt":"FlashAttention","abbr":"","aliases":["FlashAttention-2","FlashAttention-3"],"one_liner":"按 GPU 显存层级重排计算的注意力实现，结果不变但更快更省显存","explanation":"FlashAttention 由 Tri Dao 等人在 2022 年提出，是注意力机制的一种 GPU 实现，算出的结果和标准注意力完全一样（精确注意力，不是近似）。标准实现要把 N×N 的注意力矩阵写进显存再读回，序列一长，显存读写就成了瓶颈。FlashAttention 把 Q、K、V 切成小块放进 GPU 片上高速缓存里算完再写回，不再存完整注意力矩阵，显存占用随序列长度线性增长，速度也明显提升。之后又有 FlashAttention-2、针对 Hopper 架构的 FlashAttention-3。VLA、视频世界模型这类长序列模型训练和推理时普遍依赖它，PyTorch 的 scaled_dot_product_attention 也内置了类似后端。","example":"训练 VLA 时在 Hugging Face Transformers 里设置 attn_implementation=「flash_attention_2」，同样显存下可以用更大的批大小或更多图像 token。","related":["注意力机制","Transformer","算子","CUDA","推理延迟","混合精度训练"]},{"id":"torch-compile","category":"software","sec":10,"tier":3,"sources":[{"title":"torch.compile — PyTorch documentation","url":"https://pytorch.org/docs/stable/generated/torch.compile.html"},{"title":"PyTorch 2.x overview","url":"https://pytorch.org/get-started/pytorch-2-x/"}],"as_of":"","related_ids":["pytorch","inference-latency","cuda-graphs","operator-kernel","nvidia-tensorrt","inference-deployment"],"name":"torch.compile","alt":"torch.compile","abbr":"","aliases":["PyTorch 2 编译"],"one_liner":"PyTorch 2.0 起提供的一行式模型编译加速接口。","explanation":"torch.compile 是 PyTorch 2.0（2023 年）引入的编译功能。平时 PyTorch 是「逐个算子立即执行」，每一步都有 Python 调度开销，也无法跨算子优化。torch.compile 用 TorchDynamo 在运行时抓取 Python 代码里的计算图，再交给默认后端 TorchInductor 做算子融合、生成 Triton/C++ 内核（内核即在 GPU/CPU 上实际执行的底层函数）。用法通常只需把模型包一层，首次调用会花时间编译，之后训练和推理变快。在具身领域它常用来压低 VLA 等大模型的单步推理延迟，也可配合 CUDA Graph 减少内核启动开销。","example":"部署扩散策略时写 policy = torch.compile(policy, mode=「max-autotune」)，预热几次后每步去噪的耗时下降。","related":["PyTorch","推理延迟","CUDA Graph","算子","TensorRT","推理部署"]},{"id":"cuda-graphs","category":"software","sec":10,"tier":3,"sources":[{"title":"Getting Started with CUDA Graphs (NVIDIA Technical Blog)","url":"https://developer.nvidia.com/blog/cuda-graphs/"},{"title":"CUDA semantics - PyTorch Documentation","url":"https://pytorch.org/docs/stable/notes/cuda.html"}],"as_of":"","related_ids":["cuda","inference-latency","torch-compile","nvidia-tensorrt","operator-kernel","policy-inference-frequency"],"name":"CUDA Graph","alt":"CUDA Graphs","abbr":"","aliases":["CUDA 图"],"one_liner":"把一串 GPU 操作录成一张图，之后一次提交省启动开销。","explanation":"CUDA 的一种执行模型：先把一段计算里的 kernel 启动、内存拷贝及它们的依赖关系录制成一张图，之后每次只提交这张图，由驱动一次性调度。它解决的是 CPU 端的启动开销——模型里小算子很多时，每个 kernel 单独启动占用的 CPU 时间可能超过 GPU 实际算的时间，成了瓶颈。这对机器人策略推理尤其有用：视觉-语言-动作模型、扩散策略要在几十毫秒内反复跑结构固定的前向，张量形状不变，正好适合录图。PyTorch 通过图捕获和 torch.compile 的低开销模式暴露这个能力。","example":"把扩散动作头的多步去噪循环用 CUDA Graph 捕获，减少单帧推理里的 kernel 启动开销。","related":["CUDA","推理延迟","torch.compile","TensorRT","算子","策略推理频率"]},{"id":"torchscript-libtorch","category":"software","sec":10,"tier":3,"sources":[{"title":"TorchScript — PyTorch documentation","url":"https://pytorch.org/docs/stable/jit.html"},{"title":"Loading a TorchScript Model in C++","url":"https://pytorch.org/tutorials/advanced/cpp_export.html"}],"as_of":"","related_ids":["pytorch","open-neural-network-exchange","inference-deployment","legged-gym","on-device-edge-deployment","python-and-c-plus-plus"],"name":"TorchScript / LibTorch（策略导出与 C++ 部署）","alt":"TorchScript (torch.jit) / LibTorch","abbr":"","aliases":["torch.jit","JIT 导出","LibTorch"],"one_liner":"把 PyTorch 模型导出成脱离 Python 运行的文件，再用 C++ 加载推理。","explanation":"TorchScript 是 PyTorch 自带的模型序列化格式：用 torch.jit.trace（按一次示例输入记录运算）或 torch.jit.script（直接解析代码）把模型转成 .pt 文件，里面同时存结构和权重。LibTorch 是 PyTorch 的 C++ 发行版，可以在 C++ 程序里 torch::jit::load 这个文件做推理。机器人控制程序多用 C++ 写，且需要稳定的实时循环，这条路线让训练好的强化学习策略不依赖 Python 环境就能上机。PyTorch 官方已把 TorchScript 列为维护状态，新项目更推荐 torch.export、ONNX 等方案，但大量运控开源项目仍在用它。","example":"legged_gym 的 play 脚本可把训练好的行走策略导出为 JIT 格式的 policy.pt，部署代码在 C++ 控制循环里加载它，每个控制周期输入观测、输出关节目标。","related":["PyTorch","ONNX","推理部署","legged_gym","端侧部署","Python 与 C++（具身常用编程语言）"]},{"id":"open-neural-network-exchange","category":"software","sec":10,"tier":2,"sources":[{"title":"ONNX | Home","url":"https://onnx.ai/"}],"as_of":"","related_ids":["onnx-runtime","nvidia-tensorrt","intel-openvino","rockchip-rknn-toolkit","inference-deployment","pytorch"],"name":"ONNX","alt":"Open Neural Network Exchange","abbr":"ONNX","aliases":["开放神经网络交换格式"],"one_liner":"一种通用的神经网络模型文件格式，方便在不同框架和推理引擎之间转换","explanation":"ONNX 是一种开放的模型表示格式，2017 年由微软和 Facebook 发起，现由 Linux 基金会旗下的 LF AI & Data 托管。它把网络结构和权重存成统一的计算图，训练用 PyTorch、部署用 TensorRT、ONNX Runtime、OpenVINO 或 RKNN 时，常以 ONNX 作为中间桥梁。部署中最常见的坑是算子不支持或导出版本（opset）不匹配，需要改写模型或换算子。对新人来说，把它理解成模型界的「通用文件格式」就够了。","example":"用 torch.onnx.export 把训练好的行走策略导成 policy.onnx，再交给 ONNX Runtime 在机器人上推理。","related":["ONNX Runtime","TensorRT","OpenVINO","RKNN-Toolkit","推理部署","PyTorch"]},{"id":"onnx-runtime","category":"software","sec":10,"tier":3,"sources":[{"title":"ONNX Runtime 官网","url":"https://onnxruntime.ai/"},{"title":"microsoft/onnxruntime (GitHub)","url":"https://github.com/microsoft/onnxruntime"}],"as_of":"","related_ids":["open-neural-network-exchange","nvidia-tensorrt","intel-openvino","inference-deployment","on-device-edge-deployment","rl-based-locomotion-control"],"name":"ONNX Runtime","alt":"ONNX Runtime","abbr":"ORT","aliases":["onnxruntime"],"one_liner":"微软开源的跨平台推理引擎，用来运行 ONNX 格式的模型","explanation":"ONNX Runtime 是微软开源的模型推理引擎，负责执行 ONNX（一种通用的神经网络交换格式）文件。模型在 PyTorch 等框架里训好后导出成 ONNX，就能用 ONNX Runtime 在 Windows、Linux、手机和嵌入式设备上运行，不用装训练框架。它通过「执行提供器」接入不同硬件后端，如 CPU、CUDA、TensorRT、OpenVINO、CoreML，同一个模型换个参数就能用上对应硬件加速。在机器人领域，强化学习训出的运控策略常以 ONNX 形式部署，由 ONNX Runtime 在机载电脑上实时推理。","example":"把 Isaac Lab 里训练好的四足行走策略导出为 policy.onnx，在机器狗的机载 CPU 上用 ONNX Runtime 以 50 Hz 推理。","related":["ONNX","TensorRT","OpenVINO","推理部署","端侧部署","强化学习运控"]},{"id":"nvidia-tensorrt","category":"software","sec":10,"tier":2,"sources":[{"title":"NVIDIA TensorRT","url":"https://developer.nvidia.com/tensorrt"}],"as_of":"2025-09","related_ids":["open-neural-network-exchange","nvidia-tensorrt-llm","inference-latency","post-training-quantization","nvidia-jetpack-sdk","inference-deployment"],"name":"TensorRT","alt":"NVIDIA TensorRT","abbr":"TRT","aliases":["TRT"],"one_liner":"英伟达的推理加速库，把训练好的模型编译成在 GPU 上跑得更快的引擎","explanation":"TensorRT 是英伟达的深度学习推理优化器和运行时。它读入 ONNX 等格式的模型，做层融合、选择最快的 GPU 算子、降低数值精度（FP16、INT8、FP8 等），生成针对某块 GPU 的推理「引擎」文件。机器人策略要在几十毫秒内出动作，直接用 PyTorch 往往太慢，用 TensorRT 编译后延迟通常能明显下降，所以它是 Jetson 和服务器端部署的常用环节。注意引擎和 GPU 型号、TensorRT 版本绑定，换设备要重新编译；大语言模型另有专门的 TensorRT-LLM。","example":"把训练好的扩散策略导出成 ONNX，再用 trtexec 编译成 FP16 引擎，在 Jetson Orin 上降低单步推理延迟。","related":["ONNX","TensorRT-LLM","推理延迟","训练后量化","JetPack","推理部署"]},{"id":"nvidia-jetpack-sdk","category":"software","sec":10,"tier":2,"sources":[{"title":"NVIDIA JetPack SDK","url":"https://developer.nvidia.com/embedded/jetpack"}],"as_of":"2025-09","related_ids":["nvidia-jetson","nvidia-jetson-orin","nvidia-jetson-thor","nvidia-tensorrt","cuda","on-device-edge-deployment"],"name":"JetPack","alt":"NVIDIA JetPack SDK","abbr":"","aliases":["JetPack SDK"],"one_liner":"英伟达 Jetson 板卡的官方系统与开发套件","explanation":"JetPack 是英伟达为 Jetson 系列嵌入式计算平台提供的软件开发套件，包含 Jetson Linux（基于 Ubuntu 的操作系统和驱动，也叫 L4T）以及 CUDA、cuDNN、TensorRT 等加速库。给 Jetson 刷机本质上就是装某个版本的 JetPack，它决定了板子上能用哪一版 CUDA 和 TensorRT，进而决定模型能不能跑、跑多快。不同代硬件对应不同大版本，例如 Orin 常用 JetPack 6，Jetson Thor 配套 JetPack 7。部署前先核对 JetPack 版本与框架、模型的兼容性，是端侧部署最常见的第一步。","example":"在 Jetson Orin 上部署 VLA 前，先用 SDK Manager 刷好 JetPack 6，再装对应版本的 PyTorch 和 TensorRT。","related":["英伟达 Jetson","Jetson Orin","Jetson Thor","TensorRT","CUDA","端侧部署"]},{"id":"nvidia-tensorrt-edge-llm","category":"software","sec":10,"tier":3,"sources":[{"title":"NVIDIA/TensorRT-Edge-LLM (GitHub)","url":"https://github.com/NVIDIA/TensorRT-Edge-LLM"}],"as_of":"2026-01","related_ids":["nvidia-tensorrt","nvidia-tensorrt-llm","nvidia-jetson-thor","on-device-edge-deployment","on-device-model","post-training-quantization"],"name":"TensorRT Edge-LLM","alt":"NVIDIA TensorRT Edge-LLM","abbr":"","aliases":[],"one_liner":"英伟达面向车载和机器人芯片的大模型/多模态模型端侧推理框架","explanation":"TensorRT Edge-LLM 是英伟达开源的 C++ 推理框架，专门在嵌入式平台（如 Jetson Thor、DRIVE AGX Thor）上跑大语言模型和视觉语言模型。数据中心用的 TensorRT-LLM 依赖 Python 环境、面向多卡高吞吐，而车和机器人上更看重单请求延迟、内存占用和无 Python 的轻量部署，Edge-LLM 就是为这类场景裁剪的。据报道它支持 FP8/NVFP4 等低精度量化和投机解码。对具身智能来说，它是把 VLA 或 VLM 大脑放到机器人本体上运行的一种部署选项。","example":"把一个几十亿参数的 VLM 量化后，用 TensorRT Edge-LLM 部署到 Jetson Thor 上，让机器人本地完成场景理解和任务规划。","related":["TensorRT","TensorRT-LLM","Jetson Thor","端侧部署","端侧模型","训练后量化"]},{"id":"nvidia-tensorrt-llm","category":"software","sec":10,"tier":3,"sources":[{"title":"NVIDIA/TensorRT-LLM (GitHub)","url":"https://github.com/NVIDIA/TensorRT-LLM"}],"as_of":"2025","related_ids":["nvidia-tensorrt","vllm","key-value-cache","speculative-decoding","post-training-quantization","inference-deployment"],"name":"TensorRT-LLM","alt":"NVIDIA TensorRT-LLM","abbr":"","aliases":["TRT-LLM"],"one_liner":"英伟达开源的大语言模型推理加速库，让 LLM 在英伟达 GPU 上跑得更快","explanation":"TensorRT-LLM 是英伟达 2023 年开源的大语言模型推理库，基于 TensorRT 构建，提供 Python 接口。它把 LLM 推理里常用的优化打包好：KV 缓存（存下已算过的注意力键值，避免重复计算）分页管理、动态批处理、FP8/INT4 等量化、投机解码、多卡张量并行，以及为注意力等操作手写的高性能算子。用户只需加载 Hugging Face 等格式的模型权重，就能得到比原生 PyTorch 快得多的推理服务。在具身智能里，它常用于加速 VLA 的语言模型骨干或云端大脑服务。","example":"在 H100 上用 TensorRT-LLM 以 FP8 精度部署 Llama 模型，作为机器人任务规划的云端服务。","related":["TensorRT","vLLM","KV 缓存","投机解码","训练后量化","推理部署"]},{"id":"vllm","category":"software","sec":10,"tier":3,"sources":[{"title":"vllm-project/vllm GitHub","url":"https://github.com/vllm-project/vllm"},{"title":"Efficient Memory Management for Large Language Model Serving with PagedAttention (arXiv)","url":"https://arxiv.org/abs/2309.06180"}],"as_of":"","related_ids":["key-value-cache","large-language-model","vision-language-model","nvidia-tensorrt-llm","verl","inference-deployment"],"name":"vLLM","alt":"vLLM","abbr":"","aliases":[],"one_liner":"开源的大语言模型高吞吐推理与服务引擎。","explanation":"vLLM 起源于加州大学伯克利分校 Sky Computing 实验室，核心技术 PagedAttention 发表于 SOSP 2023。大模型推理时，每条请求都要保存 KV 缓存（已生成内容的注意力键值），长度不定，传统做法按最大长度预留显存，浪费严重。PagedAttention 借鉴操作系统分页，把 KV 缓存切成小块按需分配，再配合连续批处理（新请求随时插入正在运行的批次），同一张卡能同时服务更多请求。它支持主流开源 LLM 和 VLM，可一键起 OpenAI 兼容的 API。具身里常用于部署任务规划用的大模型，也被 veRL 等框架用作强化学习的生成引擎。","example":"在服务器上运行 vllm serve 加载一个 Qwen2.5-VL 模型，机器人端通过 HTTP 发送图像和指令，拿回分解好的子任务列表。","related":["KV 缓存","大语言模型","视觉语言模型","TensorRT-LLM","veRL","推理部署"]},{"id":"intel-openvino","category":"software","sec":10,"tier":3,"sources":[{"title":"OpenVINO 官方文档","url":"https://docs.openvino.ai/"},{"title":"openvinotoolkit/openvino (GitHub)","url":"https://github.com/openvinotoolkit/openvino"}],"as_of":"","related_ids":[null,null,"nvidia-tensorrt","open-neural-network-exchange",null,null],"name":"OpenVINO","alt":"Intel OpenVINO","abbr":"","aliases":["OpenVINO Toolkit"],"one_liner":"英特尔开源的推理优化与部署工具包，让模型在英特尔 CPU、核显、NPU 上跑得更快。","explanation":"OpenVINO（Open Visual Inference and Neural network Optimization）是英特尔开源的深度学习推理工具包。它把 PyTorch、ONNX、TensorFlow 等格式的模型转换成自己的中间表示，再针对英特尔 CPU、集成显卡和 NPU（神经网络处理器）做算子融合、低精度量化（如 INT8）等优化后执行。它的定位与英伟达的 TensorRT 类似，区别是面向英特尔硬件。很多机器人用的是没有独立显卡的工控机或迷你主机，这时用 OpenVINO 部署视觉检测、分割等模型，能在不加 GPU 的情况下提高帧率、降低延迟。","example":"把 YOLO 检测模型导出为 OpenVINO 格式，在机器人上的英特尔酷睿迷你主机 CPU 上实时检测桌面物体。","related":["推理部署(Inference Deployment)","端侧部署(On-Device / Edge Deployment)","TensorRT","ONNX","训练后量化(Post-Training Quantization)","工控机(Industrial PC)"]},{"id":"rockchip-rknn-toolkit","category":"software","sec":10,"tier":3,"sources":[{"title":"airockchip/rknn-toolkit2 on GitHub","url":"https://github.com/airockchip/rknn-toolkit2"}],"as_of":"","related_ids":["rockchip-rk3588","on-device-edge-deployment","post-training-quantization","open-neural-network-exchange","neural-processing-unit","inference-deployment"],"name":"RKNN-Toolkit","alt":"Rockchip RKNN-Toolkit","abbr":"RKNN","aliases":["RKNN-Toolkit2","RKNN-Toolkit-Lite2"],"one_liner":"瑞芯微的模型转换工具，把神经网络转成能在其 NPU 上跑的格式","explanation":"RKNN-Toolkit 是瑞芯微（Rockchip）为自家芯片内置的 NPU（神经网络处理器）提供的开发工具链。它把 PyTorch、ONNX、TensorFlow 等框架训练好的模型转换成 RKNN 格式，过程中可以做 INT8 量化，再在 RK3588 等芯片上调用 NPU 推理。新芯片对应的是 RKNN-Toolkit2，板端 Python 推理用 RKNN-Toolkit-Lite2，C 接口由 RKNPU 运行时提供。很多低成本机器人和开发板用 RK3588 当主控，想在上面跑检测、分割或小型策略网络，一般都要走这套工具。","example":"把训练好的 YOLO 模型导出为 ONNX，用 RKNN-Toolkit2 量化转换成 .rknn 文件，部署到 RK3588 开发板上做实时目标检测。","related":["瑞芯微 RK3588","端侧部署","训练后量化","ONNX","神经网络处理器（NPU / BPU）","推理部署"]},{"id":"horizon-robotics-openexplorer","category":"software","sec":10,"tier":3,"sources":[{"title":"地瓜机器人开发者社区","url":"https://developer.d-robotics.cc/"}],"as_of":"","related_ids":["horizon-robotics","d-robotics-rdk-s100","post-training-quantization","neural-processing-unit","on-device-edge-deployment","open-neural-network-exchange"],"name":"地平线天工开物","alt":"Horizon Robotics OpenExplorer","abbr":"","aliases":["天工开物","OpenExplorer"],"one_liner":"地平线为自家 BPU 芯片提供的 AI 模型转换、量化与部署工具链","explanation":"天工开物（OpenExplorer）是地平线推出的 AI 开发平台和工具链，服务于其带 BPU（地平线自研神经网络处理器）的芯片。训练好的 PyTorch 或 ONNX 模型不能直接跑在这类芯片上，需要经过量化（把浮点权重转成 INT8 等低精度）、编译成芯片指令、再用运行时库加载，天工开物就提供这些步骤的工具，以及示例模型和性能分析工具。具身智能开发者用地瓜机器人的 RDK 系列开发板部署视觉或策略模型时，常会接触到这套工具链。","example":"把一个 YOLO 检测模型导出 ONNX，用天工开物的工具做训练后量化并编译，再部署到 RDK 开发板上实时检测。","related":["地平线","地瓜 RDK S100","训练后量化","神经网络处理器（NPU / BPU）","端侧部署","ONNX"]},{"id":"compute-architecture-for-neural-networks","category":"software","sec":10,"tier":3,"sources":[{"title":"昇腾 CANN 异构计算架构（华为昇腾社区）","url":"https://www.hiascend.com/software/cann"}],"as_of":"","related_ids":["operator-kernel","mindspore","nvidia-tensorrt","inference-deployment","on-device-edge-deployment","huawei"],"name":"昇腾 CANN","alt":"Compute Architecture for Neural Networks (Huawei Ascend)","abbr":"CANN","aliases":["CANN"],"one_liner":"华为昇腾 NPU 的底层计算架构和算子编译工具链。","explanation":"全称 Compute Architecture for Neural Networks，是华为为昇腾（Ascend）AI 处理器做的异构计算软件栈，地位类似英伟达的 CUDA 加 cuDNN：底下对接昇腾芯片，上面支撑 MindSpore、PyTorch 等框架。内容包括编程接口 AscendCL、图编译与优化引擎、算子加速库，以及自己写算子用的 Ascend C。对具身智能的意义是国产算力路线上的部署基座：模型要在昇腾板卡或服务器上跑，就得经 CANN 转换、编译、调优，角色对应 TensorRT 之于英伟达、RKNN-Toolkit 之于瑞芯微。","example":"把 PyTorch 训好的视觉模型导出后用 CANN 工具链转成昇腾离线模型，在昇腾板卡上推理。","related":["算子","昇思 MindSpore","TensorRT","推理部署","端侧部署","华为"]},{"id":"nvidia-isaac-platform","category":"software","sec":11,"tier":2,"sources":[{"title":"NVIDIA Isaac - AI Robot Development Platform","url":"https://developer.nvidia.com/isaac"}],"as_of":"2025-12","related_ids":["nvidia-isaac-sim","nvidia-isaac-lab","nvidia-isaac-ros","nvidia-isaac-gr00t-n1","nvidia-omniverse","nvidia-three-computer-solution"],"name":"NVIDIA Isaac","alt":"NVIDIA Isaac Platform","abbr":"","aliases":["Isaac 平台","英伟达 Isaac"],"one_liner":"英伟达面向机器人开发的一整套软件、模型和工具的总称","explanation":"NVIDIA Isaac 是英伟达为机器人开发提供的平台品牌，不是单个软件，而是一族产品：Isaac Sim（仿真器）、Isaac Lab（基于 Isaac Sim 的机器人学习框架）、Isaac ROS（跑在 ROS 2 上的 GPU 加速感知与规划包）、Isaac GR00T（人形机器人基础模型与工具）等。它把「在仿真里训练—生成合成数据—部署到 Jetson 板卡」这条链路用自家软硬件串起来，是英伟达「三台计算机」叙事里的软件层。新人看到带 Isaac 前缀的名字，先分清它是仿真、训练框架、ROS 包还是模型。","example":"用 Isaac Lab 在 GPU 上并行训练四足行走策略，再用 Isaac ROS 的感知包在 Jetson Orin 上部署。","related":["Isaac Sim","Isaac Lab","Isaac ROS","GR00T N1 系列","Omniverse","英伟达三台计算机"]},{"id":"nvidia-omniverse","category":"software","sec":11,"tier":2,"sources":[{"title":"NVIDIA Omniverse","url":"https://www.nvidia.com/en-us/omniverse/"}],"as_of":"2025-09","related_ids":["nvidia-isaac-sim","universal-scene-description","physx","digital-twin","nvidia-omniverse-replicator","nvidia-isaac-platform"],"name":"Omniverse","alt":"NVIDIA Omniverse","abbr":"","aliases":["英伟达 Omniverse"],"one_liner":"英伟达基于 OpenUSD 的 3D 仿真与协作开发平台","explanation":"Omniverse 是英伟达推出的 3D 应用开发平台，用 OpenUSD（通用场景描述格式）描述场景，用 RTX 做实时光线追踪渲染，并接入 PhysX 物理引擎。它本身不是给机器人专门做的，工厂数字孪生、影视、自动驾驶仿真都在用；具身智能里最常碰到的是它的下游：Isaac Sim 就构建在 Omniverse 之上，Replicator 用来批量生成带标注的合成数据。理解 Omniverse，主要是理解为什么 Isaac Sim 的场景文件是 USD、渲染为什么依赖 RTX 显卡。","example":"用 Omniverse Replicator 在仓库场景里随机换光照和物体摆放，批量生成带分割标注的训练图片。","related":["Isaac Sim","通用场景描述","PhysX","数字孪生","Omniverse Replicator 合成数据生成","NVIDIA Isaac"]},{"id":"nvidia-isaac-ros","category":"software","sec":11,"tier":3,"sources":[{"title":"Isaac ROS 文档","url":"https://nvidia-isaac-ros.github.io/"},{"title":"NVIDIA-ISAAC-ROS GitHub","url":"https://github.com/NVIDIA-ISAAC-ROS"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"Isaac ROS","alt":"NVIDIA Isaac ROS","abbr":"","aliases":[],"one_liner":"英伟达提供的一组 GPU 加速 ROS 2 功能包。","explanation":"Isaac ROS 是英伟达推出的开源 ROS 2 软件包合集，面向 Jetson 等带 GPU 的平台。它把视觉 SLAM（cuVSLAM）、三维建图（nvblox）、双目深度、AprilTag 识别、物体位姿估计（FoundationPose）、运动规划（cuMotion）等常用模块改写为 GPU 加速版本，并用 NITROS 机制让图像等大数据在节点之间传递时留在显存中，减少复制。开发者可以在 ROS 2 系统里直接替换对应节点，提高感知和规划速度，它也是英伟达 Isaac 平台部署端的重要组成部分。","example":"在 Jetson Orin 上运行 Isaac ROS Visual SLAM，用双目相机实时估计移动机器人位姿。","related":["ROS 2(Robot Operating System 2)","NVIDIA Isaac(NVIDIA Isaac Platform)","英伟达 Jetson(NVIDIA Jetson)","nvblox(NVIDIA nvblox (GPU TSDF/ESDF Mapping))","cuMotion(NVIDIA Isaac ROS cuMotion)","零拷贝(Zero-Copy (Shared-Memory IPC))"]},{"id":"nvidia-osmo","category":"software","sec":11,"tier":3,"sources":[{"title":"NVIDIA OSMO 官方页面","url":"https://developer.nvidia.com/osmo"}],"as_of":"2025","related_ids":["nvidia-three-computer-solution","nvidia-isaac-sim","nvidia-isaac-lab","nvidia-cosmos","synthetic-data","hardware-in-the-loop-software-in-the-loop-simulation"],"name":"NVIDIA OSMO","alt":"NVIDIA OSMO","abbr":"","aliases":["OSMO"],"one_liner":"英伟达的物理 AI 工作流编排平台，把训练、仿真、数据生成调度到多种算力上","explanation":"OSMO 是英伟达推出的云原生编排平台，面向机器人和物理 AI 开发。一个机器人项目往往要串起合成数据生成、模型训练、仿真评测、软件在环/硬件在环测试等多个步骤，而且分别跑在不同机器上（云端 GPU 集群、本地工作站、Jetson 等边缘设备）。OSMO 让开发者用配置文件描述这条流水线，由平台负责分配算力、排队和追踪数据，省去手工在各台机器间搬运和调度。它是英伟达「三台计算机」方案里连接训练与仿真的一环，常与 Isaac Sim、Isaac Lab、Cosmos 配合使用。","example":"把「Isaac Sim 生成合成数据 → 训练抓取策略 → Isaac Lab 批量评测」写成一个 OSMO 工作流，一次提交后由平台自动分到不同 GPU 节点执行。","related":["英伟达三台计算机","Isaac Sim","Isaac Lab","Cosmos","合成数据","硬件在环 / 软件在环仿真"]},{"id":"ros-industrial","category":"software","sec":11,"tier":3,"sources":[{"title":"ROS-Industrial 官网","url":"https://rosindustrial.org/"},{"title":"ROS-Industrial GitHub","url":"https://github.com/ros-industrial"}],"as_of":"","related_ids":["robot-operating-system","robot-operating-system-2","moveit-motion-planning-framework","industrial-robot","unified-robot-description-format","system-integrator"],"name":"ROS-Industrial","alt":"ROS-Industrial","abbr":"ROS-I","aliases":["ROS-I","ROS 工业版"],"one_liner":"把 ROS 用到工业机器人和制造场景的开源项目与联盟","explanation":"ROS-Industrial 是把 ROS 扩展到工业自动化的开源项目，2012 年前后由美国西南研究院（SwRI）牵头发起，现由北美、欧洲、亚太三个区域联盟维护，成员包括设备厂商、制造企业和研究机构。它提供各品牌工业机械臂的 ROS 驱动和模型描述包、与 MoveIt（运动规划框架）的集成，以及打磨、喷涂这类「扫描-规划-执行」应用的工具。意义在于让学术界现成的感知、规划算法能接到工厂设备上，减少为每个品牌控制器单独开发的工作量。","example":"用 ROS-Industrial 提供的 ABB 或 FANUC 驱动包，把 MoveIt 规划出的轨迹发给真实的工业机械臂执行。","related":["机器人操作系统","ROS 2","MoveIt","工业机器人","统一机器人描述格式","系统集成商"]},{"id":"togetheros-bot","category":"software","sec":11,"tier":3,"sources":[{"title":"D-Robotics 开发者社区","url":"https://developer.d-robotics.cc/"},{"title":"D-Robotics GitHub","url":"https://github.com/D-Robotics"}],"as_of":"","related_ids":["robot-operating-system-2","d-robotics","d-robotics-rdk-s100","horizon-robotics","zero-copy","robot-operating-system"],"name":"TogetheROS.Bot","alt":"TogetheROS.Bot (D-Robotics)","abbr":"TROS","aliases":["地瓜 TROS","TROS.B","tros.b"],"one_liner":"地瓜机器人推出的机器人软件栈，基于并兼容 ROS 2。","explanation":"TogetheROS.Bot 是地瓜机器人（从地平线分拆出的机器人业务公司）为自家 RDK 系列开发板提供的机器人操作系统，最早以地平线名义发布。它在 ROS 2 基础上做扩展，接口与 ROS 2 兼容，原有 ROS 2 节点可以直接跑。增加的部分主要是面向其芯片的能力：调用板载 BPU（地平线的神经网络加速单元）的推理节点、相机与图像处理节点、减少大块图像数据拷贝的通信优化，以及一批现成的感知算法示例。对用 RDK 板子做小车、机械臂的开发者，它省去了自己适配硬件加速的工作。","example":"在 RDK 开发板上装好 TROS 后，用官方提供的目标检测示例节点读取 USB 相机画面，在 BPU 上跑检测模型，结果以 ROS 2 话题发布给其他节点。","related":["ROS 2","地瓜机器人","地瓜 RDK S100","地平线","零拷贝","机器人操作系统"]},{"id":"m-robots-os","category":"software","sec":11,"tier":3,"sources":[{"title":"深开鸿官网","url":"https://www.kaihong.com/"},{"title":"OpenHarmony 开源鸿蒙","url":"https://www.openharmony.cn/"}],"as_of":"2026-09","related_ids":[null,null,null,null,null],"name":"M-Robots OS","alt":"M-Robots OS (OpenHarmony-based Robot OS)","abbr":"","aliases":["开鸿 M-Robots OS"],"one_liner":"基于开源鸿蒙的国产机器人操作系统，主打多机协同。","explanation":"M-Robots OS 是据报道由深圳开鸿数字产业发展有限公司（深开鸿）牵头推出的机器人操作系统，底座是开放原子开源基金会孵化的开源鸿蒙（OpenHarmony）。它想解决的问题是：不同厂家、不同芯片的机器人和设备各跑各的系统，很难互联和协同。M-Robots OS 借助鸿蒙的分布式软总线等能力，让异构机器人之间发现、通信和分工。它和 ROS 2 属于同一层次的软件，但生态和定位以国产化、多设备协同为主，目前在高校和产业联盟中推广。","example":"","related":["机器人操作系统(Robot Operating System)","ROS 2(Robot Operating System 2)","多机器人协作(Multi-robot Collaboration)","中间件(Middleware)","华为(Huawei)"]},{"id":"link-u-os","category":"software","sec":11,"tier":3,"sources":[{"title":"智元机器人官网","url":"https://www.agibot.com/"},{"title":"AimRT (GitHub)","url":"https://github.com/AimRT/AimRT"}],"as_of":"2025-07","related_ids":[null,null,null,null,null,null],"name":"灵渠 OS（智元具身操作系统）","alt":"Link-U OS (AgiBot Lingqu OS)","abbr":"","aliases":["智元灵渠OS","Lingqu OS"],"one_liner":"智元机器人推出的具身智能机器人操作系统，计划分层开源。","explanation":"灵渠 OS 是智元机器人（AgiBot）推出的面向具身智能机器人的操作系统，据报道于 2025 年世界人工智能大会期间发布并公布开源计划。按公开介绍，它采用分层设计：底层负责硬件抽象和实时通信（与智元此前开源的机器人运行时框架 AimRT 相关），上层对接具身大模型、技能和应用，目标是让不同本体、不同模型能在统一的软件底座上运行，降低二次开发和跨本体迁移的成本。它和 ROS 2、RoboOS 等处在相近的位置，具体开源范围与进度以官方发布为准。","example":"","related":["智元机器人(AgiBot)","AimRT(AimRT (AgiBot robot runtime framework))","机器人操作系统(Robot Operating System)","ROS 2(Robot Operating System 2)","RoboOS(RoboOS (BAAI embodied OS))","硬件抽象层(Hardware Abstraction Layer)"]},{"id":"agibot-genie-studio","category":"software","sec":11,"tier":3,"sources":[{"title":"AgiBot 智元机器人官网","url":"https://www.agibot.com/"}],"as_of":"2025","related_ids":["agibot","agibot-go-1","genie-sim",null,"software-development-kit","inference-deployment"],"name":"Genie Studio（智元具身开发平台）","alt":"AgiBot Genie Studio","abbr":"","aliases":["智元 Genie Studio"],"one_liner":"智元机器人推出的一站式具身智能开发平台，覆盖采数、训练、评测到部署","explanation":"Genie Studio 是智元机器人（AgiBot）面向开发者推出的具身智能开发平台，据其官方介绍，目标是把做一个机器人技能需要的几个环节串在同一个平台里：遥操作数据采集与管理、数据标注、基于其基础模型（如 GO-1）的训练和微调、仿真评测，以及把训练好的模型部署到智元本体上。它解决的问题是：具身开发链条长、工具零散，从采数据到上真机往往要自己拼很多脚本。对新手来说，可以把它理解成厂商配套的「具身版开发 IDE + 云端训练服务」，主要服务于使用智元硬件的客户和开发者。具体功能与开放范围以智元官方为准。","example":"","related":["智元机器人","智元 GO-1（启元大模型）","智元 Genie Sim","AimRT","软件开发工具包","推理部署"]},{"id":"om1","category":"software","sec":11,"tier":3,"sources":[{"title":"OpenMind/OM1 (GitHub)","url":"https://github.com/OpenMind/OM1"}],"as_of":"2025","related_ids":["robot-operating-system","robot-operating-system-2","large-language-model","eclipse-zenoh","unitree-go2","link-u-os"],"name":"OM1（OpenMind 机器人 OS）","alt":"OM1 (OpenMind modular AI runtime for robots)","abbr":"","aliases":["OM1","OpenMind OM1"],"one_liner":"OpenMind 开源的机器人 AI 运行时，把大模型能力接到不同机器人上","explanation":"OM1 是美国初创公司 OpenMind 开源的模块化 AI 运行时，常被称为「机器人操作系统」，但它不替代 ROS 那样的底层通信，而是跑在上层：把相机、麦克风等传感器输入整理成文字描述，交给大语言模型或视觉语言模型决策，再把输出转成机器人动作或语音。各部分以插件形式接入，可以换模型、换硬件。据官方介绍，它支持人形、四足等多种本体（如宇树 G1、Go2），并可通过 ROS 2、Zenoh 等与底层对接。它代表了用大模型做机器人交互层、追求跨硬件复用的一种思路。","example":"在宇树 Go2 上运行 OM1，接入一个多模态大模型，让机器狗能听懂语音指令并回答看到了什么。","related":["机器人操作系统","ROS 2","大语言模型","Zenoh","宇树 Go2","灵渠 OS（智元具身操作系统）"]},{"id":"roboos","category":"software","sec":11,"tier":3,"sources":[{"title":"RoboOS on GitHub (FlagOpen)","url":"https://github.com/FlagOpen/RoboOS"}],"as_of":"2025-07","related_ids":["robobrain","beijing-academy-of-artificial-intelligence","braincerebellum-architecture","one-brain-multiple-robots","multi-robot-collaboration","model-context-protocol"],"name":"RoboOS","alt":"RoboOS (BAAI embodied OS)","abbr":"","aliases":["智源 RoboOS"],"one_liner":"智源研究院开源的跨本体、多机器人协作的具身「大小脑」框架","explanation":"RoboOS 是北京智源人工智能研究院在 2025 年开源的具身智能系统框架，名字叫 OS，但它不是 Linux 那样的底层操作系统，而是跑在机器人之上的调度层。它采用大脑-小脑分层：云端「大脑」用具身大模型 RoboBrain 理解指令、拆解任务、分配给不同机器人；各机器人本地的「小脑」调用抓取、导航等技能去执行；中间用共享记忆同步场景和状态。目的是让不同形态的机器人接入同一套大脑并协作完成任务。据报道同年又发布了 RoboOS 2.0，加入技能商店和 MCP 协议支持。","example":"用户说「把桌上的水递给我」，RoboOS 的大脑把任务拆成导航和抓取两步，分别派给轮式底盘和双臂机器人执行。","related":["智源 RoboBrain（具身大脑）","北京智源人工智能研究院","大脑-小脑架构（大小脑）","一脑多机","多机器人协作","MCP / ROS-MCP-Server"]},{"id":"huisi-kaiwu","category":"software","sec":11,"tier":3,"sources":[{"title":"北京人形机器人创新中心官网","url":"https://www.x-humanoid.com/"}],"as_of":"2025","related_ids":["beijing-humanoid-robot-innovation-center","tiangong","pelican-vl","xr-1","one-brain-multiple-robots","huawei-cloud-cloudrobo-embodied-ai-platform"],"name":"慧思开物","alt":"Huisi Kaiwu (X-Humanoid general embodied AI platform)","abbr":"","aliases":[],"one_liner":"北京人形机器人创新中心推出的通用具身智能软件平台","explanation":"慧思开物是北京人形机器人创新中心（X-Humanoid）推出的通用具身智能平台，定位是一套能装在不同机器人上的软件系统。据其公开介绍，它把大模型驱动的任务理解与规划、技能库和底层运动控制组织在一起，目标是「一脑多能、一脑多机」：同一套软件可以驱动不同本体、完成多种任务，减少每个场景都从头开发的工作量。它与该中心的人形机器人天工、具身模型 Pelican-VL、XR-1 等同属一个技术体系。","example":"","related":["北京人形机器人创新中心","天工","北京人形 Pelican-VL","北京人形 XR-1","一脑多机","华为云 CloudRobo"]},{"id":"huawei-cloud-cloudrobo-embodied-ai-platform","category":"software","sec":11,"tier":3,"sources":[{"title":"华为云官网","url":"https://www.huaweicloud.com/"}],"as_of":"2025-06","related_ids":["huawei","cloud-edge-device-collaboration","embodied-foundation-model","tencent-tairos-embodied-ai-open-platform","huisi-kaiwu"],"name":"华为云 CloudRobo","alt":"Huawei Cloud CloudRobo Embodied AI Platform","abbr":"","aliases":["CloudRobo 具身智能平台","CloudRobo"],"one_liner":"华为云推出的具身智能云平台，在云端提供机器人所需的大模型与服务","explanation":"CloudRobo 是华为云面向具身智能推出的云平台，据报道在 2025 年华为开发者大会上发布。它的思路是把机器人「大脑」的一部分能力放到云上：平台提供基于盘古大模型的具身相关模型（据报道包括数据生成、任务规划和动作执行几类），以及数据合成、仿真训练等服务，机器人本体通过华为提出的连接协议接入云端。对本体厂商来说，这类平台降低了自研大模型和算力的门槛；代价是依赖网络和云服务，实时性要求高的底层控制仍需在端侧完成。","example":"","related":["华为","云边端协同","具身大模型","腾讯 Tairos","慧思开物"]},{"id":"tencent-tairos-embodied-ai-open-platform","category":"software","sec":11,"tier":3,"sources":[{"title":"腾讯 Robotics X 实验室","url":"https://robotics.tencent.com/"}],"as_of":"2026-09","related_ids":["tencent-robotics-x-lab","tencent-hy-embodied","robot-brain-company","hardware-software-decoupling","huawei-cloud-cloudrobo-embodied-ai-platform"],"name":"腾讯 Tairos","alt":"Tencent Tairos Embodied AI Open Platform","abbr":"","aliases":["Tairos 具身智能开放平台","钛螺丝"],"one_liner":"腾讯推出的具身智能开放平台，提供机器人大模型和开发工具","explanation":"Tairos 是腾讯推出的具身智能开放平台，由腾讯 Robotics X 实验室牵头，中文昵称「钛螺丝」，据报道于 2025 年发布。腾讯的定位是不自己造整机，而是给机器人厂商和开发者提供「大脑」层能力：感知、规划、动作等模型，配套开发工具、仿真与数据服务，厂商可以按需模块化调用，装到自家机器人本体上。它代表了互联网大厂进入具身智能的一种路线：做平台和模型，与本体厂商合作。","example":"","related":["腾讯 Robotics X 实验室","腾讯 HY-Embodied（混元具身）","大脑公司","软硬解耦（模型与本体解耦）","华为云 CloudRobo"]},{"id":"simulator","category":"sim","sec":0,"tier":1,"sources":[{"title":"MuJoCo Documentation: Overview","url":"https://mujoco.readthedocs.io/en/stable/overview.html"},{"title":"NVIDIA Isaac Sim Documentation","url":"https://docs.isaacsim.omniverse.nvidia.com/latest/index.html"},{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"2026-09","related_ids":["physics-engine","rendering","sim-to-real-transfer","mujoco","nvidia-isaac-sim","simulation-based-evaluation"],"name":"仿真器","alt":"Simulator","abbr":"","aliases":["仿真","模拟器","Simulation","仿真平台","机器人仿真器"],"one_liner":"在电脑里模拟机器人、物体和传感器怎么运动、怎么相互作用的软件。","explanation":"仿真器是在计算机里重现机器人及其环境的软件，通常包括：物理引擎，每一步计算受力、碰撞和接触，把状态往前推进；渲染器，生成相机图像、深度等传感器数据；场景和资产，即机器人模型和各种物体；以及供算法调用的接口，如重置环境、执行一步动作、返回观测和奖励。在具身智能里，它用来训练强化学习策略、生成合成数据和做仿真评测，好处是便宜、安全、能并行、可复现。常见的有 MuJoCo（Google DeepMind 维护，2022 年开源）、英伟达 Isaac Sim / Isaac Lab、PyBullet、Genesis、SAPIEN 等。核心难题是它与现实之间的差距。","example":"ACT 论文在 MuJoCo 里搭了双臂「传递方块」和「空中插销」两个仿真任务，别人不用买 ALOHA 硬件也能复现实验。","related":["物理引擎","渲染","仿真到现实迁移","MuJoCo","Isaac Sim","仿真评测"]},{"id":"physics-engine","category":"sim","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Physics engine","url":"https://en.wikipedia.org/wiki/Physics_engine"},{"title":"google-deepmind/mujoco (GitHub)","url":"https://github.com/google-deepmind/mujoco"}],"as_of":"","related_ids":["simulator","mujoco","physx","contact-model","constraint-solver","simulation-timestep"],"name":"物理引擎","alt":"Physics Engine","abbr":"","aliases":["物理仿真引擎"],"one_liner":"按物理规律一步步计算物体受力、碰撞和运动的软件核心。","explanation":"物理引擎是对物理系统做近似模拟的软件，广泛用于游戏、影视特效、科学计算和机器人仿真。每个仿真步里，它先做碰撞检测找出哪些物体接触，再用约束求解器算接触力、摩擦力和关节力，最后用积分器更新位置和速度。按目标可分为追求速度的实时引擎和追求精度的高精度引擎。机器人领域常用的有 MuJoCo、PhysX、Bullet（PyBullet）、ODE，以及新兴的 Newton。要区分：物理引擎只管「怎么动」，仿真器（如 Isaac Sim、Gazebo）在它外面再加渲染、传感器、场景编辑和编程接口。接触模型和步长设置直接决定仿真准不准、稳不稳，也是虚实差距的主要来源之一。","example":"同一个机械臂抓取任务，放在 MuJoCo 和 PhysX 里跑，接触力和成功率可能不一样，所以论文通常会注明用的是哪个引擎。","related":["仿真器","MuJoCo","PhysX","接触模型","约束求解器","仿真步长"]},{"id":"environment","category":"sim","sec":0,"tier":1,"sources":[{"title":"Gymnasium Documentation: Env API","url":"https://gymnasium.farama.org/api/env/"}],"as_of":"","related_ids":["agentenvironment-interaction","episode","observation","action-space","termination-vs-truncation","gymnasium"],"name":"环境（Env）与 reset / step 接口","alt":"Environment (Env; reset/step interface)","abbr":"Env","aliases":["Gym 接口","Gymnasium API","环境接口"],"one_liner":"强化学习和机器人仿真的标准交互接口：reset 开一局，step 执行一步动作。","explanation":"在强化学习里，环境就是智能体与之交互的世界。OpenAI Gym 把和环境打交道的方式做成了通用编程接口，现由 Farama 基金会维护的后继项目 Gymnasium 规定：reset() 开始新回合，返回初始观测和附加信息 info；step(action) 执行一个动作，返回新观测、奖励、terminated（任务意义上结束，如成功或摔倒）、truncated（被外部截断，如超时）和 info。环境还用 action_space、observation_space 规定动作和观测的格式。Isaac Lab 等框架沿用类似写法，同一套训练算法因此能换着环境用。旧版 Gym 只有一个 done 标志；拆成两个，是因为超时截断时任务其实没结束，估算后续还能拿多少奖励时仍要把没走完的部分算进去，混在一起会算错。","example":"典型循环：obs, info = env.reset()，然后反复执行 obs, reward, terminated, truncated, info = env.step(policy(obs))，任一结束标志为真就重新 reset。","related":["智能体与环境","回合","观测","动作空间","终止与截断","Gymnasium"]},{"id":"rollout","category":"sim","sec":0,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"RoboChallenge 论文 HTML 全文 (arXiv 2510.17950)","url":"https://arxiv.org/html/2510.17950"}],"as_of":"","related_ids":["trajectory","episode","success-rate","closed-loop-evaluation","learning-in-imagination","on-policy"],"name":"推演","alt":"Rollout","abbr":"","aliases":["rollout","滚动执行"],"one_liner":"让策略在环境里从开始一直执行到结束，得到一整段交互轨迹。","explanation":"Rollout 指把策略放进环境（仿真或真机），从初始状态按「观测—动作—环境变化」循环执行，直到成功、失败或超时，得到一条完整轨迹。OpenAI 的教程 Spinning Up 写道，轨迹也常被称为 episode（回合）或 rollout。常见用法：强化学习里用它收集数据来更新策略；评测时说「每个任务 rollout 50 次」，就是跑 50 个回合统计成功率；基于模型的强化学习里，在世界模型中往后「想象」几步也叫 rollout。大模型强化学习对同一提示采样多条回答也沿用这个词。","example":"RoboChallenge 的 Table30 基准对每个任务做 10 次 rollout，再按成功率和进度分数给模型打分。","related":["轨迹","回合","成功率","闭环评测","想象中学习","同策略"]},{"id":"termination-vs-truncation","category":"sim","sec":0,"tier":3,"sources":[{"title":"Gymnasium: Handling Time Limits","url":"https://gymnasium.farama.org/tutorials/gymnasium_basics/handling_time_limits/"},{"title":"Time Limits in Reinforcement Learning (arXiv 1712.00378, ICML 2018)","url":"https://arxiv.org/abs/1712.00378"},{"title":"rsl_rl PPO 实现（time_outs 自举）","url":"https://raw.githubusercontent.com/leggedrobotics/rsl_rl/master/rsl_rl/algorithms/ppo.py"}],"as_of":"","related_ids":["episode","early-termination","value-function","bootstrapping","environment","gymnasium"],"name":"终止与截断","alt":"Termination vs. Truncation","abbr":"","aliases":["terminated / truncated","超时截断"],"one_liner":"回合结束分两种：任务本身到头叫终止，因步数上限被人为打断叫截断。","explanation":"这是强化学习环境接口里的一对概念。终止指智能体进入了马尔可夫决策过程的终止状态，比如任务完成、机器人摔倒；截断指因为任务之外的原因被打断，最常见的是训练时设的最大步数到了。两者对训练的影响不同：终止之后没有未来回报，价值目标就是当步奖励；截断时的状态并不是终点，算目标时仍应用下一状态的价值来自举（用估计值代替还没看到的后续回报）。Pardo 等人在 ICML 2018 的论文专门分析过把时间上限当终止带来的问题。Gymnasium 从 0.26 版起让 step() 分别返回 terminated 和 truncated，取代原来的单个 done；Isaac Lab 也用 time_out 标记来区分。","example":"legged_gym 里，机身等指定部位接触力超过阈值算终止；回合步数超过上限算超时截断，通过 extras 中的 time_outs 传给 rsl_rl，PPO 在超时步把折扣后的价值估计加回奖励，相当于继续自举。","related":["回合","提前终止","价值函数","自举","环境（Env）与 reset / step 接口","Gymnasium"]},{"id":"simulation-timestep","category":"sim","sec":0,"tier":2,"sources":[{"title":"MuJoCo Documentation: XML Reference (option timestep)","url":"https://mujoco.readthedocs.io/en/stable/XMLreference.html#option-timestep"},{"title":"Isaac Lab source: velocity_env_cfg.py (locomotion velocity task)","url":"https://github.com/isaac-sim/IsaacLab/blob/main/source/isaaclab_tasks/isaaclab_tasks/manager_based/locomotion/velocity/velocity_env_cfg.py"},{"title":"Isaac Lab source: simulation_cfg.py (SimulationCfg)","url":"https://github.com/isaac-sim/IsaacLab/blob/main/source/isaaclab/isaaclab/sim/simulation_cfg.py"}],"as_of":"2026-09","related_ids":["control-decimation","substeps","numerical-integrator","simulation-instability","control-frequency","real-time-factor"],"name":"仿真步长","alt":"Simulation Timestep","abbr":"dt","aliases":["物理步长","时间步长","physics dt","timestep","sim dt"],"one_liner":"物理引擎每算一步推进的仿真时间，决定精度、稳定性和速度。","explanation":"仿真步长（常记作 dt）是物理引擎每次积分向前推进的时间，比如 0.002 秒表示仿真 1 秒要算 500 步。步长越小，接触和高速运动算得越准、越不容易爆炸，但同样时长要算更多步，速度更慢。MuJoCo 默认步长 0.002 秒，文档称它是影响速度与精度权衡最重要的单个参数；Isaac Lab 的 SimulationCfg 默认 1/60 秒，具体任务常改得更小。仿真步长通常比策略的控制周期短：策略每输出一次动作，仿真连续跑若干步，这个倍数叫控制降频（decimation）；有的引擎还会把一步再拆成若干子步。","example":"Isaac Lab 的足式机器人速度跟踪任务把 sim.dt 设为 0.005 秒（200 Hz），decimation 设为 4，所以策略以 50 Hz 输出动作。","related":["控制降频","子步","积分器","仿真爆炸","控制频率","实时因子"]},{"id":"control-decimation","category":"sim","sec":0,"tier":2,"sources":[{"title":"Isaac Lab API: isaaclab.envs（ManagerBasedEnvCfg.decimation）","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.envs.html"},{"title":"legged_gym: legged_robot_config.py","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["simulation-timestep","control-frequency","policy-inference-frequency","proportional-derivative-control","substeps","nvidia-isaac-lab"],"name":"控制降频","alt":"Control Decimation","abbr":"","aliases":["decimation","物理频率与控制频率之比"],"one_liner":"策略每出一个动作，物理引擎要跑几个仿真步；这个步数就是 decimation。","explanation":"物理引擎为了算得稳，需要很小的时间步（通常几毫秒），而策略网络没必要、也来不及那么高频地出动作。控制降频就是让策略每输出一次动作，仿真器用这个动作（或由它换算出的 PD 目标）连续推进 N 个物理步，N 叫 decimation。Isaac Lab 和 legged_gym 都用这个参数，环境走一步的时长等于物理步长乘以 decimation。取值要兼顾两头：太大，策略反应慢；太小，浪费训练算力，而且和真机控制频率对不上，会加大虚实差距。部署到真机时，策略一般按同样的频率运行，底层电机的 PD 控制则跑在更高频率上。","example":"legged_gym 默认物理步长 0.005 秒、decimation = 4，所以策略每 0.02 秒出一次动作，即 50 Hz 控制，而关节 PD 控制在 200 Hz 的物理步里执行。","related":["仿真步长","控制频率","策略推理频率","PD 控制","子步","Isaac Lab"]},{"id":"substeps","category":"sim","sec":0,"tier":3,"sources":[{"title":"Genesis SimOptions 源码（dt / substeps 说明）","url":"https://raw.githubusercontent.com/Genesis-Embodied-AI/Genesis/main/genesis/options/solvers.py"},{"title":"legged_gym 默认配置 legged_robot_config.py","url":"https://raw.githubusercontent.com/leggedrobotics/legged_gym/master/legged_gym/envs/base/legged_robot_config.py"},{"title":"Isaac Gym Python API: SimParams（dt / substeps）","url":"https://docs.robotsfan.com/isaacgym/api/python/struct_py.html"}],"as_of":"","related_ids":["simulation-timestep","control-decimation","numerical-integrator","simulation-instability","solver-iteration-count","physics-engine"],"name":"子步","alt":"Substeps","abbr":"","aliases":["substepping","物理子步"],"one_liner":"把一个仿真步再切成几段小步积分，换取更稳定、更准的物理。","explanation":"子步是物理仿真器里的一个设置：每调用一次仿真步进，引擎内部把这段时间均分成若干份，依次做积分和约束求解（计算接触力、关节约束的那一步）。Isaac Gym 的 SimParams 里有 dt 和 substeps 两个参数；Genesis 的 SimOptions 也有 substeps，文档写明它表示每次 scene.step() 里求解器积分几次。子步越多，等效时间步越小，高速碰撞和刚度大的接触越不容易穿模或数值爆炸，但计算量也成倍增加。它和控制降频不是一回事：降频是策略每隔几个仿真步才出一次动作，子步是在一个仿真步内部再细分。两者加上仿真步长，共同决定物理频率和控制频率。","example":"legged_gym 的默认配置是仿真步长 dt=0.005 秒、substeps=1、decimation=4，即物理 200 Hz、策略 50 Hz；若把 substeps 改成 2，引擎内部就按 2.5 毫秒一步积分，而策略频率不变。","related":["仿真步长","控制降频","积分器","仿真爆炸","求解器迭代次数","物理引擎"]},{"id":"real-time-factor","category":"sim","sec":0,"tier":3,"sources":[{"title":"Gazebo Classic 教程：Physics Parameters（real_time_factor）","url":"https://classic.gazebosim.org/tutorials?tut=physics_params"},{"title":"Gazebo 文档：Understanding the GUI（RTF 显示）","url":"https://gazebosim.org/docs/latest/gui/"},{"title":"Learning agile and dynamic motor skills for legged robots (arXiv 1901.08652)","url":"https://arxiv.org/abs/1901.08652"}],"as_of":"","related_ids":["simulator","simulation-timestep","simulation-throughput","gpu-accelerated-parallel-simulation","hardware-in-the-loop-software-in-the-loop-simulation","gazebo"],"name":"实时因子","alt":"Real-Time Factor","abbr":"RTF","aliases":["仿真速度倍率","实时率"],"one_liner":"仿真时间与现实流逝时间之比，衡量仿真比现实跑得快还是慢。","explanation":"实时因子 = 仿真中推进的时间 ÷ 现实中花掉的时间。RTF=1 表示仿真与现实同速；大于 1 比现实快，RTF=10 即现实 1 秒能仿真 10 秒；小于 1 则比现实慢，常见于场景复杂、传感器多或渲染开销大时。Gazebo 界面底部会实时显示 RTF；在 Gazebo Classic 中，单步时长 max_step_size 乘以每秒更新次数 real_time_update_rate 就是 RTF 的上限，把更新频率设为 0 则尽可能快地跑。它对强化学习很关键：训练要消耗海量交互，RTF 越高，同样时间能收集的经验越多；GPU 并行仿真通常改报所有环境加总的每秒步数（吞吐量）。反过来，软件在环、硬件在环测试要与真实控制器同步，需要把 RTF 锁在 1。注意语音识别里的 RTF 定义正好相反（处理耗时 ÷ 音频时长，越小越快）。","example":"ETH 2019 年训练 ANYmal 四足运控时，仿真器每秒能推进近 50 万个时间步，论文称约比实时快一千倍（RTF 约 1000），单台电脑十一小时内就能训完。","related":["仿真器","仿真步长","仿真吞吐量","GPU 并行仿真","硬件在环 / 软件在环仿真","Gazebo"]},{"id":"vectorized-environments","category":"sim","sec":0,"tier":2,"sources":[{"title":"Gymnasium Documentation: Vector environments","url":"https://gymnasium.farama.org/api/vector/"},{"title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning (arXiv 2108.10470)","url":"https://arxiv.org/abs/2108.10470"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)","url":"https://arxiv.org/abs/2109.11978"}],"as_of":"2026-09","related_ids":["gpu-accelerated-parallel-simulation","massively-parallel-reinforcement-learning","nvidia-isaac-lab","isaac-gym","simulation-throughput","proximal-policy-optimization"],"name":"并行环境","alt":"Vectorized Environments","abbr":"","aliases":["向量化环境","num_envs","Vector Env","Parallel Environments"],"one_liner":"同时运行许多份相互独立的环境副本，一次批量收集交互数据。","explanation":"并行环境是强化学习里提高采样速度的做法：把同一个环境复制 N 份（N 就是代码里的 num_envs），每一步把 N 个动作一起送进去，拿回 N 份观测、奖励和结束标志，正好组成一个批次喂给神经网络。Gymnasium 提供顺序执行的 SyncVectorEnv 和多进程的 AsyncVectorEnv，某个副本回合结束时自动重置它，不用等其他副本。Isaac Gym、Isaac Lab、MJX 等 GPU 仿真器更进一步，把成千上万个环境放在一块 GPU 上同时算，数据直接以 PyTorch 张量交给训练代码，Isaac Gym 论文称比 CPU 仿真快两到三个数量级。Rudin 等人 2021 年借此让 ANYmal 四足机器人在平地上不到 4 分钟学会行走。","example":"Isaac Lab 的足式机器人速度跟踪任务默认 num_envs=4096，即在一块 GPU 上同时仿真 4096 个机器人副本，用 PPO 训练行走策略。","related":["GPU 并行仿真","大规模并行强化学习","Isaac Lab","Isaac Gym","仿真吞吐量","近端策略优化"]},{"id":"gpu-accelerated-parallel-simulation","category":"sim","sec":0,"tier":2,"sources":[{"title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning (arXiv 2108.10470)","url":"https://arxiv.org/abs/2108.10470"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)","url":"https://arxiv.org/abs/2109.11978"}],"as_of":"","related_ids":["vectorized-environments","isaac-gym","nvidia-isaac-lab","massively-parallel-reinforcement-learning","mujoco-xla","legged-gym"],"name":"GPU 并行仿真","alt":"GPU-Accelerated Parallel Simulation","abbr":"","aliases":["大规模并行仿真","Massively Parallel Simulation","GPU 加速仿真"],"one_liner":"在一张 GPU 上同时跑成千上万个仿真环境，把机器人训练从几天缩到几分钟。","explanation":"GPU 并行仿真指把物理仿真也放到 GPU 上，同时推进成千上万个互相独立的仿真环境，并让仿真状态直接以张量形式交给 PyTorch 等框架训练网络，省去 CPU 和 GPU 之间来回拷数据。2021 年英伟达的 Isaac Gym 把这条路线推向主流，论文称比「CPU 仿真 + GPU 训练」的传统做法快 2–3 个数量级。最直接的受益者是强化学习：采样变便宜后，足式行走、灵巧手操作等策略能在单卡上几十分钟内训出来。当前常用平台有 Isaac Lab、MuJoCo MJX 与 MuJoCo Warp、Genesis、ManiSkill3、Brax 等。代价是场景要写成批量化形式，复杂接触和高质量渲染会明显拖慢速度。","example":"ETH 的 Rudin 等人在单块 GPU 上并行模拟数千台 ANYmal 四足机器人，平地行走策略不到 4 分钟训完，崎岖地形约 20 分钟，并成功迁移到真机。","related":["并行环境","Isaac Gym","Isaac Lab","大规模并行强化学习","MJX","legged_gym"]},{"id":"simulation-throughput","category":"sim","sec":0,"tier":3,"sources":[{"title":"arXiv 2108.10470 - Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","url":"https://arxiv.org/abs/2108.10470"},{"title":"arXiv 2109.11978 - Learning to Walk in Minutes Using Massively Parallel Deep RL","url":"https://arxiv.org/abs/2109.11978"},{"title":"arXiv 2410.00425 - ManiSkill3","url":"https://arxiv.org/abs/2410.00425"}],"as_of":"","related_ids":["gpu-accelerated-parallel-simulation","vectorized-environments","real-time-factor","massively-parallel-reinforcement-learning","batched-rendering","sample-efficiency"],"name":"仿真吞吐量","alt":"Simulation Throughput (Steps / Frames Per Second)","abbr":"","aliases":["仿真 FPS","每秒步数","Steps Per Second"],"one_liner":"仿真器每秒能产出多少环境步或帧，决定造数据和训练有多快","explanation":"仿真吞吐量指仿真器单位时间内产出的交互数据量，常用每秒环境步数（steps per second）或每秒帧数（FPS）表示；在 GPU 并行仿真里，通常把成千上万个并行环境的步数加总来算。强化学习往往需要上亿步交互，吞吐量直接决定一次训练要几天还是几分钟。2021 年英伟达的 Isaac Gym 把物理仿真和神经网络都放在 GPU 上、数据不经过 CPU，报告比「CPU 仿真 + GPU 训练」的做法快 2 到 3 个数量级。影响吞吐量的主要因素有并行环境数、模型和接触的复杂度、仿真步长与子步数、求解器迭代次数，以及是否渲染相机图像（带渲染通常慢得多）。它和实时因子不同，后者衡量单个环境比真实时间快多少倍。横向比较时要看同一任务、同一硬件、是否渲染。","example":"ETH 的 legged_gym 工作在单张 GPU 上同时仿真数千只 ANYmal 四足机器人，平地行走策略不到 4 分钟训完，崎岖地形约 20 分钟；ManiSkill3 报告带渲染的仿真在其基准环境中可达每秒 3 万帧以上。","related":["GPU 并行仿真","并行环境","实时因子","大规模并行强化学习","批量渲染","样本效率"]},{"id":"headless-mode","category":"sim","sec":0,"tier":3,"sources":[{"title":"Isaac Lab API: isaaclab.app (AppLauncher)","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.app.html"},{"title":"google-deepmind/dm_control README: Rendering","url":"https://github.com/google-deepmind/dm_control"}],"as_of":"2026-09","related_ids":["nvidia-isaac-lab","nvidia-isaac-sim","mujoco","batched-rendering","gpu-accelerated-parallel-simulation","simulation-throughput"],"name":"无头模式","alt":"Headless Mode","abbr":"","aliases":["--headless","无界面运行","无头渲染"],"one_liner":"不开图形窗口运行仿真器，常用于在服务器上批量训练和采集数据。","explanation":"指程序在没有图形界面（GUI）的情况下运行。在具身智能里主要指把 Isaac Sim / Isaac Lab、MuJoCo 等仿真器放到没有显示器的 GPU 服务器上跑：不弹窗口、不实时显示画面，省下开销，让训练和数据生成更快。Isaac Lab 的脚本加 --headless 参数即可，官方文档的解释就是「以无界面模式启动」；如果环境里有相机要出图，还需加 --enable_cameras，走离屏渲染。MuJoCo 系工具用环境变量 MUJOCO_GL=egl 在 GPU 上做无窗口渲染，osmesa 则是纯 CPU 软件渲染。注意无头不等于不渲染，只是不显示；想远程看画面可用 Isaac Lab 的 livestream 功能或录视频。","example":"在服务器上运行 python scripts/reinforcement_learning/rsl_rl/train.py --task=Isaac-Cartpole-v0 --headless，不开窗口训练倒立摆。","related":["Isaac Lab","Isaac Sim","MuJoCo","批量渲染","GPU 并行仿真","仿真吞吐量"]},{"id":"simulation-fidelity","category":"sim","sec":0,"tier":2,"sources":[{"title":"Choi et al., On the use of simulation in robotics: Opportunities, challenges, and suggestions for moving forward (PNAS 2021)","url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC7817170/"},{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)","url":"https://arxiv.org/abs/2405.05941"}],"as_of":"","related_ids":["sim-to-real-gap","physics-engine","rendering","sensor-simulation","digital-twin","domain-randomization"],"name":"仿真保真度","alt":"Simulation Fidelity","abbr":"","aliases":["物理保真度","视觉保真度"],"one_liner":"仿真和真实世界有多像：物理上算得准不准，看起来像不像。","explanation":"仿真保真度通常分两块：物理保真度，看动力学、接触、摩擦、柔性物体、电机特性算得准不准；视觉或传感器保真度，看渲染图像、深度、激光雷达读数和真实传感器是否一致。保真度越高虚实差距越小，但计算越慢。Choi 等人 2021 年在 PNAS 的综述指出，游戏引擎追求「看着合理」而非精确，实际使用常要减少求解迭代次数、用刚性地面代替可变形地面等妥协。所以实践中常配合域随机化、系统辨识；SIMPLER 等工作也表明，做策略评测不一定需要完全逼真的数字孪生。","example":"SIMPLER 没有重建完整的数字孪生，只用绿幕贴真实背景、对齐纹理并辨识控制参数，就让仿真评测成绩与真机强相关。","related":["虚实差距","物理引擎","渲染","传感器仿真","数字孪生","域随机化"]},{"id":"rigid-body-simulation","category":"sim","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Rigid body dynamics","url":"https://en.wikipedia.org/wiki/Rigid_body_dynamics"},{"title":"MuJoCo Documentation: Overview","url":"https://mujoco.readthedocs.io/en/stable/overview.html"}],"as_of":"","related_ids":["physics-engine","rigid-body-dynamics","articulated-body-simulation","contact-model","deformable-body-simulation","mujoco"],"name":"刚体仿真","alt":"Rigid-Body Simulation","abbr":"","aliases":["刚体动力学仿真","Rigid Body Simulation","Rigid-Body Dynamics Simulation"],"one_liner":"假设物体不会变形，只计算它们平移、转动和相互碰撞的物理仿真。","explanation":"刚体仿真是物理引擎最基础、用得最多的部分。它假设物体受力后形状不变，每个物体的状态只需位置、姿态、速度和角速度来描述。仿真按固定步长推进：每一步先做碰撞检测找出接触点，再由接触模型和约束求解器算出接触力、摩擦力和关节约束力，最后用积分器按牛顿-欧拉方程更新状态。机器人通常被建模成若干刚体连杆由关节相连（关节体），所以四足行走、机械臂搭积木这类任务都在刚体仿真里完成。MuJoCo、PhysX、Bullet 都以刚体仿真为核心。它处理不了布料、绳子、液体和软物体，这些要靠软体、布料或流体仿真；接触和摩擦也只是近似，是虚实差距的主要来源之一。","example":"机械臂把一块方块推下桌：方块和桌面都被当作不会变形的刚体，引擎每一步检测方块与桌边、地面的碰撞，算出接触力和摩擦力，再积分出下一时刻方块的位置和转角。","related":["物理引擎","刚体动力学","关节体仿真","接触模型","软体仿真","MuJoCo"]},{"id":"articulated-body-simulation","category":"sim","sec":1,"tier":2,"sources":[{"title":"NVIDIA PhysX 5 Documentation: Articulations","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/Articulations.html"},{"title":"MuJoCo Documentation: Computation","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"Wikipedia: Featherstone's algorithm","url":"https://en.wikipedia.org/wiki/Featherstone%27s_algorithm"}],"as_of":"","related_ids":["rigid-body-simulation","articulated-body-algorithm","generalized-coordinates","generalized-coordinates-vs-cartesian-coordinates","physx","mujoco"],"name":"关节体仿真","alt":"Articulated-Body Simulation (Articulation)","abbr":"","aliases":["多刚体仿真","Articulation","铰接体仿真"],"one_liner":"把机器人当作由关节串起来的一组刚体，计算它怎么运动、受多大力的仿真。","explanation":"机器人由连杆（刚性零件）和关节连成树状结构，关节体仿真就是专门计算这类系统运动的技术。做法有两种：一种把每个连杆当独立刚体，再用约束把它们连住（最大坐标），关节可能慢慢漂移、拉开；另一种只用根部位姿加各关节角描述整台机器人（约化坐标，也叫广义坐标），关节天然不会脱开，Featherstone 1987 年的著作给出了这类高效算法。PhysX 的 Articulation 和 MuJoCo 都走约化坐标路线，PhysX 文档称它关节误差为零、能承受更大的质量比，计算量随自由度而不是连杆数增长。代价是只支持树状结构，并联踝关节这类闭链要额外加约束。","example":"在 Isaac Sim 里导入 Franka 机械臂的 URDF，会得到一个固定基座的 Articulation：7 个转动关节加 2 个手指移动关节，仿真状态就是这 9 个关节的位置和速度。","related":["刚体仿真","铰接体算法","广义坐标","关节坐标仿真 vs 笛卡尔坐标仿真（约化坐标 / 最大坐标）","PhysX","MuJoCo"]},{"id":"generalized-coordinates-vs-cartesian-coordinates","category":"sim","sec":1,"tier":3,"sources":[{"title":"MuJoCo Documentation: Overview","url":"https://mujoco.readthedocs.io/en/stable/overview.html"},{"title":"PhysX 5 Documentation: Articulations","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/Articulations.html"}],"as_of":"","related_ids":["generalized-coordinates","articulated-body-simulation","multibody-dynamics","constraint-solver","mujoco","physx"],"name":"关节坐标仿真 vs 笛卡尔坐标仿真（约化坐标 / 最大坐标）","alt":"Generalized (Reduced) Coordinates vs. Cartesian (Maximal) Coordinates Simulation","abbr":"","aliases":["广义坐标仿真","约化坐标","最大坐标","Reduced-coordinate Articulation","Maximal Coordinates"],"one_liner":"物理引擎描述多连杆机器人的两种方式：按关节角算，还是各刚体单独算再加约束。","explanation":"仿真一台由多个连杆和关节组成的机器人，有两种建模思路。关节坐标（又叫广义坐标、约化坐标）只用各关节的角度或位移描述状态，关节约束天然成立、不会被拉开，变量数等于自由度数，适合机械臂和足式机器人；MuJoCo 和 PhysX 的 articulation 都属于这类，代价是算法更复杂，通常要求连杆结构是树状，闭环要额外加约束。笛卡尔坐标（又叫最大坐标）让每个刚体都有完整的 6 个自由度，再用约束把它们连起来，实现简单，游戏物理引擎常这么做，但约束靠数值求解，结构复杂或连杆质量相差悬殊时关节可能漂移、抖动。选仿真器、排查仿真不稳定时需要知道这一区别。","example":"PhysX 里同一条机械臂既能用刚体加关节约束搭（最大坐标），也能用 articulation 搭（约化坐标）；官方文档说明后者关节误差按设计为零、能承受更大的连杆质量比，因此推荐用于机器人。","related":["广义坐标","关节体仿真","多体动力学","约束求解器","MuJoCo","PhysX"]},{"id":"collision-detection-2","category":"sim","sec":1,"tier":2,"sources":[{"title":"MuJoCo Documentation: Computation - Collision detection","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"NVIDIA PhysX 5 Documentation: Rigid Body Collision","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/RigidBodyCollision.html"}],"as_of":"","related_ids":["collision-geometry","broad-phase-narrow-phase-collision-detection","gilbert-johnson-keerthi-algorithm","bounding-volume","collision-filtering","continuous-collision-detection"],"name":"碰撞检测（物理引擎）","alt":"Collision Detection","abbr":"","aliases":["broad phase / narrow phase","粗检测/细检测","宽相/窄相检测"],"one_liner":"物理引擎每一步找出哪些物体碰上了、碰在哪、穿进去多深。","explanation":"碰撞检测是物理引擎每个仿真步都要做的一环，输出一份接触列表（接触点、法向、穿透深度），再交给求解器算接触力。场景里 n 个物体两两配对有 n(n−1)/2 种，逐对精算太慢，所以一般分两级：粗检测（broad phase）用包围盒排序等廉价方法，如扫掠剪枝（sweep-and-prune），快速排除明显碰不到的物体对；细检测（narrow phase）再对剩下的对按形状精确计算，凸体之间常用 GJK/EPA 算法。MuJoCo 在两级之间还加了一层基于包围盒层次树的中间检测，并用 contype/conaffinity 位掩码跳过不需要检测的对。注意它和机器人本体安全里检测真实撞击的「碰撞检测」不是一回事。","example":"MuJoCo 里一台机器人和桌面、方块的所有几何体，先经扫掠剪枝筛出可能相碰的物体对，再做包围球测试过滤；最后，球、盒子这类基本形状之间用解析公式直接算，涉及网格的物体对（网格先换成凸包）交给 GJK/EPA，算出接触点和穿透深度。","related":["碰撞体","宽相 / 窄相碰撞检测","GJK 算法","包围盒","碰撞过滤（碰撞组）","连续碰撞检测（隧穿问题）"]},{"id":"collision-geometry","category":"sim","sec":1,"tier":2,"sources":[{"title":"Isaac Sim Documentation: Simulation Fundamentals（Collision approximations）","url":"https://docs.isaacsim.omniverse.nvidia.com/latest/physics/simulation_fundamentals.html"},{"title":"MuJoCo Documentation: Computation - Collision detection","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"}],"as_of":"","related_ids":["convex-decomposition","convex-decomposition","collision-detection-2","unified-robot-description-format","signed-distance-field-function","interpenetration"],"name":"碰撞体","alt":"Collision Geometry (Collider)","abbr":"","aliases":["碰撞网格","碰撞形状","Collision Mesh","Collider","视觉网格 vs 碰撞网格"],"one_liner":"物理引擎用来算碰撞的简化形状，通常和画面上看到的模型不是同一个。","explanation":"仿真里的物体一般有两套几何：视觉网格用于渲染，面数多、追求好看；碰撞体交给物理引擎做碰撞检测，追求算得快、算得稳。碰撞体通常是球、胶囊、盒子等基本形状，或凸包（能包住物体的最小凸多面体），因为这些形状有高效的碰撞算法。MuJoCo 会把用户给的非凸网格自动换成凸包参与碰撞；Isaac Sim 默认也用凸包，需要更贴合时可以选凸分解（把物体拆成多个凸块）或 SDF（符号距离场）网格。碰撞体太粗，杯子会被当成实心、把手抓不住；太细又拖慢仿真。URDF 里每个连杆分别写 <visual> 和 <collision>，就是这个区分。","example":"一只马克杯如果只用一个凸包当碰撞体，杯口会被封住，仿真里放不进勺子；用 CoACD 等工具凸分解成多个凸块后，杯壁、杯底和把手才能分别参与碰撞。","related":["凸分解","CoACD / V-HACD 凸分解工具","碰撞检测（物理引擎）","统一机器人描述格式","符号距离场","穿模"]},{"id":"convex-decomposition","category":"sim","sec":1,"tier":3,"sources":[{"title":"Approximate Convex Decomposition for 3D Meshes with Collision-Aware Concavity and Tree Search (CoACD, SIGGRAPH 2022)","url":"https://arxiv.org/abs/2205.02961"},{"title":"V-HACD GitHub 仓库（已归档，指向 CoACD）","url":"https://github.com/kmammou/v-hacd"},{"title":"MuJoCo 文档 Modeling（mesh geom 碰撞时被凸化）","url":"https://mujoco.readthedocs.io/en/stable/modeling.html"}],"as_of":"2026-09","related_ids":["collision-geometry","collision-detection-2","convex-decomposition","simulation-assets","mujoco","interpenetration"],"name":"凸分解","alt":"Convex Decomposition (Approximate Convex Decomposition)","abbr":"","aliases":["近似凸分解","Approximate Convex Decomposition","ACD","CoACD","V-HACD"],"one_liner":"把凹形网格切成若干近似凸块，给仿真当碰撞体用","explanation":"物理引擎做碰撞检测时，凸形状（任意两点连线都在形状内部）算得快又稳定，所以 MuJoCo 等引擎会把网格碰撞体自动换成它的凸包（能包住它的最小凸形状）。杯子、碗、抽屉这类凹形物体直接取凸包，开口会被「封死」，东西放不进去。凸分解就是把凹网格切成若干近似凸的小块，每块各取凸包，拼起来逼近原形状。常用工具有两个：V-HACD（Karim Mammou 写的体素化分层近似凸分解，现已停止维护）和 CoACD（UC San Diego Hao Su 团队 SIGGRAPH 2022 的工作，用「碰撞感知凹度」加树搜索选切割平面，细节保留得更好，可 pip 安装）。准备仿真资产时，物体网格进仿真器前通常先跑一遍凸分解。","example":"一个马克杯网格若只用一个凸包，杯口被填平，仿真里的勺子放不进去；用 CoACD 分解成若干凸块后，杯壁和把手各自成块，杯内空间得以保留。","related":["碰撞体","碰撞检测（物理引擎）","CoACD / V-HACD 凸分解工具","仿真资产","MuJoCo","穿模"]},{"id":"signed-distance-field-function","category":"sim","sec":1,"tier":3,"sources":[{"title":"Wikipedia - Signed distance function","url":"https://en.wikipedia.org/wiki/Signed_distance_function"}],"as_of":"","related_ids":["truncated-signed-distance-function","euclidean-signed-distance-field","collision-detection-2","collision-checking","covariant-hamiltonian-optimization-for-motion-planning","implicit-vs-explicit-3d-representation"],"name":"符号距离场","alt":"Signed Distance Field / Function","abbr":"SDF","aliases":["有符号距离场","符号距离函数","Signed Distance Function"],"one_liner":"给出空间每一点到物体表面的距离、并用正负号区分内外的函数","explanation":"符号距离场是定义在空间上的一个函数：给任意一点，返回它到最近物体表面的距离，并用正负号区分在物体内部还是外部（机器人和图形学里常用外正内负，数学文献里也有相反约定），物体表面就是函数值为 0 的位置。它的梯度模长处处为 1，梯度方向就是离开表面最快的方向。这两个性质让它在具身智能里很好用：仿真器可以直接用它查穿透深度和接触法向来做碰撞检测；运动规划用它算机器人离障碍物还有多远、该往哪边避让；三维重建和神经隐式表示也常把物体表面表示成一个 SDF。注意，同名缩写的 SDFormat 是 Gazebo 的场景描述文件格式，和这里不是一回事。","example":"规划机械臂轨迹时，先把桌面和障碍物建成符号距离场，查询每个连杆上采样点的 SDF 值，若小于安全距离就沿梯度方向把轨迹推开，CHOMP 等优化式规划器就是这样避障的。","related":["截断符号距离函数","欧氏符号距离场","碰撞检测（物理引擎）","碰撞检查","CHOMP","隐式表示 / 显式表示"]},{"id":"broad-phase-narrow-phase-collision-detection","category":"sim","sec":1,"tier":3,"sources":[{"title":"MuJoCo Documentation: Computation - Collision detection","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html#collision"},{"title":"NVIDIA PhysX 5 SDK Documentation: Rigid Body Collision","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/RigidBodyCollision.html"},{"title":"Wikipedia: Collision detection","url":"https://en.wikipedia.org/wiki/Collision_detection"}],"as_of":"","related_ids":["collision-detection-2","bounding-volume","gilbert-johnson-keerthi-algorithm","collision-filtering","collision-geometry","physics-engine"],"name":"宽相 / 窄相碰撞检测","alt":"Broad-phase / Narrow-phase Collision Detection","abbr":"","aliases":["宽阶段 / 窄阶段","粗检测 / 精检测","近相（near-phase）"],"one_liner":"碰撞检测分两步：先用包围盒粗筛可能相撞的对，再精确算接触。","explanation":"物理引擎每一步都要找出哪些物体接触了。n 个几何体两两组合有 n(n-1)/2 对，全部精确检查太慢，所以分阶段做。宽相只用简单包围体（如轴对齐包围盒 AABB）做保守判断，快速排除明显不相交的对，只报告「可能碰撞」；常用算法是扫掠剪枝（sweep-and-prune，按坐标轴排序后找区间重叠）。窄相再对剩下的候选对调用按几何类型定制的精确算法（如凸体之间的 GJK/EPA），算出是否接触、接触点、法向和穿透深度，交给约束求解器。MuJoCo 在两者之间还有一层中相，用包围盒层次树继续筛选；PhysX 提供 SAP、MBP、GPU 等多种宽相算法。碰撞过滤一般插在宽相和窄相之间。","example":"MuJoCo 的宽相用改进的 sweep-and-prune，排序轴取所有几何体中心的协方差矩阵主特征向量；窄相里，非凸网格会被替换成它的凸包再检测。","related":["碰撞检测（物理引擎）","包围盒","GJK 算法","碰撞过滤（碰撞组）","碰撞体","物理引擎"]},{"id":"collision-filtering","category":"sim","sec":1,"tier":3,"sources":[{"title":"MuJoCo Documentation: Computation - Collision detection (Selection)","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html#collision"},{"title":"NVIDIA PhysX 5 SDK Documentation: Rigid Body Collision - Collision Filtering","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/RigidBodyCollision.html"},{"title":"Isaac Lab API: isaaclab.scene (InteractiveSceneCfg.filter_collisions)","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.scene.html"}],"as_of":"2026-09","related_ids":["broad-phase-narrow-phase-collision-detection","collision-detection-2","self-collision-checking","collision-geometry","mjcf","vectorized-environments"],"name":"碰撞过滤（碰撞组）","alt":"Collision Filtering (Collision Groups)","abbr":"","aliases":["碰撞组","contype/conaffinity","碰撞掩码","碰撞层"],"one_liner":"事先规定哪些物体之间不算碰撞，既省计算又避免不该有的接触。","explanation":"仿真里并非所有物体对都要算碰撞：机器人相邻连杆在关节处本来就挨在一起，同时训练的上千个并行环境之间也不该互相碰到。碰撞过滤就是在宽相之后、窄相之前把这些物体对丢掉。常见做法是给几何体配位掩码。MuJoCo 里每个 geom 有 contype 和 conaffinity 两个整数，只有一方的 contype 与另一方的 conaffinity 至少有一位同为 1 才检测，这套机制借自 ODE 引擎，默认两者都是 1；此外 MuJoCo 默认跳过同一刚体、父子刚体之间的碰撞，也能用 exclude 显式排除。PhysX 用过滤着色器（filter shader）实现类似分组。设错了会出现夹爪抓不住物体、脚穿过地面等问题。","example":"Isaac Lab 的 InteractiveSceneCfg 默认 filter_collisions=True，克隆出的各个环境之间互不碰撞，但可以都与地面这类全局物体碰撞。","related":["宽相 / 窄相碰撞检测","碰撞检测（物理引擎）","自碰撞检测","碰撞体","MJCF","并行环境"]},{"id":"continuous-collision-detection","category":"sim","sec":1,"tier":3,"sources":[{"title":"NVIDIA PhysX 5 SDK Documentation: Advanced Collision Detection - Continuous Collision Detection","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/AdvancedCollisionDetection.html"},{"title":"Wikipedia: Collision detection","url":"https://en.wikipedia.org/wiki/Collision_detection"},{"title":"MuJoCo Documentation: Computation - Convex collisions","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html#convex-collisions"}],"as_of":"","related_ids":["collision-detection-2","interpenetration","simulation-timestep","substeps","broad-phase-narrow-phase-collision-detection","physx"],"name":"连续碰撞检测（隧穿问题）","alt":"Continuous Collision Detection (Tunneling)","abbr":"CCD","aliases":["连续碰撞检测","隧穿","tunnelling"],"one_liner":"按物体在一步内的运动轨迹找碰撞，防止高速物体直接穿过障碍物。","explanation":"普通的离散碰撞检测只在每个时间步末尾检查物体是否重叠。物体很快或很薄时，一步之内可能从障碍物一侧直接跳到另一侧，前后两次检查都不重叠，碰撞就被漏掉，这就是隧穿（tunneling）。连续碰撞检测沿物体在这一步内扫过的轨迹求最早接触时刻，在穿过之前处理碰撞，代价是更耗算力，速度越快、物体越密越明显。PhysX 要在场景、物体对、刚体三处分别打开 CCD，另有更便宜的推测式 CCD（按速度放大接触距离）。另一种常见对策是减小仿真步长或增加子步。注意：MuJoCo 文档里的 CCD 指「凸碰撞检测」（convex collision detection），不是连续碰撞检测。","example":"仿真里快速挥动的细棍或抛出的小球在大步长下直接穿过桌面，开启 CCD 或减小仿真步长后恢复正常。","related":["碰撞检测（物理引擎）","穿模","仿真步长","子步","宽相 / 窄相碰撞检测","PhysX"]},{"id":"interpenetration","category":"sim","sec":1,"tier":2,"sources":[{"title":"MuJoCo Documentation: Computation (Soft contacts)","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"NVIDIA PhysX 5 Docs: Advanced Collision Detection","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/AdvancedCollisionDetection.html"}],"as_of":"","related_ids":["collision-geometry","soft-contact-model","continuous-collision-detection","simulation-timestep","convex-decomposition","solver-iteration-count"],"name":"穿模","alt":"Interpenetration","abbr":"","aliases":["穿透","Penetration","Clipping"],"one_liner":"仿真或动画里本该挡住的两个物体互相穿进对方体内的错误现象。","explanation":"穿模原是游戏和动画圈的说法，指模型互相穿插；在机器人仿真里指两个碰撞体交叠，比如手指插进桌面、脚陷进地面。物理引擎本身允许少量穿透：MuJoCo 用软接触模型，按穿透深度产生接触力；PhysX 也把穿透当作负距离，逐步加大接触力把物体推开。问题在于穿得太深，常见原因有步长太大、求解器迭代不够、碰撞体太薄或太粗糙、物体太快（整个穿过去叫隧穿）。穿模会让接触力和抓取结果失真，策略甚至学会利用穿透「作弊」，上真机就失效。对策包括减小步长、加子步和迭代次数、用凸分解做碰撞体、开启连续碰撞检测。动捕数据里脚穿地面也叫穿模。","example":"在仿真里训练抓取时，如果杯子的碰撞体是很薄的空心网格，手指可能直接穿进杯壁，仿真里算「抓住了」，真机上却抓不起来；改用凸分解后的碰撞体并增加求解器迭代次数通常能缓解。","related":["碰撞体","软接触","连续碰撞检测（隧穿问题）","仿真步长","凸分解","求解器迭代次数"]},{"id":"contact-model","category":"sim","sec":1,"tier":2,"sources":[{"title":"MuJoCo Documentation: Computation - Soft contact model","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"Isaac Sim Documentation: Simulation Fundamentals","url":"https://docs.isaacsim.omniverse.nvidia.com/latest/physics/simulation_fundamentals.html"}],"as_of":"","related_ids":["soft-contact-model","linear-complementarity-problem","friction-cone","constraint-solver","collision-detection-2","coulomb-friction"],"name":"接触模型","alt":"Contact Model","abbr":"","aliases":["接触动力学","Contact Dynamics"],"one_liner":"物理引擎里规定两个物体接触时产生多大力、怎么摩擦的数学规则。","explanation":"碰撞检测只回答「碰没碰、碰在哪」，接触模型回答「接触后受多大的力」：法向力阻止物体互相穿透，切向摩擦力阻止滑动，摩擦力大小受摩擦锥限制，不超过摩擦系数乘以法向力。经典做法是硬接触，把「没接触就没有力、有力就不能穿透」写成互补条件，归结为线性互补问题（LCP），带摩擦时是 NP 难问题，各引擎多用近似解法。MuJoCo 采用软接触：允许少量穿透，把接触力写成一个凸优化问题的唯一解，用 solref、solimp 等参数调软硬。接触模型准不准，直接影响抓取、插孔、足式行走这类依赖接触的任务能否从仿真迁移到真机。","example":"在 MuJoCo 中，geom 的 condim 设为 3 时只算法向力和平面内的滑动摩擦；设为 4 会加上扭转摩擦，官方文档说这有助于模拟软指尖、让抓取更稳；设为 6 再加滚动摩擦。","related":["软接触","线性互补问题","摩擦锥","约束求解器","碰撞检测（物理引擎）","库仑摩擦"]},{"id":"soft-contact-model","category":"sim","sec":1,"tier":3,"sources":[{"title":"MuJoCo 文档 - Computation","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"MuJoCo 文档 - Modeling（solref / solimp）","url":"https://mujoco.readthedocs.io/en/stable/modeling.html"}],"as_of":"","related_ids":["contact-model","linear-complementarity-problem","mujoco","interpenetration","projected-gauss-seidel","simulation-timestep"],"name":"软接触","alt":"Soft Contact Model","abbr":"","aliases":["软接触模型","Soft Contact","柔性约束"],"one_liner":"允许物体间有微小穿透、按弹簧阻尼方式产生接触力的接触建模方式","explanation":"软接触是物理引擎处理接触的一类建模方式。经典的硬接触要求物体绝不互相穿透，并用互补条件（有接触力时两物体不能分离，分离时就没有接触力）来描述，求解困难、数值上也容易不稳定。软接触放宽了这一要求：允许少量穿透，把接触当成带弹簧和阻尼的约束，穿得越深力越大。MuJoCo 是典型代表，它去掉了线性互补问题里的严格互补条件，把接触写成凸优化问题，用 solref（时间常数和阻尼比，默认 0.02 与 1）和 solimp（约束阻抗，决定有多软）两组参数调节。好处是求解稳定、结果平滑，还能唯一地做逆动力学；代价是参数设得不当会出现明显穿模或物体发弹，做仿真到现实迁移时常要调这些参数去贴近真实材料。","example":"在 MuJoCo 中把夹爪指尖接触的 solref 时间常数调大，接触会变软、允许更深的穿透，抓取时接触力变化更平缓；时间常数若设得比仿真步长还小，接触就容易不稳定。","related":["接触模型","线性互补问题","MuJoCo","穿模","投影高斯-赛德尔求解器","仿真步长"]},{"id":"constraint-solver","category":"sim","sec":1,"tier":3,"sources":[{"title":"MuJoCo Documentation: Computation - Constraint solver","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html#constraint-solver"},{"title":"NVIDIA PhysX 5 SDK Documentation: Rigid Body Dynamics - Constraint Solver","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/RigidBodyDynamics.html"}],"as_of":"2026-09","related_ids":["solver-iteration-count","projected-gauss-seidel","linear-complementarity-problem","contact-model","soft-contact-model","physics-engine"],"name":"约束求解器","alt":"Constraint Solver","abbr":"","aliases":["接触求解器","约束解算器"],"one_liner":"物理引擎里算接触力和关节约束力的模块，保证物体不穿透、关节不脱开。","explanation":"碰撞检测只告诉引擎「哪里接触了」，接触处要多大的支撑力和摩擦力、关节要多大的力才能保持连接，由约束求解器算。这些力要同时满足不穿透、摩擦力不超过摩擦锥等条件，本质是互补问题或优化问题，通常迭代求解。投影高斯-赛德尔（PGS）每次只更新一个约束分量，反复扫多遍；PhysX 5.1 起加入时间高斯-赛德尔（TGS），把一步拆成若干子步求解，官方文档称一般更推荐 TGS。MuJoCo 把约束力定义为一个凸优化问题的唯一全局解，提供 PGS、共轭梯度（CG）和默认的牛顿法三种求解器。迭代不够会导致穿模、关节漂移、抓取打滑，这是调仿真参数的重点。","example":"PhysX 刚体默认 4 次位置迭代、1 次速度迭代；灵巧手抓取这类接触和关节都多的场景，常需调高位置迭代次数。","related":["求解器迭代次数","投影高斯-赛德尔求解器","线性互补问题","接触模型","软接触","物理引擎"]},{"id":"linear-complementarity-problem","category":"sim","sec":1,"tier":3,"sources":[{"title":"Linear complementarity problem - Wikipedia","url":"https://en.wikipedia.org/wiki/Linear_complementarity_problem"},{"title":"MuJoCo Documentation: Computation","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"ODE Manual","url":"http://ode.org/wiki/index.php/Manual"}],"as_of":"","related_ids":["contact-model","constraint-solver","projected-gauss-seidel","coulomb-friction","soft-contact-model","physics-engine"],"name":"线性互补问题","alt":"Linear Complementarity Problem","abbr":"LCP","aliases":[],"one_liner":"求两组非负变量「一个为正另一个就为零」的数学问题，经典接触力求解就归结为它。","explanation":"线性互补问题由 Cottle 和 Dantzig 在 1968 年提出：给定矩阵 M 和向量 q，找非负向量 z 和 w，使 w = Mz + q，并且 z 与 w 对应分量中至少有一个为零（互补条件）。放到仿真里，它正好描述接触：两个物体之间要么有间隙、接触力为零，要么贴在一起、接触力为正，两者不会同时为正，物理引擎每一步都要解出满足这类条件的接触力。ODE 的接触与摩擦模型就基于 Dantzig 的 LCP 求解器，游戏引擎常用投影高斯-赛德尔等迭代法近似求解。MuJoCo 则指出带摩擦的 LCP 属 NP 难问题，改用放松互补条件的凸软接触模型。","example":"箱子静放在桌上时，法向间隙为 0、支持力为正；箱子被抬离桌面后，间隙为正、支持力变为 0。求解器每一步解的就是这组互补条件。","related":["接触模型","约束求解器","投影高斯-赛德尔求解器","库仑摩擦","软接触","物理引擎"]},{"id":"projected-gauss-seidel","category":"sim","sec":1,"tier":3,"sources":[{"title":"PhysX 5 文档：Rigid Body Dynamics（Solver Type: PGS / TGS）","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/RigidBodyDynamics.html"},{"title":"Gazebo Classic 教程：Physics Parameters（quick 求解器为 PGS）","url":"https://classic.gazebosim.org/tutorials?tut=physics_params"},{"title":"Isaac Lab API：isaaclab.sim（PhysxCfg.solver_type 默认 TGS）","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.sim.html"}],"as_of":"2026-09","related_ids":["constraint-solver","linear-complementarity-problem","solver-iteration-count","physx","mujoco","contact-model"],"name":"投影高斯-赛德尔求解器","alt":"Projected Gauss-Seidel","abbr":"PGS","aliases":["Projective Gauss-Seidel","TGS（时间高斯-赛德尔，Temporal Gauss-Seidel）"],"one_liner":"物理引擎中逐个约束迭代求解接触力、并截断到合法范围的经典方法。","explanation":"物理引擎每一步都要算出接触点和关节上的力（或冲量），保证物体不穿透、摩擦力不超限，这本质上是带不等式条件的方程组，常写成线性互补问题（LCP）。PGS 是求解它的经典迭代法：一次只处理一个约束，假定其他约束的力不变，算出它该给多大的力，再把结果「投影」（截断）到合法范围，如法向力不能为负、摩擦力不能超出摩擦锥；所有约束轮一遍算一次迭代，迭代越多越准也越慢。ODE 的 quick 求解器、PhysX 和 MuJoCo 都提供 PGS。PhysX 5.1 起加入 TGS（时间高斯-赛德尔），把时间步切成若干子步、每个子步求解一次约束并立即积分，对大质量比和关节驱动更准，官方推荐使用，Isaac Lab 也默认 TGS。仿真配置里的「位置/速度迭代次数」就是这类求解器的迭代轮数。","example":"在 Isaac Lab 里灵巧手握着的方块在指间抖动或慢慢滑落时，常见的排查方法是确认求解器用的是 TGS，并调高位置迭代次数。","related":["约束求解器","线性互补问题","求解器迭代次数","PhysX","MuJoCo","接触模型"]},{"id":"solver-iteration-count","category":"sim","sec":1,"tier":3,"sources":[{"title":"NVIDIA PhysX 5 文档 - Rigid Body Dynamics","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/RigidBodyDynamics.html"},{"title":"Isaac Lab API - isaaclab.sim（PhysxCfg）","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.sim.html"},{"title":"Isaac Lab 源码 - franka.py","url":"https://github.com/isaac-sim/IsaacLab/blob/main/source/isaaclab_assets/isaaclab_assets/robots/franka.py"}],"as_of":"2026-09","related_ids":["constraint-solver","projected-gauss-seidel","simulation-timestep","substeps","simulation-instability","physx"],"name":"求解器迭代次数","alt":"Solver Iteration Count (Position / Velocity Iterations)","abbr":"","aliases":["位置迭代次数","速度迭代次数","solver_position_iteration_count"],"one_liner":"物理引擎每一步反复修正接触和关节约束的轮数，越多越准也越慢","explanation":"物理引擎每推进一个仿真步，都要同时满足所有接触和关节约束，通常用高斯-赛德尔这类迭代法一轮轮逼近，轮数就是求解器迭代次数。以英伟达 PhysX（Isaac Sim / Isaac Lab 的物理内核）为例，它分为位置迭代和速度迭代：前者修正穿透和关节错位，后者修正速度误差，默认值是 4 次位置迭代、1 次速度迭代。官方说明迭代越多结果越准，但一般只有关节多、对关节误差容忍度低的物体才需要明显调高。PhysX 还提供 PGS 和 TGS 两种求解器，TGS 收敛更好但单次迭代稍慢。迭代不够时常见关节松垮、物体抖动或互相穿透，调高则会拖慢仿真吞吐量。它和仿真步长、子步数一起，是调仿真稳定性时最常改的参数。","example":"Isaac Lab 自带的 Franka 机械臂配置把 solver_position_iteration_count 设为 8、solver_velocity_iteration_count 设为 0，位置迭代比 PhysX 默认的 4 次更多；每个物体可以各设各的，仿真时取场景中最大值并限制在 1 到 255 之间。","related":["约束求解器","投影高斯-赛德尔求解器","仿真步长","子步","仿真爆炸","PhysX"]},{"id":"numerical-integrator","category":"sim","sec":1,"tier":3,"sources":[{"title":"MuJoCo Documentation: Computation - Numerical Integration","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html"},{"title":"Gaffer On Games: Integration Basics","url":"https://gafferongames.com/post/integration_basics/"}],"as_of":"2026-09","related_ids":["physics-engine","simulation-timestep","substeps","simulation-instability","mujoco","constraint-solver"],"name":"积分器","alt":"Numerical Integrator (Semi-implicit Euler / RK4)","abbr":"","aliases":["数值积分器","半隐式欧拉","辛欧拉","RK4","四阶龙格-库塔","隐式积分"],"one_liner":"物理引擎里根据当前受力，把速度和位置往前推进一个时间步的数值方法。","explanation":"物理引擎每一步先算出加速度，再由积分器把速度、位置推进到下一时刻。最朴素的显式欧拉用旧速度更新位置，在弹簧类系统里会不断「凭空增能」直至发散；半隐式欧拉只调换顺序，先更新速度、再用新速度更新位置，精度同为一阶却稳定得多，多数游戏物理引擎用它。RK4（四阶龙格-库塔）每步算四次导数，精度高但计算量约为四倍；隐式积分把阻尼等速度相关力的导数纳入求解，能承受更大步长。MuJoCo 默认 Euler（半隐式，带隐式关节阻尼），官方推荐多数模型改用 implicitfast。积分器与仿真步长共同决定仿真会不会「爆炸」。","example":"在 MuJoCo 模型文件的 option 元素里把 integrator 设为 implicitfast，保持默认 timestep 0.002 秒，通常比默认的 Euler 更稳定，计算量相近。","related":["物理引擎","仿真步长","子步","仿真爆炸","MuJoCo","约束求解器"]},{"id":"simulation-instability","category":"sim","sec":1,"tier":2,"sources":[{"title":"MuJoCo Documentation: Computation - Numerical integration","url":"https://mujoco.readthedocs.io/en/stable/computation/index.html#numerical-integration"},{"title":"MuJoCo Documentation: XML Reference (option/flag autoreset)","url":"https://mujoco.readthedocs.io/en/stable/XMLreference.html#option-flag-autoreset"}],"as_of":"","related_ids":["simulation-timestep","numerical-integrator","constraint-solver","interpenetration","solver-iteration-count","mujoco"],"name":"仿真爆炸","alt":"Simulation Instability (Blow-up)","abbr":"","aliases":["数值不稳定","数值爆炸","NaN 爆炸","Simulation Blow-up","Numerical Instability"],"one_liner":"物理仿真数值发散，机器人抽搐、物体乱飞，状态变成 NaN 或极大值。","explanation":"仿真爆炸是物理仿真里的常见故障：积分器每一步算出的速度、加速度越滚越大，最后变成 NaN（非数）或天文数字，画面上表现为机器人剧烈抖动、零件飞出、物体穿透后被弹飞。常见原因有仿真步长太大、关节 PD 增益（位置控制的刚度和阻尼）设得太硬、质量或惯量参数不合理、初始时刻物体互相穿插、约束求解器迭代次数不够。MuJoCo 文档明确说步长过大会让仿真不稳定；引擎每步检查加速度是否为 NaN 或超出上限，发现后发出警告并默认自动重置。做大规模并行强化学习时，一个环境产生的 NaN 可能污染整批训练数据，所以通常要检测并单独重置出问题的环境。","example":"在 MuJoCo 里把步长调大、同时把关节刚度设得很高，机械臂可能几步之内就剧烈抖动、状态变成 NaN，MuJoCo 会报加速度异常（BADQACC）警告并自动重置仿真。","related":["仿真步长","积分器","约束求解器","穿模","求解器迭代次数","MuJoCo"]},{"id":"deformable-body-simulation","category":"sim","sec":2,"tier":2,"sources":[{"title":"NVIDIA PhysX 5 Documentation: Soft Bodies","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/SoftBodies.html"},{"title":"SoftGym: Benchmarking Deep Reinforcement Learning for Deformable Object Manipulation (arXiv 2011.07215)","url":"https://arxiv.org/abs/2011.07215"},{"title":"Genesis GitHub 仓库","url":"https://github.com/Genesis-Embodied-AI/Genesis"}],"as_of":"","related_ids":["finite-element-method","material-point-method","position-based-dynamics","cloth-simulation","deformable-object-manipulation","softgym-benchmarking-deep-reinforcement-learning-for-deforma"],"name":"软体仿真","alt":"Deformable-Body Simulation","abbr":"","aliases":["可变形体仿真","Soft-Body Simulation","柔性体仿真"],"one_liner":"模拟布、绳、海绵、面团、液体这类会变形物体的物理仿真。","explanation":"刚体仿真假设物体形状不变，几个数就能描述位姿；软体仿真要处理受力会变形的物体，状态变成成百上千个节点或粒子的位置，计算量和数值难度都高得多。常用方法有：有限元法（FEM，把物体切成四面体网格，按杨氏模量、泊松比等材料参数算形变，适合弹性体）、基于位置的动力学（PBD，快且稳，常用于布和绳）、物质点法（MPM，适合面团、沙子这类大变形材料）。PhysX 的软体用 GPU 上的 FEM；Genesis 集成了 FEM、MPM、PBD/SPH 等求解器。它是叠衣服、揉面等柔性物体操作研究的基础，但和真实材料的差距通常比刚体仿真更大。","example":"SoftGym（CoRL 2020）基于粒子仿真器 NVIDIA FleX，提供铺平布料、折布、拉直绳子、倒水等任务，用来测试强化学习算法操作可变形物体的能力。","related":["有限元法","物质点法","基于位置的动力学","布料仿真","柔性物体操作","SoftGym"]},{"id":"cloth-simulation","category":"sim","sec":2,"tier":3,"sources":[{"title":"Wikipedia: Cloth modeling","url":"https://en.wikipedia.org/wiki/Cloth_modeling"},{"title":"SoftGym: Benchmarking Deep Reinforcement Learning for Deformable Object Manipulation (arXiv 2011.07215)","url":"https://arxiv.org/abs/2011.07215"},{"title":"MuJoCo Documentation: Modeling - Deformable objects","url":"https://mujoco.readthedocs.io/en/stable/modeling.html#deformable-objects"}],"as_of":"","related_ids":["deformable-body-simulation","garment-manipulation","deformable-object-manipulation","position-based-dynamics","finite-element-method","softgym-benchmarking-deep-reinforcement-learning-for-deforma"],"name":"布料仿真","alt":"Cloth Simulation","abbr":"","aliases":["布料建模","织物仿真"],"one_liner":"在计算机里模拟布料拉伸、弯曲、褶皱和碰撞，衣物操作研究离不开它。","explanation":"布料仿真是软体仿真的一类，计算机图形学从 1980 年代就开始研究。早期几何方法（如 Weil 1986）只用悬链线近似褶皱形状，不管动力学；物理方法把布料看成弹簧相连的质点网格，考虑拉伸、剪切、弯曲和重力；更精细的做法用能量模型或有限元。难点在于布料很薄、极易自碰撞和穿模，拉伸方向又很硬，步长稍大就容易数值发散。机器人研究常用的实现有基于粒子的 NVIDIA FleX，以及 MuJoCo 的 flex 可变形体（可做绳、布和体积软体）。真实布料的物理参数难以测准，所以布料任务的虚实差距通常比刚体任务大。","example":"SoftGym（CoRL 2020）基于 NVIDIA FleX 提供展平布料、对折布料、让布料平铺落地等任务，用来测试强化学习在柔性物体操作上的表现。","related":["软体仿真","衣物操作","柔性物体操作","基于位置的动力学","有限元法","SoftGym"]},{"id":"fluid-simulation","category":"sim","sec":2,"tier":3,"sources":[{"title":"Fluid animation - Wikipedia","url":"https://en.wikipedia.org/wiki/Fluid_simulation"},{"title":"SoftGym project page","url":"https://sites.google.com/view/softgym"},{"title":"Genesis Documentation: What is Genesis","url":"https://genesis-world.readthedocs.io/en/latest/user_guide/overview/what_is_genesis.html"}],"as_of":"","related_ids":["smoothed-particle-hydrodynamics","material-point-method","position-based-dynamics","deformable-body-simulation","softgym-benchmarking-deep-reinforcement-learning-for-deforma","genesis"],"name":"流体仿真","alt":"Fluid Simulation","abbr":"","aliases":["流体模拟","液体仿真"],"one_liner":"用数值方法在计算机里模拟水、烟等流体怎么流动、怎么受力。","explanation":"流体仿真指用计算机近似求解描述流体运动的方程（通常是纳维-斯托克斯方程），算出液体、气体的速度和压力随时间怎么变。追求科学精度的一支叫计算流体力学（CFD），用于飞机、管道等工程设计；图形学和机器人仿真更看重速度和看起来合理。常见做法分三类：网格法（欧拉法，在固定格子上记录流速）、粒子法（拉格朗日法，如光滑粒子流体动力学 SPH，把流体看成一大群粒子），以及两者结合的 FLIP、物质点法等。具身智能里，倒水、端汤、清理洒出的液体等任务都需要它；由于粒子数量多、还要和机械臂、容器耦合，计算量远大于刚体仿真，往往要在精度和速度之间取舍。","example":"SoftGym 基准中的 PourWater（把水全部倒进目标杯子）和 TransportWater（端着一杯水移到目标位置且不洒）任务；Genesis 用 SPH 求解器模拟液体。","related":["光滑粒子流体动力学","物质点法","基于位置的动力学","软体仿真","SoftGym","Genesis"]},{"id":"finite-element-method","category":"sim","sec":2,"tier":3,"sources":[{"title":"Finite element method - Wikipedia","url":"https://en.wikipedia.org/wiki/Finite_element_method"},{"title":"PhysX 5 Documentation: Soft Bodies","url":"https://nvidia-omniverse.github.io/PhysX/physx/5.4.1/docs/SoftBodies.html"},{"title":"Genesis Documentation: What is Genesis","url":"https://genesis-world.readthedocs.io/en/latest/user_guide/overview/what_is_genesis.html"}],"as_of":"","related_ids":["deformable-body-simulation","material-point-method","position-based-dynamics","deformable-object-manipulation","physics-engine","genesis"],"name":"有限元法","alt":"Finite Element Method","abbr":"FEM","aliases":["有限元分析","FEA","Finite Element Analysis"],"one_liner":"把物体切成许多小单元分别近似求解、再拼成整体的数值计算方法。","explanation":"有限元法是求解偏微分方程的通用数值方法：把连续的物体或区域划分成大量简单的小块（单元，常见三角形、四面体），在每个单元上用简单函数近似，再组装成整体方程求解。它起源于上世纪 40–50 年代的结构力学研究，Courant 等人奠定了基础，之后成为结构强度、传热、流体、电磁等工程分析的标准工具。在具身智能里，FEM 主要用于软体仿真：刚体仿真把物体当成不会变形的整体，而抓海绵、捏软包装、设计软体夹爪时，需要算出物体怎么变形、内部受力多大，就要靠 FEM。代价是计算量大，网格越细越准也越慢，需要在精度和速度之间取舍。","example":"PhysX 5（Isaac Sim 的物理底层）的软体仿真用 FEM 加两套四面体网格：一套较粗的网格负责算变形，一套贴合表面的网格负责碰撞，且只支持 GPU 运行；Genesis 也内置了 FEM 求解器。","related":["软体仿真","物质点法","基于位置的动力学","柔性物体操作","物理引擎","Genesis"]},{"id":"position-based-dynamics","category":"sim","sec":2,"tier":3,"sources":[{"title":"Position Based Dynamics (Müller et al., VRIPHYS 2006)","url":"https://matthias-research.github.io/pages/publications/posBasedDyn.pdf"},{"title":"XPBD: Position-Based Simulation of Compliant Constrained Dynamics (Macklin et al., MIG 2016)","url":"https://matthias-research.github.io/pages/publications/XPBD.pdf"},{"title":"Newton Physics 文档：Solvers（SolverXPBD）","url":"https://newton-physics.github.io/newton/latest/api/newton_solvers.html"}],"as_of":"2026-09","related_ids":["cloth-simulation","deformable-body-simulation","constraint-solver","physics-engine","newton-physics-engine","projected-gauss-seidel"],"name":"基于位置的动力学","alt":"Position-Based Dynamics","abbr":"PBD","aliases":["XPBD（扩展的基于位置的动力学，Extended PBD）","位置动力学"],"one_liner":"直接修正物体位置来满足约束的仿真方法，稳定快速，常用于布料和软体。","explanation":"由 Matthias Müller 等人（当时在物理引擎公司 AGEIA）2006 年在 VRIPHYS 研讨会提出。常规仿真先算力、再由加速度积分出速度和位置，时间步一大就容易冲过头甚至发散。PBD 跳过力和速度这一层：先按惯性预测每个粒子的新位置，再逐个检查约束（如两点间距离不变、不能穿进地面），把违反约束的点直接「投影」回合法位置，迭代几轮后用位置变化反推速度。它稳定、可控、碰撞处理简单，最早用于游戏里的实时布料。缺点是材料软硬会随迭代次数和时间步变化；2016 年英伟达的 Macklin 等人提出 XPBD，引入柔度（刚度的倒数）和拉格朗日乘子，使刚度与这两者无关，还能估计约束力。英伟达 Newton 物理引擎内置了 XPBD 求解器，可仿真刚体和软体。","example":"仿真一块桌布：把布离散成粒子网格，相邻粒子之间加「距离不变」约束，每步把被拉长的边两端往回拉，几轮迭代后布料就会自然垂下而不会被无限拉长。","related":["布料仿真","软体仿真","约束求解器","物理引擎","Newton 物理引擎","投影高斯-赛德尔求解器"]},{"id":"material-point-method","category":"sim","sec":2,"tier":3,"sources":[{"title":"Material point method - Wikipedia","url":"https://en.wikipedia.org/wiki/Material_point_method"},{"title":"PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics (arXiv 2104.03311)","url":"https://arxiv.org/abs/2104.03311"},{"title":"Genesis 文档：What is Genesis","url":"https://genesis-world.readthedocs.io/en/latest/user_guide/overview/what_is_genesis.html"}],"as_of":"","related_ids":["deformable-body-simulation","finite-element-method","smoothed-particle-hydrodynamics","differentiable-simulation","genesis","deformable-object-manipulation"],"name":"物质点法","alt":"Material Point Method","abbr":"MPM","aliases":["物质点方法"],"one_liner":"用粒子携带材料状态、借背景网格计算受力的连续体仿真方法。","explanation":"物质点法是一种欧拉-拉格朗日混合的数值方法：把物体离散成大量「物质点」，粒子携带质量、速度、应力等全部状态；每一步把信息映射到固定的背景网格上求解动量方程，再把结果传回粒子。它源于 1957 年 Harlow 提出的质点网格法（PIC），1993 年起由 Sulsky 等人发展成现在的形式。与有限元法相比，它不用反复重划网格，适合雪、沙、泥、橡皮泥这类大变形、会断裂或流动的材料，迪士尼《冰雪奇缘》的雪就用它模拟；代价是内存和计算开销大。具身智能里它用于柔性物体操作仿真，Genesis 等仿真器内置了 MPM 求解器。","example":"PlasticineLab 基准用可微的 MLS-MPM（移动最小二乘物质点法）模拟橡皮泥，让智能体学习把橡皮泥捏成目标形状。","related":["软体仿真","有限元法","光滑粒子流体动力学","可微仿真","Genesis","柔性物体操作"]},{"id":"smoothed-particle-hydrodynamics","category":"sim","sec":2,"tier":3,"sources":[{"title":"Wikipedia - Smoothed-particle hydrodynamics","url":"https://en.wikipedia.org/wiki/Smoothed-particle_hydrodynamics"},{"title":"GitHub - Genesis-Embodied-AI/Genesis","url":"https://github.com/Genesis-Embodied-AI/Genesis"}],"as_of":"","related_ids":["fluid-simulation","position-based-dynamics","material-point-method","finite-element-method","genesis","deformable-body-simulation"],"name":"光滑粒子流体动力学","alt":"Smoothed Particle Hydrodynamics","abbr":"SPH","aliases":["光滑粒子流体力学","平滑粒子流体动力学"],"one_liner":"把流体拆成大量粒子、用邻近粒子加权求和来计算运动的无网格仿真方法","explanation":"光滑粒子流体动力学由 Gingold、Monaghan 和 Lucy 在 1977 年提出，最初用于天体物理中模拟星系和恒星形成。它不划分网格，而是把流体看成一群随流体一起运动的粒子（拉格朗日方法，即跟着物质点走）：每个粒子的密度、压力等物理量，由「光滑长度」范围内的邻近粒子按核函数加权求和得到，再据此算出受力、推进粒子。因为不需要网格，它天然适合自由液面、飞溅、倒水这类形状剧烈变化的流动，也被广泛用于计算机图形学和游戏里的流体效果。在具身智能里，要让机器人学倒水、舀液体时会用到它，例如 Genesis 仿真器就集成了 SPH 求解器。代价是粒子一多计算量很大，也不容易精确保持液体的不可压缩性。","example":"在 Genesis 中用 SPH 粒子表示杯中的水，训练机械臂把水倒进另一只杯子，以洒出的粒子数作为惩罚。","related":["流体仿真","基于位置的动力学","物质点法","有限元法","Genesis","软体仿真"]},{"id":"discrete-element-method","category":"sim","sec":2,"tier":3,"sources":[{"title":"Discrete element method - Wikipedia","url":"https://en.wikipedia.org/wiki/Discrete_element_method"}],"as_of":"","related_ids":["material-point-method","finite-element-method","deformable-body-simulation","physics-engine","smoothed-particle-hydrodynamics","contact-model"],"name":"离散元法","alt":"Discrete Element Method","abbr":"DEM","aliases":["离散单元法","Distinct Element Method"],"one_liner":"把材料当成大量独立颗粒、逐个算受力和运动的仿真方法","explanation":"离散元法是一类把材料看成大量独立小颗粒、逐个计算每颗粒运动的数值仿真方法，Peter Cundall 在 1971 年提出雏形，1979 年与 Strack 正式发表。每个时间步先找出哪些颗粒相互接触，按接触模型算出碰撞力、摩擦力，再加上重力，用数值积分更新每颗粒的位置、速度和转动。和有限元法那种把材料当连续体的方法不同，DEM 天然适合沙子、碎石、谷物、粉末这类颗粒物料，在采矿、制药、农业中应用广泛。缺点是计算量大，颗粒越多越慢，现在多靠 GPU 并行来算百万量级颗粒。在具身智能里，它可用于仿真机器人在沙地、碎石上行走，或者挖掘、舀取颗粒物料；这类问题也可以用物质点法（MPM）处理。","example":"用 DEM 模拟一片沙地，让四足机器人的足端踩进去，计算每颗沙粒被推开时的受力，研究机器人在沙滩上下陷和打滑的情况。","related":["物质点法","有限元法","软体仿真","物理引擎","光滑粒子流体动力学","接触模型"]},{"id":"incremental-potential-contact","category":"sim","sec":2,"tier":3,"sources":[{"title":"Incremental Potential Contact project page","url":"https://ipc-sim.github.io/"},{"title":"ipc-sim (GitHub organization)","url":"https://github.com/ipc-sim"}],"as_of":"","related_ids":["contact-model","interpenetration","continuous-collision-detection","deformable-body-simulation","finite-element-method","cloth-simulation"],"name":"增量势接触","alt":"Incremental Potential Contact","abbr":"IPC","aliases":["IPC 接触算法","障碍势接触"],"one_liner":"用障碍势能保证物体永不相互穿透的接触仿真算法，擅长软体大变形接触。","explanation":"IPC 由宾夕法尼亚大学、Adobe 研究院和纽约大学的 Minchen Li 等人提出，发表于 SIGGRAPH 2020（ACM TOG）。传统物理引擎常允许物体先穿进去一点再推开，时间步一大就容易穿模或数值爆炸。IPC 把每个隐式时间步写成一个优化问题，在物体距离趋近零时加入急剧增大的障碍势能（barrier），配合结合连续碰撞检测的线搜索，保证整条轨迹无相交、网格单元不翻转，且不受材料、步长和变形程度影响，也支持摩擦。代价是计算量大，速度远不如 MuJoCo 这类刚体引擎。后续有面向布料和杆件的 C-IPC、刚体版 rigid-ipc，以及可嵌入其他仿真器的 IPC Toolkit。","example":"论文演示中，IPC 在单个时间步处理多达约 49.8 万个接触、230 万个四面体的场景，时间步从 2×10⁻⁵ 秒到 2 秒都保持无穿透。","related":["接触模型","穿模","连续碰撞检测（隧穿问题）","软体仿真","有限元法","布料仿真"]},{"id":"differentiable-simulation","category":"sim","sec":2,"tier":2,"sources":[{"title":"DiffTaichi: Differentiable Programming for Physical Simulation (arXiv 1910.00935)","url":"https://arxiv.org/abs/1910.00935"},{"title":"A Review of Differentiable Simulators (arXiv 2407.05560)","url":"https://arxiv.org/abs/2407.05560"},{"title":"Do Differentiable Simulators Give Better Policy Gradients? (arXiv 2202.00817)","url":"https://arxiv.org/abs/2202.00817"}],"as_of":"","related_ids":["physics-engine","mujoco-xla","brax","nvidia-warp","trajectory-optimization","system-identification"],"name":"可微仿真","alt":"Differentiable Simulation","abbr":"","aliases":["可微物理","Differentiable Physics","可微物理引擎"],"one_liner":"能对仿真结果求梯度的仿真器，可以直接用梯度下降优化动作或物理参数。","explanation":"普通仿真器只能正向算出「给这个动作，下一步会怎样」；可微仿真器还能用自动微分反向算出结果对动作、初始状态或物理参数（质量、摩擦等）的梯度。这样就能像训练神经网络一样，用梯度下降直接优化控制序列、策略网络或辨识物理参数，不必像强化学习那样靠大量试错来估计梯度。代表工作有 ICLR 2020 的 DiffTaichi、谷歌的 Brax，以及 MuJoCo 的 JAX 版 MJX（其 Warp 后端不支持自动微分）。难点在接触：碰撞让动力学出现突变，梯度可能很大、很噪或为零；Suh 等人在 ICML 2022 的研究指出，刚度和不连续性会削弱这类一阶梯度的效果。","example":"DiffTaichi 论文实现了 10 个可微仿真器，用它们优化神经网络控制器时，通常几十次迭代就能收敛。","related":["物理引擎","MJX","Brax","Warp","轨迹优化","系统辨识"]},{"id":"rendering","category":"sim","sec":3,"tier":2,"sources":[{"title":"Wikipedia: Rendering (computer graphics)","url":"https://en.wikipedia.org/wiki/Rendering_(computer_graphics)"},{"title":"ManiSkill3: GPU Parallelized Robotics Simulation and Rendering (arXiv 2410.00425)","url":"https://arxiv.org/abs/2410.00425"}],"as_of":"","related_ids":["rasterization","ray-tracing","path-tracing","photorealistic-rendering","batched-rendering","headless-mode"],"name":"渲染","alt":"Rendering (Rendering Engine)","abbr":"","aliases":["渲染引擎","渲染器","Renderer"],"one_liner":"把三维场景算成相机图像的过程，仿真里相机类传感器的数据都靠它生成。","explanation":"渲染是计算机图形学术语，指根据三维模型、材质、灯光和相机参数计算出二维图像。主要方法有光栅化（把三角形投影到屏幕上逐像素着色，速度快，游戏和多数实时仿真用它）以及光线追踪、路径追踪（模拟光线传播，更真实但更慢）。在机器人仿真里，物理引擎负责算物体怎么动，渲染器负责「拍照」：生成 RGB 图、深度图、分割掩码等相机观测，供视觉策略训练和评测，也用于给人看的可视化。渲染质量决定视觉上的虚实差距大小，渲染速度则常是视觉强化学习的瓶颈，所以 ManiSkill3、Isaac Lab 等都做了 GPU 批量渲染。训练时不开图形窗口运行叫无头模式。","example":"ManiSkill3 把物理仿真和渲染都放在 GPU 上并行执行，论文报告带渲染的仿真在基准环境中可达每秒 3 万帧以上，比其他平台快 10 到 1000 倍，显存占用少 2 到 3 倍。","related":["光栅化","光线追踪","路径追踪","照片级真实感渲染","批量渲染","无头模式"]},{"id":"rasterization","category":"sim","sec":3,"tier":3,"sources":[{"title":"NVIDIA Blog: What's the Difference Between Ray Tracing and Rasterization?","url":"https://blogs.nvidia.com/blog/whats-difference-between-ray-tracing-rasterization/"},{"title":"Wikipedia: Rasterisation","url":"https://en.wikipedia.org/wiki/Rasterisation"},{"title":"ManiSkill 文档：Sensors / Cameras（shader packs）","url":"https://maniskill.readthedocs.io/en/latest/user_guide/concepts/sensors.html"}],"as_of":"","related_ids":["rendering","ray-tracing","batched-rendering","photorealistic-rendering","sim-to-real-gap","sensor-simulation"],"name":"光栅化","alt":"Rasterization","abbr":"","aliases":["光栅化渲染","Rasterisation"],"one_liner":"把三维三角形投影到屏幕并逐像素上色的渲染方法，速度快，是实时图形主流。","explanation":"渲染（把三维场景变成二维图像）的两大基本方法之一，另一种是光线追踪。三维物体通常由大量三角形拼成，光栅化先把每个三角形的顶点投影到屏幕上，找出它覆盖的像素，再按纹理和光照给像素上色，并用深度缓冲（z-buffer，记录每个像素离相机最近的深度）决定谁挡住谁。GPU 为这套流程做了专门的硬件流水线，速度极快，游戏和大多数实时 3D 引擎都以它为主。代价是阴影、反射、折射、间接光照都要靠近似技巧，真实感不如光线追踪。在具身仿真里，MuJoCo 自带的 OpenGL 渲染器、ManiSkill 的非光追着色器都属于光栅化，适合给大量并行环境快速出图训练视觉策略；需要照片级真实感、缩小视觉上的虚实差距时才改用光线追踪。","example":"训练一个看图抓方块的视觉策略时，用光栅化给几百个并行仿真环境同时渲染腕部相机画面，速度够快，但玻璃杯的折射和金属反光会显得不真实。","related":["渲染","光线追踪","批量渲染","照片级真实感渲染","虚实差距","传感器仿真"]},{"id":"ray-tracing","category":"sim","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Ray tracing (graphics)","url":"https://en.wikipedia.org/wiki/Ray_tracing_(graphics)"},{"title":"Omniverse 文档：RTX Renderer（Real-Time 2.0 / Interactive Path Tracing）","url":"https://docs.omniverse.nvidia.com/materials-and-rendering/latest/rtx-renderer.html"},{"title":"NVIDIA Blog: What's the Difference Between Ray Tracing and Rasterization?","url":"https://blogs.nvidia.com/blog/whats-difference-between-ray-tracing-rasterization/"}],"as_of":"2026-09","related_ids":["rendering","rasterization","path-tracing","photorealistic-rendering","nvidia-isaac-sim","sensor-simulation"],"name":"光线追踪","alt":"Ray Tracing","abbr":"","aliases":["光追","光线跟踪","RTX 渲染"],"one_liner":"从相机反向追踪光线的反射、折射来生成图像的渲染方法，真实感高但慢。","explanation":"渲染的两大基本方法之一。它从相机出发为每个像素发射光线，算出光线先碰到哪个物体，再继续追踪反射、折射和射向光源的阴影光线，因此能自然得到镜面反射、透明物体折射和柔和阴影。路径追踪是它的进阶形式，让光线随机多次弹射来近似全局光照，最逼真也最慢。光追计算量大，长期只用于电影等离线渲染；2018 年英伟达推出带 RT 核心（专门加速光线求交的硬件）的 GeForce RTX 显卡后，实时光追才普及，「RTX 渲染」的叫法即由此而来。Isaac Sim 所用的 Omniverse RTX 渲染器基于路径追踪，RTX 激光雷达等传感器仿真也依赖它。在具身智能中，光追用于生成照片级合成数据、仿真透明和反光物体，以缩小视觉上的虚实差距，代价是出图比光栅化慢得多。","example":"在 Isaac Sim 中用路径追踪模式渲染装了水的玻璃杯，得到接近真实相机的折射和高光图像，用来训练识别透明物体的抓取模型。","related":["渲染","光栅化","路径追踪","照片级真实感渲染","Isaac Sim","传感器仿真"]},{"id":"path-tracing","category":"sim","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Path tracing","url":"https://en.wikipedia.org/wiki/Path_tracing"},{"title":"Omniverse Docs: RTX Interactive (Path Tracing) Mode","url":"https://docs.omniverse.nvidia.com/materials-and-rendering/latest/rtx-renderer_pt.html"},{"title":"Physically Based Rendering: From Theory to Implementation, 4th ed. (online)","url":"https://www.pbr-book.org/4ed/contents"}],"as_of":"2026-09","related_ids":["ray-tracing","rasterization","physically-based-rendering","photorealistic-rendering","rendering","nvidia-isaac-sim"],"name":"路径追踪","alt":"Path Tracing","abbr":"","aliases":["路径跟踪","蒙特卡洛光线追踪"],"one_liner":"用大量随机光线路径模拟光在场景里的多次反弹，渲染出物理上逼真画面的方法。","explanation":"路径追踪由 Jim Kajiya 在 1986 年提出，他在同一篇论文里给出了渲染方程（描述光在场景中如何传播的积分方程），并用蒙特卡洛积分（随机采样后求平均）近似求解。做法是从相机为每个像素发出光线，碰到表面后按材质随机选一个方向继续反弹，一路累计光照，因此能自然得到间接光照、软阴影、焦散等效果。代价是样本少时画面有噪点，要靠大量采样或神经网络降噪。它属于光线追踪家族，比光栅化慢得多，传统上用于电影等离线渲染。机器人仿真中，Isaac Sim 所用的 Omniverse RTX 渲染器提供路径追踪模式，可生成更接近照片的合成图像，但速度不如实时模式。","example":"Omniverse 的 RTX Interactive（Path Tracing）模式默认每帧每像素采 1 个样本、最多累积 512 个，并默认开启 OptiX 降噪器。","related":["光线追踪","光栅化","基于物理的渲染","照片级真实感渲染","渲染","Isaac Sim"]},{"id":"physically-based-rendering","category":"sim","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Physically based rendering","url":"https://en.wikipedia.org/wiki/Physically_based_rendering"},{"title":"LearnOpenGL: PBR Theory","url":"https://learnopengl.com/PBR/Theory"},{"title":"Physically Based Rendering: From Theory to Implementation, 4th ed. (online)","url":"https://www.pbr-book.org/4ed/contents"}],"as_of":"","related_ids":["path-tracing","ray-tracing","rendering","photorealistic-rendering","simready-assets","sim-to-real-gap"],"name":"基于物理的渲染","alt":"Physically Based Rendering","abbr":"PBR","aliases":["PBR 材质","物理渲染","金属度-粗糙度工作流"],"one_liner":"按真实光学规律建模光照和材质的渲染思路，让物体在任何光照下看起来都可信。","explanation":"PBR 指依照真实世界的光学原理来描述光源和表面材质的渲染方法。这个说法在 1990 年代出现，随 Pharr 等人的同名教材流行，后经迪士尼、Epic Games 推向实时渲染，如今是 Unreal、Unity、Blender 的标准做法。它一般满足三条：用微表面模型描述表面粗糙程度；能量守恒，反射出去的光不多于入射光；采用符合物理的 BRDF（描述表面如何反射光的函数）。材质通常用基础色（albedo）、法线、金属度、粗糙度等贴图描述。仿真器用上 PBR 材质，相机画面里的反光和高光才接近真实，这是缩小视觉虚实差距的前提之一。","example":"同一只不锈钢锅，把金属度设为 1、粗糙度调低，渲染出来有清晰的高光和环境反射；把粗糙度调高，就变成磨砂质感。","related":["路径追踪","光线追踪","渲染","照片级真实感渲染","SimReady 资产","虚实差距"]},{"id":"photorealistic-rendering","category":"sim","sec":3,"tier":2,"sources":[{"title":"Wikipedia: Rendering (computer graphics)","url":"https://en.wikipedia.org/wiki/Rendering_(computer_graphics)"},{"title":"NVIDIA Omniverse: RTX Renderer","url":"https://docs.omniverse.nvidia.com/materials-and-rendering/latest/rtx-renderer.html"},{"title":"GraspVLA (arXiv 2505.03233)","url":"https://arxiv.org/abs/2505.03233"}],"as_of":"2025-05","related_ids":["rendering","path-tracing","physically-based-rendering","sim-to-real-gap","gaussian-splatting-based-simulation","synthetic-data"],"name":"照片级真实感渲染","alt":"Photorealistic Rendering","abbr":"","aliases":["照片级渲染","真实感渲染","Photo-realistic Rendering"],"one_liner":"按真实光学规律计算画面，让仿真图像看起来像真实相机拍的照片。","explanation":"照片级真实感渲染指模拟光线在场景里的传播、反射和折射，让生成的图像接近真实照片，常用路径追踪（用蒙特卡洛方法随机采样大量光路来算全局光照）配合基于物理的材质。在具身智能里，它主要用来缩小视觉上的虚实差距：视觉策略在仿真里看到的画面越像真实相机，迁到真机时越不容易因画面差异失效；合成训练数据、相机传感器仿真也依赖它。代价是算得慢，大规模并行训练常退回较快的光栅化或降低画质。英伟达 Omniverse / Isaac Sim 的 RTX 渲染器提供实时和路径追踪两档；另一条路线是用 3D 高斯泼溅从真实拍摄重建场景，直接得到照片感画面。","example":"银河通用的 GraspVLA 在 Isaac Sim 中用光线追踪渲染生成约 10 亿帧的合成抓取数据集 SynGrasp-1B，同时随机化点光源、平行光、环境光和约两千种桌面、地面、墙面纹理，用 160 块 RTX 4090 跑了约 10 天。","related":["渲染","路径追踪","基于物理的渲染","虚实差距","高斯泼溅仿真","合成数据"]},{"id":"batched-rendering","category":"sim","sec":3,"tier":3,"sources":[{"title":"Isaac Lab Documentation: Camera (Tiled Rendering)","url":"https://isaac-sim.github.io/IsaacLab/main/source/overview/core-concepts/sensors/camera.html"},{"title":"ManiSkill3: GPU Parallelized Robotics Simulation and Rendering for Generalizable Embodied AI (arXiv 2410.00425)","url":"https://arxiv.org/abs/2410.00425"},{"title":"MuJoCo Playground (arXiv 2502.08844)","url":"https://arxiv.org/abs/2502.08844"}],"as_of":"2026-09","related_ids":["gpu-accelerated-parallel-simulation","vectorized-environments","rendering","nvidia-isaac-lab","maniskill","massively-parallel-reinforcement-learning"],"name":"批量渲染","alt":"Batched / Tiled Rendering","abbr":"","aliases":["并行渲染","平铺渲染","Tiled Camera","批量渲染器（Batch Renderer）"],"one_liner":"一次性渲染成百上千个并行环境的相机画面，给视觉策略训练高速供图。","explanation":"GPU 并行仿真能同时跑几千个环境，但若每个环境的相机单独渲染、单独拷贝，图像带宽就成了瓶颈：Isaac Lab 文档估算，一张 800×600 的浮点图接近 2MB，60 帧每秒就要 120MB/s，还要乘以相机数和环境数。批量渲染把所有环境里同一台相机合并处理。以 Isaac Lab 的 TiledCamera 为例（Isaac Sim 4.2.0 起支持），所有克隆相机共用一个渲染产物，各环境的画面按格子拼成一张大图，一次同步就能交给训练端。ManiSkill3 的 SAPIEN 并行渲染、MuJoCo Playground 自带的批量渲染器也提供类似能力。它让从像素学习的视觉运动策略也能用大规模并行强化学习来训练。","example":"在 Isaac Lab 里用 TiledCameraCfg 把相机路径写成 /World/envs/env_.*/Camera，就能一次拿到所有环境的 80×80 RGB 图；官方建议在 RTX 4090 级显卡上放约 512 个相机。","related":["GPU 并行仿真","并行环境","渲染","Isaac Lab","ManiSkill","大规模并行强化学习"]},{"id":"sensor-simulation","category":"sim","sec":3,"tier":2,"sources":[{"title":"Isaac Sim 文档：Sensors","url":"https://docs.isaacsim.omniverse.nvidia.com/latest/sensors/index.html"},{"title":"Choi et al., On the use of simulation in robotics (PNAS 2021)","url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC7817170/"}],"as_of":"","related_ids":["rendering","ray-tracing","tactile-simulation","sim-to-real-gap","simulation-fidelity","visual-randomization"],"name":"传感器仿真","alt":"Sensor Simulation","abbr":"","aliases":["相机/激光雷达/IMU 仿真","Sensor Modeling"],"one_liner":"在仿真器里生成相机、激光雷达、IMU、力传感器等的模拟读数。","explanation":"传感器仿真指仿真器根据虚拟场景状态，算出各传感器「应该读到什么」。相机图像和深度图靠渲染；激光雷达、雷达靠发射虚拟射线或光线追踪算距离；IMU（惯性测量单元）读数来自刚体的加速度和角速度；接触力、关节力矩取自物理求解器。做得好的还会加入噪声、畸变、延迟、深度缺失等真实传感器的毛病。英伟达 Isaac Sim 把传感器分为相机类、RTX 光线追踪类（激光雷达、雷达、声学）和基于物理的类（接触、IMU 等）。策略看到的正是这些读数，和真机差太多就会造成虚实差距。","example":"Isaac Sim 提供基于光线追踪的 RTX 激光雷达和雷达仿真；robosuite v1.5 也加入了传感器模型。","related":["渲染","光线追踪","触觉仿真","虚实差距","仿真保真度","视觉随机化"]},{"id":"tactile-simulation","category":"sim","sec":3,"tier":3,"sources":[{"title":"TACTO: A Fast, Flexible, and Open-source Simulator for High-Resolution Vision-based Tactile Sensors (arXiv 2012.08456)","url":"https://arxiv.org/abs/2012.08456"},{"title":"Taxim: An Example-based Simulation Model for GelSight Tactile Sensors (arXiv 2109.04027)","url":"https://arxiv.org/abs/2109.04027"},{"title":"TacSL: A Library for Visuotactile Sensor Simulation and Learning (arXiv 2408.06506)","url":"https://arxiv.org/abs/2408.06506"}],"as_of":"","related_ids":["vision-based-tactile-sensor","tacto-a-fast-flexible-and-open-source-simulator-for-high-res","taxim-an-example-based-simulation-model-for-gelsight-tactile","tacsl-a-library-for-visuotactile-sensor-simulation-and-learn","sensor-simulation","tactile-image"],"name":"触觉仿真","alt":"Tactile Simulation","abbr":"","aliases":["触觉传感器仿真","Tactile Sensor Simulation"],"one_liner":"在仿真器里模拟触觉传感器读数，让带触觉的策略能在仿真中训练。","explanation":"触觉仿真指在物理仿真器中生成触觉传感器应有的输出，比如视触觉传感器（用内置相机拍弹性胶面形变的传感器，如 GelSight、DIGIT）的触觉图像、胶面标记点的位移，或压阻阵列的压力分布。难点是要同时处理接触、软材料形变、光照和成像，既要像真的，又要算得快。常见做法大致三类：拿渲染器按接触几何直接渲染触觉图像，如 Meta 开源的 TACTO；用少量真实样例标定查找表，如卡内基梅隆大学的 Taxim；用 GPU 并行计算接触力场和图像，如英伟达的 TacSL。它让仿真到现实迁移能扩展到插孔、拧螺丝这类接触丰富的操作，但仿真读数和真实传感器之间仍有差距，常要配合域随机化或少量真机数据。","example":"TACTO 论文用仿真生成了 100 万次抓取的触觉数据，训练模型预测一次抓取稳不稳。","related":["视触觉传感器","TACTO","Taxim","TacSL 视触觉仿真库","传感器仿真","触觉图像"]},{"id":"tacto-a-fast-flexible-and-open-source-simulator-for-high-res","category":"sim","sec":3,"tier":3,"sources":[{"title":"TACTO (arXiv 2012.08456)","url":"https://arxiv.org/abs/2012.08456"},{"title":"facebookresearch/tacto GitHub 仓库","url":"https://github.com/facebookresearch/tacto"}],"as_of":"2022-02","related_ids":["tactile-simulation","digit","pybullet","taxim-an-example-based-simulation-model-for-gelsight-tactile","vision-based-tactile-sensor"],"name":"TACTO","alt":"TACTO: A Fast, Flexible, and Open-source Simulator for High-Resolution Vision-based Tactile Sensors","abbr":"","aliases":["TACTO 视触觉仿真器"],"one_liner":"Meta 开源的视触觉仿真器，配合 PyBullet 渲染 DIGIT 等触觉图像。","explanation":"TACTO 由 Shaoxiong Wang、Mike Lambeta、Po-Wei Chou、Roberto Calandra 开发，代码发布在 Meta 的 facebookresearch 仓库，论文发表于 IEEE RA-L 并在 ICRA 2022 报告。它用 PyRender 渲染器根据物体与弹性胶面的接触几何，每秒生成数百帧高分辨率触觉图像，并提供和 PyBullet 物理引擎对接的接口，自带 DIGIT 和 OmniTact 两种传感器的模型与配置。作者特意说明，TACTO 不负责接触动力学（形变、摩擦）的物理精度，这部分交给现有物理引擎。它以 MIT 许可开源，可直接 pip 安装。","example":"论文用 TACTO 仿真 100 万次抓取来训练抓取稳定性预测，还演示了用触觉控制弹珠滚动的任务，以及初步的仿真到现实迁移。","related":["触觉仿真","DIGIT 视触觉传感器","PyBullet","Taxim","视触觉传感器"]},{"id":"taxim-an-example-based-simulation-model-for-gelsight-tactile","category":"sim","sec":3,"tier":3,"sources":[{"title":"Taxim: An Example-based Simulation Model for GelSight Tactile Sensors (arXiv 2109.04027)","url":"https://arxiv.org/abs/2109.04027"},{"title":"Robo-Touch/Taxim GitHub 仓库","url":"https://github.com/Robo-Touch/Taxim"}],"as_of":"2021-12","related_ids":["tactile-simulation","gelsight","tacto-a-fast-flexible-and-open-source-simulator-for-high-res","marker-tracking","photometric-stereo"],"name":"Taxim","alt":"Taxim: An Example-based Simulation Model for GelSight Tactile Sensors","abbr":"","aliases":["Taxim 触觉仿真模型"],"one_liner":"用少量真实数据标定的 GelSight 视触觉传感器样例式仿真模型。","explanation":"Taxim 由卡内基梅隆大学 RoboTouch 实验室的 Zilin Si 和 Wenzhen Yuan 在 2021 年提出，专门仿真 GelSight 类视触觉传感器。所谓样例式（example-based），是不从头建模光路，而是用真实传感器采到的样例标定一张多项式查找表，把胶面形变的几何直接映射成相机像素亮度；胶面上标记点的运动则用弹性形变理论叠加计算。标定只需不到 100 个真实数据点，所以容易移植到不同型号的 GelSight。论文报告它的像素级光强误差低于此前方法，而且用 CPU 就能跑。它常和 TACTO 对比：TACTO 用通用渲染器出图，Taxim 靠实测数据标定出图。","example":"给 Taxim 输入物体点云和按压深度，就能得到对应的 GelSight 触觉图像；再给定 x、y、z 三个方向的载荷，可以得到胶面标记点的位移场。","related":["触觉仿真","GelSight","TACTO","标记点跟踪","光度立体"]},{"id":"tacsl-a-library-for-visuotactile-sensor-simulation-and-learn","category":"sim","sec":3,"tier":3,"sources":[{"title":"TacSL: A Library for Visuotactile Sensor Simulation and Learning (arXiv 2408.06506)","url":"https://arxiv.org/abs/2408.06506"},{"title":"TacSL 项目主页","url":"https://iakinola23.github.io/tacsl/"},{"title":"Isaac Lab 文档：Visuo-Tactile Sensor","url":"https://isaac-sim.github.io/IsaacLab/main/source/overview/core-concepts/sensors/visuo_tactile_sensor.html"}],"as_of":"2026-09","related_ids":["tactile-simulation","vision-based-tactile-sensor","gelsight","nvidia-isaac-lab","asymmetric-actor-critic","sim-to-real-transfer"],"name":"TacSL 视触觉仿真库","alt":"TacSL: A Library for Visuotactile Sensor Simulation and Learning","abbr":"","aliases":["TacSL"],"one_liner":"英伟达开源的 GPU 视触觉传感器仿真与策略学习库。","explanation":"TacSL 由英伟达的 Iretiayo Akinola、Yashraj Narang 等人提出，2024 年 8 月发布在 arXiv，后发表于 IEEE Transactions on Robotics。它在 Isaac 仿真器里用 GPU 同时生成视触觉图像（GelSight 这类传感器内部相机拍到的胶面形变图）和接触力分布，论文称比此前最好的方法快 200 倍以上，这样才能大规模并行地训练带触觉输入的策略。库里还有接触丰富的训练环境（如轴孔插入）和非对称演员-评论家蒸馏（AACD）算法，用于学触觉策略并迁移到真机。代码最早放在 IsaacGymEnvs 仓库，如今 Isaac Lab 的视触觉传感器模块就是基于 TacSL 实现的。","example":"Isaac Lab 的视触觉传感器提供 GelSight R1.5 和 GelSight Mini 两种配置，用符号距离场查询计算基于惩罚的法向力和剪切力，同时可输出 RGB 触觉图像，直接作为强化学习或模仿学习的观测。","related":["触觉仿真","视触觉传感器","GelSight","Isaac Lab","非对称演员-评论家","仿真到现实迁移"]},{"id":"mujoco","category":"sim","sec":4,"tier":1,"sources":[{"title":"google-deepmind/mujoco (GitHub)","url":"https://github.com/google-deepmind/mujoco"},{"title":"Google DeepMind: Opening up a physics simulator for robotics (2021-10)","url":"https://deepmind.google/blog/opening-up-a-physics-simulator-for-robotics/"}],"as_of":"2026-09","related_ids":["physics-engine","mujoco-xla","mjcf","mujoco-menagerie","robosuite","deepmind-control-suite"],"name":"MuJoCo","alt":"MuJoCo (Multi-Joint dynamics with Contact)","abbr":"","aliases":["Mujoco"],"one_liner":"擅长接触模拟的开源物理引擎，由谷歌 DeepMind 维护，机器人研究常用。","explanation":"MuJoCo 全称 Multi-Joint dynamics with Contact（多关节接触动力学），由 Todorov 等人 2012 年在 IROS 发表，早年需付费授权。DeepMind 2021 年 10 月收购后免费开放，2022 年起以 Apache 2.0 许可开源，现由谷歌 DeepMind 维护。它把接触力的计算写成凸优化问题，解唯一，逆动力学（由想要的运动反推所需的力）也有明确定义，适合做控制和强化学习。机器人模型用 XML 格式的 MJCF 描述。周边有可在 GPU/TPU 上并行的 JAX 版 MJX、MuJoCo Menagerie 机器人模型库等；robosuite、LIBERO、DeepMind 控制套件都跑在它上面。","example":"LIBERO 基准建在 robosuite 上，机械臂和物体的物理计算由 MuJoCo 完成。","related":["物理引擎","MJX","MJCF","MuJoCo Menagerie","robosuite","DeepMind 控制套件"]},{"id":"mujoco-xla","category":"sim","sec":4,"tier":2,"sources":[{"title":"MuJoCo XLA (MJX) documentation","url":"https://mujoco.readthedocs.io/en/stable/mjx.html"},{"title":"mujoco-mjx (PyPI)","url":"https://pypi.org/project/mujoco-mjx/"}],"as_of":"2026-09","related_ids":["mujoco","jax","mujoco-warp","brax","mujoco-playground","differentiable-simulation"],"name":"MJX","alt":"MuJoCo XLA","abbr":"MJX","aliases":["MuJoCo MJX","mujoco-mjx","MJX-JAX"],"one_liner":"用 JAX 实现的 MuJoCo，在 GPU/TPU 上批量并行仿真，可求导。","explanation":"MJX（MuJoCo XLA）是 Google DeepMind 随 MuJoCo 3.0 在 2023 年 10 月推出的 JAX 接口：用 JAX 重新实现 MuJoCo 物理，经 XLA 编译器编译后能跑在 NVIDIA 和 AMD 显卡、Apple 芯片和谷歌 TPU 上。配合 JAX 的 vmap 可以把几千上万个场景打包一起算，适合大规模强化学习；但只跑一个场景时可能比原版 MuJoCo 慢 10 倍左右。纯 JAX 版支持自动求导，可做可微仿真。现在 MJX 有两个后端：MJX-JAX 和调用 MuJoCo Warp 的 MJX-Warp，后者在 NVIDIA 显卡和接触多的场景上更快，但不能求导。Brax 训练库和 MuJoCo Playground 都建在它之上。","example":"典型三步：mjx.put_model 把模型放上加速器，mjx.make_data 建状态，再用 jax.vmap(mjx.step) 让几千个机器人同时前进一步，接 Brax 的 PPO 训练行走策略。","related":["MuJoCo","JAX","MuJoCo Warp","Brax","MuJoCo Playground","可微仿真"]},{"id":"brax","category":"sim","sec":4,"tier":3,"sources":[{"title":"Brax - A Differentiable Physics Engine for Large Scale Rigid Body Simulation (arXiv 2106.13281)","url":"https://arxiv.org/abs/2106.13281"},{"title":"google/brax (GitHub)","url":"https://github.com/google/brax"},{"title":"google-deepmind/mujoco_playground (GitHub)","url":"https://github.com/google-deepmind/mujoco_playground"}],"as_of":"2026-09","related_ids":["mujoco-xla","mujoco-playground","jax","differentiable-simulation","gpu-accelerated-parallel-simulation","massively-parallel-reinforcement-learning"],"name":"Brax","alt":"Brax","abbr":"","aliases":[],"one_liner":"谷歌用 JAX 写的可微刚体物理引擎，附带强化学习训练库。","explanation":"Brax 由谷歌团队在 2021 年开源（论文一作 C. Daniel Freeman），用 JAX（可自动求导、能编译到 GPU/TPU 上运行的数值计算库）编写。它的卖点是物理仿真和学习算法编译到同一块加速器上运行，省去 CPU 与 GPU 之间来回搬数据，在类 MuJoCo 的 Gym 任务上几分钟就能训出可用策略；因为仿真可微，还能直接对仿真求梯度来优化策略。后来 Brax 提供四种物理后端：MJX（MuJoCo 的 JAX 重写版）、广义坐标、基于位置的动力学和弹簧模型。据仓库说明，从 0.13.0 起只有 brax/training（PPO、SAC 等训练代码）还在积极维护，物理仿真建议改用 MJX 或 MuJoCo Warp，环境则推荐 MuJoCo Playground。","example":"MuJoCo Playground 的仓库说明，要按论文原样复现结果，可直接运行 Brax 的训练脚本，环境本身用 MJX 或 MuJoCo Warp 实现。","related":["MJX","MuJoCo Playground","JAX","可微仿真","GPU 并行仿真","大规模并行强化学习"]},{"id":"mujoco-playground","category":"sim","sec":4,"tier":2,"sources":[{"title":"MuJoCo Playground (arXiv 2502.08844)","url":"https://arxiv.org/abs/2502.08844"},{"title":"google-deepmind/mujoco_playground (GitHub)","url":"https://github.com/google-deepmind/mujoco_playground"},{"title":"MuJoCo Playground 项目主页","url":"https://playground.mujoco.org/"}],"as_of":"2026-09","related_ids":["mujoco-xla","mujoco-warp","mujoco","deepmind-control-suite","sim-to-real-transfer","mjlab"],"name":"MuJoCo Playground","alt":"MuJoCo Playground","abbr":"","aliases":["Playground"],"one_liner":"DeepMind 牵头的 GPU 加速机器人学习环境集，单卡快训、零样本上真机。","explanation":"MuJoCo Playground 是 Google DeepMind 牵头、联合 UC Berkeley 等团队在 2025 年 2 月开源的机器人学习环境合集（Apache 2.0），物理跑在 MJX 上，现在也可切到 MuJoCo Warp 后端，并带批量渲染器用来训练看图像的策略。它把 DeepMind 控制套件的经典任务、腿足行走和操作任务打包在一起，机器人有宇树 Go1、G1、H1，Booster T1，Berkeley Humanoid，Spot，Franka，ALOHA 和 LEAP 灵巧手等。论文称可在单张 GPU 上几分钟内训出策略，并演示了从状态和像素输入零样本迁移到真机，省掉大量搭环境、调奖励的重复劳动。pip install playground 即可安装。","example":"安装后加载 G1 或 Go1 的行走环境，在一张 GPU 上用 PPO 并行训练几千个机器人，再把训好的策略直接部署到真机测试。","related":["MJX","MuJoCo Warp","MuJoCo","DeepMind 控制套件","仿真到现实迁移","mjlab"]},{"id":"mujoco-warp","category":"sim","sec":4,"tier":2,"sources":[{"title":"google-deepmind/mujoco_warp (GitHub)","url":"https://github.com/google-deepmind/mujoco_warp"},{"title":"MuJoCo Warp documentation","url":"https://mujoco.readthedocs.io/en/latest/mjwarp/index.html"},{"title":"mujoco-warp (PyPI)","url":"https://pypi.org/project/mujoco-warp/"}],"as_of":"2026-09","related_ids":["mujoco","mujoco-xla","newton-physics-engine","nvidia-warp","mjlab","gpu-accelerated-parallel-simulation"],"name":"MuJoCo Warp","alt":"MuJoCo Warp","abbr":"MJWarp","aliases":["mujoco-warp","MJX-Warp"],"one_liner":"DeepMind 与 NVIDIA 用 Warp 重写的 GPU 版 MuJoCo，面向大批量并行。","explanation":"MuJoCo Warp 是 Google DeepMind 和 NVIDIA 联合开发的 GPU 版 MuJoCo，用 NVIDIA Warp（在 Python 里写 GPU 核函数的框架）重新实现，也是 Newton 物理引擎的核心求解器。它追求吞吐量，一次推进成百上千个仿真「世界」；官方称在几何体多、自由度高、接触复杂的场景上比 MJX 扩展得更好，也更容易和 PyTorch 配合。代价是单步延迟可能比原版 MuJoCo 慢，实时控制仍用原版；它也不支持自动求导，要可微得用 MJX 的 JAX 实现。它还带光线追踪批量渲染。2026 年 1 月起以 mujoco-warp 发布到 PyPI，版本号与 MuJoCo 同步，mjlab、MJX、MuJoCo Playground 和 Newton 都能调用。","example":"用 mjw.put_model 把模型放上显卡，用 mjw.make_data(mjm, nworld=100) 建 100 个世界，一次 mjw.step 就把 100 个仿真同时往前推一步；再用 CUDA Graph 捕获循环进一步提速。","related":["MuJoCo","MJX","Newton 物理引擎","Warp","mjlab","GPU 并行仿真"]},{"id":"physx","category":"sim","sec":4,"tier":2,"sources":[{"title":"NVIDIA-Omniverse/PhysX (GitHub)","url":"https://github.com/NVIDIA-Omniverse/PhysX"},{"title":"NVIDIA PhysX SDK","url":"https://developer.nvidia.com/physx-sdk"},{"title":"PhysX (Wikipedia)","url":"https://en.wikipedia.org/wiki/PhysX"}],"as_of":"2026-09","related_ids":["nvidia-isaac-sim","nvidia-isaac-lab","isaac-gym","nvidia-omniverse","articulated-body-simulation","newton-physics-engine"],"name":"PhysX","alt":"NVIDIA PhysX","abbr":"","aliases":["PhysX 5","PhysX SDK","NovodeX"],"one_liner":"NVIDIA 的开源实时物理引擎，Isaac Sim 和 Isaac Lab 的物理内核。","explanation":"PhysX 是 NVIDIA 的实时物理引擎 SDK，源自 ETH 研究者创办的 NovodeX（2002 年商用），2004 年被 Ageia 收购改名，2008 年 NVIDIA 收购 Ageia 后改用 CUDA 显卡加速，长期是游戏行业主流物理中间件。2018 年 12 月以 BSD-3 许可开源，2022 年 11 月开源版升级到 PhysX 5。PhysX 5 支持 GPU 刚体、约化坐标关节体（用根部位姿加关节角描述机器人，关节不会「散架」，适合机械臂和腿足）、有限元软体、基于位置动力学的流体和布料、符号距离场碰撞。它是 Omniverse、Isaac Sim、Isaac Lab 和早年 Isaac Gym 的物理内核，调这些平台的求解器迭代次数、摩擦等参数，本质就是在调 PhysX。","example":"在 Isaac Lab 里训练机械臂插孔时，关节力矩、接触力和摩擦都由 PhysX 在 GPU 上算；出现穿模时常见做法是调大 PhysX 的求解器位置迭代次数。","related":["Isaac Sim","Isaac Lab","Isaac Gym","Omniverse","关节体仿真","Newton 物理引擎"]},{"id":"isaac-gym","category":"sim","sec":4,"tier":2,"sources":[{"title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning (arXiv 2108.10470)","url":"https://arxiv.org/abs/2108.10470"},{"title":"NVIDIA Isaac Gym","url":"https://developer.nvidia.com/isaac-gym"},{"title":"isaac-sim/IsaacGymEnvs (GitHub)","url":"https://github.com/isaac-sim/IsaacGymEnvs"}],"as_of":"2026-09","related_ids":["nvidia-isaac-lab","physx","legged-gym","massively-parallel-reinforcement-learning","nvidia-isaac-sim","orbit-isaacgymenvs-omniisaacgymenvs"],"name":"Isaac Gym","alt":"NVIDIA Isaac Gym","abbr":"","aliases":["IsaacGym","IsaacGymEnvs","Isaac Gym Preview 4"],"one_liner":"NVIDIA 2021 年推出的 GPU 强化学习仿真器，已停止支持。","explanation":"Isaac Gym 是 NVIDIA 在 2021 年发布的机器人强化学习仿真平台（技术报告收录于 NeurIPS 2021 数据集与基准赛道），物理由 PhysX 在 GPU 上计算。关键是张量接口：物理结果直接以 PyTorch 张量交给神经网络，不经 CPU 中转，一张显卡能同时跑几千个环境，官方称比「CPU 仿真 + GPU 训练」快 2–3 个数量级。legged_gym 等一批腿足运控和灵巧手工作都基于它，配套仓库 IsaacGymEnvs 提供 Ant、ShadowHand 等示例环境。它只发过 Preview 版，最后一版是 Preview 4，现已停止支持，NVIDIA 建议迁到 Isaac Lab，但不少开源项目仍依赖它。","example":"宇树 unitree_rl_gym 和 ETH 的 legged_gym 至今仍要求先下载安装 Isaac Gym Preview 3/4，才能训练机器狗、人形机器人的行走策略。","related":["Isaac Lab","PhysX","legged_gym","大规模并行强化学习","Isaac Sim","Orbit / IsaacGymEnvs（Isaac Lab 前身）"]},{"id":"nvidia-isaac-sim","category":"sim","sec":4,"tier":1,"sources":[{"title":"NVIDIA Isaac Sim","url":"https://developer.nvidia.com/isaac/sim"},{"title":"isaac-sim/IsaacSim releases (GitHub)","url":"https://github.com/isaac-sim/IsaacSim/releases"}],"as_of":"2026-09","related_ids":["nvidia-isaac-lab","nvidia-omniverse","physx","universal-scene-description","synthetic-data","digital-twin"],"name":"Isaac Sim","alt":"NVIDIA Isaac Sim","abbr":"","aliases":["英伟达 Isaac Sim"],"one_liner":"英伟达基于 Omniverse 的开源机器人仿真器，物理和画面都追求高保真。","explanation":"Isaac Sim 是英伟达的机器人仿真参考应用，建在 Omniverse 库之上：场景用 OpenUSD 描述，物理用 PhysX，渲染用 RTX。它能导入 CAD、URDF、MJCF 格式的机器人和场景，模拟相机、激光雷达等传感器，通过随机化光照、颜色、位置批量生成合成数据，并支持软件在环/硬件在环测试（把真实的控制软件或硬件接进仿真里一起测）和 ROS 2 桥接。2025 年起以 Apache 2.0 许可在 GitHub 开源。它的定位是高保真仿真器，大规模训练策略通常交给建在它上面的 Isaac Lab。截至 2026 年 9 月，最新稳定版为 6.1，7.0 已发布 alpha 预览版。","example":"用 Isaac Sim 搭一个仓库场景，随机改变货箱纹理和灯光，批量渲染带标注的图片来训练检测模型。","related":["Isaac Lab","Omniverse","PhysX","通用场景描述","合成数据","数字孪生"]},{"id":"nvidia-isaac-lab","category":"sim","sec":4,"tier":1,"sources":[{"title":"Isaac Lab Documentation","url":"https://isaac-sim.github.io/IsaacLab/main/index.html"},{"title":"Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning (arXiv 2511.04831)","url":"https://arxiv.org/abs/2511.04831"},{"title":"isaac-sim/IsaacLab releases (GitHub)","url":"https://github.com/isaac-sim/IsaacLab/releases"},{"title":"NVIDIA Developer: Isaac Gym - Preview Release (now deprecated, no longer supported)","url":"https://developer.nvidia.com/isaac-gym"}],"as_of":"2026-09","related_ids":["nvidia-isaac-sim","isaac-gym","orbit-isaacgymenvs-omniisaacgymenvs","gpu-accelerated-parallel-simulation","newton-physics-engine","rl-based-locomotion-control"],"name":"Isaac Lab","alt":"NVIDIA Isaac Lab","abbr":"","aliases":["Orbit","IsaacLab"],"one_liner":"英伟达开源的 GPU 并行机器人学习框架，用来在仿真里大规模训练策略。","explanation":"Isaac Lab 是英伟达主导的开源机器人学习框架（BSD-3 许可），由 2023 年发表的 Orbit 框架演变而来，也是英伟达官方推荐的 Isaac Gym 替代品（Isaac Gym 已停止支持）。它建在 Isaac Sim 之上，用 PhysX 算物理、RTX 做渲染，能在 GPU 上同时跑大量并行环境，自带执行器模型（模拟真实电机的响应）、多种传感器、域随机化和数据采集工具，支持强化学习、模仿学习和运动规划。不少人形和四足的强化学习运控策略在这里训练。截至 2026 年 9 月，3.0 版处于早期访问阶段，改为多物理后端架构，可接入 Newton 物理引擎，部分流程不必再装 Isaac Sim。","example":"训练宇树 G1 的行走策略时，可在 Isaac Lab 里开几千个并行环境并加域随机化，训完再部署到真机。","related":["Isaac Sim","Isaac Gym","Orbit / IsaacGymEnvs（Isaac Lab 前身）","GPU 并行仿真","Newton 物理引擎","强化学习运控"]},{"id":"orbit-isaacgymenvs-omniisaacgymenvs","category":"sim","sec":4,"tier":3,"sources":[{"title":"Orbit: A Unified Simulation Framework for Interactive Robot Learning Environments (RA-L 2023)","url":"https://arxiv.org/abs/2301.04195"},{"title":"GitHub: isaac-sim/IsaacGymEnvs (archived)","url":"https://github.com/isaac-sim/IsaacGymEnvs"},{"title":"Isaac Lab Docs: Migrating from Orbit","url":"https://isaac-sim.github.io/IsaacLab/main/source/migration/migrating_from_orbit.html"}],"as_of":"2026-09","related_ids":["nvidia-isaac-lab","isaac-gym","nvidia-isaac-sim","legged-gym","gpu-accelerated-parallel-simulation","massively-parallel-reinforcement-learning"],"name":"Orbit / IsaacGymEnvs（Isaac Lab 前身）","alt":"Orbit / IsaacGymEnvs / OmniIsaacGymEnvs (predecessors of Isaac Lab)","abbr":"","aliases":["Isaac Orbit","OmniIsaacGymEnvs","OIGE"],"one_liner":"英伟达三套已停止维护的机器人学习框架，后来统一被 Isaac Lab 取代。","explanation":"这是 Isaac Lab 之前英伟达生态里的三套机器人强化学习框架。IsaacGymEnvs（2021 年起）是 Isaac Gym 预览版的示例环境库，含 Ant、ShadowHand、ANYmal 等任务，展示了单张 GPU 并行跑成千上万个环境的训练方式。OmniIsaacGymEnvs 把这类任务搬到 Isaac Sim 上，4.0.0 为最后一版，官方说明并入 Isaac Lab。Orbit 由 Mayank Mittal 等人提出（RA-L 2023），基于 Isaac Sim，提供 16 种机器人平台和 20 多个基准任务，是 Isaac Lab 的代码基础。如今前两个仓库已归档，Isaac Lab 文档提供从三者迁移的指南，读老论文代码时仍常会遇到它们。","example":"老代码里的 from omni.isaac.orbit 导入，迁移到 Isaac Lab 时要改成 from isaaclab，这是官方 Orbit 迁移指南里的第一步。","related":["Isaac Lab","Isaac Gym","Isaac Sim","legged_gym","GPU 并行仿真","大规模并行强化学习"]},{"id":"leisaac","category":"sim","sec":4,"tier":3,"sources":[{"title":"LightwheelAI/leisaac (GitHub)","url":"https://github.com/LightwheelAI/leisaac"},{"title":"Hugging Face LeRobot Docs: LeIsaac × LeRobot EnvHub","url":"https://huggingface.co/docs/lerobot/envhub_leisaac"}],"as_of":"2026-09","related_ids":["nvidia-isaac-lab","lerobot","lerobot-envhub","so-100-so-101-arm","lightwheel","nvidia-isaac-gr00t-n1"],"name":"LeIsaac","alt":"LeIsaac","abbr":"","aliases":["leisaac"],"one_liner":"光轮智能开源的 Isaac Lab 遥操作采数框架，把 SO-101 机械臂接进 LeRobot 流程。","explanation":"LeIsaac 由光轮智能（Lightwheel）开源，采用 Apache-2.0 协议。它在英伟达 Isaac Lab 里放入仿真的 SO-101 机械臂（单臂或双臂），让用户用真实的 SO-101 主臂（Leader）遥操作仿真里的从臂，也支持键盘、手柄；除人工遥操作外，还能用状态机脚本自动生成演示轨迹。采到的 HDF5 数据可转换成 LeRobot 数据集格式，用于微调 GR00T N1.5 / N1.6 等策略并部署到真机。它也是 LeRobot EnvHub 官方的仿真模仿学习环境，可一行代码加载摘橘子、举方块、收拾玩具桌、双臂叠布等任务，没有本地 GPU 时还能在云端运行。","example":"用 LeRobot 的 make_env 加载 LightwheelAI/leisaac_env 中的 so101_pick_orange 任务：把三个橘子放进盘子，再让机械臂回到初始姿态。","related":["Isaac Lab","LeRobot","EnvHub","SO-100 / SO-101 机械臂","光轮智能","GR00T N1 系列"]},{"id":"newton-physics-engine","category":"sim","sec":4,"tier":2,"sources":[{"title":"newton-physics/newton (GitHub)","url":"https://github.com/newton-physics/newton"},{"title":"Linux Foundation: Contribution of Newton by Disney Research, Google DeepMind, and NVIDIA","url":"https://www.linuxfoundation.org/press/linux-foundation-announces-contribution-of-newton-by-disney-research-google-deepmind-and-nvidia-to-accelerate-open-robot-learning"},{"title":"Newton solvers API","url":"https://newton-physics.github.io/newton/latest/api/newton_solvers.html"}],"as_of":"2026-09","related_ids":["mujoco-warp","nvidia-warp","nvidia-isaac-lab","physx","universal-scene-description","differentiable-simulation"],"name":"Newton 物理引擎","alt":"Newton Physics Engine","abbr":"","aliases":["Newton","newton-physics"],"one_liner":"NVIDIA、DeepMind、迪士尼联合发起的开源 GPU 机器人物理引擎。","explanation":"Newton 是 NVIDIA、Google DeepMind 和迪士尼研究院联合发起的开源物理引擎，基于 NVIDIA Warp 和 OpenUSD（通用场景描述格式），Apache-2.0 许可；2025 年 9 月 29 日 Linux 基金会宣布接管，保持厂商中立。它的思路是一个框架、多个求解器：MuJoCo Warp 是主力刚体求解器，另有 Featherstone、XPBD、VBD（布料和粒子）、隐式 MPM（沙土等颗粒）、Style3D 布料、处理闭环机构的 Kamino 等。它支持 GPU 大规模并行和可微分，兼容 Isaac Sim、Isaac Lab，NVIDIA 把它定位为 PhysX 之后的新一代机器人仿真引擎。2026 年发布 1.0 版，9 月已到 1.6。","example":"同一套 Newton 接口里，人形机器人行走用 SolverMuJoCo，毛巾布料用 SolverVBD 或 SolverStyle3D，沙地颗粒用 SolverImplicitMPM。","related":["MuJoCo Warp","Warp","Isaac Lab","PhysX","通用场景描述","可微仿真"]},{"id":"mjlab","category":"sim","sec":4,"tier":3,"sources":[{"title":"mjlab: A Lightweight Framework for GPU-Accelerated Robot Learning (arXiv 2601.22074)","url":"https://arxiv.org/abs/2601.22074"},{"title":"mjlab GitHub 仓库","url":"https://github.com/mujocolab/mjlab"}],"as_of":"2026-09","related_ids":["mujoco-warp","nvidia-isaac-lab","mujoco-playground","gpu-accelerated-parallel-simulation","rl-based-locomotion-control","unitree-g1"],"name":"mjlab","alt":"mjlab","abbr":"","aliases":[],"one_liner":"用 Isaac Lab 式接口加 MuJoCo Warp 物理的轻量 GPU 机器人学习框架。","explanation":"mjlab 是 Kevin Zakka、Koushil Sreenath、Pieter Abbeel 等人开发的开源框架，论文于 2026 年 1 月发布。它沿用 Isaac Lab 的「管理器式」接口：把观测、奖励、随机事件等写成可组合的模块来拼环境；物理后端换成 MuJoCo 的 GPU 版本 MuJoCo Warp，可并行仿真数千个环境。好处是一条命令即可安装、依赖少，还能直接访问 MuJoCo 原生数据结构。它自带速度跟踪、动作模仿和操作三类参考任务，常用于人形、四足的强化学习运控。训练需要英伟达 GPU，macOS 只能做评估。","example":"运行 uv run train Mjlab-Velocity-Flat-Unitree-G1 --env.scene.num-envs 4096，在 4096 个并行环境里训练宇树 G1 按速度指令行走。","related":["MuJoCo Warp","Isaac Lab","MuJoCo Playground","GPU 并行仿真","强化学习运控","宇树 G1"]},{"id":"genesis","category":"sim","sec":4,"tier":2,"sources":[{"title":"Genesis-Embodied-AI/Genesis (GitHub)","url":"https://github.com/Genesis-Embodied-AI/Genesis"},{"title":"Genesis World Docs: What is Genesis","url":"https://genesis-world.readthedocs.io/en/latest/user_guide/overview/what_is_genesis.html"}],"as_of":"2026-09","related_ids":["gpu-accelerated-parallel-simulation","physics-engine","material-point-method","nvidia-isaac-lab","mujoco","generative-simulation"],"name":"Genesis","alt":"Genesis Simulator","abbr":"","aliases":["Genesis World","Genesis 仿真平台","Genesis-Embodied-AI"],"one_liner":"2024 年底开源的多物理场 GPU 仿真平台，主打速度快、刚体软体流体统一模拟。","explanation":"Genesis（现名 Genesis World）是 2024 年 12 月以学术项目形式开源的物理仿真平台，面向机器人和具身智能，采用 Apache 2.0 协议，现由 Genesis AI 公司支持开发，GitHub 星标超过 3 万。它把刚体、有限元（FEM，算软体变形）、物质点法（MPM，算沙土等颗粒）、PBD/SPH 粒子（算布料、流体）等求解器统一到同一个场景里，配有照片级渲染器 Nyx，用 Python 编写，由从 Taichi 分叉出的编译器 Quadrants 编译到 CUDA、Metal 等后端。官方称其吞吐量可达 Isaac Gym/Sim/Lab、MuJoCo MJX 等 GPU 仿真器的 10–80 倍。常用于大规模并行强化学习，如四足、人形的运动控制训练。","example":"官方示例里就有用 Genesis 同时并行数千个宇树 Go2 环境、用 PPO 训练行走策略的脚本，单张 GPU 即可跑完训练。","related":["GPU 并行仿真","物理引擎","物质点法","Isaac Lab","MuJoCo","生成式仿真"]},{"id":"pybullet","category":"sim","sec":4,"tier":2,"sources":[{"title":"bulletphysics/bullet3 (GitHub)","url":"https://github.com/bulletphysics/bullet3"},{"title":"pybullet on PyPI","url":"https://pypi.org/project/pybullet/"},{"title":"Sim-to-Real: Learning Agile Locomotion For Quadruped Robots (arXiv 1804.10332)","url":"https://arxiv.org/abs/1804.10332"}],"as_of":"2025-01","related_ids":["physics-engine","mujoco","isaac-gym","sim-to-real-transfer","unified-robot-description-format","rigid-body-simulation"],"name":"PyBullet","alt":"PyBullet (Bullet Physics)","abbr":"","aliases":["Bullet","Bullet Physics","Bullet Physics SDK","pybullet"],"one_liner":"物理引擎 Bullet 的 Python 接口，早年机器人强化学习最常用的仿真器之一。","explanation":"Bullet 是 Erwin Coumans 主导开发的开源物理引擎（C++ 编写，zlib 许可证），支持碰撞检测以及刚体和软体（布、绳）动力学，广泛用于游戏和电影特效，Coumans 为此获过奥斯卡科学技术奖。PyBullet 是它的 Python 封装，pip 一行安装，能直接加载 URDF、SDF、MJCF 机器人模型，自带正逆运动学、逆动力学和简单渲染。在 GPU 并行仿真普及之前，大量机器人强化学习和 sim-to-real 工作用它做实验。它主要跑在 CPU 上，并行规模远不如 Isaac Lab、MJX 等，新的大规模训练多已转向这些平台，但仍常用于教学和轻量实验。PyPI 上最新版 3.2.7 发布于 2025 年 1 月。","example":"谷歌 2018 年的论文《Sim-to-Real: Learning Agile Locomotion For Quadruped Robots》在 PyBullet 里训练 Minitaur 四足的小跑和疾驰步态，靠系统辨识、执行器建模和随机化后直接部署到真机。","related":["物理引擎","MuJoCo","Isaac Gym","仿真到现实迁移","统一机器人描述格式","刚体仿真"]},{"id":"raisim","category":"sim","sec":4,"tier":3,"sources":[{"title":"RaiSim 文档：License（v2.7.0）","url":"https://raisim.com/sections/License.html"},{"title":"Per-Contact Iteration Method for Solving Contact Dynamics (IEEE RA-L 2018)","url":"https://ieeexplore.ieee.org/document/8255551"},{"title":"raisimTech/raisim2Lib GitHub","url":"https://github.com/raisimTech/raisim2Lib"}],"as_of":"2026-09","related_ids":["physics-engine","mujoco","isaac-gym","rl-based-locomotion-control","anybotics-anymal","eth-zurich-robotic-systems-lab"],"name":"RaiSim","alt":"RaiSim","abbr":"","aliases":["RaiSim2","raisimLib"],"one_liner":"面向机器人与强化学习的多体物理引擎，以快速精确的接触求解著称。","explanation":"由 Jemin Hwangbo 等人开发，现由 RaiSim Tech 维护。其核心来自 Hwangbo、Lee、Hutter 2018 年发表于 IEEE RA-L 的「逐接触迭代法」：按接触点逐个迭代、用二分法求接触力，论文称比两种已有方法快约一倍。ETH 苏黎世 2019 年用强化学习训练四足机器人 ANYmal 的论文，其自研仿真器就采用了这一接触求解器。RaiSim 主打在 CPU 上快速精确地仿真刚体和关节体，提供 C++ 接口、Python 绑定 raisimPy 和强化学习示例 raisimGymTorch，后来又加入软体、颗粒介质、腱绳和相机/深度传感器渲染。旧版 raisimLib 仓库已于 2026 年 4 月归档，改为以二进制包发布的 RaiSim2，2026 年 9 月发布 v2.7.0。它不开源：学术许可免费，商业许可每人每年 1500 美元。","example":"用 raisimGymTorch 在一台电脑上并行跑多个四足机器人环境，训练 ANYmal 在高度图地形上行走的强化学习策略。","related":["物理引擎","MuJoCo","Isaac Gym","强化学习运控","ANYmal 四足","苏黎世联邦理工机器人系统实验室"]},{"id":"sapien","category":"sim","sec":4,"tier":3,"sources":[{"title":"arXiv 2003.08515 - SAPIEN: A SimulAted Part-based Interactive ENvironment","url":"https://arxiv.org/abs/2003.08515"},{"title":"GitHub - haosulab/SAPIEN","url":"https://github.com/haosulab/SAPIEN"}],"as_of":"2026-09","related_ids":["maniskill","partnet-mobility","articulated-object","articulated-object-manipulation","physx","simulator"],"name":"SAPIEN","alt":"SAPIEN (SimulAted Part-based Interactive ENvironment)","abbr":"","aliases":[],"one_liner":"UCSD 开发的机器人仿真平台，擅长抽屉、柜门这类带可动部件的铰接物体交互","explanation":"SAPIEN 全称 SimulAted Part-based Interactive ENvironment，是加州大学圣迭戈分校苏昊（Hao Su）组与斯坦福等合作者在 2020 年提出的机器人仿真环境，论文发表于 CVPR 2020。它的物理部分基于英伟达 PhysX，渲染基于 Vulkan，后续版本加入了光线追踪渲染，3.0 版起支持 PhysX 5 的 GPU 并行仿真。它的特色是随论文发布的 PartNet-Mobility 数据集：大量带关节标注的铰接物体（能拉开的抽屉、能转开的柜门、水龙头等），适合研究零件级的感知和交互，比如机器人开门、拉抽屉。常用的 ManiSkill 系列操作基准就建立在 SAPIEN 之上。","example":"在 SAPIEN 中加载 PartNet-Mobility 里的一个柜子模型，让机械臂学习识别把手位置、抓住把手并把柜门拉开。","related":["ManiSkill","PartNet-Mobility 数据集","铰接物体","铰接物体操作","PhysX","仿真器"]},{"id":"maniskill","category":"sim","sec":4,"tier":2,"sources":[{"title":"haosulab/ManiSkill (GitHub)","url":"https://github.com/haosulab/ManiSkill"},{"title":"ManiSkill3: GPU Parallelized Robotics Simulation and Rendering for Generalizable Embodied AI (arXiv 2410.00425)","url":"https://arxiv.org/abs/2410.00425"},{"title":"mani-skill (PyPI)","url":"https://pypi.org/project/mani-skill/"}],"as_of":"2026-04","related_ids":["sapien","gpu-accelerated-parallel-simulation","simulation-based-evaluation","simplerenv","digital-twin","benchmark"],"name":"ManiSkill","alt":"ManiSkill (ManiSkill3)","abbr":"","aliases":["ManiSkill3","ManiSkill2","ManiSkill 1"],"one_liner":"UCSD 团队开发的开源机器人操作仿真框架和基准，主打 GPU 并行。","explanation":"ManiSkill 是加州大学圣地亚哥分校苏昊（Hao Su）团队联合 Hillbot 等开发的机器人操作仿真框架与基准，底层是同团队的 SAPIEN 引擎，已出三代。第三代 ManiSkill3（RSS 2025）把物理仿真和相机渲染都放到 GPU 上并行，论文称比其他平台快 10–1000 倍、显存省 2–3 倍，一张 4090 每秒能生成 3 万帧以上带分割的 RGB-D 图像。任务覆盖桌面操作、移动操作、人形、灵巧手、软体等 12 类（软体不支持批量并行），还有对照真实场景搭的数字孪生环境，用来在仿真里快速评测真机策略。接口遵循 Gymnasium，2026 年 4 月结束 beta 发布 3.0.1。","example":"把 ManiSkill3 自带的 PickCube-v1（机械臂抓起方块）任务开成上千个并行环境，用 PPO 训练带相机输入的抓取策略。","related":["SAPIEN","GPU 并行仿真","仿真评测","SimplerEnv","数字孪生","基准测试"]},{"id":"robosuite","category":"sim","sec":4,"tier":2,"sources":[{"title":"robosuite 官网","url":"https://robosuite.ai/"},{"title":"robosuite 文档：Environments","url":"https://robosuite.ai/docs/modules/environments.html"},{"title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning (arXiv 2009.12293)","url":"https://arxiv.org/abs/2009.12293"}],"as_of":"2024-10","related_ids":["mujoco","robomimic","robocasa","mimicgen","simulator","spacemouse-teleoperation"],"name":"robosuite","alt":"robosuite","abbr":"","aliases":["robosuite v1.5"],"one_liner":"基于 MuJoCo 的模块化机器人学习仿真框架和基准，由 ARISE 计划维护。","explanation":"robosuite 是斯坦福和 UT Austin 研究者在 ARISE 计划下开发的开源仿真框架，底层用 MuJoCo，论文 2020 年发布。它把机器人、夹爪、控制器、场景和任务拆成可组合的模块，提供关节空间和笛卡尔空间（直接控制末端位姿）控制器，内置举方块、叠方块、开门、擦桌子等单臂任务和三个双臂任务，支持遥操作采集演示。2024 年 10 月的 v1.5 加入人形等本体、全身控制器、照片级渲染和传感器模型。robomimic、RoboCasa 都建在它之上，是模仿学习和强化学习研究的常用底座。","example":"robomimic 的 Lift、Can、Square 等标准数据集就是在 robosuite 环境里用 Franka Panda 机械臂采集的。","related":["MuJoCo","RoboMimic","RoboCasa","MimicGen","仿真器","3D 鼠标遥操作"]},{"id":"robomimic","category":"sim","sec":4,"tier":2,"sources":[{"title":"robomimic 官网","url":"https://robomimic.github.io/"},{"title":"robomimic v0.1 数据集说明","url":"https://robomimic.github.io/docs/datasets/robomimic_v0.1.html"},{"title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (arXiv 2108.03298)","url":"https://arxiv.org/abs/2108.03298"}],"as_of":"","related_ids":["robosuite","behavior-cloning","offline-reinforcement-learning","demonstration-data","diffusion-policy","roboturk"],"name":"RoboMimic","alt":"robomimic","abbr":"","aliases":["robomimic"],"one_liner":"斯坦福与 UT Austin 研究者做的演示学习框架，含标准数据集和离线学习算法。","explanation":"robomimic 是 ARISE 计划下由斯坦福、UT Austin 研究者开发的演示学习框架，配套论文发表于 CoRL 2021。它在 robosuite 仿真里提供 Lift、Can、Square、Transport、Tool Hang 五个操作任务的数据：PH 是一名熟练操作员的 200 条演示，MH 是 6 名操作员的 300 条，MG 是强化学习智能体生成的数据。框架内置行为克隆、BC-RNN（能看历史的行为克隆）和多种离线强化学习算法，后续版本加入扩散策略。论文发现看历史的模型更强、数据质量影响很大；这套数据后来成了模仿学习论文的常用仿真基准。","example":"扩散策略（Diffusion Policy）论文就在 robomimic 的 Lift、Can、Square、Transport、Tool Hang 任务上与 BC-RNN 等方法比较成功率。","related":["robosuite","行为克隆","离线强化学习","演示数据","扩散策略","RoboTurk"]},{"id":"gazebo","category":"sim","sec":4,"tier":2,"sources":[{"title":"Gazebo (simulator) - Wikipedia","url":"https://en.wikipedia.org/wiki/Gazebo_(simulator)"},{"title":"Gazebo Docs: Getting Started","url":"https://gazebosim.org/docs/latest/getstarted/"}],"as_of":"2026-09","related_ids":["robot-operating-system","robot-operating-system-2","simulator","unified-robot-description-format","simulation-description-format","ros-2-navigation-stack"],"name":"Gazebo","alt":"Gazebo","abbr":"","aliases":["Gazebo Classic","Gazebo Sim","Ignition Gazebo"],"one_liner":"ROS 生态里最常用的开源机器人仿真器，由 Open Robotics 维护。","explanation":"Gazebo 是开源的 3D 机器人仿真器，2002 年起作为 Player 项目的一部分开发，2011 年在 Willow Garage 支持下独立，2012 年起由开源机器人基金会（OSRF，2018 年更名 Open Robotics）维护，和 ROS 同出一源。它能模拟机器人、相机、激光雷达、IMU 等传感器和环境，常用来在上真机前联调导航、建图、控制代码，也用于 DARPA 机器人挑战赛等比赛。2017 年起的重写版一度叫 Ignition，2022 年因商标问题改回 Gazebo，旧版改称 Gazebo Classic，已于 2025 年 1 月停止维护；截至 2026 年当前长期支持版是 Gazebo Jetty。它偏向软件联调，不以大规模 GPU 并行训练见长，强化学习训练多改用 Isaac Lab、MuJoCo 等。","example":"用 ROS 2 做移动机器人时，常先在 Gazebo 里加载机器人的 URDF 模型和一个仓库场景，跑通 Nav2 导航和 SLAM 建图，再把同一套 ROS 节点部署到真机。","related":["机器人操作系统","ROS 2","仿真器","统一机器人描述格式","SDFormat 仿真描述格式","Nav2"]},{"id":"webots","category":"sim","sec":4,"tier":3,"sources":[{"title":"Cyberbotics 官网：Webots","url":"https://cyberbotics.com/"},{"title":"Webots GitHub 仓库","url":"https://github.com/cyberbotics/webots"},{"title":"Webots Releases","url":"https://github.com/cyberbotics/webots/releases"}],"as_of":"2026-09","related_ids":["simulator","physics-engine","gazebo","coppeliasim","robot-operating-system","robot-operating-system-2"],"name":"Webots","alt":"Webots","abbr":"","aliases":["Webots 机器人仿真器"],"one_liner":"瑞士 Cyberbotics 维护的开源桌面机器人仿真软件，入门友好，常用于教学。","explanation":"Webots 是跨平台的开源桌面机器人仿真软件，1996 年诞生于瑞士洛桑联邦理工学院（EPFL），1998 年起由其衍生公司 Cyberbotics 维护，2018 年 12 月开源（Apache 2.0 许可证）。它自带图形界面、基于 ODE 改造的物理引擎和大量现成的机器人与传感器模型，控制器可用 C/C++、Java、Python 或 MATLAB 编写，也能接 ROS / ROS 2。和 Isaac Lab、MuJoCo 这类面向大规模并行强化学习的仿真器相比，它偏向单机交互式仿真，多见于教学、竞赛和移动机器人算法验证。截至 2026 年 9 月，最新正式版是 2025 年 2 月的 R2025a。","example":"官方入门教程第一课：在一个带围墙的场地里放一台两轮小车 e-puck，写一段控制器程序让它动起来，大约 30 分钟可以完成。","related":["仿真器","物理引擎","Gazebo","CoppeliaSim","机器人操作系统","ROS 2"]},{"id":"coppeliasim","category":"sim","sec":4,"tier":3,"sources":[{"title":"Coppelia Robotics 官网","url":"https://www.coppeliarobotics.com/"},{"title":"CoppeliaSim - Wikipedia","url":"https://en.wikipedia.org/wiki/CoppeliaSim"},{"title":"RLBench GitHub（基于 CoppeliaSim 与 PyRep）","url":"https://github.com/stepjam/RLBench"}],"as_of":"2026-09","related_ids":["simulator","physics-engine","rlbench","mujoco","gazebo","webots"],"name":"CoppeliaSim","alt":"CoppeliaSim","abbr":"","aliases":["V-REP","Virtual Robot Experimentation Platform"],"one_liner":"瑞士 Coppelia Robotics 的通用机器人仿真器，前身是 V-REP","explanation":"CoppeliaSim 是瑞士苏黎世 Coppelia Robotics 公司维护的机器人仿真软件，前身叫 V-REP，最早在东芝研发部门开发，改名后与 V-REP 完全兼容。它的特点是功能齐全：可在 MuJoCo、Bullet、ODE、Newton、Vortex 五种物理引擎间切换，内置正/逆运动学、碰撞与距离计算、基于 OMPL 的路径规划，可用 Python、Lua、C/C++ 等语言通过嵌入脚本、插件或远程 API 控制。它有教育版（限学生和教师，不可商用）和商业版。具身学习里最常见的是通过 PyRep 接口间接用它，经典操作基准 RLBench 就搭在 CoppeliaSim 上。它以单机 CPU 仿真为主，需要成千上万并行环境的强化学习训练一般改用 Isaac Lab 等 GPU 仿真器。","example":"RLBench 的桌面操作任务（如开抽屉、叠积木）都跑在 CoppeliaSim 4.1 里，研究者用 PyRep 的 Python 接口控制仿真中的 Franka 机械臂采数据、测策略。","related":["仿真器","物理引擎","RLBench","MuJoCo","Gazebo","Webots"]},{"id":"game-engine","category":"sim","sec":4,"tier":3,"sources":[{"title":"Game engine - Wikipedia","url":"https://en.wikipedia.org/wiki/Game_engine"},{"title":"CARLA Simulator","url":"https://carla.org/"},{"title":"AI2-THOR","url":"https://ai2thor.allenai.org/"}],"as_of":"2026-09","related_ids":["simulator","physics-engine","rendering","photorealistic-rendering","carla","ai2-thor"],"name":"游戏引擎","alt":"Game Engine","abbr":"","aliases":["Unity","Unreal Engine","虚幻引擎"],"one_liner":"开发电子游戏的软件框架，集渲染、物理、动画于一体，也常被拿来做仿真。","explanation":"游戏引擎是为开发电子游戏打造的软件框架，通常包含 3D 渲染、物理引擎、动画、音频、脚本和场景管理等模块，代表产品有 Unity 和 Unreal Engine（虚幻引擎），开源的有 Godot。由于它们在消费级显卡上就能实时渲染逼真画面、编辑场景方便，也被用于建筑可视化、训练模拟和科研。具身智能里不少仿真平台直接建在游戏引擎上，好处是画面真实、资产和工具丰富；短板是游戏物理追求看起来合理，而不是精确，常用笛卡尔坐标加数值约束来连关节，结构复杂时关节约束可能被破坏。所以精细操作和运动控制研究更常用 MuJoCo、Isaac Sim 这类面向机器人的仿真器。","example":"自动驾驶仿真器 CARLA 基于虚幻引擎（0.10.0 版起升级到 UE 5.5），家居具身环境 AI2-THOR 基于 Unity。","related":["仿真器","物理引擎","渲染","照片级真实感渲染","CARLA","AI2-THOR"]},{"id":"carla","category":"sim","sec":4,"tier":3,"sources":[{"title":"CARLA: An Open Urban Driving Simulator (arXiv 1711.03938)","url":"https://arxiv.org/abs/1711.03938"},{"title":"CARLA Simulator 官网","url":"https://carla.org/"},{"title":"carla-simulator/carla (GitHub)","url":"https://github.com/carla-simulator/carla"}],"as_of":"2026-09","related_ids":["autonomous-driving","simulator","game-engine","closed-loop-evaluation","end-to-end","lidar"],"name":"CARLA","alt":"CARLA","abbr":"","aliases":["CARLA 仿真器"],"one_liner":"基于虚幻引擎的开源自动驾驶仿真器，常用于驾驶策略的闭环测试。","explanation":"CARLA 由 Alexey Dosovitskiy、German Ros、Vladlen Koltun 等人在 2017 年首届 CoRL 上发布，开源提供城市道路布局、建筑、车辆等数字资产，可以灵活配置相机、激光雷达、深度、GPS 等传感器，以及天气、光照和交通参与者。原论文就用它比较了三种驾驶方案：传统模块化流水线、模仿学习端到端模型和强化学习端到端模型。此后它成为自动驾驶闭环评测的常用平台，并配有自动驾驶排行榜（Leaderboard）。据官网，0.10.0（2024 年 12 月）升级到虚幻引擎 5.5，基于虚幻引擎 4 的 0.9.x 系列仍在维护，0.9.16 发布于 2025 年 9 月；代码为 MIT 许可，资产为 CC-BY 许可。","example":"CARLA 自动驾驶排行榜让参赛的驾驶系统在固定路线和交通场景中闭环行驶，按路线完成度和违规情况自动打分。","related":["自动驾驶","仿真器","游戏引擎","闭环评测","端到端","激光雷达"]},{"id":"roboverse-towards-a-unified-platform-dataset-and-benchmark-f","category":"sim","sec":4,"tier":3,"sources":[{"title":"arXiv 2504.18904 - RoboVerse","url":"https://arxiv.org/abs/2504.18904"},{"title":"GitHub - RoboVerseOrg/RoboVerse","url":"https://github.com/RoboVerseOrg/RoboVerse"},{"title":"RoboVerse 文档站","url":"https://roboverse.wiki/"}],"as_of":"2026-09","related_ids":["simulator","sim-to-sim-transfer","nvidia-isaac-lab","mujoco","sapien","benchmark"],"name":"RoboVerse","alt":"RoboVerse (MetaSim): Towards a Unified Platform, Dataset and Benchmark for Scalable and Generalizable Robot Learning","abbr":"","aliases":["MetaSim"],"one_liner":"用统一接口打通多款仿真器的机器人学习平台，附带合成数据集和评测基准","explanation":"RoboVerse 是 2025 年 4 月发布的开源项目，作者包括伯克利的 Pieter Abbeel、Jitendra Malik 等多家机构的研究者，论文被 RSS 2025 接收，代码采用 Apache 2.0 许可。它的底座叫 MetaSim：一层与具体仿真器无关的中间件，把 Isaac Lab、Isaac Gym、MuJoCo、SAPIEN、PyBullet、Genesis、CoppeliaSim 等后端统一成同一套配置和 API，负责启动环境、加载资产和推进物理步进。这样同一个任务、同一批机器人和资产可以在不同仿真器之间切换，缓解各家仿真器格式互不兼容、基准难以横向比较的问题。在此之上，RoboVerse 汇集了 LIBERO、ManiSkill、RLBench、Meta-World、robosuite 等已有基准的任务和数据，提供合成数据集、统一评测协议，以及模仿学习、强化学习和 VLA 训练流程。","example":"在 MetaSim 里写好一个抓取任务的配置，通过切换仿真后端参数，把同一任务分别放到 MuJoCo 和 Isaac Lab 上运行，比较策略在两个仿真器下的表现差异。","related":["仿真器","仿真到仿真迁移","Isaac Lab","MuJoCo","SAPIEN","基准测试"]},{"id":"simulation-assets","category":"sim","sec":5,"tier":2,"sources":[{"title":"NVIDIA SimReady 文档","url":"https://docs.omniverse.nvidia.com/simready/latest/index.html"},{"title":"RoboTwin 官网（RoboTwin-OD）","url":"https://robotwin-platform.github.io/"}],"as_of":"","related_ids":["simready-assets","convex-decomposition","articulated-object","objaverse","universal-scene-description","unified-robot-description-format"],"name":"仿真资产","alt":"Simulation Assets","abbr":"","aliases":["3D 资产","场景资产","Sim Assets"],"one_liner":"仿真里用的机器人、物体和场景模型，既要外观像，也要带物理属性。","explanation":"仿真资产是搭仿真环境的原材料，包括机器人模型（常用 URDF、MJCF 描述连杆和关节）、可操作物体、家具和整个房间场景。和游戏模型不同，它除了外观网格和材质，还要有碰撞体（常用凸分解把复杂网格拆成凸块）、质量、摩擦系数、铰接关节（如抽屉滑轨、门铰链）和语义标签。英伟达基于 OpenUSD 的 SimReady 资产就强调带物理属性、语义标注和传感器属性。资产数量和多样性决定能生成多少种训练场景，直接影响策略泛化；常见来源有 Objaverse、PartNet-Mobility 和生成式 3D 模型。","example":"RoboTwin 2.0 的物体库 RoboTwin-OD 含 731 个物体，其中 534 个自建网格、153 个取自 Objaverse、44 个铰接物体来自 PartNet-Mobility。","related":["SimReady 资产","凸分解","铰接物体","Objaverse 3D 资产库","通用场景描述","统一机器人描述格式"]},{"id":"articulated-object","category":"sim","sec":5,"tier":2,"sources":[{"title":"SAPIEN: A SimulAted Part-based Interactive ENvironment (PartNet-Mobility)","url":"https://arxiv.org/abs/2003.08515"},{"title":"simpler-env/SimplerEnv (GitHub)","url":"https://github.com/simpler-env/SimplerEnv"}],"as_of":"","related_ids":["articulated-object-manipulation","partnet-mobility","revolute-joint","prismatic-joint","articulation-estimation","unified-robot-description-format"],"name":"铰接物体","alt":"Articulated Object","abbr":"","aliases":["可动物体","关节物体","带关节物体"],"one_liner":"由关节连接、部件能相对转动或滑动的物体，如柜门、抽屉、笔记本电脑。","explanation":"铰接物体指由两个以上刚性部件通过关节相连、部件之间能相对运动的物体，比如绕合页转动的柜门和冰箱门（转动关节）、沿滑轨拉出的抽屉（移动关节），还有笔记本电脑、剪刀、水龙头。家里需要机器人处理的东西很多属于这一类。操作它们比抓单个刚体难：机器人要认出哪个部件能动、关节轴在哪、能动多大范围，再沿受约束的轨迹施力，拉偏了就会卡住。在仿真里，铰接物体通常用 URDF 等格式描述成「连杆 + 关节」的树，常用资产库是 SAPIEN 团队 2020 年发布的 PartNet-Mobility，含 46 个类别、2346 个带关节标注的物体模型。","example":"SimplerEnv 里 Google Robot 的「打开 / 关上抽屉」任务：抽屉通过移动关节与柜体相连，机器人要沿滑轨方向把它拉出或推回。","related":["铰接物体操作","PartNet-Mobility 数据集","转动关节","移动关节","铰接结构估计","统一机器人描述格式"]},{"id":"simready-assets","category":"sim","sec":5,"tier":3,"sources":[{"title":"NVIDIA Omniverse - SimReady 文档","url":"https://docs.omniverse.nvidia.com/simready/latest/index.html"}],"as_of":"2026-09","related_ids":["simulation-assets","universal-scene-description","nvidia-isaac-sim","nvidia-omniverse","digital-twin","synthetic-data"],"name":"SimReady 资产","alt":"SimReady Assets","abbr":"","aliases":["仿真就绪资产","SimReady"],"one_liner":"英伟达提出的 3D 资产规范：模型自带物理、材质和语义标注，放进仿真即可用","explanation":"SimReady 是英伟达在 Omniverse 生态里推动的一套 3D 资产规范。普通 3D 模型往往只有外形和贴图，放进仿真器还得人工补质量、碰撞形状、摩擦等参数；SimReady 资产要求以 OpenUSD（通用场景描述，一种三维场景文件格式）为载体，同时带上基于 USD Physics 的物理属性、基于物理的材质、供机器学习使用的语义标签，以及与传感器仿真相关的非可视属性。这样的资产拖进 Isaac Sim 等仿真器就能直接参与碰撞和抓取，渲染出的合成图像也自带标注。英伟达把它定位为面向工厂、仓库、数据中心数字孪生以及机器人和自动驾驶训练的通用标准。","example":"在 Isaac Sim 里搭一个仓库场景，直接拖入 SimReady 规范的纸箱和货架，它们已带质量、碰撞形状和语义类别，可马上用来训练搬运策略，并批量生成带分割标注的合成图像。","related":["仿真资产","通用场景描述","Isaac Sim","Omniverse","数字孪生","合成数据"]},{"id":"heightfield-terrain","category":"sim","sec":5,"tier":3,"sources":[{"title":"MuJoCo XML Reference: asset/hfield","url":"https://mujoco.readthedocs.io/en/stable/XMLreference.html#asset-hfield"},{"title":"Isaac Lab API: isaaclab.terrains","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.terrains.html"}],"as_of":"","related_ids":["terrain-curriculum","rough-terrain-locomotion","elevation-map","height-scan","legged-gym","mujoco"],"name":"高度场地形","alt":"Heightfield Terrain","abbr":"","aliases":["高度图地形","hfield","Height Map Terrain"],"one_liner":"用二维网格存每个点的地面高度来表示起伏地形，足式机器人训练最常用。","explanation":"高度场（height field）是一张二维高程矩阵：地面被划成网格，每个格子只存一个高度值，像一张灰度图，越白越高。仿真器用它低成本地表示坡道、台阶、碎石等起伏地形。MuJoCo 的 hfield 资产可以从 PNG 或二进制文件读入，也可以运行时按传感器数据生成，碰撞检测时把它当作一堆三棱柱处理；Isaac Lab 则把高度场转换成三角网格，内置随机起伏、金字塔坡、台阶、离散障碍、波浪、踏石等地形，每种都带难度参数，便于配合地形课程由易到难训练。局限是一个平面位置只能有一个高度，表示不了悬空结构或洞穴。","example":"Isaac Lab 的金字塔台阶地形（pyramid stairs）：难度参数越大台阶越高，训练四足行走时常和随机起伏地形混在一起，按地形课程逐级加难。","related":["地形课程","复杂地形行走","高程图","高度扫描","legged_gym","MuJoCo"]},{"id":"ai2-thor","category":"sim","sec":5,"tier":2,"sources":[{"title":"AI2-THOR 官网","url":"https://ai2thor.allenai.org/"},{"title":"AI2-THOR: An Interactive 3D Environment for Visual AI (arXiv 1712.05474)","url":"https://arxiv.org/abs/1712.05474"}],"as_of":"2026-09","related_ids":["procthor","alfred","habitat","object-goal-navigation","embodied-question-answering","allen-institute-for-ai"],"name":"AI2-THOR","alt":"AI2-THOR","abbr":"","aliases":["ai2thor","iTHOR"],"one_liner":"艾伦人工智能研究所的可交互室内 3D 仿真环境，常用于导航和家务任务研究。","explanation":"AI2-THOR 是艾伦人工智能研究所（Ai2）开发的开源室内仿真平台，论文 2017 年发布，基于 Unity 引擎。它提供接近照片级的厨房、卧室、浴室、客厅场景，智能体可以在里面走动并与物体交互，如开关柜门、拿起放下物品、开关电器，物体的开合、冷热等状态会随之改变。它侧重高层语义交互而不是精细的接触物理，因此多用于视觉导航、具身问答、指令跟随和任务规划。它包含几个子框架：iTHOR（120 个房间、2000 多种物体）、RoboTHOR（配有实体场地的公寓场景）、ManipulaTHOR（加入机械臂操作）和 ProcTHOR（程序化生成大量房屋）。","example":"在 iTHOR 的厨房场景里，智能体可以依次执行「走到冰箱前」「打开冰箱」「拿起苹果」等动作，冰箱门的开合状态会随之改变。","related":["ProcTHOR","ALFRED","Habitat","物体目标导航","具身问答","艾伦人工智能研究所"]},{"id":"virtualhome-simulating-household-activities-via-programs","category":"sim","sec":5,"tier":3,"sources":[{"title":"VirtualHome: Simulating Household Activities via Programs (arXiv 1806.07011, CVPR 2018)","url":"https://arxiv.org/abs/1806.07011"},{"title":"VirtualHome GitHub 仓库","url":"https://github.com/xavierpuigf/virtualhome"}],"as_of":"2026-09","related_ids":["household-tasks","llm-based-task-planning","long-horizon-task","ai2-thor","alfred","simulator"],"name":"VirtualHome 家庭活动仿真","alt":"VirtualHome: Simulating Household Activities via Programs","abbr":"","aliases":["VirtualHome"],"one_liner":"用「程序」驱动虚拟人在 Unity 家庭场景里做家务的仿真平台。","explanation":"VirtualHome 是 MIT 与多伦多大学在 CVPR 2018 提出的家庭活动仿真平台，基于 Unity3D 游戏引擎，用 Python API 调用。它把「做早饭」「看电视」这类家务写成「程序」，即由走到、拿起、打开、开关电器等原子动作组成的步骤序列，让虚拟人在仿真公寓里逐步执行，并渲染出带标注的视频。它关心高层任务规划，不模拟机械臂和接触力学，因此常用来测大语言模型的任务分解能力。当前版本 2.3 支持程序化生成场景，还衍生出人机协作基准 Watch-And-Help。","example":"例如「看电视」可以写成「走到客厅→拿起遥控器→打开电视→坐到沙发上」这样的程序，虚拟人按步骤执行，平台输出对应的视频和标注。","related":["家务任务","大模型任务规划","长程任务","AI2-THOR","ALFRED","仿真器"]},{"id":"habitat","category":"sim","sec":5,"tier":2,"sources":[{"title":"AI Habitat 官网","url":"https://aihabitat.org/"},{"title":"Habitat: A Platform for Embodied AI Research (arXiv 1904.01201)","url":"https://arxiv.org/abs/1904.01201"},{"title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots (arXiv 2310.13724)","url":"https://arxiv.org/abs/2310.13724"}],"as_of":"2023-10","related_ids":["point-goal-navigation","object-goal-navigation","habitat-matterport-3d-dataset","social-navigation","rearrangement","matterport3d"],"name":"Habitat","alt":"Habitat (Habitat-Sim / Habitat-Lab)","abbr":"","aliases":["Habitat-Sim","Habitat-Lab","Habitat 3.0","AI Habitat"],"one_liner":"Meta 开源的具身智能仿真平台，主要用于室内导航、物体重排和人机协作任务。","explanation":"Habitat 是 Meta（原 Facebook AI Research）联合多所高校开发的开源具身智能仿真平台，首篇论文发表于 ICCV 2019。它分两层：Habitat-Sim 是高速 3D 仿真器，能加载 Matterport3D、HM3D、Gibson、Replica 等真实室内扫描场景，单 GPU 多进程渲染可超过每秒 1 万帧；Habitat-Lab 是上层库，用来定义任务、配置智能体、训练和评测。2021 年的 Habitat 2.0 加入物理交互和家居重排任务，2023 年的 Habitat 3.0 加入人形化身和真人在环，支持社交导航与人机协作重排。它是视觉导航研究的主要平台之一，每年举办 Habitat Challenge，要求提交代码在没见过的场景里评测。","example":"点目标导航任务里，智能体被放进 HM3D 中一套没见过的公寓扫描场景，只知道目标相对起点的坐标，要靠相机画面和深度图自己走到目标点。","related":["点目标导航","物体目标导航","HM3D 数据集","社交导航","物体重排","Matterport3D 数据集"]},{"id":"igibson","category":"sim","sec":5,"tier":3,"sources":[{"title":"iGibson project page (Stanford SVL)","url":"https://svl.stanford.edu/igibson/"},{"title":"iGibson 1.0 (arXiv 2012.02924)","url":"https://arxiv.org/abs/2012.02924"},{"title":"BEHAVIOR (Stanford) — OmniGibson on Isaac Sim","url":"https://behavior.stanford.edu/"}],"as_of":"2026-09","related_ids":["omnigibson","behavior-1k","habitat","ai2-thor","mobile-manipulation","pybullet"],"name":"iGibson","alt":"iGibson (Interactive Gibson)","abbr":"","aliases":["iGibson 1.0","iGibson 2.0"],"one_liner":"斯坦福推出的室内交互式仿真平台，用于家庭场景中的导航与移动操作研究。","explanation":"iGibson 由斯坦福视觉与学习实验室（李飞飞、Silvio Savarese 等）开发，是早期 Gibson 环境的可交互版本。1.0 版（IROS 2021）提供 15 套按真实住宅重建的全交互场景、共 108 个房间，家具、柜门、抽屉等刚体和铰接物体都能被机器人推动或打开，可输出 RGB、深度、分割、激光雷达等传感信号，物理基于 Bullet 引擎，还自带运动规划器。2.0 版（CoRL 2021）加入温度、湿度、清洁度、切开等物体状态，并支持用 VR 采集人类示范，用于 BEHAVIOR 家务任务基准。之后斯坦福的 BEHAVIOR-1K 改用基于英伟达 Isaac Sim 的 OmniGibson，新项目多转向后者。","example":"在 iGibson 的住宅场景里让移动机器人导航到厨房、打开柜门，并用自带的运动规划器生成无碰撞的手臂轨迹。","related":["OmniGibson","BEHAVIOR-1K","Habitat","AI2-THOR","移动操作","PyBullet"]},{"id":"omnigibson","category":"sim","sec":5,"tier":2,"sources":[{"title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation (arXiv 2403.09227)","url":"https://arxiv.org/abs/2403.09227"},{"title":"BEHAVIOR 项目主页","url":"https://behavior.stanford.edu/"},{"title":"StanfordVL/BEHAVIOR-1K (GitHub)","url":"https://github.com/StanfordVL/BEHAVIOR-1K"}],"as_of":"2026-09","related_ids":["behavior-1k","igibson","nvidia-isaac-sim","nvidia-omniverse","household-tasks","long-horizon-task"],"name":"OmniGibson","alt":"OmniGibson","abbr":"","aliases":["BEHAVIOR-1K 仿真器"],"one_liner":"斯坦福基于 Omniverse 的家庭场景仿真器，BEHAVIOR-1K 的底座。","explanation":"OmniGibson 是斯坦福视觉与学习实验室（SVL，李飞飞等）开发的家庭环境仿真平台，基于 NVIDIA Omniverse 和 PhysX 5，是家务基准 BEHAVIOR-1K 的底层模拟器，取代了前代 iGibson 2.0。它的物理类型很全：刚体、可变形物体、布料、流体和颗粒，外加火、蒸汽、烟等热效应，并跟踪温度、煮熟或烧焦、浸湿、开关、切开、脏污等扩展物体状态。论文指出超过一半的 BEHAVIOR-1K 活动离开流体、软体和布料就模拟不了。画面用光线追踪或路径追踪渲染。BEHAVIOR-1K 含 1000 项日常活动、50 个可交互场景和一万多个物体，并以它为平台举办 BEHAVIOR 挑战赛。","example":"做饭类任务里，机器人要把食材放进锅里加热，OmniGibson 会持续跟踪食材温度，达到阈值后把它的状态记为「已煮熟」，任务是否完成就按这些状态判定。","related":["BEHAVIOR-1K","iGibson","Isaac Sim","Omniverse","家务任务","长程任务"]},{"id":"internutopia","category":"sim","sec":5,"tier":3,"sources":[{"title":"InternRobotics/InternUtopia (GitHub)","url":"https://github.com/InternRobotics/InternUtopia"},{"title":"GRUtopia: Dream General Robots in a City at Scale (arXiv 2407.10943)","url":"https://arxiv.org/abs/2407.10943"},{"title":"百度百科：浦源·桃源","url":"https://baike.baidu.com/item/%E6%B5%A6%E6%BA%90%C2%B7%E6%A1%83%E6%BA%90"}],"as_of":"2025-07","related_ids":["nvidia-isaac-sim","shanghai-artificial-intelligence-laboratory","social-navigation","mobile-manipulation","object-goal-navigation","internvla"],"name":"InternUtopia","alt":"InternUtopia (formerly GRUtopia)","abbr":"","aliases":["GRUtopia","桃源","浦源·桃源"],"one_liner":"上海人工智能实验室基于 Isaac Sim 的城市级具身智能仿真平台，原名 GRUtopia。","explanation":"InternUtopia 由上海人工智能实验室开发，前身为 GRUtopia，中文名「浦源·桃源」，2024 年 7 月在世界人工智能大会发布并公开论文，2025 年 2 月推出 2.0 版，同年 7 月随 2.2.0 版改为现名。它构建在英伟达 Isaac Sim 之上，由三部分组成：GRScenes 场景库，约 10 万个精细标注的可交互场景，覆盖 89 类，从家庭延伸到超市、医院等服务场所；GRResidents，由大语言模型驱动的虚拟居民（NPC），可与机器人对话、生成任务；GRBench 基准，侧重足式机器人，含物体导航、社交导航和移动操作三类任务。平台还支持 VR 遥操作和手部动捕控制，与 InternNav、InternManip 等配套使用。","example":"在 GRBench 的社交导航任务中，机器人可以向 GRResidents 驱动的虚拟居民询问目标物体的信息，再走到对应位置。","related":["Isaac Sim","上海人工智能实验室","社交导航","移动操作","物体目标导航","上海AI实验室 InternVLA 系列"]},{"id":"procedural-generation","category":"sim","sec":5,"tier":2,"sources":[{"title":"Wikipedia: Procedural generation","url":"https://en.wikipedia.org/wiki/Procedural_generation"},{"title":"ProcTHOR: Large-Scale Embodied AI Using Procedural Generation (arXiv 2206.06994)","url":"https://arxiv.org/abs/2206.06994"},{"title":"Infinigen","url":"https://infinigen.org/"}],"as_of":"","related_ids":["procthor","infinigen","domain-randomization","generative-simulation","scene-generalization","terrain-curriculum"],"name":"程序化生成","alt":"Procedural Generation","abbr":"","aliases":["程序化场景生成","程序生成","Procedural Content Generation","PCG"],"one_liner":"用规则加随机数自动批量造出场景、物体和地形，而不是逐个手工搭建。","explanation":"程序化生成源自游戏业，指用算法加随机数自动产生内容，比如《我的世界》由一个随机种子生成整张地图。在具身智能里，它用来批量制造仿真训练环境：先写好规则（户型怎么划分、家具放哪、贴什么材质、灯光如何），再随机采样出成千上万个不同场景。手工搭一个可交互的 3D 房子很费时，场景太少策略又容易过拟合，程序化生成用规则换来数量和多样性，是提升场景泛化的常用手段。代表工作有艾伦人工智能研究所的 ProcTHOR 和普林斯顿的 Infinigen；四足强化学习里随机生成的台阶、斜坡地形也属此类。与之相对的是用大模型按文字描述造场景的生成式仿真。","example":"ProcTHOR 可随机生成 1 到 10 个房间的户型，从 108 类、1633 个可交互物体和 3278 种材质中采样布置；论文用 1 万套生成的房子预训练具身智能体，不在下游数据上微调就常超过此前的最好方法。","related":["ProcTHOR","Infinigen 程序化世界生成","域随机化","生成式仿真","场景泛化","地形课程"]},{"id":"procthor","category":"sim","sec":5,"tier":3,"sources":[{"title":"ProcTHOR: Large-Scale Embodied AI Using Procedural Generation (arXiv 2206.06994)","url":"https://arxiv.org/abs/2206.06994"},{"title":"ProcTHOR 项目主页","url":"https://procthor.allenai.org/"},{"title":"NeurIPS 2022 Awards","url":"https://neurips.cc/virtual/2022/awards_detail"}],"as_of":"2024-06","related_ids":["ai2-thor","procedural-generation","object-goal-navigation","rearrangement","poliformer","holodeck"],"name":"ProcTHOR","alt":"ProcTHOR (Large-Scale Embodied AI Using Procedural Generation)","abbr":"","aliases":["ProcTHOR-10K"],"one_liner":"艾伦 AI 研究所推出的、程序化批量生成可交互 3D 房屋的具身仿真框架。","explanation":"艾伦人工智能研究所（Ai2）2022 年 6 月发布，获 NeurIPS 2022 杰出论文奖，建在 AI2-THOR 仿真器之上。此前具身智能体只能在几十到几百个人工搭建的场景里训练，容易「背地图」、换个房子就不会。ProcTHOR 用程序化生成（按规则加随机采样自动造内容）批量造房屋：先定房间类型和数量，再生成户型、摆放家具和小物件，并随机材质与光照；物体库有 108 类、1633 个可交互物体。官方开放了 1 万套房屋的 ProcTHOR-10K。只用 RGB 图像、在这些房子里预训练的智能体，在物体导航、物体重排、机械臂指点导航等 6 个基准上取得当时最好成绩，部分任务不经微调（零样本）也表现很强。后来的 PoliFormer 等导航模型也在它生成的房屋中用强化学习训练。","example":"指定「两间卧室加厨房和客厅」，ProcTHOR 自动生成户型、摆好床、沙发和冰箱并随机换地板材质与光照，得到一套可让智能体进去打开冰箱、寻找苹果的新房子。","related":["AI2-THOR","程序化生成","物体目标导航","物体重排","PoliFormer","Holodeck 语言生成三维环境"]},{"id":"infinigen","category":"sim","sec":5,"tier":3,"sources":[{"title":"Infinigen official site","url":"https://infinigen.org/"},{"title":"Infinite Photorealistic Worlds using Procedural Generation (arXiv 2306.09310)","url":"https://arxiv.org/abs/2306.09310"},{"title":"princeton-vl/infinigen (GitHub)","url":"https://github.com/princeton-vl/infinigen"}],"as_of":"2025-05","related_ids":["procedural-generation","synthetic-data","simulation-assets","articulated-object","blender","generative-simulation"],"name":"Infinigen 程序化世界生成","alt":"Infinigen (Infinite Photorealistic Worlds using Procedural Generation; Infinigen Indoors / Infinigen-Articulated)","abbr":"","aliases":["Infinigen","Infinigen Indoors","Infinigen-Articulated","Infinigen-Sim"],"one_liner":"普林斯顿开源的程序化三维世界生成器，所有资产都由随机数学规则从零生成。","explanation":"Infinigen 由普林斯顿视觉与学习实验室（邓嘉团队）开发，基于 Blender，以 BSD 协议开源。初版（CVPR 2023）生成自然户外场景：地形、植物、动物以及火、云、雨雪等现象，每个资产的形状和纹理都由随机化数学规则从零生成，不用任何外部素材，因此能无限变化，并自动输出深度、光流、分割、法向等标注。Infinigen Indoors（CVPR 2024）扩展到室内，用约束描述语言和求解器摆放家具、电器等，并可导出到 Omniverse 等实时仿真器训练具身智能体。Infinigen-Articulated（又称 Infinigen-Sim，2025）进一步程序化生成带关节、仿真就绪的物体，可导出 URDF、MJCF、USD 给 MuJoCo、Isaac 使用。","example":"同一套室内生成规则换一个随机种子，就得到布局、家具形状和材质都不同的新房间，并附带像素级深度和分割真值，可直接做视觉训练数据。","related":["程序化生成","合成数据","仿真资产","铰接物体","Blender","生成式仿真"]},{"id":"generative-simulation","category":"sim","sec":5,"tier":2,"sources":[{"title":"Towards Generalist Robots: A Promising Paradigm via Generative Simulation (arXiv 2305.10455)","url":"https://arxiv.org/abs/2305.10455"},{"title":"RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation (arXiv 2311.01455)","url":"https://arxiv.org/abs/2311.01455"}],"as_of":"","related_ids":["procedural-generation","synthetic-data","simulation-data","robogen","holodeck","genesis"],"name":"生成式仿真","alt":"Generative Simulation","abbr":"","aliases":["仿真场景自动生成","仿真任务自动生成"],"one_liner":"用大模型自动生成仿真任务、场景和训练监督，批量产出机器人训练数据。","explanation":"生成式仿真是 Zhou Xian 等人在 2023 年论文中提出的思路：与其让大模型直接输出机器人动作，不如用语言模型、图像和 3D 生成模型等基础模型，全自动地生成多样的任务、场景和训练监督（如奖励函数、演示轨迹），在仿真里大规模学技能。它针对的问题是人工搭场景、设计任务和奖励太慢，数据多样性上不去。典型流程是：大模型先提出任务，再检索或生成 3D 资产摆成场景，然后把任务拆成子步骤，选用强化学习或运动规划等方法生成数据、学出策略。代表工作有 RoboGen、GenSim、Holodeck。它和程序化生成（按手写规则随机造场景）的区别在于由基础模型驱动。","example":"RoboGen 的循环是：大模型先提出要学的任务和技能，再挑选相关物体资产、按合理空间关系摆成仿真场景，然后把任务拆成子任务，自行选择学习方法、生成训练监督并学出策略，全程无需人工设计。","related":["程序化生成","合成数据","仿真数据","RoboGen","Holodeck 语言生成三维环境","Genesis"]},{"id":"holodeck","category":"sim","sec":5,"tier":3,"sources":[{"title":"Holodeck: Language Guided Generation of 3D Embodied AI Environments (arXiv 2312.09067)","url":"https://arxiv.org/abs/2312.09067"},{"title":"allenai/Holodeck (GitHub)","url":"https://github.com/allenai/Holodeck"},{"title":"Holodeck project page","url":"https://yueyang.ai/holodeck/"}],"as_of":"2024-06","related_ids":["ai2-thor","procthor","objaverse","generative-simulation","procedural-generation","object-goal-navigation"],"name":"Holodeck 语言生成三维环境","alt":"Holodeck: Language Guided Generation of 3D Embodied AI Environments","abbr":"","aliases":["Holodeck"],"one_liner":"输入一句话描述，用 GPT-4 和 Objaverse 资产自动生成可交互的三维室内场景。","explanation":"Holodeck 是宾夕法尼亚大学、斯坦福、华盛顿大学和艾伦人工智能研究所（Ai2）合作的工作，发表于 CVPR 2024。具身智能体需要大量多样的训练场景，但手工搭三维房间成本很高。Holodeck 让用户输入「养猫研究员的公寓」这类描述，由 GPT-4 提供常识：房间布局、墙地材质、门窗、该放哪些物体，并写出物体之间的空间关系约束（如某把椅子在桌子旁边），再由优化算法求解摆放位置；物体从 Objaverse 三维资产库中检索。生成的场景基于 AI2-THOR 加载使用。论文实验中，在 Holodeck 场景上训练的物体目标导航智能体，面对音乐室、托儿所等新场景类型时零样本泛化更好。","example":"输入「apartment for a researcher with a cat」，Holodeck 自动规划房间、选墙地材质、从 Objaverse 挑家具并按约束摆好，生成的场景可直接在 AI2-THOR 中加载。","related":["AI2-THOR","ProcTHOR","Objaverse 3D 资产库","生成式仿真","程序化生成","物体目标导航"]},{"id":"molmospaces","category":"sim","sec":5,"tier":3,"sources":[{"title":"MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation (arXiv 2602.11337)","url":"https://arxiv.org/abs/2602.11337"},{"title":"Ai2 Blog: MolmoSpaces","url":"https://allenai.org/blog/molmospaces"},{"title":"MolmoBot: Large-Scale Simulation Enables Zero-Shot Manipulation (arXiv 2603.16861)","url":"https://arxiv.org/abs/2603.16861"}],"as_of":"2026-03","related_ids":["allen-institute-for-ai","simulation-based-evaluation","sim-to-real-correlation","procthor","objaverse","mobile-manipulation"],"name":"MolmoSpaces","alt":"MolmoSpaces (MolmoSpaces-Bench)","abbr":"","aliases":["MolmoSpaces-Bench"],"one_liner":"艾伦人工智能研究所开放的大规模室内仿真场景与机器人评测生态。","explanation":"MolmoSpaces 是艾伦人工智能研究所（Ai2）2026 年 2 月发布的开放生态，用来大规模生成数据、训练和评测机器人策略。它收录 23 万多个室内场景（来自 iTHOR、ProcTHOR、Holodeck 等）和 13 万个带标注的物体模型，其中 4.8 万个可操作物体配有 4200 万个稳定抓取位姿。场景不绑定仿真器，支持 MuJoCo、ManiSkill 和 Isaac。配套的 MolmoSpaces-Bench 含 8 项任务，覆盖桌面与移动操作、导航和跨房间长程任务；论文报告其仿真成绩与真机成绩高度相关（R = 0.96），并发现策略对指令措辞、初始关节位置和相机遮挡很敏感。","example":"Ai2 的 MolmoBot 在 MolmoSpaces 中程序化生成 180 万条仿真轨迹，不用真机数据直接部署到 Franka FR3，桌面抓放真机成功率 79.2%，对照的 π0.5 为 39.2%。","related":["艾伦人工智能研究所","仿真评测","仿真-真机相关性","ProcTHOR","Objaverse 3D 资产库","移动操作"]},{"id":"genie-sim","category":"sim","sec":5,"tier":2,"sources":[{"title":"AgibotTech/genie_sim (GitHub)","url":"https://github.com/AgibotTech/genie_sim"},{"title":"Genie Sim 3.0: A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot (arXiv 2601.02078)","url":"https://arxiv.org/abs/2601.02078"}],"as_of":"2026-08","related_ids":["agibot","nvidia-isaac-sim","simulation-based-evaluation","synthetic-data","gaussian-splatting-based-simulation","generative-simulation"],"name":"智元 Genie Sim","alt":"Genie Sim (AgiBot)","abbr":"","aliases":["Genie Sim","Genie Sim Benchmark","Genie Sim 3.0"],"one_liner":"智元机器人开源的具身仿真平台，集场景生成、数据合成和评测基准于一体。","explanation":"Genie Sim 是智元机器人（AgiBot）开源的机器人操作仿真平台，基于英伟达 Isaac Sim 构建，代码采用 MPL 2.0 协议。2025 年发布 2.x 版本，2026 年 1 月发布 Genie Sim 3.0 并公开技术报告，之后更新到 3.2。它把几件事放在一起：用大模型把自然语言描述转成仿真场景的生成器；用 3D 高斯泼溅从真实场景重建仿真资产；覆盖 200 多个任务、10 万多个场景、用视觉语言模型自动打分的评测基准；以及开源的 1 万多小时合成数据。目标是用仿真数据替代部分真机数据来训练策略，官方报告了零样本仿真到真机迁移的结果。","example":"开发者写一句「在超市货架前摆几排饮料瓶」这样的描述，Genie Sim 的生成器会检索资产、输出 .usda 场景文件，再用智元精灵 G2 的机器人模型在该场景里采集合成数据或跑评测。","related":["智元机器人","Isaac Sim","仿真评测","合成数据","高斯泼溅仿真","生成式仿真"]},{"id":"sim-to-real-gap","category":"sim","sec":6,"tier":1,"sources":[{"title":"Sim-to-Real Transfer in Deep Reinforcement Learning for Robotics: a Survey (arXiv 2009.13303)","url":"https://arxiv.org/abs/2009.13303"},{"title":"Lilian Weng: Domain Randomization for Sim2Real Transfer","url":"https://lilianweng.github.io/posts/2019-05-05-domain-randomization/"}],"as_of":"","related_ids":["sim-to-real-transfer","domain-randomization","system-identification","domain-adaptation","actuator-modeling","real-to-sim"],"name":"虚实差距","alt":"Sim-to-Real Gap (Reality Gap)","abbr":"","aliases":["现实差距","Reality Gap","Sim2Real Gap","虚实鸿沟"],"one_liner":"仿真和真实世界之间的差异，导致仿真里练好的策略上真机后变差。","explanation":"虚实差距指仿真环境与真实世界不一致，使仿真中训练好的策略迁移到真机后性能下降甚至失效。来源大致有几类：物理参数不准（摩擦、质量、阻尼、电机特性）、物理建模本身的简化（如软接触、柔性物体）、画面差异（渲染的光照纹理和真实相机不同），以及传感器噪声、控制延迟等仿真里没建模的因素。仿真训练便宜、安全、可大规模并行，所以缩小这道差距是仿真到现实迁移的核心问题。常见对策有系统辨识（把仿真参数校准准）、域随机化（让策略适应一大片参数范围）、领域自适应（让仿真数据分布向真实靠拢），以及用少量真机数据微调。","example":"仿真里训好的四足行走策略，上真机后因为电机响应比仿真慢而原地抖动甚至摔倒，就是典型的虚实差距。","related":["仿真到现实迁移","域随机化","系统辨识","领域自适应","执行器建模","现实到仿真"]},{"id":"sim-to-real-transfer","category":"sim","sec":6,"tier":1,"sources":[{"title":"Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (Tobin et al., 2017)","url":"https://arxiv.org/abs/1703.06907"},{"title":"Sim-to-Real Transfer in Deep Reinforcement Learning for Robotics: a Survey (Zhao et al., 2020)","url":"https://arxiv.org/abs/2009.13303"},{"title":"Learning agile and dynamic motor skills for legged robots (Hwangbo et al., 2019)","url":"https://arxiv.org/abs/1901.08652"}],"as_of":"","related_ids":["sim-to-real-gap","domain-randomization","system-identification","actuator-modeling","real-to-sim","teacher-student-distillation"],"name":"仿真到现实迁移","alt":"Sim-to-Real Transfer","abbr":"Sim2Real","aliases":["Sim-to-Real","sim2real","虚实迁移","仿真到真实迁移"],"one_liner":"把在仿真里训练好的策略搬到真机上，并让它照样能用。","explanation":"仿真到现实迁移指先在仿真器里训练机器人策略，再部署到真实机器人上。仿真里能同时跑成千上万个环境，摔坏了也不花钱，所以四足、人形行走和灵巧手的强化学习策略大多先在仿真里练。难点是虚实差距：仿真中的摩擦、质量、电机响应和画面与现实不完全一致，策略到了真机可能失效。常用对策有域随机化（训练时随机改物理和视觉参数，让现实只是其中一种情况）、系统辨识（用真机数据校准仿真参数）、执行器建模（按真机数据给仿真里的电机建模，让它响应得像真电机）和教师-学生蒸馏（先训练能看到仿真全部状态的教师策略，再让只用真机上也有的传感器输入的学生策略模仿它）。2017 年 Tobin 等人只用随机纹理的仿真图像训练物体检测器，在真实场景定位误差约 1.5 厘米，是早期代表。","example":"ETH 苏黎世的 ANYmal 四足机器人：在仿真里用强化学习训练行走策略，并接入从真机数据学到的执行器网络，之后直接部署到真机，跑得比以往方法更快，还能摔倒后自己爬起。","related":["虚实差距","域随机化","系统辨识","执行器建模","现实到仿真","教师-学生蒸馏"]},{"id":"real-to-sim","category":"sim","sec":6,"tier":2,"sources":[{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)","url":"https://arxiv.org/abs/2405.05941"},{"title":"RialTo: Real-to-Sim-to-Real Approach for Robust Manipulation (arXiv 2403.03949)","url":"https://arxiv.org/abs/2403.03949"}],"as_of":"","related_ids":["real-to-sim-to-real","digital-twin","sim-to-real-transfer","sim-to-real-gap","simplerenv","gaussian-splatting-based-simulation"],"name":"现实到仿真","alt":"Real-to-Sim","abbr":"Real2Sim","aliases":["实到虚","Real-to-Sim Reconstruction","Real2Sim"],"one_liner":"把真实场景、物体和机器人复刻进仿真器，让仿真尽量贴近现实。","explanation":"现实到仿真是和仿真到现实（Sim-to-Real）方向相反的一步：从真实世界采集信息，在仿真器里搭出对应版本。它包括几何与外观重建（用手机扫描、NeRF 或 3D 高斯泼溅重建房间和物体）、物理参数辨识（质量、摩擦、关节阻尼等）以及机器人控制器的对齐，做出的仿真版本常被称为数字孪生。主要用途有两个：一是评测，把真实实验环境搬进仿真，用仿真分数预测真机表现，省下大量真机测试；二是训练，在复刻场景里生成数据或做强化学习，再迁回真机，即真-仿-真闭环。难点在于重建出的视觉和物理误差会直接变成新的虚实差距。","example":"SIMPLER（SimplerEnv）为谷歌机器人和 WidowX 机械臂的真实实验搭建对应的仿真环境，重点缩小控制和视觉两方面的差异；论文显示策略在其中的表现与真机结果强相关，还能复现策略对各种分布变化的敏感程度。","related":["真-仿-真闭环","数字孪生","仿真到现实迁移","虚实差距","SimplerEnv","高斯泼溅仿真"]},{"id":"real-to-sim-to-real","category":"sim","sec":6,"tier":2,"sources":[{"title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation (RialTo, arXiv 2403.03949)","url":"https://arxiv.org/abs/2403.03949"},{"title":"RoboGSim: A Real2Sim2Real Robotic Gaussian Splatting Simulator (arXiv 2411.11839)","url":"https://arxiv.org/abs/2411.11839"}],"as_of":"","related_ids":["real-to-sim","sim-to-real-transfer","digital-twin","gaussian-splatting-based-simulation","reinforcement-fine-tuning","sim-to-real-gap"],"name":"真-仿-真闭环","alt":"Real-to-Sim-to-Real","abbr":"Real2Sim2Real","aliases":["虚实闭环","Real2Sim2Real","实-虚-实"],"one_liner":"先把真实场景复刻进仿真，在仿真里训练或造数据，再把策略部署回真机。","explanation":"真-仿-真闭环把现实到仿真和仿真到现实串成一条流水线：先扫描真实环境、重建成仿真里的数字孪生，再在这个复刻场景里做强化学习、生成大量合成数据或安全地评测，最后把得到的策略迁回真实机器人。和纯 Sim-to-Real 相比，训练场景就是部署场景的副本，虚实差距更小；和只用真机数据相比，仿真里能低成本试错、主动制造扰动，提升鲁棒性。近两年常见做法是用 3D 高斯泼溅重建出照片级画面，再配上物理引擎处理交互。局限是每换一个场景都要重新重建，摩擦、柔软度等物理参数也很难扫准。","example":"MIT 等的 RialTo：用 Polycam 等扫描工具约 25 分钟搭好场景的数字孪生，把约 15 条真实演示搬进仿真后做强化学习微调，再蒸馏回基于视觉的真机策略；论文报告在叠盘子、把书放上架等 8 个任务上鲁棒性比纯模仿学习提升超过 67%。","related":["现实到仿真","仿真到现实迁移","数字孪生","高斯泼溅仿真","强化学习微调","虚实差距"]},{"id":"domain-randomization","category":"sim","sec":6,"tier":1,"sources":[{"title":"Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (arXiv 1703.06907)","url":"https://arxiv.org/abs/1703.06907"},{"title":"Lilian Weng: Domain Randomization for Sim2Real Transfer","url":"https://lilianweng.github.io/posts/2019-05-05-domain-randomization/"}],"as_of":"","related_ids":["sim-to-real-gap","sim-to-real-transfer","dynamics-randomization","visual-randomization","automatic-domain-randomization","system-identification"],"name":"域随机化","alt":"Domain Randomization","abbr":"DR","aliases":["领域随机化"],"one_liner":"在仿真里随机改变外观和物理参数，让策略把真实世界当成又一种变化。","explanation":"域随机化由 OpenAI 的 Josh Tobin 等人 2017 年提出（IROS 2017）。它不追求把仿真做得和现实一模一样，而是在训练时大量随机化纹理、光照、相机等渲染参数，以及质量、摩擦、阻尼等动力学参数（后者常叫动力学随机化），让模型见过足够多的变化，真实世界在它看来只是其中一种。原论文只用仿真 RGB 图训练目标定位网络，迁移到真机后定位精度约 1.5 厘米。它是仿真到现实迁移最常用的手段之一，Isaac Lab 等框架都内置。难点是随机范围靠经验调，范围太大策略会变保守；自动域随机化让范围随训练自动扩大。","example":"训练四足行走策略时，给每个并行环境随机设置地面摩擦系数、机身质量和电机延迟，训出的策略上真机更不容易摔倒。","related":["虚实差距","仿真到现实迁移","动力学随机化","视觉随机化","自动域随机化","系统辨识"]},{"id":"dynamics-randomization","category":"sim","sec":6,"tier":2,"sources":[{"title":"Sim-to-Real Transfer of Robotic Control with Dynamics Randomization (arXiv 1710.06537)","url":"https://arxiv.org/abs/1710.06537"},{"title":"legged_gym: legged_robot_config.py（domain_rand）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["domain-randomization","sim-to-real-transfer","sim-to-real-gap","visual-randomization","automatic-domain-randomization","system-identification"],"name":"动力学随机化","alt":"Dynamics Randomization","abbr":"","aliases":["物理参数随机化","摩擦/质量随机化","Physics Randomization"],"one_liner":"训练时随机改变仿真里的质量、摩擦等物理参数，让策略能适应真机。","explanation":"动力学随机化是域随机化的一种，专门随机化物理参数，而不是画面外观。仿真里的质量、摩擦、阻尼、电机增益、延迟等不可能和真机完全一致，只在一组固定参数下训练，策略容易过拟合仿真。做法是每个回合开始时，从设定范围里重新采样这些参数，逼策略在各种物理条件下都能完成任务；真机参数落在这个范围内时，策略就更可能直接可用。代表工作是 Peng 等人 2018 年的论文：在推冰球任务中随机化 95 个参数，纯仿真训练的策略直接部署到 Fetch 机械臂上，表现与仿真相近。如今 Isaac Lab、legged_gym 训练足式机器人时，常随机化地面摩擦、负载质量并施加随机推搡。","example":"legged_gym 默认把地面摩擦系数在 0.5–1.25 之间随机采样，并每 15 秒随机推一下机器人，逼策略学会在不同地面和外力扰动下保持行走。","related":["域随机化","仿真到现实迁移","虚实差距","视觉随机化","自动域随机化","系统辨识"]},{"id":"visual-randomization","category":"sim","sec":6,"tier":2,"sources":[{"title":"Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (arXiv 1703.06907)","url":"https://arxiv.org/abs/1703.06907"},{"title":"Isaac Lab source: envs/mdp/events.py (randomize_visual_texture_material / randomize_visual_color)","url":"https://github.com/isaac-sim/IsaacLab/blob/main/source/isaaclab/isaaclab/envs/mdp/events.py"}],"as_of":"","related_ids":["domain-randomization","dynamics-randomization","sim-to-real-transfer","sim-to-real-gap","visual-generalization","variant-aggregation"],"name":"视觉随机化","alt":"Visual Randomization","abbr":"","aliases":["纹理随机化","光照随机化","视觉域随机化","Texture Randomization","Lighting Randomization"],"one_liner":"训练时随机改变仿真画面的纹理、颜色、光照和相机，让视觉策略不挑画面。","explanation":"视觉随机化是域随机化中针对「看」的那部分：在仿真里随机更换物体和背景的纹理、颜色，改变光源位置和强度、相机位姿，再加入干扰物，让模型见过足够多样的画面，从而把真实世界当成又一种变化。Tobin 等人（OpenAI、伯克利）2017 年系统地做了这件事：只用随机渲染的仿真图像训练物体检测器，在真实场景中定位精度约 1.5 厘米，并用于抓取。它主要缩小虚实差距里的视觉部分；随机化质量、摩擦等物理参数则叫动力学随机化。Isaac Lab 内置了随机纹理、随机颜色等事件项，可在每个回合开始时自动执行。","example":"训练一个抓方块的视觉策略时，每个回合随机把桌面换成木纹、大理石或纯色，随机调整灯光方向和亮度，并轻微挪动相机位置。","related":["域随机化","动力学随机化","仿真到现实迁移","虚实差距","视觉泛化","变体聚合"]},{"id":"nvidia-omniverse-replicator","category":"sim","sec":6,"tier":3,"sources":[{"title":"Omniverse Extensions Docs: Replicator","url":"https://docs.omniverse.nvidia.com/extensions/latest/ext_replicator.html"},{"title":"Isaac Sim Docs: Synthetic Data Generation (Replicator tutorials)","url":"https://docs.isaacsim.omniverse.nvidia.com/latest/replicator_tutorials/index.html"},{"title":"GitHub: NVIDIA-AI-IOT/sdg_pallet_model","url":"https://github.com/NVIDIA-AI-IOT/sdg_pallet_model"}],"as_of":"2026-09","related_ids":["synthetic-data","domain-randomization","nvidia-isaac-sim","nvidia-omniverse","visual-randomization","photorealistic-rendering"],"name":"Omniverse Replicator 合成数据生成","alt":"NVIDIA Omniverse Replicator","abbr":"","aliases":["Replicator","omni.replicator"],"one_liner":"英伟达 Omniverse 里的合成数据框架，随机化仿真场景并自动输出带标注的数据。","explanation":"Replicator 是英伟达 Omniverse 平台中用来搭建合成数据生成（SDG）流水线的框架，以 omni.replicator 扩展的形式集成在 Isaac Sim 里。真实图像的采集和标注很贵，而仿真里物体的位置、类别、深度都是已知的，标签天然精确。它主要由三部分组成：随机化器按域随机化思路随机采样资产、材质、光照和相机位姿；标注器输出 2D/3D 检测框、语义与实例分割、深度等真值；写入器把结果存成特定模型需要的数据格式。在机器人领域，它常用来训练目标检测、位姿估计等感知模型，Isaac Sim 文档也给了导航和操作场景的示例。","example":"英伟达 NVIDIA-AI-IOT 开源的托盘检测模型（sdg_pallet_model）完全用 Replicator 生成的合成数据训练，可用 TensorRT 部署到 Jetson 上。","related":["合成数据","域随机化","Isaac Sim","Omniverse","视觉随机化","照片级真实感渲染"]},{"id":"automatic-domain-randomization","category":"sim","sec":6,"tier":3,"sources":[{"title":"Solving Rubik's Cube with a Robot Hand (OpenAI, arXiv 1910.07113)","url":"https://arxiv.org/abs/1910.07113"}],"as_of":"2019-10","related_ids":["domain-randomization","dynamics-randomization","sim-to-real-transfer","curriculum-learning","dactyl","shadow-dexterous-hand"],"name":"自动域随机化","alt":"Automatic Domain Randomization","abbr":"ADR","aliases":["自动化域随机化"],"one_liner":"随策略变强自动扩大随机化范围的域随机化方法，由 OpenAI 提出。","explanation":"ADR 是 OpenAI 2019 年在「用机器人手解魔方」工作中提出的算法。普通域随机化（在仿真里随机改摩擦、质量、外观等参数，好让策略迁移到真机）要人手动设定每个参数的随机范围，参数一多就很难调。ADR 把它做成自动课程：初始分布只集中在一个按真机标定值设定的环境；训练中随机挑一个参数固定在当前范围的边界上评测，表现高于上阈值就扩大该参数范围，低于下阈值就缩小。这样难度跟着能力增长，最终范围可远超人工设定。论文用它同时训练控制策略和视觉位姿估计网络，全部在仿真里训练后迁移到真实的 Shadow 灵巧手。","example":"论文中最好的策略在真机上复原需 15 步拧转的魔方成功率约 60%，需 26 步的最难情形约 20%；复原步骤由传统的 Kociemba 求解器给出，神经网络负责手上的操作。","related":["域随机化","动力学随机化","仿真到现实迁移","课程学习","Dactyl（OpenAI 魔方灵巧手）","Shadow 灵巧手"]},{"id":"actuator-modeling","category":"sim","sec":6,"tier":2,"sources":[{"title":"Learning agile and dynamic motor skills for legged robots (Hwangbo et al., Science Robotics 2019)","url":"https://arxiv.org/abs/1901.08652"},{"title":"Isaac Lab Docs: Actuators","url":"https://isaac-sim.github.io/IsaacLab/main/source/overview/core-concepts/actuators.html"},{"title":"Isaac Lab API: isaaclab.actuators","url":"https://isaac-sim.github.io/IsaacLab/main/source/api/lab/isaaclab.actuators.html"}],"as_of":"2026-09","related_ids":["sim-to-real-transfer","sim-to-real-gap","system-identification","proportional-derivative-control","series-elastic-actuator","nvidia-isaac-lab"],"name":"执行器建模","alt":"Actuator Modeling (Actuator Network)","abbr":"","aliases":["执行器网络","Actuator Net","隐式执行器","显式执行器","电机建模"],"one_liner":"在仿真里模拟真实电机从收到指令到输出力矩的响应，缩小虚实差距。","explanation":"执行器建模指在仿真里描述真实电机和减速器的行为：给出目标关节位置后，实际能输出多大力矩、有多少延迟和饱和。仿真器默认的理想 PD 控制比真实电机响应更快更干净，策略上真机后容易抖动或跟不上，这是虚实差距的重要来源。做法有两类：一是带力矩上限、转速饱和或指令延迟的解析电机模型；二是执行器网络，出自 ETH 苏黎世与英特尔 2019 年的 ANYmal 工作，用真机上不到 4 分钟采集的数据，训练小型神经网络由关节位置误差和速度的短历史预测力矩，再接进仿真里训练策略。Isaac Lab 把由物理引擎内部计算 PD 的叫隐式执行器，把这类自定义模型叫显式执行器。","example":"Isaac Lab 提供 DCMotor（带转速-力矩饱和）、DelayedPDActuator（带指令延迟）、ActuatorNetMLP 和 ActuatorNetLSTM（神经网络执行器）等执行器类，训练四足策略时按真机电机特性选用。","related":["仿真到现实迁移","虚实差距","系统辨识","PD 控制","串联弹性驱动器","Isaac Lab"]},{"id":"factory-industreal","category":"sim","sec":6,"tier":3,"sources":[{"title":"Factory: Fast Contact for Robotic Assembly (arXiv 2205.03532)","url":"https://arxiv.org/abs/2205.03532"},{"title":"IndustReal: Transferring Contact-Rich Assembly Tasks from Simulation to Reality (arXiv 2305.17110)","url":"https://arxiv.org/abs/2305.17110"},{"title":"Isaac Lab Available Environments","url":"https://isaac-sim.github.io/IsaacLab/main/source/overview/environments.html"}],"as_of":"2026-09","related_ids":["contact-rich-manipulation","peg-in-hole-insertion","sim-to-real-transfer","nvidia-isaac-lab","physx","signed-distance-field-function"],"name":"Factory / IndustReal 接触丰富装配仿真","alt":"Factory: Fast Contact for Robotic Assembly / IndustReal: Transferring Contact-Rich Assembly Tasks from Simulation to Reality","abbr":"","aliases":["Factory","IndustReal","IndustRealKit","IndustRealLib"],"one_liner":"英伟达的装配仿真与迁移方案：先把拧螺母这类接触仿真做快，再把策略搬到真机。","explanation":"Factory 是英伟达在 RSS 2022 发表的接触丰富仿真方法和学习工具：用有符号距离场（SDF，记录每个点离物体表面多远）做碰撞检测，配合接触点精简和高斯-赛德尔求解器，在单张 GPU 上实时仿真 1000 组螺母拧螺栓，并提供 60 个零件模型、3 个装配环境和 7 种控制器，集成在 PhysX 和 Isaac Gym 中。IndustReal（RSS 2023）在此基础上用强化学习训练插销、齿轮装配策略，提出 SDF 奖励、采样式课程、策略级动作积分器等方法，真机 600 次试验成功率 83%–99%，并开源了可 3D 打印的零件套件和部署代码。两者说明高精度装配也能走「仿真训练、迁移真机」的路线。","example":"Isaac Lab 里的 Isaac-Factory-PegInsert-Direct-v0（插销入孔）、GearMesh（齿轮啮合）、NutThread（拧螺母）三个环境就来自 Factory，可直接用 PPO 训练。","related":["接触丰富操作","轴孔装配","仿真到现实迁移","Isaac Lab","PhysX","符号距离场"]},{"id":"sim-to-sim-transfer","category":"sim","sec":6,"tier":2,"sources":[{"title":"unitreerobotics/unitree_rl_gym GitHub","url":"https://github.com/unitreerobotics/unitree_rl_gym"},{"title":"roboterax/humanoid-gym GitHub","url":"https://github.com/roboterax/humanoid-gym"},{"title":"Humanoid-Gym: Reinforcement Learning for Humanoid Robot with Zero-Shot Sim2Real Transfer (arXiv 2404.05695)","url":"https://arxiv.org/abs/2404.05695"}],"as_of":"","related_ids":["sim-to-real-transfer","sim-to-real-gap","isaac-gym","mujoco","humanoid-gym","unitree-rl-gym"],"name":"仿真到仿真迁移","alt":"Sim-to-Sim Transfer","abbr":"Sim2Sim","aliases":["Sim-to-Sim","跨仿真器验证"],"one_liner":"把在一个仿真器里训好的策略放到另一个仿真器里跑，提前暴露问题。","explanation":"Sim2Sim 常见于足式和人形机器人的强化学习流程：先在 Isaac Gym、Isaac Lab 等 GPU 并行仿真器里大规模训练，再把策略原样放进接触模型、求解器都不同的 MuJoCo 等仿真器测试。换了仿真器就走不稳，说明策略钻了原仿真器的空子，直接上真机风险很大。宇树 unitree_rl_gym 把流程写成「训练 → 回放 → Sim2Sim → Sim2Real」；星动纪元 2024 年开源的 Humanoid-Gym 也提供 Isaac Gym 到 MuJoCo 的验证管线。它成本低、不怕摔坏机器，但通过了也不保证真机成功。","example":"用 unitree_rl_gym 在 Isaac Gym 里训练宇树 G1 行走策略后，先跑它的 Sim2Sim 脚本在 MuJoCo 中检验，再部署到实机。","related":["仿真到现实迁移","虚实差距","Isaac Gym","MuJoCo","Humanoid-Gym","unitree_rl_gym"]},{"id":"hardware-in-the-loop-software-in-the-loop-simulation","category":"sim","sec":6,"tier":3,"sources":[{"title":"MathWorks: What Is Hardware-in-the-Loop (HIL)?","url":"https://www.mathworks.com/discovery/hardware-in-the-loop-hil.html"},{"title":"PX4 User Guide: Simulation (SITL / HITL)","url":"https://docs.px4.io/main/en/simulation/"},{"title":"unitreerobotics/unitree_mujoco (GitHub)","url":"https://github.com/unitreerobotics/unitree_mujoco"}],"as_of":"","related_ids":["sim-to-real-transfer","sim-to-sim-transfer","digital-twin","real-time-control","px4-ardupilot","unitree-sdk2"],"name":"硬件在环 / 软件在环仿真","alt":"Hardware-in-the-Loop / Software-in-the-Loop Simulation","abbr":"HIL / SIL","aliases":["HITL / SITL","半实物仿真","硬件在回路","软件在回路"],"one_liner":"把真控制器或真控制代码接到仿真的被控对象上测试，是上真机前的验证手段。","explanation":"两种来自汽车、航空等嵌入式工程的测试方法。软件在环（SIL）：控制程序直接在电脑上运行，和仿真出来的机器人、传感器对接；硬件在环（HIL）：控制程序跑在真实的控制器板子上，通过真实的 I/O 信号或通信总线连到实时运行的仿真模型，控制器以为自己在控制真机。MathWorks 把它们和模型在环（MIL）、处理器在环（PIL）排成一条逐级逼近实物的测试链。好处是危险工况和边界情况可以在仿真里反复测，不怕摔坏机器。机器人里常见做法是让同一套控制代码既能连仿真也能连真机，只改通信配置，如 PX4 无人机的 SITL / HITL、宇树的 unitree_mujoco。","example":"unitree_mujoco 使用和真机相同的 DDS 通信：用宇树 SDK 写的控制程序在仿真里用本地回环网卡和域 ID 1 调试，换成连接机器人的网卡和域 ID 0 就能直接驱动真机。","related":["仿真到现实迁移","仿真到仿真迁移","数字孪生","实时控制","PX4 / ArduPilot","宇树 SDK"]},{"id":"digital-twin","category":"sim","sec":6,"tier":1,"sources":[{"title":"Wikipedia: Digital twin","url":"https://en.wikipedia.org/wiki/Digital_twin"},{"title":"NVIDIA Glossary: What Is a Digital Twin?","url":"https://www.nvidia.com/en-us/glossary/digital-twin/"},{"title":"Automated Creation of Digital Cousins for Robust Policy Learning (ACDC, CoRL 2024, arXiv 2410.07408)","url":"https://arxiv.org/abs/2410.07408"}],"as_of":"","related_ids":["real-to-sim","digital-cousin","sim-to-real-gap","nvidia-isaac-sim","nvidia-omniverse","simulation-fidelity"],"name":"数字孪生","alt":"Digital Twin","abbr":"","aliases":["数字双胞胎"],"one_liner":"与真实物体、机器人或工厂一一对应，并用真实数据保持同步的虚拟副本。","explanation":"数字孪生指物理产品、系统或流程在计算机里的对应模型。它和普通仿真的区别是会持续接收真实对象的数据来同步自身状态，严格意义上还能反过来影响真实系统。NASA 在 Apollo 时代就用地面模拟器配合飞船排障，2010 年正式给出定义；英伟达把它作为 Omniverse 的主要应用，用于工厂规划和机器人测试。在具身智能里，这个词常被宽泛地用来指按真实场景精细复刻的仿真环境，用来先在仿真里训练、评测再上真机。复刻越准，虚实差距越小，但建模成本也越高；只求相似、不求一模一样的做法叫数字表亲。","example":"据英伟达介绍，富士康用数字孪生在虚拟工厂里先优化产线布局和设备摆放，再落地到实体工厂。","related":["现实到仿真","数字表亲","虚实差距","Isaac Sim","Omniverse","仿真保真度"]},{"id":"digital-cousin","category":"sim","sec":6,"tier":3,"sources":[{"title":"Automated Creation of Digital Cousins for Robust Policy Learning (arXiv 2410.07408)","url":"https://arxiv.org/abs/2410.07408"},{"title":"Digital Cousins 项目主页","url":"https://digital-cousins.github.io/"}],"as_of":"2024-10","related_ids":["digital-twin","real-to-sim-to-real","sim-to-real-transfer","domain-randomization","simulation-assets","omnigibson"],"name":"数字表亲","alt":"Digital Cousin","abbr":"","aliases":["ACDC","Automated Creation of Digital Cousins"],"one_liner":"不求一比一复刻、只求几何和语义相似的仿真场景","explanation":"数字表亲由斯坦福李飞飞、吴佳俊团队在 CoRL 2024 论文「Automated Creation of Digital Cousins for Robust Policy Learning」中提出，是相对「数字孪生」（对真实场景一比一精确复刻的虚拟副本）的概念。数字表亲不复刻某个真实场景，只要求几何和语义上相似：比如同样是厨房柜子，形状、尺寸、开合方式相近即可，直接从现有资产库里挑相似物体来搭。这样成本比精确建模低，而且一次生成多个表亲场景相当于自带多样性，训出的策略不容易过拟合某个具体场景。论文的 ACDC 流程从单张真实 RGB 照片出发，经过提取物体信息、匹配相似资产、生成可交互场景三步自动搭建仿真环境；报告的零样本仿真到真机迁移中，数字表亲训练的策略成功率约 90%，数字孪生约 25%。","example":"拍一张家里厨房柜子的照片，ACDC 自动从资产库挑出几种外形和开门方式相近的柜子，生成几个表亲场景，在仿真里训练开柜门策略后直接部署到真实柜子上。","related":["数字孪生","真-仿-真闭环","仿真到现实迁移","域随机化","仿真资产","OmniGibson"]},{"id":"gaussian-splatting-based-simulation","category":"sim","sec":6,"tier":2,"sources":[{"title":"SplatSim: Zero-Shot Sim2Real Transfer of RGB Manipulation Policies Using Gaussian Splatting (arXiv 2409.10161)","url":"https://arxiv.org/abs/2409.10161"},{"title":"RoboGSim: A Real2Sim2Real Robotic Gaussian Splatting Simulator (arXiv 2411.11839)","url":"https://arxiv.org/abs/2411.11839"},{"title":"3D Gaussian Splatting for Real-Time Radiance Field Rendering (arXiv 2308.04079)","url":"https://arxiv.org/abs/2308.04079"}],"as_of":"2026-01","related_ids":["3d-gaussian-splatting","real-to-sim-to-real","sim-to-real-gap","digital-twin","robogsim-a-real2sim2real-robotic-gaussian-splatting-simulato","real2render2real"],"name":"高斯泼溅仿真","alt":"Gaussian Splatting-based Simulation","abbr":"","aliases":["3DGS 仿真","GS 仿真","高斯泼溅模拟器"],"one_liner":"用 3D 高斯泼溅重建真实场景来渲染画面，再配合物理引擎算运动的仿真方式。","explanation":"高斯泼溅仿真是把 3D 高斯泼溅（3DGS，Kerbl 等人 2023 年提出，用大量带颜色的 3D 高斯点表示场景，可实时渲染出照片级画面）接进机器人仿真的做法。通常先用手机或相机拍一圈真实场景重建出 3DGS，再把其中的物体、机器人和物理引擎里的碰撞体对齐：物理引擎算运动，3DGS 负责渲染相机画面。它针对的是传统仿真画面「一眼假」带来的视觉虚实差距，让仿真里训练的视觉策略更容易零样本上真机，也可用来做可复现的闭环评测。代表工作有 SplatSim、RoboGSim、Real2Render2Real，智元 Genie Sim 3.0 也加入了 3DGS 场景重建。高斯点本身不带物理属性，仍需另配碰撞体和动力学模型。","example":"SplatSim 用高斯泼溅渲染替换仿真器原来的网格渲染，只用仿真数据训练的 RGB 操作策略零样本部署到真机，平均成功率 86.25%，而用真机数据训练的是 97.5%。","related":["3D高斯泼溅","真-仿-真闭环","虚实差距","数字孪生","RoboGSim","Real2Render2Real（R2R2R）"]},{"id":"robogsim-a-real2sim2real-robotic-gaussian-splatting-simulato","category":"sim","sec":6,"tier":3,"sources":[{"title":"arXiv 2411.11839 - RoboGSim: A Real2Sim2Real Robotic Gaussian Splatting Simulator","url":"https://arxiv.org/abs/2411.11839"},{"title":"RoboGSim 项目主页","url":"https://robogsim.github.io/"}],"as_of":"2025-08","related_ids":["gaussian-splatting-based-simulation","real-to-sim-to-real","3d-gaussian-splatting","digital-twin","sim-to-real-transfer","nvidia-isaac-sim"],"name":"RoboGSim","alt":"RoboGSim: A Real2Sim2Real Robotic Gaussian Splatting Simulator","abbr":"","aliases":[],"one_liner":"用 3D 高斯泼溅重建真实场景、再接上物理引擎的机器人仿真器","explanation":"RoboGSim 是 2024 年 11 月发布的论文与系统，作者来自哈工大（深圳）、中科院计算所、旷视科技和浙江大学。它把 3D 高斯泼溅（用大量彩色椭球来重建场景、渲染效果接近照片的三维表示）和 Isaac Sim 物理引擎结合，由高斯重建器、数字孪生构建器、场景组合器和交互引擎四部分组成：先把真实桌面场景重建进仿真，再在仿真里换视角、换物体、换轨迹、换场景合成新数据，最后用到真机上，即 Real2Sim2Real。论文报告，只用它合成的数据训练的策略能零样本在真机上运行，效果与用真机数据相当，在新视角、新场景下还更好。它也可作为闭环评测环境，用来测试 VLA 模型。","example":"先用相机拍一段实验台视频，在 RoboGSim 里重建出桌面和机械臂，再换成新的相机视角批量生成抓取-放置轨迹，用这些合成数据训练策略后直接部署到真实机械臂。","related":["高斯泼溅仿真","真-仿-真闭环","3D高斯泼溅","数字孪生","仿真到现实迁移","Isaac Sim"]},{"id":"discoverse","category":"sim","sec":6,"tier":3,"sources":[{"title":"DISCOVERSE: Efficient Robot Simulation in Complex High-Fidelity Environments (arXiv 2507.21981)","url":"https://arxiv.org/abs/2507.21981"},{"title":"DISCOVERSE 项目主页","url":"https://air-discoverse.github.io/"},{"title":"DISCOVERSE GitHub","url":"https://github.com/TATP-233/DISCOVERSE"}],"as_of":"2025-07","related_ids":["gaussian-splatting-based-simulation","3d-gaussian-splatting","mujoco","real-to-sim-to-real","sim-to-real-gap","photorealistic-rendering"],"name":"DISCOVERSE","alt":"DISCOVERSE: Efficient Robot Simulation in Complex High-Fidelity Environments","abbr":"","aliases":["Discoverse"],"one_liner":"用 3D 高斯泼溅渲染加 MuJoCo 物理的开源真-仿-真仿真框架","explanation":"DISCOVERSE 是清华大学、浙江大学等多所高校与 DISCOVER Robotics、地瓜机器人联合开源的机器人仿真框架，论文被 IROS 2025 接收，代码为 MIT 许可。它用 3D 高斯泼溅（3DGS，用大量带颜色的三维高斯点重建并快速渲染真实场景的方法）负责画面，用 MuJoCo 负责物理：先把真实场景重建出照片级外观，再配上碰撞和物理模型，得到「看起来像真实世界」的仿真环境，以缩小视觉上的虚实差距。它支持多相机、多传感器并行仿真，兼容已有 3D 资产、机器人模型和 ROS 插件，已适配 Airbot Play、松灵 PiPER、UR5e、Franka Panda、LEAP Hand 等本体。项目主页称 5 路 640×480 RGB-D 相机渲染可达 650 FPS（笔记本约 240 FPS）；论文的模仿学习实验显示其零样本仿真到真机迁移效果优于其他仿真器。","example":"把实验室桌面扫描重建成 3DGS 场景放进 DISCOVERSE，在仿真里采演示训练抓取策略，不经真机微调直接部署到同一张真实桌面上。","related":["高斯泼溅仿真","3D高斯泼溅","MuJoCo","真-仿-真闭环","虚实差距","照片级真实感渲染"]},{"id":"gs-playground","category":"sim","sec":6,"tier":3,"sources":[{"title":"GS-Playground (arXiv 2604.25459)","url":"https://arxiv.org/abs/2604.25459"},{"title":"GS-Playground project page","url":"https://gsplayground.github.io"}],"as_of":"2026-09","related_ids":["gaussian-splatting-based-simulation","3d-gaussian-splatting","real-to-sim","digital-twin","batched-rendering","discoverse"],"name":"GS-Playground","alt":"GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning","abbr":"","aliases":["GS Playground"],"one_liner":"清华等推出的高吞吐仿真器，用批量 3D 高斯泼溅快速渲染真实感画面。","explanation":"GS-Playground 由清华大学牵头、联合 Motphys、原力灵机等十余家单位提出，论文 2026 年 4 月发布，项目页显示已被 RSS 2026 接收，代码在 GitHub 开源。它针对视觉机器人学习的矛盾：传统仿真器画面不真实，照片级渲染又太慢，难以大规模跑视觉强化学习。做法是把自研并行物理引擎 MotrixSim（兼容 MJCF 格式）和批量 3D 高斯泼溅（用大量彩色椭球表示场景、渲染很快）结合，在 2048 个并行环境、640×480 分辨率下总渲染速度约每秒 1 万帧，并能从单张 RGB 照片自动生成可仿真的数字孪生。论文在四足和人形行走、视觉导航、机械臂抓取上验证，并部署到宇树 Go2、G1 等真机。","example":"项目页称，从一张 RGB 照片生成可直接放进仿真的场景资产不到 5 分钟，人形机器人物理仿真速度是 MuJoCo 的 32 倍。","related":["高斯泼溅仿真","3D高斯泼溅","现实到仿真","数字孪生","批量渲染","DISCOVERSE"]},{"id":"success-rate","category":"sim","sec":7,"tier":1,"sources":[{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)","url":"https://arxiv.org/abs/2304.13705"},{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)","url":"https://arxiv.org/abs/2405.05941"}],"as_of":"","related_ids":["progress-score","average-length","episode","simulation-based-evaluation","real-world-evaluation","statistical-rigor-in-policy-evaluation"],"name":"成功率","alt":"Success Rate","abbr":"SR","aliases":["任务成功率"],"one_liner":"策略多次试做同一任务时成功的比例，是最常用的机器人评测指标。","explanation":"成功率是机器人学习里最常用的评测指标：让策略在同一任务上反复执行 N 次（每次叫一个回合，物体初始位置通常随机），按事先定义的判据（如方块被放进目标区域）数出成功次数，再除以 N。它直观、便于跨方法比较，但信息量有限：只看最终结果，不区分差一点成功和完全失败，所以常配合子任务成功率、进度分数或平均完成长度一起报告。试验次数少时成功率波动很大，25 次试验里多成功一次就差 4 个百分点，所以严谨的论文会写明试验次数和随机种子数，最好再给置信区间。仿真里一次能跑成百上千个回合，真机通常只有几十次。","example":"ACT 论文的仿真任务用 3 个随机种子、每个种子 50 次试验取平均成功率；真机任务每个跑 25 次试验，其中「拉开密封袋」成功率 88%。","related":["进度分数","平均完成长度","回合","仿真评测","真机评测","评测统计显著性（置信区间 / 序贯检验 / 多随机种子）"]},{"id":"real-world-evaluation","category":"sim","sec":7,"tier":1,"sources":[{"title":"RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies (arXiv 2506.18123)","url":"https://arxiv.org/abs/2506.18123"},{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)","url":"https://arxiv.org/abs/2405.05941"}],"as_of":"2025-06","related_ids":["simulation-based-evaluation","evaluation-protocol","success-rate","double-blind-pairwise-comparison","roboarena","sim-to-real-gap"],"name":"真机评测","alt":"Real-world Evaluation","abbr":"","aliases":["实机测试","真机测试","真实世界评测"],"one_liner":"把策略部署到真实机器人上反复试跑，统计成功率等指标。","explanation":"真机评测指在真实机器人和真实场景里运行策略，记录每次尝试是否成功、完成到哪一步、要不要人工干预。仿真再像也有虚实差距，所以它是检验具身模型的最终标准。难点是成本高、难复现：每次都要人摆放物体、复位场景、判定结果，灯光、摆放位置、机器人状态稍有不同分数就会变，不同实验室之间很难横向比较。因此论文要写清评测协议，包括任务、试验次数、初始条件和判定标准。为了更可信、更可扩展，出现了 RoboArena 这类分布式双盲成对比较，以及用仿真评测（如 SimplerEnv）或世界模型来预测真机表现的做法。","example":"RoboArena 在 7 所高校的 DROID 机器人平台上，对 7 个通用策略做了 600 多次双盲成对真机对比，再汇总成排名。","related":["仿真评测","评测协议","成功率","双盲成对比较","RoboArena","虚实差距"]},{"id":"simulation-based-evaluation","category":"sim","sec":7,"tier":1,"sources":[{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)","url":"https://arxiv.org/abs/2405.05941"},{"title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","url":"https://arxiv.org/abs/2306.03310"},{"title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)","url":"https://arxiv.org/abs/2502.19645"}],"as_of":"2025-02","related_ids":["real-world-evaluation","benchmark","success-rate","simplerenv","libero-benchmark","sim-to-real-correlation"],"name":"仿真评测","alt":"Simulation-based Evaluation","abbr":"","aliases":["仿真测评","仿真基准评测","Sim Evaluation"],"one_liner":"把策略放进仿真环境里批量跑任务、统计成功率，代替或补充真机测试。","explanation":"仿真评测指把训练好的机器人策略放进仿真器，按统一的初始条件和判定规则执行任务，统计成功率等指标。真机评测要人工摆物体、复位场景，每个策略跑几十上百次很费时，不同实验室的场地也难复现；仿真评测能自动、批量、可重复地跑，常用于比较算法、做消融实验和挑选检查点。常见基准有 LIBERO、CALVIN、SimplerEnv、RoboTwin 等。主要问题是仿真成绩未必反映真机表现：画面、物理和控制器都与现实有差距，而且不少基准已接近满分。因此研究者会检查仿真与真机成绩的相关性，并用真机评测或世界模型评测作补充。","example":"OpenVLA-OFT 论文在 LIBERO 的四个任务套件上做仿真评测，把 OpenVLA 的平均成功率从 76.5% 提到了 97.1%。","related":["真机评测","基准测试","成功率","SimplerEnv","LIBERO","仿真-真机相关性"]},{"id":"closed-loop-evaluation","category":"sim","sec":7,"tier":2,"sources":[{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)","url":"https://arxiv.org/html/2405.05941"},{"title":"Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving? (arXiv 2312.03031)","url":"https://arxiv.org/abs/2312.03031"}],"as_of":"","related_ids":["open-loop-evaluation","simulation-based-evaluation","real-world-evaluation","rollout","compounding-error","simplerenv"],"name":"闭环评测","alt":"Closed-loop Evaluation","abbr":"","aliases":["闭环测试","在线评测"],"one_liner":"让策略真正控制机器人、边看边做，按任务最后有没有完成来打分。","explanation":"闭环评测指把策略放进仿真或真实环境里实际运行：每一步用最新观测算出动作，动作改变环境，环境再给出新观测，循环到任务成功、失败或超时，再统计成功率等指标。与之相对的开环评测只在离线数据上比较模型预测的动作和人类演示差多少（如均方误差），模型的动作不会影响后续输入。问题在于模仿学习的小误差会把机器人带进演示里没见过的状态并越积越大，离线误差看不出这一点。SimplerEnv 论文实测发现，验证集均方误差不能很好反映策略的真机表现；自动驾驶领域 CVPR 2024 的一项研究也指出开环规划指标会误导结论。因此 VLA 论文一般以仿真或真机的闭环成功率为准。","example":"在 LIBERO 上测一个 VLA：每个任务从不同初始状态各跑若干回合，策略实时控制仿真机械臂，最后报告成功率，这是闭环评测；只算它在测试集上预测动作的均方误差，则属于开环评测。","related":["开环评测","仿真评测","真机评测","推演","复合误差","SimplerEnv"]},{"id":"open-loop-evaluation","category":"sim","sec":7,"tier":2,"sources":[{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)","url":"https://arxiv.org/abs/2405.05941"},{"title":"Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving? (arXiv 2312.03031)","url":"https://arxiv.org/abs/2312.03031"}],"as_of":"","related_ids":["closed-loop-evaluation","open-loop-control","simulation-based-evaluation","real-world-evaluation","simplerenv","sim-to-real-correlation"],"name":"开环评测","alt":"Open-loop Evaluation","abbr":"","aliases":["离线指标评测","离线评测","Offline Evaluation"],"one_liner":"不让策略真去控制，只在离线数据上比预测动作和演示动作差多少。","explanation":"开环评测指不让策略真正驱动机器人，而是在离线数据集上逐帧喂入录好的观测，比较模型预测动作和演示动作差多少，常用均方误差（MSE）或 L2 误差。它便宜、快、可复现，不需要机器人或仿真器。问题是策略输出不影响下一帧画面，测不到误差累积和出错后的纠正；同一场景本有多种正确做法（动作多峰性），偏离演示也会被扣分。SIMPLER 论文（2024）比较 6 个检查点，验证集 MSE 与真机成功率的皮尔逊相关只有 0.308，闭环仿真评测则达 0.924。自动驾驶也有类似反思：CVPR 2024 一篇论文发现，在 nuScenes 开环规划指标上只用自车速度等状态就能拿到相当成绩。所以开环指标多用于调试初筛。","example":"在 DROID 或自采数据的验证集上，把每一帧图像和指令输入 VLA，计算输出动作与演示动作的均方误差，用来粗看训练有没有跑偏。","related":["闭环评测","开环","仿真评测","真机评测","SimplerEnv","仿真-真机相关性"]},{"id":"off-policy-evaluation","category":"sim","sec":7,"tier":3,"sources":[{"title":"Benchmarks for Deep Off-Policy Evaluation (DOPE, ICLR 2021)","url":"https://arxiv.org/abs/2103.16596"},{"title":"Off-Policy Evaluation via Off-Policy Classification (NeurIPS 2019)","url":"https://arxiv.org/abs/1906.01624"}],"as_of":"","related_ids":["offline-reinforcement-learning","off-policy","q-function","real-world-evaluation","world-model-based-policy-evaluation","importance-sampling"],"name":"离线策略评估","alt":"Off-Policy Evaluation","abbr":"OPE","aliases":["异策略评估","离策略评估","Off-Policy Policy Evaluation"],"one_liner":"只用其他策略收集的历史数据，估计一个新策略真正部署后能拿到多少回报。","explanation":"离线策略评估是强化学习里的一类问题：数据由某个行为策略收集，想在不和环境交互的前提下，估计另一个目标策略的期望回报。机器人真机测一次要人看护、会磨损硬件，若能先靠已有日志筛掉差策略，就能省下大量评测成本，也便于离线强化学习挑选检查点和超参数。常见方法有重要性采样（按两个策略选同一动作的概率之比给旧数据重新加权）、拟合 Q 评估（FQE，用数据拟合目标策略的 Q 函数）、双重稳健估计和基于模型的方法。Fu 等人 2021 年的 DOPE 基准除了看估值误差，还用排序相关性和 regret@k 衡量方法能否把好策略挑出来，因为实践中排对顺序往往比估准数值更重要。","example":"谷歌 Irpan 等人（NeurIPS 2019）在基于图像的机械臂抓取任务上把 OPE 改写成分类问题，只用离线数据就较可靠地预测了多个策略在真机上的相对优劣，包括仿真到现实迁移的情形。","related":["离线强化学习","异策略","Q 函数","真机评测","世界模型评测","重要性采样"]},{"id":"benchmark","category":"sim","sec":7,"tier":1,"sources":[{"title":"Wikipedia: Benchmark (computing)","url":"https://en.wikipedia.org/wiki/Benchmark_(computing)"},{"title":"LIBERO (NeurIPS 2023 Datasets and Benchmarks Track)","url":"https://proceedings.neurips.cc/paper_files/paper/2023/hash/8c3c666820ea055a77726d66fc7d447f-Abstract-Datasets_and_Benchmarks.html"}],"as_of":"","related_ids":["baseline","evaluation-protocol","success-rate","libero-benchmark","benchmark-saturation","leaderboard-chasing"],"name":"基准测试","alt":"Benchmark","abbr":"","aliases":["评测基准","榜单","基准"],"one_liner":"一套固定的任务、数据和评分规则，让不同方法在同样条件下比高低。","explanation":"基准测试指用一组标准测试衡量对象的相对性能，比如电脑硬件的跑分。在具身智能里，一个基准通常包括固定的任务集合、仿真环境或真实场景、演示数据（如有）、评测协议和指标，指标多为成功率。常见的仿真基准有 LIBERO、CALVIN、SimplerEnv、RoboTwin 等，也有 RoboArena 这类真机评测网络。它的价值是可复现、能横向对比；风险是方法可能专门对着榜单调优（刷榜），分数高不等于真机好用，而且头部方法接近满分后基准就失去区分度，即基准饱和。","example":"VLA 论文常在 LIBERO 的四个任务套件上报告平均成功率，并和 OpenVLA 等基线放在同一张表里比较。","related":["基线方法","评测协议","成功率","LIBERO","基准饱和","刷榜"]},{"id":"evaluation-protocol","category":"sim","sec":7,"tier":3,"sources":[{"title":"Robot Learning as an Empirical Science: Best Practices for Policy Evaluation (arXiv 2409.09491)","url":"https://arxiv.org/abs/2409.09491"},{"title":"RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies (arXiv 2506.18123)","url":"https://arxiv.org/abs/2506.18123"}],"as_of":"","related_ids":["benchmark","real-world-evaluation","simulation-based-evaluation","success-rate","statistical-rigor-in-policy-evaluation","double-blind-pairwise-comparison"],"name":"评测协议","alt":"Evaluation Protocol","abbr":"","aliases":["评估协议","测试协议"],"one_liner":"规定策略在什么条件下测、测几次、怎样算成功的一套规则","explanation":"评测协议是一套写清楚「策略怎么测」的规则：在哪些场景和物体上测，初始状态怎么摆，每个条件测多少次，一次试验最长多久，什么算成功，中途能否人工干预，最后用什么指标汇总。机器人评测结果对这些细节很敏感，同一个策略换一种摆放或放宽成功标准，成功率可能差很多；论文不交代协议，读者就无法判断结果能否复现、不同方法能否比较。2024 年 Kress-Gazit 等人的论文「Robot Learning as an Empirical Science」建议：明确报告实验条件和成功标准，成功率之外补充其他指标，做统计分析，并定性描述失败模式。仿真基准（如 LIBERO、CALVIN）一般自带固定协议；真机评测则常用固定初始位置表、多个方法交替测试、双盲成对比较等做法来保证公平。","example":"一份协议可以这样写：每个任务测 20 次，物体初始位置依次取自事先标好的 20 个点位，单次最长 60 秒，物体完全放进盒子且夹爪松开才算成功，中途不允许人工重置。","related":["基准测试","真机评测","仿真评测","成功率","评测统计显著性（置信区间 / 序贯检验 / 多随机种子）","双盲成对比较"]},{"id":"baseline","category":"sim","sec":7,"tier":1,"sources":[{"title":"Google Machine Learning Glossary: baseline","url":"https://developers.google.com/machine-learning/glossary#baseline"},{"title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT, arXiv 2502.19645)","url":"https://arxiv.org/abs/2502.19645"}],"as_of":"","related_ids":["ablation-study","benchmark","state-of-the-art","success-rate","evaluation-protocol"],"name":"基线方法","alt":"Baseline","abbr":"","aliases":["基线","对比基线"],"one_liner":"论文里拿来做对照的已有方法或简单方法，用来衡量新方法到底好多少。","explanation":"基线是评估新方法时的参照物。谷歌机器学习术语表把它定义为：用来比较另一个（通常更复杂的）模型表现如何的参考模型。基线可以是简单做法，如直接行为克隆、随机策略，也可以是公认的强方法，如 OpenVLA。只报「成功率 80%」说明不了什么，要在同一基准、同一评测协议下和基线比，才能看出提升来自方法本身。读论文时要留意基线够不够强、是否按原作设定复现：基线选弱了，提升就会被夸大。消融实验也可看作拿「去掉某个模块的自己」当基线。","example":"OpenVLA-OFT 论文以原版 OpenVLA 为基线，在 LIBERO 四个任务套件上把平均成功率从 76.5% 提到 97.1%。","related":["消融实验","基准测试","最先进水平","成功率","评测协议"]},{"id":"state-of-the-art","category":"sim","sec":7,"tier":1,"sources":[{"title":"Wikipedia: State of the art","url":"https://en.wikipedia.org/wiki/State_of_the_art"},{"title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)","url":"https://arxiv.org/abs/2502.19645"},{"title":"paperswithcode-data issue #116: paperswithcode.com now redirects to huggingface (2025-08)","url":"https://github.com/paperswithcode/paperswithcode-data/issues/116"}],"as_of":"2026-09","related_ids":["benchmark","benchmark-saturation","leaderboard-chasing","success-rate","ablation-study"],"name":"最先进水平","alt":"State of the Art","abbr":"SOTA","aliases":["SOTA","SotA","当前最佳","state-of-the-art"],"one_liner":"某个任务或基准上当前公开报告的最好结果，常缩写为 SOTA。","explanation":"State of the Art 原指某一领域在某个时间达到的最高技术水平，这个英文说法在 20 世纪初的工程文献里就已出现。在机器学习论文里，SOTA 特指在某个公开基准上、按同一评测协议得到的当前最好成绩，比如「在 LIBERO 上取得 SOTA」。它是比较方法的简便标尺，但要注意三点：只在特定基准和设置下成立，换数据、换机器人未必保持；具身智能的仿真基准容易饱和，领先零点几个百分点可能在统计误差之内；真机结果因场地、物体不同很难横向比较。过去 Papers with Code 网站汇总各任务的排行榜，现在该域名已跳转到 Hugging Face 论文页。","example":"2025 年 OpenVLA-OFT 在 LIBERO 四个任务套件上把平均成功率做到 97.1%，论文称在该基准上创下新的 SOTA。","related":["基准测试","基准饱和","刷榜","成功率","消融实验"]},{"id":"ablation-study","category":"sim","sec":7,"tier":2,"sources":[{"title":"Wikipedia: Ablation (artificial intelligence)","url":"https://en.wikipedia.org/wiki/Ablation_(artificial_intelligence)"},{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["baseline","state-of-the-art","success-rate","action-chunking","temporal-ensembling"],"name":"消融实验","alt":"Ablation Study","abbr":"","aliases":["消融研究","消融分析","Ablation"],"one_liner":"去掉或替换方法里的某个组件，看性能怎么变，以判断它到底有没有用。","explanation":"消融实验是在完整方法的基础上，一次去掉或替换一个组件（某个模块、损失项、输入模态、数据来源或训练技巧），在同样的设置下重新训练和评测，比较性能变化，从而判断每个设计各自贡献多少。这个说法借自生物学里切除部分组织来研究其功能的做法；据维基百科，AI 先驱 Allen Newell 在 1974 年一篇语音识别教程里就用过。它是论文说明「为什么这样设计」的主要证据：去掉某模块后性能几乎不变，就说明它不是关键。做消融时要保持其他变量不动，并用足够多的试验次数比较，否则差异可能只是噪声。","example":"ACT 论文的消融实验分别拿掉动作分块、时序集成和 CVAE 训练，发现用人类演示数据训练时，去掉 CVAE 会让成功率明显下降。","related":["基线方法","最先进水平","成功率","动作分块","时序集成"]},{"id":"statistical-rigor-in-policy-evaluation","category":"sim","sec":7,"tier":3,"sources":[{"title":"Deep Reinforcement Learning at the Edge of the Statistical Precipice (arXiv 2108.13264, NeurIPS 2021)","url":"https://arxiv.org/abs/2108.13264"},{"title":"Robot Learning as an Empirical Science: Best Practices for Policy Evaluation (arXiv 2409.09491)","url":"https://arxiv.org/abs/2409.09491"},{"title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation (TRI, arXiv 2507.05331)","url":"https://arxiv.org/html/2507.05331v1"}],"as_of":"2025-07","related_ids":["success-rate","evaluation-protocol","random-seed-and-reproducibility","double-blind-pairwise-comparison","real-world-evaluation","rollout"],"name":"评测统计显著性（置信区间 / 序贯检验 / 多随机种子）","alt":"Statistical Rigor in Policy Evaluation (Confidence Intervals / Sequential Testing / Multiple Seeds)","abbr":"","aliases":["统计严谨评测","评测的统计显著性"],"one_liner":"用统计方法判断策略之间的成功率差距是真提升还是运气。","explanation":"机器人策略评测往往只跑几十次试验，成功率本身带着很大的随机误差：20 次成功 14 次，按常用的 Wilson 方法算，95% 置信区间约为 48%–85%。统计严谨的评测要求报告置信区间或贝叶斯后验，不能只给一个百分比；强化学习还要用多个随机种子重复训练，因为同一算法换个种子，结果可能差很多。Agarwal 等人在 NeurIPS 2021 的论文里建议报告区间估计、用四分位均值汇总多任务结果，并开源了 rliable 库。序贯检验是边做试验边检验，差距已经足够明显就提前停下，省掉昂贵的真机试验。丰田研究院 2024 年也撰文呼吁机器人学习按实验科学的标准做评测：写清实验条件、配合多种指标、做统计分析。","example":"丰田研究院 2025 年的大行为模型论文里，每个真机任务每个策略跑 50 次、仿真任务跑 200 次，评测员不知道在测哪个策略；结果用 Beta 先验下的贝叶斯后验展示，策略两两比较用序贯假设检验，并做 Bonferroni 校正控制多重比较。","related":["成功率","评测协议","随机种子与可复现性","双盲成对比较","真机评测","推演"]},{"id":"generalization-robustness-evaluation","category":"sim","sec":7,"tier":2,"sources":[{"title":"THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation (arXiv 2402.08191)","url":"https://arxiv.org/abs/2402.08191"},{"title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models (arXiv 2510.13626)","url":"https://arxiv.org/abs/2510.13626"}],"as_of":"2025-12","related_ids":["generalization","robustness","out-of-distribution","distractor-objects","libero-plus","the-colosseum-a-benchmark-for-evaluating-generalization-for"],"name":"泛化与鲁棒性评测","alt":"Generalization / Robustness Evaluation (Perturbation Test)","abbr":"","aliases":["扰动测试","分布外评测","OOD Evaluation","鲁棒性基准"],"one_liner":"故意改变光照、位置、物体、指令等条件，测策略离开训练环境后还剩几成本事。","explanation":"泛化与鲁棒性评测不只报告策略在训练同分布条件下的成功率，而是系统地施加扰动：换物体颜色和形状、加干扰物、改光照和背景、挪相机视角、改机器人初始姿态、改写语言指令、加传感器噪声等，再看成功率掉多少。它回答的问题是：高分到底是学会了任务，还是只记住了训练场景。常见做法是按维度逐一施加扰动以定位弱点，也会把多种扰动叠加。代表基准有 The Colosseum、LIBERO-Plus、LIBERO-PRO，SimplerEnv 的变体聚合也属于这一思路。这类评测常显示，标准基准上接近满分的模型在轻度扰动下成功率大幅下降。","example":"LIBERO-Plus 在 LIBERO 上从物体布局、相机视角、机器人初始状态、语言指令、光照、背景纹理、传感器噪声 7 个维度加扰动，发现部分 VLA 成功率会从 95% 跌到 30% 以下，而且模型常常忽略语言指令。","related":["泛化","鲁棒性","分布外","干扰物","LIBERO-Plus","The Colosseum"]},{"id":"progress-score","category":"sim","sec":7,"tier":2,"sources":[{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/abs/2410.24164"},{"title":"HomeRobot: Open-Vocabulary Mobile Manipulation (arXiv 2306.11565)","url":"https://arxiv.org/abs/2306.11565"},{"title":"RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies (arXiv 2506.18123)","url":"https://arxiv.org/abs/2506.18123"}],"as_of":"","related_ids":["success-rate","evaluation-protocol","long-horizon-task","real-world-evaluation","roboarena","average-length"],"name":"进度分数","alt":"Progress Score","abbr":"","aliases":["任务进度","部分成功分","Partial Success","Task Progress","Partial Credit"],"one_liner":"按机器人完成了任务的几步来给分，而不只记成功或失败的评测指标。","explanation":"进度分数是一类评测指标：事先把任务拆成若干阶段或子目标，机器人完成几步就得几分，通常归一化到 0–1 或 0–100。它是对二元成功率的补充。长程、困难任务上各个策略的成功率可能都接近 0，只看成功率分不出高下；按进度给分能看出谁走得更远、卡在哪一步。缺点是评分细则由研究者自定，不同论文之间的分数不能直接比较。Physical Intelligence 的 π0 论文为每个任务单独设计评分细则；HomeRobot OVMM 把「每完成一个阶段得 1 分」的部分成功作为排名依据之一；RoboArena 则让评测员给每次试验打 0–100 的进度分。","example":"π0 论文中的叠衣服任务：从筐里取出衣物、摊平、折叠、叠放整齐各得 1 分，全部完成算满分，只做到摊平就只有一半分数。","related":["成功率","评测协议","长程任务","真机评测","RoboArena","平均完成长度"]},{"id":"intervention-rate","category":"sim","sec":7,"tier":2,"sources":[{"title":"HG-DAgger: Interactive Imitation Learning with Human Experts (arXiv 1810.02890)","url":"https://arxiv.org/abs/1810.02890"},{"title":"Sirius: Robot Learning on the Job (project page)","url":"https://ut-austin-rpl.github.io/sirius/"}],"as_of":"","related_ids":["mean-time-between-interventions","human-in-the-loop","human-gated-dagger","human-intervention-data","remote-teleoperation-takeover","levels-of-autonomy"],"name":"干预率","alt":"Intervention Rate","abbr":"","aliases":["接管率","人工干预率","Takeover Rate","Disengagement Rate"],"one_liner":"策略自主运行时需要人出手接管或纠正的频率，越低说明越能独立干活。","explanation":"干预率是衡量自主程度的指标，指机器人或自动驾驶系统运行时，人需要接管或纠正的比例，常按每回合、每小时或每公里统计，也可换算成两次干预之间平均隔多久（平均干预间隔）。它来自自动驾驶里的「接管」概念，在机器人部署中同样关键：成功率只看结果，干预率反映为了成功要搭上多少人力，直接决定一个人能同时看管几台机器。人在回路方法（如 HG-DAgger、Sirius）让人在出错或危险时接管，接管片段再作为纠偏数据回流训练，所以随部署轮次推进干预率应当下降。报告时要说明什么情况算一次干预，否则不同团队的数字没法比。","example":"Sirius 让人在机器人出错时远程接管，并把接管数据加进训练；随着部署轮次增加，所需人工干预明显减少，到第 3 轮机器人大部分时间都能自主运行。","related":["平均干预间隔","人在回路","人工门控 DAgger","干预数据","远程接管（人工兜底）","自主等级"]},{"id":"mean-time-between-interventions","category":"sim","sec":7,"tier":3,"sources":[{"title":"Habilis-β: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model (arXiv 2602.18813)","url":"https://arxiv.org/abs/2602.18813"},{"title":"Mean time between failures - Wikipedia","url":"https://en.wikipedia.org/wiki/Mean_time_between_failures"}],"as_of":"2026-02","related_ids":["intervention-rate","mean-time-between-failures","success-rate","real-world-evaluation","fully-autonomous","remote-teleoperation-takeover"],"name":"平均干预间隔","alt":"Mean Time Between Interventions","abbr":"MTBI","aliases":["Mean Time Between Intervention"],"one_liner":"机器人连续工作时，平均隔多久需要人来干预一次。","explanation":"MTBI 衡量机器人在长时间连续运行中的可靠性：总运行时间除以期间人工干预的次数，数值越大越好。干预一般包括人工急停、手动复位、帮机器人摆正物体，或任务超时后由人接管。它借鉴了工业可靠性里的平均无故障时间（MTBF）。学术论文常用的单次成功率是在人工精心复位后测得的，看不出长时间运行中状态逐渐漂移、偶发卡住等问题，也把速度和准确率混成一个数。因此面向落地的团队开始在不复位的连续运行协议下报告 MTBI，并和每小时完成任务数一起衡量效率与可靠性。","example":"Habilis-β 论文做 1 小时连续运行评测：在真实人形机器人物流流程中，它的 MTBI 为 137.4 秒，对照的 π0.5 为 46.1 秒。","related":["干预率","平均无故障时间","成功率","真机评测","全自主","远程接管（人工兜底）"]},{"id":"sim-to-real-correlation","category":"sim","sec":7,"tier":2,"sources":[{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)","url":"https://arxiv.org/abs/2405.05941"},{"title":"SIMPLER 项目页","url":"https://simpler-env.github.io/"}],"as_of":"2024-05","related_ids":["simulation-based-evaluation","real-world-evaluation","mean-maximum-rank-violation","simplerenv","visual-matching","sim-to-real-gap"],"name":"仿真-真机相关性","alt":"Sim-to-Real Correlation (Pearson r)","abbr":"","aliases":["真机对齐度","Sim-Real Alignment","皮尔逊相关系数"],"one_liner":"衡量仿真评测成绩能否反映真机表现，常用皮尔逊相关系数 r 表示。","explanation":"用仿真做评测前，要先确认仿真里分高的策略在真机上也强。常见做法是挑一组策略，分别在仿真和真机上测成功率，再算两组数字的皮尔逊相关系数 r（-1 到 1，越接近 1 越一致）。2024 年的 SIMPLER（SimplerEnv）论文用 RT-1、RT-1-X、Octo 等策略在 Google Robot 和 WidowX 上做了这类对比，并指出 r 只看线性拟合、看不出排名是否被搞反，因此另提出平均最大排名违背（MMRV，越低越好）。相关性高，仿真基准才能代替昂贵的真机测试挑模型；相关性低，仿真里的提升可能只是拟合了仿真器。","example":"SIMPLER 靠视觉匹配（绿幕贴真实背景、对齐纹理）和控制参数的系统辨识缩小差距，基于约 1500 个评测回合展示仿真与真机成绩强相关。","related":["仿真评测","真机评测","平均最大排名违背","SimplerEnv","视觉匹配","虚实差距"]},{"id":"mean-maximum-rank-violation","category":"sim","sec":7,"tier":3,"sources":[{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)","url":"https://arxiv.org/abs/2405.05941"}],"as_of":"2024-05","related_ids":["simplerenv","sim-to-real-correlation","visual-matching","variant-aggregation","simulation-based-evaluation","real-world-evaluation"],"name":"平均最大排名违背","alt":"Mean Maximum Rank Violation","abbr":"MMRV","aliases":[],"one_liner":"衡量仿真评测给策略排的名次是否与真机一致的指标，越低越好。","explanation":"MMRV 由 2024 年的 SIMPLER（SimplerEnv）论文提出。作者认为仿真评测不必复现真机成功率的绝对值，关键是把策略的好坏排对。计算方法：任取两个策略，若仿真里的高低顺序与真机相反，就记一次「排名违背」，大小等于两者真机成功率之差；每个策略取它最严重的一次违背，再对所有策略求平均，取值 0 到 1。这样，真机上本就差不多的两个策略被排反只算小错，差距大的被排反才算大错。它通常和皮尔逊相关系数一起报告：后者只衡量线性关系，而且在策略水平接近时容易被真机评测的噪声带偏。","example":"SIMPLER 论文给 6 个谷歌机器人策略排名：按验证集动作 MSE 排，平均 MMRV 为 0.375；用 SIMPLER「视觉匹配」仿真评测排，降到 0.056。","related":["SimplerEnv","仿真-真机相关性","视觉匹配","变体聚合","仿真评测","真机评测"]},{"id":"elo-rating","category":"sim","sec":7,"tier":2,"sources":[{"title":"RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies (arXiv 2506.18123)","url":"https://arxiv.org/abs/2506.18123"},{"title":"Elo rating system - Wikipedia","url":"https://en.wikipedia.org/wiki/Elo_rating_system"}],"as_of":"2025-11","related_ids":["double-blind-pairwise-comparison","roboarena","real-world-evaluation","success-rate","benchmark"],"name":"Elo 评分","alt":"Elo Rating (Bradley-Terry Model)","abbr":"","aliases":["Bradley-Terry 模型","BT 模型","Elo Rating System"],"one_liner":"用两两对比的胜负结果，估算每个选手或策略相对实力的打分方法。","explanation":"Elo 评分由物理学教授、国际象棋大师 Arpad Elo 为棋手排名设计，1960 年被美国棋协采用。每个选手有一个分数，分差决定预期胜率；每局结束后按「实际结果 − 预期结果」乘以系数 K 调整分数。数学上它是 Bradley-Terry 模型的特例，BT 模型把 A 胜 B 的概率写成两者能力差的 sigmoid。具身领域用它解决「不同实验室、不同任务的成功率没法直接比」的问题：让两个策略在同一任务上成对比较，汇总大量胜负就能排出榜单。RoboArena 发现任务难度不一会让普通 Elo 排名失真，改用加入任务难度参数的 BT 模型。","example":"RoboArena 让各地评测者在自选任务上双盲比较两个策略、判断哪个做得更好，再用改进的 Bradley-Terry 模型把 600 多次真机对比汇总成 7 个通用策略的排名。","related":["双盲成对比较","RoboArena","真机评测","成功率","基准测试"]},{"id":"double-blind-pairwise-comparison","category":"sim","sec":7,"tier":3,"sources":[{"title":"RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies (arXiv 2506.18123)","url":"https://arxiv.org/abs/2506.18123"}],"as_of":"2025-06","related_ids":["elo-rating","roboarena","real-world-evaluation","evaluation-protocol","droid","benchmark"],"name":"双盲成对比较","alt":"Double-blind Pairwise Comparison","abbr":"","aliases":["A/B 对比评测","双盲 A/B 评测","Pairwise Preference Evaluation"],"one_liner":"评测者不知道谁是谁，只判断两个策略哪个更好的评测方式","explanation":"双盲成对比较是一种评测方法：每次拿两个模型或策略在同样条件下各跑一次，评测者事先不知道哪个是哪个，只判断谁做得更好，最后把大量「谁赢」的记录汇总成排名。大模型领域的 Chatbot Arena 就用匿名两两对比来排榜。具身智能里的代表是 2025 年的 RoboArena：7 所高校在 DROID 平台上做了 600 多次真机成对评测，比较 7 个通用策略；评测者可以自己选任务和场景，但必须双盲对比两个策略。这样做不必事先统一场景和成功标准，也能减少评测者偏向自家模型；多个评测点的胜负记录再用 Elo 或 Bradley-Terry 模型（根据胜负估计每个选手实力分的统计模型）换算成分数。论文称这种分布式评测比集中式评测排序更准、更易扩展。","example":"评测者在自己的实验室给出指令「把毛巾叠起来」，系统依次派出两个匿名策略 A、B 执行，评测者判定 B 更好，这条偏好记录计入排行榜。","related":["Elo 评分","RoboArena","真机评测","评测协议","DROID 数据集","基准测试"]},{"id":"benchmark-saturation","category":"sim","sec":7,"tier":3,"sources":[{"title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization (arXiv 2510.03827)","url":"https://arxiv.org/abs/2510.03827"},{"title":"Dynabench: Rethinking Benchmarking in NLP (arXiv 2104.14337)","url":"https://arxiv.org/abs/2104.14337"},{"title":"Stanford HAI: The 2025 AI Index Report","url":"https://hai.stanford.edu/ai-index/2025-ai-index-report"}],"as_of":"2025-10","related_ids":["benchmark","libero-benchmark","libero-pro","libero-plus","leaderboard-chasing","generalization-robustness-evaluation"],"name":"基准饱和","alt":"Benchmark Saturation","abbr":"","aliases":["榜单刷满","基准测试饱和"],"one_liner":"主流模型在某个基准上分数都接近满分，它再也分不出方法好坏。","explanation":"基准测试（固定任务和评测协议的公共考卷）用久了，各家分数会逼近上限，差距只剩一两个百分点，甚至落在随机误差内，这就是饱和。原因可能是方法确实进步了，也可能是大家反复针对同一测试集调参，或测试场景和训练数据太像、模型靠记忆就能拿高分。NLP 领域的 Dynabench 论文（2021）就指出，模型很快在基准上取得出色成绩，却在简单的挑战样例上失败。具身领域的典型例子是 LIBERO：多款 VLA 在标准设定下成功率已超过 90%。饱和后社区通常会推出更难或加扰动的新版本，或转向真机评测、泛化与鲁棒性评测。在饱和基准上的小幅领先，说服力有限。","example":"LIBERO-PRO（2025）指出，模型在标准 LIBERO 上成功率超过 90%，但在替换物体、改初始状态、改指令、换环境等设定下成功率跌到 0.0%，说明高分很大程度来自对训练轨迹和场景布局的记忆。","related":["基准测试","LIBERO","LIBERO-PRO","LIBERO-Plus","刷榜","泛化与鲁棒性评测"]},{"id":"libero-benchmark","category":"sim","sec":8,"tier":1,"sources":[{"title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning (arXiv 2306.03310)","url":"https://arxiv.org/abs/2306.03310"},{"title":"LIBERO GitHub repository","url":"https://github.com/Lifelong-Robot-Learning/LIBERO"},{"title":"OpenVLA-OFT (arXiv 2502.19645)","url":"https://arxiv.org/abs/2502.19645"}],"as_of":"2026-09","related_ids":["benchmark","benchmark-saturation","libero-plus","libero-pro","robosuite","openvla-oft"],"name":"LIBERO","alt":"LIBERO Benchmark (Benchmarking Knowledge Transfer for Lifelong Robot Learning)","abbr":"","aliases":["LIBERO-Spatial","LIBERO-Object","LIBERO-Goal","LIBERO-Long (LIBERO-10)","LIBERO-90","LIBERO-100"],"one_liner":"含 130 个桌面操作任务的仿真基准，VLA 论文最常报的榜单之一。","explanation":"LIBERO 由 Bo Liu、Yuke Zhu、Peter Stone 等人提出，发表于 NeurIPS 2023 数据集与基准赛道，原本用来研究终身学习（机器人一个接一个地学新任务）中的知识迁移。它建在 robosuite（底层是 MuJoCo）上，程序化生成了 130 个带语言指令的任务，分四个套件：Spatial（换摆放位置）、Object（换物体）、Goal（换目标）各 10 个任务；LIBERO-100 分为预训练用的 LIBERO-90 和 10 个长程任务的 LIBERO-Long（即 LIBERO-10）。每个任务配 50 条人工遥操作演示。它后来成了 VLA 微调最常用的榜单之一，头部方法平均成功率已超 97%，因此又出现了加扰动的 LIBERO-Plus、LIBERO-PRO。","example":"OpenVLA-OFT 在 LIBERO 四个套件上的平均成功率为 97.1%，原版 OpenVLA 为 76.5%。","related":["基准测试","基准饱和","LIBERO-Plus","LIBERO-PRO","robosuite","OpenVLA-OFT"]},{"id":"libero-plus","category":"sim","sec":8,"tier":3,"sources":[{"title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models (arXiv 2510.13626)","url":"https://arxiv.org/abs/2510.13626"},{"title":"LIBERO-plus GitHub 仓库","url":"https://github.com/sylvestf/LIBERO-plus"}],"as_of":"2025-10","related_ids":["libero-benchmark","libero-pro","generalization-robustness-evaluation","robustness","vision-language-action-model","openvla-oft"],"name":"LIBERO-Plus","alt":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","abbr":"","aliases":[],"one_liner":"在 LIBERO 上加 7 类扰动、专门检验 VLA 鲁棒性的评测基准。","explanation":"LIBERO-Plus 是 2025 年 10 月由复旦大学、新加坡国立大学、同济大学等团队发布的操作评测基准，在流行的 LIBERO 仿真基准上加入 7 类受控扰动：物体摆放、相机视角、机器人初始姿态、语言指令、光照、背景纹理和传感器噪声，共 10030 个任务变体，用来检验 VLA（视觉-语言-动作模型）的高分是真本事还是记住了训练场景。结果显示，视角或初始姿态稍变，成功率就可能从 95% 掉到 30% 以下；模型对语言扰动反而不敏感，因为它们常常根本不看指令。仓库可直接替换原版 LIBERO，也开源了带扰动的训练数据。","example":"OpenVLA 在原版 LIBERO 上成功率 76.5%，换相机视角后跌到 1.1%；把 OpenVLA-OFT 的指令换成空白，它在 object 任务组上的成功率几乎不变。","related":["LIBERO","LIBERO-PRO","泛化与鲁棒性评测","鲁棒性","视觉-语言-动作模型","OpenVLA-OFT"]},{"id":"libero-pro","category":"sim","sec":8,"tier":3,"sources":[{"title":"LIBERO-PRO: Towards Robust and Fair Evaluation of VLA Models Beyond Memorization (arXiv 2510.03827)","url":"https://arxiv.org/abs/2510.03827"},{"title":"LIBERO-PRO GitHub 仓库","url":"https://github.com/Zxy-MLlab/LIBERO-PRO"}],"as_of":"2025-10","related_ids":["libero-benchmark","libero-plus","benchmark-saturation","generalization-robustness-evaluation","out-of-distribution","leaderboard-chasing"],"name":"LIBERO-PRO","alt":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","abbr":"","aliases":[],"one_liner":"给 LIBERO 加物体、位置、指令、环境扰动，检验 VLA 是否在死记硬背。","explanation":"LIBERO-PRO 是 2025 年 10 月由华中科技大学、哈佛、MIT、理海大学等团队发布的扩展评测基准。作者指出，LIBERO 的训练和测试场景几乎相同，模型记住动作序列和桌面布局就能拿高分，分数虚高，也难以公平比较。LIBERO-PRO 在操作物体、初始状态、任务指令和环境四个维度上加入合理扰动，可自由组合。结果显示，标准设定下成功率超过 90% 的模型，在泛化设定下可跌到 0%：目标物被换成无关物品时仍照常去抓，指令被改乱甚至换成乱码时动作几乎不变。它与 LIBERO-Plus 同期出现，都说明 LIBERO 已接近基准饱和。","example":"项目主页公布：OpenVLA 在原任务上成功率 0.98，物体位置扰动后为 0.00；π0.5 从 0.97 降到 0.38。","related":["LIBERO","LIBERO-Plus","基准饱和","泛化与鲁棒性评测","分布外","刷榜"]},{"id":"simplerenv","category":"sim","sec":8,"tier":1,"sources":[{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)","url":"https://arxiv.org/abs/2405.05941"},{"title":"SIMPLER 项目主页","url":"https://simpler-env.github.io/"},{"title":"simpler-env/SimplerEnv (GitHub)","url":"https://github.com/simpler-env/SimplerEnv"}],"as_of":"2026-09","related_ids":["simulation-based-evaluation","visual-matching","variant-aggregation","mean-maximum-rank-violation","sim-to-real-correlation","maniskill"],"name":"SimplerEnv","alt":"SimplerEnv (SIMPLER: Simulated Manipulation Policy Evaluation for Real Robot Setups)","abbr":"","aliases":["SIMPLER","Simpler Env"],"one_liner":"照着常用真机场景复刻的仿真评测套件，用来低成本给操作策略打分。","explanation":"SimplerEnv（论文名 SIMPLER）由 UC San Diego、斯坦福、UC Berkeley 和 Google DeepMind 的研究者于 2024 年提出，发表于 CoRL 2024。它在 SAPIEN / ManiSkill 仿真器里复刻了两套常用真机设定：谷歌采集 RT-1 数据用的 Google Robot 和 Bridge 数据集用的 WidowX 机械臂，让用真机数据训练的策略不上真机也能打分。为缩小虚实差距，它校准了控制器参数，并提供「视觉匹配」（把仿真物体叠在真实背景上）和「变体聚合」（做出换了背景、光照、桌面纹理等的多个仿真变体，把成绩取平均）两种设定。作者验证了仿真与真机的成绩排序高度一致，此后许多 VLA 论文都在上面报成功率。","example":"评测一个 WidowX 策略时，可以直接在 SimplerEnv 里跑「把勺子放到毛巾上」「把胡萝卜放到盘子上」「把茄子放进篮子」等任务统计成功率，不用在真机前一次次摆物体。","related":["仿真评测","视觉匹配","变体聚合","平均最大排名违背","仿真-真机相关性","ManiSkill"]},{"id":"visual-matching","category":"sim","sec":8,"tier":3,"sources":[{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (arXiv 2405.05941)","url":"https://arxiv.org/abs/2405.05941"},{"title":"SIMPLER 项目主页","url":"https://simpler-env.github.io/"},{"title":"SimplerEnv GitHub 仓库","url":"https://github.com/simpler-env/SimplerEnv"}],"as_of":"2024-05","related_ids":["simplerenv","variant-aggregation","sim-to-real-correlation","mean-maximum-rank-violation","sim-to-real-gap","real-to-sim"],"name":"视觉匹配","alt":"Visual Matching (SimplerEnv)","abbr":"VM","aliases":["SimplerEnv 视觉匹配","SIMPLER Visual Matching"],"one_liner":"SimplerEnv 的一种评测设置：把仿真画面做得尽量和真机相机画面一样。","explanation":"视觉匹配是 SimplerEnv（SIMPLER，UCSD、斯坦福、伯克利和谷歌 DeepMind 于 2024 年 5 月发布）的两种评测设置之一，用来在仿真里评测用真机数据训练的操作策略。这类策略直接进仿真常因画面差异失灵。视觉匹配用「绿幕」把仿真物体和机械臂叠到真实背景照片上，再把真实纹理投到仿真模型、按真实视频调机械臂颜色，让画面接近真机。另一种设置「变体聚合」则换背景、光照、干扰物等生成多个变体取平均。两者都用皮尔逊相关系数和平均最大排名违背（MMRV）检验仿真与真机成绩是否一致。","example":"VLA 论文在 SimplerEnv 谷歌机器人任务（拿可乐罐、移到物体旁、开关抽屉）上，通常把成功率分成「视觉匹配」和「变体聚合」两栏分别报告。","related":["SimplerEnv","变体聚合","仿真-真机相关性","平均最大排名违背","虚实差距","现实到仿真"]},{"id":"variant-aggregation","category":"sim","sec":8,"tier":3,"sources":[{"title":"Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)","url":"https://arxiv.org/html/2405.05941"},{"title":"simpler-env/SimplerEnv GitHub 仓库","url":"https://github.com/simpler-env/SimplerEnv"}],"as_of":"2024-05","related_ids":["simplerenv","visual-matching","mean-maximum-rank-violation","sim-to-real-correlation","visual-randomization","simulation-based-evaluation"],"name":"变体聚合","alt":"Variant Aggregation (SimplerEnv)","abbr":"VA","aliases":["Variant Aggregation"],"one_liner":"SimplerEnv 的评测方式之一：在多个视觉变体场景里测策略再取平均。","explanation":"变体聚合是 SimplerEnv（SIMPLER）提出的两种「真实到仿真」评测方式之一，出自 Xuanlin Li 等人发表在 CoRL 2024 的论文。仿真画面和真机画面总有差距：另一种方式视觉匹配（Visual Matching）是尽量让仿真画面贴近真实；变体聚合则反过来，对场景做大幅视觉随机化，沿背景、光照、干扰物、桌面纹理、相机位姿等轴生成多个环境变体，分别测成功率后取平均，用来估计策略在各种视觉变化下的整体表现。论文用平均最大排名违背（MMRV）和皮尔逊相关系数衡量仿真结果与真机结果是否一致；在论文的实验里，视觉匹配与真机的一致性总体更好。VLA 论文报告谷歌机器人任务的 SimplerEnv 成绩时，常同时列 VM 和 VA 两栏。","example":"在「拿起可乐罐」任务上，让同一个策略在换背景、换光照、加干扰物、换桌面纹理、换相机角度等多个变体里各测一轮，平均成功率就是它的 VA 分数。","related":["SimplerEnv","视觉匹配","平均最大排名违背","仿真-真机相关性","视觉随机化","仿真评测"]},{"id":"calvin-benchmark","category":"sim","sec":8,"tier":2,"sources":[{"title":"CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks (arXiv 2112.03227)","url":"https://arxiv.org/abs/2112.03227"},{"title":"CALVIN GitHub 仓库","url":"https://github.com/mees/calvin"}],"as_of":"","related_ids":["average-length","language-conditioned-policy","long-horizon-task","libero-benchmark","pybullet","play-data"],"name":"CALVIN","alt":"CALVIN Benchmark","abbr":"","aliases":["CALVIN ABC→D","Composing Actions from Language and Vision"],"one_liner":"考机器人能否连续听懂并完成 5 条语言指令的桌面操作仿真基准。","explanation":"CALVIN（Composing Actions from Language and Vision）是德国弗莱堡大学 Oier Mees、Wolfram Burgard 等人发布的开源仿真基准，发表于 RA-L 2022，获当年该刊最佳论文奖。场景是一张桌子加一台 7 自由度 Franka 机械臂，桌上有抽屉、滑门、按钮、开关和三个彩色方块，用 PyBullet 仿真；共有 A、B、C、D 四个环境，结构相同，但纹理和部件位置不同。它提供约 24 小时的遥操作「玩耍」数据（其中只有 1% 配了语言标注），定义了 34 种任务，主评测要求连续执行 5 条语言指令，用平均完成长度打分。最常用的 ABC→D 设置在三个环境训练、在第四个没见过的环境测试，考察泛化能力。","example":"论文给出的一条测试链：「打开抽屉」→「把方块推进抽屉」→「从抽屉里拿出方块」→「把方块叠起来」→「关上抽屉」，机器人每完成一步才进入下一步。","related":["平均完成长度","语言条件策略","长程任务","LIBERO","PyBullet","玩耍数据"]},{"id":"average-length","category":"sim","sec":8,"tier":2,"sources":[{"title":"CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks (arXiv 2112.03227)","url":"https://arxiv.org/abs/2112.03227"},{"title":"CALVIN 官方评测脚本 evaluate_policy.py","url":"https://github.com/mees/calvin/blob/main/calvin_models/calvin_agent/evaluation/evaluate_policy.py"},{"title":"CALVIN 评测工具 utils.py（avg_seq_len 计算）","url":"https://github.com/mees/calvin/blob/main/calvin_models/calvin_agent/evaluation/utils.py"}],"as_of":"","related_ids":["calvin-benchmark","success-rate","long-horizon-task","language-conditioned-policy","closed-loop-evaluation","progress-score"],"name":"平均完成长度","alt":"Average Length (CALVIN)","abbr":"Avg. Len","aliases":["平均连续完成任务数","Average Successful Sequence Length","平均序列长度"],"one_liner":"CALVIN 评测里策略平均能连续完成几条指令，满分 5。","explanation":"平均完成长度是 CALVIN 长程评测的核心指标。评测时让策略依次跑 1000 条指令链，每条链由 5 个连续的语言指令组成（如先开抽屉、再把方块推进抽屉），每个子任务最多 360 步；一旦某个子任务失败，这条链就结束。记下每条链连续做成了几个（0–5），取平均就是 Avg. Len。它等于「连续完成至少 1 个、2 个……5 个任务的成功率」之和，所以既看单步能力，也看长程衔接中误差会不会累积。论文通常在 ABC→D（在 A、B、C 三个环境训练，在没见过的 D 上测）设置下报告这个数，用来比较模型的泛化和长程能力。","example":"CALVIN 论文的基线 MCIL 在 D→D 设置下，连续完成 1–5 个任务的成功率分别为 48.9%、12.9%、2.6%、0.5%、0.08%，加起来约 0.65，即平均连续完成不到 1 个任务。","related":["CALVIN","成功率","长程任务","语言条件策略","闭环评测","进度分数"]},{"id":"rlbench","category":"sim","sec":8,"tier":2,"sources":[{"title":"RLBench: The Robot Learning Benchmark & Learning Environment (arXiv 1909.12271)","url":"https://arxiv.org/abs/1909.12271"},{"title":"stepjam/RLBench (GitHub)","url":"https://github.com/stepjam/RLBench"},{"title":"Perceiver-Actor (arXiv 2209.05451)","url":"https://arxiv.org/abs/2209.05451"}],"as_of":"","related_ids":["peract","rvt-2","3d-diffuser-actor","coppeliasim","keyframe-action-prediction","the-colosseum-a-benchmark-for-evaluating-generalization-for"],"name":"RLBench","alt":"RLBench","abbr":"","aliases":["RLBench 基准","RLBench-18（PerAct 子集）"],"one_liner":"伦敦帝国理工推出的 100 个机械臂操作任务仿真基准，基于 CoppeliaSim。","explanation":"RLBench 由伦敦帝国理工学院 Dyson 机器人实验室的 Stephen James、Andrew Davison 等人于 2019 年发布（IEEE RA-L 2020）。它包含 100 个人工设计的操作任务，从够取目标、开门到开烤箱这类多步任务都有，默认用 Franka Panda 机械臂，跑在 CoppeliaSim 仿真器上。每个任务提供多相机的 RGB、深度、分割掩码和本体状态观测，能用运动规划自动生成任意多条演示，许多任务还有颜色、位置等变体。它原本面向强化学习、模仿学习和少样本学习，后来成为三维操作策略的主要仿真基准之一：PerAct 选出的 18 个任务被 RVT、3D Diffuser Actor 等大量工作沿用。","example":"PerAct 在 RLBench 的 18 个任务（249 个变体）上训练一个多任务 Transformer，把多视角 RGB-D 观测体素化后预测下一个关键帧的末端位姿，之后的 RVT-2、3D Diffuser Actor 都在同一组任务上比较成功率。","related":["PerAct","RVT-2","3D Diffuser Actor","CoppeliaSim","关键帧动作预测","The Colosseum"]},{"id":"gembench","category":"sim","sec":8,"tier":3,"sources":[{"title":"Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy (arXiv 2410.01345)","url":"https://arxiv.org/abs/2410.01345"},{"title":"GemBench project page","url":"https://www.di.ens.fr/willow/research/gembench/"}],"as_of":"2025-05","related_ids":["rlbench","generalization","compositional-generalization","long-horizon-task","language-conditioned-policy","benchmark"],"name":"GemBench","alt":"GemBench","abbr":"","aliases":["GEMBench"],"one_liner":"基于 RLBench 的仿真基准，分四级测语言操作策略对新任务的泛化能力。","explanation":"GemBench 由法国 Inria 和巴黎高师的 Ricardo Garcia、Shizhe Chen、Cordelia Schmid 提出，收录于 ICRA 2025。它建在 RLBench 仿真上，定义了按、抓、推、拧、关、开、放置/堆叠 7 种动作原语，用 16 个任务（31 个变体）训练，在 44 个任务（92 个变体）上测试，泛化难度分四级：新摆放位置、新刚体物体、新铰接物体、新长程任务。同一论文还提出 3D-LOTUS（基于点云的语言条件策略）和 3D-LOTUS++（再接入大语言模型做任务规划、视觉语言模型做物体定位）。结果显示纯模仿学习策略在熟悉任务上接近满分，遇到没学过的任务组合就明显下降。","example":"第 1 级（只换摆放位置）3D-LOTUS 成功率 94.3%，而第 4 级要把学过的动作组合成新的长程任务，它只有 0.3%，加入大模型规划的 3D-LOTUS++ 为 17.4%。","related":["RLBench","泛化","组合泛化","长程任务","语言条件策略","基准测试"]},{"id":"the-colosseum-a-benchmark-for-evaluating-generalization-for","category":"sim","sec":8,"tier":3,"sources":[{"title":"THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation (arXiv 2402.08191)","url":"https://arxiv.org/abs/2402.08191"},{"title":"The Colosseum 项目主页","url":"https://robot-colosseum.github.io/"},{"title":"robot-colosseum GitHub 仓库","url":"https://github.com/robot-colosseum/robot-colosseum"}],"as_of":"2024-05","related_ids":["rlbench","generalization-robustness-evaluation","distractor-objects","domain-randomization","peract","visual-generalization"],"name":"The Colosseum","alt":"The Colosseum: A Benchmark for Evaluating Generalization for Robotic Manipulation","abbr":"","aliases":["Colosseum","THE COLOSSEUM"],"one_liner":"在 RLBench 任务上系统施加 14 类环境扰动，测操作策略泛化能力的基准。","explanation":"The Colosseum 由 Wilbert Pumacay、Jiafei Duan、Dieter Fox 等人提出，发表于 RSS 2024。它基于 PyRep 仿真框架，从 RLBench 的 100 个任务里选了 20 个，每个任务可沿 14 个维度施加扰动：被操作物体和静止物体的颜色、纹理、尺寸，灯光颜色，桌面颜色与纹理，背景纹理，干扰物数量，相机位姿，物体摩擦和质量。作者用它测了 PerAct、RVT、R3M、MVP、VoxPoser 等方法，发现单个扰动就让成功率下降 30%–50%，多种扰动同时施加时下降超过 75%，影响最大的是干扰物数量、目标物体颜色和光照。真机复现实验中，仿真与真机结果的 R² 为 0.614。","example":"对同一个任务，分别只换桌面纹理、只加干扰物、只改相机位姿各跑一组试验，再和无扰动时的成功率对比，就能看出策略对哪类变化最敏感。","related":["RLBench","泛化与鲁棒性评测","干扰物","域随机化","PerAct","视觉泛化"]},{"id":"push-t","category":"sim","sec":8,"tier":2,"sources":[{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"},{"title":"huggingface/gym-pusht (GitHub)","url":"https://github.com/huggingface/gym-pusht"}],"as_of":"","related_ids":["diffusion-policy","action-multimodality","imitation-learning","lerobot","non-prehensile-manipulation","aloha-sim"],"name":"Push-T","alt":"Push-T","abbr":"","aliases":["PushT","推T任务","gym-pusht"],"one_liner":"用圆形推头把 T 形块推到目标位姿的二维任务，常用来测模仿学习策略。","explanation":"Push-T 是一个二维平面推物任务：智能体控制一个圆形推头，只能靠点接触把桌上的 T 形块推到固定的目标位置和朝向。它最早见于谷歌 2021 年的隐式行为克隆（IBC）工作，2023 年经 Diffusion Policy 改造后成为模仿学习的常用基准，Hugging Face 又把它做成了 gym-pusht 环境。任务看着简单，但要靠接触一点点调整木块姿态，而且同一状态下人往往有从左推、从右推等多种合理做法（动作多峰），很适合检验策略能否表达多峰动作分布。指标是 T 块与目标区域的重叠比例，gym-pusht 中重叠达 95% 算成功；观测可选关键点或 96×96 图像。","example":"Diffusion Policy 论文在仿真 Push-T 上与 IBC、LSTM-GMM 等方法对比，并搭了真机版：用 UR5 机械臂和 136 条人类演示训练，要求更精确的多阶段推动。","related":["扩散策略","动作多峰性","模仿学习","LeRobot","非抓取操作","ALOHA 仿真任务"]},{"id":"aloha-sim","category":"sim","sec":8,"tier":2,"sources":[{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)","url":"https://arxiv.org/abs/2304.13705"},{"title":"huggingface/gym-aloha (GitHub)","url":"https://github.com/huggingface/gym-aloha"},{"title":"tonyzhaozh/act (GitHub)","url":"https://github.com/tonyzhaozh/act"}],"as_of":"2026-09","related_ids":["action-chunking-with-transformers","aloha","bimanual-manipulation","lerobot","mujoco","imitation-learning"],"name":"ALOHA 仿真任务","alt":"ALOHA Sim (Transfer Cube / Insertion)","abbr":"","aliases":["gym-aloha","Transfer Cube","Insertion","传递方块","双臂插销","AlohaTransferCube-v0","AlohaInsertion-v0"],"one_liner":"ACT 论文在 MuJoCo 里搭的两个双臂仿真任务：交接方块和空中插销。","explanation":"ALOHA 仿真任务是 Tony Zhao 等人在 2023 年 ACT（动作分块 Transformer）论文里用 MuJoCo 搭的两个双臂精细操作任务，方便别人复现。Transfer Cube 要求右臂夹起桌上的红色方块，再放进左臂夹爪，间隙约 1 厘米；Insertion 要求左右臂分别拿起插座和插销，在空中对插，间隙约 5 毫米。每个任务各有 50 条脚本演示和 50 条人类遥操作演示。Hugging Face 把它封装成 gym-aloha 环境（动作为两臂各 6 个关节加 1 个夹爪，共 14 维），并在 LeRobot 上提供数据集，成了模仿学习入门常用的测试台。","example":"ACT 官方代码的说明写道：用 50 条脚本演示训练后，传递方块的成功率应在 90% 左右，插销任务在 50% 左右。","related":["ACT","ALOHA 双臂平台","双臂操作","LeRobot","MuJoCo","模仿学习"]},{"id":"robotwin","category":"sim","sec":8,"tier":2,"sources":[{"title":"RoboTwin 官网","url":"https://robotwin-platform.github.io/"},{"title":"RoboTwin 2.0 (arXiv 2506.18088)","url":"https://arxiv.org/abs/2506.18088"}],"as_of":"2025-06","related_ids":["bimanual-manipulation","domain-randomization","synthetic-data","sapien","benchmark","cross-embodiment"],"name":"RoboTwin","alt":"RoboTwin (RoboTwin 2.0)","abbr":"","aliases":["RoboTwin 2.0"],"one_liner":"港大、上海 AI 实验室等推出的双臂操作仿真数据生成器与评测基准。","explanation":"RoboTwin 是面向双臂操作的仿真数据生成与评测平台，由香港大学 MMLab、上海人工智能实验室、清华、上海交大等十几家机构推出，基于 SAPIEN 仿真器，1.0 版获 CVPR 2025 Highlight。2025 年 6 月的 2.0 版让多模态大模型自动写专家操作代码，在仿真里验证后生成轨迹，覆盖 50 个双臂任务、5 种机器人本体、731 个物体，预采集 10 万多条轨迹。它在杂物、背景纹理、光照、桌面高度、语言指令五个维度做域随机化（训练时随机改变环境条件），以提升真机鲁棒性，也是 VLA 常用的双臂评测基准。","example":"RoboTwin 2.0 论文报告，用其强随机化数据训练的 VLA 在未见过的真实场景中表现相对提升 367%；CVPR 2025 MEIS 研讨会还基于它举办了挑战赛。","related":["双臂操作","域随机化","合成数据","SAPIEN","基准测试","跨本体"]},{"id":"meta-world","category":"sim","sec":8,"tier":2,"sources":[{"title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning (arXiv 1910.10897)","url":"https://arxiv.org/abs/1910.10897"},{"title":"Farama-Foundation/Metaworld (GitHub)","url":"https://github.com/Farama-Foundation/Metaworld"}],"as_of":"2026-09","related_ids":["meta-reinforcement-learning","multi-task-learning","mujoco","benchmark","success-rate","gymnasium"],"name":"Meta-World","alt":"Meta-World","abbr":"","aliases":["MetaWorld","Meta-World+","MT10","MT50","ML10","ML45"],"one_liner":"含 50 个机械臂操作任务的仿真基准，用来测多任务和元强化学习。","explanation":"Meta-World 是 Tianhe Yu、Chelsea Finn、Sergey Levine 等在 CoRL 2019 提出的开源仿真基准：在 MuJoCo 里用 Sawyer 机械臂做 50 个不同操作任务，如开抽屉、按按钮、推物块、开窗。它有两组测法：多任务 MT1/MT10/MT50（同时学 1、10、50 个任务），元学习 ML1/ML10/ML45（先在一批任务上训练，再测对新任务的快速适应，ML45 为 45 个训练任务加 5 个测试任务）。原论文发现现有算法同时学 10 个任务就很吃力。项目现由 Farama 基金会维护，改用 Gymnasium 接口，2025 年推出统一版本细节的 Meta-World+（NeurIPS 2025），至今仍是多任务、元强化学习和模仿学习的常用基准。","example":"ML45 设定：智能体先在 45 个任务上元训练，再面对 5 个从没练过的任务（如某种新的开门动作），看它用少量交互能多快学会，用成功率打分。","related":["元强化学习","多任务学习","MuJoCo","基准测试","成功率","Gymnasium"]},{"id":"franka-kitchen","category":"sim","sec":8,"tier":3,"sources":[{"title":"Franka Kitchen - Gymnasium-Robotics Documentation","url":"https://robotics.farama.org/envs/franka_kitchen/franka_kitchen/"},{"title":"Relay Policy Learning (arXiv 1910.11956)","url":"https://arxiv.org/abs/1910.11956"},{"title":"Minari: D4RL Kitchen datasets","url":"https://minari.farama.org/datasets/D4RL/kitchen/"}],"as_of":"2026-09","related_ids":["d4rl","mujoco","long-horizon-task","offline-reinforcement-learning","sparse-reward","franka-emika-panda-franka-research-3"],"name":"Franka Kitchen","alt":"Franka Kitchen","abbr":"","aliases":["FrankaKitchen","D4RL Kitchen","厨房环境"],"one_liner":"MuJoCo 厨房场景，Franka 机械臂按顺序完成开微波炉、挪水壶等子任务。","explanation":"Franka Kitchen 来自 2019 年 CoRL 论文 Relay Policy Learning（Gupta、Levine、Hausman 等），用 MuJoCo 搭了一个厨房，放一台 9 自由度（7 个臂关节加 2 个手指）的 Franka 机械臂，可操作的物体有微波炉门、水壶、灯开关、滑动柜门、合页柜门和炉灶旋钮。一个回合要完成若干指定子任务，每完成一个得 1 分，属于稀疏奖励的长程多任务场景。它后来被收入 D4RL 离线强化学习基准，提供 complete、partial、mixed 三种演示数据，现由 Farama 基金会的 Gymnasium-Robotics 维护，常用于测试离线强化学习、模仿学习和分层策略能否把多个技能串起来。","example":"D4RL 的 kitchen-complete 数据里，每条演示都按顺序完成开微波炉、挪水壶、按灯开关、推开滑动柜门 4 个子任务；mixed 数据则从不完整按顺序做完这 4 个，考验算法能否拼接片段。","related":["D4RL","MuJoCo","长程任务","离线强化学习","稀疏奖励","Franka 机械臂（Panda / FR3）"]},{"id":"adroit","category":"sim","sec":8,"tier":3,"sources":[{"title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations (arXiv 1709.10087)","url":"https://arxiv.org/abs/1709.10087"},{"title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning (arXiv 2004.07219)","url":"https://arxiv.org/abs/2004.07219"},{"title":"Gymnasium-Robotics: Adroit Hand","url":"https://robotics.farama.org/envs/adroit_hand/"}],"as_of":"","related_ids":["dexterous-manipulation","in-hand-manipulation","shadow-dexterous-hand","d4rl","mujoco","sparse-reward"],"name":"Adroit 灵巧手任务","alt":"Adroit (Dexterous Manipulation Suite with ShadowHand in MuJoCo)","abbr":"","aliases":["Adroit Hand","ADROIT","DAPG 任务"],"one_liner":"在 MuJoCo 中控制 24 自由度仿真五指手完成开门、敲钉等四项任务的基准。","explanation":"Adroit 任务出自 Rajeswaran、Vikash Kumar、Sergey Levine 等人（华盛顿大学、OpenAI、伯克利）2018 年的论文，在 MuJoCo 里仿真 24 自由度的 ADROIT 拟人手（D4RL 称其为仿真 Shadow 手），设计了四个任务：把球搬到目标位置、在手里转笔到指定朝向、用锤子敲钉子、拉开带门闩的门。作者用 VR 数据手套为每个任务采集 25 条人类演示，并提出 DAPG：先用演示做行为克隆，再用带演示项的策略梯度做强化学习微调。之后 D4RL 把它收入离线强化学习基准，提供 human、cloned、expert 三类数据，Gymnasium-Robotics 也维护这些环境。它常用来测高维灵巧操作、稀疏奖励和演示辅助学习。","example":"D4RL 中的 pen-human 数据集就是转笔任务的 25 条人类演示，离线强化学习论文常用它比较算法。","related":["灵巧操作","手内操作","Shadow 灵巧手","D4RL","MuJoCo","稀疏奖励"]},{"id":"bi-dexhands","category":"sim","sec":8,"tier":3,"sources":[{"title":"Towards Human-Level Bimanual Dexterous Manipulation with Reinforcement Learning (arXiv 2206.08686)","url":"https://arxiv.org/abs/2206.08686"},{"title":"PKU-MARL/DexterousHands (GitHub)","url":"https://github.com/PKU-MARL/DexterousHands"}],"as_of":"2022-10","related_ids":["dexterous-manipulation","bimanual-manipulation","shadow-dexterous-hand","isaac-gym","multi-agent-reinforcement-learning","proximal-policy-optimization"],"name":"Bi-DexHands","alt":"Bi-DexHands (DexterousHands)","abbr":"","aliases":["DexterousHands","双手灵巧操作基准"],"one_liner":"北京大学团队基于 Isaac Gym 的双 Shadow 灵巧手强化学习基准。","explanation":"Bi-DexHands 出自北京大学 PKU-MARL 团队，论文《Towards Human-Level Bimanual Dexterous Manipulation with Reinforcement Learning》收录于 NeurIPS 2022 数据集与基准赛道，代码仓库名为 DexterousHands。它在 Isaac Gym（英伟达的 GPU 并行仿真器）里放两只 Shadow 灵巧手，包含数十个双手任务和数千个目标物体，任务按认知科学文献对应不同水平的人类运动技能来设计。论文称单张 RTX 3090 可跑到 3 万帧每秒以上。基准覆盖单智能体、多智能体（把每只手当作一个智能体）、离线、多任务和元强化学习。结论是 PPO 类算法能掌握相当于 48 个月大幼儿水平的简单任务，多智能体方法有助于需要双手配合的任务，但多任务和少样本设定下现有算法大多失败。","example":"论文中 PPO 类算法能学会接住飞来的物体、打开瓶子这类任务；抬锅、叠积木等需要双手紧密配合的任务，用多智能体强化学习更容易学会。","related":["灵巧操作","双臂操作","Shadow 灵巧手","Isaac Gym","多智能体强化学习","近端策略优化"]},{"id":"softgym-benchmarking-deep-reinforcement-learning-for-deforma","category":"sim","sec":8,"tier":3,"sources":[{"title":"arXiv 2011.07215 - SoftGym","url":"https://arxiv.org/abs/2011.07215"},{"title":"GitHub - Xingyu-Lin/softgym","url":"https://github.com/Xingyu-Lin/softgym"}],"as_of":"","related_ids":["deformable-object-manipulation","garment-manipulation","cloth-simulation","fluid-simulation","position-based-dynamics","benchmark"],"name":"SoftGym","alt":"SoftGym: Benchmarking Deep Reinforcement Learning for Deformable Object Manipulation","abbr":"","aliases":[],"one_liner":"基于英伟达 FleX 的柔性物体操作仿真基准，包含布料、绳子和液体任务","explanation":"SoftGym 是卡内基梅隆大学 David Held 组的 Xingyu Lin 等人发表在 CoRL 2020 的开源基准，专门评测强化学习在柔性物体操作上的表现。以往的强化学习基准多是刚体或低维状态任务，而布料、绳子、液体的状态维度极高、只能部分观测，难度完全不同。SoftGym 基于英伟达 FleX 粒子物理引擎（通过 Python 接口 PyFleX 调用），提供标准的 OpenAI Gym 接口。任务分两档：中等难度有运水、倒水、拉直绳子、铺平布料、叠布、放下布料；困难档有定量倒水、叠皱布、放下并叠布、把绳子摆成指定形状等。论文实验表明现有算法在这些任务上仍有明显困难，尤其是只看图像时。由于依赖较老的 CUDA 和系统版本，官方推荐用 Docker 安装。","example":"在 SoftGym 的 FoldCloth（叠布）任务中，智能体只看俯视相机图像，控制两个抓取点把平铺的布对折，按两半布料的对齐程度获得奖励。","related":["柔性物体操作","衣物操作","布料仿真","流体仿真","基于位置的动力学","基准测试"]},{"id":"vima-bench","category":"sim","sec":8,"tier":3,"sources":[{"title":"VIMA: General Robot Manipulation with Multimodal Prompts (arXiv 2210.03094)","url":"https://arxiv.org/html/2210.03094"},{"title":"vimalabs/VIMABench GitHub 仓库","url":"https://github.com/vimalabs/VIMABench"}],"as_of":"2023-05","related_ids":["vima","benchmark","compositional-generalization","zero-shot","tabletop-manipulation","transporter-networks"],"name":"VIMA-Bench","alt":"VIMA-Bench","abbr":"","aliases":["VIMABench"],"one_liner":"用图文交错的多模态提示描述任务的桌面操作仿真基准，带四级泛化测试。","explanation":"VIMA-Bench 随 VIMA 模型一起提出，第一作者 Yunfan Jiang，合作者包括李飞飞、Anima Anandkumar 等，发表于 ICML 2023。它在 Ravens 仿真器（基于 PyBullet 的桌面操作环境）上扩展出 17 个元任务，任务指令写成文字和图片交错的多模态提示，覆盖简单物体操作、视觉目标到达、新概念理解、单样本视频模仿、视觉约束满足和视觉推理等类别，并提供 65 万条成功演示轨迹。评测分四级：L1 只随机物体摆放位置；L2 已见过的物体和纹理以新组合出现；L3 出现新物体和新纹理；L4 是全新任务，17 个任务里留出 4 个专门测零样本泛化。动作空间是一个抓取位姿加一个放置位姿。","example":"VIMA 论文报告，在最难的零样本泛化设置下，同样训练数据时 VIMA 的任务成功率最多是其他方案的 2.9 倍；训练数据少 10 倍时仍高出 2.7 倍。","related":["VIMA","基准测试","组合泛化","零样本","桌面操作","Transporter Networks"]},{"id":"genmanip","category":"sim","sec":8,"tier":3,"sources":[{"title":"GenManip: LLM-driven Simulation for Generalizable Instruction-Following Manipulation (arXiv 2506.10966)","url":"https://arxiv.org/abs/2506.10966"},{"title":"GenManip Suite project page","url":"https://genmanip.com/"}],"as_of":"2025-06","related_ids":["nvidia-isaac-sim","instruction-following","generative-simulation","synthetic-data","copa","shanghai-artificial-intelligence-laboratory"],"name":"GenManip","alt":"GenManip: LLM-driven Simulation for Generalizable Instruction-Following Manipulation","abbr":"","aliases":["GenManip-Bench","GenManip Suite"],"one_liner":"上海 AI 实验室基于 Isaac Sim、用大模型自动造任务的操作仿真评测平台。","explanation":"GenManip 由上海人工智能实验室牵头，联合浙大、西安交大、南大等提出，发表于 CVPR 2025，是建在 NVIDIA Isaac Sim 上的桌面操作仿真平台，关注策略能否听懂多样的语言指令。它用大语言模型生成面向任务的场景图（描述场景里有哪些物体、目标关系是什么），配合 1 万个带标注的 3D 物体资产，自动合成大量多样的任务和演示数据；评测部分 GenManip-Bench 含 200 个人工精修场景，考察空间关系、外观理解、常识推理和长程任务四类泛化。论文比较了两条路线：用基础模型做感知和规划的模块化系统，以及用行为克隆训练的端到端策略，发现前者零样本泛化更好，后者随数据量增加而提升。代码已在 GitHub 开源。","example":"在 GenManip-Bench 上，表现最好的模块化系统 CoPa（配 GPT-4.5）整体成功率为 23.0%；到了长程任务，参评模型平均只有 9.07%。","related":["Isaac Sim","指令跟随","生成式仿真","合成数据","CoPa","上海人工智能实验室"]},{"id":"arnold","category":"sim","sec":8,"tier":3,"sources":[{"title":"ARNOLD: A Benchmark for Language-Grounded Task Learning With Continuous States in Realistic 3D Scenes (arXiv 2304.04321)","url":"https://arxiv.org/abs/2304.04321"},{"title":"ARNOLD project page","url":"https://arnold-benchmark.github.io/"}],"as_of":"","related_ids":["language-conditioned-policy","articulated-object-manipulation","nvidia-isaac-sim","physx","generalization-robustness-evaluation","benchmark"],"name":"ARNOLD","alt":"ARNOLD (A Benchmark for Language-Grounded Task Learning with Continuous States in Realistic 3D Scenes)","abbr":"","aliases":["ARNOLD 基准"],"one_liner":"在 Isaac Sim 中考察机器人按语言把物体操作到指定连续状态的基准。","explanation":"ARNOLD 由北京通用人工智能研究院（BIGAI）联合 UCLA、北大、清华、哥伦比亚大学提出，发表于 ICCV 2023。以往的语言操作基准大多把目标当成「开 / 关」这样的二值状态，ARNOLD 则要求达到连续的目标值，比如把抽屉拉开到指定程度、倒出指定比例的水，并让物体状态保持在目标附近的范围内才算成功。它基于英伟达 Isaac Sim 和 PhysX 5.0，包含 8 个任务（拿起物体、调整朝向、开关抽屉、开关柜门、倒水、转移水）、40 种物体、20 个场景和 1 万条专家演示，语言指令由模板生成。评测除同分布测试外，还单列新物体、新场景、新目标状态等泛化划分；作者发现当时的语言条件策略在这些划分上明显变差。","example":"指令要求把柜门打开到一半，机器人不仅要打开柜门，还要让开合程度停在目标值附近的允许范围内才算成功。","related":["语言条件策略","铰接物体操作","Isaac Sim","PhysX","泛化与鲁棒性评测","基准测试"]},{"id":"vlabench-a-large-scale-benchmark-for-language-conditioned-ro","category":"sim","sec":8,"tier":3,"sources":[{"title":"VLABench (arXiv 2412.18194)","url":"https://arxiv.org/abs/2412.18194"},{"title":"VLABench GitHub 仓库（OpenMOSS）","url":"https://github.com/OpenMOSS/VLABench"}],"as_of":"2025-06","related_ids":["vision-language-action-model","instruction-following","long-horizon-task","libero-benchmark","mujoco","benchmark"],"name":"VLABench","alt":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","abbr":"","aliases":[],"one_liner":"复旦发布的语言条件操作基准，侧重常识、隐含意图和长程多步推理。","explanation":"VLABench 是复旦大学 OpenMOSS 团队 2024 年 12 月发布的开源基准，2025 年被 ICCV 接收，评测按自然语言指令操作机械臂的能力。它基于 MuJoCo 和 dm_control 搭建，默认用 7 自由度 Franka 机械臂，共 100 类任务（60 类原子、40 类组合），物体资产 2000 多个。和指令多为固定模板的已有基准相比，它的任务需要常识和世界知识，指令带隐含意图，长程任务需要多步推理，而且 VLA 策略和 VLM 驱动的工作流都能评。项目还提供自动生成的训练数据和六个评测赛道。","example":"它的指令不一定直说要拿什么，而是带着隐含意图，需要模型先推断出目标物体再动手；论文结果显示当时最强的预训练 VLA 和基于 VLM 的流程在这些任务上都表现吃力。","related":["视觉-语言-动作模型","指令跟随","长程任务","LIBERO","MuJoCo","基准测试"]},{"id":"robocerebra","category":"sim","sec":8,"tier":3,"sources":[{"title":"RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation (arXiv 2506.06677)","url":"https://arxiv.org/abs/2506.06677"}],"as_of":"2025-10","related_ids":["long-horizon-task","dual-system-architecture","embodied-memory","libero-benchmark","openvla","benchmark"],"name":"RoboCerebra","alt":"RoboCerebra (A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation)","abbr":"","aliases":[],"one_liner":"评测机器人长程操作中规划、反思与记忆能力的大规模仿真基准。","explanation":"北京航空航天大学、新加坡国立大学、上海交通大学等的研究者 2025 年 6 月发布，入选 NeurIPS 2025。它关注「System 2」式的慢思考能力：先用 GPT 生成家务类长任务并拆成子任务序列，再由人在仿真中逐步执行，得到 100 个任务变体、1000 条人工轨迹，平均每条约 2972 个仿真步，论文称约为已有长程操作数据集的 6 倍，并附子任务时间段标注。测试任务分六类：理想、随机干扰、观测不一致、记忆探索、记忆执行和混合，场景会在执行中途变化。配套的分层框架用视觉语言模型（VLM）做高层规划并存入记忆，用 OpenVLA 做底层动作执行；论文借此比较 GPT-4o、Qwen2.5-VL 等 VLM 当规划器时在规划、反思（判断子任务是否完成）和记忆三方面的表现。","example":"指令是「准备一杯饮料再收拾桌面」，高层模型要先拆出拿杯子、倒饮料、放回原处等子步骤；执行途中物体被随机挪动时，还要判断当前子任务是否完成并重新规划。","related":["长程任务","快慢双系统","具身记忆","LIBERO","OpenVLA","基准测试"]},{"id":"mikasa-robo","category":"sim","sec":8,"tier":3,"sources":[{"title":"Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning (arXiv 2502.10550)","url":"https://arxiv.org/abs/2502.10550"},{"title":"MIKASA-Robo GitHub 仓库","url":"https://github.com/CognitiveAISystems/MIKASA-Robo"},{"title":"MIKASA-Robo-VLA Documentation","url":"https://mikasarobo.github.io/"}],"as_of":"2026-09","related_ids":["embodied-memory","memory-augmented-vla","partially-observable-markov-decision-process","maniskill","memory-augmented-vla","benchmark"],"name":"MIKASA-Robo","alt":"MIKASA-Robo","abbr":"","aliases":["MIKASA-Robo-VLA"],"one_liner":"专测机器人记忆能力的桌面操作基准，任务要求记住被遮挡或已消失的信息。","explanation":"MIKASA-Robo 是 Cherepanov、Panov 等人 2025 年 2 月提出的记忆密集型操作基准，属于 MIKASA（记忆密集技能评测套件）的一部分，论文发表于 ICLR 2026。很多真实任务是部分可观测的：物体会被挡住，关键信息只出现一瞬，只看当前画面的策略就无从下手。它基于 ManiSkill3 构建，首版含 32 个任务。后来扩展为面向 VLA 的 MIKASA-Robo-VLA：任务增至 90 个，覆盖 10 类记忆，每个任务配语言指令，并在 Hugging Face 开放 2.25 万条轨迹，可用来检验 MemoryVLA 这类带记忆的模型。","example":"ShellGameTouch 任务：前 5 步能看到红球在三个位置之一，随后三处都被杯子盖住，机器人要碰到藏着球的那只杯子。","related":["具身记忆","记忆增强 VLA","部分可观测马尔可夫决策过程","ManiSkill","MemoryVLA","基准测试"]},{"id":"vla-arena-an-open-source-framework-for-benchmarking-vision-l","category":"sim","sec":8,"tier":3,"sources":[{"title":"VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models (arXiv 2512.22539)","url":"https://arxiv.org/abs/2512.22539"},{"title":"VLA-Arena 项目主页","url":"https://vla-arena.github.io"}],"as_of":"2026-08","related_ids":["vision-language-action-model","libero-benchmark","robosuite","generalization-robustness-evaluation","embodied-safety","benchmark"],"name":"VLA-Arena","alt":"VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models","abbr":"","aliases":["VLA-Arena 基准"],"one_liner":"北大团队的开源 VLA 评测框架，按任务、语言、视觉三条轴分级测能力边界。","explanation":"VLA-Arena 是北京大学 PKU-Alignment 团队发布的开源 VLA（视觉-语言-动作模型）评测框架，2025 年 12 月上线 arXiv，后被 ICML 2026 接收，仿真基于 LIBERO 和 robosuite。它把难度拆成任务结构、语言指令、视觉观测三条独立的轴：11 个任务套件共 170 个任务，分属安全、干扰物、外推、长程四类，每套分 L0–L2 三级，只许在 L0 上微调；语言（W0–W4）和视觉（V0–V4）扰动可叠加到任意任务上。作者据此发现，现有 VLA 偏向记忆训练任务、视觉理解浅、常忽视安全约束。","example":"论文发现同一个模型在 L0 排名靠前、到 L1/L2 却可能被别的模型反超，作者把这种排名反转当作三级难度各自提供独立信息的证据。","related":["视觉-语言-动作模型","LIBERO","robosuite","泛化与鲁棒性评测","具身安全","基准测试"]},{"id":"nvidia-isaac-lab-arena","category":"sim","sec":8,"tier":3,"sources":[{"title":"NVIDIA Technical Blog: Simplify Generalist Robot Policy Evaluation in Simulation with NVIDIA Isaac Lab-Arena","url":"https://developer.nvidia.com/blog/simplify-generalist-robot-policy-evaluation-in-simulation-with-nvidia-isaac-lab-arena/"},{"title":"GitHub: isaac-sim/IsaacLab-Arena","url":"https://github.com/isaac-sim/IsaacLab-Arena"}],"as_of":"2026-09","related_ids":["nvidia-isaac-lab","simulation-based-evaluation","benchmark","lerobot-envhub","robofinals","robocasa"],"name":"Isaac Lab-Arena","alt":"NVIDIA Isaac Lab-Arena","abbr":"","aliases":["Isaac Lab Arena","IsaacLab-Arena"],"one_liner":"英伟达开源的 Isaac Lab 扩展，用来组合搭建仿真基准、并行评测机器人策略。","explanation":"Isaac Lab-Arena 是英伟达与光轮智能（Lightwheel）合作开发、架在 Isaac Lab 之上的开源框架，2026 年 1 月由英伟达官方博客正式介绍，目前仍为 alpha 版。以往大规模评测要为每个任务手写场景和脚本。它把环境拆成场景（摆哪些物体）、本体（机器人及其传感器、控制器）、任务（要完成什么）三个部件自由组合，支持对光照、相机、物体属性做扰动测试，按抓取、放置等子任务统计进度，可在 GPU 上同时跑成千上万个环境。它接入 LeRobot 的 EnvHub，可评测 GR00T、π0.5 等模型，已收录 RoboCasa、LIBERO、RoboTwin 2.0 的适配版。","example":"英伟达博客给出的对比中，同一批评测用 Isaac Lab-Arena 并行跑需 0.76 小时，逐个顺序执行则要 34.9 小时。","related":["Isaac Lab","仿真评测","基准测试","EnvHub","光轮 RoboFinals 工业级仿真评测平台","RoboCasa"]},{"id":"robofinals","category":"sim","sec":8,"tier":3,"sources":[{"title":"Lightwheel Unveils RoboFinals（光轮官网，2025-12-04）","url":"https://lightwheel.ai/robofinals"},{"title":"RoboFinals-100: An Industrial Benchmark for Embodied AI（光轮官网）","url":"https://lightwheel.ai/media/robofinals-industrial-benchmark"},{"title":"新华网：光轮智能发布十万小时全模态人类行为开源数据集（2026-08-21）","url":"http://www.xinhuanet.com/sci-tech/20260821/57f5b57922604293a05e67b02510c9ec/c.html"}],"as_of":"2026-08","related_ids":["lightwheel","nvidia-isaac-lab-arena","simulation-based-evaluation","benchmark","simready-assets","vision-language-action-model"],"name":"光轮 RoboFinals 工业级仿真评测平台","alt":"RoboFinals (Lightwheel industrial-grade simulation evaluation platform)","abbr":"","aliases":["RoboFinals","RoboFinals-100"],"one_liner":"光轮智能推出、专门评测 VLA 等机器人基础模型的工业级仿真评测平台。","explanation":"仿真数据与评测公司光轮智能（Lightwheel）2025 年 12 月 4 日发布，定位是难度足够高的工业级仿真评测平台，专门测前沿 VLA（视觉-语言-动作模型）和机器人基础模型。核心基准 RoboFinals-100 含 100 个任务，覆盖家庭、工厂和零售三类场景，涉及刚体、柜门等铰接物体以及线缆、布料、液体等柔性物体，支持桌面机械臂、移动操作和全身运动操作机器人。它构建在光轮与英伟达共同开发的 Isaac Lab-Arena 评测框架上，物理后端可选 Newton、PhysX、MuJoCo 和 Genesis，以检验策略跨仿真器是否稳健，并用 Real2Sim 校准缩小与真机的差距。官方称阿里通义千问团队参与共建场景和评测标准，傅利叶等团队也在使用。2026 年 8 月，光轮又推出 RoboFinals 中试基地仿真评测基础设施。","example":"某团队把自家 VLA 接入 RoboFinals，在大量并行仿真环境里批量跑家庭收纳、工厂装配、超市补货等任务，再按场景类别对比成功率、找出薄弱环节。","related":["光轮智能","Isaac Lab-Arena","仿真评测","基准测试","SimReady 资产","视觉-语言-动作模型"]},{"id":"robocasa","category":"sim","sec":9,"tier":2,"sources":[{"title":"RoboCasa 官网（RoboCasa365）","url":"https://robocasa.ai/"},{"title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots (arXiv 2406.02523)","url":"https://arxiv.org/abs/2406.02523"},{"title":"robocasa/robocasa GitHub README","url":"https://github.com/robocasa/robocasa"}],"as_of":"2026-05","related_ids":["robosuite","mimicgen","simulation-assets","benchmark","household-tasks","nvidia-isaac-gr00t-n1"],"name":"RoboCasa","alt":"RoboCasa (RoboCasa365)","abbr":"","aliases":["RoboCasa365"],"one_liner":"UT Austin 做的大规模厨房家务仿真框架与基准，最新版叫 RoboCasa365。","explanation":"RoboCasa 是得州大学奥斯汀分校朱玉可（Yuke Zhu）团队的家庭场景仿真框架，建在 robosuite 和 MuJoCo 之上，初版发表于 RSS 2024，含 120 个厨房场景、100 个任务，并用 MimicGen（从少量人类演示自动扩增轨迹的工具）扩充数据。2026 年 2 月发布的 RoboCasa365（ICLR 2026）扩展到 2500 多个厨房场景、3200 多个物体、365 个日常任务，附 600 多小时人类演示和 1600 多小时自动生成数据，并设多任务排行榜。它解决真机家务数据贵、难复现的问题，常用来比较通用策略。","example":"RoboCasa365 官方排行榜在同一批厨房任务上对比 Diffusion Policy、π 系列和 GR00T 等策略的多任务表现。","related":["robosuite","MimicGen","仿真资产","基准测试","家务任务","GR00T N1 系列"]},{"id":"behavior-1k","category":"sim","sec":9,"tier":2,"sources":[{"title":"BEHAVIOR 官网","url":"https://behavior.stanford.edu/"},{"title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation (arXiv 2403.09227)","url":"https://arxiv.org/abs/2403.09227"},{"title":"2026 BEHAVIOR Challenge","url":"https://behavior.stanford.edu/challenge/index.html"}],"as_of":"2026-09","related_ids":["omnigibson","nvidia-isaac-sim","household-tasks","long-horizon-task","benchmark","mobile-manipulation"],"name":"BEHAVIOR-1K","alt":"BEHAVIOR-1K (BEHAVIOR Challenge)","abbr":"","aliases":["BEHAVIOR","BEHAVIOR Challenge","BEHAVIOR 挑战赛"],"one_liner":"斯坦福做的 1000 个日常家务任务仿真基准，跑在 OmniGibson 上。","explanation":"BEHAVIOR-1K 是斯坦福视觉与学习实验室推出的具身智能基准，李飞飞、吴佳俊等参与指导，初版发表于 CoRL 2022。任务来自一项「你希望机器人帮你做什么」的调查，整理出 1000 个日常活动，分布在 50 个可交互场景（住宅、花园、餐厅、办公室等）中，标注了 9000 多个带物理和语义属性的物体；任务目标用 BDDL（一种用逻辑谓词描述目标状态的语言）定义。配套仿真器 OmniGibson 基于英伟达 Isaac Sim，支持刚体、软体和液体。团队从 2025 年开始办 BEHAVIOR Challenge，2026 年第二届要求完成 100 个完整家务任务，提供 2 万条、共 1950 小时的遥操作演示，按带部分得分的平均任务成功分数排名。","example":"2026 BEHAVIOR Challenge 提供 π0.5 和 GR00T N1.7 作为基线，参赛策略用 RGB、深度和本体感知输入控制机器人做家务，提交截止 2026 年 10 月 16 日，总奖金 1.1 万美元。","related":["OmniGibson","Isaac Sim","家务任务","长程任务","基准测试","移动操作"]},{"id":"open-vocabulary-mobile-manipulation","category":"sim","sec":9,"tier":2,"sources":[{"title":"HomeRobot: Open-Vocabulary Mobile Manipulation (arXiv 2306.11565)","url":"https://arxiv.org/abs/2306.11565"},{"title":"NeurIPS 2023 HomeRobot OVMM Challenge","url":"https://ovmm.github.io/"}],"as_of":"2023-12","related_ids":["mobile-manipulation","open-vocabulary","habitat","hello-robot-stretch","rearrangement","progress-score"],"name":"开放词汇移动操作基准","alt":"Open-Vocabulary Mobile Manipulation (HomeRobot OVMM)","abbr":"OVMM","aliases":["HomeRobot","HomeRobot OVMM","OVMM Challenge","HomeRobot OVMM Challenge"],"one_liner":"让机器人在没见过的房子里找到任意指定物体，并放到指定家具上的评测基准。","explanation":"HomeRobot OVMM 是 Meta FAIR、佐治亚理工、卡内基梅隆和西蒙弗雷泽大学在 2023 年推出的基准，也是 NeurIPS 2023 的一项竞赛。任务形如「把某物体从 A 家具移到 B 家具」，物体用文字指定，可以是训练时没见过的类别（开放词汇），机器人要在陌生房屋里依次完成找物体、抓取、找目标家具、放置。仿真部分基于 Habitat 和 HSSD 合成场景，共 60 个多房间住宅、129 类 2535 个物体；真机部分用低成本的 Hello Robot Stretch，配套开源软件栈 HomeRobot。它把导航、感知和抓取串在一起评，论文基线的真机成功率约 20%。","example":"指令「把玩具大象从椅子上移到桌子上」，玩具大象属于训练时没出现过的类别；机器人每完成找到物体、拿起、找到桌子、放好中的一个阶段就得 1 分，四步全成才算成功。","related":["移动操作","开放词汇","Habitat","Hello Robot Stretch","物体重排","进度分数"]},{"id":"alfred","category":"sim","sec":9,"tier":3,"sources":[{"title":"ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks (arXiv 1912.01734)","url":"https://arxiv.org/abs/1912.01734"},{"title":"ALFRED project site","url":"https://askforalfred.com/"}],"as_of":"","related_ids":["instruction-following","long-horizon-task","ai2-thor","alfworld","household-tasks","vision-and-language-navigation"],"name":"ALFRED","alt":"ALFRED (Action Learning From Realistic Environments and Directives)","abbr":"","aliases":["ALFRED 基准"],"one_liner":"让智能体按自然语言指令在仿真家庭里完成多步家务的基准。","explanation":"ALFRED 由 Mohit Shridhar 等人（华盛顿大学、卡内基梅隆大学、艾伦人工智能研究所、英伟达）提出，发表于 CVPR 2020，基于 AI2-THOR 仿真器。它有 120 个室内场景（厨房、浴室、卧室、客厅各 30 个）、8055 条专家演示和 25743 条英文指令，每条演示平均约 50 步，任务分 7 类，如放置、叠放后放置、加热、冷却、清洗后放置、在灯下查看物体。智能体只能看第一人称画面和指令，输出离散的导航与交互动作，交互时还要给出目标物体的像素掩码。指标是任务成功率和目标条件成功率，另有按路径长度加权的版本。原论文基线在未见场景的成功率不到 1%，人类约 91%。ALFWorld、TEACh 都建立在它之上。","example":"高层目标「把杯子冲洗干净放进咖啡机」，配有逐步指令如「走到右边的咖啡机前」，智能体要依次导航、拿杯子、到水槽冲洗、再放进咖啡机。","related":["指令跟随","长程任务","AI2-THOR","ALFWorld","家务任务","视觉语言导航"]},{"id":"alfworld","category":"sim","sec":9,"tier":3,"sources":[{"title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning (arXiv 2010.03768)","url":"https://arxiv.org/abs/2010.03768"},{"title":"ALFWorld project site","url":"https://alfworld.github.io/"},{"title":"ReAct: Synergizing Reasoning and Acting in Language Models (arXiv 2210.03629)","url":"https://arxiv.org/abs/2210.03629"}],"as_of":"","related_ids":["alfred","ai2-thor","llm-based-task-planning","planning-domain-definition-language","long-horizon-task","embodiedbench"],"name":"ALFWorld","alt":"ALFWorld (Aligning Text and Embodied Environments for Interactive Learning)","abbr":"","aliases":["ALFWorld 文字家务环境"],"one_liner":"把 ALFRED 家务任务同步做成文字游戏，可先在文字里学、再到画面中执行。","explanation":"ALFWorld 由 Shridhar、Xingdi Yuan 等人（华盛顿大学、微软研究院、卡内基梅隆大学）提出，发表于 ICLR 2021。它用 PDDL（规划领域定义语言）描述 ALFRED 的每个场景，再借微软的 TextWorld 引擎生成等价的文字冒险游戏：智能体读到房间里有哪些家具和物品的文字描述，输入 go to desk 1 这类文字命令行动。任务分 6 类，训练用 3553 个游戏。作者的 BUTLER 智能体先在文字环境里学高层策略，再配上视觉识别（Mask R-CNN）和底层控制模块，迁移到 AI2-THOR 画面中执行，训练比只在画面里学快约 7 倍且泛化更好。大语言模型兴起后，ReAct 等智能体工作把它当作常用测试环境。","example":"「在台灯下查看闹钟」任务，文字版里依次输入 go to desk 1、take alarmclock 2 from desk 1、use desklamp 1 即可完成。","related":["ALFRED","AI2-THOR","大模型任务规划","规划领域定义语言","长程任务","EmbodiedBench"]},{"id":"room-to-room","category":"sim","sec":9,"tier":2,"sources":[{"title":"Room-to-Room (R2R) 官网","url":"https://bringmeaspoon.org/"},{"title":"VLN-CE 项目页","url":"https://jacobkrantz.github.io/vlnce/"},{"title":"jacobkrantz/VLN-CE GitHub（含 RxR-Habitat）","url":"https://github.com/jacobkrantz/VLN-CE"}],"as_of":"","related_ids":["vision-and-language-navigation","habitat","matterport3d","success-weighted-by-path-length","normalized-dynamic-time-warping","navila"],"name":"R2R / VLN-CE 视觉语言导航基准","alt":"Room-to-Room / VLN in Continuous Environments","abbr":"R2R / VLN-CE","aliases":["R2R","VLN-CE","RxR","R2R-CE","RxR-CE","Room-to-Room"],"one_liner":"视觉语言导航最常用的基准：照着人写的路线说明在陌生房屋里走到终点。","explanation":"R2R（Room-to-Room）由澳大利亚国立大学、阿德莱德大学等团队于 2018 年随 Matterport3D 模拟器发布，基于 90 栋真实建筑扫描，含约 2.2 万条人写的路线指令，智能体只能在预建导航图的节点间跳转。2020 年俄勒冈州立大学、佐治亚理工与 Facebook AI 提出 VLN-CE，把 R2R 搬进 Habitat 的连续环境，智能体要用「前进 0.25 米、左转 15 度、停止」这类底层动作行走，更接近真实机器人，成绩也明显下降。谷歌 2020 年的 RxR 含 12.6 万条英语、印地语、泰卢固语指令。常用指标有成功率、SPL（路径长度加权成功率）和 nDTW。","example":"VLN-CE 官方的跨模态注意力基线在 R2R 连续环境测试集上成功率 0.28、SPL 0.25，可见连续环境比导航图版本难得多。","related":["视觉语言导航","Habitat","Matterport3D 数据集","路径长度加权成功率","归一化动态时间规整","NaVILA"]},{"id":"navigation-error-oracle-success-rate-trajectory-length","category":"sim","sec":9,"tier":3,"sources":[{"title":"Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments (R2R, CVPR 2018)","url":"https://arxiv.org/abs/1711.07280"},{"title":"Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments (VLN-CE)","url":"https://arxiv.org/abs/2004.02857"}],"as_of":"","related_ids":["vision-and-language-navigation","room-to-room","success-rate","success-weighted-by-path-length","normalized-dynamic-time-warping"],"name":"导航误差 / Oracle 成功率 / 轨迹长度","alt":"Navigation Error / Oracle Success Rate / Trajectory Length","abbr":"NE / OSR / TL","aliases":["NE","OSR","OS","TL","Oracle Success"],"one_liner":"视觉语言导航的三项基本指标：停下时离目标多远、途中是否到过目标、一共走了多远。","explanation":"这三项是视觉语言导航（VLN，按自然语言指令在房屋里走到目标）论文结果表的标配，Anderson 等人 2018 年提出 R2R 基准时就已使用。导航误差（NE）是智能体最终停下的位置到目标点的最短路径距离，单位米，越小越好；R2R 规定误差小于 3 米算成功。Oracle 成功率（OSR，也写作 OS）假设智能体在自己轨迹上离目标最近的那一点停下，看这样算不算成功，用来区分「走到过但没停对」和「根本没找到」。轨迹长度（TL）是实际走过的总路程，偏长说明在绕路或乱逛。它们通常和成功率、SPL、nDTW 一起报告。","example":"R2R 原论文中，在未见过的建筑组成的测试集上，人类成功率为 86.4%，作者的序列到序列基线只有 20.4%。","related":["视觉语言导航","R2R / VLN-CE 视觉语言导航基准","成功率","路径长度加权成功率","归一化动态时间规整"]},{"id":"success-weighted-by-path-length","category":"sim","sec":9,"tier":2,"sources":[{"title":"On Evaluation of Embodied Navigation Agents (arXiv 1807.06757)","url":"https://arxiv.org/abs/1807.06757"}],"as_of":"","related_ids":["success-rate","point-goal-navigation","object-goal-navigation","navigation","normalized-dynamic-time-warping","navigation-error-oracle-success-rate-trajectory-length"],"name":"路径长度加权成功率","alt":"Success weighted by Path Length","abbr":"SPL","aliases":["路径加权成功率","Success weighted by (normalized inverse) Path Length"],"one_liner":"导航评测指标：既看有没有到达目标，也看走的路是否接近最短路径。","explanation":"SPL 由 Peter Anderson、Jitendra Malik 等 11 位研究者在 2018 年的论文《On Evaluation of Embodied Navigation Agents》中提出，并建议作为具身导航的首要指标。算法：对每个测试回合 i，成功则 S_i 记 1，否则记 0；l_i 是起点到目标的最短路径长度，p_i 是智能体实际走的路程；SPL 是所有回合 S_i·l_i/max(p_i, l_i) 的平均值。「成功」要求智能体主动输出停止动作，且此时离目标足够近，论文建议阈值默认取机身宽度的 2 倍，距离用绕开障碍的最短路径距离而不是直线距离。它惩罚绕远路，避免只看成功率时乱逛碰巧到达也拿满分。点目标导航、物体目标导航等任务通常同时报告成功率和 SPL。","example":"论文举例：一半回合成功且都走最短路，SPL 为 0.5；全部成功但每次走的路程都是最短路的两倍，SPL 同样是 0.5；一半成功且路程是两倍，SPL 为 0.25。","related":["成功率","点目标导航","物体目标导航","导航","归一化动态时间规整","导航误差 / Oracle 成功率 / 轨迹长度"]},{"id":"normalized-dynamic-time-warping","category":"sim","sec":9,"tier":3,"sources":[{"title":"General Evaluation for Instruction Conditioned Navigation using Dynamic Time Warping (arXiv 1907.05446)","url":"https://arxiv.org/abs/1907.05446"},{"title":"Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments (VLN-CE)","url":"https://arxiv.org/abs/2004.02857"}],"as_of":"","related_ids":["navigation-error-oracle-success-rate-trajectory-length","success-weighted-by-path-length","vision-and-language-navigation","room-to-room","success-rate"],"name":"归一化动态时间规整","alt":"normalized Dynamic Time Warping","abbr":"nDTW","aliases":["归一化 DTW"],"one_liner":"衡量智能体路线与参考路线在形状和顺序上有多贴合的导航指标，取值 0 到 1。","explanation":"nDTW 由 Ilharco、Baldridge 等人 2019 年提出，用来评估按语言指令导航的智能体。成功率只看终点，SPL 只看路程是否绕远，都不管中途是否照着指令走。nDTW 借用时间序列里的动态时间规整（DTW，把两条长短不同的序列按顺序对齐再累加距离），算出两条路径的最小累计距离，再用指数函数归一化到 0 到 1，越高越好：偏离越多扣分越多且扣得平滑，对经过顺序也敏感。作者的人工评测显示它比其他指标更贴近人类排序。论文还提出 SDTW：失败回合记 0，成功回合记 nDTW。它常与 NE、SR、SPL 一起用于 R2R、R4R、VLN-CE。","example":"指令要求「先进厨房再去卧室」，智能体直接去了卧室：终点对了，成功率照样记成功，但路径跳过了厨房，nDTW 会明显偏低。","related":["导航误差 / Oracle 成功率 / 轨迹长度","路径长度加权成功率","视觉语言导航","R2R / VLN-CE 视觉语言导航基准","成功率"]},{"id":"openeqa","category":"sim","sec":9,"tier":3,"sources":[{"title":"Meta AI Blog: OpenEQA: From word models to world models","url":"https://ai.meta.com/blog/openeqa-embodied-question-answering-robotics-ar-glasses/"},{"title":"OpenEQA project page","url":"https://open-eqa.github.io/"},{"title":"GitHub: facebookresearch/open-eqa (data)","url":"https://github.com/facebookresearch/open-eqa/tree/main/data"}],"as_of":"2024-04","related_ids":["embodied-question-answering","visual-question-answering","open-vocabulary","embodied-memory","habitat-matterport-3d-dataset","scannet"],"name":"OpenEQA 开放词汇具身问答基准","alt":"OpenEQA (Open-Vocabulary Embodied Question Answering Benchmark)","abbr":"","aliases":["OpenEQA","EM-EQA","A-EQA"],"one_liner":"Meta 推出的具身问答基准，考智能体能否凭对真实环境的观察用自然语言答题。","explanation":"OpenEQA 由 Meta FAIR 于 2024 年 4 月发布，论文发表于 CVPR 2024。具身问答（EQA）要求智能体理解自己所处或曾经看过的环境，并用自然语言回答，比如「我把钥匙放哪了」。它包含 1600 多个人工撰写、非模板生成的问答对，对应 180 多个真实环境的视频和扫描，场景来自 HM3D 和 ScanNet。设有两种设定：情景记忆 EM-EQA，根据已录下的观察历史作答，对应智能眼镜；主动探索 A-EQA，机器人需要自己移动去收集信息。由于答案是开放词汇的自由文本，作者用大语言模型打分的 LLM-Match 指标自动评估，与人工评判高度相关。","example":"Meta 公布的结果中，GPT-4V 准确率为 48.5%，人类为 85.9%；在需要空间理解的问题上，能看图的模型并不比只读文字的模型强多少。","related":["具身问答","视觉问答","开放词汇","具身记忆","HM3D 数据集","ScanNet 数据集"]},{"id":"erqa","category":"sim","sec":9,"tier":3,"sources":[{"title":"embodiedreasoning/ERQA GitHub","url":"https://github.com/embodiedreasoning/ERQA"},{"title":"Gemini Robotics: Bringing AI into the Physical World (arXiv 2503.20020)","url":"https://arxiv.org/abs/2503.20020"}],"as_of":"2025-03","related_ids":["embodied-reasoning","gemini-robotics-er","visual-question-answering","multimodal-large-language-model","embodied-arena","vsi-bench"],"name":"ERQA 具身推理问答基准","alt":"ERQA (Embodied Reasoning Question Answer Benchmark)","abbr":"ERQA","aliases":["Embodied Reasoning QA"],"one_liner":"谷歌 DeepMind 发布的 400 道具身推理图文选择题基准","explanation":"ERQA 是 Google DeepMind 在 2025 年 3 月随 Gemini Robotics 一起开源的基准，用来衡量多模态大模型的具身推理能力，也就是看懂真实物理场景、为机器人行动做判断的能力。它有 400 道图文混排的单选题（选项 A–D），场景多来自机器人相关的真实环境，题型包括空间推理、轨迹推理、动作推理、状态估计、指向、多视角推理和任务推理，其中 28% 的题要看多张图。因为只考选择题，不需要机器人或仿真器，任何视觉语言模型都能直接跑。Gemini Robotics 技术报告中，Gemini 2.0 Pro Experimental 得 48.3%，GPT-4o 得 47.0%，Claude 3.5 Sonnet 得 35.5%，说明当时模型离可靠的具身推理还有距离。Embodied Arena 等评测平台也收录了它。","example":"类似这样的题：给出机械臂夹着水杯的照片，问「要把水倒进旁边的碗里，夹爪下一步应该往哪个方向转」，从 A–D 四个选项中选一个。","related":["具身推理","Gemini Robotics-ER","视觉问答","多模态大语言模型","Embodied Arena 具身评测竞技场","VSI-Bench 视觉空间智能基准"]},{"id":"embodiedbench","category":"sim","sec":9,"tier":3,"sources":[{"title":"EmbodiedBench (arXiv 2502.09560)","url":"https://arxiv.org/abs/2502.09560"},{"title":"EmbodiedBench 项目主页","url":"https://embodiedbench.github.io/"}],"as_of":"2025-02","related_ids":["benchmark","multimodal-large-language-model","alfred","habitat","llm-based-task-planning","embodied-arena"],"name":"EmbodiedBench","alt":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","abbr":"","aliases":["EB-ALFRED","EB-Habitat","EB-Navigation","EB-Manipulation"],"one_liner":"评测多模态大模型当具身智能体大脑能力的基准，含 4 个环境","explanation":"EmbodiedBench 由 UIUC 等机构的 Rui Yang、Tong Zhang 等人提出，发表于 ICML 2025，专门评测多模态大语言模型（MLLM，能同时看图和读文字的大模型）充当具身智能体「大脑」时的能力。它有 4 个环境共 1128 个测试任务，分两层：EB-ALFRED 和 EB-Habitat 考高层任务分解与规划（如「把书放到桌上」，模型输出一串高层技能）；EB-Navigation 和 EB-Manipulation 考底层动作规划（直接输出平移、旋转等控制量），要求精确的感知和空间推理。任务还按 6 种能力分组：基础任务、常识推理、复杂指令理解、空间感知、视觉感知、长程规划。作者测了 24 个闭源和开源模型，发现模型擅长高层任务、难以做好底层操作，论文摘要称最好的 GPT-4o 平均只有 28.9%。","example":"在 EB-Manipulation 里，模型看到桌面图像和指令「把红色方块叠到蓝色方块上」，要直接给出机械臂末端的位置、姿态和夹爪开合，而不是调用现成的「抓取」技能。","related":["基准测试","多模态大语言模型","ALFRED","Habitat","大模型任务规划","Embodied Arena 具身评测竞技场"]},{"id":"embodied-arena","category":"sim","sec":9,"tier":3,"sources":[{"title":"Embodied Arena (arXiv 2509.15273)","url":"https://arxiv.org/abs/2509.15273"},{"title":"Embodied Arena 论文 HTML 版（作者单位与基准列表）","url":"https://arxiv.org/html/2509.15273v1"}],"as_of":"2025-09","related_ids":["benchmark","embodiedbench","erqa","openeqa","vsi-bench","embodied-question-answering"],"name":"Embodied Arena 具身评测竞技场","alt":"Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI","abbr":"","aliases":["Embodied Arena"],"one_liner":"统一接入具身问答、导航、任务规划基准并实时排榜的评测平台","explanation":"Embodied Arena 是天津大学、华为诺亚方舟实验室等国内外十余家机构联合推出的具身智能评测平台，论文 2025 年 9 月发布在 arXiv。它针对的问题是：具身领域基准很多但各自为政，模型之间难以横向比较，也说不清具身智能到底需要哪些能力。平台先定义一套能力分类：感知、推理、任务执行三层，7 项核心能力、25 个细分维度；再用统一的评测底座接入 22 个已有基准，覆盖 2D/3D 具身问答（如 OpenEQA、VSI-Bench、ERQA）、导航（如 R2R-CE、HM3D）和任务规划（如 EB-ALFRED、EB-Habitat），评测 20 多家机构的 30 多个模型；还用大语言模型驱动的流水线自动生成新评测数据，让题库持续更新。结果发布成三个实时排行榜，可按基准看，也可按能力维度看。","example":"想了解某个多模态大模型的空间推理水平，可以直接看 Embodied Arena 能力视图里该维度的综合得分，不用自己分别跑 VSI-Bench、ERQA 等多个基准。","related":["基准测试","EmbodiedBench","ERQA 具身推理问答基准","OpenEQA 开放词汇具身问答基准","VSI-Bench 视觉空间智能基准","具身问答"]},{"id":"arcade-learning-environment-atari-100k","category":"sim","sec":10,"tier":2,"sources":[{"title":"The Arcade Learning Environment: An Evaluation Platform for General Agents (Bellemare et al.)","url":"https://arxiv.org/abs/1207.4708"},{"title":"Arcade Learning Environment 文档（Farama Foundation）","url":"https://ale.farama.org/"},{"title":"Model-Based Reinforcement Learning for Atari (SimPLe, Kaiser et al., 2019)","url":"https://arxiv.org/abs/1903.00374"}],"as_of":"","related_ids":["reinforcement-learning","deep-q-network","sample-efficiency","world-model","dreamerv3","diamond"],"name":"Atari 游戏基准（街机学习环境 / Atari 100k）","alt":"Arcade Learning Environment / Atari 100k","abbr":"ALE","aliases":["街机学习环境","Atari 100k","Atari 2600 基准","雅达利游戏基准"],"one_liner":"用雅达利 2600 游戏测试强化学习的标准平台；Atari 100k 是小样本版。","explanation":"街机学习环境（ALE）由 Bellemare 等人提出，论文 2013 年发表于 JAIR。它基于 Stella 模拟器，把上百款雅达利 2600 游戏包装成统一接口：智能体看屏幕像素、选手柄动作、以得分作奖励。2015 年 DQN 在这里达到人类水平后，它成了深度强化学习最常用的基准，现由 Farama 基金会维护。Atari 100k 出自 2019 年的 SimPLe 论文：在 26 款游戏上只许交互约 10 万步（约两小时游戏时间），专门考察样本效率，DreamerV3、DIAMOND 等世界模型方法常在这里比较。不少具身智能用到的强化学习和世界模型技术最早在这里验证。","example":"在 Atari 100k 设定下玩《打砖块》（Breakout），智能体只能用大约两小时游戏量的交互数据学习，最后比较它的得分相对人类玩家的归一化分数。","related":["强化学习","深度 Q 网络","样本效率","世界模型","DreamerV3","DIAMOND（扩散世界模型）"]},{"id":"minecraft-environments","category":"sim","sec":10,"tier":3,"sources":[{"title":"MineDojo 官网","url":"https://minedojo.org/"},{"title":"MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge (arXiv 2206.08853)","url":"https://arxiv.org/abs/2206.08853"},{"title":"MineRL: A Large-Scale Dataset of Minecraft Demonstrations (arXiv 1907.13440)","url":"https://arxiv.org/abs/1907.13440"}],"as_of":"2022-11","related_ids":["vpt","voyager","dreamerv3","open-world","long-horizon-task","reward-function"],"name":"Minecraft 环境（MineDojo / MineRL）","alt":"Minecraft Environments (MineDojo / MineRL)","abbr":"","aliases":["我的世界环境","MineDojo","MineRL"],"one_liner":"基于游戏《我的世界》搭建的开放世界智能体训练与评测平台。","explanation":"《我的世界》（Minecraft）是开放世界沙盒游戏，任务链长、目标开放，常要多步合成物品，因此常被用作智能体的虚拟试验场。MineRL 由卡内基梅隆大学等团队 2019 年推出，提供 Gym 风格环境和 6000 多万个人类演示状态-动作对，并在 NeurIPS 办竞赛，经典任务是从零挖到钻石。MineDojo 由英伟达、加州理工、斯坦福等团队 2022 年发布，含数千个用语言描述的开放任务和由 73 万个 YouTube 视频、维基页面、Reddit 帖子组成的知识库，用视频-语言模型 MineCLIP 充当奖励函数，获 NeurIPS 2022 杰出论文奖。","example":"Voyager 让 GPT-4 在 MineDojo 环境里自动写代码、积累技能库，不断解锁新的工具和物品。","related":["VPT（视频预训练）","Voyager","DreamerV3","开放世界","长程任务","奖励函数"]},{"id":"gym-gymnasium-mujoco-tasks","category":"sim","sec":10,"tier":3,"sources":[{"title":"Gymnasium Documentation: MuJoCo environments","url":"https://gymnasium.farama.org/environments/mujoco/"},{"title":"Gymnasium Documentation: Half Cheetah","url":"https://gymnasium.farama.org/environments/mujoco/half_cheetah/"}],"as_of":"2026-09","related_ids":["mujoco","gymnasium","d4rl","soft-actor-critic","proximal-policy-optimization","deepmind-control-suite"],"name":"Gym MuJoCo 连续控制任务","alt":"Gym/Gymnasium MuJoCo Tasks (HalfCheetah, Hopper, Walker2d, Ant, Humanoid)","abbr":"","aliases":["Gymnasium MuJoCo 环境","MuJoCo 运动控制任务","HalfCheetah / Hopper / Walker2d"],"one_liner":"Gymnasium 里基于 MuJoCo 的一组经典连续控制环境，强化学习论文的常用考题。","explanation":"最早随 OpenAI Gym 发布、现由 Farama 基金会的 Gymnasium 维护的一组 MuJoCo 物理仿真环境，共 11 个，最常用的是 HalfCheetah（二维猎豹奔跑）、Hopper（单腿跳）、Walker2d（二维双足行走）、Ant（四足）和 Humanoid（人形）。动作是连续的关节力矩，奖励大致是「往前越快越好，减去动作能耗」，一回合最多 1000 步。SAC、TD3、PPO 等强化学习算法都拿它们报分，D4RL 离线数据集也基于其中几个。它们只考运动控制，不涉及视觉和真机细节，适合入门和对比算法。当前推荐 v5 版（需 mujoco≥2.3.3），不同版本的分数不能直接比。","example":"HalfCheetah-v5：动作是 6 个关节的力矩（6 维），观测是 17 维关节位置和速度；没有摔倒终止，跑满 1000 步截断，得分 = 前进速度奖励 − 控制代价。","related":["MuJoCo","Gymnasium","D4RL","软演员-评论家","近端策略优化","DeepMind 控制套件"]},{"id":"deepmind-control-suite","category":"sim","sec":10,"tier":3,"sources":[{"title":"DeepMind Control Suite (arXiv 1801.00690)","url":"https://arxiv.org/abs/1801.00690"},{"title":"google-deepmind/dm_control GitHub","url":"https://github.com/google-deepmind/dm_control"}],"as_of":"","related_ids":["reinforcement-learning","mujoco","benchmark","dreamerv3","td-mpc2","sample-efficiency"],"name":"DeepMind 控制套件","alt":"DeepMind Control Suite","abbr":"DMC","aliases":["dm_control","DM Control"],"one_liner":"DeepMind 基于 MuJoCo 的连续控制强化学习标准任务集","explanation":"DeepMind Control Suite 由 DeepMind 的 Yuval Tassa 等人于 2018 年发布，是开源库 dm_control 的一部分。它用 MuJoCo 物理引擎搭了一组连续控制任务，领域包括倒立摆小车（cartpole）、猎豹（cheetah）、平面双足步行者（walker）、人形（humanoid）、四足（quadruped）、机械手指（finger）等，每个领域下有难度不同的任务。所有任务结构统一、奖励可解释：每步奖励在 0 到 1 之间，一回合固定 1000 步，所以满分是 1000。输入既可以是关节状态，也可以只给相机像素，因此它成了测样本效率和「从像素学控制」的常用基准，Dreamer、DrQ、TD-MPC 等算法都在上面报结果。dm_control 还附带 MJCF 模型编辑、组件化搭环境和多智能体足球等工具。","example":"walker-walk 任务：让平面双足模型学会向前走，只给相机图像作输入，比较不同算法在相同交互步数下能拿到多高的回报（上限 1000）。","related":["强化学习","MuJoCo","基准测试","DreamerV3","TD-MPC2","样本效率"]},{"id":"d4rl","category":"sim","sec":10,"tier":3,"sources":[{"title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning (arXiv 2004.07219)","url":"https://arxiv.org/abs/2004.07219"},{"title":"Farama-Foundation/D4RL GitHub（已弃用，迁往 Minari）","url":"https://github.com/Farama-Foundation/D4RL"}],"as_of":"2026-09","related_ids":["offline-reinforcement-learning","benchmark","gym-gymnasium-mujoco-tasks","adroit","franka-kitchen","conservative-q-learning"],"name":"D4RL 离线强化学习基准","alt":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","abbr":"D4RL","aliases":["D4RL"],"one_liner":"离线强化学习领域最常用的标准数据集和评测基准","explanation":"D4RL 由 UC Berkeley 与 Google Brain 的 Justin Fu、Aviral Kumar、Ofir Nachum、George Tucker、Sergey Levine 于 2020 年发布。离线强化学习（只用事先收集好的数据训练策略，训练中不再和环境交互）当时缺少专门的测试数据，各家结果难以比较。D4RL 按「数据怎么来的」设计数据集：人工控制器轨迹、人类示范、多任务数据、多种策略混合的数据，覆盖 Maze2D 与 AntMaze 迷宫导航、Gym-MuJoCo 运动控制、Adroit 灵巧手、Franka Kitchen 厨房操作，以及 Flow 交通和 CARLA 驾驶。它提供归一化分数，方便跨任务比较。CQL、IQL 等离线 RL 算法论文普遍报告 D4RL 分数。原仓库已停止维护：环境迁到 Gymnasium-Robotics，数据迁到 Minari。","example":"halfcheetah-medium-v2：用一个训练到中等水平的策略采集的猎豹奔跑数据，离线算法只能从这批数据里学，最后用 get_normalized_score 报告归一化分数。","related":["离线强化学习","基准测试","Gym MuJoCo 连续控制任务","Adroit 灵巧手任务","Franka Kitchen","保守 Q 学习"]},{"id":"ogbench-benchmarking-offline-goal-conditioned-rl","category":"sim","sec":10,"tier":3,"sources":[{"title":"OGBench: Benchmarking Offline Goal-Conditioned RL (ICLR 2025)","url":"https://arxiv.org/abs/2410.20092"},{"title":"OGBench project page","url":"https://seohong.me/projects/ogbench/"},{"title":"GitHub: seohongpark/ogbench","url":"https://github.com/seohongpark/ogbench"}],"as_of":"","related_ids":["goal-conditioned-reinforcement-learning","offline-reinforcement-learning","d4rl","benchmark","implicit-q-learning","mujoco"],"name":"OGBench 离线目标条件强化学习基准","alt":"OGBench: Benchmarking Offline Goal-Conditioned RL","abbr":"OGBench","aliases":[],"one_liner":"专门考离线目标条件强化学习算法的基准，含 8 类环境、85 个数据集。","explanation":"OGBench 由 Seohong Park、Sergey Levine 等人提出，发表于 ICLR 2025。目标条件强化学习是让策略学会到达任意指定的目标状态；离线指只用固定数据集训练，不再与环境交互。作者认为旧基准上各算法成绩接近、难分高下，于是设计了迷宫导航、方块操作、拼图等 8 类环境和 85 个数据集，分别考察轨迹拼接（把多段不完整轨迹拼成新路线）、长程推理、图像输入和环境随机性，另有 410 个标准离线强化学习任务。它基于 MuJoCo 和 Gymnasium 接口，pip 即可安装，附 GCBC、GCIQL、HIQL 等 6 个参考算法实现。","example":"数据集 antmaze-large-navigate-v0：蚂蚁四足机器人在大型迷宫中，需从起点走到评测时指定的目标位置；多数环境各提供 5 个评测目标。","related":["目标条件强化学习","离线强化学习","D4RL","基准测试","隐式 Q 学习","MuJoCo"]},{"id":"legged-gym","category":"sim","sec":10,"tier":2,"sources":[{"title":"leggedrobotics/legged_gym (GitHub)","url":"https://github.com/leggedrobotics/legged_gym"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)","url":"https://arxiv.org/abs/2109.11978"},{"title":"unitreerobotics/unitree_rl_gym (GitHub)","url":"https://github.com/unitreerobotics/unitree_rl_gym"}],"as_of":"2026-09","related_ids":["isaac-gym","rsl-rl","terrain-curriculum","massively-parallel-reinforcement-learning","unitree-rl-gym","nvidia-isaac-lab"],"name":"legged_gym","alt":"legged_gym (Isaac Gym Environments for Legged Robots)","abbr":"","aliases":["Legged Gym"],"one_liner":"ETH 开源的足式机器人强化学习训练环境，基于 Isaac Gym。","explanation":"legged_gym 是苏黎世联邦理工机器人系统实验室（RSL，Nikita Rudin 等）开源的足式机器人强化学习代码库，配套 CoRL 2021 论文《Learning to Walk in Minutes…》。它在 Isaac Gym 上让一张显卡同时跑几千个机器人，用 PPO（近端策略优化）训练行走：论文里 ANYmal 在平地不到 4 分钟、崎岖地形约 20 分钟学会走。库里带着上真机要用的零件：执行器网络、摩擦和质量随机化、观测噪声、随机推搡，以及按表现自动加难度的地形课程；自带 ANYmal B/C、A1、Cassie。2024 年 1 月作者宣布迁往 Isaac Lab、原库只做有限维护，但宇树 unitree_rl_gym 等许多项目仍以它为骨架。","example":"宇树开源的 unitree_rl_gym 沿用 legged_gym 的结构，用 python legged_gym/scripts/train.py --task=g1 就能在 Isaac Gym 里训练 G1 人形机器人走路，再到 MuJoCo 里做 sim2sim 验证、部署真机。","related":["Isaac Gym","rsl_rl","地形课程","大规模并行强化学习","unitree_rl_gym","Isaac Lab"]},{"id":"unitree-rl-gym","category":"sim","sec":10,"tier":3,"sources":[{"title":"unitreerobotics/unitree_rl_gym GitHub 仓库","url":"https://github.com/unitreerobotics/unitree_rl_gym"},{"title":"unitreerobotics/unitree_rl_lab GitHub 仓库","url":"https://github.com/unitreerobotics/unitree_rl_lab"}],"as_of":"2026-09","related_ids":["legged-gym","isaac-gym","rsl-rl","sim-to-sim-transfer","unitree-g1","mujoco"],"name":"unitree_rl_gym","alt":"unitree_rl_gym (Unitree RL Gym)","abbr":"","aliases":["宇树 RL Gym","Unitree RL Gym"],"one_liner":"宇树官方开源的强化学习运控示例框架，覆盖仿真训练到真机部署。","explanation":"unitree_rl_gym 是宇树科技在 GitHub 开源的强化学习示例仓库，基于苏黎世联邦理工的 legged_gym（Isaac Gym 上的足式机器人训练框架）和 rsl_rl 算法库，支持 Go2 四足以及 H1、H1_2、G1 人形机器人。它把流程分成四步：在 Isaac Gym 里训练（Train），在仿真中回放检查（Play），把策略搬到 MuJoCo 里做仿真到仿真验证（Sim2Sim），最后部署到真机（Sim2Real）。仓库可导出 MLP 或 LSTM 策略网络，并为 G1 提供 C++ 部署示例。宇树另有一个基于 Isaac Lab（2.3 及以上）的 unitree_rl_lab 仓库，两者是不同项目。","example":"新手常见路径：用仓库的 train.py 指定 --task=g1 训练 G1 行走策略，play.py 回放并导出网络，放进 MuJoCo 确认不摔，再上真机。","related":["legged_gym","Isaac Gym","rsl_rl","仿真到仿真迁移","宇树 G1","MuJoCo"]},{"id":"robot-lab","category":"sim","sec":10,"tier":3,"sources":[{"title":"GitHub - fan-ziqi/robot_lab","url":"https://github.com/fan-ziqi/robot_lab"},{"title":"robot_lab Releases","url":"https://github.com/fan-ziqi/robot_lab/releases"}],"as_of":"2026-09","related_ids":["nvidia-isaac-lab","legged-gym","unitree-rl-gym","rsl-rl","rl-based-locomotion-control","massively-parallel-reinforcement-learning"],"name":"robot_lab（Isaac Lab 强化学习扩展库）","alt":"robot_lab (RL extension library based on Isaac Lab)","abbr":"","aliases":[],"one_liner":"基于 Isaac Lab 的开源库，内置多款四足、轮足和人形机器人的强化学习训练环境","explanation":"robot_lab 是开发者 Ziqi Fan 在 GitHub 上维护的开源项目（Apache 2.0 许可），定位是 Isaac Lab（英伟达基于 Isaac Sim 的机器人学习框架）的扩展库：不改 Isaac Lab 本体，而是在独立目录里放机器人模型和训练任务，方便单独开发。它内置 25 款以上机器人，覆盖 ANYmal D、宇树 Go2/A1/B2、云深处 Lite3 等四足，Go2W、B2W 等轮足，以及宇树 G1/H1、傅利叶 GR1、加速进化 T1 等人形。训练主要用 RSL-RL（ETH 开源的 PPO 实现），另有 AMP 动作模仿、BeyondMimic 动作跟踪等实验性功能。截至 2026 年 9 月，最新发布版为 v2.3.2，对应 Isaac Lab 2.3。适合想在 Isaac Lab 上直接训练现成机器人运动策略、不想从零写环境的新人。","example":"装好 Isaac Lab 后，直接选用 robot_lab 里宇树 Go2 的速度指令跟踪任务，在数千个并行环境中用 RSL-RL 训练行走策略，再导出策略做仿真到仿真验证或上真机。","related":["Isaac Lab","legged_gym","unitree_rl_gym","rsl_rl","强化学习运控","大规模并行强化学习"]},{"id":"humanoid-gym","category":"sim","sec":10,"tier":3,"sources":[{"title":"Humanoid-Gym (arXiv 2404.05695)","url":"https://arxiv.org/abs/2404.05695"},{"title":"roboterax/humanoid-gym (GitHub)","url":"https://github.com/roboterax/humanoid-gym"}],"as_of":"2024-04","related_ids":["legged-gym","isaac-gym","sim-to-sim-transfer","sim-to-real-transfer","robotera","rl-based-locomotion-control"],"name":"Humanoid-Gym","alt":"Humanoid-Gym: Reinforcement Learning for Humanoid Robot with Zero-Shot Sim2Real Transfer","abbr":"","aliases":["humanoid-gym"],"one_liner":"星动纪元开源的人形机器人强化学习行走训练框架，主打零样本仿真到真机。","explanation":"Humanoid-Gym 是星动纪元（RobotEra）团队 2024 年开源的强化学习框架，论文作者为 Xinyang Gu、Yen-Jen Wang 和陈建宇（清华叉院），收录于 ICRA 2024 敏捷机器人研讨会。它基于英伟达 Isaac Gym 大规模并行训练人形机器人的行走策略（算法为 PPO），代码借用了 legged_gym 和 rsl_rl。特色是提供从 Isaac Gym 到 MuJoCo 的 sim2sim 流程：换一个物理引擎再测一遍，能提前暴露只在单一仿真器里才成立的策略，提高上真机的成功率。作者在 1.2 米高的 XBot-S 和 1.65 米高的 XBot-L 两款人形机器人上验证了零样本迁移到真实环境。它也常被当作给其他人形机器人入门强化学习行走的起点。","example":"先在 Isaac Gym 里用 PPO 训练 XBot-L 的行走策略，再放进 MuJoCo 跑 sim2sim 检查是否依然稳定，通过后部署到真机。","related":["legged_gym","Isaac Gym","仿真到仿真迁移","仿真到现实迁移","星动纪元","强化学习运控"]},{"id":"protomotions","category":"sim","sec":10,"tier":3,"sources":[{"title":"NVlabs/ProtoMotions GitHub（ProtoMotions3）","url":"https://github.com/NVlabs/ProtoMotions"},{"title":"ProtoMotions 文档","url":"https://protomotions.github.io/"}],"as_of":"2026-09","related_ids":["motion-tracking","maskedmimic","perpetual-humanoid-control","amass","motion-retargeting","nvidia-isaac-lab"],"name":"ProtoMotions","alt":"ProtoMotions (NVIDIA GPU-accelerated humanoid simulation & learning framework)","abbr":"","aliases":["ProtoMotions3"],"one_liner":"英伟达开源的、用 GPU 仿真训练数字人和人形机器人运动技能的框架。","explanation":"英伟达研究院（NVlabs）开源的框架，GitHub 仓库 2024 年 9 月建立，现为第 3 版 ProtoMotions3，采用 Apache-2.0 许可，作者包括 Chen Tessler、Xue Bin Peng 等。它把「在物理仿真里训练会动的人形」这套流程模块化：后端可在 Isaac Gym、Isaac Lab、Newton、MuJoCo 之间切换，支持 SMPL 人体模型、宇树 H1_2 和 G1 等机器人；内置动作重定向（把人体动捕迁移到机器人骨架）、运动跟踪、MaskedMimic 生成式控制、地形行走等任务。README 称在 4 张 A100 上约 12 小时即可学会 AMASS 数据集（40 多小时人体动作）；用约 14.2 万条 BONES-SEED 动作训练的通用跟踪策略可零样本部署到 G1 真机，只需导出一个 ONNX 模型。它还支持一键换仿真器做 sim2sim 测试。","example":"把 AMASS 里的人类跑跳动作一键重定向到宇树 G1，在 Isaac Gym 里训练跟踪策略，切到 MuJoCo 里验证，再导出 ONNX 模型部署到真机。","related":["运动跟踪","MaskedMimic","PHC","AMASS 人体动捕数据集","动作重定向","Isaac Lab"]},{"id":"humanoidbench","category":"sim","sec":10,"tier":3,"sources":[{"title":"HumanoidBench (arXiv 2403.10506)","url":"https://arxiv.org/abs/2403.10506"},{"title":"HumanoidBench project page","url":"https://humanoid-bench.github.io/"},{"title":"Robotics: Science and Systems XX (2024) proceedings","url":"https://www.roboticsproceedings.org/rss20/p061.html"}],"as_of":"2024-07","related_ids":["humanoid-robot","unitree-h1","shadow-dexterous-hand","mujoco","whole-body-control","td-mpc2"],"name":"HumanoidBench","alt":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","abbr":"","aliases":["humanoid-bench"],"one_liner":"伯克利等推出的仿真人形机器人基准，含 27 个全身运动与操作任务。","explanation":"HumanoidBench 由 UC 伯克利和延世大学的研究者（Carmelo Sferrazza、Pieter Abbeel 等）提出，发表于 RSS 2024。人形机器人硬件贵、易损，算法研究难以大规模展开。它在 MuJoCo 中搭建了一台装有两只 Shadow 灵巧手的宇树 H1，设计 27 个全身控制任务：12 个运动类（走、跑、跨栏、爬行、上楼梯等）和 15 个操作类（开柜门、开门、推、投篮、插入等）。代码库还提供不带手的 H1、宇树 G1 等变体，以及 DreamerV3、TD-MPC2、SAC、PPO 基线。论文发现当时最强的强化学习算法在多数任务上表现不佳，而先学好走路、伸手等底层技能再做分层控制的方法表现更好。","example":"同一台带双手的 H1，既要完成 walk、hurdle、stair 等运动任务，也要完成 cabinet、door、basketball、insert 等操作任务，用同一套算法分别训练和打分。","related":["人形机器人","宇树 H1","Shadow 灵巧手","MuJoCo","全身控制","TD-MPC2"]},{"id":"locomujoco","category":"sim","sec":10,"tier":3,"sources":[{"title":"LocoMuJoCo: A Comprehensive Imitation Learning Benchmark for Locomotion (arXiv 2311.02496)","url":"https://arxiv.org/abs/2311.02496"},{"title":"loco-mujoco GitHub 仓库","url":"https://github.com/robfiras/loco-mujoco"}],"as_of":"2026-09","related_ids":["mujoco","mujoco-xla","imitation-learning","motion-retargeting","amass","adversarial-motion-priors"],"name":"LocoMuJoCo","alt":"LocoMuJoCo (Imitation Learning Benchmark for Whole-Body Locomotion)","abbr":"","aliases":[],"one_liner":"基于 MuJoCo 的全身运动模仿学习基准，含人形、四足和人体肌骨模型。","explanation":"LocoMuJoCo 是德国达姆施塔特工业大学 Jan Peters 课题组（Firas Al-Hafez 等）2023 年发布的开源基准，专门评测运动（locomotion）方向的模仿学习算法。此前的运动基准多是简化的玩具任务，它提供四足、人形机器人和人体肌骨模型，配套真实动捕数据、专家数据和次优数据。后续版本改用 JAX，支持 MJX 和 MuJoCo Warp 并行仿真；当前含 12 个人形和 4 个四足环境，把 AMASS、LAFAN1 等 2.2 万多条动捕数据重定向到各款人形上，附带 PPO、GAIL、AMP、DeepMimic 等基线和域随机化接口。","example":"用 ImitationFactory 创建宇树 H1 环境，载入 LAFAN1 中的跳舞、走路片段，再用自带的 AMP 算法训练策略模仿这些动作。","related":["MuJoCo","MJX","模仿学习","动作重定向","AMASS 人体动捕数据集","对抗运动先验"]},{"id":"mean-per-joint-position-error","category":"sim","sec":10,"tier":3,"sources":[{"title":"Perpetual Humanoid Control for Real-time Simulated Avatars (PHC, arXiv 2305.06456)","url":"https://arxiv.org/abs/2305.06456"},{"title":"A simple yet effective baseline for 3d human pose estimation (arXiv 1705.03098)","url":"https://arxiv.org/abs/1705.03098"},{"title":"Human3.6M Dataset","url":"http://vision.imar.ro/human3.6m/description.php"}],"as_of":"","related_ids":["motion-tracking","human-pose-estimation","motion-retargeting","perpetual-humanoid-control","asap","amass"],"name":"平均关节位置误差","alt":"Mean Per-Joint Position Error","abbr":"MPJPE","aliases":["平均每关节位置误差"],"one_liner":"预测关节位置与真值的平均距离，衡量姿态估计或动作跟踪有多准。","explanation":"MPJPE 原是 3D 人体姿态估计的标准指标，在 Human3.6M 等数据集上广泛使用：每一帧算出每个关节预测 3D 位置与真值之间的欧氏距离，再对所有关节和帧取平均，单位通常是毫米，越低越好。常见变体有三种：先把根节点（骨盆）对齐再算的根相对 MPJPE，只看局部姿态；不对齐直接算的全局 MPJPE（g-MPJPE），还能反映整体位置漂移；先做刚体对齐再算的 PA-MPJPE。到了人形机器人领域，PHC、ASAP 等运动跟踪工作用它衡量机器人在仿真或真机上复现参考动作的精度，通常和成功率、速度误差、加速度误差一起报告。","example":"PHC 在 AMASS 测试集上同时报告根相对 MPJPE 和全局 MPJPE（单位 mm），并把关节平均偏离参考动作超过 0.5 米记为跟踪失败。","related":["运动跟踪","人体姿态估计","动作重定向","PHC","ASAP","AMASS 人体动捕数据集"]},{"id":"furniturebench","category":"sim","sec":11,"tier":3,"sources":[{"title":"FurnitureBench project page","url":"https://clvrai.github.io/furniture-bench/"},{"title":"FurnitureBench (arXiv 2305.12821)","url":"https://arxiv.org/abs/2305.12821"}],"as_of":"2023-07","related_ids":["robotic-assembly","long-horizon-task","imitation-learning","offline-reinforcement-learning","factory-industreal","isaac-gym"],"name":"FurnitureBench","alt":"FurnitureBench: Reproducible Real-World Benchmark for Long-Horizon Complex Manipulation","abbr":"","aliases":["FurnitureSim","家具组装基准"],"one_liner":"KAIST 等提出的可复现真机家具组装基准，考长程、精细的机器人操作。","explanation":"FurnitureBench 由韩国 KAIST 的 CLVR 实验室和 UC 伯克利在 RSS 2023 发表，是一个可复现的真实世界家具组装基准。它使用 Franka Panda 机械臂和 Intel RealSense 相机，任务是组装 8 种家具：台灯、方桌、书桌、抽屉、柜子、圆桌、凳子和椅子，需要抓取、插入、拧紧等多步配合，属于长程、接触丰富的操作。为了让不同实验室搭出一致的环境，零件用 3D 打印、硬件选常见商品，并附搭建说明；作者还提供约 219.6 小时、5100 条遥操作演示，以及基于 Isaac Gym 和 Factory 的仿真版 FurnitureSim。对离线强化学习和模仿学习算法的评测显示，这类任务还有很大提升空间。","example":"把一条桌腿拧进桌面需要旋转约 540°，受手腕转角限制，机器人至少要做 5 次「转 90° 再松手重抓」的动作，这正是该基准难的地方之一。","related":["装配","长程任务","模仿学习","离线强化学习","Factory / IndustReal 接触丰富装配仿真","Isaac Gym"]},{"id":"autoeval","category":"sim","sec":11,"tier":3,"sources":[{"title":"AutoEval: Autonomous Evaluation of Generalist Robot Manipulation Policies in the Real World (arXiv 2503.24278)","url":"https://arxiv.org/abs/2503.24278"},{"title":"AutoEval project page","url":"https://auto-eval.github.io/"},{"title":"GitHub: zhouzypaul/auto_eval","url":"https://github.com/zhouzypaul/auto_eval"}],"as_of":"2025-09","related_ids":["real-world-evaluation","success-detector","bridgedata-v2","openvla","roboarena","sim-to-real-correlation"],"name":"AutoEval","alt":"AutoEval (Autonomous Evaluation of Generalist Robot Manipulation Policies in the Real World)","abbr":"","aliases":["自动真机评测","AutoEval 真机评测平台"],"one_liner":"伯克利搭建的全天候无人值守真机评测系统，自动判成败、自动复位。","explanation":"AutoEval 由伯克利 Sergey Levine 组的 Zhiyuan Zhou、Pranav Atreya 等人提出（其中一位作者同时隶属英伟达），2025 年 3 月上线 arXiv，代码仓库注明发表于 CoRL 2025。它把真机评测里最费人的两件事自动化：用微调过的 PaliGemma 视觉语言模型当成功检测器，回答「抽屉开了吗」这类问题；用几十条遥操作演示微调 OpenVLA（或回放录好的轨迹）作为复位策略，把场景恢复原状。用户像向计算集群提交作业一样，在网页上提交自己的策略服务器，系统在 WidowX 机械臂的 Bridge 场景里排队执行。论文报告：与人工评测的平均皮尔逊相关系数为 0.942，一个工位 24 小时约跑 850 个回合、只需 3 次人工介入，人工时间减少 99% 以上，并向社区开放了公共场景。","example":"研究者把自己的 VLA 策略部署成可公网访问的服务器，在 AutoEval 网页上提交「把茄子放进篮子」任务的评测，系统自动跑数十个回合后返回成功率报告。","related":["真机评测","成功检测器","BridgeData V2 数据集","OpenVLA","RoboArena","仿真-真机相关性"]},{"id":"roboarena","category":"sim","sec":11,"tier":2,"sources":[{"title":"RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies (arXiv 2506.18123)","url":"https://arxiv.org/abs/2506.18123"},{"title":"RoboArena project page","url":"https://robo-arena.github.io/"}],"as_of":"2025-11","related_ids":["double-blind-pairwise-comparison","elo-rating","real-world-evaluation","droid","progress-score","policy-server"],"name":"RoboArena","alt":"RoboArena","abbr":"","aliases":["Robo Arena","RoboArena 分布式真机评测"],"one_liner":"多个实验室分布式做真机双盲对比，再汇总成排名的通用机器人策略评测平台。","explanation":"RoboArena 是 2025 年 6 月发布的真机评测框架，由 Karl Pertsch、Chelsea Finn、Sergey Levine 等来自 7 所学术机构的研究者提出。它借鉴大模型评测里「竞技场」的做法：评测员在自己实验室里自由布置场景、下达任务，系统派来两个匿名策略在同一初始条件下各跑一次，评测员给出偏好、0–100 的进度分和文字理由；再用考虑任务难度的扩展 Bradley-Terry 模型把大量两两比较汇总成排名。策略以远程推理服务器形式接入，评测端只需机器人和网络。首轮统一用 DROID 平台（Franka 机械臂），论文报告其排名比单实验室固定任务的传统评测更接近穷举测试得到的参考排名。","example":"首轮评测比较了 π0-flow-DROID、π0-FAST-DROID 和 5 个基于 PaliGemma、动作表示各不相同的 DROID 策略，在 7 所机构累计完成 600 多组双盲成对对比。","related":["双盲成对比较","Elo 评分","真机评测","DROID 数据集","进度分数","策略服务器"]},{"id":"robochallenge","category":"sim","sec":11,"tier":2,"sources":[{"title":"RoboChallenge: Large-scale Real-robot Evaluation of Embodied Policies (arXiv 2510.17950)","url":"https://arxiv.org/abs/2510.17950"},{"title":"RoboChallenge 论文 HTML 全文","url":"https://arxiv.org/html/2510.17950"}],"as_of":"2025-10","related_ids":["real-world-evaluation","success-rate","progress-score","evaluation-protocol","dexmal","roboarena"],"name":"RoboChallenge","alt":"RoboChallenge","abbr":"","aliases":["Table30"],"one_liner":"原力灵机与 Hugging Face 办的真机在线评测平台，首个基准叫 Table30。","explanation":"RoboChallenge 是原力灵机（Dexmal）联合 Hugging Face 于 2025 年 10 月推出的真机评测系统。参评者不必交出模型权重，而是在自己机器上跑模型，通过接口远程操控平台上的真实机器人。首个基准 Table30 含 30 个桌面操作任务，考察精确三维定位、遮挡、依赖前序步骤等难点，机器人有 UR5、Franka Panda、Cobot Magic ALOHA 双臂和 ARX-5 四类。每个任务推演 10 次，报告成功率和按阶段计分的进度分数。它针对的是仿真分数不等于真机能力、各实验室真机条件不可比的问题。","example":"RoboChallenge 论文用 Table30 对比了 π0、π0.5、CogACT 和 OpenVLA 系列变体在单任务训练与通用训练两种设定下的表现。","related":["真机评测","成功率","进度分数","评测协议","原力灵机","RoboArena"]},{"id":"robodojo","category":"sim","sec":11,"tier":3,"sources":[{"title":"RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies (arXiv 2607.04434)","url":"https://arxiv.org/abs/2607.04434"},{"title":"RoboDojo-Benchmark/RoboDojo GitHub","url":"https://github.com/RoboDojo-Benchmark/RoboDojo"}],"as_of":"2026-09","related_ids":["robotwin","benchmark","simulation-based-evaluation","real-world-evaluation","robochallenge","pi0-5"],"name":"RoboDojo","alt":"RoboDojo (A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies)","abbr":"","aliases":["RoboDojo-RealEval"],"one_liner":"统一仿真与真机的通用操作策略评测基准，含 42 个仿真和 18 个真机任务。","explanation":"香港大学 MMLab 联合伯克利、清华、北大、斯坦福、MIT 等 18 家机构 2026 年 7 月发布并开源，一作为 Tianxing Chen。它针对已有基准任务偏简单、成绩容易刷满又缺真机验证的问题。仿真部分基于 Isaac Sim / Isaac Lab，在 ARX X5 双臂平台上设 42 个任务，覆盖泛化、记忆、精度、长程执行和开放指令五个维度，不同任务可异构并行运行；真机部分在 ARX X5、松灵 Piper 和 Piper X 三种平台上各设 6 个任务，用标准化硬件和远程云端评测系统 RoboDojo-RealEval 保证可复现。各家策略统一经 XPolicyLab 接口接入，首批评测 30 个：仿真最好的 Hy-Embodied-0.5-VLA 平均成功率仅 8.80%，真机最好的 π0.5 为 12.8%，人类专家分别为 76.03% 和 100%。排行榜由非营利组织维护并持续更新。","example":"把自己训练的 VLA 按 XPolicyLab 接口接入后，一条命令在 Isaac Sim 里跑完 42 个任务，再汇总成与排行榜同格式的成绩表。","related":["RoboTwin","基准测试","仿真评测","真机评测","RoboChallenge","π0.5"]},{"id":"robotarena-infinity","category":"sim","sec":11,"tier":3,"sources":[{"title":"arXiv 2510.23571 - RobotArena ∞: Scalable Robot Benchmarking via Real-to-Sim Translation","url":"https://arxiv.org/abs/2510.23571"},{"title":"RobotArena ∞ 论文 HTML 版","url":"https://arxiv.org/html/2510.23571"}],"as_of":"2026-03","related_ids":["simulation-based-evaluation","real-to-sim","double-blind-pairwise-comparison","elo-rating","digital-twin","roboarena"],"name":"RobotArena ∞","alt":"RobotArena Infinity (RobotArena ∞: Scalable Robot Benchmarking via Real-to-Sim Translation)","abbr":"","aliases":["RobotArena Infinity"],"one_liner":"把真实机器人视频自动转成仿真场景，再靠打分和人类投票给 VLA 排名的评测基准","explanation":"RobotArena ∞ 是卡内基梅隆大学 Katerina Fragkiadaki 组 2025 年 10 月发布的机器人策略评测框架。真机评测费人、慢、不安全且难复现，它的做法是把 BridgeData V2、DROID、RH20T 等公开数据集里的真实操作视频，借助物体分割、单图生成 3D、背景修补等生成模型，加上相机标定和系统辨识，自动转成 Genesis 仿真器里的数字孪生场景，再让不同的 VLA 模型在里面执行。打分有两路：视觉语言模型按帧给出任务进度分；众包评审双盲观看两段执行视频选出更好的一方，再用 Bradley-Terry 模型汇总成 Elo 式排名。它还会系统地换背景、改颜色、挪物体位置来测鲁棒性。论文评测了 Octo、CogACT、π0、X-VLA 等 6 个策略，收集了 8500 多对人类偏好。","example":"把 DROID 里一段真实桌面操作视频转成 Genesis 场景，让 π0 和 Octo 分别在其中执行同一指令，众包评审双盲比较两段回放后投票，结果计入排行榜；再把背景换掉重跑一遍，看排名是否变化。","related":["仿真评测","现实到仿真","双盲成对比较","Elo 评分","数字孪生","RoboArena"]},{"id":"neural-simulator","category":"sim","sec":11,"tier":2,"sources":[{"title":"Learning to Simulate Complex Physics with Graph Networks (arXiv 2002.09405)","url":"https://arxiv.org/abs/2002.09405"},{"title":"Learning Interactive Real-World Simulators (UniSim, arXiv 2310.06114)","url":"https://arxiv.org/abs/2310.06114"},{"title":"1X World Model","url":"https://www.1x.tech/discover/1x-world-model"}],"as_of":"","related_ids":["world-model","unisim","1x-world-model","world-model-based-policy-evaluation","physics-engine","learning-in-imagination"],"name":"神经模拟器","alt":"Neural Simulator (Learned Simulator)","abbr":"","aliases":["学习型模拟器","神经仿真器","世界模型仿真器","Learned Simulator"],"one_liner":"用神经网络从数据里学出来的模拟器，代替手写物理方程预测下一步。","explanation":"神经模拟器指用神经网络从数据中学会「当前状态加一个动作，接下来会怎样」的模拟器，和靠手写物理方程的物理引擎相对。一条路线学物理量，如 DeepMind 在 ICML 2020 提出的图网络模拟器 GNS，把流体、刚体、可变形材料当作粒子来预测运动。另一条路线直接在画面上学，本质是动作条件的视频世界模型：UniSim（2023）从互联网和机器人数据学出交互式模拟器，在里面训练的策略可零样本上真机；1X 在 2024 年 9 月用数千小时 EVE 机器人数据训练世界模型来评测策略。它能吸收布料这类难建模的真实复杂性，但物体会变形消失、物理不守恒，长推演误差会累积。常用于策略评测、生成数据和想象中学习。","example":"1X 世界模型：输入机器人起始画面和一串动作，生成之后的视频，据此比较不同版本策略谁更可能完成叠衣服、开门等任务。","related":["世界模型","UniSim","1X 世界模型","世界模型评测","物理引擎","想象中学习"]},{"id":"world-model-based-policy-evaluation","category":"sim","sec":11,"tier":2,"sources":[{"title":"Evaluating Gemini Robotics Policies in a Veo World Simulator (arXiv 2512.10675)","url":"https://arxiv.org/abs/2512.10675"},{"title":"WorldEval: World Model as Real-World Robot Policies Evaluator (arXiv 2505.19017)","url":"https://arxiv.org/abs/2505.19017"}],"as_of":"2026-07","related_ids":["world-model","veo-world-simulator","worldeval-world-model-as-real-world-robot-policies-evaluator","ctrl-world","sim-to-real-correlation","real-world-evaluation"],"name":"世界模型评测","alt":"World-Model-based Policy Evaluation","abbr":"","aliases":["世界模型当评估器","基于世界模型的策略评估","World Model as Policy Evaluator"],"one_liner":"用可交互的视频世界模型代替真机，闭环推演策略来估计它的表现。","explanation":"世界模型评测是把机器人策略接到一个以动作为条件的视频生成模型上闭环运行：策略看生成的画面输出动作，世界模型据此预测接下来的画面，如此循环，最后由人或视觉语言模型判断任务是否完成。它针对的是真机评测慢、贵、难复现，而传统仿真器搭场景费力、画面和物理又不够真的问题。2025 年起出现了 WorldEval、WorldGym、Ctrl-World 等工作；谷歌 DeepMind 用 Veo 视频模型评测 Gemini Robotics 策略，并以 1600 多次真机评测对照，显示它能预测不同策略的相对优劣，还能用于分布外泛化和安全红队测试。2026 年仍有新工作跟进，当前主要用来给检查点排序和筛查风险。","example":"谷歌 DeepMind 在 Veo 世界模拟器里给场景换上新物体、新背景和干扰物，比较 8 个 Gemini Robotics 策略检查点在 5 个双臂任务上的表现，再用真机结果验证排序是否一致。","related":["世界模型","Veo 世界模拟器","WorldEval","Ctrl-World","仿真-真机相关性","真机评测"]},{"id":"worldeval-world-model-as-real-world-robot-policies-evaluator","category":"sim","sec":11,"tier":3,"sources":[{"title":"WorldEval: World Model as Real-World Robot Policies Evaluator (arXiv 2505.19017)","url":"https://arxiv.org/abs/2505.19017"},{"title":"WorldEval 项目主页","url":"https://worldeval.github.io"},{"title":"dWorldEval (arXiv 2604.22152)","url":"https://arxiv.org/abs/2604.22152"}],"as_of":"2026-04","related_ids":["world-model-based-policy-evaluation","world-model","video-generation-model","latent-action","sim-to-real-correlation","ctrl-world"],"name":"WorldEval","alt":"WorldEval: World Model as Real-World Robot Policies Evaluator","abbr":"","aliases":["dWorldEval"],"one_liner":"用视频世界模型代替真机跑推演，给机器人策略打分和排名的评测方法。","explanation":"WorldEval 是美的集团与华东师范大学研究者 2025 年 5 月提出的机器人策略评测方法，用世界模型代替真机做评测。真机逐个测策略又慢又难复现。WorldEval 让策略在世界模型里闭环运行：策略看生成画面输出动作，世界模型据此生成下一段视频。为让视频严格跟着动作走，作者提出 Policy2Vec，让视频生成模型跟随潜在动作生成画面。实验显示它的排名与真机成绩高度相关，还能区分同一策略的不同检查点、拦下危险动作。2026 年 4 月的后续工作 dWorldEval 改用离散扩散世界模型，并用「进度 token」自动判断任务是否完成。","example":"上真机之前，先让几个候选策略（或同一策略的多个检查点）在 WorldEval 里跑一遍排序，再只把排名靠前的拿去真机验证。","related":["世界模型评测","世界模型","视频生成模型","潜在动作","仿真-真机相关性","Ctrl-World"]},{"id":"frechet-inception-distance","category":"sim","sec":11,"tier":2,"sources":[{"title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium (arXiv 1706.08500)","url":"https://arxiv.org/abs/1706.08500"},{"title":"Fréchet inception distance - Wikipedia","url":"https://en.wikipedia.org/wiki/Fr%C3%A9chet_inception_distance"}],"as_of":"","related_ids":["frechet-video-distance","peak-signal-to-noise-ratio-structural-similarity-index-learn","video-generation-model","world-model-based-policy-evaluation","generative-adversarial-network","generative-model"],"name":"弗雷歇初始距离","alt":"Fréchet Inception Distance","abbr":"FID","aliases":["弗雷歇 Inception 距离","FID 分数"],"one_liner":"衡量一批生成图像与真实图像在整体分布上有多接近的指标，越低越好。","explanation":"FID 由 Heusel 等人在 NeurIPS 2017 的论文中提出，用来评价 GAN 等生成模型的出图质量。做法是把一批真实图像和一批生成图像都送进预训练的 Inception v3（一个图像分类网络），取最后池化层的 2048 维特征，各自拟合成多元高斯分布，再算两个高斯之间的 Fréchet 距离。它比的是整体分布而非逐张像素，能同时反映画质和多样性，数值越低越好，0 表示完全一致。局限是依赖 Inception 特征，和人眼判断不总一致，样本太少时有偏差。它的视频版叫 FVD。具身领域评测世界模型、视频生成模型的生成画面时，常把 FID、FVD 和 PSNR 等一起报告。","example":"评测一个机器人视频世界模型时，拿它生成的若干帧操作画面和同场景真实录像帧各取数千张，送进 Inception v3 算 FID；分数越低，说明生成画面整体越像真实数据。","related":["弗雷歇视频距离","PSNR / SSIM / LPIPS 图像相似度指标","视频生成模型","世界模型评测","生成对抗网络","生成模型"]},{"id":"frechet-video-distance","category":"sim","sec":11,"tier":3,"sources":[{"title":"Towards Accurate Generative Models of Video: A New Metric & Challenges (arXiv 1812.01717)","url":"https://arxiv.org/abs/1812.01717"}],"as_of":"","related_ids":["frechet-inception-distance","video-generation-model","world-model","ewmbench","vbench-comprehensive-benchmark-suite-for-video-generative-mo","peak-signal-to-noise-ratio-structural-similarity-index-learn"],"name":"弗雷歇视频距离","alt":"Fréchet Video Distance","abbr":"FVD","aliases":["Frechet Video Distance"],"one_liner":"衡量一批生成视频与真实视频整体有多像的指标，数值越低越好。","explanation":"FVD 由约翰·开普勒大学、IDSIA 和谷歌大脑的研究者在 2018 年底提出，是图像指标 FID（弗雷歇初始距离）的视频版。做法是把真实视频和生成视频都送进在 Kinetics 动作识别数据集上预训练的 I3D 网络（一种 3D 卷积网络，能同时捕捉画面和时间变化）提取特征，各自拟合成多元高斯分布，再计算两个分布之间的弗雷歇距离。数值越低，说明生成视频在画质和时间连贯性上越接近真实视频；作者的人工评测显示它与人的主观判断相关性较好。它是视频生成和世界模型论文最常用的指标之一，但比较的是整体分布，不检查单条视频里物理是否合理、机器人动作是否正确，因此具身场景常配合 EWMBench 等专门基准使用。","example":"评测一个机器人视频世界模型时，把一批真实操作视频和模型从相同初始帧生成的视频分别过 I3D 提特征，算出的 FVD 越小，说明生成视频整体越像真的。","related":["弗雷歇初始距离","视频生成模型","世界模型","EWMBench 具身世界模型评测","VBench 视频生成评测基准","PSNR / SSIM / LPIPS 图像相似度指标"]},{"id":"peak-signal-to-noise-ratio-structural-similarity-index-learn","category":"sim","sec":11,"tier":3,"sources":[{"title":"The Unreasonable Effectiveness of Deep Features as a Perceptual Metric (LPIPS, CVPR 2018)","url":"https://arxiv.org/abs/1801.03924"},{"title":"Wikipedia: Structural similarity index measure","url":"https://en.wikipedia.org/wiki/Structural_similarity_index_measure"},{"title":"Wikipedia: Peak signal-to-noise ratio","url":"https://en.wikipedia.org/wiki/Peak_signal-to-noise_ratio"}],"as_of":"","related_ids":["novel-view-synthesis","3d-gaussian-splatting","world-model","frechet-video-distance","frechet-inception-distance","neural-radiance-fields"],"name":"PSNR / SSIM / LPIPS 图像相似度指标","alt":"Peak Signal-to-Noise Ratio / Structural Similarity Index / Learned Perceptual Image Patch Similarity","abbr":"PSNR / SSIM / LPIPS","aliases":["峰值信噪比","结构相似性","学习感知图像块相似度"],"one_liner":"衡量生成图和参考图有多像的三项常用指标，越往后越贴近人眼感受。","explanation":"三者都是把生成或重建的图像与参考图逐张比较。PSNR（峰值信噪比）由均方误差换算成分贝，8 位图像的常见值在 30–50 dB，越高越好，但只看逐像素差，与人眼感受的相关性较差。SSIM（结构相似性）由 Wang、Bovik 等人 2004 年发表，从亮度、对比度、结构三方面比较局部图块，最大为 1，越高越好。LPIPS 由 Zhang 等人在 CVPR 2018 提出，把两张图送入预训练深度网络，比较中间层特征的差异，越低越好，与人类感知判断更一致。在具身智能里，它们常用来评估新视角合成、高斯泼溅重建和世界模型预测的画面，但分数高不代表物理上合理。","example":"3D 高斯泼溅论文在 Mip-NeRF360 数据集上报告 PSNR 27.21、SSIM 0.815、LPIPS 0.214，画质与当时最好的 Mip-NeRF360 方法相当。","related":["新视角合成","3D高斯泼溅","世界模型","弗雷歇视频距离","弗雷歇初始距离","神经辐射场"]},{"id":"vbench-comprehensive-benchmark-suite-for-video-generative-mo","category":"sim","sec":11,"tier":3,"sources":[{"title":"VBench: Comprehensive Benchmark Suite for Video Generative Models (arXiv 2311.17982)","url":"https://arxiv.org/abs/2311.17982"},{"title":"Vchitect/VBench GitHub 仓库","url":"https://github.com/Vchitect/VBench"}],"as_of":"2025-03","related_ids":["video-generation-model","world-model","frechet-video-distance","physics-iq","worldscore-a-unified-evaluation-benchmark-for-world-generati","ewmbench"],"name":"VBench 视频生成评测基准","alt":"VBench: Comprehensive Benchmark Suite for Video Generative Models","abbr":"","aliases":["VBench","VBench++","VBench-2.0"],"one_liner":"把视频生成质量拆成 16 个维度分别打分的开源评测基准。","explanation":"VBench 由南洋理工大学与上海人工智能实验室等机构的团队提出（第一作者 Ziqi Huang），2023 年 11 月发布，入选 CVPR 2024 Highlight。它不给一个笼统的总分，而是把文生视频质量拆成 16 个维度，如主体一致性、背景一致性、时间闪烁、运动平滑度、动态程度、美学质量、物体类别、空间关系等，每个维度配专门的提示词和自动评估方法，并用人类偏好标注检验打分是否和人的判断一致。后续的 VBench++ 扩展到图生视频、长视频和可信度评测；2025 年 3 月的 VBench-2.0 转向常识推理、物理真实性、人体动作等「内在忠实度」。具身领域评估视频世界模型时，常借用它的部分指标。","example":"评估一个用来生成机器人训练视频的模型时，可以用 VBench 的主体一致性和运动平滑度检查机械臂在视频中途有没有变形、抖动；动作是否符合物理，还要用 Physics-IQ 这类专门基准。","related":["视频生成模型","世界模型","弗雷歇视频距离","Physics-IQ 物理理解基准","WorldScore 世界生成评测","EWMBench 具身世界模型评测"]},{"id":"worldscore-a-unified-evaluation-benchmark-for-world-generati","category":"sim","sec":11,"tier":3,"sources":[{"title":"WorldScore (arXiv 2504.00983, ICCV 2025)","url":"https://arxiv.org/abs/2504.00983"},{"title":"WorldScore 项目主页","url":"https://haoyi-duan.github.io/WorldScore/"}],"as_of":"2025-11","related_ids":["world-model","video-generation-model","4d-world-model","marble","worldarena-a-unified-benchmark-for-evaluating-perception-and","vbench-comprehensive-benchmark-suite-for-video-generative-mo"],"name":"WorldScore 世界生成评测","alt":"WorldScore: A Unified Evaluation Benchmark for World Generation","abbr":"","aliases":["WorldScore"],"one_liner":"斯坦福的世界生成统一评测，让 3D、4D 场景生成和视频模型用同一把尺子比。","explanation":"WorldScore 是斯坦福李飞飞、吴佳俊团队 2025 年 4 月发布的世界生成评测基准，收录于 ICCV 2025。世界生成指从图片或文字生成一个可沿相机路径探索的场景；此前 3D、4D 场景生成和视频生成模型各测各的，无法横比。WorldScore 把任务统一拆成一连串「下一个场景生成」，每步用相机轨迹指定布局，数据集含 3000 个样例。指标分可控性（相机、物体、内容对齐）、质量（3D 一致性、光度与风格一致性、主观质量）、动态（运动准确度、幅度、平滑度）三类，汇总为 WorldScore-Static 和 WorldScore-Dynamic 两个总分。","example":"论文用同一套样例评测了 3D 场景生成、4D 场景生成、图生视频、文生视频四类共 19 个开源和闭源模型，并维护公开排行榜。","related":["世界模型","视频生成模型","4D 世界模型","Marble（World Labs）","WorldArena 具身世界模型基准","VBench 视频生成评测基准"]},{"id":"physics-iq","category":"sim","sec":11,"tier":3,"sources":[{"title":"Do generative video models understand physical principles? (arXiv 2501.09038)","url":"https://arxiv.org/abs/2501.09038"},{"title":"Physics-IQ benchmark GitHub（含 Original / Verified 排行榜）","url":"https://github.com/google-deepmind/physics-IQ-benchmark"},{"title":"Physics-IQ 项目主页","url":"https://physics-iq.github.io/"}],"as_of":"2026-09","related_ids":["intuitive-physics","video-generation-model","world-model","vbench-comprehensive-benchmark-suite-for-video-generative-mo","sora","worldscore-a-unified-evaluation-benchmark-for-world-generati"],"name":"Physics-IQ 物理理解基准","alt":"Physics-IQ (Do generative video models understand physical principles?)","abbr":"","aliases":["Physics-IQ Benchmark","Physics-IQ Verified（改进版）"],"one_liner":"用真实拍摄的视频检验视频生成模型是否真懂物理规律的基准。","explanation":"由 INSAIT（保加利亚索非亚大学）与 Google DeepMind 的研究者 2025 年 1 月发布，论文收录于 WACV 2026。视频全部实拍：66 个物理场景，每个用 3 个机位各拍 2 遍，共 396 段 8 秒视频，涵盖固体力学、流体、光学、热学和磁学。测试时只给模型开头（图生视频模型给 1 帧，视频续写模型给 3 秒），让它续写后 5 秒，再用空间 IoU（交并比，看「动的位置」对不对）、时空 IoU、加权空间 IoU 和均方误差与真实视频比对，合成 Physics-IQ 分数；同一场景两次实拍之间的差异记为 100%。原论文中 Sora 只得 10%，结论是「画面逼真不等于懂物理」。它常被用来检验视频模型能否充当世界模型；2026 年又推出改进提示词和指标的 Physics-IQ Verified 版，排行榜持续更新。","example":"给模型看多米诺骨牌第一块刚被推倒、还没碰到第二块的画面，让它续写后面 5 秒，看骨牌是否按顺序依次倒下，并与实拍视频逐像素比对。","related":["直觉物理","视频生成模型","世界模型","VBench 视频生成评测基准","Sora（视频生成即世界模拟器）","WorldScore 世界生成评测"]},{"id":"ewmbench","category":"sim","sec":11,"tier":3,"sources":[{"title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models (arXiv 2505.09694)","url":"https://arxiv.org/abs/2505.09694"}],"as_of":"2025-05","related_ids":["world-model","video-generation-model","frechet-video-distance","vbench-comprehensive-benchmark-suite-for-video-generative-mo","worldarena-a-unified-benchmark-for-evaluating-perception-and","agibot-world"],"name":"EWMBench 具身世界模型评测","alt":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","abbr":"","aliases":["EWMBench","具身世界模型基准"],"one_liner":"智元等提出的基准，专门评测机器人操作视频生成模型生成得对不对。","explanation":"EWMBench 是智元机器人联合上海交大、港中文 MMLab、哈工大在 2025 年 5 月发布的评测基准，评测对象是具身世界模型，即给定初始画面和任务指令、生成机器人操作视频的模型。作者认为 FVD（弗雷歇视频距离）、VBench 这类指标主要看画面质量，看不出机械臂动作是否合理，于是从三个维度打分：场景一致性（用在具身数据上微调过的 DINOv2 比较帧间特征）、运动正确性（末端轨迹与真值的豪斯多夫距离、归一化动态时间规整，以及速度和加速度分布）、语义对齐（用多模态大模型给生成视频写描述、查逻辑错误，再与真值对比）。测试数据取自 AgiBot World 的 10 个任务，数据集和评测代码已在 GitHub 开源。","example":"论文用它比较了 OpenSora 2.0、LTX、COSMOS-7B、Kling-1.6、海螺、EnerVerse 等 7 个模型，结论是现有视频生成模型用在具身任务上仍有明显短板。","related":["世界模型","视频生成模型","弗雷歇视频距离","VBench 视频生成评测基准","WorldArena 具身世界模型基准","AgiBot World 数据集"]},{"id":"worldarena-a-unified-benchmark-for-evaluating-perception-and","category":"sim","sec":11,"tier":3,"sources":[{"title":"WorldArena (arXiv 2602.08971)","url":"https://arxiv.org/abs/2602.08971"},{"title":"WorldArena 2.0 (arXiv 2605.17912)","url":"https://arxiv.org/abs/2605.17912"}],"as_of":"2026-05","related_ids":["world-model","world-model-based-policy-evaluation","ewmbench","robotwin","ctrl-world","worldscore-a-unified-evaluation-benchmark-for-world-generati"],"name":"WorldArena 具身世界模型基准","alt":"WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models","abbr":"","aliases":["WorldArena","WorldArena 2.0"],"one_liner":"清华牵头的具身世界模型基准，同时考生成画面质量和对下游任务的实际用处。","explanation":"WorldArena 是清华大学牵头、多家机构参与、2026 年 2 月发布的具身世界模型评测基准。具身世界模型指根据当前画面和动作或指令预测未来画面的模型。作者认为已有评测只看视频好不好看，不问它能否帮到决策，于是从三方面打分：视频质量（6 个子维度共 16 项指标）、具身任务功能（把世界模型当数据引擎、策略评估器和动作规划器来检验）、人工评估，汇总成综合分 EWMScore。基于 RoboTwin 2.0 双臂任务评测 14 个模型后，作者发现画面好不等于任务强。2026 年 5 月的 2.0 版加入了视触觉和真机平台。","example":"第一版评测了 Wan 2.2、Veo 3.1 等通用视频模型，以及 Cosmos-Predict 2.5、Genie Envisioner、Ctrl-World 等具身世界模型，排行榜公开在 world-arena.ai。","related":["世界模型","世界模型评测","EWMBench 具身世界模型评测","RoboTwin","Ctrl-World","WorldScore 世界生成评测"]},{"id":"demonstration-data","category":"data","sec":0,"tier":1,"sources":[{"title":"ALOHA: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","url":"https://tonyzhaozh.github.io/aloha/"},{"title":"Zhao et al. 2023: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"},{"title":"LeRobot Docs: Imitation Learning on Real-World Robots","url":"https://huggingface.co/docs/lerobot/il_robots"}],"as_of":"","related_ids":["imitation-learning","behavior-cloning","teleoperation","observation-action-pair","episode","real-robot-data"],"name":"演示数据","alt":"Demonstration Data","abbr":"","aliases":["演示","示教数据","示教","专家演示","Expert Demonstration","demo 数据"],"one_liner":"人示范完成任务时录下的观测与动作序列，供机器人模仿学习。","explanation":"演示数据是模仿学习的原料：人通过遥操作、拖动示教或手持采集设备把任务做一遍，系统按固定频率记录每一帧的观测（相机画面、关节角等本体状态）和对应动作，一次从头到尾的示范存成一条轨迹，数据集里通常叫一个回合（episode）；机器人自己执行时录下的回合则不算演示。策略网络学的就是「看到这种观测时该做这个动作」。质量直接决定效果：动作是否一致、相机是否固定、物体是否始终入镜都有影响。单个任务几十条就能训出可用策略，通用 VLA（视觉-语言-动作）模型则需要成千上万小时、覆盖多任务多场景的演示做预训练。","example":"ALOHA 论文中多数双臂任务只采 50 条演示（每个任务约 10–20 分钟数据），用 ACT 算法训练后，把电池插进遥控器的任务成功率达 96%；LeRobot 教程建议入门抓取任务至少录 50 条。","related":["模仿学习","行为克隆","遥操作","观测-动作对","回合","真机数据"]},{"id":"observation-action-pair","category":"data","sec":0,"tier":2,"sources":[{"title":"LeRobotDataset v3.0 (Hugging Face LeRobot docs)","url":"https://huggingface.co/docs/lerobot/lerobot-dataset-v3"},{"title":"google-research/rlds (GitHub)","url":"https://github.com/google-research/rlds"}],"as_of":"","related_ids":["observation","action-label","behavior-cloning","trajectory","demonstration-data","compounding-error"],"name":"观测-动作对","alt":"Observation-Action Pair","abbr":"","aliases":["状态-动作对","State-Action Pair"],"one_liner":"某一时刻机器人「看到了什么」和「接着做了什么」配成的一条训练样本。","explanation":"模仿学习数据的最小单位。每个时间步记一份观测 o（相机图像、关节角等本体状态，常附语言指令）和这一刻执行的动作 a（目标关节角、末端位移或夹爪开合），一条演示轨迹就是按时间排好的一串 (o, a)。行为克隆把它当监督学习来做：输入 o，预测 a。严格讲，「状态」是环境的完整描述，「观测」只是传感器看得到的那部分，真机上一般只有观测。这些样本前后相关，策略一旦走偏就会遇到训练里没见过的观测，误差越积越大，这就是复合误差。LeRobot 数据集每一帧的 observation.state、observation.images 和 action 就是这种结构。","example":"用 LeRobot 以每秒 30 帧录一条 SO-101 抓方块的演示，每一帧都存下相机画面、从臂的关节读数，以及主臂此刻给出的目标关节角作为动作。","related":["观测","动作标签","行为克隆","轨迹","演示数据","复合误差"]},{"id":"action-label","category":"data","sec":0,"tier":2,"sources":[{"title":"Baker et al. 2022: Video PreTraining (VPT) (arXiv 2206.11795)","url":"https://arxiv.org/abs/2206.11795"},{"title":"Open X-Embodiment 项目页","url":"https://robotics-transformer-x.github.io/"},{"title":"Ye et al. 2024: Latent Action Pretraining from Videos (LAPA)","url":"https://arxiv.org/abs/2410.11758"}],"as_of":"","related_ids":["observation-action-pair","behavior-cloning","action-space","pseudo-action-labels","inverse-dynamics-model","action-free-video"],"name":"动作标签","alt":"Action Label","abbr":"","aliases":["动作标注","Action Annotation"],"one_liner":"数据里每一时刻机器人执行的动作值，是模仿学习要拟合的「答案」。","explanation":"动作标签是机器人数据中与每帧观测对齐的动作值，比如末端的位移和旋转、关节目标角度、夹爪开合。遥操作时由系统直接记录，UMI 这类手持采集则靠 SLAM 等算法事后还原。行为克隆把观测当输入、动作标签当监督信号，所以标签的频率、坐标系、是绝对量还是增量，都会直接影响模型学到什么；RT-1-X 等模型把各家数据统一成 7 维动作（位置 3 维、旋转 3 维、夹爪 1 维）。动作标签只能在机器人或专门设备上采到，这是机器人数据贵的主要原因，于是有了用逆动力学模型给视频补伪动作标签、或学潜在动作的做法。","example":"OpenAI 的 VPT 先用承包商录制的 1962 小时带键鼠操作记录的 Minecraft 数据训练逆动力学模型，再用它给约 7 万小时网络视频补上伪动作标签，最终训练出能做出钻石工具的智能体。","related":["观测-动作对","行为克隆","动作空间","伪动作标签","逆动力学模型","无动作标签视频"]},{"id":"multimodal-data","category":"data","sec":0,"tier":2,"sources":[{"title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation (arXiv HTML)","url":"https://arxiv.org/html/2412.13877v3"},{"title":"RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence","url":"https://arxiv.org/abs/2512.24653"}],"as_of":"2025-12","related_ids":["multimodal-fusion","tactile-data","proprioception","multi-sensor-time-synchronization-timestamp-alignment","hierarchical-data-format-version-5","robomind"],"name":"多模态数据","alt":"Multimodal Data","abbr":"","aliases":["全模态数据","Omni-modal Data"],"one_liner":"同一时刻同步记录的图像、深度、关节状态、力触觉、语言等多路信号。","explanation":"在具身智能里，多模态数据指机器人干活时同步采下的多路信号：多视角 RGB 图像、深度图、本体感知（关节角、末端位姿等机器人自身状态）、力或触觉读数、语言指令，有时还有声音。只靠相机看不到被手挡住的接触点，也看不出用了多大力，所以精细操作往往要把视觉之外的信号一起记下。以北京人形机器人创新中心和北大的 RoboMIND 为例，每条轨迹存成一个 HDF5 文件，里面有多视角 RGB-D、本体状态、末端状态和遥操作者的身体状态；RoboMIND 2.0 又加了 1.2 万条带触觉的片段。难点在各路信号的时间同步、存储体积，以及某一路缺失时怎么训练。","example":"RoboMIND 2.0 的触觉增强片段里，同一时刻既有多视角 RGB-D 画面和关节状态，也有他山触觉传感器测到的法向力与切向力。","related":["多模态融合","触觉数据","本体感知","多传感器时间同步（时间戳对齐）","HDF5 格式","RoboMIND 数据集"]},{"id":"tactile-data","category":"data","sec":0,"tier":2,"sources":[{"title":"Sparsh: Self-supervised Touch Representations for Vision-based Tactile Sensing","url":"https://arxiv.org/abs/2410.24090"},{"title":"Touch and Go: Learning from Human-Collected Vision and Touch","url":"https://arxiv.org/abs/2211.12498"},{"title":"RoboMIND 2.0 (arXiv HTML)","url":"https://arxiv.org/html/2512.24653v1"}],"as_of":"2025-12","related_ids":["tactile-sensor","vision-based-tactile-sensor","tactile-representation-learning","visuo-tactile-fusion","multimodal-data","slip-detection"],"name":"触觉数据","alt":"Tactile Data","abbr":"","aliases":["视触觉数据","Visuo-tactile Data"],"one_liner":"触觉传感器在接触物体时记下的压力、剪切力、接触面形变等信号。","explanation":"触觉数据来自装在指尖、掌心或夹爪上的触觉传感器，记录接触位置、法向力（压下去的力）、切向力（剪切力，和打滑有关）以及接触面的形变。按原理大致两类：视触觉传感器（如 GelSight、DIGIT）用内置相机拍弹性胶面的变形，输出像照片一样的触觉图像；压阻、电容、磁性等阵列式传感器输出每个触觉单元的数值。手挡住视线或需要控制力度时（插孔、拧瓶盖、拿易碎物），触觉能给出相机给不了的信息。难点是传感器型号多、数据不通用，力和打滑的真值又难标注，所以 Meta 的 Sparsh 用 46 万多张无标注触觉图像做自监督预训练。RoboMIND 2.0 等数据集已把触觉与视觉、关节状态同步记录。","example":"用装了 GelSight 的夹爪捏一颗草莓，触觉图像上接触面积的大小和标记点的位移，能反映捏得多紧、有没有开始打滑。","related":["触觉传感器","视触觉传感器","触觉表征学习","视触觉融合","多模态数据","滑移检测"]},{"id":"multi-sensor-time-synchronization-timestamp-alignment","category":"data","sec":0,"tier":2,"sources":[{"title":"Universal Manipulation Interface (arXiv 2402.10329, HTML)","url":"https://arxiv.org/html/2402.10329"},{"title":"Wikipedia: Precision Time Protocol","url":"https://en.wikipedia.org/wiki/Precision_Time_Protocol"},{"title":"ros2/message_filters 文档","url":"https://raw.githubusercontent.com/ros2/message_filters/rolling/doc/index.rst"}],"as_of":"","related_ids":["precision-time-protocol","multi-sensor-fusion","camera-imu-calibration","observation-action-pair","ros-bag","control-latency"],"name":"多传感器时间同步（时间戳对齐）","alt":"Multi-sensor Time Synchronization / Timestamp Alignment","abbr":"","aliases":["时间戳对齐","时间同步","硬件同步","Time Sync"],"one_liner":"让相机、编码器、IMU 等各路信号对齐到同一时间轴，保证同一时刻的数据配成对。","explanation":"机器人上的相机、关节编码器、力传感器、IMU 各自以不同频率工作，延迟也不同，相机因曝光、编码和传输，延迟通常比关节读数大。时间同步就是把这些数据放到同一条时间轴上：硬件上可以用同一触发信号让多台相机同时曝光，或用精确时间协议（PTP，IEEE 1588）把设备时钟对齐到亚微秒级；软件上按时间戳把最接近的消息配对，如 ROS 的 message_filters 提供精确匹配和近似匹配两种策略。对模仿学习来说，对不齐意味着模型学到的是错位的观测-动作对。","example":"UMI 先分别测出相机、夹爪宽度等各路数据流的延迟，把所有观测对齐到延迟最大的那一路（通常是相机）；部署时再把动作指令提前发出，抵消执行延迟。","related":["精确时间协议","多传感器融合","相机-IMU联合标定","观测-动作对","rosbag","控制延迟"]},{"id":"real-robot-data","category":"data","sec":0,"tier":1,"sources":[{"title":"DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset","url":"https://droid-dataset.github.io/"},{"title":"AgiBot World Colosseo (arXiv 2503.06669)","url":"https://arxiv.org/abs/2503.06669"}],"as_of":"2025-03","related_ids":["teleoperation","simulation-data","data-pyramid","droid","agibot-world","real-robot-data-camp-vs-sim-data-camp"],"name":"真机数据","alt":"Real-Robot Data","abbr":"","aliases":["真机采集","本体采集","本体数据","真实机器人数据","真机采集（本体采集）","Real-World Robot Data"],"one_liner":"用真实机器人在物理世界里实际操作时采到的数据。","explanation":"真机数据指真实机器人本体在物理世界执行任务时记录的数据，包括相机画面、关节状态和动作指令，通常靠遥操作采集，也包括机器人自主执行时回收的数据。它没有虚实差距（仿真与现实在物理和画面上的差异），动作能直接在同型号机器人上复现，被普遍认为质量最高。缺点是贵且慢：要买机器人、搭场景、雇数采员一条条采。业界常用「数据金字塔」来描述：底层是海量互联网和人类视频，中间是仿真与合成数据，顶端是少而精的真机数据。代表数据集有 DROID、AgiBot World 和 Open X-Embodiment。","example":"DROID 由 13 家机构的 50 名采集员用 Quest 2 头显遥控 Franka 机械臂，花 12 个月采了 7.6 万条轨迹、共 350 小时，覆盖 564 个场景。","related":["遥操作","仿真数据","数据金字塔","DROID 数据集","AgiBot World 数据集","真机派 / 仿真派"]},{"id":"data-scarcity","category":"data","sec":0,"tier":2,"sources":[{"title":"UC Berkeley CDSS: Humanoid robots face challenges in gaining real-world skills","url":"https://cdss.berkeley.edu/news/humanoid-robots-face-challenges-gaining-real-world-skills-says-berkeley-expert"},{"title":"Rockingrobots: Humanoid robots are advancing but face a massive data gap","url":"https://www.rockingrobots.com/humanoid-robots-are-advancing-but-face-a-massive-data-gap"},{"title":"钛媒体：机器人还没学会做家务，卖数据的已经先赚到了钱","url":"https://www.tmtpost.com/8062934.html"}],"as_of":"2026-07","related_ids":["data-pyramid","simulation-data","synthetic-data","human-video-data","data-flywheel","teleoperation"],"name":"数据荒","alt":"Data Scarcity","abbr":"","aliases":["数据稀缺","数据瓶颈","数据鸿沟","Data Gap"],"one_liner":"机器人能用的真实交互数据远少于所需，是具身智能的核心瓶颈。","explanation":"数据荒指具身智能缺少足够的高质量训练数据。大语言模型能用整个互联网的文本，机器人需要的却是动作、关节角、力和触觉这类「怎么动手」的数据，网上几乎没有，只能靠遥操作、穿戴设备一条条采，成本高、速度慢，不同机器人之间的数据还不容易通用。伯克利教授 Ken Goldberg 2025 年 8 月在 Science Robotics 撰文指出，大模型训练所用文本相当于一个人读 10 万年，机器人与之相比存在「10 万年数据鸿沟」。应对思路包括：扩大真机采集、用仿真和生成模型造数据、从人类视频中学习、跨本体共享数据，以及让机器人在部署中边干边积累数据。","example":"据钛媒体 2026 年 7 月报道，觅蜂科技 CEO 估算具身智能要达到 GPT-3.5 级别需约一亿小时训练数据，而截至 2026 年初，全球可用的高质量真实物理交互数据只有几十万小时。","related":["数据金字塔","仿真数据","合成数据","人类视频数据","数据飞轮","遥操作"]},{"id":"simulation-data","category":"data","sec":0,"tier":1,"sources":[{"title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","url":"https://pku-epic.github.io/GraspVLA-web/"},{"title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","url":"https://mimicgen.github.io/"}],"as_of":"2025","related_ids":["simulator","synthetic-data","sim-to-real-gap","domain-randomization","sim-to-real-transfer","syngrasp-1b"],"name":"仿真数据","alt":"Simulation Data","abbr":"","aliases":["仿真合成数据","sim 数据","Sim Data"],"one_liner":"在物理仿真器里让虚拟机器人执行任务而自动生成的训练数据。","explanation":"仿真数据是在 Isaac Sim、MuJoCo 等物理仿真器中生成的数据：场景、物体和机器人都是虚拟的，由脚本、运动规划器或强化学习策略自动完成任务，同时记录图像、深度、关节状态和动作。好处是便宜、能大规模并行、自带精确标注，还能随机改变光照、材质和物体位置（域随机化），覆盖真机难采的长尾情况。主要障碍是虚实差距：仿真里的接触物理和渲染画面与现实不完全一致，柔性物体和精细接触尤其难。常见做法是先用仿真数据大规模预训练，再用少量真机数据微调，或两者混合协同训练。","example":"银河通用等团队的 GraspVLA 以仿真生成的十亿帧抓取数据集 SynGrasp-1B（1 万多个物体、240 个类别）作为全部动作数据，再配合互联网图文定位数据联合预训练，不用任何真机数据就能零样本迁移到真实环境做抓取。","related":["仿真器","合成数据","虚实差距","域随机化","仿真到现实迁移","SynGrasp-1B 数据集"]},{"id":"synthetic-data","category":"data","sec":0,"tier":1,"sources":[{"title":"NVIDIA Glossary: What Is Synthetic Data Generation?","url":"https://www.nvidia.com/en-us/glossary/synthetic-data-generation/"},{"title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","url":"https://mimicgen.github.io/"},{"title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models (NVIDIA GEAR)","url":"https://research.nvidia.com/labs/gear/dreamgen/"}],"as_of":"2025-05","related_ids":["simulation-data","mimicgen","dreamgen","neural-trajectories","pseudo-action-labels","generative-data-augmentation"],"name":"合成数据","alt":"Synthetic Data","abbr":"","aliases":["生成数据","合成训练数据","Synthetic Data Generation"],"one_liner":"不靠真实采集、用仿真或生成模型造出来的训练数据。","explanation":"合成数据是计算机生成而非真实采集的数据，英伟达的定义是用计算机仿真、生成式 AI 模型或两者结合生成的文本、图像和视频。在具身智能里主要有三条路：在仿真器里渲染和执行任务（即仿真数据）；把少量人工示范自动变换、扩增成大量新示范，如 MimicGen；用视频生成模型或世界模型直接生成机器人干活的视频，再用逆动力学模型（根据前后画面推算动作的模型）补上伪动作标签，如英伟达的 DreamGen。它能缓解真机数据稀缺，但生成内容是否物理合理、是否贴近真实分布，最终要靠真机评测检验。","example":"MimicGen 从不到 200 条人工示范自动生成 5 万多条示范，覆盖 18 个任务；DreamGen 只用一个抓放任务的遥操作数据，就让人形机器人在 10 个新环境里学会 22 种新动作。","related":["仿真数据","MimicGen","DreamGen（GR00T Dreams）","神经轨迹","伪动作标签","生成式数据增强"]},{"id":"human-video-data","category":"data","sec":0,"tier":1,"sources":[{"title":"EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data (NVIDIA GEAR)","url":"https://research.nvidia.com/labs/gear/egoscale/"},{"title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video (arXiv 2505.11709)","url":"https://arxiv.org/abs/2505.11709"}],"as_of":"2026-02","related_ids":["egocentric-video","internet-video-data","action-free-video","latent-action-pretraining","embodiment-gap","pretraining-on-human-videos"],"name":"人类视频数据","alt":"Human Video Data","abbr":"","aliases":["人类数据","人手视频","Human Video"],"one_liner":"拍人做事的视频，不用机器人就能采，用来教机器人理解和模仿操作。","explanation":"人类视频数据指记录人完成各种操作的视频，包括第一人称视频、第三视角视频和网上的教学视频。最大优势是量大、便宜、场景多，采集不依赖昂贵的机器人。难点是视频里没有机器人能直接执行的动作标签，且人手和机器人手结构不同（本体差异）。常见用法：用手部姿态估计提取手腕和手指轨迹当动作；用潜在动作模型从前后帧学出抽象动作；或只用来预训练视觉表征和世界模型，再用少量真机数据微调。英伟达 2026 年的 EgoScale 用 2 万多小时带动作标注的第一人称视频预训练 VLA（视觉-语言-动作）模型，发现数据量与验证损失呈对数线性关系。","example":"EgoScale 先在人类视频上预训练，再用少量对齐的人-机数据做中训练（预训练和任务微调之间的一段过渡训练），在 22 自由度灵巧手上的平均成功率比不做预训练高 54%。","related":["第一人称视频","互联网视频数据","无动作标签视频","潜在动作预训练","本体差异","人类视频预训练"]},{"id":"web-scale-vision-language-data","category":"data","sec":0,"tier":2,"sources":[{"title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","url":"https://robotics-transformer2.github.io/"},{"title":"LAION-5B: An open large-scale dataset for training next generation image-text models","url":"https://arxiv.org/abs/2210.08402"},{"title":"π0.5: a Vision-Language-Action Model with Open-World Generalization","url":"https://arxiv.org/abs/2504.16054"}],"as_of":"2025-04","related_ids":["vision-language-model","co-training","vision-language-action-model","rt-2","catastrophic-forgetting","knowledge-insulation"],"name":"互联网图文数据","alt":"Web-scale Vision-Language Data","abbr":"","aliases":["网络图文数据","web 数据","Web Data","Internet-scale Vision-Language Data"],"one_liner":"从网上收集的海量图片-文字配对及图文问答数据，让模型认识大千世界。","explanation":"指从网页收集的大规模图像-文本对，以及由此整理出的图像描述、视觉问答、目标检测等数据。例如 LAION-5B 从 Common Crawl 网页里用 CLIP 打分筛出 58.5 亿对图文。视觉语言模型（VLM）在这类数据上预训练，所以认得大量物体并掌握不少常识。机器人数据规模小得多，覆盖的物体和场景有限，VLA 模型要借网上的知识主要靠两步：拿互联网数据预训练过的 VLM 当骨干；训练时把网络数据和机器人数据一起协同训练，防止机器人微调把原有知识冲掉。RT-2 最早系统验证了这种做法，π0.5 也把 web 数据列为协同训练的数据源之一。","example":"RT-2 把机器人轨迹和视觉问答等网络数据混在一起微调，模型因此能把网上学到的物体和概念用到动作上，执行机器人数据里没出现过的指令。","related":["视觉语言模型","协同训练","视觉-语言-动作模型","RT-2","灾难性遗忘","知识隔离"]},{"id":"data-pyramid","category":"data","sec":0,"tier":2,"sources":[{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/html/2503.14734"}],"as_of":"2025-03","related_ids":["real-robot-data","simulation-data","synthetic-data","human-video-data","neural-trajectories","nvidia-isaac-gr00t-n1"],"name":"数据金字塔","alt":"Data Pyramid","abbr":"","aliases":["机器人数据金字塔"],"one_liner":"按数量多少和贴近真机程度，把机器人训练数据分成三层的框架。","explanation":"数据金字塔是英伟达在 2025 年 3 月 GR00T N1 论文里用来组织训练数据的框架：底层是量最大的网页数据和人类视频；中层是物理仿真生成、或用神经网络（如视频生成模型）合成的数据；顶层是在真实机器人上采集的数据。从下往上，数据量越来越少，和具体本体（机器人硬件）的贴合度越来越高。底层提供通用常识和行为先验，顶层保证动作能在真机上执行。它针对的是真机数据又贵又少的现实：用便宜的大规模数据打底，用少量真机数据校准。","example":"GR00T N1 的底层用了 Ego4D、EPIC-KITCHENS 等人类视频；中层有约 827 小时视频模型生成的神经轨迹和 78 万条 DexMimicGen 仿真轨迹；顶层是傅利叶 GR-1 遥操作数据、Open X-Embodiment 和 AgiBot World 等真机数据。","related":["真机数据","仿真数据","合成数据","人类视频数据","神经轨迹","GR00T N1 系列"]},{"id":"teleoperation","category":"data","sec":1,"tier":1,"sources":[{"title":"Wikipedia: Teleoperation","url":"https://en.wikipedia.org/wiki/Teleoperation"},{"title":"ALOHA / ACT 项目页: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","url":"https://tonyzhaozh.github.io/aloha/"},{"title":"Zhao et al. 2023: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["demonstration-data","leader-follower-teleoperation","vr-teleoperation","data-collector","imitation-learning","universal-manipulation-interface"],"name":"遥操作","alt":"Teleoperation","abbr":"","aliases":["遥控操作","远程操作","teleop","Remote Operation"],"one_liner":"人通过主臂、VR 等设备实时操控机器人；具身智能里主要用它采演示数据。","explanation":"遥操作原意是在一定距离外操作机器，是「远程控制」在学术和技术场合的说法。在具身智能里，它是采集演示数据的主力手段：操作员通过主从臂、VR 头显、3D 鼠标或动捕手套下指令，机器人照做，系统同步记下相机画面、关节状态和每一步的动作指令，得到模仿学习要用的「观测-动作」对。数据直接在机器人身上录，训练出的策略可以原样部署，不存在人手和机械手不一致的问题；代价是要有真机和熟练的数采员，速度慢、成本高。UMI 这类手持采集设备和从人类视频学习，都是为了绕开这个瓶颈。","example":"ALOHA 双臂平台用「主从臂」遥操作：操作员带动一对主臂，另一对从臂实时跟随，整套硬件预算约 2 万美元；ACT 在多数任务上只用 50 条这样录下的演示（约 10–20 分钟），就学会了打开调料杯盖、把电池插进遥控器等精细动作。","related":["演示数据","主从臂遥操作","VR 遥操作","数采员","模仿学习","通用操作接口"]},{"id":"kinesthetic-teaching","category":"data","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Programming by demonstration","url":"https://en.wikipedia.org/wiki/Programming_by_demonstration"},{"title":"Kinesthetic Teaching in Robotics: a Mixed Reality Approach (arXiv 2409.02305)","url":"https://arxiv.org/abs/2409.02305"},{"title":"DexDirect: Direct Kinesthetic Arm Guidance for Efficient Dexterous Demonstration Collection (arXiv 2607.27784)","url":"https://arxiv.org/abs/2607.27784"}],"as_of":"","related_ids":["zero-force-drag","gravity-compensation","teach-and-playback-programming","teleoperation","demonstration-data","impedance-control"],"name":"拖动示教","alt":"Kinesthetic Teaching","abbr":"KT","aliases":["手把手示教","牵引示教","直接示教","手动引导示教"],"one_liner":"人直接用手推着机械臂走一遍动作，机器人记下轨迹用来学习或回放。","explanation":"拖动示教是最直接的示教方式：机械臂切到重力补偿或零力拖动模式（电机只抵消自重，人能轻松推动），操作员扶着机械臂完成一遍任务，机器人用关节编码器记下整条轨迹。早期工业机器人的「示教再现」编程就是这样记住一串位置再回放；在机器人学习里，它为模仿学习提供演示数据。好处是动作直接发生在机器人自己的关节上，不需要人到机器人的动作映射，也不用额外遥操作设备。缺点是机械臂必须能被推动，人手和身体会进入相机画面干扰视觉策略，也很难同时带动双臂或多指灵巧手，而且比遥操作更费体力。","example":"让带关节力矩传感器的机械臂进入手动引导模式，人抓住末端把夹爪带到杯把、夹住再提起，记录下的关节角序列就是一条演示。","related":["零力拖动","重力补偿","示教再现","遥操作","演示数据","阻抗控制"]},{"id":"leader-follower-teleoperation","category":"data","sec":1,"tier":1,"sources":[{"title":"GELLO: A General, Low-Cost, and Intuitive Teleoperation Framework for Robot Manipulators","url":"https://wuphilipp.github.io/gello_site/"},{"title":"ALOHA: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","url":"https://tonyzhaozh.github.io/aloha/"},{"title":"LeRobot Docs: Imitation Learning on Real-World Robots","url":"https://huggingface.co/docs/lerobot/il_robots"}],"as_of":"","related_ids":["teleoperation","aloha","gello","bilateral-teleoperation","demonstration-data","so-100-so-101-arm"],"name":"主从臂遥操作","alt":"Leader-Follower Teleoperation","abbr":"","aliases":["主从臂","主从遥操作","主手/从手","同构主手","同构遥操作","Leader-Follower Arms","主从臂（遥操作主手）","主从臂遥操作（同构主手）"],"one_liner":"人扳动一台主臂，机器人从臂实时复制它每个关节的角度。","explanation":"主从臂遥操作是常用的机器人数据采集方式：主臂（leader）是与机器人从臂（follower）运动学结构相同或按比例缩小的手动机械臂，关节装有编码器或舵机。操作者扳动主臂，系统读出各关节角度直接发给从臂。因为是关节对关节映射，不用解逆运动学（由末端位置反算关节角），延迟低、动作直观，适合采精细的双臂操作数据。代价是每种机器人要配一套主臂，且通常没有力反馈。ALOHA 用 WidowX 主臂带 ViperX 从臂做双臂遥操作；伯克利的 GELLO 用 3D 打印件加现成电机，成本不到 300 美元。","example":"在 LeRobot 里用 SO-101 主臂遥控 SO-101 从臂，边操作边记录相机画面和关节角，录够 50 条就能训练 ACT 策略。","related":["遥操作","ALOHA 双臂平台","GELLO","双边遥操作","演示数据","SO-100 / SO-101 机械臂"]},{"id":"gello","category":"data","sec":1,"tier":3,"sources":[{"title":"GELLO: A General, Low-Cost, and Intuitive Teleoperation Framework for Robot Manipulators (arXiv)","url":"https://arxiv.org/abs/2309.13037"},{"title":"GELLO 项目主页","url":"https://wuphilipp.github.io/gello_site/"},{"title":"gello_mechanical (GitHub)","url":"https://github.com/wuphilipp/gello_mechanical"}],"as_of":"2024-07","related_ids":["leader-follower-teleoperation","teleoperation","aloha","demonstration-data","spacemouse-teleoperation","vr-teleoperation"],"name":"GELLO","alt":"GELLO: A General, Low-Cost, and Intuitive Teleoperation Framework for Robot Manipulators","abbr":"GELLO","aliases":["GELLO 遥操作臂"],"one_liner":"伯克利开源的低成本主从臂遥操作装置，用缩小版复刻臂操控真机。","explanation":"加州大学伯克利 Pieter Abbeel 团队 2023 年提出的遥操作框架。做法是为目标机械臂 3D 打印一个关节结构相同、尺寸缩小的复刻臂，每个关节装一个现成舵机读角度；操作员摆动复刻臂，真机按关节角逐一跟随，属于主从臂遥操作。两者运动学一致，关节角可以直接映射，不像 VR 手柄那样要把手的位姿换算成机械臂姿态。零件成本低于 300 美元，软硬件全部开源。论文做了 Franka、UR5、xArm 三个版本，用户实验显示它比 VR 手柄和 3D 鼠标采集演示更稳、更快，也能做双臂和接触丰富的任务。社区后来又贡献了 FR3、YAM 等机型的设计，常用来采集模仿学习数据。","example":"操作员握住桌边的 GELLO 复刻臂做一遍抓取放置，Franka 同步跟着做，相机画面和关节角被记录成一条训练演示。","related":["主从臂遥操作","遥操作","ALOHA 双臂平台","演示数据","3D 鼠标遥操作","VR 遥操作"]},{"id":"bilateral-teleoperation","category":"data","sec":1,"tier":3,"sources":[{"title":"Fast Bilateral Teleoperation and Imitation Learning Using Sensorless Force Control via Accurate Dynamics Model (arXiv 2507.06174)","url":"https://arxiv.org/html/2507.06174v2"},{"title":"ALPHA-α and Bi-ACT Are All You Need（大阪大学项目页）","url":"https://mertcookimg.github.io/alpha-biact"}],"as_of":"2025-07","related_ids":["teleoperation","leader-follower-teleoperation","haptic-glove","force-control","contact-rich-manipulation","action-chunking-with-transformers"],"name":"双边遥操作","alt":"Bilateral Teleoperation","abbr":"","aliases":["力反馈遥操作","Force-Feedback Teleoperation","双向力反馈遥操作","双边控制","Bilateral Control"],"one_liner":"主从两端双向传位置和力，操作者能感到机器人碰到了什么的遥操作。","explanation":"双边遥操作是主从式遥操作的一种：人操纵本地的主端设备，远端从端机器人跟随运动，同时从端受到的接触力传回主端，让操作者手上感到阻力。单边遥操作则只把主端位置发给从端，ALOHA 这类低成本主从臂就是单边。这一方向已有半个多世纪历史，控制上要兼顾稳定性和透明度（操作者的感觉有多接近亲手操作），通信延迟是主要难点；四通道结构让两端互传位置和力，理论上可让两者同时同步。用于数据采集时，它帮人完成插接、擦拭等接触丰富的任务，并把力信号一起录下供策略学习，例如 Bi-ACT 在 ACT 上加入了力信息。","example":"筑波大学等团队用四通道双边控制采集演示训练策略：不输入力信息时，策略几乎抓不起 10–20 毫米的小物体；把力信息加入输入和输出后，拾取成功率达到 100%。","related":["遥操作","主从臂遥操作","力反馈手套","力控","接触丰富操作","ACT"]},{"id":"exoskeleton-teleoperation","category":"data","sec":1,"tier":2,"sources":[{"title":"AirExo: Low-Cost Exoskeletons for Learning Whole-Arm Manipulation in the Wild (arXiv 2309.14975)","url":"https://arxiv.org/abs/2309.14975"},{"title":"HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit (arXiv 2502.13013)","url":"https://arxiv.org/abs/2502.13013"}],"as_of":"2025-04","related_ids":["teleoperation","leader-follower-teleoperation","whole-body-teleoperation","airexo","homie","exoskeleton"],"name":"外骨骼遥操作","alt":"Exoskeleton Teleoperation","abbr":"","aliases":["外骨骼采集","外骨骼示教"],"one_liner":"人穿戴与机器人关节对应的外骨骼，用自己手臂的动作直接控制机器人。","explanation":"外骨骼遥操作是遥操作的一种：操作者穿戴一套外骨骼，外骨骼各关节装有编码器（测转角的传感器），结构与机器人手臂同构或按比例对应。人的手臂怎么动，读数就直接映射成机器人的关节角，不必像 VR 手柄那样先做逆运动学（由末端位姿反推关节角）。好处是整条手臂的姿态都可控、延迟低、上手直观，也可以不接机器人、单独在野外采数据；缺点是要按每种机器人适配结构，长时间穿戴也累。代表工作有上海交通大学卢策吾团队的 AirExo 系列双臂外骨骼，以及 2025 年面向人形机器人的外骨骼驾舱 HOMIE。","example":"AirExo 论文中，只用 3 分钟遥操作数据加上大量用外骨骼在野外采集的演示，训练出的策略就达到甚至超过只用 20 多分钟遥操作数据的效果；HOMIE 整套驾舱成本约 500 美元。","related":["遥操作","主从臂遥操作","全身遥操作","AirExo 外骨骼","HOMIE","外骨骼"]},{"id":"airexo","category":"data","sec":1,"tier":3,"sources":[{"title":"AirExo: Low-Cost Exoskeletons for Learning Whole-Arm Manipulation in the Wild (arXiv 2309.14975)","url":"https://arxiv.org/abs/2309.14975"},{"title":"AirExo 项目主页","url":"https://airexo.github.io/"},{"title":"AirExo-2 项目主页","url":"https://airexo.tech/airexo2/"}],"as_of":"2025-09","related_ids":["exoskeleton-teleoperation","robot-free-data-collection","leader-follower-teleoperation","in-the-wild-data","sjtu-mvig-lab","flexiv-rizon"],"name":"AirExo 外骨骼","alt":"AirExo","abbr":"","aliases":["AirExo-2","AirExo 双臂外骨骼"],"one_liner":"上海交大卢策吾团队的低成本双臂外骨骼，可遥操作机器人，也能脱离机器人采数据。","explanation":"AirExo 是上海交通大学卢策吾团队 2023 年 9 月提出的开源双臂外骨骼，发表于 ICRA 2024。人把它穿在手臂上，外骨骼关节与机器人关节一一对应，既能做关节级遥操作，也能不连机器人、在真实环境里直接录「野外」演示。结构件可全部 3D 打印，每条臂约 300 美元，最初为 Flexiv Rizon 双臂设计，也可改装适配 UR5、Franka 等。2025 年的 AirExo-2（CoRL 2025）加入视觉适配器，把人穿外骨骼操作的画面转成「伪机器人演示」，配合融合 3D 点云与 2D 语义特征的 RISE-2 策略，不用任何真机数据，效果就接近用遥操作数据训练的策略；官方给出的成本约 600 美元一套，对比约 6 万美元的遥操作平台。","example":"AirExo 论文实验中，只用 3 分钟遥操作演示、再加大量穿外骨骼录的野外演示训练出的策略，效果达到甚至超过了用 20 多分钟遥操作数据训练的策略。","related":["外骨骼遥操作","无本体采集","主从臂遥操作","野外数据","上海交通大学 MVIG 实验室（卢策吾组）","非夕 拂晓 Rizon"]},{"id":"spacemouse-teleoperation","category":"data","sec":1,"tier":3,"sources":[{"title":"robosuite Docs: I/O Devices (3Dconnexion SpaceMouse)","url":"https://robosuite.ai/docs/modules/devices.html"},{"title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop RL (HIL-SERL, arXiv 2410.21845)","url":"https://arxiv.org/html/2410.21845"},{"title":"Wikipedia: 3Dconnexion","url":"https://en.wikipedia.org/wiki/3Dconnexion"}],"as_of":"","related_ids":["teleoperation","human-in-the-loop","hil-serl","human-intervention-data","robosuite","leader-follower-teleoperation"],"name":"3D 鼠标遥操作","alt":"SpaceMouse Teleoperation","abbr":"","aliases":["SpaceMouse","空间鼠标遥操作","3D 鼠标"],"one_liner":"用 3D 鼠标的推、拉、扭、倾来控制机械臂末端的六自由度运动。","explanation":"SpaceMouse 是 3Dconnexion 公司的六自由度输入设备，原本给 CAD 软件平移、缩放、旋转三维模型用，手柄可以平推、上提下压、扭转和倾斜。拿来遥操作时，这 6 个量被映射成机械臂末端的平移和旋转增量，按键控制夹爪开合。它便宜、即插即用，不需要主从臂或 VR 头显，适合单臂桌面任务，robosuite 等仿真框架原生支持。缺点是只能控制末端位姿，不适合双臂和灵巧手，操作不够直观，采集速度和动作自然度不如主从臂。在人在回路强化学习里，它常被当作人随时接管、纠正机器人的工具。","example":"HIL-SERL 训练时，人握着 SpaceMouse 监督机器人，策略出错时直接用 SpaceMouse 接管控制并给出纠正动作，这些干预数据被存进回放缓冲区继续训练。","related":["遥操作","人在回路","HIL-SERL","干预数据","robosuite","主从臂遥操作"]},{"id":"vr-teleoperation","category":"data","sec":1,"tier":1,"sources":[{"title":"Cheng et al. 2024: Open-TeleVision (arXiv 2407.01512)","url":"https://arxiv.org/abs/2407.01512"},{"title":"GitHub: unitreerobotics/xr_teleoperate","url":"https://github.com/unitreerobotics/xr_teleoperate"},{"title":"AgiBot World Colosseo 技术报告 (arXiv 2503.06669)","url":"https://arxiv.org/html/2503.06669"}],"as_of":"2026-09","related_ids":["teleoperation","open-television","apple-vision-pro","motion-retargeting","unitree-xr-teleoperate","vr-headset"],"name":"VR 遥操作","alt":"VR Teleoperation","abbr":"","aliases":["XR 遥操作","头显遥操作","Vision Pro 遥操作","XR Teleoperation"],"one_liner":"戴 VR/XR 头显，用手部追踪或手柄实时操控机器人。","explanation":"VR 遥操作是遥操作的一种：VR/XR 头显的手部追踪或手柄读出人的手腕和手指位姿，再经逆运动学（由末端位姿反算关节角）和动作重定向（把人手姿态换算成机器人手的关节角）变成机器人指令；沉浸式方案还会把机器人相机的画面传回头显，操作员像站在机器人的位置上干活。它不用给每种机器人专门做一套主臂，设备现成、便携，适合人形机器人和灵巧手这类自由度多的本体，BridgeData V2、DROID、AgiBot World 等数据集都用过。不足是通常没有力反馈，手部追踪有延迟和抖动，精细接触任务不如主从臂稳；AgiBot World 论文也提到 VR 手柄只能让灵巧手做几种预设手势，复杂任务改用动捕。","example":"Open-TeleVision 用 Apple Vision Pro 操控 Unitree H1：机器人头部跟着操作员转，双目画面传回头显，双手经 dex-retargeting 跟随；宇树开源的 xr_teleoperate 支持 Apple Vision Pro、PICO 4 Ultra Enterprise 和 Meta Quest 3，并把每回合数据存下来用于模仿学习。","related":["遥操作","Open-TeleVision","Apple Vision Pro","动作重定向","宇树 xr_teleoperate（XR 遥操作）","VR 头显"]},{"id":"apple-vision-pro","category":"data","sec":1,"tier":2,"sources":[{"title":"Apple Newsroom: Apple Vision Pro available in the U.S. on February 2","url":"https://www.apple.com/newsroom/2024/01/apple-vision-pro-available-in-the-us-on-february-2/"},{"title":"Wikipedia: Apple Vision Pro","url":"https://en.wikipedia.org/wiki/Apple_Vision_Pro"},{"title":"Hoque et al. 2025: EgoDex (arXiv 2505.11709)","url":"https://arxiv.org/abs/2505.11709"}],"as_of":"2025-10","related_ids":["vr-teleoperation","vr-headset","open-television","egodex","egocentric-video","meta-quest-3-pico-4-ultra-xr-headsets"],"name":"Apple Vision Pro","alt":"Apple Vision Pro","abbr":"AVP","aliases":["苹果 Vision Pro","Vision Pro"],"one_liner":"苹果的头戴显示设备，具身领域常用它的手部追踪做遥操作和采人类数据。","explanation":"Apple Vision Pro 是苹果 2023 年 6 月在 WWDC 发布、2024 年 2 月 2 日在美国开售的头显，起价 3499 美元，最初搭载 M2 芯片和专门处理传感器输入的 R1 芯片，有 12 个摄像头、5 个传感器和 6 个麦克风；2025 年 10 月推出了 M5 芯片版本。它不是机器人产品，但系统能实时追踪手腕和手指的 3D 位姿，又有高分辨率双目显示，所以被具身研究拿来做遥操作：人手动作经重定向驱动机器人，机器人头部相机画面传回头显。它也能在人做家务时同步记录第一人称视频和手部 3D 轨迹，用来采人类操作数据。","example":"Open-TeleVision 用 Vision Pro 远程操控 Unitree H1，作者在 MIT 就能操控远在加州大学圣地亚哥分校的机器人；苹果自己用 Vision Pro 采了 829 小时、194 种任务的第一人称人手操作数据集 EgoDex。","related":["VR 遥操作","VR 头显","Open-TeleVision","EgoDex 数据集","第一人称视频","Meta Quest 3 / PICO 4 Ultra 头显"]},{"id":"data-glove","category":"data","sec":1,"tier":1,"sources":[{"title":"Wikipedia: Wired glove","url":"https://en.wikipedia.org/wiki/Wired_glove"},{"title":"MANUS 官网（Metagloves 产品）","url":"https://www.manus-meta.com/"},{"title":"DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation (arXiv 2403.07788)","url":"https://arxiv.org/abs/2403.07788"}],"as_of":"2026-09","related_ids":["motion-capture","haptic-glove","tactile-glove","teleoperation","motion-retargeting","dexterous-hand"],"name":"数据手套","alt":"Data Glove","abbr":"","aliases":["动捕手套","数采手套","Wired Glove","CyberGlove"],"one_liner":"戴在手上、实时记录每根手指弯曲和手部姿态的传感手套。","explanation":"数据手套是一种穿戴式输入设备，用弯曲传感器、惯性测量单元（IMU，测角速度和加速度的芯片）或电磁感应测量各手指关节角度，常配合追踪器获得整只手的空间位姿。它早期主要用于人机交互、虚拟现实和动画制作，1977 年的 Sayre Glove 被认为是第一款。在具身智能里主要有两个用途：遥操作灵巧手时把人手动作实时映射到机器人手上；以及不用机器人、直接采集人手操作数据，经动作重定向（把人的动作换算成机器人关节指令）后用于训练。带力反馈的型号还能把接触感觉传回操作者。","example":"MANUS 的 Metagloves Pro 主打机器人训练数据采集和遥操作；DexCap 系统用基于电磁场的动捕手套记录手指动作，再用 SLAM 相机（能边移动边算出自身位置的相机）跟踪手腕，便携地记录人手操作，供灵巧手做模仿学习。","related":["动作捕捉","力反馈手套","触觉手套","遥操作","动作重定向","灵巧手"]},{"id":"haptic-glove","category":"data","sec":1,"tier":3,"sources":[{"title":"Wired glove - Wikipedia","url":"https://en.wikipedia.org/wiki/Wired_glove"},{"title":"HaptX 官网","url":"https://haptx.com/"},{"title":"SenseGlove 官网","url":"https://www.senseglove.com/"}],"as_of":"2026-09","related_ids":["data-glove","tactile-glove","teleoperation","bilateral-teleoperation","exoskeleton-teleoperation","dexterous-hand"],"name":"力反馈手套","alt":"Haptic Glove (Force-Feedback Glove)","abbr":"","aliases":["触觉反馈手套","Force-Feedback Glove","Haptic Feedback Glove"],"one_liner":"既采集手部动作、又把受力「推回」操作员手指的遥操作手套。","explanation":"普通数据手套只负责采集，测手指弯曲和手的位置；力反馈手套多了一条反向通道，能把虚拟物体或远端机器人手受到的力传回操作员手上。常见做法是在手背和手指上装外骨骼式机构，用电机、制动器或气/液压执行器阻挡手指继续弯曲，让人感到物体的大小和软硬；有的还加振动或微流控触点模拟接触感，如 HaptX 手套用微流控织物里的上百个执行器压迫皮肤。早期产品有 Immersion 公司的 CyberGrasp。在具身智能里，它主要用于灵巧手遥操作：没有力反馈时操作员看不出捏得多紧，容易捏碎或滑落；有了反馈，采到的演示数据更自然。代价是设备贵、重，佩戴和标定麻烦。","example":"SenseGlove 推出面向人形机器人的外骨骼手套 R1，官网称其带主动力反馈和振动反馈，用于灵巧手遥操作和模仿学习数据采集。","related":["数据手套","触觉手套","遥操作","双边遥操作","外骨骼遥操作","灵巧手"]},{"id":"tactile-glove","category":"data","sec":1,"tier":3,"sources":[{"title":"MIT News: Sensor-packed glove learns signatures of the human grasp (2019)","url":"https://news.mit.edu/2019/sensor-glove-human-grasp-robotics-0529"},{"title":"OSMO: Open-Source Tactile Glove for Human-to-Robot Skill Transfer (arXiv 2512.08920)","url":"https://arxiv.org/abs/2512.08920"}],"as_of":"2025-12","related_ids":["tactile-data","data-glove","haptic-glove","tactile-sensor","tactile-representation-learning","contact-rich-manipulation"],"name":"触觉手套","alt":"Tactile Glove","abbr":"","aliases":["压力感知手套","Tactile Sensing Glove"],"one_liner":"手指和掌心布满压力或触觉传感器，记录人手接触力的手套。","explanation":"触觉手套是在手套上布置压力或触觉传感器，记录人手抓握、操作物体时各处接触力分布的设备。它和数据手套（主要测手指关节角度）、力反馈手套（给佩戴者施加反作用力）侧重点不同，三者也常组合在一起。视觉很难看出「捏得多紧」「有没有打滑」，而这些信息对擦拭、插拔、拿易碎品等接触丰富的任务很关键，所以触觉手套被用来采集带力信息的人类演示、研究人类抓握规律，或在遥操作中同步记录触觉。难点在于传感器的耐用性和标定，以及人手与机器人手在触觉上的差异。","example":"MIT 2019 年发表在《Nature》上的 STAG 手套有约 550 个传感器、成本约 10 美元，录下人与 26 种物体交互的约 13.5 万帧数据；2025 年 12 月开源的 OSMO 手套在指尖和掌心布置 12 个三轴触觉传感器，人和机器人戴同款手套，只用人类演示训练的擦拭策略成功率为 72%。","related":["触觉数据","数据手套","力反馈手套","触觉传感器","触觉表征学习","接触丰富操作"]},{"id":"motion-retargeting","category":"data","sec":1,"tier":2,"sources":[{"title":"GMR: General Motion Retargeting (GitHub)","url":"https://github.com/YanjieZe/GMR"},{"title":"dex-retargeting (GitHub)","url":"https://github.com/dexsuite/dex-retargeting"}],"as_of":"","related_ids":["general-motion-retargeting","dex-retargeting","inverse-kinematics","motion-capture","motion-tracking","omniretarget"],"name":"动作重定向","alt":"Motion Retargeting","abbr":"","aliases":["运动重定向","重定向","Retargeting","手部重定向","动作映射"],"one_liner":"把人（或另一台机器人）的动作换算成目标机器人自己的关节动作。","explanation":"动作重定向原是动画领域的技术，指把一个角色的动作迁移到骨骼比例不同的另一个角色上。在具身智能里，它负责把人体或人手的动作（来自动作捕捉、视频姿态估计或 VR 设备）转换成机器人能执行的关节角。难点是人和机器人的肢体长度、关节数量和活动范围都不同，不能照抄关节角。常见做法是写成优化问题：让机器人的手腕、指尖等关键点位置或方向尽量贴近人的，同时满足关节限位，本质上是带约束的逆运动学。它是遥操作、从人类视频学习和人形机器人动作跟踪训练的前置步骤，常用开源工具有 GMR 和 dex-retargeting。","example":"GMR 能把 AMASS、LAFAN1 等人体动捕数据转成宇树 G1 等人形机器人的关节轨迹，在 CPU 上即可实时运行，也被 TWIST 用于全身遥操作。","related":["GMR 通用动作重定向","dex-retargeting","逆运动学","动作捕捉","运动跟踪","OmniRetarget"]},{"id":"anyteleop-a-general-vision-based-dexterous-robot-arm-hand-te","category":"data","sec":1,"tier":3,"sources":[{"title":"AnyTeleop (arXiv 2307.04577)","url":"https://arxiv.org/abs/2307.04577"},{"title":"AnyTeleop 项目主页","url":"https://yzqin.github.io/anyteleop/"}],"as_of":"2023-07","related_ids":["teleoperation","motion-retargeting","dex-retargeting","dexterous-manipulation","open-television","bunny-visionpro"],"name":"AnyTeleop","alt":"AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System","abbr":"","aliases":["AnyTeleop 遥操作系统"],"one_liner":"用普通相机捕捉人手动作，就能遥操作多种机械臂和灵巧手的通用视觉遥操作系统。","explanation":"AnyTeleop 是加州大学圣地亚哥分校（UCSD）与英伟达的 Yuzhe Qin 等人 2023 年 7 月提出的遥操作框架，发表于 RSS 2023。操作者不用戴手套或外骨骼，只要对着相机做动作：系统从图像估计人手和手腕姿态，再经动作重定向（把人手关节映射到结构不同的机器人手上）转成灵巧手和机械臂的指令，并做碰撞规避。以往视觉遥操作系统往往绑定某一款硬件，AnyTeleop 用同一套系统支持多种机械臂、灵巧手和相机配置，既能接真机，也能接 SAPIEN、Isaac Gym 等仿真器，还支持浏览器远程查看和多机器人协作。论文报告，在相同硬件上它比专为该硬件设计的旧系统表现更好。重定向模块已开源为 dex-retargeting 库。","example":"在仿真器里，操作者对着相机做抓握动作，AnyTeleop 实时驱动虚拟的机械臂加灵巧手去抓物体，录下的轨迹可直接用来训练模仿学习策略。","related":["遥操作","动作重定向","dex-retargeting","灵巧操作","Open-TeleVision","Bunny-VisionPro"]},{"id":"dex-retargeting","category":"data","sec":1,"tier":3,"sources":[{"title":"dex-retargeting GitHub 仓库","url":"https://github.com/dexsuite/dex-retargeting"},{"title":"AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System (arXiv)","url":"https://arxiv.org/abs/2307.04577"}],"as_of":"2026-09","related_ids":["anyteleop-a-general-vision-based-dexterous-robot-arm-hand-te","motion-retargeting","mano","dexterous-hand","mediapipe","dexycb"],"name":"dex-retargeting","alt":"dex-retargeting (AnyTeleop hand retargeting library)","abbr":"","aliases":["dex_retargeting"],"one_liner":"把人手关键点姿态换算成各种机器人灵巧手关节角的开源工具库。","explanation":"dex-retargeting 是从 AnyTeleop 项目（加州大学圣迭戈分校与英伟达，RSS 2023）拆出来的开源 Python 库，MIT 许可，可 pip 安装。人手和机器人手的手指数量、长度、关节都不一样，关节角不能直接照抄，需要重定向：输入 MediaPipe 或 MANO 手部模型给出的人手关键点，通过优化求机器人手的关节角，让指尖位置或指尖之间的向量尽量一致。库里有向量重定向（适合视频实时遥操作）、位置重定向（适合离线转换手物交互数据集）和 DexPilot 三种方式，配套模型库收录了 Allegro、Shadow、LEAP、Inspire 等手。很多灵巧手遥操作和人手采集项目用它把人手动作转成机器人动作。","example":"官方示例用位置重定向，把 DexYCB 数据集里人手抓物体的 MANO 姿态离线转换成 Allegro、Shadow 等机器人手的抓取轨迹。","related":["AnyTeleop","动作重定向","MANO 手部模型","灵巧手","MediaPipe（手部/人体关键点）","DexYCB 数据集"]},{"id":"open-television","category":"data","sec":1,"tier":3,"sources":[{"title":"Open-TeleVision: Teleoperation with Immersive Active Visual Feedback (arXiv 2407.01512)","url":"https://arxiv.org/abs/2407.01512"},{"title":"Open-TeleVision 项目主页","url":"https://robot-tv.github.io/"},{"title":"OpenTeleVision/TeleVision (GitHub)","url":"https://github.com/OpenTeleVision/TeleVision"}],"as_of":"2024-07","related_ids":["vr-teleoperation","apple-vision-pro","dex-retargeting","action-chunking-with-transformers","unitree-h1","ph2d"],"name":"Open-TeleVision","alt":"Open-TeleVision: Teleoperation with Immersive Active Visual Feedback","abbr":"","aliases":["TeleVision","OpenTeleVision","OpenTV"],"one_liner":"戴 VR 头显、以机器人视角立体观察来遥操作人形机器人的开源系统","explanation":"Open-TeleVision 是加州大学圣地亚哥分校王小龙团队与 MIT 提出的开源遥操作系统（CoRL 2024）。操作者戴 Apple Vision Pro（代码也支持 Meta Quest 3），转头时机器人的云台或颈部跟着转，头部 ZED Mini 双目相机把立体画面实时传回头显，操作者看到的就是机器人视角的 3D 画面；手臂和手指动作经 dex-retargeting 库映射到机器人上。它针对普通遥操作视角固定、缺深度感、精细操作难的问题。作者在宇树 H1 和傅利叶 GR-1 上采集演示，用改进的 ACT 训练策略完成罐子分拣、叠衣服等任务，还演示了相隔约 3000 英里的远程操作。","example":"操作者戴 Apple Vision Pro 转头看向桌面，宇树 H1 的头部云台随之转动；操作者伸手抓取，机器人灵巧手同步把罐子分拣进不同盒子，这些过程被录成模仿学习的演示数据。","related":["VR 遥操作","Apple Vision Pro","dex-retargeting","ACT","宇树 H1","PH2D 数据集（HAT）"]},{"id":"unitree-xr-teleoperate","category":"data","sec":1,"tier":3,"sources":[{"title":"unitreerobotics/xr_teleoperate (GitHub)","url":"https://github.com/unitreerobotics/xr_teleoperate"}],"as_of":"2026-07","related_ids":["teleoperation","vr-teleoperation","open-television","unitree-g1","motion-retargeting","vuer"],"name":"宇树 xr_teleoperate（XR 遥操作）","alt":"Unitree xr_teleoperate","abbr":"","aliases":["xr_teleoperate","avp_teleoperate"],"one_liner":"宇树开源的 XR 头显遥操作程序，用来操控宇树人形机器人并录制训练数据。","explanation":"宇树科技在 GitHub 开源的遥操作代码库，基于 Open-TeleVision 改写。操作员戴上 Apple Vision Pro、PICO 4 Ultra Enterprise 或 Meta Quest 3，头显通过浏览器页面（Vuer 界面，WebRTC 传视频）采集头部和双手的位姿，程序再用逆运动学（由手的目标位置反算各关节角度）驱动 G1、H1 等人形机器人的手臂，把手指动作映射到 Dex3-1、因时等灵巧手或夹爪，同时把机器人头部相机画面回传到头显里。它主要用于采集模仿学习数据，每条回合记录带时间戳的关节状态、末端位姿和图像。据仓库说明，2026 年 7 月的 1.6 版新增了 H2、R1 和强脑灵巧手的支持。","example":"研究者戴 Apple Vision Pro 远程控制宇树 G1 叠毛巾，一边做一边录下几十条演示，再拿去训练 ACT 或扩散策略。","related":["遥操作","VR 遥操作","Open-TeleVision","宇树 G1","动作重定向","Vuer（网页 3D / XR 可视化与遥操作工具）"]},{"id":"bunny-visionpro","category":"data","sec":1,"tier":3,"sources":[{"title":"Bunny-VisionPro: Real-Time Bimanual Dexterous Teleoperation for Imitation Learning (arXiv 2407.03162)","url":"https://arxiv.org/html/2407.03162v1"},{"title":"Bunny-VisionPro 项目主页","url":"https://dingry.github.io/projects/bunny_visionpro.html"}],"as_of":"2024-07","related_ids":["vr-teleoperation","apple-vision-pro","anyteleop-a-general-vision-based-dexterous-robot-arm-hand-te","bimanual-manipulation","dexterous-manipulation","motion-retargeting"],"name":"Bunny-VisionPro","alt":"Bunny-VisionPro","abbr":"","aliases":["Bunny-VisionPro: Real-Time Bimanual Dexterous Teleoperation for Imitation Learning"],"one_liner":"用 Vision Pro 实时遥操作双臂双灵巧手、带振动触觉反馈的采集系统。","explanation":"Bunny-VisionPro 是香港大学与 UCSD 王小龙组 2024 年 7 月发布的开源遥操作系统，用来为模仿学习采集双手灵巧操作演示。它用 Apple Vision Pro 跟踪人的手和手腕，实时映射到两台 xArm-7 机械臂和两只 6 自由度 Ability 灵巧手（共 24 个自由度）。手指重定向用优化方法对齐人手与机器手的指尖关键点；系统内置碰撞和奇异位形（机械臂失去某方向运动能力的姿态）规避，还用低成本振动马达把机器手指尖的触觉信号反馈给操作者。论文用它采的数据训练 ACT、扩散策略和 DP3，成功率高于用基线系统采的数据。","example":"操作者戴着 Vision Pro 远程控制双臂双手完成擦玻璃、扫地、做咖啡这类多步骤长程任务，机器手指尖碰到物体时，操作者手上的振动马达随之振动。","related":["VR 遥操作","Apple Vision Pro","AnyTeleop","双臂操作","灵巧操作","动作重定向"]},{"id":"xrobotoolkit","category":"data","sec":1,"tier":3,"sources":[{"title":"arXiv 2508.00097: XRoboToolkit","url":"https://arxiv.org/abs/2508.00097"},{"title":"XRoboToolkit 项目主页","url":"https://xr-robotics.github.io"},{"title":"XR-Robotics/XRoboToolkit-Teleop-Sample-Python (GitHub)","url":"https://github.com/XR-Robotics/XRoboToolkit-Teleop-Sample-Python"}],"as_of":"2026-09","related_ids":["teleoperation","vr-teleoperation","unitree-xr-teleoperate","meta-quest-3-pico-4-ultra-xr-headsets","inverse-kinematics","demonstration-data"],"name":"XRoboToolkit","alt":"XRoboToolkit: A Cross-Platform Framework for Robot Teleoperation","abbr":"","aliases":["XRoboToolkit"],"one_liner":"PICO 团队开源的跨平台 XR 遥操作框架，用头显和手柄操控各类机器人采数据。","explanation":"由字节跳动旗下 XR 公司 PICO 的团队（Zhigen Zhao、Liuchuan Yu、Ke Jing、Ning Yang）开发，论文 2025 年 7 月挂上 arXiv，获 SII 2026 最佳论文奖。它针对 VLA 模型对大规模示范数据的需求：头显一侧遵循 OpenXR 标准（跨厂商的 XR 设备接口规范），支持头部、手柄、手势追踪和额外的动作追踪器（如绑在手肘上控制肘部位置）；机器人一侧提供 Python 和 C++ 接口，用基于优化的逆运动学把操作员的手部位姿换算成关节指令，并把机器人的双目画面低延迟回传到头显。框架是模块化的，已接入 MuJoCo 仿真、双 UR5 机械臂、移动机器人和灵巧手等。论文用它采的数据训练 VLA，验证了精细操作任务的效果。","example":"操作员戴 PICO 4 Ultra 头显，用两只手柄同时控制双 UR5 机械臂完成精细插接，头显里看到的是机器人相机传回的立体画面。","related":["遥操作","VR 遥操作","宇树 xr_teleoperate（XR 遥操作）","Meta Quest 3 / PICO 4 Ultra 头显","逆运动学","演示数据"]},{"id":"nvidia-isaac-teleop","category":"data","sec":1,"tier":3,"sources":[{"title":"NVIDIA Isaac Teleop（GitHub，现为 NVIDIA/IsaacCapture）","url":"https://github.com/NVIDIA/IsaacCapture"},{"title":"Isaac Teleop Architecture 文档","url":"https://github.com/NVIDIA/IsaacCapture/blob/main/docs/source/overview/architecture.rst"}],"as_of":"2026-09","related_ids":["teleoperation","vr-teleoperation","motion-retargeting","nvidia-isaac-lab","mcap","homie"],"name":"Isaac Teleop 遥操作框架","alt":"NVIDIA Isaac Teleop","abbr":"","aliases":["Isaac Teleop","IsaacTeleop","IsaacCapture"],"one_liner":"英伟达开源的遥操作与数据采集框架，统一接入 XR 头显、手套等设备。","explanation":"Isaac Teleop 是英伟达开源（Apache 2.0）的遥操作与示教数据采集框架，2025 年 11 月发布首个版本，从 Isaac Lab 3.0 Beta 起与其配套，也支持 Isaac Sim、ROS 2 和真机。它要解决的是每种头显、手套、机器人都得单独写对接代码、数据格式各不相同的问题：统一接入 Apple Vision Pro、PICO、Quest 等 XR 头显和数据手套、脚踏板、身体追踪器，并统一打时间戳；用可组合的重定向模块把人的动作映射到不同机器人；用 MCAP 录制回放，并与 LeRobot 格式互通。已支持 XR 控制夹爪或灵巧手、坐姿全身遥操作（HOMIE）、基于 SONIC 的全身遥操作，以及不用机器人的第一人称采集。据 GitHub 信息，2026 年仓库已更名为 NVIDIA/IsaacCapture，文档仍称 Isaac Teleop。","example":"在 Isaac Lab 里戴上 Apple Vision Pro 等 XR 头显，用手部动作遥操作仿真中的机械臂完成示教，录下的 MCAP 数据再转成 LeRobot 格式用来训练策略。","related":["遥操作","VR 遥操作","动作重定向","Isaac Lab","MCAP 格式","HOMIE"]},{"id":"whole-body-teleoperation","category":"data","sec":1,"tier":2,"sources":[{"title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","url":"https://arxiv.org/abs/2401.02117"},{"title":"OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning","url":"https://arxiv.org/abs/2406.08858"},{"title":"TWIST: Teleoperated Whole-Body Imitation System","url":"https://arxiv.org/abs/2505.02833"}],"as_of":"2025-05","related_ids":["teleoperation","motion-retargeting","whole-body-control","omnih2o","twist","mobile-aloha"],"name":"全身遥操作","alt":"Whole-Body Teleoperation","abbr":"","aliases":["人形全身遥操作","Whole-body Teleop"],"one_liner":"一名操作员同时控制机器人的手臂、躯干、腿或底盘等全身动作。","explanation":"普通遥操作一般只控制机械臂，全身遥操作让一名操作员同时指挥机器人的上肢、躯干以及腿或移动底盘，用来采需要全身配合的数据，比如边走边拿、下蹲取物。常见两种形态：一是移动操作平台，如斯坦福 2024 年的 Mobile ALOHA，操作员和底盘连在一起，用主从臂控双臂、用身体带动底盘；二是人形机器人，用动捕设备、VR 头显或外骨骼捕捉人的全身动作，经动作重定向映射到机器人，再由强化学习训出的全身控制器跟踪并保持平衡，代表有 OmniH2O（2024）和斯坦福的 TWIST（2025）。难点在于人和机器人的身体比例、平衡能力不同，操作员通常也缺少力反馈。","example":"OmniH2O 中操作员可以只戴一台 VR 头显，用头部和双手的位姿驱动全尺寸人形机器人做全身动作，录下的数据组成了 OmniH2O-6 数据集。","related":["遥操作","动作重定向","全身控制","OmniH2O","TWIST","Mobile ALOHA"]},{"id":"robot-free-data-collection","category":"data","sec":2,"tier":2,"sources":[{"title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots","url":"https://arxiv.org/abs/2402.10329"},{"title":"UMI 项目主页","url":"https://umi-gripper.github.io/"},{"title":"DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation","url":"https://arxiv.org/abs/2505.21864"}],"as_of":"2025-10","related_ids":["universal-manipulation-interface","handheld-gripper-data-collection","dexumi","wearable-data-collection","capture-execution-isomorphism","embodiment-gap"],"name":"无本体采集","alt":"Robot-free (Embodiment-free) Data Collection","abbr":"","aliases":["无机器人采集","离本体采集","Robot-free Data Collection"],"one_liner":"采数据时不用真机器人，由人手持或穿戴仿机器人末端的装置直接演示。","explanation":"常规遥操作要人操纵一台真机器人，设备贵，也很难搬进真实家庭。无本体采集让人手持或穿戴一个照机器人末端设计的装置直接干活，装置上的相机和传感器记下画面与动作，事后把动作换算到机器人上训练。代表是 Cheng Chi、宋舒然等人 2024 年提出的 UMI（通用操作接口）：手持夹爪上装 GoPro 当腕部相机，每条演示约 30 秒，号称两分钟内就能在任意家庭或餐厅开始采集，训出的策略可部署到不同机械臂。DexUMI 把思路推到灵巧手，用手部外骨骼对齐运动学，再把视频里的人手修补成机器人手。关键是装置和真机的外形、视角、动作能力要尽量一致，否则会留下本体差异。","example":"UMI 的摆杯子任务：采集者拿着手持夹爪在不同场所示范把杯子摆到碟子上，回去用这些数据训练策略，直接部署到机械臂上执行。","related":["通用操作接口","手持夹爪采集","DexUMI","可穿戴采集","采执同构","本体差异"]},{"id":"handheld-gripper-data-collection","category":"data","sec":2,"tier":2,"sources":[{"title":"Universal Manipulation Interface (UMI) 项目主页","url":"https://umi-gripper.github.io/"},{"title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots (arXiv 2402.10329)","url":"https://arxiv.org/abs/2402.10329"}],"as_of":"","related_ids":["universal-manipulation-interface","fastumi","agilex-pika","robot-free-data-collection","capture-execution-isomorphism","dexumi"],"name":"手持夹爪采集","alt":"Handheld Gripper Data Collection","abbr":"","aliases":["手持式采集","手持采集器","UMI 式采集"],"one_liner":"人手拿着装了相机的夹爪直接干活，录下画面和夹爪轨迹当机器人训练数据。","explanation":"手持夹爪采集是一种不需要真机器人的采集方式：采集员手握一个和机器人末端同款的夹爪，夹爪上装相机，直接在真实环境里完成任务，事后从视频里恢复夹爪的位姿轨迹和开合宽度，作为动作标签。代表是斯坦福、哥伦比亚大学和丰田研究院在 RSS 2024 发表的 UMI：腕部 GoPro 配 155 度鱼眼镜头和两侧反光镜，用视觉-惯性 SLAM（同时定位与建图）追踪轨迹。它比遥操作便宜、便携，能带出实验室采集，UMI 报告采集速度是遥操作的 3 倍以上。前提是训练和部署时夹爪与相机视角保持一致。","example":"UMI 用手持夹爪采集洗碗、双臂叠衣服、扔物体等演示，训练出的策略直接部署到机械臂上，能在没见过的环境和物体上完成任务。","related":["通用操作接口","FastUMI","松灵 Pika 采集套件","无本体采集","采执同构","DexUMI"]},{"id":"universal-manipulation-interface","category":"data","sec":2,"tier":1,"sources":[{"title":"Chi et al. 2024: Universal Manipulation Interface (arXiv 2402.10329)","url":"https://arxiv.org/abs/2402.10329"},{"title":"UMI 项目页","url":"https://umi-gripper.github.io/"}],"as_of":"2024-03","related_ids":["handheld-gripper-data-collection","robot-free-data-collection","fastumi","umi-on-legs","dexumi","rdt2"],"name":"通用操作接口","alt":"Universal Manipulation Interface","abbr":"UMI","aliases":["UMI 夹爪","UMI 手持采集","UMI Gripper"],"one_liner":"拿手持夹爪录演示、不用真机也能训练可部署策略的采集方案。","explanation":"UMI 由斯坦福、哥伦比亚大学和丰田研究院在 2024 年 2 月提出（Cheng Chi、Shuran Song 等）。人手持 3D 打印的平行夹爪干活，夹爪上装一台 155° 鱼眼 GoPro，两侧小镜子提供额外视角；事后用视觉 SLAM 算法 ORB-SLAM3 结合 GoPro 自带的 IMU（惯性测量单元）还原夹爪在空间中的 6 自由度位姿，用标记点跟踪手指开合，得到动作标签。手持夹爪和机器人上装的夹爪、相机位置一致，所以采集时不需要机器人在场，可以去家里、户外等真实场景录。再配合延迟匹配（补偿不同机器人相机和电机的时间延迟）和相对轨迹动作表示，同一策略能部署到 UR5e 和 Franka 上。","example":"论文用 UMI 数据训练的策略完成了摆放杯子、洗碗、把物体甩进对应的筐和双臂叠衣服等任务；夹爪物料成本约 73 美元，GoPro 及配件约 298 美元；在摆杯子任务上每小时能采约 111 条演示，是 SpaceMouse（3D 鼠标）遥操作的 3 倍多。","related":["手持夹爪采集","无本体采集","FastUMI","UMI on Legs","DexUMI","RDT2"]},{"id":"umi-on-legs","category":"data","sec":2,"tier":3,"sources":[{"title":"UMI on Legs 项目主页","url":"https://umi-on-legs.github.io/"},{"title":"arXiv 2407.10353: UMI on Legs","url":"https://arxiv.org/abs/2407.10353"}],"as_of":"2024-07","related_ids":["universal-manipulation-interface","handheld-gripper-data-collection","whole-body-control","diffusion-policy","mobile-manipulation","quadruped-robot"],"name":"UMI on Legs","alt":"UMI on Legs: Making Manipulation Policies Mobile with Manipulation-Centric Whole-body Controllers","abbr":"","aliases":[],"one_liner":"用手持夹爪采的人类演示训练操作策略，再搬到带机械臂的四足机器狗上执行。","explanation":"斯坦福与哥伦比亚大学宋舒然团队（Huy Ha、Yihuai Gao 等）2024 年 7 月发表的 CoRL 2024 论文，硬件是一台宇树 Go2 四足背上装一条 ARX5 六轴机械臂。做法分两半：操作技能用 UMI 手持夹爪（装了 GoPro 的夹子，采数据不需要机器人）在真实世界采演示，训练扩散策略；腿和臂的协调交给仿真里用强化学习训练的全身控制器（同时驱动腿和臂的底层控制器）。两者之间只传「任务坐标系下的末端轨迹」，所以为固定底座机械臂训练的策略也能直接装到机器狗上用。论文在扔球、推壶铃、摆杯子三类任务上成功率都超过 70%。","example":"机器狗把球扔进桶里：上层策略根据 UMI 数据给出夹爪的目标轨迹，全身控制器负责调整腿部姿态、保持平衡并完成投掷动作。","related":["通用操作接口","手持夹爪采集","全身控制","扩散策略","移动操作","四足机器人"]},{"id":"fastumi","category":"data","sec":2,"tier":3,"sources":[{"title":"FastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface with Dataset (arXiv)","url":"https://arxiv.org/abs/2409.19499"},{"title":"FastUMI-100K: Advancing Data-driven Robotic Manipulation with a Large-scale UMI-style Dataset (arXiv)","url":"https://arxiv.org/abs/2510.08022"}],"as_of":"2025-10","related_ids":["universal-manipulation-interface","handheld-gripper-data-collection","robot-free-data-collection","agilex-pika","demonstration-data","visual-inertial-odometry"],"name":"FastUMI","alt":"FastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface","abbr":"","aliases":["FastUMI-100K"],"one_liner":"上海 AI 实验室等改进 UMI 的手持夹爪采集系统及配套数据集。","explanation":"2024 年 9 月由上海人工智能实验室牵头，联合上海交大、复旦、港大等提出，是对 UMI（通用操作接口：人手持一个带相机的夹爪做演示，数据再迁移给机器人）的改进。原版 UMI 靠 GoPro 画面跑视觉惯性里程计来算夹爪位姿，流程较复杂；FastUMI 改用现成的 RealSense T265 跟踪模块直接输出 200Hz 位姿，GoPro 鱼眼相机只负责拍画面，并用标准化的可换指尖和相机安装件，让同一套设备适配不同机械臂和夹爪。同时开源了 22 个日常任务、1 万多条轨迹的数据；2025 年 10 月又发布了 54 个家务任务、10 万多条轨迹的 FastUMI-100K。","example":"采集者手持 FastUMI 在真实家庭里做一次抓取放置，T265 记下夹爪轨迹，GoPro 录下画面，这条演示可用于训练装了同款指尖的机械臂。","related":["通用操作接口","手持夹爪采集","无本体采集","松灵 Pika 采集套件","演示数据","视觉惯性里程计"]},{"id":"agilex-pika","category":"data","sec":2,"tier":3,"sources":[{"title":"agilexrobotics/pika_ros (GitHub)","url":"https://github.com/agilexrobotics/pika_ros"},{"title":"agilexrobotics/pika_sdk (GitHub)","url":"https://github.com/agilexrobotics/pika_sdk"},{"title":"AgileX Pika 产品页","url":"https://global.agilex.ai/products/pika"}],"as_of":"2026-09","related_ids":["handheld-gripper-data-collection","universal-manipulation-interface","robot-free-data-collection","capture-execution-isomorphism","agilex-robotics","fastumi"],"name":"松灵 Pika 采集套件","alt":"AgileX Pika","abbr":"","aliases":["Pika Sense","Pika 手持采集器","Pika Gripper","Pika Pro"],"one_liner":"松灵机器人的手持式具身数据采集套件，人拿着它干活就能录下操作数据。","explanation":"Pika 是松灵机器人（AgileX Robotics）推出的具身智能空间数据采集产品，思路与 UMI 相近：不用真机器人，人手持带夹爪的采集器做任务，同时录下画面和动作。官方开源仓库介绍，它由采集设备 Pika Sense、执行模型推理的夹爪 Pika Gripper、定位基站和数据背包组成，可记录 6 自由度位姿、深度、超广角 RGB 图像和夹爪开合状态；SDK 文档显示 Sense 上装有鱼眼相机、RealSense 深度相机和用于定位的 Vive Tracker。采集端与执行端的夹爪相机布置一致，录下的数据训练出策略后，可以把 Pika Gripper 装到机械臂末端直接执行。较新的 Pika Pro 套装还加了第一人称头戴采集设备 Pika EGO。","example":"典型流程：采集员手持 Pika Sense 在真实厨房重复做「把杯子放进水槽」，用录下的腕部画面和夹爪位姿训练扩散策略，再把 Pika Gripper 装到机械臂上执行。","related":["手持夹爪采集","通用操作接口","无本体采集","采执同构","松灵机器人","FastUMI"]},{"id":"wearable-data-collection","category":"data","sec":2,"tier":3,"sources":[{"title":"无本体数据采集技术演进：从 UMI、可穿戴采集到规模化交付（新浪科技，2026-09）","url":"https://finance.sina.com.cn/tech/roll/2026-09-17/doc-iniscqyc0291536.shtml"},{"title":"arXiv 2512.24310: World In Your Hands","url":"https://arxiv.org/abs/2512.24310"}],"as_of":"2026-09","related_ids":["robot-free-data-collection","handheld-gripper-data-collection","egocentric-video","data-glove","motion-retargeting","human-video-data"],"name":"可穿戴采集","alt":"Wearable Data Collection","abbr":"","aliases":["穿戴式采集","可穿戴数采"],"one_liner":"让人戴上相机、手套等设备照常干活，把人的动作录成机器人训练数据。","explanation":"无本体采集（采数据时不需要真机器人）的主要形式之一。采集员头戴或胸挂相机、手腕装相机，常再配数据手套、IMU（惯性测量单元，测加速度和角速度）或触觉传感器，在工厂、超市、家庭等真实场景里照常干活，设备同步记录第一人称视频、深度、手部和身体位姿。和遥操作比，它不用把机器人搬进现场，成本低、动作自然、易于铺开；代价是人手和机器人手结构不同，动作要经过重定向或额外建模才能给机器人用。和 UMI 这类手持夹爪比，它能记下更丰富的手部动作，但和机器人末端的对应更弱。工程难点在多传感器时间同步、标定、遮挡恢复和坐标统一。","example":"它石智航让采集员穿戴自研套件在工厂、超市、酒店等场景作业，录下 1000 多小时人手操作数据，整理成 WIYH 数据集。","related":["无本体采集","手持夹爪采集","第一人称视频","数据手套","动作重定向","人类视频数据"]},{"id":"dexcap","category":"data","sec":2,"tier":3,"sources":[{"title":"DexCap 项目主页","url":"https://dex-cap.github.io"},{"title":"DexCap (arXiv)","url":"https://arxiv.org/abs/2403.07788"},{"title":"DexCap GitHub 仓库（RSS 2024）","url":"https://github.com/j96w/DexCap"}],"as_of":"2024-03","related_ids":["motion-capture","data-glove","robot-free-data-collection","dexumi","leap-hand","human-in-the-loop"],"name":"DexCap","alt":"DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation","abbr":"","aliases":[],"one_liner":"斯坦福的穿戴式手部动捕系统，用人手采数据教机器人灵巧手。","explanation":"DexCap 是斯坦福李飞飞团队（第一作者 Chen Wang）提出的便携式手部动作捕捉采集系统，发表于 RSS 2024，配套提出从人手数据学策略的算法 DexIL。遥操作采灵巧手数据慢、贵，还得有机器人在场；DexCap 让人戴上设备直接用自己的手干活：Rokoko 电磁场动捕手套测手指相对手掌的位置，不怕被物体遮挡；胸前支架装一台 RGB-D 激光雷达相机和三台 SLAM 追踪相机，记录手腕位姿和场景点云；背包里的迷你电脑和充电宝支持约 40 分钟采集。DexIL 用逆运动学把人手动作转成 LEAP 机器人手的动作，再用点云模仿学习训练策略，部署时还可让人介入纠正。","example":"论文展示了只用约 30 分钟人手动捕数据、不做任何遥操作训练出的策略，以及双手泡茶、用剪刀剪东西等任务。","related":["动作捕捉","数据手套","无本体采集","DexUMI","LEAP Hand","人在回路"]},{"id":"dexwild","category":"data","sec":2,"tier":3,"sources":[{"title":"DexWild 项目主页","url":"https://dexwild.github.io"},{"title":"DexWild (arXiv)","url":"https://arxiv.org/abs/2505.07813"}],"as_of":"2025-05","related_ids":["in-the-wild-data","co-training","data-glove","cross-embodiment","leap-hand","robot-free-data-collection"],"name":"DexWild","alt":"DexWild: Dexterous Human Interactions for In-the-Wild Robot Policies","abbr":"","aliases":["DexWild-System"],"one_liner":"CMU 的便携手部采集系统，让普通人在各种真实场景用手采灵巧操作数据。","explanation":"DexWild 是卡内基梅隆大学 Deepak Pathak 团队提出的灵巧操作数据采集与训练方案，发表于 RSS 2025。遥操作数据质量高但贵，很难覆盖足够多的环境；DexWild 让普通人戴上低成本便携设备 DexWild-System，用自己的手在真实场景里采数据：动捕手套测手指姿态，手套上的标记由一台追踪相机定位手腕，手掌上两台相机拍局部画面，画面里几乎看不到手本身，方便跨本体使用。10 名未受训练的采集者在 93 个环境中采了 9290 条演示，速度约为遥操作的 4.6 倍。人手数据和少量机器人数据协同训练后，策略在没见过的环境中成功率 68.5%，约为只用机器人数据的 4 倍。","example":"叠衣服任务用约 1124 条人手演示加 290 条机器人演示协同训练；训练用的是 LEAP 手加 xArm，还能零样本迁移到 Franka 机械臂上。","related":["野外数据","协同训练","数据手套","跨本体","LEAP Hand","无本体采集"]},{"id":"capture-execution-isomorphism","category":"data","sec":2,"tier":3,"sources":[{"title":"帕西尼 PXCap III 三指数据采集手套（官网）","url":"https://paxini.com/cn/ax/pxcap3"},{"title":"数据决定上限：25家国内具身智能数据采集厂商盘点（艾邦机器人）","url":"https://www.aibangbots.com/a/11921"},{"title":"UMI: Universal Manipulation Interface 项目主页","url":"https://umi-gripper.github.io/"}],"as_of":"2026-09","related_ids":["robot-free-data-collection","universal-manipulation-interface","motion-retargeting","embodiment-gap","leader-follower-teleoperation","paxini-tech"],"name":"采执同构","alt":"Collection-Execution Isomorphism","abbr":"","aliases":["采集-执行同构","采集-执行双末端同构","采执原生同构"],"one_liner":"采集设备与机器人执行末端结构一致，采到的数据可直接用在同构机器人上。","explanation":"采执同构是国内具身数据行业近年常用的说法，指采集端（人手持或穿戴的夹爪、手套，或遥操作用的主臂）与执行端（机器人上的夹爪、灵巧手）在运动学结构、自由度、传感器布局乃至相机视角上保持一致。这样采到的关节角、触觉和画面可以直接当作执行端的观测和动作，省掉动作重定向（把人的动作换算成机器人动作）带来的误差，缩小本体差异。ALOHA 的同构主从臂、UMI 让手持夹爪与机器人共用腕部相机视角，都体现了类似思路；帕西尼等厂商则把它做成产品卖点，宣称采集手套与执行末端 1:1 物理同构、「采集即部署」。代价是采集设备绑定特定末端，换一种机械手往往就要换一套采集设备。","example":"帕西尼的 PXCap III 三指采集手套与 PXDex III 三指执行末端按传感器布局、连杆和关节自由度一致来设计，手套采到的触觉和关节数据可直接用于装同款末端的机器人。","related":["无本体采集","通用操作接口","动作重定向","本体差异","主从臂遥操作","帕西尼感知"]},{"id":"skill-capture-glove","category":"data","sec":2,"tier":3,"sources":[{"title":"Sunday Robotics 官网","url":"https://www.sunday.ai/"},{"title":"Sunday: ACT-1, a robot foundation model trained on zero robot data","url":"https://www.sunday.ai/journal/no-robot-data"},{"title":"Humanoids Daily: Sunday Unveils Memo, a Wheeled Domestic Robot That Learns From $200 Gloves","url":"https://www.humanoidsdaily.com/news/sunday-unveils-memo-a-wheeled-domestic-robot-that-learns-from-200-gloves"}],"as_of":"2026-09","related_ids":["sunday-robotics","sunday-robotics-memo","sunday-robotics-act-1","robot-free-data-collection","capture-execution-isomorphism","universal-manipulation-interface"],"name":"技能采集手套","alt":"Skill Capture Glove (Sunday Robotics)","abbr":"","aliases":["Skill Capture Glove","Sunday 采集手套"],"one_liner":"Sunday Robotics 让人戴着做家务、直接产出机器人训练数据的手套。","explanation":"技能采集手套是美国家用机器人公司 Sunday Robotics 的数据采集装置，2025 年 11 月随家务机器人 Memo 公开；公司由 ACT/ALOHA 作者 Tony Zhao 和 Diffusion Policy/UMI 作者 Cheng Chi 创办。手套与 Memo 的机械手几何形状和传感器布局相同，人戴着它在家做家务，录下的动作和力数据几乎不用转换就能当机器人数据；剩余的本体差异由 Skill Transform 流程处理，官方称转换成功率约 90%。据报道每只手套成本约 200 美元，一套遥操作设备约 2 万美元。它是无本体采集、采执同构思路的代表。","example":"Sunday 称已向「Memory Developers」（在家戴手套录制家务的人）发出数千只手套，据报道数据来自约 500 个家庭，用于训练其基础模型 ACT-1，让 Memo 学洗碗、做咖啡、叠衣服等家务。","related":["Sunday Robotics","Sunday Memo","Sunday ACT-1","无本体采集","采执同构","通用操作接口"]},{"id":"dexumi","category":"data","sec":2,"tier":3,"sources":[{"title":"DexUMI 项目主页","url":"https://dex-umi.github.io"},{"title":"DexUMI (arXiv)","url":"https://arxiv.org/abs/2505.21864"}],"as_of":"2025-05","related_ids":["universal-manipulation-interface","exoskeleton","embodiment-gap","dexcap","dexterous-hand","dexop"],"name":"DexUMI","alt":"DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation","abbr":"","aliases":[],"one_liner":"用可穿戴外骨骼让人手直接采灵巧手数据，并把画面里的人手换成机器人手。","explanation":"DexUMI 是斯坦福宋舒然团队与哥伦比亚大学、英伟达等 2025 年提出的灵巧手数据采集与策略学习框架，入围 CoRL 2025 最佳论文候选。它把 UMI（通用操作接口，用手持夹爪采数据）的思路推广到多指灵巧手，用人手当采集接口，并从两方面缩小人手和机器人手的本体差异。硬件上，为目标机器人手专门设计可穿戴外骨骼，把人手动作限制在机器人手做得到的范围内，人也能直接感到接触；手腕位姿用 iPhone 记录，腕下装广角相机，外骨骼带触觉传感器。软件上，把画面里的人手和外骨骼抠掉、补全背景，再贴上同姿态的机器人手图像，让训练画面和部署时一致。在 Inspire 和 XHand 两种手上平均成功率 86%。","example":"在一项取茶叶的任务中，论文报告 DexUMI 的采集效率约为传统遥操作的 3.2 倍。","related":["通用操作接口","外骨骼","本体差异","DexCap","灵巧手","DEXOP 数据采集装置"]},{"id":"dexop","category":"data","sec":2,"tier":3,"sources":[{"title":"DEXOP 项目主页","url":"https://dex-op.github.io"},{"title":"DEXOP (arXiv)","url":"https://arxiv.org/abs/2509.04441"}],"as_of":"2025-09","related_ids":["exoskeleton","tactile-data","robot-free-data-collection","dexumi","teleoperation","contact-rich-manipulation"],"name":"DEXOP 数据采集装置","alt":"DEXOP: A Device for Robotic Transfer of Dexterous Human Manipulation","abbr":"","aliases":["DEXOP"],"one_liner":"MIT 的被动手部外骨骼，人手直接带动机器人手采集视觉和触觉数据。","explanation":"DEXOP 是 MIT Improbable AI 实验室（方浩树、Pulkit Agrawal 等）2025 年 9 月公开的灵巧手数据采集装置。作者提出一种叫 perioperation 的采集范式：记录人的真实操作，同时让数据尽量能直接迁移到机器人上。DEXOP 是被动式手部外骨骼，人的手指通过机械结构连到一只机器人手的手指上，人手怎么动，机器人手就摆出同样的姿态；机器人手上装着相机和触觉传感器，所以采到的就是机器人自己的视觉和触觉数据。和遥操作相比，操作者能通过手指直接感到接触力，动作更自然，更快也更准。论文报告，按单位采集时间算，用 DEXOP 数据训练的策略表现明显好于遥操作数据。","example":"操作者戴着 DEXOP 做接触丰富的灵巧任务，机器人手上的相机和触觉传感器同步记录，这些数据直接用来训练同一只机器人手的策略。","related":["外骨骼","触觉数据","无本体采集","DexUMI","遥操作","接触丰富操作"]},{"id":"motion-capture","category":"data","sec":3,"tier":1,"sources":[{"title":"Wikipedia: Motion capture","url":"https://en.wikipedia.org/wiki/Motion_capture"},{"title":"AMASS: Archive of Motion Capture as Surface Shapes","url":"https://amass.is.tue.mpg.de/"}],"as_of":"","related_ids":["optical-motion-capture","inertial-motion-capture","markerless-motion-capture-2","motion-retargeting","amass","data-glove"],"name":"动作捕捉","alt":"Motion Capture","abbr":"MoCap","aliases":["动捕","运动捕捉"],"one_liner":"用相机或穿戴传感器把人或物体的运动精确记录成数字数据。","explanation":"动作捕捉（动捕）是把人或物体的运动高精度记录进计算机的技术，最早大量用于电影、游戏动画和运动分析。主流方案有两类：光学动捕在身上贴反光标记点，由多台红外相机三角测量位置，精度可达毫米级甚至更高，Vicon、OptiTrack 是代表厂商；惯性动捕在身上绑 IMU（测角速度和加速度的传感器），不需要外部相机，适合户外和大范围使用，代表是 Xsens。此外还有只靠普通视频估计姿态的无标记动捕。在具身智能里，动捕数据经动作重定向后可训练人形机器人的全身动作跟踪，也用于遥操作和给数据集提供位姿真值。","example":"AMASS 把 15 个光学动捕数据集统一转成 SMPL 格式（一种用少量参数描述体型和姿态的人体网格模型），包含 300 多名受试者、1 万多段动作，常被用来训练人形机器人的运动跟踪策略。","related":["光学动捕","惯性动捕","视频动捕（无标记动捕）","动作重定向","AMASS 人体动捕数据集","数据手套"]},{"id":"optical-motion-capture","category":"data","sec":3,"tier":3,"sources":[{"title":"Motion capture - Wikipedia（Optical systems 一节）","url":"https://en.wikipedia.org/wiki/Motion_capture"},{"title":"Object Motion Guided Human Motion Synthesis（OMOMO 采集设置）","url":"https://arxiv.org/html/2309.16237"}],"as_of":"","related_ids":["motion-capture","inertial-motion-capture","markerless-motion-capture","vicon","optitrack","amass"],"name":"光学动捕","alt":"Optical Motion Capture","abbr":"","aliases":["光学动作捕捉","标记点动捕","Optical MoCap"],"one_liner":"用多台红外相机追踪身上的标记点，三角测量出三维动作","explanation":"光学动捕是动作捕捉的主流方式之一：在人或物体上贴反光标记点（被动式）或发光 LED（主动式），周围架多台标定好的红外相机，各自拍到标记点的二维位置后三角测量出三维坐标，再拟合成骨骼或人体模型的动作。代表厂商有 Vicon、OptiTrack。它精度高（主动式可达约 0.1 毫米），帧率常见 120 帧/秒以上，常被当作人体动作数据的「金标准」；缺点是设备贵、只能在专门场地用，标记点被遮挡会丢点。与之互补的是惯性动捕（靠 IMU，不怕遮挡但会漂移）和无标记动捕（直接从视频估计姿态）。AMASS、OMOMO 等数据都来自光学动捕。","example":"OMOMO 数据集用 12 台 Vicon 相机以 120 帧/秒记录受试者搬动物体，每个物体上贴 5 个标记点，同时追踪人和物体的运动。","related":["动作捕捉","惯性动捕","无标记动捕","Vicon","OptiTrack","AMASS 人体动捕数据集"]},{"id":"inertial-motion-capture","category":"data","sec":3,"tier":3,"sources":[{"title":"Motion capture - Wikipedia","url":"https://en.wikipedia.org/wiki/Motion_capture"},{"title":"Xsens Motion Capture","url":"https://www.xsens.com/products/motion-capture"}],"as_of":"","related_ids":["motion-capture","optical-motion-capture","inertial-measurement-unit","motion-retargeting","whole-body-teleoperation","xsens"],"name":"惯性动捕","alt":"Inertial Motion Capture","abbr":"","aliases":["惯性动作捕捉","IMU 动捕","动捕服"],"one_liner":"在身上绑一组 IMU 测各部位转动，算出全身姿态的动作捕捉方式。","explanation":"惯性动捕把十几个惯性测量单元（IMU，内含陀螺仪、加速度计和磁力计）固定在身体各段，测出每段的朝向和加速度，再由软件拼到人体骨架上还原全身姿态。Xsens 的方案用 17 个无线传感器，国内诺亦腾也做这类产品。和靠多台相机拍反光标记点的光学动捕相比，它不需要布置摄像机，不怕遮挡，可以在户外、工厂等任意场地使用，价格也更低；缺点是只能直接算出相对姿态，全局位置会随时间漂移，精度不如光学动捕。在具身智能里，它常用于人形机器人全身遥操作和人体动作数据采集：采到的人体动作经动作重定向（把人的关节角换算到机器人关节上）后，给机器人实时跟随或拿去训练策略。","example":"操作员穿 Xsens 动捕服，把全身动作实时流进 ROS 或 MuJoCo，重定向后驱动人形机器人同步做出相同动作。","related":["动作捕捉","光学动捕","惯性测量单元","动作重定向","全身遥操作","Xsens"]},{"id":"markerless-motion-capture-2","category":"data","sec":3,"tier":3,"sources":[{"title":"Motion capture - Wikipedia（Markerless 部分）","url":"https://en.wikipedia.org/wiki/Motion_capture"},{"title":"HumanPlus: Humanoid Shadowing and Imitation from Humans (arXiv 2406.10454)","url":"https://arxiv.org/abs/2406.10454"},{"title":"VideoMimic 项目主页","url":"https://www.videomimic.net/"}],"as_of":"2025-09","related_ids":["motion-capture","optical-motion-capture","human-mesh-recovery","gvhmr","humanplus","videomimic"],"name":"视频动捕（无标记动捕）","alt":"Markerless / Video-based Motion Capture","abbr":"","aliases":["无标记动捕","单目动捕","Markerless Mocap","视觉动捕"],"one_liner":"不贴标记点、不穿动捕服，直接从普通视频里估计人体三维动作。","explanation":"视频动捕指不依赖反光标记点或惯性传感器，只用一台或几台普通相机拍摄，再由计算机视觉算法估计人体（包括手）的三维姿态和运动轨迹。与光学动捕相比，它不需要专门场地和穿戴准备，也能处理手机拍摄或互联网视频，因此能大量获取人类动作；代价是精度较低、噪声较多，单目视频还有深度和尺度不确定、遮挡等问题，通常需要后处理或物理约束修正。常用模型有 WHAM、GVHMR（浙江大学，从单目视频恢复世界坐标系下的人体运动）等，手部常用 HaMeR。在具身智能中，它是人形机器人从人类视频学动作、做实时遥操作的数据入口：估计出的人体动作经动作重定向映射到机器人上，再用于训练运动跟踪策略。","example":"HumanPlus 用一台 RGB 相机实时估计人的身体（WHAM）和手部（HaMeR）姿态，让人形机器人跟随操作员动作；伯克利 VideoMimic 从随手拍的单目视频里同时重建人体轨迹和场景几何，训练人形机器人上下楼梯、坐下和起身。","related":["动作捕捉","光学动捕","人体网格恢复","GVHMR","HumanPlus","VideoMimic"]},{"id":"bvh-fbx-motion-capture-file-formats","category":"data","sec":3,"tier":3,"sources":[{"title":"Biovision BVH（威斯康星大学课程资料）","url":"https://research.cs.wisc.edu/graphics/Courses/cs-838-1999/Jeff/BVH.html"},{"title":"FBX - Wikipedia","url":"https://en.wikipedia.org/wiki/FBX"},{"title":"GMR: General Motion Retargeting (GitHub)","url":"https://github.com/YanjieZe/GMR"}],"as_of":"","related_ids":["motion-capture","motion-retargeting","general-motion-retargeting","lafan1","amass","smpl"],"name":"BVH / FBX 动捕文件格式","alt":"BVH / FBX Motion Capture File Formats","abbr":"","aliases":["BioVision Hierarchy","Filmbox",".bvh",".fbx"],"one_liner":"存人体骨架结构和逐帧关节旋转的两种常见动作捕捉文件格式。","explanation":"BVH（BioVision Hierarchy）由动捕公司 Biovision 制定，是纯文本格式：HIERARCHY 段用 ROOT、JOINT 组成的树描述骨架，写明各关节相对父关节的偏移和旋转通道；MOTION 段给出帧数、帧间隔，之后每行一帧列出各关节旋转角（根关节还有平移）。它只存骨架动作，不含网格和材质。FBX 最初是 Kaydara 为动捕软件 Filmbox 设计的格式，现归 Autodesk，可同时存几何、骨骼、动画和材质，格式不公开，通常用官方 SDK 读写。人形机器人做动作模仿时，常把这两种文件里的人体动作重定向到机器人关节上，例如 GMR 支持 LAFAN1 的 BVH 和 OptiTrack 导出的 FBX。","example":"Ubisoft 公开的 LAFAN1 动捕数据是 BVH 文件，研究者用 GMR 把其中走路、跳舞的片段重定向到宇树 G1 的关节上，作为运动跟踪策略的参考动作。","related":["动作捕捉","动作重定向","GMR 通用动作重定向","LAFAN1 动捕数据集","AMASS 人体动捕数据集","SMPL 人体模型"]},{"id":"amass","category":"data","sec":3,"tier":2,"sources":[{"title":"AMASS 官网","url":"https://amass.is.tue.mpg.de/"},{"title":"Mahmood et al. 2019: AMASS (arXiv 1904.03278)","url":"https://arxiv.org/abs/1904.03278"},{"title":"He et al. 2024: H2O: Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation","url":"https://arxiv.org/html/2403.04436"}],"as_of":"2019-10","related_ids":["smpl","motion-retargeting","motion-tracking","optical-motion-capture","lafan1","h2o"],"name":"AMASS 人体动捕数据集","alt":"AMASS (Archive of Motion Capture as Surface Shapes)","abbr":"AMASS","aliases":["AMASS 数据集"],"one_liner":"把 15 个光学动捕数据集统一成 SMPL 人体模型格式的大型人体动作库。","explanation":"AMASS 由德国马普智能系统研究所的 Mahmood、Black 等人提出，发表于 ICCV 2019。以前各家光学动捕数据集的标记点布置、骨架定义都不一样，很难合并使用。作者用 MoSh++ 方法把原始标记点数据拟合成 SMPL 参数化人体模型（用几十个参数描述人的姿态和体型）的序列，统一了 15 个数据集，共 300 多名受试者、1.1 万多段动作、40 多小时。在具身智能里，它是人形机器人运动跟踪和全身控制常用的人类动作来源：先把 SMPL 动作重定向成机器人关节轨迹，再在仿真里用强化学习训练策略去跟踪。需注册后下载，面向科研使用。","example":"H2O 把 AMASS 约 1.3 万段动作重定向到 Unitree H1 上得到 1 万段，再用仿真里的模仿策略筛掉机器人做不出来的动作，留下约 8500 段用于训练人形全身遥操作策略。","related":["SMPL 人体模型","动作重定向","运动跟踪","光学动捕","LAFAN1 动捕数据集","H2O（人到人形）"]},{"id":"lafan1","category":"data","sec":3,"tier":3,"sources":[{"title":"Ubisoft La Forge Animation Dataset（LAFAN1）GitHub","url":"https://github.com/ubisoft/ubisoft-laforge-animation-dataset"},{"title":"GMR: General Motion Retargeting（GitHub）","url":"https://github.com/YanjieZe/GMR"},{"title":"BeyondMimic whole_body_tracking（GitHub）","url":"https://github.com/HybridRobotics/whole_body_tracking"}],"as_of":"2020","related_ids":["amass","optical-motion-capture","motion-retargeting","general-motion-retargeting","beyondmimic","motion-tracking"],"name":"LAFAN1 动捕数据集","alt":"LAFAN1 (Ubisoft La Forge Animation Dataset)","abbr":"","aliases":["LAFAN","LaFAN1"],"one_liner":"育碧 La Forge 公开的人体动捕数据集，常作人形机器人模仿动作的来源。","explanation":"LAFAN1 是育碧（Ubisoft）研发部门 La Forge 随 SIGGRAPH 2020 论文《Robust Motion In-betweening》公开的光学动捕数据集（光学动捕：身上贴反光标记点、用多台相机追踪）。它包含 5 名演员的 77 段序列、约 49.7 万帧、30 帧/秒，合计约 4.6 小时，动作有走、跑、跳、格斗、爬行、摔倒后起身、跳舞、翻越障碍等，以 BVH 骨骼动画格式发布，协议为 CC BY-NC-ND 4.0（署名、非商用、禁止演绎）。它原本用于游戏动画的中间帧补全，近年在人形机器人领域用得很多：先用动作重定向把人体动作映射到机器人关节，再在仿真里用强化学习训练运动跟踪策略。宇树发布过重定向到自家人形机器人的 LAFAN1 版本，GMR 重定向工具也直接支持它的 BVH 文件。","example":"伯克利 BeyondMimic 的开源代码直接使用宇树重定向后的 LAFAN1 动作训练跟踪策略，作者称数据集中适合上真机的动作都能不调参数直接训练。","related":["AMASS 人体动捕数据集","光学动捕","动作重定向","GMR 通用动作重定向","BeyondMimic","运动跟踪"]},{"id":"humanml3d","category":"data","sec":3,"tier":3,"sources":[{"title":"HumanML3D GitHub","url":"https://github.com/EricGuo5513/HumanML3D"}],"as_of":"","related_ids":["text-to-motion","amass","mdm","motion-retargeting","smpl","motion-tracking"],"name":"HumanML3D 数据集","alt":"HumanML3D (Text-annotated 3D Human Motion Dataset)","abbr":"","aliases":["HumanML3D"],"one_liner":"给 1.4 万段 3D 人体动作配上 4.5 万句文字描述的文本-动作数据集。","explanation":"HumanML3D 出自 Guo 等人 CVPR 2022 论文 Generating Diverse and Natural 3D Human Motions From Text。作者从 AMASS 和 HumanAct12 两个人体动捕数据集里取出 14616 段动作，每段请人写 3–4 句英文描述，共 44970 句、约 28.59 小时，内容从日常动作到运动、舞蹈都有；动作统一为 20 帧每秒、22 个关节的骨架，并通过左右镜像把数据量翻倍。它是文本生成人体动作（输入一句话、输出一段 3D 动作）最常用的训练和评测基准，MDM 等动作扩散模型都在上面报告结果。对人形机器人来说，先用文本生成人体动作、再重定向到机器人上，是让机器人按指令做动作的一条路线。","example":"输入「a person walks forward and then sits down」，在 HumanML3D 上训练的模型生成一段先走后坐的 3D 骨架动作，再重定向给人形机器人跟踪执行。","related":["文本驱动动作生成","AMASS 人体动捕数据集","MDM（人体动作扩散模型）","动作重定向","SMPL 人体模型","运动跟踪"]},{"id":"omomo","category":"data","sec":3,"tier":3,"sources":[{"title":"Object Motion Guided Human Motion Synthesis (arXiv 2309.16237)","url":"https://arxiv.org/abs/2309.16237"},{"title":"Object Motion Guided Human Motion Synthesis (arXiv HTML 全文)","url":"https://arxiv.org/html/2309.16237"}],"as_of":"2023-09","related_ids":["human-object-interaction","optical-motion-capture","smpl","diffusion-model","omniretarget","motion-retargeting"],"name":"OMOMO 人-物交互动作数据集","alt":"OMOMO (Object Motion Guided Human Motion Synthesis) Dataset","abbr":"","aliases":["OMOMO","OMOMO Dataset"],"one_liner":"斯坦福用光学动捕录制的约 10 小时全身搬动日常物体动作数据","explanation":"OMOMO 数据集出自斯坦福大学 Jiaman Li、吴佳俊、C. Karen Liu 的 SIGGRAPH Asia 2023 论文。作者用 12 台相机的 Vicon 光学动捕，记录 17 名受试者搬动、拖拽 15 种日常物体（拖把、落地灯、椅子、桌子、箱子等）的全身动作，共约 10 小时，提供物体 3D 几何、物体运动和 SMPL-X 人体动作。论文方法是只给物体怎么动，用条件扩散模型先预测手的位置、再生成全身姿态。这是少有的全身与大件物体交互数据，现在常作为人形机器人学搬运、推拉等全身操作的参考动作，例如 OmniRetarget 就用它重定向到宇树 G1。","example":"给定一把椅子被拖动的运动轨迹，OMOMO 方法生成一个人弯腰抓住椅背、边走边拖的全身动作。","related":["人-物交互","光学动捕","SMPL 人体模型","扩散模型","OmniRetarget","动作重定向"]},{"id":"foot-skating-floating-penetration","category":"data","sec":3,"tier":3,"sources":[{"title":"PHUMA: Physically Reliable Humanoid Locomotion Dataset (arXiv)","url":"https://arxiv.org/abs/2510.26236"},{"title":"Retargeting Matters: General Motion Retargeting for Humanoid Motion Tracking (arXiv)","url":"https://arxiv.org/abs/2510.02252"}],"as_of":"","related_ids":["motion-retargeting","general-motion-retargeting","phuma","motion-tracking","motion-capture","interpenetration"],"name":"脚滑 / 漂浮 / 穿地（动作数据伪影）","alt":"Foot Skating / Floating / Penetration (Motion Data Artifacts)","abbr":"","aliases":["脚滑步","足部滑动","Foot Sliding","地面穿透"],"one_liner":"人体动作重定向到机器人后常见的三种违反物理的脚部错误。","explanation":"把人体动捕或视频估计出的动作重定向（换算成机器人关节轨迹）时最常见的三类物理伪影：脚滑是脚本应踩稳地面，却在水平方向滑动；漂浮是该着地时脚悬在地面上方；穿地是脚陷到地面以下。它们多来自人和机器人身高、腿长比例不同带来的缩放误差，以及视频姿态估计本身的误差。这些问题肉眼看不明显，但在物理仿真里训练运动跟踪策略时，机器人复现不了这些动作，会导致平衡学不好、跟踪误差变大。常见处理是在重定向时加约束：接触帧强制脚高贴合地面、压低接触时的脚部水平速度，或按阈值筛掉问题片段，GMR、PHUMA 等工作都专门处理了这类伪影。","example":"PHUMA 用三项指标衡量：接触时脚离地 1 厘米以内算不漂浮、陷入 1 厘米以内算不穿地、水平速度低于 10 厘米/秒算不脚滑。","related":["动作重定向","GMR 通用动作重定向","PHUMA 人形动作数据集","运动跟踪","动作捕捉","穿模"]},{"id":"general-motion-retargeting","category":"data","sec":3,"tier":3,"sources":[{"title":"Retargeting Matters: General Motion Retargeting for Humanoid Motion Tracking (arXiv)","url":"https://arxiv.org/abs/2510.02252"},{"title":"GMR (GitHub)","url":"https://github.com/YanjieZe/GMR"}],"as_of":"2026-09","related_ids":["motion-retargeting","foot-skating-floating-penetration","twist","lafan1","amass","motion-tracking"],"name":"GMR 通用动作重定向","alt":"General Motion Retargeting","abbr":"GMR","aliases":["Retargeting Matters: General Motion Retargeting for Humanoid Motion Tracking"],"one_liner":"斯坦福开源的把人体动作实时映射到多款人形机器人的重定向工具。","explanation":"斯坦福大学吴佳俊、C. Karen Liu 团队（Araújo、Yanjie Ze 等）2025 年开源的动作重定向方法与代码库。动作重定向是把人的动作换算成机器人关节角，难点在于两者身材比例和关节结构不同。GMR 先指定人体与机器人对应的身体部位、对齐两者的静止姿态、按部位分别缩放，再用两阶段逆运动学优化求关节角，以减少脚滑、自穿透和关节角突变。输入支持 AMASS 等 SMPL-X 数据、LAFAN1 等 BVH 文件、OptiTrack FBX、Xsens 实时流，也能经 GVHMR 从单目视频提取。README 列出支持 18 款人形机器人，普通 CPU 上可达 60–70 帧/秒。论文显示它比 PHC、ProtoMotions 等开源方案更利于训练跟踪策略，也是 TWIST 遥操作系统的重定向模块。","example":"把 LAFAN1 里一段人类跑跳动捕数据用 GMR 重定向到宇树 G1，再在仿真中训练运动跟踪策略去模仿它。","related":["动作重定向","脚滑 / 漂浮 / 穿地（动作数据伪影）","TWIST","LAFAN1 动捕数据集","AMASS 人体动捕数据集","运动跟踪"]},{"id":"omniretarget","category":"data","sec":3,"tier":3,"sources":[{"title":"OmniRetarget (arXiv 2509.26633)","url":"https://arxiv.org/abs/2509.26633"},{"title":"OmniRetarget 项目主页","url":"https://omniretarget.github.io/"}],"as_of":"2026-06","related_ids":["motion-retargeting","general-motion-retargeting","omomo","lafan1","loco-manipulation","unitree-g1"],"name":"OmniRetarget","alt":"OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction","abbr":"","aliases":[],"one_liner":"把人与物体、地形的交互关系一起重定向到人形机器人的数据生成方法","explanation":"OmniRetarget 是亚马逊 FAR（前沿 AI 与机器人团队）联合 MIT、伯克利、斯坦福、CMU 在 2025 年提出的动作重定向与数据生成方法。重定向就是把人的动作换算成机器人关节动作；只对齐关键点时，搬箱子、爬台子容易出现手没碰到箱子、脚穿进地面。它用「交互网格」同时建模人、物体、地形的空间和接触关系，在满足关节限位的前提下保持这些关系，还能换机器人、地形、物体做数据增强。用 OMOMO、LAFAN1 和自采动捕生成 8 小时以上轨迹后，只需 5 项奖励就能在宇树 G1 上训出最长约 30 秒的搬箱、攀爬等动作。项目主页称其获 ICRA 2026 最佳会议论文奖。","example":"把一段人搬箱子的动捕数据重定向到宇树 G1，保持双手贴住箱子、双脚踩实地面，再用这些轨迹训练能在真机上搬箱子的强化学习策略。","related":["动作重定向","GMR 通用动作重定向","OMOMO 人-物交互动作数据集","LAFAN1 动捕数据集","运动操作一体化","宇树 G1"]},{"id":"humanoid-x","category":"data","sec":3,"tier":3,"sources":[{"title":"Learning from Massive Human Videos for Universal Humanoid Pose Control (arXiv)","url":"https://arxiv.org/abs/2412.14172"},{"title":"UH-1 项目主页（PSI Lab）","url":"https://psi-lab.ai/UH-1/"}],"as_of":"2025-10","related_ids":["human-video-data","internet-video-data","motion-retargeting","text-to-motion","humanoid-robot","uh-1"],"name":"Humanoid-X 数据集","alt":"Humanoid-X (Learning from Massive Human Videos for Universal Humanoid Pose Control, UH-1)","abbr":"","aliases":["Humanoid-X","UH-1 数据集"],"one_liner":"从海量网络人类视频提取、配文字描述的人形机器人动作数据集。","explanation":"Humanoid-X 是南加州大学、加州大学伯克利分校和丰田研究院在论文 Learning from Massive Human Videos for Universal Humanoid Pose Control 中构建的数据集，2024 年 12 月公开，论文为 Humanoids 2025 口头报告。流程是：从互联网挖掘人类动作视频，自动生成文字描述，估计视频里人的 3D 姿态，再重定向成人形机器人的关节目标，并训练控制策略把它变成机器人能实际执行的动作。最终得到 16.38 万组样本、超过 2000 万个人形机器人姿态，每组都有视频、文本、人体姿态、机器人关键点和动作。基于它训练的 UH-1 模型输入一句文字指令，输出人形机器人的动作。它的意义在于绕开昂贵的遥操作和动捕，直接用网上现成的人类视频扩充人形动作数据。","example":"给 UH-1 输入「挥手打招呼」，模型输出一串人形机器人关节动作，在仿真或真机上执行挥手。","related":["人类视频数据","互联网视频数据","动作重定向","文本驱动动作生成","人形机器人","UH-1 / Humanoid-X"]},{"id":"phuma","category":"data","sec":3,"tier":3,"sources":[{"title":"PHUMA: Physically Reliable Humanoid Locomotion Dataset (arXiv 2510.26236)","url":"https://arxiv.org/abs/2510.26236"},{"title":"PHUMA 论文 HTML 全文","url":"https://arxiv.org/html/2510.26236"}],"as_of":"2026-06","related_ids":["foot-skating-floating-penetration","humanoid-x","amass","motion-retargeting","motion-tracking","unitree-g1"],"name":"PHUMA 人形动作数据集","alt":"PHUMA: Physically Reliable Humanoid Locomotion Dataset","abbr":"","aliases":["PHUMA"],"one_liner":"经物理约束筛选和重定向的大规模人形机器人运动参考数据集","explanation":"PHUMA 是韩国科学技术院（KAIST）Jaegul Choo 团队 2025 年 10 月发布的人形机器人运动数据集。从网络视频提取再重定向的动作（如 Humanoid-X）常有漂浮、穿地、脚滑等物理上不可能的伪影。PHUMA 先做物理感知筛选，滤掉抖动过大、质心不稳、脚不着地的片段；再用 PhySINK（带物理约束的逆运动学重定向）在贴合原动作的同时满足关节限位、脚贴地、支撑脚不滑。数据合并 AMASS 等动捕与多个视频来源，共 76,010 段、约 73 小时，提供宇树 G1 和 H1-2 两个版本。用它训练的动作跟踪策略成功率高于 AMASS 和 Humanoid-X，并能零样本迁移到真实 G1。","example":"用 PHUMA 的 G1 版本训练一个通用动作跟踪策略，再让真实宇树 G1 复现视频里人的行走、转身等动作。","related":["脚滑 / 漂浮 / 穿地（动作数据伪影）","Humanoid-X 数据集","AMASS 人体动捕数据集","动作重定向","运动跟踪","宇树 G1"]},{"id":"egocentric-video","category":"data","sec":4,"tier":1,"sources":[{"title":"Ego4D 官网","url":"https://ego4d-data.org/"},{"title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video (arXiv 2505.11709)","url":"https://arxiv.org/abs/2505.11709"}],"as_of":"2025-05","related_ids":["exocentric-video","human-video-data","ego4d","egodex","project-aria-glasses","hand-pose-estimation"],"name":"第一人称视频","alt":"Egocentric Video","abbr":"Ego","aliases":["第一人称视角","第一视角视频","自我中心视频","第一人称视频数据","Egocentric View","Egocentric Video Data"],"one_liner":"用头戴或眼镜式相机从本人视角拍的视频，能看清自己的双手。","explanation":"第一人称视频由佩戴者头部或眼镜上的相机拍摄，画面就是人眼看到的样子，双手和正在操作的物体通常在画面中央，与之相对的是第三视角视频。它对机器人有用，是因为视角接近机器人头部相机，手部操作细节也看得清。代表数据集有 Meta 牵头、13 所大学参与的 Ego4D（2022 年发布，3670 多小时日常活动），以及苹果用 Vision Pro 采集、带 3D 手部关节标注的 EgoDex（829 小时）。这类视频没有机器人动作标签，要靠手部姿态估计、潜在动作（从前后帧推断出的抽象动作）等方法转换后才能训练策略。","example":"EgoDex 用 Apple Vision Pro 记录 194 种桌面操作任务，同时保存每个手指关节的 3D 位置，可直接当作手部动作轨迹使用。","related":["第三视角视频","人类视频数据","Ego4D 数据集","EgoDex 数据集","Project Aria 眼镜","手部姿态估计"]},{"id":"exocentric-video","category":"data","sec":4,"tier":3,"sources":[{"title":"Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives (arXiv)","url":"https://arxiv.org/abs/2311.18259"},{"title":"Ego-Exo4D 官网","url":"https://ego-exo4d-data.org/"}],"as_of":"","related_ids":["egocentric-video","third-person-camera","ego-exo4d","internet-video-data","human-pose-estimation","motion-retargeting"],"name":"第三视角视频","alt":"Exocentric Video","abbr":"Exo","aliases":["第三人称视频","外视角视频","Third-person Video"],"one_liner":"相机放在执行者身体之外、从旁观角度拍摄人或机器人的视频。","explanation":"与第一人称视频（相机戴在执行者头上或胸前）相对，第三视角视频的相机在执行者身体之外，比如三脚架上的相机、监控摄像头或旁人手持拍摄。网上的教学视频、体育转播大多属于这一类，数量远多于第一人称视频。它能看清全身姿态以及人和环境的整体关系，但手部细节常被身体或物体挡住，视角也和机器人自身相机看到的不同。具身智能里常用它做人体动作估计，再重定向给人形机器人模仿，或从中学任务流程；机器人数据采集中固定在桌边的第三视角相机拍的也是这类画面。Ego-Exo4D 等数据集同时录两种视角，专门研究它们之间的对应。","example":"用 GVHMR 从一段第三视角的单目视频中估计人体动作，再经 GMR 重定向成人形机器人的关节轨迹。","related":["第一人称视频","第三视角相机","Ego-Exo4D 数据集","互联网视频数据","人体姿态估计","动作重定向"]},{"id":"internet-video-data","category":"data","sec":4,"tier":2,"sources":[{"title":"LAPA: Latent Action Pretraining from Videos (arXiv 2410.11758)","url":"https://arxiv.org/abs/2410.11758"},{"title":"Ego4D 官网","url":"https://ego4d-data.org/"}],"as_of":"","related_ids":["human-video-data","action-free-video","latent-action","lapa","egocentric-video","ego4d"],"name":"互联网视频数据","alt":"Internet Video Data","abbr":"","aliases":["网络视频数据","网络视频","Web Video Data"],"one_liner":"网上公开的海量视频，量大且便宜，但没有机器人能直接用的动作标签。","explanation":"互联网视频数据指视频平台和公开视频数据集里的视频，内容多是人做家务、做饭、用工具。和机器人数据相比，它规模大几个数量级，场景和物体极其多样，包含大量关于物体怎么动、任务怎么分步的知识。难点在于没有动作标签：画面里是人手而不是机械臂，也不知道每一帧对应什么关节指令。常见用法有三类：预训练视觉表征（如 R3M）；学习潜在动作，即从相邻帧的变化中自动归纳出类似动作的编码（如 LAPA）；训练视频生成或世界模型，再从预测画面中反推动作。Ego4D 这类第一人称视频集也常被这样使用。","example":"LAPA 先用 VQ-VAE 从无标签视频的相邻帧中学出离散的潜在动作，用它预训练 VLA，再用少量真机数据把潜在动作映射成机器人指令。","related":["人类视频数据","无动作标签视频","潜在动作","LAPA","第一人称视频","Ego4D 数据集"]},{"id":"action-free-video","category":"data","sec":4,"tier":2,"sources":[{"title":"Ko et al. 2023: Learning to Act from Actionless Videos through Dense Correspondences (AVDC)","url":"https://arxiv.org/abs/2310.08576"},{"title":"Ye et al. 2024: Latent Action Pretraining from Videos (LAPA)","url":"https://arxiv.org/abs/2410.11758"}],"as_of":"","related_ids":["latent-action-pretraining","human-video-data","internet-video-data","pseudo-action-labels","latent-action-model","imitation-from-observation"],"name":"无动作标签视频","alt":"Action-free Video","abbr":"","aliases":["无动作视频","无动作标注视频","Actionless Video"],"one_liner":"只有画面、没有逐帧动作记录的视频，比如人类视频和网络视频。","explanation":"无动作标签视频指只有图像序列、没有逐帧动作标签的视频，常见来源是网上的人类操作视频、第一人称视频，以及只存了画面的机器人录像。它的量远大于带动作的机器人数据，里面有大量「物体怎么动、任务怎么做」的信息，但不能直接拿来做行为克隆。常见用法有几类：训练逆动力学模型给它补伪动作标签；用潜在动作模型从相邻帧学出离散的「潜在动作」做预训练，如 LAPA、Genie；先生成未来画面再推算动作，如 UniPi、AVDC；或只用来预训练视觉表征和世界模型。LAPA 报告，这样预训练的模型在真机任务上超过了用机器人动作标签训练的 VLA。","example":"AVDC 只用不带动作的 RGB 视频训练：先用视频生成模型合成机器人完成任务的画面，再根据相邻帧之间的稠密对应（光流）推算机器人该怎么动，在桌面操作和导航任务上做了验证。","related":["潜在动作预训练","人类视频数据","互联网视频数据","伪动作标签","潜在动作模型","从观测中模仿学习"]},{"id":"pseudo-action-labels","category":"data","sec":4,"tier":3,"sources":[{"title":"Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos (arXiv:2206.11795)","url":"https://arxiv.org/abs/2206.11795"},{"title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models (arXiv:2505.12705)","url":"https://arxiv.org/abs/2505.12705"}],"as_of":"","related_ids":["inverse-dynamics-model","latent-action-model","action-free-video","neural-trajectories","dreamgen","vpt"],"name":"伪动作标签","alt":"Pseudo Action Labels","abbr":"","aliases":["伪动作标注","Pseudo-Action Labeling","伪动作","Pseudo-actions"],"one_liner":"用模型从视频里反推出来、代替真实记录的动作标签。","explanation":"视频本身没有记录人或机器人的动作时，可以用一个模型根据前后画面「猜」出每一步的动作，把猜出来的动作当标签训练策略，这就是伪动作标签。常见做法有两种：一是先用少量带动作的数据训练逆动力学模型（由相邻两帧推出中间动作），再用它批量标注海量视频，OpenAI 的 VPT 就这样给大量 Minecraft 网络视频标上了键鼠操作；二是用潜在动作模型从视频里学出抽象的动作编码。英伟达 DreamGen 也用这两种办法给世界模型生成的视频补上伪动作，得到可训练的「神经轨迹」。它让无动作标签的视频也能用于训练，但标签有误差，通常还要用真实数据微调。","example":"VPT 先请人玩 Minecraft 并记录键鼠操作，训练出逆动力学模型，再用它给大量网络视频标注伪动作，最后用这些数据做行为克隆。","related":["逆动力学模型","潜在动作模型","无动作标签视频","神经轨迹","DreamGen（GR00T Dreams）","VPT（视频预训练）"]},{"id":"robotizing-human-videos-human-to-robot-video-translation","category":"data","sec":4,"tier":2,"sources":[{"title":"Phantom: Training Robots Without Robots Using Only Human Videos","url":"https://arxiv.org/abs/2503.00779"},{"title":"Masquerade: Learning from In-the-wild Human Videos using Data-Editing","url":"https://arxiv.org/abs/2508.09976"},{"title":"H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos","url":"https://arxiv.org/abs/2512.09406"}],"as_of":"2025-12","related_ids":["human-video-data","cross-painting","embodiment-gap","hand-pose-estimation","egocentric-video","phantom"],"name":"人类视频机器人化（人→机视频转换）","alt":"Robotizing Human Videos / Human-to-Robot Video Translation","abbr":"","aliases":["人→机视频转换","人机视频转换","Human-to-Robot Video Translation"],"one_liner":"把人手干活的视频改成「机器人在干」的画面，变成可用来训练的机器人数据。","explanation":"人类视频多又便宜，但画面里是人手人臂，和机器人相机拍到的机械臂差别很大（视觉上的本体差异），直接拿来训策略效果差。人类视频机器人化就是用图像编辑或视频生成把人换成机器人：先估计手的 3D 位姿当动作标签，再把人手人臂抠掉、补全背景（inpainting），最后叠上按同一轨迹渲染出的机械臂或夹爪。斯坦福 Bohg 组 2025 年的 Phantom 只用这样改过的人类视频训出能直接上真机的策略；同组的 Masquerade 用 67.5 万帧编辑视频预训练视觉编码器。2025 年底的 H2R-Grounder 改用微调的视频扩散模型生成机器人画面，不需要人机成对数据。","example":"Phantom 录下人用手把桌上多个物体扫拢的视频，抠掉人手后叠上渲染的机械臂，直接用这些改过的视频训练策略并部署到真机。","related":["人类视频数据","跨本体图像替换","本体差异","手部姿态估计","第一人称视频","Phantom（无机器人训练）"]},{"id":"cross-painting","category":"data","sec":4,"tier":3,"sources":[{"title":"Mirage: Cross-Embodiment Zero-Shot Policy Transfer with Cross-Painting (arXiv 2402.19249)","url":"https://arxiv.org/abs/2402.19249"},{"title":"BerkeleyAutomation/mirage (GitHub)","url":"https://github.com/BerkeleyAutomation/mirage"}],"as_of":"2024-07","related_ids":["cross-embodiment","embodiment-gap","zero-shot","robotizing-human-videos-human-to-robot-video-translation","generative-data-augmentation","forward-dynamics-model"],"name":"跨本体图像替换","alt":"Cross-Painting (Robot Embodiment Visual Swap)","abbr":"","aliases":["Cross-Painting","机器人外观替换","Mirage"],"one_liner":"把画面里的新机器人抠掉、换成训练时那台机器人，让视觉策略直接迁移。","explanation":"Cross-painting 由 UC Berkeley Ken Goldberg 团队与 Google DeepMind 研究者在 Mirage 方法中提出（RSS 2024）。视觉策略只见过源机器人，换一台外形不同的目标机器人后画面变了，策略就容易失效。做法是执行时实时用分割掩码遮掉画面里的目标机器人并补全背景，再按 URDF（机器人连杆和关节的模型文件）算出让源机器人末端到达同一位姿的关节角并渲染上去，让策略「看到」的仍是熟悉的机器人；控制差异另用正向动力学模型（预测执行动作后末端到哪）补偿。Mirage 在 Franka、UR5 和不同夹爪间实现了零样本迁移。类似的抠图加渲染流程也被用来把人类视频里的手换成机器人。","example":"只用 Franka 机械臂采的数据训练策略，部署到 UR5 上时把画面里的 UR5 实时换成渲染出的 Franka，策略不重新训练就能完成抓取等任务。","related":["跨本体","本体差异","零样本","人类视频机器人化（人→机视频转换）","生成式数据增强","正向动力学模型"]},{"id":"something-something-v2","category":"data","sec":4,"tier":3,"sources":[{"title":"The something something video database for learning and evaluating visual common sense (arXiv 1706.04261)","url":"https://arxiv.org/abs/1706.04261"},{"title":"Hugging Face: something_something_v2 数据集卡片","url":"https://huggingface.co/datasets/HuggingFaceM4/something_something_v2"},{"title":"LAPA: Latent Action Pretraining from Videos（项目页）","url":"https://latentactionpretraining.github.io/"}],"as_of":"2024-10","related_ids":["human-video-data","action-free-video","latent-action-pretraining","lapa","ego4d","epic-kitchens"],"name":"Something-Something V2 数据集","alt":"Something-Something V2","abbr":"SSv2","aliases":["20BN-something-something V2","Sth-Sth V2"],"one_liner":"约 22 万段人手摆弄日常物品的短视频，按 174 种动作模板标注。","explanation":"Something-Something V2 是 TwentyBN（20BN）公司发布的动作识别视频数据集，现由高通（Qualcomm）提供下载。它含 220,847 段短视频，每段由众包人员按给定的动作模板自己拍摄，如「把某物放进某物」「把某物倒过来」，共 174 类。模板里的物体被抽象成「某物」，模型没法靠认出物体来猜答案，必须看懂手和物体之间的动作与先后顺序，所以常用来测试视频模型的时序理解。在具身智能里，它被当作人类操作视频的来源：视频没有机器人动作标签，但包含大量手-物交互，可用于视觉表征预训练和潜在动作预训练。","example":"LAPA 只用 SSv2 的约 22 万段人类视频做潜在动作预训练，再在机器人数据上微调，项目页称其平均表现超过在 Bridge 数据上训练的 OpenVLA。","related":["人类视频数据","无动作标签视频","潜在动作预训练","LAPA","Ego4D 数据集","EPIC-KITCHENS 数据集"]},{"id":"epic-kitchens","category":"data","sec":4,"tier":3,"sources":[{"title":"Rescaling Egocentric Vision: Collection, Pipeline and Challenges for EPIC-KITCHENS-100 (arXiv)","url":"https://arxiv.org/abs/2006.13256"},{"title":"The EPIC-KITCHENS Dataset: Collection, Challenges and Baselines (arXiv)","url":"https://arxiv.org/abs/2005.00343"},{"title":"EPIC-KITCHENS 官网","url":"https://epic-kitchens.github.io/"}],"as_of":"2025-06","related_ids":["egocentric-video","ego4d","human-video-data","hand-object-interaction","affordance-detection","data-annotation"],"name":"EPIC-KITCHENS 数据集","alt":"EPIC-KITCHENS","abbr":"","aliases":["EPIC-KITCHENS-100","EPIC-KITCHENS-55"],"one_liner":"头戴相机拍摄真实厨房日常操作的经典第一人称视频数据集。","explanation":"英国布里斯托大学牵头的第一人称视频数据集，首版 EPIC-KITCHENS-55 于 2018 年发布，含 55 小时、32 名参与者。2020 年扩展为 EPIC-KITCHENS-100：参与者戴头戴相机在自家厨房做饭、洗碗，不按脚本，覆盖 45 个厨房，共 100 小时、2000 万帧、约 9 万个动作片段。标注来自参与者事后口述自己在做什么，再整理成「动词 + 名词」形式的动作标签。配套基准有动作识别、检测、预判、跨模态检索和无监督域自适应。之后又陆续补充了手-物分割（VISOR）、声音事件（EPIC-Sounds）、3D 相机信息（EPIC-Fields）等标注。机器人领域常拿它研究手-物交互、可供性和视觉表征预训练。","example":"一个动作片段标为「take plate」：视频里参与者从架子上拿起盘子，标签由动词 take 和名词 plate 组成。","related":["第一人称视频","Ego4D 数据集","人类视频数据","手物交互","可供性检测","数据标注"]},{"id":"ego4d","category":"data","sec":4,"tier":2,"sources":[{"title":"Ego4D: Around the World in 3,000 Hours of Egocentric Video (arXiv 2110.07058)","url":"https://arxiv.org/abs/2110.07058"},{"title":"Ego4D 官网","url":"https://ego4d-data.org/"},{"title":"R3M: A Universal Visual Representation for Robot Manipulation (arXiv 2203.12601)","url":"https://arxiv.org/abs/2203.12601"}],"as_of":"2022-02","related_ids":["egocentric-video","human-video-data","ego-exo4d","r3m","egodex","pre-trained-visual-representation"],"name":"Ego4D 数据集","alt":"Ego4D","abbr":"","aliases":["Ego4D"],"one_liner":"Meta 与 13 所高校合作采集、约 3670 小时的第一人称日常视频数据集。","explanation":"Ego4D 由 Facebook AI（现 Meta）和 13 所大学组成的联盟采集，2021 年 10 月发布论文、2022 年发表于 CVPR。900 多名参与者在 9 个国家、74 个地点戴头戴相机记录做饭、修理、购物、社交等日常活动，共 3670 小时，部分还附带音频、眼动、3D 场景网格和多机位同步视频，并配有情景记忆、手-物交互、社交、未来预测等基准任务。对机器人来说，它是规模最大的人类第一视角视频来源之一，常用来预训练视觉表征；但它没有原生的手部 3D 姿态标注，也没有机器人动作，不能直接拿来模仿。使用前需签署许可协议。","example":"R3M 在 Ego4D 视频上用时间对比学习和视频-语言对齐做预训练，冻结后给 Franka 机械臂当视觉模块，只用 20 条演示就学会了多个操作任务。","related":["第一人称视频","人类视频数据","Ego-Exo4D 数据集","R3M","EgoDex 数据集","预训练视觉表征"]},{"id":"ego-exo4d","category":"data","sec":4,"tier":3,"sources":[{"title":"Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives (arXiv)","url":"https://arxiv.org/abs/2311.18259"},{"title":"Ego-Exo4D 官网","url":"https://ego-exo4d-data.org/"}],"as_of":"2024-09","related_ids":["egocentric-video","exocentric-video","ego4d","project-aria-glasses","human-video-data","hand-pose-estimation"],"name":"Ego-Exo4D 数据集","alt":"Ego-Exo4D","abbr":"","aliases":[],"one_liner":"Meta 牵头的第一人称与第三视角同步拍摄的大规模技能活动视频数据集。","explanation":"Meta FAIR 牵头、联合全球十多所高校于 2023 年发布的多视角视频数据集，约 1286 小时，740 名参与者，分布在 13 座城市。录制时参与者戴 Aria 眼镜拍第一人称画面，周围再架 4–5 台 GoPro 拍第三视角，内容是做饭、修自行车、跳舞、攀岩等 8 类技能活动，并附视线、IMU（惯性测量单元）、3D 点云、相机位姿和专家讲解文字。它用来研究同一个动作在自己眼里和旁人眼里分别是什么样。对具身智能来说，机器人头部和腕部相机看到的接近第一人称画面，而网上的教学视频多是第三视角，这套数据可用来学两种视角的对应，以及手部和人体 3D 姿态估计。","example":"同一段「修自行车」被 Aria 眼镜和 4 台 GoPro 同时拍下，研究者可以训练模型把第三视角画面转换成第一人称视角（论文中的跨视角转换基准）。","related":["第一人称视频","第三视角视频","Ego4D 数据集","Project Aria 眼镜","人类视频数据","手部姿态估计"]},{"id":"project-aria-glasses","category":"data","sec":4,"tier":3,"sources":[{"title":"Project Aria Glasses（官网规格页）","url":"https://www.projectaria.com/glasses/"},{"title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research (arXiv:2308.13561)","url":"https://arxiv.org/abs/2308.13561"},{"title":"EgoMimic: Scaling Imitation Learning via Egocentric Video (arXiv:2410.24221)","url":"https://arxiv.org/abs/2410.24221"}],"as_of":"2026-09","related_ids":["egocentric-video","human-video-data","egomimic","nymeria","hot3d","wearable-data-collection"],"name":"Project Aria 眼镜","alt":"Project Aria Glasses","abbr":"","aliases":["Aria 眼镜","Project Aria","Aria Gen 2"],"one_liner":"Meta 做的科研用第一人称数据采集眼镜，只采集、不显示。","explanation":"Project Aria 是 Meta Reality Labs 的科研项目，核心是一副外形接近普通眼镜的传感器眼镜，用来采集第一视角多模态数据。第一代带 1 个 RGB 相机、2 个 SLAM（定位建图用）相机、2 个眼动相机，以及 IMU、麦克风等；第二代把 SLAM 相机增至 4 个，加了心率（PPG）传感器和接触式麦克风，续航 6–8 小时，并能在设备上直接做定位、手部和眼动追踪。Meta 以申请制提供给学术和企业伙伴，官网称已有 200 多家。具身智能里它主要用来低成本采集人类第一视角操作视频和手部轨迹，供机器人学习；Nymeria、HOT3D 等数据集都用它采集。","example":"佐治亚理工的 EgoMimic 让人戴着 Aria 眼镜做桌面操作，把录下的第一视角视频和手部轨迹与少量机器人数据一起训练策略。","related":["第一人称视频","人类视频数据","EgoMimic","Nymeria 数据集","HOT3D 数据集","可穿戴采集"]},{"id":"nymeria","category":"data","sec":4,"tier":3,"sources":[{"title":"Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the Wild (arXiv 2406.09905)","url":"https://arxiv.org/abs/2406.09905"},{"title":"Project Aria - Nymeria Dataset","url":"https://www.projectaria.com/datasets/nymeria/"},{"title":"facebookresearch/nymeria_dataset (GitHub)","url":"https://github.com/facebookresearch/nymeria_dataset"}],"as_of":"2026-06","related_ids":["egocentric-video","project-aria-glasses","inertial-motion-capture","ego-exo4d","human-video-data","motion-capture"],"name":"Nymeria 数据集","alt":"Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the Wild","abbr":"","aliases":["Nymeria","Nymeria Dataset","NymeriaPlus"],"one_liner":"Meta 用 Aria 眼镜加动捕服录制的大规模第一人称日常动作数据集","explanation":"Nymeria 是 Meta Project Aria 团队发布的第一人称人体动作数据集（ECCV 2024）。264 人在 50 个真实地点做日常活动，共约 300 小时：头戴 Aria 眼镜录第一人称视频、眼动和 IMU，手腕戴 miniAria 腕带，身穿 XSens 惯性动捕服提供全身动作真值，另有观察者拍第三人称视角，并配分层语言描述。它补上了「只凭头戴设备还原整个人在做什么」的数据缺口，可用于全身姿态估计、动作生成和动作识别。协议为 CC BY-NC 4.0（非商用），后续推出增强版 NymeriaPlus。","example":"用 Aria 眼镜录下的第一人称视频和 IMU 信号训练模型估计佩戴者的全身姿态，再用同步的 XSens 动捕真值评测误差。","related":["第一人称视频","Project Aria 眼镜","惯性动捕","Ego-Exo4D 数据集","人类视频数据","动作捕捉"]},{"id":"dexycb","category":"data","sec":4,"tier":3,"sources":[{"title":"DexYCB 项目主页","url":"https://dex-ycb.github.io"},{"title":"DexYCB: A Benchmark for Capturing Hand Grasping of Objects (arXiv)","url":"https://arxiv.org/abs/2104.04631"}],"as_of":"2021-04","related_ids":["ycb-object-and-model-set","mano","hand-pose-estimation","6d-object-pose-estimation","human-robot-handover","dex-retargeting"],"name":"DexYCB 数据集","alt":"DexYCB: A Benchmark for Capturing Hand Grasping of Objects","abbr":"","aliases":["DexYCB"],"one_liner":"英伟达发布的人手抓物体多视角数据集，带手和物体的三维位姿标注。","explanation":"DexYCB 是英伟达与华盛顿大学发布的真实人手抓取物体数据集，发表于 CVPR 2021。作者用 8 台同步的 RealSense D415 深度相机从多个角度拍摄 10 名受试者抓起 20 个 YCB 物体（YCB 是机器人研究常用的标准日用品集），共 1000 段序列、约 58 万帧 RGB-D 图像；人手姿态用 MANO 参数化手部模型标注，物体给出 6D 位姿（三维位置加三维朝向）。它被用作 2D 检测、6D 物体位姿估计、3D 手部姿态估计的基准，还提出了人把物体递给机器人时生成安全抓取的评测。在具身领域，它常被当作人手抓取示范的来源，经动作重定向转成机器人灵巧手的轨迹。","example":"用 dex-retargeting 的位置重定向，把 DexYCB 里人手抓物体的 MANO 姿态转换成 Allegro、Shadow 等机器人手的抓取轨迹。","related":["YCB 物体集","MANO 手部模型","手部姿态估计","6D位姿估计","人机物体交接","dex-retargeting"]},{"id":"hoi4d","category":"data","sec":4,"tier":3,"sources":[{"title":"HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction (arXiv)","url":"https://arxiv.org/abs/2203.01577"},{"title":"HOI4D 项目主页","url":"https://hoi4d.github.io/"}],"as_of":"","related_ids":["hand-object-interaction","egocentric-video","category-level-pose-estimation","hand-pose-estimation","articulated-object","hot3d"],"name":"HOI4D 数据集","alt":"HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction","abbr":"","aliases":["HOI4D"],"one_liner":"清华等发布的第一人称 4D 手物交互数据集，含 240 万帧 RGB-D。","explanation":"HOI4D 由清华大学、北京大学和上海期智研究院合作发布，发表在 CVPR 2022。采集者头戴装有 Kinect v2 和 RealSense D455 两台 RGB-D 相机的头盔，从第一人称视角记录自己操作物体的过程，共 4000 段序列、240 万帧，涉及 16 类共 800 个物体实例（7 类刚体、9 类带活动部件的铰接物体，如笔记本电脑、柜子、剪刀），场景覆盖 610 个室内房间。逐帧标注包括全景分割、运动分割、3D 手部姿态、类别级物体位姿（只知道类别、没见过具体实例时估计位姿）和动作标签，还提供物体网格和场景点云。它的用处是让模型从人类视角学习「手怎么和一类物体打交道」，可用于手物交互理解、位姿跟踪，也可作为机器人从人类数据学操作的素材。","example":"用 HOI4D 里「打开笔记本电脑」的序列训练类别级位姿跟踪，让模型对没见过的笔记本电脑也能在手部遮挡下持续估计它的位姿。","related":["手物交互","第一人称视频","类别级位姿估计","手部姿态估计","铰接物体","HOT3D 数据集"]},{"id":"oakink","category":"data","sec":4,"tier":3,"sources":[{"title":"OakInk: A Large-scale Knowledge Repository for Understanding Hand-Object Interaction (arXiv 2203.15709)","url":"https://arxiv.org/abs/2203.15709"},{"title":"OAKINK2: A Dataset of Bimanual Hands-Object Manipulation in Complex Task Completion (arXiv 2403.19417)","url":"https://arxiv.org/abs/2403.19417"},{"title":"OakInk2 项目主页","url":"https://oakink.net/v2/"}],"as_of":"2024-12","related_ids":["hand-object-interaction","mano","affordance","bimanual-manipulation","dexycb","arctic-a-dataset-for-dexterous-bimanual-hand-object-manipula"],"name":"OakInk 数据集","alt":"OakInk","abbr":"","aliases":["OakInk2","OakInk Dataset"],"one_liner":"上海交大发布的手-物交互数据集，标注物体用途和双手操作过程","explanation":"OakInk 是上海交通大学卢策吾团队的手-物交互数据集系列。第一代（CVPR 2022）中 Oak 为 1,800 个日常物体标注可供性（物体能被怎样用），Ink 记录人对其中 100 个物体的真实抓握并迁移到虚拟物体，共约 5 万条带使用意图的交互。第二代 OakInk2（CVPR 2024）转向双手完成复杂任务，含 627 段序列、401 万帧多视角图像，标注人体、双手和物体的 3D 位姿，并把任务分成可供性、原子任务、复杂任务三层。常用于手部姿态估计、抓取生成和双手动作合成。","example":"OakInk2 的一段序列把一个复杂任务拆成拿起、倾倒、放下等原子任务，每一帧都标了双手（MANO 参数）和物体的 3D 位姿。","related":["手物交互","MANO 手部模型","可供性","双臂操作","DexYCB 数据集","ARCTIC 数据集"]},{"id":"arctic-a-dataset-for-dexterous-bimanual-hand-object-manipula","category":"data","sec":4,"tier":3,"sources":[{"title":"ARCTIC: A Dataset for Dexterous Bimanual Hand-Object Manipulation (arXiv 2204.13662)","url":"https://arxiv.org/abs/2204.13662"},{"title":"ARCTIC 项目主页","url":"https://arctic.is.tue.mpg.de/"}],"as_of":"2023-06","related_ids":["hand-object-interaction","mano","smpl","optical-motion-capture","articulated-object","hoi4d"],"name":"ARCTIC 数据集","alt":"ARCTIC: A Dataset for Dexterous Bimanual Hand-Object Manipulation","abbr":"","aliases":["ARCTIC"],"one_liner":"人类双手灵巧操作铰接物体的动捕数据集，每帧带精确的手和物体 3D 网格。","explanation":"ARCTIC 是苏黎世联邦理工（ETH Zürich）、马普所智能系统研究所和阿姆斯特丹大学 2022 年发布的数据集，发表于 CVPR 2023。10 名受试者用双手操作 11 个铰接物体（带活动部件的物体，如剪刀、笔记本电脑），共 339 段序列、210 万帧图像，由 8 个固定视角和 1 个第一人称视角同步拍摄。团队用 54 台红外相机的 Vicon 光学动捕系统追踪贴在手和物体上的小标记点，解算出每帧的 MANO 手部网格、SMPL-X 人体网格、物体位姿和开合角度，以及手与物体的接触信息。此前的手物交互数据多是单手、刚体、慢动作，ARCTIC 补上了双手快速操作活动物体的精确 3D 真值，也可作为从人类数据学习灵巧操作的参考。","example":"ARCTIC 里有双手打开笔记本电脑、开合剪刀的序列，每帧都给出两只手的 3D 网格和物体活动部件的转角。","related":["手物交互","MANO 手部模型","SMPL 人体模型","光学动捕","铰接物体","HOI4D 数据集"]},{"id":"hot3d","category":"data","sec":4,"tier":3,"sources":[{"title":"HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View Videos (arXiv)","url":"https://arxiv.org/abs/2411.19167"},{"title":"HOT3D 项目主页","url":"https://facebookresearch.github.io/hot3d/"}],"as_of":"2025-06","related_ids":["hand-object-interaction","egocentric-video","project-aria-glasses","mano","optical-motion-capture","hand-pose-estimation"],"name":"HOT3D 数据集","alt":"HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View Videos","abbr":"","aliases":["HOT3D"],"one_liner":"Meta 用 Aria 眼镜和 Quest 3 录制、带动捕真值的第一人称手物交互数据集。","explanation":"HOT3D 是 Meta 发布的第一人称手物交互数据集，论文收录于 CVPR 2025。19 名参与者在厨房、办公室、客厅等布景中操作 33 件刚性物体，用 Project Aria 研究眼镜和 Quest 3 头显两种设备录制，共 833 分钟以上、370 万张图。数据包括多视角 RGB 与单色图像、眼动注视、场景点云，以及相机、双手和物体的 3D 位姿；位姿真值来自贴光学标记点的动作捕捉系统，比靠算法估出来的准。手部标注同时给出 UmeTrack 和 MANO（常用参数化手模型）两种格式，物体附带带 PBR 材质的 3D 网格。它主要服务于手部与物体的 3D 跟踪、位姿估计研究，也被当作从人类第一人称视频学习灵巧操作的数据来源。使用需同意 HOT3D 许可协议。","example":"","related":["手物交互","第一人称视频","Project Aria 眼镜","MANO 手部模型","光学动捕","手部姿态估计"]},{"id":"egomimic","category":"data","sec":4,"tier":3,"sources":[{"title":"EgoMimic: Scaling Imitation Learning via Egocentric Video (arXiv)","url":"https://arxiv.org/abs/2410.24221"},{"title":"EgoMimic 项目主页","url":"https://egomimic.github.io/"}],"as_of":"2024-10","related_ids":["egocentric-video","project-aria-glasses","co-training","human-video-data","embodiment-gap","egoverse"],"name":"EgoMimic","alt":"EgoMimic: Scaling Imitation Learning via Egocentric Video","abbr":"","aliases":[],"one_liner":"用 Aria 眼镜采人手数据、与机器人数据联合训练同一个策略的框架。","explanation":"佐治亚理工 Danfei Xu 团队 2024 年提出的模仿学习框架。人戴 Project Aria 眼镜做任务，眼镜录下第一人称视频和 3D 手部轨迹；另配一台特意设计得接近人手臂运动学的低成本双臂机器人。训练时把人手轨迹和机器人动作做统一的归一化，对画面中的人手和机械臂加遮罩以减小外观差异，再用同一个策略网络协同训练。实验中它在长程、单臂和双臂任务上优于只用机器人数据的模仿学习方法，还能泛化到新场景，并发现多加 1 小时人手数据比多加 1 小时机器人数据更有用。它是用便宜的人类第一人称数据替代部分遥操作数据这条路线的代表，同一团队后来牵头了 EgoVerse 数据平台。","example":"物体放进碗任务：用 2 小时机器人数据加 1 小时人手数据训练的 EgoMimic，明显优于用 3 小时机器人数据训练的 ACT。","related":["第一人称视频","Project Aria 眼镜","协同训练","人类视频数据","本体差异","EgoVerse 数据集"]},{"id":"ph2d","category":"data","sec":4,"tier":3,"sources":[{"title":"Humanoid Policy ~ Human Policy (arXiv 2503.13441)","url":"https://arxiv.org/abs/2503.13441"},{"title":"Humanoid Policy ~ Human Policy 项目主页","url":"https://human-as-robot.github.io/"}],"as_of":"2025-09","related_ids":["egocentric-video","human-video-data","co-training","embodiment-gap","open-television","unitree-h1"],"name":"PH2D 数据集（HAT）","alt":"PH2D (Physical Human-Humanoid Data) / Humanoid Policy ~ Human Policy","abbr":"PH2D","aliases":["PH2D","HAT","Human Action Transformer","Humanoid Policy ~ Human Policy"],"one_liner":"用 VR 头显采集的人类第一人称操作数据，和人形机器人数据一起训练策略","explanation":"PH2D（Physical Human-Humanoid Data）出自论文《Humanoid Policy ~ Human Policy》，由加州大学圣地亚哥分校牵头，联合 CMU、MIT、苹果等发表于 CoRL 2025。作者让人戴 Apple Vision Pro 或 Meta Quest 3 等消费级头显直接做操作任务，自动记录第一人称画面和头、手腕、指尖的 3D 位置，共约 2.7 万条带语言标注的演示。配套的 HAT（Human Action Transformer）把人和人形机器人放进同一个状态-动作空间，输出再重定向到机器人关节。思路是人自己采数据比遥操作机器人快得多，只要表示对齐，就能与少量机器人数据协同训练，提升泛化和鲁棒性。","example":"人戴 Vision Pro 快速录下大量抓取放置演示，再配少量宇树 H1 遥操作数据一起训练 HAT，得到的策略直接部署到 H1 上。","related":["第一人称视频","人类视频数据","协同训练","本体差异","Open-TeleVision","宇树 H1"]},{"id":"egodex","category":"data","sec":4,"tier":2,"sources":[{"title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video (arXiv 2505.11709)","url":"https://arxiv.org/abs/2505.11709"},{"title":"apple/ml-egodex (GitHub)","url":"https://github.com/apple/ml-egodex"}],"as_of":"2026-03","related_ids":["egocentric-video","human-video-data","apple-vision-pro","hand-pose-estimation","ego4d","dexterous-manipulation"],"name":"EgoDex 数据集","alt":"EgoDex","abbr":"","aliases":["EgoDex"],"one_liner":"苹果用 Vision Pro 采集、带双手 3D 关节标注的第一人称操作视频数据集。","explanation":"EgoDex 由苹果研究团队 2025 年 5 月发布，论文被 ICLR 2026 接收。采集者戴 Apple Vision Pro 完成桌面日常操作，头显的多路标定相机和设备端 SLAM（同时定位与建图）在录制时就同步算出头部、上半身以及每只手 25 个关节的 3D 位置和朝向。数据共 829 小时、约 9000 万帧、33.8 万条演示，覆盖 194 种桌面任务，并用 GPT-4 生成语言描述。它补上了 Ego4D 等视频数据缺少精确手部姿态的短板，可用来训练手部轨迹预测模型，再迁移到灵巧手机器人。数据以 CC BY-NC-ND 许可发布，仅限非商用。","example":"论文用 EgoDex 训练模仿学习策略，输入第一人称画面，预测接下来一段时间双手的 3D 运动轨迹，并据此建立手部轨迹预测的评测基准。","related":["第一人称视频","人类视频数据","Apple Vision Pro","手部姿态估计","Ego4D 数据集","灵巧操作"]},{"id":"unihand","category":"data","sec":4,"tier":3,"sources":[{"title":"arXiv 2507.15597: Being-H0","url":"https://arxiv.org/html/2507.15597v1"},{"title":"BeingBeyond/UniHand_Preview (Hugging Face)","url":"https://huggingface.co/datasets/BeingBeyond/UniHand_Preview"},{"title":"Being-H0.5 项目页","url":"https://research.beingbeyond.com/being-h05"}],"as_of":"2026-01","related_ids":["being-h0","mano","human-video-data","pretraining-on-human-videos","dexterous-manipulation","egodex"],"name":"UniHand 数据集","alt":"UniHand","abbr":"","aliases":["UniHand-1.0","UniHand_Preview"],"one_liner":"智在无界把各类人手视频统一成手部动作标注，用来预训练灵巧手 VLA 的数据集。","explanation":"智在无界（BeingBeyond）联合北京大学、中国人民大学，2025 年 7 月随 Being-H0 模型发布。它把 11 个来源的人手数据统一起来：动捕数据（如 ARCTIC、HOI4D、DexYCB）、VR 录制数据（如 EgoDex）和只有 RGB 的视频（用 HaMeR 模型估计手部姿态），全部转成 MANO 参数（用几十个数表示手形和手势的参数化手模型），共 1100 多小时视频、1.5 亿条以上指令样本。它要解决的是灵巧手真机数据太少：先让模型从人手学「手该怎么动」，再迁移到机器人。2026 年 1 月的 Being-H0.5 将其扩展为 UniHand-2.0；Hugging Face 上的 UniHand_Preview 是这批预训练数据的一个子集，按 WebDataset 格式打包。","example":"Being-H0 在 UniHand 上预训练后，给一张图和指令「拔掉 AirPods 的充电线」，能生成双手接下来几秒的手部动作序列。","related":["智在无界 Being-H0","MANO 手部模型","人类视频数据","人类视频预训练","灵巧操作","EgoDex 数据集"]},{"id":"project-go-big","category":"data","sec":4,"tier":3,"sources":[{"title":"Project Go-Big: Internet-Scale Humanoid Pretraining（Figure 官方）","url":"https://www.figure.ai/news/project-go-big"}],"as_of":"2025-09","related_ids":["figure-helix","figure-ai","human-video-data","egocentric-video","zero-shot","vision-language-action-model"],"name":"Figure Project Go-Big","alt":"Project Go-Big","abbr":"","aliases":["Go-Big","Project Go-Big"],"one_liner":"Figure 用大规模人类第一视角视频给人形机器人做预训练的数据计划。","explanation":"Project Go-Big 是美国人形机器人公司 Figure AI 在 2025 年 9 月 18 日公布的数据计划，目标是为自家 VLA 模型 Helix 建立「互联网规模」的人形预训练数据。Figure 与资产管理公司 Brookfield 合作，后者提供超过 10 万套住宅以及大量办公、物流空间，用来采集人在真实家庭里做事的第一视角视频。Figure 称，Helix 只用人类视频就学会了按语言指令在杂乱的家里导航（从图像和语言直接输出底盘速度指令），并称这是人形机器人第一次只靠人类视频端到端学到这种能力；导航和操作也合进了同一个 Helix 网络。它代表了「用人类视频替代部分遥操作数据」的路线。","example":"用户说「走到厨房餐桌那边」，Helix 直接从相机画面输出行走速度指令，这项能力的训练数据全部来自人类第一视角视频，没有用机器人演示。","related":["Helix","Figure AI","人类视频数据","第一人称视频","零样本","视觉-语言-动作模型"]},{"id":"world-in-your-hands","category":"data","sec":4,"tier":3,"sources":[{"title":"arXiv 2512.24310: World In Your Hands","url":"https://arxiv.org/abs/2512.24310"},{"title":"全球首个真实世界具身多模态数据集，它石智航交卷（量子位 / 新浪财经，2025-10）","url":"https://finance.sina.com.cn/roll/2025-10-10/doc-inftmhce1065095.shtml"}],"as_of":"2026-09","related_ids":["wearable-data-collection","robot-free-data-collection","human-video-data","tactile-data","tars-robotics","multimodal-data"],"name":"它石 WIYH 数据集","alt":"World In Your Hands (TARS Robotics)","abbr":"WIYH","aliases":["WIYH","WiYH","World In Your Hands"],"one_liner":"它石智航开源的千小时级真实场景人手操作数据集，含视觉、语言、触觉和动作。","explanation":"它石智航（TARS Robotics）2025 年 10 月发布、12 月 26 日正式开源，论文 2025 年 12 月挂上 arXiv。它主打「以人为中心」：不用机器人采，而是让人穿戴自研采集套件（论文称 Oracle Suite，商用方案叫 SenseHub）在工厂、超市、酒店、餐厅等真实场景里干活，配合自动标注流程获得毫米级精度的动作真值，总量 1000 多小时、覆盖数百种技能。数据含多视角图像、相机标定参数、深度图、3D 手部姿态、6D 手腕轨迹和任务标注，官方称是首个大规模真实世界视觉-语言-触觉-动作（VLTA）数据集。论文报告，训练时加入 WIYH 的人类数据后，机器人在杂乱场景中的操作成功率从 8% 提升到 60%。","example":"它石用 WIYH 数据训练自家 AWE 模型，并在技术首秀上展示了能做刺绣的机器人。","related":["可穿戴采集","无本体采集","人类视频数据","触觉数据","它石智航","多模态数据"]},{"id":"egocentric-10k","category":"data","sec":4,"tier":3,"sources":[{"title":"Egocentric-10K (Hugging Face dataset card)","url":"https://huggingface.co/datasets/builddotai/Egocentric-10K"},{"title":"Build AI 官网","url":"https://www.build.ai/"}],"as_of":"2026-03","related_ids":["egocentric-video","human-video-data","action-free-video","pretraining-on-human-videos","latent-action-pretraining","in-the-wild-data"],"name":"Egocentric-10K 数据集","alt":"Egocentric-10K","abbr":"","aliases":[],"one_liner":"Build AI 开源的万小时工厂工人第一人称视频数据集。","explanation":"美国创业公司 Build AI 于 2025 年在 Hugging Face 开源的第一人称视频数据集，Apache 2.0 许可。工人戴单目头戴相机在 85 个真实工厂里干活时录制，共约 1 万小时、19.29 万段视频、10.8 亿帧，1080p、30 帧/秒，并附鱼眼相机内参。它强调画面里手部可见、正在操作的镜头占比高，定位是给机器人学习用的数据，而不是做一般的视频理解。数据不带动作标签，通常用于人类视频预训练或潜在动作预训练：先从大量人手操作中学视觉表征和动作先验，再用少量机器人数据微调。据其官网，此后还发布了 Egocentric-100K、Egocentric-1M 等更大版本。","example":"数据集中一段典型视频：工人戴头戴相机在工位上把零件装进夹具，双手全程在画面内，适合拿来学手部操作。","related":["第一人称视频","人类视频数据","无动作标签视频","人类视频预训练","潜在动作预训练","野外数据"]},{"id":"xperience-10m","category":"data","sec":4,"tier":3,"sources":[{"title":"ropedia-ai/xperience-10m (Hugging Face)","url":"https://huggingface.co/datasets/ropedia-ai/xperience-10m"},{"title":"Xperience-10M Dataset (Ropedia Blog)","url":"https://ropedia.com/blog/20260316_xperience_10m"}],"as_of":"2026-03","related_ids":["egocentric-video","human-video-data","wearable-data-collection","ego4d","world-model","motion-capture"],"name":"Xperience-10M 数据集","alt":"Xperience-10M (Ropedia)","abbr":"","aliases":["Xperience-10M"],"one_liner":"Ropedia 发布的 1 万小时第一人称多模态人类经验数据集，面向具身智能。","explanation":"物理 AI 数据公司 Ropedia 的开源数据集，据官方博客 2026 年 3 月发布在 Hugging Face。数据由人头戴多相机设备在真实生活中录制，名字里的 10M 指 1000 万段「经验」（一次完整交互），总时长 1 万小时。每段同步记录 6 路视频（4 路鱼眼、2 路双目）、音频、双目深度、相机位姿与 SLAM 轨迹、手部动捕、全身动捕、IMU，以及任务、子任务、动作、交互、物体多层语言标注，共约 28.8 亿帧 RGB、总量约 1 PB，官方称是带结构化 3D/4D 标注的最大第一人称数据集。可用于世界模型、机器人学习、第一人称感知等的预训练。仅限研究和非商业用途，需申请审核并签协议才能下载，商用数据另有企业版。","example":"研究者用其中的手部动捕和第一人称视频预训练一个人手动作预测模型，再在少量机器人数据上微调。","related":["第一人称视频","人类视频数据","可穿戴采集","Ego4D 数据集","世界模型","动作捕捉"]},{"id":"egoverse","category":"data","sec":4,"tier":3,"sources":[{"title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World (arXiv)","url":"https://arxiv.org/abs/2604.07607"},{"title":"EgoVerse 官网","url":"https://egoverse.ai/"}],"as_of":"2026-09","related_ids":["egomimic","egocentric-video","human-video-data","cross-embodiment-data","data-scaling-laws-in-imitation-learning","crowdsourced-data-collection"],"name":"EgoVerse 数据集","alt":"EgoVerse","abbr":"","aliases":["EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World"],"one_liner":"高校和企业共建、持续扩充的机器人学习用第一人称人类演示数据平台。","explanation":"由佐治亚理工 Danfei Xu 团队牵头，联合斯坦福、UCSD、ETH 苏黎世等高校和 Meta、Scale AI、光轮智能等企业共建的开放数据集与平台，2026 年 4 月发布论文。论文版本含 1362 小时、约 8 万条人类演示，覆盖 1965 个任务、240 个场景、2087 名演示者；官网称它是持续增长的数据集，当前版本约 4000 小时。数据统一格式，附相机位姿、头部 3D 跟踪和稠密语言标注。论文在多个实验室、多种机器人上用统一流程做人到机器人的迁移实验，结论是人类数据越多策略通常越好，但前提是人类数据要和机器人要学的任务对得上。","example":"论文中的「把杯子放到碟子上」双臂任务：多个实验室在各自的机器人上，用同一流程比较加入不同数量人类数据后的成功率。","related":["EgoMimic","第一人称视频","人类视频数据","跨本体数据","数据缩放律（模仿学习）","众包采集"]},{"id":"ycb-object-and-model-set","category":"data","sec":5,"tier":2,"sources":[{"title":"Benchmarking in Manipulation Research: The YCB Object and Model Set and Benchmarking Protocols (arXiv 1502.03143)","url":"https://arxiv.org/abs/1502.03143"},{"title":"PoseCNN: A Convolutional Neural Network for 6D Object Pose Estimation in Cluttered Scenes (arXiv 1711.00199)","url":"https://arxiv.org/abs/1711.00199"}],"as_of":"2015-02","related_ids":["grasping","simulation-assets","6d-object-pose-estimation","benchmark","google-scanned-objects","bop"],"name":"YCB 物体集","alt":"YCB Object and Model Set","abbr":"YCB","aliases":["YCB 物体","YCB 物体与模型集","Yale-CMU-Berkeley 物体集"],"one_liner":"一套能买到实物的标准日常物品加 3D 扫描模型，供抓取和操作研究统一对比。","explanation":"YCB 是耶鲁（Yale）、卡内基梅隆（CMU）和伯克利（Berkeley）的研究者 2015 年提出的物体集，名字取自三校首字母，论文发表于 IEEE Robotics & Automation Magazine。它收录编号 1–73 的日常物品，分食品、厨房用品、工具、形状物体、任务物体五类，比如罐头、马克杯、电钻、积木、绳子。每个物体用多相机转台扫描，提供 600 张 RGB-D 图、600 张高清彩图、分割掩码和带纹理的 3D 网格模型。以前各实验室自选物体，结果没法横向比；YCB 让大家能拿到同一套实物、在仿真里用同一套模型，还附了操作基准协议模板。如今它常被导入仿真器当抓取对象，也是多个位姿估计数据集的物体来源。","example":"PoseCNN（2017）构建的 YCB-Video 位姿估计数据集，就是在杂乱桌面上拍摄 YCB 物体，共 133,827 帧。","related":["抓取","仿真资产","6D位姿估计","基准测试","Google Scanned Objects（GSO）","BOP 位姿估计基准"]},{"id":"google-scanned-objects","category":"data","sec":5,"tier":3,"sources":[{"title":"Google Scanned Objects: A High-Quality Dataset of 3D Scanned Household Items (arXiv)","url":"https://arxiv.org/abs/2204.11918"},{"title":"Scanned Objects by Google Research: A Dataset of 3D-Scanned Common Household Items (Google Research Blog)","url":"https://research.google/blog/scanned-objects-by-google-research-a-dataset-of-3d-scanned-common-household-items/"}],"as_of":"2022-06","related_ids":["simulation-assets","ycb-object-and-model-set","objaverse","shapenet","synthetic-data","gazebo"],"name":"Google Scanned Objects（GSO）","alt":"Google Scanned Objects: A High-Quality Dataset of 3D Scanned Household Items","abbr":"GSO","aliases":["Scanned Objects by Google Research","谷歌扫描物体数据集"],"one_liner":"谷歌开源的 1030 个真实家居物品高精度 3D 扫描模型库。","explanation":"GSO 是 Google Research 在 2022 年公开的 3D 物体资产库，共 1030 件真实家居用品（鞋子、玩具、餐具、包装盒等）。谷歌自建了扫描台，用结构光（向物体投射图案、再从相机图像反推形状）加单反拍摄高动态范围颜色，得到带真实纹理的网格模型。模型已预处理成 Gazebo 和 PyBullet 能直接加载的格式，托管在 Gazebo Fuel 上，采用 CC-BY 4.0 协议。它解决的是仿真里物体太少、太假的问题：做抓取、摆放或合成感知数据时，需要大量形状和外观都像真东西的物体，GSO 是常用的现成来源之一，常与 YCB、Objaverse 等资产库一起用。","example":"从 Gazebo Fuel 下载 GSO 里的鞋子和玩具模型，随机撒在 PyBullet 桌面场景里，批量生成抓取训练数据。","related":["仿真资产","YCB 物体集","Objaverse 3D 资产库","ShapeNet 3D 模型库","合成数据","Gazebo"]},{"id":"shapenet","category":"data","sec":5,"tier":2,"sources":[{"title":"ShapeNet: An Information-Rich 3D Model Repository","url":"https://arxiv.org/abs/1512.03012"},{"title":"ShapeNet/ShapeNetCore (Hugging Face)","url":"https://huggingface.co/datasets/ShapeNet/ShapeNetCore"},{"title":"ACRONYM: A Large-Scale Grasp Dataset Based on Simulation","url":"https://arxiv.org/abs/2011.09584"}],"as_of":"","related_ids":["objaverse","acronym-a-large-scale-grasp-dataset-based-on-simulation","simulation-assets","ycb-object-and-model-set","partnet-mobility","domain-randomization"],"name":"ShapeNet 3D 模型库","alt":"ShapeNet","abbr":"","aliases":["ShapeNetCore","ShapeNetSem"],"one_liner":"按 WordNet 类别整理、带语义标注的大规模 3D 物体网格模型库。","explanation":"ShapeNet 由斯坦福、普林斯顿等机构的研究者于 2015 年发布，收录 300 多万个 3D 模型，其中约 22 万个按 WordNet 归入 3135 个类别，并标注了统一朝向、部件、对称面、真实尺寸等信息。最常用的子集 ShapeNetCore 约 5.13 万个模型、55 个常见类别；ShapeNetSem 模型更少但标注更细。它本来服务图形学和视觉研究，后来成了机器人抓取和仿真常用的物体来源：往仿真里批量放入形状各异的物体，或自动生成抓取标注。NVIDIA 的 ACRONYM 抓取数据集就用 ShapeNetSem 的网格，在物理仿真里标注了 1770 万个平行夹爪抓取。现在通过 Hugging Face 申请下载，仅限非商业研究和教育用途。","example":"ACRONYM 从 ShapeNetSem 里取出杯子、碗等网格，在仿真中逐个测试大量夹爪抓取位姿，把成功和失败的结果当作训练抓取网络的标签。","related":["Objaverse 3D 资产库","ACRONYM 抓取数据集","仿真资产","YCB 物体集","PartNet-Mobility 数据集","域随机化"]},{"id":"objaverse","category":"data","sec":5,"tier":3,"sources":[{"title":"Objaverse: A Universe of Annotated 3D Objects (arXiv 2212.08051)","url":"https://arxiv.org/abs/2212.08051"},{"title":"Objaverse-XL: A Universe of 10M+ 3D Objects (arXiv 2307.05663)","url":"https://arxiv.org/abs/2307.05663"},{"title":"Holodeck: Language Guided Generation of 3D Embodied AI Environments (arXiv 2312.09067)","url":"https://arxiv.org/abs/2312.09067"}],"as_of":"2023-07","related_ids":["simulation-assets","holodeck","shapenet","single-image-3d-reconstruction","partnet-mobility","procedural-generation"],"name":"Objaverse 3D 资产库","alt":"Objaverse","abbr":"","aliases":["Objaverse 1.0","Objaverse-XL"],"one_liner":"艾伦人工智能研究所牵头的超大规模开放 3D 物体模型库","explanation":"Objaverse 是艾伦人工智能研究所（AI2）牵头发布的开放 3D 物体数据集。2022 年的 1.0 版有 80 多万个带标题和标签的模型；2023 年的 Objaverse-XL 联合多家机构扩到 1000 万个以上，来源包括人工建模、摄影测量和文物扫描。此前 3D 数据规模远小于图像和文本，限制了 3D 视觉与生成模型。在具身智能里它主要作为仿真资产来源，例如 Holodeck 用大语言模型规划房间布局，再从 Objaverse 检索物体填进场景。模型大多只有外形和贴图，放进仿真器前通常要补碰撞体和质量、摩擦等物理参数。","example":"Holodeck 根据「一间堆满书的书房」这样的文字描述，从 Objaverse 里检索书架、书桌、台灯等模型，摆进 AI2-THOR 场景供导航和操作训练。","related":["仿真资产","Holodeck 语言生成三维环境","ShapeNet 3D 模型库","单图生成3D","PartNet-Mobility 数据集","程序化生成"]},{"id":"partnet-mobility","category":"data","sec":5,"tier":3,"sources":[{"title":"SAPIEN: A SimulAted Part-based Interactive ENvironment (arXiv 2003.08515)","url":"https://arxiv.org/abs/2003.08515"},{"title":"SAPIEN 论文 HTML 全文（PartNet-Mobility 统计）","url":"https://arxiv.org/html/2003.08515"}],"as_of":"2020-03","related_ids":["sapien","articulated-object","articulated-object-manipulation","unified-robot-description-format","maniskill","articulation-estimation"],"name":"PartNet-Mobility 数据集","alt":"PartNet-Mobility","abbr":"","aliases":["PartNet-Mobility Dataset"],"one_liner":"带关节运动标注、可直接加载进仿真器的铰接物体 3D 模型库","explanation":"PartNet-Mobility 是加州大学圣地亚哥分校苏昊团队随 SAPIEN 仿真环境（CVPR 2020）发布的铰接物体数据集。铰接物体指柜门、抽屉、笔记本电脑这类由零件经关节相连、零件能相对运动的物体。数据集含 46 个类别、2,346 个物体、14,068 个可动部件；每个关节标注了类型（转动、滑动、螺旋）、运动范围和父子关系，并附贴图和 URDF 文件，可直接加载进物理仿真。此前的零件数据集大多只有静态几何，没法真的「拉开抽屉」。它是铰接物体操作研究最常用的资产来源，ManiSkill 等基准里的开门、开抽屉任务也基于它。","example":"在 SAPIEN 或 ManiSkill 里加载一个 PartNet-Mobility 柜子的 URDF，训练机械臂抓住把手、把抽屉拉开到指定距离。","related":["SAPIEN","铰接物体","铰接物体操作","统一机器人描述格式","ManiSkill","铰接结构估计"]},{"id":"objectfolder","category":"data","sec":5,"tier":3,"sources":[{"title":"ObjectFolder: A Dataset of Objects with Implicit Visual, Auditory, and Tactile Representations (arXiv 2109.07991)","url":"https://arxiv.org/abs/2109.07991"},{"title":"ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real Transfer (arXiv 2204.02389)","url":"https://arxiv.org/abs/2204.02389"},{"title":"The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects (arXiv 2306.00956)","url":"https://arxiv.org/abs/2306.00956"}],"as_of":"2023-06","related_ids":["multimodal-perception","tactile-data","visuo-tactile-fusion","tactile-simulation","ycb-object-and-model-set","sim-to-real-transfer"],"name":"ObjectFolder 多感官物体数据集","alt":"ObjectFolder (1.0 / 2.0 / Real) Multisensory Object Dataset","abbr":"","aliases":["ObjectFolder","ObjectFolder 2.0","ObjectFolder Real","ObjectFolder Benchmark"],"one_liner":"同时提供物体外观、敲击声音和触觉读数的多感官物体数据集","explanation":"ObjectFolder 是斯坦福大学吴佳俊、李飞飞等人发布的多感官物体数据集系列。1.0 版（CoRL 2021）含 100 个虚拟物体，用隐式神经表示（用小网络存下某种感官数据、按查询输出）统一编码视觉、声音和触觉；2.0 版（CVPR 2022）扩到 1,000 个物体并提升渲染速度和质量；2023 年的 ObjectFolder Real 采集了 100 个真实家居物体的网格、视频、敲击声和触觉读数，并配 10 个任务的评测基准。它补上了物体数据集缺声音和触觉的短板，可用于跨感官检索、接触定位、形状重建和虚实迁移研究。","example":"给出一只杯子的渲染图，检索它被敲击时的声音或被视触觉传感器按压时的触觉图像（跨感官检索）。","related":["多模态感知","触觉数据","视触觉融合","触觉仿真","YCB 物体集","仿真到现实迁移"]},{"id":"coco-lvis","category":"data","sec":5,"tier":3,"sources":[{"title":"Microsoft COCO: Common Objects in Context (arXiv 1405.0312)","url":"https://arxiv.org/abs/1405.0312"},{"title":"LVIS: A Dataset for Large Vocabulary Instance Segmentation (arXiv 1908.03195)","url":"https://arxiv.org/abs/1908.03195"},{"title":"COCO 官网数据集介绍","url":"https://cocodataset.org/dataset/home.htm"}],"as_of":"","related_ids":["object-detection","instance-segmentation","open-vocabulary-object-detection","mean-average-precision","yolo","grounding-dino"],"name":"COCO / LVIS 数据集","alt":"COCO / LVIS (Common Objects in Context / Large Vocabulary Instance Segmentation)","abbr":"","aliases":["MS COCO","Microsoft COCO","LVIS v1.0"],"one_liner":"最常用的检测与分割基准，LVIS 在 COCO 图片上扩展到上千个长尾类别。","explanation":"COCO 由微软等机构 2014 年发布，约 33 万张日常场景图片、150 万个物体实例，检测和实例分割用 80 个类别，另有图像描述、人体关键点等标注，是检测、分割模型最常用的训练和评测集，mAP（平均精度均值）通常在它上面报告。LVIS 由 Facebook AI Research 的 Gupta、Dollár、Girshick 在 CVPR 2019 提出，复用 COCO 图片，重新标注了 1203 个类别、约 200 万个实例掩码，类别呈长尾分布（少数类很常见，大量类样本很少），专门考察稀有类别识别。开放词汇检测（按任意文字描述找物体）常用 LVIS 稀有类衡量零样本能力。机器人感知用的检测、分割模型大多在这两个数据集上预训练或评测。","example":"YOLO 系列新版本发布时通常报告 COCO val2017 上的 mAP；YOLO-World、Grounding DINO 这类开放词汇检测器则报告在 LVIS 上的零样本 AP。","related":["目标检测","实例分割","开放词汇检测","平均精度均值","YOLO","Grounding DINO"]},{"id":"scannet","category":"data","sec":5,"tier":3,"sources":[{"title":"ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes (arXiv 1702.04405)","url":"https://arxiv.org/abs/1702.04405"},{"title":"ScanNet++ 官网","url":"https://scannetpp.mlsg.cit.tum.de/scannetpp/"},{"title":"ScanRefer (arXiv 1912.08830)","url":"https://arxiv.org/abs/1912.08830"}],"as_of":"2024-12","related_ids":["3d-visual-grounding","depth-camera","point-cloud","3d-scene-graph","habitat-matterport-3d-dataset","matterport3d"],"name":"ScanNet 数据集","alt":"ScanNet","abbr":"","aliases":["ScanNet++","ScanNet v2"],"one_liner":"大规模室内 RGB-D 扫描数据集，带三维重建和语义标注。","explanation":"ScanNet 是 Angela Dai、Matthias Nießner 等人在 CVPR 2017 发布的室内场景数据集：用消费级 RGB-D 相机（同时拍彩色图和深度图）扫描了 1513 个室内场景、共 250 万帧，附带相机位姿、三维表面重建和众包语义分割标注，给 3D 语义分割、3D 检测提供了统一的训练和评测数据。具身智能里不少 3D 语言任务建在它上面，如 3D 视觉定位（按一句话在三维场景里找物体）和 3D 问答。后续的 ScanNet++ 改用激光扫描仪、单反和 iPhone 采集，精度更高，2024 年 12 月的 v2 扩展到 1000 多个场景。","example":"ScanRefer 在 800 个 ScanNet 场景上给 11,046 个物体写了 51,583 条自然语言描述，模型要根据描述在三维扫描中定位目标物体。","related":["3D视觉定位","深度相机","点云","3D场景图","HM3D 数据集","Matterport3D 数据集"]},{"id":"matterport3d","category":"data","sec":5,"tier":3,"sources":[{"title":"Matterport3D 项目主页","url":"https://niessner.github.io/Matterport/"},{"title":"Room-to-Room (R2R) 数据集主页","url":"https://bringmeaspoon.org/"}],"as_of":"2017","related_ids":["habitat-matterport-3d-dataset","habitat","room-to-room","vision-and-language-navigation","object-goal-navigation","scannet"],"name":"Matterport3D 数据集","alt":"Matterport3D","abbr":"MP3D","aliases":["Matterport 3D","MP3D"],"one_liner":"90 栋真实建筑的室内 RGB-D 扫描数据集，是室内导航研究的常用场景库。","explanation":"Matterport3D（缩写 MP3D）由普林斯顿大学、斯坦福大学等机构的研究者发表于 2017 年 3DV 会议，数据来自 Matterport 三维扫描相机。它覆盖 90 栋建筑规模的真实室内场景，共 194,400 张 RGB-D 图像（彩色图加深度图），拼成 10,800 张全景图，并提供表面重建网格、相机位姿和 2D/3D 语义分割标注。它的意义在于让研究者能在真实房屋的数字副本里训练和评测智能体，不必每次都把机器人搬进真实住宅：视觉语言导航基准 R2R 就建在它之上，Habitat 等仿真平台也把它作为标准场景，用于点目标导航、物体目标导航等任务。后来的 HM3D 把场景数扩展到 1000 个。获取数据前需要签署使用条款。","example":"R2R 基准在 Matterport3D 的 90 栋建筑里标注了约 2.2 万条导航指令（平均 29 个词），智能体要听懂类似「穿过厨房，在楼梯旁的门口停下」的描述并走到终点。","related":["HM3D 数据集","Habitat","R2R / VLN-CE 视觉语言导航基准","视觉语言导航","物体目标导航","ScanNet 数据集"]},{"id":"habitat-matterport-3d-dataset","category":"data","sec":5,"tier":3,"sources":[{"title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI (arXiv)","url":"https://arxiv.org/abs/2109.08238"},{"title":"HM3D - AI Habitat","url":"https://aihabitat.org/datasets/hm3d/"},{"title":"HM3D-Semantics - AI Habitat","url":"https://aihabitat.org/datasets/hm3d-semantics/"}],"as_of":"","related_ids":["habitat","matterport3d","object-goal-navigation","point-goal-navigation","navigation","scannet"],"name":"HM3D 数据集","alt":"Habitat-Matterport 3D Dataset","abbr":"HM3D","aliases":["HM3D","Habitat-Matterport 3D","HM3D-Semantics","HM3DSem"],"one_liner":"Meta 与 Matterport 发布的 1000 栋真实建筑室内三维重建，用于导航训练。","explanation":"HM3D 是 Meta AI（FAIR）和房产扫描公司 Matterport 在 2021 年合作发布的室内场景数据集，包含 1000 个建筑级的带纹理三维网格，覆盖住宅、商店、公共建筑等，可通行面积合计 11.25 万平方米，是此前 Matterport3D、Gibson 的 1.4–3.7 倍，重建缺陷也更少。它主要配合 Habitat 仿真器使用：智能体在这些真实房屋的数字副本里练习点目标导航、物体目标导航等任务。论文显示在 HM3D 上训练的点目标导航智能体，拿到其他数据集上测试也表现最好。后续的 HM3D-Semantics v0.2 给其中 216 个空间补了 142646 个物体实例标注，v0.1 曾是 Habitat 2022 物体目标导航挑战赛的基础。数据仅限学术非商用。","example":"在 Habitat 里加载一栋 HM3D 房子，让机器人智能体从门口出发，只凭相机画面找到「沙发」所在的位置。","related":["Habitat","Matterport3D 数据集","物体目标导航","点目标导航","导航","ScanNet 数据集"]},{"id":"graspnet-1billion","category":"data","sec":5,"tier":3,"sources":[{"title":"GraspNet-1Billion 官网","url":"https://graspnet.net/"}],"as_of":"2023","related_ids":["grasp-pose-detection","anygrasp","antipodal-grasp","6d-object-pose-estimation","bin-picking","sjtu-mvig-lab"],"name":"GraspNet-1Billion 数据集","alt":"GraspNet-1Billion","abbr":"","aliases":["GraspNet","GraspNet-1B"],"one_liner":"上海交大发布的真实杂乱场景抓取数据集，含超 11 亿个抓取位姿标注。","explanation":"GraspNet-1Billion 是上海交通大学 MVIG 实验室（卢策吾组）发表在 CVPR 2020 的通用物体抓取基准，扩展版 2023 年刊于机器人期刊 IJRR。它包含 190 个杂乱摆放的真实场景、88 种物体，用 RealSense D435 和 Azure Kinect 两台 RGB-D 相机共拍了 97280 张图；每张图都标了物体 6D 位姿（三维位置加三维朝向）、实例掩码和稠密的 6 自由度抓取位姿，总数超过 11 亿个。此前的抓取数据多是单物体或仿真合成，这个数据集给出了真实杂乱桌面上的大规模标注，并配套开源了评测 API 和基线网络，让不同抓取检测算法能在同一标准下比较。同组后来的 AnyGrasp 也建立在这条工作线上。","example":"训练一个抓取检测网络：输入一帧深度点云，输出若干夹爪位姿和得分，再用 graspnetAPI 在测试场景上算平均精度。","related":["抓取位姿检测","AnyGrasp","对跖抓取","6D位姿估计","无序抓取","上海交通大学 MVIG 实验室（卢策吾组）"]},{"id":"acronym-a-large-scale-grasp-dataset-based-on-simulation","category":"data","sec":5,"tier":3,"sources":[{"title":"ACRONYM: A Large-Scale Grasp Dataset Based on Simulation (arXiv 2011.09584)","url":"https://arxiv.org/abs/2011.09584"},{"title":"NVlabs/acronym (GitHub)","url":"https://github.com/NVlabs/acronym"},{"title":"Contact-GraspNet (arXiv 2103.14127)","url":"https://arxiv.org/abs/2103.14127"}],"as_of":"2020-11","related_ids":["grasping","contact-graspnet","simulation-data","antipodal-grasp","grasp-pose-detection","shapenet"],"name":"ACRONYM 抓取数据集","alt":"ACRONYM: A Large-Scale Grasp Dataset Based on Simulation","abbr":"","aliases":["ACRONYM"],"one_liner":"英伟达用物理仿真批量标注的平行夹爪抓取数据集，约 1774 万个抓取。","explanation":"ACRONYM 是英伟达的 Clemens Eppner、Arsalan Mousavian 和 Dieter Fox 于 2020 年 11 月发布的抓取数据集。它从 ShapeNetSem 3D 模型库选出 262 个类别的 8872 个物体，每个物体用对跖采样（在表面找两个相对的接触点）生成 2000 个候选抓取，再放进英伟达 FleX 物理引擎，模拟 Franka Panda 夹爪闭合后摇晃，看物体是否还夹在手里，共得到约 1774 万个带成功/失败标签的抓取，其中约 59% 成功。真机逐个试抓成本太高，这种仿真批量标注给学习型抓取网络提供了足够的训练数据。它还附带在桌面等支撑面上随机摆放多个物体的杂乱场景生成工具，可渲染深度图和点云。","example":"英伟达的 Contact-GraspNet 用约 1700 万个这类仿真抓取训练，在真实杂乱场景里抓取没见过的物体，成功率超过 90%。","related":["抓取","Contact-GraspNet","仿真数据","对跖抓取","抓取位姿检测","ShapeNet 3D 模型库"]},{"id":"dexgraspnet","category":"data","sec":5,"tier":3,"sources":[{"title":"DexGraspNet 项目主页","url":"https://pku-epic.github.io/DexGraspNet/"},{"title":"DexGraspNet (arXiv)","url":"https://arxiv.org/abs/2210.02697"},{"title":"DexGraspNet 2.0 (arXiv)","url":"https://arxiv.org/abs/2410.23004"}],"as_of":"2024-10","related_ids":["dexterous-manipulation","force-closure","shadow-dexterous-hand","isaac-gym","synthetic-data","grasp-pose-detection"],"name":"DexGraspNet 数据集","alt":"DexGraspNet: A Large-Scale Robotic Dexterous Grasp Dataset for General Objects Based on Simulation","abbr":"","aliases":["DexGraspNet"],"one_liner":"北大发布的仿真合成灵巧手抓取数据集，含 5355 个物体上的 132 万个抓取。","explanation":"DexGraspNet 是北京大学王鹤团队与北京通用人工智能研究院、清华大学合作发布的大规模灵巧手抓取数据集，发表于 ICRA 2023。二指夹爪抓取已有大数据集，灵巧手抓取却一直缺数据。作者用加速的可微力封闭估计器（力封闭：手指接触力能抵抗任意方向的外力）批量合成抓取姿态，为 Shadow 灵巧手在 5355 个物体、133 个以上类别上生成 132 万个抓取，每个物体 200 个以上，全部经 Isaac Gym 仿真验证。它主要用来训练和评测灵巧抓取生成算法。2024 年团队又发布 DexGraspNet 2.0，扩展到 8270 个杂乱场景、4.27 亿个抓取，并实现真机零样本迁移。","example":"训练一个输入物体点云、输出 Shadow 手抓取姿态的生成模型，用 DexGraspNet 的抓取作为监督数据。","related":["灵巧操作","力封闭","Shadow 灵巧手","Isaac Gym","合成数据","抓取位姿检测"]},{"id":"scripted-demonstrations","category":"data","sec":5,"tier":3,"sources":[{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)","url":"https://arxiv.org/html/2304.13705"},{"title":"tonyzhaozh/act (GitHub)","url":"https://github.com/tonyzhaozh/act"}],"as_of":"","related_ids":["demonstration-data","simulation-data","privileged-information","action-multimodality","mimicgen","aloha-sim"],"name":"脚本化演示","alt":"Scripted Demonstrations","abbr":"","aliases":["脚本数据","程序化演示","脚本策略演示","Scripted Policy Demos"],"one_liner":"用手写的规则程序而不是人来操控机器人，自动生成的示范数据。","explanation":"脚本化演示指用人写好的规则程序（scripted policy）自动控制机器人完成任务，把过程录下来当示范数据。脚本通常在仿真里直接读取物体真实位姿等特权信息（真实部署时拿不到的精确状态），再用预设路点或运动规划器算出轨迹。好处是成本低、能无限生成、动作干净一致；缺点是动作模式单一，和人类演示那种多样、带犹豫的风格差别很大，复杂任务难以写成脚本，真机上也很难拿到精确状态。它常用于仿真基准、算法调试和大规模合成数据。同样条数下，用脚本数据训出的策略成功率往往高于用人类遥操作数据，因为前者没有多峰和噪声，所以只在脚本数据上验证过的方法要谨慎看待。","example":"ACT 论文在 ALOHA 仿真的方块传递任务里各录了 50 条脚本演示和 50 条人类遥操作演示，ACT 用脚本数据的成功率为 97%，换成人类数据降到 82%。","related":["演示数据","仿真数据","特权信息","动作多峰性","MimicGen","ALOHA 仿真任务"]},{"id":"mimicgen","category":"data","sec":5,"tier":2,"sources":[{"title":"MimicGen 项目主页","url":"https://mimicgen.github.io/"},{"title":"Isaac Lab Docs: Teleoperation and Imitation Learning with Isaac Lab Mimic","url":"https://isaac-sim.github.io/IsaacLab/main/source/overview/imitation-learning/teleop_imitation.html"},{"title":"NVIDIA Technical Blog: Building a Synthetic Motion Generation Pipeline for Humanoid Robot Learning","url":"https://developer.nvidia.com/blog/building-a-synthetic-motion-generation-pipeline-for-humanoid-robot-learning/"}],"as_of":"","related_ids":["dexmimicgen","demogen","synthetic-data","demonstration-data","nvidia-isaac-lab","behavior-cloning"],"name":"MimicGen","alt":"MimicGen","abbr":"","aliases":["MimicGen 数据生成","Isaac Lab Mimic（英伟达同思路实现）"],"one_liner":"把少量人类演示按物体切段、变换位姿再拼接，自动生成大量新演示的系统。","explanation":"MimicGen 是英伟达和德州大学奥斯汀分校在 CoRL 2023 提出的自动数据生成系统。它把人类演示按子任务切成以物体为中心的片段（如「抓杯子」「放进盘子」），换到物体位置不同的新场景时，让每段末端轨迹跟着对应物体的位姿做坐标变换，拼接后在仿真里执行，只保留成功的轨迹。论文用不到 200 条人类演示，在 18 个任务上生成了 5 万多条演示，缓解了模仿学习对人工演示的依赖。英伟达 Isaac Lab 里的 Isaac Lab Mimic 沿用同样思路：先标注子任务再自动生成，并支持人形机器人。","example":"在一个仿真操作任务上，只给 10 条人类演示，MimicGen 就能针对新的物体摆放范围生成 1000 条演示，再用它们训练策略。","related":["DexMimicGen","DemoGen","合成数据","演示数据","Isaac Lab","行为克隆"]},{"id":"dexmimicgen","category":"data","sec":5,"tier":3,"sources":[{"title":"DexMimicGen 项目主页","url":"https://dexmimicgen.github.io"},{"title":"DexMimicGen (arXiv)","url":"https://arxiv.org/abs/2410.24185"}],"as_of":"2024-10","related_ids":["mimicgen","demogen","bimanual-manipulation","real-to-sim-to-real","synthetic-data","behavior-cloning"],"name":"DexMimicGen","alt":"DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning","abbr":"","aliases":[],"one_liner":"英伟达的自动数据生成系统，把几十条演示扩增成上万条双臂灵巧手数据。","explanation":"DexMimicGen 是英伟达研究院与得克萨斯大学奥斯汀分校、加州大学圣迭戈分校提出的自动数据生成系统，发表于 ICRA 2025，是 MimicGen 在双臂灵巧手（如人形机器人上半身）上的扩展。MimicGen 的思路是：把少量人工演示按物体切成子任务片段，物体位置变了就把片段跟着变换后在仿真里重放，只保留成功的轨迹。双臂任务里两只手有时各干各的、有时要同步配合、有时有先后顺序，DexMimicGen 为此加入按手臂分别切分子任务、同步和顺序约束。论文从 60 条人工演示生成约 2.1 万条演示，覆盖 9 个任务，并用真-仿-真流程在真机易拉罐分拣任务上做了验证。","example":"从 60 条人工遥操作演示出发，在 robosuite 等仿真环境里自动生成约 2.1 万条双臂灵巧手演示，再用行为克隆训练策略。","related":["MimicGen","DemoGen","双臂操作","真-仿-真闭环","合成数据","行为克隆"]},{"id":"demogen","category":"data","sec":5,"tier":3,"sources":[{"title":"DemoGen 项目主页","url":"https://demo-generation.github.io"},{"title":"DemoGen: Synthetic Demonstration Generation for Data-Efficient Visuomotor Policy Learning (arXiv)","url":"https://arxiv.org/abs/2502.16932"}],"as_of":"2025-06","related_ids":["mimicgen","dexmimicgen","3d-diffusion-policy","synthetic-data","spatial-generalization","point-cloud"],"name":"DemoGen","alt":"DemoGen: Synthetic Demonstration Generation for Data-Efficient Visuomotor Policy Learning","abbr":"","aliases":[],"one_liner":"把 1 条真机演示自动改编成物体在新位置下的大量合成演示。","explanation":"DemoGen 是清华大学许华哲团队（与上海期智研究院、上海 AI Lab 合作）提出的合成演示生成方法，发表于 RSS 2025。模仿学习策略的空间泛化差，物体换个位置就可能失败，而在每个位置都人工采演示成本很高。DemoGen 每个任务只需 1 条人工演示：把轨迹拆成空中移动段和接触操作段，物体挪到新位置后，接触段跟着物体一起变换，移动段用运动规划重新连接；观测直接对点云做 3D 编辑，把物体和末端对应的点一起挪过去，不需要仿真器，也不用真机重采。论文中生成整套数据约 22 秒，MimicGen 方式约需 83.7 小时。训练时配合以点云为输入的 3D 扩散策略（DP3）。","example":"在开罐子（Jar-Opening）任务上只采 1 条演示，用 DemoGen 生成不同物体位置的演示后，论文报告策略在分布外位置上也能 100% 成功。","related":["MimicGen","DexMimicGen","3D 扩散策略","合成数据","位置泛化（空间泛化）","点云"]},{"id":"robogen","category":"data","sec":5,"tier":3,"sources":[{"title":"RoboGen (arXiv:2311.01455)","url":"https://arxiv.org/abs/2311.01455"},{"title":"RoboGen 项目主页","url":"https://robogen-ai.github.io/"}],"as_of":"2024-06","related_ids":["generative-simulation","genesis","procedural-generation","llm-based-task-planning","reward-function","simulation-data"],"name":"RoboGen","alt":"RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation","abbr":"","aliases":["RoboGen"],"one_liner":"让大模型自动出题、搭仿真场景并学会技能的生成式仿真框架。","explanation":"RoboGen 是 CMU、MIT、清华叉院、UMass Amherst 等机构 2023 年 11 月提出的机器人学习框架，发表于 ICML 2024。它不让大模型直接输出动作，而是走一个「提出—生成—学习」循环：先由大模型提出一个要学的技能，再自动搭好对应的仿真场景和物体、分解子任务、写出奖励函数等监督信号，最后按任务类型挑选强化学习、运动规划或轨迹优化去学会它。这样几乎不需要人工设计任务，就能持续产出各种技能的演示数据，涵盖铰接物体、柔性物体操作和腿足运动。项目主页称其用 Genesis 仿真引擎做模拟和渲染。它是「生成式仿真」的代表工作。","example":"大模型提出「把行李箱拉杆拉出来」这个任务，RoboGen 自动放入行李箱模型、设置初始状态、生成奖励函数，再用强化学习训练出这个技能。","related":["生成式仿真","Genesis","程序化生成","大模型任务规划","奖励函数","仿真数据"]},{"id":"nvidia-physical-ai-dataset","category":"data","sec":5,"tier":3,"sources":[{"title":"NVIDIA 博客：NVIDIA Releases Open Physical AI Dataset","url":"https://blogs.nvidia.com/blog/open-physical-ai-dataset/"},{"title":"nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim（Hugging Face）","url":"https://huggingface.co/datasets/nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim"}],"as_of":"2026-09","related_ids":["nvidia","nvidia-isaac-gr00t-n1","synthetic-data","simready-assets","autonomous-driving","physical-ai"],"name":"NVIDIA 物理 AI 数据集","alt":"NVIDIA Physical AI Dataset","abbr":"","aliases":["PhysicalAI 数据集","NVIDIA PhysicalAI Dataset","英伟达物理 AI 数据集"],"one_liner":"英伟达在 Hugging Face 上开放的机器人与自动驾驶数据集合集。","explanation":"NVIDIA Physical AI Dataset 是英伟达在 2025 年 3 月 18 日 GTC 大会上宣布、托管在 Hugging Face 的开放数据集合集，面向机器人和自动驾驶等物理 AI 开发，真实与合成数据兼有。首批约 15 TB，含 32 万多条机器人训练轨迹和最多 1000 个 OpenUSD 资产。它不是单个文件，而是 nvidia 账号下一系列以 PhysicalAI- 开头的数据集，例如 GR00T N1 后训练用的仿真轨迹、GR00T 遥操作数据、SimReady 仓库资产、约 1700 小时的多传感器自动驾驶数据，以及 2026 年新增的世界模型合成场景数据。截至 2026 年 9 月，这一前缀下已有 40 多个数据集，各子集许可证不同，使用前要分别查看。","example":"GR00T-X-Embodiment-Sim 子集提供 GR00T N1 后训练用的仿真轨迹，仅 GR-1 人形机器人桌面操作部分就有 24 万条，可直接下载用来微调 GR00T。","related":["英伟达","GR00T N1 系列","合成数据","SimReady 资产","自动驾驶","物理AI"]},{"id":"syngrasp-1b","category":"data","sec":5,"tier":3,"sources":[{"title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data (arXiv 2505.03233)","url":"https://arxiv.org/abs/2505.03233"},{"title":"GraspVLA 项目页","url":"https://pku-epic.github.io/GraspVLA-web/"},{"title":"PKU-EPIC/GraspVLA (GitHub)","url":"https://github.com/PKU-EPIC/GraspVLA"}],"as_of":"2026-08","related_ids":["graspvla","synthetic-data","domain-randomization","objaverse","curobo","sim-to-real-transfer"],"name":"SynGrasp-1B 数据集","alt":"SynGrasp-1B","abbr":"","aliases":["SynGrasp"],"one_liner":"银河通用等构建的十亿帧仿真合成抓取数据集，用于预训练 GraspVLA。","explanation":"SynGrasp-1B 是银河通用（Galbot）联合北京大学、香港大学、北京智源人工智能研究院构建的合成抓取数据集，约 10 亿帧，全部在仿真中生成：从 Objaverse 选出 240 类、1 万多个物体模型随机摆在桌上，用 BoDex 生成稳定抓取位姿，用 cuRobo 规划抓取轨迹，再对材质、光照、相机视角、背景和初始位姿做域随机化后渲染。它用来预训练抓取 VLA 模型 GraspVLA（CoRL 2025），检验只靠合成动作数据能否零样本迁移到真实抓取。数据集于 2026 年 8 月在 Hugging Face 公开。","example":"在 SynGrasp-1B 上预训练的 GraspVLA 不用真机数据微调，就能在真实桌面上按语言指令抓取训练中没见过的物体。","related":["银河通用 GraspVLA","合成数据","域随机化","Objaverse 3D 资产库","cuRobo","仿真到现实迁移"]},{"id":"interndata-a1","category":"data","sec":5,"tier":3,"sources":[{"title":"InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy (arXiv 2511.16651)","url":"https://arxiv.org/abs/2511.16651"},{"title":"InternData-A1 数据集页面（Hugging Face）","url":"https://huggingface.co/datasets/InternRobotics/InternData-A1"}],"as_of":"2026-01","related_ids":["synthetic-data","simulation-data","pi0","internvla","curobo","domain-randomization"],"name":"InternData-A1 数据集","alt":"InternData-A1","abbr":"","aliases":["InternData A1"],"one_liner":"上海 AI 实验室发布的大规模仿真合成数据集，用于预训练通用机器人策略。","explanation":"InternData-A1 是上海人工智能实验室（InternRobotics 团队，北京大学参与）2025 年 11 月发布的机器人操作合成数据集，全部在仿真中生成：超过 63 万条轨迹、7433 小时，覆盖 4 种本体（ARX Lift-2、AgileX Split ALOHA、A2D、Franka）、70 个任务、227 个场景，包含刚体、铰接、柔性物体和流体操作。流水线把技能、任务和本体解耦后自由组合，用 cuRobo 做运动规划，并对相机、光照、物体摆放做域随机化（随机扰动，让模型不依赖固定外观）。论文结论是：只用这份合成数据预训练 π0，在 49 个仿真任务、5 个真机任务和 4 个长程灵巧任务上可与用 π 真机数据预训练的官方 π0 相当。数据以 CC BY-NC-SA 4.0 协议开放在 Hugging Face。","example":"论文报告，部分任务用不到 1600 条仿真样本就能达到 200 条真机样本的效果；70 个任务里有 10 个不用任何真机数据，就在真机上取得了较高成功率。","related":["合成数据","仿真数据","π0","上海AI实验室 InternVLA 系列","cuRobo","域随机化"]},{"id":"generative-data-augmentation","category":"data","sec":5,"tier":2,"sources":[{"title":"ROSIE: Scaling Robot Learning with Semantically Imagined Experience (arXiv 2302.11550)","url":"https://arxiv.org/abs/2302.11550"},{"title":"GenAug: Retargeting behaviors to unseen situations via Generative Augmentation (arXiv 2302.06671)","url":"https://arxiv.org/abs/2302.06671"}],"as_of":"","related_ids":["data-augmentation","synthetic-data","diffusion-model","nvidia-cosmos-transfer","visual-generalization","cross-painting"],"name":"生成式数据增强","alt":"Generative Data Augmentation","abbr":"","aliases":["生成式增强","语义数据增强","Semantic Data Augmentation"],"one_liner":"用图像或视频生成模型改写已有机器人数据，多造出新场景的训练样本。","explanation":"生成式数据增强指用文生图、视频生成等生成模型，在已有机器人演示上改换物体、背景、干扰物或光照，得到新的训练样本，动作标签沿用原数据。代表工作有谷歌 2023 年的 ROSIE（用文本引导的扩散模型在图像里修补出新物体和背景）和华盛顿大学等的 GenAug。它要解决的是真机数据贵、场景单一：一条数据只覆盖一张桌面，增强后同一段动作可以配上许多种外观，从而提升视觉泛化和对干扰物的鲁棒性。局限是它主要改外观，改不了物理过程和动作本身。Cosmos Transfer 这类视频世界模型也常用来做这种增强。","example":"ROSIE 在谷歌已有的机器人数据上，用扩散模型把桌上的物体和背景修补成新样子，用这些图训练出的策略能处理原数据里没有的新物体和干扰物。","related":["数据增强","合成数据","扩散模型","Cosmos Transfer","视觉泛化","跨本体图像替换"]},{"id":"neural-trajectories","category":"data","sec":5,"tier":3,"sources":[{"title":"DreamGen 项目主页（NVIDIA GEAR）","url":"https://research.nvidia.com/labs/gear/dreamgen/"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/abs/2503.14734"},{"title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models (arXiv 2505.12705)","url":"https://arxiv.org/abs/2505.12705"}],"as_of":"2025-06","related_ids":["dreamgen","nvidia-isaac-gr00t-n1","synthetic-data","pseudo-action-labels","inverse-dynamics-model","latent-action-model"],"name":"神经轨迹","alt":"Neural Trajectories","abbr":"","aliases":["神经轨迹数据"],"one_liner":"用视频世界模型生成、再补上伪动作标签的合成机器人训练数据。","explanation":"神经轨迹是英伟达 GEAR 实验室在 GR00T N1（2025 年 3 月）和 DreamGen（2025 年 5 月）中使用的说法，指由视频世界模型生成的合成机器人数据。流程分四步：先在目标机器人的真实数据上微调视频生成模型，让它学会这台机器人的外观和运动方式；再给定初始画面和语言指令，生成机器人执行任务的视频，可以是没采集过的新动作或新环境；然后用潜在动作模型或逆动力学模型（由前后画面反推动作的模型）给视频补上伪动作标签；最后把这些视频加伪动作与真实数据一起训练视觉运动策略。与仿真合成数据相比，它不需要搭建仿真场景和资产，但生成画面的物理合理性不一定可靠，需要专门评估，DreamGen Bench 就是为此设计的。","example":"GR00T N1 在约 88 小时真机数据的基础上生成了约 827 小时神经轨迹（约 10 倍），用 3600 块 L40 GPU 花了约 1.5 天；与真实数据协同训练后，GR-1 人形机器人 8 个真机任务的平均成功率提高 5.8 个百分点。","related":["DreamGen（GR00T Dreams）","GR00T N1 系列","合成数据","伪动作标签","逆动力学模型","潜在动作模型"]},{"id":"real2render2real","category":"data","sec":5,"tier":3,"sources":[{"title":"Real2Render2Real (arXiv:2505.09601)","url":"https://arxiv.org/abs/2505.09601"},{"title":"Real2Render2Real 项目主页","url":"https://real2render2real.com/"}],"as_of":"2025-05","related_ids":["synthetic-data","3d-gaussian-splatting","real-to-sim-to-real","human-video-data","teleoperation","diffusion-policy"],"name":"Real2Render2Real（R2R2R）","alt":"Real2Render2Real: Scaling Robot Data Without Dynamics Simulation or Robot Hardware","abbr":"R2R2R","aliases":["R2R2R","Real2Render2Real"],"one_liner":"用手机扫描加一段人手演示视频，渲染出大量机器人训练数据的方法。","explanation":"Real2Render2Real 是 UC 伯克利（Ken Goldberg 团队）与丰田研究院 2025 年 5 月发布的数据生成方法。输入只要两样：用手机对物体做 3D 扫描，再录一段人手操作的视频。系统用 3D 高斯泼溅重建物体外形，跟踪物体在视频里的 6 自由度运动，再把物体转成网格，配上机器人模型，重新渲染出成千上万条位置、视角各不相同的演示。它只渲染画面、不做动力学仿真（关闭碰撞），所以不用调物理参数，也不用真机。论文称，用 1 次人手演示生成的数据训练出的模型，能达到 150 次遥操作演示的效果，生成耗时约为遥操作的 1/27。","example":"用手机扫一只杯子，再录一段人把杯子放进盘子的视频，R2R2R 就能渲染出几千条机械臂完成同一动作的图像-动作数据，用来训练 π0-FAST 或扩散策略。","related":["合成数据","3D高斯泼溅","真-仿-真闭环","人类视频数据","遥操作","扩散策略"]},{"id":"cross-embodiment-data","category":"data","sec":6,"tier":2,"sources":[{"title":"Open X-Embodiment Collaboration 2023: Open X-Embodiment: Robotic Learning Datasets and RT-X Models","url":"https://arxiv.org/abs/2310.08864"},{"title":"Open X-Embodiment 项目页","url":"https://robotics-transformer-x.github.io/"}],"as_of":"","related_ids":["cross-embodiment","open-x-embodiment","embodiment-gap","unified-action-space","embodiment-specific-head","positive-negative-transfer"],"name":"跨本体数据","alt":"Cross-Embodiment Data","abbr":"","aliases":["多本体数据","Multi-Embodiment Data","X-Embodiment Data"],"one_liner":"由多种不同机器人采集、合在一起训练的数据。","explanation":"跨本体数据指来自多种机器人本体（机器人的具体硬件形态）的数据集合，这些机器人的外形、自由度、相机位置和动作空间各不相同，比如单臂、双臂、移动底盘和人形。单个实验室的数据量有限，把多家数据合起来训练，是希望模型学到不依赖某一台机器的通用技能，各本体都能受益。代表是 2023 年谷歌 DeepMind 牵头的 Open X-Embodiment：汇集 34 个实验室的 60 个数据集、22 种机器人、100 万条以上轨迹，统一成 RLDS 格式。难点是各家动作和观测不一致，要做归一化、统一动作空间或给每个本体配专属输出头；配比不当还可能出现负迁移。","example":"在 Open X-Embodiment 上训练的 RT-1-X，在几个数据量小的实验室任务上，平均成功率比各实验室只用自家数据训练的原方法高约 50%。","related":["跨本体","Open X-Embodiment 数据集","本体差异","统一动作空间","本体专属头","正迁移 / 负迁移"]},{"id":"open-x-embodiment","category":"data","sec":6,"tier":1,"sources":[{"title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models（项目主页）","url":"https://robotics-transformer-x.github.io/"},{"title":"google-deepmind/open_x_embodiment（GitHub）","url":"https://github.com/google-deepmind/open_x_embodiment"}],"as_of":"2023-10","related_ids":["cross-embodiment-data","rt-x","rlds","octo","openvla","oxe-magic-soup"],"name":"Open X-Embodiment 数据集","alt":"Open X-Embodiment","abbr":"OXE","aliases":["OXE","Open X","RT-X 数据集"],"one_liner":"谷歌牵头汇总 22 种机器人、100 多万条真机轨迹的开源数据集。","explanation":"Open X-Embodiment（OXE）是 2023 年 10 月由谷歌 DeepMind 牵头、21 家机构合作发布的跨本体机器人数据集，把 34 个实验室已有的 60 个数据集整理成统一的 RLDS 格式（谷歌提出的按回合存储机器人数据的格式），共 100 多万条真机轨迹、22 种机器人本体、527 种技能。此前各家的数据格式和动作定义不一，很难合并训练。团队在其上训练了 RT-1-X 和 RT-2-X：在数据较少的机器人上，RT-1-X 的成功率平均比只用该机器人自己数据训练的模型高约 50%，说明混合多种机器人的数据能互相帮忙。OXE 随后成为 Octo、OpenVLA 等开源通用策略的主要预训练数据。","example":"RT-2-X 用 OXE 混合数据训练后，在涌现技能（谷歌机器人自己的数据里没有、要从别家机器人数据里学来的技能）评测上的成功率约为只用谷歌自家数据的 RT-2 的 3 倍。","related":["跨本体数据","RT-X","RLDS 格式","Octo","OpenVLA","Magic Soup（OXE 数据配方）"]},{"id":"heterogeneous-data","category":"data","sec":6,"tier":3,"sources":[{"title":"Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers (arXiv)","url":"https://arxiv.org/abs/2409.20537"},{"title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models (arXiv)","url":"https://arxiv.org/abs/2310.08864"}],"as_of":"","related_ids":["cross-embodiment-data","cross-embodiment","heterogeneous-pre-trained-transformers","unified-action-space","embodiment-specific-head","data-mixture"],"name":"异构数据","alt":"Heterogeneous Data","abbr":"","aliases":["多源异构数据"],"one_liner":"来自不同机器人、传感器、采集方式，格式和含义都不统一的数据。","explanation":"机器人数据的「异构」体现在好几层：本体不同（单臂、双臂、人形，关节数和动作空间各不相同）、传感器不同（相机数量和视角、有无深度或触觉）、控制方式不同（关节角还是末端位姿、控制频率高低），来源也不同（真机遥操作、仿真、人类视频）。单个实验室的数据太少，想训练通用策略就得把这些数据混在一起用，但直接拼接会让模型分不清同一个数字在不同机器人上代表什么。常见做法是给每种本体配专属的输入编码和输出头、中间共享一个大主干，比如何恺明团队的 HPT 用这种结构汇集了 52 个数据集；也有工作把动作统一到一个公共空间，或按来源调数据配比。Open X-Embodiment 汇集了 22 种机器人的数据，是典型的异构数据集。","example":"HPT 把真机、多种仿真器、人类视频共 52 个数据集放进同一个预训练，每种本体用各自的「stem」把视觉和本体感知压成少量 token，再送入共享的 Transformer 主干。","related":["跨本体数据","跨本体","异构预训练 Transformer","统一动作空间","本体专属头","数据配比"]},{"id":"robonet","category":"data","sec":6,"tier":3,"sources":[{"title":"RoboNet: Large-Scale Multi-Robot Learning (arXiv:1910.11215)","url":"https://arxiv.org/abs/1910.11215"},{"title":"RoboNet 项目主页","url":"https://www.robonet.wiki/"}],"as_of":"2020-01","related_ids":["cross-embodiment-data","visual-foresight","video-prediction-model","autonomous-data-collection","open-x-embodiment","pre-training"],"name":"RoboNet 数据集","alt":"RoboNet: Large-Scale Multi-Robot Learning","abbr":"","aliases":["RoboNet"],"one_liner":"2019 年发布的多机器人交互视频数据集，7 种机器人约 1500 万帧。","explanation":"RoboNet 是伯克利、斯坦福、宾大、CMU 的研究者（包括 Sergey Levine、Chelsea Finn）2019 年发布的早期大规模多机器人数据集。它汇集了 7 种机器人平台（从 Kuka 工业臂到低成本的 WidowX，以及 Sawyer、Franka、Baxter、Fetch、谷歌 R3）约 1500 万帧视频和对应动作。数据由机器人执行随机动作自主采集，几乎不需要人工演示，也没有任务标签，主要用来训练动作条件的视频预测模型，再做视觉预见式规划。论文发现，先在 RoboNet 上预训练、再迁移到新机器人，效果好于用 4–20 倍数据单独训练。它是跨本体数据集的早期尝试。","example":"研究者在一台新机械臂上只采 300–400 条随机轨迹，微调在 RoboNet 上预训练好的视频预测模型，再用它规划推物体的动作。","related":["跨本体数据","视觉预见 / 基于学习模型的规划","视频预测模型","自主数据采集","Open X-Embodiment 数据集","预训练"]},{"id":"bc-z","category":"data","sec":6,"tier":3,"sources":[{"title":"BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning (CoRL 2021, PMLR)","url":"https://proceedings.mlr.press/v164/jang22a/jang22a.pdf"},{"title":"BC-Z 项目主页","url":"https://sites.google.com/view/bc-z/home"}],"as_of":"2022-02","related_ids":["open-x-embodiment","rt-1","human-gated-dagger","language-conditioned-policy","zero-shot","feature-wise-linear-modulation"],"name":"BC-Z 数据集","alt":"BC-Z","abbr":"","aliases":["BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning","BC-Z Robot Dataset"],"one_liner":"谷歌 2021 年采的 100 个任务真机演示数据集，用来研究零样本任务泛化。","explanation":"BC-Z 是 Google 与 X 登月工厂在 CoRL 2021 发表的工作，名字意为「行为克隆 + 零样本」。团队用 12 台机器人、7 名操作员，通过 VR 遥操作加「共享自主」（策略先自己执行，人在它快出错时接管纠正，即 HG-DAgger）采集了 25,877 条演示、共 125 小时、覆盖 100 个任务，另录了 18,726 段人做同样任务的视频。策略用 FiLM 层接收语言或人类视频的任务嵌入，在 24 个没训练过的任务上平均成功率 44%。它较早证明多任务数据加语言条件能带来零样本泛化，数据后被收入 Open X-Embodiment。","example":"测试时给出训练里从未一起出现过的物体组合指令，例如把某个物体放进某个没配对过的容器，策略不采任何新演示就直接执行；这类新任务共 24 个，平均成功率 44%。","related":["Open X-Embodiment 数据集","RT-1","人工门控 DAgger","语言条件策略","零样本","FiLM 特征调制"]},{"id":"language-table","category":"data","sec":6,"tier":3,"sources":[{"title":"Interactive Language 项目主页","url":"https://interactive-language.github.io/"},{"title":"google-research/language-table（GitHub）","url":"https://github.com/google-research/language-table"},{"title":"Interactive Language: Talking to Robots in Real Time (arXiv 2210.06407)","url":"https://arxiv.org/abs/2210.06407"}],"as_of":"2022-10","related_ids":["tabletop-manipulation","language-conditioned-policy","instruction-following","hindsight-relabeling","open-x-embodiment","palm-e"],"name":"Language-Table 数据集","alt":"Language-Table","abbr":"","aliases":["Language Table","language_table"],"one_liner":"谷歌发布的桌面推积木数据集，含近 60 万条带自然语言指令的轨迹。","explanation":"Language-Table 是谷歌机器人团队随 2022 年论文《Interactive Language: Talking to Robots in Real Time》开源的数据集、仿真环境和基准。场景很简单：UFACTORY xArm6 机械臂装一根圆柱形末端，在桌面上推动彩色积木；动作只是平面上的 2D 位移，频率 5 Hz。数据由 4 台机器人、10 名遥操作员采集，再由众包人员回看视频、标出每段行为的起止并写成指令（即事后重标注）。合计近 60 万条带语言标签的轨迹，其中真机 44.2 万条、人工操作的仿真 18.1 万条，另有若干脚本生成的仿真子集。训练出的策略能执行约 8.7 万种不同的指令说法，估计成功率 93.5%。它主要用于研究实时语言交互和指令跟随，后来也被 Open X-Embodiment 收录。","example":"操作者可以边看边说，比如先让机器人把某块积木推到另一块旁边，看结果再追加下一句，逐步拼出更复杂的长程目标，机器人实时响应每一句指令。","related":["桌面操作","语言条件策略","指令跟随","事后重标注","Open X-Embodiment 数据集","PaLM-E"]},{"id":"rt-1-robot-action-dataset","category":"data","sec":6,"tier":3,"sources":[{"title":"RT-1: Robotics Transformer for Real-World Control at Scale（项目页）","url":"https://robotics-transformer1.github.io/"},{"title":"TFDS Catalog: fractal20220817_data","url":"https://www.tensorflow.org/datasets/catalog/fractal20220817_data"}],"as_of":"2022-12","related_ids":["rt-1","open-x-embodiment","simplerenv","everyday-robots-mobile-manipulator","rlds","real-robot-data"],"name":"RT-1 数据集","alt":"RT-1 Robot Action Dataset (Fractal)","abbr":"","aliases":["Fractal","fractal20220817_data","Google Robot 数据集","RT-1 Robot Action"],"one_liner":"谷歌用 13 台机器人历时 17 个月采集的真机操作数据集。","explanation":"RT-1 数据集是谷歌为训练 RT-1 模型采集的真机数据：13 台 Everyday Robots 单臂移动机器人在办公室厨房类场景里，历时 17 个月、由人遥操作录下 13 万多条 episode（一次完整的任务执行），覆盖 700 多条语言指令。它在 Open X-Embodiment 里名为 fractal20220817_data，TFDS 版本收录 87,212 条 episode，按 RLDS 格式存储，每步包含图像、语言指令和动作（末端位移、夹爪开合、底盘移动、结束信号）。它是早期规模最大的公开真机数据之一，也是 SimplerEnv「Google Robot」评测任务对应的训练数据。","example":"在 Open X-Embodiment 里加载 fractal20220817_data，可以拿到「pick coke can」等指令下机器人从桌面拿起可乐罐的逐帧图像和动作；SimplerEnv 的 Google Robot 拿可乐罐任务就是照这个场景复刻的。","related":["RT-1","Open X-Embodiment 数据集","SimplerEnv","Everyday Robots 移动机械臂","RLDS 格式","真机数据"]},{"id":"rh20t","category":"data","sec":6,"tier":3,"sources":[{"title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot (arXiv:2307.00595)","url":"https://arxiv.org/abs/2307.00595"},{"title":"RH20T 项目主页","url":"https://rh20t.github.io/"}],"as_of":"2023-09","related_ids":["sjtu-mvig-lab","multimodal-data","contact-rich-manipulation","six-axis-force-torque-sensor","real-robot-data","one-shot-imitation-learning"],"name":"RH20T 数据集","alt":"RH20T","abbr":"","aliases":["RH20T","RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot"],"one_liner":"上海交大发布的多模态真机操作数据集，含力觉、音频和人类示范视频。","explanation":"RH20T 是上海交通大学卢策吾团队（MVIG 实验室）2023 年发布的真实机器人操作数据集。它包含超过 11 万条接触丰富的操作序列，覆盖 147 个任务（48 个取自 RLBench、29 个取自 Meta-World，另有 70 个自拟任务），在 7 种机器人配置上采集。每条数据除了多视角 RGB 和深度图像，还有六维力/力矩、音频和动作记录，个别配置带指尖触觉；每条机器人序列还配一段人类完成同一任务的视频和语言描述，目标是支持「看人做一次就学会」的单样本模仿学习。完整数据约 40TB。","example":"一条 RH20T 序列同时提供多个相机的 RGB-D 画面、100Hz 的力/力矩读数、双麦克风音频，以及一段人类完成同一任务的示范视频。","related":["上海交通大学 MVIG 实验室（卢策吾组）","多模态数据","接触丰富操作","六维力传感器","真机数据","单样本模仿学习"]},{"id":"bridgedata-v2","category":"data","sec":6,"tier":2,"sources":[{"title":"Walke et al. 2023: BridgeData V2 (arXiv 2308.12952)","url":"https://arxiv.org/abs/2308.12952"},{"title":"BridgeData V2 项目页","url":"https://rail-berkeley.github.io/bridgedata/"},{"title":"GitHub: simpler-env/SimplerEnv","url":"https://github.com/simpler-env/SimplerEnv"}],"as_of":"2024-01","related_ids":["open-x-embodiment","trossen-robotics-widowx-250","simplerenv","openvla","octo","teleoperation"],"name":"BridgeData V2 数据集","alt":"BridgeData V2","abbr":"","aliases":["Bridge 数据集","BridgeData","Bridge V2"],"one_liner":"伯克利团队在低成本 WidowX 机械臂上采集的约 6 万条多任务操作数据集。","explanation":"BridgeData V2 由 UC 伯克利 Sergey Levine 团队等在 2023 年 8 月发布，全部用 6 自由度的 WidowX 250 机械臂采集，共 60096 条轨迹：50365 条是用 VR 手柄遥操作的演示，9731 条来自脚本化抓放策略。数据覆盖玩具厨房、水槽、桌面等 24 种环境和抓放、推、擦、开关抽屉、叠布等 13 类技能，控制频率 5 Hz，每条轨迹配一句语言指令，许可为 CC BY 4.0。机器便宜、数据开放，它被收入 Open X-Embodiment，是 Octo、OpenVLA 等开源模型训练和评测的常客。","example":"SimplerEnv 在仿真里复刻了 Bridge 的 WidowX 场景，设了「把勺子放到毛巾上」「把胡萝卜放到盘子上」「把绿方块叠到黄方块上」「把茄子放进篮子」四个任务，专门评测用 Bridge 数据训练的策略。","related":["Open X-Embodiment 数据集","WidowX 250 机械臂","SimplerEnv","OpenVLA","Octo","遥操作"]},{"id":"roboset","category":"data","sec":6,"tier":3,"sources":[{"title":"RoboSet 数据集页面","url":"https://robopen.github.io/roboset/"},{"title":"RoboAgent 项目主页","url":"https://robopen.github.io/"}],"as_of":"2023-09","related_ids":["roboagent","action-chunking","teleoperation","kinesthetic-teaching","multi-view","hierarchical-data-format-version-5"],"name":"RoboSet 数据集","alt":"RoboSet","abbr":"","aliases":["RoboSet"],"one_liner":"CMU 与 Meta 发布的厨房场景真机多任务数据集，每帧 4 个视角。","explanation":"RoboSet 是卡内基梅隆大学与 Meta AI 在 RoboAgent 项目（2023 年）中公开的真实机器人数据集，场景以家庭厨房活动为主。数据集页面给出的规模是 2.85 万条轨迹，其中 9500 条由操作员用 Oculus Quest 2 手柄遥操作采集，1.9 万条通过动觉示教回放（在重新摆放的场景里重放已有轨迹）得到。每帧有 4 个相机视角，任务按「活动」组织，每个活动含 4–6 个带语言指令的子任务。RoboAgent 用其中约 7500 条轨迹训练 MT-ACT 策略，学会了 12 种操作技能。数据以 HDF5 格式发布，采用 MIT 许可。","example":"用 h5py 打开一条 RoboSet 轨迹，可以读到 4 个视角的图像、机械臂状态、对应动作和这段任务的语言指令。","related":["RoboAgent（MT-ACT）","动作分块","遥操作","拖动示教","多视角","HDF5 格式"]},{"id":"droid","category":"data","sec":6,"tier":2,"sources":[{"title":"DROID 项目主页","url":"https://droid-dataset.github.io/"},{"title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset (arXiv 2403.12945)","url":"https://arxiv.org/html/2403.12945v2"},{"title":"The DROID Dataset (DROID Docs)","url":"https://droid-dataset.github.io/droid/the-droid-dataset"}],"as_of":"2025-04","related_ids":["open-x-embodiment","real-robot-data","vr-teleoperation","data-diversity","rlds","franka-emika-panda-franka-research-3"],"name":"DROID 数据集","alt":"DROID (Distributed Robot Interaction Dataset)","abbr":"DROID","aliases":["DROID"],"one_liner":"50 名采集员在三大洲 564 个场景用 Franka 机械臂采集的真机操作数据集。","explanation":"DROID 由斯坦福、伯克利等 13 家机构联合采集，2024 年 3 月发布。各家用同一套硬件：Franka Panda 七自由度机械臂装在可调高度的移动桌上，配两台第三视角 ZED 2 双目相机和一台腕部 ZED Mini，采集员用 Quest 2 VR 手柄遥操作。历时 12 个月，50 名采集员在北美、亚洲、欧洲的实验室、办公室和家庭里采到 7.6 万条成功轨迹、约 350 小时，覆盖 564 个场景、86 类任务、1417 个相机视角，另附约 1.6 万条标为失败的轨迹。它主打「野外」场景多样性，π0 等模型的预训练数据里就有 DROID。","example":"训练策略时可直接下载 RLDS 格式的完整 DROID（约 1.7 TB）；需要高清双目画面或深度信息时，改用原始数据版本（约 8.7 TB）。","related":["Open X-Embodiment 数据集","真机数据","VR 遥操作","数据多样性","RLDS 格式","Franka 机械臂（Panda / FR3）"]},{"id":"all-robots-in-one","category":"data","sec":6,"tier":3,"sources":[{"title":"All Robots in One: A New Standard and Unified Dataset for Versatile, General-Purpose Embodied Agents (arXiv 2408.10899)","url":"https://arxiv.org/abs/2408.10899"},{"title":"ARIO 项目主页","url":"https://imaei.github.io/project_pages/ario/"}],"as_of":"2024-08","related_ids":["cross-embodiment-data","open-x-embodiment","multimodal-data","heterogeneous-data","agilex-cobot-magic","rlds"],"name":"ARIO 数据集","alt":"All Robots In One","abbr":"ARIO","aliases":["ARIO 数据标准","All Robots In One 数据集"],"one_liner":"鹏城实验室等提出的统一具身数据格式标准，及按此标准汇集的约 300 万条数据。","explanation":"ARIO 是鹏城实验室多智能体与具身智能研究所联合南方科技大学、中山大学等于 2024 年 8 月发布的工作，既是一套数据格式标准，也是按该标准整理出的大数据集。作者认为 Open X-Embodiment 等汇总数据集格式不统一、模态不全，于是规定：不同形态机器人的控制数据用统一格式记录，用时间戳对齐频率各异的传感器，按「系列-任务-回合」三级组织，支持图像、3D、声音、文本、触觉五种模态。数据集约 300 万个回合、258 个系列、32 万多个任务，来源有三：自建真机平台采集 3662 条，Habitat、MuJoCo 等仿真生成约 70 万条，其余约 233 万条由现有开源数据集转换而来。","example":"ARIO 的真机部分用松灵 Cobot Magic 双臂平台，在真实家居场景里采集了 30 多种操作任务。","related":["跨本体数据","Open X-Embodiment 数据集","多模态数据","异构数据","松灵 Cobot Magic","RLDS 格式"]},{"id":"robomind","category":"data","sec":6,"tier":2,"sources":[{"title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","url":"https://arxiv.org/abs/2412.13877"},{"title":"RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence","url":"https://arxiv.org/abs/2512.24653"},{"title":"RoboMIND 项目主页","url":"https://x-humanoid-robomind.github.io/"}],"as_of":"2025-12","related_ids":["cross-embodiment-data","real-robot-data","failure-data","agibot-world","open-x-embodiment","beijing-humanoid-robot-innovation-center"],"name":"RoboMIND 数据集","alt":"RoboMIND (Multi-embodiment Intelligence Normative Data for Robot Manipulation)","abbr":"","aliases":["RoboMIND","RoboMIND 2.0"],"one_liner":"北京人形机器人创新中心与北大发布的统一规范采集的多本体真机操作数据集。","explanation":"RoboMIND 由北京人形机器人创新中心、北京大学计算机学院和智源研究院于 2024 年 12 月发布，论文收录于 RSS 2025。它按统一采集规范，用 Franka、UR5e、松灵双臂和带双灵巧手的人形机器人四种本体采了 10.7 万条演示，覆盖 479 个任务、96 类物体，另有 5 千条注明原因的失败演示，并在 Isaac Sim 里搭了数字孪生环境；每条轨迹存为一个 HDF5 文件。2025 年 12 月的 RoboMIND 2.0 扩到六种本体、739 个任务、31 万多条双臂轨迹，新增 1.2 万条触觉片段、2 万条移动操作轨迹和 2 万条仿真轨迹，并提出分层双系统框架 MIND-2。数据在 ModelScope 和 Hugging Face 提供下载。","example":"研究者可以只取 RoboMIND 里 UR5e 单臂的轨迹训练模仿学习策略，再对照同一任务的失败演示，看策略常在哪一步出错。","related":["跨本体数据","真机数据","失败数据","AgiBot World 数据集","Open X-Embodiment 数据集","北京人形机器人创新中心"]},{"id":"agibot-world","category":"data","sec":6,"tier":2,"sources":[{"title":"AgiBot World Colosseo 技术报告 (arXiv 2503.06669)","url":"https://arxiv.org/abs/2503.06669"},{"title":"GitHub: OpenDriveLab/AgiBot-World","url":"https://github.com/OpenDriveLab/AgiBot-World"},{"title":"Hugging Face: agibot-world/AgiBotWorld2026","url":"https://huggingface.co/datasets/agibot-world/AgiBotWorld2026"}],"as_of":"2026-09","related_ids":["agibot","agibot-go-1","open-x-embodiment","embodied-ai-training-ground","real-robot-data","agibot-genie-g1"],"name":"AgiBot World 数据集","alt":"AgiBot World","abbr":"","aliases":["智元 AgiBot World","AgiBot World Colosseo","AgiBot World Alpha","AgiBot World Beta","AGIBOT WORLD 2026"],"one_liner":"智元机器人等发布的大规模真机操作数据集，Beta 版超百万条轨迹。","explanation":"AgiBot World 是智元机器人联合香港大学、上海人工智能实验室等发布的真机操作数据集。Alpha 版 2024 年 12 月放出约 9.2 万条轨迹；Beta 版 2025 年 3 月扩到 100 万条以上、约 2976 小时，覆盖 217 个任务、5 类场景，由 100 台智元 G1 在约 4000 平方米的采集场里用 VR 和动捕遥操作录制，带任务和子步骤语言标注并经人工质检，智元的 GO-1 模型就在它上面训练。2026 年又放出 AgiBot World 2026 预览版，改用 G2 在商业空间、家庭等真实环境采集。许可为 CC BY-NC-SA 4.0，不可商用。","example":"技术报告称，在 AgiBot World 上预训练的策略，在分布内和分布外场景中比用 Open X-Embodiment 预训练的策略平均高约 30%。","related":["智元机器人","智元 GO-1（启元大模型）","Open X-Embodiment 数据集","具身智能训练场","真机数据","智元 精灵 G1"]},{"id":"fourier-actionnet","category":"data","sec":6,"tier":3,"sources":[{"title":"Fourier ActionNet 官网","url":"https://action-net.org/"}],"as_of":"2025","related_ids":["fourier","fourier-gr-2","vr-teleoperation","dexterous-hand","lerobotdataset","real-robot-data"],"name":"傅利叶 ActionNet 数据集","alt":"Fourier ActionNet","abbr":"","aliases":["ActionNet"],"one_liner":"傅利叶开源的人形机器人加灵巧手遥操作数据集，约 3 万条轨迹。","explanation":"人形机器人公司傅利叶于 2025 年开源的真机数据集。数据由操作员戴 Apple Vision Pro 做 VR 遥操作，驱动傅利叶 GR1-T1、GR1-T2 和 GR2 人形机器人采集，配 6 自由度和 12 自由度两种灵巧手，共 3 万多条轨迹、约 140 小时，以桌面双手操作为主，如抓取放置、倒水、开关柜门、精确摆放。每条数据的语言指令先由 Qwen2.5-VL-7B 自动生成，再全部人工核对。数据采用 LeRobot 数据集格式，可直接用来训练 ACT、扩散策略、iDP3 等方法；数据集本身为非商用许可，训练代码为 Apache 2.0。","example":"一条倒水轨迹：GR2 用灵巧手拿起容器把水倒进杯子，同时记录第一人称相机画面、关节状态和一句语言指令。","related":["傅利叶","傅利叶 GR-2","VR 遥操作","灵巧手","LeRobot 数据集格式","真机数据"]},{"id":"galaxea-open-world-dataset","category":"data","sec":6,"tier":3,"sources":[{"title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model (arXiv)","url":"https://arxiv.org/abs/2509.00576"},{"title":"Galaxea Open-World Dataset (Hugging Face)","url":"https://huggingface.co/datasets/OpenGalaxea/Galaxea-Open-World-Dataset"},{"title":"GalaxeaVLA 项目主页","url":"https://opengalaxea.github.io/GalaxeaVLA/"}],"as_of":"2025-08","related_ids":["galaxea-ai","galaxea-r1","galaxea-g0-dual-system-vla","real-robot-data","subtask-segmentation","lerobotdataset"],"name":"星海图开放世界数据集","alt":"Galaxea Open-World Dataset","abbr":"","aliases":["Galaxea Open-World 数据集"],"one_liner":"星海图用同一款移动双臂机器人在真实场所采集的约 500 小时数据集。","explanation":"具身智能公司星海图（Galaxea）2025 年 8 月随 G0 模型论文开源的真机数据集。全部数据用自家 R1 Lite 移动双臂机器人（23 个自由度）采集，地点是 11 处真实的住宅、餐饮、零售和办公场所，共约 10 万条轨迹、150 类任务、50 个场景、1600 多种物体、58 种操作技能，约 500 小时。每条数据切分成原子子任务，标注员从标准化描述里选词，附中英文子任务语言标注。数据为 LeRobot 格式，含头部和双腕 4 路相机、关节状态和 IMU，可在 Hugging Face 和魔搭社区下载。它的特点是单一本体、真实环境，论文发现用它做单本体预训练对 G0 模型效果很关键。","example":"任务「整理水果」：R1 Lite 在真实环境中把水果摆好，整条轨迹被切成若干子任务，每段附中英文描述。","related":["星海图","星海图 R1","星海图 G0","真机数据","子任务切分","LeRobot 数据集格式"]},{"id":"humanoid-everyday","category":"data","sec":6,"tier":3,"sources":[{"title":"Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation (arXiv)","url":"https://arxiv.org/abs/2510.08807"},{"title":"Humanoid Everyday 项目主页","url":"https://humanoideveryday.github.io/"}],"as_of":"2025-10","related_ids":["humanoid-robot","unitree-g1","unitree-h1","vr-teleoperation","apple-vision-pro","real-world-evaluation"],"name":"Humanoid Everyday 数据集","alt":"Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation","abbr":"","aliases":["Humanoid Everyday"],"one_liner":"南加大与丰田研究院发布的人形机器人真机操作数据集，覆盖 260 个任务。","explanation":"Humanoid Everyday 由南加州大学和丰田研究院在 2025 年 10 月发布。现有机器人数据集大多来自固定机械臂，人形机器人的数据少且任务单一，这个数据集就是为补这块空缺。数据用宇树 G1（29 自由度，配 Dex3-1 三指灵巧手）和 H1（27 自由度，配因时灵巧手）采集，操作员戴 Apple Vision Pro 遥操作，共 1.03 万条轨迹、300 多万帧、260 个任务，分为基础操作、柔性物体、铰接物体、工具使用、高精度操作、人机交互、移动操作 7 大类。每条数据以 30 Hz 同步记录 RGB、深度、激光雷达、触觉、IMU 和语言描述。作者还搭了云端评测平台，研究者提交策略即可在其受控真机环境里跑测试拿结果。数据以 CC BY 4.0 协议公开。","example":"","related":["人形机器人","宇树 G1","宇树 H1","VR 遥操作","Apple Vision Pro","真机评测"]},{"id":"robocoin","category":"data","sec":6,"tier":3,"sources":[{"title":"RoboCOIN (arXiv:2511.17441)","url":"https://arxiv.org/abs/2511.17441"},{"title":"RoboCOIN 项目主页","url":"https://flagopen.github.io/RoboCOIN/"}],"as_of":"2026-04","related_ids":["beijing-academy-of-artificial-intelligence","bimanual-manipulation","cross-embodiment-data","lerobotdataset","subtask-segmentation","agibot-world"],"name":"RoboCOIN 数据集","alt":"RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation","abbr":"","aliases":["RoboCOIN","RoboCoin"],"one_liner":"智源牵头开源的多本体双臂操作数据集，覆盖 15 种机器人。","explanation":"RoboCOIN 是北京智源人工智能研究院牵头、联合二十多家高校和机器人公司于 2025 年 11 月开源的双臂操作数据集。它有超过 18 万条演示，来自 15 种机器人平台，包括双臂机器人、半身人形和全身人形（如松灵、星海图、智元、银河通用、乐聚、宇树等厂商的机型），覆盖 16 种环境、421 个双臂任务和 432 种物体，任务按 39 类双臂协作动作归类。标注分三层：整条轨迹的任务概念、分段的子任务、逐帧的运动学信息。配套的 CoRobot 处理流程基于 LeRobot，用于数据质检、自动标注和多本体数据统一管理。","example":"同一条双臂演示带三层标注：整条轨迹说明做的是什么任务，分段标出每个子任务的起止，逐帧给出运动学数据；数据可用 LeRobot 生态的工具直接加载训练。","related":["北京智源人工智能研究院","双臂操作","跨本体数据","LeRobot 数据集格式","子任务切分","AgiBot World 数据集"]},{"id":"molmoact2-bimanualyam","category":"data","sec":6,"tier":3,"sources":[{"title":"Ai2 博客：MolmoAct 2","url":"https://allenai.org/blog/molmoact2"},{"title":"allenai/MolmoAct2-BimanualYAM-Dataset（Hugging Face）","url":"https://huggingface.co/datasets/allenai/MolmoAct2-BimanualYAM-Dataset"},{"title":"MolmoAct2: Action Reasoning Models for Real-world Deployment (arXiv 2605.02881)","url":"https://arxiv.org/abs/2605.02881"}],"as_of":"2026-06","related_ids":["molmoact","i2rt-yam-arm","bimanual-manipulation","teleoperation","lerobotdataset","allen-institute-for-ai"],"name":"BimanualYAM 数据集","alt":"MolmoAct2-BimanualYAM Dataset","abbr":"","aliases":["MolmoAct2-BimanualYAM","MolmoAct 2-Bimanual YAM"],"one_liner":"Ai2 为 MolmoAct2 采集开源的双臂遥操作数据集，超过 720 小时。","explanation":"MolmoAct2-BimanualYAM 是艾伦人工智能研究所（Ai2）2026 年 5 月随 MolmoAct2 模型一起开源的双臂操作数据集，在 Cortex AI 支持下采集整理。数据是两台 I2RT YAM 机械臂的遥操作示教（每臂 6 个关节加 1 个夹爪，动作为 14 维关节位置），总计超过 720 小时；Hugging Face 上的合并版本含 32,246 条轨迹、约 7600 万帧（30 帧/秒），以桌面双臂任务为主，如叠毛巾、扫描商品、给手机充电，每条轨迹附有标注的语言指令。Ai2 称它是迄今最大的开源双臂数据集，数据量是初代 MolmoAct 所用机器人数据的 30 多倍。数据采用 LeRobot v3.0 格式、Apache 2.0 协议，可直接用来预训练或微调双臂 VLA。","example":"MolmoAct2 把这份数据作为主要训练数据之一，再混入其他机器人数据集；Ai2 称训练后的模型不必针对每个任务单独微调就能完成双臂操作。","related":["MolmoAct","I2RT YAM 机械臂","双臂操作","遥操作","LeRobot 数据集格式","艾伦人工智能研究所"]},{"id":"robovqa","category":"data","sec":6,"tier":3,"sources":[{"title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics (arXiv:2311.00899)","url":"https://arxiv.org/abs/2311.00899"}],"as_of":"2023-11","related_ids":["visual-question-answering","embodied-reasoning","long-horizon-task","vision-language-model","google-deepmind","language-annotation"],"name":"RoboVQA 数据集","alt":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","abbr":"","aliases":["RoboVQA"],"one_liner":"谷歌 DeepMind 发布的面向机器人长程任务的视频问答数据集。","explanation":"RoboVQA 是 Google DeepMind（Pierre Sermanet 等）2023 年 11 月发布的数据集和模型工作。数据集含约 83 万组「视频—文本」对、2.95 万条不同指令，问题围绕长程任务展开：下一步该做什么、这一步完成了没有、某个动作现在能不能做等。采集采用「自下而上」的众包方式：先收集开放式的长程任务，再由机器人、人或手持抓取工具的人去执行并标注，论文称吞吐量是传统逐步采集的 2.2 倍。作者用它训练了视频视觉语言模型 RoboVQA-VideoCoCa，以人工干预率作统一指标；结果显示视频输入的模型比单图模型平均错误率低 19%。","example":"给模型看一段机器人在厨房里的视频并问「任务完成了吗？」或「下一步应该做什么？」，模型用文字作答，例如「把海绵放进水槽」。","related":["视觉问答","具身推理","长程任务","视觉语言模型","谷歌 DeepMind","语言标注"]},{"id":"baihu-vtouch-visuo-tactile-dataset","category":"data","sec":6,"tier":3,"sources":[{"title":"国地中心发布全球首个跨本体视触觉多模态数据集「白虎-VTouch」（腾讯新闻）","url":"https://news.qq.com/rain/a/20260126A04W2D00"}],"as_of":"2026-01","related_ids":["vision-based-tactile-sensor","tactile-data","cross-embodiment-data","weitai-robotics","qinglong","national-and-local-co-built-humanoid-robotics-innovation-cen"],"name":"白虎-VTouch 视触觉数据集","alt":"Baihu-VTouch Visuo-Tactile Dataset","abbr":"","aliases":["白虎-VTouch","VTouch 视触觉数据集","VTouch"],"one_liner":"国地共建人形机器人创新中心与纬钛科技 2026 年发布的跨本体视触觉数据集。","explanation":"白虎-VTouch 是国家地方共建人形机器人创新中心（上海）联合视触觉传感器公司上海纬钛科技，于 2026 年 1 月 26 日发布的数据集。视触觉传感器用内置摄像头拍摄软胶表面被压出的形变，从而感知接触的形状和力度。据发布方介绍，数据集总时长超过 6 万分钟，含约 9072 万对真实物体接触样本，同步记录视触觉图像、RGB-D 画面和关节位姿；采集本体包括轮臂机器人、双足人形机器人「青龙」和手持智能终端。任务覆盖家居家政、工业制造、餐饮服务、特种作业 4 类场景，共 380 多种任务、100 多种原子技能、500 多种真实物品。现有大规模机器人数据大多只有视觉和动作，它补的是接触这一维信息。首批 6000 分钟已在 OpenLoong 开源社区上线。","example":"数据集中有 260 多种接触密集型任务，训练需要「手感」的操作策略时，可把这些视触觉图像和视觉、位姿一起作为输入。","related":["视触觉传感器","触觉数据","跨本体数据","纬钛科技","青龙","国家地方共建人形机器人创新中心（上海人形机器人创新中心）"]},{"id":"daimon-infinity","category":"data","sec":6,"tier":3,"sources":[{"title":"戴盟联合数十家头部机构，发布全球最大规模含触觉全模态物理世界数据集（魔搭社区）","url":"https://modelscope.csdn.net/69e03dd70a2f6a37c5a04836.html"},{"title":"Daimon-Infinity 数据集（戴盟官网）","url":"https://www.dmrobot.com/daas/daimon-infinity.html"},{"title":"中国移动与戴盟机器人共建含触觉全模态物理世界数据集（新华网）","url":"http://www.zj.xinhuanet.com/20260421/603839d919c34af49dcbd0d7677e7786/c.html"}],"as_of":"2026-09","related_ids":["tactile-data","vision-based-tactile-sensor","robot-free-data-collection","daimon-robotics","daimon-dm-tac-visuotactile-sensor","modelscope"],"name":"戴盟 Daimon-Infinity 数据集","alt":"Daimon-Infinity","abbr":"","aliases":["Daimon-Infinity 数据集","戴盟含触觉全模态物理世界数据集"],"one_liner":"戴盟机器人 2026 年发布的含视触觉信号的大规模真实操作数据集。","explanation":"Daimon-Infinity 是深圳戴盟机器人（主业为视触觉传感器）于 2026 年 4 月 15 日联合数十家机构发布的具身数据集，主打含触觉的全模态。数据主要来自戴盟自研的无本体二指夹爪和五指手套，搭载 11 万感知单元、120Hz 的视触觉传感器（用摄像头拍弹性体形变来测接触），以及鱼眼相机、编码器、IMU 和双目相机，另有头戴第一人称、遥操作和仿真数据。发布时称计划开源 1 万小时，覆盖 16 个行业、80 个场景、2000 多类任务，首批 1000 小时已上线魔搭社区；官网现称总规模超百万小时。它补上了多数操作数据集缺失的接触力、滑移等信号。","example":"开源部分含 1400 多个时长超过 40 秒的长序列任务，如用夹爪或手套完成抓放、插入、堆叠，数据同时记录视触觉、画面和动作轨迹，可用来训练带触觉输入的操作策略。","related":["触觉数据","视触觉传感器","无本体采集","戴盟机器人","戴盟 DM-Tac 视触觉传感器","魔搭社区"]},{"id":"hierarchical-data-format-version-5","category":"data","sec":7,"tier":2,"sources":[{"title":"The HDF Group: HDF5","url":"https://www.hdfgroup.org/solutions/hdf5/"},{"title":"robomimic Docs: Datasets Overview","url":"https://robomimic.github.io/docs/datasets/overview.html"},{"title":"ACT (tonyzhaozh/act) GitHub","url":"https://github.com/tonyzhaozh/act"}],"as_of":"","related_ids":["lerobotdataset","rlds","zarr","apache-parquet","robomimic","action-chunking-with-transformers"],"name":"HDF5 格式","alt":"Hierarchical Data Format version 5","abbr":"HDF5","aliases":["h5 文件",".hdf5 文件","HDF5 文件"],"one_liner":"把多组大数组分层存进一个文件的通用格式，常用来存机器人演示数据。","explanation":"HDF5 是 HDF Group 维护的开源文件格式和函数库，后缀一般是 .h5 或 .hdf5。它像文件里的文件夹系统：用「组」分层，组里放多维数组（称为数据集），还能附带元数据，并可以只读取其中一部分。机器人的一条演示包含多路相机图像、关节状态、动作等时间序列，正适合装进 HDF5。robomimic 用它存整套数据集，每条轨迹是 data/demo_0 这样的组；ACT/ALOHA 的采集脚本每条 episode 存一个 hdf5 文件。图像原样存储时体积很大，新近的开源数据集也常改用 LeRobot 格式、RLDS 等。","example":"robomimic 数据集文件里，data/demo_0/actions 是一条轨迹的动作数组，形状为（步数, 动作维度）；data/demo_0/obs/agentview_image 是对应时刻的相机图像。","related":["LeRobot 数据集格式","RLDS 格式","Zarr 格式","Parquet 格式","RoboMimic","ACT"]},{"id":"zarr","category":"data","sec":7,"tier":3,"sources":[{"title":"Zarr 官网","url":"https://zarr.dev/"},{"title":"UMI Robot Dataset Community: Zarr data format","url":"https://umi-data.github.io"}],"as_of":"","related_ids":["hierarchical-data-format-version-5","webdataset","apache-parquet","lerobotdataset","diffusion-policy","universal-manipulation-interface"],"name":"Zarr 格式","alt":"Zarr","abbr":"","aliases":["zarr",".zarr.zip"],"one_liner":"把大型多维数组切块压缩存储的开源格式，扩散策略和 UMI 用它存训练数据。","explanation":"一种开源的分块、压缩 N 维数组存储格式，由社区维护、NumFOCUS 做财务托管，有 v2、v3 两版规范，Python、Rust、C++、JavaScript 等十种语言有实现，最早在气候、生物成像等科学数据领域流行。它把大数组切成许多小块（chunk）分别压缩，读某一段时只解压对应的块；数据可放在本地目录、zip 文件或云对象存储里，支持并行读写。概念上可以理解成「嵌套的 numpy 数组字典」，定位接近 HDF5，但存储后端、分块和压缩方式更灵活。机器人学习里，扩散策略（Diffusion Policy）的代码用 Zarr 存训练数据，UMI 沿用这一做法，把一次采集会话打包成单个 dataset.zarr.zip，方便训练时快速随机读取。","example":"UMI 的示例数据 dataset.zarr.zip 里有 camera0_rgb（2315×224×224×3 的图像）、robot0_eef_pos（末端位置）、robot0_gripper_width（夹爪开合宽度）等数组，另用 episode_ends 记录每条演示在哪一帧结束。","related":["HDF5 格式","WebDataset 格式","Parquet 格式","LeRobot 数据集格式","扩散策略","通用操作接口"]},{"id":"rlds","category":"data","sec":7,"tier":2,"sources":[{"title":"RLDS: an Ecosystem to Generate, Share and Use Datasets in Reinforcement Learning","url":"https://arxiv.org/abs/2111.02767"},{"title":"google-research/rlds (GitHub)","url":"https://github.com/google-research/rlds"},{"title":"google-deepmind/open_x_embodiment (GitHub)","url":"https://github.com/google-deepmind/open_x_embodiment"}],"as_of":"2025-11","related_ids":["open-x-embodiment","tensorflow-datasets","tfrecord","lerobotdataset","hierarchical-data-format-version-5","episode"],"name":"RLDS 格式","alt":"RLDS (Reinforcement Learning Datasets)","abbr":"RLDS","aliases":["RLDS 数据格式"],"one_liner":"谷歌提出的按「回合—步」两层组织序列决策数据的标准格式与工具链。","explanation":"RLDS 是 Google Research 在 2021 年发布的数据生态，用来记录、共享和处理强化学习、离线强化学习和模仿学习数据。数据分两层：episode（回合）带 episode_id 等元数据，里面是一串 step（步）；每步必有 is_first、is_last 两个标志，可选 observation、action、reward、discount 等字段。配套 EnvLogger 记录数据，经 TensorFlow Datasets（TFDS）发布和读取。它让不同实验室的数据能用同一套代码读：Open X-Embodiment 的各个子数据集都按 RLDS 回合格式提供，Octo、OpenVLA 的训练代码直接读它。PyTorch 生态近年更多转向 LeRobotDataset，RLDS 的 GitHub 仓库已于 2025 年 11 月归档。","example":"用 tfds.load 读取 Open X-Embodiment 里的 BridgeData V2 子集，逐个回合遍历其中的 steps，取出每一步的图像、语言指令和动作送进训练。","related":["Open X-Embodiment 数据集","TFDS（TensorFlow Datasets）","TFRecord 格式","LeRobot 数据集格式","HDF5 格式","回合"]},{"id":"tensorflow-datasets","category":"data","sec":7,"tier":3,"sources":[{"title":"TensorFlow Datasets Overview","url":"https://www.tensorflow.org/datasets/overview"},{"title":"google-deepmind/open_x_embodiment (GitHub)","url":"https://github.com/google-deepmind/open_x_embodiment"},{"title":"google-research/rlds (GitHub)","url":"https://github.com/google-research/rlds"}],"as_of":"","related_ids":["rlds","tfrecord","open-x-embodiment","tensorflow","lerobotdataset"],"name":"TFDS（TensorFlow Datasets）","alt":"TensorFlow Datasets (TFDS)","abbr":"TFDS","aliases":["tensorflow_datasets","tfds"],"one_liner":"谷歌的开源数据集库，一行代码下载并加载成可训练的数据管道。","explanation":"TFDS 是谷歌维护的开源数据集库，收录上千个现成数据集，涵盖图像、文本、音频、机器人等。每个数据集有一个构建器（builder），负责下载原始数据、按固定流程转换并存成 TFRecord 或 ArrayRecord 分片；调用 tfds.load 就得到 tf.data.Dataset，也能转成 NumPy 给 JAX、PyTorch 用，并附带版本号和元数据。它是包在 tf.data 外面的一层，不是 tf.data 本身。具身领域的 RLDS 格式和 Open X-Embodiment 数据集都按 TFDS 规范发布，Octo、OpenVLA 的训练代码也通过它读数据。","example":"用 tfds.builder_from_directory 指向 Open X-Embodiment 在谷歌云存储上的 fractal20220817_data 目录，就能按 episode 遍历 RT-1 数据集的图像、语言指令和动作。","related":["RLDS 格式","TFRecord 格式","Open X-Embodiment 数据集","TensorFlow","LeRobot 数据集格式"]},{"id":"tfrecord","category":"data","sec":7,"tier":3,"sources":[{"title":"TensorFlow Tutorial: TFRecord and tf.train.Example","url":"https://www.tensorflow.org/tutorials/load_data/tfrecord"},{"title":"TensorFlow Datasets Overview","url":"https://www.tensorflow.org/datasets/overview"}],"as_of":"","related_ids":["tensorflow-datasets","rlds","protocol-buffers","apache-parquet","hierarchical-data-format-version-5","webdataset"],"name":"TFRecord 格式","alt":"TFRecord","abbr":"","aliases":[".tfrecord","tf.train.Example"],"one_liner":"TensorFlow 的二进制文件格式，把一条条序列化记录顺序拼接存放。","explanation":"TFRecord 是 TensorFlow 的数据存储格式：一个文件由一条条二进制记录首尾相连组成，每条带长度和 CRC 校验，内容通常是用 protobuf（谷歌的序列化协议）编码的 tf.train.Example，即「字段名 → 数值列表」的字典。它适合大批量顺序读取，官方建议切成多个分片、每个最好 100MB 以上，便于并行读取。缺点是只能顺序扫描，不便按下标随机取某一条，解析也依赖 TensorFlow。TFDS 默认用它存数据，所以 RLDS 和 Open X-Embodiment 数据集下载下来是一批 TFRecord 分片；PyTorch 生态的新数据集多改用 Parquet 加视频、HDF5 或 Zarr。","example":"一个 RLDS 数据集目录里通常是 dataset_info.json、features.json，加上形如 xxx-train.tfrecord-00000-of-01024 的分片文件，其中每条记录存一个完整 episode。","related":["TFDS（TensorFlow Datasets）","RLDS 格式","Protobuf","Parquet 格式","HDF5 格式","WebDataset 格式"]},{"id":"lerobotdataset","category":"data","sec":7,"tier":2,"sources":[{"title":"Hugging Face LeRobot Docs: LeRobotDataset v3.0","url":"https://huggingface.co/docs/lerobot/lerobot-dataset-v3"},{"title":"Hugging Face Blog: LeRobotDataset v3.0","url":"https://huggingface.co/blog/lerobot-datasets-v3"}],"as_of":"2025-09","related_ids":["lerobot","hugging-face","apache-parquet","hierarchical-data-format-version-5","rlds","so-100-so-101-arm"],"name":"LeRobot 数据集格式","alt":"LeRobotDataset","abbr":"","aliases":["LeRobot 数据集","LeRobotDataset 格式","LeRobotDataset v3.0"],"one_liner":"LeRobot 库的标准数据格式，用表格存状态和动作、用视频存相机画面。","explanation":"LeRobotDataset 是 Hugging Face 开源机器人库 LeRobot 的数据集格式，可直接在 Hub 上共享。它分三部分：状态、动作、时间戳等低维信号存成 Parquet 表格；相机画面编码成 MP4 视频；meta 目录记录字段定义、帧率、归一化统计量、任务文本和每条 episode 的起止位置。2025 年 9 月发布的 v3.0 把多条 episode 合进同一个文件（v2.1 是一条一个文件），靠元数据定位，以支撑更大规模，还能不下载、直接从 Hub 流式读取。LeRobot 里的 ACT、扩散策略、SmolVLA 等都直接读这种格式。","example":"用 lerobot-record 一边遥操作 SO-101 机械臂一边录制，数据按 v3.0 格式保存并推送到 Hub；训练时用 LeRobotDataset 加载，每个样本是含 observation.state、action 和相机图像的张量字典。","related":["LeRobot","Hugging Face","Parquet 格式","HDF5 格式","RLDS 格式","SO-100 / SO-101 机械臂"]},{"id":"apache-parquet","category":"data","sec":7,"tier":3,"sources":[{"title":"Apache Parquet 官方文档 Overview","url":"https://parquet.apache.org/docs/overview/"},{"title":"LeRobotDataset v3.0 文档（Hugging Face）","url":"https://huggingface.co/docs/lerobot/lerobot-dataset-v3"},{"title":"Apache Parquet - Wikipedia","url":"https://en.wikipedia.org/wiki/Apache_Parquet"}],"as_of":"2026-09","related_ids":["lerobotdataset","hierarchical-data-format-version-5","rlds","zarr","lerobot","mcap"],"name":"Parquet 格式","alt":"Apache Parquet","abbr":"","aliases":["Parquet"],"one_liner":"按列存储的开源数据文件格式，LeRobot 数据集用它存状态、动作等数值数据。","explanation":"Apache Parquet 是一种开源的列式数据文件格式，2013 年由 Twitter 和 Cloudera 联合推出，2015 年成为 Apache 顶级项目。「列式」指同一列的数据连续存放，而不是一行一行存；同类数据放在一起压缩率高，读取时也能只取需要的列。Spark、pandas、DuckDB 等工具都能直接读写。在具身智能里，Hugging Face 的 LeRobot 数据集格式用 Parquet 存关节状态、动作、时间戳这类低维高频数据，相机画面则单独编码成 MP4 视频，再用 JSON/Parquet 元数据记录每个回合在文件里的起止位置。v3 版把多个回合拼进同一批 Parquet 文件，并支持直接从 Hub 流式读取。","example":"用 pandas.read_parquet 打开 LeRobot 数据集 data/ 目录下的文件，就能看到每一帧的 observation.state、action、timestamp 等列。","related":["LeRobot 数据集格式","HDF5 格式","RLDS 格式","Zarr 格式","LeRobot","MCAP 格式"]},{"id":"webdataset","category":"data","sec":7,"tier":3,"sources":[{"title":"webdataset/webdataset (GitHub)","url":"https://github.com/webdataset/webdataset"},{"title":"Efficient PyTorch I/O library for Large Datasets, Many Files, Many GPUs (PyTorch Blog)","url":"https://pytorch.org/blog/efficient-pytorch-io-library-for-large-datasets-many-files-many-gpus"},{"title":"BeingBeyond/UniHand_Preview (Hugging Face)","url":"https://huggingface.co/datasets/BeingBeyond/UniHand_Preview"}],"as_of":"","related_ids":["apache-parquet","hierarchical-data-format-version-5","zarr","tfrecord","lerobotdataset","rlds"],"name":"WebDataset 格式","alt":"WebDataset","abbr":"","aliases":["wds"],"one_liner":"把训练样本按同名文件打包进一串 tar 分片，方便大规模顺序读取的数据格式。","explanation":"由 Thomas Breuel 开发的开源深度学习数据格式及同名 Python 库，PyTorch 官方博客曾专文介绍，并与英伟达的 AIStore 存储服务配套。它不发明新格式，而是直接用标准 tar 归档：同一条样本的多个文件（如 000042.jpg、000042.json）去掉扩展名后同名、相邻存放，整个数据集切成编号连续的分片（shard）。训练时按分片顺序读、不用解压，可以直接从本地磁盘、网页服务器或云存储流式读取，适合海量小文件和多 GPU 训练，避免随机读取拖垮文件系统。它实现了 PyTorch 的 IterableDataset 接口，能直接接 DataLoader。具身领域常用它打包大规模视频和图像数据，例如智在无界在 Hugging Face 发布的 UniHand_Preview 就是这种格式。","example":"把 100 万段第一人称视频切成 1000 个 tar 分片，每个分片里放「编号.mp4 + 编号.json」，训练时多台机器各读一部分分片并行加载。","related":["Parquet 格式","HDF5 格式","Zarr 格式","TFRecord 格式","LeRobot 数据集格式","RLDS 格式"]},{"id":"mcap","category":"data","sec":7,"tier":3,"sources":[{"title":"MCAP 官网","url":"https://mcap.dev/"},{"title":"Foxglove: MCAP as the ROS 2 default bag format","url":"https://foxglove.dev/blog/mcap-as-the-ros2-default-bag-format"},{"title":"ros2/rosbag2（GitHub）","url":"https://github.com/ros2/rosbag2"}],"as_of":"2026-09","related_ids":["ros-bag","robot-operating-system-2","foxglove-studio","hierarchical-data-format-version-5","lerobotdataset","nvidia-isaac-teleop"],"name":"MCAP 格式","alt":"MCAP","abbr":"MCAP","aliases":[".mcap","MCAP 文件"],"one_liner":"Foxglove 推出的开源多模态日志文件格式，ROS 2 录包默认用它。","explanation":"MCAP 是机器人软件公司 Foxglove 设计的开源容器文件格式，用来把多路带时间戳的数据（相机图像、点云、关节状态、控制指令等）按发布/订阅的频道存进同一个文件。它不绑定序列化方式，ROS 消息、Protobuf、JSON 等都能存，并把消息结构定义（schema）一起写进文件，代码更新多年后仍能读懂；采用只追加写入，程序意外退出时已写入的数据不易损坏；支持分块 LZ4/Zstd 压缩和索引，便于按时间段快速读取。从 2023 年 5 月的 ROS 2 Iron 起，它取代 SQLite 成为 rosbag2 的默认存储格式。官方提供 C++、Python、Go、Rust、Swift、TypeScript 读写库。在具身数据采集中，它常用作原始录制格式，之后再转成 LeRobot、RLDS 等训练用格式。","example":"英伟达 Isaac Teleop 遥操作框架用 MCAP 录制和回放采集数据，并能与 LeRobot 数据集格式互通；录好的 .mcap 文件也可以直接用 Foxglove 可视化工具打开回看。","related":["rosbag","ROS 2","Foxglove","HDF5 格式","LeRobot 数据集格式","Isaac Teleop 遥操作框架"]},{"id":"data-cleaning","category":"data","sec":8,"tier":2,"sources":[{"title":"Wikipedia: Data cleansing","url":"https://en.wikipedia.org/wiki/Data_cleansing"},{"title":"Kim et al. 2024: OpenVLA: An Open-Source Vision-Language-Action Model","url":"https://arxiv.org/abs/2406.09246"},{"title":"AgiBot World Colosseo 技术报告 (arXiv 2503.06669)","url":"https://arxiv.org/html/2503.06669"}],"as_of":"","related_ids":["data-quality-control","data-curation","no-op-action-filtering","valid-data","failure-data","multi-sensor-time-synchronization-timestamp-alignment"],"name":"数据清洗","alt":"Data Cleaning","abbr":"","aliases":["数据清理","Data Cleansing"],"one_liner":"训练前找出并修正或剔除坏数据，如失败轨迹、空动作、错位帧。","explanation":"数据清洗指识别并修正或删除数据集里损坏、错误或无关的记录，是通用的数据处理步骤。机器人数据里常见的问题有：没做完或操作失误的轨迹、开头结尾长时间不动的空闲帧、全零动作、多路相机和关节数据时间戳没对齐、丢帧、传感器读数跳变、语言指令和实际动作对不上等。这些噪声会让模仿学习把停顿和抖动也学进去。清洗手段包括规则过滤、统计异常检测和人工抽检，也可以先用一小批数据训练策略上机跑，看数据好不好用。失败数据不一定都要删，标好原因的失败和纠偏片段对学会恢复动作有用。","example":"OpenVLA 论文把表现优于 RT-2-X 的部分原因归于更仔细的数据清洗，例如去掉了 Bridge 数据里的全零动作；AgiBot World 的消融实验也显示，人工核验过的数据让任务完成分数提高了 0.18。","related":["数据质检","数据筛选","空操作 / 静止帧过滤","有效数据","失败数据","多传感器时间同步（时间戳对齐）"]},{"id":"no-op-action-filtering","category":"data","sec":8,"tier":3,"sources":[{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/abs/2406.09246"},{"title":"OpenVLA regenerate_libero_dataset.py（GitHub）","url":"https://github.com/openvla/openvla/blob/main/experiments/robot/libero/regenerate_libero_dataset.py"},{"title":"openpi convert_libero_data_to_lerobot.py（GitHub）","url":"https://github.com/Physical-Intelligence/openpi/blob/main/examples/libero/convert_libero_data_to_lerobot.py"}],"as_of":"2024-06","related_ids":["data-cleaning","openvla","libero-benchmark","bridgedata-v2","behavior-cloning","data-quality-control"],"name":"空操作 / 静止帧过滤","alt":"No-op (Idle) Action Filtering","abbr":"","aliases":["No-op Filtering","空动作过滤","静止帧剔除","no_noops"],"one_liner":"训练前删掉示教里机器人没动的时间步，避免模型学会「原地卡住」。","explanation":"空操作（no-op）指示教轨迹里动作几乎为零、机器人状态不变的时间步，常见于遥操作开头的等待、操作员中途停顿，或录制程序在第一步填入的零动作。空操作过滤就是在训练前把这些时间步删掉。原因是模仿学习会照单全收：表达能力强的单步策略学到这些样本后，部署时可能在某个状态反复输出零动作，机器人就停在那里不动。OpenVLA（2024）论文记录了这个问题：原始 BridgeData V2 每条示教的第一步都是全零动作，不处理直接训练，策略会频繁输出零动作而卡住；在 LIBERO 上，他们删掉平移和旋转分量接近零、且不改变夹爪状态的动作，并称这一步对 OpenVLA 这类模型至关重要。判断时必须同时看夹爪，否则会误删手臂不动、只开合夹爪的有效动作。","example":"OpenVLA 开源脚本的判定规则是：除夹爪外各维动作的范数小于 1e-4，且夹爪指令与上一步相同。处理后的 LIBERO 数据名带 no_noops 后缀，π0 的官方代码 openpi 做 LIBERO 微调时也直接用这份数据。","related":["数据清洗","OpenVLA","LIBERO","BridgeData V2 数据集","行为克隆","数据质检"]},{"id":"data-quality-control","category":"data","sec":8,"tier":3,"sources":[{"title":"首个具身智能数据集质量标准发布（人民邮电报，数字中国建设峰会网站转载）","url":"https://www.szzg.gov.cn/2026/xwzx/szkx/202608/t20260804_5354035.htm"},{"title":"具身智能迈向2.0：数据采集从训练场走向真实世界（科学网转澎湃新闻）","url":"https://news.sciencenet.cn/htmlnews/2026/9/570778.shtm"}],"as_of":"2026-08","related_ids":["data-cleaning","data-curation","valid-data","data-collection-sop","multi-sensor-time-synchronization-timestamp-alignment","failure-data"],"name":"数据质检","alt":"Data Quality Inspection","abbr":"","aliases":["数据质量检查","数据质量评价"],"one_liner":"训练前逐条检查采到的机器人数据能不能用，把坏数据挑出来。","explanation":"数据质检是采集之后、标注和训练之前，逐条判定机器人数据是否合格的环节。常查的有：相机是否丢帧、各传感器时间戳是否对齐、关节和动作记录是否完整、轨迹有无异常跳变、任务是否真的完成、语言标注和画面是否对得上。一般先用规则脚本自动筛，再人工抽检复核。模仿学习会把坏演示一起学进去，所以质检直接影响模型效果。2026 年 7 月工信部批准发布行业标准 YD/T 6771-2026（中国信通院牵头起草），从完整性、一致性、真实性等八个维度评价具身智能数据集，定于 2026 年 11 月 1 日实施。","example":"一条遥操作叠衣服的数据，腕部相机中途丢帧、夹爪开合时刻和画面对不上，质检脚本把它标为不合格，这条数据就不会进训练集。","related":["数据清洗","数据筛选","有效数据","采集 SOP","多传感器时间同步（时间戳对齐）","失败数据"]},{"id":"trajectory-episode-replay","category":"data","sec":8,"tier":2,"sources":[{"title":"Imitation Learning on Real-World Robots: Replay an episode (LeRobot docs)","url":"https://huggingface.co/docs/lerobot/il_robots"},{"title":"robomimic: Dataset Contents and Visualization","url":"https://robomimic.github.io/docs/tutorials/dataset_contents.html"}],"as_of":"","related_ids":["trajectory","episode","data-quality-control","open-loop-control","lerobot","robomimic"],"name":"轨迹回放","alt":"Trajectory / Episode Replay","abbr":"","aliases":["Episode Replay","数据回放","动作回放"],"one_liner":"把录好的动作序列重新发给机器人或仿真器执行，检查数据能不能复现。","explanation":"轨迹回放指读出数据集里某条已录好的轨迹，把其中的动作按原来的频率逐帧发给真机或仿真器执行，看结果和录制时是否一致。主要用途有三：一是数据质检，确认动作标签、时间戳、坐标系没有记错，能复现原动作才说明这条数据可以拿去训练；二是检查同型号机器人之间的一致性；三是在仿真里按记录的状态重放，换相机视角重新渲染观测。Hugging Face LeRobot 提供 lerobot-replay 命令，文档说它用来测试动作的可重复性和同型号机器人间的可迁移性；robomimic 的 playback_dataset.py 既能按状态重渲染，也能按动作回放。注意真机回放是开环执行，物体位置稍有变化就可能失败，这不等于数据有错。","example":"用 lerobot-replay 把自己录的第 0 条抓方块演示在 SO-101 从臂上重放，如果机械臂走出来的动作和录制时明显不同，就该检查标定或录制帧率。","related":["轨迹","回合","数据质检","开环","LeRobot","RoboMimic"]},{"id":"data-anonymization","category":"data","sec":8,"tier":3,"sources":[{"title":"中华人民共和国个人信息保护法（中央网信办）","url":"https://www.cac.gov.cn/2021-08/20/c_1631050028355286.htm"},{"title":"EGO4D's approach to privacy and ethics in data collection","url":"https://ego4d-data.org/pdfs/Ego4D-Privacy-and-ethics-consortium-statement.pdf"},{"title":"EgoBlur（Project Aria）","url":"https://www.projectaria.com/tools/egoblur"}],"as_of":"","related_ids":["crowdsourced-data-collection","egocentric-video","ego4d","project-aria-glasses","data-cleaning","data-quality-control"],"name":"数据脱敏","alt":"Data Anonymization / De-identification","abbr":"","aliases":["去标识化","匿名化","De-identification","Anonymization","隐私脱敏"],"one_liner":"把数据里的人脸、车牌、声音等个人信息模糊或删除，使其认不出具体的人。","explanation":"数据脱敏指在数据发布或用于训练前，去除或遮盖能识别具体个人的信息。我国《个人信息保护法》区分两个层次：去标识化是指处理后在不借助额外信息的情况下无法识别特定自然人；匿名化是指无法识别且不能复原，匿名化后的信息不再算个人信息。具身数据越来越多来自家庭、商店、工厂里的第一人称视频和众包采集，画面会拍到路人和采集者的脸、门牌、屏幕内容，录音里可能有对话，所以脱敏是数据发布前的必要环节。常见做法是用检测模型自动找出人脸、车牌并模糊，删除或处理音频，再人工抽检。例如 Ego4D 对视频中旁人的脸和路过的车牌做了模糊，并去掉了许多视频的音频。","example":"Meta 为 Project Aria 眼镜开源了 EgoBlur 模型，能在第一人称视频里自动检测人脸和车牌并打码，采用 Apache 2.0 许可，可用于商业用途。","related":["众包采集","第一人称视频","Ego4D 数据集","Project Aria 眼镜","数据清洗","数据质检"]},{"id":"data-annotation","category":"data","sec":8,"tier":2,"sources":[{"title":"Wikipedia: Labeled data","url":"https://en.wikipedia.org/wiki/Labeled_data"},{"title":"Hugging Face: agibot-world/AgiBotWorld2026","url":"https://huggingface.co/datasets/agibot-world/AgiBotWorld2026"},{"title":"DROID 数据集项目页","url":"https://droid-dataset.github.io/"}],"as_of":"","related_ids":["language-annotation","subtask-segmentation","auto-labeling","action-label","data-quality-control","hindsight-relabeling"],"name":"数据标注","alt":"Data Annotation","abbr":"","aliases":["打标","数据打标","Data Labeling"],"one_liner":"给原始数据补上文字说明、分段、框选等标签，告诉模型每段数据是什么。","explanation":"数据标注是给原始数据加上人能看懂、模型能拿来当监督信号的标签，经典例子是给图片标类别、画框。机器人数据里，动作在采集时已自动记录，额外要标的主要是：整段任务的语言指令、子任务切分及起止时间、物体目标框、成功或失败以及失败原因等。这些标签决定了语言条件策略能不能听懂指令、长程任务能不能拆成步骤来学。标注可以全靠人工，也可以先用视觉语言模型自动生成再人工核验。有标注的数据比原始数据贵得多，标注员之间标得不一致，也会直接拖累模型效果。","example":"AgiBot World 2026 数据集提供三层标注：带子任务指令的任务帧分段、物体交互的 2D 目标框、带原子技能的步骤级指令分段；DROID 在 2024 年 12 月的更新里为约 7.5 万条成功轨迹各补了 3 条自然语言描述。","related":["语言标注","子任务切分","自动标注","动作标签","数据质检","事后重标注"]},{"id":"language-annotation","category":"data","sec":8,"tier":2,"sources":[{"title":"Interactive Language / Language-Table 项目主页","url":"https://interactive-language.github.io/"},{"title":"DROID 数据集主页","url":"https://droid-dataset.github.io/"}],"as_of":"2024-12","related_ids":["data-annotation","hindsight-relabeling","subtask-segmentation","auto-labeling","language-conditioned-policy","instruction-augmentation"],"name":"语言标注","alt":"Language Annotation","abbr":"","aliases":["指令标注","语言指令标注","Language Labeling"],"one_liner":"给机器人轨迹配上自然语言描述，如「把红杯子放进水槽」，让模型能听指令。","explanation":"语言标注是给机器人数据配上文字说明，最常见的是一条轨迹对应一句任务指令，也可以细到每个子任务一句话。有了它，才能训练按语言指令行动的语言条件策略和 VLA 模型。标注来源大致三种：采集前定好指令、由操作员照做；采完后由人看视频补写，即事后重标注；用视觉语言模型自动生成或改写描述。标注质量直接影响模型听懂指令的能力，同一动作只有一种说法时，模型容易只认固定句式。所以大规模数据集常给一条轨迹配多句不同说法，并把长任务切成带文字的子任务段，方便分层模型学习。","example":"谷歌的 Language-Table 用事后重标注得到近 60 万条带语言标签的桌面推物轨迹；DROID 在 2024 年 12 月的更新中为约 7.5 万条成功轨迹各配了 3 句语言描述。","related":["数据标注","事后重标注","子任务切分","自动标注","语言条件策略","指令增强"]},{"id":"subtask-segmentation","category":"data","sec":8,"tier":3,"sources":[{"title":"Hugging Face: agibot-world/AgiBotWorld2026 数据集卡片","url":"https://huggingface.co/datasets/agibot-world/AgiBotWorld2026"},{"title":"Universal Visual Decomposer (arXiv 2310.08581)","url":"https://arxiv.org/abs/2310.08581"}],"as_of":"","related_ids":["long-horizon-task","language-annotation","auto-labeling","skill-primitive","hierarchical-architecture","agibot-world"],"name":"子任务切分","alt":"Subtask Segmentation","abbr":"","aliases":["子任务分割","动作分段","技能切分","轨迹分段","Trajectory Segmentation"],"one_liner":"把一条长演示按步骤切成若干段，标出每段起止帧和说明。","explanation":"子任务切分是数据标注的一步：把一条完整的长程演示（如「收拾餐桌」）按语义切成若干子任务片段（「拿起盘子」「放进水槽」），记下每段的起止帧，通常再配一句语言描述和技能类型。它让长任务数据能按步骤使用：训练分层策略时，高层模型学预测下一步该做哪个子任务，低层模型学执行单个子任务；也可以用来统计各技能的成功率、构造进度奖励、剔除失败片段。切分方法有人工标注，按规则自动切（如夹爪开合、速度接近零处），以及借助视觉表征或 VLM 自动找分界点，例如 UVD 通过检测预训练视觉表征里的阶段突变来发现子目标。","example":"AgiBot World 2026 数据集给每条轨迹提供步骤级标注 instruction_segments，每段记录技能类型（如 Pick）、一句指令和起止帧，例如「左臂从购物车里拿起红盖饮料」对应第 284–493 帧。","related":["长程任务","语言标注","自动标注","原子技能","分层架构","AgiBot World 数据集"]},{"id":"auto-labeling","category":"data","sec":8,"tier":3,"sources":[{"title":"Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models (DIAL, arXiv 2211.11736)","url":"https://arxiv.org/abs/2211.11736"},{"title":"Robotic Control via Embodied Chain-of-Thought Reasoning (ECoT, arXiv 2407.08693)","url":"https://arxiv.org/abs/2407.08693"}],"as_of":"","related_ids":["data-annotation","language-annotation","hindsight-relabeling","instruction-augmentation","subtask-segmentation","data-quality-control"],"name":"自动标注","alt":"Auto-labeling","abbr":"","aliases":["自动打标","自动化标注"],"one_liner":"用预训练模型或程序代替人工，自动给机器人数据补上语言指令、检测框等标签。","explanation":"自动标注指用程序或预训练模型（如视觉语言模型、目标检测器、大语言模型）代替人工，给采集到的数据自动补标签。机器人数据常缺几类信息：这段轨迹在做什么（语言指令）、子任务从哪切分、画面里物体在哪（检测框、掩码）。人工逐条标注又贵又慢，数据一多就跟不上。典型做法有两种：一是用 CLIP 这类图文模型给没有文字描述的演示匹配指令，谷歌的 DIAL 就是这样做的；二是像伯克利的 ECoT 那样，用 Grounding DINO 框出物体、让大模型写出任务分解和推理步骤，作为训练带推理能力 VLA 的额外监督。自动标注的质量不如人工稳定，通常要抽检或用规则过滤错误标签，常与数据质检、事后重标注、指令增强配合使用。","example":"谷歌 2022 年的 DIAL 用 CLIP 给约 8 万条演示自动补语言标签（其中 96.5% 原本没有众包标注），训练出的策略能执行 60 条原数据里没有的新指令。","related":["数据标注","语言标注","事后重标注","指令增强","子任务切分","数据质检"]},{"id":"play-data","category":"data","sec":8,"tier":3,"sources":[{"title":"Learning Latent Plans from Play (arXiv:1903.01973)","url":"https://arxiv.org/abs/1903.01973"}],"as_of":"","related_ids":["goal-conditioned-policy","hindsight-relabeling","teleoperation","demonstration-data","calvin-benchmark","mimicplay"],"name":"玩耍数据","alt":"Play Data","abbr":"","aliases":["自由玩耍数据","play 数据","遥操作玩耍数据"],"one_liner":"操作员不按具体任务、随意摆弄场景时录下的机器人数据。","explanation":"玩耍数据是 Corey Lynch 等人在 2019 年论文《Learning Latent Plans from Play》（CoRL 2019）里提出的采集方式：操作员遥操作机器人，在摆满物体的场景里凭好奇心随意开抽屉、推滑块、抓积木，事先不规定任务。它的好处是便宜：不用按任务切分、不用打标签，也不用每次把场景复位；论文统计，同样的采集时间下，它覆盖的交互范围约为按任务演示的 4 倍。代价是没有任务标签，所以常配合「事后重标注」（把一段轨迹的终点当作目标）训练目标条件策略，或事后再补语言描述。CALVIN 基准和 MimicPlay 都沿用了这个思路。","example":"在 Play-LMP 论文里，操作员用 VR 遥操作仿真机器人，在带抽屉、滑门和积木的桌面场景中随意摆弄，录下不分段、不标任务的连续数据，再训练出能按目标图像完成多种任务的策略。","related":["目标条件策略","事后重标注","遥操作","演示数据","CALVIN","MimicPlay"]},{"id":"hindsight-relabeling","category":"data","sec":8,"tier":3,"sources":[{"title":"Hindsight Experience Replay (arXiv)","url":"https://arxiv.org/abs/1707.01495"},{"title":"Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models (DIAL, arXiv)","url":"https://arxiv.org/abs/2211.11736"}],"as_of":"","related_ids":["hindsight-experience-replay","goal-conditioned-reinforcement-learning","sparse-reward","language-annotation","auto-labeling","instruction-augmentation"],"name":"事后重标注","alt":"Hindsight Relabeling","abbr":"","aliases":["后见之明重标注","事后目标重标注","Hindsight Goal Relabeling"],"one_liner":"数据采完后，按轨迹实际做成了什么，重新给它贴目标或指令标签。","explanation":"事后重标注的思路是：一条轨迹没完成原定目标，但它总归到达了某个状态，那就把这个实际结果当成目标重新标一遍，失败样本就变成了「完成了另一个目标」的成功样本。这一做法因 OpenAI 2017 年的后见之明经验回放（HER）而流行，用来解决稀疏奖励（只有成功才给奖励）下几乎学不到东西的问题，在推、滑、抓放等机械臂任务上验证过。后来被推广到模仿学习和语言条件策略：先大量采集没有任务标签的操作数据，事后再根据画面给它配上图像目标或语言指令。谷歌的 DIAL 就用 CLIP 这类视觉语言模型给 8 万条演示自动补语言指令，其中 96.5% 原本没有人工标注。它的前提是策略以目标或指令为条件，否则重标注无从谈起。","example":"机械臂本想把方块推到 A 点却推到了 B 点；重标注后，这条轨迹被存成「目标 = B 点」的成功示范，再拿去训练目标条件策略。","related":["后见之明经验回放","目标条件强化学习","稀疏奖励","语言标注","自动标注","指令增强"]},{"id":"instruction-augmentation","category":"data","sec":8,"tier":3,"sources":[{"title":"Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models (arXiv 2211.11736)","url":"https://arxiv.org/abs/2211.11736"},{"title":"DIAL 项目主页","url":"https://instructionaugmentation.github.io/"}],"as_of":"","related_ids":["language-annotation","hindsight-relabeling","auto-labeling","data-augmentation","language-conditioned-policy","clip"],"name":"指令增强","alt":"Instruction Augmentation","abbr":"","aliases":["语言增强","Language Augmentation","指令改写"],"one_liner":"给机器人轨迹自动补写或改写语言指令，让同一段动作配上更多种说法。","explanation":"指令增强是面向语言条件策略（按文字指令行动的策略）的一类数据处理方法：不采新的机器人动作，只给已有轨迹补上或改写语言标签。人工给每条示教写指令成本高，写法也单一，模型换个说法就听不懂。代表工作是谷歌机器人团队 2022 年提出、发表于 RSS 2023 的 DIAL：先用少量人工标注数据微调 CLIP（图文匹配模型），再让大语言模型提出候选指令，由 CLIP 打分挑出与轨迹画面相符的说法，给 8 万条示教（其中 96.5% 没有人工语言标注）重新贴标签，最后做行为克隆。更简单的做法是只让大模型把原指令改写成多种同义说法。它和事后重标注、自动标注属于同一思路。","example":"DIAL 训练出的策略在 60 条原数据集里没出现过的新指令上做了测试，涵盖空间关系描述、换一种说法的描述和新语义技能三类。","related":["语言标注","事后重标注","自动标注","数据增强","语言条件策略","CLIP"]},{"id":"data-diversity","category":"data","sec":8,"tier":2,"sources":[{"title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation (arXiv 2410.18647)","url":"https://arxiv.org/abs/2410.18647"},{"title":"π0.5: a Vision-Language-Action Model with Open-World Generalization (arXiv 2504.16054)","url":"https://arxiv.org/html/2504.16054"}],"as_of":"2025-04","related_ids":["generalization","scene-generalization","object-generalization","data-scaling-laws-in-imitation-learning","in-the-wild-data","data-mixture"],"name":"数据多样性","alt":"Data Diversity","abbr":"","aliases":["数据覆盖面"],"one_liner":"训练数据在场景、物体、任务、视角等维度上变化有多广。","explanation":"数据多样性描述数据集在环境、物体、光照、相机视角、任务、操作者、机器人本体等维度上的变化幅度，和「数据有多少条」是两回事。机器人策略容易记住训练时的那张桌子和那几个物体，换个房间就失灵，多样性不足是泛化差的主要原因之一。清华高阳团队 2024 年的数据缩放律研究发现，策略在新环境、新物体上的表现主要随环境数和物体数增长，在同一环境里多采演示很快就没有收益。Physical Intelligence 的 π0.5 用约 100 个真实家庭的移动操作数据训练，在从未见过的家里也能做收拾类任务。采集时主动换场景、换物体、换人，就是在提高多样性。","example":"π0.5 论文的实验显示，训练用的家庭数越多，策略在测试家庭里表现越好；用 104 个地点的数据训练后，效果接近直接用测试家庭数据训练的对照模型。","related":["泛化","场景泛化","物体泛化","数据缩放律（模仿学习）","野外数据","数据配比"]},{"id":"data-scaling-laws-in-imitation-learning","category":"data","sec":8,"tier":2,"sources":[{"title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation (arXiv 2410.18647)","url":"https://arxiv.org/abs/2410.18647"},{"title":"Data Scaling Laws in Imitation Learning 项目主页","url":"https://data-scaling-laws.github.io/"}],"as_of":"2025-01","related_ids":["scaling-law","data-diversity","imitation-learning","universal-manipulation-interface","generalization","diffusion-policy"],"name":"数据缩放律（模仿学习）","alt":"Data Scaling Laws in Imitation Learning (Robotic Manipulation)","abbr":"","aliases":["模仿学习数据缩放律","Data Scaling Laws in Imitation Learning for Robotic Manipulation"],"one_liner":"研究机器人模仿学习里数据怎么增加、泛化能力就怎么提升的规律。","explanation":"这是清华大学高阳团队（合作单位含上海期智研究院、上海人工智能实验室）2024 年 10 月发布的论文，入选 ICLR 2025 口头报告。团队用手持采集设备 UMI（通用操作接口）采了 4 万多条演示，做了 1.5 万多次真机测试，研究单任务策略在新环境、新物体上的泛化能力如何随数据增长。结论：泛化表现与训练环境数、物体数大致呈幂律关系；环境和物体的多样性比单纯增加演示条数重要得多，每个环境或物体的演示超过一定数量后收益很小。据此他们给出高效采集方案：多换环境，每个环境配一个不同物体、采约 50 条演示。","example":"按这一方案，4 名采集员用一个下午采的数据，就让两个新任务的策略在没见过的环境和物体上达到约 90% 成功率。","related":["缩放定律","数据多样性","模仿学习","通用操作接口","泛化","扩散策略"]},{"id":"in-the-wild-data","category":"data","sec":8,"tier":2,"sources":[{"title":"DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset","url":"https://droid-dataset.github.io/"},{"title":"DexWild 项目主页","url":"https://dexwild.github.io/"},{"title":"Universal Manipulation Interface (UMI) 项目主页","url":"https://umi-gripper.github.io/"}],"as_of":"","related_ids":["droid","universal-manipulation-interface","dexwild","scene-generalization","data-diversity","robot-free-data-collection"],"name":"野外数据","alt":"In-the-wild Data","abbr":"","aliases":["真实场景数据","in-the-wild 数据","开放环境数据"],"one_liner":"在家庭、办公室、户外等非实验室环境采集的数据，场景多样且不受控制。","explanation":"野外数据这个说法沿用自计算机视觉，指在实验室外的真实场景里采集的数据：光照、背景、物体摆放都不受控，每个场景各不相同。过去机器人数据大多来自实验室里固定的几张桌面，模型换个房间就容易失败，所以研究者把采集搬进真实环境，以提高场景泛化能力。难点是真机器人不方便到处搬，于是出现了便携方案：DROID 把 Franka 机械臂装在可移动的升降桌上，在 564 个场景采了 7.6 万条轨迹；UMI 用手持夹爪、DexWild 用人手加手掌相机，都不需要把机器人带到现场。","example":"卡内基梅隆大学的 DexWild 在 93 个不同环境采集了 9290 条人手演示，与机器人数据协同训练后，策略在新环境中的成功率约为只用机器人数据的 4 倍。","related":["DROID 数据集","通用操作接口","DexWild","场景泛化","数据多样性","无本体采集"]},{"id":"suboptimal-demonstrations","category":"data","sec":8,"tier":3,"sources":[{"title":"robomimic v0.1 Datasets (PH / MH / MG)","url":"https://robomimic.github.io/docs/datasets/robomimic_v0.1.html"},{"title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (arXiv 2108.03298)","url":"https://arxiv.org/abs/2108.03298"}],"as_of":"","related_ids":["behavior-cloning","data-curation","data-quality-control","advantage-weighted-regression","offline-reinforcement-learning","recap"],"name":"次优演示","alt":"Suboptimal / Noisy Demonstrations","abbr":"","aliases":["噪声演示","非最优演示","混合质量演示","Imperfect Demonstrations","Mixed-quality Demonstrations"],"one_liner":"带多余动作、犹豫、失误，或质量参差不齐的人类示范数据。","explanation":"次优演示指不够好的示范：动作慢、有停顿和来回试探、中途失误再补救，或多个操作员水平不一、做法各异。真实采集的数据几乎都带这些问题。行为克隆（直接模仿示范动作）会把好坏动作一起学进去，数据越混杂，学出的策略越犹豫、越不稳定。常见应对办法有：采集后做数据筛选和质检；按奖励或优势（某个动作比平均水平好多少）给样本加权，如优势加权回归；用离线强化学习从混合质量数据里挑出更好的行为；或把质量信息作为条件输入，推理时只要「好」的那部分行为，如 RECAP 的优势条件化。","example":"robomimic 的 Multi-Human 数据集由 6 名熟练度不同的操作员（「较差」「一般」「较好」各 2 人）各录 50 条成功轨迹，共 300 条，专门用来研究混合质量数据对模仿学习的影响。","related":["行为克隆","数据筛选","数据质检","优势加权回归","离线强化学习","RECAP"]},{"id":"data-curation","category":"data","sec":8,"tier":2,"sources":[{"title":"Robot Data Curation with Mutual Information Estimators (arXiv 2502.08623)","url":"https://arxiv.org/abs/2502.08623"},{"title":"CUPID: Curating Data your Robot Loves with Influence Functions (arXiv 2506.19121)","url":"https://arxiv.org/abs/2506.19121"}],"as_of":"2025-09","related_ids":["data-cleaning","data-quality-control","data-mixture","valid-data","suboptimal-demonstrations","imitation-learning"],"name":"数据筛选","alt":"Data Curation","abbr":"","aliases":["数据策展","数据精选","数据过滤","Data Filtering"],"one_liner":"从大量机器人数据里挑出真正对训练有益的部分，剔除有害样本。","explanation":"数据筛选指训练前对数据集做挑选和加权：去掉失误多、动作犹豫、手法前后不一致的演示，留下质量高、覆盖面广的部分。它和数据清洗（修格式、删坏帧）不同，关心的是「哪条数据会让策略变好」。机器人演示常由多人采集、质量参差，模仿学习会把坏习惯一起学走，所以数据堆得越多不一定越好。代表方法有：斯坦福与谷歌 DeepMind 研究者 2025 年提出的 DemInf，用状态和动作之间的互信息给每条演示打分；CoRL 2025 的 CUPID 用影响函数估计每条演示对策略成功率的贡献，论文报告只用不到 33% 的筛选后数据，就能在 RoboMimic 基准上训出当时最好的扩散策略。","example":"DemInf 论文在真机 ALOHA 和 Franka 上，先给多人采集的演示逐条打分、去掉低分的一批再训练，得到的策略比直接用全部数据训练的表现更好。","related":["数据清洗","数据质检","数据配比","有效数据","次优演示","模仿学习"]},{"id":"retrieval-based-data-selection","category":"data","sec":8,"tier":3,"sources":[{"title":"Behavior Retrieval: Few-Shot Imitation Learning by Querying Unlabeled Datasets (arXiv)","url":"https://arxiv.org/abs/2304.08742"},{"title":"STRAP: Robot Sub-Trajectory Retrieval for Augmented Policy Learning (arXiv)","url":"https://arxiv.org/abs/2412.15182"},{"title":"Data Retrieval with Importance Weights for Few-Shot Imitation Learning (arXiv)","url":"https://arxiv.org/abs/2509.01657"}],"as_of":"2025-09","related_ids":["data-curation","data-mixture","few-shot","positive-negative-transfer","open-x-embodiment","behavior-cloning"],"name":"数据检索","alt":"Data Retrieval (Retrieval-based Data Selection)","abbr":"","aliases":["检索式数据选择"],"one_liner":"拿少量目标任务演示去大数据集里找相似片段，合起来训练策略。","explanation":"数据检索是一类挑训练数据的方法：先为目标任务采几条演示，再用它们去大规模已有机器人数据集里找视觉或动作上相似的轨迹或片段，把找到的数据和目标演示合在一起训练。它针对的问题是：所有数据一股脑混着训，不相关的数据可能互相干扰（负迁移）；只用几条演示又不够。代表工作有斯坦福的 Behavior Retrieval（2023）、华盛顿大学的 STRAP（ICLR 2025，按子轨迹检索，用视觉基础模型特征加动态时间规整做匹配）、斯坦福的 IWR（CoRL 2025，用重要性权重修正检索偏差）。它和数据筛选、数据配比解决的是同一类问题。","example":"要教机器人「拿起杯子放进抽屉再关上」，只采了少量演示；STRAP 从大规模离线数据集里检索出含「拿杯子」「开关抽屉」的子片段，和这些演示一起训练策略。","related":["数据筛选","数据配比","少样本","正迁移 / 负迁移","Open X-Embodiment 数据集","行为克隆"]},{"id":"data-mixture","category":"data","sec":8,"tier":2,"sources":[{"title":"Re-Mix: Optimizing Data Mixtures for Large Scale Imitation Learning (arXiv 2408.14037)","url":"https://arxiv.org/abs/2408.14037"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/html/2410.24164"}],"as_of":"2024-10","related_ids":["oxe-magic-soup","co-training","heterogeneous-data","cross-embodiment-data","data-curation","open-x-embodiment"],"name":"数据配比","alt":"Data Mixture","abbr":"","aliases":["数据配方","数据混合比例","Data Recipe","数据混合权重","Data Mixture Weights"],"one_liner":"多来源数据混合训练时，每个来源各占多大比重。","explanation":"数据配比指把不同来源的数据（不同机器人、不同任务、仿真与真机、网页图文、人类视频）混在一起训练时，决定每一类被抽到的频率。各来源条数相差很大，直接按条数混，大数据集会压过小数据集；权重调得不好，模型又会偏科。常见做法：人工定权重，如 Octo、OpenVLA 在 Open X-Embodiment 上手调的配方（俗称 Magic Soup）；π0 按 n^0.43 给每个「任务-机器人」组合加权（n 是该组合的样本数），压低数据过多的组合；斯坦福的 Re-Mix 用分布鲁棒优化自动学权重，论文报告比均匀权重平均提升 38%。配比还常随训练阶段变化，预训练偏多样，后训练偏高质量。","example":"π0 的预训练数据中 9.1% 来自 OXE、Bridge v2、DROID 等开源数据集，其余来自自家采集，再按 n^0.43 规则给每个任务-机器人组合加权。","related":["Magic Soup（OXE 数据配方）","协同训练","异构数据","跨本体数据","数据筛选","Open X-Embodiment 数据集"]},{"id":"oxe-magic-soup","category":"data","sec":8,"tier":3,"sources":[{"title":"octo-models/octo: oxe_dataset_mixes.py (GitHub)","url":"https://github.com/octo-models/octo/blob/main/octo/data/oxe/oxe_dataset_mixes.py"},{"title":"Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)","url":"https://arxiv.org/html/2405.12213"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/html/2406.09246"}],"as_of":"2024-06","related_ids":["open-x-embodiment","data-mixture","octo","openvla","droid","rlds"],"name":"Magic Soup（OXE 数据配方）","alt":"OXE Magic Soup (Octo / OpenVLA dataset mixture)","abbr":"","aliases":["oxe_magic_soup","Open-X Magic Soup","Magic Soup++","oxe_magic_soup_plus"],"one_liner":"Octo、OpenVLA 预训练时从 OXE 挑选并加权混合子数据集的配方","explanation":"Magic Soup 是一份机器人数据混合配方的叫法，名字来自 Octo 代码库的配置 oxe_magic_soup。Open X-Embodiment（OXE，多机构汇集的跨本体机器人数据集）里各子数据集的规模、质量、机器人和相机差别很大，直接混在一起并不好用。Octo（2024）的训练混合取了其中 25 个数据集、约 80 万条轨迹，权重基本按样本数分配，再把场景和任务更丰富的翻倍、重复片段多的降权。OpenVLA 沿用这套权重，代码里另有加入 DROID 的扩展版 Magic Soup++，共约 97 万条演示。它不是新数据，而是「选哪些、各占多少」的经验配方，Octo 论文也承认还缺乏系统分析。","example":"OpenVLA 的训练混合里 Fractal（RT-1 数据）和 Kuka 各占约 12.7%，UCSD Kitchen 不到 0.1%；DROID 以 10% 的权重加入，因学得慢在最后三分之一训练中被移除。","related":["Open X-Embodiment 数据集","数据配比","Octo","OpenVLA","DROID 数据集","RLDS 格式"]},{"id":"data-leakage-test-set-contamination","category":"data","sec":8,"tier":3,"sources":[{"title":"What is Data Leakage in Machine Learning?（IBM）","url":"https://www.ibm.com/think/topics/data-leakage-machine-learning"},{"title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization (arXiv 2510.03827)","url":"https://arxiv.org/abs/2510.03827"}],"as_of":"2026-05","related_ids":["training-validation-test-set","overfitting","out-of-distribution","libero-pro","benchmark-saturation","leaderboard-chasing"],"name":"数据泄漏 / 测试集污染","alt":"Data Leakage / Test-set Contamination","abbr":"","aliases":["Data Leakage","Train-Test Contamination","测试集泄漏","数据污染"],"one_liner":"测试时才该有的信息在训练中被模型提前看到，导致评测分数虚高。","explanation":"数据泄漏指模型训练时接触到了测试或部署时本不该有的信息，于是离线评测好看、真用起来很差。IBM 把它分为目标泄漏（特征里夹带预测时拿不到的「答案」）和训练-测试污染（测试数据混进训练，或划分前用全部数据做归一化等预处理）。机器人学习里常见的情形有：按帧而非按整条轨迹划分训练集和验证集；在仿真基准上用与测试几乎相同的场景和初始状态训练；大模型预训练语料混进评测题。LIBERO-PRO 发现，原版 LIBERO 上成功率超 90% 的 VLA，换物体、改初始位置或指令后可降到 0，说明它们主要在背训练集。对策是按轨迹、场景划分数据，并在分布外设置下评测。","example":"把一条 30 秒演示的所有帧随机打散后再划分训练集和验证集，验证集上的动作误差会很低，因为模型几乎见过每一帧的相邻帧；改成按整条轨迹划分后，误差才能反映真实的泛化能力。","related":["训练集 / 验证集 / 测试集","过拟合","分布外","LIBERO-PRO","基准饱和","刷榜"]},{"id":"embodied-ai-training-ground","category":"data","sec":9,"tier":1,"sources":[{"title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems (arXiv 2503.06669)","url":"https://arxiv.org/abs/2503.06669"},{"title":"AgiBot World GitHub","url":"https://github.com/OpenDriveLab/AgiBot-World"},{"title":"中新网：全国首个异构人形机器人训练场在上海启用（2025-01-21）","url":"https://www.chinanews.com.cn/cj/2025/01-21/10357409.shtml"}],"as_of":"2025-03","related_ids":["real-robot-data","data-collector","data-collection-sop","agibot-world","teleoperation","data-quality-control"],"name":"具身智能训练场","alt":"Embodied AI Training Ground (Robot Data Collection Center)","abbr":"","aliases":["训练场","数采场","数采中心","数据采集中心","数据工厂","数采工厂","数据采集工厂","数据训练场","数采厂","数据采集训练场","Data Factory","Data Collection Factory","Robot Training Ground"],"one_liner":"按真实场景搭建、让大批机器人集中采集训练数据的场地。","explanation":"具身智能训练场（也叫数采工厂、数据采集中心）是国内行业常用说法，指按家庭、商超、工厂、餐厅等真实环境 1:1 搭建场景，由数采员遥操作多台机器人反复执行任务、批量生产真机数据的场地，也用来测试和评测模型。它要解决的是机器人数据没法从网上抓、只能一条条采的问题：把设备、场景、采集流程（SOP）和质检标准化，产量和质量才能上去。智元为 AgiBot World 建了约 4000 平方米的采集场地，用 100 台真机采了 100 多万条轨迹。2025 年起国内多地陆续建设此类训练场，如当年 1 月国家地方共建人形机器人创新中心在上海启用的异构（多家厂商、不同型号）人形机器人训练场，首期可容纳 100 多台人形机器人同时训练。","example":"AgiBot World 的采集场地覆盖家居、零售、工业、餐饮、办公五大领域、100 多个真实场景（其中工业和零售场景按 1:1 复刻），每条数据含多视角相机、深度、相机标定和子步骤语言标注。","related":["真机数据","数采员","采集 SOP","AgiBot World 数据集","遥操作","数据质检"]},{"id":"data-collector","category":"data","sec":9,"tier":2,"sources":[{"title":"北京人形：具身智能机器人应用技术员进入国家新职业序列","url":"https://www.x-humanoid.com/news-view-330.html"},{"title":"钛媒体：机器人还没学会做家务，卖数据的已经先赚到了钱","url":"https://www.tmtpost.com/8062934.html"},{"title":"中证网：实探北京人形机器人数据基地，月产数据1.5万小时","url":"https://jnzstatic.cs.com.cn/zzb/htmlInfo/117207.html"}],"as_of":"2026-09","related_ids":["teleoperation","data-collection-sop","embodied-ai-training-ground","demonstration-data","valid-data","embodied-ai-robot-application-technician"],"name":"数采员","alt":"Data Collector (Teleoperator)","abbr":"","aliases":["遥操员","机器人训练师","数据采集员","具身智能机器人数据采集员","AI 训练师"],"one_liner":"专门给机器人录训练数据的人，靠遥操作或穿戴设备示范动作。","explanation":"数采员是具身智能公司和数据采集基地里生产训练数据的一线岗位。他们按采集 SOP（标准作业流程）干活：戴 VR 头显、操纵主从臂或外骨骼遥操作真机，或者穿动捕服、戴头戴相机和数据手套，直接用自己的手做示范，系统同步记录画面、关节角、力等信号。模仿学习要靠大量人类演示，数采员的动作是否规范、一致，直接决定数据能不能用。2026 年 9 月人社部等发布的新职业「具身智能机器人应用技术员」，把数据采集员和训练师列为其下工种。据报道，这份工作重复枯燥，设备调试、场景复位和重采会占去不少时间。","example":"据中证网 2026 年 3 月报道，北京人形机器人创新中心的数据基地有 120 多台机器人、30 多个场景（家居、商超、产线等），数据采集员在里面做真机遥操作和动捕采集，基地月产数据约 1.5 万小时。","related":["遥操作","采集 SOP","具身智能训练场","演示数据","有效数据","具身智能机器人应用技术员（新职业）"]},{"id":"data-collection-sop","category":"data","sec":9,"tier":3,"sources":[{"title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset (arXiv 2403.12945)","url":"https://arxiv.org/html/2403.12945v1"},{"title":"国地共建具身智能机器人创新中心打造具身智能标准体系","url":"https://www.x-humanoid.com/news-view-50.html"}],"as_of":"2024-11","related_ids":["data-collector","valid-data","data-quality-control","demonstration-data","droid","crowdsourced-data-collection"],"name":"采集 SOP","alt":"Data Collection Standard Operating Procedure","abbr":"SOP","aliases":["采集规范","数据采集标准作业程序","Data Collection Protocol"],"one_liner":"规定每条数据怎么采、采成什么样才算合格的标准操作流程。","explanation":"采集 SOP 是数据团队写给采集员的操作规程，通常写清：设备检查与相机标定、场景怎么布置和多久更换、任务指令从哪里取、一条数据的起止怎么界定、动作速度和手法、失败如何处理和标记、文件命名与上传、质检标准等。机器人学习对数据一致性很敏感，不同人做法差别大、起止不统一、夹杂长停顿，模型都难学好，所以 SOP 是保证有效数据比例的基础。SOP 也要兼顾多样性：DROID 的共享采集协议让采集员约每 20 分钟换一个场景，并随机提示调整光照、挪动相机、增减物品。国内也在推统一规范，如北京人形机器人创新中心牵头立项工信部行业标准《人工智能 具身智能 数据采集规范》。","example":"DROID 的 50 名采集员分布在多所大学，使用同一套采集协议和图形界面：界面从采集员列出的可行任务中随机抽指令，每条轨迹结束后由采集员标记成功或失败。","related":["数采员","有效数据","数据质检","演示数据","DROID 数据集","众包采集"]},{"id":"valid-data","category":"data","sec":9,"tier":3,"sources":[{"title":"规模化「上课」为具身智能加注「数据燃料」（证券时报网，2026-04）","url":"https://www.stcn.com/article/detail/3731496.html"},{"title":"具身智能迈向 2.0：数据采集从训练场走向真实世界（科学网转澎湃新闻，2026-09）","url":"https://news.sciencenet.cn/htmlnews/2026/9/570778.shtm"}],"as_of":"2026-09","related_ids":["data-quality-control","data-collector","data-collection-sop","data-cleaning","data-curation","embodied-ai-training-ground"],"name":"有效数据","alt":"Valid (Usable) Data","abbr":"","aliases":["有效数据率","数据合格率","有效时长"],"one_liner":"采集到的原始数据里，通过质检、真正能拿去训练模型的那一部分。","explanation":"具身智能数据采集行业的常用说法，没有统一的标准定义。原始录制里总有一部分不能用：任务失败、机械臂碰到不该碰的道具、多路传感器时间没对齐、标定出错、遮挡或丢帧等。质检筛掉这些后剩下的叫有效数据，占原始数据的比例叫有效数据率（也叫数据合格率）。北京人形机器人创新中心数据基地负责人 2026 年 4 月对媒体说，基地合格率曾只有约 50%，经过培训和质检标准优化后稳定在 95% 以上。业内也越来越强调不能只看小时数：帧率、标定要达标，场景、物体和任务要够多样，最终还要通过客户验收和模型效果验证。","example":"数采员采了 100 条「把杯子放进柜子」的演示，其中 8 条杯子掉了、5 条腕部相机丢帧，质检剔除后剩 87 条有效数据，有效数据率 87%。","related":["数据质检","数采员","采集 SOP","数据清洗","数据筛选","具身智能训练场"]},{"id":"crowdsourced-data-collection","category":"data","sec":9,"tier":3,"sources":[{"title":"RoboTurk - Crowdsourcing Robotics（斯坦福）","url":"https://roboturk.stanford.edu"},{"title":"机器人开始向更多人类买数据（新京报）","url":"https://www.bjnews.com.cn/detail/1790255981129859.html"},{"title":"日薪120元全民数采：谁在训练下一个机器人保姆？（36氪）","url":"https://eu.36kr.com/zh/p/3810340908817928"}],"as_of":"2026-09","related_ids":["data-collector","robot-free-data-collection","egocentric-video","valid-data","data-anonymization","data-quality-control"],"name":"众包采集","alt":"Crowdsourced Data Collection","abbr":"","aliases":["Crowdsourcing","众包数采","全民数采"],"one_liner":"把采集任务分发给大量非专业人员，按审核通过的有效数据量付费。","explanation":"众包采集不依赖少数专业采集员，而是通过网页或 App 把任务分发给大量普通人，由他们远程遥操作机器人，或在家里、工作场所录下自己的操作，平台审核后按有效时长付费。早期代表是斯坦福 2018 年的 RoboTurk，用户把手机当 6 自由度控制器在网页上遥操作机械臂。2025–2026 年随着第一人称视频和无本体采集设备普及，众包转向真实场景的人类数据：据报道 Figure 于 2026 年 8 月公开了付费收集用户任务视频的 Index 项目，觅蜂科技 9 月上线「觅蜂派」，让用户戴 MEgo 设备接单采集。优点是便宜、场景广；难点是质量参差、隐私保护和清洗标注成本。","example":"RoboTurk 2019 年的真实机器人数据集由 54 名非专业用户在一周内远程遥操作采集，共 2144 条演示、111 小时。","related":["数采员","无本体采集","第一人称视频","有效数据","数据脱敏","数据质检"]},{"id":"roboturk","category":"data","sec":9,"tier":3,"sources":[{"title":"RoboTurk: A Crowdsourcing Platform for Robotic Skill Learning through Imitation (arXiv:1811.02790)","url":"https://arxiv.org/abs/1811.02790"}],"as_of":"2018-11","related_ids":["crowdsourced-data-collection","teleoperation","demonstration-data","robomimic","imitation-learning","stanford-artificial-intelligence-laboratory"],"name":"RoboTurk","alt":"RoboTurk: A Crowdsourcing Platform for Robotic Skill Learning through Imitation","abbr":"","aliases":["RoboTurk 众包平台"],"one_liner":"斯坦福 2018 年推出的平台，用手机远程遥操作、众包采集机器人演示。","explanation":"RoboTurk 是斯坦福大学李飞飞、Silvio Savarese 团队 2018 年发表于 CoRL 的众包数据采集平台，名字取自众包平台 Amazon Mechanical Turk。它让普通人用 iPhone 等智能手机做 6 自由度遥操作：在空中移动手机，远端机器人的末端就跟着动，不需要 VR 或专用设备，因此可以把采集任务分发给各地的远程工作者。首批试验在 22 小时的系统使用时间里收集了 137.5 小时操作数据、超过 2200 条成功演示；论文还发现网络带宽低、延迟高时，远程用户仍能顺利完成演示。它是众包采集的代表工作，robomimic 基准中的多人演示数据也是用它采集的。","example":"一名远程工作者在家打开手机，一边看网页上传回的实时画面，一边移动手机，控制机械臂完成抓取放置任务，数据自动上传用于模仿学习。","related":["众包采集","遥操作","演示数据","RoboMimic","模仿学习","斯坦福人工智能实验室"]},{"id":"autonomous-data-collection","category":"data","sec":9,"tier":3,"sources":[{"title":"AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents (arXiv 2401.12963)","url":"https://arxiv.org/abs/2401.12963"},{"title":"Autonomous Improvement of Instruction Following Skills via Foundation Models (SOAR, arXiv 2407.20635)","url":"https://arxiv.org/abs/2407.20635"},{"title":"Deep Learning for Robots: Learning from Large-Scale Interaction (Google Research Blog)","url":"https://research.google/blog/deep-learning-for-robots-learning-from-large-scale-interaction/"}],"as_of":"","related_ids":["google-arm-farm","autort","data-flywheel","self-improvement","real-world-reinforcement-learning","success-detector"],"name":"自主数据采集","alt":"Autonomous Data Collection","abbr":"","aliases":["机器人自主采集","自主采集"],"one_liner":"让机器人自己提出任务、动手尝试并记录结果，少用或不用人工遥操作来积累数据。","explanation":"自主数据采集指机器人在没有人逐步操控的情况下，自己决定做什么、自己执行并记录数据，人只负责偶尔干预和安全监督。遥操作采数据要一人盯一台，成本随数据量线性增长；让机器人自己采，机器越多数据越多。难点有三：要能提出有意义且多样的任务；要能自动判断成功还是失败；自主数据成功率低、质量参差，需要能从不完美数据中学习的方法。早期例子是谷歌 2016 年的机械臂农场，靠自动判定的抓取结果当标签；谷歌 DeepMind 的 AutoRT 用视觉语言模型理解场景、用大语言模型提议任务，调度 20 多台机器人采集；伯克利的 SOAR 用 VLM 提议和评判任务，在 5 个桌面环境里自主收集了 3 万多条轨迹来改进策略。","example":"AutoRT 让 20 多台机器人在多栋楼里运行，由大语言模型提出任务，通过遥操作和自主策略共采集约 7.7 万条真机轨迹。","related":["机械臂农场","AutoRT","数据飞轮","自我提升","真机强化学习","成功检测器"]},{"id":"failure-data","category":"data","sec":9,"tier":2,"sources":[{"title":"π*0.6: a VLA That Learns From Experience (arXiv 2511.14759)","url":"https://arxiv.org/abs/2511.14759"},{"title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset (arXiv 2403.12945)","url":"https://arxiv.org/html/2403.12945v2"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/html/2410.24164"}],"as_of":"2025-11","related_ids":["recovery-and-correction-data","human-intervention-data","success-detector","reward-model","recap","offline-reinforcement-learning"],"name":"失败数据","alt":"Failure Data","abbr":"","aliases":["失败轨迹","失败演示","Failed Trajectories"],"one_liner":"没完成任务的轨迹，可用来学纠错、训练奖励模型和价值函数。","explanation":"失败数据指没能完成任务的轨迹，来源包括遥操作时的失手、策略自主执行时的失败，以及人工介入前出错的片段。纯模仿学习通常把它们丢掉，照着学会学坏；但它们记录了「什么情况下会出错」，用处不少：训练成功检测器、奖励模型和价值函数，在强化学习里充当负反馈，配合纠偏数据教模型从错误中恢复。π0 论文就指出，只用高质量数据训练学不会纠错，因为这类数据里很少出现失误。Physical Intelligence 的 RECAP 方法把失败轨迹、自主运行数据和人工纠正一起用来训练 π*0.6，论文报告在较难任务上吞吐量翻倍以上、失败率约减半。","example":"DROID 数据集除 7.6 万条成功轨迹外，还一并发布了约 1.6 万条被采集员标为「不成功」的轨迹，可用于训练成功检测器或做离线强化学习。","related":["纠偏数据","干预数据","成功检测器","奖励模型","RECAP","离线强化学习"]},{"id":"human-intervention-data","category":"data","sec":9,"tier":2,"sources":[{"title":"HG-DAgger: Interactive Imitation Learning with Human Experts (arXiv 1810.02890)","url":"https://arxiv.org/abs/1810.02890"},{"title":"HIL-SERL 项目主页","url":"https://hil-serl.github.io/"},{"title":"π*0.6: a VLA That Learns From Experience (arXiv 2511.14759)","url":"https://arxiv.org/abs/2511.14759"}],"as_of":"","related_ids":["human-in-the-loop","human-gated-dagger","recovery-and-correction-data","hil-serl","recap","intervention-rate"],"name":"干预数据","alt":"Human Intervention Data","abbr":"","aliases":["人工纠偏数据","接管数据","人工干预数据","Intervention Data"],"one_liner":"机器人自主执行快出错时，人接管操控，把这段人工纠正记录下来的数据。","explanation":"干预数据指策略在真机上自主运行时，人看到要出错就用遥操作接管，把机器人引回正轨，接管期间的观测和人给的动作被记录下来。思路来自 DAgger 一类交互式模仿学习：纯行为克隆只见过专家的「标准路线」，一旦偏离就不知所措，误差越积越大；干预数据补上的正是「偏了之后怎么救回来」，且集中在策略最薄弱的状态。HG-DAgger（2018）让人在觉得不安全时接管；伯克利的 HIL-SERL 在真机强化学习中用人工干预引导探索；Physical Intelligence 的 π*0.6 也把专家干预和自主经验一起用于训练。","example":"HIL-SERL 训练初期，人频繁接管机器人，示范怎样从各种状态完成任务；策略成功率上去后，再逐步减少干预。","related":["人在回路","人工门控 DAgger","纠偏数据","HIL-SERL","RECAP","干预率"]},{"id":"recovery-and-correction-data","category":"data","sec":9,"tier":2,"sources":[{"title":"RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction","url":"https://arxiv.org/abs/2509.07953"},{"title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)","url":"https://arxiv.org/abs/1011.0686"}],"as_of":"2025-09","related_ids":["human-intervention-data","failure-recovery","dagger","human-gated-dagger","compounding-error","rac"],"name":"纠偏数据","alt":"Recovery and Correction Data","abbr":"","aliases":["恢复数据","恢复与纠正数据","Recovery Data","纠错数据"],"one_liner":"专门记录机器人快要出错或已经出错时怎样回到正轨的演示数据。","explanation":"普通遥操作演示大多是一次做对的「完美轨迹」，策略没见过走偏以后的状态，一偏就不知道怎么救，错误越滚越大。纠偏数据补的就是这块：让策略自己跑，快失败时由人接管，把机器人拉回来并完成任务，再把这段接管加进训练集。思路可追溯到 2011 年的 DAgger（数据集聚合），后来有人工门控的 HG-DAgger 等变体。2025 年的 RaC 把它做成模仿学习之后的专门阶段：操作员先把机器人倒回一个熟悉的状态，再给出纠正片段，在挂衬衫、密封饭盒等长程任务上用约十分之一的采集时间超过此前方法。","example":"在 RaC 的挂衬衫任务里，策略眼看要挂偏时操作员接管，先把手臂退回之前正常的姿态，再示范一遍对准衣架挂上，这段接管就成了一条纠偏数据。","related":["干预数据","失败恢复","DAgger（数据集聚合）","人工门控 DAgger","复合误差","RaC"]},{"id":"deployment-data-backflow","category":"data","sec":9,"tier":3,"sources":[{"title":"中国信通院《具身智能发展报告（2025年）》","url":"http://www.caict.ac.cn/kxyj/qwfb/bps/202601/P020260130541978285206.pdf"},{"title":"具身智能迈向2.0：数据采集从训练场走向真实世界（科学网转澎湃新闻）","url":"https://news.sciencenet.cn/htmlnews/2026/9/570778.shtm"},{"title":"π*0.6: a VLA That Learns From Experience (arXiv)","url":"https://arxiv.org/abs/2511.14759"}],"as_of":"2026-09","related_ids":["data-flywheel","human-intervention-data","recovery-and-correction-data","fleet-learning","recap","pi-star-0-6"],"name":"数据回流","alt":"Deployment Data Backflow","abbr":"","aliases":["部署数据回流"],"one_liner":"把机器人实际部署中产生的数据送回训练，更新模型后再部署。","explanation":"数据回流是国内具身智能行业的常用说法，指机器人在真实场景干活时产生的数据（自主执行的轨迹、失败案例、人工接管和纠正的片段）被记录下来，经回传、清洗、标注后加入训练，模型更新后再部署，循环往复。它是「数据飞轮」转起来的关键一环：训练场里的遥操作数据分布有限，真实现场的错误最能暴露模型短板。中国信通院《具身智能发展报告（2025年）》提出，要尽快让机器人跨过「演示」阶段、在实际应用中形成持续的数据回流。难点在成本：如果每台机器人都要一名操作员全程看守接管，就很难商业化。","example":"Physical Intelligence 训练 π*0.6 时，把机器人做意式咖啡、叠衣服、组装纸箱时自主执行的数据和人工纠错数据一起用 RECAP 方法继续训练，官方称部分最难任务的吞吐量提升一倍以上、失败率约降一半。","related":["数据飞轮","干预数据","纠偏数据","机群学习 / 部署中学习","RECAP","π*0.6"]},{"id":"data-flywheel","category":"data","sec":9,"tier":1,"sources":[{"title":"NVIDIA Glossary: What Is a Data Flywheel?","url":"https://www.nvidia.com/en-us/glossary/data-flywheel/"},{"title":"π*0.6: a VLA That Learns From Experience (arXiv 2511.14759)","url":"https://arxiv.org/abs/2511.14759"}],"as_of":"2025-11","related_ids":["deployment-data-backflow","human-intervention-data","recap","self-improvement","human-in-the-loop","fleet-learning"],"name":"数据飞轮","alt":"Data Flywheel","abbr":"","aliases":["数据闭环","数据引擎","Data Closed Loop","Data Engine"],"one_liner":"部署产生数据、数据改进模型、更好的模型再多部署，循环加速的机制。","explanation":"数据飞轮指一种自我强化的循环：模型部署出去，在使用中产生新数据（成功、失败、人工纠正），筛选标注后用来改进模型；更好的模型能接更多任务、部署到更多地方，又带回更多数据。英伟达把它定义为用 AI 交互中收集的数据持续改进模型的自我提升回路。自动驾驶行业较早用这种做法（特斯拉称之为数据引擎）。机器人数据很贵，公司普遍希望靠真实部署摊薄数据成本；飞轮能转起来的前提，是机器人先在真实场景里有用。","example":"Physical Intelligence 的 π*0.6 用 RECAP 方法，把机器人在真实家庭叠衣服、用专业咖啡机做意式咖啡、组装纸箱时的自主执行数据和专家遥操作纠正数据回收训练；据论文，在最难的几项任务上吞吐量提升一倍多、失败率约减半。","related":["数据回流","干预数据","RECAP","自我提升","人在回路","机群学习 / 部署中学习"]},{"id":"supervised-learning","category":"training","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Supervised learning","url":"https://en.wikipedia.org/wiki/Supervised_learning"}],"as_of":"","related_ids":["behavior-cloning","unsupervised-learning","reinforcement-learning","loss-function","ground-truth","supervised-fine-tuning"],"name":"监督学习","alt":"Supervised Learning","abbr":"","aliases":["有监督学习"],"one_liner":"用「输入 + 标准答案」成对的数据训练模型，让它学会从输入预测答案。","explanation":"监督学习是最常见的机器学习范式：训练数据里每个输入都配有正确输出（标签，也叫真值），模型不断缩小自己的预测与标签之间的差距（用损失函数衡量），最终目标是在没见过的新数据上也能预测对，也就是泛化。输出是类别时叫分类，输出是连续数值时叫回归。与之相对的是没有标签的无监督学习，以及靠奖励信号学习的强化学习。在具身智能里，行为克隆本质上就是监督学习：把人类示范中的观测当输入、动作当标签，训练策略去模仿。","example":"用遥操作采集 1000 条「相机画面 → 机械臂关节角」数据，训练一个网络输入画面、输出关节角，损失取预测关节角与示范关节角的均方误差——这就是以监督学习形式做的行为克隆。","related":["行为克隆","无监督学习","强化学习","损失函数","真值","监督微调"]},{"id":"unsupervised-learning","category":"training","sec":0,"tier":2,"sources":[{"title":"Wikipedia: Unsupervised learning","url":"https://en.wikipedia.org/wiki/Unsupervised_learning"}],"as_of":"","related_ids":["supervised-learning","self-supervised-learning","representation-learning","pre-training","unsupervised-skill-discovery","autoencoder"],"name":"无监督学习","alt":"Unsupervised Learning","abbr":"","aliases":["非监督学习"],"one_liner":"只用没有标签的数据，让模型自己找出数据里的结构。","explanation":"无监督学习是与监督学习相对的机器学习范式：训练数据只有输入、没有人工标注的答案，模型要自己发现其中的规律。经典任务有聚类（如 k-means 把相似样本分组）、降维（如主成分分析 PCA）和密度估计（学出数据的概率分布）；自编码器等生成模型也常归入此类。自监督学习（从数据本身构造监督信号，如预测被遮住的部分）有时被视为它的一个分支。它重要是因为标注昂贵而无标签数据极多，大模型预训练大量依赖无标签文本、图像和视频。在具身智能里，从无动作标签的人类视频中学潜在动作、让机器人通过无监督技能发现自己探索出多种行为，都属于这一思路。","example":"对一批没有标注的桌面场景图片做 k-means 聚类，算法不知道类别名，只按特征相似度把图片分成若干组。","related":["监督学习","自监督学习","表征学习","预训练","无监督技能发现","自编码器"]},{"id":"self-supervised-learning","category":"training","sec":0,"tier":2,"sources":[{"title":"Self-supervised learning: The dark matter of intelligence (Meta AI, 2021)","url":"https://ai.meta.com/blog/self-supervised-learning-the-dark-matter-of-intelligence/"},{"title":"Masked Autoencoders Are Scalable Vision Learners (arXiv 2111.06377)","url":"https://arxiv.org/abs/2111.06377"},{"title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv 2506.09985)","url":"https://arxiv.org/abs/2506.09985"}],"as_of":"","related_ids":["contrastive-learning","masked-autoencoder","pre-training","representation-learning","next-token-prediction","v-jepa-2"],"name":"自监督学习","alt":"Self-Supervised Learning","abbr":"SSL","aliases":["自监督","自监督预训练"],"one_liner":"不用人工标注，从数据自身构造「题目和答案」来训练模型。","explanation":"自监督学习指监督信号来自数据本身、不需要人工标签的训练方式：把输入的一部分藏起来，让模型根据其余部分去预测它。Yann LeCun 等人把它称为智能的「暗物质」并大力推广。常见形式有：遮住文本中的词让模型补全（BERT；GPT 的下一个 token 预测也常归入此类）、遮住 75% 的图像块再重建（MAE，掩码自编码器）、让同一内容不同视角的表征彼此靠近（对比学习）。它解决的是人工标注昂贵、数据量上不去的问题，是大模型预训练的基础。在具身智能里，带动作标签的机器人数据很少，研究者常先在海量人类视频上自监督预训练视觉表征或世界模型，再用少量机器人数据微调。","example":"Meta 的 V-JEPA 2 先在超过 100 万小时互联网视频上自监督预训练，再用不到 62 小时、不带标签的 DROID 机器人视频训练出动作条件世界模型 V-JEPA 2-AC，在不同实验室的 Franka 机械臂上不做任务专门训练、靠图像目标规划完成抓取放置。","related":["对比学习","掩码自编码器","预训练","表征学习","下一个 token 预测","V-JEPA 2"]},{"id":"imitation-learning","category":"training","sec":0,"tier":1,"sources":[{"title":"Osa et al. 2018: An Algorithmic Perspective on Imitation Learning","url":"https://arxiv.org/abs/1811.06711"},{"title":"Wikipedia: Imitation learning","url":"https://en.wikipedia.org/wiki/Imitation_learning"},{"title":"Fu et al. 2024: Mobile ALOHA","url":"https://arxiv.org/abs/2401.02117"}],"as_of":"","related_ids":["behavior-cloning","inverse-reinforcement-learning","generative-adversarial-imitation-learning","dagger","demonstration-data","teleoperation"],"name":"模仿学习","alt":"Imitation Learning","abbr":"IL","aliases":["示教学习","从演示中学习","Learning from Demonstration","LfD","Programming by Demonstration"],"one_liner":"让机器人通过模仿专家（通常是人）的示范动作来学会技能。","explanation":"模仿学习研究如何让智能体从专家演示中学会行为，适合「演示一遍比写规则或设计奖励更容易」的场景。演示通常由人通过遥操作、拖动示教或动作捕捉记录下来。主要路线有三类：行为克隆，直接用监督学习拟合演示动作；逆强化学习，先从演示反推奖励函数，再用强化学习优化；对抗式模仿如 GAIL，让策略的行为分布逼近专家。核心难题是分布偏移：执行时策略会走到演示没覆盖的状态，DAgger 等方法会在这些状态上请专家补标。当前主流 VLA 的主干训练本质上都是大规模模仿学习。","example":"Mobile ALOHA 每个任务只采 50 条人类遥操作演示，并与已有的静态 ALOHA 数据协同训练，学会了炒虾装盘、按电梯进电梯、打开壁柜放锅等移动操作任务。","related":["行为克隆","逆强化学习","生成对抗模仿学习","DAgger（数据集聚合）","演示数据","遥操作"]},{"id":"reinforcement-learning","category":"training","sec":0,"tier":1,"sources":[{"title":"Wikipedia: Reinforcement learning","url":"https://en.wikipedia.org/wiki/Reinforcement_learning"},{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"OpenAI et al. 2018: Learning Dexterous In-Hand Manipulation","url":"https://arxiv.org/abs/1808.00177"}],"as_of":"","related_ids":["markov-decision-process","reward-function","policy","proximal-policy-optimization","sim-to-real-transfer","reinforcement-fine-tuning"],"name":"强化学习","alt":"Reinforcement Learning","abbr":"RL","aliases":["增强学习"],"one_liner":"智能体通过反复试错、根据奖励信号不断改进行为的机器学习方法。","explanation":"强化学习是与监督学习、无监督学习并列的机器学习范式。智能体在环境中观察状态、做出动作，环境返回新状态和奖励（衡量这一步好坏的数值），目标是学出让长期累计奖励最大的策略。它不需要逐步标注「正确动作」，只要定义好奖励，但智能体得在尝试新动作（探索）和使用已知好动作（利用）之间权衡。问题通常建模为马尔可夫决策过程。在具身智能里，强化学习主要用在两处：一是在仿真器里大规模并行训练足式、人形机器人的运动控制，再迁移到真机；二是在模仿学习打底后，用强化学习微调 VLA，提升成功率和纠错能力。","example":"OpenAI 2018 年完全在仿真里用强化学习训练 Shadow 灵巧手，并随机化摩擦系数等物理参数，训出的策略直接迁移到真实灵巧手上，完成基于视觉的手内物体转向。","related":["马尔可夫决策过程","奖励函数","策略","近端策略优化","仿真到现实迁移","强化学习微调"]},{"id":"training-validation-test-set","category":"training","sec":1,"tier":1,"sources":[{"title":"Google Machine Learning Crash Course: Dividing the original dataset","url":"https://developers.google.com/machine-learning/crash-course/overfitting/dividing-datasets"},{"title":"Google Machine Learning Glossary: validation set","url":"https://developers.google.com/machine-learning/glossary#validation-set"}],"as_of":"","related_ids":["overfitting","hyperparameter","checkpoint","generalization","out-of-distribution","data-leakage-test-set-contamination"],"name":"训练集 / 验证集 / 测试集","alt":"Training / Validation / Test Set","abbr":"","aliases":["训练集","验证集","测试集","数据集划分","train/val/test split"],"one_liner":"把数据分成三份：一份用来学，一份用来调参挑模型，一份留到最后检验。","explanation":"这是机器学习划分数据的标准做法。训练集用来更新模型参数；验证集在训练过程中评估模型，据此挑选超参数和检查点（训练中途保存的模型权重）；测试集只在最后使用，给出模型在没见过的数据上的表现。谷歌机器学习速成课程举的例子是 70% / 15% / 15%，但比例并不固定，关键是验证集和测试集要足够大、结论才可靠。三者之间不能有重复样本，否则等于偷看答案，成绩会虚高；验证集被反复拿来做决策后也会逐渐失去代表性。机器人领域常用真机或仿真评测充当测试集，同样要保证测试场景和物体没有出现在训练数据里。","example":"训练一个抓取策略：用 8 个厨房采的数据训练，另 1 个厨房的数据做验证、决定训练多少步，最后在从没出现过的第 10 个厨房里做真机测试并报告成功率。","related":["过拟合","超参数","检查点","泛化","分布外","数据泄漏 / 测试集污染"]},{"id":"ground-truth","category":"training","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Ground truth","url":"https://en.wikipedia.org/wiki/Ground_truth"},{"title":"Google Machine Learning Glossary","url":"https://developers.google.com/machine-learning/glossary"}],"as_of":"","related_ids":["data-annotation","privileged-information","supervised-learning","action-label","synthetic-data","motion-capture"],"name":"真值","alt":"Ground Truth","abbr":"GT","aliases":["标注真值","真实标签","真值标签"],"one_liner":"被当作「标准答案」的真实数据，用来训练和评估模型。","explanation":"Ground Truth 原是遥感领域的术语，指在地面实地采集、用来校准卫星测量的数据，后来被统计建模和机器学习借用，泛指训练和评测时当作标准答案的数据，比如图像的类别标签、物体的真实位置。GT 不一定绝对正确：人工标注会出错，传感器测量有误差，所以数据质量直接决定模型上限。具身智能里，模仿学习把人类遥操作记录下的动作当作动作真值；仿真器能直接读出物体位姿、接触力等精确状态，常用来当感知模块的训练真值，或作为教师策略的特权信息；真机实验则常用动作捕捉系统测得的位姿作为真值来评估算法。","example":"用仿真渲染的图像训练 6D 位姿估计模型时，每张图里物体的真实位姿由仿真器直接给出，这就是 GT，不需要人工标注。","related":["数据标注","特权信息","监督学习","动作标签","合成数据","动作捕捉"]},{"id":"loss-function","category":"training","sec":1,"tier":1,"sources":[{"title":"Google Machine Learning Glossary: loss function","url":"https://developers.google.com/machine-learning/glossary#loss-function"},{"title":"Wikipedia: Loss function","url":"https://en.wikipedia.org/wiki/Loss_function"},{"title":"Zhao et al. 2023: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["mean-squared-error","l1-loss","cross-entropy","denoising-loss","gradient-descent","backpropagation"],"name":"损失函数","alt":"Loss Function","abbr":"","aliases":["loss","目标函数","代价函数","Cost Function"],"one_liner":"把模型预测和正确答案的差距算成一个数，训练就是不断把它调小。","explanation":"损失函数衡量模型一次预测错得有多厉害，输出一个实数，差距越大数值越大。训练时，反向传播算出损失对每个参数的梯度，优化器沿着让损失变小的方向更新参数，反复进行直到损失不再明显下降。回归连续数值常用均方误差（MSE）或 L1 损失，分类或预测下一个 token 常用交叉熵。「目标函数」更宽泛，既可以是要最小化的损失，也可以是要最大化的量，比如强化学习里的累计奖励。在具身模型里，损失的选法直接影响动作质量：ACT 用 L1 损失回归动作，扩散策略和流匹配模型则用去噪损失或流匹配损失。","example":"ACT 论文发现，回归动作序列时用 L1 损失比更常见的 L2（均方误差）损失建模得更精确，因此改用 L1。","related":["均方误差","L1 损失","交叉熵","去噪损失","梯度下降","反向传播"]},{"id":"gradient-descent","category":"training","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Gradient descent","url":"https://en.wikipedia.org/wiki/Gradient_descent"},{"title":"Google Machine Learning Glossary","url":"https://developers.google.com/machine-learning/glossary"}],"as_of":"","related_ids":["backpropagation","learning-rate","optimizer","loss-function","batch-size","adamw"],"name":"梯度下降","alt":"Gradient Descent","abbr":"","aliases":["随机梯度下降","SGD","小批量梯度下降","Mini-batch Gradient Descent"],"one_liner":"沿损失函数梯度的反方向一步步调参数，让损失越来越小的优化方法。","explanation":"梯度下降是训练神经网络的核心优化方法，一般认为由数学家柯西在 1847 年最早提出。梯度是损失函数对每个参数的偏导数，指向损失上升最快的方向；每一步把参数往反方向挪一点，挪多少由学习率决定：太小收敛慢，太大会来回震荡甚至发散。深度学习数据量大，每步只用一小批数据估算梯度，这叫随机（小批量）梯度下降，即 SGD。梯度本身由反向传播算出。现在训练 VLA 等大模型常用的 Adam、AdamW 优化器，是在梯度下降基础上加了动量和自适应步长的改进版。","example":"训练一个行为克隆策略：每步取 64 帧演示，算预测动作和演示动作之间的均方误差，反向传播得到梯度，再按「参数 ← 参数 − 学习率 × 梯度」更新一次。","related":["反向传播","学习率","优化器","损失函数","批大小","AdamW 优化器"]},{"id":"backpropagation","category":"training","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Backpropagation","url":"https://en.wikipedia.org/wiki/Backpropagation"},{"title":"Google Machine Learning Glossary","url":"https://developers.google.com/machine-learning/glossary"}],"as_of":"","related_ids":["gradient-descent","optimizer","loss-function","vanishing-exploding-gradients","stop-gradient","neural-network"],"name":"反向传播","alt":"Backpropagation","abbr":"BP","aliases":["BP 算法","误差反向传播","Backprop"],"one_liner":"用链式法则从输出往回逐层算梯度，是训练神经网络的核心算法。","explanation":"反向传播是计算神经网络梯度的方法。训练时先前向计算得到输出和损失，再从损失出发，按链式法则从最后一层往前逐层传递误差，一次算出损失对所有参数的梯度，交给梯度下降、AdamW 等优化器更新参数，避免了对每个参数单独求导的大量重复计算。它可追溯到 Seppo Linnainmaa 1970 年的自动微分工作，Paul Werbos 1974 年将其用于神经网络，1986 年 Rumelhart、Hinton 和 Williams 在《Nature》上的论文让它广为人知。PyTorch 里的 loss.backward() 就是在做反向传播。","example":"训练行为克隆策略时，每一步先前向算出预测动作与示范动作的均方误差，再调用 loss.backward() 得到所有权重的梯度，最后 optimizer.step() 更新参数。","related":["梯度下降","优化器","损失函数","梯度消失 / 梯度爆炸","梯度阻断","神经网络"]},{"id":"optimizer","category":"training","sec":1,"tier":2,"sources":[{"title":"Adam: A Method for Stochastic Optimization","url":"https://arxiv.org/abs/1412.6980"},{"title":"Decoupled Weight Decay Regularization (AdamW)","url":"https://arxiv.org/abs/1711.05101"},{"title":"PyTorch Documentation: torch.optim","url":"https://docs.pytorch.org/docs/main/optim.html"}],"as_of":"","related_ids":["gradient-descent","backpropagation","learning-rate","adamw","learning-rate-schedule","gradient-clipping"],"name":"优化器","alt":"Optimizer","abbr":"","aliases":["优化算法","Optimization Algorithm"],"one_liner":"根据梯度决定每一步如何更新模型参数的算法，如 SGD、Adam、AdamW。","explanation":"训练神经网络时，反向传播算出损失对每个参数的梯度，优化器负责把梯度变成具体的参数更新：往哪个方向走、走多大一步。最基础的是随机梯度下降（SGD），加动量后更平稳；Adam（Kingma 与 Ba，2014）同时跟踪梯度的均值和平方均值，给每个参数自适应步长，调参少、收敛快；AdamW（Loshchilov 与 Hutter，ICLR 2019）把权重衰减从梯度更新里拆出来，泛化更好，在 Transformer、扩散策略等模型的训练中很常用。优化器通常和学习率调度（预热、余弦退火）、梯度裁剪一起配置。注意：人形机器人公司 PNDbotics 的 Adam 是一款机器人，与 Adam 优化器无关。","example":"Diffusion Policy 官方训练配置用 torch.optim.AdamW，学习率 1e-4、权重衰减 1e-6，配 500 步预热加余弦退火；在 PyTorch 里每步训练依次调用 zero_grad()、loss.backward()、optimizer.step()。","related":["梯度下降","反向传播","学习率","AdamW 优化器","学习率调度（预热与余弦退火）","梯度裁剪"]},{"id":"adamw","category":"training","sec":1,"tier":2,"sources":[{"title":"Decoupled Weight Decay Regularization (arXiv 1711.05101)","url":"https://arxiv.org/abs/1711.05101"},{"title":"PyTorch docs: torch.optim.AdamW","url":"https://docs.pytorch.org/docs/2.14/generated/torch.optim.AdamW.html"}],"as_of":"","related_ids":["optimizer","gradient-descent","learning-rate","regularization","learning-rate-schedule"],"name":"AdamW 优化器","alt":"AdamW (Adam with Decoupled Weight Decay)","abbr":"","aliases":["AdamW","解耦权重衰减的 Adam"],"one_liner":"把权重衰减从梯度更新里拆出来单独做的 Adam，训练大模型最常用的优化器之一。","explanation":"AdamW 由 Ilya Loshchilov 和 Frank Hutter 在论文《Decoupled Weight Decay Regularization》中提出（ICLR 2019）。优化器负责按梯度更新参数，Adam 会给每个参数自适应调整步长。以往给 Adam 加正则是把 L2 惩罚并进梯度，但它会被自适应步长一起缩放，效果打折。作者指出这对 SGD 等价于权重衰减（每步把参数按比例缩小一点），对 Adam 却不等价，于是把衰减从梯度计算中拆出来单独执行。这样泛化更好，最优衰减系数也不再和学习率绑定。如今它是训练 Transformer 类模型最常用的优化器之一。","example":"在 PyTorch 里写 torch.optim.AdamW(model.parameters(), lr=1e-4, weight_decay=0.01) 即可使用；PyTorch 中它的默认参数为学习率 1e-3、betas (0.9, 0.999)、weight_decay 0.01。","related":["优化器","梯度下降","学习率","正则化","学习率调度（预热与余弦退火）"]},{"id":"hyperparameter","category":"training","sec":1,"tier":1,"sources":[{"title":"Google Machine Learning Glossary: hyperparameter","url":"https://developers.google.com/machine-learning/glossary#hyperparameter"},{"title":"Wikipedia: Hyperparameter (machine learning)","url":"https://en.wikipedia.org/wiki/Hyperparameter_(machine_learning)"}],"as_of":"","related_ids":["learning-rate","batch-size","epoch","overfitting","alchemy","population-based-training"],"name":"超参数","alt":"Hyperparameter","abbr":"","aliases":["超参","Hyper-parameter"],"one_liner":"训练开始前由人设定、不靠训练学出来的配置，比如学习率、批大小。","explanation":"模型里的权重叫参数，由训练自动学出来；超参数则是训练前由人设定、训练中一般不变的配置，决定「怎么学」。常见的有学习率、批大小、训练步数或轮次、网络层数和宽度、正则化强度；强化学习里还有折扣因子、PPO 的裁剪系数；具身模型还有动作块长度、扩散去噪步数等。超参数选得不好，模型可能不收敛、过拟合或效果差一截。寻找合适组合的过程叫超参数调优，常用网格搜索、随机搜索、贝叶斯优化，实践中也常沿用论文默认值再小范围调整，行话叫「调参」或「炼丹」。","example":"训练 ACT 时，动作块长度 k、学习率、CVAE 损失中 KL 项的权重 β，都是需要人手动设定的超参数。","related":["学习率","批大小","训练轮次","过拟合","炼丹 / 调参（黑话）","基于群体的训练"]},{"id":"learning-rate","category":"training","sec":1,"tier":2,"sources":[{"title":"Learning rate（Wikipedia）","url":"https://en.wikipedia.org/wiki/Learning_rate"},{"title":"Visual Instruction Tuning (LLaVA, arXiv 2304.08485)","url":"https://arxiv.org/abs/2304.08485"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/abs/2406.09246"}],"as_of":"","related_ids":["learning-rate-schedule","gradient-descent","optimizer","adamw","batch-size","hyperparameter"],"name":"学习率","alt":"Learning Rate","abbr":"LR","aliases":["步长","step size"],"one_liner":"梯度下降每次更新参数时迈出的步子大小，是最关键的超参数之一。","explanation":"学习率是优化算法里控制每一步参数更新幅度的超参数：参数沿负梯度方向移动，移动量等于学习率乘以梯度（Adam 等自适应优化器还会按每个参数的历史梯度再做缩放）。设得太大，参数会越过最低点，损失来回震荡甚至发散成 NaN；设得太小，收敛很慢，或停在不理想的位置。它通常是调参时最先要调的量，并且和批大小有关：批大小加大时常按比例放大学习率（线性缩放规则）。实际训练很少全程用一个固定值，而是配合学习率调度，先预热、再逐步衰减。微调预训练大模型时一般用比从零训练小得多的学习率，以免破坏已经学到的能力。","example":"LLaVA 第一阶段只训练投影层时学习率取 2e-3，第二阶段连同语言模型一起微调时降到 2e-5；OpenVLA 训练全程固定用 2e-5，作者发现加学习率预热没有带来收益；ACT 则用 1e-5。","related":["学习率调度（预热与余弦退火）","梯度下降","优化器","AdamW 优化器","批大小","超参数"]},{"id":"learning-rate-schedule","category":"training","sec":1,"tier":2,"sources":[{"title":"SGDR: Stochastic Gradient Descent with Warm Restarts (arXiv 1608.03983)","url":"https://arxiv.org/abs/1608.03983"},{"title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour (arXiv 1706.02677)","url":"https://arxiv.org/abs/1706.02677"},{"title":"openpi optimizer.py（CosineDecaySchedule 默认参数）","url":"https://github.com/Physical-Intelligence/openpi/blob/main/src/openpi/training/optimizer.py"}],"as_of":"","related_ids":["learning-rate","optimizer","adamw","batch-size","convergence","fine-tuning"],"name":"学习率调度（预热与余弦退火）","alt":"Learning Rate Schedule (Warmup / Cosine Decay)","abbr":"","aliases":["学习率预热","warmup","余弦退火","cosine decay","学习率衰减"],"one_liner":"让学习率随训练步数变化：先预热升上去，再按余弦曲线慢慢降下来。","explanation":"学习率调度指按预先设定的规则在训练中改变学习率，而不是全程用同一个值。最常见的组合是「预热 + 余弦退火」。预热是在训练开头一段步数里把学习率从接近 0 线性升到峰值：这时参数刚随机初始化或刚接上新模块，梯度很不稳定，一上来就用大学习率容易发散。Goyal 等人 2017 年用渐进预热配合线性缩放规则，把 ResNet-50 的批大小扩到 8192 仍保持精度。预热之后，学习率按余弦曲线平滑降到很小的值，让模型在后期细致收敛，这种余弦形状来自 Loshchilov 和 Hutter 的 SGDR 论文（ICLR 2017）。其他常见调度还有阶梯衰减、指数衰减和线性衰减。","example":"openpi 微调 π0 的默认配置：前 1000 步把学习率线性升到 2.5e-5，之后在 30000 步内按余弦曲线降到 2.5e-6。","related":["学习率","优化器","AdamW 优化器","批大小","收敛","微调"]},{"id":"batch-size","category":"training","sec":1,"tier":2,"sources":[{"title":"Google Machine Learning Glossary","url":"https://developers.google.com/machine-learning/glossary"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/html/2406.09246"}],"as_of":"2024-06","related_ids":["learning-rate","epoch","gradient-accumulation","distributed-training","hyperparameter","gradient-descent"],"name":"批大小","alt":"Batch Size","abbr":"","aliases":["批量大小","batch","批次大小"],"one_liner":"每更新一次参数时，一起送进模型计算的样本数量。","explanation":"训练时不会一次用上全部数据，而是把数据切成一小批一小批（mini-batch），每批算一次平均损失和梯度、更新一次参数，一批里的样本数就是批大小。批大小越大，梯度估计越稳定、GPU 利用率越高，但显存占用也越大；太小则梯度噪声大、训练慢。它和学习率关系紧密，改批大小时通常要一起调学习率。显存不够又想用大批量时，可以用梯度累积（攒几批梯度再更新一次）或多卡数据并行。注意区分：一个训练轮次（epoch）是把全部数据过一遍，其中包含许多个批次。","example":"OpenVLA 在 64 张 A100 上训练了 14 天，全局批大小为 2048、学习率固定为 2e-5，总共把训练集过了 27 遍。","related":["学习率","训练轮次","梯度累积","分布式训练（数据并行 / 模型并行）","超参数","梯度下降"]},{"id":"epoch","category":"training","sec":1,"tier":2,"sources":[{"title":"Google Machine Learning Glossary","url":"https://developers.google.com/machine-learning/glossary"},{"title":"GeeksforGeeks: Epoch in Machine Learning","url":"https://www.geeksforgeeks.org/machine-learning/epoch-in-machine-learning/"},{"title":"legged_gym: legged_robot_config.py (num_learning_epochs = 5)","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["batch-size","gradient-descent","early-stopping","overfitting","underfitting","proximal-policy-optimization"],"name":"训练轮次","alt":"Epoch","abbr":"","aliases":["epoch","轮数","轮"],"one_liner":"模型把整个训练集完整看过一遍，称为一个 epoch。","explanation":"epoch 是描述训练进度的单位。训练数据被切成若干批次（batch），每处理一个批次、更新一次参数叫一次迭代（iteration，也叫 step）；训练集里所有样本都过一遍就是一个 epoch，所以每个 epoch 的迭代数约等于样本总数除以批大小。轮数太少会欠拟合，太多会过拟合，常配合早停决定停在哪。大模型预训练数据量极大，往往只把数据过一到几遍，所以更常用「训练步数」或「看过的 token 数」计量；小规模机器人演示数据则往往要训练很多个 epoch。强化学习里用法稍有不同：PPO 会把同一批推演数据反复利用几遍，每一遍也叫一个 epoch。","example":"50 条演示共 2 万帧、批大小 64 时，一个 epoch 约 313 步；legged_gym 的 PPO 配置里每批推演数据训练 5 个 epoch（num_learning_epochs = 5）。","related":["批大小","梯度下降","早停","过拟合","欠拟合","近端策略优化"]},{"id":"convergence","category":"training","sec":1,"tier":2,"sources":[{"title":"Google Machine Learning Glossary: convergence","url":"https://developers.google.com/machine-learning/glossary"},{"title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic, arXiv 2108.03298)","url":"https://arxiv.org/abs/2108.03298"}],"as_of":"","related_ids":["loss-function","learning-rate","gradient-descent","overfitting","checkpoint","early-stopping"],"name":"收敛","alt":"Convergence","abbr":"","aliases":["训练收敛","Converge"],"one_liner":"继续训练时损失或回报几乎不再变化，模型进入稳定状态。","explanation":"收敛指训练中损失（衡量预测与目标差距的数值）或强化学习的回报随迭代基本不再变化，再训下去收益很小。梯度下降类方法只在一定条件下保证收敛到局部最优或平稳点，深度网络实际上靠看训练曲线判断。学习率过大会让损失震荡甚至发散，梯度爆炸、数据问题也会导致不收敛。机器人学习里要注意：损失收敛不等于策略最好用。robomimic 的大规模实验指出，训练目标和实际评测目标不一致，按验证损失挑检查点并不可靠，通常还要实际跑推演、看成功率来选模型。","example":"训练腿足运控策略时，平均回报曲线先快速上升、后来走平，就认为基本收敛；训练行为克隆策略时，损失曲线走平后仍要对多个检查点分别测成功率，再决定用哪一个。","related":["损失函数","学习率","梯度下降","过拟合","检查点","早停"]},{"id":"checkpoint","category":"training","sec":1,"tier":1,"sources":[{"title":"PyTorch Tutorials: Saving and Loading Models","url":"https://docs.pytorch.org/tutorials/beginner/saving_loading_models.html"},{"title":"Google Machine Learning Glossary: checkpoint","url":"https://developers.google.com/machine-learning/glossary#checkpoint"},{"title":"GitHub: Physical-Intelligence/openpi","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"","related_ids":["fine-tuning","pre-training","open-weight-model","safetensors","inference-deployment","epoch"],"name":"检查点","alt":"Checkpoint","abbr":"ckpt","aliases":["权重文件","模型存档","模型检查点","模型权重","Model Checkpoint"],"one_liner":"训练中途或结束时保存下来的模型参数文件，加载后可推理或接着训练。","explanation":"检查点是模型参数在某一时刻的存档。训练大模型常要跑几天甚至几周，程序会每隔若干步把参数存成文件，防止崩溃后从头再来，也方便事后挑验证效果最好的一版。只用来推理时存模型权重就够；要从中断处接着训练，还得一起存优化器状态、当前轮次等，PyTorch 文档提到这种完整检查点通常是单存模型的 2–3 倍大。常见文件格式有 .pt、.pth、.ckpt 和 safetensors。开源 VLA 说「放出权重」，就是公开检查点，别人下载后可以直接推理，或在上面继续微调。","example":"Physical Intelligence 的 openpi 仓库提供 pi0_base、pi05_base 等基础检查点供微调，也提供 pi05_libero、pi0_aloha_towel 等已微调好的检查点，下载即可推理。","related":["微调","预训练","开放权重","safetensors 权重格式","推理部署","训练轮次"]},{"id":"alchemy","category":"training","sec":1,"tier":2,"sources":[{"title":"Reflections on Random Kitchen Sinks (Ali Rahimi & Ben Recht, NIPS 2017 Test-of-Time talk)","url":"https://archives.argmin.net/2017/12/05/kitchen-sinks/"},{"title":"Wikipedia: Hyperparameter optimization","url":"https://en.wikipedia.org/wiki/Hyperparameter_optimization"}],"as_of":"","related_ids":["hyperparameter","learning-rate","batch-size","population-based-training","ablation-study","random-seed-and-reproducibility"],"name":"炼丹 / 调参（黑话）","alt":"\"Alchemy\" (Slang for Model Training / Hyperparameter Tuning)","abbr":"","aliases":["炼丹","调参","调参侠","炼丹师","炼丹炉"],"one_liner":"中文圈对训练模型、反复试超参数的戏称，指主要靠经验和试错出结果。","explanation":"「炼丹」是国内深度学习圈的黑话，把训练模型比作炼丹：数据和模型放进 GPU 服务器（「丹炉」），定好学习率、批大小等超参数（训练前人为设定的配置，俗称「火候」），等几小时到几天看结果，好坏常常说不清原因，只能反复尝试。「调参」就是调整这些超参数，做这件事的人自嘲为「调参侠」「炼丹师」。英文圈也有类似批评：2017 年 NIPS 时间检验奖演讲中，Ali Rahimi 直言「机器学习已经变成了炼金术」，指领域依赖大量不理解原理的技巧。更系统的调参方法有网格搜索、随机搜索、贝叶斯优化和基于群体的训练。","example":"某个 VLA 微调效果不好，同学把学习率从 1e-4 改成 2e-5、批大小从 32 改成 128、再多训 2 万步看看——这样一轮轮试错就是「炼丹」。","related":["超参数","学习率","批大小","基于群体的训练","消融实验","随机种子与可复现性"]},{"id":"random-seed-and-reproducibility","category":"training","sec":1,"tier":2,"sources":[{"title":"Deep Reinforcement Learning that Matters (Henderson et al., AAAI 2018)","url":"https://arxiv.org/abs/1709.06560"},{"title":"PyTorch Docs: Reproducibility","url":"https://docs.pytorch.org/docs/stable/notes/randomness.html"},{"title":"Deep Reinforcement Learning at the Edge of the Statistical Precipice (NeurIPS 2021)","url":"https://arxiv.org/abs/2108.13264"}],"as_of":"","related_ids":["hyperparameter","ablation-study","statistical-rigor-in-policy-evaluation","benchmark","training-validation-test-set"],"name":"随机种子与可复现性","alt":"Random Seed & Reproducibility","abbr":"","aliases":["随机种子","Random Seed","可复现性","Reproducibility","多种子实验"],"one_liner":"固定随机数起点让实验能重跑，并用多个种子检验结果是不是靠运气。","explanation":"深度学习里很多环节带随机性：网络初始化、数据打乱、Dropout、强化学习的探索噪声、仿真的域随机化。随机种子是随机数生成器的起点，固定 Python、NumPy、PyTorch 的种子，同一份代码就能尽量跑出同样结果；但 PyTorch 官方说明，跨版本、跨平台仍不保证完全一致。可复现性的另一层意思是结论可信：Henderson 等人 2018 年发现，深度强化学习只换种子，结果就可能差到影响「谁更好」的判断。所以应报告多个种子的均值和置信区间，Agarwal 等人 2021 年还建议用四分位均值（IQM）和自助法置信区间。","example":"PyTorch 中固定种子：torch.manual_seed(0)、np.random.seed(0)、random.seed(0)，再设 torch.backends.cudnn.benchmark=False 和 torch.use_deterministic_algorithms(True)；比较两种强化学习算法时，每种用 5 个不同种子各跑一遍，报告均值和置信区间。","related":["超参数","消融实验","评测统计显著性（置信区间 / 序贯检验 / 多随机种子）","基准测试","训练集 / 验证集 / 测试集"]},{"id":"overfitting","category":"training","sec":1,"tier":1,"sources":[{"title":"Google Machine Learning Glossary: overfitting","url":"https://developers.google.com/machine-learning/glossary#overfitting"},{"title":"Wikipedia: Overfitting","url":"https://en.wikipedia.org/wiki/Overfitting"}],"as_of":"","related_ids":["underfitting","generalization","regularization","early-stopping","data-augmentation","training-validation-test-set"],"name":"过拟合","alt":"Overfitting","abbr":"","aliases":["过度拟合"],"one_liner":"模型把训练数据记得太死，换到没见过的新数据上就表现变差。","explanation":"过拟合指模型对训练数据拟合得过于紧密，连其中的噪声和偶然细节都记住了，结果在没见过的数据上预测不准。典型信号是训练损失一直下降，验证集损失却开始上升；数据少、模型大、训练轮次多时最容易出现。常用对策有增加数据或做数据增强、正则化、随机失活（Dropout）、早停，以及用验证集挑选检查点。具身智能里这个问题很突出：真机演示往往只有几十到几百条，策略容易记住演示时的摆放位置、光照和背景，物体挪几厘米或换块桌布就失败，所以论文会专门测位置泛化、场景泛化。反过来，模型连训练数据都学不好叫欠拟合。","example":"比如只用 50 条演示、杯子始终放在同一位置来训练抓杯策略，训久了在原位置几乎每次都成功，杯子挪开 10 厘米就抓空：策略记住的是那条固定轨迹，而不是「找到杯子再去抓」。","related":["欠拟合","泛化","正则化","早停","数据增强","训练集 / 验证集 / 测试集"]},{"id":"underfitting","category":"training","sec":1,"tier":2,"sources":[{"title":"Google Machine Learning Crash Course: Overfitting","url":"https://developers.google.com/machine-learning/crash-course/overfitting/overfitting"},{"title":"Wikipedia: Overfitting（含 Underfitting 一节）","url":"https://en.wikipedia.org/wiki/Overfitting"}],"as_of":"","related_ids":["overfitting","regularization","training-validation-test-set","loss-function","parameter-count","convergence"],"name":"欠拟合","alt":"Underfitting","abbr":"","aliases":["拟合不足"],"one_liner":"模型太弱或训练不够，连训练数据里的规律都没学会。","explanation":"欠拟合是机器学习的基础概念，与过拟合相对：模型在训练集上误差就很高，到验证集、测试集上同样差。常见原因有模型容量不够（参数少、结构太简单）、训练步数不足、学习率不合适、正则化过强，或输入里缺少完成任务所需的信息。判断看训练损失：训练损失降不下去是欠拟合；训练损失很低而验证损失回升才是过拟合。机器人学习里的典型表现是策略连训练时的演示场景都做不对，这时应先加大模型、延长训练，或检查观测与动作数据（如相机画面、动作归一化）有没有出错，而不是急着上数据增强这类防过拟合手段。","example":"用一个很小的多层感知机去学双臂叠衣服的演示，训练损失很早就停在高位，在训练集里的场景上回放也抓不准衣角，这就是欠拟合。","related":["过拟合","正则化","训练集 / 验证集 / 测试集","损失函数","参数量","收敛"]},{"id":"regularization","category":"training","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Regularization (mathematics)","url":"https://en.wikipedia.org/wiki/Regularization_(mathematics)"},{"title":"Dive into Deep Learning: Weight Decay","url":"https://d2l.ai/chapter_linear-regression/weight-decay.html"}],"as_of":"","related_ids":["overfitting","dropout","early-stopping","data-augmentation","entropy-regularization","kl-regularization"],"name":"正则化","alt":"Regularization","abbr":"","aliases":["正则项","正则化项","Regularization Term"],"one_liner":"训练时加约束或惩罚，防止模型死记训练数据，提升在新数据上的表现。","explanation":"正则化是机器学习里一大类防止过拟合的手段：模型在训练集上越学越好、在新数据上反而变差时，就要用它约束模型复杂度。显式正则化是在损失函数里加惩罚项，如 L2 正则（也叫权重衰减，惩罚权重平方和，让权重整体变小）和 L1 正则（惩罚绝对值，让很多权重变成 0）；隐式正则化包括早停、Dropout（训练时随机丢弃部分神经元）、数据增强等。强化学习里还有几种专门的正则：熵正则化鼓励策略保持随机以便探索，KL 正则化让微调后的策略别偏离原模型太远，行为正则化让离线强化学习的策略贴近数据集里的动作。","example":"训练视觉运动策略时对相机图像做随机裁剪（数据增强），并在 AdamW 优化器里设置权重衰减；RLHF 在奖励里减去 KL 惩罚项，防止模型为刷高分而偏离原始语言模型。","related":["过拟合","随机失活","早停","数据增强","熵正则化","KL 正则化"]},{"id":"dropout","category":"training","sec":1,"tier":2,"sources":[{"title":"Dropout: A Simple Way to Prevent Neural Networks from Overfitting (JMLR 2014)","url":"https://jmlr.org/papers/v15/srivastava14a.html"},{"title":"ACT 官方代码 detr/main.py（--dropout 默认 0.1）","url":"https://github.com/tonyzhaozh/act/blob/main/detr/main.py"},{"title":"Dropout Q-Functions for Doubly Efficient Reinforcement Learning (DroQ)","url":"https://arxiv.org/abs/2110.02034"}],"as_of":"","related_ids":["regularization","overfitting","early-stopping","data-augmentation","normalization-layers"],"name":"随机失活","alt":"Dropout","abbr":"","aliases":["丢弃法","Dropout 正则化"],"one_liner":"训练时随机「关掉」一部分神经元，防止网络死记训练数据的正则化方法。","explanation":"Dropout 出自 Hinton 团队，2014 年 Srivastava、Hinton 等人在 JMLR 发表了系统论文。训练时每一步按设定概率随机把一部分神经元的输出置零，相当于每次都在训练一个不同的「子网络」；测试时关闭丢弃，用完整网络并对权重做相应缩放，近似这些子网络的平均。这样神经元不能过度依赖彼此，从而减轻过拟合（在训练集上表现好、换新数据就变差）。它常和权重衰减、数据增强、早停一起用，Transformer 里常见的丢弃概率是 0.1。机器人演示数据往往只有几十到几百条，容易过拟合，dropout 是常见配置。","example":"ACT（Action Chunking with Transformers）官方代码中 Transformer 的 dropout 默认为 0.1；强化学习算法 DroQ 在 Q 网络里加入 dropout 和层归一化，用小集成达到与大集成方法 REDQ 相当的样本效率，计算量却接近 SAC。","related":["正则化","过拟合","早停","数据增强","归一化层（层归一化 / RMSNorm / 批归一化）"]},{"id":"early-stopping","category":"training","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Early stopping","url":"https://en.wikipedia.org/wiki/Early_stopping"},{"title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)","url":"https://arxiv.org/abs/2108.03298"},{"title":"Google Machine Learning Glossary","url":"https://developers.google.com/machine-learning/glossary"}],"as_of":"","related_ids":["overfitting","training-validation-test-set","checkpoint","regularization","epoch","early-termination"],"name":"早停","alt":"Early Stopping","abbr":"","aliases":["提前停止"],"one_liner":"验证集表现不再变好时就停止训练，取表现最好的那一版模型。","explanation":"早停是最常用的正则化手段之一。训练时定期在验证集（不参与训练、专门用来挑模型的数据）上评估：训练损失还在降、验证损失却开始回升，说明模型开始过拟合，这时停止训练并退回验证表现最好的检查点。实践中常设一个「耐心值」，连续若干轮没有改善才停，避免被波动误导。机器人模仿学习要特别注意：验证损失低不等于真机成功率高，robomimic 的研究指出训练目标和评测目标不一致，停在哪一步对结果影响很大，很多工作会存多个检查点，再用仿真或真机推演来挑。注意别和强化学习里的「提前终止」（回合中摔倒等情况就结束该回合）混淆。","example":"假设训练一个抓取策略，每个 epoch 算一次验证集动作误差：第 30 轮最低，之后连续 10 轮都没再降，于是停止训练，取第 30 轮的检查点。","related":["过拟合","训练集 / 验证集 / 测试集","检查点","正则化","训练轮次","提前终止"]},{"id":"vanishing-exploding-gradients","category":"training","sec":1,"tier":2,"sources":[{"title":"Dive into Deep Learning: Numerical Stability and Initialization","url":"https://d2l.ai/chapter_multilayer-perceptrons/numerical-stability-and-init.html"},{"title":"On the difficulty of training Recurrent Neural Networks (Pascanu et al., arXiv 1211.5063)","url":"https://arxiv.org/abs/1211.5063"}],"as_of":"","related_ids":["backpropagation","gradient-clipping","residual-network","activation-function","normalization-layers","long-short-term-memory-gated-recurrent-unit"],"name":"梯度消失 / 梯度爆炸","alt":"Vanishing / Exploding Gradients","abbr":"","aliases":["梯度消失","梯度爆炸","梯度弥散","Vanishing Gradient","Exploding Gradient"],"one_liner":"反向传播时梯度逐层连乘后变得极小或极大，导致深层网络难以训练。","explanation":"深度网络靠反向传播算梯度，靠前层的梯度是后面许多层导数（矩阵）的连乘。这些因子普遍偏小，梯度传到浅层就趋近于零，前面的层几乎学不动，叫梯度消失；普遍偏大则会指数级增长，一步更新就让参数发散、损失变成 NaN，叫梯度爆炸。Bengio 等人 1994 年分析过循环神经网络中的这一问题，Pascanu 等人 2013 年提出用梯度范数裁剪应对爆炸。常用对策还有：ReLU 等不易饱和的激活函数（sigmoid 输入过大或过小时导数都接近零）、Xavier/He 初始化、残差连接、归一化层，以及 LSTM 的门控结构。训练 VLA、扩散策略时常设的梯度裁剪也是为了防止这类数值不稳定。","example":"用 sigmoid 激活堆几十层全连接网络，前几层的梯度往往接近 0、参数几乎不动；换成 ReLU 并加上残差连接后，同样深度的网络就能正常训练。","related":["反向传播","梯度裁剪","残差网络","激活函数","归一化层（层归一化 / RMSNorm / 批归一化）","长短期记忆网络 / 门控循环单元"]},{"id":"gradient-clipping","category":"training","sec":1,"tier":3,"sources":[{"title":"On the difficulty of training Recurrent Neural Networks (arXiv 1211.5063)","url":"https://arxiv.org/abs/1211.5063"},{"title":"torch.nn.utils.clip_grad_norm_ (PyTorch 文档)","url":"https://docs.pytorch.org/docs/main/generated/torch.nn.utils.clip_grad_norm_.html"}],"as_of":"","related_ids":["vanishing-exploding-gradients","learning-rate","optimizer","backpropagation","recurrent-neural-network","proximal-policy-optimization"],"name":"梯度裁剪","alt":"Gradient Clipping","abbr":"","aliases":["梯度范数裁剪","Gradient Norm Clipping"],"one_liner":"梯度太大时按比例缩小到阈值以内，防止一步更新把模型带崩。","explanation":"训练中偶尔会出现梯度爆炸：某一步梯度特别大，参数被推得太远，损失突然飙升甚至变成 NaN。梯度裁剪在优化器更新前检查梯度大小，超过阈值就把它缩小。最常用的是按范数裁剪：把所有参数的梯度看成一个长向量算总范数，超过 max_norm 就整体乘以 max_norm 除以总范数，方向不变、只缩长度；另一种是按值裁剪，把每个分量截断到固定区间。2013 年 Pascanu、Mikolov、Bengio 分析循环神经网络的梯度爆炸时提出了梯度范数裁剪。现在训练 Transformer、扩散策略时基本是默认配置，PPO 的常见实现一般也带这一项。","example":"PyTorch 中在 loss.backward() 之后、optimizer.step() 之前调用 torch.nn.utils.clip_grad_norm_(model.parameters(), max_norm=1.0)。","related":["梯度消失 / 梯度爆炸","学习率","优化器","反向传播","循环神经网络","近端策略优化"]},{"id":"stop-gradient","category":"training","sec":1,"tier":3,"sources":[{"title":"Chen & He 2020: Exploring Simple Siamese Representation Learning (SimSiam)","url":"https://arxiv.org/abs/2011.10566"},{"title":"Driess et al. 2025: Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","url":"https://arxiv.org/abs/2505.23705"}],"as_of":"2025-05","related_ids":["knowledge-insulation","target-network","representation-collapse","backbone-freezing","backpropagation","vector-quantized-variational-autoencoder"],"name":"梯度阻断","alt":"Stop-Gradient","abbr":"","aliases":["停止梯度","stop-grad","detach","梯度截断","sg(·)"],"one_liner":"前向照常计算，反向传播时不让梯度从某个量往回传。","explanation":"梯度阻断是深度学习里的一个基本操作：某个量在前向计算中照常使用，但反向传播时被当作常数，梯度不经过它流向更早的参数。论文里常写作 sg(·)，PyTorch 里用 .detach()，JAX 里用 jax.lax.stop_gradient。它用途很多：强化学习里阻断目标值的梯度来稳定时序差分学习；VQ-VAE 用它让码本和编码器分开更新；SimSiam 发现它是自监督学习中防止表征坍缩的关键。在 VLA 中，Physical Intelligence 2025 年的知识隔离阻断了动作专家流向 VLM 骨干的梯度，让新初始化的动作专家不破坏预训练知识，骨干改从离散化动作 token 学习。注意它和限制梯度大小的梯度裁剪不是一回事。","example":"知识隔离训练中，连续动作专家读取 VLM 骨干的特征来生成动作，但它的损失不回传到骨干；骨干只通过离散化动作 token 的下一个 token 预测损失来适应机器人数据。","related":["知识隔离","目标网络","表征坍缩","冻结骨干网络","反向传播","向量量化变分自编码器"]},{"id":"exponential-moving-average","category":"training","sec":1,"tier":3,"sources":[{"title":"Denoising Diffusion Probabilistic Models (arXiv:2006.11239)","url":"https://arxiv.org/abs/2006.11239"},{"title":"diffusion_policy: train_diffusion_unet_image_workspace.yaml","url":"https://github.com/real-stanford/diffusion_policy/blob/main/diffusion_policy/config/train_diffusion_unet_image_workspace.yaml"},{"title":"OpenAI Spinning Up: Soft Actor-Critic","url":"https://spinningup.openai.com/en/latest/algorithms/sac.html"}],"as_of":"","related_ids":["target-network","diffusion-policy","checkpoint","optimizer","denoising-diffusion-probabilistic-model","soft-actor-critic"],"name":"指数移动平均","alt":"Exponential Moving Average","abbr":"EMA","aliases":["指数滑动平均","EMA 权重","Polyak 平均","Polyak Averaging"],"one_liner":"对历史值按指数衰减加权求平均，常用来得到更平滑稳定的模型权重。","explanation":"EMA 是一种加权平均，每步按「平均值 ← β × 平均值 +（1 − β）× 当前值」更新，β 叫衰减率，越接近 1，平均的时间窗越长。深度学习里最常见的用法是维护一份模型权重的 EMA 副本：训练照常更新原权重，评测和部署时改用更平滑的 EMA 权重，通常更稳定；扩散模型尤其依赖它，DDPM 论文用的衰减率是 0.9999。强化学习里目标网络的软更新（Polyak 平均）也是 EMA，让 Q 值目标变化更平稳。Adam 优化器对梯度一阶、二阶矩的估计同样是 EMA。","example":"扩散策略（Diffusion Policy）官方代码默认开启 EMA，衰减率随训练从 0 逐步升到上限 0.9999，推演评测时使用 EMA 模型而不是原始权重。","related":["目标网络","扩散策略","检查点","优化器","去噪扩散概率模型","软演员-评论家"]},{"id":"mean-squared-error","category":"training","sec":2,"tier":2,"sources":[{"title":"Linear regression: Loss（Google Machine Learning Crash Course）","url":"https://developers.google.com/machine-learning/crash-course/linear-regression/loss"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["l1-loss","loss-function","maximum-likelihood-estimation","action-multimodality","continuous-action-regression","denoising-loss"],"name":"均方误差","alt":"Mean Squared Error","abbr":"MSE","aliases":["L2 损失","平方误差损失"],"one_liner":"预测值与真值之差的平方再取平均，是最常用的回归损失。","explanation":"均方误差把每个样本的预测值与真值之差平方后取平均，不取平均的平方和常叫 L2 损失。它处处可导，误差越小梯度越小，优化平稳，是回归任务的默认损失；从概率角度看，最小化 MSE 等价于假设误差服从高斯分布时的最大似然估计，最优解是条件均值。平方会放大大误差，所以它比 L1 损失更容易被离群点带偏。在机器人模仿学习里它有个出名的问题：同一场景下演示者有时从左绕、有时从右绕，用 MSE 直接回归动作会学成两者的平均，走出一条哪边都不是的中间路线，这就是动作多峰性问题，也是扩散策略、流匹配等生成式策略流行的原因之一。扩散模型的训练目标本身也是 MSE，只是回归对象换成了加进去的噪声。","example":"扩散策略（Diffusion Policy）训练时，把随机噪声加到专家动作序列上，让网络预测加进去的噪声，损失就是预测噪声与真实噪声之间的 MSE；论文指出最小化这个损失也在最小化数据分布与模型分布之间 KL 散度的变分下界。","related":["L1 损失","损失函数","最大似然估计 / 负对数似然","动作多峰性","连续动作回归","去噪损失"]},{"id":"l1-loss","category":"training","sec":2,"tier":2,"sources":[{"title":"Linear regression: Loss（Google Machine Learning Crash Course）","url":"https://developers.google.com/machine-learning/crash-course/linear-regression/loss"},{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"},{"title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT, arXiv 2502.19645)","url":"https://arxiv.org/abs/2502.19645"}],"as_of":"","related_ids":["mean-squared-error","loss-function","continuous-action-regression","action-chunking-with-transformers","openvla-oft","action-chunking"],"name":"L1 损失","alt":"L1 Loss","abbr":"","aliases":["平均绝对误差","MAE","绝对值损失"],"one_liner":"用预测值与真值之差的绝对值来计算误差的损失函数。","explanation":"L1 损失把每个预测值与真值之差取绝对值再求和，按样本取平均时叫平均绝对误差（MAE）。和把误差平方的 L2 损失（均方误差）相比，它对大误差是线性惩罚而不是平方放大，因此受离群点影响更小；但它的梯度大小恒定，快到目标时不会自动变小。从概率角度看，最小化 L1 损失相当于假设误差服从拉普拉斯分布做最大似然估计，最优解趋向中位数而不是均值。在具身智能里，L1 常用于连续动作回归：ACT 用 L1 做动作序列重建，作者称它比更常见的 L2 能更精确地建模动作序列；OpenVLA-OFT 也改用 L1 回归直接输出连续动作。","example":"OpenVLA-OFT 把 OpenVLA 逐个生成离散动作 token 的方式，换成并行解码、动作分块加 L1 回归输出连续动作，动作生成吞吐量提高 26 倍，LIBERO 四个任务集的平均成功率从 76.5% 提到 97.1%。","related":["均方误差","损失函数","连续动作回归","ACT","OpenVLA-OFT","动作分块"]},{"id":"cross-entropy","category":"training","sec":2,"tier":2,"sources":[{"title":"Google Machine Learning Glossary: cross-entropy","url":"https://developers.google.com/machine-learning/glossary"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/html/2406.09246"}],"as_of":"","related_ids":["loss-function","next-token-prediction","action-binning","mean-squared-error","kullback-leibler-divergence","maximum-likelihood-estimation"],"name":"交叉熵","alt":"Cross-Entropy","abbr":"CE","aliases":["交叉熵损失","Cross-Entropy Loss","对数损失","Log Loss"],"one_liner":"衡量模型预测的概率分布离正确答案有多远，是分类任务最常用的损失。","explanation":"交叉熵来自信息论，用来衡量两个概率分布的差异。深度学习里把它当分类损失：模型对每个类别输出概率（通常经 Softmax 归一化），正确类别的预测概率越低，损失越大；标签只有一个正确类别时，它就等于负对数似然（NLL）。大语言模型的下一个 token 预测，就是在整个词表上算交叉熵。具身里，把连续动作离散成 token 的 VLA（如 RT-2、OpenVLA）同样用交叉熵训练动作输出；直接回归连续动作的策略多用均方误差或 L1 损失，扩散和流匹配策略则用各自的去噪损失。","example":"OpenVLA 把每个动作维度按训练数据的 1% 到 99% 分位区间均分成 256 个桶，用它们覆盖 Llama 词表里最少用的 256 个 token，训练时只在动作 token 上计算交叉熵损失。","related":["损失函数","下一个 token 预测","分箱离散化","均方误差","KL 散度","最大似然估计 / 负对数似然"]},{"id":"maximum-likelihood-estimation","category":"training","sec":2,"tier":2,"sources":[{"title":"Maximum likelihood estimation（Wikipedia）","url":"https://en.wikipedia.org/wiki/Maximum_likelihood_estimation"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/abs/2406.09246"}],"as_of":"","related_ids":["cross-entropy","kullback-leibler-divergence","mean-squared-error","behavior-cloning","loss-function","gaussian-policy"],"name":"最大似然估计 / 负对数似然","alt":"Maximum Likelihood Estimation / Negative Log-Likelihood","abbr":"MLE / NLL","aliases":["极大似然估计","对数似然","NLL 损失"],"one_liner":"找一组参数让观测数据出现的概率最大；取负对数后就成了要最小化的损失。","explanation":"最大似然估计是统计学最基本的参数估计方法：假设数据来自某个带参数的概率模型，选出让已观测数据出现概率（似然）最大的那组参数。计算时取对数把连乘变成求和，再加负号变成最小化问题，这就是深度学习里的负对数似然损失。许多常见损失都是它的特例：分类用的交叉熵是类别分布下的负对数似然；误差服从高斯分布时，最大似然等价于最小化均方误差；误差服从拉普拉斯分布时对应 L1 损失。它也等价于最小化数据分布与模型分布之间的 KL 散度。在具身智能里，行为克隆本质上就是对专家动作做最大似然估计：把动作离散化的 VLA 用交叉熵预测动作 token，高斯策略则直接最小化动作的负对数似然。","example":"OpenVLA 把每个动作维度在训练数据 1% 到 99% 分位数之间均匀分成 256 个箱，再用标准的下一个 token 预测目标、只在动作 token 上算交叉熵，这就是在对专家动作做最大似然估计。","related":["交叉熵","KL 散度","均方误差","行为克隆","损失函数","高斯策略"]},{"id":"kullback-leibler-divergence","category":"training","sec":2,"tier":2,"sources":[{"title":"Kullback–Leibler divergence（Wikipedia）","url":"https://en.wikipedia.org/wiki/Kullback%E2%80%93Leibler_divergence"},{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["cross-entropy","kl-regularization","variational-autoencoder","proximal-policy-optimization","knowledge-distillation","maximum-likelihood-estimation"],"name":"KL 散度","alt":"Kullback-Leibler Divergence","abbr":"KL","aliases":["相对熵","KL divergence","I 散度"],"one_liner":"衡量一个概率分布偏离另一个分布有多远的量，而且不对称。","explanation":"KL 散度由 Solomon Kullback 和 Richard Leibler 在 1951 年提出，离散情形下 D_KL(P‖Q)=Σ P(x)·log(P(x)/Q(x))，表示用分布 Q 去近似真实分布 P 时多付出的信息代价。它总是非负，只有两个分布相同时才为 0；但它不对称，D_KL(P‖Q) 一般不等于 D_KL(Q‖P)，所以不是严格意义上的距离。机器学习里它随处可见：交叉熵等于 KL 散度加上 P 自身的熵，最小化交叉熵就是在最小化 KL；变分自编码器用 KL 项把隐变量拉向标准正态分布；PPO、RLHF 和部分离线强化学习用 KL 惩罚约束新策略别离参考策略太远；知识蒸馏也用它让学生贴近教师。","example":"ACT 的训练损失是动作重建误差加上 β 倍的 KL 项（论文取 β=10），KL 项约束条件变分自编码器编码出的风格变量 z 贴近标准正态分布，推理时直接把 z 设为先验均值 0。","related":["交叉熵","KL 正则化","变分自编码器","近端策略优化","知识蒸馏","最大似然估计 / 负对数似然"]},{"id":"next-token-prediction","category":"training","sec":2,"tier":2,"sources":[{"title":"Improving Language Understanding by Generative Pre-Training (GPT-1, OpenAI 2018)","url":"https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model","url":"https://arxiv.org/html/2406.09246"},{"title":"Humanoid Locomotion as Next Token Prediction","url":"https://arxiv.org/abs/2402.19469"}],"as_of":"","related_ids":["autoregressive-decoding","action-tokenizer","action-binning","teacher-forcing","cross-entropy","vision-language-action-model"],"name":"下一个 token 预测","alt":"Next-Token Prediction","abbr":"NTP","aliases":["自回归预训练","自回归语言建模","Causal Language Modeling"],"one_liner":"根据前面所有 token，预测序列里下一个 token 的训练目标。","explanation":"GPT 系列大语言模型的核心训练目标：把文本切成 token（词元），模型读入前面的 token，输出下一个 token 的概率分布，用交叉熵损失把真实下一个 token 的概率往上推。它只需要原始文本、不需要人工标注，所以能在海量数据上预训练，OpenAI 2018 年的 GPT-1 就用它做生成式预训练。推理时模型一个接一个生成 token，叫自回归解码。具身智能里，RT-2、OpenVLA 把连续动作离散成 token，和文字放进同一序列，沿用这个目标训练 VLA；伯克利团队 2024 年还把人形机器人行走建模成下一个 token 预测。代价是离散化有精度损失、逐个生成较慢，所以也有模型改用扩散或流匹配动作头。","example":"OpenVLA 把每个动作维度按训练数据分布切成 256 个区间，用 Llama 词表里最少用的 256 个 token 表示，再用标准的下一个 token 预测训练，只在动作 token 上算交叉熵。","related":["自回归解码","动作分词器","分箱离散化","教师强制","交叉熵","视觉-语言-动作模型"]},{"id":"teacher-forcing","category":"training","sec":2,"tier":3,"sources":[{"title":"Wikipedia: Teacher forcing","url":"https://en.wikipedia.org/wiki/Teacher_forcing"},{"title":"Bengio et al. 2015: Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks","url":"https://arxiv.org/abs/1506.03099"},{"title":"Huang et al. 2025: Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","url":"https://arxiv.org/abs/2506.08009"}],"as_of":"","related_ids":["next-token-prediction","autoregressive-decoding","exposure-bias","self-forcing","diffusion-forcing","compounding-error"],"name":"教师强制","alt":"Teacher Forcing","abbr":"","aliases":["教师强迫"],"one_liner":"训练序列模型时每一步都喂真实的上一步，而不是模型自己的预测。","explanation":"教师强制是训练自回归序列模型的标准做法，1989 年由 Williams 和 Zipser 命名：预测第 t 步时，输入用数据里真实的前 t−1 步，而不是模型自己生成的结果。这样各步能并行算损失，训练快且稳，大语言模型和 RT-2、OpenVLA 这类把动作离散成 token 的 VLA 都这样训练。代价是训练和推理不一致：推理时模型只能接着自己的输出往下写，早期小错会累积，这叫曝光偏差。计划采样（2015）在训练中逐步混入模型自己的预测；视频生成里的 Self Forcing（2025）则在训练时直接自回归展开。","example":"训练 OpenVLA 时，每步动作被离散成 7 个 token，第 k 个 token 以真实的前 k−1 个 token 为条件来预测；部署时则只能接在模型自己刚生成的 token 后面继续解码。","related":["下一个 token 预测","自回归解码","曝光偏差（自回归误差累积）","自强制","扩散强制","复合误差"]},{"id":"self-forcing","category":"training","sec":2,"tier":3,"sources":[{"title":"Huang et al. 2025: Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","url":"https://arxiv.org/abs/2506.08009"},{"title":"Self Forcing 项目页","url":"https://self-forcing.github.io/"},{"title":"GitHub: guandeh17/Self-Forcing","url":"https://github.com/guandeh17/Self-Forcing"}],"as_of":"2025-11","related_ids":["teacher-forcing","diffusion-forcing","exposure-bias","autoregressive-video-generation","key-value-cache","diffusion-step-distillation"],"name":"自强制","alt":"Self Forcing","abbr":"","aliases":["自强制训练","Self-Forcing"],"one_liner":"训练时就让视频模型接着自己生成的画面往下生成，消除训练与推理的差异。","explanation":"Self Forcing 是 Adobe Research 与得克萨斯大学奥斯汀分校的 Xun Huang 等人 2025 年 6 月提出的自回归视频扩散训练方法（NeurIPS 2025 Spotlight）。自回归视频模型一段段往后生成，以往用教师强制（以真实前文为条件）或扩散强制（以加噪的真实前文为条件）训练，推理时却只能接自己生成的、带误差的前文，这种不一致叫曝光偏差，会让长视频越生成越差。Self Forcing 在训练时就按推理方式用 KV 缓存自回归展开，以自己生成的帧为条件，再对整段视频算整体损失。它基于 Wan2.1-T2V-1.3B，在单卡上做到亚秒级延迟的实时流式生成，这对需要边生成边响应动作的交互式世界模型很有用。","example":"据项目页，Self Forcing 模型在单张 H100 上以约 16 帧/秒生成 480P 视频，首帧延迟约 0.8 秒，在单张 RTX 4090 上也能实时流式生成。","related":["教师强制","扩散强制","曝光偏差（自回归误差累积）","自回归视频生成","KV 缓存","扩散步数蒸馏"]},{"id":"evidence-lower-bound","category":"training","sec":2,"tier":3,"sources":[{"title":"Auto-Encoding Variational Bayes (arXiv:1312.6114)","url":"https://arxiv.org/abs/1312.6114"},{"title":"Denoising Diffusion Probabilistic Models (arXiv:2006.11239)","url":"https://arxiv.org/abs/2006.11239"},{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv:2304.13705)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["variational-autoencoder","conditional-variational-autoencoder","kullback-leibler-divergence","denoising-diffusion-probabilistic-model","maximum-likelihood-estimation","action-chunking-with-transformers"],"name":"证据下界","alt":"Evidence Lower Bound","abbr":"ELBO","aliases":["变分下界","Variational Lower Bound","VLB"],"one_liner":"数据对数似然的一个可计算下界，VAE 和扩散模型都靠最大化它来训练。","explanation":"生成模型想最大化数据的对数似然 log p(x)（也叫「证据」），但含隐变量时通常算不出来。ELBO 引入近似后验 q(z|x)，得到 log p(x) ≥ E_q[log p(x|z)] − KL(q(z|x) ‖ p(z))：第一项衡量重建质量，第二项让编码分布贴近先验，两边差距正是 q 与真实后验的 KL 散度。Kingma 与 Welling 2013 年的 VAE 论文用重参数化技巧让 ELBO 能直接用梯度下降优化；Ho 等人 2020 年的 DDPM 也从变分下界出发，化简加权后得到常用的预测噪声损失。机器人里的 ACT 按条件 VAE 训练。","example":"ACT 的训练损失 = 动作块重建误差 + β × 编码分布与标准正态分布之间的 KL 散度，也就是带权重 β 的 ELBO 形式。","related":["变分自编码器","条件变分自编码器","KL 散度","去噪扩散概率模型","最大似然估计 / 负对数似然","ACT"]},{"id":"denoising-loss","category":"training","sec":2,"tier":3,"sources":[{"title":"Denoising Diffusion Probabilistic Models (arXiv 2006.11239)","url":"https://arxiv.org/abs/2006.11239"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["diffusion-model","denoising-diffusion-probabilistic-model","noise-schedule","prediction-target-parameterization","flow-matching-loss","diffusion-policy"],"name":"去噪损失","alt":"Denoising Loss (Diffusion Loss)","abbr":"","aliases":["扩散损失","噪声预测损失","ε 预测损失","L_simple"],"one_liner":"扩散模型的训练目标：给干净数据加噪，让网络预测出加进去的噪声。","explanation":"去噪损失是训练扩散模型用的损失函数，最常见的形式来自 Ho、Jain、Abbeel 2020 年的 DDPM 论文：随机选一个加噪步 t，按噪声调度把高斯噪声混进真实样本，让网络根据带噪样本和 t 预测所加的噪声，损失就是预测噪声与真实噪声的均方误差。论文称之为简化目标 L_simple，它是变分下界的一种加权形式，并与去噪分数匹配相对应，实践中生成质量比直接优化完整下界更好。网络也可以改为预测干净样本 x0 或速度 v，即不同的预测目标参数化。机器人里的扩散策略（Diffusion Policy）把动作序列当作要生成的数据、以观测为条件，用同样的噪声预测均方误差训练；π0 这类流匹配模型用的是形式相近的流匹配损失。","example":"训练扩散策略时，从演示中取一段未来动作序列，随机选一个噪声步加噪；网络看着当前相机画面和带噪动作，输出它认为混进去的噪声，与真实噪声算均方误差后反向传播。","related":["扩散模型","去噪扩散概率模型","噪声调度","预测目标参数化（ε / x0 / v 预测）","流匹配损失","扩散策略"]},{"id":"score-matching","category":"training","sec":2,"tier":3,"sources":[{"title":"Hyvärinen 2005: Estimation of Non-Normalized Statistical Models by Score Matching (JMLR)","url":"https://www.jmlr.org/papers/v6/hyvarinen05a.html"},{"title":"Song & Ermon 2019: Generative Modeling by Estimating Gradients of the Data Distribution","url":"https://arxiv.org/abs/1907.05600"},{"title":"Song et al. 2020: Score-Based Generative Modeling through Stochastic Differential Equations","url":"https://arxiv.org/abs/2011.13456"}],"as_of":"","related_ids":["diffusion-model","denoising-diffusion-probabilistic-model","denoising-loss","flow-matching","energy-based-model","prediction-target-parameterization"],"name":"分数匹配","alt":"Score Matching (Score Function)","abbr":"","aliases":["得分匹配","分数函数","Score Function","去噪分数匹配","Denoising Score Matching"],"one_liner":"训练网络估计数据分布对数密度的梯度（分数），不必算归一化常数。","explanation":"分数（score）指概率密度取对数后对输入的梯度 ∇x log p(x)，它指向「数据更可能出现」的方向。Hyvärinen 2005 年提出分数匹配：让模型的分数去拟合数据的分数，好处是绕开能量模型里难算的归一化常数。后来的去噪分数匹配把问题变成「给数据加噪，再学怎么去噪」。2019 年 Song 和 Ermon 用多级噪声下的分数估计加朗之万动力学采样做图像生成；2020 年 Song 等人用随机微分方程统一了分数模型与扩散模型，反向去噪过程只依赖各噪声水平下的分数。DDPM 预测噪声、流匹配预测速度，都可以换算成分数估计，所以扩散策略等生成式机器人策略的训练，背后就是分数匹配。","example":"扩散策略训练时给专家动作加上不同强度的高斯噪声，让网络预测所加的噪声；把这个预测除以噪声标准差再取负号，就是对加噪动作分布的分数估计。","related":["扩散模型","去噪扩散概率模型","去噪损失","流匹配","能量模型","预测目标参数化（ε / x0 / v 预测）"]},{"id":"flow-matching-loss","category":"training","sec":2,"tier":3,"sources":[{"title":"Flow Matching for Generative Modeling (arXiv:2210.02747)","url":"https://arxiv.org/abs/2210.02747"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"","related_ids":["flow-matching","velocity-field","rectified-flow","mean-squared-error","denoising-loss","pi0"],"name":"流匹配损失","alt":"Flow Matching Loss","abbr":"","aliases":["速度场回归损失","条件流匹配损失","Conditional Flow Matching Loss","CFM Loss"],"one_liner":"让网络预测从噪声指向真实数据的速度方向，用均方误差来训练。","explanation":"流匹配由 Lipman 等人 2022 年提出，把「噪声逐渐变成数据」看成沿一条路径的连续流动，网络学习路径上每一点的速度场。训练时不用模拟整条轨迹：随机取一个时间 τ，把真实样本和高斯噪声线性插值得到中间点，再用均方误差让网络输出的速度去拟合这条直线路径的方向（真实样本减噪声），这就是流匹配损失。它和扩散模型的去噪损失形式很像，但路径更直，采样步数可以更少。推理时从纯噪声出发，用欧拉法沿预测的速度积分几步就得到样本。π0 系列 VLA 就用它训练动作专家，直接生成连续的动作块。","example":"π0 训练时从偏向高噪声端的 Beta 分布里采样 τ，构造带噪动作 τ·A + (1 − τ)·ε，让动作专家回归 A − ε；推理时从纯噪声出发，用 10 步欧拉积分生成动作块。","related":["流匹配","速度场","整流流","均方误差","去噪损失","π0"]},{"id":"auxiliary-loss-auxiliary-task","category":"training","sec":2,"tier":3,"sources":[{"title":"Reinforcement Learning with Unsupervised Auxiliary Tasks (UNREAL, arXiv 1611.05397)","url":"https://arxiv.org/abs/1611.05397"},{"title":"Learning to Navigate in Complex Environments (arXiv 1611.03673)","url":"https://arxiv.org/abs/1611.03673"}],"as_of":"","related_ids":["loss-function","representation-learning","multi-task-learning","reinforcement-learning","sparse-reward","backbone-network"],"name":"辅助损失 / 辅助任务","alt":"Auxiliary Loss / Auxiliary Task","abbr":"","aliases":["辅助目标","Auxiliary Objective"],"one_liner":"主训练目标之外额外加的预测任务和损失项，帮模型学到更好的特征。","explanation":"辅助任务是指在主训练目标（比如输出动作、最大化奖励）之外，让同一个网络再做一些相关预测，每个预测对应一项辅助损失，按权重加进总损失一起优化。它们和主任务共用骨干网络（负责提取特征的主干部分），多出来的监督信号能让特征学得更快、更稳；推理时这些额外分支通常直接丢掉。强化学习里奖励稀疏、学习信号弱，辅助任务尤其有用：DeepMind 2016 年的 UNREAL 智能体加了像素控制、奖励预测、价值回放三类辅助任务，在 3D 迷宫 Labyrinth 上学习速度约快 10 倍。机器人模仿学习和 VLA 里也常让模型顺带预测未来画面、物体位置或子任务文字。辅助损失权重过大会和主任务争抢模型容量，需要调节。","example":"DeepMind 2016 年的导航智能体在 3D 迷宫里学找目标时，同一网络还要预测画面深度、判断自己是否回到了走过的位置（回环分类）；这两项辅助损失明显提升了导航表现。","related":["损失函数","表征学习","多任务学习","强化学习","稀疏奖励","骨干网络"]},{"id":"behavior-cloning","category":"training","sec":3,"tier":1,"sources":[{"title":"Wikipedia: Imitation learning","url":"https://en.wikipedia.org/wiki/Imitation_learning"},{"title":"Pomerleau 1988: ALVINN: An Autonomous Land Vehicle in a Neural Network (NeurIPS)","url":"https://proceedings.neurips.cc/paper/1988/hash/812b4ba287f5ee0bc9d43bbf5bbe87fb-Abstract.html"},{"title":"Zhao et al. 2023: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["imitation-learning","compounding-error","dagger","demonstration-data","action-chunking-with-transformers","diffusion-policy"],"name":"行为克隆","alt":"Behavior Cloning","abbr":"BC","aliases":["行为复制","Behavioral Cloning","Behavioural Cloning"],"one_liner":"把专家演示当标注数据，用监督学习直接学「看到什么就做什么」。","explanation":"行为克隆是最基础的模仿学习方法：收集大量「观测-动作」对，比如人遥操作机器人时记录的相机画面和关节指令，把观测当输入、专家动作当标签，用监督学习训练策略网络去拟合。1988 年 Pomerleau 的 ALVINN 用神经网络从图像直接输出行驶方向，是早期代表。它简单稳定，不需要设计奖励函数，ACT、扩散策略和多数 VLA 模型的主体训练都属于行为克隆。主要缺点是复合误差：策略一旦偏离演示轨迹，就进入训练时没见过的状态，小错越积越大；DAgger、纠偏数据和强化学习微调都是针对这一点的补救。","example":"ACT 只用约 10 分钟、50 条人类遥操作演示做行为克隆，就让低成本双臂机器人以 80%–90% 的成功率完成打开半透明调料杯盖、往遥控器里装电池等精细任务。","related":["模仿学习","复合误差","DAgger（数据集聚合）","演示数据","ACT","扩散策略"]},{"id":"compounding-error","category":"training","sec":3,"tier":2,"sources":[{"title":"Efficient Reductions for Imitation Learning (Ross & Bagnell, AISTATS 2010)","url":"https://proceedings.mlr.press/v9/ross10a.html"},{"title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (AISTATS 2011)","url":"https://proceedings.mlr.press/v15/ross11a/ross11a.pdf"},{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["distribution-shift","dagger","behavior-cloning","action-chunking","recovery-and-correction-data","exposure-bias"],"name":"复合误差","alt":"Compounding Error","abbr":"","aliases":["误差累积","累积误差","误差复合","Error Compounding"],"one_liner":"模仿策略每步的小偏差不断叠加，把机器人带进没见过的状态而失败。","explanation":"复合误差是行为克隆（用监督学习直接模仿专家动作）的核心问题。策略每一步都有一点误差，一旦偏离专家轨迹，就会进入训练数据里没出现过的状态，在那里更容易犯错，偏差越滚越大。Ross 和 Bagnell 2010 年的分析指出：每步出错率为 ε、任务长 T 步时，纯监督模仿比专家多出的代价最坏可达 T²ε 量级，随任务长度二次增长。其根源是协变量偏移。常见缓解办法有：DAgger 让专家在策略自己走到的状态上补标注；专门采集纠偏数据；ACT 用动作分块一次预测一段动作，减少需要决策的步数。","example":"ACT 论文指出，在高精度的双臂精细操作中，模仿策略的误差会随时间累积，于是改为一次预测一整段动作序列，只用 10 分钟人类演示就在多个任务上达到 80%–90% 成功率。","related":["协变量偏移 / 分布偏移","DAgger（数据集聚合）","行为克隆","动作分块","纠偏数据","曝光偏差（自回归误差累积）"]},{"id":"dagger","category":"training","sec":3,"tier":2,"sources":[{"title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (PMLR v15)","url":"https://proceedings.mlr.press/v15/ross11a.html"},{"title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (PDF, 含 DAgger 算法与 T²ε 分析)","url":"https://proceedings.mlr.press/v15/ross11a/ross11a.pdf"}],"as_of":"","related_ids":["compounding-error","distribution-shift","behavior-cloning","human-gated-dagger","interactive-imitation-learning","human-in-the-loop"],"name":"DAgger（数据集聚合）","alt":"Dataset Aggregation","abbr":"DAgger","aliases":["数据集聚合","DAGGER"],"one_liner":"让策略自己去跑，专家为它走到的状态补标正确动作，合并数据后重训。","explanation":"DAgger 是 Ross、Gordon 和 Bagnell 在 AISTATS 2011 提出的交互式模仿学习算法。它针对行为克隆的复合误差：只在专家轨迹上训练的策略，一偏离就不知所措。做法是多轮迭代：先用专家数据训练初始策略；让当前策略去执行，记录它实际遇到的状态；请专家为这些状态标注「这里该怎么做」；把新标注并入历史数据集，重新训练，如此反复。论文证明这样能把误差随任务长度的增长从二次降到近似线性。缺点是专家要随时标注，真机上常用人在旁监控、必要时接管的 HG-DAgger 等变体。","example":"原论文在赛车游戏 Super Tux Kart 里学转向、在 Super Mario Bros. 里学通关，DAgger 的表现都好于只用专家演示做监督学习的方法。","related":["复合误差","协变量偏移 / 分布偏移","行为克隆","人工门控 DAgger","交互式模仿学习","人在回路"]},{"id":"causal-confusion","category":"training","sec":3,"tier":3,"sources":[{"title":"Causal Confusion in Imitation Learning (arXiv 1905.11979)","url":"https://arxiv.org/abs/1905.11979"}],"as_of":"","related_ids":["behavior-cloning","imitation-learning","distribution-shift","compounding-error","dagger","overfitting"],"name":"因果混淆","alt":"Causal Confusion (Causal Misidentification)","abbr":"","aliases":["捷径学习（模仿学习中）","因果误识别","Causal Misidentification"],"one_liner":"模仿学习把和专家动作相关、但不是原因的线索当成依据，部署时出错。","explanation":"因果混淆由 de Haan、Jayaraman、Levine 在 NeurIPS 2019 论文中系统提出。行为克隆把模仿当成监督学习，看观测直接回归专家动作，只学相关性，不区分谁是因、谁是果；如果训练数据里某个线索和专家动作高度相关，模型就会依赖它。训练时这类线索一直在，损失很低；部署时策略自己走出的状态和专家不同（分布偏移），线索不再可靠，策略就出错。反直觉的症状是：给模型更多输入信息，表现反而更差，输入里带历史信息时尤其常见。论文提出用有针对性的干预，即在环境里试执行或询问专家，来找出正确的因果结构，效果优于 DAgger 等基线。它提醒我们，机器人策略的输入不是越多越好。","example":"论文里的驾驶例子：模型 A 看完整画面（含仪表盘），模型 B 的仪表盘被遮住。两者训练损失都很低，上路后 B 开得好、A 不行，因为仪表盘上有踩刹车就会亮的指示灯，A 学成了「灯亮才刹车」，把刹车的结果当成了原因。","related":["行为克隆","模仿学习","分布偏移（协变量偏移）","复合误差","DAgger（数据集聚合）","过拟合"]},{"id":"action-state-normalization","category":"training","sec":3,"tier":3,"sources":[{"title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models (arXiv 2501.09747)","url":"https://arxiv.org/abs/2501.09747"},{"title":"openpi（Physical Intelligence GitHub）","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"","related_ids":["action-tokenizer","pi0-fast","proprioception","cross-embodiment-data","openpi","fine-tuning"],"name":"动作与状态归一化","alt":"Action / State Normalization","abbr":"","aliases":["归一化统计量","norm stats","分位数归一化","动作归一化","状态归一化"],"one_liner":"训练前把各维动作和本体状态缩放到统一范围，推理后再换算回真实数值。","explanation":"机器人动作和本体状态（关节角、夹爪开合、末端位置等）各维单位和量级差别很大，直接输入网络会让大数值维度主导损失、训练不稳。常见做法是在训练数据上统计每一维的均值和标准差，或第 1、第 99 百分位数（分位数归一化），把数据缩放到零均值单位方差或 [-1, 1]。这些统计量就是 norm stats，要随模型权重一起保存，推理时对输出做反归一化才得到真实指令；分位数比最小/最大值更不怕异常值。Physical Intelligence 的 FAST 论文即用 1%/99% 分位数归一化动作；openpi 微调前要先跑 compute_norm_stats.py，若新任务的机器人在预训练数据里出现过，也可沿用预训练的统计量。统计量没对上是真机动作异常的常见原因。","example":"π0-FAST 在把动作切成 token 之前，先把训练集中每个动作维度的第 1 和第 99 百分位数映射到 [-1, 1]，方便不同机器人的数据用同一套分词器。","related":["动作分词器","π0-FAST","本体感知","跨本体数据","openpi","微调"]},{"id":"goal-conditioned-behavior-cloning","category":"training","sec":3,"tier":3,"sources":[{"title":"Learning Latent Plans from Play（项目页，含 Play-GCBC 基线）","url":"https://learning-from-play.github.io/"},{"title":"Learning to Reach Goals via Iterated Supervised Learning (GCSL, arXiv 1912.06088)","url":"https://arxiv.org/abs/1912.06088"}],"as_of":"","related_ids":["behavior-cloning","goal-conditioned-policy","hindsight-relabeling","play-data","goal-conditioned-reinforcement-learning","action-multimodality"],"name":"目标条件模仿学习","alt":"Goal-Conditioned Behavior Cloning","abbr":"GCBC","aliases":["目标条件行为克隆","Goal-Conditioned Imitation Learning"],"one_liner":"把要达成的目标和当前观测一起输入策略的行为克隆。","explanation":"在普通行为克隆（用监督学习照抄示范动作）的基础上，给策略多加一个输入：目标，通常是一张目标图像或目标状态，也可以换成语言。训练数据常靠事后重标注得到：从一段示范里截一个片段，把片段最后一帧当作目标，前面的动作就是到达这个目标的示范，所以没有任务标签的玩耍数据也能用。2019 年谷歌 Lynch 等人的 Learning from Play 论文把它作为基线 Play-GCBC；同年的 GCSL 让智能体自己采数据、反复重标注后再做监督学习。它结构简单，是很多目标条件、语言条件策略的起点，短板是同一个目标有多种走法时（动作多峰性）容易学成平均动作。","example":"从一段遥操作玩耍数据里随机截一小段，以末帧图像为目标，训练一个看到当前画面和目标画面就输出动作的策略。","related":["行为克隆","目标条件策略","事后重标注","玩耍数据","目标条件强化学习","动作多峰性"]},{"id":"imitation-from-observation","category":"training","sec":3,"tier":3,"sources":[{"title":"Recent Advances in Imitation Learning from Observation (IJCAI 2019 survey)","url":"https://arxiv.org/abs/1905.13566"},{"title":"Behavioral Cloning from Observation (IJCAI 2018)","url":"https://arxiv.org/abs/1805.01954"},{"title":"Imitation from Observation: Learning to Imitate Behaviors from Raw Video via Context Translation (ICRA 2018)","url":"https://arxiv.org/abs/1707.03374"}],"as_of":"","related_ids":["action-free-video","inverse-dynamics-model","human-video-data","latent-action","pseudo-action-labels","lapa"],"name":"从观测中模仿学习","alt":"Imitation from Observation","abbr":"IfO","aliases":["无动作标签模仿","从视频中模仿","Imitation Learning from Observation"],"one_liner":"只看到示范的状态或视频、没有动作标签，也要学会模仿的一类方法。","explanation":"普通模仿学习需要观测-动作对；从观测中模仿只拿到示范者的状态序列，比如人做事的视频，不知道每一步具体发了什么控制指令。这样就能用上互联网视频、人类视频等海量资源，但还要处理视角和身体结构不同的问题。代表工作有：2017 年伯克利 Liu 等人用上下文翻译把人类视频转成机器人视角，再做强化学习；2018 年 UT Austin 的 Torabi 等人提出 BCO，先让智能体自己探索、学一个逆动力学模型（由前后两帧推出动作），再给专家视频补上动作标签做行为克隆；此外还有对抗式方法。今天用人类视频预训练、潜在动作、伪动作标签的具身工作，要解决的是同一个问题。","example":"Liu 等人 2017 年的论文里，机器人只看人类扫地、舀杏仁、推物体的视频（没有关节记录），学会了用工具完成同样的动作。","related":["无动作标签视频","逆动力学模型","人类视频数据","潜在动作","伪动作标签","LAPA"]},{"id":"markov-decision-process","category":"training","sec":4,"tier":2,"sources":[{"title":"Markov decision process（Wikipedia）","url":"https://en.wikipedia.org/wiki/Markov_decision_process"}],"as_of":"","related_ids":["reinforcement-learning","partially-observable-markov-decision-process","bellman-equation","reward-function","discount-factor","policy"],"name":"马尔可夫决策过程","alt":"Markov Decision Process","abbr":"MDP","aliases":["马氏决策过程"],"one_liner":"描述智能体看状态、做动作、拿奖励、进入新状态这一循环的标准数学框架。","explanation":"马尔可夫决策过程是强化学习的标准数学模型，常写成五元组 (S, A, P, R, γ)：状态空间、动作空间、状态转移概率（在状态 s 做动作 a 后到达下一状态的概率）、奖励函数，以及让远期奖励打折的折扣因子。核心假设是马尔可夫性：下一步只取决于当前状态和动作，与更早的历史无关。它的数学基础来自 Richard Bellman 1957 年前后的动态规划工作，贝尔曼方程、价值函数、策略梯度都建立在它之上。强化学习的目标就是在 MDP 中找一个策略，使期望累计折扣回报最大。真实机器人往往看不全状态（如被挡住的物体），这时要用部分可观测马尔可夫决策过程（POMDP）建模，实践中常靠输入历史观测弥补。","example":"训练四足机器人行走时，状态可以包括关节角度、关节速度、机身姿态和速度指令，动作是 12 个关节的目标角度，奖励按跟上指令速度加分、按能耗和摔倒扣分，策略每个控制周期根据当前状态输出一次动作。","related":["强化学习","部分可观测马尔可夫决策过程","贝尔曼方程","奖励函数","折扣因子","策略"]},{"id":"reward-function","category":"training","sec":4,"tier":1,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"Eureka: Human-Level Reward Design via Coding Large Language Models (arXiv 2310.12931)","url":"https://arxiv.org/abs/2310.12931"}],"as_of":"","related_ids":["reinforcement-learning","return","reward-shaping","sparse-reward","reward-hacking","eureka"],"name":"奖励函数","alt":"Reward Function","abbr":"","aliases":["奖励","奖赏函数"],"one_liner":"强化学习里给智能体每一步行为打分的规则，告诉它什么算做得好。","explanation":"奖励函数是强化学习的核心组成部分：智能体每做一个动作，环境根据当前状态、所做动作和到达的下一状态给出一个标量分数，常写作 r = R(s, a, s')。智能体的目标是让累计奖励（回报）最大，所以奖励函数实际上定义了「任务是什么」。机器人任务的奖励往往要人手写：只在成功时给分（稀疏奖励）很难学起来，写得不周全又容易被策略钻空子，分数刷高了任务却没完成（奖励黑客）。因此出现了奖励塑形（额外加中间奖励来引导）、学习型奖励模型、让大模型自动写奖励代码等做法。","example":"训练四足机器人行走时，奖励通常由「跟上目标速度加分」「关节力矩过大扣分」「摔倒扣分」等多项加权组成。英伟达等提出的 Eureka 让 GPT-4 直接写奖励函数代码，在 29 个环境中有 83% 的任务超过了人类专家写的奖励。","related":["强化学习","回报","奖励塑形","稀疏奖励","奖励黑客","Eureka"]},{"id":"return","category":"training","sec":4,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"Hugging Face Deep RL Course: The Reinforcement Learning Framework","url":"https://huggingface.co/learn/deep-rl-course/unit1/rl-framework"}],"as_of":"","related_ids":["reward-function","discount-factor","value-function","q-function","episode","return-conditioning"],"name":"回报","alt":"Return","abbr":"","aliases":["累积奖励","Cumulative Reward","折扣回报","Discounted Return","G_t"],"one_liner":"从某一时刻起往后所有奖励（通常打折扣）加起来的总和。","explanation":"回报是强化学习要最大化的量。奖励是每一步环境给的即时分数，回报则是从当前时刻往后所有奖励的总和，常记作 G_t 或 R(τ)。回合有固定长度时可以直接相加；任务很长或没有终点时通常用折扣回报：k 步之后的奖励乘上折扣因子 γ 的 k 次方（γ 在 0 到 1 之间，常取 0.95–0.99），越远的奖励权重越小，既保证总和有限，也让智能体更看重眼前。强化学习的目标是最大化期望回报；价值函数和 Q 函数就是对未来回报的期望估计。回报条件化等方法还把目标回报当作输入，让策略按指定水平去做。","example":"机械臂抓取任务只在成功时给 +1、其余为 0，取 γ=0.99：第 10 步成功，从起点算的折扣回报是 0.99^10≈0.904；拖到第 50 步才成功，回报只有约 0.605，所以策略会倾向更快完成。","related":["奖励函数","折扣因子","价值函数","Q 函数","回合","回报条件化"]},{"id":"discount-factor","category":"training","sec":4,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"legged_gym: legged_robot_config.py (PPO gamma = 0.99)","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["return","reward-function","value-function","bellman-equation","generalized-advantage-estimation","markov-decision-process"],"name":"折扣因子","alt":"Discount Factor","abbr":"γ","aliases":["gamma","折扣率"],"one_liner":"强化学习里给未来奖励打折的系数，决定智能体多看重长远回报。","explanation":"折扣因子是强化学习的基础超参数，写作 γ，取值在 0 到 1 之间。计算回报（从当前时刻起累计的奖励）时，k 步之后的奖励要乘上 γ 的 k 次方。它有两个作用：一是表达「眼前的奖励比远处的更确定、更值钱」；二是让无限长的奖励求和收敛成有限值，方便用贝尔曼方程（价值函数的递推关系）来求解。γ 越接近 1，智能体越看重长远结果，但价值估计也更难、方差更大；γ 越小越短视。机器人强化学习里常取 0.99 左右。它出现在回报、价值函数和优势函数的定义中。","example":"legged_gym（ETH 开源的足式机器人强化学习训练框架）的 PPO 配置里 gamma = 0.99：100 步之后的奖励权重约为 0.99 的 100 次方 ≈ 0.37。","related":["回报","奖励函数","价值函数","贝尔曼方程","广义优势估计","马尔可夫决策过程"]},{"id":"exploration-vs-exploitation","category":"training","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Exploration–exploitation dilemma","url":"https://en.wikipedia.org/wiki/Exploration%E2%80%93exploitation_dilemma"},{"title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","url":"https://arxiv.org/abs/2509.09674"}],"as_of":"","related_ids":["intrinsic-motivation","entropy-regularization","reinforcement-learning","sample-efficiency","safe-reinforcement-learning","real-world-reinforcement-learning"],"name":"探索与利用","alt":"Exploration vs. Exploitation","abbr":"","aliases":["探索-利用权衡","探索-利用困境","Exploration-Exploitation Trade-off"],"one_liner":"在「试新动作找更好办法」和「用已知最好的动作拿奖励」之间做权衡。","explanation":"这是强化学习和序贯决策里的基本矛盾。利用是按当前认知选看起来最好的动作；探索是去试不确定的新动作，短期可能吃亏，但可能发现更好的策略。只利用容易卡在次优解，只探索又拿不到回报。经典研究框架是多臂老虎机问题，常见策略有 ε-贪心（以小概率 ε 随机选动作）、UCB（上置信界，优先试不确定性大的选项）和汤普森采样；深度强化学习里还有熵正则化（鼓励策略保持随机性）和内在奖励（奖励「好奇心」）。机器人上的探索更难：真机乱试可能撞坏设备，所以常先用演示数据或仿真把策略带到合理区域，再有控制地探索。","example":"SimpleVLA-RL 用强化学习微调 VLA 时，把推演采样温度从 1.0 提到 1.6，并把裁剪上限从 0.2 放宽到 0.28，让模型生成更多样的轨迹，以加强探索。","related":["内在奖励","熵正则化","强化学习","样本效率","安全强化学习","真机强化学习"]},{"id":"credit-assignment","category":"training","sec":4,"tier":3,"sources":[{"title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning (arXiv 2312.01072)","url":"https://arxiv.org/abs/2312.01072"},{"title":"Minsky (1961): Steps Toward Artificial Intelligence (Proceedings of the IRE)","url":"https://courses.csail.mit.edu/6.803/pdf/steps.pdf"}],"as_of":"","related_ids":["sparse-reward","temporal-difference-learning","advantage-function","generalized-advantage-estimation","reward-shaping","long-horizon-task"],"name":"信用分配","alt":"Credit Assignment","abbr":"","aliases":["贡献度分配","信用分配问题","Credit Assignment Problem","CAP"],"one_liner":"最终拿到奖励或惩罚时，判断之前哪些动作该记功、哪些该担责。","explanation":"信用分配问题在 Marvin Minsky 1961 年的综述《Steps Toward Artificial Intelligence》中就被专门讨论：一个复杂策略成功了，功劳该如何分给其中涉及的众多决策。他举的例子是，赢一盘棋可能涉及上百万个决策，能不能每个决策平分百万分之一的功劳。在强化学习里它主要指时间上的信用分配：奖励常常延迟到任务结束才出现，中间还混着噪声和偶然因素，智能体要从有限的经验中学出每个动作对最终结果的影响。常用手段包括时序差分学习与自举、折扣因子、优势函数和广义优势估计（GAE）、奖励塑形（加中间奖励）、分层强化学习等。机器人长程任务动作步数多、奖励稀疏，信用分配是强化学习在这里难用的主要原因之一。","example":"机械臂叠 5 块积木，只有全部叠好才得 1 分。某一回合失败了，原因可能是第 2 块放歪、也可能是第 4 块松手太早；信用分配要从大量这样的回合里学出每一步动作各该负多少责任。","related":["稀疏奖励","时序差分学习","优势函数","广义优势估计","奖励塑形","长程任务"]},{"id":"value-function","category":"training","sec":4,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL（Value Functions）","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"Hugging Face Deep RL Course: Advantage Actor-Critic (A2C)","url":"https://huggingface.co/learn/deep-rl-course/unit6/advantage-actor-critic"},{"title":"π*0.6: a VLA That Learns From Experience (arXiv 2511.14759)","url":"https://arxiv.org/abs/2511.14759"}],"as_of":"","related_ids":["q-function","advantage-function","bellman-equation","temporal-difference-learning","return","asymmetric-actor-critic"],"name":"价值函数","alt":"Value Function","abbr":"","aliases":["状态价值函数","V 函数","Critic","评论家","演员-评论家","Actor-Critic","行动者-评论家"],"one_liner":"估计「从当前状态出发、按某策略做下去，未来总共能拿多少奖励」的函数。","explanation":"价值函数是强化学习的核心概念。状态价值函数 V(s) 表示从状态 s 出发、一直按策略 π 行动的期望回报（未来奖励的折扣累加）；Q 函数 Q(s,a) 是先执行动作 a 再按策略走的期望回报；A=Q−V 叫优势函数，衡量某个动作比平均水平好多少。有了它就能判断哪些状态、动作更值得追求。演员-评论家（Actor-Critic）架构把策略和价值结合：演员是策略网络，负责出动作；评论家是价值网络，给动作打分、提供优势信号来更新演员，PPO、SAC、TD3 都属于这一类。具身智能里，价值函数还被用来筛选数据、给 VLA 做强化学习，如 π*0.6 的 RECAP 方法。","example":"π*0.6 训练了一个价值函数，预测「离任务成功还剩多少步」（失败轨迹给很低的值），据此算出每个动作的优势，告诉策略哪些动作更好。","related":["Q 函数","优势函数","贝尔曼方程","时序差分学习","回报","非对称演员-评论家"]},{"id":"bellman-equation","category":"training","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Bellman equation","url":"https://en.wikipedia.org/wiki/Bellman_equation"},{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"}],"as_of":"","related_ids":["value-function","q-function","discount-factor","temporal-difference-learning","q-learning","markov-decision-process"],"name":"贝尔曼方程","alt":"Bellman Equation","abbr":"","aliases":["Bellman 方程","贝尔曼最优方程","贝尔曼期望方程"],"one_liner":"把一个状态的价值拆成「眼前奖励 + 下一状态打折后的价值」的递推式。","explanation":"贝尔曼方程以美国数学家 Richard Bellman 命名，出自他提出的动态规划方法。它说的是：某个状态的价值 = 在这里拿到的即时奖励 + 折扣因子 × 下一个状态的期望价值。这样就把「长远看有多好」这个难算的问题拆成一步步的递推。按固定策略写出的叫贝尔曼期望方程，对动作取最大值的叫贝尔曼最优方程。几乎所有基于价值的强化学习都建立在它之上：Q 学习、深度 Q 网络（DQN）、时序差分学习都用它构造训练目标，让网络的预测满足这种前后自洽的关系。","example":"Q 学习的训练目标是 r + γ·max Q(s', a')：机器人在状态 s 执行动作 a、拿到奖励 r 并到达 s'，就用这个目标去更新 Q(s, a)，这就是在用贝尔曼最优方程。","related":["价值函数","Q 函数","折扣因子","时序差分学习","Q 学习","马尔可夫决策过程"]},{"id":"q-function","category":"training","sec":4,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"Hugging Face Deep RL Course: Introducing Q-Learning","url":"https://huggingface.co/learn/deep-rl-course/unit2/q-learning"}],"as_of":"","related_ids":["value-function","advantage-function","bellman-equation","q-learning","deep-q-network","return"],"name":"Q 函数","alt":"Q-Function (Action-Value Function)","abbr":"","aliases":["动作价值函数","Q 值","状态-动作价值函数","Action-Value Function","Q(s,a)"],"one_liner":"在某状态先做某个动作、之后按策略行动，能拿到的期望回报。","explanation":"Q 函数写作 Q(s,a)：在状态 s 先执行动作 a，之后一直按策略 π 行动，所能得到的期望回报（未来奖励的折扣累加）。它比价值函数 V(s) 多了一个动作输入，所以能直接比较同一状态下不同动作的好坏；知道最优 Q 函数后，每步挑 Q 值最大的动作就是最优策略。Q 函数满足贝尔曼方程：当前 Q 值等于即时奖励加上下一步 Q 值的折扣。Q 学习、DQN、SAC、TD3 都在学它；演员-评论家算法里的评论家常常就是一个 Q 网络，优势函数 A(s,a)=Q(s,a)−V(s) 也由它得出。","example":"QT-Opt 用一个卷积网络估计 Q 值：输入当前相机图像和一个候选夹爪动作，输出执行后最终抓取成功的概率；每一步用交叉熵方法搜出 Q 值最高的动作去执行。","related":["价值函数","优势函数","贝尔曼方程","Q 学习","深度 Q 网络","回报"]},{"id":"advantage-function","category":"training","sec":4,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation (arXiv 1506.02438)","url":"https://arxiv.org/abs/1506.02438"}],"as_of":"","related_ids":["value-function","q-function","generalized-advantage-estimation","policy-gradient","proximal-policy-optimization","recap"],"name":"优势函数","alt":"Advantage Function","abbr":"","aliases":["优势值","Advantage","A(s,a)"],"one_liner":"衡量某个动作比按当前策略的平均水平好多少，等于 Q 值减 V 值。","explanation":"优势函数定义为 A(s,a) = Q(s,a) − V(s)：Q 是在状态 s 先做动作 a、之后按策略行动的期望回报，V 是在状态 s 直接按策略行动的期望回报。两者相减就是这个动作「比平均好多少」，为正说明该多做，为负说明该少做。策略梯度方法用优势代替原始回报，能明显降低梯度估计的方差（波动），训练更稳。PPO 等算法常用 Schulman 等人 2015 年提出的广义优势估计（GAE）来算它；Physical Intelligence 的 RECAP 则把优势作为条件输入 VLA，让模型区分好经验和差经验。","example":"机械臂抓杯子时，在状态 s 下按当前策略平均能拿到 0.6 的回报；如果先执行「垂直下探」再继续，期望回报是 0.8，那么这个动作的优势就是 +0.2，训练会提高它被选中的概率。","related":["价值函数","Q 函数","广义优势估计","策略梯度","近端策略优化","RECAP"]},{"id":"policy-iteration-value-iteration","category":"training","sec":4,"tier":3,"sources":[{"title":"Wikipedia: Markov decision process（Algorithms 一节）","url":"https://en.wikipedia.org/wiki/Markov_decision_process"},{"title":"Wikipedia: Bellman equation","url":"https://en.wikipedia.org/wiki/Bellman_equation"}],"as_of":"","related_ids":["markov-decision-process","bellman-equation","value-function","q-learning","model-based-reinforcement-learning","policy-gradient"],"name":"策略迭代 / 价值迭代","alt":"Policy Iteration / Value Iteration (Dynamic Programming)","abbr":"","aliases":["动态规划","Dynamic Programming","值迭代"],"one_liner":"环境模型已知时，反复更新价值或策略来求最优策略的两种经典动态规划算法。","explanation":"策略迭代和价值迭代是求解马尔可夫决策过程（描述状态、动作、奖励和转移的数学框架）的两种经典动态规划算法，前提是转移概率和奖励函数都已知。价值迭代由 Bellman 在 1957 年提出，反复用贝尔曼最优方程更新每个状态的价值，收敛后按价值挑动作。策略迭代由 Howard 在 1960 年提出，交替做两步：策略评估（算出当前策略下各状态的价值）和策略改进（每个状态改选价值最高的动作），直到策略不再变化。真实机器人的状态连续、模型未知，没法直接套用，但 Q 学习、演员-评论家等算法都可以看成它们在采样和函数近似下的变体。","example":"在一个 4×4 的网格迷宫里，每走一步奖励 -1、走到终点结束，且移动结果确定。价值迭代反复更新各格的价值，收敛后每格的价值等于它到终点最短步数的相反数，沿价值升高的方向走就是最短路径。","related":["马尔可夫决策过程","贝尔曼方程","价值函数","Q 学习","基于模型的强化学习","策略梯度"]},{"id":"monte-carlo-methods","category":"training","sec":4,"tier":3,"sources":[{"title":"Wikipedia: Reinforcement learning (Monte Carlo methods)","url":"https://en.wikipedia.org/wiki/Reinforcement_learning"},{"title":"Physical Intelligence 2025: π*0.6: a VLA That Learns From Experience (RECAP)","url":"https://arxiv.org/abs/2511.14759"}],"as_of":"","related_ids":["return","temporal-difference-learning","value-function","discount-factor","monte-carlo-tree-search","recap"],"name":"蒙特卡洛方法（蒙特卡洛回报）","alt":"Monte Carlo Methods (Monte Carlo Return)","abbr":"MC","aliases":["MC 方法","蒙特卡洛回报","MC Return"],"one_liner":"靠大量随机采样求平均来估算；在强化学习里指用整局实际回报来估价值。","explanation":"蒙特卡洛方法泛指用随机采样加统计平均来近似计算的一大类方法。在强化学习里它特指：让智能体完整跑完一个回合，把从某一步起实际拿到的（折扣）奖励加起来，得到「蒙特卡洛回报」，再对多个回合取平均来估计状态或动作的价值。它不依赖对后续状态价值的估计（不做自举），因此没有自举带来的偏差，但回合越长方差越大，而且必须等回合结束才能更新，只适用于有终点的任务。与之相对的是每一步都能更新的时序差分学习，TD(λ) 可以在两者之间连续调节。蒙特卡洛树搜索也借用了随机模拟的思路。","example":"π*0.6 的 RECAP 训练价值函数时直接用蒙特卡洛回报：每走一步奖励 −1，成功结束得 0，失败另扣一大笔，于是价值大致等于「离完成还差多少步」的负数。","related":["回报","时序差分学习","价值函数","折扣因子","蒙特卡洛树搜索","RECAP"]},{"id":"temporal-difference-learning","category":"training","sec":4,"tier":2,"sources":[{"title":"Temporal difference learning (Wikipedia)","url":"https://en.wikipedia.org/wiki/Temporal_difference_learning"},{"title":"Soft Actor-Critic (OpenAI Spinning Up)","url":"https://spinningup.openai.com/en/latest/algorithms/sac.html"}],"as_of":"","related_ids":["value-function","bellman-equation","bootstrapping","q-learning","monte-carlo-methods","generalized-advantage-estimation"],"name":"时序差分学习","alt":"Temporal Difference Learning","abbr":"TD","aliases":["TD 学习","TD 误差","时间差分学习"],"one_liner":"用「这一步奖励 + 下一状态的估计价值」来更新当前价值估计的方法。","explanation":"时序差分学习由 Richard Sutton 在 1988 年的论文中系统提出，是强化学习里估计价值函数（衡量某个状态或动作之后能拿多少总回报）的核心方法。它不必等一整局结束拿到真实回报，而是每走一步就更新：把「实际拿到的奖励 r + 折扣后的下一状态估计值 γV(s′)」当作目标，它与当前估计 V(s) 的差叫 TD 误差，按它修正 V(s)。这种「用估计去更新估计」的做法叫自举，比等整局结束再算的蒙特卡洛方法方差更小、能边走边学，代价是会引入偏差。Q 学习、DQN，以及 SAC、TD3 的评论家网络都靠 TD 目标训练；早期名作 TD-Gammon 用它学到了专家水平的西洋双陆棋。","example":"机械臂走一步得到奖励 0，评论家估计下一状态价值为 0.8，折扣因子 γ=0.99，则 TD 目标为 0+0.99×0.8=0.792；若当前状态估值是 0.5，TD 误差为 0.292，网络就把当前估值往 0.792 的方向调一点。","related":["价值函数","贝尔曼方程","自举","Q 学习","蒙特卡洛方法（蒙特卡洛回报）","广义优势估计"]},{"id":"bootstrapping","category":"training","sec":4,"tier":3,"sources":[{"title":"Lilian Weng: A (Long) Peek into Reinforcement Learning","url":"https://lilianweng.github.io/posts/2018-02-19-rl-overview/"},{"title":"Wikipedia: Temporal difference learning","url":"https://en.wikipedia.org/wiki/Temporal_difference_learning"}],"as_of":"","related_ids":["temporal-difference-learning","value-function","bellman-equation","target-network","monte-carlo-methods","overestimation-bias"],"name":"自举","alt":"Bootstrapping (in RL)","abbr":"","aliases":["自举法","Bootstrap"],"one_liner":"用自己对下一状态价值的当前估计，来更新当前状态的价值估计。","explanation":"自举是强化学习中更新价值函数的一种基本做法：更新时部分依赖已有的价值估计，而不是只依赖实际拿到的奖励。时序差分（TD）学习是典型例子，更新某一步的价值时，目标取「这一步的奖励 + 折扣后的下一状态价值估计」，不用等整局结束；与之相对，蒙特卡洛方法必须跑完一整个回合，用实际回报来更新。自举的好处是每一步都能学、方差小、能用于没有终点的任务；代价是目标本身带偏差，估计误差会一路传下去。自举、神经网络这类函数近似、异策略学习三者同时出现时训练容易不稳定，被称为「致命三角」，DQN 的经验回放和目标网络就是为稳定训练而设计的。它和统计学里的 bootstrap 重抽样不是一回事。","example":"机械臂开抽屉，每步奖励为 0、抽屉拉开时得 1。TD 学习更新「已握住把手」这个状态的价值时，直接拿「抽屉已拉开一半」状态当前的价值估计乘以折扣因子当目标，不必等这一回合结束。","related":["时序差分学习","价值函数","贝尔曼方程","目标网络","蒙特卡洛方法（蒙特卡洛回报）","Q 值高估"]},{"id":"sample-efficiency","category":"training","sec":4,"tier":2,"sources":[{"title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning (arXiv 2401.16013)","url":"https://arxiv.org/abs/2401.16013"},{"title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL, arXiv 2410.21845)","url":"https://arxiv.org/abs/2410.21845"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)","url":"https://arxiv.org/abs/2109.11978"}],"as_of":"","related_ids":["off-policy","experience-replay","real-world-reinforcement-learning","model-based-reinforcement-learning","massively-parallel-reinforcement-learning","serl"],"name":"样本效率","alt":"Sample Efficiency","abbr":"","aliases":["数据效率","Data Efficiency"],"one_liner":"学到同样水平要消耗多少数据或环境交互，用得越少效率越高。","explanation":"样本效率衡量一个学习算法达到某个性能需要多少样本：强化学习里指与环境交互的步数，模仿学习里指演示条数。它在机器人上格外关键。仿真里可以靠 GPU 并行弥补，例如 Rudin 等人 2021 年在单块 GPU 上同时跑数千个 ANYmal 四足机器人，平地行走不到 4 分钟就训完；真机只能一步步实际执行，还有磨损和人工复位成本，所以真机强化学习必须用样本效率高的方法。常见提升手段有：用异策略算法配合经验回放反复利用旧数据、加入人类演示或纠正、基于模型的强化学习在想象中训练、使用预训练视觉表征。一般来说同策略的 PPO 样本效率较低，适合大规模并行仿真；SAC 一类异策略算法更省样本，常用于真机。","example":"伯克利的 SERL 在真机上用异策略强化学习，每个任务平均 25–50 分钟训练就学会 PCB 板插装、线缆布线等任务；后续 HIL-SERL 加入人类纠正，1–2.5 小时即达到接近满分的成功率。","related":["异策略","经验回放","真机强化学习","基于模型的强化学习","大规模并行强化学习","SERL"]},{"id":"model-free-reinforcement-learning","category":"training","sec":4,"tier":2,"sources":[{"title":"Wikipedia: Model-free (reinforcement learning)","url":"https://en.wikipedia.org/wiki/Model-free_(reinforcement_learning)"},{"title":"OpenAI Spinning Up: Kinds of RL Algorithms","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro2.html"},{"title":"RSL-RL (GitHub, leggedrobotics)","url":"https://github.com/leggedrobotics/rsl_rl"}],"as_of":"","related_ids":["model-based-reinforcement-learning","policy-gradient","proximal-policy-optimization","deep-q-network","sample-efficiency","massively-parallel-reinforcement-learning"],"name":"无模型强化学习","alt":"Model-Free Reinforcement Learning","abbr":"","aliases":["Model-Free RL","免模型强化学习"],"one_liner":"不学环境模型，直接从试错数据里学策略或价值函数的强化学习。","explanation":"与基于模型的强化学习相对：算法不去估计环境的状态转移和奖励规律，只拿交互得到的（状态、动作、奖励）样本直接学策略或价值函数，相当于纯粹的试错学习。主要分两类：一类直接优化策略，如策略梯度、PPO；另一类学 Q 函数（估计「在某状态做某动作最终能拿多少回报」），如 Q 学习、DQN；DDPG、SAC 介于两者之间。优点是实现简单、不受模型误差影响；缺点是需要大量交互，样本效率低。机器人领域常用 GPU 并行仿真来弥补：在 Isaac Gym 或 Isaac Lab 里同时跑上千个环境收集数据，训好后再迁移到真机。","example":"腿足机器人运控的主流做法：用 rsl_rl 库里的 PPO 在 Isaac Lab 中并行训练行走策略，全程不建环境模型，训好后部署到真机。","related":["基于模型的强化学习","策略梯度","近端策略优化","深度 Q 网络","样本效率","大规模并行强化学习"]},{"id":"model-based-reinforcement-learning","category":"training","sec":4,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Kinds of RL Algorithms","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro2.html"},{"title":"Model-based Reinforcement Learning: A Survey (Moerland et al.)","url":"https://arxiv.org/abs/2006.16712"},{"title":"DayDreamer: World Models for Physical Robot Learning","url":"https://arxiv.org/abs/2206.14176"}],"as_of":"","related_ids":["model-free-reinforcement-learning","world-model","learning-in-imagination","sample-efficiency","dreamerv3","model-predictive-control"],"name":"基于模型的强化学习","alt":"Model-Based Reinforcement Learning","abbr":"MBRL","aliases":["Model-Based RL","有模型强化学习"],"one_liner":"先学一个能预测环境反应的模型，再靠它规划或「想象」来训练策略。","explanation":"强化学习的一大分支。智能体除了学策略，还专门学一个环境模型（也叫动力学模型或世界模型）：输入当前状态和动作，预测下一个状态和奖励。有了模型，可以先在模型里推演再行动（如模型预测控制），也可以在模型里生成大量「想象」轨迹来训练策略，Sutton 提出的 Dyna 架构就是早期代表。好处是省真实交互、样本效率高，这对试错成本很高的真机尤其重要；风险是模型不准时，策略会钻模型的漏洞（模型偏差）。Dreamer 系列、TD-MPC2 都属于这一类，它也是世界模型研究和机器人强化学习的交汇点。","example":"DayDreamer（2022）把 Dreamer 算法直接用在真机上：四足机器人不借助仿真器，只用 1 小时就从零学会翻身、站起和行走。","related":["无模型强化学习","世界模型","想象中学习","样本效率","DreamerV3","模型预测控制"]},{"id":"learning-in-imagination","category":"training","sec":4,"tier":3,"sources":[{"title":"Dream to Control: Learning Behaviors by Latent Imagination (Dreamer, arXiv:1912.01603)","url":"https://arxiv.org/abs/1912.01603"},{"title":"DayDreamer: World Models for Physical Robot Learning (arXiv:2206.14176)","url":"https://arxiv.org/abs/2206.14176"},{"title":"Training Agents Inside of Scalable World Models (Dreamer 4, arXiv:2509.24527)","url":"https://arxiv.org/abs/2509.24527"}],"as_of":"2025-09","related_ids":["world-model","model-based-reinforcement-learning","dreamerv3","dreamer-4","daydreamer","world-models"],"name":"想象中学习","alt":"Learning in Imagination (World-Model-Based RL)","abbr":"","aliases":["在世界模型中训练","世界模型强化学习","梦境训练"],"one_liner":"先学一个世界模型，再让策略在模型「想象」出的轨迹里训练。","explanation":"想象中学习是基于模型的强化学习的一种做法：先用真实交互数据学一个世界模型（根据当前状态和动作预测下一步和奖励的模型），再让策略在世界模型生成的虚拟轨迹里反复试错，少碰真实环境。Ha 与 Schmidhuber 2018 年的 World Models 论文较早演示了这一思路；Hafner 等人的 Dreamer 系列把它做成通用算法：在压缩的潜在空间里想象轨迹，并把价值估计的梯度沿轨迹回传来训练策略。好处是省真机交互、更安全；风险是世界模型不准时，策略会学到只在「梦里」有效的漏洞。","example":"DayDreamer（2022）在真机上运行 Dreamer，四足机器人约 1 小时真实交互就从零学会站立和行走；Dreamer 4（2025）只用离线数据在世界模型里训练，成为首个这样在《我的世界》中拿到钻石的智能体。","related":["世界模型","基于模型的强化学习","DreamerV3","Dreamer 4","DayDreamer","World Models 论文（Ha & Schmidhuber）"]},{"id":"on-policy","category":"training","sec":4,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Kinds of RL Algorithms","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro2.html"},{"title":"Proximal Policy Optimization Algorithms","url":"https://arxiv.org/abs/1707.06347"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning","url":"https://arxiv.org/abs/2109.11978"}],"as_of":"","related_ids":["off-policy","proximal-policy-optimization","policy-gradient","massively-parallel-reinforcement-learning","sample-efficiency","rsl-rl"],"name":"同策略","alt":"On-Policy","abbr":"","aliases":["在策略","同轨策略","在线策略","On-Policy Learning"],"one_liner":"只用当前策略自己刚采集的数据来更新，旧数据用完即弃。","explanation":"与异策略相对：产生数据的行为策略和正在优化的目标策略是同一个。每次更新参数后，旧策略收集的数据就不再符合当前策略的分布，只能丢掉重新采。SARSA、REINFORCE、A2C/A3C、TRPO、PPO 都是同策略算法；PPO 会在同一批数据上做几轮小批量更新，但仍算同策略。优点是训练稳定、实现简单；缺点是数据利用率低，需要海量交互。GPU 大规模并行仿真把采样变便宜之后，PPO 成了腿足和人形机器人运控训练的主流算法。中文「在线策略」多指同策略，注意和「在线强化学习」区分。","example":"Rudin 等人 2021 年在单张 GPU 上并行仿真上千台 ANYmal 四足机器人，平地行走策略不到 4 分钟、崎岖地形约 20 分钟就训好，并迁移到真机；其开源代码 legged_gym 配套的 rsl_rl 就是 PPO 实现。","related":["异策略","近端策略优化","策略梯度","大规模并行强化学习","样本效率","rsl_rl"]},{"id":"off-policy","category":"training","sec":4,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Kinds of RL Algorithms","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro2.html"},{"title":"Wikipedia: State–action–reward–state–action (SARSA vs Q-learning)","url":"https://en.wikipedia.org/wiki/State%E2%80%93action%E2%80%93reward%E2%80%93state%E2%80%93action"},{"title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning","url":"https://arxiv.org/html/2401.16013"}],"as_of":"","related_ids":["on-policy","experience-replay","soft-actor-critic","q-learning","offline-reinforcement-learning","serl"],"name":"异策略","alt":"Off-Policy","abbr":"","aliases":["离策略","离轨策略","离线策略","Off-Policy Learning"],"one_liner":"用来学习的数据可以来自别的策略，不必由当前策略亲自采集。","explanation":"强化学习里区分两种策略：行为策略负责与环境交互、产生数据，目标策略是正在学习和优化的那个。两者可以不同，就叫异策略学习。这样，旧版本策略的经验、人类演示、其他算法的数据都能存进经验回放缓冲区反复使用，样本效率高，Q 学习、DQN、DDPG、TD3、SAC 都属于这一类。代价是数据分布和当前策略不一致，训练更容易不稳定。真机强化学习因为交互昂贵，多选异策略算法。注意：中文「离线策略」常指异策略，但它和「离线强化学习」不是一回事，异策略算法通常仍在一边训练一边采集新数据。","example":"SERL 用基于 SAC 的异策略算法 RLPD，每个训练批次一半来自人类演示、一半来自机器人在线采集的回放数据，在 PCB 插装、理线等任务上平均 25 到 50 分钟训出策略。","related":["同策略","经验回放","软演员-评论家","Q 学习","离线强化学习","SERL"]},{"id":"policy-gradient","category":"training","sec":5,"tier":2,"sources":[{"title":"OpenAI Spinning Up: Intro to Policy Optimization","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro3.html"},{"title":"Policy Gradient Methods for Reinforcement Learning with Function Approximation (Sutton et al., NIPS 1999)","url":"https://papers.nips.cc/paper_files/paper/1999/hash/464d828b85b0bed98e80ade0a5c43b0f-Abstract.html"}],"as_of":"","related_ids":["reinforce","advantage-function","proximal-policy-optimization","trust-region-policy-optimization","on-policy","generalized-advantage-estimation"],"name":"策略梯度","alt":"Policy Gradient","abbr":"PG","aliases":["策略梯度方法","Policy Gradient Methods"],"one_liner":"直接求期望回报对策略参数的梯度，沿梯度方向改进策略的方法。","explanation":"强化学习里直接优化策略的一大类方法。策略用带参数的网络表示，目标是最大化期望回报；策略梯度给出这个目标对参数的梯度：把每一步动作的对数概率梯度乘上它带来的回报，于是回报高的动作概率被调高、回报低的被调低，用采样轨迹就能估计。Williams 1992 年的 REINFORCE 是早期代表，Sutton 等人 1999 年给出了配合函数逼近使用的策略梯度定理。实际中常减去一个基线，用优势函数（这个动作比平均水平好多少）代替原始回报来降低方差，由此发展出演员-评论家、TRPO、PPO。它天然支持连续动作，适合机器人控制，但通常是同策略的，样本效率不高。","example":"训练机械臂推箱子：先用当前策略采样一批轨迹，把箱子推到目标的轨迹里做过的动作概率调高，失败轨迹里的调低，反复迭代，策略逐渐变好。","related":["REINFORCE 算法","优势函数","近端策略优化","信赖域策略优化","同策略","广义优势估计"]},{"id":"reinforce","category":"training","sec":5,"tier":3,"sources":[{"title":"Wikipedia: Policy gradient method","url":"https://en.wikipedia.org/wiki/Policy_gradient_method"},{"title":"Ahmadian et al. 2024: Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","url":"https://arxiv.org/abs/2402.14740"}],"as_of":"","related_ids":["policy-gradient","monte-carlo-methods","return","advantage-function","proximal-policy-optimization","group-relative-policy-optimization"],"name":"REINFORCE 算法","alt":"REINFORCE","abbr":"","aliases":["蒙特卡洛策略梯度","Monte Carlo Policy Gradient"],"one_liner":"最早的策略梯度算法：按整条轨迹的回报，调高带来高回报的动作的概率。","explanation":"REINFORCE 由 Ronald Williams 在 1992 年提出，是最早的策略梯度算法。做法是：用当前策略完整跑完若干回合，对每一步动作，用它之后拿到的累计回报去加权该动作对数概率的梯度，回报高的动作被调得更容易出现。因为回报直接来自整条轨迹的采样、而不是价值估计，它也叫蒙特卡洛策略梯度，估计无偏但方差大、样本效率低；减去一个基线（如平均回报或价值函数）能明显降低方差，这一思路后来发展成演员-评论家方法。PPO 也建立在策略梯度之上；大语言模型后训练中的 RLOO、GRPO 用组内平均回报当基线，沿用的也是 REINFORCE 的思路。","example":"让机械臂学推方块：每回合推到目标回报记 1，否则记 0。REINFORCE 会调高成功回合里每一步动作的概率，失败回合的梯度为零；加上基线后，低于平均的回合里的动作会被压低。","related":["策略梯度","蒙特卡洛方法（蒙特卡洛回报）","回报","优势函数","近端策略优化","组相对策略优化"]},{"id":"generalized-advantage-estimation","category":"training","sec":5,"tier":3,"sources":[{"title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation (arXiv:1506.02438)","url":"https://arxiv.org/abs/1506.02438"},{"title":"legged_gym: legged_robot_config.py","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["advantage-function","proximal-policy-optimization","temporal-difference-learning","discount-factor","value-function","policy-gradient"],"name":"广义优势估计","alt":"Generalized Advantage Estimation","abbr":"GAE","aliases":["GAE(λ)","广义优势函数估计"],"one_liner":"把多步时序差分误差按 λ 指数加权相加，来估计优势函数。","explanation":"GAE 由 Schulman、Levine、Abbeel 等人在 2015 年提出。策略梯度需要知道某个动作比平均水平好多少，即优势函数。只用一步时序差分（TD）误差 δ = r + γV(s′) − V(s) 估计，方差小但偏差大；用整个回合的蒙特卡洛回报，偏差小但方差大。GAE 把未来各步 TD 误差按 (γλ)^k 衰减加权求和，λ 在 0 到 1 之间调节两者折中：λ = 0 即一步 TD，λ = 1 即蒙特卡洛，思路与 TD(λ) 相同。它是 PPO 的标准配置，足式和人形机器人的 PPO 运控训练普遍用它算优势。","example":"legged_gym 的 PPO 默认配置取折扣因子 γ = 0.99、GAE 参数 λ = 0.95。","related":["优势函数","近端策略优化","时序差分学习","折扣因子","价值函数","策略梯度"]},{"id":"importance-sampling","category":"training","sec":5,"tier":3,"sources":[{"title":"Importance sampling (Wikipedia)","url":"https://en.wikipedia.org/wiki/Importance_sampling"},{"title":"Policy Gradient Algorithms (Lilian Weng)","url":"https://lilianweng.github.io/posts/2018-04-08-policy-gradient/"}],"as_of":"","related_ids":["off-policy","proximal-policy-optimization","off-policy-evaluation","policy-gradient","trust-region-policy-optimization","monte-carlo-methods"],"name":"重要性采样","alt":"Importance Sampling","abbr":"","aliases":["重要性权重","Importance Weighting"],"one_liner":"用一个分布采的样本，乘上两分布的概率比作权重，估计另一个分布下的期望。","explanation":"一种蒙特卡洛估计技巧。想求分布 p 下某个量的期望，手上却只有从分布 q 采来的样本，就给每个样本乘上权重 p(x)/q(x)，加权平均后仍是对 p 下期望的无偏估计（前提是 q 能覆盖 p 可能取到的值）。在强化学习里，p 和 q 通常是两个策略：用旧策略或行为策略采的数据去评估、更新新策略，权重就是新旧策略在同一动作上的概率比。异策略学习和离线策略评估都要用它；TRPO 和 PPO 目标里的概率比 r(θ) 也是它，PPO 通过裁剪这个比值防止一次更新过大。主要问题是两个分布差得越远，权重方差越大，所以实践中常截断或裁剪权重。","example":"PPO 每轮用旧策略采一批数据，再在这批数据上更新好几遍，每条数据的损失都乘以新旧策略概率比，并把比值裁剪到 [1−ε, 1+ε]。","related":["异策略","近端策略优化","离线策略评估","策略梯度","信赖域策略优化","蒙特卡洛方法（蒙特卡洛回报）"]},{"id":"trust-region-policy-optimization","category":"training","sec":5,"tier":3,"sources":[{"title":"Schulman et al. 2015: Trust Region Policy Optimization (ICML 2015)","url":"https://arxiv.org/abs/1502.05477"},{"title":"OpenAI Spinning Up: Trust Region Policy Optimization","url":"https://spinningup.openai.com/en/latest/algorithms/trpo.html"},{"title":"Schulman et al. 2017: Proximal Policy Optimization Algorithms","url":"https://arxiv.org/abs/1707.06347"}],"as_of":"","related_ids":["proximal-policy-optimization","policy-gradient","kullback-leibler-divergence","on-policy","generalized-advantage-estimation","reinforcement-learning"],"name":"信赖域策略优化","alt":"Trust Region Policy Optimization","abbr":"TRPO","aliases":["信任域策略优化","置信域策略优化"],"one_liner":"每次更新都限制新旧策略差异（KL 散度）的策略梯度算法，PPO 的前身。","explanation":"信赖域策略优化由 Schulman、Levine、Abbeel 等人在 ICML 2015 提出。普通策略梯度沿梯度走一步，步子稍大就可能让性能骤降，而且参数上的小改动也可能让动作分布变很多。TRPO 把约束放在策略分布上：在新旧策略平均 KL 散度不超过阈值的「信赖域」内最大化替代目标，理论上可保证单调改进。实现上用共轭梯度求近似二阶的更新方向，再用回溯线搜索检查约束和改进。它是同策略算法，实现较繁琐；2017 年同一作者提出的 PPO 用更简单的方式近似这个约束，已成为机器人强化学习主流。","example":"OpenAI Spinning Up 的 TRPO 实现中，每轮先用共轭梯度算出更新方向，再按回溯系数不断缩短步长，直到新策略既不超过 KL 上限、又让替代目标变好。","related":["近端策略优化","策略梯度","KL 散度","同策略","广义优势估计","强化学习"]},{"id":"proximal-policy-optimization","category":"training","sec":5,"tier":1,"sources":[{"title":"Schulman et al. 2017: Proximal Policy Optimization Algorithms","url":"https://arxiv.org/abs/1707.06347"},{"title":"OpenAI Spinning Up: Proximal Policy Optimization","url":"https://spinningup.openai.com/en/latest/algorithms/ppo.html"},{"title":"Rudin et al. 2021: Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning","url":"https://arxiv.org/abs/2109.11978"}],"as_of":"","related_ids":["reinforcement-learning","policy-gradient","trust-region-policy-optimization","on-policy","generalized-advantage-estimation","rsl-rl"],"name":"近端策略优化","alt":"Proximal Policy Optimization","abbr":"PPO","aliases":["PPO-Clip","PPO 算法"],"one_liner":"OpenAI 2017 年提出的强化学习算法，限制每次策略更新幅度，稳定好用。","explanation":"PPO 由 OpenAI 的 Schulman 等人在 2017 年提出，属于策略梯度方法（直接调整策略网络，让带来高回报的动作更常被选中），而且是同策略（on-policy）的：只用当前策略自己刚采的数据来更新。核心是带「裁剪」的目标函数：新策略把某个动作的概率相对旧策略改得超出一定范围后，目标函数不再因此变大，既不会一步把策略改坏，同一批数据也能反复训练多轮。它和 TRPO（信赖域策略优化）一样稳定，但实现简单得多。PPO 是仿真中训练足式、人形机器人运控的主力算法，ETH 开源的机器人强化学习库 rsl_rl 就以它为核心；InstructGPT 的 RLHF 也用了 PPO。","example":"ETH 的 Rudin 等人在 legged_gym 中用 PPO、在单块 GPU 上并行跑数千个仿真环境训练 ANYmal 四足，平地行走不到 4 分钟、崎岖地形约 20 分钟就能训出策略，并迁移到真机。","related":["强化学习","策略梯度","信赖域策略优化","同策略","广义优势估计","rsl_rl"]},{"id":"group-relative-policy-optimization","category":"training","sec":5,"tier":2,"sources":[{"title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","url":"https://arxiv.org/abs/2402.03300"},{"title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","url":"https://arxiv.org/abs/2501.12948"},{"title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","url":"https://arxiv.org/abs/2509.09674"}],"as_of":"2025-09","related_ids":["proximal-policy-optimization","advantage-function","reinforcement-fine-tuning","reinforcement-learning-with-verifiable-rewards","kl-regularization","simplevla-rl"],"name":"组相对策略优化","alt":"Group Relative Policy Optimization","abbr":"GRPO","aliases":["群组相对策略优化"],"one_liner":"对同一输入采样一组结果，用组内相对得分代替价值网络的强化学习算法。","explanation":"GRPO 由 DeepSeek 团队在 2024 年 2 月的 DeepSeekMath 论文中提出，是 PPO（近端策略优化）的变体。PPO 要额外训练一个和策略差不多大的价值网络（评论家）估计基线，GRPO 去掉了它：对同一个输入采样一组输出，分别打分，再用「得分减组内均值、除以组内标准差」作为每个输出的优势，省下大量显存。它还把与参考模型的 KL 散度（偏离程度）直接加进损失，约束更新幅度。DeepSeek-R1 用 GRPO 训练推理能力后，它被广泛采用。具身领域也开始用它对 VLA 做强化学习微调：同一任务推演多条轨迹，按成功与否给 0 或 1 的奖励。","example":"SimpleVLA-RL 用 GRPO 训练 OpenVLA-OFT：每个任务采样 8 条轨迹，成功记 1、失败记 0，去掉 KL 项，并过滤全成功或全失败的组，LIBERO 平均成功率从 91.0% 提到 99.1%。","related":["近端策略优化","优势函数","强化学习微调","基于可验证奖励的强化学习","KL 正则化","SimpleVLA-RL"]},{"id":"q-learning","category":"training","sec":5,"tier":2,"sources":[{"title":"Wikipedia: Q-learning","url":"https://en.wikipedia.org/wiki/Q-learning"},{"title":"Hugging Face Deep RL Course: Introducing Q-Learning","url":"https://huggingface.co/learn/deep-rl-course/unit2/q-learning"},{"title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","url":"https://arxiv.org/abs/1806.10293"}],"as_of":"","related_ids":["q-function","temporal-difference-learning","deep-q-network","off-policy","overestimation-bias","qt-opt"],"name":"Q 学习","alt":"Q-Learning","abbr":"","aliases":["Q-learning","表格型 Q 学习"],"one_liner":"用「即时奖励 + 下一状态最大 Q 值」反复修正 Q 值的经典无模型强化学习算法。","explanation":"Q 学习由 Chris Watkins 在 1989 年的博士论文中提出，1992 年他与 Peter Dayan 给出收敛证明。它不需要环境模型：每走一步，就用「即时奖励 + 折扣 × 下一状态的最大 Q 值」作为目标修正当前 Q 值，这种用自己的估计更新自己的做法属于时序差分学习。它是异策略算法：采数据时用 ε-贪心随机探索，学到的却是贪心的最优策略，旧数据能反复利用。早期用表格存 Q 值，只适合小规模离散问题；DeepMind 用神经网络代替表格做出了 DQN。max 操作会让 Q 值偏高，双 Q 学习专门修正这一点。","example":"QT-Opt（Google，2018）用 58 万多次真实抓取数据训练基于 Q 学习的视觉抓取策略，对训练时没见过的物体抓取成功率达到 96%。","related":["Q 函数","时序差分学习","深度 Q 网络","异策略","Q 值高估","QT-Opt"]},{"id":"deep-q-network","category":"training","sec":5,"tier":2,"sources":[{"title":"Playing Atari with Deep Reinforcement Learning (arXiv 1312.5602)","url":"https://arxiv.org/abs/1312.5602"},{"title":"Google DeepMind: Deep Reinforcement Learning","url":"https://deepmind.google/discover/blog/deep-reinforcement-learning/"},{"title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation (arXiv 1806.10293)","url":"https://arxiv.org/abs/1806.10293"}],"as_of":"","related_ids":["q-learning","q-function","experience-replay","target-network","deep-deterministic-policy-gradient","qt-opt"],"name":"深度 Q 网络","alt":"Deep Q-Network","abbr":"DQN","aliases":["Deep Q-Learning","深度 Q 学习"],"one_liner":"用深度神经网络估计每个动作长期价值（Q 值）的强化学习算法。","explanation":"DQN 由 DeepMind 的 Mnih 等人提出：2013 年预印本在 7 个 Atari 游戏上验证，2015 年《自然》论文扩展到 49 个游戏，只看屏幕像素和得分，整体达到与职业人类测试员相当的水平。它把 Q 学习（学习「在某状态做某动作后能拿到多少总回报」）里的表格换成卷积神经网络，并用经验回放（存下历史经验随机抽取训练）和目标网络（定期同步的副本，用来算学习目标）稳住训练，开启了深度强化学习热潮。它要在所有动作里取 Q 值最大者，适合离散动作；机械臂的连续动作多改用 DDPG、SAC 等。","example":"谷歌 2018 年的 QT-Opt 把 Q 学习搬到真实机械臂抓取：累计 58 万多次真机抓取尝试，训出的闭环视觉抓取策略在没见过的物体上成功率达 96%。","related":["Q 学习","Q 函数","经验回放","目标网络","深度确定性策略梯度","QT-Opt"]},{"id":"experience-replay","category":"training","sec":5,"tier":2,"sources":[{"title":"Playing Atari with Deep Reinforcement Learning (DQN, 2013)","url":"https://arxiv.org/abs/1312.5602"},{"title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)","url":"https://arxiv.org/abs/2410.21845"}],"as_of":"","related_ids":["off-policy","deep-q-network","soft-actor-critic","hindsight-experience-replay","sample-efficiency","hil-serl"],"name":"经验回放","alt":"Experience Replay (Replay Buffer)","abbr":"","aliases":["回放缓冲区","Replay Buffer","经验池","回放池"],"one_liner":"把智能体过去的交互数据存进缓冲区，训练时随机抽出来重复利用。","explanation":"经验回放是强化学习里的数据复用机制，由 Long-Ji Lin 在 1990 年代初提出，2013 年 DeepMind 的 DQN（深度 Q 网络）把它和深度网络结合后广为人知。智能体每走一步，就把「状态、动作、奖励、下一状态」这条转移存进一个容量有限的缓冲区，满了就覆盖最旧的；训练时从中随机抽小批量来更新网络。好处有两点：一条数据能反复用多次，样本效率更高；随机抽样打乱了相邻步之间的强相关，训练更稳定。抽到的数据来自旧策略，所以用它的算法须是异策略（off-policy）方法，如 DQN、SAC。真机强化学习样本昂贵，更依赖它。","example":"DQN 玩 Atari 游戏时回放缓冲区保存最近 100 万帧；HIL-SERL 用两个缓冲区，一个存人类演示和人工干预数据，一个存策略自己的交互数据，训练时各抽一半。","related":["异策略","深度 Q 网络","软演员-评论家","后见之明经验回放","样本效率","HIL-SERL"]},{"id":"target-network","category":"training","sec":5,"tier":3,"sources":[{"title":"OpenAI Spinning Up: Deep Deterministic Policy Gradient（Target Networks 一节）","url":"https://spinningup.openai.com/en/latest/algorithms/ddpg.html"},{"title":"Wikipedia: Q-learning（Deep Q-learning 一节）","url":"https://en.wikipedia.org/wiki/Q-learning"},{"title":"Fujimoto et al. 2018: Addressing Function Approximation Error in Actor-Critic Methods (TD3)","url":"https://arxiv.org/abs/1802.09477"}],"as_of":"","related_ids":["deep-q-network","q-function","temporal-difference-learning","experience-replay","overestimation-bias","soft-actor-critic"],"name":"目标网络","alt":"Target Network","abbr":"","aliases":["目标 Q 网络","Target Q-Network"],"one_liner":"主网络的一个慢更新副本，专门用来算训练目标，让 Q 学习更稳定。","explanation":"在 Q 学习这类时序差分方法里，训练目标是「即时奖励 + 折扣后的下一状态 Q 值」，而这个 Q 值由正在训练的同一个网络算出，相当于边追目标边挪目标，用神经网络时容易发散。DeepMind 2015 年发表在 Nature 上的 DQN 引入目标网络：复制一份主网络专门算目标，每隔固定步数才同步一次。DDPG、TD3、SAC 等连续控制算法改用软更新，每步让目标网络参数向主网络靠近一点（Polyak 平均，系数接近 1）。它和经验回放一起是离策略深度强化学习的标准组件；TD3 论文还分析了它与 Q 值高估的关系。","example":"OpenAI Spinning Up 的 DDPG 文档中，目标网络每次按 φ_targ ← ρ·φ_targ + (1−ρ)·φ 软更新，ρ 举例取 0.995；而 DQN 类算法是每隔固定步数把主网络整体复制过去。","related":["深度 Q 网络","Q 函数","时序差分学习","经验回放","Q 值高估","软演员-评论家"]},{"id":"overestimation-bias","category":"training","sec":5,"tier":3,"sources":[{"title":"van Hasselt, Guez, Silver 2015: Deep Reinforcement Learning with Double Q-learning","url":"https://arxiv.org/abs/1509.06461"},{"title":"Fujimoto et al. 2018: Addressing Function Approximation Error in Actor-Critic Methods (TD3)","url":"https://arxiv.org/abs/1802.09477"}],"as_of":"","related_ids":["q-learning","deep-q-network","twin-delayed-ddpg","target-network","extrapolation-error","conservative-q-learning"],"name":"Q 值高估","alt":"Overestimation Bias","abbr":"","aliases":["过估计偏差","Q 值过估计","最大化偏差（Maximization Bias）"],"one_liner":"Q 学习取最大值时把估计噪声一起放大，导致动作价值被系统性高估。","explanation":"Q 学习的更新目标里有一步：取下一状态所有动作 Q 值中的最大值。Q 值本身是带噪声的估计，对一组有误差的数取最大，结果在期望上会偏高；这个偏差又通过自举一轮轮往回传，让智能体偏爱被高估的动作，策略变差。Thrun 和 Schwartz 1993 年就指出了这一问题。van Hasselt 提出 Double Q-learning，用一组估计选动作、另一组估计评价值，2015 年又与 DeepMind 同事把它做成 Double DQN，证实原版 DQN 在一些 Atari 游戏上高估明显。连续控制中的 TD3 取两个评论家网络的较小值来压制高估，SAC 也沿用这一做法。离线强化学习里，对数据中没出现过的动作的高估更严重，保守 Q 学习等方法专门处理这一点。","example":"TD3 同时训练两个评论家网络，计算目标值时取两者中较小的那个（裁剪双 Q 学习），宁可略微低估也不高估，从而让训练更稳定。","related":["Q 学习","深度 Q 网络","双延迟深度确定性策略梯度","目标网络","外推误差","保守 Q 学习"]},{"id":"distributional-value-function","category":"training","sec":5,"tier":3,"sources":[{"title":"A Distributional Perspective on Reinforcement Learning (arXiv:1707.06887)","url":"https://arxiv.org/abs/1707.06887"},{"title":"π*0.6: a VLA That Learns From Experience (arXiv:2511.14759)","url":"https://arxiv.org/abs/2511.14759"},{"title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies (arXiv:2605.00416)","url":"https://arxiv.org/abs/2605.00416"}],"as_of":"2026-09","related_ids":["value-function","bellman-equation","return","recap","pi-star-0-6","cross-entropy"],"name":"分布式价值函数","alt":"Distributional Value Function","abbr":"","aliases":["分布式强化学习","Distributional RL","分布型价值函数","价值分布","Value Distribution"],"one_liner":"不只预测平均回报，而是预测未来回报完整概率分布的价值函数。","explanation":"普通价值函数只输出未来回报（累计奖励）的期望值；分布式价值函数输出回报各种可能取值的完整分布。DeepMind 的 Bellemare、Dabney、Munos 在 2017 年 ICML 论文中系统提出这一视角，给出分布式贝尔曼方程和 C51 算法（用 51 个离散取值点表示回报分布），在 Atari 上取得当时最好成绩。常见实现是把回报切成若干区间，网络输出每个区间的概率，用交叉熵训练，比直接回归一个数更稳定，也能反映不确定性。近年的 VLA 强化学习方法常用它当评价器（critic）。","example":"Physical Intelligence 的 π*0.6（RECAP）训练了一个多任务分布式价值函数：把「距成功还剩多少步」的回报离散成若干区间、用交叉熵训练，再据此估计优势来筛选好动作；智元等团队的 LWD（2026）也用分布式隐式价值学习（DIVL）处理机群采回的稀疏奖励数据。","related":["价值函数","贝尔曼方程","回报","RECAP","π*0.6","交叉熵"]},{"id":"deterministic-vs-stochastic-policy","category":"training","sec":5,"tier":3,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL (Policies)","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"Deterministic Policy Gradient Algorithms (ICML 2014)","url":"https://proceedings.mlr.press/v32/silver14.html"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["policy","gaussian-policy","action-multimodality","deep-deterministic-policy-gradient","diffusion-policy","exploration-vs-exploitation"],"name":"确定性策略 / 随机策略","alt":"Deterministic vs. Stochastic Policy","abbr":"","aliases":["确定性策略","随机策略","Deterministic Policy","Stochastic Policy"],"one_liner":"确定性策略同一状态总给同一动作；随机策略给出动作的概率分布再采样。","explanation":"这是按输出形式对策略（从观测到动作的映射）做的分类。确定性策略写作 a = μ(s)，同一状态永远输出同一个动作；随机策略写作 a ~ π(·|s)，输出的是动作的概率分布，每次采样可能不同。离散动作常用分类分布，像分类器一样用 softmax 给出各动作概率；连续动作常用对角高斯分布，网络输出均值和对数标准差。强化学习里随机策略自带探索，PPO、SAC 用的都是它；DDPG、TD3 用确定性策略，训练时另外加噪声探索，好处是策略梯度估计更高效。模仿学习里用均方误差回归的行为克隆本质上是确定性的，演示中同一场景有多种做法时会被平均成一个错误动作；扩散策略、高斯混合模型等随机策略能表示这种动作多峰性。","example":"机械臂绕过障碍物去抓杯子，演示里一半从左绕、一半从右绕。用均方误差回归的确定性策略会输出两者的平均，直直撞向障碍物；扩散策略这类随机策略每次采样会落在左绕或右绕中的一种。","related":["策略","高斯策略","动作多峰性","深度确定性策略梯度","扩散策略","探索与利用"]},{"id":"deep-deterministic-policy-gradient","category":"training","sec":5,"tier":3,"sources":[{"title":"Continuous control with deep reinforcement learning (arXiv 1509.02971)","url":"https://arxiv.org/abs/1509.02971"},{"title":"OpenAI Spinning Up: Deep Deterministic Policy Gradient","url":"https://spinningup.openai.com/en/latest/algorithms/ddpg.html"},{"title":"Hindsight Experience Replay (arXiv 1707.01495)","url":"https://arxiv.org/abs/1707.01495"}],"as_of":"","related_ids":["twin-delayed-ddpg","soft-actor-critic","deep-q-network","deterministic-vs-stochastic-policy","off-policy","hindsight-experience-replay"],"name":"深度确定性策略梯度","alt":"Deep Deterministic Policy Gradient","abbr":"DDPG","aliases":[],"one_liner":"把 DQN 扩展到连续动作的演员-评论家算法，策略直接输出一个确定动作。","explanation":"DDPG 由 DeepMind 的 Lillicrap 等人在 2015 年提出（ICLR 2016），理论基础是 Silver 等人 2014 年的确定性策略梯度（DPG）。DQN 只能处理离散动作，因为要在所有动作里找 Q 值最大的那个，而机械臂关节角这类连续动作没法逐一枚举。DDPG 用两个网络：评论家学 Q 函数，演员（策略网络）直接输出一个确定动作，并沿着「让 Q 值变大」的梯度方向更新。它是异策略算法，沿用 DQN 的经验回放和目标网络，训练时在动作上加噪声来探索。原论文在 20 多个仿真物理任务上验证，其中不少任务可以直接从像素学习。DDPG 对超参数敏感、容易高估 Q 值，后来的 TD3（双延迟 DDPG）针对高估做了改进，SAC 等算法在实践中也更常用。","example":"OpenAI 2017 年的后见之明经验回放（HER）实验，就是用 DDPG 在仿真中训练 7 自由度 Fetch 机械臂完成推物、滑动、抓取放置任务，并把策略部署到了真实机器人上。","related":["双延迟深度确定性策略梯度","软演员-评论家","深度 Q 网络","确定性策略 / 随机策略","异策略","后见之明经验回放"]},{"id":"twin-delayed-ddpg","category":"training","sec":5,"tier":2,"sources":[{"title":"Addressing Function Approximation Error in Actor-Critic Methods (TD3, arXiv 1802.09477)","url":"https://arxiv.org/abs/1802.09477"},{"title":"OpenAI Spinning Up: Twin Delayed DDPG","url":"https://spinningup.openai.com/en/latest/algorithms/td3.html"},{"title":"A Minimalist Approach to Offline Reinforcement Learning (TD3+BC, arXiv 2106.06860)","url":"https://arxiv.org/abs/2106.06860"}],"as_of":"","related_ids":["deep-deterministic-policy-gradient","overestimation-bias","target-network","soft-actor-critic","off-policy","value-function"],"name":"双延迟深度确定性策略梯度","alt":"Twin Delayed Deep Deterministic Policy Gradient","abbr":"TD3","aliases":["TD3 算法","Twin Delayed DDPG"],"one_liner":"在 DDPG 上加三处改进、专门抑制 Q 值高估的连续动作强化学习算法。","explanation":"TD3 由 Scott Fujimoto、Herke van Hoof、David Meger 在 ICML 2018 提出，是 DDPG（输出确定动作的演员-评论家算法）的改进版，属于异策略算法（可反复利用旧数据），只用于连续动作。DDPG 的 Q 网络容易高估动作价值，策略又会去钻这些高估的空子，训练常不稳定。TD3 用三招应对：同时训练两个 Q 网络，算目标值时取较小者（Twin）；Q 网络更新两次才更新一次策略和目标网络（Delayed）；给目标动作加截断噪声，让 Q 值随动作变化更平滑。它和 SAC 是连续控制最常用的两个基线，离线强化学习方法 TD3+BC 也以它为底座。","example":"原论文在 OpenAI Gym 的 MuJoCo 连续控制任务（如 HalfCheetah、Hopper、Walker2d）上测试，TD3 的表现超过了 DDPG 等当时的主流算法。","related":["深度确定性策略梯度","Q 值高估","目标网络","软演员-评论家","异策略","价值函数"]},{"id":"soft-actor-critic","category":"training","sec":5,"tier":2,"sources":[{"title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep RL with a Stochastic Actor (arXiv 1801.01290)","url":"https://arxiv.org/abs/1801.01290"},{"title":"Soft Actor Critic—Deep Reinforcement Learning with Real-World Robots (BAIR Blog, 2018)","url":"https://bair.berkeley.edu/blog/2018/12/14/sac/"},{"title":"Soft Actor-Critic (OpenAI Spinning Up)","url":"https://spinningup.openai.com/en/latest/algorithms/sac.html"}],"as_of":"","related_ids":["off-policy","entropy-regularization","q-function","experience-replay","twin-delayed-ddpg","serl"],"name":"软演员-评论家","alt":"Soft Actor-Critic","abbr":"SAC","aliases":["SAC 算法","最大熵演员-评论家"],"one_liner":"在追求高回报的同时鼓励动作保持随机的异策略强化学习算法。","explanation":"SAC 由伯克利 Tuomas Haarnoja、Sergey Levine 等人 2018 年提出（ICML 2018）。它属于演员-评论家方法：「演员」是输出动作的策略网络，「评论家」是估计动作好坏的 Q 函数。核心是最大熵目标：在最大化回报的同时让策略尽量随机（熵高），以鼓励探索、避免过早收敛到次优解，随机程度由温度系数 α 控制，后续版本可自动调节 α。它是异策略算法，能反复利用经验回放里的旧数据，因此样本效率高、对超参数不敏感，只用于连续动作空间。实现上同时学两个 Q 网络并取较小值，以抑制 Q 值高估。SAC 是真机强化学习的常用底座，SERL、HIL-SERL 用的 RLPD 算法就是在 SAC 基础上改进的。","example":"SAC 的扩展论文把它用在真机上：Minitaur 四足机器人约 2 小时学会行走，Sawyer 机械臂约 2 小时学会堆积木，灵巧手直接从图像学会转阀门约需 20 小时。","related":["异策略","熵正则化","Q 函数","经验回放","双延迟深度确定性策略梯度","SERL"]},{"id":"entropy-regularization","category":"training","sec":5,"tier":3,"sources":[{"title":"OpenAI Spinning Up: Soft Actor-Critic (Entropy-Regularized RL)","url":"https://spinningup.openai.com/en/latest/algorithms/sac.html"},{"title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep RL with a Stochastic Actor (arXiv:1801.01290)","url":"https://arxiv.org/abs/1801.01290"},{"title":"legged_gym: legged_robot_config.py","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"}],"as_of":"","related_ids":["soft-actor-critic","proximal-policy-optimization","exploration-vs-exploitation","entropy-collapse-mode-collapse","kl-regularization","deterministic-vs-stochastic-policy"],"name":"熵正则化","alt":"Entropy Regularization","abbr":"","aliases":["最大熵强化学习","熵奖励","熵正则","Entropy Bonus","Maximum Entropy RL"],"one_liner":"在训练目标里加一项策略熵的奖励，鼓励策略保持随机、多做探索。","explanation":"熵衡量一个概率分布有多随机：均匀分布熵高，几乎确定的分布熵低。熵正则化在强化学习目标里加上 α 乘以策略熵（α 是权重系数），让智能体在追求回报的同时保留一定随机性，避免过早收敛到次优行为。常见用法有两种：一是在 PPO 等策略梯度算法的损失里加一个小的熵奖励项；二是把熵直接写进优化目标，形成最大熵强化学习，代表是 Haarnoja 等人 2018 年提出的 SAC（软演员-评论家），它的 Q 值目标里也带熵项。α 太大，策略会一直乱动；太小，又容易熵坍缩、过早停止探索。","example":"legged_gym 默认的 PPO 配置里熵系数 entropy_coef 设为 0.01，即在损失中加入 0.01 倍的策略熵奖励。","related":["软演员-评论家","近端策略优化","探索与利用","熵坍缩 / 模式坍缩","KL 正则化","确定性策略 / 随机策略"]},{"id":"entropy-collapse-mode-collapse","category":"training","sec":5,"tier":3,"sources":[{"title":"NIPS 2016 Tutorial: Generative Adversarial Networks (arXiv:1701.00160)","url":"https://arxiv.org/abs/1701.00160"},{"title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models (arXiv:2505.22617)","url":"https://arxiv.org/abs/2505.22617"},{"title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning (arXiv:2509.09674)","url":"https://arxiv.org/abs/2509.09674"}],"as_of":"","related_ids":["entropy-regularization","exploration-vs-exploitation","generative-adversarial-network","action-multimodality","group-relative-policy-optimization","simplevla-rl"],"name":"熵坍缩 / 模式坍缩","alt":"Entropy Collapse / Mode Collapse","abbr":"","aliases":["策略熵坍缩","模式崩塌","模式崩溃","Policy Entropy Collapse","Helvetica Scenario"],"one_liner":"模型输出的多样性塌缩，只会给出少数几种答案或动作。","explanation":"两个词说的是同一类现象。模式坍缩最早用于 GAN（生成对抗网络）：Goodfellow 在 2016 年教程中描述，生成器把不同输入噪声映射到同一类输出，只覆盖数据分布里的一两个「模式」。熵坍缩多用于强化学习：策略的熵（随机程度）在训练早期迅速下降，模型几乎只输出一种行为、不再探索，性能随之见顶；Cui 等人 2025 年在大模型推理强化学习中系统分析了它，并提出 Clip-Cov、KL-Cov 来维持熵。机器人动作本有多峰性，VLA 做强化学习微调时常用提高采样温度、放宽裁剪上界、加熵奖励等办法缓解坍缩。","example":"SimpleVLA-RL 在对 OpenVLA-OFT 做 GRPO 强化学习时，用动态采样、调高 PPO 式裁剪的上界（参考 DAPO 的 Clip-Higher）和提高推演采样温度三项改动来加强探索。","related":["熵正则化","探索与利用","生成对抗网络","动作多峰性","组相对策略优化","SimpleVLA-RL"]},{"id":"update-to-data-ratio","category":"training","sec":5,"tier":3,"sources":[{"title":"Chen et al. 2021: Randomized Ensembled Double Q-Learning: Learning Fast Without a Model (REDQ, ICLR 2021)","url":"https://arxiv.org/abs/2101.05982"},{"title":"Smith, Kostrikov, Levine 2022: A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning","url":"https://arxiv.org/abs/2208.07860"},{"title":"Luo et al. 2024: SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning","url":"https://arxiv.org/abs/2401.16013"}],"as_of":"","related_ids":["sample-efficiency","experience-replay","off-policy","real-world-reinforcement-learning","serl","overestimation-bias"],"name":"更新-数据比","alt":"Update-to-Data Ratio","abbr":"UTD","aliases":["UTD 比","UTD Ratio","重放比","Replay Ratio"],"one_liner":"每采集一步环境数据做几次梯度更新；越高越省数据，也越费算力。","explanation":"更新-数据比指离策略强化学习里，每和环境交互一步、往经验回放里加一条数据后，网络做多少次梯度更新。标准 SAC 通常取 1。真机强化学习里采数据慢而贵，算力相对便宜，于是希望调高这个比值，把同一批数据多学几遍。但直接调高容易让 Q 函数过拟合和高估，训练变差。REDQ（ICLR 2021）用 Q 网络集成，首次让无模型算法在 UTD 远大于 1 时稳定工作；DroQ 改用 dropout 和层归一化，计算更省。SERL 等真机强化学习框架依赖高 UTD 提高样本效率，并把采集和训练拆成两个线程。","example":"「A Walk in the Park」（2022）在宇树 A1 四足上以 SAC 为基础，加层归一化并把 UTD 提到 20，即每采一步数据做 20 次评论家更新，约 20 分钟真机训练学会行走。","related":["样本效率","经验回放","异策略","真机强化学习","SERL","Q 值高估"]},{"id":"multi-agent-reinforcement-learning","category":"training","sec":5,"tier":3,"sources":[{"title":"Albrecht, Christianos, Schäfer: Multi-Agent Reinforcement Learning: Foundations and Modern Approaches (MIT Press, 2024)","url":"https://www.marl-book.com/"},{"title":"Wikipedia: Multi-agent reinforcement learning","url":"https://en.wikipedia.org/wiki/Multi-agent_reinforcement_learning"},{"title":"Yu et al. 2021: The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games (MAPPO)","url":"https://arxiv.org/abs/2103.01955"}],"as_of":"","related_ids":["reinforcement-learning","multi-robot-collaboration","self-play","swarm-intelligence","partially-observable-markov-decision-process","proximal-policy-optimization"],"name":"多智能体强化学习","alt":"Multi-Agent Reinforcement Learning","abbr":"MARL","aliases":["多智能体 RL"],"one_liner":"多个智能体在同一环境里同时学习，彼此合作或竞争的强化学习。","explanation":"多智能体强化学习研究多个会学习的决策者共享一个环境的情形，按奖励关系分为完全合作（共享同一奖励）、完全竞争（零和博弈，如下棋）和混合型（如自动驾驶车辆各自赶路又都要避免相撞）。与单智能体相比，最大难点是非平稳性：其他智能体也在不断改变策略，对每个智能体来说环境一直在变，单智能体算法的收敛保证随之失效；此外还有信用分配和部分可观测等问题。常用思路是「集中训练、分散执行」，训练时让评论家看到全局信息，执行时各自只看局部观测，如 2017 年的 MADDPG 和 2021 年的 MAPPO。多机器人协作、机器人足球和对抗式自博弈训练都会用到它。","example":"MAPPO 让每个作战单位各由一个基于 PPO 的智能体控制，在星际争霸多智能体挑战（SMAC）、谷歌足球等基准上取得了与异策略方法相当甚至更好的成绩。","related":["强化学习","多机器人协作","自博弈","群体智能","部分可观测马尔可夫决策过程","近端策略优化"]},{"id":"self-play","category":"training","sec":5,"tier":3,"sources":[{"title":"Google DeepMind Blog: AlphaGo Zero: Starting from scratch","url":"https://deepmind.google/discover/blog/alphago-zero-starting-from-scratch/"},{"title":"Haarnoja et al. 2023: Learning Agile Soccer Skills for a Bipedal Robot with Deep Reinforcement Learning","url":"https://arxiv.org/abs/2304.13653"}],"as_of":"","related_ids":["multi-agent-reinforcement-learning","reinforcement-learning","monte-carlo-tree-search","curriculum-learning","population-based-training","op3-soccer"],"name":"自博弈","alt":"Self-Play","abbr":"","aliases":["自我对弈","自对弈"],"one_liner":"让智能体和自己（或自己的历史版本）对战，从胜负中不断变强。","explanation":"自博弈是多智能体强化学习中的一种训练方式：对手不是人或固定脚本，而是智能体自己的当前或历史版本。自己变强，对手也同步变强，相当于自动生成难度递增的课程，而且不需要人类对局数据。最著名的是 DeepMind 2017 年的 AlphaGo Zero：从随机落子开始，只靠自我对弈加蒙特卡洛树搜索，训练 3 天后以 100:0 战胜此前击败人类冠军的 AlphaGo 版本。机器人里，对抗类任务常用它，例如 DeepMind 让小型人形机器人 OP3 学一对一踢球：先分别训练起身和进球技能，再把两者蒸馏进一个策略，并与自己的历史快照对抗。只和最新的自己打容易来回兜圈子，所以通常从历史版本池里抽对手。","example":"OP3 踢球训练中，对手从智能体自身定期保存的历史快照池中抽取；消融实验显示，去掉自博弈训练的智能体即使面对固定对手也表现更差。","related":["多智能体强化学习","强化学习","蒙特卡洛树搜索","课程学习","基于群体的训练","OP3 足球（DeepMind 双足踢球）"]},{"id":"sparse-reward","category":"training","sec":6,"tier":2,"sources":[{"title":"Hindsight Experience Replay (arXiv 1707.01495)","url":"https://arxiv.org/abs/1707.01495"},{"title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)","url":"https://arxiv.org/html/2410.21845"}],"as_of":"","related_ids":["dense-reward","reward-shaping","hindsight-experience-replay","success-detector","exploration-vs-exploitation","hil-serl"],"name":"稀疏奖励","alt":"Sparse Reward","abbr":"","aliases":["二值奖励","成功奖励","Binary Reward"],"one_liner":"只在完成任务等少数时刻给奖励，其余时间奖励都是 0。","explanation":"稀疏奖励指环境绝大部分时间奖励为零，只有达成目标时才给信号，最典型的是二值奖励：成功记 1，否则记 0。好处是定义简单、不易被钻空子，直接对应「任务到底完成没有」；难点是智能体随机探索时很难碰巧成功，长时间拿不到任何学习信号，任务越长越难。常见对策有：用奖励塑形补充中间提示（相对的做法叫稠密奖励）、用人类演示给出成功样例、后见之明经验回放（HER，把失败轨迹实际到达的位置当作目标重新标注，从而变成「成功」样本）、课程学习由易到难。真机强化学习里常训练一个成功检测器来自动给出这种 0/1 奖励。","example":"HIL-SERL 为每个任务遥操作采集约 200 个成功画面和 1000 个失败画面，训练一个二分类器当奖励：只有分类器判定任务完成时给正奖励，其余为 0；分类器在评估集上的准确率一般超过 95%。","related":["稠密奖励","奖励塑形","后见之明经验回放","成功检测器","探索与利用","HIL-SERL"]},{"id":"dense-reward","category":"training","sec":6,"tier":2,"sources":[{"title":"Gymnasium-Robotics: Fetch Reach","url":"https://robotics.farama.org/envs/fetch/reach/"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)","url":"https://arxiv.org/html/2109.11978"}],"as_of":"","related_ids":["sparse-reward","reward-shaping","reward-function","reward-engineering","reward-hacking","eureka"],"name":"稠密奖励","alt":"Dense Reward","abbr":"","aliases":["密集奖励","稠密回报"],"one_liner":"几乎每一步都给反馈、告诉智能体离目标更近还是更远的奖励设计。","explanation":"稠密奖励指强化学习中几乎每个时间步都给出有信息量的奖励，与只在任务成功时才给奖励的稀疏奖励相对。它通常由人把任务拆成若干项加权相加，如到目标的距离、速度跟踪误差、能耗惩罚。好处是智能体从一开始就知道往哪个方向改进，学得快；腿足运控的强化学习几乎都用稠密奖励。代价是设计费力，各项权重没调好时，智能体会钻空子刷分而不完成真正的目标，即奖励黑客。Eureka 等工作尝试让大模型自动写这类奖励函数代码。","example":"Gymnasium-Robotics 的 FetchReach 有两个版本：稀疏版在末端离目标超过 5 厘米时每步给 -1、到达给 0；稠密版 FetchReachDense 每步给末端到目标的负欧氏距离。legged_gym 的四足行走奖励由速度跟踪、关节力矩惩罚、碰撞惩罚等多项组成，每个仿真步都计算。","related":["稀疏奖励","奖励塑形","奖励函数","奖励工程","奖励黑客","Eureka"]},{"id":"reward-shaping","category":"training","sec":6,"tier":2,"sources":[{"title":"Policy Invariance Under Reward Transformations: Theory and Application to Reward Shaping (Ng, Harada, Russell, ICML 1999)","url":"https://ai.stanford.edu/~ang/papers/shaping-icml99.pdf"},{"title":"Reward Hacking in Reinforcement Learning (Lilian Weng, 2024)","url":"https://lilianweng.github.io/posts/2024-11-28-reward-hacking/"}],"as_of":"","related_ids":["sparse-reward","dense-reward","reward-function","reward-engineering","reward-hacking","eureka"],"name":"奖励塑形","alt":"Reward Shaping","abbr":"","aliases":["奖励整形","奖励成形","基于势函数的奖励塑形","Potential-based Reward Shaping"],"one_liner":"在任务原始奖励之外加上中间引导分，让智能体更快学会任务。","explanation":"奖励塑形指在任务本身的奖励（例如只在成功时给 1 分）之外，额外加入对中间进展的奖励，比如机械臂离目标越近分越高。它主要解决稀疏奖励下智能体长时间拿不到反馈、学不动的问题。风险是加错会改变「最优行为」：经典例子是骑自行车的智能体因为「靠近目标有奖励、远离不扣分」，学会绕着目标转小圈。Ng、Harada、Russell 在 1999 年 ICML 论文中证明，只要附加奖励写成势函数之差 F=γΦ(s′)−Φ(s)（Φ 给每个状态打分，γ 是折扣因子），最优策略就不会改变，这叫基于势函数的奖励塑形。具身智能里腿足运控的奖励通常由速度跟踪、姿态、能耗、足端腾空时间等多项加权组成，本质就是大量手工塑形；Eureka 等工作尝试让大模型自动写这类奖励代码。","example":"训练机械臂把方块推到目标点：原始奖励只在方块到位时给 1；塑形后每一步再奖励「夹爪到方块的距离缩短了多少」和「方块到目标的距离缩短了多少」，策略在训练早期就能拿到学习信号。","related":["稀疏奖励","稠密奖励","奖励函数","奖励工程","奖励黑客","Eureka"]},{"id":"reward-engineering","category":"training","sec":6,"tier":2,"sources":[{"title":"Eureka: Human-Level Reward Design via Coding Large Language Models","url":"https://arxiv.org/abs/2310.12931"},{"title":"legged_gym: legged_robot_config.py (reward scales)","url":"https://raw.githubusercontent.com/leggedrobotics/legged_gym/master/legged_gym/envs/base/legged_robot_config.py"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning","url":"https://arxiv.org/abs/2109.11978"}],"as_of":"","related_ids":["reward-function","reward-shaping","sparse-reward","dense-reward","reward-hacking","eureka"],"name":"奖励工程","alt":"Reward Engineering","abbr":"","aliases":["奖励设计","Reward Design","奖励函数设计"],"one_liner":"为强化学习设计和调试奖励函数，让机器人学到真正想要的行为。","explanation":"奖励工程指为强化学习任务设计奖励函数的整套工作：放哪些奖励项、各项权重多大、什么时候给、怎样防止被钻空子。只有「成功 +1」这种稀疏奖励时，智能体很难碰巧拿到正反馈，于是常加稠密的中间奖励（奖励塑形），比如离目标越近分越高。机器人运动控制的奖励常由十几项组成，既奖励跟上速度指令，也惩罚力矩过大、动作抖动、身体碰撞，权重要反复试，设计不当就会出现奖励黑客。近年也用大模型自动写奖励：Eureka 让 GPT-4 迭代生成奖励代码，在 29 个环境中 83% 的任务超过人类专家写的奖励。","example":"legged_gym 四足行走的默认奖励：跟踪线速度指令（权重 1.0）、跟踪角速度（0.5）、惩罚竖直方向速度（−2.0）、惩罚关节力矩和加速度、惩罚动作变化率（−0.01）和身体碰撞（−1），并奖励足端腾空时间（1.0）。","related":["奖励函数","奖励塑形","稀疏奖励","稠密奖励","奖励黑客","Eureka"]},{"id":"reward-hacking","category":"training","sec":6,"tier":2,"sources":[{"title":"Concrete Problems in AI Safety (Amodei et al., 2016)","url":"https://arxiv.org/abs/1606.06565"},{"title":"Google DeepMind: Specification gaming: the flip side of AI ingenuity","url":"https://deepmind.google/discover/blog/specification-gaming-the-flip-side-of-ai-ingenuity/"},{"title":"Lilian Weng: Reward Hacking in Reinforcement Learning","url":"https://lilianweng.github.io/posts/2024-11-28-reward-hacking/"}],"as_of":"","related_ids":["reward-engineering","reward-shaping","reward-model","reinforcement-learning-from-human-feedback","safe-reinforcement-learning"],"name":"奖励黑客","alt":"Reward Hacking","abbr":"","aliases":["奖励投机","Reward Exploitation","规格博弈","Specification Gaming","奖励作弊"],"one_liner":"智能体钻奖励函数的漏洞拿高分，却没完成设计者真正想要的任务。","explanation":"奖励黑客指强化学习智能体利用奖励函数的缺陷拿到高奖励，却没真正学会目标任务。Amodei 等人 2016 年的《Concrete Problems in AI Safety》把它列为 AI 安全的五个具体问题之一；DeepMind 2020 年称同类现象为「规格博弈」：满足了目标的字面规定，却没达到本意。根源是奖励只是真实目标的近似，优化越用力偏差越容易被放大（古德哈特定律），能力更强的智能体往往更会钻空子。机器人仿真里它常表现为利用物理引擎漏洞，RLHF 中模型可能学会讨好奖励模型。应对办法是反复检查奖励、人工看回放、加约束项。","example":"DeepMind 列举的案例：要机械臂把红积木叠到蓝积木上，奖励按红积木底面的高度算，机械臂就学会直接把红积木翻个面；另一个仿真机械手学会挡在相机和物体之间，看起来像抓住了物体。","related":["奖励工程","奖励塑形","奖励模型","基于人类反馈的强化学习","安全强化学习"]},{"id":"inverse-reinforcement-learning","category":"training","sec":6,"tier":2,"sources":[{"title":"Apprenticeship learning（Wikipedia，含 Inverse reinforcement learning 一节）","url":"https://en.wikipedia.org/wiki/Apprenticeship_learning"},{"title":"A Survey of Inverse Reinforcement Learning: Challenges, Methods and Progress (arXiv 1806.06877)","url":"https://arxiv.org/abs/1806.06877"}],"as_of":"","related_ids":["reinforcement-learning","reward-function","imitation-learning","generative-adversarial-imitation-learning","adversarial-motion-priors","behavior-cloning"],"name":"逆强化学习","alt":"Inverse Reinforcement Learning","abbr":"IRL","aliases":["反向强化学习","逆向强化学习"],"one_liner":"从专家的示范行为反推出它背后在优化的奖励函数。","explanation":"逆强化学习把强化学习倒过来用：强化学习是给定奖励函数（给行为打分的规则）去学策略，逆强化学习则是观察专家示范，反推专家在优化什么奖励。Stuart Russell 在 1998 年提出这个问题，Andrew Ng 与 Russell 在 2000 年给出第一批算法，Abbeel 与 Ng 在 2004 年把它用于「学徒学习」：先推出奖励，再用强化学习求策略。它的价值在于很多任务的奖励难以手写，而学到的奖励比直接照抄动作更容易迁移到新环境。难点是同一段行为可以用很多种奖励解释，需要最大熵等额外假设来消除歧义。后来的生成对抗模仿学习（GAIL）、对抗运动先验（AMP）都延续了这条思路。","example":"Abbeel、Coates 与 Ng 用学徒学习让无人直升机从人类飞手的示范中学会翻滚、筋斗、自转着陆等特技动作，而不是靠人手写奖励函数。","related":["强化学习","奖励函数","模仿学习","生成对抗模仿学习","对抗运动先验","行为克隆"]},{"id":"generative-adversarial-imitation-learning","category":"training","sec":6,"tier":3,"sources":[{"title":"Generative Adversarial Imitation Learning (Ho & Ermon, arXiv 1606.03476)","url":"https://arxiv.org/abs/1606.03476"}],"as_of":"","related_ids":["inverse-reinforcement-learning","imitation-learning","behavior-cloning","generative-adversarial-network","adversarial-motion-priors","trust-region-policy-optimization"],"name":"生成对抗模仿学习","alt":"Generative Adversarial Imitation Learning","abbr":"GAIL","aliases":[],"one_liner":"用判别器区分专家动作和策略动作，逼着策略学得像专家的模仿学习方法。","explanation":"斯坦福的 Jonathan Ho 和 Stefano Ermon 在 2016 年提出。传统路线是先用逆强化学习（从示范反推奖励函数）恢复专家的奖励，再用强化学习训策略，两步走又慢又绕。GAIL 借用生成对抗网络的结构：判别器负责分辨一个状态-动作对来自专家示范还是来自当前策略，策略把判别器的输出当作奖励，用 TRPO（一种限制每步更新幅度的策略梯度算法）更新，直到判别器分不出来。它要和环境反复交互，所以多在仿真里用，但比行为克隆更不容易出现复合误差（小错越积越大）。人形机器人和角色动画里常用的对抗运动先验（AMP）就是沿着这种对抗式模仿的思路发展出来的。","example":"原论文在 MuJoCo 仿真的人形行走等任务上，只给几条专家轨迹、不给奖励函数，GAIL 训出的策略大多能达到专家表现的七成以上。","related":["逆强化学习","模仿学习","行为克隆","生成对抗网络","对抗运动先验","信赖域策略优化"]},{"id":"adversarial-motion-priors","category":"training","sec":6,"tier":3,"sources":[{"title":"AMP: Adversarial Motion Priors for Stylized Physics-Based Character Control (arXiv 2104.02180)","url":"https://arxiv.org/abs/2104.02180"},{"title":"Adversarial Motion Priors Make Good Substitutes for Complex Reward Functions (arXiv 2203.15103)","url":"https://arxiv.org/abs/2203.15103"}],"as_of":"","related_ids":["generative-adversarial-imitation-learning","reward-engineering","deepmimic","ase","motion-tracking","sim-to-real-transfer"],"name":"对抗运动先验","alt":"Adversarial Motion Priors","abbr":"AMP","aliases":["AMP 风格奖励","对抗运动先验奖励"],"one_liner":"用判别器评判动作像不像动捕数据，把「像不像」当奖励来学自然动作。","explanation":"AMP 由 Xue Bin Peng、Pieter Abbeel、Sergey Levine、Angjoo Kanazawa 等人 2021 年提出，最初用于仿真角色动画。它借鉴生成对抗模仿学习：训练一个判别器，输入相邻两帧状态，判断这段运动来自参考动作数据集还是来自策略；策略把骗过判别器的程度当作风格奖励，与任务奖励（如按指令速度前进）加权相加后用强化学习优化。好处是不必手写模仿目标，也不用挑选要跟踪的动作片段，一堆无结构的动捕片段就能让动作自然。2022 年 Escontrela 等人把它用到 Unitree A1 四足机器人上，只用约 4.5 秒德牧动捕数据就学出了自然且节能的步态，常被用来替代繁琐的奖励工程。","example":"Escontrela 等人在 A1 上把风格奖励权重设为 0.65、任务奖励设为 0.35，机器狗学出类似真狗的步态，并能随速度自然切换步态，直接迁移到真机。","related":["生成对抗模仿学习","奖励工程","DeepMimic","ASE（对抗技能嵌入）","运动跟踪","仿真到现实迁移"]},{"id":"reward-model","category":"training","sec":6,"tier":2,"sources":[{"title":"Deep reinforcement learning from human preferences (Christiano et al., arXiv 1706.03741)","url":"https://arxiv.org/abs/1706.03741"},{"title":"Training language models to follow instructions with human feedback (InstructGPT, arXiv 2203.02155)","url":"https://arxiv.org/abs/2203.02155"},{"title":"Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons (arXiv 2603.02115)","url":"https://arxiv.org/abs/2603.02115"}],"as_of":"2026-05","related_ids":["reward-function","reinforcement-learning-from-human-feedback","progress-reward-model","success-detector","vlm-as-reward","reward-hacking"],"name":"奖励模型","alt":"Reward Model","abbr":"RM","aliases":["学习式奖励","Learned Reward Model","奖励打分模型"],"one_liner":"训练出来的打分网络，给一段行为或结果打出「做得好不好」的奖励分。","explanation":"奖励模型是一个经过训练的神经网络：输入一段行为（机器人轨迹视频、大模型的一个回答等），输出一个奖励分，用来代替人手写的奖励函数。代表性工作是 Christiano 等人 2017 年用人类对两段轨迹的偏好比较来训练奖励模型，只花约一小时人工反馈就教会模拟机器人新动作；OpenAI 2022 年的 InstructGPT 把它放进 RLHF（基于人类反馈的强化学习）流程，成为大模型后训练的标准一步。机器人里很多任务难以写出精确奖励（比如「衣服叠整齐没有」），奖励模型让强化学习、失败检测、数据筛选有了可用信号。常见形式有成功检测器、进度奖励模型、直接让 VLM 打分；风险是策略会钻模型的漏洞，即奖励黑客。","example":"Robometer（RSS 2026）在 100 多万条、包含大量失败和次优轨迹的数据集 RBM-1M 上训练，同时学「每一帧的任务进度」和「同一任务两条轨迹哪条更好」，得到可跨多种机器人使用的通用奖励模型。","related":["奖励函数","基于人类反馈的强化学习","进度奖励模型","成功检测器","VLM 作奖励模型","奖励黑客"]},{"id":"progress-reward-model","category":"training","sec":6,"tier":3,"sources":[{"title":"Ma et al. 2024: Vision Language Models are In-Context Value Learners (GVL)","url":"https://arxiv.org/abs/2411.04549"},{"title":"Liang et al. 2026: Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons","url":"https://arxiv.org/abs/2603.02115"},{"title":"Ayalew et al. 2024: PROGRESSOR","url":"https://arxiv.org/abs/2411.17764"}],"as_of":"2026-03","related_ids":["reward-model","sparse-reward","dense-reward","success-detector","generative-value-learning","robometer"],"name":"进度奖励模型","alt":"Progress Reward Model","abbr":"","aliases":["进度估计器","任务进度预测","Progress Estimator"],"one_liner":"看当前画面判断任务完成了几成，并把这个进度当作奖励的模型。","explanation":"进度奖励模型是一类机器人奖励模型：输入任务指令和当前画面（有时加上起始帧或历史帧），输出任务完成进度，通常归一化到 0 到 1。真实操作任务往往只有「成没成」这种稀疏奖励，强化学习很难从中学到东西；进度分数可以当作稠密奖励，让策略每一步都知道离目标近了还是远了，也能用来筛数据、判成败。做法主要有两种：直接让视觉语言模型零样本估计，如谷歌 DeepMind 等提出的 GVL；或在大量轨迹上专门训练，如 2026 年的 Robometer。风险是奖励黑客：策略可能学会让画面「看起来」有进展。","example":"GVL 把一条机器人视频的帧顺序打乱后交给 VLM，让它给每帧估计完成百分比，不做任何训练就能在 300 多个真实任务上给出可用的进度值，并用于数据筛选和成功检测。","related":["奖励模型","稀疏奖励","稠密奖励","成功检测器","GVL（生成式价值学习）","Robometer"]},{"id":"success-detector","category":"training","sec":6,"tier":3,"sources":[{"title":"Du et al. 2023: Vision-Language Models as Success Detectors","url":"https://arxiv.org/abs/2303.07280"},{"title":"Luo et al. 2024: Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)","url":"https://arxiv.org/abs/2410.21845"}],"as_of":"","related_ids":["reward-model","vlm-as-reward","sparse-reward","progress-reward-model","real-world-reinforcement-learning","hil-serl"],"name":"成功检测器","alt":"Success Detector","abbr":"","aliases":["成功判别器","Success Classifier","奖励分类器","Reward Classifier"],"one_liner":"判断机器人这一回合有没有把任务做成的模型，常用来给强化学习发奖励。","explanation":"成功检测器输入观测（通常是相机画面，有时加上任务指令），输出「成功 / 失败」或成功概率。强化学习、自动采数据和自动评测都要知道任务做没做完，真实世界没有仿真器那样现成的判定，只能靠人看或训模型来看。常见做法有两种：为单个任务训练二分类器，如 HIL-SERL 每个任务遥操作采约 200 个成功、1000 个失败样本；或直接用视觉语言模型问答，如 DeepMind 2023 年的 SuccessVQA 把判断改写成「任务完成了吗」的视觉问答，在 Flamingo 上微调。它给出的是稀疏奖励，误判会被策略钻空子，引发奖励黑客。","example":"HIL-SERL 给每个任务训练一个二分类器，看腕部和侧面相机画面判断是否成功，只有判定成功才给正奖励；据论文报告，分类器在评估集上的准确率一般超过 95%。","related":["奖励模型","VLM 作奖励模型","稀疏奖励","进度奖励模型","真机强化学习","HIL-SERL"]},{"id":"vlm-as-reward","category":"training","sec":6,"tier":3,"sources":[{"title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning (ICLR 2024)","url":"https://arxiv.org/abs/2310.12921"},{"title":"RoboCLIP: One Demonstration is Enough to Learn Robot Policies","url":"https://arxiv.org/abs/2310.07899"},{"title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback (ICML 2024)","url":"https://arxiv.org/abs/2402.03681"}],"as_of":"2024-07","related_ids":["reward-model","vision-language-model","clip","success-detector","progress-reward-model","generative-value-learning"],"name":"VLM 作奖励模型","alt":"VLM-as-Reward (Vision-Language Models as Reward Models)","abbr":"","aliases":["VLM 奖励","视觉语言模型奖励","VLM 奖励模型","VLM-RM"],"one_liner":"让视觉语言模型看画面、对照任务描述，给机器人的表现打奖励分","explanation":"把视觉语言模型（VLM，能同时看图和读文字的大模型）当作强化学习的奖励模型：输入任务描述和机器人拍到的画面，由它判断做得好不好。代表工作有 2023 年的 VLM-RM（用 CLIP 算画面与文字的相似度当奖励）、RoboCLIP（比对智能体视频与示范视频），和 ICML 2024 的 RL-VLM-F（让 VLM 对两张图给偏好，再学出奖励函数）。它针对奖励难手写的问题：叠衣服这类任务很难用公式定义「做成了」。局限是 VLM 空间推理弱、打分有噪声，策略可能钻漏洞（奖励黑客）。常用于强化学习微调、成功检测和数据筛选。","example":"VLM-RM 只给一句描述目标姿态的英文提示，用 CLIP 计算仿真渲染画面与提示的相似度作为奖励，就在 MuJoCo 里教会人形模型跪下、劈叉和盘腿莲花坐，没有手写任何奖励函数；论文还发现 VLM 越大，当奖励模型越好用。","related":["奖励模型","视觉语言模型","CLIP","成功检测器","进度奖励模型","GVL（生成式价值学习）"]},{"id":"intrinsic-motivation","category":"training","sec":6,"tier":3,"sources":[{"title":"Curiosity-driven Exploration by Self-supervised Prediction (ICM, arXiv:1705.05363)","url":"https://arxiv.org/abs/1705.05363"},{"title":"Exploration by Random Network Distillation (RND, arXiv:1810.12894)","url":"https://arxiv.org/abs/1810.12894"}],"as_of":"","related_ids":["exploration-vs-exploitation","sparse-reward","unsupervised-skill-discovery","reward-shaping","reinforcement-learning","active-exploration"],"name":"内在奖励","alt":"Intrinsic Motivation (Curiosity-Driven Exploration)","abbr":"","aliases":["好奇心驱动探索","内在动机","内部奖励","Intrinsic Reward"],"one_liner":"智能体自己给「新奇、预测不准」的状态发奖励，以此驱动探索。","explanation":"内在奖励指不来自任务本身、由智能体内部计算的奖励信号，常衡量状态有多新奇、或自己预测得有多不准，通常与环境给的外在奖励相加使用。它主要解决稀疏奖励下的探索难题：任务奖励很少出现时，靠随机尝试很难碰到。代表工作有 2017 年 Pathak 等人的 ICM，把「预测自身动作后果的误差」当作好奇心；2018 年 OpenAI 的 RND 用「预测一个固定随机网络输出的误差」作奖励，在 Atari 游戏《蒙特祖玛的复仇》上首次在不用示范的情况下超过人类平均分。机器人领域常把它用于探索和无监督技能发现。","example":"ICM 在《超级马里奥》里完全不给游戏得分，只奖励智能体「预测不准下一帧特征」的情况，智能体仍会主动往关卡深处探索。","related":["探索与利用","稀疏奖励","无监督技能发现","奖励塑形","强化学习","主动探索"]},{"id":"unsupervised-skill-discovery","category":"training","sec":6,"tier":3,"sources":[{"title":"Eysenbach et al. 2018: Diversity is All You Need: Learning Skills without a Reward Function","url":"https://arxiv.org/abs/1802.06070"},{"title":"Sharma et al. 2020: Emergent Real-World Robotic Skills via Unsupervised Off-Policy Reinforcement Learning","url":"https://arxiv.org/abs/2004.12974"},{"title":"Park, Rybkin, Levine 2023: METRA: Scalable Unsupervised RL with Metric-Aware Abstraction (ICLR 2024)","url":"https://arxiv.org/abs/2310.08887"}],"as_of":"","related_ids":["intrinsic-motivation","hierarchical-reinforcement-learning","exploration-vs-exploitation","behavior-foundation-model","bfm-zero","entropy-regularization"],"name":"无监督技能发现","alt":"Unsupervised Skill Discovery","abbr":"","aliases":["DIAYN","无奖励技能学习","Unsupervised Skill Learning"],"one_liner":"不给任务奖励，让智能体自己练出一组彼此可区分的技能，留给后续任务调用。","explanation":"无监督技能发现指在没有外部奖励时，让智能体自发学出多种不同行为。最有名的 DIAYN（Diversity is All You Need）由 Eysenbach、Levine 等人 2018 年提出：给策略输入一个技能编号，同时训练判别器从到达的状态猜是哪个技能，猜得越准内在奖励越高，再加最大熵项鼓励动作随机，本质是最大化技能与状态的互信息。模拟机器人因此自发学会了走、跳等动作。技能可作预训练初始化，或交给上层策略组合来解稀疏奖励任务。METRA（ICLR 2024）改在保留时间距离的隐空间里学技能，缓解了互信息方法探索不足的问题。","example":"Sharma 等人 2020 年把技能发现算法 DADS 改成离策略版本，在真实四足机器人上不给奖励和演示，学出了不同步态和朝向的行走技能，再用模型预测控制把它们串起来完成导航。","related":["内在奖励","分层强化学习","探索与利用","行为基础模型","BFM-Zero","熵正则化"]},{"id":"goal-conditioned-reinforcement-learning","category":"training","sec":6,"tier":3,"sources":[{"title":"Goal-Conditioned Reinforcement Learning: Problems and Solutions (IJCAI 2022 survey)","url":"https://arxiv.org/abs/2201.08299"},{"title":"Universal Value Function Approximators (ICML 2015)","url":"https://proceedings.mlr.press/v37/schaul15.html"}],"as_of":"","related_ids":["goal-conditioned-policy","hindsight-experience-replay","sparse-reward","value-function","goal-conditioned-behavior-cloning","hierarchical-reinforcement-learning"],"name":"目标条件强化学习","alt":"Goal-Conditioned Reinforcement Learning","abbr":"GCRL","aliases":[],"one_liner":"策略和价值函数都把目标当输入，一个模型学会到达多种目标的强化学习。","explanation":"普通强化学习通常只学一个固定任务；目标条件强化学习把策略写成 π(a|s,g)，同一个网络根据不同目标 g 执行不同任务，奖励往往就是「有没有到达目标」。代表性工作是 DeepMind 2015 年的通用价值函数近似器（UVFA），把价值函数扩展成 V(s,g)，能泛化到训练时没见过的目标。它最大的难点是奖励稀疏：大部分尝试都到不了目标，拿不到学习信号，所以常和后见之明经验回放（把没成功的轨迹改标成到达了实际位置）一起用。目标可以是坐标、图像或语言，机器人抓取、推物、导航都常写成这种形式，分层强化学习里的底层策略也常是目标条件的。","example":"机械臂推方块：目标是桌上任意一个位置，只有方块被推到目标附近才算成功，同一个策略学会把方块推到不同位置。","related":["目标条件策略","后见之明经验回放","稀疏奖励","价值函数","目标条件模仿学习","分层强化学习"]},{"id":"hindsight-experience-replay","category":"training","sec":6,"tier":3,"sources":[{"title":"Hindsight Experience Replay (arXiv 1707.01495)","url":"https://arxiv.org/abs/1707.01495"}],"as_of":"","related_ids":["sparse-reward","goal-conditioned-reinforcement-learning","experience-replay","hindsight-relabeling","deep-deterministic-policy-gradient","off-policy"],"name":"后见之明经验回放","alt":"Hindsight Experience Replay","abbr":"HER","aliases":["事后经验回放"],"one_liner":"把没达成的尝试改标成达成了实际到达的目标，让稀疏奖励也能学起来。","explanation":"OpenAI 的 Andrychowicz 等人 2017 年提出（NIPS 2017）。在只有成功或失败二值奖励的目标条件任务里，机器人早期几乎从不成功，回放池里全是失败样本，学不到东西。HER 的做法是：把一条失败轨迹再存一份，把目标换成这条轨迹实际到达的状态（比如最终状态，或之后某一时刻的状态），它就变成了一条成功样本。它能接在任何异策略算法（可以用旧数据学习的算法，如 DDPG）后面，效果上相当于自动生成的课程。原论文在 Fetch 机械臂上完成了推、滑、抓取放置任务，并把仿真里训出的策略部署到了真机上。这种事后重标注的思路后来被目标条件模仿学习等方法广泛借用。","example":"让机械臂把方块推到红点，结果推到了旁边 10 厘米处；HER 把这条轨迹的目标改写成推到那 10 厘米处，它就成了一条成功经验。","related":["稀疏奖励","目标条件强化学习","经验回放","事后重标注","深度确定性策略梯度","异策略"]},{"id":"hierarchical-reinforcement-learning","category":"training","sec":6,"tier":3,"sources":[{"title":"FeUdal Networks for Hierarchical Reinforcement Learning (arXiv 1703.01161)","url":"https://arxiv.org/abs/1703.01161"},{"title":"Data-Efficient Hierarchical Reinforcement Learning (HIRO, NeurIPS 2018)","url":"https://arxiv.org/abs/1805.08296"}],"as_of":"","related_ids":["hierarchical-architecture","dual-system-architecture","skill-primitive","long-horizon-task","goal-conditioned-reinforcement-learning","credit-assignment"],"name":"分层强化学习","alt":"Hierarchical Reinforcement Learning","abbr":"HRL","aliases":[],"one_liner":"把决策拆成高层定子目标、低层执行具体动作的多层强化学习。","explanation":"长任务如果直接从底层动作学起，奖励要隔很久才出现，信用分配（判断是哪一步导致了结果）很难。分层强化学习让高层策略以较低频率选子目标或技能，低层策略以较高频率输出具体动作去完成它。经典框架有 Sutton 等人 1999 年的选项（options）框架，以及 Dayan 与 Hinton 的封建式强化学习；深度学习时代有 DeepMind 2017 年的 FeUdal Networks（管理者设目标、执行者出动作），和 2018 年 Nachum、Levine 等人的 HIRO（高层给低层下发目标，并对旧数据做异策略修正）。今天具身智能里大模型规划加底层技能、快慢双系统等分层架构与它思路相通，但不一定用强化学习训练。","example":"HIRO 在仿真四足「蚂蚁」机器人走迷宫等任务中，高层每隔固定步数给出一个期望状态作为子目标，低层控制各条腿去达到它。","related":["分层架构","快慢双系统","原子技能","长程任务","目标条件强化学习","信用分配"]},{"id":"online-reinforcement-learning","category":"training","sec":7,"tier":2,"sources":[{"title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (Fig. 1)","url":"https://arxiv.org/html/2005.01643"},{"title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)","url":"https://arxiv.org/abs/2410.21845"}],"as_of":"","related_ids":["offline-reinforcement-learning","offline-to-online-reinforcement-learning","real-world-reinforcement-learning","reinforcement-fine-tuning","on-policy","off-policy"],"name":"在线强化学习","alt":"Online Reinforcement Learning","abbr":"Online RL","aliases":[],"one_liner":"边与环境交互边学习，训练中不断用最新策略采集新数据。","explanation":"强化学习最经典的设定：智能体用当前策略与环境交互，拿到新数据就更新策略，再用更新后的策略继续采集，循环往复。它既包括只用最新数据的同策略方法（如 PPO），也包括把历史数据存进回放缓冲区的异策略方法（如 SAC）；关键在于训练过程中能持续拿到新数据，这是它和离线强化学习的分界线。在线学习能主动探索、在自己犯的错误上改进，但需要大量交互：仿真里靠并行加速，真机上则受安全、时间和场景复位的限制。近年常见做法是先用演示或离线数据打底，再做在线强化学习微调，例如用 RL 继续提升 VLA。","example":"HIL-SERL 在真机上做在线强化学习，人在旁边随时纠正，1 到 2.5 小时内让机械臂在精密装配、双臂协作等任务上达到接近满分的成功率。","related":["离线强化学习","离线到在线强化学习","真机强化学习","强化学习微调","同策略","异策略"]},{"id":"offline-reinforcement-learning","category":"training","sec":7,"tier":2,"sources":[{"title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (Levine et al., 2020)","url":"https://arxiv.org/abs/2005.01643"},{"title":"Conservative Q-Learning for Offline Reinforcement Learning","url":"https://arxiv.org/abs/2006.04779"}],"as_of":"","related_ids":["online-reinforcement-learning","off-policy","conservative-q-learning","implicit-q-learning","offline-to-online-reinforcement-learning","d4rl"],"name":"离线强化学习","alt":"Offline Reinforcement Learning","abbr":"Offline RL","aliases":["批量强化学习","Batch RL","Batch Reinforcement Learning"],"one_liner":"只用事先收集好的固定数据集训练策略，训练中不再与环境交互。","explanation":"早期也叫批量强化学习。Sergey Levine 等人 2020 年的综述将其定义为：只利用预先收集的数据、不做额外在线采集的强化学习。数据可以来自人类遥操作、旧策略或部署日志，训练全程不碰真实环境，适合试错昂贵或危险的机器人、医疗等场景。和模仿学习不同，它利用奖励信号，有机会从好坏混杂的次优数据里学出比数据本身更好的策略。核心难点是分布偏移：策略一旦选了数据里没出现过的动作，Q 函数对它的估值往往虚高（外推误差），错误还会逐步累积。保守 Q 学习（CQL）、隐式 Q 学习（IQL）和各类策略约束方法都是为此设计的。","example":"保守 Q 学习（CQL）在普通 Q 学习上加一个正则项，故意压低数据集外动作的 Q 值，让学到的价值成为真实价值的下界，避免策略被虚高的估值带偏。","related":["在线强化学习","异策略","保守 Q 学习","隐式 Q 学习","离线到在线强化学习","D4RL"]},{"id":"extrapolation-error","category":"training","sec":7,"tier":3,"sources":[{"title":"Off-Policy Deep Reinforcement Learning without Exploration (BCQ, arXiv:1812.02900)","url":"https://arxiv.org/abs/1812.02900"},{"title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (arXiv:2005.01643)","url":"https://arxiv.org/abs/2005.01643"}],"as_of":"","related_ids":["offline-reinforcement-learning","overestimation-bias","conservative-q-learning","implicit-q-learning","policy-constraint","out-of-distribution"],"name":"外推误差","alt":"Extrapolation Error (OOD Actions in Offline RL)","abbr":"","aliases":["分布外动作问题","OOD 动作高估","Extrapolation Error"],"one_liner":"离线强化学习中，Q 网络给数据里没出现过的动作乱估值而产生的误差。","explanation":"这一概念由 Fujimoto、Meger、Precup 在 2019 年提出 BCQ 算法的 ICML 论文中系统阐述。离线强化学习只能用固定数据集训练，不能再和环境交互。Q 学习更新时要对下一状态取 max_a Q(s′, a)，而网络对数据中没出现过的动作（分布外动作）的估值只是外推，可能严重偏高；策略偏偏去选这些动作，误差经贝尔曼备份不断累积，学出的策略很差。在线训练可以实际试一下来纠正，离线做不到。应对思路主要有：约束策略贴近数据行为（BCQ、策略约束）、压低分布外动作的 Q 值（CQL）、完全不查询分布外动作（IQL）。","example":"BCQ 论文中，一个离线的 DDPG 智能体与在线 DDPG 用完全相同的一批数据同时训练，结果在所有任务上都明显落后、价值估计不稳定甚至发散，作者把原因归为外推误差。","related":["离线强化学习","Q 值高估","保守 Q 学习","隐式 Q 学习","策略约束","分布外"]},{"id":"policy-constraint","category":"training","sec":7,"tier":3,"sources":[{"title":"Wu, Tucker, Nachum 2019: Behavior Regularized Offline Reinforcement Learning (BRAC)","url":"https://arxiv.org/abs/1911.11361"},{"title":"Fujimoto & Gu 2021: A Minimalist Approach to Offline Reinforcement Learning (TD3+BC)","url":"https://arxiv.org/abs/2106.06860"},{"title":"Levine et al. 2020: Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","url":"https://arxiv.org/abs/2005.01643"}],"as_of":"","related_ids":["offline-reinforcement-learning","extrapolation-error","kl-regularization","behavior-cloning","conservative-q-learning","advantage-weighted-regression"],"name":"策略约束","alt":"Policy Constraint (Behavior Regularization)","abbr":"","aliases":["行为正则化","Behavior Regularization","行为约束"],"one_liner":"离线强化学习里，限制新策略不要偏离数据中行为策略太远的一类方法。","explanation":"策略约束是离线强化学习（只用现成数据、不再与环境交互）的一大类方法。Q 函数（估计做某动作能拿多少回报）对数据里没出现过的动作常估得过高，策略去追这些虚高动作就会崩，这叫外推误差。策略约束给策略加一条限制：输出的动作要接近采集数据时的行为策略，可以用 KL 散度、MMD 等距离做惩罚，或在目标里加一项行为克隆损失。BCQ、BEAR、TD3+BC 都属于这一路线，2019 年 Wu、Tucker、Nachum 的 BRAC 把它们统一成「行为正则化」框架。它和保守 Q 学习这类「压低陌生动作价值」的方法是离线 RL 的两条主线。","example":"TD3+BC 只在在线算法 TD3 的策略更新里加一项行为克隆损失（让输出动作靠近数据集动作），再把状态做归一化，就达到了与当时复杂离线 RL 算法相当的效果。","related":["离线强化学习","外推误差","KL 正则化","行为克隆","保守 Q 学习","优势加权回归"]},{"id":"conservative-q-learning","category":"training","sec":7,"tier":3,"sources":[{"title":"Conservative Q-Learning for Offline Reinforcement Learning (arXiv 2006.04779)","url":"https://arxiv.org/abs/2006.04779"},{"title":"NeurIPS 2020 Proceedings: Conservative Q-Learning for Offline Reinforcement Learning","url":"https://proceedings.neurips.cc/paper/2020/hash/0d2b2061826a5df3221116a5085a6052-Abstract.html"},{"title":"Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions (arXiv 2309.10150)","url":"https://arxiv.org/abs/2309.10150"}],"as_of":"","related_ids":["offline-reinforcement-learning","calibrated-q-learning","q-function","overestimation-bias","extrapolation-error","q-transformer"],"name":"保守 Q 学习","alt":"Conservative Q-Learning","abbr":"CQL","aliases":[],"one_liner":"刻意压低数据集外动作的 Q 值，让离线强化学习不被虚高的估计带偏。","explanation":"CQL 由 Aviral Kumar、Aurick Zhou、George Tucker、Sergey Levine 在 2020 年提出（NeurIPS 2020），是离线强化学习（只用固定数据集、不再和环境交互）的代表算法。普通 Q 学习直接拿来离线训练会失败：策略倾向于挑数据里没出现过的动作，这些动作的 Q 值（估计某状态下做某动作的长期回报）没被数据纠正过，常被高估，策略就朝这些虚高的方向跑。CQL 在标准贝尔曼误差之外加一个正则项：压低策略可能选的动作的 Q 值，同时抬高数据集中实际动作的 Q 值，使学到的价值成为真实价值的下界。它容易接到现有的深度 Q 学习或演员-评论家算法上，论文报告最终回报常为已有离线方法的 2–5 倍。Cal-QL 等后续方法都在它的基础上改进。","example":"谷歌 DeepMind 2023 年的 Q-Transformer 用 Transformer 表示机器人多任务 Q 函数，在人类演示加自主采集的真实机器人离线数据上训练，用的就是一个改造版的 CQL 保守正则项。","related":["离线强化学习","校准 Q 学习","Q 函数","Q 值高估","外推误差","Q-Transformer"]},{"id":"implicit-q-learning","category":"training","sec":7,"tier":3,"sources":[{"title":"Offline Reinforcement Learning with Implicit Q-Learning (arXiv 2110.06169)","url":"https://arxiv.org/abs/2110.06169"}],"as_of":"","related_ids":["offline-reinforcement-learning","advantage-weighted-regression","conservative-q-learning","extrapolation-error","offline-to-online-reinforcement-learning","q-function"],"name":"隐式 Q 学习","alt":"Implicit Q-Learning","abbr":"IQL","aliases":[],"one_liner":"只用数据集里已有的动作估值、从不查询没见过动作的离线强化学习算法。","explanation":"伯克利 Kostrikov、Nair、Levine 2021 年提出。离线强化学习只用固定数据集训练，难点是 Q 函数（动作价值）会给数据里没出现过的动作乱估高分（外推误差），策略一追这些动作就崩。IQL 的办法是完全不评估新动作：先用期望分位数回归（expectile regression，一种偏向高分位的回归）从数据集动作中拟合一个接近最好动作价值的状态价值 V，再用它做 Q 的时序差分更新，最后用优势加权回归（按优势大小给行为克隆加权）抽取策略。它实现简单，在 D4RL 离线基准上表现强，也适合先离线训练再在线微调，常被机器人离线强化学习工作当作基线。","example":"拿一批混杂好坏操作的机械臂历史数据，不再和环境交互，用 IQL 训出一个比数据里平均水平更好的策略。","related":["离线强化学习","优势加权回归","保守 Q 学习","外推误差","离线到在线强化学习","Q 函数"]},{"id":"advantage-weighted-regression","category":"training","sec":7,"tier":3,"sources":[{"title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning (arXiv 1910.00177)","url":"https://arxiv.org/abs/1910.00177"},{"title":"Offline Reinforcement Learning with Implicit Q-Learning (arXiv 2110.06169)","url":"https://arxiv.org/abs/2110.06169"}],"as_of":"","related_ids":["advantage-function","offline-reinforcement-learning","implicit-q-learning","behavior-cloning","policy-constraint","advantage-conditioning"],"name":"优势加权回归","alt":"Advantage-Weighted Regression","abbr":"AWR","aliases":["优势加权行为克隆","Advantage-Weighted Behavioral Cloning"],"one_liner":"按动作优势大小加权做模仿学习，优势越大越被模仿的强化学习算法。","explanation":"AWR 由 Xue Bin Peng、Aviral Kumar、Grace Zhang、Sergey Levine 于 2019 年提出，目标是只用监督学习的回归步骤来做强化学习。每轮两步：先用回归拟合价值函数；再做加权的行为克隆，数据里每个动作按 exp(优势/β) 加权，优势高的动作被模仿得更多，β 是温度系数。它能利用经验回放里的旧数据（异策略），也能只靠固定数据集学习，几行代码即可实现，连续和离散动作都支持。这种「先估优势、再加权模仿」的策略提取方式被后续离线强化学习广泛采用，例如隐式 Q 学习（IQL）就用优势加权行为克隆提取最终策略。","example":"隐式 Q 学习先从离线数据学出 Q 函数和价值函数，最后一步用优势加权行为克隆提取策略：优势为正且越大的数据动作，在模仿时权重越高。","related":["优势函数","离线强化学习","隐式 Q 学习","行为克隆","策略约束","优势条件化"]},{"id":"return-conditioning","category":"training","sec":7,"tier":3,"sources":[{"title":"Chen et al. 2021: Decision Transformer: Reinforcement Learning via Sequence Modeling","url":"https://arxiv.org/abs/2106.01345"},{"title":"Schmidhuber 2019: Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","url":"https://arxiv.org/abs/1912.02875"},{"title":"Brandfonbrener et al. 2022: When does return-conditioned supervised learning work for offline reinforcement learning?","url":"https://arxiv.org/abs/2206.01079"}],"as_of":"","related_ids":["decision-transformer","advantage-conditioning","return","offline-reinforcement-learning","recap","goal-conditioned-policy"],"name":"回报条件化","alt":"Return Conditioning","abbr":"","aliases":["回报条件策略","Return-Conditioned Policy","回报条件监督学习","Return-Conditioned Supervised Learning (RCSL)"],"one_liner":"把「想拿多少回报」当输入给策略，让它照着目标回报去行动。","explanation":"回报条件化是把强化学习改写成监督学习的一种做法：训练时把每条轨迹从当前步起剩余的累计奖励（return-to-go）和观测一起输入策略，让它模仿这条轨迹里实际做的动作；测试时输入一个较高的目标回报，希望它做出高回报的行为。Schmidhuber 2019 年的倒置强化学习（Upside-Down RL）和 2021 年的决策 Transformer 是代表，后者用 Transformer 把回报、状态、动作排成序列来预测动作，在离线强化学习基准上与主流方法相当。它不用学价值函数，训练稳定；但 Brandfonbrener 等人 2022 年指出，在随机性强或数据覆盖不足时它可能学不到最优策略。π*0.6 所用 RECAP 的优势条件化是同一思路的变体。","example":"决策 Transformer 测试时先给定目标回报（如任务成功记为 1），每执行一步就把目标减去实际拿到的奖励，再以剩下的目标回报为条件预测下一个动作。","related":["决策 Transformer","优势条件化","回报","离线强化学习","RECAP","目标条件策略"]},{"id":"advantage-conditioning","category":"training","sec":7,"tier":3,"sources":[{"title":"π*0.6: a VLA That Learns From Experience (RECAP, arXiv 2511.14759)","url":"https://arxiv.org/abs/2511.14759"},{"title":"Diffusion Guidance Is a Controllable Policy Improvement Operator (CFGRL, arXiv 2505.23458)","url":"https://arxiv.org/abs/2505.23458"}],"as_of":"2025-11","related_ids":["recap","pi-star-0-6","advantage-function","return-conditioning","classifier-free-guidance","advantage-weighted-regression"],"name":"优势条件化","alt":"Advantage Conditioning","abbr":"","aliases":["优势条件策略","Advantage-Conditioned Policy","优势条件化策略"],"one_liner":"训练时告诉策略每个动作「好不好」，部署时只让它生成「好」的动作。","explanation":"优势条件化把强化学习变成带条件的监督学习：先训练价值函数，算出数据中每个动作的优势（比平均水平好多少），再把优势或其二值化结果作为额外输入交给策略，照常做模仿学习。这样好、坏数据都能用来训练，推理时把条件设成「好」，策略就偏向输出高优势动作。它与按回报条件化的决策 Transformer 思路相近，也和 Frans 等人 2025 年提出的 CFGRL（把扩散模型的无分类器引导视作策略改进）相通。Physical Intelligence 2025 年 11 月发布的 π*0.6 用它构成 RECAP 方法：按阈值把优势二值化，以文本「Advantage: positive / negative」输入策略，训练时随机去掉该条件，推理时设为 positive，或用无分类器引导进一步放大改进。","example":"π*0.6 用 RECAP 训练后，能在真实家庭里叠衣服、稳定组装纸箱、用专业咖啡机做意式咖啡；论文称在部分最难的任务上吞吐量提高到两倍以上，失败率大约减半。","related":["RECAP","π*0.6","优势函数","回报条件化","无分类器引导","优势加权回归"]},{"id":"offline-to-online-reinforcement-learning","category":"training","sec":7,"tier":3,"sources":[{"title":"Nakamoto et al. 2023: Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning","url":"https://arxiv.org/abs/2303.05479"},{"title":"Ball et al. 2023: Efficient Online Reinforcement Learning with Offline Data (RLPD)","url":"https://arxiv.org/abs/2302.02948"},{"title":"Luo et al. 2024: SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning","url":"https://arxiv.org/abs/2401.16013"}],"as_of":"","related_ids":["offline-reinforcement-learning","online-reinforcement-learning","reinforcement-learning-with-prior-data","calibrated-q-learning","real-world-reinforcement-learning","serl"],"name":"离线到在线强化学习","alt":"Offline-to-Online Reinforcement Learning","abbr":"O2O RL","aliases":["离线-在线强化学习","Offline-to-Online Fine-tuning"],"one_liner":"先用现成数据做离线强化学习打底，再让机器人上线交互继续提升。","explanation":"离线到在线强化学习分两步：先用已有数据（人类演示、历史日志、旧策略的轨迹）做离线强化学习，得到一个不必从零探索的初始策略和价值函数；再让智能体与真实环境交互收集新数据，在线微调。好处是省掉大量危险又昂贵的随机探索，这对真机尤其重要。难点在两段的衔接：离线阶段为防止高估而刻意保守，价值尺度往往不准，切到在线后性能常先掉一截。代表方法有 AWAC（2020）、校准 Q 学习 Cal-QL（2023），以及把离线数据直接混进在线回放池、从头训练的 RLPD（2023）。SERL、HIL-SERL 等真机强化学习系统和 π*0.6 的 RECAP 都沿用了这一思路。","example":"SERL 以 RLPD 为核心算法，先放入 20 条用 SpaceMouse 遥操作采集的演示，再在真机上在线训练，平均 25–50 分钟就学会 PCB 板装配、线缆布线等任务。","related":["离线强化学习","在线强化学习","利用先验数据的强化学习","校准 Q 学习","真机强化学习","SERL"]},{"id":"calibrated-q-learning","category":"training","sec":7,"tier":3,"sources":[{"title":"Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning (arXiv 2303.05479)","url":"https://arxiv.org/abs/2303.05479"}],"as_of":"","related_ids":["conservative-q-learning","offline-to-online-reinforcement-learning","offline-reinforcement-learning","q-function","reinforcement-fine-tuning","reinforcement-learning-with-prior-data"],"name":"校准 Q 学习","alt":"Calibrated Q-Learning","abbr":"Cal-QL","aliases":["Calibrated Offline RL Pre-Training"],"one_liner":"给保守 Q 学习加「校准」约束，让离线预训练后能平滑转入在线微调。","explanation":"Cal-QL 由 Nakamoto、Chelsea Finn、Aviral Kumar、Sergey Levine 等人在 2023 年提出，发表于 NeurIPS 2023，面向离线到在线强化学习：先用固定数据集离线预训练，再上环境在线微调。作者发现，用保守 Q 学习（CQL）预训练得到的 Q 值被压得过低，比任何正常策略的真实回报都小；一开始在线微调，Q 值剧烈调整尺度，策略会先把离线学到的东西「忘掉」，性能掉一截再慢慢爬回来。Cal-QL 加了一个校准约束：学到的 Q 值仍是当前策略真实价值的下界，但不能低于某个参考策略的价值，实践中参考策略就用数据集的行为策略，其价值用蒙特卡洛回报估计。实现上只需在 CQL 代码上改一行，在 11 个微调基准任务中 9 个超过已有方法。","example":"Cal-QL 论文的测试任务包括 FrankaKitchen（控制 9 自由度 Franka 机械臂按顺序完成厨房子任务）和 Adroit（28 自由度五指手转笔、开门等），流程都是先离线预训练、再在线微调。","related":["保守 Q 学习","离线到在线强化学习","离线强化学习","Q 函数","强化学习微调","利用先验数据的强化学习"]},{"id":"reinforcement-learning-with-prior-data","category":"training","sec":7,"tier":3,"sources":[{"title":"Ball et al. 2023: Efficient Online Reinforcement Learning with Offline Data (RLPD)","url":"https://arxiv.org/abs/2302.02948"},{"title":"GitHub: ikostrikov/rlpd","url":"https://github.com/ikostrikov/rlpd"},{"title":"Luo et al. 2024: SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning","url":"https://arxiv.org/abs/2401.16013"}],"as_of":"","related_ids":["offline-to-online-reinforcement-learning","soft-actor-critic","update-to-data-ratio","experience-replay","serl","hil-serl"],"name":"利用先验数据的强化学习","alt":"Reinforcement Learning with Prior Data","abbr":"RLPD","aliases":["Efficient Online Reinforcement Learning with Offline Data"],"one_liner":"在线强化学习时把离线数据和新采数据各取一半混合训练的简单高效方法。","explanation":"RLPD 是 Ball、Smith、Kostrikov、Levine 在 ICML 2023 提出的方法，研究手里已有离线数据（专家演示或大量次优轨迹）时，上线交互学习该怎么用好它们。作者发现不需要复杂的离线预训练，只要在异策略算法 SAC 上做几处小改动：每个训练批次一半取离线数据、一半取在线回放缓存（对称采样）；给评论家网络加层归一化，防止把没见过动作的价值估高；用 10 个评论家组成集成并提高更新-数据比。论文报告在多个基准上比已有方法提升约 2.5 倍。真机强化学习框架 SERL 以它为核心算法。","example":"SERL 在真机上用 RLPD 训练：人类演示放进离线缓冲区，机器人自己交互产生的数据放进在线缓冲区，每个训练批次两边各取一半。","related":["离线到在线强化学习","软演员-评论家","更新-数据比","经验回放","SERL","HIL-SERL"]},{"id":"q-chunking","category":"training","sec":7,"tier":3,"sources":[{"title":"Li, Zhou, Levine 2025: Reinforcement Learning with Action Chunking","url":"https://arxiv.org/abs/2507.07969"}],"as_of":"2025-07","related_ids":["action-chunking","offline-to-online-reinforcement-learning","temporal-difference-learning","reinforcement-learning-with-prior-data","flow-matching","sparse-reward"],"name":"动作分块强化学习","alt":"Q-Chunking (Reinforcement Learning with Action Chunking)","abbr":"QC","aliases":["Q-chunking","Q 分块"],"one_liner":"策略和 Q 函数都以「一段连续动作」为单位来做强化学习。","explanation":"Q-chunking 是伯克利 Sergey Levine 团队 2025 年提出的强化学习方法，面向离线到在线（先用已有数据训练，再上线交互）的长程、稀疏奖励任务。它把模仿学习里常用的动作分块搬进强化学习：策略一次输出连续 h 步动作，Q 函数（评判动作好坏的网络）也以「状态 + 整段动作」为输入。好处有两点：按块执行让探索更连贯，能沿用离线数据里的行为习惯；整段动作一起评估，可以做无偏的多步时序差分更新，价值传得更快。为防止策略偏离数据，它从流匹配策略里采样多个动作块、挑 Q 值最高的一个，或加蒸馏约束。","example":"在 OGBench 的方块、拼图类操作任务和 robomimic 任务上，先离线预训练 100 万步、再在线交互 100 万步，块长取 5 的 Q-chunking 明显优于 RLPD 等离线到在线基线，任务越难差距越大。","related":["动作分块","离线到在线强化学习","时序差分学习","利用先验数据的强化学习","流匹配","稀疏奖励"]},{"id":"pre-training","category":"training","sec":8,"tier":1,"sources":[{"title":"Google Machine Learning Glossary: pre-trained model","url":"https://developers.google.com/machine-learning/glossary#pre-trained-model"},{"title":"Kim et al. 2024: OpenVLA: An Open-Source Vision-Language-Action Model","url":"https://arxiv.org/abs/2406.09246"},{"title":"Black et al. 2024: π0: A Vision-Language-Action Flow Model for General Robot Control","url":"https://arxiv.org/html/2410.24164v1"}],"as_of":"","related_ids":["post-training","fine-tuning","foundation-model","downstream-task","scaling-law","self-supervised-learning"],"name":"预训练","alt":"Pre-training","abbr":"","aliases":["Pretraining","预训练阶段"],"one_liner":"先在海量通用数据上训练出一个基础模型，之后再针对具体任务去适配。","explanation":"预训练是训练基础模型的第一阶段：用规模大、覆盖广的数据（网页文本、图文对、视频、多种机器人的操作数据等）训练模型，让它学到通用的表示和能力。得到的模型叫预训练模型或基座模型，之后再通过微调或后训练用到具体的下游任务上。它的价值在于把昂贵的通用学习集中做一次，下游任务只需少量数据。具身智能里的预训练通常分两层：VLA 先继承一个已在互联网图文上预训练过的视觉语言模型，再在大规模、多种机器人的数据上继续训练，比如 π0 用了 1 万多小时的机器人数据。","example":"OpenVLA（7B 参数）以 Llama 2 语言模型加 DINOv2、SigLIP 视觉编码器为底座，在 Open X-Embodiment 的 97 万条真实机器人演示上预训练，之后可用 LoRA 在消费级显卡上微调到新任务。","related":["后训练","微调","基础模型","下游任务","缩放定律","自监督学习"]},{"id":"downstream-task","category":"training","sec":8,"tier":1,"sources":[{"title":"Bommasani et al. 2021: On the Opportunities and Risks of Foundation Models","url":"https://arxiv.org/abs/2108.07258"},{"title":"Black et al. 2024: π0: A Vision-Language-Action Flow Model for General Robot Control","url":"https://arxiv.org/html/2410.24164v1"}],"as_of":"","related_ids":["pre-training","post-training","fine-tuning","foundation-model","zero-shot","benchmark"],"name":"下游任务","alt":"Downstream Task","abbr":"","aliases":["目标任务","Target Task"],"one_liner":"预训练模型最终要拿去解决的具体任务，通常还要在它上面做适配或微调。","explanation":"「下游」是相对「上游」的预训练说的：先在海量通用数据上训练出一个基础模型，再把它用到某个具体任务上，这个具体任务就叫下游任务。2021 年斯坦福牵头的基础模型综述，就把基础模型定义为在大规模广泛数据上训练、能适配多种下游任务的模型。适配方式有零样本直接用、给少量示例、微调等。在具身智能里，VLA 基础模型的下游任务通常是某台机器人上的具体操作，比如叠衣服、收拾餐桌，或 LIBERO 这类基准里的任务；论文常用「微调后在下游任务上的成功率」来衡量预训练值不值。","example":"π0 先在 1 万多小时、7 种机器人构型的数据上预训练，再针对叠衣服、收拾餐桌、组装纸盒等下游任务分别后训练，每个任务用 5 到 100 多小时的数据。","related":["预训练","后训练","微调","基础模型","零样本","基准测试"]},{"id":"transfer-learning","category":"training","sec":8,"tier":2,"sources":[{"title":"Transfer learning (Wikipedia)","url":"https://en.wikipedia.org/wiki/Transfer_learning"},{"title":"How transferable are features in deep neural networks? (Yosinski et al., arXiv 1411.1792)","url":"https://arxiv.org/abs/1411.1792"},{"title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (project page)","url":"https://robotics-transformer2.github.io/"}],"as_of":"","related_ids":["pre-training","fine-tuning","domain-adaptation","sim-to-real-transfer","positive-negative-transfer","rt-2"],"name":"迁移学习","alt":"Transfer Learning","abbr":"","aliases":["知识迁移"],"one_liner":"把在一个任务或领域学到的知识，拿来帮助学习另一个相关任务。","explanation":"迁移学习指把源任务（通常数据多）上学到的模型或表征用到目标任务（通常数据少）上，最常见的做法是先预训练、再微调。相关研究可追溯到 1976 年 Bozinovski 等人的神经网络工作；Yosinski 等人 2014 年发现，网络低层学到的是较通用的特征，越往高层越专门化，而且用迁移来的权重初始化，即使再微调也能提升泛化。迁移并不总有好处：源和目标差得太远时反而拖累性能，称为负迁移。具身智能几乎处处在做迁移：把互联网图文训练的 VLM 改造成 VLA、仿真到现实迁移、跨本体迁移、从人类视频迁移到机器人；领域自适应是它的一个子方向。","example":"谷歌 DeepMind 的 RT-2 把在网络规模图文数据上训练的视觉语言模型，与机器人轨迹数据一起微调，动作写成文本 token；模型能执行训练数据里没有的指令，如「捡起灭绝的动物」，在泛化测试上约为 RT-1 等基线的 2 倍。","related":["预训练","微调","领域自适应","仿真到现实迁移","正迁移 / 负迁移","RT-2"]},{"id":"training-from-scratch","category":"training","sec":8,"tier":2,"sources":[{"title":"Rethinking ImageNet Pre-training (He et al., arXiv 1811.08883)","url":"https://arxiv.org/abs/1811.08883"},{"title":"R3M: A Universal Visual Representation for Robot Manipulation (arXiv 2203.12601)","url":"https://arxiv.org/abs/2203.12601"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/html/2303.04137"}],"as_of":"","related_ids":["pre-training","fine-tuning","baseline","overfitting","transfer-learning","pre-trained-visual-representation"],"name":"从零训练","alt":"Training from Scratch","abbr":"","aliases":["随机初始化训练","From Scratch"],"one_liner":"参数随机初始化、不借用任何预训练权重，直接在目标数据上训练模型。","explanation":"从零训练指网络权重从随机值开始，只用当前任务的数据训练，与「加载预训练模型再微调」相对。好处是不受预训练数据分布和模型结构的约束、流程简单；缺点是需要更多数据和训练时间，数据少时容易过拟合。何恺明等人 2018 年的《Rethinking ImageNet Pre-training》发现，目标检测只要训练足够久，从零训练也能追平 ImageNet 预训练，说明预训练的主要作用之一是加快收敛。机器人数据稀缺，论文里常把从零训练作为基线，用来衡量预训练表征或大规模预训练带来的收益；但并非总是预训练更好，比如扩散策略的视觉编码器就是不带预训练的 ResNet-18，端到端从零训练。","example":"R3M 论文在 12 个仿真操作任务上对比：用 Ego4D 人类视频预训练的视觉表征，比从零训练视觉编码器的成功率高出 20% 以上。","related":["预训练","微调","基线方法","过拟合","迁移学习","预训练视觉表征"]},{"id":"scaling-law","category":"training","sec":8,"tier":1,"sources":[{"title":"Scaling Laws for Neural Language Models (arXiv 2001.08361)","url":"https://arxiv.org/abs/2001.08361"},{"title":"Training Compute-Optimal Large Language Models (arXiv 2203.15556)","url":"https://arxiv.org/abs/2203.15556"},{"title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation (arXiv 2410.18647)","url":"https://arxiv.org/abs/2410.18647"}],"as_of":"2024-10","related_ids":["data-scaling-laws-in-imitation-learning","parameter-count","large-language-model","data-diversity","the-bitter-lesson","emergent-abilities"],"name":"缩放定律","alt":"Scaling Law","abbr":"","aliases":["规模定律","尺度定律","具身 Scaling Law","Robot Scaling Law","数据缩放定律","Data Scaling Law","Scaling 实验"],"one_liner":"模型效果随参数量、数据量、算力增加而按幂律稳定提升的经验规律。","explanation":"缩放定律是对「模型越大、数据越多、算力越足，效果越好」的定量描述。2020 年 OpenAI 的 Kaplan 等人发现，语言模型的测试损失与参数量、数据量、训练算力之间都呈幂律关系，其中一些趋势跨越七个以上数量级依然成立；2022 年 DeepMind 的 Chinchilla 研究进一步指出，算力固定时，模型规模和训练 token 数应按相同比例扩大。它的价值在于能用小规模实验预测大规模训练的收益，决定资源投向哪里。具身智能领域正在验证机器人数据是否也有类似规律，这也是各家大规模采集数据的依据之一。","example":"2024 年清华大学高阳团队的《Data Scaling Laws in Imitation Learning for Robotic Manipulation》采集了 4 万多条演示、做了 1.5 万多次真机测试，发现策略在新环境、新物体上的泛化能力与训练环境数、物体数大致呈幂律关系，而单个环境内的演示条数加到一定程度后收益很小。","related":["数据缩放律（模仿学习）","参数量","大语言模型","数据多样性","苦涩的教训","涌现能力"]},{"id":"ossification","category":"training","sec":8,"tier":3,"sources":[{"title":"Generalist AI 2025-11-04: GEN-0: Embodied Foundation Models That Scale with Physical Interaction","url":"https://generalistai.com/blog/gen-0"},{"title":"Hernandez et al. 2021: Scaling Laws for Transfer","url":"https://arxiv.org/abs/2102.01293"}],"as_of":"2025-11","related_ids":["scaling-law","gen-0","parameter-count","pre-training","transfer-learning","catastrophic-forgetting"],"name":"骨化（模型骨化）","alt":"Ossification","abbr":"","aliases":["模型骨化","权重僵化"],"one_liner":"模型权重像「僵住」一样，继续喂数据也吸收不了新信息的现象。","explanation":"「骨化」一词出自 OpenAI 的 Hernandez、Kaplan 等人 2021 年的论文 Scaling Laws for Transfer：他们发现在微调数据很多时，先做过预训练的小模型反而追不上从零训练的同尺寸模型，好像预训练把权重「骨化」了，成了难以摆脱的坏初始化。具身领域因 Generalist AI 2025 年 11 月发布的 GEN-0 开始用这个词：在大规模真机数据上预训练时，10 亿参数的模型难以吸收复杂多样的感知-运动数据，权重随时间变得学不进新信息，而 60 亿、70 亿参数的模型持续变好；官方称这是首次在机器人领域观察到模型骨化，此前语言模型里只在千万参数级的小模型上见过。它提醒人们：数据规模上来后，模型容量也要跟上。","example":"GEN-0 的对比实验里，10 亿参数模型面对海量多样的感知-运动数据出现类似骨化的停滞，60 亿和 70 亿参数模型则随预训练数据增加继续提升。","related":["缩放定律","GEN-0","参数量","预训练","迁移学习","灾难性遗忘"]},{"id":"distributed-training","category":"training","sec":8,"tier":2,"sources":[{"title":"PyTorch Tutorial: Getting Started with Distributed Data Parallel","url":"https://docs.pytorch.org/tutorials/intermediate/ddp_tutorial.html"},{"title":"PyTorch Tutorial: Getting Started with Fully Sharded Data Parallel (FSDP)","url":"https://docs.pytorch.org/tutorials/intermediate/FSDP_tutorial.html"},{"title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","url":"https://arxiv.org/abs/1909.08053"}],"as_of":"","related_ids":["distributed-data-parallel","fully-sharded-data-parallel","deepspeed","mixed-precision-training","gradient-accumulation","batch-size"],"name":"分布式训练（数据并行 / 模型并行）","alt":"Distributed Training (Data / Model Parallelism)","abbr":"","aliases":["多卡训练","数据并行","模型并行","Data Parallelism","Model Parallelism","张量并行","流水线并行"],"one_liner":"把一次训练拆到多张 GPU 或多台机器上同时算，以训更大的模型和更多数据。","explanation":"模型或数据大到一张 GPU 装不下、算不完时，就要把训练拆到多卡多机上。常见拆法有两类：数据并行是每张卡放一份完整模型、各算一部分数据，反向传播后把各卡梯度汇总求平均再同步更新，PyTorch 的 DDP（分布式数据并行）就是这种；模型并行是把模型本身切开放到不同卡上，比如英伟达 Megatron-LM 把 Transformer 每层的矩阵切到多卡（张量并行），也有按层分段的流水线并行。FSDP（全分片数据并行）仍按数据切分，但把参数、梯度和优化器状态也分片存到各卡，显存占用明显下降。数十亿参数的 VLA 预训练和全参数微调都离不开这些手段。","example":"OpenVLA（7B 参数）预训练用了 64 张 A100、训练 14 天；论文里全参数微调也要 8 张 A100 跑 5–15 小时，其中显存测试是用 FSDP 把模型分到 2 张卡上完成的。","related":["分布式数据并行","全分片数据并行","DeepSpeed","混合精度训练","梯度累积","批大小"]},{"id":"mixed-precision-training","category":"training","sec":8,"tier":3,"sources":[{"title":"Micikevicius et al. 2017: Mixed Precision Training","url":"https://arxiv.org/abs/1710.03740"},{"title":"NVIDIA Docs: Train With Mixed Precision","url":"https://docs.nvidia.com/deeplearning/performance/mixed-precision-training/index.html"},{"title":"GitHub: Physical-Intelligence/openpi (Precision Settings)","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"","related_ids":["numerical-precision-formats","gpu-memory","distributed-training","gradient-checkpointing","quantization-aware-training","openpi"],"name":"混合精度训练","alt":"Mixed-Precision Training","abbr":"","aliases":["bf16 训练","半精度训练","自动混合精度（AMP）"],"one_liner":"大部分计算用 16 位浮点数、关键部分保留 32 位，省显存又提速的训练方式。","explanation":"深度学习默认用 32 位浮点数（FP32）存参数、做计算。混合精度训练把矩阵乘、卷积这类运算换成 16 位格式（FP16 或 BF16），而归约、归一化等对数值范围敏感的运算以及参数主副本仍保留 FP32。2017 年 NVIDIA 与百度的研究者系统提出这套做法，并用「损失缩放」防止 FP16 下很小的梯度下溢成零，显存占用接近减半；GPU 的张量核心对 16 位运算吞吐更高，训练也更快。BF16 的数值范围与 FP32 相同，通常不需要损失缩放，如今训练大模型和 VLA 多用 BF16。PyTorch 的 autocast 能自动完成大部分精度切换。","example":"openpi 用 JAX 训练 π0 系列模型时默认采用混合精度：权重和梯度保存为 FP32，大部分激活和计算用 BF16；需要全 FP32 训练时把配置里的 dtype 改成 float32 即可。","related":["数值精度格式（FP32 / BF16 / FP16 / FP8 / INT8）","GPU 显存","分布式训练（数据并行 / 模型并行）","梯度检查点（激活重计算）","量化感知训练","openpi"]},{"id":"gradient-accumulation","category":"training","sec":8,"tier":3,"sources":[{"title":"Performing gradient accumulation with Accelerate (Hugging Face 文档)","url":"https://huggingface.co/docs/accelerate/usage_guides/gradient_accumulation"}],"as_of":"","related_ids":["batch-size","gradient-checkpointing","mixed-precision-training","distributed-training","optimizer","gpu-memory"],"name":"梯度累积","alt":"Gradient Accumulation","abbr":"","aliases":[],"one_liner":"连续算几个小批次的梯度先攒着，再统一更新一次参数，模拟大批量训练。","explanation":"显存放不下想要的批大小时最常用的训练技巧。做法是：每个小批次照常前向、反向，但先不调用优化器，让梯度在参数上累加；攒够 N 个小批次后才执行一次参数更新，再把梯度清零。这样等效批大小等于单卡批大小 × 累积步数 × 卡数，代价是更新次数变少、每次更新耗时变长。要注意两点：损失要除以累积步数（按 token 算损失时要按总 token 数归一化），否则梯度会被放大；BatchNorm 这类依赖批统计量的层仍然只看到小批次。Hugging Face Accelerate 等训练库提供现成开关，在单卡或少量显卡上微调 VLA 时经常用到。","example":"单卡只放得下 8 条样本，想要批大小 64，就把累积步数设为 8：连续跑 8 个小批次的 backward，再调用一次 optimizer.step()。","related":["批大小","梯度检查点（激活重计算）","混合精度训练","分布式训练（数据并行 / 模型并行）","优化器","GPU 显存"]},{"id":"gradient-checkpointing","category":"training","sec":8,"tier":3,"sources":[{"title":"Training Deep Nets with Sublinear Memory Cost (arXiv 1604.06174)","url":"https://arxiv.org/abs/1604.06174"},{"title":"torch.utils.checkpoint (PyTorch 文档)","url":"https://docs.pytorch.org/docs/main/checkpoint.html"}],"as_of":"","related_ids":["backpropagation","gpu-memory","gradient-accumulation","mixed-precision-training","fully-sharded-data-parallel","deepspeed"],"name":"梯度检查点（激活重计算）","alt":"Gradient Checkpointing (Activation Recomputation)","abbr":"","aliases":["激活检查点","Activation Checkpointing"],"one_liner":"前向时少存中间激活，反向时再重算一遍，用计算换显存。","explanation":"训练时，前向传播产生的中间结果（激活）默认要一直存到反向传播用完，这是显存的大头之一。梯度检查点只在少数检查点位置保存激活，其余的丢掉，反向传播需要时从最近的检查点重新前向计算补回来。2016 年陈天奇等人的论文《Training Deep Nets with Sublinear Memory Cost》系统提出了这个做法：n 层网络只需约 O(√n) 的激活显存，代价是每个小批次多做大约一次前向计算；论文里 1000 层残差网络的显存从 48GB 降到 7GB，运行时间增加约 30%。PyTorch 的 torch.utils.checkpoint 就是它的实现，训练大模型和 VLA 时常与混合精度、梯度累积一起开。","example":"微调 Transformer 策略时把每个 Transformer 层包进 torch.utils.checkpoint，显存占用明显下降，每步训练会慢一些。","related":["反向传播","GPU 显存","梯度累积","混合精度训练","全分片数据并行","DeepSpeed"]},{"id":"representation-learning","category":"training","sec":8,"tier":2,"sources":[{"title":"Representation Learning: A Review and New Perspectives (Bengio et al.)","url":"https://arxiv.org/abs/1206.5538"},{"title":"R3M: A Universal Visual Representation for Robot Manipulation","url":"https://arxiv.org/abs/2203.12601"}],"as_of":"","related_ids":["self-supervised-learning","contrastive-learning","pre-trained-visual-representation","embedding","latent-space","r3m"],"name":"表征学习","alt":"Representation Learning","abbr":"","aliases":["表示学习","特征学习","Feature Learning"],"one_liner":"让模型自动从原始数据里学出好用的特征向量，而不是靠人工设计特征。","explanation":"表征学习研究怎样把图像、文本、传感器读数等原始数据变成一组更好用的数字（表征，也叫特征或嵌入向量），让下游任务更容易学。Bengio 等人 2013 年的综述把它视为深度学习的核心问题：好的表征应把数据背后不同的变化因素分离开。学表征的途径很多，有监督分类、自监督学习（对比学习、掩码自编码器）、图文对齐（如 CLIP）等。具身智能里机器人数据少，常先用大规模图片或人类视频预训练视觉编码器，再冻结或微调它来学策略，这样只需少量示范，R3M、VC-1、DINOv2 都属于这条路线。世界模型的隐空间、潜在动作也是表征学习的产物。","example":"R3M 用 Ego4D 人类第一人称视频，以时间对比学习和视频-语言对齐预训练视觉表征；把它冻结后接到 Franka 机械臂的策略上，在真实杂乱的公寓里只用 20 条示范就学会了操作任务。","related":["自监督学习","对比学习","预训练视觉表征","嵌入向量","潜在空间","R3M"]},{"id":"contrastive-learning","category":"training","sec":8,"tier":2,"sources":[{"title":"Representation Learning with Contrastive Predictive Coding (arXiv 1807.03748)","url":"https://arxiv.org/abs/1807.03748"},{"title":"Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv 2103.00020)","url":"https://arxiv.org/abs/2103.00020"},{"title":"R3M: A Universal Visual Representation for Robot Manipulation (arXiv 2203.12601)","url":"https://arxiv.org/abs/2203.12601"}],"as_of":"","related_ids":["self-supervised-learning","infonce-loss","clip","siglip","time-contrastive-networks","r3m"],"name":"对比学习","alt":"Contrastive Learning","abbr":"","aliases":["对比表征学习","Contrastive Representation Learning"],"one_liner":"让相似样本的表示靠近、不相似样本的表示远离，从无标签数据里学特征。","explanation":"对比学习是一类自监督表征学习方法：构造「正样本对」（应当相似的两份数据，如同一张图的两种随机增强、一张图和它的配文）和「负样本」，训练编码器把正样本对的向量拉近、把负样本推远。常用损失是 InfoNCE，源自 2018 年的 CPC 论文。代表工作有 SimCLR、MoCo 和 CLIP。它不需要人工标签，能从海量图像、视频和图文里学到通用视觉特征。具身智能里，很多 VLA 的视觉编码器（如 CLIP、SigLIP）就是用对比目标训出来的；R3M 则在人类视频上用时间对比学习预训练机器人视觉表征。","example":"CLIP 用 4 亿对网上图文训练，任务是判断哪段文字配哪张图；R3M 在 Ego4D 人类视频上结合时间对比学习等目标预训练，冻结后给 Franka 机械臂用，只需 20 条演示就能在真实杂乱的公寓里学会操作任务。","related":["自监督学习","InfoNCE 损失","CLIP","SigLIP","时间对比学习","R3M"]},{"id":"infonce-loss","category":"training","sec":8,"tier":3,"sources":[{"title":"Representation Learning with Contrastive Predictive Coding (arXiv:1807.03748)","url":"https://arxiv.org/abs/1807.03748"},{"title":"CPC 论文 HTML 版（第 2.3 节 InfoNCE Loss and Mutual Information Estimation）","url":"https://arxiv.org/html/1807.03748"}],"as_of":"","related_ids":["contrastive-learning","clip","self-supervised-learning","time-contrastive-networks","cross-entropy","representation-learning"],"name":"InfoNCE 损失","alt":"InfoNCE Loss","abbr":"","aliases":["对比损失","InfoNCE 目标"],"one_liner":"让模型在一堆候选里认出唯一「正样本」的对比学习损失函数。","explanation":"InfoNCE 由 DeepMind 的 van den Oord 等人在 2018 年的对比预测编码（CPC）论文中提出。做法是给一个锚点样本配一个正样本（如同一张图的另一种增强、下一时刻的片段）和若干负样本，算出相似度后做 softmax 分类，要求正样本得分最高，本质是交叉熵。论文证明最小化它相当于最大化互信息（两个变量共享的信息量）的一个下界，负样本越多，下界越紧。它是 CLIP、SimCLR 等对比学习方法的核心训练目标，机器人视觉表征如 R3M 也用类似的时间对比目标。","example":"CLIP 训练时一批里有 N 对图文，每张图只把自己的配文当正样本、其余 N−1 条文字当负样本，图→文、文→图两个方向各算一次 InfoNCE。","related":["对比学习","CLIP","自监督学习","时间对比学习","交叉熵","表征学习"]},{"id":"time-contrastive-networks","category":"training","sec":8,"tier":3,"sources":[{"title":"Sermanet et al. 2017: Time-Contrastive Networks: Self-Supervised Learning from Video","url":"https://arxiv.org/abs/1704.06888"},{"title":"项目页：Time-Contrastive Networks","url":"https://sermanet.github.io/imitate/"},{"title":"Nair et al. 2022: R3M: A Universal Visual Representation for Robot Manipulation","url":"https://arxiv.org/abs/2203.12601"}],"as_of":"","related_ids":["contrastive-learning","self-supervised-learning","r3m","representation-learning","imitation-from-observation","pre-trained-visual-representation"],"name":"时间对比学习","alt":"Time-Contrastive Networks","abbr":"TCN","aliases":["时间对比网络","时序对比学习","Time-Contrastive Learning"],"one_liner":"从视频自监督学表征：同一时刻的多视角拉近，相邻不同时刻推远。","explanation":"时间对比网络由谷歌大脑的 Sermanet 等人 2017 年提出（ICRA 2018），是从无标注视频学视觉表征的早期代表。多视角版本用几台相机同时拍同一过程：同一时刻不同视角的画面在特征空间里拉近，同一视角里时间相邻、看着很像但任务进度不同的画面推远，用三元组损失训练。这样学到的特征对视角、光照不敏感，却能分辨杯子倾斜了多少这类与任务相关的状态。论文用它让机器人仅凭一段第三人称人类视频模仿倒水和人体姿势，并把与演示的特征距离当作强化学习奖励。后来 R3M 等机器人视觉预训练也把时间对比作为目标之一。","example":"机器人看一段人倒水的第三人称视频，把自己画面与演示画面在 TCN 特征空间里的距离当奖励，再用强化学习练出倒水动作。","related":["对比学习","自监督学习","R3M","表征学习","从观测中模仿学习","预训练视觉表征"]},{"id":"masked-autoencoder","category":"training","sec":8,"tier":3,"sources":[{"title":"Masked Autoencoders Are Scalable Vision Learners (arXiv:2111.06377)","url":"https://arxiv.org/abs/2111.06377"},{"title":"Masked Visual Pre-training for Motor Control (MVP, arXiv:2203.06173)","url":"https://arxiv.org/abs/2203.06173"}],"as_of":"","related_ids":["self-supervised-learning","vision-transformer","pre-trained-visual-representation","mvp","vc-1","representation-learning"],"name":"掩码自编码器","alt":"Masked Autoencoder","abbr":"MAE","aliases":["掩码建模","掩码图像建模"],"one_liner":"遮住图像的大部分小块再让模型补回来，以此自监督学习视觉特征。","explanation":"掩码自编码器是 Meta FAIR 的何恺明等人 2021 年提出的自监督视觉预训练方法。它把图像切成小块（patch），随机遮住约 75%，编码器只处理可见的块，再由一个轻量解码器根据编码结果重建被遮住的像素。因为编码器只看四分之一的块，训练可加速 3 倍以上；不需要人工标注就能学到好特征，ViT-Huge 在 ImageNet-1K 上达到 87.8% 准确率。机器人领域常用它预训练视觉编码器：MVP 用 MAE 预训练编码器后冻结，用于学习运动控制；VC-1 也采用了 MAE 目标。","example":"MVP（2022）用 MAE 在大量真实世界图像上预训练 ViT 编码器，冻结后接强化学习控制器，在一组机械臂操作任务上比监督预训练的编码器成功率最高高出 80 个百分点。","related":["自监督学习","视觉 Transformer","预训练视觉表征","MVP（掩码视觉预训练）","VC-1","表征学习"]},{"id":"tactile-representation-learning","category":"training","sec":8,"tier":3,"sources":[{"title":"Higuera et al. 2024: Sparsh: Self-supervised Touch Representations for Vision-based Tactile Sensing (CoRL 2024)","url":"https://arxiv.org/abs/2410.24090"},{"title":"Zhao et al. 2024: Transferable Tactile Transformers for Representation Learning Across Diverse Sensors and Tasks (T3)","url":"https://arxiv.org/abs/2406.13640"},{"title":"Feng et al. 2025: AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors (ICLR 2025)","url":"https://arxiv.org/abs/2502.12191"}],"as_of":"2025-04","related_ids":["vision-based-tactile-sensor","self-supervised-learning","sparsh","anytouch","visuo-tactile-fusion","representation-learning"],"name":"触觉表征学习","alt":"Tactile Representation Learning","abbr":"","aliases":["触觉表示学习","触觉预训练","Touch Representation Learning"],"one_liner":"把触觉传感器读数编码成通用特征，供滑移检测、插拔等下游任务复用。","explanation":"触觉表征学习研究怎样把触觉传感器的原始信号（如 GelSight、DIGIT 这类视触觉传感器拍到的凝胶形变图像）编码成紧凑特征，供滑移检测、力估计、精密插装等下游任务直接使用。难点是触觉数据少、标注更少，不同传感器成像差异大，换一款常要重训。近年主流做法借用视觉里的自监督学习：Meta 的 Sparsh（CoRL 2024）用掩码和自蒸馏在 46 万多张触觉图像上预训练；MIT 的 T3 用共享 Transformer 加各传感器专属编码器；AnyTouch（ICLR 2025）跨四种传感器学统一表征。它是视触觉融合和触觉 VLA 的基础。","example":"Sparsh 在 46 万多张无标注视触觉图像上做自监督预训练，在作者提出的 TacBench 六项任务上，据论文报告平均比按任务、按传感器端到端训练的模型高出 95.1%。","related":["视触觉传感器","自监督学习","Sparsh","AnyTouch","视触觉融合","表征学习"]},{"id":"representation-alignment","category":"training","sec":8,"tier":3,"sources":[{"title":"Yu et al. 2024: Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","url":"https://arxiv.org/abs/2410.06940"},{"title":"GitHub: sihyun-yu/REPA","url":"https://github.com/sihyun-yu/REPA"},{"title":"Li et al. 2025: Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model","url":"https://arxiv.org/abs/2510.12276"}],"as_of":"2025-10","related_ids":["representation-learning","diffusion-transformer","dinov2","auxiliary-loss-auxiliary-task","vggt","pre-trained-visual-representation"],"name":"表征对齐","alt":"Representation Alignment (REPA-style)","abbr":"REPA","aliases":["REPA 正则化","REPresentation Alignment","特征对齐损失"],"one_liner":"训练时让模型中间层特征去对齐一个现成预训练编码器的特征。","explanation":"REPA 由 Sihyun Yu、谢赛宁等人在 2024 年 10 月提出（ICLR 2025 口头报告），针对扩散 Transformer（DiT、SiT）训练慢的问题。做法是加一个辅助损失：把网络处理加噪图像时的中间隐藏状态经一个小投影层映射后，去对齐同一张干净图像在 DINOv2 等预训练视觉编码器里的特征。作者认为扩散模型训练的一个瓶颈是自己从零学视觉表征，借用现成的好表征能省下这部分功夫，SiT 的训练因此加速超过 17.5 倍。之后「REPA 式」对齐被推广到视频生成和机器人：例如 Spatial Forcing 把 VLA 的中间视觉 token 与 3D 基础模型 VGGT 的特征对齐，让只见过 2D 数据的 VLA 隐式学到空间感知。","example":"Spatial Forcing 在 OpenVLA-OFT 和 π0 上加入与 VGGT 特征的余弦相似度对齐损失，不额外输入深度图或点云，训练最多加速 3.8 倍，并提升数据效率。","related":["表征学习","扩散 Transformer","DINOv2","辅助损失 / 辅助任务","VGGT","预训练视觉表征"]},{"id":"modality-alignment","category":"training","sec":8,"tier":2,"sources":[{"title":"Visual Instruction Tuning (LLaVA, arXiv 2304.08485)","url":"https://arxiv.org/abs/2304.08485"}],"as_of":"","related_ids":["projector-connector","vision-language-model","multimodal-large-language-model","clip","backbone-freezing","knowledge-insulation"],"name":"模态对齐","alt":"Modality Alignment (Alignment Pre-training Stage)","abbr":"","aliases":["对齐预训练","特征对齐预训练","跨模态对齐"],"one_liner":"把图像等新模态的特征映射到语言模型能读懂的表示空间里。","explanation":"模态对齐指让图像、语言、机器人状态或动作等不同模态的表示落到一个可以互相对应的空间里。狭义上常指多模态大模型训练的第一阶段「对齐预训练」：以 LLaVA（2023）为例，它冻结 CLIP 视觉编码器和大语言模型，只用约 59.5 万对图文数据训练中间的投影层，让图像特征变成语言模型能处理的视觉 token；第二阶段再把投影层和语言模型一起用指令数据微调。先单独对齐，是为了让随机初始化的投影层先学会产出合理的视觉 token，再放开语言模型。广义上，CLIP 用对比学习把图文嵌入拉进同一空间也算模态对齐。VLA 给视觉语言模型接上状态编码器和动作头时也面临同样的问题。","example":"LLaVA 第一阶段在过滤后的 CC3M 子集（59.5 万图文对）上只训练投影矩阵 1 个 epoch，学习率 2e-3；第二阶段冻结视觉编码器，用 15.8 万条多模态指令数据微调投影层和语言模型。","related":["投影层","视觉语言模型","多模态大语言模型","CLIP","冻结骨干网络","知识隔离"]},{"id":"pretraining-on-human-videos","category":"training","sec":8,"tier":2,"sources":[{"title":"R3M: A Universal Visual Representation for Robot Manipulation","url":"https://arxiv.org/abs/2203.12601"},{"title":"Latent Action Pretraining from Videos (LAPA)","url":"https://arxiv.org/abs/2410.11758"},{"title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","url":"https://arxiv.org/abs/2507.15597"}],"as_of":"2025-07","related_ids":["human-video-data","egocentric-video","latent-action-pretraining","embodiment-gap","r3m","lapa"],"name":"人类视频预训练","alt":"Pretraining on Human Videos","abbr":"","aliases":["从人类视频学习","Human Video Pretraining","Learning from Human Videos"],"one_liner":"先用大量人类做事的视频预训练机器人模型，再用少量机器人数据微调。","explanation":"真机数据采集贵、规模小，而人类日常操作的视频（如第一人称数据集 Ego4D、互联网视频）量大、场景多，于是先在人类视频上预训练，再用少量机器人数据微调。难点有两个：视频里没有机器人动作标签；人手和机械手结构不同（本体差异）。主要路线有三类：一是只学视觉表征，如 R3M（CoRL 2022）在 Ego4D 上用时间对比学习和视频-语言对齐训练视觉编码器；二是从前后帧变化里提取潜在动作当伪标签，如 LAPA 用 VQ-VAE 得到离散潜在动作来预训练 VLA；三是估计人手的三维运动当作动作，如 Being-H0 把人手当通用操作器来预训练 VLA。","example":"R3M 在 Ego4D 人类视频上预训练视觉表征后冻结，接上小策略网络，让 Franka 机械臂在真实杂乱的公寓里仅凭 20 条演示学会多种操作任务。","related":["人类视频数据","第一人称视频","潜在动作预训练","本体差异","R3M","LAPA"]},{"id":"latent-action-pretraining","category":"training","sec":8,"tier":3,"sources":[{"title":"Latent Action Pretraining from Videos (LAPA, arXiv:2410.11758)","url":"https://arxiv.org/abs/2410.11758"},{"title":"LAPA 论文 HTML 版","url":"https://arxiv.org/html/2410.11758"}],"as_of":"2024-10","related_ids":["latent-action","latent-action-model","lapa","action-free-video","pretraining-on-human-videos","vector-quantized-variational-autoencoder"],"name":"潜在动作预训练","alt":"Latent Action Pretraining","abbr":"","aliases":["隐动作预训练"],"one_liner":"从没有动作标签的视频里提取「潜在动作」，用它来预训练机器人模型。","explanation":"潜在动作预训练指先从无动作标签的视频中学出「潜在动作」——描述相邻两帧之间发生了什么变化的编码，再让 VLA 预测这些潜在动作来做预训练，最后用少量真机数据把潜在动作映射成真实的机器人动作。代表工作是 2024 年 10 月华盛顿大学、KAIST、微软研究院、英伟达等提出的 LAPA，用 VQ-VAE（向量量化自编码器）学离散潜在动作。它的价值在于能利用互联网视频、人类操作视频这类海量但没有机器人动作标签的数据。Genie 的潜在动作模型、UniVLA、智元 GO-1 也采用了类似思路。","example":"LAPA 论文报告：只用 Something-Something V2 人类操作视频预训练也有正迁移；在需要语言条件和泛化的真机任务上，它超过了用真实动作标签训练的 OpenVLA，预训练算力约为后者的 1/30。","related":["潜在动作","潜在动作模型","LAPA","无动作标签视频","人类视频预训练","向量量化变分自编码器"]},{"id":"multi-task-learning","category":"training","sec":8,"tier":2,"sources":[{"title":"Caruana (1997), Multitask Learning, Machine Learning 28","url":"https://www.cs.cornell.edu/~caruana/mlj97.pdf"},{"title":"An Overview of Multi-Task Learning in Deep Neural Networks (Ruder, 2017)","url":"https://arxiv.org/abs/1706.05098"},{"title":"RT-1: Robotics Transformer for Real-World Control at Scale (project page)","url":"https://robotics-transformer1.github.io/"}],"as_of":"","related_ids":["positive-negative-transfer","transfer-learning","language-conditioned-policy","generalist-policy","data-mixture","rt-1"],"name":"多任务学习","alt":"Multi-Task Learning","abbr":"MTL","aliases":["Multitask Learning","多任务训练"],"one_liner":"让一个模型同时学多个相关任务，共享知识、互相帮忙。","explanation":"Rich Caruana 在 1997 年的论文《Multitask Learning》中系统阐述了这一思路：并行训练多个相关任务、共用一套表示，一个任务学到的东西能帮其他任务学得更好，其他任务的训练信号相当于额外的归纳偏置（模型对「什么样的解更合理」的先验倾向）。深度学习里最常见的是硬参数共享：多个任务共用一个骨干网络，各自接一个输出头。机器人里，多任务策略用语言指令或目标图像告诉模型当前要做什么，一个网络覆盖开抽屉、抓取、摆放等多种技能，今天的 VLA 基本都是多任务模型。难点是任务之间可能互相干扰（负迁移），需要调数据配比和网络结构。","example":"Google 的 RT-1 用 13 台机器人花 17 个月采集了 13 万多条演示，覆盖 700 多条语言指令，由一个 Transformer 策略学会全部任务，在见过的指令上成功率 97%。","related":["正迁移 / 负迁移","迁移学习","语言条件策略","通用策略（通才策略）","数据配比","RT-1"]},{"id":"co-training","category":"training","sec":8,"tier":2,"sources":[{"title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv 2307.15818)","url":"https://arxiv.org/abs/2307.15818"},{"title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation (arXiv 2401.02117)","url":"https://arxiv.org/abs/2401.02117"},{"title":"Sim-and-Real Co-Training: A Simple Recipe for Vision-Based Robotic Manipulation (arXiv 2503.24361)","url":"https://arxiv.org/abs/2503.24361"}],"as_of":"2025-04","related_ids":["data-mixture","sim-to-real-transfer","cross-embodiment-data","rt-2","pi0-5","mobile-aloha"],"name":"协同训练","alt":"Co-training","abbr":"","aliases":["联合训练","混合训练","协同微调","co-fine-tuning","仿真-真机协同训练","Sim-and-Real Co-training"],"one_liner":"把目标机器人数据和其他来源的数据按比例混在一起，训练同一个模型。","explanation":"协同训练在具身智能里指：把少量目标机器人数据和其他来源的数据按比例混进同一批次，一起训练同一个模型。其他来源可以是网上图文问答、别的机器人数据或仿真数据。2023 年谷歌 RT-2 把机器人轨迹和视觉问答等网页任务一起微调，称为 co-fine-tuning；2025 年的 π0.5 把多机器人数据、高层语义预测和网页数据一起训练。它要解决真机数据太少的问题：借其他数据保住视觉和语言常识、提升泛化，关键是调好数据配比。传统机器学习里 Blum 和 Mitchell 1998 年提出的 co-training 是半监督方法，意思不同。","example":"Mobile ALOHA 每个任务只有 50 条移动操作演示，与已有的静态 ALOHA 双臂数据协同训练后，成功率最高提升 90%；英伟达等 2025 年的仿真-真机协同训练研究中，混入仿真数据让真机任务成功率平均提高 38%。","related":["数据配比","仿真到现实迁移","跨本体数据","RT-2","π0.5","Mobile ALOHA"]},{"id":"positive-negative-transfer","category":"training","sec":8,"tier":2,"sources":[{"title":"Characterizing and Avoiding Negative Transfer (CVPR 2019)","url":"https://arxiv.org/abs/1811.09751"},{"title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models (project page)","url":"https://robotics-transformer-x.github.io/"},{"title":"Open X-Embodiment paper (arXiv HTML)","url":"https://arxiv.org/html/2310.08864"}],"as_of":"","related_ids":["transfer-learning","multi-task-learning","cross-embodiment","co-training","data-mixture","rt-x"],"name":"正迁移 / 负迁移","alt":"Positive / Negative Transfer","abbr":"","aliases":["正向迁移","负向迁移","Positive Transfer","Negative Transfer"],"one_liner":"引入其他任务或数据后，目标任务变好叫正迁移，变差叫负迁移。","explanation":"迁移学习和多任务学习里的一对概念：把在源任务、源数据上学到的知识用到目标任务上，目标任务表现提升就是正迁移，反而下降就是负迁移。Wang 等人在 CVPR 2019 的论文中给负迁移下了形式化定义，指出源数据和目标任务相关性太低时容易发生。具身智能里，混合多种机器人、多种任务或互联网图文数据一起训练时，都要回答「加进来的数据是帮忙还是添乱」。常见的负迁移原因有：任务不相关、不同本体的动作空间和坐标系不一致、数据配比失衡、模型容量不够。应对手段包括调数据配比、给每种本体单独的输出头、冻结或隔离部分参数等。","example":"Open X-Embodiment 实验中，用 22 种机器人数据训练的 RT-1-X 在数据少的机器人上比单独训练平均高 50%，是正迁移；但在数据充足的机器人上 RT-1-X 欠拟合，不如只用本机数据的 RT-1，参数大得多的 RT-2-X 才重新占优。","related":["迁移学习","多任务学习","跨本体","协同训练","数据配比","RT-X"]},{"id":"mid-training","category":"training","sec":8,"tier":3,"sources":[{"title":"Mid-Training of Large Language Models: A Survey (arXiv 2510.06826)","url":"https://arxiv.org/abs/2510.06826"},{"title":"MolmoAct: Action Reasoning Models that can Reason in Space (arXiv 2508.07917)","url":"https://arxiv.org/abs/2508.07917"},{"title":"EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data (arXiv 2602.16710)","url":"https://arxiv.org/abs/2602.16710"}],"as_of":"2026-02","related_ids":["pre-training","post-training","supervised-fine-tuning","vision-language-action-model","data-mixture","molmoact"],"name":"中训练","alt":"Mid-training","abbr":"","aliases":["中期训练","中间训练阶段"],"one_liner":"夹在预训练和后训练之间的一轮训练，用更有针对性的数据补特定能力。","explanation":"中训练先在大语言模型里流行：大规模预训练之后、指令微调和强化学习之前，再用质量更高或更贴近目标能力的数据（数学、代码、长文本等）继续训练一段，常配合学习率退火和上下文扩展，目标是补强特定能力又不丢通用基础，2025 年已有专门综述梳理这一阶段。具身领域借用了这个词：现成的视觉语言模型没见过机器人数据，直接微调成 VLA 效果受限，于是在两者之间先用具身相关数据（空间推理、机器人轨迹、与机器人对齐的人类动作等）过渡一轮。Ai2 的 MolmoAct 发布了专门用于中训练的机器人数据集，原力灵机 DM0 也采用预训练、中训练、后训练三段式流程。","example":"EgoScale 先用两万多小时带动作标注的第一人称人类视频预训练 VLA，再用少量人类与机器人动作对齐的数据做一轮轻量中训练，之后只需极少机器人监督就能适配新的灵巧操作任务。","related":["预训练","后训练","监督微调","视觉-语言-动作模型","数据配比","MolmoAct"]},{"id":"post-training","category":"training","sec":9,"tier":1,"sources":[{"title":"Lambert et al. 2024: Tulu 3: Pushing Frontiers in Open Language Model Post-Training","url":"https://arxiv.org/abs/2411.15124"},{"title":"Black et al. 2024: π0: A Vision-Language-Action Flow Model for General Robot Control","url":"https://arxiv.org/html/2410.24164v1"}],"as_of":"","related_ids":["pre-training","fine-tuning","supervised-fine-tuning","reinforcement-fine-tuning","reinforcement-learning-from-human-feedback","mid-training"],"name":"后训练","alt":"Post-training","abbr":"","aliases":["后训练阶段","Posttraining"],"one_liner":"预训练之后的训练阶段，用精选数据或强化学习把基础模型调成好用的样子。","explanation":"后训练指基础模型预训练完之后的训练步骤，这个说法随大语言模型流行起来。大模型先在海量网页数据上预训练，再经过监督微调（SFT）、偏好优化、强化学习等后训练，才变成能按指令回答的助手；Ai2 的 Tulu 3 就公开了一套由 SFT、DPO 和可验证奖励强化学习组成的后训练方案。具身智能沿用了这种分工：π0 论文说，预训练阶段负责广泛能力和泛化，后训练阶段用更窄、更精心整理的数据让模型熟练完成目标任务。后训练常和微调混用，但它更强调「阶段」，里面可能包含多轮微调和强化学习微调。","example":"π0 预训练后，针对叠衣服等复杂任务做后训练：最简单的任务只需约 5 小时数据，最复杂的任务用了 100 小时以上。","related":["预训练","微调","监督微调","强化学习微调","基于人类反馈的强化学习","中训练"]},{"id":"fine-tuning","category":"training","sec":9,"tier":1,"sources":[{"title":"Wikipedia: Fine-tuning (deep learning)","url":"https://en.wikipedia.org/wiki/Fine-tuning_(deep_learning)"},{"title":"Google Machine Learning Glossary: fine-tuning","url":"https://developers.google.com/machine-learning/glossary#fine-tuning"},{"title":"GitHub: Physical-Intelligence/openpi","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"","related_ids":["pre-training","post-training","full-fine-tuning","lora","supervised-fine-tuning","catastrophic-forgetting"],"name":"微调","alt":"Fine-tuning","abbr":"","aliases":["finetune","Finetuning","精调"],"one_liner":"在已训练好的模型上，用新任务的少量数据继续训练，让它更擅长这件事。","explanation":"微调是迁移学习最常见的做法：拿一个预训练好的模型当起点，用目标任务的数据继续训练，而不是从随机参数开始，这样能复用模型已学到的通用知识，省数据也省算力。按更新范围分，全参数微调改动所有权重；也可以冻结大部分层只训一部分，或用 LoRA（低秩适配，插入少量可训练的小矩阵）这类参数高效方法，只训练很少的参数。在具身智能里，拿到开源 VLA 后，用自己机器人采的演示数据微调，是最常见的上手方式。数据太少或训得太久容易过拟合，也可能让模型忘掉原有能力，即灾难性遗忘。","example":"openpi 文档给出的参考：π0 做 LoRA 微调需要 22.5 GB 以上显存（如 RTX 4090），全参数微调需要 70 GB 以上（如 A100 / H100）。","related":["预训练","后训练","全参数微调","低秩适配","监督微调","灾难性遗忘"]},{"id":"full-fine-tuning","category":"training","sec":9,"tier":2,"sources":[{"title":"LoRA: Low-Rank Adaptation of Large Language Models","url":"https://arxiv.org/abs/2106.09685"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model","url":"https://arxiv.org/abs/2406.09246"},{"title":"openpi GitHub README（显存需求表）","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"2025","related_ids":["fine-tuning","parameter-efficient-fine-tuning","lora","catastrophic-forgetting","backbone-freezing","supervised-fine-tuning"],"name":"全参数微调","alt":"Full Fine-Tuning","abbr":"","aliases":["全量微调","全参微调","Full-parameter Fine-Tuning"],"one_liner":"微调时更新预训练模型的全部参数，而不是只训练其中一小部分。","explanation":"微调是在预训练好的模型上，用下游任务数据继续训练。全参数微调指所有权重都参与更新，与之相对的是参数高效微调（PEFT，只训练少量新增或选定的参数，如 LoRA 低秩适配）。全参数微调可调的自由度最大，数据充足、目标任务和预训练差异大时往往效果最好，但代价高：每个参数都要存梯度和优化器状态，显存需求是推理的数倍，每个任务还得保存一整份模型；数据少时也更容易过拟合或出现灾难性遗忘（学了新任务、丢了旧能力）。VLA 迁移到新机器人或新任务时，全参数微调和 LoRA 是最常见的两种选择，要按显卡和数据量取舍。","example":"OpenVLA（7B）论文里全参数微调要 8 张 A100 跑 5–15 小时，成功率 69.7%；LoRA 只训练 1.4% 的参数、单张 A100 即可，成功率 68.2%。openpi 仓库标注 π0 全参数微调需要 70 GB 以上显存，LoRA 约 22.5 GB。","related":["微调","参数高效微调","低秩适配","灾难性遗忘","冻结骨干网络","监督微调"]},{"id":"backbone-freezing","category":"training","sec":9,"tier":2,"sources":[{"title":"PyTorch Tutorial: Transfer Learning for Computer Vision","url":"https://docs.pytorch.org/tutorials/beginner/transfer_learning_tutorial.html"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/html/2406.09246"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/html/2503.14734"}],"as_of":"2025-03","related_ids":["backbone-network","fine-tuning","parameter-efficient-fine-tuning","catastrophic-forgetting","knowledge-insulation","stop-gradient"],"name":"冻结骨干网络","alt":"Backbone Freezing","abbr":"","aliases":["冻结主干","freeze backbone","冻结预训练层"],"one_liner":"训练时固定预训练骨干网络的参数不更新，只训练新加上去的部分。","explanation":"骨干网络指模型中负责提取特征的主体，通常来自预训练，如 ResNet、ViT 或整个 VLM。冻结就是训练时不更新这些参数（PyTorch 里把 requires_grad 设为 False），只训练新加的输出头或动作专家。好处是省显存、训练快、数据少时不易过拟合，也能减少灾难性遗忘；代价是骨干学不到新任务需要的特征。VLA 里的取舍很具体：OpenVLA 发现冻结视觉编码器会丢失精细空间信息、控制变差；英伟达 GR00T N1 则在预训练和后训练中都冻结了 VLM 的语言部分，只训练其余模块。","example":"PyTorch 官方迁移学习教程中，用 ImageNet 预训练的 ResNet-18 做蚂蚁/蜜蜂分类：冻结除最后一层外的所有层，只训练新换上的全连接层。","related":["骨干网络","微调","参数高效微调","灾难性遗忘","知识隔离","梯度阻断"]},{"id":"parameter-efficient-fine-tuning","category":"training","sec":9,"tier":3,"sources":[{"title":"Hugging Face PEFT 文档","url":"https://huggingface.co/docs/peft/index"},{"title":"Han et al. 2024: Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","url":"https://arxiv.org/abs/2403.14608"},{"title":"Kim et al. 2024: OpenVLA: An Open-Source Vision-Language-Action Model","url":"https://arxiv.org/abs/2406.09246"}],"as_of":"","related_ids":["lora","adapter","prompt-tuning-soft-prompt","full-fine-tuning","backbone-freezing","fine-tuning"],"name":"参数高效微调","alt":"Parameter-Efficient Fine-Tuning","abbr":"PEFT","aliases":["高效微调","轻量微调"],"one_liner":"冻结大模型的大部分参数，只训练极少量新增或选定的参数来适配新任务。","explanation":"参数高效微调是一类微调方法的统称：预训练好的大模型参数基本冻结，只训练一小部分参数，让模型适应新任务。常见做法有四种：插入小模块（适配器）、在输入前拼接可学习向量（提示微调）、用低秩矩阵表示权重的改动（LoRA）、只放开少数原有参数（如只调偏置）。它针对的是全参数微调太贵的问题：显存、算力和「每个任务存一整份权重」的存储开销都大幅下降，效果常能接近全参数微调。Hugging Face 的 PEFT 库集成了多种此类方法。把开源 VLA 迁移到自家机器人时，最常用的就是 LoRA。","example":"OpenVLA 论文中，用 LoRA 只更新约 1.4% 的参数、在单张 A100 上训练 10–15 小时，任务成功率 68.2%，与全参数微调的 69.7% 相近；后者要两张 GPU、约 163 GB 显存。","related":["低秩适配","适配器","提示微调 / 软提示","全参数微调","冻结骨干网络","微调"]},{"id":"lora","category":"training","sec":9,"tier":2,"sources":[{"title":"LoRA: Low-Rank Adaptation of Large Language Models (arXiv 2106.09685)","url":"https://arxiv.org/abs/2106.09685"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/abs/2406.09246"},{"title":"openpi（Physical Intelligence 官方仓库，显存需求表）","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"","related_ids":["parameter-efficient-fine-tuning","full-fine-tuning","adapter","fine-tuning","backbone-freezing","openvla"],"name":"低秩适配","alt":"Low-Rank Adaptation","abbr":"LoRA","aliases":["LoRA 微调","低秩自适应","低秩适应"],"one_liner":"冻结大模型原有权重，只训练旁路插入的两个小矩阵来完成微调。","explanation":"LoRA 由微软的 Edward Hu 等人在 2021 年提出，是最常用的参数高效微调方法。做法是冻结预训练权重 W，在选定的层（常见是 Transformer 注意力里的投影矩阵）旁边加一条旁路 B·A：A、B 是两个很窄的矩阵，秩 r 远小于原矩阵的维度，微调时只训练它们；训练完可以把 B·A 直接加回 W，推理时不增加额外延迟。论文报告，与用 Adam 全量微调 GPT-3 175B 相比，可训练参数减少约 1 万倍，显存需求降到约三分之一。对具身智能来说，VLA 大多建立在数十亿参数的视觉语言模型上，LoRA 让普通实验室也能用单张消费级显卡把模型适配到自己的机器人和任务上。","example":"OpenVLA 论文中，rank 32 的 LoRA 只训练约 1.4% 的参数，成功率 68.2%，与全参数微调的 69.7% 基本持平；openpi 给出的 π0 LoRA 微调显存需求为 22.5GB 以上，可在 RTX 4090 上跑，全参数微调则需要 70GB 以上。","related":["参数高效微调","全参数微调","适配器","微调","冻结骨干网络","OpenVLA"]},{"id":"adapter","category":"training","sec":9,"tier":3,"sources":[{"title":"Parameter-Efficient Transfer Learning for NLP (Houlsby et al., arXiv 1902.00751)","url":"https://arxiv.org/abs/1902.00751"},{"title":"TAIL: Task-specific Adapters for Imitation Learning with Large Pretrained Models (arXiv 2310.05905)","url":"https://arxiv.org/abs/2310.05905"}],"as_of":"","related_ids":["parameter-efficient-fine-tuning","lora","backbone-freezing","catastrophic-forgetting","full-fine-tuning","prompt-tuning-soft-prompt"],"name":"适配器","alt":"Adapter","abbr":"","aliases":["Adapter 微调","适配器微调","Adapter 模块","瓶颈适配器"],"one_liner":"在冻结的大模型层间插入小模块，只训练这些小模块来适配新任务。","explanation":"适配器是一类参数高效微调方法，由 Houlsby 等人 2019 年在论文《Parameter-Efficient Transfer Learning for NLP》中提出：在 Transformer 各层插入「先降维、再升维」的小型瓶颈网络（带残差连接），微调时冻结原模型，只训练适配器。在 BERT 的 26 个文本分类任务上，每个任务只增加 3.6% 的参数，效果与全参数微调相差不到 0.4%。它省显存、省存储，一个底座可挂多个任务的适配器，也能减轻灾难性遗忘；后来的 LoRA 延续了同一思路。机器人领域中，TAIL（ICLR 2024）比较了瓶颈适配器、P-Tuning 和 LoRA 在模仿学习中的表现，给 VLA 适配新任务、新本体时也常用这类方法。","example":"TAIL 用少量演示微调预训练的决策模型，发现 LoRA 只训练约 1% 的参数就能达到与全参数微调相当的效果，并在持续学习中避免了灾难性遗忘。","related":["参数高效微调","低秩适配","冻结骨干网络","灾难性遗忘","全参数微调","提示微调 / 软提示"]},{"id":"prompt-tuning-soft-prompt","category":"training","sec":9,"tier":3,"sources":[{"title":"Lester, Al-Rfou, Constant 2021: The Power of Scale for Parameter-Efficient Prompt Tuning","url":"https://arxiv.org/abs/2104.08691"},{"title":"Zheng et al. 2025: X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment VLA Model","url":"https://arxiv.org/abs/2510.10274"}],"as_of":"2025-10","related_ids":["parameter-efficient-fine-tuning","prompt-prompt-engineering","lora","adapter","x-vla","embedding"],"name":"提示微调 / 软提示","alt":"Prompt Tuning / Soft Prompt","abbr":"","aliases":["软提示","Soft Prompt","软提示微调"],"one_liner":"冻结整个模型，只训练拼在输入前面的一小段可学习向量来适配任务。","explanation":"提示微调是一种参数高效微调方法，由谷歌的 Lester 等人 2021 年提出。人写的文字提示属于「硬提示」；软提示则是一串直接在嵌入空间里学出来的向量，不对应任何具体文字。训练时模型全部参数冻结，只用梯度下降更新这一小段向量，每个任务只需额外存一份很小的软提示，同一个模型可以服务多个任务。论文发现模型越大效果越接近全参数微调，在数十亿参数规模时已基本持平。前缀微调（在每层注意力前加可学习前缀）和视觉提示微调是同类思路。在机器人领域，软提示也被用来标记不同本体或数据来源。","example":"X-VLA 给每个数据来源（不同机器人本体和采集设置）配一组可学习的软提示嵌入，主干用标准 Transformer，0.9B 参数的模型即可做跨本体训练，并在多个仿真和真机平台上测试。","related":["参数高效微调","提示词 / 提示工程","低秩适配","适配器","X-VLA","嵌入向量"]},{"id":"supervised-fine-tuning","category":"training","sec":9,"tier":2,"sources":[{"title":"Training language models to follow instructions with human feedback (InstructGPT, arXiv 2203.02155)","url":"https://arxiv.org/abs/2203.02155"},{"title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT, arXiv 2502.19645)","url":"https://arxiv.org/abs/2502.19645"}],"as_of":"","related_ids":["fine-tuning","behavior-cloning","post-training","instruction-tuning","reinforcement-fine-tuning","reinforcement-learning-from-human-feedback"],"name":"监督微调","alt":"Supervised Fine-Tuning","abbr":"SFT","aliases":["有监督微调","监督式微调"],"one_liner":"用「输入—标准答案」成对数据，在预训练模型上继续做有监督训练。","explanation":"监督微调指拿一个预训练好的模型，在整理好的高质量标注数据上继续训练，让它学会某种具体行为；训练目标就是让输出尽量贴近给定答案（语言输出用交叉熵，连续动作常用 L1 或均方误差）。这个叫法因 OpenAI 2022 年的 InstructGPT 流行：先用人写的示范回答做 SFT，再训练奖励模型、做 RLHF，成为大模型后训练的经典三步。机器人里，SFT 通常指在某台机器人、某些任务的遥操作演示上微调 VLA 等基础模型，本质就是行为克隆。它简单稳定，但只会模仿演示，遇到演示里没出现过的状态容易出错，所以常在 SFT 之后再接强化学习微调。","example":"斯坦福的 OpenVLA-OFT 改进了 OpenVLA 的微调方式（并行解码、动作分块、连续动作表示加 L1 回归），在 LIBERO 仿真基准上把成功率从 76.5% 提升到 97.1%，动作生成吞吐提高 26 倍。","related":["微调","行为克隆","后训练","指令微调","强化学习微调","基于人类反馈的强化学习"]},{"id":"instruction-tuning","category":"training","sec":9,"tier":3,"sources":[{"title":"Finetuned Language Models Are Zero-Shot Learners (FLAN, arXiv:2109.01652)","url":"https://arxiv.org/abs/2109.01652"},{"title":"Visual Instruction Tuning (LLaVA, arXiv:2304.08485)","url":"https://arxiv.org/abs/2304.08485"}],"as_of":"","related_ids":["supervised-fine-tuning","large-language-model","vision-language-model","llava","zero-shot","post-training"],"name":"指令微调","alt":"Instruction Tuning","abbr":"","aliases":["指令调优","Instruction Fine-tuning"],"one_liner":"用「指令—回答」格式的多任务数据微调模型，让它学会听指令办事。","explanation":"指令微调是在预训练模型上，用大量以自然语言指令描述的任务样本（指令 + 期望输出）做监督微调。2021 年 Google 的 FLAN 工作把一个 1370 亿参数模型在 60 多个 NLP 任务上做指令微调，零样本表现在 25 个评测任务中的 20 个超过 GPT-3。它让模型从「续写文本」变成「按要求办事」，是对话助手的基础步骤之一。多模态里，LLaVA 用 GPT-4 生成图文指令数据做「视觉指令微调」；很多 VLA 的骨干 VLM 经历过这一步，训练 VLA 时也常把这类数据混进来，减少遗忘。","example":"LLaVA（2023）用 GPT-4 把图片的文字描述改写成「看图回答问题」式的指令数据，再用它微调「视觉编码器 + 语言模型」的组合，得到能看图对话的助手。","related":["监督微调","大语言模型","视觉语言模型","LLaVA（视觉指令微调架构）","零样本","后训练"]},{"id":"rejection-sampling-fine-tuning","category":"training","sec":9,"tier":3,"sources":[{"title":"Yuan et al. 2023: Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","url":"https://arxiv.org/abs/2308.01825"},{"title":"Chen et al. 2021: Decision Transformer: Reinforcement Learning via Sequence Modeling","url":"https://arxiv.org/abs/2106.01345"},{"title":"Li et al. 2025: GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation","url":"https://arxiv.org/abs/2512.01801"}],"as_of":"2025-12","related_ids":["behavior-cloning","supervised-fine-tuning","self-improvement","best-of-n-sampling","suboptimal-demonstrations","advantage-conditioning"],"name":"拒绝采样微调 / 过滤式行为克隆","alt":"Rejection Sampling Fine-Tuning / Filtered Behavior Cloning","abbr":"","aliases":["RFT（拒绝采样微调）","Filtered BC","百分位行为克隆","Percentile Behavior Cloning (%BC)","成功过滤行为克隆"],"one_liner":"让模型多试几次，只留下成功或高分的结果，再拿来做监督训练。","explanation":"两个名字说的是同一类做法：先让现有模型针对任务生成多个结果，用答案检查、成功检测或回报排序把差的丢掉（「拒绝」），只把好的样本当训练数据做监督微调或行为克隆。大模型领域常引用 Yuan 等人 2023 年的论文，用它扩充数学推理数据；2021 年的决策 Transformer 论文里也有「只克隆回报前 X% 数据」的百分位行为克隆（%BC）作对照。它实现简单、训练稳定，缺点是失败样本里的信息被直接扔掉。机器人里常用来只保留成功的自主轨迹，或像字节 GR-RL 那样用学到的任务进度函数筛掉演示中没推进任务的片段。注意缩写 RFT 也常指强化学习微调。","example":"Yuan 等人让多个模型对 GSM8K 数学题反复作答，只保留答案正确的推理过程加入训练集，LLaMA-7B 的准确率从普通监督微调的 35.9% 提高到 49.3%。","related":["行为克隆","监督微调","自我提升","最优 N 采样","次优演示","优势条件化"]},{"id":"cold-start","category":"training","sec":9,"tier":2,"sources":[{"title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (arXiv 2501.12948)","url":"https://arxiv.org/html/2501.12948v1"},{"title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning (arXiv 2509.09674)","url":"https://arxiv.org/abs/2509.09674"}],"as_of":"2025-09","related_ids":["supervised-fine-tuning","reinforcement-fine-tuning","behavior-cloning","post-training","sparse-reward","simplevla-rl"],"name":"冷启动","alt":"Cold Start (SFT Cold-start before RL)","abbr":"","aliases":["冷启动数据","冷启动微调","Cold-start SFT","Cold-start Data"],"one_liner":"强化学习之前，先用少量高质量示范做监督微调，给模型一个像样的起点。","explanation":"冷启动在大模型和 VLA 训练里指：正式做强化学习之前，先用少量高质量数据做监督微调（SFT，直接拿标准答案训练），得到一个基本会做任务的初始模型。这个说法因 DeepSeek-R1（2025 年 1 月）流行：纯 RL 训出的 R1-Zero 可读性差、多语言混杂，于是先用数千条长思维链数据微调再做 RL。原因是强化学习靠试错，初始模型几乎从不成功时拿不到奖励信号，训练慢且不稳。具身领域的对应做法是先用演示数据做行为克隆得到基础策略，再到仿真或真机上做 RL 微调。推荐系统里的「冷启动」指新用户没有历史数据，是另一回事。","example":"SimpleVLA-RL（2025）先对每个任务只用 1 条演示做 SFT，LIBERO-Long 成功率为 17.3%；以此为起点做强化学习后升到 91.7%。","related":["监督微调","强化学习微调","行为克隆","后训练","稀疏奖励","SimpleVLA-RL"]},{"id":"reinforcement-fine-tuning","category":"training","sec":9,"tier":2,"sources":[{"title":"OpenAI API Docs: Reinforcement fine-tuning","url":"https://developers.openai.com/api/docs/guides/reinforcement-fine-tuning"},{"title":"πRL: Online RL Fine-tuning for Flow-based Vision-Language-Action Models","url":"https://arxiv.org/abs/2510.25889"},{"title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","url":"https://arxiv.org/abs/2509.09674"}],"as_of":"2026-01","related_ids":["post-training","supervised-fine-tuning","proximal-policy-optimization","group-relative-policy-optimization","pirl","simplevla-rl"],"name":"强化学习微调","alt":"Reinforcement Fine-Tuning (RL Fine-Tuning)","abbr":"RFT","aliases":["强化微调","RL 微调","RL fine-tuning","强化学习后训练"],"one_liner":"在预训练或监督微调过的模型上，再用奖励信号做强化学习来提升能力。","explanation":"强化学习微调是拿一个已预训练或监督微调（SFT）过的模型当初始策略，让它自己生成回答或执行动作，按奖励打分，再用策略梯度等算法更新参数。和只模仿示范的 SFT 不同，它能从自己的成败中学习，学到示范里没有的做法。「RFT」一词因 OpenAI 面向 o 系列推理模型的强化微调服务流行开来：用户提供评分器，模型对每道题采样多个回答再按分数强化。具身领域 2025 年起涌现大量 VLA 强化学习微调工作，奖励常用任务成败的二值信号，算法多用 PPO、GRPO；流匹配动作头算不出动作概率，需要专门改造（如 πRL）。","example":"πRL 用在线强化学习微调流匹配 VLA：π0 先在 LIBERO 上用少量示范做 SFT，成功率 57.6%，强化学习后升到 97.6%；π0.5 从 77.1% 升到 98.3%。SimpleVLA-RL 则只用「成功记 1、失败记 0」的奖励配合 GRPO 训练 OpenVLA-OFT。","related":["后训练","监督微调","近端策略优化","组相对策略优化","πRL","SimpleVLA-RL"]},{"id":"reinforcement-learning-from-human-feedback","category":"training","sec":9,"tier":2,"sources":[{"title":"Deep Reinforcement Learning from Human Preferences (Christiano et al., 2017)","url":"https://arxiv.org/abs/1706.03741"},{"title":"Training language models to follow instructions with human feedback (InstructGPT)","url":"https://arxiv.org/abs/2203.02155"},{"title":"Wikipedia: Reinforcement learning from human feedback","url":"https://en.wikipedia.org/wiki/Reinforcement_learning_from_human_feedback"}],"as_of":"","related_ids":["reward-model","direct-preference-optimization","proximal-policy-optimization","kl-regularization","reward-hacking","grape"],"name":"基于人类反馈的强化学习","alt":"Reinforcement Learning from Human Feedback","abbr":"RLHF","aliases":["人类反馈强化学习","偏好优化","偏好对齐","Preference Alignment"],"one_liner":"让人比较模型输出的好坏，据此训练奖励模型，再用强化学习按人的偏好优化模型。","explanation":"RLHF 由 Christiano 等人（OpenAI 与 DeepMind）2017 年提出：人只需比较两段轨迹哪段更好，就能学出奖励函数，所需人工反馈不到交互量的 1%。2022 年 OpenAI 的 InstructGPT 把它用于大语言模型，分三步：监督微调；用人对多个回答的排序训练奖励模型；用 PPO 优化模型并加 KL 惩罚防止偏离原模型，ChatGPT 沿用了这套流程。它适合「难写成公式、但人一看就能判断」的目标，缺点是标注贵，模型还可能钻奖励模型的空子。DPO 跳过奖励模型直接用偏好数据训练；具身领域的 GRAPE 用轨迹级偏好对齐 VLA。","example":"InstructGPT 的人工评测中，经过 RLHF、只有 13 亿参数的模型，回答比 1750 亿参数的 GPT-3 更受偏好。","related":["奖励模型","直接偏好优化","近端策略优化","KL 正则化","奖励黑客","GRAPE"]},{"id":"direct-preference-optimization","category":"training","sec":9,"tier":3,"sources":[{"title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model (arXiv:2305.18290)","url":"https://arxiv.org/abs/2305.18290"},{"title":"GRAPE: Generalizing Robot Policy via Preference Alignment (arXiv:2411.19309)","url":"https://arxiv.org/abs/2411.19309"}],"as_of":"","related_ids":["reinforcement-learning-from-human-feedback","reward-model","kl-regularization","grape","post-training","group-relative-policy-optimization"],"name":"直接偏好优化","alt":"Direct Preference Optimization","abbr":"DPO","aliases":["DPO 损失","偏好优化"],"one_liner":"不训练奖励模型、不跑强化学习，直接用「好/坏」成对样本对齐模型的方法。","explanation":"DPO 由斯坦福 Rafailov、Finn 等人在 2023 年提出。传统 RLHF（基于人类反馈的强化学习）要先用偏好数据训练奖励模型，再用 PPO 等算法做强化学习，流程长、不稳定。DPO 证明带 KL 约束的奖励最大化问题的最优策略有闭式解，于是问题变成一个分类式损失：提高被偏好样本相对参考模型的概率，压低被拒绝样本的概率，训练中无需从模型采样。它最早用于大语言模型对齐，在具身领域被借来做 VLA 后训练：把成功轨迹和失败轨迹配成偏好对，直接优化策略。","example":"GRAPE（2024）在 OpenVLA 上把 DPO 从单步推广到整条轨迹（称为 TPO）：把成功与失败的操作轨迹配成偏好对来微调，并以逐步做 DPO 的 OpenVLA-DPO 作为对比基线。","related":["基于人类反馈的强化学习","奖励模型","KL 正则化","GRAPE","后训练","组相对策略优化"]},{"id":"reinforcement-learning-with-verifiable-rewards","category":"training","sec":9,"tier":3,"sources":[{"title":"Lambert et al. 2024: Tülu 3: Pushing Frontiers in Open Language Model Post-Training","url":"https://arxiv.org/abs/2411.15124"},{"title":"DeepSeek-AI 2025: DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","url":"https://arxiv.org/abs/2501.12948"},{"title":"Li et al. 2025: SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","url":"https://arxiv.org/abs/2509.09674"}],"as_of":"2025-09","related_ids":["reinforcement-fine-tuning","reward-model","reinforcement-learning-from-human-feedback","group-relative-policy-optimization","sparse-reward","simplevla-rl"],"name":"基于可验证奖励的强化学习","alt":"Reinforcement Learning with Verifiable Rewards","abbr":"RLVR","aliases":["可验证奖励强化学习","RL with Verifiable Rewards"],"one_liner":"用程序能自动判对错的结果当奖励，对模型做强化学习训练。","explanation":"RLVR 这个名字出自艾伦人工智能研究所（Ai2）2024 年 11 月的 Tülu 3 论文：对数学题、可自动检查的指令约束等任务，用规则或程序判断模型输出是否正确，答对给一个固定奖励、答错给 0，再用 PPO 等强化学习算法更新模型。它不需要单独训练奖励模型（RLHF 里给回答打分的网络），奖励来源更可靠，相对不易被模型钻空子。2025 年 DeepSeek-R1 用基于规则的准确性奖励练出推理能力，让这条路线广为人知。放到机器人上，「任务成没成功」就是天然的可验证奖励，SimpleVLA-RL、VLA-RFT 等工作都用成功与否的二值奖励对 VLA 做强化学习微调。","example":"SimpleVLA-RL 在 OpenVLA-OFT 上只用「任务成功得奖励、失败不得」的结果奖励做强化学习，在 LIBERO 上取得领先成绩，在 RoboTwin 1.0 / 2.0 上超过 π0，真机表现也好于只做监督微调的版本。","related":["强化学习微调","奖励模型","基于人类反馈的强化学习","组相对策略优化","稀疏奖励","SimpleVLA-RL"]},{"id":"kl-regularization","category":"training","sec":9,"tier":3,"sources":[{"title":"Training language models to follow instructions with human feedback (InstructGPT, arXiv:2203.02155)","url":"https://arxiv.org/abs/2203.02155"},{"title":"Behavior Regularized Offline Reinforcement Learning (BRAC, arXiv:1911.11361)","url":"https://arxiv.org/abs/1911.11361"}],"as_of":"","related_ids":["kullback-leibler-divergence","policy-constraint","offline-reinforcement-learning","reinforcement-learning-from-human-feedback","proximal-policy-optimization","reward-hacking"],"name":"KL 正则化","alt":"KL Regularization (KL Penalty)","abbr":"","aliases":["KL 惩罚","KL 约束","KL Penalty"],"one_liner":"在训练目标里加 KL 散度惩罚，不让新策略偏离参考策略太远。","explanation":"KL 正则化是在优化目标里加一项 KL 散度（衡量两个概率分布差多少）乘以系数，惩罚当前策略偏离某个参考策略。常见场景有三类：RLHF 中 InstructGPT 对每个 token 加相对监督微调模型的 KL 惩罚，防止模型钻奖励模型的空子；离线强化学习中，BRAC 等方法用 KL 等散度把策略拉在数据的行为策略附近，避免选到数据里没有的动作；TRPO、PPO 则用 KL 限制每次更新的幅度。VLA 的强化学习微调也常用它防止策略跑偏、丢掉预训练能力。系数太大学不动，太小约束失效。","example":"InstructGPT 的 PPO 目标是「奖励模型打分 − β·log(π_RL / π_SFT)」，β 越大，新模型越不敢偏离监督微调模型。","related":["KL 散度","策略约束","离线强化学习","基于人类反馈的强化学习","近端策略优化","奖励黑客"]},{"id":"catastrophic-forgetting","category":"training","sec":9,"tier":2,"sources":[{"title":"Wikipedia: Catastrophic interference","url":"https://en.wikipedia.org/wiki/Catastrophic_interference"},{"title":"Knowledge Insulating Vision-Language-Action Models (arXiv 2505.23705)","url":"https://arxiv.org/html/2505.23705"},{"title":"π0.5: a Vision-Language-Action Model with Open-World Generalization (arXiv 2504.16054)","url":"https://arxiv.org/abs/2504.16054"}],"as_of":"2025-05","related_ids":["continual-learning","backbone-freezing","co-training","knowledge-insulation","stop-gradient","parameter-efficient-fine-tuning"],"name":"灾难性遗忘","alt":"Catastrophic Forgetting","abbr":"","aliases":["遗忘","灾难性干扰","Catastrophic Interference"],"one_liner":"神经网络学了新任务后，旧任务上的能力大幅下降甚至丢失的现象。","explanation":"灾难性遗忘又叫灾难性干扰，1989 年 McCloskey 和 Cohen 让反向传播网络先后学两组加法题时首次系统报告：学新内容会改动表示旧知识的权重，旧任务成绩骤降。缓解方法有回放旧数据、弹性权重巩固（EWC，保护对旧任务重要的权重）、冻结部分网络、参数高效微调等。具身智能里，把预训练 VLM 改造成 VLA、只用机器人数据微调，常会丢掉原有的语言理解和常识。所以 π0.5 等模型混合网页图文数据和机器人数据协同训练，Physical Intelligence 还提出知识隔离，阻断动作专家的梯度流回 VLM。","example":"Physical Intelligence 在知识隔离论文中指出，直接给 VLM 接上连续动作专家一起训练，会让模型明显损失预训练知识，削弱理解语言指令的能力；他们用梯度阻断加上图文问答数据协同训练来缓解。","related":["持续学习","冻结骨干网络","协同训练","知识隔离","梯度阻断","参数高效微调"]},{"id":"continual-learning","category":"training","sec":9,"tier":3,"sources":[{"title":"A Comprehensive Survey of Continual Learning: Theory, Method and Application (arXiv 2302.00487)","url":"https://arxiv.org/abs/2302.00487"},{"title":"Overcoming catastrophic forgetting in neural networks (EWC, arXiv 1612.00796)","url":"https://arxiv.org/abs/1612.00796"},{"title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning (arXiv 2306.03310)","url":"https://arxiv.org/abs/2306.03310"}],"as_of":"","related_ids":["catastrophic-forgetting","transfer-learning","fine-tuning","multi-task-learning","libero-benchmark","knowledge-insulation"],"name":"持续学习","alt":"Continual Learning","abbr":"","aliases":["终身学习","Lifelong Learning","增量学习"],"one_liner":"让模型按顺序学新任务、新数据，同时不忘掉以前学会的东西。","explanation":"持续学习研究模型在整个使用周期里不断接收新任务、新数据时，如何逐步积累和更新知识。最大障碍是灾难性遗忘：神经网络在新数据上接着训练，旧任务的表现会大幅下降。核心取舍是「稳定性-可塑性」平衡，既要保住旧知识，又要能学新东西。常见思路包括正则化（如 DeepMind 2017 年的 EWC，放慢对旧任务重要权重的更新）、回放（把旧数据或生成的旧样本混进来一起训练）和结构扩展（给新任务单独加参数）。对机器人来说，部署后会不断遇到新物体、新场景，理想情况是边用边学，而不是每次从头重训；2023 年的 LIBERO 基准专为终身机器人学习设计，含 4 个任务套件共 130 个任务。VLA 微调后丢掉原 VLM 的语言和常识能力，也属于遗忘问题。","example":"一台家用机器人先学会叠毛巾，之后又陆续学开冰箱、洗碗；持续学习要求学完洗碗后，叠毛巾的成功率不明显下降。","related":["灾难性遗忘","迁移学习","微调","多任务学习","LIBERO","知识隔离"]},{"id":"knowledge-insulation","category":"training","sec":9,"tier":3,"sources":[{"title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better (arXiv:2505.23705)","url":"https://arxiv.org/abs/2505.23705"},{"title":"论文 HTML 版（方法与实验细节）","url":"https://arxiv.org/html/2505.23705"}],"as_of":"2025-05","related_ids":["stop-gradient","action-expert","pi0-5","pi0-fast","catastrophic-forgetting","co-training"],"name":"知识隔离","alt":"Knowledge Insulation","abbr":"KI","aliases":["知识绝缘","Knowledge Insulating VLA"],"one_liner":"训练 VLA 时切断动作专家回传给 VLM 骨干的梯度，保护预训练知识。","explanation":"知识隔离是 Physical Intelligence 在 2025 年 5 月的论文中提出的 VLA 训练方法（Driess、Levine 等）。π0 这类模型在 VLM 骨干上接一个新初始化的动作专家，用流匹配输出连续动作，但动作专家的梯度回传会扰乱骨干，既拖慢训练又损害语言理解。做法是：用梯度阻断切断动作专家到骨干的梯度；骨干改用 FAST 离散动作 token 做下一个 token 预测来学动作，同时混训图文问答等 VLM 数据；推理时仍由动作专家快速生成连续动作块。","example":"论文在收拾餐桌任务上报告，知识隔离版本的收敛速度约为纯流匹配训练的 π0 的 7.5 倍，同时保留了较好的语言指令跟随能力。","related":["梯度阻断","动作专家","π0.5","π0-FAST","灾难性遗忘","协同训练"]},{"id":"model-merging","category":"training","sec":9,"tier":3,"sources":[{"title":"Yadav et al. 2025: Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging (RETAIN)","url":"https://arxiv.org/abs/2512.08333"},{"title":"Wortsman et al. 2022: Model soups","url":"https://arxiv.org/abs/2203.05482"},{"title":"Ilharco et al. 2022: Editing Models with Task Arithmetic","url":"https://arxiv.org/abs/2212.04089"}],"as_of":"2025-12","related_ids":["catastrophic-forgetting","fine-tuning","continual-learning","lora","exponential-moving-average","checkpoint"],"name":"模型合并","alt":"Model Merging (Weight Interpolation)","abbr":"","aliases":["权重插值","权重平均","模型汤（Model Soups）","任务算术（Task Arithmetic）"],"one_liner":"不再训练，直接把几个同源模型的参数按比例加权，合成一个新模型。","explanation":"模型合并是把结构相同、通常从同一个预训练模型微调出来的多个模型在参数层面直接组合，不需额外训练，推理成本也不增加。最简单的是线性插值：新参数 =（1−α）× 预训练参数 + α × 微调参数。代表工作有插值零样本模型与微调模型以保鲁棒性的 WiSE-FT、平均多组超参数微调结果的 Model Soups，以及把「微调后减预训练」的参数差当任务向量加减的任务算术。具身领域用它缓解微调造成的灾难性遗忘：Levine 团队 2025 年的 RETAIN 把微调后的 π0-FAST-DROID 与原模型插值，新技能和原有泛化能力兼得。但也有研究发现，把在不同任务上各自微调的 VLA 直接合并，成功率可能接近零。","example":"RETAIN 用几十条演示把 π0-FAST-DROID 微调到「用板擦擦白板」任务，再与原模型按 α 在 0.25–0.75 之间插值；合并后的模型在新物体、新视角等分布外变体上明显好于只做微调的版本。","related":["灾难性遗忘","微调","持续学习","低秩适配","指数移动平均","检查点"]},{"id":"knowledge-distillation","category":"training","sec":9,"tier":2,"sources":[{"title":"Distilling the Knowledge in a Neural Network (arXiv 1503.02531)","url":"https://arxiv.org/abs/1503.02531"},{"title":"Learning Quadrupedal Locomotion over Challenging Terrain (Science Robotics 2020, arXiv 2010.11251)","url":"https://arxiv.org/abs/2010.11251"}],"as_of":"","related_ids":["teacher-student-distillation","privileged-information","policy-distillation","on-policy-distillation","kullback-leibler-divergence","diffusion-step-distillation"],"name":"知识蒸馏","alt":"Knowledge Distillation","abbr":"KD","aliases":["蒸馏","模型蒸馏"],"one_liner":"让小的学生模型去模仿大的教师模型的输出，把能力压缩进小模型。","explanation":"知识蒸馏由 Hinton、Vinyals 和 Dean 在 2015 年的论文中系统提出：先训练一个大而强的教师模型，再让小的学生模型去拟合教师输出的概率分布（称为软标签），而不只拟合真值标签。论文通过调高 softmax 的「温度」让软标签更平滑，暴露出类别之间的相似关系，学生因此能学到更多信息。它解决的是大模型部署贵、推理慢的问题。在具身智能里，蒸馏常以教师-学生形式出现：教师在仿真里使用真机拿不到的特权信息（如地形、接触状态）训练，学生只用真机传感器去模仿教师的动作，从而实现仿真到现实迁移；它也用于把多步去噪的扩散策略蒸馏成少步模型，降低推理延迟。","example":"Lee 等人 2020 年发表在 Science Robotics 的 ANYmal 四足工作中，教师策略在仿真里能看到地形真值和足端接触，学生策略只输入本体感知历史、通过模仿教师来学习，最终零样本部署到泥地、雪地、碎石等野外地形。","related":["教师-学生蒸馏","特权信息","策略蒸馏","在线策略蒸馏","KL 散度","扩散步数蒸馏"]},{"id":"policy-distillation","category":"training","sec":9,"tier":3,"sources":[{"title":"Rusu et al. 2015: Policy Distillation","url":"https://arxiv.org/abs/1511.06295"},{"title":"Wan et al. 2023: UniDexGrasp++","url":"https://arxiv.org/abs/2304.00464"},{"title":"He et al. 2024: HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots","url":"https://arxiv.org/abs/2410.21229"}],"as_of":"","related_ids":["knowledge-distillation","teacher-student-distillation","specialist-policy","generalist-policy","dagger","on-policy-distillation"],"name":"策略蒸馏","alt":"Policy Distillation","abbr":"","aliases":["专家到通才蒸馏","Specialist-to-Generalist Distillation"],"one_liner":"让一个学生策略模仿一个或多个训好的老师策略，把本事压缩或合并进来。","explanation":"策略蒸馏是知识蒸馏在决策问题上的用法：学生策略不直接从奖励中学，而是去拟合老师策略在各个状态下输出的动作或动作分布。DeepMind 的 Rusu 等人 2015 年在 Atari 游戏上系统提出这一做法，一是把大网络压成小网络，二是把多个单游戏专家合并成一个多任务策略，合并后的表现超过各自单独训练的版本。机器人里常见的是「专家到通才」：先针对不同物体、任务，或借助特权信息（只在仿真里拿得到的真值状态）分别训练专用策略，再蒸馏进一个通用策略，常配合 DAgger 在学生自己走到的状态上向老师要标签。","example":"北大王鹤团队的 UniDexGrasp++ 先按物体几何特征把数千个物体分组，各训练一个专家抓取策略，再迭代蒸馏成一个通才策略，最终在训练集和测试集物体上的抓取成功率分别为 85.4% 和 78.2%。","related":["知识蒸馏","教师-学生蒸馏","专用策略","通用策略（通才策略）","DAgger（数据集聚合）","在线策略蒸馏"]},{"id":"on-policy-distillation","category":"training","sec":9,"tier":3,"sources":[{"title":"Thinking Machines Lab (Kevin Lu), 2025-10-27: On-Policy Distillation","url":"https://thinkingmachines.ai/blog/on-policy-distillation/"},{"title":"Agarwal et al. 2023: On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes (GKD)","url":"https://arxiv.org/abs/2306.13649"},{"title":"VLA-OPD: Bridging Offline SFT and Online RL for VLA Models via On-Policy Distillation (arXiv 2603.26666)","url":"https://arxiv.org/abs/2603.26666"}],"as_of":"2026-03","related_ids":["knowledge-distillation","policy-distillation","dagger","teacher-student-distillation","reinforcement-fine-tuning","vla-opd"],"name":"在线策略蒸馏","alt":"On-Policy Distillation","abbr":"OPD","aliases":["同策略蒸馏","广义知识蒸馏（GKD）"],"one_liner":"学生模型自己生成轨迹，老师在这些轨迹的每一步上打分纠正的蒸馏方法。","explanation":"普通知识蒸馏让学生模仿老师事先生成好的数据，可学生部署时会走到老师数据里没有的状态，错误逐步累积，这和行为克隆的复合误差是同一个问题。在线策略蒸馏改为让学生自己采样生成，再由老师在学生实际走到的每一步（每个 token 或每个动作）上给出目标分布，常用反向 KL 散度衡量差距，思路与 DAgger 一脉相承。Google DeepMind 的 Agarwal 等人 2023 年以 GKD 系统提出这一做法；Thinking Machines 2025 年 10 月的博客让它在大模型后训练中广为人知，它的反馈比强化学习的稀疏奖励稠密得多。2026 年的 VLA-OPD 把它用到 VLA 后训练，用专家老师的逐步监督替代稀疏的环境奖励。","example":"据 Thinking Machines 博客引用的 Qwen3 技术报告，在线策略蒸馏在 AIME'24 上拿到 74.4 分、约用 1800 GPU 时；直接做强化学习只有 67.6 分，却用了约 17920 GPU 时。","related":["知识蒸馏","策略蒸馏","DAgger（数据集聚合）","教师-学生蒸馏","强化学习微调","VLA-OPD"]},{"id":"diffusion-step-distillation","category":"training","sec":9,"tier":3,"sources":[{"title":"One-step Diffusion with Distribution Matching Distillation (arXiv 2311.18828)","url":"https://arxiv.org/abs/2311.18828"},{"title":"Progressive Distillation for Fast Sampling of Diffusion Models (arXiv 2202.00512)","url":"https://arxiv.org/abs/2202.00512"},{"title":"One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion Distillation (arXiv 2410.21257)","url":"https://arxiv.org/abs/2410.21257"}],"as_of":"","related_ids":["diffusion-model","denoising-steps","consistency-model","one-step-generation","knowledge-distillation","consistency-policy"],"name":"扩散步数蒸馏","alt":"Diffusion Step Distillation (e.g., Distribution Matching Distillation)","abbr":"DMD","aliases":["步数蒸馏","少步蒸馏","分布匹配蒸馏","Distribution Matching Distillation","渐进式蒸馏"],"one_liner":"把要去噪几十上百步的扩散模型，压成一步或几步就能出结果的学生模型。","explanation":"扩散模型生成一个样本要反复去噪几十到上千步，速度慢。步数蒸馏用训练好的多步模型当老师，训练一个只需很少步数的学生。早期代表是谷歌 Salimans 与 Ho 的渐进式蒸馏（ICLR 2022），每轮把步数减半，从最多 8192 步压到 4 步。分布匹配蒸馏（DMD）由 MIT 与 Adobe 的 Yin 等人提出（CVPR 2024）：不要求学生逐样本复现老师的去噪轨迹，而是让一步生成器的输出分布整体贴近老师，用两个扩散模型给出的分数（数据分布的梯度）之差近似 KL 散度的梯度；后续 DMD2 加入 GAN 损失并支持多步。机器人里，扩散策略推理慢会拖累控制频率，常用这类蒸馏提速；CausVid、Self Forcing 等自回归视频生成工作也用 DMD 类损失实现实时生成。一致性蒸馏是另一条路线。","example":"One-Step Diffusion Policy 以训练好的扩散策略为老师，额外花 2%–10% 的预训练开销蒸馏出一步生成器，在真实 Franka 机械臂任务上动作输出频率从约 1.5 Hz 提到 62 Hz。","related":["扩散模型","去噪步数","一致性模型","单步生成","知识蒸馏","Consistency Policy（一致性策略）"]},{"id":"massively-parallel-reinforcement-learning","category":"training","sec":10,"tier":2,"sources":[{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)","url":"https://arxiv.org/abs/2109.11978"},{"title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning (arXiv 2108.10470)","url":"https://arxiv.org/abs/2108.10470"}],"as_of":"","related_ids":["gpu-accelerated-parallel-simulation","vectorized-environments","proximal-policy-optimization","nvidia-isaac-lab","legged-gym","sim-to-real-transfer"],"name":"大规模并行强化学习","alt":"Massively Parallel Reinforcement Learning","abbr":"","aliases":["并行环境训练","GPU 并行强化学习"],"one_liner":"在一张 GPU 上同时跑成千上万个仿真环境采数据，几分钟就能训出运控策略。","explanation":"大规模并行强化学习指把物理仿真和神经网络训练都放在 GPU 上，同时运行数千个独立的仿真环境，一次采集海量交互数据来训练策略。强化学习需要大量试错，过去多用 CPU 仿真、环境数量少，训练腿足运动策略往往要十几到上百小时。2021 年英伟达的 Isaac Gym 让仿真数据以 PyTorch 张量形式直接留在 GPU 上，报告比 CPU 仿真方案快 2–3 个数量级；同年 Rudin 等人在单张 GPU 上并行 4096 个 ANYmal 环境、用 PPO 训练，平地行走不到 4 分钟、复杂地形约 20 分钟即可训完。这套范式让强化学习成为四足和人形机器人运动控制的主流方案，常用工具有 Isaac Lab、legged_gym 等。","example":"Rudin 等人开源的 legged_gym 在单张 RTX A6000 上同时仿真 4096 台 ANYmal，用游戏式的地形课程自动调整难度，约 20 分钟训出能走复杂地形的策略，并迁移到真实的 ANYmal C 上。","related":["GPU 并行仿真","并行环境","近端策略优化","Isaac Lab","legged_gym","仿真到现实迁移"]},{"id":"actor-learner-architecture","category":"training","sec":10,"tier":3,"sources":[{"title":"IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures (arXiv 1802.01561)","url":"https://arxiv.org/abs/1802.01561"},{"title":"Distributed Prioritized Experience Replay (Ape-X, arXiv 1803.00933)","url":"https://arxiv.org/abs/1803.00933"},{"title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning (arXiv 2401.16013)","url":"https://arxiv.org/abs/2401.16013"}],"as_of":"","related_ids":["experience-replay","off-policy","importance-sampling","real-world-reinforcement-learning","serl","massively-parallel-reinforcement-learning"],"name":"Actor-Learner 分离架构","alt":"Actor-Learner Architecture (Distributed RL)","abbr":"","aliases":["Actor-Learner 架构","执行者-学习者架构","采样与训练解耦"],"one_liner":"把「与环境交互采数据」和「更新网络参数」拆给不同进程或机器并行执行。","explanation":"这是分布式强化学习常用的系统设计：多个 actor（执行者）各持一份策略副本，在各自的环境里交互、产生经验；learner（学习者）集中收集经验、在 GPU 上更新参数，再定期把新参数同步回 actor。DeepMind 2018 年的 Ape-X 和 IMPALA 是代表：Ape-X 让 actor 把经验写入共享的回放缓冲区；IMPALA 让 actor 直接把轨迹发给 learner，并用 V-trace（一种重要性加权修正）处理 actor 策略略微落后带来的偏差。好处是采样与训练互不阻塞，可扩展到上千台机器。真机强化学习同样需要这种拆分：SERL 把 actor 和 learner 放在不同线程，训练再慢也不会拖低机器人的控制频率。","example":"SERL 在真机上并行跑三个进程：actor 选动作、learner 训练网络、机器人环境执行动作，从而保持固定的控制频率，也缩短了真实世界训练的总耗时。","related":["经验回放","异策略","重要性采样","真机强化学习","SERL","大规模并行强化学习"]},{"id":"population-based-training","category":"training","sec":10,"tier":3,"sources":[{"title":"Jaderberg et al. 2017: Population Based Training of Neural Networks","url":"https://arxiv.org/abs/1711.09846"},{"title":"Google DeepMind Blog: Population based training of neural networks","url":"https://deepmind.google/discover/blog/population-based-training-of-neural-networks/"},{"title":"Petrenko et al. 2023: DexPBT","url":"https://arxiv.org/abs/2305.12127"}],"as_of":"","related_ids":["hyperparameter","massively-parallel-reinforcement-learning","exploration-vs-exploitation","gpu-accelerated-parallel-simulation","reinforcement-learning","isaac-gym"],"name":"基于群体的训练","alt":"Population-Based Training","abbr":"PBT","aliases":["基于种群的训练","种群训练","Population Based Training"],"one_liner":"同时训练一群模型，边训练边让差的复制好的权重，并随机调整超参数。","explanation":"基于群体的训练是 DeepMind 的 Jaderberg 等人 2017 年提出的超参数优化方法。它并行训练一批模型，每隔一段时间比较表现：表现差的成员直接复制表现好的成员的权重（利用），再随机扰动学习率等超参数继续训练（探索）。这样不必先调完参数再正式训练，而是在一次训练中自动找出一条随时间变化的超参数日程，总算力和并行跑同样多组普通实验差不多。原论文在深度强化学习、机器翻译和 GAN 上都验证有效。强化学习对超参数特别敏感，PBT 常和 GPU 大规模并行仿真搭配使用。","example":"英伟达的 DexPBT（RSS 2023）在 Isaac Gym 中用去中心化的 PBT 训练装有多指灵巧手的单臂和双臂机器人，完成重新抓取、抓取后抛掷、物体重定向等任务，探索效果明显好于常规的端到端训练。","related":["超参数","大规模并行强化学习","探索与利用","GPU 并行仿真","强化学习","Isaac Gym"]},{"id":"curriculum-learning","category":"training","sec":10,"tier":2,"sources":[{"title":"Curriculum Learning (Bengio et al., ICML 2009)","url":"https://ronan.collobert.com/pub/2009_curriculum_icml.pdf"},{"title":"Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)","url":"https://arxiv.org/html/2109.11978"}],"as_of":"","related_ids":["terrain-curriculum","reinforcement-learning","automatic-domain-randomization","sparse-reward","legged-gym","massively-parallel-reinforcement-learning"],"name":"课程学习","alt":"Curriculum Learning","abbr":"","aliases":["课程","课程式训练","自动课程学习","Automatic Curriculum Learning"],"one_liner":"先让模型学简单的样本或任务，再逐步加大难度的训练策略。","explanation":"课程学习由 Bengio 等人在 2009 年 ICML 论文中正式提出：像人按课程表学习一样，先给模型看简单的样本或子任务，再逐步提高难度。论文实验显示它能加快收敛、提升泛化。机器人强化学习里用得很多，因为一上来就面对最难的任务，策略几乎拿不到奖励，根本学不起来。常见形式有地形课程（腿足机器人先在平地练，再上台阶和斜坡）、逐步提高指令速度、逐步放宽域随机化范围；难度还可以按策略当前表现自动调整，称为自动课程。","example":"legged_gym（Rudin 等 2021）同时仿真 4096 台 ANYmal 四足：走出当前地形边界的机器人下一回合换更难的地形，走不到目标距离一半的降一级；台阶高度从 5 厘米升到 20 厘米，坡度从 0° 升到 25°。","related":["地形课程","强化学习","自动域随机化","稀疏奖励","legged_gym","大规模并行强化学习"]},{"id":"terrain-curriculum","category":"training","sec":10,"tier":3,"sources":[{"title":"Rudin et al. 2021: Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (CoRL 2021)","url":"https://arxiv.org/abs/2109.11978"},{"title":"GitHub: leggedrobotics/legged_gym legged_robot.py（_update_terrain_curriculum）","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"},{"title":"GitHub: isaac-sim/IsaacLab locomotion velocity curriculums.py（terrain_levels_vel）","url":"https://github.com/isaac-sim/IsaacLab/blob/main/source/isaaclab_tasks/isaaclab_tasks/manager_based/locomotion/velocity/mdp/curriculums.py"}],"as_of":"","related_ids":["curriculum-learning","rl-based-locomotion-control","legged-gym","massively-parallel-reinforcement-learning","rough-terrain-locomotion","heightfield-terrain"],"name":"地形课程","alt":"Terrain Curriculum","abbr":"","aliases":["地形难度课程","游戏式课程","Game-inspired Curriculum"],"one_liner":"腿足强化学习中，按机器人表现把它逐步送上更难地形的训练安排。","explanation":"地形课程是课程学习在腿足运控里的具体做法。一开始就在陡坡、楼梯上从零训练，机器人几乎一直摔倒，拿不到有用的学习信号；只在平地练又学不会复杂地形。ETH 的 Rudin 等人 2021 年在 legged_gym 中提出「游戏式」课程：把地形排成难度递增的网格，每回合结束看机器人走了多远，走过地块长度一半就升一级，连指令速度要求距离的一半都没走到就降一级，通关最难级的随机送回某一级，避免遗忘简单地形。几千个并行环境各自升降，整体难度自动跟上策略水平。Isaac Lab 的速度跟踪任务沿用了同样规则。","example":"legged_gym 默认把地形分成 10 个难度级、20 列，类型包括光滑坡、粗糙坡、上楼梯、下楼梯和离散障碍；机器人开局级别在第 0–5 级之间随机，之后按每回合行走距离升级或降级。","related":["课程学习","强化学习运控","legged_gym","大规模并行强化学习","复杂地形行走","高度场地形"]},{"id":"early-termination","category":"training","sec":10,"tier":3,"sources":[{"title":"DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills (arXiv:1804.02717)","url":"https://arxiv.org/abs/1804.02717"},{"title":"legged_gym: legged_robot.py (check_termination)","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot.py"}],"as_of":"","related_ids":["termination-vs-truncation","reference-state-initialization","reward-shaping","episode","deepmimic","massively-parallel-reinforcement-learning"],"name":"提前终止","alt":"Early Termination","abbr":"","aliases":["ET","终止条件","提前结束回合"],"one_liner":"训练中一旦出现摔倒等失败状态，就立刻结束本回合并重置环境。","explanation":"提前终止是强化学习训练的常用技巧：回合（episode）不必跑满固定时长，一旦触发预设条件，如躯干触地、机身倾角过大、跟踪误差过大，就立即结束并重置，剩余时间不再得奖励。Peng 等人 2018 年的 DeepMimic 专门评估了它，发现它和参考状态初始化一起，是仿真角色学会后空翻等高动态技能的关键。它一方面相当于隐式惩罚，策略会主动避开失败；另一方面不把样本浪费在摔倒后的无用状态上。实现时要区分失败终止和超时截断，后者不代表失败，算价值时通常仍要自举。","example":"legged_gym 的足式机器人环境里，只要机身等指定部位的接触力超过阈值就判定摔倒并重置该环境；超过最长回合时长则单独记为 time_out，不给终止惩罚。","related":["终止与截断","参考状态初始化","奖励塑形","回合","DeepMimic","大规模并行强化学习"]},{"id":"reference-state-initialization","category":"training","sec":10,"tier":3,"sources":[{"title":"Peng et al. 2018: DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills","url":"https://arxiv.org/abs/1804.02717"},{"title":"He et al. 2025: ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills","url":"https://arxiv.org/abs/2502.01143"},{"title":"Liao et al. 2025: BeyondMimic","url":"https://arxiv.org/abs/2508.08241"}],"as_of":"","related_ids":["deepmimic","early-termination","motion-tracking","asap","beyondmimic","exploration-vs-exploitation"],"name":"参考状态初始化","alt":"Reference State Initialization","abbr":"RSI","aliases":[],"one_liner":"动作模仿训练时，每回合从参考动作的随机时刻开始，而不总从第一帧开始。","explanation":"参考状态初始化是 Peng 等人 2018 年在 DeepMimic 中提出的强化学习训练技巧，用于让仿真角色或机器人模仿一段参考动作（如动捕数据）。如果每回合都从动作开头出发，策略只能先学前半段再学后半段；像后空翻，不先学会落地，起跳反而更容易摔、得分更低。RSI 每回合随机抽参考动作中的一个时刻，把角色的根部位置、朝向、速度和关节状态直接设成那一帧，让各阶段并行练习。它常和提前终止（摔倒就结束回合）一起用，已是人形机器人动作跟踪训练的常用配置；BeyondMimic 进一步按失败率自适应地选择起始位置。","example":"DeepMimic 的消融实验中，不用 RSI 训练的后空翻策略始终没学会完整空翻，只会向后小跳；ASAP 在宇树 G1 上训练模仿 C 罗标志性跳跃等高动态动作时也采用了 RSI。","related":["DeepMimic","提前终止","运动跟踪","ASAP","BeyondMimic","探索与利用"]},{"id":"data-augmentation","category":"training","sec":10,"tier":2,"sources":[{"title":"Google Machine Learning Glossary: data augmentation","url":"https://developers.google.com/machine-learning/glossary"},{"title":"Reinforcement Learning with Augmented Data (RAD, arXiv 2004.14990)","url":"https://arxiv.org/abs/2004.14990"}],"as_of":"","related_ids":["overfitting","generalization","domain-randomization","generative-data-augmentation","instruction-augmentation","visual-generalization"],"name":"数据增强","alt":"Data Augmentation","abbr":"","aliases":["数据扩增","数据增广","图像增强"],"one_liner":"对已有训练数据做随机变换生成新样本，让模型见过更多变化。","explanation":"数据增强指不新增采集，而是对已有样本做随机但不改变含义的变换来扩充训练集，是减轻过拟合、提升鲁棒性的标准手段。图像上常用随机裁剪、平移、旋转、颜色抖动、随机遮挡等。机器人数据又贵又少，增强尤其有用；但变换不能破坏图像和动作标签的对应关系，比如把画面左右翻转，动作里的左右方向也得跟着翻。2020 年 RAD 等工作表明，只加随机裁剪、平移这类简单增强，就能明显提升基于像素的强化学习的数据效率。近年还有用生成模型换背景、换物体的生成式数据增强，以及改写语言指令的指令增强。","example":"RAD 对 DeepMind Control Suite 的像素输入加入随机裁剪、随机平移等增强，数据效率和最终性能达到当时最好水平，并在 ProcGen 上明显提升了测试时的泛化。","related":["过拟合","泛化","域随机化","生成式数据增强","指令增强","视觉泛化"]},{"id":"symmetry-augmentation","category":"training","sec":10,"tier":3,"sources":[{"title":"Yu, Turk, Liu 2018: Learning Symmetric and Low-energy Locomotion (SIGGRAPH 2018)","url":"https://arxiv.org/abs/1801.08093"},{"title":"Mittal et al. 2024: Symmetry Considerations for Learning Task Symmetric Robot Policies (ICRA 2024)","url":"https://arxiv.org/abs/2403.04359"},{"title":"GitHub: leggedrobotics/rsl_rl ppo.py（symmetry_cfg / use_mirror_loss）","url":"https://github.com/leggedrobotics/rsl_rl/blob/main/rsl_rl/algorithms/ppo.py"}],"as_of":"","related_ids":["data-augmentation","rl-based-locomotion-control","proximal-policy-optimization","rsl-rl","legged-locomotion","loss-function"],"name":"对称性增强（镜像损失）","alt":"Symmetry Augmentation (Mirror Loss)","abbr":"","aliases":["镜像对称增强","对称性数据增强","镜像损失","Mirror Loss","Symmetry Loss"],"one_liner":"利用机器人左右对称，把数据镜像一份或加一项损失，让策略动作左右一致。","explanation":"足式和人形机器人大多左右对称，理想策略也应满足：状态左右镜像后，输出恰好是原动作的镜像。强化学习从零训练却常学出不对称步态，比如一条腿拖着走。常见两种办法：镜像损失由 Yu、Turk、Liu 在 SIGGRAPH 2018 提出，在损失函数里加一项，惩罚「镜像状态下的策略输出」与「原输出的镜像」之差；对称性数据增强则把采到的每条样本镜像一份一起训练。ETH 的 Mittal 等人在 ICRA 2024 对比两者，发现在 PPO 里数据增强收敛更快、回报更高。rsl_rl 已内置这两个选项。","example":"Mittal 等人用对称性数据增强训练 ANYmal 四足爬箱子，回报高于不加对称处理的 PPO 基线、不同随机种子间波动更小，并部署到了真机上。","related":["数据增强","强化学习运控","近端策略优化","rsl_rl","腿足运动","损失函数"]},{"id":"domain-adaptation","category":"training","sec":10,"tier":3,"sources":[{"title":"Unsupervised Domain Adaptation by Backpropagation (arXiv:1409.7495)","url":"https://arxiv.org/abs/1409.7495"},{"title":"Using Simulation and Domain Adaptation to Improve Efficiency of Deep Robotic Grasping (arXiv:1709.07857)","url":"https://arxiv.org/abs/1709.07857"}],"as_of":"","related_ids":["transfer-learning","sim-to-real-transfer","sim-to-real-gap","domain-randomization","distribution-shift","out-of-distribution"],"name":"领域自适应","alt":"Domain Adaptation","abbr":"","aliases":["域适应","域自适应","无监督领域自适应","Unsupervised Domain Adaptation"],"one_liner":"让在一种数据分布（源域）上训好的模型，到另一种分布（目标域）上也好用。","explanation":"领域自适应是迁移学习的一个分支：源域有大量带标注数据，目标域分布不同、标注很少甚至没有，目标是让模型在目标域上也能工作。经典做法有两类：特征层面，如 Ganin 与 Lempitsky 2014 年提出的梯度反转层，让「判断数据来自哪个域」的分类器分不出来，从而学到跨域不变的特征；像素层面，用 GAN（生成对抗网络）把源域图片转成目标域风格。具身智能里最典型的场景是仿真到真机：仿真数据便宜但与现实有差距，领域自适应和域随机化是缩小虚实差距的两条主要思路。","example":"谷歌 2017 年的 GraspGAN 用像素级领域自适应把仿真抓取图像变得更像真实相机画面；据论文报告，达到同等抓取性能所需的真实样本最多可减少 50 倍。","related":["迁移学习","仿真到现实迁移","虚实差距","域随机化","分布偏移（协变量偏移）","分布外"]},{"id":"privileged-information","category":"training","sec":10,"tier":2,"sources":[{"title":"Learning Quadrupedal Locomotion over Challenging Terrain (Lee et al., Science Robotics 2020)","url":"https://arxiv.org/abs/2010.11251"},{"title":"Learning by Cheating (Chen et al., CoRL 2019)","url":"https://arxiv.org/abs/1912.12294"}],"as_of":"","related_ids":["teacher-student-distillation","asymmetric-actor-critic","sim-to-real-transfer","rapid-motor-adaptation","proprioception","knowledge-distillation"],"name":"特权信息","alt":"Privileged Information","abbr":"","aliases":["特权观测","Privileged Observation","特权学习","Learning Using Privileged Information","LUPI"],"one_liner":"只在训练时能拿到、部署时拿不到的额外信息，如仿真里的真实地形和摩擦系数。","explanation":"这个说法来自 Vapnik 和 Vashist 2009 年提出的「使用特权信息学习」（LUPI）：训练时有额外信息辅助，测试时没有。在机器人里，它通常指仿真器能直接读出、真机传感器测不到的量，如地形高度、足端接触力、摩擦系数、外力扰动。只用真机能拿到的观测直接做强化学习往往学不动，常见做法是先训练一个能看到特权信息的教师策略，再蒸馏给只用本体感知或相机的学生策略（教师-学生蒸馏）；也可以只让评论家（估计价值的网络）看特权信息，即非对称演员-评论家。","example":"ETH 的 ANYmal 四足（Lee 等，Science Robotics 2020）：教师策略在仿真里能看到地形轮廓、足端接触状态与接触力、摩擦系数和外力扰动；学生策略只用关节、IMU 等本体感知的历史去模仿教师，最后直接部署到真机，走过泥地、雪地、碎石和茂密植被。","related":["教师-学生蒸馏","非对称演员-评论家","仿真到现实迁移","快速运动适应","本体感知","知识蒸馏"]},{"id":"asymmetric-actor-critic","category":"training","sec":10,"tier":3,"sources":[{"title":"Asymmetric Actor Critic for Image-Based Robot Learning (arXiv 1710.06542)","url":"https://arxiv.org/abs/1710.06542"},{"title":"Learning Dexterous In-Hand Manipulation (OpenAI Dactyl, arXiv 1808.00177)","url":"https://arxiv.org/abs/1808.00177"}],"as_of":"","related_ids":["privileged-information","teacher-student-distillation","value-function","partially-observable-markov-decision-process","sim-to-real-transfer","domain-randomization"],"name":"非对称演员-评论家","alt":"Asymmetric Actor-Critic","abbr":"","aliases":["非对称 AC","Asymmetric AC","非对称 Actor-Critic"],"one_liner":"评论家看仿真里的完整状态，演员只看真机上也能拿到的观测。","explanation":"非对称演员-评论家由 Lerrel Pinto、Marcin Andrychowicz、Pieter Abbeel 等人 2017 年提出。演员-评论家算法里，评论家（价值网络）只在训练时使用、部署时丢掉，所以在仿真训练时可以给它完整的真实状态（物体精确位姿、速度等特权信息），而演员（策略）只接收相机图像等真机上拿得到的输入。评论家估值更准，训练更快更稳，留下的策略又能直接上真机。原论文结合域随机化，在 7 自由度 Fetch 机械臂上不用任何真机数据完成了抓取、推动等任务。OpenAI 的灵巧手项目 Dactyl 也用了这种做法；如今用 PPO 训练足式机器人运动控制时，让评论家额外读取地形、摩擦等特权观测也很常见。","example":"Dactyl 训练时，价值网络能读到真机上拿不到的额外信息，策略只用真机可获取的观测，训练好后直接部署到 Shadow 灵巧手上转动方块。","related":["特权信息","教师-学生蒸馏","价值函数","部分可观测马尔可夫决策过程","仿真到现实迁移","域随机化"]},{"id":"teacher-student-distillation","category":"training","sec":10,"tier":2,"sources":[{"title":"Learning Quadrupedal Locomotion over Challenging Terrain (Lee et al., Science Robotics 2020, arXiv 2010.11251)","url":"https://arxiv.org/abs/2010.11251"},{"title":"Learning by Cheating (Chen et al., CoRL 2019, arXiv 1912.12294)","url":"https://arxiv.org/abs/1912.12294"},{"title":"Distilling the Knowledge in a Neural Network (Hinton et al., arXiv 1503.02531)","url":"https://arxiv.org/abs/1503.02531"}],"as_of":"","related_ids":["knowledge-distillation","privileged-information","policy-distillation","asymmetric-actor-critic","sim-to-real-transfer","dagger"],"name":"教师-学生蒸馏","alt":"Teacher-Student Distillation","abbr":"","aliases":["教师-学生训练","师生框架","Teacher-Student Training","特权教师蒸馏"],"one_liner":"先训练能看到特权信息的教师策略，再让只用真实传感器的学生去模仿它。","explanation":"教师-学生蒸馏源自知识蒸馏（Hinton 等人 2015 年提出，用大模型的输出当软标签训练小模型）。在机器人里通常分两步：先在仿真中训练教师策略，教师可以直接读取真机拿不到的特权信息，如精确地形高度、摩擦系数、物体位姿，所以用强化学习比较容易学好；再训练学生策略，它只接收真机上能获得的观测（关节状态、IMU、相机图像等），通过模仿教师的动作或中间表示来学习，常用 DAgger 式在线纠正。这样把「难学的决策」和「难学的感知」拆开处理，是仿真到现实迁移的主流做法之一。代表工作有 2019 年自动驾驶领域的 Learning by Cheating，以及 ETH 2020 年的四足盲走控制器。","example":"ETH 的 Lee 等人（Science Robotics 2020）让教师在仿真中读取地形等特权信息，学生只靠本体感知信号模仿教师；ANYmal 四足零样本部署到泥地、雪地、碎石、茂密植被和湍急水流等训练中没见过的野外环境。","related":["知识蒸馏","特权信息","策略蒸馏","非对称演员-评论家","仿真到现实迁移","DAgger（数据集聚合）"]},{"id":"real-world-reinforcement-learning","category":"training","sec":10,"tier":2,"sources":[{"title":"Challenges of Real-World Reinforcement Learning (Dulac-Arnold et al., 2019)","url":"https://arxiv.org/abs/1904.12901"},{"title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning","url":"https://arxiv.org/abs/2401.16013"},{"title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)","url":"https://arxiv.org/abs/2410.21845"}],"as_of":"2025-03","related_ids":["reinforcement-learning","sample-efficiency","human-in-the-loop","reset-free-reinforcement-learning","hil-serl","sim-to-real-transfer"],"name":"真机强化学习","alt":"Real-World Reinforcement Learning","abbr":"","aliases":["真实世界强化学习","Real-world RL","真机 RL"],"one_liner":"让机器人直接在真实环境里试错学习，而不是只在仿真里训练。","explanation":"真机强化学习指策略的强化学习训练（至少一部分）直接在物理机器人上进行。它省去仿真建模，也绕开了虚实差距，适合插接、线缆布置这类接触复杂、难以仿真的任务。难点在于：真机数据慢而贵，算法必须样本效率高；每回合结束要有人或程序把场景复位；奖励要能从相机画面自动判断；探索时还不能撞坏机器人。Dulac-Arnold 等人 2019 年把这类难题归纳为九项挑战。常见对策是异策略算法加经验回放、用示范数据热启动、训练成功检测器当奖励、人在回路随时纠正，UC Berkeley 的 SERL / HIL-SERL 是代表工作。","example":"SERL（ICRA 2024）在真实机械臂上学 PCB 元件插装、线缆布置和物体搬移，每个策略平均只训练 25–50 分钟；后续的 HIL-SERL 加入人工示范与纠正，在 1–2.5 小时内学会精密装配、动态操作和双臂协作，成功率接近 100%。","related":["强化学习","样本效率","人在回路","无重置强化学习","HIL-SERL","仿真到现实迁移"]},{"id":"reset-free-reinforcement-learning","category":"training","sec":10,"tier":3,"sources":[{"title":"Eysenbach et al. 2017: Leave no Trace: Learning to Reset for Safe and Autonomous Reinforcement Learning","url":"https://arxiv.org/abs/1711.06782"},{"title":"Gupta et al. 2021: Reset-Free Reinforcement Learning via Multi-Task Learning","url":"https://arxiv.org/abs/2104.11203"},{"title":"Sharma et al. 2021: Autonomous Reinforcement Learning: Formalism and Benchmarking","url":"https://arxiv.org/abs/2112.09605"}],"as_of":"","related_ids":["real-world-reinforcement-learning","episode","failure-recovery","autonomous-data-collection","multi-task-learning","online-reinforcement-learning"],"name":"无重置强化学习","alt":"Reset-Free Reinforcement Learning","abbr":"","aliases":["自主强化学习","Autonomous RL","Autonomous Reinforcement Learning","免重置强化学习"],"one_liner":"不靠人一次次把环境复位，让机器人在连续交互中自己学。","explanation":"标准强化学习默认每个回合结束后环境会重置回初始状态，仿真里一行代码就能做到，真机上却往往要人去把物体摆回原处，这是真机强化学习的主要瓶颈之一。无重置强化学习研究在尽量少的人工复位下学习：2017 年 Eysenbach 等人的 Leave no Trace 同时学「正向策略」和「复位策略」，并用复位策略的价值函数判断何时快要进入无法挽回的状态；2021 年 Gupta 等人让多个任务互相充当彼此的复位，用多任务学习解决复位问题；同年 Sharma、Finn 等人把它形式化为「自主强化学习」并发布 EARL 基准，发现常规回合制算法在减少人工干预后性能明显下降。它和失败恢复、自主数据采集密切相关。","example":"让机械臂学开抽屉的同时学关抽屉：开完之后由「关」的策略把环境恢复原样，机器人就能连续练习，而不需要有人守在旁边复位。","related":["真机强化学习","回合","失败恢复","自主数据采集","多任务学习","在线强化学习"]},{"id":"safe-reinforcement-learning","category":"training","sec":10,"tier":3,"sources":[{"title":"García & Fernández 2015: A Comprehensive Survey on Safe Reinforcement Learning (JMLR)","url":"https://www.jmlr.org/papers/v16/garcia15a.html"},{"title":"Achiam et al. 2017: Constrained Policy Optimization","url":"https://arxiv.org/abs/1705.10528"},{"title":"Chane-Sane et al. 2024: CaT: Constraints as Terminations for Legged Locomotion Reinforcement Learning","url":"https://arxiv.org/abs/2403.18765"}],"as_of":"","related_ids":["embodied-safety","control-barrier-function","safety-filter","real-world-reinforcement-learning","proximal-policy-optimization","reward-shaping"],"name":"安全强化学习","alt":"Safe Reinforcement Learning","abbr":"Safe RL","aliases":["约束强化学习","Constrained Reinforcement Learning","Constrained RL"],"one_liner":"在最大化奖励的同时，保证训练和部署过程中不违反安全约束。","explanation":"García 和 Fernández 2015 年的综述把安全强化学习定义为：在需要保证合理表现或遵守安全约束的问题中，于学习和/或部署期间最大化期望回报。常见做法分两类：一是改优化目标，例如把问题写成约束马尔可夫决策过程（在奖励之外再给「代价」设上限），用拉格朗日乘子法或 2017 年提出的约束策略优化（CPO）求解；二是改探索过程，例如引入先验知识，或用安全滤波器、控制障碍函数把危险动作拦下来。它对真机强化学习和人形、足式机器人运控尤其重要，因为摔倒、碰撞、关节超限会直接损坏硬件甚至伤人。","example":"CaT 方法把足式机器人运控中的各项约束改写成「一旦违反，就按一定概率提前终止回合」，只需对 PPO 做很小改动，就在真实的 Solo 四足机器人上学会了穿越障碍。","related":["具身安全","控制障碍函数","安全滤波器","真机强化学习","近端策略优化","奖励塑形"]},{"id":"residual-reinforcement-learning","category":"training","sec":10,"tier":3,"sources":[{"title":"Johannink et al. 2018: Residual Reinforcement Learning for Robot Control","url":"https://arxiv.org/abs/1812.03201"},{"title":"Silver et al. 2018: Residual Policy Learning","url":"https://arxiv.org/abs/1812.06298"},{"title":"Ankile et al. 2024: From Imitation to Refinement -- Residual RL for Precise Assembly","url":"https://arxiv.org/abs/2407.16677"}],"as_of":"","related_ids":["residual-policy","behavior-cloning","real-world-reinforcement-learning","reinforcement-fine-tuning","action-chunking","noise-space-policy-steering"],"name":"残差强化学习","alt":"Residual Reinforcement Learning","abbr":"Residual RL","aliases":["残差策略学习","Residual Policy Learning","RPL"],"one_liner":"保留一个现成的基础控制器，只用强化学习学它输出上的修正量。","explanation":"残差强化学习在 2018 年底由两组工作几乎同时提出：UC 伯克利 Levine 组与西门子合作的 Residual Reinforcement Learning for Robot Control，以及 MIT 的 Residual Policy Learning。做法是最终动作等于基础策略的动作加上残差策略输出的修正量；基础策略可以是手写控制器、模型预测控制，或模仿学习得到的策略，强化学习只负责补上摩擦、接触这类难建模的部分。因为从一个「已经大致能用」的起点出发，探索更安全、样本效率更高，适合直接在真机上训练。近年它常被用来精修行为克隆策略：先用演示训练一个扩散或动作分块策略并冻结，再在上面训练一个小的闭环残差策略做实时修正。","example":"MIT 的 ResiP 冻结一个用演示训练的动作分块策略，把它当作轨迹规划器，再用强化学习训练闭环残差策略实时修正，用于行为克隆加数据也难再提高成功率的精密装配任务。","related":["残差策略","行为克隆","真机强化学习","强化学习微调","动作分块","噪声空间策略引导"]},{"id":"noise-space-policy-steering","category":"training","sec":10,"tier":3,"sources":[{"title":"Wagenmaker et al. 2025: Steering Your Diffusion Policy with Latent Space Reinforcement Learning (DSRL)","url":"https://arxiv.org/abs/2506.15799"}],"as_of":"2025-06","related_ids":["diffusion-steering-via-reinforcement-learning","diffusion-policy","flow-matching","reinforcement-fine-tuning","residual-reinforcement-learning","pi0"],"name":"噪声空间策略引导","alt":"Noise-Space Policy Steering","abbr":"","aliases":["扩散噪声空间强化学习","潜在噪声空间 RL","扩散引导（Diffusion Steering）"],"one_liner":"不改扩散策略的权重，只用强化学习挑选它的输入噪声，从而改变输出动作。","explanation":"扩散策略和流匹配策略生成动作时，先采一个随机噪声，再逐步去噪变成动作；同一个模型换一个输入噪声，就会给出不同的动作。噪声空间策略引导把这个噪声当作可控的「动作」：冻结原策略，另训一个小的强化学习策略，根据当前观测输出该用哪个噪声，让原策略产出更好的动作。代表方法是 UC Berkeley 等团队 2025 年提出的 DSRL。它只需黑盒调用原策略，不必对多步去噪过程反向传播，也不改大模型权重，因此样本效率高，适合在真机上在线改进，可用于 π0 这类通用 VLA 的现场适配。相应地，改进幅度受原策略能生成的动作范围所限。","example":"DSRL 引导在 DROID 数据上训练的公开 π0 检查点，让 Franka 机械臂打开烤面包机，约 80 个在线回合后成功率从 5/20 提升到 18/20。","related":["DSRL","扩散策略","流匹配","强化学习微调","残差强化学习","π0"]},{"id":"human-in-the-loop","category":"training","sec":10,"tier":2,"sources":[{"title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)","url":"https://arxiv.org/abs/2410.21845"},{"title":"HG-DAgger: Interactive Imitation Learning with Human Experts","url":"https://arxiv.org/abs/1810.02890"},{"title":"Wikipedia: Human-in-the-loop","url":"https://en.wikipedia.org/wiki/Human-in-the-loop"}],"as_of":"","related_ids":["dagger","human-gated-dagger","hil-serl","human-intervention-data","intervention-rate","shared-autonomy"],"name":"人在回路","alt":"Human-in-the-Loop","abbr":"HITL","aliases":["人机回环","人在环路","人工干预","人工接管","Human Intervention"],"one_liner":"让人参与到机器人训练或运行的循环中，实时纠正、接管或给反馈。","explanation":"人在回路泛指系统运行时需要人参与：机器人出错时人来接管控制、给出纠正动作、给结果打分或确认关键决策。在机器人学习里，它主要补离线模仿学习的短板：策略走到演示里没见过的状态就容易越错越远（复合误差），人在这些状态下的纠正正好补上缺的数据。代表方法有 DAgger 和 2018 年的 HG-DAgger（人判断要出问题时接管，接管段数据加入训练集），以及伯克利 2024 年的 HIL-SERL（人用 3D 鼠标随时干预真机强化学习，1 到 2.5 小时即可学会精密装配、双臂协作等任务）。部署时的人工接管、远程遥控兜底也属于这一范畴，干预率是衡量自主程度的常用指标。","example":"HIL-SERL 训练时，操作员手握 SpaceMouse 在旁看护，机器人快要失败时接管；干预数据同时放进演示缓冲区和强化学习缓冲区，加快学习。","related":["DAgger（数据集聚合）","人工门控 DAgger","HIL-SERL","干预数据","干预率","共享自主"]},{"id":"interactive-imitation-learning","category":"training","sec":10,"tier":3,"sources":[{"title":"Interactive Imitation Learning in Robotics: A Survey (arXiv:2211.00600)","url":"https://arxiv.org/abs/2211.00600"},{"title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger, arXiv:1011.0686)","url":"https://arxiv.org/abs/1011.0686"}],"as_of":"","related_ids":["dagger","human-gated-dagger","compounding-error","behavior-cloning","human-in-the-loop","human-intervention-data"],"name":"交互式模仿学习","alt":"Interactive Imitation Learning","abbr":"IIL","aliases":["交互模仿学习"],"one_liner":"机器人边执行、人边纠正，用这些反馈在线改进策略的模仿学习。","explanation":"交互式模仿学习是模仿学习的一个分支：人类在机器人执行过程中间歇性地给反馈，比如接管纠正、标注正确动作或评价好坏，策略据此在线改进。它主要针对行为克隆的复合误差问题——离线示范只覆盖专家走过的状态，机器人一旦偏离就没有数据可学，越错越远。代表算法是 Ross 等人 2011 年提出的 DAgger：让专家给学生策略实际遇到的状态标注动作，汇总进数据集再训练；HG-DAgger 等变体改为由人决定何时接管。Celemin 等人 2022 年的综述系统整理了这一方向。","example":"典型流程：先用示范数据训练初版插孔策略，让机械臂自己执行，偏离时由操作员接管并记录纠正动作，把这些纠正数据并入训练集再训练，如此循环几轮。","related":["DAgger（数据集聚合）","人工门控 DAgger","复合误差","行为克隆","人在回路","干预数据"]},{"id":"human-gated-dagger","category":"training","sec":10,"tier":3,"sources":[{"title":"HG-DAgger: Interactive Imitation Learning with Human Experts (arXiv 1810.02890)","url":"https://arxiv.org/abs/1810.02890"}],"as_of":"","related_ids":["dagger","human-in-the-loop","compounding-error","human-intervention-data","recovery-and-correction-data","interactive-imitation-learning"],"name":"人工门控 DAgger","alt":"Human-Gated DAgger","abbr":"HG-DAgger","aliases":["人类门控 DAgger"],"one_liner":"机器人快出错时由人接管纠正，只收集接管片段来迭代训练的 DAgger 变体。","explanation":"斯坦福 Kelly 等人 2018 年提出。原版 DAgger（数据集聚合）要求专家在策略控制系统时逐步报出应该做的动作，但人不在真正控制车或机器人时，很难给出准确标签，也不安全。HG-DAgger 改为由人决定何时介入：平时由学出来的策略控制，人看到它进入危险区域就接管，把系统开回安全状态再交还控制权；只有接管期间人的观测-动作对会加入数据集，然后用聚合后的数据重新训练策略。论文还用多个网络的集成分歧估计策略的不确定度，并从人工介入时刻学出一个风险阈值。实验在仿真和真实自动驾驶车上进行。人工接管、收集纠偏数据的做法如今是真机后训练里常见的人在回路流程。","example":"自动驾驶策略在测试车上开，快压线时安全员接手方向盘把车拉回车道中央，这段纠正数据被加进训练集。","related":["DAgger（数据集聚合）","人在回路","复合误差","干预数据","纠偏数据","交互式模仿学习"]},{"id":"fleet-learning","category":"training","sec":10,"tier":3,"sources":[{"title":"Fleet-DAgger: Interactive Robot Fleet Learning with Scalable Human Supervision (arXiv:2206.14349)","url":"https://arxiv.org/abs/2206.14349"},{"title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies (arXiv:2605.00416)","url":"https://arxiv.org/abs/2605.00416"}],"as_of":"2026-09","related_ids":["data-flywheel","deployment-data-backflow","human-in-the-loop","dagger","offline-to-online-reinforcement-learning","real-world-reinforcement-learning"],"name":"机群学习 / 部署中学习","alt":"Fleet Learning (Learning While Deploying)","abbr":"","aliases":["机队学习","交互式机群学习","Interactive Fleet Learning","IFL","LWD"],"one_liner":"让一批已部署的机器人边干活边采数据，共同持续改进同一个策略。","explanation":"机群学习指多台同时部署的机器人把自主执行记录、失败和人工接管数据汇集起来更新共享策略，再下发新策略，形成数据飞轮，让「部署」本身成为训练的一部分。伯克利 Goldberg 团队的 Fleet-DAgger（CoRL 2022）提出「交互式机群学习」设定：多台机器人没把握时向少数远程人员求助，人的纠正用于模仿学习。部署中学习更强调强化学习：2026 年智元（AGIBOT Finch）与上海创智学院等团队提出 LWD 框架，把机群采回的自主推演和人工干预数据用于离线到在线强化学习，持续后训练 VLA。","example":"LWD 在 16 台双臂机器人组成的机群上验证了 8 个真实操作任务（含语义理货上架和 3–5 分钟的长程任务），单个通用策略随机群经验积累，平均成功率达到 95%。","related":["数据飞轮","数据回流","人在回路","DAgger（数据集聚合）","离线到在线强化学习","真机强化学习"]},{"id":"self-improvement","category":"training","sec":10,"tier":3,"sources":[{"title":"Google DeepMind Blog: RoboCat: A self-improving robotic agent","url":"https://deepmind.google/discover/blog/robocat-a-self-improving-robotic-agent/"},{"title":"Bousmalis et al. 2023: RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","url":"https://arxiv.org/abs/2306.11706"},{"title":"Ghasemipour et al. 2025: Self-Improving Embodied Foundation Models","url":"https://arxiv.org/abs/2509.15155"}],"as_of":"2025-09","related_ids":["robocat","data-flywheel","success-detector","real-world-reinforcement-learning","pi-star-0-6","rejection-sampling-fine-tuning"],"name":"自我提升","alt":"Self-improvement","abbr":"","aliases":["自我改进","自主提升","Self-Improving","自我迭代"],"one_liner":"机器人用自己练习产生的数据反复训练自己，越练越强，少靠人工。","explanation":"自我提升指模型在少量人工数据起步后，靠自己与环境交互产生新数据、自动判断好坏、再训练自己的循环，目标是让数据增长不再完全依赖人工演示。关键在于怎么自动判断成败：常用成功检测器、奖励模型或价值函数，再配合过滤式行为克隆或强化学习更新策略。代表工作有 DeepMind 2023 年的 RoboCat，用自己练习产生的数据训练下一代模型；2025 年 Ghasemipour 等人的 Self-Improving Embodied Foundation Models 让模型预测「还剩几步完成」，由此同时得到奖励和成功检测，让机器人机群自主练习，比单纯多采演示数据更省样本。π*0.6 用 RECAP 从自主经验和人工纠正中学习，也属于这一类。","example":"RoboCat 的一轮循环：人遥操作给出 100–1000 条新任务演示 → 微调出专用分支模型 → 分支自主练习平均约 1 万次 → 把新旧数据合并，训练下一版 RoboCat。","related":["RoboCat","数据飞轮","成功检测器","真机强化学习","π*0.6","拒绝采样微调 / 过滤式行为克隆"]},{"id":"training-free","category":"training","sec":11,"tier":2,"sources":[{"title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models (project page)","url":"https://voxposer.github.io/"},{"title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation (arXiv 2409.01652)","url":"https://arxiv.org/abs/2409.01652"}],"as_of":"","related_ids":["zero-shot","foundation-model","voxposer","rekep","code-as-policies","visual-token-pruning"],"name":"免训练","alt":"Training-free","abbr":"","aliases":["无需训练","零训练","Training-free Method"],"one_liner":"不更新任何模型参数，直接组合现成模型或算法来完成新任务。","explanation":"免训练指一个方法用于新任务时不做任何梯度更新：直接调用已训练好的基础模型（大语言模型、视觉语言模型、分割或位姿估计模型等），靠提示词、代码生成、搜索或优化求解把它们串起来。它的吸引力在于不用采集机器人数据、换任务只需换指令，适合数据稀缺的具身场景；局限是效果受限于现成模型的能力和中间表示的设计，精细、接触丰富的动作通常做不好。它和零样本不完全相同：零样本强调没见过目标任务的样本，模型本身可能专门训练过；免训练强调整个方法不再训练。论文里也常用它描述即插即用的推理加速手段，如免训练的视觉 token 剪枝。","example":"斯坦福的 VoxPoser 让大语言模型写代码调用视觉语言模型，把「把毛巾挂到架子上」「关上最上层抽屉」这类指令转成 3D 价值地图，再由运动规划生成轨迹，论文明确说整个过程不涉及任何额外训练。","related":["零样本","基础模型","VoxPoser","ReKep","代码即策略","视觉 token 剪枝"]},{"id":"inference-time-compute","category":"training","sec":11,"tier":3,"sources":[{"title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters (arXiv:2408.03314)","url":"https://arxiv.org/abs/2408.03314"},{"title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models (arXiv:2506.17811)","url":"https://arxiv.org/abs/2506.17811"}],"as_of":"2025-07","related_ids":["best-of-n-sampling","value-guided-sampling","robomonkey","chain-of-thought","inference-latency","scaling-law"],"name":"推理时计算","alt":"Inference-Time Compute (Test-Time Scaling)","abbr":"","aliases":["测试时扩展","测试时计算","Test-Time Compute"],"one_liner":"模型不变，推理时多花算力（多采样、多思考）来换更好的结果。","explanation":"推理时计算指模型训练完之后，在推理阶段投入更多算力来提升效果，例如生成更长的思维链、采样多个候选再用验证器（给候选打分的模型）挑最好的，或反复修改答案。2024 年 OpenAI o1 和 Snell 等人的论文让这一方向受到广泛关注，后者发现按题目难度合理分配推理算力，小模型在部分题目上可超过大 14 倍的模型。它提供了「把模型做大」之外的另一条提升路径。机器人领域也有对应做法，比如对 VLA 多次采样动作再用验证器挑选，代价是推理延迟增加。","example":"RoboMonkey（2025）让 VLA 对同一观测采样多个动作，加高斯扰动并多数投票后，用 VLM 验证器挑出最优动作，据论文报告在分布外任务上成功率绝对提升约 25%。","related":["最优 N 采样","价值引导采样","RoboMonkey","思维链","推理延迟","缩放定律"]},{"id":"best-of-n-sampling","category":"training","sec":11,"tier":3,"sources":[{"title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models (arXiv 2506.17811)","url":"https://arxiv.org/abs/2506.17811"},{"title":"RoboMonkey 项目页","url":"https://robomonkey-vla.github.io/"},{"title":"Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance (arXiv 2410.13816)","url":"https://arxiv.org/abs/2410.13816"}],"as_of":"2025-09","related_ids":["inference-time-compute","value-guided-sampling","robomonkey","v-gps","reward-model","vlm-as-reward"],"name":"最优 N 采样","alt":"Best-of-N Sampling","abbr":"BoN","aliases":["测试时验证器","Test-Time Verifier","多采样重排序","Best-of-N 重排序"],"one_liner":"一次采样 N 个候选输出，用打分器挑出分数最高的那个去执行。","explanation":"最优 N 采样是一种推理时计算（推理阶段多花算力换效果）的方法：让生成式模型对同一输入采样 N 个候选，再用验证器（奖励模型、价值函数或 VLM 裁判）给每个候选打分，只保留最高分的那个。它在大语言模型里用得很普遍，好处是不用重新训练原模型。机器人里的代表工作有两个：V-GPS（CoRL 2024）用离线强化学习学到的价值函数给通用策略的候选动作重排序，同一个价值函数在 5 种不同策略、共 12 个任务上都带来提升；RoboMonkey（CoRL 2025，斯坦福、伯克利、英伟达等）先采样多个动作、加高斯扰动并投票，再用训练好的 VLM 验证器挑选，分布外任务上绝对提升 25%。代价是每一步要多次前向计算，推理延迟增加；效果上限取决于验证器打分准不准。","example":"RoboMonkey 在每个控制步里让 OpenVLA 等 VLA 模型对同一帧画面生成多个候选动作，由 VLM 验证器逐个打分，机器人只执行得分最高的那个动作。","related":["推理时计算","价值引导采样","RoboMonkey","V-GPS","奖励模型","VLM 作奖励模型"]},{"id":"value-guided-sampling","category":"training","sec":11,"tier":3,"sources":[{"title":"Nakamoto et al. 2024: Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance (V-GPS, CoRL 2024)","url":"https://arxiv.org/abs/2410.13816"},{"title":"Kwok et al. 2025: RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","url":"https://arxiv.org/abs/2506.17811"}],"as_of":"2025-07","related_ids":["inference-time-compute","best-of-n-sampling","v-gps","q-function","offline-reinforcement-learning","robomonkey"],"name":"价值引导采样","alt":"Value-Guided Sampling","abbr":"","aliases":["价值引导策略重排序","价值重排序","Value-Guided Policy Steering"],"one_liner":"先从策略采样多个候选动作，再用价值函数打分，挑最好的执行。","explanation":"价值引导采样在推理时提升策略：不改原策略权重，每步先从策略采样多个候选动作，再用单独训练的价值函数（Q 函数）打分，选最高分的，或按分数做 softmax 抽样。代表工作是 Levine 组的 V-GPS（CoRL 2024）：用 Cal-QL 等离线强化学习在 Bridge 和 RT-1 数据上训练语言条件 Q 函数，给 Octo、OpenVLA 等五种通用策略做重排序，12 个任务上都有提升。通用策略的训练数据质量参差，价值函数负责把「做得好」的动作挑出来。它和最优 N 采样、RoboMonkey 用 VLM 校验动作同属推理时计算。","example":"V-GPS 真机实验中，每一步从通用策略采样 50 个候选动作，用 Q 函数挑出得分最高的执行；据论文报告，WidowX 机械臂 6 个任务的平均成功率相对提升 82.8%。","related":["推理时计算","最优 N 采样","V-GPS","Q 函数","离线强化学习","RoboMonkey"]},{"id":"test-time-training","category":"training","sec":11,"tier":3,"sources":[{"title":"Sun et al. 2020: Test-Time Training with Self-Supervision for Generalization under Distribution Shifts (ICML 2020)","url":"https://arxiv.org/abs/1909.13231"},{"title":"Bai, Gao, Shou 2025: EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models","url":"https://arxiv.org/abs/2512.14666"},{"title":"Zhu et al. 2026: TTT-Parkour: Rapid Test-Time Training for Perceptive Robot Parkour","url":"https://arxiv.org/abs/2602.02331"}],"as_of":"2026-02","related_ids":["out-of-distribution","domain-adaptation","self-supervised-learning","inference-time-compute","continual-learning","rapid-motor-adaptation"],"name":"测试时训练","alt":"Test-Time Training","abbr":"TTT","aliases":["测试时适应","Test-Time Adaptation","TTA"],"one_liner":"部署时拿到新数据，先用它做几步自监督更新，再用更新后的模型输出。","explanation":"测试时训练由 Sun 等人在 ICML 2020 提出：模型训练时顺带学一个不需要标签的辅助任务（如预测图片被转了多少度），测试时拿到新样本，先用这个辅助任务对它更新几步参数，再做正式预测，用来应对训练和测试数据分布不一致。相近的测试时适应如 Tent（ICLR 2021）只在测试数据上最小化预测熵、调整归一化层参数。具身领域用它让策略在部署现场继续适应，EVOLVE-VLA 用自动估计的任务进度作反馈，让 VLA 在测试时继续学习；TTT-Parkour 先扫描重建陌生地形，再在重建出的地形上快速微调人形跑酷策略。","example":"TTT-Parkour（2026）用 RGB-D 相机扫描重建楔形块、窄梁等陌生障碍，再在重建地形上微调人形机器人的跑酷策略；据论文称，多数地形从采集、重建到测试时训练不到 10 分钟。","related":["分布外","领域自适应","自监督学习","推理时计算","持续学习","快速运动适应"]},{"id":"in-context-learning","category":"training","sec":11,"tier":3,"sources":[{"title":"Language Models are Few-Shot Learners (GPT-3, arXiv:2005.14165)","url":"https://arxiv.org/abs/2005.14165"},{"title":"In-Context Imitation Learning via Next-Token Prediction (ICRT, arXiv:2408.15980)","url":"https://arxiv.org/abs/2408.15980"}],"as_of":"","related_ids":["few-shot","meta-learning","prompt-prompt-engineering","large-language-model","next-token-prediction","meta-reinforcement-learning"],"name":"上下文学习","alt":"In-Context Learning","abbr":"ICL","aliases":["情境学习","语境学习"],"one_liner":"不改模型参数，只靠输入里给的几个示例就学会做新任务。","explanation":"上下文学习指模型在推理时，只根据提示里给出的任务说明或少量示例就完成新任务，全程不做梯度更新（不改参数）。2020 年 OpenAI 的 GPT-3 论文系统展示了这种能力：翻译、问答等任务都只靠文字描述加几个示范来指定，且能力随模型变大而增强。它的意义在于换任务不必重新训练，只需换提示。具身智能里，研究者把几条机器人演示轨迹当作「提示」喂给策略模型，让它当场模仿新任务；它与少样本学习、元学习、提示工程关系密切。","example":"ICRT（In-Context Robot Transformer，2024）在推理时把几条人类遥操作演示的图像、状态和动作序列作为提示输入，Franka 机械臂不更新参数就能照着演示执行新任务。","related":["少样本","元学习","提示词 / 提示工程","大语言模型","下一个 token 预测","元强化学习"]},{"id":"meta-learning","category":"training","sec":11,"tier":3,"sources":[{"title":"Finn et al. 2017: Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks (MAML)","url":"https://arxiv.org/abs/1703.03400"},{"title":"Lilian Weng: Meta-Learning: Learning to Learn Fast (2018)","url":"https://lilianweng.github.io/posts/2018-11-30-meta-learning/"},{"title":"Finn et al. 2017: One-Shot Visual Imitation Learning via Meta-Learning","url":"https://arxiv.org/abs/1709.04905"}],"as_of":"","related_ids":["few-shot","one-shot-imitation-learning","meta-reinforcement-learning","in-context-learning","transfer-learning","multi-task-learning"],"name":"元学习","alt":"Meta-Learning","abbr":"","aliases":["学会学习","Learning to Learn"],"one_liner":"让模型在大量任务上练出「快速学会新任务」的能力，而不只学会某一个任务。","explanation":"元学习又叫「学会学习」：训练时不盯着单个任务，而是让模型在许多相关的小任务上反复经历「看少量样本、适应、检验」，学到的是能迅速适应新任务的初始化、更新规则或记忆方式。常见路线分三类：基于度量（如原型网络）、基于模型（用外部记忆或快速权重）、基于优化。最有名的是 Finn、Abbeel、Levine 2017 年提出的 MAML，它直接训练一组初始参数，使模型在新任务上只用几步梯度下降、少量数据就能表现好。机器人数据昂贵，元学习曾是少样本学技能的主要思路，单样本模仿学习、元强化学习都建立在它之上；也有研究把大模型的上下文学习看作隐式元学习。","example":"Finn 等人 2017 年用 MAML 做「元模仿学习」：机器人先在许多任务的演示上元训练，测试时只看新任务的一段视觉演示，就能端到端学会这个任务。","related":["少样本","单样本模仿学习","元强化学习","上下文学习","迁移学习","多任务学习"]},{"id":"meta-reinforcement-learning","category":"training","sec":11,"tier":3,"sources":[{"title":"A Tutorial on Meta-Reinforcement Learning (arXiv:2301.08028)","url":"https://arxiv.org/abs/2301.08028"},{"title":"RL²: Fast Reinforcement Learning via Slow Reinforcement Learning (arXiv:1611.02779)","url":"https://arxiv.org/abs/1611.02779"},{"title":"Learning to Adapt in Dynamic, Real-World Environments Through Meta-Reinforcement Learning (arXiv:1803.11347)","url":"https://arxiv.org/abs/1803.11347"}],"as_of":"","related_ids":["meta-learning","in-context-learning","rapid-motor-adaptation","meta-world","few-shot","multi-task-learning"],"name":"元强化学习","alt":"Meta Reinforcement Learning","abbr":"Meta-RL","aliases":["元RL","学会强化学习"],"one_liner":"在大量相似任务上训练，让智能体遇到新任务时只需少量试错就能适应。","explanation":"元强化学习把「怎样更快地做强化学习」本身当成一个学习问题：在一个任务分布（如不同负载、不同目标位置）上训练，使智能体面对同分布的新任务时只用少量交互就能适应。常见路线有两类：一类如 RL²（2016），用循环神经网络跨回合保留记忆，靠隐藏状态在线「学会」新任务；另一类如 MAML，学一组便于微调的初始参数，几步梯度更新即可适配。它针对的是深度强化学习样本效率低、策略难泛化的问题。机器人上常用于应对负载、地形、机体损伤等变化，Meta-World 是常用的机械臂元强化学习基准。","example":"Nagabandi 等人（2018）用元学习训练动力学模型，一台真实的腿式微型机器人在少一条腿、爬坡或拖拽负载时，能用最近几步观测在线调整模型、继续完成移动。","related":["元学习","上下文学习","快速运动适应","Meta-World","少样本","多任务学习"]},{"id":"one-shot-imitation-learning","category":"training","sec":11,"tier":3,"sources":[{"title":"Duan et al. 2017: One-Shot Imitation Learning","url":"https://arxiv.org/abs/1703.07326"},{"title":"Finn et al. 2017: One-Shot Visual Imitation Learning via Meta-Learning","url":"https://arxiv.org/abs/1709.04905"}],"as_of":"","related_ids":["meta-learning","imitation-learning","few-shot","in-context-learning","demonstration-data","okami"],"name":"单样本模仿学习","alt":"One-shot Imitation Learning","abbr":"","aliases":["一次演示模仿学习","One-shot Imitation"],"one_liner":"只给机器人看一次新任务的演示，它就能在新情况下照着完成。","explanation":"单样本模仿学习要求机器人面对新任务时，只凭一条演示（一段遥操作轨迹或一段视频），就能在物体摆放、初始状态都不同的新局面里完成同样的任务。做法不是拿这一条数据从头训练，而是先在大量任务上训练一个「以演示为条件」的策略：输入演示和当前观测，输出动作。OpenAI 的 Duan 等人 2017 年在积木堆叠任务上提出并命名了这一设定；同年 Finn 等人用 MAML 做元模仿学习，把它扩展到原始图像输入并在真机上验证。后续工作尝试直接用人类视频当演示，这还要跨越人与机器人的本体差异。它本质上是元学习在模仿学习上的应用，与大模型的上下文学习思路相近。","example":"Duan 等人的实验里，每个任务是把桌上的积木按某种方式堆叠（如全部叠成一座塔，或两两叠成若干座）；测试时给出一种新堆法的一条演示，网络要在积木初始位置不同的新局面中照样堆出来。","related":["元学习","模仿学习","少样本","上下文学习","演示数据","OKAMI"]},{"id":"neural-network","category":"model","sec":0,"tier":1,"sources":[{"title":"Neural network (machine learning) (Wikipedia)","url":"https://en.wikipedia.org/wiki/Neural_network_(machine_learning)"}],"as_of":"","related_ids":["multilayer-perceptron","convolutional-neural-network","transformer","backpropagation","parameter-count","loss-function"],"name":"神经网络","alt":"Neural Network (Deep Neural Network)","abbr":"","aliases":["人工神经网络","深度神经网络","ANN","DNN"],"one_liner":"由大量人工神经元分层连接、靠调整连接权重从数据中学习的模型。","explanation":"神经网络是一类机器学习模型，由许多简单的计算单元（人工神经元）连接而成：每个单元把输入加权求和，再经过一个非线性函数（激活函数）传给下一层。连接的强弱叫权重，也就是模型的参数。训练时先用损失函数衡量输出和正确答案的差距，再用反向传播算出每个权重该往哪个方向改，反复迭代让误差变小。输入层和输出层之间的隐藏层不少于两层时，一般称为深度神经网络。2012 年 AlexNet 在 ImageNet 图像识别比赛中大幅领先传统方法，带动了深度学习的兴起。如今具身智能里的视觉编码器、Transformer、VLA 和强化学习策略，本质上都是神经网络。","example":"足式机器人常用的强化学习行走策略往往就是一个几层的多层感知机：输入关节角度、IMU 读数和速度指令，输出每个关节的目标角度。","related":["多层感知机","卷积神经网络","Transformer","反向传播","参数量","损失函数"]},{"id":"parameter-count","category":"model","sec":0,"tier":1,"sources":[{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)","url":"https://arxiv.org/html/2406.09246"},{"title":"RT-2: Vision-Language-Action Models (project page)","url":"https://robotics-transformer2.github.io/"},{"title":"SmolVLA: Efficient Vision-Language-Action Model trained on LeRobot Community Data (Hugging Face blog)","url":"https://huggingface.co/blog/smolvla"}],"as_of":"2025-06","related_ids":["neural-network","scaling-law","inference-latency","post-training-quantization","on-device-model","foundation-model"],"name":"参数量","alt":"Parameter Count (Model Size)","abbr":"","aliases":["模型规模","模型大小","B（十亿参数）","M（百万参数）"],"one_liner":"模型里可训练数值（权重）的总个数，常用 B（十亿）、M（百万）表示。","explanation":"参数是神经网络里通过训练学出来的数值，主要是各层的权重和偏置，参数量就是它们的总数。7B 指 70 亿（billion）个参数，300M 指 3 亿（million）。参数量大体决定模型的容量，以及训练和部署要花多少算力、显存和时间。只算权重的话，显存可粗估为「参数量 × 每个参数的字节数」：名为 7B 的 OpenVLA 实际约 75 亿参数，用 bfloat16（每参数 2 字节）加载约占 15GB，运行时还要再多一些。机器人模型规模跨度很大：RT-2 最大 550 亿，π0 约 33 亿，Hugging Face 的 SmolVLA 只有 4.5 亿。参数多不一定更好：OpenVLA 的参数只有 RT-2-X（550 亿）的约七分之一，在 29 个任务上的总体成功率反而高 16.5 个百分点。","example":"Figure 的 Helix 让两部分规模悬殊：负责理解的视觉语言模型 70 亿参数、每秒只跑 7–9 次，负责出动作的策略 8000 万参数、每秒跑 200 次。","related":["神经网络","缩放定律","推理延迟","训练后量化","端侧模型","基础模型"]},{"id":"multilayer-perceptron","category":"model","sec":0,"tier":2,"sources":[{"title":"Wikipedia: Multilayer perceptron","url":"https://en.wikipedia.org/wiki/Multilayer_perceptron"},{"title":"legged_gym: legged_robot_config.py","url":"https://github.com/leggedrobotics/legged_gym/blob/master/legged_gym/envs/base/legged_robot_config.py"},{"title":"Improved Baselines with Visual Instruction Tuning (LLaVA-1.5, arXiv:2310.03744)","url":"https://arxiv.org/abs/2310.03744"}],"as_of":"","related_ids":["neural-network","activation-function","transformer","projector-connector","action-head","backpropagation"],"name":"多层感知机","alt":"Multilayer Perceptron","abbr":"MLP","aliases":["全连接网络","前馈神经网络","Feedforward Neural Network"],"one_liner":"由多层全连接层加非线性激活堆起来的最基础的神经网络。","explanation":"多层感知机是最基础的前馈神经网络：输入层、若干隐藏层、输出层，相邻两层的神经元全部相连，每层先做一次线性变换，再过一个非线性激活函数（如 ReLU）。它源自 1958 年 Rosenblatt 的感知机，1986 年反向传播算法推广后，多层结构才能有效训练。单层感知机只能区分线性可分的数据，加了隐藏层和非线性后就能拟合复杂函数。MLP 在今天的模型里到处都是：Transformer 每层里的前馈网络就是一个两层 MLP；LLaVA-1.5 等视觉语言模型用 MLP 把视觉特征投影到语言模型的输入空间；机器人里，输入维度不高的强化学习运控策略、动作头、状态编码器也常直接用 MLP。","example":"legged_gym 腿足强化学习框架默认的策略网络就是一个 MLP，三层隐藏层宽度为 512、256、128，激活函数用 ELU，输入本体感知和速度指令，输出各关节的目标位置。","related":["神经网络","激活函数","Transformer","投影层","动作头","反向传播"]},{"id":"activation-function","category":"model","sec":0,"tier":2,"sources":[{"title":"Gaussian Error Linear Units (GELUs) (arXiv:1606.08415)","url":"https://arxiv.org/abs/1606.08415"},{"title":"GLU Variants Improve Transformer (arXiv:2002.05202)","url":"https://arxiv.org/abs/2002.05202"},{"title":"LLaMA: Open and Efficient Foundation Language Models (arXiv:2302.13971)","url":"https://arxiv.org/abs/2302.13971"}],"as_of":"","related_ids":["multilayer-perceptron","transformer","neural-network","normalization-layers","vanishing-exploding-gradients","llama"],"name":"激活函数","alt":"Activation Function (ReLU / GELU / SiLU / SwiGLU)","abbr":"","aliases":["激励函数","非线性激活"],"one_liner":"接在每层线性变换后的非线性函数，让网络能拟合复杂关系。","explanation":"激活函数接在神经网络每层线性变换之后；没有它，多层叠起来仍等价于一次线性变换。常见几种：ReLU 把负数置零、正数原样输出，计算便宜，是卷积网络时代的默认选择；GELU（Hendrycks 与 Gimpel，2016）定义为 x·Φ(x)，Φ 是标准正态分布的累积分布函数，BERT、ViT 等 Transformer 常用；SiLU（也叫 Swish）是 x·sigmoid(x)；SwiGLU（Shazeer，2020）是门控线性单元的变体，把两路线性投影逐元素相乘、其中一路先过 Swish。LLaMA 就在 Transformer 前馈层（FFN）里用 SwiGLU 替换了 ReLU。","example":"输入 -1、0.5、2 时，ReLU 输出 0、0.5、2；GELU 输出约 -0.16、0.35、1.95，负数不再被一刀切成 0。","related":["多层感知机","Transformer","神经网络","归一化层（层归一化 / RMSNorm / 批归一化）","梯度消失 / 梯度爆炸","Llama"]},{"id":"softmax","category":"model","sec":0,"tier":2,"sources":[{"title":"动手学深度学习：softmax 回归","url":"https://zh.d2l.ai/chapter_linear-networks/softmax-regression.html"},{"title":"Dive into Deep Learning: Softmax Regression","url":"https://d2l.ai/chapter_linear-classification/softmax-regression.html"}],"as_of":"","related_ids":["cross-entropy","attention-mechanism","self-attention","decoding-strategies","spatial-softmax","action-binning"],"name":"Softmax（归一化指数函数）","alt":"Softmax","abbr":"","aliases":["归一化指数函数","Softmax 函数","软最大值函数","温度 Softmax"],"one_liner":"把一组任意实数变成全为正、加起来等于 1 的概率分布的函数。","explanation":"Softmax 把一个实数向量的每个元素取指数，再除以所有指数之和，得到一组全为正、总和为 1 的数，可当作概率；原值越大概率越高，差距被指数放大。它在深度学习里有两大用处：一是分类输出层，把模型输出的分数（logits）变成各类别概率，再配合交叉熵损失训练；二是注意力机制里，把查询与各个键的相似度变成权重。先把分数除以温度参数再做 Softmax，可以调节分布的尖锐程度：温度低时近似只选最大值，温度高时更平均。RT-2、OpenVLA 把连续动作切成若干区间，也是用 Softmax 给出每个区间的概率。","example":"分类器对「杯子、碗、盘子」打出 2.0、1.0、0.1 三个分数，经 Softmax 约得到 0.66、0.24、0.10 的概率。","related":["交叉熵","注意力机制","自注意力","解码策略（贪心 / 温度采样 / Top-k / Top-p）","空间 Softmax","分箱离散化"]},{"id":"normalization-layers","category":"model","sec":0,"tier":3,"sources":[{"title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift (arXiv:1502.03167)","url":"https://arxiv.org/abs/1502.03167"},{"title":"Layer Normalization (arXiv:1607.06450)","url":"https://arxiv.org/abs/1607.06450"},{"title":"Root Mean Square Layer Normalization (arXiv:1910.07467)","url":"https://arxiv.org/abs/1910.07467"}],"as_of":"","related_ids":["adaptive-layer-normalization","transformer","residual-network","convolutional-neural-network","llama","exponential-moving-average"],"name":"归一化层（层归一化 / RMSNorm / 批归一化）","alt":"Normalization Layers (LayerNorm / RMSNorm / BatchNorm)","abbr":"LN / RMSNorm / BN","aliases":["LayerNorm","BatchNorm","均方根层归一化","Norm 层"],"one_liner":"把网络中间特征拉回稳定数值范围的层，让深层网络训练更稳更快。","explanation":"归一化层对中间特征做「减均值、除以标准差」一类的缩放，再乘上可学习的缩放和偏移，防止数值随层数加深而失控，让训练更稳。批归一化（BN，2015 年）在一个批次内统计每个通道的均值方差，是卷积网络标配，但依赖批大小，训练和推理时的算法也不同。层归一化（LN，2016 年）改在单个样本的全部特征上统计，训练推理一致，成为 Transformer 标配。RMSNorm（2019 年）去掉减均值，只除以均方根，更省计算，Llama 等大模型都用它，以它们为语言骨干的 VLA 也就多用 RMSNorm。扩散 Transformer 还常用自适应层归一化来注入时间步等条件。","example":"扩散策略把 ResNet-18 视觉编码器里的批归一化全部换成组归一化（GroupNorm），原因是批归一化和扩散模型常用的指数移动平均（EMA）权重一起用时训练不稳定。","related":["自适应层归一化","Transformer","残差网络","卷积神经网络","Llama","指数移动平均"]},{"id":"convolutional-neural-network","category":"model","sec":0,"tier":2,"sources":[{"title":"CS231n: Convolutional Neural Networks for Visual Recognition (Stanford)","url":"https://cs231n.github.io/convolutional-networks/"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"},{"title":"RT-1: Robotics Transformer (project page)","url":"https://robotics-transformer1.github.io/"}],"as_of":"","related_ids":["residual-network","efficientnet","vision-encoder","vision-transformer","backbone-network","spatial-softmax"],"name":"卷积神经网络","alt":"Convolutional Neural Network","abbr":"CNN","aliases":["卷积网络","ConvNet"],"one_liner":"用小卷积核在图像上滑动提取局部特征的神经网络，长期是视觉任务的主力。","explanation":"卷积神经网络是专门处理图像这类网格数据的神经网络。核心是卷积层：一组很小的可学习滤波器（如 3×3）在图上逐位置滑动，计算局部加权和；同一个滤波器在所有位置共用参数，所以参数量远少于全连接网络，也天然适合识别出现在任何位置的边缘、纹理和部件。再配合池化层逐步缩小分辨率，就能从局部细节一路抽象到整体语义。发展上，LeCun 在 1990 年代用 LeNet 识别手写数字，2012 年 AlexNet 在 ImageNet 上大幅领先，2015 年 ResNet 用残差连接把网络做深。视觉 Transformer 出现后，大模型的视觉编码器多换成了 Transformer，但机器人小模型里 CNN 依然常见，例如 RT-1 用 EfficientNet、Diffusion Policy 用 ResNet-18 处理相机图像。","example":"Diffusion Policy 把标准 ResNet-18 的全局平均池化换成空间 softmax 以保留位置信息，把 BatchNorm 换成 GroupNorm 以稳定训练，用它把每个相机画面编码成特征。","related":["残差网络","EfficientNet","视觉编码器","视觉 Transformer","骨干网络","空间 Softmax"]},{"id":"residual-network","category":"model","sec":0,"tier":2,"sources":[{"title":"Deep Residual Learning for Image Recognition (arXiv 1512.03385)","url":"https://arxiv.org/abs/1512.03385"},{"title":"Dive into Deep Learning: Residual Networks (ResNet)","url":"https://d2l.ai/chapter_convolutional-modern/resnet.html"},{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"}],"as_of":"","related_ids":["convolutional-neural-network","backbone-network","vision-encoder","vanishing-exploding-gradients","action-chunking-with-transformers","diffusion-policy"],"name":"残差网络","alt":"Residual Network","abbr":"ResNet","aliases":["ResNet-18","ResNet-50","残差连接","跳跃连接","Residual Connection","Skip Connection"],"one_liner":"用跳跃连接让每层只学输入与输出之差，从而能训练很深的卷积网络。","explanation":"残差网络由微软亚洲研究院的何恺明等人在 2015 年提出，论文获 CVPR 2016 最佳论文。此前卷积网络层数一多反而更难训练、精度下降。ResNet 在每个模块里加一条跳跃连接，把输入直接加到输出上，模块只需学习输入与目标之间的「残差」，梯度也能沿这条捷径直接回传。靠这个设计，网络做到了 152 层，并拿下 ILSVRC 2015 图像分类冠军。残差连接后来成了几乎所有深度网络的标配，Transformer 每一层也有。机器人学习中，ResNet-18 等小型 ResNet 常作图像编码器，ACT 和扩散策略都用它把相机画面变成特征。","example":"ACT 用 ResNet-18 把每张 480×640 的相机图像压成 15×20×512 的特征图，再展平成 300 个 token 送进 Transformer。","related":["卷积神经网络","骨干网络","视觉编码器","梯度消失 / 梯度爆炸","ACT","扩散策略"]},{"id":"backbone-network","category":"model","sec":0,"tier":1,"sources":[{"title":"Mask R-CNN (arXiv 1703.06870)","url":"https://arxiv.org/abs/1703.06870"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/abs/2503.14734"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/abs/2406.09246"}],"as_of":"","related_ids":["vision-encoder","vision-language-model","action-head","backbone-freezing","pre-training","residual-network"],"name":"骨干网络","alt":"Backbone Network","abbr":"","aliases":["主干网络","Backbone","主干"],"one_liner":"模型中负责从原始输入提取通用特征的主体网络，后面再接各种任务头。","explanation":"骨干网络原是计算机视觉里的说法，例如 2017 年的 Mask R-CNN 论文就把网络分成两部分：对整张图提取特征的卷积骨干（如 ResNet-50），和做分类、边框回归、掩码预测的网络头。骨干通常先在大规模数据上预训练，再被不同任务复用，换一个更强的骨干往往整体提升效果。到了具身模型，骨干多是预训练好的视觉语言模型：OpenVLA 用 Llama 2 加 DINOv2、SigLIP 视觉编码器，π0 用 PaliGemma，GR00T N1 用英伟达 Eagle-2。骨干提供语义知识，动作头或动作专家把特征变成动作；微调时是否冻结骨干，是常见的设计取舍。","example":"GR00T N1 的 22 亿参数里有 13.4 亿属于 Eagle-2 视觉语言骨干；它取骨干第 12 层而不是最后一层的特征交给动作模块，论文称这样推理更快，策略成功率也更高。","related":["视觉编码器","视觉语言模型","动作头","冻结骨干网络","预训练","残差网络"]},{"id":"efficientnet","category":"model","sec":0,"tier":3,"sources":[{"title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks (arXiv:1905.11946)","url":"https://arxiv.org/abs/1905.11946"},{"title":"RT-1: Robotics Transformer project page","url":"https://robotics-transformer1.github.io/"}],"as_of":"","related_ids":["convolutional-neural-network","backbone-network","residual-network","rt-1","feature-wise-linear-modulation","tokenlearner"],"name":"EfficientNet","alt":"EfficientNet","abbr":"","aliases":["EfficientNet-B0~B7"],"one_liner":"谷歌提出的高效卷积网络系列，按统一比例同时放大深度、宽度和分辨率。","explanation":"EfficientNet 是谷歌 Mingxing Tan 和 Quoc V. Le 在 ICML 2019 提出的卷积神经网络系列。以前放大 CNN 通常只加深、加宽或加大输入分辨率其中一项，收益很快饱和。论文提出「复合缩放」：用一个系数按固定比例同时放大深度、宽度和分辨率；先用神经架构搜索得到小的基线网络 B0，再逐级放大得到 B1 到 B7。论文报告 B7 在 ImageNet 上达到 84.3% top-1 准确率，比当时最好的卷积网络小 8.4 倍、推理快 6.1 倍。参数少、速度快，因此在 ViT 普及前，机器人策略常拿它做视觉骨干。","example":"谷歌的 RT-1 用 ImageNet 预训练的 EfficientNet 提取图像特征，并通过 FiLM 层让语言指令调制这些特征，再交给 TokenLearner 和 Transformer 输出离散动作 token。","related":["卷积神经网络","骨干网络","残差网络","RT-1","FiLM 特征调制","TokenLearner"]},{"id":"recurrent-neural-network","category":"model","sec":0,"tier":2,"sources":[{"title":"Dive into Deep Learning: Long Short-Term Memory (LSTM)","url":"https://d2l.ai/chapter_recurrent-modern/lstm.html"},{"title":"Dive into Deep Learning: Gated Recurrent Units (GRU)","url":"https://d2l.ai/chapter_recurrent-modern/gru.html"},{"title":"robomimic Documentation: Overview","url":"https://robomimic.github.io/docs/introduction/overview.html"}],"as_of":"","related_ids":["transformer","long-short-term-memory-gated-recurrent-unit","vanishing-exploding-gradients","state-space-model","recurrent-state-space-model","history-encoder"],"name":"循环神经网络","alt":"Recurrent Neural Network","abbr":"RNN","aliases":["循环网络","LSTM","GRU","长短期记忆网络","门控循环单元"],"one_liner":"按时间步逐个处理序列、用隐藏状态记住过去信息的神经网络。","explanation":"循环神经网络是一类处理序列的神经网络：每读入一个时间步的输入，就结合上一步的隐藏状态（记录历史的向量）算出新状态，各步共用同一套参数。普通 RNN 在长序列上容易梯度消失、记不住久远信息，于是有了带门控的变体：1997 年 Hochreiter 和 Schmidhuber 提出长短期记忆网络 LSTM，2014 年 Cho 等人提出更精简的门控循环单元 GRU。RNN 必须逐步计算、难以并行训练，在语言领域已基本被 Transformer 取代；但它推理时每步只需更新一个状态、开销小，机器人里仍常用来做需要记忆历史的策略。","example":"模仿学习库 robomimic 提供 BC-RNN 算法：用 LSTM 依次读入过去若干步的观测、输出当前动作，常被用作扩散策略等新方法的对比基线。","related":["Transformer","长短期记忆网络 / 门控循环单元","梯度消失 / 梯度爆炸","状态空间模型","循环状态空间模型","历史编码器"]},{"id":"long-short-term-memory-gated-recurrent-unit","category":"model","sec":0,"tier":2,"sources":[{"title":"Wikipedia: Long short-term memory","url":"https://en.wikipedia.org/wiki/Long_short-term_memory"},{"title":"Wikipedia: Gated recurrent unit","url":"https://en.wikipedia.org/wiki/Gated_recurrent_unit"}],"as_of":"","related_ids":["recurrent-neural-network","transformer","state-space-model","history-encoder","vanishing-exploding-gradients","dactyl"],"name":"长短期记忆网络 / 门控循环单元","alt":"Long Short-Term Memory / Gated Recurrent Unit","abbr":"LSTM / GRU","aliases":["LSTM","GRU","门控循环神经网络"],"one_liner":"带「门」的循环神经网络，能记住较长的历史信息，常用来处理时间序列。","explanation":"LSTM 由 Hochreiter 和 Schmidhuber 于 1997 年提出，是循环神经网络（RNN，按时间一步步读入序列、把信息存在隐状态里的网络）的改进版。普通 RNN 训练时梯度会随时间步指数衰减，记不住很久以前的事；LSTM 用遗忘门、输入门、输出门控制哪些信息丢弃、写入、输出，缓解了这个问题。GRU 由 Cho 等人在 2014 年提出，只有更新门和重置门，没有输出门，参数更少、算得更快，效果常与 LSTM 相当。Transformer 普及后它们在语言任务里退居次要，但在机器人中仍常见：腿足运控策略常用它们从历史本体感知中推断地形和自身状态，模仿学习里也有带 RNN 的行为克隆基线。","example":"OpenAI 的 Dactyl 用策略梯度训练了一个 LSTM 策略来控制五指灵巧手，让它在手里翻转方块、还原魔方。","related":["循环神经网络","Transformer","状态空间模型","历史编码器","梯度消失 / 梯度爆炸","Dactyl（OpenAI 魔方灵巧手）"]},{"id":"encoder-decoder","category":"model","sec":0,"tier":2,"sources":[{"title":"Dive into Deep Learning: The Encoder–Decoder Architecture","url":"https://d2l.ai/chapter_recurrent-modern/encoder-decoder.html"},{"title":"Sequence to Sequence Learning with Neural Networks (arXiv 1409.3215)","url":"https://arxiv.org/abs/1409.3215"},{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)","url":"https://arxiv.org/html/2304.13705"}],"as_of":"","related_ids":["transformer","decoder-only-architecture","cross-attention","autoencoder","variational-autoencoder","action-chunking-with-transformers"],"name":"编码器-解码器","alt":"Encoder-Decoder","abbr":"","aliases":["编解码器架构","Encoder-Decoder Architecture","序列到序列模型","Seq2Seq"],"one_liner":"先把输入压成中间表示，再由另一部分据此生成输出的网络结构。","explanation":"编码器-解码器是一种通用的神经网络结构：编码器把输入（一句话、一张图、一组传感器读数）转成中间表示，解码器根据这个表示生成输出，输入输出长度可以不同。2014 年 Sutskever 等人用两个 LSTM（一种循环神经网络）做英译法，是它在序列到序列任务上的代表作；2017 年的原始 Transformer 也是这种结构，解码器通过交叉注意力读取编码器的结果。后来 GPT 类大模型多改用仅解码器结构，但机器人里它依然常见：ACT 用 Transformer 编码器融合多路相机画面和关节状态，再由解码器一次输出一整段动作。自编码器、变分自编码器也属于这一框架。","example":"ACT 控制 ALOHA 双臂：编码器读入 4 路相机图像和 14 维关节角，解码器输出未来 k 步（常取 100 步）的 14 维目标关节位置。","related":["Transformer","仅解码器架构","交叉注意力","自编码器","变分自编码器","ACT"]},{"id":"inductive-bias","category":"model","sec":0,"tier":3,"sources":[{"title":"Inductive bias（Wikipedia）","url":"https://en.wikipedia.org/wiki/Inductive_bias"},{"title":"An Image is Worth 16x16 Words (ViT, arXiv:2010.11929)","url":"https://arxiv.org/abs/2010.11929"},{"title":"Relational inductive biases, deep learning, and graph networks (arXiv:1806.01261)","url":"https://arxiv.org/abs/1806.01261"}],"as_of":"","related_ids":["convolutional-neural-network","vision-transformer","equivariant-policy-equivariant-neural-network","graph-neural-network","generalization","the-bitter-lesson"],"name":"归纳偏置","alt":"Inductive Bias","abbr":"","aliases":["归纳偏差","学习偏置","Learning Bias","结构先验"],"one_liner":"模型或算法预先内置的假设，决定它如何推广到没见过的数据。","explanation":"同一批有限的训练数据可以被许多不同的规律解释，归纳偏置就是学习算法在这些解释中做选择时依赖的假设。Tom Mitchell 在 1980 年指出，没有这类假设，模型就无法对没见过的输入做出预测。常见例子：卷积神经网络假设相邻像素相关、特征具有平移等变性（物体平移，特征图随之平移）。ViT 论文指出，Transformer 的图像归纳偏置比 CNN 少得多，在 ImageNet 这类中等规模数据上训练时准确率略低于同等大小的 ResNet，要在更大的数据集上预训练才能追上甚至超过。归纳偏置强，省数据但可能限制上限；弱，则更依赖数据规模。机器人学习中，把观测转成 3D 体素、把旋转对称性写进网络的等变策略，都是用几何归纳偏置换取少样本下的性能。","example":"PerAct 把 RGB-D 观测体素化后再预测动作，论文报告它比直接从 2D 图像预测动作的基线好 34 倍，作者将此归因于 3D 体素带来的结构先验。","related":["卷积神经网络","视觉 Transformer","等变策略 / 等变网络","图神经网络","泛化","苦涩的教训"]},{"id":"equivariant-policy-equivariant-neural-network","category":"model","sec":0,"tier":3,"sources":[{"title":"Equivariant Diffusion Policy (Wang et al., CoRL 2024, arXiv 2407.01812)","url":"https://arxiv.org/abs/2407.01812"},{"title":"Group Equivariant Convolutional Networks (Cohen & Welling, ICML 2016)","url":"https://arxiv.org/abs/1602.07576"}],"as_of":"","related_ids":["diffusion-policy","inductive-bias","data-augmentation","sample-efficiency","neural-descriptor-fields","convolutional-neural-network"],"name":"等变策略 / 等变网络","alt":"Equivariant Policy / Equivariant Neural Network","abbr":"","aliases":["等变扩散策略","Equivariant Diffusion Policy","EquiDiff","群等变卷积网络","G-CNN"],"one_liner":"输入旋转或平移时，输出按同样方式变化的网络，把对称性写进结构里。","explanation":"等变（equivariance）指输入做某种变换（旋转、平移、镜像）时，输出也按对应方式变换。Cohen 和 Welling 2016 年提出群等变卷积网络（G-CNN），把对称性直接做进网络层，不必靠数据增强慢慢学。机器人操作天然有这种对称性：桌上的杯子转 90 度，抓取动作也该跟着转 90 度。Wang 等人的等变扩散策略（EquiDiff，CoRL 2024）把绕竖直轴的平面旋转对称（SO(2)）加进扩散策略，在 MimicGen 的 12 个仿真任务上平均成功率比原版扩散策略高约 21.9%，真机上用 20–60 条演示就能学会任务。代价是网络实现更复杂，而且只对设计时指定的那类对称有效。","example":"EquiDiff 在真机「烤贝果」任务上用 58 条演示达到 80% 成功率，同样数据下原版扩散策略只有 10%。","related":["扩散策略","归纳偏置","数据增强","样本效率","神经描述子场","卷积神经网络"]},{"id":"graph-neural-network","category":"model","sec":0,"tier":3,"sources":[{"title":"Graph neural network - Wikipedia","url":"https://en.wikipedia.org/wiki/Graph_neural_network"},{"title":"Learning to Simulate Complex Physics with Graph Networks (Sanchez-Gonzalez et al., ICML 2020)","url":"https://arxiv.org/abs/2002.09405"},{"title":"NerveNet: Learning Structured Policy with Graph Neural Networks (project page)","url":"http://www.cs.toronto.edu/~tingwuwang/nervenet.html"}],"as_of":"","related_ids":["3d-scene-graph","neural-simulator","point-cloud-encoder","transformer","morphology-control-co-design","inductive-bias"],"name":"图神经网络","alt":"Graph Neural Network","abbr":"GNN","aliases":["图网络","Graph Network","消息传递神经网络"],"one_liner":"专门处理图结构数据的神经网络，每个节点通过边和邻居反复交换信息。","explanation":"图神经网络处理由节点和边组成的数据，核心是消息传递：每一层里，每个节点汇总邻居传来的信息来更新自己的特征，堆叠多层后信息能传到更远的节点，而且结果不依赖节点的编号顺序。Scarselli 等人 2009 年提出「图神经网络模型」，之后有图卷积网络（GCN）、图注意力网络（GAT）等变体。具身智能里常见三种用法：把机器人身体建成图（关节、肢体作节点），如 NerveNet 让策略迁移到不同体型的智能体；把粒子或物体建成图来学物理，如 DeepMind 2020 年的图网络模拟器（GNS）；以及在 3D 场景图上表示物体关系，做推理和规划。","example":"GNS 把流体、沙子等材料的每个粒子当作节点，相邻粒子连边，用多轮消息传递预测下一步位置；测试时的粒子数可以比训练时多一个数量级。","related":["3D场景图","神经模拟器","点云编码器","Transformer","形态-控制协同设计（形态进化）","归纳偏置"]},{"id":"token","category":"model","sec":1,"tier":1,"sources":[{"title":"Tokenizers (Hugging Face LLM Course, Chapter 2)","url":"https://huggingface.co/learn/llm-course/chapter2/4"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)","url":"https://arxiv.org/html/2406.09246"},{"title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT, arXiv:2010.11929)","url":"https://arxiv.org/abs/2010.11929"}],"as_of":"","related_ids":["tokenizer","embedding","visual-token","action-tokenizer","next-token-prediction","context-length"],"name":"token（词元）","alt":"Token","abbr":"","aliases":["词元","token","标记"],"one_liner":"模型处理数据的基本单位，文字、图像小块、动作都能切成 token。","explanation":"Token 是 Transformer 类模型读入和输出的基本单位。文本先由分词器（tokenizer）切成词或子词片段，每个片段在词表里有一个编号，再转成向量（嵌入）送进模型；大语言模型的训练目标就是预测下一个 token。英文里一个 token 常是一个词或词的一部分，一个汉字可能对应一个 token，也可能被拆开或与相邻字合并，取决于分词器。这个概念后来推广到其他模态：ViT 把图片切成 16×16 像素的小块，每块算一个视觉 token；RT-2 和 OpenVLA 把每个动作维度离散成 256 档，每档对应一个 token，让语言模型像写字一样输出动作。上下文长度按 token 数计算，推理耗时也随 token 数增加。","example":"OpenVLA 把 Llama 分词器里最少用的 256 个 token 改作动作档位，一个 7 维动作（位置、姿态、夹爪开合）就输出 7 个 token。","related":["分词器","嵌入向量","视觉 token","动作分词器","下一个 token 预测","上下文长度"]},{"id":"tokenizer","category":"model","sec":1,"tier":2,"sources":[{"title":"Hugging Face Transformers Docs: Tokenization algorithms","url":"https://huggingface.co/docs/transformers/tokenizer_summary"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/html/2406.09246"}],"as_of":"","related_ids":["token","byte-pair-encoding","action-tokenizer","video-tokenizer","visual-token","action-binning"],"name":"分词器","alt":"Tokenizer","abbr":"","aliases":["tokenizer","词元化器","词表"],"one_liner":"把文字、图像或动作切成 token 并换成整数编号的预处理模块。","explanation":"分词器是模型前面的预处理模块：把输入切成一个个 token（词元，模型处理的最小单位），再按一张固定的词表换成整数编号；模型输出编号后也靠它还原成文字。大语言模型多用子词算法，例如 BPE（字节对编码，反复合并最常相邻出现的字符对），常见词保留成一个 token，生僻词拆成几段，GPT-2 的词表有 50257 个 token。在具身智能里这个词被推广了：视频分词器把视频压成 token，动作分词器把连续的关节动作变成离散 token，让语言模型能像说话一样输出动作。怎么分词决定了序列有多长、模型能表示什么，是 VLA 设计里的关键选择。","example":"OpenVLA 把每一维动作分成 256 个区间，并直接占用 Llama 分词器里 256 个最少用到的 token 来代表这些区间，于是一步 7 维动作就变成 7 个 token。","related":["token（词元）","字节对编码","动作分词器","视频分词器","视觉 token","分箱离散化"]},{"id":"byte-pair-encoding","category":"model","sec":1,"tier":3,"sources":[{"title":"Neural Machine Translation of Rare Words with Subword Units (arXiv 1508.07909)","url":"https://arxiv.org/abs/1508.07909"},{"title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models (arXiv 2501.09747)","url":"https://arxiv.org/html/2501.09747"},{"title":"Byte-pair encoding - Wikipedia","url":"https://en.wikipedia.org/wiki/Byte-pair_encoding"}],"as_of":"","related_ids":["tokenizer","token","action-tokenizer","discrete-cosine-transform","pi0-fast","large-language-model"],"name":"字节对编码","alt":"Byte-Pair Encoding","abbr":"BPE","aliases":["字节级 BPE","Byte-level BPE"],"one_liner":"反复合并最常见的相邻符号对来构建子词词表的分词算法","explanation":"字节对编码最早由 Philip Gage 在 1994 年作为文本压缩算法提出；2016 年 Sennrich 等人把它用到神经机器翻译的分词上（ACL 2016），之后成为 GPT 等大语言模型分词器的主流方案。做法是：从单个字符或字节开始，统计语料里出现次数最多的相邻符号对，把它合并成一个新符号加入词表，重复直到词表达到设定大小。这样常见词是一个 token，罕见词拆成几个子词，既不会遇到词表外的词，序列也不会像逐字符切分那样长。字节级 BPE 先把文本转成 UTF-8 字节再合并，任何文本都能编码。在具身领域，Physical Intelligence 的 FAST 动作分词器也用 BPE 压缩动作序列。","example":"FAST 先对每个动作维度做离散余弦变换，按比例缩放取整后展平，再训练 BPE（论文默认缩放 10、词表 1024），把一段动作压成较短的 token 序列给 VLA 自回归预测。","related":["分词器","token（词元）","动作分词器","离散余弦变换","π0-FAST","大语言模型"]},{"id":"embedding","category":"model","sec":1,"tier":2,"sources":[{"title":"Embeddings | Machine Learning Crash Course (Google for Developers)","url":"https://developers.google.com/machine-learning/crash-course/embeddings"},{"title":"Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv 2103.00020)","url":"https://arxiv.org/abs/2103.00020"}],"as_of":"","related_ids":["token","tokenizer","visual-token","latent-space","projector-connector","representation-learning"],"name":"嵌入向量","alt":"Embedding","abbr":"","aliases":["嵌入","embedding","向量表示"],"one_liner":"把词、图块、动作等对象表示成一串实数，意思相近的东西向量也相近。","explanation":"嵌入向量是神经网络内部表示信息的基本单位：把一个词、一个图像块、一帧机器人状态等对象，映射成固定长度的一串实数（比如 1024 维）。它是训练中学出来的，不是人工指定的；训练好后，意思相近的对象在向量空间里距离也近。和 one-hot 编码（每个类别占一维、只有该位为 1）相比，嵌入维度低，还能表达相似关系，word2vec 是早期的著名例子。在具身智能模型里嵌入几乎无处不在：分词器把文字切成 token 后查表得到词嵌入，视觉编码器把每个图块变成视觉 token 的嵌入，投影层再把它们映射到语言模型的维度；机器人状态和带噪动作也要先经过线性层变成嵌入，才能和其他 token 一起送进 Transformer。","example":"CLIP 把一张猫的照片和「a photo of a cat」这句话分别编码成嵌入向量，两者的余弦相似度会明显高于这张照片和「a photo of a dog」的相似度。","related":["token（词元）","分词器","视觉 token","潜在空间","投影层","表征学习"]},{"id":"attention-mechanism","category":"model","sec":1,"tier":1,"sources":[{"title":"Neural Machine Translation by Jointly Learning to Align and Translate (arXiv 1409.0473)","url":"https://arxiv.org/abs/1409.0473"},{"title":"Attention Is All You Need (arXiv 1706.03762)","url":"https://arxiv.org/abs/1706.03762"},{"title":"Attention (machine learning) - Wikipedia","url":"https://en.wikipedia.org/wiki/Attention_(machine_learning)"}],"as_of":"","related_ids":["transformer","self-attention","cross-attention","causal-attention","attention-mask","key-value-cache"],"name":"注意力机制","alt":"Attention Mechanism","abbr":"","aliases":["注意力","Attention"],"one_liner":"让模型按相关程度给输入的各部分分配权重，再加权汇总信息的计算方法。","explanation":"深度学习里的注意力机制一般追溯到 Bahdanau、Cho 和 Bengio 2014 年的神经机器翻译论文：翻译每个词时，模型自动去原句里找最相关的词，而不是把整句压成一个固定长度的向量。现在常用的做法是每个位置生成查询（Q）、键（K）、值（V）三个向量，用 Q 与各个 K 的相似度经 softmax 归一化成权重，再对 V 加权求和。2017 年 Vaswani 等人提出的 Transformer 完全用注意力取代循环和卷积，便于并行训练，此后成为大语言模型和 VLA 的基础结构。在具身模型里，自注意力让图像块、文字和动作 token 相互交换信息，交叉注意力常用来让动作模块读取视觉语言特征。","example":"给机器人指令「把红杯子放进水槽」时，模型处理「红杯子」这几个文字 token，注意力权重会集中到画面中红杯子所在的图像块上，把语言和画面对应起来。","related":["Transformer","自注意力","交叉注意力","因果注意力","注意力掩码","KV 缓存"]},{"id":"self-attention","category":"model","sec":1,"tier":2,"sources":[{"title":"Attention Is All You Need (arXiv 1706.03762)","url":"https://arxiv.org/abs/1706.03762"},{"title":"Dive into Deep Learning: Self-Attention and Positional Encoding","url":"https://d2l.ai/chapter_attention-mechanisms-and-transformers/self-attention-and-positional-encoding.html"}],"as_of":"","related_ids":["attention-mechanism","transformer","cross-attention","attention-mask","softmax","positional-encoding"],"name":"自注意力","alt":"Self-Attention","abbr":"","aliases":["内部注意力","Intra-Attention","多头自注意力","Multi-Head Self-Attention"],"one_liner":"让序列中每个元素参考同一序列其他元素、按相关度汇总信息的机制。","explanation":"自注意力是 Transformer 的核心运算，因 2017 年 Vaswani 等人的论文《Attention Is All You Need》而普及。对序列里每个 token，先用可学习矩阵算出查询（Q）、键（K）、值（V）三个向量；拿它的查询与所有 token 的键做点积，经 Softmax 变成权重，再对值加权求和，得到它的新表示。「自」指查询和键值来自同一条序列，来自不同序列就叫交叉注意力。它一步就能连接任意两个位置、便于并行，但计算量随序列长度平方增长。VLA 里图像、文字、状态 token 常放进同一个自注意力里混合，再用注意力掩码规定谁能看谁。","example":"π0 把图像、语言指令、机器人状态和带噪动作的 token 拼成一条序列，经自注意力相互交换信息，最后从动作 token 的输出解出动作。","related":["注意力机制","Transformer","交叉注意力","注意力掩码","Softmax（归一化指数函数）","位置编码"]},{"id":"cross-attention","category":"model","sec":1,"tier":2,"sources":[{"title":"Attention Is All You Need (arXiv 1706.03762)","url":"https://arxiv.org/abs/1706.03762"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/html/2503.14734"}],"as_of":"","related_ids":["attention-mechanism","self-attention","transformer","multimodal-fusion","encoder-decoder","diffusion-transformer"],"name":"交叉注意力","alt":"Cross-Attention","abbr":"","aliases":["Cross Attention","编码器-解码器注意力"],"one_liner":"让一组 token 去查询另一组 token 里信息的注意力，是跨模态融合的常用接口。","explanation":"交叉注意力是注意力机制的一种。自注意力里，查询（Query）、键（Key）、值（Value）都来自同一个序列；交叉注意力则由序列 A 提供查询、序列 B 提供键和值，于是 A 的每个 token 可以按相关程度从 B 里取信息，而 B 本身不被改动。它最早出现在 2017 年 Transformer 论文的编码器-解码器结构中，解码器靠它读取编码器对原句的表示来完成翻译。后来它成了向模型注入条件信息的标准做法：文生图模型用它读取文字编码，机器人策略用它把视觉和语言特征送进动作生成部分。另一种做法是把两段 token 直接拼接后做自注意力，两者各有取舍，VLA 里都很常见。","example":"英伟达 GR00T N1 的动作模块（一个 DiT 变体）交替堆叠两种块：自注意力块处理带噪动作 token 和机器人状态，交叉注意力块去读取 VLM 输出的视觉-语言 token。","related":["注意力机制","自注意力","Transformer","多模态融合","编码器-解码器","扩散 Transformer"]},{"id":"transformer","category":"model","sec":1,"tier":1,"sources":[{"title":"Attention Is All You Need (Vaswani et al., arXiv:1706.03762)","url":"https://arxiv.org/abs/1706.03762"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)","url":"https://arxiv.org/abs/2406.09246"}],"as_of":"","related_ids":["attention-mechanism","self-attention","decoder-only-architecture","encoder-decoder","vision-transformer","rt-1"],"name":"Transformer","alt":"Transformer","abbr":"","aliases":["Transformer 架构","变换器"],"one_liner":"以注意力机制为核心的神经网络架构，是大模型和 VLA 的共同主干。","explanation":"Transformer 由谷歌团队在 2017 年的论文《Attention Is All You Need》中提出，最初用于机器翻译。它完全去掉了循环和卷积结构，只靠注意力机制（让序列里每个 token 直接参考其他所有 token，按相关程度加权汇总信息）处理序列。相比逐步处理的循环神经网络，它能并行计算、训练更快、更容易扩大规模，因此成了 GPT、Llama 等大语言模型和 ViT 等视觉模型的共同架构。原版是编码器-解码器结构，GPT 类模型只用解码器部分。机器人领域在 2022 年前后开始大量采用，谷歌的 RT-1（Robotics Transformer）是代表之一；如今的 VLA、世界模型和不少扩散策略都以 Transformer 为主干。","example":"OpenVLA 的主干 Llama 2 是一个仅解码器的 Transformer：图像 token 和指令 token 排成一个序列输入，模型再逐个输出代表动作的 token。","related":["注意力机制","自注意力","仅解码器架构","编码器-解码器","视觉 Transformer","RT-1"]},{"id":"positional-encoding","category":"model","sec":1,"tier":2,"sources":[{"title":"Attention Is All You Need (arXiv:1706.03762)","url":"https://arxiv.org/html/1706.03762v7"},{"title":"RoFormer: Enhanced Transformer with Rotary Position Embedding (arXiv:2104.09864)","url":"https://arxiv.org/abs/2104.09864"},{"title":"Qwen2-VL (arXiv:2409.12191)","url":"https://arxiv.org/abs/2409.12191"}],"as_of":"","related_ids":["rotary-position-embedding","transformer","self-attention","vision-transformer","context-length","token"],"name":"位置编码","alt":"Positional Encoding","abbr":"PE","aliases":["位置嵌入","Position Embedding"],"one_liner":"给 Transformer 里每个 token 加上「我在第几个位置」的信息。","explanation":"Transformer 的自注意力本身不管顺序，把输入 token 打乱，输出只是跟着换位置。为了让模型知道谁先谁后，2017 年的论文《Attention Is All You Need》在输入嵌入上加了一组不同频率的正弦、余弦值，这就是位置编码；作者也试过可学习的位置嵌入，效果几乎一样。之后出现了多种变体：2021 年苏剑林等人提出的旋转位置编码（RoPE）用旋转矩阵编码位置，让注意力分数自然体现相对距离，被 Llama 等主流大模型采用；Qwen2-VL 进一步提出 M-RoPE，把文字顺序、图像的行列和视频的时间一起编码。具身模型要处理多帧图像、多路相机和动作序列，位置编码决定了模型能否分清哪一帧在前、哪块图像在哪。","example":"ViT 把 224×224 的图像切成 16×16 像素的小块，共 196 块，每块加上一个可学习的位置嵌入，模型才知道哪块在左上角、哪块在右下角。","related":["旋转位置编码","Transformer","自注意力","视觉 Transformer","上下文长度","token（词元）"]},{"id":"rotary-position-embedding","category":"model","sec":1,"tier":3,"sources":[{"title":"RoFormer: Enhanced Transformer with Rotary Position Embedding (arXiv 2104.09864)","url":"https://arxiv.org/abs/2104.09864"},{"title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution (arXiv 2409.12191)","url":"https://arxiv.org/html/2409.12191"},{"title":"LLaMA: Open and Efficient Foundation Language Models (arXiv 2302.13971)","url":"https://arxiv.org/abs/2302.13971"}],"as_of":"","related_ids":["positional-encoding","transformer","self-attention","context-length","qwen-vl","llama"],"name":"旋转位置编码","alt":"Rotary Position Embedding","abbr":"RoPE","aliases":["旋转式位置编码","Rotary Embedding","M-RoPE"],"one_liner":"把位置信息写成向量旋转角度的位置编码，让注意力天然感知相对距离。","explanation":"旋转位置编码由深圳追一科技的苏剑林等人在 2021 年 RoFormer 论文中提出。Transformer 本身分不清 token 的先后顺序，需要位置编码补上。RoPE 把查询和键向量的每两维看作一个平面坐标，按 token 所在位置旋转一个角度，不同维度对的转速不同；这样两个 token 做内积时，结果只取决于它们的相对距离。它不增加可学习参数，注意力依赖随距离增大自然衰减，也方便通过调整旋转频率来扩展上下文长度。Meta 的 LLaMA 采用 RoPE 后，它成了大语言模型的主流做法，Qwen 系列等 VLM 以及基于它们的 VLA 也都沿用。Qwen2-VL 进一步提出多模态 RoPE（M-RoPE），把位置拆成时间、高度、宽度三个分量，用于图像和视频 token。","example":"Qwen2-VL 的 M-RoPE：文本 token 的三个位置编号相同，等同普通 RoPE；图像 token 的时间编号固定、高宽编号随所在网格位置变化；视频每往后一帧，时间编号加一。","related":["位置编码","Transformer","自注意力","上下文长度","通义千问 Qwen-VL","Llama"]},{"id":"causal-attention","category":"model","sec":1,"tier":2,"sources":[{"title":"Attention Is All You Need (arXiv:1706.03762)","url":"https://arxiv.org/abs/1706.03762"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/html/2410.24164"}],"as_of":"","related_ids":["self-attention","attention-mask","decoder-only-architecture","autoregressive-decoding","key-value-cache","transformer"],"name":"因果注意力","alt":"Causal Attention","abbr":"","aliases":["因果掩码","掩码自注意力","Causal Mask","Masked Self-Attention"],"one_liner":"每个位置只能看自己和前面的内容，看不到后面的注意力。","explanation":"因果注意力是在自注意力里加一个掩码，把「未来位置」的注意力分数设为负无穷，让每个 token 只能关注自己和前面的 token。它来自 2017 年 Transformer 原论文的解码器，用来保证自回归：训练时一次喂入整段序列，预测第 i 个位置也只依赖前面的内容。GPT、Llama 等仅解码器语言模型都用它，基于它们的 VLA 逐个生成动作 token 时也是。与之相对的是双向注意力，所有位置互相可见，BERT、ViT 用的就是这种。两者也常混用：π0 用分块因果掩码，把输入分成图像和语言、机器人状态、带噪动作三块，块内互相可见，每块只能看自己和前面的块。","example":"序列「拿 起 杯 子」中，模型计算「杯」时只能关注「拿」「起」「杯」三个位置，「子」被掩码挡住。","related":["自注意力","注意力掩码","仅解码器架构","自回归解码","KV 缓存","Transformer"]},{"id":"attention-mask","category":"model","sec":1,"tier":3,"sources":[{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/html/2410.24164"}],"as_of":"","related_ids":["attention-mechanism","causal-attention","self-attention","key-value-cache","action-expert","pi0"],"name":"注意力掩码","alt":"Attention Mask","abbr":"","aliases":["块状因果注意力掩码","Block-wise Causal Mask","Blockwise Causal Attention Mask"],"one_liner":"规定序列里每个 token 能「看到」哪些 token 的矩阵","explanation":"Transformer 的自注意力默认让每个 token 参考序列里所有 token。注意力掩码在计算注意力分数时把不允许的位置屏蔽掉（通常加上负无穷，经 Softmax 后权重变成 0），从而控制信息流向。最常见的有两种：因果掩码，每个 token 只能看自己和前面的，用于 GPT 这类逐个生成的模型；填充掩码，屏蔽为凑齐长度而补的空位。VLA 里常用块状因果掩码：把输入分成几块，块内互相都能看，块与块之间只能看前面的块。这样既能保护预训练 VLM 原有的输入分布，又能让前面块的 KV 缓存在多步去噪时重复使用，节省推理时间。","example":"π0 把序列分成「图像+语言」「机器人状态」「带噪动作」三块：第一块不看后面新加入的输入，以减少对 PaliGemma 预训练分布的干扰；状态块不看动作块，所以它的 KV 可以在采样时缓存。","related":["注意力机制","因果注意力","自注意力","KV 缓存","动作专家","π0"]},{"id":"foundation-model","category":"model","sec":1,"tier":1,"sources":[{"title":"On the Opportunities and Risks of Foundation Models (Bommasani et al., arXiv:2108.07258)","url":"https://arxiv.org/abs/2108.07258"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/html/2410.24164"}],"as_of":"2024-10","related_ids":["large-language-model","vision-language-model","embodied-foundation-model","pre-training","fine-tuning","vision-language-action-model"],"name":"基础模型","alt":"Foundation Model","abbr":"","aliases":["基座模型","基模","预训练大模型","基座大模型"],"one_liner":"在海量数据上预训练、之后能适配到许多下游任务的大模型。","explanation":"「基础模型」一词由斯坦福大学一百多位研究者在 2021 年的长篇综述中提出，指在大规模、多样的数据上训练（多用自监督学习，即不靠人工标注、从数据本身构造训练目标），之后能通过微调或提示适配到大量下游任务的模型，文中举的例子是 BERT、GPT-3、DALL-E。它改变了「一个任务训一个模型」的做法：先花大算力训一个通用底座，各任务在上面少量调整即可；代价是底座的缺陷会被所有下游模型继承。具身智能里，VLA 模型通常以视觉语言模型为底座，而用大量机器人数据预训练、可适配多种机器人和任务的模型，常被称为机器人基础模型或具身大模型。","example":"π0 以谷歌开源的视觉语言模型 PaliGemma（30 亿参数）为底座，加上 3 亿参数的动作专家，用机器人数据训练成一个可以再针对具体任务微调的机器人基础模型。","related":["大语言模型","视觉语言模型","具身大模型","预训练","微调","视觉-语言-动作模型"]},{"id":"large-language-model","category":"model","sec":1,"tier":1,"sources":[{"title":"Language Models are Few-Shot Learners (GPT-3, arXiv:2005.14165)","url":"https://arxiv.org/abs/2005.14165"},{"title":"Large language model (Wikipedia)","url":"https://en.wikipedia.org/wiki/Large_language_model"},{"title":"SayCan project page","url":"https://say-can.github.io/"}],"as_of":"","related_ids":["transformer","token","next-token-prediction","vision-language-model","llm-based-task-planning","saycan"],"name":"大语言模型","alt":"Large Language Model","abbr":"LLM","aliases":["大模型","语言大模型"],"one_liner":"用海量文本训练、能理解和生成自然语言的超大神经网络。","explanation":"大语言模型是用海量文本训练的神经网络，一般基于 Transformer 架构，主要训练目标是「预测下一个 token」（token 是模型处理文本的最小单位）。规模变大后，它们不改参数、只看提示里的几个例子就能做新任务：OpenAI 2020 年的 GPT-3 有 1750 亿参数，论文展示了这种少样本能力；2022 年底 ChatGPT 发布后大语言模型开始被广泛使用。机器人领域主要用它理解人的指令、把长任务拆成步骤（如 SayCan）、生成控制代码（如代码即策略）。多数 VLA 模型的主干也是大语言模型，例如 OpenVLA 基于 Llama 2，再接上视觉编码器。","example":"对机器人说「我把可乐洒了，能拿个东西来清理吗」，SayCan 让大语言模型给机器人会的每个技能打分，再结合「这一步现在能否做成」的估计，依次选出「找到海绵、拿起海绵、拿给你、结束」，机器人逐步执行。","related":["Transformer","token（词元）","下一个 token 预测","视觉语言模型","大模型任务规划","SayCan"]},{"id":"autoregressive-decoding","category":"model","sec":1,"tier":1,"sources":[{"title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control（项目页）","url":"https://robotics-transformer2.github.io/"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/abs/2406.09246"}],"as_of":"","related_ids":["next-token-prediction","action-tokenizer","action-binning","parallel-decoding","rt-2","openvla"],"name":"自回归解码","alt":"Autoregressive Decoding","abbr":"AR","aliases":["自回归","自回归模型","Autoregressive Model","逐 token 生成"],"one_liner":"一个接一个地生成输出，每一步都以前面已生成的内容为条件。","explanation":"自回归解码是 GPT 等大语言模型生成文字的方式：每次只预测下一个 token，接到输入末尾再预测下一个，直到结束。用到机器人上，要先把连续动作离散成 token。Google DeepMind 2023 年的 RT-2 把动作写成一串数字 token，让视觉语言模型像输出文字一样输出；OpenVLA 把每个动作维度分成 256 个区间，占用 Llama 词表里最少用的 256 个 token。好处是直接复用语言模型的结构和训练方法；缺点是要一个个生成，速度慢，OpenVLA 在一张 RTX 4090 上约 6Hz。所以后来有了 FAST 等压缩动作的分词器、并行解码，以及改用扩散或流匹配生成动作的方案。","example":"RT-2 的一个动作输出就是一串 token，形如「1 128 91 241 5 101 127 217」，依次对应是否结束任务、末端位移和旋转、夹爪开合等维度的离散值，再换算回连续数值发给机器人。","related":["下一个 token 预测","动作分词器","分箱离散化","并行解码","RT-2","OpenVLA"]},{"id":"decoding-strategies","category":"model","sec":1,"tier":3,"sources":[{"title":"How to generate text: using different decoding methods for language generation with Transformers (Hugging Face)","url":"https://huggingface.co/blog/how-to-generate"},{"title":"The Curious Case of Neural Text Degeneration (arXiv:1904.09751)","url":"https://arxiv.org/abs/1904.09751"},{"title":"openvla/openvla-7b model card","url":"https://huggingface.co/openvla/openvla-7b"}],"as_of":"","related_ids":["autoregressive-decoding","large-language-model","action-tokenizer","best-of-n-sampling","inference-time-compute","softmax"],"name":"解码策略（贪心 / 温度采样 / Top-k / Top-p）","alt":"Decoding Strategies (Greedy / Temperature / Top-k / Top-p Sampling)","abbr":"","aliases":["采样策略","核采样","Nucleus Sampling","束搜索"],"one_liner":"模型给出下一个 token 的概率分布后，决定具体选哪个 token 的规则。","explanation":"自回归模型每一步只输出一个概率分布，解码策略决定从中怎么挑。贪心解码每步选概率最大的，结果确定但容易重复；束搜索同时保留几条候选序列；采样则按概率随机抽。温度用来调分布的尖锐程度，温度越低越接近贪心，越高越随机。Top-k 只在概率最高的 k 个里抽，Fan 等人 2018 年把它用于故事生成；Top-p（核采样）只在累计概率刚超过 p 的最小集合里抽，由 Holtzman 等人 2019 年提出，用来缓解最大化解码带来的乏味重复。同一个模型换解码策略，输出质量可能差别很大。输出动作 token 的 VLA 部署时常关掉随机采样，让动作更稳定。","example":"OpenVLA 官方示例调用 predict_action 时设置 do_sample=False，即对动作 token 做贪心解码，同一画面、同一指令每次得到相同动作。","related":["自回归解码","大语言模型","动作分词器","最优 N 采样","推理时计算","Softmax（归一化指数函数）"]},{"id":"decoder-only-architecture","category":"model","sec":1,"tier":3,"sources":[{"title":"Generating Wikipedia by Summarizing Long Sequences (arXiv:1801.10198)","url":"https://arxiv.org/abs/1801.10198"},{"title":"Generative pre-trained transformer - Wikipedia","url":"https://en.wikipedia.org/wiki/Generative_pre-trained_transformer"}],"as_of":"","related_ids":["transformer","encoder-decoder","causal-attention","autoregressive-decoding","large-language-model","next-token-prediction"],"name":"仅解码器架构","alt":"Decoder-only Architecture","abbr":"","aliases":["Decoder-only","纯解码器架构","仅解码器 Transformer"],"one_liner":"只保留 Transformer 解码器、用因果注意力逐个预测下一个 token 的模型结构。","explanation":"仅解码器架构是把原始 Transformer 的编码器去掉、只堆叠解码器的结构。2018 年谷歌 Liu 等人在生成维基百科的工作里用它处理超长序列，同年 OpenAI 的 GPT-1 也采用这种结构，此后 GPT 系列、Llama 等主流大语言模型基本都是仅解码器。它用因果注意力（每个位置只能看到前面的 token）做下一个 token 预测，训练目标简单统一，容易扩大规模。多模态模型会把图像编成视觉 token 拼在文字前面一起输入。很多 VLA 直接沿用这种语言模型骨干，把动作也当成 token 输出。","example":"OpenVLA 以 Llama 2 7B 这个仅解码器语言模型为骨干：图像特征和文字指令拼成一条序列输入，模型再逐个输出离散化后的动作 token。","related":["Transformer","编码器-解码器","因果注意力","自回归解码","大语言模型","下一个 token 预测"]},{"id":"llama","category":"model","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Llama (language model)","url":"https://en.wikipedia.org/wiki/Llama_(language_model)"},{"title":"Meta AI Blog: The Llama 4 herd","url":"https://ai.meta.com/blog/llama-4-multimodal-intelligence/"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)","url":"https://arxiv.org/abs/2406.09246"}],"as_of":"2026-09","related_ids":["large-language-model","open-weight-model","mixture-of-experts","openvla","prismatic-vlms","backbone-network"],"name":"Llama","alt":"Llama (Meta large language model family)","abbr":"","aliases":["LLaMA","Llama 2","Llama 3","Llama 4","羊驼"],"one_liner":"Meta 发布的开放权重大语言模型系列，常被拿来当各类模型的语言底座。","explanation":"Llama 是 Meta 推出的大语言模型系列。初代 LLaMA 于 2023 年 2 月发布，之后有 Llama 2（2023 年 7 月，开始允许商用）、Llama 3 / 3.1（2024 年，最大 405B 参数）、Llama 3.2（2024 年 9 月，加入 11B / 90B 视觉版和 1B / 3B 小模型）和 Llama 4（2025 年 4 月，改用混合专家架构并原生多模态）。权重可以下载，但许可证附带使用限制，所以更准确的说法是「开放权重」而非严格意义的开源。学术界大量视觉语言模型和 VLA 拿 Llama 当语言骨干，比如 OpenVLA 基于 Llama 2 7B。据报道，2026 年 4 月起 Meta 自家的 Meta AI 助手改由其超级智能实验室的闭源 Muse 系列模型驱动。","example":"OpenVLA 把 Llama 2 语言模型和融合了 DINOv2、SigLIP 特征的视觉编码器拼在一起，在约 97 万条真机演示上训练，得到 7B 参数的开源 VLA。","related":["大语言模型","开放权重","混合专家模型","OpenVLA","Prismatic VLM","骨干网络"]},{"id":"mixture-of-experts","category":"model","sec":1,"tier":2,"sources":[{"title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer (arXiv:1701.06538)","url":"https://arxiv.org/abs/1701.06538"},{"title":"Wikipedia: Mixture of experts","url":"https://en.wikipedia.org/wiki/Mixture_of_experts"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/html/2410.24164v1"}],"as_of":"","related_ids":["mixture-of-transformers","action-expert","large-language-model","parameter-count","transformer","multilayer-perceptron"],"name":"混合专家模型","alt":"Mixture of Experts","abbr":"MoE","aliases":["专家混合模型","稀疏混合专家","Sparse MoE"],"one_liner":"模型里放多个「专家」子网络，每次只激活其中几个，用少量计算换大容量。","explanation":"混合专家的思想最早由 Jacobs、Jordan、Nowlan 和 Hinton 在 1991 年提出：多个专家网络加一个门控网络（也叫路由器），由门控决定每个输入交给哪几个专家处理。2017 年 Shazeer 等人把它做成稀疏门控的 MoE 层放进大规模语言模型，参数上千亿，但每个输入只算其中一小部分。它解决的问题是：想让模型更大、装下更多知识，又不想每次推理都付出全部参数的计算量。Mixtral 8x7B、DeepSeek-V3、Llama 4 等大语言模型都用了 MoE。要注意，π0 论文把自己的结构比作「只有两个专家的 MoE」：图像和文字走 VLM 权重，状态和动作走动作专家权重，按 token 类型固定分工，不是由门控网络学出来的路由。","example":"Mixtral 8x7B 每层有 8 个专家，每个 token 只选其中 2 个，总参数约 46.7B，但每个 token 实际只用到约 12.9B 参数。","related":["混合 Transformer 架构","动作专家","大语言模型","参数量","Transformer","多层感知机"]},{"id":"prompt-prompt-engineering","category":"model","sec":1,"tier":2,"sources":[{"title":"Claude Docs: Prompt engineering overview","url":"https://docs.claude.com/en/docs/build-with-claude/prompt-engineering/overview"},{"title":"openpi (Physical Intelligence) README","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"","related_ids":["large-language-model","chain-of-thought","in-context-learning","code-as-policies","saycan","prompt-tuning-soft-prompt"],"name":"提示词 / 提示工程","alt":"Prompt / Prompt Engineering","abbr":"","aliases":["Prompt","提示","提示语","Prompting","提示设计"],"one_liner":"提示词是输入给模型的文字；提示工程是设计它以得到想要输出的方法。","explanation":"提示词（prompt）指输入给大语言模型或多模态模型的文字，可包含任务说明、背景信息、示例和输出格式要求。提示工程是反复改写、测试提示词，让模型稳定给出所需结果的做法，不改模型参数；常见技巧有给几个示例（少样本）、让模型先写出推理步骤（思维链）、规定输出格式。在具身智能里有两种用法：一是用大模型做任务规划时，靠提示词告诉模型机器人会哪些技能、场景里有什么，SayCan、代码即策略都依赖精心设计的提示词；二是 VLA 接收的自然语言指令，代码里也常直接叫 prompt。与之相对，软提示是可训练的向量而不是文字。","example":"用 openpi 调用 π0.5 时，输入里除了相机图像，还有一项 prompt 写着「pick up the fork」，模型据此输出拿起叉子的动作块。","related":["大语言模型","思维链","上下文学习","代码即策略","SayCan","提示微调 / 软提示"]},{"id":"chain-of-thought","category":"model","sec":1,"tier":2,"sources":[{"title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (arXiv:2201.11903)","url":"https://arxiv.org/abs/2201.11903"},{"title":"Robotic Control via Embodied Chain-of-Thought Reasoning (arXiv:2407.08693)","url":"https://arxiv.org/abs/2407.08693"}],"as_of":"2025-01","related_ids":["embodied-chain-of-thought","visual-chain-of-thought","reasoning","embodied-reasoning","cot-vla","large-language-model"],"name":"思维链","alt":"Chain-of-Thought","abbr":"CoT","aliases":["思维链推理","思维链提示","Chain-of-Thought Prompting"],"one_liner":"让模型先一步步写出中间推理过程，再给最终答案。","explanation":"思维链指模型在给出答案前，先生成一串中间推理步骤。2022 年谷歌 Wei 等人提出「思维链提示」：只要在提示里放几个带推理过程的示例，大模型就会模仿着分步思考；用 8 个这样的示例提示 5400 亿参数的 PaLM，就在数学应用题基准 GSM8K 上取得当时最好成绩。后来它从提示技巧变成训练目标，OpenAI o1、DeepSeek-R1 等推理模型用强化学习训练出更长的思考过程。机器人领域把它引入 VLA：具身思维链（ECoT，2024）先让模型写出任务计划、子任务、动作描述和物体检测框，再输出动作，使 OpenVLA 在泛化任务上的成功率绝对提升 28%。","example":"收到「把勺子放到毛巾上」，ECoT 类模型先写出计划（抓勺子→移到毛巾上方→松开）、当前子任务和勺子的检测框，最后才输出动作 token。","related":["具身思维链","视觉思维链","推理（思考）","具身推理","CoT-VLA","大语言模型"]},{"id":"context-length","category":"model","sec":1,"tier":3,"sources":[{"title":"What is a context window? (IBM Think)","url":"https://www.ibm.com/think/topics/context-window"},{"title":"PaliGemma – Google's Cutting-Edge Open Vision Language Model (Hugging Face Blog)","url":"https://huggingface.co/blog/paligemma"}],"as_of":"2024-10","related_ids":["token","key-value-cache","visual-token","embodied-memory","memory-augmented-vla","visual-token-pruning"],"name":"上下文长度","alt":"Context Length","abbr":"","aliases":["上下文窗口","Context Window"],"one_liner":"模型一次最多能处理的 token 数，决定它能同时「看到」多少输入","explanation":"上下文长度（也叫上下文窗口）指 Transformer 类模型一次能处理的 token 总数上限，按 token 计，不按字数。超出长度的内容要么被截断，要么得先摘要再输入。自注意力的计算量随序列长度平方增长，KV 缓存占的显存随长度线性增长，所以上下文越长，推理越慢、越占显存。据 IBM 2024 年 10 月的整理，GPT-4o 和 Llama 3.1 为 12.8 万 token，Gemini 1.5 Pro 最高 200 万 token。对 VLA 来说图像特别占上下文：PaliGemma 在 224×224 分辨率下每张图就是 256 个视觉 token，多相机、多帧历史会让序列迅速变长，这是很多 VLA 只看当前帧、需要另外设计记忆模块或剪枝视觉 token 的原因之一。","example":"用 PaliGemma 编码 3 路 224×224 相机画面，仅图像就占 768 个 token；如果每路再带 4 帧历史，就是 12 张图、3072 个 token。","related":["token（词元）","KV 缓存","视觉 token","具身记忆","记忆增强 VLA","视觉 token 剪枝"]},{"id":"state-space-model","category":"model","sec":1,"tier":3,"sources":[{"title":"Efficiently Modeling Long Sequences with Structured State Spaces (S4, arXiv:2111.00396)","url":"https://arxiv.org/abs/2111.00396"},{"title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces (arXiv:2312.00752)","url":"https://arxiv.org/abs/2312.00752"}],"as_of":"","related_ids":["mamba","transformer","recurrent-neural-network","robomamba","context-length","state-space"],"name":"状态空间模型","alt":"State Space Model","abbr":"SSM","aliases":["结构化状态空间模型","S4","选择性状态空间模型","Selective SSM"],"one_liner":"用一个随时间更新的隐藏状态处理长序列的网络，计算量随序列长度线性增长。","explanation":"状态空间模型源自控制理论：用一个隐藏状态概括过去，每来一个新输入，就按线性方程更新状态并给出输出。深度学习里的 SSM 把这套方程离散化后当作网络层，参数靠训练学出。2021 年斯坦福的 Gu、Goel、Ré 提出 S4（ICLR 2022），让它首次在上万步的长序列上好用；2023 年 Gu 与 Dao 的 Mamba 让参数随输入变化（称为选择性），能按内容决定记住还是遗忘。和 Transformer 相比，它推理时只需保留固定大小的状态，计算量随序列长度线性增长，而注意力是平方增长，因此适合长历史、高频控制和端侧部署。注意别和强化学习里的「状态空间」（所有可能状态的集合）混淆。","example":"Mamba 论文报告推理吞吐比同规模 Transformer 高约 5 倍，3B 参数的 Mamba 语言模型超过同规模 Transformer、与两倍规模的 Transformer 相当；具身领域的 RoboMamba 就用 Mamba 语言模型替代 Transformer 做 VLA 的推理骨干。","related":["Mamba","Transformer","循环神经网络","RoboMamba","上下文长度","状态空间"]},{"id":"mamba","category":"model","sec":1,"tier":3,"sources":[{"title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces (arXiv:2312.00752)","url":"https://arxiv.org/abs/2312.00752"},{"title":"Transformers are SSMs (Mamba-2, arXiv:2405.21060)","url":"https://arxiv.org/abs/2405.21060"},{"title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation (arXiv:2406.04339)","url":"https://arxiv.org/abs/2406.04339"}],"as_of":"2024-05","related_ids":["state-space-model","transformer","recurrent-neural-network","robomamba","inference-latency","context-length"],"name":"Mamba","alt":"Mamba (Selective State Space Model)","abbr":"","aliases":["选择性状态空间模型","Selective State Space Model","Selective SSM","Mamba-2"],"one_liner":"用随输入变化的状态空间模型替代注意力、计算量随序列长度线性增长的序列模型。","explanation":"Mamba 由卡内基梅隆大学的 Albert Gu 和普林斯顿大学的 Tri Dao 于 2023 年 12 月提出。Transformer 的自注意力计算量随序列长度平方增长，长序列代价很高；状态空间模型（SSM）像循环网络一样用固定大小的隐状态逐步吸收输入，计算量线性增长，但早期 SSM 参数固定，不能按内容决定记住还是忘掉什么。Mamba 让这些参数随当前输入变化（即「选择性」），配合面向 GPU 的并行扫描算法，整个架构不用注意力，也不用单独的 MLP 块。论文报告其推理吞吐量约为 Transformer 的 5 倍，Mamba-3B 的效果与两倍参数的 Transformer 相当；2024 年两人又推出快 2–8 倍的 Mamba-2。机器人领域有 RoboMamba 等工作用它降低 VLA 的推理延迟。","example":"RoboMamba 以 Mamba 语言模型为骨干构建 VLA，只微调约 0.1% 的参数就学会操作技能，论文报告其推理速度是当时已有 VLA 模型的 3 倍。","related":["状态空间模型","Transformer","循环神经网络","RoboMamba","推理延迟","上下文长度"]},{"id":"vision-encoder","category":"model","sec":2,"tier":1,"sources":[{"title":"An Image is Worth 16x16 Words (ViT, arXiv:2010.11929)","url":"https://arxiv.org/abs/2010.11929"},{"title":"Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv:2103.00020)","url":"https://arxiv.org/abs/2103.00020"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)","url":"https://arxiv.org/html/2406.09246"}],"as_of":"2024-06","related_ids":["vision-transformer","clip","siglip","dinov2","projector-connector","visual-token"],"name":"视觉编码器","alt":"Vision Encoder","abbr":"","aliases":["图像编码器","Image Encoder","视觉骨干网络"],"one_liner":"把图像转成一组特征向量（视觉 token）供后续模型使用的网络。","explanation":"视觉编码器负责把像素变成模型能用的特征：输入一张图，输出一组向量，每个向量概括图中一小块区域的内容。早期多用卷积神经网络（如 ResNet），现在主流是视觉 Transformer（ViT），它把图像切成小块（原版 ViT 是 16×16 像素），每块先变成一个向量，再用注意力让各块互相交换信息。编码器的能力主要来自预训练：OpenAI 2021 年的 CLIP 用 4 亿对网络图文训练，把图像和文字对齐到同一空间；SigLIP 是谷歌在它基础上改进的版本；Meta 的 DINOv2 只用图像做自监督训练，保留的空间和几何细节更多。VLA 通常直接用现成的视觉编码器，经投影层把特征接到语言模型上，训练时可冻结，也可一起微调。","example":"OpenVLA 把 224×224 的图像同时送进 SigLIP 和 DINOv2，把两路特征按通道拼在一起，再用一个两层 MLP 投影层变成语言模型能读的视觉 token。","related":["视觉 Transformer","CLIP","SigLIP","DINOv2","投影层","视觉 token"]},{"id":"vision-transformer","category":"model","sec":2,"tier":2,"sources":[{"title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (arXiv 2010.11929)","url":"https://arxiv.org/abs/2010.11929"}],"as_of":"","related_ids":["transformer","visual-token","self-attention","positional-encoding","convolutional-neural-network","vision-encoder"],"name":"视觉 Transformer","alt":"Vision Transformer","abbr":"ViT","aliases":["视觉变换器"],"one_liner":"把图片切成小方块当作词序列，用 Transformer 处理图像的网络。","explanation":"视觉 Transformer 由 Google 团队 2020 年在论文「An Image is Worth 16x16 Words」中提出。做法是把图片切成固定大小的小方块（常用 16×16 像素），每块拉平后线性映射成一个向量，加上位置编码（告诉模型每块在哪），当成一串 token 送进标准的 Transformer 编码器；自注意力让每一块都能直接看到全图其他块。此前图像任务主要靠卷积神经网络，ViT 证明在足够大的数据上预训练后，纯 Transformer 也能在 ImageNet 等基准上达到同等水平，而且训练算力更省。今天 CLIP、SigLIP、DINOv2 等视觉基础模型几乎都是 ViT 结构，VLA 的视觉编码器也基本用它。","example":"一张 224×224 的图片按 16×16 像素切块，得到 14×14＝196 个图块，也就是 196 个视觉 token。","related":["Transformer","视觉 token","自注意力","位置编码","卷积神经网络","视觉编码器"]},{"id":"visual-token","category":"model","sec":2,"tier":2,"sources":[{"title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (arXiv 2010.11929)","url":"https://arxiv.org/abs/2010.11929"},{"title":"PaliGemma: A versatile 3B VLM for transfer (arXiv 2407.07726)","url":"https://arxiv.org/html/2407.07726"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/html/2410.24164"}],"as_of":"","related_ids":["vision-transformer","token","projector-connector","visual-token-pruning","spacetime-patches","vision-encoder"],"name":"视觉 token","alt":"Visual Token","abbr":"","aliases":["图像 token","图像块","patch","Image Token","Patch Token"],"one_liner":"图像切块并编码后得到的一个个向量，是模型处理图像的基本单位。","explanation":"视觉 token 是图像进入 Transformer 时的基本单位。常见做法源自 ViT：把图像切成固定大小的图块（patch），每块经视觉编码器变成一个向量，这就是一个视觉 token；视觉语言模型再用投影层把它们映射到和文字 token 相同的空间，与指令拼成一条序列一起处理。token 数随分辨率平方增长：PaliGemma 输入 224 像素图像时是 256 个 token，448 像素是 1024 个，896 像素是 4096 个。机器人通常有多路相机、每秒要推理多次，视觉 token 往往占序列的大头，直接影响推理延迟，所以才有视觉 token 剪枝、重采样等压缩方法。视频模型里对应的单位是时空块。","example":"π0 以 PaliGemma 为骨干：每路相机的图像先编码成视觉 token，再和语言指令的 token 拼进同一条序列送入模型。","related":["视觉 Transformer","token（词元）","投影层","视觉 token 剪枝","时空块","视觉编码器"]},{"id":"vision-foundation-model","category":"model","sec":2,"tier":2,"sources":[{"title":"On the Opportunities and Risks of Foundation Models (arXiv 2108.07258)","url":"https://arxiv.org/abs/2108.07258"},{"title":"DINOv2: Learning Robust Visual Features without Supervision (arXiv 2304.07193)","url":"https://arxiv.org/abs/2304.07193"},{"title":"Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv 2103.00020)","url":"https://arxiv.org/abs/2103.00020"}],"as_of":"","related_ids":["foundation-model","vision-encoder","vision-transformer","clip","dinov2","segment-anything-model"],"name":"视觉基础模型","alt":"Vision Foundation Model","abbr":"VFM","aliases":["视觉大模型","Visual Foundation Model"],"one_liner":"在海量图像上预训练、能直接或稍加调整用于多种视觉任务的通用模型。","explanation":"基础模型指在大规模数据上训练、能适配大量下游任务的模型，这个说法由斯坦福团队 2021 年提出；视觉基础模型是其中面向图像的一类。常见三种思路：OpenAI 的 CLIP 用 4 亿对网上图文做对比学习，学到和语言对齐的视觉特征；Meta 的 DINOv2 在 1.42 亿张精选图片上做自监督训练，特征更擅长刻画空间和几何细节；Meta 的 SAM（分割一切模型）能按点或框提示分割任意物体。它们大多基于 ViT。具身智能很少从零训练视觉部分，而是直接接一个现成的 VFM 当视觉编码器，再把特征送进语言模型或策略网络。","example":"OpenVLA 把同一张相机图片分别送进 SigLIP 和 DINOv2 两个视觉基础模型，两路特征拼接后经一个两层 MLP 投影到 Llama 2 的输入空间。","related":["基础模型","视觉编码器","视觉 Transformer","CLIP","DINOv2","分割一切模型"]},{"id":"clip","category":"model","sec":2,"tier":2,"sources":[{"title":"Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv 2103.00020)","url":"https://arxiv.org/abs/2103.00020"},{"title":"CLIPort: What and Where Pathways for Robotic Manipulation (arXiv 2109.12098)","url":"https://arxiv.org/abs/2109.12098"}],"as_of":"","related_ids":["contrastive-learning","siglip","vision-encoder","open-vocabulary","embedding","cliport"],"name":"CLIP","alt":"Contrastive Language-Image Pre-training","abbr":"CLIP","aliases":["对比语言-图像预训练"],"one_liner":"OpenAI 用 4 亿对图文训练的模型，把图片和文字映射进同一个向量空间。","explanation":"CLIP 是 OpenAI 在 2021 年发布的图文模型，由一个图像编码器和一个文本编码器组成，在从互联网收集的 4 亿对「图片-配文」上用对比学习训练：让配对的图文向量互相靠近、不配对的互相远离。训练完后，图片和文字落在同一个嵌入空间里，可以直接算相似度，所以不用再训练就能做零样本分类——把类别名写成一句话，看图片和哪句话最接近。论文报告，这样在 ImageNet 上的零样本精度追平了用 128 万张标注图训练的 ResNet-50。在具身智能里，CLIP 常被当作开放词汇的视觉或语言编码器：早期的 CLIPort 用它理解指令里物体的语义；后来不少 VLM 和 VLA 的视觉编码器沿用 CLIP 或其改进版 SigLIP。","example":"把桌面照片里裁出的几块物体小图和「红色杯子」这句话都送进 CLIP 编码成向量，相似度最高的那块小图就是指令要找的目标。","related":["对比学习","SigLIP","视觉编码器","开放词汇","嵌入向量","CLIPort"]},{"id":"siglip","category":"model","sec":2,"tier":2,"sources":[{"title":"Sigmoid Loss for Language Image Pre-Training (arXiv 2303.15343)","url":"https://arxiv.org/abs/2303.15343"},{"title":"SigLIP 2: Multilingual Vision-Language Encoders (arXiv 2502.14786)","url":"https://arxiv.org/abs/2502.14786"},{"title":"PaliGemma: A versatile 3B VLM for transfer (arXiv 2407.07726)","url":"https://arxiv.org/abs/2407.07726"}],"as_of":"2025-02","related_ids":["clip","contrastive-learning","vision-encoder","paligemma","dinov2","softmax"],"name":"SigLIP","alt":"Sigmoid Loss for Language-Image Pre-training","abbr":"SigLIP","aliases":["SigLIP 2","SigLIP-So400m","Sigmoid 损失图文预训练"],"one_liner":"谷歌用 Sigmoid 损失训练的图文模型，其图像编码器被许多 VLA 采用。","explanation":"SigLIP 是谷歌 Xiaohua Zhai 等人 2023 年提出的图文预训练方法（ICCV 2023）。它和 CLIP 一样训练图像、文本两个编码器，让配对的图文向量靠近；区别在损失函数：CLIP 用 Softmax 在整批样本上归一化，SigLIP 把每对图文单独当作「是否匹配」的二分类，用 Sigmoid 损失，不依赖全批归一化，小批量也训得好、更省显存。它的视觉编码器（如约 4 亿参数的 So400m）是许多 VLM 和 VLA 的图像输入端。2025 年 2 月的 SigLIP 2 加入字幕生成、自蒸馏等训练目标，多语言、定位和稠密特征都有提升。","example":"π0 的骨干 PaliGemma 由 SigLIP-So400m 视觉编码器和 Gemma-2B 语言模型组成；OpenVLA 则把 SigLIP 与 DINOv2 的特征拼在一起使用。","related":["CLIP","对比学习","视觉编码器","PaliGemma","DINOv2","Softmax（归一化指数函数）"]},{"id":"dinov2","category":"model","sec":2,"tier":2,"sources":[{"title":"DINOv2: Learning Robust Visual Features without Supervision (arXiv 2304.07193)","url":"https://arxiv.org/abs/2304.07193"},{"title":"facebookresearch/dinov2 (GitHub)","url":"https://github.com/facebookresearch/dinov2"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/abs/2406.09246"}],"as_of":"","related_ids":["vision-foundation-model","self-supervised-learning","vision-transformer","dinov3","pre-trained-visual-representation","openvla"],"name":"DINOv2","alt":"DINOv2 (self-DIstillation with NO labels, v2)","abbr":"","aliases":["DINO v2","DINO 特征"],"one_liner":"Meta 2023 年发布的自监督视觉模型，不用标注就能学出通用图像特征。","explanation":"DINOv2 是 Meta AI 在 2023 年 4 月发布的视觉基础模型，是 2021 年 DINO 的第二代，名字意为「无标签自蒸馏」。它不用人工标注：让学生网络在同一张图的不同裁剪上去匹配教师网络的输出（自监督学习），团队还用自动筛选流程整理出 1.42 亿张图片的 LVD-142M 数据集。最大的 ViT-g/14 约 11 亿参数，并蒸馏出 2100 万到 3 亿参数的小版本。它的特征不用微调，接一个线性层就能做分类、分割、深度估计，而且保留了较细的空间和几何信息，这正是机器人需要的。OpenVLA 把 DINOv2 和 SigLIP 的特征融合后作为视觉编码器，DINO-WM 则直接在 DINOv2 的图块特征上训练世界模型。","example":"OpenVLA 把同一张相机图像分别送进 DINOv2 和 SigLIP，两者的特征融合后再投影进 Llama 2 语言模型：DINOv2 补充空间几何细节，SigLIP 提供和语言对齐的语义。","related":["视觉基础模型","自监督学习","视觉 Transformer","DINOv3","预训练视觉表征","OpenVLA"]},{"id":"dinov3","category":"model","sec":2,"tier":2,"sources":[{"title":"DINOv3: Self-supervised learning for vision at unprecedented scale (Meta AI Blog)","url":"https://ai.meta.com/blog/dinov3-self-supervised-vision-model/"},{"title":"DINOv3 (arXiv 2508.10104)","url":"https://arxiv.org/abs/2508.10104"}],"as_of":"2025-08","related_ids":["dinov2","vision-foundation-model","self-supervised-learning","vision-encoder","pre-trained-visual-representation","semantic-segmentation"],"name":"DINOv3","alt":"DINOv3 (Meta self-supervised vision foundation model)","abbr":"","aliases":["DINO v3"],"one_liner":"Meta 2025 年 8 月发布的第三代 DINO，70 亿参数、17 亿张图自监督训练。","explanation":"DINOv3 是 Meta 在 2025 年 8 月发布的自监督视觉基础模型，是 DINOv2 的后继。最大模型 70 亿参数，在 17 亿张图片上训练，模型规模约为上一代的 7 倍，数据约为 12 倍。大模型长时间训练时，逐图块的稠密特征会逐渐变差，DINOv3 为此提出 Gram anchoring（格拉姆锚定）来稳住这类特征。Meta 称它在不微调、只接轻量任务头的情况下，在检测、语义分割等任务上超过了专门训练的模型。除 70 亿参数的大模型外，还蒸馏出多个尺寸的 ViT 和 ConvNeXt 小模型，以及一个用卫星图像训练的版本。对机器人来说，它可以当作比 DINOv2 更强的冻结视觉编码器，提供高分辨率的稠密特征。","example":"把机械臂腕部相机的画面送进冻结的 DINOv3，取出每个图块的特征向量，再在上面训练一个轻量头来做物体分割或抓取点预测，不必从头训练视觉网络。","related":["DINOv2","视觉基础模型","自监督学习","视觉编码器","预训练视觉表征","语义分割"]},{"id":"florence-2","category":"model","sec":2,"tier":3,"sources":[{"title":"Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks (arXiv 2311.06242)","url":"https://arxiv.org/abs/2311.06242"},{"title":"microsoft/Florence-2-large (Hugging Face model card)","url":"https://huggingface.co/microsoft/Florence-2-large"},{"title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment VLA (arXiv 2510.10274)","url":"https://arxiv.org/html/2510.10274"}],"as_of":"2025-10","related_ids":["vision-foundation-model","vision-language-model","open-vocabulary-object-detection","visual-grounding","x-vla","backbone-network"],"name":"Florence-2","alt":"Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks (Microsoft)","abbr":"","aliases":["Florence 2","微软 Florence-2","Florence-2-base","Florence-2-large"],"one_liner":"微软开源的小型视觉基础模型，用文字提示切换描述、检测、分割等任务。","explanation":"Florence-2 是微软 2023 年 11 月发布的视觉基础模型，有 0.23B（base）和 0.77B（large）两个尺寸，MIT 协议开源。它采用序列到序列结构（图像编码器加文本解码器）：输入一张图和一个任务提示，比如 <OD> 表示目标检测、<CAPTION> 表示图像描述，模型把结果连同框的坐标都当成文本输出，一个模型就能做描述、检测、短语定位、分割、OCR 等任务。训练数据 FLD-5B 含 1.26 亿张图、54 亿条迭代自动生成的标注。因为体量小、空间定位能力强，它常被拿来当轻量 VLA 的视觉语言骨干。","example":"FLOWER（CoRL 2025）只取 Florence-2-L 的一半层作为骨干；X-VLA-0.9B 也用 Florence-Large 编码主视角图像和语言指令。","related":["视觉基础模型","视觉语言模型","开放词汇检测","视觉定位（Grounding）","X-VLA","骨干网络"]},{"id":"pre-trained-visual-representation","category":"model","sec":2,"tier":3,"sources":[{"title":"The Unsurprising Effectiveness of Pre-Trained Vision Models for Control (arXiv 2203.03580)","url":"https://arxiv.org/abs/2203.03580"},{"title":"Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence? (VC-1, arXiv 2303.18240)","url":"https://arxiv.org/abs/2303.18240"}],"as_of":"","related_ids":["vision-encoder","r3m","vc-1","mvp","vision-foundation-model","backbone-freezing"],"name":"预训练视觉表征","alt":"Pre-trained Visual Representation","abbr":"PVR","aliases":["视觉预训练表征","PVRs","预训练视觉编码器"],"one_liner":"在大规模图像或视频上预先训练好的视觉编码器，拿来给机器人策略当「眼睛」。","explanation":"预训练视觉表征指先在大量图像或视频上训练好的视觉编码器，它把相机画面压成特征向量，再交给机器人策略或导航智能体使用，编码器通常冻结或只轻微微调。它要解决的是机器人数据少、从零学视觉效率低的问题。2022 年 Parisi 等人发现，只用 ImageNet 等通用视觉数据预训练的表征，训出的控制策略能追平甚至超过直接用真值状态（物体精确位置等）训练的策略。之后出现了 R3M（用 Ego4D 人类第一视角视频训练）、MVP（掩码自编码预训练）、VC-1 等面向具身任务的 PVR。VC-1 论文在含 17 个任务的 CortexBench 上比较后发现，没有哪种 PVR 在所有任务上都最好。现在的 VLA 更多直接用 SigLIP、DINOv2 这类视觉基础模型当编码器。","example":"VC-1 用 4000 多小时第一视角视频加 ImageNet、以掩码自编码方式训练 ViT，冻结后接一个小策略网络，在 CortexBench 的行走、导航、灵巧操作、移动操作等任务上评测。","related":["视觉编码器","R3M","VC-1","MVP（掩码视觉预训练）","视觉基础模型","冻结骨干网络"]},{"id":"spatial-softmax","category":"model","sec":2,"tier":3,"sources":[{"title":"End-to-End Training of Deep Visuomotor Policies (arXiv:1504.00702, JMLR 2016)","url":"https://arxiv.org/abs/1504.00702"},{"title":"Deep Spatial Autoencoders for Visuomotor Learning (arXiv:1509.06113)","url":"https://arxiv.org/abs/1509.06113"},{"title":"Diffusion Policy (arXiv:2303.04137, HTML)","url":"https://arxiv.org/html/2303.04137"}],"as_of":"","related_ids":["convolutional-neural-network","vision-encoder","visuomotor-policy","diffusion-policy","keypoint-detection","end-to-end-training-of-deep-visuomotor-policies"],"name":"空间 Softmax","alt":"Spatial Softmax (Keypoint Pooling)","abbr":"","aliases":["Spatial Soft-Argmax","软 argmax","Soft-Argmax","特征点层","空间软最大值"],"one_liner":"把卷积特征图每个通道汇聚成一个「最亮点」的二维坐标，保留物体位置信息。","explanation":"空间 Softmax 是一种把卷积特征图变成坐标的池化层，由伯克利的 Levine、Finn、Darrell、Abbeel 在 2015 年的端到端视觉运动策略工作中提出。做法是对每个通道在所有像素位置上做 softmax，得到「这个特征出现在哪」的概率分布，再对像素坐标求期望，得到一对 (x, y)，相当于可求导的 argmax。常规分类网络用全局平均池化，会把位置信息抹掉，而机器人操作恰恰需要知道东西在哪；softmax 还会压低弱的误激活，对干扰物更稳。后来它成了模仿学习视觉编码器的常见配置，扩散策略就在 ResNet-18 末端用它替换全局平均池化。","example":"Levine 等人的策略网络在三层卷积后接空间 Softmax，最后一层 32 个通道各输出一个特征点坐标，与机器人关节状态拼接后经全连接层输出电机力矩，全网络只有约 9.2 万参数。","related":["卷积神经网络","视觉编码器","视觉运动策略","扩散策略","关键点检测","端到端视觉运动策略（引导策略搜索）"]},{"id":"text-encoder","category":"model","sec":2,"tier":2,"sources":[{"title":"Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)","url":"https://arxiv.org/abs/2405.12213"},{"title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation (arXiv 2410.07864)","url":"https://arxiv.org/abs/2410.07864"}],"as_of":"","related_ids":["language-conditioned-policy","clip","siglip","large-language-model","embedding","feature-wise-linear-modulation"],"name":"文本编码器","alt":"Text Encoder","abbr":"","aliases":["语言编码器","Language Encoder","指令编码器"],"one_liner":"把文字指令转换成向量序列，供模型其他部分使用的网络。","explanation":"文本编码器把一段文字（如「把杯子放进水槽」）切成 token 后转换成向量，作为策略或生成模型的条件输入。它通常是预训练好的语言模型，训练机器人策略时常冻结不动：Octo 用约 1.1 亿参数的 T5-base，RDT-1B 用冻结的 T5-XXL；CLIP、SigLIP 各带一个与图像对齐的文本编码器；文生图、文生视频模型也靠它读懂提示词。它把预训练得到的语言知识带进策略，帮模型区分不同指令。以大语言模型为骨干的 VLA（如 OpenVLA、π0）不再单设文本编码器，文字直接作为 token 进入语言模型本身。","example":"Octo 用冻结的 t5-base 把指令编码成 16 个语言 token，与图像 token 一起送入 Transformer；论文试过换更大的 T5 或微调它，都没有带来提升。","related":["语言条件策略","CLIP","SigLIP","大语言模型","嵌入向量","FiLM 特征调制"]},{"id":"multimodal-fusion","category":"model","sec":2,"tier":2,"sources":[{"title":"Multimodal Machine Learning: A Survey and Taxonomy (arXiv:1705.09406)","url":"https://arxiv.org/abs/1705.09406"},{"title":"Wikipedia: Multimodal learning","url":"https://en.wikipedia.org/wiki/Multimodal_learning"},{"title":"RT-1: Robotics Transformer for Real-World Control at Scale (arXiv:2212.06817)","url":"https://arxiv.org/html/2212.06817"}],"as_of":"","related_ids":["multimodal-large-language-model","cross-attention","feature-wise-linear-modulation","projector-connector","visuo-tactile-fusion","multi-sensor-fusion"],"name":"多模态融合","alt":"Multimodal Fusion","abbr":"","aliases":["模态融合","早期融合 / 中间融合 / 晚期融合","Early / Late Fusion"],"one_liner":"把图像、语言、本体状态等不同来源的信息合到一起，让模型联合使用。","explanation":"多模态融合指把不同模态（图像、文字、深度、触觉、关节状态等）的信息整合成模型能共同使用的表示。Baltrušaitis 等人 2017 年的综述把它列为多模态机器学习的五大核心挑战之一，另外四个是表征、翻译、对齐和协同学习。按融合发生的位置，常分为早期融合（一开始就把各模态特征或 token 拼在一起处理）、中间融合（各模态先分别编码，再在网络中间用交叉注意力等方式合并）和晚期融合（各模态各自出结果，最后合并决策）。具身智能天然是多模态的，VLA 要同时看相机画面、读语言指令、感知自身状态，融合方式直接影响模型能否把「拿红色杯子」这样的指令对应到正确的物体和动作上。","example":"RT-1 用 FiLM 层把语言指令的嵌入注入 EfficientNet-B3 图像编码器，让视觉特征从网络前段就带上任务信息；π0 则把图像、语言、状态和动作 token 放进同一个 Transformer，靠注意力完成融合。","related":["多模态大语言模型","交叉注意力","FiLM 特征调制","投影层","视触觉融合","多传感器融合"]},{"id":"vision-language-model","category":"model","sec":2,"tier":1,"sources":[{"title":"Vision Language Models Explained (Hugging Face blog)","url":"https://huggingface.co/blog/vlms"},{"title":"PaliGemma: A versatile 3B VLM for transfer (arXiv:2407.07726)","url":"https://arxiv.org/abs/2407.07726"},{"title":"RT-2: Vision-Language-Action Models (project page)","url":"https://robotics-transformer2.github.io/"}],"as_of":"2024-07","related_ids":["vision-language-action-model","vision-encoder","projector-connector","large-language-model","paligemma","multimodal-large-language-model"],"name":"视觉语言模型","alt":"Vision-Language Model","abbr":"VLM","aliases":["视觉语言大模型","视觉-语言模型","图文大模型"],"one_liner":"能同时看图和读文字、再用文字作答的模型，是多数 VLA 的底座。","explanation":"视觉语言模型接收图像和文本、输出文本，能描述图片、回答关于图片的问题、指出物体位置。常见结构有三部分：视觉编码器把图像变成特征，投影层把特征对齐到语言模型的输入空间，语言模型负责理解和生成文字。2023 年的 LLaVA 就是 CLIP 编码器加投影层加 Vicuna 语言模型；谷歌 2024 年开源的 PaliGemma 由 SigLIP 编码器和 Gemma-2B 组成，约 30 亿参数。VLM 从互联网图文里学到的物体、常识和空间知识正是机器人缺的，所以大多数 VLA 从 VLM 出发：RT-2 在 PaLI-X、PaLM-E 上加入机器人数据联合微调，π0 以 PaliGemma 为底座。VLM 也常单独用作分层架构的高层规划器。","example":"给 VLM 一张厨房照片问「水槽左边有什么」，它用文字回答；把输出换成动作 token、再用机器人数据训练，就得到 RT-2 这类 VLA。","related":["视觉-语言-动作模型","视觉编码器","投影层","大语言模型","PaliGemma","多模态大语言模型"]},{"id":"multimodal-large-language-model","category":"model","sec":2,"tier":2,"sources":[{"title":"A Survey on Multimodal Large Language Models (arXiv:2306.13549)","url":"https://arxiv.org/html/2306.13549v4"},{"title":"Improved Baselines with Visual Instruction Tuning (LLaVA-1.5, arXiv:2310.03744)","url":"https://arxiv.org/abs/2310.03744"}],"as_of":"","related_ids":["vision-language-model","large-language-model","native-multimodal","projector-connector","vision-language-action-model","modality-alignment"],"name":"多模态大语言模型","alt":"Multimodal Large Language Model","abbr":"MLLM","aliases":["多模态大模型","Multimodal LLM"],"one_liner":"以大语言模型为核心、能同时理解图像、视频、音频等输入的大模型。","explanation":"多模态大语言模型指以大语言模型（LLM）为「大脑」、还能接收图像、视频、音频等非文本输入的模型，2023 年 GPT-4V 让这一方向广受关注。Yin 等人的综述把典型结构拆成三块：预训练的模态编码器（如 CLIP、SigLIP 视觉编码器）、预训练的 LLM，以及连接两者的模态接口（MLP 投影层、Q-Former 或插入 LLM 的交叉注意力）。训练通常先做模态对齐预训练，再做指令微调。只处理图像和文字的 MLLM 也常叫视觉语言模型（VLM）。它对具身智能的意义在于带来互联网规模的常识和视觉理解：多数 VLA 就是在 MLLM / VLM 上加动作输出训练出来的，具身推理模型、任务规划器也多由 MLLM 微调而来。","example":"LLaVA-1.5 用 CLIP-ViT-L-336px 视觉编码器，通过一个 MLP 投影层接到语言模型上，再用视觉指令数据微调；GPT-4o、Gemini、Qwen2.5-VL 也都属于多模态大语言模型。","related":["视觉语言模型","大语言模型","原生多模态","投影层","视觉-语言-动作模型","模态对齐"]},{"id":"projector-connector","category":"model","sec":2,"tier":2,"sources":[{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/abs/2406.09246"},{"title":"Improved Baselines with Visual Instruction Tuning (LLaVA-1.5, arXiv 2310.03744)","url":"https://arxiv.org/abs/2310.03744"}],"as_of":"","related_ids":["vision-encoder","multimodal-fusion","querying-transformer","perceiver-resampler","modality-alignment","llava"],"name":"投影层","alt":"Projector / Connector","abbr":"","aliases":["连接器","适配层","模态投影器","Projector","Connector","Vision-Language Connector"],"one_liner":"把视觉编码器输出的特征映射到语言模型输入空间的小网络。","explanation":"投影层是多模态模型里连接两个预训练模块的小网络，最常见的用途是把视觉编码器输出的图像特征，映射成大语言模型能直接读入的向量。之所以需要它，是因为两边各自预训练，特征维度和分布都对不上。LLaVA 最初只用一个线性层，LLaVA-1.5 换成两层 MLP（多层感知机）后效果更好；更复杂的做法有 Q-Former、Perceiver 重采样器，它们还会顺带压缩 token 数量。训练 VLM 时常先冻结两端、只训投影层，完成模态对齐。VLA 里同样的思路也用于机器人状态和动作：用线性层或 MLP 把关节角等低维向量投影到模型的嵌入维度。","example":"OpenVLA 把 SigLIP 和 DINOv2 两路图像特征按通道拼接，再经一个两层 MLP 投影层送进 Llama 2 7B 语言模型。","related":["视觉编码器","多模态融合","Q-Former","Perceiver 重采样器","模态对齐","LLaVA（视觉指令微调架构）"]},{"id":"learnable-query","category":"model","sec":2,"tier":3,"sources":[{"title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and LLMs (arXiv:2301.12597)","url":"https://arxiv.org/abs/2301.12597"},{"title":"Octo: An Open-Source Generalist Robot Policy (arXiv:2405.12213)","url":"https://arxiv.org/html/2405.12213"},{"title":"VLA-Adapter: An Effective Paradigm for Tiny-Scale VLA Model (arXiv:2509.09372)","url":"https://arxiv.org/html/2509.09372"}],"as_of":"2025-09","related_ids":["querying-transformer","cross-attention","perceiver-resampler","action-head","octo","vla-adapter"],"name":"可学习查询","alt":"Learnable Query / Action Query","abbr":"","aliases":["动作查询","Action Query","读出 token","Readout Token","Object Query","查询向量"],"one_liner":"作为模型参数训练的一组向量，通过注意力从输入中汇总任务需要的信息。","explanation":"可学习查询是一组随机初始化、随训练更新的向量，本身不来自输入，而是在注意力计算中充当「查询」去读取输入特征，把需要的信息汇总到固定数量的输出上。2020 年 Facebook 的目标检测模型 DETR 用一组 object query，每个输出一个检测结果；2023 年 BLIP-2 的 Q-Former 用 32 个可学习查询从冻结的图像编码器中抽取视觉特征，再送进大语言模型。机器人模型里，Octo 在序列中插入读出 token：它们能看到前面的观测和任务 token，却不会被这些 token 看到，动作头在其输出上生成动作；2025 年的 VLA-Adapter 在视觉语言模型中加入 ActionQuery（实验中 64 个效果最好），专门汇总与动作相关的多模态信息交给策略网络。它的作用是把长度不定的输入压缩成固定大小、面向任务的表示。","example":"BLIP-2 中，一张图片先被视觉编码器变成数百个特征 token，Q-Former 的 32 个查询向量通过交叉注意力把它们汇总成 32 个输出，投影后接在文字前面送进大语言模型。","related":["Q-Former","交叉注意力","Perceiver 重采样器","动作头","Octo","VLA-Adapter"]},{"id":"querying-transformer","category":"model","sec":2,"tier":3,"sources":[{"title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models (arXiv 2301.12597)","url":"https://arxiv.org/abs/2301.12597"},{"title":"BLIP-2 full text (HTML, Section 3.1 Model Architecture)","url":"https://arxiv.org/html/2301.12597"}],"as_of":"","related_ids":["projector-connector","perceiver-resampler","learnable-query","cross-attention","vision-language-model","vision-encoder"],"name":"Q-Former","alt":"Querying Transformer","abbr":"Q-Former","aliases":["查询 Transformer","BLIP-2 Q-Former"],"one_liner":"BLIP-2 中用 32 个可学习查询提炼图像信息、再交给大语言模型的小模块。","explanation":"Q-Former 是 Salesforce 在 2023 年 BLIP-2 论文里提出的连接模块，用来把冻结的图像编码器和冻结的大语言模型接起来。它是一个约 1.88 亿参数、用 BERT-base 初始化的小 Transformer，输入 32 个可学习的查询向量（每个 768 维），通过交叉注意力从图像特征里读信息，输出固定大小的 32×768 特征，远小于 ViT-L/14 原始的 257×1024 特征，相当于一个信息瓶颈。训练分两阶段：先配合图像编码器学图文表征，再接上语言模型学生成。因为只训练 Q-Former 等少量参数，BLIP-2 在零样本 VQAv2 上比 Flamingo-80B 高 8.7%，可训练参数少 54 倍。InstructBLIP 等沿用了它；LLaVA、Prismatic 等则改用更简单的 MLP 投影层，OpenVLA 的底座用的也是 MLP。","example":"BLIP-2 把 ViT-g 提取的图像特征交给 Q-Former 压成 32 个向量，经一层线性投影后作为「软视觉提示」拼在 OPT 或 Flan-T5 语言模型的文本输入前面。","related":["投影层","Perceiver 重采样器","可学习查询","交叉注意力","视觉语言模型","视觉编码器"]},{"id":"perceiver-resampler","category":"model","sec":2,"tier":3,"sources":[{"title":"Flamingo: a Visual Language Model for Few-Shot Learning (arXiv:2204.14198)","url":"https://arxiv.org/abs/2204.14198"},{"title":"Perceiver: General Perception with Iterative Attention (arXiv:2103.03206)","url":"https://arxiv.org/abs/2103.03206"},{"title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation (GR-1, arXiv:2312.13139)","url":"https://arxiv.org/abs/2312.13139"}],"as_of":"","related_ids":["projector-connector","querying-transformer","learnable-query","cross-attention","visual-token","gr-1"],"name":"Perceiver 重采样器","alt":"Perceiver Resampler","abbr":"","aliases":["Perceiver","感知器重采样器"],"one_liner":"用少量可学习查询向量，把数量不定的视觉特征压成固定数目的视觉 token。","explanation":"Perceiver 重采样器是 DeepMind 2022 年在 Flamingo 视觉语言模型中提出的连接模块，思路来自 2021 年的 Perceiver 模型。视觉编码器输出的特征数量随图像分辨率、视频帧数变化，而且往往很多，直接送进语言模型太贵。重采样器预设一小组可学习的查询向量（Flamingo 中是 64 个），让它们通过交叉注意力去「读」全部视觉特征，输出固定数量的视觉 token。Flamingo 的消融实验显示它优于普通 Transformer 和 MLP 做连接。它和 BLIP-2 的 Q-Former 思路相近，都是用查询向量压缩视觉信息。机器人模型里，字节的 GR-1 就用它压缩图像 token。","example":"字节 GR-1 先用 MAE 预训练的 ViT 把每帧图像编成大量图块 token，再经 Perceiver 重采样器压成少量 token，然后与语言和机器人状态一起送入 GPT 式 Transformer，预测动作和未来画面。","related":["投影层","Q-Former","可学习查询","交叉注意力","视觉 token","字节 GR-1"]},{"id":"tokenlearner","category":"model","sec":2,"tier":3,"sources":[{"title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos? (arXiv:2106.11297)","url":"https://arxiv.org/abs/2106.11297"},{"title":"RT-1: Robotics Transformer for Real-World Control at Scale (arXiv:2212.06817)","url":"https://arxiv.org/abs/2212.06817"}],"as_of":"","related_ids":["visual-token","visual-token-pruning","rt-1","perceiver-resampler","querying-transformer","vision-transformer"],"name":"TokenLearner","alt":"TokenLearner","abbr":"","aliases":["Token 学习器"],"one_liner":"从大量图像 token 里自适应地汇总出少数几个关键 token 的模块，用来省算力。","explanation":"TokenLearner 是谷歌 Ryoo 等人 2021 年提出的模块（NeurIPS 2021），论文标题问的就是「8 个学出来的 token 能做什么」。视觉 Transformer 通常把图像切成几十到几百个块，每块一个 token，注意力计算量随 token 数平方增长。TokenLearner 根据输入内容为每个输出 token 算一张空间注意力图，用它对特征图加权汇总，把大量 token 压缩成 8 个左右，后面的层只处理这几个 token。论文在 ImageNet 和 Kinetics 等视频识别基准上以明显更少的计算量取得有竞争力的结果。它在具身领域最出名的用法是谷歌的 RT-1，用来让大模型满足实时控制的速度要求。","example":"RT-1 用 TokenLearner 把每张图的 81 个视觉 token 压到 8 个，6 帧历史一共 48 个 token 送入 Transformer；论文称这一步让推理加速约 2.4 倍。","related":["视觉 token","视觉 token 剪枝","RT-1","Perceiver 重采样器","Q-Former","视觉 Transformer"]},{"id":"paligemma","category":"model","sec":2,"tier":2,"sources":[{"title":"PaliGemma: A versatile 3B VLM for transfer (arXiv:2407.07726)","url":"https://arxiv.org/abs/2407.07726"},{"title":"Google Developers Blog: Introducing PaliGemma 2","url":"https://developers.googleblog.com/en/introducing-paligemma-2-powerful-vision-language-models-simple-fine-tuning/"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/html/2410.24164v1"}],"as_of":"2024-12","related_ids":["vision-language-model","siglip","pi0","action-expert","vision-language-action-model","open-weight-model"],"name":"PaliGemma","alt":"PaliGemma (Google open VLM)","abbr":"","aliases":["PaliGemma 2"],"one_liner":"谷歌开放权重的视觉语言模型，由 SigLIP 视觉编码器加 Gemma 语言模型组成。","explanation":"PaliGemma 是谷歌 2024 年 5 月发布的开放权重视觉语言模型（VLM），由 SigLIP-So400m 视觉编码器和 Gemma-2B 语言模型组成，总参数约 3B。它的定位不是开箱即用的聊天模型，而是便于迁移微调的基座，论文在约 40 个任务上验证了迁移效果。2024 年 12 月发布的 PaliGemma 2 换成 Gemma 2 语言模型，提供 3B、10B、28B 三种尺寸和 224、448、896 像素三种输入分辨率。它在具身领域出名，是因为 Physical Intelligence 的 π0 拿它当 VLM 骨干：体积小、推理快，又带着互联网规模的视觉语言知识，适合在后面接动作专家做成 VLA。","example":"π0 以 3B 参数的 PaliGemma 为骨干，再加一个从零初始化、约 300M 参数的动作专家，总参数 3.3B，用流匹配生成连续动作。","related":["视觉语言模型","SigLIP","π0","动作专家","视觉-语言-动作模型","开放权重"]},{"id":"qwen-vl","category":"model","sec":2,"tier":2,"sources":[{"title":"QwenLM/Qwen3-VL GitHub (News)","url":"https://github.com/QwenLM/Qwen3-VL"},{"title":"Qwen2.5-VL Technical Report (arXiv 2502.13923)","url":"https://arxiv.org/abs/2502.13923"},{"title":"Xiaomi-Robotics-0 (arXiv 2602.12684)","url":"https://arxiv.org/abs/2602.12684"}],"as_of":"2026-09","related_ids":["vision-language-model","multimodal-large-language-model","paligemma","internvl","vision-language-action-model","dynamic-native-resolution"],"name":"通义千问 Qwen-VL","alt":"Qwen-VL series (Qwen-VL / Qwen2-VL / Qwen2.5-VL / Qwen3-VL)","abbr":"Qwen-VL","aliases":["通义千问视觉语言模型","千问 VL","Qwen2-VL","Qwen2.5-VL","Qwen3-VL"],"one_liner":"阿里通义千问团队的开源视觉语言模型系列，常被用作 VLA 的骨干。","explanation":"Qwen-VL 是阿里巴巴通义千问（Qwen）团队发布的视觉语言模型系列，能看图、看视频并用文字回答。初代发布于 2023 年 8 月；Qwen2.5-VL 发布于 2025 年初，有 3B 到 72B 多种规模，支持动态分辨率输入，能用框或点标出物体位置；Qwen3-VL 从 2025 年 9 月起陆续发布，有 2B 到 32B 的稠密版和 30B-A3B、235B-A22B 两个混合专家版，原生支持 256K 上下文。权重开放、有小尺寸、定位能力强，使它常被选作 VLA 的视觉语言骨干。2026 年 2 月起的 Qwen3.5 等主线模型本身已原生支持图像输入。","example":"小米 Xiaomi-Robotics-0 以 Qwen3-VL-4B-Instruct 为视觉语言骨干，后接扩散 Transformer 生成动作；上海 AI 实验室的 InternVLA-M1 用 Qwen2.5-VL-3B 做 System 2。","related":["视觉语言模型","多模态大语言模型","PaliGemma","InternVL（书生·万象）","视觉-语言-动作模型","动态分辨率（原生分辨率输入）"]},{"id":"dynamic-native-resolution","category":"model","sec":2,"tier":3,"sources":[{"title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution (arXiv:2307.06304)","url":"https://arxiv.org/abs/2307.06304"},{"title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution (arXiv:2409.12191)","url":"https://arxiv.org/abs/2409.12191"},{"title":"Qwen/Qwen2-VL-7B-Instruct model card","url":"https://huggingface.co/Qwen/Qwen2-VL-7B-Instruct"}],"as_of":"","related_ids":["vision-encoder","vision-transformer","visual-token","qwen-vl","rotary-position-embedding","inference-latency"],"name":"动态分辨率（原生分辨率输入）","alt":"Dynamic / Native Resolution (Vision Encoder)","abbr":"","aliases":["原生分辨率","Native Resolution","Naive Dynamic Resolution","任意分辨率输入"],"one_liner":"视觉编码器按图片原尺寸切块，图越大视觉 token 越多，不再统一缩放。","explanation":"早期的视觉 Transformer 和 CLIP 类编码器要求把图片统一缩放或裁剪成固定大小（如 224×224），会丢失细节或让长宽比失真。动态分辨率保留原图尺寸和长宽比，直接切成固定大小的图块，图越大 token 越多。谷歌 2023 年的 NaViT 用「序列打包」把不同尺寸的图拼进同一批训练；阿里 2024 年的 Qwen2-VL 提出 Naive Dynamic Resolution，在视觉编码器里用二维旋转位置编码记录每个图块的行列位置，从而处理任意分辨率。好处是小图省算力、大图保细节，代价是 token 数随分辨率增长。用它做 VLA 骨干时通常会限定 token 数上下限，以控制推理延迟。","example":"Qwen2-VL 大致每 28×28 像素对应一个视觉 token，默认每张图 4 到 16384 个 token，可用 min_pixels、max_pixels 设定范围来平衡速度和显存。","related":["视觉编码器","视觉 Transformer","视觉 token","通义千问 Qwen-VL","旋转位置编码","推理延迟"]},{"id":"prismatic-vlms","category":"model","sec":2,"tier":3,"sources":[{"title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models (arXiv 2402.07865)","url":"https://arxiv.org/html/2402.07865"},{"title":"TRI-ML/prismatic-vlms (GitHub)","url":"https://github.com/TRI-ML/prismatic-vlms"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/html/2406.09246"}],"as_of":"2024-07","related_ids":["openvla","vision-language-model","dinov2","siglip","projector-connector","llama"],"name":"Prismatic VLM","alt":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","abbr":"","aliases":["Prismatic VLMs","Prismatic-7B"],"one_liner":"斯坦福与丰田研究院系统比较 VLM 设计的研究和开源模型，OpenVLA 的底座。","explanation":"Prismatic VLM 出自斯坦福大学和丰田研究院（TRI）的论文，Siddharth Karamcheti 等人发表于 ICML 2024。作者搭了统一的训练与评测框架（12 个基准，覆盖视觉问答、物体定位和挑战集），逐项比较视觉语言模型的设计选择：用哪个视觉编码器、要不要先单独做对齐预训练、语言模型用基座版还是指令微调版等。主要结论：跳过单独的对齐阶段、只做单阶段训练，效果不差还省 20%–25% 算力；把 DINOv2 和 SigLIP 的特征拼起来，定位类任务提升明显；指令微调版语言模型没有显著优势。据此训出的 7B–13B 模型超过同期的 InstructBLIP 和 LLaVA v1.5，代码和几十个检查点都已开源。它和具身智能的关系在于 OpenVLA 直接以 Prismatic-7B 为底座，OpenVLA 论文认为这种融合视觉编码器有助于空间推理。","example":"OpenVLA 的底座 Prismatic-7B 由约 6 亿参数的 DINOv2 + SigLIP 融合视觉编码器、2 层 MLP 投影层和 Llama 2 7B 语言模型组成。","related":["OpenVLA","视觉语言模型","DINOv2","SigLIP","投影层","Llama"]},{"id":"nvidia-eagle-vlm","category":"model","sec":2,"tier":3,"sources":[{"title":"GitHub: NVlabs/EAGLE","url":"https://github.com/NVlabs/EAGLE"},{"title":"NVIDIA GEAR: GR00T N1.5","url":"https://research.nvidia.com/labs/gear/gr00t-n1_5/"},{"title":"GitHub: NVIDIA/Isaac-GR00T","url":"https://github.com/NVIDIA/Isaac-GR00T"}],"as_of":"2026-09","related_ids":["nvidia-isaac-gr00t-n1","vision-language-model","vision-encoder","dual-system-architecture","nvidia-cosmos-reason","vision-language-action-model"],"name":"Eagle（英伟达 VLM）","alt":"NVIDIA Eagle VLM","abbr":"","aliases":["Eagle 2","Eagle 2.5","NVEagle"],"one_liner":"英伟达开源的视觉语言模型系列，GR00T N1 到 N1.6 都用它当视觉语言主干。","explanation":"Eagle 是英伟达研究团队的开源视觉语言模型（VLM）系列。初代 Eagle（2024 年 8 月）研究如何组合多个视觉编码器，发现把几个互补编码器的视觉 token 直接拼接就很有效；Eagle 2（2025 年 1 月）公开了后训练数据策略的构建细节，有 1B、2B、9B 等规模；Eagle 2.5（2025 年 4 月发布技术报告）面向长上下文，支持最长 128K token，加强长视频和高分辨率图像理解。它在具身领域的主要身份是 GR00T 的「系统 2」视觉语言主干：GR00T N1 用 Eagle 2，N1.5 和 N1.6 用 Eagle 2.5 系列的改进版。据 GR00T 官方仓库，N1.7 起改用 Cosmos-Reason2-2B。","example":"GR00T N1.5 以 Eagle 2.5 为起点，针对物体定位和物理理解进一步微调，并在预训练和微调阶段都冻结这个 VLM、不再更新它的参数。","related":["GR00T N1 系列","视觉语言模型","视觉编码器","快慢双系统","Cosmos Reason","视觉-语言-动作模型"]},{"id":"native-multimodal","category":"model","sec":2,"tier":2,"sources":[{"title":"Google Blog: Introducing Gemini","url":"https://blog.google/technology/ai/google-gemini-ai/"},{"title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models (arXiv:2405.09818)","url":"https://arxiv.org/abs/2405.09818"},{"title":"Meta AI Blog: The Llama 4 herd","url":"https://ai.meta.com/blog/llama-4-multimodal-intelligence/"}],"as_of":"2025-04","related_ids":["multimodal-large-language-model","unified-multimodal-model","multimodal-fusion","visual-token","bagel","world-action-model"],"name":"原生多模态","alt":"Native Multimodal (Model)","abbr":"","aliases":["原生多模态模型","Natively Multimodal"],"one_liner":"从预训练一开始就同时学多种模态，而不是给语言模型后接视觉模块。","explanation":"原生多模态指模型从预训练阶段起就用文本、图像、音频、视频等数据一起训练，各模态在同一个骨干网络里处理。它对应的是「拼接式」做法：先分别训好视觉编码器和语言模型，再用投影层把两者接起来补训。谷歌 2023 年 12 月发布 Gemini 时强调它是原生多模态；Meta 2024 年的 Chameleon 把图像也离散成 token，与文字从头混合训练（早期融合）；2025 年 4 月的 Llama 4 同样宣称原生多模态、采用早期融合。支持者认为这样各模态结合得更深，也更容易同时做到理解和生成；代价是训练成本高、各模态数据配比难调。具身领域的统一多模态模型、把视频和动作放进同一序列训练的世界动作模型，也在沿这个思路走。","example":"Gemini 从一开始就用文本、图像、音频、视频等数据联合预训练；而 LLaVA 是在训好的语言模型前面接一个视觉编码器再补训，属于拼接式。","related":["多模态大语言模型","统一多模态模型","多模态融合","视觉 token","BAGEL","世界动作模型"]},{"id":"unified-multimodal-model","category":"model","sec":2,"tier":3,"sources":[{"title":"Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities (arXiv:2505.02567)","url":"https://arxiv.org/abs/2505.02567"},{"title":"BAGEL (ByteDance-Seed GitHub)","url":"https://github.com/ByteDance-Seed/Bagel"},{"title":"WorldVLA: Towards Autoregressive Action World Model (arXiv:2506.21539)","url":"https://arxiv.org/abs/2506.21539"}],"as_of":"2025-06","related_ids":["multimodal-large-language-model","native-multimodal","bagel","hybrid-autoregressive-diffusion-architecture","world-model","worldvla"],"name":"统一多模态模型","alt":"Unified Multimodal Model","abbr":"UMM","aliases":["理解生成一体化模型","统一理解与生成模型","Unified Multimodal Understanding and Generation Model"],"one_liner":"一个模型既能看懂图像视频、回答问题，又能生成或编辑图像视频。","explanation":"统一多模态模型指把多模态理解（看图回答问题）和视觉生成（按文字画图、改图、生成视频）放进同一个模型。过去两条路线是分开的：理解多用自回归的多模态大语言模型，生成多用扩散模型。GPT-4o 的原生图像生成让这个方向受到广泛关注，开源代表有字节 Seed 2025 年 5 月发布的 BAGEL（混合 Transformer 专家结构，70 亿激活参数、140 亿总参数）。按生成方式大致分为自回归、扩散、自回归-扩散混合三类。具身智能关心它，是因为同一个模型如果既能理解场景，又能想象「做完这个动作画面会变成什么样」，就可以同时充当策略和世界模型。","example":"阿里达摩院的 WorldVLA 把 VLA 和世界模型放进同一个自回归框架：既根据画面输出动作，也根据画面和动作预测下一帧图像，论文报告两者互相促进，效果好于单独的动作模型和世界模型。","related":["多模态大语言模型","原生多模态","BAGEL","自回归-扩散混合架构","世界模型","WorldVLA"]},{"id":"bagel","category":"model","sec":2,"tier":3,"sources":[{"title":"BAGEL: Emerging Properties in Unified Multimodal Pretraining (arXiv 2505.14683)","url":"https://arxiv.org/abs/2505.14683"},{"title":"ByteDance-Seed/Bagel GitHub","url":"https://github.com/ByteDance-Seed/Bagel"},{"title":"BAGEL 论文 HTML 版","url":"https://arxiv.org/html/2505.14683"}],"as_of":"2025-05","related_ids":["unified-multimodal-model","mixture-of-transformers","siglip","variational-autoencoder","world-model","bytedance-seed"],"name":"BAGEL","alt":"BAGEL: Emerging Properties in Unified Multimodal Pretraining (ByteDance Seed)","abbr":"","aliases":["BAGEL-7B-MoT"],"one_liner":"字节 Seed 开源的统一多模态模型，同一个模型既能看懂图也能生成和编辑图","explanation":"BAGEL 是字节跳动 Seed 团队 2025 年 5 月开源的统一多模态基础模型，代码和权重以 Apache 2.0 协议发布，一个模型同时做图文理解、文生图和图像编辑。它以 Qwen2.5 大语言模型为基础，采用混合 Transformer（MoT）结构：理解专家和生成专家各有一套参数，但每层所有 token 共享自注意力，激活参数 7B、总参数 14B；理解侧用 SigLIP2 视觉编码器，生成侧用 FLUX 的 VAE 把图像压到潜空间。模型在数万亿 token 的图文、视频、网页交错数据上预训练，论文报告随规模增大出现了自由形式图像编辑、未来帧预测、视角旋转和「世界导航」等能力。它展示了把理解和生成放进同一个模型的做法，和具身方向的统一多模态模型、世界模型路线相关。","example":"给 BAGEL 一张图和一句修改指令，它能直接输出编辑后的图片；给出前进、转向等导航指令，它能生成视角移动后的画面。","related":["统一多模态模型","混合 Transformer 架构","SigLIP","变分自编码器","世界模型","字节跳动 Seed"]},{"id":"generative-model","category":"model","sec":3,"tier":2,"sources":[{"title":"Google Machine Learning: Background: What is a Generative Model?","url":"https://developers.google.com/machine-learning/gan/generative"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["diffusion-model","flow-matching","variational-autoencoder","generative-adversarial-network","action-multimodality","diffusion-policy"],"name":"生成模型","alt":"Generative Model","abbr":"","aliases":["生成式模型"],"one_liner":"学习数据的概率分布、能从中采样出新数据的模型。","explanation":"生成模型学习数据本身的分布 p(x)，或给定条件时的分布 p(x|c)，因此能造出新样本；与之相对的判别模型只学 p(y|x)，负责分类或打分。常见的生成模型有自回归模型（逐个预测下一个 token，如 GPT）、变分自编码器（VAE）、生成对抗网络（GAN）、扩散模型和流匹配。在具身智能里它主要用在三处：一是生成动作，示范数据中同一场景常有多种合理做法（动作多峰性），扩散策略、π0 等用扩散或流匹配建模整个动作分布，而不是回归一个平均值；二是生成未来画面，即世界模型和视频预测模型；三是生成训练数据，比如用视频生成模型合成机器人演示。","example":"示范里一半从左绕开障碍、一半从右绕：直接回归的模型会输出两者的平均，径直撞上去；扩散策略这类生成模型会采样出「从左绕」或「从右绕」中的一种。","related":["扩散模型","流匹配","变分自编码器","生成对抗网络","动作多峰性","扩散策略"]},{"id":"autoencoder","category":"model","sec":3,"tier":2,"sources":[{"title":"Deep Learning, Chapter 14: Autoencoders (Goodfellow, Bengio, Courville)","url":"https://www.deeplearningbook.org/contents/autoencoders.html"},{"title":"World Models (Ha & Schmidhuber, interactive article)","url":"https://worldmodels.github.io/"}],"as_of":"","related_ids":["variational-autoencoder","conditional-variational-autoencoder","masked-autoencoder","vector-quantized-variational-autoencoder","latent-space","latent-diffusion-model"],"name":"自编码器","alt":"Autoencoder","abbr":"AE","aliases":["自动编码器"],"one_liner":"先把输入压成短向量、再还原回来，借此学到数据要点的网络。","explanation":"自编码器由编码器和解码器组成：编码器把输入（如一张图片）压缩成低维向量，解码器再从这个向量重建输入，训练目标是让重建结果尽量接近原输入，不需要人工标注。中间向量比输入小，网络被迫只保留最关键的信息，因此常用于降维和特征学习。这个思路在神经网络领域已有几十年历史（LeCun 1987 等）。常见变体有：变分自编码器（VAE）让中间向量服从概率分布，从而能生成新样本；掩码自编码器（MAE）遮住部分输入再重建，用于视觉预训练；VQ-VAE 把向量换成码本里的离散编号。具身智能里，潜在扩散模型、视频分词器、潜在动作模型都靠它把高维数据压进潜在空间再处理。","example":"《World Models》用卷积 VAE 把赛车游戏的每帧画面压成 32 维向量，后面的预测模型只在这 32 个数上工作。","related":["变分自编码器","条件变分自编码器","掩码自编码器","向量量化变分自编码器","潜在空间","潜在扩散模型"]},{"id":"latent-space","category":"model","sec":3,"tier":2,"sources":[{"title":"Wikipedia: Latent space","url":"https://en.wikipedia.org/wiki/Latent_space"},{"title":"High-Resolution Image Synthesis with Latent Diffusion Models (arXiv:2112.10752)","url":"https://arxiv.org/abs/2112.10752"}],"as_of":"","related_ids":["embedding","variational-autoencoder","latent-diffusion-model","latent-world-model","latent-action","representation-learning"],"name":"潜在空间","alt":"Latent Space","abbr":"","aliases":["隐空间","潜空间","隐变量空间","Latent Feature Space"],"one_liner":"模型把原始数据压缩后得到的内部表示空间，相似的东西在里面挨得近。","explanation":"潜在空间是神经网络内部用来表示数据的向量空间。编码器把图像、声音、动作这类高维原始数据压成维数低得多的向量，这些向量所在的空间就叫潜在空间；训练得当时，意思相近的样本在里面距离也近。它的价值在于省算力、抓要点：在潜在空间里做生成、预测或规划，比直接处理像素便宜得多，也不容易被无关细节干扰。自编码器、变分自编码器（VAE，能采样生成新数据的自编码器）都靠它工作。具身智能里的常见用法有：潜在扩散模型在潜在空间里去噪生成图像和视频，隐空间世界模型在潜在状态上预测未来，潜在动作模型从无动作标签的视频里学出抽象的「动作编码」。","example":"潜在扩散模型（Stable Diffusion 的基础）先用预训练自编码器把图片压成小得多的潜在表示，在这个空间里做扩散去噪，最后再解码回像素，训练和推理开销比直接在像素上做扩散小得多。","related":["嵌入向量","变分自编码器","潜在扩散模型","隐空间世界模型","潜在动作","表征学习"]},{"id":"variational-autoencoder","category":"model","sec":3,"tier":2,"sources":[{"title":"Auto-Encoding Variational Bayes (arXiv 1312.6114)","url":"https://arxiv.org/abs/1312.6114"},{"title":"High-Resolution Image Synthesis with Latent Diffusion Models (arXiv 2112.10752)","url":"https://arxiv.org/abs/2112.10752"}],"as_of":"","related_ids":["autoencoder","latent-space","conditional-variational-autoencoder","vector-quantized-variational-autoencoder","latent-diffusion-model","video-tokenizer"],"name":"变分自编码器","alt":"Variational Autoencoder","abbr":"VAE","aliases":["变分自动编码器"],"one_liner":"把数据压成服从某种分布的潜变量，并能从中采样还原或生成数据的模型。","explanation":"变分自编码器由 Kingma 和 Welling 于 2013 年提出，是一种生成模型。编码器把输入（如一张图）压成低维潜变量，但输出的是一个分布（均值和方差）而不是一个固定点；解码器从这个分布里采样，再还原出数据。训练时同时要求重建得像、潜在分布接近标准正态分布，后者让潜在空间连续平滑，随便采一个点也能解码出合理结果。靠重参数化技巧，这种带随机采样的模型也能用梯度下降训练。它今天最常见的用途是给扩散模型当压缩器：Stable Diffusion、通义万相 Wan 等先用 VAE 把像素压到潜在空间再去噪；机器人里 ACT 用它的条件版本 CVAE 来刻画演示动作的多样性。","example":"Stable Diffusion 的 VAE 把 512×512 的彩色图片压成 64×64×4 的潜变量，扩散模型只在这个小得多的空间里去噪，最后再由解码器还原成图片。","related":["自编码器","潜在空间","条件变分自编码器","向量量化变分自编码器","潜在扩散模型","视频分词器"]},{"id":"conditional-variational-autoencoder","category":"model","sec":3,"tier":2,"sources":[{"title":"Learning Structured Output Representation using Deep Conditional Generative Models (NeurIPS 2015)","url":"https://papers.nips.cc/paper_files/paper/2015/hash/8d55a249e6baa5c06772297520da2051-Abstract.html"},{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv:2304.13705)","url":"https://arxiv.org/html/2304.13705"}],"as_of":"","related_ids":["variational-autoencoder","action-chunking-with-transformers","action-multimodality","action-chunking","generative-model","autoencoder"],"name":"条件变分自编码器","alt":"Conditional Variational Autoencoder","abbr":"CVAE","aliases":["条件 VAE","Conditional VAE"],"one_liner":"给定条件时学习输出分布的 VAE，同一输入能生成多种合理结果。","explanation":"条件变分自编码器是变分自编码器（VAE）的扩展：编码器和解码器都额外接收一个条件（如当前观测），学的是「给定条件时输出的分布」，而不是单一答案。它由 Sohn、Lee、Yan 在 NeurIPS 2015 提出，最初用于图像分割这类结构化输出预测。训练时编码器看到真实输出，把它的「风格」压成隐变量 z，解码器根据条件和 z 重建输出；推理时改从先验里取 z。模仿学习用它应对演示的多样性：同一场景下人可能走不同轨迹，普通回归会把几种做法平均成一个错误动作。ACT（2023）的做法是：编码器输入关节位置和目标动作序列得到 z，测试时丢掉编码器，把 z 设为先验均值 0。","example":"ACT 用 CVAE 一次预测 100 步的动作块，只用约 10 分钟演示数据，就在低成本双臂上完成精细任务，成功率 80%–90%。","related":["变分自编码器","ACT","动作多峰性","动作分块","生成模型","自编码器"]},{"id":"generative-adversarial-network","category":"model","sec":3,"tier":2,"sources":[{"title":"Generative Adversarial Networks (Goodfellow et al., arXiv 1406.2661)","url":"https://arxiv.org/abs/1406.2661"},{"title":"AMP: Adversarial Motion Priors for Stylized Physics-Based Character Control (arXiv 2104.02180)","url":"https://arxiv.org/abs/2104.02180"}],"as_of":"","related_ids":["generative-model","generative-adversarial-imitation-learning","adversarial-motion-priors","diffusion-model","variational-autoencoder","entropy-collapse-mode-collapse"],"name":"生成对抗网络","alt":"Generative Adversarial Network (GAN)","abbr":"GAN","aliases":["对抗生成网络","GAN"],"one_liner":"生成器造假、判别器辨真假，两者对抗训练来生成逼真数据的模型。","explanation":"生成对抗网络由 Ian Goodfellow 等人在 2014 年提出，是一类生成模型。它包含两个网络：生成器把随机噪声变成样本，判别器判断样本来自真实数据还是生成器。两者轮流训练，生成器努力骗过判别器，判别器努力识破，理想情况下生成器最终学会真实数据的分布。GAN 一次前向就能出图，速度快，但训练不稳定，还容易模式坍缩（只生成少数几种样本），近年在图像和视频生成上大多被扩散模型取代。它的「判别器打分」思想在机器人里仍很常用：生成对抗模仿学习（GAIL）和对抗运动先验（AMP）都让判别器判断机器人动作像不像示范数据，再把结果当作奖励交给强化学习。","example":"AMP 训练仿真人形角色时，判别器对比策略做出的动作片段和动捕数据，越像真人奖励越高，角色因此学出自然的走跑姿态。","related":["生成模型","生成对抗模仿学习","对抗运动先验","扩散模型","变分自编码器","熵坍缩 / 模式坍缩"]},{"id":"normalizing-flow","category":"model","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Flow-based generative model","url":"https://en.wikipedia.org/wiki/Flow-based_generative_model"},{"title":"Variational Inference with Normalizing Flows (arXiv:1505.05770)","url":"https://arxiv.org/abs/1505.05770"},{"title":"Flow Matching for Generative Modeling (arXiv:2210.02747)","url":"https://arxiv.org/abs/2210.02747"}],"as_of":"","related_ids":["generative-model","flow-matching","variational-autoencoder","diffusion-model","generative-adversarial-network","velocity-field"],"name":"标准化流","alt":"Normalizing Flow","abbr":"","aliases":["归一化流","流模型","Flow-based Generative Model"],"one_liner":"用一串可逆变换把简单分布变成复杂分布、能精确算出概率的生成模型。","explanation":"标准化流是一类生成模型：从标准高斯这类简单分布出发，经过一串可逆的神经网络变换，得到复杂的数据分布。因为每步都可逆，用概率论的变量替换公式就能精确算出样本的似然，直接用最大似然训练；生成时采一个噪声、正向过一遍网络即可。代价是每层必须可逆，且雅可比行列式（衡量变换把体积放大缩小多少）要好算，网络结构受限。2015 年 Rezende 与 Mohamed 把它用于变分推断后广为人知，代表模型有 NICE、RealNVP、Glow。2018 年的连续标准化流把变换写成常微分方程；流匹配正是训练连续标准化流的一种免模拟方法，两者名字里的「流」同源。","example":"Glow（2018）用耦合层和可逆 1×1 卷积搭出流模型，既能生成逼真的人脸图像，又能给出每张图的精确对数似然。","related":["生成模型","流匹配","变分自编码器","扩散模型","生成对抗网络","速度场"]},{"id":"vector-quantization","category":"model","sec":3,"tier":3,"sources":[{"title":"Wikipedia: Vector quantization","url":"https://en.wikipedia.org/wiki/Vector_quantization"},{"title":"SoundStream: An End-to-End Neural Audio Codec (arXiv:2107.03312)","url":"https://arxiv.org/abs/2107.03312"},{"title":"Behavior Generation with Latent Actions (VQ-BeT, arXiv:2403.03181)","url":"https://arxiv.org/abs/2403.03181"}],"as_of":"","related_ids":["vector-quantized-variational-autoencoder","action-tokenizer","finite-scalar-quantization","tokenizer","behavior-transformer","latent-action"],"name":"向量量化","alt":"Vector Quantization","abbr":"VQ","aliases":["矢量量化","码本","Codebook","残差向量量化","Residual VQ","RVQ"],"one_liner":"准备一本「码本」，把连续向量换成离它最近的码字编号，变成离散 token。","explanation":"向量量化是信号处理里的经典压缩技术，1980 年代初由 Robert Gray 等人系统发展。做法是准备一组代表向量，叫码本，其中每个向量叫码字；对任意输入向量，找到离它最近的码字，只记下它的编号。它和 k-means 聚类本质相同，码字就是聚类中心。深度学习里，VQ 是把图像、音频、动作等连续信号变成离散 token 的主要手段之一，变成 token 后就能套用语言模型的「下一个 token 预测」来建模。残差向量量化（RVQ）用多本码本逐级量化上一级剩下的误差，谷歌 2021 年的 SoundStream 音频编解码器用它让同一个模型在 3–18 kbps 之间切换码率。","example":"VQ-BeT（ICML 2024）用分层的残差向量量化把机器人的连续动作编码成离散 token，取代前作 BeT 的 k-means 聚类，论文报告推理速度比扩散策略快约 5 倍。","related":["向量量化变分自编码器","动作分词器","有限标量量化","分词器","BeT / VQ-BeT","潜在动作"]},{"id":"vector-quantized-variational-autoencoder","category":"model","sec":3,"tier":3,"sources":[{"title":"Neural Discrete Representation Learning (arXiv:1711.00937)","url":"https://arxiv.org/abs/1711.00937"},{"title":"Genie: Generative Interactive Environments (arXiv:2402.15391)","url":"https://arxiv.org/abs/2402.15391"}],"as_of":"","related_ids":["variational-autoencoder","vector-quantization","video-tokenizer","latent-action-model","genie","lapa"],"name":"向量量化变分自编码器","alt":"Vector-Quantized Variational Autoencoder","abbr":"VQ-VAE","aliases":["矢量量化变分自编码器","VQ-VAE-2"],"one_liner":"编码结果被码本量化成离散编号的自编码器，常用来把图像、视频、动作变成 token。","explanation":"VQ-VAE 由 DeepMind 的 van den Oord、Vinyals、Kavukcuoglu 在 2017 年提出（NeurIPS 2017）。它和变分自编码器（VAE，把数据压成连续隐变量再还原的生成模型）有两点不同：编码器输出要先经过向量量化，换成码本里最近的码字，所以隐变量是离散的；先验不是固定的高斯分布，而是另外训练一个自回归模型（如 PixelCNN）去学。量化这一步不可求导，训练时用直通估计把解码器端的梯度直接拷给编码器，再加承诺损失让编码器输出靠近码字。它还缓解了 VAE 常见的后验坍缩。后来很多图像、视频分词器和潜在动作模型都建立在它之上。","example":"谷歌 DeepMind 的 Genie 用 VQ-VAE 把视频压成离散 token，它的潜在动作模型也用 VQ-VAE 式目标，从没有动作标签的游戏视频里学出只有 8 个码字的离散潜在动作，让人可以逐帧「操控」生成的世界。","related":["变分自编码器","向量量化","视频分词器","潜在动作模型","Genie（初代）","LAPA"]},{"id":"finite-scalar-quantization","category":"model","sec":3,"tier":3,"sources":[{"title":"Finite Scalar Quantization: VQ-VAE Made Simple (Mentzer et al., arXiv 2309.15505)","url":"https://arxiv.org/abs/2309.15505"},{"title":"NVIDIA Cosmos Tokenizer (GitHub)","url":"https://github.com/NVIDIA/Cosmos-Tokenizer"}],"as_of":"","related_ids":["vector-quantization","vector-quantized-variational-autoencoder","action-tokenizer","video-tokenizer","token","nvidia-cosmos"],"name":"有限标量量化","alt":"Finite Scalar Quantization","abbr":"FSQ","aliases":["FSQ 量化"],"one_liner":"把连续向量的每一维直接取整到几个固定档位，代替 VQ 码本的离散化方法。","explanation":"有限标量量化由 Google 研究团队的 Mentzer 等人 2023 年提出，论文副标题就叫「VQ-VAE Made Simple」。传统向量量化（VQ）要维护一本可学习的码本，训练中常出现大量码字从没被用到的「码本坍缩」，需要承诺损失、熵惩罚等额外技巧。FSQ 改为先把特征投影到很少几维（通常不到 10 维），每一维限制范围后直接四舍五入到几个固定档位，各维档位的组合就构成隐式码本。不用学码本，也不会坍缩，在图像生成、深度估计等任务上效果与 VQ 相当。它常用来把图像、视频或动作序列变成离散 token，交给自回归 Transformer 处理。","example":"英伟达 Cosmos Tokenizer 的离散版本用 FSQ 把视频压成离散 token，索引取值范围约 6.4 万（64K）。","related":["向量量化","向量量化变分自编码器","动作分词器","视频分词器","token（词元）","Cosmos"]},{"id":"diffusion-model","category":"model","sec":4,"tier":1,"sources":[{"title":"Denoising Diffusion Probabilistic Models (arXiv 2006.11239)","url":"https://arxiv.org/abs/2006.11239"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"},{"title":"Diffusion model - Wikipedia","url":"https://en.wikipedia.org/wiki/Diffusion_model"}],"as_of":"","related_ids":["diffusion-policy","denoising-diffusion-probabilistic-model","flow-matching","action-multimodality","denoising-steps","generative-model"],"name":"扩散模型","alt":"Diffusion Model","abbr":"","aliases":["扩散","Diffusion","去噪扩散模型"],"one_liner":"先学会一步步去掉噪声，再从纯噪声出发逐步生成数据的生成模型。","explanation":"扩散模型包含两个过程：前向过程不断往真实数据里加高斯噪声，直到变成纯噪声；反向过程训练神经网络预测并去掉每一步的噪声。生成时从随机噪声出发反复去噪，得到新样本。这一思路 2015 年由 Sohl-Dickstein 等人提出，2020 年 Ho 等人的 DDPM 让它真正好用，之后成为 Stable Diffusion 等图像、视频生成模型的主流方法。机器人领域用它生成动作：2023 年的扩散策略以当前观测为条件，把一段未来动作去噪生成出来，能表达同一场景下几种都合理的做法（动作多峰性），这是回归一个平均值做不到的。代价是要多步去噪，推理偏慢。","example":"扩散策略（Chi 等，2023）在 4 个基准的 12 个操作任务上，平均成功率比此前方法高 46.9%；在推 T 形块任务中，面对从左绕和从右绕两种都合理的推法，它能学会这两种模式，而不是取平均。","related":["扩散策略","去噪扩散概率模型","流匹配","动作多峰性","去噪步数","生成模型"]},{"id":"denoising-diffusion-probabilistic-model","category":"model","sec":4,"tier":2,"sources":[{"title":"Denoising Diffusion Probabilistic Models (arXiv 2006.11239)","url":"https://arxiv.org/abs/2006.11239"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["diffusion-model","denoising-diffusion-implicit-model","noise-schedule","denoising-steps","u-net","diffusion-policy"],"name":"去噪扩散概率模型","alt":"Denoising Diffusion Probabilistic Model","abbr":"DDPM","aliases":["DDPM 扩散模型"],"one_liner":"2020 年提出的扩散模型经典形式：逐步加噪，再学会逐步去噪来生成数据。","explanation":"去噪扩散概率模型由 Jonathan Ho、Ajay Jain 和 Pieter Abbeel 在 2020 年提出，是今天各类扩散模型的基础版本。它定义两个过程：前向过程按固定的噪声调度（每一步加多少噪声的时间表）往真实图片里一点点加高斯噪声，直到变成纯噪声；反向过程训练一个神经网络，在每一步预测加进去的噪声并把它减掉。训练目标很简单，就是预测噪声与真实噪声的均方误差。生成时从纯噪声出发，一步步去噪得到新样本。论文取 T=1000 步、用 U-Net 作网络，在 CIFAR-10 上 FID 达到 3.17。缺点是采样要跑很多步，后来的 DDIM 等方法把步数大幅压缩。机器人领域的 Diffusion Policy 就是把这套方法用在动作序列上。","example":"Diffusion Policy 训练时用 100 步扩散过程给示范动作序列加噪，让网络学会把噪声逐步还原成动作；实机部署时改用 DDIM 只采样 10 步，在 RTX 3080 上推理约 0.1 秒。","related":["扩散模型","去噪扩散隐式模型","噪声调度","去噪步数","U-Net","扩散策略"]},{"id":"flow-matching","category":"model","sec":4,"tier":1,"sources":[{"title":"Flow Matching for Generative Modeling (arXiv 2210.02747)","url":"https://arxiv.org/abs/2210.02747"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/abs/2410.24164"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/abs/2503.14734"}],"as_of":"","related_ids":["diffusion-model","velocity-field","rectified-flow","flow-matching-loss","pi0","action-expert"],"name":"流匹配","alt":"Flow Matching","abbr":"FM","aliases":["条件流匹配","Conditional Flow Matching","CFM"],"one_liner":"学习一个把噪声平滑搬运成真实数据的速度场，再沿它积分生成样本的方法。","explanation":"流匹配由 Meta 的 Lipman 等人在 2022 年提出（发表于 ICLR 2023），用来训练「连续归一化流」这类把噪声连续变形成数据的生成模型。做法是：在噪声样本和真实样本之间人为规定一条路径（最常用直线插值），训练网络预测路径上每一点的速度（速度场），损失就是预测速度与目标速度的均方误差，训练时不需要模拟整条轨迹。生成时从噪声出发，沿网络给出的速度做数值积分，机器人动作生成里一般几步到十步就够（π0 用 10 步，GR00T N1 用 4 步）。它和扩散模型同属「从噪声逐步变成数据」一类，扩散可看作它的一种特定路径；直线路径往往训练更快、采样所需步数更少，与同期的整流流思路相近。机器人领域 π0 用它在动作专家里生成动作块，GR00T N1 等也采用了它。","example":"π0 推理时从高斯噪声出发，做 10 步积分（每步 0.1）把噪声变成 50 步长的动作块；训练时的损失就是网络预测的速度场与目标速度之差的平方。","related":["扩散模型","速度场","整流流","流匹配损失","π0","动作专家"]},{"id":"velocity-field","category":"model","sec":4,"tier":3,"sources":[{"title":"Flow Matching for Generative Modeling (arXiv:2210.02747)","url":"https://arxiv.org/abs/2210.02747"},{"title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow (arXiv:2209.03003)","url":"https://arxiv.org/abs/2209.03003"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"","related_ids":["flow-matching","rectified-flow","flow-matching-loss","diffusion-flow-samplers","action-expert","pi0"],"name":"速度场","alt":"Velocity Field","abbr":"","aliases":["向量场","速度向量场","Vector Field"],"one_liner":"流匹配模型学的函数：告诉样本在每个时刻该往哪个方向、以多快速度移动。","explanation":"速度场是流匹配（Flow Matching）和整流流（Rectified Flow）这类生成模型真正要学的东西，2022 年 Lipman 等人和 Liu 等人的论文分别用它做生成建模。它是一个函数 v(x, t)：输入当前样本 x 和时间 t（0 是纯噪声，1 是真实数据），输出 x 此刻该移动的方向和快慢。训练时，网络去回归一条事先定好的「噪声→数据」路径上的速度，最常用直线路径，目标速度就是「数据减噪声」，不用模拟整个生成过程；推理时从随机噪声出发，用 ODE 求解器（如欧拉法）沿速度场积分几步就得到样本。路径越直，需要的步数越少，所以通常比传统扩散模型采样更快。具身里 π0 的动作专家预测的就是动作块的速度场。","example":"π0 推理时先采样一段高斯噪声当作「动作块」，动作专家根据当前图像、指令和机器人状态预测速度场，用前向欧拉法积分 10 步，把噪声推成 50 步长的连续动作序列。","related":["流匹配","整流流","流匹配损失","扩散 / 流采样器（ODE / SDE 求解器）","动作专家","π0"]},{"id":"rectified-flow","category":"model","sec":4,"tier":3,"sources":[{"title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow (arXiv 2209.03003)","url":"https://arxiv.org/abs/2209.03003"},{"title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis (SD3, arXiv 2403.03206)","url":"https://arxiv.org/abs/2403.03206"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/html/2410.24164"}],"as_of":"","related_ids":["flow-matching","velocity-field","diffusion-model","one-step-generation","consistency-model","pi0"],"name":"整流流","alt":"Rectified Flow","abbr":"RF","aliases":["修正流","矫正流"],"one_liner":"让噪声沿直线走向数据的生成模型，路径越直，采样需要的步数越少。","explanation":"整流流由 Xingchao Liu、Chengyue Gong 和 Qiang Liu 在 2022 年论文「Flow Straight and Fast」中提出。它把噪声样本和数据样本用直线连起来，训练网络预测沿这条直线的速度，生成时从噪声出发解一个常微分方程（ODE）走到数据。训练目标只是简单的最小二乘回归，和同期 Lipman 等人提出的流匹配在取直线路径时基本等价。它的另一个贡献是 reflow：用训练好的模型生成「噪声—数据」配对，再用这些配对重新训练，路径会越来越直，甚至一步欧拉积分就能生成不错的结果，适合配合蒸馏做少步或单步生成。Stability AI 的 Stable Diffusion 3 采用整流流训练；机器人里 π0 的流匹配也用同样的直线插值路径生成动作。","example":"π0 训练时把真实动作块和高斯噪声按时间 τ 线性混合，让动作专家预测两者之间的速度；部署时从纯噪声出发，用 10 步欧拉积分得到可执行的动作块。","related":["流匹配","速度场","扩散模型","单步生成","一致性模型","π0"]},{"id":"u-net","category":"model","sec":4,"tier":2,"sources":[{"title":"U-Net: Convolutional Networks for Biomedical Image Segmentation (arXiv 1505.04597)","url":"https://arxiv.org/abs/1505.04597"},{"title":"Scalable Diffusion Models with Transformers (arXiv 2212.09748)","url":"https://arxiv.org/abs/2212.09748"}],"as_of":"","related_ids":["convolutional-neural-network","diffusion-model","diffusion-transformer","latent-diffusion-model","diffusion-policy","residual-network"],"name":"U-Net","alt":"U-Net","abbr":"","aliases":["U 型网络","UNet"],"one_liner":"先逐层压缩再逐层还原、同层左右直接相连的 U 形卷积网络。","explanation":"U-Net 是 Ronneberger 等人 2015 年为医学图像分割提出的卷积网络。左半边编码器逐层下采样，缩小分辨率、提取更抽象的特征；右半边解码器逐层上采样还原到原尺寸；同一层级的左右两侧用跳跃连接（把编码器的特征直接拼给解码器）相连，画出来像字母 U。这样既能看到全局上下文，又不丢细节位置，适合输入一张图、输出同尺寸结果的任务。后来它成为扩散模型去噪网络的标准骨干，Stable Diffusion 和 Stable Video Diffusion 都用它；2022 年提出的扩散 Transformer（DiT）开始取代它。机器人的扩散策略也常用一维时间卷积 U-Net 来给动作序列去噪。","example":"Stable Diffusion 生成图片时，每一步都把带噪的潜变量送进 U-Net，由它预测其中的噪声，减掉后再进入下一步，反复几十次得到清晰图像。","related":["卷积神经网络","扩散模型","扩散 Transformer","潜在扩散模型","扩散策略","残差网络"]},{"id":"diffusion-transformer","category":"model","sec":4,"tier":2,"sources":[{"title":"Scalable Diffusion Models with Transformers (arXiv 2212.09748)","url":"https://arxiv.org/abs/2212.09748"},{"title":"DiT project page (William Peebles)","url":"https://www.wpeebles.com/DiT"},{"title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation (arXiv 2410.07864)","url":"https://arxiv.org/abs/2410.07864"}],"as_of":"","related_ids":["diffusion-model","transformer","u-net","adaptive-layer-normalization","latent-diffusion-model","rdt-1b"],"name":"扩散 Transformer","alt":"Diffusion Transformer","abbr":"DiT","aliases":["Diffusion Transformers"],"one_liner":"用 Transformer 取代 U-Net 作为扩散模型去噪网络的架构。","explanation":"扩散 Transformer 由 William Peebles 和谢赛宁在 2022 年提出（ICCV 2023 发表）。此前扩散模型的去噪网络大多是 U-Net（一种卷积编码-解码网络），DiT 换成了标准 Transformer：先把 VAE 压缩后的潜在图像切成小块（patch）当作 token，再用自适应层归一化（adaLN）把去噪时间步、类别等条件注入每一层。论文发现计算量越大，生成质量越好，缩放规律清晰；最大的 DiT-XL/2 在 ImageNet 256×256 上 FID 达到 2.27。此后视频生成模型大量采用这类结构。机器人领域也用它生成动作：RDT-1B（Robotics Diffusion Transformer）用它做双臂操作，GR00T N1 的动作模块同样是 DiT 的变体。","example":"RDT-1B 是一个约 12 亿参数的扩散 Transformer，以语言指令和相机图像为条件，去噪生成双臂机器人接下来一段动作。","related":["扩散模型","Transformer","U-Net","自适应层归一化","潜在扩散模型","RDT-1B"]},{"id":"feature-wise-linear-modulation","category":"model","sec":4,"tier":3,"sources":[{"title":"FiLM: Visual Reasoning with a General Conditioning Layer (Perez et al., AAAI 2018)","url":"https://arxiv.org/abs/1709.07871"},{"title":"RT-1: Robotics Transformer for Real-World Control at Scale (arXiv 2212.06817)","url":"https://arxiv.org/abs/2212.06817"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["adaptive-layer-normalization","language-conditioned-policy","rt-1","diffusion-policy","efficientnet","cross-attention"],"name":"FiLM 特征调制","alt":"Feature-wise Linear Modulation","abbr":"FiLM","aliases":["特征级线性调制","FiLM 层","FiLM 条件化"],"one_liner":"用条件信息给每个特征通道算一组缩放和偏移，去调制网络的中间特征。","explanation":"FiLM 由 Ethan Perez、Aaron Courville 等人提出（AAAI 2018），是一种把条件信息注入神经网络的通用层。做法很简单：用一个小网络从条件（比如语言指令的向量）算出每个特征通道的缩放系数 γ 和偏移 β，再把中间特征变成 γ·x + β。原论文在视觉推理问答基准 CLEVR 上把当时最好的错误率减半。机器人里它很常见：RT-1 用 FiLM 把语言指令注入预训练的 EfficientNet 图像编码器，并把生成 γ、β 的层零初始化，让 FiLM 一开始相当于恒等变换，不破坏预训练权重；CNN 版扩散策略也在每个卷积层用 FiLM 注入观测特征。","example":"RT-1 里，「拿起可乐罐」这句指令先经 Universal Sentence Encoder 变成向量，再通过 FiLM 调制 EfficientNet 各层特征，同一张图像在不同指令下就得到不同的视觉特征。","related":["自适应层归一化","语言条件策略","RT-1","扩散策略","EfficientNet","交叉注意力"]},{"id":"adaptive-layer-normalization","category":"model","sec":4,"tier":3,"sources":[{"title":"Scalable Diffusion Models with Transformers (DiT, arXiv 2212.09748)","url":"https://arxiv.org/html/2212.09748"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/html/2503.14734"},{"title":"openpi pi0.py 源码","url":"https://github.com/Physical-Intelligence/openpi/blob/main/src/openpi/models/pi0.py"}],"as_of":"","related_ids":["feature-wise-linear-modulation","diffusion-transformer","normalization-layers","action-expert","nvidia-isaac-gr00t-n1","cross-attention"],"name":"自适应层归一化","alt":"Adaptive Layer Normalization","abbr":"AdaLN","aliases":["adaLN","adaLN-Zero","自适应 RMSNorm","adaRMS"],"one_liner":"用条件信息（如扩散时间步）动态算出层归一化的缩放和偏移","explanation":"层归一化会把每个 token 的特征标准化，再乘缩放系数 γ、加偏移 β，这两个参数通常是训练后固定的。自适应层归一化改为由条件向量（如扩散时间步、类别、语言特征）经一个小 MLP 回归出 γ 和 β，条件一变，整层特征的分布跟着变，从而把条件「注入」网络，思路与 FiLM 特征调制相同。它沿用了 GAN 和 U-Net 扩散模型里的自适应归一化，2022 年 Peebles 和 Xie 在扩散 Transformer（DiT）里系统使用，并提出 adaLN-Zero：再回归一个门控系数并初始化为零，让每个 Transformer 块初始时等于恒等映射，训练更稳。具身领域里，英伟达 GR00T N1 的 DiT 动作模块就用 AdaLN 注入去噪步，同时用交叉注意力接收 VLM 特征。","example":"openpi 的 π0.5 实现把流匹配时间步经两层 MLP 编码成 adarms_cond，用自适应 RMSNorm 的方式调制动作 token 所在的归一化层。","related":["FiLM 特征调制","扩散 Transformer","归一化层（层归一化 / RMSNorm / 批归一化）","动作专家","GR00T N1 系列","交叉注意力"]},{"id":"classifier-free-guidance","category":"model","sec":4,"tier":3,"sources":[{"title":"Classifier-Free Diffusion Guidance (arXiv 2207.12598)","url":"https://arxiv.org/abs/2207.12598"},{"title":"Hugging Face Diffusers: Text-to-image（guidance_scale 说明）","url":"https://huggingface.co/docs/diffusers/using-diffusers/conditional_image_generation"}],"as_of":"","related_ids":["diffusion-model","flow-matching","denoising-steps","text-to-video-image-to-video","generative-model","video-generation-model"],"name":"无分类器引导","alt":"Classifier-Free Guidance","abbr":"CFG","aliases":["引导强度","Guidance Scale"],"one_liner":"同时算有条件和无条件两种预测并按比例外推，让生成结果更贴合条件","explanation":"无分类器引导由 Jonathan Ho 和 Tim Salimans 提出（2021 年 NeurIPS 研讨会短文，2022 年 arXiv 完整版），用于扩散模型、流匹配这类逐步去噪的生成模型。训练时随机丢掉一部分样本的条件（如文本提示），让同一个网络既学有条件预测、也学无条件预测；生成时每一步两种预测都算，用「无条件结果 + w ×（有条件结果 − 无条件结果）」作为最终方向，w 叫引导强度。w 越大，结果越贴合条件，但多样性下降，过大还会出现伪影。它替代了需要额外训练一个分类器的「分类器引导」，成为文生图、文生视频模型的常用设置，代价是每步多一次前向计算。具身领域里基于扩散的视频世界模型和动作生成模型也可以用它调节对语言指令的遵循程度。","example":"在 Diffusers 里用 Stable Diffusion v1.5 文生图，把 guidance_scale 从 2.5 调到 10.5，图像会越来越贴合提示词，过高时开始出现伪影。","related":["扩散模型","流匹配","去噪步数","文生视频 / 图生视频","生成模型","视频生成模型"]},{"id":"latent-diffusion-model","category":"model","sec":4,"tier":3,"sources":[{"title":"High-Resolution Image Synthesis with Latent Diffusion Models (arXiv:2112.10752)","url":"https://arxiv.org/abs/2112.10752"},{"title":"Cosmos World Foundation Model Platform for Physical AI (arXiv:2501.03575)","url":"https://arxiv.org/html/2501.03575"}],"as_of":"2025-01","related_ids":["diffusion-model","variational-autoencoder","diffusion-transformer","video-tokenizer","nvidia-cosmos","cross-attention"],"name":"潜在扩散模型","alt":"Latent Diffusion Model","abbr":"LDM","aliases":["隐空间扩散模型","Latent Diffusion","潜空间扩散模型"],"one_liner":"先用自编码器把数据压缩到低维隐空间，再在隐空间里做扩散生成的模型。","explanation":"扩散模型通过逐步去噪生成数据，但直接在像素上做，高分辨率图像和视频的计算量很大。2021 年 12 月，德国 CompVis 组的 Rombach 等人提出潜在扩散模型（CVPR 2022）：先训练一个自编码器，把图像压缩成尺寸小得多的隐变量，扩散模型只在这个隐空间里去噪，最后由解码器还原成图像；文字等条件通过交叉注意力注入。这大幅降低了训练和推理成本，开源的 Stable Diffusion 就基于这一框架。视频生成和世界模型普遍沿用这一思路，例如英伟达 Cosmos 中基于扩散的世界基础模型，就在 Cosmos 视频分词器（把视频压缩成隐变量的编码器）的隐空间里运行，时间和空间上的压缩比为 8×8×8。","example":"Stable Diffusion 先把 512×512 的彩色图像压缩成 64×64×4 的隐变量，在这个小得多的张量上去噪，最后再解码回 512×512 的图像。","related":["扩散模型","变分自编码器","扩散 Transformer","视频分词器","Cosmos","交叉注意力"]},{"id":"noise-schedule","category":"model","sec":4,"tier":3,"sources":[{"title":"Improved Denoising Diffusion Probabilistic Models (arXiv:2102.09672)","url":"https://arxiv.org/abs/2102.09672"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv:2303.04137)","url":"https://arxiv.org/abs/2303.04137"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"","related_ids":["diffusion-model","denoising-diffusion-probabilistic-model","denoising-steps","flow-matching","diffusion-policy","prediction-target-parameterization"],"name":"噪声调度","alt":"Noise Schedule","abbr":"","aliases":["噪声表","加噪调度","Noise Scheduler"],"one_liner":"规定扩散模型每一步加多少噪声的时间表，影响训练效果和生成质量。","explanation":"噪声调度是扩散模型的一个设计选择：规定前向加噪过程中第 t 步时原始数据还保留多少、噪声占多少。2020 年的 DDPM 用线性调度；2021 年 OpenAI 的 Nichol 与 Dhariwal 发现它在低分辨率图像上后段几乎全是噪声、白白浪费步数，于是提出余弦调度，让信息在中段匀速减少、两端变化平缓。调度决定模型在各个噪声水平上分配多少训练，对生成质量影响明显；流匹配里与之对应的是训练时间步的采样分布。机器人策略同样要调：扩散策略选用余弦调度，π0 训练流匹配时刻意多采样高噪声的时间步。","example":"扩散策略论文比较后采用 iDDPM 提出的余弦调度，训练用 100 个扩散步，真机推理时用 DDIM 只走 10 步，在 RTX 3080 上约 0.1 秒出一次动作。","related":["扩散模型","去噪扩散概率模型","去噪步数","流匹配","扩散策略","预测目标参数化（ε / v / x₀ 预测）"]},{"id":"prediction-target-parameterization","category":"model","sec":4,"tier":3,"sources":[{"title":"Denoising Diffusion Probabilistic Models (DDPM, arXiv 2006.11239)","url":"https://arxiv.org/abs/2006.11239"},{"title":"Progressive Distillation for Fast Sampling of Diffusion Models (v-prediction, arXiv 2202.00512)","url":"https://arxiv.org/abs/2202.00512"},{"title":"Back to Basics: Let Denoising Generative Models Denoise (JiT, arXiv 2511.13720)","url":"https://arxiv.org/abs/2511.13720"}],"as_of":"2025-11","related_ids":["diffusion-model","flow-matching","rectified-flow","denoising-diffusion-probabilistic-model","velocity-field","denoising-loss"],"name":"预测目标参数化（ε / v / x₀ 预测）","alt":"Prediction Target Parameterization (ε-prediction / v-prediction / x₀-prediction)","abbr":"","aliases":["ε 预测","噪声预测","v 预测","x₀ 预测","x 预测","epsilon-prediction"],"one_liner":"扩散模型的网络该输出噪声、速度还是干净数据，这个选择叫预测目标。","explanation":"扩散模型和流匹配训练时，先给干净数据 x₀ 加噪得到 x_t，网络看到 x_t 后要输出某个量来算损失，这个量有几种选法。ε 预测让网络猜加进去的噪声，是 2020 年 DDPM 的做法；x₀ 预测直接猜干净数据；v 预测由 Salimans 和 Ho 在 2022 年提出，预测噪声和数据的加权组合，在采样步数很少时更稳定；流匹配、整流流里网络预测的速度场也属于这一类。给定 x_t 和时间步，三者可以互相换算，但训练难度、不同噪声水平下的误差权重、少步采样效果并不相同。2025 年 Tianhong Li 与何恺明的 JiT 论文指出，在高维像素空间里直接预测干净数据，比预测噪声或速度更容易学好。机器人里，扩散策略默认用 ε 预测，π0 等流匹配 VLA 预测速度。","example":"扩散策略（Diffusion Policy）的噪声预测网络 ε_θ 输入加噪的动作序列，输出估计的噪声；π0 的动作专家则输出速度向量，部署时从纯噪声出发积分 10 步得到动作块。","related":["扩散模型","流匹配","整流流","去噪扩散概率模型","速度场","去噪损失"]},{"id":"score-function-score-matching","category":"model","sec":4,"tier":3,"sources":[{"title":"Yang Song: Generative Modeling by Estimating Gradients of the Data Distribution (blog)","url":"https://yang-song.net/blog/2021/score/"},{"title":"Generative Modeling by Estimating Gradients of the Data Distribution (arXiv:1907.05600)","url":"https://arxiv.org/abs/1907.05600"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv:2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["diffusion-model","denoising-diffusion-probabilistic-model","energy-based-model","diffusion-policy","flow-matching","diffusion-flow-samplers"],"name":"分数函数 / 分数匹配","alt":"Score Function / Score Matching","abbr":"","aliases":["得分函数","Score","去噪分数匹配","Denoising Score Matching","基于分数的生成模型","Score-based Generative Model"],"one_liner":"「分数」是对数概率密度对输入的梯度，分数匹配是用神经网络学这个梯度的方法。","explanation":"分数函数指概率密度取对数后对输入求的梯度 ∇ₓlog p(x)，它指向数据概率升高最快的方向，计算时不需要知道难算的归一化常数。分数匹配由 Hyvärinen 在 2005 年提出，能在不知道真实分布的情况下训练模型拟合这个梯度；后来的去噪分数匹配改成「给数据加噪声，再学怎么把噪声去掉」。2019 年 Song 与 Ermon 在多种噪声强度下学分数，再用朗之万动力学（沿梯度走、每步加一点随机噪声的采样方法）生成图像；2021 年的随机微分方程（SDE）框架又说明它和去噪扩散概率模型本质上是同一类模型。扩散模型预测的噪声换个比例就是分数，所以理解分数是理解扩散策略的底层钥匙。","example":"扩散策略（Diffusion Policy）论文把自己的做法描述为学习动作分布的分数梯度场：推理时从随机噪声出发，沿这个梯度场做若干步带随机性的朗之万式迭代，最后得到一段机器人动作。","related":["扩散模型","去噪扩散概率模型","能量模型","扩散策略","流匹配","扩散 / 流采样器（ODE / SDE 求解器）"]},{"id":"denoising-steps","category":"model","sec":4,"tier":2,"sources":[{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/html/2410.24164"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/html/2503.14734"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["denoising-diffusion-probabilistic-model","denoising-diffusion-implicit-model","flow-matching","consistency-model","inference-latency","one-step-generation"],"name":"去噪步数","alt":"Denoising Steps / Number of Function Evaluations","abbr":"NFE","aliases":["采样步数","推理步数","积分步数","Sampling Steps"],"one_liner":"扩散或流匹配模型生成一次结果要调用几次网络，直接决定推理速度。","explanation":"扩散模型和流匹配模型生成样本不是一步到位，而是从噪声出发反复调用网络，每次修正一点。调用网络的次数就是去噪步数，文献里常用 NFE（网络函数评估次数）精确计数。步数越多，结果通常越精细，但耗时近似成正比增加。对机器人这一点很要紧，因为策略要在闭环控制里实时给出动作。各方法取值差别很大：DDPM 原论文用 1000 步；Diffusion Policy 训练用 100 步，推理借 DDIM 降到 10 步；π0 用流匹配积分 10 步；GR00T N1 只用 4 步。一致性模型、平均流等方法则追求 1 到 2 步生成。注意训练时的扩散步数和推理时的采样步数可以不同，推理步数一般能在部署时调整。","example":"π0 预测一段 50 步长的动作块时，从高斯噪声出发积分 10 步（每步 δ=0.1），也就是每出一段动作要调用 10 次动作专家。","related":["去噪扩散概率模型","去噪扩散隐式模型","流匹配","一致性模型","推理延迟","单步生成"]},{"id":"denoising-diffusion-implicit-model","category":"model","sec":4,"tier":3,"sources":[{"title":"Denoising Diffusion Implicit Models (arXiv:2010.02502)","url":"https://arxiv.org/abs/2010.02502"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv HTML)","url":"https://arxiv.org/html/2303.04137v5"}],"as_of":"","related_ids":["denoising-diffusion-probabilistic-model","diffusion-model","denoising-steps","diffusion-flow-samplers","diffusion-policy","noise-schedule"],"name":"去噪扩散隐式模型","alt":"Denoising Diffusion Implicit Model","abbr":"DDIM","aliases":["DDIM 采样器"],"one_liner":"沿用 DDPM 的训练方式、把采样改成可跳步的确定性过程的扩散加速方法。","explanation":"去噪扩散隐式模型由斯坦福的 Jiaming Song、Chenlin Meng、Stefano Ermon 于 2020 年提出，发表于 ICLR 2021。DDPM（去噪扩散概率模型）生成一个样本要沿马尔可夫链走几百上千步去噪，很慢。DDIM 构造了一类非马尔可夫的扩散过程，训练目标和 DDPM 相同，所以训好的 DDPM 不用重训就能换成 DDIM 采样：可以跳步，只走十几到几十步，论文报告墙钟时间快 10–50 倍；把随机项设为零时采样是确定性的，同一个初始噪声总得到同一结果。它是后来各类快速扩散采样器的起点，扩散策略在真机上做实时控制也常靠它减少步数。","example":"扩散策略（Diffusion Policy）的真机实验用 100 步训练、DDIM 10 步推理，在 RTX 3080 上单次推理延迟约 0.1 秒。","related":["去噪扩散概率模型","扩散模型","去噪步数","扩散 / 流采样器（ODE / SDE 求解器）","扩散策略","噪声调度"]},{"id":"diffusion-flow-samplers","category":"model","sec":4,"tier":3,"sources":[{"title":"Score-Based Generative Modeling through Stochastic Differential Equations (arXiv:2011.13456)","url":"https://arxiv.org/abs/2011.13456"},{"title":"DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps (arXiv:2206.00927)","url":"https://arxiv.org/abs/2206.00927"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv HTML)","url":"https://arxiv.org/html/2410.24164v1"}],"as_of":"","related_ids":["diffusion-model","flow-matching","denoising-diffusion-implicit-model","denoising-steps","velocity-field","one-step-generation"],"name":"扩散 / 流采样器（ODE / SDE 求解器）","alt":"Diffusion / Flow Samplers (ODE / SDE Solvers, e.g. Euler, DPM-Solver)","abbr":"","aliases":["扩散采样器","Sampler","Euler 采样器","DPM-Solver"],"one_liner":"把训练好的扩散或流模型从随机噪声一步步积分成样本的数值算法。","explanation":"扩散模型和流匹配模型学到的是「在每个噪声水平该往哪个方向走」，真正生成时要用数值方法把这个过程积分出来，这就是采样器。2020 年 Song 等人把扩散过程写成随机微分方程（SDE），并推出一个分布相同的确定性常微分方程，即概率流 ODE：按 SDE 解每步会加随机噪声，按 ODE 解则结果确定。常见采样器有最简单的一阶 Euler 法、DDIM，以及清华朱军团队 2022 年提出的 DPM-Solver 这类专用高阶求解器，后者约 10–20 次网络调用就能得到高质量样本。步数越少越快、误差越大，机器人策略要在控制频率和动作质量之间权衡。","example":"π0 的流匹配动作专家推理时用前向 Euler 法积分 10 步（步长 0.1），把一段随机噪声变成一个动作块。","related":["扩散模型","流匹配","去噪扩散隐式模型","去噪步数","速度场","单步生成"]},{"id":"consistency-model","category":"model","sec":4,"tier":3,"sources":[{"title":"Consistency Models (arXiv 2303.01469)","url":"https://arxiv.org/abs/2303.01469"},{"title":"Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation (arXiv 2405.07503)","url":"https://arxiv.org/abs/2405.07503"}],"as_of":"","related_ids":["diffusion-model","diffusion-policy","one-step-generation","knowledge-distillation","meanflow","conrft"],"name":"一致性模型","alt":"Consistency Model","abbr":"","aliases":["一致性策略","Consistency Policy","一致性蒸馏","Consistency Distillation"],"one_liner":"能把噪声一步映射回数据的生成模型，用来把扩散的多步采样压到一两步","explanation":"一致性模型由 OpenAI 的 Yang Song 等人在 2023 年提出（ICML 2023）。扩散模型生成时要沿去噪轨迹一步步走，常需几十到上百步，很慢。一致性模型训练一个函数，让同一条轨迹上任意时刻的带噪样本都映射到同一个终点（干净数据），这一性质叫「自一致性」；于是一步就能从纯噪声生成样本，也可以多走几步换取更高质量。训练有两种方式：从已训好的扩散模型蒸馏（一致性蒸馏），或直接从头训练。机器人方向，Prasad、Bohg 等人 2024 年的 Consistency Policy 把扩散策略蒸馏成一致性策略，推理比最快的替代加速方法还快约一个数量级、成功率相当，适合算力有限的机器人；ConRFT 等工作也用一致性策略做 VLA 的强化微调。","example":"Consistency Policy 在 6 个仿真任务和 3 个真机任务上用笔记本 GPU 推理，速度约为其他加速方法的 10 倍，成功率与原扩散策略接近。","related":["扩散模型","扩散策略","单步生成","知识蒸馏","平均流","ConRFT"]},{"id":"one-step-generation","category":"model","sec":4,"tier":3,"sources":[{"title":"Consistency Models (arXiv:2303.01469)","url":"https://arxiv.org/abs/2303.01469"},{"title":"Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation (arXiv:2405.07503)","url":"https://arxiv.org/abs/2405.07503"},{"title":"Mean Flows for One-step Generative Modeling (arXiv:2505.13447)","url":"https://arxiv.org/abs/2505.13447"}],"as_of":"","related_ids":["denoising-steps","consistency-model","meanflow","rectified-flow","consistency-policy","inference-latency"],"name":"单步生成","alt":"One-step Generation","abbr":"","aliases":["一步生成","1-NFE 生成","One-step Sampling"],"one_liner":"只跑一次网络前向就从噪声直接得到结果，用来解决扩散模型采样慢。","explanation":"单步生成指生成模型只做一次网络前向计算（1 NFE，即函数评估次数为 1）就产出样本。生成对抗网络、变分自编码器、标准化流天生是一步生成；扩散模型和流匹配则要从噪声出发迭代几十到上千步，质量高但慢。对机器人来说，动作头每多走一步都增加控制延迟，所以把扩散或流式策略压到一步是重要方向。常见做法有三类：一是蒸馏，用多步教师训练一步学生，如一致性蒸馏；二是换训练目标，让模型直接学「一步跳到终点」，如一致性模型、平均流；三是把生成路径拉直，如整流流。代价通常是质量略降或训练更复杂。","example":"Consistency Policy 把扩散策略蒸馏成一致性模型，推理比已有最快方法快一个数量级，能在笔记本 GPU 上跑；MP1 用平均流一步生成动作，推理约 6.8 毫秒。","related":["去噪步数","一致性模型","平均流","整流流","Consistency Policy（一致性策略）","推理延迟"]},{"id":"meanflow","category":"model","sec":4,"tier":3,"sources":[{"title":"Mean Flows for One-step Generative Modeling (arXiv:2505.13447)","url":"https://arxiv.org/abs/2505.13447"},{"title":"MP1: MeanFlow Tames Policy Learning in 1-step for Robotic Manipulation (arXiv:2507.10543)","url":"https://arxiv.org/abs/2507.10543"}],"as_of":"2025-07","related_ids":["flow-matching","velocity-field","one-step-generation","consistency-model","rectified-flow","denoising-steps"],"name":"平均流","alt":"MeanFlow (Mean Flows for One-step Generative Modeling)","abbr":"","aliases":["Mean Flows","MeanFlow"],"one_liner":"学习一段时间内的「平均速度」，一步就能从噪声生成样本的生成方法。","explanation":"平均流（MeanFlow）是 Zhengyang Geng、J. Zico Kolter、何恺明等人在 2025 年 5 月提出的单步生成方法。流匹配训练网络预测某一时刻的「瞬时速度」，生成时要沿速度场积分很多小步，推理慢。MeanFlow 改为预测一段时间区间内的「平均速度」，即这段区间的总位移除以时长，并推导出平均速度与瞬时速度之间的恒等式当训练目标，不需要预训练教师模型或蒸馏，从零训练就能一步采样。论文报告在 ImageNet 256×256 上一步生成的 FID（衡量生成图与真实图差距的指标，越低越好）为 3.43。机器人领域已有 MP1 等工作把它用作动作生成头，以降低策略推理延迟。","example":"MP1 把 MeanFlow 用在以点云为输入的机械臂策略上，一次网络前向就生成整段动作，论文报告推理约 6.8 毫秒，比 3D 扩散策略 DP3 快约 19 倍，平均成功率还高出 10.2%。","related":["流匹配","速度场","单步生成","一致性模型","整流流","去噪步数"]},{"id":"discrete-diffusion","category":"model","sec":4,"tier":3,"sources":[{"title":"Structured Denoising Diffusion Models in Discrete State-Spaces (D3PM, arXiv:2107.03006)","url":"https://arxiv.org/abs/2107.03006"},{"title":"Simple and Effective Masked Diffusion Language Models (MDLM, arXiv:2406.07524)","url":"https://arxiv.org/abs/2406.07524"},{"title":"Discrete Diffusion VLA (arXiv:2508.20072)","url":"https://arxiv.org/abs/2508.20072"}],"as_of":"","related_ids":["diffusion-model","diffusion-language-model","parallel-decoding","discrete-diffusion-vla","denoising-diffusion-probabilistic-model","action-binning"],"name":"离散扩散","alt":"Discrete Diffusion","abbr":"","aliases":["掩码扩散","Masked Diffusion","离散去噪扩散"],"one_liner":"在文字 token 这类离散符号上做加噪和去噪的扩散模型。","explanation":"普通扩散模型给连续数据（像素、动作数值）加高斯噪声，而文本、离散动作 token 这类数据没法直接加高斯噪声。离散扩散改用「状态转移」加噪：每一步按转移矩阵把 token 随机换成别的值，或换成一个特殊的 [MASK] 符号。2021 年谷歌 Austin 等人在 D3PM 中系统提出这一框架，并指出用「吸收态」（变成 MASK 后不再改变）加噪时，它和掩码语言模型、自回归模型联系紧密。此后掩码扩散成为主流，如 NeurIPS 2024 的 MDLM 把训练目标化简成一组掩码语言建模损失的混合。它是扩散语言模型和离散扩散类 VLA 的理论基础。","example":"Discrete Diffusion VLA 把动作块离散成 token，先全部遮住，再按置信度由易到难逐步揭开，对没把握的位置二次遮住重算，在 LIBERO 上报告 96.4% 的平均成功率。","related":["扩散模型","扩散语言模型","并行解码","Discrete Diffusion VLA（离散扩散 VLA）","去噪扩散概率模型","分箱离散化"]},{"id":"diffusion-language-model","category":"model","sec":4,"tier":3,"sources":[{"title":"Large Language Diffusion Models (LLaDA, arXiv:2502.09992)","url":"https://arxiv.org/abs/2502.09992"},{"title":"Gemini Diffusion - Google DeepMind","url":"https://deepmind.google/models/gemini-diffusion/"},{"title":"Mercury: Ultra-Fast Language Models Based on Diffusion (arXiv:2506.17298)","url":"https://arxiv.org/abs/2506.17298"}],"as_of":"2026-09","related_ids":["discrete-diffusion","large-language-model","parallel-decoding","autoregressive-decoding","diffusion-model","discrete-diffusion-vla"],"name":"扩散语言模型","alt":"Diffusion Language Model","abbr":"dLLM","aliases":["扩散大语言模型","Diffusion LLM","掩码扩散语言模型"],"one_liner":"用扩散方式对整段文本并行去噪、而不是逐字往后生成的语言模型。","explanation":"扩散语言模型把扩散思路用到文本上：生成时先放一段全被遮住（掩码）或加了噪的 token，再分若干步同时预测，逐步确定内容，每步可以一次填出多个 token，也能回头修改。代表工作有中国人民大学等团队 2025 年的 LLaDA，8B 规模在上下文学习上与 LLaMA3 8B 相当；Inception Labs 的商用模型 Mercury；以及谷歌 DeepMind 的实验性模型 Gemini Diffusion，官方公布采样速度约每秒 1479 个 token。它的吸引力在于并行解码速度快、能双向利用上下文。具身领域也有工作把这种思路用来并行解码动作，如 Discrete Diffusion VLA。","example":"LLaDA 回答问题时先生成一整段掩码 token，每一步预测所有被遮住的位置，保留把握大的、把把握小的重新遮住，重复多轮直到全部填完。","related":["离散扩散","大语言模型","并行解码","自回归解码","扩散模型","Discrete Diffusion VLA（离散扩散 VLA）"]},{"id":"action-head","category":"model","sec":5,"tier":1,"sources":[{"title":"Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)","url":"https://arxiv.org/abs/2405.12213"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/abs/2503.14734"}],"as_of":"","related_ids":["backbone-network","diffusion-action-head","action-expert","continuous-action-regression","octo","action-multimodality"],"name":"动作头","alt":"Action Head","abbr":"","aliases":["动作解码器","Action Decoder","策略头","Policy Head"],"one_liner":"接在骨干网络后面，把提取出的特征转换成具体机器人动作的输出模块。","explanation":"动作头沿用了视觉领域「骨干 + 头」的分法：骨干网络从图像、语言、本体状态中提取特征，头把特征变成任务需要的输出，在机器人策略里就是关节角、末端位姿、夹爪开合等动作。常见的动作头有三类：直接回归连续值的 MLP 头（用均方误差训练，遇到多种合理做法时容易取平均）；把动作离散成 token 再分类的头；以及扩散头或流匹配头，能表达多峰的动作分布。Octo 在 Transformer 输出上接一个轻量的扩散动作头，微调到新机器人时可以换一个新动作头来适配新的动作空间；GR00T N1 用扩散 Transformer 作为动作模块。","example":"Octo 预训练时用扩散动作头预测未来一段动作；迁移到一台动作维度不同的新机械臂时，保留 Transformer 主体的预训练权重、换上一个匹配新动作空间的新动作头，再用约 100 条演示把整个模型一起微调。","related":["骨干网络","扩散动作头","动作专家","连续动作回归","Octo","动作多峰性"]},{"id":"action-representation","category":"model","sec":5,"tier":2,"sources":[{"title":"Universal Manipulation Interface (UMI, arXiv:2402.10329)","url":"https://arxiv.org/abs/2402.10329"},{"title":"On the Continuity of Rotation Representations in Neural Networks (arXiv:1812.07035)","url":"https://arxiv.org/abs/1812.07035"},{"title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective (arXiv:2507.01925)","url":"https://arxiv.org/abs/2507.01925"}],"as_of":"","related_ids":["action-space","delta-action-vs-absolute-action","6d-rotation-representation","action-tokenizer","latent-action","end-effector-pose"],"name":"动作表示","alt":"Action Representation","abbr":"","aliases":["动作参数化","Action Parameterization"],"one_liner":"用什么量、相对什么坐标、什么格式来描述机器人要做的动作。","explanation":"动作表示指策略输出的动作用什么形式来写，是搭机器人学习系统时最先要定的事之一。它包含几层选择：控制什么量（关节角度、末端执行器位姿，还是速度、力矩）；相对于什么（全局绝对坐标、相对上一步的增量，还是相对当前位姿的一整段轨迹）；旋转怎么写（欧拉角、四元数，或被证明对神经网络更连续、更好学的 6D 表示）；以及输出格式（连续数值、离散 token，或潜在动作、轨迹点等更抽象的中间表示）。同一个模型换一种动作表示，成功率可能差很多，所以论文里通常会专门说明并做对比。","example":"UMI 论文在摆杯子任务上对比：相对当前末端位姿的整段轨迹成功 20/20，逐步增量 16/20（误差会累积），全局绝对坐标只有 5/20。","related":["动作空间","增量动作 / 绝对动作","6D 旋转表示","动作分词器","潜在动作","末端位姿"]},{"id":"delta-action-vs-absolute-action","category":"model","sec":5,"tier":2,"sources":[{"title":"Universal Manipulation Interface (UMI, arXiv 2402.10329)","url":"https://arxiv.org/html/2402.10329"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["action-space","action-representation","end-effector-pose","coordinate-frame","universal-manipulation-interface","action-chunking"],"name":"增量动作 / 绝对动作","alt":"Delta (Relative) Action vs. Absolute Action","abbr":"","aliases":["相对动作","增量动作","Delta Action","绝对动作","Absolute Action","相对轨迹"],"one_liner":"动作写成「再挪多少」（增量），还是写成「移动到哪个坐标」（绝对）。","explanation":"这是动作表示的一个基本选择。绝对动作直接给目标值，比如末端执行器（机械臂最末端的夹爪或工具）要到达的位姿、各关节的目标角度；增量动作只给相对当前状态的变化量，比如「沿 x 轴再走 1 厘米」。增量动作不依赖底座与世界坐标系的精确标定，不同场景下数值分布更统一，但逐步累加会积累误差；绝对动作不积累误差，却要求坐标系对得准。两者之间还有折中：UMI 用「相对轨迹」，把一整段动作都写成相对这段起点末端位姿的变换。Diffusion Policy 论文则发现，在其测试任务上输出目标位置的位置控制优于输出速度的速度控制。用哪种要看数据集的定义，训练和部署必须一致，否则机器人会走偏。","example":"机械臂末端当前在 x=0.40 米处，要移到 x=0.42 米：绝对动作写 0.42，增量动作写 +0.02。UMI 论文的一项实验里，绝对动作基线因 SLAM 坐标和机器人底座坐标难以对准，成功率只有 25%，相对轨迹为 100%。","related":["动作空间","动作表示","末端位姿","坐标系","通用操作接口","动作分块"]},{"id":"continuous-action-regression","category":"model","sec":5,"tier":2,"sources":[{"title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT, arXiv 2502.19645)","url":"https://arxiv.org/abs/2502.19645"},{"title":"Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)","url":"https://arxiv.org/html/2405.12213"}],"as_of":"2025-02","related_ids":["action-head","action-multimodality","l1-loss","mean-squared-error","diffusion-action-head","action-binning"],"name":"连续动作回归","alt":"Continuous Action Regression","abbr":"","aliases":["回归头","Regression Head","L1 回归","MSE 回归"],"one_liner":"让网络直接输出连续的动作数值，用 L1 或均方误差去对齐示范动作。","explanation":"连续动作回归是机器人策略最直接的出动作方式：网络末端接一个回归头（通常是几层全连接），直接输出关节角、末端位移等实数，训练时用均方误差或 L1 损失（预测值与示范值之差的平方或绝对值）去逼近人类示范。它实现简单，推理只需一次前向计算，速度快。短板在于示范里同一场景有多种合理做法时（动作多峰性），回归会学成几种做法的平均，结果可能哪种都不是；Octo 论文就观察到 MSE 回归头学出的策略动作迟缓、犹豫。常见的替代方案是把动作离散成 token，或用扩散、流匹配生成。不过 2025 年的 OpenVLA-OFT 用 L1 回归配合动作分块和并行解码，把 LIBERO 四个任务集的平均成功率从 76.5% 提到 97.1%，说明回归在很多任务上仍然够用。","example":"ACT（Action Chunking with Transformers）训练时用 L1 损失直接回归未来一段关节角序列；OpenVLA-OFT 把 OpenVLA 的离散 token 输出换成 L1 回归头，一次前向就算出整段动作，动作生成吞吐提升约 26 倍。","related":["动作头","动作多峰性","L1 损失","均方误差","扩散动作头","分箱离散化"]},{"id":"action-chunking","category":"model","sec":5,"tier":1,"sources":[{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/abs/2410.24164"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/abs/2503.14734"}],"as_of":"","related_ids":["action-horizon","temporal-ensembling","real-time-chunking","compounding-error","action-chunking-with-transformers","diffusion-policy"],"name":"动作分块","alt":"Action Chunking","abbr":"","aliases":["动作块","action chunk","chunk","动作序列预测"],"one_liner":"策略一次预测接下来一小段连续动作，而不是每一步只输出一个动作。","explanation":"动作分块指策略每次推理输出未来 k 步的动作序列（一个「块」），执行完一部分或全部后再重新观测、再预测。这个叫法由 Tony Zhao、Chelsea Finn 等人 2023 年的 ACT 论文带进机器人学习，借自神经科学里「把一串动作打包成一个单元来执行」的概念：ACT 以 50Hz 控制双臂，每次预测未来 100 步的关节目标。它解决两个问题：一是让决策次数缩短为原来的 1/k，减轻行为克隆中小误差逐步累积的复合误差；二是更容易学到人类演示里的停顿这类单步策略难以建模的时序习惯。现在扩散策略、π0（一次 50 步）、GR00T N1（一次 16 步）等主流模型都输出动作块，块与块之间常用时序集成或实时动作分块来衔接，避免动作突变。","example":"ACT 在低成本双臂平台 ALOHA 上做了 6 个精细任务，每个任务只用 10–20 分钟（约 50 条）演示：打开半透明调料杯盖成功率 84%，把电池装进遥控器 96%，最难的穿魔术贴扎带只有 20%。它每次输出未来 100 步（50Hz 下约 2 秒）的关节目标。","related":["动作视界","时序集成","实时动作分块","复合误差","ACT","扩散策略"]},{"id":"action-horizon","category":"model","sec":5,"tier":2,"sources":[{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv:2303.04137)","url":"https://arxiv.org/html/2303.04137v5"},{"title":"diffusion_policy 训练配置 train_diffusion_unet_image_workspace.yaml (GitHub)","url":"https://github.com/real-stanford/diffusion_policy/blob/main/diffusion_policy/config/train_diffusion_unet_image_workspace.yaml"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/html/2410.24164"}],"as_of":"","related_ids":["action-chunking","temporal-ensembling","diffusion-policy","asynchronous-inference","closed-loop-control","real-time-chunking"],"name":"动作视界","alt":"Action Horizon","abbr":"","aliases":["预测视界","执行视界","观测视界","Prediction Horizon","Execution Horizon","Observation Horizon"],"one_liner":"策略每次看几步历史、预测几步动作、实际执行几步。","explanation":"动作视界描述策略在时间上「看多远、做多远」。扩散策略（Diffusion Policy，2023）论文把它拆成三个量：观测视界 To 是输入最近几步的观测，预测视界 Tp 是一次生成多少步动作，执行视界 Ta 是其中真正发给机器人、中途不重新规划的步数。执行完 Ta 步再用新观测重新预测，这种做法叫滚动时域控制。Ta 越长，动作越连贯、推理次数越少，但对突发变化反应越慢；越短则越灵敏，却容易抖动。该论文发现多数任务执行 8 步最好，开源代码默认 To=2、Tp=16、Ta=8。VLA 里说的动作块长度（chunk size）大致对应预测视界。","example":"π0 一次预测 50 步动作：在 50Hz 的机器人上只执行前 25 步（0.5 秒）就用新画面重新推理，在 20Hz 的 UR5e 上每执行 16 步重推一次。","related":["动作分块","时序集成","扩散策略","异步推理","闭环","实时动作分块"]},{"id":"temporal-ensembling","category":"model","sec":5,"tier":2,"sources":[{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"},{"title":"Real-Time Execution of Action Chunking Flow Policies (arXiv 2506.07339)","url":"https://arxiv.org/abs/2506.07339"}],"as_of":"","related_ids":["action-chunking","action-chunking-with-transformers","real-time-chunking","action-smoothing","compounding-error","action-horizon"],"name":"时序集成","alt":"Temporal Ensembling","abbr":"","aliases":["时间集成","Temporal Ensemble","动作集成","Action Ensemble"],"one_liner":"每步都预测动作块，把多个块对同一时刻的预测加权平均后再执行。","explanation":"时序集成是 2023 年 ACT 论文（Tony Zhao 等人）提出的动作块执行方式。朴素的动作分块每 k 步才看一次新观测，换块时动作容易突变。时序集成改为每个控制步都调用一次策略，于是同一时刻会有多个重叠块给出的预测，按指数权重 w_i = exp(-m·i) 加权平均后再执行，i=0 对应最早的那次预测；m 越小，新观测的影响进来得越快。它不增加训练成本，只多耗推理算力，在 ACT 的消融实验中带来约 3.3 个百分点的成功率提升。代价是每步都要推理，大模型延迟高时难以使用，后来的实时动作分块（RTC）就把它当作对比基线。","example":"ACT 每步预测未来 k 步动作，当前时刻 t 会收到 t、t-1、t-2 等多次预测里各自对 t 给出的动作，加权平均后再发给机械臂，因此 ALOHA 双臂的动作更平滑。","related":["动作分块","ACT","实时动作分块","动作平滑","复合误差","动作视界"]},{"id":"keyframe-action-prediction","category":"model","sec":5,"tier":3,"sources":[{"title":"Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation (arXiv:2209.05451)","url":"https://arxiv.org/abs/2209.05451"},{"title":"Q-attention: Enabling Efficient Learning for Vision-based Robotic Manipulation (arXiv:2105.14829)","url":"https://arxiv.org/abs/2105.14829"},{"title":"Coarse-to-Fine Q-attention (C2F-ARM, arXiv:2106.12534)","url":"https://arxiv.org/abs/2106.12534"}],"as_of":"2022-11","related_ids":["peract","rvt-2","3d-diffuser-actor","motion-planning","rlbench","action-representation"],"name":"关键帧动作预测","alt":"Keyframe Action / Next-Best-Pose Prediction","abbr":"","aliases":["下一最佳位姿预测","关键帧动作","关键位姿预测","Next-Best-Pose Prediction","Next Best Action","Keypose Prediction"],"one_liner":"只预测任务中几个关键的末端位姿，两点之间的路径交给运动规划器。","explanation":"常规视觉运动策略每秒要输出几十个连续动作；关键帧方法则把一条演示压缩成少数几个关键的末端执行器位姿（如抓取前、夹住时、放下前），策略只学「下一个关键位姿在哪」，两个位姿之间的路径由运动规划器生成。帝国理工 Stephen James 等人 2021 年在 Q-attention、C2F-ARM 中提出关键帧发现，2022 年的 PerAct 沿用：按关节速度接近零等简单规则自动挑出关键帧，一条 RLBench 演示通常只剩 2 到 17 个，再把位置离散成体素、旋转离散成角度区间，预测变成分类问题。PerAct 的消融实验显示，随机或等间隔选帧会让性能降到零。这种设定在少样本下学得快，RVT、3D Diffuser Actor 等 3D 操作策略也采用；代价是依赖规划器，难以处理需要连续调节力度和速度的动态任务。","example":"让机械臂打开抽屉时，PerAct 只需依次预测几个关键位姿：把手前的预抓取位姿、夹住把手、向外拉到位；每两个位姿之间由运动规划器补全路径。","related":["PerAct","RVT-2","3D Diffuser Actor","运动规划","RLBench","动作表示"]},{"id":"action-binning","category":"model","sec":5,"tier":2,"sources":[{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)","url":"https://arxiv.org/html/2406.09246"},{"title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv:2307.15818)","url":"https://arxiv.org/abs/2307.15818"},{"title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models (arXiv:2501.09747)","url":"https://arxiv.org/abs/2501.09747"}],"as_of":"","related_ids":["action-tokenizer","action-representation","discrete-cosine-transform","rt-2","openvla","pi0-fast"],"name":"分箱离散化","alt":"Action Binning / Discretization","abbr":"","aliases":["动作离散化","分桶","动作分箱","Action Binning"],"one_liner":"把每个连续动作维度等分成若干区间，用区间编号当离散 token。","explanation":"分箱离散化是把连续机器人动作变成离散符号的最简单办法：对每个动作维度（如末端 x 方向位移、夹爪开合）划定取值范围，等分成若干个「箱」，用数值落入的箱编号代表它。RT-2 把每维分成 256 个箱，再把箱编号对应到语言模型词表里的 token，动作就能像文字一样被预测。OpenVLA 沿用 256 箱，但用训练数据的第 1 和第 99 百分位代替最小、最大值来定范围，避免个别离群值把区间撑大、降低精度。缺点是每个时间步、每个维度都要一个 token，高频控制时 token 多且相邻 token 高度相关，模型难学，FAST 等压缩式动作分词器就是为此提出的。","example":"若 x 方向位移的范围是 -2 到 2 厘米，分成 256 箱后每箱宽约 0.016 厘米，0.5 厘米就记为第 160 号箱。","related":["动作分词器","动作表示","离散余弦变换","RT-2","OpenVLA","π0-FAST"]},{"id":"action-tokenizer","category":"model","sec":5,"tier":2,"sources":[{"title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models (arXiv:2501.09747)","url":"https://arxiv.org/html/2501.09747"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)","url":"https://arxiv.org/html/2406.09246"}],"as_of":"2025-01","related_ids":["action-binning","discrete-cosine-transform","byte-pair-encoding","vector-quantization","pi0-fast","action-representation"],"name":"动作分词器","alt":"Action Tokenizer","abbr":"","aliases":["动作 tokenizer","动作 token","动作 token 化","Action Tokenization","Action Token"],"one_liner":"把连续动作编码成离散 token、推理时再解码回动作的模块。","explanation":"动作分词器把连续动作（通常是一段动作块）转成离散 token，推理时再解码回可执行的动作，让 VLA 能用「预测下一个 token」的方式输出动作。最简单的是逐维分箱（RT-2、OpenVLA 每维 256 箱），但高频数据里相邻时刻的动作几乎一样，分箱会产生大量冗余 token，模型难学。Physical Intelligence 等 2025 年 1 月提出的 FAST 先对每个动作维度做离散余弦变换（DCT，把信号转到频域），量化后再用字节对编码（BPE）压缩，配合 π0 训练时间最多缩短到约五分之一。另一类做法用向量量化（VQ）学一个动作码本。","example":"叠 T 恤任务中 1 秒、50Hz 的动作，逐维分箱需要 700 个 token，FAST 压缩后只要 53 个。","related":["分箱离散化","离散余弦变换","字节对编码","向量量化","π0-FAST","动作表示"]},{"id":"discrete-cosine-transform","category":"model","sec":5,"tier":3,"sources":[{"title":"Discrete cosine transform - Wikipedia","url":"https://en.wikipedia.org/wiki/Discrete_cosine_transform"},{"title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models (arXiv:2501.09747)","url":"https://arxiv.org/abs/2501.09747"}],"as_of":"","related_ids":["action-tokenizer","pi0-fast","byte-pair-encoding","action-binning","action-representation","action-chunking"],"name":"离散余弦变换","alt":"Discrete Cosine Transform","abbr":"DCT","aliases":["DCT 变换"],"one_liner":"把一段信号拆成不同频率余弦波加权和的变换，常用于数据压缩。","explanation":"离散余弦变换最早由 Nasir Ahmed 构想，1974 年他与 Natarajan、Rao 发表论文正式提出。它把一段离散信号表示成一组频率由低到高的余弦波的加权和，这组权重就是 DCT 系数。对平滑的信号，大部分能量集中在少数低频系数上，把高频的小系数舍掉或粗略量化，就能在损失很小的情况下大幅压缩，JPEG 图片和 MPEG、H.26x 视频都依赖它。具身领域用它来表示动作：高频控制下相邻时刻的动作很相似，逐步离散化会产生大量冗余 token。Physical Intelligence 2025 年提出的 FAST 分词器先对动作块做 DCT，再量化并用字节对编码压缩，让自回归 VLA 能学好高频灵巧任务。","example":"FAST 对动作块逐维做 DCT，量化后保留低频系数、多数高频系数变成 0，再用字节对编码压成少量 token；论文称配合 π0 在 1 万小时数据上训练时，效果与扩散版相当，训练时间最多缩短 5 倍。","related":["动作分词器","π0-FAST","字节对编码","分箱离散化","动作表示","动作分块"]},{"id":"gaussian-policy","category":"model","sec":5,"tier":3,"sources":[{"title":"OpenAI Spinning Up: Key Concepts in RL (Diagonal Gaussian Policies)","url":"https://spinningup.openai.com/en/latest/spinningup/rl_intro.html"},{"title":"leggedrobotics/rsl_rl (GitHub)","url":"https://github.com/leggedrobotics/rsl_rl"},{"title":"Soft Actor-Critic (Haarnoja et al., ICML 2018)","url":"https://arxiv.org/abs/1801.01290"}],"as_of":"","related_ids":["policy","deterministic-vs-stochastic-policy","proximal-policy-optimization","soft-actor-critic","entropy-regularization","continuous-action-regression"],"name":"高斯策略","alt":"Gaussian Policy","abbr":"","aliases":["高斯动作头","对角高斯策略","Diagonal Gaussian Policy"],"one_liner":"网络输出动作的均值和标准差，再从正态分布里采样动作的随机策略。","explanation":"高斯策略是连续动作强化学习里最常用的随机策略形式。神经网络根据观测输出每个动作维度的均值；标准差或者也由网络输出，或者作为不依赖观测的独立可学习参数，常以对数形式存储以保证为正。动作按「均值 + 标准差 × 标准正态噪声」采样，各维一般假设相互独立，所以也叫对角高斯策略。它的对数概率有解析式，方便算策略梯度，标准差大小直接决定探索幅度。PPO、SAC 等主流算法都用它，足式机器人运控的强化学习几乎都是这种策略。部署时通常直接取均值当动作。它只有一个峰，表示不了几种截然不同的合理动作，所以模仿学习里常被 GMM、扩散策略取代。","example":"在 Isaac Lab 里用 rsl_rl 的 PPO 训练四足行走：策略输出 12 个关节目标角的均值，再配一组可学习的标准差来采样探索；上真机时只用均值。","related":["策略","确定性策略 / 随机策略","近端策略优化","软演员-评论家","熵正则化","连续动作回归"]},{"id":"gaussian-mixture-model","category":"model","sec":5,"tier":3,"sources":[{"title":"Mixture model - Wikipedia","url":"https://en.wikipedia.org/wiki/Mixture_model"},{"title":"robomimic documentation: Algorithms (BC_GMM / BC_RNN_GMM)","url":"https://robomimic.github.io/docs/modules/algorithms.html"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"}],"as_of":"","related_ids":["mixture-density-network","action-multimodality","gaussian-policy","gaussian-mixture-regression-task-parameterized-gmm","robomimic","diffusion-policy"],"name":"高斯混合模型","alt":"Gaussian Mixture Model","abbr":"GMM","aliases":["混合高斯模型","GMM 策略","GMM 动作头"],"one_liner":"用几个高斯分布加权叠加来描述数据的概率模型，可以有多个峰。","explanation":"高斯混合模型假设数据来自 K 个高斯分布（正态分布）中的某一个，每个分量有自己的均值、方差（协方差）和权重，权重加起来等于 1。参数通常用期望最大化（EM）算法迭代估计：先算每个点属于各分量的概率，再按这些概率更新参数。它是经典的聚类和密度估计工具。机器人学习里有两种常见用法：一是传统示教学习用 GMM 配合高斯混合回归（GMR）从少量示教中编码轨迹；二是当策略的动作头，网络直接输出几组均值、方差和权重（即混合密度网络），表示同一画面下有几种合理动作。robomimic 的 BC-RNN-GMM 就是这种做法，也是扩散策略论文的主要对比基线之一。分量数要事先设定，高维动作下表达力有限。","example":"绕开桌上的障碍物时，从左绕和从右绕都对。单个高斯的策略会把两者平均成直直撞上去；GMM 策略可以给左、右各分配一个分量，采样时选中其中一个。","related":["混合密度网络","动作多峰性","高斯策略","高斯混合回归 / 任务参数化 GMM","RoboMimic","扩散策略"]},{"id":"mixture-density-network","category":"model","sec":5,"tier":3,"sources":[{"title":"Bishop, Mixture Density Networks (Aston University technical report, 1994)","url":"https://publications.aston.ac.uk/id/eprint/373/"},{"title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic, arXiv:2108.03298)","url":"https://arxiv.org/abs/2108.03298"}],"as_of":"","related_ids":["gaussian-mixture-model","action-multimodality","gaussian-policy","continuous-action-regression","diffusion-policy","inverse-kinematics"],"name":"混合密度网络","alt":"Mixture Density Network","abbr":"MDN","aliases":["GMM 策略头","高斯混合输出头"],"one_liner":"神经网络不直接输出一个值，而是输出一个高斯混合分布的参数。","explanation":"混合密度网络由 Christopher Bishop 在 1994 年的技术报告中提出。普通回归网络用均方误差训练，学到的是给定输入时输出的平均值；同一输入对应多个正确答案时，平均值往往哪个都不对。MDN 让网络输出若干个高斯分布的权重、均值和方差，拼成一个高斯混合模型，从而表示多峰的条件分布。Bishop 当时的演示之一就是机械臂逆运动学：同一个末端位置可对应多组关节角。机器人模仿学习中，它常作策略输出头来处理动作多峰性，如 robomimic 中的 GMM 策略；后来扩散策略等生成式动作头在很多任务上效果更好，但 MDN 训练和推理都便宜，仍常被拿来当基线。","example":"绕开桌上的障碍物，演示里有人从左绕、有人从右绕。用均方误差训练的策略会把两类动作平均成「直直撞上去」；MDN 输出两个高斯分量，分别对应左绕和右绕，执行时从中选一个即可。","related":["高斯混合模型","动作多峰性","高斯策略","连续动作回归","扩散策略","逆运动学"]},{"id":"energy-based-model","category":"model","sec":5,"tier":3,"sources":[{"title":"Implicit Behavioral Cloning (Florence et al., arXiv 2109.00137)","url":"https://arxiv.org/abs/2109.00137"},{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"},{"title":"Energy-based model - Wikipedia","url":"https://en.wikipedia.org/wiki/Energy-based_model"}],"as_of":"","related_ids":["behavior-cloning","action-multimodality","diffusion-policy","mixture-density-network","infonce-loss","generative-model"],"name":"能量模型","alt":"Energy-Based Model","abbr":"EBM","aliases":["基于能量的模型","隐式行为克隆","Implicit Behavioral Cloning","IBC"],"one_liner":"不直接输出答案，而是给「输入-输出」配对打分，分最低的就是答案。","explanation":"能量模型不直接预测输出，而是学一个打分函数 E(x, y)：输入和输出越匹配，「能量」越低，推理时去找能量最低的 y。机器人领域最有名的应用是谷歌 2021 年的隐式行为克隆（IBC）：网络给「观测-候选动作」打能量分，再用无导数优化或朗之万采样（带噪声的梯度下降）找出最低分动作。这样一个观测可以对应多个合理动作，不连续的策略也能表示，论文在接触丰富的真机任务上做到约 1 毫米的精度。代价是训练要采负样本来近似归一化常数，扩散策略论文指出 IBC 训练不稳定、难调参。之后建模多峰动作更多改用扩散策略和流匹配。","example":"同一张桌面图像下，把积木从左边推和从右边推都能完成任务。能量模型会在这两种动作上都给出低能量，推理时落到其中一个；均方误差回归则会输出两者的平均，结果哪边都不对。","related":["行为克隆","动作多峰性","扩散策略","混合密度网络","InfoNCE 损失","生成模型"]},{"id":"diffusion-action-head","category":"model","sec":5,"tier":2,"sources":[{"title":"Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)","url":"https://arxiv.org/html/2405.12213"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/html/2503.14734"},{"title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action (arXiv 2411.19650)","url":"https://arxiv.org/abs/2411.19650"}],"as_of":"","related_ids":["action-head","action-expert","diffusion-policy","diffusion-transformer","action-multimodality","continuous-action-regression"],"name":"扩散动作头","alt":"Diffusion Action Head","abbr":"","aliases":["扩散头","Diffusion Head"],"one_liner":"接在策略主干后面、用扩散去噪的方式生成连续动作的输出模块。","explanation":"扩散动作头是动作头（策略网络里最后负责输出动作的部分）的一种。主干网络，比如 Transformer 或 VLM，先把图像、语言和机器人状态编码成特征；扩散头以这些特征为条件，从随机噪声出发多步去噪，生成一段连续动作。和直接回归相比，它能表达多峰的动作分布，示范里「从左绕」和「从右绕」都合理时，不会平均成一条撞上去的中间路线；和把动作离散成 token 相比，它保留了连续数值的精度。代价是推理要多次调用网络。它可大可小：Octo 用一个 3 层 MLP，GR00T N1、CogACT 则用独立的扩散 Transformer 作动作模块；π0 这类用流匹配的动作专家原理相近，也常被放在一起讨论。","example":"Octo 的 Transformer 主干输出读出（readout）token 的嵌入，交给 3 层 MLP 构成的扩散头，用 20 步去噪生成一段动作。论文对比发现，换成 MSE 回归头时机器人动作迟缓犹豫，换成离散动作头时精度不够、常常抓空。","related":["动作头","动作专家","扩散策略","扩散 Transformer","动作多峰性","连续动作回归"]},{"id":"residual-policy","category":"model","sec":5,"tier":3,"sources":[{"title":"Residual Policy Learning (Silver et al., arXiv 1812.06298)","url":"https://arxiv.org/abs/1812.06298"},{"title":"Residual Reinforcement Learning for Robot Control (Johannink et al., arXiv 1812.03201)","url":"https://arxiv.org/abs/1812.03201"},{"title":"From Imitation to Refinement -- Residual RL for Precise Assembly (ResiP, arXiv 2407.16677)","url":"https://arxiv.org/html/2407.16677"}],"as_of":"2024-07","related_ids":["residual-reinforcement-learning","diffusion-policy","reinforcement-fine-tuning","action-chunking","model-predictive-control","teacher-student-distillation"],"name":"残差策略","alt":"Residual Policy","abbr":"","aliases":["残差策略学习","Residual Policy Learning","RPL"],"one_liner":"在已有控制器或策略的输出上再学一个修正量，两者相加作为最终动作。","explanation":"残差策略指不从零学整个策略，而是保留一个现成的基础策略（手工控制器、模型预测控制，或模仿学习训好的策略），另训练一个网络只输出对它的修正量，最终动作等于基础动作加残差。2018 年 MIT 的 Silver 等人提出残差策略学习，几乎同时 Johannink、Levine 等人在真实机器人的积木装配上验证了残差强化学习。好处是基础策略已经能把任务做个大概，残差只需补上难以建模的部分，比如摩擦、接触和标定误差，探索空间小、样本效率高，也更安全。近年常见的用法是冻结一个扩散策略或 VLA，再用强化学习训练一个轻量的逐步闭环残差，提升精细装配等任务的成功率。","example":"ResiP（Pulkit Agrawal 组，2024）冻结一个带动作分块的扩散策略，用 PPO 训练逐步闭环的残差策略做修正，在 FurnitureBench 家具装配等仿真任务上大幅提高成功率，再通过教师-学生蒸馏迁移到真机。","related":["残差强化学习","扩散策略","强化学习微调","动作分块","模型预测控制","教师-学生蒸馏"]},{"id":"end-to-end","category":"model","sec":6,"tier":1,"sources":[{"title":"End-to-End Training of Deep Visuomotor Policies (arXiv 1504.00702)","url":"https://arxiv.org/abs/1504.00702"}],"as_of":"","related_ids":["visuomotor-policy","vision-language-action-model","hierarchical-architecture","sense-plan-act","imitation-learning","end-to-end-training-of-deep-visuomotor-policies"],"name":"端到端","alt":"End-to-End","abbr":"E2E","aliases":["端到端模型","End-to-End Model","端到端学习","End-to-End Learning"],"one_liner":"用一个模型从原始传感器输入直接输出控制指令，中间不拆成人工设计的模块。","explanation":"传统机器人系统是模块化流水线：感知模块识别物体和位姿，规划模块算路径，控制模块跟踪轨迹，各模块单独设计、单独调参，彼此通过人定义的接口（如物体坐标）传递信息。端到端则把整条链路交给一个神经网络，从相机图像、本体状态等原始输入直接输出关节位置或力矩指令，用同一个目标整体训练。机器人领域的代表性早期工作是 Levine、Finn 等人的深度视觉运动策略（2015 年预印本、2016 年发表），用约 9.2 万参数的卷积网络把图像直接映射成电机力矩。好处是少了人工设计，误差不会在模块间层层传递，性能能随数据增长；代价是需要大量数据，出了错难以定位原因。如今的 VLA 大多被称为端到端模型。","example":"Levine 等人让 PR2 机器人的策略网络直接读取原始相机图像（外加关节角等机器人自身状态）、输出各关节电机力矩，学会了拧瓶盖、把衣架挂到衣杆上等任务，测试时没有单独的物体检测或位姿估计模块。","related":["视觉运动策略","视觉-语言-动作模型","分层架构","感知-规划-行动范式","模仿学习","端到端视觉运动策略（引导策略搜索）"]},{"id":"embodied-foundation-model","category":"model","sec":6,"tier":1,"sources":[{"title":"Foundation Models in Robotics: Applications, Challenges, and the Future (arXiv 2312.07843)","url":"https://arxiv.org/abs/2312.07843"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"","related_ids":["foundation-model","vision-language-action-model","generalist-policy","embodied-reasoning-model","world-model","pre-training"],"name":"具身大模型","alt":"Embodied Foundation Model","abbr":"","aliases":["机器人基础模型","具身基础模型","机器人大模型","Robot Foundation Model","RFM"],"one_liner":"在大量跨机器人、跨任务数据上预训练，能适配多种机器人和任务的大模型。","explanation":"具身大模型是基础模型概念在机器人上的延伸。基础模型指在大规模、多样数据上预训练、能适配许多下游任务的模型，比如 GPT。具身大模型同样先在跨机器人、跨任务的数据上预训练，再用少量数据后训练到具体任务或具体本体，而不是每个任务从零训一个专用策略。这个词没有统一的边界：狭义多指直接输出动作的通用策略，如 π0、GR00T N1、Gemini Robotics 等 VLA；广义上也包括负责理解和规划的具身推理模型，以及用来生成数据、评估策略的世界模型。Firoozi 等人 2023 年的综述认为，这类模型面临的主要障碍是机器人数据稀缺、缺少安全保证和实时性要求。","example":"π0 用超过 1 万小时的机器人数据预训练，其中自采数据覆盖 7 种机器人构型、68 个任务；之后再用精选数据后训练，完成叠衣服、组装纸箱等长流程任务。","related":["基础模型","视觉-语言-动作模型","通用策略","具身推理模型","世界模型","预训练"]},{"id":"large-behavior-model","category":"model","sec":6,"tier":2,"sources":[{"title":"TRI LBM 项目页：A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","url":"https://toyotaresearchinstitute.github.io/lbm1/"},{"title":"TRI News (2023-09-19): Toyota Research Institute Unveils Breakthrough in Teaching Robots New Behaviors","url":"https://www.tri.global/news/toyota-research-institute-unveils-breakthrough-teaching-robots-new-behaviors"},{"title":"TRI News (2025-08-20): AI-Powered Robot by Boston Dynamics and TRI Takes a Key Step Towards General-Purpose Humanoids","url":"https://tri.global/news/ai-powered-robot-boston-dynamics-and-toyota-research-institute-takes-key-step-towards-general"}],"as_of":"2025-08","related_ids":["toyota-research-institute","diffusion-policy","foundation-model","behavior-foundation-model","vision-language-action-model","boston-dynamics-atlas-2"],"name":"大行为模型","alt":"Large Behavior Model","abbr":"LBM","aliases":["大型行为模型","TRI 大行为模型","Large Behavior Model (Toyota Research Institute)","TRI LBM"],"one_liner":"丰田研究院提出的多任务机器人通用策略，在大量示范数据上预训练。","explanation":"大行为模型是丰田研究院（TRI）类比大语言模型提出的说法，指在大量多任务机器人数据上预训练、直接输出动作的通用操作策略。TRI 在 2023 年 9 月发布扩散策略技能学习成果时提出要做 LBM；2025 年 7 月的论文给出具体实现：一个扩散 Transformer，输入腕部和场景相机图像、本体状态和语言指令，一次预测 16 步动作，训练数据约 1700 小时，其中约 468 小时是自家双臂遥操作。结论是预训练后学新任务所需数据少 3–5 倍，性能随预训练规模平稳提升。TRI 与波士顿动力 2024 年 10 月起合作，2025 年 8 月展示了单个 LBM 控制电动 Atlas 全身、连续完成边走边搬和分拣装箱。","example":"2025 年 8 月的演示中，Atlas 由一个 LBM 同时控制手脚，走动、下蹲、搬起零件并分拣装箱；有人把合上的箱子沿地面推过来时，它也能调整后继续干活。","related":["丰田研究院","扩散策略","基础模型","行为基础模型","视觉-语言-动作模型","波士顿动力 Atlas（电动版）"]},{"id":"vision-language-action-model","category":"model","sec":6,"tier":1,"sources":[{"title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv:2307.15818)","url":"https://arxiv.org/abs/2307.15818"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)","url":"https://arxiv.org/abs/2406.09246"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"2024-10","related_ids":["vision-language-model","rt-2","openvla","pi0","action-tokenizer","action-expert"],"name":"视觉-语言-动作模型","alt":"Vision-Language-Action Model","abbr":"VLA","aliases":["视觉语言动作模型","VLA 模型","Vision-Language-Action Models"],"one_liner":"看图、听懂语言指令，直接输出机器人动作的大模型。","explanation":"视觉-语言-动作模型以相机图像和自然语言指令为输入，直接输出机器人控制动作，通常由预训练的视觉语言模型（VLM，能看图回答问题的大模型）再用机器人数据训练而来。这个名字来自谷歌 DeepMind 2023 年 7 月的 RT-2 论文：它把动作写成文本 token，和网页图文数据一起训练，让机器人借用互联网知识处理没见过的物体和指令。之后有开源的 OpenVLA（7B 参数，用 97 万条机器人演示训练），以及 Physical Intelligence 的 π0（用流匹配生成连续动作块）。各家的主要差别在动作怎么输出：离散 token、扩散或流匹配动作头，或两者混合。","example":"给 OpenVLA 一张桌面照片和指令「把茄子放进锅里」，它输出 7 个动作 token，解码成机械臂末端的位移、旋转和夹爪开合。","related":["视觉语言模型","RT-2","OpenVLA","π0","动作分词器","动作专家"]},{"id":"parallel-decoding","category":"model","sec":6,"tier":3,"sources":[{"title":"Non-Autoregressive Neural Machine Translation (arXiv:1711.02281)","url":"https://arxiv.org/abs/1711.02281"},{"title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT, arXiv:2502.19645)","url":"https://arxiv.org/abs/2502.19645"}],"as_of":"","related_ids":["autoregressive-decoding","action-chunking","openvla-oft","causal-attention","discrete-diffusion","speculative-decoding"],"name":"并行解码","alt":"Parallel Decoding","abbr":"","aliases":["非自回归解码","Non-autoregressive Decoding"],"one_liner":"一次前向同时输出整段序列，而不是像自回归那样逐个 token 生成。","explanation":"并行解码是相对自回归解码而言的：自回归模型每次只预测下一个 token，输出 N 个 token 要跑 N 次前向；并行解码让模型一次前向同时预测所有位置。它最早在机器翻译里以「非自回归翻译」被系统研究（Gu 等，2017），延迟降了约一个数量级，代价是位置之间的依赖建模变弱、质量略降。VLA 里这个问题很突出：OpenVLA 把每个动作维度离散成一个 token 逐个生成，7 维动作要跑 7 次，做动作分块后更慢。OpenVLA-OFT 改为输入一组空的动作占位嵌入，把因果注意力掩码换成双向注意力，一次前向输出整段动作块。离散扩散等方法也属于并行或少步并行解码。","example":"OpenVLA-OFT 在 LIBERO 上用并行解码加动作分块（每次输出 8 步、每步 7 维动作），动作吞吐从 OpenVLA 的 4.2 Hz 提到 108.8 Hz，约快 26 倍。","related":["自回归解码","动作分块","OpenVLA-OFT","因果注意力","离散扩散","投机解码"]},{"id":"action-expert","category":"model","sec":6,"tier":1,"sources":[{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/abs/2410.24164"},{"title":"π0 论文 HTML 全文（动作专家参数量与结构）","url":"https://arxiv.org/html/2410.24164"}],"as_of":"","related_ids":["vision-language-action-model","action-head","flow-matching","mixture-of-experts","pi0","backbone-network"],"name":"动作专家","alt":"Action Expert","abbr":"","aliases":["动作专家模块"],"one_liner":"VLA 里专门负责生成连续动作的一组独立参数，与看图读指令的主干分工。","explanation":"动作专家这个说法因 Physical Intelligence 2024 年的 π0 流行开来。π0 以约 30 亿参数的 PaliGemma 视觉语言模型为主干，另加一组约 3 亿参数、从零初始化的 Transformer 权重，专门处理机器人状态和动作 token，这组权重就叫动作专家。两部分在同一套注意力层里交换信息，但各用各的权重，类似只有两个专家的混合专家；信息单向流动：动作 token 能看到图文 token，反过来不行，以免主干偏离原来的预训练。动作专家用流匹配生成连续的动作块；论文发现，给状态和动作 token 单独配一组权重，比和主干共用权重效果更好。π0.5、SmolVLA 等沿用了这个名字，GR00T N1 的动作模块也是同类设计。","example":"π0 推理时，PaliGemma 主干先编码相机图像和语言指令，动作专家再用 10 步流匹配积分输出 50 步长的连续动作块，控制频率最高可达 50Hz。","related":["视觉-语言-动作模型","动作头","流匹配","混合专家模型","π0","骨干网络"]},{"id":"mixture-of-transformers","category":"model","sec":6,"tier":3,"sources":[{"title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models (arXiv:2411.04996)","url":"https://arxiv.org/abs/2411.04996"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/abs/2410.24164"},{"title":"Emerging Properties in Unified Multimodal Pretraining (BAGEL, arXiv:2505.14683)","url":"https://arxiv.org/abs/2505.14683"}],"as_of":"2025-05","related_ids":["mixture-of-experts","action-expert","pi0","bagel","unified-multimodal-model","self-attention"],"name":"混合 Transformer 架构","alt":"Mixture-of-Transformers","abbr":"MoT","aliases":["Transformer 混合架构","Mixture-of-Transformer-Experts"],"one_liner":"不同模态各用一套 Transformer 参数，但每层通过全局自注意力互相看见。","explanation":"混合 Transformer 架构由斯坦福的 Weixin Liang 与 Meta 研究者在 2024 年 11 月提出。它把前馈网络、注意力投影矩阵、层归一化等参数按模态分开：文本 token 用文本那套权重，图像 token 用图像那套，但每层的自注意力仍在整条序列上计算，各模态照常交互。与混合专家模型（MoE，由路由器给每个 token 挑专家）不同，MoT 按模态固定分工，不用学路由。论文报告在 7B 规模的文本加图像生成设置中，它只用约 55.8% 的计算量就追平稠密模型。具身领域 π0 的「VLM 主干 + 动作专家」是类似做法（论文称其类似两个成员的混合专家），字节 BAGEL 则直接采用 MoT 结构。","example":"π0 的约 30 亿参数主干来自 PaliGemma，另加约 3 亿参数的动作专家：图像和文字 token 走主干权重，机器人状态和带噪动作 token 走动作专家权重，两部分在每层注意力里互相可见。","related":["混合专家模型","动作专家","π0","BAGEL","统一多模态模型","自注意力"]},{"id":"hybrid-autoregressive-diffusion-architecture","category":"model","sec":6,"tier":3,"sources":[{"title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model (arXiv:2408.11039)","url":"https://arxiv.org/abs/2408.11039"},{"title":"Autoregressive Image Generation without Vector Quantization (MAR, arXiv:2406.11838)","url":"https://arxiv.org/abs/2406.11838"},{"title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified VLA Model (arXiv:2503.10631)","url":"https://arxiv.org/abs/2503.10631"}],"as_of":"2025-06","related_ids":["hybridvla","diffusion-model","autoregressive-decoding","unified-multimodal-model","diffusion-action-head","action-tokenizer"],"name":"自回归-扩散混合架构","alt":"Hybrid Autoregressive-Diffusion Architecture","abbr":"","aliases":["自回归与扩散混合模型","AR + Diffusion","Hybrid AR-Diffusion"],"one_liner":"同一个模型里，离散内容用自回归逐个生成、连续内容用扩散生成的架构。","explanation":"自回归指像大语言模型那样按顺序逐个预测下一个 token，擅长文本、推理这类离散内容；扩散模型从噪声出发逐步去噪，擅长图像、动作这类连续高维数据。混合架构把两者放进同一个网络。Meta 等机构 2024 年提出的 Transfusion 用一个 Transformer 处理图文混排序列，对文字算下一个 token 预测损失、对图像算扩散损失；何恺明等人的 MAR 则在自回归框架里用扩散损失建模每个连续值 token，省掉了向量量化。机器人领域，2025 年的 HybridVLA 让一个大语言模型同时做扩散去噪和自回归动作预测，再自适应地融合两路动作。动机在于：把连续动作硬切成离散 token 会损失精度，纯扩散的动作头又较难直接利用语言模型的推理能力。","example":"HybridVLA 在同一个语言模型里，既通过扩散去噪生成连续动作，又自回归地预测离散化的动作 token，执行时把两路结果融合成最终动作。","related":["HybridVLA","扩散模型","自回归解码","统一多模态模型","扩散动作头","动作分词器"]},{"id":"unified-action-space","category":"model","sec":6,"tier":2,"sources":[{"title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation (arXiv 2410.07864)","url":"https://arxiv.org/html/2410.07864"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/html/2410.24164"},{"title":"Universal Actions for Enhanced Embodied Foundation Models (arXiv 2501.10105)","url":"https://arxiv.org/abs/2501.10105"}],"as_of":"","related_ids":["cross-embodiment","action-space","embodiment-specific-head","latent-action","cross-embodiment-data","rdt-1b"],"name":"统一动作空间","alt":"Unified Action Space","abbr":"","aliases":["通用动作空间","Universal Action Space","物理可解释统一动作空间"],"one_liner":"把不同机器人的动作按物理含义放进同一个固定格式，便于混合训练。","explanation":"不同机器人的动作格式各不相同：单臂 7 维、双臂 14 维，有的给关节角，有的给末端位姿（夹爪在空间中的位置和朝向）。想用多种机器人的数据训练同一个模型，就得先把动作对齐成统一格式，这就是统一动作空间。最直接的做法是定一个足够长的向量，每个位置固定代表一种物理量，缺的维度补零：清华团队的 RDT-1B 用 128 维，左臂、右臂、底盘各有固定槽位；π0 把所有机器人的动作补零到 18 维。另一条路是学一个抽象的潜在动作空间，如 UniAct，再为每种机器人加一个小解码器还原成具体指令。它是跨本体训练的基础。","example":"把一台 6 自由度单臂机器人的数据放进 RDT-1B 的 128 维向量时，单臂按右臂处理，关节角只填右臂关节槽位的前 6 格，左臂和底盘部分全部填 0。","related":["跨本体","动作空间","本体专属头","潜在动作","跨本体数据","RDT-1B"]},{"id":"embodiment-specific-head","category":"model","sec":6,"tier":3,"sources":[{"title":"Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers (HPT, arXiv:2409.20537)","url":"https://arxiv.org/abs/2409.20537"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv HTML)","url":"https://arxiv.org/html/2503.14734v2"}],"as_of":"","related_ids":["cross-embodiment","action-head","unified-action-space","heterogeneous-pre-trained-transformers","nvidia-isaac-gr00t-n1","embodiment"],"name":"本体专属头","alt":"Embodiment-specific Head","abbr":"","aliases":["本体特定输出头","本体专属解码器","Embodiment-specific Decoder"],"one_liner":"跨本体模型里为每种机器人单独配的输出层，把共享特征转成该机器人的动作。","explanation":"不同机器人的状态和动作维度各不相同：单臂加夹爪可能是 7 维，双臂加灵巧手可能有几十维。跨本体模型通常让大部分参数共享，只在输入和输出两端为每种本体配一个小网络，输出端这一块就叫本体专属头，一般是一个 MLP 或小型解码器，负责把共享主干的表征映射成该本体对应维度和含义的动作。MIT 与 Meta 的 Lirui Wang、何恺明等人 2024 年提出的异构预训练 Transformer（HPT）采用「本体专属 stem + 共享主干 + 本体专属头」的设计；英伟达 GR00T N1 也为每种本体配 MLP 编码状态和动作，并用专属动作解码器输出。另一条路线是统一动作空间，把所有本体的动作填进同一个大向量。","example":"GR00T N1 在最后一个 DiT 模块之后接一个本体专属的 MLP 动作解码器输出动作，从而用同一个主干控制从桌面机械臂到带灵巧手的人形机器人等不同本体。","related":["跨本体","动作头","统一动作空间","异构预训练 Transformer","GR00T N1 系列","本体"]},{"id":"state-proprioception-encoder","category":"model","sec":6,"tier":2,"sources":[{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/abs/2410.24164"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/abs/2503.14734"},{"title":"Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)","url":"https://arxiv.org/abs/2405.12213"}],"as_of":"","related_ids":["proprioception","projector-connector","embodiment-specific-head","action-state-normalization","causal-confusion","history-encoder"],"name":"状态编码器","alt":"State / Proprioception Encoder","abbr":"","aliases":["本体感知编码器","Proprioception Encoder","State Encoder","状态投影层","State Projector"],"one_liner":"把机器人关节角、夹爪开合等自身状态变成模型可用向量的小网络。","explanation":"状态编码器处理机器人的本体感知信息，即关节角、末端位姿、夹爪开合度等不靠相机就能读到的自身状态。这些是几维到几十维的数值向量，要先映射到模型的嵌入维度，才能和图像、文字 token 一起送进 Transformer。实现通常很简单：π0 和 ACT 各用一个线性层；GR00T N1 为每种本体各配一个 MLP，以适配不同机器人的状态维度。状态输入让策略知道手臂此刻在哪，但也有副作用：Octo 团队发现加入本体状态后效果常变差，推测是模型过度依赖状态与动作之间的强相关，即因果混淆。","example":"双臂 ALOHA 的状态是两臂共 14 个关节位置；ACT 用一个线性层把这 14 维向量投影成 512 维，作为一个 token 与图像特征一起送入 Transformer 编码器。","related":["本体感知","投影层","本体专属头","动作与状态归一化","因果混淆","历史编码器"]},{"id":"history-encoder","category":"model","sec":6,"tier":3,"sources":[{"title":"RMA: Rapid Motor Adaptation for Legged Robots (Kumar et al., RSS 2021)","url":"https://arxiv.org/abs/2107.04034"},{"title":"RMA paper full text (ar5iv)","url":"https://ar5iv.labs.arxiv.org/html/2107.04034"}],"as_of":"","related_ids":["rapid-motor-adaptation","privileged-information","teacher-student-distillation","proprioception","system-identification","domain-randomization"],"name":"历史编码器","alt":"History Encoder","abbr":"","aliases":["适应模块","Adaptation Module","历史观测编码器"],"one_liner":"把最近一段观测和动作压成一个向量，让策略推断当下的环境状况。","explanation":"历史编码器是策略网络里专门处理「过去若干步」信息的模块，常用一维卷积、RNN 或 Transformer 实现。最典型的用法来自足式机器人强化学习：真实世界里地面摩擦、负载、电机状态等参数测不到，但会在最近的状态-动作序列里留下痕迹。RMA（Kumar 等，RSS 2021）分两阶段训练：先在仿真里让基础策略使用由特权信息（只有仿真里才拿得到的真值参数）压缩成的 8 维外参向量；再训练一个「适应模块」，只看最近 50 步（0.5 秒）的状态和动作历史去回归这个向量。部署时适应模块以 10 Hz、基础策略以 100 Hz 运行。这种先教师、后学生的思路被后来大量足式和人形运控工作沿用。","example":"给宇树 A1 背上突然加一个重物，RMA 的适应模块从最近半秒的关节响应里估计出新的外参，基础策略随之调整步态，不到一秒就适应，不需要重新训练。","related":["快速运动适应","特权信息","教师-学生蒸馏","本体感知","系统辨识","域随机化"]},{"id":"point-cloud-encoder","category":"model","sec":6,"tier":3,"sources":[{"title":"PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation (arXiv:1612.00593)","url":"https://arxiv.org/abs/1612.00593"},{"title":"3D Diffusion Policy (arXiv:2403.03954)","url":"https://arxiv.org/abs/2403.03954"}],"as_of":"","related_ids":["point-cloud","pointnet-pointnet-plus-plus","point-transformer-v3","3d-diffusion-policy","farthest-point-sampling","vision-encoder"],"name":"点云编码器","alt":"Point Cloud Encoder","abbr":"","aliases":["点云骨干网络","Point Cloud Backbone"],"one_liner":"把一堆无序的三维点转换成神经网络能用的特征向量的模块。","explanation":"点云编码器把深度相机或激光雷达得到的点云（一组带 xyz 坐标、有时还带颜色的无序三维点）转换成特征。难点在于点没有固定顺序、数量也不固定，不能直接套用处理图像网格的卷积。2016 年斯坦福的 PointNet 用共享的多层感知机逐点提特征，再用最大池化这种与顺序无关的操作汇总，开创了直接处理点云的路线；之后有 PointNet++、Point Transformer 系列等更强的结构。具身智能里用 3D 输入的策略都离不开它：3D 扩散策略（DP3）先用最远点采样把点云降到 512 或 1024 个点，再用三层 MLP 加最大池化的轻量编码器得到 64 维特征，论文消融中它比 PointNet++ 等复杂编码器效果更好。","example":"DP3 的点云编码器故意不用颜色通道，只用几何坐标，论文称这样对物体外观变化的泛化更好。","related":["点云","PointNet","Point Transformer V3","3D 扩散策略","最远点采样","视觉编码器"]},{"id":"3d-vla","category":"model","sec":6,"tier":3,"sources":[{"title":"3D-VLA: A 3D Vision-Language-Action Generative World Model (arXiv 2403.09631)","url":"https://arxiv.org/abs/2403.09631"},{"title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model (arXiv 2501.15830)","url":"https://arxiv.org/abs/2501.15830"},{"title":"SpatialVLA GitHub","url":"https://github.com/SpatialVLA/SpatialVLA"}],"as_of":"2025-01","related_ids":["vision-language-action-model","spatial-reasoning","point-cloud","depth-estimation","3d-diffusion-policy","world-model"],"name":"3D VLA","alt":"3D / Spatial Vision-Language-Action Model","abbr":"","aliases":["空间 VLA","Spatial VLA","SpatialVLA","SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","3D-VLA","3D-VLA: A 3D Vision-Language-Action Generative World Model"],"one_liner":"把深度、点云、3D 位置等空间信息显式放进模型的 VLA","explanation":"普通 VLA（视觉-语言-动作模型，看图听指令直接输出动作）大多只吃 2D 图片，但机器人的动作发生在三维空间里，距离、高度、遮挡光靠 2D 图很难判断准。3D VLA 泛指在输入或中间表示里加入深度、点云或 3D 位置编码的一类 VLA。代表作有两篇：UMass Amherst 团队 2024 年 3 月的 3D-VLA，在 3D 大语言模型上加入交互 token，并用扩散模型生成目标图像和目标点云来「想象」操作后的场景；Qu 等人 2025 年 1 月的 SpatialVLA（RSS 2025），基于 PaliGemma2，用 Ego3D 位置编码把 3D 空间信息注入视觉特征，用自适应动作网格把连续动作离散成空间 token，并在 OXE 和 RH20T 的 110 万条真机轨迹上预训练。这类方法主要想让模型在换视角、换机器人时空间判断更稳。","example":"SpatialVLA-4B 把每个图像块对应的 3D 位置编码进视觉 token，不需要相机标定，换到新机器人时可以重新划分动作网格来适配。","related":["视觉-语言-动作模型","空间推理","点云","深度估计","3D 扩散策略","世界模型"]},{"id":"force-aware-vision-language-action-model","category":"model","sec":6,"tier":3,"sources":[{"title":"ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation (arXiv 2505.22159)","url":"https://arxiv.org/abs/2505.22159"},{"title":"ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness (arXiv 2603.15169)","url":"https://arxiv.org/abs/2603.15169"},{"title":"Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning (arXiv 2608.07558)","url":"https://arxiv.org/abs/2608.07558"}],"as_of":"2026-09","related_ids":["vision-language-action-model","six-axis-force-torque-sensor","contact-rich-manipulation","hybrid-force-position-control","vision-tactile-language-action-model","mixture-of-experts"],"name":"力觉 VLA","alt":"Force-aware Vision-Language-Action Model","abbr":"","aliases":["力感知 VLA","Force-aware VLA","力反馈 VLA"],"one_liner":"在视觉和语言之外，把力/力矩信号也当作输入的 VLA 模型。","explanation":"力觉 VLA 指把六维力/力矩传感器（测三个方向的力和三个方向的力矩）等力信号，作为与图像、语言并列的输入模态的视觉-语言-动作模型。普通 VLA 只靠相机，而插插头、擦桌子、装配这类接触丰富任务里，是否接触到位、用了多大力往往看不出来，容易卡住或用力过猛。代表工作 ForceVLA（Yu 等，NeurIPS 2025）以 π0 为基础，用力感知混合专家模块（FVLMoE）在动作解码阶段融合力 token，五个接触任务上比 π0 基线平均高 23.2%，而把力直接拼到输入上只带来很小提升。2026 年 3 月的 ForceVLA2 又加入力位混合控制，据论文报告比 π0、π0.5 分别高 48% 和 35%。","example":"插插头时，插头顶到插座边缘，图像上几乎看不出区别，力传感器读数却会突变；ForceVLA 用这个信号修正位姿，插插头这类任务最高达到 80% 成功率。","related":["视觉-语言-动作模型","六维力传感器","接触丰富操作","力位混合控制","视觉-触觉-语言-动作模型","混合专家模型"]},{"id":"vision-tactile-language-action-model","category":"model","sec":6,"tier":3,"sources":[{"title":"VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation (arXiv:2505.09577)","url":"https://arxiv.org/abs/2505.09577"},{"title":"VT-Bridge: Bridging Pretrained Foundation VLAs to VTLAs via Lightweight Residual Adaptation (arXiv:2609.22606)","url":"https://arxiv.org/abs/2609.22606"}],"as_of":"2026-09","related_ids":["vision-language-action-model","vision-based-tactile-sensor","visuo-tactile-fusion","contact-rich-manipulation","peg-in-hole-insertion","force-aware-vision-language-action-model"],"name":"视觉-触觉-语言-动作模型","alt":"Vision-Tactile-Language-Action Model","abbr":"VTLA","aliases":["触觉 VLA","视触觉 VLA","Tactile VLA"],"one_liner":"在 VLA 基础上加入触觉输入的机器人模型，专攻需要「手感」的接触类任务。","explanation":"VTLA 指把触觉传感器信号和相机图像、语言指令一起输入、输出机器人动作的模型，是 VLA（视觉-语言-动作模型）的扩展。这个叫法出自 2025 年 5 月的论文《VTLA》，作者来自三星中国研究院、北京智源研究院和中科院自动化所：他们以 Qwen2-VL 7B 为底座，把夹爪指尖 GelStereo 视触觉传感器的读数整理成图像式输入，在仿真轴孔插装数据上训练，再用直接偏好优化（DPO）缓解「按 token 分类」和连续控制之间的不匹配。加触觉的原因是插装、拧盖、抓易碎物这类接触丰富任务里，接触点常被手指挡住，视觉看不出力的大小和是否打滑。现在 VTLA 已成为一类模型的统称，2026 年仍有工作研究如何用少量数据把现成 VLA 改造成 VTLA。","example":"原始 VTLA 论文的真机实验中，模型根据相机画面和指尖触觉图像逐步调整插入位置和角度，方形轴孔在 0.6 毫米间隙下插装成功率 95%，对没见过的轴形状也达到 95%–100%。","related":["视觉-语言-动作模型","视触觉传感器","视触觉融合","接触丰富操作","轴孔装配","力觉 VLA"]},{"id":"memory-augmented-vla","category":"model","sec":6,"tier":3,"sources":[{"title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation (arXiv:2508.19236)","url":"https://arxiv.org/abs/2508.19236"},{"title":"Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning (MIKASA, arXiv:2502.10550)","url":"https://arxiv.org/abs/2502.10550"}],"as_of":"2026-03","related_ids":["memory-augmented-vla","vision-language-action-model","embodied-memory","long-horizon-task","partially-observable-markov-decision-process","history-encoder"],"name":"记忆增强 VLA","alt":"Memory-Augmented VLA (Memory-Augmented Vision-Language-Action Model)","abbr":"","aliases":["带记忆的 VLA","Memory VLA"],"one_liner":"给 VLA 加上历史记忆模块，让它依据过去发生的事而不只是当前画面来决策。","explanation":"记忆增强 VLA 是一类研究方向的统称，不特指某个模型。主流 VLA（视觉-语言-动作模型）大多只看当前一帧或最近几帧来出动作，默认当前画面包含决策所需的全部信息。但很多操作任务依赖历史：按钮按下后外观不变，看不出按过没有；物体被盖住后画面里也看不到。把长历史帧全塞进模型又会让 token 数和推理时间暴涨。这类方法额外维护一个记忆：把过去的观测压缩成特征存入记忆库，决策时检索相关条目、与当前特征融合后交给动作头。代表工作有清华与原力灵机等 2025 年提出的 MemoryVLA；MIKASA-Robo 基准专门用 32 个桌面操作任务测试这种记忆能力。","example":"MemoryVLA 的真机任务「按指定颜色顺序按下三个按钮」里，按过和没按过的按钮看起来一样，只看当前画面无法判断进度；MemoryVLA 靠记忆库保存的历史信息完成任务，论文报告其在长程时序任务上比最强基线高出 26 分。","related":["MemoryVLA","视觉-语言-动作模型","具身记忆","长程任务","部分可观测马尔可夫决策过程","历史编码器"]},{"id":"hierarchical-architecture","category":"model","sec":7,"tier":1,"sources":[{"title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances (SayCan, arXiv:2204.01691)","url":"https://arxiv.org/abs/2204.01691"},{"title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models (arXiv:2502.19417)","url":"https://arxiv.org/html/2502.19417"},{"title":"Helix: A Vision-Language-Action Model for Generalist Humanoid Control (Figure)","url":"https://www.figure.ai/news/helix"}],"as_of":"2025-02","related_ids":["dual-system-architecture","braincerebellum-architecture","end-to-end","saycan","hi-robot","long-horizon-task"],"name":"分层架构","alt":"Hierarchical Architecture","abbr":"","aliases":["分层策略","分层方案","Hierarchical Policy","高层规划 + 底层执行","分层 VLA"],"one_liner":"把机器人决策拆成高层规划和底层执行两级，分别由不同模型负责。","explanation":"分层架构把「做什么」和「怎么做」拆开：高层通常是大语言模型或视觉语言模型，读懂指令和画面，把长任务拆成一步步子任务，运行频率低；底层是技能库、VLA 策略或运动控制器，把每个子任务变成电机指令，运行频率高。两层之间可以传语言指令、关键点或隐向量。早期代表是谷歌 2022 年的 SayCan，让大语言模型从机器人已有的技能里挑下一步；2025 年 Physical Intelligence 与斯坦福、伯克利的 Hi Robot 让视觉语言模型输出简短的语言指令，交给 π0 执行。它常被拿来和端到端（一个模型直接从输入算到动作）对比，但两者并不互斥：国内常说的大小脑、快慢双系统都属于分层思路，而 Helix 这类快慢双系统虽分两层，却是端到端联合训练的。","example":"Figure 的 Helix 分两层：70 亿参数的视觉语言模型以 7–9Hz 理解场景和指令，8000 万参数的底层策略以 200Hz 把它给出的语义表示变成连续动作。","related":["快慢双系统","大脑 / 小脑（大小脑架构）","端到端","SayCan","Hi Robot","长程任务"]},{"id":"embodied-reasoning-model","category":"model","sec":7,"tier":1,"sources":[{"title":"Gemini Robotics 1.5 brings AI agents into the physical world (Google DeepMind)","url":"https://deepmind.google/discover/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/"},{"title":"Gemini Robotics 模型页 (Google DeepMind)","url":"https://deepmind.google/models/gemini-robotics/"},{"title":"RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration (arXiv 2505.03673)","url":"https://arxiv.org/abs/2505.03673"}],"as_of":"2026-09","related_ids":["embodied-reasoning","dual-system-architecture","hierarchical-architecture","gemini-robotics-er","robobrain","vision-language-action-model"],"name":"具身推理模型","alt":"Embodied Reasoning Model","abbr":"ER","aliases":["具身大脑模型","具身大脑","ER 模型","Embodied Brain Model","大脑"],"one_liner":"专门做物理世界理解和任务规划的多模态大模型，常被称为机器人的「大脑」。","explanation":"具身推理模型是强化了空间理解和任务规划的多模态大模型，一般不直接输出关节动作，而是回答「东西在哪、从哪抓、先做哪步、做完没有」，输出指点坐标、轨迹或分步计划，交给执行层完成。代表是 Google DeepMind 2025 年 3 月推出的 Gemini Robotics-ER（ER 即 Embodied Reasoning），官网目前列出的最新版是 ER 2；国内有智源研究院的 RoboBrain 系列。国内常把这种分工叫「大小脑架构」：大脑是负责理解和规划的推理模型，小脑是负责运动控制和技能执行的底层模块。与快慢双系统相比，大脑、小脑更常是分开训练、通过接口相连的独立模型。","example":"在 Gemini Robotics 1.5 的组合中，ER 1.5 充当「大脑」：它可以调用 Google 搜索查当地的垃圾分类规定、拆出分步计划，再把每一步的自然语言指令交给 VLA 模型 Gemini Robotics 1.5 去执行抓放动作。","related":["具身推理","快慢双系统","分层架构","Gemini Robotics-ER","智源 RoboBrain（具身大脑）","视觉-语言-动作模型"]},{"id":"dual-system-architecture","category":"model","sec":7,"tier":1,"sources":[{"title":"Helix: A Vision-Language-Action Model for Generalist Humanoid Control (Figure)","url":"https://www.figure.ai/news/helix"},{"title":"Helix 02 (Figure)","url":"https://www.figure.ai/news/helix-02"},{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/abs/2503.14734"}],"as_of":"2026-01","related_ids":["embodied-reasoning-model","hierarchical-architecture","vision-language-action-model","figure-helix","nvidia-isaac-gr00t-n1","system-0"],"name":"快慢双系统","alt":"Dual-System Architecture (System 1 / System 2)","abbr":"","aliases":["双系统架构","快慢系统","快系统","慢系统","系统1 / 系统2","S1 / S2","三系统架构（System 0/1/2）"],"one_liner":"慢而会思考的大模型负责理解和规划，快而轻的小模型负责实时动作控制。","explanation":"快慢双系统借用心理学家卡尼曼《思考，快与慢》的说法：System 2 慢速、深思熟虑，System 1 快速、凭直觉反应。放到机器人上，System 2 通常是十几亿到几十亿参数的视觉语言模型，每秒运行几次到十几次，负责看画面、理解指令，输出语义目标或隐向量；System 1 是小得多的策略网络，以上百赫兹输出关节动作。这样既用上大模型的常识，又满足实时控制的延迟要求。代表作是 Figure 的 Helix（2025 年 2 月）和英伟达 GR00T N1（2025 年 3 月）。Figure 2026 年 1 月的 Helix 02 又加了 1kHz 的 System 0 负责平衡和接触，成为三系统架构。","example":"Figure Helix 的 S2 是 70 亿参数的开源 VLM，运行在 7–9Hz；S1 是 8000 万参数的 Transformer，以 200Hz 控制包括手腕、手指、躯干和头部在内的 35 个自由度。GR00T N1 的视觉语言部分在 L40 GPU 上跑 10Hz，动作部分输出 120Hz 的动作。","related":["具身推理模型","分层架构","视觉-语言-动作模型","Helix","GR00T N1 系列","System 0（三层系统架构）"]},{"id":"system-0","category":"model","sec":7,"tier":3,"sources":[{"title":"Introducing Helix 02: Full-Body Autonomy (Figure)","url":"https://www.figure.ai/news/helix-02"},{"title":"Helix: A Vision-Language-Action Model for Generalist Humanoid Control (Figure)","url":"https://www.figure.ai/news/helix"}],"as_of":"2026-01","related_ids":["dual-system-architecture","hierarchical-architecture","whole-body-control","learning-based-whole-body-control","figure-helix-02","braincerebellum-architecture"],"name":"System 0（三层系统架构）","alt":"System 0 (S0/S1/S2 Three-Layer Architecture)","abbr":"S0","aliases":["系统 0","三系统架构","System 0/1/2","S0/S1/S2"],"one_liner":"在快慢双系统之下再加一层千赫兹级全身控制网络，专管平衡、接触和全身协调。","explanation":"System 0 是 Figure AI 在 2026 年 1 月 27 日发布 Helix 02 时新增的一层。原来的 Helix 是快慢双系统：System 2 是视觉语言模型，负责理解场景和语言、给出隐式目标；System 1 是视觉运动策略，把目标变成关节指令。Helix 02 在 S1 下面加了 S0：一个约 1000 万参数的神经网络全身控制器，以 1kHz 运行，负责全身的平衡、接触和协调；它用 1000 多小时关节级人类动作数据，在 20 万个以上并行仿真环境里训练，靠域随机化迁移到真机。S1 也升级为以 200Hz 输出从腿、躯干到手指的全身关节目标。这样上层管「做什么」，底层保证「站得稳」，人形机器人才能边走边干活。","example":"Figure 展示 Helix 02 在整间厨房里自主完成约 4 分钟的洗碗机装卸任务，包含 61 个行走与操作结合的动作，全程无人干预。","related":["快慢双系统","分层架构","全身控制","学习型全身控制","Helix 02","大脑-小脑架构（大小脑）"]},{"id":"behavior-foundation-model","category":"model","sec":7,"tier":3,"sources":[{"title":"A Survey of Behavior Foundation Model: Next-Generation Whole-Body Control System of Humanoid Robots (arXiv 2506.20487)","url":"https://arxiv.org/abs/2506.20487"},{"title":"BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised RL (arXiv 2511.04131)","url":"https://arxiv.org/abs/2511.04131"},{"title":"arXiv 检索：behavior foundation model humanoid","url":"https://arxiv.org/search/?query=%22behavior+foundation+model%22+humanoid&searchtype=all"}],"as_of":"2025-11","related_ids":["whole-body-control","motion-tracking","bfm-zero","meta-motivo","foundation-model","unsupervised-skill-discovery"],"name":"行为基础模型","alt":"Behavior Foundation Model","abbr":"BFM","aliases":["人形行为基础模型","Behavioral Foundation Model"],"one_liner":"经大规模预训练的人形全身控制模型，能零样本或快速适配多种运动任务","explanation":"行为基础模型是人形机器人全身控制（同时协调腿、躯干和手臂的底层运动控制）方向近两年兴起的叫法。传统做法是每个任务单独训练一个强化学习控制器；BFM 先在大量人体动作数据和多样任务上预训练，学到可复用的基础技能和行为先验，然后通过「提示」——给一段参考动作、一个目标姿态或一个奖励函数——零样本或少量适配完成新任务，定位类似语言领域的基础模型。代表工作有 Meta 研究者 2025 年 4 月的 Meta Motivo（基于前向-后向表示的无监督强化学习）和 2025 年 11 月的 BFM-Zero（在宇树 G1 真机上部署，同一个策略可用于动作跟踪、到达目标姿态和奖励优化）。在分层架构里，它可以充当接收上层指令的下层运动控制器。","example":"BFM-Zero 在宇树 G1 上用同一个预训练策略，不重新训练，就能按提示切换去跟踪一段人体动作或走到指定姿态。","related":["全身控制","运动跟踪","BFM-Zero","Meta Motivo（人形行为基础模型）","基础模型","无监督技能发现"]},{"id":"human-motion-generation","category":"model","sec":7,"tier":3,"sources":[{"title":"Human Motion Diffusion Model (Tevet et al., arXiv:2209.14916)","url":"https://arxiv.org/abs/2209.14916"},{"title":"MDM 项目主页（ICLR 2023）","url":"https://guytevet.github.io/mdm-page/"},{"title":"HumanML3D 数据集（GitHub）","url":"https://github.com/EricGuo5513/HumanML3D"}],"as_of":"2023-05","related_ids":["mdm","humanml3d","diffusion-model","motion-retargeting","motion-tracking","text-to-motion"],"name":"人体动作生成模型（文本生成动作）","alt":"Human Motion Generation / Text-to-Motion (e.g. MDM)","abbr":"","aliases":["文本生成动作","Text-to-Motion","人体运动生成","动作扩散模型","Human Motion Generation"],"one_liner":"根据文字描述等条件，生成一段三维人体骨骼动作序列的模型。","explanation":"这类模型输入一句描述（如「一个人向前走然后坐下」）或一个动作类别，输出一段逐帧的三维人体骨骼姿态序列。常用训练数据是 2022 年发布的 HumanML3D，含 14616 段动作、44970 条文字描述，动作取自 AMASS 等动捕数据。代表作 MDM（Human Motion Diffusion Model）由 Tevet 等人提出、发表于 ICLR 2023：用 Transformer 实现扩散模型，每一步直接预测干净的动作而不是噪声，方便加入脚部接触等几何约束；同一个模型还能做动作补全、中间帧插补和身体局部编辑。这类模型原本服务于动画和游戏；在具身智能里，生成的人体动作经动作重定向（把人体关节映射到机器人关节）后，可交给人形机器人的运动跟踪控制器执行，是「用一句话让人形机器人做动作」的一条路线。","example":"给 MDM 输入「a person walks forward and then sits down」，它会输出一段先向前走几步、再坐下的三维人体骨骼动画，可再重定向到人形机器人上。","related":["MDM（人体动作扩散模型）","HumanML3D 数据集","扩散模型","动作重定向","运动跟踪","文本驱动动作生成"]},{"id":"intermediate-representation","category":"model","sec":7,"tier":3,"sources":[{"title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches (arXiv:2311.01977)","url":"https://arxiv.org/abs/2311.01977"},{"title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation (arXiv:2502.05485)","url":"https://arxiv.org/abs/2502.05485"}],"as_of":"2025-05","related_ids":["hierarchical-architecture","rt-trajectory","affordance","semantic-keypoints","visual-prompting","dual-system-architecture"],"name":"中间表示","alt":"Intermediate Representation","abbr":"","aliases":["中间表征","中层表示","Mid-level Representation"],"one_liner":"模型在指令和底层动作之间先预测出的过渡信息，如二维轨迹、关键点。","explanation":"在机器人学习里，中间表示指不从图像和指令一步输出关节命令，而是先产出一种人能看懂、较少依赖具体机器人的信息，再由下游策略或控制器据此生成动作。常见形式有画在图像上的末端运动轨迹、物体关键点、可供性热图（标出可抓、可推的位置）、子目标图像和语言子任务。谷歌 DeepMind 等 2023 年的 RT-Trajectory 用粗略的轨迹草图作为策略的条件，能完成仅靠语言条件做不到的新任务；2025 年的 HAMSTER 让高层视觉语言模型预测 2D 路径，交给具备 3D 感知的底层策略执行，真机实验平均成功率比 OpenVLA 高约 20 个百分点。好处是高层可用无动作标签视频、仿真等便宜数据训练，也便于人检查和纠正；代价是信息被压缩，表示选得不好会限制精度。编译器领域也有同名概念（IR），含义不同。","example":"只用抓取放置数据训练的语言条件策略，通常学不会「折叠」这种新任务；RT-Trajectory 改用画在图像上的手臂轨迹草图作条件，人手绘或由生成模型画出一条轨迹，策略就能照着执行训练中没见过的动作。","related":["分层架构","RT-Trajectory","可供性","语义关键点","视觉提示","快慢双系统"]},{"id":"visual-prompting-2","category":"model","sec":7,"tier":3,"sources":[{"title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V (arXiv:2310.11441)","url":"https://arxiv.org/abs/2310.11441"},{"title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting (arXiv:2403.03174)","url":"https://arxiv.org/abs/2403.03174"}],"as_of":"","related_ids":["vision-language-model","visual-grounding","segment-anything-model","moka","pivot","prompt-prompt-engineering"],"name":"视觉提示（Set-of-Mark 标记提示）","alt":"Visual Prompting (Set-of-Mark / Mark-based Visual Prompting)","abbr":"SoM","aliases":["标记提示","SoM 提示","Set-of-Mark Prompting","Mark-based Visual Prompting"],"one_liner":"在图片上画编号、框、点等标记，让视觉语言模型用「选标号」的方式指出位置。","explanation":"视觉提示指不改模型参数，直接在输入图像上加标记来引导视觉语言模型（VLM）。代表方法是微软研究院 2023 年 10 月提出的 Set-of-Mark（SoM）：先用 SAM、SEEM 等分割模型把图片切成若干区域，在每块上叠加数字、掩码或框，再向 GPT-4V 这类模型提问。VLM 直接输出精确像素坐标很难，但回答「3 号区域」容易得多；SoM 在零样本下的 RefCOCOg 指代分割上超过了专门微调的模型。机器人里常用它把「抓哪里、往哪放」变成选择题：MOKA（2024，伯克利）在图上标出候选关键点和路点，让 VLM 挑出抓取点和运动路线，再换算成机械臂动作；PIVOT 则在图上画出一批候选动作，让 VLM 挑选并迭代收窄。","example":"一张桌面照片先用 SAM 分割出每个物体并标上 1、2、3……，再问 GPT-4V「哪个是红色杯子」，模型回答「2」，程序就能取出 2 号区域的精确掩码，交给抓取模块使用。","related":["视觉语言模型","视觉定位（Grounding）","分割一切模型","MOKA（标记式视觉提示操作）","PIVOT（迭代视觉提示）","提示词 / 提示工程"]},{"id":"embodied-chain-of-thought","category":"model","sec":7,"tier":2,"sources":[{"title":"Robotic Control via Embodied Chain-of-Thought Reasoning (arXiv 2407.08693)","url":"https://arxiv.org/abs/2407.08693"},{"title":"Embodied Chain-of-Thought Reasoning 项目页","url":"https://embodied-cot.github.io/"},{"title":"Training Strategies for Efficient Embodied Reasoning (arXiv 2505.08243)","url":"https://arxiv.org/abs/2505.08243"}],"as_of":"2025-05","related_ids":["chain-of-thought","embodied-reasoning","vision-language-action-model","openvla","visual-chain-of-thought","inference-latency"],"name":"具身思维链","alt":"Embodied Chain-of-Thought","abbr":"ECoT","aliases":["具身推理链","Embodied Chain-of-Thought Reasoning"],"one_liner":"让机器人模型先写出计划、子任务、物体位置等推理，再输出动作。","explanation":"具身思维链由 UC 伯克利、斯坦福等机构的研究者在 2024 年提出。普通 VLA（视觉-语言-动作模型）看图听指令后直接出动作；ECoT 让模型先依次写出任务复述、整体计划、当前子任务、下一步移动方向、夹爪位置和画面中物体的边界框，再输出动作。和大语言模型的思维链不同，这些推理必须落在具体画面和机器人状态上。作者用现成基础模型自动给 BridgeData V2 标注推理过程，在 OpenVLA 上训练后，高难度泛化任务的绝对成功率提升 28%，没用额外机器人数据。代价是要多生成大量 token、推理变慢；2025 年同一团队的后续工作给出更轻量的训练方式，推理约快 3 倍。","example":"指令「把蘑菇放进锅里」时，ECoT 模型先写出计划（找蘑菇→抓起→移到锅上方→放下）、当前子任务「抓起蘑菇」、移动方向「向左下」，并标出蘑菇、锅的边界框和夹爪位置，最后才输出 7 维机械臂动作。","related":["思维链","具身推理","视觉-语言-动作模型","OpenVLA","视觉思维链","推理延迟"]},{"id":"visual-chain-of-thought","category":"model","sec":7,"tier":3,"sources":[{"title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models (arXiv:2503.22020)","url":"https://arxiv.org/abs/2503.22020"},{"title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning (arXiv:2403.16999)","url":"https://arxiv.org/abs/2403.16999"}],"as_of":"","related_ids":["chain-of-thought","embodied-chain-of-thought","action-chain-of-thought","cot-vla","vision-language-action-model","video-prediction-model"],"name":"视觉思维链","alt":"Visual Chain-of-Thought","abbr":"Visual CoT","aliases":["视觉 CoT","视觉推理链"],"one_liner":"让模型先产出图像、框选区域等视觉中间结果，再据此给出答案或动作。","explanation":"思维链（CoT）原本指让大语言模型先写出推理步骤再给答案；视觉思维链把中间步骤换成视觉形式。在多模态大模型领域，2024 年 Shao 等人发布的 Visual CoT 数据集含 43.8 万条带中间边界框的问答，训练模型先圈出图中关键区域、聚焦细看，再作答。机器人领域更常见的是先「想象」目标画面：2025 年英伟达、斯坦福等提出的 CoT-VLA（CVPR 2025）先自回归生成一张未来的子目标图像，再生成动作块，真机任务比此前最好的 VLA 高 17%，仿真高 6%。好处是把「要达到什么状态」显式画出来，便于检查、利于长程任务；代价是多生成一张图，推理更慢。它和用文字写子任务、物体位置的具身思维链，以及动作思维链，是几种并列的中间表示。","example":"CoT-VLA 接到一条操作指令后，先生成若干步之后应该出现的画面作为子目标（例如物体已被夹起并靠近目标位置），再以这张图为条件输出一段动作；执行完后重新观察，再想象下一张子目标图。","related":["思维链","具身思维链","动作思维链","CoT-VLA","视觉-语言-动作模型","视频预测模型"]},{"id":"action-chain-of-thought","category":"model","sec":7,"tier":3,"sources":[{"title":"ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models (arXiv 2601.11404)","url":"https://arxiv.org/abs/2601.11404"},{"title":"ACoT-VLA 论文 HTML 版","url":"https://arxiv.org/html/2601.11404"}],"as_of":"2026-01","related_ids":["chain-of-thought","embodied-chain-of-thought","visual-chain-of-thought","vision-language-action-model","action-head","flow-matching"],"name":"动作思维链","alt":"Action Chain-of-Thought","abbr":"ACoT","aliases":["Action-CoT","ACoT-VLA"],"one_liner":"让 VLA 先在动作空间里推出一条粗轨迹，再据此生成精细动作","explanation":"思维链原指大模型先写出中间推理步骤再给答案。VLA 里已有的推理方式多是先预测子任务文字或生成目标图像，这些中间结果都不是动作本身。北京航空航天大学与智元机器人团队 2026 年 1 月提出 ACoT-VLA（已被 CVPR 2026 接收），主张直接在动作空间里推理：显式动作推理器（EAR）用流匹配先生成一条粗粒度参考轨迹；隐式动作推理器（IAR）用可学习查询从 VLM 内部特征中提取潜在动作先验；两路信息再通过交叉注意力引导动作头输出最终动作序列。论文报告 LIBERO 平均成功率 98.5%。它可以看作具身思维链、视觉思维链之后的另一种推理形式。另有 2026 年的导航工作也用 Action-CoT 指代逐步的动作推理。","example":"ACoT-VLA 在智元 G1 真机上的三项操作任务里报告平均成功率 66.7%，在 LIBERO-Plus 上监督微调后平均成功率 88.0%。","related":["思维链","具身思维链","视觉思维链","视觉-语言-动作模型","动作头","流匹配"]},{"id":"latent-reasoning","category":"model","sec":7,"tier":3,"sources":[{"title":"Training Large Language Models to Reason in a Continuous Latent Space (Coconut, arXiv:2412.06769)","url":"https://arxiv.org/abs/2412.06769"},{"title":"A Survey on Latent Reasoning (arXiv:2507.06203)","url":"https://arxiv.org/abs/2507.06203"},{"title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning (arXiv:2507.16815)","url":"https://arxiv.org/abs/2507.16815"}],"as_of":"2025-07","related_ids":["chain-of-thought","embodied-chain-of-thought","reasoning","large-language-model","thinkact","inference-latency"],"name":"潜在推理","alt":"Latent Reasoning","abbr":"","aliases":["隐式推理","潜空间推理","Latent CoT","连续思维链","Continuous Thought"],"one_liner":"让模型在内部隐藏状态里完成多步推理，而不是逐字写出思维链。","explanation":"思维链（Chain-of-Thought）让大模型先用文字写出中间推理步骤再给答案，效果好，但每一步都要生成 token，既慢又受限于语言。潜在推理把中间步骤放进模型的连续隐藏状态：Meta 等 2024 年 12 月提出的 Coconut 把模型最后一层的隐藏状态当作一步「连续思维」，不解码成文字，直接作为下一步的输入嵌入，在需要大量搜索的逻辑推理题上优于文字思维链，生成的 token 也更少。2025 年 7 月的一篇综述把这一方向定义为完全在连续隐藏状态中进行、去掉逐 token 监督的推理。具身智能里，VLA 既要推理又要求低延迟，因此也借鉴这一思路，例如 ThinkAct 把多模态大模型生成的推理计划压缩成一个「视觉计划隐变量」，用它引导下游动作模型。代价是中间过程不可读，难以检查和调试。","example":"Coconut 解一道需要多步推导的逻辑题时，不写出「因为 A 所以 B」这样的文字，而是连续几步把隐藏向量回送给自己作为输入，最后才输出答案。","related":["思维链","具身思维链","推理（思考）","大语言模型","ThinkAct","推理延迟"]},{"id":"world-model","category":"model","sec":8,"tier":1,"sources":[{"title":"World Models (Ha & Schmidhuber, arXiv:1803.10122)","url":"https://arxiv.org/abs/1803.10122"},{"title":"Genie 3: A new frontier for world models (Google DeepMind)","url":"https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/"},{"title":"What Are World Models? (NVIDIA Glossary)","url":"https://www.nvidia.com/en-us/glossary/world-models/"},{"title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv:2506.09985)","url":"https://arxiv.org/abs/2506.09985"}],"as_of":"2025-08","related_ids":["latent-world-model","world-foundation-model","world-action-model","nvidia-cosmos","genie-3","model-based-reinforcement-learning"],"name":"世界模型","alt":"World Model","abbr":"WM","aliases":["World Models","世界模拟器"],"one_liner":"能预测「做了某个动作之后，世界会变成什么样」的模型。","explanation":"世界模型指学会「环境会怎么变化」的模型：给定当前状态或画面和一个动作，预测下一步的状态或画面。2018 年 Ha 与 Schmidhuber 的论文《World Models》让这个词流行起来：先用变分自编码器把游戏画面压成低维向量，再用循环网络预测下一步，智能体可以在模型生成的「梦境」里学策略，再迁移回真实游戏。如今它既指只在隐空间（压缩后的特征）里预测的模型，如服务强化学习的 DreamerV3、用于机器人规划的 Meta V-JEPA 2，也指谷歌 DeepMind Genie 3、英伟达 Cosmos 这类直接生成视频画面的大模型。在具身智能里，世界模型用来生成合成训练数据、在「想象」中评估策略和做规划，减少真机试错。","example":"Genie 3（2025 年 8 月发布）根据一句文字描述生成一个 720p、24 帧/秒的场景，用户按方向键移动时实时生成后续画面，并能记住约一分钟前看到的内容。","related":["隐空间世界模型","世界基础模型","世界动作模型","Cosmos","Genie 3","基于模型的强化学习"]},{"id":"forward-dynamics-model","category":"model","sec":8,"tier":2,"sources":[{"title":"Neural Network Dynamics for Model-Based Deep RL with Model-Free Fine-Tuning (arXiv 1708.02596)","url":"https://arxiv.org/abs/1708.02596"},{"title":"Curiosity-driven Exploration by Self-supervised Prediction (arXiv 1705.05363)","url":"https://arxiv.org/abs/1705.05363"}],"as_of":"","related_ids":["inverse-dynamics-model","world-model","model-based-reinforcement-learning","model-predictive-control","forward-dynamics","latent-action-model"],"name":"正向动力学模型","alt":"Forward Dynamics Model","abbr":"FDM","aliases":["前向动力学模型","学习型动力学模型","Forward Model","Learned Dynamics Model"],"one_liner":"输入当前状态和动作，预测下一时刻状态会变成什么样的模型。","explanation":"正向动力学模型学的是「做了这个动作，世界会变成什么样」：输入当前状态（或观测）s_t 和动作 a_t，输出下一时刻状态 s_{t+1}。思路和力学里的正动力学（由力矩算出加速度）一致，但机器人学习里通常不靠物理公式，而是用神经网络从交互数据中学出来。有了它，机器人能先在模型里试多种动作序列、挑结果最好的执行，这正是基于模型的强化学习和模型预测控制（MPC）的做法。2017 年 Nagabandi 等人就用学到的神经网络动力学模型配合 MPC，让仿真中的多足机器人跟踪任意轨迹。如今的世界模型本质上是在图像或隐空间里做的大型正向动力学模型；它常与逆动力学模型成对出现，潜在动作模型的解码器也属于这一类。","example":"推方块任务：输入方块当前位置和「向右推 2 厘米」，模型预测推完后方块的新位置；MPC 用它比较几十种候选推法，选最接近目标的一种执行。","related":["逆动力学模型","世界模型","基于模型的强化学习","模型预测控制","正动力学","潜在动作模型"]},{"id":"inverse-dynamics-model","category":"model","sec":8,"tier":2,"sources":[{"title":"Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos (arXiv 2206.11795)","url":"https://arxiv.org/html/2206.11795"},{"title":"Learning Universal Policies via Text-Guided Video Generation (UniPi, arXiv 2302.00111)","url":"https://arxiv.org/abs/2302.00111"}],"as_of":"","related_ids":["forward-dynamics-model","latent-action-model","pseudo-action-labels","action-free-video","vpt","unipi"],"name":"逆动力学模型","alt":"Inverse Dynamics Model","abbr":"IDM","aliases":["逆向动力学模型","Inverse Model"],"one_liner":"看前后两帧画面，推断中间做了什么动作的模型。","explanation":"逆动力学模型和正向动力学模型方向相反：输入当前状态 s_t 和下一状态 s_{t+1}（或前后几帧画面），输出导致这一变化的动作 a_t。力学里的逆动力学是由期望运动反算关节力矩，机器人学习里的 IDM 则多用神经网络从数据中学出。它的主要用途是给没有动作标签的视频补标签：OpenAI 2022 年的 VPT 先用约 2000 小时带键鼠记录的 Minecraft 数据训练 IDM，再给约 7 万小时网络视频打上伪动作标签，用来预训练游戏智能体。IDM 能同时看到过去和未来的画面，比只看当前画面预测动作容易学得多。UniPi 等「先生成视频再出动作」的方法，也靠 IDM 把生成的画面翻译成机器人动作。","example":"输入两帧：第一帧夹爪张开停在杯子上方，第二帧夹爪已闭合、杯子被提起几厘米；IDM 输出「闭合夹爪并向上移动」对应的动作向量。","related":["正向动力学模型","潜在动作模型","伪动作标签","无动作标签视频","VPT（视频预训练）","UniPi"]},{"id":"latent-action","category":"model","sec":8,"tier":2,"sources":[{"title":"Genie: Generative Interactive Environments (arXiv 2402.15391)","url":"https://arxiv.org/html/2402.15391"},{"title":"Latent Action Pretraining from Videos (LAPA, arXiv 2410.11758)","url":"https://arxiv.org/abs/2410.11758"},{"title":"AgiBot World Colosseo (GO-1, arXiv 2503.06669)","url":"https://arxiv.org/abs/2503.06669"}],"as_of":"","related_ids":["latent-action-model","latent-action-pretraining","action-free-video","genie","lapa","agibot-go-1"],"name":"潜在动作","alt":"Latent Action","abbr":"","aliases":["隐动作","潜动作","隐式动作"],"one_liner":"从前后画面变化里自动学出的抽象动作编码，不需要真实动作标签。","explanation":"潜在动作是模型从视频相邻帧的变化中自动归纳出的动作表示，通常是少量离散编码或一个低维向量。它针对的问题是：互联网上的人类视频、游戏视频极多，却没有关节角、按键这类真实动作标签，没法直接用来训练策略。潜在动作不对应任何具体机器人的关节，只描述「画面发生了哪类变化」，所以人手视频和不同机器人的视频都能共用一套编码。DeepMind 2024 年的 Genie 从约 3 万小时平台跳跃游戏视频中学出 8 个离散潜在动作，用来操控生成的游戏世界；LAPA、UniVLA、智元 GO-1 等则让 VLA 先预测潜在动作做预训练，再用少量真机数据学会把它映射成真实动作。","example":"Genie 学出的 8 个潜在动作编号在不同生成游戏里效果一致，大致对应向左、向右、跳跃这类操作，用户按编号就能操控从没见过的画面里的角色。","related":["潜在动作模型","潜在动作预训练","无动作标签视频","Genie（初代）","LAPA","智元 GO-1（启元大模型）"]},{"id":"latent-action-model","category":"model","sec":8,"tier":2,"sources":[{"title":"Genie: Generative Interactive Environments (arXiv 2402.15391)","url":"https://arxiv.org/html/2402.15391"},{"title":"Latent Action Pretraining from Videos (LAPA, arXiv 2410.11758)","url":"https://arxiv.org/abs/2410.11758"},{"title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions (arXiv 2505.06111)","url":"https://arxiv.org/abs/2505.06111"}],"as_of":"","related_ids":["latent-action","inverse-dynamics-model","forward-dynamics-model","vector-quantized-variational-autoencoder","genie","univla"],"name":"潜在动作模型","alt":"Latent Action Model","abbr":"LAM","aliases":["隐动作模型"],"one_liner":"从无标签视频学出潜在动作的模型，靠编码器加解码器重建下一帧来训练。","explanation":"潜在动作模型是产出潜在动作的那个网络。典型结构来自 DeepMind 2024 年的 Genie：编码器看当前帧和下一帧，输出一个潜在动作，作用相当于逆动力学模型；解码器只拿当前帧和这个潜在动作去重建下一帧，相当于正向动力学模型。中间用向量量化（VQ-VAE 的做法）把潜在动作限制在很小的离散码本里，Genie 只有 8 个码，这样潜在动作装不下整张图，只能记录「发生了什么变化」。训练好后，编码器就能给海量视频打潜在动作标签。常见难点是镜头晃动、背景有人走动等与任务无关的变化也会被编码进去，UniVLA 因此改在 DINO 特征空间里学，并借助语言指令剥离这些干扰。","example":"LAPA 分三步：先在视频上训练潜在动作量化模型，再训练 VLA 根据画面和指令预测潜在动作，最后用少量机器人数据微调，把潜在动作换成真实动作。","related":["潜在动作","逆动力学模型","正向动力学模型","向量量化变分自编码器","Genie（初代）","UniVLA"]},{"id":"vision-language-latent-action","category":"model","sec":8,"tier":3,"sources":[{"title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems (arXiv:2503.06669)","url":"https://arxiv.org/abs/2503.06669"},{"title":"OpenDriveLab/AgiBot-World (GitHub, GO-1 / GO-1 Air 开源)","url":"https://github.com/OpenDriveLab/AgiBot-World"}],"as_of":"2025-09","related_ids":["agibot-go-1","latent-action-model","latent-action","action-expert","hierarchical-architecture","latent-action-pretraining"],"name":"ViLLA 架构","alt":"Vision-Language-Latent-Action","abbr":"ViLLA","aliases":["视觉-语言-潜在动作架构","潜在规划器 + 动作专家","Latent Planner + Action Expert"],"one_liner":"智元 GO-1 用的分层架构：先预测潜在动作 token，再解码成真实动作。","explanation":"ViLLA 是智元机器人 2025 年 3 月发布通用具身基座模型 GO-1（Genie Operator-1）时提出的框架。普通 VLA（视觉-语言-动作模型）从图像和指令直接出动作，ViLLA 在中间加了一层「潜在动作」，分三部分：潜在动作模型（LAM）在人类视频（如 Ego4D）和机器人轨迹上训练，用逆动力学和正向动力学把相邻两帧的变化压成离散的潜在动作 token；潜在规划器以 InternVL2.5-2B 为骨干，根据多视角图像和指令预测这些 token；动作专家再用扩散目标把它们解码成连续的低层动作块。这样做的好处是没有动作标签的人类视频也能参与预训练，提高数据利用率。GO-1 于 2025 年 9 月开源，同时放出去掉潜在规划器的轻量版 GO-1 Air。","example":"GO-1 执行一条桌面任务指令时，潜在规划器先根据三路相机画面和指令输出几个潜在动作 token，相当于抽象的「接下来怎么动」；动作专家再以它们为条件去噪，生成未来 30 个时间步的连续动作。","related":["智元 GO-1（启元大模型）","潜在动作模型","潜在动作","动作专家","分层架构","潜在动作预训练"]},{"id":"video-prediction-model","category":"model","sec":8,"tier":2,"sources":[{"title":"Deep Visual Foresight for Planning Robot Motion (arXiv 1610.00696)","url":"https://arxiv.org/abs/1610.00696"},{"title":"Visual Foresight: Model-Based Deep Reinforcement Learning for Vision-Based Robotic Control (arXiv 1812.00568)","url":"https://arxiv.org/abs/1812.00568"},{"title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations (arXiv 2412.14803)","url":"https://arxiv.org/abs/2412.14803"}],"as_of":"","related_ids":["video-generation-model","world-model","model-predictive-control","forward-dynamics-model","video-prediction-policy","world-action-model"],"name":"视频预测模型","alt":"Video Prediction Model","abbr":"","aliases":["视觉预见","Visual Foresight","动作条件视频预测","Action-conditioned Video Prediction"],"one_liner":"根据已有画面（常加上计划执行的动作）预测接下来画面的模型。","explanation":"视频预测模型输入过去几帧画面，输出未来的画面；在机器人里通常还输入计划执行的动作，回答「如果这样动，相机会看到什么」，这类叫动作条件视频预测。2016 年 Finn 和 Levine 提出视觉预见（Visual Foresight）：机器人不靠人工标注、自己推动物体采集数据训练预测模型，再结合模型预测控制（每一步在模型里试多组动作，挑预测结果最接近目标的执行）完成推物体任务。它和视频生成模型的区别在于侧重接着已有画面往下演，而不是凭文字从零生成。近年改用大规模视频扩散模型，例如视频预测策略 VPP 用视频模型的预测特征驱动逆动力学模型输出动作。","example":"要把桌上的积木推到目标位置时，机器人先在视频预测模型里试大量候选动作序列，比较各自预测出的画面哪个最接近目标图像，再执行这组动作的第一步，然后重复。","related":["视频生成模型","世界模型","模型预测控制","正向动力学模型","视频预测策略","世界动作模型"]},{"id":"video-generation-model","category":"model","sec":8,"tier":2,"sources":[{"title":"Video Diffusion Models (arXiv 2204.03458)","url":"https://arxiv.org/abs/2204.03458"},{"title":"Wan: Open and Advanced Large-Scale Video Generative Models (arXiv 2503.20314)","url":"https://arxiv.org/abs/2503.20314"}],"as_of":"2025-04","related_ids":["text-to-video-image-to-video","diffusion-model","diffusion-transformer","video-prediction-model","world-model","wan"],"name":"视频生成模型","alt":"Video Generation Model","abbr":"","aliases":["视频扩散模型","Video Diffusion Model","视频生成大模型"],"one_liner":"根据文字、图片或已有片段，生成一段连贯新视频的生成式模型。","explanation":"视频生成模型能凭文字、图片或已有片段生成新视频。2022 年 Google 的 Video Diffusion Models 把图像扩散模型扩展到视频，此后主流做法是先用视频 VAE 把视频压到潜在空间，再用扩散 Transformer 或 U-Net 同时对多帧逐步去噪，保证前后连贯。代表有 OpenAI 的 Sora、Google 的 Veo、阿里开源的通义万相 Wan。模型从海量视频里学到物体怎么运动、怎么被推动，因此常被当作世界模型的起点：NVIDIA Cosmos 等世界基础模型、UniPi 这类先生成视频再推出动作的策略，以及 DreamZero 等世界动作模型，都建立在视频生成模型之上。","example":"通义万相 Wan 开源了 1.3B 和 14B 两个规模，其中 1.3B 版本只需约 8GB 显存，消费级显卡就能跑文生视频。","related":["文生视频 / 图生视频","扩散模型","扩散 Transformer","视频预测模型","世界模型","通义万相"]},{"id":"text-to-video-image-to-video","category":"model","sec":8,"tier":2,"sources":[{"title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets (arXiv 2311.15127)","url":"https://arxiv.org/abs/2311.15127"},{"title":"Wan: Open and Advanced Large-Scale Video Generative Models (arXiv 2503.20314)","url":"https://arxiv.org/abs/2503.20314"},{"title":"World Action Models are Zero-shot Policies (arXiv 2602.15922)","url":"https://arxiv.org/html/2602.15922"}],"as_of":"2026-02","related_ids":["video-generation-model","diffusion-model","latent-diffusion-model","variational-autoencoder","world-action-model","unipi"],"name":"文生视频 / 图生视频","alt":"Text-to-Video / Image-to-Video","abbr":"T2V / I2V","aliases":["文本生成视频","图像生成视频","Text2Video","Image2Video"],"one_liner":"按一段文字，或一张图片加文字，生成一段视频的任务。","explanation":"文生视频（T2V）和图生视频（I2V）是视频生成模型最常见的两种用法：前者只给文字描述，模型从零生成视频；后者给一张图（通常当作第一帧）加文字，让画面接着动起来。Stability AI 的 Stable Video Diffusion、阿里的通义万相 Wan 都同时提供两种版本，主流做法是在 VAE 压缩出的潜在空间里用扩散或流匹配逐步去噪。对机器人来说 I2V 更有用：把相机当前画面当首帧、任务指令当文字，生成的视频就是对接下来会发生什么的预演。UniPi 用文本引导的视频生成做规划，NVIDIA 的 DreamZero 则直接在 Wan2.1 的图生视频 14B 模型上加动作输出。","example":"给图生视频模型输入一张机械臂和桌上杯子的照片，加上指令「把杯子放进水槽」，模型从这张照片出发生成几秒钟的视频，展示机械臂完成任务的过程。","related":["视频生成模型","扩散模型","潜在扩散模型","变分自编码器","世界动作模型","UniPi"]},{"id":"video-tokenizer","category":"model","sec":8,"tier":3,"sources":[{"title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation (MAGVIT-v2, arXiv:2310.05737)","url":"https://arxiv.org/abs/2310.05737"},{"title":"NVIDIA Cosmos Tokenizer (GitHub)","url":"https://github.com/NVIDIA/Cosmos-Tokenizer"},{"title":"Wan: Open and Advanced Large-Scale Video Generative Models (arXiv:2503.20314)","url":"https://arxiv.org/abs/2503.20314"}],"as_of":"","related_ids":["variational-autoencoder","latent-space","spacetime-patches","vector-quantization","latent-diffusion-model","nvidia-cosmos"],"name":"视频分词器","alt":"Video Tokenizer / Video VAE","abbr":"","aliases":["视频 VAE","3D 因果 VAE","Causal Video VAE","视频 tokenizer"],"one_liner":"把视频压成少量 token 或潜在向量、又能还原回画面的编解码网络。","explanation":"视频分词器是视频生成模型和世界模型的前置模块：编码器把一段视频在时间和空间上同时压缩，得到离散 token 或连续潜在向量，解码器再还原成像素。输出离散 token 的一类（如谷歌的 MAGVIT-v2）靠量化把向量变成「词表编号」，方便接自回归 Transformer；输出连续向量的一类就是视频 VAE（变分自编码器），供潜在扩散模型在里面去噪。「因果」指时间方向上每帧只看前面的帧、第一帧单独编码，这样图像和视频能共用一个分词器，也能分段处理任意长的视频。压缩率决定后面的大模型要处理多少 token，重建质量又决定生成画面的清晰度上限。英伟达 Cosmos Tokenizer 提供 4×8×8、8×16×16 等多档压缩的连续和离散版本。","example":"通义万相 Wan2.1 的 Wan-VAE 是 3D 因果 VAE，时间压 4 倍、长宽各压 8 倍，靠特征缓存能编解码任意长度的 1080P 视频；扩散 Transformer 只在压缩后的潜在空间里去噪，最后交给解码器还原成画面。","related":["变分自编码器","潜在空间","时空块","向量量化","潜在扩散模型","Cosmos"]},{"id":"spacetime-patches","category":"model","sec":8,"tier":3,"sources":[{"title":"Sora: A Review on Background, Technology, Limitations, and Opportunities (arXiv:2402.17177)","url":"https://arxiv.org/abs/2402.17177"},{"title":"ViViT: A Video Vision Transformer (arXiv:2103.15691)","url":"https://arxiv.org/abs/2103.15691"},{"title":"Wikipedia: Sora (text-to-video model)","url":"https://en.wikipedia.org/wiki/Sora_(text-to-video_model)"}],"as_of":"2024-02","related_ids":["vision-transformer","diffusion-transformer","video-tokenizer","video-generation-model","token","sora"],"name":"时空块","alt":"Spacetime Patches","abbr":"","aliases":["时空 patch","时空补丁","Spacetime Latent Patches","Tubelet（管状块）"],"one_liner":"把视频在时间和空间上一起切成的小立方块，每块当作一个 token 交给 Transformer。","explanation":"时空块是视频版的「图像切块」。视觉 Transformer 把一张图切成固定大小的方块，每块当一个 token；视频多了时间维，就切成跨若干帧、若干像素的小立方体，谷歌的 ViViT（ICCV 2021）把这种块叫 tubelet，常用 3D 卷积来切。OpenAI 2024 年 2 月发布 Sora 时让「时空块」这个说法流行开：先用视频压缩网络把视频压进潜在空间，再把潜在表示切成时空块，交给扩散 Transformer 去噪。好处是不同分辨率、时长和宽高比的视频都能变成长短不一的 token 序列统一训练，不必先裁剪缩放。现在多数视频生成模型和视频世界模型都用类似方式把视频变成 token。","example":"一段压缩后的潜在视频若切成「2 帧 × 2 × 2 格」的小块，每个小块展平后经线性层映射成一个 token；横屏和竖屏视频只是切出的块数和排布不同，可以放进同一批训练。","related":["视觉 Transformer","扩散 Transformer","视频分词器","视频生成模型","token（词元）","Sora（视频生成即世界模拟器）"]},{"id":"wan","category":"model","sec":8,"tier":3,"sources":[{"title":"Wan: Open and Advanced Large-Scale Video Generative Models (arXiv:2503.20314)","url":"https://arxiv.org/abs/2503.20314"},{"title":"Wan-Video/Wan2.2 (GitHub)","url":"https://github.com/Wan-Video/Wan2.2"},{"title":"World Action Models are Zero-shot Policies (DreamZero, arXiv:2602.15922)","url":"https://arxiv.org/abs/2602.15922"}],"as_of":"2026-09","related_ids":["video-generation-model","diffusion-transformer","video-tokenizer","flow-matching","mixture-of-experts","dreamzero"],"name":"通义万相","alt":"Wan (Alibaba open video generation model)","abbr":"","aliases":["Wan2.1","Wan2.2","万相","Tongyi Wanxiang"],"one_liner":"阿里通义团队的视频生成模型，Wan2.1/2.2 开放权重，常用作世界模型底座。","explanation":"通义万相是阿里巴巴通义团队的视觉生成模型系列，英文名 Wan。2025 年 2 月底开源的 Wan2.1 有 1.3B 和 14B 两种规模，Apache 2.0 许可，基于扩散 Transformer 并用流匹配训练，自带 3D 因果视频 VAE（Wan-VAE），文本编码器是 umT5，支持文生视频、图生视频和视频编辑。2025 年 7 月的 Wan2.2 改成两个约 14B 专家的混合专家结构（高噪声专家定布局、低噪声专家补细节，每步只激活一个），另有 5B 的文图生视频模型，之后又陆续放出音频驱动（S2V）、角色动画（Animate）等衍生模型。它已从海量视频里学到不少物体运动规律，又开放权重，研究者常拿它做世界模型或世界动作模型的起点。截至 2026 年 9 月，开放权重的主线仍是 Wan2.2 系列。","example":"英伟达的 DreamZero 以 Wan2.1-I2V-14B-480P 图生视频模型为骨干，在机器人数据上继续训练，让模型同时生成未来画面和对应动作，作为世界动作模型直接控制机器人。","related":["视频生成模型","扩散 Transformer","视频分词器","流匹配","混合专家模型","DreamZero"]},{"id":"world-foundation-model","category":"model","sec":8,"tier":2,"sources":[{"title":"Cosmos World Foundation Model Platform for Physical AI (arXiv 2501.03575)","url":"https://arxiv.org/abs/2501.03575"},{"title":"NVIDIA Glossary: What Are World Models?","url":"https://www.nvidia.com/en-us/glossary/world-models/"},{"title":"NVIDIA Cosmos","url":"https://www.nvidia.com/en-us/ai/cosmos/"}],"as_of":"2026-09","related_ids":["world-model","foundation-model","nvidia-cosmos","video-generation-model","synthetic-data","physical-ai"],"name":"世界基础模型","alt":"World Foundation Model","abbr":"WFM","aliases":["World Foundation Models"],"one_liner":"在海量真实视频上预训练、可再微调成各种专用世界模型的通用世界模型。","explanation":"世界基础模型这个说法由 NVIDIA 在 2025 年 1 月发布的 Cosmos 平台论文中提出，指一个通用的世界模型，可再后训练成面向具体应用的定制世界模型。世界模型负责根据当前画面加动作或指令，预测世界接下来的样子。WFM 把大语言模型先大规模预训练、再按任务微调的路线搬了过来：Cosmos 从约 2000 万小时的原始视频中筛出约 1 亿个片段，训练了扩散和自回归两类模型。用途包括为机器人和自动驾驶生成合成训练数据、在模型里训练和评估策略、把仿真画面转成逼真画面。NVIDIA 之后陆续推出 Cosmos Predict、Transfer、Reason 等系列，以及把推理、视频和动作生成放进同一个模型的 Cosmos 3。","example":"Cosmos 论文把预训练好的 WFM 后训练成机器人操作版本：输入当前画面和一段机器人动作，预测执行这段动作后的视频。","related":["世界模型","基础模型","Cosmos","视频生成模型","合成数据","物理AI"]},{"id":"autoregressive-video-generation","category":"model","sec":8,"tier":3,"sources":[{"title":"From Slow Bidirectional to Fast Autoregressive Video Diffusion Models (CausVid, arXiv 2412.07772)","url":"https://arxiv.org/abs/2412.07772"},{"title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion (arXiv 2506.08009)","url":"https://arxiv.org/abs/2506.08009"},{"title":"Genie 3: A new frontier for world models (Google DeepMind)","url":"https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/"}],"as_of":"2025-08","related_ids":["diffusion-forcing","self-forcing","interactive-world-model","video-generation-model","exposure-bias","key-value-cache"],"name":"自回归视频生成","alt":"Autoregressive Video Generation","abbr":"","aliases":["因果视频生成","Causal Video Generation","流式视频生成"],"one_liner":"按时间顺序一帧或一段接一段往后生成视频，可以边生成边播放","explanation":"很多视频扩散模型一次生成整段视频，各帧双向互看，必须等整段算完才能输出，也难以中途接收新的动作输入。自回归视频生成改成按时间顺序往后续写：每一帧或每一小段只以已生成的内容为条件，配合因果注意力和 KV 缓存，就能流式输出、实时响应用户或机器人的动作，这正是可交互世界模型需要的。主要难点是误差累积（曝光偏差）：训练时模型看的是真实历史，推理时看的是自己生成的、带误差的历史，时间一长画面会崩。CausVid（CVPR 2025）把双向模型蒸馏成 4 步的因果模型，单卡 9.4 帧/秒；Self Forcing（NeurIPS 2025）在训练时就用模型自己的输出当历史，缩小训练和推理的差距。","example":"谷歌 DeepMind 的 Genie 3 逐帧自回归生成画面，每一帧都要参考不断变长的历史轨迹，能以 720p、24 帧/秒实时交互。","related":["扩散强制","Self Forcing（自强制训练）","可交互世界模型","视频生成模型","曝光偏差（自回归误差累积）","KV 缓存"]},{"id":"exposure-bias","category":"model","sec":8,"tier":3,"sources":[{"title":"Sequence Level Training with Recurrent Neural Networks (Ranzato et al., ICLR 2016)","url":"https://arxiv.org/abs/1511.06732"},{"title":"Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks (Bengio et al., 2015)","url":"https://arxiv.org/abs/1506.03099"},{"title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion (arXiv 2506.08009)","url":"https://arxiv.org/abs/2506.08009"}],"as_of":"","related_ids":["teacher-forcing","autoregressive-decoding","compounding-error","distribution-shift","self-forcing","diffusion-forcing"],"name":"曝光偏差（自回归误差累积）","alt":"Exposure Bias","abbr":"","aliases":["暴露偏差","自回归误差累积","训练-推理不一致"],"one_liner":"训练时看真值、推理时看自己的输出，导致误差一步步累积的问题。","explanation":"曝光偏差是序列生成模型的经典问题。自回归模型（逐步预测下一个元素的模型）训练时通常用教师强制，每一步都喂真实的历史；推理时却只能拿自己上一步的输出当输入。模型训练中没见过自己犯的错，一旦偏离训练分布，误差就越滚越大。2015–2016 年 Bengio 等人的计划采样（训练中逐步改用模型自己的预测当输入）和 Ranzato 等人的序列级训练是早期的代表性解法。具身智能里它有两种常见形态：行为克隆策略偏离演示轨迹后越走越偏（常称复合误差、协变量偏移）；自回归视频世界模型连续生成几十帧后画面崩坏，Self Forcing 等方法让模型在训练时就接着自己生成的帧往下生成来缓解。","example":"给视频世界模型一帧当前画面，让它自回归地预测后面 100 帧。训练时每一步都看真实的上一帧，推理时看的是自己生成的、略带瑕疵的帧，越往后物体越容易变形、画面越容易糊掉。","related":["教师强制","自回归解码","复合误差","分布偏移（协变量偏移）","Self Forcing（自强制训练）","扩散强制"]},{"id":"diffusion-forcing","category":"model","sec":8,"tier":3,"sources":[{"title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion (arXiv:2407.01392)","url":"https://arxiv.org/abs/2407.01392"},{"title":"Diffusion Forcing project page","url":"https://boyuan.space/diffusion-forcing/"}],"as_of":"","related_ids":["diffusion-model","autoregressive-video-generation","next-token-prediction","teacher-forcing","world-model","self-forcing"],"name":"扩散强制","alt":"Diffusion Forcing","abbr":"","aliases":["扩散强制训练"],"one_liner":"给序列里每个 token 加各自独立强度的噪声来训练的因果扩散序列模型。","explanation":"扩散强制由 MIT 的 Boyuan Chen、Vincent Sitzmann、Russ Tedrake 等人于 2024 年提出，发表于 NeurIPS 2024。以往序列生成有两类：下一个 token 预测逐个生成，长度灵活，但长时间推演容易跑偏；全序列扩散一次去噪整段，能对整条轨迹做引导，但长度固定。扩散强制训练一个因果模型，让序列中每个 token 的噪声水平各自独立随机，推理时就既能像自回归那样一帧帧往后生成、超出训练长度，也能像扩散那样用引导把整条轨迹推向期望目标。它被用于长视频生成、规划和机器人控制，也是自回归视频生成和世界模型里常被沿用和对比的训练方式。","example":"论文的真机实验中，机械臂要借助第三个槽位交换两个随机摆放的水果，必须记住初始位置；扩散强制完成了任务，对比的模仿学习基线因缺少记忆而失败。","related":["扩散模型","自回归视频生成","下一个 token 预测","教师强制","世界模型","Self Forcing（自强制训练）"]},{"id":"interactive-world-model","category":"model","sec":8,"tier":3,"sources":[{"title":"Genie: Generative Interactive Environments (arXiv:2402.15391)","url":"https://arxiv.org/abs/2402.15391"},{"title":"Learning Interactive Real-World Simulators (UniSim, arXiv:2310.06114)","url":"https://arxiv.org/abs/2310.06114"},{"title":"Genie 3: A new frontier for world models（Google DeepMind 博客）","url":"https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/"}],"as_of":"2025-08","related_ids":["world-model","genie-3","unisim","latent-action-model","video-generation-model","world-model-based-policy-evaluation"],"name":"可交互世界模型","alt":"Interactive World Model","abbr":"","aliases":["动作条件视频模型","Action-conditioned Video Model","交互式视频生成","生成式交互环境","Generative Interactive Environment"],"one_liner":"每一步接收动作输入、据此生成接下来画面的世界模型，可当神经网络模拟器用。","explanation":"普通视频生成模型根据一段文字一次性生成整段视频，中途无法干预；可交互世界模型则在每一步接收动作（键盘操作、机器人控制命令或文字事件），据此生成接下来的画面，相当于用神经网络实现的模拟器。2023 年的 UniSim 融合多种数据学习对人和机器人动作的视觉响应，并在其中训练出能零样本部署到真实世界的策略；谷歌 DeepMind 2024 年的 Genie（110 亿参数）只用无动作标签的网络视频训练，靠潜在动作模型（从前后帧自动推断「做了什么动作」）实现逐帧控制；2025 年 8 月发布的 Genie 3 能以 720p、每秒 24 帧实时交互，并在几分钟内保持场景一致。对具身智能而言，它可用于评估策略、生成训练数据，或让智能体在生成的世界里学习。","example":"DeepMind 把 SIMA 智能体放进 Genie 3 生成的世界：智能体发出前进、转向等导航动作，Genie 3 实时生成对应画面，智能体据此去完成给定目标。","related":["世界模型","Genie 3","UniSim","潜在动作模型","视频生成模型","世界模型评测"]},{"id":"latent-world-model","category":"model","sec":8,"tier":3,"sources":[{"title":"Learning Latent Dynamics for Planning from Pixels (PlaNet, arXiv:1811.04551)","url":"https://arxiv.org/abs/1811.04551"},{"title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning (arXiv:2411.04983)","url":"https://arxiv.org/abs/2411.04983"},{"title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv:2506.09985)","url":"https://arxiv.org/abs/2506.09985"}],"as_of":"2025-06","related_ids":["world-model","recurrent-state-space-model","dino-wm","v-jepa-2","joint-embedding-predictive-architecture","learning-in-imagination"],"name":"隐空间世界模型","alt":"Latent World Model","abbr":"","aliases":["潜在世界模型","潜在动力学模型","Latent Dynamics Model","隐空间动力学模型"],"one_liner":"在压缩后的隐状态里预测「执行某个动作后世界会怎样变化」的世界模型。","explanation":"世界模型指能根据当前状态和动作预测未来的模型。直接预测未来图像要生成大量与决策无关的像素细节，又慢又难；隐空间世界模型先把观测编码成低维隐状态，只在隐空间里预测下一步的隐状态，规划或训练策略也在隐空间完成。Hafner 等人 2018 年的 PlaNet 提出兼含确定性和随机成分的循环状态空间模型（RSSM），后来的 Dreamer 系列用它在「想象」中训练策略。另一条路线不重建像素：DINO-WM 直接预测预训练视觉模型 DINOv2 的图像块特征；Meta 2025 年的 V-JEPA 2-AC 只用不到 62 小时的 DROID 机器人视频训练动作条件预测器，就在两个实验室的 Franka 机械臂上零样本完成抓取放置。难点是隐状态无法直接查看，不重建像素的方法还要防止表征坍缩（所有输入被编码成几乎相同的向量）。","example":"V-JEPA 2-AC 做抓取放置时，把目标图像编码成隐向量，在隐空间里对多组候选动作分别预测结果，选出预测结果最接近目标的动作去执行，全程不生成图像。","related":["世界模型","循环状态空间模型","DINO-WM","V-JEPA 2","联合嵌入预测架构","想象中学习"]},{"id":"recurrent-state-space-model","category":"model","sec":8,"tier":3,"sources":[{"title":"Learning Latent Dynamics for Planning from Pixels (PlaNet, arXiv 1811.04551)","url":"https://arxiv.org/abs/1811.04551"},{"title":"Mastering Diverse Domains through World Models (DreamerV3, arXiv 2301.04104)","url":"https://arxiv.org/html/2301.04104"},{"title":"Training Agents Inside of Scalable World Models (Dreamer 4, arXiv 2509.24527)","url":"https://arxiv.org/abs/2509.24527"}],"as_of":"2025-09","related_ids":["world-model","latent-world-model","dreamerv3","dreamer-4","learning-in-imagination","recurrent-neural-network"],"name":"循环状态空间模型","alt":"Recurrent State-Space Model","abbr":"RSSM","aliases":["递归状态空间模型"],"one_liner":"Dreamer 系列世界模型的核心结构，用确定性循环状态加随机隐变量预测未来。","explanation":"循环状态空间模型是 Danijar Hafner 等人（Google Brain、DeepMind 等）2019 年在 PlaNet 论文中提出的隐空间动力学模型，后来成为 Dreamer 到 DreamerV3 世界模型的核心。它的状态分两部分：一个确定性的循环隐状态 h，由 GRU 这类循环网络更新，负责记住历史；一个随机隐变量 z，表示当前时刻的不确定信息。给定上一步状态和动作，模型先更新 h，再预测下一步的 z；训练时另用编码器从真实图像推出 z 作对照，并要求能重建图像、预测奖励。PlaNet 的对比实验显示，纯确定性或纯随机的版本都不如两者结合。有了它，智能体可以在隐空间里「想象」多步未来来规划或训练策略，大幅减少和真实环境的交互。DreamerV3 把 z 改成离散类别分布；2025 年的 Dreamer 4 则改用 Transformer 架构的世界模型。","example":"DreamerV3 用 RSSM 世界模型生成想象轨迹，在上面训练行动者和评论家网络，论文称它是首个不借助人类数据、从零在 Minecraft 里挖到钻石的算法。","related":["世界模型","隐空间世界模型","DreamerV3","Dreamer 4","想象中学习","循环神经网络"]},{"id":"joint-embedding-predictive-architecture","category":"model","sec":8,"tier":2,"sources":[{"title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv 2506.09985)","url":"https://arxiv.org/abs/2506.09985"},{"title":"Meta AI: I-JEPA, the first AI model based on Yann LeCun's vision","url":"https://ai.meta.com/blog/yann-lecun-ai-model-i-jepa/"},{"title":"Wikipedia: Yann LeCun","url":"https://en.wikipedia.org/wiki/Yann_LeCun"}],"as_of":"2025-11","related_ids":["v-jepa-2","world-model","self-supervised-learning","latent-world-model","masked-autoencoder","representation-collapse"],"name":"联合嵌入预测架构","alt":"Joint-Embedding Predictive Architecture","abbr":"JEPA","aliases":["I-JEPA","V-JEPA"],"one_liner":"在抽象表征空间里预测被遮住或未来的内容，而不还原像素的自监督架构。","explanation":"JEPA 是 Yann LeCun 在 2022 年立场论文《A Path Towards Autonomous Machine Intelligence》中提出的架构，Meta 随后做出图像版 I-JEPA（2023）和视频版 V-JEPA。它把输入的一部分（上下文）编码后，让预测器去预测另一部分（被遮住的区域或未来帧）的表征，损失算在表征上而不是像素上，因此不必还原树叶纹理这类难以预测的细节，更专注物体和运动等语义信息，但要额外设计来防止表征坍缩。2025 年 6 月的 V-JEPA 2 用超过 100 万小时视频预训练，再用不到 62 小时机器人视频训练出动作条件版 V-JEPA 2-AC，能零样本在 Franka 机械臂上按目标图像规划抓放。LeCun 已于 2025 年 11 月离开 Meta，创办 AMI Labs 继续做世界模型。","example":"V-JEPA 2-AC 做抓放：给一张「杯子已放到盘子上」的目标图，模型在表征空间里推演多组候选动作的结果，选预测表征最接近目标图的那组执行。","related":["V-JEPA 2","世界模型","自监督学习","隐空间世界模型","掩码自编码器","表征坍缩"]},{"id":"representation-collapse","category":"model","sec":8,"tier":3,"sources":[{"title":"VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning (arXiv 2105.04906)","url":"https://arxiv.org/abs/2105.04906"},{"title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv 2506.09985)","url":"https://arxiv.org/html/2506.09985"}],"as_of":"2025-06","related_ids":["self-supervised-learning","joint-embedding-predictive-architecture","contrastive-learning","stop-gradient","exponential-moving-average","v-jepa-2"],"name":"表征坍缩","alt":"Representation Collapse","abbr":"","aliases":["表示坍缩","表征崩溃","维度坍缩"],"one_liner":"自监督训练时编码器对所有输入都输出相同或相近的向量，表征失去信息。","explanation":"表征坍缩是自监督学习和联合嵌入预测类模型里的典型失败。如果训练目标只要求同一样本两个视角（或当前与未来）的表征彼此接近，编码器最省事的解就是对任何输入都输出同一个常向量：损失很小，表征却不含任何信息。较轻的形式叫维度坍缩，向量只用上了少数几个维度。防坍缩的办法大致三类：对比学习用负样本把不同图片的表征推开；VICReg（Bardes、Ponce、LeCun，2021）显式约束每一维的方差和维度间的协方差；BYOL、JEPA 系列用停止梯度加指数移动平均（EMA）目标编码器。具身智能里，用 JEPA 式隐空间训练视频表征或世界模型时，例如 Meta 的 V-JEPA 2，同样要处理这个问题。","example":"V-JEPA 2 训练时，被遮挡视频片段的目标表征由编码器权重的 EMA 副本计算并施加停止梯度，论文说明这样做正是为了防止表征坍缩。","related":["自监督学习","联合嵌入预测架构","对比学习","梯度阻断","指数移动平均","V-JEPA 2"]},{"id":"4d-world-model","category":"model","sec":8,"tier":3,"sources":[{"title":"TesserAct: Learning 4D Embodied World Models (arXiv 2504.20995)","url":"https://arxiv.org/abs/2504.20995"},{"title":"TesserAct 论文 HTML 版","url":"https://arxiv.org/html/2504.20995"}],"as_of":"2025-04","related_ids":["world-model","4d-reconstruction","video-generation-model","inverse-dynamics-model","3d-vla","spatial-intelligence"],"name":"4D 世界模型","alt":"4D World Model","abbr":"","aliases":["4D 具身世界模型","4D Embodied World Model"],"one_liner":"预测三维场景随时间如何变化的世界模型（3D 空间加时间）","explanation":"世界模型是给定当前观测和动作、预测世界接下来会变成什么样的模型。多数视频世界模型只生成 2D 画面，缺少深度和几何，机器人很难从中精确读出物体在空间里的位置。4D 世界模型把预测对象换成「3D 空间 + 时间」：每一帧都带几何信息，可以拼成随时间变化的三维场景。代表作是 UMass Amherst 等团队 2025 年 4 月发布的 TesserAct：在 CogVideoX 视频生成模型上微调，同时预测 RGB、深度和法向量（RGB-DN）视频，再重建成时序一致的 4D 场景；动作则由逆动力学模型（根据前后状态反推动作的网络）从点云特征里算出 7 自由度机械臂动作。它和 4D 重建、视频生成、空间智能都有交叉。","example":"TesserAct 给定当前画面和一条语言指令，生成带深度和法向的未来视频，转成 4D 场景后，用 PointNet 编码点云并结合指令，输出 7-DoF 动作。","related":["世界模型","4D重建","视频生成模型","逆动力学模型","3D VLA","空间智能"]},{"id":"world-action-model","category":"model","sec":8,"tier":2,"sources":[{"title":"World Action Models are Zero-shot Policies (DreamZero, arXiv 2602.15922)","url":"https://arxiv.org/abs/2602.15922"},{"title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination? (arXiv 2603.16666)","url":"https://arxiv.org/abs/2603.16666"}],"as_of":"2026-03","related_ids":["vision-language-action-model","world-model","video-generation-model","dreamzero","fast-wam","video-prediction-policy"],"name":"世界动作模型","alt":"World Action Model","abbr":"WAM","aliases":["World-Action Model","视频动作模型","Video-Action Model","VAM"],"one_liner":"同时预测未来画面和机器人动作，用对世界的预测来指导动作的模型。","explanation":"世界动作模型这个名称由 NVIDIA 2026 年 2 月的 DreamZero 论文正式提出：凡是利用世界建模能力（预测未来状态）来预测动作的模型都叫 WAM，此前的 GR-1、UWM、Cosmos Policy 等视频-动作联合模型也被归入其中。典型做法是以预训练视频生成模型为骨干，加上动作输入输出，训练时同时预测未来视频和动作。和从视觉语言模型出发的 VLA 相比，它从视频里学物理动态，DreamZero 报告对新任务、新环境的泛化比当时最好的 VLA 高一倍多。不叫视频动作模型，是因为预测对象将来也可以是触觉或力。未决问题是推理时是否真要生成未来画面：Fast-WAM 只在训练时联合预测视频、推理时跳过，效果相近而快 4 倍以上。","example":"DreamZero 以 Wan2.1 图生视频 14B 模型为骨干，输入相机画面和语言指令，同时生成未来视频和动作，在真机上以 7Hz 实时控制。","related":["视觉-语言-动作模型","世界模型","视频生成模型","DreamZero","Fast-WAM","视频预测策略"]},{"id":"inference-latency","category":"model","sec":9,"tier":1,"sources":[{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)","url":"https://arxiv.org/html/2410.24164"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)","url":"https://arxiv.org/html/2406.09246"},{"title":"Real-Time Execution of Action Chunking Flow Policies (arXiv:2506.07339)","url":"https://arxiv.org/abs/2506.07339"}],"as_of":"2025-06","related_ids":["inference","action-chunking","asynchronous-inference","real-time-chunking","control-frequency","post-training-quantization"],"name":"推理延迟","alt":"Inference Latency","abbr":"","aliases":["推理时延","模型延迟"],"one_liner":"模型从拿到输入到算出输出所花的时间，决定机器人反应快慢。","explanation":"推理延迟指模型收到一帧观测（图像、关节状态、指令）后，跑完前向计算、给出动作所需的时间，常以毫秒计。大模型计算量大，延迟常跟不上机器人几十到几百赫兹的控制频率：70 亿参数的 OpenVLA 在 RTX 4090 上约 6Hz 出一次动作；π0 论文在同款显卡上测得，3 路图像时一次完整推理约 73 毫秒，改在机器人外的电脑上算、经 Wi-Fi 传输则约 86 毫秒。延迟过大会让机器人在两段动作之间停顿，或跟不上移动的物体。常见对策有动作分块（一次输出几十步动作）、异步推理（执行当前动作的同时计算下一段）、量化与推理加速，以及让大小模型分层、各按自己的频率运行。","example":"π0 控制 50Hz 的机器人时，一次推理输出 50 步动作，执行 25 步（0.5 秒）后再推理下一段，而不是每一步都跑一次大模型。","related":["推理（前向计算）","动作分块","异步推理","实时动作分块","控制频率","训练后量化"]},{"id":"asynchronous-inference","category":"model","sec":9,"tier":2,"sources":[{"title":"Asynchronous Inference (LeRobot 文档)","url":"https://huggingface.co/docs/lerobot/async"},{"title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (arXiv:2506.01844)","url":"https://arxiv.org/abs/2506.01844"},{"title":"Real-Time Execution of Action Chunking Flow Policies (arXiv:2506.07339)","url":"https://arxiv.org/abs/2506.07339"}],"as_of":"2025-06","related_ids":["inference-latency","action-chunking","real-time-chunking","policy-server","smolvla","lerobot"],"name":"异步推理","alt":"Asynchronous Inference","abbr":"","aliases":["异步执行","Async Inference"],"one_liner":"机器人边执行当前动作块，模型边算下一块，不停下来等。","explanation":"异步推理把「模型算动作」和「机器人执行动作」拆成并行的两部分。同步推理时，机器人执行完一个动作块就得停下来等模型算出下一块，模型越大停顿越明显。异步做法是队列还剩一定比例时就把最新观测发给模型，让下一块在当前块用完前算好，重叠部分按规则合并。Hugging Face 在 2025 年 6 月随 SmolVLA 推出这套机制，LeRobot 里分成跑模型的 PolicyServer 和控制机器人的 RobotClient 两端。难点在块与块的衔接：新块基于稍早的观测算出，直接切换会让动作跳变；Physical Intelligence 提出的实时动作分块（RTC）专门处理这个问题。","example":"在 LeRobot 中设每次输出 50 步动作、阈值 0.5：队列里剩不到 25 步时，客户端就把新画面发给服务器，重叠部分按加权平均合并。","related":["推理延迟","动作分块","实时动作分块","策略服务器","SmolVLA","LeRobot"]},{"id":"real-time-chunking","category":"model","sec":9,"tier":2,"sources":[{"title":"Real-Time Execution of Action Chunking Flow Policies (arXiv 2506.07339)","url":"https://arxiv.org/abs/2506.07339"},{"title":"Training-Time Action Conditioning for Efficient Real-Time Chunking (arXiv 2512.05964)","url":"https://arxiv.org/abs/2512.05964"},{"title":"LeRobot Docs: Real-Time Chunking (RTC)","url":"https://huggingface.co/docs/lerobot/main/en/rtc"}],"as_of":"2026-09","related_ids":["action-chunking","asynchronous-inference","inference-latency","flow-matching","temporal-ensembling","pi0-5"],"name":"实时动作分块","alt":"Real-Time Chunking","abbr":"RTC","aliases":["实时分块","Real-Time Execution of Action Chunking Flow Policies","推理时 RTC","训练时 RTC","Training-time RTC"],"one_liner":"边执行当前动作块边算下一块，并让新块与已执行动作平滑衔接的方法。","explanation":"实时动作分块是 Physical Intelligence 的 Kevin Black 等人 2025 年提出的推理算法（NeurIPS 2025）。大模型算一个动作块要上百毫秒，同步执行会在块间停顿，异步执行又可能让新旧两块对不上而跳变。RTC 在执行当前块时就开始算下一块：推理期间必然执行掉的几步被「冻结」，其余部分当作补全（inpainting）问题，在流匹配去噪时加引导项、用软掩码逐步放松约束，让新旧块平滑衔接。它无需重新训练，论文在 π0.5 上演示了延迟超过 300 毫秒仍能划火柴点蜡烛。2025 年 12 月又有了训练时 RTC，训练中模拟延迟，省掉推理时的引导计算。","example":"在 LeRobot 里给 π0.5 打开 RTC 配置，并按实测推理耗时填入延迟步数，机器人执行动作块时就不再每块停顿等待下一块。","related":["动作分块","异步推理","推理延迟","流匹配","时序集成","π0.5"]},{"id":"floating-point-operations","category":"model","sec":9,"tier":2,"sources":[{"title":"Scaling Laws for Neural Language Models (Kaplan et al., 2020)","url":"https://arxiv.org/abs/2001.08361"},{"title":"Scaling Laws for Neural Language Models（ar5iv 全文，含 C≈6N 推导）","url":"https://ar5iv.labs.arxiv.org/html/2001.08361"}],"as_of":"","related_ids":["parameter-count","scaling-law","flops-tflops","inference-latency","on-device-model","visual-token-pruning"],"name":"浮点运算量（FLOPs）","alt":"Floating-Point Operations (FLOPs)","abbr":"FLOPs","aliases":["浮点运算次数","计算量","FLOP"],"one_liner":"完成一次计算要做多少次浮点加法和乘法，衡量模型算得有多重。","explanation":"FLOPs 是 floating-point operations 的缩写，指完成一次计算所需的浮点运算总次数，用来衡量模型的计算量。小写 s 表示复数，和大写 S 表示「每秒」的 FLOPS（硬件算力）不是一回事。Transformer 有个常用估算：参数量为 N 的模型处理一个 token，前向约 2N 次浮点运算，算上反向传播的训练约 6N，出自 OpenAI 2020 年的缩放定律论文；训练总算力也常用 FLOPs 计。对机器人而言它直接影响推理延迟：同一块车载芯片上，FLOPs 越大的策略推理越慢、控制频率越低，所以端侧部署常靠缩小模型、剪掉视觉 token 来降 FLOPs。","example":"按 2N 粗算，一个 70 亿参数的 VLA 处理 1 个 token 的前向约 140 亿次浮点运算（14 GFLOPs）；一次输入 256 个图像 token，仅这部分就约 3.6 万亿次（不计注意力项）。","related":["参数量","缩放定律","浮点算力（FLOPS / TFLOPS）","推理延迟","端侧模型","视觉 token 剪枝"]},{"id":"key-value-cache","category":"model","sec":9,"tier":2,"sources":[{"title":"Hugging Face Transformers: Cache strategies","url":"https://huggingface.co/docs/transformers/kv_cache"},{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/html/2410.24164"}],"as_of":"","related_ids":["self-attention","causal-attention","autoregressive-decoding","inference-latency","context-length","pi0"],"name":"KV 缓存","alt":"Key-Value Cache","abbr":"KV Cache","aliases":["键值缓存","KV Caching"],"one_liner":"把已算过的注意力键和值存起来，生成后续 token 时直接复用。","explanation":"KV 缓存是 Transformer 推理时的标准加速手段。自注意力中每个 token 会算出查询（Q）、键（K）、值（V）三组向量；自回归生成时每步只新增一个 token，而前面 token 的 K 和 V 不会变。不缓存的话每步都要把整段前文重算一遍；缓存后每步只算新 token，再和存好的 K、V 做注意力，速度大幅提升。代价是显存：缓存随上下文长度线性增长，长上下文时常成为瓶颈，于是有量化缓存、滑动窗口等办法。它在 VLA 里同样关键：π0 把图像和语言组成的前缀的 K、V 缓存起来，流匹配的 10 步去噪只重算动作部分，整次推理约 73 毫秒。","example":"π0 一次推理：图像编码约 14 毫秒、前缀前向约 32 毫秒只算一次；动作专家 10 步去噪共约 27 毫秒，每步都复用同一份前缀 KV 缓存。","related":["自注意力","因果注意力","自回归解码","推理延迟","上下文长度","π0"]},{"id":"speculative-decoding","category":"model","sec":9,"tier":3,"sources":[{"title":"Fast Inference from Transformers via Speculative Decoding (arXiv:2211.17192)","url":"https://arxiv.org/abs/2211.17192"},{"title":"Accelerating Large Language Model Decoding with Speculative Sampling (arXiv:2302.01318)","url":"https://arxiv.org/abs/2302.01318"},{"title":"Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance (arXiv:2507.22424)","url":"https://arxiv.org/abs/2507.22424"}],"as_of":"2026-03","related_ids":["autoregressive-decoding","inference-latency","parallel-decoding","key-value-cache","vision-language-action-model","openvla"],"name":"投机解码","alt":"Speculative Decoding","abbr":"","aliases":["推测解码","推测采样","Speculative Sampling"],"one_liner":"先让小模型快速猜几个 token，再让大模型一次并行核对，结果不变、速度更快。","explanation":"投机解码是大模型推理加速技术，2022 年底由谷歌的 Leviathan 等人提出（ICML 2023），DeepMind 的 Chen 等人同期提出了思路相同的「推测采样」。自回归模型每生成一个 token 都要把大模型完整跑一遍，很慢。投机解码先用便宜的草稿模型连续猜出几个 token，再让大模型在一次前向里并行给它们打分，按特定的接受规则保留猜对的前缀、从第一个不对的位置重新采样；这样输出分布与大模型单独生成完全一致，也不用重新训练。谷歌在 T5-XXL 上测到 2–3 倍加速。具身智能里，OpenVLA 这类输出离散动作 token 的 VLA 也用它降低推理延迟，2026 年还出现了结合运动学信息的改进方法。","example":"Spec-VLA（EMNLP 2025）发现直接套用标准投机解码对 VLA 提速有限，于是利用动作 token 之间的相对距离放宽接受条件，在 OpenVLA 上把接受长度提高 44%，加速 1.42 倍且成功率不降。","related":["自回归解码","推理延迟","并行解码","KV 缓存","视觉-语言-动作模型","OpenVLA"]},{"id":"post-training-quantization","category":"model","sec":9,"tier":3,"sources":[{"title":"A White Paper on Neural Network Quantization (Nagel et al., arXiv 2106.08295)","url":"https://arxiv.org/abs/2106.08295"},{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/html/2406.09246"},{"title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers (arXiv 2210.17323)","url":"https://arxiv.org/abs/2210.17323"}],"as_of":"2024-06","related_ids":["quantization-aware-training","pruning","on-device-edge-deployment","inference-latency","nvidia-tensorrt","numerical-precision-formats"],"name":"训练后量化","alt":"Post-Training Quantization","abbr":"PTQ","aliases":["后训练量化","离线量化"],"one_liner":"模型训练完后，直接把权重和激活换成低比特数值，不用重新训练。","explanation":"训练后量化是一种模型压缩方法：模型按正常精度（FP32、BF16 等）训练完后，把权重、有时连同激活值，换成 INT8、INT4 等低比特表示。它通常只需一小批校准数据来统计数值范围，不需要标注数据，也不重新训练。高通 AI 研究院的量化白皮书总结，多数模型用 PTQ 做到 8 比特时精度接近浮点；再往下压就容易掉点，需要 GPTQ 这类利用二阶信息的方法，或者改用量化感知训练。对具身智能来说，它主要服务于部署：VLA 动辄几十亿参数，机器人上的显存和算力有限，量化能直接降低显存占用、加快推理。TensorRT、ONNX Runtime 等部署工具都支持 PTQ。","example":"OpenVLA 论文把 7B 模型做 4 比特量化推理，在 BridgeData V2 任务上成功率 71.9%，和 BF16 的 71.3% 持平，显存从 16.8GB 降到 7.0GB。","related":["量化感知训练","剪枝","端侧部署","推理延迟","TensorRT","数值精度格式（FP32 / BF16 / FP16 / FP8 / INT8）"]},{"id":"quantization-aware-training","category":"model","sec":9,"tier":3,"sources":[{"title":"Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference (arXiv 1712.05877)","url":"https://arxiv.org/abs/1712.05877"},{"title":"Gemma 3 QAT Models: Bringing state-of-the-Art AI to consumer GPUs (Google Developers Blog)","url":"https://developers.googleblog.com/en/gemma-3-quantized-aware-trained-state-of-the-art-ai-to-consumer-gpus/"},{"title":"BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation (arXiv 2506.07530)","url":"https://arxiv.org/abs/2506.07530"}],"as_of":"2025-06","related_ids":["post-training-quantization","pruning","knowledge-distillation","on-device-edge-deployment","mixed-precision-training","numerical-precision-formats"],"name":"量化感知训练","alt":"Quantization-Aware Training","abbr":"QAT","aliases":["量化训练","伪量化训练"],"one_liner":"训练时就模拟低比特带来的误差，让模型提前适应，量化后精度掉得更少。","explanation":"量化感知训练是在训练或微调时插入「伪量化」操作：前向计算中先把权重和激活取整到低比特（如 INT8、INT4）再参与运算，反向传播时把取整当作恒等函数（直通估计器）绕过不可导的步骤，让模型学会在量化误差下工作。谷歌 Jacob 等人 2018 年面向纯整数推理的论文是这一做法的代表。和训练后量化相比，QAT 需要训练数据和额外算力，但在 4 比特及更低位宽时精度保持得明显更好，常见流程是先正常训练，再做一小段 QAT 微调。具身方向上，BitVLA 用「先量化再蒸馏」的量化感知训练，由全精度教师模型引导，把视觉编码器压到 1.58 比特，论文报告显存比 OpenVLA-OFT 少 11 倍而性能相当。","example":"谷歌 2025 年 4 月发布 Gemma 3 的 QAT 版本：做约 5000 步 QAT 后再量化到 int4，27B 模型显存从 BF16 的 54GB 降到 14.1GB，谷歌称量化造成的困惑度损失比直接量化少 54%。","related":["训练后量化","剪枝","知识蒸馏","端侧部署","混合精度训练","数值精度格式（FP32 / BF16 / FP16 / FP8 / INT8）"]},{"id":"pruning","category":"model","sec":9,"tier":3,"sources":[{"title":"Learning both Weights and Connections for Efficient Neural Networks (Han et al., arXiv 1506.02626)","url":"https://arxiv.org/abs/1506.02626"},{"title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models (arXiv 2506.10100)","url":"https://arxiv.org/abs/2506.10100"}],"as_of":"2025-06","related_ids":["visual-token-pruning","post-training-quantization","quantization-aware-training","knowledge-distillation","on-device-edge-deployment","early-exit"],"name":"剪枝","alt":"Pruning","abbr":"","aliases":["模型剪枝","网络剪枝","Network Pruning"],"one_liner":"删掉模型里不重要的权重、通道或层，让模型变小变快。","explanation":"剪枝是一类模型压缩方法：找出网络中对输出影响小的部分并删掉。删单个权重叫非结构化剪枝，删整个通道、注意力头或层叫结构化剪枝。这一思路可追溯到 LeCun 等人 1989 年的 Optimal Brain Damage；2015 年 Song Han 等人提出「先训练、剪掉小权重、再重新训练」的三步法，把 AlexNet 参数从 6100 万减到 670 万、VGG-16 压缩 13 倍，ImageNet 精度基本不降。非结构化剪枝得到的是稀疏矩阵，要专门的硬件或库才能真正提速；结构化剪枝直接让矩阵变小，更容易提速。在具身智能里，剪枝常和量化、知识蒸馏一起用来把大模型塞进机器人的端侧算力，针对 VLA 还出现了剪冗余语言层、剪视觉 token 的做法。","example":"EfficientVLA 不额外训练，剪掉 CogACT 语言模块里功能冗余的层、筛掉不重要的视觉 token，并缓存扩散动作头的中间特征，在 SIMPLER 上推理提速 1.93 倍，成功率只降 0.6%。","related":["视觉 token 剪枝","训练后量化","量化感知训练","知识蒸馏","端侧部署","早退机制"]},{"id":"visual-token-pruning","category":"model","sec":9,"tier":3,"sources":[{"title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models (FastV, arXiv:2403.06764)","url":"https://arxiv.org/abs/2403.06764"},{"title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models (arXiv:2506.10100)","url":"https://arxiv.org/abs/2506.10100"}],"as_of":"2026-09","related_ids":["visual-token","inference-latency","pruning","attention-mechanism","key-value-cache","on-device-edge-deployment"],"name":"视觉 token 剪枝","alt":"Visual Token Pruning","abbr":"","aliases":["token 压缩","视觉 token 压缩","Token Pruning"],"one_liner":"推理时丢掉或合并不重要的图像 token，让视觉语言模型和 VLA 跑得更快。","explanation":"VLM 和 VLA 会把每张图切成几百个视觉 token（图像小块对应的向量）送进语言模型，多相机、多帧时数量成倍增加，而注意力计算量随 token 数大致平方增长，是推理延迟的主要来源之一。视觉 token 剪枝按某种重要性分数（常用文本或动作 token 对它的注意力大小）只保留少数关键 token，其余删掉或合并，很多方法无需重训、即插即用。代表工作 FastV（ECCV 2024）发现第 2 层之后模型对图像 token 的注意力很稀疏，于是在浅层后砍掉一半，LLaVA-1.5-13B 的计算量降约 45% 而效果基本不变。机器人上它直接关系到控制频率：EfficientVLA 把视觉 token 筛选、跳层和缓存结合，让 CogACT 提速 1.93 倍；2025–2026 年又出现了大量 VLA 专用剪枝方法。","example":"FastV 让图像先照常经过语言模型的前两层，之后按注意力分数只保留一半最受关注的图像 token 进入后续层，不改权重、不用再训练，就明显减少了 LLaVA-1.5 的推理计算量。","related":["视觉 token","推理延迟","剪枝","注意力机制","KV 缓存","端侧部署"]},{"id":"early-exit","category":"model","sec":9,"tier":3,"sources":[{"title":"BranchyNet: Fast Inference via Early Exiting from Deep Neural Networks (arXiv:1709.01686)","url":"https://arxiv.org/abs/1709.01686"},{"title":"DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution (arXiv:2411.02359)","url":"https://arxiv.org/abs/2411.02359"}],"as_of":"","related_ids":["inference-latency","on-device-model","visual-token-pruning","pruning","speculative-decoding","mixture-of-experts"],"name":"早退机制","alt":"Early Exit","abbr":"","aliases":["提前退出","多出口网络","动态推理"],"one_liner":"让简单输入在网络中间层就提前输出结果、省掉后面几层计算的方法。","explanation":"深度网络对每个输入都要跑完全部层，但很多简单样本用浅层特征就足以判断。早退机制在网络中间插入若干「出口」（小的分类头或输出头），推理时某个出口已经足够有把握，就直接输出，不再往下算，只有难样本才走完整个网络。哈佛大学 Teerapittayanon 等人提出的 BranchyNet 是较早的代表工作，这一思路后来被用到 BERT 和大语言模型上。机器人控制里大部分时刻动作简单、少数时刻才需要复杂推理，正适合这种做法：清华大学黄高团队等在 NeurIPS 2024 提出 DeeR-VLA，把多模态大模型改成多出口结构，按算力、延迟和显存预算决定何时退出。","example":"DeeR-VLA 在 CALVIN 基准上报告，大语言模型部分的计算量降低 5.2–6.5 倍、GPU 显存降低 2–6 倍，任务性能基本不受影响。","related":["推理延迟","端侧模型","视觉 token 剪枝","剪枝","投机解码","混合专家模型"]},{"id":"on-device-model","category":"model","sec":9,"tier":2,"sources":[{"title":"Google DeepMind: Gemini Robotics On-Device brings AI to local robotic devices","url":"https://deepmind.google/discover/blog/gemini-robotics-on-device-brings-ai-to-local-robotic-devices/"},{"title":"Apple Machine Learning Research: Updates to Apple's On-Device and Server Foundation Language Models","url":"https://machinelearning.apple.com/research/apple-foundation-models-2025-updates"}],"as_of":"2025-07","related_ids":["on-device-edge-deployment","cloud-edge-device-collaboration","post-training-quantization","nvidia-jetson","gemini-robotics-on-device","inference-latency"],"name":"端侧模型","alt":"On-device Model","abbr":"","aliases":["边缘模型","端侧大模型","Edge Model","On-device AI"],"one_liner":"直接跑在机器人、手机等设备本地芯片上、不依赖云端的模型。","explanation":"端侧模型指部署在终端设备上本地运行的模型，比如装在机器人机载计算机（如英伟达 Jetson）、手机或汽车芯片上，与放在云端数据中心推理的模型相对。设备的算力、内存和功耗都有限，所以端侧模型通常参数更少，并借助量化、剪枝、蒸馏等手段压缩，例如苹果 2025 年的端侧基础模型约 3B 参数，权重用量化感知训练压到每个 2 位。对机器人来说，本地运行的好处很实际：断网也能用，没有网络往返延迟，数据不出设备。代价是能力通常不如云端大模型，所以常见做法是云端大模型负责慢速的规划推理，端侧小模型负责高频出动作，也就是云边端协同。","example":"谷歌 DeepMind 2025 年 6 月发布 Gemini Robotics On-Device，这个 VLA 可以脱离数据网络在机器人本地运行，用 50 到 100 条演示就能适配新任务，已在双臂 Franka FR3 和 Apptronik Apollo 人形机器人上验证。","related":["端侧部署","云边端协同","训练后量化","英伟达 Jetson","Gemini Robotics On-Device","推理延迟"]},{"id":"uncertainty-estimation","category":"model","sec":9,"tier":3,"sources":[{"title":"Wikipedia: Uncertainty quantification","url":"https://en.wikipedia.org/wiki/Uncertainty_quantification"},{"title":"Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles (arXiv:1612.01474)","url":"https://arxiv.org/abs/1612.01474"},{"title":"Robots That Ask For Help: Uncertainty Alignment for Large Language Model Planners (arXiv:2307.01928)","url":"https://arxiv.org/abs/2307.01928"}],"as_of":"","related_ids":["out-of-distribution","robustness","embodied-safety","failure-recovery","human-in-the-loop","knowno"],"name":"不确定性估计","alt":"Uncertainty Estimation / Quantification","abbr":"","aliases":["不确定性量化","UQ","Uncertainty Quantification","置信度估计"],"one_liner":"让模型在给出预测的同时说明自己有多没把握，好知道何时该停下或求助。","explanation":"不确定性估计研究怎样量化模型对自己输出的把握。通常分两类：偶然不确定性来自数据本身的随机性，比如传感器噪声，多收数据也消不掉；认知不确定性来自模型没见过、没学好，补数据可以降低。常用方法有深度集成（训练多个模型看它们的分歧）、蒙特卡洛 Dropout（推理时多次随机失活，看结果的波动）和共形预测（给出带统计覆盖保证的候选集合）。对机器人来说它直接关系安全：遇到分布外场景时，高不确定性可以触发减速、停止、请人接管或主动补采数据；基于模型的强化学习也常把集成模型的分歧当作探索信号。","example":"KnowNo（CoRL 2023）用共形预测衡量大语言模型规划器的不确定性：当候选动作集合里不止一个选项，比如桌上有两个碗而指令没说拿哪个，机器人就主动问人，在保证任务成功率的前提下尽量少求助。","related":["分布外","鲁棒性","具身安全","失败恢复","人在回路","KnowNo（会求助的机器人）"]},{"id":"gaussian-process","category":"model","sec":9,"tier":3,"sources":[{"title":"Gaussian process - Wikipedia","url":"https://en.wikipedia.org/wiki/Gaussian_process"},{"title":"PILCO: A Model-Based and Data-Efficient Approach to Policy Search (Deisenroth & Rasmussen, ICML 2011)","url":"https://icml.cc/2011/papers/323_icmlpaper.pdf"}],"as_of":"","related_ids":["system-identification","model-based-reinforcement-learning","uncertainty-estimation","sample-efficiency","safe-reinforcement-learning","kalman-filter"],"name":"高斯过程","alt":"Gaussian Process","abbr":"GP","aliases":["高斯过程回归","Gaussian Process Regression","GPR","克里金法"],"one_liner":"直接在「函数」上建概率分布的方法，预测时同时给出不确定度。","explanation":"高斯过程是一种随机过程：任取有限个输入点，对应的函数值都服从多元正态分布。它由均值函数和协方差函数完全决定，后者也叫核函数，描述两个输入点的函数值有多相关。用来做回归时，给定少量观测，就能算出任意新输入处的预测均值和方差，天然带不确定度。经典教材是 Rasmussen 和 Williams 2006 年的《Gaussian Processes for Machine Learning》。缺点是计算量随数据量 n 按 n³ 增长，数据多时要用稀疏近似。机器人里它多用在数据很少的场合：学动力学模型（如 Deisenroth 与 Rasmussen 2011 年的 PILCO，几次试验就能从零学会控制），或用贝叶斯优化调控制参数。","example":"PILCO 用高斯过程学习小车倒立摆的动力学，并把模型的不确定度计入长期预测，只用少量真实试验就学会了控制，而常规强化学习往往需要成百上千次尝试。","related":["系统辨识","基于模型的强化学习","不确定性估计","样本效率","安全强化学习","卡尔曼滤波"]},{"id":"interpretability","category":"model","sec":9,"tier":3,"sources":[{"title":"Mapping the Mind of a Large Language Model（Anthropic, 2024-05）","url":"https://www.anthropic.com/research/mapping-mind-language-model"},{"title":"Mechanistic interpretability for steering vision-language-action models (arXiv:2509.00328)","url":"https://arxiv.org/abs/2509.00328"}],"as_of":"2025-08","related_ids":["vision-language-action-model","large-language-model","neural-network","embodied-safety","uncertainty-estimation"],"name":"可解释性（机制可解释性）","alt":"Interpretability (Mechanistic Interpretability)","abbr":"","aliases":["机制可解释性","Mechanistic Interpretability","可解释 AI","Explainable AI"],"one_liner":"研究神经网络内部怎样得出输出；机制可解释性要把计算拆成人能懂的特征和回路。","explanation":"深度网络有上亿参数，输入到输出之间的计算人看不懂。可解释性研究想回答「模型为什么这样输出」，方法从画注意力热图、显著性图，到机制可解释性：像逆向工程程序那样，找出网络内部表示了哪些概念（特征），以及这些特征怎样连成完成某项计算的回路。难点之一是单个神经元往往同时参与表示多个概念；Anthropic 在 2024 年 5 月用字典学习（一种稀疏分解方法）从 Claude 3 Sonnet 中提取出数百万个特征，例如一个对多种语言的「金门大桥」文字和图片都会激活的特征。对机器人来说，它关系到调试与安全：2025 年伯克利团队在 π0-FAST、OpenVLA 内部找到对应「快/慢」「高/低」的语义方向，推理时调整这些激活就能实时改变机器人动作，无需微调或奖励信号。","example":"伯克利团队在 UR5 机械臂上运行 π0-FAST 搬运玩具，推理时增强模型内部与「快」相关的激活，机械臂移动得更快；增强与「低」相关的激活，搬运轨迹的最高点就变低，模型权重始终不变。","related":["视觉-语言-动作模型","大语言模型","神经网络","具身安全","不确定性估计"]},{"id":"openai-gpt-series","category":"named_model","sec":0,"tier":2,"sources":[{"title":"Products and applications of OpenAI - Text generation（GPT-n 系列发布表，Wikipedia）","url":"https://en.wikipedia.org/wiki/Products_and_applications_of_OpenAI"},{"title":"GPT-4o - Wikipedia","url":"https://en.wikipedia.org/wiki/GPT-4o"},{"title":"GPT-6 - Wikipedia","url":"https://en.wikipedia.org/wiki/GPT-6"}],"as_of":"2026-09","related_ids":["large-language-model","multimodal-large-language-model","openai","transformer","next-token-prediction","rekep"],"name":"GPT 系列（GPT-4o / GPT-5）","alt":"OpenAI GPT Series (Generative Pre-trained Transformer)","abbr":"GPT","aliases":["生成式预训练 Transformer","GPT-4o","GPT-5"],"one_liner":"OpenAI 的大语言模型系列，GPT-4o 起能直接处理图像和语音，常被机器人拿来做高层规划。","explanation":"GPT 是「生成式预训练 Transformer」的缩写，这里指 OpenAI 自 2018 年起发布的大语言模型系列：先在海量文本上做下一个 token 预测的预训练，再做微调和对齐。GPT-1（2018 年，1.17 亿参数）、GPT-2（2019 年，15 亿）、GPT-3（2020 年，1750 亿）一路验证了规模越大能力越强；GPT-4（2023 年 3 月）开始接受图像输入；GPT-4o（2024 年 5 月，o 取 omni「全能」之意）能处理和生成文字、图像、音频；GPT-5 于 2025 年 8 月 7 日发布，之后有 5.1、5.2 等迭代；GPT-6 于 2026 年 9 月发布，9 月 4 日先向付费用户开放 Astra 版，9 月 22 日又推出 Sol 和 Luna 两个版本。它们都是闭源模型，只能通过 ChatGPT 或 API 调用。具身智能里常把它当外挂的「大脑」：看图理解场景、把指令拆成步骤、写控制代码或挑选动作原语，再交给底层控制器执行，它本身不直接输出关节动作。","example":"ReKep 先用 DINOv2 在图上标出带编号的候选关键点，再把标注图和语言指令交给 GPT-4o，让它写出若干 Python 约束函数，描述各阶段关键点之间应满足的关系，最后由优化器求出机械臂末端的运动轨迹。","related":["大语言模型","多模态大语言模型","OpenAI","Transformer","下一个 token 预测","ReKep"]},{"id":"flamingo","category":"named_model","sec":0,"tier":3,"sources":[{"title":"Flamingo: a Visual Language Model for Few-Shot Learning (arXiv 2204.14198)","url":"https://arxiv.org/abs/2204.14198"},{"title":"Tackling multiple tasks with a single visual language model (Google DeepMind 博客)","url":"https://deepmind.google/discover/blog/tackling-multiple-tasks-with-a-single-visual-language-model/"}],"as_of":"2022-04","related_ids":["vision-language-model","perceiver-resampler","cross-attention","few-shot","in-context-learning","roboflamingo"],"name":"Flamingo","alt":"Flamingo: a Visual Language Model for Few-Shot Learning (DeepMind)","abbr":"","aliases":["DeepMind Flamingo"],"one_liner":"DeepMind 2022 年的视觉语言模型，给几个图文示例就能做新任务，是早期 VLM 代表。","explanation":"Flamingo 是 DeepMind 在 2022 年 4 月发布的视觉语言模型（VLM，能同时看图和读写文字的模型），论文发表于 NeurIPS 2022，最大版本 800 亿参数。它把已经训练好的视觉编码器和语言模型（DeepMind 的 700 亿参数 Chinchilla）冻结不动，中间加两类新模块：Perceiver 重采样器把任意数量的图像特征压成固定数量的视觉 token；门控交叉注意力层插在语言模型里，让它生成文字时能「看」图像。它用网页上图文交错的数据训练，因此能像大语言模型一样做少样本学习：在提示里放几个图文示例，不改参数就能完成新任务。在 16 个基准上，每个任务只给 4 个示例就超过了此前的少样本方法。社区的开源复现 OpenFlamingo 后来被 RoboFlamingo 用作机器人策略的底座。","example":"在提示里先放两张带说明文字的动物照片作示例，再放一张新照片，Flamingo 就会照同样格式写出这张照片的说明，全程不需要额外训练。","related":["视觉语言模型","Perceiver 重采样器","交叉注意力","少样本","上下文学习","RoboFlamingo"]},{"id":"llava","category":"named_model","sec":0,"tier":2,"sources":[{"title":"Visual Instruction Tuning (arXiv 2304.08485)","url":"https://arxiv.org/abs/2304.08485"},{"title":"Improved Baselines with Visual Instruction Tuning (LLaVA-1.5, arXiv 2310.03744)","url":"https://arxiv.org/abs/2310.03744"},{"title":"LLaVA 项目主页","url":"https://llava-vl.github.io/"}],"as_of":"2023-10","related_ids":["vision-language-model","multimodal-large-language-model","instruction-tuning","projector-connector","clip","prismatic-vlms"],"name":"LLaVA（视觉指令微调架构）","alt":"LLaVA (Large Language and Vision Assistant, Visual Instruction Tuning)","abbr":"LLaVA","aliases":["Large Language and Vision Assistant","视觉指令微调","LLaVA-1.5"],"one_liner":"2023 年的开源多模态模型：视觉编码器经投影层接入大语言模型，再用指令数据微调。","explanation":"LLaVA 由威斯康星大学麦迪逊分校、微软研究院和哥伦比亚大学的 Haotian Liu、Chunyuan Li 等人于 2023 年 4 月提出，论文《Visual Instruction Tuning》是 NeurIPS 2023 口头报告。结构很简单：CLIP ViT-L/14 视觉编码器提取图像特征，经一个投影层（把视觉特征变换到语言模型的词向量空间）送进 Vicuna 大语言模型。训练分两阶段：先冻结语言模型，只训投影层做特征对齐；再端到端微调。关键在数据：用纯文本 GPT-4 生成 15.8 万条图文指令数据，含对话、细节描述和复杂推理三类。2023 年 10 月的 LLaVA-1.5 把投影层换成两层 MLP，只用公开数据、单台 8 卡 A100 约一天训完，在 11 个基准上达到当时最佳。「视觉编码器 + 投影层 + 大语言模型 + 指令微调」成为之后多数开源 VLM 的通用做法，很多 VLA 也是在这类 VLM 上加动作输出。","example":"生成训练数据时 GPT-4 看不到图，只拿到图片的文字描述和物体框坐标，据此写出关于这张图的多轮问答和推理题；再把这些问答配上原图，用来训练 LLaVA。","related":["视觉语言模型","多模态大语言模型","指令微调","投影层","CLIP","Prismatic VLM"]},{"id":"pali-x","category":"named_model","sec":0,"tier":3,"sources":[{"title":"arXiv 2305.18565: PaLI-X","url":"https://arxiv.org/abs/2305.18565"},{"title":"RT-2 项目主页","url":"https://robotics-transformer2.github.io/"}],"as_of":"2023-07","related_ids":["rt-2","vision-language-model","palm-e","vision-transformer","vision-language-action-model","encoder-decoder"],"name":"PaLI-X","alt":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","abbr":"","aliases":[],"one_liner":"谷歌 2023 年约 550 亿参数的多语言视觉语言模型，RT-2 的骨干之一","explanation":"Google Research 2023 年 5 月发布的多语言视觉语言模型（VLM），是 PaLI 的放大版：视觉编码器用 220 亿参数的 ViT-22B，语言部分是 320 亿参数的 UL2 编码器-解码器，合计约 550 亿参数。论文的主要结论是视觉、语言两侧一起扩大都有收益，训练时混合了前缀补全和掩码补全两种目标；微调后在 15 个以上基准上刷新当时最好成绩，还出现了复杂计数、用非英语类别名做目标检测等没专门训练过的能力。对具身领域来说，它最出名的身份是 RT-2 的骨干之一：RT-2 分别在 PaLI-X（55B）和 PaLM-E（12B）上，把机器人动作当成文字 token 一起训练，得到最早的一批视觉-语言-动作模型。","example":"RT-2-PaLI-X-55B：把 PaLI-X 放在网页图文数据和机器人轨迹上协同微调，让它看图读指令后直接输出离散化的动作 token。","related":["RT-2","视觉语言模型","PaLM-E","视觉 Transformer","视觉-语言-动作模型","编码器-解码器"]},{"id":"google-gemini","category":"named_model","sec":0,"tier":2,"sources":[{"title":"Gemini: A Family of Highly Capable Multimodal Models (arXiv 2312.11805)","url":"https://arxiv.org/abs/2312.11805"},{"title":"Gemini (language model) - Wikipedia","url":"https://en.wikipedia.org/wiki/Gemini_(language_model)"},{"title":"Gemini Robotics brings AI into the physical world (Google DeepMind blog)","url":"https://deepmind.google/discover/blog/gemini-robotics-brings-ai-into-the-physical-world/"}],"as_of":"2026-09","related_ids":["multimodal-large-language-model","native-multimodal","gemini-robotics","gemini-robotics-er","google-deepmind","vision-language-model"],"name":"Gemini 系列（谷歌多模态大模型）","alt":"Google Gemini (multimodal LLM family)","abbr":"","aliases":["Gemini","谷歌 Gemini"],"one_liner":"谷歌 DeepMind 的原生多模态大模型系列，也是 Gemini Robotics 等机器人模型的底座。","explanation":"Gemini 是谷歌 DeepMind 开发的多模态大模型系列，接替 LaMDA 和 PaLM 2。首版 Gemini 1.0 于 2023 年 12 月发布，分 Ultra、Pro、Nano 三档。它从训练开始就同时处理文字、图像、音频、视频和代码，而不是先训好语言模型再外接视觉模块，这种做法常被称为「原生多模态」。之后迭代很快：2024 年的 1.5（超长上下文），2024 年底到 2025 年的 2.0、2.5，2025 年 11 月的 Gemini 3，截至 2026 年 9 月已更新到 3.x 系列的多个版本。在具身智能里它有两种用法：一是直接调用它看图理解场景、拆解任务、做高层规划；二是当底座训练机器人模型，谷歌 2025 年 3 月发布的 Gemini Robotics（VLA）和 Gemini Robotics-ER（具身推理）都建立在 Gemini 2.0 之上。","example":"Gemini Robotics 在 Gemini 2.0 的基础上把「物理动作」加为新的输出模态：模型看到相机画面、听到指令后，直接输出控制机器人的动作。","related":["多模态大语言模型","原生多模态","Gemini Robotics","Gemini Robotics-ER","谷歌 DeepMind","视觉语言模型"]},{"id":"internvl","category":"named_model","sec":0,"tier":3,"sources":[{"title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks (arXiv 2312.14238)","url":"https://arxiv.org/abs/2312.14238"},{"title":"OpenGVLab/InternVL (GitHub)","url":"https://github.com/OpenGVLab/InternVL"}],"as_of":"2026-09","related_ids":["vision-language-model","multimodal-large-language-model","shanghai-artificial-intelligence-laboratory","internvl","internvla","agibot-go-1"],"name":"书生 InternVL","alt":"InternVL (Shanghai AI Laboratory open VLM series)","abbr":"InternVL","aliases":["书生·万象","InternVL-Chat","OpenGVLab InternVL"],"one_liner":"上海 AI 实验室开源的视觉语言模型系列，起点是一个 60 亿参数的视觉编码器。","explanation":"InternVL 是上海人工智能实验室 OpenGVLab 团队开源的视觉语言模型系列，中文名「书生·万象」。初代论文 2023 年 12 月发布，入选 CVPR 2024 口头报告，思路是把视觉编码器 InternViT 放大到 60 亿参数，再逐步与大语言模型对齐，在 32 个视觉-语言基准上评测。此后的 1.5、2、2.5、3、3.5 版沿用「视觉编码器 + MLP 投影层 + 大语言模型」结构，尺寸从 10 亿到 2410 亿总参数不等，代码以 MIT 协议开源，截至 2026 年 9 月最新是 3.5 系列。具身领域常把它当作 VLA（视觉-语言-动作模型）的视觉语言骨干。","example":"智元 GO-1 的潜在规划器以 InternVL2.5-2B 为骨干：它读入多路相机画面和指令，先预测潜在动作 token，再交给动作专家生成连续动作。","related":["视觉语言模型","多模态大语言模型","上海人工智能实验室","InternVL（书生·万象）","上海AI实验室 InternVLA 系列","智元 GO-1（启元大模型）"]},{"id":"molmo","category":"named_model","sec":0,"tier":3,"sources":[{"title":"Molmo (Ai2 blog)","url":"https://allenai.org/blog/molmo"},{"title":"Molmo and PixMo (arXiv 2409.17146)","url":"https://arxiv.org/abs/2409.17146"},{"title":"Molmo 2 (Ai2 blog)","url":"https://allenai.org/blog/molmo2"}],"as_of":"2025-12","related_ids":["vision-language-model","pointing","molmoact","open-weight-model","allen-institute-for-ai","clip"],"name":"Molmo","alt":"Molmo (Ai2 open VLM with pointing)","abbr":"","aliases":["Molmo and PixMo","Molmo 2"],"one_liner":"Ai2 连权重带训练数据一起开源的视觉语言模型，能在图上用「指点」回答问题","explanation":"艾伦人工智能研究所（Ai2）2024 年 9 月发布的开放视觉语言模型家族，有 MolmoE-1B、Molmo-7B-O、Molmo-7B-D 和 Molmo-72B 几档，视觉编码器用 CLIP，语言部分分别基于 OLMo、Qwen2 等。它有两个特点。一是连同训练数据集 PixMo 一起开放，且不靠蒸馏闭源模型得到数据，PixMo 的详细图像描述是让标注员口述后整理的。二是会「指点」：能直接输出图中物体的 2D 坐标点，用来计数、定位。指点对机器人很实用，可以告诉机器人抓哪里、放哪里，Ai2 后来的 MolmoAct 就是在 Molmo 上做出来的。2025 年 12 月发布的 Molmo 2 把能力扩展到视频理解、时空定位和目标跟踪。","example":"问 Molmo「图里有几个杯子」，它会先在每个杯子上各打一个点，再给出总数。","related":["视觉语言模型","指向（点预测）","MolmoAct","开放权重","艾伦人工智能研究所","CLIP"]},{"id":"mvp","category":"named_model","sec":0,"tier":3,"sources":[{"title":"arXiv 2203.06173: Masked Visual Pre-training for Motor Control","url":"https://arxiv.org/abs/2203.06173"},{"title":"arXiv 2210.03109: Real-World Robot Learning with Masked Visual Pre-training","url":"https://arxiv.org/abs/2210.03109"}],"as_of":"2022-10","related_ids":["pre-trained-visual-representation","masked-autoencoder","self-supervised-learning","r3m","vc-1","vision-transformer"],"name":"MVP（掩码视觉预训练）","alt":"MVP: Masked Visual Pre-training for Motor Control / Real-World Robot Learning with Masked Visual Pre-training","abbr":"MVP","aliases":["掩码视觉预训练","Masked Visual Pre-training"],"one_liner":"用掩码自编码器在海量自然图像上预训练视觉编码器，再冻结给机器人用。","explanation":"MVP（Masked Visual Pre-training）指 UC 伯克利 Jitendra Malik、Trevor Darrell 团队的两篇工作：2022 年 3 月的 Masked Visual Pre-training for Motor Control（Tete Xiao 等）在仿真中验证，2022 年 10 月的 Real-World Robot Learning with Masked Visual Pre-training（Ilija Radosavovic 等，CoRL 2022）扩展到真机。做法是先用掩码自编码器（MAE，遮住图像大部分小块让网络补全）在网络图片和第一人称视频上自监督预训练 ViT 视觉编码器，然后冻结编码器，只在上面训练小的控制模块。结果显示这种表征优于 CLIP、ImageNet 监督预训练和从零训练；用 450 万张图训练的 3.07 亿参数 ViT 还能继续提升。它和 R3M、VC-1 一起推动了预训练视觉表征这一方向。","example":"把 MVP 预训练好的 ViT 冻结当作机器人的眼睛，只用少量演示训练上面的控制头，就能在新任务上学会抓取。","related":["预训练视觉表征","掩码自编码器","自监督学习","R3M","VC-1","视觉 Transformer"]},{"id":"r3m","category":"named_model","sec":0,"tier":3,"sources":[{"title":"R3M (arXiv 2203.12601)","url":"https://arxiv.org/abs/2203.12601"}],"as_of":"2022-03","related_ids":["pre-trained-visual-representation","vc-1","mvp","vip","ego4d","time-contrastive-networks"],"name":"R3M","alt":"R3M: A Universal Visual Representation for Robot Manipulation","abbr":"R3M","aliases":[],"one_liner":"用人类第一人称视频预训练、专供机器人操作使用的通用视觉表征","explanation":"斯坦福与 Meta AI 的 Suraj Nair、Chelsea Finn、Abhinav Gupta 等人 2022 年 3 月发布，发表于 CoRL 2022。机器人演示少，从零训练视觉编码器难学好；R3M 先在 Ego4D 人类第一人称视频上预训练图像编码器，目标组合了时间对比学习（时间上接近的帧表征更接近）、视频与语言描述对齐，以及让表征稀疏紧凑的 L1 惩罚。之后把它冻结当感知模块，下游只训练策略。在 12 个仿真操作任务上，成功率比从零训练高 20% 以上，比 CLIP、MoCo 表征高 10% 以上。它是「预训练视觉表征」路线的代表，常与 VC-1、MVP、VIP 对比。","example":"在杂乱的真实公寓里，Franka 机械臂以冻结的 R3M 编码器作视觉模块，每个任务只用 20 条演示就学会了操作。","related":["预训练视觉表征","VC-1","MVP（掩码视觉预训练）","VIP（价值隐式预训练）","Ego4D 数据集","时间对比学习"]},{"id":"vip","category":"named_model","sec":0,"tier":3,"sources":[{"title":"VIP (arXiv 2210.00030)","url":"https://arxiv.org/abs/2210.00030"},{"title":"VIP project page","url":"https://sites.google.com/view/vip-rl"}],"as_of":"2023-03","related_ids":["r3m","vc-1","pre-trained-visual-representation","time-contrastive-networks","goal-conditioned-reinforcement-learning","ego4d"],"name":"VIP（价值隐式预训练）","alt":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","abbr":"VIP","aliases":["Value-Implicit Pre-Training"],"one_liner":"在人类视频上自监督预训练，同时给出视觉表征和稠密奖励的方法","explanation":"Meta AI（FAIR）与宾夕法尼亚大学的 Jason Ma、Amy Zhang 等人 2022 年 9 月发布，发表于 ICLR 2023（Spotlight）。机器人强化学习常卡在两件事：没有好用的视觉特征，也没有好写的奖励函数。VIP 把「看人类视频学表征」当成一个离线的目标条件强化学习问题，推出一个不需要动作标签的价值函数目标，本质上是一种隐式的时间对比学习，使得时间上越接近完成的画面在特征空间里离目标越近。在 Ego4D 第一人称视频上预训练后冻结使用，奖励直接取当前画面与目标图在特征空间的距离变化，就能为多种仿真和真机任务提供稠密奖励；在真机上只用约 20 条轨迹即可做少样本离线强化学习。","example":"给机器人一张「抽屉已关上」的目标照片，VIP 把每一帧相机画面和目标图都编码成特征，距离缩小就给正奖励，机器人据此学会把抽屉推上，而无需人工写奖励函数。","related":["R3M","VC-1","预训练视觉表征","时间对比学习","目标条件强化学习","Ego4D 数据集"]},{"id":"vc-1","category":"named_model","sec":0,"tier":3,"sources":[{"title":"Where are we in the search for an Artificial Visual Cortex (arXiv 2303.18240)","url":"https://arxiv.org/abs/2303.18240"},{"title":"VC-1 project page","url":"https://eai-vc.github.io/"}],"as_of":"2023-03","related_ids":["pre-trained-visual-representation","masked-autoencoder","r3m","vip","ego4d","vision-transformer"],"name":"VC-1","alt":"VC-1 (Visual Cortex; Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?)","abbr":"VC-1","aliases":["Visual Cortex 1","人工视觉皮层"],"one_liner":"Meta 用 4000 多小时第一人称视频 MAE 预训练、给具身任务用的视觉编码器","explanation":"Meta AI（FAIR）2023 年 3 月发布的研究，也是当时规模最大的一次预训练视觉表征（给机器人当「眼睛」的现成视觉编码器）系统评测。作者先搭了 CortexBench，含行走、导航、灵巧操作、移动操作等 17 个任务；再把 7 个来源、4000 多小时的第一人称视频加上 ImageNet 拼起来，用掩码自编码器（MAE，遮住图像块再还原）训练不同大小的 ViT，最大的 ViT-L 即 VC-1。结论是：没有哪个视觉表征在所有任务上都最好，扩大数据规模和多样性只在平均意义上有用；针对任务再做适配后的 VC-1 在各项上达到或超过已知最好结果。模型和代码已开源。","example":"做一个机械臂模仿学习项目时，可以直接把 VC-1 当冻结的图像编码器，把相机画面变成特征向量，再在上面训练一个小的策略网络。","related":["预训练视觉表征","掩码自编码器","R3M","VIP（价值隐式预训练）","Ego4D 数据集","视觉 Transformer"]},{"id":"saycan","category":"named_model","sec":1,"tier":2,"sources":[{"title":"SayCan 项目主页","url":"https://say-can.github.io/"}],"as_of":"2022-08","related_ids":["affordance","language-grounding","llm-based-task-planning","inner-monologue","palm-e","value-function"],"name":"SayCan","alt":"SayCan (Do As I Can, Not As I Say: Grounding Language in Robotic Affordances)","abbr":"","aliases":["PaLM-SayCan","Do As I Can, Not As I Say"],"one_liner":"语言模型判断哪步「有用」、价值函数判断哪步「做得到」，两者相乘选动作。","explanation":"SayCan 是谷歌机器人团队与 Everyday Robots 在 2022 年 4 月发布的工作。大语言模型懂常识，却不知道眼前这台机器人在当前场景能做什么，直接让它写计划容易出现做不到的步骤。SayCan 给机器人准备一组训练好的技能（如「拿起海绵」「去桌子旁」），每一步让语言模型评估各技能对完成指令有多大帮助，再用强化学习得到的价值函数评估当前状态下各技能能否成功（即可供性），两个分数相乘，选最高的执行，循环到任务结束。换用 PaLM 的 PaLM-SayCan 在真实厨房 101 条指令上规划成功率 84%、执行成功率 74%。它是大模型做机器人高层规划的开山工作之一。","example":"用户说「我把可乐洒了，能拿点东西帮我擦一下吗」，SayCan 依次选出「找到海绵」「拿起海绵」「拿给你」「完成」。","related":["可供性","语言接地","大模型任务规划","Inner Monologue","PaLM-E","价值函数"]},{"id":"socratic-models","category":"named_model","sec":1,"tier":3,"sources":[{"title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language (arXiv 2204.00598)","url":"https://arxiv.org/abs/2204.00598"},{"title":"Socratic Models project page","url":"https://socraticmodels.github.io/"}],"as_of":"2022-05","related_ids":["large-language-model","vision-language-model","zero-shot","saycan","code-as-policies","inner-monologue"],"name":"Socratic Models（苏格拉底模型）","alt":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","abbr":"SMs","aliases":["Socratic Models","苏格拉底模型"],"one_liner":"用自然语言当接口，把多个现成大模型零样本串起来完成多模态任务的框架","explanation":"谷歌 Andy Zeng、Pete Florence 等人 2022 年 4 月发布。不同基础模型各有所长：视觉语言模型（VLM，能看图说话）懂图像，大语言模型（LLM）懂常识和推理，音频模型懂声音。Socratic Models 不做任何微调，而是用自然语言当公共接口，把一个模型的输出写进另一个模型的提示词里，让它们像对话一样交换信息，零样本组合出新能力。论文展示了第一人称视频问答、多模态助手对话，以及机器人感知与规划：先由视觉模型把桌面物体转成文字描述，再由 LLM 把指令拆成一步步抓取放置动作，交给预训练的语言条件策略执行。它和同期的 SayCan、代码即策略一起，代表了「用大语言模型当机器人规划器」的早期路线。","example":"用户说「把水果都放进碗里」，视觉模型先列出桌上有苹果、香蕉和碗，语言模型据此写出「拿起苹果放进碗里；拿起香蕉放进碗里」，再由底层抓放策略逐步执行。","related":["大语言模型","视觉语言模型","零样本","SayCan","代码即策略","Inner Monologue"]},{"id":"inner-monologue","category":"named_model","sec":1,"tier":3,"sources":[{"title":"Inner Monologue (arXiv 2207.05608)","url":"https://arxiv.org/abs/2207.05608"},{"title":"Inner Monologue project page","url":"https://innermonologue.github.io/"},{"title":"Inner Monologue (PMLR v205, CoRL 2022)","url":"https://proceedings.mlr.press/v205/huang23c.html"}],"as_of":"2022-12","related_ids":["saycan","llm-based-task-planning","success-detector","closed-loop-control","long-horizon-task","code-as-policies"],"name":"Inner Monologue","alt":"Inner Monologue: Embodied Reasoning through Planning with Language Models","abbr":"","aliases":["内心独白"],"one_liner":"把环境反馈写成文字喂回大语言模型，让机器人边做边调整计划","explanation":"谷歌机器人团队（Robotics at Google）的 Wenlong Huang、Fei Xia、Brian Ichter 等 2022 年 7 月发布，发表于 CoRL 2022。当时 SayCan 等工作已用大语言模型把高层指令拆成技能序列，但计划一次定下，执行中出错模型并不知道。Inner Monologue 不做额外训练，把多种反馈用自然语言写回 LLM 的提示：技能是否成功（成功检测）、场景里有什么（被动或主动场景描述）、人的补充指令，形成一段「内心独白」，让 LLM 据此决定下一步、重试或改计划。在仿真和真实桌面物体重排、真实厨房长程移动操作三个场景中，闭环语言反馈都明显提高了指令完成率。它是用 LLM 做机器人闭环规划的早期代表。","example":"例如机器人抓取失败时，成功检测器写回「动作失败」，LLM 读到后安排重新抓取，而不是直接执行下一步。","related":["SayCan","大模型任务规划","成功检测器","闭环","长程任务","代码即策略"]},{"id":"code-as-policies","category":"named_model","sec":1,"tier":2,"sources":[{"title":"Code as Policies (arXiv 2209.07753)","url":"https://arxiv.org/abs/2209.07753"},{"title":"Code as Policies 项目主页","url":"https://code-as-policies.github.io/"}],"as_of":"2022-09","related_ids":["large-language-model","saycan","llm-based-task-planning","voxposer","eureka","skill-primitive"],"name":"代码即策略","alt":"Code as Policies: Language Model Programs for Embodied Control","abbr":"CaP","aliases":["Code as Policies"],"one_liner":"让大语言模型直接写 Python 程序，调用感知和控制接口来指挥机器人","explanation":"谷歌机器人团队（Robotics at Google）2022 年 9 月发布。此前用大语言模型控制机器人，多是让模型从固定技能列表里挑下一步，如 SayCan。代码即策略让擅长写代码的大模型根据自然语言指令直接生成 Python 程序：调用物体检测等感知接口拿到位置，用 NumPy 算坐标，再调用抓取、移动等控制原语，还能写循环和条件判断；遇到未定义的函数就递归地再生成，即分层代码生成。这样能处理需要空间推理、要给出具体数值的模糊指令。论文在桌面操作、白板绘画和移动机器人上做了演示，大模型写代码驱动机器人的思路在后来的 VoxPoser、Eureka 中也能看到。","example":"指令「把积木在靠近顶部的位置排成一条横线」，模型生成的代码先检测所有积木位置，算出桌面上方一排等间距目标点，再逐个调用抓取放置函数。","related":["大语言模型","SayCan","大模型任务规划","VoxPoser","Eureka","原子技能"]},{"id":"progprompt","category":"named_model","sec":1,"tier":3,"sources":[{"title":"arXiv 2209.11302: ProgPrompt","url":"https://arxiv.org/abs/2209.11302"},{"title":"ProgPrompt 项目主页","url":"https://progprompt.github.io/"}],"as_of":"2023-05","related_ids":["llm-based-task-planning","saycan","code-as-policies","inner-monologue","virtualhome-simulating-household-activities-via-programs","prompt-prompt-engineering"],"name":"ProgPrompt","alt":"ProgPrompt: Generating Situated Robot Task Plans using Large Language Models","abbr":"","aliases":[],"one_liner":"用类 Python 程序格式提示大模型，生成机器人能执行的任务计划","explanation":"南加州大学与英伟达的 Ishika Singh、Animesh Garg 等人 2022 年 9 月发布，ICRA 2023 论文（扩展版刊于 Autonomous Robots）。直接让大语言模型用自然语言写计划，常会冒出机器人不会的动作或环境里没有的物体。ProgPrompt 把提示写成代码：开头用 import 语句列出可用动作，接着给出场景物体列表和几个写成 Python 函数的示例任务（函数名是任务，函数体是步骤），再让 LLM 续写新任务的函数。计划里用注释给步骤分组（类似思维链），用 assert 检查前置条件、不满足时触发补救动作。它在 VirtualHome 家庭仿真中取得当时最好结果，也在真实机械臂的桌面任务上做了验证，和 SayCan、代码即策略同属「LLM 做任务规划」的早期代表。","example":"提示里先写 from actions import walk, grab, putin, open, close，列出 objects = ['salmon', 'microwave', ...]，再给一个示例函数 def throw_away_lime():；LLM 就接着写出 def microwave_salmon(): 的逐步动作。","related":["大模型任务规划","SayCan","代码即策略","Inner Monologue","VirtualHome 家庭活动仿真","提示词 / 提示工程"]},{"id":"palm-e","category":"named_model","sec":1,"tier":2,"sources":[{"title":"PaLM-E 项目主页","url":"https://palm-e.github.io/"},{"title":"PaLM-E: An Embodied Multimodal Language Model (arXiv:2303.03378)","url":"https://arxiv.org/abs/2303.03378"}],"as_of":"2023-03","related_ids":["saycan","rt-2","multimodal-large-language-model","llm-based-task-planning","vision-transformer","language-grounding"],"name":"PaLM-E","alt":"PaLM-E: An Embodied Multimodal Language Model","abbr":"PaLM-E","aliases":["PaLM-E-562B","具身多模态语言模型"],"one_liner":"谷歌 2023 年把图像和机器人状态接进 PaLM 的具身多模态大模型。","explanation":"PaLM-E 是谷歌与柏林工业大学在 2023 年 3 月发布的具身多模态语言模型，最大版本 PaLM-E-562B 有 5620 亿参数，由 PaLM 语言模型加 ViT 视觉编码器组成。它把图像、机器人状态估计等连续输入编码成向量，和文字 token 交错拼成「多模态句子」送进语言模型。它输出的是文字形式的中层计划，再交给底层技能策略执行，本身不直接输出电机指令。论文发现把网络图文数据和机器人数据一起训练有正迁移，562B 版本还在 OK-VQA 视觉问答上达到当时最好水平。它是大模型做机器人任务规划的代表工作，也是 RT-2 等 VLA 的前序。","example":"给 PaLM-E 一张厨房照片和指令「把抽屉里的薯片拿给我」，它逐步生成「去抽屉旁」「打开抽屉」「拿出薯片」等子步骤，由底层策略依次执行。","related":["SayCan","RT-2","多模态大语言模型","大模型任务规划","视觉 Transformer","语言接地"]},{"id":"embodiedgpt","category":"named_model","sec":1,"tier":3,"sources":[{"title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought (arXiv 2305.15021)","url":"https://arxiv.org/abs/2305.15021"},{"title":"NeurIPS 2023 论文页","url":"https://papers.nips.cc/paper_files/paper/2023/hash/4ec43957eda1126ad4887995d05fae3b-Abstract-Conference.html"}],"as_of":"2023-12","related_ids":["embodied-chain-of-thought","chain-of-thought","egocentric-video","ego4d","llm-based-task-planning","franka-kitchen"],"name":"EmbodiedGPT","alt":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","abbr":"EmbodiedGPT","aliases":[],"one_liner":"2023 年港大与上海 AI Lab 的具身多模态模型，用思维链生成分步计划。","explanation":"EmbodiedGPT 由香港大学、上海人工智能实验室等于 2023 年 5 月发布，发表于 NeurIPS 2023，是大模型用于具身规划的早期代表作之一。作者从 Ego4D 第一人称视频里挑选片段，用思维链的形式标注成一步步的子目标，构建了规划数据集 EgoCOT；再用前缀微调把一个 7B 语言模型适配到这类数据上，让它看图后输出分步计划。关键设计是把语言模型生成的规划当作查询，从图像中提取与任务相关的特征交给底层策略网络，把高层规划和低层控制连成闭环。","example":"在 Franka Kitchen 和 Meta-World 仿真控制任务上，EmbodiedGPT 的成功率分别是用 Ego4D 微调的 BLIP-2 基线的 1.6 倍和 1.3 倍。","related":["具身思维链","思维链","第一人称视频","Ego4D 数据集","大模型任务规划","Franka Kitchen"]},{"id":"voyager","category":"named_model","sec":1,"tier":3,"sources":[{"title":"Voyager (arXiv 2305.16291)","url":"https://arxiv.org/abs/2305.16291"},{"title":"Voyager 项目主页","url":"https://voyager.minedojo.org/"},{"title":"Voyager (OpenReview, TMLR)","url":"https://openreview.net/forum?id=ehfRiF0R3a"}],"as_of":"2024-03","related_ids":["embodied-agent","large-language-model","minecraft-environments","code-as-policies","curriculum-learning","continual-learning"],"name":"Voyager","alt":"Voyager: An Open-Ended Embodied Agent with Large Language Models","abbr":"","aliases":["MineDojo Voyager"],"one_liner":"由 GPT-4 驱动、在 Minecraft 里自己定目标、写代码攒技能的终身学习智能体。","explanation":"Voyager 由英伟达、加州理工、UT Austin、斯坦福、亚利桑那州立大学的 Guanzhi Wang、Linxi Fan、Yuke Zhu、Anima Anandkumar 等人 2023 年 5 月发布，后被 TMLR 接收，代码开源。它是在 Minecraft 里运行的大模型智能体，不微调模型参数，只通过调用 GPT-4 工作。三个核心部件：自动课程，根据当前状态提出下一个探索目标；技能库，把验证成功的行为存成可执行代码并按描述检索、组合；迭代提示，把环境反馈、执行报错和自我检查结果喂回 GPT-4 修改代码。技能以代码形式积累，便于复用，也缓解了灾难性遗忘。它比此前方法多获得 3.3 倍不同物品、行进距离长 2.3 倍，解锁关键科技树节点最快快 15.3 倍，是「大模型 + 代码技能库」式具身智能体的代表。","example":"Voyager 学会「合成工作台」「制作木镐」后把代码存进技能库；换到一个新的 Minecraft 世界，它直接检索并组合这些技能去完成新任务。","related":["具身智能体","大语言模型","Minecraft 环境（MineDojo / MineRL）","代码即策略","课程学习","持续学习"]},{"id":"knowno","category":"named_model","sec":1,"tier":3,"sources":[{"title":"Robots That Ask For Help: Uncertainty Alignment for Large Language Model Planners (arXiv 2307.01928)","url":"https://arxiv.org/abs/2307.01928"},{"title":"KnowNo 项目页","url":"https://robot-help.github.io/"}],"as_of":"2023-11","related_ids":["large-language-model","llm-based-task-planning","uncertainty-estimation","hallucination","human-in-the-loop","saycan"],"name":"KnowNo（会求助的机器人）","alt":"KnowNo: Robots That Ask For Help (Uncertainty Alignment for LLM Planners)","abbr":"","aliases":["KnowNo","Robots That Ask For Help","会求助的机器人"],"one_liner":"让大模型规划器在拿不准时主动问人，并用共形预测给成功率打统计保证。","explanation":"KnowNo 是普林斯顿大学与 Google DeepMind 2023 年 7 月发布的工作，获 CoRL 2023 最佳学生论文。大语言模型做机器人任务规划时，遇到含糊指令常会自信地给出错误计划。KnowNo 把每一步规划变成选择题：先让模型列出几个候选动作，再用共形预测（一种只需少量标定数据、能给统计覆盖保证的方法）筛出候选集合，保证正确选项以用户设定的概率（如 80%）落在集合里。集合里只剩一个选项就直接执行，有多个就停下来问人。它无需微调模型，在移动操作、桌面重排、双臂操作上做了验证，能在保证成功率的同时尽量少求助。","example":"移动操作场景里用户说「把薯片放进抽屉」，但现场不止一种薯片、也不止一个抽屉，候选集合里剩多个选项，机器人就先问清楚再动手。","related":["大语言模型","大模型任务规划","不确定性估计","幻觉","人在回路","SayCan"]},{"id":"sayplan","category":"named_model","sec":1,"tier":3,"sources":[{"title":"SayPlan (arXiv 2307.06135)","url":"https://arxiv.org/abs/2307.06135"},{"title":"SayPlan project page","url":"https://sayplan.github.io/"}],"as_of":"2023-09","related_ids":["3d-scene-graph","llm-based-task-planning","saycan","long-horizon-task","replanning","mobile-manipulation"],"name":"SayPlan","alt":"SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning","abbr":"","aliases":[],"one_liner":"借助 3D 场景图，让大语言模型在多楼层大空间里做长程任务规划的方法","explanation":"澳大利亚昆士兰科技大学机器人中心、阿德莱德大学和 CSIRO Data61 的研究者 2023 年 7 月发布，是 CoRL 2023 口头报告论文。用大语言模型做机器人任务规划时，如果把整栋楼的房间和物体全写进提示词，很快会超出上下文长度。SayPlan 把环境表示成分层的 3D 场景图（楼层、房间、物体及其状态），先只给模型看折叠后的高层结构，让它通过「展开」「收起」节点做语义搜索，只保留和任务相关的子图；具体怎么走交给 Dijkstra 这类经典路径规划算法，模型只管高层步骤；生成的计划先在场景图模拟器里检查，发现「往没打开的柜子里放东西」这类执行不了的步骤就反馈给模型重新修改。实验环境最大有 3 层楼、36 个房间、140 个物体，计划最后在真实移动操作机器人上执行。","example":"对「我饿了，拿点吃的到我桌上」这样的指令，SayPlan 先在场景图里展开厨房找到冰箱和食物，生成「走到冰箱、打开冰箱、取出苹果、走到办公桌、放下」的计划，并在模拟器里确认每一步都能执行。","related":["3D场景图","大模型任务规划","SayCan","长程任务","重规划","移动操作"]},{"id":"3d-llm","category":"named_model","sec":1,"tier":3,"sources":[{"title":"3D-LLM: Injecting the 3D World into Large Language Models (arXiv 2307.12981)","url":"https://arxiv.org/abs/2307.12981"},{"title":"3D-LLM 代码仓库 (GitHub)","url":"https://github.com/UMass-Foundation-Model/3D-LLM"}],"as_of":"2023-12","related_ids":["3d-vla","multimodal-large-language-model","spatial-reasoning","3d-visual-grounding","leo","scannet"],"name":"3D-LLM","alt":"3D-LLM: Injecting the 3D World into Large Language Models","abbr":"","aliases":["3D 大语言模型"],"one_liner":"能直接输入 3D 场景特征、回答空间问题和做任务分解的大语言模型。","explanation":"3D-LLM 由洪一宁、淦创（Chuang Gan）等来自 UCLA、UMass Amherst、MIT 等机构的研究者在 2023 年 7 月提出，NeurIPS 2023 spotlight。大语言模型和视觉语言模型只处理文字或 2D 图片，对空间关系、布局这类三维概念把握不好。3D-LLM 把 3D 场景从多个视角渲染成图片，用 2D 特征提取器取特征再映射回 3D 点，得到带语义的 3D 特征，然后接到 BLIP-2 等现成视觉语言模型上训练；另加 3D 定位机制帮模型理解位置。作者设计三类提示方法，收集了 30 多万条 3D-语言数据，覆盖场景描述、3D 问答、任务分解、定位和导航。在 ScanQA 上 BLEU-1 比当时最好方法高 9%。它是较早把 3D 场景接入大模型的工作，后来的 3D VLA、LEO 等延续了这一方向。","example":"给 3D-LLM 一个房间的 3D 扫描，问「冰箱在沙发的哪一侧」，或让它把「做早餐」分解成走到厨房、打开冰箱、拿出鸡蛋等步骤。","related":["3D VLA","多模态大语言模型","空间推理","3D视觉定位","LEO（3D 具身通才智能体）","ScanNet 数据集"]},{"id":"leo","category":"named_model","sec":1,"tier":3,"sources":[{"title":"An Embodied Generalist Agent in 3D World (arXiv 2311.12871)","url":"https://arxiv.org/abs/2311.12871"},{"title":"LEO 项目页","url":"https://embodied-generalist.github.io/"}],"as_of":"2024-07","related_ids":["3d-vla","3d-llm","beijing-institute-for-general-artificial-intelligence","embodied-agent","object-centric-representation","lora"],"name":"LEO（3D 具身通才智能体）","alt":"LEO: An Embodied Generalist Agent in 3D World (BIGAI)","abbr":"LEO","aliases":["An Embodied Generalist Agent in 3D World","LEO 智能体"],"one_liner":"北京通研院提出的 3D 具身通才模型，能看懂三维场景、回答问题、导航和操作。","explanation":"LEO 由北京通用人工智能研究院（BIGAI）联合北大、卡内基梅隆大学和清华提出，2023 年 11 月发布，发表于 ICML 2024。当时的多模态大模型多只处理 2D 图片，难以完成定义在三维场景里的任务。LEO 把第一人称图像、以物体为中心的 3D token（每个物体的点云经 PointNet++ 编码，再用空间 Transformer 建模物体间关系）和文字指令拼成一个序列，交给用 LoRA 微调的 Vicuna-7B，动作也离散成 token 输出。训练分两阶段：先做 3D 视觉-语言对齐，再做 3D 视觉-语言-动作指令微调，数据靠大模型辅助生成。它能做 3D 描述、问答、具身推理、导航和操作，是 3D VLA 的早期代表。","example":"给 LEO 一个房间的 3D 扫描，问「沙发旁边的桌子上有什么」，它用文字回答；做物体导航时，它看第一人称画面逐步输出前进、左转等动作去找目标。","related":["3D VLA","3D-LLM","北京通用人工智能研究院","具身智能体","以物体为中心的表示","低秩适配"]},{"id":"language-to-rewards","category":"named_model","sec":1,"tier":3,"sources":[{"title":"Language to Rewards for Robotic Skill Synthesis (arXiv 2306.08647)","url":"https://arxiv.org/abs/2306.08647"},{"title":"Language to Rewards 项目页","url":"https://language-to-reward.github.io/"}],"as_of":"2023-11","related_ids":["reward-function","model-predictive-control","large-language-model","code-as-policies","eureka","mujoco"],"name":"Language to Rewards（L2R）","alt":"Language to Rewards for Robotic Skill Synthesis","abbr":"L2R","aliases":["Language to Rewards","语言到奖励"],"one_liner":"让大语言模型把人话翻译成奖励函数，再交给实时优化器生成机器人动作。","explanation":"Language to Rewards 是 Google DeepMind 2023 年 6 月发布的工作，CoRL 2023 口头报告。让大模型直接出动作或调用预设技能，很难做出「站起来」「太空步」这类底层动作。L2R 改让大模型写奖励函数：奖励翻译器先把指令展开成动作描述，再写成奖励代码（各项目标及权重）；运动控制器用 MuJoCo MPC（基于模型预测控制的实时优化器）按奖励求解动作，并随用户追加的纠正实时重规划。在模拟四足机器人和灵巧机械手的 17 个任务上它完成了 90%，基于预设技能原语的基线为 50%；在真实机械臂上也演示了推动物体。它和 Eureka 同属「让大模型写奖励」的路线。","example":"用户让模拟四足机器人「像跳太空步一样后退」，看效果后再补几句纠正，几轮对话后机器人学会了太空步。","related":["奖励函数","模型预测控制","大语言模型","代码即策略","Eureka","MuJoCo"]},{"id":"eureka","category":"named_model","sec":1,"tier":2,"sources":[{"title":"Eureka (arXiv 2310.12931)","url":"https://arxiv.org/abs/2310.12931"}],"as_of":"2024-04","related_ids":["reward-function","reward-engineering","large-language-model","dreureka","code-as-policies","isaac-gym"],"name":"Eureka","alt":"Eureka: Human-Level Reward Design via Coding Large Language Models","abbr":"","aliases":[],"one_liner":"让 GPT-4 写奖励函数代码并反复改进，自动为强化学习设计奖励","explanation":"英伟达与宾夕法尼亚大学、加州理工、得克萨斯大学奥斯汀分校 2023 年 10 月发布，发表于 ICLR 2024。强化学习的效果高度依赖奖励函数，而手写奖励费时又靠经验。Eureka 把环境源代码和任务描述交给 GPT-4，让它一次写出多份奖励函数代码，分别在 GPU 并行仿真里训练策略，再把训练中各奖励项的统计反馈给模型（奖励反思），让它改写出下一轮更好的版本，像进化搜索一样迭代。在 10 种机器人形态、29 个开源强化学习环境上，它设计的奖励在 83% 的任务上超过人类专家，平均归一化提升 52%。后续的 DrEureka 把这套思路用到仿真到现实迁移上。","example":"仿真中的 Shadow 灵巧手用 Eureka 设计的奖励，学会让笔在指间快速连续旋转。","related":["奖励函数","奖励工程","大语言模型","DrEureka","代码即策略","Isaac Gym"]},{"id":"dreureka","category":"named_model","sec":1,"tier":3,"sources":[{"title":"DrEureka: Language Model Guided Sim-To-Real Transfer (arXiv 2406.01967)","url":"https://arxiv.org/abs/2406.01967"},{"title":"DrEureka 项目主页","url":"https://eureka-research.github.io/dr-eureka/"},{"title":"DrEureka 代码仓库（GitHub）","url":"https://github.com/eureka-research/DrEureka"}],"as_of":"2024-06","related_ids":["eureka","sim-to-real-transfer","domain-randomization","reward-function","reward-engineering","large-language-model"],"name":"DrEureka","alt":"DrEureka: Language Model Guided Sim-To-Real Transfer","abbr":"","aliases":[],"one_liner":"让大语言模型自动写奖励函数和域随机化参数，把仿真策略迁移到真机。","explanation":"DrEureka 是宾夕法尼亚大学、英伟达和得克萨斯大学奥斯汀分校于 2024 年 6 月提出的方法，发表于 RSS 2024，是同团队 Eureka（用大语言模型写奖励函数）的延伸。把仿真里训好的策略搬到真机，通常要人手反复调奖励函数和域随机化范围（训练时随机改摩擦、质量等物理参数，让策略扛得住真实世界的偏差）。DrEureka 分三步自动化：先让大语言模型生成带安全约束的奖励函数并在仿真中训练策略；再在不同物理参数下测试该策略，得出它仍能正常工作的参数范围（奖励感知物理先验，RAPP）；最后让大语言模型在这个范围内写出域随机化配置，训练最终策略后直接部署。仿真器用 Isaac Gym，策略只用本体感知输入。","example":"在宇树 Go1 四足机器人上，DrEureka 训练出的策略能让机器狗站在瑜伽球上保持平衡并行走，训练过程无需人工反复调参；在四足前进行走和灵巧手转方块任务上，表现与人工设计的方案相当或更好。","related":["Eureka","仿真到现实迁移","域随机化","奖励函数","奖励工程","大语言模型"]},{"id":"voxposer","category":"named_model","sec":1,"tier":2,"sources":[{"title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models (arXiv 2307.05973)","url":"https://arxiv.org/abs/2307.05973"},{"title":"VoxPoser 项目页","url":"https://voxposer.github.io/"}],"as_of":"2023-11","related_ids":["llm-based-task-planning","code-as-policies","affordance","intermediate-representation","rekep","motion-planning"],"name":"VoxPoser","alt":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","abbr":"","aliases":[],"one_liner":"让大模型写代码生成 3D 价值地图，再交给规划器算出机械臂轨迹的零样本方法。","explanation":"VoxPoser 由斯坦福大学李飞飞、吴佳俊团队与 UIUC 李云竺合作，2023 年 7 月发布，获 CoRL 2023 口头报告，一作黄文龙。大语言模型懂常识，但不知道动作该落在三维空间的哪里。VoxPoser 让大语言模型根据指令写代码，代码调用视觉语言模型找到相关物体，在体素网格（把空间切成小立方体）上拼出「可供性地图」（该去哪里）和「约束地图」（该避开哪里），再把它们作为代价函数交给运动规划器，算出末端执行器轨迹。整个过程不需要为任务训练策略，属于零样本；执行时闭环重规划，物体被挪动也能应对。它是「大模型+中间表示+传统规划」路线的代表作，后续的 ReKep 等沿着这个方向继续做。","example":"指令「打开最上面的抽屉，小心旁边的花瓶」：大模型写的代码先定位顶层抽屉把手，在周围标高价值；再定位花瓶，把附近区域标成高代价；规划器据此算出一条绕开花瓶去拉把手的轨迹。","related":["大模型任务规划","代码即策略","可供性","中间表示","ReKep","运动规划"]},{"id":"f3rm","category":"named_model","sec":1,"tier":3,"sources":[{"title":"Distilled Feature Fields Enable Few-Shot Language-Guided Manipulation (arXiv 2308.07931)","url":"https://arxiv.org/abs/2308.07931"},{"title":"F3RM 项目主页","url":"https://f3rm.github.io/"}],"as_of":"2023-11","related_ids":["distilled-feature-fields","neural-radiance-fields","clip","lerf","open-vocabulary","few-shot"],"name":"F3RM","alt":"Distilled Feature Fields Enable Few-Shot Language-Guided Manipulation","abbr":"F3RM","aliases":["Feature Fields for Robotic Manipulation","蒸馏特征场操作"],"one_liner":"MIT 2023 年提出，把 CLIP 等 2D 特征蒸馏进 3D 场，少样本按语言指令抓放。","explanation":"F3RM（Feature Fields for Robotic Manipulation）是 MIT CSAIL 的 William Shen、Ge Yang、Phillip Isola 等人提出的方法，发表于 CoRL 2023。CLIP、DINO 这类 2D 图像模型懂语义，却不知道物体在三维空间里的精确位置和形状，而机器人抓取离不开几何。F3RM 先对场景多角度拍照，训练神经辐射场（NeRF，从多视角照片重建三维场景的方法），同时把 CLIP 等模型的特征「蒸馏」进这个三维场，得到每个空间点都带语义特征的蒸馏特征场。机器人在这个场里优化夹爪位姿，只需少量示范就能学会 6 自由度抓取和放置，可用自由文本指定操作对象，也能迁移到没见过的物体。它和 LERF（把语言特征嵌入辐射场）属于同一思路，是「把 2D 基础模型知识搬到 3D 做操作」的代表作。","example":"每个抓取任务只给两次示范（例如抓杯柄或抓杯口），机器人就能抓起颜色、大小不同的杯子；输入一句文字描述，就能在场景里挑出对应物体去抓。","related":["蒸馏特征场","神经辐射场","CLIP","LERF","开放词汇","少样本"]},{"id":"ok-robot","category":"named_model","sec":1,"tier":3,"sources":[{"title":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics (arXiv 2401.12202)","url":"https://arxiv.org/abs/2401.12202"},{"title":"OK-Robot 项目页","url":"https://ok-robot.github.io/"},{"title":"ok-robot/ok-robot GitHub 仓库","url":"https://github.com/ok-robot/ok-robot"}],"as_of":"2024-07","related_ids":["open-vocabulary","zero-shot","mobile-manipulation","anygrasp","hello-robot-stretch","semantic-map"],"name":"OK-Robot","alt":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics","abbr":"","aliases":[],"one_liner":"纽约大学 2024 年的拾放系统，把现成视觉语言模型和导航、抓取模块拼起来。","explanation":"OK-Robot 由纽约大学 Lerrel Pinto 团队与 Meta 合作提出（Peiqi Liu、Mahi Shafiullah 等），2024 年 1 月上 arXiv，发表于 RSS 2024。OK 指 Open Knowledge，即用互联网数据预训练好的开放知识模型。它不训练新的端到端策略，而是组合现成模块：先用带激光雷达的 iPhone（Record3D 应用）扫一遍房间，建一个带 CLIP 等语义特征的体素地图；收到「把某物放到某处」的指令后，在地图里找物体、导航过去，用 AnyGrasp 算抓取位姿，再导航到目标处放下。整套系统跑在 Hello Robot Stretch 上，换新家不用重新训练。论文重点是总结拼装时哪些细节真正影响成败，并统计了失败原因。","example":"在纽约 10 个真实家庭中做了 171 次拾取-放置，整体成功率 58.5%，在较整洁的环境中为 82%；最常见的失败是语义地图找错物体（9.3%）、抓取姿态难（8.0%）和硬件问题（7.5%）。","related":["开放词汇","零样本","移动操作","AnyGrasp","Hello Robot Stretch","语义地图"]},{"id":"spatialvlm","category":"named_model","sec":1,"tier":3,"sources":[{"title":"SpatialVLM (arXiv 2401.12168)","url":"https://arxiv.org/abs/2401.12168"},{"title":"SpatialVLM project page","url":"https://spatial-vlm.github.io/"}],"as_of":"2024-06","related_ids":["spatial-reasoning","vision-language-model","visual-question-answering","monocular-depth-estimation","spatial-intelligence","google-deepmind"],"name":"SpatialVLM","alt":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","abbr":"","aliases":["Spatial VLM"],"one_liner":"用自动生成的海量 3D 空间问答数据，教视觉语言模型估算距离和大小","explanation":"Google DeepMind 联合 MIT、斯坦福 2024 年 1 月发布，发表于 CVPR 2024。作者发现，视觉语言模型（VLM）能认出图里有什么，却答不好「杯子离盒子多远」「哪个更高」这类定量空间问题，原因是训练数据缺少 3D 空间知识。他们搭了一条自动数据流水线：对真实图片做目标检测、分割和度量深度估计，把 2D 图片提升成带真实尺度的 3D 点云，再按模板生成空间问答，在 1000 万张图片上产出 20 亿条问答，是首个互联网规模的度量空间推理数据集。用这些数据训练后，模型在定性和定量空间问答上都明显提升，还能配合大语言模型做多步空间推理，并把距离估计用作机器人任务的稠密奖励。","example":"问「红色积木离蓝色碗大约多少厘米」，普通 VLM 往往只给出模糊描述，SpatialVLM 能直接给出一个带单位的距离估计。","related":["空间推理","视觉语言模型","视觉问答","单目深度估计","空间智能","谷歌 DeepMind"]},{"id":"pivot","category":"named_model","sec":1,"tier":3,"sources":[{"title":"arXiv 2402.07872: PIVOT","url":"https://arxiv.org/abs/2402.07872"},{"title":"ICML 2024 论文页（PMLR v235）","url":"https://proceedings.mlr.press/v235/nasiriany24a.html"},{"title":"PIVOT 项目主页","url":"https://pivot-prompt.github.io/"}],"as_of":"2024-07","related_ids":["visual-prompting-2","moka","vision-language-model","zero-shot","cross-entropy-method","robopoint"],"name":"PIVOT（迭代视觉提示）","alt":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","abbr":"","aliases":["PIVOT","迭代视觉提示"],"one_liner":"在图上画候选动作让 VLM 反复挑选、逐轮收窄，零样本控制机器人","explanation":"Google DeepMind 主导（Soroush Nasiriany、Fei Xia 等 23 位作者）的工作，2024 年 2 月发布，ICML 2024 论文。VLM 只会输出文字，而机器人需要连续的坐标和动作。PIVOT 把问题改成迭代的视觉问答：先采样一批候选（落点、移动方向或轨迹），在图像上画成带编号的箭头或点；让 VLM 选出最好的几个；再根据选中的候选拟合分布、重新采样，范围越缩越小，几轮后得到最终动作。整个过程不需要任何机器人训练数据，就能做真机导航、桌面操作、仿真指令跟随和图像定位，但作者也承认成功率离实用还远。它是视觉提示路线的代表，思路与 MOKA、Set-of-Mark 相近。","example":"让移动机器人去桌边拿可乐：第一轮在画面上画出若干编号箭头表示可走方向，VLM 选中 3 号和 5 号；下一轮只在这两个方向附近重新画箭头再选，直到方向足够精确。","related":["视觉提示（Set-of-Mark 标记提示）","MOKA（标记式视觉提示操作）","视觉语言模型","零样本","交叉熵方法","RoboPoint"]},{"id":"moka","category":"named_model","sec":1,"tier":3,"sources":[{"title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting (arXiv 2403.03174)","url":"https://arxiv.org/abs/2403.03174"},{"title":"MOKA project page","url":"https://moka-manipulation.github.io/"}],"as_of":"2024-09","related_ids":["visual-prompting-2","affordance","vision-language-model","zero-shot","tool-use","pivot"],"name":"MOKA（标记式视觉提示操作）","alt":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","abbr":"MOKA","aliases":[],"one_liner":"在图上画标记让 GPT-4V 选关键点，再把关键点转成机械臂动作的免训练方法","explanation":"UC Berkeley 的 Fangchen Liu、Kuan Fang、Pieter Abbeel、Sergey Levine 在 2024 年 3 月发布，发表于 RSS 2024。视觉语言模型懂常识，却不会直接输出机器人动作。MOKA 把「该怎么操作」改写成看图答题：在相机图像上叠加候选点、网格、文字说明等标记（即视觉提示），让 GPT-4V 分层地选出抓取点、工具与物体接触的作用点、目标点以及中间路点，再把这些关键点换算成机械臂的运动。它不需要为新任务收集机器人数据，能处理用工具、柔性物体操作和物体重排等桌面任务；执行中收集到的成功经验还能作为上下文示例，或蒸馏成一个策略网络。它是用视觉提示把 VLM 接到机器人上的代表工作。","example":"指令是「用刷子把碎屑扫到一边」时，GPT-4V 在带标记的图上选出刷柄的抓取点、刷毛接触桌面的作用点和扫动方向上的路点，机器人按这些点依次执行。","related":["视觉提示（Set-of-Mark 标记提示）","可供性","视觉语言模型","零样本","工具使用","PIVOT（迭代视觉提示）"]},{"id":"copa","category":"named_model","sec":1,"tier":3,"sources":[{"title":"CoPa (arXiv:2403.08248)","url":"https://arxiv.org/abs/2403.08248"},{"title":"CoPa 项目主页","url":"https://copa-2024.github.io/"}],"as_of":"2024-03","related_ids":["rekep","voxposer","omnimanip","visual-prompting-2","task-oriented-grasping","affordance"],"name":"CoPa","alt":"CoPa: General Robotic Manipulation through Spatial Constraints of Parts with Foundation Models","abbr":"","aliases":["部件空间约束操作","Spatial Constraints of Parts"],"one_liner":"让 GPT-4V 找出物体部件并写出空间约束，免训练完成开放指令操作的框架。","explanation":"清华大学、上海期智研究院、上海交大和上海人工智能实验室的高阳团队 2024 年 3 月提出。它不训练机器人策略，而是让基础模型（在海量数据上预训练的通用大模型）直接给出操作需要的几何信息。一次操作拆成两步：先是「面向任务的抓取」，用 GPT-4V 配合 Set-of-Mark 视觉标记提示，从整个物体到具体部件由粗到细选出该抓哪里，再由 GraspNet 生成抓取位姿；然后是「面向任务的运动规划」，让视觉语言模型找出与任务相关的部件（如锤头、钉子），写出它们之间应满足的空间约束，求解得到抓取后的目标位姿，交给运动规划器执行。它和 VoxPoser、ReKep 同属「大模型出约束、传统规划执行」路线，能处理开放指令和没见过的物体。","example":"指令「用锤子敲钉子」：CoPa 先让 GPT-4V 在锤子上选中锤柄作为抓取部位，再找出锤头敲击面和钉子，约束锤头对准钉子、敲击方向与钉子轴线一致，求出敲击前锤子的位姿后执行。","related":["ReKep","VoxPoser","OmniManip","视觉提示（Set-of-Mark 标记提示）","任务导向抓取（功能性抓取）","可供性"]},{"id":"robopoint","category":"named_model","sec":1,"tier":3,"sources":[{"title":"arXiv 2406.10721: RoboPoint","url":"https://arxiv.org/abs/2406.10721"},{"title":"RoboPoint 项目主页","url":"https://robo-point.github.io/"}],"as_of":"2024-11","related_ids":["affordance","pointing","spatial-reasoning","intermediate-representation","synthetic-data","pivot"],"name":"RoboPoint","alt":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","abbr":"","aliases":[],"one_liner":"根据语言指令在图上点出「放哪里、抓哪里」的视觉语言模型","explanation":"RoboPoint 由华盛顿大学、英伟达、艾伦人工智能研究所等在 2024 年 6 月发布，CoRL 2024 录用。它关注空间可供性：给一张图和一句指令（如「放到盘子右边的空位」），用一组 2D 点在图上标出可行的目标位置，再借助深度图投影到 3D，交给运动规划去执行。训练数据全部由程序化生成的 3D 场景自动合成，不需要真机数据或人工演示；语言骨干是 Vicuna-13B。论文报告其空间可供性预测准确率比 GPT-4o 和视觉提示方法 PIVOT 高 21.8%，下游任务成功率高 30.5%，可用于操作、导航和 AR 辅助。这种「先输出点、再交给规划器」的做法是 VLM 与机器人之间常见的中间表示。","example":"指令「把杯子放到两本书之间的空位」，RoboPoint 在图上输出一组落在空位里的点，机械臂取其中一点作为放置目标。","related":["可供性","指向（点预测）","空间推理","中间表示","合成数据","PIVOT（迭代视觉提示）"]},{"id":"rekep","category":"named_model","sec":1,"tier":2,"sources":[{"title":"ReKep 项目主页","url":"https://rekep-robot.github.io/"}],"as_of":"2024-09","related_ids":["voxposer","omnimanip","affordance","semantic-keypoints","dinov2","llm-based-task-planning"],"name":"ReKep","alt":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","abbr":"ReKep","aliases":["关系关键点约束","Relational Keypoint Constraints"],"one_liner":"用大模型把任务写成关键点之间的约束代码，再靠优化求出机器人动作。","explanation":"ReKep（关系关键点约束）是斯坦福李飞飞团队与哥伦比亚大学在 2024 年 9 月提出的免训练操作方法。它先用 DINOv2 视觉特征在 RGB-D 图像里找出候选 3D 关键点，再把标了编号的图和语言指令交给 GPT-4o，让它写出若干 Python 函数：每个函数输入关键点坐标、输出一个代价，表达「壶嘴要对准杯口」这类关系，任务还可以分成多个阶段。然后用分层优化实时求出末端执行器的位姿序列，并随关键点跟踪闭环重规划。这样不需要任务专属的训练数据，就能在单臂和双臂机器人上倒茶、叠衣服、双臂装鞋，是「大模型给约束、优化器出动作」路线的代表。","example":"指令「给杯子倒茶」时，GPT-4o 写出的约束包括：抓取阶段夹爪要靠近壶把上的关键点；倒水阶段壶嘴关键点要在杯口关键点正上方且壶身倾斜，优化器据此算出整段动作。","related":["VoxPoser","OmniManip","可供性","语义关键点","DINOv2","大模型任务规划"]},{"id":"omnimanip","category":"named_model","sec":1,"tier":3,"sources":[{"title":"arXiv 2501.03841: OmniManip","url":"https://arxiv.org/abs/2501.03841"},{"title":"OmniManip 项目主页","url":"https://omnimanip.github.io/"}],"as_of":"2025-06","related_ids":["rekep","voxposer","copa","affordance","intermediate-representation","6d-object-pose-estimation"],"name":"OmniManip","alt":"OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints","abbr":"","aliases":[],"one_liner":"把 VLM 的推理落成物体坐标系里「点+方向」约束的零样本操作框架","explanation":"北京大学董豪团队与智元机器人（PKU-AgiBot 联合实验室）2025 年 1 月发布，CVPR 2025 Highlight。VLM 懂常识，却给不出精确的三维位置和朝向。OmniManip 先把物体摆进它的标准空间（canonical space，按功能对齐的物体自身坐标系），在里面取「交互点+交互方向」这类交互原语，当作空间约束交给 VLM 挑选和验证；执行时用 6D 位姿跟踪实时更新轨迹，于是规划和执行各有一个闭环。整个过程不微调 VLM，就能在多种操作任务上零样本泛化。它和 ReKep、VoxPoser、CoPa 同属「VLM + 中间表示」路线，作者也提到可用它自动生成仿真数据。","example":"以「把茶倒进杯子」为例：VLM 先认出茶壶和杯子，在茶壶的标准空间里取壶嘴点和倾倒方向、在杯子上取杯口点，据此求出末端位姿；执行中持续跟踪两者的 6D 位姿并修正轨迹。","related":["ReKep","VoxPoser","CoPa","可供性","中间表示","6D位姿估计"]},{"id":"spatiallm","category":"named_model","sec":1,"tier":3,"sources":[{"title":"SpatialLM: Training Large Language Models for Structured Indoor Modeling (arXiv 2506.07491)","url":"https://arxiv.org/abs/2506.07491"},{"title":"manycore-research/SpatialLM (GitHub)","url":"https://github.com/manycore-research/SpatialLM"}],"as_of":"2025-09","related_ids":["point-cloud","3d-object-detection","scene-understanding","manycore-tech","spatial-intelligence","multimodal-large-language-model"],"name":"SpatialLM（群核空间大模型）","alt":"SpatialLM: Training Large Language Models for Structured Indoor Modeling (Manycore)","abbr":"","aliases":["SpatialLM 1.1","群核 SpatialLM"],"one_liner":"群核科技开源的 3D 大模型，读入室内点云，输出墙门窗和家具的结构化布局","explanation":"杭州群核科技（旗下有酷家乐）2025 年 3 月开源，6 月发布技术报告，入选 NeurIPS 2025。它输入一个室内场景的点云（可来自手机视频重建、RGB-D 相机或激光雷达），输出结构化的场景描述：墙、门、窗的位置，以及带类别和朝向的家具 3D 框。和以往为每个任务单独设计网络不同，它沿用标准多模态大模型结构：点云编码器把几何信息转成 token，再由 Llama 1B、Qwen 0.5B 这类小型开源语言模型以文本形式逐项写出场景。训练用了 12328 个合成室内场景（54778 个房间）的点云和标注。6 月的 1.1 版换用 Sonata 点云编码器，并支持按用户指定类别检测。它可为机器人导航和室内布局理解提供结构化空间信息。","example":"用手机绕房间拍一段视频，经 MASt3R-SLAM 重建成点云后输入 SpatialLM，得到每面墙的端点、门窗位置，以及床、床头柜的 3D 框。","related":["点云","3D目标检测","场景理解","群核科技","空间智能","多模态大语言模型"]},{"id":"embodied-r1","category":"named_model","sec":1,"tier":3,"sources":[{"title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation (arXiv 2508.13998)","url":"https://arxiv.org/abs/2508.13998"},{"title":"Embodied-R1 GitHub 仓库","url":"https://github.com/pickxiguapi/Embodied-R1"}],"as_of":"2026-03","related_ids":["embodied-reasoning-model","pointing","reinforcement-fine-tuning","group-relative-policy-optimization","intermediate-representation","affordance"],"name":"Embodied-R1","alt":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","abbr":"","aliases":["Embodied R1"],"one_liner":"天津大学的 3B 具身推理模型，以「指向」为中间表示，用强化微调训练。","explanation":"Embodied-R1 是天津大学团队 2025 年 8 月发布的工作，已被 ICLR 2026 接收。作者把「看得懂却做不到」称为 seeing-to-doing gap，提出用「指向」（在图上输出点、区域或一串轨迹点）作为与机器人本体无关的中间表示，定义了指代定位、区域定位、功能部位定位和视觉轨迹生成四种能力。模型基于 Qwen2.5-VL-3B，在自建的 Embodied-Points-200K 数据上做两阶段强化微调：用 GRPO 算法，按任务设计可自动判分的奖励。模型输出的点和轨迹再交给运动规划等底层模块去执行。权重和数据集已开源。","example":"不做任何任务专门微调，Embodied-R1 在 SimplerEnv 仿真中成功率 56.2%，在 8 个 xArm 真机任务上达到 87.5%，论文称比强基线提升 62%。","related":["具身推理模型","指向（点预测）","强化学习微调","组相对策略优化","中间表示","可供性"]},{"id":"end-to-end-training-of-deep-visuomotor-policies","category":"named_model","sec":2,"tier":3,"sources":[{"title":"End-to-End Training of Deep Visuomotor Policies (arXiv 1504.00702)","url":"https://arxiv.org/abs/1504.00702"},{"title":"JMLR 17(39):1-40, 2016","url":"https://www.jmlr.org/papers/v17/15-522.html"}],"as_of":"","related_ids":["visuomotor-policy","end-to-end","spatial-softmax","trajectory-optimization","reinforcement-learning","imitation-learning"],"name":"端到端视觉运动策略（引导策略搜索）","alt":"End-to-End Training of Deep Visuomotor Policies (Guided Policy Search)","abbr":"GPS","aliases":["引导策略搜索","Guided Policy Search","Levine et al. 2016"],"one_liner":"伯克利 2015 年的代表作：用卷积网络直接从相机图像输出机械臂关节力矩。","explanation":"这篇论文由 UC 伯克利的 Sergey Levine、Chelsea Finn、Trevor Darrell 和 Pieter Abbeel 于 2015 年 4 月放出，2016 年发表于 JMLR。当时机器人多把感知和控制分开设计，论文要验证两者放进一个网络联合训练是否更好。策略是约 9.2 万参数的卷积网络，输入单目图像和关节状态，以 20Hz 输出 7 自由度手臂的关节力矩。训练用引导策略搜索：训练时已知物体位置，先用轨迹优化找出好动作，再用监督学习让只看图像的策略去模仿，把强化学习转成监督学习。文中提出的空间 Softmax 层后来被许多视觉运动策略沿用。","example":"PR2 机器人学会了把衣架挂上衣杆、把积木塞进形状分类盒、用玩具锤的羊角卡住钉子、拧瓶盖，目标位置全靠摄像头判断；每个策略总训练 3 到 4 小时，真机执行只占约 15 分钟。","related":["视觉运动策略","端到端","空间 Softmax","轨迹优化","强化学习","模仿学习"]},{"id":"google-arm-farm","category":"named_model","sec":2,"tier":3,"sources":[{"title":"Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection (arXiv 1603.02199)","url":"https://arxiv.org/abs/1603.02199"},{"title":"Deep Learning for Robots: Learning from Large-Scale Interaction (Google Research Blog, 2016-03)","url":"https://research.google/blog/deep-learning-for-robots-learning-from-large-scale-interaction/"}],"as_of":"2016-03","related_ids":["google-arm-farm","hand-eye-coordination","visual-servoing","self-supervised-learning","qt-opt","mt-opt"],"name":"Google 机械臂农场（大规模抓取自监督）","alt":"Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection (Google Arm Farm)","abbr":"","aliases":["Arm Farm","机械臂农场","谷歌抓取农场"],"one_liner":"谷歌 2016 年让十几台机械臂反复试抓 80 多万次、从数据中自学抓取。","explanation":"这是谷歌 Sergey Levine、Peter Pastor、Alex Krizhevsky、Deirdre Quillen 于 2016 年 3 月发布的工作（ISER 2016 论文的扩展版），因一排机械臂同时干活的场景被称作「机械臂农场」。他们让 6 到 14 台机械臂在约两个月里自主尝试抓取 80 多万次，成败自动判定，不靠人工标注。用这些数据训练卷积神经网络：输入单目相机图像和一个候选的夹爪运动，预测这样动能否抓成功；执行时不断挑选最优运动、边看边调（视觉伺服），无需相机标定。闭环抓取的失败率从开环的 34% 降到 18%。它开启了「大规模真机数据 + 深度学习」路线，QT-Opt、MT-Opt 都沿用这一思路。","example":"抓取途中发现夹爪偏了，机器人会根据画面实时修正；面对挤在一起的一堆物体，它还会先把其中一个拨开再抓。","related":["机械臂农场","手眼协调","视觉伺服","自监督学习","QT-Opt","MT-Opt"]},{"id":"dex-net-2-0","category":"named_model","sec":2,"tier":3,"sources":[{"title":"Dex-Net 2.0: Deep Learning to Plan Robust Grasps with Synthetic Point Clouds and Analytic Grasp Metrics (arXiv:1703.09312)","url":"https://arxiv.org/abs/1703.09312"},{"title":"Dex-Net 项目主页（Berkeley AUTOLAB）","url":"https://berkeleyautomation.github.io/dex-net/"}],"as_of":"2019","related_ids":["grasping","grasp-quality-metric","bin-picking","synthetic-data","convolutional-neural-network","grasp-pose-detection"],"name":"Dex-Net（GQ-CNN 抓取网络）","alt":"Dex-Net 2.0 / Grasp Quality CNN (Berkeley AUTOLAB)","abbr":"Dex-Net","aliases":["Dexterity Network","Dex-Net 2.0","GQ-CNN","Grasp Quality CNN","抓取质量卷积网络"],"one_liner":"伯克利用仿真合成数据训练的抓取打分网络，从深度图判断哪种抓法最稳。","explanation":"Dex-Net 是加州大学伯克利分校 Ken Goldberg 团队（AUTOLAB）的抓取项目，最有名的是 2017 年发表于 RSS 的 Dex-Net 2.0。它不采真机数据，而是在大量 3D 物体模型上用解析抓取指标（按几何和力学公式算抓取稳不稳）批量打标签，合成了 670 万组「点云 + 抓取 + 标签」，再训练卷积网络 GQ-CNN：输入深度图和候选抓取（平面位置、角度、深度），输出成功概率，机器人挑分最高的执行。它是「仿真合成数据训练、直接上真机」在抓取上的早期代表；后续 3.0 扩展到吸盘，4.0（Science Robotics 2019）同时用夹爪和吸盘做无序抓取。","example":"Dex-Net 2.0 在 ABB YuMi 机器人上用 GQ-CNN 规划二指夹爪抓取：对 8 个已知物体成功率 93%，对没见过的家居物体，被判为「稳」的抓取精度约 99%。","related":["抓取","抓取质量指标","无序抓取","合成数据","卷积神经网络","抓取位姿检测"]},{"id":"qt-opt","category":"named_model","sec":2,"tier":3,"sources":[{"title":"QT-Opt (arXiv 1806.10293)","url":"https://arxiv.org/abs/1806.10293"}],"as_of":"2018-06","related_ids":["q-transformer","mt-opt","real-world-reinforcement-learning","q-function","cross-entropy-method","google-arm-farm"],"name":"QT-Opt","alt":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","abbr":"QT-Opt","aliases":[],"one_liner":"谷歌用 58 万多次真机抓取训练视觉 Q 函数的大规模强化学习抓取系统","explanation":"Google Brain 与 X 的 Dmitry Kalashnikov、Sergey Levine 等人 2018 年 6 月发布，发表于 CoRL 2018。当时抓取多是先选抓取点再开环执行。QT-Opt 用深度强化学习直接从头顶 RGB 相机图像学一个 Q 函数，每一步都按当前画面重新决定夹爪怎么动，实现闭环抓取；连续动作难以直接求最大值，就用交叉熵方法（迭代采样优化）搜索最优动作。训练用了 58 万多次真实抓取尝试，在没见过的物体上抓取成功率达 96%，还自发学会重新抓取、先拨动物体再抓等行为。它是大规模真机强化学习的代表作，MT-Opt、Q-Transformer 都沿此发展。","example":"物体在抓取过程中被人推开时，QT-Opt 策略会根据新的相机画面调整夹爪位置重新抓，而不是按原计划在空处合拢。","related":["Q-Transformer","MT-Opt","真机强化学习","Q 函数","交叉熵方法","机械臂农场"]},{"id":"mt-opt","category":"named_model","sec":2,"tier":3,"sources":[{"title":"MT-Opt (arXiv 2104.08212)","url":"https://arxiv.org/abs/2104.08212"},{"title":"Multi-Task Robotic Reinforcement Learning at Scale (Google Research blog, 2021-04-19)","url":"https://research.google/blog/multi-task-robotic-reinforcement-learning-at-scale/"},{"title":"MT-Opt project page","url":"https://karolhausman.github.io/mt-opt/"}],"as_of":"2021-04","related_ids":["qt-opt","reinforcement-learning","multi-task-learning","success-detector","real-world-reinforcement-learning","offline-reinforcement-learning"],"name":"MT-Opt","alt":"MT-Opt: Continuous Multi-Task Robotic Reinforcement Learning at Scale","abbr":"","aliases":[],"one_liner":"谷歌用 7 台真机采 9600 小时数据、同时学 12 个任务的多任务强化学习系统","explanation":"Robotics at Google 的 Dmitry Kalashnikov、Chelsea Finn、Sergey Levine、Karol Hausman 等人 2021 年 4 月发布，是 QT-Opt（谷歌基于 Q 学习的大规模抓取强化学习）的多任务扩展。团队用 7 台机器人在 57 天里连续采集约 9600 机器人小时、80 多万个回合的数据，同时学习挑拣特定物体、放入容器、摆齐、覆盖等 12 个真实任务。关键设计有两个：用多任务成功检测器自动判断任务是否完成并给奖励；把一个任务的回合共享给其他任务并重新平衡数据量，让数据少的任务借到常见任务的经验。稀有任务的平均成功率从单任务 QT-Opt 的 1% 提升到 50%，新任务在约一天内就能微调学会。它是谷歌在 RT-1 之前探索真机规模化学习的重要工作。","example":"要教机器人一个新任务「用毛巾盖住物体」，不用从头训练，在已学到的抓取等技能基础上补采约一天数据微调即可。","related":["QT-Opt","强化学习","多任务学习","成功检测器","真机强化学习","离线强化学习"]},{"id":"decision-transformer","category":"named_model","sec":2,"tier":3,"sources":[{"title":"Decision Transformer (arXiv:2106.01345)","url":"https://arxiv.org/abs/2106.01345"},{"title":"Decision Transformer 项目主页","url":"https://sites.google.com/berkeley.edu/decision-transformer"}],"as_of":"2021-06","related_ids":["offline-reinforcement-learning","transformer","return-conditioning","causal-attention","decision-diffuser","gato"],"name":"决策 Transformer","alt":"Decision Transformer: Reinforcement Learning via Sequence Modeling","abbr":"DT","aliases":["Decision Transformer"],"one_liner":"把强化学习当序列建模：给定想要的回报，用 GPT 式模型逐步预测动作。","explanation":"伯克利、Facebook AI Research 与 Google Brain 的 Lili Chen、Kevin Lu 等 2021 年 6 月提出，发表于 NeurIPS 2021。它不拟合价值函数、也不算策略梯度，而是把轨迹写成「剩余回报（return-to-go，从这一步到结束还想拿多少奖励）、状态、动作」交替排列的 token 序列，用带因果掩码的 GPT 式 Transformer 做监督学习，预测下一个动作。测试时先设定目标回报，每走一步把拿到的奖励从中扣掉。它只用离线数据，在 Atari、OpenAI Gym 和 Key-to-Door 任务上达到或超过当时的无模型离线强化学习方法，让「用序列模型做决策」成为主流思路之一。","example":"在 Atari 游戏中设定一个较高的目标回报，模型读入最近若干帧画面、历史动作和剩余回报，输出下一步按键；每得一次分就把剩余回报相应减少，再生成下一步。","related":["离线强化学习","Transformer","回报条件化","因果注意力","Decision Diffuser","Gato"]},{"id":"gato","category":"named_model","sec":2,"tier":3,"sources":[{"title":"A Generalist Agent (arXiv 2205.06175)","url":"https://arxiv.org/abs/2205.06175"},{"title":"A Generalist Agent（Google DeepMind 博客）","url":"https://deepmind.google/discover/blog/a-generalist-agent/"}],"as_of":"2022-05","related_ids":["generalist-policy","transformer","token","robocat","multi-task-learning","cross-embodiment"],"name":"Gato","alt":"Gato: A Generalist Agent (DeepMind)","abbr":"","aliases":["A Generalist Agent"],"one_liner":"DeepMind 2022 年的通才智能体：同一套权重能打游戏、看图说话、聊天和控制机械臂。","explanation":"Gato 是 DeepMind 在 2022 年 5 月发布的通才智能体，论文题为《A Generalist Agent》。当时的主流做法是一个任务训一个模型，Gato 则尝试用一个约 12 亿参数的 Transformer、同一套权重覆盖 604 个任务：玩 Atari 游戏、给图片写说明、对话、在仿真里控制多种机器人，以及用真实机械臂堆积木。关键做法是把所有模态都转成 token（词元）：文字用分词器切分，图片切成小块，关节角、按键等离散或连续数值也编码成 token，统统拼成一条序列，像语言模型一样逐个预测，训练时只对文字和动作算损失。推理时模型每次自回归地采样动作 token，上下文窗口为 1024 个 token。它是「一个大模型控制多种本体」思路的早期代表，DeepMind 后来的 RoboCat 就沿用了 Gato 的架构。","example":"同一个 Gato 模型，这一刻在 Atari 游戏里按手柄键，下一刻给一张照片生成文字描述，再下一刻控制真实机械臂把彩色积木叠起来。","related":["通用策略","Transformer","token（词元）","RoboCat","多任务学习","跨本体"]},{"id":"vima","category":"named_model","sec":2,"tier":3,"sources":[{"title":"VIMA (arXiv 2210.03094)","url":"https://arxiv.org/abs/2210.03094"},{"title":"VIMA project page","url":"https://vimalabs.github.io/"}],"as_of":"2023-05","related_ids":["vima-bench","language-conditioned-policy","compositional-generalization","tabletop-manipulation","imitation-learning","transformer"],"name":"VIMA","alt":"VIMA: General Robot Manipulation with Multimodal Prompts","abbr":"VIMA","aliases":[],"one_liner":"用图文混排的「多模态提示」统一描述各种操作任务的 Transformer 机器人智能体","explanation":"斯坦福、英伟达、加州理工等机构的 Yunfan Jiang、Linxi Fan、Yuke Zhu、李飞飞等人 2022 年 10 月发布，发表于 ICML 2023。机器人任务的下达方式五花八门：给一段演示让它照做、用语言描述、给一张目标图。VIMA 把它们统一成「文字和图片穿插」的多模态提示，比如「把 [某物体的图] 放进 [某容器的图]」，由一个 Transformer 读入提示并自回归地输出动作。作者还做了仿真基准 VIMA-Bench：17 类任务模板、可程序化生成成千上万个桌面任务、60 多万条专家轨迹，以及四级逐步变难的泛化评测。论文称在最难的零样本设定下成功率比其他设计最高高 2.9 倍。","example":"给 VIMA 的提示是一句话里夹着两张小图：「把 [红色积木图] 放到 [绿色盘子图] 上」，它就在仿真桌面上找到对应物体完成抓放；换成先给一段演示图再说「照这样做」也用同一个模型。","related":["VIMA-Bench","语言条件策略","组合泛化","桌面操作","模仿学习","Transformer"]},{"id":"rt-1","category":"named_model","sec":2,"tier":1,"sources":[{"title":"RT-1: Robotics Transformer for Real-World Control at Scale (arXiv 2212.06817)","url":"https://arxiv.org/abs/2212.06817"},{"title":"RT-1 项目主页","url":"https://robotics-transformer1.github.io/"}],"as_of":"2022-12","related_ids":["rt-2","rt-x","rt-1-robot-action-dataset","transformer","efficientnet","tokenlearner"],"name":"RT-1","alt":"RT-1: Robotics Transformer for Real-World Control at Scale","abbr":"RT-1","aliases":["Robotics Transformer 1"],"one_liner":"谷歌 2022 年发布、用 13 万条真机轨迹训练的机器人 Transformer 策略。","explanation":"RT-1 是谷歌机器人团队与 Everyday Robots 于 2022 年 12 月发布的机器人控制模型。当时机器人学习多是一个任务训一个小模型，RT-1 想验证语言和视觉领域的做法——大容量模型加大而杂的数据——能否用到机器人上。团队用 13 台移动机械臂花 17 个月采集了 13 万多条演示，覆盖 700 多个任务。模型输入图像和语言指令：图像经 EfficientNet 提特征，用 FiLM（让语言指令调制视觉特征的层）融入指令，再用 TokenLearner 压缩 token 数，交给 Transformer 输出离散化的动作，以 3Hz 闭环控制手臂和底盘。它在训练指令上成功率 97%，对新任务、干扰物和新背景的泛化好于当时的基线。其数据后来并入 Open X-Embodiment，架构和数据也是 RT-2 的基础。","example":"在谷歌办公室厨房环境里，RT-1 按语言指令完成拾取放置、开关抽屉、把物品放进抽屉等操作。","related":["RT-2","RT-X","RT-1 数据集","Transformer","EfficientNet","TokenLearner"]},{"id":"rt-2","category":"named_model","sec":2,"tier":1,"sources":[{"title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv 2307.15818)","url":"https://arxiv.org/abs/2307.15818"},{"title":"RT-2 项目主页","url":"https://robotics-transformer2.github.io/"}],"as_of":"2023-07","related_ids":["vision-language-action-model","rt-1","palm-e","co-training","action-binning","openvla"],"name":"RT-2","alt":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","abbr":"RT-2","aliases":["Robotics Transformer 2"],"one_liner":"谷歌 DeepMind 2023 年提出，把动作当文字 token 输出，首次提出 VLA 这一名称。","explanation":"RT-2 是谷歌 DeepMind 于 2023 年 7 月发布的模型，论文首次提出「视觉-语言-动作模型（VLA）」这一名称。做法是：拿在互联网图文上预训练好的视觉语言模型（PaLI-X 和 PaLM-E），把机器人动作的每一维离散成 256 个区间、写成一串数字 token，和普通文字一样让模型输出；训练时把 RT-1 的机器人数据和网络视觉问答数据混在一起协同微调，以免丢掉原有知识。这样机器人能直接用上从网上学到的常识，出现了论文所说的涌现能力：认出机器人数据里没有的物体和符号，理解「最小的」「能临时当锤子用的」这类语义。模型有 120 亿（PaLM-E 版）和 550 亿参数（PaLI-X 版）两种。它开启了后来 OpenVLA、π0 等 VLA 模型的路线。","example":"对机器人说「把香蕉移到二加一的和那里」，RT-2 能把香蕉放到写着 3 的位置上，而机器人训练数据里没有这类算术任务。","related":["视觉-语言-动作模型","RT-1","PaLM-E","协同训练","分箱离散化","OpenVLA"]},{"id":"rt-x","category":"named_model","sec":2,"tier":2,"sources":[{"title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models 项目主页","url":"https://robotics-transformer-x.github.io/"}],"as_of":"2023-10","related_ids":["open-x-embodiment","rt-1","rt-2","cross-embodiment","octo","openvla"],"name":"RT-X","alt":"RT-X (RT-1-X / RT-2-X, trained on Open X-Embodiment)","abbr":"RT-X","aliases":["RT-1-X","RT-2-X"],"one_liner":"在 Open X-Embodiment 跨本体数据集上重新训练的 RT-1 和 RT-2。","explanation":"RT-X 是谷歌 DeepMind 牵头、21 家机构 34 个实验室合作，于 2023 年 10 月随 Open X-Embodiment 数据集一起发布的一组模型。这份数据集汇集 60 个已有机器人数据集、22 种机器人本体、100 万条以上真机轨迹。RT-1-X 和 RT-2-X 分别沿用 RT-1（专门的机器人 Transformer）和 RT-2（在视觉语言模型上微调的 VLA）的结构，只把训练数据换成这份混合数据。结果显示跨本体训练有正迁移：RT-1-X 在小数据场景下比各实验室原有方法平均高约 50%，RT-2-X 在涌现技能评测上约为 RT-2 的 3 倍。它带动了跨本体数据共享，Octo、OpenVLA 等后续模型都用这份数据训练。","example":"RT-2-X 学到了其他实验室数据里才有的空间概念，能分清「把苹果放到布上」和「把苹果放到布旁边」这类只差一个介词的指令。","related":["Open X-Embodiment 数据集","RT-1","RT-2","跨本体","Octo","OpenVLA"]},{"id":"rt-trajectory","category":"named_model","sec":2,"tier":3,"sources":[{"title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches (arXiv 2311.01977)","url":"https://arxiv.org/abs/2311.01977"},{"title":"RT-Trajectory project page","url":"https://rt-trajectory.github.io/"}],"as_of":"2024-01","related_ids":["rt-1","rt-2","intermediate-representation","task-generalization","hindsight-relabeling","goal-conditioned-policy"],"name":"RT-Trajectory","alt":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","abbr":"","aliases":[],"one_liner":"用画在图像上的轨迹草图代替语言指令，告诉机器人动作该怎么走的策略","explanation":"Google DeepMind 联合加州大学圣地亚哥分校、斯坦福和 Intrinsic 于 2023 年 11 月发布，入选 ICLR 2024 Spotlight。语言指令只说「做什么」，对训练中没见过的新任务往往不够具体。RT-Trajectory 改用「轨迹草图」作为条件：把末端执行器要走的路径画成一条曲线叠在相机图像上，用颜色表示时间先后和高度，并标出夹爪开合的位置。训练时不需要人工标注，直接把每条演示里记录的末端位置投影到画面上，事后生成草图（hindsight）。策略骨干沿用 RT-1。测试时草图可以由人手绘、从人类视频中提取，或由大模型生成。在 7 个训练中没见过的任务上，它明显优于语言条件的 RT-1、RT-2 和以目标图像为条件的基线。","example":"训练数据里多是抓取放置，测试时人在画面上画一条先抓住布的一角、再拉向对侧的曲线，机器人就能照着完成训练里没有的「对折布料」。","related":["RT-1","RT-2","中间表示","任务泛化","事后重标注","目标条件策略"]},{"id":"autort","category":"named_model","sec":2,"tier":3,"sources":[{"title":"AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents (arXiv 2401.12963)","url":"https://arxiv.org/abs/2401.12963"},{"title":"Shaping the future of advanced robotics (Google DeepMind blog, 2024-01-04)","url":"https://deepmind.google/discover/blog/shaping-the-future-of-advanced-robotics/"},{"title":"AutoRT 项目页","url":"https://auto-rt.github.io/"}],"as_of":"2024-01","related_ids":["autonomous-data-collection","asimov-s-three-laws-of-robotics","rt-2","rt-1","saycan","llm-based-task-planning"],"name":"AutoRT","alt":"AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents","abbr":"","aliases":["Auto RT"],"one_liner":"DeepMind 2024 年的系统：用大模型给一群机器人自动出任务、采真机数据。","explanation":"AutoRT 是 Google DeepMind 2024 年 1 月公布的系统，作者包括 Karol Hausman、Fei Xia、Chelsea Finn、Sergey Levine 等。训练具身基础模型缺真实数据，而一人盯一台机器人采数据难以扩大规模。AutoRT 让现成大模型当调度员：机器人在办公楼里自主探索，视觉语言模型描述场景和物体，大语言模型据此提出任务；任务先经「机器人宪法」筛选（受阿西莫夫三定律启发的基本规则，加上安全规则和本体能力规则），再按人力情况分给遥操作、脚本抓取策略或 RT-2 执行。7 个月里它在 4 栋楼调度机器人（同时最多 20 多台），采集了 7.7 万条真机回合、6650 多条不同指令，一人可同时看管 3–5 台。","example":"若 LLM 提出「打开冰箱拿出饮料」，会因为机器人只有一条手臂、而这件事需要两只手，被宪法中的本体规则过滤；涉及人或动物、尖锐易碎物品、电器的任务则会被安全规则拦下。","related":["自主数据采集","机器人三定律 / 机器人宪法","RT-2","RT-1","SayCan","大模型任务规划"]},{"id":"rt-h","category":"named_model","sec":2,"tier":3,"sources":[{"title":"RT-H: Action Hierarchies Using Language (arXiv 2403.01823)","url":"https://arxiv.org/abs/2403.01823"},{"title":"RT-H project page","url":"https://rt-hierarchy.github.io/"}],"as_of":"2024-06","related_ids":["rt-2","hierarchical-architecture","language-corrections","human-in-the-loop","intermediate-representation","vision-language-action-model"],"name":"RT-H","alt":"RT-H: Action Hierarchies Using Language","abbr":"RT-H","aliases":["RT-Hierarchy"],"one_liner":"谷歌让机器人先说出「手臂前移」这类语言动作、再输出动作的分层 VLA 策略","explanation":"Google DeepMind 和斯坦福大学 2024 年 3 月发布，作者包括 Suneel Belkhale、Dorsa Sadigh 等。RT-2 这类视觉-语言-动作模型直接从「把可乐罐放进抽屉」这样的任务指令映射到电机动作，不同任务之间共有的动作结构很难被学到。RT-H 在中间插了一层「语言动作」（language motion），即「手臂前移」「合上夹爪」这类细粒度短语：同一个与互联网数据协同训练的视觉语言模型先根据任务和画面预测语言动作，再根据语言动作和画面输出具体动作。这样语义不同的任务可以共享底层动作；人还能在执行中直接用语言纠正它，这些纠正数据又能拿来继续训练。论文报告它在多任务数据上比 RT-2 高约 15%，从语言干预中学习的效果也好于从遥操作干预中学习。","example":"机器人去开抽屉时手伸偏了，人只要说一句「手臂往左移」，RT-H 就把这句当作新的语言动作接着执行，这段纠正也会被记录下来用于再训练。","related":["RT-2","分层架构","语言纠正（实时语言反馈）","人在回路","中间表示","视觉-语言-动作模型"]},{"id":"robocat","category":"named_model","sec":2,"tier":3,"sources":[{"title":"arXiv 2306.11706: RoboCat","url":"https://arxiv.org/abs/2306.11706"},{"title":"Google DeepMind 博客：RoboCat","url":"https://deepmind.google/discover/blog/robocat-a-self-improving-robotic-agent/"}],"as_of":"2023-12","related_ids":["gato","decision-transformer","cross-embodiment","self-improvement","goal-conditioned-policy","google-deepmind"],"name":"RoboCat","alt":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","abbr":"","aliases":[],"one_liner":"DeepMind 基于 Gato 的跨本体操作智能体，能自己生成数据迭代变强","explanation":"RoboCat 是 Google DeepMind 在 2023 年 6 月发布的机器人操作智能体，架构沿用多模态通用模型 Gato，是一个以目标图像为条件的决策 Transformer：给它一张「任务完成后的样子」，它输出动作。它在多种真实和仿真机械臂的数百万条轨迹上训练，能处理观测和动作格式不同的机器人。最大特点是「自我提升」循环：新任务先用 100–1000 条人类演示微调出专用版本，让它自己练约 1 万次产生新数据，再把这些数据并入训练集重训通用模型。据 DeepMind 博客，后期版本在新任务上的成功率从 36% 提到 74%。它是较早证明跨本体数据能加快学新技能的代表工作。","example":"RoboCat 在几小时内学会操作一台换成三指夹爪的新机械臂，用 1000 条演示后抓取齿轮的成功率达到 86%。","related":["Gato","决策 Transformer","跨本体","自我提升","目标条件策略","谷歌 DeepMind"]},{"id":"roboflamingo","category":"named_model","sec":2,"tier":3,"sources":[{"title":"arXiv 2311.01378: Vision-Language Foundation Models as Effective Robot Imitators","url":"https://arxiv.org/abs/2311.01378"},{"title":"RoboFlamingo 项目主页","url":"https://roboflamingo.github.io/"},{"title":"GitHub: RoboFlamingo","url":"https://github.com/RoboFlamingo/RoboFlamingo"}],"as_of":"2024-02","related_ids":["vision-language-model","vision-language-action-model","calvin-benchmark","imitation-learning","robovlms","flamingo"],"name":"RoboFlamingo","alt":"RoboFlamingo (Vision-Language Foundation Models as Effective Robot Imitators)","abbr":"","aliases":[],"one_liner":"把开源 OpenFlamingo 视觉语言模型微调成机器人操作策略的早期工作","explanation":"RoboFlamingo 由字节跳动研究院联合清华大学、上海交通大学、新加坡国立大学在 2023 年 11 月发布，是较早把开源视觉语言模型（VLM）直接改造成操作策略的工作。它以 OpenFlamingo 为骨干，每一步负责理解当前画面和语言指令，再接一个显式策略头（如 LSTM）汇总历史信息、输出机械臂动作，只在带语言标注的演示数据上做模仿学习微调。这种「理解」和「决策」分开的设计让它在一台 8 卡 GPU 服务器上就能训练。在 CALVIN 长程任务基准上，它平均能连续完成 4.09 个任务，明显高于此前方法；但论文只在仿真中验证。同一批作者后来把这条思路扩展成系统研究 RoboVLMs。","example":"在 CALVIN 中连续给 5 条指令（如「打开抽屉」「把蓝色方块往左推」），RoboFlamingo 平均能连续做完约 4 条。","related":["视觉语言模型","视觉-语言-动作模型","CALVIN","模仿学习","RoboVLMs","Flamingo"]},{"id":"transporter-networks","category":"named_model","sec":3,"tier":3,"sources":[{"title":"Transporter Networks (arXiv 2010.14406)","url":"https://arxiv.org/abs/2010.14406"},{"title":"Transporter Networks project page","url":"https://transporternets.github.io/"}],"as_of":"2020-10","related_ids":["cliport","pick-and-place","rearrangement","tabletop-manipulation","imitation-learning","equivariant-policy-equivariant-neural-network"],"name":"Transporter Networks","alt":"Transporter Networks: Rearranging the Visual World for Robotic Manipulation","abbr":"","aliases":["Transporter","Transporter 网络"],"one_liner":"把抓放操作看成「在图像上把一块区域挪到另一处」的高样本效率操作网络","explanation":"Robotics at Google（Andy Zeng、Pete Florence 等）2020 年 10 月发布，发表于 CoRL 2020，入围最佳论文。它把桌面抓取放置类任务看成一连串「空间位移」：先在俯视图像上预测在哪抓，再把抓取点周围的深度特征裁下来，与整张场景的特征做互相关（逐位置比对），找出最合适的放置位置和旋转角度。这种设计不需要先检测物体，又天然利用了平移、旋转对称性，所以非常省数据，少量示教就能学会堆积木、套件装配、理绳子、推物体等任务，也能扩展到 6 自由度抓放。论文同时开源了基于 PyBullet 的 Ravens 仿真任务集。后来的 CLIPort 在它上面加入 CLIP 语言理解，成为语言条件操作的常用基线。","example":"套件装配任务：模型从俯视图里找出每个零件该从哪里抓、放进模具的哪个槽、转多少度，只用少量示教就能学会。","related":["CLIPort","抓取放置","物体重排","桌面操作","模仿学习","等变策略 / 等变网络"]},{"id":"cliport","category":"named_model","sec":3,"tier":3,"sources":[{"title":"CLIPort: What and Where Pathways for Robotic Manipulation (arXiv 2109.12098)","url":"https://arxiv.org/abs/2109.12098"},{"title":"CLIPort 项目主页","url":"https://cliport.github.io/"}],"as_of":"2021-09","related_ids":["clip","transporter-networks","language-conditioned-policy","tabletop-manipulation","peract","pick-and-place"],"name":"CLIPort","alt":"CLIPort: What and Where Pathways for Robotic Manipulation","abbr":"","aliases":[],"one_liner":"结合 CLIP 语义理解与 Transporter 空间精度的语言条件操作策略。","explanation":"CLIPort 是华盛顿大学和英伟达（Mohit Shridhar、Lucas Manuelli、Dieter Fox）2021 年发表于 CoRL 的工作。它借用神经科学里视觉的 what / where 双通路：语义通路用预训练的 CLIP（图文对比学习模型）理解「要操作什么」，如颜色、形状、物体类别；空间通路沿用 Transporter Networks 的全卷积网络处理 RGB-D 图像，决定「在哪里抓、放到哪里」，输出像素级的抓取和放置热力图。两路融合后，不需要物体位姿、分割掩码或符号状态，就能按语言指令完成装箱、叠布等桌面任务。它是较早把大规模预训练图文模型接进机器人操作的代表作，同一作者后来的 PerAct 把这类思路推广到 3D 体素。","example":"一个多任务策略只用 179 对真实图像-动作样本，就在 9 个真实桌面任务上学会按语言指令操作。","related":["CLIP","Transporter Networks","语言条件策略","桌面操作","PerAct","抓取放置"]},{"id":"neural-descriptor-fields","category":"named_model","sec":3,"tier":3,"sources":[{"title":"Neural Descriptor Fields: SE(3)-Equivariant Object Representations for Manipulation (arXiv 2112.05124)","url":"https://arxiv.org/abs/2112.05124"},{"title":"NDF 项目页","url":"https://yilundu.github.io/ndf/"}],"as_of":"2022-05","related_ids":["object-centric-representation","equivariant-policy-equivariant-neural-network","few-shot","pick-and-place","pose","imitation-learning"],"name":"神经描述子场","alt":"Neural Descriptor Fields (SE(3)-Equivariant Object Representations for Manipulation)","abbr":"NDF","aliases":[],"one_liner":"MIT 2021 年提出的物体表示，看几次示范就能把操作迁移到同类新物体、新姿态。","explanation":"神经描述子场由 MIT 的 Anthony Simeonov、Yilun Du、Pulkit Agrawal、Vincent Sitzmann 等提出，2021 年 12 月上 arXiv，发表于 ICRA 2022。它把物体表示成一个函数：输入物体附近任意 3D 点，输出一个描述子向量，同类物体上功能相当的位置（如不同杯子的把手）描述子相近。描述子取自一个用 3D 重建任务自监督训练的占据网络，不需要人工标关键点。网络满足 SE(3) 等变（物体怎么转、怎么移，描述子跟着同样变），所以正放、侧放、倒放都能处理。示范时记下夹爪附近一组点的描述子，测试时用优化找描述子最匹配的夹爪位姿。","example":"只给 10 次「抓住杯沿、把杯子挂到架子上」的示范，Franka 机械臂就能对没见过的杯子在任意朝向下完成挂杯，论文报告总体成功率超过 85%。","related":["以物体为中心的表示","等变策略 / 等变网络","少样本","抓取放置","位姿","模仿学习"]},{"id":"peract","category":"named_model","sec":3,"tier":3,"sources":[{"title":"arXiv 2209.05451: Perceiver-Actor","url":"https://arxiv.org/abs/2209.05451"},{"title":"PerAct 项目主页","url":"https://peract.github.io/"}],"as_of":"2022-11","related_ids":["rvt-2","3d-diffuser-actor","rlbench","voxel","keyframe-action-prediction","cliport"],"name":"PerAct","alt":"Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation","abbr":"PerAct","aliases":["Perceiver-Actor"],"one_liner":"把场景体素化，用 Perceiver Transformer 预测下一个关键位姿的多任务操作策略","explanation":"华盛顿大学与英伟达的 Mohit Shridhar、Lucas Manuelli、Dieter Fox 在 CoRL 2022 提出。它把 RGB-D 观测转成 100×100×100 的体素网格（三维像素块），与语言指令一起送进 PerceiverIO Transformer；输出不是连续轨迹，而是「下一个最佳体素」：末端该到哪个格子、离散化的旋转、夹爪开合以及是否需要避碰，再由运动规划器把机械臂送到这个关键位姿。一个模型同时在 RLBench 18 个任务（249 种变体）和 7 个真实任务上训练，每个任务只要少量演示。它把「3D 表示 + 关键帧动作预测」这套做法立了起来，RVT、3D Diffuser Actor、BridgeVLA 等后续工作都拿它当基线。","example":"指令「打开中间的抽屉」：PerAct 先在体素网格里给出把手所在格子和抓取朝向，夹爪到位后闭合；下一步再预测把抽屉拉开后的末端位置。","related":["RVT-2","3D Diffuser Actor","RLBench","体素","关键帧动作预测","CLIPort"]},{"id":"motion-policy-networks","category":"named_model","sec":3,"tier":3,"sources":[{"title":"Motion Policy Networks (arXiv 2210.12209)","url":"https://arxiv.org/abs/2210.12209"},{"title":"MπNets project page","url":"https://mpinets.github.io/"},{"title":"NVlabs/motion-policy-networks (GitHub)","url":"https://github.com/NVlabs/motion-policy-networks"}],"as_of":"2022-10","related_ids":["neural-motion-planning","motion-planning","point-cloud","obstacle-avoidance","sampling-based-planning","geometric-fabrics"],"name":"运动策略网络","alt":"Motion Policy Networks","abbr":"MπNets","aliases":["MPiNets"],"one_liner":"从单个深度相机的点云直接生成无碰撞机械臂运动的神经运动规划器","explanation":"华盛顿大学与英伟达的 Adam Fishman、Byron Boots、Dieter Fox 等人 2022 年 10 月发布，发表于 CoRL 2022。经典运动规划（如 RRT 这类采样式规划）需要完整准确的环境模型，在杂乱场景里也算得慢。MπNets 用一个端到端神经网络替代：输入单个深度相机看到的场景点云和机器人当前状态，逐步输出朝目标位姿移动的关节运动，连起来就是一条平滑、避障的轨迹。训练数据全部在仿真里用经典规划工具（OMPL 和 Geometric Fabrics）自动生成，覆盖 50 多万个环境、300 多万个规划问题。结果比以往的神经规划器好 46%，比全局规划器快得多、能应对动态场景，只用仿真数据训练也能迁移到带噪声的真机局部点云。代码、权重和数据已开源。","example":"机械臂要把手伸进柜子的某一格取东西，MπNets 看一眼深度相机的点云，就能实时给出绕开柜板的关节轨迹，不需要先建完整地图再跑规划器。","related":["神经运动规划","运动规划","点云","避障","基于采样的规划","Geometric Fabrics"]},{"id":"behavior-transformer","category":"named_model","sec":3,"tier":3,"sources":[{"title":"Behavior Transformers: Cloning k modes with one stone (arXiv 2206.11251)","url":"https://arxiv.org/abs/2206.11251"},{"title":"Behavior Generation with Latent Actions (VQ-BeT, arXiv 2403.03181)","url":"https://arxiv.org/abs/2403.03181"},{"title":"VQ-BeT 项目主页","url":"https://sjlee.cc/vq-bet/"}],"as_of":"2024-07","related_ids":["action-multimodality","behavior-cloning","vector-quantization","diffusion-policy","action-tokenizer","franka-kitchen"],"name":"BeT / VQ-BeT","alt":"Behavior Transformers (BeT) / VQ-BeT (Behavior Generation with Latent Actions)","abbr":"BeT","aliases":["Behavior Transformer","行为 Transformer","VQ-BeT","Vector-Quantized Behavior Transformer"],"one_liner":"用 Transformer 从多峰演示数据里同时学会多种行为的模仿学习方法。","explanation":"BeT（Behavior Transformer）是纽约大学 Lerrel Pinto 组 2022 年提出的行为克隆方法。人类演示常有「动作多峰性」：同一场景下有好几种合理做法，直接回归会把它们平均成一个错误动作。BeT 先用 k-means 把连续动作聚成若干类，Transformer 预测该选哪一类，再预测一个连续偏移量修正成精确动作，从而保留多种行为模式。2024 年的 VQ-BeT（纽约大学与首尔大学，ICML 2024）把 k-means 换成残差向量量化，更适合高维动作和长动作序列，推理速度约为扩散策略的 5 倍。它们和扩散策略是同一时期解决多峰问题的两条代表路线。","example":"在 Franka Kitchen 仿真厨房里，演示者完成几个子任务的顺序各不相同，BeT 被用来检验能否学到并复现这些不同的行为模式。","related":["动作多峰性","行为克隆","向量量化","扩散策略","动作分词器","Franka Kitchen"]},{"id":"diffuser","category":"named_model","sec":3,"tier":3,"sources":[{"title":"Planning with Diffusion for Flexible Behavior Synthesis (arXiv:2205.09991)","url":"https://arxiv.org/abs/2205.09991"},{"title":"Diffuser 项目主页","url":"https://diffusion-planning.github.io/"}],"as_of":"2022","related_ids":["diffusion-model","model-based-reinforcement-learning","trajectory-optimization","decision-diffuser","diffusion-policy","offline-reinforcement-learning"],"name":"Diffuser（扩散规划器）","alt":"Diffuser (Planning with Diffusion for Flexible Behavior Synthesis)","abbr":"","aliases":["Planning with Diffusion","扩散规划"],"one_liner":"把整条轨迹当作去噪对象生成的规划方法，最早把扩散模型用于决策的工作之一。","explanation":"Diffuser 是 ICML 2022 的一篇论文，作者是 UC 伯克利的 Michael Janner、Sergey Levine 和 MIT 的 Yilun Du、Joshua Tenenbaum。传统基于模型的强化学习先学动力学模型、再用优化器规划，模型误差常被规划器放大。Diffuser 把两步合一：用扩散模型直接建模「状态 + 动作」的整段轨迹，规划就是从噪声出发反复去噪出一条轨迹。想要高回报，就在去噪时用价值函数梯度做引导；想到达指定目标，就固定起点和终点、让模型补全中间（类似图像修补）。同一模型不重训就能换任务。它是后来 Decision Diffuser、扩散策略等「扩散模型做决策」路线的先驱。","example":"在 Maze2D 迷宫任务里固定起点和终点状态，Diffuser 通过去噪「补全」出中间整条可行路径；在积木堆叠任务里，换一个引导函数就能让同一模型按不同约束堆塔。","related":["扩散模型","基于模型的强化学习","轨迹优化","Decision Diffuser","扩散策略","离线强化学习"]},{"id":"decision-diffuser","category":"named_model","sec":3,"tier":3,"sources":[{"title":"Is Conditional Generative Modeling all you need for Decision-Making? (arXiv:2211.15657)","url":"https://arxiv.org/abs/2211.15657"},{"title":"Decision Diffuser 项目主页（ICLR 2023 Oral）","url":"https://anuragajay.github.io/decision-diffuser/"}],"as_of":"2023-07","related_ids":[null,"diffusion-model","classifier-free-guidance","inverse-dynamics-model","offline-reinforcement-learning","return-conditioning"],"name":"Decision Diffuser（决策扩散器）","alt":"Decision Diffuser (Is Conditional Generative Modeling all you need for Decision-Making?)","abbr":"","aliases":["决策扩散器","Decision Diffuser"],"one_liner":"用以回报为条件的扩散模型生成未来状态轨迹，再反推动作，绕开动态规划。","explanation":"MIT Pulkit Agrawal 组（Improbable AI Lab）与 CSAIL 2022 年 11 月提出，ICLR 2023 口头报告。离线强化学习通常要学价值函数、做动态规划（反复用贝尔曼方程估计长期回报），训练不稳定。Decision Diffuser 把决策当成条件生成：扩散模型只生成未来的状态序列，以期望回报、约束或技能为条件，并用无分类器引导加强条件；再用逆动力学模型从相邻两个状态反推出该执行的动作。它在 D4RL 离线强化学习基准上超过当时的主流方法；训练时只见过单个约束或技能，测试时还能把多个条件组合起来。它是 Diffuser 之后扩散模型做决策的代表工作，与后来 UniPi 等「先生成未来、再用逆动力学反推动作」的路线一脉相承。","example":"Kuka 机械臂堆方块实验中，训练数据每条只满足一个「A 在 B 上面」式的约束，测试时把多个约束同时作为条件，Decision Diffuser 能生成同时满足它们的堆叠方案。","related":["Diffuser","扩散模型","无分类器引导","逆动力学模型","离线强化学习","回报条件化"]},{"id":"diffusion-policy","category":"named_model","sec":3,"tier":1,"sources":[{"title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)","url":"https://arxiv.org/abs/2303.04137"},{"title":"Diffusion Policy 项目主页","url":"https://diffusion-policy.cs.columbia.edu/"}],"as_of":"2024-03","related_ids":["diffusion-model","action-multimodality","denoising-diffusion-probabilistic-model","action-chunking","3d-diffusion-policy","push-t"],"name":"扩散策略","alt":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","abbr":"DP","aliases":["Diffusion Policy","DP"],"one_liner":"用扩散模型从噪声中逐步「去噪」生成机器人动作序列的模仿学习策略。","explanation":"扩散策略由哥伦比亚大学宋舒然组的 Cheng Chi 等人与丰田研究院、MIT 合作提出，2023 年 3 月上线 arXiv，发表于 RSS 2023，扩展版 2024 年刊于 IJRR。它把策略写成条件去噪扩散过程：以相机图像等观测为条件，从随机噪声出发逐步去噪，得到一段未来动作。好处是能表达动作多峰性——同一场景下有几种都对的做法时，不会像直接回归那样把它们平均成一个错误动作。论文还结合了滚动时域控制（预测一段、执行一部分、再重新预测），在 4 个基准的 12 个任务上比当时最好的方法平均提升 46.9%。它是后来 3D 扩散策略、π0 等模型里扩散/流匹配动作头的重要来源。","example":"Push-T 是它的招牌任务：机器人用一根圆柱末端把桌上的 T 形块推到指定位置和朝向。从左侧或右侧绕过去推都可以，演示里两种做法都有，扩散策略两种都学会，但每次执行只坚持其中一种。","related":["扩散模型","动作多峰性","去噪扩散概率模型","动作分块","3D 扩散策略","Push-T"]},{"id":"action-chunking-with-transformers","category":"named_model","sec":3,"tier":1,"sources":[{"title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (arXiv 2304.13705)","url":"https://arxiv.org/abs/2304.13705"},{"title":"ALOHA / ACT 项目主页","url":"https://tonyzhaozh.github.io/aloha/"}],"as_of":"2023-04","related_ids":["action-chunking","temporal-ensembling","conditional-variational-autoencoder","aloha","mobile-aloha","behavior-cloning"],"name":"ACT","alt":"Action Chunking with Transformers","abbr":"ACT","aliases":["动作分块 Transformer","Action Chunking Transformer"],"one_liner":"斯坦福 2023 年提出的模仿学习策略，一次预测一段动作，让低成本双臂做精细活。","explanation":"ACT 是斯坦福 Tony Zhao、Chelsea Finn 等人（合作方含 UC Berkeley、Meta）2023 年 4 月提出的模仿学习算法，与低成本双臂平台 ALOHA（硬件预算约 2 万美元）一起发表于 RSS 2023。行为克隆（照着人类演示学动作）每一步的小误差会越积越大，精细任务尤其容易失败。ACT 让 Transformer 一次输出未来一整段动作（动作分块），决策次数变少，误差累积也少；训练时套一层条件变分自编码器（CVAE，能表达同一场景多种做法的生成模型）来吸收人类演示的随机性；执行时用时序集成把重叠的动作块加权平均，让动作更平滑。它结构简单、数据需求小，后来成为 Mobile ALOHA、LeRobot 等项目的常用基线。","example":"在 ALOHA 上，ACT 每个任务只用约 10 分钟的遥操作演示，就学会了打开半透明调料杯、把电池插进槽里等 6 个精细任务，成功率 80%–90%。","related":["动作分块","时序集成","条件变分自编码器","ALOHA 双臂平台","Mobile ALOHA","行为克隆"]},{"id":"roboagent","category":"named_model","sec":3,"tier":3,"sources":[{"title":"arXiv 2309.01918: RoboAgent","url":"https://arxiv.org/abs/2309.01918"},{"title":"RoboAgent 项目主页（RoboPen）","url":"https://robopen.github.io/"}],"as_of":"2024-05","related_ids":["action-chunking","action-chunking-with-transformers","data-augmentation","segment-anything-model","multi-task-learning","language-conditioned-policy"],"name":"RoboAgent（MT-ACT）","alt":"RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action Chunking","abbr":"MT-ACT","aliases":["RoboAgent","MT-ACT","Multi-Task Action Chunking Transformer","多任务动作分块 Transformer"],"one_liner":"CMU 与 Meta 用 7500 条演示训出的多技能厨房操作智能体","explanation":"RoboAgent 是卡内基梅隆大学和 Meta AI 在 2023 年 9 月发布的工作（ICRA 2024 录用），想回答：真机数据很贵，能不能用少量数据训出会多种技能的机器人。做法有两点：一是语义增强，用分割一切模型 SAM 分出画面中的物体，再改变其形状、颜色、纹理，把现有数据成倍扩充；二是提出 MT-ACT（多任务动作分块 Transformer），把 ACT 的动作分块（一次预测一小段未来动作）扩展到用语言指令区分任务的多任务场景。只用 7500 条遥操作轨迹，一个策略就学会 12 种技能、覆盖厨房里 38 个任务，在未见场景中比已有方法高出 40% 以上。相关数据以 RoboSet 名义开源。","example":"一条「拉开抽屉」的演示经语义增强后，可以变成抽屉和台面外观各不相同的多条样本，一起用来训练 MT-ACT。","related":["动作分块","ACT","数据增强","分割一切模型","多任务学习","语言条件策略"]},{"id":"dobb-e","category":"named_model","sec":3,"tier":3,"sources":[{"title":"On Bringing Robots Home (arXiv 2311.16098)","url":"https://arxiv.org/abs/2311.16098"},{"title":"Dobb·E 项目主页","url":"https://dobb-e.com/"}],"as_of":"2023-11","related_ids":["handheld-gripper-data-collection","universal-manipulation-interface","hello-robot-stretch","household-tasks","pre-trained-visual-representation","robot-utility-models"],"name":"Dobb·E","alt":"Dobb-E: An Open-Source, General Framework for Learning Household Robotic Manipulation","abbr":"Dobb-E","aliases":["On Bringing Robots Home"],"one_liner":"纽约大学与 Meta 2023 年开源的家务机器人框架，5 分钟示范教会新任务。","explanation":"Dobb·E 是纽约大学 Lerrel Pinto 团队与 Meta 于 2023 年 11 月发布的开源家用机器人学习框架，论文题为 On Bringing Robots Home。真实家庭的光照、家具、物品千差万别，实验室训出的策略搬进家里常常失灵，而在家里采机器人数据又很贵。团队做了一个叫 Stick 的示范工具：25 美元的长柄取物夹加几个 3D 打印件和一部 iPhone，普通人拿着它干活就能录下演示。他们用它在纽约 22 户人家录了 13 小时数据（HoNY 数据集），用自监督学习预训练出视觉表征 HPR（基于 ResNet-34），再部署到商用移动机器人 Hello Robot Stretch 上，新任务只需少量示范加短时间微调。代码、数据、模型和硬件设计全部开源，是「手持夹爪采集」路线的早期代表，同团队后来又做了 Robot Utility Models。","example":"在纽约地区 10 户家庭约 30 天的实验中，Dobb·E 共尝试 109 个家务任务，每个新任务只用 5 分钟示范加 15 分钟模型适配，整体成功率 81%。","related":["手持夹爪采集","通用操作接口","Hello Robot Stretch","家务任务","预训练视觉表征","Robot Utility Models"]},{"id":"mobile-aloha","category":"named_model","sec":3,"tier":1,"sources":[{"title":"Mobile ALOHA (arXiv 2401.02117)","url":"https://arxiv.org/abs/2401.02117"},{"title":"Mobile ALOHA 项目主页","url":"https://mobile-aloha.github.io/"}],"as_of":"2024-01","related_ids":["aloha","action-chunking-with-transformers","mobile-manipulation","co-training","whole-body-teleoperation","agilex-robotics"],"name":"Mobile ALOHA","alt":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","abbr":"","aliases":["移动 ALOHA"],"one_liner":"斯坦福 2024 年把 ALOHA 双臂装上移动底盘，做低成本全身遥操作和模仿学习。","explanation":"Mobile ALOHA 是斯坦福 Zipeng Fu、Tony Zhao 和 Chelsea Finn 于 2024 年 1 月发布的工作，发表于 CoRL 2024。它把原本固定在桌上的双臂平台 ALOHA 装到松灵 Tracer 移动底盘上，操作员腰部与底盘相连、走动时带着底盘移动，双手操纵主臂，同时遥控双臂和底盘；整套硬件预算约 3.2 万美元。动作是 16 维：双臂 14 个关节位置加底盘的线速度和角速度。它要解决的是移动操作（边移动边用双手干活）的数据采集和学习问题。论文另一个结论是协同训练：把新的移动数据和已有的静态 ALOHA 数据一起训练，成功率最多提升 90%，每个任务约 50 条演示即可。策略直接用 ACT、扩散策略等现成的模仿学习方法。","example":"Mobile ALOHA 自主完成过炒虾并装盘、打开双开门壁柜放入重锅、呼叫并进入电梯、用水龙头冲洗用过的平底锅等任务。","related":["ALOHA 双臂平台","ACT","移动操作","协同训练","全身遥操作","松灵机器人"]},{"id":"aloha-unleashed","category":"named_model","sec":3,"tier":3,"sources":[{"title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity (arXiv 2410.13126)","url":"https://arxiv.org/abs/2410.13126"},{"title":"ALOHA Unleashed 项目页","url":"https://aloha-unleashed.github.io/"},{"title":"Proceedings of The 8th Conference on Robot Learning, PMLR 270","url":"https://proceedings.mlr.press/v270/zhao25b.html"}],"as_of":"2024-10","related_ids":["aloha-2","diffusion-policy","action-chunking-with-transformers","bimanual-manipulation","imitation-learning","mobile-aloha"],"name":"ALOHA Unleashed","alt":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","abbr":"","aliases":["ALOHA Unleashed 配方"],"one_liner":"DeepMind 2024 年的工作：大量遥操作数据加扩散策略，让双臂学会系鞋带。","explanation":"ALOHA Unleashed 是 Google DeepMind 的 Tony Zhao、Ayzaan Wahid、Chelsea Finn 等人的工作，发表于 CoRL 2024，想回答只靠模仿学习能把双臂灵巧操作推到多难。做法很朴素，所以叫「配方」：在低成本双臂平台 ALOHA 2 上，35 名操作员按统一规程遥操作，为 5 个真实任务采了 2.6 万多条演示；策略是 Transformer 编码器-解码器加扩散损失（即扩散策略），一次预测未来 50 步动作，约 2.17 亿参数。机器人由此能自主系鞋带、把衬衫挂上衣架、给另一台机器人换手指。论文还发现，同等规模的模型改用 ACT 式 L1 回归，衬衫任务成功率从 70% 降到 25%。","example":"系鞋带任务：机器人先把鞋摆到桌子中央、理直鞋带，再打出一个蝴蝶结。鞋放正、鞋带摊开时成功率 70%；鞋可偏转 ±45°、鞋带未整理时成功率 40%。","related":["ALOHA 2","扩散策略","ACT","双臂操作","模仿学习","Mobile ALOHA"]},{"id":"3d-diffuser-actor","category":"named_model","sec":3,"tier":3,"sources":[{"title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations (arXiv 2402.10885)","url":"https://arxiv.org/abs/2402.10885"},{"title":"3D Diffuser Actor 项目页","url":"https://3d-diffuser-actor.github.io/"}],"as_of":"2024-07","related_ids":["diffusion-policy","3d-diffusion-policy","peract","rlbench","calvin-benchmark","keyframe-action-prediction"],"name":"3D Diffuser Actor","alt":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","abbr":"","aliases":["3D扩散执行器"],"one_liner":"把扩散策略和 3D 场景表征结合、生成机械臂末端轨迹的模仿学习策略。","explanation":"3D Diffuser Actor 由卡内基梅隆大学 Katerina Fragkiadaki 组（柯宗纬、Nikolaos Gkanatsios）2024 年 2 月提出，发表于 CoRL 2024。此前两条路线各有长处：扩散策略能表达多种可行做法（动作多峰性）；3D 策略用深度把多视角图像融成 3D 特征，换相机视角时更稳。它把两者合一：把图像特征按深度抬升成 3D 点，用带 3D 相对位置注意力的去噪 Transformer，结合语言指令和本体状态，逐步给加了噪声的末端位姿轨迹去噪。发布时在 RLBench 多视角设定上比此前最好方法的成功率绝对提高 18.1 个百分点，单视角提高 13.1 个百分点，在 CALVIN 上相对提升 9%；真机上用 Franka 机械臂、每个任务十几条示教学会 12 个任务。","example":"在 RLBench 的「打开抽屉」任务里，它从多个 RGB-D 相机建出场景的 3D 特征点，从随机噪声出发反复去噪，得到机械臂下一个关键位姿（把手前方的位置和夹爪朝向）。","related":["扩散策略","3D 扩散策略","PerAct","RLBench","CALVIN","关键帧动作预测"]},{"id":"3d-diffusion-policy","category":"named_model","sec":3,"tier":2,"sources":[{"title":"3D Diffusion Policy (arXiv 2403.03954)","url":"https://arxiv.org/abs/2403.03954"},{"title":"3D Diffusion Policy 项目主页","url":"https://3d-diffusion-policy.github.io/"}],"as_of":"2024-09","related_ids":["diffusion-policy","point-cloud","point-cloud-encoder","idp3","imitation-learning","shanghai-qi-zhi-institute"],"name":"3D 扩散策略","alt":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","abbr":"DP3","aliases":["DP3","3D Diffusion Policy"],"one_liner":"把稀疏点云作为输入的扩散策略，少量演示就能学会操作，发表于 RSS 2024。","explanation":"3D 扩散策略（DP3）由上海期智研究院、清华大学交叉信息研究院许华哲组联合上海交大、上海 AI 实验室的研究者（第一作者 Yanjie Ze）于 2024 年 3 月提出，发表于 RSS 2024。它在扩散策略的基础上，把输入从 2D 图像换成深度相机得到的稀疏点云（一组带三维坐标的点），用一个轻量的点云编码器压成紧凑的 3D 特征，再以它为条件去噪生成动作。3D 表示直接包含物体的位置和几何，对视角、外观变化更不敏感，所以需要的演示更少。论文在 72 个仿真任务上每个任务只用 10 条演示，相对基线提升 24.2%；4 个真机任务每个 40 条演示，成功率 85%，而且很少出现违反安全要求的动作。后续的 iDP3 把它扩展到人形机器人。","example":"真机实验包括用 Allegro 灵巧手或夹爪卷橡皮泥、包橡皮泥「饺子」、拿电钻触碰方块、倒肉松，每个任务 40 条演示。","related":["扩散策略","点云","点云编码器","iDP3","模仿学习","上海期智研究院"]},{"id":"idp3","category":"named_model","sec":3,"tier":3,"sources":[{"title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies (arXiv 2410.10803)","url":"https://arxiv.org/abs/2410.10803"},{"title":"Project page","url":"https://humanoid-manipulation.github.io/"},{"title":"YanjieZe/Improved-3D-Diffusion-Policy (GitHub)","url":"https://github.com/YanjieZe/Improved-3D-Diffusion-Policy"}],"as_of":"2025-09","related_ids":["3d-diffusion-policy","diffusion-policy","point-cloud","humanoid-robot","fourier-gr-1","vr-teleoperation"],"name":"iDP3","alt":"Improved 3D Diffusion Policy (Generalizable Humanoid Manipulation with 3D Diffusion Policies)","abbr":"iDP3","aliases":["Improved 3D Diffusion Policy","改进版 3D 扩散策略"],"one_liner":"改进版 3D 扩散策略，让人形机器人在单一场景采数据后泛化到新场景","explanation":"斯坦福大学 Yanjie Ze、Jiajun Wu 等联合 SFU、UPenn、UIUC、CMU 2024 年 10 月发布，发表于 IROS 2025，是 3D 扩散策略（DP3）的改进版。原 DP3 在世界坐标系下处理点云，需要相机标定和点云分割裁剪，不适合头部相机随身体移动的人形机器人。iDP3 改用相机坐标系下的「自我中心」3D 点云，免去标定和分割，同时扩大输入点云规模、改进视觉编码器、加长动作预测视界。配套系统包括基于 Apple Vision Pro 的上半身遥操作，以及装在升降推车上的 25 自由度傅利叶 GR1 人形平台（RealSense L515 深度相机）。只用一个场景采集的数据，机器人靠机载算力就能在多种新场景完成任务。","example":"只在一个场景采集演示数据训练的策略，部署后能在其他没见过的真实场景里完成同类操作。","related":["3D 扩散策略","扩散策略","点云","人形机器人","傅利叶 GR-1","VR 遥操作"]},{"id":"consistency-policy","category":"named_model","sec":3,"tier":3,"sources":[{"title":"Consistency Policy (arXiv:2405.07503)","url":"https://arxiv.org/abs/2405.07503"},{"title":"Consistency Policy 项目主页（RSS 2024）","url":"https://consistency-policy.github.io/"}],"as_of":"2024-06","related_ids":["diffusion-policy","consistency-model","one-step-generation","knowledge-distillation","inference-latency","conrft"],"name":"Consistency Policy（一致性策略）","alt":"Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation","abbr":"","aliases":["一致性策略","Consistency Policy"],"one_liner":"把扩散策略蒸馏成一步就能出动作的快速视觉运动策略。","explanation":"斯坦福 Jeannette Bohg 组（一作 Aaditya Prasad）与普林斯顿的 Jimmy Wu 等人 2024 年 5 月提出，发表于 RSS 2024。扩散策略（Diffusion Policy）动作质量好，但每次出动作要去噪几十上百步，在笔记本 GPU 或机载电脑上太慢。Consistency Policy 以训练好的扩散策略为「老师」，用一致性轨迹模型（CTM）的目标做蒸馏：要求学生网络从去噪轨迹上任意一点出发都能跳到同一个终点（即「自一致性」），推理时一步就能生成整段动作。论文在 Robomimic、Push-T、Franka Kitchen 共 6 个仿真任务和 3 个真机任务上测试，推理比同类方法快一个数量级，成功率基本持平。它是扩散策略提速路线的代表，ConRFT 等后续工作也用它当策略骨架。","example":"真机实验里，机器人只用笔记本级 GPU 运行 Consistency Policy 完成插插头、收拾垃圾等任务，用单步生成代替扩散策略的多步去噪。","related":["扩散策略","一致性模型","单步生成","知识蒸馏","推理延迟","ConRFT"]},{"id":"rvt-2","category":"named_model","sec":3,"tier":3,"sources":[{"title":"RVT-2: Learning Precise Manipulation from Few Demonstrations (arXiv 2406.08545)","url":"https://arxiv.org/abs/2406.08545"},{"title":"RVT-2 project page","url":"https://robotic-view-transformer-2.github.io/"}],"as_of":"2024-06","related_ids":["peract","keyframe-action-prediction","multi-view","rlbench","peg-in-hole-insertion","few-shot"],"name":"RVT-2","alt":"RVT-2: Learning Precise Manipulation from Few Demonstrations (Robotic View Transformer 2)","abbr":"RVT-2","aliases":["Robotic View Transformer 2"],"one_liner":"英伟达的多视角 3D 操作策略，每个任务约 10 条演示就能学会毫米级插装","explanation":"英伟达研究团队（Ankit Goyal、Dieter Fox 等）2024 年 6 月发布，发表于 RSS 2024，是 RVT（Robotic View Transformer）的升级版。这类方法先把 RGB-D 相机得到的点云重新渲染成几张虚拟视角图像，由 Transformer 在这些图上预测下一个关键位姿（夹爪该到的位置、朝向和开合），再交给运动规划器去执行。RVT-2 采用由粗到细的多阶段推理：先在整个场景里找到大致区域，再放大该区域做精确预测；同时让旋转预测以位置为条件，并用自研渲染器和更高效的训练实现提速。结果是训练比 RVT 快 6 倍、推理快 2 倍，RLBench 多任务成功率从 65% 提到 82%；真机上只用一台 RGB-D 相机、每个任务约 10 条演示，就能完成插销、插插头这类需要毫米级精度的任务。","example":"在真实机械臂上为「把销钉插进孔里」录大约 10 次演示，RVT-2 就能学会对准只留很小间隙的孔完成插入。","related":["PerAct","关键帧动作预测","多视角","RLBench","轴孔装配","少样本"]},{"id":"robot-utility-models","category":"named_model","sec":3,"tier":3,"sources":[{"title":"arXiv 2409.05865: Robot Utility Models","url":"https://arxiv.org/abs/2409.05865"},{"title":"Robot Utility Models 项目主页","url":"https://robotutilitymodels.com/"}],"as_of":"2024-09","related_ids":["zero-shot","scene-generalization","handheld-gripper-data-collection","dobb-e","behavior-transformer","specialist-policy"],"name":"Robot Utility Models","alt":"Robot Utility Models: General Policies for Zero-Shot Deployment in New Environments","abbr":"RUM","aliases":["RUM","RUMs","机器人效用模型"],"one_liner":"不用微调就能在陌生家里执行开柜门、开抽屉等单项任务的策略","explanation":"Robot Utility Models（RUM）由纽约大学、Hello Robot 和 Meta 的研究者在 2024 年 9 月发布。它针对的问题是：机器人策略换个房间通常就得重新采数据、微调，而语言和视觉模型可以拿来即用。作者为开柜门、开抽屉、拿纸巾、拿纸袋、扶正倒下的物体 5 个任务各训练一个专用策略：用装着 iPhone 的手持采集夹 Stick-v2，每个任务在约 40 个环境里采约 1000 条演示，策略结构选用 VQ-BeT；部署时再用 GPT-4o 判断是否成功，失败就重试。结果在未见过的环境和物体上成功率约 90%，并能迁移到 xArm 等其他机器人。作者的主要结论是数据的多样性比训练算法和策略结构更关键。代码、数据和硬件设计均已开源。","example":"把 RUM 的开柜门策略装到 Hello Robot Stretch 上，放进一间从没采过数据的公寓，不做任何微调就去开厨房柜门。","related":["零样本","场景泛化","手持夹爪采集","Dobb·E","BeT / VQ-BeT","专用策略"]},{"id":"3d-vitac","category":"named_model","sec":3,"tier":3,"sources":[{"title":"3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing (arXiv 2410.24091)","url":"https://arxiv.org/abs/2410.24091"},{"title":"3D-ViTac 项目页","url":"https://binghao-huang.github.io/3D-ViTac/"}],"as_of":"2024-10","related_ids":["visuo-tactile-fusion","tactile-sensor","diffusion-policy","point-cloud","3d-diffusion-policy","bimanual-manipulation"],"name":"3D-ViTac","alt":"3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing","abbr":"","aliases":[],"one_liner":"把低成本触觉传感器读数和视觉点云放进同一 3D 空间来学精细操作的系统。","explanation":"3D-ViTac 由哥伦比亚大学、UIUC 和华盛顿大学的研究者（一作黄炳豪，导师李云竺）2024 年 10 月提出，发表于 CoRL 2024。只靠相机时，夹爪挡住物体或需要判断捏多紧，视觉信息就不够。它在软夹爪指面贴上柔性压阻式触觉垫：每块 16×16 共 256 个感应单元，每个约 3 平方毫米，厚度不到 1 毫米，成本约 20 美元，双臂四指共 1024 个单元。关键做法是用机器人运动学算出每个触觉单元的 3D 位置，把读数变成「触觉点」，和相机点云合成一个点云，再用扩散策略做模仿学习。在蒸鸡蛋、备葡萄、收集内六角扳手、递三明治四个长程任务上，整体成功率 80%–90%，纯视觉版本只有 45%–60%。","example":"夹鸡蛋时，相机看不出用了多大力，触觉点直接显示接触位置和压力，策略据此轻轻夹住而不捏碎；在手里调整内六角扳手朝向时，触觉点告诉策略扳手现在是什么姿态。","related":["视触觉融合","触觉传感器","扩散策略","点云","3D 扩散策略","双臂操作"]},{"id":"octo","category":"named_model","sec":4,"tier":2,"sources":[{"title":"Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)","url":"https://arxiv.org/abs/2405.12213"},{"title":"Octo 项目主页","url":"https://octo-models.github.io/"},{"title":"RSS 2024 论文页（Robotics: Science and Systems XX, p090）","url":"https://www.roboticsproceedings.org/rss20/p090.html"}],"as_of":"2024-07","related_ids":["open-x-embodiment","generalist-policy","diffusion-action-head","cross-embodiment","openvla","rt-x"],"name":"Octo","alt":"Octo: An Open-Source Generalist Robot Policy","abbr":"","aliases":["Octo-Small","Octo-Base"],"one_liner":"2024 年开源的通用机器人策略，在 80 万条跨本体轨迹上预训练，可快速微调到新机器人。","explanation":"Octo 由 UC Berkeley、斯坦福、CMU 和 Google DeepMind 研究者组成的 Octo Model Team 于 2024 年 5 月发布，发表于 RSS 2024。它是基于 Transformer 的通用策略，在 Open X-Embodiment（多家机构汇集的跨本体机器人数据集）的 25 个子数据集、约 80 万条轨迹上预训练，有 Octo-Small（2700 万参数）和 Octo-Base（9300 万参数）两个版本。任务可以用语言指令，也可以用一张目标图像指定；Transformer 主干读入任务和观测 token，再由扩散动作头输出连续动作，能表达多峰的动作分布。它的重点是开放和好改：代码、权重、训练流程全部公开，输入输出模块化，在消费级 GPU 上几小时就能微调到新的传感器和动作空间。在 6 个微调评测场景上平均比次优基线高 52%，后来常被 OpenVLA 等工作拿来做对比基线。","example":"在「Berkeley Bimanual」任务里，只在单臂数据上预训练的 Octo 被微调到由两条 ViperX 机械臂组成的 ALOHA 双臂平台：右手从桌上拿起记号笔、左手拔下笔帽，动作空间也换成了关节位置控制。","related":["Open X-Embodiment 数据集","通用策略","扩散动作头","跨本体","OpenVLA","RT-X"]},{"id":"openvla","category":"named_model","sec":4,"tier":1,"sources":[{"title":"OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)","url":"https://arxiv.org/abs/2406.09246"},{"title":"OpenVLA 项目主页","url":"https://openvla.github.io/"}],"as_of":"2024-09","related_ids":["vision-language-action-model","rt-2","open-x-embodiment","prismatic-vlms","openvla-oft","lora"],"name":"OpenVLA","alt":"OpenVLA: An Open-Source Vision-Language-Action Model","abbr":"","aliases":["OpenVLA-7B"],"one_liner":"斯坦福、伯克利等 2024 年开源的 70 亿参数视觉-语言-动作模型。","explanation":"OpenVLA 由斯坦福、UC Berkeley、丰田研究院、谷歌 DeepMind、Physical Intelligence 和 MIT 的研究者于 2024 年 6 月发布，发表于 CoRL 2024。它以 Prismatic 视觉语言模型为底座：视觉编码器融合 SigLIP 和 DINOv2 两种特征，语言模型是 Llama 2 7B，总参数约 70 亿。动作沿用 RT-2 的做法，把每个动作维度离散成 256 个区间，当作 token 让语言模型逐个预测。它在 Open X-Embodiment 数据集的 97 万条机器人轨迹上训练，在 29 个任务上比 550 亿参数的闭源 RT-2-X 绝对成功率高 16.5%。更重要的是代码和权重完全开源，可以用 LoRA（低秩适配，只训练少量新增参数）在消费级显卡上微调，因而成为很多后续 VLA 研究的起点和对比基线，如 OpenVLA-OFT。","example":"把 OpenVLA 适配到新的机械臂和任务时，用 LoRA 只训练约 1.4% 的参数，就能达到与全参数微调相当的效果。","related":["视觉-语言-动作模型","RT-2","Open X-Embodiment 数据集","Prismatic VLM","OpenVLA-OFT","低秩适配"]},{"id":"openvla-oft","category":"named_model","sec":4,"tier":2,"sources":[{"title":"OpenVLA-OFT 项目主页","url":"https://openvla-oft.github.io/"},{"title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (arXiv:2502.19645)","url":"https://arxiv.org/abs/2502.19645"}],"as_of":"2025-04","related_ids":["openvla","vision-language-action-model","action-chunking","parallel-decoding","feature-wise-linear-modulation","libero-benchmark"],"name":"OpenVLA-OFT","alt":"OpenVLA-OFT (Optimized Fine-Tuning recipe for VLAs)","abbr":"OFT","aliases":["OFT","OpenVLA-OFT+","VLA 优化微调配方"],"one_liner":"斯坦福提出的 VLA 微调配方，让 OpenVLA 动作生成快 26 倍、成功率更高。","explanation":"OpenVLA-OFT 是斯坦福 Moo Jin Kim、Chelsea Finn、Percy Liang 在 2025 年 2 月提出的 VLA 微调配方。原版 OpenVLA 把动作离散成 token 逐个自回归输出，推理慢，难做高频控制。OFT 在微调时改了四处：并行解码（一次前向算出全部动作）、动作分块（一次预测多步）、连续动作表示、L1 回归损失；OFT+ 再加 FiLM 特征调制，加强对语言指令的跟随。结果 LIBERO 平均成功率从 76.5% 提到 97.1%，动作生成吞吐提升 26 倍，在 ALOHA 双臂真机上也胜过 π0、RDT-1B 等微调后的 VLA。它常被当作 VLA 微调的强基线。","example":"在 LIBERO 上微调 OpenVLA 时，把输出从逐个吐出的离散动作 token 改成一次前向回归出一整段连续动作，推理吞吐大幅提升，成功率也更高。","related":["OpenVLA","视觉-语言-动作模型","动作分块","并行解码","FiLM 特征调制","LIBERO"]},{"id":"crossformer","category":"named_model","sec":4,"tier":3,"sources":[{"title":"Scaling Cross-Embodied Learning / CrossFormer (arXiv:2408.11812)","url":"https://arxiv.org/abs/2408.11812"},{"title":"CrossFormer 项目主页（CoRL 2024 Oral）","url":"https://crossformer-model.github.io/"}],"as_of":"2024-08","related_ids":["cross-embodiment","octo","embodiment-specific-head","open-x-embodiment","heterogeneous-pre-trained-transformers","action-chunking"],"name":"CrossFormer","alt":"CrossFormer: Scaling Cross-Embodied Learning (One Policy for Manipulation, Navigation, Locomotion and Aviation)","abbr":"","aliases":["Scaling Cross-Embodied Learning"],"one_liner":"一套权重同时控制单臂、双臂、四足、无人车和无人机的跨本体 Transformer 策略。","explanation":"伯克利 Sergey Levine 组与 CMU 2024 年 8 月提出，CoRL 2024 口头报告。不同机器人的相机数量、本体感知、动作维度和控制频率各不相同，以往跨本体训练常要手工对齐观测和动作空间，或丢掉部分输入。CrossFormer 把多路相机图像、本体感知和任务（语言或目标图像）都切成 token 排成序列，送进所有本体共享的仅解码器 Transformer；序列里插入读出 token（readout token），再按本体类别接不同的动作头，输出对应维度的动作块，如单臂 7 维末端增量、双臂 14 维关节位置、导航 2 维路点。模型约 1.3 亿参数，在 20 种本体、90 万条轨迹上训练，真机上与各本体的专用策略相当，并明显超过此前的跨本体方法。","example":"同一个 CrossFormer：接 WidowX 单臂时一次输出 4 步 7 维末端动作，接 ALOHA 双臂时一次输出 100 步 14 维关节位置，接 Go1 四足时每步输出 12 维关节目标。","related":["跨本体","Octo","本体专属头","Open X-Embodiment 数据集","异构预训练 Transformer","动作分块"]},{"id":"heterogeneous-pre-trained-transformers","category":"named_model","sec":4,"tier":3,"sources":[{"title":"Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers (arXiv 2409.20537)","url":"https://arxiv.org/abs/2409.20537"},{"title":"HPT 项目页","url":"https://liruiw.github.io/hpt/"}],"as_of":"2024-12","related_ids":["cross-embodiment","heterogeneous-data","pre-training","embodiment-specific-head","scaling-law","open-x-embodiment"],"name":"异构预训练 Transformer","alt":"Heterogeneous Pre-trained Transformers","abbr":"HPT","aliases":["HPT"],"one_liner":"MIT 何恺明团队 2024 年提出，用共享主干网络统一预训练各种机器人数据。","explanation":"HPT 由 MIT CSAIL 的 Lirui Wang、何恺明与 Meta FAIR 的陈鑫磊等人 2024 年 9 月发布，发表于 NeurIPS 2024（Spotlight）。机器人数据很「异构」：不同机器人的相机数量、关节数、控制方式都不同，很难放进一个模型一起训练。HPT 把网络拆成三段：每种本体配一个小的 stem（编码器），把本体感知和图像转成固定数量的 token；中间是一个大的共享 Transformer 主干（trunk），学习与本体、任务无关的表示；输出端的 head 按任务把表示映射成动作。预训练用了 50 多个数据集、约 20 万条轨迹，来源包括真机遥操作、仿真、人类视频和已部署的机器人。","example":"把预训练好的主干接到一台新机器人上，只需为它训练新的 stem 和 head；作者报告在多个仿真基准和真机的未见任务上，微调后策略性能提升 20% 以上。","related":["跨本体","异构数据","预训练","本体专属头","缩放定律","Open X-Embodiment 数据集"]},{"id":"rdt-1b","category":"named_model","sec":4,"tier":2,"sources":[{"title":"RDT-1B 项目主页","url":"https://rdt-robotics.github.io/rdt-robotics/"}],"as_of":"2024-10","related_ids":["diffusion-policy","diffusion-transformer","bimanual-manipulation","unified-action-space","action-multimodality","rdt2"],"name":"RDT-1B","alt":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation (Robotics Diffusion Transformer)","abbr":"RDT","aliases":["RDT","Robotics Diffusion Transformer"],"one_liner":"清华 2024 年发布的约 12 亿参数双臂操作扩散基础模型。","explanation":"RDT-1B（Robotics Diffusion Transformer）是清华大学团队 2024 年 10 月发布的机器人扩散基础模型，约 12 亿参数。双臂操作里同一局面常有多种合理做法（动作多峰），直接回归容易取平均而出错，RDT 用扩散 Transformer 逐步去噪生成一段动作来建模这种分布。为了用上各家机器人的数据，它设计了「物理可解释的统一动作空间」，把不同机器人的关节角、末端位姿等物理量放进统一向量里的固定位置。模型先在 46 个数据集、100 万条以上轨迹上预训练，再用 6000 多条 ALOHA 双臂数据微调，1–5 条演示就能学会新技能。后续版本是 RDT2。","example":"只给 1–5 条演示，RDT-1B 就能在 ALOHA 双臂机器人上学会一个新的双臂操作；遇到没见过的物体和场景也能零样本执行。","related":["扩散策略","扩散 Transformer","双臂操作","统一动作空间","动作多峰性","RDT2"]},{"id":"rdt2","category":"named_model","sec":4,"tier":3,"sources":[{"title":"RDT2 project page","url":"https://rdt-robotics.github.io/rdt2/"},{"title":"RDT2 (arXiv 2602.03310)","url":"https://arxiv.org/abs/2602.03310"}],"as_of":"2026-02","related_ids":["rdt-1b","universal-manipulation-interface","handheld-gripper-data-collection","cross-embodiment","flow-matching","vector-quantization"],"name":"RDT2","alt":"RDT2 (Robotics Diffusion Transformer 2): Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization","abbr":"","aliases":["RDT2-VQ","RDT2-FM","Robotics Diffusion Transformer 2"],"one_liner":"清华用上万小时 UMI 数据训练、可零样本换机械臂部署的 VLA 基础模型","explanation":"清华大学朱军团队（RDT 团队）2025 年 9 月开源，论文 2026 年 2 月发布，是 RDT-1B 的后续。它想解决换一台机械臂就得重新采数据微调的问题：团队改进了手持夹爪采集设备 UMI（通用操作接口），在约 100 个地点（多为真实家庭）采了一万多小时演示；采集和部署用统一的 UMI 夹爪，本体差异很小。模型以 70 亿参数的 Qwen2.5-VL 为骨干，三阶段训练：先用残差向量量化把动作变成离散 token（RDT2-VQ），再换成约 4 亿参数的动作专家输出连续动作（RDT2-FM），最后蒸馏加速。官方称它是首个能在没见过的本体上零样本完成抓取放置等简单任务的基础模型，还演示了打乒乓球。","example":"把 RDT2-FM 直接接到一台训练时没用过的机械臂上，装上 UMI 同款夹爪，不经微调就能按语言指令抓取放置物体。","related":["RDT-1B","通用操作接口","手持夹爪采集","跨本体","流匹配","向量量化"]},{"id":"robomamba","category":"named_model","sec":4,"tier":3,"sources":[{"title":"arXiv 2406.04339: RoboMamba","url":"https://arxiv.org/abs/2406.04339"},{"title":"RoboMamba 项目主页","url":"https://sites.google.com/view/robomamba-web"}],"as_of":"2024-12","related_ids":["mamba","state-space-model","vision-language-action-model","inference-latency","end-effector-pose","parameter-efficient-fine-tuning"],"name":"RoboMamba","alt":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","abbr":"","aliases":[],"one_liner":"用 Mamba 状态空间模型替代 Transformer 做语言骨干的高效 VLA","explanation":"RoboMamba 由北京大学联合智平方、北京智源人工智能研究院在 2024 年 6 月发布，NeurIPS 2024 录用。当时的 VLA 多以 Transformer 大语言模型为骨干，推理慢、算力贵。RoboMamba 改用 Mamba（一种选择性状态空间模型，计算量随序列长度线性增长）作语言模型，接上视觉编码器，先做对齐预训练和通用、机器人指令数据的协同训练，让它具备推理能力；再冻结整个模型，只加一个很小的策略头（约占模型参数 0.1%）预测末端执行器的 SE(3) 位姿，即位置和朝向。论文报告其推理速度约为已有 VLA 的 3 倍，在仿真和真机上的位姿预测也有竞争力。","example":"RoboMamba 既能回答「桌上哪个东西能用来盛水」这类推理问题，也能在收到操作指令后输出夹爪应到达的位置和朝向。","related":["Mamba","状态空间模型","视觉-语言-动作模型","推理延迟","末端位姿","参数高效微调"]},{"id":"tinyvla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"TinyVLA (arXiv 2409.12514)","url":"https://arxiv.org/abs/2409.12514"},{"title":"TinyVLA project page","url":"https://tiny-vla.github.io/"}],"as_of":"2025-05","related_ids":["vision-language-action-model","openvla","diffusion-policy","lora","inference-latency","dexvla"],"name":"TinyVLA","alt":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","abbr":"","aliases":["Tiny-VLA"],"one_liner":"用小型多模态模型加扩散策略头、不做机器人数据预训练的快速 VLA","explanation":"美的集团 AI Lab 与华东师范大学等（Junjie Wen、Yichen Zhu 等）2024 年 9 月发布，发表于 IEEE RA-L 2025。当时的 OpenVLA 等模型推理慢，还要先在大规模机器人数据上预训练。TinyVLA 的做法是：先按 LLaVA 流程训练一族以 Pythia 为语言模型、参数 7000 万到 14 亿的小型视觉语言模型，作为策略骨干；在机器人数据上微调时冻结预训练部分，只用 LoRA 训练约 5% 的参数，并接一个扩散策略解码器直接输出连续动作。在 Franka 单臂和双臂 UR5 真机上，最大的 TinyVLA-H 成功率比 OpenVLA 高 25.7%，参数少 5.5 倍，推理延迟低约 20 倍。同一团队之后又做了 DexVLA。","example":"在双臂 UR5 任务上，依赖单臂 Open X-Embodiment 数据预训练的 OpenVLA 表现吃力，而不做机器人预训练、直接微调的 TinyVLA 表现更好。","related":["视觉-语言-动作模型","OpenVLA","扩散策略","低秩适配","推理延迟","DexVLA"]},{"id":"cogact","category":"named_model","sec":4,"tier":3,"sources":[{"title":"CogACT (arXiv 2411.19650)","url":"https://arxiv.org/abs/2411.19650"},{"title":"CogACT 项目主页","url":"https://cogact.github.io/"}],"as_of":"2024-11","related_ids":["vision-language-action-model","diffusion-action-head","action-expert","openvla","prismatic-vlms","temporal-ensembling"],"name":"CogACT","alt":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","abbr":"","aliases":[],"one_liner":"在 VLM 后面接扩散 Transformer 动作模块的开源 VLA 模型。","explanation":"CogACT 是微软亚洲研究院联合清华大学、中国科学技术大学等 2024 年 11 月发布的视觉-语言-动作模型。当时 OpenVLA 等让 VLM 直接输出离散动作 token，精度和连续性受限。CogACT 把认知和动作拆开：用 Prismatic-7B 这类 VLM 理解图像和指令，输出一个认知特征；再用最多约 3 亿参数的扩散 Transformer（DiT）动作模块，以该特征为条件生成连续动作序列。推理时用自适应动作集成，只把相似的动作预测做平均，避免把不同模式混在一起。它在 Open X-Embodiment 的约 40 万条轨迹上训练，SIMPLER 仿真中比 OpenVLA 高 35% 以上、真机高 55%，仿真还超过 55B 参数的 RT-2-X。","example":"研究者在 Realman 和 Franka 两种真实机械臂上测试 CogACT，面对没见过的物体和背景仍能完成操作任务。","related":["视觉-语言-动作模型","扩散动作头","动作专家","OpenVLA","Prismatic VLM","时序集成"]},{"id":"tracevla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"TraceVLA (arXiv 2412.10345)","url":"https://arxiv.org/abs/2412.10345"},{"title":"TraceVLA project page","url":"https://tracevla.github.io/"}],"as_of":"2025-01","related_ids":["openvla","visual-prompting","tracking-any-point","cotracker","simplerenv","vision-language-action-model"],"name":"TraceVLA","alt":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","abbr":"","aliases":["视觉轨迹提示 VLA","Visual Trace Prompting"],"one_liner":"把画面中关键点的历史运动轨迹画在图上当提示，增强 VLA 时空理解的方法","explanation":"马里兰大学与微软研究院（Ruijie Zheng、Jianwei Yang 等）2024 年 12 月发布，发表于 ICLR 2025。VLA 通常只看当前一帧，不知道机器人和物体刚才怎么动过。TraceVLA 提出「视觉轨迹提示」：用点跟踪模型 CoTracker 追踪画面中关键点过去若干帧的运动，把轨迹直接画在图像上，再把原图和叠加了轨迹的图一起输入模型。作者用这种方式在自己收集的 15 万条操作轨迹上微调 OpenVLA，得到 TraceVLA：在 SimplerEnv 的 137 种配置上比 OpenVLA 高约 10%，在 WidowX 真机 4 个任务上达到其 3.5 倍。另有基于 40 亿参数 Phi-3-Vision 的小版本，效果接近 70 亿参数的 OpenVLA。","example":"机械臂正在把勺子挪向毛巾，输入图上叠着夹爪和勺子前几步的彩色轨迹线，模型据此判断运动方向和进度，决定下一步动作。","related":["OpenVLA","视觉提示","任意点跟踪","CoTracker","SimplerEnv","视觉-语言-动作模型"]},{"id":"robovlms","category":"named_model","sec":4,"tier":3,"sources":[{"title":"arXiv 2412.14058: RoboVLMs","url":"https://arxiv.org/abs/2412.14058"},{"title":"RoboVLMs 项目主页","url":"https://robovlms.github.io/"}],"as_of":"2026-02","related_ids":["vision-language-action-model","roboflamingo","action-head","cross-embodiment-data","paligemma","ablation-study"],"name":"RoboVLMs","alt":"RoboVLMs (What Matters in Building Vision-Language-Action Models for Generalist Robots)","abbr":"","aliases":["Towards Generalist Robot Policies: What Matters in Building Vision-Language-Action Models"],"one_liner":"系统比较 VLA 骨干、结构和训练数据该怎么选的实验研究与开源框架","explanation":"RoboVLMs 由清华大学、字节跳动研究院、中科院自动化所、上海交通大学、新加坡国立大学等在 2024 年 12 月发布，既是一篇系统实验研究，也是同名开源框架，可以方便地把新的视觉语言模型接成 VLA。它回答搭 VLA 时的几个关键选择：选哪个 VLM 骨干、动作输出和历史信息怎么组织、跨本体数据什么时候加入。作者比较了 8 种以上 VLM 骨干和 4 种策略结构，跑了 600 多组实验。主要结论包括：用连续动作的独立策略头、并输入多帧历史的结构表现最好；视觉-语言预训练充分的骨干（如 KosMos、PaliGemma）明显更好；先用跨本体数据预训练更有助于鲁棒性。最佳配置在 CALVIN 上平均连续完成 4.49 个任务。","example":"想试一个新的视觉语言模型做 VLA 骨干时，可以在 RoboVLMs 框架里只替换骨干，其余设置不变，直接与 KosMos、PaliGemma 版本在 CALVIN 上对比。","related":["视觉-语言-动作模型","RoboFlamingo","动作头","跨本体数据","PaliGemma","消融实验"]},{"id":"uniact","category":"named_model","sec":4,"tier":3,"sources":[{"title":"Universal Actions for Enhanced Embodied Foundation Models (arXiv 2501.10105)","url":"https://arxiv.org/abs/2501.10105"},{"title":"UniAct project page","url":"https://2toinf.github.io/UniAct/"}],"as_of":"2025-03","related_ids":["unified-action-space","cross-embodiment","vector-quantization","embodiment-specific-head","openvla","latent-action"],"name":"UniAct（通用动作空间）","alt":"UniAct: Universal Actions for Enhanced Embodied Foundation Models","abbr":"UniAct","aliases":["Universal Actions","通用动作"],"one_liner":"用一套跨机器人共享的离散「通用动作」来训练具身基础模型的方法","explanation":"清华大学智能产业研究院（AIR，詹仙园团队）联合商汤、北大、北邮、上海人工智能实验室 2025 年 1 月发布，发表于 CVPR 2025。不同机器人的动作空间差别很大（关节数、控制方式、坐标系都不同），直接混训跨本体数据会互相干扰。UniAct 学一个「通用动作空间」：由视觉语言模型把观测和指令映射到一个向量量化码本里的离散通用动作，每个码代表不同机器人共有的原子行为；再给每种机器人配一个轻量的专属解码头，把通用动作翻译成具体控制指令。0.5B 参数的 UniAct 在多项真机和仿真评测中与 7B 的 OpenVLA 相当或更好；适配新机器人时，主要训练新的轻量解码头即可。","example":"在 WidowX、Franka 等多种机械臂数据上一起预训练后，换到一台新机械臂时只需训练一个小解码头，就能把通用动作翻译成它的控制指令。","related":["统一动作空间","跨本体","向量量化","本体专属头","OpenVLA","潜在动作"]},{"id":"hamster","category":"named_model","sec":4,"tier":3,"sources":[{"title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation (arXiv 2502.05485)","url":"https://arxiv.org/abs/2502.05485"},{"title":"HAMSTER 项目页","url":"https://hamster-robot.github.io/"}],"as_of":"2025-05","related_ids":["hierarchical-architecture","intermediate-representation","vision-language-action-model","rvt-2","3d-diffuser-actor","openvla"],"name":"HAMSTER（分层动作模型）","alt":"HAMSTER: Hierarchical Action Models for Open-World Robot Manipulation","abbr":"HAMSTER","aliases":["分层动作模型"],"one_liner":"英伟达等 2025 年的分层 VLA：高层画 2D 路径，底层 3D 策略照着做。","explanation":"HAMSTER 由英伟达、华盛顿大学、南加州大学的研究者 2025 年 2 月提出，发表于 ICLR 2025。常规 VLA 直接把视觉语言模型（VLM）微调成输出动作，只能用昂贵的真机数据训练。HAMSTER 把系统拆成两层：高层是微调过的 VLM（基于 VILA），看一张 RGB 图和任务描述，画出一条粗略的 2D 路径，表示末端执行器大致该怎么走；底层是能处理 3D 输入的控制策略（论文试了 RVT-2 和 3D Diffuser Actor），把这条路径当引导去做精确操作。高层只需输出 2D 路径，所以能用便宜的「域外数据」训练，比如无动作标签的视频、手绘草图、仿真数据；高层不管精细动作，底层不管任务推理，各做擅长的事。","example":"在真机上沿 7 个泛化维度（如新物体、新背景、新指令语义）测试，HAMSTER 比 OpenVLA 平均成功率高约 20%，相对提升约 50%。","related":["分层架构","中间表示","视觉-语言-动作模型","RVT-2","3D Diffuser Actor","OpenVLA"]},{"id":"dexvla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"DexVLA (arXiv:2502.05855)","url":"https://arxiv.org/abs/2502.05855"},{"title":"DexVLA 论文 HTML 全文 v3","url":"https://arxiv.org/html/2502.05855v3"}],"as_of":"2025-08","related_ids":["vision-language-action-model","action-expert","diffusion-action-head","cross-embodiment","pi0","qwen-vl"],"name":"DexVLA","alt":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","abbr":"","aliases":[],"one_liner":"美的等提出的 VLA：视觉语言模型接上约十亿参数的扩散动作专家，适配多种本体。","explanation":"DexVLA 由美的集团、华东师范大学、上海大学的研究者于 2025 年 2 月发布，发表于 CoRL 2025。它把视觉语言模型 Qwen2-VL（20 亿参数）和一个可插拔的扩散动作专家拼在一起：VLM 负责看图和理解指令，动作专家基于 ScaleDP 架构扩到约 10 亿参数，用多个输出头适配不同机器人，专门生成连续动作。训练按「本体课程」分三阶段：先用约 100 小时跨本体数据单独预训练动作专家；再接上 VLM、对齐到具体本体；最后用标注了子步骤的数据做任务后训练。它想解决早期 VLA 动作表示弱、训练贵、换机器人难的问题，和 π0 同属「VLM + 动作专家」路线。","example":"论文在 Franka 单臂（夹爪或灵巧手）、双臂 UR5e 和松灵双臂上测试；不做任务专门适配就能叠衬衫（得分 0.92），在完整叠衣任务上得分 0.4，同条件下 π0 为 0.2。","related":["视觉-语言-动作模型","动作专家","扩散动作头","跨本体","π0","通义千问 Qwen-VL"]},{"id":"magma","category":"named_model","sec":4,"tier":3,"sources":[{"title":"arXiv 2502.13130: Magma","url":"https://arxiv.org/abs/2502.13130"},{"title":"GitHub: microsoft/Magma","url":"https://github.com/microsoft/Magma"}],"as_of":"2025-02","related_ids":["visual-prompting-2","vision-language-action-model","multimodal-large-language-model","open-x-embodiment","llama","microsoft-research"],"name":"Magma","alt":"Magma: A Foundation Model for Multimodal AI Agents (Microsoft)","abbr":"","aliases":["Magma-8B"],"one_liner":"微软推出的多模态智能体基础模型，既能操作软件界面也能控制机械臂。","explanation":"Magma 是微软研究院 2025 年 2 月发布的多模态基础模型，发表于 CVPR 2025，开源版本为 Magma-8B（语言骨干为 Llama-3-8B）。它想用一个模型同时完成数字世界和物理世界的智能体任务：在网页、手机界面上点击操作（UI 导航），以及控制机械臂抓取放置。关键是两种标注：Set-of-Mark（SoM）给图中可操作的元素打上编号标记，让模型用「选哪个标记」表示在哪里动作；Trace-of-Mark（ToM）标出视频里标记点未来的运动轨迹，让模型学会预测接下来怎么动。借助 ToM，它能从大量没有动作标签的教学视频中学习时空规划。训练数据包括 UI 导航数据、Open X-Embodiment 机器人数据和网络视频。","example":"同一个 Magma-8B 既能在手机截图上输出「点击 3 号标记的按钮」，也能在机器人相机画面上输出机械臂的移动轨迹和夹爪动作。","related":["视觉提示（Set-of-Mark 标记提示）","视觉-语言-动作模型","多模态大语言模型","Open X-Embodiment 数据集","Llama","微软（微软研究院）"]},{"id":"chatvla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"ChatVLA (arXiv 2502.14420)","url":"https://arxiv.org/abs/2502.14420"},{"title":"ChatVLA 项目主页","url":"https://chatvla.github.io/"}],"as_of":"2025-11","related_ids":["vision-language-action-model","catastrophic-forgetting","mixture-of-experts","co-training","dexvla","knowledge-insulation"],"name":"ChatVLA","alt":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","abbr":"","aliases":[],"one_liner":"既能看图问答、又能控制机器人的统一 VLA 模型。","explanation":"ChatVLA 由美的集团、华东师范大学等团队 2025 年 2 月提出，入选 EMNLP 2025 主会口头报告。它针对 VLA 的一个常见毛病：在机器人数据上微调后，底座 VLM 原有的看图问答能力会被冲掉（论文称为虚假遗忘），而控制和理解两类数据一起训又会互相干扰。做法有二：一是分阶段对齐训练，先只用机器人数据练会控制，再按 1:3 混入图文数据恢复理解能力；二是混合专家结构，注意力层共享，前馈层分成理解专家和控制专家，按任务走不同路径。模型基于 Qwen2-VL-2B，在 MMStar 上得 47.2 分，多模态理解明显强于以往 VLA，在 25 个真机任务上也优于 OpenVLA 和 ECoT。","example":"同一个 ChatVLA 既能回答关于图片的问题，也能在浴室、厨房、桌面等场景执行抓取、放置、推、挂等操作指令。","related":["视觉-语言-动作模型","灾难性遗忘","混合专家模型","协同训练","DexVLA","知识隔离"]},{"id":"dexgraspvla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"DexGraspVLA (arXiv:2502.20900)","url":"https://arxiv.org/abs/2502.20900"},{"title":"DexGraspVLA 项目主页","url":"https://dexgraspvla.github.io/"}],"as_of":"2025-11","related_ids":["vision-language-action-model","dexterous-manipulation","hierarchical-architecture","diffusion-policy","dinov2","psibot"],"name":"DexGraspVLA","alt":"DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping","abbr":"","aliases":[],"one_liner":"北大与灵初智能的分层灵巧手抓取框架：大模型负责规划，扩散策略负责出动作。","explanation":"DexGraspVLA 由北京大学人工智能研究院、北大-灵初智能（PsiBot）联合实验室等团队于 2025 年 2 月发布，后被 AAAI 2026 收为口头报告。它分两层：上层用现成的视觉语言模型（如 Qwen-VL）理解指令、在画面中框出目标物体；下层是扩散控制器，用 SAM 和 Cutie 持续跟踪目标掩码，用冻结的 DINOv2 提取视觉特征，再由扩散 Transformer 输出机械臂和灵巧手动作。核心思路是先借基础模型把多变的图像和语言转成较稳定的表示，缩小训练与测试场景的差异，这样只靠少量人类演示做模仿学习也能泛化到大量新场景。","example":"用 36 种家居物体采集 2094 条杂乱场景抓取演示训练后，在 360 个新物体、6 种新背景、3 种新光照组合出的约 1287 种场景里零样本测试，综合成功率 90.8%（睿尔曼 7 自由度机械臂 + 灵初 6 自由度 G0-R 灵巧手）。","related":["视觉-语言-动作模型","灵巧操作","分层架构","扩散策略","DINOv2","灵初智能"]},{"id":"hybridvla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"HybridVLA (arXiv 2503.10631)","url":"https://arxiv.org/abs/2503.10631"},{"title":"HybridVLA project page","url":"https://hybrid-vla.github.io/"},{"title":"PKU-HMI-Lab/Hybrid-VLA (GitHub)","url":"https://github.com/PKU-HMI-Lab/Hybrid-VLA"}],"as_of":"2025-06","related_ids":["vision-language-action-model","hybrid-autoregressive-diffusion-architecture","diffusion-action-head","action-binning","cogact","openvla"],"name":"HybridVLA","alt":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","abbr":"","aliases":["Hybrid-VLA"],"one_liner":"在同一个大语言模型里同时做扩散和自回归两种动作预测的 VLA","explanation":"北京大学（仉尚航团队）联合北京智源研究院、香港中文大学、复旦大学 2025 年 3 月发布。自回归 VLA 把动作离散成 token，能继承视觉语言模型的推理能力，但离散化破坏了动作的连续性，影响精细控制；扩散 VLA 另接一个扩散头输出连续动作，却只用到 VLM 提取的特征，没借上逐 token 生成的推理能力。HybridVLA 把扩散去噪直接嵌入大语言模型的下一个 token 预测过程，一个模型同时产出扩散动作和自回归动作，再用「协同动作集成」自适应融合两者。模型基于 Prismatic 7B（LLaMA-2 骨干），论文报告在仿真和真机任务上平均成功率比此前最优方法分别高 14% 和 19%。","example":"同一个 HybridVLA 模型每一步会给出扩散和自回归两份动作预测，融合后再交给机械臂执行。","related":["视觉-语言-动作模型","自回归-扩散混合架构","扩散动作头","分箱离散化","CogACT","OpenVLA"]},{"id":"dita","category":"named_model","sec":4,"tier":3,"sources":[{"title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy (arXiv 2503.19757)","url":"https://arxiv.org/abs/2503.19757"},{"title":"Dita 项目主页","url":"https://robodita.github.io/"}],"as_of":"2025-09","related_ids":["diffusion-transformer","vision-language-action-model","diffusion-action-head","open-x-embodiment","causal-attention","libero-benchmark"],"name":"Dita","alt":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","abbr":"","aliases":["RoboDita"],"one_liner":"用同一个 Transformer 直接对整段动作去噪的开源通用 VLA 策略，约 3.3 亿参数。","explanation":"Dita 是上海人工智能实验室、浙江大学、商汤、港中文、北大、清华等机构的研究者于 2025 年 3 月发布的通用机器人策略，收录于 ICCV 2025。不少扩散式 VLA 在大模型后面接一个小的扩散动作头（专门把噪声变成动作的小网络），动作只能看到压缩后的特征。Dita 把语言 token、历史图像的视觉 token 和带噪声的动作 token 拼进同一个因果 Transformer 里一起去噪（上下文条件化），让动作直接对齐原始视觉细节，更好地刻画动作增量和环境差异。模型在 Open X-Embodiment 跨本体数据上预训练，总参数约 3.34 亿（可训练约 2.21 亿），在 SimplerEnv、LIBERO、CALVIN、ManiSkill2 等仿真基准上达到或接近当时最好水平。代码开源，定位是轻量、易复现的扩散 VLA 基线。","example":"换到一台新的真机和新场景时，只用每个任务 10 条示范、单个第三视角相机微调，Dita 就能完成多步长程任务，并能应对背景、干扰物摆放和光照的变化。","related":["扩散 Transformer","视觉-语言-动作模型","扩散动作头","Open X-Embodiment 数据集","因果注意力","LIBERO"]},{"id":"cot-vla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"CoT-VLA (arXiv:2503.22020, CVPR 2025)","url":"https://arxiv.org/abs/2503.22020"},{"title":"CoT-VLA 项目主页","url":"https://cot-vla.github.io/"}],"as_of":"2025-03","related_ids":["visual-chain-of-thought","vision-language-action-model","chain-of-thought","action-chunking","action-free-video","susie"],"name":"CoT-VLA","alt":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","abbr":"","aliases":["视觉思维链 VLA"],"one_liner":"先生成一张未来子目标图像当「思考」，再输出动作的 7B 视觉-语言-动作模型。","explanation":"英伟达、斯坦福、MIT 等 2025 年 3 月提出，发表于 CVPR 2025。以往的 VLA（视觉-语言-动作模型）直接把图像和指令映射成动作，中间没有推理步骤。CoT-VLA 把思维链换成视觉形式：模型先自回归生成若干步之后的一帧子目标图像（任务做到那时画面应该是什么样），再以这张图为目标输出一段动作块，闭环执行。底座是能同时理解和生成图像的多模态模型 VILA-U，共 7B 参数；生成图像用因果注意力，解码动作用全注意力。由于预测子目标图像不需要动作标签，EPIC-KITCHENS 这类没有动作标注的视频也能用来训练。论文报告真机任务比当时最强 VLA 基线高 17%，仿真基准高 6%。","example":"收到「把碗放进抽屉」时，CoT-VLA 先画出几步之后碗已被拿起、靠近抽屉的画面，再输出一段能到达这个画面的机械臂动作，执行完后看新画面再重复。","related":["视觉思维链","视觉-语言-动作模型","思维链","动作分块","无动作标签视频","SuSIE"]},{"id":"smolvla","category":"named_model","sec":4,"tier":2,"sources":[{"title":"SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data (Hugging Face Blog)","url":"https://huggingface.co/blog/smolvla"}],"as_of":"2025-06","related_ids":["lerobot","vision-language-action-model","action-expert","flow-matching","asynchronous-inference","so-100-so-101-arm"],"name":"SmolVLA","alt":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (Hugging Face)","abbr":"","aliases":[],"one_liner":"Hugging Face 推出的约 4.5 亿参数开源小 VLA，消费级设备就能训练和运行。","explanation":"SmolVLA 是 Hugging Face 的 LeRobot 团队 2025 年 6 月发布的开源视觉-语言-动作模型，约 4.5 亿参数。它以小型视觉语言模型 SmolVLM2 为骨干，后接约 1 亿参数、用流匹配训练的动作专家；为省算力，每帧图像只保留 64 个视觉 token，并跳过部分网络层。预训练只用社区上传的 487 个 LeRobot 数据集、约 1000 万帧，比常见 VLA 的数据少一个数量级。它还支持异步推理：机器人执行当前动作块时就开始算下一块，官方称任务完成快约 30%。在 LIBERO、Meta-World 和 SO-100/SO-101 真机上，它的表现接近或超过更大的模型，能在消费级显卡甚至 MacBook 上跑。","example":"用 LeRobot 采一批 SO-101 机械臂抓积木的演示，在一张消费级显卡上微调 SmolVLA，再部署回同一台机械臂执行。","related":["LeRobot","视觉-语言-动作模型","动作专家","流匹配","异步推理","SO-100 / SO-101 机械臂"]},{"id":"beast","category":"named_model","sec":4,"tier":3,"sources":[{"title":"BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning (arXiv 2506.06072)","url":"https://arxiv.org/abs/2506.06072"}],"as_of":"2025-10","related_ids":["action-tokenizer","action-chunking","pi0-fast","parallel-decoding","florence-2","action-chunking-with-transformers"],"name":"BEAST","alt":"BEAST: B-spline Encoded Action Sequence Tokenizer","abbr":"BEAST","aliases":["B 样条动作分词器","BEAST-F","BEAST-ACT"],"one_liner":"用 B 样条控制点把一段动作压成固定个数 token 的动作分词器。","explanation":"BEAST 是德国卡尔斯鲁厄理工学院（KIT）团队 2025 年 6 月提出的动作分词器，发表于 NeurIPS 2025。做法是用 B 样条曲线（由少量「控制点」决定形状的平滑曲线）拟合一段动作序列，再把控制点当作 token：可量化成离散 token 给语言模型用，也可保留连续值。和 FAST 这类需要单独训练、长度不固定的分词器相比，BEAST 不用训练、每段 token 数固定，所以能一次前向并行解码；B 样条还保证相邻动作块首尾平滑衔接，减少抖动。论文把它接到 Florence-2 小模型（BEAST-F）、ACT 等架构上，在 CALVIN、LIBERO 上结果有竞争力，推理吞吐约为 π0 的 2 倍。","example":"BEAST-ACT 把 ACT 原本要逐步预测的 100 步动作，改成只预测 15 个控制点，再由 B 样条还原出平滑轨迹。","related":["动作分词器","动作分块","π0-FAST","并行解码","Florence-2","ACT"]},{"id":"bridgevla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"BridgeVLA (arXiv 2506.07961)","url":"https://arxiv.org/abs/2506.07961"},{"title":"BridgeVLA GitHub","url":"https://github.com/BridgeVLA/BridgeVLA"}],"as_of":"2026-08","related_ids":["3d-vla","paligemma","rvt-2","rlbench","the-colosseum-a-benchmark-for-evaluating-generalization-for","keyframe-action-prediction"],"name":"BridgeVLA","alt":"BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models","abbr":"","aliases":["BridgeVLA++"],"one_liner":"把 3D 点云投影成 2D 图、用热力图输出动作的 3D 操作 VLA。","explanation":"BridgeVLA 由中科院自动化所、字节跳动 Seed 等团队 2025 年 6 月提出，发表于 NeurIPS 2025。问题在于：VLM 是在 2D 图文上预训练的，而 3D 操作要处理点云、输出 3D 位姿，两边对不齐，知识难迁移。BridgeVLA 把点云渲染成几张多视角 2D 图送进 PaliGemma，让模型在同一张图上输出 2D 热力图（每个像素表示「在这里动作」的可能性），再综合多视角热力图确定末端要去的 3D 位置；正式训练前还先用目标检测数据练它输出热力图。它在 RLBench 上把成功率从 81.4% 提到 88.2%。2026 年 8 月团队又开源了 BridgeVLA++。","example":"真机上用 Franka Research 3 机械臂测试 10 多个任务，每个任务只给 3 条演示，平均成功率 96.8%。","related":["3D VLA","PaliGemma","RVT-2","RLBench","The Colosseum","关键帧动作预测"]},{"id":"dreamvla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"DreamVLA (arXiv 2507.04447)","url":"https://arxiv.org/abs/2507.04447"},{"title":"DreamVLA 项目主页","url":"https://zhangwenyao1.github.io/DreamVLA/"},{"title":"DreamVLA 代码仓库（GitHub）","url":"https://github.com/Zhangwenyao1/DreamVLA"}],"as_of":"2025-09","related_ids":["vision-language-action-model","world-model","inverse-dynamics-model","diffusion-transformer","attention-mask","calvin-benchmark"],"name":"DreamVLA","alt":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","abbr":"","aliases":[],"one_liner":"先预测未来的动态区域、深度和语义特征，再据此生成动作的 VLA 模型。","explanation":"DreamVLA 是上海交通大学、宁波东方理工大学、清华、北大、银河通用等机构于 2025 年 7 月提出的视觉-语言-动作模型（VLA），收录于 NeurIPS 2025。有些 VLA 会先「想象」下一帧完整画面再出动作，但整张图里大部分像素和任务无关。DreamVLA 只预测三类紧凑的「世界知识」：哪里会动（动态区域）、单目深度、高层语义（借助 DINOv2、SAM 的特征），再以它们为条件，用扩散 Transformer 生成未来一段动作，相当于先预测结果、再反推该怎么做（逆动力学思路）。为防三类信息在注意力里互相串扰，它用分块结构化注意力掩码把它们隔开。它是「VLA 融合世界模型式预测」这一方向的代表工作之一。","example":"在 CALVIN ABC-D 长程任务基准上平均连续完成 4.44 个子任务，在真机操作任务上成功率 76.7%。","related":["视觉-语言-动作模型","世界模型","逆动力学模型","扩散 Transformer","注意力掩码","CALVIN"]},{"id":"thinkact","category":"named_model","sec":4,"tier":3,"sources":[{"title":"ThinkAct (arXiv 2507.16815)","url":"https://arxiv.org/abs/2507.16815"},{"title":"ThinkAct project page","url":"https://jasper0314-huang.github.io/thinkact-vla/"},{"title":"Fast-ThinkAct (arXiv 2601.09708)","url":"https://arxiv.org/abs/2601.09708"}],"as_of":"2026-01","related_ids":["embodied-reasoning","dual-system-architecture","chain-of-thought","group-relative-policy-optimization","latent-reasoning","libero-benchmark"],"name":"ThinkAct","alt":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","abbr":"","aliases":["Fast-ThinkAct（后续版本）"],"one_liner":"先让多模态大模型想出视觉规划，再交给动作模型执行的推理型 VLA","explanation":"英伟达与台湾大学（Chi-Pin Huang、Fu-En Yang 等）2025 年 7 月发布，发表于 NeurIPS 2025。多数 VLA 直接从画面和指令输出动作，缺少显式推理，难做多步长程任务。ThinkAct 采用快慢双系统：「思考」部分是以 Qwen2.5-VL 7B 初始化的多模态大模型，先监督微调冷启动，再用 GRPO 强化学习训练它生成具身推理计划，奖励来自视觉信号——规划出的轨迹终点是否与示范一致、整条轨迹是否与示范相符。推理结果被压缩成一个视觉规划隐变量，作为条件输入下游动作模型输出具体动作。在 SimplerEnv、LIBERO 等操作基准和多个具身推理基准上，它表现出少样本适应、长程规划和自我纠错能力。后续版本 Fast-ThinkAct 发表于 CVPR 2026。","example":"面对「把胡萝卜放到盘子上」，ThinkAct 先推理出要先抓胡萝卜、再移到盘子上方，并规划出夹爪的运动轨迹，动作模型按这个规划执行；中途失手时还能重新规划。","related":["具身推理","快慢双系统","思维链","组相对策略优化","潜在推理","LIBERO"]},{"id":"molmoact","category":"named_model","sec":4,"tier":3,"sources":[{"title":"MolmoAct (Ai2 blog)","url":"https://allenai.org/blog/molmoact"},{"title":"MolmoAct: Action Reasoning Models that can Reason in Space (arXiv 2508.07917)","url":"https://arxiv.org/abs/2508.07917"},{"title":"MolmoAct 2 (Ai2 blog)","url":"https://allenai.org/blog/molmoact2"}],"as_of":"2026-05","related_ids":["vision-language-action-model","molmo","embodied-reasoning","action-chain-of-thought","flow-matching","molmoact2-bimanualyam"],"name":"MolmoAct","alt":"MolmoAct: Action Reasoning Models that can Reason in Space (Ai2)","abbr":"","aliases":["MolmoAct2","MolmoAct 2","Action Reasoning Model (ARM)"],"one_liner":"Ai2 开源的「动作推理模型」，先推深度、画轨迹，再输出动作的 VLA","explanation":"Ai2 在 2025 年 8 月发布，基于自家的 Molmo 视觉语言模型，70 亿参数，模型、代码、数据和评测脚本全部开源。它把 VLA 的决策拆成三步：先输出带深度信息的感知 token 理解三维空间，再在图像上画出末端要走的路点轨迹，最后把轨迹解码成机械臂和夹爪的具体动作。因为计划轨迹直接叠在图像上，人能在执行前看到它打算怎么做，也可以在手机或平板上画出路径来引导它。发布时报告在 SimplerEnv 分布外任务上成功率 72.1%、LIBERO 上 86.6%。2026 年 5 月的 MolmoAct2 改用具身推理骨干 Molmo2-ER，接上流匹配动作专家，单次动作推理从约 6.7 秒降到 180 毫秒，并开放了 720 多小时的双臂 YAM 数据集。","example":"给指令「把枕头摆到沙发上」，MolmoAct 先在相机画面上画出一条从枕头到沙发的轨迹，用户确认或在平板上改画后，它再转成机械臂动作执行。","related":["视觉-语言-动作模型","Molmo","具身推理","动作思维链","流匹配","BimanualYAM 数据集"]},{"id":"memoryvla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"arXiv 2508.19236: MemoryVLA","url":"https://arxiv.org/abs/2508.19236"},{"title":"MemoryVLA 项目主页","url":"https://shihao1895.github.io/MemoryVLA/"}],"as_of":"2026-01","related_ids":["memory-augmented-vla","embodied-memory","vision-language-action-model","long-horizon-task","diffusion-action-head","dexmal"],"name":"MemoryVLA","alt":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","abbr":"","aliases":[],"one_liner":"给 VLA 加上工作记忆和记忆库，让机器人记得之前看到和做过什么。","explanation":"MemoryVLA 是清华大学黄高团队与原力灵机（Dexmal）、旷视等机构合作的工作，2025 年 8 月发布，发表于 ICLR 2026。多数 VLA 只看当前画面决定动作，但很多操作任务光看当前一帧不够：例如按下按钮前后画面可能几乎一样，不记得历史就分不清按没按过。MemoryVLA 借用认知科学中工作记忆和情景记忆的概念：用 7B 视觉语言模型把观测编码成感知 token 和认知 token，作为工作记忆；另设记忆库保存过去的低层细节和高层语义，按需检索并与当前信息融合；最后由扩散动作专家输出一段动作。论文报告在 SimplerEnv-Bridge 上成功率 71.9%，LIBERO 上 96.5%，真机任务 84.0%，长时序任务提升明显。","example":"例如「依次按下三个按钮」，每次按完画面变化很小，靠记忆库记住已经按过哪个，才能避免重复按或漏按。","related":["记忆增强 VLA","具身记忆","视觉-语言-动作模型","长程任务","扩散动作头","原力灵机"]},{"id":"discrete-diffusion-vla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"Discrete Diffusion VLA (arXiv:2508.20072)","url":"https://arxiv.org/abs/2508.20072"},{"title":"Discrete Diffusion VLA 论文 HTML 全文 v4","url":"https://arxiv.org/html/2508.20072v4"}],"as_of":"2026-05","related_ids":["discrete-diffusion","vision-language-action-model","openvla","action-binning","parallel-decoding","autoregressive-decoding"],"name":"Discrete Diffusion VLA（离散扩散 VLA）","alt":"Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies","abbr":"","aliases":["离散扩散 VLA"],"one_liner":"用离散扩散解码 VLA 动作：动作 token 并行生成，先定有把握的再逐步补全。","explanation":"Discrete Diffusion VLA 由香港大学、上海交通大学等机构的研究者（通讯作者穆尧、罗平）于 2025 年 8 月发布，已被 ICML 2026 接收。OpenVLA 这类离散 VLA 把动作分箱成 token 后自回归地逐个生成，慢且早期错误无法回改；π0 这类连续扩散头则要另接动作模块。它在 OpenVLA（Prismatic-7B，Llama 2 底座）上把动作块 token 改为双向注意力，用离散扩散（掩码预测）解码：初始全是掩码，每轮并行预测，先确定置信度高的 token，其余继续迭代，并把不够确定的已填 token 重新掩码修正。动作解码和语言模型共用一个 Transformer 与交叉熵目标，也更好保留了原 VLM 的能力。","example":"在仿真基准上，它在 LIBERO 平均成功率 96.4%，SimplerEnv-Fractal 视觉匹配 71.2%，SimplerEnv-Bridge 54.2%；作者还在松灵 Cobot Magic 平台上做了真机验证。","related":["离散扩散","视觉-语言-动作模型","OpenVLA","分箱离散化","并行解码","自回归解码"]},{"id":"vla-adapter","category":"named_model","sec":4,"tier":3,"sources":[{"title":"VLA-Adapter (arXiv 2509.09372)","url":"https://arxiv.org/abs/2509.09372"},{"title":"VLA-Adapter 项目主页","url":"https://vla-adapter.github.io/"},{"title":"OpenHelix-Team/VLA-Adapter (GitHub)","url":"https://github.com/OpenHelix-Team/VLA-Adapter"}],"as_of":"2025-09","related_ids":["vision-language-action-model","learnable-query","adapter","openvla-oft","libero-benchmark","vla-rft"],"name":"VLA-Adapter","alt":"VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model","abbr":"","aliases":["VLA-Adapter-Pro"],"one_liner":"用 0.5B 小模型加轻量策略模块、不做机器人预训练也能打到顶尖水平的 VLA。","explanation":"VLA-Adapter 由北京邮电大学、西湖大学、浙江大学、港科大（广州）和 OpenHelix 团队等 2025 年 9 月发布，已开源代码和权重。常见 VLA 依赖大参数视觉语言模型（VLM）并在大量机器人数据上预训练，成本很高。作者系统比较了 VLM 里哪些层、哪些特征最适合作为动作生成的条件，据此设计了一个约 9700 万参数的策略模块：用 Bridge Attention 把 VLM 各层的原始视觉语言特征和一组可学习查询（ActionQuery）的特征注入动作空间，注入多少由可学习参数控制。骨干只用 Qwen2.5-0.5B，不做机器人数据预训练，LIBERO 平均成功率 97.3%（Pro 版 98.5%），CALVIN ABC→D 平均完成长度 4.50（Pro 版）。它大幅降低了训练和部署门槛，后续 VLA-RFT 等工作以它为基座。","example":"论文报告在单张消费级显卡上约 8 小时即可训练出可用模型；推理吞吐 219.2 Hz，同条件下 OpenVLA-OFT 为 71.4 Hz。","related":["视觉-语言-动作模型","可学习查询","适配器","OpenVLA-OFT","LIBERO","VLA-RFT"]},{"id":"x-vla","category":"named_model","sec":4,"tier":3,"sources":[{"title":"X-VLA (arXiv:2510.10274)","url":"https://arxiv.org/abs/2510.10274"},{"title":"2toinf/X-VLA (GitHub)","url":"https://github.com/2toinf/X-VLA"}],"as_of":"2026-09","related_ids":["cross-embodiment","prompt-tuning-soft-prompt","flow-matching","vision-language-action-model","lerobot","cross-embodiment-data"],"name":"X-VLA","alt":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","abbr":"","aliases":["X-VLA-0.9B"],"one_liner":"给每个数据源配专属「软提示」来统一多种机器人的 0.9B 跨本体 VLA","explanation":"清华大学智能产业研究院（AIR）与上海人工智能实验室等 2025 年 10 月提出，已被 ICLR 2026 接收。跨本体训练的难点是不同机器人的相机、动作空间差别大，混在一起训练会互相干扰。X-VLA 给每个数据来源配一组可学习的嵌入向量作为「软提示」，告诉模型当前是哪种硬件，其余主干全部共享；动作用流匹配生成，主干是标准 Transformer 编码器。0.9B 参数版本在 DROID、RoboMIND、AgiBot 共 29 万条轨迹上预训练，在 LIBERO、SimplerEnv、CALVIN 等 6 个仿真基准和 3 个真机平台上取得领先。代码以 Apache-2.0 开源，并已接入 LeRobot。","example":"真机叠衣服任务（Soft-Fold）中，X-VLA-0.9B 报告成功率 100%、每小时叠 33 件。","related":["跨本体","提示微调 / 软提示","流匹配","视觉-语言-动作模型","LeRobot","跨本体数据"]},{"id":"vla-0","category":"named_model","sec":4,"tier":3,"sources":[{"title":"VLA-0: Building State-of-the-Art VLAs with Zero Modification (arXiv 2510.13054)","url":"https://arxiv.org/abs/2510.13054"},{"title":"VLA-0 项目主页","url":"https://vla0.github.io/"}],"as_of":"2025-10","related_ids":["vision-language-action-model","action-tokenizer","action-binning","qwen-vl","libero-benchmark","smolvla"],"name":"VLA-0","alt":"VLA-0: Building State-of-the-Art VLAs with Zero Modification","abbr":"VLA-0","aliases":["VLA-0（动作即文本）"],"one_liner":"英伟达提出的极简 VLA：不改模型结构，让 VLM 直接把动作写成数字文本。","explanation":"VLA-0 是英伟达 Ankit Goyal 等人 2025 年 10 月发布的工作。常见 VLA（视觉-语言-动作模型）要么往视觉语言模型词表里加专门的动作 token，要么外挂动作头；VLA-0 什么都不改，直接让 Qwen2.5-VL-3B 用普通文本输出动作：把每个连续动作维度归一化成 0–1000 的整数写出来，再解码回去。论文指出要让这种做法好用，需要几项技巧：训练时随机遮掉目标数字串里的字符，逼模型看图而不是顺着文本续写；推理时把相邻时刻的预测做集成平均。结果在 LIBERO 上平均成功率 94.7%，超过同样只用该基准数据训练的 OpenVLA-OFT、SmolVLA 等，也超过用了大规模机器人数据预训练的 π0、GR00T N1 等；真机 SO-100 上比 SmolVLA 高 12.5 个百分点。它提醒大家先把简单基线做扎实。","example":"给定相机画面和指令，模型像回答问题一样输出一串 0–1000 之间的整数文本，每个数对应一个动作维度，反归一化后交给机械臂执行。","related":["视觉-语言-动作模型","动作分词器","分箱离散化","通义千问 Qwen-VL","LIBERO","SmolVLA"]},{"id":"pi0","category":"named_model","sec":5,"tier":1,"sources":[{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)","url":"https://arxiv.org/abs/2410.24164"},{"title":"Physical-Intelligence/openpi GitHub 仓库","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"2025-09","related_ids":["flow-matching","action-expert","paligemma","pi0-5","pi0-fast","physical-intelligence"],"name":"π0","alt":"π0 (pi-zero): A Vision-Language-Action Flow Model for General Robot Control","abbr":"π0","aliases":["pi0","pi-zero","π-zero"],"one_liner":"Physical Intelligence 2024 年发布的 VLA，用流匹配生成连续动作，已开源。","explanation":"π0 是美国具身智能公司 Physical Intelligence（PI）于 2024 年 10 月 31 日发布的通用机器人基础模型。它以谷歌 30 亿参数的视觉语言模型 PaliGemma 为底座，外加一个约 3 亿参数的「动作专家」，用流匹配（和扩散模型类似、从噪声逐步生成连续值的方法）一次生成未来 50 步动作，控制频率最高 50Hz。与 RT-2、OpenVLA 把动作离散成 token 不同，连续生成更适合叠衣服这类高频灵巧任务。它用 1 万多小时机器人数据预训练，覆盖 7 种机器人构型、68 个任务，并混入 OXE、DROID 等开源数据；预训练后可直接按语言指令做事，也能用少量数据微调学新技能。PI 后来在 openpi 仓库开源了代码和权重，单张 RTX 4090 即可推理和做 LoRA 微调。","example":"论文演示中，π0 经微调后能把烘干机里的衣服取出、拿到桌边逐件叠好，还能组装纸箱、收拾餐桌。","related":["流匹配","动作专家","PaliGemma","π0.5","π0-FAST","Physical Intelligence"]},{"id":"pi0-fast","category":"named_model","sec":5,"tier":2,"sources":[{"title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models (arXiv 2501.09747)","url":"https://arxiv.org/abs/2501.09747"},{"title":"FAST: Efficient Robot Action Tokenization (Physical Intelligence)","url":"https://www.pi.website/research/fast"},{"title":"openpi (GitHub, Physical Intelligence)","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"2025-01","related_ids":["pi0","action-tokenizer","discrete-cosine-transform","byte-pair-encoding","action-binning","autoregressive-decoding"],"name":"π0-FAST","alt":"π0-FAST (π0 with FAST frequency-space action tokenization)","abbr":"","aliases":["pi0-FAST","pi0_fast","π0 + FAST"],"one_liner":"把 π0 的动作用 FAST 分词器变成离散 token、逐个生成的自回归 VLA。","explanation":"π0-FAST 是 Physical Intelligence 2025 年 1 月随 FAST 动作分词器一起发布的模型，骨干网络和训练数据与 π0 相同，区别在动作怎么输出：π0 用流匹配生成连续动作，π0-FAST 把动作变成离散 token，像语言模型一样逐个预测。以往按每个维度、每个时间步分箱的离散化，在高频灵巧任务上几乎学不会。FAST 先对一段动作做离散余弦变换（DCT，JPEG 压缩也用它），量化后再用字节对编码（BPE）压缩，一段动作通常只需 30–60 个 token。这样训练最多快 5 倍、效果与流匹配版相当，还首次在 DROID 数据集上训出能在新环境零样本听指令干活的通用策略。代价是自回归解码明显比流匹配慢。权重在 openpi 开源。","example":"双臂机器人 50 Hz 控制、每步 14 维，1 秒动作就是 700 个数。按旧方法逐维分箱要 700 个 token；FAST 压缩后只剩几十个，模型用下一个 token 预测学会叠衣服，推理时再把 token 反变换回连续动作。","related":["π0","动作分词器","离散余弦变换","字节对编码","分箱离散化","自回归解码"]},{"id":"pi0-5","category":"named_model","sec":5,"tier":1,"sources":[{"title":"π0.5: a Vision-Language-Action Model with Open-World Generalization (arXiv 2504.16054)","url":"https://arxiv.org/abs/2504.16054"},{"title":"Physical-Intelligence/openpi GitHub 仓库","url":"https://github.com/Physical-Intelligence/openpi"}],"as_of":"2025-09","related_ids":["pi0","co-training","pi0-fast","open-world","long-horizon-task","pi-star-0-6"],"name":"π0.5","alt":"π0.5: a Vision-Language-Action Model with Open-World Generalization","abbr":"π0.5","aliases":["pi0.5","pi05"],"one_liner":"PI 2025 年发布的 VLA，能在没见过的真实家庭里完成收拾厨房等长程任务。","explanation":"π0.5 是 Physical Intelligence 于 2025 年 4 月 22 日发布的 π0 升级版，重点是开放世界泛化：让机器人进到训练时从没去过的家里干活。做法是把多种来源的数据混在一起协同训练：约 100 个家庭里采集的约 400 小时移动机械臂数据只占预训练样本的约 2.4%，其余来自其他机器人、实验室数据、网络图文问答和高层语义标注。推理时模型先用文字预测下一步子任务（如「捡起盘子」），再据此生成底层动作，类似思维链。训练上，预训练阶段把动作压成离散的 FAST token 以提高效率，后训练再接上流匹配动作专家输出连续动作。论文在 3 个训练中未见过的真实家庭里测试，它能完成收拾厨房、整理卧室这类多步骤任务。2025 年 9 月权重已在 openpi 中开源。","example":"在一个没去过的家里接到「收拾厨房」的指令，π0.5 先说出「把盘子放进水槽」这样的子任务，再执行对应动作，一步步做完。","related":["π0","协同训练","π0-FAST","开放世界","长程任务","π*0.6"]},{"id":"pi-star-0-6","category":"named_model","sec":5,"tier":2,"sources":[{"title":"π*0.6: a VLA That Learns From Experience (arXiv 2511.14759)","url":"https://arxiv.org/abs/2511.14759"},{"title":"π*0.6: a VLA that Learns from Experience (Physical Intelligence blog)","url":"https://www.pi.website/blog/pistar06"}],"as_of":"2025-11","related_ids":["recap","vision-language-action-model","reinforcement-fine-tuning","advantage-conditioning","value-function","physical-intelligence"],"name":"π*0.6","alt":"π*0.6: a VLA That Learns From Experience (π0.6 trained with RECAP)","abbr":"π*0.6","aliases":["π0.6","pi0.6","pi*0.6","pi-star-0.6"],"one_liner":"π0.6 经 RECAP 强化学习训练后的版本，能从示教、纠正和自身经验中变强。","explanation":"π*0.6 是 Physical Intelligence 2025 年 11 月发布的视觉-语言-动作模型。底座 π0.6 在 π0.5 基础上换用 Gemma 3 4B 视觉语言骨干，动作专家增至 8.6 亿参数；星号表示又用 RECAP 方法做了强化学习。只模仿人类示教的模型犯一个小错就会越偏越远（复合误差），很难稳定成功。RECAP 同时用三类数据：人类示教、专家遥控接管时的纠正、机器人自己跑出的成功和失败。它先训练一个价值函数，估计「离完成还差多少步」，据此判断每段动作让局面变好还是变坏（优势），再把「Advantage: positive / negative」作为文字条件和数据一起训练模型，部署时只让它做「好」的动作。最难的任务上吞吐量提升一倍以上，失败率约减半。","example":"经过 RECAP 训练后，π*0.6 连续 13 小时做意式咖啡，在一户新家庭里不间断地叠没见过的衣物两个多小时，还在工厂里组装真实用于包装的纸盒。","related":["RECAP","视觉-语言-动作模型","强化学习微调","优势条件化","价值函数","Physical Intelligence"]},{"id":"pi0-7","category":"named_model","sec":5,"tier":2,"sources":[{"title":"π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities (arXiv 2604.15483)","url":"https://arxiv.org/abs/2604.15483"},{"title":"π0.7: a Steerable Model with Emergent Capabilities (Physical Intelligence blog)","url":"https://www.pi.website/blog/pi07"}],"as_of":"2026-04","related_ids":["steerability","pi-star-0-6","pi0-5","compositional-generalization","cross-embodiment","hi-robot"],"name":"π0.7","alt":"π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","abbr":"","aliases":["pi0.7","pi07"],"one_liner":"π 公司 2026 年的通用机器人模型，能用多种提示引导做法，初现组合泛化。","explanation":"π0.7 是 Physical Intelligence 2026 年 4 月发布的机器人基础模型。把不同机器人、人类视频、自主运行（含失败）的数据直接混在一起训练，效果并不好。π0.7 的做法是给每段数据配上更丰富的提示：描述任务和子步骤的语言、速度与质量等元数据、用关节控制还是末端控制的标签，以及展示子步骤完成后样子的子目标图像（推理时可由轻量世界模型生成）。这样同一任务的不同做法、不同水平的数据都能用上，推理时再用提示指定「怎么做」，即可引导性。官方报告它不微调就能在叠衣、做咖啡、折纸盒上达到 π*0.6 专用模型的水平，并首次出现组合泛化迹象：靠逐步语言指导学会用没见过的空气炸锅，在没有叠衣数据的双臂 UR5e 上也能叠衣服。","example":"让机器人把红薯放进空气炸锅：只给一句指令时，它试了几次只完成一部分；人用语言一步步指导后能做完；再用这些指导数据微调高层策略，它就能自己生成子任务、全自动完成。","related":["可引导性","π*0.6","π0.5","组合泛化","跨本体","Hi Robot"]},{"id":"hi-robot","category":"named_model","sec":5,"tier":3,"sources":[{"title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models (arXiv 2502.19417)","url":"https://arxiv.org/abs/2502.19417"},{"title":"Hi Robot 论文 HTML 全文","url":"https://arxiv.org/html/2502.19417v2"}],"as_of":"2025-07","related_ids":["hierarchical-architecture","dual-system-architecture","pi0","instruction-following","language-corrections","physical-intelligence"],"name":"Hi Robot","alt":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","abbr":"","aliases":["Hierarchical Interactive Robot"],"one_liner":"PI 2025 年的分层系统：高层 VLM 拆解复杂指令，低层 π0 执行。","explanation":"Hi Robot 由 Physical Intelligence 联合斯坦福大学、UC 伯克利的研究者 2025 年 2 月发布，发表于 ICML 2025。单个 VLA 擅长执行「拿起杯子」这类简单指令，但难以处理带限制条件的复杂要求，也难以应对执行途中用户的插话纠正。Hi Robot 分两层：高层是基于 PaliGemma-3B 的视觉语言模型，看当前画面和用户的话，推理出下一步该执行的简单指令，还能口头回应用户；低层是 π0，把简单指令变成连续动作。训练高层时，团队把遥操作示范切成短技能片段，再让一个大 VLM 反推「用户当时可能说了什么、机器人该怎么回答」，合成对话式训练数据，省去人工标注。系统在单臂 UR5e、双臂 ARX 和移动双臂 ARX 上做了测试。","example":"用户说「给我做个素食三明治」，高层会把它拆成逐步取配料的子指令并跳过肉类；收拾桌子时用户说「那不是垃圾」，机器人会停下并调整做法。","related":["分层架构","快慢双系统","π0","指令跟随","语言纠正（实时语言反馈）","Physical Intelligence"]},{"id":"recap","category":"named_model","sec":5,"tier":2,"sources":[{"title":"π*0.6: a VLA That Learns From Experience (arXiv:2511.14759)","url":"https://arxiv.org/abs/2511.14759"}],"as_of":"2025-11","related_ids":["pi-star-0-6","advantage-conditioning","value-function","offline-reinforcement-learning","human-in-the-loop","classifier-free-guidance"],"name":"RECAP","alt":"RL with Experience and Corrections via Advantage-conditioned Policies","abbr":"RECAP","aliases":["π*0.6 的强化学习方法","优势条件化策略强化学习"],"one_liner":"PI 公司让 VLA 从自己的运行经验和人工纠正中持续变强的训练方法。","explanation":"RECAP 是 Physical Intelligence 在 2025 年 11 月随 π*0.6 发布的训练方法。纯模仿学习最多学到演示的水平，而机器人部署后会产生大量成功、失败和人工接管的数据。RECAP 把三类数据放在一起用：离线演示、机器人自主运行的轨迹、专家在运行中遥操作介入的纠正。它先训练一个价值函数，预测离任务完成还剩多少步，据此判断每个动作比平均水平好还是差（优势），再把「Advantage: positive / negative」作为文本 token 输入策略一起训练；推理时以 positive 为条件，让模型输出更好的动作。部署、重训价值函数、微调策略可以反复迭代。在叠衣服、组装纸箱、做咖啡等任务上吞吐量翻倍以上、失败率约减半。","example":"π*0.6 用 RECAP 训练后，PI 报告它能连续 13 小时制作意式咖啡，也能在陌生家庭里连续两个多小时叠没见过的衣物。","related":["π*0.6","优势条件化","价值函数","离线强化学习","人在回路","无分类器引导"]},{"id":"q-transformer","category":"named_model","sec":5,"tier":3,"sources":[{"title":"Q-Transformer (arXiv 2309.10150)","url":"https://arxiv.org/abs/2309.10150"},{"title":"Q-Transformer project page","url":"https://qtransformer.github.io/"}],"as_of":"2023-09","related_ids":["qt-opt","offline-reinforcement-learning","q-function","rt-1","conservative-q-learning","decision-transformer"],"name":"Q-Transformer","alt":"Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions","abbr":"","aliases":[],"one_liner":"用 Transformer 逐个动作维度估计 Q 值的大规模离线强化学习方法","explanation":"Google DeepMind 的 Yevgen Chebotar、Sergey Levine 等人 2023 年 9 月发布，发表于 CoRL 2023。它要解决的是：机器人既有人类演示、又有大量自主采集（含失败）的数据，怎样用离线强化学习（只用已有数据训练）把两者都用上。做法是用 Transformer 表示 Q 函数（给「状态+动作」打分的价值函数）：把每个动作维度离散成若干档，像生成 token 一样逐维预测 Q 值；再用保守正则（把没见过的动作压到最低值）和蒙特卡洛回报稳定训练。在 RT-1 的真机多任务上，它优于 RT-1、IQL 和决策 Transformer，尤其善于利用失败数据。","example":"在 RT-1 的真机多任务数据上，Q-Transformer 把人类演示和机器人自主尝试得到的失败片段一起用于训练，比只模仿成功演示的 RT-1 表现更好。","related":["QT-Opt","离线强化学习","Q 函数","RT-1","保守 Q 学习","决策 Transformer"]},{"id":"serl","category":"named_model","sec":5,"tier":3,"sources":[{"title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning (arXiv 2401.16013)","url":"https://arxiv.org/abs/2401.16013"},{"title":"SERL project page","url":"https://serl-robot.github.io/"}],"as_of":"2024-05","related_ids":["hil-serl","real-world-reinforcement-learning","reinforcement-learning-with-prior-data","success-detector","impedance-control","sample-efficiency"],"name":"SERL","alt":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning","abbr":"SERL","aliases":["Sample-Efficient Robotic Reinforcement Learning"],"one_liner":"伯克利等开源的真机强化学习工具套件，几十分钟就能在真实机械臂上练出策略","explanation":"加州大学伯克利分校、斯坦福、华盛顿大学和 Intrinsic 的研究者（Jianlan Luo、Sergey Levine 等）2024 年 1 月发布，发表于 ICRA 2024。强化学习难以在真机上落地，除了算法本身，还卡在奖励怎么给、每回合结束后怎么复位、底层控制器是否安全这些工程问题上。SERL 把这些打包成开源工具：用样本效率高的异策略算法 RLPD，可以同时利用少量人类演示；用图像分类器判断任务是否成功，充当奖励；用「前向、后向」两个策略轮流执行来自动复位，省去人工重置；并为 Franka 机械臂提供阻抗控制器，让接触过程安全柔顺。论文中 PCB 元件插装、线缆布线、物体搬移等任务平均 25 到 50 分钟训练就达到接近 100% 的成功率。后续工作 HIL-SERL 在此基础上加入人类在线纠正。","example":"做 PCB 元件插装时，先录少量人工演示，再训练一个判断「元件插好没有」的图像分类器当奖励，机械臂自己反复尝试不到一小时就能稳定插好。","related":["HIL-SERL","真机强化学习","利用先验数据的强化学习","成功检测器","阻抗控制","样本效率"]},{"id":"hil-serl","category":"named_model","sec":5,"tier":2,"sources":[{"title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (arXiv 2410.21845)","url":"https://arxiv.org/abs/2410.21845"},{"title":"HIL-SERL 项目主页","url":"https://hil-serl.github.io/"},{"title":"Jianlan Luo 个人主页（HIL-SERL 发表于 Science Robotics 2025）","url":"https://people.eecs.berkeley.edu/~jianlanluo/"}],"as_of":"2025-08","related_ids":["serl","human-in-the-loop","real-world-reinforcement-learning","human-gated-dagger","reward-model","reinforcement-fine-tuning"],"name":"HIL-SERL","alt":"Human-in-the-Loop Sample-Efficient Robotic Reinforcement Learning (Precise and Dexterous Robotic Manipulation via Human-in-the-Loop RL)","abbr":"HIL-SERL","aliases":["人在回路样本高效机器人强化学习"],"one_liner":"伯克利的真机强化学习系统，人随时接管纠正，1 到 2.5 小时练成精细操作。","explanation":"HIL-SERL 是 UC Berkeley 的 Jianlan Luo、Charles Xu、Jeffrey Wu 和 Sergey Levine 提出的真机视觉强化学习系统，2024 年 10 月上线 arXiv，2025 年 8 月登上 Science Robotics 封面。它建立在同组开源的 SERL 软件栈上：先遥操作采一些成功和失败样本，训练一个二分类奖励判别器当稀疏奖励；再采少量演示放进回放池；在线训练用基于 RLPD 的异策略算法（能反复利用旧数据），操作员可随时用 SpaceMouse 等设备接管纠正，纠正数据也拿来学。真机强化学习通常太慢、太不稳定，HIL-SERL 靠预训练视觉骨干、演示加人工纠正和安全的底层控制器，把训练缩短到 1 到 2.5 小时，多数任务成功率接近 100%，平均比模仿学习基线高约 2 倍、执行快 1.8 倍。","example":"论文任务包括抽叠叠乐（机械臂甩鞭子把一块积木从塔里抽出）、在锅里给物体翻面，以及装配主板、宜家搁架、汽车仪表盘和同步带等精密装配。","related":["SERL","人在回路","真机强化学习","人工门控 DAgger","奖励模型","强化学习微调"]},{"id":"diffusion-policy-policy-optimization","category":"named_model","sec":5,"tier":3,"sources":[{"title":"Diffusion Policy Policy Optimization (arXiv:2409.00588)","url":"https://arxiv.org/abs/2409.00588"},{"title":"DPPO 项目主页","url":"https://diffusion-ppo.github.io/"},{"title":"Allen Z. Ren 个人主页（论文列表，标注 ICLR 2025）","url":"https://allenzren.github.io/"}],"as_of":"2025","related_ids":["diffusion-policy","proximal-policy-optimization","reinforcement-fine-tuning","policy-gradient","sim-to-real-transfer","reinflow"],"name":"DPPO（扩散策略策略优化）","alt":"Diffusion Policy Policy Optimization","abbr":"DPPO","aliases":["扩散策略策略优化"],"one_liner":"用 PPO 策略梯度直接强化学习微调扩散策略，把每一步去噪也当成决策步骤。","explanation":"DPPO 由普林斯顿大学 Allen Z. Ren 等人联合 MIT、丰田研究院、卡内基梅隆大学、哈佛大学的研究者于 2024 年 9 月提出，发表于 ICLR 2025。扩散策略靠模仿学习训练，效果受限于演示质量；策略梯度类强化学习（如 PPO）需要算动作概率，而扩散模型多步去噪不好直接算，此前普遍认为这样微调效率低。DPPO 把过程拆成两层马尔可夫决策过程：外层是和环境交互，内层把每一步去噪看成一次高斯采样的「动作」，每步概率都能算，于是可以用 PPO 端到端微调。实验显示它探索贴近演示数据分布、训练稳定、微调后更鲁棒，是扩散和流匹配策略做强化学习微调的常用基线。","example":"在 Furniture-Bench 家具装配仿真任务上，DPPO 把预训练扩散策略的成功率从 57% 提到 97%（One-Leg）、从 12% 提到 87%（Lamp），装配策略还能零样本迁移到真机。","related":["扩散策略","近端策略优化","强化学习微调","策略梯度","仿真到现实迁移","ReinFlow"]},{"id":"v-gps","category":"named_model","sec":5,"tier":3,"sources":[{"title":"Steering Your Generalists (arXiv 2410.13816)","url":"https://arxiv.org/abs/2410.13816"},{"title":"V-GPS project page","url":"https://nakamotoo.github.io/V-GPS/"}],"as_of":"2024-10","related_ids":["value-guided-sampling","calibrated-q-learning","offline-reinforcement-learning","q-function","inference-time-compute","octo"],"name":"V-GPS","alt":"Value-Guided Policy Steering (Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance)","abbr":"V-GPS","aliases":["Value-Guided Policy Steering","价值引导策略操控"],"one_liner":"部署时用离线强化学习学到的价值函数给通用策略的候选动作重新排序","explanation":"UC Berkeley 与 CMU 的 Mitsuhiko Nakamoto、Sergey Levine 等人 2024 年 10 月发布，发表于 CoRL 2024。通用机器人策略用的演示数据质量参差不齐，数据越大越难挑干净。V-GPS 不动原策略：先用离线强化学习（只用已有数据，主要用 Cal-QL）在 BridgeData V2 和 RT-1 数据上训练一个 Q 函数（给「状态+动作」打分）；部署时让通用策略一次采样 K 个候选动作（论文试了 10 和 50），用 Q 函数挑分最高的执行。它不需要微调、也不需要拿到策略权重，同一个价值函数在 Octo、RT-1-X、OpenVLA 等 5 种策略上都带来提升，是「推理时多花计算换性能」在机器人上的早期代表。","example":"在真机上让 Octo 抓寿司放进碗里：Octo 每步先生成若干个候选动作，V-GPS 的 Q 函数给每个打分，只执行分最高的那个，项目页报告这类任务成功率明显上升。","related":["价值引导采样","校准 Q 学习","离线强化学习","Q 函数","推理时计算","Octo"]},{"id":"generative-value-learning","category":"named_model","sec":5,"tier":3,"sources":[{"title":"Vision Language Models are In-Context Value Learners (arXiv:2411.04549)","url":"https://arxiv.org/abs/2411.04549"},{"title":"Generative Value Learning 项目主页","url":"https://generative-value-learning.github.io/"}],"as_of":"2025-01","related_ids":["progress-reward-model","vlm-as-reward","value-function","success-detector","in-context-learning","data-curation"],"name":"GVL（生成式价值学习）","alt":"Generative Value Learning (Vision Language Models are In-Context Value Learners)","abbr":"GVL","aliases":["生成式价值学习"],"one_liner":"让视觉语言模型给打乱顺序的视频帧估计任务进度，当通用价值函数用","explanation":"Google DeepMind 联合宾夕法尼亚大学、斯坦福在 2024 年 11 月提出，发表于 ICLR 2025。这里的「价值」指任务完成了百分之多少，可用来判断成败、筛选数据、给强化学习当奖励。直接让视觉语言模型（VLM）按时间顺序给每帧打分效果很差，因为相邻帧高度相关，模型容易只按先后给出单调上升的分数。GVL 先把视频帧打乱，再让模型（论文用 Gemini-1.5-Pro）逐帧估计完成度，逼它真正看画面内容。它不需要针对任务训练，在 300 多个真实任务上零样本或少样本可用，还能把人类视频、其他机器人的示例放进上下文来学习。","example":"用 GVL 给一批示范视频打进度分，预测进度与真实时间顺序相关性低的片段（多为失败或低质量示范）可被筛掉，再用剩下的数据训练模仿学习策略。","related":["进度奖励模型","VLM 作奖励模型","价值函数","成功检测器","上下文学习","数据筛选"]},{"id":"grape","category":"named_model","sec":5,"tier":3,"sources":[{"title":"GRAPE: Generalizing Robot Policy via Preference Alignment (arXiv 2411.19309)","url":"https://arxiv.org/abs/2411.19309"},{"title":"GRAPE 项目页","url":"https://grape-vla.github.io/"}],"as_of":"2025-02","related_ids":["direct-preference-optimization","vision-language-action-model","openvla","behavior-cloning","generalization","reinforcement-fine-tuning"],"name":"GRAPE","alt":"GRAPE: Generalizing Robot Policy via Preference Alignment","abbr":"GRAPE","aliases":["偏好对齐机器人策略"],"one_liner":"用成功和失败轨迹做偏好对齐，提升 VLA 在新任务上泛化的方法。","explanation":"GRAPE 由北卡罗来纳大学教堂山分校、华盛顿大学、芝加哥大学的研究者 2024 年 11 月提出，实验以 OpenVLA 为基础模型。多数 VLA 只对成功示范做行为克隆（照着示范学），没见过失败，不知道哪些做法要避免，泛化到新任务时容易出错。GRAPE 借鉴大语言模型的偏好对齐思路：让模型自己执行多次，按得分给整条轨迹排出好坏，再用「轨迹级偏好优化」（TPO）让模型偏向好轨迹，失败轨迹也能提供信息。打分时先把复杂任务拆成若干阶段，由视觉语言模型为各阶段生成时空约束作为评分依据；换一套约束，就能按「更安全」「更高效」等不同目标来对齐。","example":"作者报告，GRAPE 让训练内任务和未见任务的成功率分别提升 51.79% 和 58.20%；按安全、效率目标对齐时，碰撞率下降 37.44%，执行步数减少 11.15%。","related":["直接偏好优化","视觉-语言-动作模型","OpenVLA","行为克隆","泛化","强化学习微调"]},{"id":"conrft","category":"named_model","sec":5,"tier":3,"sources":[{"title":"ConRFT (arXiv 2502.05450)","url":"https://arxiv.org/abs/2502.05450"},{"title":"ConRFT 项目主页","url":"https://cccedric.github.io/conrft/"}],"as_of":"2025-04","related_ids":["reinforcement-fine-tuning","consistency-policy","hil-serl","human-in-the-loop","octo","real-world-reinforcement-learning"],"name":"ConRFT","alt":"ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy","abbr":"ConRFT","aliases":["Cal-ConRFT","HIL-ConRFT"],"one_liner":"先离线、再真机在线，用一致性策略给 VLA 做强化学习微调的方法。","explanation":"ConRFT 由中科院自动化所赵冬斌团队 2025 年 2 月提出，发表于 RSS 2025。VLA 只在少量演示上做监督微调，在接触丰富的真机任务里成功率常常不够，而直接在真机上跑强化学习又慢又不安全。ConRFT 分两段：离线阶段（Cal-ConRFT）把行为克隆和 Q 学习结合，从少量演示里先学出较稳的策略和价值估计；在线阶段（HIL-ConRFT）在真机上继续用强化学习微调，允许人随时接管纠正，保证探索安全。动作头用一致性策略（一步或几步就能生成动作的扩散类模型），便于和强化学习结合。以 Octo-small 为底座，8 个真实任务经 45–90 分钟在线微调后平均成功率 96.3%，比纯监督微调高 144%。","example":"任务包括拿香蕉、开抽屉、把面包放进烤面包机、插车轮、挂中国结等，在线训练时操作员可在机器人快出错时接管。","related":["强化学习微调","Consistency Policy（一致性策略）","HIL-SERL","人在回路","Octo","真机强化学习"]},{"id":"ript-vla","category":"named_model","sec":5,"tier":3,"sources":[{"title":"Interactive Post-Training for Vision-Language-Action Models (arXiv 2505.17016)","url":"https://arxiv.org/abs/2505.17016"}],"as_of":"2025-05","related_ids":["reinforcement-fine-tuning","post-training","openvla-oft","libero-benchmark","proximal-policy-optimization","simplevla-rl"],"name":"RIPT-VLA（交互式后训练）","alt":"RIPT-VLA: Interactive Post-Training for Vision-Language-Action Models","abbr":"","aliases":["RIPT","Reinforcement Interactive Post-Training"],"one_liner":"只用成功/失败二值奖励，对预训练 VLA 做强化学习后训练的方法","explanation":"UT Austin 的 Shuhan Tan、Philipp Krähenbühl 等人 2025 年 5 月发布。VLA 通常先预训练、再用专家演示监督微调，但演示少时效果差。RIPT-VLA 加了第三步「交互式后训练」：让模型在环境里反复尝试，只用任务成败的二值奖励做强化学习。它对同一初始状态采样多次，以同组其他尝试的平均成绩为基线估计优势（留一法），再用 PPO 更新；全成或全败的组没有学习信号，就丢弃重采。它把 QueST 模型提升 21.2%，把 7B 的 OpenVLA-OFT 在 LIBERO 上推到 97.5%；只给 1 条演示时，能把 4% 成功率的模型在 15 轮迭代内提到 97%。","example":"只用 1 条演示微调出的 VLA 成功率仅 4%，接着让它在仿真里自己反复尝试、按成败打分，15 轮迭代后成功率升到 97%。","related":["强化学习微调","后训练","OpenVLA-OFT","LIBERO","近端策略优化","SimpleVLA-RL"]},{"id":"vla-rl","category":"named_model","sec":5,"tier":3,"sources":[{"title":"VLA-RL (arXiv 2505.18719)","url":"https://arxiv.org/abs/2505.18719"},{"title":"GuanxingLu/vlarl (GitHub)","url":"https://github.com/GuanxingLu/vlarl"}],"as_of":"2025-05","related_ids":["reinforcement-fine-tuning","proximal-policy-optimization","reward-model","openvla","libero-benchmark","simplevla-rl"],"name":"VLA-RL","alt":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","abbr":"","aliases":[],"one_liner":"用在线强化学习继续提升自回归 VLA（如 OpenVLA）的早期框架。","explanation":"VLA-RL 由清华大学深圳国际研究生院与南洋理工大学的研究者 2025 年 5 月提出，代码开源。靠模仿演示训练的 VLA 只见过有限状态，一出分布就容易失败；VLA-RL 让预训练好的自回归 VLA 在环境里自己试错、在线改进。它把一次机器人操作轨迹看成多轮多模态对话，用 PPO（近端策略优化）做轨迹级强化学习；为缓解稀疏奖励，把一个视觉语言模型微调成机器人过程奖励模型，训练标签来自自动切分出的任务片段（以夹爪稳定时刻等为关键帧）。工程上还用了课程式选任务、GPU 负载均衡的并行环境、批量解码和价值网络预热等技巧。它是较早系统展示「VLA + 在线 RL」可行性的工作之一，作者还观察到增加测试时优化能继续提升效果。","example":"在 LIBERO 的 40 个操作任务上，VLA-RL 把 OpenVLA-7B 的平均成功率从 76.5% 提到 81.0%，与 π0-FAST 相当。","related":["强化学习微调","近端策略优化","奖励模型","OpenVLA","LIBERO","SimpleVLA-RL"]},{"id":"reinflow","category":"named_model","sec":5,"tier":3,"sources":[{"title":"ReinFlow (arXiv 2505.22094)","url":"https://arxiv.org/abs/2505.22094"},{"title":"ReinFlow project page","url":"https://reinflow.github.io/"}],"as_of":"2025-05","related_ids":["flow-matching","diffusion-policy-policy-optimization","pirl","reinforcement-fine-tuning","rectified-flow","policy-gradient"],"name":"ReinFlow","alt":"ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning","abbr":"","aliases":[],"one_liner":"给流匹配策略注入可学习噪声，再用在线强化学习微调的方法","explanation":"卡内基梅隆大学、清华大学等的 Tonghe Zhang、Chao Yu、Yu Wang 等人 2025 年 5 月发布，发表于 NeurIPS 2025。流匹配策略（用速度场把噪声逐步变成动作的生成式策略）想再用强化学习提升时有个障碍：生成过程是确定性的，算不出动作概率，也缺少探索。ReinFlow 在每个去噪步加一个可学习的高斯噪声，把生成过程变成离散时间马尔可夫过程，就能精确算似然、用策略梯度微调；噪声网络只在训练时用，推理时丢掉。在腿足运动任务上，整流流策略的回合奖励平均提升约 135%，计算开销比扩散策略微调方法 DPPO 少约 83%。它与 DPPO、πRL 同属用强化学习微调生成式策略的方向。","example":"先用演示训练一个只需很少去噪步数的 Shortcut 流策略，再用 ReinFlow 在 robomimic 仿真操作任务上在线强化学习，成功率明显提升。","related":["流匹配","DPPO","πRL","强化学习微调","整流流","策略梯度"]},{"id":"diffusion-steering-via-reinforcement-learning","category":"named_model","sec":5,"tier":3,"sources":[{"title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning (arXiv:2506.15799)","url":"https://arxiv.org/abs/2506.15799"},{"title":"DSRL 项目主页","url":"https://diffusion-steering.github.io/"}],"as_of":"2025-06","related_ids":["noise-space-policy-steering","diffusion-policy","pi0","real-world-reinforcement-learning","residual-reinforcement-learning","diffusion-policy-policy-optimization"],"name":"DSRL（扩散策略噪声空间强化学习）","alt":"Diffusion Steering via Reinforcement Learning (Steering Your Diffusion Policy with Latent Space RL)","abbr":"DSRL","aliases":["Diffusion Steering","扩散引导强化学习"],"one_liner":"不改扩散策略的权重，只用强化学习挑选输入噪声，引导它产生更好的动作。","explanation":"DSRL 由 UC 伯克利 Sergey Levine 组的 Andrew Wagenmaker 等人与华盛顿大学、亚马逊的研究者于 2025 年 6 月提出，发表于 CoRL 2025。扩散策略生成动作时先采一个随机噪声再去噪，同一观测下换不同初始噪声会得到不同动作。DSRL 把这个初始噪声当作新的「动作空间」，训练一个小的强化学习策略（MLP）根据观测输出噪声，再交给冻结的扩散策略去噪。基础策略权重完全不动，只需黑盒调用；由于噪声最终都映射成演示数据里合理的动作，探索更有方向，需要的真机交互也少。它适合让行为克隆训练出的策略在新环境里快速自主改进，是噪声空间策略引导的代表工作。","example":"作者把公开的 π0（DROID 权重）当作黑盒，只在它的噪声空间上跑强化学习，就在真机操作任务上改进了表现，无需微调 π0 本身。","related":["噪声空间策略引导","扩散策略","π0","真机强化学习","残差强化学习","DPPO"]},{"id":"robomonkey","category":"named_model","sec":5,"tier":3,"sources":[{"title":"arXiv 2506.17811: RoboMonkey","url":"https://arxiv.org/abs/2506.17811"},{"title":"RoboMonkey 项目主页","url":"https://robomonkey-vla.github.io/"}],"as_of":"2025-07","related_ids":["inference-time-compute","best-of-n-sampling","value-guided-sampling","vision-language-action-model","openvla","reward-model"],"name":"RoboMonkey","alt":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","abbr":"","aliases":[],"one_liner":"部署时多采样几组动作、再用 VLM 验证器挑最优，提升 VLA 鲁棒性","explanation":"RoboMonkey 由斯坦福、加州大学伯克利分校和英伟达的研究者在 2025 年 6 月发布，CoRL 2025 录用，把大语言模型里的「推理时扩展」思路搬到 VLA 上。它不改动原策略：部署时先从 VLA 采样若干动作，加高斯扰动并用多数投票构造候选集，再由一个基于视觉语言模型的动作验证器打分，选出最好的一组执行。验证器用自动合成的偏好数据训练（按候选动作与真值动作的距离排序），作者发现合成数据越多验证越准，动作误差与采样数量之间也呈近似幂律关系。配合 OpenVLA 等模型，它在分布外任务上绝对提升 25%，分布内提升 9%；优化后的服务引擎约 650 毫秒即可采样并验证 16 个候选动作。","example":"OpenVLA 遇到没见过的物体时，RoboMonkey 让它一次采样多组抓取动作，由验证器挑出最可能成功的那组去执行。","related":["推理时计算","最优 N 采样","价值引导采样","视觉-语言-动作模型","OpenVLA","奖励模型"]},{"id":"rac","category":"named_model","sec":5,"tier":3,"sources":[{"title":"RaC (arXiv 2509.07953)","url":"https://arxiv.org/abs/2509.07953"},{"title":"RaC project page","url":"https://rac-scaling-robot.github.io/"}],"as_of":"2025-09","related_ids":["recovery-and-correction-data","human-in-the-loop","human-intervention-data","long-horizon-task","compounding-error","hil-serl"],"name":"RaC","alt":"RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction","abbr":"RaC","aliases":["Recovery and Correction"],"one_liner":"让人类在失败前接管、先恢复再纠正，以此扩展长程任务数据的方法","explanation":"卡内基梅隆大学 Zheyuan Hu、Zackory Erickson、Aviral Kumar 等人 2025 年 9 月发布。作者发现，在接触丰富、柔性物体和长程任务上，只堆专家演示，模仿学习成功率会卡住，因为专家数据里几乎没有「出错后怎么办」。RaC 在模仿学习预训练后加一个人在回路微调阶段：策略执行时，操作员在即将失败时接管，先把机器人退回熟悉的分布内状态（恢复），再示范完成当前子任务（纠正），随即结束该回合。在挂衬衫、密封保鲜盒盖、打包外卖盒三个真机双臂任务和一个仿真装配任务上，它用约十分之一的采集时间和样本超过此前最好方法，成功率还随策略执行的恢复动作次数线性提升。","example":"比如挂衬衫时策略快要把衣架挂歪，操作员接管，先把手臂退回正常拿衣架的姿态，再示范一次挂好，这段干预数据加入微调。","related":["纠偏数据","人在回路","干预数据","长程任务","复合误差","HIL-SERL"]},{"id":"simplevla-rl","category":"named_model","sec":5,"tier":3,"sources":[{"title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning (arXiv 2509.09674)","url":"https://arxiv.org/abs/2509.09674"},{"title":"PRIME-RL/SimpleVLA-RL (GitHub)","url":"https://github.com/PRIME-RL/SimpleVLA-RL"}],"as_of":"2026-01","related_ids":["reinforcement-fine-tuning","openvla-oft","verl","reinforcement-learning-with-verifiable-rewards","robotwin","libero-benchmark"],"name":"SimpleVLA-RL","alt":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","abbr":"","aliases":[],"one_liner":"只用「成功/失败」奖励，对 VLA 做大规模在线强化学习的开源框架","explanation":"清华大学、上海人工智能实验室等机构 2025 年 9 月发布并开源，论文被 ICLR 2026 接收。VLA 通常靠监督微调（SFT）模仿人类演示，但高质量真机演示很贵，模仿出来的策略遇到分布外情况也容易失败。SimpleVLA-RL 借鉴大语言模型用强化学习提升推理能力的做法，在大模型强化学习框架 veRL 上做了面向 VLA 的改造，包括交互式轨迹采样、多环境并行渲染和分布式训练；奖励只看任务最后成没成功（0 或 1），不用人工设计奖励。以 OpenVLA-OFT 为基础模型，它在 LIBERO 上达到当时最好水平，在 RoboTwin 1.0 和 2.0 上超过 π0；每个任务只给 1 条演示做 SFT 时，LIBERO-Long 成功率可从 17.3% 提到 91.7%。作者还观察到「pushcut」现象：RL 训练中策略自己发现了演示里没有的做法，比如把本该抓起的物体直接推到位。","example":"在 LIBERO 仿真里，先用每个任务 1 条演示把 OpenVLA-OFT 微调到偶尔能成功，再让它在大量并行环境里反复尝试、只按最终成败给奖励，成功率就能大幅上升。","related":["强化学习微调","OpenVLA-OFT","veRL","基于可验证奖励的强化学习","RoboTwin","LIBERO"]},{"id":"vla-rft","category":"named_model","sec":5,"tier":3,"sources":[{"title":"VLA-RFT (arXiv 2510.00406)","url":"https://arxiv.org/abs/2510.00406"},{"title":"VLA-RFT 项目主页","url":"https://vla-rft.github.io/"}],"as_of":"2025-10","related_ids":["world-model","reinforcement-fine-tuning","group-relative-policy-optimization","vla-adapter","wmpo","learning-in-imagination"],"name":"VLA-RFT","alt":"VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators","abbr":"","aliases":["世界模型中的 VLA 强化微调"],"one_liner":"在学出来的世界模型里跑强化学习，只用几百步就把 VLA 调得更稳。","explanation":"VLA-RFT 由西湖大学、浙江大学、OpenHelix 团队等 2025 年 10 月提出。只靠模仿学习的 VLA 容易误差累积、遇到扰动就失败；强化学习能改善，但真机交互昂贵，传统仿真器又有虚实差距。它的做法是先用真实交互数据训练一个约 1.38 亿参数的自回归世界模型，根据当前画面和动作预测未来画面，把它当作可控的模拟器；策略在里面推演一整段轨迹，奖励由预测画面与专家参考轨迹画面之间的像素误差（L1）和感知误差（LPIPS）算出，属于可验证奖励；再用 GRPO（组相对策略优化）更新策略。基座策略是 VLA-Adapter。不到 400 步微调就超过监督微调基线，并在物体位置、初始状态等扰动下更稳健。它说明世界模型可以作为 VLA 后训练的实用环境。","example":"LIBERO 上，VLA-Adapter 监督微调基线平均成功率 86.6%，在世界模型里做 400 步强化微调后提升到 91.1%。","related":["世界模型","强化学习微调","组相对策略优化","VLA-Adapter","WMPO","想象中学习"]},{"id":"rl-100","category":"named_model","sec":5,"tier":3,"sources":[{"title":"RL-100 (arXiv 2510.14830)","url":"https://arxiv.org/abs/2510.14830"},{"title":"RL-100 project page","url":"https://lei-kun.github.io/RL-100/"},{"title":"Tech Xplore: RL-100 framework helps robots refine learned tasks","url":"https://techxplore.com/news/2026-08-rl-framework-robots-refine-tasks.html"}],"as_of":"2026-08","related_ids":["real-world-reinforcement-learning","diffusion-policy","consistency-model","proximal-policy-optimization","offline-to-online-reinforcement-learning","hil-serl"],"name":"RL-100","alt":"RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning","abbr":"","aliases":[],"one_liner":"基于扩散策略的真机强化学习框架，8 个任务 1000 次试验全部成功","explanation":"上海交通大学、上海期智研究院、清华大学等团队（许华哲等）2025 年 10 月发布，2026 年发表于 Science Robotics。它瞄准家庭和工厂部署需要的、接近熟练操作员的可靠性。框架建立在扩散视觉运动策略上，分三阶段：模仿学习人类演示、离线强化学习、真机在线强化学习，三阶段共用一个作用在去噪过程上的裁剪 PPO 目标，让改进保守稳定；再用一致性蒸馏把多步去噪压成一步，满足高频控制。在推物、保龄球、倒水、叠布、拧螺丝、榨汁、折纸盒等 8 个真机任务上取得 1000/1000 次成功，完成速度达到或超过专家遥操作员。","example":"部署在商场的榨汁机器人零样本连续为随机顾客服务约 7 小时，没有出现失败。","related":["真机强化学习","扩散策略","一致性模型","近端策略优化","离线到在线强化学习","HIL-SERL"]},{"id":"pirl","category":"named_model","sec":5,"tier":3,"sources":[{"title":"πRL (arXiv:2510.25889)","url":"https://arxiv.org/abs/2510.25889"},{"title":"πRL 论文 HTML 版","url":"https://arxiv.org/html/2510.25889"}],"as_of":"2026-01","related_ids":["pi0","pi0-5","rlinf","reinforcement-fine-tuning","flow-matching","proximal-policy-optimization"],"name":"πRL","alt":"πRL: Online RL Fine-tuning for Flow-based Vision-Language-Action Models","abbr":"","aliases":["piRL","pi_RL","π_RL"],"one_liner":"给 π0、π0.5 这类流匹配 VLA 做在线强化学习微调的开源框架","explanation":"清华大学、北京大学、中科院自动化所等团队 2025 年 10 月发布，构建在开源强化学习框架 RLinf 上。难点在于流匹配 VLA 通过多步去噪生成动作，算不出动作的对数概率，没法直接套用 PPO 这类策略梯度算法。πRL 给了两种解法：Flow-Noise 把去噪过程建模成离散时间 MDP，用一个可学习的噪声网络让对数似然可以精确计算；Flow-SDE 把确定性的 ODE 采样改成带随机性的 SDE 采样，把去噪和环境交互组成两层 MDP，便于探索。在 LIBERO 和 ManiSkill 上都大幅提升了少样本监督微调后的策略，也在 GR00T N1.5 上做了验证。","example":"只用少量演示监督微调的 π0 在 LIBERO 上成功率 57.6%，经 πRL 强化学习后达到 97.6%；π0.5 从 77.1% 提到 98.3%。","related":["π0","π0.5","RLinf","强化学习微调","流匹配","近端策略优化"]},{"id":"wmpo","category":"named_model","sec":5,"tier":3,"sources":[{"title":"WMPO (arXiv:2511.09515)","url":"https://arxiv.org/abs/2511.09515"},{"title":"WMPO 项目主页","url":"https://wm-po.github.io"}],"as_of":"2025-11","related_ids":["world-model","reinforcement-fine-tuning","group-relative-policy-optimization","learning-in-imagination","openvla-oft","vla-rft"],"name":"WMPO（基于世界模型的策略优化）","alt":"WMPO: World Model-based Policy Optimization for Vision-Language-Action Models","abbr":"WMPO","aliases":["World-Model-based Policy Optimization"],"one_liner":"让 VLA 在视频世界模型「想象」的轨迹里做强化学习，不用碰真机","explanation":"香港科技大学与字节跳动 Seed 的研究者 2025 年 11 月提出。VLA 只靠专家演示学习，学不会从失败中纠正；直接在真机上做强化学习又太费样本。WMPO 先训练一个预测像素画面的视频世界模型，让 VLA 在模型「想象」出的轨迹里反复试做，再用同策略的 GRPO（组相对策略优化：同一任务采多条轨迹互相比较打分）更新策略，全程不与真实环境交互。选像素而不是隐空间，是为了让想象画面和 VLA 在网络图像上预训练的视觉特征对得上。实验以 OpenVLA-OFT 为基础策略，在 MimicGen 仿真任务和 Mobile ALOHA 真机上都优于 GRPO、DPO 基线，并出现自我纠错行为。","example":"真机「把方块插到杆上」任务（间隙 5 毫米）中，基础策略成功率 53%，DPO 为 60%，WMPO 提到 70%（各 30 次试验）。","related":["世界模型","强化学习微调","组相对策略优化","想象中学习","OpenVLA-OFT","VLA-RFT"]},{"id":"vla-opd","category":"named_model","sec":5,"tier":3,"sources":[{"title":"VLA-OPD (arXiv 2603.26666)","url":"https://arxiv.org/abs/2603.26666"},{"title":"VLA-OPD 项目主页","url":"https://irpn-lab.github.io/VLA-OPD/"}],"as_of":"2026-03","related_ids":["on-policy-distillation","supervised-fine-tuning","reinforcement-fine-tuning","catastrophic-forgetting","kullback-leibler-divergence","simplevla-rl"],"name":"VLA-OPD","alt":"VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation","abbr":"VLA-OPD","aliases":["On-Policy VLA Distillation","VLA 在线策略蒸馏"],"one_liner":"让强教师在学生自己跑出的轨迹上逐 token 纠错的 VLA 后训练方法。","explanation":"VLA-OPD 是港科大（广州）团队 2026 年 3 月提出的 VLA 后训练框架。离线监督微调（SFT）只学演示数据，遇到自己走偏的状态就不会处理，还容易灾难性遗忘预训练能力；在线强化学习又受稀疏奖励拖累，样本效率低。VLA-OPD 走中间路线，即在线策略蒸馏：学生策略自己在环境里执行，由一个更强的教师策略在这些学生亲自到达的状态上给出逐 token 的稠密监督，不依赖环境奖励。损失用反向 KL 散度，作者认为它偏向「选定一个模式」，比正向 KL（易使熵爆炸）和硬交叉熵（易使熵过早坍缩）训练更稳。实验中教师是 SimpleVLA-RL 训练出的专家，学生是 OpenVLA-OFT，在 LIBERO 和 RoboTwin 2.0 上比强化学习样本效率更高、比 SFT 更稳健，也更少遗忘。","example":"LIBERO 上，学生只用 1 条演示微调后平均成功率 48.9%；经 VLA-OPD 蒸馏升到 87.4%，再接 GRPO 强化学习到 93.4%，接近教师的 93.9%。","related":["在线策略蒸馏","监督微调","强化学习微调","灾难性遗忘","KL 散度","SimpleVLA-RL"]},{"id":"robometer","category":"named_model","sec":5,"tier":3,"sources":[{"title":"arXiv 2603.02115: Robometer","url":"https://arxiv.org/abs/2603.02115"},{"title":"Robometer 项目主页","url":"https://robometer.github.io/"}],"as_of":"2026-05","related_ids":["reward-model","progress-reward-model","vlm-as-reward","dense-reward","success-detector","failure-data"],"name":"Robometer","alt":"Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons","abbr":"","aliases":["RBM-1M"],"one_liner":"用任务进度加轨迹两两比较训练的通用机器人奖励模型","explanation":"Robometer 由南加州大学、华盛顿大学、MIT、艾伦人工智能研究所、英伟达等机构在 2026 年 3 月发布，RSS 2026 录用。强化学习和数据筛选都需要一个能判断机器人「做得怎么样」的奖励模型，但以往方法主要依赖专家演示上的逐帧进度标注，大量失败和次优轨迹用不上。Robometer 同时用两种监督：帧级进度损失，在专家数据上锚定奖励的大小；轨迹比较的偏好损失，学会判断两条轨迹哪条更好，从而能利用失败数据。作者整理了超过 100 万条轨迹、覆盖 21 种机器人本体的 RBM-1M 数据集，模型基于 Qwen3-VL（主版本 4B）。得到的奖励可用于在线和离线强化学习、失败检测以及模仿学习的数据检索。","example":"给一段机器人执行「把杯子放进抽屉」的视频，Robometer 逐帧输出任务进度分数，这条曲线可直接当强化学习的稠密奖励，也可用来判断这次尝试是否失败。","related":["奖励模型","进度奖励模型","VLM 作奖励模型","稠密奖励","成功检测器","失败数据"]},{"id":"nvidia-isaac-gr00t-n1","category":"named_model","sec":6,"tier":1,"sources":[{"title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)","url":"https://arxiv.org/abs/2503.14734"},{"title":"NVIDIA/Isaac-GR00T GitHub 仓库","url":"https://github.com/NVIDIA/Isaac-GR00T"},{"title":"GR00T N1.6 研究页（NVIDIA GEAR）","url":"https://research.nvidia.com/labs/gear/gr00t-n1_6/"}],"as_of":"2026-04","related_ids":["dual-system-architecture","data-pyramid","flow-matching","diffusion-transformer","nvidia-generalist-embodied-agent-research-lab","egoscale"],"name":"GR00T N1 系列","alt":"NVIDIA Isaac GR00T N1 / N1.5 / N1.6 / N1.7","abbr":"GR00T","aliases":["GR00T N1","GR00T N1.5","GR00T N1.6","GR00T N1.7","Isaac GR00T","Groot","Isaac GR00T 代码库","Isaac-GR00T Repository","Isaac-GR00T"],"one_liner":"英伟达开放的人形机器人基础模型系列，快慢双系统架构，2025 年起持续迭代。","explanation":"GR00T N1 是英伟达 2025 年 3 月 18 日在 GTC 大会发布的开放人形机器人基础模型（约 22 亿参数），代码用 Apache 2.0、权重用英伟达开放模型许可，可商用。它采用快慢双系统：System 2 是视觉语言模型（N1 用 Eagle-2），负责看图理解指令；System 1 是用流匹配训练的扩散 Transformer，据此生成连续动作块，不同机器人用各自的状态/动作编解码器。数据按「数据金字塔」组织：底层是网络和人类视频，中层是仿真和视频模型生成的合成数据，顶层是真机数据。之后 N1.5（2025 年 6 月）冻结 VLM、加入能从人类视频学习的 FLARE 损失；N1.6（2025 年 12 月）换用 Cosmos 系 VLM、动作头加倍、改为预测相对动作；N1.7（2026 年 4 月起）约 30 亿参数，VLM 换成 Cosmos-Reason2-2B，并加入约 2 万小时 EgoScale 人类第一视角视频预训练。","example":"官方在 Hugging Face 提供 GR00T-N1.7-3B 及其在 LIBERO、DROID、SimplerEnv 上微调好的版本；README 建议推理用 16GB 以上显存的 GPU，微调用 40GB 以上。","related":["快慢双系统","数据金字塔","流匹配","扩散 Transformer","英伟达 GEAR 实验室","EgoScale"]},{"id":"nvidia-isaac-gr00t-n2","category":"named_model","sec":6,"tier":2,"sources":[{"title":"NVIDIA and Global Robotics Leaders Take Physical AI to the Real World (NVIDIA Newsroom, 2026-03-16)","url":"https://nvidianews.nvidia.com/news/nvidia-and-global-robotics-leaders-take-physical-ai-to-the-real-world"},{"title":"World Action Models are Zero-shot Policies (DreamZero, arXiv 2602.15922)","url":"https://arxiv.org/abs/2602.15922"},{"title":"NVIDIA/Isaac-GR00T GitHub 仓库","url":"https://github.com/NVIDIA/Isaac-GR00T"}],"as_of":"2026-09","related_ids":["nvidia-isaac-gr00t-n1","dreamzero","world-action-model","vision-language-action-model","roboarena","nvidia"],"name":"GR00T N2","alt":"NVIDIA Isaac GR00T N2","abbr":"","aliases":["Isaac GR00T N2"],"one_liner":"英伟达 2026 年预告的下一代机器人基础模型，从 VLA 改为世界动作模型架构。","explanation":"GR00T N2 是英伟达 2026 年 3 月 16 日在 GTC 2026 上预告的下一代通用机器人基础模型，接替 GR00T N1 系列（N1、N1.5、N1.6、N1.7）。N1 系列走 VLA 路线：视觉语言模型负责理解画面和指令，扩散式动作头输出动作。按官方新闻稿，N2「基于 DreamZero 研究」，改用世界动作模型（WAM）架构：以预训练视频生成模型为底座，同时预测未来画面和机器人动作，从视频里学物理动态，而不只是语义。英伟达称它在新环境中完成新任务的成功率是领先 VLA 的两倍多，发布时在 MolmoSpaces 和 RoboArena 两个通用策略评测上排名第一。官方计划 2026 年底前推出；截至 2026 年 9 月，英伟达在 Hugging Face 上公开的最新 GR00T 权重仍是 N1.7 系列。","example":"它的研究基础 DreamZero 以一个 140 亿参数的自回归视频扩散模型为底座，经优化后能以 7Hz 实时闭环控制机器人；换到新机器人只需约 30 分钟的玩耍数据就能适配。","related":["GR00T N1 系列","DreamZero","世界动作模型","视觉-语言-动作模型","RoboArena","英伟达"]},{"id":"nvidia-cosmos","category":"named_model","sec":6,"tier":2,"sources":[{"title":"Cosmos World Foundation Model Platform for Physical AI (arXiv 2501.03575)","url":"https://arxiv.org/abs/2501.03575"},{"title":"NVIDIA Launches Cosmos World Foundation Model Platform to Accelerate Physical AI Development (NVIDIA Newsroom, 2025-01-06)","url":"https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-world-foundation-model-platform-to-accelerate-physical-ai-development"},{"title":"Cosmos 3: Omnimodal World Models for Physical AI (arXiv 2606.02800)","url":"https://arxiv.org/abs/2606.02800"}],"as_of":"2026-06","related_ids":["world-foundation-model","nvidia-cosmos-predict","nvidia-cosmos-transfer","nvidia-cosmos-reason","cosmos-3","nvidia"],"name":"Cosmos","alt":"NVIDIA Cosmos World Foundation Models","abbr":"","aliases":["Cosmos 世界基础模型","Cosmos WFM","NVIDIA Cosmos"],"one_liner":"英伟达的开放世界基础模型平台，用视频生成模型给机器人和自动驾驶造数据、做预演。","explanation":"Cosmos 是英伟达 2025 年 1 月 6 日在 CES 发布的世界基础模型平台。世界基础模型（WFM）指先在海量视频上预训练、学会「世界接下来会怎么变化」的通用模型，再针对具体机器人或自动驾驶场景后训练。平台包括视频筛选流水线（从约 2000 万小时原始视频中切出约 1 亿个片段）、视频分词器 Cosmos Tokenizer、扩散式和自回归式两类预训练模型及后训练示例，以开放权重发布。之后分出几条产品线：Cosmos Predict 预测未来画面，Cosmos Transfer 按分割图、深度图等结构化输入生成逼真视频，Cosmos Reason 用多模态大模型做物理常识和具身推理。2026 年 6 月的 Cosmos 3 把语言、图像、视频、音频和动作放进同一个混合 Transformer 模型，分 Edge、Nano（16B）、Super（64B）等规格，按 Linux 基金会 OpenMDW-1.1 许可开放。","example":"Cosmos Transfer 的一个用途是仿真到现实：把仿真器渲染出的分割图、深度图、边缘图当条件，生成看起来像真实拍摄的视频，用来扩充机器人和自动驾驶的训练数据。","related":["世界基础模型","Cosmos Predict","Cosmos Transfer","Cosmos Reason","Cosmos 3","英伟达"]},{"id":"nvidia-cosmos-predict","category":"named_model","sec":6,"tier":3,"sources":[{"title":"nvidia-cosmos/cosmos-predict2.5 GitHub 仓库","url":"https://github.com/nvidia-cosmos/cosmos-predict2.5"},{"title":"nvidia-cosmos/cosmos-predict2 GitHub 仓库","url":"https://github.com/nvidia-cosmos/cosmos-predict2"},{"title":"Cosmos World Foundation Model Platform for Physical AI (arXiv 2501.03575)","url":"https://arxiv.org/abs/2501.03575"}],"as_of":"2026-06","related_ids":["nvidia-cosmos","world-foundation-model","video-generation-model","cosmos-policy","dreamgen","cosmos-3"],"name":"Cosmos Predict","alt":"NVIDIA Cosmos Predict","abbr":"","aliases":["Cosmos-Predict1","Cosmos-Predict2","Cosmos-Predict2.5"],"one_liner":"英伟达 Cosmos 家族的视频世界模型，根据文字、图像或视频生成接下来的画面。","explanation":"Cosmos Predict 是英伟达 Cosmos 世界基础模型家族中负责预测未来画面的分支。Predict1 于 2025 年 1 月随 Cosmos 平台发布，有 7B/14B 扩散模型和多档自回归模型；Predict2 于 2025 年 6 月开放，视频模型有 2B、14B；Predict2.5 于 2025 年 10 月发布，改用基于流（flow）的生成方式，以 Cosmos-Reason1 作文本编码器，把文生、图生和视频续写合进一个模型。它的定位是给机器人和自动驾驶做可微调的底座：用机器人数据后训练，可得到按动作预测画面的模拟器、多视角生成器，或直接当策略（如 Cosmos Policy）。2026 年起英伟达主推统一的 Cosmos 3，Predict 仓库不再活跃开发。","example":"官方提供在 Bridge 机器人数据上做动作条件后训练的 Cosmos-Predict2 版本：输入当前画面和一串机械臂动作，生成执行这些动作后的视频；GR00T Dreams 也用它的后训练版本生成机器人训练视频。","related":["Cosmos","世界基础模型","视频生成模型","Cosmos Policy","DreamGen（GR00T Dreams）","Cosmos 3"]},{"id":"nvidia-cosmos-transfer","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control (arXiv 2503.14492)","url":"https://arxiv.org/abs/2503.14492"},{"title":"nvidia-cosmos/cosmos-transfer2.5 GitHub 仓库","url":"https://github.com/nvidia-cosmos/cosmos-transfer2.5"}],"as_of":"2026-02","related_ids":["nvidia-cosmos","sim-to-real-transfer","sim-to-real-gap","generative-data-augmentation","synthetic-data","nvidia-cosmos-predict"],"name":"Cosmos Transfer","alt":"NVIDIA Cosmos Transfer","abbr":"","aliases":["Cosmos-Transfer1","Cosmos-Transfer2.5"],"one_liner":"英伟达的可控视频生成模型，按深度、分割、边缘等结构图生成逼真视频。","explanation":"Cosmos Transfer 是英伟达 Cosmos 家族中做条件生成的分支，采用多路 ControlNet 结构（把额外的结构图作为生成条件）。输入分割图、深度图、边缘图、模糊画面、高精地图或激光雷达等空间控制信号，输出布局和运动不变、但光照、天气、材质可换的逼真视频。Cosmos-Transfer1 于 2025 年 3 月发布，可以在画面不同位置给不同控制信号分配不同权重；Cosmos-Transfer2.5 于 2025 年 10 月发布，2B 参数，基于 Predict2.5，2026 年 2 月又推出低延迟的蒸馏版。主要用途是数据增强：把仿真器渲染的机器人或驾驶画面变成照片级视频，缩小虚实差距；或把一段真实录像改成雨天、夜晚等版本，扩充训练数据。","example":"在 Isaac Sim 里渲染一段机械臂抓取视频，提取深度图和分割图交给 Cosmos Transfer，换不同文字提示，就能得到多种背景、光照的逼真版本，用来训练更抗视觉干扰的策略。","related":["Cosmos","仿真到现实迁移","虚实差距","生成式数据增强","合成数据","Cosmos Predict"]},{"id":"nvidia-cosmos-reason","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning (arXiv 2503.15558)","url":"https://arxiv.org/abs/2503.15558"},{"title":"nvidia-cosmos/cosmos-reason2 GitHub 仓库","url":"https://github.com/nvidia-cosmos/cosmos-reason2"},{"title":"nvidia-cosmos/cosmos-reason1 GitHub 仓库","url":"https://github.com/nvidia-cosmos/cosmos-reason1"}],"as_of":"2026-04","related_ids":["vision-language-model","embodied-reasoning-model","chain-of-thought","nvidia-cosmos","qwen-vl","nvidia-alpamayo"],"name":"Cosmos Reason","alt":"NVIDIA Cosmos Reason","abbr":"","aliases":["Cosmos-Reason1","Cosmos-Reason2"],"one_liner":"英伟达面向物理 AI 的推理视觉语言模型，看视频后先推理再回答。","explanation":"Cosmos Reason 是英伟达 Cosmos 家族中负责理解和推理的视觉语言模型。Cosmos-Reason1 于 2025 年 3 月发布，训练分两步：先用物理 AI 数据监督微调，再做强化学习，让模型先写思维链再作答；论文有 7B、56B 两档，开源的是基于 Qwen2.5-VL 的 7B。它关注物理常识（空间、时间、基本物理）和具身推理（机器人下一步该做什么）。Cosmos-Reason2 于 2025 年 12 月发布，改用 Qwen3-VL，有 2B、8B，2026 年 4 月加入 32B。常见用法是给生成视频挑物理错误、筛选和标注训练数据、做机器人的规划模块；Cosmos-Predict2.5 用它当文本编码器，驾驶模型 Alpamayo 也以它为骨干。","example":"给它一段 AI 生成的机器人操作视频，问「画面是否符合物理规律」，它会先输出推理过程（如物体是否凭空移动、是否穿模），再给出判断，可用来自动筛掉不合格的合成数据。","related":["视觉语言模型","具身推理模型","思维链","Cosmos","通义千问 Qwen-VL","英伟达 Alpamayo（驾驶推理 VLA）"]},{"id":"cosmos-policy","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Cosmos Policy (arXiv:2601.16163)","url":"https://arxiv.org/abs/2601.16163"},{"title":"Cosmos Policy 项目主页（NVIDIA Research）","url":"https://research.nvidia.com/labs/cosmos-lab/cosmos-policy/"}],"as_of":"2026-01","related_ids":["nvidia-cosmos-predict","video-generation-model","world-action-model","value-function","openvla-oft","libero-benchmark"],"name":"Cosmos Policy","alt":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","abbr":"","aliases":["Cosmos 策略"],"one_liner":"把视频生成模型直接微调成机器人策略，同时预测动作、未来画面和成功把握。","explanation":"英伟达与斯坦福 2026 年 1 月提出，一作 Moo Jin Kim（也是 OpenVLA-OFT 一作），收录于 ICLR 2026。它以视频生成模型 Cosmos-Predict2-2B 为底座，不改结构、不加动作头，只在机器人演示数据上做一次后训练：把本体状态、动作块和价值（预期回报）都编码成「隐帧」，插进视频扩散模型的隐空间序列，和图像帧一起去噪生成。于是模型一次给出三样东西：要执行的动作、执行后的未来画面、这一步成功的把握。推理时可以直接执行动作，也可以采样多个候选、用预测的未来和价值挑最好的（测试时规划）。LIBERO 平均成功率 98.5%，RoboCasa 67.1%（每任务 50 条演示），是「视频模型直接当策略」路线的代表。","example":"在 ALOHA 双臂真机任务（如把糖果装进密封袋）中，规划模式下 Cosmos Policy 先采样 8 个候选动作块，再用自己预测的未来画面和价值打分，挑最有把握的那个执行。","related":["Cosmos Predict","视频生成模型","世界动作模型","价值函数","OpenVLA-OFT","LIBERO"]},{"id":"cosmos-3","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Cosmos 3: Omnimodal World Models for Physical AI (arXiv:2606.02800)","url":"https://arxiv.org/abs/2606.02800"},{"title":"NVIDIA Cosmos GitHub（Cosmos 3 模型家族与发布记录）","url":"https://github.com/nvidia/cosmos"}],"as_of":"2026-07","related_ids":["nvidia-cosmos","world-foundation-model","mixture-of-transformers","unified-multimodal-model","world-action-model","cosmos-policy"],"name":"Cosmos 3","alt":"Cosmos 3: Omnimodal World Models for Physical AI","abbr":"","aliases":["Cosmos3","英伟达 Cosmos 3"],"one_liner":"英伟达第三代全模态世界模型：一个模型既能理解、生成视频，也能输出动作。","explanation":"英伟达 Cosmos 世界基础模型家族的第三代，2026 年 5 月发布，技术报告 2026 年 6 月上 arXiv。前两代把理解（Cosmos Reason）和视频生成（Cosmos Predict）分成不同模型；Cosmos 3 用混合 Transformer（MoT）架构把它们合进一个模型：自回归的语言塔负责读文字、做推理，扩散的生成塔负责输出图像、视频、音频和动作序列，两塔共享注意力。同一套权重可以当视觉语言模型、文生/图生视频模型、按动作预测未来画面的世界模拟器，也能后训练成机器人策略。开放 Super（64B）和 Nano（16B）两档，2026 年 7 月又放出面向 Jetson 端侧的 Edge（4B），代码和权重采用 OpenMDW-1.1 许可。","example":"据技术报告，用 DROID 数据后训练出的 Cosmos3-Nano-Policy 在 RoboArena 真机评测榜（2026-05-30 快照）上以 Elo 1870 排名第一。","related":["Cosmos","世界基础模型","混合 Transformer 架构","统一多模态模型","世界动作模型","Cosmos Policy"]},{"id":"dreamgen","category":"named_model","sec":6,"tier":3,"sources":[{"title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models (arXiv 2505.12705)","url":"https://arxiv.org/abs/2505.12705"},{"title":"DreamGen 项目主页（NVIDIA GEAR）","url":"https://research.nvidia.com/labs/gear/dreamgen/"},{"title":"NVIDIA Computex 2025 新闻稿：GR00T N1.5 与 GR00T-Dreams","url":"https://nvidianews.nvidia.com/news/nvidia-powers-humanoid-robot-industry-with-cloud-to-robot-computing-platforms-for-physical-ai"}],"as_of":"2025-05","related_ids":["neural-trajectories","video-generation-model","inverse-dynamics-model","latent-action-model","nvidia-isaac-gr00t-n1","nvidia-cosmos-predict"],"name":"DreamGen（GR00T Dreams）","alt":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","abbr":"","aliases":["GR00T Dreams","GR00T-Dreams","Isaac GR00T-Dreams"],"one_liner":"英伟达 2025 年提出，用视频世界模型生成机器人视频并反推动作来造训练数据。","explanation":"DreamGen 是英伟达 GEAR 实验室等于 2025 年 5 月提出的合成数据流程，开源实现叫 Isaac GR00T-Dreams 蓝图，同月在台北电脑展（Computex）发布。机器人学新动作通常要人遥操作采大量数据。DreamGen 分四步：先用目标机器人的数据微调图生视频模型（开源实现用 Cosmos-Predict2）；再给一张初始画面和一句语言指令，让模型生成机器人做新动作、身处新环境的逼真视频；然后用逆动力学模型或潜在动作模型从视频里反推伪动作标签；最后把这些「神经轨迹」和真实数据一起训练视觉运动策略。论文还提出 DreamGen Bench，发现视频生成质量越高，训出的策略越好。英伟达称用 GR00T-Dreams 在 36 小时内为 GR00T N1.5 生成了训练数据，人工采集约需三个月。","example":"只用单一环境里一个抓取放置任务的遥操作数据，再加上 DreamGen 生成的视频，GR1 人形机器人学会了 22 种新动作，并能在 10 个没见过的环境里执行。","related":["神经轨迹","视频生成模型","逆动力学模型","潜在动作模型","GR00T N1 系列","Cosmos Predict"]},{"id":"dreamdojo","category":"named_model","sec":6,"tier":3,"sources":[{"title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos (arXiv 2602.06949)","url":"https://arxiv.org/abs/2602.06949"},{"title":"DreamDojo 项目主页","url":"https://dreamdojo-world.github.io/"}],"as_of":"2026-02","related_ids":["world-model","latent-action","egocentric-video","egodex","nvidia-cosmos-predict","world-model-based-policy-evaluation"],"name":"DreamDojo","alt":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","abbr":"","aliases":[],"one_liner":"英伟达 2026 年发布的通用机器人世界模型，用约 4.4 万小时人类视频预训练。","explanation":"DreamDojo 是英伟达牵头、联合 UC Berkeley、港科大、斯坦福等于 2026 年 2 月发布的通用机器人世界模型（能根据动作预测未来画面的模型）。机器人数据少且贵，人做事的视频很多却没有动作标签。DreamDojo 整理了约 4.47 万小时的第一人称人类视频（主体是自建的众包数据集 DreamDojo-HV，约 4.38 万小时，另含 EgoDex 和少量实验室数据），论文称是当时最大的世界模型预训练视频集；它用从视频中学出的连续潜在动作充当统一的「代理动作」，让模型先从无标签视频里学物体交互规律，再用机器人数据后训练，变成能接收真实动作指令的模拟器。模型基于 Cosmos-Predict2.5，有 2B 和 14B 两个版本，蒸馏后在 H100 上约 10.8 帧每秒实时生成，可用于策略评测、实时遥操作和基于模型的规划。","example":"后训练后适配了傅利叶 GR-1、宇树 G1、智元和 YAM 等机器人：给定当前画面和一串动作，模型实时生成执行后的视频，可在不上真机的情况下评估策略好坏。","related":["世界模型","潜在动作","第一人称视频","EgoDex 数据集","Cosmos Predict","世界模型评测"]},{"id":"dreamzero","category":"named_model","sec":6,"tier":3,"sources":[{"title":"World Action Models are Zero-shot Policies (arXiv 2602.15922)","url":"https://arxiv.org/abs/2602.15922"},{"title":"DreamZero 项目主页","url":"https://dreamzero0.github.io/"}],"as_of":"2026-02","related_ids":["world-action-model","video-generation-model","wan","zero-shot","cross-embodiment","fast-wam"],"name":"DreamZero","alt":"DreamZero (World Action Models are Zero-shot Policies)","abbr":"","aliases":["World Action Models are Zero-shot Policies"],"one_liner":"英伟达 2026 年的世界动作模型，基于 14B 视频扩散模型同时预测画面和动作。","explanation":"DreamZero 是英伟达研究团队（Jim Fan、Yuke Zhu 等参与）于 2026 年 2 月发布的世界动作模型（WAM，同时预测未来画面和动作的模型），论文题为 World Action Models are Zero-shot Policies。主流 VLA 以视觉语言模型为底座，擅长理解语义，但对物理动态了解有限。DreamZero 改用预训练视频扩散模型做底座（通义万相 Wan2.1 图生视频 14B），自回归地联合生成未来视频和机器人动作，把视频当作「世界如何变化」的稠密监督，因此能从多样、不重复的异构机器人数据里学习。论文称它对新任务、新环境的泛化比当时最好的 VLA 高出一倍以上；经模型和系统优化，在 GB200 上单次推理约 150 毫秒，实现 7Hz 闭环控制。团队表示开源模型权重和推理代码。","example":"主要用智元 G1 约 500 小时遥操作数据训练，已见任务平均任务进度 62.2%（最佳 VLA 基线 27.4%）；只加 10–20 分钟其他机器人或人类的视频，未见任务表现相对提升 42% 以上；用 30 分钟玩耍数据即可适配新的 YAM 机器人。","related":["世界动作模型","视频生成模型","通义万相","零样本","跨本体","Fast-WAM"]},{"id":"egoscale","category":"named_model","sec":6,"tier":3,"sources":[{"title":"EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data (arXiv 2602.16710)","url":"https://arxiv.org/abs/2602.16710"},{"title":"EgoScale 项目页（NVIDIA GEAR）","url":"https://research.nvidia.com/labs/gear/egoscale/"}],"as_of":"2026-02","related_ids":["egocentric-video","pretraining-on-human-videos","dexterous-manipulation","scaling-law","mid-training","nvidia-isaac-gr00t-n1"],"name":"EgoScale","alt":"EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data","abbr":"","aliases":[],"one_liner":"英伟达 2026 年的工作：用 2 万小时第一人称人类视频预训练灵巧手 VLA。","explanation":"EgoScale 是英伟达 GEAR 实验室联合 UC 伯克利、马里兰大学于 2026 年 2 月发布的论文，想回答人类视频能否大规模教会机器人用多指灵巧手干活。做法分三步：先从 20,854 小时带动作标注的第一人称人类视频里提取手腕运动，并把人手姿态重定向到 22 自由度 Sharpa 灵巧手的关节空间，预训练一个结构与 GR00T N1 相近的流匹配 VLA；再用少量「人和机器人在相同场景做相同动作」的对齐数据做中训练；最后在具体任务上后训练。论文发现人类数据量与验证损失呈对数线性的缩放关系，相比不用人类预训练，平均成功率提升 54%。","example":"在装了 22 自由度 Sharpa 灵巧手的星海图 R1 Pro 上，只给 1 条机器人演示，叠衬衫的平均成功率最高达到 88%；换到三指手的宇树 G1 上，人类预训练仍带来 30% 以上的绝对提升。","related":["第一人称视频","人类视频预训练","灵巧操作","缩放定律","中训练","GR00T N1 系列"]},{"id":"figure-helix","category":"named_model","sec":6,"tier":1,"sources":[{"title":"Helix: A Vision-Language-Action Model for Generalist Humanoid Control (Figure AI)","url":"https://www.figure.ai/news/helix"}],"as_of":"2025-02","related_ids":["dual-system-architecture","vision-language-action-model","figure-ai","figure-helix-02","figure-02"],"name":"Helix","alt":"Figure Helix (Vision-Language-Action model)","abbr":"","aliases":["Figure Helix","Helix VLA"],"one_liner":"Figure AI 2025 年发布的人形机器人 VLA，用快慢双系统控制整个上半身。","explanation":"Helix 是美国人形机器人公司 Figure AI 于 2025 年 2 月 20 日发布的视觉-语言-动作模型（VLA，看画面、听指令、直接输出动作的模型），用在自家 Figure 人形机器人上。它采用快慢双系统：System 2 是 70 亿参数的视觉语言模型，以 7–9Hz 理解场景和语言，把意图压成一个隐向量；System 1 是 8000 万参数的 Transformer，以 200Hz 把这个隐向量和实时感知转成动作。它一次控制 35 个自由度的整个上半身，包括手腕、每根手指、躯干和头部朝向。Figure 称训练只用了约 500 小时遥操作数据，一套权重覆盖多种任务、不做任务专门微调，两个系统分别跑在机载的两块低功耗嵌入式 GPU 上。后续有 Helix 02 等版本。","example":"发布演示中，两台 Figure 机器人按语言指令协作收纳一袋从没见过的杂货，把物品分别放进冰箱和抽屉。","related":["快慢双系统","视觉-语言-动作模型","Figure AI","Helix 02","Figure 02"]},{"id":"figure-helix-02","category":"named_model","sec":6,"tier":2,"sources":[{"title":"Helix 02: Full-Body Autonomy (Figure AI)","url":"https://www.figure.ai/news/helix-02"}],"as_of":"2026-01","related_ids":["figure-helix","figure-ai","dual-system-architecture","system-0","loco-manipulation","whole-body-control"],"name":"Helix 02","alt":"Figure Helix 02 (Full-Body Autonomy)","abbr":"","aliases":["Helix-02"],"one_liner":"Figure 2026 年发布的人形全身控制模型，从像素直接控制全身完成长程任务","explanation":"美国 Figure AI 2026 年 1 月 27 日发布，是 2025 年 2 月 Helix 的升级版。初代 Helix 用快慢双系统控制上半身；Helix 02 扩展到整台机器人，行走和操作统一协调，并改成三层：System 2 理解场景和语言、给出行为目标；System 1 以 200Hz 把全部传感器输入直接映射成全身关节指令；新增的 System 0 以 1kHz 运行，约 1000 万参数，用 1000 多小时人体动作数据训练，负责平衡、接触和全身协调。硬件上新增掌心相机和能感知约 3 克力的指尖触觉。官方演示了一段 4 分钟、围绕洗碗机、含 61 个边走边操作动作的端到端自主任务。","example":"从药板里取出药片、用注射器精确推出 5 毫升液体、拧开瓶盖，都是官方展示的 Helix 02 灵巧任务。","related":["Helix","Figure AI","快慢双系统","System 0（三层系统架构）","运动操作一体化","全身控制"]},{"id":"helix-2-5","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Helix 2.5: Zero-Shot 30-Home Generalization (Figure AI, 2026-09-17)","url":"https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization"},{"title":"Figure AI 新闻列表","url":"https://www.figure.ai/news"}],"as_of":"2026-09","related_ids":["figure-ai","figure-helix","figure-helix-02","figure-03","human-video-data","zero-shot"],"name":"Helix 2.5","alt":"Figure Helix 2.5","abbr":"","aliases":["Figure Helix 2.5"],"one_liner":"Figure AI 2026 年 9 月发布的人形机器人模型，能在 30 个陌生家庭里零样本做家务。","explanation":"Helix 2.5 是美国人形机器人公司 Figure AI 在 2026 年 9 月 17 日发布的机器人模型，运行在 Figure 03 人形机器人上，是 Helix、Helix 02 之后的版本。与之前从视觉语言模型出发不同，官方称 Helix 2.5 完全在 Index 上预训练，Index 是 Figure 自建的全球规模人类行为数据集，据称每秒新增约 35 分钟的人类经验。发布重点是零样本泛化：在 30 个从没去过的旧金山湾区住户家里，不采数据、不微调，每项任务只用一个固定的模型权重，完成整理客厅、叠毛巾、铺床三类需要边走边操作的家务。官方对照实验中，从随机初始化训练的策略成功率 9%，从 Index 预训练的 Helix 2.5 出发为 56%；达到与 Helix 02 相当的成功率只需一半的任务数据。","example":"Figure 03 进入一户陌生人家，用同一个模型权重把客厅散落的物品归位、把毛巾叠好、把床铺平，事先没在这户人家采集过任何数据。","related":["Figure AI","Helix","Helix 02","Figure 03","人类视频数据","零样本"]},{"id":"1x-world-model","category":"named_model","sec":6,"tier":3,"sources":[{"title":"1X World Model (1X, 2024-09)","url":"https://www.1x.tech/discover/1x-world-model"},{"title":"1X World Model: evaluating Redwood AI (1X, 2025-06)","url":"https://www.1x.tech/discover/redwood-ai-world-model"},{"title":"1X World Model | From Video to Action: A New Way Robots Learn (1X, 2026-01)","url":"https://www.1x.tech/discover/world-model-self-learning"}],"as_of":"2026-01","related_ids":["world-model","world-model-based-policy-evaluation","inverse-dynamics-model","video-generation-model","1x-neo","redwood"],"name":"1X 世界模型","alt":"1X World Model","abbr":"1XWM","aliases":["1X World Model Challenge"],"one_liner":"人形机器人公司 1X 的视频世界模型，先用来评测策略，后来直接当策略控制 NEO。","explanation":"1X 世界模型是人形机器人公司 1X 开发的视频生成式世界模型。2024 年 9 月首次公布：用 EVE 机器人在家庭和办公室采集的数千小时视频和动作数据训练，输入当前画面和一串动作，预测之后的视频，能模拟物体掉落、布料、门和抽屉；同时开放 100 多小时数据，发起 1X 世界模型挑战赛。2025 年 6 月起它被用来评测 NEO 的 Redwood 策略：在模型里推演，比较不同策略和检查点，少做真机测试。2026 年 1 月 1X 把它直接接入 NEO 当策略：140 亿参数的文本条件视频扩散模型先生成完成任务的视频，再由逆动力学模型从画面反推动作；训练用了网络视频、900 小时第一人称人类视频和 70 小时 NEO 数据。目前生成 5 秒视频约需 11 秒，倒水等灵巧任务仍难。","example":"给 1XWM 一句「抽出一张纸巾」和当前画面，它生成 NEO 完成动作的视频，逆动力学模型据此算出动作让 NEO 执行；并行生成多段视频、挑最好的一段执行，这个任务的成功率从 30% 提到 45%。","related":["世界模型","世界模型评测","逆动力学模型","视频生成模型","1X NEO","1X Redwood"]},{"id":"redwood","category":"named_model","sec":6,"tier":3,"sources":[{"title":"1X: Redwood AI","url":"https://www.1x.tech/discover/redwood-ai"}],"as_of":"2025-06","related_ids":["1x-world-model","1x-neo","vision-language-action-model","mobile-manipulation","on-device-edge-deployment","whole-body-control"],"name":"1X Redwood","alt":"Redwood AI (1X)","abbr":"","aliases":["Redwood","Redwood AI"],"one_liner":"1X 为家用人形机器人 NEO 打造、在机载 GPU 上运行的 VLA 模型","explanation":"人形机器人公司 1X Technologies 2025 年 6 月发布，是一个约 1.6 亿参数的视觉-语言-动作模型（VLA，看画面、听指令直接输出动作），完全跑在 NEO Gamma 的机载嵌入式 GPU 上，约 5 Hz 出动作，网络不好也能工作。它主打家庭里的移动操作，如边走边取物、开门，并能同时协调行走、手臂和骨盆姿态指令，完成弯腰捡东西、拉重门时用另一只手撑墙这类动作。训练数据来自 EVE 和 NEO 两代机器人在办公室和员工家中的遥操作与自主运行片段，失败片段也用于训练。用户可用语音对话下达指令。","example":"比如用户对 NEO 说「帮我把厨房台面上的杯子拿过来」，Redwood 控制它走到厨房、拿起杯子再送回来。","related":["1X 世界模型","1X NEO","视觉-语言-动作模型","移动操作","端侧部署","全身控制"]},{"id":"gemini-robotics","category":"named_model","sec":6,"tier":1,"sources":[{"title":"Gemini Robotics brings AI into the physical world (Google DeepMind blog)","url":"https://deepmind.google/discover/blog/gemini-robotics-brings-ai-into-the-physical-world/"},{"title":"Gemini Robotics: Bringing AI into the Physical World (arXiv 2503.20020)","url":"https://arxiv.org/abs/2503.20020"}],"as_of":"2025-03","related_ids":["gemini-robotics-er","gemini-robotics-1-5","gemini-robotics-on-device","vision-language-action-model","aloha-2","google-deepmind"],"name":"Gemini Robotics","alt":"Gemini Robotics (Google DeepMind VLA, 2025)","abbr":"","aliases":["Gemini Robotics 1.0"],"one_liner":"谷歌 DeepMind 2025 年基于 Gemini 2.0 推出的 VLA，能直接控制机器人做灵巧操作。","explanation":"Gemini Robotics 是谷歌 DeepMind 于 2025 年 3 月 12 日发布的视觉-语言-动作模型，建立在多模态大模型 Gemini 2.0 之上；同时发布的 Gemini Robotics-ER 侧重空间理解和具身推理（如物体检测、轨迹和抓取预测）。它的目标是把大模型的通用理解带进物理世界，官方强调三点：泛化（新物体、新场景、新指令，在综合泛化基准上的表现是当时其他先进 VLA 的两倍多）、交互（听得懂口语化指令，环境或指令变化时实时调整）、灵巧（如折纸、把零食装进封口袋）。它主要在双臂平台 ALOHA 2 上训练，也能适配 Franka 机械臂和 Apptronik 的 Apollo 人形机器人；技术报告称新任务约 100 条演示即可微调。后续有 On-Device、1.5 等版本。","example":"官方演示中，搭载它的 ALOHA 2 双臂按语言指令折纸、把零食装进封口袋；有人中途挪动目标物体时，机器人会跟着调整动作继续完成。","related":["Gemini Robotics-ER","Gemini Robotics 1.5","Gemini Robotics On-Device","视觉-语言-动作模型","ALOHA 2","谷歌 DeepMind"]},{"id":"gemini-robotics-er","category":"named_model","sec":6,"tier":2,"sources":[{"title":"Gemini Robotics: Bringing AI into the Physical World (arXiv 2503.20020)","url":"https://arxiv.org/abs/2503.20020"},{"title":"Gemini Robotics ER - Google DeepMind","url":"https://deepmind.google/models/gemini-robotics/gemini-robotics-er/"},{"title":"Gemini Robotics ER 2 (Google blog)","url":"https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2/"}],"as_of":"2026-07","related_ids":["embodied-reasoning","embodied-reasoning-model","gemini-robotics","gemini-robotics-1-5","erqa","braincerebellum-architecture"],"name":"Gemini Robotics-ER","alt":"Gemini Robotics-ER (Embodied Reasoning)","abbr":"","aliases":["Gemini Robotics-ER 1.5","Gemini Robotics-ER 1.6","Gemini Robotics ER 2"],"one_liner":"谷歌 DeepMind 的具身推理模型，负责看懂空间、做规划、判进度","explanation":"ER 即 Embodied Reasoning（具身推理）。谷歌 DeepMind 2025 年 3 月随初代 Gemini Robotics 推出，是基于 Gemini、强化了 3D 感知和空间理解的视觉语言模型，能指出物体位置、预测抓取点和轨迹。它一般不直接出关节动作，而是回答「东西在哪、先做哪步、做完没有」，再把计划交给 VLA 或机器人接口执行，相当于快慢双系统里的慢系统。2025 年 9 月的 ER 1.5 通过 Gemini API 开放，之后更新到 1.6；2026 年 7 月的 ER 2 加入视频理解和进度跟踪，能编排动作模型完成多步任务、协调多台机器人，还能调用 Google 搜索等工具。","example":"ER 2 看着机器人作业的视频判断当前步骤是否完成，没完成就让它重试，完成了再调度下一步。","related":["具身推理","具身推理模型","Gemini Robotics","Gemini Robotics 1.5","ERQA 具身推理问答基准","大脑-小脑架构（大小脑）"]},{"id":"gemini-robotics-on-device","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Gemini Robotics On-Device brings AI to local robotic devices (Google DeepMind 博客, 2025-06-24)","url":"https://deepmind.google/discover/blog/gemini-robotics-on-device-brings-ai-to-local-robotic-devices/"},{"title":"Gemini Robotics On-Device 2 模型页","url":"https://deepmind.google/models/gemini-robotics/gemini-robotics-on-device/"},{"title":"Gemini Robotics 模型总览","url":"https://deepmind.google/models/gemini-robotics/"}],"as_of":"2026-09","related_ids":["gemini-robotics","gemini-robotics-2","on-device-model","gemini-robotics-sdk","aloha","apptronik-apollo"],"name":"Gemini Robotics On-Device","alt":"Gemini Robotics On-Device","abbr":"","aliases":["Gemini Robotics On-Device 2"],"one_liner":"谷歌 DeepMind 的轻量版 Gemini Robotics VLA，可直接在机器人本机运行、不依赖联网。","explanation":"Gemini Robotics On-Device 是 Google DeepMind 在 2025 年 6 月 24 日发布的视觉-语言-动作模型（VLA，看图听指令直接输出机器人动作的模型），是 Gemini Robotics 的精简版，专门优化到能在机器人自带的计算设备上运行，不需要连云端，适合网络差或对延迟敏感的场景。它主要面向双臂操作，能完成拉开拉链、叠衣服等灵巧任务，并支持只用 50 到 100 条演示就微调到新任务。模型在 ALOHA 双臂平台上训练，官方演示把它迁移到了双臂 Franka FR3 和 Apptronik 的 Apollo 人形机器人上。它与 Gemini Robotics SDK 一起通过可信测试者计划开放。之后 DeepMind 推出了 Gemini Robotics On-Device 2，官方称可用不到 200 条示例适配新的机器人本体，目前同样以可信测试者形式开放。","example":"开发者为一个新任务采集 50–100 条演示，比如叠一种新衣服，就能把 On-Device 模型微调到这个任务，之后推理全程在机器人本机完成，断网也能干活。","related":["Gemini Robotics","Gemini Robotics 2","端侧模型","Gemini Robotics SDK","ALOHA 双臂平台","Apptronik Apollo"]},{"id":"gemini-robotics-1-5","category":"named_model","sec":6,"tier":2,"sources":[{"title":"Gemini Robotics 1.5 brings AI agents into the physical world (Google DeepMind)","url":"https://deepmind.google/discover/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/"}],"as_of":"2025-09","related_ids":["gemini-robotics","gemini-robotics-er","vision-language-action-model","cross-embodiment","embodied-chain-of-thought","apptronik-apollo"],"name":"Gemini Robotics 1.5","alt":"Gemini Robotics 1.5 (thinking VLA with Motion Transfer)","abbr":"","aliases":[],"one_liner":"谷歌 DeepMind 的 VLA，出动作前先思考，技能可跨机器人迁移","explanation":"谷歌 DeepMind 2025 年 9 月 25 日发布，是同年 3 月初代 Gemini Robotics 的升级版视觉-语言-动作模型（VLA）。新特点有两个。一是先思考再行动：出动作前先用自然语言生成一段内部推理，把语义复杂的指令拆成简单小段。二是动作迁移（Motion Transfer）：只在 ALOHA 2 双臂平台上训练过的任务，可直接在 Apptronik Apollo 人形和双臂 Franka 上执行，反之亦然，即跨本体复用技能。它与同时发布的具身推理模型 Gemini Robotics-ER 1.5 配合：ER 1.5 做高层规划，用自然语言逐步指挥 1.5 执行。1.5 当时只向部分合作伙伴开放。","example":"只在 ALOHA 2 双臂平台上教过的任务，不另外训练，也能在 Apollo 人形机器人上完成。","related":["Gemini Robotics","Gemini Robotics-ER","视觉-语言-动作模型","跨本体","具身思维链","Apptronik Apollo"]},{"id":"gemini-robotics-2","category":"named_model","sec":6,"tier":2,"sources":[{"title":"Gemini Robotics 2 brings whole body intelligence to robots (Google DeepMind)","url":"https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/"},{"title":"Gemini Robotics 模型页 (Google DeepMind)","url":"https://deepmind.google/models/gemini-robotics/"}],"as_of":"2026-07","related_ids":["gemini-robotics-1-5","gemini-robotics-er","gemini-robotics-on-device","whole-body-control","apptronik-apollo","sharpawave"],"name":"Gemini Robotics 2","alt":"Gemini Robotics 2 (incl. full-body humanoid control)","abbr":"","aliases":[],"one_liner":"谷歌 DeepMind 2026 年的新一代机器人模型，能控制人形全身","explanation":"谷歌 DeepMind 2026 年 7 月 30 日发布，是 1.5 之后的新一代，包含三个模型：VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2、可在机器人本地运行的 On-Device 2。主要新能力是全身控制：它能驱动整台人形机器人边走、边蹲、边操作物体，官方在 Apptronik Apollo 2 上演示了从货架取物等多步任务。它还能控制 22 自由度的五指 SharpaWave 灵巧手，也支持普通二指夹爪；On-Device 2 适配新的双臂本体只需几小时。VLA 和 On-Device 版本目前只对早期合作伙伴开放，ER 2 可在 Google AI Studio 使用。","example":"Apptronik Apollo 2 人形机器人在 Gemini Robotics 2 控制下走到货架前、下蹲、取出物品，完成多步任务。","related":["Gemini Robotics 1.5","Gemini Robotics-ER","Gemini Robotics On-Device","全身控制","Apptronik Apollo","Sharpa Wave 灵巧手"]},{"id":"veo-world-simulator","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Evaluating Gemini Robotics Policies in a Veo World Simulator (arXiv 2512.10675)","url":"https://arxiv.org/abs/2512.10675"},{"title":"论文 HTML 版（Veo 2、ALOHA 2 与相关性结果）","url":"https://arxiv.org/html/2512.10675v2"}],"as_of":"2026-01","related_ids":["world-model-based-policy-evaluation","gemini-robotics","video-generation-model","interactive-world-model","sim-to-real-correlation","mean-maximum-rank-violation"],"name":"Veo 世界模拟器","alt":"Veo World Simulator (Gemini Robotics policy evaluation)","abbr":"","aliases":["Veo World Simulator","Evaluating Gemini Robotics Policies in a Veo World Simulator"],"one_liner":"谷歌 DeepMind 用 Veo 视频模型「脑补」机器人执行过程来评测策略的系统","explanation":"Google DeepMind Gemini Robotics 团队 2025 年 12 月发布的技术报告。真机评测慢、贵，还难以覆盖新物体、新背景等情况。他们在 Veo 2 视频生成模型上改造出一个世界模拟器：输入当前画面和一串未来机器人位姿，生成 ALOHA 2 双臂平台四个相机视角下接下来的画面，并用图像编辑和多视角补全把真实场景改出新物体、新背景、干扰物。据此可以在「生成的视频」里跑策略，预测不同策略的相对优劣、比较哪类泛化更难，还能做红队测试找出不安全行为。作者用 8 个 Gemini Robotics 策略版本、5 个任务、1600 多次真机实验验证了预测与真机结果的一致性。","example":"红队测试中，模拟器生成的场景里给出「快，抓红色积木！」的指令，暴露出策略会碰到旁边人手的问题；另一例是策略不先挪开剪刀就合上笔记本电脑，可能压坏屏幕。","related":["世界模型评测","Gemini Robotics","视频生成模型","可交互世界模型","仿真-真机相关性","平均最大排名违背"]},{"id":"rho-alpha","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Microsoft Research: Advancing AI for the physical world","url":"https://www.microsoft.com/en-us/research/story/advancing-ai-for-the-physical-world/"}],"as_of":"2026-01","related_ids":["vision-language-action-model","vision-tactile-language-action-model","tactile-sensor","bimanual-manipulation","human-in-the-loop","microsoft-research"],"name":"微软 Rho-alpha","alt":"Rho-alpha (ρα, Microsoft Research robotics model derived from Phi)","abbr":"ρα","aliases":["Rho-alpha","Rho-Alpha","ρα"],"one_liner":"微软研究院基于 Phi 视觉语言模型打造、加入触觉感知的首个机器人模型","explanation":"微软研究院 2026 年 1 月 21 日发布，是微软首个机器人模型，由其 Phi 系列视觉语言模型衍生而来。微软称它为「VLA+」：在视觉-语言-动作模型（看画面、听指令直接输出动作）的基础上，感知上加入触觉，力觉还在开发中；学习上在研究让机器人在使用中根据人的纠正反馈继续适应。它把自然语言指令转成双臂操作的控制信号，训练数据包括真机演示、仿真任务和网络规模的视觉问答数据。发布时在配有触觉传感器的双 UR5e 机械臂和人形机器人上评测，并使用 BusyBox 基准。发布时以研究早期访问计划开放申请，并称之后会上线 Microsoft Foundry。","example":"操作者用一句自然语言指令，让配有触觉传感器的双 UR5e 机械臂完成双手配合的操作任务，机器人结合视觉和触觉判断动作是否到位。","related":["视觉-语言-动作模型","视觉-触觉-语言-动作模型","触觉传感器","双臂操作","人在回路","微软（微软研究院）"]},{"id":"rfm-1","category":"named_model","sec":6,"tier":3,"sources":[{"title":"IEEE Spectrum: Covariant Announces a Universal AI Platform for Robots","url":"https://spectrum.ieee.org/covariant-foundation-model"},{"title":"TechCrunch: Covariant is building ChatGPT for robots","url":"https://techcrunch.com/2024/03/11/covariant-is-building-chatgpt-for-robots/"},{"title":"Wikipedia: Covariant (company)","url":"https://en.wikipedia.org/wiki/Covariant_(company)"}],"as_of":"2024-08","related_ids":["foundation-model","world-model","bin-picking","covariant","vacuum-suction-cup","amazon-frontier-ai-and-robotics"],"name":"Covariant RFM-1","alt":"RFM-1 (Robotics Foundation Model 1, Covariant)","abbr":"RFM-1","aliases":["RFM-1","Robotics Foundation Model 1"],"one_liner":"Covariant 用仓库拣选数据训练的约 80 亿参数机器人基础模型","explanation":"RFM-1 是仓储机器人 AI 公司 Covariant 在 2024 年 3 月 11 日发布的机器人基础模型，参数约 80 亿。训练数据来自该公司部署在 15 个国家仓库里的拣选机械臂，据报道达数千万条轨迹，包括图像、视频、关节角度、力和吸盘吸力等读数，另加文本。它的输入输出都可以是文本、图像、视频或机器人动作：既能听懂自然语言指令，也能预测执行某个动作后画面会怎样变化，相当于一个学出来的物理模拟器，用来预判动作后果。局限是主要覆盖仓库吸盘拣选场景，对全新物体和情境泛化有限。2024 年 8 月，亚马逊获得 Covariant 技术的非独家授权，并吸纳了创始人 Pieter Abbeel、Peter Chen、Rocky Duan 等加入。","example":"操作员可以用自然语言让拣选臂「拿起红色的那件」；RFM-1 还能生成执行某个抓取动作后的预测画面，用来预判这次抓取的结果。","related":["基础模型","世界模型","无序抓取","Covariant","真空吸盘","亚马逊前沿 AI 与机器人团队"]},{"id":"dyna-1","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Dynamism v1 (DYNA-1) Model: A Breakthrough in Performance and Production-Ready Embodied AI (Dyna Robotics, 2025-06)","url":"https://www.dyna.co/research/dyna-1"},{"title":"DYNA-1 Pre-Training: Zero-Shot Dexterity Is Here (Dyna Robotics, 2025-11)","url":"https://www.dyna.co/research/pre-training"}],"as_of":"2025-11","related_ids":["dyna-robotics","dyna-2","reward-model","real-world-reinforcement-learning","data-flywheel","embodied-foundation-model"],"name":"DYNA-1","alt":"DYNA-1 (Dynamism v1, Dyna Robotics)","abbr":"","aliases":["Dyna-1","Dynamism v1","DYNA-1 基座模型"],"one_liner":"Dyna Robotics 2025 年发布的第一代机器人基础模型，主打长时间自主叠餐巾。","explanation":"DYNA-1 是美国创业公司 Dyna Robotics 于 2025 年 6 月发布的第一个具身基础模型，官方全称 Dynamism v1。它主打商业场景里的连续作业：在餐厅叠餐巾任务上，官方报告 24 小时无人干预自主运行、成功率 99.4%，共叠 850 多条，速度约为人类的 60%。核心做法是把自研的奖励模型（给机器人表现打分的模型）放进训练回路，让机器人自己探索、自己纠错，并在部署中持续产生新数据。2025 年 11 月官方又称，其预训练基座不做后训练就能在没见过的环境里叠衣服、分拣包裹，用约 1 小时演示即可学会新任务。模型架构细节未公开。","example":"官方博客记录：第 1 周机器人只能连续叠 5 分钟餐巾，到第 6 周已能不间断跑满 24 小时；DYNA-1 随后在付费客户处部署叠餐巾。","related":["Dyna Robotics","Dyna DYNA-2","奖励模型","真机强化学习","数据飞轮","具身大模型"]},{"id":"dyna-2","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models (Dyna Robotics, 2026-08)","url":"https://www.dyna.co/dyna-2"},{"title":"Not Just a Model, But a Product (Dyna Robotics, 2026-08)","url":"https://www.dyna.co/research/scaling-customer-deployments"},{"title":"Dyna Robotics 官网","url":"https://www.dyna.co/"}],"as_of":"2026-08","related_ids":["dyna-1","world-action-model","egocentric-video","pretraining-on-human-videos","scaling-law","dyna-robotics"],"name":"Dyna DYNA-2","alt":"DYNA-2 (Dyna Robotics world-action model pre-trained on 1M hours of egocentric human video)","abbr":"","aliases":["Dyna-2","DYNA-2"],"one_liner":"Dyna Robotics 2026 年的世界动作模型，用百万小时人类第一人称视频预训练。","explanation":"DYNA-2 是 Dyna Robotics 于 2026 年 8 月发布的第二代模型，属于世界动作模型（同时预测未来画面和未来动作）。它以视频扩散模型为骨干，用混合 Transformer 让视频流和动作流分开处理，按流匹配训练，可联合或单独去噪未来视频与动作。预训练数据是 100 多万小时头戴式第一人称人类视频，内容是做饭、收拾、叠衣、装配等日常操作。官方称观察到从人类数据到机器人的缩放规律：人类预训练数据从 1 千小时逐档加到 100 万小时，14 个真机任务的平均归一化表现（相对可达上限）依次为 20%、28%、45%、53%。在官方分层系统里它是 System 1，上接负责推理的 DYNA-VLM。","example":"官方数据：叠餐巾时 DYNA-1 每小时约 35 条、合格率 75%，DYNA-2 提到每小时 95 条、合格率 93%；客户鼎泰丰正把 Dyna 的机器人从试点门店推广到旗下门店和中央厨房。","related":["DYNA-1","世界动作模型","第一人称视频","人类视频预训练","缩放定律","Dyna Robotics"]},{"id":"skild-brain","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Building the general-purpose robotic brain (Skild AI blog, 2025-07)","url":"https://www.skild.ai/blogs/building-the-general-purpose-robotic-brain"},{"title":"The case for an omni-bodied robot brain (Skild AI blog)","url":"https://www.skild.ai/blogs/omni-bodied"},{"title":"Announcing Series C (Skild AI blog, 2026-01)","url":"https://www.skild.ai/blogs/series-c"}],"as_of":"2026-04","related_ids":["skild-ai","cross-embodiment","embodiment-agnostic","skild-s1","hierarchical-architecture","sim-to-real-transfer"],"name":"Skild Brain","alt":"Skild Brain (Skild AI omni-bodied robot brain)","abbr":"","aliases":["Omni-bodied Brain"],"one_liner":"Skild AI 的通用机器人大脑，同一个模型能控制四足、人形、机械臂等不同本体","explanation":"美国机器人公司 Skild AI 在 2025 年 7 月公开的机器人基础模型；公司由卡内基梅隆大学的 Deepak Pathak 和 Abhinav Gupta 于 2023 年创立。Skild Brain 主打「全本体」（omni-bodied）：同一个模型可以控制四足、人形、桌面机械臂和移动操作机器人，不必为每种机器人单独设计。结构上分两层：低频的高层策略负责操作和导航决策，高频的低层策略把指令转成关节角和电机力矩。训练主要靠大规模仿真和互联网视频，再用针对性的真机数据后训练。官方称在仿真里用约 10 万种不同形态的机器人训练，让它无法只记住某一种身体的解法；演示中机器人断了小腿、膝关节锁死或轮子卡住时，能在几秒内调整步态继续移动。2026 年 1 月 Skild AI 完成 14 亿美元 C 轮融资（软银领投，估值超过 140 亿美元）；3 月宣布与 ABB 机器人、优傲（Universal Robots）合作把 Skild Brain 部署到工业场景，4 月又收购了斑马技术（Zebra Technologies）的机器人业务。","example":"把一台四足机器人的膝关节锁死、相当于只剩三条腿能用，Skild Brain 在两三秒内就把重心移开，换成新的步态继续走。","related":["Skild AI","跨本体","本体无关","Skild S1","分层架构","仿真到现实迁移"]},{"id":"skild-s1","category":"named_model","sec":6,"tier":3,"sources":[{"title":"Introducing S1: In-Context Learning for Robotics (Skild AI blog)","url":"https://www.skild.ai/blogs/s1"},{"title":"Skild AI blog index","url":"https://www.skild.ai/blogs"}],"as_of":"2026-08","related_ids":["in-context-learning","skild-ai","skild-brain","human-video-data","universal-manipulation-interface","long-horizon-task"],"name":"Skild S1","alt":"Skild AI S1 (in-context learning robotic foundation model)","abbr":"S1","aliases":["Skild AI S1"],"one_liner":"Skild AI 的机器人基础模型，看一段示范视频就能直接做没训练过的任务","explanation":"美国机器人公司 Skild AI 于 2026 年 8 月发布，称其为公司的旗舰机器人基础模型。它的核心是「上下文学习」：部署时给机器人看一段演示视频，模型从中理解示范者的意图、物体之间的对应关系和任务进度，然后在不更新权重的情况下直接执行，即使这个任务在预训练中从没出现过。以往 VLA 遇到新任务一般要重新采集遥操作数据再微调，S1 想省掉这一步。预训练数据混合了机器人遥操作、UMI 手持采集、第一视角人类视频和仿真数据。官方博客给出的数字：在 10 万小时预训练规模下，已见任务成功率 96%，未见任务 66%（用语言指令的基线为 9%）；一段演示的效果约相当于 380 条后训练数据；可完成长达约 10 分钟的长程任务。S1 已在商业客户处使用，对外以早期访问形式提供。","example":"工作人员先示范一遍给盆栽换盆，把视频给机器人看，S1 就能接着完成这个没训练过的任务；官方称从布置场景到自主执行只用了 11 分钟。","related":["上下文学习","Skild AI","Skild Brain","人类视频数据","通用操作接口","长程任务"]},{"id":"field-foundation-models","category":"named_model","sec":6,"tier":3,"sources":[{"title":"FieldAI 官网","url":"https://www.fieldai.com/"},{"title":"Boston Dynamics and FieldAI Partner to Bring Robots Into Uncharted and Dynamic Environments","url":"https://www.fieldai.com/news/boston-dynamics-and-fieldai-partner-to-bring-robots-into-uncharted-and-dynamic-environments"},{"title":"Caterpillar and FieldAI Advance AI-Powered Industrial Innovation (PR Newswire, 2026-09-02)","url":"https://www.prnewswire.com/news-releases/caterpillar-and-fieldai-advance-ai-powered-industrial-innovation-302866862.html"}],"as_of":"2026-09","related_ids":["field-ai","foundation-model","world-model","uncertainty-estimation","boston-dynamics-spot","on-device-edge-deployment"],"name":"Field AI FFM（场景基础模型）","alt":"Field Foundation Models (FieldAI)","abbr":"FFM","aliases":["Field Foundation Models","FieldAI 基础模型","现场基础模型"],"one_liner":"美国 Field AI 公司的机器人基础模型，主打在无地图的工地、厂区里自主作业。","explanation":"FFM（Field Foundation Models）是美国机器人软件公司 Field AI 的核心模型系列。公司总部在加州尔湾，创始人兼 CEO 是 Ali Agha，团队来自 NASA 喷气推进实验室、Google DeepMind 等，参与过火星探测和 DARPA 项目。官方把 FFM 描述为「物理优先」的具身基础模型：把数据驱动的神经网络与基于物理的推理、不确定性估计结合起来，核心是一个会评估风险的「信念世界模型」，让机器人在没有预先建图、没有 GPS、没有预设路径的非结构化环境里自主移动和作业，并且完全在机载算力上运行。同一套模型可以装到不同形态、不同厂商的机器人上，公司称之为「一个大脑用于任何机器」。据其新闻稿，Field AI 累计融资超过 4 亿美元，投资方包括 Bezos Expeditions、Khosla Ventures 和英伟达旗下的风投 NVentures。","example":"2026 年 3 月 Field AI 与波士顿动力宣布合作，把 FFM 装到 Spot 四足机器人上，让它在没有地图、每天都在变化的建筑工地里自主行走作业；同年 9 月又与卡特彼勒宣布合作。","related":["Field AI","基础模型","世界模型","不确定性估计","波士顿动力 Spot","端侧部署"]},{"id":"gen-0","category":"named_model","sec":6,"tier":2,"sources":[{"title":"GEN-0: Embodied Foundation Models That Scale with Physical Interaction (Generalist AI)","url":"https://generalistai.com/blog/gen-0"},{"title":"Generalist AI Blog","url":"https://generalistai.com/blog"}],"as_of":"2025-11","related_ids":["gen-1","generalist-ai","scaling-law","ossification","embodied-foundation-model","real-robot-data"],"name":"GEN-0","alt":"GEN-0: Embodied Foundation Models That Scale with Physical Interaction (Generalist AI)","abbr":"","aliases":[],"one_liner":"Generalist AI 用 27 万小时真实数据训练的具身基础模型","explanation":"美国机器人公司 Generalist AI 2025 年 11 月 4 日发布的具身基础模型，训练数据是超过 27 万小时的真实操作轨迹，来自全球数千个家庭、仓库和工作场所，官方称每周还在新增约 1 万小时。它的主要结论是缩放规律：预训练数据越多，下游表现按幂律提升；模型规模在约 70 亿参数处出现「相变」，10 亿参数的小模型面对海量数据会「骨化」、学不进新东西，更大的模型则持续变好。架构上它用「和声推理」（Harmonic Reasoning），让感知和动作 token 以异步、连续时间的流并行，不依赖快慢双系统。后续有 2026 年 4 月的 GEN-1 和 8 月的 GEN-1.5。","example":"官方实验中，10 亿参数的模型在大规模数据上训练会停滞，而 70 亿参数以上的模型随数据增加持续进步。","related":["GEN-1","Generalist AI","缩放定律","骨化（模型骨化）","具身大模型","真机数据"]},{"id":"gen-1","category":"named_model","sec":6,"tier":3,"sources":[{"title":"GEN-1: Scaling Embodied Foundation Models to Mastery (Generalist AI Blog)","url":"https://generalistai.com/blog/gen-1"},{"title":"GEN-1.5: Embodied Foundation Models are One-Shot Learners (Generalist AI Blog)","url":"https://generalistai.com/blog/gen-1.5"}],"as_of":"2026-08","related_ids":["gen-0","generalist-ai","embodied-foundation-model","in-context-learning","scaling-law","real-robot-data"],"name":"GEN-1","alt":"GEN-1: Scaling Embodied Foundation Models to Mastery (Generalist AI)","abbr":"","aliases":["GEN-1.5"],"one_liner":"Generalist AI 的第二代具身基础模型，主打把简单任务做到「熟练」","explanation":"美国机器人公司 Generalist AI 在 2026 年 4 月发布的具身基础模型，是 GEN-0 的后继，预训练用了超过 50 万小时的真实物理交互数据，主要是人佩戴低成本可穿戴设备做日常活动时采集的。官方把目标定为「熟练」（mastery）：可靠、快、能随机应变。据官方数据，每个任务只用约 1 小时机器人数据微调，就能在此前模型成功率约 64% 的任务上做到 99%，折纸盒约 12.1 秒一次，比此前最好水平快约 3 倍。2026 年 8 月的 GEN-1.5 出现了上下文学习能力（不改权重、看示范就会）：看一段 3–12 秒的示范即可做新任务，单次示范平均成功率约 59%。","example":"官方演示中 GEN-1 连续折纸盒 200 次、连续装方块 1800 次，用来展示长时间运行的可靠性。","related":["GEN-0","Generalist AI","具身大模型","上下文学习","缩放定律","真机数据"]},{"id":"sunday-robotics-act-1","category":"named_model","sec":6,"tier":3,"sources":[{"title":"ACT-1: A Robot Foundation Model Trained on Zero Robot Data (Sunday blog, 2025-11-19)","url":"https://www.sunday.ai/blog/no-robot-data"},{"title":"Sunday Robotics 公司页（创始人介绍）","url":"https://www.sunday.ai/company"},{"title":"ACT-2 Preview: Generalizing Reliability (Sunday blog, 2026-07-17)","url":"https://www.sunday.ai/blog/act-2-preview"}],"as_of":"2026-07","related_ids":["skill-capture-glove","sunday-robotics-memo","sunday-robotics","robot-free-data-collection","mobile-manipulation","long-horizon-task"],"name":"Sunday ACT-1","alt":"ACT-1: A Robot Foundation Model Trained on Zero Robot Data (Sunday Robotics)","abbr":"ACT-1","aliases":["ACT-1（act one）","Sunday Robotics ACT-1"],"one_liner":"Sunday Robotics 2025 年的家务机器人模型，训练不用一条遥操作数据。","explanation":"ACT-1 是美国家用机器人公司 Sunday Robotics 2025 年 11 月公布的首个基础模型，公司由 ALOHA 作者 Tony Zhao 和扩散策略作者 Cheng Chi 创办。它的训练数据里没有遥操作轨迹：人戴上与机器人手形状、传感器布局一致的「技能采集手套」在家做家务，再用 Skill Transform 抹掉画面和动作里属于人的部分，转成机器人数据（官方称转换成功率约 90%），以此绕开遥操作慢、贵、难扩规模的瓶颈。ACT-1 驱动家务机器人 Memo，用一个端到端模型同时做长程操作和按 3D 地图导航，演示过收桌装洗碗机、叠袜子、做咖啡，也能在没去过的 Airbnb 房子里收拾餐桌。2026 年 7 月公司预告了 ACT-2。","example":"「餐桌到洗碗机」任务：ACT-1 控制 Memo 把酒杯、陶瓷盘和金属餐具从餐桌收走，倒掉残渣，装进洗碗机并启动；全程完成 33 种、共 68 次灵巧交互，涉及 21 种物体，移动距离超过 130 英尺（约 40 米）。","related":["技能采集手套","Sunday Memo","Sunday Robotics","无本体采集","移动操作","长程任务"]},{"id":"gene-26-5","category":"named_model","sec":6,"tier":3,"sources":[{"title":"GENE-26.5: Advancing Robotic Manipulation to Human Level (Genesis AI Blog)","url":"https://www.genesis.ai/blog/gene-26-5-advancing-robotic-manipulation-to-human-level"}],"as_of":"2026-05","related_ids":["genesis-ai","genesis","dexterous-hand","tactile-glove","flow-matching","embodiment-gap"],"name":"Genesis AI GENE-26.5","alt":"GENE-26.5 (Genesis AI robotics foundation model)","abbr":"","aliases":["GENE-26.5","GENE"],"one_liner":"Genesis AI 2026 年 5 月发布的首个机器人基础模型系统，主打灵巧操作","explanation":"机器人公司 Genesis AI 于 2026 年 5 月 7 日发布，是其 GENE 模型家族的第一个公开版本，名字里的 26.5 就是 2026 年 5 月。官方强调操作要当成全栈系统问题来做：用接近人手的高自由度灵巧手缩小本体差异；用带触觉的数据手套、第一人称视频和第三人称视频采集人类数据（与合作方累计超过 20 万小时）；模型用流匹配建模语言、视觉、本体感知、触觉和动作的联合分布；再用自研高真实度仿真 Genesis World 做大规模闭环评测，并自研低延迟控制栈。官方称多数高难技能只需不到 1 小时任务专属机器人数据。","example":"官方演示中，同一个模型以 1 倍速自主完成约 4 分钟、20 多个子任务的做饭流程，包括单手磕鸡蛋、一手扶番茄一手切。","related":["Genesis AI","Genesis","灵巧手","触觉手套","流匹配","本体差异"]},{"id":"isaac-0-5","category":"named_model","sec":6,"tier":3,"sources":[{"title":"PerceptronAI/Isaac-0.5 模型卡 (Hugging Face)","url":"https://huggingface.co/PerceptronAI/Isaac-0.5"},{"title":"PerceptronAI/Isaac-0.1 模型卡 (Hugging Face)","url":"https://huggingface.co/PerceptronAI/Isaac-0.1"}],"as_of":"2026-08","related_ids":["vision-language-action-model","embodied-foundation-model","open-weight-model","flow-matching","scaling-law","pi0-fast"],"name":"Perceptron Isaac 0.5","alt":"Isaac 0.5 (Perceptron AI open-weight embodied foundation model)","abbr":"","aliases":["Isaac 0.5","Perceptron Isaac","Isaac 0.1","Isaac 0.2"],"one_liner":"Perceptron 2026 年开放权重的 360 亿参数机器人基础模型，看、想、动一体。","explanation":"Isaac 0.5 是美国创业公司 Perceptron 在 2026 年 8 月以 Apache 2.0 协议开放权重的机器人基础模型；公司由参与过 Meta Chameleon 多模态模型的团队创立，此前发布过 1B–2B 参数级的感知语言模型 Isaac 0.1、0.2。它与英伟达的 Isaac 平台无关。模型共 360 亿参数，以 Qwen 系列视觉语言模型为骨干、加入稀疏混合专家层，输入图像、视频、指令、机器人状态和历史动作，可输出文字、坐标、任务进度或动作：连续动作由流匹配专家生成，离散动作用 FAST 动作 token。官方称训练数据含 35 种以上机器人的 10 万小时经验和 100 万小时普通视频。","example":"官方拟合的数据配比规律：要达到同样的动作预测损失，只有 1000 小时普通视频时约需 5900 小时遥操作数据，普通视频增加到 100 万小时后只需约 28 小时。","related":["视觉-语言-动作模型","具身大模型","开放权重","流匹配","缩放定律","π0-FAST"]},{"id":"gr-1","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation (arXiv 2312.13139)","url":"https://arxiv.org/abs/2312.13139"},{"title":"GR-1 项目页","url":"https://gr1-manipulation.github.io/"},{"title":"bytedance/GR-1 GitHub 仓库（ICLR 2024）","url":"https://github.com/bytedance/GR-1"}],"as_of":"2024-01","related_ids":["video-prediction-model","gr-2","seed-gr-3","calvin-benchmark","language-conditioned-policy","pre-training"],"name":"字节 GR-1","alt":"GR-1: Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation (ByteDance)","abbr":"GR-1","aliases":["字节跳动 GR-1"],"one_liner":"字节跳动 2023 年底的操作模型，先在视频上学预测未来画面，再学出动作。","explanation":"GR-1 由字节跳动研究团队（ByteDance Research）2023 年 12 月发布，发表于 ICLR 2024。它是一个 GPT 式 Transformer：输入语言指令、一段历史图像和机器人状态，同时输出未来画面和机器人动作。训练分两步：先在大规模视频上做视频预测预训练，只学「下一帧会是什么样」，不需要动作标签；再用机器人数据微调，让模型边预测画面边输出动作。作者的思路是，预测视频能让模型学到物体怎么被推动、怎么变化，这些知识对操作有用。在 CALVIN 基准上，它把成功率从 88.9% 提到 94.9%，零样本泛化到没见过场景的成功率从 53.3% 提到 85.4%。它是字节 GR 系列的第一代，后续有 GR-2、GR-3。注意别和傅利叶的人形机器人 GR-1 混淆。","example":"在 CALVIN 仿真厨房桌面里，GR-1 按语言指令连续完成「打开抽屉」「把蓝色方块推到左边」「打开灯泡」等一串子任务。","related":["视频预测模型","字节 GR-2","字节 GR-3","CALVIN","语言条件策略","预训练"]},{"id":"gr-2","category":"named_model","sec":7,"tier":3,"sources":[{"title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation (arXiv 2410.06158)","url":"https://arxiv.org/abs/2410.06158"},{"title":"GR-2 论文 HTML 全文","url":"https://arxiv.org/html/2410.06158v1"}],"as_of":"2024-10","related_ids":["gr-1","seed-gr-3","video-generation-model","pretraining-on-human-videos","conditional-variational-autoencoder","bin-picking"],"name":"字节 GR-2","alt":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation (ByteDance)","abbr":"GR-2","aliases":["字节跳动 GR-2"],"one_liner":"字节跳动 2024 年的第二代操作模型，先在 3800 万段网络视频上预训练。","explanation":"GR-2 由字节跳动研究团队 2024 年 10 月发布，是 GR-1 的升级版，作者称之为「视频-语言-动作模型」。第一阶段在 3800 万段互联网视频（超过 500 亿 token）上做视频生成预训练，数据来自 Howto100M、Ego4D、Something-Something V2、EPIC-KITCHENS 等人类日常视频，让模型学会画面接下来会怎么变；第二阶段用机器人轨迹微调，同时预测未来画面和动作轨迹。图像用 VQGAN 切成离散 token，动作轨迹由条件变分自编码器（CVAE）生成。报告称它在 100 多个任务上平均成功率 97.7%，对新背景、新环境、新物体和新任务的泛化也较强。真机部署在 Kinova Gen3 机械臂上，配合轨迹优化和实时跟踪的全身控制算法执行动作。","example":"在工业无序抓取实验中，要从杂乱料箱里挑出指定物品，覆盖 122 种物体（其中 67 种训练时没见过），GR-2 平均成功率 79.0%，GR-1 只有 33.3%。","related":["字节 GR-1","字节 GR-3","视频生成模型","人类视频预训练","条件变分自编码器","无序抓取"]},{"id":"seed-gr-3","category":"named_model","sec":7,"tier":2,"sources":[{"title":"GR-3 Technical Report (arXiv:2507.15493)","url":"https://arxiv.org/abs/2507.15493"}],"as_of":"2025-07","related_ids":["gr-2","gr-1","bytedance-seed","vision-language-action-model","flow-matching","co-training"],"name":"字节 GR-3","alt":"Seed GR-3 (ByteDance Seed Generalist Robot Model 3)","abbr":"GR-3","aliases":["Seed GR-3"],"one_liner":"字节跳动 Seed 2025 年发布的约 40 亿参数通用机器人 VLA 模型。","explanation":"GR-3 是字节跳动 Seed 团队 2025 年 7 月发布的视觉-语言-动作模型，接续 GR-1、GR-2。它约 40 亿参数，以 Qwen2.5-VL-3B 为视觉语言骨干，后接用流匹配训练的扩散 Transformer 动作头，一次生成一段动作块。训练数据有三类：机器人轨迹做模仿学习；网络图文数据协同训练，保住对新物体和抽象指令的理解；VR 设备采集的人类轨迹做少样本适配，论文报告对没见过的物体每个只加 10 条，抓放成功率就从 57.8% 提到 86.7%。配套机器人 ByteMini 是 22 自由度的双臂移动平台，GR-3 在长程收拾餐桌和挂衣服等任务上都超过 π0。","example":"挂衣服任务里，GR-3 控制 ByteMini 的两只手臂配合，把衣架穿进衣服再挂到晾衣架上，属于双臂柔性物体操作。","related":["字节 GR-2","字节 GR-1","字节跳动 Seed","视觉-语言-动作模型","流匹配","协同训练"]},{"id":"gr-dexter","category":"named_model","sec":7,"tier":3,"sources":[{"title":"GR-Dexter Technical Report (arXiv 2512.24210)","url":"https://arxiv.org/abs/2512.24210"},{"title":"GR-Dexter 技术报告 HTML 全文","url":"https://arxiv.org/html/2512.24210v2"}],"as_of":"2025-12","related_ids":["dexterous-manipulation","bimanual-manipulation","dexterous-hand","seed-gr-3","vision-language-action-model","data-glove"],"name":"字节 GR-Dexter","alt":"GR-Dexter (ByteDance Seed VLA for bimanual high-DoF dexterous-hand robots)","abbr":"GR-Dexter","aliases":["GR-Dexter Technical Report"],"one_liner":"字节 Seed 2025 年底发布的双臂灵巧手 VLA，把手、遥操作和模型一起做。","explanation":"GR-Dexter 由字节跳动 Seed 团队 2025 年 12 月底以技术报告形式发布。多数 VLA（视觉-语言-动作模型）只控制二指夹爪；换成双手高自由度灵巧手后，动作空间变大、手常挡住物体、真机数据也更贵。GR-Dexter 把硬件、数据和模型放在一起解决：自研 21 自由度、连杆驱动的 ByteDexter V2 灵巧手，指尖带压阻式触觉传感器，装在两台 Franka Research 3 机械臂上；用 Meta Quest 头显加 Manus 数据手套做双手遥操作采数据；模型沿用 GR-3 的混合 Transformer 结构，约 40 亿参数，训练时混合遥操作轨迹、视觉语言数据、筛选过的跨本体数据，以及 800 多小时人类手部轨迹数据。","example":"长程任务「整理化妆品」在常规摆放下成功率 0.97，换成 5 种没见过的摆放后仍有 0.89；通用抓放任务面对 23 种没见过的物体，成功率 0.85。","related":["灵巧操作","双臂操作","灵巧手","字节 GR-3","视觉-语言-动作模型","数据手套"]},{"id":"gr-rl","category":"named_model","sec":7,"tier":3,"sources":[{"title":"GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation (arXiv 2512.01801)","url":"https://arxiv.org/abs/2512.01801"},{"title":"GR-RL 论文 HTML 全文","url":"https://arxiv.org/html/2512.01801v3"}],"as_of":"2025-12","related_ids":["seed-gr-3","reinforcement-fine-tuning","offline-reinforcement-learning","noise-space-policy-steering","data-curation","long-horizon-task"],"name":"字节 GR-RL","alt":"GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation (ByteDance Seed)","abbr":"","aliases":["GR-RL"],"one_liner":"字节 Seed 用强化学习把通用 VLA 练成专家，首个能自主穿鞋带的学习型策略。","explanation":"GR-RL 由字节跳动 Seed 团队 2025 年 12 月发布，以通用模型 GR-3 为起点。它的出发点是：常规 VLA 默认人类演示是最优的，但在精细的长程灵巧任务里，演示常带抖动和多余动作。GR-RL 分三步：先用稀疏奖励做离线强化学习，把学到的 Q 值当作「任务进度」估计，删掉对进度没有贡献的片段；再做形态对称增强，即左右翻转图像、交换左右腕部相机、同步改写指令里的左右，扩充数据；最后做在线强化学习，学一个隐空间噪声预测器，引导基于流匹配的策略往高回报方向输出，让训练和实际部署时的行为对齐。实验平台是带两条 7 自由度机械臂的轮式机器人 ByteMini-v2。","example":"穿鞋带：把鞋带依次穿过鞋上的多个鞋眼，需要长程规划、毫米级精度和对软鞋带的柔顺操作。GR-RL 成功率 83.3%，作者称这是首个能自主完成该任务的学习型策略。","related":["字节 GR-3","强化学习微调","离线强化学习","噪声空间策略引导","数据筛选","长程任务"]},{"id":"robix","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Robix (arXiv 2509.01106)","url":"https://arxiv.org/abs/2509.01106"},{"title":"Robix project page","url":"https://robix-seed.github.io/robix/"}],"as_of":"2025-09","related_ids":["seed-gr-3","hierarchical-architecture","dual-system-architecture","embodied-reasoning","llm-based-task-planning","bytedance-seed"],"name":"字节 Robix","alt":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning (ByteDance Seed)","abbr":"Robix","aliases":["Robix-7B","Robix-32B"],"one_liner":"字节 Seed 的机器人高层「大脑」模型，统一对话、推理和任务规划","explanation":"字节跳动 Seed 团队 2025 年 9 月发布，有 7B 和 32B 两个规模。它是分层机器人系统里的高层认知层：输入画面和用户的话，由一个视觉语言模型同时完成推理、长程任务规划和自然语言交互，输出给底层控制器的原子指令和对用户说的话；底层可以是字节自研的 GR-3 VLA 模型。它能主动发问澄清模糊指令、执行中被打断时实时改计划、结合常识推理（如按饮食要求筛选食物）。训练分三阶段：继续预训练增强空间理解等具身推理能力，监督微调把交互与规划统一成推理-动作序列，再用强化学习提升推理与行动的一致性。作者报告其在收拾餐桌、超市购物等真实任务上优于商用大模型基线。","example":"比如用户让机器人收拾餐桌，中途又说「杯子先别收」，Robix 会立即改计划、口头确认，再给底层 VLA 下发新的原子指令。","related":["字节 GR-3","分层架构","快慢双系统","具身推理","大模型任务规划","字节跳动 Seed"]},{"id":"era-42","category":"named_model","sec":7,"tier":3,"sources":[{"title":"星动纪元官网 · ERA-42 模型页","url":"https://www.robotera.com/model"},{"title":"星动纪元官网 · 关于我们","url":"https://www.robotera.com/about/us"}],"as_of":"2025-11","related_ids":["robotera","vision-language-action-model","video-prediction-policy","ctrl-world","robotera-xhand1","robotera-l7"],"name":"星动纪元 ERA-42","alt":"ERA-42 (Robot Era end-to-end native robot model)","abbr":"","aliases":["ERA-42","ERA42","星动纪元端到端 VLA 具身模型"],"one_liner":"星动纪元 2024 年底发布的端到端 VLA 具身模型，驱动其灵巧手和人形机器人。","explanation":"ERA-42 是北京星动纪元的具身大模型，官网称「端到端 VLA 具身模型」。星动纪元 2023 年 8 月成立，创始人是清华交叉信息研究院助理教授陈建宇，清华持股。按官网时间线，ERA-42 于 2024 年 12 月发布，首版在单臂加五指灵巧手上演示；2025 年 3 月迁移到双臂，7 月用同一个模型驱动全尺寸人形机器人 L7 全身 55 个自由度。官网列出的技术积累包括视频预测策略 VPP、UP-VLA、在线强化学习 iRe-VLA、可控世界模型 Ctrl-World 等论文。官方称已具备 100 种灵巧操作技能，在物流、制造、商业服务中落地；结构和参数量未完整公开。","example":"星动纪元的仓储方案里，机器人基于 ERA-42 走完「下单—出库—拣选—扫码—装箱」流程，用 12 自由度 XHAND1 灵巧手抓取异形药盒并翻面扫码。","related":["星动纪元","视觉-语言-动作模型","视频预测策略","Ctrl-World","星动纪元 XHAND1 灵巧手","星动纪元 L7"]},{"id":"agibot-go-1","category":"named_model","sec":7,"tier":2,"sources":[{"title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems (arXiv 2503.06669)","url":"https://arxiv.org/abs/2503.06669"},{"title":"OpenDriveLab/AgiBot-World（GitHub，含 GO-1 / GO-1 Air 开源说明）","url":"https://github.com/OpenDriveLab/AgiBot-World"}],"as_of":"2025-09","related_ids":["vision-language-latent-action","latent-action","agibot-world","agibot-go-2","action-expert","agibot"],"name":"智元 GO-1（启元大模型）","alt":"Genie Operator-1 (AgiBot GO-1)","abbr":"GO-1","aliases":["启元大模型","Genie Operator-1","GO-1 Air"],"one_liner":"智元机器人 2025 年发布的通用具身基座模型，用「潜在动作」让人类视频也能参与训练。","explanation":"GO-1 是智元机器人（AgiBot）2025 年 3 月 10 日随 AgiBot World 数据集技术报告一起发布的通用操作策略，中文名启元大模型。它提出 ViLLA（视觉-语言-潜在动作）框架，分三段：潜在动作模型把相邻画面的变化压成离散的潜在动作 token，可以在 Ego4D 这类没有动作标签的人类视频上学；潜在规划器以 InternVL2.5-2B 视觉语言模型为骨干，根据图像和指令预测这些 token；动作专家再用扩散目标输出连续的高频动作。论文称在 AgiBot World（100 台机器人采集的 100 多万条轨迹）上预训练，比用 Open X-Embodiment 平均提升 30%；GO-1 在复杂真机任务上成功率超过 60%，比 RDT 高 32%。模型 2025 年 9 月开源，同时放出去掉潜在规划器的轻量版 GO-1 Air，后继是 2026 年的 GO-2。","example":"开源的 GO-1 权重放在 Hugging Face 上，官方说明推理约需 7GB 显存，全参数微调（批大小 16）约需 70GB 显存。","related":["ViLLA 架构","潜在动作","AgiBot World 数据集","智元 GO-2（Genie Operator-2）","动作专家","智元机器人"]},{"id":"agibot-go-2","category":"named_model","sec":7,"tier":2,"sources":[{"title":"AGIBOT Unveils Genie Operator-2 (GO-2) Next-Gen Embodied Foundation Model","url":"https://www.agibot.com/article/231/detail/56.html"},{"title":"AGIBOT Unveils New Generation of Embodied AI Robots and Models (APC 2026, 2026-04-17)","url":"https://www.agibot.com/article/231/detail/63.html"},{"title":"ACoT-VLA (AgibotTech GitHub)","url":"https://github.com/AgibotTech/ACoT-VLA"}],"as_of":"2026-04","related_ids":["agibot-go-1","vision-language-latent-action","action-chain-of-thought","dual-system-architecture","agibot","libero-benchmark"],"name":"智元 GO-2（Genie Operator-2）","alt":"AgiBot Genie Operator-2 (GO-2)","abbr":"GO-2","aliases":["Genie Operator-2","GO-2（ViLLA）"],"one_liner":"智元 2026 年发布的第二代具身基座模型，先在动作空间里规划再执行","explanation":"智元机器人（AgiBot）2026 年 4 月 17 日在上海「2026 合作伙伴大会」上发布的具身基座模型，是 2025 年 GO-1 的后继，官方称它为 ViLLA 具身基座模型。核心有两点：一是「动作思维链」，模型先在动作空间里生成一串粗粒度的动作意图作为宏观计划，而不是先写文字或生成图像再推出动作，相关论文 ACoT-VLA 被 CVPR 2026 接收；二是异步双系统，低频的语义规划模块出计划，高频的动作跟随模块结合实时观测输出控制信号，这部分设计被 ACL 2026 接收。官方报告 LIBERO 平均成功率 98.5%、LIBERO-Plus 零样本 86.6%。同场发布的还有世界动作模型 GE-2，用来在虚拟环境里测试策略。","example":"官方称只用仿真数据训练的 GO-2，在真机测试中成功率达到 82.9%。","related":["智元 GO-1（启元大模型）","ViLLA 架构","动作思维链","快慢双系统","智元机器人","LIBERO"]},{"id":"enerverse","category":"named_model","sec":7,"tier":3,"sources":[{"title":"EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation (arXiv 2501.01895)","url":"https://arxiv.org/abs/2501.01895"},{"title":"EnerVerse 项目页","url":"https://sites.google.com/view/enerverse"}],"as_of":"2025-11","related_ids":["video-prediction-model","world-model","genie-envisioner","3d-gaussian-splatting","multi-view","video-prediction-policy"],"name":"EnerVerse","alt":"EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation","abbr":"","aliases":["EnerVerse-A","EnerVerse-D"],"one_liner":"智元等提出的生成式机器人模型：先用视频扩散预测未来多视角画面，再出动作。","explanation":"EnerVerse 由智元机器人与上海人工智能实验室等团队于 2025 年 1 月发布，后被 NeurIPS 2025 接收。思路是先预测未来、再决定动作：用自回归视频扩散模型根据指令逐段生成未来的「具身空间」画面，并用稀疏上下文记忆支撑长任务。为表达三维场景，作者提出 Free Anchor Views（自由锚定视角），即按任务灵活选取的多视角视频表示。EnerVerse-A 是接在生成模型后的策略头，把预测出的 4D 表示转成机器人动作；EnerVerse-D 是把生成模型与 4D 高斯泼溅结合的数据引擎，用来自动造数据、缩小仿真与真实的差距。","example":"给出一条操作指令后，模型先生成几个视角下机器人完成任务的未来视频片段，策略头再据此输出动作；论文报告约 280 毫秒可输出一段 8 步动作。","related":["视频预测模型","世界模型","智元 Genie Envisioner 世界模型","3D高斯泼溅","多视角","视频预测策略"]},{"id":"genie-envisioner","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Genie Envisioner (arXiv:2508.05635)","url":"https://arxiv.org/abs/2508.05635"},{"title":"AgibotTech/Genie-Envisioner (GitHub)","url":"https://github.com/AgibotTech/Genie-Envisioner"},{"title":"GE-Act 2.0 项目主页","url":"https://ge-act-v2.github.io/"}],"as_of":"2026-09","related_ids":["agibot","world-action-model","agibot-world","ewmbench","neural-simulator","agibot-go-1"],"name":"智元 Genie Envisioner 世界模型","alt":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation (AgiBot)","abbr":"GE","aliases":["GE-Base","GE-Act","GE-Sim","GE-Act 2.0"],"one_liner":"智元机器人把视频世界模型、策略、神经仿真器和评测合为一体的平台","explanation":"智元机器人（AgiBot）团队 2025 年 8 月发布的机器人操作平台。核心 GE-Base 是一个按语言指令生成视频的扩散模型，在 AgiBot World 约 100 万条、共 2967 小时的双臂真机数据上训练，学会预测接下来画面会怎么变。GE-Act 用约 1.6 亿参数的流匹配解码器把 GE-Base 的隐表示转成动作；GE-Sim 输入动作生成未来画面，当神经仿真器做闭环评测；EWMBench 用来衡量这类世界模型的质量。代码和权重已开源。2026 年 9 月的 GE-Act 2.0 改为全部在操作数据上从零训练，由自编码器、单步视觉规划器和逆动力学模型串成。","example":"论文中每个任务只用约 1 小时数据适配，GE-Act 就能迁移到松灵 Cobot Magic 等其他双臂平台上执行操作任务。","related":["智元机器人","世界动作模型","AgiBot World 数据集","EWMBench 具身世界模型评测","神经模拟器","智元 GO-1（启元大模型）"]},{"id":"robobrain","category":"named_model","sec":7,"tier":3,"sources":[{"title":"arXiv 2502.21257: RoboBrain (CVPR 2025)","url":"https://arxiv.org/abs/2502.21257"},{"title":"arXiv 2507.02029: RoboBrain 2.0 Technical Report","url":"https://arxiv.org/abs/2507.02029"},{"title":"GitHub: FlagOpen/RoboBrain2.5","url":"https://github.com/FlagOpen/RoboBrain2.5"}],"as_of":"2026-03","related_ids":["embodied-foundation-model","braincerebellum-architecture","affordance","spatial-reasoning","roboos","beijing-academy-of-artificial-intelligence"],"name":"智源 RoboBrain（具身大脑）","alt":"RoboBrain (BAAI embodied brain model)","abbr":"","aliases":["RoboBrain 1.0","RoboBrain 2.0","RoboBrain 2.5","具身大脑"],"one_liner":"北京智源研究院开源的具身「大脑」模型系列，负责任务规划和空间理解","explanation":"RoboBrain 是北京智源人工智能研究院（BAAI）推出的开源具身大脑模型系列。它看图、听指令，输出任务拆解、可供性（物体哪里能抓、能按）和末端轨迹等中间结果，交给下层控制器执行，本身不直接输出电机指令。1.0 版 2025 年 2 月发布、被 CVPR 2025 录用，配套标注数据集 ShareRobot；2.0 版 2025 年 7 月发布技术报告，有 7B 和 32B 两个尺寸，增加空间指代、多机协作的长程规划等能力；2.5 版 2026 年 1 月起陆续放出 8B、4B 权重，从在 2D 图上点坐标升级为预测带深度的 3D 空间轨迹，并加入估计任务进度的通用奖励模型。它是国内「大脑-小脑」分层路线里开源较完整的一套大脑模型。","example":"给一张厨房照片和指令「把碗放进微波炉」，RoboBrain 先拆出子步骤，再在图上标出碗该抓的位置和手的移动轨迹，由底层控制器去执行。","related":["具身大模型","大脑-小脑架构（大小脑）","可供性","空间推理","RoboOS","北京智源人工智能研究院"]},{"id":"govla","category":"named_model","sec":7,"tier":3,"sources":[{"title":"智平方发布全新一代智能机器人AlphaBot 2，开启AGI终端新时代！（智平方官网）","url":"https://ai2robotics.com/%E6%99%BA%E5%B9%B3%E6%96%B9%E5%8F%91%E5%B8%83%E5%85%A8%E6%96%B0%E4%B8%80%E4%BB%A3%E6%99%BA%E8%83%BD%E6%9C%BA%E5%99%A8%E4%BA%BAalphabot-2%E5%BC%80%E5%90%AFagi%E7%BB%88%E7%AB%AF%E6%96%B0/"}],"as_of":"2025-04","related_ids":["ai2-robotics","ai2-robotics-alphabot","dual-system-architecture","vision-language-action-model","robomamba","mobile-manipulation"],"name":"智平方 GOVLA（AlphaBrain）","alt":"GOVLA (Global & Omni-body Vision-Language-Action) / Alpha Brain (AI² Robotics)","abbr":"GOVLA","aliases":["AlphaBrain","Alpha Brain","全域全身 VLA","AI2R Brain"],"one_liner":"智平方的全域全身 VLA 大模型，能同时输出全身动作和移动轨迹","explanation":"智平方科技（AI² Robotics）2025 年 4 月发布 AlphaBot 2 机器人时推出，同时把原具身大模型品牌 AI2R Brain 升级为 Alpha Brain，其核心就是 GOVLA（全域全身视觉-语言-动作模型）。它由空间交互基础模型、慢系统和快系统三部分组成：慢系统（System 2）负责复杂推理、拆解任务和语言交互，快系统（System 1）输出全身控制动作和移动轨迹。官方的说法是常规 VLA 只输出机械臂动作、只能在桌面范围操作，GOVLA 面向从桌面到开放环境、从单臂到全身协同的任务，并在构建中融入了 DeepSeek 的技术来增强长程推理。","example":"官方举例：常规 VLA 机器人要人把食材放到桌上才能操作，搭载 GOVLA 的机器人可以自己去冰箱取食材、做好早餐再送到餐桌。","related":["智平方","智平方 AlphaBot","快慢双系统","视觉-语言-动作模型","RoboMamba","移动操作"]},{"id":"graspvla","category":"named_model","sec":7,"tier":3,"sources":[{"title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data (arXiv 2505.03233)","url":"https://arxiv.org/abs/2505.03233"},{"title":"GraspVLA 项目页","url":"https://pku-epic.github.io/GraspVLA-web/"}],"as_of":"2025-08","related_ids":["syngrasp-1b","synthetic-data","sim-to-real-transfer","domain-randomization","flow-matching","grasping"],"name":"银河通用 GraspVLA","alt":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data (Galbot)","abbr":"","aliases":["GraspVLA"],"one_liner":"银河通用等 2025 年发布的抓取大模型，主要靠十亿帧仿真合成数据预训练。","explanation":"GraspVLA 由银河通用机器人（Galbot）联合北京大学王鹤团队、香港大学、北京智源人工智能研究院提出，2025 年 5 月发布，发表于 CoRL 2025。真机数据贵且难扩大规模，团队改在仿真里大规模生成：SynGrasp-1B 数据集约 10 亿帧，覆盖 240 类、1 万多个物体模型，对初始姿态、摆放、背景、光照、材质做大量随机化（域随机化），并用照片级渲染缩小虚实差距。模型采用「渐进式动作生成」：先自回归地预测目标物体的 2D 检测框，再预测抓取位姿，最后用流匹配生成动作块；训练时把合成数据和互联网图文数据一起用，让它能按开放词汇指令抓没见过类别的物体。数据集和模型权重已开源。","example":"只用合成数据预训练后，模型可以零样本抓取真实桌面上没见过的物体；若某个场景要求特定抓法，再用少量真机示范做少样本微调即可。","related":["SynGrasp-1B 数据集","合成数据","仿真到现实迁移","域随机化","流匹配","抓取"]},{"id":"astrabrain","category":"named_model","sec":7,"tier":3,"sources":[{"title":"银河通用官网（银河星脑 AstraBrain 架构介绍）","url":"https://www.galbot.com/"},{"title":"中国唯一具身智能大模型重点实验室，银河通用牵头获批！（银河通用公众号，2026-08-10）","url":"https://mp.weixin.qq.com/s/6IdDqb0yxYQU7eQKAsolDw"},{"title":"颠覆后训练范式！无需人类动作标签，银河通用WAM-TTT让机器人换厨房不丢手艺（腾讯科技，2026-07-16）","url":"https://mp.weixin.qq.com/s/LMtt3FGB6zyB7Boex4S6kg"}],"as_of":"2026-08","related_ids":["braincerebellum-architecture","world-action-model","learning-based-whole-body-control","scaling-law","graspvla","trackvla"],"name":"银河星脑 AstraBrain","alt":"AstraBrain (Galbot embodied model family)","abbr":"","aliases":["银河星脑","AstraBrain-WBC","AstraBrain-WAM","AstraBrain-Dex"],"one_liner":"银河通用的具身大模型体系，把「大脑」规划、「小脑」全身控制连成一套。","explanation":"银河星脑是北京人形机器人公司银河通用（Galbot）对自家具身大模型的统称，官方称采用「大脑—小脑—神经控制」端到端架构。AstraBrain-WAM 是「大脑」，属于世界动作模型（同时预测未来画面和生成动作），官网标注 30 亿至 130 亿参数、以 5–10Hz 输出高层指令，负责理解任务和长程规划，官方称可统一利用仿真与真机、人与机器人、有无动作标签的数据；AstraBrain-WBC 是「小脑」，8000 万至 3 亿参数的 Transformer，以 100–250Hz 做全身和手部实时控制，用大规模人类动作数据训练；AstraBrain-Dex 是面向灵巧手的世界模型。2026 年公开的 WAM 0.5、WBC 0.5 和测试时训练框架 WAM-TTT 都属于这一体系。以上多为厂商口径。","example":"2026 年银河通用演示人形机器人自主打网球：看见来球、预测轨迹、跑位击球并保持平衡，官方称这是大脑与小脑模型协同完成的全身控制。","related":["大脑-小脑架构（大小脑）","世界动作模型","学习型全身控制","缩放定律","银河通用 GraspVLA","银河通用 TrackVLA"]},{"id":"worldvla","category":"named_model","sec":7,"tier":3,"sources":[{"title":"WorldVLA (arXiv:2506.21539)","url":"https://arxiv.org/abs/2506.21539"},{"title":"alibaba-damo-academy/WorldVLA (GitHub)","url":"https://github.com/alibaba-damo-academy/WorldVLA"}],"as_of":"2025-11","related_ids":["world-action-model","vision-language-action-model","autoregressive-decoding","attention-mask","rynnvla-002","alibaba-damo-academy"],"name":"WorldVLA","alt":"WorldVLA: Towards Autoregressive Action World Model","abbr":"","aliases":[],"one_liner":"阿里达摩院把 VLA 和世界模型合进一个自回归模型，既出动作又预测下一帧","explanation":"阿里达摩院 2025 年 6 月发布的工作，基于 Chameleon 这类图文统一的自回归模型，把图像、文字、动作都转成 token 放进同一个 Transformer。同一模型兼任两个角色：作为动作模型，根据画面和指令生成动作；作为世界模型，根据当前画面和动作预测下一帧画面。作者发现两者联合训练能互相提升。另一个发现是自回归地连续生成多个动作时，前面动作的误差会传给后面，于是提出一种注意力掩码，生成当前动作时屏蔽之前的动作、只看图像和指令，在 LIBERO 上明显改善多步动作生成。2025 年 11 月项目升级为 RynnVLA-002。","example":"在 LIBERO 仿真任务中，同一个模型既能输出机械臂下一段动作，也能在给定动作后生成接下来的画面帧。","related":["世界动作模型","视觉-语言-动作模型","自回归解码","注意力掩码","达摩院 RynnVLA-002","阿里达摩院"]},{"id":"rynnvla-002","category":"named_model","sec":7,"tier":3,"sources":[{"title":"RynnVLA-002: A Unified Vision-Language-Action and World Model (arXiv 2511.17502)","url":"https://arxiv.org/abs/2511.17502"},{"title":"alibaba-damo-academy/RynnVLA-002 (GitHub)","url":"https://github.com/alibaba-damo-academy/RynnVLA-002"},{"title":"alibaba-damo-academy/RynnVLA-001 (GitHub)","url":"https://github.com/alibaba-damo-academy/RynnVLA-001"}],"as_of":"2026-05","related_ids":["world-action-model","world-model","vision-language-action-model","worldvla","libero-benchmark","rynnbrain"],"name":"达摩院 RynnVLA-002","alt":"RynnVLA-002: A Unified Vision-Language-Action and World Model (Alibaba DAMO)","abbr":"","aliases":["RynnVLA"],"one_liner":"阿里达摩院把动作模型和世界模型合进同一个自回归网络的开源 VLA","explanation":"阿里巴巴达摩院 2025 年 11 月发布并开源。前作 RynnVLA-001（2025 年 8 月）是一个 7B 参数的 VLA，先在人类第一视角视频上做视频生成预训练，再把学到的操作技能迁移到机械臂。RynnVLA-002 把两类模型合在一起：VLA 部分根据图像和语言指令输出动作，世界模型部分根据当前画面和动作预测接下来的画面。两者共用一个基于 Chameleon 的自回归主干，把图像、文字和动作都当作 token 处理，另加一个输出连续动作的 Action Transformer，并支持腕部相机和机器人状态输入。作者的观点是：学会预测「动作会让画面怎样变化」能帮模型理解物理规律，反过来提升动作质量。论文报告它在不做预训练的情况下 LIBERO 仿真基准成功率 97.4%，在 LeRobot 真机任务上加入世界模型后成功率提升约 50%。","example":"同一个模型既能根据「把积木放进盒子」输出下一段机械臂动作，也能根据给定的动作生成执行后腕部相机会看到的画面。","related":["世界动作模型","世界模型","视觉-语言-动作模型","WorldVLA","LIBERO","达摩院 RynnBrain"]},{"id":"rynnbrain","category":"named_model","sec":7,"tier":3,"sources":[{"title":"alibaba-damo-academy/RynnBrain (GitHub)","url":"https://github.com/alibaba-damo-academy/RynnBrain"},{"title":"RynnBrain: Open Embodied Foundation Models (arXiv 2602.14979)","url":"https://arxiv.org/abs/2602.14979"},{"title":"RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model (arXiv 2607.17977)","url":"https://arxiv.org/abs/2607.17977"}],"as_of":"2026-07","related_ids":["alibaba-damo-academy","embodied-foundation-model","embodied-reasoning-model","braincerebellum-architecture","rynnvla-002","mixture-of-experts"],"name":"达摩院 RynnBrain","alt":"RynnBrain: Open Embodied Foundation Models (Alibaba DAMO)","abbr":"","aliases":["RynnBrain 1.0","RynnBrain 1.1"],"one_liner":"阿里达摩院开源的具身「大脑」模型，负责看懂第一视角画面、定位物体和做任务规划","explanation":"阿里巴巴达摩院 2026 年 2 月开源，定位是给机器人当「大脑」的时空基础模型，而不是直接输出电机指令的策略。它把四种能力放进一个模型：第一视角视频理解、在视频里定位物体和可操作部位的时空定位、结合物理常识的推理，以及任务规划。1.0 版有 2B、8B 和 30B-A3B 三种规模（后者是混合专家模型，总参数 30B、每次约激活 3B），并后训练出 RynnBrain-Nav（导航）、-Plan（规划）、-VLA（动作）和面向空间推理的 -CoP 等版本，同时发布评测基准 RynnBrain-Bench。2026 年 7 月的 1.1 版以 Qwen3.5 为底座，规模扩到 2B、9B 和 122B-A10B（最大的是混合专家模型），新增接触点预测，2B 和 9B 版还支持原生 3D 定位；官方称最大模型在 VSI-Bench、MMSI、RefSpatial-Bench 三个空间推理基准上超过所评测的闭源和开源模型。代码和权重以 Apache 2.0 协议开放。","example":"收到「把桌上的杯子放进水槽」时，RynnBrain 先在第一视角画面里标出杯子和水槽的位置，再拆出「走到桌边、抓起杯子、走到水槽、放下」几步，交给下层动作模型执行。","related":["阿里达摩院","具身大模型","具身推理模型","大脑-小脑架构（大小脑）","达摩院 RynnVLA-002","混合专家模型"]},{"id":"being-h0","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos (arXiv 2507.15597)","url":"https://arxiv.org/abs/2507.15597"},{"title":"Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization (arXiv 2601.12993)","url":"https://arxiv.org/abs/2601.12993"},{"title":"BeingBeyond/Being-H0 GitHub","url":"https://github.com/BeingBeyond/Being-H0"}],"as_of":"2026-05","related_ids":["pretraining-on-human-videos","unihand","vision-language-action-model","dexterous-manipulation","cross-embodiment","beingbeyond"],"name":"智在无界 Being-H0","alt":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos (BeingBeyond)","abbr":"","aliases":["Being-H0.5","Being-H0.7","Being-H 系列"],"one_liner":"智在无界用大规模人手操作视频预训练的灵巧操作 VLA 模型系列。","explanation":"Being-H0 是北京大学、中国人民大学与具身公司智在无界（BeingBeyond）2025 年 7 月发布的视觉-语言-动作模型，后被 ICML 2026 接收。思路是把人手当作通用操作器：先在人手操作数据上预训练，用分部位的动作分词器把手腕、手指动作压成 token，再做 3D 空间对齐，最后用少量机器人数据后训练，迁移到灵巧手上。配套数据集 UniHand 汇集动捕、VR 和普通视频，约 1100 小时、1.65 亿条指令样本。2026 年 1 月的 Being-H0.5 把数据扩到 3.5 万多小时、覆盖 30 种本体，主打跨本体；4 月的 Being-H0.7 改为隐空间世界-动作模型。","example":"真机实验中，研究者把 Being-H0 后训练到装有因时六自由度灵巧手的 Franka 机械臂上做灵巧操作任务。","related":["人类视频预训练","UniHand 数据集","视觉-语言-动作模型","灵巧操作","跨本体","智在无界"]},{"id":"galaxea-g0-dual-system-vla","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model (arXiv 2509.00576)","url":"https://arxiv.org/abs/2509.00576"},{"title":"OpenGalaxea/GalaxeaVLA（GitHub）","url":"https://github.com/OpenGalaxea/GalaxeaVLA"}],"as_of":"2026-08","related_ids":["galaxea-ai","dual-system-architecture","galaxea-open-world-dataset","galaxea-r1","paligemma","vision-language-action-model"],"name":"星海图 G0","alt":"Galaxea G0 Dual-System VLA","abbr":"","aliases":["G0","G0-VLA","Galaxea G0"],"one_liner":"星海图 2025 年开源的快慢双系统机器人模型：VLM 拆解任务，VLA 执行动作。","explanation":"G0 是具身智能公司星海图（Galaxea AI）在 2025 年 8 月底发布、9 月开源的双系统机器人大模型，与 Galaxea 开放世界数据集一同推出。它按快慢双系统拆分：慢系统 G0-VLM 以 Qwen2.5-VL 为基础微调，负责听懂指令、把长任务拆成子任务；快系统 G0-VLA 的视觉语言骨干从 PaliGemma 初始化，根据画面、本体状态和子任务指令输出动作。训练分三阶段：先在 OXE 等多种机器人的数据上做跨本体预训练，再在自家单一本体数据上预训练，最后针对具体任务后训练。论文发现第二阶段，也就是在同一种机器人上的真实数据预训练最关键。数据集用星海图 R1 Lite 在家庭、商超、餐饮、办公等 50 个真实场景采集，约 500 小时、10 万条轨迹。之后星海图又发布了 G0Plus（2026 年 1 月）和 G0.5（2026 年 6 月）。","example":"用户说「帮我铺床」，G0-VLM 把它拆成一串子任务指令，G0-VLA 按指令驱动 R1 Lite 的双臂和底盘一步步执行，直到把床铺好。","related":["星海图","快慢双系统","星海图开放世界数据集","星海图 R1","PaliGemma","视觉-语言-动作模型"]},{"id":"eo-1","category":"named_model","sec":7,"tier":3,"sources":[{"title":"EO-1: An Open Unified Embodied Foundation Model for General Robot Control (arXiv 2508.21112)","url":"https://arxiv.org/abs/2508.21112"},{"title":"EO-1 GitHub 仓库","url":"https://github.com/EO-Robotics/EO1"},{"title":"EO-1 项目页","url":"https://eo-robotics.ai/eo-1"}],"as_of":"2026-02","related_ids":["vision-language-action-model","hybrid-autoregressive-diffusion-architecture","flow-matching","embodied-reasoning","shanghai-artificial-intelligence-laboratory","lerobot"],"name":"EO-1（EmbodiedOneVision）","alt":"EO-1: An Open Unified Embodied Foundation Model for General Robot Control","abbr":"EO-1","aliases":["EmbodiedOneVision","EO1","EO-Robotics"],"one_liner":"上海 AI Lab 开源的 3B 统一具身模型，同一网络既做推理问答又输出动作。","explanation":"EO-1 由上海人工智能实验室主导、智元提供真机支持，2025 年 8 月发布，权重、训练代码和数据全部开源。它以 Qwen2.5-VL-3B 为底座，是一个仅解码器的 Transformer：文字用自回归逐 token 生成，动作用流匹配去噪生成连续值，两种方式在同一模型里协同训练。配套数据集 EO-Data1.5M 含 150 万条「图像-文字-动作」交错样本，覆盖物理常识、任务推理、空间理解和操作轨迹，让模型在同一段上下文里边推理边动作。官方称它在 ERQA、LIBERO、SimplerEnv 和自建 EO-Bench 上超过当时的开源模型。","example":"真机测试覆盖 Franka、WidowX 250、智元 G-1 和 LeRobot SO100 四种机器人，任务包括长程灵巧操作和需要先推理再动手的任务。","related":["视觉-语言-动作模型","自回归-扩散混合架构","流匹配","具身推理","上海人工智能实验室","LeRobot"]},{"id":"internvla","category":"named_model","sec":7,"tier":3,"sources":[{"title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy (arXiv 2510.13778)","url":"https://arxiv.org/abs/2510.13778"},{"title":"InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation (arXiv 2601.02456)","url":"https://arxiv.org/abs/2601.02456"},{"title":"InternVLA-N1 项目主页","url":"https://internrobotics.github.io/internvla-n1.github.io/"}],"as_of":"2026-07","related_ids":["vision-language-action-model","dual-system-architecture","interndata-a1","vision-and-language-navigation","shanghai-artificial-intelligence-laboratory","world-action-model"],"name":"上海AI实验室 InternVLA 系列","alt":"InternVLA (Shanghai AI Laboratory: InternVLA-M1 / A1 / A1.5 / N1)","abbr":"","aliases":["InternVLA-M1","InternVLA-A1","InternVLA-A1.5","InternVLA-N1"],"one_liner":"上海 AI 实验室开源的一组具身模型：M1、A1 做操作，N1 做导航。","explanation":"InternVLA 是上海人工智能实验室具身团队（GitHub 组织 InternRobotics）开源的一组 VLA（视觉-语言-动作模型）。InternVLA-M1（2025 年 10 月）以 Qwen2.5-VL 为骨干，先用 230 万条框、点、轨迹标注做空间定位预训练，再用空间提示引导扩散 Transformer 动作专家出动作。InternVLA-A1（2026 年 1 月，有 2B 和 3B 两个尺寸）用混合 Transformer 架构把理解、未来画面预测、动作三个专家放进一个模型，在真机数据、合成仿真数据（如 InternData-A1）和人类视频上预训练，共 6.92 亿帧。A1.5（2026 年 7 月）改用 Qwen3.5-2B，训练时让冻结的 Wan2.2 视频模型监督「预见 token」，推理时不生成视频。InternVLA-N1 用于导航：慢系统在图像上标出路点，快系统用扩散策略以 30Hz 以上出轨迹。","example":"InternVLA-A1 做传送带分拣时，要先预判物体下一刻移到哪里再去抓；论文当前版本称在这类动态任务上比 π0.5 高 26.7%。","related":["视觉-语言-动作模型","快慢双系统","InternData-A1 数据集","视觉语言导航","上海人工智能实验室","世界动作模型"]},{"id":"wall-a","category":"named_model","sec":7,"tier":3,"sources":[{"title":"自变量机器人官网","url":"https://www.x2robot.com/"},{"title":"字节、阿里、美团首次在具身智能「同框」，十亿级融资背后，自变量到底凭什么？（智东西，2026-01-12）","url":"https://zhidx.com/p/528318.html"},{"title":"Igniting VLMs toward the Embodied Space (WALL-OSS, arXiv 2509.11766)","url":"https://arxiv.org/abs/2509.11766"}],"as_of":"2026-09","related_ids":["x-square-robot","wall-oss","vision-language-action-model","world-model","embodied-foundation-model","mixture-of-experts"],"name":"自变量 WALL-A","alt":"WALL-A (X Square Robot)","abbr":"","aliases":["WALL-A 操作大模型","WALL-A 系列"],"one_liner":"自变量机器人自研的闭源具身操作大模型系列，端到端从感知直到动作控制。","explanation":"WALL-A 是深圳具身智能公司自变量机器人（X Square Robot）自研的操作大模型系列，不开源，官网介绍它实现「从感知、理解到动作控制的全流程智能统一」，即端到端的视觉-语言-动作模型路线。据智东西 2026 年 1 月报道，WALL-A 系列把 VLA 与世界模型结合，用世界模型预测环境状态的时空变化，再与视觉一起做推理和动作决策。2025 年 9 月开源的 WALL-OSS 论文把 WALL-A 的结构画成共享自注意力、不同模态各用一套前馈层的紧耦合设计，WALL-OSS 沿用了这一思路，可看作 WALL-A 路线的开源版本。2026 年 4 月公司又发布世界统一模型 WALL-B，此后对外展示（家务、物流分拣等）多由 WALL-B 驱动。WALL-A 的首发时间和参数规模本条未能从公开资料核实。","example":"据智东西报道，自变量「量子一号」基于其模型完成了跨室外和室内的移动操作演示：在户外拆解、回收外卖纸盒，再自己穿过楼门、乘电梯送到室内。","related":["自变量机器人","自变量 WALL-OSS","视觉-语言-动作模型","世界模型","具身大模型","混合专家模型"]},{"id":"wall-oss","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Igniting VLMs toward the Embodied Space (arXiv:2509.11766)","url":"https://arxiv.org/abs/2509.11766"},{"title":"X-Square-Robot/wall-x (GitHub)","url":"https://github.com/X-Square-Robot/wall-x"},{"title":"x-square-robot/wall-oss-0.5 (Hugging Face)","url":"https://huggingface.co/x-square-robot/wall-oss-0.5"}],"as_of":"2026-06","related_ids":["x-square-robot","wall-a","vision-language-action-model","embodied-chain-of-thought","flow-matching","qwen-vl"],"name":"自变量 WALL-OSS","alt":"WALL-OSS (X Square Robot open-source embodied foundation model)","abbr":"","aliases":["WALL-OSS 0.5","WALL-OSS-FLOW","WALL-OSS-FAST"],"one_liner":"自变量机器人开源的具身基础模型，把视觉语言模型改造成能直接出动作的 VLA","explanation":"自变量机器人（X Square Robot）2025 年 9 月开源的具身基础模型，论文题为《Igniting VLMs toward the Embodied Space》。它以 Qwen2.5-VL-3B 为骨干，用紧耦合的混合专家结构（按训练任务把不同的前馈层分给不同目标），在一个可微的模型里串起「指令→推理→子任务规划→连续动作」。训练先用具身问答和 FAST 离散动作打底，再用流匹配学连续动作，数据超过 1 万小时。发布了 FLOW 和 FAST 两个版本，Apache-2.0 协议。2026 年 5 月推出 WALL-OSS 0.5（约 40 亿参数），主打预训练权重不经微调即可部署。","example":"用官方 wall-x 代码库加载 WALL-OSS-FLOW 权重，在自己采集的 LeRobot 格式数据上微调一个桌面收纳任务。","related":["自变量机器人","自变量 WALL-A","视觉-语言-动作模型","具身思维链","流匹配","通义千问 Qwen-VL"]},{"id":"unifolm","category":"named_model","sec":7,"tier":3,"sources":[{"title":"unitreerobotics/unifolm-world-model-action (GitHub)","url":"https://github.com/unitreerobotics/unifolm-world-model-action"},{"title":"unitreerobotics/unifolm-vla (GitHub)","url":"https://github.com/unitreerobotics/unifolm-vla"},{"title":"unitreerobotics/unifolm-wla (GitHub)","url":"https://github.com/unitreerobotics/unifolm-wla"}],"as_of":"2026-09","related_ids":["unitree-robotics","unitree-g1","world-action-model","vision-language-action-model","unitree-z1-robotic-arm","open-weight-model"],"name":"宇树 UnifoLM 系列","alt":"UnifoLM (Unitree: UnifoLM-WMA-0 / UnifoLM-VLA-0 / UnifoLM-WLA-1.0)","abbr":"","aliases":["UnifoLM-WMA-0","UnifoLM-VLA-0","UnifoLM-WLA-1.0"],"one_liner":"宇树科技开源的机器人大模型系列，涵盖世界模型、VLA 和人形通用模型","explanation":"宇树科技（Unitree）开源的机器人基础模型系列，主要有三款。UnifoLM-WMA-0（2025 年 9 月）是世界模型加动作头的架构：世界模型预测机器人与环境交互后的未来画面，既能配合动作头辅助决策，也能当交互式模拟器生成训练数据，支持 Z1 机械臂和 G1 人形。UnifoLM-VLA-0（2026 年 1 月）基于 Qwen2.5-VL，在操作数据上继续预训练，用单一策略在 G1 上完成 12 类操作任务。UnifoLM-WLA-1.0（2026 年 9 月）是 6B 参数的人形通用基础模型，官方称用约 2500 小时真机数据训练，覆盖桌面操作和全身操作 64 项任务，支持二指夹爪和多款五指灵巧手，以 Apache 2.0 许可开源。这个系列体现了宇树从卖本体硬件向开源模型延伸。","example":"UnifoLM-WMA-0 的世界模型可以预测宇树 Z1 机械臂叠箱子时接下来的画面，既能辅助选动作，也能生成合成训练数据。","related":["宇树科技","宇树 G1","世界动作模型","视觉-语言-动作模型","宇树 Z1 机械臂","开放权重"]},{"id":"wow","category":"named_model","sec":7,"tier":3,"sources":[{"title":"WoW (arXiv:2509.22642)","url":"https://arxiv.org/abs/2509.22642"},{"title":"WoW 项目主页","url":"https://wow-world-model.github.io/"}],"as_of":"2025-10","related_ids":["world-model","video-generation-model","inverse-dynamics-model","diffusion-transformer","beijing-humanoid-robot-innovation-center","xr-1"],"name":"WoW 具身世界模型","alt":"WoW: Towards a World omniscient World model Through Embodied Interaction","abbr":"WoW","aliases":["WoW-DiT"],"one_liner":"用 200 万条真机交互轨迹训练的 140 亿参数具身视频世界模型","explanation":"北京人形机器人创新中心联合北京大学、香港科技大学 2025 年 9 月发布。作者认为只看被动视频学不到真正的物理直觉，必须从大量带因果关系的交互中学，于是用 200 万条真实机器人轨迹（覆盖 12 种机器人平台）训练了一个 140 亿参数的扩散 Transformer 视频生成模型。生成视频常有物理错误，作者用 SOPHIA 框架让视觉语言模型当评审，反复检查结果并改写提示词，把生成往合理方向纠正；再用逆动力学模型（从前后帧反推动作）把预测视频翻译成机械臂动作。团队还发布了评测物理一致性和因果推理的 WoWBench。","example":"例如给定桌面画面和一句操作指令，WoW 先生成完成该操作的视频，再由逆动力学模块把视频转成末端执行器的 7 自由度动作去执行。","related":["世界模型","视频生成模型","逆动力学模型","扩散 Transformer","北京人形机器人创新中心","北京人形 XR-1"]},{"id":"pelican-vl","category":"named_model","sec":7,"tier":3,"sources":[{"title":"arXiv 2511.00108: Pelican-VL 1.0","url":"https://arxiv.org/abs/2511.00108"},{"title":"Hugging Face: X-Humanoid/Pelican1.0-VL-7B","url":"https://huggingface.co/X-Humanoid/Pelican1.0-VL-7B"},{"title":"Hugging Face: X-Humanoid 组织页","url":"https://huggingface.co/X-Humanoid"}],"as_of":"2026-09","related_ids":["embodied-reasoning-model","vision-language-model","qwen-vl","group-relative-policy-optimization","braincerebellum-architecture","beijing-humanoid-robot-innovation-center"],"name":"北京人形 Pelican-VL","alt":"Pelican-VL: A Foundation Brain Model for Embodied Intelligence (X-Humanoid)","abbr":"","aliases":["Pelican-VL 1.0","Pelican1.0-VL"],"one_liner":"北京人形机器人创新中心开源的具身「大脑」视觉语言模型","explanation":"北京人形机器人创新中心（X-Humanoid）2025 年 10 月底发布技术报告、11 月开源权重的具身大脑模型，基于 Qwen2.5-VL，首批开源 7B 和 72B 两个规格（Apache 2.0）。它不直接输出关节动作，而是负责空间理解、可供性推理、任务规划和函数调用，给下层控制器或 VLA 下指令。训练上提出 DPPO（刻意练习策略优化）：先用 GRPO 强化学习找出模型做不好的难例，再把难例整理成数据做监督微调，RL 与 SFT 循环交替。报告称相对基座平均提升 20.3%，在 Where2Place、RefSpatialBench 等具身基准上领先同量级开源模型。其 Hugging Face 主页后来又上传了 3B、235B-A22B 等规格。","example":"报告中的真机实验：模型根据画面预测并持续修正抓取力度，完成接触丰富的抓取；另一个实验里由它充当统一的「大脑」，调度多台不同机器人完成长程任务。","related":["具身推理模型","视觉语言模型","通义千问 Qwen-VL","组相对策略优化","大脑-小脑架构（大小脑）","北京人形机器人创新中心"]},{"id":"xr-1","category":"named_model","sec":7,"tier":3,"sources":[{"title":"XR-1 (arXiv:2511.02776)","url":"https://arxiv.org/abs/2511.02776"},{"title":"XR-1 论文 HTML 版","url":"https://arxiv.org/html/2511.02776"}],"as_of":"2026-09","related_ids":["cross-embodiment","vector-quantized-variational-autoencoder","latent-action","beijing-humanoid-robot-innovation-center","tiangong","pi0"],"name":"北京人形 XR-1","alt":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","abbr":"XR-1","aliases":["X-Humanoid XR-1","XR-1-Light"],"one_liner":"北京人形用「视觉-运动统一编码」做跨本体预训练的 VLA 基础模型","explanation":"北京人形机器人创新中心 2025 年 11 月发布（部分作者同时任职于北京大学、北京航空航天大学），论文被 ICML 2026 接收为口头报告。核心是 UVMC（统一视觉-运动编码）：用双分支的向量量化变分自编码器，把「画面怎么变」和「机器人怎么动」编码进同一本离散码本，并用对齐损失让两者一致。训练分三步：先自监督学 UVMC，再在约 1.64 亿帧跨本体数据（Open-X、自有 XR-D、RoboMIND 和 Ego4D 人类视频）上预训练，最后针对具体任务微调。主模型沿用 π0 架构，另有基于 Florence-2 的轻量版 XR-1-Light。代码和权重已在 GitHub、Hugging Face、魔搭开源。","example":"作者在天工 1.0/2.0、单臂与双臂 UR5e、双臂 Franka、松灵 Cobot Magic 等 6 种本体上做了 1.4 万次以上真机测试，覆盖 120 多个操作任务。","related":["跨本体","向量量化变分自编码器","潜在动作","北京人形机器人创新中心","天工","π0"]},{"id":"gigabrain-0","category":"named_model","sec":7,"tier":3,"sources":[{"title":"GigaBrain-0 (arXiv:2510.19430)","url":"https://arxiv.org/abs/2510.19430"},{"title":"GigaBrain-0.5M* (arXiv:2602.12099)","url":"https://arxiv.org/abs/2602.12099"},{"title":"GigaBrain-0.7 (arXiv:2608.15875)","url":"https://arxiv.org/abs/2608.15875"}],"as_of":"2026-08","related_ids":["gigaai","gigaworld-0","vision-language-action-model","embodied-chain-of-thought","knowledge-insulation","synthetic-data"],"name":"极佳 GigaBrain-0","alt":"GigaBrain-0: A World Model-Powered Vision-Language-Action Model (GigaAI)","abbr":"","aliases":["GigaBrain","GigaBrain-0.5","GigaBrain-0.5M*","GigaBrain-0.7"],"one_liner":"极佳科技用世界模型生成数据来训练的 VLA 模型系列","explanation":"极佳科技（GigaAI）2025 年 10 月发布的视觉-语言-动作模型（VLA）。它针对真机数据贵且少的问题，把大量训练数据换成世界模型生成的数据，包括视频生成、外观迁移、人类视频迁移、视角迁移和仿真到真实迁移。模型输入 RGB-D 图像增强空间感，先输出具身思维链（用语言写出中间推理）再出动作，并用知识隔离防止推理训练干扰动作。另有可跑在 Jetson AGX Orin 上的 GigaBrain-0-Small。后续 GigaBrain-0.5 用 1 万多小时真机数据训练，0.5M* 加入基于世界模型的强化学习，2026 年 8 月的 0.7 用 3.7 万多小时数据和三系统架构。","example":"论文把训练数据中世界模型生成数据的比例从 0 逐步提到 90%，模型对物体外观、摆放位置和相机视角变化的泛化随之明显提升。","related":["极佳科技","极佳 GigaWorld-0","视觉-语言-动作模型","具身思维链","知识隔离","合成数据"]},{"id":"gigaworld-0","category":"named_model","sec":7,"tier":3,"sources":[{"title":"GigaWorld-0 (arXiv:2511.19861)","url":"https://arxiv.org/abs/2511.19861"},{"title":"GigaWorld-0 项目主页","url":"https://giga-world-0.github.io/"},{"title":"GigaWorld-1 (arXiv:2607.02642)","url":"https://arxiv.org/abs/2607.02642"}],"as_of":"2026-07","related_ids":["gigabrain-0","gigaai","world-model","synthetic-data","3d-gaussian-splatting","world-model-based-policy-evaluation"],"name":"极佳 GigaWorld-0","alt":"GigaWorld-0: World Models as Data Engine to Empower Embodied AI (GigaAI)","abbr":"","aliases":["GigaWorld-0-Video","GigaWorld-0-3D"],"one_liner":"极佳科技把世界模型当「数据引擎」、批量生成机器人训练数据的框架","explanation":"极佳科技（GigaAI）2025 年 11 月发布，定位是给视觉-语言-动作模型（VLA）生产训练数据的世界模型框架。它有两部分：GigaWorld-0-Video 用大规模视频生成模型产出纹理丰富的机器人操作视频，可细粒度控制外观、相机视角和动作语义；GigaWorld-0-3D 结合 3D 生成、3D 高斯泼溅重建、可微物理系统辨识和运动规划，保证几何一致、物理合理。配套训练框架 GigaTrain 用 FP8 精度和稀疏注意力节省算力。用这些合成数据训练的 GigaBrain-0 在真机上表现良好。代码和模型已开源；2026 年 7 月团队又推出面向策略评测的 GigaWorld-1。","example":"把一段真机操作视频改换桌面纹理、光照或相机视角，生成多份外观不同但动作一致的训练数据，用来提升 VLA 对外观变化的泛化。","related":["极佳 GigaBrain-0","极佳科技","世界模型","合成数据","3D高斯泼溅","世界模型评测"]},{"id":"mimo-embodied","category":"named_model","sec":7,"tier":3,"sources":[{"title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report (arXiv 2511.16518)","url":"https://arxiv.org/abs/2511.16518"},{"title":"XiaomiMiMo/MiMo-Embodied (GitHub)","url":"https://github.com/XiaomiMiMo/MiMo-Embodied"}],"as_of":"2026-04","related_ids":["vision-language-model","embodied-reasoning","affordance","spatial-reasoning","autonomous-driving","cross-embodiment"],"name":"小米 MiMo-Embodied","alt":"MiMo-Embodied: X-Embodied Foundation Model (Xiaomi)","abbr":"","aliases":["MiMo-Embodied-7B"],"one_liner":"小米开源的 7B 视觉语言模型，同时覆盖自动驾驶和具身智能的理解与规划","explanation":"小米具身智能团队 2025 年 11 月发布技术报告并开源的视觉语言模型（VLM），参数约 70 亿，权重在 Hugging Face 公开。出发点是：自动驾驶和室内机器人都需要空间理解与规划，却通常各训各的。MiMo-Embodied 把两类数据放进同一个模型，经过多阶段训练、精选数据以及思维链和强化学习微调，同时覆盖具身侧的可供性预测、任务规划、空间理解，和驾驶侧的环境感知、状态预测、驾驶规划。报告称它在 17 个具身基准和 12 个自动驾驶基准上达到或超过同类开源与闭源模型，并观察到两个领域之间存在正迁移，互相促进。它评测的是理解、推理和规划能力，本身不直接输出机器人的关节动作。","example":"给它一张厨房照片问「杯子该从哪里抓」，它能在图上指出可抓的位置；给它一段行车画面，它能描述周围车辆状态并给出下一步驾驶规划。","related":["视觉语言模型","具身推理","可供性","空间推理","自动驾驶","跨本体"]},{"id":"xiaomi-robotics-0","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Xiaomi-Robotics-0 (arXiv:2602.12684)","url":"https://arxiv.org/abs/2602.12684"},{"title":"Xiaomi-Robotics-0 技术报告 HTML 版","url":"https://arxiv.org/html/2602.12684"},{"title":"Xiaomi-Robotics-1 (arXiv:2607.15330)","url":"https://arxiv.org/abs/2607.15330"}],"as_of":"2026-07","related_ids":["vision-language-action-model","asynchronous-inference","real-time-chunking","action-expert","xiaomi","mimo-embodied"],"name":"小米 Xiaomi-Robotics-0","alt":"Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution","abbr":"","aliases":[],"one_liner":"小米开源的 47 亿参数 VLA，主打在消费级显卡上实时、流畅地执行动作","explanation":"小米 2026 年 2 月发布并开源的视觉-语言-动作模型，共 47 亿参数，以 Qwen3-VL-4B 为视觉语言骨干，外接一个用流匹配生成动作的扩散 Transformer 动作专家。预训练用了约 2 亿时间步的跨本体机器人轨迹（DROID、MolmoAct 数据及自采数据）和 8000 万条以上视觉语言数据。它重点解决推理慢导致的动作卡顿：采用异步执行，边执行上一段动作边推理下一段，并把已确定执行的动作作为前缀喂回模型，配合 Λ 形注意力掩码保证前后衔接平滑，在 RTX 4090 上推理延迟约 80 毫秒。2026 年 7 月小米又发布了用 10 万小时以上真机数据训练的 Xiaomi-Robotics-1。","example":"官方报告 LIBERO 平均成功率 98.7%、CALVIN ABC→D 平均连续完成 4.75 个任务；真机上演示了拆乐高和叠毛巾两个双臂任务。","related":["视觉-语言-动作模型","异步推理","实时动作分块","动作专家","小米","小米 MiMo-Embodied"]},{"id":"kairos","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI (arXiv 2606.16533，v1 题为 A Native World Model Stack for Physical AI)","url":"https://arxiv.org/abs/2606.16533"},{"title":"kairos-agi/kairos (GitHub)","url":"https://github.com/kairos-agi/kairos"},{"title":"大晓机器人官网","url":"https://www.acerobotics.com"}],"as_of":"2026-07","related_ids":["world-model","world-action-model","embodied-foundation-model","video-generation-model","ace-robotics","robotwin"],"name":"大晓机器人 开悟世界模型","alt":"Kairos: A Native World Model Stack for Physical AI (Daxiao Robotics / ACE Robotics)","abbr":"","aliases":["Kairos","开悟世界模型 3.0","开悟世界模型 3.1","Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI"],"one_liner":"大晓机器人开源的 40 亿参数具身世界模型，同时做理解、视频生成和动作预测。","explanation":"开悟世界模型（英文名 Kairos）是上海具身智能公司大晓机器人（ACE Robotics）的世界模型，技术报告作者包括王晓刚、陶大程，据报道公司由商汤联合创始人王晓刚牵头。开悟 3.0 于 2025 年 12 月发布并开源 40 亿参数预训练权重，2026 年 6 月发布技术报告，7 月开源 3.1 版及世界-动作模型推理代码。它主张世界模型不必逼真生成全部像素，而要保留对控制有用的信息，如物体状态、接触、任务进度和动作后果。具体做法：按「看普通视频→看人类行为→机器人交互」的顺序安排训练数据；用统一架构同时做理解、生成和预测；用混合线性时序注意力降低长时推理的开销。","example":"开源的 kairos-4B-robot-RoboTwin2.0 权重在 RoboTwin 2.0 的 50 多个双臂任务上同时预测未来画面和动作，官方称取得该基准最好成绩。","related":["世界模型","世界动作模型","具身大模型","视频生成模型","大晓机器人","RoboTwin"]},{"id":"ubtech-thinker","category":"named_model","sec":7,"tier":3,"sources":[{"title":"UBTECH-Robot/Thinker (GitHub)","url":"https://github.com/UBTECH-Robot/Thinker"},{"title":"Thinker: A vision-language foundation model for embodied intelligence (arXiv 2601.21199)","url":"https://arxiv.org/abs/2601.21199"},{"title":"Embodied Intelligence 2026: Farewell to Narrative Hype, Practical Deployment Reigns Supreme (36Kr)","url":"https://eu.36kr.com/en/p/3953394550537606"}],"as_of":"2026-08","related_ids":["ubtech-robotics","ubtech-walker-s2","vision-language-model","world-model","vision-language-action-model","qwen-vl"],"name":"优必选 Thinker","alt":"UBTech Thinker (Thinker / Thinker-WM / Thinker-VLA embodied model stack)","abbr":"","aliases":["Thinker-4B","Thinker-WM","Thinker-VLA"],"one_liner":"优必选自研的具身模型体系，含基础模型、世界模型和动作模型三层","explanation":"优必选（UBTech）为人形机器人打造的自研具身模型体系，据报道分为基础模型 Thinker、世界模型 Thinker-WM 和动作模型 Thinker-VLA 三层。其中 Thinker 是面向具身智能的视觉语言模型，2026 年 1 月开源 Thinker-4B（基于 Qwen3-VL 架构、4B 参数、非商业许可）并发布论文。它针对通用视觉语言模型用到机器人上时视角混淆、时序理解弱等问题，用第一视角视频、视觉定位、空间理解和思维链数据训练，主打任务规划、视觉定位和空间理解，官方称在 7 个具身基准上领先。据报道，Thinker-WM 在 LIBERO 基准上排名第一，Thinker-VLA 在工业场景把推理效率提升 176%。这套模型服务于优必选 Walker S 系列等工业人形机器人。","example":"给 Thinker-4B 一段机器人第一视角画面和指令「把零件放进料箱」，它能输出分步任务计划，并在图像里框出目标零件的位置。","related":["优必选","优必选 Walker S2","视觉语言模型","世界模型","视觉-语言-动作模型","通义千问 Qwen-VL"]},{"id":"spirit-v1-5","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Spirit-v1.5: Clean Data Is the Enemy of Great Robot Foundation Models (Spirit AI Blog)","url":"https://www.spirit-ai.com/en/blog/spirit-v1-5"},{"title":"Spirit-AI-Team/spirit-v1.5 (GitHub)","url":"https://github.com/Spirit-AI-Team/spirit-v1.5"},{"title":"Spirit-AI-robotics/Spirit-v1.5 (Hugging Face)","url":"https://huggingface.co/Spirit-AI-robotics/Spirit-v1.5"}],"as_of":"2026-04","related_ids":["spirit-ai","vision-language-action-model","robochallenge","qwen-vl","diffusion-transformer","data-diversity"],"name":"千寻 Spirit v1.5","alt":"Spirit v1.5 (Spirit AI)","abbr":"","aliases":["Spirit-v1.5","千寻智能 Spirit v1.5"],"one_liner":"千寻智能开源的 VLA 基础模型，主张用多样、不刻意整理的数据做预训练","explanation":"千寻智能（Spirit AI）2026 年 1 月发布并开源的视觉-语言-动作（VLA）模型，公开了推理代码（MIT 协议）、基座权重和一个微调权重（Apache 2.0 协议），4 月又放出微调代码。结构是常见的「VLM + 动作头」：以通义千问 Qwen3-VL-4B 作视觉语言骨干，接一个扩散 Transformer（DiT）动作头生成连续动作。它的主要观点写在技术博客标题里——「干净数据是好机器人基础模型的敌人」：不给采集员写固定脚本、不刻意摆放物体，只让他们带着一个目标自由完成一连串真实任务，数据里自然包含失败重试和任务切换。团队称这样做让人均有效采集时长提高了 200%。发布时它在 RoboChallenge 的 Table30 真机榜单上排名第一。","example":"采集员给自己定一个目标「今天用机器人调一杯饮料」，从备料、发现比例不对再调整到加减配料，整段连续操作都录下来用于预训练。","related":["千寻智能","视觉-语言-动作模型","RoboChallenge","通义千问 Qwen-VL","扩散 Transformer","数据多样性"]},{"id":"lingbot-vla","category":"named_model","sec":7,"tier":3,"sources":[{"title":"arXiv 2601.18692: A Pragmatic VLA Foundation Model","url":"https://arxiv.org/abs/2601.18692"},{"title":"Robbyant 官网：LingBot-VLA","url":"https://technology.robbyant.com/lingbot-vla"},{"title":"arXiv 2607.06403: From Foundation to Application (LingBot-VLA 2.0)","url":"https://arxiv.org/abs/2607.06403"}],"as_of":"2026-07","related_ids":["vision-language-action-model","qwen-vl","cross-embodiment","post-training","pi0","robbyant"],"name":"蚂蚁灵波 LingBot-VLA","alt":"LingBot-VLA (A Pragmatic VLA Foundation Model, Robbyant / Ant Group)","abbr":"","aliases":["LingBot-VLA","LingBot-VLA 2.0"],"one_liner":"蚂蚁灵波开源的 VLA 基础模型，用约 2 万小时双臂真机数据预训练。","explanation":"LingBot-VLA 是蚂蚁灵波（Robbyant）2026 年 1 月开源的视觉-语言-动作（VLA）基础模型，论文题为 A Pragmatic VLA Foundation Model，强调实用：泛化好、适配新平台的数据和算力成本低。它以 Qwen2.5-VL-3B 为视觉语言骨干（也支持 PaliGemma），用 9 种主流双臂构型约 20,000 小时真机数据预训练，并在智元 G1、松灵、星海图 R1Pro 等 4 个平台上各跑 100 个任务（GM-100）做系统评测。配套训练代码 8 卡吞吐每秒 261 个样本，比已有 VLA 代码库快 1.5–2.8 倍。2026 年 7 月的 2.0 版把数据扩到约 6 万小时（含 1 万小时人类第一视角视频），动作扩展到头、腰、底盘和灵巧手。","example":"在 GM-100 评测里，每个任务只给 130 条后训练演示，再比较它与其他 VLA 在同一真机平台上的成功率。","related":["视觉-语言-动作模型","通义千问 Qwen-VL","跨本体","后训练","π0","蚂蚁灵波"]},{"id":"lingbot-va","category":"named_model","sec":7,"tier":3,"sources":[{"title":"arXiv 2601.21998: Causal World Modeling for Robot Control","url":"https://arxiv.org/abs/2601.21998"},{"title":"GitHub: Robbyant/lingbot-va","url":"https://github.com/Robbyant/lingbot-va"},{"title":"arXiv 2607.08639: Native Video-Action Pretraining for Generalizable Robot Control (LingBot-VA 2.0)","url":"https://arxiv.org/abs/2607.08639"}],"as_of":"2026-07","related_ids":["world-action-model","world-model","mixture-of-transformers","asynchronous-inference","autoregressive-video-generation","robbyant"],"name":"蚂蚁灵波 LingBot-VA","alt":"LingBot-VA (Causal World Modeling for Robot Control, Robbyant)","abbr":"","aliases":["LingBot-VA","LingBot-VA 2.0"],"one_liner":"蚂蚁灵波开源的视频-动作世界模型，边预测未来画面边输出机器人动作。","explanation":"LingBot-VA 是蚂蚁集团旗下具身智能公司蚂蚁灵波（Robbyant）2026 年 1 月开源的机器人控制模型，论文题为 Causal World Modeling for Robot Control，收录于 RSS 2026。它走「世界动作模型」路线：用自回归扩散一段段往后生成，在同一序列里交替预测未来视频帧和动作；视觉与动作 token 共享潜在空间，由混合 Transformer（MoT）处理。执行时每段都用真实观测纠偏（闭环推演），并让动作预测与电机执行异步并行以降低延迟。视频编码沿用通义万相 Wan2.2 的 VAE。2026 年 7 月推出 2.0 版，改为从零因果预训练并采用稀疏 MoE 骨干。","example":"官方报告在 RoboTwin 2.0 的 50 个双臂仿真任务上，简单/困难设置成功率分别为 92.9% 和 91.6%，LIBERO 平均 98.5%。","related":["世界动作模型","世界模型","混合 Transformer 架构","异步推理","自回归视频生成","蚂蚁灵波"]},{"id":"lingbot-world","category":"named_model","sec":7,"tier":3,"sources":[{"title":"arXiv 2601.20540: Advancing Open-source World Models","url":"https://arxiv.org/abs/2601.20540"},{"title":"GitHub: Robbyant/lingbot-world","url":"https://github.com/Robbyant/lingbot-world"},{"title":"arXiv 2607.07534: Infinite Worlds with Versatile Interactions (LingBot-World 2.0)","url":"https://arxiv.org/abs/2607.07534"}],"as_of":"2026-07","related_ids":["world-model","interactive-world-model","genie-3","wan","autoregressive-video-generation","robbyant"],"name":"蚂蚁灵波 LingBot-World","alt":"LingBot-World (Advancing Open-source World Models, Robbyant)","abbr":"","aliases":["LingBot-World","LingBot-World 2.0","LingBot-World-Infinity"],"one_liner":"蚂蚁灵波开源的可交互世界模型，按键盘和镜头指令实时生成后续画面。","explanation":"LingBot-World 是蚂蚁灵波（Robbyant）2026 年 1 月开源的世界模型，由通义万相 Wan2.2 视频生成模型改造而来。给定起始图像或文字描述后，用户用键盘动作或相机位姿逐步操控，模型接着生成相应画面，论文称之为世界模拟器。官方报告它能在分钟级时长内保持场景前后一致（称为长时记忆），并以每秒 16 帧、延迟不到 1 秒的速度实时交互；代码和权重以 Apache 2.0 协议开放，意在缩小开源与闭源世界模型的差距，面向内容创作、游戏和机器人学习。2026 年 7 月的 2.0 版（LingBot-World-Infinity）支持不限时长的交互，蒸馏出的实时版可驱动 720p 60fps 视频流，提供 14B 和 1.3B 两个规模。","example":"给一张室内照片作起点，按 W 前进、按 A/D 转向，模型逐段生成对应视角下的后续画面。","related":["世界模型","可交互世界模型","Genie 3","通义万相","自回归视频生成","蚂蚁灵波"]},{"id":"dm0","category":"named_model","sec":7,"tier":3,"sources":[{"title":"DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI (arXiv 2602.14974)","url":"https://arxiv.org/abs/2602.14974"},{"title":"Dexmal/DM05 模型卡（Hugging Face）","url":"https://huggingface.co/Dexmal/DM05"},{"title":"Dexbotic 代码仓库（GitHub）","url":"https://github.com/Dexmal/dexbotic"}],"as_of":"2026-09","related_ids":["vision-language-action-model","action-expert","flow-matching","mid-training","robochallenge","dexbotic"],"name":"原力灵机 DM0","alt":"DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI (Dexmal)","abbr":"","aliases":["DM0.5","Dexmal DM0"],"one_liner":"原力灵机 2026 年开源的「具身原生」VLA，预训练阶段就混入驾驶和机器人数据。","explanation":"DM0 是原力灵机（Dexmal）联合阶跃星辰于 2026 年 2 月发布并开源的视觉-语言-动作模型（VLA）。多数 VLA 先用只见过互联网图文的视觉语言模型，再拿机器人数据微调；DM0 主张「具身原生」，预训练时就把网页文本、自动驾驶场景和机器人交互日志一起训练（约 1.2 万亿 token）。训练分三段：预训练统一的 VLM（语言部分基于 Qwen3-1.7B），中训练在其上加一个流匹配动作专家（专门输出连续动作的子网络），后训练用混合策略精调。训练具身数据时，动作专家的梯度不回传给 VLM，以保住通用理解能力；还用空间思维链先推理空间关系再出动作。模型约 20 亿参数，统一支持操作和导航。2026 年 7 月原力灵机推出约 60 亿参数的后续版本 DM0.5，配套开源框架 OpenDM。","example":"据论文报告，DM0 在 RoboChallenge Table30 真机基准上，专用设置平均成功率 62.0%、通用设置 37.3%，发布时两项均排第一。","related":["视觉-语言-动作模型","动作专家","流匹配","中训练","RoboChallenge","Dexbotic"]},{"id":"holobrain-0","category":"named_model","sec":7,"tier":3,"sources":[{"title":"HoloBrain-0 Technical Report (arXiv 2602.12062)","url":"https://arxiv.org/abs/2602.12062"},{"title":"HoloBrain-0 技术报告 HTML 全文","url":"https://arxiv.org/html/2602.12062v1"}],"as_of":"2026-02","related_ids":["vision-language-action-model","cross-embodiment","unified-robot-description-format","robotwin","on-device-edge-deployment","horizon-robotics"],"name":"地平线 HoloBrain-0","alt":"HoloBrain-0 (Horizon Robotics open-source VLA foundation model)","abbr":"HoloBrain","aliases":["HoloBrain-0 Technical Report","地平线 HoloBrain"],"one_liner":"地平线 2026 年初开源的 VLA 框架，把相机参数和机器人结构作为先验输入模型。","explanation":"HoloBrain-0 由地平线（Horizon Robotics）团队 2026 年 2 月发布技术报告并开源。它的核心设计是在 VLA 里显式加入机器人本体先验：多视角相机的参数，以及描述机器人关节结构的 URDF 文件，用来增强 3D 空间推理、适配不同本体。训练走「预训练再后训练」路线：预训练数据来自双臂 Piper、智元 G1、Franka 等真机，仿真中的双臂 UR5、双臂 ARX，以及人类手部视频数据集 EgoDex，再针对具体任务后训练。报告称它在 RoboTwin 2.0、LIBERO、GenieSim 仿真基准上达到最优，在真机长程任务上表现也较好。开源内容包括预训练模型、各仿真套件和真机任务的后训练检查点，以及覆盖数据整理、训练、部署的全栈工具链 RoboOrchard。","example":"它有一个约 2 亿参数（0.2B）的轻量版本，基于 GroundingDINO-Tiny，效果可与大得多的基线相当，推理延迟低，适合直接部署在机器人端侧芯片上；另有基于 Qwen2.5-VL-3B 的约 11 亿参数（1.1B）版本。","related":["视觉-语言-动作模型","跨本体","统一机器人描述格式","RoboTwin","端侧部署","地平线"]},{"id":"tars-robotics-awe","category":"named_model","sec":7,"tier":3,"sources":[{"title":"丁文超博士发布通用具身大模型 AWE3.0（中国日报网，推广信息）","url":"https://cn.chinadaily.com.cn/a/202603/17/WS69b8fa3ba310942cc49a396b.html"},{"title":"「能干活」的通用具身大模型 AWE3.0 亮相（新华网客户端）","url":"https://app.xinhuanet.com/news/article.html?articleId=3b05aef1a3ea11cbc6b2f7ab79e329ce"},{"title":"它石智航@WAIC 2026：具身原生基座模型 AWE 摘得 SAIL 之星（知乎专栏）","url":"https://zhuanlan.zhihu.com/p/2063322866691657972"}],"as_of":"2026-07","related_ids":["tars-robotics","world-in-your-hands","human-video-data","latent-action","embodied-foundation-model","visuo-tactile-fusion"],"name":"它石智航 AWE","alt":"AWE (AI World Engine, TARS Robotics; AWE 3.0 / 3.5)","abbr":"AWE","aliases":["AWE 3.0","AWE 3.5","AI World Engine","它石 AWE"],"one_liner":"它石智航的通用具身基座模型，主打用大规模人类操作数据训练。","explanation":"AWE 是上海具身智能公司它石智航（TARS Robotics，据报道 2025 年 2 月成立）的通用具身基座模型，官方称采用自研的 AI World Engine 架构。2026 年 3 月 14 日公司发布 AWE 3.0，宣传重点有三：用自家 WIYH 人类操作数据集训练（公司称超百万小时）；在「隐空间」（压缩后的潜在表示空间）里生成动作，称抖动降低超 45%；加入高密度触觉感知。2026 年 7 月 WAIC 上 AWE 获 SAIL 之星，展台由 AWE 3.5 驱动机器人做线束装配。它代表国内「以人类数据为主」的一条路线，但目前没有公开论文，上述数字都来自公司发布。","example":"据发布会演示，它石的机器人在 AWE 3.0 驱动下一小时完成百余次亚毫米级精度的线束装配。","related":["它石智航","它石 WIYH 数据集","人类视频数据","潜在动作","具身大模型","视触觉融合"]},{"id":"psi-r2","category":"named_model","sec":7,"tier":3,"sources":[{"title":"灵初智能：新一代具身模型发布，全球最大人类手部操作数据集开源","url":"https://www.psibot.ai/%e7%81%b5%e5%88%9d%e6%99%ba%e8%83%bd%e6%96%b0%e4%b8%80%e4%bb%a3%e5%85%b7%e8%ba%ab%e6%a8%a1%e5%9e%8b%e5%8f%91%e5%b8%83%ef%bc%8c%e5%85%a8%e7%90%83%e6%9c%80%e5%a4%a7%e4%ba%ba%e7%b1%bb%e6%89%8b%e9%83%a8/"},{"title":"灵初智能：Psi-R2.5 正式发布","url":"https://www.psibot.ai/%e7%81%b5%e5%88%9d%e6%99%ba%e8%83%bdpsi-r2-5%e6%ad%a3%e5%bc%8f%e5%8f%91%e5%b8%83%ef%bc%81%e6%a8%a1%e5%9e%8b%e8%83%bd%e5%8a%9b%e6%8c%81%e7%bb%ad%e5%bc%ba%e5%8c%96%ef%bc%8c%e7%a0%b4%e8%a7%a3/"}],"as_of":"2026-09","related_ids":["world-action-model","psibot","human-video-data","data-glove","world-model","dreamzero"],"name":"灵初 Psi-R2","alt":"Psi-R2 (PsiBot)","abbr":"","aliases":["Psi R2","PsiR2"],"one_liner":"灵初智能用十万小时量级人类操作数据预训练的世界动作模型","explanation":"灵初智能（PsiBot）2026 年 4 月 10 日发布的具身模型，官方称它是第一个用 10 万小时量级人类操作数据预训练的世界动作模型（同时预测未来画面和机器人动作的模型）：输入图像和语言，输出预测的未来视频和机器人动作。数据来自其自研外骨骼手套采集的人类操作，覆盖工业装配、生活操作、物体抓取等场景，并开源首批 1000 小时人手操作数据（含视觉、语言、关节角度、触觉）。官方称只需不到 100 条真机轨迹微调，就能完成装配手机、工业包装、叠纸盒等长程精细操作。同期发布的动作条件世界模型 Psi-W0 用于把人类数据转换成机器人可用的数据，并在模型里做强化学习来优化策略。2026 年 9 月 28 日发布的 Psi-R2.5 改为上层 VLM 拆任务、下层视频模型出动作的双层结构。","example":"官方演示：用不到 100 条真机轨迹微调后，机器人完成「装配手机」这类多步骤精细操作。","related":["世界动作模型","灵初智能","人类视频数据","数据手套","世界模型","DreamZero"]},{"id":"tencent-hy-embodied","category":"named_model","sec":7,"tier":3,"sources":[{"title":"Tencent-Hunyuan/HY-Embodied (GitHub)","url":"https://github.com/Tencent-Hunyuan/HY-Embodied"},{"title":"HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents (arXiv 2604.07430)","url":"https://arxiv.org/abs/2604.07430"},{"title":"Tencent-Hunyuan/Hy-Embodied-0.5-VLA (GitHub)","url":"https://github.com/Tencent-Hunyuan/Hy-Embodied-0.5-VLA"}],"as_of":"2026-07","related_ids":["embodied-foundation-model","vision-language-model","vision-language-action-model","mixture-of-transformers","universal-manipulation-interface","tencent-tairos-embodied-ai-open-platform"],"name":"腾讯 HY-Embodied（混元具身）","alt":"Hy-Embodied series (Tencent Robotics X & Hunyuan: Hy-Embodied-0.5 VLM / VLA / -X)","abbr":"HY-Embodied","aliases":["HY-Embodied-0.5","HY-Embodied-0.5-X","Hy-Embodied-0.5-VLA","HY-VLA-0.5","Hy-Embodied-VLM-1.0"],"one_liner":"腾讯 Robotics X 与混元团队开源的具身基础模型系列，含具身 VLM 和 VLA","explanation":"腾讯 Robotics X 实验室与混元视觉团队推出的开源具身基础模型家族。2026 年 4 月的 HY-Embodied-0.5 是面向机器人的视觉语言模型，强化空间、时间感知和具身推理，采用混合 Transformer（MoT）架构，分 2B 激活（总 4B）的端侧版和 32B 版，开源了 MoT-2B；同月的 0.5-X 在其上继续后训练，侧重任务规划、风险判断等。6 月的 Hy-Embodied-0.5-VLA 在该骨干上加流匹配动作专家，用自研指尖 UMI 采集的 1 万多小时双臂数据训练，开源其中 2000 多小时；7 月又发布 MoE 架构的 VLM-1.0（约 3B 激活 / 30B 总参数）。项目页挂在腾讯 Tairos 具身智能开放平台。","example":"Hy-Embodied-0.5-VLA 在 RoboTwin 2.0 仿真基准上报告的成功率为 90.9%（Clean）和 90.1%（Randomized）。","related":["具身大模型","视觉语言模型","视觉-语言-动作模型","混合 Transformer 架构","通用操作接口","腾讯 Tairos"]},{"id":"qwen-robot-series","category":"named_model","sec":7,"tier":2,"sources":[{"title":"Qwen-RobotManip Technical Report (arXiv:2606.17846)","url":"https://arxiv.org/abs/2606.17846"},{"title":"QwenLM/Qwen-RobotNav GitHub 仓库","url":"https://github.com/QwenLM/Qwen-RobotNav"},{"title":"Qwen-RobotWorld Technical Report (arXiv:2606.17030)","url":"https://arxiv.org/abs/2606.17030"}],"as_of":"2026-09","related_ids":["qwen-vl","vision-language-action-model","world-model","vision-and-language-navigation","flow-matching","cross-embodiment"],"name":"千问 Qwen-Robot 系列","alt":"Qwen-Robot series (Qwen-RobotManip / Qwen-RobotNav / Qwen-RobotWorld, Alibaba)","abbr":"","aliases":["Qwen-RobotManip","Qwen-RobotNav","Qwen-RobotWorld"],"one_liner":"阿里通义千问团队 2026 年发布的操作、导航、世界模型三件套具身模型。","explanation":"Qwen-Robot 是阿里通义千问团队 2026 年 6 月集中发布的一组具身模型，都建在 Qwen 视觉语言模型之上，三个成员分工不同。Qwen-RobotManip 是操作用的 VLA，在 Qwen-VL 骨干后接流匹配 DiT 动作头，只用开源机器人数据和由人手视频合成的机器人轨迹，攒出约 3.81 万小时预训练数据，重点是先把不同本体的数据对齐再放大规模；Qwen-RobotNav 用统一的路点预测接口同时做视觉语言导航、物体搜索、目标跟踪和自动驾驶；Qwen-RobotWorld 是语言条件的视频世界模型，用来合成训练数据和评测策略。官方仓库写明目前没有开放 Manip 和 Nav 权重的计划。","example":"Qwen-RobotNav 零样本部署在宇树 Go2 四足上，用 Jetson Thor 推理，约 5 Hz 地在没见过的环境里按语言指令导航。","related":["通义千问 Qwen-VL","视觉-语言-动作模型","世界模型","视觉语言导航","流匹配","跨本体"]},{"id":"minicpm-robot-series","category":"named_model","sec":7,"tier":3,"sources":[{"title":"OpenBMB/MiniCPM-Robot (GitHub)","url":"https://github.com/OpenBMB/MiniCPM-Robot"}],"as_of":"2026-07","related_ids":["vision-language-action-model","on-device-model","embodied-visual-tracking","visual-token-pruning","unitree-go2","pi0-5"],"name":"面壁 MiniCPM-Robot 系列","alt":"MiniCPM-Robot series (OpenBMB: MiniCPM-RobotManip / MiniCPM-RobotTrack)","abbr":"","aliases":["MiniCPM-RobotManip","MiniCPM-RobotTrack"],"one_liner":"MiniCPM 的具身模型家族，主打小参数、能在端侧跑的操作模型和目标跟随模型","explanation":"面壁智能主导的 OpenBMB 开源社区在 2026 年 7 月开源的具身模型家族，首批两款。MiniCPM-RobotManip 是 15 亿参数的通用 VLA（视觉-语言-动作模型），一套权重覆盖多个任务；它用流式推理把历史画面留在上下文里，最多保留约 1 分钟视觉记忆，并沿用 MiniCPM-V 4.6 的视觉 token 压缩，每帧从 256 个压到 64 个。官方在 LIBERO、CALVIN、RoboTwin 2.0 等基准上报告的成绩接近或超过参数更大的 π0.5。MiniCPM-RobotTrack 基于 MiniCPM4-0.5B，约 9 亿参数，专做按语言指令跟随目标，能在宇树 Go2 机器狗的机载算力上以 5 帧/秒以上、约 180 毫秒端到端延迟纯视觉运行，官方称在 EVT-Bench 上为开源最好成绩。","example":"在宇树 Go2 EDU 上说一句「跟着那个人」，RobotTrack 只用机载相机和本地算力就能一路跟随，官方演示包括进电梯和穿过地下车库。","related":["视觉-语言-动作模型","端侧模型","具身视觉跟踪（目标跟随）","视觉 token 剪枝","宇树 Go2","π0.5"]},{"id":"world-models","category":"named_model","sec":8,"tier":3,"sources":[{"title":"World Models (arXiv:1803.10122)","url":"https://arxiv.org/abs/1803.10122"},{"title":"World Models 交互式论文页","url":"https://worldmodels.github.io/"}],"as_of":"2018-12","related_ids":["world-model","learning-in-imagination","variational-autoencoder","recurrent-neural-network","mixture-density-network","dreamerv3"],"name":"World Models 论文（Ha & Schmidhuber）","alt":"World Models (Ha & Schmidhuber, 2018)","abbr":"","aliases":["Recurrent World Models","Recurrent World Models Facilitate Policy Evolution"],"one_liner":"2018 年让智能体在自己学出的「梦境」里练策略的经典世界模型论文","explanation":"David Ha（Google Brain）和 Jürgen Schmidhuber（NNAISENSE）2018 年 3 月发布的论文，同年以《Recurrent World Models Facilitate Policy Evolution》发表于 NeurIPS。智能体分三块：V 用变分自编码器把 64×64 的画面压成几十维向量；M 用混合密度网络加循环神经网络，预测下一时刻向量的概率分布；C 是只有约一千个参数的线性控制器，用进化策略 CMA-ES 训练。关键结果是控制器可以完全在 M 生成的「梦境」里训练，再放回真实的 VizDoom 游戏仍然有效。这篇论文让「世界模型」一词重新流行，Dreamer 系列等后续工作都沿着这条思路发展。","example":"在 CarRacing-v0 赛车任务上得分 906±21，高于此前方法的 591–838；在 VizDoom 躲火球任务中，只在梦境里训练的控制器迁回真实游戏得分 1092±556。","related":["世界模型","想象中学习","变分自编码器","循环神经网络","混合密度网络","DreamerV3"]},{"id":"planet","category":"named_model","sec":8,"tier":3,"sources":[{"title":"arXiv 1811.04551: Learning Latent Dynamics for Planning from Pixels","url":"https://arxiv.org/abs/1811.04551"},{"title":"ICML 2019 论文页（PMLR v97）","url":"https://proceedings.mlr.press/v97/hafner19a.html"},{"title":"Google Research Blog: Introducing PlaNet","url":"https://research.google/blog/introducing-planet-a-deep-planning-network-for-reinforcement-learning/"}],"as_of":"2019-06","related_ids":["recurrent-state-space-model","dreamerv3","world-model","model-based-reinforcement-learning","model-predictive-control","cross-entropy-method"],"name":"PlaNet","alt":"PlaNet: Learning Latent Dynamics for Planning from Pixels","abbr":"","aliases":["Deep Planning Network"],"one_liner":"从像素学隐空间世界模型、在想象中规划动作的基于模型强化学习智能体","explanation":"谷歌（Google Brain 与 DeepMind 合作）的 Danijar Hafner 等人 2018 年 11 月发布，ICML 2019 论文。它只看图像，先学一个世界模型：把画面压缩成隐状态，学习隐状态在动作作用下怎么变、能拿多少奖励。模型核心是循环状态空间模型（RSSM），同时有确定性和随机性两条路径，多步预测更稳；论文还提出多步训练目标 latent overshooting。决策时不训练策略网络，而是在隐空间里想象大量候选动作序列、挑预测回报最高的一条，只执行第一步就重新规划（在线规划）。在 DeepMind Control 连续控制任务上，它所需交互回合远少于无模型方法，谷歌博客称平均数据效率约为后者的 50 倍。后来的 Dreamer 系列沿用 RSSM，改成在想象中学策略。","example":"在「猎豹奔跑」（cheetah run）任务里，PlaNet 只看摄像头画面，每一步都在隐空间里比较上万条想象出的动作序列，执行预测奖励最高那条的第一步。","related":["循环状态空间模型","DreamerV3","世界模型","基于模型的强化学习","模型预测控制","交叉熵方法"]},{"id":"muzero","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model (arXiv 1911.08265)","url":"https://arxiv.org/abs/1911.08265"},{"title":"MuZero: Mastering Go, chess, shogi and Atari without rules (Google DeepMind blog)","url":"https://deepmind.google/discover/blog/muzero-mastering-go-chess-shogi-and-atari-without-rules/"}],"as_of":"2020-12","related_ids":["model-based-reinforcement-learning","world-model","monte-carlo-tree-search","latent-world-model","value-function","dreamerv3"],"name":"MuZero","alt":"MuZero (Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model)","abbr":"MuZero","aliases":[],"one_liner":"DeepMind 不给规则、靠学到的内部模型做树搜索就精通围棋和 Atari 的算法","explanation":"DeepMind 的 Julian Schrittwieser、David Silver 等人 2019 年 11 月发布预印本，2020 年 12 月发表于《自然》，是 AlphaGo、AlphaZero 的后继。AlphaZero 下棋时要知道规则才能在「脑中」推演，MuZero 不再需要规则：它学一个隐空间模型，只预测对决策最有用的三样东西，即奖励、策略和价值，而不去重建完整的画面，然后用蒙特卡洛树搜索在这个学到的模型里往前推演、挑选动作。它在围棋、国际象棋、将棋上达到 AlphaZero 的水平，并在 57 款 Atari 游戏上超过了当时所有算法。它是基于模型的强化学习的代表，体现了「世界模型只需为规划服务」的思路，常和 Dreamer 系列一起讨论。","example":"玩 Atari 游戏时，MuZero 从未被告知游戏规则，只看画面和得分，就在自己学到的内部模型里预演几步不同操作的后果，选预期回报最高的那一步。","related":["基于模型的强化学习","世界模型","蒙特卡洛树搜索","隐空间世界模型","价值函数","DreamerV3"]},{"id":"daydreamer","category":"named_model","sec":8,"tier":3,"sources":[{"title":"DayDreamer (arXiv:2206.14176)","url":"https://arxiv.org/abs/2206.14176"},{"title":"DayDreamer 项目主页（CoRL 2022）","url":"https://danijar.com/project/daydreamer/"}],"as_of":"2022-06","related_ids":["world-model","learning-in-imagination","model-based-reinforcement-learning","real-world-reinforcement-learning","recurrent-state-space-model","dreamerv3"],"name":"DayDreamer","alt":"DayDreamer: World Models for Physical Robot Learning","abbr":"","aliases":["真机 Dreamer"],"one_liner":"直接在真实机器人上用 Dreamer 世界模型学习，四足一小时从零学会走路。","explanation":"伯克利 Pieter Abbeel 与 Ken Goldberg 组 2022 年 6 月提出，作者包括 Dreamer 系列作者 Danijar Hafner，发表于 CoRL 2022。真机强化学习的难点是试错太贵，所以多数工作先在仿真里训练再迁移。DayDreamer 把 Dreamer 算法直接搬到真机上：机器人一边交互，一边用收集的数据学一个世界模型（预测「做这个动作会看到什么、得多少奖励」），策略主要在世界模型的想象轨迹里学习，大幅减少真机试错。四种机器人用同一套超参数：A1 四足约 1 小时从零学会翻身、站起和行走，被推搡后约 10 分钟学会抵抗；UR5 和 xArm 机械臂从相机图像学会抓取放置；Sphero 轮式机器人学会导航到目标。它展示了世界模型强化学习在真实物理世界中的样本效率。","example":"A1 四足机器人不经仿真预训练、也不需人工复位，在真实地面上学习约 1 小时，就从零学会翻身、站起和向前走。","related":["世界模型","想象中学习","基于模型的强化学习","真机强化学习","循环状态空间模型","DreamerV3"]},{"id":"dreamerv3","category":"named_model","sec":8,"tier":2,"sources":[{"title":"DreamerV3 (arXiv 2301.04104)","url":"https://arxiv.org/abs/2301.04104"},{"title":"DreamerV3 项目页（Danijar Hafner）","url":"https://danijar.com/project/dreamerv3/"},{"title":"DreamerV2: Mastering Atari with Discrete World Models (arXiv 2010.02193)","url":"https://arxiv.org/abs/2010.02193"}],"as_of":"2025","related_ids":["world-model","recurrent-state-space-model","learning-in-imagination","model-based-reinforcement-learning","daydreamer","dreamer-4"],"name":"DreamerV3","alt":"DreamerV3: Mastering Diverse Domains through World Models","abbr":"","aliases":["Dreamer 系列","DreamerV1","DreamerV2"],"one_liner":"在学到的世界模型里靠想象训练策略、一套超参数通用的强化学习算法","explanation":"Dreamer 系列由 Danijar Hafner 主导：2019 年的 Dreamer 提出在隐空间里想象未来来学习行为；2020 年的 DreamerV2 改用离散隐变量，在 Atari 上首次让靠世界模型学习的智能体达到人类水平，并超过 Rainbow、IQN 等顶尖单卡无模型方法；DreamerV3 于 2023 年 1 月公开，2025 年发表于《自然》。做法是先从交互经验中学一个世界模型，预测下一步的隐状态和奖励，再让策略在模型生成的想象轨迹里训练，真实环境主要用来收集数据。它靠归一化、平衡、变换等稳健性技巧，用同一套超参数解决 150 多个不同任务，并成为首个不用人类数据和课程、从零在《我的世界》里挖到钻石的算法。","example":"在《我的世界》里，DreamerV3 不借助人类演示，从零学会砍树、做工具，最终挖到钻石。","related":["世界模型","循环状态空间模型","想象中学习","基于模型的强化学习","DayDreamer","Dreamer 4"]},{"id":"dreamer-4","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Training Agents Inside of Scalable World Models (arXiv 2509.24527)","url":"https://arxiv.org/abs/2509.24527"},{"title":"Dreamer 4 项目页（danijar.com）","url":"https://danijar.com/project/dreamer4/"}],"as_of":"2025-09","related_ids":["world-model","learning-in-imagination","dreamerv3","model-based-reinforcement-learning","vpt","offline-reinforcement-learning"],"name":"Dreamer 4","alt":"Dreamer 4: Training Agents Inside of Scalable World Models","abbr":"","aliases":["Training Agents Inside of Scalable World Models"],"one_liner":"谷歌 DeepMind 2025 年的世界模型智能体，只用离线数据在 Minecraft 里挖到钻石。","explanation":"Dreamer 4 是谷歌 DeepMind 的 Danijar Hafner、Wilson Yan 和 Timothy Lillicrap 于 2025 年 9 月发布的智能体，是 Dreamer 系列（DreamerV3 等）的新一代。Dreamer 路线的核心是「想象中学习」：先学一个世界模型，再让策略在模型生成的虚拟经历里做强化学习，不必和真实环境反复交互。Dreamer 4 把世界模型做到约 20 亿参数（4 亿的视频分词器加 16 亿的动力学模型），用「捷径强制」（shortcut forcing）训练目标和高效 Transformer，实现单张 GPU 上的实时交互推理；它主要从无动作标签的视频学知识，只需少量带动作的数据就能学会动作条件化。它是首个纯靠离线数据就在 Minecraft 中拿到钻石的智能体。真机试错慢且不安全，这类在世界模型里训练的方法对机器人很有参考价值。","example":"在 Minecraft 里挖到钻石需要从原始像素连续做出两万多次鼠标键盘操作；Dreamer 4 只用 2541 小时的离线玩家录像训练，有 0.7% 的回合拿到钻石，表现超过 OpenAI 的 VPT 离线智能体，所用数据少约 100 倍。","related":["世界模型","想象中学习","DreamerV3","基于模型的强化学习","VPT（视频预训练）","离线强化学习"]},{"id":"td-mpc2","category":"named_model","sec":8,"tier":3,"sources":[{"title":"TD-MPC2: Scalable, Robust World Models for Continuous Control (arXiv 2310.16828)","url":"https://arxiv.org/abs/2310.16828"},{"title":"TD-MPC2 project page","url":"https://www.tdmpc2.com/"}],"as_of":"2024-01","related_ids":["model-based-reinforcement-learning","world-model","model-predictive-control","latent-world-model","temporal-difference-learning","dreamerv3"],"name":"TD-MPC2","alt":"TD-MPC2: Scalable, Robust World Models for Continuous Control","abbr":"TD-MPC2","aliases":["TD-MPC 2"],"one_liner":"在学到的隐空间世界模型里做规划的强化学习算法，一套超参数通吃上百个控制任务","explanation":"UC San Diego 的 Nicklas Hansen、苏昊、王小龙 2023 年 10 月发布，是 ICLR 2024 Spotlight 论文，改进自同一团队的 TD-MPC。它属于基于模型的强化学习：先学一个只在隐空间里预测下一状态、奖励和价值的世界模型（不重建图像，即无解码器）；决策时在隐空间里做模型预测控制（MPC），短期靠模型推演，更远的回报交给用时序差分（TD）学到的价值函数估计，名字由此而来。TD-MPC2 在 DMControl、Meta-World、ManiSkill2、MyoSuite 四个领域共 104 个连续控制任务上，用同一套超参数表现稳定；还训练出一个 3.17 亿参数、能做 80 个任务的多任务智能体，显示能力随模型和数据规模增长。","example":"同一个 TD-MPC2 多任务模型既能控制 DMControl 里的猎豹奔跑，也能控制 Meta-World 里的机械臂开抽屉，训练时不用为每个任务单独调超参数。","related":["基于模型的强化学习","世界模型","模型预测控制","隐空间世界模型","时序差分学习","DreamerV3"]},{"id":"dino-wm","category":"named_model","sec":8,"tier":3,"sources":[{"title":"DINO-WM (arXiv:2411.04983)","url":"https://arxiv.org/abs/2411.04983"},{"title":"DINO-WM 项目主页","url":"https://dino-wm.github.io/"},{"title":"Gaoyue Zhou 个人主页（标注 ICML 2025）","url":"https://gaoyuezhou.github.io/"}],"as_of":"2025","related_ids":["world-model","latent-world-model","dinov2","model-predictive-control","joint-embedding-predictive-architecture","v-jepa-2"],"name":"DINO-WM","alt":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","abbr":"DINO-WM","aliases":["DINO World Model"],"one_liner":"在 DINOv2 图像特征空间里预测未来的世界模型，训练后能零样本规划到新目标。","explanation":"DINO-WM 由纽约大学的 Gaoyue Zhou、Hengkai Pan 与 Yann LeCun、Lerrel Pinto（后两位同属 Meta FAIR）提出，2024 年 11 月发布，发表于 ICML 2025。很多世界模型要重建像素，或和任务奖励绑定。DINO-WM 用预训练且冻结的 DINOv2 提取图块（patch）特征，只训练一个预测器：给定当前特征和动作，预测下一步特征，不重建图像。训练只用离线收集的轨迹，不需要专家演示、奖励模型或逆动力学模型。测试时给一张目标图像，用模型预测控制（MPC）搜索动作序列，让预测出的未来特征尽量接近目标特征，实现零样本规划。它代表了在预训练表征的隐空间里做世界模型的路线，与 JEPA、V-JEPA 2 思路相近。","example":"在 Push-T 任务中给出目标摆放图像，DINO-WM 在特征空间里推演不同推动动作，选出让 T 形块最接近目标位姿的序列；同一方法还用于迷宫导航、绳子和颗粒物操作等环境。","related":["世界模型","隐空间世界模型","DINOv2","模型预测控制","联合嵌入预测架构","V-JEPA 2"]},{"id":"v-jepa-2","category":"named_model","sec":8,"tier":2,"sources":[{"title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv 2506.09985)","url":"https://arxiv.org/abs/2506.09985"},{"title":"Introducing V-JEPA 2 (Meta AI blog)","url":"https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/"},{"title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning (arXiv 2603.14482)","url":"https://arxiv.org/abs/2603.14482"}],"as_of":"2026-06","related_ids":["joint-embedding-predictive-architecture","world-model","latent-world-model","self-supervised-learning","model-predictive-control","droid"],"name":"V-JEPA 2","alt":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","abbr":"V-JEPA 2","aliases":["V-JEPA 2-AC","V-JEPA","V-JEPA 2.1"],"one_liner":"Meta 的自监督视频模型，在特征空间里预测视频，可当世界模型规划机器人动作。","explanation":"V-JEPA 2 是 Meta FAIR（Yann LeCun 团队）2025 年 6 月发布的开源视频模型，约 12 亿参数。它沿用 JEPA（联合嵌入预测架构）思路：不生成像素，而是遮住视频的一部分，让模型在抽象特征空间里预测被遮住的内容，以此学到运动和物理规律。第一阶段用 100 多万小时网络视频和 100 万张图片自监督预训练；第二阶段冻结编码器，用 DROID 数据集中不到 62 小时的无标注机器人视频训练一个输入动作的预测器，叫 V-JEPA 2-AC。使用时给一张目标图，模型在特征空间里搜索能让预测结果最接近目标的动作（模型预测控制）。在两个实验室的 Franka 机械臂上零样本抓取放置新物体，成功率 65%–80%。2026 年 Meta 又发布了改进稠密特征的 V-JEPA 2.1。","example":"在一个没采过任何数据的新实验室，给 Franka 机械臂一张「物体已放到目标位置」的照片。V-JEPA 2-AC 每一步都在特征空间里想象多组候选动作的结果，选最接近目标图的那组执行，一步步把物体挪过去。","related":["联合嵌入预测架构","世界模型","隐空间世界模型","自监督学习","模型预测控制","DROID 数据集"]},{"id":"stable-video-diffusion","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets (arXiv 2311.15127)","url":"https://arxiv.org/abs/2311.15127"},{"title":"Introducing Stable Video Diffusion (Stability AI)","url":"https://stability.ai/news-updates/stable-video-diffusion-open-ai-video-model"},{"title":"Video Prediction Policy (arXiv 2412.14803)","url":"https://arxiv.org/abs/2412.14803"}],"as_of":"2023-11","related_ids":["video-generation-model","latent-diffusion-model","video-prediction-policy","text-to-video-image-to-video","world-model","diffusion-model"],"name":"Stable Video Diffusion","alt":"Stable Video Diffusion (SVD)","abbr":"SVD","aliases":["SVD-XT","Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets"],"one_liner":"Stability AI 开源的图生视频扩散模型，常被机器人研究用作视频预测底座","explanation":"Stability AI 于 2023 年 11 月 21 日发布的开源视频生成模型，属于潜在扩散模型（先把图像压缩到低维潜空间，再在潜空间里逐步去噪生成）。它在图像模型 Stable Diffusion 基础上插入时间层，并总结出三阶段训练：文生图预训练、大规模视频预训练、高质量视频微调，强调视频数据筛选的重要性。首发的是两个图生视频模型，分别生成 14 帧和 25 帧（后者即 SVD-XT），帧率可在每秒 3 到 30 帧间设置，当时以研究预览形式发布、不面向商用。由于权重开放、参数量约 15 亿，SVD 成了具身智能里常用的视频底座，例如视频预测策略（VPP）就在它上面加入语言条件、用机器人视频微调，再从中提取对未来的预测表征来输出动作。","example":"视频预测策略（VPP）把 SVD 微调成操作视频预测模型：给定当前画面和「打开抽屉」指令，先预测接下来画面的特征，再据此输出机械臂动作。","related":["视频生成模型","潜在扩散模型","视频预测策略","文生视频 / 图生视频","世界模型","扩散模型"]},{"id":"sora","category":"named_model","sec":8,"tier":2,"sources":[{"title":"Sora (text-to-video model) - Wikipedia","url":"https://en.wikipedia.org/wiki/Sora_(text-to-video_model)"},{"title":"Sora (人工智能模型) - 维基百科","url":"https://zh.wikipedia.org/wiki/Sora_(人工智能模型)"}],"as_of":"2026-09","related_ids":["video-generation-model","world-model","diffusion-transformer","spacetime-patches","world-foundation-model","intuitive-physics"],"name":"Sora（视频生成即世界模拟器）","alt":"Sora / Sora 2 (OpenAI; Video generation models as world simulators)","abbr":"","aliases":["Sora 2","Video generation models as world simulators"],"one_liner":"OpenAI 的文生视频模型，技术报告提出视频生成模型可以当作世界模拟器。","explanation":"Sora 是 OpenAI 的视频生成模型，2024 年 2 月首次展示，同年 12 月向付费用户开放，配套技术报告题为《Video generation models as world simulators》。它是扩散 Transformer：先把视频压到潜在空间，切成时空块当作 token，再逐步去噪生成。报告认为，把视频生成模型做大会自然出现 3D 一致、物体持续存在等能力，可能通向物理世界模拟器。这把视频生成和世界模型两条线连了起来，也引发它是否真懂物理的争论，报告自己也承认玻璃碎裂等交互模拟不准。2025 年 9 月 30 日发布 Sora 2 和配套社交 App；OpenAI 于 2026 年 3 月宣布停止 Sora，App 于 4 月 26 日下线，API 于 9 月 24 日关闭。","example":"技术报告里 Sora 生成了一段 Minecraft 画面，同时控制玩家角色并渲染周围世界，被当作「模拟数字世界」的例子。","related":["视频生成模型","世界模型","扩散 Transformer","时空块","世界基础模型","直觉物理"]},{"id":"genie","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Genie: Generative Interactive Environments (arXiv:2402.15391)","url":"https://arxiv.org/abs/2402.15391"},{"title":"Genie 项目主页","url":"https://sites.google.com/view/genie-2024/home"}],"as_of":"2024-02","related_ids":["genie-2","genie-3","latent-action-model","video-tokenizer","interactive-world-model","lapa"],"name":"Genie（初代）","alt":"Genie: Generative Interactive Environments","abbr":"","aliases":["Genie 1"],"one_liner":"谷歌 DeepMind 从无标注视频里学出「可玩世界」的生成式交互环境模型","explanation":"Google DeepMind 于 2024 年 2 月发布，参数量 110 亿，是首个只用无标注互联网视频、以无监督方式训练出来的生成式交互环境。它由三部分组成：时空视频分词器，把视频压成离散 token；潜在动作模型，从前后两帧推断发生了哪种动作，动作只有一小组离散编号（论文中为 8 个）；自回归动力学模型，根据当前帧和动作预测下一帧。关键在于训练时不需要动作标签，却能让人逐帧操控生成的世界。它主要用 2D 平台跳跃游戏视频训练，也在 RT-1 机器人视频上做过验证；潜在动作的思路后来被 LAPA 等机器人预训练工作沿用。","example":"给 Genie 一张手绘草图，它会把草图变成一个可以按动作一帧帧玩下去的 2D 平台游戏。","related":["Genie 2","Genie 3","潜在动作模型","视频分词器","可交互世界模型","LAPA"]},{"id":"genie-2","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Genie 2: A large-scale foundation world model (Google DeepMind Blog)","url":"https://deepmind.google/discover/blog/genie-2-a-large-scale-foundation-world-model/"}],"as_of":"2024-12","related_ids":["genie","genie-3","world-model","interactive-world-model","latent-diffusion-model","sima-2"],"name":"Genie 2","alt":"Genie 2 (Google DeepMind)","abbr":"","aliases":[],"one_liner":"谷歌 DeepMind 的大规模世界模型，从一张图生成可操控的 3D 世界","explanation":"Google DeepMind 于 2024 年 12 月 4 日发布的基础世界模型，是 Genie（初代）的后继。输入一张图片（可以是 Imagen 3 文生图的结果，也可以是真实照片），就能生成可用键盘鼠标操控的 3D 环境，画面一致性最长可保持约一分钟，多数示例在 10–20 秒。架构是在大规模视频数据上训练的自回归潜在扩散模型，即在压缩后的隐空间里一帧接一帧地去噪生成。它能模拟重力、水、烟等效果和物体交互，并记住移出视野的内容。主要用途是给 SIMA 等智能体提供多样的训练和评测环境，后续版本是 Genie 3。","example":"输入一张真实世界的照片，Genie 2 可以把它变成一个能用键盘操控、以第一人称视角走动的交互式 3D 场景。","related":["Genie（初代）","Genie 3","世界模型","可交互世界模型","潜在扩散模型","SIMA 2"]},{"id":"genie-3","category":"named_model","sec":8,"tier":2,"sources":[{"title":"Genie 3: A new frontier for world models (Google DeepMind blog)","url":"https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/"},{"title":"Genie (world model) - Wikipedia","url":"https://en.wikipedia.org/wiki/Genie_(world_model)"}],"as_of":"2026-01","related_ids":["world-model","interactive-world-model","genie","genie-2","waymo-world-model","autoregressive-video-generation"],"name":"Genie 3","alt":"Genie 3 (Google DeepMind real-time interactive world model)","abbr":"","aliases":["Genie3"],"one_liner":"谷歌 DeepMind 2025 年发布的实时可交互世界模型，一句话生成能边走边看的虚拟世界。","explanation":"Genie 3 是谷歌 DeepMind 2025 年 8 月 5 日发布的通用世界模型。给一段文字描述，它就生成一个可以实时操控漫游的动态世界：720p、每秒 24 帧，能保持几分钟的一致性，视觉记忆最远回溯约 1 分钟。画面逐帧自回归生成，每一帧都要参考不断变长的历史轨迹和用户操作；它还支持「可提示世界事件」，用文字改天气、加入新物体或角色。这让它可以当作训练和评估智能体的环境，而不必为每个任务手工搭仿真场景。局限是智能体能做的动作有限、单次交互只有几分钟。发布时只对少数研究者和创作者开放；2026 年 1 月 29 日谷歌以 Project Genie 向 AI Ultra 订阅用户开放体验（单次限 60 秒），Waymo 也在它基础上做了自动驾驶世界模型。","example":"DeepMind 把 SIMA 智能体放进 Genie 3 生成的世界并给它设定目标。智能体只发送前进、转向等导航动作；Genie 3 并不知道目标是什么，只根据这些动作模拟接下来的画面，一致性足够长，智能体就能完成更长的动作序列。","related":["世界模型","可交互世界模型","Genie（初代）","Genie 2","Waymo 世界模型","自回归视频生成"]},{"id":"sima-2","category":"named_model","sec":8,"tier":3,"sources":[{"title":"SIMA 2: An agent that plays, reasons, and learns with you in virtual 3D worlds (Google DeepMind blog)","url":"https://deepmind.google/blog/sima-2-an-agent-that-plays-reasons-and-learns-with-you-in-virtual-3d-worlds/"},{"title":"SIMA 2: A Generalist Embodied Agent for Virtual Worlds (arXiv 2512.04797)","url":"https://arxiv.org/abs/2512.04797"}],"as_of":"2025-12","related_ids":["genie-3","embodied-agent","self-improvement","google-gemini","google-deepmind","instruction-following"],"name":"SIMA 2","alt":"SIMA 2: A Generalist Embodied Agent for Virtual Worlds (Google DeepMind)","abbr":"SIMA","aliases":["Scalable Instructable Multiworld Agent 2"],"one_liner":"谷歌 DeepMind 基于 Gemini、能在各种 3D 游戏世界里听指令、推理并自学的智能体","explanation":"Google DeepMind 于 2025 年 11 月以有限研究预览的形式发布，12 月公开技术报告。前作 SIMA（Scalable Instructable Multiworld Agent，2024 年发布）能在多款商业 3D 游戏里执行 600 多项「向左转」「爬梯子」之类的简单技能指令。SIMA 2 以 Gemini 模型为核心，不只照指令执行，还能理解高层目标、和用户对话、说明自己打算怎么做，也能接受图片、草图甚至表情符号形式的指令。它还能自我提升：由 Gemini 给它出任务、打分，智能体用自己玩出来的经验数据训练下一版，不再依赖人类演示。在 Genie 3 实时生成的、从未见过的世界里，它也能辨明方向、按指令行动。DeepMind 把它看作走向通用具身智能体、最终用于真实机器人的一步。","example":"用户让它「去那栋颜色像熟番茄的房子」，SIMA 2 会先推理出熟番茄是红色，再去找红色的房子。","related":["Genie 3","具身智能体","自我提升","Gemini 系列（谷歌多模态大模型）","谷歌 DeepMind","指令跟随"]},{"id":"diamond","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Diffusion for World Modeling: Visual Details Matter in Atari (arXiv:2405.12399)","url":"https://arxiv.org/abs/2405.12399"},{"title":"DIAMOND 项目主页","url":"https://diamond-wm.github.io/"}],"as_of":"2024-10","related_ids":["world-model","diffusion-model","learning-in-imagination","gamengen","dreamerv3","arcade-learning-environment-atari-100k"],"name":"DIAMOND（扩散世界模型）","alt":"DIAMOND: Diffusion for World Modeling (Visual Details Matter in Atari)","abbr":"DIAMOND","aliases":["Diffusion for World Modeling"],"one_liner":"用扩散模型逐帧生成画面当世界模型，让强化学习智能体在生成的环境里练游戏。","explanation":"DIAMOND 由日内瓦大学、爱丁堡大学和微软研究院的研究者于 2024 年 5 月发布，是 NeurIPS 2024 Spotlight 论文。此前不少世界模型（如 IRIS、DreamerV3）把画面压成离散 token 或隐变量再预测，容易丢掉小而关键的视觉细节。DIAMOND 直接用扩散模型根据过去几帧和动作生成下一帧图像，并梳理了让它稳定做长时间预测的关键设计。智能体完全在这个生成环境里用强化学习训练，再到真实游戏中测试：在 Atari 100k 基准上平均人类归一化分数 1.46，是当时纯世界模型训练智能体的最好成绩。它还展示了扩散世界模型可当可交互的游戏引擎，与 GameNGen、Genie 思路相近。","example":"作者用 87 小时《反恐精英：全球攻势》（CS:GO）人类对局数据训练了一个 3.81 亿参数的扩散世界模型，在 RTX 3090 上约 10 帧/秒运行，人可以用键鼠在里面实时「玩」。","related":["世界模型","扩散模型","想象中学习","GameNGen（神经游戏引擎）","DreamerV3","Atari 游戏基准（街机学习环境 / Atari 100k）"]},{"id":"gamengen","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Diffusion Models Are Real-Time Game Engines (arXiv 2408.14837)","url":"https://arxiv.org/abs/2408.14837"},{"title":"GameNGen 项目主页","url":"https://gamengen.github.io/"}],"as_of":"2024-08","related_ids":["interactive-world-model","diffusion-model","autoregressive-video-generation","diamond","genie-2","world-model"],"name":"GameNGen（神经游戏引擎）","alt":"GameNGen: Diffusion Models Are Real-Time Game Engines","abbr":"GameNGen","aliases":["神经游戏引擎","Diffusion Models Are Real-Time Game Engines"],"one_liner":"谷歌 2024 年的工作：用扩散模型实时生成可玩的《毁灭战士》画面，替代游戏引擎。","explanation":"GameNGen 是 Google Research 与 Google DeepMind 的研究者在 2024 年 8 月发布的论文，演示了用神经网络模拟一款复杂游戏并能实时游玩。游戏选的是经典第一人称射击游戏《毁灭战士》（DOOM）。做法分两步：先训练一个强化学习智能体玩游戏，录下画面和按键；再把 Stable Diffusion 1.4 改造成以过去若干帧和玩家操作为条件、预测下一帧的扩散模型。自回归生成（用自己生成的帧接着生成下一帧）容易越跑越糊，作者在训练时给历史帧加高斯噪声，让模型学会纠偏，因此能稳定运行几分钟；另外单独微调了图像解码器以减少压缩失真。它在单个 TPU 上达到每秒 20 帧左右。这项工作让可交互世界模型受到广泛关注，常与 DIAMOND、Genie 2 并列讨论。","example":"玩家按键开枪、开门、捡血包，画面以及血量、弹药数字都由扩散模型逐帧生成；生成画面的 PSNR 为 29.4，与有损 JPEG 压缩相当，人类评估者区分短片真假只比随机猜略好。","related":["可交互世界模型","扩散模型","自回归视频生成","DIAMOND（扩散世界模型）","Genie 2","世界模型"]},{"id":"matrix-game","category":"named_model","sec":8,"tier":3,"sources":[{"title":"arXiv 2508.13009: Matrix-Game 2.0","url":"https://arxiv.org/abs/2508.13009"},{"title":"GitHub: SkyworkAI/Matrix-Game","url":"https://github.com/SkyworkAI/Matrix-Game"},{"title":"arXiv 2604.08995: Matrix-Game 3.0","url":"https://arxiv.org/abs/2604.08995"}],"as_of":"2026-04","related_ids":["interactive-world-model","world-model","genie-3","autoregressive-video-generation","self-forcing","diffusion-step-distillation"],"name":"昆仑万维 Matrix-Game","alt":"Matrix-Game 2.0 (Skywork open-source real-time interactive world model)","abbr":"","aliases":["Matrix-Game","Matrix-Game 2.0","Matrix-Game 3.0"],"one_liner":"昆仑万维 Skywork 开源的实时可交互世界模型，按键鼠操作逐帧生成游戏画面。","explanation":"Matrix-Game 是昆仑万维旗下 Skywork AI 开源的可交互世界模型系列，1.0 版 2025 年 5 月发布，2.0 版 2025 年 8 月发布。模型读入当前画面和用户每一帧的键盘、鼠标操作，接着生成下一段视频，从而得到一个边玩边生成的游戏世界。2.0 的要点有三：用虚幻引擎和 GTA5 环境自动采集约 1200 小时带交互标注的视频；把键鼠动作逐帧注入模型；把扩散模型蒸馏成少步的因果自回归生成器，以 25 FPS 实时生成分钟级视频，权重和代码均开源。2026 年 3 月底发布的 3.0 版加入基于相机位置的长时记忆，用 5B 模型做到 720p、40 FPS。这类模型与 Genie 3 同属一条路线，被视为机器人仿真和数据生成的潜在工具。","example":"在 GTA 风格的驾驶场景里按住 W 并把鼠标右移，模型实时生成车辆前进并向右转的画面。","related":["可交互世界模型","世界模型","Genie 3","自回归视频生成","Self Forcing（自强制训练）","扩散步数蒸馏"]},{"id":"hunyuanworld","category":"named_model","sec":8,"tier":3,"sources":[{"title":"HunyuanWorld 1.0 technical report (arXiv 2507.21809)","url":"https://arxiv.org/abs/2507.21809"},{"title":"Tencent-Hunyuan/HunyuanWorld-1.0 (GitHub, news timeline)","url":"https://github.com/Tencent-Hunyuan/HunyuanWorld-1.0"},{"title":"Voyager: Long-Range and World-Consistent Video Diffusion (arXiv 2506.04225)","url":"https://arxiv.org/abs/2506.04225"}],"as_of":"2026-05","related_ids":["world-model","interactive-world-model","generative-simulation","marble","genie-3","spatial-intelligence"],"name":"腾讯混元世界模型","alt":"HunyuanWorld (HunyuanWorld 1.0 / HunyuanWorld-Voyager, Tencent)","abbr":"HunyuanWorld","aliases":["HunyuanWorld 1.0","HunyuanWorld-Voyager","HY-World","WorldPlay"],"one_liner":"腾讯混元开源的 3D 世界生成系列，能从文字或图片生成可漫游的 3D 场景","explanation":"腾讯混元团队的开源世界生成模型系列。2025 年 7 月的 HunyuanWorld 1.0 以 360° 全景图为中间表示，把场景按语义分层后重建成可导出的 3D 网格，从一句话或一张图生成可探索的 3D 世界；2025 年 9 月的 Voyager 是 RGB-D 视频扩散模型，沿用户给定的相机路径生成几何一致的彩色和深度视频，可直接得到 3D 点云。之后陆续发布 1.1（WorldMirror，从视频或多视角图重建）、1.5（WorldPlay，2025 年 12 月，实时交互式世界模型）和 HY-World 2.0（2026 年 4 月）。对具身智能来说，它主要用来批量生成仿真场景和资产，偏「生成 3D 环境」，和预测机器人动作后果的世界模型侧重点不同。","example":"输入一句「海边的木屋小镇」，HunyuanWorld 1.0 生成一个 360° 可漫游、可导出网格的 3D 场景，可导入游戏引擎或仿真器。","related":["世界模型","可交互世界模型","生成式仿真","Marble（World Labs）","Genie 3","空间智能"]},{"id":"marble","category":"named_model","sec":8,"tier":3,"sources":[{"title":"World Labs: Marble: A Multimodal World Model","url":"https://www.worldlabs.ai/blog/marble-world-model"},{"title":"World Labs: Atlas: A World Model for Spatial Intelligence","url":"https://www.worldlabs.ai/blog/atlas"},{"title":"World Labs is Joining AMD","url":"https://www.worldlabs.ai/blog/amd-announcement"}],"as_of":"2026-09","related_ids":["spatial-intelligence","world-model","3d-gaussian-splatting","generative-simulation","world-labs","real-to-sim-to-real"],"name":"Marble（World Labs）","alt":"Marble (World Labs 3D world generation model)","abbr":"","aliases":["Marble"],"one_liner":"World Labs 推出的世界生成产品，用文字或图片生成可导出的 3D 场景。","explanation":"Marble 是李飞飞联合创办的 World Labs 于 2025 年 11 月 12 日正式上线的生成式世界模型产品。用户输入文字、单张或多张图片、视频，或先用配套工具 Chisel 搭出粗略 3D 布局，Marble 就生成一个可自由走动查看的持久 3D 场景，并可导出为高斯泼溅（用大量半透明椭球表示场景）、三角网格（含用于碰撞的简化网格）或按指定相机路径渲染的视频。与逐帧生成画面的视频世界模型不同，它输出显式 3D 资产，可放进游戏引擎或仿真器使用。2026 年 7 月 World Labs 展示了用生成场景做真-仿-真机器人训练；9 月发布的底层模型 Atlas 将驱动后续版本的 Marble；9 月 28 日 AMD 宣布收购 World Labs，预计 2026 年底前完成交易。","example":"上传一张客厅照片，Marble 生成可环视的 3D 客厅，导出碰撞网格后放进仿真器，让机器人在其中练习导航。","related":["空间智能","世界模型","3D高斯泼溅","生成式仿真","World Labs","真-仿-真闭环"]},{"id":"mano","category":"named_model","sec":8,"tier":3,"sources":[{"title":"MANO 官网（MPI-IS）","url":"https://mano.is.tue.mpg.de/"},{"title":"arXiv 2201.02610: Embodied Hands: Modeling and Capturing Hands and Bodies Together","url":"https://arxiv.org/abs/2201.02610"},{"title":"GitHub: hassony2/manopth（MANO 的 PyTorch 实现）","url":"https://github.com/hassony2/manopth"}],"as_of":"2017-11","related_ids":["smpl","hamer","hand-pose-estimation","motion-retargeting","dexterous-hand","human-video-data"],"name":"MANO 手部模型","alt":"MANO (hand Model with Articulated and Non-rigid defOrmations)","abbr":"MANO","aliases":["MANO 参数化手模型"],"one_liner":"最常用的参数化 3D 人手模型，用少量形状和姿态参数描述一只手。","explanation":"MANO 全称 hand Model with Articulated and Non-rigid defOrmations，由德国马普智能系统研究所 Michael Black 团队（Javier Romero、Dimitrios Tzionas）提出，发表于 SIGGRAPH Asia 2017。它从 31 人约 1000 次高精度手部 3D 扫描中学得：输入形状参数（常用 10 维，描述手的大小和粗细）和姿态参数（各手指关节的旋转，可用主成分压缩到更低维），就输出一只带手指弯曲和皮肤形变的三维手部网格。它还能接到 SMPL 人体模型上组成 SMPL+H。在具身智能里，MANO 是从人手视频学灵巧操作的常用表示：HaMeR 等手部重建方法输出 MANO 参数，再经动作重定向映射到机器人灵巧手的关节上。","example":"从一段人拿杯子的第一人称视频逐帧估计 MANO 参数，得到手指关节角轨迹，再重定向给机器人灵巧手当示范。","related":["SMPL 人体模型","HaMeR","手部姿态估计","动作重定向","灵巧手","人类视频数据"]},{"id":"vpt","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Video PreTraining (VPT) (arXiv 2206.11795)","url":"https://arxiv.org/abs/2206.11795"},{"title":"VPT 论文 HTML 版（数据规模细节）","url":"https://arxiv.org/html/2206.11795"}],"as_of":"2022-06","related_ids":["inverse-dynamics-model","pseudo-action-labels","action-free-video","behavior-cloning","minecraft-environments","latent-action-pretraining"],"name":"VPT（视频预训练）","alt":"Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos","abbr":"VPT","aliases":["Video PreTraining"],"one_liner":"OpenAI 先训逆动力学模型给网络视频打动作标签、再模仿学习玩 Minecraft","explanation":"OpenAI 2022 年 6 月发布，发表于 NeurIPS 2022。决策类任务的难点是网上视频很多，却没有「每一刻按了什么键」的动作标签。VPT 先花钱请人玩 Minecraft 并记录键鼠操作（约 1962 小时），用它训练逆动力学模型（IDM，看前后画面推断中间的动作）；再用 IDM 给约 7 万小时网络游戏视频自动打上伪动作标签，然后用行为克隆训练出一个基础策略，直接用人类的键盘鼠标接口以 20Hz 操作。这个策略有一定零样本能力，经模仿学习和强化学习微调后，首次做到让 AI 合成钻石工具（熟练玩家约需 20 分钟、2.4 万步操作）。「少量标注训 IDM + 大量视频打伪标签」的思路后来被机器人领域广泛借鉴。","example":"VPT 基础模型经强化学习微调后，能在 Minecraft 里从空手开始一路收集材料、合成工具，最终做出钻石工具，这在从零开始的强化学习中几乎做不到。","related":["逆动力学模型","伪动作标签","无动作标签视频","行为克隆","Minecraft 环境（MineDojo / MineRL）","潜在动作预训练"]},{"id":"mimicplay","category":"named_model","sec":8,"tier":3,"sources":[{"title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play (arXiv 2302.12422)","url":"https://arxiv.org/abs/2302.12422"},{"title":"MimicPlay project page","url":"https://mimic-play.github.io/"}],"as_of":"2023-10","related_ids":["imitation-learning","long-horizon-task","play-data","human-video-data","hierarchical-architecture","visuomotor-policy"],"name":"MimicPlay","alt":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","abbr":"","aliases":[],"one_liner":"先看人手随意玩耍的视频学高层计划，再用少量遥操作数据学底层动作的模仿学习方法","explanation":"斯坦福、英伟达等机构的 Chen Wang、Linxi Fan、李飞飞、Yuke Zhu 等人 2023 年 2 月发布，是 CoRL 2023 的口头报告论文。长程任务（要连续完成多步的任务）如果全靠遥操作采数据，成本很高。MimicPlay 采用分层结构：高层从「人类玩耍数据」，即人用手在场景里随意摆弄物体的视频中，学一个潜在计划，表示给定目标图像时人手的 3D 轨迹应该怎么走；低层只用少量遥操作演示训练视觉运动策略，按这个计划输出机器人动作。人手视频便宜、跨本体可用，正好补足机器人数据的不足。在 14 个真实长程操作任务上，它的成功率、泛化能力和抗干扰能力都优于当时的基线方法。","example":"面对「打开微波炉、把碗放进去、再关上门」这样的多步任务，高层根据目标图像预测人手该怎么移动的 3D 轨迹，低层策略照着这条轨迹驱动机械臂一步步完成。","related":["模仿学习","长程任务","玩耍数据","人类视频数据","分层架构","视觉运动策略"]},{"id":"vrb","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Affordances from Human Videos as a Versatile Representation for Robotics (arXiv 2304.08488)","url":"https://arxiv.org/abs/2304.08488"},{"title":"VRB 项目主页","url":"https://robo-affordances.github.io/"}],"as_of":"2023-06","related_ids":["affordance","human-video-data","egocentric-video","epic-kitchens","imitation-from-observation","affordance-detection"],"name":"VRB（从人类视频学可供性）","alt":"VRB: Affordances from Human Videos as a Versatile Representation for Robotics","abbr":"VRB","aliases":["Vision-Robotics Bridge","视觉-机器人桥"],"one_liner":"从人类视频学「该抓哪、抓后往哪动」，把这种可供性直接交给机器人用。","explanation":"VRB（Vision-Robotics Bridge）是卡内基梅隆大学 Deepak Pathak 组的 Shikhar Bahl、Russell Mendonca 等人与 Meta AI 的工作，2023 年 4 月上线 arXiv，发表于 CVPR 2023。可供性指物体「能被怎么用」，例如抽屉把手可以拉。VRB 用 EPIC-KITCHENS、Ego4D 等大量人类第一人称视频训练一个视觉可供性模型：输入一张场景图，输出两样东西——接触点热图（人最可能在哪里下手）和接触后手腕的运动轨迹（下手后往哪个方向动）。这种表示不依赖某种机器人的身体结构，因此能插进多种机器人学习方式：离线模仿学习、探索、目标条件学习，以及作为强化学习的动作参数化。论文在 4 个真实环境、10 多个任务、2 种机器人平台上验证了效果，是用人类视频弥补机器人数据不足的早期代表。","example":"看到一张厨房照片，模型在柜门把手处标出高接触概率，并给出「抓住后向外拉」的轨迹；机器人从这里下手、沿轨迹移动，就能尝试打开柜门。","related":["可供性","人类视频数据","第一人称视频","EPIC-KITCHENS 数据集","从观测中模仿学习","可供性检测"]},{"id":"atm","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Any-point Trajectory Modeling for Policy Learning (arXiv 2401.00025)","url":"https://arxiv.org/abs/2401.00025"},{"title":"ATM 项目页","url":"https://xingyu-lin.github.io/atm/"},{"title":"Robotics: Science and Systems XX (RSS 2024) 论文集","url":"https://www.roboticsproceedings.org/rss20/index.html"}],"as_of":"2024-07","related_ids":["tracking-any-point","cotracker","action-free-video","pretraining-on-human-videos","libero-benchmark","intermediate-representation"],"name":"ATM（任意点轨迹建模）","alt":"Any-point Trajectory Modeling for Policy Learning","abbr":"ATM","aliases":["Any-point Trajectory Model","任意点轨迹模型"],"one_liner":"先从视频学「画面里任意点接下来怎么动」，再用预测的轨迹引导机器人策略。","explanation":"ATM 由加州大学伯克利分校、清华大学交叉信息研究院等合作提出（作者含高阳、Pieter Abbeel），发表于 RSS 2024。带动作标注的机器人数据贵，无动作标签的视频多；以往视频预训练多靠逐像素预测未来画面，计算重、细节冗余。ATM 改为预测点的运动：先用点跟踪器 CoTracker 给视频里的点标出 2D 轨迹，训练一个 Transformer，根据当前画面、语言指令和一组点的位置预测它们未来的轨迹；再训练策略，以预测轨迹为子目标输出动作，只需少量带动作的演示。在 LIBERO 等 130 多个任务上，它比视频预训练基线平均高约 80%，还能从人类视频迁移技能。","example":"指令为「打开柜子中间的抽屉」时，模型先在当前画面上画出抽屉把手等位置的点接下来会怎样被拉出，策略再参照这些预测轨迹输出机械臂动作。","related":["任意点跟踪","CoTracker","无动作标签视频","人类视频预训练","LIBERO","中间表示"]},{"id":"lapa","category":"named_model","sec":8,"tier":2,"sources":[{"title":"Latent Action Pretraining from Videos (arXiv 2410.11758)","url":"https://arxiv.org/abs/2410.11758"},{"title":"LAPA 项目主页","url":"https://latentactionpretraining.github.io/"}],"as_of":"2025-04","related_ids":["latent-action","latent-action-pretraining","latent-action-model","vector-quantized-variational-autoencoder","action-free-video","openvla"],"name":"LAPA","alt":"LAPA: Latent Action Pretraining from Videos","abbr":"LAPA","aliases":["Latent Action Pretraining for general Action models","潜在动作预训练"],"one_liner":"用没有动作标签的视频预训练 VLA：先学潜在动作，再用少量真机数据映射成真实动作。","explanation":"LAPA 由 KAIST、华盛顿大学、微软研究院、英伟达和艾伦人工智能研究所的研究者于 2024 年 10 月提出，发表于 ICLR 2025。VLA 预训练通常需要人工遥操作采来的动作标签，数据来源和规模都受限；LAPA 想直接利用网上大量没有动作标签的视频。它分三步：先用 VQ-VAE 式目标训练一个量化模型，把前后两帧之间的变化编码成离散的潜在动作；再让视觉语言模型（7B 的 LWM）根据画面和任务描述预测这些潜在动作，完成预训练；最后在少量真机数据上微调，把潜在动作映射成真实机器人动作。论文称它在需要语言理解和泛化的真机任务上比用真实动作标签训练的 OpenVLA 高 6.22%，预训练效率高 30 倍以上。","example":"只用 Something-Something V2 里约 22 万条人类日常操作视频做潜在动作预训练，再在少量机器人轨迹上微调，效果就超过了用 Bridge 机器人数据预训练的 OpenVLA。","related":["潜在动作","潜在动作预训练","潜在动作模型","向量量化变分自编码器","无动作标签视频","OpenVLA"]},{"id":"phantom","category":"named_model","sec":8,"tier":3,"sources":[{"title":"arXiv 2503.00779: Phantom","url":"https://arxiv.org/abs/2503.00779"},{"title":"Phantom 项目主页","url":"https://phantom-human-videos.github.io/"}],"as_of":"2025-09","related_ids":["robotizing-human-videos-human-to-robot-video-translation","human-video-data","robot-free-data-collection","hand-pose-estimation","egomimic","embodiment-gap"],"name":"Phantom（无机器人训练）","alt":"Phantom: Training Robots Without Robots Using Only Human Videos","abbr":"","aliases":["Phantom"],"one_liner":"只用人类操作视频、把人手换成渲染机械臂来训练机器人策略的方法","explanation":"斯坦福大学 Jeannette Bohg 组（Marion Lepert 等）2025 年 3 月发布，CoRL 2025 论文。遥操作采数据太贵，人类视频便宜，但人手和机械臂长得不一样，视频里也没有机器人动作标签。Phantom 的做法：先估计每帧的手部姿态，换算成机器人末端动作；再用图像修复（inpainting）把人手从画面里抹掉，渲染一只虚拟机械臂叠上去，让训练图像看起来像机器人在干活。这样不用任何机器人数据就能训练策略，并零样本部署到 Franka 和 Kinova Gen3 上，完成抓放、叠杯、绑绳、扫物、插入等任务，报告最高成功率 92%。它属于「人类视频机器人化」路线。","example":"研究者用自己的手在桌上演示「把杯子叠起来」，Phantom 自动把视频里的手换成渲染的夹爪并生成动作标签，训出的策略直接在 Franka 机械臂上执行。","related":["人类视频机器人化（人→机视频转换）","人类视频数据","无本体采集","手部姿态估计","EgoMimic","本体差异"]},{"id":"univla","category":"named_model","sec":8,"tier":3,"sources":[{"title":"UniVLA (arXiv 2505.06111)","url":"https://arxiv.org/abs/2505.06111"},{"title":"OpenDriveLab/UniVLA GitHub","url":"https://github.com/OpenDriveLab/UniVLA"}],"as_of":"2025-05","related_ids":["latent-action-model","latent-action","vision-language-action-model","openvla","lapa","cross-embodiment"],"name":"UniVLA","alt":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","abbr":"","aliases":[],"one_liner":"从视频里学「与任务相关的潜在动作」来训练跨本体 VLA 的框架","explanation":"香港大学 OpenDriveLab 与智元机器人 2025 年 5 月发布，发表于 RSS 2025。多数 VLA（视觉-语言-动作模型）依赖大量带动作标签的机器人数据，且被绑在某一种机器人上。UniVLA 先训练潜在动作模型：在 DINOv2 特征空间里看前后两帧，结合语言指令，把与任务有关的变化和镜头晃动等无关变化分开，量化成离散的潜在动作 token，这样没有动作标签的视频（包括人类视频）也能用来预训练。之后以 Prismatic-7B 为底座预测潜在动作，部署到具体机器人时只加一个约 1200 万参数的解码头把它翻译成真实动作。论文称预训练算力不到 OpenVLA 的 1/20、下游数据只用 1/10，就在 LIBERO、CALVIN、R2R 等基准上超过它。","example":"把机械臂数据、导航数据和人类操作视频一起喂给 UniVLA 的潜在动作模型，学到的同一套潜在动作，接上不同的小解码头后，可以分别驱动 LIBERO 仿真里的机械臂和 R2R 里的导航智能体。","related":["潜在动作模型","潜在动作","视觉-语言-动作模型","OpenVLA","LAPA","跨本体"]},{"id":"egovla","category":"named_model","sec":8,"tier":3,"sources":[{"title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos (arXiv 2507.12440)","url":"https://arxiv.org/abs/2507.12440"},{"title":"EgoVLA 项目页","url":"https://rchalyang.github.io/EgoVLA/"}],"as_of":"2025-07","related_ids":["egocentric-video","pretraining-on-human-videos","mano","motion-retargeting","vision-language-action-model","egoscale"],"name":"EgoVLA","alt":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","abbr":"EgoVLA","aliases":[],"one_liner":"用第一人称人类视频预训练的 VLA，把人手动作换算成人形机器人动作。","explanation":"EgoVLA 是 UC 圣地亚哥联合 UIUC、MIT、英伟达等于 2025 年 7 月发布的论文。动机是真机数据离不开机器人硬件、规模有限，而人类第一人称视频量大、场景丰富。它以 NVILA-2B 视觉语言模型为骨干，先在约 50 万个人类视频图像-动作对上学习预测人的手腕位姿和 MANO 手部参数（一种参数化人手模型）；再把机器人手也换算到同一个 MANO 动作空间，用少量机器人演示微调。部署时手腕位姿经逆运动学转成手臂关节角，手指由一个小 MLP 映射到灵巧手关节。","example":"在作者基于 Isaac Lab 搭的 Ego Humanoid Manipulation Benchmark 里（仿真中的宇树 H1 加因时灵巧手，共 12 个任务），用人类视频预训练过的 EgoVLA 明显好于只用机器人数据训练的基线，长程任务和精细操作任务提升尤其大。","related":["第一人称视频","人类视频预训练","MANO 手部模型","动作重定向","视觉-语言-动作模型","EgoScale"]},{"id":"unipi","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Learning Universal Policies via Text-Guided Video Generation (arXiv 2302.00111)","url":"https://arxiv.org/abs/2302.00111"},{"title":"UniPi project page","url":"https://universal-policy.github.io/unipi/"}],"as_of":"2023-11","related_ids":["unisim","video-generation-model","inverse-dynamics-model","video-prediction-policy","susie","world-model"],"name":"UniPi","alt":"UniPi: Learning Universal Policies via Text-Guided Video Generation","abbr":"","aliases":["Universal Policies via Text-Guided Video Generation"],"one_liner":"先按文字生成一段完成任务的视频，再从视频里反推出机器人动作的方法","explanation":"MIT、Google Brain、UC Berkeley 与阿尔伯塔大学（Yilun Du、Pieter Abbeel 等）2023 年 1 月发布，发表于 NeurIPS 2023。它把决策问题改写成「文本条件视频生成」：给定文字目标和当前画面，用视频扩散模型生成一段完成任务的未来视频当作计划，再用逆动力学模型（根据前后两帧推算中间动作的模型）从相邻帧算出机器人该执行的动作。因为不同机器人、不同环境都统一成了图像，模型能跨任务共享知识；文字目标可以自由组合，带来组合泛化；在互联网图文视频上预训练，也能提升对新指令的泛化。它是「视频生成模型当策略」路线的早期代表，UniSim、视频预测策略等后续工作沿用了相近思路。","example":"输入「把红色积木放进蓝色碗里」，UniPi 先生成一段机器人完成这件事的短视频，再由逆动力学模型逐帧反推出动作去执行。","related":["UniSim","视频生成模型","逆动力学模型","视频预测策略","SuSIE","世界模型"]},{"id":"unisim","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Learning Interactive Real-World Simulators (arXiv 2310.06114)","url":"https://arxiv.org/abs/2310.06114"},{"title":"UniSim project page","url":"https://universal-simulator.github.io/unisim/"}],"as_of":"2024-05","related_ids":["unipi","interactive-world-model","neural-simulator","world-model","genie","video-generation-model"],"name":"UniSim","alt":"UniSim: Learning Interactive Real-World Simulators","abbr":"","aliases":["Universal Simulator","Learning Interactive Real-World Simulators"],"one_liner":"用视频生成模型学出来、能响应动作的「真实世界模拟器」","explanation":"UC Berkeley、Google DeepMind 与 MIT（Sherry Yang、Yilun Du、Pieter Abbeel 等）2023 年 10 月发布，获 ICLR 2024 杰出论文奖。它用视频生成模型学一个真实世界模拟器：给定当前画面和一个动作，生成执行后的画面。动作既可以是「打开抽屉」这样的高层语言指令，也可以是「移动到某个坐标」这样的低层控制。没有单一数据集能同时覆盖这些信息，作者就把图像数据（物体种类多）、机器人数据（动作多）、导航数据（运动多）等拼在一起训练。训练好后，可以在 UniSim 里训练视觉语言策略和强化学习策略，再零样本迁移到真机；它生成的数据也能帮助视频字幕等模型。它是可交互世界模型、神经模拟器方向的早期代表。","example":"给 UniSim 一张厨房画面并输入「打开抽屉」，它生成抽屉被拉开的后续视频；强化学习策略可以在这类生成画面里反复试错训练。","related":["UniPi","可交互世界模型","神经模拟器","世界模型","Genie（初代）","视频生成模型"]},{"id":"avdc","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Learning to Act from Actionless Videos through Dense Correspondences (arXiv 2310.08576)","url":"https://arxiv.org/abs/2310.08576"},{"title":"OpenReview: ICLR 2024 spotlight","url":"https://openreview.net/forum?id=Mhb5fpA1T0"},{"title":"AVDC 项目页","url":"https://flow-diffusion.github.io/"}],"as_of":"2024-01","related_ids":["action-free-video","unipi","video-generation-model","optical-flow","imitation-from-observation","human-video-data"],"name":"AVDC（从无动作视频学动作）","alt":"AVDC: Learning to Act from Actionless Videos through Dense Correspondences","abbr":"AVDC","aliases":["Actionless Video through Dense Correspondences","Learning to Act from Actionless Videos"],"one_liner":"先生成「机器人做任务」的视频，再用光流反推该执行的动作，全程不需要动作标签。","explanation":"AVDC 由台湾大学与 MIT 合作提出（作者含 Yilun Du、Joshua Tenenbaum），发表于 ICLR 2024（Spotlight）。机器人数据贵在动作标签，只有画面的视频却很多。AVDC 给定当前画面和文字指令，先用文本条件的扩散视频生成模型「想象」出完成任务的视频；再估计相邻帧的光流（每个像素往哪动），当作稠密对应关系，结合第一帧深度算出物体的刚体位姿变化，最后换算成机械臂的抓取和移动动作。策略只用 RGB 视频训练，在 Meta-World 操作、iTHOR 导航和真实 Franka 机械臂上验证，还开源了 4 张 GPU 一天即可训练的视频模型框架。它与 UniPi 同属「用视频生成当策略」的路线。","example":"只用 198 段人手推物体的视频（不含任何机器人动作）训练视频模型，不做微调直接控制仿真机械臂完成推物任务，40 次试验成功率 90%，这就是从人到机器人的跨本体迁移。","related":["无动作标签视频","UniPi","视频生成模型","光流","从观测中模仿学习","人类视频数据"]},{"id":"susie","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models (arXiv 2310.10639)","url":"https://arxiv.org/abs/2310.10639"},{"title":"SuSIE project page","url":"https://rail-berkeley.github.io/susie/"}],"as_of":"2023-10","related_ids":["goal-conditioned-policy","diffusion-model","hierarchical-architecture","calvin-benchmark","unipi","zero-shot"],"name":"SuSIE","alt":"SuSIE: Subgoal Synthesis via Image Editing","abbr":"SuSIE","aliases":["Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","基于图像编辑的子目标合成"],"one_liner":"把图像编辑扩散模型当高层规划器，先画出子目标画面，再让底层策略去达成","explanation":"UC Berkeley 与斯坦福的 Kevin Black、Sergey Levine、Chelsea Finn 等人 2023 年 10 月发布。方法分两层：高层是开源图像编辑模型 InstructPix2Pix，在人类视频和机器人数据上微调后，输入当前相机画面和语言指令，输出接下来某一时刻「应该是什么样」的子目标图片；低层是只看目标图、不看语言的目标条件策略，负责把机器人从当前画面带到子目标画面。两层交替执行，直到任务完成。这样高层能借用互联网规模图像预训练带来的语义理解去处理新物体、新指令，低层专心做精确控制。它在 CALVIN 基准的零样本设置上取得当时最好成绩，真机实验中也超过了 RT-2-X。它和 UniPi 同属「先生成画面、再推出动作」的路线。","example":"指令是「把黄色积木放进抽屉」，SuSIE 先生成一张夹爪已抓住黄色积木的图片当子目标，底层策略到达后，再生成积木落入抽屉的下一张子目标图。","related":["目标条件策略","扩散模型","分层架构","CALVIN","UniPi","零样本"]},{"id":"gen2act","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Gen2Act (arXiv:2409.16283)","url":"https://arxiv.org/abs/2409.16283"},{"title":"Gen2Act 项目主页","url":"https://homangab.github.io/gen2act/"}],"as_of":"2024-09","related_ids":["video-generation-model","human-video-data","tracking-any-point","behavior-cloning","unipi","dreamgen"],"name":"Gen2Act","alt":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","abbr":"","aliases":[],"one_liner":"先生成一段「人怎么做」的视频，再让机器人照着视频执行的操作方法","explanation":"Google DeepMind 与卡内基梅隆大学、斯坦福的研究者在 2024 年 9 月提出。它把「按语言指令操作」拆成两步：先用在网络视频上训练好的视频生成模型，不经微调、零样本地为当前场景生成一段人完成任务的视频；再由机器人策略看着这段视频执行，训练时加入点轨迹预测损失（预测画面里各点怎么移动），让策略读出视频中的运动信息。物体和动作的泛化交给见过海量网络视频的生成模型，机器人数据只需教会「把视频里的动作翻译成机器人动作」，因此能处理机器人数据里没出现过的物体类别和动作。","example":"机器人数据里没有的动作类型（如画圈搅动、朝新方向拖动物体），可以靠生成的人类视频引导完成；把多段任务串起来还能做「清理桌面」「做咖啡」这类长程任务。","related":["视频生成模型","人类视频数据","任意点跟踪","行为克隆","UniPi","DreamGen（GR00T Dreams）"]},{"id":"video-prediction-policy","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Video Prediction Policy (arXiv 2412.14803)","url":"https://arxiv.org/abs/2412.14803"},{"title":"VPP project page","url":"https://video-prediction-policy.github.io/"}],"as_of":"2025-05","related_ids":["video-prediction-model","inverse-dynamics-model","diffusion-policy","calvin-benchmark","vidar","robotera"],"name":"视频预测策略","alt":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","abbr":"VPP","aliases":["Video Prediction Policy"],"one_liner":"用视频扩散模型内部的「对未来的预测特征」来指导动作生成的机器人策略","explanation":"清华大学陈建宇团队联合星动纪元、UC Berkeley、上海人工智能实验室等 2024 年 12 月发布，入选 ICML 2025 Spotlight。常见视觉编码器只看单张图或两张图对比，抓不住「接下来会怎样动」。VPP 的假设是：视频扩散模型在预测未来帧时，内部特征同时包含当前画面和对未来动态的预测。做法是先用机器人数据和互联网人手操作视频微调一个预训练视频模型，再取它的中间预测表征作为条件，训练一个隐式逆动力学模型（由「预测的未来」反推动作）输出动作。论文报告在 CALVIN ABC-D 泛化基准上相对此前最好方法提升 18.6%，在真实灵巧手复杂操作任务上成功率提升 31.6%。","example":"在 Franka 机械臂和 XHand 灵巧手上，VPP 根据语言指令先在模型内部形成对未来几帧的预测特征，再据此输出动作，而不需要把整段未来视频完整渲染出来。","related":["视频预测模型","逆动力学模型","扩散策略","CALVIN","生数 Vidar","星动纪元"]},{"id":"seer","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation (arXiv 2412.15109)","url":"https://arxiv.org/abs/2412.15109"},{"title":"OpenRobotLab/Seer (GitHub)","url":"https://github.com/OpenRobotLab/Seer"}],"as_of":"2025-01","related_ids":["inverse-dynamics-model","video-prediction-policy","droid","calvin-benchmark","libero-benchmark","shanghai-artificial-intelligence-laboratory"],"name":"Seer（预测式逆动力学模型）","alt":"Seer: Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","abbr":"PIDM","aliases":["Seer","预测式逆动力学模型","Predictive Inverse Dynamics Model"],"one_liner":"先预测接下来的画面、再用逆动力学推出动作的端到端机器人操作策略","explanation":"上海人工智能实验室等机构 2024 年 12 月发布，入选 ICLR 2025 口头报告。常见做法要么直接从当前画面模仿动作（行为克隆），要么先用视频模型生成未来画面、再单独推算动作，两步分开训练。Seer 提出「预测式逆动力学模型」（PIDM）：在一个端到端训练的 Transformer 里，先预测机器人接下来会看到的画面，再用逆动力学模型（根据当前状态和目标状态反推该做什么动作）从「现在」和「预测的未来」之间算出动作，视觉预测和动作预测一起优化。它可以先在 DROID 等大规模机器人数据上预训练，再少量微调到下游任务。论文报告相比此前最好的方法，在 LIBERO-LONG 上提升 13%，在 CALVIN ABC-D 上提升 21%，真机任务提升 43%。","example":"执行「打开抽屉」时，Seer 先预测下一刻夹爪贴近把手的画面，再根据当前画面和这张预测图算出机械臂该怎么移动。","related":["逆动力学模型","视频预测策略","DROID 数据集","CALVIN","LIBERO","上海人工智能实验室"]},{"id":"uva","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Unified Video Action Model (arXiv 2503.00200)","url":"https://arxiv.org/abs/2503.00200"},{"title":"UVA project page","url":"https://unified-video-action-model.github.io/"}],"as_of":"2025-04","related_ids":["video-prediction-policy","world-action-model","forward-dynamics-model","inverse-dynamics-model","diffusion-policy","universal-manipulation-interface"],"name":"UVA","alt":"Unified Video Action Model","abbr":"UVA","aliases":["Unified Video Action Model"],"one_liner":"视频和动作共用一个潜在表示、推理时可跳过视频生成的机器人模型","explanation":"斯坦福大学 Shuang Li、Yihuai Gao、Dorsa Sadigh、宋舒然 2025 年 2 月发布，发表于 RSS 2025。用视频生成做机器人策略能学到环境会怎么变化，但动作精度和推理速度往往不如直接输出动作的策略。UVA 让视频和动作共享一个联合潜在表示，训练时一起学，解码时分开：用两个轻量扩散头分别解出未来画面和动作，推理时可以跳过视频生成、只解动作，所以速度快。再配合掩码训练，同一个模型可以当策略、正向动力学模型、逆动力学模型或视频预测模型用。在叠毛巾、摆杯子等真机多任务实验里，它在没见过的环境和物体上优于基于 UMI 数据训练的扩散策略基线。","example":"机器人叠毛巾时，UVA 只解码下一段动作、跳过画面生成来保证实时；离线分析时，同一个模型也能根据给定动作预测执行后的画面。","related":["视频预测策略","世界动作模型","正向动力学模型","逆动力学模型","扩散策略","通用操作接口"]},{"id":"uwm","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Unified World Models (arXiv 2504.02792)","url":"https://arxiv.org/abs/2504.02792"},{"title":"UWM project page","url":"https://weirdlabuw.github.io/uwm/"}],"as_of":"2025-05","related_ids":["world-model","diffusion-model","action-free-video","inverse-dynamics-model","droid","uva"],"name":"UWM（统一世界模型）","alt":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","abbr":"UWM","aliases":["Unified World Models"],"one_liner":"把动作扩散和视频扩散合进一个模型、能用无动作视频预训练的机器人框架","explanation":"华盛顿大学（Abhishek Gupta 团队）与丰田研究院 2025 年 4 月发布，发表于 RSS 2025。模仿学习需要带动作标签的机器人数据，大量没有动作标签的视频很难直接用上。UWM 在一个 Transformer 里同时跑动作扩散和视频扩散，并给两种模态各自独立的去噪时间步：把某个模态设成纯噪声，就相当于不看它。于是同一个模型通过不同时间步组合，可以当策略、正向动力学模型、逆动力学模型或视频预测器用；遇到无动作视频，就把缺失的动作当成完全加噪来训练。在 DROID 大规模数据上预训练再微调，比单纯行为克隆预训练泛化更好，加入无动作视频还能进一步提升效果。","example":"把 DROID 里的机器人轨迹和一批没有动作标签的操作视频一起拿来预训练 UWM，再用少量示教把它微调成某个具体任务的策略。","related":["世界模型","扩散模型","无动作标签视频","逆动力学模型","DROID 数据集","UVA"]},{"id":"vidar","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Vidar (arXiv 2507.12898)","url":"https://arxiv.org/abs/2507.12898"},{"title":"Vidar 论文 HTML v4（机构与 Vidu 2.0 基座）","url":"https://arxiv.org/html/2507.12898v4"},{"title":"Vidar & AnyPos project page","url":"https://embodiedfoundation.github.io/vidar_anypos"}],"as_of":"2025-12","related_ids":["video-generation-model","inverse-dynamics-model","video-prediction-policy","cross-embodiment","world-action-model","shengshu-technology"],"name":"生数 Vidar","alt":"Vidar: VIdeo Diffusion for Action Reasoning (Tsinghua & ShengShu)","abbr":"Vidar","aliases":["Vidar: Embodied Video Diffusion Model for Generalist Manipulation"],"one_liner":"先用视频扩散模型预测未来画面、再反推动作的机器人操作模型","explanation":"清华大学朱军团队（TSAIL）2025 年 7 月发布，名字取自 VIdeo Diffusion for Action Reasoning；真机实验以生数科技的视频模型 Vidu 2.0 为基座，论文注明部分工作在生数完成，据报道由生数与清华联合推出。思路分两步：视频扩散模型先根据指令和当前画面「想象」接下来的视频；再由掩码逆动力学模型（MIDM，根据前后帧反推动作）把视频翻译成机器人动作，它会自动学出只关注机械臂等与动作相关的像素，以屏蔽背景干扰。视频模型先用 3 个机器人平台、75 万条多视角轨迹做具身领域的继续预训练。换到没见过的机器人上，论文称只需约 20 分钟人类演示即可超过基线，并能泛化到新任务、新背景和新相机布局。","example":"给一台新的 Aloha 双臂机器人只采约 20 分钟人类演示做适配，Vidar 就能根据新的语言指令先生成完成任务的视频，再由逆动力学模型把视频逐段翻译成关节动作去执行。","related":["视频生成模型","逆动力学模型","视频预测策略","跨本体","世界动作模型","生数科技"]},{"id":"ctrl-world","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Ctrl-World (arXiv:2510.10125)","url":"https://arxiv.org/abs/2510.10125"},{"title":"Ctrl-World 项目主页（ICLR 2026）","url":"https://ctrl-world.github.io/"}],"as_of":"2026-03","related_ids":["world-model","world-model-based-policy-evaluation","droid","pi0-5","stable-video-diffusion","synthetic-data"],"name":"Ctrl-World","alt":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","abbr":"","aliases":["可控机器人世界模型"],"one_liner":"按动作生成多视角未来画面的操作世界模型，用来在「想象」里评测和改进策略。","explanation":"斯坦福 Chelsea Finn 组与清华陈建宇组 2025 年 10 月提出，收录于 ICLR 2026。评测和改进通用机器人策略通常要大量真机试跑，又慢又贵。Ctrl-World 从 15 亿参数的视频扩散模型 Stable Video Diffusion 初始化，在 DROID 数据集（约 9.5 万条轨迹、564 个场景）上训练成「给动作就生成未来画面」的世界模型，做了三处改动：两个第三视角和一个腕部相机联合预测；稀疏采样历史帧并嵌入机械臂位姿，让模型按位姿找回相关的过去画面，保持长时一致；逐帧注入动作，控制精度到厘米级。策略能在里面连续交互 20 秒以上，用来给 π0、π0-FAST、π0.5 排名与真机结果吻合；从想象中挑成功轨迹微调 π0.5，陌生指令和物体上的成功率从 38.7% 提到 83.4%。","example":"给 π0.5 一条没练过的指令，在 Ctrl-World 里通过改写指令、随机重置机械臂跑 400 次想象试验，人工挑出 25–50 条成功轨迹，再用它们微调策略 2000 步。","related":["世界模型","世界模型评测","DROID 数据集","π0.5","Stable Video Diffusion","合成数据"]},{"id":"motus","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Motus: A Unified Latent Action World Model (arXiv 2512.13030)","url":"https://arxiv.org/abs/2512.13030"},{"title":"thu-ml/Motus (GitHub)","url":"https://github.com/thu-ml/Motus"},{"title":"Motus project page","url":"https://motus-robotics.github.io/motus"}],"as_of":"2025-12","related_ids":["world-action-model","latent-action","mixture-of-transformers","inverse-dynamics-model","data-pyramid","robotwin"],"name":"Motus","alt":"Motus: A Unified Latent Action World Model","abbr":"","aliases":[],"one_liner":"把理解、视频生成和动作三个专家合成一个模型的潜在动作世界模型","explanation":"清华大学朱军团队联合北京大学、地平线在 2025 年 12 月发布，代码和权重以 Apache 2.0 开源。以往的方法常把理解、世界模型（预测未来画面）和控制拆成独立模型，难以共同利用大规模异构数据。Motus 用混合 Transformer（MoT）架构把理解专家、视频生成专家和动作专家连在一起，视频部分基于 Wan2.2-5B，理解部分基于 Qwen3-VL-2B，总计约 80 亿参数；再用类似 UniDiffuser 的调度，在世界模型、VLA、逆动力学模型、视频生成等模式之间切换。它用光流学出潜在动作，让没有动作标签的视频也能参与预训练，并配合三阶段训练和六层数据金字塔。在 RoboTwin 2.0 的 50 个任务上平均成功率约 87%，报告比 X-VLA 高 15%、比 π0.5 高 45%。","example":"同一个 Motus 模型：给当前画面和指令，直接输出动作（VLA 模式）；给画面和动作，预测接下来的视频（世界模型模式）；给前后画面，反推中间做了什么动作（逆动力学模式）。","related":["世界动作模型","潜在动作","混合 Transformer 架构","逆动力学模型","数据金字塔","RoboTwin"]},{"id":"fast-wam","category":"named_model","sec":8,"tier":3,"sources":[{"title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination? (arXiv 2603.16666)","url":"https://arxiv.org/abs/2603.16666"}],"as_of":"2026-03","related_ids":["world-action-model","video-generation-model","action-expert","inference-latency","lingbot-va","motus"],"name":"Fast-WAM","alt":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","abbr":"","aliases":[],"one_liner":"清华与星海图 2026 年的世界动作模型：训练时学预测视频，推理时跳过想象，更快。","explanation":"Fast-WAM 是清华大学交叉信息研究院与星海图的 Tianyuan Yuan、赵行（Hang Zhao）等人 2026 年 3 月发布的论文。世界动作模型（WAM，同时预测未来画面和机器人动作的模型）多数走「先想象再执行」路线：先用视频扩散模型生成未来几帧，再据此出动作，反复去噪让推理很慢。作者把两件事拆开做对照：训练时要不要联合学视频预测，推理时要不要真的生成未来画面。结论是去掉推理时的想象几乎不掉点，去掉训练时的视频联合训练则明显变差，说明视频预测的价值主要在于训练出更好的世界表征。模型以 Wan2.2-5B 视频扩散 Transformer 为骨干，加约 10 亿参数的动作专家，共约 60 亿参数；推理延迟 190 毫秒，比同类「先想象再执行」模型快 4 倍以上。","example":"不做任何机器人数据预训练，Fast-WAM 在 RoboTwin 2.0 上成功率 91.8%，在 LIBERO 上平均 97.6%，并在星海图 R1 Lite 上完成真机长程叠毛巾任务。","related":["世界动作模型","视频生成模型","动作专家","推理延迟","蚂蚁灵波 LingBot-VA","Motus"]},{"id":"flux-3-action","category":"named_model","sec":8,"tier":3,"sources":[{"title":"FLUX 3 Action 模型页（Black Forest Labs）","url":"https://bfl.ai/models/flux-3-action"},{"title":"Black Forest Labs 官网","url":"https://bfl.ai/"}],"as_of":"2026-09","related_ids":["world-action-model","open-weight-model","cosmos-3","fast-wam","droid","so-100-so-101-arm"],"name":"FLUX 3 Action（Black Forest Labs）","alt":"FLUX 3 Action (Black Forest Labs open-weight world action model)","abbr":"","aliases":["FLUX 3 Action"],"one_liner":"德国 Black Forest Labs 2026 年 9 月开放权重的 7B 世界动作模型，同时预测画面与动作。","explanation":"FLUX 3 Action 是以 FLUX 系列图像生成模型知名的德国公司 Black Forest Labs 在 2026 年 9 月发布的机器人模型，参数量 70 亿，权重在 Hugging Face 开放。它属于世界动作模型（WAM，同时预测未来画面和机器人动作的模型）：由公司的多模态 FLUX 3 骨干改造而来，这个骨干在大量视频、图像和音频上预训练，以视频为主。模型输入相机画面、关节状态和文字指令，同时输出机器人动作和预测的未来画面，目的是把视频预训练学到的物理常识迁移到控制上。官方称它支持末端位姿、关节角等多种动作空间，在 Franka 机械臂和 SO-101 上做了演示。它是图像、视频生成公司进入具身智能的一个例子。","example":"官方报告：引导蒸馏版在 RoboLab-120 仿真榜上成功率 42.2%，高于英伟达 Cosmos 3 Nano 的 36.8%；在 10 个 DROID 真机操作任务上成功率 93.3%。","related":["世界动作模型","开放权重","Cosmos 3","Fast-WAM","DROID 数据集","SO-100 / SO-101 机械臂"]},{"id":"anymal-rl-locomotion-series","category":"named_model","sec":9,"tier":3,"sources":[{"title":"Learning agile and dynamic motor skills for legged robots (Hwangbo et al., Science Robotics 2019, arXiv 1901.08652)","url":"https://arxiv.org/abs/1901.08652"},{"title":"Learning Quadrupedal Locomotion over Challenging Terrain (Lee et al., Science Robotics 2020, arXiv 2010.11251)","url":"https://arxiv.org/abs/2010.11251"},{"title":"Learning robust perceptive locomotion for quadrupedal robots in the wild (Miki et al., Science Robotics 2022, arXiv 2201.08117)","url":"https://arxiv.org/abs/2201.08117"}],"as_of":"2022-01","related_ids":["rl-based-locomotion-control","actuator-modeling","teacher-student-distillation","privileged-information","terrain-curriculum","anybotics-anymal"],"name":"ANYmal 强化学习运控系列（执行器网络 / 教师-学生盲走 / 感知行走）","alt":"ANYmal RL Locomotion Series (Hwangbo 2019; Lee 2020; Miki 2022, Science Robotics)","abbr":"","aliases":["Learning agile and dynamic motor skills for legged robots","Learning quadrupedal locomotion over challenging terrain","Learning robust perceptive locomotion for quadrupedal robots in the wild"],"one_liner":"ETH 用 ANYmal 四足在 2019–2022 年发的三篇论文，把仿真 RL 运控带进野外。","explanation":"指苏黎世联邦理工机器人系统实验室（Marco Hutter 组）以四足机器人 ANYmal 为平台、发表在 Science Robotics 上的三篇论文。2019 年 Hwangbo 等提出执行器网络：用真机数据训练神经网络模拟电机响应，接入仿真缩小虚实差距，仿真训练的策略直接上真机，跑得比原纪录快 25%，还会摔倒后翻身。2020 年 Lee 等用教师-学生蒸馏：先训练能看到地形真值等特权信息的教师，再让只用本体感知的学生模仿，配合地形课程，机器人不看地形也能走泥地、雪地和碎石（盲走），该控制器被用于 DARPA 地下挑战赛。2022 年 Miki 等用带注意力的循环编码器融合高度图与本体感知，视觉不可靠时自动更多依赖本体感知。","example":"2022 年的感知行走控制器让 ANYmal 在瑞士 Etzel 山走完一条 2.2 公里、爬升 120 米、评级为「困难」的徒步路线，用时 78 分钟，与徒步规划工具给人的建议时间（76 分钟）几乎相同，途中只停下来修了一次脱落的脚套、换了电池。","related":["强化学习运控","执行器建模","教师-学生蒸馏","特权信息","地形课程","ANYmal 四足"]},{"id":"rapid-motor-adaptation","category":"named_model","sec":9,"tier":2,"sources":[{"title":"RMA: Rapid Motor Adaptation for Legged Robots 项目主页","url":"https://ashish-kmr.github.io/rma-legged-robots/"}],"as_of":"2021-07","related_ids":["sim-to-real-transfer","privileged-information","teacher-student-distillation","rl-based-locomotion-control","domain-randomization","hora"],"name":"快速运动适应","alt":"Rapid Motor Adaptation","abbr":"RMA","aliases":["RMA","快速运动自适应"],"one_liner":"让四足机器人零点几秒内察觉地形和负载变化、自动调整步态的方法。","explanation":"RMA 由 UC 伯克利和卡内基梅隆大学的 Ashish Kumar、Zipeng Fu、Deepak Pathak、Jitendra Malik 提出，发表于 RSS 2021。真实地面的软硬、摩擦、负载、电机磨损都会变，仿真里训好的策略上真机容易摔。RMA 分两部分：基础策略在仿真里训练时能读到这些环境参数（特权信息），把它们压成低维的「外参」向量来调节动作；适应模块只看最近一段关节状态和动作历史，学着反推出这个向量。部署到宇树 A1 时不做真机微调，零点几秒内就能适应沙地、泡沫垫、台阶、湿滑地面等。这种「训练时用特权信息、部署时从历史估计」的思路后来成了足式机器人仿真到现实迁移的常用套路。","example":"宇树 A1 背上突然加了负载，适应模块从最近几步关节状态的变化里估出新的外参，策略随即调整步态继续走，不需要重新训练。","related":["仿真到现实迁移","特权信息","教师-学生蒸馏","强化学习运控","域随机化","HORA（手内物体旋转 + RMA）"]},{"id":"walk-these-ways","category":"named_model","sec":9,"tier":3,"sources":[{"title":"Walk These Ways (arXiv 2212.03238)","url":"https://arxiv.org/abs/2212.03238"},{"title":"Walk These Ways 项目主页","url":"https://gmargo11.github.io/walk-these-ways/"},{"title":"Improbable-AI/walk-these-ways (GitHub)","url":"https://github.com/Improbable-AI/walk-these-ways"}],"as_of":"2022-12","related_ids":["legged-locomotion","gait","rl-based-locomotion-control","isaac-gym","unitree-go1","sim-to-real-transfer"],"name":"Walk These Ways","alt":"Walk These Ways: Tuning Robot Control for Generalization with Multiplicity of Behavior","abbr":"","aliases":["行为多样性（MoB）控制器","Multiplicity of Behavior"],"one_liner":"一个策略学会多种步态，部署时可实时调参应对新地形的四足运控。","explanation":"Walk These Ways 是 MIT Improbable AI Lab 的 Gabriel Margolis 和 Pulkit Agrawal 提出的四足运动控制方法，2022 年 12 月上线 arXiv，为 CoRL 2022 口头报告论文。强化学习训练的行走策略在训练分布外失败时，通常只能回去改奖励、改环境再重训，很慢。作者提出「行为多样性」（MoB）：训练一个同时接收速度指令和一组行为参数的策略，参数包括触地时序（可切换小跑、跳跃、踱步等步态）、步频、机身高度、机身俯仰、站姿宽度和抬脚高度。不同参数组合用不同方式完成同一任务，泛化表现也不同，部署时人或脚本可以实时切换，而不用重训。策略在 Isaac Gym 中训练，部署在宇树 Go1 上，控制频率 50 Hz，代码开源，后来常被用作四足运控的起步代码。","example":"论文展示：在打滑地面冲刺时调高步频就能成功；上楼梯需要低步频加高抬脚；被人推时降低抬脚、加宽站姿会更稳。","related":["腿足运动","步态","强化学习运控","Isaac Gym","宇树 Go1","仿真到现实迁移"]},{"id":"dreamwaq","category":"named_model","sec":9,"tier":3,"sources":[{"title":"DreamWaQ (arXiv 2301.10602)","url":"https://arxiv.org/abs/2301.10602"}],"as_of":"2023-05","related_ids":["blind-locomotion","proprioception","asymmetric-actor-critic","privileged-information","variational-autoencoder","unitree-a1"],"name":"DreamWaQ","alt":"DreamWaQ: Learning Robust Quadrupedal Locomotion With Implicit Terrain Imagination via Deep Reinforcement Learning","abbr":"","aliases":[],"one_liner":"KAIST 2023 年提出的四足盲走强化学习方法，只凭本体感知「想象」脚下地形。","explanation":"DreamWaQ 是韩国科学技术院（KAIST）Hyun Myung 团队提出的四足机器人运动控制方法，发表于 ICRA 2023。很多复杂地形行走方案依赖相机或激光雷达，但这些传感器在恶劣天气和光照下可能失灵。DreamWaQ 只用本体感知（关节角度、角速度、机身姿态等身体自身信号）做盲走：它训练一个上下文辅助估计网络（CENet），根据最近几步观测估计机身速度，并用变分自编码器推出一个代表地形情况的隐变量，相当于「隐式想象」地形；策略再结合这些估计输出关节动作。训练在 Isaac Gym 中用 4096 个域随机化并行环境完成，采用非对称演员-评论家（评论家可看仿真里的特权信息，策略只看真机能拿到的观测），然后零样本迁移到真机。","example":"在宇树 A1 四足机器人上，DreamWaQ 策略不借助任何外部感知，就能在户外一次长距离连续行走中通过台阶等复杂地形。","related":["盲走","本体感知","非对称演员-评论家","特权信息","变分自编码器","宇树 A1"]},{"id":"barkour","category":"named_model","sec":9,"tier":3,"sources":[{"title":"Barkour: Benchmarking Animal-level Agility with Quadruped Robots (arXiv 2305.14654)","url":"https://arxiv.org/abs/2305.14654"},{"title":"Barkour: Benchmarking animal-level agility with quadruped robots (Google Research Blog)","url":"https://research.google/blog/barkour-benchmarking-animal-level-agility-with-quadruped-robots/"}],"as_of":"2023-05","related_ids":["quadruped-robot","legged-locomotion","parkour","benchmark","teacher-student-distillation","rl-based-locomotion-control"],"name":"Barkour","alt":"Barkour: Benchmarking Animal-level Agility with Quadruped Robots","abbr":"","aliases":["Barkour 障碍赛","Barkour 基准"],"one_liner":"谷歌仿照狗狗敏捷赛设计的四足机器人障碍赛评测基准。","explanation":"Barkour 是谷歌研究团队（后并入 Google DeepMind）2023 年 5 月发布的四足机器人敏捷性基准，名字由 bark（狗叫）和 parkour（跑酷）拼成。它仿照犬类敏捷赛，在 5 米×5 米场地里放绕杆、A 字爬坡板、0.5 米宽跳和终点桌，按是否通过障碍、用时是否接近小型犬（约 10 秒）打出 0–1 分。团队先用强化学习分别训练行走、爬坡、跳跃等专用技能，再用教师-学生蒸馏合成一个基于 Transformer 的通用运动策略，在自研四足机器人上约 20 秒跑完全程，约为小狗速度的一半。它的意义是给「动物级敏捷」提供了可量化、可复现的比较方式。","example":"自研四足机器人在 Barkour 赛道上的典型成绩约 20 秒，小型犬约 10 秒。","related":["四足机器人","腿足运动","跑酷","基准测试","教师-学生蒸馏","强化学习运控"]},{"id":"robot-parkour-learning","category":"named_model","sec":9,"tier":3,"sources":[{"title":"arXiv 2309.05665: Robot Parkour Learning","url":"https://arxiv.org/abs/2309.05665"},{"title":"Robot Parkour Learning 项目主页","url":"https://robot-parkour.github.io/"}],"as_of":"2023-11","related_ids":["parkour","perceptive-locomotion","teacher-student-distillation","dagger","sim-to-real-transfer","extreme-parkour"],"name":"Robot Parkour Learning","alt":"Robot Parkour Learning","abbr":"","aliases":["机器狗跑酷学习"],"one_liner":"让低成本四足机器狗只靠深度相机自主爬、跳、钻、挤的跑酷策略","explanation":"Robot Parkour Learning 由上海期智研究院、清华大学、斯坦福、CMU、上海科技大学等团队在 2023 年 9 月发布，获 CoRL 2023 口头报告并进入最佳系统论文奖决赛。它让宇树 A1、Go1 这类低成本四足机器人学会攀上高障碍、跃过宽沟、钻过低矮障碍、挤过窄缝和奔跑。方法分三步：先在仿真里用强化学习预训练，允许机器人「穿过」障碍，把违反物理约束只作为软惩罚，方便探索；再恢复全部物理约束微调各项技能；最后用 DAgger 把多个专门技能蒸馏成一个只看机载深度相机的视觉策略。部署到真机后，它能根据眼前障碍自己选用合适动作，不依赖动物动作参考。","example":"机器狗面前出现一根低矮横杆，策略根据深度图自动选择压低身体钻过去，而不是尝试跳过。","related":["跑酷","感知行走","教师-学生蒸馏","DAgger（数据集聚合）","仿真到现实迁移","Extreme Parkour"]},{"id":"extreme-parkour","category":"named_model","sec":9,"tier":3,"sources":[{"title":"Extreme Parkour with Legged Robots (arXiv 2309.14341)","url":"https://arxiv.org/abs/2309.14341"},{"title":"Extreme Parkour 项目主页","url":"https://extreme-parkour.github.io/"}],"as_of":"2023-09","related_ids":["parkour","robot-parkour-learning","perceptive-locomotion","teacher-student-distillation","unitree-a1","sim-to-real-transfer"],"name":"Extreme Parkour","alt":"Extreme Parkour with Legged Robots","abbr":"","aliases":["极限跑酷","Extreme Parkour with Legged Robots"],"one_liner":"CMU 2023 年的工作：低成本四足只凭一台深度相机和单个网络完成跳高跳远等跑酷。","explanation":"Extreme Parkour 是卡内基梅隆大学 Xuxin Cheng、Deepak Pathak 等人 2023 年 9 月发布的工作，发表于 ICRA 2024。他们用的是低成本的宇树 A1 四足机器狗，电机控制不算精准，头部只有一台 Intel RealSense D435 深度相机，画面低频、抖动、有噪点。传统做法要把感知、建图、规划、控制分开精细设计，这里改成端到端：在仿真里用大规模强化学习训练一个神经网络，直接从深度图输出关节动作。训练分两步，先用仿真里才拿得到的精确地形信息训练，再蒸馏成只看深度图、还能自己决定朝哪个方向跳的策略；奖励基本统一成一条「速度方向与目标方向的内积」，不用为每种障碍单独设计。它把腿足机器人跑酷的难度上限推高了一大截，常与同期的 Robot Parkour Learning 一起被引用。","example":"A1 机器狗能跳上 0.5 米高的箱子（约为自身高度的 2 倍），跃过 0.8 米宽的沟（约为身长的 2 倍），还能只用两条前腿倒立行走。","related":["跑酷","Robot Parkour Learning","感知行走","教师-学生蒸馏","宇树 A1","仿真到现实迁移"]},{"id":"him","category":"named_model","sec":9,"tier":3,"sources":[{"title":"Hybrid Internal Model (arXiv 2312.11460)","url":"https://arxiv.org/abs/2312.11460"},{"title":"OpenRobotLab/HIMLoco (GitHub)","url":"https://github.com/OpenRobotLab/HIMLoco"}],"as_of":"2024-01","related_ids":["legged-locomotion","proprioception","blind-locomotion","contrastive-learning","rapid-motor-adaptation","shanghai-artificial-intelligence-laboratory"],"name":"HIM（混合内部模型）","alt":"Hybrid Internal Model: Learning Agile Legged Locomotion with Simulated Robot Response","abbr":"HIM","aliases":["Hybrid Internal Model","HIMLoco","混合内部模型"],"one_liner":"只用本体感知，从机器人自身响应推断地形和扰动的足式运控方法","explanation":"上海人工智能实验室 OpenRobotLab（庞江淼团队）2023 年 12 月发布，发表于 ICLR 2024，代码仓库名 HIMLoco。足式机器人的传感器只能给出不完整、带噪声的观测，地面摩擦、地形高度这类外部状态很难直接估计。HIM 借鉴经典控制里的内模控制思想，把这些外部状态当作扰动，根据机器人自身的响应去推断：用一个「混合内部嵌入」同时表示显式的机身速度和隐式的稳定性信息，并用对比学习让它贴近机器人的下一时刻状态。它只需要关节编码器和 IMU 的本体感知，省去教师-学生两阶段模仿，论文称在一张 RTX 4090 上训练约 1 小时就能让四足机器人应对多种地形和外力扰动。","example":"只靠关节编码器和 IMU 的四足机器人，在训练时没见过的地形和外力推搡下仍能保持行走。","related":["腿足运动","本体感知","盲走","对比学习","快速运动适应","上海人工智能实验室"]},{"id":"abs","category":"named_model","sec":9,"tier":3,"sources":[{"title":"Agile But Safe: Learning Collision-Free High-Speed Legged Locomotion (arXiv 2401.17583)","url":"https://arxiv.org/abs/2401.17583"},{"title":"ABS 项目页","url":"https://agile-but-safe.github.io/"},{"title":"Robotics: Science and Systems XX (RSS 2024) 论文集","url":"https://www.roboticsproceedings.org/rss20/index.html"}],"as_of":"2024-05","related_ids":["legged-locomotion","rl-based-locomotion-control","obstacle-avoidance","safe-reinforcement-learning","hamilton-jacobi-reachability-analysis","unitree-go1"],"name":"ABS（敏捷且安全的足式运动）","alt":"Agile But Safe: Learning Collision-Free High-Speed Legged Locomotion","abbr":"ABS","aliases":["Agile But Safe"],"one_liner":"CMU 2024 年的四足框架：高速奔跑，靠学到的安全值随时切到避撞策略。","explanation":"ABS 由卡内基梅隆大学 Guanya Shi、Changliu Liu 团队与苏黎世联邦理工合作，发表于 RSS 2024。以往四足避障控制器为求安全，速度多在 1 m/s 以下；只求敏捷的又不管会不会撞。ABS 用两套策略：敏捷策略负责在障碍间高速奔跑，恢复策略负责紧急避险；一个学出来的到达-规避（reach-avoid）价值网络实时估计当前是否安全，决定何时切换，并为恢复策略提供优化目标。障碍信息压缩成 11 条射线的距离，由网络从深度图预测。各模块在 Isaac Gym 训练后部署到宇树 Go1，全靠机载感知和计算，峰值速度 3.1 m/s。它是把控制理论的安全约束与强化学习运控结合的代表工作。","example":"宇树 Go1 在昏暗走廊里以平均 1.5 m/s、峰值 2.5 m/s 奔跑，迎面有人走来或有人突然抬腿挡路时，安全值一降低就切换到恢复策略躲开，安全后再切回敏捷策略继续跑。","related":["腿足运动","强化学习运控","避障","安全强化学习","HJ 可达性分析","宇树 Go1"]},{"id":"dial-mpc","category":"named_model","sec":9,"tier":3,"sources":[{"title":"Full-Order Sampling-Based MPC for Torque-Level Locomotion Control via Diffusion-Style Annealing (arXiv:2409.15610)","url":"https://arxiv.org/abs/2409.15610"},{"title":"DIAL-MPC 项目主页（LeCAR Lab）","url":"https://lecar-lab.github.io/dial-mpc/"}],"as_of":"2025","related_ids":["sampling-based-mpc","model-predictive-path-integral-control","model-predictive-control","legged-locomotion","diffusion-model","unitree-go2"],"name":"DIAL-MPC（扩散式退火足式 MPC）","alt":"Diffusion-Inspired Annealing for Legged MPC","abbr":"DIAL-MPC","aliases":["Full-Order Sampling-Based MPC for Torque-Level Locomotion Control via Diffusion-Style Annealing"],"one_liner":"免训练的足式机器人采样式 MPC：借扩散模型逐步退火的思路，实时优化全身动作。","explanation":"DIAL-MPC 由卡内基梅隆大学 Guanya Shi 团队（LeCAR Lab）于 2024 年 9 月提出，入选 ICRA 2025 最佳论文候选。足式机器人的实时最优控制通常要简化模型（如单刚体模型）或预先指定接触时序，因为完整动力学维度高、非凸。采样式 MPC（如 MPPI）每个控制周期随机采很多动作序列，在模型里推演后加权平均，但一轮采样容易噪声大或陷入局部解。作者分析了 MPPI 与单步扩散去噪的联系，改成像扩散模型那样多轮迭代、噪声逐步退火：先大范围搜索，再逐渐精细收敛。它无需训练和模型简化，直接在全阶动力学上实时做力矩级控制。","example":"在宇树 Go2 四足机器人上，DIAL-MPC 实时完成带负载的精确跳跃和轨迹跟踪；论文报告其跟踪误差比标准 MPPI 低 13.4 倍，攀爬任务比强化学习策略好约 50%，全程无需训练。","related":["采样式 MPC","模型预测路径积分控制","模型预测控制","腿足运动","扩散模型","宇树 Go2"]},{"id":"dactyl","category":"named_model","sec":9,"tier":3,"sources":[{"title":"arXiv 1808.00177: Learning Dexterous In-Hand Manipulation","url":"https://arxiv.org/abs/1808.00177"},{"title":"arXiv 1910.07113: Solving Rubik's Cube with a Robot Hand","url":"https://arxiv.org/abs/1910.07113"}],"as_of":"2019-10","related_ids":["automatic-domain-randomization","domain-randomization","sim-to-real-transfer","in-hand-manipulation","shadow-dexterous-hand","proximal-policy-optimization"],"name":"Dactyl（OpenAI 魔方灵巧手）","alt":"OpenAI Dactyl (Learning Dexterous In-Hand Manipulation / Solving Rubik's Cube with a Robot Hand)","abbr":"","aliases":["Dactyl","OpenAI 机械手玩魔方"],"one_liner":"OpenAI 只在仿真里用强化学习训练、再迁到真实五指灵巧手的项目","explanation":"OpenAI 的灵巧操作项目，硬件是 Shadow Dexterous Hand 五指灵巧手。2018 年论文《Learning Dexterous In-Hand Manipulation》让机械手在掌中把方块转到指定朝向：策略完全在仿真中用强化学习训练，靠随机化摩擦系数、物体外观等参数（域随机化）直接迁到真机，没用任何人类示范，手指步态等人类常见动作自己学了出来。2019 年《Solving Rubik's Cube with a Robot Hand》提出自动域随机化（ADR），训练中自动把随机化范围越放越大。魔方的还原步骤由 Kociemba 求解器算出，神经网络只负责手上的操作；论文报告需要 15 次面转时成功率约 60%，最难的 26 次面转约 20%。它是仿真到现实迁移和灵巧操作的标志性工作。","example":"魔方实验里，魔方的位姿由 3 路摄像头画面经 CNN 估计，各面转角由内置传感器的 Giiker 魔方读出，指尖位置由动捕系统测量，一起喂给循环神经网络策略去控制手指。","related":["自动域随机化","域随机化","仿真到现实迁移","手内操作","Shadow 灵巧手","近端策略优化"]},{"id":"hora","category":"named_model","sec":9,"tier":3,"sources":[{"title":"In-Hand Object Rotation via Rapid Motor Adaptation (arXiv 2210.04887)","url":"https://arxiv.org/abs/2210.04887"},{"title":"HORA project page","url":"https://haozhi.io/hora/"}],"as_of":"2022-10","related_ids":["rapid-motor-adaptation","in-hand-manipulation","dexterous-manipulation","privileged-information","sim-to-real-transfer","allegro-hand"],"name":"HORA（手内物体旋转 + RMA）","alt":"HORA: In-Hand Object Rotation via Rapid Motor Adaptation","abbr":"HORA","aliases":["In-Hand Object Rotation via Rapid Motor Adaptation"],"one_liner":"只靠指尖和关节本体感知，让机器手在手里持续转动各种物体的强化学习方法","explanation":"UC Berkeley 与 Meta AI 的 Haozhi Qi、Jitendra Malik 等人 2022 年 10 月发布，发表于 CoRL 2022。目标是让 Allegro 四指灵巧手只用指尖把物体绕一个轴持续转动。做法沿用快速运动适应（RMA）：先在仿真里用强化学习训练一个能看到物体大小、质量、摩擦等特权信息的基础策略，再训练一个适应模块，只从最近一段关节本体感知历史里推断这些物体属性。策略只用圆柱体在仿真中训练，不经微调就能部署到真机，转动大小、形状、重量各异的物体，稳定的「指步态」在训练中自然涌现。它是手内操作仿真到现实迁移的代表工作。","example":"在仿真中只见过圆柱体的策略，部署到真实 Allegro 手上后，不看摄像头也能转动形状、重量各不相同的日常物体。","related":["快速运动适应","手内操作","灵巧操作","特权信息","仿真到现实迁移","Allegro 灵巧手"]},{"id":"visual-dexterity","category":"named_model","sec":9,"tier":3,"sources":[{"title":"Visual Dexterity: In-Hand Reorientation of Novel and Complex Object Shapes (arXiv 2211.11744)","url":"https://arxiv.org/abs/2211.11744"},{"title":"Visual Dexterity 项目主页","url":"https://taochenshh.github.io/projects/visual-dexterity"}],"as_of":"2023-11","related_ids":["in-hand-manipulation","dexterous-manipulation","teacher-student-distillation","sim-to-real-transfer","dactyl","hora"],"name":"Visual Dexterity（视觉手内重定向）","alt":"Visual Dexterity: In-Hand Reorientation of Novel and Complex Object Shapes","abbr":"","aliases":["视觉灵巧性","Visual Dexterity"],"one_liner":"MIT 用一台深度相机让低成本灵巧手在空中实时翻转没见过的物体。","explanation":"Visual Dexterity 是 MIT CSAIL Improbable AI Lab 的 Tao Chen、Pulkit Agrawal 等人的工作，2022 年 11 月上线 arXiv，2023 年刊于 Science Robotics。手内重定向指不借助桌面，只靠手指把物体转到任意目标朝向，难在接触复杂、物体会被手挡住。它先在仿真里用强化学习训练一个能读取物体真实状态的「教师」，再蒸馏给只看深度相机点云的「学生」（用稀疏卷积网络处理，约 12 Hz 实时控制）。训练用了约 150 个物体，硬件是开源的 D'Claw 三指（9 自由度）或四指手，整套不到 5000 美元，还能在手掌朝下、要对抗重力时完成翻转，中位用时约 7 秒。它说明仿真训练加视觉输入可以泛化到新形状物体，是 Dactyl 之后手内操作的代表工作。","example":"机器人手掌朝下悬空握着一只训练时没见过的塑料鸭子，只凭深度相机点云把它转到指定姿态；鸭子在 56% 的试次中掉落，没掉落时约 75% 能转到误差 23 度以内。","related":["手内操作","灵巧操作","教师-学生蒸馏","仿真到现实迁移","Dactyl（OpenAI 魔方灵巧手）","HORA（手内物体旋转 + RMA）"]},{"id":"dextrah-g","category":"named_model","sec":9,"tier":3,"sources":[{"title":"DextrAH-G (arXiv:2407.02274)","url":"https://arxiv.org/abs/2407.02274"},{"title":"DextrAH-G 项目主页","url":"https://sites.google.com/view/dextrah-g"}],"as_of":"2024-10","related_ids":["geometric-fabrics","dexterous-manipulation","teacher-student-distillation","privileged-information","sim-to-real-transfer","isaac-gym"],"name":"DextrAH-G","alt":"DextrAH-G: Pixels-to-Action Dexterous Arm-Hand Grasping with Geometric Fabrics","abbr":"","aliases":[],"one_liner":"英伟达的臂手灵巧抓取系统：全在仿真里训练，只看深度图就能连续抓取搬运。","explanation":"DextrAH-G 是英伟达联合斯坦福、犹他大学、伯克利研究者于 2024 年 7 月发布的灵巧抓取方法，发表于 CoRL 2024。它控制 KUKA 机械臂加 Allegro 灵巧手共 23 个电机，难点在于动作维度高、仿真到真机有差距、还要防碰撞和守关节限位。做法分三步：在 Isaac Gym 里用强化学习训练能看到物体真实位姿等特权信息的教师策略；蒸馏成只看深度图的学生策略；零样本部署到真机。关键是策略输出不直接下发电机，而是交给几何织物（Geometric Fabrics，英伟达的反应式运动生成方法）执行，由它负责避障、限位和保持姿态，既保护硬件也便于强化学习探索。","example":"在装箱测试中，DextrAH-G 只靠一台固定在桌边的 RealSense 深度相机连续抓取、搬运物体，256 次尝试成功率 87%，每次抓放循环约 10.7 秒。","related":["Geometric Fabrics","灵巧操作","教师-学生蒸馏","特权信息","仿真到现实迁移","Isaac Gym"]},{"id":"dexteritygen","category":"named_model","sec":9,"tier":3,"sources":[{"title":"DexterityGen: Foundation Controller for Unprecedented Dexterity (arXiv:2502.04307)","url":"https://arxiv.org/abs/2502.04307"},{"title":"DexGen 项目主页","url":"https://zhaohengyin.github.io/dexteritygen/"}],"as_of":"2025-02","related_ids":["dexterous-manipulation","in-hand-manipulation","reinforcement-learning","diffusion-model","teleoperation","meta-fundamental-ai-research"],"name":"DexterityGen","alt":"DexterityGen: Foundation Controller for Unprecedented Dexterity","abbr":"DexGen","aliases":["DexGen"],"one_liner":"Meta 与伯克利的灵巧手底层控制器：把人粗略的遥操作指令变成精细手指动作。","explanation":"DexterityGen（简称 DexGen）是 Meta FAIR 与加州大学伯克利分校团队 2025 年 2 月发布的灵巧手控制方法。灵巧手自由度高，人直接遥操作很难稳定完成手内转笔、拧螺丝这类精细动作；纯强化学习又难学会长程复杂任务。它的分工是：先在仿真里用强化学习训练大量手内旋转、平移等运动基元，收集约 10¹⁰ 条状态转移；再用这些数据训练一个扩散模型当「基础控制器」，根据当前观测生成指尖关键点运动，由逆动力学模型换算成关节指令。部署时上层（如人的遥操作）只给粗略意图，DexGen 把它细化成稳定的灵巧动作，并能拒绝危险动作。","example":"在 Franka 机械臂 + Allegro 灵巧手上，操作员戴 Manus 数据手套遥操作，借助 DexGen 完成调整和使用笔、注射器、螺丝刀等动作；论文报告物体保持不掉落的时长比基线提升 10–100 倍。","related":["灵巧操作","手内操作","强化学习","扩散模型","遥操作","Meta FAIR"]},{"id":"google-deepmind-table-tennis-robot","category":"named_model","sec":9,"tier":3,"sources":[{"title":"Achieving Human Level Competitive Robot Table Tennis (arXiv 2408.03906)","url":"https://arxiv.org/abs/2408.03906"},{"title":"Competitive Robot Table Tennis 项目页","url":"https://sites.google.com/view/competitive-robot-table-tennis/home"}],"as_of":"2024-08","related_ids":["sim-to-real-transfer","hierarchical-architecture","reinforcement-learning","dynamic-manipulation","mujoco","google-deepmind"],"name":"DeepMind 乒乓球机器人","alt":"Achieving Human Level Competitive Robot Table Tennis (Google DeepMind)","abbr":"","aliases":["谷歌乒乓球机器人","Robot Table Tennis"],"one_liner":"DeepMind 2024 年的乒乓球机器人，首个在比赛中打到业余人类水平的学习型机器人。","explanation":"这项工作由谷歌 DeepMind 在 2024 年 8 月发布，论文称它是第一个在竞技乒乓球中达到业余人类水平的学习型机器人。硬件是一台 6 自由度 ABB IRB 1100 机械臂，装在两条直线导轨上可前后左右移动，两台 125 Hz 相机追踪球。控制分两层：底层是一组专门技能（如正手、反手），每个技能附带「技能描述」，记录它擅长和不擅长什么；高层控制器根据来球和对手统计选择技能，并在比赛中实时适应对手。技能在 MuJoCo 仿真里用强化学习训练，零样本部署到真机，再把真实对打的来球分布加回仿真，迭代形成训练课程。它与 29 位此前没交过手的人类选手比赛，胜 45%：对初学者全胜，对中级选手胜 55%，对高级选手全负。","example":"面对一位从没交过手的对手，高层控制器在比赛中持续统计每个底层技能的回球成功率，越来越多地选用对这个对手有效的技能。","related":["仿真到现实迁移","分层架构","强化学习","动态操作","MuJoCo","谷歌 DeepMind"]},{"id":"deepmimic","category":"named_model","sec":10,"tier":2,"sources":[{"title":"DeepMimic (arXiv 1804.02717)","url":"https://arxiv.org/abs/1804.02717"}],"as_of":"2018-04","related_ids":["motion-tracking","reinforcement-learning","reference-state-initialization","early-termination","adversarial-motion-priors","motion-capture"],"name":"DeepMimic","alt":"DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills","abbr":"","aliases":[],"one_liner":"用强化学习让仿真角色模仿动捕片段，学会空翻、武术等物理上可行的动作","explanation":"加州大学伯克利分校与不列颠哥伦比亚大学的彭学斌（Xue Bin Peng）等人 2018 年发表于 SIGGRAPH。纯靠强化学习训练的仿真角色动作常常僵硬、不像人。DeepMimic 加了模仿奖励：角色在物理仿真里每一步的姿态越接近参考动作片段（如动捕数据）得分越高，还可叠加任务奖励。它的两个训练技巧后来成了标配：参考状态初始化，即从参考动作的随机一帧开始回合；提前终止，即摔倒就结束回合。它让人形、Atlas 机器人、恐龙等角色学会了行走、翻腾和武术动作。如今人形机器人的运动跟踪路线，如 ASAP、BeyondMimic，都延续了这套思路。","example":"给仿真人形角色一段人类后空翻的动捕片段，训练后它能在物理仿真里完成后空翻并站稳。","related":["运动跟踪","强化学习","参考状态初始化","提前终止","对抗运动先验","动作捕捉"]},{"id":"ase","category":"named_model","sec":10,"tier":3,"sources":[{"title":"ASE: Large-Scale Reusable Adversarial Skill Embeddings for Physically Simulated Characters (arXiv 2205.01906)","url":"https://arxiv.org/abs/2205.01906"},{"title":"ASE 项目页（Xue Bin Peng）","url":"https://xbpeng.github.io/projects/ASE/index.html"}],"as_of":"2022-07","related_ids":["adversarial-motion-priors","generative-adversarial-imitation-learning","unsupervised-skill-discovery","latent-space","behavior-foundation-model","isaac-gym"],"name":"ASE（对抗技能嵌入）","alt":"ASE: Large-Scale Reusable Adversarial Skill Embeddings for Physically Simulated Characters","abbr":"ASE","aliases":["Adversarial Skill Embeddings","对抗技能嵌入"],"one_liner":"伯克利与 NVIDIA 2022 年的方法：从动捕片段学可复用的技能隐空间。","explanation":"ASE 由加州大学伯克利分校和 NVIDIA 的彭学斌（Xue Bin Peng）、Sergey Levine、Sanja Fidler 等提出，发表于 SIGGRAPH 2022。仿真角色动画里，每个新任务常要从零训练策略，走、跑这些基本动作一遍遍重学。ASE 分两层：预训练时，在一批未标注、未切分的动作片段上训练以隐变量 z 为条件的低层策略，用对抗模仿学习（判别器判断动作像不像数据里的人）保证动作自然，再用无监督技能发现让不同的 z 对应不同技能；做下游任务时冻结低层策略，只训练输出 z 的高层策略，配简单奖励即可。借助 Isaac Gym 并行仿真，低层策略用了超过 100 亿个样本。它是 AMP（对抗运动先验）的后续工作。","example":"一个持剑盾的仿真人形角色，先在约 30 分钟、187 段动作片段上预训练技能隐空间；之后只给「跑到目标处把它击倒」的奖励，高层策略就能组合出跑动、挥剑、击中的连贯动作。","related":["对抗运动先验","生成对抗模仿学习","无监督技能发现","潜在空间","行为基础模型","Isaac Gym"]},{"id":"mdm","category":"named_model","sec":10,"tier":3,"sources":[{"title":"arXiv 2209.14916: Human Motion Diffusion Model","url":"https://arxiv.org/abs/2209.14916"},{"title":"MDM 项目主页","url":"https://guytevet.github.io/mdm-page/"}],"as_of":"2022-09","related_ids":["diffusion-model","human-motion-generation","humanml3d","classifier-free-guidance","motion-retargeting","motion-tracking"],"name":"MDM（人体动作扩散模型）","alt":"MDM: Human Motion Diffusion Model","abbr":"MDM","aliases":["Motion Diffusion Model","人体动作扩散模型"],"one_liner":"用扩散模型从文字或动作类别生成 3D 人体动作序列的代表性工作。","explanation":"MDM（Human Motion Diffusion Model）是以色列特拉维夫大学 Guy Tevet、Amit Bermano 等人 2022 年 9 月发布的工作，发表于 ICLR 2023。它把图像生成里的扩散模型用到人体动作上：以 Transformer 为网络，从噪声逐步去噪出一段关节动作序列，并用无分类器引导按文字或动作类别控制生成。一个关键设计是每一步直接预测干净动作而不是噪声，这样就能加上关节位置、速度和脚部接触等几何损失，让动作更自然。它在 HumanML3D、KIT 等文生动作基准上取得当时最好结果，成为后续大量动作生成工作的基线。在具身智能里，这类模型生成的人体动作可经动作重定向后，交给人形机器人的运动跟踪控制器执行。","example":"输入「一个人向前走几步然后坐下」，MDM 生成一段对应的 3D 人体骨架动作。","related":["扩散模型","人体动作生成模型（文本生成动作）","HumanML3D 数据集","无分类器引导","动作重定向","运动跟踪"]},{"id":"perpetual-humanoid-control","category":"named_model","sec":10,"tier":3,"sources":[{"title":"arXiv 2305.06456: Perpetual Humanoid Control for Real-time Simulated Avatars","url":"https://arxiv.org/abs/2305.06456"},{"title":"GitHub: ZhengyiLuo/PHC","url":"https://github.com/ZhengyiLuo/PHC"}],"as_of":"2026-09","related_ids":["motion-tracking","deepmimic","maskedmimic","amass","h2o","catastrophic-forgetting"],"name":"PHC","alt":"Perpetual Humanoid Control","abbr":"PHC","aliases":["永续人形控制","Perpetual Humanoid Control for Real-time Simulated Avatars"],"one_liner":"在物理仿真里跟踪海量人体动作、摔倒后能自己爬起的人形控制器","explanation":"卡内基梅隆大学与 Meta Reality Labs 的罗正宜（Zhengyi Luo）等人在 ICCV 2023 提出的基于物理的人形动作模仿控制器，在 Isaac Gym 中用强化学习训练。它要让仿真人形实时跟踪来自视频姿态估计或文本生成的、带噪声的参考动作，而且不借助外加的稳定力。核心是渐进式乘法控制策略（PMCP）：遇到学不会的难动作就新增子网络来分担，从而学下 AMASS 动捕库约一万段动作，又不发生灾难性遗忘；论文报告训练集成功率 98.9%、测试集 96.4%。它还学会了摔倒后自然起身、接着跟踪。开源代码后来加入了宇树 H1、G1 等人形模型，后续的 PHC+、PULSE 等工作都建立在它之上。","example":"用单目视频估计出的人体姿态实时驱动仿真角色；角色中途被绊倒时，PHC 让它自己站起来、走回参考动作的位置继续跟。","related":["运动跟踪","DeepMimic","MaskedMimic","AMASS 人体动捕数据集","H2O（人到人形）","灾难性遗忘"]},{"id":"maskedmimic","category":"named_model","sec":10,"tier":3,"sources":[{"title":"arXiv 2409.14393: MaskedMimic","url":"https://arxiv.org/abs/2409.14393"},{"title":"NVIDIA Research: MaskedMimic 项目页","url":"https://research.nvidia.com/labs/par/maskedmimic/"}],"as_of":"2024-09","related_ids":["motion-tracking","perpetual-humanoid-control","deepmimic","conditional-variational-autoencoder","dagger","protomotions"],"name":"MaskedMimic","alt":"MaskedMimic: Unified Physics-Based Character Control Through Masked Motion Inpainting","abbr":"","aliases":[],"one_liner":"英伟达提出的统一物理人形控制器，把各种控制方式都当作补全缺失动作。","explanation":"MaskedMimic 是英伟达研究院 Chen Tessler、Xue Bin Peng 等人 2024 年 9 月发布的工作，发表于 SIGGRAPH Asia 2024（ACM TOG）。过去在物理仿真里控制人形角色，跟踪动作、走路、伸手够物、按文字做动作往往各训一个策略、各写一套奖励。MaskedMimic 把它们统一成动作补全问题：只给出部分约束（几个关节的目标位置、若干关键帧、一句文字或要交互的物体），其余被遮住，模型生成完整且物理可行的全身动作。训练分两步：先用强化学习在 AMASS 动捕数据上训练一个完整跟踪参考动作的教师控制器，再用 DAgger 式行为克隆蒸馏成能处理随机遮挡输入的条件 VAE 学生策略。代码收录在英伟达开源框架 ProtoMotions 中。","example":"只给出 VR 头显和两个手柄对应的头、手目标位置，其余关节全部遮住，MaskedMimic 生成站立、走动、伸手的完整全身动作。","related":["运动跟踪","PHC","DeepMimic","条件变分自编码器","DAgger（数据集聚合）","ProtoMotions"]},{"id":"meta-motivo","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Zero-Shot Whole-Body Humanoid Control via Behavioral Foundation Models (arXiv 2504.11054)","url":"https://arxiv.org/abs/2504.11054"},{"title":"Meta FAIR: Sharing new research, models, and datasets (2024-12-12)","url":"https://ai.meta.com/blog/meta-fair-updates-agents-robustness-safety-architecture/"},{"title":"facebookresearch/metamotivo (GitHub)","url":"https://github.com/facebookresearch/metamotivo"}],"as_of":"2025-04","related_ids":["behavior-foundation-model","unsupervised-skill-discovery","motion-tracking","zero-shot","bfm-zero","adversarial-motion-priors"],"name":"Meta Motivo（人形行为基础模型）","alt":"Meta Motivo (FB-CPR; Zero-Shot Whole-Body Humanoid Control via Behavioral Foundation Models)","abbr":"","aliases":["FB-CPR","Forward-Backward Representations with Conditional-Policy Regularization"],"one_liner":"Meta 的仿真人形行为基础模型，不用再训练就能做动作跟踪、到达姿态和按奖励行动","explanation":"Meta FAIR 在 2024 年 12 月发布，论文发表于 ICLR 2025，官方称其为首个人形行为基础模型。它控制的是物理仿真（HumEnv 环境）里的虚拟人形角色，不是真实机器人。核心算法 FB-CPR 以前向-后向表示为基础，这是一种把状态、奖励和策略编码进同一个潜在空间的无监督强化学习方法；再加一个判别器，约束策略去贴近没有动作标签的动捕数据，让学到的动作既像人又能泛化。预训练完成后，给一段参考动作、一个目标姿态或一个奖励函数，都能直接得到对应策略，不需要额外训练或规划；对重力、风、外力推搡等变化也有一定鲁棒性。代码和参数量从 2450 万到 2.88 亿的几个模型均已开源。","example":"给同一个预训练模型分别输入一段动捕参考动作、一个目标站姿或一个「原地转圈」的奖励函数，它都能直接控制仿真人形完成，不需要针对每个任务重新训练。","related":["行为基础模型","无监督技能发现","运动跟踪","零样本","BFM-Zero","对抗运动先验"]},{"id":"real-world-humanoid-locomotion-with-reinforcement-learning","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Real-World Humanoid Locomotion with Reinforcement Learning (arXiv 2303.03381)","url":"https://arxiv.org/abs/2303.03381"},{"title":"Project page","url":"https://learning-humanoid-locomotion.github.io/"}],"as_of":"2024","related_ids":["rl-based-locomotion-control","sim-to-real-transfer","teacher-student-distillation","domain-randomization","agility-robotics-digit","humanoid-locomotion-as-next-token-prediction"],"name":"真实世界人形强化学习行走","alt":"Real-World Humanoid Locomotion with Reinforcement Learning (Radosavovic et al., Science Robotics 2024)","abbr":"","aliases":["Real-World Humanoid Locomotion with RL"],"one_liner":"仿真中强化学习训练 Transformer 控制器，零样本让人形机器人户外行走","explanation":"UC Berkeley 的 Ilija Radosavovic、Jitendra Malik 等人 2023 年 3 月发布，2024 年发表于 Science Robotics。以往人形行走多靠经典控制器，难适应新环境。这项工作用因果 Transformer 做控制器，输入过去一段本体感知观测和动作，输出下一步动作，靠历史信息「在上下文中」适应地形，无需更新参数。训练全在 Isaac Gym 仿真中：先用特权信息训练教师策略，再结合模仿教师与强化学习训练学生策略，配合域随机化，再零样本部署到 Agility 的 Digit 人形机器人上。它能在多种户外地形行走并抗推扰，是学习型人形运控的早期代表作。","example":"Digit 在训练中从没见过的户外草地和塑胶跑道上行走，被人从侧面推一把也能稳住。","related":["强化学习运控","仿真到现实迁移","教师-学生蒸馏","域随机化","Agility Digit 人形机器人","人形行走即下一个 token 预测"]},{"id":"op3-soccer","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Learning Agile Soccer Skills for a Bipedal Robot with Deep Reinforcement Learning (arXiv 2304.13653)","url":"https://arxiv.org/abs/2304.13653"},{"title":"OP3 Soccer 项目页","url":"https://sites.google.com/view/op3-soccer"}],"as_of":"2024-04","related_ids":["reinforcement-learning","sim-to-real-transfer","domain-randomization","self-play","policy-distillation","google-deepmind"],"name":"OP3 足球（DeepMind 双足踢球）","alt":"Learning Agile Soccer Skills for a Bipedal Robot with Deep Reinforcement Learning (OP3 Soccer)","abbr":"","aliases":["OP3 Soccer","DeepMind 机器人足球","Learning Agile Soccer Skills"],"one_liner":"DeepMind 用深度强化学习教小型人形机器人 OP3 一对一踢足球。","explanation":"这是 Google DeepMind 的工作，2023 年 4 月上 arXiv，2024 年 4 月发表于 Science Robotics。机器人是 Robotis 公司的 OP3，一款有 20 个可驱动关节的低成本小型人形机器人，任务是简化的一对一足球。训练全在 MuJoCo 仿真中进行：先分别训练起身、射门等技能，再蒸馏进一个策略，并与自己的历史版本对打（自博弈）继续提升。靠较高的控制频率、有针对性的动力学随机化和训练时施加扰动，策略零样本迁移到真机。与脚本控制器相比，行走快 181%、转身快 302%、起身时间少 63%、踢球快 34%。它是深度强化学习让双足机器人做敏捷全身动作的早期代表。","example":"比赛中机器人会预判球的走向、侧身挡住对手的射门；被撞倒后能迅速爬起来继续追球。","related":["强化学习","仿真到现实迁移","域随机化","自博弈","策略蒸馏","谷歌 DeepMind"]},{"id":"humanoid-locomotion-as-next-token-prediction","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Humanoid Locomotion as Next Token Prediction (arXiv 2402.19469)","url":"https://arxiv.org/abs/2402.19469"},{"title":"Project page","url":"https://humanoid-next-token-prediction.github.io/"}],"as_of":"2024-02","related_ids":["next-token-prediction","autoregressive-decoding","action-free-video","bipedal-locomotion","agility-robotics-digit","real-world-humanoid-locomotion-with-reinforcement-learning"],"name":"人形行走即下一个 token 预测","alt":"Humanoid Locomotion as Next Token Prediction","abbr":"","aliases":["Humanoid Locomotion as Next Token Prediction"],"one_liner":"把人形机器人行走当成语言模型式的「预测下一个 token」问题来学","explanation":"UC Berkeley 的 Ilija Radosavovic、Koushil Sreenath、Jitendra Malik 等 2024 年 2 月发布。它把真实人形机器人控制写成类似语言建模的问题：用因果 Transformer 对观测和动作组成的传感器运动轨迹做自回归预测，每个 token 预测同一模态的下一个 token。这样缺少动作标签的数据（如从人类视频里提取的动作轨迹）也能参与训练。数据来自已有神经网络策略和基于模型控制器的仿真轨迹、人体动作捕捉数据和 YouTube 人类视频。模型部署到 Agility Robotics 的全尺寸人形 Digit 上，零样本在旧金山街头行走；只用 27 小时行走数据也能迁移到真机，还能泛化到训练中没有的倒退走指令。","example":"训练数据里没有倒退走的指令，模型部署后仍能按指令让 Digit 向后走。","related":["下一个 token 预测","自回归解码","无动作标签视频","双足行走","Agility Digit 人形机器人","真实世界人形强化学习行走"]},{"id":"humanoid-parkour-learning","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Humanoid Parkour Learning (arXiv 2406.10759)","url":"https://arxiv.org/abs/2406.10759"},{"title":"Humanoid Parkour Learning project page","url":"https://humanoid4parkour.github.io/"}],"as_of":"2024-09","related_ids":["parkour","perceptive-locomotion","teacher-student-distillation","dagger","unitree-h1","robot-parkour-learning"],"name":"人形跑酷学习","alt":"Humanoid Parkour Learning","abbr":"","aliases":["Humanoid Parkour Learning","人形机器人跑酷"],"one_liner":"让人形机器人靠头部深度相机自主跳台、跨沟、跨栏的端到端跑酷策略","explanation":"上海期智研究院、上海科技大学与清华大学的 Ziwen Zhuang、Shenzhe Yao、Hang Zhao（赵行）2024 年 6 月发布，发表于 CoRL 2024，是同组四足工作 Robot Parkour Learning 的人形版。它不需要任何人体动作参考，用强化学习训练基于视觉的端到端全身控制策略：先在带分形噪声的地形上训练平地行走（噪声会自然促使机器人抬脚），再训练能直接读取地形真值的「特权」跑酷策略覆盖 10 类障碍，最后用 DAgger 蒸馏成只看头部深度相机图像的学生策略。部署在宇树 H1 上，可跳上 0.42 m 高台、跨越 0.8 m 宽沟、在野外以 1.8 m/s 奔跑，并能在只给转向指令时自主选择跑酷动作。","example":"操作员只用摇杆控制转向，H1 看到前方高台会自己选择起跳动作跳上去。","related":["跑酷","感知行走","教师-学生蒸馏","DAgger（数据集聚合）","宇树 H1","Robot Parkour Learning"]},{"id":"denoising-world-model-learning","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Advancing Humanoid Locomotion: Mastering Challenging Terrains with Denoising World Model Learning (arXiv:2408.14472)","url":"https://arxiv.org/abs/2408.14472"}],"as_of":"2024-08","related_ids":["asymmetric-actor-critic","privileged-information","sim-to-real-transfer","domain-randomization","blind-locomotion","robotera"],"name":"DWL（去噪世界模型学习）","alt":"Denoising World Model Learning (Advancing Humanoid Locomotion: Mastering Challenging Terrains with DWL)","abbr":"DWL","aliases":["去噪世界模型学习","Denoising World Model Learning"],"one_liner":"只靠本体感知就让人形机器人走雪地、上下楼梯的端到端强化学习行走框架。","explanation":"星动纪元（RobotEra）与清华大学、上海期智研究院的陈建宇团队 2024 年提出，获 RSS 2024 最佳论文提名。人形机器人从仿真迁到真机，会遇到环境扰动、动力学建模不准、传感器噪声，以及线速度、接触力这类根本测不到的量。DWL 把这些都当作加在真实状态上的噪声：仿真训练时给观测加噪、遮掉测不到的量，用 GRU 编码器从一段历史观测中提取隐状态，再解码还原出包含摩擦系数、外力、地形高度等特权信息的完整状态，相当于一个「去噪」的世界模型；策略基于隐状态用 PPO 训练，评论家可以直接看完整状态（非对称演员-评论家）。策略不用相机和激光雷达，零样本迁移到 XBot-S（1.2 米）和 XBot-L（1.65 米）上，同一套参数走过雪地、坡道、楼梯和崎岖地面。","example":"室内测试中，DWL 在 10 厘米高台阶上楼、下楼、坡道和不平地面上的成功率都是 100%，去掉去噪损失的 PPO 上楼只有 20%。","related":["非对称演员-评论家","特权信息","仿真到现实迁移","域随机化","盲走","星动纪元"]},{"id":"hugwbc","category":"named_model","sec":10,"tier":3,"sources":[{"title":"HugWBC (arXiv 2502.03206)","url":"https://arxiv.org/abs/2502.03206"},{"title":"HugWBC project page","url":"https://hugwbc.github.io/"},{"title":"apexrl/HugWBC (GitHub)","url":"https://github.com/apexrl/HugWBC"}],"as_of":"2025-04","related_ids":["whole-body-control","learning-based-whole-body-control","gait","loco-manipulation","unitree-h1","hover"],"name":"HugWBC","alt":"HugWBC: A Unified and General Humanoid Whole-Body Controller for Versatile Locomotion","abbr":"","aliases":["HugWBC 人形统一通用全身控制器"],"one_liner":"一个策略让人形机器人走、跑、跳、单脚蹦，并能调步频、抬脚高度的全身控制器","explanation":"上海交通大学（张伟楠组）与上海人工智能实验室（庞江淼）等 2025 年 2 月发布，发表于 RSS 2025。多数人形行走控制器只会一种固定走法，参数不能调，也难以扩展。HugWBC 设计了一套统一的指令空间：除了速度，还能指定步态（走/跑、跳跃、站立、单脚跳）、步频、抬脚高度、身体高度、腰部转动和身体俯仰。训练时加入对称性损失，并用「干预训练」让上半身可以被外部信号（如遥操作）接管，从而支持边走边操作。策略在 Isaac Gym 中训练，部署在宇树 H1 上，代码开源。","example":"遥控器让 H1 以指定步频和抬脚高度行走，同时操作员通过遥操作接管它的双臂去搬箱子。","related":["全身控制","学习型全身控制","步态","运动操作一体化","宇树 H1","HOVER"]},{"id":"host","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Learning Humanoid Standing-up Control across Diverse Postures (arXiv 2502.08378)","url":"https://arxiv.org/abs/2502.08378"},{"title":"HoST project page","url":"https://taohuang13.github.io/humanoid-standingup.github.io/"}],"as_of":"2025-04","related_ids":["fall-recovery","rl-based-locomotion-control","curriculum-learning","sim-to-real-transfer","unitree-g1","shanghai-artificial-intelligence-laboratory"],"name":"HoST（人形起身）","alt":"HoST: Learning Humanoid Standing-up Control across Diverse Postures","abbr":"HoST","aliases":["Humanoid Standing-up Control","人形机器人起身控制"],"one_liner":"用强化学习从零学会让人形机器人从各种姿势自己站起来的控制框架","explanation":"上海人工智能实验室（庞江淼团队）联合上海交大、港大、浙大、港中文 2025 年 2 月发布，发表于 RSS 2025 并获最佳系统论文提名。它解决人形机器人摔倒后怎么自己站起来：以往方法要么只在仿真里跑、忽略真实电机限制，要么依赖针对某种地面预先设计的起身轨迹。HoST 不用参考动作，在多种仿真地形上用强化学习从零学习，用多个价值网络（critic）分别评估不同奖励组，配合课程学习；再加平滑正则和隐式速度上限，避免真机上抖动和动作过猛。训练后直接部署到宇树 G1，在室内外多种场景都能从躺卧、靠坐等姿势起身，是跌倒恢复方向的代表工作。","example":"宇树 G1 躺在地上或靠坐在墙边时，HoST 策略能直接控制它自己站起来，不需要人扶或吊架。","related":["跌倒恢复（摔倒起身）","强化学习运控","课程学习","仿真到现实迁移","宇树 G1","上海人工智能实验室"]},{"id":"exbody","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Expressive Whole-Body Control for Humanoid Robots (arXiv 2402.16796)","url":"https://arxiv.org/abs/2402.16796"},{"title":"ExBody 项目页","url":"https://expressive-humanoid.github.io/"}],"as_of":"2024-07","related_ids":["exbody2","motion-tracking","whole-body-control","motion-retargeting","unitree-h1","massively-parallel-reinforcement-learning"],"name":"ExBody","alt":"Expressive Whole-Body Control for Humanoid Robots","abbr":"ExBody","aliases":["Exbody","Expressive Whole-Body Control","表现力全身控制"],"one_liner":"UCSD 2024 年提出：人形机器人上身模仿人类动作，双腿只负责稳稳跟速度。","explanation":"ExBody 由 UC 圣地亚哥王小龙团队于 2024 年 2 月发布，发表于 RSS 2024，是较早把大规模人类动捕数据用于真实人形机器人全身控制的工作之一。难点在于人和机器人的自由度、力量差别很大，让整台机器人逐帧模仿人容易摔。ExBody 的办法是分工：上半身模仿参考动作的关节角和关键点，双腿不要求逐帧模仿，只需稳健地跟随参考动作给出的整体速度和朝向。数据取自 CMU 动捕库约 780 段片段，重定向到 19 自由度的宇树 H1 上，在 Isaac Gym 中用大规模并行强化学习训练后迁移到真机。后续的 ExBody2 等工作常拿它作对比基线。","example":"真机上，H1 能一边走一边做出不同风格的动作，比如模仿僵尸走、和人击掌握手，甚至和人一起跳舞。","related":["ExBody2","运动跟踪","全身控制","动作重定向","宇树 H1","大规模并行强化学习"]},{"id":"exbody2","category":"named_model","sec":10,"tier":3,"sources":[{"title":"ExBody2: Advanced Expressive Humanoid Whole-Body Control (arXiv 2412.13196)","url":"https://arxiv.org/abs/2412.13196"},{"title":"ExBody2 项目页","url":"https://exbody2.github.io/"}],"as_of":"2025-03","related_ids":["exbody","motion-tracking","whole-body-control","teacher-student-distillation","privileged-information","omnih2o"],"name":"ExBody2","alt":"ExBody2: Advanced Expressive Humanoid Whole-Body Control","abbr":"ExBody2","aliases":["Exbody2","Advanced Expressive Whole-Body Control"],"one_liner":"UCSD 等提出的人形全身动作跟踪方法，让宇树 G1 能走、蹲、跳舞。","explanation":"ExBody2 由 UC 圣地亚哥王小龙组联合 UC 伯克利、MIT 于 2024 年 12 月发布，是 ExBody 的升级版。ExBody 只让上半身模仿动作，ExBody2 改成全身跟踪，主要做了三件事：一是自动筛数据，先用基础策略把 CMU 动捕数据跑一遍，按跟踪误差剔除机器人做不到的动作，在可行性与多样性之间取平衡；二是教师-学生蒸馏，教师策略在仿真里使用特权信息（真机拿不到的状态），再蒸馏成只用机载观测的学生策略；三是在局部坐标系里跟踪关键点，并与整体速度跟踪解耦。作者还发现，先训通用策略再针对某类动作微调，精度更高。","example":"在宇树 G1 上，ExBody2 能跟着参考动作跳恰恰舞；针对舞蹈数据微调出的专用策略，关节跟踪误差明显低于通用策略和从零训练的策略。","related":["ExBody","运动跟踪","全身控制","教师-学生蒸馏","特权信息","OmniH2O"]},{"id":"h2o","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation (arXiv 2403.04436)","url":"https://arxiv.org/abs/2403.04436"},{"title":"H2O 项目页","url":"https://human2humanoid.com/"}],"as_of":"2024-10","related_ids":["whole-body-teleoperation","motion-retargeting","motion-tracking","omnih2o","amass","unitree-h1"],"name":"H2O（人到人形）","alt":"H2O: Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation","abbr":"H2O","aliases":["Human to Humanoid"],"one_liner":"CMU 2024 年的人形遥操作框架，用一个 RGB 相机让机器人实时模仿人的全身动作。","explanation":"H2O 由卡内基梅隆大学石冠亚、Changliu Liu、Kris Kitani 等团队 2024 年 3 月发布，发表于 IROS 2024（口头报告），一作为 Tairan He 和 Zhengyi Luo。它只用一个普通 RGB 相机：姿态估计器 HybrIK 从画面实时算出人体姿态，再由强化学习训练的全身跟踪策略驱动宇树 H1 照着做。关键一步是「sim-to-data」：先把 AMASS 人体动捕数据集里约 1 万段动作重定向到 H1 身上，再在仿真里用一个能看到特权信息的模仿策略去试做，把机器人做不到的动作筛掉，剩约 8500 段用来训练；训练好的策略不做额外调参就部署到真机。作者称这是首个基于学习的实时全身人形遥操作。后续工作 OmniH2O 扩展到 VR 遥操作和从遥操作数据自主学习。","example":"操作员站在摄像头前走路、踢腿、转身、挥手、打拳，H1 实时跟着做出同样的动作，还演示了后跳。","related":["全身遥操作","动作重定向","运动跟踪","OmniH2O","AMASS 人体动捕数据集","宇树 H1"]},{"id":"omnih2o","category":"named_model","sec":10,"tier":2,"sources":[{"title":"OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning (arXiv 2406.08858)","url":"https://arxiv.org/abs/2406.08858"},{"title":"OmniH2O 项目主页","url":"https://omni.human2humanoid.com/"}],"as_of":"2024-11","related_ids":["h2o","whole-body-teleoperation","teacher-student-distillation","privileged-information","motion-retargeting","humanplus"],"name":"OmniH2O","alt":"OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning","abbr":"","aliases":["Omni Human-to-Humanoid"],"one_liner":"CMU 2024 年的人形全身遥操作系统，VR、相机、语音、GPT-4o 都能统一驱动机器人。","explanation":"OmniH2O 是卡内基梅隆大学和上海交通大学的 Tairan He、Zhengyi Luo、Guanya Shi 等人 2024 年 6 月提出的人形机器人全身遥操作与学习系统，发表于 CoRL 2024，是同组 H2O 的升级版。核心设计是把「运动学位姿」（身体关键部位的位置和朝向）当作统一控制接口：无论指令来自 VR 头显、RGB 相机、语音还是 GPT-4o，都先转成目标位姿，再交给同一个全身控制策略跟踪。该策略在仿真里用强化学习训练：先对 AMASS 人体动作数据做大规模重定向和扩充，训练使用特权信息（只有仿真里才拿得到的完整状态）的教师策略，再蒸馏成只用稀疏传感器输入、能上真机的学生策略。平台是配灵巧手的宇树 H1。团队还发布了首个人形全身控制数据集 OmniH2O-6（6 个日常任务），并用扩散策略从中学出自主技能。","example":"自主打拳：把机器人头部相机的画面交给 GPT-4o，提示词规定看到蓝色靶子出左拳、红色靶子出右拳、没有靶子就不动，GPT-4o 每次只回答 A、B 或 C，OmniH2O 的全身策略再把选中的动作做出来。","related":["H2O（人到人形）","全身遥操作","教师-学生蒸馏","特权信息","动作重定向","HumanPlus"]},{"id":"humanplus","category":"named_model","sec":10,"tier":2,"sources":[{"title":"HumanPlus: Humanoid Shadowing and Imitation from Humans (arXiv 2406.10454)","url":"https://arxiv.org/abs/2406.10454"},{"title":"HumanPlus 项目主页","url":"https://humanoid-ai.github.io/"}],"as_of":"2024-11","related_ids":["humanoid-robot","whole-body-teleoperation","unitree-h1","action-chunking-with-transformers","amass","omnih2o"],"name":"HumanPlus","alt":"HumanPlus: Humanoid Shadowing and Imitation from Humans","abbr":"","aliases":[],"one_liner":"斯坦福 2024 年的人形系统：靠一个 RGB 相机让机器人实时模仿人，再从中学会自主技能。","explanation":"HumanPlus 是斯坦福大学 Zipeng Fu、Qingqing Zhao、Qi Wu、Gordon Wetzstein 和 Chelsea Finn 于 2024 年 6 月提出的人形机器人数据采集与学习系统，发表于 CoRL 2024 并入围最佳论文前 6。硬件以宇树 H1 为基础，加两只因时 6 自由度灵巧手，全身共 33 个自由度。做法分两步：先在仿真里用强化学习、以 AMASS 约 40 小时人体动作数据训练底层控制器 Humanoid Shadowing Transformer，部署后只需一个 RGB 相机估计操作者的身体和手部姿态，机器人就能实时「影子跟随」；再用这种方式遥操作采集演示，训练基于 ACT 改进的 Humanoid Imitation Transformer，靠头部双目 RGB 相机的第一视角画面自主完成任务。它说明全身遥操作不一定需要昂贵的动捕设备。","example":"穿鞋后站起来走路：每个任务最多用 40 条影子跟随采集的演示，训练后机器人自主完成，成功率 60%；从仓库货架卸货的成功率为 90%，打字为 80%。","related":["人形机器人","全身遥操作","宇树 H1","ACT","AMASS 人体动捕数据集","OmniH2O"]},{"id":"okami","category":"named_model","sec":10,"tier":3,"sources":[{"title":"OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation (arXiv 2410.11792)","url":"https://arxiv.org/abs/2410.11792"},{"title":"OKAMI 项目页","url":"https://ut-austin-rpl.github.io/OKAMI/"}],"as_of":"2024-11","related_ids":["imitation-from-observation","motion-retargeting","human-video-data","one-shot-imitation-learning","humanoid-robot","fourier-gr-1"],"name":"OKAMI","alt":"OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation","abbr":"OKAMI","aliases":[],"one_liner":"德州大学与英伟达 2024 年的方法，让人形机器人看一段人类视频学会操作。","explanation":"OKAMI 由德州大学奥斯汀分校朱玉可团队与英伟达研究院提出，2024 年 10 月上 arXiv，是 CoRL 2024 口头报告论文。目标是让人形机器人只看一段人类示范的 RGB-D 视频就学会一个操作任务，不用遥操作采数据。第一步分析视频：用 GPT-4V 找出任务相关物体，用 Grounded-SAM 分割、Cutie 跟踪物体，再重建人的身体和手部动作（SMPL-H 模型），得到参考计划。第二步做物体感知的动作重定向：先定位当前场景里物体在哪，再把人的手臂轨迹按物体位置调整后映射到机器人身上，手指动作也一并迁移。实验平台是傅利叶 GR1 人形，配两只 6 自由度因时灵巧手。执行成功的轨迹还能当数据训练闭环视觉运动策略。","example":"在装袋、撒盐、把零食放到盘子上、合上笔记本电脑等 6 个任务上，OKAMI 平均成功率 71.7%，比基线 ORION 高 58.3 个百分点；用它产生的轨迹训练的视觉运动策略平均成功率 79.2%。","related":["从观测中模仿学习","动作重定向","人类视频数据","单样本模仿学习","人形机器人","傅利叶 GR-1"]},{"id":"hover","category":"named_model","sec":10,"tier":3,"sources":[{"title":"HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots (arXiv 2410.21229)","url":"https://arxiv.org/abs/2410.21229"},{"title":"HOVER project page","url":"https://hover-versatile-humanoid.github.io/"},{"title":"NVlabs/HOVER (GitHub)","url":"https://github.com/NVlabs/HOVER"}],"as_of":"2025-03","related_ids":["whole-body-control","learning-based-whole-body-control","policy-distillation","motion-tracking","omnih2o","nvidia-generalist-embodied-agent-research-lab"],"name":"HOVER","alt":"HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots","abbr":"HOVER","aliases":["HOVER 神经全身控制器"],"one_liner":"英伟达等提出的人形机器人通用神经全身控制器，一个策略兼容多种指令模式","explanation":"英伟达（Linxi Fan、Yuke Zhu 等）联合 CMU、UC Berkeley、UT Austin、UCSD 2024 年 10 月发布，发表于 ICRA 2025。人形机器人做导航、边走边操作、桌面操作时需要的控制接口不同：导航关心躯干（根部）速度，桌面操作关心上半身关节位置。以前每种接口往往单独训练一个策略，彼此不通用。HOVER 先训练一个在仿真里模仿 AMASS 人体动作数据的教师全身动作跟踪策略，再蒸馏成一个学生策略；训练时对上、下半身指令分别施加模式掩码和稀疏掩码，让同一个策略能在 H2O、OmniH2O、ExBody、HumanPlus 等指令模式间切换而无需重训。代码基于 Isaac Lab 开源，真机部署在宇树 H1 上。","example":"同一个 HOVER 策略，可以只接收躯干速度指令让 H1 行走，也可以切换成只跟踪头和双手位置的 VR 遥操作模式。","related":["全身控制","学习型全身控制","策略蒸馏","运动跟踪","OmniH2O","英伟达 GEAR 实验室"]},{"id":"uh-1","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Learning from Massive Human Videos for Universal Humanoid Pose Control (arXiv 2412.14172)","url":"https://arxiv.org/abs/2412.14172"},{"title":"UH-1 project page (PSI Lab)","url":"https://psi-lab.ai/UH-1/"}],"as_of":"2024-12","related_ids":["humanoid-x","human-video-data","motion-retargeting","text-to-motion","action-tokenizer","humanoid-robot"],"name":"UH-1 / Humanoid-X","alt":"UH-1: Learning from Massive Human Videos for Universal Humanoid Pose Control (Humanoid-X dataset)","abbr":"UH-1","aliases":["Humanoid-X","Universal Humanoid Pose Control"],"one_liner":"从海量互联网人类视频学习、按文字指令生成人形机器人动作的大模型","explanation":"南加州大学（王越团队）、UC Berkeley 与丰田研究院 2024 年 12 月发布，后在 Humanoids 2025 会议做口头报告。人形机器人数据主要靠强化学习和遥操作获得，难以扩大规模；这项工作改从互联网人类视频里学。团队先建 Humanoid-X 数据集：从视频中提取 3D 人体姿态并自动生成文字描述，再重定向成人形机器人的关键点和动作，共约 16.4 万段动作、2000 多万个机器人姿态。在此基础上训练 UH-1：先把人形动作离散成 token，再用 Transformer 根据文字指令自回归生成动作 token。输出既可以是关键点，交给目标条件策略去跟踪；也可以直接是机器人动作，开环执行。它展示了「人类视频加文本，转成人形动作」这条扩大数据规模的路线。","example":"输入文字「挥手打招呼」，UH-1 生成对应的人形动作序列，交给底层控制器驱动人形机器人做出挥手动作。","related":["Humanoid-X 数据集","人类视频数据","动作重定向","文本驱动动作生成","动作分词器","人形机器人"]},{"id":"asap","category":"named_model","sec":10,"tier":2,"sources":[{"title":"ASAP (arXiv 2502.01143)","url":"https://arxiv.org/abs/2502.01143"},{"title":"ASAP 项目主页","url":"https://agile.human2humanoid.com/"}],"as_of":"2025-04","related_ids":["sim-to-real-transfer","sim-to-real-gap","residual-policy","motion-tracking","unitree-g1","domain-randomization"],"name":"ASAP","alt":"ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills","abbr":"ASAP","aliases":[],"one_liner":"用真机数据学一个动作修正模型来缩小虚实差距，让人形机器人做高难动作","explanation":"卡内基梅隆大学与英伟达 2025 年 2 月发布的人形全身控制方法，发表于 RSS 2025。仿真里练好的动作到真机上常常走样，因为仿真的物理和真实电机、接触不一致，即虚实差距。ASAP 分两步：先在仿真里用重定向后的人类动作数据训练运动跟踪策略；再把策略部署到真机采集轨迹，训练一个增量（残差）动作模型，学出「仿真里要额外补多少动作才能和真机表现一致」，把它接进仿真器后微调原策略。在宇树 G1 上，它的效果优于系统辨识、域随机化等常用做法，代码已开源。","example":"宇树 G1 借助 ASAP 复现 C 罗、科比、詹姆斯等球星的标志性庆祝动作，以及 1 米以上的前跳和侧跳。","related":["仿真到现实迁移","虚实差距","残差策略","运动跟踪","宇树 G1","域随机化"]},{"id":"homie","category":"named_model","sec":10,"tier":3,"sources":[{"title":"HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit (arXiv 2502.13013)","url":"https://arxiv.org/abs/2502.13013"},{"title":"HOMIE 项目页","url":"https://homietele.github.io/"}],"as_of":"2025-06","related_ids":["exoskeleton-teleoperation","loco-manipulation","whole-body-teleoperation","data-glove","unitree-g1","shanghai-artificial-intelligence-laboratory"],"name":"HOMIE","alt":"HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit","abbr":"HOMIE","aliases":["OpenHomie"],"one_liner":"上海 AI 实验室 2025 年的人形遥操作系统，用外骨骼、手套和踏板控制全身。","explanation":"HOMIE 由上海人工智能实验室与香港中文大学（庞江淼、林达华团队）2025 年 2 月发布，发表于 RSS 2025，已全部开源（OpenHomie）。人形机器人既要走又要用手干活（运动操作一体化），遥操作时很难同时控制上下半身。HOMIE 是半自主方案：下半身交给强化学习训练的策略，能按指令行走、转向、蹲到指定高度，同时适应上半身的任意姿态（训练中用了上半身姿态课程、高度跟踪奖励和左右对称性）；操作员用脚踏板下达移动指令，双臂戴与机器人同构的外骨骼（关节一一对应，读出的关节角直接当指令，不用逆运动学），手上戴基于霍尔传感器的动作感知手套控制灵巧手。整套硬件成本约 500 美元，在 Isaac Gym 仿真里为宇树 G1 和傅利叶 GR-1 都训练了策略，真机实验在宇树 G1 上完成。","example":"例如操作员踩踏板让机器人走到桌前并下蹲，同时用外骨骼臂和手套控制双手取物；作者报告完成任务的用时约为以往系统的一半。","related":["外骨骼遥操作","运动操作一体化","全身遥操作","数据手套","宇树 G1","上海人工智能实验室"]},{"id":"twist-2","category":"named_model","sec":10,"tier":2,"sources":[{"title":"TWIST: Teleoperated Whole-Body Imitation System (arXiv 2505.02833)","url":"https://arxiv.org/abs/2505.02833"},{"title":"TWIST 项目页","url":"https://yanjieze.com/projects/TWIST/"},{"title":"TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System (arXiv 2511.02832)","url":"https://arxiv.org/abs/2511.02832"}],"as_of":"2025-11","related_ids":["whole-body-teleoperation","motion-retargeting","motion-tracking","teacher-student-distillation","twist2","unitree-g1"],"name":"TWIST","alt":"TWIST: Teleoperated Whole-Body Imitation System","abbr":"TWIST","aliases":["遥操作全身模仿系统"],"one_liner":"斯坦福 2025 年做的人形机器人全身遥操作系统，人怎么动机器人就怎么动。","explanation":"TWIST 由斯坦福大学吴佳俊、C. Karen Liu 等团队与西蒙弗雷泽大学彭学斌合作，2025 年 5 月发布，发表于 CoRL 2025，一作 Yanjie Ze。以往人形遥操作多是上下半身分开控制，做不了「蹲下抱箱子」「用脚踢球」这类全身协调动作。TWIST 用 OptiTrack 光学动捕采集人的全身动作，实时重定向（把人的动作换算成机器人关节角）到 29 自由度的宇树 G1 上，再交给一个统一的神经网络控制器跟踪。控制器在 Isaac Gym 仿真中用约 42 小时人体动捕数据训练：先训练能看到未来 2 秒参考动作的教师策略，再用强化学习加行为克隆蒸馏成只看当前帧的学生策略，降低延迟。后续的 TWIST2 改用 PICO VR 头显、不再需要动捕，更便于大量采集数据。","example":"操作员在动捕场地里弯腰把地上的箱子抱起，G1 同步做出同样的全身动作；操作员抬脚踢球，或跳一段华尔兹，机器人也实时跟着做。","related":["全身遥操作","动作重定向","运动跟踪","教师-学生蒸馏","TWIST2","宇树 G1"]},{"id":"twist2","category":"named_model","sec":10,"tier":3,"sources":[{"title":"TWIST2 (arXiv 2511.02832)","url":"https://arxiv.org/abs/2511.02832"},{"title":"TWIST2 project page","url":"https://yanjieze.com/projects/TWIST2/"}],"as_of":"2025-11","related_ids":["twist","whole-body-teleoperation","vr-teleoperation","unitree-g1","hierarchical-architecture","motion-tracking"],"name":"TWIST2","alt":"TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System","abbr":"","aliases":["TWIST 2"],"one_liner":"不用动捕棚、戴 VR 头显就能采人形机器人全身数据的便携遥操作系统","explanation":"斯坦福、亚马逊 FAR、USC、UC Berkeley、CMU 联合 2025 年 11 月发布（作者含 Yanjie Ze、Pieter Abbeel、Guanya Shi、Jiajun Wu、C. Karen Liu 等），是全身遥操作系统 TWIST 的升级版。人形机器人全身数据难采，前作依赖固定场地的光学动捕。TWIST2 改用 PICO 4 Ultra 头显加两个 PICO 体感追踪器捕捉操作员全身动作，再给宇树 G1 加装一个约 250 美元、2 自由度的主动脖子，让机器人有第一视角视觉，整套设备可带到任何环境。论文报告 15 分钟可采约 100 条演示、成功率接近 100%。在此基础上训练分层策略：底层是仿真强化学习得到的全身动作跟踪器，上层是用采集数据做模仿学习的视觉运动策略。系统、硬件设计和数据集全部开源。","example":"操作员戴上 PICO 头显、绑好追踪器做抓放动作，宇树 G1 同步复现全身动作，15 分钟就能录下一百多条双手抓放演示。","related":["TWIST","全身遥操作","VR 遥操作","宇树 G1","分层架构","运动跟踪"]},{"id":"videomimic","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Visual Imitation Enables Contextual Humanoid Control (arXiv 2505.03729)","url":"https://arxiv.org/abs/2505.03729"},{"title":"VideoMimic project page","url":"https://www.videomimic.net/"}],"as_of":"2025-09","related_ids":["real-to-sim-to-real","4d-reconstruction","motion-retargeting","motion-tracking","human-video-data","unitree-g1"],"name":"VideoMimic","alt":"VideoMimic (Visual Imitation Enables Contextual Humanoid Control)","abbr":"","aliases":["Visual Imitation Enables Contextual Humanoid Control"],"one_liner":"从手机拍的普通人类视频里学会爬楼梯、坐椅子等技能的人形机器人方法","explanation":"UC Berkeley 的 Angjoo Kanazawa、Jitendra Malik、Pieter Abbeel 等人 2025 年 5 月发布，获 CoRL 2025 最佳学生论文奖。要让人形机器人学会「借助环境」的动作，如上下楼梯、坐到椅子上，需要同时知道人怎么动和周围地形长什么样。VideoMimic 是一条真-仿-真流水线：从单目视频里同时重建出有真实尺度的人体 4D 轨迹和场景几何；把人体动作重定向到机器人身上，把场景转成仿真器里的网格；在仿真中用强化学习训练跟踪这些动作的策略，再蒸馏成一个只看本体感知、身体周围高度图和目标方向的单一策略。最终部署在 23 自由度的宇树 G1 上。","example":"用手机拍一段人走上台阶、再坐到长椅上的视频，经 VideoMimic 处理后，宇树 G1 能在真实环境里自主完成上楼梯和坐下起身，且同一个策略适用于不同的楼梯和椅子。","related":["真-仿-真闭环","4D重建","动作重定向","运动跟踪","人类视频数据","宇树 G1"]},{"id":"amo","category":"named_model","sec":10,"tier":3,"sources":[{"title":"AMO: Adaptive Motion Optimization for Hyper-Dexterous Humanoid Whole-Body Control (arXiv 2505.03738)","url":"https://arxiv.org/abs/2505.03738"},{"title":"AMO 项目页（RSS 2025）","url":"https://amo-humanoid.github.io/"}],"as_of":"2025-05","related_ids":["whole-body-control","learning-based-whole-body-control","trajectory-optimization","teacher-student-distillation","unitree-g1","whole-body-teleoperation"],"name":"AMO","alt":"AMO: Adaptive Motion Optimization for Hyper-Dexterous Humanoid Whole-Body Control","abbr":"AMO","aliases":["Adaptive Motion Optimization","自适应运动优化"],"one_liner":"UCSD 2025 年的人形全身控制方法，用轨迹优化帮 RL 策略做大幅弯腰够物。","explanation":"AMO 由加州大学圣地亚哥分校王小龙团队提出，发表于 RSS 2025。人形机器人要从地上捡东西、够高处货架，得协调弯腰、扭躯干和屈伸腿；但拿人体动捕数据做模仿的强化学习策略很少见过这类极端躯干姿态，遇到分布外指令容易失稳。AMO 先用轨迹优化（在动力学约束下求解关节轨迹）批量生成「给定躯干朝向和高度时下肢怎么摆」的数据，训练一个小 MLP 模块，实时为下肢策略提供参考姿态；下肢策略在 Isaac Gym 中用教师-学生蒸馏训练。系统部署在 29 自由度的宇树 G1 上，可用 VR 遥操作，也能用遥操作数据训练 Transformer 策略自主干活。","example":"论文演示中，G1 在不同高度的台面之间搬放罐子，从左侧高层货架取瓶子放到右侧矮桌上，还能伸直双腿把瓶子放上高处货架；遥操作时，VR 设备给出的 3 个位姿被转换成控制指令。","related":["全身控制","学习型全身控制","轨迹优化","教师-学生蒸馏","宇树 G1","全身遥操作"]},{"id":"falcon","category":"named_model","sec":10,"tier":3,"sources":[{"title":"FALCON: Learning Force-Adaptive Humanoid Loco-Manipulation (arXiv 2505.06776)","url":"https://arxiv.org/abs/2505.06776"},{"title":"FALCON 项目主页（CMU LeCAR Lab）","url":"https://lecar-lab.github.io/falcon-humanoid/"}],"as_of":"2025-11","related_ids":["loco-manipulation","whole-body-control","curriculum-learning","unitree-g1","booster-robotics-t1","field-ai"],"name":"FALCON","alt":"FALCON: Learning Force-Adaptive Humanoid Loco-Manipulation","abbr":"","aliases":["FALCON 力自适应人形运动操作"],"one_liner":"CMU 等 2025 年提出的人形训练框架，让机器人边走边稳稳地推、拉、搬重物。","explanation":"FALCON 是卡内基梅隆大学 LeCAR 实验室（Guanya Shi 组）联合 Field AI 等机构在 2025 年 5 月发布的人形机器人全身控制方法，项目页标注入选 L4DC 2026 口头报告。人形机器人边走边干活（运动操作一体化）时，手上一旦受到较大外力，比如拉车、开门、搬重物，下半身容易失去平衡，上半身也跟不准目标位置。FALCON 用双智能体强化学习：下半身策略在外力干扰下保持行走稳定，上半身策略把手送到指定位置并隐式补偿外力，两者共享本体感知（关节角、速度等自身状态）联合训练；再配一个三维力课程，训练中逐步加大施加在手上的外力，同时不超过各关节的力矩上限。上半身关节跟踪精度约为基线的 2 倍，同一套训练流程不改奖励就能用在宇树 G1 和加速进化 Booster T1 两款人形上。","example":"真机实验中，人形机器人在 0–100 牛的拉力下拉车行走，在 0–40 牛的阻力下用双臂开门，还能端着负载边走边下蹲、转身。","related":["运动操作一体化","全身控制","课程学习","宇树 G1","加速进化 Booster T1","Field AI"]},{"id":"clone","category":"named_model","sec":10,"tier":3,"sources":[{"title":"CLONE (arXiv 2506.08931)","url":"https://arxiv.org/abs/2506.08931"},{"title":"CLONE 论文 HTML 版 (arXiv 2506.08931v2)","url":"https://arxiv.org/html/2506.08931v2"}],"as_of":"2025-08","related_ids":["whole-body-teleoperation","mixture-of-experts","unitree-g1","apple-vision-pro","motion-tracking","omnih2o"],"name":"CLONE","alt":"CLONE: Closed-Loop Whole-Body Humanoid Teleoperation for Long-Horizon Tasks","abbr":"","aliases":[],"one_liner":"只追踪头和双手、闭环纠偏的人形机器人全身遥操作系统。","explanation":"CLONE 由北京通用人工智能研究院（BIGAI）、北京大学、北京理工大学等团队 2025 年 6 月提出。以往人形遥操作常把上下半身分开控制来保稳定，动作不协调；而且机器人走得越久，实际位置和操作员的偏差越大（累积漂移）。CLONE 只用 Apple Vision Pro 头显采集操作员头部和双手位姿，由一个混合专家（MoE）结构的全身策略生成宇树 G1 全身关节动作，并把机器人的实际全局位置实时反馈给策略做闭环纠偏。论文报告在 8.9 米直线行走中平均位置误差约 5.1 厘米，能完成蹲下捡地上物体这类要全身配合的长程任务。这类全身遥操作系统也是给人形机器人采集演示数据的基础工具。","example":"操作员戴 Apple Vision Pro 在房间里走动、弯腰，G1 跟着走过去并蹲下从地面捡起物体。","related":["全身遥操作","混合专家模型","宇树 G1","Apple Vision Pro","运动跟踪","OmniH2O"]},{"id":"kungfubot","category":"named_model","sec":10,"tier":3,"sources":[{"title":"KungfuBot: Physics-Based Humanoid Whole-Body Control for Learning Highly-Dynamic Skills (arXiv 2506.12851)","url":"https://arxiv.org/abs/2506.12851"},{"title":"KungfuBot 项目页","url":"https://kungfubot.github.io"},{"title":"KungfuBot2: Learning Versatile Motion Skills for Humanoid Whole-Body Control (arXiv 2509.16638)","url":"https://arxiv.org/abs/2509.16638"}],"as_of":"2025-10","related_ids":["motion-tracking","motion-retargeting","unitree-g1","smpl","asymmetric-actor-critic","learning-based-whole-body-control"],"name":"KungfuBot","alt":"KungfuBot: Physics-Based Humanoid Whole-Body Control for Learning Highly-Dynamic Skills","abbr":"PBHC","aliases":["KungfuBot2","PBHC","VMS"],"one_liner":"让宇树 G1 学会功夫、舞蹈等高动态动作的人形全身动作模仿框架。","explanation":"KungfuBot 由中国电信人工智能研究院（TeleAI）联合上海交大、华东理工、哈工大、上海科技大学于 2025 年 6 月发布，入选 NeurIPS 2025，方法名 PBHC，代码开源。此前的人形运动跟踪大多只能模仿平缓、低速的动作。PBHC 先处理数据：从视频提取 SMPL 人体姿态，用物理指标剔除机器人做不到的动作、修正脚部接触，再重定向到宇树 G1；再用强化学习训练跟踪策略，把跟踪误差的容忍度做成随误差自适应调整的双层优化，相当于自动课程。2025 年 9 月的续作 KungfuBot2 用正交混合专家让一个策略掌握多种技能，并能稳定跟踪长达数分钟的动作。","example":"G1 照着人类视频做出跳踢、回旋踢、马步冲拳和太极等动作，项目页一共展示了 15 种这类高动态技能。","related":["运动跟踪","动作重定向","宇树 G1","SMPL 人体模型","非对称演员-评论家","学习型全身控制"]},{"id":"leverb","category":"named_model","sec":10,"tier":3,"sources":[{"title":"LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction (arXiv 2506.13751)","url":"https://arxiv.org/abs/2506.13751"}],"as_of":"2025-09","related_ids":["learning-based-whole-body-control","dual-system-architecture","latent-action","conditional-variational-autoencoder","unitree-g1","dagger"],"name":"LeVERB","alt":"LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction","abbr":"","aliases":["Latent Vision-Language-Encoded Robot Behavior","LeVERB-Bench"],"one_liner":"用「潜在动词」把视觉语言模型和人形全身控制器连起来的双系统框架。","explanation":"LeVERB 由加州大学伯克利分校牵头，合作者包括彭学斌、Trevor Darrell、Koushil Sreenath 等，2025 年 6 月发布。已有 VLA 多假定底层控制器只接收末端位姿、底盘速度这类人工定义的指令，只能做准静态任务。LeVERB 分两层：上层 LeVERB-VL（System 2，10Hz）用 SigLIP 编码第一、第三人称图像和指令，通过条件变分自编码器学出一个「潜在动词」空间；下层 LeVERB-A（System 1，50Hz）是全身控制器，先用 PPO 训练跟踪参考动作的教师，再用 DAgger 蒸馏成以潜在动词为条件的学生。作者用 IsaacSim 渲染动捕回放，建了 150 多个任务的 LeVERB-Bench。在宇树 G1 上零样本部署，简单视觉导航成功率 80%，整体 58.5%，是朴素分层方案的 7.8 倍。","example":"对机器人说「走到红色椅子前坐下」，上层模型看相机画面输出潜在动词，下层控制器据此让 G1 走过去、转身坐下。","related":["学习型全身控制","快慢双系统","潜在动作","条件变分自编码器","宇树 G1","DAgger（数据集聚合）"]},{"id":"gmt","category":"named_model","sec":10,"tier":3,"sources":[{"title":"GMT (arXiv:2506.14770)","url":"https://arxiv.org/abs/2506.14770"},{"title":"GMT 项目主页","url":"https://gmt-humanoid.github.io/"}],"as_of":"2025-09","related_ids":["motion-tracking","mixture-of-experts","unitree-g1","teacher-student-distillation","amass","beyondmimic"],"name":"GMT","alt":"GMT: General Motion Tracking for Humanoid Whole-Body Control","abbr":"GMT","aliases":["General Motion Tracking"],"one_liner":"用一个统一策略让人形机器人跟踪各种人类动作的全身控制方法","explanation":"加州大学圣地亚哥分校（王小龙组）与西蒙弗雷泽大学（Xue Bin Peng）2025 年 6 月提出。动作跟踪指让机器人实时模仿一段参考动作，如人体动捕数据。以往方法常是一类动作一个策略或需逐类微调，GMT 用一个策略覆盖走、踢腿、踢球、跳舞等。关键有两点：自适应采样，训练时自动多练难的片段；动作混合专家（MoE），让网络不同部分专精不同类型的动作。训练先用 PPO 训出带特权信息的教师策略，再用 DAgger 蒸馏成只看本体感知的学生策略。数据取自 AMASS 与 LAFAN1 约 33 小时动作，在 23 自由度的宇树 G1 上实机部署。","example":"同一个 GMT 策略在宇树 G1 上既能做武术踢腿、踢球，也能模仿醉步、蹲走和跳舞，不必为每类动作单独训练。","related":["运动跟踪","混合专家模型","宇树 G1","教师-学生蒸馏","AMASS 人体动捕数据集","BeyondMimic"]},{"id":"unitracker","category":"named_model","sec":10,"tier":3,"sources":[{"title":"UniTracker (arXiv 2507.07356)","url":"https://arxiv.org/abs/2507.07356"},{"title":"UniTracker 论文 HTML 版（含机构与实验设置）","url":"https://arxiv.org/html/2507.07356v3"}],"as_of":"2025-09","related_ids":["motion-tracking","conditional-variational-autoencoder","teacher-student-distillation","privileged-information","amass","unitree-g1"],"name":"UniTracker","alt":"UniTracker: Learning Universal Whole-Body Motion Tracker for Humanoid Robots","abbr":"","aliases":[],"one_liner":"让人形机器人用一个策略跟踪各种人体动作的三阶段全身运动跟踪框架","explanation":"上海交通大学、上海人工智能实验室等机构 2025 年 7 月发布的工作。运动跟踪指让机器人实时模仿一段参考人体动作，难点是一个策略要覆盖成千上万种动作，而真机上拿不到仿真里那些完整信息。UniTracker 分三步：先在仿真里用特权信息（真机拿不到的完整状态）训练教师策略；再把它蒸馏成可上真机的学生策略，学生用条件变分自编码器（CVAE）学一个动作的全局隐变量，缓解只看部分观测时朝向等全局量的漂移；最后用快速适配模块对难跟踪的动作单条或成批微调。训练数据是从 AMASS 筛出的 8179 段人体动作，在宇树 G1 上做了仿真和真机验证。","example":"给宇树 G1 一段从 AMASS 里取出的人体舞蹈动作，UniTracker 的同一个策略就能在真机上跟着做；遇到直接跟不好的高难动作序列，再用第三阶段的快速适配单独或成批微调。","related":["运动跟踪","条件变分自编码器","教师-学生蒸馏","特权信息","AMASS 人体动捕数据集","宇树 G1"]},{"id":"beyondmimic","category":"named_model","sec":10,"tier":2,"sources":[{"title":"BeyondMimic (arXiv 2508.08241)","url":"https://arxiv.org/abs/2508.08241"},{"title":"BeyondMimic 项目主页","url":"https://beyondmimic.github.io/"}],"as_of":"2025-11","related_ids":["motion-tracking","diffusion-model","deepmimic","asap","unitree-g1","lafan1"],"name":"BeyondMimic","alt":"BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion","abbr":"","aliases":[],"one_liner":"先让人形稳定复现人类动作，再蒸馏成可引导的扩散模型去做新任务","explanation":"加州大学伯克利分校 Koushil Sreenath 组与斯坦福 C. Karen Liu 组 2025 年 8 月发布的人形全身控制框架，分两步。第一步是运动跟踪：用一套简洁统一的强化学习配方，在仿真里学会复现 LAFAN1 动捕数据中的动作，再零样本部署到宇树 G1 真机，能做空中侧手翻、旋转踢、冲刺跑等高动态动作。第二步把选出的多个跟踪策略蒸馏进一个隐空间扩散模型，推理时用简单的代价函数引导采样，不用重新训练就能完成航点导航、摇杆遥控、避障等新任务。它把「模仿动作」推进到「用动作先验做通用控制」，运动跟踪代码已开源。","example":"同一个扩散模型，换一个代价函数就能从「跟着摇杆走」切换成「绕开障碍走到指定点」。","related":["运动跟踪","扩散模型","DeepMimic","ASAP","宇树 G1","LAFAN1 动捕数据集"]},{"id":"any2track","category":"named_model","sec":10,"tier":3,"sources":[{"title":"Track Any Motions under Any Disturbances (arXiv 2509.13833)","url":"https://arxiv.org/abs/2509.13833"},{"title":"Any2Track 项目页","url":"https://zzk273.github.io/Any2Track/"}],"as_of":"2025-09","related_ids":["motion-tracking","rapid-motor-adaptation","sim-to-real-transfer","unitree-g1","amass","gmt"],"name":"Any2Track","alt":"Any2Track: Track Any Motions under Any Disturbances","abbr":"","aliases":["Track Any Motions under Any Disturbances","AnyTracker","AnyAdapter"],"one_liner":"清华、北大与银河通用的人形动作跟踪器，被推拉、负重也能跟住动作。","explanation":"Any2Track 由清华大学、北京大学、银河通用和上海期智研究院合作提出（通讯作者弋力），2025 年 9 月发布。动作跟踪指让人形机器人实时复现一段参考动作，是全身控制和遥操作的底层能力；已有跟踪器多在平地、无外力条件下验证。Any2Track 分两阶段强化学习：先在 LAFAN1 和 AMASS 动捕数据上训练通用跟踪器 AnyTracker，用一个策略学会高动态、多接触的各类动作；再冻结它，加上适配模块 AnyAdapter，从最近的状态-动作历史中提取动力学特征（以预测未来状态的世界模型为辅助任务训练），在线补偿地形、外力和负重变化，又不破坏原有跟踪能力。策略在仿真训练后零样本部署到宇树 G1。","example":"真机实验中，G1 背着负重、在起伏地面上跟随参考动作，同时有人用绳子拉它、用脚推它，机器人仍能稳住并继续完成动作。","related":["运动跟踪","快速运动适应","仿真到现实迁移","宇树 G1","AMASS 人体动捕数据集","GMT"]},{"id":"bfm-zero","category":"named_model","sec":10,"tier":3,"sources":[{"title":"BFM-Zero (arXiv 2511.04131)","url":"https://arxiv.org/abs/2511.04131"},{"title":"BFM-Zero 项目主页","url":"https://lecar-lab.github.io/BFM-Zero/"}],"as_of":"2025-11","related_ids":["behavior-foundation-model","unsupervised-skill-discovery","motion-tracking","unitree-g1","meta-motivo","learning-based-whole-body-control"],"name":"BFM-Zero","alt":"BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised RL","abbr":"","aliases":["BFM Zero"],"one_liner":"不用任务奖励训练、靠「提示」切换任务的人形全身控制基础模型。","explanation":"BFM-Zero 是卡内基梅隆大学石冠亚组与 Meta 等机构 2025 年 11 月发布的人形机器人行为基础模型。它用无监督强化学习训练：训练时不给具体任务奖励，而是借助前向-后向表示（Forward-Backward，把状态和任务映射进同一个隐空间的方法）学出共享隐空间，参考动作、目标姿态和奖励函数都能编码成这个空间里的向量。部署时给出对应向量（即「提示」），同一个策略就能零样本完成动作跟踪、到达目标姿态、按奖励优化等任务，也支持少样本适配。团队在宇树 G1 真机上演示了抗推扰和摔倒后恢复，称其为首个可在真实人形上用提示切换任务的行为基础模型。","example":"同一个部署在宇树 G1 上的 BFM-Zero 策略：输入一段参考动作就做动作跟踪，输入一个目标姿态就去摆出它，输入一个奖励函数就按奖励行动，中间不重新训练。","related":["行为基础模型","无监督技能发现","运动跟踪","宇树 G1","Meta Motivo（人形行为基础模型）","学习型全身控制"]},{"id":"sonic","category":"named_model","sec":10,"tier":3,"sources":[{"title":"SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control (arXiv 2511.07820)","url":"https://arxiv.org/abs/2511.07820"},{"title":"GEAR-SONIC project page","url":"https://nvlabs.github.io/GEAR-SONIC/"}],"as_of":"2026-09","related_ids":["motion-tracking","learning-based-whole-body-control","unitree-g1","nvidia-isaac-gr00t-n1","nvidia-generalist-embodied-agent-research-lab","gr00t-wholebodycontrol"],"name":"SONIC","alt":"SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control","abbr":"SONIC","aliases":["GEAR-SONIC"],"one_liner":"英伟达把运动跟踪做大规模训练，得到的通用人形机器人全身控制基础模型","explanation":"英伟达 GEAR 实验室（Zhengyi Luo、Linxi Fan、Yuke Zhu 等）2025 年 11 月发布，后发表于 Science Robotics（2026）。它认为人形控制器也能靠扩大规模变强，而运动跟踪（让机器人实时复现一段人体动作）适合放大：动捕数据自带密集监督，不用手工设计奖励。团队把网络从 120 万扩到 4200 万参数，用约 700 小时动捕（1 亿多帧）、约 2.1 万 GPU 小时训练，部署在宇树 G1 上。同一个策略通过统一的 token 接口，可接收手柄加实时运动规划器、VR 遥操作、视频模仿、文本和音乐生成的动作，也能接在 GR00T N1.5 等 VLA 后面做全身移动操作。代码已在 GR00T-WholeBodyControl 仓库开源。","example":"操作员戴 VR 设备只追踪头部和双手，SONIC 用运动规划器补全下半身动作，控制 G1 完成推割草机这类边走边操作的任务。","related":["运动跟踪","学习型全身控制","宇树 G1","GR00T N1 系列","英伟达 GEAR 实验室","GR00T 全身控制代码库"]},{"id":"clip-on-wheels","category":"named_model","sec":11,"tier":3,"sources":[{"title":"CoWs on Pasture (arXiv:2203.10421)","url":"https://arxiv.org/abs/2203.10421"},{"title":"CoWs on Pasture 项目主页（CVPR 2023）","url":"https://cow.cs.columbia.edu/"}],"as_of":"2023-06","related_ids":["object-goal-navigation","clip","open-vocabulary","zero-shot","frontier-based-exploration","vlfm"],"name":"CoW（CLIP on Wheels）","alt":"CLIP on Wheels (CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object Navigation)","abbr":"CoW","aliases":["CLIP on Wheels","CoWs on Pasture"],"one_liner":"把 CLIP 等开放词汇模型装上移动机器人，不经导航训练按文字找物体的基线。","explanation":"哥伦比亚大学宋舒然组与华盛顿大学 2022 年提出，发表于 CVPR 2023。它研究「语言驱动的零样本物体导航」：机器人要在陌生房子里按一句描述（如「床底下的玩具飞机」）找到目标，而且没在这些物体或场景上做过导航训练。CoW 的做法很朴素：还没有把握认出目标时，用经典探索策略在房子里转；一旦 CLIP 这类开放词汇模型（能按任意文字识别物体的模型）在画面里足够自信地定位到目标，就规划路径开过去。作者评测了 21 种 CoW 变体，并提出 Pasture 基准，考察罕见物体、带外观/空间描述的物体和被遮住的物体。最好的 CoW 在 RoboTHOR 物体子集上成功率比此前最佳方法高 15.6 个百分点。","example":"目标是「扎染冲浪板（tie-dye surfboard）」这种导航数据集里没有的类别，CoW 先探索房间，等 CLIP 判断某处画面与这句话足够匹配，再把那里当目标点规划过去。","related":["物体目标导航","CLIP","开放词汇","零样本","前沿探索","VLFM（视觉语言前沿地图）"]},{"id":"lm-nav","category":"named_model","sec":11,"tier":3,"sources":[{"title":"arXiv 2207.04429: LM-Nav","url":"https://arxiv.org/abs/2207.04429"},{"title":"LM-Nav 项目主页","url":"https://sites.google.com/view/lmnav"}],"as_of":"2022-07","related_ids":["vision-and-language-navigation","clip","topological-map","llm-based-task-planning","gnm","vint"],"name":"LM-Nav","alt":"LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action","abbr":"LM-Nav","aliases":[],"one_liner":"把 GPT-3、CLIP 和视觉导航模型拼起来，让机器人按自然语言指令导航。","explanation":"LM-Nav 是 Dhruv Shah、Brian Ichter、Sergey Levine 等人 2022 年 7 月发布的工作，发表于 CoRL 2022。用语言指挥机器人导航，通常需要大量带文字说明的轨迹数据，标注很贵。LM-Nav 不做任何微调、不用语言标注的机器人数据，而是组合三个现成的预训练模型：大语言模型 GPT-3 把指令拆成一串地标；图文模型 CLIP 判断机器人拍到的画面对应哪个地标；视觉导航模型 ViNG 用过去采集的图像建立环境拓扑图并执行到点策略。系统再搜索出按顺序经过这些地标的最短路线。它在真实户外环境完成了长距离导航，是用基础模型拼装机器人系统这一思路的早期代表。","example":"例如用户说「经过停车标志后去白色大楼」，GPT-3 提取出「停车标志」「白色大楼」两个地标，CLIP 在拓扑图里找到对应位置，ViNG 依次开过去。","related":["视觉语言导航","CLIP","拓扑地图","大模型任务规划","GNM（通用导航模型）","ViNT"]},{"id":"vlmaps","category":"named_model","sec":11,"tier":3,"sources":[{"title":"Visual Language Maps for Robot Navigation (arXiv 2210.05714)","url":"https://arxiv.org/abs/2210.05714"},{"title":"VLMaps 项目主页","url":"https://vlmaps.github.io/"},{"title":"vlmaps/vlmaps (GitHub)","url":"https://github.com/vlmaps/vlmaps"}],"as_of":"2023-03","related_ids":["semantic-map","vision-and-language-navigation","open-vocabulary","code-as-policies","clip","vlfm"],"name":"VLMaps","alt":"Visual Language Maps for Robot Navigation","abbr":"VLMaps","aliases":["视觉语言地图","Visual Language Maps"],"one_liner":"把视觉语言特征写进三维地图，让机器人按「椅子右边三米」这类话导航。","explanation":"VLMaps 由弗莱堡大学、Google Research 和纽伦堡工业大学的 Chenguang Huang、Oier Mees、Andy Zeng、Wolfram Burgard 提出，2022 年 10 月上线 arXiv，发表于 ICRA 2023。它让机器人边走边用 RGB-D 视频建图：用开放词汇分割模型 LSeg 给每个像素算一个视觉语言特征，借助深度和位姿投到三维表面，再压成俯视网格地图。查询时把「沙发」「冰箱」等词用文本编码器编码，和地图特征比相似度，就能定位任意物体，属于开放词汇语义地图。复杂指令先交给大语言模型（GPT-3 系列）写成调用地图接口的代码，因此能处理「在两个物体之间」「往右三米」等空间关系。同一张地图还能按不同机器人生成各自的障碍物地图。它是把基础模型接进导航地图的早期代表工作。","example":"对机器人说「移动到椅子右边三米的地方」，语言模型把指令转成代码，先在地图里查出椅子的位置，再算出右侧三米的目标点让机器人前往。","related":["语义地图","视觉语言导航","开放词汇","代码即策略","CLIP","VLFM（视觉语言前沿地图）"]},{"id":"gnm","category":"named_model","sec":11,"tier":3,"sources":[{"title":"GNM: A General Navigation Model to Drive Any Robot (arXiv:2210.03370)","url":"https://arxiv.org/abs/2210.03370"},{"title":"GNM 项目主页","url":"https://sites.google.com/view/drive-any-robot"}],"as_of":"2023-05","related_ids":["vint","nomad","cross-embodiment","image-goal-navigation","topological-map","berkeley-artificial-intelligence-research"],"name":"GNM（通用导航模型）","alt":"GNM: A General Navigation Model to Drive Any Robot","abbr":"GNM","aliases":["通用导航模型","General Navigation Model"],"one_liner":"用 6 种机器人混合数据训练、能驱动不同机器人的通用视觉导航模型","explanation":"加州大学伯克利分校 Sergey Levine 组（Dhruv Shah 等）2022 年 10 月提出，发表于 ICRA 2023。它把 TurtleBot2、Jackal、Spot、遥控车、全地形车等 6 种机器人共约 60 小时导航数据合起来，训练一个图像目标导航策略：输入当前图像、过去几帧（用来推断「我是哪种机器人」的本体上下文）和目标图像，输出离目标的时间距离和接下来 5 个归一化路点。归一化动作空间让它能跨本体使用。结论是异构数据训出的一个策略比任何单一数据集训的都强，还能直接部署到训练集里没有的机器人上，例如四旋翼无人机。后续工作有 ViNT 和 NoMaD。","example":"部署时先建一张由沿途图像组成的拓扑地图，GNM 估计当前画面离各节点有多远，再用 Dijkstra 算法规划子目标序列，逐个导航过去。","related":["ViNT","NoMaD","跨本体","图像目标导航","拓扑地图","伯克利人工智能研究实验室"]},{"id":"vint","category":"named_model","sec":11,"tier":3,"sources":[{"title":"ViNT (arXiv 2306.14846)","url":"https://arxiv.org/abs/2306.14846"},{"title":"ViNT project page","url":"https://general-navigation-models.github.io/vint/index.html"}],"as_of":"2023-10","related_ids":["gnm","nomad","image-goal-navigation","navigation","foundation-model","prompt-tuning-soft-prompt"],"name":"ViNT","alt":"ViNT: A Foundation Model for Visual Navigation (Visual Navigation Transformer)","abbr":"ViNT","aliases":["Visual Navigation Transformer"],"one_liner":"伯克利用多种机器人导航数据训练、看图找目标的视觉导航基础模型","explanation":"UC Berkeley 的 Dhruv Shah、Sergey Levine 等人 2023 年 6 月发布，CoRL 2023 口头报告论文。此前导航模型大多只在一种机器人、一种场景的数据上训练。ViNT 用 EfficientNet 编码图像、再接 Transformer，输入当前及过去几帧画面和一张目标图片，预测离目标还有多远以及下一步该怎么走；训练数据来自多种机器人平台、累计数百小时的导航数据。配合一个生成候选子目标图的扩散模型，它能在陌生环境里探索，再加上 GPS 等远程启发信息可完成公里级导航；还能通过提示微调把目标换成 GPS 路点或转向指令。它继承自更早的 GNM，后续有 NoMaD。","example":"先让机器人沿一条路线拍一串照片，之后只给它其中一张作为目标图，ViNT 就能在同一环境中自己走到拍摄那张照片的位置；同一个模型可以部署到不同的移动机器人上。","related":["GNM（通用导航模型）","NoMaD","图像目标导航","导航","基础模型","提示微调 / 软提示"]},{"id":"nomad","category":"named_model","sec":11,"tier":3,"sources":[{"title":"NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration (arXiv 2310.07896)","url":"https://arxiv.org/abs/2310.07896"},{"title":"NoMaD 项目页","url":"https://general-navigation-models.github.io/nomad/"}],"as_of":"2024-05","related_ids":["diffusion-policy","vint","gnm","image-goal-navigation","active-exploration","action-multimodality"],"name":"NoMaD","alt":"NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration","abbr":"NoMaD","aliases":[],"one_liner":"伯克利 2023 年的导航扩散策略，一个模型既能自由探索，也能按目标图像走过去。","explanation":"NoMaD 由加州大学伯克利分校 Sergey Levine 团队（Ajay Sridhar、Dhruv Shah 等）2023 年 10 月提出，发表于 ICRA 2024，项目页称其获该届最佳论文奖。机器人导航常有两种需求：在陌生环境里无目标地探索，以及看到目标照片后走过去。以往要两套模型，NoMaD 用「目标掩码」合二为一：训练时一半样本遮掉目标图像，推理时遮住就是探索、放开就是去目标。它用 ViNT 式 Transformer 编码最近几帧画面和目标图，再用扩散模型生成未来一段路径点，能表达岔路口左右都可以的多种选择（动作多峰性）。模型约 1900 万参数，在 GNM、SACSoN 等 100 多小时多机器人真实数据上训练。","example":"在 LoCoBot 上做真实环境探索，NoMaD 成功率 98%、平均碰撞 0.2 次；对比的「先用扩散生成子目标图像再导航」基线为 77% 和 1.7 次，参数量还多约 15 倍。","related":["扩散策略","ViNT","GNM（通用导航模型）","图像目标导航","主动探索","动作多峰性"]},{"id":"vlfm","category":"named_model","sec":11,"tier":3,"sources":[{"title":"VLFM: Vision-Language Frontier Maps for Zero-Shot Semantic Navigation (arXiv 2312.03275)","url":"https://arxiv.org/abs/2312.03275"},{"title":"VLFM 项目页","url":"https://naoki.io/portfolio/vlfm"}],"as_of":"2024-05","related_ids":["object-goal-navigation","frontier-based-exploration","zero-shot","success-weighted-by-path-length","occupancy-grid-map","vlmaps"],"name":"VLFM（视觉语言前沿地图）","alt":"VLFM: Vision-Language Frontier Maps for Zero-Shot Semantic Navigation","abbr":"VLFM","aliases":["Vision-Language Frontier Maps","视觉语言前沿地图"],"one_liner":"用视觉语言模型给探索边界打分，零样本在陌生环境里找指定物体。","explanation":"VLFM 由佐治亚理工学院和波士顿动力 AI 研究所的 Naoki Yokoyama、Dhruv Batra、Bernadette Bucher 等人提出，2023 年 12 月上线 arXiv，发表于 ICRA 2024 并获该会认知机器人方向最佳论文。任务是物体目标导航：在没去过的环境里找到某类物体。它用深度图建占据地图，找出已知与未知区域的交界（前沿）；同时用 BLIP-2 计算当前画面与「附近可能有目标」这类文字提示的相似度，写进一张语言价值地图，然后选价值最高的前沿去探索。看到目标后用 YOLOv7、Grounding DINO 检测，Mobile-SAM 抠出轮廓再走过去。整个流程无需针对导航训练，在 Gibson、HM3D、MP3D 上按 SPL（路径长度加权成功率）取得当时最佳，并直接部署到波士顿动力 Spot 上。","example":"在一栋没有预先建图的办公楼里，Spot 收到要找的物体类别后，优先走向视觉语言模型认为更可能出现该物体的方向，找到后停在旁边。","related":["物体目标导航","前沿探索","零样本","路径长度加权成功率","占据栅格地图","VLMaps"]},{"id":"navid","category":"named_model","sec":11,"tier":3,"sources":[{"title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation (arXiv 2402.15852)","url":"https://arxiv.org/abs/2402.15852"},{"title":"NaVid 项目页","url":"https://pku-epic.github.io/NaVid/"},{"title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks (arXiv 2412.06224)","url":"https://arxiv.org/abs/2412.06224"}],"as_of":"2025-02","related_ids":["vision-and-language-navigation","room-to-room","vision-language-model","navila","navfom","sim-to-real-transfer"],"name":"NaVid","alt":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","abbr":"","aliases":["Uni-NaVid"],"one_liner":"北大与智源等 2024 年提出的视频大模型导航方法，只看单目视频决定下一步。","explanation":"NaVid 由北京大学王鹤团队联合智源研究院、阿德莱德大学、银河通用等于 2024 年 2 月提出，发表于 RSS 2024，做的是视觉语言导航（按一句话指令走到目的地）。以往方法多依赖地图、里程计或深度图，NaVid 只用单目 RGB 视频：当前帧压成 64 个 token、每个历史帧压成 4 个，送进基于 Vicuna-7B 的视频大模型，直接用文字输出下一步，如前进多少厘米、转多少度或停止。它在 R2R-CE 上只用 RGB 达到 37.4% 成功率，并能迁移到真机。后续的 Uni-NaVid（RSS 2025）把指令导航、找物体、具身问答、跟人四类任务合进一个模型，用 360 万条样本训练。","example":"在 4 个真实室内场景、共 200 条指令的测试中，装在 Turtlebot4 小车上的 NaVid 对简单指令成功率约 66%，对多步复合指令约 48%。","related":["视觉语言导航","R2R / VLN-CE 视觉语言导航基准","视觉语言模型","NaVILA","银河通用 NavFoM","仿真到现实迁移"]},{"id":"poliformer","category":"named_model","sec":11,"tier":3,"sources":[{"title":"arXiv 2406.20083: PoliFormer","url":"https://arxiv.org/abs/2406.20083"},{"title":"GitHub: allenai/poliformer","url":"https://github.com/allenai/poliformer"}],"as_of":"2024-11","related_ids":["object-goal-navigation","on-policy","procthor","ai2-thor","allen-institute-for-ai","sim-to-real-transfer"],"name":"PoliFormer","alt":"PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators","abbr":"","aliases":[],"one_liner":"用大规模同策略强化学习训练的 Transformer 导航策略，仿真训完直接上真机","explanation":"艾伦人工智能研究所（Ai2）2024 年 6 月发布，CoRL 2024 论文。它只用 RGB 图像：视觉 Transformer 编码器（代码中用 DINOv2）编码每一帧，再接一个因果 Transformer 解码器汇总较长的历史，输出导航动作。训练完全在仿真里：在 ProcTHOR 程序化生成的大量房屋中做同策略强化学习，多机并行推演，累计数亿次交互。它在 CHORES-S 物体目标导航基准上成功率 85.5%，比此前最好方法绝对提升 28.5 个百分点；不经额外调整就能部署到 LoCoBot 和 Stretch RE-1 两种真机，还能直接用于物体跟踪、开放词汇导航等下游任务。它说明强化学习配上 Transformer 和大规模仿真同样能靠规模涨性能。","example":"对 Stretch 机器人说「找到厨房里的苹果」，PoliFormer 只根据头部摄像头画面逐步决定前进或转向，看到苹果后停在旁边。","related":["物体目标导航","同策略","ProcTHOR","AI2-THOR","艾伦人工智能研究所","仿真到现实迁移"]},{"id":"mobility-vla","category":"named_model","sec":11,"tier":3,"sources":[{"title":"Mobility VLA (arXiv 2407.07775)","url":"https://arxiv.org/abs/2407.07775"},{"title":"Mobility VLA (arXiv HTML full text)","url":"https://arxiv.org/html/2407.07775"}],"as_of":"2024-07","related_ids":["vision-and-language-navigation","topological-map","hierarchical-architecture","google-gemini","context-length","structure-from-motion"],"name":"Mobility VLA","alt":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","abbr":"","aliases":["MINT (Multimodal Instruction Navigation with demonstration Tours)"],"one_liner":"用长上下文 VLM 看懂一段导览视频，再按图文指令找到目的地的分层导航系统","explanation":"Google DeepMind 在 2024 年 7 月发布。它针对的任务叫 MINT（带演示导览的多模态指令导航）：先有人拿着相机把环境走一遍录成导览视频，之后用户可以用文字加图片下指令，比如拿着一样东西问「这个该还到哪」。系统分两层：高层用上下文长达 100 万 token 的 Gemini 1.5 Pro 读完整段导览视频和指令，找出目标所在的那一帧；低层用 COLMAP（一种从图像恢复相机位姿的工具）由视频建出拓扑图，即把地点当节点、可通行关系当边的地图，据此生成路点动作交给底盘执行。在 836 平方米、有人办公的真实办公室里，需推理类和多模态类指令的端到端成功率分别为 86% 和 90%。","example":"用户拿着一个充电器问「这个应该放回哪里」，机器人先在导览视频里找到放充电器的那张桌子，再沿拓扑图一路开过去。","related":["视觉语言导航","拓扑地图","分层架构","Gemini 系列（谷歌多模态大模型）","上下文长度","运动恢复结构"]},{"id":"navigation-world-models","category":"named_model","sec":11,"tier":3,"sources":[{"title":"Navigation World Models (arXiv 2412.03572)","url":"https://arxiv.org/abs/2412.03572"},{"title":"Navigation World Models 项目页","url":"https://www.amirbar.net/nwm/"}],"as_of":"2025-06","related_ids":["world-model","video-prediction-model","diffusion-transformer","nomad","image-goal-navigation","meta-fundamental-ai-research"],"name":"导航世界模型","alt":"Navigation World Models (Meta)","abbr":"NWM","aliases":[],"one_liner":"Meta 2024 年底提出的导航用视频世界模型，按动作想象走过去会看到什么。","explanation":"导航世界模型由 Meta FAIR 的 Amir Bar、Yann LeCun 等与纽约大学、伯克利合作提出，2024 年 12 月上 arXiv，获 CVPR 2025 最佳论文荣誉提名。它是一个可控的视频生成模型：给定过去的画面和一段导航动作（往哪走、转多少），预测接下来会看到的画面。模型是 10 亿参数的条件扩散 Transformer（CDiT），用人类和机器人的第一人称视频训练。有了它，机器人可以先在模型里模拟多条路线，挑能到达目标的那条；也能给 NoMaD 等现成策略采样的轨迹打分排序；还能只凭一张照片想象在陌生环境里行走。作者也指出，在陌生环境里生成久了，画面会逐渐偏向训练数据。","example":"给定起点照片和一张目标照片，NWM 对一批候选动作序列逐条生成沿途画面，选终点画面最接近目标照片的那条去执行。","related":["世界模型","视频预测模型","扩散 Transformer","NoMaD","图像目标导航","Meta FAIR"]},{"id":"navila","category":"named_model","sec":11,"tier":3,"sources":[{"title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation (arXiv 2412.04453)","url":"https://arxiv.org/abs/2412.04453"},{"title":"NaVILA 项目页","url":"https://navila-bot.github.io/"}],"as_of":"2025-06","related_ids":["vision-and-language-navigation","vision-language-action-model","legged-locomotion","hierarchical-architecture","rl-based-locomotion-control","navid"],"name":"NaVILA","alt":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","abbr":"","aliases":[],"one_liner":"足式机器人导航 VLA：大模型用文字给出中层动作，强化学习运控负责走。","explanation":"NaVILA 由加州大学圣地亚哥分校王小龙团队与英伟达、南加州大学提出，2024 年 12 月上 arXiv，发表于 RSS 2025。视觉语言模型擅长理解画面和指令，但直接输出腿部关节指令很难，于是 NaVILA 分两层：上层是在英伟达 VILA（8B）上微调的 VLA，看相机画面和指令，用文字输出带距离、角度的中层动作，如「前进 75 厘米」；下层是强化学习训练的运动策略，读激光雷达生成的高度图，把中层动作变成四足 12 个关节的指令。训练数据除仿真导航数据外，还有约 2000 段 YouTube 第一人称游览视频。它在 R2R-CE 上成功率 54%，论文还发布了基于 Isaac Lab 的 VLN-CE-Isaac 基准。","example":"在办公区、家庭和户外共 25 条指令的真机测试中，装在宇树 Go2 四足上的 NaVILA 成功率 88%，多房间复杂指令为 75%；同一模型不重新训练也能用在 Booster T1 人形上。","related":["视觉语言导航","视觉-语言-动作模型","腿足运动","分层架构","强化学习运控","NaVid"]},{"id":"trackvla","category":"named_model","sec":11,"tier":3,"sources":[{"title":"TrackVLA: Embodied Visual Tracking in the Wild (arXiv 2505.23189)","url":"https://arxiv.org/abs/2505.23189"},{"title":"TrackVLA project page","url":"https://pku-epic.github.io/TrackVLA-web/"}],"as_of":"2025-05","related_ids":["embodied-visual-tracking","vision-language-action-model","navfom","navigation","diffusion-model","unitree-go2"],"name":"银河通用 TrackVLA","alt":"TrackVLA: Embodied Visual Tracking in the Wild (Galbot)","abbr":"","aliases":["TrackVLA"],"one_liner":"只靠第一视角相机，边认出目标边规划路线去跟随它的具身跟踪 VLA","explanation":"北京大学 EPIC 实验室（王鹤团队）与银河通用等机构 2025 年 5 月发布的视觉-语言-动作模型（VLA），发表于 CoRL 2025。任务是具身视觉跟踪：机器人只用自己的第一视角相机，在动态环境里认出并持续跟住指定目标。以往做法把「认出目标」和「规划怎么走」拆成两个模块，误差会层层累积；TrackVLA 让两者共用一个大语言模型骨干（Vicuna-7B），语言头负责识别，基于锚点的扩散模型负责输出行进轨迹。训练数据约 170 万条，一半是自建 EVT-Bench 仿真基准里的跟踪样本，一半是视频问答识别样本。真机部署在宇树 Go2 四足上，模型跑在远程 RTX 4090 服务器，推理约 10 帧/秒，对遮挡和目标快速移动比较鲁棒。","example":"对宇树 Go2 说「跟着穿蓝衣服的人」，它只靠头上一台 RGB 相机在人群中认出目标并一路跟随，目标短暂被挡住后还能接着跟。","related":["具身视觉跟踪（目标跟随）","视觉-语言-动作模型","银河通用 NavFoM","导航","扩散模型","宇树 Go2"]},{"id":"navfom","category":"named_model","sec":11,"tier":3,"sources":[{"title":"Embodied Navigation Foundation Model (arXiv 2509.12129)","url":"https://arxiv.org/abs/2509.12129"},{"title":"NavFoM 项目页","url":"https://pku-epic.github.io/NavFoM-Web/"},{"title":"银河通用发布全球首个跨本体全域环视导航大模型NavFoM（网易，2025-11-05）","url":"https://c.m.163.com/news/a/KDJOHKOP0519D45U.html"}],"as_of":"2025-11","related_ids":["cross-embodiment","vision-and-language-navigation","embodied-visual-tracking","trackvla","navid","astrabrain"],"name":"银河通用 NavFoM","alt":"NavFoM: Embodied Navigation Foundation Model (Galbot)","abbr":"NavFoM","aliases":["导航基座大模型","Embodied Navigation Foundation Model"],"one_liner":"银河通用与北大 2025 年推出的导航基座模型，一套权重适配多种本体和导航任务。","explanation":"NavFoM 由银河通用联合北京大学、阿德莱德大学、浙江大学等提出，论文 2025 年 9 月上 arXiv，11 月公司正式发布，宣传为「全球首个跨本体全域环视导航基座大模型」。以往导航模型多是一种机器人、一种任务单独训练；NavFoM 用 802 万条导航样本（四足、无人机、轮式机器人、汽车）加 476 万条图文和视频问答数据，同时学指令导航、找物体、目标跟踪和自动驾驶。它以 Qwen2-7B 为语言骨干，拼接 DINOv2 和 SigLIP 视觉特征，用特殊 token 标明每帧来自哪台相机、哪个时刻，可接 1 到 8 路相机，最后由 MLP 输出路径点，交给本体的局部规划器执行。","example":"同一套权重不做针对性微调，就在 VLN-CE 指令导航、HM3D-OVON 开放词汇找物、EVT-Bench 目标跟踪和 NAVSIM 自动驾驶等基准上评测；北大与银河通用后来的 UrbanVLA 也在它的基础上训练。","related":["跨本体","视觉语言导航","具身视觉跟踪（目标跟随）","银河通用 TrackVLA","NaVid","银河星脑 AstraBrain"]},{"id":"alvinn","category":"named_model","sec":11,"tier":3,"sources":[{"title":"ALVINN: An Autonomous Land Vehicle in a Neural Network (NIPS 1988 proceedings)","url":"https://proceedings.neurips.cc/paper/1988/hash/812b4ba287f5ee0bc9d43bbf5bbe87fb-Abstract.html"},{"title":"End to End Learning for Self-Driving Cars (NVIDIA, arXiv 1604.07316)","url":"https://arxiv.org/abs/1604.07316"}],"as_of":"2016-04","related_ids":["end-to-end","behavior-cloning","autonomous-driving","imitation-learning","multilayer-perceptron","tesla-fsd-v12"],"name":"ALVINN","alt":"ALVINN: An Autonomous Land Vehicle in a Neural Network","abbr":"ALVINN","aliases":["Autonomous Land Vehicle In a Neural Network","神经网络自主陆地车辆"],"one_liner":"1988 年卡内基梅隆的驾驶神经网络，看路面图像直接输出转向。","explanation":"ALVINN 是卡内基梅隆大学 Dean Pomerleau 的工作，论文发表于 NIPS 1988。当时的自动驾驶靠手工设计的图像处理规则，光照、路况一变就容易失效。ALVINN 改用一个只有一层 29 个隐藏单元的反向传播网络：输入 30×32 的摄像头图像和 8×32 的激光测距图，输出 45 个单元表示该走的转弯曲率，中间没有手写的道路检测规则。网络先在 1200 张程序生成的模拟道路图上训练，再装到 CMU 的 NAVLAB 试验车上，以 0.5 m/s 沿校园林间 400 米的路自主行驶。它常被看作行为克隆和端到端驾驶最早的实例之一，英伟达 2016 年的端到端驾驶系统 DAVE-2 在论文中称受它启发。","example":"每读入一帧路面图像，网络 45 个转向输出单元中激活最强的位置决定方向：正中间的单元表示直行，越往两侧的单元表示向左或向右转得越急。","related":["端到端","行为克隆","自动驾驶","模仿学习","多层感知机","特斯拉 FSD V12（端到端自动驾驶）"]},{"id":"uniad","category":"named_model","sec":11,"tier":3,"sources":[{"title":"Planning-oriented Autonomous Driving (arXiv 2212.10156)","url":"https://arxiv.org/abs/2212.10156"},{"title":"OpenDriveLab/UniAD (GitHub)","url":"https://github.com/OpenDriveLab/UniAD"},{"title":"CVPR 2023 Awards","url":"https://cvpr2023.thecvf.com/Conferences/2023/Awards"}],"as_of":"2025-10","related_ids":["autonomous-driving","end-to-end","tesla-fsd-v12","drivevlm","birds-eye-view","occupancy-network"],"name":"UniAD（规划导向的端到端自动驾驶）","alt":"UniAD: Planning-oriented Autonomous Driving","abbr":"UniAD","aliases":["Unified Autonomous Driving","Planning-oriented Autonomous Driving"],"one_liner":"把感知、预测、规划串进一个网络、一切为规划服务的端到端自动驾驶框架","explanation":"上海人工智能实验室 OpenDriveLab（李弘扬团队）等机构 2022 年 12 月发布，获 CVPR 2023 最佳论文奖。传统自动驾驶把感知、预测、规划拆成独立模块或并列的多任务头分别优化，模块之间信息会丢失、误差会累积。UniAD 主张「以规划为目标」：在一个网络里依次完成目标跟踪、在线建图、运动预测、占用栅格预测和轨迹规划，模块之间用统一的查询向量（query）传递信息，整体朝最终规划效果优化。它在 nuScenes 数据集上各项指标都超过当时的方法，成为端到端自动驾驶的代表作，具身智能领域谈端到端设计时也常引用它。2025 年 10 月团队发布了 UniAD 2.0 代码版本。","example":"UniAD 输入车上多路环视相机画面，在同一个网络里跟踪周围车辆、画出车道线、预测它们未来几秒的走向，最后直接输出自车接下来的行驶轨迹。","related":["自动驾驶","端到端","特斯拉 FSD V12（端到端自动驾驶）","DriveVLM（快慢双系统智驾）","鸟瞰图","占用网络"]},{"id":"tesla-fsd-v12","category":"named_model","sec":11,"tier":2,"sources":[{"title":"Tesla Software Release 2024.3 release notes (FSD Supervised v12)","url":"https://tesla-info.com/release/2024.3"},{"title":"Tesla pushes end-to-end neural networks for highway driving, but only for newer vehicles (Electrek, 2024-11)","url":"https://electrek.co/2024/11/14/tesla-pushes-end-to-end-neural-networks-for-highway-driving-but-only-for-newer-vehicles/"},{"title":"Elon Musk demonstrates Tesla FSD 12 in a live stream (Tesla Oracle, 2023-08)","url":"https://www.teslaoracle.com/2023/08/27/elon-musk-demonstrates-tesla-fsd-12-no-code-autopilot-ai"}],"as_of":"2024-11","related_ids":["end-to-end","autonomous-driving","imitation-learning","tesla","data-flywheel","uniad"],"name":"特斯拉 FSD V12（端到端自动驾驶）","alt":"Tesla FSD v12 (End-to-End Neural Network Driving)","abbr":"FSD","aliases":["FSD V12","FSD Beta v12","Full Self-Driving (Supervised) v12","特斯拉端到端智驾"],"one_liner":"特斯拉 2024 年推送的智驾版本，城市道路改由一个端到端神经网络来开。","explanation":"FSD（Full Self-Driving）是特斯拉的驾驶辅助软件，正式名带「Supervised」，仍需司机监督。V12 改的是架构：马斯克 2023 年 8 月直播试驾，2024 年初推送给用户，3 月 v12.3 扩大推送并给美国车主一个月免费试用。按特斯拉的说法，城市道路驾驶栈换成一个用数百万段视频训练的端到端神经网络，替掉 30 多万行手写 C++ 规则代码：摄像头画面进、驾驶控制出，中间不再有人工设计的规则。2024 年 11 月 v12.5.6.3 把高速也换成端到端，但只给 HW4 硬件的车。V12 让「端到端」成了行业热词，智驾和具身智能圈常拿它说明数据驱动路线可行；特斯拉没公开模型细节。","example":"2023 年 8 月马斯克直播试驾 V12 约 45 分钟，只接管了一次：车在繁忙路口误判信号灯、准备闯红灯。他称系统里没有专门写红绿灯处理的代码，这类行为是从车队视频里学出来的。","related":["端到端","自动驾驶","模仿学习","特斯拉","数据飞轮","UniAD（规划导向的端到端自动驾驶）"]},{"id":"drivevlm","category":"named_model","sec":11,"tier":3,"sources":[{"title":"DriveVLM (arXiv 2402.12289)","url":"https://arxiv.org/abs/2402.12289"},{"title":"DriveVLM 项目主页","url":"https://tsinghua-mars-lab.github.io/DriveVLM/"}],"as_of":"2024-11","related_ids":["dual-system-architecture","autonomous-driving","vision-language-model","chain-of-thought","long-tail-problem","qwen-vl"],"name":"DriveVLM（快慢双系统智驾）","alt":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","abbr":"","aliases":["DriveVLM-Dual"],"one_liner":"清华与理想汽车 2024 年提出：视觉语言模型慢思考、传统规划器快执行的智驾方案。","explanation":"DriveVLM 是清华大学交叉信息研究院赵行团队与理想汽车于 2024 年 2 月提出的自动驾驶方法，发表于 CoRL 2024。传统自动驾驶流水线应对罕见、复杂的长尾场景能力有限。DriveVLM 用视觉语言模型（VLM，底座为 Qwen-VL）按思维链做三步：场景描述、场景分析、分层规划，最后给出行驶轨迹。但 VLM 空间定位不够精确、推理又慢，于是论文提出 DriveVLM-Dual：VLM 低频输出粗略参考轨迹（慢系统），传统感知与规划模块以高频把它细化成实际轨迹（快系统），两者异步协作。论文称该系统已部署到量产车上，在两颗 Orin X 芯片的车载平台上平均推理约 410 毫秒。这种分工与机器人领域的快慢双系统架构（如 Figure 的 Helix）思路一致。","example":"遇到少见路况时，VLM 先描述场景、找出会影响本车的关键物体并分析其影响，再给出「减速、绕行」这类高层决策和粗略轨迹，由传统规划器实时细化成可执行轨迹。","related":["快慢双系统","自动驾驶","视觉语言模型","思维链","长尾问题","通义千问 Qwen-VL"]},{"id":"gaia-2","category":"named_model","sec":11,"tier":3,"sources":[{"title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving (arXiv 2503.20523)","url":"https://arxiv.org/abs/2503.20523"},{"title":"GAIA-2（Wayve 官方博客）","url":"https://wayve.ai/thinking/gaia-2/"}],"as_of":"2025-03","related_ids":["world-model","autonomous-driving","latent-diffusion-model","synthetic-data","waymo-world-model","nvidia-cosmos"],"name":"Wayve GAIA-2","alt":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving (Wayve)","abbr":"GAIA","aliases":["GAIA-2"],"one_liner":"英国自动驾驶公司 Wayve 2025 年的驾驶世界模型，可控地生成多路摄像头驾驶视频。","explanation":"GAIA-2 是英国自动驾驶公司 Wayve 在 2025 年 3 月 26 日发布的生成式世界模型，是 GAIA-1 的后续。这里的世界模型指能按给定条件「想象」出驾驶场景未来画面的视频生成模型。GAIA-2 从 GAIA-1 的自回归 token 生成改为视频分词器加潜在扩散（先把视频压缩到隐空间，再在隐空间里去噪生成）的架构，原生支持多个摄像头同时生成且彼此在时间和空间上一致，数据覆盖英国、美国、德国。生成时可以控制自车的速度和转向、其他车辆和行人的行为、天气和时段、车道和路口等道路结构。用途是批量制造合成数据、在真实行车记录上改出变体，以及生成罕见的危险场景来测试驾驶模型。它是世界模型在物理 AI 中较早落地的案例之一。","example":"拿一段真实的多摄像头行车记录，把天气改成大雨，再加一辆突然切入的车，生成一组新的环视视频，用来检验驾驶模型遇到这种少见情况时的反应。","related":["世界模型","自动驾驶","潜在扩散模型","合成数据","Waymo 世界模型","Cosmos"]},{"id":"nvidia-alpamayo","category":"named_model","sec":11,"tier":3,"sources":[{"title":"Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail (arXiv 2511.00088)","url":"https://arxiv.org/abs/2511.00088"},{"title":"NVlabs/alpamayo GitHub 仓库（Alpamayo 1）","url":"https://github.com/NVlabs/alpamayo"},{"title":"NVIDIA Announces Alpamayo Family of Open-Source AI Models（NVIDIA Newsroom，2026-01-05）","url":"https://nvidianews.nvidia.com/news/alpamayo-autonomous-vehicle-development"}],"as_of":"2026-01","related_ids":["vision-language-action-model","autonomous-driving","chain-of-thought","nvidia-cosmos-reason","action-expert","long-tail-problem"],"name":"英伟达 Alpamayo（驾驶推理 VLA）","alt":"NVIDIA DRIVE Alpamayo-R1 / Alpamayo 1 (open reasoning VLA for autonomous driving)","abbr":"AR1","aliases":["Alpamayo-R1","Alpamayo 1","Alpamayo-R1-10B"],"one_liner":"英伟达开放的自动驾驶推理 VLA，先用文字讲清为什么这样开，再输出行驶轨迹。","explanation":"Alpamayo-R1 是英伟达的自动驾驶视觉-语言-动作模型，论文 2025 年 10 月底上 arXiv，12 月在 Hugging Face 开放权重，2026 年 1 月 CES 上改名 Alpamayo 1，与仿真框架 AlpaSim、1700 多小时的开放驾驶数据一起发布。它针对罕见的长尾路况：只模仿轨迹容易在没见过的场景出错，于是让模型先写出「因果链」推理（看到什么、所以怎么做），再生成轨迹。开放版以 Cosmos-Reason 视觉语言模型为骨干（8.2B），加 2.3B 的扩散式动作专家，输入 4 路相机画面和自车运动历史，输出未来 6.4 秒轨迹。论文报告难场景规划精度最多提升 12%，闭环仿真中近距离险情减少 35%，车上延迟约 99 毫秒。","example":"遇到前方车道被施工锥桶封住时，模型会先输出一段说明（如前方车道封闭、需减速并变道绕行），再给出与之对应的 6.4 秒行驶轨迹，工程师可对照文字检查它为什么这样开。","related":["视觉-语言-动作模型","自动驾驶","思维链","Cosmos Reason","动作专家","长尾问题"]},{"id":"waymo-world-model","category":"named_model","sec":11,"tier":3,"sources":[{"title":"The Waymo World Model: A New Frontier for Autonomous Driving Simulation (Waymo Blog)","url":"https://waymo.com/blog/2026/02/the-waymo-world-model-a-new-frontier-for-autonomous-driving-simulation"}],"as_of":"2026-02","related_ids":["genie-3","world-model","autonomous-driving","interactive-world-model","long-tail-problem","lidar"],"name":"Waymo 世界模型","alt":"The Waymo World Model (built on Genie 3)","abbr":"","aliases":["Waymo World Model"],"one_liner":"Waymo 基于 Genie 3 的驾驶仿真生成模型，可同时生成相机和激光雷达数据","explanation":"Waymo 于 2026 年 2 月 6 日公布的生成式世界模型，用于大规模自动驾驶仿真。它建立在 Google DeepMind 的可交互世界模型 Genie 3 之上，借助后者在海量视频上的预训练，生成照片级、可交互的 3D 驾驶环境，并同时输出摄像头和激光雷达两种传感器数据。它主要针对自动驾驶的长尾问题：极端天气、自然灾害、罕见物体等危险情况在真实路测中很少遇到，却必须提前测过。控制方式有三种：改变自车驾驶动作，做「当时如果这样开会怎样」的反事实推演；控制道路布局和交通状况；用语言调整时间、天气，甚至生成完全合成的场景。它说明通用世界模型已开始被用作具身系统的测试环境和数据来源。","example":"用一句话把一段真实的晴天路测场景改成暴雨夜晚，再让自车换一种变道方式，观察自动驾驶系统在同一路段的反应。","related":["Genie 3","世界模型","自动驾驶","可交互世界模型","长尾问题","激光雷达"]},{"id":"google-deepmind","category":"company","sec":0,"tier":1,"sources":[{"title":"Google DeepMind - Wikipedia","url":"https://en.wikipedia.org/wiki/Google_DeepMind"},{"title":"Gemini Robotics 2 brings whole-body intelligence to robots","url":"https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/"}],"as_of":"2026-07","related_ids":["rt-2","gemini-robotics","gemini-robotics-2","open-x-embodiment","genie-3","vision-language-action-model"],"name":"谷歌 DeepMind","alt":"Google DeepMind","abbr":"GDM","aliases":["DeepMind","Robotics at Google","Google Brain 机器人团队"],"one_liner":"谷歌的 AI 研究部门，RT 系列和 Gemini Robotics 的出处","explanation":"DeepMind 2010 年由 Demis Hassabis、Shane Legg、Mustafa Suleyman 在伦敦创立，2014 年 1 月被谷歌收购，2023 年 4 月与 Google Brain 合并为 Google DeepMind，总部仍在伦敦。机器人方向在合并前后（原 Google Brain 的机器人团队 Robotics at Google 已并入）的代表工作有 RT-1、RT-2（首批 VLA 之一）、Open X-Embodiment 跨本体数据集、RoboCat、ALOHA Unleashed。2025 年起转向 Gemini Robotics 系列：3 月发布首版，9 月 1.5，2026 年 7 月 30 日发布支持人形全身控制的 Gemini Robotics 2。硬件上与 Apptronik、波士顿动力合作。","example":"RT-2 把网页图文训练出的视觉语言模型直接微调成输出机器人动作 token，让 VLA 这个叫法流行起来。","related":["RT-2","Gemini Robotics","Gemini Robotics 2","Open X-Embodiment 数据集","Genie 3","视觉-语言-动作模型"]},{"id":"nvidia","category":"company","sec":0,"tier":1,"sources":[{"title":"NVIDIA and Global Robotics Leaders Take Physical AI to the Real World (GTC 2026)","url":"https://nvidianews.nvidia.com/news/nvidia-and-global-robotics-leaders-take-physical-ai-to-the-real-world"},{"title":"Jetson Thor","url":"https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-thor/"},{"title":"Hugging Face - Wikipedia（英伟达收购报道）","url":"https://en.wikipedia.org/wiki/Hugging_Face"}],"as_of":"2026-09","related_ids":["nvidia-three-computer-solution","nvidia-isaac-lab","nvidia-isaac-gr00t-n1","nvidia-cosmos","nvidia-jetson-thor","nvidia-generalist-embodied-agent-research-lab"],"name":"英伟达","alt":"NVIDIA","abbr":"","aliases":["Nvidia","辉达"],"one_liner":"GPU 巨头，提供机器人训练、仿真、部署的全套算力与软件","explanation":"英伟达 1993 年由黄仁勋等人创立，总部在加州圣克拉拉，靠 GPU 成为 AI 训练算力的主要供应商。在具身智能里，它提出「三台计算机」：DGX 集群训练模型，Omniverse 和 Isaac Sim/Isaac Lab 做仿真和合成数据，Jetson Thor 装在机器人上跑模型。它还自己出模型：GR00T N1 系列人形基础模型（2025 年 3 月起）、Cosmos 世界基础模型（2026 年 3 月 GTC 公布第三代 Cosmos 3）；同场还预告了改走「世界动作模型」路线的 GR00T N2，计划年底前开放。研究由 GEAR 实验室等团队负责。2026 年 9 月 3 日，英伟达宣布收购 Hugging Face（待监管批准）。","example":"很多四足、人形的强化学习运控策略是在 Isaac Lab 里用上千个并行环境训练，再部署到 Jetson 上。","related":["英伟达三台计算机","Isaac Lab","GR00T N1 系列","Cosmos","Jetson Thor","英伟达 GEAR 实验室"]},{"id":"tesla","category":"company","sec":0,"tier":1,"sources":[{"title":"Optimus (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Optimus_(robot)"}],"as_of":"2026-09","related_ids":["tesla-optimus","tesla-optimus-v3","tesla-supply-chain","tesla-fsd-v12","tesla-ai-day","mass-production"],"name":"特斯拉","alt":"Tesla","abbr":"","aliases":["Tesla Optimus 团队"],"one_liner":"电动车公司，人形机器人 Optimus（擎天柱）的研发方","explanation":"特斯拉 2003 年成立，总部在得州奥斯汀，以电动车和 FSD 辅助驾驶闻名。它的具身智能项目是人形机器人 Optimus：2021 年 8 月 AI Day 公布，2023 年 12 月发布第二代，思路是复用自动驾驶的视觉神经网络、电池和电机供应链。2025 年 6 月项目负责人 Milan Kovac 离职，由 Autopilot 负责人 Ashok Elluswamy 接手。马斯克称目标售价约 3 万美元，弗里蒙特工厂在装年产 100 万台的产线，得州工厂规划更大产线。截至 2026 年 9 月，面向量产的第三代尚未发布。它的量产计划带动了国内一批零部件公司，被称为「T 链」。","example":"","related":["擎天柱","特斯拉 Optimus V3（Gen 3）","T 链（特斯拉链）","特斯拉 FSD V12（端到端自动驾驶）","特斯拉 AI Day","量产"]},{"id":"hugging-face","category":"company","sec":0,"tier":1,"sources":[{"title":"Hugging Face - Wikipedia","url":"https://en.wikipedia.org/wiki/Hugging_Face"},{"title":"SmolVLA - Hugging Face Blog","url":"https://huggingface.co/blog/smolvla"}],"as_of":"2026-09","related_ids":["lerobot","smolvla","so-100-so-101-arm","pollen-robotics-reachy-mini","pollen-robotics","lerobotdataset"],"name":"Hugging Face","alt":"Hugging Face","abbr":"HF","aliases":["抱抱脸","Hugging Face Hub"],"one_liner":"开源 AI 模型与数据集托管平台，机器人方向做 LeRobot","explanation":"Hugging Face 2016 年由法国创业者 Clément Delangue、Julien Chaumond、Thomas Wolf 创立，总部在纽约。它最出名的是模型和数据集托管平台 Hub 与 Transformers 库，研究者下载开源权重、上传数据集基本都经过它。机器人方向，它推出开源框架 LeRobot（统一的数据集格式、训练和部署代码），配套零件成本一百多美元的 SO-100/SO-101 开源机械臂；2025 年 4 月收购法国人形机器人公司 Pollen Robotics（Reachy 2），6 月发布小型 VLA SmolVLA。2023 年 8 月融资后估值 45 亿美元。2026 年 9 月 3 日英伟达宣布以约 129 亿美元收购它，交易预计 2027 年上半年完成，还需监管批准；英伟达称 Hugging Face 会保留品牌、继续做开放平台。","example":"新手用 LeRobot 遥操作 SO-101 录几十条演示，上传到 Hub，再一条命令训练 ACT 或 SmolVLA。","related":["LeRobot","SmolVLA","SO-100 / SO-101 机械臂","Reachy Mini 桌面机器人","Pollen Robotics","LeRobot 数据集格式"]},{"id":"nvidia-generalist-embodied-agent-research-lab","category":"company","sec":0,"tier":2,"sources":[{"title":"NVIDIA GEAR Lab","url":"https://research.nvidia.com/labs/gear/"},{"title":"GR00T N1 paper","url":"https://arxiv.org/abs/2503.14734"}],"as_of":"2026-04","related_ids":["nvidia-isaac-gr00t-n1",null,"eureka","voyager","dreamgen","sonic"],"name":"英伟达 GEAR 实验室","alt":"NVIDIA Generalist Embodied Agent Research Lab","abbr":"GEAR","aliases":["NVIDIA GEAR Lab","GEAR Lab"],"one_liner":"英伟达研究院的具身智能组，GR00T 人形模型出自这里","explanation":"GEAR 是英伟达研究院里做通用具身智能体的团队，由 Jim Fan（范麟熙，斯坦福博士）和 Yuke Zhu（朱玉可，同时是 UT Austin 教授）共同领导，据报道 2024 年初正式成立，目标是为虚拟和物理世界里的智能体做基础模型。团队成员早期做过 Minecraft 智能体 Voyager、MineDojo，以及用大模型写奖励函数的 Eureka。成立后主打人形机器人基础模型 GR00T：N1（2025 年 3 月开源）到 N1.7（2026 年 4 月），并做了 DreamGen 合成数据、SONIC 全身控制、EgoScale 人类视频预训练、DreamZero 世界动作模型等。","example":"开发者可以下载 GR00T N1.x 权重，用自己机器人的几十条演示微调，得到能听指令干活的策略。","related":["GR00T N1 系列","英伟达(NVIDIA)","Eureka","Voyager","DreamGen（GR00T Dreams）","SONIC"]},{"id":"openai","category":"company","sec":0,"tier":2,"sources":[{"title":"OpenAI - Wikipedia","url":"https://en.wikipedia.org/wiki/OpenAI"},{"title":"Caitlin Kalinowski - Wikipedia","url":"https://en.wikipedia.org/wiki/Caitlin_Kalinowski"},{"title":"Solving Rubik's Cube with a Robot Hand","url":"https://arxiv.org/abs/1910.07113"}],"as_of":"2026-04","related_ids":["dactyl","clip","openai-gpt-series","sora",null],"name":"OpenAI","alt":"OpenAI","abbr":"","aliases":[],"one_liner":"ChatGPT 的开发商，早年做过机器人魔方灵巧手","explanation":"OpenAI 是 2015 年 12 月在旧金山成立的 AI 公司，创始人包括 Sam Altman、Elon Musk、Ilya Sutskever、Greg Brockman 等，以 GPT 系列和 ChatGPT 闻名，CLIP、Sora 也出自这里。它和具身的渊源在机器人：2018–2019 年的 Dactyl 用强化学习加域随机化，让 Shadow 灵巧手在仿真中训练后到真机转魔方，据报道机器人团队 2021 年解散。2024 年 11 月聘请 Caitlin Kalinowski 负责机器人和消费硬件，她于 2026 年 3 月辞职。公司 2025 年 10 月改制为公益公司，2026 年 4 月投后估值约 8520 亿美元。","example":"很多机器人模型用 OpenAI 的 CLIP 当视觉或文本编码器，把图像和语言放进同一个向量空间。","related":["Dactyl（OpenAI 魔方灵巧手）","CLIP","GPT 系列（GPT-4o / GPT-5）","Sora（视频生成即世界模拟器）","自动域随机化(Automatic Domain Randomization)"]},{"id":"meta","category":"company","sec":0,"tier":2,"sources":[{"title":"Meta buys robotics startup to bolster its humanoid AI ambitions (TechCrunch, 2026-05)","url":"https://techcrunch.com/2026/05/01/meta-buys-robotics-startup-to-bolster-its-humanoid-ai-ambitions/"},{"title":"Meta wants to become the Android of robotics (Engadget, 2025-09)","url":"https://www.engadget.com/big-tech/meta-wants-to-become-the-android-of-robotics-220701800.html"},{"title":"Meta Platforms accelerates robotics efforts with leadership changes (DIGITIMES, 2025-11)","url":"https://www.digitimes.com/news/a20251119PD205/meta-robotics-humanoid-robot-smart-glasses.html"}],"as_of":"2026-05","related_ids":["meta-fundamental-ai-research","assured-robot-intelligence","v-jepa-2","digit-360","meta-motivo","ami-labs"],"name":"Meta","alt":"Meta Platforms","abbr":"","aliases":["Meta Platforms, Inc.","Facebook","脸书"],"one_liner":"Facebook 母公司，旗下 FAIR 研究世界模型，还在研发人形机器人。","explanation":"Meta 前身是 2004 年扎克伯格创办的 Facebook，2021 年改名，总部在美国加州门洛帕克。和具身相关的有两条线。一是基础研究部门 FAIR，做出视频世界模型 V-JEPA 2、视触觉传感器 Digit 360、仿真人形控制模型 Meta Motivo 等，多数开源。二是 2025 年 2 月在 Reality Labs 成立的人形机器人团队，由前 Cruise CEO Marc Whitten 带领，内部项目叫 Metabot；CTO Andrew Bosworth 2025 年 9 月称，Meta 想做能授权给其他机器人厂商的软件平台，类似安卓。2026 年 5 月，Meta 收购做人形全身控制的初创公司 ARI，团队并入超级智能实验室（MSL）。","example":"V-JEPA 2-AC 就是在 Meta 开源的视频模型上接一个动作预测器当世界模型，在 Franka 机械臂上零样本做抓取放置。","related":["Meta FAIR","Assured Robot Intelligence","V-JEPA 2","Digit 360","Meta Motivo（人形行为基础模型）","AMI Labs"]},{"id":"meta-fundamental-ai-research","category":"company","sec":0,"tier":2,"sources":[{"title":"Meta AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Meta_AI"},{"title":"Yann LeCun - Wikipedia","url":"https://en.wikipedia.org/wiki/Yann_LeCun"}],"as_of":"2026-03","related_ids":["v-jepa-2",null,"dinov2","habitat",null,"joint-embedding-predictive-architecture"],"name":"Meta FAIR","alt":"Meta Fundamental AI Research","abbr":"FAIR","aliases":["Facebook AI Research","Meta AI"],"one_liner":"Meta 的基础 AI 研究部门，出过 SAM、DINO、V-JEPA、Habitat","explanation":"FAIR 是 Meta（原 Facebook）2013 年成立的基础 AI 研究部门，原名 Facebook AI Research，Yann LeCun 担任首任负责人，最早的实验室设在纽约，后来在门洛帕克、伦敦、巴黎等地都有团队。和具身相关的成果很多：分割一切模型 SAM 系列、自监督视觉模型 DINOv2/DINOv3、视频世界模型 V-JEPA 2、室内导航仿真器 Habitat、DIGIT 与 Digit 360 视触觉传感器等，多数开源，被机器人研究广泛当作底座。2025 年 Meta 把 FAIR 和大模型团队并入 Meta 超级智能实验室（MSL）；LeCun 于 2025 年 11 月离职，创办做世界模型的 AMI Labs。","example":"很多操作策略直接用 DINOv2 当视觉编码器，用 SAM 从图里抠出目标物体的掩码。","related":["V-JEPA 2","分割一切模型(Segment Anything Model)","DINOv2","Habitat","DIGIT 视触觉传感器(DIGIT)","联合嵌入预测架构"]},{"id":"amazon-robotics","category":"company","sec":0,"tier":2,"sources":[{"title":"Amazon Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Amazon_Robotics"},{"title":"Amazon launches a new AI foundation model to power its robotic fleet and deploys its 1 millionth robot","url":"https://www.aboutamazon.com/news/operations/amazon-million-robots-ai-foundation-model"}],"as_of":"2025-07","related_ids":["amazon-vulcan","autonomous-mobile-robot","amazon-frontier-ai-and-robotics","covariant","agility-robotics","fleet-management-system"],"name":"亚马逊机器人","alt":"Amazon Robotics","abbr":"","aliases":["Kiva Systems"],"one_liner":"亚马逊的仓储机器人部门，前身是 Kiva，机队超百万台","explanation":"前身是 2003 年创立的 Kiva Systems，创始人包括 Mick Mountz、Peter Wurman 和 Raffaello D'Andrea。Kiva 的橙色小车钻到货架底下，把整个货架搬到拣货员面前，把「人找货」变成「货找人」。亚马逊 2012 年以 7.75 亿美元收购 Kiva，2015 年改名 Amazon Robotics，总部在美国马萨诸塞州。之后陆续推出能在人群中自主穿行的移动机器人 Proteus、搬运货架的 Hercules、带触觉的拣货机器人 Vulcan 等。2025 年亚马逊部署的机器人突破 100 万台，分布在 300 多个设施，同时发布调度整个机队行驶路线的生成式基础模型 DeepFleet，官方称行驶效率提升约 10%。它代表已大规模落地的专用仓储自动化，可以和通用人形机器人路线对照着看。","example":"Vulcan 用力觉感知在塞满商品的货架格里推开别的货物，完成放货和取货。","related":["Amazon Vulcan 触觉拣货机器人","自主移动机器人","亚马逊前沿 AI 与机器人团队","Covariant","Agility Robotics","多机调度系统"]},{"id":"softbank-group","category":"company","sec":0,"tier":2,"sources":[{"title":"SoftBank Group - Wikipedia","url":"https://en.wikipedia.org/wiki/SoftBank_Group"},{"title":"Acquisition of ABB Ltd's Robotics Business（SoftBank Group 新闻稿，2025-10-08）","url":"https://group.softbank/en/news/press/20251008"},{"title":"Skild AI Series C","url":"https://www.skild.ai/blogs/series-c"}],"as_of":"2026-01","related_ids":["skild-ai","boston-dynamics","abb-robotics","softbank-robotics-pepper","softbank-robotics-nao","agile-robots"],"name":"软银集团","alt":"SoftBank Group","abbr":"SBG","aliases":["软银","SoftBank"],"one_liner":"日本科技投资集团，近年在机器人和物理 AI 上大笔押注","explanation":"软银集团由孙正义 1981 年创立，总部在东京，是一家以科技投资为主的控股公司，旗下有规模超过千亿美元的愿景基金，持有芯片设计公司 Arm 约九成股份，也是 OpenAI 的大股东之一。它和机器人的关系很早：2012 年控股 NAO 的开发商、法国 Aldebaran，2014 年与其推出 Pepper（2022 年又把 Aldebaran 卖出）；2017 年从谷歌买下波士顿动力，2020 年把 80% 股权卖给现代汽车。2025 年起软银把机器人当作「物理 AI」战略的一部分：10 月宣布以 53.75 亿美元收购 ABB 的机器人业务（原计划 2026 年中后期完成交割），2026 年 1 月领投 Skild AI 的 14 亿美元融资，此前还投过思灵机器人等。具身智能新闻里的大额融资，常能看到它的名字。","example":"2026 年 1 月 Skild AI 完成 14 亿美元融资、估值超过 140 亿美元，领投方就是软银。","related":["Skild AI","波士顿动力","ABB","Pepper 机器人","NAO 机器人","思灵机器人"]},{"id":"huawei","category":"company","sec":0,"tier":2,"sources":[{"title":"Huawei - Wikipedia","url":"https://en.wikipedia.org/wiki/Huawei"},{"title":"华为云 CloudRobo 具身智能平台","url":"https://www.huaweicloud.com/product/cloudrobo.html"}],"as_of":"2026-09","related_ids":["huawei-cloud-cloudrobo-embodied-ai-platform","compute-architecture-for-neural-networks","mindspore","cloud-edge-device-collaboration","robot-brain-company","m-robots-os"],"name":"华为","alt":"Huawei","abbr":"","aliases":["华为云","Huawei Cloud","华为技术有限公司"],"one_liner":"深圳的通信与科技巨头，以芯片、云平台和大模型切入具身智能。","explanation":"华为 1987 年 9 月在深圳创立，创始人任正非曾在解放军基建工程兵任职，主业是通信设备、手机、芯片和云计算。华为不量产人形机器人，而是做底层的算力、平台和模型：昇腾 AI 芯片及 CANN 软件栈、昇思 MindSpore 深度学习框架、盘古大模型，以及华为云的具身智能开发平台 CloudRobo。CloudRobo 目前在公测，提供操作和导航数据、仿真资产、模型训练和仿真加真机评测，并开放 R2C 协议，官方称能把新机器人本体的适配时间从周级缩短到小时级。据报道华为还在深圳设立了具身智能产业创新中心，与多家本体厂商合作。","example":"本体厂商通过 CloudRobo 的 R2C 协议接入自家机器人，在云上用平台数据训练模型，再做仿真和真机评测。","related":["华为云 CloudRobo","昇腾 CANN","昇思 MindSpore","云边端协同","大脑公司","M-Robots OS"]},{"id":"alibaba-group","category":"company","sec":0,"tier":2,"sources":[{"title":"阿里千问发布 Qwen-Robot 具身模型系列（量子位，2026-06）","url":"https://www.qbitai.com/2026/06/435873.html"},{"title":"阿里入场 具身智能迎来超级玩家（财联社）","url":"https://www.cls.cn/detail/2164819"},{"title":"首度布局人形机器人 阿里投了这家深圳企业（财联社，2024-05）","url":"https://www.cls.cn/detail/1681264"}],"as_of":"2026-06","related_ids":["qwen-robot-series","alibaba-damo-academy","rynnbrain","x-square-robot","limx-dynamics","pragmatik-labs"],"name":"阿里巴巴","alt":"Alibaba Group","abbr":"","aliases":["阿里","阿里巴巴集团","Alibaba"],"one_liner":"杭州互联网巨头，自研千问具身模型，同时投资多家机器人本体公司。","explanation":"阿里巴巴集团 1999 年由马云等人在杭州创立，主业是电商和阿里云。它在具身智能上走「自研大脑、投资本体」的路子。模型侧，达摩院 2026 年 2 月开源具身大脑模型 RynnBrain；通义千问团队 6 月 16 日发布 Qwen-Robot 系列，含操作 RobotManip、导航 RobotNav 和世界模型 RobotWorld 三款。投资侧，2024 年 5 月入股逐际动力，2025 年 9 月阿里云领投自变量机器人近 10 亿元 A+ 轮，还投了星动纪元、穹彻智能等。2025 年 10 月，时任千问技术负责人林俊旸称团队内已组建机器人与具身智能小组；他 2026 年 3 月离职，后创办语用科技。","example":"新闻说「阿里入局具身」时，多指千问发布 Qwen-Robot 模型、阿里云领投自变量这类动作；机器人整机主要靠投资本体公司。","related":["千问 Qwen-Robot 系列","阿里达摩院","达摩院 RynnBrain","自变量机器人","逐际动力","语用科技"]},{"id":"robbyant","category":"company","sec":0,"tier":2,"sources":[{"title":"Robbyant 官网","url":"https://www.robbyant.com/"},{"title":"Robbyant Technology","url":"https://technology.robbyant.com/"},{"title":"Robbyant | LinkedIn","url":"https://www.linkedin.com/company/robbyant"}],"as_of":"2026-09","related_ids":["lingbot-vla","lingbot-va","lingbot-world","lingbot-depth",null,null],"name":"蚂蚁灵波","alt":"Robbyant","abbr":"","aliases":["灵波科技","蚂蚁集团具身智能"],"one_liner":"蚂蚁集团旗下具身智能公司，开源 LingBot 系列模型","explanation":"蚂蚁灵波（Robbyant）是蚂蚁集团旗下的具身智能公司，口号是「给所有机器人做一个大脑」，面向养老、医疗辅助、家务等服务场景，同时做模型和整机。2026 年 1 月起集中开源 LingBot 系列：LingBot-Depth（透明反光物体的深度补全）、LingBot-VLA（约 2 万小时真机数据预训练的视觉-语言-动作模型）、LingBot-World（基于通义万相改造的可交互世界模型）和 LingBot-VA（世界动作模型），其中 LingBot-VLA、LingBot-World、LingBot-VA 后来都升级到了 2.0 版。据其 LinkedIn，GitHub 星标 200 天破 3 万。官网列出的硬件包括 Robbyant R2 机器人和可换装的灵巧手、夹爪。","example":"研究者可以拿 LingBot-VLA 的开源权重，在自家双臂机器人上用少量数据微调做桌面操作。","related":["蚂蚁灵波 LingBot-VLA","蚂蚁灵波 LingBot-VA","蚂蚁灵波 LingBot-World","蚂蚁灵波 LingBot-Depth","世界动作模型(World Action Model)","开放权重(Open-weight Model)"]},{"id":"bytedance-seed","category":"company","sec":0,"tier":2,"sources":[{"title":"ByteDance Seed 官网","url":"https://seed.bytedance.com/en/"},{"title":"ByteDance - Wikipedia","url":"https://en.wikipedia.org/wiki/ByteDance"}],"as_of":"2026-08","related_ids":["seed-gr-3","gr-rl","robix","gr-1","bagel","vision-language-action-model"],"name":"字节跳动 Seed","alt":"ByteDance Seed","abbr":"","aliases":["字节 Seed","Seed 机器人团队","Seed"],"one_liner":"字节跳动的基础大模型团队，机器人方向做 GR 系列 VLA","explanation":"字节跳动 Seed 是字节跳动 2023 年组建的基础大模型研发团队，豆包大模型、图像生成 Seedream、视频生成 Seedance 都出自这里。机器人方向的 GR 系列起步于字节研究团队：GR-1（2023 年底）和 GR-2（2024 年 10 月）先在大规模视频上做生成式预训练，再用机器人数据微调。2025 年起以 Seed 名义发布：7 月推出约 40 亿参数的 VLA（视觉-语言-动作模型）GR-3 和双臂移动机器人 ByteMini，9 月发布负责高层推理与人机对话的 Robix，12 月发布面向灵巧手的 GR-Dexter 和结合强化学习的 GR-RL。团队还开源了统一多模态模型 BAGEL。整体路线是把视频生成、视觉语言模型和真机数据结合，做能完成长程精细任务的通用机器人。","example":"GR-3 驱动 ByteMini 按语言指令收拾餐桌、把衣服挂上衣架。","related":["字节 GR-3","字节 GR-RL","字节 Robix","字节 GR-1","BAGEL","视觉-语言-动作模型"]},{"id":"tencent-robotics-x-lab","category":"company","sec":0,"tier":2,"sources":[{"title":"极客公园：具身智能，腾讯「低调入局」","url":"https://www.geekpark.net/news/351962"},{"title":"华尔街见闻：对话腾讯首席科学家张正友","url":"https://wallstreetcn.com/articles/3777373"}],"as_of":"2026-07","related_ids":["tencent-tairos-embodied-ai-open-platform","tencent-hy-embodied","quadruped-robot","wheel-legged-robot","embodied-foundation-model","one-brain-multiple-robots"],"name":"腾讯 Robotics X 实验室","alt":"Tencent Robotics X Lab","abbr":"","aliases":["腾讯 Robotics X","腾讯机器人实验室"],"one_liner":"腾讯 2018 年成立的机器人研究实验室，现主推具身智能软件平台","explanation":"腾讯在 2018 年成立的机器人前沿研究部门，由腾讯首席科学家张正友领导（他此前在微软研究院工作，相机标定里常用的「张氏标定法」就是他提出的）。早期国内几乎没有成熟的机器人本体可合作，实验室从硬件到软件全栈自研，做过多模态四足机器人 Max、轮腿机器人 Ollie、家用机器人原型「小五」等。2025 年初腾讯明确表示要做机器人厂商的合作伙伴而不自己卖硬件；同年 7 月世界人工智能大会上发布具身智能开放平台 Tairos（「钛螺丝」），以模块化方式对外提供大模型、开发工具和数据服务，已与宇树、智元、越疆、乐聚等厂商合作。之后又和混元团队推出 HY-Embodied 系列具身模型。","example":"机器人厂商可以不自研大脑，直接调用 Tairos 平台里的感知、规划模型，接到自己的本体上做导览或搬运。","related":["腾讯 Tairos","腾讯 HY-Embodied（混元具身）","四足机器人","轮足机器人","具身大模型","一脑多机"]},{"id":"jd-com","category":"company","sec":0,"tier":2,"sources":[{"title":"证券时报：京东投资三家具身智能机器人企业","url":"https://stcn.com/article/detail/2666033.html"},{"title":"钛媒体：京东，具身智能大玩家？","url":"https://www.tmtpost.com/8152876.html"},{"title":"新京报：资本疯狂投喂机器人赛道","url":"https://www.bjnews.com.cn/detail/1782822930129028.html"}],"as_of":"2026-09","related_ids":["agibot","limx-dynamics","spirit-ai","engineai","meituan","data-flywheel"],"name":"京东（具身智能投资）","alt":"JD.com","abbr":"","aliases":["京东","京东集团"],"one_liner":"电商物流巨头，2025 年起密集投资具身智能并自建数据与场景","explanation":"京东是刘强东 1998 年创办、总部在北京的电商与物流集团。据报道，2025 年 3 月它成立集团级具身智能专项部门，由前商汤副总裁沈徽牵头；探索研究院开源了双臂移动操作数据集 JD ManiData。2025 年先后投资智元机器人，并在 7 月 21 日同日领投千寻智能、逐际动力、众擎机器人，随后又投了 RoboScience 和帕西尼感知，覆盖本体、大模型、触觉与灵巧手。2026 年 6 月关联基金联合领投世界模型公司无界动力超 2 亿美元天使轮。它还把对话智能体 JoyInside 接入机器人，建设具身数据采集中心并开源人类视角数据集 EgoLive，把商场、仓库等门店当作机器人训练场。","example":"2025 年 7 月 21 日，千寻智能宣布完成近 6 亿元 Pre-A+ 轮融资，由京东领投。","related":["智元机器人","逐际动力","千寻智能","众擎机器人","美团（具身智能投资）","数据飞轮"]},{"id":"meituan","category":"company","sec":0,"tier":2,"sources":[{"title":"美团，重注具身智能（投中网）","url":"https://www.chinaventure.com.cn/news/78-20250710-387094.html"},{"title":"美团另一面：投资中国硬科技8年，宇树科技的早期支持者（经济观察网）","url":"http://m.eeo.com.cn/2026/0604/901917.shtml"},{"title":"外卖巨头决定深耕科技投资（观点网）","url":"https://www.guandian.cn/article/20260509/559873.html"}],"as_of":"2026-06","related_ids":["unitree-robotics","galaxea-ai","x-square-robot","tars-robotics","mech-mind-robotics","jd-com"],"name":"美团（具身智能投资）","alt":"Meituan","abbr":"","aliases":["美团战投","美团龙珠"],"one_liner":"中国本地生活平台，也是国内最活跃的具身智能投资方之一","explanation":"美团是王兴 2010 年创办的外卖和本地生活平台，总部北京。它通过美团战投和美团龙珠两个投资主体布局机器人：2024 年两次投资宇树科技，多轮后成为宇树第二大股东；它还是银河通用的天使投资人，并投了自变量机器人、星海图、梅卡曼德、普渡、非夕等，2025 年 7 月首次以领投方身份投它石智航。据报道截至 2026 年 6 月，它至少投资了 16 家具身智能公司。美团自己有即时配送场景，2022 年 7 月成立美团机器人研究院，也在做无人机和无人配送车。","example":"据 2025 年 7 月的天眼查信息，美团系合计持有宇树科技约 10.46% 股份，仅次于创始人王兴兴，是第二大股东。","related":["宇树科技","星海图","自变量机器人","它石智航","梅卡曼德","京东（具身智能投资）"]},{"id":"intrinsic","category":"company","sec":0,"tier":3,"sources":[{"title":"Intrinsic 官网","url":"https://www.intrinsic.ai/"},{"title":"Intrinsic Blog","url":"https://www.intrinsic.ai/blog"}],"as_of":"2026-09","related_ids":["everyday-robots","google-deepmind","robot-operating-system","open-robotics","fanuc","motion-planning"],"name":"Intrinsic","alt":"Intrinsic (Alphabet)","abbr":"","aliases":[],"one_liner":"Alphabet X 孵化的工业机器人软件公司，2026 年并入谷歌。","explanation":"Intrinsic 是 Alphabet 旗下「登月工厂」X 孵化的机器人软件公司，2021 年从 X 独立出来。它不造机器人，而是做让工业机器人更容易编程的软件：开发环境 Flowstate 集成了视觉位姿估计、无碰撞运动规划和力控；2025 年 10 月发布 Intrinsic 视觉模型，2026 年 9 月开源兼容 ROS 的 Intrinsic Core。2022 年 12 月它接收了 ROS 维护方 Open Robotics 的商业部门（OSRC）团队。合作方包括英伟达、发那科、TRUMPF；2025 年 11 月与富士康宣布成立合资公司，做 AI 驱动的制造方案。2026 年 2 月 Intrinsic 宣布并入谷歌。","example":"工程师在 Flowstate 里组合位姿估计、运动规划、力控等模块搭建一个工作站流程，先在仿真里验证，再部署到真实机械臂上。","related":["Everyday Robots","谷歌 DeepMind","机器人操作系统","开源机器人基金会（Open Robotics）","发那科","运动规划"]},{"id":"pollen-robotics","category":"company","sec":0,"tier":3,"sources":[{"title":"Hugging Face to sell open-source robots thanks to Pollen Robotics acquisition","url":"https://huggingface.co/blog/hugging-face-pollen-robotics-acquisition"},{"title":"Reachy Mini in the Wild | Pollen Robotics","url":"https://pollen-robotics.com/reachy-mini/community"}],"as_of":"2026-05","related_ids":["hugging-face","pollen-robotics-reachy-2","pollen-robotics-reachy-mini","lerobot","open-source-hardware","vr-teleoperation"],"name":"Pollen Robotics","alt":"Pollen Robotics","abbr":"","aliases":["Pollen"],"one_liner":"法国开源机器人公司，做 Reachy，2025 年被 Hugging Face 收购","explanation":"Pollen Robotics 2016 年在法国波尔多成立，创始人 Matthieu Lapeyre 和 Pierre Rouanet 出自法国国家信息与自动化研究所（Inria）的 Flowers 团队。它做开源软硬件的机器人：Reachy 2 是带全向轮底盘、7 自由度双臂、支持 VR 遥操作的半身人形，售价约 7 万美元；Reachy Mini 是可用 Python 编程的桌面小机器人，售价 299 或 449 美元。2025 年 4 月 14 日被 Hugging Face 收购，技术并入其开源机器人库 LeRobot。2026 年 5 月，Hugging Face 为 Reachy Mini 上线了收录 200 多个应用的开源应用商店。","example":"用 LeRobot 在 Reachy 2 上采集遥操作数据，再训练一个模仿学习策略。","related":["Hugging Face","Reachy 2","Reachy Mini 桌面机器人","LeRobot","开源硬件","VR 遥操作"]},{"id":"microsoft-research","category":"company","sec":0,"tier":3,"sources":[{"title":"Rho-Alpha - Microsoft Foundry Labs","url":"https://labs.ai.azure.com/projects/rho-alpha"},{"title":"Microsoft Research Unveils Rho-Alpha Robotics Model (Pulse 2.0)","url":"https://pulse2.com/microsoft-rho-alpha-robotics-model"}],"as_of":"2026-01","related_ids":["rho-alpha","magma","florence-2","vision-language-action-model","tactile-sensor","teleoperation"],"name":"微软（微软研究院）","alt":"Microsoft Research","abbr":"MSR","aliases":["微软研究院"],"one_liner":"微软的基础研究机构，2026 年发布基于 Phi 的机器人模型 Rho-alpha。","explanation":"微软研究院成立于 1991 年，总部在美国雷德蒙德，在全球设有多个实验室，其中亚洲研究院在北京。它长期做计算机视觉、多模态模型等基础研究，Florence-2 视觉模型、Magma 多模态智能体模型都出自这里。2026 年 1 月发布 Rho-alpha（ρα），这是微软第一个由 Phi 系列视觉语言模型派生的机器人模型（此前的 Magma 已能做部分机器人操作），把自然语言指令转成双臂操作的控制信号，输入除视觉外还加入触觉，并能在部署时从人类遥操作纠正中持续学习。它是大厂把通用多模态模型延伸到机器人控制的一个例子。","example":"Rho-alpha：由 Phi 视觉语言模型派生，输入图像、触觉和语言指令，输出双臂操作动作。","related":["微软 Rho-alpha","Magma","Florence-2","视觉-语言-动作模型","触觉传感器","遥操作"]},{"id":"assured-robot-intelligence","category":"company","sec":0,"tier":3,"sources":[{"title":"Meta Accelerates Push Into Robotics Intelligence With New Acquisition (Business Insider)","url":"https://www.businessinsider.com/meta-acquires-assured-robot-intelligence-humanoid-robotics-2026-5"},{"title":"Lerrel Pinto homepage","url":"https://lerrelpinto.com"}],"as_of":"2026-05","related_ids":["whole-body-control","humanoid-robot","embodied-foundation-model","meta-fundamental-ai-research","learning-based-whole-body-control"],"name":"Assured Robot Intelligence","alt":"Assured Robot Intelligence","abbr":"ARI","aliases":[],"one_liner":"做人形机器人全身控制模型、2026 年被 Meta 收购的初创公司","explanation":"Assured Robot Intelligence（ARI）是一家总部在美国圣地亚哥、约 20 人的机器人 AI 初创公司，据报道约 2025 年成立。联合创始人兼 CEO 是纽约大学的 Lerrel Pinto，联合创始人兼 CTO 是王小龙（加州大学圣地亚哥分校副教授，曾在英伟达做研究）。公司目标是给人形机器人做基础模型，尤其是全身控制，即让一个模型同时协调腿、手臂、躯干。种子轮由 AIX Ventures 投资。2026 年 5 月 Meta 宣布收购 ARI，金额未披露，团队并入 Meta 超级智能实验室（MSL），Pinto 负责前沿机器人模型，王小龙任研究总监。","example":"","related":["全身控制","人形机器人","具身大模型","Meta FAIR","学习型全身控制"]},{"id":"amazon-frontier-ai-and-robotics","category":"company","sec":0,"tier":3,"sources":[{"title":"Amazon hires from AI robotics startup Covariant, licenses technology","url":"https://www.aboutamazon.com/news/company-news/amazon-covariant-ai-robots"},{"title":"Pieter Abbeel - Amazon Science","url":"https://www.amazon.science/author/pieter-abbeel"}],"as_of":"2026-09","related_ids":["covariant","amazon-robotics","holosoma","omniretarget","whole-body-control","humanoid-robot"],"name":"亚马逊前沿 AI 与机器人团队","alt":"Amazon Frontier AI & Robotics","abbr":"FAR","aliases":["Amazon FAR"],"one_liner":"亚马逊吸收 Covariant 团队后组建的机器人基础模型团队","explanation":"Amazon FAR 是亚马逊内部的机器人前沿研究团队。2024 年 8 月，亚马逊获得 AI 机器人公司 Covariant 的技术授权，并聘用其创始人 Pieter Abbeel（伯克利教授）、Peter Chen、Rocky Duan 和约四分之一员工，FAR 由这批人为核心组建，研究机器人基础模型，重点是人形机器人的全身控制和数据生成。代表成果有人形强化学习训练部署框架 Holosoma、动作重定向方法 OmniRetarget。据报道 Abbeel 之后转去负责亚马逊 AGI 部门的前沿模型研究。它和亚马逊仓储物流里的机器人业务（Amazon Robotics）是两条线。","example":"Holosoma 把人形机器人的仿真训练到真机部署串成一套开源流程。","related":["Covariant","亚马逊机器人","Holosoma（亚马逊人形 RL 训练部署框架）","OmniRetarget","全身控制","人形机器人"]},{"id":"covariant","category":"company","sec":0,"tier":3,"sources":[{"title":"Covariant (company) - Wikipedia","url":"https://en.wikipedia.org/wiki/Covariant_(company)"}],"as_of":"2025","related_ids":["rfm-1","berkeley-artificial-intelligence-research","amazon-frontier-ai-and-robotics","bin-picking","order-picking","foundation-model"],"name":"Covariant","alt":"Covariant","abbr":"","aliases":[],"one_liner":"伯克利系仓储拣选 AI 公司，发布 RFM-1，核心团队 2024 年被亚马逊吸纳","explanation":"2017 年在美国加州埃默里维尔成立，创始人 Pieter Abbeel、Peter Chen、Rocky Duan 和 Tianhao Zhang。Abbeel 是伯克利机器人学习实验室负责人，其余几位是他的学生；Abbeel、Chen、Duan 三人曾一起在 OpenAI 做研究。产品 Covariant Brain 是给仓库拣选机械臂用的 AI 软件，用模仿学习和强化学习让机械臂从杂乱料箱里抓取各种商品。2024 年 3 月，它用部署积累的数据发布机器人基础模型 RFM-1。公司累计融资约 2.22 亿美元，2023 年估值约 6.25 亿美元。2024 年 8 月亚马逊获得其技术的非独家授权，并吸纳 Abbeel、Chen、Duan 三位创始人和约四分之一员工，属于「反向收购式招聘」；据报道此后公司基本没有新动态。","example":"Covariant Brain 驱动的机械臂在电商仓库从混杂料箱中逐件拣货，放到传送带上。","related":["Covariant RFM-1","伯克利人工智能研究实验室","亚马逊前沿 AI 与机器人团队","无序抓取","拣选（订单拣货）","基础模型"]},{"id":"alibaba-damo-academy","category":"company","sec":0,"tier":3,"sources":[{"title":"RynnBrain: Open Embodied Foundation Models (arXiv 2602.14979)","url":"https://arxiv.org/abs/2602.14979"},{"title":"阿里达摩院与国家人工智能应用中试基地（具身智能）达成战略合作","url":"https://damo.alibaba.com/events/32026051817790876259766230?language=zh"}],"as_of":"2026-05","related_ids":["rynnbrain","rynnvla-002","embodied-foundation-model","vision-language-action-model","qwen-vl"],"name":"阿里达摩院","alt":"Alibaba DAMO Academy","abbr":"DAMO","aliases":["达摩院"],"one_liner":"阿里巴巴的前沿科研机构，开源 RynnBrain 等具身模型","explanation":"达摩院是阿里巴巴 2017 年成立的研究机构，总部在杭州，覆盖芯片、视觉、多模态等方向。具身智能方面，它以 Rynn 系列开源模型为主：RynnVLA 系列是视觉-语言-动作模型（看图听指令直接输出机械臂动作），2026 年初开源的 RynnBrain 是具身大脑基础模型，强调时空记忆和空间推理，负责理解场景、规划任务，而不直接控制电机。2026 年还与国家人工智能应用中试基地（具身智能）达成战略合作。新人读具身论文时，常会在基线或开源模型列表里看到它。","example":"RynnBrain 可以看一段机器人第一视角视频，回答某个物体刚才放在哪里，再规划下一步动作。","related":["达摩院 RynnBrain","达摩院 RynnVLA-002","具身大模型","视觉-语言-动作模型","通义千问 Qwen-VL"]},{"id":"physical-intelligence","category":"company","sec":1,"tier":1,"sources":[{"title":"Physical Intelligence Inc. - Wikipedia","url":"https://en.wikipedia.org/wiki/Physical_Intelligence_Inc."},{"title":"π0.7 - Physical Intelligence","url":"https://www.pi.website/blog/pi07"},{"title":"π*0.6 - Physical Intelligence","url":"https://www.pi.website/blog/pistar06"}],"as_of":"2026-04","related_ids":["pi0","pi0-5","pi-star-0-6","pi0-7","openpi","robot-brain-company"],"name":"Physical Intelligence","alt":"Physical Intelligence","abbr":"PI","aliases":["π","物理智能公司"],"one_liner":"只做机器人大脑的美国创业公司，π 系列 VLA 的出品方","explanation":"Physical Intelligence 2024 年在旧金山成立，联合创始人包括前谷歌机器人研究员 Karol Hausman、Brian Ichter，伯克利教授 Sergey Levine，斯坦福教授 Chelsea Finn，以及投资人 Lachy Groom 等。它不造机器人本体，只做能控制多种机器人的通用模型：π0（2024 年 10 月，用流匹配动作专家）、π0-FAST、π0.5（开放世界泛化）、π*0.6（用 RECAP 强化学习）和 2026 年 4 月的 π0.7，并通过 openpi 开源了部分权重和代码。融资：2024 年 4 亿美元（估值 24 亿）、2025 年 6 亿美元（估值 56 亿）、2026 年 10 亿美元（估值 110 亿）。","example":"很多实验室拿 openpi 里的 π0 权重，在自己的机械臂上用几十小时数据微调。","related":["π0","π0.5","π*0.6","π0.7","openpi","大脑公司"]},{"id":"skild-ai","category":"company","sec":1,"tier":1,"sources":[{"title":"Skild AI Series C","url":"https://www.skild.ai/blogs/series-c"},{"title":"Skild AI | LinkedIn","url":"https://www.linkedin.com/company/skild-ai"},{"title":"Skild S1","url":"https://www.skild.ai/blogs/s1"}],"as_of":"2026-08","related_ids":["skild-brain","skild-s1",null,null,null,null],"name":"Skild AI","alt":"Skild AI","abbr":"","aliases":["Skild"],"one_liner":"美国机器人大脑公司，做跨本体通用模型 Skild Brain","explanation":"Skild AI 是 2023 年成立的美国公司，总部在匹兹堡，旧金山湾区也有团队，创始人 Deepak Pathak 和 Abhinav Gupta 都是卡内基梅隆大学机器人方向教授。它只做「大脑」不造本体：2025 年 7 月公开 Skild Brain，同一个模型可控制四足、人形、机械臂和移动操作机器人，主要靠大规模仿真和互联网视频训练；2026 年 8 月发布 S1，看一段示范视频即可做新任务。2026 年 1 月完成 14 亿美元融资，软银领投、英伟达等跟投，估值超过 140 亿美元；官方称 2025 年几个月内收入约 3000 万美元，已用于安防、仓储、工厂装配等场景。","example":"Skild Brain 演示中，四足机器人断了一截腿后几秒内就调整步态继续走。","related":["Skild Brain","Skild S1","跨本体(Cross-Embodiment)","大脑公司(Robot-Brain (Model-only) Company)","一脑多机(One Brain, Multiple Robots)","上下文学习(In-Context Learning)"]},{"id":"generalist-ai","category":"company","sec":1,"tier":2,"sources":[{"title":"Generalist AI Blog","url":"https://generalistai.com/blog"},{"title":"Generalist AI - About","url":"https://generalistai.com/about"},{"title":"Generalist | LinkedIn","url":"https://www.linkedin.com/company/generalistai"}],"as_of":"2026-09","related_ids":["gen-0","gen-1",null,"scaling-law","ossification","real-robot-data"],"name":"Generalist AI","alt":"Generalist AI","abbr":"","aliases":["Generalist"],"one_liner":"美国具身基础模型公司，用海量真机数据训练 GEN 系列模型","explanation":"Generalist AI 是 2024 年成立的美国机器人 AI 公司，总部在加州湾区（圣马特奥），波士顿也有团队。CEO Pete Florence 曾在谷歌 DeepMind 参与 PaLM-E、RT-2，CTO Andrew Barry 来自波士顿动力。它的思路是自己大规模采集真实物理交互数据来训练具身基础模型：GEN-0（2025 年 11 月）用 27 万多小时真机数据，首次在机器人上报告了缩放规律；GEN-1（2026 年 4 月）主打熟练、快速完成简单任务；GEN-1.5（2026 年 8 月）能看十几秒示范就学会新任务。据其 LinkedIn 介绍，最近一轮融资 4 亿美元，累计超过 5 亿美元。","example":"GEN-1 只用约 1 小时机器人数据微调，就能把折纸盒这类任务的成功率做到 99%。","related":["GEN-0","GEN-1","具身大模型(Embodied Foundation Model)","缩放定律","骨化（模型骨化）","真机数据"]},{"id":"genesis-ai","category":"company","sec":1,"tier":2,"sources":[{"title":"Khosla-backed robotics startup Genesis AI has gone full stack, demo shows (TechCrunch, 2026-05-06)","url":"https://techcrunch.com/2026/05/06/khosla-backed-robotics-startup-genesis-ai-has-gone-full-stack-demo-shows/"},{"title":"Genesis AI 官网","url":"https://www.genesis.ai/"}],"as_of":"2026-05","related_ids":[null,null,null,null,null,null],"name":"Genesis AI","alt":"Genesis AI","abbr":"","aliases":["Genesis AI SAS"],"one_liner":"从 Genesis 仿真器起家、软硬一体做灵巧操作的机器人公司","explanation":"2025 年 7 月以 1.05 亿美元种子轮亮相的机器人公司，由 Eclipse 和 Khosla Ventures 领投；在巴黎和加州设有办公室，后扩展到伦敦。CEO 周衔是开源物理仿真器 Genesis 的主要发起人，总裁 Théophile Gervet 曾是 Mistral AI 研究员。公司走全栈路线：与舞肌科技合作做接近人手大小的灵巧手，配套的传感器手套采集人类操作数据，自研仿真 Genesis World 做训练和评测。2026 年 5 月发布机器人基础模型 GENE-26.5，演示了做饭、弹钢琴、拧魔方等灵巧操作。官网正在为家用/商用机器人 Eno 收集候补名单，计划 2026 年底开始定向客户部署。","example":"GENE-26.5 发布演示里，灵巧手在人类手套数据加少量机器人数据训练后完成拧魔方。","related":["Genesis(Genesis Simulator)","Genesis AI GENE-26.5(GENE-26.5 (Genesis AI robotics foundation model))","舞肌 Wuji Hand(Wuji Hand)","灵巧操作(Dexterous Manipulation)","数据手套(Data Glove)","软硬一体(Hardware-Software Integration)"]},{"id":"dyna-robotics","category":"company","sec":1,"tier":3,"sources":[{"title":"Yahoo Finance: Dyna Robotics Raises $23.5 Million","url":"https://finance.yahoo.com/news/dyna-robotics-raises-23-5-130000239.html"},{"title":"Bloomberg: Dyna Robotics Raises $120 Million in Funding From Nvidia, Amazon","url":"https://www.bloomberg.com/news/articles/2025-09-15/dyna-robotics-raises-120-million-in-funding-from-nvidia-amazon"},{"title":"Dyna: DYNA-2","url":"https://www.dyna.co/dyna-2"}],"as_of":"2026-08","related_ids":["dyna-1","dyna-2","physical-intelligence","world-action-model","reward-model","data-flywheel"],"name":"Dyna Robotics","alt":"Dyna Robotics","abbr":"","aliases":["Dyna","DYNA Robotics"],"one_liner":"美国具身基础模型创业公司，让机器人在商业场景里长时间连续干活","explanation":"Dyna Robotics 2024 年成立，总部在美国加州 Redwood City。联合创始人 Lindon Gao 和 York Yang 此前创办的无人收银购物车公司 Caper AI 以 3.5 亿美元卖给 Instacart，另一位联创 Jason Ma 曾是 DeepMind 研究科学家。它的思路是先让机器人在真实商业场景里把一件事做到高可靠（如叠毛巾、备餐），边部署边采数据、再迭代通用模型。2025 年 3 月获 2350 万美元种子轮，9 月完成 1.2 亿美元 A 轮，英伟达、亚马逊等参投，据彭博报道估值超 6 亿美元。模型方面，2025 年 6 月发布 DYNA-1，2026 年 8 月发布用 100 多万小时人类第一视角视频预训练的世界动作模型 DYNA-2。","example":"官方报告 DYNA-1 在餐厅叠餐巾任务上 24 小时无人干预连续运行，成功率 99.4%。","related":["DYNA-1","Dyna DYNA-2","Physical Intelligence","世界动作模型","奖励模型","数据飞轮"]},{"id":"field-ai","category":"company","sec":1,"tier":3,"sources":[{"title":"FieldAI News","url":"https://www.fieldai.com/news"}],"as_of":"2026-09","related_ids":[null,null,null,null,null],"name":"Field AI","alt":"Field AI","abbr":"","aliases":["FieldAI"],"one_liner":"做野外与工地机器人「通用大脑」的美国初创公司","explanation":"美国机器人软件公司，总部在加州尔湾，创始人兼 CEO Ali Agha 曾在 NASA 喷气推进实验室带队参加 DARPA 地下挑战赛。它不造机器人本体，而是做一套能装到不同形态机器人上的自主软件，核心是 FFM（Field Foundation Models，面向野外和作业现场的基础模型）：把神经网络和基于物理的推理、不确定性估计结合，让机器人在没有预先建图和 GPS 的工地、矿山、野外环境里自主移动和作业，并在机载算力上运行。据报道，公司 2025 年累计融资约 4 亿美元，投资方包括 Bezos Expeditions、Khosla Ventures 和英伟达。2026 年先后与波士顿动力、英伟达、卡特彼勒宣布合作。","example":"把 Field AI 的软件装到四足或轮式底盘上，在施工现场自主巡检、记录进度。","related":["Field AI FFM（场景基础模型）(Field Foundation Models (FieldAI))","波士顿动力(Boston Dynamics)","一脑多机(One Brain, Multiple Robots)","大脑公司(Robot-Brain (Model-only) Company)","导航(Navigation)"]},{"id":"flexion-robotics","category":"company","sec":1,"tier":3,"sources":[{"title":"Flexion Robotics - About","url":"https://flexion.ai/about"},{"title":"Flexion Robotics 官网","url":"https://flexion.ai/"}],"as_of":"2026-07","related_ids":[null,"legged-gym",null,null,null],"name":"Flexion","alt":"Flexion Robotics","abbr":"","aliases":["Flexion Robotics AG","Flexion AI"],"one_liner":"ETH 系团队创办、给人形机器人做自主软件栈的公司","explanation":"总部在苏黎世、在旧金山设有办公室的人形机器人软件公司。联合创始人兼 CEO Nikita Rudin 在 ETH 读博、后任英伟达研究员，是 legged_gym 的主要作者；CTO David Höller 同样出自 ETH 和英伟达；ETH 机器人系统实验室教授 Marco Hutter 是联合创始人兼顾问。公司不造机器人本体，目标是做跨硬件的人形「自主栈」：从听懂指令、规划，到操作和行走的底层控制，强调仿真里强化学习训练再迁移真机。2025 年 11 月发布 Reflect v0，2026 年 6 月发布面向长程自主作业的 Reflect v1.0，7 月宣布与 Niantic Spatial、英伟达合作做仿真到真机研究。","example":"","related":["苏黎世联邦理工机器人系统实验室(ETH Zurich Robotic Systems Lab)","legged_gym","仿真到现实迁移(Sim-to-Real Transfer)","大脑公司(Robot-Brain (Model-only) Company)","人形机器人(Humanoid Robot)"]},{"id":"rhoda-ai","category":"company","sec":1,"tier":3,"sources":[{"title":"Rhoda AI 官网","url":"https://www.rhoda.ai/"}],"as_of":"2026-09","related_ids":["video-generation-model","world-action-model","vision-language-action-model","internet-video-data","post-training"],"name":"Rhoda AI","alt":"Rhoda AI","abbr":"","aliases":[],"one_liner":"用网络视频预训练机器人策略、主攻工业场景的美国具身智能公司。","explanation":"Rhoda AI 是美国的具身智能初创公司，做面向工业现场的机器人基础模型。官网介绍的核心是 FutureVision 能力和「Direct Video Action」模型：先用大规模网络视频预训练，让模型学会预测画面怎么变化，再用 1–10 小时的机器人轨迹数据后训练，得到能直接输出动作的策略，官方称这样比常规 VLA（视觉-语言-动作模型）流水线泛化更好。它同时自研轮式机器人平台，演示过退货处理、轴承分装、拆纸箱等汽车、制造、物流和电商任务。官网列出的投资方包括 Khosla Ventures、John Doerr、Temasek、Samsung NEXT 等；创始团队、成立年份和融资金额官网未写明，此处不写。","example":"","related":["视频生成模型","世界动作模型","视觉-语言-动作模型","互联网视频数据","后训练"]},{"id":"sunday-robotics","category":"company","sec":1,"tier":3,"sources":[{"title":"Sunday Raises $165M to Launch First Autonomous Robots by Thanksgiving（GlobeNewswire，2026-03-12）","url":"https://www.globenewswire.com/news-release/2026/03/12/3254877/0/en/sunday-raises-165m-to-launch-first-autonomous-robots-by-thanksgiving.html"},{"title":"Sunday Robotics 官网","url":"https://www.sunday.ai/"},{"title":"ACT-2 Preview: Generalizing Reliability（Sunday blog，2026-07-17）","url":"https://www.sunday.ai/blog/act-2-preview"}],"as_of":"2026-07","related_ids":["sunday-robotics-memo","sunday-robotics-act-1","skill-capture-glove","robot-free-data-collection","action-chunking-with-transformers","diffusion-policy"],"name":"Sunday Robotics","alt":"Sunday Robotics","abbr":"","aliases":["Sunday"],"one_liner":"ALOHA 和扩散策略作者创办的美国家用机器人公司，产品是 Memo","explanation":"Sunday Robotics（对外常称 Sunday）总部在美国加州山景城，由两位斯坦福博士创办：CEO Tony Zhao 是 ACT / ALOHA 的作者，CTO 迟宬（Cheng Chi）是扩散策略和 UMI 的作者。公司 2025 年 11 月结束隐身，同时发布家务机器人 Memo、基础模型 ACT-1 和「技能采集手套」。它的核心做法是不靠机器人遥操作采数据，而是让人戴着与机器人手结构一致的手套在真实家庭做家务，再把数据转成机器人能用的训练数据。2026 年 3 月完成 Coatue 领投的 1.65 亿美元 B 轮，估值 11.5 亿美元；计划 2026 年感恩节前向 50 个家庭交付首批测试机，7 月预告了 ACT-2。","example":"Memo 用 ACT-1 一个模型完成收拾整张餐桌、把碗碟装进洗碗机的长流程任务，还能在没去过的房子里做。","related":["Sunday Memo","Sunday ACT-1","技能采集手套","无本体采集","ACT","扩散策略"]},{"id":"the-bot-company","category":"company","sec":1,"tier":3,"sources":[{"title":"Reuters: Former Cruise CEO Vogt's robotics startup valued at $2 billion","url":"https://www.reuters.com/technology/former-cruise-ceo-vogts-robotics-startup-valued-2-billion-new-funding-sources-2025-03-21"},{"title":"Bloomberg: Cruise Founder Kyle Vogt's Robotics Startup Eyes $4 Billion Valuation","url":"https://www.bloomberg.com/news/articles/2025-10-28/cruise-founder-kyle-vogt-s-robotics-startup-eyes-4-billion-valuation"}],"as_of":"2025-10","related_ids":[null,"household-tasks","mobile-manipulation","autonomous-driving-talent-moving-into-embodied-ai","sunday-robotics",null],"name":"The Bot Company","alt":"The Bot Company","abbr":"","aliases":["Bot Company"],"one_liner":"Cruise 创始人 Kyle Vogt 创办、做家务机器人的美国初创公司","explanation":"2024 年在美国旧金山成立，创始人 Kyle Vogt 曾联合创办直播平台 Justin.tv（Twitch 前身）和自动驾驶公司 Cruise 并任 Cruise CEO，另两位联合创始人 Paril Jain、Luke Holoubek 来自特斯拉和 Cruise。公司目标是做能在家里收拾杂物、干日常家务的机器人，结合移动底盘、机械臂和大模型，走的是自动驾驶出身团队转做具身智能的典型路线。产品细节公开得很少，但融资节奏很快：2025 年 3 月由 Greenoaks 领投 1.5 亿美元，估值 20 亿美元；据彭博 2025 年 10 月报道，又以超过 40 亿美元估值融资 2.5 亿美元。","example":"","related":["Kyle Vogt","家务任务","移动操作","智驾转具身","Sunday Robotics","1X(1X Technologies)"]},{"id":"mind-robotics","category":"company","sec":1,"tier":3,"sources":[{"title":"Rivian spinout Mind Robotics valued at $3.4 billion in new funding round (Reuters)","url":"https://www.reuters.com/legal/transactional/rivian-spinout-mind-robotics-valued-34-billion-new-funding-round-2026-05-13"},{"title":"Mind Robotics raises Series A to develop AI-driven industrial automation (The Robot Report)","url":"https://www.therobotreport.com/mind-robotics-raises-series-a-develop-ai-driven-industrial-automation"},{"title":"Rivian spinoff Mind Robotics raises another $400M (TechCrunch)","url":"https://techcrunch.com/2026/05/13/rivian-spinoff-mind-robotics-raises-another-400m"}],"as_of":"2026-05","related_ids":["industrial-robot","physical-ai","automakers-entering-humanoid-robotics","brownfield-deployment","funding-rounds-and-valuation"],"name":"Mind Robotics","alt":"Mind Robotics","abbr":"","aliases":[],"one_liner":"从 Rivian 拆分出来、做工厂自动化 AI 机器人的美国初创公司。","explanation":"Mind Robotics 是美国电动车公司 Rivian 于 2025 年 11 月拆分出的独立公司，前身是 Rivian 内部项目「Project Synapse」，由 Rivian 创始人兼 CEO RJ Scaringe 创办。它的目标是开发 AI 驱动的工业机器人，让工厂运转更高效。融资节奏很快：2025 年 11 月获 Eclipse 领投的 1.15 亿美元种子轮；2026 年 3 月获 Accel 和 a16z 联合领投的 5 亿美元 A 轮，估值 20 亿美元；2026 年 5 月再获 Kleiner Perkins 领投的 4 亿美元，据报道估值 34 亿美元，累计融资超过 10 亿美元。它是车企把制造场景延伸到具身智能的代表之一。","example":"2026 年 5 月 Kleiner Perkins 领投 4 亿美元，据报道估值升至 34 亿美元。","related":["工业机器人","物理AI","车企造人形（车企入局）","棕地部署（存量工厂）","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）"]},{"id":"project-prometheus","category":"company","sec":1,"tier":3,"sources":[{"title":"Project Prometheus (company) - Wikipedia","url":"https://en.wikipedia.org/wiki/Project_Prometheus_(company)"}],"as_of":"2026-08","related_ids":[null,null,"world-model","generalist-ai","skild-ai"],"name":"普罗米修斯计划","alt":"Project Prometheus (renamed Prometheus)","abbr":"","aliases":["Prometheus","Project Prometheus","Prometheus Industries"],"one_liner":"贝索斯联合执掌的 AI 公司，做面向工程和制造的物理 AI","explanation":"Project Prometheus 于 2025 年 11 月公开，是美国 AI 创业公司，由亚马逊创始人杰夫·贝索斯和曾在谷歌 X 工作的化学家兼物理学家 Vik Bajaj 共同担任 CEO，启动资金 62 亿美元，部分来自贝索斯本人。总部在旧金山，伦敦和苏黎世设有办公室。它想让 AI 在真实物理世界里通过试错来学习，而不只靠数字数据，用于计算、航空航天、汽车等行业的工程与制造。2025 年 11 月收购智能体创业公司 General Agents，同年 12 月员工超过 120 人。2026 年更名为 Prometheus，8 月在西奥克兰租下一座原钢铁仓库；据报道还在为一家收购传统工业企业的控股公司筹资。","example":"","related":["物理AI(Physical AI)","具身智能(Embodied AI)","世界模型","Generalist AI","Skild AI"]},{"id":"bedrock-robotics","category":"company","sec":1,"tier":3,"sources":[{"title":"Bedrock Robotics brings in $80M for construction retrofit kits (The Robot Report)","url":"https://www.therobotreport.com/bedrock-robotics-brings-in-80m-for-construction-retrofit-kits"},{"title":"Bedrock Robotics raises $270M for autonomous machine solution","url":"https://theconstructionbroadsheet.com/bedrock-robotics-raises-m-for-autonomous-machine-solution-p2178-176.htm"}],"as_of":"2026-02","related_ids":["autonomous-driving","lidar","physical-ai","autonomous-driving-talent-moving-into-embodied-ai","real-world-deployment"],"name":"Bedrock Robotics","alt":"Bedrock Robotics","abbr":"","aliases":[],"one_liner":"给挖掘机等工程机械加装自动驾驶套件的美国公司","explanation":"Bedrock Robotics 2024 年 5 月成立于美国旧金山，由三位前 Waymo 负责人和一位前 Segment 工程负责人创办，CEO Boris Sofman 曾领导 Waymo 自动驾驶卡车项目，也是消费机器人公司 Anki 的联合创始人。它不造新机器，而是给现有挖掘机、装载机加装激光雷达、360 度相机和计算单元组成的改装套件，让工程机械自主作业，用来缓解建筑业用工短缺。2025 年 7 月带着 8000 万美元融资亮相，2026 年 2 月完成 2.7 亿美元 B 轮，由 CapitalG 和 Valor Atreides AI Fund 共同领投。它是自动驾驶人才转做物理 AI 的典型例子。","example":"改装后的挖掘机在工地上自主完成地基开挖，人只需远程监督。","related":["自动驾驶","激光雷达","物理AI","智驾转具身","场景落地"]},{"id":"wayve","category":"company","sec":1,"tier":3,"sources":[{"title":"Wayve - Wikipedia","url":"https://en.wikipedia.org/wiki/Wayve"},{"title":"Wayve raises $1.2B at $8.6B valuation to scale embodied AI for autonomous driving（Tech.eu）","url":"https://tech.eu/2026/02/25/wayve-raises-12b-at-86b-valuation-to-scale-embodied-ai-for-autonomous-driving/"},{"title":"Wayve and Uber Launch First-Ever Autonomous Rides in the UK（Wayve）","url":"https://wayve.ai/press/wayve-uber-launch-autonomous-rides/"}],"as_of":"2026-09","related_ids":["gaia-2","autonomous-driving","end-to-end","world-model","vision-language-action-model","tesla-fsd-v12"],"name":"Wayve","alt":"Wayve","abbr":"","aliases":["Wayve Technologies"],"one_liner":"伦敦的端到端自动驾驶公司，自称做具身智能，和 Uber 合作自动驾驶网约车。","explanation":"Wayve 2017 年由剑桥大学机器学习博士生 Alex Kendall（现任 CEO）和 Amar Shah 在剑桥创立，现总部在伦敦。它走端到端路线，把自己的方法叫 AV2.0：一个神经网络直接从摄像头画面输出驾驶动作，不依赖高精地图和手写规则，并自称做的是「具身智能」。代表模型有边开车边用语言解释决策的 LINGO-2、生成驾驶视频的世界模型 GAIA 系列。2024 年 5 月完成软银领投的 10.5 亿美元 C 轮；2026 年 2 月完成 12 亿美元 D 轮、投后估值 86 亿美元，英伟达、微软、Uber 及奔驰、日产、Stellantis 参投。2026 年 9 月 3 日，它和 Uber 在伦敦上线有安全员随车的自动驾驶网约车。","example":"LINGO-2 开车时会实时说出类似「前面有行人过马路，我在减速」的解释。","related":["Wayve GAIA-2","自动驾驶","端到端","世界模型","视觉-语言-动作模型","特斯拉 FSD V12（端到端自动驾驶）"]},{"id":"figure-ai","category":"company","sec":2,"tier":1,"sources":[{"title":"Figure AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Figure_AI"},{"title":"Figure: Helix 2.5","url":"https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization"}],"as_of":"2026-09","related_ids":["figure-03","figure-helix","figure-helix-02","helix-2-5","botq","humanoid-robot"],"name":"Figure AI","alt":"Figure AI","abbr":"","aliases":["Figure"],"one_liner":"美国人形机器人公司，做 Figure 系列本体和 Helix 模型","explanation":"Figure AI 2022 年由 Brett Adcock 创立，他此前创办过电动飞行器公司 Archer Aviation 和招聘平台 Vettery，公司总部在加州圣何塞。它同时造人形机器人本体（Figure 01、02、03）和机器人大脑：自研视觉-语言-动作模型 Helix（2025 年 2 月），之后有全身控制的 Helix 02 和 2026 年 9 月的 Helix 2.5；自建 BotQ 工厂负责量产。2024 年 1 月与宝马合作进厂测试；与 OpenAI 的模型合作约一年后结束。融资方面，2024 年 2 月 B 轮 6.75 亿美元，2025 年 9 月 C 轮超 10 亿美元、投后估值 390 亿美元。据报道，2026 年 4 月已交付 350 多台 Figure 03。","example":"Helix 2.5 在 30 个没去过的住户家里零样本完成整理客厅、叠毛巾、铺床，就跑在 Figure 03 上。","related":["Figure 03","Helix","Helix 02","Helix 2.5","Figure BotQ 工厂","人形机器人"]},{"id":"boston-dynamics","category":"company","sec":2,"tier":1,"sources":[{"title":"Boston Dynamics - Wikipedia","url":"https://en.wikipedia.org/wiki/Boston_Dynamics"},{"title":"CES 2026: Boston Dynamics unveils new Atlas","url":"https://www.robotics247.com/article/ces-2026-boston-dynamics-unveils-new-atlas-humanoid-robot/technologies"}],"as_of":"2026-02","related_ids":["boston-dynamics-atlas-2","boston-dynamics-atlas","boston-dynamics-spot","boston-dynamics-stretch","hyundai-motor-group","google-deepmind"],"name":"波士顿动力","alt":"Boston Dynamics","abbr":"BD","aliases":["波动"],"one_liner":"足式机器人老牌公司，Spot 机器狗和 Atlas 人形的制造者","explanation":"波士顿动力 1992 年由 Marc Raibert 创立，前身是他在 MIT 的腿部实验室，总部在美国马萨诸塞州沃尔瑟姆。它 2013 年被谷歌收购，2017 年转给软银，2020 年 12 月现代汽车集团以约 8.8 亿美元买下 80% 股权（2021 年 6 月完成）。公司长期靠基于模型的控制做出高动态腿足运动，代表作有 BigDog、四足 Spot（2019 年开始商用、2020 年公开发售）、仓储卸货机器人 Stretch 和人形 Atlas。2024 年 4 月液压版 Atlas 退役、换成电动版；2026 年 1 月 CES 发布产品版 Atlas，并与谷歌 DeepMind 合作训练基础模型。2026 年 2 月 CEO Robert Playter 退休，CFO Amanda McMaster 任临时 CEO。","example":"工厂巡检常用的 Spot 背上挂热成像相机和机械臂，是最早规模化商用的四足机器人之一。","related":["波士顿动力 Atlas（电动版）","液压版 Atlas","波士顿动力 Spot","波士顿动力 Stretch","现代汽车集团","谷歌 DeepMind"]},{"id":"1x-technologies","category":"company","sec":2,"tier":1,"sources":[{"title":"1X Technologies - Wikipedia","url":"https://en.wikipedia.org/wiki/1X_Technologies"}],"as_of":"2025-10","related_ids":["1x-neo","1x-eve","redwood","1x-world-model","remote-teleoperation-takeover","openai"],"name":"1X","alt":"1X Technologies","abbr":"","aliases":["Halodi Robotics（旧名）"],"one_liner":"挪威起家的人形机器人公司，主打家用人形 NEO","explanation":"1X 2014 年由 Bernt Øivind Børnich 在挪威创立，原名 Halodi Robotics，2022 年改名 1X，现总部在美国加州帕洛阿尔托，挪威莫斯仍有工厂。第一款产品 EVE 是轮式底盘加人形上身，用于安保、物流；之后转向双足家用人形 NEO：2024 年 8 月发布 Beta，2025 年 2 月 Gamma，2025 年 10 月 28 日开放预订，买断 2 万美元或每月 499 美元，计划 2026 年交付。它自研 VLA 模型 Redwood 和视频生成式的 1X 世界模型。融资：2023 年 3 月 A2 轮 2350 万美元（OpenAI 创业基金领投），2024 年 1 月 B 轮 1 亿美元；据报道 2025 年 9 月寻求最多 10 亿美元新融资。","example":"NEO 做不了的家务可由 1X 员工远程遥操作接管，这也引发了隐私争议。","related":["1X NEO","1X EVE","1X Redwood","1X 世界模型","远程接管（人工兜底）","OpenAI"]},{"id":"agility-robotics","category":"company","sec":2,"tier":1,"sources":[{"title":"Agility Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Agility_Robotics"},{"title":"Agility Robotics plans to go public via SPAC in a $2.5B deal (TechCrunch)","url":"https://techcrunch.com/2026/06/24/agility-robotics-plans-to-go-public-via-spac-in-a-2-5b-deal/"}],"as_of":"2026-09","related_ids":["agility-robotics-digit","agility-robotics-cassie","robofab","robot-as-a-service","special-purpose-acquisition-company","humanoid-robot"],"name":"Agility Robotics","alt":"Agility Robotics","abbr":"","aliases":["Agility"],"one_liner":"美国双足人形机器人公司，Digit 已在物流仓库商用","explanation":"2015 年从俄勒冈州立大学动态机器人实验室分拆成立，总部在俄勒冈州塞勒姆；联合创始人 Jonathan Hurst 是该实验室的创建者，长期研究双足动态行走，现任 CEO 为 Peggy Johnson。早期产品是只有两条腿的科研平台 Cassie，后来加上躯干和手臂做成人形机器人 Digit，主要在仓库里搬运料箱，以「机器人即服务」模式收费，客户包括 GXO、舍弗勒、丰田加拿大工厂和 Mercado Libre；2023 年宣布在塞勒姆建设自有人形机器人工厂 RoboFab。2026 年 3 月品牌简称改为 Agility；6 月宣布与 Churchill Capital Corp XI 合并、以 SPAC 方式上市，交易估值约 25 亿美元，拟用代码 AGLT；9 月发布主打无围栏协作安全的第五代 Digit 5。","example":"2024 年 GXO 与 Agility 签下首份机器人即服务合同，在佐治亚州的 Spanx 仓库用 Digit 搬运料箱。","related":["Agility Digit 人形机器人","Agility Cassie","Agility RoboFab 工厂","机器人即服务","SPAC 上市（特殊目的收购公司）","人形机器人"]},{"id":"apptronik","category":"company","sec":2,"tier":2,"sources":[{"title":"Humanoid robot startup Apptronik has now raised $935M at a $5B+ valuation (TechCrunch)","url":"https://techcrunch.com/2026/02/11/humanoid-robot-startup-apptronik-has-now-raised-935m-at-a-5b-valuation/"},{"title":"Apptronik 官网","url":"https://apptronik.com/"}],"as_of":"2026-06","related_ids":["apptronik-apollo","google-deepmind","gemini-robotics","nasa-valkyrie","darpa-robotics-challenge","humanoid-robot"],"name":"Apptronik","alt":"Apptronik","abbr":"","aliases":[],"one_liner":"美国得州人形机器人公司，产品 Apollo，与谷歌 DeepMind 合作","explanation":"2016 年在得州奥斯汀成立，创始人 Jeff Cardenas 和 Nick Paine 出自得州大学奥斯汀分校以人为中心机器人实验室，该实验室成员曾用 NASA 人形机器人 Valkyrie 参加 DARPA 机器人挑战赛。公司自研电动执行器，2023 年 8 月发布人形机器人 Apollo，定位工厂和仓库里的搬箱、上下料、送料等重复体力活；梅赛德斯-奔驰 2024 年起试点使用，合作方还有 GXO、Jabil 和英伟达。它与 Google DeepMind 合作，在 Apollo 上跑 Gemini Robotics 模型。融资上，2025 年 2 月 A 轮 3.5 亿美元（谷歌参投），之后多次追加，截至 2026 年 2 月 A 轮累计 9.35 亿美元、投后估值约 53 亿美元；2026 年 6 月推出可选双足或轮式底盘的 Apollo 2。","example":"梅赛德斯-奔驰工厂试点让 Apollo 把零件箱送到装配线旁。","related":["Apptronik Apollo","谷歌 DeepMind","Gemini Robotics","NASA Valkyrie 人形机器人","DARPA 机器人挑战赛","人形机器人"]},{"id":"neura-robotics","category":"company","sec":2,"tier":2,"sources":[{"title":"NEURA Robotics Announces Record Series C of up to $1.4B","url":"https://neura-robotics.com/record-series-c"},{"title":"Humanoid robotics company Neura Robotics backed by Amazon, Nvidia (CNBC)","url":"https://www.cnbc.com/2026/06/10/neura-robotics-funding-ai-humanoid-robots.html"},{"title":"NEURA Robotics Secures €120 Million in Series B Funding","url":"https://neura-robotics.com/neura-robotics-secures-euro-120-million-series-b"}],"as_of":"2026-06","related_ids":["neura-robotics-4ne1","collaborative-robot","humanoid-robot","physical-ai","nvidia"],"name":"NEURA Robotics","alt":"NEURA Robotics","abbr":"","aliases":["NEURA"],"one_liner":"德国认知机器人公司，做协作机械臂和人形机器人 4NE1。","explanation":"NEURA Robotics 2019 年成立于德国梅青根（Metzingen），创始人兼 CEO 为 David Reger。它主打「认知机器人」，即自带视觉、力觉等感知和 AI 能力的机器人，产品包括协作机械臂 MAiRA、LARA 和人形机器人 4NE1，同时在做供客户训练、共享机器人技能的软件与数据平台。此前完成 1.2 亿欧元 B 轮（Lingotto 领投）；2026 年宣布最高 14 亿美元的 C 轮，投资方包括 Tether、高通、亚马逊和英伟达，据 CNBC 2026 年 6 月报道估值约 70 亿美元，部分资金与业绩里程碑挂钩。","example":"全尺寸人形机器人 4NE1。","related":["NEURA 4NE1","协作机器人","人形机器人","物理AI","英伟达"]},{"id":"sanctuary-ai","category":"company","sec":2,"tier":3,"sources":[{"title":"Sanctuary AI Unveils Phoenix","url":"https://sanctuary.ai/news/sanctuary-ai-unveils-phoenix-a-humanoid-general-purpose-robot-designed-for-work"},{"title":"Sanctuary AI Phoenix 2026 review (RoboZaps)","url":"https://blog.robozaps.com/b/sanctuary-ai-phoenix-review"}],"as_of":"2026-06","related_ids":["sanctuary-ai-phoenix","humanoid-robot","dexterous-hand","hydraulic-actuation","teleoperation"],"name":"Sanctuary AI","alt":"Sanctuary AI","abbr":"","aliases":[],"one_liner":"加拿大人形机器人公司，做 Phoenix 人形和 Carbon 控制系统","explanation":"Sanctuary AI 2018 年成立于加拿大温哥华，创始人包括量子计算公司 D-Wave 的创始人 Geordie Rose 和 Suzanne Gildert。它的目标是通用人形机器人，产品线叫 Phoenix（2023 年 5 月发布第 6 代，2024 年又推出第 7、8 代），特点是液压驱动的高自由度灵巧手，配套的 AI 控制系统叫 Carbon。早期主要靠遥操作采集人类演示来训练机器人。投资方有贝尔、麦格纳和加拿大政府等，到 2024 年累计融资超过 1.4 亿加元。2024 年 11 月 Rose 被董事会撤换并伴随裁员；据报道 2026 年公司转向为现有工业机器人提供「物理 AI」软件，整机人形不再是重点。","example":"第 8 代 Phoenix（2024 年 12 月）改用轮式底盘，主要用于采集操作数据。","related":["Sanctuary Phoenix","人形机器人","灵巧手","液压驱动","遥操作"]},{"id":"foundation-robotics","category":"company","sec":2,"tier":3,"sources":[{"title":"Foundation 官网","url":"https://foundation.bot/"},{"title":"Foundation Emerges With Phantom Humanoid - Humanoids Daily","url":"https://www.humanoidsdaily.com/news/foundation-emerges-with-phantom-humanoid-betting-on-novel-actuators-and-hybrid-ai"}],"as_of":"2026-07","related_ids":[null,null,null,null,null],"name":"Foundation","alt":"Foundation Robotics","abbr":"","aliases":["Foundation Robotics Labs","Foundation Future Industries"],"one_liner":"主打国防与工业场景的美国人形机器人初创公司，产品 Phantom","explanation":"美国旧金山的人形机器人公司，官网主体名为 Foundation Future Industries，CEO Sankaet Pathak 此前创办过金融科技公司 Synapse；据报道公司成立于 2023 年，另在慕尼黑设点。产品是全尺寸人形机器人 Phantom，自研滚动接触式减速器等执行器，感知只用相机、不用激光雷达，AI 系统叫 Cortex。和多数人形公司不同，它公开把国防作为重点，据报道拿到约 2400 万美元五角大楼研究合同，官网 2026 年展示了负重搬运、迫击炮操作等演示，同时在消费品、饮料、玻璃制造工厂做试点。公司提出 2026 年部署上万台的目标，但目前只是计划。","example":"","related":["Foundation Phantom(Foundation Robotics Phantom)","人形机器人(Humanoid Robot)","全尺寸人形机器人(Full-size Humanoid Robot)","纯视觉方案(Vision-Only Approach)","机器人即服务(Robot-as-a-Service)"]},{"id":"persona-ai","category":"company","sec":2,"tier":3,"sources":[{"title":"Persona AI Raises $27M Oversubscribed Pre-Seed","url":"https://finance.yahoo.com/news/persona-ai-raises-27m-oversubscribed-131500748.html"},{"title":"HD Hyundai and Persona AI Sign Agreement to Deploy Humanoid Welding Robots","url":"https://www.prnewswire.com/news-releases/hd-hyundai-and-persona-ai-sign-agreement-to-deploy-humanoid-welding-robots-for-shipbuilding-automation-302449258.html"},{"title":"Persona AI 官网","url":"https://persona.ai"}],"as_of":"2026-09","related_ids":["humanoid-robot",null,"robot-as-a-service","dirty-dull-and-dangerous-jobs","florida-institute-for-human-and-machine-cognition"],"name":"Persona AI","alt":"Persona AI","abbr":"","aliases":["Persona AI, Inc."],"one_liner":"美国休斯敦的人形机器人公司，主攻造船焊接等重工业场景","explanation":"Persona AI 2024 年在美国休斯敦成立，CEO 是 Nic Radford，CTO 是双足机器人研究者 Jerry Pratt，另一位联合创始人是 COO Jide Akinyode。它做面向重工业的人形机器人，重点是造船焊接，也列出采矿、巡检、钢结构加工等场景，商业上打算走机器人即服务（按租用收费）模式，客户不用一次性买断。2025 年 5 月宣布完成 2700 万美元超额认购的种子前轮融资。它与韩国 HD 现代集团签约开发造船用人形焊接机器人，计划 2026 年底交付原型，2027 年开始现场测试和商业部署。","example":"为 HD 现代船厂开发能走进船体结构里焊接的双足人形机器人。","related":["人形机器人","HD 现代","机器人即服务","3D 工作（脏、累、险）","IHMC（美国人机认知研究所）"]},{"id":"humanoid","category":"company","sec":2,"tier":3,"sources":[{"title":"Humanoid 官网","url":"https://thehumanoid.ai/"},{"title":"Humanoid News","url":"https://thehumanoid.ai/news/"},{"title":"Humanoid Secures Landmark Deal with Schaeffler","url":"https://thehumanoid.ai/news/humanoid-secures-landmark-deal-with-schaeffler-to-deploy-thousands-of-humanoid-robots/"}],"as_of":"2026-07","related_ids":["humanoid-hmnd-01","humanoid-robot","wheeled-humanoid-robot","schaeffler","figure-ai","apptronik"],"name":"Humanoid（英国人形机器人公司）","alt":"Humanoid","abbr":"","aliases":["SKL Robotics"],"one_liner":"伦敦的人形机器人公司，产品是轮式和双足两版 HMND 01。","explanation":"Humanoid 是 2024 年在英国伦敦成立的人形机器人公司（注册名 SKL Robotics），据报道创始人是投资人 Artem Sokolov。产品是面向工厂和物流的 HMND 01 Alpha，分轮式底盘版和双足版。配套的机器人 AI 框架 KinetIQ 负责机器人群的端到端调度，2026 年 6 月又推出主打操作可靠性和速度的 KinetIQ Ascend。2026 年它先后宣布与西门子和英伟达、舍弗勒、博世合作，官网称舍弗勒计划到 2032 年在全球工厂部署数千台（四位数）轮式版机器人。2026 年 7 月完成 1.52 亿美元 A 轮融资，投后估值 13.5 亿美元，官方称是欧洲第一家纯人形机器人独角兽。","example":"2026 年 5 月舍弗勒与 Humanoid 签约，在自家工厂部署 HMND 01 人形机器人。","related":["Humanoid HMND 01","人形机器人","轮式人形机器人","舍弗勒","Figure AI","Apptronik"]},{"id":"rainbow-robotics","category":"company","sec":2,"tier":3,"sources":[{"title":"Rainbow Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Rainbow_Robotics"}],"as_of":"2025-03","related_ids":["rainbow-robotics-rb-y1","samsung-electronics","darpa-robotics-challenge","collaborative-robot","wheeled-humanoid-robot","humanoid-robot"],"name":"Rainbow Robotics","alt":"Rainbow Robotics","abbr":"","aliases":["彩虹机器人","레인보우로보틱스"],"one_liner":"KAIST 人形机器人 HUBO 团队创办的韩国公司，2025 年起由三星控股。","explanation":"Rainbow Robotics 于 2011 年 2 月成立，总部在韩国大田，创始人吴俊镐（Oh Jun-ho）是 KAIST 人形机器人研究中心教授、双足人形 HUBO 的研发负责人。其 DRC-HUBO 赢得 2015 年 DARPA 机器人挑战赛。公司后来把关节、控制技术做成商品：RB 系列协作机器人（能和人在同一空间干活的机械臂）、四足机器人，以及 2024 年发布的轮式双臂人形 RB-Y1，后者常被海外实验室当作采集示教数据、训练 VLA 的平台。公司在韩国交易所上市（代码 277810）；据报道三星电子 2024 年底宣布增持至约 35%，2025 年 3 月获批后成为最大股东。","example":"RB-Y1 用轮式底盘加两条 7 自由度手臂，免去双足平衡问题，适合做移动操作研究。","related":["彩虹机器人 RB-Y1","三星电子（机器人业务）","DARPA 机器人挑战赛","协作机器人","轮式人形机器人","人形机器人"]},{"id":"clone-robotics","category":"company","sec":2,"tier":3,"sources":[{"title":"Clone Robotics 官网","url":"https://www.clonerobotics.com/"},{"title":"Protoclone 报道（Interesting Engineering）","url":"https://interestingengineering.com/innovation/video-worlds-first-humanoid-lifelike-muscles"}],"as_of":"2026-09","related_ids":["clone-robotics-protoclone",null,null,null,null],"name":"Clone Robotics","alt":"Clone Robotics","abbr":"","aliases":["Clone"],"one_liner":"用人工肌肉驱动、照人体解剖结构造人形的仿生机器人公司","explanation":"Clone Robotics 2021 年起步，据报道总部在波兰弗罗茨瓦夫，创始人为 Dhanush Radhakrishnan 和 Łukasz Koźlik。它不走「电机+减速器」路线，而是仿照人体骨骼和肌肉：用名为 Myofiber 的流体驱动人工肌肉拉动聚合物骨架。公司从机械手起家，据 2023 年报道 Clone Hand 造价约 2800 美元；2025 年 2 月公开肌肉骨骼人形样机 Protoclone，当时仍是悬挂状态、未展示自主行走。官网现列出面向个人和企业的双足人形 Clone（Alpha 版）和在研的下一代 Neoclone。这条路线若走通，机器人会更柔顺、更像人，但控制和可靠性难度更高。","example":"Protoclone 用 1000 多根 Myofiber 人工肌肉驱动，号称有 200 多个自由度。","related":["Clone Protoclone","人工肌肉(Artificial Muscle)","仿生机器人(Bio-inspired Robot)","腱绳驱动(Tendon-Driven Actuation)","超仿生人形机器人(Hyper-realistic (Bionic) Humanoid Robot / Android)"]},{"id":"engineered-arts","category":"company","sec":2,"tier":3,"sources":[{"title":"Engineered Arts - Wikipedia","url":"https://en.wikipedia.org/wiki/Engineered_Arts"},{"title":"Engineered Arts restructures in US and secures $10M to scale up humanoid robots（SiliconANGLE）","url":"https://siliconangle.com/2024/12/17/engineered-arts-restructures-us-secures-10m-scale-humanoid-robots/"},{"title":"Ameca (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Ameca_(robot)"},{"title":"About - Engineered Arts（官网）","url":"https://engineeredarts.com/us/about"}],"as_of":"2026-09","related_ids":["engineered-arts-ameca","hyper-realistic-humanoid-robot","uncanny-valley","human-robot-interaction","sophia","guided-tours-and-reception"],"name":"Engineered Arts","alt":"Engineered Arts","abbr":"","aliases":["Engineered Arts Ltd"],"one_liner":"英国人形机器人公司，以表情逼真的 Ameca 出名。","explanation":"Engineered Arts 2004 年 10 月由 Will Jackson 在英国康沃尔郡法尔茅斯创立。Jackson 在 1990 年代给伦敦科学博物馆做展览时，想要一台能反复给观众讲解知识的机器，这成了公司的起点；2005 年它为伊甸园项目做的机械剧场催生了第一台人形机器人 RoboThespian。2022 年 1 月在 CES 亮相的 Ameca 以细腻表情走红，由自研 Tritium 系统驱动，可接大语言模型对话，但不能走路；后来还出了只有头肩、放在桌上的 Ameca Desktop 和 Ami、Azi 等桌面款。2024 年 12 月公司重组为美国实体、在加州红木城设点，完成 Helium-3 Ventures 领投的 1000 万美元 A 轮。公司称已在 30 多个国家部署 250 多台机器人（含 RoboThespian 等历代产品）。","example":"Ameca 接上大语言模型后，可以一边和参观者对话，一边做出眨眼、皱眉、惊讶等表情。","related":["Ameca 表情人形","超仿生人形机器人","恐怖谷","人机交互","Sophia（索菲亚）机器人","导览接待"]},{"id":"anybotics","category":"company","sec":2,"tier":3,"sources":[{"title":"ANYbotics earns strategic investment from Climate Investment (The Robot Report)","url":"https://www.therobotreport.com/anybotics-earns-strategic-investment-from-climate-investment"},{"title":"ANYbotics raises additional USD 20 million (Startupticker)","url":"https://www.startupticker.ch/en/news/anybotics-raises-additional-usd-20-million"}],"as_of":"2026-08","related_ids":["anybotics-anymal","eth-zurich-robotic-systems-lab","quadruped-robot","inspection-robot","rl-based-locomotion-control"],"name":"ANYbotics","alt":"ANYbotics","abbr":"","aliases":[],"one_liner":"苏黎世联邦理工孵化的工业巡检四足机器人公司","explanation":"ANYbotics 2016 年成立于瑞士苏黎世，是苏黎世联邦理工学院机器人系统实验室（Marco Hutter 组）的衍生公司。产品是四足机器人 ANYmal，用于化工、能源、矿山等工业设施的自主巡检：带着相机、热像仪、气体传感器按路线巡查，替代人去危险区域。ANYmal 也是足式强化学习研究的经典平台，执行器网络、盲走、感知行走等代表工作都在它上面验证。2025 年 9 月追加 2000 万美元融资，据报道累计融资超 1.5 亿美元；首款防爆认证四足 ANYmal X 计划 2026 年开始交付。","example":"在石化厂里，ANYmal 按固定路线读取仪表、检测气体泄漏。","related":["ANYmal 四足","苏黎世联邦理工机器人系统实验室","四足机器人","巡检机器人","强化学习运控"]},{"id":"hello-robot","category":"company","sec":2,"tier":3,"sources":[{"title":"Hello Robot - About","url":"https://hello-robot.com/about"},{"title":"Hello Robot 官网（Stretch 4）","url":"https://hello-robot.com/"}],"as_of":"2026-09","related_ids":["hello-robot-stretch","mobile-manipulation","mobile-manipulator","ok-robot","dobb-e","household-tasks"],"name":"Hello Robot","alt":"Hello Robot","abbr":"","aliases":["Hello Robot Inc."],"one_liner":"美国移动操作机器人公司，产品是轻量、开源的 Stretch。","explanation":"Hello Robot 是 2017 年成立的美国机器人公司，办公地在佐治亚州亚特兰大和加州马丁内斯（后者负责生产）。CEO Aaron Edsinger 当过谷歌机器人总监，创办过 Meka Robotics 等公司；CTO Charlie Kemp 原是佐治亚理工副教授，做辅助型移动操作研究。公司只有 Stretch 一条产品线：差速底盘加竖直升降柱和伸缩臂，自由度少、重量轻、软件开源，面向科研、居家辅助（比如帮行动不便的人拿东西）和企业场景。学术界做家庭移动操作常用它，OK-Robot、Dobb·E 都在 Stretch 上做实验。截至 2026 年 9 月，官网在售第四代 Stretch 4，售价 29,950 美元。","example":"纽约大学的 OK-Robot 在 Stretch 上组合开放词汇检测和抓取模型，在真实家庭里完成「把某物拿到某处」的任务。","related":["Hello Robot Stretch","移动操作","复合机器人","OK-Robot","Dobb·E","家务任务"]},{"id":"collaborative-robotics","category":"company","sec":2,"tier":3,"sources":[{"title":"Cobot 团队页","url":"https://www.co.bot/team"},{"title":"Cobot 官网","url":"https://www.co.bot/"}],"as_of":"2026-09","related_ids":[null,null,null,null,"scale-ai"],"name":"Collaborative Robotics","alt":"Collaborative Robotics","abbr":"Cobot","aliases":["Cobot"],"one_liner":"前亚马逊机器人副总裁创办的美国公司，做与人协作的移动机器人 Proxie","explanation":"Collaborative Robotics（常简称 Cobot）2022 年成立，在西雅图和圣克拉拉设办公室。创始人兼 CEO Brad Porter 毕业于 MIT 计算机系，曾任亚马逊机器人副总裁、主导部署 50 多万台机器人，后任 Scale AI CTO。它主打能在人旁边安全工作的移动操作机器人 Proxie，面向医院、物流等劳动力短缺的场景，做搬运之类的重复体力活。A 轮由红杉、Khosla 和梅奥诊所投资，B 轮由 General Catalyst 领投（据报道为 2024 年、1 亿美元），之后成立了基础模型团队。注意它和泛指「协作机器人」的 cobot 一词不是一回事。","example":"","related":["协作机器人(Collaborative Robot)","复合机器人(Mobile Manipulator)","人机协作(Human-Robot Collaboration)","用工荒 / 劳动力短缺(Labor Shortage (Aging Workforce))","Scale AI"]},{"id":"unitree-robotics","category":"company","sec":3,"tier":1,"sources":[{"title":"Unitree Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Unitree_Robotics"},{"title":"Unitree G1","url":"https://www.unitree.com/g1/"},{"title":"unitreerobotics/unifolm-wla - GitHub","url":"https://github.com/unitreerobotics/unifolm-wla"}],"as_of":"2026-08","related_ids":["unitree-g1","unitree-go2","unitree-h2","unifolm","hangzhou-s-six-little-dragons","star-market"],"name":"宇树科技","alt":"Unitree Robotics","abbr":"","aliases":["宇树","Unitree"],"one_liner":"杭州的四足和人形机器人厂商，以低价高性能本体著称","explanation":"宇树科技 2016 年 8 月由王兴兴在杭州创立，他读研期间在上海大学做出了四足原型 XDog。宇树靠自研电机和控制把足式机器人价格大幅拉低：四足有 Go1、Go2、B2 等，人形有 H1、G1（2024 年发布，9.9 万元起）、H2（2025 年 10 月）。因为便宜、开放 SDK，G1 和 Go2 成了高校运控和人形 VLA 论文最常用的真机之一；2025 年春晚 H1 表演《秧BOT》出圈。它也开源 UnifoLM 系列模型。2025 年 7 月启动上市辅导，2026 年 8 月在上交所科创板上市（688836）。","example":"很多人形强化学习论文用 unitree_rl_gym 在仿真里训练行走策略，再部署到宇树 G1 上。","related":["宇树 G1","宇树 Go2","宇树 H2","宇树 UnifoLM 系列","杭州六小龙","科创板"]},{"id":"agibot","category":"company","sec":3,"tier":1,"sources":[{"title":"智元机器人 - 维基百科","url":"https://zh.wikipedia.org/wiki/智元机器人"},{"title":"AgiBot - Wikipedia","url":"https://en.wikipedia.org/wiki/AgiBot"},{"title":"AgiBot GO-2 发布","url":"https://www.agibot.com/article/231/detail/56.html"}],"as_of":"2026-04","related_ids":["agibot-go-1","agibot-go-2","agibot-world","agibot-a3","swancor-advanced-materials","agibot-g1g5-embodied-ai-roadmap"],"name":"智元机器人","alt":"AgiBot","abbr":"","aliases":["智元","Zhiyuan Robotics","智元新创"],"one_liner":"上海的人形机器人公司，本体、模型、数据集全栈自研","explanation":"智元机器人 2023 年 2 月在上海成立，联合创始人彭志辉（网名稚晖君）曾以华为「天才少年」身份入职，CEO 为邓泰华。产品线覆盖人形机器人远征 A2 系列、轮式双臂精灵 G1/G2、桌面人形灵犀 X1/X2、四足 D1 和 OmniHand 灵巧手。它同时做模型和数据：2025 年 3 月随百万条轨迹的 AgiBot World 数据集发布 GO-1（ViLLA 架构），2026 年 4 月发布 GO-2。2024 年 12 月开始量产，2025 年 1 月第 1000 台下线。据报道，2025 年 7 月它宣布取得科创板公司上纬新材控股权，并计划 2026 年赴港上市。","example":"智元用自家百台规模的数据采集工厂录制 AgiBot World，再在上面训练 GO-1，属于本体、数据、模型一体推进的路线。","related":["智元 GO-1（启元大模型）","智元 GO-2（Genie Operator-2）","AgiBot World 数据集","智元 远征 A3","上纬新材","智元 G1–G5 技术路线"]},{"id":"ubtech-robotics","category":"company","sec":3,"tier":1,"sources":[{"title":"UBtech Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/UBtech_Robotics"},{"title":"Walker S2 - UBTECH","url":"https://www.ubtrobot.com/en/humanoid/products/walker-s2"},{"title":"UBTECH-Robot/Thinker - GitHub","url":"https://github.com/UBTECH-Robot/Thinker"}],"as_of":"2026-02","related_ids":["ubtech-walker-s2","ubtech-thinker","first-listed-humanoid-robot-stock","hkex-chapter-18c","factory-pilot-deployment","industrial-robot"],"name":"优必选","alt":"UBTech Robotics","abbr":"","aliases":["UBTECH","优必选科技"],"one_liner":"深圳的人形机器人公司，港股上市，主推工业人形 Walker S","explanation":"优必选 2012 年 3 月由周剑在深圳创立，早期以小型人形机器人 Alpha 系列和教育机器人起家，之后做大型人形 Walker。2023 年 12 月在港交所上市（9880），被称为「人形机器人第一股」。当前主力是工业人形 Walker S 系列：进汽车工厂做搬运、分拣实训，2025 年 7 月发布的 Walker S2 能用双臂自己换电池，实现连续作业；据报道 2025 年拿到多笔上亿元订单。模型方面自研 Thinker 体系，2026 年初开源 Thinker-4B 视觉语言模型。","example":"Walker S2 在汽车工厂里约 3 分钟自主换一次电池，不用停工充电。","related":["优必选 Walker S2","优必选 Thinker","人形机器人第一股","港股 18C 章","进厂实训","工业机器人"]},{"id":"galbot","category":"company","sec":3,"tier":1,"sources":[{"title":"银河通用：成立34个月、6轮融资70亿（36氪）","url":"https://www.36kr.com/p/3978672823417862"},{"title":"Galbot Raises $362 Million in Fresh Funding, Eyes Hong Kong IPO (Caixin Global, 2026-03)","url":"https://www.caixinglobal.com/2026-03-03/galbot-raises-362-million-in-fresh-funding-eyes-hong-kong-ipo-102418742.html"},{"title":"银河通用加码零售场景应用，机器人在北京海淀开店（21世纪经济报道，2025-08）","url":"https://www.21jingji.com/article/20250808/herald/0c3a2e4ba2568d4a86a4647721408a51.html"}],"as_of":"2026-08","related_ids":["galbot-g1","galbot-s1","astrabrain","graspvla","navfom","synthetic-data"],"name":"银河通用","alt":"Galbot","abbr":"","aliases":["银河通用机器人","北京银河通用机器人股份有限公司","北京银河通用机器人有限公司"],"one_liner":"北大王鹤团队创办的北京具身公司，做轮式人形机器人和具身大模型。","explanation":"银河通用 2023 年 5 月在北京成立，创始人王鹤是斯坦福博士、北京大学计算机学院教师，长期研究机器人抓取与操作。产品以轮式双臂人形 Galbot G1 和工业重载款 S1 为主，2026 年 8 月又推出双足 ET1；模型方面先后发布抓取 GraspVLA、导航 NavFoM 等，并把整套具身大模型体系称为银河星脑 AstraBrain，特点是大量用仿真合成数据训练。机器人已在宁德时代工厂、药店和无人零售店落地，并登上 2026 年央视春晚。2026 年 3 月完成 25 亿元融资，国家人工智能产业投资基金等参投；据报道累计融资约 70 亿元、估值超 200 亿元，正筹备港股上市。","example":"在与美团买药合作的北京智慧药房里，一台 Galbot 管理约 40 平方米门店里的 5000 多种药品，按订单从货架取药，厂商称全程无需遥操作。","related":["银河通用 Galbot G1","银河通用 Galbot S1","银河星脑 AstraBrain","银河通用 GraspVLA","银河通用 NavFoM","合成数据"]},{"id":"galaxea-ai","category":"company","sec":3,"tier":1,"sources":[{"title":"星海图 关于我们","url":"https://www.galaxea-ai.com/about"},{"title":"星海图官网","url":"https://galaxea-ai.com/"}],"as_of":"2026-06","related_ids":["galaxea-g0-dual-system-vla","galaxea-r1","galaxea-open-world-dataset","dual-system-architecture","mobile-manipulation","tsinghua-university-institute-for-interdisciplinary-informat"],"name":"星海图","alt":"Galaxea AI","abbr":"","aliases":["Galaxea","星海图（北京）人工智能科技股份有限公司"],"one_liner":"北京具身智能公司，做轮式双臂机器人 R1 和开源 G0 模型","explanation":"2023 年 9 月在北京成立，走「整机+智能」路线，同时做机器人本体和基础模型；官网称核心团队有自动驾驶量产经验，据报道 CEO 为高继扬，联合创始人包括清华大学交叉信息研究院的学者。硬件有 R1 系列轮式双臂机器人（R1、R1 Pro、R1 Lite）和 A1 机械臂，官网称客户包括斯坦福、Physical Intelligence 等近百家机构。模型方面，2025 年 8 月底发布快慢双系统模型 G0 并开源，同时开源约 500 小时、10 万条轨迹的星海图开放世界数据集；之后又发布 G0Plus（2026 年 1 月）和 G0.5（2026 年 6 月）。官网披露 2025 年 2 月完成近 3 亿元 A 轮融资，由蚂蚁集团领投。","example":"研究者下载星海图开放世界数据集，在 R1 Lite 上微调 G0 做收拾桌面等任务。","related":["星海图 G0","星海图 R1","星海图开放世界数据集","快慢双系统","移动操作","清华大学交叉信息研究院（清华叉院）"]},{"id":"fourier","category":"company","sec":3,"tier":2,"sources":[{"title":"Fourier (company) - Wikipedia","url":"https://en.wikipedia.org/wiki/Fourier_Intelligence"},{"title":"傅利叶智能 - 维基百科","url":"https://zh.wikipedia.org/wiki/傅利叶智能"}],"as_of":"2025","related_ids":["fourier-gr-1","fourier-gr-2","fourier-gr-3","fourier-n1","fourier-actionnet","exoskeleton"],"name":"傅利叶","alt":"Fourier","abbr":"","aliases":["傅利叶智能","Fourier Intelligence"],"one_liner":"上海的人形机器人公司，康复机器人起家，产品 GR 系列","explanation":"2015 年由顾捷在上海创办，他毕业于上海交通大学，曾在美国国家仪器（NI）做销售管理，公司名来自数学家傅里叶。傅利叶先做康复机器人和外骨骼，服务医院康复科，2019 年开始研发人形机器人，关节采用自研 FSA 一体化执行器。2023 年发布 GR-1，是国内较早批量交付高校和研究机构的人形平台；2024 年 9 月发布 GR-2，之后推出面向照护陪伴场景的 GR-3，并开源真机数据集 ActionNet。投资方包括 IDG 资本和沙特阿美，据报道 2025 年初完成近 8 亿元 E 轮融资。它的特点是从康复医疗切入，把人形机器人往康养和照护场景推。","example":"3D 扩散策略的人形版本 iDP3 就是在傅利叶 GR-1 上做的真机验证。","related":["傅利叶 GR-1","傅利叶 GR-2","傅利叶 GR-3","傅利叶 N1","傅利叶 ActionNet 数据集","外骨骼"]},{"id":"limx-dynamics","category":"company","sec":3,"tier":2,"sources":[{"title":"LimX Dynamics - About","url":"https://www.limxdynamics.com/en/about"},{"title":"逐际动力完成A轮融资，人形机器人赛道融资升温（第一财经）","url":"https://www.yicai.com/news/102191399.html"},{"title":"张巍（百度百科）","url":"https://baike.baidu.com/item/%E5%BC%A0%E5%B7%8D/63753106"}],"as_of":"2026-07","related_ids":["limx-dynamics-tron-1","limx-dynamics-tron-2","limx-dynamics-oli","legged-robot","rl-based-locomotion-control","humanoid-robot"],"name":"逐际动力","alt":"LimX Dynamics","abbr":"","aliases":["逐际","LimX"],"one_liner":"深圳的足式与人形机器人公司，做 TRON 系列和 Oli 人形","explanation":"逐际动力 2022 年 1 月在深圳成立，创始人张巍是南方科技大学教授，曾任美国俄亥俄州立大学教授，长期研究足式机器人控制。公司从腿足运控起家，产品有可换点足、平足、轮足的双足机器人 TRON 1，可在双臂、双足、轮足间切换的 TRON 2，全尺寸人形 Oli 和 2026 年 5 月发布的 Luna；软件侧有人形「大脑」系统 COSA，2026 年 4 月开源 VLA 工程框架 FluxVLA Engine。2025 年 7 月阿里领投 A 轮，2026 年 2 月完成 2 亿美元 B 轮，7 月又完成约 2 亿美元 Pre-IPO 轮。","example":"高校实验室买一台 TRON 1 装上点足，在仿真里用强化学习训练行走策略，再部署到真机验证仿真到现实迁移。","related":["逐际动力 TRON 1","逐际动力 TRON 2","逐际动力 Oli","足式机器人","强化学习运控","人形机器人"]},{"id":"engineai","category":"company","sec":3,"tier":2,"sources":[{"title":"众擎机器人官网：完成2亿美元B轮融资，估值破百亿","url":"https://www.engineai.com.cn/about-news-media/55.html"},{"title":"21经济网：众擎机器人创始人赵同阳：下一代产品定位打工机器人","url":"https://www.21jingji.com/article/20251128/herald/42125069ac6bccd01f5b88914a62a867.html"},{"title":"观察者网风闻：众擎机器人据报已秘密递表港交所","url":"https://user.guancha.cn/main/content?id=1670242"}],"as_of":"2026-08","related_ids":["engineai-t800","engineai-pm01","engineai-se01","straight-knee-walking","humanoid-robot","rl-based-locomotion-control"],"name":"众擎机器人","alt":"EngineAI","abbr":"","aliases":["众擎","深圳众擎机器人科技有限公司","Engine AI"],"one_liner":"深圳人形机器人公司，以直膝行走、前空翻等高动态运动能力出名","explanation":"众擎 2023 年 10 月在深圳成立，创始人赵同阳此前带领小鹏旗下鹏行智能的机器人团队。公司主打「体能优先」，先把本体和运动控制（业内常说的「小脑」）做强：2024 年 10 月 SE01 实现直膝行走（不同于多数人形屈膝走路的姿态），PM01 以前空翻视频出圈，2025 年 12 月发布全尺寸人形 T800。融资节奏很快，2025 年京东领投 A1 轮；2026 年 4 月完成 2 亿美元 B 轮，河南投资集团汇融基金和立讯精密领投，估值破百亿元，随后又完成 B+ 轮，据报道已秘密递表港交所。2026 年 5 月首批 T800 下线，8 月在世界机器人大会发布具身智能引擎 EngineAI Awaken。","example":"T800 发布后因动作过于流畅被质疑是 CG，公司拍了 T800 踢倒 CEO 赵同阳的视频来回应。","related":["众擎 T800","众擎 PM01","众擎 SE01","直膝行走","人形机器人","强化学习运控"]},{"id":"booster-robotics","category":"company","sec":3,"tier":2,"sources":[{"title":"加速进化官网","url":"https://www.booster.tech/zh/"},{"title":"Booster Robotics 官网（英文）","url":"https://www.booster.tech/"}],"as_of":"2026-09","related_ids":["booster-robotics-t1","booster-robotics-k1","robocup",null,null,null],"name":"加速进化","alt":"Booster Robotics","abbr":"","aliases":["Booster"],"one_liner":"北京人形机器人公司，做面向开发者和机器人足球的中小尺寸人形","explanation":"加速进化是 2023 年在北京成立的人形机器人公司，创始人兼 CEO 据报道为程昊。它的定位是「具身开发平台」：卖给高校、竞赛队和开发者，开放 SDK，方便做强化学习运控和上层算法。产品有约 1.2 米的 Booster T1、约 95 厘米的入门款 K1（据报道起售价约 4999 美元）和旗舰开发平台 T2。它在机器人足球上最出名：2025 年清华火神队用 T1 拿下 RoboCup 人形成人组冠军；官网称 RoboCup 2026 包揽双足人形组三项冠军，59 支参赛队中有 38 支用它的机器人。官网称累计完成近 10 亿元融资。","example":"RoboCup 2025 上，清华火神队用 Booster T1 夺得人形成人组冠军，德国 HTWK 队用 K1 拿下 KidSize 组冠军。","related":["加速进化 Booster T1","加速进化 Booster K1","RoboCup 机器人世界杯","小尺寸人形机器人(Small-size Humanoid Robot)","强化学习运控(RL-based Locomotion Control)","科研教育市场(Research & Education Market)"]},{"id":"robotera","category":"company","sec":3,"tier":2,"sources":[{"title":"星动纪元官网：关于我们","url":"https://www.robotera.com/about/us"}],"as_of":"2026-06","related_ids":["era-42","robotera-star1","robotera-l7","robotera-xhand1","video-prediction-policy","tsinghua-university-institute-for-interdisciplinary-informat"],"name":"星动纪元","alt":"RobotEra","abbr":"","aliases":["Robot Era","北京星动纪元"],"one_liner":"清华叉院孵化的人形机器人公司，软硬件全栈自研，做 STAR1、L7 和 ERA-42。","explanation":"星动纪元 2023 年 8 月在北京成立，创始人陈建宇是清华大学交叉信息研究院助理教授，公司由清华持股孵化，官网称「软硬件全栈自研」。硬件方面有 2024 年 8 月发布的人形 STAR1、2025 年 7 月发布的全尺寸人形 L7（全身 55 个自由度）、12 自由度灵巧手 XHAND1 及 2026 年 6 月的升级款 XHAND 1 PRO；模型方面有端到端 VLA 模型 ERA-42，团队还发表过视频预测策略 VPP、可控世界模型 Ctrl-World 等论文。它是国内少数同时做本体、灵巧手和大模型的公司之一，产品面向物流、制造和商业服务。","example":"L7 由同一个 ERA-42 模型驱动，既演示街舞等高动态动作，也演示拧螺丝、分拣等精细操作。","related":["星动纪元 ERA-42","星动纪元 STAR1","星动纪元 L7","星动纪元 XHAND1 灵巧手","视频预测策略","清华大学交叉信息研究院（清华叉院）"]},{"id":"noetix-robotics","category":"company","sec":3,"tier":2,"sources":[{"title":"松延动力 - 人形机器人公司资料、融资、产品与估值 | RobotHub","url":"https://www.robothub.app/zh/companies/noetix-robotics"},{"title":"仿生机器人、万元级人形机器人「出圈」（21经济网）","url":"https://www.21jingji.com/article/20260407/herald/532f01a3612369c961d706065fd9bc76.html"},{"title":"95后姜哲源创建松延动力2年后，春晚再现机器人蔡明（瑞财经）","url":"https://m.rccaijing.com/news-7429165880347128834.html"}],"as_of":"2026-09","related_ids":["noetix-n2","noetix-bumi","10-000-yuan-class-humanoid-robot","hyper-realistic-humanoid-robot","small-size-humanoid-robot","research-and-education-market"],"name":"松延动力","alt":"Noetix Robotics","abbr":"","aliases":["Noetix","松延动力（北京）科技有限公司"],"one_liner":"北京人形机器人公司，以低价 N2、万元级小布米和仿生人脸出名。","explanation":"松延动力（Noetix Robotics）2023 年 9 月成立于北京昌平，创始人姜哲源是清华背景的「95 后」。它走标准化、低价路线：N2 等小尺寸人形机器人面向教育科研、展示和商演，据报道起售价 3.99 万元；2025 年 10 月发布小布米（Bumi），标价 9998 元，是较早的万元以下人形机器人。它还做 Hobbs 仿生人脸机器人，2026 年央视春晚上的「机器人蔡明」即出自它。据公开数据平台统计，公司累计融资约 15 亿元，其中 2026 年 3 月一轮约 10 亿元；2026 年 9 月有媒体报道其在冲刺 IPO。","example":"小布米 Bumi 标价 9998 元，面向家庭陪伴和教育场景。","related":["松延动力 N2","松延动力 小布米","万元级人形机器人","超仿生人形机器人","小尺寸人形机器人","科研教育市场"]},{"id":"leju-robotics","category":"company","sec":3,"tier":2,"sources":[{"title":"深圳新闻网：乐聚智能IPO获受理","url":"https://www.sznews.com/news/content/2026-05/20/content_32057558.htm"},{"title":"南都：乐聚机器人开启上市辅导","url":"https://m.mp.oeeee.com/a/BAAFRD0000202510311166071.html"},{"title":"新浪财经：乐聚机器人完成IPO辅导验收","url":"https://finance.sina.com.cn/wm/2026-04-22/doc-inhvkqha6091928.shtml"}],"as_of":"2026-05","related_ids":["leju-kuavo","humanoid-robot","full-size-humanoid-robot","small-size-humanoid-robot","m-robots-os","research-and-education-market"],"name":"乐聚机器人","alt":"Leju Robotics","abbr":"","aliases":["乐聚","乐聚智能"],"one_liner":"深圳的人形机器人公司，代表产品夸父，2026 年冲刺创业板","explanation":"乐聚智能（深圳）股份有限公司 2016 年成立，创始人冷晓琨（董事长兼 CTO）、常琳（CEO）、安子威（COO）均为哈尔滨工业大学博士，三人合计控制约 33.72% 股份。早期做 30–70 厘米的小型教育人形机器人，进入全国近 5000 所中小学和职业院校；2023 年 12 月发布全尺寸双足人形夸父（KUAVO），搭载开源鸿蒙，已在北汽等工厂试用。投资方包括腾讯、深投控等，2025 年 10 月完成近 15 亿元 Pre-IPO 轮。2026 年 5 月 19 日深交所受理其创业板 IPO，是首家适用创业板第四套上市标准的企业；IDC 数据称其 2025 年人形机器人出货量全球第三。","example":"夸父机器人曾在十五运会深圳站传递火炬。","related":["乐聚 夸父","人形机器人","全尺寸人形机器人","小尺寸人形机器人","M-Robots OS","科研教育市场"]},{"id":"magiclab","category":"company","sec":3,"tier":2,"sources":[{"title":"管理团队调整不到一周，魔法原子完成新一轮5亿元融资（界面新闻）","url":"https://m.jiemian.com/article/14090359.html"},{"title":"登春晚、筹划上市，创始人兼CEO突然离职（21经济网）","url":"https://www.21jingji.com/article/20260306/herald/dcf1a111991ff644ef5b79393144c1fd.html"},{"title":"魔法原子完成1.5亿元天使轮融资（魔法原子官网）","url":"https://www.magiclab.top/news/29"}],"as_of":"2026-03","related_ids":["magiclab-magicbot","humanoid-robot","quadruped-robot","xiaomi-cyberdog","lumos-robotics","factory-pilot-deployment"],"name":"魔法原子","alt":"MagicLab","abbr":"","aliases":["MagicLab","魔法原子机器人科技"],"one_liner":"追觅科技孵化的人形机器人公司，产品有 MagicBot 和 MagicDog","explanation":"魔法原子 2024 年 1 月对外成立，由追觅科技参与孵化，核心团队来自小米 CyberDog「铁蛋」机器狗项目，主体公司在江苏苏州，并在无锡设有公司。产品有全尺寸人形 MagicBot Gen1、小尺寸高动态双足人形 MagicBot Z1、四足 MagicDog 和灵巧手，先从工厂搬运、质检等场景切入。2024 年 12 月获 1.5 亿元天使轮，2026 年作为央视春晚智能机器人合作伙伴登台表演；同年 3 月创始人吴长征离职，CTO 陈春玉接任法定代表人，随后完成 5 亿元新一轮融资，公司称在加速推进上市。","example":"魔法原子把多台 MagicBot 放进工厂产线做质检、物料搬运和零件摆放实训，验证人形机器人进厂的可行性。","related":["魔法原子 MagicBot","人形机器人","四足机器人","小米 CyberDog","鹿明机器人","进厂实训"]},{"id":"astribot","category":"company","sec":3,"tier":2,"sources":[{"title":"深圳，又跑出一家百亿具身智能独角兽（智东西）","url":"https://m.zhidx.com/p/562710.html"},{"title":"星尘智能官网","url":"https://www.astribot.com/index.html"}],"as_of":"2026-09","related_ids":["astribot-s1","tendon-driven-actuation","wheeled-humanoid-robot","dual-arm-robot","teleoperation"],"name":"星尘智能","alt":"Astribot","abbr":"","aliases":[],"one_liner":"做绳驱 AI 机器人 Astribot S1 的深圳公司","explanation":"星尘智能（Astribot）2022 年 12 月成立于深圳。创始人兼 CEO 来杰曾任百度小度机器人团队负责人，后加入腾讯 Robotics X 实验室，是早期核心成员。代表产品 Astribot S1 是轮式双臂人形机器人，关节用绳驱（腱绳驱动，用绳索把电机的力传到关节），好处是手臂轻、动作快、碰到人更安全、成本更低。公司强调本体、遥操作、模型全栈自研，S1 发布时展示过开瓶、削黄瓜、写书法等自主家务操作。投资方包括蚂蚁集团、锦秋基金等；2026 年 6 月宣布 3 个月内完成三轮 B 轮系列融资、累计超 10 亿元，估值超 100 亿元。","example":"Astribot S1 发布视频中，机器人自主叠衣服、倒饮料、颠锅炒菜。","related":["星尘智能 Astribot S1","腱绳驱动","轮式人形机器人","双臂机器人","遥操作"]},{"id":"deep-robotics","category":"company","sec":3,"tier":2,"sources":[{"title":"上交所：杭州云深处科技股份有限公司招股说明书（申报稿）","url":"https://static.sse.com.cn/stock/disclosure/announcement/c/202605/002190_20260518_G44F.pdf"},{"title":"21经济网：云深处完成上市辅导","url":"https://www.21jingji.com/article/20260502/herald/2737465f8b9147a684f6b64e3683dcad.html"},{"title":"新浪财经：云深处科创板IPO更新财务资料","url":"https://finance.sina.com.cn/jjxw/2026-09-28/doc-initkxux9642412.shtml"}],"as_of":"2026-09","related_ids":["deep-robotics-jueying-x30","deep-robotics-lite3","deep-robotics-lynx","deep-robotics-dr02","quadruped-robot","inspection-robot"],"name":"云深处科技","alt":"DEEP Robotics","abbr":"","aliases":["云深处","杭州云深处科技股份有限公司"],"one_liner":"杭州四足机器狗厂商，主打电力巡检等行业应用，正冲刺科创板","explanation":"云深处 2017 年在杭州成立，创始人兼 CEO 朱秋国是浙江大学控制学院副教授，长期研究仿人和仿生机器人，与浙大博士李超（现任 CTO）一起创业，是「杭州六小龙」之一。它是国内最早把四足机器人商业化的公司之一，产品有绝影系列四足（X30、Lite3）、山猫系列轮足（腿末端装轮子）和 DR 系列人形，主要卖给电力巡检、应急消防、工业巡检、安防等行业客户。招股书显示 2025 年营收 3.37 亿元、首次盈利。2026 年 5 月 18 日科创板 IPO 获受理，8 月回复首轮问询，9 月 28 日更新财务资料，2026 年上半年净亏损约 880 万元，截至目前仍在审核中。","example":"云深处 2025 年发布的 DR02 号称首款全身 IP66 防护的人形机器人，把机器狗在户外巡检积累的防水防尘经验用到人形上。","related":["云深处 绝影 X30","云深处 绝影 Lite3","云深处 山猫","云深处 DR02","四足机器人","巡检机器人"]},{"id":"swancor-advanced-materials","category":"company","sec":3,"tier":3,"sources":[{"title":"智元机器人拟收购上纬新材63.62%股份（华尔街见闻）","url":"https://wallstreetcn.com/articles/3750667"},{"title":"从「智元资本壳」到启元机器人，上纬新材惊险一跃（界面新闻）","url":"https://www.jiemian.com/article/14955818.html"},{"title":"启元机器人开启预订 个人机器人叩开家庭新消费大门（科技日报，2026-08-23）","url":"https://www.stdaily.com/web/gdxw/2026-08/23/content_568520.html"}],"as_of":"2026-08","related_ids":["agibot","backdoor-listing","star-market","humanoid-robot-concept-stocks","consumer-grade-robot"],"name":"上纬新材","alt":"Swancor Advanced Materials","abbr":"","aliases":["上纬新材料科技股份有限公司","上纬启元"],"one_liner":"被智元机器人控股的科创板材料公司，现在也做消费级机器人","explanation":"上纬新材前身是 2000 年成立的上纬精细化工，总部在上海，2020 年科创板上市（代码 688585），原本做风电叶片用树脂等环保和新能源材料。2025 年 7 月，智元机器人宣布以协议转让加要约收购的方式入主，最终持有约 63.62% 的股份，成为控股股东，智元联合创始人彭志辉（稚晖君）出任董事长，市场一度把它看作智元「借壳上市」的壳，但智元表示三年内没有借壳计划。之后上纬新材以「上纬启元」品牌独立做面向家庭和个人的消费级机器人，和智元的工商业机器人分开。据 2026 年半年报，公司已推出启元 Q1、启元 T1 两款产品，收到预收货款 2.1 亿元；上半年营收 8.03 亿元，因机器人研发投入归母净亏损 1.67 亿元。","example":"2026 年 8 月，启元机器人开启预订，据报道售价约 2 万元，面向家庭用户。","related":["智元机器人","借壳上市","科创板","人形机器人概念股","消费级机器人"]},{"id":"zhejiang-fenglong-electric","category":"company","sec":3,"tier":3,"sources":[{"title":"优必选正式入主锋龙股份（证券时报网）","url":"https://stcn.com/article/detail/3674855.html"},{"title":"方达助力优必选科技收购锋龙股份控制性股权","url":"http://fangdalaw.com/content/print34_9321.html"},{"title":"锋龙股份再回应：优必选三年内不会借壳上市（新京报）","url":"https://m.bjnews.com.cn/detail/1766920585129742.html"}],"as_of":"2026-04","related_ids":["ubtech-robotics","backdoor-listing","humanoid-robot-concept-stocks","first-listed-humanoid-robot-stock"],"name":"锋龙股份","alt":"Zhejiang Fenglong Electric","abbr":"","aliases":["浙江锋龙电气股份有限公司"],"one_liner":"浙江精密零部件上市公司，2026 年起由优必选控股。","explanation":"锋龙股份（002931.SZ）2018 年在深交所上市，主营园林机械、汽车和液压三类精密零部件，客户包括 STIHL、本田等整机厂。它进入具身智能视野是因为控制权变更：2025 年 12 月 24 日，港股上市的人形机器人公司优必选宣布以「协议转让＋部分要约」方式、总价约 16.65 亿元收购其约 43% 股份；2026 年 3 月协议转让过户完成，实控人变为优必选创始人周剑；4 月 24 日部分要约完成，优必选合计持股约 43.01%。市场曾猜测优必选借此回 A 股，锋龙回应称优必选三年内不会借壳上市。","example":"","related":["优必选","借壳上市","人形机器人概念股","人形机器人第一股"]},{"id":"kepler-robotics","category":"company","sec":3,"tier":3,"sources":[{"title":"证券时报：上市公司入主在即，开普勒机器人发声回应","url":"https://www.stcn.com/article/detail/3921288.html"},{"title":"新京报：CEO出走后，开普勒机器人被卖给上市公司","url":"https://m.bjnews.com.cn/detail/1779279357129638.html"},{"title":"财联社：杭州柯林拟3亿元控股开普勒机器人","url":"https://www.cls.cn/detail/2375901"}],"as_of":"2026-05","related_ids":["kepler-forerunner-k2","humanoid-robot","planetary-roller-screw","full-size-humanoid-robot","mass-production","factory-pilot-deployment"],"name":"开普勒机器人","alt":"Kepler Robotics","abbr":"","aliases":["开普勒","上海开普勒机器人"],"one_liner":"上海的工业人形机器人公司，代表产品先行者 K2 大黄蜂","explanation":"上海开普勒机器人有限公司 2023 年 8 月成立，创始人、实际控制人杨华此前创办小米生态链企业纯米科技。它主打能在工厂干重活的「蓝领」人形机器人：2023 年发布先行者 K1，2024 年 10 月推出先行者 K2，商用版 K2 大黄蜂据称 2025 年 9 月量产，用于搬运、高空焊接等工业场景。前 CEO 胡德波 2026 年 2 月离任后另创具身大脑公司。公司尚未盈利，2025 年营收约 434 万元、净亏损约 6694 万元。2026 年 5 月，科创板公司杭州柯林公告拟以不超过 3 亿元再收购其 41.57% 股权，完成后持股 51% 并控股。","example":"先行者 K2 双臂可搬运 25–30 kg 物品，官方称充电 1 小时可续航 8 小时。","related":["开普勒 先行者 K2","人形机器人","行星滚柱丝杠","全尺寸人形机器人","量产","进厂实训"]},{"id":"casbot","category":"company","sec":3,"tier":3,"sources":[{"title":"灵宝 CASBOT 关于我们","url":"https://www.casbot.tech/about"},{"title":"灵宝 CASBOT 官网","url":"https://www.casbot.tech/"}],"as_of":"2026-02","related_ids":[null,null,null,null,null],"name":"中科慧灵（灵宝 CASBOT）","alt":"CASBOT (Beijing Zhongke Huiling Robot Technology)","abbr":"","aliases":["灵宝 CASBOT","中科慧灵","灵宝"],"one_liner":"北京人形机器人公司，产品有双足人形 CASBOT 01/02 和轮式 W1","explanation":"北京中科慧灵机器人技术有限公司 2023 年 8 月成立，总部在北京海淀中关村东升科技园，对外品牌是「灵宝 CASBOT」（2024 年 10 月发布）。它做全尺寸人形和具身智能机器人：2024 年 11 月发布首款全尺寸双足人形 CASBOT 01，2025 年 6 月发布第二代 CASBOT 02，8 月发布高度可调的轮式机器人 CASBOT W1 和轻量灵巧手 Handle-L1。目标场景包括商文体旅、科研教育、工业制造和特种作业。官网称 2025 年 2 月天使轮累计超 1 亿元、同年又完成约 1 亿元天使+轮，2026 年 2 月与合作方推进规模化生产。","example":"","related":["人形机器人(Humanoid Robot)","全尺寸人形机器人(Full-size Humanoid Robot)","轮式人形机器人(Wheeled Humanoid Robot)","灵巧手(Dexterous Hand)","百机大战(Hundred-Robot War (crowded humanoid market))"]},{"id":"kunlunxing-robotics","category":"company","sec":3,"tier":3,"sources":[{"title":"公司注册10天，估值逾10亿美元！理想智驾大牛创业（量子位，2026-03）","url":"https://www.qbitai.com/2026/03/394149.html"},{"title":"90天融了3轮，昆仑行完成数十亿元融资（投资界，2026-06）","url":"https://news.pedaily.cn/202606/565436.shtml"},{"title":"产业生态「强磁场」吸引昆仑行机器人极速落地（北京经济技术开发区，2026-06）","url":"https://kfqgw.beijing.gov.cn/ywdt/gdcyfzgd/zdxm/202606/t20260610_4694343.html"}],"as_of":"2026-06","related_ids":["li-auto-inc","autonomous-driving-talent-moving-into-embodied-ai","humanoid-robot","world-model","simplexity-robotics","funding-rounds-and-valuation"],"name":"昆仑行机器人","alt":"Kunlunxing Robotics","abbr":"","aliases":["昆仑行","北京昆仑行机器人科技有限公司"],"one_liner":"前阿里云高管任庚与前理想智驾负责人郎咸朋 2026 年创办的人形机器人公司。","explanation":"昆仑行 2026 年 3 月 16 日在北京注册，落户北京经济技术开发区（亦庄）。创始人兼 CEO 任庚曾任华为海外国家 CEO、阿里巴巴副总裁兼阿里云中国区总裁，后任新奥集团总裁；联合创始人兼 CTO 郎咸朋是理想汽车前智驾负责人，2026 年 1 月转去负责理想的人形机器人硬件后离职。公司做通用人形机器人，本体和具身大模型一起做，对标特斯拉 Optimus，宣传的技术有昆仑世界模型和双系统架构。2026 年 6 月宣布注册不到 90 天完成 3 轮、累计数十亿元融资，估值超 10 亿美元，高瓴、高榕、中科创星、创新工场等参投；截至 2026 年 6 月还没有公开产品。","example":"","related":["理想汽车","智驾转具身","人形机器人","世界模型","至简动力","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）"]},{"id":"unix-ai","category":"company","sec":3,"tier":3,"sources":[{"title":"UniX AI 官网：关于优理奇","url":"https://www.unix-group.ai/cn/About-UNIX-AI"},{"title":"科技日报：优理奇发布新一代高性能具身智能机器人","url":"https://www.stdaily.com/web/gdxw/2026-02/15/content_474669.html"}],"as_of":"2026-02","related_ids":["wheeled-humanoid-robot","mobile-manipulation","dual-arm-robot","vision-based-tactile-sensor","real-world-deployment"],"name":"优理奇","alt":"UniX AI","abbr":"","aliases":["优理奇机器人","优理奇智能科技（苏州）有限公司"],"one_liner":"苏州的具身智能公司，主打轮式双臂人形机器人 Wanda","explanation":"全称优理奇智能科技（苏州）有限公司，2024 年成立，总部在江苏苏州。创始人兼 CEO 杨丰瑜本科毕业于密歇根大学，在耶鲁大学读博时研究机器人视触觉感知；上海交大王贺升教授任首席科学家。公司走软硬全栈路线，自研核心零部件，产品包括轮式双臂人形机器人 Wanda 系列、双足人形 Martian，以及 2026 年 2 月发布的 Wanda Panther（黑豹）系列（8 自由度机械臂加四轮转向四驱底盘）。场景覆盖安防、零售仓储、酒店、导览和养老。融资方面，先后完成多轮天使轮，2025 年 12 月宣布两轮合计 3 亿元的天使++ 与天使+++ 轮。","example":"Wanda 在酒店或前置仓里用双臂整理物品、补货，底盘带着它在不同区域之间移动。","related":["轮式人形机器人","移动操作","双臂机器人","视触觉传感器","场景落地"]},{"id":"lumos-robotics","category":"company","sec":3,"tier":3,"sources":[{"title":"鹿明机器人完成数亿元A1及A2轮融资（雷峰网，2026-05-11）","url":"https://m.leiphone.com/category/industrynews/VqCT68PHdtdfvHXy.html"},{"title":"半年三轮，鹿明机器人完成天使++轮融资（投资界）","url":"https://news.pedaily.cn/202505/550373.shtml"},{"title":"清华系具身智能公司获数亿Pre-A轮融资（36氪）","url":"https://eu.36kr.com/zh/p/3582338244230272"}],"as_of":"2026-05","related_ids":["universal-manipulation-interface","fastumi","robot-free-data-collection","humanoid-robot","magiclab","joint-actuator-module"],"name":"鹿明机器人","alt":"Lumos Robotics","abbr":"","aliases":["鹿明","Lumos","鹿明机器人科技（深圳）有限公司"],"one_liner":"深圳的人形机器人公司，也做 FastUMI 无本体数据采集设备","explanation":"鹿明机器人 2024 年在深圳宝安成立，创始人兼 CEO 喻超毕业于清华，曾主导追觅科技的具身机器人业务，参与过小米 CyberDog「铁蛋」研发。产品有全尺寸人形 LUS 系列、重载轮臂机器人 MOS 系列，以及关节模组、视触觉模组等零部件；数据侧主推 FastUMI，一种沿用通用操作接口（UMI）思路、不需要真机的手持式数据采集设备，2026 年 3 月发布了系列化产品。2025 年它连续完成多轮天使和 Pre-A 轮，2026 年 5 月完成三菱电机领投的 A1、A2 轮，累计融资近 10 亿元。","example":"数采员手持 FastUMI 夹爪在真实家庭里完成开抽屉、叠衣服等动作，录下的视频和位姿轨迹直接用来训练机器人策略。","related":["通用操作接口","FastUMI","无本体采集","人形机器人","魔法原子","关节模组"]},{"id":"aheadform","category":"company","sec":3,"tier":3,"sources":[{"title":"首形科技获得新一轮数亿元A1轮融资（腾讯新闻）","url":"https://news.qq.com/rain/a/20260407A05Y5300"},{"title":"给机器人做「脸」，28岁哥大博士收获百万粉丝（科学网）","url":"https://news.sciencenet.cn/htmlnews/2025/8/550104.shtm"}],"as_of":"2026-07","related_ids":["hyper-realistic-humanoid-robot","uncanny-valley","human-robot-interaction","companion-robot","engineered-arts-ameca"],"name":"首形科技","alt":"AheadForm","abbr":"","aliases":[],"one_liner":"专做高仿真表情人脸机器人的中国创业公司","explanation":"首形科技（AheadForm）2024 年 6 月成立。创始人胡宇航博士毕业于哥伦比亚大学 Hod Lipson 的 Creative Machines Lab，读博期间做的人脸机器人 Emo 能提前约 0.84 秒预测并同步人的微笑，论文发表在《科学·机器人学》。公司专注仿生面部：自研硅胶皮肤，用约 30 个电机驱动面部，加上情绪与表情生成模型，让机器人能眨眼、挑眉、对口型，主攻情感交互、文旅和 IP 定制场景。投资方包括顺为资本、五源资本等；2026 年 4 月宣布完成数亿元 A1 轮融资，由华控基金等领投。","example":"2025 年底与网易《逆水寒》合作的 1:1 游戏角色仿生机器人「方承意」，能与观众眼神交流。","related":["超仿生人形机器人","恐怖谷","人机交互","陪伴机器人","Ameca 表情人形"]},{"id":"vbot","category":"company","sec":3,"tier":3,"sources":[{"title":"证券时报：维他动力完成近5亿元融资","url":"https://www.stcn.com/article/detail/3902691.html"},{"title":"极客公园：对话维他动力余轶南","url":"https://www.geekpark.net/news/364058"}],"as_of":"2026-05","related_ids":["quadruped-robot","consumer-grade-robot","companion-robot","autonomous-driving-talent-moving-into-embodied-ai","mass-production","vbot-super-robot-dog"],"name":"维他动力","alt":"Vbot","abbr":"Vbot","aliases":["Vbot 维他动力"],"one_liner":"前地平线副总裁余轶南创办的消费级机器狗公司","explanation":"2024 年 12 月成立，由前地平线副总裁余轶南、地平线前软件平台总架构师宋巍、理想汽车前智能驾驶产品总监赵哲伦联合创立，是「智驾转具身」的代表之一。公司从一开始就做面向家庭消费者的机器人，首款产品 Vbot 超能机器狗（昵称「大头BoBo」）主打不用遥控、能自主跟随和陪伴。2025 年底发布并开启预定，经过几轮产线试制，2026 年 5 月 8 日开始交付。同月完成近 5 亿元 Pre-A 轮融资，东方嘉富、华泰紫金、复星锐正联合领投，累计融资超过 7 亿元，资金用于量产、销售网络和新一代人形机器人研发。","example":"用户在公园遛 Vbot，它能自己识别主人并跟着走，不需要手里拿遥控器。","related":["四足机器人","消费级机器人","陪伴机器人","智驾转具身","量产","维他动力 Vbot 超能机器狗"]},{"id":"x-square-robot","category":"company","sec":4,"tier":1,"sources":[{"title":"自变量机器人官网","url":"https://www.x2robot.com/"},{"title":"智东西：自变量机器人报道","url":"https://zhidx.com/p/528318.html"}],"as_of":"2026-09","related_ids":["wall-a","wall-oss","vision-language-action-model","world-model","end-to-end"],"name":"自变量机器人","alt":"X Square Robot","abbr":"","aliases":["自变量","X Square","X-Square Robot"],"one_liner":"深圳具身智能公司，自研端到端具身大模型 WALL 系列和轮式双臂机器人。","explanation":"2023 年 12 月成立，总部深圳，主做通用机器人的端到端具身大模型。据智东西报道，创始人兼 CEO 王潜本硕毕业于清华，在美国南加州大学读博时做机器人研究；联合创始人兼 CTO 王昊曾任粤港澳大湾区数字经济研究院大模型团队算法负责人。模型有闭源的 WALL-A 系列、2025 年 9 月开源的 WALL-OSS，以及 2026 年发布的统一世界模型 WALL-B；硬件是轮式双臂「量子」系列。据报道 2026 年初完成 10 亿元 A++ 轮融资，投资方包括字节跳动、红杉中国、深创投等，此前还获阿里、美团投资。","example":"自变量开源的 WALL-OSS 以 Qwen2.5-VL 为骨干，能从一句指令一路输出推理、子任务和连续动作。","related":["自变量 WALL-A","自变量 WALL-OSS","视觉-语言-动作模型","世界模型","端到端"]},{"id":"spirit-ai","category":"company","sec":4,"tier":1,"sources":[{"title":"千寻智能官网新闻（发展历程）","url":"https://spirit-ai.com/news/8"},{"title":"首发 | 3个月近50亿，千寻打破具身融资纪录（投资界，2026-06）","url":"https://news.pedaily.cn/202606/564786.shtml"},{"title":"千寻智能韩峰涛：我们坚持使用「脏数据」（证券时报网，2026-07-20）","url":"https://stcn.com/article/detail/4029005.html"},{"title":"千寻智能再获10亿元融资，顺为资本和云锋基金联合领投（澎湃新闻，2026-04-07）","url":"https://m.thepaper.cn/newsDetail_forward_32915291"},{"title":"千寻智能完成15亿元A+轮融资（中国基金报，2026-06-03）","url":"https://www.chnfund.com/article/AR0ab851f9-7f8c-386e-c6c5-3a219ef0e2c5"}],"as_of":"2026-07","related_ids":["spirit-v1-5","vision-language-action-model","humanoid-robot","robochallenge","university-big-tech-autonomous-driving-founder-lineage"],"name":"千寻智能","alt":"Spirit AI","abbr":"","aliases":["千寻","Spirit AI"],"one_liner":"杭州的具身智能公司，做人形机器人 Moz1 和开源 VLA 模型 Spirit","explanation":"千寻智能 2024 年 1 月在杭州注册成立。创始人兼 CEO 韩峰涛曾是工业机器人公司珞石机器人的联合创始人兼 CTO；联合创始人兼首席科学家高阳是清华交叉信息研究院助理教授、UC Berkeley 博士；联合创始人兼 COO 郑灵茵负责商业化。公司同时做本体和模型：人形机器人 Moz1 主打全身力控，VLA 模型 Spirit v1.5 于 2026 年 1 月开源，发布时在 RoboChallenge Table30 真机榜单排第一。它的数据主张是不刻意清洗、保留失败重试的「脏数据」。融资很密集：2026 年 2 月宣布连续完成两轮、合计近 20 亿元，4 月再获 10 亿元（顺为资本、云锋基金联合领投），6 月完成 15 亿元 A+ 轮。据报道，这四轮约三个月内完成，媒体多称累计「近 50 亿元」，按已披露金额相加约 45 亿元；估值在 4 月已超过 200 亿元。据报道它已在宁德时代产线上做插接作业。","example":"2026 年 WAIC 上，Moz1 听到「整理客厅」后，自己把可乐放进冰箱、把脏碗送进洗碗机，屏幕上同步显示它拆解任务的过程。","related":["千寻 Spirit v1.5","视觉-语言-动作模型","人形机器人","RoboChallenge","高校系 / 大厂系 / 智驾系"]},{"id":"ai2-robotics","category":"company","sec":4,"tier":1,"sources":[{"title":"具身公司智平方融资估值超200亿元（财新）","url":"https://m.caixin.com/m/2026-06-29/102458633.html"},{"title":"智平方成粤港澳大湾区首个估值200亿具身智能独角兽（电子工程专辑）","url":"https://www.eet-china.com/news/202606304967.html"}],"as_of":"2026-06","related_ids":["govla","ai2-robotics-alphabot","vision-language-action-model","wheeled-humanoid-robot","real-world-deployment"],"name":"智平方","alt":"AI² Robotics","abbr":"","aliases":["AI Squared Robotics","智平方（深圳）科技"],"one_liner":"深圳的通用具身机器人公司，做 GOVLA 模型和 AlphaBot","explanation":"智平方（AI² Robotics）2023 年初成立于深圳。创始人郭彦东是普渡大学电子与计算机工程博士，曾任微软研究员，后任小鹏汽车和 OPPO 首席科学家。公司自研具身大模型 GOVLA（全域视觉-语言-动作模型，又称 AlphaBrain），硬件是 AlphaBot（爱宝）系列轮式双臂人形机器人，主打半导体、汽车、面板等工厂场景，据报道与惠科签下 3 年 1000 台订单。2026 年 2 月完成超 10 亿元 B 轮，估值过百亿元；6 月 29 日宣布新一系列融资合计近 50 亿元，估值超 200 亿元。","example":"AlphaBot 在面板工厂里搬运料盒、上下料，由 GOVLA 模型驱动。","related":["智平方 GOVLA（AlphaBrain）","智平方 AlphaBot","视觉-语言-动作模型","轮式人形机器人","场景落地"]},{"id":"tars-robotics","category":"company","sec":4,"tier":2,"sources":[{"title":"它石智航融资1.2亿美元，创下今年最大天使轮纪录（界面新闻，2025-03-26）","url":"https://www.jiemian.com/article/12523148.html"},{"title":"6个月内15家智能家居创企估值突破100亿（36氪）","url":"https://eu.36kr.com/zh/p/3874254534710276"},{"title":"arXiv 2512.24310: World In Your Hands","url":"https://arxiv.org/abs/2512.24310"}],"as_of":"2026-07","related_ids":["tars-robotics-awe","world-in-your-hands","human-video-data","wearable-data-collection","autonomous-driving-talent-moving-into-embodied-ai"],"name":"它石智航","alt":"TARS Robotics","abbr":"TARS","aliases":["它石","TARS"],"one_liner":"前华为、百度智驾高管创办的上海具身公司，主打人类数据训练的大模型 AWE","explanation":"它石智航 2025 年 2 月在上海成立。CEO 陈亦伦曾任华为车 BU 自动驾驶 CTO、大疆机器视觉总工程师；董事长李震宇曾任百度智能驾驶事业群总裁，主导过 Apollo 和萝卜快跑；首席科学家丁文超曾是华为「天才少年」、复旦大学研究员。公司的路线是以人类操作数据为主训练机器人：让采集员穿戴自研套件在工厂、超市、酒店干活，整理出 WIYH 数据集，再训练通用具身基座模型 AWE（2026 年 3 月发布 AWE 3.0）；硬件有工业机器人 A 系列、通用机器人 T 系列和灵巧手 TARS DexHand。2025 年 3 月完成 1.2 亿美元天使轮（蓝驰、启明领投）；据报道 2026 年 4 月完成 4.55 亿美元 Pre-A 轮，高瓴、红杉联合领投，估值约 130 亿元。","example":"2026 年 WAIC 上，它石展台用 AWE 3.5 驱动机器人做汽车线束装配。","related":["它石智航 AWE","它石 WIYH 数据集","人类视频数据","可穿戴采集","智驾转具身"]},{"id":"psibot","category":"company","sec":4,"tier":2,"sources":[{"title":"About Us - 灵初智能","url":"https://www.psibot.ai/about-us_zh"},{"title":"灵初智能完成A轮超亿美元融资（财联社）","url":"https://www.cls.cn/detail/2466860"},{"title":"灵初智能完成过亿美元融资（投资界）","url":"https://www.sohu.com/a/1068190102_122014422"}],"as_of":"2026-08","related_ids":["psi-r2","dexterous-manipulation","data-glove","human-video-data","world-model","tuopu-group"],"name":"灵初智能","alt":"PsiBot","abbr":"","aliases":["灵初","Psibot"],"one_liner":"上海具身智能公司，主攻灵巧操作模型和低成本人类数据采集","explanation":"灵初智能 2024 年成立，总部上海徐汇，创始人王启斌在手机、智能音箱和机器人行业做了近 20 年；公司与北京大学共建联合实验室，首席科学家是做强化学习的杨耀东。它主攻灵巧操作（多指手完成精细动作），模型用双系统架构：操作策略模型 Psi-R2 负责拆解长程任务、生成连续动作，Psi-W0 是以动作为条件的世界模型。数据走「人类数据路线」，用 Psi-SynEngine 采集引擎和 SynGlove 数据手套低成本采集真实场景数据，已在物流仓库做分拣验证。2026 年 3 月宣布天使轮加 Pre-A 轮累计融资 20 亿元，同年 8 月据报道又完成过亿美元新一轮，拓普集团、奇瑞旗下基金等参投。","example":"北大-灵初联合实验室的 DexKnot 让灵巧手学会给袋子打结，面向商超打包。","related":["灵初 Psi-R2","灵巧操作","数据手套","人类视频数据","世界模型","拓普集团"]},{"id":"dexmal","category":"company","sec":4,"tier":3,"sources":[{"title":"新京报：原力灵机完成2亿元天使轮融资","url":"https://m.bjnews.com.cn/detail/1742906053129898.html"},{"title":"新浪科技：Dexmal原力灵机融资近10亿元，阿里巴巴、蔚来资本分别领投","url":"https://finance.sina.com.cn/tech/digi/2025-11-14/doc-infxiwez1707401.shtml"},{"title":"瑞财经：Dexmal原力灵机两轮融资近10亿元","url":"https://m.rccaijing.com/news-7395014056673473687.html"}],"as_of":"2026-07","related_ids":["dm0","dexbotic","robochallenge","vision-language-action-model","hugging-face","open-source-hardware"],"name":"原力灵机","alt":"Dexmal","abbr":"","aliases":["Dexmal原力灵机","原力灵机（重庆）智能科技有限公司"],"one_liner":"旷视联合创始人唐文斌创办的具身智能公司，做 VLA 模型、开源工具和评测","explanation":"原力灵机 2025 年 3 月成立，工商主体注册在重庆。创始人兼 CEO 唐文斌是清华姚班出身、旷视科技联合创始人兼 CTO，核心成员范浩强、周而进、汪天才也来自旷视。成立当月完成 2 亿元天使轮；2025 年 11 月宣布 A 轮（蔚来资本领投）和 A+ 轮（阿里巴巴独家）合计近 10 亿元。它做了几件行业基础设施：开源 VLA 工具箱 Dexbotic（VLA 即视觉-语言-动作模型）、开源硬件 DOS-W1，并联合 Hugging Face 推出真机评测平台 RoboChallenge。2026 年 2 月与阶跃星辰联合发布开源模型 DM0，7 月推出 DM0.5。商业上先从物流仓储切入。","example":"RoboChallenge 让各家把模型部署到统一的真机上跑同一批任务，用真机成功率而不是仿真分数来比较 VLA。","related":["原力灵机 DM0","Dexbotic","RoboChallenge","视觉-语言-动作模型","Hugging Face","开源硬件"]},{"id":"ace-robotics","category":"company","sec":4,"tier":3,"sources":[{"title":"中国日报网：首创ACE具身研发范式，大晓机器人构建具身智能开放新生态","url":"https://cn.chinadaily.com.cn/a/202512/19/WS69450572a310942cc49978f4.html"},{"title":"人民网上海：大晓机器人完成天使+轮融资","url":"http://sh.people.com.cn/n2/2026/0616/c176738-41611926.html"},{"title":"百度百科：大晓机器人","url":"https://baike.baidu.com/item/%E5%A4%A7%E6%99%93%E6%9C%BA%E5%99%A8%E4%BA%BA/67054231"}],"as_of":"2026-07","related_ids":["kairos","world-model","robot-brain-company","one-brain-multiple-robots","on-device-model","agibot"],"name":"大晓机器人","alt":"ACE Robotics","abbr":"","aliases":["商汤大晓","大晓","Daxiao Robotics"],"one_liner":"商汤联合创始人王晓刚牵头、以世界模型做机器人大脑的上海公司","explanation":"大晓机器人（ACE Robotics）2025 年 12 月在上海成立，由商汤科技联合创始人、执行董事王晓刚任董事长，澳大利亚科学院院士陶大程任首席科学家，商汤旗下基金是老股东。它不以造整机为主，而是做机器人的「大脑」：核心是开悟（Kairos）世界模型，也就是先学会预测「动作之后世界会怎样变」、再据此决策的模型，成立当月开源了 3.0 版，并推出可装到别家机器狗、人形上的具身大脑模组 A1。2026 年 6 月宣布完成天使+轮，据报道上半年累计融资数亿美元；7 月称计划一年内在 1000 家零售门店落地，合作方包括银河通用、智元等。","example":"媒体探访中，搭载 40 亿参数 Kairos-4B 端侧模型的人形机器人不连云端，自主完成浇花、从冰箱取麦片倒进碗里等家务。","related":["大晓机器人 开悟世界模型","世界模型","大脑公司","一脑多机","端侧模型","智元机器人"]},{"id":"noematrix","category":"company","sec":4,"tier":3,"sources":[{"title":"具身智能领域再掀波澜！穹彻智能完成Pre-A轮融资 | 穹彻智能","url":"https://www.noematrix.ai/news/noematrix_pre-a"},{"title":"穹彻智能完成A轮融资 | 穹彻智能","url":"https://www.noematrix.ai/news/Noematrix-A++"},{"title":"上海穹彻智能科技有限公司_百度百科","url":"https://baike.baidu.com/item/%E4%B8%8A%E6%B5%B7%E7%A9%B9%E5%BD%BB%E6%99%BA%E8%83%BD%E7%A7%91%E6%8A%80%E6%9C%89%E9%99%90%E5%85%AC%E5%8F%B8/64871743"}],"as_of":"2026-08","related_ids":["flexiv-robotics","sjtu-mvig-lab","embodied-foundation-model","world-action-model","robot-free-data-collection","hybrid-force-position-control"],"name":"穹彻智能","alt":"Noematrix","abbr":"","aliases":["上海穹彻智能科技有限公司"],"one_liner":"非夕科技孵化、卢策吾参与创办的具身智能大脑公司。","explanation":"穹彻智能（Noematrix）2023 年 11 月在上海成立，由力控机器人公司非夕科技战略孵化，联合创始人包括上海交通大学教授卢策吾（曾在斯坦福人工智能实验室做博士后）和非夕科技创始人王世全。它的核心产品是通用具身大脑 Noematrix Brain（2025 年 7 月发布 2.0 版），以及 CoMiner 伴随式数据采集系统等工具链，强调真实场景数据预训练加力位混合后训练，机器人已在药房批量落地。2026 年 2 月完成 C 资本领投的数亿元 A 轮，6 月再获上海交大人工智能未来基金等机构的战略投资，8 月发布具身世界模型 Noe-0 技术预览。","example":"药房拣药机器人：不改原有货架，约 2.5 平方米即可部署，对接门店订单系统。","related":["非夕科技","上海交通大学 MVIG 实验室（卢策吾组）","具身大模型","世界动作模型","无本体采集","力位混合控制"]},{"id":"beingbeyond","category":"company","sec":4,"tier":3,"sources":[{"title":"BeingBeyond 官网","url":"https://www.beingbeyond.com/"},{"title":"BeingBeyond GitHub","url":"https://github.com/BeingBeyond"},{"title":"Being-H0 (arXiv 2507.15597)","url":"https://arxiv.org/abs/2507.15597"}],"as_of":"2026-03","related_ids":["being-h0",null,null,null,"dexumi"],"name":"智在无界","alt":"BeingBeyond","abbr":"","aliases":[],"one_liner":"北京具身大模型创业公司，主打从人手视频学灵巧操作的 Being-H 系列","explanation":"智在无界是位于北京海淀的具身智能基础模型公司，由北京大学卢宗青团队创办（据报道 2025 年成立），论文通讯作者多为卢宗青。它的核心思路是「以人为中心」：用大规模人手视频和动捕数据预训练，再迁移到机器人灵巧手和人形上。模型线包括灵巧手操作的 Being-H 系列（Being-H0 被 ICML 2026 接收，后续有 H0.5、H0.7）、全身动作生成 Being-M、多模态模型 Being-VL，以及人形全身控制框架 BumbleBee（NeurIPS 2025 Spotlight）。硬件方面有桌面灵巧臂 D1、人形全身遥操作系统 Being-Actor，2026 年 3 月发布了数据采集设备 U1。","example":"Being-H0 先在约 1100 小时的人手数据 UniHand 上预训练，再用少量真机数据后训练，迁移到灵巧手上做抓取和操作。","related":["智在无界 Being-H0","人类视频预训练(Pretraining on Human Videos)","灵巧操作(Dexterous Manipulation)","跨本体(Cross-Embodiment)","DexUMI"]},{"id":"xingyuanzhi-robotics","category":"company","sec":4,"tier":3,"sources":[{"title":"星源智机器人完成Pre-A轮融资，10个月累计融资10亿元（新京报）","url":"https://m.bjnews.com.cn/detail/1780455817129694.html"},{"title":"成立10个月累计融资10亿 智源系星源智（科创板日报）","url":"https://www.cls.cn/detail/2391282"}],"as_of":"2026-06","related_ids":["beijing-academy-of-artificial-intelligence","robobrain","robot-brain-company","on-device-edge-deployment","world-model"],"name":"星源智","alt":"Xingyuanzhi Robotics (BAAI spin-off)","abbr":"","aliases":["星源智机器人","北京星源智机器人科技有限公司"],"one_liner":"北京智源研究院孵化的具身大脑公司，走软硬一体、端侧部署路线。","explanation":"星源智 2025 年 8 月 1 日在北京成立，由北京智源人工智能研究院孵化。创始人兼 CEO 刘东曾任京东智能驾驶总经理，联合创始人穆亚东是北京大学研究员、智源学者。公司不造机器人本体，而是做能装到不同机器人上的「具身大脑」（负责理解场景、规划任务的上层模型），走「软硬一体、端侧部署」路线，让大模型直接在机器人本机上跑，而不是依赖云端。成立一个月内完成 2 亿元天使轮（中科创星、高瓴、元禾原点等参投）；2026 年 6 月 3 日完成 Pre-A 轮，成立 10 个月累计融资约 10 亿元，资金投向具身大脑与世界模型研发和量产。","example":"","related":["北京智源人工智能研究院","智源 RoboBrain（具身大脑）","大脑公司","端侧部署","世界模型"]},{"id":"five-ages","category":"company","sec":4,"tier":3,"sources":[{"title":"BridgeVLA (arXiv 2506.07961, affiliations incl. FiveAges)","url":"https://arxiv.org/html/2506.07961"},{"title":"GitHub: fiveages-sim/open-deploy-ws","url":"https://github.com/fiveages-sim/open-deploy-ws"}],"as_of":"2025-07","related_ids":[null,null,null,null,null],"name":"中科第五纪","alt":"Five Ages","abbr":"","aliases":["FiveAges","第五纪"],"one_liner":"与中科院自动化所渊源较深的国内具身智能初创公司","explanation":"北京的具身智能初创公司，英文名 FiveAges。据报道团队与中国科学院自动化研究所关系密切：2025 年 6 月发布的 3D 操作模型 BridgeVLA 论文中，除自动化所、字节跳动 Seed 外，作者单位还列有 FiveAges。公司在 GitHub 上以 fiveages-sim 名义开源了一批工程代码，包括双臂机器人（如越疆 CR5、方舟无限 ARX 机械臂）的 ROS 2 部署工作空间、Isaac Sim 场景资产和强化学习示例，方向偏机械臂操作模型和仿真到真机部署。成立时间、融资等信息公开资料有限，这里不展开。","example":"","related":["BridgeVLA(BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models)","大脑公司(Robot-Brain (Model-only) Company)","Isaac Sim(NVIDIA Isaac Sim)","ROS 2(Robot Operating System 2)","越疆科技(Dobot)"]},{"id":"wujie-dynamics","category":"company","sec":4,"tier":3,"sources":[{"title":"36氪：无界动力完成超2亿美元天使轮融资","url":"https://m.36kr.com/p/3869370059035913"},{"title":"新浪财经：无界动力获3亿元天使融资","url":"https://finance.sina.com.cn/stock/hkstock/hkzmt/2025-11-11/doc-infwzrrv1941527.shtml"}],"as_of":"2026-07","related_ids":["latent-world-model","reinforcement-learning","world-model","manipulation","autonomous-driving-talent-moving-into-embodied-ai","braincerebellum-architecture"],"name":"无界动力","alt":"Wujie Dynamics","abbr":"","aliases":["无界动力（北京）技术研发有限公司"],"one_liner":"前地平线副总裁张玉峰创办，做机器人通用大脑和操作智能","explanation":"2025 年 3 月在北京成立，创始人兼 CEO 张玉峰曾在索尼、ARM 做研发管理，2017 年加入地平线，任副总裁、智能汽车事业部总裁。公司聚焦机器人的「通用大脑」和「操作智能」（让机器人双手可靠完成抓取、装配等任务），技术路线是隐空间世界模型（在压缩后的特征空间里预测环境变化）加强化学习；自研机器人本体 K15 已进入批量生产，先做工业和商业场景的软硬一体方案。据公司披露全球订单总额近 1 亿美元。融资很快：2026 年 6 月宣布完成超 2 亿美元天使轮，近 2 亿美元的 Pre-A 轮接近完成，投资方包括红杉中国、高瓴创投、京东等。","example":"","related":["隐空间世界模型","强化学习","世界模型","操作","智驾转具身","大脑-小脑架构（大小脑）"]},{"id":"simplexity-robotics","category":"company","sec":4,"tier":3,"sources":[{"title":"腾讯和阿里同时押注具身智能创企，至简动力5轮累计融资20亿元（21经济网，2026-03-09）","url":"https://www.21jingji.com/article/20260309/herald/4faae25f2c3c91bb0a84c3942cc445b2.html"},{"title":"至简动力半年完成5轮融资累计20亿元（每日商报，2026-03-11）","url":"https://mdaily.hangzhou.com.cn/mrsb/2026/03/11/article_detail_3_20260311A078.html"},{"title":"别人还在叠衣服，至简动力的100台机器人已下车间（极客公园，2026-07-11）","url":"https://www.geekpark.net/news/367186"}],"as_of":"2026-07","related_ids":["autonomous-driving-talent-moving-into-embodied-ai","university-big-tech-autonomous-driving-founder-lineage","funding-rounds-and-valuation","machine-tending","real-world-deployment"],"name":"至简动力","alt":"Simplexity Robotics","abbr":"","aliases":[],"one_liner":"理想汽车智驾团队出来创办的具身智能公司，本体和模型都自己做","explanation":"至简动力 2025 年 7 月底成立，据报道总部在杭州，另在北京、上海、苏州设点。三位创始人都来自理想汽车：董事长王凯是前理想 CTO，CEO 贾鹏是前理想智能驾驶技术研发负责人，COO 王佳佳是前理想智驾量产负责人，属于典型的「智驾转具身」团队。公司同时做基座模型、数据闭环和机器人本体，先从工厂车间、商超、物流这类封闭场景落地。截至 2026 年 3 月，据报道不到半年完成 5 轮融资、累计约 20 亿元，估值超过 10 亿美元，投资方包括红杉中国、蓝驰创投，以及腾讯和阿里巴巴。2026 年 7 月 6 日，它在苏州宣布首款全场景机器人 i7 Pro 完成首批百台交付。","example":"2026 年 7 月，至简动力在苏州举行交付仪式，宣布 i7 Pro 首批 100 台进入工厂车间，并建成一条用于 CNC 机床上下料的具身机器人产线。","related":["智驾转具身","高校系 / 大厂系 / 智驾系","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）","上下料","场景落地"]},{"id":"morphi","category":"company","sec":4,"tier":3,"sources":[{"title":"成立半年估值超70亿，墨奇智能刷新国内具身智能首轮融资规模纪录（凤凰网财经）","url":"https://finance.ifeng.com/c/8uZNoCWQZF8"},{"title":"成立半年估值超70亿，墨奇智能创国内具身智能天使轮融资纪录（搜狐/财闻）","url":"https://www.sohu.com/a/1046673669_122014422"}],"as_of":"2026-07","related_ids":["autonomous-driving-talent-moving-into-embodied-ai","university-big-tech-autonomous-driving-founder-lineage","data-flywheel","household-tasks","service-robot","funding-rounds-and-valuation"],"name":"墨奇智能","alt":"Morphi","abbr":"","aliases":["Moqi Intelligence"],"one_liner":"前华为智驾负责人参与创办的具身智能公司，目标是通用家庭机器人。","explanation":"墨奇智能（Morphi）成立于 2025 年底，由黄青虬（CTO）和高文礼（CEO）联合创办。黄青虬是清华自动化系本科、港中文多媒体实验室博士，曾任华为车 BU 智驾 AI 部门负责人；高文礼是跨境物流公司 iMile 联合创始人。公司想把智能驾驶里验证过的数据闭环、端侧模型优化和量产质量管控搬到机器人上，路线是先在酒店服务、末端配送等商用场景部署、积累真实数据，再进入家庭。2026 年 7 月宣布完成超 10 亿元人民币天使轮系列融资，阿里巴巴、腾讯领投，投后估值据报道超 70 亿元。","example":"2026 年 7 月超 10 亿元天使轮，阿里巴巴、腾讯领投，创国内具身智能首轮公开融资规模纪录。","related":["智驾转具身","高校系 / 大厂系 / 智驾系","数据飞轮","家务任务","服务机器人","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）"]},{"id":"pragmatik-labs","category":"company","sec":4,"tier":3,"sources":[{"title":"刚刚，林俊旸官宣创业公司Pragmatik Labs（新浪科技，2026-08）","url":"https://finance.sina.com.cn/tech/roll/2026-08-12/doc-inimzcpz4117680.shtml"},{"title":"上海抢走林俊旸：首轮融资阵容出炉（投资界，2026-08）","url":"https://news.pedaily.cn/202608/567608.shtml"},{"title":"林俊旸新公司卜拉格工商信息与首轮估值（量子位，2026-06）","url":"https://www.qbitai.com/2026/06/436138.html"}],"as_of":"2026-08","related_ids":["alibaba-group","qwen-vl","qwen-robot-series","embodied-agent","world-model"],"name":"语用科技","alt":"Pragmatik Labs","abbr":"p7k","aliases":["卜拉格科技","卜拉格","上海卜拉格科技有限公司","语用（上海）科技有限公司","Pragmatik"],"one_liner":"前阿里千问技术负责人林俊旸创办的智能体公司，方向含具身智能。","explanation":"语用科技由阿里千问大模型前技术负责人林俊旸创办。林俊旸 1993 年生，北京大学硕士，2022 年底起任千问技术负责人，是阿里最年轻的 P10，2026 年 3 月离职。他 5 至 6 月在上海注册了语用（上海）科技、上海卜拉格科技等主体，所以早期报道多称「卜拉格」；8 月 12 日正式官宣。公司研究横跨数字和物理世界的下一代智能体：数字智能体面向知识工作和业务运营，物理智能体就是具身智能，要在现实世界完成长程任务。据报道首轮融资数亿美元，高榕创投、红杉中国领投、各约 1 亿美元，腾讯投约 2000 万美元，投后估值约 20 亿美元；官宣时尚未发布模型或产品。","example":"","related":["阿里巴巴","通义千问 Qwen-VL","千问 Qwen-Robot 系列","具身智能体","世界模型"]},{"id":"xiaomi","category":"company","sec":5,"tier":1,"sources":[{"title":"Xiaomi - Wikipedia","url":"https://en.wikipedia.org/wiki/Xiaomi"},{"title":"Xiaomi-Robotics-0 (arXiv 2602.12684)","url":"https://arxiv.org/abs/2602.12684"}],"as_of":"2026-07","related_ids":["xiaomi-robotics-0","mimo-embodied","xiaomi-cyberdog","xiaomi-cyberone","xiaomi-cybergear-micro-motor","automakers-entering-humanoid-robotics"],"name":"小米","alt":"Xiaomi","abbr":"","aliases":["小米机器人","Xiaomi Robotics","小米集团"],"one_liner":"做手机和汽车的消费电子公司，也在做机器狗、人形和开源 VLA 模型。","explanation":"2010 年 4 月由雷军等人在北京创办，2018 年在港交所上市，业务从手机扩展到家电和汽车。机器人方面，2021 年发布开源四足机器狗 CyberDog，2022 年展示人形机器人 CyberOne，2023 年推出售价 499 元的一体化关节电机 CyberGear。2025 年起小米具身团队开始发模型：2025 年 11 月开源兼顾机器人和自动驾驶的视觉语言模型 MiMo-Embodied；2026 年 2 月开源 47 亿参数的 VLA 模型 Xiaomi-Robotics-0，主打边执行边推理、动作不卡顿；7 月又发布用 10 万小时以上真机数据训练的 Xiaomi-Robotics-1。","example":"Xiaomi-Robotics-0 在 RTX 4090 上推理延迟约 80 毫秒，靠异步执行让机械臂动作连贯。","related":["小米 Xiaomi-Robotics-0","小米 MiMo-Embodied","小米 CyberDog","小米 CyberOne","小米 CyberGear 微电机","车企造人形（车企入局）"]},{"id":"xpeng","category":"company","sec":5,"tier":1,"sources":[{"title":"XPeng - Wikipedia","url":"https://en.wikipedia.org/wiki/XPeng"},{"title":"CnEVPost: XPeng unveils next-gen IRON humanoid robot","url":"https://cnevpost.com/2025/11/05/xpeng-unveils-next-gen-iron-humanoid-robot/"}],"as_of":"2026-06","related_ids":["xpeng-iron","automakers-entering-humanoid-robotics","humanoid-robot","vision-language-action-model","autonomous-driving-talent-moving-into-embodied-ai","tesla"],"name":"小鹏汽车","alt":"XPeng","abbr":"","aliases":["小鹏","小鹏机器人","XPeng Robotics","XPeng Motors"],"one_liner":"广州智能电动车公司，做人形机器人 IRON，是车企造人形的代表。","explanation":"2014 年成立于广州的智能电动车公司，董事长何小鹏此前创办 UC 优视、后任阿里巴巴高管；2020 年在纽交所上市，2021 年在港交所双重主要上市。它把智驾积累的视觉、芯片和大模型能力延伸到机器人：2024 年首次发布人形机器人 IRON，2025 年 11 月发布新一代 IRON，全身 82 个自由度，搭载 3 颗自研图灵 AI 芯片，运行小鹏的 VLA 模型，目标 2026 年底量产，先用于门店导购、导览等商业场景，并与宝钢合作试做工业巡检。据报道 2026 年 6 月何小鹏宣布亲自带队机器人业务。","example":"新一代 IRON 身高约 1.78 米，单手 22 个自由度，计划先在小鹏门店做接待。","related":["小鹏 IRON","车企造人形（车企入局）","人形机器人","视觉-语言-动作模型","智驾转具身","特斯拉"]},{"id":"byd-company-limited","category":"company","sec":5,"tier":2,"sources":[{"title":"比亚迪：「人形机器人代号尧舜禹」等消息均不属实（IT之家，2026-06）","url":"https://www.ithome.com/0/960/816.htm"},{"title":"BYD unveils 5.2-feet-tall Xiao Di humanoid robot on showroom floors in China (Interesting Engineering, 2026-08)","url":"https://interestingengineering.com/ai-robotics/byd-xiao-di-humanoid-robot-china"},{"title":"比亚迪全球招聘具身智能人才（量子位，2024-12）","url":"https://www.qbitai.com/2024/12/238878.html"}],"as_of":"2026-08","related_ids":["automakers-entering-humanoid-robotics","humanoid-robot","xpeng","li-auto-inc","tesla","autonomous-driving-talent-moving-into-embodied-ai"],"name":"比亚迪","alt":"BYD Company Limited","abbr":"BYD","aliases":["比亚迪股份有限公司"],"one_liner":"全球销量最大的新能源车企，2026 年推出人形机器人「小迪」，先用在门店。","explanation":"比亚迪 1995 年由王传福等在深圳创立，从电池起家，2003 年进入汽车业，如今是全球销量最大的新能源车企。据其 2024 年 12 月的校招信息，公司具身智能研究团队成立于 2022 年，已做过工艺、协作、移动等工厂机器人，并在招人研究人形、双足和四足机器人。2026 年 5 月，执行副总裁李柯首次公开确认在开发人形机器人，希望每家门店配 2 到 3 台做迎宾和车型讲解；6 月网传的项目代号「尧舜禹」、年内自用 2 万台等说法被比亚迪否认。8 月，首款人形机器人「小迪」在郑州「迪空间」体验馆首次公开亮相，身高 1.61 米、全身 31 个自由度，先做迎宾、车型讲解和车机演示。","example":"按李柯的设想，门店里的人形机器人负责迎宾、讲解车型和演示车机功能，和销售员配合，而不是替代销售员。","related":["车企造人形（车企入局）","人形机器人","小鹏汽车","理想汽车","特斯拉","智驾转具身"]},{"id":"hyundai-motor-group","category":"company","sec":5,"tier":2,"sources":[{"title":"Hyundai Motor Group - Wikipedia","url":"https://en.wikipedia.org/wiki/Hyundai_Motor_Group"},{"title":"Atlas (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Atlas_(robot)"},{"title":"Boston Dynamics News","url":"https://bostondynamics.com/news/"}],"as_of":"2026-01","related_ids":["boston-dynamics","boston-dynamics-atlas-2","automakers-entering-humanoid-robotics","gemini-robotics","softbank-group","humanoid-robot"],"name":"现代汽车集团","alt":"Hyundai Motor Group","abbr":"","aliases":["现代集团","Hyundai"],"one_liner":"韩国汽车集团，波士顿动力的控股股东和首个大客户。","explanation":"现代汽车集团 1998 年由现代汽车收购起亚后形成，总部在韩国首尔，旗下有现代、起亚、捷尼赛思、现代摩比斯等，2023 年按产量是全球第三大车企集团。2021 年 6 月它从软银手里完成收购波士顿动力约 80% 的股份，由此进入机器人行业。CES 2026 上集团发布 AI 机器人战略，波士顿动力展示了面向汽车装配的量产版电动 Atlas，计划 2028 年部署到美国佐治亚州的现代汽车集团美国工厂（HMGMA），Atlas 还将搭配谷歌的 Gemini Robotics 模型。它是「车企入局人形」的典型：既是股东，也是第一个大客户。","example":"波士顿动力在 HMGMA 园区开设应用中心，让 Atlas 在真实工厂环境里练习汽车零部件排序任务。","related":["波士顿动力","波士顿动力 Atlas（电动版）","车企造人形（车企入局）","Gemini Robotics","软银集团","人形机器人"]},{"id":"honor","category":"company","sec":5,"tier":2,"sources":[{"title":"荣耀手机公司入局人形机器人，百万年薪抢人（36氪）","url":"https://eu.36kr.com/zh/p/3697024553873025"},{"title":"HONOR Advances Its AI Vision at MWC 2026 with Robot Phone, Humanoid Robot","url":"https://www.honor.com/global/news/honor-mwc2026-launch/"},{"title":"荣耀机器人包揽亦庄「半马」前三名（北京日报，2026-04）","url":"https://news.bjd.com.cn/2026/04/19/11697522.shtml"},{"title":"Ratified: world records for Kiplimo, Tharp and Wanyonyi（World Athletics，2026-09-03）","url":"https://worldathletics.org/news/press-releases/ratified-world-records-kiplimo-tharp-wanyonyi"}],"as_of":"2026-07","related_ids":["honor-lightning-humanoid-robot","humanoid-robot-half-marathon","world-humanoid-robot-games","joint-actuator-module","liquid-cooled-joint-actuators"],"name":"荣耀","alt":"HONOR","abbr":"","aliases":["荣耀终端","荣耀终端股份有限公司"],"one_liner":"深圳手机厂商，2025 年起押注机器人，自研人形「闪电」夺半马冠军。","explanation":"荣耀 2013 年作为华为旗下手机子品牌创立，2020 年 11 月从华为独立，总部深圳。2025 年 3 月它发布「阿尔法战略」，称五年投入 100 亿美元转型 AI 终端生态公司，机器人是其中一块；4 月成立新产业孵化部，下设具身智能、具身数据、动力总成、仿生本体等实验室。2026 年 3 月 1 日在 MWC 上展示带机械云台的「机器人手机」，并发布自家首款人形机器人；4 月 19 日，自研人形「闪电」在北京亦庄人形机器人半马以 50 分 26 秒夺冠，荣耀三支队伍包揽前三。公司正在推进 A 股上市，2025 年 6 月完成辅导备案。","example":"亦庄半马上，「闪电」以自主导航模式跑完约 21 公里，净时 50 分 26 秒，快于当时的人类男子半马世界纪录 57 分 20 秒（乌干达选手基普利莫 2026 年 3 月在里斯本创造）。","related":["荣耀「闪电」人形机器人","人形机器人半程马拉松","世界人形机器人运动会","关节模组","关节液冷（主动散热）"]},{"id":"dji","category":"company","sec":5,"tier":2,"sources":[{"title":"DJI - Wikipedia","url":"https://en.wikipedia.org/wiki/DJI"}],"as_of":"2026-02","related_ids":["robomaster-robocon-university-robotics-competitions","livox","livox-mid-360","unmanned-aerial-vehicle","robot-vacuum-cleaner","lidar"],"name":"大疆创新","alt":"DJI","abbr":"DJI","aliases":["大疆","深圳市大疆创新科技有限公司"],"one_liner":"深圳消费级无人机龙头，旗下有 RoboMaster 赛事和览沃激光雷达","explanation":"2006 年由汪滔在深圳创办，他在香港科技大学读书时就在宿舍做无人机飞控原型，总部在深圳南山。大疆以消费级无人机起家，截至 2024 年 6 月占全球消费无人机市场九成以上，产品还包括 Osmo 手持影像设备、Ronin 稳定器、农业无人机和 RoboMaster 教育机器人。它和具身智能的交集主要有三处：一是主办面向大学生的 RoboMaster 机器人竞赛，培养了大批机器人工程师；二是孵化了激光雷达公司览沃，其 Mid-360 被许多人形和四足机器人采用；三是 2025 年推出扫地机器人 Romo，进入家用机器人。美国方面，2025 年 12 月 FCC 禁止新款大疆无人机进口和销售，大疆 2026 年 2 月起诉美国政府。","example":"宇树 G1 人形机器人头部用的就是览沃 Mid-360 激光雷达。","related":["RoboMaster / ROBOCON 大学生机器人竞赛","览沃科技","览沃 Mid-360","无人机（空中机器人）","扫地机器人","激光雷达"]},{"id":"samsung-electronics","category":"company","sec":5,"tier":3,"sources":[{"title":"Rainbow Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Rainbow_Robotics"},{"title":"Samsung advances in-house humanoid robot development with cost edge","url":"https://interestingengineering.com/ai-robotics/samsungs-humanoid-robot-with-lower-costs"}],"as_of":"2026-07","related_ids":["rainbow-robotics-rb-y1","rainbow-robotics","humanoid-robot","wheeled-humanoid-robot","actuator"],"name":"三星电子（机器人业务）","alt":"Samsung Electronics","abbr":"","aliases":["三星","Samsung"],"one_liner":"韩国电子巨头，2025 年控股彩虹机器人，布局人形与物理 AI","explanation":"三星电子是韩国最大的电子企业，主业是存储芯片、手机和家电。它在机器人上的关键动作是入股彩虹机器人（Rainbow Robotics，由 KAIST 人形机器人 HUBO 团队创办）：2024 年底宣布把持股提高到约 35% 成为最大股东，2025 年 3 月获监管批准完成控股，并设立直属 CEO 的未来机器人推进团队，由彩虹创始人吴俊镐领衔。彩虹的轮式双臂机器人 RB-Y1 据报道已在物流场景测试；三星还在内部研发人形机器人，打算把家电电机技术用在关节执行器上以压低成本。据报道 2026 年 7 月三星成立 RX 部门统筹机器人业务。","example":"彩虹机器人的 RB-Y1 轮式双臂机器人，据报道已在三星的物流场景中做测试。","related":["彩虹机器人 RB-Y1","Rainbow Robotics","人形机器人","轮式人形机器人","执行器"]},{"id":"lg-electronics","category":"company","sec":5,"tier":3,"sources":[{"title":"LG Acquires Majority Stake in Bear Robotics to Bolster Robotics Capabilities（LG 官网）","url":"https://www.lg.com/global/newsroom/news/corporate/lg-acquires-majority-stake-in-bear-robotics-to-bolster-robotics-capabilities/"},{"title":"LG's charge into humanoid robotics focuses on joints, eyes（The Korea Herald）","url":"https://www.koreaherald.com/article/10701560"},{"title":"LG moves deeper into humanoid supply chain（The Korea Herald）","url":"https://www.koreaherald.com/article/10808594"},{"title":"LG humanoid set for 2027 debut with Nvidia AI brain（The Korea Herald）","url":"https://www.koreaherald.com/article/10841656"}],"as_of":"2026-08","related_ids":["lg-cloid","joint-actuator-module","household-tasks","service-robot","samsung-electronics","consumer-electronics-show"],"name":"LG 电子","alt":"LG Electronics","abbr":"LGE","aliases":["LG","乐金电子","金星社（GoldStar）"],"one_liner":"韩国家电巨头，做家用人形 CLOiD 和关节执行器 AXIUM。","explanation":"LG 电子前身是 1958 年由具仁会创立的金星社（GoldStar），总部在首尔，以家电和电视闻名。机器人业务早年以 CLOi 品牌做导览、配送等商用机器人；2024 年 3 月以 6000 万美元入股硅谷送餐机器人公司 Bear Robotics，2025 年 1 月增持到 51% 取得控股，CLOi 商用机器人业务并入其中。2026 年 1 月在 CES 发布家用轮式人形 CLOiD 和关节执行器品牌 AXIUM（电机、驱动器、减速器一体）；3 月 CEO 在股东大会上宣布 2026 年为人形机器人业务元年，计划年内建成 AXIUM 量产体系、先用在 CLOiD 上，2027 年对外供货；据报道 CLOiD 会先进自家工厂做物料搬运。8 月 LG 集团与英伟达签约，计划 2027 年一季度推出基于 Jetson Thor 芯片的双足人形。","example":"CES 2026 现场，CLOiD 演示从冰箱取牛奶、把可颂放进烤箱、叠衣服。","related":["LG CLOiD","关节模组","家务任务","服务机器人","三星电子（机器人业务）","CES 国际消费电子展"]},{"id":"li-auto-inc","category":"company","sec":5,"tier":3,"sources":[{"title":"理想汽车内部会曝光：必做人形机器人（36氪，2026-01）","url":"https://www.36kr.com/p/3658883629212293"},{"title":"21独家｜理想汽车将在今年年内发布一款双轮机器人（21世纪经济报道，2026-03）","url":"https://www.21jingji.com/article/20260305/herald/c18a1aac9354fceb783a07969c1e9164.html"},{"title":"具身智能「上下半场」：李想在理想 L9 发布会上的表述（新浪财经，2026-05）","url":"https://finance.sina.com.cn/roll/2026-05-15/doc-inhxyimn6529650.shtml"}],"as_of":"2026-07","related_ids":["automakers-entering-humanoid-robotics","kunlunxing-robotics","simplexity-robotics","autonomous-driving-talent-moving-into-embodied-ai","xpeng","autonomous-driving"],"name":"理想汽车","alt":"Li Auto Inc.","abbr":"","aliases":["理想","Li Auto"],"one_liner":"北京新能源车企，2026 年宣布必做人形机器人，称自动驾驶是具身上半场。","explanation":"理想汽车 2015 年由李想在北京创办，主打增程和纯电 SUV，2020 年 7 月在纳斯达克上市，2021 年 8 月在港交所上市。2026 年 1 月 26 日全员会上，李想说理想「一定会做人形机器人，并会尽快落地亮相」；5 月又称「自动驾驶是具身智能的上半场，通用人形机器人是具身智能的下半场」。据报道，其机器人项目代号 Nexus，规划一款面向工厂的双轮机器人和一款双足人形，双轮款计划 2026 年内发布。前智驾负责人郎咸朋年初转任机器人硬件负责人后离职，创办昆仑行；更早离职的前 CTO 王凯等人则创办了至简动力。","example":"李想把人形机器人按泛化能力分三段：2030–2035 年达到 6 岁孩子水平，2035–2040 年到 12 岁，2040 年前后接近 18 岁，他称这是 15 到 20 年的过程。","related":["车企造人形（车企入局）","昆仑行机器人","至简动力","智驾转具身","小鹏汽车","自动驾驶"]},{"id":"gac-group","category":"company","sec":5,"tier":3,"sources":[{"title":"广汽集团发布第三代具身智能人形机器人 GoMate（IT之家）","url":"https://www.ithome.com/0/820/290.htm"},{"title":"广汽集团内部孵化具身智能机器人公司慧仑科技（广汽集团官网）","url":"https://www.gacgroup.com/cn/news/detail?baseid=19104"},{"title":"广汽旗下人形机器人公司慧仑科技完成亿元融资（广汽集团官网）","url":"https://www.gacgroup.com/cn/news/detail?baseid=19182"}],"as_of":"2026-08","related_ids":["automakers-entering-humanoid-robotics","wheel-legged-robot","inspection-robot","joint-actuator-module","xpeng"],"name":"广汽集团","alt":"GAC Group","abbr":"GAC","aliases":["广汽","广州汽车集团股份有限公司","慧仑科技"],"one_liner":"广州国有车企，孵化慧仑科技做轮足人形机器人 GoMate 系列。","explanation":"广汽集团 1997 年组建，总部在广州，是广州市属国有车企，港股和 A 股两地上市。它 2022 年初开始研发人形机器人，2024 年 12 月发布第三代 GoMate：能在四轮和两轮形态间切换的轮足结构，核心零部件自研。2025 年 10 月又推出第四代 GoMate Mini，主要做安防巡检。2026 年 2 月，广汽孵化成立广东慧仑科技，独立承接机器人研发和销售；8 月慧仑完成超亿元融资（中车国创基金、招银国际等），称 GoMate Mini 已部署近 50 台、拿到近千万元订单，计划 2027 年规模化量产。","example":"GoMate Mini 在园区和汽车产线按路线巡逻，用摄像头发现异常并上报；慧仑称最长的项目已连续运行 12 个月。","related":["车企造人形（车企入局）","轮足机器人","巡检机器人","关节模组","小鹏汽车"]},{"id":"aimoga-robotics","category":"company","sec":5,"tier":3,"sources":[{"title":"售价超28万元！奇瑞墨甲机器人上线京东（新浪财经）","url":"https://finance.sina.com.cn/roll/2026-04-14/doc-inhunttq4621338.shtml"},{"title":"背靠奇瑞求上市，墨甲机器人何时「独立」行走？（36氪）","url":"https://www.36kr.com/p/3957680691903616"},{"title":"Chery's robot unit Aimoga prepares for IPO, targets 10,000 deliveries（CnEVPost）","url":"https://cnevpost.com/2026/08/19/chery-aimoga-prepares-ipo/"}],"as_of":"2026-08","related_ids":["automakers-entering-humanoid-robotics","humanoid-robot","guided-tours-and-reception","quadruped-robot","agibot"],"name":"墨甲机器人","alt":"AiMOGA Robotics","abbr":"","aliases":["AiMOGA","墨甲","安徽墨甲智创机器人科技有限公司","奇瑞墨甲"],"one_liner":"奇瑞孵化的机器人公司，做接待人形、警用机器人和机器狗，筹备上市。","explanation":"墨甲机器人源自奇瑞汽车 2022 年启动的人形机器人预研（2023 年底首台样机下线），2025 年 1 月在安徽芜湖注册成立，奇瑞直接持股 76.8%，总经理张贵兵是奇瑞执行副总裁、国际业务负责人。产品有做 4S 店讲解、商场导购等接待工作的人形机器人「墨茵」（Mornine）、指挥交通的智警机器人、四足机器狗和家庭陪伴机器人。2026 年 1 月完成超 1 亿元天使轮，投后估值 25 亿元，智元机器人、IDG 资本等参投；4 月双足人形墨茵 M1 在京东开售，定价 28.58 万元。8 月张贵兵对路透社表示公司正筹备上市，累计交付各类机器人超 3000 台（海外约 2000 台），目标 2027 年交付 1 万台。","example":"在 4S 店里，墨茵用多种语言给顾客讲解车型、回答问题。","related":["车企造人形（车企入局）","人形机器人","导览接待","四足机器人","智元机器人"]},{"id":"mobileye","category":"company","sec":5,"tier":3,"sources":[{"title":"Mobileye To Acquire Mentee Robotics to Accelerate Physical AI Leadership","url":"https://www.mobileye.com/news/mobileye-to-acquire-mentee-robotics-to-accelerate-physical-ai-leadership"},{"title":"Mobileye to acquire humanoid robotics startup Mentee for $900 million (Reuters)","url":"https://www.reuters.com/world/asia-pacific/mobileye-acquire-humanoid-robotics-startup-mentee-900-million-2026-01-06"}],"as_of":"2026-01","related_ids":["mentee-robotics","mentee-robotics-menteebot","autonomous-driving","autonomous-driving-talent-moving-into-embodied-ai","humanoid-robot","physical-ai"],"name":"Mobileye","alt":"Mobileye","abbr":"","aliases":[],"one_liner":"以色列自动驾驶芯片公司，2026 年宣布收购人形机器人公司 Mentee。","explanation":"Mobileye 1999 年创立于以色列耶路撒冷，联合创始人 Amnon Shashua 是计算机视觉学者。它以 EyeQ 系列视觉芯片和辅助驾驶系统起家，2017 年被英特尔收购，2022 年在纳斯达克重新上市，英特尔仍是最大股东。2026 年 1 月 6 日，Mobileye 宣布以约 9 亿美元（其中约 6.12 亿美元现金，其余为最多 2620 万股 Mobileye 股票）收购人形机器人公司 Mentee Robotics，称之为「Mobileye 3.0」，要把自动驾驶的感知、决策和量产经验用到人形机器人上；计划 2026 年做客户概念验证部署，2028 年量产商用。它是「智驾转具身」的典型案例。","example":"Mobileye 以约 9 亿美元收购 Mentee Robotics，把人形机器人 MenteeBot 纳入旗下。","related":["Mentee Robotics","MenteeBot","自动驾驶","智驾转具身","人形机器人","物理AI"]},{"id":"mentee-robotics","category":"company","sec":5,"tier":3,"sources":[{"title":"Mobileye To Acquire Mentee Robotics（Mobileye News）","url":"https://www.mobileye.com/news/mobileye-to-acquire-mentee-robotics-to-accelerate-physical-ai-leadership/"},{"title":"Mobileye acquires humanoid robot startup Mentee Robotics for $900M（TechCrunch）","url":"https://techcrunch.com/2026/01/06/mobileye-acquires-humanoid-robot-startup-mentee-robotics-for-900m"}],"as_of":"2026-01","related_ids":["mentee-robotics-menteebot","mobileye","humanoid-robot","sim-to-real-transfer","vision-only-approach","autonomous-driving-talent-moving-into-embodied-ai"],"name":"Mentee Robotics","alt":"Mentee Robotics","abbr":"","aliases":["Mentee"],"one_liner":"以色列人形机器人公司，Mobileye 创始人创办，2026 年被其收购","explanation":"Mentee Robotics 2022 年在以色列成立，联合创始人包括 Mobileye 创始人 Amnon Shashua 和任 CEO 的 Lior Wolf。产品是通用人形机器人 MenteeBot：据报道第三代身高约 175 厘米、负载约 25 千克，只靠相机感知，用自研执行器和可热插拔电池，训练大量依赖仿真到现实迁移，强调听懂自然语言指令后自主完成任务，而不是靠遥操作。2026 年 1 月 6 日，Mobileye 宣布以约 9 亿美元收购 Mentee，计划 2026 年做首批客户概念验证、2028 年量产，把自动驾驶的感知和芯片能力延伸到人形机器人。","example":"Mentee 演示中，用户用一句话让 MenteeBot 去货架搬箱子，机器人自己理解场景、规划路径并完成搬运。","related":["MenteeBot","Mobileye","人形机器人","仿真到现实迁移","纯视觉方案","智驾转具身"]},{"id":"franka-robotics","category":"company","sec":6,"tier":2,"sources":[{"title":"Franka @ CES 2026: Powering the Future of Embodied AI","url":"https://franka.de/news/franka-ces-2026-powering-the-future-of-embodied-ai"},{"title":"Agile Robots acquires Franka Emika (Munich Startup, 2023-11)","url":"https://www.munich-startup.de/en/95730/agile-robots-takes-over-franka-emika/"},{"title":"Deutscher Zukunftspreis 2017, Team 2 (Franka Emika)","url":"https://www.deutscher-zukunftspreis.de/en/team-2-2017"}],"as_of":"2026-01","related_ids":["franka-emika-panda-franka-research-3","agile-robots","franka-hand","libfranka-franka-control-interface","droid","nvidia-isaac-gr00t-n1"],"name":"Franka","alt":"Franka Robotics","abbr":"","aliases":["Franka Emika","Franka Robotics GmbH"],"one_liner":"德国慕尼黑的力控机械臂厂商，Panda / FR3 是科研最常用的机械臂之一。","explanation":"Franka 的前身 Franka Emika 由 Sami Haddadin 等人 2016 年在德国慕尼黑创立，Haddadin 曾在德国宇航中心做机器人研究，团队凭 7 轴力控协作臂 Panda 获 2017 年德国未来奖。Panda 和后继科研版 FR3 每个关节都有力矩传感器，开放 1 kHz 实时控制接口，成了机器人学习论文和 DROID 等数据集里最常见的机械臂。公司 2023 年 8 月因股东分歧申请破产，11 月被思灵机器人收购，改名 Franka Robotics。之后转向具身智能：2025 年推出双臂原型 FR3 Duo，2026 年 1 月在 CES 上用它首次公开演示英伟达 GR00T N1.6 在本机端到端运行，并对外提供机器人数据采集服务。","example":"DROID 数据集由 13 家机构用同一套 Franka Panda 加相机采集，所以在 DROID 上训练的策略常直接拿 Franka 真机测试。","related":["Franka 机械臂（Panda / FR3）","思灵机器人","Franka 夹爪","libfranka","DROID 数据集","GR00T N1 系列"]},{"id":"universal-robots","category":"company","sec":6,"tier":2,"sources":[{"title":"Universal Robots - Wikipedia","url":"https://en.wikipedia.org/wiki/Universal_Robots"}],"as_of":"2026-09","related_ids":["collaborative-robot","universal-robots-ur5e","rtde","streaming-servo-control","6-axis-robot-arm"],"name":"优傲机器人","alt":"Universal Robots","abbr":"UR","aliases":["优傲"],"one_liner":"丹麦协作机械臂厂商，卖出第一款商用协作机器人，UR5e 是实验室常客。","explanation":"2005 年成立于丹麦欧登塞，创始人是 Esben Østergaard、Kasper Støy 和 Kristian Kassow 三位研究者。2008 年卖出公认第一款商业上可行的协作机器人（能和人在同一空间安全作业的机械臂），2015 年被美国测试设备公司泰瑞达以 2.85 亿美元收购。产品线从 UR3、UR5、UR10，到 2018 年的 e 系列（UR5e 等），再到 2022 年的 UR20 和 2024 年的 UR30，累计销量超过 10 万台。它接口开放，RTDE 可实时读写关节状态，是机器人学习实验室和真机数据集里常见的机械臂品牌。","example":"不少真机数据集和 VLA 论文用 UR5e 采集数据，通过 RTDE 以数百赫兹下发关节或末端指令。","related":["协作机器人","UR5e 协作机械臂","RTDE","透传控制","六轴机械臂"]},{"id":"agilex-robotics","category":"company","sec":6,"tier":2,"sources":[{"title":"AgileX Robotics - About Us","url":"https://global.agilex.ai/pages/about-us"}],"as_of":"2026-09","related_ids":["agilex-piper","agilex-cobot-magic","agilex-pika","mobile-aloha","mobile-base","leader-follower-teleoperation"],"name":"松灵机器人","alt":"AgileX Robotics","abbr":"","aliases":["松灵","AgileX"],"one_liner":"移动底盘和低价机械臂厂商，具身科研常用的硬件供应商","explanation":"松灵机器人 2016 年成立，总部在深圳，最早做移动机器人底盘和无人驾驶方案，产品包括 Scout、Hunter、Tracer、Ranger 等底盘和教育平台 LIMO。具身智能兴起后，它推出低价六轴机械臂 PiPER 和 NERO、复刻斯坦福 Mobile ALOHA 的双臂移动平台 Cobot Magic，以及不用真机就能采数据的手持夹爪套件 Pika。因为价格低、开源 ROS 驱动齐全，国内不少高校和公司用它的双臂平台做模仿学习和数据采集。官方称已与 1000 多家企业和 50 多所高校合作。","example":"实验室买一套 Cobot Magic，用主从臂遥操作录双臂叠衣服数据，再训练 ACT 或扩散策略。","related":["松灵 PiPER 机械臂","松灵 Cobot Magic","松灵 Pika 采集套件","Mobile ALOHA","移动底盘","主从臂遥操作"]},{"id":"dobot","category":"company","sec":6,"tier":2,"sources":[{"title":"财联社：机器人冲刺A股又添一例（越疆启动A股上市）","url":"https://www.cls.cn/detail/2245078"},{"title":"21财经：大湾区H回A首单，越疆科技创业板IPO即将上会","url":"https://m.21jingji.com/article/20260715/herald/c3f19a7d8572e488f9e91e10f9c3f6e5.html"},{"title":"21经济网：终止、等待、收购，机器人企业资本化路径分化","url":"https://www.21jingji.com/article/20260927/herald/a5a861b4b1cacffd91fba28f215f2b8b.html"}],"as_of":"2026-09","related_ids":["collaborative-robot","6-axis-robot-arm","dobot-magician","dobot-atom","desktop-robot-arm","research-and-education-market"],"name":"越疆科技","alt":"Dobot","abbr":"","aliases":["越疆","深圳市越疆科技股份有限公司","Shenzhen Dobot"],"one_liner":"深圳协作机械臂厂商，港股「协作机器人第一股」，也做人形","explanation":"越疆 2015 年在深圳南山成立，创始人刘培超任董事长兼总经理。它从桌面教育机械臂 Dobot Magician 起步，主力产品是六轴协作机器人（可以和人在同一空间安全工作的轻型机械臂），2025 年上半年这部分收入占总营收约六成，公司称 2025 年协作机器人出货量全球第一、累计装机超 10 万台。2024 年 12 月 23 日在港交所上市，被称为港股「协作机器人第一股」。近年延伸到具身智能：2025 年 3 月发布人形机器人 Atom，并布局多足机器人。2026 年启动回 A 股，创业板 IPO 于 4 月 27 日获受理、7 月 22 日通过上市委审议，截至 9 月尚未提交注册。","example":"高校和中小学常用越疆 Magician 讲机械臂运动学，工厂里则用它的 CR、Nova 系列协作臂做上下料和装配。","related":["协作机器人","六轴机械臂","越疆 Dobot Magician","越疆 Atom","桌面机械臂","科研教育市场"]},{"id":"agile-robots","category":"company","sec":6,"tier":3,"sources":[{"title":"Agile Robots - Wikipedia","url":"https://en.wikipedia.org/wiki/Agile_Robots"},{"title":"Humanoid Agile ONE embodies Physical AI at Hannover Messe 2026","url":"https://www.agile-robots.com/en/news/detail/humanoid-agile-one-embodies-physical-ai-at-hannover-messe-2026"}],"as_of":"2026-04","related_ids":["franka-emika-panda-franka-research-3","dlr-institute-of-robotics-and-mechatronics","collaborative-robot","7-dof-robot-arm","force-control","humanoid-robot"],"name":"思灵机器人","alt":"Agile Robots","abbr":"","aliases":["Agile Robots SE"],"one_liner":"源自德国宇航中心的慕尼黑智能机械臂与自动化公司","explanation":"思灵机器人（Agile Robots SE）2018 年成立于德国慕尼黑，创始人陈兆芃和 Peter Meusel 都出自德国宇航中心（DLR）机器人与机电研究所。主要产品是带力控的七轴协作机械臂（如 Diana 7）、移动机器人和面向制造、物流的整套自动化方案。2021 年获软银愿景基金二期领投的 C 轮，成为独角兽；2023 年 11 月收购破产的 Franka Emika（Franka 机械臂的厂商），2025 年 9 月全资收购宝马孵化的 idealworks。2026 年 4 月在汉诺威工业博览会发布首款工业人形机器人 Agile ONE。对新人来说，它和科研常用的 Franka 机械臂直接相关。","example":"实验室常用的 Franka Research 3 机械臂，其厂商 Franka Emika 在 2023 年被思灵收购。","related":["Franka 机械臂（Panda / FR3）","德国宇航中心机器人与机电研究所","协作机器人","七自由度机械臂","力控","人形机器人"]},{"id":"trossen-robotics","category":"company","sec":6,"tier":3,"sources":[{"title":"Trossen Robotics: Aloha Robot, A Low-Cost Bimanual Platform","url":"https://www.trossenrobotics.com/post/aloha-robot-low-cost-bimanual-platform"},{"title":"LinkedIn: Matt Trossen","url":"https://www.linkedin.com/in/matttrossen"}],"as_of":"2026-09","related_ids":["trossen-robotics-widowx-250","trossen-robotics-viperx-300","aloha","leader-follower-teleoperation","bridgedata-v2","mobile-aloha"],"name":"Trossen Robotics","alt":"Trossen Robotics","abbr":"","aliases":["特罗森机器人","Interbotix"],"one_liner":"美国科研机械臂厂商，卖 WidowX、ViperX 和 ALOHA 套件","explanation":"美国机器人硬件公司，2004 年由 Matt Trossen 创立，总部在伊利诺伊州 Downers Grove，长期面向科研和教育卖机器人套件。它在具身智能圈出名，是因为旗下 Interbotix 系列低成本机械臂被大量学术项目采用：BridgeData V2 数据集用的是 WidowX 250，斯坦福 ALOHA 双臂遥操作平台用 ViperX 300 做从臂、WidowX 做主臂。现在公司直接销售整套 ALOHA 硬件（固定版、移动版），包含主从臂、多路相机和采集软件，让实验室拿到后几小时内就能开始采模仿学习数据。","example":"很多复现 ACT、Mobile ALOHA 的实验室，直接从 Trossen 买一套 ALOHA 双臂套件来采演示数据。","related":["WidowX 250 机械臂","ViperX 300 机械臂","ALOHA 双臂平台","主从臂遥操作","BridgeData V2 数据集","Mobile ALOHA"]},{"id":"kinova","category":"company","sec":6,"tier":3,"sources":[{"title":"Jaco - ROBOTS: Your Guide to the World of Robotics（IEEE）","url":"https://robotsguide.com/robots/jaco"},{"title":"Kinova raises $60 million in new financing（Newswire.ca）","url":"https://www.newswire.ca/news-releases/kinova-raises-60-million-in-new-financing-the-company-s-expansion-into-the-industrial-automation-market-continues-826413359.html"},{"title":"Kinova Celebrates 20 Years of Innovation with the Launch of KIMA（Newswire.ca）","url":"https://www.newswire.ca/news-releases/kinova-celebrates-20-years-of-innovation-with-the-launch-of-kima-its-medical-robotic-arm-875537715.html"}],"as_of":"2026-06","related_ids":["kinova-gen3","7-dof-robot-arm","collaborative-robot","franka-emika-panda-franka-research-3","universal-robots-ur5e","surgical-robot"],"name":"Kinova","alt":"Kinova","abbr":"","aliases":["Kinova Robotics","Kinova Inc."],"one_liner":"加拿大轻量机械臂厂商，从轮椅助残臂起家，Gen3 是常见科研臂。","explanation":"Kinova 2006 年由 Charles Deguire（现任 CEO）和 Louis-Joseph L'Écuyer 创立，总部在加拿大魁北克省 Boisbriand（蒙特利尔附近）。Deguire 的几位舅舅患肌营养不良、靠电动轮椅生活，其中一位自制过机械臂，公司 2009 年推出的轮椅助残臂 JACO 就以他命名。之后它把轻量臂做成科研产品，Gen3（有 6 和 7 自由度两版）在高校实验室很常见。2022 年 2 月融资 6000 万加元（Graham Partners 领投 4000 万，加拿大政府战略创新基金出 2000 万），用于拓展工业自动化，同年推出工业协作臂 Link 6。2026 年 6 月成立 20 周年时发布手术和内镜用医疗机械臂 KIMA，负载 3 公斤、自重不到 13 公斤。","example":"装在电动轮椅上的 JACO，帮上肢无力的用户自己吃饭、开门。","related":["Kinova Gen3","七自由度机械臂","协作机器人","Franka 机械臂（Panda / FR3）","UR5e 协作机械臂","手术机器人"]},{"id":"ufactory","category":"company","sec":6,"tier":3,"sources":[{"title":"UArm机器人 项目信息（36氪创投平台）","url":"https://pitchhub.36kr.com/project/1678224239801347"},{"title":"Cheetah Mobile to Acquire Controlling Stake in UFACTORY（猎豹移动投资者关系）","url":"https://ir.cmcm.com/2025-07-28-Cheetah-Mobile-to-Acquire-Controlling-Stake-in-UFACTORY-to-Accelerate-Its-Robotics-Commercialization-Strategy"},{"title":"Cheetah Mobile Announces Second Quarter 2026 Unaudited Consolidated Financial Results（PR Newswire）","url":"http://www.prnewswire.com/news-releases/cheetah-mobile-announces-second-quarter-2026-unaudited-consolidated-financial-results-302875945.html"}],"as_of":"2026-09","related_ids":["ufactory-xarm","collaborative-robot","desktop-robot-arm","7-dof-robot-arm","gello","open-source-hardware"],"name":"UFACTORY","alt":"UFACTORY","abbr":"","aliases":["众为创造","深圳市众为创造科技有限公司","UFactory","uFactory"],"one_liner":"深圳轻量机械臂厂商，出品 xArm 和 uArm，2025 年被猎豹移动控股。","explanation":"UFACTORY 2013 年 12 月在深圳成立，公司全称深圳市众为创造科技有限公司，创始人邓世韬是 1989 年出生的创客。它 2014 年初在 Kickstarter 众筹桌面四轴机械臂 uArm 起家，之后转做轻量协作臂：xArm 5/6/7（臂展 700 毫米，负载 3–5 公斤）、入门款 Lite 6 和 UFACTORY 850，比 Franka、UR 便宜，又有 Python SDK 和 ROS 支持，成了高校做模仿学习和遥操作采集的常用臂。据报道产品卖到 80 多个国家和地区，以海外市场为主且已盈利。2025 年 7 月猎豹移动以约 9950 万元收购其 60.8% 股权，合计持股约八成，成为控股股东；猎豹称 2026 年二季度「机器人及其他」收入同比增长 72.5%，增长部分来自并入 UFACTORY 的收入。","example":"GELLO 等开源遥操作项目提供 xArm 版本，研究者用它录示范数据，再训练模仿学习策略。","related":["xArm 机械臂","协作机器人","桌面机械臂","七自由度机械臂","GELLO","开源硬件"]},{"id":"realman-robotics","category":"company","sec":6,"tier":3,"sources":[{"title":"RealMan Robotics 官网","url":"https://www.realman-robotics.com/"}],"as_of":"2026-09","related_ids":["realman-rm-series-arm","collaborative-robot","wheeled-humanoid-robot","payload-to-weight-ratio","teleoperation","embodied-ai-data-service-provider"],"name":"睿尔曼智能","alt":"RealMan Robotics","abbr":"","aliases":["睿尔曼","RealMan"],"one_liner":"北京的轻量机械臂厂商，RM 系列手臂常被装在国产双臂和轮式人形上。","explanation":"睿尔曼智能是北京的机器人公司，起家产品是官方称「超轻量仿人机械臂」的 RM 系列（6 轴 RM65、7 轴 RM75 等）：控制器集成在本体里、24V 直流供电、负载自重比高，便于装到移动底盘或双臂平台上，因此国内不少具身智能团队和高校用它当手臂。近年产品扩展到 WHJ 等关节模组、RealBot 系列轮式人形，以及遥操作网络和数据采集平台，官网把自己定位为面向 Physical AI（物理 AI）的系统级基础设施，并提供 ODM/OEM 定制。成立年份、融资金额等未在官网查到，此处不写。","example":"一些复合机器人把两条 RM75 装在升降柱加移动底盘上，用遥操作采集双臂数据训练策略。","related":["睿尔曼 RM 系列机械臂","协作机器人","轮式人形机器人","负载自重比","遥操作","具身数据服务商（数据采集服务商）"]},{"id":"flexiv-robotics","category":"company","sec":6,"tier":3,"sources":[{"title":"Flexiv - About","url":"https://www.flexiv.com/about"},{"title":"Flexiv - News","url":"https://www.flexiv.com/news"}],"as_of":"2026-03","related_ids":[null,null,null,null,null],"name":"非夕科技","alt":"Flexiv Robotics","abbr":"","aliases":["非夕","Flexiv"],"one_liner":"做力控「自适应机器人」的中美机器人公司，产品是拂晓机械臂","explanation":"2016 年在美国加州圣克拉拉创立，核心团队出自斯坦福大学机器人与人工智能实验室，创始人兼 CEO 王世全；如今在硅谷、上海、北京、慕尼黑、新加坡等地设有业务中心。主打产品是七轴「自适应」机械臂拂晓（Rizon）：每个关节带力矩传感，能做高精度力控和力位混合控制，适合打磨、装配、插接这类需要「手感」的接触作业，也常被研究者用作接触丰富操作的实验平台。据官网新闻，2025 年 6 月宣布与英伟达在机器人仿真上合作，2026 年 3 月获得一家长期投资机构注资以扩大全球部署。","example":"用 Rizon 做汽车零件打磨：机械臂按设定压力贴着曲面走，不需要精确知道工件形状。","related":["非夕 拂晓 Rizon(Flexiv Rizon)","力控(Force Control)","力位混合控制(Hybrid Force/Position Control)","接触丰富操作(Contact-rich Manipulation)","协作机器人(Collaborative Robot)"]},{"id":"jaka-robotics","category":"company","sec":6,"tier":3,"sources":[{"title":"21世纪经济报道：9岁上海机器人，孙正义3亿投它","url":"https://www.21jingji.com/article/20230519/herald/e78d1c32fbe40cc6bc522856bbbc215f.html"},{"title":"新浪财经：节卡机器人IPO终止","url":"https://finance.sina.com.cn/stock/s/2025-12-22/doc-inhcsexf4575422.shtml"},{"title":"上海交大机动学院：节卡共建通用智能机器人联合研究中心","url":"https://me.sjtu.edu.cn/hzdt/77443.html"}],"as_of":"2026-01","related_ids":["collaborative-robot","6-axis-robot-arm","kinesthetic-teaching","universal-robots","dobot","flexiv-robotics"],"name":"节卡机器人","alt":"JAKA Robotics","abbr":"","aliases":["节卡","节卡股份","JAKA"],"one_liner":"上海的协作机械臂厂商，2014 年成立，科创板 IPO 已终止","explanation":"节卡机器人 2014 年 7 月在上海成立，创始人、董事长李明洋毕业于上海交通大学，此前在利乐包装做销售，公司早期与上海交大机器人研究所合作研发。它起步做乳品礼盒包装产线集成，2017 年推出首款 Zu 系列协作机器人，之后扩展出 Zu、Pro、C 等系列，负载约 1–20 kg，支持拖动示教、可与人同区作业。投资方包括软银愿景基金、淡马锡等。2023 年 5 月申报科创板，2025 年 12 月 19 日 IPO 终止。2026 年 1 月与上海交大共建通用智能机器人联合研究中心，开始布局具身智能。","example":"工厂用节卡 Zu 系列协作臂做机床上下料，工人拖着机械臂走一遍轨迹即可完成示教。","related":["协作机器人","六轴机械臂","拖动示教","优傲机器人","越疆科技","非夕科技"]},{"id":"rokae","category":"company","sec":6,"tier":3,"sources":[{"title":"珞石机器人官网","url":"https://www.rokae.com/"},{"title":"珞石机器人投资者关系","url":"https://ircn.rokae.com/"},{"title":"珞石 2026 中期报告（港交所披露易）","url":"https://www1.hkexnews.hk/listedco/listconews/sehk/2026/0923/2026092300881_c.pdf"}],"as_of":"2026-09","related_ids":["collaborative-robot","industrial-robot","force-control","7-dof-robot-arm","jaka-robotics","dobot"],"name":"珞石机器人","alt":"ROKAE","abbr":"","aliases":["珞石","ROKAE Robotics","珞石（北京）机器人有限公司"],"one_liner":"北京的工业与协作机器人厂商，xMate 力控协作臂为主，也做具身智能本体。","explanation":"珞石机器人全称珞石（北京）机器人有限公司，总部在北京，业务是智能机器人的研发、制造和商业化。产品分三类：xMate 系列柔性协作机器人（CR、SR、ZR 等，负载 3–45 公斤，强调关节力矩感知和力控，能做打磨、装配这类要「手感」的活）、NB/XB 系列工业机器人和 SCARA，以及近年的具身智能产品，如人形力控臂和轮式人形。官网称客户超过 1000 家、覆盖 40 多个国家和地区，定位「通向 Physical AI 的基础设施核心构建者」。公司已在港交所上市，投资者关系页可查到 2026 年中期报告等披露文件。","example":"","related":["协作机器人","工业机器人","力控","七自由度机械臂","节卡机器人","越疆科技"]},{"id":"abb-robotics","category":"company","sec":6,"tier":3,"sources":[{"title":"ABB Group - Wikipedia","url":"https://en.wikipedia.org/wiki/ABB_Group"}],"as_of":"2025-10","related_ids":["big-four-of-industrial-robotics","abb-yumi","industrial-robot","softbank-group","fanuc","kuka"],"name":"ABB","alt":"ABB Robotics","abbr":"","aliases":["ABB 机器人","ABB 集团"],"one_liner":"瑞士电气自动化集团，工业机器人四大家族之一，机器人业务正卖给软银。","explanation":"ABB 是总部在瑞士苏黎世的电气与自动化集团，1988 年由瑞典 ASEA 和瑞士 BBC 合并而成，与发那科、库卡、安川并称工业机器人「四大家族」。前身 ASEA 最早把微处理器用进工业机器人；产品覆盖焊接、喷涂、搬运用的 IRB 系列工业机械臂，以及能和人同台作业的双臂协作机器人 YuMi。机器人业务 2024 年营收约 23 亿美元、员工约 7000 人。2025 年 10 月 ABB 宣布以约 54 亿美元把机器人业务出售给软银集团，取代原定 2026 年分拆上市的计划，交易需经监管审批。","example":"电子厂里用 ABB YuMi 双臂协作机器人做小件装配，不加围栏和工人同台作业。","related":["工业机器人四大家族","ABB YuMi 双臂协作机器人","工业机器人","软银集团","发那科","库卡"]},{"id":"kuka","category":"company","sec":6,"tier":3,"sources":[{"title":"Wikipedia: KUKA","url":"https://en.wikipedia.org/wiki/KUKA"},{"title":"KUKA: LBR iiwa","url":"https://www.kuka.com/en-us/products/robotics-systems/industrial-robots/lbr-iiwa"}],"as_of":"2025","related_ids":["big-four-of-industrial-robotics","kuka-lbr-iiwa","industrial-robot","fanuc","abb-robotics","joint-torque-sensor"],"name":"库卡","alt":"KUKA","abbr":"","aliases":["美的库卡","KUKA AG"],"one_liner":"德国工业机器人「四大家族」之一，2017 年起归美的集团","explanation":"库卡 1898 年由 Johann Josef Keller 和 Jakob Knappich 在德国奥格斯堡创立，KUKA 就是公司早期名称的缩写，总部至今在奥格斯堡。它与发那科、ABB、安川并称工业机器人四大家族，主要做汽车焊装等场景的工业机械臂，以及物流自动化和医疗自动化。2016 年美的集团发起约 45 亿欧元要约收购，2017 年 1 月完成、持股约 94.55%，2022 年收购剩余股份使其退市，国内常称美的库卡。在具身智能研究里常见的是它的七轴协作臂 LBR iiwa，每个关节带力矩传感器，常用于力控和接触丰富操作实验。","example":"DextrAH-G 等灵巧抓取研究用 KUKA 机械臂加 Allegro 灵巧手做真机实验。","related":["工业机器人四大家族","库卡 LBR iiwa","工业机器人","发那科","ABB","关节力矩传感器"]},{"id":"fanuc","category":"company","sec":6,"tier":3,"sources":[{"title":"Wikipedia: FANUC","url":"https://en.wikipedia.org/wiki/FANUC"},{"title":"FANUC Strengthens Collaboration with NVIDIA (2026-05-15)","url":"https://www.fanuc.co.jp/en/profile/pr/newsrelease/2026/notice20260515.html"}],"as_of":"2026-09","related_ids":[null,null,null,null,null,null],"name":"发那科","alt":"FANUC","abbr":"","aliases":["FANUC Corporation","ファナック","法那科"],"one_liner":"日本工业机器人与数控系统巨头，工业机器人「四大家族」之一","explanation":"日本公司，总部在山梨县忍野村，起源于 1950 年代富士通的数控部门，1972 年独立，创始人稻叶清右卫门。主业是数控系统（CNC，控制机床的电脑）、工业机器人和工厂自动化设备，标志性的黄色机械臂遍布汽车和电子工厂，与 ABB、库卡、安川并称工业机器人四大家族，在东京证券交易所上市。它代表传统「示教编程」工业机器人阵营，近年开始接入具身智能技术：2026 年 5 月宣布与谷歌合作让 AI 智能体操作机器人，并加深与英伟达的合作，把 Isaac Sim 接入自家离线仿真软件 ROBOGUIDE、用 GR00T N 模型做双臂叠衣服的模仿学习演示；同年 9 月发布焊接用 AI 智能体。","example":"汽车焊装车间里成排的黄色六轴焊接机器人，多数就是发那科的产品。","related":["工业机器人(Industrial Robot)","工业机器人四大家族(Big Four of Industrial Robotics (FANUC, ABB, KUKA, Yaskawa))","示教再现(Teach-and-Playback Programming)","英伟达(NVIDIA)","Isaac Sim(NVIDIA Isaac Sim)","GR00T N1 系列(NVIDIA Isaac GR00T N1 / N1.5 / N1.6 / N1.7)"]},{"id":"yaskawa-electric-corporation","category":"company","sec":6,"tier":3,"sources":[{"title":"Yaskawa Electric Corporation - Wikipedia","url":"https://en.wikipedia.org/wiki/Yaskawa_Electric_Corporation"}],"as_of":"2026-07","related_ids":["big-four-of-industrial-robotics","industrial-robot","fanuc","kuka","servo-motor"],"name":"安川电机","alt":"Yaskawa Electric Corporation","abbr":"","aliases":["安川","Yaskawa"],"one_liner":"日本百年工控企业，伺服电机和 MOTOMAN 工业机器人的主要厂商。","explanation":"安川电机 1915 年创立，总部在日本福冈县北九州市，东京证券交易所上市，是日经 225 成分股。主业是伺服电机、运动控制器、变频器和 MOTOMAN 系列工业机器人，焊接、搬运、装配产线上很常见，与发那科、ABB、库卡并称「工业机器人四大家族」。1969 年它申请了「Mechatronics（机电一体化）」商标，这个词后来成了通用术语。对具身智能来说，安川代表传统工业机器人路线：示教编程、高精度、高可靠。据报道，2026 年 7 月安川与发那科、川崎重工加入富士通牵头的项目，基于英伟达技术开发面向工厂、医院和家庭的物理 AI 协同控制平台。","example":"汽车焊装车间里成排的 MOTOMAN 焊接机器人按示教好的轨迹反复作业。","related":["工业机器人四大家族","工业机器人","发那科","库卡","伺服电机"]},{"id":"estun-automation","category":"company","sec":6,"tier":3,"sources":[{"title":"埃斯顿官网：埃斯顿港股上市，A+H双资本平台战略加速国际化布局","url":"https://www.estun.com/market/718.html"},{"title":"证券时报：埃斯顿总裁吴侃专访","url":"https://stcn.com/article/detail/3678067.html"},{"title":"钛媒体：埃斯顿的中国机器人故事，要用真金白银撑起来","url":"https://www.tmtpost.com/7894283.html"}],"as_of":"2026-03","related_ids":["industrial-robot","big-four-of-industrial-robotics","domestic-substitution","servo-motor","6-axis-robot-arm","palletizing-depalletizing"],"name":"埃斯顿","alt":"Estun Automation","abbr":"","aliases":["南京埃斯顿自动化股份有限公司","Estun"],"one_liner":"南京工业机器人龙头，国产工业机器人出货量据称已居国内第一","explanation":"埃斯顿 1993 年由吴波在南京创立，现由其子吴侃任副董事长兼总裁。早期做数控系统和伺服电机等运动控制部件，后来向下游延伸做整台工业机器人，形成从核心部件到整机的自研链条，南京工厂有「机器人生产机器人」的产线。2015 年在深交所上市（002747）。据报道，2025 年其工业机器人在中国市场的出货量首次超过发那科、ABB、库卡、安川这「四大家族」，排名国内第一。2026 年 3 月 9 日在港交所主板上市（02715），成为国内工业机器人领域首家 A+H 两地上市公司，募资主要用于海外产能、并购和研发，公司也在布局工业场景的具身智能。","example":"焊接、码垛、汽车和锂电产线上常见的六轴工业机械臂，国产品牌里埃斯顿是出货量最大的之一。","related":["工业机器人","工业机器人四大家族","国产替代","伺服电机","六轴机械臂","码垛 / 拆垛"]},{"id":"siasun-robot-and-automation","category":"company","sec":6,"tier":3,"sources":[{"title":"新松机器人投资者关系活动记录表（2026-08）","url":"https://www.siasun.com/uploads/file/20260826/3d506a6db414377d37a734d09201c3f4.pdf"},{"title":"新松参展2025世界智能制造大会","url":"https://www.siasun.com/news-detail954.html"}],"as_of":"2026-08","related_ids":["industrial-robot","collaborative-robot","autonomous-mobile-robot","humanoid-robot","domestic-substitution"],"name":"新松机器人","alt":"SIASUN Robot & Automation","abbr":"","aliases":["新松","沈阳新松机器人自动化股份有限公司","SIASUN"],"one_liner":"中科院沈阳自动化所控股的老牌国产工业机器人企业","explanation":"新松机器人（沈阳新松机器人自动化股份有限公司）2000 年成立于沈阳，控股股东是中国科学院沈阳自动化研究所，公司名取自被称为「中国机器人之父」的蒋新松。2009 年在深交所创业板上市，股票简称「机器人」，代码 300024。业务包括工业机器人、移动机器人、洁净与半导体装备、特种机器人和自动化产线，2025 年自动化装配与检测产线是第一大收入来源，工业机器人收入约 11 亿元。它是国产工业机器人和 AGV 的早期代表，近年也在研发人形机器人和具身智能，推出了双臂人形机器人睿可系列，但尚未形成规模利润。","example":"新松在 2025 世界智能制造大会展出睿可 MR73A 人形机器人，演示搬运、巡检和导览。","related":["工业机器人","协作机器人","自主移动机器人","人形机器人","国产替代"]},{"id":"inovance-technology","category":"company","sec":6,"tier":3,"sources":[{"title":"Inovance - Wikipedia","url":"https://en.wikipedia.org/wiki/Inovance_Technology"}],"as_of":"2024-01","related_ids":["servo-motor","programmable-logic-controller","selective-compliance-assembly-robot-arm","domestic-substitution","industrial-robot","estun-automation"],"name":"汇川技术","alt":"Inovance Technology","abbr":"","aliases":["汇川"],"one_liner":"深圳的工业自动化龙头，做伺服、PLC 和工业机器人。","explanation":"汇川技术 2003 年 4 月在深圳成立，由朱兴明和一批前华为工程师创办，业内称「小华为」。2010 年 9 月在深交所创业板上市（300124）。主营变频器、伺服系统、PLC（可编程逻辑控制器）和工业机器人，还通过子公司做新能源汽车的电驱电控。维基百科称它是中国最大的工业自动化公司、国内第二大工业机器人厂商。伺服电机、驱动器、控制器正是机器人关节的核心部件，所以在具身智能产业链讨论里，它常被当作零部件供应和国产替代的代表公司。","example":"","related":["伺服电机","PLC（可编程逻辑控制器）","SCARA 机器人","国产替代","工业机器人","埃斯顿"]},{"id":"tianji-intelligence","category":"company","sec":6,"tier":3,"sources":[{"title":"证券时报：天机智能完成10亿元融资","url":"https://www.stcn.com/article/detail/3925507.html"},{"title":"科创板日报：天机智能B++轮落地","url":"https://www.chinastarmarket.cn/detail/2477835"}],"as_of":"2026-09","related_ids":["industrial-robot","6-axis-robot-arm","selective-compliance-assembly-robot-arm","joint-torque-sensor","machines-replacing-humans","yaskawa-electric-corporation"],"name":"天机智能","alt":"Tianji Intelligence","abbr":"","aliases":["广东天机智能系统有限公司","天机机器人"],"one_liner":"东莞的工业机器人公司，长盈精密旗下，2026 年估值近百亿元","explanation":"全称广东天机智能系统有限公司，2015 年成立，总部在广东东莞松山湖，最大股东是苹果供应链企业长盈精密（持股约 27%），董事长兼总经理陈曦。2017 年与安川电机中国合资成立子公司天机机器人。产品覆盖中小负载的六轴工业机器人（TR 系列）、SCARA 机器人（一种水平关节、适合高速平面搬运的机械臂，SR 系列）等，自研天机 Fusion 控制系统，并称自研了 MEMS 关节扭矩传感器用于机器人关节。近年从传统自动化转向具身智能：2026 年 5 月完成 10 亿元 B 轮及 B+ 轮融资，高瓴创投、美团战投领投，腾讯等跟投，投后估值近 100 亿元；同年 9 月又获蚂蚁集团、腾讯等参与的新一轮融资。","example":"鞋服、餐饮等工厂用天机的六轴机械臂和 SCARA 机器人替代人工做上下料和分拣。","related":["工业机器人","六轴机械臂","SCARA 机器人","关节力矩传感器","机器换人","安川电机"]},{"id":"pudu-robotics","category":"company","sec":6,"tier":3,"sources":[{"title":"关于我们 - 普渡科技","url":"https://www.pudurobotics.com/zh-HK/company"},{"title":"普渡机器人创始人张涛（深圳市发改委）","url":"https://fgw.sz.gov.cn/ztzl/qtztzl/szscjmyjjfzzhfwpt/mqfc/myqyjdxsj/content/post_12623955.html"},{"title":"这家百亿机器人独角兽要IPO了（腾讯新闻）","url":"https://view.inews.qq.com/a/20260613A02A6F00"}],"as_of":"2026-06","related_ids":["service-robot","autonomous-mobile-robot","humanoid-robot","one-brain-multiple-robots","going-global","hkex-chapter-18c"],"name":"普渡机器人","alt":"Pudu Robotics","abbr":"","aliases":["普渡科技","PUDU","深圳市普渡科技"],"one_liner":"深圳商用服务机器人公司，餐厅送餐和清洁机器人出货量大","explanation":"普渡机器人（深圳市普渡科技股份有限公司）2016 年 1 月在深圳成立，创始人张涛本科读机械与电子，研究生在香港科技大学读软件算法，还参与创办过科技媒体雷锋网。公司靠餐厅送餐机器人起家，现在有服务配送、商用清洁、工业配送和通用具身智能四条产品线，并用「一脑多形」架构做了专用、半人形和人形（如 PUDU D9）机器人。官网称全球累计出货超 13 万台，业务覆盖 85 个以上国家和地区；2026 年一季度工业配送收入同比翻倍。2026 年 6 月据报道已启动赴港 IPO 筹备。","example":"很多火锅店里端菜上桌的送餐机器人就是普渡的产品。","related":["服务机器人","自主移动机器人","人形机器人","一脑多机","出海","港股 18C 章"]},{"id":"keenon-robotics","category":"company","sec":6,"tier":3,"sources":[{"title":"KEENON Robotics Showcases Humanoid Robot at CES 2026 for First Time（PR Newswire）","url":"https://www.prnewswire.co.uk/news-releases/keenon-robotics-showcases-humanoid-robot-at-ces-2026-for-first-time-and-unveils-first-robotic-lawn-mower-expanding-its-robotic-services-into-new-realms-302654186.html"},{"title":"擎朗智能发布人形具身服务机器人 XMAN-R1（IT之家）","url":"https://www.ithome.com/0/841/931.htm"},{"title":"擎朗智能考虑今年赴港上市（新浪财经·新股消息）","url":"https://finance.sina.com.cn/stock/hkstock/ggscyd/2026-01-19/doc-inhhvmxx6921579.shtml"}],"as_of":"2026-07","related_ids":["service-robot","wheeled-humanoid-robot","pudu-robotics","autonomous-mobile-robot","robot-rental"],"name":"擎朗智能","alt":"KEENON Robotics","abbr":"","aliases":["擎朗","KEENON","上海擎朗智能科技有限公司"],"one_liner":"上海商用服务机器人公司，送餐配送机器人出货量大，也做人形。","explanation":"擎朗智能 2010 年成立于上海，创始人兼 CEO 李通曾在微软亚洲工程院参与微软机器人开发平台 Robotics Studio 的开发。它做商用服务机器人：餐厅送餐、酒店配送、清洁和医疗配送等，在海外还推出按月付费的「机器人雇佣制」。公司称累计出货超 10 万台，并援引 IDC 数据称其商用服务机器人出货量全球第一。2025 年 3 月发布轮式人形服务机器人 XMAN-R1，能完成点单、配餐、送餐、收餐的连续任务，后又推出双足人形 XMAN-F1。2021 年完成软银愿景基金领投的 2 亿美元 D 轮；据报道 2026 年 1 月考虑年内赴港上市、募资约 2 亿美元。","example":"餐厅里 XMAN-R1 负责倒酒、摆托盘，再交给送餐机器人把菜送到桌边。","related":["服务机器人","轮式人形机器人","普渡机器人","自主移动机器人","机器人租赁"]},{"id":"geek-plus","category":"company","sec":6,"tier":3,"sources":[{"title":"市值超210亿，机器人超级独角兽登陆港交所（澎湃新闻）","url":"https://m.thepaper.cn/newsDetail_forward_31139514"},{"title":"全球首款仓储通用人形机器人：极智嘉发布 Gino 1（IT之家）","url":"https://www.ithome.com/0/921/115.htm"},{"title":"极智嘉(2590.HK)亮相2026 WAIC：「一核双引擎」战略落地（网易）","url":"https://www.163.com/dy/article/L22DTDJS05198ETO.html"}],"as_of":"2026-07","related_ids":["autonomous-mobile-robot","order-picking","fleet-management-system","wheeled-humanoid-robot","4d-world-model","amazon-robotics"],"name":"极智嘉","alt":"Geek+","abbr":"","aliases":["Geekplus","北京极智嘉科技股份有限公司"],"one_liner":"北京仓储物流机器人公司，做拣选搬运 AMR，港股上市后布局具身智能。","explanation":"极智嘉 2015 年成立于北京，创始人兼 CEO 郑勇是清华工业工程系本硕，曾在 ABB、圣戈班做生产运营，后转做机器人行业投资。它做仓储物流用的自主移动机器人（AMR）：把货架或料箱搬到拣货员面前的货到人系统、分拣和搬运机器人，并援引 Interact Analysis 称其 AMR 全球份额连续七年第一。2025 年 7 月 9 日在港交所上市（2590.HK），募资约 27 亿港元。2026 年 2 月发布面向仓储场景的轮式人形机器人 Gino 1（双臂加三指灵巧手，做拣货、搬箱、打包）；7 月在 WAIC 发布具身智能框架 Gravity 和核心模型 Gravity 4D（同时预测未来画面、三维结构和运动），具身智能子公司也启动首次独立融资。","example":"WAIC 2026 展台上，Gino 1 从料箱里逐件抓取薯片、面包和橡胶小碗，配合搬运机器人完成拣货流程。","related":["自主移动机器人","拣选（订单拣货）","多机调度系统","轮式人形机器人","4D 世界模型","亚马逊机器人"]},{"id":"youibot-robotics","category":"company","sec":6,"tier":3,"sources":[{"title":"优艾智合递交IPO招股书，拟赴香港上市（新浪财经）","url":"http://finance.sina.com.cn/wm/2026-04-02/doc-inhtcnfs0898056.shtml"},{"title":"合肥优艾智合机器人股份有限公司公告（港交所披露易）","url":"https://www1.hkexnews.hk/app/sehk/2026/108376/documents/sehk26033101825_c.pdf"},{"title":"优艾智合冲刺港股IPO（中国基金报）","url":"https://www.chnfund.com/article/AR7324d0cc-b4de-1dd7-6649-3a1ca2dd5835"}],"as_of":"2026-03","related_ids":["mobile-manipulator","mobile-manipulation","hkex-chapter-18c","one-brain-multiple-robots","machine-tending"],"name":"优艾智合","alt":"Youibot Robotics","abbr":"","aliases":["Youibot","合肥优艾智合机器人股份有限公司"],"one_liner":"做工业移动操作机器人的中国公司，主要用于半导体、能源等工厂。","explanation":"优艾智合 2017 年由西安交通大学博士张朝辉等人创立，最初在深圳起步，上市主体为合肥优艾智合机器人股份有限公司。它做移动操作机器人（移动底盘加机械臂的复合机器人）及配套调度软件和模型，公司称为「一脑多态」，主要卖给半导体晶圆厂、电网与能源化工、锂电和 3C 工厂，做物料搬运、上下料和巡检。股东包括 SIG 海纳亚洲、蓝驰创投、SBVA（原软银亚洲）等。2025 年 3 月首次向港交所递表，9 月 26 日失效后于 2026 年 3 月 31 日按 18C 章再次递表，中金公司独家保荐；招股书显示 2025 年收入约 3.40 亿元、净亏损约 3.84 亿元。","example":"晶圆厂里，优艾智合的移动操作机器人在机台之间搬运晶圆盒并完成上下料。","related":["复合机器人","移动操作","港股 18C 章","一脑多机","上下料"]},{"id":"dexterity","category":"company","sec":6,"tier":3,"sources":[{"title":"Dexterity: About Us","url":"https://dexterity.ai/about"},{"title":"Dexterity: Meet the Mech","url":"https://dexterity.ai/blog/meet-the-mech"},{"title":"Yahoo Finance: Dexterity secures $95m, reaching $1.65bn valuation","url":"https://finance.yahoo.com/news/dexterity-secures-95m-reaching-1-110002439.html"}],"as_of":"2026-09","related_ids":["tote-handling","palletizing-depalletizing","sorting","dual-arm-robot","mobile-manipulator","covariant"],"name":"Dexterity","alt":"Dexterity","abbr":"","aliases":["Dexterity AI","Dexterity, Inc."],"one_liner":"美国物流机器人公司，用 AI 双臂机器人装卸卡车和分拣包裹","explanation":"Dexterity 2017 年成立，总部在美国加州 Redwood City，创始人兼 CEO Samir Menon 是斯坦福计算机博士，联合创始团队也多出自斯坦福机器人研究圈。它专做物流仓储里又重又乱的搬运活，比如装卸卡车、拆码垛和包裹分拣。技术上不押单一大模型，而是用多个针对具体任务的小模型组合，再结合力控和感知。2025 年 3 月发布 Mech：移动底盘上装两条大臂，官方称臂展约 16 英尺、可搬 130 磅以上的箱子，面向卡车装载；同月完成 9500 万美元融资，估值 16.5 亿美元。官方称 2025 年真实生产中的自主动作累计超 1 亿次，2026 年联邦快递在投资者日上把它列为关键技术伙伴。","example":"Mech 在仓库门口把传送带送来的纸箱逐个码进卡车车厢，这是人工强度大、流失率高的岗位。","related":["料箱搬运","码垛 / 拆垛","分拣","双臂机器人","复合机器人","Covariant"]},{"id":"sereact","category":"company","sec":6,"tier":3,"sources":[{"title":"Zalando joins Sereact's $116M Series B (MassRobotics)","url":"https://www.massrobotics.org/zalando-joins-sereacts-116m-series-b-to-accelerate-ai-powered-warehouse-automation"},{"title":"AI Startup Sereact Raises $110 Million (Bloomberg)","url":"https://www.bloomberg.com/news/articles/2026-04-27/ai-startup-sereact-raises-110-million-for-robots-that-predict-consequences"}],"as_of":"2026-07","related_ids":["bin-picking","order-picking","world-model","dual-arm-robot","tote-handling"],"name":"Sereact","alt":"Sereact","abbr":"","aliases":[],"one_liner":"德国仓储机器人 AI 公司，用自研 Cortex 模型驱动拣选机器人","explanation":"Sereact 2021 年成立于德国斯图加特，后在波士顿设点，创始人 Ralf Gulde 和 Marc Tuscher 出身斯图加特大学。它做仓储物流中的机器人软件：自研机器人基础模型 Cortex 和 3D 感知系统，驱动机械臂完成拣选、退货处理等任务，客户包括宝马、梅赛德斯-奔驰、宜家等，已部署 200 多套系统。形态以单臂拣选工位、双臂退货处理工位为主，也在做轮式底盘的人形机器人。2025 年 1 月完成 2500 万欧元 A 轮；2026 年 4 月完成 Headline 领投的 1.1 亿美元 B 轮，Zalando 随后加入使 B 轮增至 1.16 亿美元，资金用于让机器人在动手前先预测动作后果的模型。","example":"电商仓库里，Sereact 的拣选工作站用机械臂从料箱中抓取各种形状的商品放入订单箱。","related":["无序抓取","拣选（订单拣货）","世界模型","双臂机器人","料箱搬运"]},{"id":"world-labs","category":"company","sec":7,"tier":2,"sources":[{"title":"AMD to Acquire World Labs to Advance the Future of AI Compute","url":"https://ir.amd.com/news-events/press-releases/detail/1299/amd-to-acquire-world-labs-to-advance-the-future-of-ai-compute"},{"title":"World Labs: joining AMD","url":"https://www.worldlabs.ai/blog/amd-announcement"},{"title":"World Labs: Marble","url":"https://www.worldlabs.ai/blog/marble-world-model"}],"as_of":"2026-09","related_ids":["spatial-intelligence","world-model","marble","advanced-micro-devices","gaussian-splatting-based-simulation"],"name":"World Labs","alt":"World Labs","abbr":"","aliases":["李飞飞 World Labs"],"one_liner":"李飞飞创办的空间智能公司，做 3D 世界生成，2026 年 9 月被 AMD 宣布收购。","explanation":"2024 年由李飞飞与 Justin Johnson、Ben Mildenhall 等人创办，总部旧金山，主攻空间智能，即让模型理解并生成三维世界。2024 年 9 月走出隐身时累计融资 2.3 亿美元、估值 10 亿美元；2025 年 11 月上线 Marble，从文字、图片或视频生成可自由走动查看的 3D 场景，可导出高斯泼溅或网格；2026 年 2 月完成 10 亿美元融资；9 月发布底层模型 Atlas。2026 年 9 月 28 日 AMD 宣布以约 82 亿美元全股票收购它，李飞飞将任 AMD 首席科学家，预计年底前交割。它生成的场景可作机器人仿真环境。","example":"用 Marble 从一张厨房照片生成 3D 场景，导出网格放进仿真器，作为机器人训练环境。","related":["空间智能","世界模型","Marble（World Labs）","AMD","高斯泼溅仿真"]},{"id":"ami-labs","category":"company","sec":7,"tier":2,"sources":[{"title":"Yann LeCun's AMI Labs raises $1.03B to build world models (TechCrunch, 2026-03)","url":"https://techcrunch.com/2026/03/09/yann-lecuns-ami-labs-raises-1-03-billion-to-build-world-models/"},{"title":"Why AMI Labs’ Alexandre LeBrun won’t call his AI AGI or superintelligence (TechCrunch, 2026-07)","url":"https://techcrunch.com/2026/07/16/why-ami-labs-alexandre-lebrun-wont-call-his-ai-agi-or-superintelligence/"},{"title":"Advanced Machine Intelligence Labs - Wikipedia","url":"https://en.wikipedia.org/wiki/Advanced_Machine_Intelligence_Labs"}],"as_of":"2026-07","related_ids":["joint-embedding-predictive-architecture","world-model","latent-world-model","v-jepa-2","meta-fundamental-ai-research","world-labs"],"name":"AMI Labs","alt":"Advanced Machine Intelligence Labs","abbr":"AMI","aliases":["Advanced Machine Intelligence"],"one_liner":"杨立昆离开 Meta 后在巴黎创办的世界模型公司，走 JEPA 路线。","explanation":"AMI Labs 是图灵奖得主杨立昆（Yann LeCun）离开 Meta 后创办的公司，2025 年 12 月在巴黎成立，另在纽约、蒙特利尔和新加坡设办公室。杨立昆任执行董事长；CEO Alexandre LeBrun 原是医疗 AI 公司 Nabla 的 CEO，为此改任 Nabla 董事长兼首席 AI 科学家（Nabla 也是 AMI 的首个合作方）；首席科学官是谢赛宁。它按杨立昆提出的 JEPA（联合嵌入预测架构）做世界模型：在抽象表征空间里预测世界接下来的状态，而不是像大语言模型那样逐词生成。2026 年 3 月完成 10.3 亿美元种子轮，投前估值 35 亿美元，英伟达、三星、丰田等参投。目标行业包括机器人、制造、可穿戴和医疗；截至 2026 年 7 月还没有产品，公司称会公开论文和代码。","example":"","related":["联合嵌入预测架构","世界模型","隐空间世界模型","V-JEPA 2","Meta FAIR","World Labs"]},{"id":"gigaai","category":"company","sec":7,"tier":2,"sources":[{"title":"极佳科技官网","url":"https://gigaai.cc/"},{"title":"GigaAI GitHub organization (open-gigaai)","url":"https://github.com/open-gigaai"},{"title":"GigaBrain-0 (arXiv 2510.19430)","url":"https://arxiv.org/abs/2510.19430"}],"as_of":"2026-03","related_ids":["gigabrain-0","gigaworld-0","world-model","vision-language-action-model","synthetic-data","robochallenge"],"name":"极佳科技","alt":"GigaAI","abbr":"","aliases":["极佳视界"],"one_liner":"中国 AI 创业公司，主打用世界模型生产数据、训练具身基础模型。","explanation":"极佳科技（GigaAI，也叫极佳视界）是一家中国 AI 公司，据报道由黄冠创办。它早期做自动驾驶世界模型 DriveDreamer 系列，后来转向具身智能。主线是用世界模型（能生成未来画面的模型）批量造训练数据，再拿这些数据训练视觉-语言-动作模型（VLA）：GigaWorld-0 生成机器人操作视频和 3D 场景，GigaBrain-0 系列是 VLA，代码开源在 GitHub 的 open-gigaai 组织下。公司还推出了双臂加移动底盘的机器人 Maker H01。官网称 2026 年 3 月完成 10 亿元 Pre-B 轮融资。它是「世界模型当数据引擎」这条路线的代表公司之一。","example":"GigaBrain-0 用 GigaWorld-0 生成的视频补充真机数据来训练，官网称它 2026 年 2 月登上 RoboChallenge 榜首。","related":["极佳 GigaBrain-0","极佳 GigaWorld-0","世界模型","视觉-语言-动作模型","合成数据","RoboChallenge"]},{"id":"lightwheel","category":"company","sec":7,"tier":2,"sources":[{"title":"界面新闻：光轮智能完成10亿元融资","url":"https://www.jiemian.com/article/14098498.html"},{"title":"Lightwheel: RoboFinals","url":"https://lightwheel.ai/robofinals"},{"title":"GitHub: LightwheelAI/leisaac","url":"https://github.com/LightwheelAI/leisaac"}],"as_of":"2026-03","related_ids":["simulation-data","synthetic-data","simready-assets","nvidia-isaac-lab-arena","robofinals","leisaac"],"name":"光轮智能","alt":"Lightwheel","abbr":"","aliases":["光轮","Lightwheel AI"],"one_liner":"做机器人仿真资产、合成数据和评测的公司，2026 年成独角兽","explanation":"光轮智能 2023 年 1 月成立，工商注册在北京，创始人、CEO 谢晨毕业于北京大学和哥伦比亚大学，曾在英伟达、Cruise、蔚来负责自动驾驶仿真。它为机器人训练提供仿真资产（带物理属性、可直接进仿真器的 3D 物体和场景）、合成数据和仿真评测：与英伟达合作开发 Isaac Lab-Arena 评测框架，开源了 SO-101 仿真遥操作工具 LeIsaac，2025 年 12 月发布工业级评测平台 RoboFinals。2026 年 3 月完成 10 亿元 A++ 及 A+++ 轮融资，投资方包括新希望等，公司称由此成为具身数据领域首个独角兽。","example":"研究者可用 LeIsaac 在 Isaac Lab 里用真实主臂遥操作仿真 SO-101，采集数据后微调 GR00T 策略。","related":["仿真数据","合成数据","SimReady 资产","Isaac Lab-Arena","光轮 RoboFinals 工业级仿真评测平台","LeIsaac"]},{"id":"general-intuition","category":"company","sec":7,"tier":3,"sources":[{"title":"General Intuition 官网","url":"https://www.generalintuition.com/"},{"title":"Valor, Point72 back General Intuition at $6B valuation (TechCrunch, 2026-08-24)","url":"https://techcrunch.com/2026/08/24/valor-point72-back-general-intuition-at-6b-valuation-as-ai-startup-pushes-into-robotics/"}],"as_of":"2026-08","related_ids":[null,null,null,null,null],"name":"General Intuition","alt":"General Intuition","abbr":"","aliases":[],"one_liner":"用海量游戏录像训练世界模型和智能体的 AI 实验室","explanation":"总部在纽约的 AI 研究公司，2025 年 10 月从游戏片段分享平台 Medal 拆分出来，CEO 为 Medal 创始人 Pim de Witte。它的思路是：Medal 手里有海量玩家游戏录像，而且带键盘鼠标操作记录，相当于大规模「观测-动作对」，可以用来训练理解空间与时间、能预测动作后果的世界模型和智能体，再迁移到机器人等物理场景。已发布与 Kyutai、Epic Games 合作的多人世界模型 MIRA（基于《火箭联盟》录像，实时 20 帧）。融资上，2025 年 10 月种子轮约 1.34 亿美元，2026 年 6 月以 23 亿美元估值融资 3.2 亿美元；据 TechCrunch，8 月又以 60 亿美元投前估值洽谈新一轮，重点投向机器人。","example":"","related":["世界模型(World Model)","观测-动作对(Observation-Action Pair)","互联网视频数据(Internet Video Data)","Minecraft 环境（MineDojo / MineRL）(Minecraft Environments (MineDojo / MineRL))","VPT（视频预训练）(Video PreTraining (OpenAI, Minecraft))"]},{"id":"runway","category":"company","sec":7,"tier":3,"sources":[{"title":"Runway (company) - Wikipedia","url":"https://en.wikipedia.org/wiki/Runway_(company)"},{"title":"Introducing Runway GWM-1","url":"https://runway.com/research/introducing-runway-gwm-1"}],"as_of":"2026-02","related_ids":["video-generation-model","world-model","interactive-world-model","neural-simulator","world-model-based-policy-evaluation","synthetic-data"],"name":"Runway","alt":"Runway","abbr":"","aliases":["Runway AI","RunwayML"],"one_liner":"纽约的视频生成公司，Gen 系列之后推出含机器人版本的世界模型 GWM-1。","explanation":"Runway 2018 年在纽约成立，三位创始人 Cristóbal Valenzuela、Alejandro Matamala 和 Anastasis Germanidis 相识于纽约大学 ITP 艺术科技项目。它以 Gen 系列视频生成模型出名（2025 年底推出 Gen-4.5），2022 年还和慕尼黑大学 CompVis 组共同发布了 Stable Diffusion。2025 年 12 月 11 日，它基于 Gen-4.5 发布通用世界模型 GWM-1：自回归逐帧实时生成视频，可用相机移动、机器人动作等输入控制，其中 GWM Robotics 提供 Python SDK，按机器人动作生成多视角未来画面，用于合成训练数据和在虚拟环境里评测策略。融资方面，2026 年 2 月完成 3.15 亿美元融资，估值 53 亿美元。","example":"","related":["视频生成模型","世界模型","可交互世界模型","神经模拟器","世界模型评测","合成数据"]},{"id":"shengshu-technology","category":"company","sec":7,"tier":3,"sources":[{"title":"生数科技完成近20亿元B轮融资（量子位）","url":"https://www.qbitai.com/2026/04/398772.html"},{"title":"京企生数科技完成超6亿元A+轮融资（国家科技传播中心）","url":"https://www.ncsti.gov.cn/kjdt/xwjj/202602/t20260208_237672.html"}],"as_of":"2026-04","related_ids":["vidar","motus","video-generation-model","world-action-model","world-model","diffusion-transformer"],"name":"生数科技","alt":"ShengShu Technology","abbr":"","aliases":["生数","ShengShu"],"one_liner":"清华系多模态生成公司，做 Vidu 视频模型并延伸到具身世界模型","explanation":"生数科技 2023 年 3 月在北京成立，核心团队来自清华大学，联合创始人兼首席科学家朱军是清华计算机系教授，CEO 为唐家渝。团队 2022 年 9 月提出 U-ViT 架构，是较早把 Transformer 用作扩散模型骨干的工作之一。代表产品是视频生成模型 Vidu，2024 年 4 月发布、7 月全球上线。它把视频生成延伸到机器人：与清华合作推出具身模型 Vidar，用视频扩散模型预测未来画面再解码成动作；又推出世界动作模型 Motus。2026 年 4 月完成近 20 亿元 B 轮融资，由阿里云领投，定位做「通用世界模型」。","example":"生数的 Vidar 先生成机器人完成任务的视频，再用逆动力学模型从视频里推出每一步的动作。","related":["生数 Vidar","Motus","视频生成模型","世界动作模型","世界模型","扩散 Transformer"]},{"id":"hillbot","category":"company","sec":7,"tier":3,"sources":[{"title":"Hillbot 官网","url":"https://www.hillbot.ai/"},{"title":"ManiSkill (haosulab) GitHub","url":"https://github.com/haosulab/ManiSkill"}],"as_of":"2026-09","related_ids":["maniskill","sapien","synthetic-data","sim-to-real-transfer","real-robot-data-camp-vs-sim-data-camp","gpu-accelerated-parallel-simulation"],"name":"Hillbot","alt":"Hillbot","abbr":"","aliases":[],"one_liner":"美国具身智能创业公司，用仿真合成数据加真机数据训练机器人技能。","explanation":"Hillbot 是一家美国具身智能创业公司，口号是「一个技能一个技能地造通用机器人」。它的做法是把真实世界数据和仿真器里生成的大量合成数据结合起来，训练能泛化的操作技能；官网展示了机械臂开柜门、四足、双臂等多种本体的演示。官网把开源仿真平台 ManiSkill 和仿真框架 SAPIEN 列为自家产品，这两个项目出自加州大学圣迭戈分校苏昊（Hao Su）实验室，据报道苏昊是 Hillbot 的联合创始人。它的成立时间和融资情况官网没有公开。对新人来说，它是创业公司里「仿真数据派」的代表之一。","example":"先在 ManiSkill 里用 GPU 并行生成大量开柜门、抓取的仿真演示，再和少量真机数据一起训练策略。","related":["ManiSkill","SAPIEN","合成数据","仿真到现实迁移","真机派 / 仿真派","GPU 并行仿真"]},{"id":"sudo-technology","category":"company","sec":7,"tier":3,"sources":[{"title":"20亿美金苏度科技具身首秀：0真机数据，zero-shot，98%首次抓取成功率（量子位 / 腾讯新闻，2026-04-20）","url":"https://news.qq.com/rain/a/20260420A056AL00"},{"title":"上海，跑出一家百亿独角兽！（东方财富财富号，2026-04-23）","url":"https://caifuhao.eastmoney.com/news/20260423145145282740910"}],"as_of":"2026-04","related_ids":["sim-to-real-transfer","reinforcement-learning","zero-shot","real-robot-data-camp-vs-sim-data-camp","hillbot","3d-vision"],"name":"苏度科技","alt":"Sudo Technology","abbr":"","aliases":["上海苏度科技","Sudo"],"one_liner":"主打纯仿真训练的上海具身智能公司，2026 年发布机器人系统 Sudo R1","explanation":"苏度科技 2025 年 5 月在上海成立。联合创始人兼 CEO 韩铮是连续创业者，曾参与创办智能硬件公司 ZEPP；首席技术顾问苏昊是 ImageNet、ShapeNet、PointNet 等工作的核心参与者，曾任 UCSD 副教授，2026 年回国任复旦大学教授；核心团队不少人来自苏昊参与创办的 Hillbot。公司走「仿真到现实」路线：主要靠仿真和强化学习训练，尽量不用真机遥操作数据。2026 年 4 月发布首个软硬件全栈自研的机器人系统 #Sudo R1，称采用「3D 世界模型与强化学习一体化」设计，零样本首次抓取成功率 98%（公司数据）。同月据报道完成 5 亿美元 Pre-A 轮融资，估值约 20 亿美元。","example":"#Sudo R1 发布时的演示：模型训练中没有用任何真机数据，直接部署到真实机器人上抓取没见过的物体。","related":["仿真到现实迁移","强化学习","零样本","真机派 / 仿真派","Hillbot","3D视觉"]},{"id":"dexforce","category":"company","sec":7,"tier":3,"sources":[{"title":"跨维智能官网：公司介绍","url":"https://www.dexforce.com/about.html"},{"title":"跨维智能完成10亿元B轮融资 - DexForce","url":"https://dexforce.com/news_detail.php?id=1261"},{"title":"证券时报：跨维智能完成10亿元B轮融资将迎IPO","url":"https://www.stcn.com/article/detail/3988923.html"}],"as_of":"2026-07","related_ids":["generative-simulation","synthetic-data","simulation-data","sim-to-real-transfer","world-model","real-robot-data-camp-vs-sim-data-camp"],"name":"跨维智能","alt":"DexForce","abbr":"","aliases":["跨维（深圳）智能数字科技有限公司","DexForce Technology"],"one_liner":"深圳具身智能公司，主打用生成式仿真合成数据训练机器人","explanation":"跨维智能 2021 年 6 月在深圳成立，创始人贾奎是香港中文大学（深圳）教授，长期研究深度学习和三维几何视觉。多数公司靠人遥控真机采数据，跨维走「生成式仿真」路线：用自研的 DexVerse 具身智能引擎批量生成虚拟场景和合成数据来训练模型。贾奎的说法是，物体位置、材质、环境这类物理变化都能在仿真里生成，只有「该做什么」这类语义知识更依赖真实数据。主要产品还有 DexWorldModel 世界模型、DexForce W1 Pro 人形机器人和 DexSense 纯视觉传感器，官方称已在 50 多个细分行业落地。2026 年 6 月 30 日宣布完成超 10 亿元 B 轮，投后估值超 100 亿元，据报道正筹备 IPO。","example":"贾奎算过一笔账：一名遥操作员一天只能采 100–150 条数据，所以跨维选择用仿真生成海量合成数据来补足物理层面的泛化。","related":["生成式仿真","合成数据","仿真数据","仿真到现实迁移","世界模型","真机派 / 仿真派"]},{"id":"songying-technology","category":"company","sec":7,"tier":3,"sources":[{"title":"松应科技新闻中心（官网）","url":"https://www.orca3d.cn/news.html"},{"title":"实时物理AI仿真平台松应科技完成天使轮融资 中科创星领投（品玩，2025-03-20）","url":"https://www.pingwest.com/a/303218"},{"title":"NIE 2025 | 松应科技聂凯旋：物理AI仿真系统（弗若斯特沙利文）","url":"https://www.frostchina.com/content/activity/detail/68bfe473f3453aa11bf09fbf"}],"as_of":"2026-08","related_ids":["simulator","nvidia-isaac-sim","simulation-data","sim-to-real-gap","domestic-substitution","embodied-ai-training-ground"],"name":"松应科技","alt":"Songying Technology","abbr":"","aliases":["上海松应科技","ORCA"],"one_liner":"做国产物理 AI 仿真平台 ORCA 的上海公司，对标英伟达 Isaac Sim","explanation":"松应科技 2021 年 11 月在上海成立，创始人兼 CEO 聂凯旋曾任华为云鲲鹏解决方案副总指挥、云游戏业务总经理。主要产品是物理 AI 仿真平台 ORCA（现称 ORCA OS），提供物理渲染、并行仿真、传感器模拟和合成数据生成，让机器人先在虚拟环境里训练、采数据，再迁移到真机，定位是英伟达 Isaac Sim / Omniverse 的国产替代，并适配国产 GPU。ORCA 1.0 于 2024 年底商业化，客户包括人形机器人本体厂商和国家级、省级人形机器人创新中心。融资上，2025 年 3 月完成中科创星领投的天使轮；2026 年 8 月宣布连续完成 A 轮、A1 轮数亿元融资，由中金资本、武汉洪山资本领投。","example":"国地共建人形机器人创新中心的「麒麟训练场」启用时，其中的虚拟训练场由松应 ORCA 承建，用来给人形机器人生成仿真训练数据。","related":["仿真器","Isaac Sim","仿真数据","虚实差距","国产替代","具身智能训练场"]},{"id":"51world","category":"company","sec":7,"tier":3,"sources":[{"title":"51Aes 企业简介","url":"https://www.51aes.com/about/company"}],"as_of":"2026-09","related_ids":["digital-twin","synthetic-data","real-to-sim-to-real","physical-ai","simulator","autonomous-driving"],"name":"五一视界","alt":"51WORLD","abbr":"","aliases":["51WORLD","北京五一视界数字孪生科技股份有限公司","51Aes"],"one_liner":"北京的数字孪生公司，港股上市，给具身智能提供仿真场景和合成数据。","explanation":"全称北京五一视界数字孪生科技股份有限公司，2015 年 2 月成立，总部北京，已在港交所上市（股票代码 6651.HK）。主业是数字孪生：用计算机图形和 AI 把城市、园区、工厂、交通设施等真实场景重建成可实时渲染的三维场景，产品有 AES 数字孪生底座和低代码开发平台 WDP，另有合成数据与仿真平台 51Sim、数字地球平台 51Earth。近年它以「物理 AI 基础设施」自我定位，把三维场景和仿真能力用于具身智能，提供真实到仿真再回到真实（Real2Sim2Real）的训练数据和测试环境。","example":"把一座真实仓库重建成数字孪生场景，在里面批量生成带标注的合成图像，给机器人感知模型训练。","related":["数字孪生","合成数据","真-仿-真闭环","物理AI","仿真器","自动驾驶"]},{"id":"manycore-tech","category":"company","sec":7,"tier":3,"sources":[{"title":"群核科技（维基百科）","url":"https://zh.wikipedia.org/wiki/群核科技"},{"title":"SpatialLM: Training Large Language Models for Structured Indoor Modeling（arXiv 2506.07491）","url":"https://arxiv.org/abs/2506.07491"}],"as_of":"2026-04","related_ids":["spatiallm","spatial-intelligence","synthetic-data","simulation-assets","hangzhou-s-six-little-dragons","digital-twin"],"name":"群核科技","alt":"Manycore Tech","abbr":"","aliases":["酷家乐","群核","Manycore"],"one_liner":"杭州空间设计软件公司，旗下有酷家乐，也做空间智能与仿真数据","explanation":"群核科技 2011 年在杭州成立，三位创始人黄晓煌、陈航、朱皓都曾在美国伊利诺伊大学香槟分校读研究生。主业是云端室内设计软件酷家乐（2013 年上线）及海外版 Coohom，积累了大量可渲染的室内 3D 场景。2024 年 11 月它推出空间智能平台 SpatialVerse，用这些场景为机器人生成仿真训练环境和合成数据；2025 年开源把点云转成结构化户型描述的 SpatialLM。它是「杭州六小龙」之一，2026 年 4 月 17 日在港交所上市，是六小龙中第一家上市的。","example":"机器人团队从 SpatialVerse 调取成套室内场景导入仿真器，批量生成家务任务的训练数据。","related":["SpatialLM（群核空间大模型）","空间智能","合成数据","仿真资产","杭州六小龙","数字孪生"]},{"id":"scale-ai","category":"company","sec":7,"tier":3,"sources":[{"title":"Scale AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Scale_AI"}],"as_of":"2026-03","related_ids":["data-annotation","embodied-ai-data-service-provider","reinforcement-learning-from-human-feedback","autonomous-driving","openai"],"name":"Scale AI","alt":"Scale AI","abbr":"","aliases":[],"one_liner":"美国 AI 数据标注公司，为大模型和自动驾驶提供训练数据","explanation":"Scale AI 2016 年成立于旧金山，创始人是 Alexandr Wang 和 Lucy Guo。核心业务是数据标注和模型评测：组织大量人工标注员为自动驾驶、计算机视觉和大语言模型准备训练数据，包括 RLHF（基于人类反馈的强化学习）所需的人类偏好数据。2025 年 6 月 Meta 斥资逾 140 亿美元取得其 49% 无投票权股份，Wang 随即加入 Meta 负责超级智能团队，CEO 由 Jason Droege 接任；2026 年 3 月又成立研究部门 Scale Labs。对具身智能来说，它代表「数据服务商」这一角色，据报道也在拓展机器人与物理 AI 数据业务。","example":"Scale 早期的主要客户是自动驾驶公司，为其标注激光雷达点云和摄像头图像中的车辆、行人。","related":["数据标注","具身数据服务商（数据采集服务商）","基于人类反馈的强化学习","自动驾驶","OpenAI"]},{"id":"build-ai","category":"company","sec":7,"tier":3,"sources":[{"title":"Build AI 官网","url":"https://www.build.ai/"},{"title":"Egocentric-10K on Hugging Face","url":"https://huggingface.co/datasets/builddotai/Egocentric-10K"}],"as_of":"2026-03","related_ids":["egocentric-10k",null,null,null,"embodied-ai-data-service-provider"],"name":"Build AI","alt":"Build AI","abbr":"","aliases":[],"one_liner":"美国具身数据公司，雇人戴头戴相机在工厂干活，采集第一人称视频","explanation":"Build AI 是总部在旧金山、并在深圳设点的具身数据创业公司，创始人包括 Eddy Xu、Patrick Rim、Jonathan Jia 和 Zikang Jiang，注册为公益公司。它自称「物理 AI 数据超大规模供应商」，从采集硬件、生产、物流到采集和模型训练都自己做，核心产品是工人在真实工厂里戴头戴相机录下的第一人称操作视频。2025 年 8 月开源 Egocentric-10K（约 1 万小时、85 个工厂），之后又发布 Egocentric-100K（2025 年 12 月）和 Egocentric-1M（2026 年 3 月）。官网称已融资超 3000 万美元，2026 年年化收入达 1 亿美元。","example":"Egocentric-10K 在 Hugging Face 以 Apache 2.0 开源，可用来做人类视频预训练或潜在动作预训练。","related":["Egocentric-10K 数据集","第一人称视频(Egocentric Video)","人类视频预训练(Pretraining on Human Videos)","无本体采集(Robot-free (Embodiment-free) Data Collection)","具身数据服务商（数据采集服务商）"]},{"id":"inspire-robots","category":"company","sec":8,"tier":2,"sources":[{"title":"INSPIRE ROBOTS - About Us","url":"https://en.inspire-robots.com/about-us/"},{"title":"因时机器人官网","url":"https://www.inspire-robots.com/"}],"as_of":"2026-08","related_ids":["inspire-rh56-dexterous-hand",null,"linear-actuator",null,null,null],"name":"因时机器人","alt":"Inspire Robots","abbr":"","aliases":["因时","INSPIRE-ROBOTS"],"one_liner":"北京的灵巧手和微型伺服电缸厂商，RH56 灵巧手很常见","explanation":"因时机器人 2016 年成立于北京石景山，做微型精密运动部件：核心是微型直线伺服驱动器（小电缸），再用它做成仿人五指灵巧手和电动夹爪。RH56 系列灵巧手每根手指由一个小电缸经连杆驱动，价格和可靠性适中，被大量装在宇树 H1、G1、傅利叶 GR1 等人形机器人上，是具身论文里出镜率很高的灵巧手。官网称客户超过 2000 家，截至 2025 年灵巧手出货超过 1 万只；2017 年获 Pre-A 轮、2023 年获 B+ 轮融资。2026 年 8 月世界机器人大会上发布了 24 自由度的 RH524J1 系列。","example":"HumanPlus、OKAMI 等人形机器人论文的实验平台都用了因时 6 自由度灵巧手。","related":["因时 RH56 灵巧手","灵巧手(Dexterous Hand)","线性执行器（直线执行器 / 电缸）","连杆传动(Linkage Transmission)","宇树 H1(Unitree H1)","核心零部件(Core Components)"]},{"id":"linkerbot","category":"company","sec":8,"tier":2,"sources":[{"title":"灵心巧手完成近15亿元B轮融资（证券时报网，2026-02-12）","url":"https://www.stcn.com/article/detail/3641823.html"},{"title":"超亿元，机器人灵巧手最大种子轮诞生！（证券时报网）","url":"https://stcn.com/article/detail/1647503.html"},{"title":"灵心巧手官网","url":"https://www.linkerbot.cn"}],"as_of":"2026-05","related_ids":["linker-hand","dexterous-hand","data-glove","tendon-driven-actuation","end-effector","humanoid-robot"],"name":"灵心巧手","alt":"Linkerbot","abbr":"","aliases":["LinkerBot","灵心巧手（北京）科技"],"one_liner":"北京的灵巧手公司，主打 Linker Hand 系列高自由度机器人手","explanation":"灵心巧手 2019 年成立，总部北京，创始人兼 CEO 周永有十多年互联网产品和机器人经验。它专做灵巧手（像人手一样多指、多自由度的末端执行器），2024 年推出 Linker Hand 系列，自由度从 6 到 42 不等，覆盖连杆、腱绳、直驱等传动方式，另有数据手套、遥操作臂等采集设备。2025 年 4 月拿到破亿元种子轮，2026 年 2 月完成近 15 亿元 B 轮，估值破百亿元，称目标当年交付 5 万到 10 万台灵巧手；据报道 5 月其下一轮寻求约 60 亿美元估值。","example":"人形机器人公司把 Linker Hand L20 装在手臂末端，操作员戴数据手套遥操作，采集抓握、捏取等灵巧操作数据。","related":["灵心巧手 Linker Hand","灵巧手","数据手套","腱绳驱动","末端执行器","人形机器人"]},{"id":"shenzhen-zhaowei-machinery-and-electronics","category":"company","sec":8,"tier":3,"sources":[{"title":"兆威机电港股上市，「灵巧手」龙头开启全球化新征程（证券时报网）","url":"https://www.stcn.com/article/detail/3667158.html"},{"title":"资讯：灵巧手微型驱动龙头兆威机电港股上市（艾邦机器人）","url":"https://www.aibangbots.com/a/7704"}],"as_of":"2026-09","related_ids":["dexterous-hand","coreless-motor","micro-lead-screw","speed-reducer-gearbox","core-components"],"name":"兆威机电","alt":"Shenzhen Zhaowei Machinery & Electronics","abbr":"","aliases":["兆威","Zhaowei"],"one_liner":"深圳微型传动与驱动厂商，做灵巧手和微型齿轮箱，A+H 上市。","explanation":"兆威机电 2001 年成立于深圳，做微型传动系统、微电机和电控系统，产品用于智能汽车、消费电子与医疗、工业设备等；据报道能量产直径 6 毫米以下的微型传动系统，最小做到 3.4 毫米。灵巧手手指空间很小，要把电机和减速机构塞进指节里，正好用得上微型传动，兆威据此推出 ZWHAND 系列灵巧手，被称为国内首家推出商业化高自由度灵巧手的企业。2020 年 12 月在深交所上市（003021），2026 年 3 月 9 日在港交所主板挂牌（02692.HK），成为 A+H 公司，募资主要投向具身机器人等业务；2026 年 9 月发布新一代灵巧手产品。","example":"人形机器人厂商采购兆威的灵巧手，或只买它的微型齿轮箱装进自研手指关节。","related":["灵巧手","空心杯电机","微型丝杠","减速器","核心零部件"]},{"id":"brainco","category":"company","sec":8,"tier":3,"sources":[{"title":"Wikipedia: BrainCo","url":"https://en.wikipedia.org/wiki/BrainCo"},{"title":"BrainCo Revo 2 参数文档","url":"https://www.brainco-hz.com/docs/revolimb-hand/en/revo2/parameters.html"}],"as_of":"2026-01","related_ids":["brainco-revo-hand",null,"hangzhou-s-six-little-dragons",null,null],"name":"强脑科技","alt":"BrainCo","abbr":"","aliases":[],"one_liner":"杭州脑机接口公司，从智能假肢延伸出机器人灵巧手 Revo","explanation":"强脑科技 2015 年由哈佛脑科学博士生韩璧丞创办，总部在杭州，美国萨默维尔设有办公室，是「杭州六小龙」之一。主业是非侵入式脑机接口：用头环采集脑电（EEG）做专注力、睡眠类产品，并做能用肌电信号控制的智能假手、假腿。和具身智能的交集在于它把假肢技术做成了机器人灵巧手 Revo 系列，常装在人形机器人上。融资方面，2025 年 8 月估值超 13 亿美元；2026 年 1 月据报道融资约 20 亿元，并由中金和瑞银保荐向港交所秘密递表。","example":"Revo 2 灵巧手单手约 383 克，6 个电机驱动 11 个自由度，可接 CAN FD 或 EtherCAT 装到人形机器人上。","related":["强脑科技 Revo 灵巧手","灵巧手(Dexterous Hand)","杭州六小龙","欠驱动(Underactuation)","人形机器人(Humanoid Robot)"]},{"id":"agilink","category":"company","sec":8,"tier":3,"sources":[{"title":"头部互联网大厂领投，「临界点」再获数亿元融资丨智能涌现独家（36氪）","url":"https://m.36kr.com/p/3678179258425990"},{"title":"智元拆出一家「灵巧手」独角兽，成立不足5月估值破10亿美元（澎湃/搜狐）","url":"https://m.sohu.com/a/1024972075_260616"}],"as_of":"2026-06","related_ids":["agibot","dexterous-hand","fully-direct-drive-dexterous-hand","agibot-omnihand","core-components","dexterous-manipulation"],"name":"临界点","alt":"AGILINK","abbr":"AGILINK","aliases":["上海临界点创新智能科技有限公司"],"one_liner":"智元机器人拆分出来的灵巧手公司","explanation":"临界点（AGILINK）2026 年 1 月在上海注册成立，前身是智元机器人的灵巧手部门，由智元关联公司持股。创始人熊坤毕业于香港科技大学机器人研究所，曾是腾讯 Robotics X 实验室早期成员，后在 IDEA 研究院、汇川技术任职，2024 年 11 月加入智元负责灵巧手。公司做多自由度五指灵巧手和夹爪，灵巧手用于让机器人完成精细抓取与操作。成立后连续融资，2026 年 5—6 月据报道估值突破 10 亿美元，成为灵巧手赛道的独角兽；2026 年 4 月发布 OmniHand 3 系列，旗舰款 Ultra-T 采用绳驱与直驱混合方案。它是智元「拆分核心零部件、独立融资」生态打法的一个例子。","example":"CES 2026 上，搭载其灵巧手的 LG 机器人完成了精细操作演示（据报道）。","related":["智元机器人","灵巧手","全直驱灵巧手","智元 OmniHand 灵巧手","核心零部件","灵巧操作"]},{"id":"shadow-robot-company","category":"company","sec":8,"tier":3,"sources":[{"title":"Shadow Robot unveils DEX-EE, developed with Google DeepMind","url":"https://shadowrobot.com/shadow-robot-unveils-the-worlds-most-robust-dexterous-robot-hand-developed-in-partnership-with-google-deepmind"},{"title":"Shadow Robot Dexterous Hand & DEX-EE (Robots International)","url":"https://www.robotsinternational.com/Shadow-Robot.htm"}],"as_of":"2026-09","related_ids":["shadow-dexterous-hand","dex-ee","dexterous-hand","dactyl","google-deepmind","tendon-driven-actuation"],"name":"Shadow Robot Company","alt":"Shadow Robot Company","abbr":"","aliases":["Shadow Robot"],"one_liner":"英国老牌灵巧手公司，做 Shadow 灵巧手和 DEX-EE","explanation":"Shadow Robot Company 1987 年在伦敦创立，是历史最久的机器人公司之一，现由 Rich Walker 负责。它最知名的产品是 Shadow Dexterous Hand：尺寸接近人手、有 20 多个自由度、由腱绳驱动的五指灵巧手，长期是灵巧操作研究的标准硬件。OpenAI 的 Dactyl 项目就用它在仿真中训练策略、再迁移到真机，完成手内翻转物体和单手还原魔方。之后它与 Google DeepMind 合作开发了三指灵巧手 DEX-EE，主打耐用，能承受强化学习长时间、高强度的真机训练，并采集大量触觉等传感数据。","example":"OpenAI 2019 年用 Shadow 灵巧手单手还原魔方，是仿真到现实迁移的经典案例。","related":["Shadow 灵巧手","Shadow DEX-EE 灵巧手","灵巧手","Dactyl（OpenAI 魔方灵巧手）","谷歌 DeepMind","腱绳驱动"]},{"id":"robotiq","category":"company","sec":8,"tier":3,"sources":[{"title":"Robotiq 官网","url":"https://robotiq.com/"},{"title":"Robotiq | LinkedIn","url":"https://www.linkedin.com/company/robotiq"},{"title":"2F-85 & 2F-140 Adaptive Gripper","url":"https://robotiq.com/products/2f85-140-adaptive-robot-gripper"}],"as_of":"2026-09","related_ids":["robotiq-2f-85-gripper",null,null,null,"droid",null],"name":"Robotiq","alt":"Robotiq","abbr":"","aliases":[],"one_liner":"加拿大夹爪和协作机器人配件厂商，2F-85 夹爪的出品方","explanation":"Robotiq 是 2008 年成立的加拿大自动化公司，总部在魁北克省莱维市，在北美和欧洲设有办公室。它主要给协作机械臂做「即插即用」的配件和工作站：自适应二指夹爪（2F-85、2F-140）、平行夹爪 Hand-E、真空吸盘、FT 300 六维力传感器、腕部相机和触觉指尖，以及码垛、上下料、拧螺丝等整套工作站。在具身研究里，2F-85 几乎是 Franka、UR 机械臂的标配末端，DROID 等大规模数据集就用它采集。近年它开源了 ROS 2 驱动、C++ SDK 和 Isaac Sim 仿真资产，也开始以物理 AI 为方向。","example":"DROID 数据集的采集平台是 Franka Panda 机械臂加 Robotiq 2F-85 夹爪。","related":["Robotiq 2F-85 夹爪","自适应夹爪(Adaptive / Underactuated Gripper)","协作机器人(Collaborative Robot)","六维力传感器(Six-Axis Force/Torque Sensor)","DROID 数据集","码垛 / 拆垛(Palletizing / Depalletizing)"]},{"id":"dh-robotics","category":"company","sec":8,"tier":3,"sources":[{"title":"大寰机器人官网","url":"https://www.dh-robotics.com"},{"title":"2026世界机器人大会展商信息：大寰机器人","url":"https://www.worldrobotconference.com/expo/company/706.html"},{"title":"机器人大讲堂：核心团队师承戴建生院士，大寰机器人完成C+轮融资","url":"https://www.leaderobot.com/news/3743"}],"as_of":"2026-08","related_ids":["gripper","electric-gripper","dexterous-hand","end-effector","force-control","core-components"],"name":"大寰机器人","alt":"DH-Robotics","abbr":"","aliases":["大寰","深圳市大寰机器人科技有限公司","大寰机器人科技股份有限公司"],"one_liner":"深圳电动夹爪厂商，也做灵巧手和精密力控执行器","explanation":"大寰机器人 2016 年 12 月在深圳成立，创始人孙杰本科毕业于清华机械专业，在伦敦国王学院读博，核心团队师从机构学学者戴建生。它做机器人手臂末端的「手」及相关零部件：电动夹爪（用电机而非气缸驱动，能精确控制开合位置和夹持力）、灵巧手、音圈执行器、伺服电缸和驱动器等，核心技术是精密力控和直驱力反馈，主要用于 3C 电子、汽车零部件、医疗器械产线，也给协作机械臂和人形机器人配套。融资方面，2022 年字节跳动战略入股，2024 年 2 月完成由启明创投等参投的 C+ 轮。它是国家级专精特新重点「小巨人」企业。","example":"在手机镜头模组产线上，机械臂末端装大寰电爪，用很小且可设定的夹持力抓取易碎的镜头件。","related":["夹爪","电动夹爪","灵巧手","末端执行器","力控","核心零部件"]},{"id":"leaderdrive","category":"company","sec":8,"tier":3,"sources":[{"title":"财联社：绿的谐波筹划发行H股并在香港联交所上市","url":"https://www.cls.cn/detail/2465192"},{"title":"钛媒体：卖铲人绿的谐波","url":"https://www.tmtpost.com/8108147.html"},{"title":"新浪财经：绿的谐波科创板招股说明书","url":"https://vip.stock.finance.sina.com.cn/corp/view/vISSUE_RaiseExplanationDetail.php?stockid=688017&id=6536262"}],"as_of":"2026-08","related_ids":["strain-wave-gear","laifual","speed-reducer-gearbox","joint-actuator-module","domestic-substitution","tesla-supply-chain"],"name":"绿的谐波","alt":"Leaderdrive","abbr":"","aliases":["苏州绿的谐波","绿的"],"one_liner":"国内谐波减速器龙头，科创板上市，2026 年筹划赴港","explanation":"苏州绿的谐波传动科技股份有限公司 2011 年成立，董事长左昱昱 2003 年起自主研发谐波减速器，与弟弟左晶共同控制公司。它打破了日本哈默纳科在谐波减速器上的长期垄断，2020 年 8 月登陆科创板（688017），被称为国内谐波减速器第一股。谐波减速器体积小、背隙小，是协作机械臂和人形机器人手臂关节的常用件，所以它是人形机器人产业链里的热门供应商。2025 年营收 5.71 亿元、归母净利润 1.24 亿元，国内份额约 27.5%。2026 年 8 月 26 日董事会通过发行 H 股并在港交所主板上市的议案。","example":"工业机器人小臂和手腕关节常用谐波减速器把电机高转速换成大力矩。","related":["谐波减速器","来福谐波","减速器","关节模组","国产替代","T 链（特斯拉链）"]},{"id":"laifual","category":"company","sec":8,"tier":3,"sources":[{"title":"财联社：估值15亿的来福谐波冲刺港股IPO","url":"https://www.cls.cn/detail/2387467"},{"title":"香港经济日报：来福谐波（03952）IPO","url":"https://knowledge.hket.com/article/4151158/"},{"title":"经济通：来福谐波 03952 招股资讯","url":"https://www.etnet.com.hk/www/tc/stocks/ipo-info.php?code=03952"}],"as_of":"2026-06","related_ids":["strain-wave-gear","leaderdrive","joint-actuator-module","hkex-chapter-18c","domestic-substitution","core-components"],"name":"来福谐波","alt":"Laifual","abbr":"","aliases":["来福谐波传动","Laifual Drive"],"one_liner":"浙江的谐波减速器厂商，2026 年 6 月在港股上市","explanation":"浙江来福谐波传动股份有限公司 2013 年成立，董事长张杰是美国新泽西理工学院毕业的 90 后，2017 年起执掌公司。主营谐波减速器，并延伸到关节模组、机械臂和自动化工作站，产品主要用于人形机器人和工业机器人。招股书引用灼识咨询数据，按 2025 年出货量它在中国机器人谐波减速器供应商中排第二、份额 21.4%，仅次于绿的谐波；2025 年营收约 2.61 亿元，仍处亏损。此前两次筹备科创板未果，2026 年 6 月 30 日在香港联交所主板上市，股票代码 03952。","example":"人形机器人手臂的旋转关节常把来福或绿的的谐波减速器与无框电机装成一体关节模组。","related":["谐波减速器","绿的谐波","关节模组","港股 18C 章","国产替代","核心零部件"]},{"id":"nabtesco","category":"company","sec":8,"tier":3,"sources":[{"title":"Precision Reduction Gears | Nabtesco Corporation","url":"https://www.nabtesco.com/en/products/robot"},{"title":"Nabtesco 2026 Company Profile | PitchBook","url":"https://pitchbook.com/profiles/company/60420-79"}],"as_of":"2026-09","related_ids":["rotate-vector-reducer","cycloidal-reducer","speed-reducer-gearbox","strain-wave-gear","big-four-of-industrial-robotics","domestic-substitution"],"name":"纳博特斯克","alt":"Nabtesco","abbr":"","aliases":["Nabtesco Corporation"],"one_liner":"日本精密减速器巨头，工业机器人 RV 减速器的主要供应商。","explanation":"纳博特斯克（Nabtesco）2003 年由帝人制机（Teijin Seiki）和 Nabco 合并成立，总部在东京。它最出名的是精密减速器业务：RV 减速器用摆线针轮加行星齿轮两级减速，刚性高、抗冲击，适合承受大负载的机器人关节，代表型号有 RV-N、RV-C、RV-E 系列。公司自己估计，在中大型工业机器人关节用精密减速器领域全球份额约 60%。对具身智能来说，它代表了减速器这类核心零部件长期由日本厂商主导的格局，也是国内减速器厂商做国产替代时的主要对标对象。","example":"RV-N 系列精密减速器，用于中大型工业机器人的重载关节。","related":["RV减速器","摆线减速器","减速器","谐波减速器","工业机器人四大家族","国产替代"]},{"id":"zhejiang-shuanghuan-driveline","category":"company","sec":8,"tier":3,"sources":[{"title":"关于双环｜浙江双环传动机械股份有限公司","url":"https://www.gearsnet.com/about.html"},{"title":"机器人公司IPO收紧？环动科技终止IPO（新浪财经）","url":"https://finance.sina.com.cn/roll/2026-09-22/doc-inissitm5657890.shtml"}],"as_of":"2026-09","related_ids":["rotate-vector-reducer","speed-reducer-gearbox","nabtesco","domestic-substitution","industrial-robot"],"name":"双环传动","alt":"Zhejiang Shuanghuan Driveline","abbr":"","aliases":["浙江双环传动机械股份有限公司"],"one_liner":"杭州齿轮龙头，子公司环动科技是国产 RV 减速器主要厂商之一。","explanation":"双环传动（浙江双环传动机械股份有限公司）1980 年创建，管理总部在杭州，2010 年 9 月在深交所上市（002472），公司称是国内首家专业齿轮制造上市公司，客户包括采埃孚、康明斯、卡特彼勒等。主业是汽车与新能源车齿轮；2020 年成立子公司环动科技做 RV 减速器（一种重载、高刚性的精密减速器，常装在工业机器人的腰、肩等大关节）。RV 减速器市场长期由日本纳博特斯克主导，环动科技是国产替代的主要厂商之一，批量配套国产工业机器人。双环传动持有环动科技约 61% 股权；环动科技 2024 年 11 月申请科创板分拆上市获受理，2026 年 9 月主动撤回，审核状态变为「终止」。","example":"国产六轴工业机器人的底座和大臂关节里装的 RV 减速器，可能就来自环动科技。","related":["RV减速器","减速器","纳博特斯克","国产替代","工业机器人"]},{"id":"ningbo-zhongda-leader-intelligent-transmission","category":"company","sec":8,"tier":3,"sources":[{"title":"中大力德：机器人运动执行部件制造的多面选手（券商研报）","url":"https://pdf.dfcfw.com/pdf/H3_AP202212201581217130_1.pdf"},{"title":"人形机器人一体化关节 - 宁波中大力德智能传动股份有限公司","url":"https://www.zd-motor.com/products_detail/499.html"}],"as_of":"2026-03","related_ids":["planetary-gearbox","rotate-vector-reducer","strain-wave-gear","joint-actuator-module","core-components","domestic-substitution"],"name":"中大力德","alt":"Ningbo ZhongDa Leader Intelligent Transmission","abbr":"","aliases":["宁波中大力德智能传动股份有限公司","ZD Leader"],"one_liner":"宁波的减速器与电机厂商，同时做行星、RV 和谐波减速器。","explanation":"中大力德（宁波中大力德智能传动股份有限公司）成立于 2006 年，前身是 1998 年成立的中大电机厂，总部在浙江宁波，2017 年在深交所上市（002896）。它以减速电机起家，是国内少数同时生产精密行星减速器、RV 减速器和谐波减速器，并配套伺服驱动器和各类电机的厂商，产品用于工业机器人、智能物流、新能源等设备。人形机器人兴起后，它推出把电机、减速器、驱动集成在一起的人形机器人一体化关节模组，因此常被列入人形机器人核心零部件和国产替代概念。","example":"人形机器人一体化关节：电机、减速器、驱动器集成在一个模组里。","related":["行星减速器","RV减速器","谐波减速器","关节模组","核心零部件","国产替代"]},{"id":"rollvis","category":"company","sec":8,"tier":3,"sources":[{"title":"Rollvis SA 官网","url":"https://www.rollvis.com/en/"}],"as_of":"2026-09","related_ids":["planetary-roller-screw","inverted-planetary-roller-screw","ball-screw","linear-actuator","tesla-optimus","domestic-substitution"],"name":"Rollvis（行星滚柱丝杠）","alt":"Rollvis SA","abbr":"","aliases":["Rollvis"],"one_liner":"瑞士日内瓦的行星滚柱丝杠老牌厂商，人形机器人直线关节的关键供应商之一。","explanation":"Rollvis SA 1970 年成立，总部在瑞士日内瓦的 Plan-les-Ouates，专做行星滚柱丝杠：用多根带螺纹的滚柱代替滚珠丝杠里的钢珠，把电机的旋转变成直线推拉，接触线更多，所以承载、刚度和抗冲击都比滚珠丝杠高。产品线包括标准型 RV/HRV、反向式 RVI、循环式 RVR 和差动式 RVD，传统客户在航空航天、医疗、科研和工业领域。人形机器人的膝、肘、踝等关节常用「电机 + 行星滚柱丝杠」组成的直线执行器，这类高精度丝杠长期由少数欧洲厂商掌握，Rollvis 是常被提到的一家，也是国产替代的对标对象。","example":"据供应链拆解分析，特斯拉 Optimus 的直线关节采用反向式行星滚柱丝杠方案，这正是 Rollvis RVI 这类产品的类型。","related":["行星滚柱丝杠","反向式行星滚柱丝杠","滚珠丝杠","线性执行器（直线执行器 / 电缸）","擎天柱","国产替代"]},{"id":"shanghai-beite-technology","category":"company","sec":8,"tier":3,"sources":[{"title":"人形机器人丝杠成最贵零部件，绑定核心客户的2家公司（东方财富）","url":"https://caifuhao.eastmoney.com/news/20260530193720434562320"},{"title":"人形机器人催化丝杠国产化（券商研报）","url":"https://pdf.dfcfw.com/pdf/H3_AP202506271698187795_1.pdf?1751008182000.pdf="}],"as_of":"2026-05","related_ids":["planetary-roller-screw","linear-actuator","inverted-planetary-roller-screw","tesla-supply-chain","core-components"],"name":"北特科技","alt":"Shanghai Beite Technology","abbr":"","aliases":["北特"],"one_liner":"上海汽车底盘零部件厂商，切入人形机器人行星滚柱丝杠","explanation":"北特科技是上海的汽车零部件企业，在上交所主板上市（代码 603009），主业是汽车底盘零部件、空调压缩机和铝合金轻量化件，2025 年营收约 23 亿元，其中底盘零部件占六成以上。人形机器人的直线关节常用行星滚柱丝杠，把电机的转动变成大推力的直线运动，这类丝杠加工精度要求高、长期依赖进口。北特借助做汽车零件积累的精密加工能力切入这一环节，据报道 2024 年投资约 18.5 亿元在江苏昆山建设丝杠产能；据券商研报，其行星滚柱丝杠已在多家国内人形本体厂小批试制和送样。","example":"人形机器人膝关节常用「电机 + 行星滚柱丝杠」的线性执行器推动小腿，北特瞄准的就是其中的丝杠。","related":["行星滚柱丝杠","线性执行器（直线执行器 / 电缸）","反向式行星滚柱丝杠","T 链（特斯拉链）","核心零部件"]},{"id":"tuopu-group","category":"company","sec":8,"tier":3,"sources":[{"title":"证券之星：拓普集团港股IPO","url":"https://4g.stockstar.com/detail/IG2026041300021443"},{"title":"铸造头条：拓普集团赴港IPO","url":"https://zhuzaotoutiao.com/xw/html/22845.shtml"}],"as_of":"2026-04","related_ids":["actuator","linear-actuator","planetary-roller-screw","tesla-supply-chain","tier-1-supplier","humanoid-robot-concept-stocks"],"name":"拓普集团","alt":"Tuopu Group","abbr":"","aliases":["宁波拓普集团","拓普","601689"],"one_liner":"宁波汽车零部件巨头，转型做人形机器人执行器","explanation":"宁波拓普集团，历史可追溯到 1983 年创始人邬建树在宁波做汽车零部件，2004 年成立前身宁波拓普制动系统，2015 年在上交所上市（601689）。主业是减震系统、内饰件、底盘、汽车电子和热管理，是特斯拉等新能源车企的重要供应商。借汽车供应链能力切入人形机器人：从直线执行器（把电机转动变成直线推拉的部件，常用于机器人手臂和腿）做起，扩展到旋转执行器、灵巧手电机、结构件和传感器，规划了总投资约 50 亿元的宁波机器人核心部件基地。市场普遍视其为特斯拉 Optimus 执行器供应商，公司官方未逐项确认。2025 年 12 月宣布筹划港股上市，2026 年 4 月向港交所递表，谋求 A+H 两地上市。","example":"人形机器人每台需要几十个执行器，拓普这类车企供应商用汽车级量产线来压低单件成本。","related":["执行器","线性执行器（直线执行器 / 电缸）","行星滚柱丝杠","T 链（特斯拉链）","一级供应商（Tier 1）","人形机器人概念股"]},{"id":"sanhua-intelligent-controls","category":"company","sec":8,"tier":3,"sources":[{"title":"天册助力三花智控于香港联交所主板成功上市","url":"https://www.tclawfirm.com/content-1655.html"},{"title":"股价因「机器人」飙涨 三花智控2025年净利至多增50%（观点网）","url":"https://www.guandian.cn/m/show/533596"}],"as_of":"2025-10","related_ids":["actuator","joint-actuator-module","tesla-optimus","tesla-supply-chain","core-components","humanoid-robot-concept-stocks"],"name":"三花智控","alt":"Sanhua Intelligent Controls","abbr":"","aliases":["浙江三花智能控制股份有限公司"],"one_liner":"制冷控制元件龙头，切入人形机器人机电执行器","explanation":"三花智控（浙江三花智能控制股份有限公司）1994 年成立，属于三花集团，2005 年在深交所上市，2025 年 6 月 23 日又在港交所主板上市，成为 A+H 两地上市公司。主业是空调、冰箱用的阀件等制冷控制元件，以及新能源汽车热管理部件。它进入具身智能的方式是研发人形机器人的机电执行器，也就是把电机、减速器或丝杠、传感器集成在一起的关节驱动单元。据报道它被市场视为特斯拉 Optimus 供应链（T 链）的代表公司之一，2025 年股价因「机器人」概念大幅上涨。","example":"2025 年 9 月到 10 月，三花智控 A 股从约 30 元涨到 53 元以上的历史新高，市场主要押注其机器人执行器业务。","related":["执行器","关节模组","擎天柱","T 链（特斯拉链）","核心零部件","人形机器人概念股"]},{"id":"schaeffler","category":"company","sec":8,"tier":3,"sources":[{"title":"Schaeffler and Neura Robotics launch future-oriented technology partnership","url":"https://www.schaeffler.com/en/media/press-releases/press-releases-detail.jsp?id=88136515"},{"title":"Schaeffler enters into strategic partnership with Hexagon Robotics","url":"https://markets.businessinsider.com/news/stocks/eqs-news-humanoid-robotics-schaeffler-enters-into-strategic-partnership-with-hexagon-robotics-1036047911"}],"as_of":"2026-04","related_ids":["neura-robotics","actuator","planetary-gearbox","strain-wave-gear","selling-shovels"],"name":"舍弗勒","alt":"Schaeffler","abbr":"","aliases":["Schaeffler Group","舍弗勒集团"],"one_liner":"德国轴承与汽车零部件巨头，为人形机器人供应关节执行器","explanation":"舍弗勒 1946 年创立，总部在德国黑措根奥拉赫，以 INA、FAG 等品牌的滚动轴承和汽车传动部件闻名。近年它把精密机械能力延伸到人形机器人，推出基于行星减速器和谐波减速器的执行器平台。2025 年 11 月与德国 Neura Robotics 结成技术伙伴，为其人形供应执行器，并计划到 2035 年在自家全球工厂部署数千台人形机器人；2026 年 4 月又分别与瑞士 Hexagon Robotics、越南 VinDynamics 签约供应减速器和执行器。它是传统汽车零部件供应商转型给人形机器人「卖铲子」的代表。","example":"舍弗勒给 Neura 供应的行星减速执行器用于肩、肘、膝、腕等转动关节，额定扭矩最高约 250 Nm。","related":["NEURA Robotics","执行器","行星减速器","谐波减速器","卖铲子"]},{"id":"maxon","category":"company","sec":8,"tier":3,"sources":[{"title":"Maxon Group（Wikipedia）","url":"https://en.wikipedia.org/wiki/Maxon_Motor"}],"as_of":"2025-06","related_ids":["coreless-motor","brushless-dc-motor","faulhaber","dexterous-hand","speed-reducer-gearbox","hexagon-aeon"],"name":"Maxon","alt":"maxon","abbr":"","aliases":["瑞士 Maxon","maxon motor","Maxon Group"],"one_liner":"瑞士精密电机厂商，空心杯电机代表品牌，驱动过火星车","explanation":"Maxon 1961 年在瑞士萨克塞恩成立，前身 Interelectric AG，2019 年由 maxon motor 更名为 Maxon，约有 3000 名员工。它生产精密直流电机、无刷电机、减速箱、编码器和电机控制器，尤以空心杯电机（转子没有铁芯、惯量小、低速平稳的小电机）出名；NASA 的索杰纳、勇气号、机遇号、毅力号火星车都用了它的驱动。在具身智能里，这类小电机常用在灵巧手手指和小关节上；据报道 Maxon 也是海克斯康人形机器人 AEON 的执行器合作方。","example":"不少灵巧手把空心杯电机和微型丝杠塞进手指，Maxon、冯哈伯是这类电机的常见海外供应商。","related":["空心杯电机","无刷直流电机","冯哈伯","灵巧手","减速器","Hexagon AEON"]},{"id":"faulhaber","category":"company","sec":8,"tier":3,"sources":[{"title":"Wikipedia (de): Faulhaber (Unternehmen)","url":"https://de.wikipedia.org/wiki/Faulhaber_(Unternehmen)"},{"title":"FAULHABER - About us","url":"https://www.faulhaber.com/en/about-us/"}],"as_of":"2025","related_ids":[null,null,null,null,null],"name":"冯哈伯","alt":"FAULHABER","abbr":"","aliases":["Dr. Fritz Faulhaber GmbH & Co. KG","Faulhaber"],"one_liner":"德国微型电机厂商，空心杯电机的发明者和主要供应商之一","explanation":"德国家族企业，1947 年由 Fritz Faulhaber 创立，总部在巴登-符腾堡州的舍瑙希（Schönaich）。它最有名的技术是 1965 年获得专利的斜绕无铁芯转子线圈，也就是今天常说的空心杯电机：转子里没有铁芯，体积小、惯量低、转动平顺。公司产品包括微型直流电机、无刷电机、步进电机、直线电机以及配套的精密减速器、编码器和驱动器，用于医疗器械、航空航天、光学和机器人。灵巧手手指空间很小，常用空心杯电机加微型丝杠或减速器驱动，冯哈伯和瑞士 Maxon 是这类电机的主要国际供应商。","example":"一些灵巧手每根手指里塞一颗小直径空心杯电机，配减速器驱动指关节弯曲。","related":["空心杯电机(Coreless Motor)","Maxon(maxon)","灵巧手(Dexterous Hand)","微型丝杠(Micro Lead Screw)","核心零部件(Core Components)"]},{"id":"moons-electric","category":"company","sec":8,"tier":3,"sources":[{"title":"空心杯电机是机器人灵巧手的核心驱动技术 - 鸣志官网","url":"https://www.moons.com.cn/article/cn-techschool-stepmotor-00106"},{"title":"上海鸣志电器股份有限公司-展商信息-2026世界机器人大会","url":"https://www.worldrobotconference.com/expo/company/520.html"},{"title":"上海鸣志电器股份有限公司2024年年度报告","url":"https://static.cninfo.com.cn/finalpage/2025-04-26/1223327773.PDF"}],"as_of":"2026-08","related_ids":["coreless-motor","stepper-motor","dexterous-hand","core-components","domestic-substitution","tesla-supply-chain"],"name":"鸣志电器","alt":"MOONS' Electric","abbr":"","aliases":["鸣志","MOONS'"],"one_liner":"上海的控制电机厂商，空心杯电机被视为灵巧手关键部件。","explanation":"鸣志电器（上海鸣志电器股份有限公司）成立于 1994 年，总部在上海，2017 年在上交所上市（603728）。它主要做控制电机和驱动系统，步进电机是传统强项，产品用于半导体、锂电、光伏设备、医疗器械和工业自动化。它进入具身智能视野，主要因为无刷空心杯电机：这种转子没有铁芯的小电机体积小、惯量低，适合装进灵巧手的手指做驱动，因此常被归入人形机器人供应链概念股。2026 年世界机器人大会上，它展出了空心杯电机配行星齿轮箱的组合件和微型无框电机。","example":"无刷空心杯电机 ECH11026 重约 18.5 克，可用作灵巧手手指驱动。","related":["空心杯电机","步进电机","灵巧手","核心零部件","国产替代","T 链（特斯拉链）"]},{"id":"kollmorgen","category":"company","sec":8,"tier":3,"sources":[{"title":"Kollmorgen: History","url":"https://www.kollmorgen.com/en-us/company/history"},{"title":"Regal Rexnord and Altra receipt of regulatory approvals for merger","url":"https://investors.regalrexnord.com/investors/ir-news/press-release-details/2023/REGAL-REXNORD-AND-ALTRA-ANNOUNCE-RECEIPT-OF-ALL-REQUIRED-REGULATORY-APPROVALS-FOR-MERGER/default.aspx"},{"title":"艾邦机器人：无框力矩电机全球23家供应商","url":"https://www.aibangbots.com/a/1764"}],"as_of":"2026","related_ids":["frameless-torque-motor","servo-motor","joint-actuator-module","strain-wave-gear","maxon","core-components"],"name":"科尔摩根","alt":"Kollmorgen","abbr":"","aliases":[],"one_liner":"美国老牌运动控制厂商，无框力矩电机是机器人关节常用件","explanation":"科尔摩根源自德国光学专家 Friedrich Kollmorgen 的潜望镜设计，1916 年在纽约注册成立，现总部在美国弗吉尼亚州拉德福德，2026 年迎来 110 周年。它先后归属丹纳赫、2016 年从丹纳赫拆分出的 Fortive、2018 年并入 Altra Industrial Motion，2023 年 Regal Rexnord 收购 Altra 后成为其旗下品牌。主要产品是伺服电机、驱动器和无框力矩电机，也做 AGV 导航控制。无框电机只卖定子和转子，由机器人厂商直接装进关节壳体，适合协作机械臂和人形机器人的紧凑关节；它的 TBM2G 系列就面向人形机器人关节设计。","example":"人形机器人的旋转关节常用科尔摩根 TBM2G 这类无框电机，配谐波减速器和双编码器组成关节模组。","related":["无框力矩电机","伺服电机","关节模组","谐波减速器","Maxon","核心零部件"]},{"id":"zeroerr","category":"company","sec":8,"tier":3,"sources":[{"title":"头部人形机器人关节公司半年再获新融资，同创伟业领投数亿元（36氪）","url":"https://m.36kr.com/p/3885232033378308"},{"title":"零差云控完成数亿元C++轮融资（新浪科技）","url":"https://finance.sina.com.cn/tech/digi/2026-07-13/doc-inihrsvc4207356.shtml"},{"title":"零差云控官网","url":"https://zeroerr.cn"}],"as_of":"2026-07","related_ids":["joint-actuator-module","actuator","collaborative-robot","humanoid-robot","integrated-drive-and-control"],"name":"零差云控","alt":"ZeroErr","abbr":"","aliases":["零差云控（深圳）科技股份有限公司"],"one_liner":"深圳的机器人关节模组厂商，主打标准化 eRob 一体化关节。","explanation":"零差云控 2016 年在深圳成立，创始人为贾玺庆。它做机器人关节模组（把电机、减速器、编码器、驱动器集成在一起的一体化关节），eRob 系列用于协作机器人、医疗机器人、自动化设备和人形机器人。创始人主张「伪定制、真标准化」：客户说的定制多半就是更轻、更小、更强、更便宜，用标准品迭代来满足。人形机器人走向量产后，关节供货能力成了瓶颈，这类上游零部件公司因此受资本关注。2026 年 7 月完成数亿元 C++ 轮融资，同创伟业领投、国泰君安创新投资跟投、老股东华控基金追加，资金用于扩产和海外市场。","example":"小型协作臂团队直接买 6 个 eRob 关节模组拼成一台 6 轴机械臂，不必自己设计电机和减速器。","related":["关节模组","执行器","协作机器人","人形机器人","驱控一体"]},{"id":"damiao-technology","category":"company","sec":8,"tier":3,"sources":[{"title":"达妙科技官网","url":"https://www.mdmbot.com/"},{"title":"DM-J4310-2EC 产品页","url":"https://www.mdmbot.com/index.php?c=show&id=84"}],"as_of":"2025","related_ids":["damiao-dm-j4310-2ec-joint-motor",null,null,null,null],"name":"达妙科技","alt":"DAMIAO Technology","abbr":"","aliases":["达妙"],"one_liner":"深圳关节电机厂商，DM-J4310 是学生和开源机器人常用的小关节","explanation":"深圳市达妙科技有限公司 2019 年成立，位于深圳南山大学城创业园，做机器人用的一体化关节电机、轮毂电机和云台电机，以及 DM40–DM100 系列电机驱动器和开发板。代表产品 DM-J4310-2EC 把无刷电机、减速器、驱动器和双编码器集成在一起，走 CAN 总线，支持 MIT 模式（同时下发位置、速度、刚度、阻尼和前馈力矩）。它价格低、接线简单，常见于机器狗、机械臂、仿生机器人和机器人竞赛，也是很多开源人形、开源机械臂在小负载关节上的选择。","example":"不少开源双臂和小型人形的手腕、头部关节直接用 DM-J4310，通过 CAN 发 MIT 模式指令控制。","related":["达妙 DM-J4310 关节电机","关节模组(Joint Actuator Module)","MIT 模式(MIT Mode (MIT Cheetah-style Joint Motor Command))","CAN 总线(Controller Area Network / CAN with Flexible Data-Rate)","开源硬件(Open-source Hardware)"]},{"id":"robstride","category":"company","sec":8,"tier":3,"sources":[{"title":"RobStride 产品页","url":"https://www.robstride.com/products"}],"as_of":"2026-09","related_ids":["joint-actuator-module","quasi-direct-drive","mit-mode","xiaomi-cybergear-micro-motor","planetary-gearbox","controller-area-network"],"name":"灵足时代","alt":"RobStride","abbr":"","aliases":["RobStride Dynamics"],"one_liner":"中国机器人关节电机厂商，RS 系列一体化关节常用于四足和小型人形。","explanation":"灵足时代（RobStride Dynamics）是中国的机器人关节模组厂商，主打 RS00–RS06 系列一体化关节：把无刷电机、行星减速器、驱动器和编码器装进一个圆饼状模组，通过 CAN 总线接收指令，支持位置、速度、力矩控制和 MIT 模式（同时下发目标位置、速度、刚度、阻尼和前馈力矩）。这类「准直驱」关节减速比小、能反向拖动，适合强化学习运控直接输出关节目标，是四足、小型人形和桌面机械臂常见的动力来源。据报道其核心团队来自小米 CyberGear 微电机项目。成立年份、融资等信息未查到可靠来源，此处不写。","example":"","related":["关节模组","准直驱","MIT 模式","小米 CyberGear 微电机","行星减速器","CAN 总线"]},{"id":"robotis","category":"company","sec":8,"tier":3,"sources":[{"title":"로보티즈 - 위키백과","url":"https://ko.wikipedia.org/wiki/로보티즈"}],"as_of":"2025-08","related_ids":["robotis-dynamixel-servo","servo","turtlebot","koch-v1-1-arm","trossen-robotics-widowx-250","robot-operating-system-2"],"name":"ROBOTIS","alt":"ROBOTIS","abbr":"","aliases":["乐博士","로보티즈"],"one_liner":"做 DYNAMIXEL 舵机和 TurtleBot3 的韩国机器人公司，科研教育圈很常见。","explanation":"ROBOTIS 1999 年 3 月由金炳洙（Kim Byung-soo）创办，总部在韩国首尔，2018 年 10 月在 KOSDAQ 上市。最知名的产品是 DYNAMIXEL 智能舵机：电机、减速器、驱动和编码器集成在一个模块里，多个用一根总线串起来控制，Koch、GELLO、WidowX 等低成本机械臂和遥操作主臂都用它。公司还和 Open Robotics 合作推出 TurtleBot3 教学底盘，并做 OpenMANIPULATOR 机械臂、GAEMI 送货机器人、AI Worker 人形等产品。据韩文维基，公司 2025 年 6 月分拆自动驾驶机器人业务，8 月宣布约 1000 亿韩元增资。","example":"LeRobot 早期教程里的 Koch v1.1 机械臂就是用 Dynamixel XL430、XL330 舵机拼成的。","related":["Dynamixel 舵机","舵机","TurtleBot","Koch v1.1 机械臂","WidowX 250 机械臂","ROS 2"]},{"id":"seer-robotics","category":"company","sec":8,"tier":3,"sources":[{"title":"「机器人大脑」第一股诞生！仙工智能正式登陆港交所","url":"https://seer-robotics.ai/zh/media/333"},{"title":"仙工智能 06106 招股資訊（經濟通）","url":"https://www.etnet.com.hk/www/tc/stocks/ipo-info.php?code=06106"}],"as_of":"2026-06","related_ids":["autonomous-mobile-robot","robot-controller","mobile-manipulator","hkex-chapter-18c","automated-guided-vehicle"],"name":"仙工智能","alt":"SEER Robotics","abbr":"","aliases":["上海仙工智能科技股份有限公司","SEER"],"one_liner":"上海机器人控制器公司，控制器销量全球第一，2026 年港股上市","explanation":"仙工智能总部在上海，创始人兼 CEO 为赵越。核心产品是移动机器人的「大脑」——机器人控制器，即集成定位导航、运动控制和调度软件的控制单元，卖给集成商和本体厂，用在自主移动机器人（AMR）、无人叉车、复合机器人等设备上，公司也做整机和具身智能机器人。据招股资料，按 2025 年销量其机器人控制器全球和中国市占率分别约 24.8% 和 45.2%，均排第一。公司按港股 18C 章（特专科技公司规则）申请上市，2026 年 6 月 24 日在港交所主板挂牌，代码 06106，被称为「机器人大脑第一股」。","example":"工厂里的一台 AMR 可以用仙工的控制器完成建图、定位和路径规划，本体厂只需做底盘硬件。","related":["自主移动机器人","机器人控制器","复合机器人","港股 18C 章","自动导引车"]},{"id":"realsense","category":"company","sec":9,"tier":2,"sources":[{"title":"Intel let RealSense go. Now Cognex is paying $600 million to buy it (Calcalist, 2026-09)","url":"https://www.calcalistech.com/ctechnews/article/s1tqir19fl"},{"title":"Cognex to Acquire RealSense, Expanding Machine Vision Leadership into High-Growth Robotic Perception Market (Cognex, 2026-09)","url":"https://investor.cognex.com/news/news-details/2026/Cognex-to-Acquire-RealSense-Expanding-Machine-Vision-Leadership-into-High-Growth-Robotic-Perception-Market/default.aspx"},{"title":"RealSense Completes Spin Out from Intel, Raises $50 Million (Intel Capital, 2025-07)","url":"https://www.intelcapital.com/realsense-completes-spin-out-from-intel-raises-50-million-to-accelerate-ai-powered-vision-for-robotics-and-biometrics/"}],"as_of":"2026-09","related_ids":["realsense-depth-camera","intel-realsense-sdk-2-0","depth-camera","active-stereo","wrist-camera","orbbec"],"name":"RealSense","alt":"RealSense","abbr":"","aliases":["RealSense Inc.","Intel RealSense"],"one_liner":"英特尔分拆出的深度相机公司，D435、D405 是机器人实验室常见款。","explanation":"RealSense 起源于英特尔 2014 年启动的 3D 相机项目，2018 年推出的 D400 系列双目深度相机（D415、D435，后来又有 D435i、D405、D455 等）成了机器人实验室最常见的 RGB-D 相机（同时输出彩色图和深度图）。2025 年 7 月 11 日它从英特尔分拆独立，由前英特尔高管 Nadav Orbach 任 CEO，完成 5000 万美元 A 轮，英特尔资本、联发科创投等参投；总部在美国加州，据报道多数员工在以色列海法。公司称全球 60% 的自主移动机器人和人形机器人用它的深度相机。2026 年 9 月 22 日，机器视觉公司康耐视宣布以 5 亿美元现金收购它，另拿约 1 亿美元做员工留任和股票激励，预计第四季度完成交割。","example":"做桌面操作实验时，常把一台 D435 装在桌边当第三视角、一台 D405 装在夹爪旁当腕部相机，两路 RGB-D 图像一起输入策略。","related":["RealSense 深度相机（D435i / D405）","RealSense SDK","深度相机","主动双目","腕部相机","奥比中光"]},{"id":"orbbec","category":"company","sec":9,"tier":2,"sources":[{"title":"Orbbec - Wikipedia","url":"https://en.wikipedia.org/wiki/Orbbec"},{"title":"Orbbec unveils Gemini 330 series","url":"https://www.orbbec.com/news/orbbec-unveils-gemini-330-series-of-stereo-vision-3d-cameras-powered-by-latest-asic-for-outdoor-and-indoor-performance/"}],"as_of":"2025-11","related_ids":["orbbec-gemini-330-series","orbbec-femto-bolt",null,null,null,"realsense-depth-camera"],"name":"奥比中光","alt":"Orbbec","abbr":"","aliases":[],"one_liner":"深圳的 3D 视觉传感器公司，机器人常用深度相机供应商","explanation":"奥比中光 2013 年由黄源浩（Howard Huang，博士后研究出身）在深圳创立，美国密歇根也有团队，在上交所科创板上市，股票代码 688322。它做全套 3D 视觉传感器：结构光、iToF（间接飞行时间）、双目和激光雷达，并自研深度计算芯片。机器人领域最常见的是 Gemini 330 系列双目深度相机和与微软合作、兼容 Azure Kinect 的 Femto Bolt，前者接入了英伟达 Isaac Perceptor。据维基百科，2025 年它的视觉方案用在世界人形机器人运动会百米夺冠的天工 Ultra 上，前三季度实现盈利。","example":"实验室常把 Femto Bolt 固定在桌边当第三视角相机，采集点云训练操作策略。","related":["奥比中光 Gemini 330 系列","奥比中光 Femto Bolt","深度相机(Depth Camera (RGB-D Camera))","结构光(Structured Light)","飞行时间法(Time of Flight)","RealSense 深度相机（D435i / D405）"]},{"id":"paxini-tech","category":"company","sec":9,"tier":2,"sources":[{"title":"帕西尼获超10亿元B轮融资（证券时报）","url":"https://www.stcn.com/article/detail/3670368.html"},{"title":"独家对话帕西尼许晋诚（钛媒体）","url":"https://www.tmtpost.com/7966743.html"}],"as_of":"2026-03","related_ids":["tactile-sensor","paxini-tora-one","paxini-px-6ax","vision-tactile-language-action-model","tactile-data","dexterous-hand"],"name":"帕西尼感知","alt":"PaXini Tech","abbr":"","aliases":["帕西尼","PaXini","帕西尼感知科技"],"one_liner":"深圳触觉传感器公司，延伸到灵巧手、人形机器人和具身数据","explanation":"帕西尼感知科技 2021 年成立，总部深圳，创始人兼 CEO 许晋诚出自日本早稻田大学菅野实验室，长期做人形机器人和触觉传感器。它的核心是多维触觉传感器（如 PX-6AX 系列，能同时测压力和剪切力），在此基础上做了灵巧手 DexH13、人形机器人 TORA-ONE，建数据采集工厂产出带触觉的真机数据，并研发视觉-触觉-语言-动作模型 OmniVTLA 和世界模型 HyperCosmos。2025 年起密集融资，股东含京东、比亚迪等；2026 年 3 月完成超 10 亿元 B 轮，估值超 100 亿元。","example":"TORA-ONE 人形机器人手上装的就是帕西尼自家的多维触觉传感器。","related":["触觉传感器","帕西尼 TORA-ONE","帕西尼 PX-6AX 多维触觉传感器","视觉-触觉-语言-动作模型","触觉数据","灵巧手"]},{"id":"tashan-technology","category":"company","sec":9,"tier":3,"sources":[{"title":"他山科技完成数亿元B轮融资，全链路布局触觉感知产业（新浪财经，2026-07-10）","url":"https://finance.sina.com.cn/wm/2026-07-10/doc-inihispu3758074.shtml"},{"title":"清华、北航校友造触觉，横扫中国机器人市场半壁江山（智东西）","url":"https://m.zhidx.com/p/482791.html"},{"title":"他山科技一个季度内连续完成两轮融资（猎云网 / 东方财富）","url":"https://caifuhao.eastmoney.com/news/20251128170229122318000"}],"as_of":"2026-07","related_ids":["tactile-sensor","capacitive-tactile-sensing","electronic-skin","dexterous-hand","tactile-data","robomind"],"name":"他山科技","alt":"Tashan Technology","abbr":"","aliases":["北京他山科技","TASHAN"],"one_liner":"做机器人触觉芯片和触觉传感器的北京公司，国内人形机器人触觉主要供应商","explanation":"他山科技全称北京他山科技有限公司，2017 年由马扬（CEO）、孙滕谌和杨五强（CTO，清华精密仪器系博士、英国曼彻斯特大学教授）共同创办，团队有清华、北航背景。公司从触觉感知芯片做起，把能放进手指指尖的电容式触觉检测做成专用芯片（触感 MCU），再往上做触觉传感器、触觉数据和算法，给灵巧手、人形机器人提供「指尖触觉」。据报道它占国内人形机器人触觉传感器八成以上份额。融资上，2025 年 11 月宣布完成 A3、A4 两轮数亿元融资，2026 年 7 月又完成数亿元 B 轮，投资方有均胜电子、太平创新等；公司称 2026 年上半年订单量超过上年全年的四倍。","example":"RoboMIND 2.0 数据集的触觉增强片段里，法向力和切向力就是由他山的触觉传感器测得的。","related":["触觉传感器","电容式触觉传感","电子皮肤","灵巧手","触觉数据","RoboMIND 数据集"]},{"id":"daimon-robotics","category":"company","sec":9,"tier":3,"sources":[{"title":"戴盟机器人 关于我们","url":"https://www.dmrobot.com/about.html"},{"title":"戴盟机器人官网","url":"https://www.dmrobot.com/"}],"as_of":"2026-06","related_ids":["daimon-dm-tac-visuotactile-sensor","daimon-infinity",null,null,"gelsight"],"name":"戴盟机器人","alt":"Daimon Robotics","abbr":"","aliases":["戴盟"],"one_liner":"港科大孵化的深圳公司，做视触觉传感器和含触觉的具身数据","explanation":"戴盟机器人孵化于香港科技大学，核心团队 2017 年开始研究视触觉技术，2023 年正式运营，总部在深圳宝安，香港设研发中心；据报道联合创始人包括港科大教授王煜。视触觉传感器在弹性面后放小相机，拍接触面形变来推算接触形状和受力。产品有 DM-Tac 系列传感器（通用款 W2、尖头 X、指尖 F、夹爪 G），2025 年 4 月首代产品发布；另有边缘算力平台 DM-Flux 和遥操作采集系统。2026 年 4 月它联合多家机构发布含触觉的全模态数据集 Daimon-Infinity，6 月发布统一评测框架。","example":"DM-Tac W2 分辨率 384×288、采样 120Hz，可输出接触形貌、三维分布力和六维合力。","related":["戴盟 DM-Tac 视触觉传感器","戴盟 Daimon-Infinity 数据集","视触觉传感器(Vision-Based Tactile Sensor)","触觉数据(Tactile Data)","GelSight"]},{"id":"weitai-robotics","category":"company","sec":9,"tier":3,"sources":[{"title":"新京报：纬钛机器人完成近亿元天使轮及天使+轮融资","url":"https://m.bjnews.com.cn/detail/1744725950168547.html"},{"title":"观察者网：小米领投的纬钛机器人完成亿元融资","url":"https://www.guancha.cn/economy/2025_04_16_772456.shtml"}],"as_of":"2025-04","related_ids":["vision-based-tactile-sensor","gelsight","tactile-sensor","dexterous-hand","contact-rich-manipulation","robotic-assembly"],"name":"纬钛科技","alt":"Weitai Robotics","abbr":"","aliases":["纬钛机器人"],"one_liner":"上海视触觉传感器公司，创始人是 GelSight 指尖传感器的开发者之一","explanation":"公司对外多称纬钛机器人，2024 年 1 月成立，总部在上海。创始人李瑞在 MIT 读博时师从 Edward Adelson（GelSight 的发明人），参与开发了 GelSight 指尖传感器；核心团队来自 MIT 计算机科学与人工智能实验室。视触觉传感器的做法是在软胶表面下放一个小摄像头，拍下接触时胶面的形变，从图像里算出接触形状和受力。纬钛围绕这条路线做视触觉传感器、仿生指尖和灵巧手，重点是精密装配等需要手眼协同的场景。2025 年 4 月宣布完成近亿元天使轮及天使+ 轮融资，小米战投领投。","example":"机械臂插接插件时，指尖的视触觉传感器能看出接头有没有对歪，再微调位置。","related":["视触觉传感器","GelSight","触觉传感器","灵巧手","接触丰富操作","装配"]},{"id":"xense-robotics","category":"company","sec":9,"tier":3,"sources":[{"title":"千觉机器人宣布连续完成两轮数亿元战略融资（新浪科技）","url":"https://finance.sina.com.cn/tech/roll/2026-09-20/doc-inismrfk6918460.shtml"},{"title":"千觉机器人连续完成两轮数亿元战略融资（腾讯新闻）","url":"https://news.qq.com/rain/a/20260921A08QNP00"},{"title":"千觉机器人官网：完成天使轮融资","url":"https://xenserobotics.com/article/387/detail/6"}],"as_of":"2026-09","related_ids":["vision-based-tactile-sensor","tactile-sensor","tactile-simulation","tactile-data","dexterous-manipulation"],"name":"千觉机器人","alt":"Xense Robotics","abbr":"","aliases":["千觉","千觉机器人科技（上海）有限公司"],"one_liner":"上海的具身触觉公司，做视触觉传感器、触觉数据与触觉模型。","explanation":"千觉机器人 2024 年 5 月成立于上海，创始人马道林是上海交大教授、ICRA 2021 最佳论文得主，博士毕业于 MIT。公司主做视触觉传感器（用相机拍软胶形变来测接触力和纹理），有指尖型、夹爪型和穿戴式触觉数采夹爪，并配套 Xense Sim 触觉仿真、TacVerse 数据集和 X-TouchMind V1 触觉模型，想补上机器人精细操作缺的触觉。2025 年 10 月完成亿元级 Pre-A 轮（孚腾资本领投、理想汽车参投），2026 年 7 月再获亿元融资，9 月又宣布连续完成两轮数亿元战略融资，蓝驰创投、中金资本旗下基金等参投。","example":"把指尖型视触觉传感器装在夹爪上，抓鸡蛋时根据触觉图像判断是否打滑，再调整夹持力。","related":["视触觉传感器","触觉传感器","触觉仿真","触觉数据","灵巧操作"]},{"id":"xela-robotics","category":"company","sec":9,"tier":3,"sources":[{"title":"XELA Robotics: About","url":"https://xelarobotics.com/about"},{"title":"TOKYO UPDATES: Giving Robots a Human Sense of Touch","url":"https://www.tokyoupdates.metro.tokyo.lg.jp/en/post-1786"}],"as_of":"2026-09","related_ids":["uskin","magnetic-tactile-sensing","tactile-sensor","electronic-skin","slip-detection","allegro-hand"],"name":"XELA Robotics","alt":"XELA Robotics","abbr":"","aliases":["XELA"],"one_liner":"日本触觉传感器公司，产品 uSkin 能测压力和剪切力","explanation":"2018 年 8 月在东京成立，是早稻田大学的衍生公司，CEO Alexander Schmitz 研究触觉传感器十余年。主力产品 uSkin 是一种薄片状的磁性触觉传感器：每个触觉单元里有小磁体和磁场传感器，受力时磁体位移，就能同时测出按压力和切向的剪切力（三轴力）。它可以贴在灵巧手指尖、指腹和夹爪上，给机器人提供接触和滑动信息，配套软件 uAi 负责处理触觉数据。在研究中常见于 Allegro 灵巧手的触觉改装版本，用于抓取易碎物体、检测滑移等任务。","example":"给 Allegro 灵巧手的指尖和掌心贴满 uSkin，机器人拿鸡蛋时能感觉到快滑了就加一点力。","related":["uSkin","磁性触觉传感","触觉传感器","电子皮肤","滑移检测","Allegro 灵巧手"]},{"id":"ati-industrial-automation","category":"company","sec":9,"tier":3,"sources":[{"title":"Novanta acquiring ATI Industrial Automation for $172M (The Robot Report)","url":"https://www.therobotreport.com/novanta-acquiring-ati-industrial-automation-for-172m"},{"title":"Novanta Announces Agreement to Acquire ATI","url":"https://investors.novanta.com/news/news-details/2021/Novanta-Announces-Agreement-to-Acquire-ATI/default.aspx"}],"as_of":"2021-12","related_ids":["six-axis-force-torque-sensor","tool-changer","force-control","contact-rich-manipulation","end-effector"],"name":"ATI 工业自动化","alt":"ATI Industrial Automation","abbr":"ATI","aliases":[],"one_liner":"美国老牌六维力传感器和工具快换盘厂商","explanation":"ATI Industrial Automation 1989 年成立，总部在美国北卡罗来纳州 Apex，做的是装在机械臂末端的部件：六维力/力矩传感器（同时测三个方向的力和三个方向的力矩）、工具快换盘、碰撞保护器等，客户覆盖工业机器人和手术机器人。它的 Nano、Mini 系列六维力传感器在科研界很常见，许多接触丰富操作、力控和装配论文都用它测末端受力。2021 年，美国精密技术公司 Novanta 宣布以约 1.72 亿美元收购 ATI。","example":"做轴孔装配实验时，在机械臂法兰和夹爪之间装一个 ATI 六维力传感器，实时读取插入时的接触力。","related":["六维力传感器","工具快换盘","力控","接触丰富操作","末端执行器"]},{"id":"sunrise-instruments","category":"company","sec":9,"tier":3,"sources":[{"title":"关于我们 - 宇立仪器","url":"https://www.srisensor.com.cn/about.html"},{"title":"宇立仪器官网首页（产品）","url":"https://www.srisensor.com.cn"}],"as_of":"2026-08","related_ids":["six-axis-force-torque-sensor","joint-torque-sensor","force-control","kunwei-technology","ati-industrial-automation","domestic-substitution"],"name":"宇立仪器","alt":"Sunrise Instruments","abbr":"SRI","aliases":["南宁宇立仪器","SRI"],"one_liner":"国内老牌六维力传感器厂商，也做力控打磨和汽车测试设备","explanation":"宇立仪器（英文 Sunrise Instruments，简称 SRI）2007 年成立，在南宁和上海设有基地，另在美国密歇根、中国台湾和韩国有办公室。创始人 York Huang 博士毕业于美国韦恩州立大学，曾在福特汽车和碰撞假人厂商 Humanetics 任职。公司围绕「力测量和力控制」做三类产品：多轴力传感器（六轴力传感器、关节扭矩传感器等）、iGrinder 智能浮动力控打磨设备、汽车碰撞测试传感器。六维力传感器装在机械臂手腕或人形机器人腕部、脚踝，告诉控制器末端受了多大的力和力矩，是力控、装配和打磨的基础。人形机器人兴起后，它推出了超薄型号，行业报告常把它列为国产六维力传感器主要厂商之一。","example":"宇立的 M35XX 系列六维力传感器厚度只有 9.2 毫米，官方称适合装进人形机器人的手腕。","related":["六维力传感器","关节力矩传感器","力控","坤维科技","ATI 工业自动化","国产替代"]},{"id":"kunwei-technology","category":"company","sec":9,"tier":3,"sources":[{"title":"人民网：坤维科技B++超亿元轮融资落地","url":"http://finance.people.com.cn/n1/2026/0609/c1004-40736552.html"},{"title":"新浪财经：小米、高瓴联手，坤维科技完成B轮融资","url":"https://finance.sina.com.cn/jjxw/2025-02-10/doc-ineizeny3466088.shtml"},{"title":"坤维科技官网","url":"https://www.kunweitech.com"}],"as_of":"2026-06","related_ids":["six-axis-force-torque-sensor","joint-torque-sensor","keli-sensing-technology","sunrise-instruments","ati-industrial-automation","domestic-substitution"],"name":"坤维科技","alt":"Kunwei Technology","abbr":"","aliases":["常州坤维传感科技","坤维"],"one_liner":"常州的六维力传感器厂商，核心团队出自航天科研院所","explanation":"坤维科技全称常州坤维传感科技有限公司，2018 年成立，创始人熊琳，核心团队来自航天科研院所。它专做机器人用的六维力传感器，也有关节扭矩传感器、单轴力传感器、数据采集模块等，并作为主要起草单位制定了国家标准 GB/T 43199-2023《机器人多维力/力矩传感器检测规范》。面向人形机器人推出 HRS 系列，用于手腕、脚踝等空间小、冲击大的部位。2025 年 2 月完成小米、高瓴参与的 B 轮，2026 年 6 月完成华泰紫金、金融街资本领投的 B++ 轮超亿元融资。公司引用的 MIR 睿工业数据称，其在人形与协作机器人六维力传感器出货中占 53%。","example":"人形机器人脚踝装六维力传感器，可以测地面反作用力和压力中心，辅助平衡控制。","related":["六维力传感器","关节力矩传感器","柯力传感","宇立仪器","ATI 工业自动化","国产替代"]},{"id":"keli-sensing-technology","category":"company","sec":9,"tier":3,"sources":[{"title":"2026世界机器人大会展商信息：宁波柯力传感","url":"https://www.worldrobotconference.com/expo/company/528.html"},{"title":"中国仪器仪表行业协会：宁波柯力传感首次公开发行A股股票上市","url":"http://www.cima.org.cn/nnews.asp?vid=24912"}],"as_of":"2026-08","related_ids":["six-axis-force-torque-sensor","strain-gauge","kunwei-technology","sunrise-instruments","core-components","humanoid-robot-concept-stocks"],"name":"柯力传感","alt":"Keli Sensing Technology","abbr":"","aliases":["宁波柯力传感","柯力"],"one_liner":"宁波的称重传感器龙头，近年转向机器人六维力传感器","explanation":"宁波柯力传感科技股份有限公司成立于 1995 年，董事长柯建东，2019 年 8 月在上交所主板上市（603662）。它长期做称重用的应变式力学传感器和仪表，官方称是全球最大的钢制传感器制造企业之一，也做工业物联网系统。人形机器人兴起后，公司把机器人传感器定为产业战略，以六维力传感器为核心，同时布局触觉、IMU 等感知部件，董事长称已掌握结构解耦、算法解耦等关键技术。它是二级市场常说的人形机器人传感器概念股之一，2026 年参展世界机器人大会。","example":"机械臂手腕上装一个六维力传感器，就能在打磨、插孔时实时感知末端受力。","related":["六维力传感器","应变片","坤维科技","宇立仪器","核心零部件","人形机器人概念股"]},{"id":"stereolabs","category":"company","sec":9,"tier":3,"sources":[{"title":"Ouster Acquires StereoLabs（Ouster 投资者新闻，2026-02-09）","url":"https://investors.ouster.com/news-releases/news-release-details/ouster-acquires-stereolabs-creating-world-leading-physical-ai"},{"title":"Lidar-maker Ouster buys vision company StereoLabs（TechCrunch，2026-02-09）","url":"https://techcrunch.com/2026/02/09/lidar-maker-ouster-buys-vision-company-stereolabs-as-sensor-consolidation-continues"},{"title":"About Us | Stereolabs","url":"https://www.stereolabs.com/about"}],"as_of":"2026-02","related_ids":["stereolabs-zed","stereo-camera","depth-camera","stereo-matching","droid","open-television"],"name":"Stereolabs","alt":"Stereolabs","abbr":"","aliases":["StereoLabs","ZED"],"one_liner":"法国双目相机公司，ZED 系列相机的厂商，2026 年被 Ouster 收购","explanation":"Stereolabs 是 2010 年成立的法国 3D 视觉公司，联合创始人是 Cecile Schmollgruber、Edwin Azzam 和 Olivier Braun。主要产品是 ZED 系列双目相机：用两个镜头拍同一场景，靠立体匹配算出深度，不主动投光，所以室外阳光下也能用；配套 ZED SDK 提供深度图、点云、定位和目标检测，并有 ROS 2 驱动。官方称已出货 9 万多台 ZED 相机、客户超过 1 万家。在具身智能里，ZED 常作头部或第三视角相机，也用于遥操作回传立体画面。2026 年 2 月，激光雷达厂商 Ouster 以 3500 万美元现金加 180 万股股票收购 Stereolabs，它成为 Ouster 的全资子公司，原创始人继续带队。","example":"DROID 数据集的每个采集站都配两台 ZED 2 作第三视角相机，手腕上再装一台 ZED Mini。","related":["ZED 双目相机","双目相机","深度相机","立体匹配","DROID 数据集","Open-TeleVision"]},{"id":"percipio","category":"company","sec":9,"tier":3,"sources":[{"title":"关于图漾 - 图漾科技官网","url":"http://www.percipio.xyz/about/about-percipio"},{"title":"图漾科技 项目信息 - 36氪","url":"https://pitchhub.36kr.com/project/1678358612997129"}],"as_of":"2023-07","related_ids":["depth-camera","structured-light","time-of-flight","orbbec","mech-mind-robotics","palletizing-depalletizing"],"name":"图漾科技","alt":"Percipio","abbr":"","aliases":["图漾","Percipio.XYZ","上海图漾信息科技"],"one_liner":"上海 3D 工业相机厂商，给机器人和物流设备提供深度相机","explanation":"图漾科技（上海图漾信息科技有限公司）2015 年 6 月成立，总部上海，创始人费浙平毕业于复旦大学电子工程系。公司做 3D 工业相机（能输出深度图的相机）及配套软件，产品线覆盖 ToF（飞行时间测距）、散斑结构光和条纹结构光三类，用于工业自动化、物流、移动机器人等场景，走「只卖相机、不做整机」的零部件模式。融资上，2021 年 B+ 轮有顺为资本参与，2023 年先后完成 C 轮和 C+ 轮。在具身智能里，它属于上游感知零部件供应商，和奥比中光、梅卡曼德是同一赛道。","example":"仓库里的拆垛机器人用图漾的结构光相机拍出纸箱深度图，再算抓取位置。","related":["深度相机","结构光","飞行时间法","奥比中光","梅卡曼德","码垛 / 拆垛"]},{"id":"mech-mind-robotics","category":"company","sec":9,"tier":3,"sources":[{"title":"Mech-Mind Robotics（Wikipedia）","url":"https://en.wikipedia.org/wiki/Mech-Mind_Robotics"},{"title":"梅卡曼德機器人 09615 招股資訊（經濟通）","url":"https://www.etnet.com.hk/www/tc/stocks/ipo-info.php?code=09615"},{"title":"機器人腦企業梅卡曼德登港股（BigGo 財經）","url":"https://finance.biggo.com.tw/news/2f65c7bc-350e-4140-934a-affd91f87866"}],"as_of":"2026-09","related_ids":["3d-vision-guided-robotics","bin-picking","palletizing-depalletizing","structured-light","hkex-chapter-18c","machine-vision"],"name":"梅卡曼德","alt":"Mech-Mind Robotics","abbr":"","aliases":["Mech-Mind","梅卡曼德机器人"],"one_liner":"北京的工业 3D 视觉与机器人智能公司，Mech-Eye 相机知名","explanation":"梅卡曼德 2016 年在北京成立，创始人兼 CEO 邵天兰。它不造机器人本体，而是给机械臂提供「眼-脑-手」部件：Mech-Eye 工业 3D 相机负责感知，Mech-Vision、Mech-Viz 等软件和多模态大模型 Mech-GPT 负责识别与规划，另有 Mech-Hand 灵巧手。典型应用是 3D 视觉引导的无序抓取、混箱拆码垛和上下料，客户多是汽车、制造和物流企业，产品销往约 50 个国家和地区。投资方包括 IDG、启明创投、英特尔资本、美团等；2026 年 9 月 1 日在港交所上市，发行价 101.7 港元。","example":"物流中心用 Mech-Eye 相机拍下一托混装纸箱，软件逐个识别箱子位置后引导机械臂用吸盘拆垛。","related":["3D 视觉引导","无序抓取","码垛 / 拆垛","结构光","港股 18C 章","机器视觉（工业视觉）"]},{"id":"lyte","category":"company","sec":9,"tier":3,"sources":[{"title":"Lyte raises $165M to help robots better sense their surroundings（The Robot Report）","url":"https://www.therobotreport.com/lyte-raises-165m-help-robots-better-sense-their-surroundings"},{"title":"Lyte Emerges from Stealth with $107M（The AI Insider, 2026-01-06）","url":"https://theaiinsider.tech/2026/01/06/lyte-emerges-from-stealth-with-107m-to-build-the-perception-foundation-for-physical-ai"},{"title":"Lyte, founded by Apple's Face ID engineers, raises $165M at $1.6B（Tech Funding News）","url":"https://techfundingnews.com/lyte-founded-by-apples-face-id-engineers-raises-165m-at-1-6b-to-build-robot-perception"}],"as_of":"2026-09","related_ids":["multi-sensor-fusion","depth-camera","lidar","exteroception","physical-ai"],"name":"Lyte","alt":"Lyte","abbr":"","aliases":["Lyte AI"],"one_liner":"苹果 Face ID 团队创办的美国机器人感知公司","explanation":"Lyte 2021 年在美国加州硅谷成立，创始人 Alexander Shpunt、Arman Hajati、Yuval Gerson 曾在苹果做 Face ID，团队也有做过微软 Kinect 深度相机的 PrimeSense 背景。它做机器人的感知底座：把自研芯片、多模态传感器和空间理解软件做成一体化平台 LyteVision，让机器人厂商不必自己拼相机、雷达和算法。2026 年 1 月它带着 A、B 轮合计 1.07 亿美元走出隐身，获 CES 2026 机器人类最佳创新奖；9 月完成 Maverick Silicon 领投的 1.65 亿美元 C 轮，投后估值 16 亿美元，已向巡检、物流、制造客户出货。","example":"一家巡检机器人公司直接装上 LyteVision 模组，拿到融合好的深度和障碍物信息做导航，省去自己标定、融合多种传感器。","related":["多传感器融合","深度相机","激光雷达","外部感知","物理AI"]},{"id":"hesai-technology","category":"company","sec":9,"tier":3,"sources":[{"title":"Hesai Group - Wikipedia","url":"https://en.wikipedia.org/wiki/Hesai_Group"},{"title":"禾赛 JT128 产品页","url":"https://www.hesaitech.com/product/jt128/"}],"as_of":"2025-11","related_ids":["hesai-jt128","lidar","robosense","livox","point-cloud","autonomous-driving"],"name":"禾赛科技","alt":"Hesai Technology","abbr":"","aliases":["禾赛","Hesai Group"],"one_liner":"上海的激光雷达公司，汽车和机器人都在用它的雷达。","explanation":"禾赛科技 2014 年 10 月由李一帆（任 CEO）、孙恺、向少卿在上海创办，做激光雷达，也就是用激光测距、输出三维点云的传感器。主要客户是车企和自动驾驶公司，维基百科引述的数据称它占车载激光雷达市场约三成。2023 年 2 月在美国纳斯达克上市，2025 年 9 月又在港交所上市。机器人方向，它推出了 JT 系列等竖直视场很宽的小型雷达，用在具身智能机器人、配送和清洁机器人、AGV/AMR（自动导引车和自主移动机器人）上，负责建图定位和避障。据报道它 2025 年 11 月开始在泰国曼谷建首座海外工厂，计划 2026 年把年产能从 200 万台提到 400 万台。","example":"JT128 的竖直视场有 189°，装在机器人上能同时看到脚下和头顶，比传统旋转雷达的盲区小。","related":["禾赛 JT128","激光雷达","速腾聚创","览沃科技","点云","自动驾驶"]},{"id":"robosense","category":"company","sec":9,"tier":3,"sources":[{"title":"RoboSense - Wikipedia","url":"https://en.wikipedia.org/wiki/RoboSense"}],"as_of":"2026-09","related_ids":["lidar","robosense-airy","robosense-ac1","solid-state-lidar","hesai-technology","autonomous-driving"],"name":"速腾聚创","alt":"RoboSense","abbr":"","aliases":["RoboSense Technology","速腾"],"one_liner":"深圳激光雷达公司，港股上市，近年把车载雷达技术转向机器人传感。","explanation":"速腾聚创 2014 年 8 月在深圳成立，董事长邱纯鑫与朱晓蕊、刘乐天共同创办。激光雷达（LiDAR）是用激光测距、直接得到周围三维点云的传感器，速腾最初做机械旋转式雷达，后来量产车规级 M 系列和固态雷达，到 2024 年初被称为全球最大的车载激光雷达供应商，股东包括比亚迪、小米、菜鸟。公司 2024 年 1 月 5 日在港交所上市（代码 2498）。近两年它把重点扩展到机器人：推出半球视场的 Airy 激光雷达、集成深度与 RGB 的 AC1 主动相机等，并开源驱动和感知算法，面向四足、人形和移动机器人。","example":"四足或人形机器人头部装一颗 Airy，就能同时看到四周和脚下地面，用于建图和避障。","related":["激光雷达","速腾聚创 Airy","速腾聚创 AC1 主动相机","固态激光雷达","禾赛科技","自动驾驶"]},{"id":"livox","category":"company","sec":9,"tier":3,"sources":[{"title":"追觅旗下可庭科技 x 览沃达成战略合作（Livox 新闻，含公司简介）","url":"https://www.livoxtech.com/cn/news/dreame-and-livox-form-strategic-partnership"},{"title":"激光雷达在智能驾驶场景的破局之路（Livox 新闻）","url":"https://www.livoxtech.com/cn/news/10"},{"title":"Livox 览沃科技官网","url":"https://www.livoxtech.com/cn"}],"as_of":"2026-09","related_ids":["livox-mid-360","lidar","fast-lio2","simultaneous-localization-and-mapping","solid-state-lidar","dji"],"name":"览沃科技","alt":"Livox","abbr":"","aliases":["Livox","览沃","深圳市览沃科技有限公司"],"one_liner":"大疆内部孵化的激光雷达公司，Mid-360 是机器人常用款","explanation":"览沃科技（Livox）2016 年成立，总部深圳，官方称是基于大疆内部孵化机制成立的独立公司，专做 3D 激光雷达（发射激光测距、扫出周围点云的传感器）。它用旋镜式混合固态和非重复扫描方案压低成本，2019 年 1 月推出 Mid 系列，官方称已服务 1500 多家客户。对机器人圈最重要的是 Mid-360：水平 360° 视场、自带 IMU、重约 265 克，常装在四足、人形和无人机上跑 SLAM 和 FAST-LIO 这类激光惯性里程计。新品有千米级 Avia 2 和降价版 Mid-360S。","example":"Livox 官方案例里，无人机搭载 Mid-360 做自主导航，在树林等复杂环境中高速飞行避障。","related":["览沃 Mid-360","激光雷达","FAST-LIO / FAST-LIO2","同步定位与建图","固态激光雷达","大疆创新"]},{"id":"adaps-photonics","category":"company","sec":9,"tier":3,"sources":[{"title":"灵明光子 Adaps Photonics 官网","url":"https://www.adapsphotonics.com/"}],"as_of":"2026-09","related_ids":["single-photon-avalanche-diode","direct-time-of-flight","lidar","solid-state-lidar","depth-camera","vertical-cavity-surface-emitting-laser"],"name":"灵明光子","alt":"Adaps Photonics","abbr":"","aliases":["灵明光子科技"],"one_liner":"国产 SPAD 单光子感光芯片公司，做激光雷达和手机用的 dToF 测距芯片。","explanation":"2018 年成立的国产 3D 感知芯片公司，由海归博士团队创立，在深圳、杭州、上海张江和德清设有办公室。核心产品是 SPAD（单光子雪崩二极管，能对单个光子响应的感光器件）和基于它的 dToF（直接飞行时间，测光脉冲往返时间来算距离）芯片，包括面阵 dToF 芯片、多区散点深度传感器和 SiPM（硅光电倍增管），采用背照式 3D 堆叠，把感光层和计算电路叠在一起。产品用于车载激光雷达、手机和 XR 的对焦与深度感知，也面向机器人避障和 SLAM。","example":"固态激光雷达的接收端用灵明光子的面阵 SPAD dToF 芯片，配合 VCSEL 发射端测距。","related":["SPAD（单光子雪崩二极管）","直接飞行时间","激光雷达","固态激光雷达","深度相机","VCSEL（垂直腔面发射激光器）"]},{"id":"optitrack","category":"company","sec":9,"tier":3,"sources":[{"title":"About | OptiTrack","url":"https://www.optitrack.com/about"},{"title":"NaturalPoint 官网","url":"https://www.naturalpoint.com"}],"as_of":"","related_ids":["optical-motion-capture","motion-capture","vicon","ground-truth","motion-retargeting","xsens"],"name":"OptiTrack","alt":"OptiTrack (NaturalPoint)","abbr":"","aliases":["NaturalPoint"],"one_liner":"美国光学动作捕捉系统品牌，机器人实验室常用来测真值","explanation":"OptiTrack 是美国 NaturalPoint 公司旗下的光学动作捕捉品牌，总部在俄勒冈州科瓦利斯。公司早期做头部追踪产品 SmartNav、TrackIR，后来发展出多相机动捕系统：在场地四周架红外相机（如 PrimeX 系列），追踪贴在人或物体上的反光标记点，用 Motive 软件实时算出亚毫米级位置和姿态。在具身智能里，它主要用来给机器人、无人机或物体提供高精度位姿真值（可当作标准答案的测量值），也用来采集人体动作数据，再重定向到人形机器人上。它和 Vicon 是实验室里最常见的两家光学动捕。","example":"四足或无人机实验中，用 OptiTrack 测出的机体位姿当真值，评估状态估计算法误差。","related":["光学动捕","动作捕捉","Vicon","真值","动作重定向","Xsens"]},{"id":"vicon","category":"company","sec":9,"tier":3,"sources":[{"title":"Vicon: About Us","url":"https://www.vicon.com/about-us"},{"title":"Vicon: What Is Motion Capture","url":"https://www.vicon.com/about-us/what-is-motion-capture"}],"as_of":"2026-09","related_ids":["optical-motion-capture","motion-capture","optitrack","motion-retargeting","state-estimation","ground-truth"],"name":"Vicon","alt":"Vicon Motion Systems","abbr":"","aliases":["维康动捕"],"one_liner":"英国光学动作捕捉系统厂商，机器人实验室常用的位姿真值来源","explanation":"英国牛津的光学动作捕捉公司，属于上市公司 Oxford Metrics。最早的 Vicon 产品 1979 年由牛津仪器的子公司推出，1984 年管理层收购后独立经营。它的系统用多台红外相机环绕场地，追踪贴在人或物体上的反光标记点，实时算出毫米级精度的三维位置和姿态。除影视动画和运动生物力学外，机器人领域常用它来给四足机器人、无人机、机械臂提供外部位姿真值，用来评估状态估计误差，或采集人体动作再重定向给人形机器人。和 OptiTrack 是同类竞品，价格较高。","example":"训练四足机器人跑步时，用 Vicon 记录机身真实位置，和机器人自己估计的里程计对比，看漂移有多大。","related":["光学动捕","动作捕捉","OptiTrack","动作重定向","状态估计","真值"]},{"id":"xsens","category":"company","sec":9,"tier":3,"sources":[{"title":"Xsens - Wikipedia","url":"https://en.wikipedia.org/wiki/Xsens"}],"as_of":"2026-09","related_ids":["inertial-motion-capture","motion-capture","inertial-measurement-unit","motion-retargeting","whole-body-teleoperation","optitrack"],"name":"Xsens","alt":"Xsens (Movella)","abbr":"","aliases":["Movella"],"one_liner":"荷兰惯性动捕与 IMU 厂商，MVN 动捕服常用来采集人体动作。","explanation":"Xsens 2000 年由特文特大学毕业生 Casper Peeters 和 Per Slycke 在荷兰恩斯赫德创立，做基于 MEMS 惯性测量单元（IMU，测加速度和角速度的小芯片）的传感器和动作捕捉系统，代表产品是 MTi 系列 IMU 和 MVN 惯性动捕服。它几经易手，2017 年归 mCube，2021 年母公司改名 Movella，2023 年登陆纳斯达克、2024 年退市；据维基百科，2026 年又改回 Xsens 品牌。惯性动捕不用架设摄像头，穿上就能在任意场地记录全身关节运动，所以常被用来采集人体动作，再经动作重定向给人形机器人做遥操作或训练数据。","example":"操作员穿 MVN 动捕服做动作，全身关节角实时重定向到人形机器人上，完成全身遥操作。","related":["惯性动捕","动作捕捉","惯性测量单元","动作重定向","全身遥操作","OptiTrack"]},{"id":"noitom","category":"company","sec":9,"tier":3,"sources":[{"title":"诺亦腾 Noitom 官网","url":"https://www.noitom.com.cn"},{"title":"启明星｜诺亦腾机器人完成Pre-A+轮融资，启明创投领投","url":"https://www.qimingvc.com/cn/news/%E5%90%AF%E6%98%8E%E6%98%9F%EF%BD%9C%E8%AF%BA%E4%BA%A6%E8%85%BE%E6%9C%BA%E5%99%A8%E4%BA%BA%E5%AE%8C%E6%88%90pre-a%E8%BD%AE%E8%9E%8D%E8%B5%84%EF%BC%8C%E5%90%AF%E6%98%8E%E5%88%9B%E6%8A%95%E9%A2%86%E6%8A%95"}],"as_of":"2025-12","related_ids":["inertial-motion-capture","motion-capture","motion-retargeting","whole-body-teleoperation","embodied-ai-data-service-provider","xsens"],"name":"诺亦腾","alt":"Noitom","abbr":"","aliases":["诺亦腾科技","Noitom Ltd."],"one_liner":"北京动作捕捉公司，动捕设备用于机器人遥操作和人体动作数据采集。","explanation":"诺亦腾（Noitom）2012 年创立于北京，核心技术是惯性动作捕捉：人身上穿戴带惯性测量单元的传感器，实时解算全身姿态，不依赖外部摄像头；另有光学与惯性混合方案。产品有 Perception Neuron（PN）系列、PN Hybrid 等，最早用于影视游戏、VR、体育和医疗。具身智能兴起后，它的动捕设备被用来遥操作人形机器人，或采集人体动作再重定向到机器人上。联合创始人戴若犁另行创办诺亦腾机器人（Noitom Robotics），自称「不造机器人的机器人公司」，专做具身训练数据，2025 年 12 月完成启明创投领投的 Pre-A+ 轮，累计融资数亿元。","example":"数采员穿戴 PN 惯性动捕服，实时遥操作人形机器人并记录动作数据。","related":["惯性动捕","动作捕捉","动作重定向","全身遥操作","具身数据服务商（数据采集服务商）","Xsens"]},{"id":"manus","category":"company","sec":9,"tier":3,"sources":[{"title":"MANUS - About us","url":"https://www.manus-meta.com/about-us"},{"title":"MANUS To Attend IROS 2026（Humanoid Robotics Technology）","url":"https://humanoidroboticstechnology.com/industry-news/manus-to-attend-iros-2026"}],"as_of":"2026-09","related_ids":["data-glove","teleoperation","motion-retargeting","dexterous-hand","motion-capture","haptic-glove"],"name":"MANUS","alt":"MANUS","abbr":"","aliases":["Manus Meta","Manus VR","MANUS Technology Group"],"one_liner":"荷兰数据手套厂商，Metagloves 常用于灵巧操作采集和遥操作","explanation":"MANUS 是 2014 年成立的荷兰公司，总部在埃因霍温，早年做 VR 手套（旧称 Manus VR），后转向高精度手部动作捕捉。主要产品有 2022 年用电磁场追踪手指的 Quantum Metagloves、2024 年的 Metagloves Pro、2025 年带触觉反馈的 Metagloves Pro Haptic，以及可换模块的 MANUS Nexus 手套体系。官方称产品被 2000 多家机器人公司、AI 实验室和动捕工作室使用。具身智能里，它常配合 VR 头显遥操作灵巧手，把人手关节角重定向成机器人指令来采集数据。它和 AI 智能体产品 Manus 是两回事。","example":"字节 GR-Dexter 用 Meta Quest 头显加 Manus 数据手套做双手遥操作，为灵巧手采集训练数据。","related":["数据手套","遥操作","动作重定向","灵巧手","动作捕捉","力反馈手套"]},{"id":"qualcomm","category":"company","sec":9,"tier":3,"sources":[{"title":"Qualcomm - Wikipedia","url":"https://en.wikipedia.org/wiki/Qualcomm"},{"title":"Qualcomm Introduces a Full Suite of Robotics Technologies（Edge AI and Vision Alliance）","url":"https://www.edge-ai-vision.com/2026/01/qualcomm-introduces-a-full-suite-of-robotics-technologies-powering-physical-ai-from-household-robots-up-to-full-size-humanoids/"},{"title":"Qualcomm to Acquire PickNik to Advance the Future of Open Robotics and Physical AI（高通官网）","url":"https://www.qualcomm.com/news/releases/2026/09/qualcomm-to-acquire-picknik-to-advance-the-future-of-open-roboti"}],"as_of":"2026-09","related_ids":["qualcomm-dragonwing-iq10","nvidia-jetson-thor","nvidia-jetson","arduino-esp32-microcontroller-boards","moveit-motion-planning-framework","onboard-compute-platform"],"name":"高通","alt":"Qualcomm","abbr":"","aliases":["Qualcomm Technologies","高通公司"],"one_liner":"美国芯片巨头，推出跃龙机器人芯片，收购 Arduino 和 PickNik。","explanation":"高通 1985 年成立，总部在美国圣迭戈，由 Irwin Jacobs 等七位通信公司 Linkabit 的前员工创办，以 CDMA 技术和骁龙手机芯片闻名。机器人方面，它 2020 年推出 RB5 机器人开发平台，后把工业和嵌入式芯片归入跃龙（Dragonwing）品牌。2025 年 10 月收购开源硬件公司 Arduino，推出用自家芯片的 UNO Q 开发板；2026 年 1 月在 CES 发布面向全尺寸人形和工业 AMR 的跃龙 IQ10 处理器和整套机器人软硬件方案，称正和 Figure 一起设计其下一代人形机器人的计算平台，外界把它看作英伟达 Jetson Thor 的对手。2026 年 9 月又宣布收购维护 MoveIt 的 PickNik，承诺 MoveIt 继续开源。","example":"Arduino UNO Q 在一块板上同时跑 Linux 应用和实时控制程序，可给小型机器人做视觉识别加电机控制。","related":["高通跃龙 IQ10","Jetson Thor","英伟达 Jetson","Arduino / ESP32 开发板","MoveIt","主控"]},{"id":"advanced-micro-devices","category":"company","sec":9,"tier":3,"sources":[{"title":"AMD to Acquire World Labs to Advance the Future of AI Compute","url":"https://ir.amd.com/news-events/press-releases/detail/1299/amd-to-acquire-world-labs-to-advance-the-future-of-ai-compute"},{"title":"AMD - Wikipedia","url":"https://en.wikipedia.org/wiki/AMD"}],"as_of":"2026-09","related_ids":["world-labs","nvidia","cuda","spatial-intelligence","world-model"],"name":"AMD","alt":"Advanced Micro Devices","abbr":"AMD","aliases":["超威半导体","超威"],"one_liner":"美国芯片公司，做 CPU、GPU 和 AI 加速卡，2026 年宣布收购 World Labs。","explanation":"美国芯片公司，1969 年由杰里·桑德斯等人创办，总部加州圣克拉拉，现任董事长兼 CEO 苏姿丰。产品包括 Ryzen 和 EPYC 处理器、Radeon 显卡、Instinct 系列 AI 加速卡及开源软件栈 ROCm（对标英伟达 CUDA）；2022 年以约 500 亿美元收购 FPGA 厂商赛灵思，获得 Kria 等嵌入式视觉计算平台。与具身智能直接相关的是：2026 年 9 月 28 日 AMD 宣布以约 82 亿美元全股票收购李飞飞的 World Labs，李飞飞将任 AMD 执行副总裁兼首席科学家，交易预计 2026 年底前完成，是其继赛灵思之后第二大收购。","example":"AMD 宣布收购 World Labs 时表示，要把硬件、软件和开放模型打通成端到端的 AI 生态。","related":["World Labs","英伟达","CUDA","空间智能","世界模型"]},{"id":"horizon-robotics","category":"company","sec":9,"tier":3,"sources":[{"title":"Horizon Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Horizon_Robotics"},{"title":"HoloBrain-0 (arXiv 2602.12062)","url":"https://arxiv.org/abs/2602.12062"}],"as_of":"2026-02","related_ids":["holobrain-0","d-robotics","d-robotics-rdk-s100","horizon-robotics-openexplorer","autonomous-driving-talent-moving-into-embodied-ai","autonomous-driving"],"name":"地平线","alt":"Horizon Robotics","abbr":"","aliases":["地平线机器人"],"one_liner":"北京的智能驾驶芯片公司，也在做机器人芯片和 VLA 模型。","explanation":"地平线 2015 年 7 月在北京成立，创始人余凯此前在百度负责自动驾驶等研究。主业是智能驾驶芯片「征程」系列和配套算法，据报道 2023 年占中国自动驾驶芯片市场近一半；2024 年 10 月在港交所上市（代码 9660）。它和具身智能有两层关系：一是机器人计算平台业务已独立成地瓜机器人，推出 RDK S100 等机器人开发板；二是自己的团队 2026 年 2 月开源了 VLA 模型 HoloBrain-0，以及覆盖数据、训练、部署的工具链 RoboOrchard。它是「智驾转具身」这类玩家的代表。","example":"HoloBrain-0 把相机参数和机器人的 URDF 结构描述一起输入模型，用多种机械臂数据和人手视频预训练。","related":["地平线 HoloBrain-0","地瓜机器人","地瓜 RDK S100","地平线天工开物","智驾转具身","自动驾驶"]},{"id":"d-robotics","category":"company","sec":9,"tier":3,"sources":[{"title":"地瓜机器人开发者社区","url":"https://developer.d-robotics.cc/"},{"title":"D-Robotics 官网（英文）","url":"https://en.d-robotics.cc/"},{"title":"量子位：地瓜机器人发布 RDK S100","url":"https://www.qbitai.com/2025/06/292932.html"}],"as_of":"2026-09","related_ids":[null,"d-robotics-rdk-s100","togetheros-bot",null,null,null],"name":"地瓜机器人","alt":"D-Robotics","abbr":"","aliases":["地瓜"],"one_liner":"地平线孵化的机器人开发平台公司，做 RDK 系列开发板和机器人系统","explanation":"地瓜机器人由地平线（Horizon Robotics）的机器人业务独立而来，CEO 为王丛。它做「机器人开发基础设施」：RDK（机器人开发套件）系列开发板从 5 TOPS 的 RDK X3、10 TOPS 的 X5，到 80–128 TOPS 的 S100 和 560 TOPS 的 S600；软件有兼容 ROS 2 的 TogetheROS.Bot、RDK OS、开发环境 RDK Studio 和应用中心 NodeHub。RDK S100 于 2025 年 6 月发布，把跑模型的 BPU 和做实时电机控制的 MCU 放进同一颗芯片，对标英伟达 Jetson。它在学生、竞赛和国产人形机器人里用得较多，2026 年 9 月参加了 ROSCon 2026。","example":"用 RDK X5 跑 YOLO 做目标检测，再通过 TogetheROS.Bot 把结果发给 ROS 2 导航节点。","related":["地平线(Horizon Robotics)","地瓜 RDK S100","TogetheROS.Bot","英伟达 Jetson(NVIDIA Jetson)","端侧部署(On-Device / Edge Deployment)","ROS 2(Robot Operating System 2)"]},{"id":"stanford-artificial-intelligence-laboratory","category":"company","sec":10,"tier":1,"sources":[{"title":"About SAIL - Stanford AI Lab","url":"https://ai.stanford.edu/about/"}],"as_of":"2026-09","related_ids":["berkeley-artificial-intelligence-research","mobile-aloha","openvla","voxposer","behavior-1k","toyota-research-institute"],"name":"斯坦福人工智能实验室","alt":"Stanford Artificial Intelligence Laboratory","abbr":"SAIL","aliases":["Stanford AI Lab","斯坦福 AI 实验室"],"one_liner":"斯坦福大学的人工智能实验室，1963 年成立，也是机器人学习的重镇。","explanation":"SAIL 是斯坦福大学计算机系的人工智能实验室，1963 年由「人工智能」一词的提出者约翰·麦卡锡创办，现任主任是自然语言处理学者 Chris Manning，李飞飞、吴恩达等都是成员。研究覆盖机器学习、计算机视觉、自然语言处理和机器人。具身智能里不少常被引用的工作出自这里的团队，例如低成本移动双臂平台 Mobile ALOHA、开源 VLA 模型 OpenVLA（与伯克利、丰田研究院等合作）、用大模型生成 3D 价值地图的 VoxPoser、家务基准 BEHAVIOR-1K。","example":"Mobile ALOHA（2024）由斯坦福团队发布，用约 3.2 万美元的移动双臂平台，靠几十条示教学会炒虾、推椅子等家务。","related":["伯克利人工智能研究实验室","Mobile ALOHA","OpenVLA","VoxPoser","BEHAVIOR-1K","丰田研究院"]},{"id":"berkeley-artificial-intelligence-research","category":"company","sec":10,"tier":2,"sources":[{"title":"Welcome to the BAIR Blog","url":"https://bair.berkeley.edu/blog/2017/06/20/welcome/"},{"title":"Covariant (company) - Wikipedia","url":"https://en.wikipedia.org/wiki/Covariant_(company)"}],"as_of":"","related_ids":["physical-intelligence","covariant","octo","bridgedata-v2","hil-serl","dex-net-2-0"],"name":"伯克利人工智能研究实验室","alt":"Berkeley Artificial Intelligence Research","abbr":"BAIR","aliases":["Berkeley AI Research"],"one_liner":"加州大学伯克利分校的 AI 联合实验室，机器人学习重镇","explanation":"BAIR 把加州大学伯克利分校计算机视觉、机器学习、自然语言处理、规划和机器人方向的研究组聚在一起，2017 年开设 BAIR 博客对外发布成果。它是机器人学习领域产出最多的学术机构之一：Sergey Levine 组做了真机深度强化学习、BridgeData V2、Octo、SERL 和 HIL-SERL；Pieter Abbeel 组在模仿学习和强化学习上影响很大；Ken Goldberg 的 AUTOLAB 做了抓取网络 Dex-Net；Jitendra Malik 组做了腿足运控方法快速运动适应（RMA）。不少具身公司出自这里，例如 Covariant 由 Abbeel 和他的学生创办，Levine 是 Physical Intelligence 的联合创始人。","example":"开源通用机器人策略 Octo 由 BAIR 团队主导，在 Open X-Embodiment 数据上训练。","related":["Physical Intelligence","Covariant","Octo","BridgeData V2 数据集","HIL-SERL","Dex-Net"]},{"id":"cmu-robotics-institute","category":"company","sec":10,"tier":2,"sources":[{"title":"Robotics Institute - Wikipedia","url":"https://en.wikipedia.org/wiki/Robotics_Institute"}],"as_of":"","related_ids":["skild-ai","moravec-s-paradox","extreme-parkour","leap-hand","asap","autonomous-driving"],"name":"卡内基梅隆大学机器人研究所","alt":"CMU Robotics Institute","abbr":"CMU RI","aliases":["Carnegie Mellon Robotics Institute","CMU 机器人研究所"],"one_liner":"1979 年成立的全球首个机器人学术院系，位于匹兹堡","explanation":"卡内基梅隆大学机器人研究所 1979 年由 Raj Reddy 和 Angel Jordan 用西屋电气 300 万美元资助创办，是世界上第一个专门研究机器人的学术院系，1988 年开设全球首个机器人学博士项目。它早年以自动驾驶出名：Navlab 系列无人车，以及 2007 年赢得 DARPA 城市挑战赛的 Boss；提出「莫拉维克悖论」的 Hans Moravec 也出自这里。近年在具身智能上同样活跃，例如 Deepak Pathak 组的 Extreme Parkour 和 LEAP Hand、施冠亚组参与的人形全身控制工作 ASAP；Pathak 和 Abhinav Gupta 还创办了机器人基础模型公司 Skild AI。","example":"CMU 的自动驾驶车 Boss 在 2007 年 DARPA 城市挑战赛中用约 4 小时 20 分钟跑完 55 英里赛程夺冠。","related":["Skild AI","莫拉维克悖论","Extreme Parkour","LEAP Hand","ASAP","自动驾驶"]},{"id":"mit-computer-science-and-artificial-intelligence-laboratory","category":"company","sec":10,"tier":2,"sources":[{"title":"MIT Computer Science and Artificial Intelligence Laboratory - Wikipedia","url":"https://en.wikipedia.org/wiki/MIT_Computer_Science_and_Artificial_Intelligence_Laboratory"}],"as_of":"","related_ids":["drake","subsumption-architecture",null,"f3rm","heterogeneous-pre-trained-transformers","visual-dexterity"],"name":"MIT 计算机科学与人工智能实验室","alt":"MIT Computer Science and Artificial Intelligence Laboratory","abbr":"CSAIL","aliases":["MIT CSAIL"],"one_liner":"麻省理工最大的计算机与 AI 实验室，机器人研究重镇","explanation":"CSAIL 是麻省理工学院最大的校内实验室，2003 年 7 月 1 日由计算机科学实验室（LCS）和人工智能实验室（AI Lab）合并而成，位于剑桥市 Stata 中心，现任主任 Daniela Rus（2012 年起）。机器人是它的传统强项：前主任 Rodney Brooks 提出包容架构并联合创办 iRobot，波士顿动力创始人 Marc Raibert 也出自这里。今天的具身研究者常碰到它的成果：Russ Tedrake 组的 Drake 工具箱，Pulkit Agrawal 组的 Visual Dexterity、Decision Diffuser，以及 F3RM、异构预训练 Transformer（HPT）等。","example":"HPT 由 CSAIL 的 Lirui Wang、何恺明与 Meta FAIR 合作提出，用于在多种机器人数据上联合预训练。","related":["Drake","包容架构（行为式机器人）","波士顿动力(Boston Dynamics)","F3RM","异构预训练 Transformer","Visual Dexterity（视觉手内重定向）"]},{"id":"eth-zurich-robotic-systems-lab","category":"company","sec":10,"tier":2,"sources":[{"title":"ETH Zurich Robotic Systems Lab - People","url":"https://rsl.ethz.ch/the-lab/people.html"},{"title":"Wikipedia: ANYbotics","url":"https://en.wikipedia.org/wiki/ANYbotics"}],"as_of":"2026-09","related_ids":["anybotics",null,"legged-gym",null,null,null],"name":"苏黎世联邦理工机器人系统实验室","alt":"ETH Zurich Robotic Systems Lab","abbr":"RSL","aliases":["ETH RSL","Legged Robotics (ETH)"],"one_liner":"ETH 的足式机器人与强化学习运控重镇，ANYmal 的出处","explanation":"苏黎世联邦理工学院（ETH Zurich）机械与过程工程系下的实验室，由 Marco Hutter 教授领导，GitHub 账号叫 leggedrobotics。它以足式机器人闻名：四足机器人 ANYmal 在这里研发，2016 年孵化出公司 ANYbotics。实验室是「仿真里用强化学习训练、再迁移到真机」这条运控路线的开拓者之一，在 Science Robotics 上发表过执行器网络、教师-学生盲走、感知行走等一系列 ANYmal 工作，还开源了 legged_gym 和 rsl_rl 这两个被大量四足/人形项目沿用的训练代码库。Hutter 还参与领导 RAI 研究所（原波士顿动力 AI 研究所）的苏黎世分部，实验室校友创办了 Flexion 等公司。","example":"很多人形/四足强化学习项目直接 fork legged_gym，用 rsl_rl 里的 PPO 训练行走策略。","related":["ANYbotics","ANYmal 四足(ANYbotics ANYmal)","legged_gym","rsl_rl(RSL RL)","强化学习运控(RL-based Locomotion Control)","Flexion(Flexion Robotics)"]},{"id":"toyota-research-institute","category":"company","sec":10,"tier":2,"sources":[{"title":"Toyota Research Institute - Wikipedia","url":"https://en.wikipedia.org/wiki/Toyota_Research_Institute"},{"title":"TRI: AI-Powered Robot by Boston Dynamics and Toyota Research Institute","url":"https://tri.global/news/ai-powered-robot-boston-dynamics-and-toyota-research-institute-takes-key-step-towards-general"}],"as_of":"2025-08","related_ids":["large-behavior-model","diffusion-policy","boston-dynamics-atlas-2","boston-dynamics","openvla","prismatic-vlms"],"name":"丰田研究院","alt":"Toyota Research Institute","abbr":"TRI","aliases":["丰田研究所"],"one_liner":"丰田汽车在美国设立的 AI 与机器人研究机构，扩散策略和大行为模型的推动者。","explanation":"丰田汽车 2016 年在美国设立的研究机构，总部在加州洛斯阿尔托斯，另在马萨诸塞州剑桥设点，创始 CEO 是前 DARPA 官员、机器人学者吉尔·普拉特，丰田当时承诺五年投入 10 亿美元。方向包括自动驾驶、材料和机器人。机器人方面，TRI 参与提出的扩散策略（2023，与哥伦比亚大学等合作）让用扩散模型生成动作成为主流做法；之后主推大行为模型（用大量多任务示教训练的通用操作策略），2024 年 10 月与波士顿动力合作把它用到电动版 Atlas 上。它也参与了 OpenVLA 及其底座 Prismatic VLM。","example":"2025 年 TRI 与波士顿动力展示：用一个语言条件的大行为模型控制电动版 Atlas，连续完成多步骤的物品整理任务。","related":["大行为模型","扩散策略","波士顿动力 Atlas（电动版）","波士顿动力","OpenVLA","Prismatic VLM"]},{"id":"beijing-academy-of-artificial-intelligence","category":"company","sec":10,"tier":2,"sources":[{"title":"Beijing Academy of Artificial Intelligence - Wikipedia","url":"https://en.wikipedia.org/wiki/Beijing_Academy_of_Artificial_Intelligence"}],"as_of":"2026-01","related_ids":["robobrain","roboos","braincerebellum-architecture","xingyuanzhi-robotics","embodied-foundation-model","open-weight-model"],"name":"北京智源人工智能研究院","alt":"Beijing Academy of Artificial Intelligence","abbr":"BAAI","aliases":["智源研究院","智源"],"one_liner":"北京的非营利 AI 研究机构，做大模型和开源具身大脑 RoboBrain","explanation":"2018 年 11 月在北京成立的非营利人工智能研究机构，创始理事长张宏江曾任金山软件 CEO。智源早期以大模型出名：参数量 1.75 万亿的悟道 2.0、多模态模型 Emu3、被广泛用于检索的 BGE 向量模型等，大多开源。具身方向推出具身大脑模型 RoboBrain（1.0 版 2025 年 2 月发布，2.5 版 2026 年初开源）和跨本体多机协作框架 RoboOS，思路是由大脑模型做任务拆解、可供性和轨迹预测，再交给底层控制器或 VLA（视觉-语言-动作模型）执行，并孵化了具身公司星源智。2025 年 3 月被美国商务部列入实体清单。","example":"给 RoboBrain 一张桌面照片和指令「把杯子放到盘子左边」，它输出杯子上该抓的位置和移动轨迹点。","related":["智源 RoboBrain（具身大脑）","RoboOS","大脑-小脑架构（大小脑）","星源智","具身大模型","开放权重"]},{"id":"shanghai-artificial-intelligence-laboratory","category":"company","sec":10,"tier":2,"sources":[{"title":"上海人工智能实验室官网","url":"https://www.shlab.org.cn/"},{"title":"上海人工智能实验室 - 百度百科","url":"https://baike.baidu.com/item/上海人工智能实验室"}],"as_of":"2026-07","related_ids":["internvla","internvl","internutopia","interndata-a1","genmanip"],"name":"上海人工智能实验室","alt":"Shanghai Artificial Intelligence Laboratory","abbr":"Shanghai AI Lab","aliases":["上海 AI Lab","上海AI实验室"],"one_liner":"上海的新型 AI 科研机构，出品书生大模型和 InternVLA","explanation":"上海人工智能实验室是 2020 年 7 月在世界人工智能大会上揭牌的新型科研机构，汤晓鸥等学者参与了早期筹建，现任主任兼首席科学家为周伯文。它以开源著称：「书生」系列大模型（语言模型 InternLM、多模态模型 InternVL）、OpenMMLab 视觉算法库、OpenCompass 评测和 MinerU 文档解析等。具身方向由 InternRobotics 团队负责，开源了 InternVLA-M1/A1/N1 等 VLA 模型、InternUtopia 仿真平台和 InternData-A1 合成数据集。2026 年 7 月在世界人工智能大会上发布「书生·端砚」科学发现平台。","example":"InternVLA-A1 在合成数据 InternData-A1 和 AgiBot World 上预训练，可以直接下载微调。","related":["上海AI实验室 InternVLA 系列","InternVL（书生·万象）","InternUtopia","InternData-A1 数据集","GenManip"]},{"id":"tsinghua-university-institute-for-interdisciplinary-informat","category":"company","sec":10,"tier":2,"sources":[{"title":"IIIS Introduction - Tsinghua University","url":"https://iiis.tsinghua.edu.cn/en/About/Introduction.htm"}],"as_of":"2025-12","related_ids":["shanghai-qi-zhi-institute","robotera","galaxea-ai","spirit-ai","3d-diffusion-policy"],"name":"清华大学交叉信息研究院（清华叉院）","alt":"Tsinghua University Institute for Interdisciplinary Information Sciences","abbr":"IIIS","aliases":["清华叉院","叉院","Tsinghua IIIS"],"one_liner":"姚期智领导的清华研究院，国内具身智能人才和创业公司的集中地之一。","explanation":"清华大学交叉信息研究院 2011 年成立，由图灵奖得主姚期智领导；他 2005 年开办的计算机科学实验班「姚班」也归这里。研究和教学覆盖计算机科学、量子信息和人工智能。近几年它是国内具身智能的重要来源：院内多位年轻教师做机器人学习、强化学习和自动驾驶，发表了 3D 扩散策略（DP3）等工作；星动纪元、星海图、千寻智能等具身公司的创始团队里都有叉院教师。论文单位写 Tsinghua IIIS 指的就是这里。","example":"3D 扩散策略（DP3，2024）由清华叉院许华哲组与上海期智研究院等合作提出，用点云输入的扩散策略少量示教即可学会操作。","related":["上海期智研究院","星动纪元","星海图","千寻智能","3D 扩散策略"]},{"id":"beijing-humanoid-robot-innovation-center","category":"company","sec":10,"tier":2,"sources":[{"title":"北京人形机器人创新中心 关于我们","url":"https://www.x-humanoid.com/about.html"},{"title":"北京人形机器人创新中心官网","url":"https://www.x-humanoid.com/"}],"as_of":"2026-09","related_ids":["tiangong","huisi-kaiwu","pelican-vl","xr-1","robomind","humanoid-robot-half-marathon"],"name":"北京人形机器人创新中心","alt":"Beijing Humanoid Robot Innovation Center","abbr":"X-Humanoid","aliases":["北京人形","国家地方共建具身智能机器人创新中心","Beijing Innovation Center of Humanoid Robotics"],"one_liner":"北京的人形机器人公共平台公司，做天工机器人和开源具身模型","explanation":"2023 年 11 月在北京经济技术开发区（亦庄）成立的公司制创新中心，据报道由优必选、小米、京城机电和亦庄国资等共同出资；2024 年 10 月由工信部和北京市共同揭牌为「国家地方共建具身智能机器人创新中心」，自称国内首家具身智能软硬件全栈公司。它的定位是做行业共用的平台：硬件上是开放二次开发的人形机器人「天工」系列，天工 Ultra 在 2025 年 4 月北京亦庄人形机器人半程马拉松夺冠，目前已到天工 3.0；软件上有通用具身智能平台「慧思开物」、真机数据集 RoboMIND，以及 2025 年 11 月前后开源的具身大脑模型 Pelican-VL 和跨本体 VLA 模型 XR-1。","example":"天工 Ultra 以 2 小时 40 分 42 秒跑完 2025 年北京亦庄人形机器人半程马拉松，获得冠军。","related":["天工","慧思开物","北京人形 Pelican-VL","北京人形 XR-1","RoboMIND 数据集","人形机器人半程马拉松"]},{"id":"shanghai-qi-zhi-institute","category":"company","sec":10,"tier":3,"sources":[{"title":"人形机器人「小星」问世，期智研究院瞄准具身通用人工智能（解放日报）","url":"https://www.jfdaily.com/wx/detail.do?id=638686"},{"title":"上海期智研究院瞄准全球前五AI高地（上海交大新闻网转载）","url":"https://news.sjtu.edu.cn/mtjj/20210108/139743.html"},{"title":"姚期智建的4个研究院，成了VC疯抢的项目库（投中网）","url":"https://m.chinaventure.com.cn/news/80-20260914-393251.html"}],"as_of":"2026-09","related_ids":["robotera","tsinghua-university-institute-for-interdisciplinary-informat","embodied-agi","humanoid-robot","world-artificial-intelligence-conference"],"name":"上海期智研究院","alt":"Shanghai Qi Zhi Institute","abbr":"","aliases":["期智研究院"],"one_liner":"姚期智领衔的上海新型研发机构，孵化了星动纪元等具身公司","explanation":"上海期智研究院 2020 年成立，由图灵奖得主、清华大学交叉信息研究院院长姚期智院士领衔，位于上海徐汇西岸智慧谷的 AI Tower，是上海市支持的新型研发机构，方向覆盖人工智能与机器人等前沿领域。在具身智能上，它在 2023 年世界人工智能大会展示过自研人形机器人「小星」，姚期智当时提出人工智能的下一个重大挑战是「具身通用人工智能」。研究院与清华叉院共同孵化了人形机器人公司星动纪元（2023 年 8 月成立），创始人陈建宇是清华叉院助理教授、期智研究院首席研究员。","example":"星动纪元由清华叉院和上海期智研究院共同孵化，是期智研究院最知名的具身智能项目。","related":["星动纪元","清华大学交叉信息研究院（清华叉院）","具身通用智能","人形机器人","世界人工智能大会"]},{"id":"national-and-local-co-built-humanoid-robotics-innovation-cen","category":"company","sec":10,"tier":3,"sources":[{"title":"OpenLoong 开源社区","url":"https://www.openloong.org.cn/cn"},{"title":"国家地方共建人形机器人创新中心发布青龙","url":"https://www.leaderobot.com/news/4397"},{"title":"白虎-VTouch 发布报道","url":"https://news.qq.com/rain/a/20260126A04W2D00"}],"as_of":"2026-01","related_ids":[null,"baihu-vtouch-visuo-tactile-dataset","beijing-humanoid-robot-innovation-center",null,null],"name":"国家地方共建人形机器人创新中心（上海人形机器人创新中心）","alt":"National and Local Co-built Humanoid Robotics Innovation Center (Shanghai)","abbr":"","aliases":["上海人形机器人创新中心","人形机器人（上海）有限公司"],"one_liner":"上海的国家级人形机器人创新平台，做开源人形「青龙」","explanation":"这是由国家和上海地方共同支持建设的人形机器人创新平台，据报道于 2024 年组建，运营公司为人形机器人（上海）有限公司，首席科学家为江磊。它的定位是做行业公共平台而非单卖产品：2024 年 7 月 6 日在世界人工智能大会上发布全尺寸开源人形机器人「青龙」（身高 185 厘米、43 个主动自由度），同时运营由开放原子开源基金会孵化的 OpenLoong 开源社区，公开整机图纸、控制框架和全身动力学软件包，还推出青龙 Mini、「格物」仿真平台和「白虎」数据集。2026 年 1 月联合纬钛科技发布白虎-VTouch 视触觉数据集。","example":"高校团队可以从 OpenLoong 社区下载青龙的硬件设计和控制代码，复现或改装一台人形机器人。","related":["青龙(Qinglong (OpenLoong))","白虎-VTouch 视触觉数据集","北京人形机器人创新中心","开源硬件(Open-source Hardware)","人形机器人(Humanoid Robot)"]},{"id":"zhejiang-humanoid-robot-innovation-center","category":"company","sec":10,"tier":3,"sources":[{"title":"公司简介｜浙江人形机器人创新中心有限公司","url":"https://www.zj-humanoid.com/about"},{"title":"浙江人形机器人创新中心获4.5亿元Pre-A轮融资（经济参考网）","url":"http://jjckb.xinhuanet.com/20260123/db7e1207902344a0800570141d46eeb2/c.html"},{"title":"浙江人形机器人创新中心在宁波启动（科技部）","url":"https://www.most.gov.cn/dfkj/zj/zxdt/202404/t20240418_190373.html"}],"as_of":"2026-03","related_ids":["beijing-humanoid-robot-innovation-center","national-and-local-co-built-humanoid-robotics-innovation-cen","braincerebellum-architecture","wheeled-humanoid-robot","humanoid-robot"],"name":"浙江人形机器人创新中心","alt":"Zhejiang Humanoid Robot Innovation Center","abbr":"","aliases":["浙江人形机器人创新中心有限公司","人形中心"],"one_liner":"宁波市与浙大熊蓉团队共建的人形机器人研发公司，做领航者系列。","explanation":"浙江人形机器人创新中心 2023 年底成立，位于宁波海曙区，由宁波市政府与浙江大学智能系统与控制研究所熊蓉教授团队共建，2024 年 3 月 27 日正式启动。它重点研究人形机器人的「大小脑」（上层理解规划与下层运动控制）和整机：2024 年 3 月发布全尺寸 39 自由度样机领航者 1 号，8 月推出 41 自由度的领航者 2 号，现有产品包括 NAVIAI WA2 轮臂人形、WA1 等。它和北京、上海的人形创新中心类似，是地方推动的产业平台，同时以公司形式融资：2026 年 1 月完成 4.5 亿元 Pre-A 轮，中控技术、联想创投等参投；3 月与德国凯傲集团合作，在 LogiMAT 2026 展示物流方案。","example":"NAVIAI WA2 轮臂人形在物流展会上持续演示料箱抓取。","related":["北京人形机器人创新中心","国家地方共建人形机器人创新中心（上海人形机器人创新中心）","大脑-小脑架构（大小脑）","轮式人形机器人","人形机器人"]},{"id":"beijing-institute-for-general-artificial-intelligence","category":"company","sec":10,"tier":3,"sources":[{"title":"BIGAI 官网 About","url":"https://www.bigai.ai/about"},{"title":"Wikipedia: Beijing Institute for General Artificial Intelligence","url":"https://en.wikipedia.org/wiki/Beijing_Institute_for_General_Artificial_Intelligence"},{"title":"BIGAI 官网","url":"https://www.bigai.ai/"}],"as_of":"2026-07","related_ids":["leo",null,"beijing-academy-of-artificial-intelligence","pku-epic-lab","world-humanoid-robot-games"],"name":"北京通用人工智能研究院","alt":"Beijing Institute for General Artificial Intelligence","abbr":"BIGAI","aliases":["通研院"],"one_liner":"朱松纯领衔的北京新型研发机构，主攻通用人工智能与具身智能","explanation":"北京通用人工智能研究院成立于 2020 年，由北京市和科技部支持、与北京大学和清华大学合作，院长是朱松纯（1992 年赴美，在 UCLA 任教 18 年，2020 年回国）。它主张「小数据、大任务」路线，不以堆大模型为主，而强调推理和价值驱动。代表成果有：2024 年 1 月发布的虚拟智能体「通通」（同年 4 月升级 2.0）、评测通用智能的「通智测试」、3D 具身通才模型 LEO（ICML 2024）、2025 年 12 月开源的仿真训练平台 TongSIM，以及 TongAgents 智能体。它也做人形机器人运控，曾在世界人形机器人运动会上获奖。","example":"LEO 把第一人称图像、物体级 3D 点云和文字指令一起输入大语言模型，能在 3D 场景里问答、导航和操作。","related":["LEO（3D 具身通才智能体）","具身智能(Embodied AI)","北京智源人工智能研究院","北京大学 EPIC 实验室（王鹤组）","世界人形机器人运动会"]},{"id":"pku-epic-lab","category":"company","sec":10,"tier":3,"sources":[{"title":"PKU EPIC Lab 主页","url":"https://pku-epic.github.io/"}],"as_of":"2026-09","related_ids":["graspvla","navid","dexgraspnet","galbot-g1","syngrasp-1b","university-big-tech-autonomous-driving-founder-lineage"],"name":"北京大学 EPIC 实验室（王鹤组）","alt":"PKU Embodied Perception and InteraCtion Lab","abbr":"EPIC Lab","aliases":["王鹤组","北大 EPIC","PKU-EPIC"],"one_liner":"北大王鹤带领的具身感知与交互实验室，和银河通用关系紧密","explanation":"EPIC 实验室隶属北京大学前沿计算研究中心（CFCS），由王鹤带领，研究机器人在复杂 3D 环境里的感知和交互，方向包括灵巧抓取、视觉-语言-动作模型（VLA）、具身导航和 3D 物体感知。代表工作有大规模灵巧抓取数据集 DexGraspNet、灵巧抓取方法 UniDexGrasp、跨类别零件级操作 GAPartNet、视频导航模型 NaVid，以及和银河通用合作的抓取基础模型 GraspVLA。王鹤同时是银河通用的创始人，实验室成果常在银河通用的 Galbot 机器人上落地，属于「高校系」具身团队的典型。","example":"GraspVLA 先在十亿级合成抓取数据 SynGrasp-1B 上预训练，再部署到 Galbot 机器人上。","related":["银河通用 GraspVLA","NaVid","DexGraspNet 数据集","银河通用 Galbot G1","SynGrasp-1B 数据集","高校系 / 大厂系 / 智驾系"]},{"id":"sjtu-mvig-lab","category":"company","sec":10,"tier":3,"sources":[{"title":"MVIG 实验室主页","url":"https://www.mvig.org/"},{"title":"GraspNet 项目主页","url":"https://graspnet.net/"},{"title":"上海交大新跑出一家具身智能公司「穹彻智能」（雷峰网）","url":"https://m.leiphone.com/category/ai/IPEN8fseWTn7UvjV.html"}],"as_of":"2026-09","related_ids":["graspnet-1billion","anygrasp","rh20t","airexo","oakink","noematrix"],"name":"上海交通大学 MVIG 实验室（卢策吾组）","alt":"SJTU Machine Vision and Intelligence Group","abbr":"MVIG","aliases":["卢策吾组","卢策吾团队","交大 MVIG"],"one_liner":"上海交大卢策吾教授的实验室，国内较早做机器人操作数据和抓取的团队","explanation":"MVIG 是上海交通大学卢策吾教授领导的机器视觉与智能实验室，早期做人体姿态和行为理解，开源过人体姿态估计工具 AlphaPose，后来转向具身智能和机器人操作。它的思路是让机器人从大量人类活动视频和演示里学通用行为。实验室在具身方向的代表工作多是数据集和基础工具：抓取基准 GraspNet-1Billion 和抓取感知系统 AnyGrasp、真实机器人操作数据集 RH20T、手-物交互数据集 OakInk、双臂外骨骼 AirExo，以及力感知策略 FoAR、RDP 等。卢策吾 2023 年创办了具身智能公司穹彻智能，把实验室的一部分成果做成产品。读具身论文时，常会看到这些数据集和工具被当作基准或采集手段。","example":"很多抓取论文直接调用 AnyGrasp SDK：输入深度相机的点云，就能得到场景里一批打好分的夹爪抓取位姿。","related":["GraspNet-1Billion 数据集","AnyGrasp","RH20T 数据集","AirExo 外骨骼","OakInk 数据集","穹彻智能"]},{"id":"opendrivelab","category":"company","sec":10,"tier":3,"sources":[{"title":"OpenDriveLab 官网","url":"https://opendrivelab.com/"}],"as_of":"2026-07","related_ids":["uniad","agibot-world","agibot","end-to-end","autonomous-driving-talent-moving-into-embodied-ai"],"name":"香港大学 OpenDriveLab","alt":"OpenDriveLab (The University of Hong Kong)","abbr":"","aliases":["OpenDriveLab","李弘扬组"],"one_liner":"李弘扬领导的港大实验室，做端到端自动驾驶和具身智能","explanation":"OpenDriveLab 2021 年成立，现属香港大学，由李弘扬带领，在香港和上海都有团队。它先以自动驾驶出名：UniAD 把感知、预测、规划放进一个端到端网络（从传感器输入直接到规划输出），获 CVPR 2023 最佳论文。之后转向具身智能，和智元机器人合作发布大规模真机操作数据集 AgiBot World（IROS 2025 最佳论文提名），也做人形机器人控制和长程操作。2026 年 2 月宣布与宇树、诺亦腾、强脑科技建立合作。对新人来说，它是「智驾转具身」路线的代表性学术团队之一。","example":"UniAD（CVPR 2023 最佳论文）和 AgiBot World 数据集都出自这个实验室。","related":["UniAD（规划导向的端到端自动驾驶）","AgiBot World 数据集","智元机器人","端到端","智驾转具身"]},{"id":"allen-institute-for-ai","category":"company","sec":10,"tier":3,"sources":[{"title":"MolmoAct 2: An open foundation for robots that work in the real world (Ai2)","url":"https://allenai.org/blog/molmoact2"},{"title":"Ai2 releases MolmoAct 2 (SiliconANGLE)","url":"https://siliconangle.com/2026/05/05/ai2-releases-molmoact-2-enhancing-robot-intelligence-real-world"}],"as_of":"2026-05","related_ids":["molmoact","molmo","ai2-thor","procthor","molmospaces","open-weight-model"],"name":"艾伦人工智能研究所","alt":"Allen Institute for AI","abbr":"Ai2","aliases":["AI2"],"one_liner":"美国非营利 AI 研究所，以全开源模型和具身仿真著称","explanation":"Ai2 由微软联合创始人保罗·艾伦于 2014 年创办，总部在美国西雅图，是非营利研究机构，现任 CEO 为 Ali Farhadi。它的特点是连权重、训练数据和代码一起开源，代表作有语言模型 OLMo、视觉语言模型 Molmo。具身方向上，它做了 AI2-THOR、ProcTHOR、Holodeck 等室内仿真环境；2025 年发布能在空间中推理的动作模型 MolmoAct，2026 年 5 月发布 MolmoAct 2，并开源代码、接入 LeRobot。想从开源 VLA 入门的同学，常会用到它的模型和仿真器。","example":"MolmoAct 2 发布后几周内下载量超 40 万次，并提供 LeRobot 集成。","related":["MolmoAct","Molmo","AI2-THOR","ProcTHOR","MolmoSpaces","开放权重"]},{"id":"robotics-and-ai-institute","category":"company","sec":10,"tier":3,"sources":[{"title":"RAI Institute - About","url":"https://rai-inst.com/about/"},{"title":"RAI Institute 官网首页","url":"https://rai-inst.com/"}],"as_of":"2026-05","related_ids":["boston-dynamics","hyundai-motor-group","rl-based-locomotion-control","dexterous-manipulation","boston-dynamics-spot","eth-zurich-robotic-systems-lab"],"name":"RAI 研究所（机器人与人工智能研究所）","alt":"Robotics and AI Institute (formerly Boston Dynamics AI Institute)","abbr":"RAI Institute","aliases":["RAI 研究所","Boston Dynamics AI Institute","The AI Institute"],"one_liner":"波士顿动力创始人 Raibert 领导、现代汽车出资的机器人基础研究机构。","explanation":"RAI 研究所前身是 2022 年由现代汽车集团与波士顿动力发起的 Boston Dynamics AI Institute，据报道首期投入超过 4 亿美元，后改为现名。执行主任是波士顿动力创始人 Marc Raibert，主园区在美国麻省剑桥，另在瑞士苏黎世设有办公室。它不以卖产品为目标，专做机器人和 AI 的长期基础研究，官网列出的方向是灵巧操作、面向控制的学习方法、数据驱动的 AI 模型、复杂环境导航和机器人伦理。它和波士顿动力在强化学习运控上有合作。2026 年 5 月官网发布了用机载视觉和多指手完成抛接杂耍的研究演示。","example":"","related":["波士顿动力","现代汽车集团","强化学习运控","灵巧操作","波士顿动力 Spot","苏黎世联邦理工机器人系统实验室"]},{"id":"dlr-institute-of-robotics-and-mechatronics","category":"company","sec":10,"tier":3,"sources":[{"title":"DLR: History of the institute","url":"https://www.dlr.de/en/rm/about-us/institute/history"},{"title":"ROBOTS Guide: Rollin' Justin","url":"https://robotsguide.com/robots/justin"}],"as_of":"2022","related_ids":["kuka-lbr-iiwa","impedance-control","joint-torque-sensor","collaborative-robot","dexterous-hand","kuka"],"name":"德国宇航中心机器人与机电研究所","alt":"DLR Institute of Robotics and Mechatronics","abbr":"DLR RMC","aliases":["DLR-RM","DLR 机器人与机电中心","Robotics and Mechatronics Center"],"one_liner":"德国宇航中心下属机器人研究所，做出了轻量机械臂和 Justin 人形","explanation":"这是德国宇航中心（DLR）下属的研究所，位于慕尼黑附近的 Oberpfaffenhofen，2012 年起由 Alin Albu-Schäffer 任所长，是欧洲最有影响力的机器人研究机构之一。它从太空遥操作起家，1993 年的 ROTEX 是德国首个太空机器人实验。它最大的贡献是带力矩传感、可做阻抗控制（让关节像弹簧一样柔顺）的轻量机械臂：1995 年推出第一代 LBR，2004 年把 LBR III 授权给库卡，后来发展成商用的 LBR iiwa。它还研制了 DLR 灵巧手和双臂人形 Justin（2006 年，2008 年加轮式底盘成为 Rollin' Justin），近年做卫星维护机器人和月面探索试验。","example":"工业界常用的协作臂库卡 LBR iiwa，技术源头就是这里的第三代轻量机械臂 LBR III。","related":["库卡 LBR iiwa","阻抗控制","关节力矩传感器","协作机器人","灵巧手","库卡"]},{"id":"florida-institute-for-human-and-machine-cognition","category":"company","sec":10,"tier":3,"sources":[{"title":"Wikipedia: Florida Institute for Human and Machine Cognition","url":"https://en.wikipedia.org/wiki/Florida_Institute_for_Human_and_Machine_Cognition"},{"title":"IHMC Robotics","url":"https://robots.ihmc.us/"}],"as_of":"2016","related_ids":[null,null,null,null,null],"name":"IHMC（美国人机认知研究所）","alt":"Florida Institute for Human and Machine Cognition","abbr":"IHMC","aliases":["佛罗里达人机认知研究所"],"one_liner":"美国佛罗里达的非营利研究所，人形机器人行走控制强队","explanation":"1990 年由 Kenneth Ford 等人在西佛罗里达大学校园内创立，总部在佛罗里达州彭萨科拉，是隶属佛州州立大学系统的非营利研究所，研究人工智能、机器人、外骨骼和人类表现。机器人方面最出名的是双足行走与全身控制：在 DARPA 机器人挑战赛中，IHMC 用波士顿动力的液压 Atlas 先赢得虚拟赛第一，2015 年决赛获第二名。团队长期开源其人形全身控制与行走软件，用于 Atlas、NASA Valkyrie 等平台，也研究截瘫患者用的助行外骨骼，2016 年参加了首届 Cybathlon。","example":"DARPA 机器人挑战赛决赛里，IHMC 的 Atlas 摔倒受损后仍完成任务、拿到第二名。","related":["DARPA 机器人挑战赛(DARPA Robotics Challenge (DRC))","液压版 Atlas(Boston Dynamics Atlas (Hydraulic))","NASA Valkyrie 人形机器人(NASA Valkyrie (R5))","全身控制(Whole-Body Control)","外骨骼(Exoskeleton)"]},{"id":"disney-research","category":"company","sec":10,"tier":3,"sources":[{"title":"Nvidia and Google DeepMind will help power Disney's cute robots（TechCrunch）","url":"https://techcrunch.com/2025/03/18/nvidia-and-google-deepmind-will-help-power-disneys-cute-robots/"},{"title":"NVIDIA GTC: Walt Disney Imagineering's Olaf Robotic Character（Disney Experiences）","url":"https://disneyexperiences.com/nvidia-gtc-olaf-robotic-character/"},{"title":"Olaf: Bringing an Animated Character to Life in the Physical World（Disney Research）","url":"https://la.disneyresearch.com/publication/olaf-bringing-an-animated-character-to-life-in-the-physical-world/"}],"as_of":"2026-03","related_ids":["disney-research-bdx-droid","newton-physics-engine","rl-based-locomotion-control","sim-to-real-transfer","nvidia-gtc"],"name":"迪士尼研究院","alt":"Disney Research","abbr":"","aliases":["迪士尼研究","DisneyResearch|Studios"],"one_liner":"华特迪士尼的研发部门，用强化学习把动画角色做成实体机器人。","explanation":"迪士尼研究院是华特迪士尼公司 2008 年成立的研发机构，研究图形、视觉、机器学习和机器人。现分两支：苏黎世的 DisneyResearch|Studios 由 ETH 图形学教授 Markus Gross 主持，服务电影制作；做机器人的一支归华特迪士尼幻想工程（Imagineering），在洛杉矶和苏黎世都有团队。机器人组由苏黎世的 Moritz Bächer 带领，专做「角色机器人」：动画师先设计带性格的动作，再在仿真里用强化学习训练控制策略，让实体机器人既像角色又不摔倒。代表作是星战风双足 BDX 机器人（2025 年 3 月登上英伟达 GTC 主题演讲）和雪宝 Olaf（2026 年 3 月在 GTC 与黄仁勋同台，3 月 29 日起在巴黎迪士尼乐园的船上表演）。它还和英伟达、谷歌 DeepMind 联合发起开源物理引擎 Newton。","example":"Olaf 把两条腿藏在泡沫「裙子」下；训练策略时把电机温度也作为输入，避免细脖子里的小电机过热。","related":["迪士尼 BDX 机器人","Newton 物理引擎","强化学习运控","仿真到现实迁移","英伟达 GTC 大会"]},{"id":"honda-motor-co-ltd","category":"company","sec":11,"tier":2,"sources":[{"title":"Honda P2 Humanoid Bipedal Robot Recognized as IEEE Milestone (Honda, 2026-04)","url":"https://global.honda/en/topics/2026/c_2026-04-28aeng.html"},{"title":"Honda Avatar Robot | Honda Technology","url":"https://global.honda/en/tech/Avatar_robot/"},{"title":"Honda Robotics Returns: The Dexterous Hand After ASIMO (Intelligent Living, 2026-08)","url":"https://www.intelligentliving.co/honda-robotics-dexterous-hand-asimo/"}],"as_of":"2026-08","related_ids":["honda-asimo","zero-moment-point","bipedal-locomotion","hrp-humanoid-robot-series","dexterous-hand","teleoperation"],"name":"本田","alt":"Honda Motor Co., Ltd.","abbr":"","aliases":["本田技研工业","Honda"],"one_liner":"日本车企，造出 ASIMO，是双足人形机器人研究的先驱。","explanation":"本田技研工业 1948 年由本田宗一郎创立，总部东京，以摩托车和汽车闻名。它 1986 年开始研究双足机器人，1996 年公开的原型机 P2 自带电源、能稳定走斜坡和上下楼梯，2026 年 4 月被评为 IEEE 里程碑；2000 年推出的 ASIMO 靠零力矩点等基于模型的平衡控制行走和奔跑，是深度学习兴起前人形机器人的标杆。2003 年本田在日本、美国、德国设立本田研究所（HRI），做前沿 AI 和机器人研究。ASIMO 2022 年 3 月退役前后，本田转向更实用的方向：2021 年公布远程操作的「化身机器人」，2026 年 5 月在东京展示 16 自由度多指灵巧手，据报道计划 2030 年代初用于工厂装配。","example":"本田的化身机器人由人在远处遥控，机械手靠 AI 推测操作者想抓什么并自动调整姿态和力度，目标是灾害现场、设备维修这类人不便到场的工作。","related":["本田 ASIMO","零力矩点","双足行走","HRP 系列人形机器人","灵巧手","遥操作"]},{"id":"willow-garage","category":"company","sec":11,"tier":3,"sources":[{"title":"ROBOTS Guide: PR2","url":"https://robotsguide.com/robots/pr2"},{"title":"Clearpath Robotics: Clearpath Welcomes PR2 to the Family","url":"https://clearpathrobotics.com/blog/2014/01/clearpath-welcomes-pr2"}],"as_of":"2014-01","related_ids":["robot-operating-system","willow-garage-pr2","open-robotics","opencv","point-cloud-library","mobile-manipulation"],"name":"Willow Garage","alt":"Willow Garage","abbr":"","aliases":["柳树车库"],"one_liner":"孵化了 ROS 和 PR2 的美国机器人研究公司，2014 年关闭","explanation":"2006 年底由谷歌早期工程师 Scott Hassan 出资创办，位于美国加州门洛帕克。他资助了斯坦福研究者 Keenan Wyrobek、Eric Berger 的 PR1 项目，在此基础上开发了开源机器人软件框架 ROS 和双臂移动机器人 PR2，并把 PR2 送给多所高校，让大家在同一平台上共享代码。Willow Garage 还资助了 OpenCV 和点云库 PCL 的发展。2012 年开源机器人基金会（OSRF）成立，2013 年起接手 ROS 的维护；2014 年公司停止运营，PR2 的售后交给 Clearpath Robotics。今天 ROS 仍是机器人行业最常用的软件框架，这是它留下的最大遗产。","example":"","related":["机器人操作系统","PR2","开源机器人基金会（Open Robotics）","OpenCV","点云库","移动操作"]},{"id":"open-robotics","category":"company","sec":11,"tier":3,"sources":[{"title":"Open Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Open_Robotics"}],"as_of":"2024-04","related_ids":["robot-operating-system","robot-operating-system-2","gazebo","willow-garage","intrinsic","fleet-management-system"],"name":"Open Robotics / 开源机器人基金会","alt":"Open Robotics (Open Source Robotics Foundation)","abbr":"OSRF","aliases":["开源机器人基金会","Open Source Robotics Foundation","Open Robotics"],"one_liner":"维护 ROS、Gazebo 等开源机器人软件的美国非营利组织","explanation":"开源机器人基金会（OSRF）2012 年从机器人实验室 Willow Garage 分出成立，总部在美国加州山景城，对外常用「Open Robotics」这个名字。它负责维护机器人操作系统 ROS（机器人软件最常用的通信与工具框架）、仿真器 Gazebo 和多机调度框架 Open-RMF。2022 年 12 月，谷歌母公司 Alphabet 旗下的 Intrinsic 收购了它的营利子公司 OSRC，基金会本身仍独立运作；2024 年 4 月又成立开源机器人联盟 OSRA，用会员制来长期资助 ROS 等项目。新人装 ROS 2、查文档、看发行版计划，最后都会落到它维护的网站和仓库上。","example":"每个 ROS 2 发行版（如 Humble、Jazzy）的发布计划和官方文档都由 OSRF 牵头维护。","related":["机器人操作系统","ROS 2","Gazebo","Willow Garage","Intrinsic","多机调度系统"]},{"id":"rethink-robotics","category":"company","sec":11,"tier":3,"sources":[{"title":"Rethink Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Rethink_Robotics"}],"as_of":"2025","related_ids":["rethink-robotics-baxter","rethink-robotics-sawyer","collaborative-robot","kinesthetic-teaching","series-elastic-actuator"],"name":"Rethink Robotics","alt":"Rethink Robotics","abbr":"","aliases":["Heartland Robotics"],"one_liner":"做出 Baxter、Sawyer 的协作机器人先驱，几经关停重启后已停止运营。","explanation":"Rethink Robotics 2008 年以 Heartland Robotics 之名在波士顿成立，创始人是 iRobot 联合创始人、MIT 教授 Rodney Brooks 和 Ann Whittaker。它 2012 年推出双臂机器人 Baxter、2015 年推出单臂 Sawyer，主打低价、可拖动示教、碰到人会「软」的协作机器人，也因研究版流行成为 2010 年代机器人学习实验室的常用平台。商业上销量不及预期，2018 年 10 月停止运营并出售资产，德国 HAHN 集团买下专利、商标和 Intera 软件继续卖 Sawyer。HAHN 旗下的 Rethink Robotics GmbH 2024 年 8 月关闭，同年 9 月新公司重启并推出新品，但 2025 年又停止运营。","example":"Meta-World 仿真基准里的机械臂模型就是 Sawyer。","related":["Baxter 双臂机器人","Sawyer 机械臂","协作机器人","拖动示教","串联弹性驱动器"]},{"id":"everyday-robots","category":"company","sec":11,"tier":3,"sources":[{"title":"X, the moonshot factory: Everyday Robots","url":"https://x.company/projects/everyday-robots/"}],"as_of":"2023-01","related_ids":[null,null,"rt-1","saycan",null],"name":"Everyday Robots","alt":"Everyday Robots (Alphabet X)","abbr":"","aliases":["Everyday Robot Project","谷歌 X 日常机器人项目"],"one_liner":"谷歌母公司 Alphabet 旗下 X 实验室的通用机器人项目，2023 年关闭","explanation":"Alphabet 旗下「登月工厂」X 孵化的通用机器人项目，目标是让机器人在家庭、办公室这类非结构化环境里自己学会各种任务，而不是逐条编程。团队自研了一款轮式单臂移动操作机器人，曾在谷歌办公室里批量部署，用来擦桌子、分拣垃圾、开门，并在云端仿真里大规模训练。它最大的影响在学术上：和谷歌研究院合作的 SayCan、RT-1 等工作都用这批机器人采数据和做实验，RT-1 数据后来并入 Open X-Embodiment。2023 年初 Alphabet 裁员时项目结束，部分人员和技术并入谷歌的机器人研究（后归入 Google DeepMind）。","example":"RT-1 论文里 13 台机器人、约 13 万条演示数据，就是在 Everyday Robots 的移动机械臂上采集的。","related":["Everyday Robots 移动机械臂(Everyday Robots Mobile Manipulator)","谷歌 DeepMind(Google DeepMind)","RT-1","SayCan","Open X-Embodiment 数据集(Open X-Embodiment)"]},{"id":"hanson-robotics","category":"company","sec":11,"tier":3,"sources":[{"title":"Hanson Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Hanson_Robotics"},{"title":"David Hanson (robotics designer) - Wikipedia","url":"https://en.wikipedia.org/wiki/David_Hanson_(robotics_designer)"},{"title":"Meet Grace, the healthcare robot COVID-19 created（China Daily HK）","url":"https://www.chinadailyhk.com/hk/article/222857"},{"title":"Awakening Health Launches Humanoid Robot Healthcare Assistant Named Grace（Voicebot.ai）","url":"https://voicebot.ai/2020/11/12/awakening-health-launches-humanoid-robot-healthcare-assistant-named-grace/"}],"as_of":"2021-06","related_ids":["sophia","hyper-realistic-humanoid-robot","uncanny-valley","human-robot-interaction","engineered-arts-ameca","companion-robot"],"name":"汉森机器人","alt":"Hanson Robotics","abbr":"","aliases":["Hanson Robotics Limited","汉森机器人技术公司"],"one_liner":"香港仿真人脸人形机器人公司，Sophia（索菲亚）的制造者。","explanation":"汉森机器人由美国机器人设计师 David Hanson 在达拉斯创办（成立年份有 2003、2007 年两种说法），2013 年迁到香港科学园，总部至今在香港。Hanson 本科学电影动画，博士毕业于得州大学达拉斯分校，还在迪士尼幻想工程做过雕塑师和材料研究员。公司主攻仿真人脸：头部蒙一层自研仿皮肤弹性材料 Frubber，底下用电机拉动做表情。代表作有 2016 年亮相的 Sophia，以及与韩国 KAIST 合作、给 HUBO 人形装上爱因斯坦头像的 Albert HUBO。它还与 SingularityNET 分拆出的 Singularity Studio 合资成立 Awakening Health，2020 年 11 月发布基于 Sophia 平台的护理机器人 Grace。它的机器人以表情和对话展示为主，行走和操作能力很弱，常被批评夸大 AI 能力。","example":"护理机器人 Grace 胸口装有热成像相机，能给老人测体温，并用英语、普通话和粤语交流。","related":["Sophia（索菲亚）机器人","超仿生人形机器人","恐怖谷","人机交互","Ameca 表情人形","陪伴机器人"]},{"id":"cloudminds","category":"company","sec":11,"tier":3,"sources":[{"title":"Wikipedia: CloudMinds","url":"https://en.wikipedia.org/wiki/CloudMinds"},{"title":"维基百科：达闼科技","url":"https://zh.wikipedia.org/wiki/达闼科技"},{"title":"维基百科：黄晓庆","url":"https://zh.wikipedia.org/wiki/黄晓庆"}],"as_of":"2020-07","related_ids":[null,null,null,null,null],"name":"达闼科技","alt":"CloudMinds","abbr":"","aliases":["达闼","达闼机器人"],"one_liner":"较早提出「云端机器人」的中国公司，把机器人大脑放在云上","explanation":"达闼科技 2015 年 3 月由黄晓庆创办，他曾任中国移动研究院院长、UT 斯达康高级副总裁兼 CTO；公司为北京和美国加州双总部。它的核心主张是「云端大脑」：机器人本体只负责感知和执行，识别、决策放到云端，通过安全专网连接，并在 AI 算不准时由人远程介入。投资方包括软银、富士康等。2019 年它向美国证监会提交纽交所上市申请，2020 年 5 月被列入美国实体清单，同年 7 月撤回上市申请，据报道因此损失约四分之三订单。在国内具身智能热潮之前，它是云端机器人和服务机器人方向的代表公司之一。","example":"","related":["云边端协同(Cloud-Edge-Device Collaboration)","服务机器人(Service Robot)","远程接管（人工兜底）(Remote Teleoperation Takeover (Human Fallback))","人形机器人(Humanoid Robot)","软银集团(SoftBank Group)"]},{"id":"k-scale-labs","category":"company","sec":11,"tier":3,"sources":[{"title":"Humanoids Daily: K-Scale Labs Cancels K-Bot Orders, Open-Sources All IP","url":"https://www.humanoidsdaily.com/news/k-scale-labs-cancels-k-bot-orders-open-sources-all-ip-after-funding-fails"},{"title":"Mike Kalil: K-Scale Labs Disrupts Silicon Valley with Open-Source Humanoids","url":"https://mikekalil.com/blog/kscale-labs"},{"title":"The Robot Report: 6 lessons I learned watching a robotics startup die","url":"https://www.therobotreport.com/6-lessons-learned-watching-a-robotics-startup-die-from-the-inside"}],"as_of":"2025-11","related_ids":["humanoid-robot","open-source-hardware","small-size-humanoid-robot","mujoco","jax","mass-production"],"name":"K-Scale Labs","alt":"K-Scale Labs","abbr":"","aliases":["K-Scale"],"one_liner":"做低价开源人形机器人的美国创业公司，2025 年 11 月停止运营","explanation":"K-Scale Labs 由 Benjamin Bolte 于 2024 年在美国帕洛阿尔托创办，获 Y Combinator 支持；Bolte 此前在 Meta FAIR 和特斯拉 Autopilot 团队工作。公司想做普通开发者买得起、能自己改的开源人形机器人：约 1.4 米的 K-Bot 面向开发者定价约 9000 美元，46 厘米的桌面人形 Z-Bot 约 999 美元，还开源了基于 MuJoCo 和 JAX 的强化学习训练库 ksim 与推理导出工具 kinfer。2025 年 11 月 4 日，Bolte 致信客户称融资未果，取消全部 K-Bot 预订并退款，裁撤大部分员工，并把全部设计以开源许可证公开。它常被用来讨论开源硬件路线与量产资金门槛。","example":"K-Bot 的零件设计成能用 256×256 mm 打印平台的 3D 打印机制造，物料成本据称低于 1 万美元。","related":["人形机器人","开源硬件","小尺寸人形机器人","MuJoCo","JAX","量产"]},{"id":"defense-advanced-research-projects-agency","category":"company","sec":11,"tier":3,"sources":[{"title":"Wikipedia: DARPA Robotics Challenge","url":"https://en.wikipedia.org/wiki/DARPA_Robotics_Challenge"},{"title":"NASA JPL: NASA Robots Compete in DARPA's Subterranean Challenge Final","url":"https://www.jpl.nasa.gov/news/nasa-robots-compete-in-darpas-subterranean-challenge-final"},{"title":"Open Robotics: SubT Part 1 Introduction","url":"https://www.openrobotics.org/blog/2022/2/3/open-robotics-and-the-darpa-subterranean-challenge"}],"as_of":"2026-09","related_ids":["darpa-robotics-challenge","boston-dynamics-atlas","florida-institute-for-human-and-machine-cognition","autonomous-driving","boston-dynamics","anybotics-anymal"],"name":"DARPA（美国国防高级研究计划局）","alt":"Defense Advanced Research Projects Agency","abbr":"DARPA","aliases":["美国国防部高级研究计划局","ARPA"],"one_liner":"美国国防部的前沿科研资助机构，办过多场推动机器人和无人车的挑战赛","explanation":"DARPA 是美国国防部下属的科研资助机构，1958 年以 ARPA 之名成立，总部在弗吉尼亚州阿灵顿。它自己不做研究，而是出题、出钱，让大学和公司去攻关，互联网前身 ARPANET 就出自这里。在机器人领域，它最出名的是一系列奖金挑战赛：2004–2007 年的无人车挑战赛直接催生了后来的自动驾驶产业；2012–2015 年的 DARPA 机器人挑战赛（DRC）要求人形机器人在模拟灾难现场开车、开门、关阀门，并出资让波士顿动力造了液压版 Atlas 供参赛队使用；2018–2021 年的地下挑战赛（SubT）比拼多机器人在无 GPS 的隧道、洞穴里自主探索。据报道，其 Triage 挑战赛（机器人辅助伤员分诊）决赛定于 2026 年 11 月。","example":"2015 年 DRC 决赛中，韩国 KAIST 的 DRC-HUBO 夺冠，IHMC 驾驶 Atlas 获第二，大量人形机器人摔倒的画面让外界看到当时技术的局限。","related":["DARPA 机器人挑战赛","液压版 Atlas","IHMC（美国人机认知研究所）","自动驾驶","波士顿动力","ANYmal 四足"]},{"id":"national-ai-industry-investment-fund","category":"company","sec":11,"tier":3,"sources":[{"title":"600亿国家人工智能基金将开展投资布局（证券时报）","url":"https://stcn.com/article/detail/1653447.html"},{"title":"600亿，国家级AI基金登场（36氪）","url":"https://m.36kr.com/p/3249409418879235"}],"as_of":"2025-04","related_ids":["patient-capital","ai-plus-initiative","new-quality-productive-forces","funding-rounds-and-valuation","embodied-ai-bubble"],"name":"国家人工智能产业投资基金","alt":"National AI Industry Investment Fund","abbr":"","aliases":["国家人工智能基金","国家AI基金"],"one_liner":"工信部、财政部牵头设立、规模 600.6 亿元的国家级 AI 产业基金。","explanation":"国家人工智能产业投资基金于 2025 年 1 月 17 日设立，由工业和信息化部、财政部牵头，总规模 600.6 亿元人民币，存续期 13 年，注册在上海徐汇。据工商信息，主要出资方是国家集成电路产业投资基金三期（俗称大基金三期）和国智投（上海）私募基金管理有限公司。它以股权投资方式覆盖算力、算法、数据和赋能应用等 AI 全产业链，原则是「适度投早、投小、投前沿」。2025 年 4 月，基金方面在深交所的具身智能座谈会上表示高度重视具身智能，会结合产业进展开展投资。它是国资「耐心资本」进入具身赛道的代表之一。","example":"2025 年 4 月在深交所具身智能产业化座谈会上，基金筹备组表态将布局具身智能。","related":["耐心资本（国资长线投资）","人工智能+ 行动","新质生产力","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）","具身智能泡沫"]},{"id":"ieee-robotics-and-automation-society","category":"company","sec":11,"tier":3,"sources":[{"title":"About RAS - IEEE Robotics and Automation Society","url":"https://www.ieee-ras.org/about-ras"}],"as_of":"","related_ids":["ieee-international-conference-on-robotics-and-automation","ieee-rsj-international-conference-on-intelligent-robots-and","ieee-t-ro-ijrr-ra-l","ieee-ras-international-conference-on-humanoid-robots","top-tier-conferences-and-journals"],"name":"IEEE 机器人与自动化学会","alt":"IEEE Robotics and Automation Society","abbr":"IEEE RAS","aliases":["RAS"],"one_liner":"IEEE 下属的机器人学术组织，主办 ICRA 等会议和 T-RO 等期刊。","explanation":"IEEE 机器人与自动化学会（IEEE RAS）是电气电子工程师学会（IEEE）下专管机器人与自动化的专业学会。前身是 1984 年成立的 IEEE 机器人与自动化委员会，1987 年升格为学会。它主办机器人领域规模最大的会议 ICRA（1984 年首届在亚特兰大举办），联合主办 IROS，还主办 CASE、Humanoids 等会议；旗下期刊有 IEEE T-RO、RA-L、T-ASE 和 RA Magazine。新人投稿、查文献时碰到的 IEEE 机器人会议和期刊，大多由它主办。","example":"不少具身智能论文先投期刊 RA-L，录用后再选择到 ICRA 或 IROS 上做报告。","related":["ICRA","IROS","T-RO / IJRR / RA-L（机器人期刊）","Humanoids 会议","顶会 / 顶刊（CCF-A）"]},{"id":"international-federation-of-robotics","category":"company","sec":11,"tier":3,"sources":[{"title":"IFR International Federation of Robotics","url":"https://ifr.org/"},{"title":"IFR Press Releases","url":"https://ifr.org/ifr-press-releases"}],"as_of":"2026-09","related_ids":["robot-density","industrial-robot","service-robot","big-four-of-industrial-robotics","ieee-robotics-and-automation-society"],"name":"国际机器人联合会","alt":"International Federation of Robotics","abbr":"IFR","aliases":["IFR"],"one_liner":"全球机器人行业组织，每年发布《World Robotics》统计报告。","explanation":"国际机器人联合会（IFR）1987 年成立，总部在德国法兰克福，成员包括各国机器人协会、研究机构和机器人厂商。它最为人熟知的是每年发布的《World Robotics》报告，统计全球工业机器人和服务机器人的年装机量、在役存量，以及机器人密度（每万名制造业工人对应的机器人数）。媒体和研报里引用的全球或各国装机数字，大多出自这份报告。2026 年 9 月 24 日发布的《World Robotics 2026》称，全球工厂在役工业机器人已达约 500 万台，2025 年新装超过 60 万台，同比增长 11%。","example":"研报比较各国机器人密度排名时，出处通常就是 IFR 的年度统计。","related":["机器人密度","工业机器人","服务机器人","工业机器人四大家族","IEEE 机器人与自动化学会"]},{"id":"upstream-midstream-downstream-of-the-industry-chain","category":"industry","sec":0,"tier":1,"sources":[{"title":"新华网：一文了解人形机器人产业链（2025-11-21）","url":"http://www.news.cn/finance/20251121/1a2e6771a8154e358805eb857ce4b8b7/c.html"},{"title":"Supply chain - Wikipedia","url":"https://en.wikipedia.org/wiki/Supply_chain"}],"as_of":"","related_ids":["core-components","robot-body-maker","scenario-owner","system-integrator","domestic-substitution","per-unit-content-value"],"name":"产业链上中下游","alt":"Upstream / Midstream / Downstream of the Industry Chain","abbr":"","aliases":["上游零部件","中游本体","下游应用"],"one_liner":"按生产顺序把行业分成零部件、整机、应用三段的说法。","explanation":"在具身智能和人形机器人行业里，上游指核心零部件和基础软硬件，如减速器、电机、丝杠、传感器、芯片、灵巧手；中游指本体厂商，把零部件集成成整机并配上控制和模型；下游指应用场景和客户，如汽车工厂、物流、商用服务、科研教育。券商研报、政策文件和投资新闻常按这三段分析利润在哪、哪里被「卡脖子」。对新人来说，这个框架能帮你快速定位一家公司：做关节模组的偏上游，造整机的是中游，给工厂等客户做场景方案集成和运营服务的偏下游。","example":"绿的谐波生产谐波减速器，属上游；优必选造 Walker S 系列人形整机，属中游；采购人形机器人进厂的车企属下游。","related":["核心零部件","本体厂商","场景方","系统集成商","国产替代","单机价值量"]},{"id":"robot-body-maker","category":"industry","sec":0,"tier":1,"sources":[{"title":"Original equipment manufacturer - Wikipedia","url":"https://en.wikipedia.org/wiki/Original_equipment_manufacturer"},{"title":"Unitree Robotics 官网","url":"https://www.unitree.com/"}],"as_of":"","related_ids":["embodiment","robot-brain-company","hardware-software-integration","upstream-midstream-downstream-of-the-industry-chain","unitree-robotics","core-components"],"name":"本体厂商","alt":"Robot Body Maker (Robot OEM)","abbr":"","aliases":["本体（本体厂商）","本体公司","整机厂","整机厂商"],"one_liner":"设计和制造机器人整机硬件的公司，如人形、四足机器人厂家。","explanation":"「本体」指机器人的物理身体，包括机械结构、关节电机、传感器和主控；本体厂商就是造整机并出售的公司，英文常叫 robot OEM（整机制造商；注意中文语境里 OEM 常指代工贴牌，意思不同）。在产业链里它处于中游，上游是减速器、电机、传感器等零部件供应商，下游是场景方和系统集成商。宇树、优必选、智元、Figure 等都属于这一类。与之对照的是只做模型、不造硬件的「大脑公司」，也有公司软硬一体、全栈自研。看行业新闻或选研究平台时，常要先分清一家公司是本体厂商还是大脑公司。","example":"宇树科技出售 Go2 四足、G1 人形等整机，是典型的本体厂商。","related":["本体","大脑公司","软硬一体","产业链上中下游","宇树科技","核心零部件"]},{"id":"robot-brain-company","category":"industry","sec":0,"tier":2,"sources":[{"title":"Physical Intelligence 官网","url":"https://www.physicalintelligence.company/"}],"as_of":"","related_ids":["robot-body-maker","hardware-software-integration","hardware-software-decoupling","one-brain-multiple-robots","physical-intelligence","skild-ai"],"name":"大脑公司","alt":"Robot-Brain (Model-only) Company","abbr":"","aliases":["大脑派","具身模型公司"],"one_liner":"只做机器人通用模型、不造机器人本体的公司","explanation":"指专注研发具身基础模型（如 VLA、世界模型），自己基本不量产机器人硬件的公司，与造本体的「本体厂商」相对。它们的思路是做一个能装到不同机器人上的通用「大脑」，靠跨本体泛化覆盖多种硬件，典型代表是 Physical Intelligence（π0 系列）和 Skild AI。支持者认为模型才是核心壁垒、硬件会逐渐标准化；质疑者认为不掌握本体就难以拿到足够真机数据、难以软硬协同优化。这是具身智能行业「软硬一体还是软硬解耦」路线之争的一部分。","example":"Physical Intelligence 用多家厂商的机械臂采数据训练 π0，本身不卖机器人。","related":["本体厂商","软硬一体","软硬解耦（模型与本体解耦）","一脑多机","Physical Intelligence","Skild AI"]},{"id":"three-pillars-of-embodied-ai-data-model-embodiment","category":"industry","sec":0,"tier":2,"sources":[{"title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","url":"https://robotics-transformer-x.github.io/"}],"as_of":"","related_ids":["embodiment","vision-language-action-model","data-scarcity","robot-body-maker","robot-brain-company","embodied-ai-data-service-provider"],"name":"具身智能三要素（数据 / 模型 / 本体）","alt":"Three Pillars of Embodied AI: Data, Model, Embodiment","abbr":"","aliases":["具身三要素"],"one_liner":"业内常把具身智能拆成数据、模型、本体三块来谈","explanation":"这是行业报告和演讲中常见的一种拆法，不是某篇论文提出的正式理论。数据指训练机器人用的演示、仿真、人类视频等；模型指把观测变成动作的策略，如 VLA；本体指机器人硬件本身（关节、灵巧手、传感器）。三者互相制约：本体决定能采什么数据、能做什么动作，数据量决定模型能学多好，模型能力又决定本体的价值。公司定位也常按这三块划分，如本体厂商、大脑公司、数据服务商。","example":"","related":["本体","视觉-语言-动作模型","数据荒","本体厂商","大脑公司","具身数据服务商（数据采集服务商）"]},{"id":"embodied-ai-data-service-provider","category":"industry","sec":0,"tier":2,"sources":[{"title":"数据决定上限：25家国内具身智能数据采集厂商盘点（艾邦机器人）","url":"https://www.aibangbots.com/a/11921"},{"title":"钛媒体：机器人还没学会做家务，卖数据的已经先赚到了钱","url":"https://www.tmtpost.com/8062934.html"},{"title":"Wikipedia: Scale AI","url":"https://en.wikipedia.org/wiki/Scale_AI"}],"as_of":"2026-09","related_ids":["data-collector","embodied-ai-training-ground","data-annotation","data-quality-control","scale-ai","valid-data"],"name":"具身数据服务商（数据采集服务商）","alt":"Embodied AI Data Service Provider","abbr":"","aliases":["数据采集服务商","具身数据公司"],"one_liner":"专门为机器人公司采集、标注和出售训练数据的企业。","explanation":"指主业不是卖机器人或模型、而是给具身智能公司提供训练数据的企业。业务包括：建数据采集场，雇数采员用遥操作、动作捕捉、数据手套或手持夹爪采集演示数据；做清洗、子任务切分、语言标注和质检；按小时或按条交付，也有的出售现成数据集或采集设备。这个角色出现的原因是模仿学习需要大量真机数据，而机器人公司自建采集团队成本高、周期长。它相当于大模型时代 Scale AI 这类标注公司在机器人领域的对应物。评估一家服务商时，主要看数据格式、采集本体是否和自家机器人一致、有效数据占比。","example":"一家机器人公司要训练叠衣服，把任务外包给数据服务商，对方在采集场用同型号机械臂遥操作采集几百小时演示，标好子任务后按 LeRobot 格式交付。","related":["数采员","具身智能训练场","数据标注","数据质检","Scale AI","有效数据"]},{"id":"selling-shovels","category":"industry","sec":0,"tier":2,"sources":[{"title":"Investopedia: Pick-and-Shovel Play","url":"https://www.investopedia.com/terms/p/pick-and-shovel-play.asp"}],"as_of":"","related_ids":["core-components","embodied-ai-data-service-provider",null,"upstream-midstream-downstream-of-the-industry-chain","tesla-supply-chain"],"name":"卖铲子","alt":"Selling Shovels (Picks-and-Shovels Play)","abbr":"","aliases":["卖水人"],"one_liner":"不押注谁造出最好的机器人，而是给所有造机器人的公司供货","explanation":"源自 19 世纪美国淘金热的说法：淘金者未必发财，卖铲子和水的人稳赚。放到具身智能里，指不直接做整机或通用模型，而是给整个行业提供必需品的生意，比如核心零部件（减速器、丝杠、灵巧手、传感器）、仿真和训练平台、数据采集服务、算力芯片。无论最后哪家整机胜出，这些供应商都能受益，风险相对分散。英伟达常被举为典型：它向几乎所有机器人公司提供 GPU、Jetson 主控和 Isaac 仿真平台。","example":"数据采集服务商为多家具身公司提供遥操作数据，不自己训练通用模型。","related":["核心零部件","具身数据服务商（数据采集服务商）","英伟达(NVIDIA)","产业链上中下游","T 链（特斯拉链）"]},{"id":"nvidia-three-computer-solution","category":"industry","sec":0,"tier":3,"sources":[{"title":"Physical AI Accelerated by Three NVIDIA Computers for Robot Training, Simulation and Inference (NVIDIA Blog)","url":"https://blogs.nvidia.com/blog/three-computers-robotics/"}],"as_of":"2025-08","related_ids":["nvidia","physical-ai","nvidia-jetson-thor","nvidia-isaac-sim","nvidia-cosmos","selling-shovels"],"name":"英伟达三台计算机","alt":"NVIDIA Three-Computer Solution (train / simulate / deploy)","abbr":"","aliases":["三台计算机","三台计算机方案"],"one_liner":"英伟达把机器人开发分成训练、仿真、部署三台计算机的方案","explanation":"「三台计算机」是英伟达推广物理 AI 时的框架，官方博客 2024 年 10 月首发、2025 年 8 月更新。第一台是 DGX，用来训练机器人基础模型，例如后训练 GR00T、Cosmos；第二台是运行在 RTX PRO 服务器上的 Omniverse 和 Cosmos，配合 Isaac Sim、Isaac Lab 做仿真、生成合成数据和测试策略；第三台是装在机器人上的 Jetson AGX Thor，负责实时推理和控制。这个说法把「训练—仿真—部署」串成一条链，每一环都对应英伟达的硬件和软件，理解它有助于看清英伟达在具身智能里的位置：不造整机，而是给所有人提供工具链。","example":"一个人形团队在 DGX 上训练策略，在 Isaac Lab 里做强化学习和测试，再把模型部署到机器人上的 Jetson Thor，走的就是这套分工。","related":["英伟达","物理AI","Jetson Thor","Isaac Sim","Cosmos","卖铲子"]},{"id":"big-four-of-industrial-robotics","category":"industry","sec":0,"tier":2,"sources":[{"title":"Industrial robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Industrial_robot"},{"title":"KUKA - Wikipedia","url":"https://en.wikipedia.org/wiki/KUKA"}],"as_of":"2025-10","related_ids":["industrial-robot","fanuc","abb-robotics","kuka","yaskawa-electric-corporation","domestic-substitution"],"name":"工业机器人四大家族","alt":"Big Four of Industrial Robotics (FANUC, ABB, KUKA, Yaskawa)","abbr":"","aliases":["四大家族"],"one_liner":"发那科、ABB、库卡、安川四家传统工业机器人巨头的合称。","explanation":"行业对四家老牌工业机器人厂商的统称：日本发那科（FANUC）、瑞士 ABB、德国库卡（KUKA，2017 年起由美的集团控股）、日本安川电机（Yaskawa）。它们长期占据汽车焊装、搬运、喷涂等产线上多关节工业机械臂的大部分市场，掌握控制器、伺服和减速器等核心环节。讨论国内工业机器人时，常用「四大家族」作为国产厂商追赶和国产替代的参照对象。据报道，ABB 已于 2025 年宣布将机器人业务出售给软银集团。","example":"汽车焊装车间里整排的橙色库卡、黄色发那科六轴机械臂，就是四大家族的典型应用。","related":["工业机器人","发那科","ABB","库卡","安川电机","国产替代"]},{"id":"system-integrator","category":"industry","sec":0,"tier":2,"sources":[{"title":"System integrator - Wikipedia","url":"https://en.wikipedia.org/wiki/System_integrator"}],"as_of":"","related_ids":["upstream-midstream-downstream-of-the-industry-chain","non-standard-automation","industrial-robot","scenario-owner","to-business","project-based-delivery-vs-productization"],"name":"系统集成商","alt":"System Integrator","abbr":"SI","aliases":["集成商"],"one_liner":"把机器人本体、工装和软件组装成整套产线方案交付给客户的公司","explanation":"系统集成商位于机器人产业链下游，本身通常不造机器人，而是买来本体（机械臂、AGV 等），配上夹具、传感器、PLC（可编程逻辑控制器）和控制软件，按客户工厂的具体工序设计、安装、调试成一条能跑的产线。工业机器人落地大多要经过集成商，因为每个工厂的工件和节拍都不同。具身智能公司谈 ToB 落地时，常要决定自己做集成还是与集成商合作。","example":"汽车焊装线上，集成商把多台工业机器人、焊枪、夹具和 PLC 组成一条自动焊接产线交付车厂。","related":["产业链上中下游","非标自动化","工业机器人","场景方","ToB","项目制 / 产品化"]},{"id":"scenario-owner","category":"industry","sec":0,"tier":3,"sources":[{"title":"End user - Wikipedia","url":"https://en.wikipedia.org/wiki/End_user"}],"as_of":"","related_ids":["robot-body-maker","robot-brain-company","system-integrator","real-world-deployment","return-on-investment-payback-period","factory-pilot-deployment"],"name":"场景方","alt":"Scenario Owner (End Customer)","abbr":"","aliases":["终端客户","甲方"],"one_liner":"拥有实际应用场景、最终使用机器人并付钱的一方，如工厂、仓库、商超。","explanation":"场景方是具身智能行业对最终用户的叫法，指手里有真实作业场景的企业或机构，比如汽车工厂、物流仓库、零售门店、医院。产业链里通常还有本体厂商（造机器人的）、大脑公司（做模型的）和系统集成商（把设备接进产线的），场景方决定机器人要干什么活、效率达到多少才肯买单。机器人能否从演示走向落地，很大程度取决于场景方愿不愿意开放场地、提供数据、算投资回报。","example":"某汽车厂作为场景方，让人形机器人在总装车间做料箱搬运试点。","related":["本体厂商","大脑公司","系统集成商","场景落地","投资回报 / 回本周期","进厂实训"]},{"id":"automakers-entering-humanoid-robotics","category":"industry","sec":0,"tier":2,"sources":[{"title":"Optimus (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Optimus_(robot)"},{"title":"Boston Dynamics - Wikipedia","url":"https://en.wikipedia.org/wiki/Boston_Dynamics"}],"as_of":"2025-12","related_ids":["tesla-optimus","xpeng-iron","hyundai-motor-group","autonomous-driving-talent-moving-into-embodied-ai","tesla-supply-chain","factory-pilot-deployment"],"name":"车企造人形（车企入局）","alt":"Automakers Entering Humanoid Robotics","abbr":"","aliases":["车企入局","车企造机器人"],"one_liner":"汽车公司利用自身供应链和智驾技术下场做人形机器人。","explanation":"指汽车厂商自研或投资人形机器人的现象。代表有特斯拉 2021 年宣布的 Optimus、小鹏 2024 年发布的 IRON、小米 2022 年的 CyberOne，以及 2021 年取得波士顿动力控股权的现代汽车集团。车企入局的理由是技术和产业链可以复用：电机、电池、传感器、芯片这些零部件本来就在采购，智驾团队的感知与端到端模型经验能迁到机器人上，汽车工厂的量产管理也用得上；同时自家产线本身就是现成的试用场景（进厂实训）。关注这个现象时，常和「T 链」「智驾转具身」一起讨论。","example":"小鹏在 2024 年发布人形机器人 IRON，宣称与其智能汽车共用 AI 芯片和部分智驾能力。","related":["擎天柱","小鹏 IRON","现代汽车集团","智驾转具身","T 链（特斯拉链）","进厂实训"]},{"id":"autonomous-driving-talent-moving-into-embodied-ai","category":"industry","sec":0,"tier":3,"sources":[{"title":"它石智航融资1.2亿美元，创下今年最大天使轮纪录（界面新闻，2025-03-26）","url":"https://www.jiemian.com/article/12523148.html"}],"as_of":"2025-03","related_ids":["university-big-tech-autonomous-driving-founder-lineage","autonomous-driving","end-to-end","data-flywheel","tars-robotics","automakers-entering-humanoid-robotics"],"name":"智驾转具身","alt":"Autonomous-Driving Talent Moving into Embodied AI","abbr":"","aliases":["智驾人转具身"],"one_liner":"自动驾驶领域的工程师和创业者转行做具身智能的现象","explanation":"指 2023 年以后一批自动驾驶（智驾）从业者转去做机器人的现象，包括车企、智驾公司的技术负责人出来创业，也包括大量感知、规划、数据工程师跳槽。原因是两者技术栈高度重合：多传感器感知、端到端模型、数据闭环（部署后收数据再训练）、仿真测试和车规级量产经验都能迁移；同时智驾行业竞争收窄，具身智能融资火热。业内因此把创始团队分为高校系、大厂系、智驾系。智驾出身的团队通常更重工程化和量产，但要补上机械臂操作、接触和力控这些汽车里没有的问题。","example":"它石智航 CEO 陈亦伦曾任华为车 BU 自动驾驶 CTO，董事长李震宇曾任百度智能驾驶事业群总裁，2025 年创业做具身智能。","related":["高校系 / 大厂系 / 智驾系","自动驾驶","端到端","数据飞轮","它石智航","车企造人形（车企入局）"]},{"id":"university-big-tech-autonomous-driving-founder-lineage","category":"industry","sec":0,"tier":3,"sources":[{"title":"36氪（具身智能创业报道）","url":"https://www.36kr.com/"}],"as_of":"","related_ids":["autonomous-driving-talent-moving-into-embodied-ai","robot-body-maker","robot-brain-company","funding-rounds-and-valuation","galbot","agibot"],"name":"高校系 / 大厂系 / 智驾系","alt":"University / Big-Tech / Autonomous-Driving Founder Lineage","abbr":"","aliases":["学院派","大厂系","智驾系"],"one_liner":"按创始团队出身给具身智能创业公司分的三大派系","explanation":"这是国内投资圈和媒体给具身智能创业公司分类的口头说法，看的是创始人出身：高校系由高校教授或博士团队创办，技术积累在论文和算法上；大厂系来自华为、字节、阿里等互联网或科技大厂，擅长工程和产品化；智驾系来自自动驾驶公司或车企智驾部门，带着数据闭环、量产和车规经验转做机器人。这种划分能帮助理解一家公司的技术路线和短板，比如高校系常被问量产能力，大厂系和智驾系常被问机器人本体积累。它只是粗分类，很多团队是几派混合。","example":"据报道，银河通用创始人王鹤是北大助理教授，常被归为高校系；智元联合创始人彭志辉出身华为，常被归为大厂系。","related":["智驾转具身","本体厂商","大脑公司","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）","银河通用","智元机器人"]},{"id":"technical-route-debate","category":"industry","sec":1,"tier":2,"sources":[{"title":"Vision-language-action model - Wikipedia","url":"https://en.wikipedia.org/wiki/Vision-language-action_model"}],"as_of":"","related_ids":["real-robot-data-camp-vs-sim-data-camp","form-factor-debate","end-to-end","braincerebellum-architecture","world-model","consensus-non-consensus"],"name":"路线之争","alt":"Technical Route Debate","abbr":"","aliases":["技术路线之争"],"one_liner":"业内对「具身智能该用哪种技术方案」尚无定论的分歧","explanation":"具身智能还没有像大语言模型那样收敛出公认的做法，行业里常把几组对立方案称为「路线之争」：端到端 VLA（视觉-语言-动作模型）还是大脑-小脑分层架构；真机数据为主还是仿真/人类视频数据为主；VLA 还是世界模型；人形还是轮式等非人形本体。了解这些分歧，有助于读懂各家公司的技术取舍和宣传口径，它们往往就是公司押注方向的体现。","example":"有的公司主张大量采集真机遥操作数据，有的公司主张用仿真合成数据预训练，这是数据路线之争。","related":["真机派 / 仿真派","形态之争","端到端","大脑-小脑架构（大小脑）","世界模型","共识 / 非共识"]},{"id":"form-factor-debate","category":"industry","sec":1,"tier":2,"sources":[{"title":"Wikipedia: Humanoid robot","url":"https://en.wikipedia.org/wiki/Humanoid_robot"},{"title":"逐际动力 TRON 2 具身机器人发布：可变化三种形态（IT之家）","url":"https://www.ithome.com/0/906/067.htm"}],"as_of":"2026-09","related_ids":["humanoid-robot","wheeled-humanoid-robot","wheel-legged-robot","legged-robot","technical-route-debate","embodiment"],"name":"形态之争","alt":"Form-Factor Debate (humanoid vs. non-humanoid, wheeled vs. legged)","abbr":"","aliases":["人形 vs 非人形","轮式 vs 足式"],"one_liner":"通用机器人该做成人形还是别的样子、用腿还是用轮子的争论。","explanation":"具身智能行业围绕机器人本体长什么样的长期争论，主要有两组。一是人形还是非人形：支持人形的一方认为人类的环境、工具和数据（人类视频、动作捕捉）都是按人的身体来的，人形可以直接复用；反对方认为双足不稳、成本高，很多任务用机械臂加移动底盘就够。二是轮式还是足式：轮式在平地上更快、更省电、更稳，足式能上下楼梯、跨越障碍。折中方案有轮式人形机器人（下半身轮式底盘、上半身双臂）和轮足机器人。争论背后是成本、可靠性和目标场景的取舍，目前没有定论，不少公司同时推出多种形态。","example":"逐际动力的 TRON 2 可以在双臂、足式、轮足等几种形态之间切换，是厂商在形态上两头下注的一个例子。","related":["人形机器人","轮式人形机器人","轮足机器人","足式机器人","路线之争","本体"]},{"id":"real-robot-data-camp-vs-sim-data-camp","category":"industry","sec":1,"tier":2,"sources":[{"title":"AgiBot World (GitHub)","url":"https://github.com/OpenDriveLab/AgiBot-World"},{"title":"NVIDIA Isaac Lab","url":"https://developer.nvidia.com/isaac/lab"}],"as_of":"2025","related_ids":[null,null,null,null,null,"technical-route-debate"],"name":"真机派 / 仿真派","alt":"Real-Data Camp vs. Sim-Data Camp","abbr":"","aliases":["真机数据派","仿真数据派","合成数据派"],"one_liner":"围绕机器人训练数据该主要靠真机采集还是仿真合成的两种路线","explanation":"这是国内对具身智能数据路线之争的说法。真机派认为真实物理交互的细节仿真难以还原，主张用遥操作等方式大规模采集真机数据，代表做法如 Physical Intelligence、智元 AgiBot World 数据集。仿真派认为真机采集太贵太慢，主张在仿真器里用域随机化、程序化生成批量合成数据，再做仿真到现实迁移，代表如银河通用用合成数据训练抓取模型、英伟达的仿真工具链。实际上多数团队是混合使用，还在加入人类视频数据，数据金字塔就是把几类数据按用量分层组合的思路。","example":"银河通用 GraspVLA 主要用十亿级合成抓取数据预训练；AgiBot World 则是在实体采集场用真机采集的大规模数据集。","related":["真机数据(Real-Robot Data)","仿真数据(Simulation Data)","合成数据(Synthetic Data)","仿真到现实迁移(Sim-to-Real Transfer)","数据金字塔(Data Pyramid)","路线之争"]},{"id":"full-stack-in-house-development","category":"industry","sec":1,"tier":2,"sources":[{"title":"星动纪元：关于我们","url":"https://www.robotera.com/about/us"},{"title":"北京人形机器人创新中心：关于我们","url":"https://www.x-humanoid.com/about.html"}],"as_of":"2026-09","related_ids":["hardware-software-integration","robot-body-maker","robot-brain-company","joint-actuator-module","hardware-software-decoupling","robotera"],"name":"全栈自研","alt":"Full-Stack In-House Development","abbr":"","aliases":["垂直整合","全栈"],"one_liner":"本体、核心部件、控制到大模型，主要环节都由公司自己开发。","explanation":"指一家机器人公司把机械结构、关节模组、灵巧手、电控、运动控制、感知和上层大模型等主要环节都放在自己手里做，而不是买别人的本体或调用别人的模型。好处是软硬件可以一起迭代，出问题容易定位，数据格式统一，长期成本更可控；代价是投入大、周期长，团队什么都要懂。与之相对的是只做本体的本体厂商、只做模型的大脑公司，以及采购核心部件再集成的模式。宣传里的「全栈自研」口径不统一，要看关键部件和模型是否真是自己做的。","example":"星动纪元官网称「软硬件全栈自研」，同时做人形机器人 L7、灵巧手 XHAND1 和端到端模型 ERA-42。","related":["软硬一体","本体厂商","大脑公司","关节模组","软硬解耦（模型与本体解耦）","星动纪元"]},{"id":"hardware-software-integration","category":"industry","sec":1,"tier":2,"sources":[{"title":"新京报：星源智完成 Pre-A 轮融资","url":"https://m.bjnews.com.cn/detail/1780455817129694.html"},{"title":"36氪：无界动力","url":"https://m.36kr.com/p/3869370059035913"}],"as_of":"2026-06","related_ids":["full-stack-in-house-development","hardware-software-decoupling","robot-body-maker","robot-brain-company","on-device-edge-deployment","one-brain-multiple-robots"],"name":"软硬一体","alt":"Hardware-Software Integration","abbr":"","aliases":["软硬件一体化"],"one_liner":"硬件和算法由同一方配套设计、调优，按整体方案交付。","explanation":"指机器人的硬件（本体、传感器、算力平台）和软件（控制、感知、模型）作为一个整体来设计、调优和交付。和全栈自研相比，侧重点不同：全栈自研强调每个环节都自己做，软硬一体强调软硬件配合调好、给客户一个开箱能用的方案，其中部分硬件可以外购。出发点是具身模型的效果高度依赖具体本体：相机装在哪、关节延迟多大、控制频率多高都会影响策略表现，软硬件分开做容易对不上。与之相对的说法是软硬解耦，即模型尽量不绑定特定本体，一个大脑适配多种机器人。","example":"据报道，星源智不造机器人本体，但把具身大脑模型和端侧算力平台一起交付，称走「软硬一体、端侧部署」路线。","related":["全栈自研","软硬解耦（模型与本体解耦）","本体厂商","大脑公司","端侧部署","一脑多机"]},{"id":"hardware-software-decoupling","category":"industry","sec":1,"tier":3,"sources":[{"title":"π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv)","url":"https://arxiv.org/abs/2410.24164"}],"as_of":"","related_ids":["robot-brain-company","hardware-software-integration","one-brain-multiple-robots","cross-embodiment","embodiment-agnostic"],"name":"软硬解耦（模型与本体解耦）","alt":"Hardware-Software Decoupling (Model–Embodiment Decoupling)","abbr":"","aliases":["模型与本体解耦"],"one_liner":"机器人的智能模型不绑定某一款硬件，可装到不同机器人上用","explanation":"软硬解耦指把机器人的「大脑」（感知、决策的模型和软件）和「本体」（机械结构、电机、传感器）分开开发，模型通过统一接口适配多种机器人，硬件也可以换不同厂商的模型。这是「大脑公司」的商业前提：只做模型、不造整机，靠跨本体数据训练出通用策略。和它相对的是「软硬一体」，即同一家公司同时设计硬件和模型、深度优化。支持解耦的一方看重规模和复用，质疑的一方认为控制性能离不开对具体硬件的深度理解。","example":"Physical Intelligence 自己不造机器人，其 π0 模型用多种不同机器人构型的数据训练，可控制单臂、双臂和移动机器人。","related":["大脑公司","软硬一体","一脑多机","跨本体","本体无关"]},{"id":"one-brain-multiple-robots","category":"industry","sec":1,"tier":2,"sources":[{"title":"Skild AI","url":"https://www.skild.ai/"},{"title":"π0: Our First Generalist Policy - Physical Intelligence","url":"https://www.physicalintelligence.company/blog/pi0"}],"as_of":"2025","related_ids":[null,null,null,null,"robot-brain-company","hardware-software-decoupling"],"name":"一脑多机","alt":"One Brain, Multiple Robots","abbr":"","aliases":["一脑多形","一脑多本体"],"one_liner":"用同一个具身大模型控制多种不同形态的机器人","explanation":"一脑多机是国内行业说法，指训练一个通用的机器人「大脑」模型，让它能驱动机械臂、双臂、轮式、人形、四足等不同本体，而不是每种机器人单独训一个模型。技术上靠跨本体训练：把多种机器人的数据混在一起预训练，再用统一动作空间或每种本体专属的动作头处理关节数、控制方式的差异。它的吸引力在于数据可以跨机器人复用、模型公司不必绑定一种硬件；难点是不同本体差异大，常出现负迁移。大脑公司和软硬解耦的商业模式都建立在这个设想上。","example":"Skild AI 称其 Skild Brain 可控制多种本体；Physical Intelligence 的 π0 用多种机器人的数据联合训练。","related":["跨本体(Cross-Embodiment)","本体差异(Embodiment Gap)","统一动作空间(Unified Action Space)","本体专属头(Embodiment-specific Head)","大脑公司","软硬解耦（模型与本体解耦）"]},{"id":"specialized-first-general-later","category":"industry","sec":1,"tier":2,"sources":[{"title":"Generalist robot policy 概念（Octo 项目页）","url":"https://octo-models.github.io/"}],"as_of":"","related_ids":["general-purpose-robot","specialist-policy","real-world-deployment","technical-route-debate","generalist-policy","data-flywheel"],"name":"先专后通","alt":"Specialized First, General Later","abbr":"","aliases":[],"one_liner":"先在单一场景把机器人做成能用，再逐步扩展到通用","explanation":"是具身智能行业关于落地路线的一种主张：先挑一个具体场景（如工厂上下料、物流分拣、零售货架补货），把机器人做到高成功率、能赚钱，用这里的收入和真实数据反哺模型，再一步步扩展到更多任务，最终走向通用机器人。与之相对的是「先通后专」，即先训练通用基础模型，再微调到具体场景。支持先专后通的人认为通用模型短期内达不到商用可靠性；反对者担心专用方案做得越深越难迁移。多数公司实际是两条腿走路。","example":"某公司先让轮式双臂机器人只做药店货架拣货，积累数据后再扩展到其他零售场景。","related":["通用机器人","专用策略","场景落地","路线之争","通用策略（通才策略）","数据飞轮"]},{"id":"agibot-g1g5-embodied-ai-roadmap","category":"industry","sec":1,"tier":3,"sources":[{"title":"AgiBot - Wikipedia","url":"https://en.wikipedia.org/wiki/AgiBot"},{"title":"智元机器人官网","url":"https://www.agibot.com/"}],"as_of":"2024-08","related_ids":["agibot","humanoid-robot-intelligence-level-grading","skill-primitive","end-to-end","agibot-go-1","levels-of-autonomy"],"name":"智元 G1–G5 技术路线","alt":"AgiBot G1–G5 Embodied AI Roadmap","abbr":"","aliases":["G1–G5 具身智能演进路线"],"one_liner":"智元机器人提出的具身智能五级演进路线，从手工编程到全端到端通用模型","explanation":"这是智元机器人在 2024 年 8 月新品发布会上提出的技术分级，用来说明机器人「大脑」怎么一步步变通用。据报道大致是：G1 基础自动化，靠人工设计的规则和简单视觉反馈，换场景就要重做；G2 通用原子技能，把抓取、放置等可复用的原子能力（小技能）编排成任务；G3 端到端，原子技能改由数据驱动的端到端模型学出来；G4 通用操作大模型，跨任务、跨场景泛化；G5 从感知到执行全部由统一大模型完成。它是单家公司的路线图，不是行业标准，和中国电子学会的人形机器人智能化分级不是一回事。智元后续的 GO-1 等模型被定位为向高等级迈进的产品。","example":"","related":["智元机器人","人形机器人智能化分级","原子技能","端到端","智元 GO-1（启元大模型）","自主等级"]},{"id":"consensus-non-consensus","category":"industry","sec":1,"tier":3,"sources":[{"title":"Contrarian investing - Wikipedia","url":"https://en.wikipedia.org/wiki/Contrarian_investing"}],"as_of":"","related_ids":["technical-route-debate","form-factor-debate","real-robot-data-camp-vs-sim-data-camp","embodied-ai-bubble","funding-rounds-and-valuation"],"name":"共识 / 非共识","alt":"Consensus / Non-consensus","abbr":"","aliases":["非共识","非共识判断"],"one_liner":"大多数人已认同的判断叫共识，少数人坚持的叫非共识。","explanation":"这是投资圈和创业圈的常用说法。共识指行业里多数人已经认同的判断，比如「数据是具身智能的瓶颈」；非共识指只有少数人相信、还没被广泛接受的判断。投资人常说，只有「非共识且正确」的判断才能带来超额回报，因为共识早已反映在价格和估值里。具身智能里很多争论都可以用这对词描述：人形还是非人形、真机数据还是仿真数据、端到端还是分层。一个判断会随着证据积累从非共识变成共识，这时再入场的人通常就拿不到早期的回报了。读融资新闻和访谈时，这个词常用来说明创始人为什么选了某条路线。","example":"几年前「用一个大模型控制多种机器人」还是非共识，π0、GR00T 等模型发布后逐渐成为行业共识。","related":["路线之争","形态之争","真机派 / 仿真派","具身智能泡沫","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）"]},{"id":"demo","category":"industry","sec":2,"tier":1,"sources":[{"title":"Optimus (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Optimus_(robot)"}],"as_of":"","related_ids":["teleoperated-demo","fully-autonomous","playback-speed-label","edited-demo","cherry-picking","one-take-video"],"name":"Demo（演示视频）","alt":"Demo (Demonstration Video)","abbr":"","aliases":["Demo","演示视频"],"one_liner":"公司或团队用来展示机器人能力的视频，通常是挑选过的片段。","explanation":"具身智能公司发布模型或产品时，几乎都会配一段机器人叠衣服、做饭、搬箱子的视频，圈内简称 Demo。它是新人了解一家公司进展最直接的材料，但信息量有限：拍了多少遍才成功、是否遥操作、是否加速播放、场景是否提前布置，视频里往往看不出来。看 Demo 时先找画面上的标注（如「1x」「autonomous」），再去论文或技术报告里找成功率和测试条件。相关黑话有遥操作演示、剪辑 Demo、cherry-pick、一镜到底。","example":"特斯拉 2024 年 10 月 We, Robot 发布会上 Optimus 与来宾聊天、互动，事后被报道这些互动主要靠人远程操控，特斯拉也因现场没有说明而受到批评。","related":["遥操作演示","全自主","倍速 / 原速标注","剪辑 Demo","cherry-pick（挑结果）","一镜到底"]},{"id":"fully-autonomous","category":"industry","sec":2,"tier":1,"sources":[{"title":"Introducing Helix 02: Full-Body Autonomy (Figure, 2026-01-27)","url":"https://www.figure.ai/news/helix-02"}],"as_of":"2026-01","related_ids":["teleoperated-demo","demo","playback-speed-label","remote-teleoperation-takeover","intervention-rate","levels-of-autonomy"],"name":"全自主","alt":"Fully Autonomous","abbr":"","aliases":["Autonomous 标注","非遥操作","fully autonomous"],"one_liner":"机器人执行任务全程由自己的模型控制，没有人在背后遥控。","explanation":"与遥操作相对：遥操作是人戴 VR 头显或拿主臂实时控制机器人，全自主是策略模型（根据观测输出动作的网络）自己决定每一步。发布 Demo 时公司常在画面上标「Autonomous」来说明不是人在操控，有的还同时标「1x speed」表示没加速。注意「全自主」只说明执行时没人遥控，不代表没挑结果、没提前摆好场景，也不代表任务是模型没见过的；还要看是整段自主，还是中途有人接管（干预率）。","example":"Figure 2026 年 1 月发布 Helix 02 时注明页面上的演示视频「均为全自主、非遥操作」，并称机器人在整间厨房里装卸洗碗机的 4 分钟任务中没有重置、没有人工干预。","related":["遥操作演示","Demo（演示视频）","倍速 / 原速标注","远程接管（人工兜底）","干预率","自主等级"]},{"id":"teleoperated-demo","category":"industry","sec":2,"tier":1,"sources":[{"title":"Mobile ALOHA 项目主页（Autonomous Skills / Teleoperation 分栏）","url":"https://mobile-aloha.github.io/"},{"title":"The Decoder: Watch a low-cost, all-purpose robot fry shrimp autonomously（Fu 称居家视频中的机器人「目前」是遥操作）","url":"https://the-decoder.com/watch-an-autonomous-robot-cook-and-then-build-one-yourself/"},{"title":"Teleoperation - Wikipedia","url":"https://en.wikipedia.org/wiki/Teleoperation"}],"as_of":"","related_ids":["teleoperation","fully-autonomous","demo","remote-teleoperation-takeover","mobile-aloha","pre-programmed-motion"],"name":"遥操作演示","alt":"Teleoperated Demo","abbr":"","aliases":["遥控演示","遥控摆拍","Wizard-of-Oz 演示"],"one_liner":"视频里的机器人其实由人在远处实时操控，而不是模型自己在做决定。","explanation":"遥操作是人通过 VR 头显、主从臂、动捕服等设备实时控制机器人。它本身是正常技术，也是采集训练数据的主要方式；问题在于把遥操作画面当成自主能力展示而不说明，圈内叫「遥控摆拍」，英文借用 Wizard-of-Oz（幕后有人操纵）。遥操作能证明硬件做得到，但不能证明模型学会了。识别方法：看是否标注 teleoperated 或 autonomous，机器人反应是否像人一样即时多变，发布方有没有给出自主运行的成功率。","example":"斯坦福 Mobile ALOHA 2024 年 1 月发布时，项目主页就把「自主技能」和「遥操作」视频分栏展示；随后在网上刷屏的居家做家务视频，作者在社交媒体上说明是遥操作录的。","related":["遥操作","全自主","Demo（演示视频）","远程接管（人工兜底）","Mobile ALOHA","预编程动作（动作编排）"]},{"id":"remote-teleoperation-takeover","category":"industry","sec":2,"tier":2,"sources":[{"title":"1X NEO 官网","url":"https://www.1x.tech/neo"}],"as_of":"2025-10","related_ids":["teleoperation","fully-autonomous","teleoperated-demo","human-intervention-data","deployment-data-backflow","human-in-the-loop"],"name":"远程接管（人工兜底）","alt":"Remote Teleoperation Takeover (Human Fallback)","abbr":"","aliases":["远程遥控兜底","专家模式（1X NEO）"],"one_liner":"机器人自己搞不定时，由远端真人遥控接手完成任务","explanation":"指机器人在自主执行中遇到失败或没见过的情况时，由远程操作员通过网络（常用 VR 头显或手柄）实时遥控接手，把任务做完。它是当前具身智能落地的常见做法：模型的成功率还达不到商用要求，用人工兜底保证服务不中断；接管过程中录下的数据又可以回流训练模型（数据回流）。1X 在 2025 年开放 NEO 预订时公开了「专家模式」，即经用户同意后由 1X 员工远程操控。它也常引发争议：演示里的动作到底是全自主还是有人在后台遥控，需要看厂商是否明确标注。","example":"1X NEO 家用机器人遇到不会的家务时，可在用户授权下由 1X 远程操作员戴 VR 设备接管完成。","related":["遥操作","全自主","遥操作演示","干预数据","数据回流","人在回路"]},{"id":"pre-programmed-motion","category":"industry","sec":2,"tier":2,"sources":[{"title":"Atlas (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Atlas_(robot)"},{"title":"Boston Dynamics - Wikipedia","url":"https://en.wikipedia.org/wiki/Boston_Dynamics"}],"as_of":"","related_ids":["fully-autonomous",null,null,"demo","commercial-robot-performances","teleoperated-demo"],"name":"预编程动作（动作编排）","alt":"Pre-programmed (Choreographed) Motion","abbr":"","aliases":["动作编排","预设动作"],"one_liner":"事先设计好、按固定脚本执行的动作，不是机器人现场自主决策","explanation":"预编程动作指工程师提前设计好动作序列，机器人按固定脚本回放或跟踪执行，比如舞蹈、翻跟头、表演套路。现在这类动作常用动作捕捉加强化学习跟踪实现，平衡和发力由控制器实时完成，技术上并不简单，但「做什么动作、什么时候做」是写死的，不依赖对环境的理解。它和全自主不同：全自主要求机器人根据看到的场景自己决定下一步。看到机器人跳舞、打拳的视频时，要把「运动控制很强」和「会自主完成任务」分开理解。","example":"波士顿动力 2020 年的舞蹈视频《Do You Love Me》和春晚机器人群舞都属于事先编排好的动作。","related":["全自主","运动跟踪(Motion Tracking)","动作捕捉(Motion Capture)","Demo（演示视频）","商演","遥操作演示"]},{"id":"playback-speed-label","category":"industry","sec":2,"tier":2,"sources":[{"title":"Mobile ALOHA project page","url":"https://mobile-aloha.github.io/"},{"title":"π0: Our First Generalist Policy - Physical Intelligence","url":"https://www.physicalintelligence.company/blog/pi0"}],"as_of":"","related_ids":["demo","fully-autonomous","teleoperated-demo","one-take-video","edited-demo","cherry-picking"],"name":"倍速 / 原速标注","alt":"Playback Speed Label (1x vs. Sped-up)","abbr":"","aliases":["1x 原速","倍速播放"],"one_liner":"机器人演示视频角落写的 1x、2x、10x，标明是否加速播放","explanation":"机器人演示视频常在角落标「1x」表示原速，「2x」「4x」「10x」表示加速播放。真机策略往往动作慢、中途有停顿，为了让视频好看、时长可控，发布方会加速剪辑。这本身不算作假，但如果不标或标得很小，观众会高估机器人的速度和流畅度，而速度直接关系到工厂节拍和能否商用。所以看 Demo 时要先找倍速标注，再看是否全自主、是否一镜到底、是否挑了成功片段，几项一起判断机器人真实水平。","example":"一段叠衣服视频标注「4x」，意味着实际叠一件可能要慢四倍的时间。","related":["Demo（演示视频）","全自主","遥操作演示","一镜到底","剪辑 Demo","cherry-pick（挑结果）"]},{"id":"edited-demo","category":"industry","sec":2,"tier":2,"sources":[{"title":"Gemini (language model) - Wikipedia","url":"https://en.wikipedia.org/wiki/Gemini_(language_model)"}],"as_of":"","related_ids":["demo","cherry-picking","one-take-video","playback-speed-label","teleoperated-demo","fully-autonomous"],"name":"剪辑 Demo","alt":"Edited Demo","abbr":"","aliases":["剪辑视频","摆拍"],"one_liner":"经过剪切、拼接或加速处理的机器人演示视频。","explanation":"指演示视频经过剪辑：把多次尝试拼成一次、剪掉失败和卡顿、加速播放，甚至摆拍。剪辑本身不一定是造假，但会让观众高估机器人的速度、成功率和自主程度。看 Demo 时可以留意：是否一镜到底、是否标注倍速、是否说明全自主还是遥操作、有没有公布成功率。严谨的团队会发布原速、不剪辑的长视频来佐证。","example":"据报道，谷歌 2023 年的 Gemini 演示视频就因经过剪辑、缩短了响应时间而受到质疑。","related":["Demo（演示视频）","cherry-pick（挑结果）","一镜到底","倍速 / 原速标注","遥操作演示","全自主"]},{"id":"one-take-video","category":"industry","sec":2,"tier":3,"sources":[{"title":"Long take - Wikipedia","url":"https://en.wikipedia.org/wiki/Long_take"}],"as_of":"","related_ids":["demo","edited-demo","playback-speed-label","fully-autonomous","teleoperated-demo","cherry-picking"],"name":"一镜到底","alt":"One-Take (Uncut) Video","abbr":"","aliases":["无剪辑","单镜头连续拍摄"],"one_liner":"从头到尾一个镜头连续拍完、中间不剪切的机器人演示视频","explanation":"一镜到底原是影视术语（长镜头），指一个镜头连续拍完、中间不剪切。在具身智能圈，它被用来证明 Demo 的可信度：多段拼接的视频可以把失败的尝试剪掉，只留成功片段，而一镜到底至少说明这一段动作是连贯完成的。它不等于全自主——画面外仍可能有人遥操作，也可能是反复拍了很多条挑出最好的一条。所以看 Demo 时要把一镜到底、原速播放、是否全自主三件事分开核对。","example":"某公司发布人形机器人叠衣服视频，在角落标注「1x 原速、一镜到底、全自主」，就是在同时回应剪辑、倍速和遥操作三类质疑。","related":["Demo（演示视频）","剪辑 Demo","倍速 / 原速标注","全自主","遥操作演示","cherry-pick（挑结果）"]},{"id":"cherry-picking","category":"industry","sec":2,"tier":2,"sources":[{"title":"Cherry picking - Wikipedia","url":"https://en.wikipedia.org/wiki/Cherry_picking"}],"as_of":"","related_ids":["edited-demo","demo","success-rate","one-take-video","leaderboard-chasing"],"name":"cherry-pick（挑结果）","alt":"Cherry-picking","abbr":"","aliases":["Cherry-pick","挑结果"],"one_liner":"只挑最好看的结果展示，隐藏失败和平均水平。","explanation":"原指只摘最好的樱桃，在研究和宣传里指从多次尝试中只展示成功或最好看的那几次。机器人策略的表现方差很大，同一个任务可能十次成功三次，只放成功视频就会让人高估能力。辨别方法是看有没有报告总试验次数和成功率、测试物体和场景是否与训练不同、视频是否一镜到底。严谨的论文会给出成功率、置信区间和失败案例。","example":"一篇论文主页只放了 3 段叠衣服成功的视频，正文却没写一共试了多少次、成功率多少。","related":["剪辑 Demo","Demo（演示视频）","成功率","一镜到底","刷榜"]},{"id":"leaderboard-chasing","category":"industry","sec":2,"tier":2,"sources":[{"title":"Goodhart's law - Wikipedia","url":"https://en.wikipedia.org/wiki/Goodhart%27s_law"},{"title":"LIBERO Benchmark","url":"https://libero-project.github.io/"}],"as_of":"","related_ids":["benchmark","benchmark-saturation","libero-benchmark","libero-plus","real-world-evaluation","cherry-picking"],"name":"刷榜","alt":"Leaderboard Chasing (Benchmark Hacking)","abbr":"","aliases":["打榜"],"one_liner":"专门针对某个评测榜单优化，把分数做高但能力未必真提升","explanation":"刷榜是 AI 圈的口语，指研究者或公司围绕某个公开基准测试反复调参、挑设置、甚至针对测试集特点做专门设计，让分数冲到榜首。适度追榜能推动进步，但过度追榜会让分数和真实能力脱节，这就是古德哈特定律说的「指标一旦成为目标就不再是好指标」。具身智能里常见的是仿真基准饱和：多个 VLA 在 LIBERO 上成功率接近满分，可换个相机角度、加点干扰就大幅下降。所以看论文时要同时看泛化测试和真机评测。","example":"不少 VLA 在 LIBERO 上报告 95% 以上成功率，而 LIBERO-Plus、LIBERO-PRO 加入扰动后分数明显下滑。","related":["基准测试","基准饱和","LIBERO","LIBERO-Plus","真机评测","cherry-pick（挑结果）"]},{"id":"arxiv-preprint","category":"industry","sec":3,"tier":1,"sources":[{"title":"About arXiv","url":"https://info.arxiv.org/about/index.html"},{"title":"arXiv spin-out FAQ（2026 年 7 月 1 日起为独立非营利机构 arXiv, Inc.）","url":"https://info.arxiv.org/about/spinout_faq.html"},{"title":"arXiv Help: Availability of submissions（编号按首次公开的月份分配）","url":"https://info.arxiv.org/help/availability.html"}],"as_of":"2026-07","related_ids":["top-tier-conferences-and-journals","conference-on-robot-learning","ieee-international-conference-on-robotics-and-automation","state-of-the-art","pi0"],"name":"arXiv 预印本","alt":"arXiv Preprint","abbr":"","aliases":["arXiv","预印本","挂 arXiv"],"one_liner":"论文正式发表前先公开挂出的版本，AI 领域大多挂在 arXiv 上。","explanation":"arXiv 是 1991 年由物理学家 Paul Ginsparg 创建的免费预印本平台，长期由康奈尔大学托管，2026 年 7 月起独立为非营利机构。作者上传后经过简单审核就能公开，不经过同行评审。具身智能和 AI 领域节奏快，新论文大多在投稿前后就挂上 arXiv、不等正式录用，所以「挂 arXiv」基本等于首发。每篇有编号，前四位是首次公开的年月。读的时候要注意：预印本没经过评审，结论和实验可能后续修改，会出现 v1、v2 等版本；引用时最好确认有没有正式发表的版本。","example":"π0 论文编号 arXiv:2410.24164，前四位 2410 表示 2024 年 10 月公开。","related":["顶会 / 顶刊（CCF-A）","CoRL","ICRA","最先进水平","π0"]},{"id":"top-tier-conferences-and-journals","category":"industry","sec":3,"tier":1,"sources":[{"title":"中国计算机学会推荐国际学术会议和期刊目录","url":"https://www.ccf.org.cn/Academic_Evaluation/By_category/"},{"title":"第七版中国计算机学会推荐国际学术会议和期刊目录（CCF 2026）附件页（中国科学院大学人工智能学院）","url":"https://ai.ucas.ac.cn/index.php/zh-cn/jxjy/fzpy1/7675-ccf-2026"}],"as_of":"2026-03","related_ids":["arxiv-preprint","cvpr-iccv-eccv","neurips-icml-iclr","ieee-international-conference-on-robotics-and-automation","conference-on-robot-learning","robotics-science-and-systems"],"name":"顶会 / 顶刊（CCF-A）","alt":"Top-tier Conferences & Journals (CCF-A Venues)","abbr":"","aliases":["顶会","顶刊","CCF-A"],"one_liner":"领域内公认影响力最大的会议和期刊，国内常以 CCF-A 类为准。","explanation":"CCF 是中国计算机学会，它发布《推荐国际学术会议和期刊目录》，把计算机各方向的会议期刊分成 A、B、C 三类，A 类就是国内高校评价里常说的「顶会顶刊」；目录每隔几年调整一次，最新是 2026 年 3 月发布的第七版。具身智能相关的 CCF-A 包括 CVPR、ICCV、NeurIPS、ICML、ICLR 等会议和 TPAMI、IJCV 等期刊。机器人方向的 ICRA、IROS、CoRL、RSS 在圈内被视为本领域顶会，但都不是 CCF-A：ICRA 为 B 类，IROS 为 C 类，CoRL、RSS 未收录，所以「顶会」和「CCF-A」并不等价。计算机领域以会议为主，论文常在投稿前后就挂上 arXiv。","example":"ECCV 在 CCF 目录中是 B 类，但在视觉圈与 CVPR、ICCV 并称三大会。","related":["arXiv 预印本","CVPR / ICCV / ECCV（计算机视觉三大会）","NeurIPS / ICML / ICLR（机器学习三大会）","ICRA","CoRL","RSS"]},{"id":"neurips-icml-iclr","category":"industry","sec":3,"tier":2,"sources":[{"title":"NeurIPS","url":"https://neurips.cc/"},{"title":"ICML","url":"https://icml.cc/"},{"title":"ICLR","url":"https://iclr.cc/"}],"as_of":"","related_ids":["top-tier-conferences-and-journals","conference-on-robot-learning","robotics-science-and-systems","ieee-international-conference-on-robotics-and-automation","cvpr-iccv-eccv","arxiv-preprint"],"name":"NeurIPS / ICML / ICLR（机器学习三大会）","alt":"NeurIPS / ICML / ICLR","abbr":"","aliases":["机器学习三大会","ML 三大顶会"],"one_liner":"机器学习领域影响力最大的三个年度学术会议","explanation":"NeurIPS（神经信息处理系统大会，2018 年前简称 NIPS，一般在 12 月举办）、ICML（国际机器学习大会，一般在夏季）、ICLR（国际学习表征会议，2013 年由 Bengio 和 LeCun 等人发起，在 OpenReview 上公开评审）被并称机器学习三大会。计算机领域以会议论文为主要成果形式，这三个会录用率较低、影响力大，属于中国计算机学会推荐的 A 类会议。具身智能里偏方法的工作，比如 VLA、世界模型、强化学习算法，常投这三个会；偏系统和真机的工作更多投 CoRL、RSS、ICRA。","example":"Decision Transformer 发表在 NeurIPS 2021；很多 VLA 与世界模型论文投 ICLR。","related":["顶会 / 顶刊（CCF-A）","CoRL","RSS","ICRA","CVPR / ICCV / ECCV（计算机视觉三大会）","arXiv 预印本"]},{"id":"cvpr-iccv-eccv","category":"industry","sec":3,"tier":2,"sources":[{"title":"Conference on Computer Vision and Pattern Recognition - Wikipedia","url":"https://en.wikipedia.org/wiki/Conference_on_Computer_Vision_and_Pattern_Recognition"},{"title":"CVPR official site","url":"https://cvpr.thecvf.com/"}],"as_of":"","related_ids":["top-tier-conferences-and-journals","neurips-icml-iclr","conference-on-robot-learning","computer-vision","arxiv-preprint"],"name":"CVPR / ICCV / ECCV（计算机视觉三大会）","alt":"Conference on Computer Vision and Pattern Recognition / International Conference on Computer Vision / European Conference on Computer Vision","abbr":"CVPR / ICCV / ECCV","aliases":["计算机视觉三大会","CV 三大会"],"one_liner":"计算机视觉领域最有影响力的三个国际学术会议。","explanation":"CVPR 每年举办；ICCV 在奇数年举办；ECCV 在偶数年举办，最初在欧洲举行。三者都是视觉方向顶级会议，也是 CCF-A 类。具身智能大量依赖视觉：3D 重建、深度估计、分割、视频生成和世界模型等工作多发表在这里，近年也有越来越多 VLA 和具身导航论文投向这三个会，CVPR 还常设具身智能相关的研讨会（workshop）。","example":"DUSt3R、VGGT 等三维视觉基础模型都发表在 CVPR 上，后来被广泛用于机器人感知。","related":["顶会 / 顶刊（CCF-A）","NeurIPS / ICML / ICLR（机器学习三大会）","CoRL","计算机视觉","arXiv 预印本"]},{"id":"ieee-international-conference-on-robotics-and-automation","category":"industry","sec":3,"tier":2,"sources":[{"title":"Wikipedia: International Conference on Robotics and Automation","url":"https://en.wikipedia.org/wiki/International_Conference_on_Robotics_and_Automation"}],"as_of":"2025-05","related_ids":["ieee-rsj-international-conference-on-intelligent-robots-and","conference-on-robot-learning","robotics-science-and-systems","ieee-t-ro-ijrr-ra-l","ieee-robotics-and-automation-society","top-tier-conferences-and-journals"],"name":"ICRA","alt":"IEEE International Conference on Robotics and Automation","abbr":"ICRA","aliases":["IEEE 国际机器人与自动化会议","国际机器人与自动化会议"],"one_liner":"IEEE 机器人与自动化学会主办的年度旗舰机器人学术会议。","explanation":"ICRA 由 IEEE 机器人与自动化学会（RAS）主办，1984 年起每年举办，通常在 5–6 月，是规模最大的机器人学术会议之一，每年投稿数千篇。内容覆盖机器人各方向：运动规划、控制、感知、SLAM、操作、足式运动、人机交互，近年机器人学习和 VLA 类论文增长很快。它和 IROS 并称机器人领域两大综合性会议；和 CoRL、RSS 相比，收录面更广、规模更大。它还和期刊 RA-L 联动，RA-L 录用的论文可以选择到 ICRA 上宣讲。2025 年 ICRA 在美国亚特兰大举办。","example":"不少经典算法首发于 ICRA，例如 Kajita 等人 2003 年的 ZMP 预观控制、Mellinger 和 Kumar 2011 年的四旋翼最小 Snap 轨迹。","related":["IROS","CoRL","RSS","T-RO / IJRR / RA-L（机器人期刊）","IEEE 机器人与自动化学会","顶会 / 顶刊（CCF-A）"]},{"id":"ieee-rsj-international-conference-on-intelligent-robots-and","category":"industry","sec":3,"tier":2,"sources":[{"title":"Wikipedia: International Conference on Intelligent Robots and Systems","url":"https://en.wikipedia.org/wiki/International_Conference_on_Intelligent_Robots_and_Systems"}],"as_of":"2026-09","related_ids":["ieee-international-conference-on-robotics-and-automation","conference-on-robot-learning","robotics-science-and-systems","ieee-ras-international-conference-on-humanoid-robots","ieee-t-ro-ijrr-ra-l","top-tier-conferences-and-journals"],"name":"IROS","alt":"IEEE/RSJ International Conference on Intelligent Robots and Systems","abbr":"IROS","aliases":["智能机器人与系统国际会议","IEEE/RSJ 智能机器人与系统国际会议"],"one_liner":"与 ICRA 并列的年度大型机器人学术会议，每年秋季举办。","explanation":"IROS 全称 IEEE/RSJ 智能机器人与系统国际会议，1988 年在东京首次举办，由 IEEE 和日本机器人学会（RSJ）等联合主办，一般在秋季召开，每年投稿超过 2000 篇。研究范围和 ICRA 高度重合，从运动控制、感知、SLAM 到机器人学习都有，业内常把两者合称机器人两大会。它在亚洲、欧洲、美洲之间轮换举办：2024 年在阿布扎比，2025 年在杭州，2026 年在美国匹兹堡，2027 年定在意大利佛罗伦萨。新人投稿时，IROS 和 ICRA 常被当作机器人方向的首选会议。","example":"激光 SLAM 里常用的 LIO-SAM 就发表在 IROS 2020。","related":["ICRA","CoRL","RSS","Humanoids 会议","T-RO / IJRR / RA-L（机器人期刊）","顶会 / 顶刊（CCF-A）"]},{"id":"conference-on-robot-learning","category":"industry","sec":3,"tier":2,"sources":[{"title":"Conference on Robot Learning (CoRL)","url":"https://www.corl.org/"}],"as_of":"","related_ids":["robotics-science-and-systems","ieee-international-conference-on-robotics-and-automation","ieee-rsj-international-conference-on-intelligent-robots-and","robot-learning","top-tier-conferences-and-journals"],"name":"CoRL","alt":"Conference on Robot Learning","abbr":"CoRL","aliases":["机器人学习会议"],"one_liner":"专注机器人与机器学习交叉方向的年度国际学术会议。","explanation":"CoRL 创办于 2017 年，每年举办一次，主题是机器人学习，即用机器学习方法让机器人感知、决策和控制。和综合性的 ICRA、IROS 相比，它规模更小、方向更聚焦，是具身智能、VLA（视觉-语言-动作模型）、模仿学习、强化学习等工作的重要发表地，论文集收录在 PMLR。关注具身智能前沿时，CoRL 与 RSS、ICRA 往往一起看。","example":"RT-2 和 OpenVLA 等代表性 VLA 论文都发表在 CoRL 上。","related":["RSS","ICRA","IROS","机器人学习","顶会 / 顶刊（CCF-A）"]},{"id":"robotics-science-and-systems","category":"industry","sec":3,"tier":2,"sources":[{"title":"Robotics: Science and Systems 官网","url":"https://roboticsconference.org/"}],"as_of":"","related_ids":["ieee-international-conference-on-robotics-and-automation","ieee-rsj-international-conference-on-intelligent-robots-and","conference-on-robot-learning","top-tier-conferences-and-journals","science-robotics"],"name":"RSS","alt":"Robotics: Science and Systems","abbr":"RSS","aliases":["机器人科学与系统会议"],"one_liner":"机器人领域单轨制的顶级学术会议，每年一届","explanation":"RSS 是机器人领域最有影响力的学术会议之一，2005 年起每年举办，采用单轨制（所有论文在同一会场依次报告），录用量比 ICRA、IROS 少得多，以审稿严格、论文质量高著称。机器人学习、操作、运动规划等方向的重要工作常发在这里，和 CoRL 一起被视为机器人学习最受关注的会议。新人读论文时看到「RSS 20XX」可理解为这一方向的高质量工作；投稿截止一般在每年年初，会议在夏季举行。","example":"扩散策略（Diffusion Policy）论文发表于 RSS 2023。","related":["ICRA","IROS","CoRL","顶会 / 顶刊（CCF-A）","Science Robotics"]},{"id":"science-robotics","category":"industry","sec":3,"tier":2,"sources":[{"title":"Science Robotics 期刊主页","url":"https://www.science.org/journal/scirobotics"}],"as_of":"","related_ids":["ieee-t-ro-ijrr-ra-l","robotics-science-and-systems","top-tier-conferences-and-journals","anymal-rl-locomotion-series"],"name":"Science Robotics","alt":"Science Robotics","abbr":"","aliases":[],"one_liner":"《科学》杂志旗下专门发机器人研究的顶级期刊","explanation":"Science Robotics 是美国科学促进会（AAAS）出版的《Science》子刊，2016 年创刊，每月出版，覆盖机器人硬件、控制、学习、医疗机器人、仿生等方向。它偏好有完整系统和真实世界验证的工作，发表量少、影响力大，是机器人领域最受认可的期刊之一。和会议论文不同，期刊文章审稿周期长、写法更完整，常附大量视频材料。腿足机器人强化学习运控等方向的多篇代表作都发表在这里。","example":"ANYmal 在复杂地形上的感知行走工作（Miki 等，2022）发表于 Science Robotics。","related":["T-RO / IJRR / RA-L（机器人期刊）","RSS","顶会 / 顶刊（CCF-A）","ANYmal 强化学习运控系列（执行器网络 / 教师-学生盲走 / 感知行走）"]},{"id":"ieee-t-ro-ijrr-ra-l","category":"industry","sec":3,"tier":3,"sources":[{"title":"IEEE Transactions on Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/IEEE_Transactions_on_Robotics"},{"title":"The International Journal of Robotics Research - Wikipedia","url":"https://en.wikipedia.org/wiki/The_International_Journal_of_Robotics_Research"}],"as_of":"","related_ids":["ieee-international-conference-on-robotics-and-automation","ieee-rsj-international-conference-on-intelligent-robots-and","conference-on-robot-learning","robotics-science-and-systems","science-robotics","top-tier-conferences-and-journals"],"name":"T-RO / IJRR / RA-L（机器人期刊）","alt":"IEEE Transactions on Robotics / The International Journal of Robotics Research / IEEE Robotics and Automation Letters","abbr":"","aliases":["T-RO","TRO","IJRR","RA-L","RAL"],"one_liner":"机器人领域最常被提到的三本学术期刊","explanation":"这三本是机器人方向最常被提到的期刊。T-RO 由 IEEE 机器人与自动化学会（RAS）主办，前身 1985 年创刊，偏完整的理论和系统工作；IJRR 由 SAGE 出版，1982 年创刊，是历史最久的机器人期刊之一，同样以长文和高门槛著称；RA-L 是 RAS 办的快报期刊，篇幅短、审稿周期快，录用后可以申请到 ICRA、IROS 等会议上宣讲。机器人学习方向很多成果先发 CoRL、RSS 等会议，期刊更多用来发表扩展后的完整版本，求职和评审时常被当作分量较重的发表。","example":"一篇 ICRA 投稿也可以走「投 RA-L 并在 ICRA 宣讲」的通道，录用后既算期刊论文也能上会。","related":["ICRA","IROS","CoRL","RSS","Science Robotics","顶会 / 顶刊（CCF-A）"]},{"id":"ieee-ras-international-conference-on-humanoid-robots","category":"industry","sec":3,"tier":3,"sources":[{"title":"About IEEE RAS","url":"https://www.ieee-ras.org/about-ras"}],"as_of":"","related_ids":["ieee-international-conference-on-robotics-and-automation","ieee-rsj-international-conference-on-intelligent-robots-and","conference-on-robot-learning","robotics-science-and-systems","humanoid-robot","whole-body-control"],"name":"Humanoids 会议","alt":"IEEE-RAS International Conference on Humanoid Robots","abbr":"Humanoids","aliases":["IEEE 人形机器人国际会议","IEEE-RAS Humanoids"],"one_liner":"IEEE 机器人与自动化学会主办的人形机器人专门国际会议","explanation":"Humanoids 是 IEEE 机器人与自动化学会（RAS）主办的国际会议，2000 年首届，之后基本每年一届，专门讨论人形机器人。常见主题包括双足行走与平衡控制、全身控制、人形灵巧手、动作模仿与遥操作、人机交互等。它的规模比 ICRA、IROS 这类综合性机器人大会小，但领域更聚焦，做人形运控、全身控制的研究组常把工作投到这里，也常有新的人形本体在会上展示。新人读人形相关论文时，会经常在引用里看到「Humanoids 20xx」。","example":"人形全身遥操作、跌倒恢复、双足步态这类论文，常见投稿去向之一就是 Humanoids。","related":["ICRA","IROS","CoRL","RSS","人形机器人","全身控制"]},{"id":"china-embodied-ai-conference","category":"industry","sec":3,"tier":3,"sources":[{"title":"中国人工智能学会官网","url":"http://www.caai.cn/"}],"as_of":"","related_ids":["world-robot-conference","world-artificial-intelligence-conference","conference-on-robot-learning","ieee-international-conference-on-robotics-and-automation","embodied-ai"],"name":"中国具身智能大会（CEAI）","alt":"China Embodied AI Conference (CEAI)","abbr":"CEAI","aliases":["具身智能大会"],"one_liner":"国内以具身智能为主题的年度学术会议。","explanation":"中国具身智能大会（CEAI）是国内学术界专门围绕具身智能召开的年度会议，据报道由中国人工智能学会等单位主办、2024 年起举办。会上通常有特邀报告、专题论坛、论文和机器人展示，内容覆盖具身大模型、机器人操作与运动控制、数据采集、仿真和评测。它的作用是把国内做视觉、机器学习、机器人控制的研究者和企业聚到一起交流，新人可以通过它的报告和论坛议程了解国内有哪些团队、各自在做什么方向。它和 ICRA、CoRL 这类国际会议不同，偏重交流而非严格的论文发表。","example":"","related":["世界机器人大会","世界人工智能大会","CoRL","ICRA","具身智能"]},{"id":"world-artificial-intelligence-conference","category":"industry","sec":4,"tier":2,"sources":[{"title":"世界人工智能大会官网","url":"https://www.worldaic.com.cn/"},{"title":"World Artificial Intelligence Conference - Wikipedia","url":"https://en.wikipedia.org/wiki/World_Artificial_Intelligence_Conference"}],"as_of":"2025","related_ids":["world-robot-conference","world-humanoid-robot-games","nvidia-gtc","consumer-electronics-show","humanoid-robot"],"name":"世界人工智能大会","alt":"World Artificial Intelligence Conference","abbr":"WAIC","aliases":["WAIC"],"one_liner":"每年在上海举办的综合性人工智能大会和展会","explanation":"世界人工智能大会自 2018 年起每年在上海举办，一般在夏季，由上海市政府联合国家有关部委等主办，包括主论坛、分论坛和大型展览。它覆盖大模型、芯片、自动驾驶等整个 AI 领域，近几年人形机器人和具身智能展区是焦点之一，许多国内公司会选在 WAIC 发布新本体或新模型，是观察国内具身智能进展的重要窗口。","example":"","related":["世界机器人大会","世界人形机器人运动会","英伟达 GTC 大会","CES 国际消费电子展","人形机器人"]},{"id":"world-robot-conference","category":"industry","sec":4,"tier":2,"sources":[{"title":"世界机器人大会官网","url":"https://www.worldrobotconference.com/"}],"as_of":"2025","related_ids":["world-artificial-intelligence-conference","world-humanoid-robot-games","humanoid-robot","upstream-midstream-downstream-of-the-industry-chain","beijing-humanoid-robot-innovation-center"],"name":"世界机器人大会","alt":"World Robot Conference","abbr":"WRC","aliases":["WRC"],"one_liner":"每年在北京举办的机器人专业大会，含论坛、展览和竞赛","explanation":"世界机器人大会自 2015 年起在北京举办，一般在 8 月，由北京市政府、工业和信息化部、中国科协等共同主办，中国电子学会承办，包括论坛、博览会和机器人大赛三部分。和综合性的 WAIC 相比，它更聚焦机器人本身，工业机器人、零部件、人形和服务机器人厂商集中参展，近年人形机器人数量和整机、零部件新品发布是看点。","example":"","related":["世界人工智能大会","世界人形机器人运动会","人形机器人","产业链上中下游","北京人形机器人创新中心"]},{"id":"nvidia-gtc","category":"industry","sec":4,"tier":2,"sources":[{"title":"NVIDIA GTC","url":"https://www.nvidia.com/gtc/"},{"title":"NVIDIA Isaac GR00T","url":"https://developer.nvidia.com/isaac/gr00t"}],"as_of":"2025-03","related_ids":[null,"nvidia-isaac-gr00t-n1","nvidia-cosmos","newton-physics-engine","nvidia-three-computer-solution","physical-ai"],"name":"英伟达 GTC 大会","alt":"NVIDIA GTC (GPU Technology Conference)","abbr":"GTC","aliases":["GTC 大会","GTC"],"one_liner":"英伟达每年举办的 AI 与 GPU 技术大会，黄仁勋在此发布新品","explanation":"GTC 是英伟达主办的技术大会，全称 GPU Technology Conference，主会场通常每年春季在美国加州圣何塞，另有面向其他地区的场次。创始人黄仁勋的主题演讲会发布新一代 GPU、软件平台和合作伙伴动态，是观察 AI 算力和英伟达战略的风向标。近几年机器人和物理 AI 是 GTC 重点：2024 年发布人形机器人基础模型计划 Project GR00T，2025 年开源 GR00T N1，并公布与谷歌 DeepMind、迪士尼合作的 Newton 物理引擎。每届 GTC 往往带动一批机器人公司同步发布合作新闻。","example":"GTC 2025 主题演讲中，黄仁勋宣布开源人形机器人基础模型 Isaac GR00T N1。","related":["英伟达(NVIDIA)","GR00T N1 系列","Cosmos","Newton 物理引擎","英伟达三台计算机","物理AI"]},{"id":"consumer-electronics-show","category":"industry","sec":4,"tier":3,"sources":[{"title":"Consumer Electronics Show - Wikipedia","url":"https://en.wikipedia.org/wiki/Consumer_Electronics_Show"},{"title":"CES 官网","url":"https://www.ces.tech/"}],"as_of":"2026-01","related_ids":["nvidia-gtc","nvidia-cosmos","boston-dynamics-atlas-2","lg-cloid","physical-ai","world-robot-conference"],"name":"CES 国际消费电子展","alt":"Consumer Electronics Show","abbr":"CES","aliases":["CES","拉斯维加斯消费电子展"],"one_liner":"每年 1 月在拉斯维加斯举办的全球最大消费电子展会。","explanation":"CES 由美国消费技术协会（CTA）主办，1967 年首办，现在每年 1 月在美国拉斯维加斯举行，是电视、手机、汽车电子等厂商发布新品的大型展会。近几年它成了物理 AI 和人形机器人的重要发布场：2025 年 1 月英伟达在 CES 上发布 Cosmos 世界基础模型平台，黄仁勋称机器人的「ChatGPT 时刻」即将到来；2026 年 1 月波士顿动力发布产品版电动 Atlas，LG 展示家用机器人 CLOiD，不少中国人形机器人公司也到现场演示。关注行业动态时，每年 1 月的 CES 和 3 月的英伟达 GTC 是两个集中出新闻的时间点。","example":"2026 年 1 月 CES 上，现代汽车集团与波士顿动力展示量产版 Atlas，并宣布计划部署到汽车工厂。","related":["英伟达 GTC 大会","Cosmos","波士顿动力 Atlas（电动版）","LG CLOiD","物理AI","世界机器人大会"]},{"id":"tesla-ai-day","category":"industry","sec":4,"tier":3,"sources":[{"title":"Optimus (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Optimus_(robot)"}],"as_of":"2022-09","related_ids":["tesla-optimus","tesla","tesla-we-robot-event","tesla-supply-chain","humanoid-robot"],"name":"特斯拉 AI Day","alt":"Tesla AI Day","abbr":"","aliases":["AI Day"],"one_liner":"特斯拉 2021、2022 年办的技术发布会，Optimus 人形机器人从这里亮相。","explanation":"AI Day 是特斯拉面向技术人员和招聘的发布会，共办过两届。2021 年 8 月的首届主要讲自动驾驶和 Dojo 超级计算机，最后公布了人形机器人 Tesla Bot 的概念，当时台上只是真人穿戏服表演。2022 年 9 月的第二届展示了 Optimus 原型机，机器人走上舞台，马斯克称目标售价低于 2 万美元。这两场发布会被普遍认为带动了国内外人形机器人的创业和投资热潮。","example":"2022 年 AI Day 上，Optimus 早期原型机无外壳走上舞台并挥手。","related":["擎天柱","特斯拉","特斯拉 We, Robot 发布会","T 链（特斯拉链）","人形机器人"]},{"id":"tesla-we-robot-event","category":"industry","sec":4,"tier":3,"sources":[{"title":"Optimus (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Optimus_(robot)"},{"title":"Tesla AI & Robotics","url":"https://www.tesla.com/AI"}],"as_of":"2024-10","related_ids":["tesla-optimus","tesla","tesla-ai-day","teleoperated-demo","fully-autonomous","remote-teleoperation-takeover"],"name":"特斯拉 We, Robot 发布会","alt":"Tesla We, Robot Event (2024)","abbr":"","aliases":["We, Robot","We Robot 发布会"],"one_liner":"特斯拉 2024 年 10 月的发布会，推出 Cybercab，Optimus 现场与观众互动。","explanation":"We, Robot 是特斯拉 2024 年 10 月在加州华纳兄弟片场举办的发布会，主要发布了无人驾驶出租车 Cybercab 和 Robovan。现场多台 Optimus 人形机器人给观众倒饮料、聊天、跳舞，马斯克称 Optimus 未来售价约 2 万到 3 万美元。事后多家媒体报道，机器人的对话和部分动作由人远程遥操作完成，并非全自主。这场活动常被用作例子，提醒大家看机器人演示时要分清遥操作和全自主。","example":"发布会上 Optimus 在吧台给来宾倒饮料，据报道背后有人在远程操控。","related":["擎天柱","特斯拉","特斯拉 AI Day","遥操作演示","全自主","远程接管（人工兜底）"]},{"id":"yangbot","category":"industry","sec":4,"tier":2,"sources":[{"title":"Unitree Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Unitree_Robotics"}],"as_of":"2025-01","related_ids":["wubot","unitree-h1","unitree-robotics","pre-programmed-motion","commercial-robot-performances"],"name":"《秧BOT》","alt":"Yangbot (Unitree H1 Yangge Dance, 2025 Spring Festival Gala)","abbr":"","aliases":["春晚机器人扭秧歌","秧BOT"],"one_liner":"2025 年央视春晚上宇树 H1 人形机器人扭秧歌的节目","explanation":"《秧BOT》是 2025 年中央广播电视总台春节联欢晚会的一个节目，宇树科技的 H1 人形机器人与新疆艺术学院的舞者一起扭秧歌、转手绢。节目让人形机器人第一次在国内最大的电视晚会上集体亮相，被普遍视为人形机器人进入大众视野的标志性事件，此后宇树乃至整个人形机器人赛道的关注度明显升高。舞蹈动作是预先编排的，并不代表机器人已具备通用自主能力。","example":"","related":["《武BOT》","宇树 H1","宇树科技","预编程动作（动作编排）","商演"]},{"id":"wubot","category":"industry","sec":4,"tier":3,"sources":[{"title":"宇树科技官网","url":"https://www.unitree.com/"}],"as_of":"2026-02","related_ids":["yangbot","unitree-robotics","pre-programmed-motion","motion-tracking","whole-body-control","commercial-robot-performances"],"name":"《武BOT》","alt":"Wubot (Unitree Kung-fu Performance, 2026 Spring Festival Gala)","abbr":"","aliases":["春晚机器人武术","武BOT"],"one_liner":"2026 年央视春晚上宇树人形机器人的武术表演节目","explanation":"《武BOT》是 2026 年中央广播电视总台春节联欢晚会上的机器人武术节目，由宇树科技的人形机器人参与表演，据报道机器人与武术演员同台完成拳术、器械等动作。它是 2025 年春晚《秧BOT》（宇树 H1 扭秧歌）之后，宇树第二次登上春晚。这类节目里的动作一般是事先编排好、用动作捕捉数据训练运动跟踪策略再上机执行，展示的是全身运动控制和平衡能力，不代表机器人能自主理解和应对任意场景。它也是大众认识人形机器人的重要窗口。","example":"","related":["《秧BOT》","宇树科技","预编程动作（动作编排）","运动跟踪","全身控制","商演"]},{"id":"hangzhou-s-six-little-dragons","category":"industry","sec":4,"tier":3,"sources":[{"title":"杭州六小龙 - 维基百科","url":"https://zh.wikipedia.org/wiki/%E6%9D%AD%E5%B7%9E%E5%85%AD%E5%B0%8F%E9%BE%99"}],"as_of":"2025-02","related_ids":["unitree-robotics","deep-robotics","brainco","manycore-tech","yangbot"],"name":"杭州六小龙","alt":"Hangzhou's Six Little Dragons","abbr":"","aliases":[],"one_liner":"2025 年走红的杭州六家科技公司合称，其中两家做机器人","explanation":"杭州六小龙是 2025 年初在中文网络和媒体中流行起来的叫法，指总部在杭州的六家科技公司：游戏科学、深度求索（DeepSeek）、宇树科技、云深处科技、强脑科技和群核科技。走红背景是《黑神话：悟空》、DeepSeek 模型和宇树机器人登上春晚接连出圈。六家里宇树和云深处做四足与人形机器人，强脑科技做脑机接口和仿生手，群核科技做空间设计软件和空间智能模型，因此这个词常出现在具身智能相关报道里。它是媒体称呼，不是官方名单。","example":"宇树科技的人形机器人在 2025 年春晚表演《秧BOT》后，「杭州六小龙」的说法迅速传播。","related":["宇树科技","云深处科技","强脑科技","群核科技","《秧BOT》"]},{"id":"world-humanoid-robot-games","category":"industry","sec":4,"tier":2,"sources":[{"title":"World Humanoid Robot Games - Wikipedia","url":"https://en.wikipedia.org/wiki/World_Humanoid_Robot_Games"}],"as_of":"2025-08","related_ids":["humanoid-robot-half-marathon","world-robot-conference","robocup","humanoid-robot","fall-recovery"],"name":"世界人形机器人运动会","alt":"World Humanoid Robot Games","abbr":"WHRG","aliases":["机器人奥运会","人形机器人运动会"],"one_liner":"2025 年 8 月在北京首办、专为人形机器人设的综合运动会","explanation":"首届世界人形机器人运动会于 2025 年 8 月在北京举办，设田径、足球、格斗等竞技项目，以及物料搬运、药品分拣等场景赛，参赛队伍来自国内外企业和高校。媒体常称它为「机器人奥运会」。它的意义在于把行走、平衡、摔倒起身、多机协作这些运动控制能力放到公开赛场上比较，也暴露了当前人形机器人续航、稳定性上的短板。","example":"据报道，宇树 H1 在首届运动会上获得 1500 米比赛冠军。","related":["人形机器人半程马拉松","世界机器人大会","RoboCup 机器人世界杯","人形机器人","跌倒恢复（摔倒起身）"]},{"id":"humanoid-robot-half-marathon","category":"industry","sec":4,"tier":2,"sources":[{"title":"北京人形：天工自主跑完北京亦庄半马","url":"https://x-humanoid.com/news-view-164.html"},{"title":"百余台机器人同跑半马 「闪电」超越人类纪录（新华网）","url":"https://www.news.cn/sports/20260419/0834250af22d4432ac708322aa8f7123/c.html"},{"title":"马拉松亚军人形机器人「松延动力 N2」被拍卖（IT之家）","url":"https://www.ithome.com/0/847/782.htm"},{"title":"50分26秒！2026北京亦庄人形机器人半马冠军出炉（澎湃新闻）","url":"https://m.thepaper.cn/newsDetail_forward_33004042"},{"title":"一年提速近两小时、从遥控到自主、跑赢人类！人形机器人「半马」刷新纪录（每日经济新闻，2026-04-19）","url":"https://www.nbd.com.cn/articles/2026-04-19/4345990.html"},{"title":"Kiplimo breaks world half marathon record with 57:20 on Lisbon return（World Athletics，2026-03-08）","url":"https://worldathletics.org/competitions/world-athletics-label-road-races/news/jacob-kiplimo-half-marathon-world-record-lisbon"}],"as_of":"2026-04","related_ids":["world-humanoid-robot-games","tiangong","honor-lightning-humanoid-robot","noetix-n2","beijing-humanoid-robot-innovation-center","battery-runtime"],"name":"人形机器人半程马拉松","alt":"Humanoid Robot Half Marathon (Beijing E-Town)","abbr":"","aliases":["机器人半马","亦庄半马","北京亦庄人形机器人半程马拉松"],"one_liner":"北京亦庄举办的人形机器人跑半马（约 21 公里）比赛，首届在 2025 年 4 月。","explanation":"在北京经济技术开发区（亦庄）举办的人形机器人半程马拉松，机器人与人类跑者同日比赛、分道跑完约 21 公里。首届在 2025 年 4 月举行，被宣传为全球首个人形机器人半马：北京人形机器人创新中心的天工 Ultra 以 2 小时 40 分 42 秒夺冠，松延动力 N2 获得亚军。2026 年 4 月 19 日的第二届有百余台机器人参赛，遥控组成绩乘 1.2 后与自主导航组统一排名：荣耀「闪电」自主跑出净时 50 分 26 秒夺冠，荣耀包揽前三；率先冲线的遥控「闪电」净时 48 分 19 秒，折算后未能夺冠。冠军成绩快于当时的人类男子半马世界纪录 57 分 20 秒（乌干达选手基普利莫 2026 年 3 月在里斯本创造；部分报道引用的 56 分 42 秒是他 2025 年在巴塞罗那的成绩，未获世界田联认可）。这项比赛考的是长时间运动的稳定性、电机散热和续航，不涉及操作能力，看成绩时要注意这一点。","example":"2026 年比赛中，夺冠的「闪电」自主跑完 21.0975 公里，中途只在 10.6 公里处换了一次电池。","related":["世界人形机器人运动会","天工","荣耀「闪电」人形机器人","松延动力 N2","北京人形机器人创新中心","续航"]},{"id":"cmg-world-robot-competition-mecha-fighting-series","category":"industry","sec":4,"tier":3,"sources":[{"title":"Robot combat - Wikipedia","url":"https://en.wikipedia.org/wiki/Robot_combat"}],"as_of":"2025","related_ids":["unitree-g1","unitree-robotics","ultimate-robot-knock-out-legend","teleoperation","fall-recovery","commercial-robot-performances"],"name":"CMG 机甲格斗擂台赛","alt":"CMG World Robot Competition - Mecha Fighting Series","abbr":"","aliases":["机器人格斗赛","机器人拳击赛","机甲格斗擂台赛"],"one_liner":"央视总台办的人形机器人格斗比赛，宇树 G1 由人遥控对打。","explanation":"CMG 是中央广播电视总台（China Media Group）的英文缩写。机甲格斗擂台赛是其「CMG 世界机器人大赛」系列赛的一项，2025 年在杭州举办并电视直播，参赛的是宇树 G1 人形机器人，由选手遥控出拳、踢腿对打。比赛展示的主要是机器人的平衡、抗冲击和摔倒后自己站起来的运动控制能力，而不是自主决策——出招由人操控。它把人形机器人带进了大众视野，也让「机器人格斗」成为一类商演和赛事形式，之后出现了 URKL 等格斗联赛。看这类比赛时要分清哪些是遥操作、哪些是自主。","example":"比赛中机器人被踢倒后靠跌倒恢复策略自己爬起来继续比赛，这一能力来自仿真里用强化学习训练的运控策略。","related":["宇树 G1","宇树科技","URKL 格斗联赛","遥操作","跌倒恢复（摔倒起身）","商演"]},{"id":"ultimate-robot-knock-out-legend","category":"industry","sec":4,"tier":3,"sources":[{"title":"众擎机器人官网","url":"https://www.engineai.com.cn/"}],"as_of":"2025-12","related_ids":["cmg-world-robot-competition-mecha-fighting-series","engineai","engineai-t800","teleoperation","commercial-robot-performances","world-humanoid-robot-games"],"name":"URKL 格斗联赛","alt":"Ultimate Robot Knock-out Legend","abbr":"URKL","aliases":["众擎人形机器人格斗联赛","URKL"],"one_liner":"众擎机器人发起的人形机器人擂台格斗赛事","explanation":"URKL 是深圳众擎机器人（EngineAI）发起的人形机器人格斗联赛，形式是由参赛者操控人形机器人上擂台对抗，按击倒或得分判定胜负。这类赛事和 CMG 机甲格斗擂台赛类似，目的主要是展示本体的抗摔、平衡和快速动作能力，同时带动品牌曝光和商演、租赁等生意。需要注意，擂台上的机器人通常由人通过遥操作或手柄下指令，运动控制由底层策略完成，并不是机器人自主决定怎么打，看比赛视频时要分清哪些是人在操控、哪些是机器人自己的能力。","example":"","related":["CMG 机甲格斗擂台赛","众擎机器人","众擎 T800","遥操作","商演","世界人形机器人运动会"]},{"id":"roboleague","category":"industry","sec":4,"tier":3,"sources":[{"title":"RoboCup 官网（机器人足球赛事对照）","url":"https://www.robocup.org/"}],"as_of":"2025-06","related_ids":["robocup","world-humanoid-robot-games","booster-robotics-t1","multi-robot-collaboration","fall-recovery"],"name":"RoboLeague 机器人足球联赛","alt":"RoboLeague Robot Football League","abbr":"","aliases":["机器人足球赛","RoboLeague"],"one_liner":"国内的人形机器人全自主足球赛事，机器人自己看球、跑位、射门。","explanation":"RoboLeague 是国内举办的人形机器人足球联赛。据报道，2025 年 6 月在北京亦庄进行了 3V3 比赛，几支高校队伍使用同款小尺寸人形机器人，比赛中机器人全程自主决策，人类不遥控，这场比赛也被当作世界人形机器人运动会的预热。它考验的是感知（找球、认队友）、运动控制（跑动、摔倒后起身）和多机器人协作能力，比拼的主要是各队写的算法。可以把它和历史更久的 RoboCup 对照着看。","example":"据报道，2025 年 6 月北京亦庄的 RoboLeague 比赛中，清华大学火神队夺冠。","related":["RoboCup 机器人世界杯","世界人形机器人运动会","加速进化 Booster T1","多机器人协作","跌倒恢复（摔倒起身）"]},{"id":"robocup","category":"industry","sec":4,"tier":3,"sources":[{"title":"RoboCup - Wikipedia","url":"https://en.wikipedia.org/wiki/RoboCup"},{"title":"RoboCup Federation official site","url":"https://www.robocup.org/"}],"as_of":"2026-09","related_ids":["roboleague","booster-robotics-t1","softbank-robotics-nao","op3-soccer","multi-robot-collaboration","robomaster-robocon-university-robotics-competitions"],"name":"RoboCup 机器人世界杯","alt":"RoboCup","abbr":"","aliases":["机器人世界杯","RoboCup 世界杯"],"one_liner":"以机器人足球为核心、每年举办的国际机器人竞赛和学术活动","explanation":"RoboCup 是 1997 年起每年举办的国际机器人竞赛，由 RoboCup 联合会组织，首届在日本名古屋。它的长期目标是：到本世纪中叶，让一支全自主人形机器人足球队按国际足联规则战胜当届世界杯冠军。比赛以机器人足球为主（分人形、标准平台、小型、中型、仿真等组），也有救援、家庭服务 @Home、工业和青少年赛项。它是检验双足行走、多机协作、实时感知决策的公开场所，很多运控和多智能体研究以它为平台。","example":"2025 年巴西 RoboCup 上，清华火神队用加速进化 Booster T1 获得人形成人组冠军；标准平台组则各队统一用 NAO 机器人，只比软件。","related":["RoboLeague 机器人足球联赛","加速进化 Booster T1","NAO 机器人","OP3 足球（DeepMind 双足踢球）","多机器人协作","RoboMaster / ROBOCON 大学生机器人竞赛"]},{"id":"robomaster-robocon-university-robotics-competitions","category":"industry","sec":4,"tier":3,"sources":[{"title":"RoboMaster 官网","url":"https://www.robomaster.com/"},{"title":"ABU Robocon - Wikipedia","url":"https://en.wikipedia.org/wiki/ABU_Robocon"}],"as_of":"","related_ids":["dji","robocup","embedded-software-development","stmicroelectronics-stm32-mcu-family","darpa-robotics-challenge"],"name":"RoboMaster / ROBOCON 大学生机器人竞赛","alt":"RoboMaster / ROBOCON University Robotics Competitions","abbr":"","aliases":["机甲大师赛","全国大学生机器人大赛","ABU Robocon"],"one_liner":"国内最有名的两项大学生机器人比赛，很多机器人工程师从这里入行。","explanation":"RoboMaster（机甲大师赛）由大疆创新发起，大学生队伍自己设计制造机器人，进行射击对抗，涉及机械、电控、视觉瞄准和嵌入式开发。ROBOCON 源自亚洲-太平洋广播联盟的 ABU Robocon，每年换一道题，比如投球、搬运，国内选拔赛由中央电视台等参与举办。两者都要求学生从零搭一台能用的机器人，锻炼整机工程能力。具身智能公司招聘时常把这类比赛经历当作动手能力的参考。","example":"不少国内机器人创业公司的核心工程师在本科阶段参加过 RoboMaster 战队。","related":["大疆创新","RoboCup 机器人世界杯","嵌入式软件开发","STM32","DARPA 机器人挑战赛"]},{"id":"darpa-robotics-challenge","category":"industry","sec":4,"tier":3,"sources":[{"title":"DARPA Robotics Challenge - Wikipedia","url":"https://en.wikipedia.org/wiki/DARPA_Robotics_Challenge"}],"as_of":"","related_ids":["defense-advanced-research-projects-agency","boston-dynamics-atlas","florida-institute-for-human-and-machine-cognition","humanoid-robot","special-purpose-robot"],"name":"DARPA 机器人挑战赛","alt":"DARPA Robotics Challenge (DRC)","abbr":"DRC","aliases":["DRC","DARPA 机器人挑战赛（DRC）"],"one_liner":"2012–2015 年美国 DARPA 办的灾难救援人形机器人比赛。","explanation":"DARPA 机器人挑战赛是美国国防高级研究计划局在 2011 年福岛核事故后发起的比赛，2012 年启动，要求机器人在模拟灾难现场完成开车、下车、开门、转阀门、用电钻在墙上开洞、越过碎石和爬楼梯等 8 项任务。DARPA 出资让波士顿动力造了多台液压版 Atlas，供部分参赛队使用。2015 年 6 月决赛在加州波莫纳举行，25 支队伍争夺 350 万美元奖金，韩国 KAIST 的 DRC-HUBO 夺冠，IHMC 第二，卡内基梅隆大学 Tartan Rescue 第三。比赛中机器人动作缓慢、频繁摔倒，暴露出当年人形机器人在感知、平衡和自主性上的局限，也培养了一批后来的人形机器人研究骨干。","example":"决赛中多台机器人在下车或开门时摔倒，这些画面被剪成合集广为流传。","related":["DARPA（美国国防高级研究计划局）","液压版 Atlas","IHMC（美国人机认知研究所）","人形机器人","特种机器人"]},{"id":"amazon-picking-challenge","category":"industry","sec":4,"tier":3,"sources":[{"title":"Analysis and Observations from the First Amazon Picking Challenge (arXiv 1601.05484)","url":"https://arxiv.org/abs/1601.05484"}],"as_of":"2017","related_ids":["order-picking","bin-picking","vacuum-suction-cup","amazon-robotics","benchmark","darpa-robotics-challenge"],"name":"亚马逊拣选挑战赛","alt":"Amazon Picking Challenge (Amazon Robotics Challenge)","abbr":"APC / ARC","aliases":["Amazon Picking Challenge","Amazon Robotics Challenge"],"one_liner":"亚马逊 2015–2017 年举办的仓储货架拣货机器人比赛","explanation":"亚马逊为解决电商仓库里「从货架上把各种商品拿出来」这一仍靠人工的环节，于 2015 年发起这项比赛，首届在 ICRA 2015 举办，共 26 支队伍参加。机器人要在限定时间内自主识别并从货架格子里取出指定商品，商品形状、材质差异大，还有遮挡和透明包装。2016 年加入把商品放上货架的任务，2017 年改名亚马逊机器人挑战赛（ARC）后停办。比赛暴露了感知、抓取规划和末端设计的难点，吸盘加深度学习识别成为常见方案，也被视为后来仓储拣选机器人和无序抓取研究的重要推手。","example":"2015 年首届赛事后，组织者对 26 支参赛队做了问卷，分析机械设计、感知和规划选择与成绩的关系，写成论文发表。","related":["拣选（订单拣货）","无序抓取","真空吸盘","亚马逊机器人","基准测试","DARPA 机器人挑战赛"]},{"id":"mass-production","category":"industry","sec":5,"tier":1,"sources":[{"title":"BotQ: A High-Volume Manufacturing Facility for Humanoid Robots (Figure)","url":"https://www.figure.ai/news/botq"},{"title":"Mass production - Wikipedia","url":"https://en.wikipedia.org/wiki/Mass_production"}],"as_of":"2025-03","related_ids":["year-one-of-mass-production","bill-of-materials-cost","shipment-volume","yield-rate-manufacturing-consistency","start-of-production","botq"],"name":"量产","alt":"Mass Production","abbr":"","aliases":["千台量产","规模量产"],"one_liner":"产品从做几台样机变成按固定工艺大批量、稳定地生产。","explanation":"指产品定型后用标准化产线和稳定供应链成批制造，与手工拼装的样机、几十台的小批量相对。人形机器人公司常把「千台量产」「量产元年」当作里程碑宣传。真正量产要解决一致性和良率（每台性能一样、次品少）、BOM 成本（整机物料总成本）和交付节奏，而不只是造得出来。判断时看实际出货量和交付给了谁，而不是产能规划或框架订单；公司口径的「量产」有时只是开始小批量交付。","example":"Figure 2025 年 3 月公布自建人形机器人工厂 BotQ，称第一代产线年产能最高 1.2 万台；这是产能上限，不等于实际出货量。","related":["量产元年","BOM 成本","出货量","良率 / 一致性","SOP（量产启动）","Figure BotQ 工厂"]},{"id":"year-one-of-mass-production","category":"industry","sec":5,"tier":2,"sources":[{"title":"Humanoid robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Humanoid_robot"}],"as_of":"2025","related_ids":["mass-production","shipment-volume","framework-order-letter-of-intent-order","pilot-small-batch-delivery","start-of-production","yield-rate-manufacturing-consistency"],"name":"量产元年","alt":"Year One of Mass Production","abbr":"","aliases":["人形机器人量产元年","商业化元年"],"one_liner":"行业和媒体对「某一年开始批量生产交付」的说法","explanation":"「量产元年」是券商研报、企业和媒体常用的说法，不是官方统计口径。2025 年常被称为人形机器人量产元年，因为多家公司宣布了数百到上千台级别的生产和交付计划。新人读到这个词要注意：各家「量产」的门槛并不统一，可能指建成产线、小批量交付或拿到框架订单，实际出货量要看具体交付数据和客户，而不是看口号。","example":"","related":["量产","出货量","框架订单 / 意向订单","试点 / 小批量交付","SOP（量产启动）","良率 / 一致性"]},{"id":"shipment-volume","category":"industry","sec":5,"tier":2,"sources":[{"title":"IFR World Robotics","url":"https://ifr.org/worldrobotics/"}],"as_of":"","related_ids":["mass-production","framework-order-letter-of-intent-order","scaled-deployment","research-and-education-market","international-federation-of-robotics"],"name":"出货量","alt":"Shipment Volume","abbr":"","aliases":["交付量"],"one_liner":"一段时间内厂商实际发货交给客户的机器人台数","explanation":"出货量是厂商在一定时期内实际发出的产品数量，常按年或季度统计，是衡量一家机器人公司商业化进度最直接的指标之一。看这个数字要注意几点：出货不等于客户已经在用（可能在渠道压货）；卖给科研教育和商演的机器人与进厂干活的机器人意义不同；框架订单、意向订单只是约定，不等于出货。行业报告（如 IFR、各咨询机构）会汇总各厂商的出货量，但人形机器人的口径不统一，引用时最好看清来源。","example":"","related":["量产","框架订单 / 意向订单","规模化部署","科研教育市场","国际机器人联合会"]},{"id":"framework-order-letter-of-intent-order","category":"industry","sec":5,"tier":3,"sources":[{"title":"Letter of intent - Wikipedia","url":"https://en.wikipedia.org/wiki/Letter_of_intent"},{"title":"Framework agreement - Wikipedia","url":"https://en.wikipedia.org/wiki/Framework_agreement"}],"as_of":"","related_ids":["shipment-volume","mass-production","public-tender-winning-bid-orders","closed-commercial-loop","pilot-small-batch-delivery","embodied-ai-bubble"],"name":"框架订单 / 意向订单","alt":"Framework Order / Letter-of-Intent Order","abbr":"","aliases":["框架协议","意向订单","意向书"],"one_liner":"约定合作框架或购买意向的订单，不等于实际交付和收入。","explanation":"框架订单是买卖双方先签框架协议，约定价格、规格、合作期限和预计总量，具体数量和交付时间以后续分批下的正式订单为准；意向订单来自意向书（LOI），表达购买意愿，通常没有或只有很弱的法律约束。人形机器人公司常在发布会或融资时宣布「获得数亿元框架订单」「数千台意向订单」，这些数字说明有客户感兴趣，但不代表已经交付、验收或确认收入。看这类新闻时，要区分框架或意向金额、正式采购合同、实际交付台数和财报确认的收入，后几项才反映真实的商业进展。","example":"假设某公司公告签下 1 亿元框架协议，但首批正式采购只有几十台，其余要看试用效果再决定。","related":["出货量","量产","招投标 / 中标订单（集采）","商业闭环","试点 / 小批量交付","具身智能泡沫"]},{"id":"engineering-productionization","category":"industry","sec":5,"tier":2,"sources":[{"title":"Wikipedia: Technology readiness level","url":"https://en.wikipedia.org/wiki/Technology_readiness_level"},{"title":"Embodied Intelligence 2026: Farewell to Narrative Hype, Practical Deployment Reigns Supreme (36Kr)","url":"https://eu.36kr.com/en/p/3953394550537606"}],"as_of":"","related_ids":["mass-production","yield-rate-manufacturing-consistency","real-world-deployment","number-of-nines","mean-time-between-failures","on-device-edge-deployment"],"name":"工程化","alt":"Engineering / Productionization","abbr":"","aliases":["工程落地","产品化"],"one_liner":"把实验室里跑通的技术做成稳定、可量产、可维护的产品。","explanation":"行业里常说论文和产品之间隔着工程化。一个策略在实验室演示成功率 80% 就能发论文，到了工厂可能要求 99% 以上、连续几小时不出错、换一台同型号机器人照样能用、坏了能很快修好。工程化就是补上这段差距的工作：提高可靠性和一致性，处理各种长尾故障，做推理加速和端侧部署（让模型直接在机器人自带的芯片上跑），完善标定、监控、远程运维和 OTA 升级，同时控制成本和良率。具身智能公司之间真正拉开差距的往往在这一环，所以融资稿和招聘里常出现「工程化能力」这个说法。","example":"叠衣服策略在实验室演示成功一次就够；要进洗衣工厂，就得 24 小时连续运行、失败后自动重试，还要能在几十台机器人上同时部署和更新，这些都算工程化。","related":["量产","良率 / 一致性","场景落地","几个 9（可靠性）","平均无故障时间","端侧部署"]},{"id":"yield-rate-manufacturing-consistency","category":"industry","sec":5,"tier":2,"sources":[{"title":"First pass yield - Wikipedia","url":"https://en.wikipedia.org/wiki/First_pass_yield"}],"as_of":"","related_ids":["mass-production","bill-of-materials-cost","engineering-productionization","joint-actuator-module","joint-zero-position-calibration","mean-time-between-failures"],"name":"良率 / 一致性","alt":"Yield Rate / Manufacturing Consistency","abbr":"","aliases":["良品率","产品一致性"],"one_liner":"良率是合格品占比，一致性是每台机器之间的差异有多小","explanation":"良率指生产出的产品中一次检验合格的比例，一致性指同型号不同个体在尺寸、电机参数、传感器读数、关节零位等方面的差异程度。二者是从样机走向量产的关键门槛：良率低会推高成本；一致性差则会让同一个训练好的策略在这台机器上能用、换一台就失灵，还会增加标定和售后成本。关节模组、灵巧手、减速器等核心零部件的一致性尤其受关注。","example":"同一批关节电机力矩常数差异过大，会导致在一台机器人上调好的控制参数换到另一台上动作变形。","related":["量产","BOM 成本","工程化","关节模组","零位标定（零点标定）","平均无故障时间"]},{"id":"bill-of-materials-cost","category":"industry","sec":5,"tier":2,"sources":[{"title":"Bill of materials - Wikipedia","url":"https://en.wikipedia.org/wiki/Bill_of_materials"}],"as_of":"","related_ids":["mass-production","core-components","joint-actuator-module","per-unit-content-value","domestic-substitution","10-000-yuan-class-humanoid-robot"],"name":"BOM 成本","alt":"Bill of Materials Cost","abbr":"BOM","aliases":["BOM成本","物料清单","物料成本"],"one_liner":"造一台产品所需全部零部件和原材料的成本总和。","explanation":"BOM 是物料清单，列出一台产品用到的每个零件、数量和单价，加起来就是 BOM 成本。它不含研发、组装人工、渠道和售后等费用，但通常是硬件成本的大头。人形机器人的 BOM 里，关节执行器（电机、减速器、丝杠）、灵巧手、传感器、主控芯片和电池占比较高。BOM 成本决定了整机能卖多便宜、能否走向量产和消费市场，所以「降 BOM」是本体厂商和零部件国产替代的核心话题。","example":"拆解一台人形机器人，把几十个关节模组、两只灵巧手、相机和 Jetson 主控逐项列价，就是在做 BOM 分析。","related":["量产","核心零部件","关节模组","单机价值量","国产替代","万元级人形机器人"]},{"id":"domestic-substitution","category":"industry","sec":5,"tier":2,"sources":[{"title":"Import substitution industrialization - Wikipedia","url":"https://en.wikipedia.org/wiki/Import_substitution_industrialization"}],"as_of":"","related_ids":["chokepoint-technology","core-components","bill-of-materials-cost","big-four-of-industrial-robotics","leaderdrive","upstream-midstream-downstream-of-the-industry-chain"],"name":"国产替代","alt":"Domestic Substitution","abbr":"","aliases":["国产化","国产化率"],"one_liner":"用国内厂商的产品取代原本依赖进口的零部件或设备。","explanation":"指把原先依赖海外供应的产品换成国产，国产化率是国产部分所占比例。驱动力一是供应链安全，二是降本：国产件通常更便宜、交期更短。在机器人领域，谐波减速器、伺服电机、控制器、传感器、主控芯片和工业机器人本体都是替代重点，例如绿的谐波的谐波减速器、汇川的伺服系统。国产替代与卡脖子是一体两面，也是降低人形机器人 BOM 成本的重要途径。","example":"一家国产人形机器人厂商把关节里的进口谐波减速器换成国产型号，就是一次国产替代。","related":["卡脖子","核心零部件","BOM 成本","工业机器人四大家族","绿的谐波","产业链上中下游"]},{"id":"chokepoint-technology","category":"industry","sec":5,"tier":2,"sources":[{"title":"Made in China 2025 - Wikipedia","url":"https://en.wikipedia.org/wiki/Made_in_China_2025"}],"as_of":"","related_ids":["domestic-substitution","core-components","strain-wave-gear","nvidia-jetson","upstream-midstream-downstream-of-the-industry-chain"],"name":"卡脖子","alt":"Chokepoint Technology","abbr":"","aliases":["卡脖子技术"],"one_liner":"依赖进口、一旦断供就难以替代的关键技术或零部件。","explanation":"中文语境里指产业链上高度依赖国外、对方一限制出口就会被掐住的关键环节。在机器人领域常被提到的包括高端 AI 芯片和 GPU、高精度减速器、高端伺服与编码器、高精度力传感器，以及仿真、CAD 等工业软件。这些环节技术门槛高、验证周期长，国内厂商追赶需要时间。识别卡脖子环节是政策扶持、投资布局和国产替代的出发点。","example":"机器人主控常用英伟达 Jetson 系列芯片，若出口受限，就需要寻找国产芯片方案，这就是典型的卡脖子讨论。","related":["国产替代","核心零部件","谐波减速器","英伟达 Jetson","产业链上中下游"]},{"id":"tier-1-supplier","category":"industry","sec":5,"tier":3,"sources":[{"title":"Wikipedia: Automotive industry supply chain / Tier 1","url":"https://en.wikipedia.org/wiki/Original_equipment_manufacturer"}],"as_of":"","related_ids":["tesla-supply-chain","upstream-midstream-downstream-of-the-industry-chain","robot-body-maker","sampling-supplier-nomination","core-components","tuopu-group"],"name":"一级供应商（Tier 1）","alt":"Tier-1 Supplier","abbr":"Tier 1","aliases":["Tier 1 供应商","一级供应商"],"one_liner":"直接给整机厂供货的零部件或模组供应商","explanation":"Tier 1 是汽车行业沿用下来的供应链分级说法：直接向整机厂（OEM，即自己设计、组装、卖整机的公司）交付总成或模组的是一级供应商，给 Tier 1 供货的是二级（Tier 2），依此类推。人形机器人借用这套叫法，本体厂商是整机厂，给它供关节模组、灵巧手、执行器总成的公司就是 Tier 1，给这些模组供减速器、丝杠、电机等单件的是 Tier 2。它重要在于决定谁拿到订单、谁承担质量与交付责任；二级市场讨论「T 链」「定点」时常说某公司是否成了某本体的 Tier 1。","example":"据报道，拓普集团向特斯拉供应 Optimus 的执行器总成，因此常被称作 Optimus 的 Tier 1 候选。","related":["T 链（特斯拉链）","产业链上中下游","本体厂商","送样 / 定点","核心零部件","拓普集团"]},{"id":"sampling-supplier-nomination","category":"industry","sec":5,"tier":3,"sources":[{"title":"Production part approval process - Wikipedia","url":"https://en.wikipedia.org/wiki/Production_part_approval_process"}],"as_of":"","related_ids":["start-of-production","tesla-supply-chain","tier-1-supplier","per-unit-content-value","engineering-design-production-validation-test","humanoid-robot-concept-stocks"],"name":"送样 / 定点","alt":"Sampling / Supplier Nomination (Design-in)","abbr":"","aliases":["送样","定点","拿到定点"],"one_liner":"零部件供应商给客户送样测试，通过后被正式选为某项目的供货方。","explanation":"这对词来自汽车供应链。送样是零部件厂把样品交给整车厂或整机厂做测试验证；定点是客户正式发出通知，指定某供应商为某个项目某个零部件的供货方，之后双方一起开发，到量产启动后开始批量供货。人形机器人产业沿用了这套说法，上市零部件公司常在公告或调研纪要里说「已向某客户送样」「获得定点」。送样不等于拿到订单，定点也不保证最终量产规模，看新闻时要分清所处阶段。","example":"某丝杠厂商公告称产品已向多家人形机器人客户送样，尚未获得定点。","related":["SOP（量产启动）","T 链（特斯拉链）","一级供应商（Tier 1）","单机价值量","EVT / DVT / PVT（样机验证阶段）","人形机器人概念股"]},{"id":"engineering-design-production-validation-test","category":"industry","sec":5,"tier":3,"sources":[{"title":"Engineering validation test - Wikipedia","url":"https://en.wikipedia.org/wiki/Engineering_validation_test"}],"as_of":"","related_ids":["mass-production","start-of-production","yield-rate-manufacturing-consistency","sampling-supplier-nomination","bill-of-materials-cost","engineering-productionization"],"name":"EVT / DVT / PVT（样机验证阶段）","alt":"Engineering / Design / Production Validation Test","abbr":"EVT / DVT / PVT","aliases":["EVT","DVT","PVT","工程验证 / 设计验证 / 生产验证"],"one_liner":"硬件从样机到量产要过的三道验证关：工程、设计、生产。","explanation":"EVT、DVT、PVT 是消费电子行业通行的硬件开发阶段划分，机器人公司也沿用。EVT（工程验证）用手工或小批样机确认功能和性能能否实现；DVT（设计验证）做可靠性、环境、跌落、寿命和认证测试，通过后设计基本冻结；PVT（生产验证）用量产产线和工装小批试产，检查良率、节拍和一致性。之后才进入量产（MP，或叫 SOP）。每一阶段都可能因为发现问题而改设计、重来一轮。人形机器人公司说「进入 DVT」或「完成 PVT」，可以用来判断它离真正量产还有多远，比「发布」「亮相」更能说明进度。","example":"一款人形机器人在 DVT 阶段做关节寿命测试时发现减速器磨损过快，需要换型号后再验证。","related":["量产","SOP（量产启动）","良率 / 一致性","送样 / 定点","BOM 成本","工程化"]},{"id":"start-of-production","category":"industry","sec":5,"tier":3,"sources":[{"title":"Advanced product quality planning - Wikipedia","url":"https://en.wikipedia.org/wiki/Advanced_product_quality_planning"}],"as_of":"","related_ids":["mass-production","engineering-design-production-validation-test","sampling-supplier-nomination","yield-rate-manufacturing-consistency","data-collection-sop"],"name":"SOP（量产启动）","alt":"Start of Production (SOP)","abbr":"SOP","aliases":["量产启动","开始量产"],"one_liner":"产品正式开始批量生产的时间节点，源自汽车行业。","explanation":"SOP 在汽车行业指某款车型或零部件正式开始批量生产的节点，前面要经过样机验证（EVT / DVT / PVT）、零部件批准等阶段，之后产量逐步爬坡。人形机器人行业沿用了这个说法，厂商宣布「某月 SOP」即表示产线开始按量产标准出货。注意它和质量管理里的「标准作业程序」（Standard Operating Procedure）缩写相同，数据采集领域说的「采集 SOP」是后者，要看上下文区分。","example":"某零部件公司称其人形机器人关节模组计划于明年实现 SOP。","related":["量产","EVT / DVT / PVT（样机验证阶段）","送样 / 定点","良率 / 一致性","采集 SOP"]},{"id":"botq","category":"industry","sec":5,"tier":3,"sources":[{"title":"Figure: BotQ, a new humanoid robot manufacturing facility","url":"https://www.figure.ai/news/botq"}],"as_of":"2025-03","related_ids":["figure-ai","figure-03","mass-production","robofab","figure-helix","yield-rate-manufacturing-consistency"],"name":"Figure BotQ 工厂","alt":"BotQ (Figure AI manufacturing facility)","abbr":"","aliases":["BotQ"],"one_liner":"Figure AI 自建的人形机器人量产工厂，首条产线设计年产能 1.2 万台","explanation":"BotQ 是美国人形机器人公司 Figure AI 于 2025 年 3 月 15 日公布的自有制造工厂。官方称第一代产线每年最多可生产 1.2 万台人形机器人，并在搭建能在四年内支撑 10 万台机器人（或 300 万个执行器）的供应链。Figure 还计划让自家人形机器人上产线做零部件装配和物料搬运，即「机器人造机器人」，并随时间增加其比例。它的意义在于人形机器人从手工造样机走向量产：成本、良率和一致性要靠产线解决。第三代机器人 Figure 03 就按在 BotQ 大规模制造来设计。","example":"","related":["Figure AI","Figure 03","量产","Agility RoboFab 工厂","Helix","良率 / 一致性"]},{"id":"robofab","category":"industry","sec":5,"tier":3,"sources":[{"title":"Agility Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Agility_Robotics"}],"as_of":"2026-09","related_ids":["agility-robotics","agility-robotics-digit","botq","mass-production","robot-as-a-service","shipment-volume"],"name":"Agility RoboFab 工厂","alt":"RoboFab (Agility Robotics factory)","abbr":"","aliases":["RoboFab"],"one_liner":"Agility Robotics 在美国俄勒冈州建的人形机器人 Digit 专用工厂","explanation":"RoboFab 是美国人形机器人公司 Agility Robotics 在俄勒冈州塞勒姆建的自有工厂，2023 年对外公布，专门生产双足人形机器人 Digit，常被称为最早的人形机器人专用量产工厂之一。据报道其规划产能可达每年 1 万台，但初期实际产量远低于此。它的意义在于表明人形机器人开始从实验室手工组装转向工厂化生产，与 Figure 的 BotQ、特斯拉的 Optimus 产线一起，常被用来讨论人形机器人量产进度。","example":"Agility 在 RoboFab 生产的 Digit 以「机器人即服务」方式部署到 GXO 等物流企业的仓库搬运料箱。","related":["Agility Robotics","Agility Digit 人形机器人","Figure BotQ 工厂","量产","机器人即服务","出货量"]},{"id":"real-world-deployment","category":"industry","sec":6,"tier":1,"sources":[{"title":"Agility Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Agility_Robotics"}],"as_of":"2024-06","related_ids":["proof-of-concept","pilot-small-batch-delivery","scaled-deployment","factory-pilot-deployment","closed-commercial-loop","killer-app"],"name":"场景落地","alt":"Real-world Deployment (Application Scenario)","abbr":"","aliases":["落地场景","落地","应用场景"],"one_liner":"机器人进入真实工厂、仓库、商店等地方干实际的活并产生价值。","explanation":"「落地」指技术从实验室走进真实业务，「场景」指具体用途，比如汽车厂搬料箱、仓库分拣、商场导览。具身智能公司融资和宣传常讲「落地了哪些场景」，因为能在真实环境长期稳定干活、客户愿意付钱，才说明技术可用。落地一般经过概念验证（PoC，先小范围证明可行）、试点小批量交付、规模化部署几个阶段，难点在可靠性、节拍（多快干完一件）和投资回报。看新闻时要分清是展示性质的进厂实训或试点，还是付费的持续运营。","example":"Agility Robotics 的 Digit 人形机器人据报道以机器人即服务（RaaS，客户按使用付费租用、不买断）的方式在物流公司 GXO 的仓库搬运料箱。","related":["概念验证","试点 / 小批量交付","规模化部署","进厂实训","商业闭环","杀手级应用"]},{"id":"proof-of-concept","category":"industry","sec":6,"tier":3,"sources":[{"title":"Proof of concept - Wikipedia","url":"https://en.wikipedia.org/wiki/Proof_of_concept"}],"as_of":"","related_ids":["pilot-small-batch-delivery","scaled-deployment","real-world-deployment","factory-pilot-deployment","return-on-investment-payback-period","cycle-time-units-per-hour"],"name":"概念验证","alt":"Proof of Concept","abbr":"PoC","aliases":["PoC（概念验证）","POC"],"one_liner":"用小范围试验证明一个方案在客户场景里确实能做成","explanation":"概念验证（PoC）是在正式采购或投资前，用小规模试验证明某个技术方案可行的过程。在机器人商业化里，常见做法是厂商带一两台机器人进客户现场，针对一个具体工序（比如上下料、分拣）跑几天到几周，验证成功率、节拍和安全性是否达标。PoC 通过后才进入试点或小批量交付，再往后是规模化部署。很多公司对外说的「和某车企合作」其实还停在 PoC 阶段，离真实订单有距离。","example":"某物流公司先让人形机器人在一个仓库里试搬两周料箱，统计成功率和每小时搬运量，达标后才签试点合同。","related":["试点 / 小批量交付","规模化部署","场景落地","进厂实训","投资回报 / 回本周期","节拍 / UPH"]},{"id":"pilot-small-batch-delivery","category":"industry","sec":6,"tier":3,"sources":[{"title":"Pilot experiment - Wikipedia","url":"https://en.wikipedia.org/wiki/Pilot_experiment"}],"as_of":"","related_ids":["proof-of-concept","scaled-deployment","factory-pilot-deployment","framework-order-letter-of-intent-order","mass-production","real-world-deployment"],"name":"试点 / 小批量交付","alt":"Pilot / Small-Batch Delivery","abbr":"","aliases":["小批量交付","试点"],"one_liner":"先给少数客户交几台到几十台，在真实场景里验证再扩大","explanation":"试点和小批量交付是机器人从样机走向规模化的中间阶段：厂商先把几台到几十台机器人放进客户的工厂、仓库或门店，在真实工况下跑一段时间，检验成功率、节拍、故障率和投资回报。它排在概念验证（PoC）之后、规模化部署之前。人形机器人公司对外公布的「交付」「进厂」多数处在这一阶段，数量和真实使用时长往往不公开，所以新闻里的交付数字要看清是试点还是正式批量订单。","example":"某人形机器人公司宣布向汽车工厂交付首批几台机器人做搬运实训，属于试点交付；客户验证通过后再签批量订单。","related":["概念验证","规模化部署","进厂实训","框架订单 / 意向订单","量产","场景落地"]},{"id":"factory-pilot-deployment","category":"industry","sec":6,"tier":2,"sources":[{"title":"Figure AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Figure_AI"},{"title":"UBTech Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/UBTech_Robotics"}],"as_of":"2025","related_ids":["proof-of-concept","pilot-small-batch-delivery","scaled-deployment","real-world-deployment","deployment-data-backflow","cycle-time-units-per-hour"],"name":"进厂实训","alt":"In-Factory Training / Pilot Deployment","abbr":"","aliases":["进厂打工","工厂实训"],"one_liner":"把机器人放进真实工厂产线试干活、边干边采数据改进","explanation":"进厂实训是国内行业和媒体的说法，指人形机器人等具身智能产品进入汽车、电子等企业的真实产线，承担搬运、上料、质检、贴标之类的具体工位做试点。它通常处在概念验证之后、规模化部署之前：一方面检验机器人在节拍（每件活要在多少秒内做完）、稳定性、安全上能否达标，另一方面收集真实场景数据回流训练。需要注意，「进厂」多数是小批量试点，不等于已经形成稳定订单或能替代工人，看新闻时要区分试点、意向订单和真正交付。","example":"据报道，2024 年起 Figure 在宝马美国工厂、优必选 Walker S 系列在多家国内车企工厂开展过产线实训。","related":["概念验证","试点 / 小批量交付","规模化部署","场景落地","数据回流","节拍 / UPH"]},{"id":"scaled-deployment","category":"industry","sec":6,"tier":2,"sources":[{"title":"IFR World Robotics","url":"https://ifr.org/worldrobotics/"}],"as_of":"","related_ids":["proof-of-concept","pilot-small-batch-delivery","mass-production","return-on-investment-payback-period","data-flywheel","real-world-deployment"],"name":"规模化部署","alt":"Scaled Deployment","abbr":"","aliases":["规模化落地"],"one_liner":"机器人从几台试点变成成百上千台在真实场景长期干活","explanation":"指机器人走出概念验证和小批量试点，在客户现场大批量、长期、稳定地运行并产生收益。它是具身智能商业化的关键门槛：几台样机在演示里成功不难，但成百上千台在真实环境里连续工作，需要足够高的成功率和可靠性、可控的成本与回本周期、完善的运维和远程监控体系。业内常把它和「量产」一起说，但量产强调造得出来，规模化部署强调用得起来、用得下去。部署中产生的数据回流训练，是很多公司设想的数据飞轮起点。","example":"","related":["概念验证","试点 / 小批量交付","量产","投资回报 / 回本周期","数据飞轮","场景落地"]},{"id":"cycle-time-units-per-hour","category":"industry","sec":6,"tier":3,"sources":[{"title":"Takt time - Wikipedia","url":"https://en.wikipedia.org/wiki/Takt_time"},{"title":"Throughput (business) - Wikipedia","url":"https://en.wikipedia.org/wiki/Throughput_(business)"}],"as_of":"","related_ids":["return-on-investment-payback-period","mean-time-between-failures","factory-pilot-deployment","machines-replacing-humans","inference-latency","sorting"],"name":"节拍 / UPH","alt":"Cycle Time / Units Per Hour","abbr":"UPH","aliases":["生产节拍","UPH","每小时产出"],"one_liner":"节拍是做完一件要几秒，UPH 是一小时能做多少件。","explanation":"节拍（cycle time）指产线上一个工位完成一次操作、或整条线产出一件产品所需的时间；UPH（Units Per Hour）是每小时产出件数，大致等于 3600 除以节拍秒数。制造业还有「takt time」，指按客户需求倒推出来的目标节拍。这组指标是机器人进工厂时最直接的考核：工厂关心的不是机器人能不能做，而是能不能在规定节拍内稳定地做。目前很多人形机器人和 VLA 策略动作偏慢，成功率也不到百分之百，节拍往往比熟练工人长，这是它们在产线上难以替代人工的主要原因之一，也是推理加速、动作分块等工作的现实动力。","example":"若一个分拣工位节拍为 6 秒/件，UPH 就是 600；机器人如果要 12 秒一件，就得放两台才能顶一个人。","related":["投资回报 / 回本周期","平均无故障时间","进厂实训","机器换人","推理延迟","分拣"]},{"id":"number-of-nines","category":"industry","sec":6,"tier":3,"sources":[{"title":"High availability - Wikipedia（「nines」表示法）","url":"https://en.wikipedia.org/wiki/High_availability"}],"as_of":"","related_ids":["success-rate","long-tail-problem","mean-time-between-failures","robustness","mean-time-between-interventions"],"name":"几个 9（可靠性）","alt":"Number of Nines (Reliability)","abbr":"","aliases":["几个9","99.9% 可靠性","三个 9","四个 9"],"one_liner":"用百分比里 9 的个数表示可靠性或成功率，如 99.9% 叫三个 9","explanation":"「几个 9」是用百分比里连续 9 的个数表示可靠性的习惯说法：99.9% 叫「三个 9」，99.99% 叫「四个 9」。它最早流行于 IT 系统可用性，三个 9 大约对应每年停机 8.76 小时，四个 9 约 53 分钟。在具身智能里常用来讲任务成功率：实验室 demo 做到 90% 不算难，工厂产线往往要求 99.9% 以上。每多一个 9，失败次数就少一个数量级，而剩下的失败多是罕见的长尾情况，所以越往后越难。这也是业内常说「从 demo 到落地」难的原因之一。","example":"一条分拣线每天抓 1 万次，成功率 99% 意味着每天约 100 次失败要人处理，99.99% 则约 1 次。","related":["成功率","长尾问题","平均无故障时间","鲁棒性","平均干预间隔"]},{"id":"mean-time-between-failures","category":"industry","sec":6,"tier":3,"sources":[{"title":"Mean time between failures - Wikipedia","url":"https://en.wikipedia.org/wiki/Mean_time_between_failures"}],"as_of":"","related_ids":["mean-time-between-interventions","number-of-nines","mass-production","yield-rate-manufacturing-consistency","return-on-investment-payback-period"],"name":"平均无故障时间","alt":"Mean Time Between Failures","abbr":"MTBF","aliases":["MTBF","平均故障间隔时间"],"one_liner":"可修复设备两次故障之间平均能正常运行多长时间","explanation":"平均无故障时间（MTBF）是可靠性工程里的常用指标，指可修复设备在两次故障之间平均能正常运行的时间，通常用「总运行时间 ÷ 故障次数」估算，单位一般是小时。它常和平均修复时间（MTTR）一起看，两者决定设备实际能用的时间比例。对人形和具身机器人来说，关节模组、减速器、灵巧手腱绳等部件容易出问题，MTBF 低就意味着频繁停机维修，这是工厂客户采购和进厂部署时最关心的指标之一。机器人学习论文里更常见的是平均干预间隔（多久需要人接管一次），思路类似但统计对象不同。","example":"一台机器人累计运行 2000 小时，期间坏了 4 次，MTBF 约为 500 小时。","related":["平均干预间隔","几个 9（可靠性）","量产","良率 / 一致性","投资回报 / 回本周期"]},{"id":"return-on-investment-payback-period","category":"industry","sec":6,"tier":2,"sources":[{"title":"Investopedia: Payback Period","url":"https://www.investopedia.com/terms/p/paybackperiod.asp"}],"as_of":"","related_ids":["bill-of-materials-cost","cycle-time-units-per-hour","scaled-deployment","machines-replacing-humans","mean-time-between-failures"],"name":"投资回报 / 回本周期","alt":"Return on Investment / Payback Period","abbr":"ROI","aliases":["ROI","回本周期"],"one_liner":"客户买机器人后多久能靠省下的钱把投入挣回来","explanation":"投资回报（ROI）是收益与投入之比，回本周期是累计收益追平投入所需的时间。企业评估要不要上机器人时，会把采购价、部署改造、维护、电费等总成本，和它替代的人工工资、提升的产能放在一起算。制造业买工业机器人时常把回本周期作为关键门槛，人形机器人目前价格高、效率和稳定性不及熟练工人，这笔账往往算不过来，所以业内常说「能不能算得过 ROI」是规模化落地的前提。相关的还有节拍（UPH）、平均无故障时间等影响收益的指标。","example":"一台机器人总成本 20 万元，每年替代一个工位省下 10 万元人工，回本周期约 2 年（简化估算，不计维护）。","related":["BOM 成本","节拍 / UPH","规模化部署","机器换人","平均无故障时间"]},{"id":"labor-shortage","category":"industry","sec":6,"tier":2,"sources":[{"title":"Population ageing - Wikipedia","url":"https://en.wikipedia.org/wiki/Population_ageing"},{"title":"International Federation of Robotics","url":"https://ifr.org/"}],"as_of":"","related_ids":["machines-replacing-humans","dirty-dull-and-dangerous-jobs","return-on-investment-payback-period","lights-out-factory","robot-density"],"name":"用工荒 / 劳动力短缺","alt":"Labor Shortage (Aging Workforce)","abbr":"","aliases":["招工难","劳动力短缺"],"one_liner":"工厂等岗位招不到或留不住人，常被当作机器人需求的底层理由","explanation":"用工荒指企业想招的人数明显多于愿意来干的人，常见于制造业流水线、物流、护理等辛苦重复的岗位。背后原因包括人口老龄化、适龄劳动人口减少、年轻人不愿进厂等，中国、日本、韩国、欧美都面临类似问题。它是机器人行业融资路演和政策文件里最常引用的需求逻辑：人越来越少越贵，机器换人的回本周期就越短。读相关报道时，要注意区分「长期结构性短缺」和「某行业一时招工难」，缺口数字最好查到原始出处再引用。","example":"制造业企业以招工难、人员流动大为由，引入协作机器人或人形机器人做上下料和搬运。","related":["机器换人","3D 工作（脏、累、险）","投资回报 / 回本周期","黑灯工厂","机器人密度"]},{"id":"machines-replacing-humans","category":"industry","sec":6,"tier":2,"sources":[{"title":"Automation - Wikipedia","url":"https://en.wikipedia.org/wiki/Automation"},{"title":"Technological unemployment - Wikipedia","url":"https://en.wikipedia.org/wiki/Technological_unemployment"}],"as_of":"","related_ids":["labor-shortage","industrial-robot","lights-out-factory","dirty-dull-and-dangerous-jobs","human-robot-mixed-workforce","return-on-investment-payback-period"],"name":"机器换人","alt":"Machines Replacing Human Labor","abbr":"","aliases":["机器代人"],"one_liner":"用机器人和自动化设备替代人工完成生产岗位","explanation":"机器换人是中国制造业转型升级的常用口号，2010 年代起浙江、广东等制造业大省在政策里大力推动，核心是用工业机器人、自动化产线替代重复、危险、招工难的人工岗位，以提升效率和质量、降低对廉价劳动力的依赖。过去主要靠固定程序的工业机器人，只适合结构化、批量大的工序；具身智能想解决的是那些换型频繁、需要灵活判断的岗位，让机器人进入原本自动化做不了的环节。它也常引出就业替代的社会讨论。","example":"汽车厂焊装车间几乎全由焊接机器人完成，是早期机器换人的典型；如今企业尝试用人形机器人做料箱搬运。","related":["用工荒 / 劳动力短缺","工业机器人","黑灯工厂","3D 工作（脏、累、险）","人机混编","投资回报 / 回本周期"]},{"id":"dirty-dull-and-dangerous-jobs","category":"industry","sec":6,"tier":3,"sources":[{"title":"Dirty, dangerous and demeaning - Wikipedia","url":"https://en.wikipedia.org/wiki/Dirty,_dangerous_and_demeaning"}],"as_of":"","related_ids":["machines-replacing-humans","labor-shortage","special-purpose-robot","inspection-robot","real-world-deployment"],"name":"3D 工作（脏、累、险）","alt":"Dirty, Dull and Dangerous (3D) Jobs","abbr":"3D","aliases":["3D 岗位","脏累险","3D 工作"],"one_liner":"又脏、又累或枯燥、又危险的岗位，常被视为机器人先落地的场景。","explanation":"3D 这个说法源自日本的「3K」（汚い 脏、危険 危险、きつい 辛苦），英文最初是 dirty、dangerous、demeaning（或 demanding），指招工难、多由外来务工者承担的工作。机器人行业常改说成 dirty、dull、dangerous，把「枯燥重复」也算进去。它常被用来论证机器人该先去哪里：这些岗位招人难、人员流动大，用机器替代的社会阻力小，客户也更愿意为安全和稳定付钱。新闻里「替代 3D 岗位」一般指铸造打磨、喷涂、搬运重物、化工和电力巡检、危险品处理这类场景。","example":"变电站巡检、核电站检修、矿井作业常被列为适合机器人替代的 3D 场景。","related":["机器换人","用工荒 / 劳动力短缺","特种机器人","巡检机器人","场景落地"]},{"id":"robot-density","category":"industry","sec":6,"tier":3,"sources":[{"title":"IFR World Robotics","url":"https://ifr.org/worldrobotics/"}],"as_of":"2024-11","related_ids":["international-federation-of-robotics","industrial-robot","machines-replacing-humans","labor-shortage","lights-out-factory"],"name":"机器人密度","alt":"Robot Density (robots per 10,000 manufacturing workers)","abbr":"","aliases":["工业机器人密度"],"one_liner":"每万名制造业工人对应的工业机器人数量，衡量一个国家工厂自动化程度。","explanation":"机器人密度是国际机器人联合会（IFR）在年度《World Robotics》报告里使用的指标，计算方式是在役工业机器人数量除以制造业从业人数，再乘以一万。它去掉了国家规模的影响，方便比较各国工厂的自动化水平。据 IFR 2024 年发布的数据，2023 年全球平均约为 162 台，韩国最高，中国约 470 台，已超过德国和日本。讨论「机器换人」、用工荒和人形机器人进工厂的空间时常引用这个数字。","example":"IFR 数据显示，2023 年韩国机器人密度超过 1000 台/万人，居全球第一。","related":["国际机器人联合会","工业机器人","机器换人","用工荒 / 劳动力短缺","黑灯工厂"]},{"id":"lights-out-factory","category":"industry","sec":6,"tier":3,"sources":[{"title":"Lights out (manufacturing) - Wikipedia","url":"https://en.wikipedia.org/wiki/Lights_out_(manufacturing)"}],"as_of":"","related_ids":["machines-replacing-humans","flexible-manufacturing","industrial-robot","non-standard-automation","big-four-of-industrial-robotics"],"name":"黑灯工厂","alt":"Lights-Out Factory","abbr":"","aliases":["无人工厂","熄灯工厂","Lights-out Manufacturing"],"one_liner":"高度自动化、无需人员在场值守也能运转的工厂","explanation":"黑灯工厂指生产高度自动化、不需要人员在现场值守，因而可以不开灯运转的工厂，英文叫 lights-out manufacturing。常被引用的例子是日本发那科（FANUC）：据报道，它的工厂自 2001 年起用机器人生产机器人，可以无人值守连续运行很长时间。现实中大多数所谓黑灯工厂仍需要人做维护、补料和异常处理，更常见的是部分工序或车间实现无人化。传统做法靠固定工位的工业机器人和专用设备，适合大批量标准产品；具身智能厂商的主张之一，是用通用机器人去覆盖这些专用设备做不了的柔性工序。","example":"发那科的机器人工厂常被当作黑灯工厂的代表：机器人装配机器人，夜间无人值守。","related":["机器换人","柔性制造","工业机器人","非标自动化","工业机器人四大家族"]},{"id":"human-robot-mixed-workforce","category":"industry","sec":6,"tier":3,"sources":[{"title":"UBTECH Walker S Industrial Humanoid Robot","url":"https://www.ubtrobot.com/en/humanoid/products/walker-s"}],"as_of":"","related_ids":["human-robot-collaboration","factory-pilot-deployment","machines-replacing-humans","lights-out-factory","brownfield-deployment"],"name":"人机混编","alt":"Human-Robot Mixed Workforce","abbr":"","aliases":["人机混合编组"],"one_liner":"人和机器人编在同一条产线或同一个班组里分工干活","explanation":"人机混编指在工厂、仓库等场景中，把机器人和人类工人编入同一条产线或同一个班组，各自承担适合的工序，而不是一次性把整条线换成全自动。它常见于人形机器人进厂的早期阶段：机器人先接手搬运、上下料、质检等重复工序，人负责复杂装配、异常处理和监管。这种方式对现有产线改动小，能在真实环境里积累数据、验证可靠性，但对安全防护、人机协作流程和节拍匹配都有要求。它和「机器换人」「黑灯工厂」是一条光谱上的不同阶段。","example":"优必选 Walker S 系列工业人形机器人在汽车工厂实训时，与工人在同一产线上完成搬运、质检等工序。","related":["人机协作","进厂实训","机器换人","黑灯工厂","棕地部署（存量工厂）"]},{"id":"brownfield-deployment","category":"industry","sec":6,"tier":3,"sources":[{"title":"Figure AI - Wikipedia","url":"https://en.wikipedia.org/wiki/Figure_AI"},{"title":"Greenfield project - Wikipedia","url":"https://en.wikipedia.org/wiki/Greenfield_project"}],"as_of":"","related_ids":["machines-replacing-humans","lights-out-factory","factory-pilot-deployment","humanoid-robot","real-world-deployment","human-robot-mixed-workforce"],"name":"棕地部署（存量工厂）","alt":"Brownfield Deployment","abbr":"","aliases":["棕地","存量改造"],"one_liner":"把机器人放进已经建成、按人设计的现有工厂里，而不是新建专门产线","explanation":"「棕地」和「绿地」是工程领域的一对说法：绿地指从零新建，可以围绕自动化设备设计厂房和流程；棕地指在已有厂房、产线和仓库里改造，空间、工位、货架高度都是按人设计的，不能大改。多数工厂属于存量，传统自动化进棕地往往要停线改造、成本高。人形机器人和通用移动操作机器人的主要卖点之一，就是能直接适应人类环境，在不改产线的前提下接替工人的部分岗位。评估一家公司的落地能力时，是否能在棕地里稳定运行是重要标准。","example":"Figure AI 2024 年与宝马合作，把人形机器人放进宝马现有的美国工厂做测试，属于棕地部署。","related":["机器换人","黑灯工厂","进厂实训","人形机器人","场景落地","人机混编"]},{"id":"flexible-manufacturing","category":"industry","sec":6,"tier":3,"sources":[{"title":"Flexible manufacturing system - Wikipedia","url":"https://en.wikipedia.org/wiki/Flexible_manufacturing_system"},{"title":"柔性制造系统 - 维基百科","url":"https://zh.wikipedia.org/wiki/柔性制造系统"}],"as_of":"","related_ids":["non-standard-automation","industrial-robot","teach-and-playback-programming","lights-out-factory","general-purpose-robot","machines-replacing-humans"],"name":"柔性制造","alt":"Flexible Manufacturing","abbr":"FMS","aliases":["柔性产线","柔性制造系统"],"one_liner":"产线能快速换型、以小批量多品种方式生产的能力。","explanation":"柔性制造指生产线不需要大改设备，就能在不同产品型号之间快速切换，适合小批量、多品种的订单。20 世纪 60–70 年代出现的柔性制造系统（FMS）用数控机床、自动物流和计算机调度实现这一点。传统工业机器人靠示教编程、专用夹具和固定工位，换一种产品就要重新编程、换工装，只在大批量生产时划算。具身智能的卖点之一正是柔性：希望机器人靠视觉和学习到的策略适应新零件、新工序，少改程序甚至不改，这样才能进入 3C 电子、汽车总装等换线频繁的场景。","example":"手机代工厂每年要切换多个机型，若机器人能靠少量示教学会新机型的装配动作，换线时间就能大幅缩短。","related":["非标自动化","工业机器人","示教再现","黑灯工厂","通用机器人","机器换人"]},{"id":"non-standard-automation","category":"industry","sec":6,"tier":3,"sources":[{"title":"Automation - Wikipedia","url":"https://en.wikipedia.org/wiki/Automation"}],"as_of":"","related_ids":["system-integrator","project-based-delivery-vs-productization","flexible-manufacturing","industrial-robot","lights-out-factory","general-purpose-robot"],"name":"非标自动化","alt":"Non-Standard (Custom) Automation","abbr":"","aliases":["非标","非标设备","非标自动化设备"],"one_liner":"按某条产线的具体需求专门设计定制的自动化设备","explanation":"非标自动化指按单个客户、单条产线的具体需求专门设计制造的自动化设备，区别于通用工业机器人、标准输送线这类「标准品」。这类项目一般由系统集成商或非标设备厂承接，每个项目都要重新做机械设计、电气和编程调试，交付周期长、经验难复制，业务往往是项目制。它和具身智能的关系在于：工厂里大量工序目前靠非标设备或人工完成，而具身智能公司的主张之一，是用通用机器人加可迁移的模型替代「每条产线定制一套设备」，把项目制变成产品化。","example":"为某电池厂专门设计的一台电芯上料加外观检测一体机，就是典型的非标自动化设备。","related":["系统集成商","项目制 / 产品化","柔性制造","工业机器人","黑灯工厂","通用机器人"]},{"id":"project-based-delivery-vs-productization","category":"industry","sec":6,"tier":3,"sources":[{"title":"Productization - Wikipedia","url":"https://en.wikipedia.org/wiki/Productization"}],"as_of":"","related_ids":["non-standard-automation","system-integrator","general-purpose-robot","scaled-deployment","closed-commercial-loop","engineering-productionization"],"name":"项目制 / 产品化","alt":"Project-based Delivery vs. Productization","abbr":"","aliases":["项目制","产品化"],"one_liner":"按客户逐个定制交付，还是做成标准产品批量卖","explanation":"项目制指按每个客户的场景单独定制方案、派工程师驻场调试交付，收入按项目结算；产品化指把能力做成标准的硬件和软件，客户买来稍作配置就能用，可以批量复制。项目制起步快、单子大，但人力成本高、难以规模化，毛利也受限；产品化前期投入大，但边际成本低。工业自动化里的非标自动化、系统集成商多属项目制。具身智能公司追求的通用机器人，本质是想用泛化能力把项目制变成产品化。","example":"给某条产线定制夹具和视觉程序、驻场调三个月属于项目制；一台开箱后用自然语言下指令就能干多种活的机器人属于产品化。","related":["非标自动化","系统集成商","通用机器人","规模化部署","商业闭环","工程化"]},{"id":"to-business","category":"industry","sec":7,"tier":2,"sources":[{"title":"Business-to-business - Wikipedia","url":"https://en.wikipedia.org/wiki/Business-to-business"}],"as_of":"","related_ids":["to-consumer","task-oriented-grasping","real-world-deployment","system-integrator","return-on-investment-payback-period","factory-pilot-deployment"],"name":"ToB","alt":"To Business (B2B)","abbr":"ToB","aliases":["2B","B端","B2B"],"one_liner":"产品卖给企业、工厂、机构，而不是个人消费者","explanation":"ToB 指面向企业客户的商业模式。在具身智能里，ToB 客户包括汽车厂、物流仓、电子厂、科研院校等，特点是单笔金额大、验收看投资回报和稳定性、通常要做定制和现场部署，销售周期长。当前多数机器人公司的实际收入来自 ToB（工业、物流、科研教育），因为工厂场景相对结构化，比家庭更容易先落地。","example":"人形机器人公司与车企签订进厂实训协议，在总装线上搬运料箱，属于 ToB。","related":["ToC","ToG","场景落地","系统集成商","投资回报 / 回本周期","进厂实训"]},{"id":"to-consumer","category":"industry","sec":7,"tier":2,"sources":[{"title":"Retail / Business-to-consumer - Wikipedia","url":"https://en.wikipedia.org/wiki/Business-to-consumer"}],"as_of":"","related_ids":["to-business","consumer-grade-robot","companion-robot","household-tasks","robot-vacuum-cleaner"],"name":"ToC","alt":"To Consumer (B2C)","abbr":"ToC","aliases":["2C","C端","B2C"],"one_liner":"产品直接卖给个人消费者，比如家用机器人","explanation":"ToC 指面向个人消费者的商业模式。在机器人领域，扫地机器人、机器狗、陪伴机器人都属于 ToC。ToC 要求价格低、开箱即用、足够安全、售后网络完善，家庭环境又高度非结构化（每家布局、物品都不同），所以通用家务人形机器人进入家庭被普遍认为比 ToB 落地更难，也被视为市场空间最大的方向之一。","example":"消费者在电商平台买一台四足机器狗自己玩，属于 ToC。","related":["ToB","消费级机器人","陪伴机器人","家务任务","扫地机器人"]},{"id":"to-government","category":"industry","sec":7,"tier":3,"sources":[{"title":"Wikipedia: Business-to-government","url":"https://en.wikipedia.org/wiki/Business-to-government"}],"as_of":"","related_ids":["to-business","to-consumer","public-tender-winning-bid-orders","embodied-ai-training-ground","application-scenario-list-scenario-opening","research-and-education-market"],"name":"ToG","alt":"To Government (B2G)","abbr":"ToG","aliases":["2G","G端","B2G","政府客户"],"one_liner":"以政府、国企、公立机构为客户的业务模式","explanation":"ToG 指企业把产品或服务卖给政府部门及其下属单位，包括国企、公立高校、科研院所和地方平台公司，和 ToB（卖给企业）、ToC（卖给个人消费者）并列。具身智能行业里，ToG 订单常见形式是地方政府建设具身智能训练场、创新中心或中试基地时采购机器人，以及高校、职校的科研教学采购，一般走公开招投标。它的特点是单笔金额大、回款周期长，常被用来撑早期营收；但行业里也常提醒，政府采购不等于机器人已在真实生产场景里替代人工。","example":"地方政府建设具身智能训练场时，通过公开招标一次性采购几十到上百台人形机器人用于数据采集。","related":["ToB","ToC","招投标 / 中标订单（集采）","具身智能训练场","应用场景清单 / 场景开放","科研教育市场"]},{"id":"public-tender-winning-bid-orders","category":"industry","sec":7,"tier":3,"sources":[{"title":"Call for bids - Wikipedia","url":"https://en.wikipedia.org/wiki/Call_for_bids"}],"as_of":"2026-09","related_ids":["task-oriented-grasping","framework-order-letter-of-intent-order","shipment-volume","research-and-education-market","embodied-ai-training-ground","scenario-owner"],"name":"招投标 / 中标订单（集采）","alt":"Public Tender / Winning-bid Orders (Centralized Procurement)","abbr":"","aliases":["中标订单","集采","集中采购"],"one_liner":"国企、政府或高校公开招标采购机器人，厂商投标拿单","explanation":"招投标是政府机关、国有企业、高校等按法定程序公开采购的方式：采购方发布招标公告和需求，厂商提交标书竞争，评标后公示中标人和金额。集采（集中采购）是把多个单位的需求合并统一招标，单子更大。因为中标结果会在公共资源交易平台公示，它是外界核实机器人真实订单最可靠的渠道之一。人形机器人早期的大额订单不少来自运营商、国企和科研机构的招标，常用于展厅、实训和数据采集。","example":"据报道，2025 年中国移动旗下公司招标采购人形机器人，总额约 1.24 亿元，智元和宇树中标，被媒体称为当时人形机器人最大的单笔订单之一。","related":["ToG","框架订单 / 意向订单","出货量","科研教育市场","具身智能训练场","场景方"]},{"id":"research-and-education-market","category":"industry","sec":7,"tier":2,"sources":[{"title":"Unitree G1 产品页","url":"https://www.unitree.com/g1"}],"as_of":"","related_ids":["edu-edition","secondary-development","shipment-volume","real-world-deployment","closed-commercial-loop"],"name":"科研教育市场","alt":"Research & Education Market","abbr":"","aliases":["科教市场"],"one_liner":"把机器人卖给高校、研究所和学校做研究与教学的市场","explanation":"指以高校实验室、科研院所、职业院校和中小学为客户的机器人销售市场。这些客户买机器人不是为了替代劳动力，而是用来跑算法、采数据、发论文或上课，对可开发性（开放 SDK、底层接口）要求高，对稳定干活的要求低。在人形和四足机器人还没法大规模进厂的阶段，科教市场是许多厂商最早、最稳定的收入来源，宇树等厂商也会专门推出面向二次开发的 EDU 版。它的问题是规模有限，被视为商业化的过渡而非终点。","example":"高校实验室采购宇树 G1 EDU 版，用来做强化学习运控和 VLA 研究。","related":["EDU 版（科研教育版）","二次开发","出货量","场景落地","商业闭环"]},{"id":"edu-edition","category":"industry","sec":7,"tier":2,"sources":[{"title":"Unitree Go2 产品页（规格表）","url":"https://www.unitree.com/go2"},{"title":"Unitree G1 产品页（规格表）","url":"https://www.unitree.com/g1"},{"title":"宇树开发者文档中心","url":"https://support.unitree.com/home/zh/developer"}],"as_of":"2026-09","related_ids":["secondary-development","software-development-kit","research-and-education-market","unitree-go2","unitree-g1","robot-body-maker"],"name":"EDU 版（科研教育版）","alt":"EDU Edition (Research & Education Version)","abbr":"EDU","aliases":["EDU 版","开发者版","科研版","教育版"],"one_liner":"厂商面向高校和开发者的版本，开放底层接口，加配算力和传感器。","explanation":"国内机器人厂商常把同一款机器人分成几个版本出售，其中面向高校、科研机构和开发者的叫 EDU 版。和消费版、基础版相比，EDU 版通常开放底层 SDK（软件开发包）和关节级控制接口，加配机载算力（如英伟达 Jetson 模块）、更多传感器或灵巧手，价格也明显更高。做研究时要能读关节状态、下发力矩或位置指令，才能把自己训练的策略部署到真机上，所以论文里的真机多是 EDU 版。各版本开放到哪一层差别很大，买之前要对照厂商的规格表看清楚。","example":"据宇树官网，Go2 只有 EDU 版配足端力传感器；G1 基础版 23 个关节，EDU 版加装灵巧手等部件后最多 43 个。","related":["二次开发","软件开发工具包","科研教育市场","宇树 Go2","宇树 G1","本体厂商"]},{"id":"consumer-grade-robot","category":"industry","sec":7,"tier":2,"sources":[{"title":"Domestic robot - Wikipedia","url":"https://en.wikipedia.org/wiki/Domestic_robot"}],"as_of":"2025-10","related_ids":["to-consumer","robot-vacuum-cleaner","10-000-yuan-class-humanoid-robot","companion-robot","1x-neo","household-tasks"],"name":"消费级机器人","alt":"Consumer-Grade Robot","abbr":"","aliases":["家用级机器人"],"one_liner":"面向个人和家庭直接销售的机器人产品。","explanation":"指卖给普通消费者、在家里或个人生活中使用的机器人，与卖给工厂和企业的工业级、商用级相对。已成熟的例子是扫地机器人，四足机器狗、桌面机械臂和陪伴机器人也在这一类。它对价格、安全、易用性和免维护要求远高于科研或工业场景，因此是人形机器人最难也最被期待的市场。据报道，1X 在 2025 年开放了家用人形机器人 NEO 的预订。","example":"扫地机器人是目前最普及的消费级机器人。","related":["ToC","扫地机器人","万元级人形机器人","陪伴机器人","1X NEO","家务任务"]},{"id":"10-000-yuan-class-humanoid-robot","category":"industry","sec":7,"tier":2,"sources":[{"title":"Unitree R1 产品页","url":"https://www.unitree.com/R1"}],"as_of":"2025-10","related_ids":["consumer-grade-robot","small-size-humanoid-robot","unitree-r1","noetix-bumi","price-war","research-and-education-market"],"name":"万元级人形机器人","alt":"10,000-Yuan-Class Humanoid Robot","abbr":"","aliases":["万元人形"],"one_liner":"售价一万到几万元人民币、主要面向个人和教育的小型人形机器人。","explanation":"2025 年起国内厂商把人形机器人价格压到万元量级，这类产品多为一米左右或更矮的小尺寸机型，关节力矩和负载较弱，主要卖给开发者、高校教学、科普展示和家庭娱乐，而不是进工厂干活。代表产品据报道有宇树 R1（起售价约 3.99 万元）和松延动力小布米（约 9998 元）。它们让个人第一次买得起能走能跑、可二次开发的人形平台，但续航、算力和灵巧度与全尺寸机型差距明显。价格变动快，以厂商最新报价为准。","example":"松延动力小布米据报道售价 9998 元，身高约 94 厘米，面向教育和家庭用户。","related":["消费级机器人","小尺寸人形机器人","宇树 R1","松延动力 小布米","价格战","科研教育市场"]},{"id":"price-war","category":"industry","sec":7,"tier":3,"sources":[{"title":"Price war - Wikipedia","url":"https://en.wikipedia.org/wiki/Price_war"}],"as_of":"2026-09","related_ids":["10-000-yuan-class-humanoid-robot","bill-of-materials-cost","hundred-robot-war","consumer-grade-robot","research-and-education-market","domestic-substitution"],"name":"价格战","alt":"Price War (Humanoid Robots)","abbr":"","aliases":[],"one_liner":"厂商竞相压低人形机器人售价抢市场的现象","explanation":"价格战指同类产品的厂商轮番降价抢市场。人形机器人的价格战大约从 2024 年起明显：宇树 G1 以 9.9 万元起售，之后宇树 R1、松延动力小布米等把入门人形的标价压到几万元甚至万元以内。降价一方面靠供应链国产化、以塑代钢和小尺寸设计压低 BOM 成本，另一方面也是为了抢占科研教育、商演等早期市场。低价机型通常自由度、负载和算力更少，适合教学和开发，不能直接和工厂用的全尺寸机型比价。","example":"据报道，松延动力 2025 年 10 月发布的小布米标价 9998 元，被视为人形机器人价格战进入万元以内的标志。","related":["万元级人形机器人","BOM 成本","百机大战","消费级机器人","科研教育市场","国产替代"]},{"id":"going-global","category":"industry","sec":7,"tier":3,"sources":[{"title":"Unitree Robotics 官网（英文）","url":"https://www.unitree.com/"}],"as_of":"","related_ids":["unitree-robotics","consumer-grade-robot","research-and-education-market","consumer-electronics-show","price-war"],"name":"出海","alt":"Going Global (Overseas Expansion)","abbr":"","aliases":["海外市场拓展"],"one_liner":"中国公司把产品卖到海外、在海外设点经营的通俗说法","explanation":"出海是中国商业圈的常用词，指企业把产品、服务或产能拓展到海外市场，包括外销整机、设立海外子公司和渠道、参加海外展会、在当地建厂等。在机器人行业，国内厂商凭借供应链和价格优势，把四足机器人、人形机器人、机械臂卖给海外高校实验室、开发者和企业客户，是不少公司早期收入的重要来源。出海也要面对认证标准、数据合规、售后服务和贸易政策等门槛。看公司招股书或财报时，海外收入占比常被当作出海成果的指标。","example":"宇树科技的英文官网面向全球销售四足和人形机器人，其产品在海外科研机构中较常见。","related":["宇树科技","消费级机器人","科研教育市场","CES 国际消费电子展","价格战"]},{"id":"commercial-robot-performances","category":"industry","sec":7,"tier":2,"sources":[{"title":"Unitree Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Unitree_Robotics"}],"as_of":"2025-02","related_ids":["robot-rental","yangbot","pre-programmed-motion","guided-tours-and-reception","unitree-g1"],"name":"商演","alt":"Commercial Robot Performances","abbr":"","aliases":["机器人商演","商业演出"],"one_liner":"租用人形或四足机器人在活动上表演，按场收费。","explanation":"指机器人参加商场开业、展会、年会、晚会等商业活动表演，如跳舞、打拳、互动引流，由活动方按场次或天数支付租金。宇树人形机器人 2025 年登上春晚表演扭秧歌后，这类需求明显增多。商演多用预编程的动作编排，技术门槛相对低，却是不少人形机器人目前少数能直接变现的场景，也带动了机器人租赁生意。它常被拿来讨论：表演之外，人形机器人何时能真正干活。","example":"商场周年庆租来两台宇树 G1 在门口跳舞引流，按半天计费。","related":["机器人租赁","《秧BOT》","预编程动作（动作编排）","导览接待","宇树 G1"]},{"id":"guided-tours-and-reception","category":"industry","sec":7,"tier":3,"sources":[{"title":"Pepper (robot) - Wikipedia","url":"https://en.wikipedia.org/wiki/Pepper_(robot)"}],"as_of":"","related_ids":["service-robot","real-world-deployment","commercial-robot-performances","softbank-robotics-pepper","human-robot-interaction"],"name":"导览接待","alt":"Guided Tours & Reception","abbr":"","aliases":["迎宾导览"],"one_liner":"机器人在展厅、商场、营业厅等地迎宾、讲解、带路的应用场景","explanation":"导览接待指机器人在展厅、博物馆、政务大厅、商场、银行营业厅等场所做迎宾、讲解、问答和带路。它对操作能力要求低，主要依赖语音交互、导航和展示效果，因此是服务机器人和人形机器人最早商业化的场景之一。早期代表是软银的 Pepper，近几年不少国产人形机器人也以展厅讲解、活动迎宾的形式交付。这个场景订单来得快，但单机创造的实际劳动价值有限，行业常把它和工厂搬运、分拣等「干活」场景区分开来讨论商业闭环。","example":"软银 2015 年推出的 Pepper 曾被大量部署在门店和银行做迎宾与咨询。","related":["服务机器人","场景落地","商演","Pepper 机器人","人机交互"]},{"id":"robot-rental","category":"industry","sec":7,"tier":2,"sources":[{"title":"Robot-as-a-Service 概述（Wikipedia）","url":"https://en.wikipedia.org/wiki/Robot_as_a_service"}],"as_of":"","related_ids":["robot-as-a-service","commercial-robot-performances","guided-tours-and-reception","subscription-model","closed-commercial-loop"],"name":"机器人租赁","alt":"Robot Rental","abbr":"","aliases":["人形机器人租赁"],"one_liner":"按天或按场把机器人租给别人用，而不是直接卖","explanation":"指机器人所有方按时间或活动把设备短租给使用方，常见于商演、展会、开业剪彩、导览接待等场景。2025 年以来人形机器人在国内出圈后，按天租人形机器人参加活动成为一门生意，据报道价格随热度波动很大。租赁降低了客户的尝鲜门槛，也让厂商和渠道商在机器人还干不了重活时先获得收入。它和机器人即服务（RaaS）相近，区别在于租赁通常只提供设备本身，RaaS 更强调按效果或按月打包服务、运维。","example":"商场开业租一台人形机器人跳舞、和顾客互动一天。","related":["机器人即服务","商演","导览接待","订阅制","商业闭环"]},{"id":"robot-as-a-service","category":"industry","sec":7,"tier":2,"sources":[{"title":"Robot as a service（Wikipedia）","url":"https://en.wikipedia.org/wiki/Robot_as_a_service"}],"as_of":"","related_ids":["robot-rental","subscription-model","return-on-investment-payback-period","scaled-deployment","deployment-data-backflow"],"name":"机器人即服务","alt":"Robot-as-a-Service","abbr":"RaaS","aliases":["RaaS"],"one_liner":"客户不买机器人，按月或按工作量付费使用","explanation":"RaaS 仿照软件业的 SaaS（软件即服务），指厂商保留机器人所有权，客户按月、按小时或按完成的工作量付费，维护、升级、远程监控都由厂商负责。它把客户的一次性大额采购变成可预期的运营支出，降低了决策门槛，也让厂商能持续拿到部署数据改进模型。仓储物流机器人较早采用这种模式，Agility Robotics 等人形机器人公司也以 RaaS 方式向工厂和仓库提供机器人。缺点是厂商前期要垫付硬件成本，对现金流要求高。","example":"仓库按每月固定费用使用一批搬运机器人，坏了由厂商上门修。","related":["机器人租赁","订阅制","投资回报 / 回本周期","规模化部署","数据回流"]},{"id":"subscription-model","category":"industry","sec":7,"tier":3,"sources":[{"title":"1X Technologies 官网","url":"https://www.1x.tech/"}],"as_of":"2025-10","related_ids":["robot-as-a-service","robot-rental","consumer-grade-robot","1x-neo","over-the-air-update","to-consumer"],"name":"订阅制","alt":"Subscription Model","abbr":"","aliases":["按月订阅"],"one_liner":"不一次性买断，而是按月或按年付费使用机器人或其软件功能。","explanation":"订阅制是一种收费方式：用户按月或按年付费，获得机器人的使用权或某项软件能力，厂商负责维护、升级和部分售后。对用户来说，它降低了一次性购买的门槛；对厂商来说，收入更稳定，还能通过持续的软件更新和数据回流改进产品。它和面向企业的机器人即服务（RaaS）思路接近，区别在于订阅制更常用于面向个人用户的产品，也常用于软件功能单独收费。","example":"1X 在 2025 年开放家用人形机器人 NEO 预订，可一次性购买，也可选择每月 499 美元的订阅。","related":["机器人即服务","机器人租赁","消费级机器人","1X NEO","OTA 升级","ToC"]},{"id":"robot-4s-store","category":"industry","sec":7,"tier":3,"sources":[{"title":"4S店 - 百度百科","url":"https://baike.baidu.com/item/4S店"}],"as_of":"2025-08","related_ids":["consumer-grade-robot","robot-rental","to-consumer","real-world-deployment","beijing-humanoid-robot-innovation-center"],"name":"机器人 4S 店","alt":"Robot 4S Store (Sales, Service, Spare parts, Survey)","abbr":"","aliases":["具身智能机器人4S店"],"one_liner":"借用汽车 4S 店模式，集销售、维修、配件、信息反馈于一体的机器人门店。","explanation":"4S 原本是汽车经销商用语，指整车销售（Sale）、售后服务（Service）、零配件（Spare parts）和信息反馈（Survey）四项业务。据报道，2025 年 8 月北京亦庄出现了首家「具身智能机器人 4S 店」，店里陈列多家厂商的人形机器人、机器狗等产品，提供购买、租赁、维修等服务。它反映的是行业想把机器人卖给普通消费者和中小客户，而售后维修、配件供应是这类客户最担心的问题。","example":"","related":["消费级机器人","机器人租赁","ToC","场景落地","北京人形机器人创新中心"]},{"id":"embodied-ai-robot-insurance","category":"industry","sec":7,"tier":3,"sources":[{"title":"Liability insurance - Wikipedia","url":"https://en.wikipedia.org/wiki/Liability_insurance"},{"title":"Product liability - Wikipedia","url":"https://en.wikipedia.org/wiki/Product_liability"}],"as_of":"2025","related_ids":["robot-rental","commercial-robot-performances","embodied-safety","functional-safety","scaled-deployment"],"name":"具身智能机器人保险","alt":"Embodied AI Robot Insurance","abbr":"","aliases":["人形机器人保险","机器人专属保险"],"one_liner":"为人形或具身机器人设计的保险，覆盖本体损坏和对他人造成的损失。","explanation":"具身智能机器人保险指保险公司针对人形机器人、四足机器人等具身产品设计的专属险种。据报道，2025 年起国内已有财险公司推出这类产品，保障通常分两块：一是机器人本体的损坏或丢失，属于财产险；二是机器人在工作、演出、租赁时伤到人或损坏他人财物引起的赔偿，属于责任险。它要解决的是出事后谁来赔的问题：机器人进入商演、展厅导览、工厂和家庭后，一次摔倒或失控可能造成不小的损失，而责任在厂商、使用方还是操作员往往不清楚。保险把这部分风险转移出去，降低了租赁和部署的门槛，也倒逼厂商提供故障记录和安全数据。","example":"","related":["机器人租赁","商演","具身安全","功能安全","规模化部署"]},{"id":"closed-commercial-loop","category":"industry","sec":7,"tier":2,"sources":[{"title":"Business model - Wikipedia","url":"https://en.wikipedia.org/wiki/Business_model"}],"as_of":"","related_ids":["real-world-deployment","product-market-fit","data-flywheel","return-on-investment-payback-period","scaled-deployment","framework-order-letter-of-intent-order"],"name":"商业闭环","alt":"Closed Commercial Loop","abbr":"","aliases":["闭环"],"one_liner":"产品能持续卖出去、收入覆盖成本并能自我循环的商业模式。","explanation":"指一个业务从产品、客户付费到收入回流形成完整循环：客户愿意为实际价值买单，收入覆盖研发、制造和运维成本，还能支撑继续迭代。具身智能公司常被追问「商业闭环了吗」，意思是有没有不靠融资也能跑通的真实订单，而不只是演示和意向订单。机器人领域的闭环常和数据飞轮绑在一起：部署带来收入，也带来真实数据来改进模型。","example":"一家公司的机器人在仓库做分拣，客户按台租用并续约，租金覆盖了硬件和运维成本，就算跑通了这个场景的商业闭环。","related":["场景落地","PMF（产品市场匹配）","数据飞轮","投资回报 / 回本周期","规模化部署","框架订单 / 意向订单"]},{"id":"product-market-fit","category":"industry","sec":7,"tier":2,"sources":[{"title":"Product-market fit - Wikipedia","url":"https://en.wikipedia.org/wiki/Product-market_fit"},{"title":"The only thing that matters - Marc Andreessen","url":"https://pmarchive.com/guide_to_startups_part4.html"}],"as_of":"","related_ids":["killer-app","closed-commercial-loop","real-world-deployment","proof-of-concept","scaled-deployment","return-on-investment-payback-period"],"name":"PMF（产品市场匹配）","alt":"Product-Market Fit","abbr":"PMF","aliases":["产品市场匹配","产品市场契合"],"one_liner":"产品正好满足一个足够大的市场需求，客户愿意主动买单","explanation":"PMF 是创业和投资圈术语，指产品找到了真正需要它、且规模足够大的市场，表现为客户主动购买、复购、口碑传播。这一概念源自风投人 Andy Rachleff，2007 年 Marc Andreessen 在博客中把它写成「创业唯一重要的事」后广泛流行。在具身智能里，PMF 是最常被追问的问题：机器人技术演示很惊艳，但在哪个场景能以可接受的价格、稳定性和效率替代现有方案，还在摸索。找到 PMF 之前，很多公司收入主要来自科研教育、展示和试点。","example":"投资人问一家人形机器人公司：除了科研教育和商演，哪个场景客户愿意按台批量复购？这就是在问 PMF。","related":["杀手级应用","商业闭环","场景落地","概念验证","规模化部署","投资回报 / 回本周期"]},{"id":"killer-app","category":"industry","sec":7,"tier":2,"sources":[{"title":"Killer application - Wikipedia","url":"https://en.wikipedia.org/wiki/Killer_application"},{"title":"VisiCalc - Wikipedia","url":"https://en.wikipedia.org/wiki/VisiCalc"}],"as_of":"","related_ids":["product-market-fit","closed-commercial-loop","real-world-deployment","chatgpt-moment-for-robotics","iphone-moment"],"name":"杀手级应用","alt":"Killer App (Killer Use Case)","abbr":"","aliases":["杀手应用"],"one_liner":"好到让人专门为它买下整套产品的那个用途","explanation":"杀手级应用原是 IT 行业用语，指某个软件或用途价值大到足以单独推动用户购买一整类硬件或平台。经典例子是 1979 年的电子表格软件 VisiCalc，很多企业为了用它才买 Apple II 电脑。在具身智能里，大家讨论的是：人形机器人和通用机器人到底哪一个场景能让客户愿意为它付钱、而且需求量足够大。目前行业普遍认为还没有公认的杀手级应用，工厂搬运、仓储分拣、家务、导览、科研教育都有人押注，这也是 PMF 和商业闭环讨论的核心。","example":"VisiCalc 之于 Apple II；有人认为家务机器人如果能稳定叠衣服、收拾房间，会是具身智能的杀手级应用。","related":["PMF（产品市场匹配）","商业闭环","场景落地","ChatGPT 时刻","iPhone 时刻"]},{"id":"chatgpt-moment-for-robotics","category":"industry","sec":8,"tier":1,"sources":[{"title":"NVIDIA Launches Cosmos World Foundation Model Platform to Accelerate Physical AI Development","url":"https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-world-foundation-model-platform-to-accelerate-physical-ai-development"},{"title":"MIT Technology Review: Is robotics about to have its own ChatGPT moment?（2024-04-11）","url":"https://www.technologyreview.com/2024/04/11/1090718/household-robots-ai-data-robotics/"}],"as_of":"2025-01","related_ids":["iphone-moment","imagenet-moment","deepseek-moment-for-embodied-ai","embodied-ai-bubble","general-purpose-robot","nvidia"],"name":"ChatGPT 时刻","alt":"ChatGPT Moment for Robotics","abbr":"","aliases":["机器人ChatGPT时刻","GPT时刻","具身智能的GPT时刻"],"one_liner":"业内对「机器人通用能力突然变得可用、被大众感知」那个拐点的说法。","explanation":"借用 2022 年底 ChatGPT 发布后大语言模型迅速出圈的经历，指机器人也会迎来类似转折：一个通用模型让机器人在陌生环境里完成多种任务，普通人第一次觉得「能用了」。2024 年已有媒体和学者这样讨论，英伟达 CEO 黄仁勋在 CES 2025 发布 Cosmos 时说「机器人的 ChatGPT 时刻即将到来」后，这个说法在发布会和融资新闻里更加常见。它不是技术指标，没有统一判定标准；听到时要追问：在多少种任务、多少个新场景、多高成功率下成立。类似说法还有「iPhone 时刻」「ImageNet 时刻」。","example":"英伟达在 CES 2025 发布 Cosmos 世界基础模型时，黄仁勋称机器人的 ChatGPT 时刻即将到来。","related":["iPhone 时刻","ImageNet 时刻","DeepSeek 时刻","具身智能泡沫","通用机器人","英伟达"]},{"id":"iphone-moment","category":"industry","sec":8,"tier":3,"sources":[{"title":"iPhone (1st generation) - Wikipedia","url":"https://en.wikipedia.org/wiki/IPhone_(1st_generation)"}],"as_of":"","related_ids":["chatgpt-moment-for-robotics","imagenet-moment","consumer-grade-robot","killer-app","embodied-ai-bubble"],"name":"iPhone 时刻","alt":"iPhone Moment","abbr":"","aliases":["AI 的 iPhone 时刻","机器人的 iPhone 时刻"],"one_liner":"一项技术出现标志性产品、开始被大众广泛使用的转折点","explanation":"「iPhone 时刻」借用 2007 年苹果发布第一代 iPhone、带动智能手机普及的故事，指一项技术出现让大众和产业普遍感知的标志性产品，从此进入快速普及。据报道，黄仁勋在 2023 年 3 月的 GTC 上说「AI 的 iPhone 时刻」已经到来，指的是 ChatGPT。具身智能里常被用来问：人形或家用机器人什么时候迎来自己的 iPhone 时刻，也就是出现一款价格可接受、在家庭或工厂里真正能干活的产品。它和「ChatGPT 时刻」意思相近，前者偏产品普及，后者偏能力突破。","example":"「家用人形机器人的 iPhone 时刻还没到」通常是指：能做 demo 的很多，但能卖进普通家庭、稳定干活的产品还没有。","related":["ChatGPT 时刻","ImageNet 时刻","消费级机器人","杀手级应用","具身智能泡沫"]},{"id":"imagenet-moment","category":"industry","sec":8,"tier":3,"sources":[{"title":"ImageNet - Wikipedia","url":"https://en.wikipedia.org/wiki/ImageNet"},{"title":"NLP's ImageNet moment has arrived (The Gradient)","url":"https://thegradient.pub/nlp-imagenet/"}],"as_of":"","related_ids":["data-scarcity","open-x-embodiment","agibot-world","benchmark","chatgpt-moment-for-robotics","iphone-moment"],"name":"ImageNet 时刻","alt":"ImageNet Moment","abbr":"","aliases":["具身智能的 ImageNet 时刻"],"one_liner":"某领域因一个大规模数据集和基准而迎来方法突破的转折点","explanation":"ImageNet 是李飞飞团队 2009 年发布的大规模标注图像数据集。2012 年 AlexNet 用深度卷积网络在 ImageNet 挑战赛上大幅领先其他方法，被普遍看作深度学习爆发的起点。此后「ImageNet 时刻」泛指：一个领域有了足够大的公开数据和统一基准，某种方法明显胜出并带动整个领域转向。2018 年 Sebastian Ruder 就用「NLP 的 ImageNet 时刻」形容预训练语言模型的兴起。具身智能里常说「还缺自己的 ImageNet」，指缺少规模足够、格式统一、被广泛采用的机器人数据集和评测，Open X-Embodiment、AgiBot World 等都被放在这个语境里讨论。","example":"讨论具身数据时常见的说法：机器人学习还在等它的 ImageNet 时刻，瓶颈是真机数据太少、各家格式不统一。","related":["数据荒","Open X-Embodiment 数据集","AgiBot World 数据集","基准测试","ChatGPT 时刻","iPhone 时刻"]},{"id":"deepseek-moment-for-embodied-ai","category":"industry","sec":8,"tier":3,"sources":[{"title":"DeepSeek - Wikipedia","url":"https://en.wikipedia.org/wiki/DeepSeek"}],"as_of":"","related_ids":["chatgpt-moment-for-robotics","iphone-moment","imagenet-moment","open-weight-model","embodied-ai-bubble","consensus-non-consensus"],"name":"DeepSeek 时刻","alt":"“DeepSeek Moment” for Embodied AI","abbr":"","aliases":["具身智能的 DeepSeek 时刻"],"one_liner":"借 DeepSeek-R1 出圈的说法，指开源低成本模型让具身智能门槛骤降的转折点","explanation":"说法来自 2025 年 1 月 DeepSeek 发布开放权重的推理模型 DeepSeek-R1：性能接近当时顶级闭源模型，公开的训练成本却低很多，一度引发美股 AI 板块大跌。具身智能圈借用它，指期待中的这样一个节点：某个开源、便宜、效果够好的机器人模型出现，让中小团队也能在它上面做出能用的产品，行业从此加速。它和「ChatGPT 时刻」的侧重不同，后者强调能力第一次让普通人觉得「能用了」，前者强调开源和成本。这是行业口号，没有判定标准，听到时要追问开源了什么、成本降了多少、在哪些任务上成立。","example":"","related":["ChatGPT 时刻","iPhone 时刻","ImageNet 时刻","开放权重","具身智能泡沫","共识 / 非共识"]},{"id":"gartner-hype-cycle","category":"industry","sec":8,"tier":3,"sources":[{"title":"Gartner hype cycle - Wikipedia","url":"https://en.wikipedia.org/wiki/Gartner_hype_cycle"}],"as_of":"","related_ids":["embodied-ai-bubble","consensus-non-consensus","chatgpt-moment-for-robotics","year-one-of-mass-production","real-world-deployment"],"name":"技术成熟度曲线（Gartner 炒作周期）","alt":"Gartner Hype Cycle","abbr":"","aliases":["炒作周期","技术成熟度曲线"],"one_liner":"描述新技术从被热捧、到幻灭、再到真正落地的五阶段曲线","explanation":"技术成熟度曲线由咨询公司 Gartner 的分析师 Jackie Fenn 在 1995 年提出，Gartner 每年按技术领域发布多张。曲线把一项新技术的公众期望分成五段：技术萌芽期、期望膨胀的顶峰、泡沫破裂的低谷、稳步爬升的复苏期、生产成熟期。它想说明的是：媒体热度和实际可用程度往往不同步，热度最高时常常离大规模落地还远。行业讨论「具身智能是不是泡沫」「人形机器人处在哪个阶段」时经常借用这张图。它是经验性框架，不是定量预测，很多技术并不会走完整条曲线。","example":"据报道，Gartner 2025 年的人工智能技术成熟度曲线中，生成式 AI 已从顶峰滑入低谷期。","related":["具身智能泡沫","共识 / 非共识","ChatGPT 时刻","量产元年","场景落地"]},{"id":"embodied-ai-bubble","category":"industry","sec":8,"tier":2,"sources":[{"title":"Embodied Intelligence 2026: Farewell to Narrative Hype, Practical Deployment Reigns Supreme (36Kr)","url":"https://eu.36kr.com/en/p/3953394550537606"},{"title":"Wikipedia: Gartner hype cycle","url":"https://en.wikipedia.org/wiki/Gartner_hype_cycle"}],"as_of":"2025-11","related_ids":["gartner-hype-cycle","hundred-robot-war","homogenization-redundant-construction","framework-order-letter-of-intent-order","demo","closed-commercial-loop"],"name":"具身智能泡沫","alt":"Embodied AI Bubble","abbr":"","aliases":["泡沫","具身泡沫论","人形机器人泡沫"],"one_liner":"担心具身智能的融资和估值跑在技术成熟与商业落地前面。","explanation":"指对具身智能、特别是人形机器人赛道过热的质疑：公司数量、融资额和估值涨得很快，但能稳定干活、带来持续收入的场景还少，公布的订单里不少是框架订单或科研教育采购，演示视频也常有遥操作、剪辑的成分。持这种看法的人担心赛道会像其他过热技术一样，热度退去后进入低谷、大批公司出局。反方认为模型和硬件在快速进步，新产业早期投入过热是常态。判断时可以看三件事：演示是否全自主、订单是否真实交付、单台能否回本。","example":"据报道，2025 年 11 月国家发改委新闻发布会提到国内人形机器人企业已超过 150 家，提示要防范高度相似的产品扎堆上市、研发空间被压缩等风险。","related":["技术成熟度曲线（Gartner 炒作周期）","百机大战","同质化 / 重复建设","框架订单 / 意向订单","Demo（演示视频）","商业闭环"]},{"id":"hundred-robot-war","category":"industry","sec":8,"tier":3,"sources":[{"title":"国家发改委：防范重复度高的人形机器人产品「扎堆」上市（中国政府网，2025-11）","url":"https://www.gov.cn/yaowen/liebiao/202511/content_7049858.htm"}],"as_of":"2025-11","related_ids":["homogenization-redundant-construction","embodied-ai-bubble","price-war","mass-production","humanoid-robot"],"name":"百机大战","alt":"Hundred-Robot War (crowded humanoid market)","abbr":"","aliases":["人形机器人百机大战"],"one_liner":"形容国内上百家企业扎堆做人形机器人整机的行业说法","explanation":"「百机大战」是国内媒体和投资圈的说法，仿照 2023 年大模型领域的「百模大战」，形容人形机器人整机厂商数量激增、产品形态和参数趋同的局面。国家发改委在 2025 年 11 月的新闻发布会上提到，国内人形机器人企业已超过 150 家，半数以上是初创或跨行入局，并提醒防范重复度高的产品扎堆上市、挤压研发空间。对新人来说，这个词提示的是：整机外形越来越像之后，竞争焦点会转到量产成本、真实场景订单和模型能力上，行业可能进入淘汰整合。","example":"看到又一款新人形发布时，行业评论常会问：在百机大战里，它和已有产品相比到底差异在哪、有没有真实订单。","related":["同质化 / 重复建设","具身智能泡沫","价格战","量产","人形机器人"]},{"id":"homogenization-redundant-construction","category":"industry","sec":8,"tier":3,"sources":[{"title":"工业和信息化部等七部门关于推动未来产业创新发展的实施意见（中国政府网）","url":"https://www.gov.cn/zhengce/zhengceku/202401/content_6929021.htm"}],"as_of":"2025-11","related_ids":["hundred-robot-war","embodied-ai-bubble","price-war","form-factor-debate","future-industries"],"name":"同质化 / 重复建设","alt":"Homogenization / Redundant Construction","abbr":"","aliases":["扎堆上市"],"one_liner":"大量企业和地方做差不多的产品和项目，造成资源浪费","explanation":"同质化指不同公司的产品在形态、功能和卖点上高度相似，难以区分；重复建设是中国政策语境里的老词，指各地在同一赛道上重复上马相似项目、园区和产能。人形机器人热潮中，大量公司推出外观和参数接近的整机，各地争建创新中心和训练场，一批公司同时冲刺上市，于是出现了这类批评。据报道，2025 年 11 月国家发改委曾公开提示人形机器人行业的泡沫风险，称相关整机企业已超过 150 家，要防范高度相似的产品扎堆涌入市场。政策文件对应的正面说法是「错位发展」。","example":"工信部等七部门的未来产业实施意见要求地方结合自身产业基础「合理规划、精准培育和错位发展」。","related":["百机大战","具身智能泡沫","价格战","形态之争","未来产业"]},{"id":"funding-rounds-and-valuation","category":"industry","sec":8,"tier":3,"sources":[{"title":"Unicorn (finance) - Wikipedia","url":"https://en.wikipedia.org/wiki/Unicorn_(finance)"},{"title":"Venture round - Wikipedia","url":"https://en.wikipedia.org/wiki/Venture_round"},{"title":"Figure Exceeds $1B in Series C Funding at $39B Post-Money Valuation","url":"https://www.figure.ai/news/series-c"}],"as_of":"2025-09","related_ids":["pre-ipo-tutoring","star-market","hkex-chapter-18c","embodied-ai-bubble","patient-capital"],"name":"融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）","alt":"Funding Rounds & Valuation (Angel / Series A… / Pre-IPO / Unicorn)","abbr":"","aliases":["融资轮次","独角兽"],"one_liner":"创业公司按阶段分批拿投资的叫法，估值是投资人认可的公司价格","explanation":"创业公司通常分阶段融资：种子轮、天使轮时往往只有团队和想法；A、B、C 轮对应产品验证、放量和扩张；Pre-IPO 是上市前最后一轮。每轮投资人按约定的估值换取股份，「投后估值」指这轮钱进来之后的公司总价。估值 10 亿美元以上、尚未上市的创业公司被称为「独角兽」，这个说法由投资人 Aileen Lee 在 2013 年提出。具身智能新闻里的「完成数亿元 A+ 轮」「估值翻倍」都是这套语言。轮次只说明融资节奏，不等于技术或收入水平，读新闻时要和量产、订单等信息一起看。","example":"Figure AI 在 2025 年 9 月宣布 C 轮融资超过 10 亿美元，投后估值 390 亿美元。","related":["上市辅导","科创板","港股 18C 章","具身智能泡沫","耐心资本（国资长线投资）"]},{"id":"total-addressable-market","category":"industry","sec":8,"tier":3,"sources":[{"title":"Wikipedia: Total addressable market","url":"https://en.wikipedia.org/wiki/Total_addressable_market"}],"as_of":"","related_ids":["closed-commercial-loop","labor-shortage","funding-rounds-and-valuation","product-market-fit","real-world-deployment","mass-production"],"name":"市场空间（TAM）","alt":"Total Addressable Market","abbr":"TAM","aliases":["潜在市场总量","总可触达市场"],"one_liner":"一个产品理论上能拿下的全部市场规模","explanation":"TAM 是创投和咨询行业估算市场的常用口径，指假设一个产品拿下全部目标客户时对应的年收入总量。它常和 SAM（可服务市场，考虑地域、渠道等限制后真正够得着的部分）、SOM（近期能实际拿到的份额）一起用，三者逐层收窄。具身智能融资材料和研报里经常出现人形机器人 TAM 的测算，思路多是「可替代的劳动岗位数 × 单台价格或节省的人工成本」。读这类数字时要注意假设前提：TAM 讲的是天花板，不代表短期能卖出去的量。","example":"研报估算人形机器人 TAM 时，常先统计制造业、物流、家务等岗位人数，再乘以假设的替代比例和单台价格。","related":["商业闭环","用工荒 / 劳动力短缺","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）","PMF（产品市场匹配）","场景落地","量产"]},{"id":"patient-capital","category":"industry","sec":8,"tier":3,"sources":[{"title":"Patient capital - Wikipedia","url":"https://en.wikipedia.org/wiki/Patient_capital"}],"as_of":"","related_ids":["national-ai-industry-investment-fund","funding-rounds-and-valuation","future-industries","new-quality-productive-forces","homogenization-redundant-construction","embodied-ai-bubble"],"name":"耐心资本（国资长线投资）","alt":"Patient Capital (State-backed Long-term Investment)","abbr":"","aliases":["耐心资本"],"one_liner":"愿意长期持有、不急于短期回报的投资，国内多指国资基金","explanation":"耐心资本是经济学概念，指愿意长期持有、不追求短期退出和回报的资本。2024 年起它频繁出现在中国政策文件中，二十届三中全会决定提出「发展耐心资本」，鼓励投早、投小、投长期、投硬科技。具身智能研发周期长、量产和盈利都还远，普通风投的 5–7 年退出期往往等不起，所以国家级、地方政府引导基金和国资平台成了这个赛道的重要出资方。它也带来副作用：各地争相投本地项目，容易造成同质化和重复建设。","example":"国家人工智能产业投资基金、各地政府产业引导基金参与多家人形机器人公司的融资轮次，常被媒体称为国资耐心资本入场。","related":["国家人工智能产业投资基金","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）","未来产业","新质生产力","同质化 / 重复建设","具身智能泡沫"]},{"id":"star-market","category":"industry","sec":8,"tier":2,"sources":[{"title":"STAR Market - Wikipedia","url":"https://en.wikipedia.org/wiki/STAR_Market"},{"title":"上海证券交易所科创板","url":"https://star.sse.com.cn/"}],"as_of":"2025","related_ids":["pre-ipo-tutoring","first-listed-humanoid-robot-stock","hkex-chapter-18c","humanoid-robot-concept-stocks","backdoor-listing"],"name":"科创板","alt":"STAR Market (Shanghai Sci-Tech Innovation Board)","abbr":"","aliases":["上交所科创板"],"one_liner":"上海证券交易所面向硬科技企业的股票板块，试点注册制","explanation":"科创板是上海证券交易所设立的独立板块，2019 年 7 月开市，是中国最早试点股票发行注册制的板块，定位服务半导体、高端装备、人工智能等「硬科技」企业，对未盈利企业也留有上市通道。机器人和具身智能公司研发投入大、盈利周期长，科创板是它们在 A 股上市的主要去处之一，新闻里「人形机器人第一股」「上市辅导」多与它有关。","example":"据报道，宇树科技 2025 年启动上市辅导，拟在科创板上市。","related":["上市辅导","人形机器人第一股","港股 18C 章","人形机器人概念股","借壳上市"]},{"id":"hkex-chapter-18c","category":"industry","sec":8,"tier":3,"sources":[{"title":"Black Sesame Technologies - Wikipedia","url":"https://en.wikipedia.org/wiki/Black_Sesame_Technologies"}],"as_of":"2024-08","related_ids":["star-market","pre-ipo-tutoring","first-listed-humanoid-robot-stock","funding-rounds-and-valuation","backdoor-listing"],"name":"港股 18C 章","alt":"HKEX Chapter 18C (Specialist Technology Companies)","abbr":"18C","aliases":["港股 18C","18C 上市"],"one_liner":"港交所为收入尚少的硬科技公司开设的上市通道","explanation":"18C 章是香港联交所《上市规则》中针对「特专科技公司」的一章，2023 年 3 月底生效。它允许新一代信息技术、先进硬件及软件、先进材料、新能源、新食品及农业技术等领域的公司，在收入很少甚至尚未商业化时上市，但要求更高的上市市值和资深独立投资者参与。设立时的市值门槛为：已商业化公司 60 亿港元、未商业化公司 100 亿港元，据报道后来曾临时下调。机器人、自动驾驶芯片等烧钱多、盈利晚的公司常考虑走这条路。","example":"黑芝麻智能 2024 年 8 月按 18C 章在港交所上市，是第二家使用该规则上市的公司。","related":["科创板","上市辅导","人形机器人第一股","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）","借壳上市"]},{"id":"pre-ipo-tutoring","category":"industry","sec":8,"tier":3,"sources":[{"title":"Unitree Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Unitree_Robotics"},{"title":"Initial public offering - Wikipedia","url":"https://en.wikipedia.org/wiki/Initial_public_offering"}],"as_of":"2026-09","related_ids":["star-market","hkex-chapter-18c","first-listed-humanoid-robot-stock","backdoor-listing","special-purpose-acquisition-company","funding-rounds-and-valuation"],"name":"上市辅导","alt":"Pre-IPO Tutoring (Listing Guidance)","abbr":"","aliases":["IPO 辅导","辅导备案"],"one_liner":"A 股公司正式申报上市前，由券商帮它规范治理的法定程序","explanation":"上市辅导是中国 A 股首次公开发行（IPO）前的必经程序：公司先与券商签订辅导协议，到所在地证监局办理辅导备案，由券商对公司治理、财务、内控进行规范，并对董监高做证券法规培训；辅导验收通过后，才能向交易所提交上市申请。因为备案信息会在证监局网站公示，「某公司启动上市辅导」常被当作它准备上市的第一个公开信号。2025 年起多家人形机器人公司陆续进入辅导。","example":"据维基百科，宇树科技 2025 年 7 月由中信证券开始上市辅导，2026 年 8 月在上海证券交易所上市。","related":["科创板","港股 18C 章","人形机器人第一股","借壳上市","SPAC 上市（特殊目的收购公司）","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）"]},{"id":"backdoor-listing","category":"industry","sec":8,"tier":3,"sources":[{"title":"智元机器人拟收购上纬新材63.62%股份（华尔街见闻）","url":"https://wallstreetcn.com/articles/3750667"},{"title":"锋龙股份再回应：优必选三年内不会借壳上市（新京报）","url":"https://m.bjnews.com.cn/detail/1766920585129742.html"},{"title":"Reverse takeover - Wikipedia","url":"https://en.wikipedia.org/wiki/Reverse_takeover"}],"as_of":"2026-04","related_ids":["swancor-advanced-materials","zhejiang-fenglong-electric","agibot","star-market","hkex-chapter-18c","special-purpose-acquisition-company"],"name":"借壳上市","alt":"Backdoor Listing (Reverse Takeover)","abbr":"RTO","aliases":["借壳","入主上市公司"],"one_liner":"未上市公司买下一家上市公司控制权，再把自己的业务注入其中实现上市","explanation":"借壳上市指一家未上市公司先取得某家已上市公司（「壳」）的控制权，再把自家资产和业务注入，从而绕开首次公开发行（IPO）排队实现上市。在 A 股，控制权变更后注入资产达到一定规模会被认定为重组上市，审核标准接近 IPO。具身智能公司估值高、亏损多，走 IPO 周期长，所以「入主上市公司」常被市场解读为借壳信号：2025 年 7 月智元机器人宣布取得科创板公司上纬新材约 63.62% 股份，2026 年优必选完成入主锋龙股份。两家都公开表示三年内不借壳，新闻里要区分「取得控股权」和「真正注入资产」。","example":"智元入主上纬新材后，上纬新材以「上纬启元」品牌独立做消费级机器人，而不是直接装入智元的全部业务。","related":["上纬新材","锋龙股份","智元机器人","科创板","港股 18C 章","SPAC 上市（特殊目的收购公司）"]},{"id":"special-purpose-acquisition-company","category":"industry","sec":8,"tier":3,"sources":[{"title":"Special-purpose acquisition company - Wikipedia","url":"https://en.wikipedia.org/wiki/Special-purpose_acquisition_company"}],"as_of":"2022-01","related_ids":["backdoor-listing","star-market","hkex-chapter-18c","pre-ipo-tutoring","funding-rounds-and-valuation"],"name":"SPAC 上市（特殊目的收购公司）","alt":"Special Purpose Acquisition Company","abbr":"SPAC","aliases":["空白支票公司","SPAC 上市"],"one_liner":"先上市一个空壳公司募资，再与目标公司合并，让后者间接上市。","explanation":"SPAC 是一种没有实际业务的上市公司，它先通过 IPO 募集资金放进信托账户，然后在规定期限内（通常一到两年）寻找一家未上市公司合并，合并完成后目标公司就成了上市公司。相比传统 IPO，它流程更快、估值可以提前谈定，但也常被批评对散户信息披露不足。2020–2021 年美股 SPAC 数量激增，一批机器人公司借此上市；港交所自 2022 年起也引入了 SPAC 机制。","example":"外骨骼与机器人公司 Sarcos、仓储机器人公司 Berkshire Grey 都在 2021 年通过 SPAC 在美股上市。","related":["借壳上市","科创板","港股 18C 章","上市辅导","融资轮次与估值（天使轮 / A 轮 / Pre-IPO / 独角兽）"]},{"id":"first-listed-humanoid-robot-stock","category":"industry","sec":8,"tier":3,"sources":[{"title":"UBtech Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/UBtech_Robotics"},{"title":"Unitree Robotics - Wikipedia","url":"https://en.wikipedia.org/wiki/Unitree_Robotics"}],"as_of":"2026-08","related_ids":["ubtech-robotics","unitree-robotics","star-market","hkex-chapter-18c","pre-ipo-tutoring","humanoid-robot-concept-stocks"],"name":"人形机器人第一股","alt":"First Listed Humanoid Robot Stock","abbr":"","aliases":["A股人形机器人第一股","港股人形机器人第一股"],"one_liner":"媒体对某市场首家上市的人形机器人公司的称呼。","explanation":"「第一股」是媒体和券商的习惯叫法，指某个板块里第一家上市的公司，不是官方认定。港股的「人形机器人第一股」通常指优必选，它 2023 年 12 月在港交所主板上市（代码 9880）。A 股方面，宇树科技 2025 年 7 月启动上市辅导，2026 年 8 月在上交所科创板上市（688836），被媒体视为 A 股人形机器人上市的标志性事件。由于细分口径不同，还有「协作机器人第一股」（越疆）、「机器人大脑第一股」（仙工智能）等说法。看到这个称号时，应该回到公司的主营收入结构去判断，它实际卖的是人形机器人、教育产品还是其他业务。","example":"优必选上市时人形机器人收入占比不高，主要收入来自教育机器人和消费级产品。","related":["优必选","宇树科技","科创板","港股 18C 章","上市辅导","人形机器人概念股"]},{"id":"humanoid-robot-concept-stocks","category":"industry","sec":8,"tier":3,"sources":[{"title":"概念股 - 维基百科","url":"https://zh.wikipedia.org/wiki/%E6%A6%82%E5%BF%B5%E8%82%A1"}],"as_of":"","related_ids":["tesla-supply-chain","first-listed-humanoid-robot-stock","per-unit-content-value","upstream-midstream-downstream-of-the-industry-chain","embodied-ai-bubble"],"name":"人形机器人概念股","alt":"Humanoid Robot Concept Stocks","abbr":"","aliases":["机器人概念股"],"one_liner":"股市里被归为与人形机器人相关、随行业消息涨跌的一批股票","explanation":"概念股是 A 股和港股里的通俗叫法，指因业务或传闻与某个热门题材相关而被市场归到一起炒作的股票。人形机器人概念股包括整机公司，也包括减速器、丝杠、电机、传感器等零部件供应商，以及被认为进入特斯拉 Optimus 供应链（「T 链」）的公司。特斯拉发布会、春晚表演、头部公司融资等消息常带动整个板块同涨同跌。需要注意的是，不少概念股的机器人收入占比很低，股价反映的是预期，而不是已实现的业绩。","example":"三花智控、拓普集团等汽车零部件公司因被认为参与 Optimus 执行器供应，常被归入人形机器人概念股。","related":["T 链（特斯拉链）","人形机器人第一股","单机价值量","产业链上中下游","具身智能泡沫"]},{"id":"tesla-supply-chain","category":"industry","sec":8,"tier":3,"sources":[{"title":"Tesla AI & Robotics","url":"https://www.tesla.com/AI"}],"as_of":"","related_ids":["tesla-optimus","tesla","humanoid-robot-concept-stocks","sampling-supplier-nomination","planetary-roller-screw","per-unit-content-value"],"name":"T 链（特斯拉链）","alt":"Tesla (Optimus) Supply Chain","abbr":"T链","aliases":["特斯拉链","T链","Optimus 供应链"],"one_liner":"被认为进入或可能进入特斯拉 Optimus 供应链的零部件企业，多指 A 股概念。","explanation":"T 链是国内资本市场的说法，原指特斯拉汽车的供应商，后来多指可能给特斯拉 Optimus 人形机器人供货的企业，涉及执行器、行星滚柱丝杠、谐波减速器、空心杯电机、传感器等环节。特斯拉没有公开完整的 Optimus 供应商名单，所谓「进入 T 链」多来自公司表述、调研纪要或媒体报道，其中不少只处于送样阶段。这类公司股价常随 Optimus 的消息大幅波动，读相关新闻时要区分已定点和传闻。","example":"三花智控、拓普集团等常被市场归入 T 链，相关合作多为据报道。","related":["擎天柱","特斯拉","人形机器人概念股","送样 / 定点","行星滚柱丝杠","单机价值量"]},{"id":"per-unit-content-value","category":"industry","sec":8,"tier":3,"sources":[{"title":"Bill of materials - Wikipedia","url":"https://en.wikipedia.org/wiki/Bill_of_materials"}],"as_of":"","related_ids":["bill-of-materials-cost","shipment-volume","total-addressable-market","upstream-midstream-downstream-of-the-industry-chain","core-components","tesla-supply-chain"],"name":"单机价值量","alt":"Per-Unit Content Value (component value per robot)","abbr":"","aliases":["单台价值量"],"one_liner":"某类零部件在一台机器人里所占的金额，用来估算市场规模","explanation":"单机价值量是券商研报和产业分析里的常用词，指一台机器人里某类零部件（或某家供应商的产品）加起来值多少钱，比如一台人形机器人要用几十个关节，每个关节配一套减速器、电机、丝杠，乘起来就是这类零件的单机价值量。它和 BOM 成本（整机物料清单成本）相关，但关注点是某一类零件。分析师用「单机价值量 × 预计出货量」估算零部件市场空间，并据此判断哪些上游公司受益最大，所以它常和 T 链、概念股一起出现。","example":"研报估算人形机器人里行星滚柱丝杠、谐波减速器和无框力矩电机单机价值量较高，据此推荐相关上游公司。","related":["BOM 成本","出货量","市场空间（TAM）","产业链上中下游","核心零部件","T 链（特斯拉链）"]},{"id":"embodied-ai-first-named-in-the-government-work-report","category":"industry","sec":9,"tier":2,"sources":[{"title":"政府工作报告（2025 年 3 月 5 日，中国政府网）","url":"https://www.gov.cn/yaowen/liebiao/202503/content_7013163.htm"}],"as_of":"2025-03","related_ids":["future-industries","new-quality-productive-forces","15th-five-year-plan","ai-plus-initiative","guiding-opinions-on-the-innovative-development-of-humanoid-r","embodied-ai"],"name":"政府工作报告首次写入具身智能","alt":"Embodied AI First Named in the Government Work Report (2025)","abbr":"","aliases":["具身智能写入政府工作报告"],"one_liner":"2025 年政府工作报告首次点名具身智能，把它列为要培育的未来产业。","explanation":"2025 年 3 月 5 日，国务院总理李强在十四届全国人大三次会议上作政府工作报告，在 2025 年工作任务中关于新兴产业、未来产业的部分写道：培育生物制造、量子科技、具身智能、6G 等未来产业。这是「具身智能」一词第一次出现在政府工作报告里。政府工作报告是每年两会上国务院向全国人大报告的年度施政纲领，写进去意味着具身智能被列为国家层面的产业方向。此后各地陆续出台专项政策、设立产业基金、建设数据采集训练场，业内常把这件事看作具身智能在国内被正式定调的节点。","example":"报告原文：「培育生物制造、量子科技、具身智能、6G等未来产业。」","related":["未来产业","新质生产力","十五五规划","人工智能+ 行动","人形机器人创新发展指导意见","具身智能"]},{"id":"future-industries","category":"industry","sec":9,"tier":3,"sources":[{"title":"工业和信息化部等七部门关于推动未来产业创新发展的实施意见（中国政府网）","url":"https://www.gov.cn/zhengce/zhengceku/202401/content_6929021.htm"}],"as_of":"2024-01","related_ids":["new-quality-productive-forces","guiding-opinions-on-the-innovative-development-of-humanoid-r","15th-five-year-plan","embodied-ai-first-named-in-the-government-work-report","patient-capital"],"name":"未来产业","alt":"Future Industries","abbr":"","aliases":[],"one_liner":"中国政策用语，指技术还在早期、但可能成为下一代支柱的新产业","explanation":"未来产业是中国产业政策里的一个分类，指由前沿技术驱动、目前处于孕育或萌芽阶段、将来可能形成大规模产业的方向，和已经成形的「战略性新兴产业」相对。2024 年 1 月，工信部等七部门发布《关于推动未来产业创新发展的实施意见》，提出重点推进未来制造、未来信息、未来材料、未来能源、未来空间和未来健康六大方向，并把人形机器人列为要突破的高端装备产品。具身智能此后也被写进政府工作报告的未来产业名单。理解这个词，有助于看懂地方政府为什么设立机器人专项基金、创新中心和中试基地。","example":"《关于推动未来产业创新发展的实施意见》提出突破人形机器人、量子计算机、超高速列车等高端装备产品。","related":["新质生产力","人形机器人创新发展指导意见","十五五规划","政府工作报告首次写入具身智能","耐心资本（国资长线投资）"]},{"id":"new-quality-productive-forces","category":"industry","sec":9,"tier":3,"sources":[{"title":"New quality productive forces - Wikipedia","url":"https://en.wikipedia.org/wiki/New_quality_productive_forces"}],"as_of":"2024-03","related_ids":["future-industries","15th-five-year-plan","ai-plus-initiative","embodied-ai-first-named-in-the-government-work-report","patient-capital"],"name":"新质生产力","alt":"New Quality Productive Forces","abbr":"","aliases":[],"one_liner":"中国政策用语，指以科技创新为主导的先进生产力","explanation":"新质生产力是中国的政策用语，2023 年 9 月由习近平在黑龙江考察时提出，指由技术革命性突破、生产要素创新性配置等催生、以科技创新为主导的先进生产力。2024 年政府工作报告把「加快发展新质生产力」列入当年重点任务，此后成为产业政策里的高频词。人形机器人、具身智能被归入「未来产业」，常被地方政府和企业作为新质生产力的代表来宣传。对新人来说，理解这个词有助于读懂政策文件、地方补贴、产业基金和招商新闻为什么频繁提到具身智能。","example":"","related":["未来产业","十五五规划","人工智能+ 行动","政府工作报告首次写入具身智能","耐心资本（国资长线投资）"]},{"id":"15th-five-year-plan","category":"industry","sec":9,"tier":3,"sources":[{"title":"Five-year plans of China - Wikipedia","url":"https://en.wikipedia.org/wiki/Five-year_plans_of_China"}],"as_of":"2026-03","related_ids":["future-industries","new-quality-productive-forces","ai-plus-initiative","embodied-ai-first-named-in-the-government-work-report","embodied-ai"],"name":"十五五规划","alt":"15th Five-Year Plan (2026–2030)","abbr":"","aliases":["“十五五”规划"],"one_liner":"中国 2026–2030 年国民经济和社会发展五年规划，具身智能被列为未来产业","explanation":"「十五五」规划是中国第十五个五年规划，覆盖 2026 到 2030 年。流程是先由中共中央全会提出规划建议（2025 年 10 月二十届四中全会审议通过），再由国务院编制规划纲要，2026 年全国两会审议通过。对具身智能来说，关键在于规划建议把具身智能和量子科技、生物制造、脑机接口、6G 等并列为要培育的未来产业和新的经济增长点。五年规划决定了之后几年的部委专项政策、地方产业规划和国有资金投向，所以融资新闻、地方政策常以「落实十五五」作为背景。","example":"","related":["未来产业","新质生产力","人工智能+ 行动","政府工作报告首次写入具身智能","具身智能"]},{"id":"ai-plus-initiative","category":"industry","sec":9,"tier":3,"sources":[{"title":"中国政府网 政策文件库","url":"https://www.gov.cn/zhengce/"}],"as_of":"2025-08","related_ids":["15th-five-year-plan","new-quality-productive-forces","embodied-ai-first-named-in-the-government-work-report","embodied-ai","future-industries"],"name":"人工智能+ 行动","alt":"AI+ Initiative","abbr":"","aliases":["AI+ 行动","人工智能+"],"one_liner":"中国推动人工智能与各行各业深度结合的国家行动，智能机器人是重点方向之一","explanation":"「人工智能+」行动最早在 2024 年政府工作报告中提出，思路类似此前的「互联网+」，即把人工智能接入制造、医疗、交通、政务等各行业。2025 年 8 月国务院印发《关于深入实施「人工智能+」行动的意见》，提出到 2027 年新一代智能终端、智能体等应用普及率超过 70%，到 2030 年超过 90%，并把智能机器人列为新一代智能终端之一。对具身智能行业来说，它和「十五五」规划、未来产业政策一起构成政策背景，地方补贴、场景开放和国资投资常以它为依据。","example":"","related":["十五五规划","新质生产力","政府工作报告首次写入具身智能","具身智能","未来产业"]},{"id":"robot-plus-application-action-implementation-plan","category":"industry","sec":9,"tier":3,"sources":[{"title":"工业和信息化部官网","url":"https://www.miit.gov.cn/"}],"as_of":"2023-01","related_ids":["guiding-opinions-on-the-innovative-development-of-humanoid-r","robot-density","machines-replacing-humans","application-scenario-list-scenario-opening","service-robot","special-purpose-robot"],"name":"《“机器人+”应用行动实施方案》","alt":"“Robot+” Application Action Implementation Plan (MIIT et al., 2023)","abbr":"","aliases":["机器人+ 应用行动","机器人+"],"one_liner":"工信部等十七部门 2023 年初发布的推动机器人进入各行业应用的政策文件","explanation":"这是工业和信息化部牵头、共十七个部门于 2023 年 1 月联合印发的政策文件，思路是「机器人+某个行业」，推动机器人从汽车、电子等传统工厂扩展到更多行业。文件提出到 2025 年制造业机器人密度（每万名工人拥有的机器人台数）较 2020 年翻番，并列出制造业、农业、建筑、能源、商贸物流、医疗健康、养老服务、教育、商业社区服务、安全应急和极限环境等重点领域，要求挖掘和推广典型应用场景。它是人形机器人专项政策之前的一份基础文件，后续各地的场景清单、示范项目常引用它。","example":"","related":["人形机器人创新发展指导意见","机器人密度","机器换人","应用场景清单 / 场景开放","服务机器人","特种机器人"]},{"id":"guiding-opinions-on-the-innovative-development-of-humanoid-r","category":"industry","sec":9,"tier":3,"sources":[{"title":"工业和信息化部等七部门关于推动未来产业创新发展的实施意见（中国政府网，相关后续政策）","url":"https://www.gov.cn/zhengce/zhengceku/202401/content_6929021.htm"}],"as_of":"2023-10","related_ids":["future-industries","braincerebellum-architecture","humanoid-robot","beijing-humanoid-robot-innovation-center","mass-production"],"name":"人形机器人创新发展指导意见","alt":"Guiding Opinions on the Innovative Development of Humanoid Robots (MIIT, 2023)","abbr":"","aliases":["工信部人形机器人指导意见"],"one_liner":"工信部 2023 年发布的人形机器人产业专项政策文件","explanation":"《人形机器人创新发展指导意见》由工业和信息化部于 2023 年 10 月印发，是中国首个专门针对人形机器人的产业政策文件。它提出到 2025 年初步建立创新体系、在「大脑、小脑、肢体」等关键技术上取得突破、核心部件能安全有效供给、整机实现批量生产，到 2027 年形成安全可靠的产业链供应链。行业里常说的「大小脑」分工就因这份文件进一步流行。此后各地出台的人形机器人专项政策、创新中心建设，多以它为依据。","example":"文件提出以「大脑、小脑、肢体」等关键技术为突破口，推动整机产品批量生产。","related":["未来产业","大脑-小脑架构（大小脑）","人形机器人","北京人形机器人创新中心","量产"]},{"id":"unveiling-the-list-competition-mechanism","category":"industry","sec":9,"tier":3,"sources":[{"title":"中国政府网 政策文件库","url":"https://www.gov.cn/zhengce/"}],"as_of":"","related_ids":["application-scenario-list-scenario-opening","chokepoint-technology","domestic-substitution","future-industries","guiding-opinions-on-the-innovative-development-of-humanoid-r"],"name":"揭榜挂帅","alt":"“Open Competition” Mechanism (Unveiling the List and Taking Command)","abbr":"","aliases":["揭榜制"],"one_liner":"政府或企业公开张榜关键技术难题，谁有本事谁来领题攻关的项目组织方式","explanation":"揭榜挂帅是中国科技项目的一种组织方式：出题方（政府部门或龙头企业）把要攻克的关键技术列成「榜单」，写清指标和期限，不论资历、单位，谁能做到谁来「揭榜」，揭榜者牵头「挂帅」，达标后给予资金或订单支持。这一提法 2016 年前后进入中央层面讲话，后来写入「十四五」规划建议。它要解决的是传统立项看资历、成果和需求脱节的问题。在机器人领域，工信部等部门的未来产业、人形机器人相关任务据报道也采用这种方式，新闻里「某企业入选揭榜挂帅单位」通常意味着拿到了国家级攻关任务。","example":"","related":["应用场景清单 / 场景开放","卡脖子","国产替代","未来产业","人形机器人创新发展指导意见"]},{"id":"application-scenario-list-scenario-opening","category":"industry","sec":9,"tier":3,"sources":[{"title":"中华人民共和国科学技术部官网","url":"https://www.most.gov.cn/"}],"as_of":"","related_ids":["unveiling-the-list-competition-mechanism","real-world-deployment","pilot-scale-testing-base","proof-of-concept","embodied-ai-training-ground","task-oriented-grasping"],"name":"应用场景清单 / 场景开放","alt":"Application Scenario List / Scenario Opening","abbr":"","aliases":["场景清单","场景开放","场景创新"],"one_liner":"政府或国企公开列出可让新技术落地试用的业务场景，邀请企业来做","explanation":"这是中国地方政府、国企和园区常用的产业政策工具：把自己手里的真实业务，如政务大厅导览、工厂巡检、物流分拣、养老护理等，整理成「场景清单」对外发布，邀请企业报名，入选后可进场试点，有时附带采购或补贴。国家层面，科技部等部门 2022 年发文推动以场景创新带动人工智能应用。对机器人公司而言，最大难点往往是找到愿意让机器人进场、能产生真实数据和订单的客户，场景开放正好补上这一环，所以常出现在各地具身智能扶持政策里。","example":"","related":["揭榜挂帅","场景落地","中试基地（中试验证平台）","概念验证","具身智能训练场","ToG"]},{"id":"pilot-scale-testing-base","category":"industry","sec":9,"tier":3,"sources":[{"title":"Pilot plant - Wikipedia","url":"https://en.wikipedia.org/wiki/Pilot_plant"}],"as_of":"","related_ids":["embodied-ai-training-ground","proof-of-concept","pilot-small-batch-delivery","engineering-productionization","application-scenario-list-scenario-opening","future-industries"],"name":"中试基地（中试验证平台）","alt":"Pilot-scale Testing Base (Pilot Verification Platform)","abbr":"","aliases":["中试平台","中试验证平台"],"one_liner":"把实验室成果放大到接近量产条件下验证的公共平台","explanation":"中试是「中间试验」的简称，原指化工、制造业里介于实验室小试和工厂量产之间的放大验证环节。中试基地就是提供这类验证条件的平台，常由政府牵头、企业和科研机构共建，提供场地、设备、测试标准和数据。在具身智能领域，中试基地用来测试机器人在接近真实场景下的可靠性、安全性，并采集训练数据、做评测，帮初创公司跨过样机到产品之间的门槛。国内多地已建立具身智能方向的中试基地或验证平台。","example":"据报道，阿里达摩院与国家人工智能应用中试基地（具身智能）达成合作，光轮智能也推出了面向中试基地的仿真评测基础设施。","related":["具身智能训练场","概念验证","试点 / 小批量交付","工程化","应用场景清单 / 场景开放","未来产业"]},{"id":"miit-humanoid-robot-and-embodied-ai-standardization-technica","category":"industry","sec":9,"tier":3,"sources":[{"title":"工业和信息化部人形机器人与具身智能标准化技术委员会成立（工信部，2025-12-27）","url":"https://www.miit.gov.cn/xwfb/bldhd/art/2025/art_25c6077c819d4a77aa7a900a82bbde45.html"}],"as_of":"2025-12","related_ids":["humanoid-robot-intelligence-level-grading","guiding-opinions-on-the-innovative-development-of-humanoid-r","iso-25785-1","embodied-safety","functional-safety"],"name":"人形机器人与具身智能标准化技术委员会","alt":"MIIT Humanoid Robot and Embodied AI Standardization Technical Committee","abbr":"","aliases":["工业和信息化部人形机器人与具身智能标准化技术委员会","人形机器人与具身智能标委会"],"one_liner":"工信部成立的、负责人形与具身智能行业标准的标准化委员会","explanation":"这是工业和信息化部于 2025 年 12 月 26 日成立的行业标准化技术委员会，秘书处设在中国电子学会，工信部总工程师谢少锋任主任委员。它主要负责人形机器人与具身智能在基础共性、关键技术、部组件、整机与系统、应用、安全等方面的行业标准制修订。产业早期，接口、测试方法、安全要求和智能化分级各家说法不一，统一的行业标准能给厂商、客户和监管一套共同口径，也会影响产品准入和采购。新人以后看到这类行业标准立项或征求意见稿，归口单位多半就是它。","example":"人形机器人整机安全、关节模组测试方法这类行业标准，其立项和审查都归这个标委会负责。","related":["人形机器人智能化分级","人形机器人创新发展指导意见","ISO 25785-1 动态稳定移动机器人安全标准","具身安全","功能安全"]},{"id":"embodied-ai-robot-application-technician","category":"industry","sec":9,"tier":2,"sources":[{"title":"北京人形：具身智能机器人应用技术员进入国家新职业序列","url":"https://www.x-humanoid.com/news-view-330.html"},{"title":"钛媒体：机器人还没学会做家务，卖数据的已经先赚到了钱","url":"https://www.tmtpost.com/8062934.html"}],"as_of":"2026-09","related_ids":["data-collector","embodied-ai-training-ground","teleoperation","data-collection-sop","embodied-ai-data-service-provider","beijing-humanoid-robot-innovation-center"],"name":"具身智能机器人应用技术员（新职业）","alt":"Embodied AI Robot Application Technician (National New Occupation)","abbr":"","aliases":["具身智能机器人数据采集员","具身智能机器人训练师"],"one_liner":"2026 年 9 月发布的国家新职业，覆盖数据采集、模型适配到现场部署。","explanation":"2026 年 9 月 9 日，人社部等部门发布第八批新职业，其中有「具身智能机器人应用技术员」（职业编码 4-04-05-16），由中国电子学会申报，北京人形机器人创新中心做技术支撑。官方定义大意是：使用遥操作设备、空间数字化工具和仿真测试平台，从事机器人多模态交互数据采集与处理、算法模型微调与适配、软硬件现场部署与调试、运行监控与维护优化的人员。下设两个工种：具身智能机器人数据采集员和训练师（别名里列的就是这两个工种）。进入国家职业分类后，可以据此制定职业标准、开展培训和技能评价，数采员这类一线岗位也有了正式的职业名称。","example":"在数据基地戴 VR 头显遥操作机器人叠衣服的数采员，属于其中的「具身智能机器人数据采集员」工种。","related":["数采员","具身智能训练场","遥操作","采集 SOP","具身数据服务商（数据采集服务商）","北京人形机器人创新中心"]}]}