12代表性模型与工作
按发展脉络看有名的模型:从 SayCan、RT-2 到 π 系列、GR00T 和世界模型。 · 332 条
- 12.1具身借用的基础大模型11
- 12.2大模型当大脑27
- 12.3端到端学习与 RT 系列16
- 12.4模仿学习经典策略21
- 12.5开源通用策略与 VLA32
- 12.6π 系列与强化学习28
- 12.7海外巨头与明星公司35
- 12.8国内具身模型45
- 12.9世界模型与视频学习43
- 12.10足式、灵巧手与敏捷技能16
- 12.11人形全身控制与遥操作37
- 12.12导航与自动驾驶21
12.1具身借用的基础大模型
具身模型的「眼睛」和「大脑」多是借来的:先认识这些大模型和视觉编码器
- GPT 系列(GPT-4o / GPT-5)OpenAI GPT Series (Generative Pre-trained Transformer)OpenAI 的大语言模型系列,GPT-4o 起能直接处理图像和语音,常被机器人拿来做高层规划。
- FlamingoFlamingo: a Visual Language Model for Few-Shot Learning (DeepMind)DeepMind 2022 年的视觉语言模型,给几个图文示例就能做新任务,是早期 VLM 代表。
- LLaVA(视觉指令微调架构)LLaVA (Large Language and Vision Assistant, Visual Instruction Tuning)2023 年的开源多模态模型:视觉编码器经投影层接入大语言模型,再用指令数据微调。
- PaLI-XPaLI-X: On Scaling up a Multilingual Vision and Language Model谷歌 2023 年约 550 亿参数的多语言视觉语言模型,RT-2 的骨干之一
- Gemini 系列(谷歌多模态大模型)Google Gemini (multimodal LLM family)谷歌 DeepMind 的原生多模态大模型系列,也是 Gemini Robotics 等机器人模型的底座。
- 书生 InternVLInternVL (Shanghai AI Laboratory open VLM series)上海 AI 实验室开源的视觉语言模型系列,起点是一个 60 亿参数的视觉编码器。
- MolmoMolmo (Ai2 open VLM with pointing)Ai2 连权重带训练数据一起开源的视觉语言模型,能在图上用「指点」回答问题
- MVP(掩码视觉预训练)MVP: Masked Visual Pre-training for Motor Control / Real-World Robot Learning with Masked Visual Pre-training用掩码自编码器在海量自然图像上预训练视觉编码器,再冻结给机器人用。
- R3MR3M: A Universal Visual Representation for Robot Manipulation用人类第一人称视频预训练、专供机器人操作使用的通用视觉表征
- VIP(价值隐式预训练)VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training在人类视频上自监督预训练,同时给出视觉表征和稠密奖励的方法
- VC-1VC-1 (Visual Cortex; Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?)Meta 用 4000 多小时第一人称视频 MAE 预训练、给具身任务用的视觉编码器
12.2大模型当大脑
有了大模型,最早的用法是当大脑:拆任务、写代码和奖励、看懂空间,再调现成技能
- SayCanSayCan (Do As I Can, Not As I Say: Grounding Language in Robotic Affordances)语言模型判断哪步「有用」、价值函数判断哪步「做得到」,两者相乘选动作。
- Socratic Models(苏格拉底模型)Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language用自然语言当接口,把多个现成大模型零样本串起来完成多模态任务的框架
- Inner MonologueInner Monologue: Embodied Reasoning through Planning with Language Models把环境反馈写成文字喂回大语言模型,让机器人边做边调整计划
- 代码即策略Code as Policies: Language Model Programs for Embodied Control让大语言模型直接写 Python 程序,调用感知和控制接口来指挥机器人
- ProgPromptProgPrompt: Generating Situated Robot Task Plans using Large Language Models用类 Python 程序格式提示大模型,生成机器人能执行的任务计划
- PaLM-EPaLM-E: An Embodied Multimodal Language Model谷歌 2023 年把图像和机器人状态接进 PaLM 的具身多模态大模型。
- EmbodiedGPTEmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought2023 年港大与上海 AI Lab 的具身多模态模型,用思维链生成分步计划。
- VoyagerVoyager: An Open-Ended Embodied Agent with Large Language Models由 GPT-4 驱动、在 Minecraft 里自己定目标、写代码攒技能的终身学习智能体。
- KnowNo(会求助的机器人)KnowNo: Robots That Ask For Help (Uncertainty Alignment for LLM Planners)让大模型规划器在拿不准时主动问人,并用共形预测给成功率打统计保证。
- SayPlanSayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning借助 3D 场景图,让大语言模型在多楼层大空间里做长程任务规划的方法
- 3D-LLM3D-LLM: Injecting the 3D World into Large Language Models能直接输入 3D 场景特征、回答空间问题和做任务分解的大语言模型。
- LEO(3D 具身通才智能体)LEO: An Embodied Generalist Agent in 3D World (BIGAI)北京通研院提出的 3D 具身通才模型,能看懂三维场景、回答问题、导航和操作。
- Language to Rewards(L2R)Language to Rewards for Robotic Skill Synthesis让大语言模型把人话翻译成奖励函数,再交给实时优化器生成机器人动作。
- EurekaEureka: Human-Level Reward Design via Coding Large Language Models让 GPT-4 写奖励函数代码并反复改进,自动为强化学习设计奖励
- DrEurekaDrEureka: Language Model Guided Sim-To-Real Transfer让大语言模型自动写奖励函数和域随机化参数,把仿真策略迁移到真机。
- VoxPoserVoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models让大模型写代码生成 3D 价值地图,再交给规划器算出机械臂轨迹的零样本方法。
- F3RMDistilled Feature Fields Enable Few-Shot Language-Guided ManipulationMIT 2023 年提出,把 CLIP 等 2D 特征蒸馏进 3D 场,少样本按语言指令抓放。
- OK-RobotOK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics纽约大学 2024 年的拾放系统,把现成视觉语言模型和导航、抓取模块拼起来。
- SpatialVLMSpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities用自动生成的海量 3D 空间问答数据,教视觉语言模型估算距离和大小
- PIVOT(迭代视觉提示)PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs在图上画候选动作让 VLM 反复挑选、逐轮收窄,零样本控制机器人
- MOKA(标记式视觉提示操作)MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting在图上画标记让 GPT-4V 选关键点,再把关键点转成机械臂动作的免训练方法
- CoPaCoPa: General Robotic Manipulation through Spatial Constraints of Parts with Foundation Models让 GPT-4V 找出物体部件并写出空间约束,免训练完成开放指令操作的框架。
- RoboPointRoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics根据语言指令在图上点出「放哪里、抓哪里」的视觉语言模型
- ReKepReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation用大模型把任务写成关键点之间的约束代码,再靠优化求出机器人动作。
- OmniManipOmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints把 VLM 的推理落成物体坐标系里「点+方向」约束的零样本操作框架
- SpatialLM(群核空间大模型)SpatialLM: Training Large Language Models for Structured Indoor Modeling (Manycore)群核科技开源的 3D 大模型,读入室内点云,输出墙门窗和家具的结构化布局
- Embodied-R1Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation天津大学的 3B 具身推理模型,以「指向」为中间表示,用强化微调训练。
12.3端到端学习与 RT 系列
另一条路是端到端学控制:从真机学抓取到通才模型,再到 RT-2 首提 VLA
- 端到端视觉运动策略(引导策略搜索)End-to-End Training of Deep Visuomotor Policies (Guided Policy Search)伯克利 2015 年的代表作:用卷积网络直接从相机图像输出机械臂关节力矩。
- Google 机械臂农场(大规模抓取自监督)Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection (Google Arm Farm)谷歌 2016 年让十几台机械臂反复试抓 80 多万次、从数据中自学抓取。
- Dex-Net(GQ-CNN 抓取网络)Dex-Net 2.0 / Grasp Quality CNN (Berkeley AUTOLAB)伯克利用仿真合成数据训练的抓取打分网络,从深度图判断哪种抓法最稳。
- QT-OptQT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation谷歌用 58 万多次真机抓取训练视觉 Q 函数的大规模强化学习抓取系统
- MT-OptMT-Opt: Continuous Multi-Task Robotic Reinforcement Learning at Scale谷歌用 7 台真机采 9600 小时数据、同时学 12 个任务的多任务强化学习系统
- 决策 TransformerDecision Transformer: Reinforcement Learning via Sequence Modeling把强化学习当序列建模:给定想要的回报,用 GPT 式模型逐步预测动作。
- GatoGato: A Generalist Agent (DeepMind)DeepMind 2022 年的通才智能体:同一套权重能打游戏、看图说话、聊天和控制机械臂。
- VIMAVIMA: General Robot Manipulation with Multimodal Prompts用图文混排的「多模态提示」统一描述各种操作任务的 Transformer 机器人智能体
- RT-1RT-1: Robotics Transformer for Real-World Control at Scale谷歌 2022 年发布、用 13 万条真机轨迹训练的机器人 Transformer 策略。
- RT-2RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control谷歌 DeepMind 2023 年提出,把动作当文字 token 输出,首次提出 VLA 这一名称。
- RT-XRT-X (RT-1-X / RT-2-X, trained on Open X-Embodiment)在 Open X-Embodiment 跨本体数据集上重新训练的 RT-1 和 RT-2。
- RT-TrajectoryRT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches用画在图像上的轨迹草图代替语言指令,告诉机器人动作该怎么走的策略
- AutoRTAutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic AgentsDeepMind 2024 年的系统:用大模型给一群机器人自动出任务、采真机数据。
- RT-HRT-H: Action Hierarchies Using Language谷歌让机器人先说出「手臂前移」这类语言动作、再输出动作的分层 VLA 策略
- RoboCatRoboCat: A Self-Improving Generalist Agent for Robotic ManipulationDeepMind 基于 Gato 的跨本体操作智能体,能自己生成数据迭代变强
- RoboFlamingoRoboFlamingo (Vision-Language Foundation Models as Effective Robot Imitators)把开源 OpenFlamingo 视觉语言模型微调成机器人操作策略的早期工作
12.4模仿学习经典策略
同期小模型模仿学习也在进化:从 PerAct 到扩散策略、ACT,学会精细双臂活
- Transporter NetworksTransporter Networks: Rearranging the Visual World for Robotic Manipulation把抓放操作看成「在图像上把一块区域挪到另一处」的高样本效率操作网络
- CLIPortCLIPort: What and Where Pathways for Robotic Manipulation结合 CLIP 语义理解与 Transporter 空间精度的语言条件操作策略。
- 神经描述子场Neural Descriptor Fields (SE(3)-Equivariant Object Representations for Manipulation)MIT 2021 年提出的物体表示,看几次示范就能把操作迁移到同类新物体、新姿态。
- PerActPerceiver-Actor: A Multi-Task Transformer for Robotic Manipulation把场景体素化,用 Perceiver Transformer 预测下一个关键位姿的多任务操作策略
- 运动策略网络Motion Policy Networks从单个深度相机的点云直接生成无碰撞机械臂运动的神经运动规划器
- BeT / VQ-BeTBehavior Transformers (BeT) / VQ-BeT (Behavior Generation with Latent Actions)用 Transformer 从多峰演示数据里同时学会多种行为的模仿学习方法。
- Diffuser(扩散规划器)Diffuser (Planning with Diffusion for Flexible Behavior Synthesis)把整条轨迹当作去噪对象生成的规划方法,最早把扩散模型用于决策的工作之一。
- Decision Diffuser(决策扩散器)Decision Diffuser (Is Conditional Generative Modeling all you need for Decision-Making?)用以回报为条件的扩散模型生成未来状态轨迹,再反推动作,绕开动态规划。
- 扩散策略Diffusion Policy: Visuomotor Policy Learning via Action Diffusion用扩散模型从噪声中逐步「去噪」生成机器人动作序列的模仿学习策略。
- ACTAction Chunking with Transformers斯坦福 2023 年提出的模仿学习策略,一次预测一段动作,让低成本双臂做精细活。
- RoboAgent(MT-ACT)RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action ChunkingCMU 与 Meta 用 7500 条演示训出的多技能厨房操作智能体
- Dobb·EDobb-E: An Open-Source, General Framework for Learning Household Robotic Manipulation纽约大学与 Meta 2023 年开源的家务机器人框架,5 分钟示范教会新任务。
- Mobile ALOHAMobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation斯坦福 2024 年把 ALOHA 双臂装上移动底盘,做低成本全身遥操作和模仿学习。
- ALOHA UnleashedALOHA Unleashed: A Simple Recipe for Robot DexterityDeepMind 2024 年的工作:大量遥操作数据加扩散策略,让双臂学会系鞋带。
- 3D Diffuser Actor3D Diffuser Actor: Policy Diffusion with 3D Scene Representations把扩散策略和 3D 场景表征结合、生成机械臂末端轨迹的模仿学习策略。
- 3D 扩散策略3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations把稀疏点云作为输入的扩散策略,少量演示就能学会操作,发表于 RSS 2024。
- iDP3Improved 3D Diffusion Policy (Generalizable Humanoid Manipulation with 3D Diffusion Policies)改进版 3D 扩散策略,让人形机器人在单一场景采数据后泛化到新场景
- Consistency Policy(一致性策略)Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation把扩散策略蒸馏成一步就能出动作的快速视觉运动策略。
- RVT-2RVT-2: Learning Precise Manipulation from Few Demonstrations (Robotic View Transformer 2)英伟达的多视角 3D 操作策略,每个任务约 10 条演示就能学会毫米级插装
- Robot Utility ModelsRobot Utility Models: General Policies for Zero-Shot Deployment in New Environments不用微调就能在陌生家里执行开柜门、开抽屉等单项任务的策略
- 3D-ViTac3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing把低成本触觉传感器读数和视觉点云放进同一 3D 空间来学精细操作的系统。
12.5开源通用策略与 VLA
RT 与模仿学习汇成开源 VLA:Octo、OpenVLA 之后,改进百花齐放
- OctoOcto: An Open-Source Generalist Robot Policy2024 年开源的通用机器人策略,在 80 万条跨本体轨迹上预训练,可快速微调到新机器人。
- OpenVLAOpenVLA: An Open-Source Vision-Language-Action Model斯坦福、伯克利等 2024 年开源的 70 亿参数视觉-语言-动作模型。
- OpenVLA-OFTOpenVLA-OFT (Optimized Fine-Tuning recipe for VLAs)斯坦福提出的 VLA 微调配方,让 OpenVLA 动作生成快 26 倍、成功率更高。
- CrossFormerCrossFormer: Scaling Cross-Embodied Learning (One Policy for Manipulation, Navigation, Locomotion and Aviation)一套权重同时控制单臂、双臂、四足、无人车和无人机的跨本体 Transformer 策略。
- 异构预训练 TransformerHeterogeneous Pre-trained TransformersMIT 何恺明团队 2024 年提出,用共享主干网络统一预训练各种机器人数据。
- RDT-1BRDT-1B: a Diffusion Foundation Model for Bimanual Manipulation (Robotics Diffusion Transformer)清华 2024 年发布的约 12 亿参数双臂操作扩散基础模型。
- RDT2RDT2 (Robotics Diffusion Transformer 2): Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization清华用上万小时 UMI 数据训练、可零样本换机械臂部署的 VLA 基础模型
- RoboMambaRoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation用 Mamba 状态空间模型替代 Transformer 做语言骨干的高效 VLA
- TinyVLATinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation用小型多模态模型加扩散策略头、不做机器人数据预训练的快速 VLA
- CogACTCogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation在 VLM 后面接扩散 Transformer 动作模块的开源 VLA 模型。
- TraceVLATraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies把画面中关键点的历史运动轨迹画在图上当提示,增强 VLA 时空理解的方法
- RoboVLMsRoboVLMs (What Matters in Building Vision-Language-Action Models for Generalist Robots)系统比较 VLA 骨干、结构和训练数据该怎么选的实验研究与开源框架
- UniAct(通用动作空间)UniAct: Universal Actions for Enhanced Embodied Foundation Models用一套跨机器人共享的离散「通用动作」来训练具身基础模型的方法
- HAMSTER(分层动作模型)HAMSTER: Hierarchical Action Models for Open-World Robot Manipulation英伟达等 2025 年的分层 VLA:高层画 2D 路径,底层 3D 策略照着做。
- DexVLADexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control美的等提出的 VLA:视觉语言模型接上约十亿参数的扩散动作专家,适配多种本体。
- MagmaMagma: A Foundation Model for Multimodal AI Agents (Microsoft)微软推出的多模态智能体基础模型,既能操作软件界面也能控制机械臂。
- ChatVLAChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model既能看图问答、又能控制机器人的统一 VLA 模型。
- DexGraspVLADexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping北大与灵初智能的分层灵巧手抓取框架:大模型负责规划,扩散策略负责出动作。
- HybridVLAHybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model在同一个大语言模型里同时做扩散和自回归两种动作预测的 VLA
- DitaDita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy用同一个 Transformer 直接对整段动作去噪的开源通用 VLA 策略,约 3.3 亿参数。
- CoT-VLACoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models先生成一张未来子目标图像当「思考」,再输出动作的 7B 视觉-语言-动作模型。
- SmolVLASmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (Hugging Face)Hugging Face 推出的约 4.5 亿参数开源小 VLA,消费级设备就能训练和运行。
- BEASTBEAST: B-spline Encoded Action Sequence Tokenizer用 B 样条控制点把一段动作压成固定个数 token 的动作分词器。
- BridgeVLABridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models把 3D 点云投影成 2D 图、用热力图输出动作的 3D 操作 VLA。
- DreamVLADreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge先预测未来的动态区域、深度和语义特征,再据此生成动作的 VLA 模型。
- ThinkActThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning先让多模态大模型想出视觉规划,再交给动作模型执行的推理型 VLA
- MolmoActMolmoAct: Action Reasoning Models that can Reason in Space (Ai2)Ai2 开源的「动作推理模型」,先推深度、画轨迹,再输出动作的 VLA
- MemoryVLAMemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation给 VLA 加上工作记忆和记忆库,让机器人记得之前看到和做过什么。
- Discrete Diffusion VLA(离散扩散 VLA)Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies用离散扩散解码 VLA 动作:动作 token 并行生成,先定有把握的再逐步补全。
- VLA-AdapterVLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model用 0.5B 小模型加轻量策略模块、不做机器人预训练也能打到顶尖水平的 VLA。
- X-VLAX-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model给每个数据源配专属「软提示」来统一多种机器人的 0.9B 跨本体 VLA
- VLA-0VLA-0: Building State-of-the-Art VLAs with Zero Modification英伟达提出的极简 VLA:不改模型结构,让 VLM 直接把动作写成数字文本。
12.6π 系列与强化学习
PI 的 π 系列是 VLA 标杆;再看强化学习怎样让策略从经验里变强
- π0π0 (pi-zero): A Vision-Language-Action Flow Model for General Robot ControlPhysical Intelligence 2024 年发布的 VLA,用流匹配生成连续动作,已开源。
- π0-FASTπ0-FAST (π0 with FAST frequency-space action tokenization)把 π0 的动作用 FAST 分词器变成离散 token、逐个生成的自回归 VLA。
- π0.5π0.5: a Vision-Language-Action Model with Open-World GeneralizationPI 2025 年发布的 VLA,能在没见过的真实家庭里完成收拾厨房等长程任务。
- π*0.6π*0.6: a VLA That Learns From Experience (π0.6 trained with RECAP)π0.6 经 RECAP 强化学习训练后的版本,能从示教、纠正和自身经验中变强。
- π0.7π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilitiesπ 公司 2026 年的通用机器人模型,能用多种提示引导做法,初现组合泛化。
- Hi RobotHi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action ModelsPI 2025 年的分层系统:高层 VLM 拆解复杂指令,低层 π0 执行。
- RECAPRL with Experience and Corrections via Advantage-conditioned PoliciesPI 公司让 VLA 从自己的运行经验和人工纠正中持续变强的训练方法。
- Q-TransformerQ-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions用 Transformer 逐个动作维度估计 Q 值的大规模离线强化学习方法
- SERLSERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning伯克利等开源的真机强化学习工具套件,几十分钟就能在真实机械臂上练出策略
- HIL-SERLHuman-in-the-Loop Sample-Efficient Robotic Reinforcement Learning (Precise and Dexterous Robotic Manipulation via Human-in-the-Loop RL)伯克利的真机强化学习系统,人随时接管纠正,1 到 2.5 小时练成精细操作。
- DPPO(扩散策略策略优化)Diffusion Policy Policy Optimization用 PPO 策略梯度直接强化学习微调扩散策略,把每一步去噪也当成决策步骤。
- V-GPSValue-Guided Policy Steering (Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance)部署时用离线强化学习学到的价值函数给通用策略的候选动作重新排序
- GVL(生成式价值学习)Generative Value Learning (Vision Language Models are In-Context Value Learners)让视觉语言模型给打乱顺序的视频帧估计任务进度,当通用价值函数用
- GRAPEGRAPE: Generalizing Robot Policy via Preference Alignment用成功和失败轨迹做偏好对齐,提升 VLA 在新任务上泛化的方法。
- ConRFTConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy先离线、再真机在线,用一致性策略给 VLA 做强化学习微调的方法。
- RIPT-VLA(交互式后训练)RIPT-VLA: Interactive Post-Training for Vision-Language-Action Models只用成功/失败二值奖励,对预训练 VLA 做强化学习后训练的方法
- VLA-RLVLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning用在线强化学习继续提升自回归 VLA(如 OpenVLA)的早期框架。
- ReinFlowReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning给流匹配策略注入可学习噪声,再用在线强化学习微调的方法
- DSRL(扩散策略噪声空间强化学习)Diffusion Steering via Reinforcement Learning (Steering Your Diffusion Policy with Latent Space RL)不改扩散策略的权重,只用强化学习挑选输入噪声,引导它产生更好的动作。
- RoboMonkeyRoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models部署时多采样几组动作、再用 VLM 验证器挑最优,提升 VLA 鲁棒性
- RaCRaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction让人类在失败前接管、先恢复再纠正,以此扩展长程任务数据的方法
- SimpleVLA-RLSimpleVLA-RL: Scaling VLA Training via Reinforcement Learning只用「成功/失败」奖励,对 VLA 做大规模在线强化学习的开源框架
- VLA-RFTVLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators在学出来的世界模型里跑强化学习,只用几百步就把 VLA 调得更稳。
- RL-100RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning基于扩散策略的真机强化学习框架,8 个任务 1000 次试验全部成功
- πRLπRL: Online RL Fine-tuning for Flow-based Vision-Language-Action Models给 π0、π0.5 这类流匹配 VLA 做在线强化学习微调的开源框架
- WMPO(基于世界模型的策略优化)WMPO: World Model-based Policy Optimization for Vision-Language-Action Models让 VLA 在视频世界模型「想象」的轨迹里做强化学习,不用碰真机
- VLA-OPDVLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation让强教师在学生自己跑出的轨迹上逐 token 纠错的 VLA 后训练方法。
- RobometerRobometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons用任务进度加轨迹两两比较训练的通用机器人奖励模型
12.7海外巨头与明星公司
技术路线讲完看公司:英伟达、Figure、谷歌等海外公司各自的基座模型
- GR00T N1 系列NVIDIA Isaac GR00T N1 / N1.5 / N1.6 / N1.7英伟达开放的人形机器人基础模型系列,快慢双系统架构,2025 年起持续迭代。
- GR00T N2NVIDIA Isaac GR00T N2英伟达 2026 年预告的下一代机器人基础模型,从 VLA 改为世界动作模型架构。
- CosmosNVIDIA Cosmos World Foundation Models英伟达的开放世界基础模型平台,用视频生成模型给机器人和自动驾驶造数据、做预演。
- Cosmos PredictNVIDIA Cosmos Predict英伟达 Cosmos 家族的视频世界模型,根据文字、图像或视频生成接下来的画面。
- Cosmos TransferNVIDIA Cosmos Transfer英伟达的可控视频生成模型,按深度、分割、边缘等结构图生成逼真视频。
- Cosmos ReasonNVIDIA Cosmos Reason英伟达面向物理 AI 的推理视觉语言模型,看视频后先推理再回答。
- Cosmos PolicyCosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning把视频生成模型直接微调成机器人策略,同时预测动作、未来画面和成功把握。
- Cosmos 3Cosmos 3: Omnimodal World Models for Physical AI英伟达第三代全模态世界模型:一个模型既能理解、生成视频,也能输出动作。
- DreamGen(GR00T Dreams)DreamGen: Unlocking Generalization in Robot Learning through Video World Models英伟达 2025 年提出,用视频世界模型生成机器人视频并反推动作来造训练数据。
- DreamDojoDreamDojo: A Generalist Robot World Model from Large-Scale Human Videos英伟达 2026 年发布的通用机器人世界模型,用约 4.4 万小时人类视频预训练。
- DreamZeroDreamZero (World Action Models are Zero-shot Policies)英伟达 2026 年的世界动作模型,基于 14B 视频扩散模型同时预测画面和动作。
- EgoScaleEgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data英伟达 2026 年的工作:用 2 万小时第一人称人类视频预训练灵巧手 VLA。
- HelixFigure Helix (Vision-Language-Action model)Figure AI 2025 年发布的人形机器人 VLA,用快慢双系统控制整个上半身。
- Helix 02Figure Helix 02 (Full-Body Autonomy)Figure 2026 年发布的人形全身控制模型,从像素直接控制全身完成长程任务
- Helix 2.5Figure Helix 2.5Figure AI 2026 年 9 月发布的人形机器人模型,能在 30 个陌生家庭里零样本做家务。
- 1X 世界模型1X World Model人形机器人公司 1X 的视频世界模型,先用来评测策略,后来直接当策略控制 NEO。
- 1X RedwoodRedwood AI (1X)1X 为家用人形机器人 NEO 打造、在机载 GPU 上运行的 VLA 模型
- Gemini RoboticsGemini Robotics (Google DeepMind VLA, 2025)谷歌 DeepMind 2025 年基于 Gemini 2.0 推出的 VLA,能直接控制机器人做灵巧操作。
- Gemini Robotics-ERGemini Robotics-ER (Embodied Reasoning)谷歌 DeepMind 的具身推理模型,负责看懂空间、做规划、判进度
- 谷歌 DeepMind 的轻量版 Gemini Robotics VLA,可直接在机器人本机运行、不依赖联网。
- Gemini Robotics 1.5Gemini Robotics 1.5 (thinking VLA with Motion Transfer)谷歌 DeepMind 的 VLA,出动作前先思考,技能可跨机器人迁移
- Gemini Robotics 2Gemini Robotics 2 (incl. full-body humanoid control)谷歌 DeepMind 2026 年的新一代机器人模型,能控制人形全身
- Veo 世界模拟器Veo World Simulator (Gemini Robotics policy evaluation)谷歌 DeepMind 用 Veo 视频模型「脑补」机器人执行过程来评测策略的系统
- 微软 Rho-alphaRho-alpha (ρα, Microsoft Research robotics model derived from Phi)微软研究院基于 Phi 视觉语言模型打造、加入触觉感知的首个机器人模型
- Covariant RFM-1RFM-1 (Robotics Foundation Model 1, Covariant)Covariant 用仓库拣选数据训练的约 80 亿参数机器人基础模型
- DYNA-1DYNA-1 (Dynamism v1, Dyna Robotics)Dyna Robotics 2025 年发布的第一代机器人基础模型,主打长时间自主叠餐巾。
- Dyna DYNA-2DYNA-2 (Dyna Robotics world-action model pre-trained on 1M hours of egocentric human video)Dyna Robotics 2026 年的世界动作模型,用百万小时人类第一人称视频预训练。
- Skild BrainSkild Brain (Skild AI omni-bodied robot brain)Skild AI 的通用机器人大脑,同一个模型能控制四足、人形、机械臂等不同本体
- Skild S1Skild AI S1 (in-context learning robotic foundation model)Skild AI 的机器人基础模型,看一段示范视频就能直接做没训练过的任务
- Field AI FFM(场景基础模型)Field Foundation Models (FieldAI)美国 Field AI 公司的机器人基础模型,主打在无地图的工地、厂区里自主作业。
- GEN-0GEN-0: Embodied Foundation Models That Scale with Physical Interaction (Generalist AI)Generalist AI 用 27 万小时真实数据训练的具身基础模型
- GEN-1GEN-1: Scaling Embodied Foundation Models to Mastery (Generalist AI)Generalist AI 的第二代具身基础模型,主打把简单任务做到「熟练」
- Sunday ACT-1ACT-1: A Robot Foundation Model Trained on Zero Robot Data (Sunday Robotics)Sunday Robotics 2025 年的家务机器人模型,训练不用一条遥操作数据。
- Genesis AI GENE-26.5GENE-26.5 (Genesis AI robotics foundation model)Genesis AI 2026 年 5 月发布的首个机器人基础模型系统,主打灵巧操作
- Perceptron Isaac 0.5Isaac 0.5 (Perceptron AI open-weight embodied foundation model)Perceptron 2026 年开放权重的 360 亿参数机器人基础模型,看、想、动一体。
12.8国内具身模型
再看国内:大厂、研究院和创业公司的基座,多在 VLA 与世界动作模型两条路上
- 字节 GR-1GR-1: Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation (ByteDance)字节跳动 2023 年底的操作模型,先在视频上学预测未来画面,再学出动作。
- 字节 GR-2GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation (ByteDance)字节跳动 2024 年的第二代操作模型,先在 3800 万段网络视频上预训练。
- 字节 GR-3Seed GR-3 (ByteDance Seed Generalist Robot Model 3)字节跳动 Seed 2025 年发布的约 40 亿参数通用机器人 VLA 模型。
- 字节 GR-DexterGR-Dexter (ByteDance Seed VLA for bimanual high-DoF dexterous-hand robots)字节 Seed 2025 年底发布的双臂灵巧手 VLA,把手、遥操作和模型一起做。
- 字节 GR-RLGR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation (ByteDance Seed)字节 Seed 用强化学习把通用 VLA 练成专家,首个能自主穿鞋带的学习型策略。
- 字节 RobixRobix: A Unified Model for Robot Interaction, Reasoning and Planning (ByteDance Seed)字节 Seed 的机器人高层「大脑」模型,统一对话、推理和任务规划
- 星动纪元 ERA-42ERA-42 (Robot Era end-to-end native robot model)星动纪元 2024 年底发布的端到端 VLA 具身模型,驱动其灵巧手和人形机器人。
- 智元 GO-1(启元大模型)Genie Operator-1 (AgiBot GO-1)智元机器人 2025 年发布的通用具身基座模型,用「潜在动作」让人类视频也能参与训练。
- 智元 GO-2(Genie Operator-2)AgiBot Genie Operator-2 (GO-2)智元 2026 年发布的第二代具身基座模型,先在动作空间里规划再执行
- EnerVerseEnerVerse: Envisioning Embodied Future Space for Robotics Manipulation智元等提出的生成式机器人模型:先用视频扩散预测未来多视角画面,再出动作。
- 智元 Genie Envisioner 世界模型Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation (AgiBot)智元机器人把视频世界模型、策略、神经仿真器和评测合为一体的平台
- 智源 RoboBrain(具身大脑)RoboBrain (BAAI embodied brain model)北京智源研究院开源的具身「大脑」模型系列,负责任务规划和空间理解
- 智平方 GOVLA(AlphaBrain)GOVLA (Global & Omni-body Vision-Language-Action) / Alpha Brain (AI² Robotics)智平方的全域全身 VLA 大模型,能同时输出全身动作和移动轨迹
- 银河通用 GraspVLAGraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data (Galbot)银河通用等 2025 年发布的抓取大模型,主要靠十亿帧仿真合成数据预训练。
- 银河星脑 AstraBrainAstraBrain (Galbot embodied model family)银河通用的具身大模型体系,把「大脑」规划、「小脑」全身控制连成一套。
- WorldVLAWorldVLA: Towards Autoregressive Action World Model阿里达摩院把 VLA 和世界模型合进一个自回归模型,既出动作又预测下一帧
- 达摩院 RynnVLA-002RynnVLA-002: A Unified Vision-Language-Action and World Model (Alibaba DAMO)阿里达摩院把动作模型和世界模型合进同一个自回归网络的开源 VLA
- 达摩院 RynnBrainRynnBrain: Open Embodied Foundation Models (Alibaba DAMO)阿里达摩院开源的具身「大脑」模型,负责看懂第一视角画面、定位物体和做任务规划
- 智在无界 Being-H0Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos (BeingBeyond)智在无界用大规模人手操作视频预训练的灵巧操作 VLA 模型系列。
- 星海图 G0Galaxea G0 Dual-System VLA星海图 2025 年开源的快慢双系统机器人模型:VLM 拆解任务,VLA 执行动作。
- EO-1(EmbodiedOneVision)EO-1: An Open Unified Embodied Foundation Model for General Robot Control上海 AI Lab 开源的 3B 统一具身模型,同一网络既做推理问答又输出动作。
- 上海AI实验室 InternVLA 系列InternVLA (Shanghai AI Laboratory: InternVLA-M1 / A1 / A1.5 / N1)上海 AI 实验室开源的一组具身模型:M1、A1 做操作,N1 做导航。
- 自变量 WALL-AWALL-A (X Square Robot)自变量机器人自研的闭源具身操作大模型系列,端到端从感知直到动作控制。
- 自变量 WALL-OSSWALL-OSS (X Square Robot open-source embodied foundation model)自变量机器人开源的具身基础模型,把视觉语言模型改造成能直接出动作的 VLA
- 宇树 UnifoLM 系列UnifoLM (Unitree: UnifoLM-WMA-0 / UnifoLM-VLA-0 / UnifoLM-WLA-1.0)宇树科技开源的机器人大模型系列,涵盖世界模型、VLA 和人形通用模型
- WoW 具身世界模型WoW: Towards a World omniscient World model Through Embodied Interaction用 200 万条真机交互轨迹训练的 140 亿参数具身视频世界模型
- 北京人形 Pelican-VLPelican-VL: A Foundation Brain Model for Embodied Intelligence (X-Humanoid)北京人形机器人创新中心开源的具身「大脑」视觉语言模型
- 北京人形 XR-1XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations北京人形用「视觉-运动统一编码」做跨本体预训练的 VLA 基础模型
- 极佳 GigaBrain-0GigaBrain-0: A World Model-Powered Vision-Language-Action Model (GigaAI)极佳科技用世界模型生成数据来训练的 VLA 模型系列
- 极佳 GigaWorld-0GigaWorld-0: World Models as Data Engine to Empower Embodied AI (GigaAI)极佳科技把世界模型当「数据引擎」、批量生成机器人训练数据的框架
- 小米 MiMo-EmbodiedMiMo-Embodied: X-Embodied Foundation Model (Xiaomi)小米开源的 7B 视觉语言模型,同时覆盖自动驾驶和具身智能的理解与规划
- 小米 Xiaomi-Robotics-0Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution小米开源的 47 亿参数 VLA,主打在消费级显卡上实时、流畅地执行动作
- 大晓机器人 开悟世界模型Kairos: A Native World Model Stack for Physical AI (Daxiao Robotics / ACE Robotics)大晓机器人开源的 40 亿参数具身世界模型,同时做理解、视频生成和动作预测。
- 优必选 ThinkerUBTech Thinker (Thinker / Thinker-WM / Thinker-VLA embodied model stack)优必选自研的具身模型体系,含基础模型、世界模型和动作模型三层
- 千寻 Spirit v1.5Spirit v1.5 (Spirit AI)千寻智能开源的 VLA 基础模型,主张用多样、不刻意整理的数据做预训练
- 蚂蚁灵波 LingBot-VLALingBot-VLA (A Pragmatic VLA Foundation Model, Robbyant / Ant Group)蚂蚁灵波开源的 VLA 基础模型,用约 2 万小时双臂真机数据预训练。
- 蚂蚁灵波 LingBot-VALingBot-VA (Causal World Modeling for Robot Control, Robbyant)蚂蚁灵波开源的视频-动作世界模型,边预测未来画面边输出机器人动作。
- 蚂蚁灵波 LingBot-WorldLingBot-World (Advancing Open-source World Models, Robbyant)蚂蚁灵波开源的可交互世界模型,按键盘和镜头指令实时生成后续画面。
- 原力灵机 DM0DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI (Dexmal)原力灵机 2026 年开源的「具身原生」VLA,预训练阶段就混入驾驶和机器人数据。
- 地平线 HoloBrain-0HoloBrain-0 (Horizon Robotics open-source VLA foundation model)地平线 2026 年初开源的 VLA 框架,把相机参数和机器人结构作为先验输入模型。
- 它石智航 AWEAWE (AI World Engine, TARS Robotics; AWE 3.0 / 3.5)它石智航的通用具身基座模型,主打用大规模人类操作数据训练。
- 灵初 Psi-R2Psi-R2 (PsiBot)灵初智能用十万小时量级人类操作数据预训练的世界动作模型
- 腾讯 HY-Embodied(混元具身)Hy-Embodied series (Tencent Robotics X & Hunyuan: Hy-Embodied-0.5 VLM / VLA / -X)腾讯 Robotics X 与混元团队开源的具身基础模型系列,含具身 VLM 和 VLA
- 千问 Qwen-Robot 系列Qwen-Robot series (Qwen-RobotManip / Qwen-RobotNav / Qwen-RobotWorld, Alibaba)阿里通义千问团队 2026 年发布的操作、导航、世界模型三件套具身模型。
- 面壁 MiniCPM-Robot 系列MiniCPM-Robot series (OpenBMB: MiniCPM-RobotManip / MiniCPM-RobotTrack)MiniCPM 的具身模型家族,主打小参数、能在端侧跑的操作模型和目标跟随模型
12.9世界模型与视频学习
回到世界模型这条线:先在想象里练策略,再生成世界、从视频里学动作
- World Models 论文(Ha & Schmidhuber)World Models (Ha & Schmidhuber, 2018)2018 年让智能体在自己学出的「梦境」里练策略的经典世界模型论文
- PlaNetPlaNet: Learning Latent Dynamics for Planning from Pixels从像素学隐空间世界模型、在想象中规划动作的基于模型强化学习智能体
- MuZeroMuZero (Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model)DeepMind 不给规则、靠学到的内部模型做树搜索就精通围棋和 Atari 的算法
- DayDreamerDayDreamer: World Models for Physical Robot Learning直接在真实机器人上用 Dreamer 世界模型学习,四足一小时从零学会走路。
- DreamerV3DreamerV3: Mastering Diverse Domains through World Models在学到的世界模型里靠想象训练策略、一套超参数通用的强化学习算法
- Dreamer 4Dreamer 4: Training Agents Inside of Scalable World Models谷歌 DeepMind 2025 年的世界模型智能体,只用离线数据在 Minecraft 里挖到钻石。
- TD-MPC2TD-MPC2: Scalable, Robust World Models for Continuous Control在学到的隐空间世界模型里做规划的强化学习算法,一套超参数通吃上百个控制任务
- DINO-WMDINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning在 DINOv2 图像特征空间里预测未来的世界模型,训练后能零样本规划到新目标。
- V-JEPA 2V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and PlanningMeta 的自监督视频模型,在特征空间里预测视频,可当世界模型规划机器人动作。
- Stable Video DiffusionStable Video Diffusion (SVD)Stability AI 开源的图生视频扩散模型,常被机器人研究用作视频预测底座
- Sora(视频生成即世界模拟器)Sora / Sora 2 (OpenAI; Video generation models as world simulators)OpenAI 的文生视频模型,技术报告提出视频生成模型可以当作世界模拟器。
- Genie(初代)Genie: Generative Interactive Environments谷歌 DeepMind 从无标注视频里学出「可玩世界」的生成式交互环境模型
- Genie 2Genie 2 (Google DeepMind)谷歌 DeepMind 的大规模世界模型,从一张图生成可操控的 3D 世界
- Genie 3Genie 3 (Google DeepMind real-time interactive world model)谷歌 DeepMind 2025 年发布的实时可交互世界模型,一句话生成能边走边看的虚拟世界。
- SIMA 2SIMA 2: A Generalist Embodied Agent for Virtual Worlds (Google DeepMind)谷歌 DeepMind 基于 Gemini、能在各种 3D 游戏世界里听指令、推理并自学的智能体
- DIAMOND(扩散世界模型)DIAMOND: Diffusion for World Modeling (Visual Details Matter in Atari)用扩散模型逐帧生成画面当世界模型,让强化学习智能体在生成的环境里练游戏。
- GameNGen(神经游戏引擎)GameNGen: Diffusion Models Are Real-Time Game Engines谷歌 2024 年的工作:用扩散模型实时生成可玩的《毁灭战士》画面,替代游戏引擎。
- 昆仑万维 Matrix-GameMatrix-Game 2.0 (Skywork open-source real-time interactive world model)昆仑万维 Skywork 开源的实时可交互世界模型,按键鼠操作逐帧生成游戏画面。
- 腾讯混元世界模型HunyuanWorld (HunyuanWorld 1.0 / HunyuanWorld-Voyager, Tencent)腾讯混元开源的 3D 世界生成系列,能从文字或图片生成可漫游的 3D 场景
- Marble(World Labs)Marble (World Labs 3D world generation model)World Labs 推出的世界生成产品,用文字或图片生成可导出的 3D 场景。
- MANO 手部模型MANO (hand Model with Articulated and Non-rigid defOrmations)最常用的参数化 3D 人手模型,用少量形状和姿态参数描述一只手。
- VPT(视频预训练)Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online VideosOpenAI 先训逆动力学模型给网络视频打动作标签、再模仿学习玩 Minecraft
- MimicPlayMimicPlay: Long-Horizon Imitation Learning by Watching Human Play先看人手随意玩耍的视频学高层计划,再用少量遥操作数据学底层动作的模仿学习方法
- VRB(从人类视频学可供性)VRB: Affordances from Human Videos as a Versatile Representation for Robotics从人类视频学「该抓哪、抓后往哪动」,把这种可供性直接交给机器人用。
- ATM(任意点轨迹建模)Any-point Trajectory Modeling for Policy Learning先从视频学「画面里任意点接下来怎么动」,再用预测的轨迹引导机器人策略。
- LAPALAPA: Latent Action Pretraining from Videos用没有动作标签的视频预训练 VLA:先学潜在动作,再用少量真机数据映射成真实动作。
- Phantom(无机器人训练)Phantom: Training Robots Without Robots Using Only Human Videos只用人类操作视频、把人手换成渲染机械臂来训练机器人策略的方法
- UniVLAUniVLA: Learning to Act Anywhere with Task-centric Latent Actions从视频里学「与任务相关的潜在动作」来训练跨本体 VLA 的框架
- EgoVLAEgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos用第一人称人类视频预训练的 VLA,把人手动作换算成人形机器人动作。
- UniPiUniPi: Learning Universal Policies via Text-Guided Video Generation先按文字生成一段完成任务的视频,再从视频里反推出机器人动作的方法
- UniSimUniSim: Learning Interactive Real-World Simulators用视频生成模型学出来、能响应动作的「真实世界模拟器」
- AVDC(从无动作视频学动作)AVDC: Learning to Act from Actionless Videos through Dense Correspondences先生成「机器人做任务」的视频,再用光流反推该执行的动作,全程不需要动作标签。
- SuSIESuSIE: Subgoal Synthesis via Image Editing把图像编辑扩散模型当高层规划器,先画出子目标画面,再让底层策略去达成
- Gen2ActGen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation先生成一段「人怎么做」的视频,再让机器人照着视频执行的操作方法
- 视频预测策略Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations用视频扩散模型内部的「对未来的预测特征」来指导动作生成的机器人策略
- Seer(预测式逆动力学模型)Seer: Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation先预测接下来的画面、再用逆动力学推出动作的端到端机器人操作策略
- UVAUnified Video Action Model视频和动作共用一个潜在表示、推理时可跳过视频生成的机器人模型
- UWM(统一世界模型)Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets把动作扩散和视频扩散合进一个模型、能用无动作视频预训练的机器人框架
- 生数 VidarVidar: VIdeo Diffusion for Action Reasoning (Tsinghua & ShengShu)先用视频扩散模型预测未来画面、再反推动作的机器人操作模型
- Ctrl-WorldCtrl-World: A Controllable Generative World Model for Robot Manipulation按动作生成多视角未来画面的操作世界模型,用来在「想象」里评测和改进策略。
- MotusMotus: A Unified Latent Action World Model把理解、视频生成和动作三个专家合成一个模型的潜在动作世界模型
- Fast-WAMFast-WAM: Do World Action Models Need Test-time Future Imagination?清华与星海图 2026 年的世界动作模型:训练时学预测视频,推理时跳过想象,更快。
- FLUX 3 Action(Black Forest Labs)FLUX 3 Action (Black Forest Labs open-weight world action model)德国 Black Forest Labs 2026 年 9 月开放权重的 7B 世界动作模型,同时预测画面与动作。
12.10足式、灵巧手与敏捷技能
从操作转向运动:四足越野跑酷、灵巧手转物体,都在仿真里强化学习练成再上真机
- ANYmal 强化学习运控系列(执行器网络 / 教师-学生盲走 / 感知行走)ANYmal RL Locomotion Series (Hwangbo 2019; Lee 2020; Miki 2022, Science Robotics)ETH 用 ANYmal 四足在 2019–2022 年发的三篇论文,把仿真 RL 运控带进野外。
- 快速运动适应Rapid Motor Adaptation让四足机器人零点几秒内察觉地形和负载变化、自动调整步态的方法。
- Walk These WaysWalk These Ways: Tuning Robot Control for Generalization with Multiplicity of Behavior一个策略学会多种步态,部署时可实时调参应对新地形的四足运控。
- DreamWaQDreamWaQ: Learning Robust Quadrupedal Locomotion With Implicit Terrain Imagination via Deep Reinforcement LearningKAIST 2023 年提出的四足盲走强化学习方法,只凭本体感知「想象」脚下地形。
- BarkourBarkour: Benchmarking Animal-level Agility with Quadruped Robots谷歌仿照狗狗敏捷赛设计的四足机器人障碍赛评测基准。
- 让低成本四足机器狗只靠深度相机自主爬、跳、钻、挤的跑酷策略
- Extreme ParkourExtreme Parkour with Legged RobotsCMU 2023 年的工作:低成本四足只凭一台深度相机和单个网络完成跳高跳远等跑酷。
- HIM(混合内部模型)Hybrid Internal Model: Learning Agile Legged Locomotion with Simulated Robot Response只用本体感知,从机器人自身响应推断地形和扰动的足式运控方法
- ABS(敏捷且安全的足式运动)Agile But Safe: Learning Collision-Free High-Speed Legged LocomotionCMU 2024 年的四足框架:高速奔跑,靠学到的安全值随时切到避撞策略。
- DIAL-MPC(扩散式退火足式 MPC)Diffusion-Inspired Annealing for Legged MPC免训练的足式机器人采样式 MPC:借扩散模型逐步退火的思路,实时优化全身动作。
- Dactyl(OpenAI 魔方灵巧手)OpenAI Dactyl (Learning Dexterous In-Hand Manipulation / Solving Rubik's Cube with a Robot Hand)OpenAI 只在仿真里用强化学习训练、再迁到真实五指灵巧手的项目
- HORA(手内物体旋转 + RMA)HORA: In-Hand Object Rotation via Rapid Motor Adaptation只靠指尖和关节本体感知,让机器手在手里持续转动各种物体的强化学习方法
- Visual Dexterity(视觉手内重定向)Visual Dexterity: In-Hand Reorientation of Novel and Complex Object ShapesMIT 用一台深度相机让低成本灵巧手在空中实时翻转没见过的物体。
- DextrAH-GDextrAH-G: Pixels-to-Action Dexterous Arm-Hand Grasping with Geometric Fabrics英伟达的臂手灵巧抓取系统:全在仿真里训练,只看深度图就能连续抓取搬运。
- DexterityGenDexterityGen: Foundation Controller for Unprecedented DexterityMeta 与伯克利的灵巧手底层控制器:把人粗略的遥操作指令变成精细手指动作。
- DeepMind 乒乓球机器人Achieving Human Level Competitive Robot Table Tennis (Google DeepMind)DeepMind 2024 年的乒乓球机器人,首个在比赛中打到业余人类水平的学习型机器人。
12.11人形全身控制与遥操作
同一套方法搬到人形:从动画角色模仿、双足行走,到全身遥操作和动作跟踪
- DeepMimicDeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills用强化学习让仿真角色模仿动捕片段,学会空翻、武术等物理上可行的动作
- ASE(对抗技能嵌入)ASE: Large-Scale Reusable Adversarial Skill Embeddings for Physically Simulated Characters伯克利与 NVIDIA 2022 年的方法:从动捕片段学可复用的技能隐空间。
- MDM(人体动作扩散模型)MDM: Human Motion Diffusion Model用扩散模型从文字或动作类别生成 3D 人体动作序列的代表性工作。
- PHCPerpetual Humanoid Control在物理仿真里跟踪海量人体动作、摔倒后能自己爬起的人形控制器
- MaskedMimicMaskedMimic: Unified Physics-Based Character Control Through Masked Motion Inpainting英伟达提出的统一物理人形控制器,把各种控制方式都当作补全缺失动作。
- Meta Motivo(人形行为基础模型)Meta Motivo (FB-CPR; Zero-Shot Whole-Body Humanoid Control via Behavioral Foundation Models)Meta 的仿真人形行为基础模型,不用再训练就能做动作跟踪、到达姿态和按奖励行动
- 真实世界人形强化学习行走Real-World Humanoid Locomotion with Reinforcement Learning (Radosavovic et al., Science Robotics 2024)仿真中强化学习训练 Transformer 控制器,零样本让人形机器人户外行走
- OP3 足球(DeepMind 双足踢球)Learning Agile Soccer Skills for a Bipedal Robot with Deep Reinforcement Learning (OP3 Soccer)DeepMind 用深度强化学习教小型人形机器人 OP3 一对一踢足球。
- 人形行走即下一个 token 预测Humanoid Locomotion as Next Token Prediction把人形机器人行走当成语言模型式的「预测下一个 token」问题来学
- 人形跑酷学习Humanoid Parkour Learning让人形机器人靠头部深度相机自主跳台、跨沟、跨栏的端到端跑酷策略
- DWL(去噪世界模型学习)Denoising World Model Learning (Advancing Humanoid Locomotion: Mastering Challenging Terrains with DWL)只靠本体感知就让人形机器人走雪地、上下楼梯的端到端强化学习行走框架。
- HugWBCHugWBC: A Unified and General Humanoid Whole-Body Controller for Versatile Locomotion一个策略让人形机器人走、跑、跳、单脚蹦,并能调步频、抬脚高度的全身控制器
- HoST(人形起身)HoST: Learning Humanoid Standing-up Control across Diverse Postures用强化学习从零学会让人形机器人从各种姿势自己站起来的控制框架
- ExBodyExpressive Whole-Body Control for Humanoid RobotsUCSD 2024 年提出:人形机器人上身模仿人类动作,双腿只负责稳稳跟速度。
- ExBody2ExBody2: Advanced Expressive Humanoid Whole-Body ControlUCSD 等提出的人形全身动作跟踪方法,让宇树 G1 能走、蹲、跳舞。
- H2O(人到人形)H2O: Learning Human-to-Humanoid Real-Time Whole-Body TeleoperationCMU 2024 年的人形遥操作框架,用一个 RGB 相机让机器人实时模仿人的全身动作。
- OmniH2OOmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and LearningCMU 2024 年的人形全身遥操作系统,VR、相机、语音、GPT-4o 都能统一驱动机器人。
- HumanPlusHumanPlus: Humanoid Shadowing and Imitation from Humans斯坦福 2024 年的人形系统:靠一个 RGB 相机让机器人实时模仿人,再从中学会自主技能。
- OKAMIOKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation德州大学与英伟达 2024 年的方法,让人形机器人看一段人类视频学会操作。
- HOVERHOVER: Versatile Neural Whole-Body Controller for Humanoid Robots英伟达等提出的人形机器人通用神经全身控制器,一个策略兼容多种指令模式
- UH-1 / Humanoid-XUH-1: Learning from Massive Human Videos for Universal Humanoid Pose Control (Humanoid-X dataset)从海量互联网人类视频学习、按文字指令生成人形机器人动作的大模型
- ASAPASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills用真机数据学一个动作修正模型来缩小虚实差距,让人形机器人做高难动作
- HOMIEHOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit上海 AI 实验室 2025 年的人形遥操作系统,用外骨骼、手套和踏板控制全身。
- TWISTTWIST: Teleoperated Whole-Body Imitation System斯坦福 2025 年做的人形机器人全身遥操作系统,人怎么动机器人就怎么动。
- TWIST2TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System不用动捕棚、戴 VR 头显就能采人形机器人全身数据的便携遥操作系统
- VideoMimicVideoMimic (Visual Imitation Enables Contextual Humanoid Control)从手机拍的普通人类视频里学会爬楼梯、坐椅子等技能的人形机器人方法
- AMOAMO: Adaptive Motion Optimization for Hyper-Dexterous Humanoid Whole-Body ControlUCSD 2025 年的人形全身控制方法,用轨迹优化帮 RL 策略做大幅弯腰够物。
- FALCONFALCON: Learning Force-Adaptive Humanoid Loco-ManipulationCMU 等 2025 年提出的人形训练框架,让机器人边走边稳稳地推、拉、搬重物。
- CLONECLONE: Closed-Loop Whole-Body Humanoid Teleoperation for Long-Horizon Tasks只追踪头和双手、闭环纠偏的人形机器人全身遥操作系统。
- KungfuBotKungfuBot: Physics-Based Humanoid Whole-Body Control for Learning Highly-Dynamic Skills让宇树 G1 学会功夫、舞蹈等高动态动作的人形全身动作模仿框架。
- LeVERBLeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction用「潜在动词」把视觉语言模型和人形全身控制器连起来的双系统框架。
- GMTGMT: General Motion Tracking for Humanoid Whole-Body Control用一个统一策略让人形机器人跟踪各种人类动作的全身控制方法
- UniTrackerUniTracker: Learning Universal Whole-Body Motion Tracker for Humanoid Robots让人形机器人用一个策略跟踪各种人体动作的三阶段全身运动跟踪框架
- BeyondMimicBeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion先让人形稳定复现人类动作,再蒸馏成可引导的扩散模型去做新任务
- Any2TrackAny2Track: Track Any Motions under Any Disturbances清华、北大与银河通用的人形动作跟踪器,被推拉、负重也能跟住动作。
- BFM-ZeroBFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised RL不用任务奖励训练、靠「提示」切换任务的人形全身控制基础模型。
- SONICSONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control英伟达把运动跟踪做大规模训练,得到的通用人形机器人全身控制基础模型
12.12导航与自动驾驶
最后看移动:导航从拼模块找路到导航大模型,自动驾驶从 ALVINN 走到 VLA
- CoW(CLIP on Wheels)CLIP on Wheels (CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object Navigation)把 CLIP 等开放词汇模型装上移动机器人,不经导航训练按文字找物体的基线。
- LM-NavLM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action把 GPT-3、CLIP 和视觉导航模型拼起来,让机器人按自然语言指令导航。
- VLMapsVisual Language Maps for Robot Navigation把视觉语言特征写进三维地图,让机器人按「椅子右边三米」这类话导航。
- GNM(通用导航模型)GNM: A General Navigation Model to Drive Any Robot用 6 种机器人混合数据训练、能驱动不同机器人的通用视觉导航模型
- ViNTViNT: A Foundation Model for Visual Navigation (Visual Navigation Transformer)伯克利用多种机器人导航数据训练、看图找目标的视觉导航基础模型
- NoMaDNoMaD: Goal Masked Diffusion Policies for Navigation and Exploration伯克利 2023 年的导航扩散策略,一个模型既能自由探索,也能按目标图像走过去。
- VLFM(视觉语言前沿地图)VLFM: Vision-Language Frontier Maps for Zero-Shot Semantic Navigation用视觉语言模型给探索边界打分,零样本在陌生环境里找指定物体。
- NaVidNaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation北大与智源等 2024 年提出的视频大模型导航方法,只看单目视频决定下一步。
- PoliFormerPoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators用大规模同策略强化学习训练的 Transformer 导航策略,仿真训完直接上真机
- Mobility VLAMobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs用长上下文 VLM 看懂一段导览视频,再按图文指令找到目的地的分层导航系统
- 导航世界模型Navigation World Models (Meta)Meta 2024 年底提出的导航用视频世界模型,按动作想象走过去会看到什么。
- NaVILANaVILA: Legged Robot Vision-Language-Action Model for Navigation足式机器人导航 VLA:大模型用文字给出中层动作,强化学习运控负责走。
- 银河通用 TrackVLATrackVLA: Embodied Visual Tracking in the Wild (Galbot)只靠第一视角相机,边认出目标边规划路线去跟随它的具身跟踪 VLA
- 银河通用 NavFoMNavFoM: Embodied Navigation Foundation Model (Galbot)银河通用与北大 2025 年推出的导航基座模型,一套权重适配多种本体和导航任务。
- ALVINNALVINN: An Autonomous Land Vehicle in a Neural Network1988 年卡内基梅隆的驾驶神经网络,看路面图像直接输出转向。
- UniAD(规划导向的端到端自动驾驶)UniAD: Planning-oriented Autonomous Driving把感知、预测、规划串进一个网络、一切为规划服务的端到端自动驾驶框架
- 特斯拉 FSD V12(端到端自动驾驶)Tesla FSD v12 (End-to-End Neural Network Driving)特斯拉 2024 年推送的智驾版本,城市道路改由一个端到端神经网络来开。
- DriveVLM(快慢双系统智驾)DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models清华与理想汽车 2024 年提出:视觉语言模型慢思考、传统规划器快执行的智驾方案。
- Wayve GAIA-2GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving (Wayve)英国自动驾驶公司 Wayve 2025 年的驾驶世界模型,可控地生成多路摄像头驾驶视频。
- 英伟达 Alpamayo(驾驶推理 VLA)NVIDIA DRIVE Alpamayo-R1 / Alpamayo 1 (open reasoning VLA for autonomous driving)英伟达开放的自动驾驶推理 VLA,先用文字讲清为什么这样开,再输出行驶轨迹。
- Waymo 世界模型The Waymo World Model (built on Genie 3)Waymo 基于 Genie 3 的驾驶仿真生成模型,可同时生成相机和激光雷达数据