VLA:视觉 + 语言 → 动作
Vision-Language-Action:一个模型把「看到的 + 听到的」直接变成机械臂动作(第7章)
图像 Vision
相机
画面
语言 Language
“把红色方块
放进盒子”
状态 State
关节角 / 速度
末端位姿 EEF
Visual
Encoder
Word
Tokenizer
State
Encoder
统一 token 序列
LLM Backbone · VLM
System 2 · 慢思考
理解图像 + 语言指令
→ 多模态「通感」
Action Model · DiT
System 1 · 快执行
去噪 denoising → 电机动作
动作 Action
代表模型(LeRobot 策略库)
π0 (Pi0) · π0-FAST · π0.5
GR00T N1.5 · OpenVLA
ACT(作业3 指定)· SmolVLA
▶ 播放
‹ 上一步
下一步 ›
记住这点:
VLA = 视觉 + 语言 + 状态 统一进
同一个框架
。VLM(System 2 慢思考)负责
理解
,动作模型 / 策略(System 1 快执行)负责
产动作
——端到端从像素直达关节,从而跨场景泛化到没训练过的新指令 / 新物体。