VLA:视觉 + 语言 → 动作

Vision-Language-Action:一个模型把「看到的 + 听到的」直接变成机械臂动作(第7章)

图像 Vision 相机 画面 语言 Language “把红色方块 放进盒子” 状态 State 关节角 / 速度 末端位姿 EEF Visual Encoder Word Tokenizer State Encoder 统一 token 序列 LLM Backbone · VLM System 2 · 慢思考 理解图像 + 语言指令 → 多模态「通感」 Action Model · DiT System 1 · 快执行 去噪 denoising → 电机动作 动作 Action 代表模型(LeRobot 策略库) π0 (Pi0) · π0-FAST · π0.5 GR00T N1.5 · OpenVLA ACT(作业3 指定)· SmolVLA
记住这点:VLA = 视觉 + 语言 + 状态 统一进同一个框架。VLM(System 2 慢思考)负责理解,动作模型 / 策略(System 1 快执行)负责产动作——端到端从像素直达关节,从而跨场景泛化到没训练过的新指令 / 新物体。