具身全链路演算器

语音唤醒(ASR) → LLM 解析指令 → ACT 输出动作序列(抓一个方块入盒) → VLM 对剩余方块视觉计数。 对应第7章 作业3 具身挑战赛 的任务链(参考工程 4-FruitSorter)。点“运行”看四阶段依次点亮,每步显示该阶段的输入 / 输出;也可“单步”逐段观察。

1.0× 桌面剩余 4 · 已入盒 0
1
STEP · ASR
语音唤醒
speech/asr_boidu.py
2
STEP · LLM
指令解析
agent/llm_parser.py
3
STEP · ACT
动作序列
Action Chunking
4
STEP · VLM
视觉计数
数剩余方块

场景 · SO-101 机械臂(示意)

一句话直觉:ACT 不“走一步看一步”,而是一次预测未来一小段动作(一个 chunk),端到端把图像直接映射成动作、无需显式规划;语音是入口、VLM 计数是收尾——四段串起来就是作业3 的完整任务链。
对齐课程笔记:ACT = Action Chunking with Transformers(几十 M 小模型,encoder-decoder + CVAE 隐变量 z,动作分块减累积误差);VLM 对剩余方块视觉计数;端侧部署香橙派。评分看 抓取成功率 / 执行效率 / 稳定性