ACT · 动作分块
一次预测一整"块"未来动作序列,替代走一步看一步的抖动执行。
多相机图像 ×N
关节角 qₜ
当前观测 oₜ
Transformer
Enc–Dec + CVAE z
预测动作
aₜ, aₜ₊₁, … aₜ₊ₖ
逐步预测(单步)
抖动 ⚡ 误差累积
ACT 动作分块(chunk)
一次预测 k 步动作 = 一个 chunk
平滑 〜 连贯执行
▶ 播放
步进 ›
记住这点:
ACT =
Action Chunking with Transformers
。看一眼当前观测就"成块"预测未来 k 步动作, 按 chunk 连贯执行 —— 用规划替代走一步看一步,减少频繁重规划带来的抖动与累积误差。