ACT · 动作分块

一次预测一整"块"未来动作序列,替代走一步看一步的抖动执行。

多相机图像 ×N 关节角 qₜ 当前观测 oₜ Transformer Enc–Dec + CVAE z 预测动作 aₜ, aₜ₊₁, … aₜ₊ₖ 逐步预测(单步) 抖动 ⚡ 误差累积 ACT 动作分块(chunk) 一次预测 k 步动作 = 一个 chunk 平滑 〜 连贯执行
记住这点:ACT = Action Chunking with Transformers。看一眼当前观测就"成块"预测未来 k 步动作, 按 chunk 连贯执行 —— 用规划替代走一步看一步,减少频繁重规划带来的抖动与累积误差。