上下文拼帧 → senone 后验

CD-DNN-HMM:把中心帧 ±5 共 11 帧拼成定长输入,DNN 输出全 senone 后验

语音特征帧序列 o t-5 t t+5 11 帧上下文窗 定长输入向量 (11×D) 多层非线性 · 越深越判别 输出层 softmax · senone 后验 p(q_t=s | o_t) HMM 状态链 input = [o_{t-5}…o_t…o_{t+5}] p(q_t=s | o_t) = softmax(z^L)
💡 拼帧把变长上下文塞进固定大小的输入,弥补前馈网络无记忆;DNN 一次输出全部 senone 的后验 p(q_t=s|o_t),发射给 HMM。