上下文拼帧 → senone 后验
CD-DNN-HMM:把中心帧 ±5 共 11 帧拼成定长输入,DNN 输出全 senone 后验
语音特征帧序列 o
t-5
t
t+5
11 帧上下文窗
定长输入向量 (11×D)
多层非线性 · 越深越判别
输出层 softmax · senone 后验
p(q_t=s | o_t)
HMM 状态链
input
= [
o
_{t-5}…
o
_t…
o
_{t+5}]
p
(q_t=s | o_t) = softmax(z^L)
▶ 播放
单步
重置
💡 拼帧把变长上下文塞进固定大小的输入,弥补前馈网络无记忆;DNN 一次输出
全部 senone
的后验 p(q_t=s|o_t),发射给 HMM。