Seq2Seq 信息瓶颈:变长输入压成定长向量
编码器把任意长的输入序列 x₁…x_T 全部塞进同一个固定大小的向量 h,看它装不装得下。
输入序列 x₁…x_T
定长向量 h
解码输出 y₁…y_L
encoder
h
h = h_T^enc · 固定维度
维度小 → 丢信息
维度大 → 稀释
P(
y
|
x
) = ∏ P(yᵢ | y<ᵢ,
h
) —— 整句信息只剩
h
这一个向量
▶ 播放
单步
💡 不管输入多长,整句被压成
同一个定长 h
:短句装得下,长句必然瓶颈丢信息——这正是引出
注意力机制
的致命局限。