Seq2Seq 信息瓶颈:变长输入压成定长向量

编码器把任意长的输入序列 x₁…x_T 全部塞进同一个固定大小的向量 h,看它装不装得下。

输入序列 x₁…x_T 定长向量 h 解码输出 y₁…y_L encoder h h = h_T^enc · 固定维度 维度小 → 丢信息 维度大 → 稀释

P(y | x) = ∏ P(yᵢ | y<ᵢ, h) —— 整句信息只剩 h 这一个向量

💡 不管输入多长,整句被压成同一个定长 h:短句装得下,长句必然瓶颈丢信息——这正是引出注意力机制的致命局限。