IBM Model 1 演算器 · EM 词对齐

用《自然语言处理》课件法英句对(p67–71 直觉演示 / p74 两词算例),逐句对跑 EM:E 步算对齐后验(软对齐热力矩阵)→ 收集加权计数 → M 步重估翻译概率 t(e|f)。看概率如何从均匀初始化收敛、对齐如何逐渐清晰(鸽笼原理)。

算例
当前步骤
翻译概率表 t(e|f) 行=源词 f · 列=目标词 e 
本轮期望计数 count(e|f) 与 total(f)(M 步分子/分母)
编辑语料(每行「源句 ||| 目标句」;应用后按均匀分布重新初始化)
考点速记(课件 p63–83)
· 定义式:p(e,a|f) = ε/(lf+1)le · Πj t(ej|fa(j));NULL 占源端位置 0,故 +1。p64 算例乘积部分 0.7×0.8×0.8×0.4 = 0.1792
· 鸡生蛋:有对齐可估参数、有参数可估对齐 → 不完整数据 → EM(隐变量=词对齐;HMM 的 Baum-Welch 里隐变量=状态序列)。
· 求和–乘积交换(必会推导):p(e|f) = Σa p(e,a|f) 中各 a(j) 独立,「积的和=和的积」→ 复杂度 O((lf+1)le) 降为 O(le(lf+1));由此对齐后验按位置分解:p(a(j)=i|e,f) = t(ej|fi) / Σi' t(ej|fi')。
· M 步直觉:期望计数 = 该词对翻译概率占该目标词「总解释量」的份额;重估 t = count/total。
· 鸽笼原理:其它词被解释掉后,剩余配对被迫清晰(fleur–flower 随 la–the 确立而凸显)。
· Model 1–5:1 词汇翻译 / 2 绝对调序 / 3 繁衍度 / 4 相对调序 / 5 修缺陷;只有 Model 1 有全局最优(任意初始化收敛到同一解),高阶模型逐级初始化;Model 3 起求和化简失效、改对高概率对齐采样
与《HMM 演算器》成套 · 默认数据取自课件 p67–74。两词算例第 1 轮 E 步:4 对齐后验 0.824 / 0.052 / 0.118 / 0.007(分母 0.68),期望计数 c(the|la)≈0.876、c(house|maison)≈0.942,可与笔记对照。快捷键 下一步 · Space 自动