← 全部课程
智能语音技术
上海交通大学 · 计算机学院 · X-LANCE
一门系统的智能语音技术课程(CS4313,俞凯 / 钱彦旻):从信号与系统、语音信号处理与特征提取(MFCC),到概率统计与模式识别基础、统计语音识别框架与隐马尔可夫模型(HMM),再到统计语言模型、大词表连续语音识别(LVCSR)解码、深度神经网络声学模型,直至端到端语音识别(CTC / RNN-T / Attention / Conformer)。配套逐讲深读知识库、公式速查、知识地图与中英术语表。
课程助教
基于本课程全部知识库答疑,回答附出处,只讲课里有的,不编造。
开始提问 →知识图谱
全部笔记的关联网络,力导向可视化:拖拽缩放,探索章节与知识点之间的脉络。
探索图谱 →原理可视化
每个核心知识点一个直观动画讲解,按章浏览、点击放大 —— 抽象概念一看就懂。
观看动画 →语音信号实验室
录音/上传/合成一段语音,实时看它变成 波形→频谱图→梅尔谱→MFCC,并演示能量/过零率驱动的 VAD。对应第 1/2/5 章,也是 Project1-VAD 的练手台。
进入实验室 →ASR / TTS 对比台
录一句话,并排看市面各家最新 ASR 怎么转写(比准确率、延迟);输入文字,并排听各家 TTS 合成(比自然度、韵律)。亲手感受不同语音系统的真实差异。
对比各家引擎 →项目指导
上传项目文档(选题 / 方案 / 代码 / 报告),AI 指导老师结合课程要求逐项给出具体修改意见与改进清单。
上传项目,获取意见 →课程章节
- 1信号处理及系统基本概念 — 信号与系统、傅里叶级数/变换、Z 变换、采样定理与 Nyquist、LTI 系统与卷积
- 2语音信号处理 — 语音产生模型、短时分析、加窗分帧、MFCC 与滤波器组、基音与共振峰、端点检测
- 3概率与贝叶斯理论 — 概率公理、贝叶斯公式、高斯分布、信息论(熵/KL/互信息)、最大熵
- 4模式识别与参数估计 — MLE / MAP / 贝叶斯估计、EM 算法、高斯混合模型 GMM
- 5统计语音识别基础 — 贝叶斯 ASR 框架、声学模型与语言模型分解、特征与解码、WER 评测
- 6隐马尔可夫模型 HMM — 三大基本问题、前向后向算法、Viterbi 解码、Baum-Welch 重估(Lecture 6-7)
- 8统计语言模型 — n-gram、最大似然估计、平滑与回退、困惑度 perplexity
- 9大词表连续语音识别 LVCSR — 上下文相关三音子、决策树状态聚类、WFST、束搜索解码
- 10语音识别的深度神经网络模型 DNN — DNN-HMM 混合系统、反向传播、上下文相关 CD-DNN、特征与训练
- 11其他神经网络及其应用 — CNN / RNN / LSTM / 注意力机制及其在语音识别中的应用
- 13端到端语音识别 — CTC、RNN-Transducer、注意力编解码 AED/LAS、Joint CTC/Attention、Transformer/Conformer
题库共 生成中…