课程封面

智能语音处理

共23节 已有4人学过

主讲老师于泓

更新时间2025-04-24 20:35:34

课件资料暂无

5

加载中...

课程介绍

语音增强、语音合成、声纹识别、语音识别,语音相关算法、代码详解。

讲师介绍

讲师头像

于泓

北京邮电大学博士,鲁东大学讲师

AI课程导读

这是一门从语音信号基础到前沿生成式语音模型的系统实战课。课程从WAV/PCM读取、波形显示与librosa工具链讲起,逐步深入STFT、FBank、MFCC等特征,静音消除、预加重等预处理;再通过Shazam音频指纹、DTW热词检测、谱减法、维纳滤波与SEGAN,打通检索、识别、增强等典型任务。后半程聚焦VITS:从VAE、GAN、Flow基础,到模型结构、TextEncoder、PosteriorEncoder、Flow、Decoder、判别器与损失函数,并带你完成AISHELL多说话人TTS训练、快速微调及So-VITS-SVC 5.0声音转换。适合有Python和深度学习基础、希望进入语音算法或提升工程能力的学生与开发者。学完后,你既能理解核心原理,也能复现代码流程,独立开展语音增强、音频检索、TTS与音色转换实验。

AI课程大纲

于泓

北京邮电大学博士,鲁东大学讲师

评价

给该课程打分:

发表