语音信号处理
现代语音技术已经从「人工特征 + 单任务统计模型」发展为「大规模语音表征 + 任务头」与「离散音频 token + 生成模型」并行的路线。学习时仍要从采样、频谱和声学特征开始,因为当前模型的输入、延迟、失真和评测都建立在这些概念上;但不应把 MFCC、GMM-HMM 当作技术终点。
快速开始¶
建议按下面的依赖顺序学习:
- 阅读 数字音频基础,理解采样、分帧、短时傅里叶变换、Mel 频谱和 MFCC。
- 阅读 语音表征,区分手工声学特征、自监督连续表示和神经音频编解码器产生的离散 token。
- 根据任务进入 自动语音识别、语音生成 或 语音理解与增强。
- 最后阅读 语音语言模型,理解级联系统、语音条件语言模型和端到端语音到语音模型。
实践时先固定一小段 WAV 音频,完成「读取波形 -> 重采样 -> 计算 Log-Mel 频谱 -> 送入模型 -> 得到文本、类别或新波形」的闭环。记录采样率、声道、时长、归一化方式和模型版本,避免把前处理差异误判成模型效果差异。Hugging Face Audio Course 可用于补充代码实践。
技术路线¶
当前常见系统可以归纳为四条路线:
| 路线 | 中间表示 | 典型任务 | 主要特点 |
|---|---|---|---|
| 传统信号处理 | 波形、频谱、MFCC | 去噪、小词表识别、声学分析 | 可解释、数据需求低,但跨场景泛化有限 |
| 判别式深度模型 | Log-Mel 或连续隐藏状态 | ASR、说话人、情感、事件分类 | 直接优化任务指标,部署路线成熟 |
| 自监督语音表征 | 预训练 Encoder 的帧级表示 | 低资源 ASR、分类、说话人任务 | 利用大量无标注语音,再用少量标注适配 |
| 生成式语音模型 | 频谱、潜变量或离散音频 token | TTS、音色迁移、语音对话 | 能统一生成任务,但采样成本和安全风险更高 |
这些路线不是互斥关系。例如 ASR 可以使用自监督 Encoder 加 CTC 头;语音对话模型可以先用神经编解码器把波形转为 token,再由语言模型联合建模文本和音频;TTS 也可以同时使用文本 Encoder、流匹配声学模型和神经声码器。
任务地图¶
语音信号同时包含「说了什么」「谁在说」「怎样说」和「环境中有什么」。不同任务保留的信息不同:
- 自动语音识别 (Automatic Speech Recognition, ASR) 关注语言内容,输出字符、子词或词序列。
- 文本转语音 (Text-to-Speech, TTS) 从文本生成具有音色、韵律和情感的波形。
- 说话人识别与验证关注身份;语音情感识别关注副语言信息。
- 语音活动检测、降噪、去混响和语音分离改善输入质量或提取目标说话人。
- 语音语言模型联合处理语义、声学和对话状态,支持语音问答、翻译和全双工交互。
评测原则¶
不同任务不能共用一个「准确率」结论:
| 任务 | 常用指标 | 还需人工或系统级检查 |
|---|---|---|
| ASR | WER、CER、实时率 | 专有名词、时间戳、长音频、噪声和口音 |
| TTS | MOS、说话人相似度、可懂度 | 韵律、停顿、长文本稳定性和越权音色模仿 |
| 说话人验证 | EER、minDCF | 跨设备、跨语言、伪造语音攻击 |
| 情感或事件分类 | Macro-F1、AUROC | 类别不平衡、数据集偏差和跨域泛化 |
| 增强与分离 | SI-SDR、STOI、PESQ | 下游 ASR、听感和实时延迟 |
| 语音对话 | 任务成功率、首包延迟、打断响应 | 语义正确性、自然度、重叠说话和安全策略 |
评测集应按说话人、录音环境和语料来源切分,防止同一说话人或同一录音片段同时出现在训练集与测试集。生成式系统还要记录水印、授权音色和滥用防护策略。
Note
原课程笔记的考核记录为出勤、两次测验和期末大项目,本次重构保留该信息,但正文内容按技术依赖而非授课周次组织。