跳转至

语音信号处理

现代语音技术已经从「人工特征 + 单任务统计模型」发展为「大规模语音表征 + 任务头」与「离散音频 token + 生成模型」并行的路线。学习时仍要从采样、频谱和声学特征开始,因为当前模型的输入、延迟、失真和评测都建立在这些概念上;但不应把 MFCC、GMM-HMM 当作技术终点。

快速开始

建议按下面的依赖顺序学习:

  1. 阅读 数字音频基础,理解采样、分帧、短时傅里叶变换、Mel 频谱和 MFCC。
  2. 阅读 语音表征,区分手工声学特征、自监督连续表示和神经音频编解码器产生的离散 token。
  3. 根据任务进入 自动语音识别、语音生成 或 语音理解与增强。
  4. 最后阅读 语音语言模型,理解级联系统、语音条件语言模型和端到端语音到语音模型。

实践时先固定一小段 WAV 音频,完成「读取波形 -> 重采样 -> 计算 Log-Mel 频谱 -> 送入模型 -> 得到文本、类别或新波形」的闭环。记录采样率、声道、时长、归一化方式和模型版本,避免把前处理差异误判成模型效果差异。Hugging Face Audio Course 可用于补充代码实践。

技术路线

当前常见系统可以归纳为四条路线:

路线 中间表示 典型任务 主要特点
传统信号处理 波形、频谱、MFCC 去噪、小词表识别、声学分析 可解释、数据需求低,但跨场景泛化有限
判别式深度模型 Log-Mel 或连续隐藏状态 ASR、说话人、情感、事件分类 直接优化任务指标,部署路线成熟
自监督语音表征 预训练 Encoder 的帧级表示 低资源 ASR、分类、说话人任务 利用大量无标注语音,再用少量标注适配
生成式语音模型 频谱、潜变量或离散音频 token TTS、音色迁移、语音对话 能统一生成任务,但采样成本和安全风险更高

这些路线不是互斥关系。例如 ASR 可以使用自监督 Encoder 加 CTC 头;语音对话模型可以先用神经编解码器把波形转为 token,再由语言模型联合建模文本和音频;TTS 也可以同时使用文本 Encoder、流匹配声学模型和神经声码器。

任务地图

语音信号同时包含「说了什么」「谁在说」「怎样说」和「环境中有什么」。不同任务保留的信息不同:

  • 自动语音识别 (Automatic Speech Recognition, ASR) 关注语言内容,输出字符、子词或词序列。
  • 文本转语音 (Text-to-Speech, TTS) 从文本生成具有音色、韵律和情感的波形。
  • 说话人识别与验证关注身份;语音情感识别关注副语言信息。
  • 语音活动检测、降噪、去混响和语音分离改善输入质量或提取目标说话人。
  • 语音语言模型联合处理语义、声学和对话状态,支持语音问答、翻译和全双工交互。

评测原则

不同任务不能共用一个「准确率」结论:

任务 常用指标 还需人工或系统级检查
ASR WER、CER、实时率 专有名词、时间戳、长音频、噪声和口音
TTS MOS、说话人相似度、可懂度 韵律、停顿、长文本稳定性和越权音色模仿
说话人验证 EER、minDCF 跨设备、跨语言、伪造语音攻击
情感或事件分类 Macro-F1、AUROC 类别不平衡、数据集偏差和跨域泛化
增强与分离 SI-SDR、STOI、PESQ 下游 ASR、听感和实时延迟
语音对话 任务成功率、首包延迟、打断响应 语义正确性、自然度、重叠说话和安全策略

评测集应按说话人、录音环境和语料来源切分,防止同一说话人或同一录音片段同时出现在训练集与测试集。生成式系统还要记录水印、授权音色和滥用防护策略。

Note

原课程笔记的考核记录为出勤、两次测验和期末大项目,本次重构保留该信息,但正文内容按技术依赖而非授课周次组织。