跳转至

一、概要

语音前处理效果难以达到质变,有处理和没处理影响不大。特别是随着后处理模型的鲁棒,前处理的价值越来越小。来源

语音前处理概述

20250212_114828

神经网络/GMM+HMM 的识别模型中,一般选用什么声学特征?

  1. 梅尔频率倒谱系数(MFCC):通常提取 13-20 维特征,计算复杂度适中。DCT 操作可能丢失部分相位信息,且对动态特征(如一阶/二阶差分)的依赖较强。
  2. 感知线性预测系数(PLP):通常提取 12-16 维,适合资源受限场景。计算复杂度高于 MFCC,且对说话人差异的区分能力较弱。
  3. 滤波器组特征(Fbank):特征维度较高(通常 40-80 维),且特征间存在相关性,可能增加模型复杂度。包含相位和频谱细节,适合深度学习模型(如 CNN、RNN)直接学习。无需 DCT,计算效率更高。

二、为什么还要研究听觉/发声系统

都用 MFCC/Fbank 了,研究人耳和发声机制还有什么用?

2.1 MFCC/Fbank 本身就是听觉研究的工程结晶

  • Mel 刻度:来自心理声学实验,三角滤波器组在模拟耳蜗基底膜的临界频带
  • 对数压缩:对应韦伯-费希纳定律——响度与振幅的对数成正比。这就是 log-Mel 比线性能量谱效果好得多的根因。
  • 预加重:补偿声门脉冲 -6dB/oct 衰减和口唇辐射效应(见后文"辐射模型"),不是经验值。
  • 抛弃相位:因为人耳对相位不敏感(仅靠幅度谱即可还原可懂语音)。
  • 窗长 20~30ms:覆盖 2~3 个基音周期,对应"短时平稳"假设的物理依据。

不理解听觉机制,连"为什么用 80 维而不是 200 维 Fbank"、"为什么用三角窗而不是矩形窗"都解释不清楚。

2.2 深度学习时代依然没绕开

系统 输入特征
Whisper (OpenAI) 80 维 log-Mel Fbank
Wav2Vec2 / HuBERT 原始波形,但首层 CNN 学到的滤波器形状高度接近 gammatone(耳蜗模型)
Conformer / Paraformer 80 维 Fbank
Qwen3 AuT mel 谱输入

端到端 ≠ 抛弃前端。CNN+下采样学到的东西,本质上是在数据驱动地重新发明听觉滤波。理解听觉模型能: - 判断模型是否学到了合理表示。 - 解释为什么 raw waveform 模型需要远多于 Fbank 模型的数据。 - 在试 PCEN / SincNet / gammatone Fbank 等新前端时不再盲调。

2.3 各部分研究 vs 应用领域 的对应关系

笔记里的物理/数学建模深浅不一,价值也不一样。下表帮助按需阅读,避免在识别工程里花深推导时间但收益为零。

列说明: - 识别 (ASR):声学/语言模型为主的语音转文字 - 编码:低码率语音传输(LPC10/CELP/EVS/SILK/Opus) - TTS/声码器:参数合成与神经声码器(WORLD/STRAIGHT/LPCNet/NSF) - 声纹/反伪:说话人识别 + AI 合成检测 - VAD/前端:端点检测、降噪、AEC、波束

✅ 强相关 / 🟡 间接有用 / ❌ 基本无关

研究内容(笔记章节) 识别 编码 TTS/声码器 声纹/反伪 VAD/前端
听觉系统 / Mel 刻度 / 对数压缩 🟡
共振峰概念(F1/F2/F3) 🟡 🟡
基频与声调(pitch / mel 公式) 🟡 声调语种
同态分析框架(倒谱、CMN) 🟡
声管 / 共振峰声道模型 V(z) 🟡
辐射模型 R(z) → 预加重 🟡 调参用 🟡 🟡
Rosenberg 声门脉冲 g[n] ✅ 反深伪
浊音激励 / 复倒谱推导 🟡
轻音激励 / 功率谱模型 🟡
LPC / LPCC ✅ 核心 🟡
LSF / LSP ✅ 核心 🟡
短时能量 / 过零率 / AMDF ❌ 实用算法不再用 🟡 🟡 ✅ 仍是 baseline
谱熵 / 能熵比

2.3.1 给 ASR 工程师的阅读建议

值得深究: - 听觉系统、Mel/对数压缩、共振峰(解释 badcase、调前端) - 同态分析 + CMN(信道鲁棒性的数学基础) - 预加重的物理来源(决定系数取值)

知道存在即可,不必深推: - Rosenberg 模型与浊音/轻音复倒谱推导 → 编码与合成相关 - LPC 全极点拟合、LSF/LSP → 编码核心,识别基本不用 - 声道 V(z)/辐射 R(z) 的 Z 变换细节 → 合成相关

做声调语种 / 远场 / 反深伪时再回来补: - 基频提取、共振峰追踪、声门源建模

三、从音素开始

3.1 共振峰

3.1.1 共振

来源

回复力公式:

\[ F=-kx \]

运动方程:

\[ ma=-kx \]

当存在外界激励时,

\[ ma=-kx+F_0 \sin{\omega t} \]

对应的微分方程

\[ m \frac{\mathrm{d}^2x}{\mathrm{d} t^2}+kx=F_0 \sin{\omega t} \]

当初始振子位移和速度都为0时,

\[ x(t)=\frac{F_0(\omega^2_n \sin \omega t - \omega_n \omega \sin \omega_n t)}{k(\omega^2_n -\omega^2)} \]

其中\(\omega_n=\sqrt{\frac{k}{m}}\),为弹簧振子的固有频率。 当激励函数\(\omega \to \omega_n\)时,

\[ lim_{\omega \to \omega_n}x(t)=\frac{F_0\omega_n t}{2k}\cos \omega_n t=A\cos \omega_n t \]

可以看出,振幅是时间的线性函数,会随着时间一直增大,直到无穷,这和物理直观的结果是一致的。当然,实际的模型中,我们还要考虑阻尼的影响,此时方程和解的性质会更复杂一些。

3.1.2 共振峰模型

声道和鼻道如图3.7中沿一条直线排开的不均匀截面区域的管道所示。实际上,从图3.1中可以清楚地看出,声道在喉和咽之间几乎形成了一个直角。上述产生的声音,经过这些管道传播,频谱由这些管道的频率选择成形。这个效应与管风琴或管乐器中观察到的效应类似。在语音产生环境下,声道的共振频率称为共振峰频率或简称为共振峰。共振峰频率取决于声道的形状和大小;每种形状都以一组共振峰频率为特点。改变声道的形状可以产生不同的声音。因此,语音信号的谱性质随着声道形状的改变而随时间变化。

共振峰是指在声音的频谱中能量相对集中的一些区域,共振峰不但是音质的决定因素,而且反映了声道(共振腔)的物理特征。振峰信息包含在频率包络之中,因此共振峰参数提取的关键是估计自然语音频谱包络,一般认为谱包络中的最大值就是共振峰。

3.2 基频 和自相关

20250212_112004

基频反映音调。基频 = 采样率 / t_max,表示频率时称为基音周期,其中 t_max 为语音短时自相关函数取得最大值的时间,离散化后对应采样点数。

四声(声调):阴平、阳平、上声、去声。

由于浊音的基音周期随时间变化,L应尽量小。另一方面,要在自相关函数中得到任何周期性的暗示,窗口的长度必须至少我波形的两个周期。

3.3 基音谐波和共振峰的关系

基音谐波:周期性结构,反映声带振动特性。 共振峰:非周期性结构,反映声道形状特性。

传统的频谱包络估计法是利用谐波峰值提供的 用前三个共振峰来代表一个元音就足够了。对于复杂的辅音或鼻音,大概要用五个以上的共振峰才行。

3.4 声音语音学

20250212_125230

知乎-音标发音 听力课堂-点击音标发音 -

3.4.1 轻音和浊音

如果声带放松,两条声带薄膜分开,肺中的空气畅通无阻地通过声道直到声道收缩,此时有两种情况发生。 * 如果只是部分收缩,空气流会变成湍流,因此会产生所谓的“清音”语音(比如单词/see/或/shout/的最初发音部分)。如果是全部收缩,之后会形成压力。轻音也称为摩擦音。 * 当收缩释放时,压力也随之突然释放,产生一种短暂的瞬态声音,比如/put/、take/、kick/这些单词开始发音的部分。根据语音产生机理,口腔或鼻中的气压变化再次产生了语音信号。

特征 浊音 清音
定义 有喉头声带的震动产生 喉头声带未发生震动
频率 大多分布在低频区域,具有共振峰特性 频谱宽泛且均匀,高频成分较多
周期 具有准周期性。波形尖锐且密集。 不具备周期特性。
能量 浊音携带的能量较大。 清音携带的能量较少。
发音感觉 浊音发音时感觉较为沉重。 清音发音时感觉较为轻柔。

3.4.2 元音

声带振动产生一个准周期的空气脉冲,这一空气脉冲激励形状固定的声道就能得到元音。

  • 前元音:具有较低的第一共振峰频率和较高的第二共振峰频率
  • 后元音:具有较低的第一和第二共振峰频率
  • 中元音:具有较高的第一共振峰频率和较低的第二共振峰频率

声道形状从其所对应的两个元音之间平滑地改变可以产生双元音。

半元音 /w/ 和 /y/ 常称为滑音,/r/ 和 /l/ 称为流音。半元音以声道中的收缩为特征,但没有湍流产生。/w/、/r/ 和 /l/ 的第二共振峰有明显的从低到高的动作。/y/ 流音在前,后面紧跟一个元音 /i/。

流音,又称滑音或通音,是一种辅音音素。在发音时,发音器官的某一部分(如舌尖、舌叶或舌根等)接近或接触发音器官的另一部分(如齿龈、硬腭等),使气流受到阻碍,然后发音器官的这一部分迅速离开阻碍,使气流得以通过,形成发音。

20250402_172953

图:元音元音及其形状的横截面图

3.4.3 辅音

20250214_103701

在声门激励下(所以他们是浊音),如果声道在口腔通道的某一地方完全闭塞,就会产生鼻辅音/m/、/n/、/ŋ/ /m/发音的频率上零点位置比/n/要低,因此频谱上发音/m/的空洞比/n/稍微小一些。

清擦音是由稳定的气流激励声产生的。这一气流在声道收缩处形成湍流,声道收缩的位置决定了所产生的摩擦音。摩擦音激励的类似噪声性质。/f/的噪声谱基本位域或略高于4kHz,/s/ 3~4kHz, sh 在2~3kHz,

浊擦音产生时,声带是振动的,所以在声门处还有一个激励源。语谱图中有基音周期条纹。

浊塞音是一种短暂的、非持续的发音。声道在某处完全收缩,从而建立一定的气压,然后突然释放就形成浊塞音。经常有一小部分低频能量通过喉壁(有时候被称为声排)向外辐射。/b/的波形除了表明浊音激励和高频能量缺失这两个特征外,其他什么也说明不了。

清塞音声道完全阻塞的时期声压已经建立而声带并不振动。所以,在完全阻塞的时期之后,一旦空气压力得到释放,就会出现一个短暂的摩擦时期(由于空气突然外溢引起的湍流)

20250214_113228

四、听觉、听感知模型和语音感知

4.1 人类听觉系统

人耳的听觉系统分为听觉外周和听觉中枢两个部分。由于外耳道的共振效应,会使声音得到10dB左右的放大。外耳主要起着声乐定位和声音放大的作用。

中耳由鼓膜、中耳腔和听骨链组成。声波从鼓膜传到前庭窗的能量转换过程中,听小骨使声音的强度增加了30dB。在特强声时,听小骨对声音进行非线性传递,从而对内耳起到保护作用。

内耳将机械能转换成神经冲动传给大脑。通常可看成三个独立结构:半规管、前庭和耳蜗。半规管可以感知各个方向的运动,起到调节身体平衡的作用。 耳蜗由骨阶、中阶和前庭阶组成。中阶基底膜上的外毛细胞和内毛细胞的电位差生成神经信号。

  1. 人耳感知语音主要是通过语音信号的频谱分量的幅度,而对相位不敏感,并且语音的响度与频谱幅度的对数成正比。
  2. 人耳对 100Hz 以下的低频声音不敏感,对高频声尤其是 2000~5000Hz 的声音敏感,对 3000Hz 左右的声音最敏感。
  3. 人耳对于频率的分辨能力受声强的影响,太强或者太弱的声音都会导致对频率的分辨力降低。

4.1.1 为什么耳蜗 = 滤波器组

核心机理:基底膜的"频率-位置"映射(tonotopy)

耳蜗是个螺旋管,里面有条基底膜沿管子铺开。基底膜的物理特性沿长度方向连续变化: - 基底端(靠卵圆窗,入口):窄、薄、硬 → 共振频率高(~20kHz) - 顶端(蜗孔处):宽、厚、软 → 共振频率低(~20Hz)

声波进入后引起淋巴液波动,带动基底膜产生行波(traveling wave)。每个频率成分都会在基底膜上对应的"共振位置"产生最大振幅,过了之后能量迅速衰减——这就是 Békesy 行波理论(1961 诺贝尔生理学/医学奖)。

直观类比:不同长度的弦排成一排,混合音输入时每根弦只挑出对应频率振动——基底膜是"连续版的弦阵"。

4.1.2 毛细胞作为检测器

基底膜每个位置上方分布着毛细胞(约 1.5 万内毛细胞 + 1.2 万外毛细胞): - 基底膜局部振动 → 毛细胞纤毛弯曲 → 离子通道开闭 → 听神经脉冲 - 每根听神经纤维对应一个特征频率(CF, Characteristic Frequency)

所以基底膜每个位置 = 一个带通滤波器,毛细胞 = 该滤波器的输出检测器。整条基底膜 ≈ 几千通道的滤波器组。

4.1.3 耳蜗关键特性(决定特征工程)

特性 物理表现 对特征工程的影响
频率-位置对应(tonotopy) 高频→基底端,低频→顶端 滤波器组架构的生物学合法性
非均匀分辨率 单位频率分配的基底膜长度低频段更多 Mel/ERB 刻度低频密、高频疏
带通有重叠 相邻位置响应频段相互重叠 Mel 三角滤波器组带 ~50% overlap
外毛细胞非线性增益 弱声放大 40-60dB,强声压缩 log 压缩 / PCEN 的生理依据
相位锁定 低频神经元脉冲与波形同步(<5kHz) 中枢汇总后仅幅度可用 → "对相位不敏感"
临界频带 邻近频率成分相互掩蔽 Bark / ERB 刻度的定义来源
动态范围 120dB 主动机制 + 神经压缩 远大于任何工程麦克风
侧抑制 相邻神经元相互抑制,锐化频谱 解释为什么人耳"听共振峰"很灵敏

4.1.4 为什么这套映射对 ASR 重要

关键认知翻转:不是"耳蜗像滤波器组",而是"人类语言演化时已经针对这套滤波器组优化过了"

  • 元音 F1/F2、辅音爆破/摩擦的频段分布——这些区分性特征之所以可辨,是因为人类祖先有这样的耳蜗。
  • 反过来:用类似耳蜗的滤波器组提特征 → 落到的就是语言中本来就用来传达信息的维度。
  • 这就是为什么 Mel/gammatone 比"等带宽线性滤波"效果好——不是因为听觉模型"更美",而是语言本身就构造在听觉模型的坐标系里

4.2 音高和音调

区别: * 音高是一个具体的、单一的声音属性,它描述的是声音的高低程度。 * 音调则是一个整体的、综合的概念,它描述的是音乐作品或语音中的音调色彩和调性特征。 联系: * 音高是构成音调的基础元素之一。在音乐中,不同的音高组合在一起形成了不同的音调和旋律。 * 在语音学中,音调的变化也是通过音高的变化来实现的。例如,汉语中的四声就是通过不同的音高变化来区分的。

音高(主观属性)与频率(物理属性)的关系如下。将 1000Hz 纯音定义为 1000mel。

\[ 音高(mel)= 1127log_e(1+F/700) \]

4.3 听感模型

4.3.1 耳蜗滤波与 gammatone

基底膜每个位置只对特定频段敏感,整体呈现为一组带通滤波器组——这就是"耳蜗 = 滤波器组"的生理基础。Mel 三角滤波是工程近似,gammatone 是生理拟真

Gammatone 滤波器的冲激响应:

\[ g(t)=at^{n-1}e^{-2\pi b t}\cos(2\pi f_c t + \phi), \quad t \ge 0 \]
  • gamma 分布包络 × 余弦载波,由此得名
  • \(n\) 为阶数(常取 4),\(b\) 控制带宽,\(f_c\) 为中心频率
  • 直接拟合生理实验测得的基底膜冲激响应

ERB 刻度(Equivalent Rectangular Bandwidth): gammatone 中心频率按 ERB 排布,作用与 Mel 类似但低频段更稠密。

\[ ERB(f)=24.7(4.37f/1000+1) \]

4.3.1.1 Mel 三角 vs gammatone

维度 Mel 三角滤波 Gammatone
来源 心理声学实验(响度感知) 生理实验(基底膜冲激响应)
形状 三角函数(频域加权) gamma 包络 × 余弦(时域卷积)
计算成本 高(虽有频域近似实现)
频带刻度 Mel ERB
主流地位 工业标准(MFCC/Fbank) 学术 + 鲁棒前端

4.3.1.2 应用

  • 鲁棒 ASR 前端:GFCC(Gammatone Frequency Cepstral Coefficients)替换 Mel,噪声/远场下相对 MFCC 略涨。
  • 助听器 / 人工耳蜗:直接用 gammatone 滤波器组建模生理传导。
  • 解释 raw waveform 模型:Wav2Vec2 / SincNet 首层 CNN 学到的滤波器形状高度接近 gammatone——这是 inductive bias 学到正确听觉模型的实证(见前文"为什么还要研究听觉/发声系统")。
  • 未成主流的原因:干净数据下相对 MFCC 提升有限,计算成本却显著更高,工业界折中选了 Mel。

4.4 人类语音感知实验

从语音感知、可懂度和自然度实验中获取的知识,应能帮助我们更好地了解设计与实现实际语音分析和合成系统的约束条件。

4.5 语谱图 spectrogram

语谱图/声谱图,这个概念的出现是为了弥补频谱图丢失时间这个维度的信息,故而增加了时间这个维度。

语谱图的横坐标是时间,纵坐标是频率,坐标点值为语音数据能量。由于是采用二维平面表达三维信息,所以能量值的大小是通过颜色来表示的,颜色深,表示该点的语音能量越强。

补充:csdn: 为什么使用正弦波作为信号分析等领域的基础? * 周期性(初衷) * 不变性:正弦波通过线性时不变系统后还是正弦波,而且频率不会发生改变,适合作为基函数 * 可行性:傅里叶变换的收敛性证明

4.6 带宽、窄带和宽带

语音带宽通常指的是语音信号中包含的主要频率成分的范围,即最大截止频率与最小截止频率之差。对于人类语音,这个范围大致在300Hz到3400Hz之间。

窗函数带宽则是指窗函数在频域上的频率响应的主瓣宽度。窗函数用于对信号进行加窗处理,以限制信号的分析范围或减少频谱泄漏。窗函数的带宽反映了窗函数在频域上的分辨率或选择性。

窗带宽仅影响频谱分析的分辨率,而非信号的频带范围。(窗带宽 ≠ 滤波器带宽)

\[ B=k F_s / L (Hz) \]

对于矩形窗k=2,汉明窗k=4。

当窗函数的长度为几个基音周期时,STFT分析称为窄带分析。(长窗) 当窗函数的长度约为一个基音周期时,STFT分析称为宽带分析。(短窗)

采样率一定,宽带分析时的N更小,所以频率分辨率更低。记忆:宽即更宽泛粗糙。

宽带声谱图出现在浊音中的垂直条纹,当短窗冲激响应的峰值位于各个基音周期的最大值时,滤波器输出的能量会达到最大,反之最小。

由于窄带的频率分辨率高,所以横向的黑白间隔很更明显。横向黑条纹对应基音及其谐波。

20250430_100735

一般数字语谱图会使用高频强调技术来抵消语音频谱的自然衰减。另外可方便地按需扩展或压缩其频率和时间。

五、从发音角度看

csdn-Pelhans-现代语音信号处理笔记 (四) 倒谱分析与同态滤波

语音信号可用一个线性时不变系统的输出表示,即看做声门激励信号声道冲激响应的卷积。在语音信号处理领域,根据语音信号求解声门激励函数和声道冲激响应有非常重要的意义,如要求出语音信号的共振峰(共振峰是声道传递函数一对共轭复极点的频率),需要知道声道传递函数。

由卷积结果求出参与卷积的各信号,即将卷积分量分开,通常称为解卷,也成反卷积。解卷算法分为两大类,第一类为参数解卷,包括LPC等。第二类为非参数解卷,同态信号处理是其中最重要的一种。

20250319_112916

5.1 人类发音系统

声道是自声门(声带)之后对发音起决定性作用的器官。声道中各器官对语音的作用称为调音。 口腔是最重要的部分,它的大小和形状可以通过调整舌、唇、齿和腭来改变。

对发音影响最大的是从喉结至杓状软骨之间的韧带褶,称为声带。

5.2 基本概念

线性时不变系统(Linear Time-Invariant System,简称LTI系统)其输出对输入的响应不随时间改变,并且满足线性原理,即系统的输出是输入的线性函数。

系统六大特性判断:线性、时不变、因果、稳定、无记忆与可逆。 卷积律的交换不改变符号。

csdn-电科_银尘-无失真系统/线性相位系统 知了爱学-深入浅出理解信号处理中的一个关键概念:最小相位系统的定义

幅度表示系统对信号的放大或衰减程度,相位则表示系统对信号的延迟或提前程度。无失真系统的相位为斜率固定的线;而最小相位系统最关键的特点就在于它的相位响应与幅度响应之间存在着一种特定的数学关系。

知乎-工程师-信号与系统(7)——Z变换 对于一个因果LTI系统,若极点位于单位圆内,则该系统是稳定系统。

csdn-张海军2013-零点和极点到底影响了什么?什么是最小相位系统? 对于FIR系统(没有极点),如果系统函数的所有零点都位于单位圆内,则称该系统为最小相位系统;如果系统函数的所有零点都位于单位圆外,则称该系统为最大相位系统;如果一部分零点位于单位圆内,一部分零点位于单位圆外,则称该系统为混合相位系统或非最小相位系统。

对于IIR系统(存在极点),如果系统函数的所有零点和极点都在单位圆内,则称该系统为最小相位系统。

Z变换用使用泰勒展开的幕级数对应:csdn-Rqff-幂级数展开常用公式

回波系统:\(h[n]=\delta [n] * \alpha\delta[n-N_p]\)

zhihu-question-湍流究竟是什么?

pku-金融时间序列分析 zhihu-seriesc-时序预测 | ARMA应用指南 AR模型是全极点模型,全极点模型可以通过提高阶数来近似极零点模型

TODO: 双线性变换法

离散⇿周期,连续⇿非周期。来源 来源

变换类型 正变换 逆变换 输入信号特性 输出信号特性 离散性和周期性
傅里叶变换(FT) \(F(j\omega)=\int_{-\infty}^{\infty}f(t)e^{-j\omega t}\rm{d}t\) \(f(t)=\frac{1}{2\pi}\int_{-\infty}^{\infty}F(j\omega)e^{j\omega t}\rm{d}\omega\) 连续时间非周期信号 连续时间非周期信号 (输入是连续周期,输出是连续周期)
傅里叶级数(FS) 连续时间周期信号 离散频率非周期信号(频谱系数) (输入是连续周期,输出是离散非周期频谱)
离散时间傅里叶变换(DTFT) 离散时间非周期信号 连续频率周期信号(频谱) (输入是离散非周期,输出是连续周期频谱)
离散傅里叶变换(DFT) 离散时间有限长序列(可视为周期信号的一个周期) 离散频率周期信号(频谱) (输入和输出都是离散周期,输入可视为周期信号的一个周期)

20250430_134606

注:等式左边可以认为是一个整体性符号,把它看成y也行。因为关注的不是\(t=t_0\)时,\(\Omega=\Omega_0\)。有这样的理解有,等式左右括号中有没有j,或者是不是exp形式,就无所谓了,这样表达的唯一意义仅为方便基于符号确认傅里叶变换的形式。

STACF 短时自相关函数。

如果窗长度为L=641(16kHz,40ms),则自相关函数的长度至少为2L+1,考虑到FFT需要2次幂,则N=2048。

5.2.1 STFT

短时傅里叶变换 STFT (与DTFT同源) 信号\(x[n]\)在统计响应为\(w[n]\)的线性滤波器的输出为:

\[ \begin{align*} X_{\hat{n}}(e^{j\hat{\omega}}) &= \sum_{m=-\infty}^{\infty}x[\hat{n}-m]x[m]e^{-j\hat{\omega}m} \\ &= \sum_{m=-\infty}^{\infty}w[m]x[\hat{n}-m]e^{-j\hat{\omega}(\hat{n}-m)} \end{align*} \]

其中\(\hat{n}\)为窗函数的采样点,是离散的,\(\hat{\omega}\)为窗函数的频率点,是连续的。

20250430_165315

R为帧移步长,L为窗长(可假设为L=2M+1点的汉明窗),r为整数,N为FFT的采样点数,因果窗的有效分从\(m=rR-L\)加到\(m=rR\)

\[ X_{rR}(e^{j(2\pi k/N)})=X_r[k]=\sum_{m=-\infty}^{\infty}X[m]w[rR-m]e^{-j(2\pi k/N)m} \]

5.3 倒谱和同态语音处理

同态分析是一种信号处理方法,旨在将信号中的非线性关系(如卷积)转换为线性关系(如加法),从而简化分析过程。 (类似通信领域的信号和载波的分离)

概念 含义 概念 含义
频谱 自相关函数的傅里叶变换 倒滤波 对对数频谱的线性操作
倒谱 对数频谱的傅里叶逆变换 频率 频谱的自变量
分析 确定一个信号的频谱 倒频 倒谱的自变量
倒分析 确定一个信号的频谱 谐振频率 基频的整数倍
滤波 对时间信号的线性操作 谐振到品类 基倒频的整数倍

信号的DTFT定义为

\[ X(e^{-j \omega}) = \sum_{m=-\infty}^{\infty} x[n] e^{-j \omega n} \]

x[n] → 短时傅里叶变换STFT → \(X_n(e^{j\hat{\omega}})\)→ 语音处理 → 短时傅里叶分析STFS → y[n]

一个信号\(x[n]\)倒谱\(c[n]\)定义为

\[ c[n] = \frac{1}{2 \pi} \int_{-\pi}^{\pi} log|X(e^{j\omega})| e^{j \omega n} \mathrm{d}\omega \]

倒谱对应的量纲是“Quefrency”,称为倒频。

复倒谱包含幅度和相位信息,倒谱仅包含幅度信息。对于语音信号,倒谱是复倒谱的偶部。

\[ \hat{x}(n) = Z^{-1}[lnZ[x(n)]] \]

对数谱是倒谱的基础:倒谱的计算过程中,首先需要对信号的傅里叶变换幅度谱取对数,得到对数谱。这一步操作被称为“对数压缩”,目的是放大信号中的弱成分,便于后续分析。 倒谱是对数谱的逆傅里叶变换:在得到对数谱后,对其进行逆傅里叶变换,即可得到倒谱。倒谱将信号从频域转换到时域(倒频域),从而揭示信号在倒频域的特征。

可以认为短浊音段取自一个被周期脉冲激励的线性时不变系统的稳态输出。类似地,可以认为短轻音段是线性时不变系统被随机噪声激励的结果。

     /  >  フ
     |   _  _ l
     /` ミ_꒳ノ
     /      |
    /  ヽ   ノ
    │  | | |
 / ̄|   | | |
 | ( ̄ヽ__ヽ_)__)
 \二つ

5.4 同态分析

5.4.1 声道模型

语音信号处理-语音产生模型 对于声道,常见的数学模型有:声管模型和共振峰模型。声管模型将声道视为多个不同截面的声管串联;而对于常用的共振峰模型,其将声道视为一个谐振腔。

常见的共振峰模型有:级联、并联以及混合型三种,它们具有不同的适用描述对象。我们首先说明元音、辅音的区别,元音是指发音时从肺部呼出的气流通过起共鸣器作用的口腔、阻力极小并无摩擦声音的语音,而在辅音中,无论声带振动与否,发声时呼出的气流通过口腔或鼻腔时受到一定阻碍。另外,辅音包括清辅音和浊辅音两大类。发音时声带不震动、送气的叫清辅音;发音时声带震动、不送气的叫浊辅音。级联模型适用于描述大部分元音,其将声道视为一组串联的二阶谐振器,每个谐振器对应1个共振峰频率,即依次放大信号中谐振频率的成分;对于并联模型,其结构相对复杂,适用于描述非一般的元音和大部分辅音。混合模型将串联模型和并联模型结合起来,可根据所要描述的语音,自动进行切换。这三种模型的结构如下图所示。

TODO:声道模型怎么建立。

  1. 声管模型:根据声波的传播理论,计算每段的声阻抗、反射系数及传输函数。适用于简单元音的模拟,如通过调整声管长度和截面积,可合成不同音质的元音。
  2. 共振峰模型:根据共振峰的数学模型,计算共振峰的频率、共振系数及传输函数。适用于描述非一般的元音和大部分辅音。
  3. 数字波导方法:模拟声波在声道中的传播、反射和散射。通过网格划分实现声道的几何建模,支持一维、二维或三维仿真。

书中给出了一种共振峰声道模型:

\[ V(z) = \frac{1}{\prod^{5}_{k=1}{(1-2 e^{-2\pi\sigma_k T})cos(2\pi F_kT)z^{-1}}+e^{-4\pi\sigma_k T}z^{-2}} \]

其中\(F_k\)为中心频率;前五个共振峰带宽为\(2\sigma_k\)\(k=1,2,3,4,5\)。 一般来说,一个元音用前三个共振峰来表示就足够了;而对于复杂的辅音或鼻音,大概要用到前五个以上的共振峰才行。

20250402_183740

5.4.2 辐射模型

口唇张开的面积远小于头部的表面积,则可近似地看成平板开槽辐射的情况。(物理推导略) 声道的终端是口和唇,口唇端的辐射效应在高频段较为明显,而在低频段影响较小,因而可用高通滤波器来表示辐射模型:

\[ R(z) = 1 - r z^{-1} \]

其中,对于浊音,r接近1,而对于清音,取值很小。

在实际信号分析时,常用所谓“预加重技术”,即采样后插入一个一阶的高通滤波器。此时,只剩下声道部分,就便于声道参数的分析了。

5.4.3 产生模型

线性语音产生模型的基本假设是:肺部气流在声道中以平面波的形式传递。但是,研究表明,声道中的语音信号并不总是以平面波的形式传播,气流在通过声道腔体的某些部分时存在湍流,因此在声道模型中,语音信号应该由平面波部分的线性部分和湍流区域部分的非线性部分共同组成。 但下文的计算依然以线性脉冲产生器来分析。

5.4.4 浊音分析

20250319_112916

浊音声门脉冲-Rosenberg提出的模型:

\[ g[n] = \begin{cases} 0.5[1-cos(\frac{\pi(n+1)}{N_1}], & 0 \le n \le N_1 -1 \\ cos(\frac{0.5\pi(n+1-N_1)}{N_2} ), & N_1 \le n \le N_1 + N_2 -2\\ 0. & \text{else } \end{cases} \]

这个近似的斜三角波的 Z 变换可以近似为两极点模型:

\[ G(z)=\frac{1}{{(1-e^{-cT}z^{-1})}^2} \]

周期激励成分

\[ p[n] = \sum^{\infty}_{k=0}\beta^k\delta[n-kN_p] \]

其z变换为

\[ P(z) = \sum^{\infty}_{k=0}\beta^k\frac{1}{1-z^{-kN_p}}=\frac{1}{1-\beta z^{-N_p}} \]

参数值例子:\(\beta=0.999\),\(N_p=80\), 对应于基频10000/80=125Hz。 对数谱为:

\[ \hat{P}(z) = -log(1-\beta z^{-N_p}) = \sum^{\infty}_{k=1}\frac{\beta ^k}{k}z^{-kN_p} \]

从而有复倒谱,

\[ \hat{p}[n]=\sum^{\infty}_{k=1}\frac{\beta ^k}{k}p[n-kN_p] \]

冲激响应函数

\[ h_v[n]=Ag[n]*v[n]*r[n] \]

合成语音输出的复倒谱是所有复倒谱之和。第一个脉冲峰值的位置位于倒谱\(N_p\)处,即激励的周期。这个脉冲不会在清音段的倒谱出现。

20250402_191222

5.4.5 轻音分析

由于轻音的激励是随机噪声,因此需要通过自相关函数和功率谱的方法来描述。

\[ \phi_{ss}[n]=\phi_{vv}[n]*\phi_{rr}[n]*(A^2_U \delta[n])=A^2_U*\phi_{vv}[n]*\phi_{rr}[n] \]

功率谱为:

\[ \Phi_SS(z)=A^2_U*\Phi_{vv}(z)*\Phi_{rr}(z)=A^2_U*V(z)V(z^{-1})R(z)R(z^{-1}) \]

自相关函数的(复)倒谱是:

\[ \hat{\phi}_{ss}=2[logAu\delta[n]+\hat{v}[n]+\hat{v}[-n]\hat{r}[n]\hat{r}[-n]] \]

由于功率谱涉及平方,所以s[n]的功率谱为:

\[ \hat{h}_U[n]= \begin{cases} \hat{\phi}_{ss}/2, & n \ge 0 \\ 0, & otherwise. \end{cases} \]

对数谱中没有周期成分,因而在倒谱中没有孤立的峰值。

5.5 语音短时倒谱分析模型

\[ s[n]=e[n]*h[n], 0 \le n \le L-1 \]

式中:h[n]为冲激响应,e[n]为激励信号。

下文将把冲激响应作为估计对象。 * \(h_V\),V可能代表Vocal(发声):与浊音声带振动相关。 * \(h_U\),U可能代表Unvoiced(无声):与轻音声带不振动相关。

对于加窗后的语音段:

\[ x[n]=w[n]s[n]=w[n] (e[n]*h[n])\approx e_w[n]*h[n], 0 \le n \le L-1 \]

对于浊音:对应「倒谱峰」

\[ \hat{e}_w[n]=\begin{cases} \hat{w}_{N_{p}}[n], & 0, \pm N_p, \pm 2N_p, ...\\ 0, & otherwise \end{cases} \]

对于轻音:可认为是有限长随机信号段 有限长随机信号段的DTFT的幅度平方被称为周期图(Periodogram)(或功率谱Power Spectral Density, PSD),它被人们熟知的原因是它显示了随频率变化的随机波动。波动来源: * 有限样本 → 统计误差 → 随机波动。 * 离散频率 + 旁瓣泄漏 → 频谱不连续 → 额外波动。

\(log|H_U(e_{j\omega})|\)为低频部分,高频部分\(log|X(e_{j\omega})|\)为随机波动。

20250408_143755

其中\(\mathcal{D}_*\) 表示倒谱计算,\(l[n]\)为倒谱窗,与\(\hat{x}[n]\)的卷积称为同态滤波,或频不变线性滤波。高(倒频)通的同态滤波将获取激励信号,低(倒频)通的同态滤波将获取冲激响应信号。

20250402_191213

再回到浊音

20250408_193842

再回到轻音

20250408_193535

浊音的频谱主要集中在低频部分,摩擦音的对数频谱在2700Hz处有一个很宽的峰。

5.6 LPC Linear Predictive Coding 线性预测编码

“一个语音取样的现在值可以用若干个语音取样过去值的加权线性组合来逼近”来源,即线性信号处理中的卷积定义。

LPC 的核心是基于历史数据的动态预测,而非仅参数估计。

条件: 1. 忽略鼻音/摩擦音/爆破音等 2. 语音信号短时不变,帧长10-30 ms(可近似为线性时不变系统)

20250211_153711

LPC将语音信号看作是由若干个共振峰和各自对应的带通滤波器的输出叠加而成的。在LPC模型中,首先对语音信号进行p阶的线性预测分析,得到预测系数。这些预测系数描述了语音信号的线性预测特性,可以用于语音的编码、合成和分析。

5.6.1 vs

Linear Predictive Analysis (LPA):线性预测分析是一种用于语音信号处理的技术,其核心思想是利用过去时刻的信号值来预测当前时刻的信号值。通过建立线性预测模型,找到一组预测系数,使得预测值与实际信号值之间的误差最小。

Linear Predictive Coding (LPC):线性预测编码是基于线性预测分析的一种编码方法。它利用线性预测模型来分析语音信号,提取出反映声道特性的参数(即预测系数),并对这些参数进行编码传输,在接收端再利用这些参数重建语音信号。可以说LPC是LPA在语音编码领域的一种具体应用。

Line-Spectrum Frequency (LSF):线谱频率是对LPC预测系数的一种转换表示形式。LPC预测系数通常是一个多项式的系数,而LSF是将这些系数转换为一组频率值,这些频率值对应于全极点滤波器(由LPC模型表示)的极点在单位圆上的位置。

线谱对(Line Spectrum Pair,LSP)是用于表示语音信号线性预测(Linear Prediction,LP)模型参数的方法,它是一组频率值,通常成对出现,用于描述语音信号的短时功率谱的特性。LSP 是线性预测系数(Linear Prediction Coefficients,LPC)的一种转换形式,将 LPC 系数转换为一对对的频率值,这些频率值是预测误差滤波器的极点的角度。

5.7 倒谱距离量度

5.7.1 梅尔系数

特性 对数压缩 立方根压缩
听觉感知匹配度 高(符合韦伯-费希纳定律) 低(非线性特性不匹配)
信道归一化效果 优秀(CMS效果显著) 较差(CMS效果有限)
计算稳定性 高(小信号处理稳定) 中等(小信号易受影响)
应用广泛性 主流方法(MFCC标准流程) 较少使用

公式:(1kHz以下为常数,之后呈指数增长,知道4kHz时为采样频率的一半。)

\[ F_{mel}=1125 ln(1+f/700) \]
\[ F^{-1}_{mel}=700(e^{b/1125}-1) \]

计算过程: 1. 确定最低频率(0HZ),最高频率(fs/2),Mel滤波器个数M(如23); 2. 转换最低频率和最高频率的Mel(f);

low_freq_mel = 0
high_freq_mel = 2595 * np.log10(1 + (fs / 2) / 700)
3. 计算相连两个Mel滤波器中心Mel频率的距离,在Mel频率上,两两之间的中心频率是等间距的;
nfilt = 23 #滤波器个数
mel_points = np.linspace(low_freq_mel, high_freq_mel, nfilt + 2)  # 所有的mel中心点,为了方便后面计算mel滤波器组,左右两边各补一个中心点
4. 将每个中心Mel频率转化为频率f(非等间距);
hz_points = 700 * (10 ** (mel_points / 2595) - 1)
5. 计算频率所对应的FFT中心的下标:

\[ bin=\frac{hz\_point}{fs/2}(\frac{fft\_len}{2}+1) \]
fbank = np.zeros((nfilt, int(NFFT / 2 + 1)))  # 各个mel滤波器在能量谱对应点的取值
bin = (hz_points / (fs / 2)) * (NFFT / 2)  # 各个mel滤波器中心点对应FFT的区域编码,找到有值的位置
for i in range(1, nfilt + 1):
    left = int(bin[i-1])
    center = int(bin[i])
    right = int(bin[i+1])
    for j in range(left, center):
        fbank[i-1, j+1] = (j + 1 - bin[i-1]) / (bin[i] - bin[i-1])
    for j in range(center, right):
        fbank[i-1, j+1] = (bin[i+1] - (j + 1)) / (bin[i+1] - bin[i])
print(fbank)

应用人声领域时,且用频率f,而非N作为横坐标,则有下图三角形式的梅尔滤波器组:

20250409_104833

代码详见csdn-arbaraChow 梅尔倒谱系数MFCC由浅入深

若用于特征提取,过程详见来源 若用于滤波:

\[ MF_m[r]=\frac{1}{A_r}\sum^{U_r}_{k=L_r}|V_r[k]X_m[k]|^2, r=1,2,...,R \]

其中R为滤波器组数,\(X_m[k]\)为第m帧的DFT变换,\(V_r[k]\)为第r个梅尔滤波器的加权函数,\(A_r=\sum^{U_r}_{k=L_r}|V_r[k]|^2\)为倒谱窗的归一化因子。

5.7.2 均衡化

梅尔倒谱系数(MFCCs)是语音信号处理中的核心特征,广泛应用于语音识别、说话人识别等任务。然而,MFCCs在提取过程中可能引入倒谱偏置(Cepstral Mean),即各维MFCC的均值存在系统性偏差。这种偏置会降低特征的鲁棒性,尤其在跨信道或跨环境场景下表现明显。均衡化(Cepstral Mean Normalization, CMN)是一种通过消除倒谱偏置来增强特征稳定性的技术。

5.7.2.1 均衡化的作用

均衡化通过减去MFCCs的均值来消除偏置,具体效果包括: - 信道鲁棒性:减少信道差异对特征的影响。 - 噪声抑制:降低背景噪声对低频倒谱分量的干扰。 - 特征对齐:使不同录音条件下的MFCCs分布更一致。

5.7.2.2 帧级均衡化(Frame-level CMN)

操作:对每一帧的 MFCCs 减去其均值。

\[ \tilde{c}_t(k) = c_t(k) - \frac{1}{K} \sum_{k=1}^{K} c_t(k) \]

其中 \(c_t(k)\) 为第 \(t\) 帧的第 \(k\) 维 MFCC,\(K\) 为 MFCC 的维度(通常为 12-13)。

问题:可能过度拟合当前帧的噪声,导致特征波动。

5.7.2.3 语句级均衡化(Utterance-level CMN)

操作:对整段语音的 MFCCs 计算全局均值并减去。

\[ \tilde{c}_t(k) = c_t(k) - \frac{1}{T \cdot K} \sum_{t=1}^{T} \sum_{k=1}^{K} c_t(k) \]

其中 \(T\) 为总帧数。

  • 优点:更稳定的偏置估计,适合长语音。
  • 缺点:对短语音或实时场景不适用。
5.7.2.3.1 滑动窗口均衡化(Sliding Window CMN)
  • 操作:使用滑动窗口计算局部均值,兼顾实时性和稳定性。
  • 适用场景:流式语音处理。

5.7.2.4 均衡化的变体与改进

(1) 高斯归一化(Gaussian Normalization)

操作:不仅减去均值,还除以标准差。

\[ \tilde{c}_t(k) = \frac{c_t(k) - \mu_k}{\sigma_k} \]

其中 \(\mu_k\)\(\sigma_k\) 是第 \(k\) 维 MFCC 的全局均值和标准差。

  • 优点:进一步消除尺度差异。
  • 缺点:对异常值敏感。

(2) 动态特征均衡化 - 操作:对一阶导数(ΔMFCCs)和二阶导数(ΔΔMFCCs)单独均衡化。 - 原因:导数特征可能具有不同的偏置特性。

(3) 分段均衡化 - 操作:将语音分为静音段和语音段,分别均衡化。 - 优点:避免静音段噪声影响语音特征。

5.7.3 一阶导和二阶导

practicalcryptography/mel-frequency-cepstral-coefficients-mfccs 梅尔倒谱系数也称为static coefficients。一阶导和二阶导称为dynamic coefficients。 对于一阶导:

\[ \Delta c_t = \frac{\sum_{n=1}^{N} n \cdot (c_{t+n} - c_{t-n})}{2 \sum_{n=1}^{N} n^2} \]

其中: - \(\Delta c_t\):第 \(t\) 帧的一阶导数(即第 \(t\) 帧MFCC的变化率)。 - \(c_t\):第 \(t\) 帧的MFCC值(假设是某个特定的MFCC系数,如第1个系数)。 - \(N\):差分窗口的大小(通常为2,表示考虑前后各2帧)。 - \(n\):差分窗口内的帧偏移量(如 \(n = 1, 2\))。

二阶导基于一阶导数进行计算。

5.8 LPCC 线性预测倒谱系数 Linear Prediction Cepstrum Coefficient

5.9 对比

LPC更适用于语音编码和合成等领域,而LPCC则更适用于语音识别和说话人识别等领域。

六、从听觉角度看

如果在语音识别系统中能模拟人类听觉感知处理特点,就有可能提高语音的识别率。 考虑到人类的听觉特征,先将线性频谱映射到基于听觉感知的Mel非线性频谱中,然后转换到倒谱上。

\[ Mel(f)=2595 \times lg(1+\frac{f}{700}) \]

以此为基进行离散余弦变换

\[ C(n)-\sum^{N-1}_{m=0}s(m) cos(\frac{\pi n (m-0.5)}{M}),n=1,2,...,L \]

七、简单特征(实用算法基本不实用)

7.1 时域特征

7.1.1 过零率

过零率很容易受模数转换器中的直流偏置、信号中的 60Hz 交流声和数字化系统内噪声的影响。 通常采用带通滤波器来作为抗混叠滤波器,以便消除信号中的直流部分和60Hz干扰。

因为声门波引入的频谱衰减,而清音的大部分能量位于高频处。由于高频谱内容意味着高过零率,而低频谱内容意味着低过零率,因此在过零率和能量随频率分布之间有很强的相关性。此外,浊音的总能量明显大于清音的总能量。因此,话音应由相对高的能量和相对低的过零率表征。

短时平均幅度差分函数(AMDF)定长为

\[ \gamma_{\hat{n}}(k)=\sum_{k=0}^{N-1} |x[\hat{n}+m]w_1[m]-x[\hat{n}+m - k]w_2[m - k]| \]

后者的窗比前者的窗更好,类似与修正自相关函数的情况,其值会在0.6到1.0之前变化。\(\gamma_{\hat{n}}(k)\)在浊音基音周期迅速下降,而在轻音的基音周期没有可以比较的下降。

只能在SNR>10dB的条件下保持较高准确率。面对非平稳的噪声环境时,算法的鲁棒性差。

7.1.2 短时能量及短时平均幅度

\[ E_n = \sum_{m=0}^{N-1} x^2_n[m] \]
\[ M_n = \sum_{m=0}^{N-1}|X_n[m]|/N \]

用途:清音浊音区分,分界。

7.1.3 短时自相关

缺点:计算量大

\[ R_n(k) = \sum_{m=0}^{N-1} x_n[m]x_n[m+k]w[m] (0 -le k -le K) \]

20250430_154726

用于计算基音周期时,音频需要进行60~500Hz的预滤波器。由于低幅值保留共振峰信息,高幅值保留谐波信息,可以再进行一个中心削波函数,或三电平削波函数。

变种方法:加权自相关函数(ACF)、边长ACF

7.1.4 短时平均幅度差

\[ F_n(k) = \sum_{m=1}^{N-k+1}|x_n(m+k-1)-x_n(m)|/N \]

7.2 频域/特征

7.2.1 频带方差

语音的频带方差大,噪声的频带方差小。

一是大多数算法只能在SNR>10dB的条件下保持较高准确率;二是难以分辨与语音具有相似频域特征噪声;三是对清音的检测效果一般。

7.3 信息论特征

7.3.1 谱熵

在信息论中,一个事件的信息量与其发生的概率成反比。概率越小的事件,其发生时提供的信息量越大。 信息量通常定义为概率的负对数(\(−\log p\))。 熵是概率分布中所有可能事件的信息量的加权平均(期望值)。

\[ H=-\sum_{i}p_i \log p_i \]

N为FFT的长度,第n帧都某一谱线k的能量谱为:

\[ p_n(k)=X_n[k]X^*_n[k] \]

归一化概率谱为:

\[ p_n(k)=\frac{Y_n(k)}{\sum_{l=0}^{N/2}Y_n(l)}=\frac{Y_n(k)}{E_n} \]

则语音帧的短时谱熵定义为:

\[ H_n=\sum_{k=0}^{N/2}p_n(k)\log p_n(k) \]

7.4 混合方法

7.4.1 比例法

说话区间能量是向上凸起的,而过零率相反。所以能量值除以过零率,则更能突出说话区间。

\[ LE_n=lg(1+E_n/a) \]
\[ \tilde{x}_n(m) = \begin{cases} x_n(m),& |x_n(m)| \ge \sigma \\ 0 ,& |x_n(m)| \lt \sigma \end{cases} \]

能零比\(EZR_n=LE_n/(ZCR_n+b)\) 此处b为一般小的常数,防止\(ZCR_n\)为零时溢出。 能熵比

\[ EEF_n=\sqrt{1+|LE_n/H_n|} \]

八、特征提取技术

8.1 共振峰计算

方法 避免基频谐波干扰的机制 优势 局限性
倒谱分析法 通过倒谱变换将频谱包络与基频谐波分离到倒谱域 物理分离,鲁棒性强,计算效率高 倒谱长度选择需经验调整
LPC法 通过全极点模型拟合频谱包络,但易受谐波干扰 计算简单,适合静态语音 高基频下易误判谐波为共振峰
峰值检测法 直接在频谱中检测峰值,但谐波可能形成伪峰 实现简单,适合高信噪比场景 噪声环境下误判率高

高基音影响:高基音频率(如200Hz以上)的谐波会与共振峰(通常集中在500Hz-3000Hz)发生频谱重叠,导致共振峰被谐波掩盖。高基频的瞬态信号(如爆破音)可能产生额外的频谱成分,干扰共振峰的提取。

在倒谱中,频谱包络表现为低时域成分(慢变部分),而基频谐波表现为高时域成分(快变部分)。 分离机制:通过倒谱变换,频谱包络与谐波的能量被映射到倒谱的不同区域,实现物理上的分离。倒谱域加个窗,滤除高时域成分,然后再做傅里叶变换,最终从包络极值中获取共振峰。

九、厂商编码器

9.1 Qwen3 AuT编码器

Qwen3 AuT 编码器解析

8倍下采样模块:大幅降低计算复杂度 动态注意力窗口:1~8秒,语音边界扩大窗口 多头自注意力机制:捕捉音频序列中的长距离依赖关系 前馈神经网络:进行特征变换和非线性映射

十、link

csdn-茫茫人海一粒沙 - 音频特征与音频信号提取总结

[1]刘青松. 基于神经网络的低功耗语音关键词唤醒硬件设计[D].电子科技大学,2023.DOI:10.27005/d.cnki.gdzku.2022.003514.