MFCC(梅尔倒频谱系数)总结

2024-06-14 00:38

本文主要是介绍MFCC(梅尔倒频谱系数)总结,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

看了很多MFCC的资料,经常过一段时间就忘了。现在总结一下其中的要点,便于今后翻看。

MFCC(梅尔倒频谱系数)是在1980年由Davis和Mermelstein搞出来的。MFCC是一种人工(hand crafted)特征,可以用于语音识别等。当年在语音领域取得了重大的成就,后来出现了深度学习,这种deep learned特征就是另一说了。虽然现在深度学习如日中天,也取得了非常好的效果,但是MFCC仍然有很高的出现频率,甚至有把音频的MFCC作为RNN的输入再提特征的。

MFCC的提取过程

  1. 对一段连续的音频信号分帧
  2. 把每一帧转换为它的频谱(或者能量谱)
  3. 对每一帧的频谱用梅尔滤波器(mel filterbank)进行滤波,再对每个滤波器的结果求和得到一个长度为 n n 滤 波 器 的向量
  4. 对3.中得到的向量的每个元素取对数
  5. 对4.中的向量做DCT,得到另一个向量(倒频谱)
  6. 保留第2~13个元素,舍弃其他。这个长度为12的向量即为MFCC

Mel scale(梅尔刻度)

梅尔刻度产生,是由于人的听力对不同频率的声音变化的敏感性不同而提出的。具体地,人耳对于低频声音的变化要比高频敏感。所以对频率做一个非线性变换,得到梅尔刻度:
这里写图片描述
反之,
这里写图片描述
正向变换的函数图像为:
这里写图片描述
通过这个函数图像可以明显地看到,变换后,低频部分的差异被拉大(纵轴范围变大,即纵向拉长),而高频部分的差异被压缩(纵轴范围变小)。可以想象为,一把长度为5的尺子,上面所有的刻度点都右移不等,使得左边的刻度稀疏,右边稠密。

实现方法

假设声音信号频率为16kHz。

1. 对音频分帧

通常每帧的长度为20~40ms,25ms是标准的。这意味着每帧有 0.02516000=400 0.025 ∗ 16000 = 400 个采样点。而分帧步长(frame step)通常为10ms,即160 samples;两帧之间有重叠。如果帧数不为偶数,通常还要padding。

下面的步骤就是对每帧进行操作,每帧会提取出12个MFCC。
假设我们的声音信号为 s(n) s ( n ) ,分帧后为 si(n) s i ( n ) n n 1~ N N (400),i 1 1 ~总帧数。si(n)经过DFT之后得到 Si(k) S i ( k ) ,对应的功率谱为 Pi(k) P i ( k )

2. 对每帧做DFT

这里写图片描述
其中 h(n) h ( n ) N N sample long analysis window (e.g. hamming window),K是DFT的长度。每帧 si(n) s i ( n ) 的功率谱为
这里写图片描述
通常FFT为512个点,取前257个。

3. 计算Mel-spaced filterbank,并进行滤波(加权和)

通常有20~40(标准是26)个三角滤波器,用来对2.中的能量谱进行滤波。由于上面说了,对每一帧用FFT得到257个点,所以这里会有26个长度为257的滤波器。

如何确定滤波器的形状?

下面以10个梅尔滤波器为例,解释如何确定滤波器的形状。假设声音频率范围是300Hz到8000Hz,对应为401.25 Mels到2834.99 Mels。
1.把频率(Hz)转为Mel scale
2.假设现在盛博我们需要10个滤波器,所以加上两端点一共有12个点,即将频域分成了11份:

m(i) = 401.25, 622.50, 843.75, 1065.00, 1286.25, 1507.50, 1728.74, 1949.99, 2171.24, 2392.49, 2613.74, 2834.99

3.将上面的Mels转回Hz

h(i) = 300, 517.33, 781.90, 1103.97, 1496.04, 1973.32, 2554.33, 3261.62, 4122.63, 5170.76, 6446.70, 8000

4.在对应位置用三角滤波器进行滤波
这里写图片描述
这样就得到了一个10维的向量。注意,标准情况下应该是26个。

4. 将3.中的26维向量取对数
5. 对4.中的26维向量用DCT

得到了26个倒谱系数(cepstral coefficents)。一般取第2-13个,即为MFCC

这篇关于MFCC(梅尔倒频谱系数)总结的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1058888

相关文章

Kubernetes常用命令大全近期总结

《Kubernetes常用命令大全近期总结》Kubernetes是用于大规模部署和管理这些容器的开源软件-在希腊语中,这个词还有“舵手”或“飞行员”的意思,使用Kubernetes(有时被称为“... 目录前言Kubernetes 的工作原理为什么要使用 Kubernetes?Kubernetes常用命令总

Python中实现进度条的多种方法总结

《Python中实现进度条的多种方法总结》在Python编程中,进度条是一个非常有用的功能,它能让用户直观地了解任务的进度,提升用户体验,本文将介绍几种在Python中实现进度条的常用方法,并通过代码... 目录一、简单的打印方式二、使用tqdm库三、使用alive-progress库四、使用progres

Android数据库Room的实际使用过程总结

《Android数据库Room的实际使用过程总结》这篇文章主要给大家介绍了关于Android数据库Room的实际使用过程,详细介绍了如何创建实体类、数据访问对象(DAO)和数据库抽象类,需要的朋友可以... 目录前言一、Room的基本使用1.项目配置2.创建实体类(Entity)3.创建数据访问对象(DAO

Java向kettle8.0传递参数的方式总结

《Java向kettle8.0传递参数的方式总结》介绍了如何在Kettle中传递参数到转换和作业中,包括设置全局properties、使用TransMeta和JobMeta的parameterValu... 目录1.传递参数到转换中2.传递参数到作业中总结1.传递参数到转换中1.1. 通过设置Trans的

C# Task Cancellation使用总结

《C#TaskCancellation使用总结》本文主要介绍了在使用CancellationTokenSource取消任务时的行为,以及如何使用Task的ContinueWith方法来处理任务的延... 目录C# Task Cancellation总结1、调用cancellationTokenSource.

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

学习hash总结

2014/1/29/   最近刚开始学hash,名字很陌生,但是hash的思想却很熟悉,以前早就做过此类的题,但是不知道这就是hash思想而已,说白了hash就是一个映射,往往灵活利用数组的下标来实现算法,hash的作用:1、判重;2、统计次数;

git使用的说明总结

Git使用说明 下载安装(下载地址) macOS: Git - Downloading macOS Windows: Git - Downloading Windows Linux/Unix: Git (git-scm.com) 创建新仓库 本地创建新仓库:创建新文件夹,进入文件夹目录,执行指令 git init ,用以创建新的git 克隆仓库 执行指令用以创建一个本地仓库的

二分最大匹配总结

HDU 2444  黑白染色 ,二分图判定 const int maxn = 208 ;vector<int> g[maxn] ;int n ;bool vis[maxn] ;int match[maxn] ;;int color[maxn] ;int setcolor(int u , int c){color[u] = c ;for(vector<int>::iter

整数Hash散列总结

方法:    step1  :线性探测  step2 散列   当 h(k)位置已经存储有元素的时候,依次探查(h(k)+i) mod S, i=1,2,3…,直到找到空的存储单元为止。其中,S为 数组长度。 HDU 1496   a*x1^2+b*x2^2+c*x3^2+d*x4^2=0 。 x在 [-100,100] 解的个数  const int MaxN = 3000