MFCC(梅尔倒频谱系数)总结

2024-06-14 00:38

本文主要是介绍MFCC(梅尔倒频谱系数)总结,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

看了很多MFCC的资料,经常过一段时间就忘了。现在总结一下其中的要点,便于今后翻看。

MFCC(梅尔倒频谱系数)是在1980年由Davis和Mermelstein搞出来的。MFCC是一种人工(hand crafted)特征,可以用于语音识别等。当年在语音领域取得了重大的成就,后来出现了深度学习,这种deep learned特征就是另一说了。虽然现在深度学习如日中天,也取得了非常好的效果,但是MFCC仍然有很高的出现频率,甚至有把音频的MFCC作为RNN的输入再提特征的。

MFCC的提取过程

  1. 对一段连续的音频信号分帧
  2. 把每一帧转换为它的频谱(或者能量谱)
  3. 对每一帧的频谱用梅尔滤波器(mel filterbank)进行滤波,再对每个滤波器的结果求和得到一个长度为 n n 滤 波 器 的向量
  4. 对3.中得到的向量的每个元素取对数
  5. 对4.中的向量做DCT,得到另一个向量(倒频谱)
  6. 保留第2~13个元素,舍弃其他。这个长度为12的向量即为MFCC

Mel scale(梅尔刻度)

梅尔刻度产生,是由于人的听力对不同频率的声音变化的敏感性不同而提出的。具体地,人耳对于低频声音的变化要比高频敏感。所以对频率做一个非线性变换,得到梅尔刻度:
这里写图片描述
反之,
这里写图片描述
正向变换的函数图像为:
这里写图片描述
通过这个函数图像可以明显地看到,变换后,低频部分的差异被拉大(纵轴范围变大,即纵向拉长),而高频部分的差异被压缩(纵轴范围变小)。可以想象为,一把长度为5的尺子,上面所有的刻度点都右移不等,使得左边的刻度稀疏,右边稠密。

实现方法

假设声音信号频率为16kHz。

1. 对音频分帧

通常每帧的长度为20~40ms,25ms是标准的。这意味着每帧有 0.02516000=400 0.025 ∗ 16000 = 400 个采样点。而分帧步长(frame step)通常为10ms,即160 samples;两帧之间有重叠。如果帧数不为偶数,通常还要padding。

下面的步骤就是对每帧进行操作,每帧会提取出12个MFCC。
假设我们的声音信号为 s(n) s ( n ) ,分帧后为 si(n) s i ( n ) n n 1~ N N (400),i 1 1 ~总帧数。si(n)经过DFT之后得到 Si(k) S i ( k ) ,对应的功率谱为 Pi(k) P i ( k )

2. 对每帧做DFT

这里写图片描述
其中 h(n) h ( n ) N N sample long analysis window (e.g. hamming window),K是DFT的长度。每帧 si(n) s i ( n ) 的功率谱为
这里写图片描述
通常FFT为512个点,取前257个。

3. 计算Mel-spaced filterbank,并进行滤波(加权和)

通常有20~40(标准是26)个三角滤波器,用来对2.中的能量谱进行滤波。由于上面说了,对每一帧用FFT得到257个点,所以这里会有26个长度为257的滤波器。

如何确定滤波器的形状?

下面以10个梅尔滤波器为例,解释如何确定滤波器的形状。假设声音频率范围是300Hz到8000Hz,对应为401.25 Mels到2834.99 Mels。
1.把频率(Hz)转为Mel scale
2.假设现在盛博我们需要10个滤波器,所以加上两端点一共有12个点,即将频域分成了11份:

m(i) = 401.25, 622.50, 843.75, 1065.00, 1286.25, 1507.50, 1728.74, 1949.99, 2171.24, 2392.49, 2613.74, 2834.99

3.将上面的Mels转回Hz

h(i) = 300, 517.33, 781.90, 1103.97, 1496.04, 1973.32, 2554.33, 3261.62, 4122.63, 5170.76, 6446.70, 8000

4.在对应位置用三角滤波器进行滤波
这里写图片描述
这样就得到了一个10维的向量。注意,标准情况下应该是26个。

4. 将3.中的26维向量取对数
5. 对4.中的26维向量用DCT

得到了26个倒谱系数(cepstral coefficents)。一般取第2-13个,即为MFCC

这篇关于MFCC(梅尔倒频谱系数)总结的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1058888

相关文章

java常见报错及解决方案总结

《java常见报错及解决方案总结》:本文主要介绍Java编程中常见错误类型及示例,包括语法错误、空指针异常、数组下标越界、类型转换异常、文件未找到异常、除以零异常、非法线程操作异常、方法未定义异常... 目录1. 语法错误 (Syntax Errors)示例 1:解决方案:2. 空指针异常 (NullPoi

Java反转字符串的五种方法总结

《Java反转字符串的五种方法总结》:本文主要介绍五种在Java中反转字符串的方法,包括使用StringBuilder的reverse()方法、字符数组、自定义StringBuilder方法、直接... 目录前言方法一:使用StringBuilder的reverse()方法方法二:使用字符数组方法三:使用自

Python依赖库的几种离线安装方法总结

《Python依赖库的几种离线安装方法总结》:本文主要介绍如何在Python中使用pip工具进行依赖库的安装和管理,包括如何导出和导入依赖包列表、如何下载和安装单个或多个库包及其依赖,以及如何指定... 目录前言一、如何copy一个python环境二、如何下载一个包及其依赖并安装三、如何导出requirem

Rust格式化输出方式总结

《Rust格式化输出方式总结》Rust提供了强大的格式化输出功能,通过std::fmt模块和相关的宏来实现,主要的输出宏包括println!和format!,它们支持多种格式化占位符,如{}、{:?}... 目录Rust格式化输出方式基本的格式化输出格式化占位符Format 特性总结Rust格式化输出方式

Python中连接不同数据库的方法总结

《Python中连接不同数据库的方法总结》在数据驱动的现代应用开发中,Python凭借其丰富的库和强大的生态系统,成为连接各种数据库的理想编程语言,下面我们就来看看如何使用Python实现连接常用的几... 目录一、连接mysql数据库二、连接PostgreSQL数据库三、连接SQLite数据库四、连接Mo

Git提交代码详细流程及问题总结

《Git提交代码详细流程及问题总结》:本文主要介绍Git的三大分区,分别是工作区、暂存区和版本库,并详细描述了提交、推送、拉取代码和合并分支的流程,文中通过代码介绍的非常详解,需要的朋友可以参考下... 目录1.git 三大分区2.Git提交、推送、拉取代码、合并分支详细流程3.问题总结4.git push

Kubernetes常用命令大全近期总结

《Kubernetes常用命令大全近期总结》Kubernetes是用于大规模部署和管理这些容器的开源软件-在希腊语中,这个词还有“舵手”或“飞行员”的意思,使用Kubernetes(有时被称为“... 目录前言Kubernetes 的工作原理为什么要使用 Kubernetes?Kubernetes常用命令总

Python中实现进度条的多种方法总结

《Python中实现进度条的多种方法总结》在Python编程中,进度条是一个非常有用的功能,它能让用户直观地了解任务的进度,提升用户体验,本文将介绍几种在Python中实现进度条的常用方法,并通过代码... 目录一、简单的打印方式二、使用tqdm库三、使用alive-progress库四、使用progres

Android数据库Room的实际使用过程总结

《Android数据库Room的实际使用过程总结》这篇文章主要给大家介绍了关于Android数据库Room的实际使用过程,详细介绍了如何创建实体类、数据访问对象(DAO)和数据库抽象类,需要的朋友可以... 目录前言一、Room的基本使用1.项目配置2.创建实体类(Entity)3.创建数据访问对象(DAO

Java向kettle8.0传递参数的方式总结

《Java向kettle8.0传递参数的方式总结》介绍了如何在Kettle中传递参数到转换和作业中,包括设置全局properties、使用TransMeta和JobMeta的parameterValu... 目录1.传递参数到转换中2.传递参数到作业中总结1.传递参数到转换中1.1. 通过设置Trans的