深度学习_人脸检测_基于多任务卷积神经网络(MTCNN)论文详解

本文主要是介绍深度学习_人脸检测_基于多任务卷积神经网络(MTCNN)论文详解,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

首先上论文地址:
Joint Face Detection and Alignment using Multi-task Cascaded Convolutional Networks

一.MTCNN工作流程图

首先我们看一下MTCNN的工作流程图:

在这里插入图片描述

注意:训练阶段使用的图片都是 12 × 12 12\times 12 12×12去训练P-Net,而在inference的时候,图像大小不受限制。

图像金字塔的作用:可以进行不同大小的人头的推理,达到尺度不变性。

二.MTCNN的模型结构

MTCNN模型有三个子网络。

分别是P-Net,R-Net,O-Net。

  1. Proposal Network(P-Net):该网络结构主要获得了人脸区域的候选窗口和边界框的回归向量。并用该边界框做回归,对候选窗口进行校准,然后通过非极大值抑制(NMS)来合并高度重合的候选框。
  2. Refine network(R-Net):该网络结构还是通过边界框回归和NMS来去掉那些false-positive区域。只是由于该网络结构和P-Net网络结构有差异,多了一个全连接层,所以会取得更好的抑制false-positive的作用。
  3. Output Network(O-Net):该层比R-Net层又多了一层卷积层,所以处理的结果会更加精细。作用和R-Net层作用一样。但是该层对人脸区域进行了更多的监督,同时还会输出5个地标(landmark)

下面我们来看看详细的网络结构:

在这里插入图片描述
建立模型的一些考虑:

  1. 把5 * 5卷积换成3 * 3卷积,能减少计算量,并增加深度。
  2. 非线性激活函数使用PReLU。

更加详细的网络结构

分别为det1,det2,det3。

det1.prototxt结构:

在这里插入图片描述

det2.prototxt结构:

在这里插入图片描述

det3.prototxt结构:

在这里插入图片描述

为了检测不同大小的人脸,开始需要构建图像金字塔,先经过P-Net模型,输出人脸类别和边界框(边界框的预测为了对特征图映射到原图的框平移和缩放得到更准确的框),将识别为人脸的框映射到原图框位置可以获取patch,之后每一个patch通过resize的方式输入到R-Net,识别为人脸的框并且预测更加准确的人脸框,最后R-Net识别为人脸的每一个patch通过resize的方式输入到O-Net,跟R-Net类似,关键点是为了在训练集有限情况下使模型更鲁棒

注意:构建图像金字塔的缩放比例要保留,为了将边界框映射到最开会原图上。

三.MTCNN的主要公式

MTCNN特征描述子主要包含3个部分,人脸/非人脸分类器,边界框回归,地标定位。

人脸分类

在这里插入图片描述

上式为人脸分类的交叉熵损失函数,其中pi为是人脸的概率,yidet 为ground-truth标签。

边界框回归

在这里插入图片描述

上式为通过欧式距离计算的回归损失,使得这个过程成为回归问题。其中,带尖儿的y为通过网络预测得到,不带尖儿的y为实际的ground-truth坐标。其中,y为一个(左上角x,左上角y,长,宽)组成的四元组。

地标定位

在这里插入图片描述

和边界回归一样这也是一个回归问题,还是计算网络预测的地标位置和实际真是地标位置的欧式距离,并最小化该距离。其中,带尖儿的y为通过网路预测得到,不带尖儿的y为实际的ground-truth地标坐标。由于一共5个点(左右眼睛,嘴巴,左右嘴角),每个点有x和y2个坐标,所以y属于十元组。

多个输入源的训练

在这里插入图片描述

整个的训练学习过程就是最小化上面的这个函数,其中N为训练样本的数量,aj 表示任务的重要性,bj 为样本标签,Lj 为上面的损失函数。

Online Hard sample mining(OHEM)

这个概念是什么意思呢?
答:寻找出比较刚的样本,好好炼它!!!

有别于传统的硬样本挖掘,我们进行在线硬样本挖掘,与训练过程相适应。

在小批量样本训练过程中,为了取得更好的效果,我们从所有样本中对正向传播计算出的损失进行排序,并选择损失最高的前70%样本作为硬样本,然后我们只计算反向传播中这些硬样本的梯度,这样一来保证传递的都是有效的数字。有点类似latent SVM,只是作者在实现上更加体现了深度学习的end-to-end。

四.训练

论文中使用的数据集

  1. FDDB
  2. WIDER
  3. AFLW

数据集的标注有4类

  1. Positive face数据(正样本)
  2. Negative face数据(负样本)
  3. Part face数据(部分人脸样本)
  4. landmark face数据(地标)

训练样本的比例负样本:正样本:Part样本:地标 = 3:1:1:2

交并比IoU(Intersection-over-Union)比例

在训练过程中,y尖儿和y的交并比比例为:

  1. 0-0.3:负样本
  2. 0.4-0.65:部分人脸样本
  3. 0.65-1:正样本

各个数据集如何使用

  1. 网络做人脸分类的时候,使用Positives和Negatives的图片来做,容易使模型收敛。
  2. 网络做人脸bbox的偏移量回归的时候,使用Positives和Parts的数据,比较好的使得bbox回归。
  3. 网络在进行人脸landmark回归的时候,只使用landmark face数据集。

训练效果

在线硬样本挖掘的有效性:
在这里插入图片描述

joint detection and alignment的有效性:

在这里插入图片描述

人脸检测的效果与其他算法进行对比:

在这里插入图片描述

运行的时间效率:

在这里插入图片描述

优化方法及思路

  1. 将landmark加入到前面两个网络进行训练。因为landmark是基于bbox的左上角坐标做偏移的,这样做会使得bbox的损失函数和landmark损失函数相关联。这个影响应该是正向的,论文里也提到landmark的预测也有利于bbox预测的更好。所以将landmark加入到前面两个网络做训练其实是有利于bbox预测的更好,为第三层真正预测landmark打下基础。
  2. P-Net是为了能产生proposal,但是因为要多次缩放在执行推理,这样的效率比不上batch处理,所以可以进行多模型多GPU并行,经过了P-Net后,R-Net和O-Net进行batch。
  3. 在截图中没有人脸的部分,可以标注负值。

这篇关于深度学习_人脸检测_基于多任务卷积神经网络(MTCNN)论文详解的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/191711

相关文章

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

Spring Security基于数据库验证流程详解

Spring Security 校验流程图 相关解释说明(认真看哦) AbstractAuthenticationProcessingFilter 抽象类 /*** 调用 #requiresAuthentication(HttpServletRequest, HttpServletResponse) 决定是否需要进行验证操作。* 如果需要验证,则会调用 #attemptAuthentica

【前端学习】AntV G6-08 深入图形与图形分组、自定义节点、节点动画(下)

【课程链接】 AntV G6:深入图形与图形分组、自定义节点、节点动画(下)_哔哩哔哩_bilibili 本章十吾老师讲解了一个复杂的自定义节点中,应该怎样去计算和绘制图形,如何给一个图形制作不间断的动画,以及在鼠标事件之后产生动画。(有点难,需要好好理解) <!DOCTYPE html><html><head><meta charset="UTF-8"><title>06

学习hash总结

2014/1/29/   最近刚开始学hash,名字很陌生,但是hash的思想却很熟悉,以前早就做过此类的题,但是不知道这就是hash思想而已,说白了hash就是一个映射,往往灵活利用数组的下标来实现算法,hash的作用:1、判重;2、统计次数;

综合安防管理平台LntonAIServer视频监控汇聚抖动检测算法优势

LntonAIServer视频质量诊断功能中的抖动检测是一个专门针对视频稳定性进行分析的功能。抖动通常是指视频帧之间的不必要运动,这种运动可能是由于摄像机的移动、传输中的错误或编解码问题导致的。抖动检测对于确保视频内容的平滑性和观看体验至关重要。 优势 1. 提高图像质量 - 清晰度提升:减少抖动,提高图像的清晰度和细节表现力,使得监控画面更加真实可信。 - 细节增强:在低光条件下,抖

OpenHarmony鸿蒙开发( Beta5.0)无感配网详解

1、简介 无感配网是指在设备联网过程中无需输入热点相关账号信息,即可快速实现设备配网,是一种兼顾高效性、可靠性和安全性的配网方式。 2、配网原理 2.1 通信原理 手机和智能设备之间的信息传递,利用特有的NAN协议实现。利用手机和智能设备之间的WiFi 感知订阅、发布能力,实现了数字管家应用和设备之间的发现。在完成设备间的认证和响应后,即可发送相关配网数据。同时还支持与常规Sof

零基础学习Redis(10) -- zset类型命令使用

zset是有序集合,内部除了存储元素外,还会存储一个score,存储在zset中的元素会按照score的大小升序排列,不同元素的score可以重复,score相同的元素会按照元素的字典序排列。 1. zset常用命令 1.1 zadd  zadd key [NX | XX] [GT | LT]   [CH] [INCR] score member [score member ...]

【机器学习】高斯过程的基本概念和应用领域以及在python中的实例

引言 高斯过程(Gaussian Process,简称GP)是一种概率模型,用于描述一组随机变量的联合概率分布,其中任何一个有限维度的子集都具有高斯分布 文章目录 引言一、高斯过程1.1 基本定义1.1.1 随机过程1.1.2 高斯分布 1.2 高斯过程的特性1.2.1 联合高斯性1.2.2 均值函数1.2.3 协方差函数(或核函数) 1.3 核函数1.4 高斯过程回归(Gauss

烟火目标检测数据集 7800张 烟火检测 带标注 voc yolo

一个包含7800张带标注图像的数据集,专门用于烟火目标检测,是一个非常有价值的资源,尤其对于那些致力于公共安全、事件管理和烟花表演监控等领域的人士而言。下面是对此数据集的一个详细介绍: 数据集名称:烟火目标检测数据集 数据集规模: 图片数量:7800张类别:主要包含烟火类目标,可能还包括其他相关类别,如烟火发射装置、背景等。格式:图像文件通常为JPEG或PNG格式;标注文件可能为X