【论文阅读-姿态估计】Differentiable Hierarchical Graph Grouping for Multi-Person Pose Estimation

本文主要是介绍【论文阅读-姿态估计】Differentiable Hierarchical Graph Grouping for Multi-Person Pose Estimation,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

本文将介绍发表在ECCV 2020的一篇基于图模型的多人姿态估计方法,作者来自香港大学、商汤科技、南京大学和悉尼大学。
论文链接: https://arxiv.org/abs/2007.11864v1
代码链接: 尚未公开

主要思想:

现有的多人姿态估计模型一般分为一般分为两大类:top-down和bottom-up方法。Top-down的模型先对输入的图像进行目标检测,检测出图像中每个人的bounding box之后,通过单人姿态估计模型对每个人的姿态进行检测。而bottom-up的方法则是先通过关键点检测模型检测出图像中所有人的所有关键点,然后对其进行聚类分组等操作,将检测出的关键点与每个人对应起来。本文提出了一个基于图模型的bottom-up方法,即通过一个可训练的层级图结构(HGG,Hierarchical Graph Grouping)来对前一阶段检测到的关键点进行分组。在训练阶段,HGG部分与关键点检测部分是端到端一起训练的。

模型结构

主要框架图
如上图所示,本文的模型分为关键点提取(Keypoint Candidate Proposal)和基于图的关键点聚类(Hierarchical Graph Grouping
)两部分。其中关键点提取部分采用的是四组堆叠的沙漏网络结构,输出为关键点的Heatmap和点对关系特征图。而用于关键点分组的Hierarchical Graph Grouping部分就是本文的主要创新点,其主要结构如下图所示:
HGG结构
HGG部分主要由三部分组成:

  1. GNN用来学习Heatmaps中每个节点之间的边(Edge)连接;
  2. Edge Discriminator用来判断每个边的两个节点是否应该连接(输出0或1),两个点来自同一个人时输出1,来自不同人时输出0;
  3. Macro-Node Discriminator用来监督每次迭代的Group结果,当每个Group中所有节点都属于同一个人时输出1,否则输出0.

如下面伪代码所示,对关键点的Group是通过迭代进行的,每次迭代由四步操作构成:Graph feature aggregation, Edge proximity update, Node clustering, Graph pruning.
HGG伪代码

模型训练

损失函数:

模型的损失函数主要由三部分组成:

  1. Keypoint detection loss:监督训练Heatmap的生成;
  2. Pairwise pull/push loss:监督训练点对关系特征图的生成,将来自不同人的两个nodes关系尽可能远,同一个人的两个nodes关系尽可能近;
  3. BCE loss:监督训练两个判别器——Edge Discriminator和Macro-node Discriminator。
训练细节:

优化算法:Adam, lr=2e-4;
Input size:512512;
Output Size:128
128

这篇关于【论文阅读-姿态估计】Differentiable Hierarchical Graph Grouping for Multi-Person Pose Estimation的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/693048

相关文章

多头注意力机制(Multi-Head Attention)

文章目录 多头注意力机制的作用多头注意力机制的工作原理为什么使用多头注意力机制?代码示例 多头注意力机制(Multi-Head Attention)是Transformer架构中的一个核心组件。它在机器翻译、自然语言处理(NLP)等领域取得了显著的成功。多头注意力机制的引入是为了增强模型的能力,使其能够从不同的角度关注输入序列的不同部分,从而捕捉更多层次的信息。 多头注意力机

ssh在本地虚拟机中的应用——解决虚拟机中编写和阅读代码不方便问题的一个小技巧

虚拟机中编程小技巧分享——ssh的使用 事情的起因是这样的:前几天一位工程师过来我这边,他看到我在主机和虚拟机运行了两个vscode环境,不经意间提了句:“这么艰苦的环境写代码啊”。 后来我一想:确实。 我长时间以来都是直接在虚拟机里写的代码,但是毕竟是虚拟机嘛,有时候编辑器没那么流畅,在文件比较多的时候跳转很麻烦,容易卡住。因此,我当晚简单思考了一下,想到了一个可行的解决方法——即用ssh

康奈尔大学之论文审稿模型Reviewer2及我司七月对其的实现(含PeerRead)

前言 自从我司于23年7月开始涉足论文审稿领域之后「截止到24年6月份,我司的七月论文审稿GPT已经迭代到了第五版,详见此文的8.1 七月论文审稿GPT(从第1版到第5版)」,在业界的影响力越来越大,所以身边朋友如发现业界有相似的工作,一般都会第一时间发给我,比如本部分要介绍的康奈尔大学的reviewer2 当然,我自己也会各种看类似工作的论文,毕竟同行之间的工作一定会互相借鉴的,我们会学他们

芯片后端之 PT 使用 report_timing 产生报告如何阅读

今天,就PT常用的命令,做一个介绍,希望对大家以后的工作,起到帮助作用。 在PrimeTime中,使用report_timing -delay max命令生成此报告。switch -delay max表示定时报告用于设置(这是默认值)。 首先,我们整体看一下通过report_timing 运行之后,报告产生的整体样式。 pt_shell> report_timing -from start_

【论文精读】分类扩散模型:重振密度比估计(Revitalizing Density Ratio Estimation)

文章目录 一、文章概览(一)问题的提出(二)文章工作 二、理论背景(一)密度比估计DRE(二)去噪扩散模型 三、方法(一)推导分类和去噪之间的关系(二)组合训练方法(三)一步精确的似然计算 四、实验(一)使用两种损失对于实现最佳分类器的重要性(二)去噪结果、图像质量和负对数似然 论文:Classification Diffusion Models: Revitalizing

【python】python葡萄酒国家分布情况数据分析pyecharts可视化(源码+数据集+论文)【独一无二】

👉博__主👈:米码收割机 👉技__能👈:C++/Python语言 👉公众号👈:测试开发自动化【获取源码+商业合作】 👉荣__誉👈:阿里云博客专家博主、51CTO技术博主 👉专__注👈:专注主流机器人、人工智能等相关领域的开发、测试技术。 python葡萄酒国家分布情况数据分析pyecharts可视化(源码+数据集+论文)【独一无二】 目录 python葡

论文阅读--Efficient Hybrid Zoom using Camera Fusion on Mobile Phones

这是谷歌影像团队 2023 年发表在 Siggraph Asia 上的一篇文章,主要介绍的是利用多摄融合的思路进行变焦。 单反相机因为卓越的硬件性能,可以非常方便的实现光学变焦。不过目前的智能手机,受制于物理空间的限制,还不能做到像单反一样的光学变焦。目前主流的智能手机,都是采用多摄的设计,一般来说一个主摄搭配一个长焦,为了实现主摄与长焦之间的变焦,目前都是采用数字变焦的方式,数字变焦相比于光学

基于协方差信息的Massive MIMO信道估计算法性能研究

1. 引言 随着移动互联网不断发展,人们对通信的速率和可靠性的要求越来越高[1]。目前第四代移动通信系统已经逐渐商用,研究人员开始着手研究下一代移动通信系统相关技术[2][3]。在下一代移动通信系统中要求下行速率达到10Gbps,这就要求我们使用更先进的技术和更宽的系统带宽。MIMO技术由于可以在不增加系统带宽和功率的前提下,成倍的提升系统容量和可靠性,已经广泛应用于各种无线通信系统中,但仅采用

【LLM之KG】CoK论文阅读笔记

研究背景 大规模语言模型(LLMs)在许多自然语言处理(NLP)任务中取得了显著进展,特别是在零样本/少样本学习(In-Context Learning, ICL)方面。ICL不需要更新模型参数,只需利用几个标注示例就可以生成预测。然而,现有的ICL和链式思维(Chain-of-Thought, CoT)方法在复杂推理任务上仍存在生成的推理链常常伴随错误的问题,导致不真实和不可靠的推理结果。

【python】python基于akshare企业财务数据对比分析可视化(源码+数据集+论文)【独一无二】

👉博__主👈:米码收割机 👉技__能👈:C++/Python语言 👉公众号👈:测试开发自动化【获取源码+商业合作】 👉荣__誉👈:阿里云博客专家博主、51CTO技术博主 👉专__注👈:专注主流机器人、人工智能等相关领域的开发、测试技术。 系列文章目录 目录 系列文章目录一、设计要求二、设计思路三、可视化分析 一、设计要求 选取中铁和贵州茅