Trans高质量Paper | 再小再隐蔽的目标检测都不是问题(附源码下载)

2024-03-11 20:30

本文主要是介绍Trans高质量Paper | 再小再隐蔽的目标检测都不是问题(附源码下载),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!


计算机视觉研究院专栏

作者:Edison_G

隐藏的目标与背景之间的高内在相似性使得COD(concealed object detection)比传统的目标检测/分割更具挑战性。

长按扫描二维码关注我们

一、简要

有研究者提出第一个关于隐藏物体检测的系统研究,旨在识别那些“完美嵌入”在其背景中的物体。隐藏的目标与背景之间的高内在相似性使得COD比传统的对象检测/分割更具挑战性。

为了更好地理解这项任务,收集了一个叫做COD10K的大型数据集(如上图),它由10,000张图像组成,覆盖了78个目标类别中不同真实场景中隐藏的目标。此外,研究者还提供了丰富的注释,包括目标类别、目标边界、具有挑战性的属性、目标级标签和实例级注释。

COD10K是迄今为止最大的COD数据集,具有最丰富的注释,它支持全面的隐藏目标理解,甚至可以用来帮助推进其他一些视觉任务,如检测、分割、分类等。受动物在野外狩猎的启发,研究者还为COD设计了一个简单而强大的基线,称为搜索识别网络(Search Identification Network,SINet)。在没有任何bells和whistles情况下,SINet在所有被测试的数据集上的性能都超过了12个前沿基线,使它们成为鲁棒的通用架构,可以作为COD未来研究的催化剂。

二、背景

您是否可以在上图中10秒内找到隐藏的目标吗?生物学家称其称为背景匹配伪装(BMC),其中一个或多个物体试图调整其颜色以与周围环境“无缝”匹配,以避免检测到。生态学家发现,这种BMC策略可以欺骗观察者的视觉感知系统。自然地,隐藏目标检测(COD)需要大量的视觉感知知识。理解COD本身不仅具有科学价值,而且在许多基本领域的应用也很重要,如计算机视觉(例如,搜救工作或稀有物种发现)、医学(例如,息肉分割、肺感染分割)、农业(例如,防止入侵的蝗虫检测)和艺术(例如,recreational art)。

在下图中提供了通用、突出和隐藏目标检测的例子。

目标和非目标之间的高内在相似性使得COD比传统的目标分割/检测更具挑战性。尽管最近受到了越来越多的关注,但关于COD的研究仍然很少,主要是由于缺乏足够大的数据集和标准基准,如Pascal-VOC, ImageNet, MS-COCO, ADE20K和DAVIS。 

三、COD10K DATASET

Object and instance distributions of each concealed category in the COD10K

Diverse types of concealed objects in our COD10K

四、COD FRAMEWORK

Component details

Group-Reversal Attention (GRA)。最后在反向指导和小组指导操作的帮助下,引入了剩余的学习过程,称为GRA块。根据以往的研究,多阶段的细化可以提高性能。

五、实验

计算机视觉研究院学习群等你加入!

计算机视觉研究院主要涉及深度学习领域,主要致力于人脸检测、人脸识别,多目标检测、目标跟踪、图像分割等研究方向。研究院接下来会不断分享最新的论文算法新框架,我们这次改革不同点就是,我们要着重”研究“。之后我们会针对相应领域分享实践过程,让大家真正体会摆脱理论的真实场景,培养爱动手编程爱动脑思考的习惯!

扫码关注

计算机视觉研究院

公众号ID|ComputerVisionGzq

学习群|扫码在主页获取加入方式

Githu代码 | 回复“COD”获取代码

这篇关于Trans高质量Paper | 再小再隐蔽的目标检测都不是问题(附源码下载)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/798978

相关文章

好题——hdu2522(小数问题:求1/n的第一个循环节)

好喜欢这题,第一次做小数问题,一开始真心没思路,然后参考了网上的一些资料。 知识点***********************************无限不循环小数即无理数,不能写作两整数之比*****************************(一开始没想到,小学没学好) 此题1/n肯定是一个有限循环小数,了解这些后就能做此题了。 按照除法的机制,用一个函数表示出来就可以了,代码如下

hdu1043(八数码问题,广搜 + hash(实现状态压缩) )

利用康拓展开将一个排列映射成一个自然数,然后就变成了普通的广搜题。 #include<iostream>#include<algorithm>#include<string>#include<stack>#include<queue>#include<map>#include<stdio.h>#include<stdlib.h>#include<ctype.h>#inclu

综合安防管理平台LntonAIServer视频监控汇聚抖动检测算法优势

LntonAIServer视频质量诊断功能中的抖动检测是一个专门针对视频稳定性进行分析的功能。抖动通常是指视频帧之间的不必要运动,这种运动可能是由于摄像机的移动、传输中的错误或编解码问题导致的。抖动检测对于确保视频内容的平滑性和观看体验至关重要。 优势 1. 提高图像质量 - 清晰度提升:减少抖动,提高图像的清晰度和细节表现力,使得监控画面更加真实可信。 - 细节增强:在低光条件下,抖

JAVA智听未来一站式有声阅读平台听书系统小程序源码

智听未来,一站式有声阅读平台听书系统 🌟&nbsp;开篇:遇见未来,从“智听”开始 在这个快节奏的时代,你是否渴望在忙碌的间隙,找到一片属于自己的宁静角落?是否梦想着能随时随地,沉浸在知识的海洋,或是故事的奇幻世界里?今天,就让我带你一起探索“智听未来”——这一站式有声阅读平台听书系统,它正悄悄改变着我们的阅读方式,让未来触手可及! 📚&nbsp;第一站:海量资源,应有尽有 走进“智听

常用的jdk下载地址

jdk下载地址 安装方式可以看之前的博客: mac安装jdk oracle 版本:https://www.oracle.com/java/technologies/downloads/ Eclipse Temurin版本:https://adoptium.net/zh-CN/temurin/releases/ 阿里版本: github:https://github.com/

购买磨轮平衡机时应该注意什么问题和技巧

在购买磨轮平衡机时,您应该注意以下几个关键点: 平衡精度 平衡精度是衡量平衡机性能的核心指标,直接影响到不平衡量的检测与校准的准确性,从而决定磨轮的振动和噪声水平。高精度的平衡机能显著减少振动和噪声,提高磨削加工的精度。 转速范围 宽广的转速范围意味着平衡机能够处理更多种类的磨轮,适应不同的工作条件和规格要求。 振动监测能力 振动监测能力是评估平衡机性能的重要因素。通过传感器实时监

烟火目标检测数据集 7800张 烟火检测 带标注 voc yolo

一个包含7800张带标注图像的数据集,专门用于烟火目标检测,是一个非常有价值的资源,尤其对于那些致力于公共安全、事件管理和烟花表演监控等领域的人士而言。下面是对此数据集的一个详细介绍: 数据集名称:烟火目标检测数据集 数据集规模: 图片数量:7800张类别:主要包含烟火类目标,可能还包括其他相关类别,如烟火发射装置、背景等。格式:图像文件通常为JPEG或PNG格式;标注文件可能为X

缓存雪崩问题

缓存雪崩是缓存中大量key失效后当高并发到来时导致大量请求到数据库,瞬间耗尽数据库资源,导致数据库无法使用。 解决方案: 1、使用锁进行控制 2、对同一类型信息的key设置不同的过期时间 3、缓存预热 1. 什么是缓存雪崩 缓存雪崩是指在短时间内,大量缓存数据同时失效,导致所有请求直接涌向数据库,瞬间增加数据库的负载压力,可能导致数据库性能下降甚至崩溃。这种情况往往发生在缓存中大量 k

6.1.数据结构-c/c++堆详解下篇(堆排序,TopK问题)

上篇:6.1.数据结构-c/c++模拟实现堆上篇(向下,上调整算法,建堆,增删数据)-CSDN博客 本章重点 1.使用堆来完成堆排序 2.使用堆解决TopK问题 目录 一.堆排序 1.1 思路 1.2 代码 1.3 简单测试 二.TopK问题 2.1 思路(求最小): 2.2 C语言代码(手写堆) 2.3 C++代码(使用优先级队列 priority_queue)

Java ArrayList扩容机制 (源码解读)

结论:初始长度为10,若所需长度小于1.5倍原长度,则按照1.5倍扩容。若不够用则按照所需长度扩容。 一. 明确类内部重要变量含义         1:数组默认长度         2:这是一个共享的空数组实例,用于明确创建长度为0时的ArrayList ,比如通过 new ArrayList<>(0),ArrayList 内部的数组 elementData 会指向这个 EMPTY_EL