VLDB-2020 论文简析:检测和预防众包数据中的混淆标签-Detecting and Preventing Confused Labels in Crowdsourced Data

本文主要是介绍VLDB-2020 论文简析:检测和预防众包数据中的混淆标签-Detecting and Preventing Confused Labels in Crowdsourced Data,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

VLDB2020论文简析:检测和预防众包数据中的混淆标签-Detecting and Preventing Confused Labels in Crowdsourced Data

    • 研究背景
    • 研究目标
    • 问题挑战
    • 作者贡献
    • 总体模型
    • 1 真值发现器的生成模型
    • 2 检测混淆观测的推理算法(MCMC-C)
    • 3 基于MV的贪婪算法
    • 数据集
    • 实验分析
    • 困惑/思考

研究背景

  • 如今,众包通常用于解决类似AI相关的问题,例如对象分类以及为机器学习(ML)算法生成带标签的训练数据。
  • 因为观察的混淆,或者是因为两个对象是相似的,或者因为任务描述解释的差异,众包工作者可能将i类的对象与j类的对象混淆,导致众包工作者标记的数据可能且通常会带有偏差或噪声。
    例如:如下图所示,摩纳哥国旗、波兰国旗和印度尼西亚国旗,红薯和山药,演员Rami Said Malek和皇后乐队主唱Freddie Mercury,通常是因为它们是相似的,导致在众包任务中工作人员出现观察混淆,从而辨别错误。
    在这里插入图片描述
    正如上述例子展示的那样,即使整体工作人员的准确性都非常高,但这些错误在不被注意的情况下,也很可能出现混淆,因为这不是一个全面的问题,只针对某些类。如果不被发现和未纠正,这导致一些类的标签总是错误的。

研究目标

  • (从任务设计者的角度)在标识给出类标签并清晰的地方识别任务标签中的混淆。例如:在用旗帜或食物或著名演员的名字来标记图片的任务中识别混淆。
  • 在众包过程的早期发现混乱(即在少数投票之后),这样就可以尽早提醒任务设计者并改进任务;
  • 能够处理众包标签,以检测和纠正混淆标签。

问题挑战

针对上述情况,对象分类任务中混淆错误的真值发现问题的解决具有以下困难挑战:

  • ① 一个能检测混淆错误的真值发现模型
    需要扩展现有的真值发现模型,使其能够对可能的混淆错误进行建模和推理,但是没有任何现有真相发现模型的解决方案能够做到这一点。
  • ② 需要指定源和对象之间的所有概率依赖关系
  • ③ 计算上的时间、空间复杂度考虑
    为了检测和考虑混淆错误,需要测试所有可能的混淆,并查看其中哪些可能存在混淆。这是一个计算上昂贵的操作,它需要搜索指数数量的状态可能性(Nc个可能的混淆观察有2^Nc个状态)。
  • ④ 研究针对的是在一组可能被混淆的类中的情况。
    必须从数据中学习模型参数的数量和类型并且能够在工人、物品和标签的数量上进行缩放,才能有效地做到这一点。

作者贡献

  • 问题建模为一个分类任务,并引入了“聚类”( 生成的聚类就是假设的互相混淆的对象组)的概念,通过显式建模混淆来扩展这个基本模型。然后

这篇关于VLDB-2020 论文简析:检测和预防众包数据中的混淆标签-Detecting and Preventing Confused Labels in Crowdsourced Data的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/358951

相关文章

MySQL InnoDB引擎ibdata文件损坏/删除后使用frm和ibd文件恢复数据

《MySQLInnoDB引擎ibdata文件损坏/删除后使用frm和ibd文件恢复数据》mysql的ibdata文件被误删、被恶意修改,没有从库和备份数据的情况下的数据恢复,不能保证数据库所有表数据... 参考:mysql Innodb表空间卸载、迁移、装载的使用方法注意!此方法只适用于innodb_fi

mysql通过frm和ibd文件恢复表_mysql5.7根据.frm和.ibd文件恢复表结构和数据

《mysql通过frm和ibd文件恢复表_mysql5.7根据.frm和.ibd文件恢复表结构和数据》文章主要介绍了如何从.frm和.ibd文件恢复MySQLInnoDB表结构和数据,需要的朋友可以参... 目录一、恢复表结构二、恢复表数据补充方法一、恢复表结构(从 .frm 文件)方法 1:使用 mysq

mysql8.0无备份通过idb文件恢复数据的方法、idb文件修复和tablespace id不一致处理

《mysql8.0无备份通过idb文件恢复数据的方法、idb文件修复和tablespaceid不一致处理》文章描述了公司服务器断电后数据库故障的过程,作者通过查看错误日志、重新初始化数据目录、恢复备... 周末突然接到一位一年多没联系的妹妹打来电话,“刘哥,快来救救我”,我脑海瞬间冒出妙瓦底,电信火苲马扁.

golang获取prometheus数据(prometheus/client_golang包)

《golang获取prometheus数据(prometheus/client_golang包)》本文主要介绍了使用Go语言的prometheus/client_golang包来获取Prometheu... 目录1. 创建链接1.1 语法1.2 完整示例2. 简单查询2.1 语法2.2 完整示例3. 范围值

javaScript在表单提交时获取表单数据的示例代码

《javaScript在表单提交时获取表单数据的示例代码》本文介绍了五种在JavaScript中获取表单数据的方法:使用FormData对象、手动提取表单数据、使用querySelector获取单个字... 方法 1:使用 FormData 对象FormData 是一个方便的内置对象,用于获取表单中的键值

HTML5中下拉框<select>标签的属性和样式详解

《HTML5中下拉框<select>标签的属性和样式详解》在HTML5中,下拉框(select标签)作为表单的重要组成部分,为用户提供了一个从预定义选项中选择值的方式,本文将深入探讨select标签的... 在html5中,下拉框(<select>标签)作为表单的重要组成部分,为用户提供了一个从预定义选项中

Rust中的BoxT之堆上的数据与递归类型详解

《Rust中的BoxT之堆上的数据与递归类型详解》本文介绍了Rust中的BoxT类型,包括其在堆与栈之间的内存分配,性能优势,以及如何利用BoxT来实现递归类型和处理大小未知类型,通过BoxT,Rus... 目录1. Box<T> 的基础知识1.1 堆与栈的分工1.2 性能优势2.1 递归类型的问题2.2

Python使用Pandas对比两列数据取最大值的五种方法

《Python使用Pandas对比两列数据取最大值的五种方法》本文主要介绍使用Pandas对比两列数据取最大值的五种方法,包括使用max方法、apply方法结合lambda函数、函数、clip方法、w... 目录引言一、使用max方法二、使用apply方法结合lambda函数三、使用np.maximum函数

Python如何实现PDF隐私信息检测

《Python如何实现PDF隐私信息检测》随着越来越多的个人信息以电子形式存储和传输,确保这些信息的安全至关重要,本文将介绍如何使用Python检测PDF文件中的隐私信息,需要的可以参考下... 目录项目背景技术栈代码解析功能说明运行结php果在当今,数据隐私保护变得尤为重要。随着越来越多的个人信息以电子形

Redis的数据过期策略和数据淘汰策略

《Redis的数据过期策略和数据淘汰策略》本文主要介绍了Redis的数据过期策略和数据淘汰策略,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录一、数据过期策略1、惰性删除2、定期删除二、数据淘汰策略1、数据淘汰策略概念2、8种数据淘汰策略