谣言检测数据集

2024-03-10 03:40
文章标签 数据 检测 谣言

本文主要是介绍谣言检测数据集,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

下面的数据集链接,大家如果打不开的话,建议打开VPN,上外网下载哦!

1 PHEME-R 

这是一个在PHEME FP7项目的新闻学用例中收集和注释的数据集。这些谣言与9个不同的突发新闻相关。它是为分析社交媒体谣言而创建的,包含由谣言推文发起的推特对话;对话包括对这些谣言推文的回应推文。这些推文已经被注解为支持度、确定性和证据性。

该数据集包含330个对话线程(297个英语,33个德语),每个线程都有一个文件夹。

年份:2016

下载链接: PHEME rumour scheme dataset: journalism use case

2 PHEME dataset

        这个数据集包含了突发新闻期间发布的Twitter谣言和非谣言的集合

        该数据的结构如下。每个事件都有一个目录,有两个子文件夹,谣言和非谣言。这两个文件夹有以推特ID命名的文件夹。推文本身可以在相关推文的'源推文'目录中找到,而'反应'目录中有回应该源推文的一组推文。同时,每个文件夹都包含'annotation.json',它包含关于谣言的真实性的信息,以及'structure.json',它包含关于对话结构的信息

        该数据集是PHEME谣言和非谣言数据集的延伸(https://figshare.com/articles/PHEME_dataset_of_rumours_and_non-rumours/4010619),它包含了与9个事件相关的谣言,每个谣言都被标注了其真实性值,即真、假或未验证。

        时间: 2018年

        这个数据集被用在论文“All-in-one: Multi-task Learning for Rumour Verification"。更多细节,请参考该论文。

Ma-Twitter

        Twitter.txt:这个语料库总共包含992个有标签的事件。每一行都包含一个事件和相关推文的ID:event_id, label, tweet_ids。对于标签,如果该事件是一个谣言,其值为1,否则为0。请注意,由于Twitter数据的使用条款,我们不能公布推文的具体内容。用户可以通过Twitter的API自己下载这些内容。

        Twitter_event_claims.txt:这个文件提供了每个事件的主要声明内容。每一行都包含一个事件,其声明由event_id和声明内容组成。在这个文件中,只包括我们自己从Snopes.com上收集的事件的声明,而标为 "未知 "的声明则是从两篇论文中构建的其他数据集(为了平衡我们的类别分布)借来的。

4 Ma-Weibo

        微博数据(weibo.txt)。这个语料库总共包含4664个有标签的事件。每一行都包含一个事件和相关帖子的ID,格式为:event_id, label, post_ids。对于标签,如果该事件是一个谣言,其值为1,否则为0。我们还以json格式发布所有帖子的内容,这些内容被保存在./Weibo目录下,每个文件被命名为event_id.json,对应于单个事件。

        下载链接:https://www.dropbox.com/s/46r50ctrfa0ur1o/rumdect.zip?dl=0

        需要注意的是,我们并没有为每个微博事件明确地产生声明,因为我们直接从新浪社区管理中心收集事件的传播线程,每个事件的源帖(第一篇)可以被视为主要的声明。

5 Twitter 15 和 Twitter 16

        两个公开可用的推特数据集。

下载链接:https://www.dropbox.com/s/7ewzdrbelpmrnxu/rumdetect2017.zip?dl=0

介绍:在本文中,我们试图根据微博帖子的传播结构来解决从微博帖子中识别谣言 (即虚假信息) 的问题。我们首先使用传播树对微博帖子的传播进行建模,这些传播树为原始消息的传播和发展提供了有价值的线索

论文链接:Detect Rumors in Microblog Posts Using Propagation Structure via Kernel Learning

6 BuzzFeedNews

下载链接:https://github.com/BuzzFeedNews/2016-10-facebook-fact-check

你可以在这里找到所有帖子、事实核查评分和 Facebook 参与度数据的电子表格。收集和评价页面的方法可以在主文章的开头和结尾。
Facebook 的参与数据是从2016年10月11日的 Facebook API 中获得的。

论文:"Hyperpartisan Facebook Pages Are Publishing False And Misleading Information At An Alarming Rate,"

数据集格式:

SemEval19-2019年 - text/user info/time stamp/ propagation info

论文链接:SemEval-2019 Task 7: RumourEval, Determining Rumour Veracity and Support for Rumours - ACL Anthology

        提供了一个可疑帖子和随后在社交媒体中进行对话的数据集,并注释了立场和准确性。社交媒体的谣言源于各种突发新闻,数据集被扩展到包括Reddit以及新的Twitter帖子。

下载链接:RumourEval 2019 data

Task A (SDQC)

        与预测谣言真实性的目标有关,第一个子任务将处理跟踪其他来源如何适应谣言故事准确性的补充目标。分析周围话语的关键步骤是确定社交媒体中的其他用户如何看待谣言。我们建议通过查看对提出谣言声明的帖子 (即原始谣言 (来源) 帖子) 的答复来解决这一分析。我们将为参与者提供由回复原始谣言帖子的帖子组成的树状对话,每个帖子都针对谣言提供自己的支持。我们以支持,拒绝,查询或评论 (SDQC) 声明的方式来构建此框架。因此,我们引入了一个子任务,其目标是标记给定语句 (谣言帖子) 和回复帖子 (后者可以是直接或嵌套回复) 之间的交互类型。树状结构线程中的每个推文都必须分为以下四个类别之一:

        支持: 回应的作者支持他们回应的谣言的真实性;

        否认: 回应的作者否认他们回应的谣言的真实性;

        查询: 答复的作者要求提供与他们所回应的谣言的真实性有关的其他证据;

        评论: 回应的作者发表了自己的评论,但没有对评估他们所回应的谣言的真实性做出明确的贡献。

任务 B (验证)

        第二个子任务的目标是预测给定谣言的准确性。该谣言以事后报告或质疑的形式提出,但在发布时被认为没有根据。鉴于这样的主张以及提供的一组其他资源,系统应返回一个标签,该标签将谣言的预期真实性描述为真或假。这项任务的基本事实是由团队的记者和专家成员手动确定的,他们确定官方声明或其他可信赖的证据来源,以解决给定谣言的真实性。将提供其他上下文作为准确性预测系统的输入; 此上下文将包括在谣言报道之前立即检索到的相关来源的快照,包括相关Wikipedia文章的快照,Wikipedia转储,从NewsDiffs检索到的数字新闻媒体的新闻文章,以及同一事件的先前推文。至关重要的是,不得使用包含谣言解决后信息的外部资源。为了控制这一点,我们将指定参与者可能使用的外部信息的精确版本。这对于确保我们将时间敏感性引入准确性预测任务很重要。我们采取一种简单的方法来完成这项任务,只对谣言使用正确/错误的标签。然而,实际上,许多说法很难核实; 例如,有许多关于弗拉基米尔·普京 (Vladimir Putin) 在2015年的活动的谣言,许多谣言完全没有根据。因此,我们还期望系统对每个谣言返回0-1范围内的置信度值; 如果谣言不可验证,则应返回0的置信度。

这篇关于谣言检测数据集的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/792915

相关文章

大模型研发全揭秘:客服工单数据标注的完整攻略

在人工智能(AI)领域,数据标注是模型训练过程中至关重要的一步。无论你是新手还是有经验的从业者,掌握数据标注的技术细节和常见问题的解决方案都能为你的AI项目增添不少价值。在电信运营商的客服系统中,工单数据是客户问题和解决方案的重要记录。通过对这些工单数据进行有效标注,不仅能够帮助提升客服自动化系统的智能化水平,还能优化客户服务流程,提高客户满意度。本文将详细介绍如何在电信运营商客服工单的背景下进行

基于MySQL Binlog的Elasticsearch数据同步实践

一、为什么要做 随着马蜂窝的逐渐发展,我们的业务数据越来越多,单纯使用 MySQL 已经不能满足我们的数据查询需求,例如对于商品、订单等数据的多维度检索。 使用 Elasticsearch 存储业务数据可以很好的解决我们业务中的搜索需求。而数据进行异构存储后,随之而来的就是数据同步的问题。 二、现有方法及问题 对于数据同步,我们目前的解决方案是建立数据中间表。把需要检索的业务数据,统一放到一张M

关于数据埋点,你需要了解这些基本知识

产品汪每天都在和数据打交道,你知道数据来自哪里吗? 移动app端内的用户行为数据大多来自埋点,了解一些埋点知识,能和数据分析师、技术侃大山,参与到前期的数据采集,更重要是让最终的埋点数据能为我所用,否则可怜巴巴等上几个月是常有的事。   埋点类型 根据埋点方式,可以区分为: 手动埋点半自动埋点全自动埋点 秉承“任何事物都有两面性”的道理:自动程度高的,能解决通用统计,便于统一化管理,但个性化定

使用SecondaryNameNode恢复NameNode的数据

1)需求: NameNode进程挂了并且存储的数据也丢失了,如何恢复NameNode 此种方式恢复的数据可能存在小部分数据的丢失。 2)故障模拟 (1)kill -9 NameNode进程 [lytfly@hadoop102 current]$ kill -9 19886 (2)删除NameNode存储的数据(/opt/module/hadoop-3.1.4/data/tmp/dfs/na

异构存储(冷热数据分离)

异构存储主要解决不同的数据,存储在不同类型的硬盘中,达到最佳性能的问题。 异构存储Shell操作 (1)查看当前有哪些存储策略可以用 [lytfly@hadoop102 hadoop-3.1.4]$ hdfs storagepolicies -listPolicies (2)为指定路径(数据存储目录)设置指定的存储策略 hdfs storagepolicies -setStoragePo

Hadoop集群数据均衡之磁盘间数据均衡

生产环境,由于硬盘空间不足,往往需要增加一块硬盘。刚加载的硬盘没有数据时,可以执行磁盘数据均衡命令。(Hadoop3.x新特性) plan后面带的节点的名字必须是已经存在的,并且是需要均衡的节点。 如果节点不存在,会报如下错误: 如果节点只有一个硬盘的话,不会创建均衡计划: (1)生成均衡计划 hdfs diskbalancer -plan hadoop102 (2)执行均衡计划 hd

综合安防管理平台LntonAIServer视频监控汇聚抖动检测算法优势

LntonAIServer视频质量诊断功能中的抖动检测是一个专门针对视频稳定性进行分析的功能。抖动通常是指视频帧之间的不必要运动,这种运动可能是由于摄像机的移动、传输中的错误或编解码问题导致的。抖动检测对于确保视频内容的平滑性和观看体验至关重要。 优势 1. 提高图像质量 - 清晰度提升:减少抖动,提高图像的清晰度和细节表现力,使得监控画面更加真实可信。 - 细节增强:在低光条件下,抖

【Prometheus】PromQL向量匹配实现不同标签的向量数据进行运算

✨✨ 欢迎大家来到景天科技苑✨✨ 🎈🎈 养成好习惯,先赞后看哦~🎈🎈 🏆 作者简介:景天科技苑 🏆《头衔》:大厂架构师,华为云开发者社区专家博主,阿里云开发者社区专家博主,CSDN全栈领域优质创作者,掘金优秀博主,51CTO博客专家等。 🏆《博客》:Python全栈,前后端开发,小程序开发,人工智能,js逆向,App逆向,网络系统安全,数据分析,Django,fastapi

烟火目标检测数据集 7800张 烟火检测 带标注 voc yolo

一个包含7800张带标注图像的数据集,专门用于烟火目标检测,是一个非常有价值的资源,尤其对于那些致力于公共安全、事件管理和烟花表演监控等领域的人士而言。下面是对此数据集的一个详细介绍: 数据集名称:烟火目标检测数据集 数据集规模: 图片数量:7800张类别:主要包含烟火类目标,可能还包括其他相关类别,如烟火发射装置、背景等。格式:图像文件通常为JPEG或PNG格式;标注文件可能为X

pandas数据过滤

Pandas 数据过滤方法 Pandas 提供了多种方法来过滤数据,可以根据不同的条件进行筛选。以下是一些常见的 Pandas 数据过滤方法,结合实例进行讲解,希望能帮你快速理解。 1. 基于条件筛选行 可以使用布尔索引来根据条件过滤行。 import pandas as pd# 创建示例数据data = {'Name': ['Alice', 'Bob', 'Charlie', 'Dav