thunlp / Chinese_Rumor_Dataset

中文谣言数据
687 stars 137 forks source link
dataset rumor social-computation

中文谣言数据

该数据为从新浪微博不实信息举报平台抓取的中文谣言数据,分为两个部分。其中当前目录下的数据集仅包含谣言原微博,不包含转发/评论信息;而CED_Dataset中是包含转发/评论信息的中文谣言数据集。

数据集介绍

第一部分数据集(./rumors_v170613.json)共包含从2009年9月4日至2017年6月12日的31669条谣言。文件中,每一行为一条json格式的谣言数据,字段释义如下:

引用

如果您使用该数据集,请引用以下论文:

    @article{liu2015rumors,
      title={中文社交媒体谣言统计语义分析},
      author={刘知远 and 张乐 and 涂存超 and 孙茂松},
      journal={中国科学: 信息科学},
      volume={12},
      pages={1536--1546},
      year={2015}
    }
    @article{liu2015rumors,
      title={Statistical and semantic analysis of rumors in Chinese social media},
      author={Liu, Zhiyuan and Zhang, Le and Tu, Cunchao and Sun, Maosong},
      journal={Scientia Sinica Informationis},
      volume={45},
      number={12},
      pages={1536},
      year={2015}
    }

第二部分数据集(CED_Dataset)包含与微博原文相关的转发与评论信息,数据集中共包含谣言1538条和非谣言1849条。该数据集分为微博原文与其转发/评论内容。其中所有微博原文(包含谣言与非谣言)在original-microblog文件夹中,剩余两个文件夹non-rumor-repost和rumor-repost分别包含非谣言原文与谣言原文的对应的转发与评论信息。(该数据集中并不区分评论与转发)该数据文件中,每条原文,评论或评论均为json格式的数据,部分字段释义如下:

引用

如果您使用该数据集,请引用以下论文:

@article{song2018ced,
  title={CED: Credible Early Detection of Social Media Rumors},
  author={Song, Changhe and Tu, Cunchao and Yang, Cheng and Liu, Zhiyuan and Sun, Maosong},
  journal={arXiv preprint arXiv:1811.04175},
  year={2018}
}