这是一个开源数据集,包含数百万篇新闻文章,主要从http://www.opensources.co/的1001个精选域名中抓取。为了更好地平衡类别,还包含了[NYTimes](https://developer.nytimes.com/)和[WebHose English News Articles](https://webhose.io/datasets)的文章。该数据集主要用于训练深度学习算法
该数据集名为Bend the Truth (Urdu Fake News),主要用于乌尔都语的假新闻检测任务。数据集包含两个主要字段:news(新闻内容,乌尔都语字符串)和label(标签,表示新闻是真实的还是虚假的)。此外,数据集还包含一个category字段,用于表示新闻的类别,包括体育、健康、技术、娱乐和商业五个类别。数据集分为训练集和测试集,训练集包含638个样本,测试集包含262个样本。