登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
BBC Articles Dataset with Extra Features
BBC Articles Dataset with Extra Features
收藏
kaggle
2026-03-18 更新
2024-10-26 收录
新闻分类
自然语言处理
数据链接:
https://www.kaggle.com/datasets/jacopoferretti/bbc-articles-dataset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Classify BBC NEWS articles
对BBC新闻文章进行分类
应用场景:
创建时间:
2024-10-11
搜集汇总
背景与挑战
背景概述
该数据集是一个用于新闻文章分类的BBC新闻文章数据集,包含额外特征,旨在支持对BBC新闻内容进行分类分析。
以上内容由遇见数据集搜集并总结生成
相关数据集
Pinyin to Character Conversion Dataset
自然语言处理
拼音转汉字
该数据集是为了拼音转汉字任务(P2C)而创建的,它包含了从主要中文新闻网站收集的文章。此外,数据集还整合了“常用词汇”和“网络词汇”等外部词库,以提升转换性能。其规模包括260万篇训练文章和1000篇测试文章,专门用于拼音转汉字的任务。
arXiv
31
0
davanstrien/similarity-dataset-sc2-8b
自然语言处理
机器学习
--- language: - en size_categories: n<1K dataset_info: features: - name: anchor dtype: string - name: positive dtype: string - name: negative dtype: string splits: - name: trai
Hugging Face
2024-05-30 更新
22
0
avemio/German-RAG-DPO-ShareGPT-HESSIAN-AI
自然语言处理
多语言问答系统
这是一个专门为细调语言模型而设计的德语RAG任务数据集,使用合成增强的德语维基百科数据构建。数据集包含多个子任务,每个子任务都针对不同的训练目标,例如提取式问答、考虑时间差异的问答、带有多个引用的问答等。数据集以问题-答案节点和相关/无关上下文节点的形式构建训练知识图。
Hugging Face
2025-02-06 更新
8
0
Korpus Malti v4.0
马耳他语
自然语言处理
Korpus Malti v4.0是由马耳他大学创建的一个新的马耳他语文本数据集,包含了约20758071条数据,数据来源于多种在线和离线资源,如新闻、法律文本、演讲和辩论的转录等。该数据集旨在为马耳他语这种低资源语言提供丰富的预训练数据,以支持自然语言处理任务,如依赖解析、词性标注、命名实体识别和情感分析。数据集的创建过程中,特别注意了数据的质量和多样性,以确保其在不同领域的应用效果。
arXiv
2022-05-27 更新
24
0
WritingPrompts-Filtered
自然语言处理
文本数据清洗
这个数据集包含了从Reddit上过滤和去污染的WritingPrompts,专门处理以移除与LitBench测试集的重叠内容,确保了用于语言模型训练的数据清洁且无测试集污染。
Hugging Face
2025-09-13 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广