登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
BAAI-WuDaoCorporaText文本预训练数据集
BAAI-WuDaoCorporaText文本预训练数据集
收藏
智源
2023-10-18 更新
2025-04-26 收录
文本预训练
大模型
数据链接:
https://data.baai.ac.cn/datadetail/WuDaoCorporaText
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
WuDaoCorpora是北京智源人工智能研究院(智源研究院)构建的大规模、高质量数据集,用于支撑大模型训练研究
应用场景:
提供机构:
智源研究院
创建时间:
2022-05-27
相关数据集
BirdsData手工标注自然声音标准大数据集
自然声音检测
目标检测
该birdsdata自然声音检测数据集主要针对自然界采集声音类别的检测问题,并为目标检测研究提供多样化、实用性的基准
智源
2023-10-18 更新
85
0
SeniorTalk
老年人语音
语音特征分析
老年人声音数据集
智源
2025-05-22 更新
22
0
安全帽未佩戴行为目标检测赛道数据集
目标检测
电力安全
国网电力和智源研究院推出的电力施工安全帽检测数据集
智源
2023-10-18 更新
16
0
U-RISC神经元识别大赛数据集
神经元识别
电镜技术
比赛的数据为电镜扫描的视网膜图片
智源
2023-10-18 更新
23
0
高质量pdf大纲分段文本预训练数据
自然语言处理
文本预训练
**OutlineSeg 数据集**OutlineSeg 数据集是一个高质量的预训练数据集,专门用于从PDF文档中提取和分段文本。数据集通过利用文档中的目录大纲,将长篇内容切分为合适的段落,以确保每段文本既有完整的语义,又能在模型训练过程中被充分利用。该数据集的主要特点包括:1. **基于大纲的分段**:利用PDF文档的目录大纲,对内容进行逻辑分段。这种方法确保了每段文本都具有结构化的上下文,适合
魔搭社区
2026-07-13 更新
21
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广