登录后查看消息通知
遇见数据集
中文在线集团股份有限公司

中文在线集团股份有限公司

企业

中文在线集团股份有限公司成立于2000年,属新闻和出版业,主营网络出版物出版。面向网络文学、自然语言处理、语音识别等领域提供数据服务,开放网文数据集(网络文学、自然语言处理)、出版物有声书(小说有声书)数据集(语音识别、语音转文本)、百度文库数据集(文档处理、内容管理),支撑知识产权分析与转化。

网络文学自然语言处理语音识别新闻出版高新技术企业
成立于 2000 年北京市https://www.4yt.net/ir@col.com

数据概览

11
数据集总量
167
总浏览量
0
关注人数
2026-04-11
最近更新
分类统计

相关机构

  • 杭
    杭州声贝软件技术有限公司
    拥有数据集:121个
    企业
  • 旗
    旗正数字科技(江苏)有限公司
    拥有数据集:111个
    企业
  • 上
    上海吉贝克信息技术有限公司
    拥有数据集:67个
    企业
  • 浙
    浙江新瑞立汽配有限公司
    拥有数据集:40个
    企业
  • 中
    中电云计算技术有限公司
    拥有数据集:38个
    企业

数据集列表

中文试题数据库
教育
试题管理
数据处理遵循合规性和结构化加工规则,采集合规各学科试题,剔除侵权、违规、低质试题,确保试题来源合法、内容规范;采用试题结构化标注算法,对试题进行全字段拆分、标注,按学段、学科、题型进行分类整理,运用难度分级算法,对试题进行难度划分,实现数据的结构化存储和多维度检索;该数据集未涉及个人数据、公共数据,无需进行匿名化、去标识化处理,数据处理活动符合相关法律法规要求。
贵州省数据知识产权登记平台2026-04-08 更新40
中文出版物图书数据集
出版物
文本处理
数据处理遵循合规性和标准化规则,采集合规中文出版物,剔除侵权、违规、低质内容,确保出版物来源合法、内容规范;采用文本提取算法,从多种格式的出版物中提取纯文本,剔除格式冗余信息,按学科领域进行分类加工,实现文本内容的标准化处理和结构化存储;该数据集未涉及个人数据、公共数据,无需进行匿名化、去标识化处理,数据处理活动符合相关法律法规规定。
贵州省数据知识产权登记平台2026-04-08 更新140
图像数据集
数据处理遵循严格的质量管控和合规性规则,采集合规无水印图片,剔除侵权、违规、低质、模糊及带水印的图片,确保图片来源合法、质量达标;采用图像分类算法,根据图片内容、场景、主题等特征进行精细化分类,运用图片质量检测算法,筛选出高清合格图片,优化图片存储格式,确保数据格式规范、调用便捷;该数据集未涉及个人数据、公共数据,无需进行匿名化、去标识化处理,数据处理活动符合相关法律法规规定。
贵州省数据知识产权登记平台2026-04-08 更新120
干音音频数据集
语音识别
音频处理
数据处理遵循严格的质量管控规则,采集合规实拍干音,剔除杂音、低质、违规音频,确保音频来源合法、质量达标;采用音频切分算法,根据说话内容逻辑、语句停顿等特征将音频切分为若干片段,运用时间戳标注算法实现毫秒级时序对齐,结合说话人识别规则标注不同说话人信息,最终生成Srt格式标注文件;该数据集未涉及个人隐私数据、公共数据,无需进行匿名化、去标识化处理,数据处理活动符合相关法律法规要求。
贵州省数据知识产权登记平台2026-04-08 更新60
15000小时短视频数据集
短视频
多模态学习
数据规格 总时长15000 小时,单条视频10–30 秒,分辨率、帧率、编码规范统一,便于批量训练。 文本标注规则 每条视频对应精准文本描述,涵盖场景、主体、动作、氛围、逻辑等语义信息,标注清晰无歧义。 清洗与质控规则 经过去重、去模糊、去水印、去违规内容、去低质片段,数据纯净度高、可用性强。 算法适配 天然适配CLIP、BLIP、LVM、文生视频模型、多模态因果建模、对比学习、掩码建模等主流训练范式。
贵州省数据知识产权登记平台2026-04-01 更新70
中文期刊数据集
中文期刊
学术文献
数据处理遵循合规性和学术规范规则,采集合规中文期刊,剔除侵权、违规、低质及非学术类期刊内容,确保期刊来源合法、内容规范;采用文本清洗算法,剔除期刊中的格式冗余、无关信息,按学科门类进行分类加工,对学术文本进行结构化处理,实现数据的标准化存储;该数据集未涉及个人数据、公共数据,无需进行匿名化、去标识化处理,数据处理活动符合相关法律法规要求。
贵州省数据知识产权登记平台2026-04-08 更新110
外文试题数据库
教育数据
多语种试题
数据处理遵循合规性和结构化加工规则,采集合规多语种试题,剔除侵权、违规、低质试题,确保试题来源合法、内容规范;采用试题结构化处理算法,对试题进行字段拆分、标注,按语种、学段、题型、学科进行分类整理,运用解析关联算法,将试题与对应解析精准匹配,实现数据的结构化存储;该数据集未涉及个人数据、公共数据,无需进行匿名化、去标识化处理,数据处理活动符合相关法律法规要求。
贵州省数据知识产权登记平台2026-04-08 更新40
视频数据集
视频分类
数据处理
数据处理遵循合规性和质量管控双重规则,采集合规实拍视频,严格剔除侵权、违规、低质、带水印及含字幕的视频,确保视频来源合法、质量达标;采用视频分类算法,根据视频内容特征、场景类型进行精细化分类,运用元数据标注规则,为每段视频匹配对应的标签关键词和短描述,生成Excel格式元数据文件;该数据集未涉及个人数据、公共数据,无需进行匿名化、去标识化处理,所有数据处理活动均符合相关法律法规要求。
贵州省数据知识产权登记平台2026-04-08 更新50
百度文库数据集
文档处理
内容管理
数据处理遵循合规性原则,对百度文库中的文档进行合规采集,严格剔除违规、低俗、侵权及低质内容,确保数据来源合法合规;采用分类加工规则,按文档类型、使用场景进行精细化分类,运用格式转换算法将不同原始格式的文档统一处理为word、json标准格式,确保数据格式规范、内容统一;该数据集未涉及个人数据、公共数据,无需进行匿名化、去标识化等额外处理,所有数据处理活动均符合相关法律法规规定。
贵州省数据知识产权登记平台2026-04-08 更新200
出版物有声书(小说有声书)数据集
语音识别
语音转文本
数据规模与规格 总时长20 万小时,以有声书、有声小说为主,音频 + 文本逐段对齐,格式规范统一。 文本对齐规则 文本与音频内容高度一致、无错漏、无乱码,支持句级别 / 段级别对齐,适配序列建模。 清洗与质控规则 经过去噪、去静音、去重、去低质录音、去违规内容处理,音频清晰、文本准确。 算法适配 天然支持自监督语音预训练、ASR 端到端训练、TTS 建模、语音–文本跨模态对齐、对比学习等主流训练框架与算法。
贵州省数据知识产权登记平台2026-03-12 更新230
关于我们
遇见数据集——让每个数据集都被发现,让每一次遇见都有价值。
数发科官网www.sfktec.com
联系我们
selectdataset@iotsh.com.cn
商业合作
数据驱动未来,携手共赢发展
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15沪公网安备31010402336585号
热门搜索