登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Urdu Data Set
Urdu Data Set
收藏
kaggle
2026-06-14 更新
2024-03-08 收录
自然语言处理
毒性分析
数据链接:
https://www.kaggle.com/datasets/lucca9211/urdu-data-set
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Roman Urdu DataSet with toxicity in language
包含语言毒性内容的罗马乌尔都语数据集
应用场景:
创建时间:
2020-05-14
相关数据集
Bengali Language Fake news
虚假新闻识别
自然语言处理
"Bengali and English Languages Fake-news Identification"
kaggle
2024-12-13 更新
12
0
Dawnnn0429/MathInstruct-PoT-NumGLUE
数学教育
自然语言处理
该数据集包含三个字段:来源(source),指令(instruction)和输出(output),均为文本格式。数据集分为训练集和测试集两部分,其中训练集包含12126个示例,测试集包含1348个示例。数据集主要用于某种文本生成或处理任务,具体应用场景需结合字段内容和数据集划分进一步分析。
Hugging Face
2025-11-12 更新
10
0
line.10.9.10.10000
文本生成
自然语言处理
该数据集包含输入文本(input_text)和目标文本(target_text)两个字段,适用于研究文本生成任务。数据集分为训练集和验证集,其中训练集有10000个样本,验证集有1024个样本。数据集用于支持论文《Roll the dice & look before you leap: Going beyond the creative limits of next-token predicti
Hugging Face
2025-05-27 更新
9
0
lman63/munir2
自然语言处理
对话系统
这是一个包含指令、输入和响应字段的数据集,适用于训练和测试机器学习模型。数据集分为训练集和测试集,其中训练集有4个样本,测试集有1个样本。
Hugging Face
2025-02-09 更新
11
0
AY2324S2-CS4248-Team-47/gec-dpo-ultrafeedback
自然语言处理
文本选择
--- dataset_info: features: - name: chosen dtype: string - name: prompt dtype: string - name: rejected dtype: string splits: - name: train num_bytes: 5625717 num_exampl
Hugging Face
2024-04-16 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广