登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
tunizi
tunizi
收藏
OpenCSG
2024-07-19 更新
2026-01-19 收录
阿拉伯语情感分析
方言分类
数据链接:
https://opencsg.com/datasets/AIWizards/tunizi?tab=summary
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
TUNIZI主要用于情感分类任务,它包含使用拉丁字母书写的突尼斯阿拉伯语文本。数据集规模在1000到10000个样本之间,标注由专家生成,但数据的具体来源、标注细节、授权许可等信息缺失。
应用场景:
提供机构:
AIWizards
创建时间:
2024-07-19
相关数据集
example_mmdata_mnbvc
多模态
语音数据集
MNBVC多模态语料数据集v2.0,专注于提供多模态语料数据,包含文本、图片和音频等多种类型。数据集中每条数据都有唯一标识符,并记录了首次出现时间及扩展信息。每个数据块都标明了类别(模态),并提供文件MD5值(可选)以保证数据完整性。该数据集适用于多模态信息处理任务,并提供了图片和音频数据的读取代码示例,方便用户进行标准化数据操作。本数据集采用Apache-2.0授权许可。
OpenCSG
2024-07-19 更新
23
0
TF-ID-arxiv-papers
学术论文识别
计算机视觉
TF-ID arXiv论文数据集,专注于学术论文中表格和图形的识别任务。它包含约4600张图像,这些图像是来自Hugging Face Daily Papers的论文页面,主要涵盖人工智能/机器学习/深度学习相关主题。数据集以COCO格式提供边界框标注,这些标注由人工完成。此数据集可用于复现所有TF-ID模型,并采用MIT许可。
OpenCSG
2024-07-19 更新
16
0
aio-passages
文本处理
竞赛数据集
llm-book/aio-passages 仓库提供“AI王”竞赛使用的段落数据集,该数据集包含超过400万条样本,数据内容为文本段落,并带有id、pageid、revid、章节和标题等字段信息。数据来源于cl-tohoku/quiz-datasets,遵循CC BY-SA 3.0和GNU FDL许可协议。
OpenCSG
2024-07-19 更新
15
0
bbq
社会偏见
问答系统
BBQ仓库专注于提供用于评估问答系统中社会偏见的基准数据集。该数据集由作者构建的问题集组成,突出了针对属于受保护群体的社会偏见,涵盖了与美国英语环境相关的九个社会维度。BBQ在两种情况下评估模型响应:在信息不足的上下文中,测试响应反映社会偏见的程度;在信息充分的上下文中,测试模型的偏见是否会覆盖正确的答案选择。该数据集以JSONL格式存储,并提供All、Age、Disability_status、
OpenCSG
2025-06-25 更新
18
0
fake_news_filipino
虚假新闻检测
菲律宾语
Fake News Filipino 专注于菲律宾语的虚假新闻检测,它包含3206个由专家标注的新闻样本,真假新闻各占一半。数据来源于被Verafiles和菲律宾国家记者联盟(NUJP)标记为虚假新闻的网站以及菲律宾的主流新闻网站。该数据集支持文本分类任务,特别是在事实核查方面。数据集中包含标签和文章内容,文章内容保留了大小写和标点符号,且未纠正任何拼写错误的单词。
OpenCSG
2024-07-19 更新
15
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广