登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Twitter Data Over 1.5 Million For NLP
Twitter Data Over 1.5 Million For NLP
收藏
kaggle
2023-04-30 更新
2024-03-08 收录
自然语言处理
社交媒体数据
数据链接:
https://www.kaggle.com/datasets/sourabhkumarsantra/twitter-data-over-15-million-for-nlp
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
You can use this dataset for various jobs (Ex:-Intent Classification)
应用场景:
创建时间:
2023-04-30
相关数据集
vwxyzjn/openhermes-dev__mistralai_Mixtral-8x7B-Instruct-v0.1__1707245027
机器学习
自然语言处理
--- dataset_info: features: - name: system_prompt dtype: string - name: model dtype: string - name: avatarUrl dtype: string - name: conversations list: - name: from
Hugging Face
2024-02-07 更新
8
0
SanjanaPedada/SanjanaPedada
自然语言处理
机器学习
--- dataset_info: features: - name: input sequence: string - name: output sequence: string - name: input_ids sequence: int32 - name: attention_mask sequence: int8 splits:
Hugging Face
2024-03-17 更新
6
0
The datasets and the machine learning models used in the literature to develop question classifiers.
问题分类
自然语言处理
The datasets and the machine learning models used in the literature to develop question classifiers.
NIAID Data Ecosystem
0
0
lingvenvist/bxr-animacy-test-data-no-postproc_output.csv
生命性识别
自然语言处理
--- dataset_info: features: - name: sentences dtype: string - name: tokens sequence: string - name: anim_tags sequence: class_label: names: '0': N
Hugging Face
2024-05-25 更新
7
0
kgrabko/JiRackDatasetWikipediaEn
自然语言处理
银行风控建模
该数据集专为JiRack分词器格式化,用于训练JiRack Base 1.5B模型。建议初始化模型时使用4K上下文窗口以确保稳定性,随后通过专门的JiRack 8K数据集扩展到8K上下文,这种两阶段方法在扩展模型长距离依赖之前确保稳健的位置编码。数据集针对银行和金融科技机构设计,用于构建安全、内部的模型,支持端到端解决方案,以预训练模型用于欺诈预防、垃圾邮件过滤、风险评估和反洗钱检测。这是基础检查
Hugging Face
2026-05-05 更新
0
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广