登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Small talk : Intent Classification data
Small talk : Intent Classification data
收藏
kaggle
2022-09-15 更新
2024-03-07 收录
意图分类
自然语言处理
数据链接:
https://www.kaggle.com/datasets/salmanfaroz/small-talk-intent-classification-data
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Utterance and Intent
话语(Utterance)与意图(Intent)
应用场景:
创建时间:
2022-09-13
相关数据集
cowWhySo/reddit_top_comments
社交媒体广告
自然语言处理
该数据集包含了从2005年到2022年期间,从Reddit平台上选取的多个热门子版块(如AskReddit、worldnews等)的帖子及其最高赞评论。每个数据条目包括帖子标题(title)、帖子正文(selftext)、最高赞评论(top_comment)和所属子版块(subreddit)。数据集经过筛选,仅包含至少有一个赞的评论。数据集涵盖了多个非NSFW的子版块,但可能包含一些NSFW语言。
Hugging Face
2024-06-20 更新
10
0
iambestfeed/wiki-text-subset
自然语言处理
文本分析
--- dataset_info: features: - name: text dtype: string splits: - name: test num_bytes: 1305088 num_examples: 4358 - name: train num_bytes: 5464857.797949871 num_examples:
Hugging Face
2024-04-29 更新
8
0
MasonMac/WildChat-4.8M-EN-Semantic-Deduplicated
自然语言处理
文本去重
这是一个由去重后的英文提示组成的集合,提示长度小于2000个token。经过验证至少80%的提示由英文字母组成后移除非英文提示,使用HashSet和MinHash进行去重,并使用Qwen3-8B-Embedding生成嵌入进行聚类,只保留与质心最远的提示。数据集提供了四个不同的相似度阈值下的聚类结果:0.7、0.75、0.8和0.9。
Hugging Face
2025-08-23 更新
8
0
AIGym/code-pretraining-8196
代码学习
自然语言处理
这是一个包含文本数据的训练集,共有1632309个文本样本,数据集大小为3.58GB,下载大小为1.67GB。
Hugging Face
2025-09-19 更新
8
0
AmanPriyanshu/stratified-kmeans-diverse-pretraining-100K-1M
自然语言处理
机器学习预训练
这是一个精心平衡的子集,结合了FineWeb-Edu和Proof-Pile-2,使用基于嵌入的k-means采样,以确保在多个尺度上的教育和数学/科学内容的多样性和代表性。数据集以50k、100k、250k、500k和1M的规模提供,包括教育、科学、数学和代码内容。
Hugging Face
2025-10-04 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广