登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
MiniLM-L6-cos-v1
MiniLM-L6-cos-v1
收藏
kaggle
2022-02-18 更新
2024-03-08 收录
自然语言处理
句子相似度
数据链接:
https://www.kaggle.com/datasets/ghermanb/minilm-l6-cos-v1
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
MiniLM for sentence similarity
用于句子相似度任务的MiniLM
应用场景:
创建时间:
2022-02-18
相关数据集
WildEval/WildBench-Results-v2-internal
自然语言处理
模型评估
该数据集包含多个不同配置的对话模型生成的数据,每个配置的数据集包含了会话ID、聊天历史、模型输入、输出、生成器、配置参数、数据集来源和主要标签等特征。数据集主要用于训练对话模型,每个配置的训练集包含2997个样本,数据大小和下载大小因配置不同而有所差异。
Hugging Face
2024-05-21 更新
22
0
yiyic/CulturaX_pa_train
自然语言处理
文本分析
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 5215523686 num_examples: 645987 download_size: 1995087048 dataset_size: 5215523686 confi
Hugging Face
2024-05-16 更新
7
0
FineWeb-Tokenized
自然语言处理
文本数据
这是一个经过预标记的`input_ids`数据集,基于HuggingFace的FineWeb语料库。该数据集使用自定义标记器进行预标记,以优化性能。它适用于预训练、微调或语言模型研究,基于高质量、去重和过滤的网页数据集FineWeb。
Hugging Face
2025-07-27 更新
5
0
Saibo-creator/bookcorpus_compact_1024_shard7_of_10_meta
自然语言处理
文本分析
--- dataset_info: features: - name: text dtype: string - name: concept_with_offset dtype: string - name: cid_arrangement sequence: int32 - name: schema_lengths sequence: int6
Hugging Face
2023-02-02 更新
9
0
ybracke/dtak-transnormer-basic-v1
德语拼写规范化
自然语言处理
DTAK-transnormer-basic是一个德语历史文本数据集,包含1600至1899年间出版的文本,提供每个句子的历史拼写和规范化拼写。数据集可用于训练和评估历史德语文本的规范化模型,分为训练集、验证集和测试集。
Hugging Face
2025-02-12 更新
5
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广