遇见数据集

oshizo/HSClustering-ja

收藏
Hugging Face2024-06-23 更新2024-06-29 收录
官方服务:

资源简介:

该数据集是一个用于嵌入模型学习和评估的聚类数据集。数据来源于日本海关的预先指示回答(品目分类),并经过整理后公开。数据集包含了‘一般的品名’和‘货物概要’的结合文本,以及对应的HS代码的‘部’作为标签。数据集在2024年6月23日进行了更新,删除了‘一般的品名’重复的数据。数据集被随机分割为训练集和测试集,且保持了标签的比例。

该数据集是一个用于嵌入模型学习和评估的聚类数据集。数据来源于日本海关的预先指示回答(品目分类),并经过整理后公开。数据集包含了‘一般的品名’和‘货物概要’的结合文本,以及对应的HS代码的‘部’作为标签。数据集在2024年6月23日进行了更新,删除了‘一般的品名’重复的数据。数据集被随机分割为训练集和测试集,且保持了标签的比例。

提供机构:
oshizo
原始信息汇总

数据集概述

数据集信息

  • 特征:

    • 税番: 类型为字符串
    • text: 类型为字符串
    • label: 类型为整数64位
  • 分割:

    • train:
      • 字节数: 1667475
      • 样本数: 2655
    • test:
      • 字节数: 555604
      • 样本数: 886
  • 下载大小: 928402字节

  • 数据集大小: 2223079字节

配置

  • 配置名称: default
    • 数据文件:
      • train: data/train-*
      • test: data/test-*

任务类别

  • 文本分类

语言

  • 日语

数据处理

分割详情

label train test
1 150 51
2 214 71
3 32 11
4 576 192
5 27 9
6 308 102
7 246 82
8 46 16
9 67 22
10 30 10
11 304 101
12 66 22
13 45 15
14 14 5
15 149 50
16 138 45
17 36 13
18 31 10
20 176 59
搜集汇总
数据集介绍
oshizo/HSClustering-ja 数据集图片
背景与挑战
背景概述
该数据集是一个日语文本分类数据集,基于日本海关的预先指示回答(品目分类)数据构建,包含3,541条数据,划分为训练集和测试集。数据集特点包括:每条数据由商品描述文本(结合“一般的品名”和“货物概要”)和对应的HS代码“部”标签组成,适用于文本嵌入模型的聚类任务,且数据已去重并保持标签比例平衡。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务