alvations/c4p0-x1-fr-en
收藏资源简介:
该数据集包含多种文本和元数据特征,如源文本、目标文本、生成文本及其对应的语言标识。数据集分为训练集,共有7个示例,总大小为9747字节。数据集主要用于训练和测试文本生成和翻译模型,通过不同的文本字段和语言标识,可以用于多种自然语言处理任务。
数据集信息: 特征项: - 字段名:源文本(source),数据类型:字符串 - 字段名:目标文本(target),数据类型:字符串 - 字段名:目标文本回译至源语言(target_backto_source),数据类型:字符串 - 字段名:原始目标文本列表(raw_target),数据类型:列表,列表元素: - 字段名:生成文本(generated_text),数据类型:字符串 - 字段名:原始回译目标文本列表(raw_target_backto_source),数据类型:列表,列表元素: - 字段名:生成文本(generated_text),数据类型:字符串 - 字段名:提示词(prompt),数据类型:字符串 - 字段名:反向提示词(reverse_prompt),数据类型:字符串 - 字段名:源语言标识符(source_langid),数据类型:字符串 - 字段名:目标语言标识符(target_langid),数据类型:字符串 - 字段名:回译目标语言标识符(target_backto_source_langid),数据类型:字符串 - 字段名:文档ID(doc_id),数据类型:64位整数 - 字段名:句子ID(sent_id),数据类型:64位整数 - 字段名:微秒级时间戳(timestamp[us]),数据类型:timestamp[us] - 字段名:统一资源定位符(url),数据类型:字符串 - 字段名:文档哈希值(doc_hash),数据类型:字符串 数据拆分: - 拆分名称:train(训练集),占用字节数:9747字节,样本数量:7 下载总大小:21197字节,数据集总大小:9747字节 配置项: - 配置名称:default(默认配置),数据文件: - 对应拆分:train(训练集),文件路径:02b9d52b317f351f/train-*
数据集概述
数据集特征
- source (字符串)
- target (字符串)
- target_backto_source (字符串)
- raw_target (列表)
- generated_text (字符串)
- raw_target_backto_source (列表)
- generated_text (字符串)
- prompt (字符串)
- reverse_prompt (字符串)
- source_langid (字符串)
- target_langid (字符串)
- target_backto_source_langid (字符串)
- doc_id (整数)
- sent_id (整数)
- timestamp (时间戳,单位:微秒)
- url (字符串)
- doc_hash (字符串)
数据集分割
- train
- num_bytes: 9747
- num_examples: 7
数据集大小
- download_size: 21197
- dataset_size: 9747
配置
- config_name: default
- data_files
- split: train
- path: 02b9d52b317f351f/train-*



