遇见数据集

Xhaheen/Alpaca_urdu_2024_1

收藏
Hugging Face2024-03-06 更新2024-06-22 收录
官方服务:

资源简介:

--- dataset_info: features: - name: input dtype: string - name: output dtype: string - name: answer_lengths dtype: 'null' splits: - name: train num_bytes: 51251741 num_examples: 45622 download_size: 24545189 dataset_size: 51251741 configs: - config_name: default data_files: - split: train path: data/train-* license: apache-2.0 task_categories: - text-generation language: - ur size_categories: - 10K<n<100K --- Description The Alpaca Urdu 🦙 is a translation of the original dataset into Urdu. This dataset is a part of the Alpaca project and is designed for NLP tasks. 🌐 Dataset Information Size: The translated dataset contains [45,000] samples. Languages: Urdu License: [cc-by-4.0] Original Dataset: Alpaca Cleaned dataset Columns The translated dataset includes the following columns: input: input text in Urdu. output: translated output in Urdu. answer_lengths: Lengths of the answers. Example Usage from datasets import load_dataset # Load the translated dataset dataset = load_dataset("Xhaheen/Alpaca_urdu_2024_1") # Access a sample sample = dataset["train"][0] print(sample) ############## import pandas as pd # Assuming the dataset has a key named "train" containing the data df = pd.DataFrame(dataset["train"]) # Save the DataFrame to a CSV file named "alpaca_ur.csv" df.to_csv("alpaca_urdu.csv", index=False)

数据集信息: 特征字段: - 字段名:input,数据类型:字符串 - 字段名:output,数据类型:字符串 - 字段名:answer_lengths,数据类型:空值 数据集划分: - 划分名称:train(训练集),字节数:51251741,样本数量:45622 下载大小:24545189 数据集总大小:51251741 配置项: - 配置名称:default(默认配置),数据文件: - 划分:train(训练集),路径:data/train-* 许可证:Apache-2.0 任务类别: - 文本生成 语言: - 乌尔都语(ur) 样本规模区间: - 10K < n < 100K ## 数据集说明 阿尔帕卡乌尔都语版(Alpaca Urdu)🦙是原始数据集的乌尔都语译本。本数据集隶属于阿尔帕卡项目(Alpaca Project),旨在用于自然语言处理(Natural Language Processing,简称NLP)任务🌐。 ### 数据集详情 1. 样本规模:经翻译的数据集共包含约45000条样本 2. 语言:乌尔都语 3. 许可证:CC-BY-4.0 4. 原始数据集:阿尔帕卡清洗版数据集(Alpaca Cleaned dataset) ### 字段说明 该翻译数据集包含以下字段: - `input`:乌尔都语输入文本 - `output`:乌尔都语翻译后的输出文本 - `answer_lengths`:答案长度统计值 ### 使用示例 python from datasets import load_dataset # 加载该翻译数据集 dataset = load_dataset("Xhaheen/Alpaca_urdu_2024_1") # 访问单条样本 sample = dataset["train"][0] print(sample) python import pandas as pd # 假设数据集的"train"划分包含全部数据 df = pd.DataFrame(dataset["train"]) # 将数据框导出为名为"alpaca_urdu.csv"的CSV文件 df.to_csv("alpaca_urdu.csv", index=False)

提供机构:
Xhaheen
原始信息汇总

数据集概述

基本信息

  • 数据集名称: Alpaca Urdu 🦙
  • 语言: Urdu
  • 许可证: Apache-2.0
  • 任务类别: 文本生成
  • 大小类别: 10K<n<100K

数据结构

  • 特征:
    • input: 输入文本,数据类型为字符串
    • output: 输出文本,数据类型为字符串
    • answer_lengths: 答案长度,数据类型为空

数据分割

  • 训练集:
    • 文件名: data/train-*
    • 样本数量: 45622
    • 字节数: 51251741

下载信息

  • 下载大小: 24545189
  • 数据集大小: 51251741

示例用法

python from datasets import load_dataset

加载翻译后的数据集

dataset = load_dataset("Xhaheen/Alpaca_urdu_2024_1")

访问样本

sample = dataset["train"][0] print(sample)

搜集汇总
数据集介绍
Xhaheen/Alpaca_urdu_2024_1 数据集图片
背景与挑战
背景概述
该数据集是Alpaca项目的乌尔都语翻译版本,专为自然语言处理任务设计,包含约45,000个样本,涵盖问答和文本生成等多种场景。数据以parquet格式存储,主要列包括乌尔都语的input和output文本,适用于训练和评估乌尔都语语言模型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务