Xhaheen/Alpaca_urdu_2024_1
收藏资源简介:
--- dataset_info: features: - name: input dtype: string - name: output dtype: string - name: answer_lengths dtype: 'null' splits: - name: train num_bytes: 51251741 num_examples: 45622 download_size: 24545189 dataset_size: 51251741 configs: - config_name: default data_files: - split: train path: data/train-* license: apache-2.0 task_categories: - text-generation language: - ur size_categories: - 10K<n<100K --- Description The Alpaca Urdu 🦙 is a translation of the original dataset into Urdu. This dataset is a part of the Alpaca project and is designed for NLP tasks. 🌐 Dataset Information Size: The translated dataset contains [45,000] samples. Languages: Urdu License: [cc-by-4.0] Original Dataset: Alpaca Cleaned dataset Columns The translated dataset includes the following columns: input: input text in Urdu. output: translated output in Urdu. answer_lengths: Lengths of the answers. Example Usage from datasets import load_dataset # Load the translated dataset dataset = load_dataset("Xhaheen/Alpaca_urdu_2024_1") # Access a sample sample = dataset["train"][0] print(sample) ############## import pandas as pd # Assuming the dataset has a key named "train" containing the data df = pd.DataFrame(dataset["train"]) # Save the DataFrame to a CSV file named "alpaca_ur.csv" df.to_csv("alpaca_urdu.csv", index=False)
数据集信息: 特征字段: - 字段名:input,数据类型:字符串 - 字段名:output,数据类型:字符串 - 字段名:answer_lengths,数据类型:空值 数据集划分: - 划分名称:train(训练集),字节数:51251741,样本数量:45622 下载大小:24545189 数据集总大小:51251741 配置项: - 配置名称:default(默认配置),数据文件: - 划分:train(训练集),路径:data/train-* 许可证:Apache-2.0 任务类别: - 文本生成 语言: - 乌尔都语(ur) 样本规模区间: - 10K < n < 100K ## 数据集说明 阿尔帕卡乌尔都语版(Alpaca Urdu)🦙是原始数据集的乌尔都语译本。本数据集隶属于阿尔帕卡项目(Alpaca Project),旨在用于自然语言处理(Natural Language Processing,简称NLP)任务🌐。 ### 数据集详情 1. 样本规模:经翻译的数据集共包含约45000条样本 2. 语言:乌尔都语 3. 许可证:CC-BY-4.0 4. 原始数据集:阿尔帕卡清洗版数据集(Alpaca Cleaned dataset) ### 字段说明 该翻译数据集包含以下字段: - `input`:乌尔都语输入文本 - `output`:乌尔都语翻译后的输出文本 - `answer_lengths`:答案长度统计值 ### 使用示例 python from datasets import load_dataset # 加载该翻译数据集 dataset = load_dataset("Xhaheen/Alpaca_urdu_2024_1") # 访问单条样本 sample = dataset["train"][0] print(sample) python import pandas as pd # 假设数据集的"train"划分包含全部数据 df = pd.DataFrame(dataset["train"]) # 将数据框导出为名为"alpaca_urdu.csv"的CSV文件 df.to_csv("alpaca_urdu.csv", index=False)
数据集概述
基本信息
- 数据集名称: Alpaca Urdu 🦙
- 语言: Urdu
- 许可证: Apache-2.0
- 任务类别: 文本生成
- 大小类别: 10K<n<100K
数据结构
- 特征:
- input: 输入文本,数据类型为字符串
- output: 输出文本,数据类型为字符串
- answer_lengths: 答案长度,数据类型为空
数据分割
- 训练集:
- 文件名: data/train-*
- 样本数量: 45622
- 字节数: 51251741
下载信息
- 下载大小: 24545189
- 数据集大小: 51251741
示例用法
python from datasets import load_dataset
加载翻译后的数据集
dataset = load_dataset("Xhaheen/Alpaca_urdu_2024_1")
访问样本
sample = dataset["train"][0] print(sample)




