🤗Datasets
收藏资源简介:
🤗Datasets是一个轻量级且可扩展的库,用于轻松共享和访问自然语言处理(NLP)及其他领域的数据集和评估指标。它具有与NumPy、pandas、PyTorch和Tensorflow 2的内置互操作性,轻量级且快速,具有透明和Pythonic的API,并能处理大型数据集,通过默认的内存映射驱动器来克服RAM内存限制。此外,它还具有智能缓存功能,确保数据处理的高效性。
🤗Datasets is a lightweight and extensible library designed for the effortless sharing and accessing of datasets and evaluation metrics in natural language processing (NLP) and other fields. It features built-in interoperability with NumPy, pandas, PyTorch, and TensorFlow 2, is lightweight and fast, offers a transparent and Pythonic API, and can handle large datasets by overcoming RAM limitations through default memory-mapped drivers. Additionally, it includes intelligent caching capabilities to ensure efficient data processing.
数据集概述
数据集名称
🤗Datasets
数据集描述
🤗Datasets 是一个轻量级且可扩展的库,用于轻松共享和访问自然语言处理(NLP)及其他领域的数据集和评估指标。
主要特点
- 兼容性:与NumPy、Pandas、PyTorch和TensorFlow 2兼容。
- 性能:轻量级且快速,API透明且Pythonic。
- 处理大数据:自然地释放用户从RAM内存限制,所有数据集默认在驱动器上内存映射。
- 智能缓存:数据处理多次时无需等待。
数据集内容
- 提供约100个NLP数据集和约10个评估指标。
- 社区可轻松添加和共享新的数据集和评估指标。
使用方法
datasets.list_datasets():列出可用数据集。datasets.load_dataset(dataset_name, **kwargs):实例化数据集。datasets.list_metrics():列出可用评估指标。datasets.load_metric(metric_name, **kwargs):实例化评估指标。
示例代码
python from datasets import list_datasets, load_dataset, list_metrics, load_metric
列出所有可用数据集
print(list_datasets())
加载数据集并打印训练集的第一个示例
squad_dataset = load_dataset(squad) print(squad_dataset[train][0])
列出所有可用评估指标
print(list_metrics())
加载评估指标
squad_metric = load_metric(squad)
数据集浏览
可通过实时数据集查看器浏览完整的数据集集合。




