遇见数据集

OpenMol/LPM-24_caption-MMChat

收藏
Hugging Face2024-05-27 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: molecules struct: - name: smiles sequence: string - name: messages list: - name: content dtype: string - name: role dtype: string splits: - name: train num_bytes: 87113554 num_examples: 160560 - name: test num_bytes: 6586980 num_examples: 21942 download_size: 13093198 dataset_size: 93700534 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* ---

数据集信息: 特征项: - 分子(molecules):结构体类型,包含字段: - 简化分子线性输入规范(SMILES)序列:字符串序列类型 - 消息列表(messages):列表类型,列表元素为包含以下字段的结构体: - 内容(content):字符串类型 - 角色(role):字符串类型 数据集划分: - 训练集(train):占用字节数87113554,样本总数160560 - 测试集(test):占用字节数6586980,样本总数21942 下载大小:13093198字节,数据集总大小:93700534字节 配置项: - 默认配置(default):对应数据文件路径如下: - 训练集:data/train-* - 测试集:data/test-*

提供机构:
OpenMol
原始信息汇总

数据集概述

数据集特征

  • molecules
    • smiles: 字符串序列
  • messages
    • content: 字符串类型
    • role: 字符串类型

数据集分割

  • train
    • 大小: 87113554 字节
    • 示例数量: 160560
  • test
    • 大小: 6586980 字节
    • 示例数量: 21942

数据集大小

  • 下载大小: 13093198 字节
  • 总大小: 93700534 字节

数据文件配置

  • config_name: default
  • 数据文件路径
    • 训练数据: data/train-*
    • 测试数据: data/test-*
二维码
社区交流群
二维码
科研交流群
商业服务