遇见数据集

perceptron-743/good-reads-data

收藏
Hugging Face2024-03-01 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: bookId dtype: string - name: title dtype: string - name: series dtype: string - name: author dtype: string - name: rating dtype: float64 - name: description dtype: string - name: language dtype: string - name: isbn dtype: string - name: genres dtype: string - name: characters dtype: string - name: bookFormat dtype: string - name: edition dtype: string - name: pages dtype: string - name: publisher dtype: string - name: publishDate dtype: string - name: firstPublishDate dtype: string - name: awards dtype: string - name: numRatings dtype: int64 - name: ratingsByStars dtype: string - name: likedPercent dtype: float64 - name: setting dtype: string - name: coverImg dtype: string - name: bbeScore dtype: int64 - name: bbeVotes dtype: int64 - name: price dtype: string - name: word_count dtype: int64 - name: input_ids sequence: int32 - name: token_type_ids sequence: int8 - name: attention_mask sequence: int8 splits: - name: train num_bytes: 182353702 num_examples: 53944 download_size: 57947357 dataset_size: 182353702 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征字段: - 字段名:bookId(书籍ID),数据类型:字符串(string) - 字段名:title(书名),数据类型:字符串(string) - 字段名:series(作品系列),数据类型:字符串(string) - 字段名:author(作者),数据类型:字符串(string) - 字段名:rating(评分),数据类型:64位浮点数(float64) - 字段名:description(书籍简介),数据类型:字符串(string) - 字段名:language(语言),数据类型:字符串(string) - 字段名:isbn(国际标准书号,ISBN),数据类型:字符串(string) - 字段名:genres(作品分类),数据类型:字符串(string) - 字段名:characters(登场角色),数据类型:字符串(string) - 字段名:bookFormat(书籍装帧形式),数据类型:字符串(string) - 字段名:edition(版本信息),数据类型:字符串(string) - 字段名:pages(页数),数据类型:字符串(string) - 字段名:publisher(出版社),数据类型:字符串(string) - 字段名:publishDate(出版日期),数据类型:字符串(string) - 字段名:firstPublishDate(首次出版日期),数据类型:字符串(string) - 字段名:awards(所获奖项),数据类型:字符串(string) - 字段名:numRatings(总评分次数),数据类型:64位整数(int64) - 字段名:ratingsByStars(星级评分分布),数据类型:字符串(string) - 字段名:likedPercent(好评占比),数据类型:64位浮点数(float64) - 字段名:setting(故事背景),数据类型:字符串(string) - 字段名:coverImg(封面图片链接),数据类型:字符串(string) - 字段名:bbeScore,数据类型:64位整数(int64) - 字段名:bbeVotes,数据类型:64位整数(int64) - 字段名:price(售价),数据类型:字符串(string) - 字段名:word_count(单词总数),数据类型:64位整数(int64) - 字段名:input_ids(输入令牌序列),数据类型:32位整数(int32)序列 - 字段名:token_type_ids(令牌类型标识序列),数据类型:8位整数(int8)序列 - 字段名:attention_mask(注意力掩码序列),数据类型:8位整数(int8)序列 数据集划分: - 划分名称:train(训练集),字节占用量:182353702,样本总数:53944 下载总大小:57947357 数据集本体大小:182353702 数据集配置: - 配置名称:default(默认配置),数据文件: - 对应划分:train(训练集),文件路径:data/train-*

提供机构:
perceptron-743
原始信息汇总

数据集信息

特征

  • bookId: 字符串
  • title: 字符串
  • series: 字符串
  • author: 字符串
  • rating: 浮点数 (float64)
  • description: 字符串
  • language: 字符串
  • isbn: 字符串
  • genres: 字符串
  • characters: 字符串
  • bookFormat: 字符串
  • edition: 字符串
  • pages: 字符串
  • publisher: 字符串
  • publishDate: 字符串
  • firstPublishDate: 字符串
  • awards: 字符串
  • numRatings: 整数 (int64)
  • ratingsByStars: 字符串
  • likedPercent: 浮点数 (float64)
  • setting: 字符串
  • coverImg: 字符串
  • bbeScore: 整数 (int64)
  • bbeVotes: 整数 (int64)
  • price: 字符串
  • word_count: 整数 (int64)
  • input_ids: 序列 (int32)
  • token_type_ids: 序列 (int8)
  • attention_mask: 序列 (int8)

数据分割

  • train:
    • 字节数: 182353702
    • 样本数: 53944

数据集大小

  • 下载大小: 57947357 字节
  • 数据集大小: 182353702 字节

配置

  • default:
    • 数据文件:
      • 分割: train
      • 路径: data/train-*
搜集汇总
数据集介绍
perceptron-743/good-reads-data 数据集图片
构建方式
在图书推荐与文学分析领域,高质量的结构化数据是驱动模型性能的关键。perceptron-743/good-reads-data数据集基于Goodreads平台,通过系统化爬取与清洗流程构建而成。其原始数据涵盖图书元信息、用户评分及文本描述,经过格式统一、缺失值处理与多源对齐后,最终整合为包含27个字段的标准化表格。数据集以单训练集划分,包含53,944条样本,每条记录均携带从基础属性(如标题、作者、ISBN)到衍生特征(如词频统计、情感编码)的完整信息,为下游任务提供了坚实的结构化基础。
特点
该数据集的核心特色在于其多维度的语义融合能力。它不仅保留了传统的数值型评分(rating)与分类标签(genres),更创新性地嵌入了经预训练模型处理的文本向量化表示(input_ids、token_type_ids、attention_mask),实现了从离散元数据到连续语义空间的直接映射。此外,字段覆盖范围极广,从出版日期、获奖记录到人物角色与场景设定,一应俱全。这种将结构化字段与深度学习特征并存的架构,使得数据集既能支撑传统的统计建模,又能无缝对接现代自然语言处理管线。
使用方法
使用该数据集时,研究者可直接加载HuggingFace Datasets库中的perceptron-743/good-reads-data路径,通过默认配置获取训练分片。对于经典推荐任务,可选取rating、genres等字段作为标签与特征;若需进行文本生成或语义分析,则可利用description字段与预计算好的input_ids序列。数据集已按标准格式存储为parquet或arrow文件,支持分布式读取与批量处理。建议在使用前按需过滤无效条目(如缺失的ISBN或空描述),并根据具体模型要求对数值字段进行归一化或分桶操作。
背景与挑战
背景概述
在数字化阅读日益普及的当下,图书推荐系统与个性化阅读分析成为自然语言处理与信息检索领域的重要研究方向。perceptron-743/good-reads-data数据集由研究人员于近年构建,依托全球知名图书社区Goodreads的丰富用户评价与书目元数据,旨在为图书属性预测、用户偏好建模及文本生成等任务提供高质量训练资源。该数据集收录了超过五万本图书的详尽信息,涵盖标题、作者、系列、评分、描述、体裁、角色、奖项、价格及词数等26个字段,并包含经过预处理的输入标识符与注意力掩码,便于直接用于深度学习模型。其发布对图书领域的多模态学习与推荐算法优化产生了显著推动,成为连接图书内容理解与用户行为分析的桥梁。
当前挑战
该数据集面临的核心挑战首先在于图书推荐领域的固有难题:用户兴趣的多样性与动态变化导致评分稀疏且偏好复杂,仅依赖评分与体裁等结构化特征难以捕捉深层语义关联。其次,构建过程中遭遇多重障碍:数据采集需处理Goodreads平台海量非结构化文本,如描述、奖项与角色信息存在格式不统一与缺失值问题;价格与出版日期等字段因不同版本混杂而难以标准化;词数与评分分布的长尾效应要求精细的采样与平衡策略。此外,多语言图书的混合收录加剧了文本预处理的难度,而封面图像与文本描述的跨模态对齐仍需进一步探索,以充分发挥数据集的潜力。
常用场景
经典使用场景
在计算社会科学与自然语言处理交叉领域,perceptron-743/good-reads-data数据集凭借其丰富的图书元数据与用户评分信息,成为研究图书推荐系统的经典基准。研究者常利用该数据集中的评分、星级分布及用户偏好指标,构建协同过滤或基于内容的推荐模型,以探索用户阅读行为的潜在模式。其包含的书籍描述、作者、流派及角色等文本特征,为语义分析与个性化推荐算法提供了高质量的训练素材,尤其在冷启动场景下,该数据集的多模态属性展现出独特优势。
衍生相关工作
基于该数据集,学术界涌现了一系列经典衍生工作。其中,融合文本嵌入与图神经网络的推荐模型利用书籍描述与用户评分构建知识图谱,显著提升了推荐的可解释性。另一项代表性研究则聚焦于跨域推荐,通过迁移学习将Goodreads数据中的用户偏好映射至其他娱乐内容领域。此外,该数据集催生了关于评分偏见与流行度偏差的探讨,研究者开发了去偏算法以缓解头部效应,从而公平地推荐冷门佳作。这些工作不仅深化了对图书推荐机制的理解,也为通用推荐系统提供了方法论借鉴。
数据集最近研究
最新研究方向
在数字人文与推荐系统交叉领域,perceptron-743/good-reads-data数据集为基于多模态特征的图书理解与个性化推荐研究提供了丰富的语义资源。该数据集不仅囊括了图书元数据、用户评分与评论情感,还创新性地引入了预训练模型的输入表征(input_ids、token_type_ids、attention_mask),使得研究者能够直接利用Transformer架构进行深度语义建模。当前前沿方向聚焦于融合文本描述、体裁标签与阅读偏好,构建能够捕捉用户隐性兴趣的端到端推荐模型。同时,该数据集的引入推动了图书领域细粒度情感分析、跨语言推荐与序列化阅读行为预测等热点问题的探索,为构建更具文化深度与个性化体验的数字阅读平台奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务