遇见数据集

GitHub Follower Dataset

收藏
github2026-08-23 更新2026-08-26 收录
官方服务:

资源简介:

GitHub 粉丝榜上粉丝过万的356个真实用户数据集,包含用户档案、成名路径分类和头部用户深度调研。

A dataset of 356 real GitHub users with over 10,000 followers on the GitHub Follower Leaderboard, including user profiles, classifications of their rise-to-fame paths, and in-depth investigations of the top-tier users in this cohort.

创建时间:
2026-08-23
原始信息汇总

数据集概述

该数据集收录了 356 个 GitHub 真实用户账号,这些账号的粉丝数均不少于 10,000,数据抓取时间为 2026-08-23,通过 GitHub Search API 和 REST API 全量获取,并附带成名路径分类和头部用户深度调研。

文件结构

文件名 内容说明
users.json 356 个用户的完整档案,包括 login、name、company、bio、blog、twitter、followers、public_repos、created_at,按粉丝数降序排列
classified.json 353 人的成名路径分类,分为:框架作者、教育创作者、技术领袖、开源高产者、内容策展人、AI 工具作者、公司品牌号
stories.json 粉丝 ≥24,000 的 24 位头部用户深度调研,包含成名故事、关键事实和来源链接,由多路搜索代理收集并经核查修正
verdicts.json 对 stories 中部分事实的核查结论(CONFIRMED / CORRECTED / PARTIAL),共 11 条

数据分布

粉丝区间 人数
≥50k 18
20k–50k 89
15k–20k 61
10k–15k 188

复现方法

使用 GitHub CLI 分页枚举粉丝数大于 10,000 的用户,并逐个抓取用户档案,具体命令见仓库中的 ## 复现方法 部分。

已知局限

  • 粉丝数为抓取时点的存量数据,GitHub Search API 存在索引延迟(±几小时)。
  • 成名路径分类为主观判定,明星边界难以精确统一。
  • stories.json 中未通过核查的数字已在博客文章中模糊化,引用前需自行验证。
搜集汇总
数据集介绍
GitHub Follower Dataset 数据集图片
构建方式
该数据集于2026年8月23日通过GitHub官方Search API与REST API协同抓取,以粉丝数≥10,000为筛选阈值,对全量用户进行枚举与档案采集。构建流程包含两个核心阶段:首先利用Search API按粉丝数降序分页检索满足条件的用户标识,随后调用REST API逐一获取每个账号的完整公开档案,包括登录名、姓名、公司、简介、博客、Twitter、粉丝数、公共仓库数及注册时间等字段。所有数据经过去重与排序,最终形成包含356个真实账号的规范化数据集,并按粉丝数降序排列,确保样本的时间一致性与结构完整性。
使用方法
使用者可直接加载配套的JSON文件进行多维分析,如依据粉丝数分布(≥50k、20k–50k、15k–20k、10k–15k)研究用户分层,或利用分类标签探究不同成名路径的特征。对于需要复现或扩展的研究者,可通过GitHub CLI执行提供的两段API命令:先用Search API枚举粉丝数超过10,000的用户并分页获取,接着用REST API逐账号抓取档案,即可生成新时间点的数据集。使用时需注意粉丝数为采集时点值,且Search API存在索引延迟,分类判定带主观性,引用stories.json中的数字前应参照核查结论自行验证。
背景与挑战
背景概述
GitHub作为全球最大的开源协作平台,其用户影响力常以粉丝数衡量,但高粉丝用户的成名路径与身份构成尚缺乏系统性实证。该数据集由lxlynx于2026年8月23日通过GitHub Search API与REST API全量采集,收录粉丝数不低于10,000的356个真实账号,并依据成名路径将其划分为框架作者、教育创作者、技术领袖等七类,同时对头部24位用户进行深度调研与事实核查。该数据集填补了GitHub用户影响力生态研究的空白,为理解开源社区中非明星用户的崛起机制、平台社交传播规律及技术人才影响力评估提供了宝贵的数据基础,对开源社区研究、社交媒体分析及人才发现等领域具有重要参考价值。
当前挑战
该数据集构建面临多重挑战。领域层面,GitHub粉丝数受平台算法、项目热度及外部社交媒体影响,单纯数量难以反映真实技术影响力,且“明星”界限主观,需一刀切处理,分类亦依赖人工判定,存在偏差。构建过程中,GitHub Search API存在索引延迟(±几小时),导致粉丝数为时点快照,非实时精确;全量枚举需分页请求,易受API速率限制;深度调研依赖多路搜索代理,收集信息需对抗核查,但部分事实仍无法完全确认,导致stories.json中未通过核查的数据需模糊化处理,引用前需用户自行验证,增加了数据可信度评估的复杂性。
常用场景
经典使用场景
该数据集聚焦于GitHub平台上粉丝数逾越万级阈值的356个真实用户,为开发者影响力与开源社区生态研究提供了不可多得的全景样本。其典型使用场景涵盖对高影响力开发者画像的构建,借助users.json中的多维字段,研究者可系统剖析这些核心贡献者的地域分布、职业归属、代码仓库产出及社交网络辐射力。同时,classified.json中的成名路径分类为解读技术人才崛起模式提供了量化依据,可应用于开源社会学、计算传播学及其交叉领域的实证探索。
解决学术问题
该数据集有效破解了过往开源生态研究中普遍存在的高影响力个体样本缺失、数据获取成本高昂及更新滞后等难题。其全量抓取策略及双层校验机制,保障了时间点的完整性与高可信度,使研究者得以洞察粉丝数分布的幂律特征与长尾形态。更为关键的是,它对“技术明星”的界定提出可复验的操作性框架,回应了关于技术权威与网络声望形成的理论争议,显著拓展了技术社区中社会资本量化研究的方法路径。
实际应用
在实际应用中,该数据集可服务于开源项目维护者的社区策略优化,助力识别潜在的核心贡献者与传播节点。对于技术招聘与人才评估领域,其详尽档案为量化候选人的技术影响力提供了一手标尺;而对开发者关系或开源布道团队而言,成名路径分类可辅助构思有效的社区激励与生态运营方案。此外,该数据还可支撑技术媒体与咨询机构开展高影响力网络分析,为开发者经济与开源商业化的策略制定提供数据支撑。
数据集最近研究
最新研究方向
该数据集聚焦于GitHub平台上粉丝数逾万的356位真实用户,通过全量抓取与多维度档案构建,开创性地将开发者影响力量化分析推向新的深度。其最新研究方向围绕“非明星开发者”的成名路径与生态角色展开,融合了基于分类学的方法论(如框架作者、教育创作者、技术领袖等),并辅以头部用户的深度叙事挖掘与事实核查机制,体现了数据驱动与人文叙事交织的探索。这一工作不仅回应了开源社区中影响力分布不均的热点议题,还为理解开发者社交网络、技术传播模式及开源生态的可持续发展提供了实证基础,对学术研究与平台治理均具有启示意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务