Data-Gouv-FR/temps-de-parole-aux-elections-regionales-et-departementales
收藏数据链接:
官方服务:
资源简介:
该数据集是法国地区和省选举中电视台宣布的讲话时间汇编。数据来源于法国高级视听委员会(CSA)网站,覆盖所有可用频道,时间已转换为秒。数据集包含两个子集:一个列出每个处理选区的讲话时间,另一个汇总国家辩论的讲话时间,不关联特定选区。注意:早期版本文件存在重复,已更新清理后的文件。
Compilation of the speaking time declared by the channels for the departmental and regional elections. The figures are retrieved from the CSA website for all available channels. The duration has been converted to seconds. Two datasets coexist: one listing the different speaking times for each treated constituency and the other aggregating the speaking times corresponding to the national debate and not attached to a particular constituency. [⚠️ An initial version of the files contained several duplicates. New cleaned files have been updated on June 24].
提供机构:
Data-Gouv-FR搜集汇总
数据集介绍

构建方式
该数据集源自法国官方开放数据平台data.gouv.fr,旨在系统整理各电视台在2021年法国大区及省议会选举期间发布的竞选发言时长信息。原始数据采集自法国最高视听委员会(CSA)官网,覆盖所有可获取的电视台频道,并将原始时长统一转换为秒为单位。数据集在HuggingFace上以两个子集形式呈现:其一为按选区划分的具体发言时长记录,另一则为不隶属于特定选区的全国性辩论发言时长汇总。值得注意的是,初始版本曾存在若干重复条目,经彻底清洗后已于6月24日更新为纯净版本。
特点
该数据集的核心特点在于其层次化的存储架构与开放的互操作性。每个原始表格资源在HuggingFace仓库中被映射为一个独立的配置子集,均包含统一的'train'数据拆分,便于标准化调用。数据以高效压缩的Parquet格式存储,同时兼容CSV格式,兼顾分析性能与通用性。数据集采用fr-lo许可协议,专为法语政治传播研究设计,为学者和分析师提供了量化媒体话语权分配、考察选举期间表达自由与多元主义等议题的珍贵结构化素材。
使用方法
使用者可通过HuggingFace的datasets库便捷调用该数据集。以Python为例,首先通过load_dataset函数加载指定子集,如'load_dataset("Data-Gouv-ML/temps-de-parole-aux-elections-regionales-et-departementales", "temps-de-parole-aux-elections-debat-national")',即可获取全国辩论发言时长的训练集。返回的数据结构为标准的Dataset对象,支持切片、筛选及与Pandas等分析工具的无缝衔接。数据集明确标注了来源标识符与slug,便于追溯原始官方页面,确保分析工作的可复现性与数据溯源完整性。
背景与挑战
背景概述
该数据集名为“temps-de-parole-aux-elections-regionales-et-departementales”,由法国数据开放平台data.gouv.fr于2021年发布,旨在系统性地收集和整理法国各大电视台在2021年大区及省级选举期间所申报的候选人发言时间数据。数据源自法国最高视听委员会(CSA)的公开记录,经过转换以秒为单位进行量化。该数据集的核心研究问题聚焦于选举过程中媒体话语权的分配,为政治传播、媒体偏见及选举公平性研究提供了实证基础。通过整合全国辩论与各选区的发言时长,研究者得以深入分析候选人曝光度的地域差异与整体格局,对法国政治生态与公共政策研究具有重要影响力。
当前挑战
该数据集所解决的领域挑战在于量化选举期间媒体话语的平等性,为其提供可验证的数据支撑,以揭示候选人间发言时间的结构性不均。在构建过程中面临的主要挑战包括:原始数据散布于CSA网站上不同频道的申报记录,需手动进行多源数据抓取与格式统一;以秒为单位的转换过程潜藏精度误差;初始版本存在重复条目,需经过严格的清洗与去重处理,最终于2021年6月24日发布修正版本。此外,数据的分层结构(全国辩论与选区层面)使得聚合分析时需谨慎处理归属问题,避免统计偏差。
常用场景
经典使用场景
该数据集汇聚了法国2021年大区及省级选举期间,各大电视频道所申报的候选人及政治团体发言时长。其经典使用场景在于利用结构化时序数据,定量分析媒体在选举过程中的政治倾向与资源分配差异,揭示不同区域或国家层面的政治话语权分布格局。
解决学术问题
该数据集解决了传播学与政治学交叉领域中关于选举媒体报道公平性的量化难题。通过精确到秒的发言时长数据,学者得以验证媒体中立性原则在实际选举中的落实情况,探究候选人政治派别、选举层级与电视曝光度之间的内在关联,为民主过程的透明度评估提供了实证基础。
衍生相关工作
基于此数据集,衍生出多类相关研究,包括构建选举媒体覆盖趋势的可视化平台、开发预测选情与媒体曝光度关系的统计模型,以及设计对比不同年份选举中发言时长变迁的纵向分析框架。这些工作进一步拓展了数据集在政治传播动态监测领域的应用边界。
以上内容由遇见数据集搜集并总结生成



