WeRateDogs Twitter Data
收藏资源简介:
该数据集包含Twitter用户@dog_rates(又称WeRateDogs)的推文存档,以幽默的方式给人们的狗评分,通常分母为10,分子经常大于10(例如11/10,12/10)。存档包括超过5000条推文的基本数据(推文ID、时间戳、文本等),截至2017年8月1日。
This dataset contains the tweet archive of Twitter user @dog_rates, also known as WeRateDogs. This account humorously rates dogs using a scoring system where the denominator is almost always 10, while the numerator frequently exceeds 10 (e.g., 11/10, 12/10). The archive includes basic data for over 5,000 tweets, such as tweet ID, timestamp, text content and other related information, as of August 1, 2017.
We Rate Dogs 数据集
简介
本项目分析和可视化的数据集是Twitter用户@dog_rates(又称WeRateDogs)的推文存档。WeRateDogs以幽默的方式给人们的狗评分,评分通常分母为10,分子经常大于10(例如,11/10,12/10)。
存档包括截至2017年8月1日超过5000条推文的基本推文数据(推文ID、时间戳、文本等)。
数据收集
- 从Udacity下载了
twitter-archive-enhanced.csv,并使用pd.read_csv导入。 - 使用
requests库从Udacity的服务器上程序化地获取了image_predictions.tsv。 - 由于无法通过API收集推文,使用Udacity提供的代码访问推文数据。
数据评估
- 使用电子表格软件(Excel)进行视觉评估,并在Jupyter Notebook中进行程序化评估。
- 根据项目评分标准识别了质量和整洁度问题。
- 在进行数据整理之前创建了数据框的副本。
解决的质量问题
- 删除了2017年8月1日之前的没有图像预测的推文。
- 处理了
rating_denominator列中的异常值。 - 更正了数据类型(例如,推文ID、时间戳)。
- 从推文URL中提取了推文来源。
- 将
Doggo、Floofer、Pupper、Puppo列中的"None"值更新为空值。 - 处理了图像预测中的错误狗名。
- 从图像预测中删除了非狗的预测。
- 清理了狗品种名称中的连字符。
解决的整洁度问题
- 从
dog_twitter_archive中删除了不必要的列。 - 将
Doggo、Floofer、Pupper、Puppo列合并为一个dog type列。 - 将所有表合并为一个最终的干净数据框
dog_archive_final。
结论
本数据整理项目成功解决了WeRateDogs数据集中的11个清洁度和整洁度问题。进一步的努力可能需要消除所有不一致性。




