mailing.csv
收藏资源简介:
该数据集包含了一个真实直接营销活动的捐赠历史和人口统计信息,具体特征包括家庭收入、首次捐赠日期、最近捐赠日期、平均捐赠金额、频率代码、捐赠金额代码、明星捐赠者标志、最后一次捐赠金额、平均捐赠金额以及结果变量(1表示在该活动中捐赠,0表示未捐赠)。
This dataset contains donation history and demographic information from a real direct marketing campaign. The specific features include household income, first donation date, most recent donation date, average donation amount, frequency code, donation amount code, star donor flag, last donation amount, average donation amount, and the outcome variable (1 denotes donation in this campaign, while 0 indicates no donation).
预测慈善捐赠响应的随机森林模型
数据集描述
数据集 mailing.csv 包含以下特征:
- Income: 家庭收入
- Firstdate: 该个人的首次捐赠日期
- Lastdate: 该个人的最近捐赠日期
- Amount: 该个人的平均捐赠金额
- rfaf2: 频率代码
- rfaa2: 捐赠金额代码
- pepstrfl: 星标捐赠者标志
- glast: 最后一次捐赠金额
- gavr: 平均捐赠金额
- class: 目标变量,1 表示在该活动中捐赠,0 表示未捐赠
项目结构
项目包括以下步骤:
-
数据探索和准备:
- 评估训练和测试数据集中
class变量的分布,确保平衡。
- 评估训练和测试数据集中
-
模型拟合:
- 使用训练数据集拟合随机森林模型。
- 确定模型的袋外(OOB)错误率。
-
预测性能评估:
- 使用
confusionMatrix函数计算混淆矩阵和其他性能指标。 - 创建 ROC 曲线并计算训练和测试数据集的 AUC。
- 使用
-
模型检查:
- 检查随机森林模型的变量重要性得分。
- 使用模型进行个体预测并分析关键特征的影响。
-
影响分析:
- 使用个体条件期望(ICE)和部分依赖图(PDP)来理解关键特征对捐赠预测的影响。
-
总结和建议:
- 总结模型的预测性能和关键特征重要性。
- 讨论潜在的改进措施并为未来活动提供建议。
发现总结
- 初始数据探索显示
class变量在训练和测试数据集中相对平衡。 - 随机森林模型在训练和测试数据集上表现出不同的性能,评估过程中观察到潜在的过拟合。
- 影响捐赠预测的关键特征包括收入、捐赠日期(Firstdate 和 Lastdate)和过去的捐赠金额。
- 调整模型复杂度和正则化技术可能提高预测准确性。
建议
- 简化模型或使用正则化技术可能有助于缓解过拟合。
- 收集更多数据可以增强模型的泛化能力。
- 根据关键特征如收入和过去捐赠行为定制请求策略可能提高活动成功率。
使用方法
要复现分析:
- 加载数据集和所需库。
- 运行提供的代码以拟合随机森林模型并评估其性能。
- 使用模型进行预测并分析关键特征的影响。
额外内容:PDP+ICE 图表
仓库还包括一个额外部分,展示如何使用 iml 包创建部分依赖图(PDP)结合个体条件期望(ICE)曲线,以可视化特定特征对预测捐赠概率的影响。
结论
该项目提供了一个全面的随机森林模型构建和评估方法,以预测慈善捐赠响应。获得的洞察可以帮助通过更有效地定位个人来改善未来的营销活动。




