# 数据挖掘-学生成绩预测 **Repository Path**: gzw1127/data-mining ## Basic Information - **Project Name**: 数据挖掘-学生成绩预测 - **Description**: 用九种机器学习方法进行学生成绩预测 - **Primary Language**: Python - **License**: MIT - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-01-14 - **Last Updated**: 2026-01-14 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README 本研究基于葡萄牙两所中学396名学生的数学成绩数据,采用多种统计建模方法对中学生学业成绩进行预测分 析。通过数据挖掘和机器学习技术,探索影响学生学业成绩的关键因素,构建有效的预测模型。研究首先对原始数据进行预处理,包括缺失值处理、异常值检 测和特征工程;然后运用描述性统计分析、相关性分析和可视化技术探索数据特征;选择9种机器学习的方法对成绩进行预测,包括线性回归 、岭回归、Lasso回归、ElasticNet回归、决策树回归、随机森林回归、梯度提升回归、K近邻回归和支持向量回归, 并采用交叉验证和网格搜索进行参数优化;最后通过均方根误差(RMSE)、平均绝对误差(MAE)和决定系数(R²)等指标评估模型性能。 实证结果表明,随机森林模型表现最佳,在测试集上预测准确率达到84.8%,R²为0.8264,RMSE为1.8866,MAE为1.21,G2成绩、 学习时间和母亲教育水平是影响学生数学成绩的最关键因素。本研究为教育管理部门、学校和教师提供了数据驱动的决策支持, 有助于识别学业困难学生并实施精准干预。 **结果:** 1. student_performance_comprehensive_analysis.png - 综合数据分析图 2. feature_correlation_with_G3.png - 特征相关性图 3. feature_pairplot.png - 特征散点图矩阵 4. best_model_performance.png - 最佳模型性能图 5. detailed_feature_importance.png - 详细特征重要性图 6. model_results.csv - 所有模型结果 7. predictions.csv - 预测结果 8. feature_importance.csv - 特征重要性 9. model_info.csv - 模型信息