实习生将直接处理大型表格数据,应用其中一种决策树算法来解决分类或预测问题。
所需掌握的知识
数据科学知识:数据处理流程(预处理、标准化、特征工程)。
机器学习算法:Boosting算法的运作机制,特别是梯度提升决策树(GBDT)。
评估指标(Metrics):理解分类问题的准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1-Score、ROC-AUC。
实施步骤
连接实验环境:登录https://dev.mdcgroup.vn门户,获取访问配置了强大资源的ML服务器集群(JupyterHub或SSH服务器)的账户信息。
准备数据集:下载一个大规模表格样本数据集(例如:客户流失预测数据,或金融风险分析数据)。
数据预处理(Pandas/NumPy):处理缺失值,对分类变量进行编码(Categorical encoding),按照标准比例将数据集划分为训练集/验证集/测试集。
训练LightGBM模型:使用Python中的lightgbm库初始化模型。设置基本的超参数(Hyperparameters),如learning_rate、num_leaves、max_depth。
参数优化(Tuning):使用Early Stopping技术避免过拟合。执行网格搜索(Grid Search)或随机搜索(Random Search)以找到最优参数集。
评估与存储模型:使用混淆矩阵(Confusion Matrix)和ROC曲线图评估模型在测试集上的性能。将训练好的模型保存为.txt或.pkl文件,以便随时部署应用。
结果验收
选择题考试:在内部系统上进行关于基于树的算法结构的理论考试。
问题与建议:比较LightGBM与XGBoost在已实验数据集上的速度和准确性优缺点。
结果报告:将包含从数据处理到模型评估的完整代码流程的Jupyter Notebook (.ipynb) 文件发送给导师。
周末讨论:演示从LightGBM模型中输出的特征重要性(Feature Importance)的重要性。