← ClaudeAtlas

ml-ensemble-designlisted

集成学习设计方法论:何时值得集成、怎么制造"好而不同"(accuracy + diversity)、Boosting vs Bagging 选型、四类扰动通道、平均/投票/Stacking 结合策略与六种翻车预防。当用户想堆模型涨点、问"多模型融合会更好吗""bagging 还是 boosting""Stacking 线上线下不一致"时激活。信号词:ensemble, bagging, boosting, stacking, voting, 模型融合, diversity。不适用于单模型诊断(用 ml-diagnosis)与不平衡重采样(用 ml-imbalanced-learning)。
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# ML 集成设计:好而不同 · 降对项 · 选对通道与结合法 ## R — 原文 (Reading) > 要获得好的集成,个体学习器应"好而不同",即个体学习器要有一定的"准确性",即学习器不能太坏,并且要有"多样性"(diversity),即学习器间具有差异。 > > — 周志华,《机器学习》第8章 8.1节 > 上式显示出,随着集成中个体分类器数目T 的增大,集成的错误率将指数级下降,最终趋向于零。然而我们必须注意到,上面的分析有一个关键假设:基学习器的误差相互独立。在现实任务中,个体学习器是为解决同一个问题训练出来的,它们显然不可能相互独立!事实上,个体学习器的"准确性"和"多样性"本身就存在冲突。 > > — 周志华,《机器学习》第8章 8.1节 > 从偏差-方差分解的角度看,Boosting 主要关注降低偏差……Bagging 主要关注降低方差,因此它在不剪枝决策树、神经网络等易受样本扰动的学习器上效用更为明显。 > > — 周志华,《机器学习》第8章 8.2/8.3节 > 常见做法主要是对数据样本、输入属性、输出表示、算法参数进行扰动……有一些基学习器对数据样本的扰动不敏感,例如线性学习器、支持向量机、朴素贝叶斯、k近邻学习器等,这样的基学习器称为稳定基学习器(stable base learner),对此类基学习器进行集成往往需使用输入属性扰动等其他机制。 > > — 周志华,《机器学习》第8章 8.5.3节 > 加权平均法的权重一般是从训练数据中学习而得……较容易导致过拟合。因此,实验和应用均显示出,加权平均法未必一定优于简单平均法。……若直接用初级学习器的训练集来产生次级训练集,则过拟合风险会比较大;因此,一般是通过使用交叉验证或留一法这样的方式,用训练初级学习器未使用的样本来产生次级学习器的训练样本。 > > — 周志华,《机器学习》第8章 8.4节 --- ## I — 方法论骨架 (Interpretation) 集成不是"多训几个模型投票",而是一个有明确前提条件的设计问题,分三步走: **第一步:判断值不值得集成。** 集成收益完全来自个体间的分歧(diversity):错误互斥的个体集成后大涨,高度雷同的个体集成后零收益白付 T 倍算力,一致地错且差的集成反而更糟。"误差独立→错误率指数下降趋于零"的漂亮结论现实中不成立——个体是为同一问题训出来的,天然相关;且准确性与多样性本身冲突,个体已很强后再强行增多样会掉准确率。所以先测成员相关性/分歧度,别急着堆数量。 **第二步:按主导误差项选路线。** 先用偏差-方差语言诊断:偏差主导(欠拟合、弱学习器)→ 走串行 Boosting,逐轮聚焦错例削减偏差;方差主导(深树、神经网络等不稳定学习器)→ 走并行 Bagging/随机森林,自助采样削方差。对已经又强又稳的模型做任何集成收益趋零。 **第三步:制造多样性靠扰动通道,结合靠策略匹配。** 注入随机性有四个旋钮:数据样本扰动、输入属性扰动、输出表示扰动、算法参数扰动——通道必须与基学习器的敏感性匹配(线性学习器/SVM/朴素贝叶斯是稳定学习器,对样本扰动不敏感,须换属性等其他通道;通道可叠加,RF=样本+属性)。结合策略按个体质量分布定:性能相近宜简单平均(加权未必更优、学得的权重还易过拟合),性能悬殊才宜加权,异质概率输出必须先校准再混投,Stacking 必须用交叉验证产生的 held-out 预测训练次级层否则泄露。 --- ## A1 — 书中的应用 (Past Applicat