← ClaudeAtlas

ml-automl-naslisted

AutoML 与 NAS 适用判断:自动化的是选择环节,数据质量仍是人的责任。用户问"要不要用 AutoML/NAS 怎么回事"、纠结搜索空间设计、少 epoch 代理评估选出的架构训完不对劲、大模型 时代还要不要自跑 NAS 时激活。动作: 划算性判定→NAS 三要素→代理偏差校准→留出终审。 与 HPO 分界: HPO 调参数,NAS 搜架构本身。 不适用于: 已定架构调参(ml-hpo-strategy)、数据质量排查(ml-leakage-defense)。 trigger: AutoML, NAS neural architecture search, DARTS, supernet
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# AutoML 与 NAS — 自动化的是选择,不是判断 ## R — 原文 (Reading) > **来源说明**: 本 skill 属扩充批D——主题超出西瓜书覆盖范围(西瓜书 f12 仅一句调参折中原则),R 段改引 AutoML/NAS 奠基文献并标注来源性质;凡无法保证逐字精确处一律标(转述)。 > Neural architecture search is defined by three components: a search space (which architectures can be represented), a search strategy (how the space is explored), and a performance estimation scheme (how candidate architectures are measured).(转述) > > — 转述自 T. Elsken 等《Neural Architecture Search: A Survey》(JMLR 2019), 第1节(来源性质:综述公认表述) > Training each candidate to convergence is prohibitively expensive; methods therefore use fewer epochs, smaller proxies, or weight sharing—but these lower-fidelity estimates introduce bias and noise into the search.(转述) > > — 转述自 T. Elsken 等 (JMLR 2019) 第4节;另见 B. Zoph & Q. Le《Neural Architecture Search with Reinforcement Learning》(ICLR 2017) 中以并行训练与早停控制成本的实践(来源性质:奠基论文公认表述) --- ## I — 方法论骨架 (Interpretation) AutoML 的本质是把"人肉试错做选择"换成"机器在定义好的空间里搜"。它自动化的只是**选择环节**,而选择的前提——空间怎么定、数据是否干净、目标是什么——仍然是人的责任。 - **AutoML 解决什么**: 表格任务的 pipeline 组合(特征预处理×��型族×超参的三重选择,如 Auto-sklearn/TPOT 的贝叶斯优化+元学习+集成);超参搜索自动化(Optuna/Hyperband);以及最深的一档——架构本身的搜索(NAS)。共同前提是:**候选空间有限且可枚举/可采样,单次评估可自动化,评价目标单一明确**。 - **NAS 三要素**: ①搜索空间——允许哪些结构存在(层数范围/算子集合/连接方式);空间太窄搜不出超越设计者的东西,太空宽则搜索成本指数爆炸;②搜索策略——在空间里怎么走(强化学习/进化算法/贝叶斯优化/可微松弛 DARTS 类);③性能估计——怎么给每个候选拍板。三要素互相牵制:空间决定策略可行性,估计精度决定策略能否学到真信号。 - **代理指标陷阱**: 完整训练每个候选不可承受,于是用少 epoch/小数据子集/权重共享(one-shot/supernet)来估性能——但这些低保真信号有系统性偏差:早停分数与最终收敛性能的相关性并不保证,权重共享下各候选互相干扰导致排名失真。**用代理指标选出的 top