← ClaudeAtlas

ml-semisupervisedlisted

标注太少、想利用大量未标注数据时的路线选型与安全纪律。用户说"只有几百条标注/未标注 数据怎么用/pseudo-label/self-training 掉点"、纠结主动学习与半监督区别、协同训练前提、 或加未标注数据反而掉点时激活。 动作: 查资格线(标注真不够?未标注同源?)→验证聚类/流形假设→选路线 (生成式/S3VM/基于分歧/图传播)→强制纯监督基线对照。 不适用于: 标注充足的监督任务、无标签聚类、自监督预训练。 trigger: semi-supervised, unlabeled data, pseudo-label, co-training, TSVM, self-training, 伪标记, 协同训练。
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 半监督学习 — 未标记数据不是免费的午餐,先验资再用 ## R — 原文 (Reading) > ""聚类假设"(cluster assumption),即假设数据存在簇结构,同一个簇的样本属于同一个类别。……另一种常见的假设是"流形假设"(manifold assumption),即假设数据分布在一个流形结构上,邻近的样本拥有相似的输出值。" > > — 周志华, 《机器学习》第13章 13.1节 "未标记样本" > "此类方法有一个关键:模型假设必须准确,即假设的生成式模型必须与真实数据分布吻合;否则利用未标记数据反倒会降低泛化性能。……遗憾的是,在现实任务中往往很难事先做出准确的模型假设,除非拥有充分可靠的领域知识。" > > — 周志华, 《机器学习》第13章 13.2节 "生成式方法" > "不同视图、不同算法、不同数据采样、不同参数设置等,都仅是产生差异的渠道,而非必备条件。" > > — 周志华, 《机器学习》第13章 13.5节 "基于分歧的方法" --- ## I — 方法论骨架 (Interpretation) 未标记样本不含标签,却含有数据分布的信息——前提是你能把"分布"和"标记"挂钩起来。这个挂钩就是桥梁假设:聚类假设(同簇同类别)或流形假设(邻近样本输出相似),本质都是"相似的样本拥有相似的输出"。所有半监督方法的收益与风险都压在这座桥上。 三条纪律: 1. **先验资**:标记数据真的不够吗?若监督基线已达要求,引入半监督等于凭空增加一层假设风险——免费的午餐可能有毒。 2. **查同源**:未标注样本必须与标注样本来自同一分布(独立同分布采样)。分布错位时,海量廉价数据会把模型拽向错误的结构。 3. **按领域知识选路线**:生成式方法要求模型假设准确(需强领域知识背书,EM 求解);半监督 SVM 押注"低密度分隔";基于分歧的方法对模型假设最宽容——分歧才是本质,多视图只是产生分歧的渠道之一(不同算法/采样/参数皆可);图方法概念清晰但撞 O(m²) 存储墙,且天生直推(封闭世界,新样本要重构图或另补预测器)。 最后的安全阀:永远保留纯监督基线对照——加了未标记数据后在同一验证协议下不升反降,立即回退并按病灶定位排查。"安全半监督"至今仍是未决问题,所以对照纪律不是可选的礼貌,是唯一的防线。 --- ## A1 — 书中的应用 (Past Application) ### 案例 1: 瓜田问瓜——主动学习 vs 半监督的三岔口 (c32) - **问题**: 丰收季来到瓜田,瓜农只抱来三四个好瓜、指着五六个说还需再生长些时日——不到十个带标记的瓜训练分类器太少,地里满地的未标记瓜能不能用上? - **方法论的使用**: 作者把"用未标记瓜"拆成三条路逐一辨析:(1) 让模型先训一个、自己挑"对改善性能帮助最大"的瓜去问瓜农,问完加进训练集重训再挑——这是主动学习,花查询成本买专家信息;(2) 不与任何专家交互,直接利用未标记瓜携带的分布信息——这是半监督。直观演示:待判别瓜恰好位于一正一反两个标注瓜的正中间,只能瞎猜;但观察到周围未标记瓜聚出的簇后,可有把握判为正类(聚类假设落地)。(3) 请瓜农把地里全部瓜标完再用——耗费大量人力物力,被否定。 - **结论**: 未标记样本虽无标记,却在"与有标记样本同分布"的前提下揭示了数据分布结构,可在标记稀缺时大幅助力建模;医学影像(影像海量、请专家全标病灶不现实)与网页推荐(极少用户愿花时间打标、互联网网页近乎无限)是同一结构的两个现实