ml-semisupervisedlisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 半监督学习 — 未标记数据不是免费的午餐,先验资再用
## R — 原文 (Reading)
> ""聚类假设"(cluster assumption),即假设数据存在簇结构,同一个簇的样本属于同一个类别。……另一种常见的假设是"流形假设"(manifold assumption),即假设数据分布在一个流形结构上,邻近的样本拥有相似的输出值。"
>
> — 周志华, 《机器学习》第13章 13.1节 "未标记样本"
> "此类方法有一个关键:模型假设必须准确,即假设的生成式模型必须与真实数据分布吻合;否则利用未标记数据反倒会降低泛化性能。……遗憾的是,在现实任务中往往很难事先做出准确的模型假设,除非拥有充分可靠的领域知识。"
>
> — 周志华, 《机器学习》第13章 13.2节 "生成式方法"
> "不同视图、不同算法、不同数据采样、不同参数设置等,都仅是产生差异的渠道,而非必备条件。"
>
> — 周志华, 《机器学习》第13章 13.5节 "基于分歧的方法"
---
## I — 方法论骨架 (Interpretation)
未标记样本不含标签,却含有数据分布的信息——前提是你能把"分布"和"标记"挂钩起来。这个挂钩就是桥梁假设:聚类假设(同簇同类别)或流形假设(邻近样本输出相似),本质都是"相似的样本拥有相似的输出"。所有半监督方法的收益与风险都压在这座桥上。
三条纪律:
1. **先验资**:标记数据真的不够吗?若监督基线已达要求,引入半监督等于凭空增加一层假设风险——免费的午餐可能有毒。
2. **查同源**:未标注样本必须与标注样本来自同一分布(独立同分布采样)。分布错位时,海量廉价数据会把模型拽向错误的结构。
3. **按领域知识选路线**:生成式方法要求模型假设准确(需强领域知识背书,EM 求解);半监督 SVM 押注"低密度分隔";基于分歧的方法对模型假设最宽容——分歧才是本质,多视图只是产生分歧的渠道之一(不同算法/采样/参数皆可);图方法概念清晰但撞 O(m²) 存储墙,且天生直推(封闭世界,新样本要重构图或另补预测器)。
最后的安全阀:永远保留纯监督基线对照——加了未标记数据后在同一验证协议下不升反降,立即回退并按病灶定位排查。"安全半监督"至今仍是未决问题,所以对照纪律不是可选的礼貌,是唯一的防线。
---
## A1 — 书中的应用 (Past Application)
### 案例 1: 瓜田问瓜——主动学习 vs 半监督的三岔口 (c32)
- **问题**: 丰收季来到瓜田,瓜农只抱来三四个好瓜、指着五六个说还需再生长些时日——不到十个带标记的瓜训练分类器太少,地里满地的未标记瓜能不能用上?
- **方法论的使用**: 作者把"用未标记瓜"拆成三条路逐一辨析:(1) 让模型先训一个、自己挑"对改善性能帮助最大"的瓜去问瓜农,问完加进训练集重训再挑——这是主动学习,花查询成本买专家信息;(2) 不与任何专家交互,直接利用未标记瓜携带的分布信息——这是半监督。直观演示:待判别瓜恰好位于一正一反两个标注瓜的正中间,只能瞎猜;但观察到周围未标记瓜聚出的簇后,可有把握判为正类(聚类假设落地)。(3) 请瓜农把地里全部瓜标完再用——耗费大量人力物力,被否定。
- **结论**: 未标记样本虽无标记,却在"与有标记样本同分布"的前提下揭示了数据分布结构,可在标记稀缺时大幅助力建模;医学影像(影像海量、请专家全标病灶不现实)与网页推荐(极少用户愿花时间打标、互联网网页近乎无限)是同一结构的两个现实