← ClaudeAtlas

ml-rl-decision-looplisted

判断任务是否该用强化学习、选哪条路线。用户问"强化学习适不适合/reward 怎么设计/ Q-learning 和 Sarsa 区别/exploration exploitation/agent 训练不动"时激活。 动作: 验资格(延迟奖赏+序贯决策缺一不可)→模型可知否(有模型→动态规划; 免模型→蒙特 卡罗 vs 时序差分)→配探索利用折中(ε贪心/Softmax)→状态大时表格升级函数逼近。 不适用于: 一次性预测、有即时标签任务。 trigger: reinforcement learning, MDP, reward design, Q-learning, Sarsa, exploration exploitation, 奖赏函数。
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 强化学习决策环 — 先验资格,再选路线,最后配探索 ## R — 原文 (Reading) > "当我们执行某个操作(例如,施肥)时,并不能立即获得这个最终奖赏,甚至难以判断当前操作对最终奖赏的影响,仅能得到一个当前反馈(例如,瓜苗看起来更健壮了)。我们需多次种瓜,在种瓜过程中不断摸索,然后才能总结出较好的种瓜策略。" > > — 周志华, 《机器学习》第16章 16.1节 "任务与奖赏" > "若学习算法不依赖于环境建模,则称为'免模型学习'(model-free learning),这比有模型学习要困难得多。" > > — 周志华, 《机器学习》第16章 16.4节 "免模型学习" > "'探索'和'利用'这两者是矛盾的,因为尝试次数(即总投币数)有限,加强了一方则会自然削弱另一方,这就是强化学习所面临的'探索-利用窘境'(Exploration-Exploitation dilemma)。" > > — 周志华, 《机器学习》第16章 16.2.1节 "探索与利用" --- ## I — 方法论骨架 (Interpretation) 强化学习处理的是"没有老师告诉你在某状态下该做什么、只有事后结算的累积奖赏"的学习问题:机器在环境中不断尝试,学得策略 π 使长期累积奖赏最大。形式上是四元组 E=(X,A,P,R)——状态空间、动作空间、转移概率、奖赏函数。它相当于"具有延迟标记信息的监督学习",延迟二字就是一切困难的根源。 方法论是一条三级决策链。 **第一级:资格审。** 任务必须同时满足两个特征——序贯决策(动作影响后续状态)+ 延迟奖赏(好坏要许多步之后才揭晓)。缺任何一个都别用 RL:有即时标签是监督学习;一步定输赢退化成单步优化。种瓜是好例子:施肥的效果要收获时才知道,当下只有"瓜苗更健壮"这类即时信号。 **第二级:路线分岔——环境模型知道吗?** 转移概率和奖赏函数已知(或能在机器内可靠模拟)→ 有模型学习,归结为动态规划:策略评估(Bellman 递归展开)与策略改进(换入当前最优动作)交替迭代至收敛,或直接值迭代。未知 → 免模型学习,困难得多:无法全概率展开就只能真实交互采样,且估计对象要从状态值 V 换成状态-动作值 Q。采样后批更新是蒙特卡罗(整条轨迹跑完再平均,简单但慢);每走一步就更新是时序差分 TD(结合 DP 与 MC 的思想,效率更高)——Sarsa 是同策略版本(评估和执行都是 ε-贪心策略),Q-learning 是异策略版本(评估原始策略、执行 ε-贪心)。 **第三级:全程配探索纪律。** 尝试次数有限,探索(估准各动作)与利用(选当前最优)零和拉扯:仅探索估得准却没机会赢,仅利用会被开局运气锁死。折中的标配是 ε-贪心(ε 按不确定性调、可随时间衰减如 1/√t)或 Softmax(温度 τ 控制软硬);免模型评估时 ε-贪心还兼任"制造轨迹多样性"的职责——确定性策略采一万条轨迹其实是同一条。 **边界提醒**:以上全部建立在表格值函数上(每个状态一格)。状态空间连续/巨大时表格失效,需离散化(难)或值函数近似(线性起步,可换核方法/神经网络)——这是表格方法到函数逼近的分界线,跨线会引入新的不稳定来源。 --- ## A1 — 书中的应用 (Past Application) ### 案例 1: 种西瓜的 MDP 具象化 (c37) - **问题**: 种瓜从选种到浇水施肥除草杀虫,要等收获才知道瓜好不好——如何把这个过程变成机器能学的形式? - **方法论的