← ClaudeAtlas

harness-evolvelisted

面向 Agent workspace(OpenClaw / Claude Code / LangGraph / 任何有"系统配置文件 + 运行日志"概念的框架)的自进化 skill——一次运行走完整闭环:追踪前沿研究 → 精读分析 → 系统自检 → 按 L1/L2/L3 风险分级自主执行或提案。触发词:"运行自进化"、"跑一次 harness evolve"、"检查一下系统有没有能优化的地方"、"今天有什么新研究可以落地"、"帮我看看 agent 配置是不是该收敛了"。
AgentGameLab/skills · ★ 0 · AI & Automation · score 75
Install: claude install-skill AgentGameLab/skills
# Harness Evolve — Agent 系统自进化引擎 > 一次运行 = 一条完整闭环:**搜前沿 → 读懂它 → 照镜子 → 分级动手**。 > 不是"读论文写笔记",也不是"盲目自动重构",而是把研究发现和系统自检结果, > 用同一套风险分级规则,转成**安全、可验证、可回滚**的动作。 --- ## v3.0 定位说明 v1.x/v2.x 把"只研究"和"消费研究 + 执行"拆成两个 skill(harness-research / harness-evolve), 理由是怕研究阶段的直觉污染执行判断。实践下来,多数使用场景是单 Agent 单会话跑一次就想要结果, 拆两个 skill 只是增加了"先跑哪个、日志同不同步"的心智负担。 v3.0 合并成一条流程,但**把原来靠"物理隔离两个 skill"守住的安全边界,改成靠"流程内部的强制关卡"守住**: 研究结论不能跳过风险分级直接变成执行动作——第 4 步系统自检和第 5 步分级执行之间必须有明确判断, 高风险项(L3)依然禁止在本次运行内直接改文件。**边界没有消失,只是从"两个文件"收进了"一个流程里的强制关卡"。** --- ## 一句话定位 当你想让一个**正在运行的 Agent workspace** 持续变好时,用这个 skill 跑一次: 1. 向外看世界(outward):最近 ≤3 天 Agent harness / 记忆编排 / 多智能体领域有什么新发表 2. 向内照镜子(inward):当前系统配置有没有冗余、冲突、积压、退化 3. 向后落地(action):能安全直接改的直接改,中风险的写提案等审核,高风险的只记录不动手 **终点不是"我看了什么",而是"系统今天有没有变得更清楚、更少冲突、更少债务"。** --- ## 职责边界 ### 本 skill 负责 - 读取当前项目 / workspace 的真实配置结构,找到真正决定行为的文件 - 在时间窗口内搜索前沿材料并精读分析 - 对当前系统做结构自检(冗余/冲突/积压/退化/债务) - 把研究发现 + 自检结果,按 L1/L2/L3 风险分级转成动作 - 写入统一进化日志,输出可用于日报的摘要 ### 本 skill 不负责 - 不允许"觉得有启发"直接等于"应该立刻上线"——必须过风险分级 - 不在没有安全边界定义(safe_files / review_file 未知)时改任何文件 - 不对高风险项(DB migration、auth/RLS、CI/CD、删 ADR)动手,只能观察上报 - 不重复分析日志里已出现过的标题 / URL - 不用平庸内容凑数——没发现就写没发现 一句话:**这条流程可以又搜又改,但改多深由风险分级说了算,不由"看起来值得"说了算。** --- ## 执行约束(贯穿全程) - **证据优先**:结论必须有论文/文章/工程案例依据,直觉只能指导搜索方向 - **场景优先**:从当前 workspace 的真实问题倒推,不从"这个论文看起来很酷"正推 - **单变量**:每条落地建议只描述一个主要变量,避免捆绑多个改动 - **诚实高于数量**:没有高质量发现 / 没有系统问题,就如实记录,不用平庸内容污染日志 - **去重铁律**:已记录过的标题 / URL 不重复分析,哪怕换了搜索词命中 - **风险分级不可跳过**:任何"可落地方向"落地前,必须先过第 5 步的 L1/L2/L3 判断 --- ## 第 0 步:读取项目 /