← ClaudeAtlas

self-evolvelisted

Use to autonomously self-improve a skill/repo via reflect/propose/evaluate/judge/accept behind an un-gameable eval gate. Triggers: self-evolve, 自迭代/进化 skill, 优化仓库.
DaizeDong/self-evolve · ★ 1 · AI & Automation · score 74
Install: claude install-skill DaizeDong/self-evolve
# self-evolve (SKILL) 指向任意 skill / 仓库 / 项目,在 git worktree 沙箱内多轮自动改进它,用不可 game 的 提交门保证「**被采纳 = 真改进**」。 **方法论恒定,信号来源自适应。** reflect → propose → evaluate → judge → accept,全程 反自欺;唯一随目标变的是「评测信号从哪来」。 > **能跑就跑,能核就核,都不能就生成场景让异质判官评,所以没有不能进化的目标。** ## 统一评测框架(评测策略,不是目标等级) 只要目标意图可抽取、可操作化,信号就能造出来,故不存在不可评的目标。下面三者是同一 `evaluate` 契约的三个 **provider**,可叠加(`A+B`、`C+B`…),按可核验强度排序,往上尽量 取、取不到向下兜底,底永远存在: | 评测策略 | 取信号的方式 | 何时用 | 强度 | |---|---|---|---| | **A 程序裁决** | 跑目标自带 / 可生成的测试,pass/fail | 有可执行判据(含可为其生成测试) | 最高(确定、可重放) | | **B 锚核验** | 改进主张拆成可独立核验的事实锚(URL/文献/SEC/可复现命令),逐锚 verify | 「对���系于外部事实 | 高(独立源、可抽 holdout) | | **C 生成评测** | harness 生成场景 + rubric,交异质判官(Claude×Codex,prompt 无真值)盲评 | 前两者都取不到 | 较低(异质 + 防合谋闸补强) | **C 不是「兜底差等舱」,是第三种合法信号通道**:对任何目标都能生成使用场景、从意图写出 可打分 rubric、让两个异质模型盲评取一致性。「取不到任何信号」在工程上不存在。纯 C 默认 走人审落地,是信号最弱时把终判交回人的审慎,**不是「目标不可用」**。 (**落地状态**:C 的「真 coverage(场景对意图的覆盖率)」与对 A/B 的 accept 端平权由 scenario-eval 模块承载;当前代码对纯主观 C 仍取保守处理,`coverage=0`、权重偏低、默认 人审,平权是 scenario-eval 的设计 / 落地方向。)详见 [`docs/philosophy.md`](docs/philosophy.md)、[`reference/signal-providers.md`](reference/signal-providers.md)。 ## Pipeline ``` ┌──────────────────── 一次迭代 ────────────────────┐ PROFILE ──► REFLECT ──► PROPOSE ──► PATCH ──► EVALUATE ──► JUDGE ──┐ (定信号源) (读历史) (出方案) (落沙箱) (取信号) (码裁决) │ │ accept/reject/rollback └────────────────────◄── LOOP ◄────────────────────────────────┘ │ 命中自欺/熔断 → PAUSE(人审)