harness-benchlisted
Install: claude install-skill DaeSeokSong/oh-my-ouroboros
# Harness Bench (Before/After 측정)
> **목적**: 시스템 변경(룰/스킬/agents)의 효과를 객관적으로 측정한다. "감으로 좋아진 듯"이 아닌 "수치로 N% 개선" 보고.
## 트리거
| 트리거 | 시점 |
|--------|------|
| 명시적 호출 (`/harness-bench init "..."`) | 측정 시작 |
| learner 자동 룰 추가 직후 | 신규 룰의 효과 검증 |
| 사용자 "효과 측정해" / "비교해" 명시 | 즉시 |
## 사용 흐름
### 1. 초기화
```
bash ~/.claude/scripts/harness-bench.sh init "loss function 수정 작업" "bench-loss-202605"
```
→ `~/.claude/_bench/bench-loss-202605.md` 생성
### 2. Before 측정 (변경 전 상태에서 작업 실행)
1. 동일 작업을 변경 **전** 룰로 실행
2. 결과 수집 (예: QA 통과 여부, 시도 횟수, 사용 토큰, 사용자 개입 횟수)
3. 기록:
```
bash ~/.claude/scripts/harness-bench.sh before "bench-loss-202605" "시도 3회, 사용자 개입 2회, QA FAIL 1회 후 통과"
```
### 3. 룰/스킬 변경 적용
### 4. After 측정 (변경 후 상태에서 동일 작업 실행)
1. 동일 작업을 변경 **후** 룰로 실행
2. 결과 수집
3. 기록:
```
bash ~/.claude/scripts/harness-bench.sh after "bench-loss-202605" "시도 1회, 사용자 개입 0회, QA 1회 통과"
```
### 5. 비교 보고
스크립트가 자동으로 Before/After 차이 stdout 출력.
## 측정 지표 권장 (Anthropic 하네스 강화 루프)
| 지표 | 의미 | 좋은 변화 | Gate 역할 |
|------|------|---------|----------|
| 시도 횟수 (`attempts`) | 작업 완료까지 반복 | 감소 | **게이트 대상** |
| 사용자 개입 (`interventions`) | main 에스컬레이션 횟수 | 감소 | **게이트 대상** |
| QA FAIL (`qa_fail`) | 검증 실패 횟수 | 감소 | **게이트 대상** |
| 사용 토큰 (`tokens`) | 누적 토큰 (대략) | 감소 | **모니터 전용 — 게이트 제외** (Goodhart 차단) |
| 작업 시간 | 시작~완료 시간 | 감소 | 참고 |
| preference-gate 통과율 | gate exit 0 비율 (3사이클 기준) | 증가 | 메타 지표 |
| tier별 후보 수 | Tier-1 통과 / reject 후보 건수 | Tier-1 통과↑ | 메타 지표 |
## Mem0 통합
After 측정 완료 시 `code_pattern` 카테고리에 효과 저장:
```
add_memory(
text=