golden-datasetlisted
Install: claude install-skill ArieGoldkin/claude-forge
# Golden Dataset
**Curate, manage, and validate high-quality test datasets for AI/ML systems**
## Overview
A **golden dataset** is a curated collection of high-quality examples used for regression testing, retrieval evaluation, model benchmarking, and reproducibility. This skill covers the full lifecycle: curating new entries with quality analysis, managing backup/restore operations, and validating data integrity.
### Example Golden Dataset Metrics
| Metric | Value |
|--------|-------|
| Documents | 98 completed |
| Chunks | 415 embedded segments |
| Test queries | 203 with expected results |
| Pass rate | 91.6% retrieval quality |
**Purpose:** Test hybrid search (vector + BM25 + RRF), validate metadata boosting, detect retrieval regressions, benchmark embedding models.
---
## Curation
Quality criteria, workflows, and multi-agent analysis patterns for evaluating and adding documents to the golden dataset.
**Key areas:**
- **Content type classification** -- article, tutorial, research paper, documentation, video transcript, code repository
- **Difficulty stratification** -- trivial, easy, medium, hard, adversarial (based on semantic complexity)
- **Quality dimensions** -- accuracy (0.25), coherence (0.20), depth (0.25), relevance (0.30)
- **Multi-agent pipeline** -- parallel evaluation with Quality Evaluator, Difficulty Classifier, Domain Tagger, Query Generator
- **Duplicate prevention** -- URL check + semantic similarity > 80% threshold
**Detailed patterns:** [ref