doc-extractlisted
Install: claude install-skill VibeEngineering-LLC/agent-ops-doctrine
# doc-extract
Per-файловые **примитивы извлечения текста**, в��несенные из `radon-library`
(2026-06-18) для переиспользования между скиллами. Скилл — это **библиотека функций**,
он не хранит корпус, не пишет отчёты и ничего не оркеструет: walk/реестры/`*_report.json`
остаются в скилле-потребителе (например `radon-library`).
## Слой
```
docs-rag базовый extract_text: .docx / .txt / .md (фундамент)
└─ doc-extract + PDF (текст-слой + детект скана), OCR скана,
legacy .doc/.ppt/.rtf (LibreOffice), .pptx, .csv, .xls/.xlsx/.xlsm
```
doc-extract сидит НАД docs-rag: для .docx/.txt/.md по-прежнему вызывайте
`docs-rag.extract.extract_text`, doc-extract его не дублирует.
## markitdown — turnkey «что угодно → markdown» (+ MCP-сервер)
С 2026-06-19 в окружении есть **Microsoft markitdown 0.1.5** (установлен через `uv tool`):
CLI `C:\Users\<you>\.local\bin\markitdown.exe`, пакет в
`...\AppData\Local\Packages\Claude_pzs8sxrjxfjjc\LocalCache\Roaming\uv\tools\markitdown\`.
Это готовый конвертер БЕЗ кода: `markitdown <in> -o <out.md>` (или stdout).
Покрытие конвертеров (проверено по `converters\*.py`): docx, pptx, xlsx, pdf, html,
epub, csv, image (EXIF + опц. LLM-caption), outlook `.msg`, ipynb, zip, rss, wikipedia,
youtube, bing-serp, audio (транскрипция). docx→md round-trip проверен на нашем отчёте —
GFM-таблицы, кириллица, escape целы.
**MCP-сервер `markitdown-mcp`** зарегистрирован в `C:\Users\<you>\.claude.json` →
`mcpServers.markitdown` (transport