← ClaudeAtlas

doc-extractlisted

Corpus-agnostic примитивы для извлечения plain text из документов: PDF (text layer + scan detect), сканированный PDF через OCR (PyMuPDF + Tesseract rus+eng), legacy Office (.doc/.ppt/.rtf через LibreOffice), .pptx, .csv, spreadsheets (.xls/.xlsx). Importable-функции, своего корпуса нет. Use when a pipeline needs arbitrary office/PDF → text и базового docx/txt/md-экстрактора `docs-rag` не хватает.
VibeEngineering-LLC/agent-ops-doctrine · ★ 0 · Data & Documents · score 72
Install: claude install-skill VibeEngineering-LLC/agent-ops-doctrine
# doc-extract Per-файловые **примитивы извлечения текста**, в��несенные из `radon-library` (2026-06-18) для переиспользования между скиллами. Скилл — это **библиотека функций**, он не хранит корпус, не пишет отчёты и ничего не оркеструет: walk/реестры/`*_report.json` остаются в скилле-потребителе (например `radon-library`). ## Слой ``` docs-rag базовый extract_text: .docx / .txt / .md (фундамент) └─ doc-extract + PDF (текст-слой + детект скана), OCR скана, legacy .doc/.ppt/.rtf (LibreOffice), .pptx, .csv, .xls/.xlsx/.xlsm ``` doc-extract сидит НАД docs-rag: для .docx/.txt/.md по-прежнему вызывайте `docs-rag.extract.extract_text`, doc-extract его не дублирует. ## markitdown — turnkey «что угодно → markdown» (+ MCP-сервер) С 2026-06-19 в окружении есть **Microsoft markitdown 0.1.5** (установлен через `uv tool`): CLI `C:\Users\<you>\.local\bin\markitdown.exe`, пакет в `...\AppData\Local\Packages\Claude_pzs8sxrjxfjjc\LocalCache\Roaming\uv\tools\markitdown\`. Это готовый конвертер БЕЗ кода: `markitdown <in> -o <out.md>` (или stdout). Покрытие конвертеров (проверено по `converters\*.py`): docx, pptx, xlsx, pdf, html, epub, csv, image (EXIF + опц. LLM-caption), outlook `.msg`, ipynb, zip, rss, wikipedia, youtube, bing-serp, audio (транскрипция). docx→md round-trip проверен на нашем отчёте — GFM-таблицы, кириллица, escape целы. **MCP-сервер `markitdown-mcp`** зарегистрирован в `C:\Users\<you>\.claude.json` → `mcpServers.markitdown` (transport