← ClaudeAtlas

pdf-extractlisted

Extrakce ručních poznámek, zvýraznění, podtržení a označených obrázků z PDF knih. Detekuje barevné anotace (zelené, žluté, červené, modré, černé) a vytvoří strukturovaný .md soubor s přepisem.
jmech-pepa/pepa-claude-toolkit · ★ 0 · Data & Documents · score 51
Install: claude install-skill jmech-pepa/pepa-claude-toolkit
# PDF Extract – extrakce poznámek z knih v5.0 (script-backed) ## Kdy použít - Uživatel chce vytáhnout své ruční poznámky a zvýraznění z PDF knihy - Trigger fráze: "extrahuj poznámky", "poznámky z PDF", "/pdf-extract", "vytáhni z knihy" ## Vstup - Cesta k PDF souboru (povinné) - Volitelně: výstupní cesta, konkrétní rozsah stran ## Kontext uživatele - Uživatel anotuje **digitálním perem na tabletu** - Typické anotace: čárky u textu, ohraničení pasáží, podtržení, sem tam ruční poznámka - Tahy jsou **vždy nepravidelné** (nikdy dokonale rovné) – to je klíčový rozlišovací znak od tištěného obsahu - Schémata a diagramy v knize mají být **zachovány jako obrázky**, NE převáděny na text ## Architektura — AI dělá úsudek, skript mechaniku **Veškerá deterministická logika žije v `~/.claude/skills/pdf-extract/scripts/detect.py`** (JSON na stdout, progress na stderr). Detekční pravidla, prahy a draze zaplacené poučky z verzí v3–v4.1 (fill-only paths neviditelné v PNG, řazení merge_ranges dle y_min, margin=15, rozlišení ručního tahu od layoutu) jsou zapsané ve skriptu jako kód + komentáře — **při úpravách logiky edituj skript, nepiš ad-hoc Python do session**. AI (tato session + subagenti) dělá jen to, co skript neumí: vizuální čtení ručního textu, interpretaci složitých stran, sestavení výstupu. ``` scan → kategorizace stran: simple / marginal / complex extract-simple → strany s vestavěnými PDF anotacemi (highlight/underline/strikeout) → hotový markdown extract-margins →