← ClaudeAtlas

pdf-to-mdlisted

Use this skill when the user wants to convert PDF files to Markdown using Docling. This includes converting single PDFs, batch-converting directories of PDFs, extracting structured content (headings, tables, lists) from academic papers, converting scanned documents with OCR, or configuring Docling pipeline options for table detection and image extraction.
Bauhaus-InfAU/infau-skill-base · ★ 0 · Data & Documents · score 61
Install: claude install-skill Bauhaus-InfAU/infau-skill-base
# PDF to Markdown Conversion (Docling) ## Overview Convert PDF documents to structured Markdown using the [Docling](https://docling-project.github.io/docling/) library. Docling uses ML models to understand document layout, preserving headings, tables, lists, and reading order. For advanced pipeline configuration, OCR settings, and performance tuning, see reference.md. ## Quick Start ```python from docling.document_converter import DocumentConverter converter = DocumentConverter() result = converter.convert("document.pdf") markdown = result.document.export_to_markdown() with open("document.md", "w", encoding="utf-8") as f: f.write(markdown) ``` **Install:** `pip install docling` ## Docling Library ### Basic Conversion ```python from docling.document_converter import DocumentConverter converter = DocumentConverter() result = converter.convert("paper.pdf") # Export as Markdown md = result.document.export_to_markdown() # Page count print(f"{len(result.document.pages)} pages") ``` ### Batch Conversion ```python from pathlib import Path from docling.document_converter import DocumentConverter converter = DocumentConverter() output_dir = Path("markdown_outputs") output_dir.mkdir(exist_ok=True) for pdf in Path("papers/").glob("*.pdf"): result = converter.convert(str(pdf)) md = result.document.export_to_markdown() (output_dir / f"{pdf.stem}.md").write_text(md, encoding="utf-8") print(f"Converted {pdf.name}") ``` ### Custom Output Path ```python f