← All creators

kau10082

User

Pre-repair station for PDF text-extraction pipelines (e.g. PDF→Markdown): when extraction yields garbled text, rebuild the text layer deterministically from font data — OCR only verifies. | PDF 文字萃取管線(如 PDF→Markdown)的前置修復站:抽出亂碼時,從字型線索確定性修復文字層,OCR 只當驗證者。

6 indexed · 0 Featured · 0 stars · avg score 70
Prolific

Categories

Indexed Skills (6)

Data & Documents Listed

pdf-text-recover

PDF「文字層亂碼」的確定性修復助手——當 pdftotext / PyMuPDF 抽出控制字元、亂碼、 U+FFFD,但檔案並非掃描版時啟動。核心主張:字型缺 ToUnicode ≠ 不可還原; `/Encoding /Differences` 與內嵌字型 charset 多半仍在,可確定性重建對照表。 OCR 只當「驗證者」,不當裁判、更不當第一手段。 交付門檻機械化:U+FFFD 歸零、連字正規化、修復腳本重跑位元級相同、雙獨立驗證路徑收斂。 觸發情境: - 「這個 PDF 抽出來是亂碼/控制字元」「文字層壞掉」「缺 ToUnicode」 - 「pdftotext 吐出一堆 \x01\x02」「複製貼上變成方塊/問號」 - 「內文正常但表格/標題是亂碼」(子集字型症狀,本 skill 的典型案例) - epub-extract 等上游 skill 遇到文字層亂碼 PDF 時轉交 - 提供 PDF 並要求「修復文字層/還原文字/不要用 OCR 硬轉」

0 Updated 4 days ago
kau10082
Data & Documents Listed

epub-extract

整本電子書(epub / PDF / docx / txt)或網頁的「結構化萃取」助手——不是摘要,是忠實抽取, 目的是讓沒讀過原文的人或另一個 AI 能據此完整重組進知識庫,不必回看原文。 核心賣點:可稽核(覆蓋清單逐項對帳)+ 大聲失敗(scripts/verify.py 抓到靜默吞圖/掉章就 exit 1)。 搭配 Claude Cowork 使用(需能讀寫本機檔案、自跑多輪工具)。 主要啟動:丟 epub/書檔 +自然語言,或用 /epub 明確召喚。 觸發情境: - `/epub`(明確召喚;雲端 Chat 適用,Claude Code 因斜線撞 CLI 建議改用自然語言) - 「把這本 epub/電子書結構化萃取」「忠實抽取這本書進知識庫」「不���摘要,要保真萃取」 - 「這本書萃取成 Obsidian 可用的 .md」「逐章抽取、附錄逐題全收」 - 「把這個網頁/線上手冊章節萃取進知識庫」「多頁手冊逐頁抽取、參考文獻逐筆保留」 - 提供 epub/PDF/docx/txt 或 URL,並要求「結構化萃取/忠實抽取/建檔用重組稿」

0 Updated 1 weeks ago
kau10082
AI & Automation Listed

transcript-fix

醫學演講/會議語音轉文字(ASR)逐字稿校稿與語意重建助手。 當使用者提供一份辨識錯誤密集的醫學逐字稿,要求校稿、清稿、語意重建或整理成可用文件時,立即啟動此 skill。 觸發情���: - 「幫我校稿這份逐字稿」「幫我清這份 ASR 稿」 - 「把這份演講錄音的逐字稿整理乾淨」 - 「語意重建」「重建逐字稿」 - 「這是同一場的另一份(或多份)逐字稿,幫我對照」 - 提供醫學演講/會議的逐字稿(中英夾雜、藥名/數據被聽錯)並要求整理 - "Help me proofread / clean up this (medical) transcript" - "Fix this ASR transcript" / "semantic reconstruction of this transcript" - "Here's another transcript of the same talk — compare them" - A medical lecture/meeting transcript (Chinese-English mix, misheard drug names or numbers) is provided with a request to clean it up

0 Updated 1 weeks ago
kau10082
Data & Documents Listed

ppt-to-md

學術/藥廠簡報(.pptx)忠實轉 Markdown 的機械式抽取管線,目標是「盡量真實還原簡報內容」。 當使用者要把投影片轉成 markdown、且在意「保留原始內容、不失真」時,立即啟動此 skill。 網頁轉檔工具吃不下的大檔(動輒 25~50MB,內嵌圖片撐大),本 skill 在本機處理、無大小限制。 主要啟動:丟 .pptx +自然語言,或用 /ppt 明確召喚。 觸發情境: - `/ppt`(明確召喚;雲端 Chat 適用,Claude Code 因斜線撞 CLI 建議改用自然語言) - 「把這份簡報/投影片/deck 轉成 markdown」「pptx 轉 markdown」「用 PPT_to_MD 轉」 - 「盡量真實還原這份學術簡報的內容」 - 「這份 pptx 太大網頁工具吃不下,幫我在本機轉」 - 「投影片裡的表格/圖表數據也要保留」「講者備註也要一起抽」 - 提供 .pptx(尤其含講者備註/圖表的學術簡報)並要求轉檔或整理成可讀的 markdown

0 Updated 1 weeks ago
kau10082
AI & Automation Listed

slide-verify

醫學簡報文字內容的「驗證 → 勘誤 → 重排 → 拆頁 →(選用)白話改寫」一條龍助手。 用 PubMed(必要時 Crossref/出版社頁面)逐條查證每個引用與數字,專抓「真文獻被用錯」的失真; 只吃已萃取的文字(ppt-to-md 產物或直接貼上的投影片文字),不吃 .pptx 二進位。 觸發情境:使用者貼上醫學簡報文字並要求「驗證/勘誤/校對」「查 reference/查數字」 「重排順序」「拆頁」「改白話」,或明確輸入 /verify。

0 Updated 1 weeks ago
kau10082
AI & Automation Listed

projectmemory

把 Notion 當作 Claude 的跨對話外部記憶庫,透過 Notion MCP 記錄與回溯專案進度。當使用者輸入 /load、/save、/save all、/idea、/status、/archive、/upgrade idea、/export obsidian 等指令,或說 「整理 X 的 Obsidian 版」「把所有專案匯出 Obsidian 版」「匯出某日期後有更新的專案」,或 「projectmemory 載入/儲存 X」「用 projectmemory skill 存 X」「依 projectmemory /save X」 「載入 X 專案記憶」「把這串存進 ProjectMemory」「記到 Notion 專案記憶」「交接這個專案」時, 務必啟動此 skill。即使使用者只說「存一下」「load 一下 EBM」而未明講 projectmemory, 只要意圖是讀寫 ProjectMemory/Session Log/Ideas 這幾個 Notion DB,就用此 skill。 但若「存一下」出現在寫程式/編輯檔案的語境(可能指存檔案、git commit),先確認 「是要存進 ProjectMemory(Notion)嗎?」再啟動,不得逕自啟動。 涵蓋 ProjectMemory DB、Session Log DB、Ideas DB、Artifacts 資料夾的所有讀寫。 (注意:純斜線指令在 Claude Code 會撞 CLI 內建指令,Code 環境請用「projectmemory + 動作」呼叫法;雲端 Chat 可直接用斜線。)

0 Updated 1 weeks ago
kau10082

Bio shown is the top-scored skill's repo description as a fallback — real GitHub bios land in a future update.