omd-video

Solid

视频→逐段结构化笔记 (MiMo-v2.5 原生吃画面+音频, 非 whisper 转写; ���重入管线)。讲解/课程视频里 PPT 框架图/代码/提示词是画面独有、音频拿不到的信息。产 ALL-NOTES.md 交 /omd-council 或 dag_research 做综合。Trigger:/omd-video、抖音/B站/YouTube 讲解视频、课程系列、把这些视频学一遍/提炼、画面里有代码/图表/PPT。Skip:文字原文综合→/omd-council;网页内容→dag_research(检索版)。

AI & Automation 39 stars 1 forks Updated today MIT

Install

View on GitHub

Quality Score: 82/100

Stars 20%
53
Recency 20%
100
Frontmatter 20%
70
Documentation 15%
100
Issue Health 10%
50
License 10%
100
Description 5%
100

Skill Content

# /omd-video — 视频→逐段结构化笔记 (MiMo 多模态) > 讲解类视频画面有大量 PPT/框架图/提示词/代码 = 音频拿不到 → MiMo-v2.5 **原生吃视频**(画面+音频),非 whisper 转写。确定性五阶段管线,**可重入**(已产出阶段自动跳过):discover/enumerate→download→segment→fanout→aggregate。综合/蒸馏不在本管线内——产物 `ALL-NOTES.md` 交给 omd dag 引擎。 ## 何时用 抖音/B站/YouTube 讲解视频或课程系列要提炼成知识;画面信息密集(代码/图表/PPT)、音频拿不全的内容采集。 ## 何时不用(边界) 已有**文字**原文要多视角综合 → `/omd-council`;要 web 页面内容/多源事实 → `dag_research`;要设计判优 → `/omd-council`。本管线只做"视频→笔记语料",综合让 dag 引擎做。 ## 入口:先定用途,再定参数(跑之前必做) 视频采集是**一次性昂贵操作**(下载+切段+N 段并发喂模型),fps/分辨率选错 = 糊了读不到 或 烧钱重跑。所以拿到 url/描述后**先判用途再定参数**——能从用户描述/URL 推断就推断,并**宣告选定参数**再跑;只有画面构成不明(它决定 fps/res,猜错最贵)才问一句。**不逐参数确认(反 ceremonial),一次问清用途即可。** 三个要素定全部参数:① 画面构成(定 fps + media_resolution)② 要提取什么(定制 prompt)③ 时长量级(分段 + 成本预警)。 | 画面构成 | `--fps` | `--media-resolution` | `--scale` | prompt 侧重 | |---|---|---|---|---| | 纯口播/访谈/播客 | 1(可 0.5) | default(无字·省钱) | 640 | 口播要点 | | PPT 幻灯讲解 | 1 | max | 960 | 屏幕文字+框架图 | | 代码演示/live coding | 2 | max | 1280 | 逐行转录代码 | | 动画/逐步 build/白板 | 2 | max | 960 | 抓状态变化时序 | | UI 操作/点选演示 | 2–3 | max | 960 | 操作步骤序列 | 「要提取什么」和 fps 正交,单独定制 fanout prompt(只要提示词模板 / 只要代码 / 完整转录 → `--prompt-file` 或改 DEFAULT_PROMPT)。**画面构成不明时问一句**:「画面主要是啥——纯人讲 / PPT / 敲代码 / 动画演示?重点抓口播还是画面里的代码/提示词?」用户答完 → 宣告选定 fps/res/scale/prompt → 跑。 ## 怎么跑 脚本自包含在本技���目录,随 omd mcp 自装到 `~/.claude/skills/omd-video/run.py`。用绝对路径调(尊重 `CLAUDE_CONFIG_DIR`): ```bash SKILL="${CLAUDE_CONFIG_DIR:-$HOME/.claude}/skills/omd-video/run.py" # 已有 url/id 列表 (每行 <url> 或 <id>|<slug>) python "$SKILL" --urls list.txt -...

Details

Author
AbyssCN
Repository
AbyssCN/oh-my-dag
Created
3 months ago
Last Updated
today
Language
TypeScript
License
MIT

Integrates with

Similar Skills

Semantically similar based on skill content — not just same category

AI & Automation Featured

video-understanding

把视频分析为结构化理解索引:场景检测、ASR 转写、逐场景 VLM 观察、静音窗口、融合时间线和写作 brief。 用于理解、索引或总结视频,也作为后续创作前的分析阶段。输入��频文件;输出 scenes.json、 asr_result.json、vlm_analysis.json、silence_periods.json、timeline_fusion.json、agent_narration_brief.md。 触发词:视频理解、视频分析、视频索引、video understanding、analyze video、看懂视频。

505 Updated 6 days ago
zenstory-ai
Code & Development Listed

video-editor

端到端的竖屏教程视频流水线:搭 workspace、建项目、转录、粗剪、HTML 特效叠加、 ASS 字幕、渲染导出。适用于抖音/小红书这类快节奏口播 + 录屏教程。触发词: "剪视频" "粗剪" "rough cut" "cut plan" "改分镜" "加特效" "花字" "叠加组件" "overlay component" "前后对比" "生成字幕" "烧字幕" "导出成片" "建视频项目" "搭 workspace" "转录" "送审" "审稿" "我改好了",或任何涉及 projects/<name>/ 下视频工程的请求。

0 Updated 1 months ago
dusty-cjh
Code & Development Listed

interflow-ip-video

把中文文稿做成 Interflow Bold-Mono 竖屏口播视频——火山引擎声音复刻配音(你自己的克隆音,1.2x 紧凑口播)、RMS 响度包络驱动口型的常驻 IP 小人(浮动/眨眼/点头/指向/抬手/欢迎)、暗底网格+辉光线稿的数据可视化(d3 平滑图表/迁移弧线/时间轴/象限等 10+ 种形式)、玻璃拟态词级字幕,渲染成 1080x1920 MP4。用户说「IP 小人视频 / 用我的声音出片 / interflow 风格文生视频 / bold-mono 出片」,或给一段中文文稿要做成带小人配音的竖屏视频时使用。

3 Updated 1 months ago
derek-zhuolin