omnimedia

Solid

Multimodal AI - Gemini for analysis (vision/transcribe/OCR/extract); image generation via Codex (ChatGPT subscription), Gemini/Imagen, OpenRouter, MiniMax; video, speech, music via Gemini + MiniMax. Use when the user asks to analyze, transcribe, OCR, or describe an image/audio/video/document, or to generate an image, video, voiceover, or music.

AI & Automation 7 stars 0 forks Updated today MIT

Install

View on GitHub

Quality Score: 84/100

Stars 20%
30
Recency 20%
100
Frontmatter 20%
70
Documentation 15%
100
Issue Health 10%
80
License 10%
100
Description 5%
100

Skill Content

# Omnimedia Process audio, images, videos, documents using Gemini. Generate images via **Codex (ChatGPT subscription)**, Google/Imagen, OpenRouter, or MiniMax. Generate videos, speech, music via Gemini + MiniMax. ## Setup ```bash # Google Gemini (analysis + image/video gen) export GEMINI_API_KEY="your-key" # https://aistudio.google.com/apikey # OpenRouter (optional image-generation router / non-Google models) export OPENROUTER_API_KEY="your-key" # https://openrouter.ai/settings/keys # MiniMax (image/video/speech/music gen) export MINIMAX_API_KEY="your-key" # https://platform.minimax.io/user-center/basic-information/interface-key pip install google-genai python-dotenv pillow requests # Codex CLI (subscription image gen - no API key required) brew install codex # or per https://developers.openai.com/codex/cli codex login # ChatGPT Plus/Pro/Business/Enterprise/Edu codex login status # expects: "Logged in using ChatGPT" ``` ### API Key Rotation (Optional) For high-volume Gemini usage, configure multiple keys: ```bash export GEMINI_API_KEY="key1" export GEMINI_API_KEY_2="key2" # auto-rotates on rate limit ``` ## Quick Start **Verify setup**: `python scripts/check_setup.py` **Analyze media**: `python scripts/gemini_batch_process.py --files <file> --task <analyze|transcribe|extract>` **Generate (Codex subscription)**: `python scripts/gemini_batch_process.py --task generate --provider codex --prompt "desc"` **Generat...

Details

Author
vanducng
Repository
vanducng/skills
Created
4 months ago
Last Updated
today
Language
HTML
License
MIT

Integrates with

Bundled in these plugins

Similar Skills

Semantically similar based on skill content — not just same category

Data & Documents Solid

ai-multimodal

Process and generate multimedia content using Google Gemini API. Capabilities include analyze audio files (transcription with timestamps, summarization, speech understanding, music/sound analysis up to 9.5 hours), understand images (captioning, object detection, OCR, visual Q&A, segmentation), process videos (scene detection, Q&A, temporal analysis, YouTube URLs, up to 6 hours), extract from documents (PDF tables, forms, charts, diagrams, multi-page), generate images (text-to-image, editing, composition, refinement). Use when working with audio/video files, analyzing images or screenshots, processing PDF documents, extracting structured data from media, creating images from text prompts, or implementing multimodal AI features. Supports multiple models (Gemini 2.5/2.0) with context windows up to 2M tokens.

394 Updated 4 days ago
Microck
Web & Frontend Listed

gemini-webapi

Use Google Gemini (via the local tools/gemini toolkit) to generate ad scripts, voiceover scripts, documents, marketing copy, AI images for ads/storyboards, short video clips, and audio/music beds. Trigger when the user wants to "use Gemini" to write, narrate, generate images, generate video, generate documents, or draft ad copy/scripts inside the video-ad workspace (any project under C:\Users\user\Desktop\video-ad).

0 Updated 3 weeks ago
abdul977
AI & Automation Listed

gemini-omni

Create Gemini Omni voice resources, character resources, and Flash Preview or multimodal text-to-video tasks through RunAPI. Use when the user asks an agent to create or manage Gemini Omni audio voices, character resources, or video. Default to the RunAPI CLI for one-off calls; use SDKs only when integrating RunAPI into an app or backend.

1 Updated 4 days ago
runapi-ai