data-analyst

Solid

BigQuery/Snowflake接続、EDA、可視化、Marimoノートブック作成を行うサブエージェント。 データ分析関連の4つのルール(data_analysis, visualization, notebook, marimo_variable_naming)を統合。 「データ分析して」「BigQueryに接続」「EDAを実行」「Marimoで分析」等のリクエストで発動。

Data & Documents 347 stars 12 forks Updated 1 weeks ago

Install

View on GitHub

Quality Score: 81/100

Stars 20%
85
Recency 20%
90
Frontmatter 20%
70
Documentation 15%
100
Issue Health 10%
50
License 10%
0
Description 5%
100

Skill Content

# Data Analyst サブエージェント BigQuery/Snowflake接続、EDA、可視化、Marimoノートブック作成を専用コンテキストで実行するサブエージェント。 > **Draft:** Marimo変数の補助Lintスクリプトは未収録。変数名の重複は手動で確認する。 ## 目的 データ分析処理をメインエージェントのコンテキストから分離し: - 4つの関連ルールをサブエージェント内に統合(約1500-3000トークン削減) - 分析結果のサマリーのみを返却 - GCP認証フローの統合 ## 統合ルール このサブエージェントは以下の4つのルールの内容を内包しています: 1. `data_analysis.mdc` - データ分析の基本原則 2. `visualization.mdc` - 可視化の品質基準 3. `notebook.mdc` - Marimo Notebook利用ルール 4. `marimo_variable_naming.mdc` - Marimo変数命名ルール --- # Part 1: データ分析の基本原則 ## 分析プロセス 1. **目的の明確化**: 分析開始前に目的・ゴール・仮説を記述 2. **データ品質の確保**: 完全性・正確性・一貫性を確認、欠損・異常値・重複の処理方針を説明 3. **バイアスと因果**: 主観的バイアスを排除、相関と因果を混同しない 4. **分析対象の理解**: カラム意味・単位・収集元・更新頻度を把握 ## ファイル整理 ``` data/ ├── raw/ # 元データ(上書き禁止) ├── intermediate/ # 中間処理データ ├── feature/ # 特徴量データ └── output/ # 最終出力 ``` **命名規則**: `{source}__{target}__{granularity}__{date}.parquet` 例: `bq__sales__daily__2025-03-01.parquet` ## EDA(探索的データ分析) - YData Profiling (`ydata-profiling`) やAutoViz (`autoviz`) を活用 - Marimoでインタラクティブに探索 - 1つのグラフに情報を詰め込みすぎない --- # Part 2: 可視化の品質基準 ## 必須ルール | ルール | 説明 | |--------|------| | 意味のあるラベル | index番号使用禁止、ユーザー名/日付/カテゴリ名を使用 | | 適切なグラフタイプ | 棒グラフ(比較)、折れ線(時系列)、ヒートマップ(2次元)| | 日本語ラベル | 専門知識なしで理解できるように | | 数値ラベル表示 | 棒の上に「1,791件」等を表示 | | タイトル/軸ラベル/凡例 | 必須 | | 高解像度 | 300 DPI以上 | ## グラフタイプ選択 | データ | 推奨グラフ | |--------|----------| | カテゴリ比較 | 棒グラフ | | 時系列 | 折れ線グラフ | | 2次元データ | ヒートマップ | | 内訳 | 積み上げグラフ | | 長いラベル | 横棒グラフ | ## matplotlib設定 ```python import matplotlib matplotlib.use('Agg'...

Details

Author
minicoohei
Repository
minicoohei/ai-agent-camp
Created
5 months ago
Last Updated
1 weeks ago
Language
Python
License
None

Integrates with

Similar Skills

Semantically similar based on skill content — not just same category

DevOps & Infrastructure Solid

monitoring-dashboard

marimoダッシュボード・プロジェクト進捗可視化に使用。 「ダッシュボードを作って」「進捗を可視化して」「テスト結果を表示して」等のリクエストで発動。

347 Updated 1 weeks ago
minicoohei
Data & Documents Solid

data-analysis-skills

当用户提供数据文件(CSV / Excel / JSON / TSV)或表格数据,想要做分析、找洞察或要一份报告时使用——例如「分析数据」「做数据报告」「帮我看看这份数据」「这批订单数据说明什么」,以及销售 / 经营 / 运营数据复盘、探索性分析(EDA)、A/B 实验评估、趋势预测,或要一份可交互的 HTML 数据报告。不适用于:搭建 dashboard 应用、网页爬取、连接线上数据库。

12 Updated 1 weeks ago
cabbage2000-lab
AI & Automation Listed

可视化规范

从数据剖析到出版级成图的完整可视化工具。先做数据剖析(列类型/样本量/分布/异常值/分组结构/相关性), 再结合论证目标推荐图型,主动拦截科研画图经典错误,产出 Nature / Science / IEEE / Elsevier / PNAS / 中文核心期刊级别的成图。覆盖数据 EDA、图表契约、选图决策、出版级绘制、程序自检 + AI 读图闭环、多格式 导出和文件审计。数学建模场景额外支持三类图体系(原始数据/过程/结果)和子问题覆盖检查。 当用户涉及论文配图、科研画图、数据可视化、选图、期刊投稿图、figure、出版级图表、matplotlib、seaborn、 plotly、误差棒、显著性标注、色盲安全配色、矢量图导出、中文论文图表、多面板时使用。

8 Updated yesterday
OrinVoss