← ClaudeAtlas

dolphindb-machinelearninglisted

DolphinDB Web 侧机器学习数据工作流技能。用于数据清洗、特征工程、分类、回归和聚类的机器学习任务。
dolphindb/DolphinX_Skill · ★ 8 · Web & Frontend · score 57
Install: claude install-skill dolphindb/DolphinX_Skill
# 用途 将本技能作为 DolphinDB Web 侧 ML 链路的唯一入口。它覆盖从数据源发现、原始建模数据选择、角色推断、清洗、特征工程到分类、回归和聚类的一次性聊天交付。 本技能提供的是“决策规则 + 脚本块参考”,不是硬编码流水线。Agent 应根据用户目标、schema、样本和当前平台能力选择必要模块;脚本块用于提供可执行写法和审计证据,不能替代业务判断。 # 约束 - DOS 资源是一次性脚本块,不是函数库。复制脚本块并替换占位变量;不要整文件运行,不要定义或调用自定义函数。若平台已有等价工具或执行器,可以复用工具实现,但必须遵守 reference 中的阶段约束和输出说明。 - 查询必须有界并经过 schema 校验;不要编造数据库名、表名或列名。 - 原始建模数据选择必须在清洗前完成。涉及未来窗口标签时,标签应在原始数据阶段物化;不要把“未来标签稍后在特征工程中构建”作为默认方案。 - 角色推断时,用户显式选择优先于启发式规则。监督学习标签有歧义时,必须请求确认。 - 清洗和特征工程是默认强制确认点。清洗结果出来后必须汇报清洗方案、行列影响、填充/删除/标记数量、跳过步骤和警告,并等待用户确认;特征工程结束后必须汇报特征构建方案、特征族、数量、排除原因、泄漏检查和对齐结果,并等待用户确认。 - 分类和回归训练必须先用 `sqlDS(<select * from webTrain>)` 构造训练数据源;预测输入必须是 table。聚类必须先把动态特征列构造成 table,再调用 `kmeans` 或 `predict`。同一类 ML API 连续失败 2 次后,先跑最小 API 验证,不要扩大脚本继续猜。 - 分类标签必须使用从 0 开始的整数编码列。原始标签是字符串、SYMBOL、yes/no 或非连续编码时,先运行分类标签编码块,再用编码列作为 `webLabelCol`。 - 分类任务遇到明显类别不均衡时,只把欠采样作为默认内置处理方式;欠采样只能作用于训练数据,不能改变验证集和测试集的原始类别分布。 # 路由 先判断请求类型,再按对应模块链路执行。每个链路都先读取本文件和 `dolphindb-machinelearning/references/stage-script-map.md`,再只读取当前任务需要的 reference 和 DOS 文件。 - 查询、预览、过滤、聚合、join、schema 发现:使用 query 模块。读取 `dolphindb-machinelearning/references/query-guidance.md`,需要脚本时读取 `dolphindb-machinelearning/scripts/query_reference.dos`。 - 字段角色推断:使用 role 模块。读取 `dolphindb-machinelearning/references/role-policy.md`,需要脚本时读取 `dolphindb-machinelearning/scripts/role_reference.dos`。 - 原始建模数据选择:执行 query -> role -> raw-data selection。读取 `dolphindb-machinelearning/references/raw-data-selection-guide.md`,并按需参考 `query_reference.dos` 与 `role_reference.dos` 的聚合、join、未