diff --git a/skills/model-iteration/SKILL.md b/skills/model-iteration/SKILL.md index 85f78a2..33f164a 100644 --- a/skills/model-iteration/SKILL.md +++ b/skills/model-iteration/SKILL.md @@ -13,7 +13,7 @@ allowed_tools: read_file, write_file, edit_file, grep_search, glob_search, bash, ## 平台适配约束 - 本 skill 面向外部模型迭代工程,不要修改本平台源码目录,除非用户明确要求开发平台本身。 -- 对话内临时报告、分析摘要和中间产物优先写当前会话 `output/`;外部训练仓库、CML 目录、`/mnt/...` 路径只有在用户明确指定或确认后才写入。 +- 对话内临时报告、分析摘要和中间产物优先写当前会话 `output/`; - 修改训练数据、提交 CML 训练、部署模型、覆盖外部结果目录都属于高影响操作;执行前必须展示将要改动/提交的对象并等待用户确认。用户明确说“开始,<需求集合名>”时,可以先执行一次当前模型评测和只读分析,不要直接训练。 - 不要硬编码或输出 API key。调用模型接口时从环境变量读取 `OPENAI_API_KEY`、`OPENAI_BASE_URL`、`OPENAI_MODEL` 或用户当前配置。 - 优先使用 `python_exec` 做结构化分析和报表汇总;只有需要调用 CML、git、系统命令或已有脚本时才使用 `bash`。 @@ -29,15 +29,6 @@ allowed_tools: read_file, write_file, edit_file, grep_search, glob_search, bash, 不只是跑通流程,而是每一轮都要能回答:"这轮验证了什么?学到了什么?下一轮改什么?" -## Setup - -1. 读取 `config.yaml` -2. 读取 `modules/` 下所有 Python 文件 -3. 验证 `verl_zk`、`ai-planning` 等目录 -4. 确认基线:若 `results/iteration_log.jsonl` 不存在,先跑基线 -5. 确认 `results/error_registry.jsonl` 存在(无则初始化为空)——用于跨轮错误追踪 -6. 确认 需求集合,需求集合在https://git.n.xiaomi.com/ai-service/ai-planning/-/tree/autoresearch-v1?ref_type=heads的data/specific_test_set下,具体由用户指定 - ## 触发规则 用户发 **"开始,<需求集合名>"**(如 `"开始,icl_test"`)→ **立即用当前模型跑一轮评测**,不再中途确认参数,直到报告完成: