--- name: eval-repair description: 分析评测错误,并为针对性训练集/评测集补充生成可 review 的数据计划。 when_to_use: 当用户提供评测结果、模型判错样本或带标签错误 case,并希望补充训练/评测数据时使用。 aliases: error-repair, eval-data allowed_tools: read_file, write_file, edit_file, grep_search, glob_search, ask_user_question --- 使用这个 skill 处理“已有评测错误 -> 错误分析 -> 人工 review 问题类别 -> 数据生成计划 -> canonical records -> 导出”的工作流。 ## 输入假设 用户可能会提供一个或多个文件,里面包含: - query 或多轮对话 - 期望/正确 label - 模型预测 label - 可选的 tts - 可选的原因、垂域、模型版本、设备或其他元数据 输入格式可能每次不同。不要在检查文件前假设列名。 ## 必要工作流 1. 读取用户提供的评测/错误文件;如果没有路径,先询问。 2. 识别已有字段,以及缺失的 canonical record 必填字段。 3. 生成错误分析笔记,至少包含: - top 混淆对 - 反复出现的 query 模式 - 代表性样例 - 缺失或不明确的字段 4. 提出可供人工 review 的问题类别。 5. 如果类别边界不清,先请用户确认,再制定生成计划。 6. 创建生成计划,说明: - 目标问题类别 - 目标 label - 计划生成数量 - 要生成的正例、反例、边界例 - 必要元数据 7. 只有在计划清楚后,才生成或请求 canonical records。 8. TODO:工具实现后,在预览或导出前运行 `data_agent_validate_dataset_records`。 9. TODO:工具实现后,运行 `render_dataset_preview` 和 `export_dataset`。 ## 当前工具状态 当前先使用已有工具完成文件检查和产物写入: - `read_file` - `write_file` - `edit_file` - `grep_search` - `glob_search` - `ask_user_question` 规划中的数据工具不一定已经实现。除非用户确认当前分支已经实现,否则不要直接调用不存在的工具。 ## 推荐产物 ```text output/eval_errors_context.md output/error_analysis.md output/generation_plan.md output/generated_candidates.jsonl output/open_questions.md ``` 上面的 `output/...` 是逻辑文件名,实际路径必须位于当前 session/output。临时脚本、抽样缓存和中间文件必须位于当前 session/scratchpad。 ## 约束 - 在 canonical records 达成一致并通过校验前,不要直接导出最终训练/评测格式。 - 不要把自动聚类当成最终事实,聚类和类别命名必须可 review。 - 面向人的总结要简洁,并尽量用样例支撑。 - 不要在项目根目录、源码目录或其他非 session 目录创建本任务产物;用户明确指定外部目标文件时除外。