Files
zk-data-agent/skills/eval-repair/SKILL.md
T
2026-05-08 17:09:07 +08:00

75 lines
2.7 KiB
Markdown

---
name: eval-repair
description: 分析评测错误,并为针对性训练集/评测集补充生成可 review 的数据计划。
when_to_use: 当用户提供评测结果、模型判错样本或带标签错误 case,并希望补充训练/评测数据时使用。
aliases: error-repair, eval-data
allowed_tools: read_file, write_file, edit_file, grep_search, glob_search, ask_user_question
---
使用这个 skill 处理“已有评测错误 -> 错误分析 -> 人工 review 问题类别 -> 数据生成计划 -> canonical records -> 导出”的工作流。
## 输入假设
用户可能会提供一个或多个文件,里面包含:
- query 或多轮对话
- 期望/正确 label
- 模型预测 label
- 可选的 tts
- 可选的原因、垂域、模型版本、设备或其他元数据
输入格式可能每次不同。不要在检查文件前假设列名。
## 必要工作流
1. 读取用户提供的评测/错误文件;如果没有路径,先询问。
2. 识别已有字段,以及缺失的 canonical record 必填字段。
3. 生成错误分析笔记,至少包含:
- top 混淆对
- 反复出现的 query 模式
- 代表性样例
- 缺失或不明确的字段
4. 提出可供人工 review 的问题类别。
5. 如果类别边界不清,先请用户确认,再制定生成计划。
6. 创建生成计划,说明:
- 目标问题类别
- 目标 label
- 计划生成数量
- 要生成的正例、反例、边界例
- 必要元数据
7. 只有在计划清楚后,才生成或请求 canonical records。
8. TODO:工具实现后,在预览或导出前运行 `data_agent_validate_dataset_records`
9. TODO:工具实现后,运行 `render_dataset_preview``export_dataset`
## 当前工具状态
当前先使用已有工具完成文件检查和产物写入:
- `read_file`
- `write_file`
- `edit_file`
- `grep_search`
- `glob_search`
- `ask_user_question`
规划中的数据工具不一定已经实现。除非用户确认当前分支已经实现,否则不要直接调用不存在的工具。
## 推荐产物
```text
output/eval_errors_context.md
output/error_analysis.md
output/generation_plan.md
output/generated_candidates.jsonl
output/open_questions.md
```
上面的 `output/...` 是逻辑文件名,实际路径必须位于当前 session/output。临时脚本、抽样缓存和中间文件必须位于当前 session/scratchpad。
## 约束
- 在 canonical records 达成一致并通过校验前,不要直接导出最终训练/评测格式。
- 不要把自动聚类当成最终事实,聚类和类别命名必须可 review。
- 面向人的总结要简洁,并尽量用样例支撑。
- 不要在项目根目录、源码目录或其他非 session 目录创建本任务产物;用户明确指定外部目标文件时除外。