Files
zk-data-agent/skills/eval-repair/SKILL.md
T
2026-05-08 17:09:07 +08:00

2.7 KiB

name, description, when_to_use, aliases, allowed_tools
name description when_to_use aliases allowed_tools
eval-repair 分析评测错误,并为针对性训练集/评测集补充生成可 review 的数据计划。 当用户提供评测结果、模型判错样本或带标签错误 case,并希望补充训练/评测数据时使用。 error-repair, eval-data read_file, write_file, edit_file, grep_search, glob_search, ask_user_question

使用这个 skill 处理“已有评测错误 -> 错误分析 -> 人工 review 问题类别 -> 数据生成计划 -> canonical records -> 导出”的工作流。

输入假设

用户可能会提供一个或多个文件,里面包含:

  • query 或多轮对话
  • 期望/正确 label
  • 模型预测 label
  • 可选的 tts
  • 可选的原因、垂域、模型版本、设备或其他元数据

输入格式可能每次不同。不要在检查文件前假设列名。

必要工作流

  1. 读取用户提供的评测/错误文件;如果没有路径,先询问。
  2. 识别已有字段,以及缺失的 canonical record 必填字段。
  3. 生成错误分析笔记,至少包含:
    • top 混淆对
    • 反复出现的 query 模式
    • 代表性样例
    • 缺失或不明确的字段
  4. 提出可供人工 review 的问题类别。
  5. 如果类别边界不清,先请用户确认,再制定生成计划。
  6. 创建生成计划,说明:
    • 目标问题类别
    • 目标 label
    • 计划生成数量
    • 要生成的正例、反例、边界例
    • 必要元数据
  7. 只有在计划清楚后,才生成或请求 canonical records。
  8. TODO:工具实现后,在预览或导出前运行 data_agent_validate_dataset_records
  9. TODO:工具实现后,运行 render_dataset_previewexport_dataset

当前工具状态

当前先使用已有工具完成文件检查和产物写入:

  • read_file
  • write_file
  • edit_file
  • grep_search
  • glob_search
  • ask_user_question

规划中的数据工具不一定已经实现。除非用户确认当前分支已经实现,否则不要直接调用不存在的工具。

推荐产物

output/eval_errors_context.md
output/error_analysis.md
output/generation_plan.md
output/generated_candidates.jsonl
output/open_questions.md

上面的 output/... 是逻辑文件名,实际路径必须位于当前 session/output。临时脚本、抽样缓存和中间文件必须位于当前 session/scratchpad。

约束

  • 在 canonical records 达成一致并通过校验前,不要直接导出最终训练/评测格式。
  • 不要把自动聚类当成最终事实,聚类和类别命名必须可 review。
  • 面向人的总结要简洁,并尽量用样例支撑。
  • 不要在项目根目录、源码目录或其他非 session 目录创建本任务产物;用户明确指定外部目标文件时除外。