Files
zk-data-agent/skills/label-fast-slow-routing/references/legacy-eval-and-quality.md
T

6.1 KiB

旧评测标签迁移与质量控制

目录

文档定位

《快慢系统分发-评测集构建》是早期策略、评测集项目计划和一次候选挖掘实验的混合文档。其项目日期早于 2026.6 新标准。

使用它:

  • 解释复杂性原因。
  • 迁移旧 FAST_DIRECT / SLOW_* 数据。
  • 复用候选挖掘、人工盲标、主动学习和流量回放方法。

不要使用它覆盖新三档语义标准。

旧八类标签

旧标签 旧定义
FAST_DIRECT 当前轮可直接、安全、确定性满足
SLOW_FILTER_RANK 候选筛选、排序、优化或推荐
SLOW_DISAMBIGUATE 目标身份不确定,需先消歧
SLOW_GOAL_STATE 给目标状态,需反推参数
SLOW_WORKFLOW 多动作、多工具或显式多步骤
SLOW_CONTEXT_DEPENDENT 复杂性主要来自上文或记忆
SLOW_UNCLEAR 结合必要上下文仍不明确
SLOW_ADVANCED_CAPABILITY 不在旧快系统白名单的高级能力

旧文档没有给多原因冲突优先级。迁移时允许先保留多个原因,再选择决定性主因。

迁移到新三档

不要做固定的一对一映射。先按 2026.6 语义重标,再按需要回填最接近的旧标签。

旧标签 新标准处理
FAST_DIRECT 通常为快;仍检查它是否属于新标准明确列出的模糊信息型
SLOW_FILTER_RANK 简单单目标条件搜索可改为快;复杂权衡、推荐、外部验证仍慢
SLOW_DISAMBIGUATE 非标准称呼但可唯一识别且动作明确可改为快;真实多候选仍慢
SLOW_GOAL_STATE 只有目标状态、需反推动作时慢;动作和对象已明确时可能改为快
SLOW_WORKFLOW 多步/跨工具仍慢;多个全部明确的设备控制动作改为快
SLOW_CONTEXT_DEPENDENT 真正依赖上文推理时慢;已建立快操作流中的简单直接续接可快
SLOW_UNCLEAR 执行意图需澄清时慢;若缺端侧导致政策无法确定,可标模糊并复核
SLOW_ADVANCED_CAPABILITY 废除按能力白名单直接定语义;按用户预期重判,能力缺口另记

兼容输出规则:

  • 只有新结论能被旧标签无损表达时才填写 legacy_eval_label
  • 模糊通常无法无损映射到旧二值标签,默认填 null
  • 业务方明确要求旧二值路由时,可从 default_route 派生,但不要覆盖新 label
  • 不要把 complex_task=true画等号。

关键口径变化

维度 旧评测文档 2026.6 新标准
核心视角 快系统白名单与能力边界 用户等待预期
标签空间 1 个 FAST + 7 个 SLOW 快 / 慢 / 模糊
简单筛选 普遍视为 SLOW_FILTER_RANK 目标明确、无需多步时可快
模糊称呼 普遍视为 SLOW_DISAMBIGUATE 可唯一识别且动作明确时可快
多动作 普遍视为 SLOW_WORKFLOW 全部明确设备控制是快特例
产品知识/故障/状态 快慢二分 正式标为模糊
能力不支持 SLOW_ADVANCED_CAPABILITY 标签不变;快能力缺口标待承接
边界 case 短期一律慢 保留模糊语义,默认路由慢
短 query 实验中 ≤5 字默认快 禁止作为语义规则

内部冲突也要处理:

  • 新标准物理页 2 把“评分 4.5 以上的泰国菜”列入导航慢,物理页 8 又明确列为快;使用最终汇总的快。
  • 新标准垂域调研把“压线噔噔的声音关掉”归入模糊功能指代慢,物理页 9 明确改为快;使用最终汇总的快。
  • 新标准调研把静态知识、故障和部分状态查询直接分快慢,物理页 10 统一为模糊;保留模糊标签。

评测集构建

复用旧文档的闭环:

候选挖掘
  -> LLM 预打标
  -> 人工背靠背盲标
  -> 分歧仲裁与规则回灌
  -> 种子模型
  -> 主动学习
  -> 真实流量回放
  -> 覆盖分析

候选来源:

  1. 线上真实流量。
  2. 明确功能点 TopQuery。
  3. 现有快慢评测集。
  4. LLM 生成或改写的紧邻边界对。

建议数据记录至少保留:

  • 原始 ID、query、session 和上下文。
  • 端侧、设备、来源和时间。
  • 新三档语义标签及默认路由。
  • 原因码、证据、置信度、复核状态。
  • 可选旧标签和结构维度。
  • 标注员、规则版本和仲裁结果。

质检门禁

标注一致性

  • 使用同一份边界基准集校准 Prompt 和标注员。
  • 对高分歧样本执行两名标注员背靠背盲标。
  • 计算 IAA,并把分歧原因回灌规则和黄金样例。
  • 把人机分歧与人人分歧分开分析。

数据完整性

  • 对同一 session 使用一致的上下文窗口。
  • 区分真实流量、旧集迁移和合成改写来源。
  • 对 session 去重,并隔离训练集和评测集。
  • 保留 模糊,不要在语义真值中提前二值化。

覆盖与指标

  • 按快/慢/模糊、原因码、垂域、端侧和来源分层统计。
  • 单独统计慢误分为快的高风险错误,以及快误分为慢的延迟损失。
  • 同时报告宏平均、各类召回和混淆矩阵,不只报告总准确率。
  • 不使用旧实验分布作为目标配额。

两道门

  1. 语义门:人工或模型是否依据当前规则得出正确结论。
  2. 结构门:记录是否通过 scripts/validate_label.py

结构校验通过不代表语义正确。

禁止固化的旧信息

不要把以下内容写成新策略:

  • “≤5 字默认快”。
  • “上轮慢则次轮必慢”的无条件继承。
  • “边界一律慢”的永久语义规则。
  • 旧快系统白名单或 SLOW_ADVANCED_CAPABILITY
  • 旧实验中任一类别占比。
  • 2K/3K 种子规模、5K/1W 最终规模等互相冲突的项目目标。
  • 95%/98% 等未统一口径的验收数字。