6.1 KiB
6.1 KiB
旧评测标签迁移与质量控制
目录
文档定位
《快慢系统分发-评测集构建》是早期策略、评测集项目计划和一次候选挖掘实验的混合文档。其项目日期早于 2026.6 新标准。
使用它:
- 解释复杂性原因。
- 迁移旧
FAST_DIRECT/SLOW_*数据。 - 复用候选挖掘、人工盲标、主动学习和流量回放方法。
不要使用它覆盖新三档语义标准。
旧八类标签
| 旧标签 | 旧定义 |
|---|---|
FAST_DIRECT |
当前轮可直接、安全、确定性满足 |
SLOW_FILTER_RANK |
候选筛选、排序、优化或推荐 |
SLOW_DISAMBIGUATE |
目标身份不确定,需先消歧 |
SLOW_GOAL_STATE |
给目标状态,需反推参数 |
SLOW_WORKFLOW |
多动作、多工具或显式多步骤 |
SLOW_CONTEXT_DEPENDENT |
复杂性主要来自上文或记忆 |
SLOW_UNCLEAR |
结合必要上下文仍不明确 |
SLOW_ADVANCED_CAPABILITY |
不在旧快系统白名单的高级能力 |
旧文档没有给多原因冲突优先级。迁移时允许先保留多个原因,再选择决定性主因。
迁移到新三档
不要做固定的一对一映射。先按 2026.6 语义重标,再按需要回填最接近的旧标签。
| 旧标签 | 新标准处理 |
|---|---|
FAST_DIRECT |
通常为快;仍检查它是否属于新标准明确列出的模糊信息型 |
SLOW_FILTER_RANK |
简单单目标条件搜索可改为快;复杂权衡、推荐、外部验证仍慢 |
SLOW_DISAMBIGUATE |
非标准称呼但可唯一识别且动作明确可改为快;真实多候选仍慢 |
SLOW_GOAL_STATE |
只有目标状态、需反推动作时慢;动作和对象已明确时可能改为快 |
SLOW_WORKFLOW |
多步/跨工具仍慢;多个全部明确的设备控制动作改为快 |
SLOW_CONTEXT_DEPENDENT |
真正依赖上文推理时慢;已建立快操作流中的简单直接续接可快 |
SLOW_UNCLEAR |
执行意图需澄清时慢;若缺端侧导致政策无法确定,可标模糊并复核 |
SLOW_ADVANCED_CAPABILITY |
废除按能力白名单直接定语义;按用户预期重判,能力缺口另记 |
兼容输出规则:
- 只有新结论能被旧标签无损表达时才填写
legacy_eval_label。 模糊通常无法无损映射到旧二值标签,默认填null。- 业务方明确要求旧二值路由时,可从
default_route派生,但不要覆盖新label。 - 不要把
complex_task=true与慢画等号。
关键口径变化
| 维度 | 旧评测文档 | 2026.6 新标准 |
|---|---|---|
| 核心视角 | 快系统白名单与能力边界 | 用户等待预期 |
| 标签空间 | 1 个 FAST + 7 个 SLOW | 快 / 慢 / 模糊 |
| 简单筛选 | 普遍视为 SLOW_FILTER_RANK |
目标明确、无需多步时可快 |
| 模糊称呼 | 普遍视为 SLOW_DISAMBIGUATE |
可唯一识别且动作明确时可快 |
| 多动作 | 普遍视为 SLOW_WORKFLOW |
全部明确设备控制是快特例 |
| 产品知识/故障/状态 | 快慢二分 | 正式标为模糊 |
| 能力不支持 | SLOW_ADVANCED_CAPABILITY |
标签不变;快能力缺口标待承接 |
| 边界 case | 短期一律慢 | 保留模糊语义,默认路由慢 |
| 短 query | 实验中 ≤5 字默认快 | 禁止作为语义规则 |
内部冲突也要处理:
- 新标准物理页 2 把“评分 4.5 以上的泰国菜”列入导航慢,物理页 8 又明确列为快;使用最终汇总的快。
- 新标准垂域调研把“压线噔噔的声音关掉”归入模糊功能指代慢,物理页 9 明确改为快;使用最终汇总的快。
- 新标准调研把静态知识、故障和部分状态查询直接分快慢,物理页 10 统一为模糊;保留模糊标签。
评测集构建
复用旧文档的闭环:
候选挖掘
-> LLM 预打标
-> 人工背靠背盲标
-> 分歧仲裁与规则回灌
-> 种子模型
-> 主动学习
-> 真实流量回放
-> 覆盖分析
候选来源:
- 线上真实流量。
- 明确功能点 TopQuery。
- 现有快慢评测集。
- LLM 生成或改写的紧邻边界对。
建议数据记录至少保留:
- 原始 ID、query、session 和上下文。
- 端侧、设备、来源和时间。
- 新三档语义标签及默认路由。
- 原因码、证据、置信度、复核状态。
- 可选旧标签和结构维度。
- 标注员、规则版本和仲裁结果。
质检门禁
标注一致性
- 使用同一份边界基准集校准 Prompt 和标注员。
- 对高分歧样本执行两名标注员背靠背盲标。
- 计算 IAA,并把分歧原因回灌规则和黄金样例。
- 把人机分歧与人人分歧分开分析。
数据完整性
- 对同一 session 使用一致的上下文窗口。
- 区分真实流量、旧集迁移和合成改写来源。
- 对 session 去重,并隔离训练集和评测集。
- 保留
模糊,不要在语义真值中提前二值化。
覆盖与指标
- 按快/慢/模糊、原因码、垂域、端侧和来源分层统计。
- 单独统计慢误分为快的高风险错误,以及快误分为慢的延迟损失。
- 同时报告宏平均、各类召回和混淆矩阵,不只报告总准确率。
- 不使用旧实验分布作为目标配额。
两道门
- 语义门:人工或模型是否依据当前规则得出正确结论。
- 结构门:记录是否通过
scripts/validate_label.py。
结构校验通过不代表语义正确。
禁止固化的旧信息
不要把以下内容写成新策略:
- “≤5 字默认快”。
- “上轮慢则次轮必慢”的无条件继承。
- “边界一律慢”的永久语义规则。
- 旧快系统白名单或
SLOW_ADVANCED_CAPABILITY。 - 旧实验中任一类别占比。
- 2K/3K 种子规模、5K/1W 最终规模等互相冲突的项目目标。
- 95%/98% 等未统一口径的验收数字。