# Dataset Draft Text v1 模型生成数据样本时,先写便于人工 review 的 draft text,不直接写 canonical JSON。 ## 格式 ```text # dataset_label: 数据集或专题名称 ### case: case名称 用户: 本轮 query complex: false target: Agent(tag='xxx') notes: 可选,说明覆盖的问题或边界 ### case: 多轮 case 名称 用户: 前一轮 query 小爱: 前一轮 tts 用户: 本轮 query complex: false target: Agent(tag='xxx') notes: 可选,说明覆盖的问题或边界 ``` ## 规则 - 每条数据用一个 `### case:` 开始。 - `用户:` 表示用户 query。 - `小爱:` 表示小爱回复 tts。 - 最后一个 `用户:` 是本轮 query。 - `complex:` 是复杂度维度,必须独立填写 `true` 或 `false`;无法确定时先问用户,不要把它塞进 `target`。 - `target:` 是本轮 query 对应的监督标签,必须存在。 - Agent 标签推荐写单引号形式 `Agent(tag='xxx')`,转换工具会规范成 `Agent(tag="xxx")`。 - 单轮数据只需要写一行 `用户:`,然后写 `complex:` 和 `target:`。 - 多轮数据需要按照时间顺序写多组 `用户:` / `小爱:`。 - 多轮数据的最后一轮只写 `用户:`、`complex:` 和 `target:`,不要写最后一轮 `小爱:`。 - 如果 `target` 无法确定,不要编造,必须向用户确认。 - 不要手写 `record_id`、`request_id`、`timestamp`、`context`。