Files
zk-data-agent/skills/product-data/knowledge/dataset_draft_v1.md
T
2026-05-11 11:46:09 +08:00

1.2 KiB

Dataset Draft Text v1

模型生成数据样本时,先写便于人工 review 的 draft text,不直接写 canonical JSON。

格式

# dataset_label: 数据集或专题名称

### case: case名称
用户: 本轮 query
target: Agent(tag='xxx')
notes: 可选,说明覆盖的问题或边界

### case: 多轮 case 名称
用户: 前一轮 query
小爱: 前一轮 tts
用户: 本轮 query
target: Agent(tag='xxx')
notes: 可选,说明覆盖的问题或边界

规则

  • 每条数据用一个 ### case: 开始。
  • 用户: 表示用户 query。
  • 小爱: 表示小爱回复 tts。
  • 最后一个 用户: 是本轮 query。
  • target: 是本轮 query 对应的监督标签,必须存在。
  • Agent 标签推荐写单引号形式 Agent(tag='xxx'),转换工具会规范成 Agent(tag="xxx")
  • 单轮数据只需要写一行 用户:,然后写 target:
  • 多轮数据需要按照时间顺序写多组 用户: / 小爱:
  • 多轮数据的最后一轮只写 用户:target:,不要写最后一轮 小爱:
  • 如果 target 无法确定,不要编造,必须向用户确认。
  • 不要手写 record_idrequest_idtimestampcontext