1.5 KiB
1.5 KiB
Model Labeling 输入格式
本 skill 的脚本会把不同来源的数据统一成 sample:
{
"index": 0,
"request_id": "",
"query": "",
"prompt": "",
"gold_label": "",
"source_format": ""
}
canonical records
识别条件:
- JSONL 每行是对象,或 JSON 数组 /
{ "records": [...] }。 - 对象包含
turn.query。
字段来源:
query:turn.queryrequest_id:source.request_idgold_label:complex=true/false+label.targetprompt:按 product-data 的 planning prompt 规则生成
training jsonl
识别条件:
- 每行是对象。
- 包含
instruction或system。
字段来源:
prompt:system + instruction包成 chat template;如果已有prompt则直接使用。gold_label:outputquery:尽力从[当前query]后的用户:抽取。
eval/planning CSV
识别条件:
- CSV 表头包含
newPrompt或query。
字段来源:
prompt:优先newPromptquery:querygold_label:code标签,如果有complex列则组合成两行
同事流转 CSV
识别条件:
- CSV 表头包含
query和function。
字段来源:
query:queryrequest_id:request_idgold_label:functionprompt:根据query、prev_session、context生成 planning prompt
未知格式
如果不能识别,脚本返回:
{
"ok": false,
"needs_mapping": true,
"columns": ["..."],
"error": "..."
}
此时必须询问用户字段映射,不要猜。