Improve online mining record conversion
This commit is contained in:
@@ -16,11 +16,36 @@
|
||||
3. 用 `elk_search_cases.py` 拉候选。
|
||||
4. 用 `elk_join_request_logs.py` 补全 main/pre_processing 字段。
|
||||
5. 展示小批候选给用户 review。
|
||||
6. 用户确认后,用 `build_dataset_draft.py` 转 dataset draft。
|
||||
7. 用 `product-data` 脚本 normalize、validate、export。
|
||||
6. 用户确认后,优先用 `build_online_records.py` 直接生成 canonical records 和流通表格。
|
||||
7. 只有需要人工查看 draft 或混合生成数据时,才用 `build_dataset_draft.py` 转 dataset draft,再接 product-data。
|
||||
|
||||
这个分支不生成新 query。
|
||||
|
||||
### rid 快速转样本流程
|
||||
|
||||
适用表达:
|
||||
|
||||
- “把这个 rid 的数据拉下来,作为测试数据”
|
||||
- “这几个 request_id 转成我们的元数据”
|
||||
- “线上命中的这批样本直接导出”
|
||||
|
||||
流程:
|
||||
|
||||
1. 整理 `request_ids`、`dataset_label`、`target`、`complex`、日期。
|
||||
2. 如果没有日期,先按近 48 小时查;查不到要问用户补日期。
|
||||
3. 调用 `build_online_records.py`。
|
||||
4. 检查返回的 `summaries`:
|
||||
- `query`
|
||||
- `target`
|
||||
- `target_source`
|
||||
- `prev_session_count`
|
||||
- `main_domain`
|
||||
- `planning_result`
|
||||
5. 告诉用户输出路径:
|
||||
- `output/records.jsonl`
|
||||
- `output/records.csv`
|
||||
- 用户要求训练/评测时,再导出 `training.jsonl` / `eval_planning.csv`
|
||||
|
||||
## 分支 B:基于线上问题补充生成数据
|
||||
|
||||
适用表达:
|
||||
@@ -51,4 +76,3 @@ tts:
|
||||
```
|
||||
|
||||
不要默认展示完整 prompt。prompt 很长时只展示命中片段。
|
||||
|
||||
|
||||
Reference in New Issue
Block a user