Improve online mining record conversion

This commit is contained in:
wuyang6
2026-05-14 17:19:23 +08:00
parent e10cb6909b
commit c6b3233769
7 changed files with 651 additions and 63 deletions
+27 -3
View File
@@ -16,11 +16,36 @@
3.`elk_search_cases.py` 拉候选。
4.`elk_join_request_logs.py` 补全 main/pre_processing 字段。
5. 展示小批候选给用户 review。
6. 用户确认后,用 `build_dataset_draft.py` 转 dataset draft
7. `product-data` 脚本 normalize、validate、export
6. 用户确认后,优先`build_online_records.py` 直接生成 canonical records 和流通表格
7. 只有需要人工查看 draft 或混合生成数据时,才用 `build_dataset_draft.py` 转 dataset draft,再接 product-data
这个分支不生成新 query。
### rid 快速转样本流程
适用表达:
- “把这个 rid 的数据拉下来,作为测试数据”
- “这几个 request_id 转成我们的元数据”
- “线上命中的这批样本直接导出”
流程:
1. 整理 `request_ids``dataset_label``target``complex`、日期。
2. 如果没有日期,先按近 48 小时查;查不到要问用户补日期。
3. 调用 `build_online_records.py`
4. 检查返回的 `summaries`
- `query`
- `target`
- `target_source`
- `prev_session_count`
- `main_domain`
- `planning_result`
5. 告诉用户输出路径:
- `output/records.jsonl`
- `output/records.csv`
- 用户要求训练/评测时,再导出 `training.jsonl` / `eval_planning.csv`
## 分支 B:基于线上问题补充生成数据
适用表达:
@@ -51,4 +76,3 @@ tts:
```
不要默认展示完整 prompt。prompt 很长时只展示命中片段。