42 lines
1.9 KiB
Markdown
42 lines
1.9 KiB
Markdown
# 数据 Agent 实现任务表
|
||
|
||
范围:先在现有 agent loop 上开发和调试 data-agent 的 tools 与 skills,暂时不改主运行链路。
|
||
|
||
## 极简任务表
|
||
|
||
| 顺序 | 任务 | 产物 | 验证方式 |
|
||
|---|---|---|---|
|
||
| 1 | 定义 canonical record v1 | `src/data_agent_schema.py` 或 `src/data_agent/records.py` | 单测覆盖合法和非法样本 |
|
||
| 2 | 实现 `validate_dataset_records` 工具 | 新增 `AgentTool` 注册和 handler | 用 JSONL 样例跑工具,检查结构化错误 |
|
||
| 3 | 实现 `render_dataset_preview` 工具 | 生成面向人工 review 的 Markdown 预览 | 用 3 条样本生成预览 |
|
||
| 4 | 实现 `convert_dataset_format` 工具 | 至少支持 `training_jsonl`、`eval_prompt_csv`、`review_table_csv` | 输入 canonical JSONL,检查导出文件 |
|
||
| 5 | 实现 `export_dataset` 工具 | 多格式导出和 manifest | 校验失败时拒绝导出 |
|
||
| 6 | 增加最小 data skill | 新增类似 `dataset-construction` 的目录化 skill | Web UI 中可见,并指导 validate/export 循环 |
|
||
| 7 | 准备调试样例 | `test_data/data_agent/*.jsonl` | 通过 Web UI 跑 skill + tools |
|
||
| 8 | 实现 `normalize_dataset_records` 工具 | 支持简单 CSV/JSONL 字段映射到 canonical JSONL | 输入 CSV,输出 canonical JSONL |
|
||
| 9 | 实现 `dedup_dataset_records` 工具 | 按 query + label 做精确去重 | 输出去重后 JSONL 和重复样本报告 |
|
||
| 10 | 按需增强 Web UI trace | 更清晰展示 tool 参数和结果 | 人工 UI 验证 |
|
||
|
||
## 第一批实现切片
|
||
|
||
先做任务 1、2、6、7:
|
||
|
||
```text
|
||
skill 指导
|
||
-> Agent 生成 canonical JSONL
|
||
-> validate_dataset_records 校验
|
||
-> Web UI 展示工具调用参数和校验错误
|
||
```
|
||
|
||
## 预计第一批文件
|
||
|
||
```text
|
||
src/data_agent_schema.py
|
||
src/agent_tools.py
|
||
src/bundled_skills.py
|
||
tests/test_data_agent_schema.py
|
||
tests/test_data_agent_tools.py
|
||
test_data/data_agent/valid_records.jsonl
|
||
test_data/data_agent/invalid_records.jsonl
|
||
```
|