This commit is contained in:
hupenglong1
2026-05-20 15:04:19 +08:00
parent c4b935692c
commit 1a94cec822
27 changed files with 4831 additions and 1693 deletions
-66
View File
@@ -1,66 +0,0 @@
# Skill: model-iteration
本目录是小爱中控模型迭代 skill,用于评测、错误分析、数据增强、SFT 训练和 CML workflow 追踪。
## 目录结构
```
model-iteration/
├── config.yaml # 评估阈值 + CML 工作流配置
├── knowledge/ # 分流知识库
│ ├── navigation_routing_rules.md # 地图导航 Agent/ComplexTask 分流
│ ├── travel_routing_rules.md # 旅游 Agent/ComplexTask 分流
│ └── multi_command_rules.md # 多指令 vs ComplexTask 判定
├── scripts/
│ ├── prepare_and_train_sft.py # 数据组装 + 本地训练
│ ├── submit_sft_via_cml.sh # CML 云端训练提交(R29 起统一用此)
│ └── sft_train_job.yaml.tpl # CML 训练 job YAML 模板
├── SKILL.md # 完整迭代协议(触发规则、Step 0-6、数据增强/清洗规范)
└── README.md # 本文件
```
## 快速上手
### 1. 评测当前模型
```bash
cml workflow run \
--workflow_id f-20260408161444-wu3pz --version v28 \
--global_inputs runDic=<N> \
--global_inputs model_path_new=<新模型路径> \
--global_inputs model_path_old=<基线模型路径>
```
### 2. SFT 训练(CML 云端)
```bash
AUTORESEARCH_ROOT=/mnt/wangsenhao/autoresearch-zk \
./scripts/submit_sft_via_cml.sh <RUNDIC> [PREV_RUNDIC]
```
训练完成后自动起评测 workflow。
### 3. SFT 训练(本地)
```bash
AUTORESEARCH_ROOT=/mnt/wangsenhao/autoresearch-zk \
python scripts/prepare_and_train_sft.py prepare --output_dir ./sft_data
AUTORESEARCH_ROOT=/mnt/wangsenhao/autoresearch-zk \
python scripts/prepare_and_train_sft.py train \
--data_dir ./sft_data \
--model_path /mnt/wangsenhao/verl_zk/Qwen3-4B-Instruct-2507 \
--model_type qwen3 \
--train_output ./sft_output \
--epochs 3 --lr 1e-5
```
## 关键规则
- **达标标准**:需求集合 ≥ 95%,大盘车载降幅 ≤ 0.3%specific test 降幅 ≤ 1%
- **数据清洗**:case 驱动、禁止批量、必须备份、只改 output 不动 instruction
- **训练环境**FSDP2 + torch 2.6 需要 accelerate==1.7.0,不要改训练代码去适配
## 完整协议
详见 [SKILL.md](SKILL.md)
File diff suppressed because it is too large Load Diff
@@ -9,5 +9,5 @@ thresholds:
# CML 评测工作流配置
cml_eval:
workflow_id: f-20260408161444-wu3pz
version: v28
version: v32
@@ -0,0 +1,57 @@
# 多轮对话连贯性 —— ComplexTask 继承规则
## 核心判定
| 场景 | 输出 | 示例 |
|------|------|------|
| 上轮是 ComplexTask + 当前 query 和上轮**相关**(延续/细化/替换/挑选/追加) | 当前仍 `ComplexTask(tag="...")` | 上轮 CT 导航多目的地,当前"第二家导航过去" → CT |
| 上轮是 Agent + 当前 query 是独立新任务 | 按当前 query 独立分类 | 上轮 Agent 导航,当前"播放周杰伦" → Agent(音乐播放) |
| 上轮是 ComplexTask + 当前 query 是**无关**新任务 | 按当前独立分类 | 上轮 CT 旅游,当前"今天天气怎么样" → QA/WeatherQA |
## 判定要点
- **"相关"的定义**:当前 query 是对上轮任务的**延续、细化、替换、挑选、追加**中的任一类:
- 延续:用户在上轮的同一任务线上继续操作("继续导航"/"换一条不堵的"
- 细化:对上轮结果加筛选条件("人少一点的"/"评分最高的"/"最近的那个"
- 替换:换掉上轮的某个要素,同领域保持("不要 A 换成 B"
- 挑选:从上轮推荐的候选中选择("第一个"/"第二家"/"刚给的那个"
- 追加:在上轮任务基础上加步骤("路上再加个加油站"/"顺便找个 ATM"
- **prev 侧"隐式 CT 信号"R17777 补充)**:prev 即使只是一轮用户独白,只要含以下任一信号也视作 CT 场景:
- **单轮内自我修正/替换**:"导航到 A 哦不对 B"、"去 X 啊不 Y"、"到 A 嗯就是 B" —— 用户在说的过程中换目的地,系统需处理替换逻辑
- **候选选择犹豫**"是 A 还是 B"、"哪个近就哪个"、"算了不去 A 了"
- **多 POI 枚举/对比**"A 和 B 哪个近"、"先说 A 再说 B"
> 注:单 POI + 多重形容词筛选("最便宜的有车位的充电站")**不算** CT 信号,按 R1 归 Agent。
- **继承的是 `complex` 维度,不是 tag 内容**:tag 仍可能是 Agent 标签,但 complex=true,因为复合任务语境未结束
## 反例(不适用继承)
- 当前 query 明显切换意图:上轮 CT 导航 → 当前"打开空调"(tag=车载控制,无关)→ 独立分类
- 当前 query 是独立的闲聊 / 时间 / 天气问答:上轮 CT → 当前"现在几点" → 独立分类
- 上轮是 CT 但失败/取消("算了不要了"):后续 query 不再继承
## 为什么需要这条规则(经验来源)
R17775 迭代中,我们修改了训练集 47 条"纯路线偏好"样本 complex=true → false,对齐 0511 专项 gold60% → 76.67%)。但这产生副作用:
- `复杂导航线上真实_rag` -3.30pp11 条 gold=true 被过度修正为 false
- 如 "我要重新选一个路线"、"嗯经过凤雏路去江北虹悦城"
- `0511 专项` 新引入 6 条错全是**多轮延续 POI/挑选**类
- 如 "评分最高的那个导航过去"、"第二家导航过去"、"人少一点的"
根因:单看 query 这些表达像"纯偏好",但在多轮上下文中是**对上轮 ComplexTask 的挑选/细化**,应继承 CT。SFT 模型在只看当前 query 时判错。
## 应用场景
- **数据增强**:生成带 prev_session 的训练样本时,如果 prev 是 `ComplexTask(...)`,当前 query 与之相关 → ground_truth 必须是 ComplexTask(不能矛盾)
- **训练集清洗**:不要把"多轮延续同任务"类样本的 complex=true 改为 falseR17774 的 47 条改动里,L10752 / L10943 / L10954 等 multi_turn_deixis 已保留未改,正确)
- **Badcase 分析**:错例 query 如果语境是对上轮 CT 的延续,SFT 模型判错不能靠修改训练集同 pattern 样本的 label 来解,需要补"带 prev_session 的延续 CT"仿写增强模型学到上下文信号
- **Reward 函数**:对违反此规则的预测(prev=CT + 相关继续 但 pred complex=false)应被惩罚
## 反模式
- ❌ 只看当前 query 文本判 complex,忽略 prev_session
- ❌ 训练集批改 complex=true→false 时未检查 prev_session,导致多轮延续样本被误改
- ❌ 生成仿写时当前 query 与 prev_session 矛盾(prev CT 但 current 标 complex=false
@@ -4,8 +4,8 @@
| 场景 | 输出 | 示例 |
|------|------|------|
| 规划路线,无筛选条件 | `Agent(tag="旅游出行")` | 规划一个从北京到上海的路线 |
| 规划路线,有筛选条件 | `ComplexTask(tag="旅游出行")` | 规划一个从北京到上海的路线,人少风景好、三天两夜、3000预算 |
| 规划路线,无筛选条件 | `Agent(tag="旅游")` | 规划一个从北京到上海的路线 |
| 规划路线,有筛选条件 | `ComplexTask(tag="旅游")` | 规划一个从北京到上海的路线,人少风景好、三天两夜、3000预算 |
## 判定要点
File diff suppressed because it is too large Load Diff
@@ -4,11 +4,9 @@
用法:
# 仅组装数据
AUTORESEARCH_ROOT=/mnt/wangsenhao/autoresearch-zk \
python prepare_and_train_sft.py prepare --output_dir /mnt/wangsenhao/autoresearch-zk/sft_data
python prepare_and_train_sft.py prepare --output_dir /mnt/wangsenhao/autoresearch-zk/sft_data
# 启动训练(需先 prepare)
AUTORESEARCH_ROOT=/mnt/wangsenhao/autoresearch-zk \
python prepare_and_train_sft.py train \
--data_dir /mnt/wangsenhao/autoresearch-zk/sft_data \
--model_path /mnt/wangsenhao/verl_zk/Qwen3-4B-Instruct-2507 \
@@ -28,14 +26,7 @@ from pathlib import Path
logging.basicConfig(level=logging.INFO, format="%(asctime)s %(levelname)s %(message)s")
log = logging.getLogger(__name__)
def _path_from_env(name: str, fallback: Path) -> Path:
return Path(os.environ.get(name, str(fallback))).expanduser().resolve()
AUTORESEARCH_ROOT = _path_from_env("AUTORESEARCH_ROOT", Path("/mnt/wangsenhao/autoresearch-zk"))
AI_PLANNING = _path_from_env("AI_PLANNING_DIR", AUTORESEARCH_ROOT / "ai-planning")
ZK_TRAINER_DIR = _path_from_env("ZK_TRAINER_DIR", AUTORESEARCH_ROOT / "zk_trainer")
AI_PLANNING = Path(__file__).resolve().parent / "ai-planning"
TRAIN_SET_DIR = AI_PLANNING / "data" / "train_set"
DATA_TRAIN_DIR = AI_PLANNING / "data_train"
GENERATE_TRAIN_SCRIPT = DATA_TRAIN_DIR / "generate_train.py"
@@ -157,7 +148,7 @@ def run_sft_training(data_dir: str, model_path: str, model_type: str, train_outp
epochs: int = 3, lr: float = 1e-5, max_seq_length: int = 1024,
per_device_batch: int = 1, grad_accum: int = 1):
"""基于 zk_trainer 的 accelerate launch 方式启动 SFT 训练。"""
zk_trainer_dir = str(ZK_TRAINER_DIR)
zk_trainer_dir = str(Path(__file__).resolve().parent / "zk_trainer")
if not os.path.isdir(zk_trainer_dir):
log.error(f"zk_trainer 目录不存在: {zk_trainer_dir}")
return None
@@ -1,117 +0,0 @@
jobName: "sft-train-r{RUNDIC}"
description: "AutoResearch R{RUNDIC} SFT training (40k+ samples, qwen3-4B base, 3 epochs FSDP2)"
accessType: PUBLIC
imageConfig:
imageUrl: micr.cloud.mioffice.cn/vllm-image/ai-arch-llm-prod:vllm-v0.12.0-f098b188
imageCommand: |-
set -ex
cd {AUTORESEARCH_ROOT}
# 0a. 验环境 + 装缺的包(vllm 镜像 py3.12 + torch 已含)
python3 --version
python3 -c "import torch; print(f'torch={torch.__version__}')"
pip install -q --no-deps "accelerate==1.7.0" 2>&1 | tail -3
pip install -q --ignore-installed blinker 2>&1 | tail -2
pip install -q peft 2>&1 | tail -3
pip install -q wandb bitsandbytes 2>&1 | tail -3
pip install -q luigi mlflow scikit-learn openpyxl pyyaml sentencepiece tiktoken protobuf pynvml datasets 2>&1 | tail -3
pip install -q "transformers>=4.45" 2>&1 | tail -3
python3 -c 'import torch, accelerate, transformers, peft; print(torch.__version__, accelerate.__version__, transformers.__version__, peft.__version__)'
# 0c. 把 HF cache 重定向到容器本地大盘(默认在 ~/.cache 可能是 juicefsmmap 易 SIGBUS
export HF_HOME=/tmp/hf_cache
export HF_DATASETS_CACHE=/tmp/hf_cache/datasets
export TRANSFORMERS_CACHE=/tmp/hf_cache/transformers
mkdir -p /tmp/hf_cache/datasets /tmp/hf_cache/transformers
df -h /tmp /dev/shm 2>/dev/null || true
# 强制 datasets 加载进内存而不是 arrow mmap(避免 /dev/shm 溢出 SIGBUS
export HF_DATASETS_IN_MEMORY_MAX_SIZE=20000000000
export HF_DATASETS_NUM_PROC=1
export TOKENIZERS_PARALLELISM=false
export OMP_NUM_THREADS=1
export MKL_NUM_THREADS=1
# 关闭 NCCL 用 shm 通信(改 socket 通道)
export NCCL_SHM_DISABLE=1
export NCCL_P2P_DISABLE=0
export NCCL_DEBUG=WARN
# 0b. 把上一轮产出搬走(cml job 内幂等,本地搬过就跳过)
if [ -d sft_output ] && [ ! -d sft_output_r{PREV_RUNDIC} ]; then
mv sft_output sft_output_r{PREV_RUNDIC}
fi
rm -rf sft_output
# 1. 组装数据
python3 {AUTORESEARCH_ROOT}/prepare_and_train_sft.py prepare \
--output_dir {AUTORESEARCH_ROOT}/sft_data
# 2. 启动训练(绝对路径,避免相对路径在容器内找不到 zk_trainer
python3 {AUTORESEARCH_ROOT}/prepare_and_train_sft.py train \
--data_dir {AUTORESEARCH_ROOT}/sft_data \
--model_path /mnt/wangsenhao/verl_zk/Qwen3-4B-Instruct-2507 \
--model_type qwen3 \
--train_output {AUTORESEARCH_ROOT}/sft_output \
--epochs 3 --lr 1e-5
# 3. 训练成功标记(被 watcher 检测)
[ -f {AUTORESEARCH_ROOT}/sft_output/config.json ] && \
touch {AUTORESEARCH_ROOT}/sft_output/_SUCCESS
# 挂载 wangsenhao + xiaoai-zk-model-train-tj5 + verl_zk 所在卷
juiceFsMountConfigs:
- volume: wangsenhao
juiceFsCluster: tj5-common
subPath: /
mountPath: /mnt/wangsenhao
readOnly: false
- volume: xiaoai-zk-model-train-tj5
juiceFsCluster: tj5-common
subPath: /
mountPath: /mnt/xiaoai-zk-model-train-tj5
readOnly: false
envConfigs:
- key: PYTHONPATH
value: {AUTORESEARCH_ROOT}/zk_trainer
- key: WANDB_DISABLED
value: "true"
- key: WANDB_MODE
value: offline
- key: VOLUME_PREFIX
value: /mnt/xiaoai-zk-model-train-tj5
- key: HF_HOME
value: /mnt/wangsenhao/.hf_cache
# h20-96g 8 卡 FSDP2
queueId: "6052"
priority: 5
preemptible: false
framework: pytorch
resourceConfigs:
- nodeRole: worker
nodeNumber: 1
perNodeResourceSpec:
resourcePriority: GUARANTEED
resourceName: cloudml.ng2h20-8-8.20-199
resourceNumber: 8
# 故障自动重试(节点级失败)
retryConfig:
enableRetry: true
maxRetryTimes: 2
policySets:
- NodeFailure
# 失败/完成飞书告警
alertConfig:
enableAlert: true
alertItems:
- alertConditions:
- FAILED
- SUCCEED
alertLevel: P2
alertReceivers:
persons:
- wangsenhao
@@ -1,104 +0,0 @@
#!/bin/bash
# 用 cml custom_train submit 提交 SFT 训练,训练完成后自动起 cml workflow run 评测
# 用法: ./submit_sft_via_cml.sh <RUNDIC>
# 例: ./submit_sft_via_cml.sh 17756
set -euo pipefail
RUNDIC=${1:?usage: $0 <RUNDIC>}
PREV_RUNDIC=${2:-$((RUNDIC-1))}
SCRIPT_DIR="$(cd "$(dirname "${BASH_SOURCE[0]}")" && pwd)"
ROOT=${AUTORESEARCH_ROOT:-/mnt/wangsenhao/autoresearch-zk}
MODEL_OLD=${MODEL_OLD:-/mnt/wangsenhao/verl_zk/qwen4b_cispo_wokl_add_bvt_2/global_step_5/actor/huggingface}
TPL=${SFT_TRAIN_JOB_TEMPLATE:-$SCRIPT_DIR/sft_train_job.yaml.tpl}
YAML=/tmp/sft_train_job_r${RUNDIC}.yaml
if [ -f ~/.cloudml-cli/.profile ]; then
source ~/.cloudml-cli/.profile
else
echo "[cml-sft] ❌ 未找到 ~/.cloudml-cli/.profile,请先安装并初始化 cml" >&2
exit 1
fi
# 1. 渲染 yaml 模板
sed \
-e "s|{RUNDIC}|${RUNDIC}|g" \
-e "s|{PREV_RUNDIC}|${PREV_RUNDIC}|g" \
-e "s|{AUTORESEARCH_ROOT}|${ROOT}|g" \
"$TPL" > "$YAML"
echo "[cml-sft] yaml: $YAML"
# 2. 提交训练任务
SUBMIT_OUT=$(cml custom_train submit --filename "$YAML" 2>&1)
echo "$SUBMIT_OUT"
JOB_ID=$(echo "$SUBMIT_OUT" | grep -oE 't-[0-9]+-[a-z0-9]+' | head -1)
if [ -z "$JOB_ID" ]; then
echo "[cml-sft] ❌ 提交失败" >&2
exit 1
fi
echo "[cml-sft] ✅ JobID: $JOB_ID"
# 3. 后台 watcher:等训练成功 → 自动起评测
WATCHER_LOG=/tmp/r${RUNDIC}_logs/cml_watcher.log
mkdir -p "$(dirname "$WATCHER_LOG")"
nohup bash -c '
JOB_ID='"$JOB_ID"'
RUNDIC='"$RUNDIC"'
LOG='"$WATCHER_LOG"'
ROOT='"$ROOT"'
MODEL_NEW="$ROOT/sft_output"
MODEL_OLD='"$MODEL_OLD"'
EVAL_WORKFLOW_ID=f-20260408161444-wu3pz
EVAL_VERSION=v28
source ~/.cloudml-cli/.profile
echo "[$(date)] 等待 cml job $JOB_ID 完成..." >> "$LOG"
while true; do
STATE=$(cml custom_train describe "$JOB_ID" 2>/dev/null | grep -o "\"state\": \"[a-z]*\"" | head -1 | sed "s/.*: \"//;s/\"//")
case "$STATE" in
succeed)
echo "[$(date)] 训练成功" >> "$LOG"
break ;;
failed|killed)
echo "[$(date)] ❌ 训练 $STATE" >> "$LOG"
exit 1 ;;
*)
sleep 60 ;;
esac
done
# 验证产出
[ ! -f "$MODEL_NEW/_SUCCESS" ] && [ ! -f "$MODEL_NEW/config.json" ] && {
echo "[$(date)] ❌ 产出缺失" >> "$LOG"; exit 1
}
# 起评测
echo "[$(date)] 启动 CML 评测 runDic=$RUNDIC" >> "$LOG"
cml workflow run \
--workflow_id $EVAL_WORKFLOW_ID --version $EVAL_VERSION \
--global_inputs runDic=$RUNDIC \
--global_inputs model_path_new=$MODEL_NEW \
--global_inputs model_path_old=$MODEL_OLD >> "$LOG" 2>&1
echo "[$(date)] cml workflow run 提交完成" >> "$LOG"
' > /tmp/r${RUNDIC}_logs/watcher_runner.log 2>&1 &
WATCHER_PID=$!
echo "[cml-sft] watcher PID: $WATCHER_PIDlog: $WATCHER_LOG"
# 4. 立即输出可查看命令
cat <<EOF
[cml-sft] 任务提交完成,关键命令:
查看任务状态: cml custom_train describe $JOB_ID
查看实时日志: cml custom_train logs $JOB_ID --follow
停止任务: cml custom_train kill $JOB_ID
watcher log: tail -f $WATCHER_LOG
训练完成后,evaluation workflow 会自动启动;评测产物在
/mnt/xiaoai-zk-model-train-tj5/workflow5/workflow${RUNDIC}/
JobID: $JOB_ID
RUNDIC: $RUNDIC
EOF