feat: backend gate fallback + metric_diff docs + submit_sft fix
- Auto-inject human-review gate when agent asks question but forgets gate entry - Add complex_dev/complex_base field docs to program.md metric_diff table - Fix submit_sft.sh minor issues - jupyter_runtime improvements Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
@@ -219,8 +219,10 @@ for k in prev:
|
||||
|
||||
| 字段 | 含义 |
|
||||
| --- | --- |
|
||||
| `origin_predict_base` | 旧模型原始输出。具体格式(是否含 `complex=` 前缀、tag 包装、自定义 class 名等)以当前评测产出为准,**分析前 head 一下实物** |
|
||||
| `origin_predict_dev` | 新模型原始输出。同上,格式以当前产出为准 |
|
||||
| `origin_predict_base` | 旧模型(baseline)原始输出。具体格式(是否含 `complex=` 前缀、tag 包装、自定义 class 名等)以当前评测产出为准,**分析前 head 一下实物** |
|
||||
| `origin_predict_dev` | 新模型(迭代模型)原始输出。同上,格式以当前产出为准 |
|
||||
| `complex_dev` | 迭代模型的 complex 标签(true/false),从 `origin_predict_dev` 解析出的复杂度判定 |
|
||||
| `complex_base` | baseline 模型的 complex 标签(true/false),从 `origin_predict_base` 解析出的复杂度判定 |
|
||||
| `cleaned_predict_*` | 清洗后输出,用于 GSB 对比 |
|
||||
| `label` / `code_label_base` | ground truth;`label` 为空时回退解析 `code_label_base` |
|
||||
|
||||
|
||||
@@ -19,7 +19,9 @@ SFT_RUNDIC=${1:?usage: $0 <SFT_RUNDIC> [PREV_RUNDIC]}
|
||||
PREV_RUNDIC=${2:-$((SFT_RUNDIC-1))}
|
||||
|
||||
SCRIPT_DIR="$(cd "$(dirname "${BASH_SOURCE[0]}")" && pwd)"
|
||||
ROOT=${AUTORESEARCH_ROOT:-/mnt/wangsenhao/autoresearch-zk}
|
||||
# chat-isolated 时代 AUTORESEARCH_ROOT == AUTORESEARCH_CHAT_ROOT;优先用 chat
|
||||
# root,避免 agent 没 export AUTORESEARCH_ROOT 时回退到全局共享路径(已废弃)。
|
||||
ROOT=${AUTORESEARCH_ROOT:-${AUTORESEARCH_CHAT_ROOT:-$(dirname "$SCRIPT_DIR")}}
|
||||
TPL=${SFT_TRAIN_JOB_TEMPLATE:-$SCRIPT_DIR/sft_train_job.yaml.tpl}
|
||||
YAML=/tmp/sft_train_job_r${SFT_RUNDIC}.yaml
|
||||
|
||||
|
||||
Reference in New Issue
Block a user