feat: add evaluation and safety chapter
This commit is contained in:
@@ -66,3 +66,17 @@ DeepSeek-VL/VL2、Janus、OCR 三分支,Kimi 三代 MoonViT、十六张问题
|
||||
计入全文证据。十八本独立账、62 节点阅读链、DeepSeek 与 Kimi 服务谱系、十五组视觉合同和
|
||||
四实验合同见 `../INFERENCE_SERVING_RESEARCH.md`。Grok Headless 的 70 个候选只保存在
|
||||
`../INFERENCE_SERVING_GROK_LEADS.md`,不能越过一手来源核验进入正文。
|
||||
|
||||
评测与安全首轮缓存位于 `evaluation-safety/`(不提交 PDF/TXT):
|
||||
|
||||
- 指标与套件:BLEU、ROUGE、GLUE、SuperGLUE、MMLU-Pro / Redux、PALOMA 与 RULER;
|
||||
- 动态与代码:Dynabench、FreshLLMs、LiveBench、HumanEval、EvalPlus、LiveCodeBench 与 SWE-bench Live;
|
||||
- 裁判与偏好:MT-Bench、G-Eval、LLMBar、Length-Controlled AlpacaEval、Arena-Hard 与 Chatbot Arena;
|
||||
- 安全与 Agent:RealToxicity、ToxiGen、GCG、HarmBench、StrongREJECT、JailbreakBench、InjecAgent、
|
||||
Cybench、WildGuard 与 AILuminate;
|
||||
- DeepSeek LLM/Math/V2/V3/R1/V3.2/V4 与 Kimi K3 复用既有模型报告缓存。
|
||||
|
||||
本轮完整校验 50 份新增 PDF/TXT;Global MMLU 通过 canonical arXiv 导出入口取得,PDF 可读性警告
|
||||
未影响文本核验。二十二张测量账、80 节点阅读链、DeepSeek/K3 协议谱系、四实验合同与证据边界见
|
||||
`../EVALUATION_SAFETY_RESEARCH.md`。Grok Headless 仅生成教学问题和候选线索,永久隔离在
|
||||
`../EVALUATION_SAFETY_GROK_LEADS.md`,不能作为正式事实来源。
|
||||
|
||||
Reference in New Issue
Block a user