一次随机尝试成功率
INTERACTIVE / MEASUREMENT WORKBENCH
所有输出都是公开公式上的教学模型,用来观察协议变量怎样改变结论;它们不是任何真实模型的复跑成绩, 也不把相关性写成因果。
先看一次成功率,再分别计算“至少一次”“全部成功”和选择性回答;同时观察 tokenizer 对 PPL 的影响。
at least one = 1 − (1 − p)k · all succeed = pk · ECEtoy = |confidence − accuracy|
pass@k 的严格无偏估计还需要每题 n 个样本中通过数 c;这里用独立同分布近似建立方向直觉。
一次随机尝试成功率
有 verifier 时的搜索价值
连续任务的可靠性压力
单桶校准差,仅作直觉
准确率 / 覆盖率
按原始字节归一,跨 tokenizer 的单位更稳定。
细粒度 token:每 token 承载的字节更少。
粗粒度 token:即使 byte loss 相同,PPL 也会变。
一次成功率和多次搜索成功率目前相同,因为 k=1;把 k 调大后,搜索分会升,连续可靠性会降。
用可见混杂做压力测试:回答顺序、长度差、自我偏好、Judge 能力与票数怎样改变胜率和不确定性。
先给结论,再列证据边界;不重复问题。
提供更多背景、分点、例子与总结;可能更完整,也可能只是更长。
混入顺序、长度、自偏后的观察值
移除教学模型中的长度项
交换先后可造成的差
二项近似;真实 Arena 图更复杂
观察胜率 长度控制后的估计
当前协议里,较长的 B 获得长度红利;交换顺序或控制长度,排名可能翻转。
把五层泄漏、检测能力、题目刷新与历史锚点分开,观察新鲜度和纵向可比性的冲突。
教学设定中未受泄漏影响的题
五层污染中可被当前扫描发现的比例
存在但未被当前方法捕获
刷新速度与未泄漏比例的教学合成
固定锚点越多,跨月纵向比较越稳
当前只启用原文与答案泄漏;n-gram 对原文较敏感,对答案代码与语义改写仍不充分。
把模型、脚手架、工具、预算、Verifier、产品安全壳和攻击强度放到同一张成本—能力—风险图。
不含 Harness / 工具 / 多试
教学独立近似,不能当真实复跑
重试 × Token 预算的相对成本
在当前攻击与安全壳设定下
安全壳也会损失无害可用性
四次尝试和 32K 预算把系统成功率推高,但应同时披露成本;安全壳压低危险服从,也带来过拒。