--- const protocolPresets = [ ["greedy", "一次 Greedy", "1 次、无搜索", 1, 1], ["sample", "Mean pass@1", "多次采样取平均", 64, 1], ["search", "Pass@k", "有 verifier 的搜索", 64, 8], ["reliable", "Pass^k", "连续成功可靠性", 5, 5], ]; ---

INTERACTIVE / MEASUREMENT WORKBENCH

把榜单拆回四台测量仪

所有输出都是公开公式上的教学模型,用来观察协议变量怎样改变结论;它们不是任何真实模型的复跑成绩, 也不把相关性写成因果。

WORKBENCH 01 / METRIC

同一个“80%”,可能回答四个不同问题

先看一次成功率,再分别计算“至少一次”“全部成功”和选择性回答;同时观察 tokenizer 对 PPL 的影响。

{protocolPresets.map(([id, name, note], index) => ( ))}
THREE DIFFERENT QUESTIONS at least one = 1 − (1 − p)k · all succeed = pk · ECEtoy = |confidence − accuracy|

pass@k 的严格无偏估计还需要每题 n 个样本中通过数 c;这里用独立同分布近似建立方向直觉。

ONE TRY80.0%

一次随机尝试成功率

AT LEAST ONE / k80.0%

有 verifier 时的搜索价值

ALL k SUCCEED80.0%

连续任务的可靠性压力

TOY ECE8.0 pp

单桶校准差,仅作直觉

SELECTIVE VIEW80% / 100%

准确率 / 覆盖率

SAME BYTE LOSS1.18 bits / byte

按原始字节归一,跨 tokenizer 的单位更稳定。

TOKENIZER A / PPL16.3

细粒度 token:每 token 承载的字节更少。

TOKENIZER B / PPL91.0

粗粒度 token:即使 byte loss 相同,PPL 也会变。

结论边界

一次成功率和多次搜索成功率目前相同,因为 k=1;把 k 调大后,搜索分会升,连续可靠性会降。

怎么使用:先改变一个变量,口述“我究竟换了模型、测量协议、系统预算还是威胁模型”; 如果一句比较没有这些字段,就先把结论降级为“在该公开设置下的观察值”。