悬案 OG-002 · 理性复盘 · 7-agent 审计后重制

禁草稿心算大数:
9 个里只有 2 家旗舰扛住

数据全真,问题在框定。这测的不是"会不会加法",是"禁草稿、单次、不给工具"的极限心算 —— 给计算器或允许写步骤,这道题基本消失。贵 ≠ 准(旗舰 GPT-4.1 仅 4/16)。下面是审计后的诚实呈现。

01 数据
全真
分数/成本/144 次/判分都对得上 results.json;失分确为模型真算错,非判分 bug。
02 约束
唯一变量=禁草稿
协议「不要写过程」,禁分步禁工具的极限心算,不是日常用法。
03 误差
加 Wilson CI
n=16 单次采样,95% CI 宽 ±10–22pp,相邻名次基本不显著。
04 待办
补对照臂
允许写过程/给工具,预期便宜模型瞬间逼近满分,把"旗舰才稳"证伪。
实验条件(据 battle.py) max_tokens 1500 每题跑 1 次 system prompt 协议 FINAL:<整数>·不要写过程 无温度固定 无重采样 reasoning 未统一(Gemini 偷打草稿)
图① Model × 位数 · 哪里翻车(每格印 k/n)

顶部两家旗舰一路到 7-8 位才裂;底部一团从 4 位就。但每桶仅 2-3 题,任何"在第 N 位翻车"的精确断言不可支撑,只看大势别看单格。

答对率0% → 100%虚线格 = n≤2,更不可解释
图② 成本 vs 准确率 · 本案真正的裁决图

x=每场成本(对数轴,差 ~660 倍)· y=准确率 · 横线 80% 资格线 · 竖须=Wilson 95% CI。一眼看出:Sonnet ~88% 只花 Gemini Pro ~94%~1/6.6(真性价比);误差棒同时暴露中下部一团 CI 大幅重叠、排不出干净顺序GPT-4.1($2/1M)仅 25%,反被更便宜的 DeepSeek 略高 —— 价格不预测准确率。

图③ 总准确率 + Wilson CI · 按显著分组,不按段位

不再给每个模型独立名次/段位。颜色只分非重叠 CI 的显著组:顶部两旗舰显著领先,底部一团统计上不可区分(两个 0/16 不该被排成第 8 vs 9)。

结案 · 留什么 / 砍什么

✓ 站得住(经得起统计)

  • 两家旗舰 CI[71.7,98.9]/[64.0,96.5] 显著碾压底部一团(上界 ≤36%)及旗舰 GPT-4.1(25%)
  • 真实巨大鲁棒性差异(0/16→15/16)= 同档位 ≠ 同能力
  • 成本与准确率不挂钩的强反例(GPT-4.1 vs DeepSeek)
  • 完全可复现:gold.json+battle.py+score.py·判分剥逗号后精确匹配

✂ 已砍(overclaim)

  • "10 个数随意相加都做不到"——实测是禁草稿+单次+无工具
  • "旗舰才稳"——GPT-4.1 仅 25%,被 Haiku 点估计反超(但 n=16 不显著)
  • 刚性 1-9 名次表 + 硬段位 夯/人上人/拉/💀
  • "位数一大就翻车"折线——每桶 n=2-3,pooled 尾部还回升,非单调
  • "反方赢/终审定论"的口吻
★ 给冠军 Gemini Pro 标星:它是 reasoning 模型,per-call 成本是 Flash-Lite 的 ~730x,铁证它在隐藏通道仍打了草稿,协议没被统一执行。而亚军 Sonnet 是干净反例:非 reasoning、便宜、无隐藏草稿却 14/16 —— 这才是最硬的真信号:便宜非推理也能扛
下一步才是真·结案

补两条对照臂:①允许写过程 ②给计算器/代码工具 —— 预期便宜模型瞬间逼近满分,把"旗舰才稳"彻底证伪。再每题跑 k=3-5 次拿 mean±SD(仅 ~$1.2)。

数据全真,框定从严。 禁草稿心算大数,只有 2 家扛住;贵 ≠ 准。
16 道题 4→9 位 · 144 次真打 · $0.24 · 协议+采样次数也上墙
看逐题证据