数据全真,问题在框定。这测的不是"会不会加法",是"禁草稿、单次、不给工具"的极限心算 —— 给计算器或允许写步骤,这道题基本消失。贵 ≠ 准(旗舰 GPT-4.1 仅 4/16)。下面是审计后的诚实呈现。
顶部两家旗舰一路金到 7-8 位才裂;底部一团从 4 位就红。但每桶仅 2-3 题,任何"在第 N 位翻车"的精确断言不可支撑,只看大势别看单格。
x=每场成本(对数轴,差 ~660 倍)· y=准确率 · 横线 80% 资格线 · 竖须=Wilson 95% CI。一眼看出:Sonnet ~88% 只花 Gemini Pro ~94% 的 ~1/6.6(真性价比);误差棒同时暴露中下部一团 CI 大幅重叠、排不出干净顺序。GPT-4.1($2/1M)仅 25%,反被更便宜的 DeepSeek 略高 —— 价格不预测准确率。
不再给每个模型独立名次/段位。颜色只分非重叠 CI 的显著组:顶部两旗舰显著领先,底部一团统计上不可区分(两个 0/16 不该被排成第 8 vs 9)。
补两条对照臂:①允许写过程 ②给计算器/代码工具 —— 预期便宜模型瞬间逼近满分,把"旗舰才稳"彻底证伪。再每题跑 k=3-5 次拿 mean±SD(仅 ~$1.2)。