证据现场 · OG-002 · 判分过程摆给你看

怎么判出「只 3 个能稳住」的?

不是只有 3 个能算对——每道题都有好几个答对(下面这两道一道 5/10、一道 4/10)。但 16 道从 4 位爬到 9 位一路不崩的,全程只有 3 个:Gemini Pro、Sonnet,还有杀出来 16/16 满分登顶的豆包(中国·还比旗舰便宜)。每道题怎么判,全摆出来。这就是「带 receipts 才上墙」。

01 出题
10 个随机数
16 道题,每道 10 个整数相加,位数 4→9 递增。真值 Python 精确算,不靠 AI。
02 真考
原样发给 11 个模型
每道题真发 API,收回答案。共 176 次真实调用,~$0.46(含后补豆包 + OG挑战 Gemini 3.5 Flash)。
03 判分
跟真值死磕
抽出模型最终答案,跟真值一字不差比对。对 ✓ 错 ✗,没得商量。
04 排名
数对几题
每个模型答对几题 → 准确率 → 谁稳谁崩。下面看两道真题怎么判的。
实验条件(据 battle.py) max_tokens 1500 每题跑 1 次 system prompt 统一协议 FINAL:<整数>·不要写过程 无温度固定 无重采样 reasoning 未统一
📋 想自己验?两条路:① 题目+答案手动粘进聊天框跑;② 脚本存成 .py 在终端自动跑。答案单独核分,别和题目一起喂 ①②聊天框 · ③.py终端 · 或下面 ▶ 当场盲测
▶ 上擂台 · 选个模型当场盲测 —— 答案锁服务端,模型只收盲题,结果直接跑回这页
最终排名 · 16 题总分 · ✓策展已复验 + 🏟社区待复验 · 只比准确率 + 性价比
#模型得分准确率 单题成本性价比
准÷$
1豆包 Seed 1.6双冠16/16100%$0.002031.5
2Gemini 2.5 Pro15/1694%$0.01224.8
3Claude Sonnet 4.614/1688%$0.001830.2
▼ 以下 <80% —— 没资格争性价比之王(全错0成本=性价比无穷大,无意义)
4Gemini 3.5 Flash🏴 OG挑战11/1669%$0.0118门槛外
5DeepSeek V3.28/1650%$0.00003门槛外
6Claude Haiku 4.58/1650%$0.00023门槛外
7GPT-4.14/1625%$0.00025门槛外
8Gemini 2.5 Flash-Lite3/1619%$0.00002门槛外
9GPT-4.1 mini1/166%$0.00005门槛外
10Llama 3.3 70B0/160%$0.00002门槛外
11Qwen2.5 72B0/160%$0.00005门槛外
两块金牌都被豆包端走:① 绝对冠军=准确率最高(16/16);② 性价比之王=准确率÷成本,且必须先 ≥80% 才有资格。前三名里 —— 豆包、Sonnet 单题 ~$0.002,Gemini Pro 贵 6 倍($0.0122,reasoning 烧隐藏 token)。所以"满分 vs 旗舰"的差,差在成本不差在准:豆包满分还比 Gemini 便宜 6 倍。
⚠ 为什么不比速度:延迟严重受网络/服务商负载/排队影响,同一模型不同时刻能差几倍,单测不公平,故不纳入排名。仍是禁草稿/单次/n=16,精确数字看理性版。
🏴 第 4 行 = OG 社区挑战:有人晒 Gemini 3.5 Flash「16/16」,一查是开卷(模型看到了答案);同配方盲测复验真分 11/16,照样进第 4 名。这就是 og2go —— 谁都能挑战上墙,但战绩靠复验,不靠截图
热身 · 第 1 题 · 4 位数 ×10 · 6/11 答对
// 题目:把这 10 个数加起来
 6,861
+8,829
+3,654
+8,136
+6,739
+3,429
+9,751
+1,907
+7,620
+1,660
真值 =58,586
11 个模型当场怎么答的(✓ 对 / ✗ 错):
豆包 Seed 1.6 🏆58,586总16/16·50次全稳
Gemini 3.5 Flash 🏴58,586总11/16·OG挑战
DeepSeek V3.258,586总8/16·50次仅42%·蒙中⚠
Claude Haiku 4.558,586总8/16·小数稳大数崩
Gemini 2.5 Pro58,586总15/16·50次98%
Claude Sonnet 4.658,586总14/16·50次全稳
Qwen2.5 72B58,626多了 40
GPT-4.158,686多了 100
GPT-4.1 mini55,586差了 3,000
Gemini 2.5 Flash-Lite68,610多了 10,024
Llama 3.3 70B6,861差了 51,725
注意这是禁草稿/不给工具的心算:就算只 4 位数,11 个里也只有 6 个算对。⚠ 别被 ✓ 骗:DeepSeek 这道对了,但它 50 次只对 42%、总分 8/16,是蒙中。多数模型连小数连加都不稳——但允许写步骤/给计算器就会好很多,这测的是"被禁草稿的心算"不是"会不会加法"。
上强度 · 第 16 题 · 9 位数 ×10 · 只 5/11 答对
// 题目:把这 10 个数加起来
 465,060,564
+976,720,443
+143,853,578
+134,529,161
+656,830,543
+111,475,322
+272,988,485
+754,255,986
+789,649,768
+381,782,965
真值 =4,687,146,815
同样 11 个模型,位数一大就崩:
豆包 Seed 1.6 🏆4,687,146,815总16/16·50次全稳
Gemini 3.5 Flash 🏴4,687,146,815总11/16·OG挑战
DeepSeek V3.24,687,146,815总8/16·50次仅12%·蒙中⚠
Gemini 2.5 Pro4,687,146,815总15/16·50次96%
Claude Sonnet 4.64,687,146,815总14/16·50次全稳
Claude Haiku 4.54,687,746,815多了 600,000
GPT-4.14,689,140,615多了 1,993,800
Qwen2.5 72B4,785,266,160多了 98,119,345
GPT-4.1 mini4,786,842,815多了 99,696,000
Llama 3.3 70B4,181,704,815差了 505,442,000
Gemini 2.5 Flash-Lite4,001,371,045差了 685,775,770
9 位数,11 个里 6 个当场翻车(同样禁草稿心算)。看那些 ✗:有的差几百万、有的直接错几亿。⚠ DeepSeek 也对了这最难一道,但别被骗——它 50 次只对 12%、总分 8/16,纯蒙中。16 题从头稳到尾的只有 豆包、Gemini Pro★ 和 Sonnet —— 豆包 16/16 满分还比旗舰便宜;Gemini 是 reasoning 模型,成本铁证它偷打了草稿;Sonnet 是非推理的干净反例。给计算器/允许写步骤,这题就不存在。
16 道题,从 4 位爬到 9 位,每题都这么判 —— 但记住:禁草稿/单次/n=16,看理性版的误差棒与显著分组才不会过度解读。
看理性版(带 CI) 视觉识别手册 →