📋 想自己验?两条路:① 题目+答案手动粘进聊天框跑;② 脚本存成 .py 在终端自动跑。答案单独核分,别和题目一起喂
①②聊天框 · ③.py终端 · 或下面 ▶ 当场盲测
▶ 上擂台 · 选个模型当场盲测 —— 答案锁服务端,模型只收盲题,结果直接跑回这页
最终排名 · 16 题总分 · ✓策展已复验 + 🏟社区待复验 · 只比准确率 + 性价比
| # | 模型 | 得分 | 准确率 |
单题成本 | 性价比 准÷$ |
| 1 | 豆包 Seed 1.6双冠 | 16/16 | 100% | $0.0020 | 31.5 |
| 2 | Gemini 2.5 Pro | 15/16 | 94% | $0.0122 | 4.8 |
| 3 | Claude Sonnet 4.6 | 14/16 | 88% | $0.0018 | 30.2 |
| ▼ 以下 <80% —— 没资格争性价比之王(全错0成本=性价比无穷大,无意义) |
| 4 | Gemini 3.5 Flash🏴 OG挑战 | 11/16 | 69% | $0.0118 | 门槛外 |
| 5 | DeepSeek V3.2 | 8/16 | 50% | $0.00003 | 门槛外 |
| 6 | Claude Haiku 4.5 | 8/16 | 50% | $0.00023 | 门槛外 |
| 7 | GPT-4.1 | 4/16 | 25% | $0.00025 | 门槛外 |
| 8 | Gemini 2.5 Flash-Lite | 3/16 | 19% | $0.00002 | 门槛外 |
| 9 | GPT-4.1 mini | 1/16 | 6% | $0.00005 | 门槛外 |
| 10 | Llama 3.3 70B | 0/16 | 0% | $0.00002 | 门槛外 |
| 11 | Qwen2.5 72B | 0/16 | 0% | $0.00005 | 门槛外 |
两块金牌都被豆包端走:① 绝对冠军=准确率最高(16/16);② 性价比之王=准确率÷成本,且必须先 ≥80% 才有资格。前三名里 —— 豆包、Sonnet 单题 ~$0.002,Gemini Pro 贵 6 倍($0.0122,reasoning 烧隐藏 token)。所以"满分 vs 旗舰"的差,差在成本不差在准:豆包满分还比 Gemini 便宜 6 倍。
⚠ 为什么不比速度:延迟严重受网络/服务商负载/排队影响,同一模型不同时刻能差几倍,单测不公平,故不纳入排名。仍是禁草稿/单次/n=16,精确数字看理性版。
🏴 第 4 行 = OG 社区挑战:有人晒 Gemini 3.5 Flash「16/16」,一查是开卷(模型看到了答案);同配方盲测复验真分 11/16,照样进第 4 名。这就是 og2go —— 谁都能挑战上墙,但战绩靠复验,不靠截图。
热身 · 第 1 题 · 4 位数 ×10 · 6/11 答对
// 题目:把这 10 个数加起来
6,861
+8,829
+3,654
+8,136
+6,739
+3,429
+9,751
+1,907
+7,620
+1,660
真值 =58,586
11 个模型当场怎么答的(✓ 对 / ✗ 错):
✓豆包 Seed 1.6 🏆58,586总16/16·50次全稳
✓Gemini 3.5 Flash 🏴58,586总11/16·OG挑战
✓DeepSeek V3.258,586总8/16·50次仅42%·蒙中⚠
✓Claude Haiku 4.558,586总8/16·小数稳大数崩
✓Gemini 2.5 Pro58,586总15/16·50次98%
✓Claude Sonnet 4.658,586总14/16·50次全稳
✗Qwen2.5 72B58,626多了 40
✗GPT-4.158,686多了 100
✗GPT-4.1 mini55,586差了 3,000
✗Gemini 2.5 Flash-Lite68,610多了 10,024
✗Llama 3.3 70B6,861差了 51,725
注意这是禁草稿/不给工具的心算:就算只 4 位数,11 个里也只有 6 个算对。⚠ 别被 ✓ 骗:DeepSeek 这道对了,但它 50 次只对 42%、总分 8/16,是蒙中。多数模型连小数连加都不稳——但允许写步骤/给计算器就会好很多,这测的是"被禁草稿的心算"不是"会不会加法"。
上强度 · 第 16 题 · 9 位数 ×10 · 只 5/11 答对
// 题目:把这 10 个数加起来
465,060,564
+976,720,443
+143,853,578
+134,529,161
+656,830,543
+111,475,322
+272,988,485
+754,255,986
+789,649,768
+381,782,965
真值 =4,687,146,815
同样 11 个模型,位数一大就崩:
✓豆包 Seed 1.6 🏆4,687,146,815总16/16·50次全稳
✓Gemini 3.5 Flash 🏴4,687,146,815总11/16·OG挑战
✓DeepSeek V3.24,687,146,815总8/16·50次仅12%·蒙中⚠
✓Gemini 2.5 Pro4,687,146,815总15/16·50次96%
✓Claude Sonnet 4.64,687,146,815总14/16·50次全稳
✗Claude Haiku 4.54,687,746,815多了 600,000
✗GPT-4.14,689,140,615多了 1,993,800
✗Qwen2.5 72B4,785,266,160多了 98,119,345
✗GPT-4.1 mini4,786,842,815多了 99,696,000
✗Llama 3.3 70B4,181,704,815差了 505,442,000
✗Gemini 2.5 Flash-Lite4,001,371,045差了 685,775,770
9 位数,11 个里 6 个当场翻车(同样禁草稿心算)。看那些 ✗:有的差几百万、有的直接错几亿。⚠ DeepSeek 也对了这最难一道,但别被骗——它 50 次只对 12%、总分 8/16,纯蒙中。16 题从头稳到尾的只有 豆包、Gemini Pro★ 和 Sonnet —— 豆包 16/16 满分还比旗舰便宜;Gemini 是 reasoning 模型,成本铁证它偷打了草稿;Sonnet 是非推理的干净反例。给计算器/允许写步骤,这题就不存在。