GPT-6 Low 比 GPT-5.6 xHigh 還強?GPT-6 與 GPT-5.6 推理強度數值對比
Copyright Notice: This article is an original work licensed under the CC 4.0 BY-NC-ND license.
If you wish to repost this article, please include the original source link and this copyright notice.
Source link: https://v2know.com/article/1376
GPT-6 Astra 發布後,一個很值得注意的變化是: 相同的 Reasoning Effort(推理強度),GPT-6 的實際能力已經明顯高於 GPT-5.6 Sol。
根據 Artificial Analysis 的 Intelligence Index 評測,目前兩代模型各推理檔位的分數如下:
| Reasoning Effort | GPT-5.6 Sol | GPT-6 Astra | GPT-6 相對提升 |
|---|---|---|---|
| Low | 34 | 46 | +35.3% |
| Medium | 39 | 50 | +28.2% |
| High | 42 | 51 | +21.4% |
| Extra High / xHigh | 44 | 53 | +20.5% |
| Max | 47 | 53 | +12.8% |
最值得注意的是 GPT-6 Low
單獨拿幾個檔位出來看:
- GPT-5.6 High:42
- GPT-5.6 xHigh:44
- GPT-6 Low:46
- GPT-5.6 Max:47
- GPT-6 Medium:50
也就是說: GPT-6 Low 的綜合評測分數,已經超過 GPT-5.6 xHigh,甚至非常接近 GPT-5.6 Max。
因此,如果以前習慣在 Codex 或其他複雜任務中使用 GPT-5.6 xHigh,切換到 GPT-6 Low 並不一定是在「降低推理強度」。
GPT-6 Low ≈ GPT-5.6 xHigh ~ Max
而 GPT-6 Medium、High 以上,則進一步超出了 GPT-5.6 的常規能力範圍。
結論
如果只看 Artificial Analysis Intelligence Index,可以非常簡單地理解:
GPT-6 Low > GPT-5.6 xHigh
而且 GPT-6 Low 的 46 分距離 GPT-5.6 Max 的 47 分僅差 1 分。
這也意味著,到了 GPT-6 這一代,很多原本需要使用 High 或 xHigh 推理強度的任務, 可能使用 Low 或 Medium 就已經足夠。
當然,Intelligence Index 是由多項 Benchmark 組成的綜合指標, 不能理解成 GPT-6 Low 在任何單一任務上都一定勝過 GPT-5.6 xHigh, 也不能把分數差直接理解成「智力高了多少百分比」。
但用它來橫向觀察不同模型、不同 Reasoning Effort 的整體能力位置,非常直觀。
資料來源
This article was last edited at