Codex Ultra 真的比較強嗎?我的實測結論:大多數時候 High 就夠了

| Application program | 1 Reads

最近我連續測試了 Codex 的不同 reasoning 等級,尤其是 Very High(xhigh)、Max 與 Ultra

原本我的直覺很簡單:

等級越高 = 越聰明 = 越適合複雜開發。

但實際使用之後,我的結論幾乎完全相反。

Ultra:名字很猛,實際體驗很差

我刻意拿 Ultra 測了三種任務:

  • 很簡單的任務

  • 中等複雜度任務

  • 非常複雜的任務

結果三次都不理想,而且都有一個共同問題:

非常慢。

最讓我困惑的是,即使是複雜任務,Ultra 也沒有呈現出「花更多時間,所以結果明顯更好」的感覺。

後來才理解,Ultra 並不是單純的:

Max 再加強版

它更接近:

讓 Codex 使用多個 subagent 拆分任務的模式。

問題就在這裡。

如果任務不是天然可以平行拆成多個獨立部分,例如:

  • Agent A 分析 Backend

  • Agent B 分析 Frontend

  • Agent C 分析測試

  • Agent D 分析 Security

那麼多 Agent 帶來的可能不是效率,而是:

拆解成本 + 重複分析 + 協調成本 + 最後整合成本。

尤其像 Power Apps、MCP、GUI 操作、RDL 修改這種大量步驟彼此依賴的工作,本質上是串行任務。

Ultra 在這種場合甚至可能比普通模式更慢。

所以至少對我的工作來說:

Ultra 不如叫 Parallel Mode,比叫 Ultra 準確得多。

至於我的主觀名稱?

Trash。


Max 也沒有想像中神

Max 的情況稍微好一點。

它確實會花更多時間思考、檢查、探索問題。

但我實際使用之後最大的感覺是:

Max 和 Very High 的品質差距,遠遠沒有時間差距那麼大。

很多任務上,Very High 已經可以得到很好的結果。

升到 Max 之後,經常看到 Codex:

  • 讀更多東西

  • 重新檢查

  • 思考更多可能性

  • 驗證更多次

但最終產出的東西,未必比 Very High 明顯更好。

這也是為什麼我現在完全不把:

Medium → High → Very High → Max → Ultra

理解成單純的「智商排行榜」。

它比較像:

你願意給模型多少推理預算,以及用什麼方式處理任務。


那到底什麼叫「高 Reasoning」?

這也是我之前最大的誤區。

我以前會覺得:

程式很多、檔案很多、功能很多 = 需要高 reasoning。

其實不是。

例如:

  • 讀 20 個 VBA Module

  • 讀 3 張 Dataverse Table

  • 處理 400 個欄位

  • 修改很多 Excel Sheet

  • 用 pac CLI 操作 Power Platform

  • 根據明確要求修改 RDL

這些工作可能非常耗時。

但它們更多是:

Context-heavy + Execution-heavy

而不是:

Reasoning-heavy。

真正吃 reasoning 的問題是:

「答案不能直接讀出來,而是必須自己推導。」

例如:

  • 三段 VBA 邏輯互相矛盾,真正的業務規則是什麼?

  • 舊 Access 架構無法直接搬到 Power Apps,應該重新怎麼設計?

  • 需求只有業務描述,沒有詳細設計,整套架構應該怎麼做?

  • 一個 Bug 有五種可能原因,需要逐一排除。

  • 400 個欄位到底應該如何重新分組成合理的帳票?

這才是真的 reasoning-heavy。


我現在怎麼選 Codex 等級?

經過這段時間實測,我自己的使用方式已經變成:

Medium
需求非常明確、偏機械操作。

High
我的日常主力。需要理解專案、跨檔案修改、操作工具、做一定程度的判斷與驗證。

Very High / xhigh
需求不完整,需要 Codex 自己做比較多設計與推導時使用。

Max
Very High 已經處理不好,而且問題確定出在「推理」而不是工具時才考慮。

Ultra
只有任務真的可以拆成多個互不依賴的子任務時才考慮。

換句話說:

大多數軟體開發工作,我現在直接用 High。


一個很好用的判斷方法

我現在會用這句話判斷:

你替 Codex 決定得越多,reasoning 越可以降低。

你要求 Codex 自己決定得越多,reasoning 才越值得提高。

例如:

「按照這份詳細設計實作 WinForms。」

High 通常就夠。

但如果是:

「我只有業務需求,你自己決定 DB、Architecture、UI、Validation、Transaction、Error Handling。」

這才開始適合 xhigh。

所以「從零寫程式」也不代表一定要 xhigh。

如果規格夠清楚,High 依然很好用。


結論:不要迷信最高檔

我現在最大的心得就是:

Reasoning 等級不是 RPG 的裝備稀有度。

Max 不一定比 Very High 實用。

Ultra 更不是 Max 的究極進化版。

很多時候,提高 reasoning 只是讓模型:

想得更多、檢查得更多、花得更久。

但「更多」不等於「更好」。

至少按照我目前對 Codex 的實測:

High 是最實用的日常檔位。

xhigh 是特殊情況。

Max 是備用武器。

Ultra 是非常挑任務結構的特殊模式。

所以如果你也發現 Codex 開到最高檔之後,工作時間暴增,結果卻沒有明顯改善——

問題可能不是你的 Prompt。

你可能只是把 Reasoning 開得太高了。

This article was last edited at