2026年9月10日

科技

實測 GPT-5.3-Codex:OpenAI 首個高風險模型——限制嚴苛,API 至今仍未開放

今天凌晨,OpenAI 釋出的 GPT-5.3-Codex 可以被視為對近期本地 Agent 工具爆發式增長的一記強有力回擊——尤其是對 Anthropic 的直接回應。 配合 OpenAI 最新推出...

今天凌晨,OpenAI 釋出的 GPT-5.3-Codex 可以被視為對近期本地 Agent 工具爆發式增長的一記強有力回擊——尤其是對 Anthropic 的直接回應。

配合 OpenAI 最新推出的 Codex 桌面應用,許多此前由 Skill、Cowork、Claude Code、Openclaw 等熱門工具分別實現的能力,如今都可以在一個統一的環境中完成,核心由 Codex 的互動外殼與 GPT-5.3-Codex 模型本身共同驅動。

在 Codex 應用中,使用者可以直接選擇 GPT-5.3-Codex,並精細調節其推理深度。為了評估它在真實場景中的表現,我們給它佈置了與此前測試 Cowork 時類似的任務,包括本地檔案處理、格式轉換、多 Skills 協同呼叫、生成 Word、PowerPoint、Excel 文件、下載影片,甚至是開發應用程式。

實際表現令人印象深刻。相比從零開始安裝和配置 Claude Code 的複雜流程,Codex 提供了一個門檻低得多的入口,尤其對新手使用者而言更為友好。這也反映了整個生態中的一個明顯趨勢:本地 Agent 最初大多誕生於“黑乎乎”的命令列環境,但正在逐步迴歸到更直觀、更易用的圖形化介面。

近幾天,外界對 Codex 的評價也出現了明顯轉向。不少開發者表示已從 Claude Code 轉向 Codex,一些國內的獨立開發者也提到,Codex Plus 會員即可直接使用,而且不像 Claude 那樣頻繁遭遇無情封號的問題。

OpenAI CEO 山姆·奧特曼也毫不掩飾自己的興奮,公開宣佈 Codex 的活躍使用者數已經突破 100 萬。在 OpenAI 的模型更新部落格中,官方同樣不吝讚美之詞,稱 GPT-5.3-Codex 是公司第一個具備“自我構建”能力的模型,正因如此,才能以如此快的速度推出 5.3-Codex。

結合 Anthropic 使用 Claude Code、100% AI 程式碼、僅用兩週時間構建 Cowork 的成果,以及 OpenAI 此前分享的“28 天內用 Codex 構建 Android 版 Sora”的案例,一個結論已經呼之欲出:Agent 的時代,真的來了。

用 Codex 取代 ChatGPT 和 Claude Code

和大多數本地 Agent 工具一樣,Codex 的起點是工作區。使用者可以建立多個 Project,每個 Project 對應一個本地資料夾,再在其中開啟對話執行緒(Threads)。對於熟悉 ChatGPT 的使用者來說,這套工作流幾乎是零學習成本。

從一個最簡單的例子開始,我們新建了一個空的下載資料夾,開啟一個新的執行緒,選擇 GPT-5.3-Codex,然後直接下達指令。當我們要求它下載一個來自 X 的影片時,Codex 會自動識別可用的 Skills,並呼叫 yt-dlp 來完成下載。即便是一個長達四個多小時的影片,Codex 也會在對話視窗中持續更新下載進度。

下載完成後,我們進一步要求它提取完整逐字稿,生成一份雙語文件,並將整個流程打包成一個可複用的 Skill。隨後,同一個執行緒還能繼續完成影片剪輯、GIF 轉換或格式轉碼,全程無需離開 Codex。

例如,我們讓 Codex 將影片的第 5 秒到第 25 秒剪輯成一個新影片。得益於 GPT-5.3-Codex 快速的 token 處理能力,整體耗時並不長,更多取決於本地電腦的解碼和編碼效能。同樣地,我們也可以讓它直接把前 5 秒轉成一個 GIF,限制在 10MB 以內,幀率可調,寬度控制在 640 畫素。

很快,對應的 GIF 檔案就生成完成了。再極端一些,Codex 甚至可以把整個影片轉成圖片序列——每秒 30 幀,每一幀都是一張圖片。結合 GPT-5.3-Codex 在 Terminal-Bench-2 上的出色表現,這種對本地檔案的直接處理能力,使 Codex 足以支撐各種生產力工具和效率工具的實現。

作為對比,剛剛釋出的 Claude Opus 4.6 在 Terminal-Bench 2.0 上的得分為 65.4%,而 GPT-5.3-Codex 則達到了 77.3%。

從檔案管理到完整應用

在另一項測試中,我們讓 Codex 根據圖片內容批次重新命名檔案,要求檔名不超過 20 個英文字母,且不能包含符號。重新命名完成後,我們又讓它將這些圖片進行拼接,無論是縱向還是橫向,Codex 都能通過呼叫合適的工具順利完成。

和 Claude 的生態類似,Codex 同樣擁有豐富的 Skills 市場。應用內已原生集成了 PowerPoint、Excel、Word、Canvas、Notion 等多種常用能力。

回到核心的程式設計能力上,升級後的 GPT-5.3-Codex 相比 GPT-5.2 有著明顯進步。我們直接讓它從零開始開發一個“每日一詞”的 App。不同於 ChatGPT 的 Canvas 只能生成一個無法帶走的網頁預覽,Codex 會在本地完整構建專案,並通過 Vercel、Cloudflare 等 Skills 進行部署。

在 Extra High 的超強推理模式下,GPT-5.3-Codex 會在每一步操作前詢問下一步的選擇。這種行為源於 Codex 內部的排程機制:它會根據任務需要,動態呼叫不同的 Skills,其中包括會自動展開多輪對話的頭腦風暴模組。

最終,Codex 基本完成了最初提出的所有功能需求,並且還能進一步擴充套件到 macOS、iOS 和 Android 版本。如果使用者已經有現成的程式碼專案,也可以直接在 Codex 中開啟對應資料夾,讓 GPT-5.3-Codex 分析專案中的 Bug,並直接進行修復。

程式設計模型之戰的力量平衡正在改變

在相當長的一段時間裡,開發者的首選往往是 Anthropic 的 Sonnet / Opus 模型,配合 Claude Code 工具。OpenAI 在複雜、長邏輯程式碼推理方面一度被認為有所落後。GPT-5.3-Codex 的出現,顯然就是為了縮小,甚至終結這一差距。

無論是在基準測試還是實際體驗中,GPT-5.3-Codex 都不僅超越了自家的前代模型,也已經顯露出壓制競爭對手的跡象。它真正展現出了將程式碼編寫、測試和推理整合為一個完整流程的能力。

在 OpenAI 的釋出部落格中,遊戲開發是一個重點案例,因此我們也讓 Codex 做了一個簡單的物理彈球遊戲。雖然最終介面沒有達到我們在提示詞中期待的 RPG 風格,但整體是可執行、可遊玩的。網路上也已經出現了不少用 GPT-5.3-Codex 製作的小遊戲,比如類似超級瑪麗的收集金幣玩法。

沒有絕對贏家,只有更快的輪迴

從 Anthropic 的視角來看,OpenAI 今天的動作或許並不陌生。近幾年,OpenAI 在技術路線上的確多次緊隨 Claude 的腳步:Claude 深耕程式碼能力時,OpenAI 把重心放在 Sora、日報、瀏覽器、ChatGPT Agent 等方向,反響有限,於是重新回到程式碼賽道;Anthropic 在 1 月初推出 Cowork,OpenAI 便在 2 月初發布 Codex 應用。

時間點也凸顯了雙方的競爭關係。凌晨 1 點 45 分,Anthropic 在 X 上釋出 Claude Opus 4.6;不久之後,OpenAI 端出了 GPT-5.3-Codex。兩款模型的目標其實高度一致——為 Agent 提供更強的底座能力。話術已經從“vibe coding”演進到一個更直白的事實:Agent 想做好事,本質上還是要“程式碼寫得好”。

雖然 Opus 4.6 在 Terminal-Bench 2.0 和 SWE-Bench 上不如 GPT-5.3-Codex,但它通過將上下文視窗拉長到史無前例的 100 萬 token 進行了補償,而且從整體 benchmark 表現來看,差距並沒有被無限放大。

Anthropic 也暗示,真正的殺手鐧還沒登場——Sonnet 5 才是他們眼中的“真功夫”。

一些早期使用者測試進一步強化了這種張力。有開發者表示,Opus 4.6 只用一次呼叫,就完成了整個程式碼庫的重構,把原本混亂不堪的“屎山”全部模組化;也有人讓 Opus 4.6 和 4.5 玩同一款經營遊戲,結果是 4.6 在前期花更多時間制定策略,但最終在等級、財富和裝備上全面領先。

還有開發者用 Opus 4.6 做了一個寶可夢克隆遊戲,稱這是他用 AI 做過最酷的專案。根據描述,Opus 4.6 思考了 1 小時 30 分鐘,消耗了 11 萬個 token,只迭代了三次。

在 Anthropic 官方演示和使用者反饋中,Opus 4.6 還展現了強大的專案管理能力:它能在一天內自主關閉 13 個 issue,並將另外 12 個 issue 準確分派給合適的人類成員。類似於 Kimi K2.5 的智慧體蜂群,Opus 4.6 也能管理大規模程式碼庫,在 Claude Code 中組建 Agent Teams,讓多個 AI 分工協作,有的寫程式碼、有的 Review、有的測試,整體效率最高可提升 2.5 倍。

模型越強,使用者越強

從更宏觀的角度看,這一切就像一個輪迴:先是 Gemini 出風頭,然後是 Claude,如今看起來又輪到了 OpenAI,甚至不排除接下來是 Grok。但在這個輪迴中,作為使用者的我們,能清晰感受到 AI 能力在持續增強。

目前,OpenAI 尚未開放 GPT-5.3-Codex 的 API,理由是模型能力過強,存在較高風險,仍在評估如何安全啟用。而 Claude Opus 4.6 已經可以通過 Claude 通用聊天應用、Claude Code 以及 API 多種方式使用。

作為今年海外“御三家”首批亮相的兩款重磅模型,GPT-5.3-Codex 和 Claude Opus 4.6 都非常值得一試。展望未來,圍繞 Agent 的能力升級、讓 Agent 真正為我們做事,仍將是大模型演進的核心方向。

接著讀

800 萬應用填不滿的需求,靈光“閃應用”成為新藍海

你是否也遇到過這樣的困擾?手機裡應用程式琳琅滿目,卻總找不到真正契合自己需求的那一款:記賬軟體統計邏輯不符習慣、分類管理不夠靈活、適配功能的工具廣告頻繁彈出……個性化需求,似乎總被“淹沒”。 這種情況...

279 天前

孫正義女兒公開亮相 軟銀接班話題再度升溫

(東京29日訊)日本獨角獸生物材料公司 Spiber 宣佈,已獲得BOLD株式會社首席執行員川名麻耶的業務支援。根據公開資料顯示,川名麻耶為日本科技投資巨頭 軟銀集團 創辦人 孫正義 的長女。 孫正義...

255 天前