實測 GPT-5.3-Codex:OpenAI 首個高風險模型——限制嚴苛,API 至今仍未開放
今天凌晨,OpenAI 釋出的 GPT-5.3-Codex 可以被視為對近期本地 Agent 工具爆發式增長的一記強有力回擊——尤其是對 Anthropic 的直接回應。 配合 OpenAI 最新推出...
今天凌晨,OpenAI 釋出的 GPT-5.3-Codex 可以被視為對近期本地 Agent 工具爆發式增長的一記強有力回擊——尤其是對 Anthropic 的直接回應。
配合 OpenAI 最新推出的 Codex 桌面應用,許多此前由 Skill、Cowork、Claude Code、Openclaw 等熱門工具分別實現的能力,如今都可以在一個統一的環境中完成,核心由 Codex 的互動外殼與 GPT-5.3-Codex 模型本身共同驅動。
在 Codex 應用中,使用者可以直接選擇 GPT-5.3-Codex,並精細調節其推理深度。為了評估它在真實場景中的表現,我們給它佈置了與此前測試 Cowork 時類似的任務,包括本地檔案處理、格式轉換、多 Skills 協同呼叫、生成 Word、PowerPoint、Excel 文件、下載影片,甚至是開發應用程式。
實際表現令人印象深刻。相比從零開始安裝和配置 Claude Code 的複雜流程,Codex 提供了一個門檻低得多的入口,尤其對新手使用者而言更為友好。這也反映了整個生態中的一個明顯趨勢:本地 Agent 最初大多誕生於“黑乎乎”的命令列環境,但正在逐步迴歸到更直觀、更易用的圖形化介面。
近幾天,外界對 Codex 的評價也出現了明顯轉向。不少開發者表示已從 Claude Code 轉向 Codex,一些國內的獨立開發者也提到,Codex Plus 會員即可直接使用,而且不像 Claude 那樣頻繁遭遇無情封號的問題。
OpenAI CEO 山姆·奧特曼也毫不掩飾自己的興奮,公開宣佈 Codex 的活躍使用者數已經突破 100 萬。在 OpenAI 的模型更新部落格中,官方同樣不吝讚美之詞,稱 GPT-5.3-Codex 是公司第一個具備“自我構建”能力的模型,正因如此,才能以如此快的速度推出 5.3-Codex。
結合 Anthropic 使用 Claude Code、100% AI 程式碼、僅用兩週時間構建 Cowork 的成果,以及 OpenAI 此前分享的“28 天內用 Codex 構建 Android 版 Sora”的案例,一個結論已經呼之欲出:Agent 的時代,真的來了。
用 Codex 取代 ChatGPT 和 Claude Code
和大多數本地 Agent 工具一樣,Codex 的起點是工作區。使用者可以建立多個 Project,每個 Project 對應一個本地資料夾,再在其中開啟對話執行緒(Threads)。對於熟悉 ChatGPT 的使用者來說,這套工作流幾乎是零學習成本。
從一個最簡單的例子開始,我們新建了一個空的下載資料夾,開啟一個新的執行緒,選擇 GPT-5.3-Codex,然後直接下達指令。當我們要求它下載一個來自 X 的影片時,Codex 會自動識別可用的 Skills,並呼叫 yt-dlp 來完成下載。即便是一個長達四個多小時的影片,Codex 也會在對話視窗中持續更新下載進度。
下載完成後,我們進一步要求它提取完整逐字稿,生成一份雙語文件,並將整個流程打包成一個可複用的 Skill。隨後,同一個執行緒還能繼續完成影片剪輯、GIF 轉換或格式轉碼,全程無需離開 Codex。
例如,我們讓 Codex 將影片的第 5 秒到第 25 秒剪輯成一個新影片。得益於 GPT-5.3-Codex 快速的 token 處理能力,整體耗時並不長,更多取決於本地電腦的解碼和編碼效能。同樣地,我們也可以讓它直接把前 5 秒轉成一個 GIF,限制在 10MB 以內,幀率可調,寬度控制在 640 畫素。
很快,對應的 GIF 檔案就生成完成了。再極端一些,Codex 甚至可以把整個影片轉成圖片序列——每秒 30 幀,每一幀都是一張圖片。結合 GPT-5.3-Codex 在 Terminal-Bench-2 上的出色表現,這種對本地檔案的直接處理能力,使 Codex 足以支撐各種生產力工具和效率工具的實現。
作為對比,剛剛釋出的 Claude Opus 4.6 在 Terminal-Bench 2.0 上的得分為 65.4%,而 GPT-5.3-Codex 則達到了 77.3%。
從檔案管理到完整應用
在另一項測試中,我們讓 Codex 根據圖片內容批次重新命名檔案,要求檔名不超過 20 個英文字母,且不能包含符號。重新命名完成後,我們又讓它將這些圖片進行拼接,無論是縱向還是橫向,Codex 都能通過呼叫合適的工具順利完成。
和 Claude 的生態類似,Codex 同樣擁有豐富的 Skills 市場。應用內已原生集成了 PowerPoint、Excel、Word、Canvas、Notion 等多種常用能力。
回到核心的程式設計能力上,升級後的 GPT-5.3-Codex 相比 GPT-5.2 有著明顯進步。我們直接讓它從零開始開發一個“每日一詞”的 App。不同於 ChatGPT 的 Canvas 只能生成一個無法帶走的網頁預覽,Codex 會在本地完整構建專案,並通過 Vercel、Cloudflare 等 Skills 進行部署。
在 Extra High 的超強推理模式下,GPT-5.3-Codex 會在每一步操作前詢問下一步的選擇。這種行為源於 Codex 內部的排程機制:它會根據任務需要,動態呼叫不同的 Skills,其中包括會自動展開多輪對話的頭腦風暴模組。
最終,Codex 基本完成了最初提出的所有功能需求,並且還能進一步擴充套件到 macOS、iOS 和 Android 版本。如果使用者已經有現成的程式碼專案,也可以直接在 Codex 中開啟對應資料夾,讓 GPT-5.3-Codex 分析專案中的 Bug,並直接進行修復。
程式設計模型之戰的力量平衡正在改變
在相當長的一段時間裡,開發者的首選往往是 Anthropic 的 Sonnet / Opus 模型,配合 Claude Code 工具。OpenAI 在複雜、長邏輯程式碼推理方面一度被認為有所落後。GPT-5.3-Codex 的出現,顯然就是為了縮小,甚至終結這一差距。
無論是在基準測試還是實際體驗中,GPT-5.3-Codex 都不僅超越了自家的前代模型,也已經顯露出壓制競爭對手的跡象。它真正展現出了將程式碼編寫、測試和推理整合為一個完整流程的能力。
在 OpenAI 的釋出部落格中,遊戲開發是一個重點案例,因此我們也讓 Codex 做了一個簡單的物理彈球遊戲。雖然最終介面沒有達到我們在提示詞中期待的 RPG 風格,但整體是可執行、可遊玩的。網路上也已經出現了不少用 GPT-5.3-Codex 製作的小遊戲,比如類似超級瑪麗的收集金幣玩法。
沒有絕對贏家,只有更快的輪迴
從 Anthropic 的視角來看,OpenAI 今天的動作或許並不陌生。近幾年,OpenAI 在技術路線上的確多次緊隨 Claude 的腳步:Claude 深耕程式碼能力時,OpenAI 把重心放在 Sora、日報、瀏覽器、ChatGPT Agent 等方向,反響有限,於是重新回到程式碼賽道;Anthropic 在 1 月初推出 Cowork,OpenAI 便在 2 月初發布 Codex 應用。
時間點也凸顯了雙方的競爭關係。凌晨 1 點 45 分,Anthropic 在 X 上釋出 Claude Opus 4.6;不久之後,OpenAI 端出了 GPT-5.3-Codex。兩款模型的目標其實高度一致——為 Agent 提供更強的底座能力。話術已經從“vibe coding”演進到一個更直白的事實:Agent 想做好事,本質上還是要“程式碼寫得好”。
雖然 Opus 4.6 在 Terminal-Bench 2.0 和 SWE-Bench 上不如 GPT-5.3-Codex,但它通過將上下文視窗拉長到史無前例的 100 萬 token 進行了補償,而且從整體 benchmark 表現來看,差距並沒有被無限放大。
Anthropic 也暗示,真正的殺手鐧還沒登場——Sonnet 5 才是他們眼中的“真功夫”。
一些早期使用者測試進一步強化了這種張力。有開發者表示,Opus 4.6 只用一次呼叫,就完成了整個程式碼庫的重構,把原本混亂不堪的“屎山”全部模組化;也有人讓 Opus 4.6 和 4.5 玩同一款經營遊戲,結果是 4.6 在前期花更多時間制定策略,但最終在等級、財富和裝備上全面領先。
還有開發者用 Opus 4.6 做了一個寶可夢克隆遊戲,稱這是他用 AI 做過最酷的專案。根據描述,Opus 4.6 思考了 1 小時 30 分鐘,消耗了 11 萬個 token,只迭代了三次。
在 Anthropic 官方演示和使用者反饋中,Opus 4.6 還展現了強大的專案管理能力:它能在一天內自主關閉 13 個 issue,並將另外 12 個 issue 準確分派給合適的人類成員。類似於 Kimi K2.5 的智慧體蜂群,Opus 4.6 也能管理大規模程式碼庫,在 Claude Code 中組建 Agent Teams,讓多個 AI 分工協作,有的寫程式碼、有的 Review、有的測試,整體效率最高可提升 2.5 倍。
模型越強,使用者越強
從更宏觀的角度看,這一切就像一個輪迴:先是 Gemini 出風頭,然後是 Claude,如今看起來又輪到了 OpenAI,甚至不排除接下來是 Grok。但在這個輪迴中,作為使用者的我們,能清晰感受到 AI 能力在持續增強。
目前,OpenAI 尚未開放 GPT-5.3-Codex 的 API,理由是模型能力過強,存在較高風險,仍在評估如何安全啟用。而 Claude Opus 4.6 已經可以通過 Claude 通用聊天應用、Claude Code 以及 API 多種方式使用。
作為今年海外“御三家”首批亮相的兩款重磅模型,GPT-5.3-Codex 和 Claude Opus 4.6 都非常值得一試。展望未來,圍繞 Agent 的能力升級、讓 Agent 真正為我們做事,仍將是大模型演進的核心方向。
鄭欽文排名跌至世界第24位!年終確定無緣前20,但澳網種子席位穩了
自從因傷退出中網後,中國網球“一姐”鄭欽文的康復情況一直牽動著球迷的心。雖然她仍在積極治療與恢復中,但具體復出時間仍未確定。而在最新的WTA即時排名中,鄭欽文的排名已下滑至世界第24位,並有可能繼續下...
特斯拉充電時爆炸!車主被掀翻在地,官方調查報告揭真相:罪魁禍首竟是第三方轉接頭
10 月 23 日訊息——一樁震驚全球的電動車安全事故,終於有了定論。 去年 8 月,加拿大發生了一起特斯拉在充電過程中突然爆炸的事件。監控畫面顯示,一名男車主在將充電槍插入車尾並關上後備廂後,正準備...
大馬足總若在體育仲裁庭上訴失敗 楊巧雙警告:或將面對更嚴厲處分
(吉隆坡20日訊)青年及體育部長楊巧雙今日在國會指出,若大馬足球總會(FAM)向國際體育仲裁法庭(CAS)的上訴失敗,國際足聯(FIFA)可能會進一步加重對大馬足總及7名歸化球員的罰款與禁賽處罰。 她...
800 萬應用填不滿的需求,靈光“閃應用”成為新藍海
你是否也遇到過這樣的困擾?手機裡應用程式琳琅滿目,卻總找不到真正契合自己需求的那一款:記賬軟體統計邏輯不符習慣、分類管理不夠靈活、適配功能的工具廣告頻繁彈出……個性化需求,似乎總被“淹沒”。 這種情況...
AI 大神 Karpathy 的 2025 年度總結刷屏全網:AI 既是天才也是“智障”,這 6 個關鍵轉折點最重要。
今年各類年度回顧陸續上線,OpenAI 前聯合創始人 Andrej Karpathy 也釋出了自己的大模型年度總結。早些時候他在 YC 演講引發熱議,提出:軟體進入 3.0(從寫程式碼到喂資料,再到對模...
孫正義女兒公開亮相 軟銀接班話題再度升溫
(東京29日訊)日本獨角獸生物材料公司 Spiber 宣佈,已獲得BOLD株式會社首席執行員川名麻耶的業務支援。根據公開資料顯示,川名麻耶為日本科技投資巨頭 軟銀集團 創辦人 孫正義 的長女。 孫正義...
切爾西可以別想了!費爾明與巴薩續約至2031年,薪水上漲,解約金翻倍
根據轉會專家羅馬諾的最新訊息,巴塞羅那已經與22歲的西班牙進攻型中場費爾明就續約達成一致,新合同將延長至2031年(原合同至2029年)。雙方預計將在本週內正式完成簽約。 羅馬諾透露,費爾明已於本週一...
35歲韓劇女星健康亮紅燈,緊急停工接受手術,專心休養
(首爾28日訊)憑韓劇《黑暗榮耀》中“惡女空姐”崔惠程一角開啟知名度的35歲韓國女星車珠英,去年曾來港出席《2025 MAMA Awards》。近日,其經紀公司 Ghost Studio 釋出緊急宣告...
馬德鍾 4 月將在廣州開唱,網友好奇:他有代表作歌曲嗎?
(香港 12 日訊)視帝馬德鍾早前宣佈離開 TVB,並將事業重心轉向中國市場。近日他宣佈將於 4 月在廣州舉辦演唱會,同時公開最新宣傳海報。 海報顯示,現年 57 歲的馬德鍾以黑色造型亮相,身形線條搶...
贊達亞再度以婚紗造型亮相紅毯驚豔全場 湯姆·赫蘭德低調尾隨躲上二樓仍被狗仔捕捉曝光
近日,好萊塢女星贊達亞現身巴黎,為新片《戲劇》首映禮亮相。她一襲路易威登定製長袖婚紗驚豔全場——背部大面積鏤空設計,拖尾處點綴誇張黑色蝴蝶結,整體造型冷冽又極具戲劇張力。 造型細節同樣耐人尋味。她在無...
王心凌北碚演唱會人氣爆棚 場館外山頭擠滿觀眾甚至爬樹圍觀 當地回應引關注
“樹上的朋友,你們好嗎?”這句經典臺詞,竟在重慶北碚現實上演! 4月18日晚,王心凌北碚演唱會現場外出現罕見一幕——場館旁的野山被“佔領”,不少歌迷直接爬上山坡,甚至有人蹲在樹上“遠距離追星”,畫面既...
“小辣椒”奧斯卡造型引熱議 意外走光遭全網吐槽,被質疑為博流量過度營銷
這件舊聞近日被外媒再度翻出,再次引發討論。在第98屆奧斯卡金像獎紅毯上,奧斯卡影后格溫妮斯·帕特洛的造型曾因“疑似走光”而成為當晚話題焦點。 現年53歲的她時隔多年重返紅毯,身穿阿瑪尼高定禮服亮相杜比...