
對開發者而言,今次更新的重點是 API 價格降低 50%、Coding 與 Agent 能力提升、事實準確度改善、Computer Use 升級,以及針對長時間 Agent 特別強化 Prompt Caching。
GPT-6 Sol 及 Luna 已在 OpenAI API 上線,Model ID 分別為:
gpt-6-sol
gpt-6-luna
兩款模型亦已開始在 ChatGPT Work 及 Codex 推出。

API 價格直接減半
OpenAI 將 GPT-6 Sol 及 Luna 的 API 價格,較 GPT-5.6 推廣價格降低 50%:
| 模型 | Input / 100 萬 tokens | Output / 100 萬 tokens |
|---|---|---|
| GPT-6 Sol | US$2 | US$10 |
| GPT-6 Luna | US$0.10 | US$0.50 |
作為比較,GPT-5.6 Sol 原本為 US$4 / US$20;
GPT-5.6 Luna 則為 US$0.20 / US$1.20。
OpenAI 表示,今次減價來自 caching 及 inference infrastructure 效率提升,因此選擇直接將節省的成本反映在 API 價格上。
Agent 工作:Sol 每項任務 US$0.27
OpenAI 今次大量 benchmark 都不再只比較模型分數,而是同時列出 cost per task。
在 AutomationBench 1.0.6 中,AI Agent 需要使用 47 種工具,完成銷售、市場推廣、營運、客服、財務及 HR 等跨應用程式工作。
GPT-6 Sol 在 xhigh effort 下取得 33.2%,每項工作成本約 US$0.27。
官方比較數據顯示:
GPT-6 Astra low 為 30.3%,成本約是 Sol 的 3.9 倍;
Claude Opus 5 max 為 26.9%,成本約是 Sol 的 11.1 倍;
Claude Fable 5.1 配合 Opus 5 fallback 為 31.4%,成本則高於 Sol 8.9 倍,而且這個數字尚未計入約 40% 任務觸發 Opus 5 fallback 的成本。
GPT-6 Luna 同樣有明顯提升。OpenAI 指 Luna 在 high effort 下,相比 GPT-5.6 Luna 的 AutomationBench 成績增加 5.4 個百分點,每項工作成本則降低 58%。
Coding:Sol 接近 Fable 5,Luna 亦追到高階模型
Coding 是今次另一項主要升級。
在 FrontierCode 1.1,測試不只要求程式能夠運行,亦會評估 test quality、修改範圍、code style 及是否符合原有 codebase 標準,即程式碼最終是否真正適合 merge。
OpenAI 表示 GPT-6 Sol 相較 GPT-5.6 Sol 有明顯進步,並能以遠低成本,達到 Claude Fable 5.1 xhigh 相若水平。
另一項 DeepSWE v1.1 專門測試真實 codebase 中的長週期軟件工程任務。
GPT-6 Sol max effort 得分 68.8%,與 Claude Fable 5 xhigh 的 69.9% 相差 1.1 個百分點,但 OpenAI 估算每項工作成本低約 80%。
更值得留意的是 GPT-6 Luna。Luna max effort 在同一測試取得 66.6%,與 Claude Opus 5 及 Fable 5 medium effort 表現相若;OpenAI 估算 Luna 每項工作成本分別低 93% 及 96%。

Computer Use:Sol 達 60.5%
Computer Use 同樣由 Astra 的能力下放至 Sol 及 Luna。
在 OSWorld 2.0 offline 測試,GPT-6 Sol xhigh 取得 60.5%,Claude Opus 5 medium 為 60.3%,但 OpenAI 指 Sol 每項任務成本約低 80%。
GPT-6 Luna max 的表現亦已超越 GPT-5.6 Sol medium,而每項任務成本只有後者約 十分之一。
OpenAI 同時強調,目前 GPT-6 Astra 仍然是旗下 Computer Use 能力最高的模型,Sol 及 Luna 今次主要改善的是能力與成本之間的比例。

Factuality:Sol 錯誤量約減半
除了 Coding,GPT-6 Sol 及 Luna 的事實準確度亦有改善。
OpenAI 使用一組來自匿名化 ChatGPT 真實對話的內部 factuality evaluation,專門挑選曾被用戶標記出事實錯誤的案例重新測試。
結果顯示,GPT-6 Sol 出現的錯誤約只有 GPT-5.6 Sol 一半,可靠程度已接近 GPT-6 Astra。
GPT-6 Luna 在較高 reasoning effort 下,則可以達到 GPT-5.6 Sol 相若的 factuality,而成本約只有後者 百分之一。
不過 OpenAI 特別提醒,這組資料刻意選取容易令模型犯錯的對話,因此不能視為一般 ChatGPT 使用情況下的實際錯誤率。

Prompt Cache 大改:改 reasoning effort 都不再失效
對正在開發 Agent 的團隊,今次其中一項最實際的新功能其實不是 benchmark,而是 Prompt Caching 改進。
GPT-6 提高了預設 cache hit rate,讓 Agent 可以重用更多已處理 context;cached input token read 可獲 90% 折扣。
更重要的是,兩種過往很容易令 cache 失效的操作,今次可以保留之前的 cached context:
修改 reasoning effort
以及
啟用或停用 tools
換言之,Agent 執行途中即使因任務難度提高 reasoning effort,或者按需要開關不同工具,之前已經處理的 prompt prefix 仍可繼續重用。
Explicit Breakpoints:開發者自行決定 cache 到哪裏
GPT-6 Prompt Caching 亦加入 explicit breakpoints。
開發者可以自行指定 cached prompt prefix 在哪個位置結束,令固定 context 與經常變動的內容分開,提高 cache reuse。
OpenAI 同時提供 Prompt Caching Dashboard,顯示有多少 input 被 cache 以及隨時間的變化;另有 diagnostics tool,可協助找出 cache miss 的原因及優化位置。
OpenAI 引述 GitHub 數據指,過去數月相關 caching 改善已應用於數十億次 OpenAI model requests,令 Copilot 需要重新處理的 prompt tokens 比例下降超過 50%。
Technical / Coding 對話亦改寫作風格
GPT-6 Astra 引入的新 communication style,今次亦正式下放至 Sol 及 Luna。
OpenAI 表示,新模型特別針對 technical 及 coding conversations 改善,包括:
更清楚直接、減少 jargon、減少奇怪措辭、刪減低價值細節,以及在不減少實際內容的情況下稍為縮短答案。
官方展示的 Coding 例子亦反映另一項改變。
GPT-5.6 Sol 在收到網站修改要求後,很快便表示修改已經完成;GPT-6 Sol 則先說明自己會檢查現有網站結構,再決定是否真的需要 React。完成後亦明確交代自己實際測試過 desktop、窄螢幕 mobile 及 browser back navigation。
OpenAI 指新版本其中一項改善,就是減少在尚未真正檢查之前便作出結論,同時更清楚交代模型究竟做過甚麼、沒有做過甚麼。

Coding「講大話」情況亦下降
這亦延伸至 GPT-6 的 alignment 改進。
OpenAI 表示 Sol 及 Luna 承接 Astra 的 alignment 訓練方式,相比 GPT-5.6 對應型號,在多項安全及 alignment evaluation 都有所改善。
其中一項特別針對 Coding Agent 的測試,會刻意設計容易令 AI 誤導使用者的情況,例如聲稱已經完成實際上未完成的修改、繞過 reviewer 或避開警告。
OpenAI 表示 GPT-6 Sol 及 Luna 相比 GPT-5.6 型號,出現這類 misleading claims about their coding work 的比例下降。官方同時強調,這些都是刻意設計的極端測試,不能直接視為日常使用的實際失敗率。
現時在哪裏可以用?
GPT-6 Sol 與 GPT-6 Luna 已於 OpenAI API 推出:
gpt-6-sol
gpt-6-luna
Plus、Pro、Business、Enterprise 及 Edu 用戶亦已開始可以在 ChatGPT Work 及 Codex 使用兩款模型。
Free 及 Go 用戶則可透過 desktop app 使用 GPT-6 Luna。
OpenAI 表示發佈初期兩款模型仍未正式在一般 ChatGPT Chat 模式推出,並會逐步向用戶開放。




