開放人工智能(OpenAI)推出 GPT-6 Astra:新一代智能模型引領人工通用智能(AGI)時代
OpenAI 最近發佈了最新的大型語言模型 GPT-6 Astra。該模型在多項嚴格基準測試中取得高分,包括終端基準科學(Terminal‑Bench Science)、代理最後考試(Agents' Last Exam)、前沿數學等級四(Frontier Math Tier 4)以及 ARC‑AGI‑3。
在 ARC‑AGI‑3 測試中,Astra 獲得 99.9% 的成績,顯示其在「自主學習與解決陌生問題」方面取得突破。模型能自主規劃、使用工具、操作電腦,並在多步驟流程中自我修正。
前沿數學等級四測試的正確率約為 98%。此測試由 Epoch AI 與數十位頂尖數學家(包括菲爾茲獎得主陶哲軒)共同設計,涵蓋代數幾何、範疇論、數論等研究級難題。人類專家通常需要數小時甚至數天才能解出一題。
與 OpenAI 同時發表了 Astra 生成的數學論文《Improved Short Gaps Between Primes》,宣布將「孿生素數猜想」的有界素數間距從 246 縮小至 186。
孿生素數猜想的核心是證明存在無窮多對差值為 2 的素數。2013 年,華裔數學家張益唐首次證明存在無窮多對間距小於 7,000 萬的素數;2014 年,陶哲軒發起全球線上協作計畫 Polymath8b,結合 James Maynard 的篩法,將上界鎖定在 246。此後 12 年未再縮小,直至 Astra 以形式化驗證工具 Lean(Lean)將上界降至 186,確保邏輯正確性。
基於上述成果,OpenAI 表示 Astra 已符合人工通用智能(AGI)的標準。
多項指標領先同儕
Astra 在電腦使用、瀏覽、軟件工程、網絡安全、科學研究與專業工作等領域均表現突出。與 Anthropic 推出的 Claude Opus 5.1 相比,Astra 在代理最後考試測試中使用的輸出 token 約少 65%,顯示同等任務下更具效率。
在電腦使用方面,Astra 能自動生成文件、電子表格與簡報,並根據需求靈活調整。BenchCAD(BenchCAD)測試中,Astra 獲得 95.9% 的得分,遠高於 GPT‑5.6 Sol 的 83.3%。過往的 AI 雖擅長文字與二維(2D)圖像生成,但在需要嚴密數學邏輯、精確尺寸和空間架構的三維(3D)領域常出現「幻覺」或結構扭曲。Astra 證明具備三維空間推理能力,能完整理解複雜物體的幾何拓撲,並轉化為嚴格的工程代碼。
在網絡安全方面,OpenAI 指出 Astra 是首個達到關鍵安全能力閾值的模型。配合適當工具與訪問權限,模型能自行發現未知漏洞並開發針對系統加固的利用程式,無需人工逐步指導。
科學研究能力同樣突出。終端基準科學 0.1 測試(Terminal Benchmark Science 0.1)中,Astra 取得 64.6% 的得分,超過 Claude Fable 5.1 的 52.6%。Astra 具備強大的長程推理與容錯能力,在數十步甚至數百步的複雜科學實驗鏈條中仍能保持嚴密邏輯,實驗失敗時能自行檢討並找出錯誤。GPQA Diamond(GPQA Diamond)測試(評估研究生級別的科學推理)中,Astra 獲得 96.0%。
任務完成速度亦有顯著提升。OSWorld 2.0(OSWorld 2.0)測試顯示,Astra 完成任務的速度比 GPT‑5.6 Sol 快約 47%。GPQA Diamond 題目由化學、物理、生物等領域專家設計,刻意避開網絡上直接可得的答案,每道題均包含高難度多步驟推理、複雜數學計算與陷阱選項。
自主運作的規劃能力
Astra 的設計目標是提升工作流程的效率與自主性,能在多種應用場景中自動執行複雜任務,從編寫程式碼到進行科學研究皆可勝任。模型透過海量數據學習與先進演算法,實現在各類任務中的高效表現。
OpenAI 在推出 Astra 宣傳片,展示從「編寫一個 2D 的火箭遊戲」到「直接生成高精度的 3D 立體火箭工程模型」的無縫跨越,不僅是呈現視覺特效,而是代表 AI 在跨模態整合與高維空間建模上的突破,包括跨維度空間對齊(2D Space to 3D Physics)、多工具鏈的「端到端」代理工作流(Agentic Workflow)以及多模態記憶與意圖的「不失真傳遞」。AI 從簡單的遊戲概念演進至符合工程標準的三維模型,直接輸出工業級 STL/STEP 檔案,可用於 3D 列印、CNC 數值控制加工或自動化大規模生產,具備直接參與實體製造、硬件設計與建築規劃的能力。
與競爭對手的比較
| 測試 | GPT‑6 Astra | Claude Opus 5.1 | GPT‑5.6 Sol |
|---|---|---|---|
| Terminal‑Bench Science 0.1 | 64.6% | 52.6% | 55.8% |
| Agents' Last Exam | 59.3% | 55.5% | 53.6% |
| OSWorld 2.0 | 72.6% | N/A | 65.7% |
| GPQA Diamond | 96.0% | N/A | N/A |
歡迎來到 AGI
儘管 Astra 在多項測試中表現優異,仍有改進空間。例如在 OSWorld 2.0 測試中僅取得 72.6% 的得分,說明仍有約四分之一的任務未能成功完成。模型仍會產生幻覺,雖較 GPT‑5.6 Sol 減少約三分之一,但尚未完全根除。總體而言,GPT‑6 Astra 標誌著人工智慧領域的重要突破。隨著技術持續演進,未來模型有望在智能與效率上取得更大進步。
OpenAI 總裁 Greg Brockman 簡短一句:「歡迎來到 AGI 時代」,說明了 Astra 的核心定位。
