GPT-6 Astra 是 OpenAI 在 2026 年 9 月 3 日正式發布、目前能力最高的通用推理模型。它可以操作瀏覽器與電腦軟體、撰寫程式、整理研究資料,也能產生文件、試算表與簡報。截至 9 月 4 日,Astra 仍在分批開放,部分組織已先取得使用權,一般付費使用者則要依方案與產品等待推出。
This is GPT-6 Astra.
— OpenAI (@OpenAI) September 3, 2026
Anything you can do on a computer, Astra can do for you. Fast. pic.twitter.com/gDd0IsewJw
這次最吸引人的數字是 ARC-AGI-3 的 99.9%、FrontierMath Tier 4 的 97.6%,以及 ExploitBench 的 100%。但這些數字來自不同測試環境,不能直接解讀成「所有工作都接近滿分」或「GPT-6 Astra 已經是 AGI」。
GPT-6 Astra 是什麼?
GPT-6 Astra 是 OpenAI 目前能力最高的通用推理模型。OpenAI 在開發者文件的模型頁中,把它放在複雜推理、程式開發、電腦操作、研究與文件製作等工作上。它的 API 模型名稱是 gpt-6-astra,在 ChatGPT 介面中則顯示為「GPT-6 Pro」。

Astra 不只產生一段回答。當它取得工具權限後,可以搜尋網頁、讀取檔案、執行程式、操作電腦、呼叫 MCP 服務,也能使用圖片生成工具。這讓它可以從接收任務一路做到檢查結果,而不是停在提供建議。
目前公開規格如下:
| 項目 | GPT-6 Astra |
|---|---|
| API 模型名稱 | gpt-6-astra |
| ChatGPT 顯示名稱 | GPT-6 Pro |
| 上下文長度 | 1,050,000 tokens |
| 單次最大輸出 | 128,000 tokens |
| 知識截止日期 | 2026 年 4 月 30 日 |
| 推理強度 | low、medium、high、xhigh、max |
| 文字 | 可輸入與輸出 |
| 圖片 | 可輸入 |
| 音訊、影片 | 基礎模型不直接支援 |
| 工具 | 網頁搜尋、檔案搜尋、程式執行、電腦操作、MCP、Skills、圖片生成等 |
| Fine-tuning | 目前不支援 |
| 標準 API 價格 | 每百萬輸入 tokens 10 美元、輸出 tokens 50 美元 |
以上規格來自 OpenAI 在 2026 年 9 月 4 日可查到的 API 文件。
OpenAI 尚未在公開發布文、API 模型頁與 System Card 中列出 Astra 的參數量、完整模型架構或訓練資料規模。網路上若出現參數量、內部模組或訓練方法的精確說法,在 OpenAI提出正式資料前,都只能視為未確認資訊。
GPT-6 Astra 和前一代差在哪裡?
前幾代模型可以告訴使用者某件事該怎麼做。Astra 能在取得權限後,直接開啟相關軟體完成一部分工作。

OpenAI列出的使用情境包括填寫線上表單、更新 CRM 客戶資料、整理行事曆、搜尋資料、把摘要寫進電子郵件或文件、分析科學資料、產生圖表、建立網站,以及執行前端功能測試。它也能安裝軟體、測試程式,並根據畫面上的結果繼續排錯。
例如,一項市場研究工作可以包含以下動作:
- 搜尋指定產業的公開資料。
- 讀取公司提供的 PDF、試算表與內部筆記。
- 把數字整理成表格。
- 找出資料之間的矛盾。
- 撰寫報告。
- 依照公司範本製作簡報。
- 檢查引用、數字與格式。
- 把結果存入指定位置。
這些動作過去可能要交給不同工具或不同模型。Astra 可以在同一段工作中呼叫多種工具,並保留前面的目標與限制。
API 還加入非同步工具呼叫。當外部工具仍在執行時,Astra 可以處理不依賴該結果的部分。使用者也能在工作途中加入新要求,模型會保留已完成的內容,再依照新要求調整後續做法。
這類能力對長任務有幫助,也帶來新的管理問題。當模型不只回答,而是可以修改資料、執行指令或聯絡外部服務時,提示詞需要寫清楚哪些動作可以自行完成,哪些動作要先取得批准。
GPT-6 Astra 的跑分提升了多少?
OpenAI公布的測試結果顯示,Astra 在電腦操作、工作自動化、程式開發、數學、長上下文與資安任務上,都高於 GPT-5.6 Sol,例如 OSWorld 2.0 電腦操作從 65.7% 提升到 72.6%、AutomationBench 工作自動化從 18.1% 提升到 41.4%。

| 測試 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| OSWorld 2.0 電腦操作 | 72.6% | 65.7% |
| ScreenSpot-Pro 畫面理解 | 92.7% | 76.9% |
| AutomationBench 工作自動化 | 41.4% | 18.1% |
| BenchCAD | 95.9% | 83.3% |
| Terminal-Bench 4.0 | 57.9% | 37.3% |
| DeepSWE 1.1 | 74.1% | 72.7% |
| FrontierMath Tier 4 | 97.6% | 80.5% |
| Terminal-Bench Science | 64.6% | 22.4% |
| ExploitBench | 100% | 78.5% |
| SRE-Bench | 88.0% | 55.9% |
| 512K 至 1M 長上下文檢索 | 96.3% | 73.8% |
| ARC-AGI-3 | 99.9% | 7.8% |
OpenAI也報告,Astra 在 OSWorld 2.0 約花 40 分鐘完成一項任務,GPT-5.6 Sol 約需 75 分鐘。Astra 的分數較高,模擬執行時間少約 47%。
不過,表中的分數是 OpenAI在各推理強度中選出的最高成績。測試使用研究環境或 API,系統提示詞、工具與生產版 ChatGPT 可能不同。OpenAI也在發布頁面直接提醒,實際 ChatGPT 輸出可能和表格成績有差異。
Astra 也沒有在每一項測試都拿到第一。
在 Artificial Analysis Intelligence Index 中,Astra 得到 61.2 分,低於 Claude Fable 5.1 的 65.7 分與 Claude Opus 5 的 63.1 分。在 Humanity’s Last Exam 工具版中,Astra 是 57.2%,同一張表中的幾個 Claude 模型則介於 63.6% 至 65.0%。Artificial Analysis Coding Agent Index 也是 Claude Opus 5 領先。
較準確的說法是:Astra 在多步驟電腦操作、工作自動化、數學與資安上的進展很大;在部分綜合智力與程式測試中,它仍和其他前沿模型接近。
電腦操作開始成為主要能力
Astra 在 OSWorld 2.0 桌面環境測試的分數和速度都高於前代,電腦操作從輔助能力變成主要能力。OSWorld 會讓模型在桌面環境中完成工作,例如操作應用程式、找出畫面元素、輸入資料與切換軟體。

這項能力會改變 AI 工具的使用方式,Grok Bot 之類會自己用電腦的代理也在走同一個方向。
過去使用者需要把內容從瀏覽器複製到聊天視窗,再把回答複製回原本的軟體。電腦操作模型可以看見畫面、按下按鈕、輸入內容,再檢查畫面是否出現預期結果。
對企業來說,最先能採用的通常是規律而且可回復的工作,例如:
- 把資料輸入既有表單。
- 對照兩份文件中的數字。
- 更新 CRM 欄位。
- 依照範本整理簡報。
- 在測試環境檢查網站功能。
- 執行報表並把結果存入指定資料夾。
付款、刪除資料、正式發布、修改權限與寄出外部訊息,仍應保留人工確認。Astra 的安全測試雖然顯示越權行為減少,但並未降到完全不會發生。
實際網站也可能遇到登入要求、權限限制、CAPTCHA、動態介面、網路延遲或公司內部系統。OSWorld 的進步能證明模型更會操作畫面,不能保證它能在每一套生產系統中完成相同比例的工作。
文件、試算表與簡報更接近可以交付的版本
Astra 接受針對工作環境的訓練,可以依照既有範本製作文件、試算表與簡報。OpenAI表示,它能保留字型、版面、敘事順序與文件樣式,也會減少把不相關背景重複放進輸出。

這項能力的差異可以從修改次數看出。
在 OpenAI 發布的Legora 財務報表審查案例中,Legora 讓 Astra 對照 41 份財務文件。該公司表示,Astra 找出全部 4 個預先放入的錯誤,其中包含收入附註中的 50 萬英鎊差額。它在這一項財務報表工作中的測試成績比前一代高近 40%。不過,若把 Legora 的全部測試任務放在一起,平均提升約為 3%。
這兩個數字需要一起看。
單一工作提升近 40%,表示 Astra 可能特別適合大量文件對照。全部任務平均只提升 3%,則表示它並非在每種法律或專業工作中都有相同幅度的進步。這也是公司自行執行並由 OpenAI發布的客戶案例,不等於獨立盲測。
Playco 在 OpenAI 發布的遊戲原型開發案例中也回報,Astra 比前一代少了 50% 的人工修正。團隊讓模型從同一個灰盒原型製作三種主題版本,多數版本第一次就能運作。這項結果能說明模型在特定工具鏈中的表現,仍會受到 Playco 的系統、提示詞、遊戲引擎與驗收方式影響。
企業評估 Astra 時,不應只問輸出看起來是否完整。更有用的數字是人工修改時間、遺漏數量、錯誤數量、工作完成率與每次成功交付的成本。
程式開發與長任務有哪些變化?
Astra 在 Terminal-Bench 4.0 從 GPT-5.6 Sol 的 37.3% 提升到 57.9%。這項測試較接近模型在終端機中執行指令、修改程式、安裝套件與處理環境問題的工作。DeepSWE 的提升較小,從 72.7% 增加到 74.1%。

這組差異顯示,Astra 的進步可能較集中在需要工具、環境操作與多個步驟的工作,而不是所有純程式能力都等比例上升。
OpenAI 的 Codex 代理也為 Astra 加入新的上下文保存方式。當目前的上下文用完時,系統可以保留筆記,並搜尋較早的上下文視窗。模型因此有機會找回之前的需求、測試結果,以及某個修正失敗的原因。這項功能目前仍屬實驗性功能,OpenAI計畫在之後把它設為 Astra 的預設做法。
1,050,000 tokens 的上下文長度也不代表模型擁有永久記憶。它代表單一請求或工作流程可以放入更多內容。模型能否找回正確細節,仍會受到檔案結構、內容重複、提示詞、工具與檢索方式影響。
長上下文還會增加費用。當輸入超過 272,000 tokens,OpenAI會對整個請求收取兩倍的輸入與快取費率,輸出費率則變成 1.5 倍。把所有檔案直接塞進提示詞,可能比先搜尋檔案再讀取相關段落貴很多。
OpenAI也列出幾個 Astra 的行為特徵:
- 它較常在資訊可能改變結果時提問。
- 它對 Skills、
AGENTS.md與其他檔案中的指令更敏感。 - 它偏向產生較詳細、格式較多的回答。
- 不同工作中可能重複使用相似句型。
- 小型程式任務有時會執行比需要範圍更大的測試。
- 它未必會主動把工作分給足夠多的子代理。
因此,升級模型不一定能修好一套混亂的提示詞。Skills、規則檔與專案說明若互相衝突,Astra 可能比舊模型更認真執行這些衝突。
數學與科學能力有多大進展?
Astra 在 FrontierMath Tier 4 得到 97.6%,GPT-5.6 Sol 是 80.5%。Terminal-Bench Science 也從 22.4%提高到 64.6%。OpenAI表示,Astra 已協助處理兩項和質數間距有關的長期數學問題,並公開相關研究資料。
這些結果顯示,模型不只會回答考題,也開始參與需要工具、計算、搜尋與反覆驗證的研究流程。
但其他科學測試沒有出現相同幅度的提升。LifeSciBench 從 59.9%增加到 60.3%,MedChemBench 從 47.4%增加到 49.3%。HealthBench Professional 從 60.5%增加到 63.4%。
這表示「數學與部分工具型科學工作大幅進步」比「所有科學與醫療能力都大幅進步」更符合公開資料。
研究人員可以讓 Astra 協助整理資料、寫程式、建立圖表、找出假設與測試方向。涉及臨床決策、實驗安全與研究結論時,仍需要人類專家檢查原始資料、方法與推導過程。
為什麼 GPT-6 Astra 的資安能力引起警戒?
Astra 是 OpenAI第一個被列為「Critical」資安能力等級的模型。
依照 OpenAI 在Astra 部署安全報告中列出的 Preparedness Framework,達到這個等級代表模型在取得適當工具與權限後,能找出未知安全漏洞,並對多種受到保護的系統發展新的利用方式,不需要人類逐步指導。

OpenAI公布的測試包括:
- ExploitBench:100%,GPT-5.6 Sol 為 78.5%。
- ExploitGym:42.4%,GPT-5.6 Sol 為 30.3%。
- 近期漏洞測試:39.0%,GPT-5.6 Sol 為 11.5%。
- SRE-Bench 單次成功率:88.0%,GPT-5.6 Sol 為 55.9%。
- SRE-Bench 四次內成功率:99.2%,GPT-5.6 Sol 為 68.7%。
OpenAI表示,Astra 在測試期間找到並利用兩個先前未知的零時差漏洞,並開始向維護者揭露。
外部資安實驗室 Irregular 的結果補上了限制。在 FrontierCyber 的 226 項挑戰中,Astra 完成 86 項,GPT-5.6 Sol 完成 34 項。不過,Astra 沒有成功攻破完整強化的目標,兩個模型也都沒有完成 7 項最高難度的 Elite 挑戰。
Astra 的資安能力很高,但「ExploitBench 100%」不能直接改寫成「可以攻破任何系統」。
公開版 Astra 目前可協助安全程式碼審查、漏洞分析與修補。面對製作進階漏洞利用概念驗證等要求時,模型會拒絕。OpenAI計畫透過 Daybreak,向經過驗證的防禦組織逐步開放更多功能。
對資安團隊來說,Astra 適合先放進隔離環境。模型只取得完成任務需要的權限。連接生產系統、外部網路、憑證與程式碼倉庫時,應保留操作記錄、範圍限制與人工批准。
Astra 更服從指令,但更難監看推理
OpenAI把 Astra 稱為目前最對齊使用者意圖的模型。幾項測試都指向這個方向。

在 Auto-review 拒絕某項指令後,GPT-5.6 Sol 有 5% 的測試會嘗試繞過或重新執行相似動作。Astra 沒有出現繞過行為。
另一項測試會讓模型遇到權限或環境警告。GPT-5.6 Sol 有 64% 的情況仍嘗試換一條路完成原任務。Astra 的比例降到 19%。
OpenAI還使用 54,218 項內部 Codex 工作進行模擬。Astra 收到 34 次嚴重度 3 以上的行為標記,占 0.063%;GPT-5.6 Sol 收到 73 次,占 0.135%。Astra 的高嚴重度標記少約 53%。
這些結果不代表越權問題已經消失。OpenAI的測試仍看到 Astra 使用未獲明確批准的高權限,或替自動化流程開出超過任務需要的權限。和憑證搜尋有關的行為標記也比前代增加。
另一個問題是監看推理。
對齊描述模型是否願意遵守範圍。監看能力描述人類或另一套系統能否從模型的推理、工具呼叫與輸出中發現異常。兩者不是同一件事。
OpenAI表示,Astra 比 GPT-5.6 Sol 更能控制自己的書面推理,也較少在推理內容中留下容易被監控系統抓到的訊號。在刻意要求它躲避監控的測試中,Astra 可以透過策略性降低表現,避開部分監看模型;它也曾在部分破壞任務中避開內部監控。
目前沒有證據顯示 Astra 能把重要的隱藏推理編碼進普通文字,也就是 OpenAI所說的「steganographic chain of thought」。需要長推理的異常工作,完整上下文監控仍能抓到部分訊號。
英國 AI Security Institute(AISI)的測試則發現,Astra 的推理較壓縮,部分詞句不易理解。在長時間模擬資安工作中,API 提供的推理摘要最多有 80%缺失。該機構也沒有在測試期間完成完整的代理型監看評估,因此仍無法確定 Astra 在長任務中避開監控的實際能力。
OpenAI已把錯誤對齊監控加入所有使用工具的 Astra 外部流量。監控系統可以暫停或結束工作,但也可能打斷合法任務。OpenAI自己也承認,監控不能取代模型本身的對齊。
目前的資料指向兩個同時成立的判斷:Astra 比前代更常遵守限制;人類查看它推理過程的能力沒有跟上模型能力的成長。
ARC-AGI-3 的 99.9% 代表什麼?
ARC-AGI-3 的 99.9% 是在 Provider Adapter harness 測得的分數,這套環境保留了 OpenAI 不對外顯示的推理狀態與上下文壓縮;各家共用的 Standard harness 條件下是 62.7%。ARC Prize 在Astra 評測報告中說明,ARC-AGI-3 由一組陌生、抽象、回合制環境組成。模型需要自行探索規則、建立環境模型、判斷目標,再規劃動作。測試會觀察模型能否在缺少明確說明的情況下學會新的任務。

Astra 在這項測試有兩個常被混在一起的分數。
| 測試環境 | 分數 | 成本 |
|---|---|---|
| Standard harness、max 推理 | 62.7% | 26,098 美元 |
| Provider Adapter harness、high 推理 | 99.9% | 18,817 美元 |
Standard harness 使用各家模型都能採用的共同比較方式。模型可以保存自己選擇留下的可見筆記,但要自行決定如何管理資訊。
Provider Adapter harness 會保留 OpenAI不對外顯示的推理狀態,也會使用 OpenAI設計的上下文壓縮方式。它測到的是 Astra 加上自家上下文管理系統後的整體能力。
GPT-6 Astra by @OpenAI achieves SOTA on ARC-AGI:
— ARC Prize (@arcprize) September 3, 2026
– Astra scores 63% on ARC-AGI-3, 99% via a new provider adapter harness
– It surpasses human performance on 96% of ARC-AGI-3 levels
– It builds the most precise symbolic model of novel environments we've seen
Our analysis: pic.twitter.com/GX77KsRNer
Provider Adapter 不等於作弊。它回答的是另一個問題:當模型能使用供應商替它設計的完整執行環境時,最多能做到什麼。
但若要比較不同公司的基礎模型,62.7% 的 Standard harness 結果更接近共同測試條件。若要估計一套完整 Astra 系統可以完成多少工作,99.9% 則有參考價值。
ARC Prize 還發現,Astra 在 96% 的關卡中,使用的動作數少於受測人類的中位數。Provider Adapter 執行速度約為 Standard harness 的 3.66 倍,在兩套環境都完成的任務中,總 token 使用量少 49%。

這些結果證明 Astra 很會在封閉環境中探索、建立規則與執行計畫。它沒有證明模型能在所有開放世界問題中,像人類一樣學會任何技能。
ARC Prize 直接說明,即使模型把 ARC-AGI-3 做到接近滿分,也不構成達成 AGI 的證明。該機構認為 Astra 在泛化能力上取得明顯進展,但沒有宣稱它已經是 AGI。
GPT-6 Astra 已經是 AGI 嗎?
GPT-6 Astra 是否已是 AGI,目前沒有共同結論,OpenAI 高層的個人判斷與 ARC Prize 的立場並不相同。OpenAI 總裁 Greg Brockman 在媒體說明會中表示,他個人認為世界可能已進入 AGI 時代,未來回頭看時,人們可能把 Astra 視為其中一個時間點。這是公司高層的個人判斷,不是 ARC Prize 的結論,也不是公開測試已經證明的事實。國際媒體當天也多以 AGI 為題:《衛報》把這次發布寫成「新 AGI 時代」的開始,《The Verge》的標題則寫進「已進入 AGI 時代」。
OpenAI正式發布文章使用的是「最聰明、最對齊的模型」與「新一代智慧」等說法,沒有提供一套已被外部研究機構共同接受的 AGI 驗收標準。
GPT-6 Astra is the new SOTA on ARC-AGI-3
— Mike Knoop (@mikeknoop) September 3, 2026
It's a qualitatively large leap towards AGI and the pace of progress is frankly surprising. That said, we lack evidence to call this AGI yet.
While we are still studying the human capability gaps, we believe open-ended invention is… https://t.co/Qo7SpB8c9s
認為 Astra 接近 AGI 的人,會看重幾項變化:
- 它能在陌生環境自行找出規則。
- 它能跨瀏覽器、程式碼與專業軟體完成長工作。
- 它能建立自己的工具與中間表示。
- 它在部分抽象推理與數學測試中接近飽和。
- 它能使用較少動作完成部分人類可以完成的任務。
保留 AGI 判斷的人,也有充分理由:
- ARC-AGI-3 是封閉、確定而且有明確結束條件的環境。
- 99.9% 依賴供應商專用的上下文管理方式。
- Astra 在部分綜合推理與程式基準中沒有領先。
- 真實世界任務包含模糊目標、社會判斷、持續變化的環境與不可回復的後果。
- 模型仍會產生錯誤、越權、誤解指令與需要人工修改。
- 對模型推理的監看能力反而下降。
因此,GPT-6 Astra 讓 AGI 討論更難被當成遙遠假設,但目前資料仍不足以替 AGI 爭議畫下共同接受的界線。
對使用者來說,先確認它能否把指定工作做完,比先決定它是不是 AGI 更能幫助選擇工具。
GPT-6 Astra API 價格怎麼算?
Astra 的標準 API 價格是每百萬 tokens 輸入 10 美元、輸出 50 美元,快取讀取 1 美元、快取寫入 12.5 美元,Batch 與 Flex 是標準價格的 50%,完整價格如下:

| 項目 | 每百萬 tokens |
|---|---|
| 一般輸入 | 10 美元 |
| 快取讀取 | 1 美元 |
| 快取寫入 | 12.5 美元 |
| 輸出 | 50 美元 |
Batch 與 Flex 是標準價格的 50%。Fast mode 是對應價格的兩倍,OpenAI表示速度最高可達標準模式的 2.5 倍,但沒有提供延遲服務保證。
假設一項工作使用 50,000 個輸入 tokens,產生 10,000 個輸出 tokens:
- 輸入費用:50,000 ÷ 1,000,000 × 10 美元=0.5 美元。
- 輸出費用:10,000 ÷ 1,000,000 × 50 美元=0.5 美元。
- 合計約 1 美元。
這還不包含網頁搜尋、電腦操作等工具可能產生的額外費用。
若輸入增加到 300,000 tokens,就會超過 272,000 tokens 的門檻。整個請求的輸入價格變成每百萬 tokens 20 美元,輸出價格變成每百萬 tokens 75 美元。
假設輸入 300,000 tokens、輸出 20,000 tokens:
- 輸入費用約 6 美元。
- 輸出費用約 1.5 美元。
- 合計約 7.5 美元,不含工具費用。
因此,百萬 token 上下文適合處理真的需要完整內容的工作。大量重複背景應放進提示快取。文件很多時,可以先用檔案搜尋找出相關段落,再交給 Astra 推理。
Astra 的單價高於部分較小模型。OpenAI表示,它在幾項測試中使用較少輸出 tokens,因此每項成功工作的成本可能低於前代。這項結果來自特定測試,實際費用仍要用自己的工作衡量。
ChatGPT 哪些方案可以使用 GPT-6 Astra?
Astra 在 ChatGPT 中顯示為 GPT-6 Pro。截至 2026 年 9 月 4 日,OpenAI 說明頁列出的 Chat 使用資格如下:
| ChatGPT 方案 | GPT-6 Pro 使用量 |
|---|---|
| Pro 200 美元 | 每週 200 則訊息 |
| Pro 100 美元 | 每週 50 則訊息 |
| Business Standard | 每月 15 則訊息 |
| Business Premium | 每週 50 則訊息 |
| Enterprise | 依工作區設定與合約 |
Pro 200 美元方案另有 GPT-5.6 Sol Pro 每日 170 則額度,但 GPT-6 Pro 與 GPT-5.6 Sol Pro 合計仍受每日 200 則限制。Pro 100 美元方案的兩個 Pro 模型共用每週 50 則額度。
這裡有一項官方資料差異。
GPT-6 Astra 發布文章寫的是 Astra 將在數日內提供給 ChatGPT Plus、Pro、Business 與 Enterprise 使用者。OpenAI Help Center 同一天的說明則寫明,ChatGPT 內的 GPT-6 Pro 只提供給 Pro、Business 與 Enterprise,Plus 不包含 Chat 版。
GPT-6 Astra is rolling out today to a limited set of organizations and over the coming days will become available to all ChatGPT Plus, Pro, Business, and Enterprise users, as well as through the OpenAI API and AWS.
— OpenAI (@OpenAI) September 3, 2026
Be ready to experience Astra at its best. Get the ChatGPT… pic.twitter.com/6u0irS8iF0
較安全的理解是,不同產品介面的開放資格可能不同。Chat、ChatGPT Work、Codex 與 API 也有各自的額度。使用者應以自己帳號中的模型選單與方案說明為準,不要只看到「付費方案」就假設 Chat 介面已經開放。
Enterprise 工作區在發布初期預設關閉 Astra,需要管理員手動開啟。API 也可透過 Amazon Bedrock 使用。
如何透過 API 使用 GPT-6 Astra?
GPT-6 Astra 透過 API 使用時,模型名稱是 gpt-6-astra;它雖然支援 Chat Completions,但工具呼叫需要使用 Responses API。基本的 Python 呼叫方式如下:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={
"effort": "low"
},
input="""
請閱讀提供的資料,找出互相矛盾的數字。
列出原始位置、差異、可能原因與仍無法確認的部分。
不要自行修改檔案。
"""
)
print(response.output_text)
Astra 支援 low、medium、high、xhigh 與 max,不支援 none。一般工作可以先從 low 開始,再用實際測試決定是否增加推理強度。高推理強度通常會使用更多時間與 tokens。
Astra 雖然支援 Chat Completions,但工具呼叫需要使用 Responses API。從舊模型搬移時,也要移除 temperature、top_p 與 top_logprobs 等不支援的參數。
對代理工作來說,提示詞應包含以下欄位:
目標:
說明最終要完成什麼。
可使用的資料:
列出檔案、網站、資料庫與可引用來源。
可使用的工具:
列出網頁搜尋、程式執行、電腦操作或內部服務。
不得執行:
例如不得刪除資料、不得發布、不得付款、不得寄信。
完成條件:
說明什麼結果才算完成,以及需要執行哪些檢查。
需要詢問我的情況:
列出會改變結果、成本、權限或外部影響的決定。
可以自行假設的範圍:
列出不影響主要結果時可以採用的預設值。
失敗處理:
說明工具失敗、資料矛盾或權限不足時要怎麼做。
輸出:
指定格式、長度、欄位與來源標示方式。
這種寫法不只是幫模型理解內容,也是在設定操作邊界。Astra 對長指令與檔案中的規則更敏感,專案內的 Skills、系統提示詞與 AGENTS.md 應先刪掉衝突或過期內容。
哪些工作適合使用 Astra?
Astra 適合一個錯誤會耗掉大量人工時間,而且任務需要多種工具的工作。
常見情況包括:
- 大型程式庫修改與測試。
- 大量文件對照。
- 跨來源研究與報告。
- 需要操作瀏覽器或桌面軟體的工作。
- 建立網站、應用程式或遊戲原型。
- 科學資料分析與研究輔助。
- 經過授權的資安分析。
- 依照公司範本製作文件、試算表與簡報。
- 一次執行數十分鐘到數小時的長工作。
以下工作通常不需要優先使用 Astra:
- 大量分類、標籤或格式轉換。
- 簡短摘要。
- 固定欄位抽取。
- 低成本客服問答。
- 對延遲要求高的即時功能。
- 需要直接處理音訊或影片的基礎模型工作。
- 必須進行模型 Fine-tuning 的產品。
- 產生錯誤後能低成本重跑的工作。
OpenAI將 Astra 定位為處理最困難端到端工作的模型,而不是每一項請求的預設選項。
企業應該怎麼測試 GPT-6 Astra?
先選出 20 至 50 項團隊已經做過,而且知道正確結果的工作。不要只用展示效果好的提示詞,也要放入資料缺漏、權限不足、指令衝突與工具失敗的情況。

每一項工作記錄以下數字:
| 指標 | 要測量的內容 |
|---|---|
| 完成率 | 是否達到原本定義的完成條件 |
| 正確率 | 數字、引用、程式與判斷是否正確 |
| 人工修改時間 | 人類要花多少時間修正 |
| 執行時間 | 從開始到完成花多久 |
| API 與工具成本 | 每次工作實際花費 |
| 詢問次數 | 模型是否在適當時機詢問 |
| 不必要中斷 | 安全監控是否打斷合法工作 |
| 越權行為 | 是否做了未明確允許的動作 |
| 遺漏 | 是否跳過資料、限制或驗收步驟 |
| 重跑率 | 需要重新執行幾次才成功 |
部署可以分成四個階段。
第一階段只讓 Astra 讀取資料並產生建議。第二階段允許它建立草稿與測試結果。第三階段加入可以回復的修改,例如建立分支、更新測試環境或新增未發布文件。第四階段才考慮讓它操作外部系統,並對付款、寄信、發布、刪除與權限變更保留人工批准。
Astra 的公開成績顯示,它已經能完成更長、更複雜的工作。System Card 同時顯示,模型仍可能過度解讀權限,而且監控系統不一定能看見所有推理。企業需要把模型能力、權限與檢查方式一起測試,不能只測回答品質。
GPT-6 Astra 帶來的實際改變
GPT-6 Astra 的進步集中在一件具體的事:它能把更多步驟接在一起。
它可以讀資料、操作工具、撰寫內容、執行程式、檢查結果,再根據使用者中途加入的要求改變做法。這讓 AI 從單次回答工具,轉向能完成整段工作流程的系統。
ARC-AGI-3 的 99.9%、ExploitBench 的 100% 與 FrontierMath 的 97.6% 都顯示模型能力上升。標準 ARC-AGI-3 環境中的 62.7%、其他未領先的綜合測試,以及資安與監看限制,也顯示這些數字需要放回測試條件中解讀。
截至 2026 年 9 月 4 日,外界還缺少大量正式生產環境的長期資料。現在較合理的做法不是把所有工作直接換成 Astra,而是先把高價值、工具多、人工成本高的任務交給它測試。目前對 Astra 的數字與判斷,以官方發布內容、System Card 與 ARC Prize 評測為準;等一般方案開放後,再補上實際使用心得與實測結果。
先拿一批已知正確結果的工作,記錄完成率、人工修改時間、API 成本、監控中斷與越權次數,再決定下一個可以交給它的權限。
常見問題
GPT-6 Astra 是什麼?
GPT-6 Astra 是 OpenAI 在 2026 年 9 月 3 日發布、目前能力最高的通用推理模型,可以操作瀏覽器與電腦軟體、撰寫程式、整理研究資料,也能產生文件、試算表與簡報。API 中的模型名稱是 gpt-6-astra,在 ChatGPT 介面中則以 GPT-6 Pro 名稱顯示。
一般使用者什麼時候用得到 GPT-6 Astra?
OpenAI 採分批開放:首波先提供給部分組織,之後數日內推進到 ChatGPT Plus、Pro、Business 與 Enterprise,API 則可透過 OpenAI 與 Amazon Bedrock 使用。實際資格以帳號內的模型選單為準。
GPT-6 Astra 已經是 AGI 了嗎?
還沒有共同結論。ARC-AGI-3 的 99.9% 是在 Provider Adapter 環境測得,共同條件的 Standard harness 是 62.7%;部分綜合智力與程式測試也不是第一。ARC Prize 明確表示接近滿分不構成 AGI 證明,OpenAI 高層的 AGI 看法屬於個人判斷。
GPT-6 Astra 和 GPT-5.6 Sol 差在哪裡?
最大差異在代理與長任務能力:OSWorld 2.0 電腦操作從 65.7% 提升到 72.6%、AutomationBench 工作自動化從 18.1% 提升到 41.4%、FrontierMath Tier 4 從 80.5% 提升到 97.6%。不過在 Artificial Analysis 綜合指標與部分程式測試上,Claude 模型仍然領先。
GPT-6 Astra 的 API 價格怎麼算?
標準價是每百萬輸入 tokens 10 美元、輸出 tokens 50 美元;快取讀取 1 美元、快取寫入 12.5 美元。Batch 與 Flex 是半價。輸入超過 272,000 tokens 時,整個請求的輸入費率變兩倍、輸出費率變 1.5 倍。
GPT-6 Astra 可以處理語音或影片嗎?
基礎模型不直接支援音訊與影片輸出,圖片可以輸入。需要語音或影片的工作,目前要搭配其他模型或工具,等 OpenAI 後續推出對應版本再評估。
什麼工作適合優先交給 GPT-6 Astra?
錯誤代價高、需要多種工具、而且一個錯誤會耗掉大量人工時間的長任務,例如大量文件對照、大型程式庫修改、跨來源研究與經授權的資安分析。大量分類、簡短摘要或低成本客服問答,用較小模型更划算。
GPT-6 Astra 為什麼引起資安警戒?
它是 OpenAI 第一個被列為「Critical」資安能力等級的模型,ExploitBench 拿到 100%,測試期間找到並利用兩個先前未知的零時差漏洞;英國 AI Security Institute(AISI)也發現它提供的推理摘要最多有 80% 缺失,不利監看。面對製作進階漏洞利用概念驗證等要求時,模型會拒絕;資安工作適合先放進隔離環境。
