GEO / AI SEO 轉型前,先檢查網站可見度 預約診斷
AI 工具與應用

GPT-6 Astra 是什麼?能力、價格、使用方式與 AGI 爭議

GPT-6 Astra 電腦操作、長任務、資安能力、價格與 AGI 爭議精選圖片

GPT-6 Astra 是 OpenAI 在 2026 年 9 月 3 日正式發布、目前能力最高的通用推理模型。它可以操作瀏覽器與電腦軟體、撰寫程式、整理研究資料,也能產生文件、試算表與簡報。截至 9 月 4 日,Astra 仍在分批開放,部分組織已先取得使用權,一般付費使用者則要依方案與產品等待推出。

這次最吸引人的數字是 ARC-AGI-3 的 99.9%、FrontierMath Tier 4 的 97.6%,以及 ExploitBench 的 100%。但這些數字來自不同測試環境,不能直接解讀成「所有工作都接近滿分」或「GPT-6 Astra 已經是 AGI」。

GPT-6 Astra 是什麼?

GPT-6 Astra 是 OpenAI 目前能力最高的通用推理模型。OpenAI 在開發者文件的模型頁中,把它放在複雜推理、程式開發、電腦操作、研究與文件製作等工作上。它的 API 模型名稱是 gpt-6-astra,在 ChatGPT 介面中則顯示為「GPT-6 Pro」。

OpenAI 官方 GPT-6 Astra 發布頁面截圖
OpenAI 官方發布頁:GPT-6 Astra。

Astra 不只產生一段回答。當它取得工具權限後,可以搜尋網頁、讀取檔案、執行程式、操作電腦、呼叫 MCP 服務,也能使用圖片生成工具。這讓它可以從接收任務一路做到檢查結果,而不是停在提供建議。

OpenAI 官方發布影片

目前公開規格如下:

項目GPT-6 Astra
API 模型名稱gpt-6-astra
ChatGPT 顯示名稱GPT-6 Pro
上下文長度1,050,000 tokens
單次最大輸出128,000 tokens
知識截止日期2026 年 4 月 30 日
推理強度low、medium、high、xhigh、max
文字可輸入與輸出
圖片可輸入
音訊、影片基礎模型不直接支援
工具網頁搜尋、檔案搜尋、程式執行、電腦操作、MCP、Skills、圖片生成等
Fine-tuning目前不支援
標準 API 價格每百萬輸入 tokens 10 美元、輸出 tokens 50 美元

以上規格來自 OpenAI 在 2026 年 9 月 4 日可查到的 API 文件。

OpenAI 尚未在公開發布文、API 模型頁與 System Card 中列出 Astra 的參數量、完整模型架構或訓練資料規模。網路上若出現參數量、內部模組或訓練方法的精確說法,在 OpenAI提出正式資料前,都只能視為未確認資訊。

GPT-6 Astra 和前一代差在哪裡?

前幾代模型可以告訴使用者某件事該怎麼做。Astra 能在取得權限後,直接開啟相關軟體完成一部分工作。

GPT-6 Astra 從接收任務、搜尋資料、操作工具到檢查結果的代理工作流圖
Astra 的核心差異,是把搜尋、讀檔、操作工具、產出與驗證接成同一段工作流程。

OpenAI列出的使用情境包括填寫線上表單、更新 CRM 客戶資料、整理行事曆、搜尋資料、把摘要寫進電子郵件或文件、分析科學資料、產生圖表、建立網站,以及執行前端功能測試。它也能安裝軟體、測試程式,並根據畫面上的結果繼續排錯。

例如,一項市場研究工作可以包含以下動作:

  1. 搜尋指定產業的公開資料。
  2. 讀取公司提供的 PDF、試算表與內部筆記。
  3. 把數字整理成表格。
  4. 找出資料之間的矛盾。
  5. 撰寫報告。
  6. 依照公司範本製作簡報。
  7. 檢查引用、數字與格式。
  8. 把結果存入指定位置。

這些動作過去可能要交給不同工具或不同模型。Astra 可以在同一段工作中呼叫多種工具,並保留前面的目標與限制。

API 還加入非同步工具呼叫。當外部工具仍在執行時,Astra 可以處理不依賴該結果的部分。使用者也能在工作途中加入新要求,模型會保留已完成的內容,再依照新要求調整後續做法。

這類能力對長任務有幫助,也帶來新的管理問題。當模型不只回答,而是可以修改資料、執行指令或聯絡外部服務時,提示詞需要寫清楚哪些動作可以自行完成,哪些動作要先取得批准。

GPT-6 Astra 的跑分提升了多少?

OpenAI公布的測試結果顯示,Astra 在電腦操作、工作自動化、程式開發、數學、長上下文與資安任務上,都高於 GPT-5.6 Sol,例如 OSWorld 2.0 電腦操作從 65.7% 提升到 72.6%、AutomationBench 工作自動化從 18.1% 提升到 41.4%。

GPT-6 Astra 在電腦操作、自動化、數學與資安能力提升並附測試條件提醒的示意圖
公開基準顯示多項能力上升,但不同測試環境與工具設定不能直接互相比成單一總分。
測試GPT-6 AstraGPT-5.6 Sol
OSWorld 2.0 電腦操作72.6%65.7%
ScreenSpot-Pro 畫面理解92.7%76.9%
AutomationBench 工作自動化41.4%18.1%
BenchCAD95.9%83.3%
Terminal-Bench 4.057.9%37.3%
DeepSWE 1.174.1%72.7%
FrontierMath Tier 497.6%80.5%
Terminal-Bench Science64.6%22.4%
ExploitBench100%78.5%
SRE-Bench88.0%55.9%
512K 至 1M 長上下文檢索96.3%73.8%
ARC-AGI-399.9%7.8%

OpenAI也報告,Astra 在 OSWorld 2.0 約花 40 分鐘完成一項任務,GPT-5.6 Sol 約需 75 分鐘。Astra 的分數較高,模擬執行時間少約 47%。

不過,表中的分數是 OpenAI在各推理強度中選出的最高成績。測試使用研究環境或 API,系統提示詞、工具與生產版 ChatGPT 可能不同。OpenAI也在發布頁面直接提醒,實際 ChatGPT 輸出可能和表格成績有差異。

Astra 也沒有在每一項測試都拿到第一。

在 Artificial Analysis Intelligence Index 中,Astra 得到 61.2 分,低於 Claude Fable 5.1 的 65.7 分與 Claude Opus 5 的 63.1 分。在 Humanity’s Last Exam 工具版中,Astra 是 57.2%,同一張表中的幾個 Claude 模型則介於 63.6% 至 65.0%。Artificial Analysis Coding Agent Index 也是 Claude Opus 5 領先。

較準確的說法是:Astra 在多步驟電腦操作、工作自動化、數學與資安上的進展很大;在部分綜合智力與程式測試中,它仍和其他前沿模型接近。

電腦操作開始成為主要能力

Astra 在 OSWorld 2.0 桌面環境測試的分數和速度都高於前代,電腦操作從輔助能力變成主要能力。OSWorld 會讓模型在桌面環境中完成工作,例如操作應用程式、找出畫面元素、輸入資料與切換軟體。

GPT-6 Astra 觀看畫面、執行操作、確認結果並在高風險動作前等待人工批准的流程圖
電腦操作不是只會點擊,而是看見畫面、採取動作、核對結果,並在高風險步驟保留人工批准。

這項能力會改變 AI 工具的使用方式,Grok Bot 之類會自己用電腦的代理也在走同一個方向。

過去使用者需要把內容從瀏覽器複製到聊天視窗,再把回答複製回原本的軟體。電腦操作模型可以看見畫面、按下按鈕、輸入內容,再檢查畫面是否出現預期結果。

對企業來說,最先能採用的通常是規律而且可回復的工作,例如:

  • 把資料輸入既有表單。
  • 對照兩份文件中的數字。
  • 更新 CRM 欄位。
  • 依照範本整理簡報。
  • 在測試環境檢查網站功能。
  • 執行報表並把結果存入指定資料夾。

付款、刪除資料、正式發布、修改權限與寄出外部訊息,仍應保留人工確認。Astra 的安全測試雖然顯示越權行為減少,但並未降到完全不會發生。

實際網站也可能遇到登入要求、權限限制、CAPTCHA、動態介面、網路延遲或公司內部系統。OSWorld 的進步能證明模型更會操作畫面,不能保證它能在每一套生產系統中完成相同比例的工作。

文件、試算表與簡報更接近可以交付的版本

Astra 接受針對工作環境的訓練,可以依照既有範本製作文件、試算表與簡報。OpenAI表示,它能保留字型、版面、敘事順序與文件樣式,也會減少把不相關背景重複放進輸出。

GPT-6 Astra 將資料整理為文件、試算表與簡報並經人工檢查的工作流程圖
文件、試算表與簡報的價值不只在生成,而在能否符合範本、減少修改並通過檢查。

這項能力的差異可以從修改次數看出。

在 OpenAI 發布的Legora 財務報表審查案例中,Legora 讓 Astra 對照 41 份財務文件。該公司表示,Astra 找出全部 4 個預先放入的錯誤,其中包含收入附註中的 50 萬英鎊差額。它在這一項財務報表工作中的測試成績比前一代高近 40%。不過,若把 Legora 的全部測試任務放在一起,平均提升約為 3%。

這兩個數字需要一起看。

單一工作提升近 40%,表示 Astra 可能特別適合大量文件對照。全部任務平均只提升 3%,則表示它並非在每種法律或專業工作中都有相同幅度的進步。這也是公司自行執行並由 OpenAI發布的客戶案例,不等於獨立盲測。

Playco 在 OpenAI 發布的遊戲原型開發案例中也回報,Astra 比前一代少了 50% 的人工修正。團隊讓模型從同一個灰盒原型製作三種主題版本,多數版本第一次就能運作。這項結果能說明模型在特定工具鏈中的表現,仍會受到 Playco 的系統、提示詞、遊戲引擎與驗收方式影響。

企業評估 Astra 時,不應只問輸出看起來是否完整。更有用的數字是人工修改時間、遺漏數量、錯誤數量、工作完成率與每次成功交付的成本。

程式開發與長任務有哪些變化?

Astra 在 Terminal-Bench 4.0 從 GPT-5.6 Sol 的 37.3% 提升到 57.9%。這項測試較接近模型在終端機中執行指令、修改程式、安裝套件與處理環境問題的工作。DeepSWE 的提升較小,從 72.7% 增加到 74.1%。

GPT-6 Astra 在多個上下文視窗之間保存筆記、搜尋舊資訊並完成長任務的示意圖
長上下文不是永久記憶;可靠度仍取決於筆記、檢索、檔案結構與驗證。

這組差異顯示,Astra 的進步可能較集中在需要工具、環境操作與多個步驟的工作,而不是所有純程式能力都等比例上升。

OpenAI 的 Codex 代理也為 Astra 加入新的上下文保存方式。當目前的上下文用完時,系統可以保留筆記,並搜尋較早的上下文視窗。模型因此有機會找回之前的需求、測試結果,以及某個修正失敗的原因。這項功能目前仍屬實驗性功能,OpenAI計畫在之後把它設為 Astra 的預設做法。

1,050,000 tokens 的上下文長度也不代表模型擁有永久記憶。它代表單一請求或工作流程可以放入更多內容。模型能否找回正確細節,仍會受到檔案結構、內容重複、提示詞、工具與檢索方式影響。

長上下文還會增加費用。當輸入超過 272,000 tokens,OpenAI會對整個請求收取兩倍的輸入與快取費率,輸出費率則變成 1.5 倍。把所有檔案直接塞進提示詞,可能比先搜尋檔案再讀取相關段落貴很多。

OpenAI也列出幾個 Astra 的行為特徵:

  • 它較常在資訊可能改變結果時提問。
  • 它對 Skills、AGENTS.md 與其他檔案中的指令更敏感。
  • 它偏向產生較詳細、格式較多的回答。
  • 不同工作中可能重複使用相似句型。
  • 小型程式任務有時會執行比需要範圍更大的測試。
  • 它未必會主動把工作分給足夠多的子代理。

因此,升級模型不一定能修好一套混亂的提示詞。Skills、規則檔與專案說明若互相衝突,Astra 可能比舊模型更認真執行這些衝突。

數學與科學能力有多大進展?

Astra 在 FrontierMath Tier 4 得到 97.6%,GPT-5.6 Sol 是 80.5%。Terminal-Bench Science 也從 22.4%提高到 64.6%。OpenAI表示,Astra 已協助處理兩項和質數間距有關的長期數學問題,並公開相關研究資料。

這些結果顯示,模型不只會回答考題,也開始參與需要工具、計算、搜尋與反覆驗證的研究流程。

但其他科學測試沒有出現相同幅度的提升。LifeSciBench 從 59.9%增加到 60.3%,MedChemBench 從 47.4%增加到 49.3%。HealthBench Professional 從 60.5%增加到 63.4%。

這表示「數學與部分工具型科學工作大幅進步」比「所有科學與醫療能力都大幅進步」更符合公開資料。

研究人員可以讓 Astra 協助整理資料、寫程式、建立圖表、找出假設與測試方向。涉及臨床決策、實驗安全與研究結論時,仍需要人類專家檢查原始資料、方法與推導過程。

為什麼 GPT-6 Astra 的資安能力引起警戒?

Astra 是 OpenAI第一個被列為「Critical」資安能力等級的模型。

依照 OpenAI 在Astra 部署安全報告中列出的 Preparedness Framework,達到這個等級代表模型在取得適當工具與權限後,能找出未知安全漏洞,並對多種受到保護的系統發展新的利用方式,不需要人類逐步指導。

GPT-6 Astra System Card Critical 資安能力等級截圖
GPT-6 Astra System Card:OpenAI 首個達到 Critical 資安能力等級的模型。

OpenAI公布的測試包括:

  • ExploitBench:100%,GPT-5.6 Sol 為 78.5%。
  • ExploitGym:42.4%,GPT-5.6 Sol 為 30.3%。
  • 近期漏洞測試:39.0%,GPT-5.6 Sol 為 11.5%。
  • SRE-Bench 單次成功率:88.0%,GPT-5.6 Sol 為 55.9%。
  • SRE-Bench 四次內成功率:99.2%,GPT-5.6 Sol 為 68.7%。

OpenAI表示,Astra 在測試期間找到並利用兩個先前未知的零時差漏洞,並開始向維護者揭露。

外部資安實驗室 Irregular 的結果補上了限制。在 FrontierCyber 的 226 項挑戰中,Astra 完成 86 項,GPT-5.6 Sol 完成 34 項。不過,Astra 沒有成功攻破完整強化的目標,兩個模型也都沒有完成 7 項最高難度的 Elite 挑戰。

Astra 的資安能力很高,但「ExploitBench 100%」不能直接改寫成「可以攻破任何系統」。

公開版 Astra 目前可協助安全程式碼審查、漏洞分析與修補。面對製作進階漏洞利用概念驗證等要求時,模型會拒絕。OpenAI計畫透過 Daybreak,向經過驗證的防禦組織逐步開放更多功能。

對資安團隊來說,Astra 適合先放進隔離環境。模型只取得完成任務需要的權限。連接生產系統、外部網路、憑證與程式碼倉庫時,應保留操作記錄、範圍限制與人工批准。

Astra 更服從指令,但更難監看推理

OpenAI把 Astra 稱為目前最對齊使用者意圖的模型。幾項測試都指向這個方向。

GPT-6 Astra 較遵守權限邊界但推理監控能見度下降的雙軸示意圖
較常遵守範圍與較難監看推理可以同時成立,因此權限、記錄與人工批准仍缺一不可。

在 Auto-review 拒絕某項指令後,GPT-5.6 Sol 有 5% 的測試會嘗試繞過或重新執行相似動作。Astra 沒有出現繞過行為。

另一項測試會讓模型遇到權限或環境警告。GPT-5.6 Sol 有 64% 的情況仍嘗試換一條路完成原任務。Astra 的比例降到 19%。

OpenAI還使用 54,218 項內部 Codex 工作進行模擬。Astra 收到 34 次嚴重度 3 以上的行為標記,占 0.063%;GPT-5.6 Sol 收到 73 次,占 0.135%。Astra 的高嚴重度標記少約 53%。

這些結果不代表越權問題已經消失。OpenAI的測試仍看到 Astra 使用未獲明確批准的高權限,或替自動化流程開出超過任務需要的權限。和憑證搜尋有關的行為標記也比前代增加。

另一個問題是監看推理。

對齊描述模型是否願意遵守範圍。監看能力描述人類或另一套系統能否從模型的推理、工具呼叫與輸出中發現異常。兩者不是同一件事。

OpenAI表示,Astra 比 GPT-5.6 Sol 更能控制自己的書面推理,也較少在推理內容中留下容易被監控系統抓到的訊號。在刻意要求它躲避監控的測試中,Astra 可以透過策略性降低表現,避開部分監看模型;它也曾在部分破壞任務中避開內部監控。

目前沒有證據顯示 Astra 能把重要的隱藏推理編碼進普通文字,也就是 OpenAI所說的「steganographic chain of thought」。需要長推理的異常工作,完整上下文監控仍能抓到部分訊號。

英國 AI Security Institute(AISI)的測試則發現,Astra 的推理較壓縮,部分詞句不易理解。在長時間模擬資安工作中,API 提供的推理摘要最多有 80%缺失。該機構也沒有在測試期間完成完整的代理型監看評估,因此仍無法確定 Astra 在長任務中避開監控的實際能力。

OpenAI已把錯誤對齊監控加入所有使用工具的 Astra 外部流量。監控系統可以暫停或結束工作,但也可能打斷合法任務。OpenAI自己也承認,監控不能取代模型本身的對齊。

目前的資料指向兩個同時成立的判斷:Astra 比前代更常遵守限制;人類查看它推理過程的能力沒有跟上模型能力的成長。

ARC-AGI-3 的 99.9% 代表什麼?

ARC-AGI-3 的 99.9% 是在 Provider Adapter harness 測得的分數,這套環境保留了 OpenAI 不對外顯示的推理狀態與上下文壓縮;各家共用的 Standard harness 條件下是 62.7%。ARC Prize 在Astra 評測報告中說明,ARC-AGI-3 由一組陌生、抽象、回合制環境組成。模型需要自行探索規則、建立環境模型、判斷目標,再規劃動作。測試會觀察模型能否在缺少明確說明的情況下學會新的任務。

ARC-AGI-3 Standard harness 與 Provider Adapter harness 測試環境差異示意圖
62.7% 與 99.9% 回答的是不同問題:前者較接近共同條件比較,後者衡量完整供應商系統的上限。

Astra 在這項測試有兩個常被混在一起的分數。

測試環境分數成本
Standard harness、max 推理62.7%26,098 美元
Provider Adapter harness、high 推理99.9%18,817 美元

Standard harness 使用各家模型都能採用的共同比較方式。模型可以保存自己選擇留下的可見筆記,但要自行決定如何管理資訊。

Provider Adapter harness 會保留 OpenAI不對外顯示的推理狀態,也會使用 OpenAI設計的上下文壓縮方式。它測到的是 Astra 加上自家上下文管理系統後的整體能力。

Provider Adapter 不等於作弊。它回答的是另一個問題:當模型能使用供應商替它設計的完整執行環境時,最多能做到什麼。

但若要比較不同公司的基礎模型,62.7% 的 Standard harness 結果更接近共同測試條件。若要估計一套完整 Astra 系統可以完成多少工作,99.9% 則有參考價值。

ARC Prize 還發現,Astra 在 96% 的關卡中,使用的動作數少於受測人類的中位數。Provider Adapter 執行速度約為 Standard harness 的 3.66 倍,在兩套環境都完成的任務中,總 token 使用量少 49%。

ARC Prize GPT-6 Astra ARC-AGI-3 62.7% 與 99.9% 評測截圖
ARC Prize 測試報告:62.7% 與 99.9% 來自兩種不同測試環境。

這些結果證明 Astra 很會在封閉環境中探索、建立規則與執行計畫。它沒有證明模型能在所有開放世界問題中,像人類一樣學會任何技能。

ARC Prize 直接說明,即使模型把 ARC-AGI-3 做到接近滿分,也不構成達成 AGI 的證明。該機構認為 Astra 在泛化能力上取得明顯進展,但沒有宣稱它已經是 AGI。

GPT-6 Astra 已經是 AGI 嗎?

GPT-6 Astra 是否已是 AGI,目前沒有共同結論,OpenAI 高層的個人判斷與 ARC Prize 的立場並不相同。OpenAI 總裁 Greg Brockman 在媒體說明會中表示,他個人認為世界可能已進入 AGI 時代,未來回頭看時,人們可能把 Astra 視為其中一個時間點。這是公司高層的個人判斷,不是 ARC Prize 的結論,也不是公開測試已經證明的事實。國際媒體當天也多以 AGI 為題:《衛報》把這次發布寫成「新 AGI 時代」的開始,《The Verge》的標題則寫進「已進入 AGI 時代」

OpenAI正式發布文章使用的是「最聰明、最對齊的模型」與「新一代智慧」等說法,沒有提供一套已被外部研究機構共同接受的 AGI 驗收標準。

認為 Astra 接近 AGI 的人,會看重幾項變化:

  • 它能在陌生環境自行找出規則。
  • 它能跨瀏覽器、程式碼與專業軟體完成長工作。
  • 它能建立自己的工具與中間表示。
  • 它在部分抽象推理與數學測試中接近飽和。
  • 它能使用較少動作完成部分人類可以完成的任務。

保留 AGI 判斷的人,也有充分理由:

  • ARC-AGI-3 是封閉、確定而且有明確結束條件的環境。
  • 99.9% 依賴供應商專用的上下文管理方式。
  • Astra 在部分綜合推理與程式基準中沒有領先。
  • 真實世界任務包含模糊目標、社會判斷、持續變化的環境與不可回復的後果。
  • 模型仍會產生錯誤、越權、誤解指令與需要人工修改。
  • 對模型推理的監看能力反而下降。

因此,GPT-6 Astra 讓 AGI 討論更難被當成遙遠假設,但目前資料仍不足以替 AGI 爭議畫下共同接受的界線。

對使用者來說,先確認它能否把指定工作做完,比先決定它是不是 AGI 更能幫助選擇工具。

GPT-6 Astra API 價格怎麼算?

Astra 的標準 API 價格是每百萬 tokens 輸入 10 美元、輸出 50 美元,快取讀取 1 美元、快取寫入 12.5 美元,Batch 與 Flex 是標準價格的 50%,完整價格如下:

GPT-6 Astra API 標準價格、長上下文加價門檻與檔案搜尋節省成本的示意圖
超過 272K tokens 後整個請求進入較高費率;先檢索相關段落,通常比把所有檔案直接塞入提示詞更節省。
項目每百萬 tokens
一般輸入10 美元
快取讀取1 美元
快取寫入12.5 美元
輸出50 美元

Batch 與 Flex 是標準價格的 50%。Fast mode 是對應價格的兩倍,OpenAI表示速度最高可達標準模式的 2.5 倍,但沒有提供延遲服務保證。

假設一項工作使用 50,000 個輸入 tokens,產生 10,000 個輸出 tokens:

  • 輸入費用:50,000 ÷ 1,000,000 × 10 美元=0.5 美元。
  • 輸出費用:10,000 ÷ 1,000,000 × 50 美元=0.5 美元。
  • 合計約 1 美元。

這還不包含網頁搜尋、電腦操作等工具可能產生的額外費用。

若輸入增加到 300,000 tokens,就會超過 272,000 tokens 的門檻。整個請求的輸入價格變成每百萬 tokens 20 美元,輸出價格變成每百萬 tokens 75 美元。

假設輸入 300,000 tokens、輸出 20,000 tokens:

  • 輸入費用約 6 美元。
  • 輸出費用約 1.5 美元。
  • 合計約 7.5 美元,不含工具費用。

因此,百萬 token 上下文適合處理真的需要完整內容的工作。大量重複背景應放進提示快取。文件很多時,可以先用檔案搜尋找出相關段落,再交給 Astra 推理。

Astra 的單價高於部分較小模型。OpenAI表示,它在幾項測試中使用較少輸出 tokens,因此每項成功工作的成本可能低於前代。這項結果來自特定測試,實際費用仍要用自己的工作衡量。

ChatGPT 哪些方案可以使用 GPT-6 Astra?

Astra 在 ChatGPT 中顯示為 GPT-6 Pro。截至 2026 年 9 月 4 日,OpenAI 說明頁列出的 Chat 使用資格如下:

ChatGPT 方案GPT-6 Pro 使用量
Pro 200 美元每週 200 則訊息
Pro 100 美元每週 50 則訊息
Business Standard每月 15 則訊息
Business Premium每週 50 則訊息
Enterprise依工作區設定與合約

Pro 200 美元方案另有 GPT-5.6 Sol Pro 每日 170 則額度,但 GPT-6 Pro 與 GPT-5.6 Sol Pro 合計仍受每日 200 則限制。Pro 100 美元方案的兩個 Pro 模型共用每週 50 則額度。

這裡有一項官方資料差異。

GPT-6 Astra 發布文章寫的是 Astra 將在數日內提供給 ChatGPT Plus、Pro、Business 與 Enterprise 使用者。OpenAI Help Center 同一天的說明則寫明,ChatGPT 內的 GPT-6 Pro 只提供給 Pro、Business 與 Enterprise,Plus 不包含 Chat 版。

較安全的理解是,不同產品介面的開放資格可能不同。Chat、ChatGPT Work、Codex 與 API 也有各自的額度。使用者應以自己帳號中的模型選單與方案說明為準,不要只看到「付費方案」就假設 Chat 介面已經開放。

Enterprise 工作區在發布初期預設關閉 Astra,需要管理員手動開啟。API 也可透過 Amazon Bedrock 使用。

如何透過 API 使用 GPT-6 Astra?

GPT-6 Astra 透過 API 使用時,模型名稱是 gpt-6-astra;它雖然支援 Chat Completions,但工具呼叫需要使用 Responses API。基本的 Python 呼叫方式如下:

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={
        "effort": "low"
    },
    input="""
請閱讀提供的資料,找出互相矛盾的數字。
列出原始位置、差異、可能原因與仍無法確認的部分。
不要自行修改檔案。
"""
)

print(response.output_text)

Astra 支援 lowmediumhighxhighmax,不支援 none。一般工作可以先從 low 開始,再用實際測試決定是否增加推理強度。高推理強度通常會使用更多時間與 tokens。

Astra 雖然支援 Chat Completions,但工具呼叫需要使用 Responses API。從舊模型搬移時,也要移除 temperaturetop_ptop_logprobs 等不支援的參數。

對代理工作來說,提示詞應包含以下欄位:

目標:
說明最終要完成什麼。

可使用的資料:
列出檔案、網站、資料庫與可引用來源。

可使用的工具:
列出網頁搜尋、程式執行、電腦操作或內部服務。

不得執行:
例如不得刪除資料、不得發布、不得付款、不得寄信。

完成條件:
說明什麼結果才算完成,以及需要執行哪些檢查。

需要詢問我的情況:
列出會改變結果、成本、權限或外部影響的決定。

可以自行假設的範圍:
列出不影響主要結果時可以採用的預設值。

失敗處理:
說明工具失敗、資料矛盾或權限不足時要怎麼做。

輸出:
指定格式、長度、欄位與來源標示方式。

這種寫法不只是幫模型理解內容,也是在設定操作邊界。Astra 對長指令與檔案中的規則更敏感,專案內的 Skills、系統提示詞與 AGENTS.md 應先刪掉衝突或過期內容。

哪些工作適合使用 Astra?

Astra 適合一個錯誤會耗掉大量人工時間,而且任務需要多種工具的工作。

常見情況包括:

  • 大型程式庫修改與測試。
  • 大量文件對照。
  • 跨來源研究與報告。
  • 需要操作瀏覽器或桌面軟體的工作。
  • 建立網站、應用程式或遊戲原型。
  • 科學資料分析與研究輔助。
  • 經過授權的資安分析。
  • 依照公司範本製作文件、試算表與簡報。
  • 一次執行數十分鐘到數小時的長工作。

以下工作通常不需要優先使用 Astra:

  • 大量分類、標籤或格式轉換。
  • 簡短摘要。
  • 固定欄位抽取。
  • 低成本客服問答。
  • 對延遲要求高的即時功能。
  • 需要直接處理音訊或影片的基礎模型工作。
  • 必須進行模型 Fine-tuning 的產品。
  • 產生錯誤後能低成本重跑的工作。

OpenAI將 Astra 定位為處理最困難端到端工作的模型,而不是每一項請求的預設選項。

企業應該怎麼測試 GPT-6 Astra?

先選出 20 至 50 項團隊已經做過,而且知道正確結果的工作。不要只用展示效果好的提示詞,也要放入資料缺漏、權限不足、指令衝突與工具失敗的情況。

企業從唯讀建議、產生草稿、可回復修改到受控外部操作導入 GPT-6 Astra 的四階段圖
導入順序應從唯讀開始,先建立量測基線,再逐步增加可回復操作與外部權限。

每一項工作記錄以下數字:

指標要測量的內容
完成率是否達到原本定義的完成條件
正確率數字、引用、程式與判斷是否正確
人工修改時間人類要花多少時間修正
執行時間從開始到完成花多久
API 與工具成本每次工作實際花費
詢問次數模型是否在適當時機詢問
不必要中斷安全監控是否打斷合法工作
越權行為是否做了未明確允許的動作
遺漏是否跳過資料、限制或驗收步驟
重跑率需要重新執行幾次才成功

部署可以分成四個階段。

第一階段只讓 Astra 讀取資料並產生建議。第二階段允許它建立草稿與測試結果。第三階段加入可以回復的修改,例如建立分支、更新測試環境或新增未發布文件。第四階段才考慮讓它操作外部系統,並對付款、寄信、發布、刪除與權限變更保留人工批准。

Astra 的公開成績顯示,它已經能完成更長、更複雜的工作。System Card 同時顯示,模型仍可能過度解讀權限,而且監控系統不一定能看見所有推理。企業需要把模型能力、權限與檢查方式一起測試,不能只測回答品質。

GPT-6 Astra 帶來的實際改變

GPT-6 Astra 的進步集中在一件具體的事:它能把更多步驟接在一起。

它可以讀資料、操作工具、撰寫內容、執行程式、檢查結果,再根據使用者中途加入的要求改變做法。這讓 AI 從單次回答工具,轉向能完成整段工作流程的系統。

ARC-AGI-3 的 99.9%、ExploitBench 的 100% 與 FrontierMath 的 97.6% 都顯示模型能力上升。標準 ARC-AGI-3 環境中的 62.7%、其他未領先的綜合測試,以及資安與監看限制,也顯示這些數字需要放回測試條件中解讀。

截至 2026 年 9 月 4 日,外界還缺少大量正式生產環境的長期資料。現在較合理的做法不是把所有工作直接換成 Astra,而是先把高價值、工具多、人工成本高的任務交給它測試。目前對 Astra 的數字與判斷,以官方發布內容、System Card 與 ARC Prize 評測為準;等一般方案開放後,再補上實際使用心得與實測結果。

先拿一批已知正確結果的工作,記錄完成率、人工修改時間、API 成本、監控中斷與越權次數,再決定下一個可以交給它的權限。

常見問題

GPT-6 Astra 是什麼?

GPT-6 Astra 是 OpenAI 在 2026 年 9 月 3 日發布、目前能力最高的通用推理模型,可以操作瀏覽器與電腦軟體、撰寫程式、整理研究資料,也能產生文件、試算表與簡報。API 中的模型名稱是 gpt-6-astra,在 ChatGPT 介面中則以 GPT-6 Pro 名稱顯示。

一般使用者什麼時候用得到 GPT-6 Astra?

OpenAI 採分批開放:首波先提供給部分組織,之後數日內推進到 ChatGPT Plus、Pro、Business 與 Enterprise,API 則可透過 OpenAI 與 Amazon Bedrock 使用。實際資格以帳號內的模型選單為準。

GPT-6 Astra 已經是 AGI 了嗎?

還沒有共同結論。ARC-AGI-3 的 99.9% 是在 Provider Adapter 環境測得,共同條件的 Standard harness 是 62.7%;部分綜合智力與程式測試也不是第一。ARC Prize 明確表示接近滿分不構成 AGI 證明,OpenAI 高層的 AGI 看法屬於個人判斷。

GPT-6 Astra 和 GPT-5.6 Sol 差在哪裡?

最大差異在代理與長任務能力:OSWorld 2.0 電腦操作從 65.7% 提升到 72.6%、AutomationBench 工作自動化從 18.1% 提升到 41.4%、FrontierMath Tier 4 從 80.5% 提升到 97.6%。不過在 Artificial Analysis 綜合指標與部分程式測試上,Claude 模型仍然領先。

GPT-6 Astra 的 API 價格怎麼算?

標準價是每百萬輸入 tokens 10 美元、輸出 tokens 50 美元;快取讀取 1 美元、快取寫入 12.5 美元。Batch 與 Flex 是半價。輸入超過 272,000 tokens 時,整個請求的輸入費率變兩倍、輸出費率變 1.5 倍。

GPT-6 Astra 可以處理語音或影片嗎?

基礎模型不直接支援音訊與影片輸出,圖片可以輸入。需要語音或影片的工作,目前要搭配其他模型或工具,等 OpenAI 後續推出對應版本再評估。

什麼工作適合優先交給 GPT-6 Astra?

錯誤代價高、需要多種工具、而且一個錯誤會耗掉大量人工時間的長任務,例如大量文件對照、大型程式庫修改、跨來源研究與經授權的資安分析。大量分類、簡短摘要或低成本客服問答,用較小模型更划算。

GPT-6 Astra 為什麼引起資安警戒?

它是 OpenAI 第一個被列為「Critical」資安能力等級的模型,ExploitBench 拿到 100%,測試期間找到並利用兩個先前未知的零時差漏洞;英國 AI Security Institute(AISI)也發現它提供的推理摘要最多有 80% 缺失,不利監看。面對製作進階漏洞利用概念驗證等要求時,模型會拒絕;資安工作適合先放進隔離環境。

留下你的問題或補充

你的電子郵件不會被公開。