project
GPT-6 Astra - OpenAI 推出的最新旗舰大模型
GPT-6 Astra 是 OpenAI 推出的旗舰大模型,官方称其为「全球最智能、最符合人类意图的模型」。模型突破传统聊天边界,进化为能独立操作软件、浏览网页、完成...
GPT-6 Astra是什么
GPT-6 Astra 是 OpenAI 推出的旗舰大模型,官方称其为「全球最智能、最符合人类意图的模型」。模型突破传统聊天边界,进化为能独立操作软件、浏览网页、完成复杂任务的 AI Agent。在 ARC-AGI-3的得分达到 99.9%、ExploitBench获得 100% 成绩等测试中创下纪录,可胜任编程、科研、网安等专业工作。
GPT-6 Astra的主要功能
-
Computer Use:独立操作计算机软件、浏览网页、填写表单、更新 CRM 与整理日程。
-
软件工程:完成复杂编程与代码库理解,Terminal-Bench 与 DeepSWE 测试均达 SOTA。
-
科学研究:直接分析实验数据、生成图表,FrontierMath Tier 4 得分 97.6%。
-
网络安全:发现并利用 zero-day 漏洞,ExploitBench 测试达 100%。
-
3D 与硬件设计:操作 Blender、Unity、KiCad 完成 3D 建模、游戏场景与 PCB 电路板设计。
-
专业文档:生成排版精美的海报、演示文稿及可直接使用的商务文档。
GPT-6 Astra的技术原理
-
超大规模预训练:首次在美国 Stargate 德州基地使用超 10 万张 GPU 完成预训练,是 OpenAI 迄今规模最大的训练项目之一。
-
模型对齐与安全:集合多年强化学习和对齐研究成果,采用此前模型参与监督;在突破任务边界测试中,越权比例从 48% 降至 0%。
-
长程上下文管理:Codex 跨上下文窗口保存笔记并支持搜索过往消息与工具输出,使长时任务不丢失关键信息。
-
分级安全策略:普通版本拒绝高级网络安全请求,经审核的安全团队可通过 Daybreak 项目获得更开放的能力访问,平衡性能与风险。
如何使用GPT-6 Astra
- 获取权限:订阅 ChatGPT Plus/Pro/Business/Enterprise 或申请 API 访问,获得 GPT-6 Astra 使用权限。
- 切换模型:在 ChatGPT 客户端或 API 端点中选择 GPT-6 Astra 作为当前模型。
- 输入指令:用自然语言输入复杂任务指令,支持编程、设计、科研、办公自动化等多场景。
- 开启 Computer Use:开启 Computer Use 功能,授权 Astra 自主操作软件、浏览网页及调用外部工具。
- 交互确认:根据执行进度实时反馈,确认关键节点或调整需求,直至任务完成并导出成果。
GPT-6 Astra的核心优势
-
Agent 能力质变:从聊天问答进化为能独立完成复杂任务的 AI Agent,可直接操作软件、浏览网页、处理专业工作流。
-
顶尖基准成绩:ARC-AGI-3 达 99.9%,ExploitBench 达 100%,FrontierMath Tier 4 达 97.6%,多项测试刷新纪录。
-
软件工程领先:Terminal-Bench 与 DeepSWE 均达 SOTA,代码生成迭代更少,长程任务上下文不丢失。
-
科学研究能力:可直接进入专业软件分析实验数据,参与数学研究并推进素数间隔问题。
-
创意与硬件设计:支持 Blender、Unity、KiCad 完成 3D 建模、游戏场景搭建与 PCB 电路板设计。
-
网络安全双刃剑:具备发现 zero-day 漏洞的能力,但通过 Daybreak 分级策略严格管控开放范围。
GPT-6 Astra的项目地址
- 项目官网:https://openai.com/index/gpt-6-astra/
GPT-6 Astra的同类竞品对比
| 对比维度 | GPT-6 Astra (OpenAI) | Claude Fable 5.1 (Anthropic) |
|---|---|---|
| 产品定位 | 全球最强 AI Agent,AGI 时代起点 | Anthropic 旗舰模型,侧重安全与推理 |
| Computer Use | OSWorld 2.0: 72.6% Agents’ Last Exam: 59.3% ScreenSpot-Pro: 92.7% |
Agents’ Last Exam: 48.7% ScreenSpot-Pro: 87.3% |
| 软件工程 | Terminal-Bench 4.0: 57.7% DeepSWE v1.1: 74.1% FrontierCode Ext: 64.5% |
Terminal-Bench 4.0: 55.8% DeepSWE v1.1: 67.4% FrontierCode Ext: 63.6% |
| 科学研究 | FrontierMath Tier 4: 97.6% GPQA Diamond: 96.0% Terminal-Bench Science: 64.6% |
FrontierMath Tier 4: 87.8% GPQA Diamond: 93.7% Terminal-Bench Science: 52.6% |
| 网络安全 | ExploitBench: 100% ExploitGym: 42.4% |
ExploitGym: 30.4% |
| 安全对齐 | 越权比例 0% CU 安全: 2.4% |
CU 安全: 9.5% |
| 定价 | 输入 $10/M tokens 输出 $50/M tokens |
输入 $10/M tokens 输出 $50/M tokens |
| 开放策略 | 分级开放,普通用户受限,安全团队 via Daybreak | 通过 Claude 平台及 API 标准开放 |
GPT-6 Astra的应用场景
- 软件工程:自主完成复杂代码编写、调试与数据库迁移,Terminal-Bench 与 DeepSWE 测试均达行业顶尖水平。
- 科学研究:直接进入专业软件分析基因测序数据、生成实验图表,并参与推进数学前沿难题研究。
- 办公自动化:独立操作 Excel、Power BI 等工具,完成填表、CRM 更新、日程整理及复杂数据分析。
- 3D 与硬件设计:在 Blender、Unity 中完成 3D 建模与游戏场景搭建,或使用 KiCad 完成 PCB 电路板布局设计。
- 网络安全:主动扫描并发现 zero-day 漏洞,帮助企业修复系统缺陷,同时通过分级策略防止滥用。