AB
AiBoss站
project

GPT-6 Astra - OpenAI 推出的最新旗舰大模型

GPT-6 Astra 是 OpenAI 推出的旗舰大模型,官方称其为「全球最智能、最符合人类意图的模型」。模型突破传统聊天边界,进化为能独立操作软件、浏览网页、完成...

GPT-6 Astra是什么

GPT-6 Astra 是 OpenAI 推出的旗舰大模型,官方称其为「全球最智能、最符合人类意图的模型」。模型突破传统聊天边界,进化为能独立操作软件、浏览网页、完成复杂任务的 AI Agent。在 ARC-AGI-3的得分达到 99.9%、ExploitBench获得 100% 成绩等测试中创下纪录,可胜任编程、科研、网安等专业工作。

GPT-6 Astra的主要功能

  • Computer Use:独立操作计算机软件、浏览网页、填写表单、更新 CRM 与整理日程。
  • 软件工程:完成复杂编程与代码库理解,Terminal-Bench 与 DeepSWE 测试均达 SOTA。
  • 科学研究:直接分析实验数据、生成图表,FrontierMath Tier 4 得分 97.6%。
  • 网络安全:发现并利用 zero-day 漏洞,ExploitBench 测试达 100%。
  • 3D 与硬件设计:操作 Blender、Unity、KiCad 完成 3D 建模、游戏场景与 PCB 电路板设计。
  • 专业文档:生成排版精美的海报、演示文稿及可直接使用的商务文档。

GPT-6 Astra的技术原理

  • 超大规模预训练:首次在美国 Stargate 德州基地使用超 10 万张 GPU 完成预训练,是 OpenAI 迄今规模最大的训练项目之一。
  • 模型对齐与安全:集合多年强化学习和对齐研究成果,采用此前模型参与监督;在突破任务边界测试中,越权比例从 48% 降至 0%。
  • 长程上下文管理:Codex 跨上下文窗口保存笔记并支持搜索过往消息与工具输出,使长时任务不丢失关键信息。
  • 分级安全策略:普通版本拒绝高级网络安全请求,经审核的安全团队可通过 Daybreak 项目获得更开放的能力访问,平衡性能与风险。

如何使用GPT-6 Astra

  • 获取权限:订阅 ChatGPT Plus/Pro/Business/Enterprise 或申请 API 访问,获得 GPT-6 Astra 使用权限。
  • 切换模型:在 ChatGPT 客户端或 API 端点中选择 GPT-6 Astra 作为当前模型。
  • 输入指令:用自然语言输入复杂任务指令,支持编程、设计、科研、办公自动化等多场景。
  • 开启 Computer Use:开启 Computer Use 功能,授权 Astra 自主操作软件、浏览网页及调用外部工具。
  • 交互确认:根据执行进度实时反馈,确认关键节点或调整需求,直至任务完成并导出成果。

GPT-6 Astra的核心优势

  • Agent 能力质变:从聊天问答进化为能独立完成复杂任务的 AI Agent,可直接操作软件、浏览网页、处理专业工作流。
  • 顶尖基准成绩:ARC-AGI-3 达 99.9%,ExploitBench 达 100%,FrontierMath Tier 4 达 97.6%,多项测试刷新纪录。
  • 软件工程领先:Terminal-Bench 与 DeepSWE 均达 SOTA,代码生成迭代更少,长程任务上下文不丢失。
  • 科学研究能力:可直接进入专业软件分析实验数据,参与数学研究并推进素数间隔问题。
  • 创意与硬件设计:支持 Blender、Unity、KiCad 完成 3D 建模、游戏场景搭建与 PCB 电路板设计。
  • 网络安全双刃剑:具备发现 zero-day 漏洞的能力,但通过 Daybreak 分级策略严格管控开放范围。

GPT-6 Astra的项目地址

  • 项目官网:https://openai.com/index/gpt-6-astra/

GPT-6 Astra的同类竞品对比

对比维度 GPT-6 Astra (OpenAI) Claude Fable 5.1 (Anthropic)
产品定位 全球最强 AI Agent,AGI 时代起点 Anthropic 旗舰模型,侧重安全与推理
Computer Use OSWorld 2.0: 72.6%
Agents’ Last Exam: 59.3%
ScreenSpot-Pro: 92.7%
Agents’ Last Exam: 48.7%
ScreenSpot-Pro: 87.3%
软件工程 Terminal-Bench 4.0: 57.7%
DeepSWE v1.1: 74.1%
FrontierCode Ext: 64.5%
Terminal-Bench 4.0: 55.8%
DeepSWE v1.1: 67.4%
FrontierCode Ext: 63.6%
科学研究 FrontierMath Tier 4: 97.6%
GPQA Diamond: 96.0%
Terminal-Bench Science: 64.6%
FrontierMath Tier 4: 87.8%
GPQA Diamond: 93.7%
Terminal-Bench Science: 52.6%
网络安全 ExploitBench: 100%
ExploitGym: 42.4%
ExploitGym: 30.4%
安全对齐 越权比例 0%
CU 安全: 2.4%
CU 安全: 9.5%
定价 输入 $10/M tokens
输出 $50/M tokens
输入 $10/M tokens
输出 $50/M tokens
开放策略 分级开放,普通用户受限,安全团队 via Daybreak 通过 Claude 平台及 API 标准开放

GPT-6 Astra的应用场景

  • 软件工程:自主完成复杂代码编写、调试与数据库迁移,Terminal-Bench 与 DeepSWE 测试均达行业顶尖水平。
  • 科学研究:直接进入专业软件分析基因测序数据、生成实验图表,并参与推进数学前沿难题研究。
  • 办公自动化:独立操作 Excel、Power BI 等工具,完成填表、CRM 更新、日程整理及复杂数据分析。
  • 3D 与硬件设计:在 Blender、Unity 中完成 3D 建模与游戏场景搭建,或使用 KiCad 完成 PCB 电路板布局设计。
  • 网络安全:主动扫描并发现 zero-day 漏洞,帮助企业修复系统缺陷,同时通过分级策略防止滥用。