GPT-6 Astra 开始比人类更会用电脑

行业动态

GPT-6 Astra 开始比人类更会用电脑

栏目:行业动态

摘要

OpenAI 正式发布 GPT‑6 Astra,其最大突破不只是推理能力,而是能直接操作 Blender、Unreal Engine 5、Excel、Power BI、浏览器、终端与科研软件。电脑正在从人类的工具,逐渐变成 AI 的通用执行接口。

本文目录

2026年9月3日,OpenAI正式发布 GPT‑6 Astra。它最值得关注的变化,不只是推理、编程或考试成绩继续上涨,而是 AI与电脑之间的关系开始发生变化:过去的大模型主要负责“告诉你怎么做”,Astra则越来越像一个能够直接进入软件环境、理解屏幕、操作界面、跨应用完成任务的数字执行者。

GPT-6 Astra 操作多种专业软件的主题插图,展示 3D 建模、代码、文档和表格工作流

OpenAI把 Astra称为目前最强的 computer use模型,并明确表示它在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等方向达到新的前沿水平。如果这种能力继续扩展,AI的竞争焦点就不再只是“谁更聪明”,而会变成“谁能真正使用人类已经创造出来的全部数字工具”。

真正的变化,是 AI开始直接操作软件

Astra可以填写网页表单、更新 CRM客户记录、整理日历、完成在线研究,并把结果写进邮件或文档编辑器。它还能分析科学数据、生成图表、创建网站、执行前端 QA、自动安装和测试软件,以及根据屏幕上的问题进行排错。

这类能力和传统聊天机器人最大的区别,是它不再只输出一段文字或代码,而是能在真实软件里连续执行多步操作。用户给出的往往只是目标,模型需要自己判断下一步该打开什么、点击哪里、输入什么、发现错误后如何修正,并且在任务进行过程中维持上下文。

OpenAI在 OSWorld 2.0电脑操作评测中给出的结果是:GPT‑6 Astra得分72.6%,GPT‑5.6 Sol为65.7%。更关键的是,Astra完成同类任务的模拟耗时大约减少了47%,平均约40分钟,而 GPT‑5.6 Sol约为75分钟。ScreenSpot‑Pro这类强调界面视觉理解与点击判断的测试中,Astra得分达到92.7%。

这些数字不能简单翻译成“它已经比所有人类都会用电脑”,因为基准测试覆盖的是特定任务分布,不等于现实世界所有软件和所有职业。但它们确实说明了一件很重要的事:在一批复杂、跨步骤、需要视觉判断的电脑任务上,前沿模型已经从“勉强能操作”进入“可以承担真实工作流”的阶段。

Blender到 Unreal Engine 5,是最直观的一次跨软件展示

OpenAI官方展示了一个很有代表性的案例:GPT‑6 Astra在 Blender中完成房屋建模,然后把结果继续处理成 Unreal Engine 5中可以行走探索的场景。对设计师、建筑师和客户来说,这意味着模型不是只生成一张效果图,而是在两个专业软件之间完成连续工作,把三维资产进一步变成可交互空间。

这类任务过去通常要求操作者理解建模、材质、场景结构、导出格式、引擎导入和交互逻辑。Astra的意义在于,它开始尝试把这些原本高度依赖软件熟练度的操作压缩成“描述目标—执行—检查—修正”的代理流程。

OpenAI同时展示了 Astra在 Excel、Power BI、电路板设计、游戏开发、汽车传动相关任务、法律文档格式化、网页前端 QA和科学软件中的操作。它还可以导航科研软件检查测序质量、查看遗传变异,并根据结果辅助研究人员判断下一步应该分析什么。

CAD和专业软件能力已经不只是演示

在 BenchCAD中,模型需要根据多视角渲染重建三维物体,并通过生成 CAD代码恢复几何结构。GPT‑6 Astra的几何重叠得分达到95.9%,高于 GPT‑5.6 Sol的83.3%。

Agents’ Last Exam则测试模型在真实专业软件中完成金融建模、工程、媒体制作等复杂任务的能力。Astra得分59.3%,高于 GPT‑5.6 Sol的53.6%,也高于公开对比中的 Claude Opus 5的55.5%。这类测试更接近“让 AI坐到一台电脑前完成工作”,而不是传统问答题。

它还在 AutomationBench上得到41.4%,相比 GPT‑5.6 Sol的18.1% 有明显提升。这个方向尤其值得关注,因为真正能改变办公和生产流程的,并不是模型一次回答得多漂亮,而是它能否稳定地把几十个操作连起来,完成一个人原本需要在多个软件之间切换才能完成的任务。

“通用人工智能”争议,正在从智力转向执行能力

OpenAI官方没有简单把“AGI已经完成”写成一个技术定论,但公司内部和外部已经开始公开使用“AGI era”来描述 Astra所代表的阶段。ARC‑AGI‑3上,Astra得分达到99.9%;OpenAI引述 ARC Prize Foundation的评价称,Astra在96% 的关卡上超过了人类动作效率基线,并接近该评测中的人类水平。

这也解释了为什么 Astra的“电脑使用能力”比单一考试成绩更重要。一个模型即使知识很多,如果不能调用软件、浏览网页、运行工具、处理文件、纠正错误,它仍然只是一个高级问答系统。反过来,当模型能够持续操作电脑,它就获得了连接几乎整个数字世界的执行接口。

电脑本身已经是人类最通用的工具。Blender、Unreal Engine、Excel、Power BI、浏览器、终端、IDE、CRM、科学分析工具、设计软件和企业后台,本质上都是不同形式的界面。一个能够看懂屏幕、学习交互规则、调用工具并持续完成任务的模型,理论上不需要为每一种软件重新训练一个完全独立的机器人。

所以真正值得关注的“奇点”可能不是某一天 AI在一张智力测验里超过人类,而是它开始拥有一种通用的数字行动能力:人类过去几十年制造的软件,突然都可能成为 AI可以直接使用的工具。

它仍然不是“所有软件都会、所有任务都比人强”

目前 Astra仍然处于逐步开放阶段,并不是所有用户都已经可以使用。电脑操作基准也远未达到100%,长任务中仍可能因为界面变化、权限、模糊指令、软件异常或环境差异而失败。专业领域里,模型是否能完成任务,也不等于它能够取代具有责任、经验和判断权的人类专家。

更值得警惕的是,电脑操作能力越强,安全问题也越现实。OpenAI已确认 Astra是首个在其 Preparedness Framework下达到网络安全 Critical等级的模型。在没有生产级防护的评测环境里,它已经具备发现未知漏洞、开发利用方式和完成复杂安全任务的能力。OpenAI因此给 Astra加入了更严格的监控、权限和自动审查机制。

但从产品方向看,边界已经相当清楚:AI正在从“回答问题的软件”变成“会使用软件的软件”。当模型可以进入 Blender建模、进入 Unreal Engine搭场景、进入 Excel做分析、进入浏览器完成事务、进入终端安装和排错,再跨多个工具把任务一直做到结束时,软件操作本身正在从一种需要长期训练的人类技能,逐渐变成可以被自然语言调用的能力。

GPT‑6 Astra真正强大的地方,可能并不是它比上一代多拿了多少分,而是它开始把电脑变成自己的通用工具箱。过去我们学习软件,是为了让电脑替我们工作;现在,AI正在学习软件,下一步很可能是我们只需要告诉它结果应该是什么。

© 2026 DGNEWLIVE 保留所有权利.