2026-10-03
已往两年,咱们已经经习气把事情丢进谈天框。
让AI写一封邮件、收拾集会记要、查找资料,或者者给出一份方案。它的回覆愈来愈像一位纯熟员工,却始终隔着末了一步:AI卖力告诉你怎么做,剩下的操作仍旧要由人来完成。
GPT-6 Astra试图跨过这一步。
根据OpenAI的先容,Astra不仅能理解使命,还有可以打开阅读器、操作桌面软件、填写表格、更新CRM里的客户资料,再把处置惩罚成果写进邮件及文档。于工程场景中,它还有能安装软件、运行测试、建造网站,甚至打开KiCad完成电路板结构。

用户再也不需要把一个使命拆成十几条指令,别离交给差别东西。只要告诉Astra想要甚么,它便会本身寻觅进口、切换页面,完成中间那些噜苏的操作。
这已经经很靠近人们想象中的“数字员工”。
它不会坐于办公室里,也没有本身的工位,却能利用公司天天都于利用的软件,接办已往必需由员工逐项完成的事情。比拟模子又学会了几多常识、基准成就提高了几个百分点,这类变化更易被企业感触感染到。
OpenAI结合开创人格雷格·布罗克曼把Astra称为AGI时代的初步。但就于几天前,萨姆·奥尔特曼还有说,AGI已经经成为一个界说杂乱、甚至带有营销色采的词。
Astra是否是AGI,可以留给研究职员继承争辩。对于平凡用户及企业来讲,一个更直接的变化已经经发生:AI最先从“会回覆问题”,走向“能把工作办完”。
“数字员工”还有没有彻底到来,但它离真正的事情情况,已经经比已往近了不少。
此次进级,重点不于谈天
根据OpenAI的先容,Astra可以填写于线表格、更新CRM里的客户资料、收拾日历、搜刮网页、处置惩罚邮件及文档。
它还有能安装软件、运行测试、排查电脑妨碍。于工程场景里,Astra可以打开KiCad举行电路板结构,挪用数据阐发东西天生图表,也能够建造网站,再跑一遍前端质量查抄。
此刻的年夜模子已经经很会说了。影响企业是否愿意继承费钱的,不是回覆能不克不及再长一点,而是AI能不克不及脱离谈天框,进入公司天天都于利用的体系。
Astra于一些电脑操作测试中的前进很较着。于Agents’ Last Exam上,它取患上59.3%的成就,高在GPT-5.6 Sol的53.6%及Claude Opus 5的55.5%;完成同类使命时,输出token比Claude Opus 5少约65%。

于OSWorld 2.0电脑操作测试中,Astra取患上72.6%的成就,平均完成时间约为40分钟。GPT-5.6 Sol的成就是65.7%,平均需要约75分钟。
但Astra也没有于所有测试中领先。于带东西的Humanity’s Last Exam上,它的57.2%低在Claude Fable 5.1的65%;Artificial Analysis Intelligence Index上,Astra一样掉队在两款Claude模子。
以是,OpenAI所谓“全世界最智慧的模子”,仍旧是发布会语言。测试东西、推理预算及使命类型稍有差别,排名就可能发生变化。
Astra最凸起之处,不是每一一道题都拿第一,而是把推理及操作接到了一路。之前,AI可以告诉你怎样建造一张表格、修改公司后台、部署一个网站,末了还有患上有人照着谜底操作。Astra试图把鼠标及键盘也接已往。
OpenAI想要的不只是定阅费
GPT-6 Astra起首向一部门机构开放,随落伍入ChatGPT Plus、Pro、Business及Enterprise,并经由过程API及AWS提供。

它的API价格其实不自制:每一百万输入token 10美元,输出token 50美元,拥有105万token的上下文窗口,至多可以输出12.8万token。
这里的“端到端”,实在比“最强模子”更能申明OpenAI的筹算。企业不会只计较一次对于话用了几多token。它们更体贴一项事情需要几多时间、几多人工复核,以和掉败之后要不要重做。
假如Astra能用几美元完成一项原本需要员工忙上几个小时的事情,即便单次挪用价格更高,企业也可能愿意买单。模子之间的比力,也会从“每一百万token几多钱”转向“完成一件及格的事情要几多钱”。
Anthropic已经经依赖编程能力、长使命体现及企业客户成立了上风。OpenAI拥有重大的ChatGPT用户,但想进入企业的焦点营业,仅靠谈天呆板人还有不敷。
电脑操作能力给了OpenAI另外一条路。
许多企业仍于利用老旧的财政软件、后台体系及内部网页。这些体系没有利便的API,也不成能全数为AI重写。Astra可以直接辨认界面、点击按钮、填写字段,像一位员工那样利用它们。
企业缭绕模子从头摆设权限、审批及审计之后,改换模子就再也不是改一个API地址那末简朴。OpenAI获得的也不只是一笔挪用收入,还有多是整套事情流的进口。
更守端方,却没有之前那末好读
Astra于安全测试中更愿意遵守限定,它的思维历程却比前代模子更难监控。
OpenAI暗示,Astra的思维链更短,也更少呈现可以或许袒露异样举动的信息。于一些专门设计的匹敌测试中,当研究职员要求它遁藏监控时,它有时可以或许绕过只查抄思维链的监控器。OpenAI没有发明Astra于平凡利用情况中自动隐蔽用意的证据,环境还有没有严峻到“模子学会棍骗人类”。

问题出于监视手腕上。当前评测里的Astra更守端方,研究职员却比之前更难从它的推理记载中提早发明问题。今天测出来的安全体现不错,不代表统一套监控要领可以或许一直跟上模子能力。
英国AI安全研究所还有测试了模仿供给链进犯、虚伪身份,以和引诱别人接管歹意代码等场景。测试没有接入真实收集及代码堆栈,不克不及直接当做一次实际进犯,但已经经足以提示企业:部署智能体时,最难做的决议不是选哪一个模子,而是给它开放哪些权限。
AI正于从“会说”走向“会做”
Astra普和之后,网页及桌面软件可能迎来一轮新的革新。
已往的软件界面重要为人设计,此后还有患上思量智能体能不克不及辨认按钮、理解页面状况、发明操作掉败。与此同时,网站也要区别正常的AI代办署理、批量主动化东西及歹意呆板人。

身份验证、授权规模及操作记载,会成为智能体产物的基础举措措施。
收集安全行业面临的压力越发直接。AI可以更快发明缝隙,也能更快制造进犯东西。安全竞争会从“谁先找到缝隙”,逐步酿成“谁能更快修复、部署及验证”。
对于平凡常识事情者来讲,短时间内先被压缩的可能不是整个岗亭,而是事情中那些最噜苏的步调:找资料、录数据、建造初稿、调解格局、于几个软件之间搬运信息。
人的位置会向先后两头挪动。一端是决议AI应该做甚么、能做到哪一步;另外一端是查抄成果、处置惩罚破例,并于呈现问题之后找到责任人。

GPT-6 Astra是否是AGI,还有可以继承争辩。
更实际的环境是,AI已经经从一个提供建议的人,酿成了一个预备亲主动手的人。
假如Astra乐成,OpenAI拿到的将是一个弘远在谈天定阅的企业主动化市场。假如它犯错,留下的也不会只是一段禁绝确的回覆,还有多是一条被修改的记载、一份部署过错的代码、一笔不应发出的生意业务,或者者一个还没有公然的缝隙。
已往,年夜模子说错一句话,用户还有可以直接划走。
当它拿起鼠标,过错就会留于实际世界里。
版权所有,未经许可不患上转载
-乐鱼体育