AI资讯

刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6

作者:新智元0 次浏览 来源:新智元
刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6

Anthropic发布Claude Opus 5.5,性能追平Fable 5.1且成本降低40%,在Terminal-Bench 4.0和GDPval-AA v2.1等多项基准测试中超越GPT-6 Astra,OpenAI两小时内推出GPT-6 Sol和Luna迎战。

文章配图

今夜,Anthropic没有任何预热,直接甩出了Claude Opus 5.5。

这是Claude 5.5系列首款模型!

Opus 5.5不仅性能追平了Fable 5.1,成本还要比上一代Opus 5低40%,输出速度狂飙30%。

文章配图

这一次,A\直接掀了「性能强=成本高」的桌子。

如今,每个人可以拿到Fable 5.1级的能力,用更少的钱,干更多的活儿。

文章配图

三个字总结:更强、更便宜、更快

用Anthropic的话来说,Opus 5.5在智能体编程、计算机使用、知识工作上,全部刷新了SOTA。

尤其是Terminal-Bench 4.0,跑出了66.4%的成绩,直接把GPT-6 Astra、Fable 5.1按在地上打。

知识工作GDPval-AA v2.1拿下1846 Elo,也跑到了对手前面。

文章配图

如今,Claude 5.5的亮相,直接把新一轮模型大战的火药味儿直接拉满。

Anthropic官宣不过2小时,OpenAI直接扔出了GPT-6 Sol和Luna迎战。

AI圈新一轮大战,今夜正式开打了!

文章配图

目前,Claude Opus 5.5已在全球正式上线,未来几周,Sonnet 5.5与Haiku 5.5也将同步登场。

文章配图

首个Claude 5.5登场

暴打GPT-6 Astra

距离Opus 5发布,仅仅过去了不到两个月。

Claude此番「跳级发售」,摆明了就是冲着OpenAI去的。

文章配图

Artifical Analysis上,Claude 5.5和Fable 5.1,全部压过了GPT-6 Astra

在Anthropic自家的能力指数ECI上,Opus 5.5的得分干过了「雪藏」的Mythos 5.1。

第三方机构Vals AI的RSI指数,测的是模型自己搞AI研究的本事。实测下来,Opus 5.5全球第一。

文章配图

文章配图

到了编程这一项,差距被拉得更开。

Terminal-Bench 4.0衡量的是AI在真实终端环境中完成复杂多步编程任务能力。

在这里,Opus 5.5直接拿下了66.4%,领先GPT-6 Astra整整8.5个百分点(57.9%)。Fable 5.1是55.8%;Opus 5只有52.3%。

Opus 5.5只要开默认档,就能锤爆Opus 5的最高档,而成本只有它的五分之一;追平Astra,也只需花Astra 40%的钱。

文章配图

此外,在测真实代码合并的FrontierCode v1.1,它跑出54.4%,险胜Astra的53.3%。

最夸张的是CursorBench 4.0,题目全是从真实Cursor会话里扒出来的含糊不清、跨文件的烂摊子任务,它拿下57.8%,而GPT-5.6 Sol只有41.7%。

文章配图

文章配图

在知识工作领域,Opus 5.5同样势不可挡。

GDPval-AA v2.1基准测试覆盖44个职业的真实工作任务,Opus 5.5拿下1846 Elo,GPT-6 Astra只有1542。

300多分的Elo差距,在竞技评分体系里几乎是代差。

文章配图

狂飙写作,「啰嗦」病治好了

最值得一提的是,Opus 5.5这一次在写作和沟通能力上,再次强化了。

之前,Opus 5被吐槽最多的就是沟通太费劲。

现在它学会了「结论前置」,扫一眼就能看懂,不说黑话、不拽怪词,让怎么写就怎么写。

长时间协作下来,体验可以说是质的飞跃。

Anthropic把两个版本拉了个横评,大家感受一下:

遇到Bug时,老版Opus 5要慢条斯理地铺垫一大段,结论藏在后面;Opus 5.5第一句话就一针见血地指出账单异常,紧接着干净利落地附上代码。

文章配图

Box的AI产品副总实际体验后表示,「Opus 5.5的token用量只有上一代的三分之一,啰嗦度暴降40%」。

文章配图

全网首测

比Astra更像AGI

Claude Opus 5.5到底香不香,光听Anthropic吹可不行。

Bun的作者Jarred Sumner说了句大实话,写作像Opus 4.6,写代码像Fable 5.1,它会很快成为大部分人的主力模型。

文章配图

这不,第一波开发者的真实测评,已经出炉了!

手搓3D动画,每一帧都是狠活

虽然Claude不会生图,但它这次手搓动画效果的体验,那叫一个丝滑。

开发者cheaty看完网友DreW制作的一个30秒短片撂下一句话,「在我看来,这比Astra更像AGI」!

文章配图

文章配图

谷歌DeepMind的Ben Poole在纸上随手画了一台投石机和一摞方块的草图。

眼瞧着,Opus 5.5就把草图变成了一个能发射、能砸塌方块的3D物理仿真,投石机的关节和配重都是照着草图搭的。

文章配图

Anthropic大牛

Addy Osmani也来整活了。

他直接在Three.js里搓了一只骑自行车的鹈鹕的3D动画,在线开香槟庆祝。

文章配图

沃顿商学院的Ethan Mollick再次用同一套shader提示词测了下——暴雨中的哥特城市。

文章配图

文章配图

一句话直出游戏

在游戏生成上,Opus 5.5也是拿捏很到位。

有人让它整一个涂鸦画风的FPS,居然直接一把过,清完三波小怪之后甚至还能打Boss。

文章配图

文章配图

经典游戏「我的世界」,可玩效果非常能打。

文章配图

另一位开发者Edwin做了一款游戏,灵感来自人类历史上第一台计算机——安提基特拉机械装置的打捞发现。

画面和音效全都是 Opus 5.5 纯代码实时跑出来的,没有任何外部素材。

文章配图

Opus降价四成

实则烧得更多

过去,Opus系列让很多人又爱又恨,能力强,但Token蒸发太快。

这一次,Anthropic直接启动了「加量减价」模式。

文章配图

输入4刀、输出20刀,各砍20%。最烧钱的缓存读取直接从0.50刀砍到0.20刀,降了60%。

想追求速度,开Fast模式提速2.5倍,价格翻倍,8刀和40刀。

官方的说法很诱人,在典型工作负载下,整体便宜40%,输出快30%。

但Artificial Analysis的测试显示,在最高档max effort下,Opus 5.5每解一道题,平均要狂吐11.9万个token,而思考就消耗了8.4万token。

整体看,Opus 5是7.3万,Fable 5.1是7.8万,GPT-6 Astra只有2.7万。

也就是说,它比上一代多想了60%,比Astra多想了4倍。单价降两成,思考量涨六成,两头一抵,白降。

文章配图

文章配图

在安全审查这块,Anthropic爆出了一句让人后背发凉的大实话。

Opus 5.5在自动行为审计里拿了历史最高分,试图绕过限制的越狱行为比上一代少了85%,而且每次都会「乖乖主动上报」。

但紧接着,官方坦承,他们发现Opus 5.5经常敏锐地怀疑自己正在被人类评估。这事细思极恐。

一个AI知道自己在考试,它在考场上展现的「乖巧」,未必代表它在真实世界里不受控时的反应。随着能力变强,这个问题正在变成一个无解的黑洞。

OA终极之战,才刚刚开始

这一战,还没有完。

Anthropic也说了,Opus 5.5只是首个版本,Sonnet 5.5和Haiku 5.5也即将推出。

5.5系列的全面铺开,才刚刚开始。

从旗舰到中端到轻量级,Anthropic正在用一套完整的产品线,对OpenAI发起全线进攻。

而OpenAI那边,也拿出了GPT-6 Sol和Luna,效率更高、成本更优的选择。

大模型这波仗,从拼技术一路卷到拼价格,现在可真到肉搏的时候了。

文章配图

参考资料:

https://www.anthropic.com/claude-opus-5-5

https://x.com/AnthropicAI/status/2102435703535939725?s=20

https://x.com/ClaudeDevs/status/2102438800836489554?s=20

文章来自于微信公众号 “新智元”,作者 “新智元”

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)