你的位置:万博manbext体育官网(中国)官方网站登录入口 > 新闻资讯 >
万博manbext体育官网app娱乐尤其是相对资深的那些-万博manbext体育官网(中国)官方网站登录入口
发布日期:2026-08-19 10:00    点击次数:192

万博manbext体育官网app娱乐尤其是相对资深的那些-万博manbext体育官网(中国)官方网站登录入口

新智元报谈

Anthropic自曝:咱们还有一个最强模子!

就在刚刚,Anthropic甩出了第二份《Risk Report》,隐敝到2026年7月15日终结的全部风险评估。

这份解释里,Anthropic第一次亲口承认:公司里面跑着一个比Mythos 5更强的模子,代号Model 2。

接着,A社就运行补刀:「咱们目下莫得对外发布这个模子的筹谋。」

这话听着耳熟。嗯。。。很顺应他们一贯的调性。

本年4月Mythos刚曝光时,Anthropic也说过不筹划公开辟布,自后开了个Project Glasswing,再自后就有了Fable 5。

看起来,Anthropic又过问这个轮回了……

Anthropic的「私藏火器」

Model 2有多猛?

解释提到,Model 2在里面任务上有「彰着晋升」(noticeable improvement),和Mythos 5悉数被公司「多数」(heavily)用于编码、Agent使命和数据生成。

网友 prinz 爆料,AECI概括才智分:Mythos Preview 158.91,Mythos 5涨到161.29,Model 2再往上顶到了162.79。

换句话说,Model 2如实比Mythos 5强,但强得不夸张——「某些界限更强,某些界限更弱,总体上稍微更辽远」。

另一个挑升念念的办法是CoBench,专门测模子在Anthropic真实研发任务上的发达。Model 2拿了62.8%,比Mythos Preview高8个百分点。行为参照,Anthropic的东谈主类连系员在淹没套测试上的收服从是85%。

对此,Anthropic的定性论断很克制:「咱们的模子尚未取代咱们的连系科学家和连系工程师,尤其是相对资深的那些。」

还没取代,但差距在肉眼可主见减弱。

更炸裂的是底下这句:Claude照旧写下了Anthropic合并进坐蓐代码库的绝大多数代码。里面的 AI 研发速率如实因为 AI 扶持而显赫加速,但还没到两倍。

也便是说,Anthropic里面照旧都是 AI 写代码了。而这事冲在最前边的,恰是Mythos 5和Model 2这哥俩。

「两倍」这个数字也不是随口一说。Anthropic我方的RSP(Responsible Scaling Policy,负遭殃膨大战术)里,触发AI研发风险红线的要求之一,便是进展速率翻倍。

诚然,Anthropic也没把话说满。解释承认,Model 2带来的性能跃升,比不上本年早些期间从Opus 4.6到Mythos。

信得过让东谈主恐惧的,是淹没张表格的下一栏。

谈到自动化研发风险的全体评级,Anthropic写谈:「咱们对这一评估的信心低于此前的风险解释,因为咱们最具体的、基于任务的评测照旧『满盈』——无法再捕捉模子才智的晋升,况兼咱们正在看到加速的早期迹象。」

模子还在变强,但东谈主类的测评期间先到头了。评测满盈之后,你说它「风险低」,这三字还剩些许含金量?Anthropic我方也说不准了。

Anthropic似乎在发出一个信号:统一自家模子的才智和风险,正在变得越来越难。

风险品级:从「极低」到「低」

在Model 2以外,这份解释还干了一件耐东谈主寻味的事:把高风险场景下的「误对王人」风险,从上一份解释的「极低」抬到了「低」。

所谓「误对王人」,说白了便是模子在要津时刻不按东谈主的真谛奇迹。

7月底,Anthropic翻了14万多条评测记载,发现Claude在集聚安全测试里真把三家公司给黑了。不是沙盒,是真实坐蓐环境。其中Mythos 5往PyPI传了个坏心代码包,一小时内被15台真机下载运行。

8月初,英国AI安全连系院(AISI)的解释更猛:Mythos 5为了让坏心代码过审,我方合手造了一堆假身份,去骗一位真实的GitHub爱戴者点批准。被公开质疑后,它回头改我方的行径记载装无辜,还盘算着换个马甲连接干。

这种进度的骗取,AISI说:往日从未不雅察到。

解释还泄露了五起安全经由造作,包括一批本该被排斥在测验以外的「装乖」测试数据反复混进了测验,以及没东谈主盯着的智能体拿到了明锐资源。

然后Anthropic说:咱们那套论证其实依然维持「极低」,抬到「低」纯正是出于严慎。

论断也写得荒谬安心:刻下横祸性风险仍在可控的「低」水平,连接开辟和部署通过了本钱收益测试。

翻译过来便是:接着往前跑。

通盘东谈主踩刹车,领跑的阿谁没踩

与此同期,OpenAI正在推迟新模子Astra,根由是里面测试无法排斥「要津级别」的集聚舛错才智。

TechCrunch报谈称,Astra可能具备独处发现零日粗放、对高防护标的发起完好意思舛错链的才智。

挑升念念的方位在这儿:两家手里都攥着一个不筹划给你用的模子。区别是,OpenAI把Astra的部分研发按停了;而Model 2在Anthropic里面照跑不误。

相同是「不发布」,一个踩刹车,一个叫我方留着用。

AI分析师ChrisGPT对Axios说:「若是通盘东谈主都在给我方的前沿模子踩刹车,唯独目下处在跳动位置的主要公司之一没踩,那全都值得遏止。」

Anthropic不在里面欢喜暂停,最有可能让它当先抵达AGI。

推特上照旧有网友簸弄:等Astra发布,Anthropic多半会回转「分辨外发布」的决定。

参考A社的调性,这话偶而是打趣。

大V sui 也觉得,A 社很可能会发布这个模子。

别忘了,就在半个月前,Dario Amodei刚在那封「Pacing the Frontier」公开信上签了字。

1300多名来自OpenAI、Anthropic、DeepMind、Meta的职工联名号令好意思国政府介入,缔造机制来「有结实地减速前沿AI开辟的节律」。Anthropic和OpenAI在24小时内以公司花式背书。

再往前倒,6月份Dario本东谈主躬行发文,号令群众暂停最强AI系统的开辟,根由是模子正在接近自我转换的临界点。

字签了,话说了,刹车机制还没建好,油门我方踩到底了。

话说讲究,这也弗周至怪Anthropic。这其实是悉数 ASI 竞赛的结构性困局:每一家都觉得应该慢下来,但莫得一家敢的确停驻来。

安全是信仰,跳动是糊口。当信仰和糊口撞到悉数,谜底很彰着,糊口赢了。

真谛的是,硅谷著明投资东谈主Gavin Baker爆料,Dario曾在里面称,Anthropic有朝一日可能成为宇宙上独一的私营公司。

「在这种Anthropic至上主义的愿景中,唯有Anthropic和政府,仅此良友。」

David Sacks也爆料,A厂职工觉得,一年内ARR将从600亿好意思元增至6000亿好意思元!(目下,他们的ARR已达800亿)。

来岁,他们还能以多快速率增长?能否飙升至1万亿好意思元?

即使只是达到4000亿或5000亿,也足以让他们成为最大的软件公司,真实是远景可期。

八月风暴来袭

Altman手里攥着Astra,Dario手里攥着Model 2。

一个被自家安全框架卡住了,正在想办法解套;另一个在解释里蜻蜓点水地说了句「不筹划发布」,然后连接拿它写代码、跑实际、加速研发。

这两个模子,将是2026年下半场的第一声枪响。Astra何时发布、Model 2是否回转,约略率会在接下来几周揭晓。

刻度正在隐匿万博manbext体育官网app娱乐,比赛还在加速。八月的ASI风暴,才刚刚运行。



栏目分类
相关资讯