笑傲江湖原创文学网 - 纯净的绿色文学家园 !

笑傲江湖(全文在线阅读>

笑傲江湖

AI智能体能自主生成并运行量子计算代码_我的网站

那时花开

A |     

Anthropic又有两张新牌,被提前掀开了!今天,第三方开发者应用和Discord社区中,接连出现了两个陌生的模型ID——claude-mashmallow-eap(棉花糖)claude-melon-eap(甜瓜)早期实测流出,Marshmallow表现更强,对话自然度反超 Opus 5,Melon则稍逊一筹。      科技日报讯 (记者张佳欣)氛围编程(Vibe Coding)正从传统软件开发进入量子计算领域。不过,它们的综合能力全不是Fable级别,最快下周上线。据英国《自然》杂志日前消息,法国量子计算初创企业Pasqal研究人员开发出一种人工智能(AI)智能体,能根据英文自然语言指令生成量子计算代码,并自动在真实量子计算机上运行。研究人员表示,这种量子氛围编程有望降低量子计算实验的技术门槛,让更多人能够开展量子计算研究。就在全网吃瓜的同时,Anthropic内部却先炸出了一颗雷——Fable 5上线两个多月,却遭遇了一场近乎集体的冷落。

B |   所谓氛围编程,是指用户只需要用自然语言告诉AI工具,希望软件实现什么功能,AI便会生成相应程序,并根据用户反馈进行修改和运行。

Anthropic紧急补牌

Claude新模型曝光这轮更新,似乎比以往来得更急。

C |   目前,Anthropic公司的Claude等前沿大语言模型已展现出理解量子计算的能力,不少研究人员也开始用这类模型辅助编写量子计算代码。AI圈大佬们推测,Marshmallow大概率对应Opus级别的迭代升级,可能就是Opus 5.1。而Melon则更接近Sonnet级别。一位网友放出的SVG实测结果,也进一步拉开了两款模型之间的差距。

D | Pasqal研究团队则让这些前沿大语言模型熟悉其量子计算机的技术规格,进一步探索大语言模型能否实现量子领域的氛围编程。  团队重点探索了量子计算最具潜力的应用之一,即量子模拟。量子模拟是指调控量子计算机,使其表现得类似于另一种物理系统,例如催化剂或具有特殊磁性的材料。量子计算机运行这样的模拟,可预测材料的性质,而相关计算可能会超出经典计算机的能力。

E |   Pasqal团队对AI智能体进行了3项测试,每项测试都选取一篇描述某种物理现象的论文,并要求智能体编写和运行代码,以验证这一现象是否可通过量子计算机进行模拟。

F |   Pasqal首席技术官伊克·亨里耶说,要完成这一“转换”,通常需要同时掌握材料物理学和量子计算知识的专业团队,而AI智能体现在可协助完成这一过程。

G |   不过,这并不意味着量子计算已能完全交给AI。

                                  
Anthropic官方目前还没有正式回应,但各种蛛丝马迹已经开始汇聚。在其中一项测试中,智能体需要团队提供较多指导,才能最终得到符合物理规律的实现方案。在涉及实验物理准确性的关键环节,人类研究人员仍不可或缺。如果只是正常升级,这件事本身并不奇怪。真正微妙的是,为什么偏偏是现在?毕竟,就在两个多月前,Anthropic才刚刚把自己最强、最贵的一张牌推上牌桌。它就是站在Claude金字塔最顶端的Fable 5。  目前,其他研究团队也在探索利用大语言模型辅助量子计算。

最强Fable 5,竟然爆冷两个月前,Fable 5顶着Anthropic最强旗舰的光环登场。纽约大学阿布扎比分校应用物理学家努海拉·伊南及其同事开发了一个定制版开源大语言模型LLaMA,使其能生成量子计算代码,但目前还不能自主运行这些代码。不过,这一工具已帮助她和同事将一些原本需要4天完成的工作缩短至1天。能力最强,价格最贵,同时还是Claude整个产品线中最顶尖的那个AI。按照行业惯性,新旗舰一发布,大厂往往会迅速迁移,把预算向最新、最强的模型倾斜。这一次,规律在Fable 5身上失效了!支付平台Ramp追踪了,美国超70000万家企业的Token消费数据,结果发现:Fable 5上线一个月后,只吃掉了企业在Anthropic上6%的Token调用量,支出占比11.4%。如今,两个多月都过去了,FT拿到的最新数据,这一支出份额仍徘徊在11%左右。也就是说,真正愿意把模型切到Fable 5上的开发者、大厂,寥寥无几。对面OpenAI旗舰GPT-5.6 Sol,同期拿走了25%的Token和23%的支出份额。同一个赛场,Anthropic顶配模型份额,只有竞品的四分之一。更尴尬的是,Fable 5的总营收贡献大约只有GPT-5.6 Sol的75%,尽管它每个Token贵了一倍。贵到什么程度呢?Fable 5的单价是,Anthropic自家Opus 4.8的2倍,是Haiku 4.5的10倍。虽强,但大多数企业的日常场景,根本用不到那个级别。自家Opus 5,反杀大哥Anthropic另一款模型,才是Fable 5的正面暴击。7月底,Opus 5正式登场,定价只有Fable 5的一半,但在编程、知识工作评测中,反而跑出了更好的成绩。CursorBench 3.2的测试结果,更直接——Opus 5在最大算力下得分70%,每任务成本$8.23。Fable 5得分70.5%,高了0.5个百分点,但要$17.32。

H | 相当于多花一倍的钱,也仅多跑出0.5%的成绩。企业用脚投票的结果毫不意外,Ramp数据显示,Opus 5上线后,它的支出迅速反超了Fable 5。但问题在于,如果旗舰模型只是展示柜,那市场凭什么给出2万亿美元的估值?开源从11%到62%,仅四个月不仅如此,开源AI的疯狂扩张,同样让Anthropic倍感压力。

I | Vercel AI Gateway统计显示——4月,开源模型的Token份额只有11%。

J | 到了6月,这个数字暴涨到29%。

K | 8月最新数据,直接冲到了62%。短短两个月,从不到三成飙升到超过六成。而它们花掉的钱,不到企业总支出的4%。换句话说,干了大部分活的模型,几乎不花钱。这就让Fable 5的位置越来越尴尬。往里看,Opus 5只要一半的价格,就已经能追到它身后;往外看,开源模型还在一轮轮把价格往下打。Fable 5当然可以继续负责冲击能力上限。但Anthropic眼下更缺的,是企业真正愿意长期用、放量用的模型。这么看,Marshmallow(棉花糖)和Melon(甜瓜)突然冒出来,也就没那么意外了。它们要补的,可能正是Claude全家桶里最关键的一块——够强,也得够便宜;能秀肌肉,更得有人买单。

Current article:http://q5zz.tibiantasangnenti.buzz/news/20260826_240728.html

Published on:22:39:20


顶一下
(0)
0%
踩一下
(0)
0%
------分隔线----------------------------