Anthropic新模型略超最强Claude

Anthropic低调披露内部代号为“Model 2”的最新系统,称其综合性能略微超过目前公开可用的最强模型Claude Mythos 5。该模型在MMLU-Pro、BIG-Bench Hard、HumanEval等主流评测上领先2%至4%,在Agentic任务上优势接近5%,且推理成本与延迟保持不变。消息引发研究社区广泛关注,业界猜测这可能是一个独立于现有Scaling Law体系的并行项目,或代表架构与训练目标的重大变化。Anthropic选择以“披露”而非“发布”的方式公开该模型,被视为一场精心设计的战略行动,既维护现有产品周期,又向高端客户释放技术储备信号。此次披露也引发了关于安全对齐、监管透明度及行业竞争比较基准的深刻讨论,标志着AI行业进入新的透明化阶段。

Anthropic新模型略超最强Claude

Anthropic 日前在一份技术备忘录中低调披露了内部代号为“Model 2”的最新系统,称其综合性能“略微超过”目前公开可用的最强模型 Claude Mythos 5。这份文件并未伴随新闻发布会,也没有在官网首页置顶,但消息传出后在研究社区引发了远超常规迭代的关注。原因不在于分数高了多少,而在于“Model 2”这个名字本身所暗示的技术路线选择,以及 Anthropic 选择在 Mythos 5 发布尚未满月就承认内部存在更强系统的罕见透明度。

根据备忘录中列出的基准数据,Model 2 在 MMLU-Pro、BIG-Bench Hard 和 HumanEval 等主流评测上的表现比 Mythos 5 高出约 2% 至 4%。在需要多轮推理的 Agentic 任务中,如 SWE-bench Verified 和 GAIA,优势略大,接近 5%。这可以理解为“略超”,但值得注意的是,所有测试均未出现性能回退,且推理成本与延迟保持一致。一位没有参与该项目的 Anthropic 前研究员告诉我,这种“不增加成本的小幅全面领先”通常不是靠参数规模扩大或更长思维链能实现的,而是可能在架构或训练目标上出现了结构性变化。

更大的信号藏在模型命名里。Anthropic 内部一直沿用“Mythos”作为公开品牌,而“Model 2”显然不是 Mythos 6 的工程代号。熟悉公司语言模型路线图的消息人士猜测,这可能是一个独立于现有 Scaling Law 体系的并行项目。此前 Anthropic 首席科学家曾暗示,下一代模型将不再单纯追求“更大”,而是要让模型学会在推理过程中进行更高效的“信息获取”。Model 2 在长上下文非连续任务上的突出表现——比如从 100 页论文中找出矛盾点并正确引用——似乎印证了这种方向。

不过,“性能略超”的措辞也引发了对安全对齐的猜测。Anthropic 官方拒绝透露 Model 2 是否会被直接部署,仅强调“与公开模型同等的对齐保证”。但在 AI 政策圈,这种“内部模型明显强于公开模型”的披露历来敏感。去年各实验室曾联合承诺,不会在未完成安全评估前发布超越 AGI 预期能力的模型。Model 2 的存在是否意味着评估框架已经完成?又或者,Anthropic 是在主动暴露自己的“能力上限”,以对冲竞争对手在闭门环境中制造的信息不对称?

站在行业角度看,这次披露可能是一场精心设计的战略行动。Mythos 5 目前是市场公认的标杆,使用它的开发者们形成了庞大的生态。若 Anthropic 直接推出 Model 2,将面临与现有 API 兼容、用户迁移等大量成本。但通过“披露”而非“发布”,公司既不破坏现有产品周期,又能向高端企业客户和研究者释放一个信号:我们手里有更好的东西,且随时可以供货。一位云计算业务负责人评价说:“这是在用透明度做产品预售。”

更深层的影响在于,这重新定义了模型竞争的比较基准。过去,公司比拼的是公开基准上的最高分;现在,Anthropic 主动提出“公开最强”与“内部最强”的区分,迫使对手思考一个尖锐问题:你们内部是不是也有更强的系统?如果否,那么你在技术上已经被落下;如果是,那么你又凭什么隐瞒?这种“明牌游戏”可能加速整个行业的披露文化,也可能导致更多模糊、半真半假的信息战。

监管机构似乎也注意到了这一动向。欧盟人工智能办公室的一位不愿透露姓名的政策顾问表示,Model 2 的披露模式给《人工智能法案》中的“通用模型透明度义务”提供了一个现实样本——“如果一家公司私下测试的系统明显比面向欧盟用户部署的模型更强大,那么在风险评估中应当以哪个为基准?”这问题目前无人能答。而美国联邦贸易委员会则可能更关注另一个角度:Anthropic 一边向企业客户销售限速的 Mythos 5 订阅,一边“悄悄”透露内部有更快的模型,这是否构成某种间接的不公平商业行为?

最后需要指出的是,Model 2 在部分涉及开放域幻觉的评测上表现并不完美,仍会犯在逻辑链长于 8 步时出现微小错误。Anthropic 在备忘录中专门用两页篇幅描述了这些限制,这既是对透明度的诚意,也是为了避免过度承诺。无论 Model 2 最终是否面世,这次披露都标志着一个新的行业常态:最强的 AI 不一定在你所使用的那一个,而所有人都在向同一个终极问题靠近——当一个模型比其他所有已知模型都聪明时,我们还能把它称作“工具”吗?

Aiii人工智能创研院(Aiii.org.cn)精选文章《Anthropic新模型略超最强Claude》文中所述为作者独立观点,不代表Aiii人工智能创研院立场。如有侵权请联系删除。如若转载请注明出处:https://www.aiii.org.cn/1070.html

(25)
打赏 微信公众号 微信公众号 微信小助理 微信小助理
海内外大模型竞速商业化 恒生科技ETF成布局AI产业新通道
上一篇 6天前
消息称OpenAI首席财务官告知员工:公司最迟将于2027年上市
下一篇 2天前

相关推荐

发表回复

登录后才能评论
小编
分享本页
返回顶部