新闻速览
Anthropic于2026年9月27日发布新一代旗舰模型Claude Opus 4.5,推理成本较前代下降45%,在复杂代码生成与多步数学推理任务中性能提升显著。该模型通过混合推理架构实现成本与能力的平衡,标志着头部AI实验室在推理效率竞赛中进入新阶段。本文梳理发布细节、技术背景与行业影响,并给出刘工的分析判断。
事件详情
2026年9月27日,Anthropic正式发布Claude Opus 4.5,这是其Opus系列旗舰模型的第四代产品。该模型在SWE-bench Verified基准上取得78.2%的通过率,较前代Claude Opus 4.1的71.5%提升6.7个百分点;在AIME 2026数学竞赛测试中准确率达到92.4%,前代为88.1%。Anthropic官方公布,Opus 4.5的每百万token推理成本为12美元,较Opus 4.1的21.8美元下降45%。模型上下文窗口保持200万token,支持128K输出长度。发布当日,Anthropic同步开放API访问,并更新了Claude.ai网页端与移动端应用。Anthropic联合创始人兼CEO Dario Amodei在发布声明中表示,Opus 4.5通过动态推理分配机制,在简单任务上自动缩短推理链,在复杂任务上延长推理深度,从而在保持性能的同时显著降低计算开销。该模型已集成至Anthropic的Claude Code编程助手,并支持AWS Bedrock与Google Vertex AI平台部署。
背景
此次发布发生在AI推理成本竞争白热化的背景下。2025年以来,OpenAI、Google与Anthropic相继推出多款推理增强模型,但推理链长度增加带来的算力成本成为行业共同痛点。OpenAI的o3模型在2025年发布时因高推理成本引发开发者社区讨论,Google的Gemini 2.5 Pro则通过混合推理模式探索成本优化路径。Anthropic此前在2026年3月发布的Claude Opus 4.1已引入初步的动态推理机制,但当时仅支持固定深度推理链。此次Opus 4.5将动态推理分配扩展至全模型层,并优化了注意力机制中的稀疏计算模块。市场层面,企业客户对AI编程助手与数据分析工具的需求持续增长,但成本敏感度同步上升。Anthropic在2026年第二季度财报中披露,其企业API调用量同比增长210%,但客户对单位推理成本的关注度成为续约谈判中的核心议题。
深度解读
刘工认为,Claude Opus 4.5的核心突破在于将推理深度从固定参数变为可学习策略。此前行业主流做法是让模型在推理时始终使用相同长度的思维链,而Opus 4.5通过训练一个轻量级路由网络,在输入阶段预判任务复杂度,并据此分配推理预算。这一设计在SWE-bench上的表现尤为关键:78.2%的通过率意味着在真实软件工程任务中,模型能够自主判断何时需要深入推理、何时可以快速作答。刘工注意到,Anthropic公开的基准测试显示,在简单代码补全任务上,Opus 4.5的平均推理token数较Opus 4.1减少62%,而在复杂架构设计任务上仅减少11%,这种非均匀优化正是成本下降45%的主要来源。刘工预测,动态推理分配将成为下一代基础模型的标配能力,OpenAI与Google大概率会在下一代产品中跟进类似架构。 刘工认为,45%的推理成本降幅将直接改变企业客户的采购决策。以一家中型软件公司为例,若每月调用量在10亿token级别,使用Opus 4.5较Opus 4.1每月可节省约98万美元推理费用。这一数字在年化层面接近1200万美元,足以影响企业选择哪家模型供应商。刘工对比了OpenAI的o3与Google的Gemini 2.5 Pro:o3的每百万token推理成本为18美元,Gemini 2.5 Pro为15美元,Opus 4.5的12美元在头部模型中处于最低水平。刘工认为,Anthropic此举意在抢占企业级推理市场,尤其是编程助手与数据分析两个高价值场景。但刘工也提醒,成本下降可能引发价格战,压缩整个行业的利润率,中小型AI应用开发商将从中受益,而模型供应商的毛利率承压。
数据与对比
- 与上一代Claude Opus 4.1相比,Opus 4.5的推理成本从每百万token 21.8美元降至12美元,降幅45%;SWE-bench Verified通过率从71.5%提升至78.2%,提升6.7个百分点;AIME 2026数学竞赛准确率从88.1%提升至92.4%,提升4.3个百分点。与竞品对比:OpenAI o3每百万token推理成本为18美元,Google Gemini 2.5 Pro为15美元,Opus 4.5的12美元为三者最低。在简单任务上,Opus 4.5的平均推理token数较前代减少62%,复杂任务上仅减少11%。
影响与展望
对行业而言,短期(3个月)内,Anthropic的定价策略将迫使OpenAI与Google重新评估其推理模型定价,可能引发新一轮降价潮。中期(1年)看,动态推理分配架构将成为行业标准,模型供应商的竞争焦点将从纯性能指标转向单位成本性能比。对普通用户而言,短期(3个月)内,Claude.ai订阅用户将获得更快的响应速度与更低的用量消耗,月费不变的情况下可用量增加。中期(1年)看,AI编程助手与数据分析工具的价格可能下调,中小企业与个人开发者将能以更低成本使用高级推理能力,但模型供应商的利润空间将被压缩,行业可能加速整合。
延伸思考
延伸思考
- 动态推理分配架构是否会成为下一代基础模型的行业标准?
- 推理成本下降45%对AI编程助手市场的定价策略将产生何种连锁反应?
- Anthropic在成本优化上的领先能否转化为企业市场份额的实质性增长?
来源与原文
本条动态来自 TechCrunch AI(发布于 2026-09-27 16:30:00)。本站为海外 AI 动态的中文转述与观点评论,原文版权归原作者所有。
每日聚合海外 AI 一手动态与深度观点。收藏本站,不错过每一个重要信号;返回首页查看更多。
