Anthropic补上的是一档更讲性价比的旗舰:编码更强,更能自己把任务做完,价格大约是上一档旗舰的一半。
Anthropic是美国人工智能公司,Claude是它的模型系列。7月24日发布的Claude Opus 5,在编码、智能体自主性和长程任务上被描述为显著提升。Frontier-Bench的编码能力排名第一。自主任务的执行时长突破8小时。定价为输入3美元、输出15美元,均按每百万tokens计算,约为Fable 5的一半。Cursor、Cognition、Replit等编程工具宣布接入。
产品矩阵因此更完整。从高到低大致是:Fable 5作为旗舰,Opus 5作为高性能又更便宜的一档,Opus 4.8作为成熟稳定版本,Sonnet 5作为极致性价比,Haiku 5作为超低成本。覆盖从企业高端到个人开发者。名字多,买的时候要比的是任务长度和价格,不是名字本身。
两组成绩被单独写出。在SWE-Bench Pro上,Opus 5自主完成约69.2%的任务。SWE-Bench一类评测,看的是模型能否在真实代码仓库里修好问题。在HumanEval-X的长程测试中,它可以独立处理8小时以上的连续任务。Salesforce、Notion和Slack已宣布把它作为人工智能智能体的核心引擎之一。智能体在这里指能自己拆任务、调用工具并连续执行的系统。
面对Kimi K3和GPT-5.6 Sol的夹击,Opus 5被放在「性能接近旗舰、价格腰斩」的位置,用来填中小开发者的空白。编程工具市场因此可能再洗一轮:接入名单里的Cursor、Cognition和Replit,会把默认模型从旧档换成这一档,用户账单和完成率会一起变化。要看的是69.2%和8小时能否在这些工具的真实工单里复现,而不是只停在发布当天的榜单。
输入3美元、输出15美元每百万tokens,约为Fable 5的一半。这个价格对准要编码、又付不起旗舰满价的团队。Cursor、Cognition、Replit宣布接入,默认模型会在工具里被换掉,用户不一定自己到模型官网下单。矩阵里还有Opus 4.8、Sonnet 5和Haiku 5,买的时候要比任务长度,不是比名字。
SWE-Bench Pro约69.2%,看的是能否在代码仓库里修好问题。超过8小时的连续任务,看的是会不会中途停住。Salesforce、Notion和Slack把它放进智能体引擎,更在意第二条能不能进办公流。面对Kimi K3和GPT-5.6 Sol,这一档填的是中小开发者的价格带。