旗舰模型再抬一档,抬的是能自己做完的软件任务。7月11日,Anthropic发布Claude Opus 4.8。
Anthropic做Claude系列。4.8的定位是复杂、周期长的软件工程和智能体流程,重点在更少的人工盯守,以及更少把错代码当成通过。智能体流程,白话就是模型自己拆任务、调用工具、检查结果,而不是每一步都等用户按回车。
公开的能力点:
同一天,Background Tasks扩展到手机。用户在网页或移动端安排长时间任务,后端跑完后用推送通知决策点或结果,不必一直开着连接,桌面和手机可以同步。7月9日还发布了测试版Claude Reflect,四个维度是任务委派、目标描述、结果辨别、责任审慎,可以回看过去1、3、6、12个月的聊天并生成使用总结。
原文把这三件套写成一条不同的路线:相对OpenAI的产品矩阵和企业集成,Anthropic强调可审计、可解释、可控制。背景里提到J-lens论文揭示Claude内部存在“全局工作空间”。论文细节原文没有展开,不能把4.8说成已经把这篇论文变成产品开关。
100万token做成默认上下文,而且定价层级与前代相同,长上下文就不是单独加价项。effort control让用户在加深推理和节省额度之间切换。Background Tasks把长任务从必须开着电脑,变成做完再通知,桌面和移动端可以同步。Reflect仍是测试版,回看的是过去1、3、6、12个月的使用总结,不是一款新的旗舰模型。69.2%只说明SWE-Bench Pro这一项。
69.2%是一项基准的分数,不是所有仓库的成功率。数百个微代理是能力描述。下一步看企业客户是否真的把长任务放到手机通知里跑完,以及静默错误“低约4倍”有没有独立复测。