Anthropic Claude Opus 4.8全球上线:SWE-Bench Pro 69.2%+"dynamic workflows"数百微数字代理并行+100万token默认上下文

PromptTree|阅读 0
2026/07/11 09:47
AnthropicClaude智能体软件工程
Anthropic发布Claude Opus 4.8,SWE-Bench Pro得分69.2%,可在Claude Code中并行调度数百个微代理。默认上下文100万token,定价层级与前代相同。Background Tasks扩展到移动端,并推出可回看历史使用的Claude Reflect测试版。

旗舰模型再抬一档,抬的是能自己做完的软件任务。7月11日,Anthropic发布Claude Opus 4.8。

Anthropic做Claude系列。4.8的定位是复杂、周期长的软件工程和智能体流程,重点在更少的人工盯守,以及更少把错代码当成通过。智能体流程,白话就是模型自己拆任务、调用工具、检查结果,而不是每一步都等用户按回车。

公开的能力点:

  1. dynamic workflows:在Claude Code里部署数百个微代理并行处理,把大代码库拆开,验证后再合并输出。
  2. 静默错误下降:有缺陷的代码被当成通过的可能性,比前代低约4倍。
  3. SWE-Bench Pro得分69.2%,跨领域推理同步提升。这项基准考的是真实软件任务能不能做完。
  4. effort control:用户可以调推理深度。难的任务加深,要低延迟的任务放浅,用来省API额度。
  5. 默认上下文100万token,定价层级与前代相同。token是上下文和计费的单位,100万意味着长代码库更不容易被截断。

同一天,Background Tasks扩展到手机。用户在网页或移动端安排长时间任务,后端跑完后用推送通知决策点或结果,不必一直开着连接,桌面和手机可以同步。7月9日还发布了测试版Claude Reflect,四个维度是任务委派、目标描述、结果辨别、责任审慎,可以回看过去1、3、6、12个月的聊天并生成使用总结。

原文把这三件套写成一条不同的路线:相对OpenAI的产品矩阵和企业集成,Anthropic强调可审计、可解释、可控制。背景里提到J-lens论文揭示Claude内部存在“全局工作空间”。论文细节原文没有展开,不能把4.8说成已经把这篇论文变成产品开关。

100万token做成默认上下文,而且定价层级与前代相同,长上下文就不是单独加价项。effort control让用户在加深推理和节省额度之间切换。Background Tasks把长任务从必须开着电脑,变成做完再通知,桌面和移动端可以同步。Reflect仍是测试版,回看的是过去1、3、6、12个月的使用总结,不是一款新的旗舰模型。69.2%只说明SWE-Bench Pro这一项。

69.2%是一项基准的分数,不是所有仓库的成功率。数百个微代理是能力描述。下一步看企业客户是否真的把长任务放到手机通知里跑完,以及静默错误“低约4倍”有没有独立复测。