↑

DeepSeek|V4.1 Flash公布ARC-AGI成绩,抽象推理再上台阶

PromptTree|阅读 0
2026/10/08 08:35
DeepSeekV4.1 FlashARC-AGI抽象推理推理模型
ARC Prize于10月6日公布DeepSeek V4.1 Flash在ARC-AGI基准上的成绩:ARC-AGI-2得72.9%、ARC-AGI-1得94.5%,均较V4 Flash显著提升,但每任务成本相应上涨约250%。

一款主打性价比的推理模型,突然在抽象推理这块「硬骨头」上刷出新高,业内更关心的其实是它到底多花了多少算力。

DeepSeek V4.1 Flash是深度求索于9月29日发布的Flash系列更新,官方定位「更聪明、更快、更省」。10月6日,独立评测机构ARC Prize在其官方成绩页公布了这款模型在ARC-AGI基准上的表现。ARC-AGI(Abstraction and Reasoning Corpus,抽象与推理语料)由François Chollet等人设计,专门考察模型面对「从未见过」的小型图案规律时,能否像人一样举一反三,被广泛视作衡量通用抽象推理能力、而非记忆刷题能力的标尺。

成绩与对比: 公开数据显示,DeepSeek V4.1 Flash在ARC-AGI-2上得72.9%,在ARC-AGI-1上得94.5%。作为对照,上一代V4 Flash(0731版)此前在同一评测上的最佳成绩约为61.4%(ARC-AGI-2)与89.0%(ARC-AGI-1)。也就是说,新一代在两道「试卷」上分别提升了约11.5个和5.5个百分点,进步幅度可观。

成本账: 提升并非免费。ARC Prize口径显示,V4.1 Flash每任务平均成本比V4 Flash高出约250%。更耐人寻味的是分档表现——在ARC-AGI-1上,high档得88.5%,反而低于low档的90.5%。这提示在抽象推理这类任务上,「推理档位越高分越高」并不总是成立,采购方按难度分档调度、而非一味拉满,可能更划算。

背景与含义: 抽象推理一直是推理模型与通用大模型的分水岭之一。V4.1 Flash以Flash级(轻量、低延迟)定位却逼近更高的ARC分数,说明国产模型在「少样本规律归纳」这条能力线上持续爬坡;而成本上涨250%的代价,则把「推理时间与算力预算」重新摆回开发者的桌面上。对产业观察者,这条消息的价值不在名次,而在它把一个现实问题说清楚了:更强的推理,正在被更精确地定价。

事实以ARC Prize官方成绩页与DeepSeek官方发布说明为准。