一款主打性价比的推理模型,突然在抽象推理这块「硬骨头」上刷出新高,业内更关心的其实是它到底多花了多少算力。
DeepSeek V4.1 Flash是深度求索于9月29日发布的Flash系列更新,官方定位「更聪明、更快、更省」。10月6日,独立评测机构ARC Prize在其官方成绩页公布了这款模型在ARC-AGI基准上的表现。ARC-AGI(Abstraction and Reasoning Corpus,抽象与推理语料)由François Chollet等人设计,专门考察模型面对「从未见过」的小型图案规律时,能否像人一样举一反三,被广泛视作衡量通用抽象推理能力、而非记忆刷题能力的标尺。
成绩与对比: 公开数据显示,DeepSeek V4.1 Flash在ARC-AGI-2上得72.9%,在ARC-AGI-1上得94.5%。作为对照,上一代V4 Flash(0731版)此前在同一评测上的最佳成绩约为61.4%(ARC-AGI-2)与89.0%(ARC-AGI-1)。也就是说,新一代在两道「试卷」上分别提升了约11.5个和5.5个百分点,进步幅度可观。
成本账: 提升并非免费。ARC Prize口径显示,V4.1 Flash每任务平均成本比V4 Flash高出约250%。更耐人寻味的是分档表现——在ARC-AGI-1上,high档得88.5%,反而低于low档的90.5%。这提示在抽象推理这类任务上,「推理档位越高分越高」并不总是成立,采购方按难度分档调度、而非一味拉满,可能更划算。
背景与含义: 抽象推理一直是推理模型与通用大模型的分水岭之一。V4.1 Flash以Flash级(轻量、低延迟)定位却逼近更高的ARC分数,说明国产模型在「少样本规律归纳」这条能力线上持续爬坡;而成本上涨250%的代价,则把「推理时间与算力预算」重新摆回开发者的桌面上。对产业观察者,这条消息的价值不在名次,而在它把一个现实问题说清楚了:更强的推理,正在被更精确地定价。
事实以ARC Prize官方成绩页与DeepSeek官方发布说明为准。