DeepSeek造芯,不再只是传闻——论文里已经把需求写到了芯片层。
其一,V3.1论文"硬件设计建议"暗藏芯片需求。研究团队在论文中直接把需求写到了芯片层:"通信任务要从计算单元上卸载、张量核累加精度要更高、要支持更细粒度的量化"——这是一份"甲方需求书"。配套的V3.1引入UE8M0 FP8数据格式,被业内认为是专门为下一代国产芯片的硬件特性而设计,意味着DeepSeek早就有了自研芯片的打算。
其二,68%推理成本压力倒逼造芯。2026年产业测算显示,国内规模化大模型服务商68%年度算力开支集中在推理硬件采购,模型训练硬件投入占比仅32%。推理属于持续性摊销成本,长期累计投入数倍于一次性训练开支——用户越多,推理成本就像水电费一样吞噬利润。
其三,DeepSeek的真实负载是稀缺能力。其他芯片公司做芯片常常面临"芯片做出来了但不知道真实负载"的问题。DeepSeek模型每天服务数千万用户,每轮对话都是真实推理负载数据——用真实场景倒推芯片设计,本身就是稀缺能力。
消息传出后,英伟达盘前股价下跌约1.6%(对万亿市值巨头意味着上百亿美元蒸发)。Gartner报告显示英伟达整体AI加速芯片全球市占69%、高端训练GPU份额超80%,硬件采购成本持续传导。项目启动约一年,DeepSeek已与芯片设计公司、晶圆代工厂、存储企业展开接洽,团队通过行业内推定向招募芯片架构师和设计工程师、全程不公开。
同期OpenAI自研推理芯片Jalapeño已于6月24日发布(9个月创高性能ASIC最快开发记录),Meta Iris 9月量产,Anthropic接触三星评估2nm代工——全球顶级AI公司不约而同"甩开英伟达自己造芯片"。
FP8可以理解成用更少的比特装下一个数。显存和带宽省下来,精度就要靠硬件的累加和更细的量化补回来,所以论文才会把需求写到芯片层,而不是只改软件调度。UE8M0被放进V3.1,业内把它读成「先把数据格式写成下一代国产芯片能跑的样子」,这和事后适配现成GPU不是同一条路线。
读者也不该把「已与代工厂接洽」读成「芯片已经流片」。原文能核对的是方向、格式、约一年的接洽和不公开招募,没有给出流片节点。盘前股价波动计价的是预期。Gartner仍写出很高的全球份额,说明训练和高端卡在短期内没有因此易手。没有真实用户的设计,只能用基准程序去猜瓶颈;每天数千万轮对话会把通信和量化的卡点直接打在账单上。这是模型公司相对纯芯片公司的不对称,也是这篇论文被当成甲方需求书的原因。