大模型产业|价格战进入下半场,推理芯片成核心成本战场

PromptTree|阅读 1
2026/07/25 17:50
推理芯片DeepSeek阿里云昇腾寒武纪
中国大模型产业进入推理侧成本竞争:DeepSeek自研推理芯片项目已启动一年,目标再压低一个数量级成本。阿里云首席技术官周靖人称,推理预算约60%用于自研推理芯片与定制加速卡。

训练侧的参数竞赛告一段落之后,更咬牙的账单转到了推理。每一次用户提问,都在消耗芯片时间。

2026年,中国大模型产业被描述为从「训练侧参数竞赛」进入「推理侧成本战争」。推理指模型已经训练完、对外提供服务时的计算。用户越多、每个会话越长,这部分成本越像水电。DeepSeek创始人梁文锋在投资人会议上披露,自研人工智能推理芯片的项目已经秘密进行一年,目标是把推理成本再压低一个数量级。阿里云首席技术官周靖人在世界人工智能大会分论坛上说,大模型推理预算中约60%已经用于自研推理芯片和定制加速卡。

逻辑写得很直。模型架构相对成熟之后,训练成本更可预期。应用规模化却让推理需求膨胀。QuestMobile的数据显示,2026年上半年国产人工智能应用的日均调用量较年初约增8倍,日均token消耗增长超过12倍。token是计费和计量单位。调用次数涨8倍、消耗涨超过12倍,说明单次会话也在变长,而不只是多了几个新用户。

国际侧,英伟达的H200、B200和Rubin仍主导高性能推理。Groq、Cerebras、SambaNova等把公司重心放在推理的厂商也在崛起。国内侧,华为昇腾、寒武纪MLU、海光DCU、阿里平头哥、燧原、沐曦、摩尔线程都在加速布局。名字多,说明没有一家已经把推理侧完全锁死,也说明云厂商在同时试芯片和试价格。

谁握有更低单位成本的推理算力,谁就更可能在应用爆发期保住价格。DeepSeek要的是再低一个数量级,阿里云则把预算的约六成押在自研和定制卡上。两条路都还没到「芯片已经替代外部供应」的完成时。接下来要核对的是:秘密项目一年之后,有没有可部署的芯片;以及60%的预算,有没有换成可计量的单位推理成本下降。

再压低一个数量级,指的是成本降到大约现在的十分之一,不是再降几个百分点。DeepSeek把目标绑在已经秘密进行一年的自研推理芯片上。阿里云则把推理预算的约60%放进自研芯片和定制加速卡。一条是模型公司自己做卡,一条是云厂商掌握供给,都还没到替代外部芯片的完成时。

英伟达H200、B200、Rubin仍是高性能推理的参照,Groq、Cerebras、SambaNova把公司重心放在推理。国内昇腾、寒武纪、海光、平头哥、燧原、沐曦、摩尔线程同时在试。调用量较年初约增8倍、token消耗增超过12倍的时候,谁的单位成本接不住,价格战的下半场就只剩下涨价。