趋境科技×摩尔线程|国产PD异构Token工厂进入生产环境

PromptTree|阅读 4
2026/09/05 08:14
趋境科技摩尔线程PD异构AI Token
9月3日趋境科技与摩尔线程签署战略合作,以国产PD异构技术融合MTT S5000与MUSA,推进ATaaS高品质AI Token工厂并以Token Pod交付。方案已承接头部模型厂商真实流量;公开口径含约50 TPS以上生成、超约90% KV命中、约99.9%稳定性。

大模型应用一旦进入规模化,基础设施竞争就会从「单卡跑不跑得动」滑向「每一枚高品质Token的生产成本」。9月3日,趋境科技与摩尔线程签署战略合作协议:以趋境自研国产PD异构技术,深度融合摩尔线程MTT S5000智算卡与MUSA软件平台,共同推进基于ATaaS平台的国产化高品质AI Token工厂,并以Token Pod(Token超节点)作为联合交付载体。

趋境科技聚焦推理系统与Token生产运营,公开强调「少模型、深优化」——围绕有明确规模化需求的重点模型,把芯片、推理引擎与真实负载一起打磨。摩尔线程是国产GPU与MUSA软件栈厂商,MTT S5000面向智算场景,强调高密度算力、原生FP8与生态适配。签约现场公开出席名单包括趋境创始人兼CEO艾智远、首席科学家武永卫,以及摩尔线程创始人、董事长兼CEO张建中等。

方案与生产口径:

  1. 分治:MTT S5000负责Prefill阶段输入计算与KV Cache生成,再与承担Decode的高带宽GPU协同
  2. 资源池:Prefill可独立供给、独立计费、独立优化,减少按单阶段峰值配置整套集群的浪费
  3. 性价比:同等生产服务标准下,由约4至5台MTT S5000组成的Prefill资源池,输入Token处理性价比公开称超过国际先进算力方案
  4. 生产指标:平均超过约50 TPS生成速度、超约90%的KV Cache命中率、约99.9%稳定性,并给出生产级低首Token时延(TTFT)保障
  5. 业务:相关方案已投入生产,承接头部模型厂商官方业务的真实Token流量

所谓PD异构,白话是把「读懂长上下文、写好KV」和「一个个吐字」拆到不同算力池,用更合适的卡干更合适的活;所谓AI Token工厂,白话是按服务等级协议持续、稳定地「生产」可计费推理输出,而不是实验室跑通一次Demo。对采购方,验收应从单卡基准转向端到端时延、命中率、稳定性与单位Token成本。

放在国产算力上下文里,长期叙事偏「能不能训起来」;推理侧一旦日均走到千亿、万亿Token,真正卡脖子的是Prefill成本与混部运维。趋境公开称截至2026年8月已完成日均万亿级高品质Token生产项目共建,并在多个项目形成日均千亿级生产能力——这为Token Pod标准化复制提供了项目土壤。双方拟把模型适配、跨设备协同与运营经验沉淀进Token Pod,形成可按业务扩展的生产单元。

产业影响上,若PD异构混推成为政企与模型厂默认路径,国产GPU进入生产环境的门槛会从「替代整卡」变成「先吃Prefill」。需要把边界读清楚:性价比与TPS等为合作双方公开口径,不同模型与负载不可直接外推;「超越国际先进」是在既定服务标准下的对照表述。下一观察点是Token Pod标准化交付节奏,以及更多头部流量是否持续迁入。