高端GPU买不到、买不起时,竞争会从「谁拿到顶配卡」转向「谁把手里的卡用满」。是石科技把这条路写成一套可复述的软件方法论:Meta-Infer。
是石科技定位为独立第三方全栈算力运营商,称纳管超20000P算力、运营十余个智算中心,并强调不绑定特定大模型厂商。公司披露自研Meta-Infer面向异构加速芯片的企业级推理引擎,目标是在不改动模型结构与任务语义的前提下,弥合「框架默认路径」与「长尾硬件真实能力」之间的缝隙。公开叙述把优化收成四项:内核补齐、算子优化与通信重构、并行与容量调优、缓存复用。
以DeepSeek-V4.1-Flash为例:8张PCIe-Only显卡的社区Day0基线输入吞吐约1932 tok/s;算模协同阶段补齐sparse-MLA Prefill快路径、替换FP8稠密GEMM慢内核、扩大PCIe-IPC通信快路径后,吞吐升至约5850 tok/s;再经注意力融合、投机解码草稿裁剪、计算通信重叠、Prefill/Decode差异化并行与显存参数重校,进一步到约13274 tok/s,整体约6.87倍,并支持1M超长上下文。同方法论下,DeepSeek-V4-Flash输入吞吐由约14546升至约22584 tok/s(约1.55倍);GLM5.3由约3236.78升至约6222.72 tok/s(约1.92倍),P95首Token时延由约141.6秒降至约46.6秒,上下文上限由约27万Token拓展到约105万Token。MiniMax H3视频生成相关口径则给出端到端加速与整机吞吐相对B300的折算对照,强调软件栈与缓存策略可显著缩小「同任务、不同硬件」的体感差距。
机制上,长尾硬件常因元数据、页尺寸或不在官方验证矩阵,被框架静默降级到低效通用实现;PCIe带宽远低于NVLink时,若照搬高速互联默认通信策略,GPU会长时间空等。Meta-Infer的叙事是:先解锁本该触发的快路径,再按带宽重写通信与并行,最后用缓存复用砍掉重复计算。公司称国产GPU上也做了路径适配,例如显式启用平台优化的稀疏注意力、关闭不适配的Shared Expert融合,并把Shared Expert与Routed Expert并行提交,在公开配对测试中带来约11.26%吞吐提升。
对推理业务,这意味着「能跑起来」只是起点;对采购决策,PCIe与国产卡的性价比评估必须把软件栈算进去。数字来自公司披露的压测口径,生产环境仍需对照模型版本、并发点、量化方式与SLA。观察点包括:优化是否沉淀为可交付产品、客户侧是否形成可核验案例,以及开源社区默认路径能否吸收同类适配经验。