专用推理芯片IPO热闹时,有人坚持:企业机架里的H200与MI300X,还远没被软件挖透。
Kog是法国AI推理创业公司,创始人兼CEO为Gaël Delalleau,团队规模公开口径约11人,获Varsity VC等支持,并有欧洲算力与深科技政策语境下的叙事。所谓推理(inference),白话是模型训练完成后,真正回答用户、跑Agent时的那一段计算;速度与成本正在成为Agent能否进生产的瓶颈。行业一条路是买专用推理芯片,另一条路是在现有GPU上用编译、内核与调度把带宽吃干——Kog押后一条,而且强调「单请求」解码,而不是只靠超大batch刷平均吞吐。
据TechCrunch报道,Kog主张通过更深的GPU层软件优化,在企业已有的标准数据中心GPU上提升单请求解码速度。公开技术预览曾演示约3000 tokens/秒量级的单请求吞吐,硬件口径包括AMD MI300X与Nvidia H200等;演示基于约20亿参数的定制小模型Laneformer 2B(现已开源)。公司叙事目标包含「约30倍更快LLM推理」,并称观察到客户还不准备微调小模型,因此转而把重点放在加速更大模型。Delalleau对TechCrunch称技术预览后获得约200条可跟进商机;早期场景指向软件工程Agent(长时间等待结果的用户)以及「一句话生成游戏/应用」类产品。计划口径是约9月前后拿出首个约10倍加速的大模型实现,再以此推进客户牵引与A轮叙事。
把承诺与已演示拆开,避免海报吞掉验收:
对采购方,这是「买新芯片」之外的软件路径选项,但合同验收必须写清:加速比在哪个模型、哪个GPU、单请求还是吞吐均值、以及尾延迟。对欧洲深科技,主权算力叙事与盘活存量GPU资产可以同框,但若大模型演示延期,种子轮故事会快速折价。对Agent产品经理,则提醒一个产品事实:用户愿意为「快」付费(Anthropic等已对Fast Mode溢价),延迟本身就是功能。
需要把边界读清楚。3000 tokens/秒与30倍、10倍均为公司演示或目标口径,外部复现与旗舰模型结果仍待验证;融资时间表属创始人展望。下一观察点是约10倍大模型演示是否按时出现,以及与CUDA生态、竞品推理引擎的对照实验——小模型三千TPS好写,旗舰稳速才算数。