斯坦福把尺子量完,中美顶级模型的性能差距收成2.7%,中国模型的调用量则已经走到美国前面。
这份《AI Index Report 2026》于7月25日发布。报告显示,2026年中美顶级人工智能模型的性能差距缩至2.7%,低于2023年的15.2%、2024年的9.8%和2025年的5.4%。差距缩小是连年趋势,不是单年跳跃。2.7%是顶级模型之间的性能差,不是两国所有产品的平均差。
调用和下载是另外两本账。OpenRouter上,中国人工智能模型的token调用量达到36.11万亿次,美国模型为7.13万亿次,前者约为后者的5倍以上。OpenRouter是把多家模型接口放在一起供开发者调用的平台。Hugging Face上,中国模型下载量占比41%,美国为38%,中国一侧第一次超过美国。Hugging Face是模型权重的主要分享平台。下载多,说明开发者在拿权重;调用多,说明线上请求在跑。
能力追平被点到具体名字。Kimi K3、Qwen3.8-Max、智谱GLM-5.2、DeepSeek V4等,已在多项国际基准上追平甚至领先。Qwen系列长期位居全球开发者下载前列。应用规模上,中国日均token调用领先,背后是十亿级用户,电商、社交和支付等场景,以及极低的接口价格。DeepSeek V4 Pro的输出价格约为美国同类的十七分之一。
开源话语权被单独写成一条。中国开源模型下载占比首次超过美国,Qwen、DeepSeek、Kimi、GLM成为全球开发者的重要选项。报告也指出短板:顶级研究人才数量、基础研究的原创突破、算力基建规模,仍与美国有差距。对华人工智能芯片出口管制还在,硬件底座的压力没有随榜单差距缩小而消失。
三本账要分开读。性能差2.7%,说的是最强模型贴得很近。调用量领先,说的是使用规模。下载占比,说的是开源权重的传播。人才、原创和算力仍被报告写成美国保持部分领先的地方。下一份指数若只重复2.7%,信息量就不大;要看的是调用量领先能否换成收入,以及芯片限制会不会重新拉开训练侧的差距。