国产代码智能体在国际评测上拿下一个硬核第一。联想天禧AI自主研发的专业代码智能体框架TianxiCode,在SWE-bench-Live评测的Lite分榜中以71%的问题解决率登顶全球第一,成绩已通过官方审核。值得注意的是,取得这一成绩的模型组合是TianxiCode框架搭配开源模型DeepSeek-V4.1-Flash,而非闭源旗舰。
先交代评测本身的分量。SWE-bench系列是软件工程评测中被公认难度最高的基准之一,任务来自真实开源仓库的问题单,要求智能体读懂代码库、定位缺陷、写出能通过测试的补丁,与「代码补全」这种轻量任务完全是两个量级。Live版本的任务池持续更新,避免模型在静态题目上过拟合刷分,因此被业内视为最贴近真实开发环境的代码智能体试金石。
再看主角。TianxiCode出自联想天禧AI,后者是联想面向个人用户的超级智能体品牌,2026年5月的联想创新科技大会上正式发布,采用端云混合架构——敏感数据留在端侧处理,重任务上云调用大算力,隐私安全是这套体系反复强调的底线。此次登顶说明联想在Agent工程层有实打实的自研投入:任务分解、代码定位、多轮修复验证这些编排能力,恰恰是框架层最值钱的部分。
组合方式同样值得琢磨。用DeepSeek-V4.1-Flash这样主打性价比的开源模型做底座拿下第一,说明在天禧的框架编排下,模型能力可以被更高效地调度出来。这套「自研框架+开源模型」的组合拳,对端侧厂商是一条务实的路线:不追求模型军备竞赛,而是把工程能力护城河垒在评测和产品之间。
对联想而言,这个第一并非只是为了榜单。AI PC是天禧架构最重要的落地场景,代码智能体能力可以直接反哺开发者的本地编程助手、办公自动化和企业IT运维等场景。当个人智能体越来越多地承接「替用户干活」的任务,软件工程能力就是其中门槛最高、价值最大的一类。
把视角拉高一些:过去代码智能体榜单长期由海外实验室和头部大厂轮替坐庄,国内团队多在追赶。此次国产框架配国产开源模型登顶,至少证明在Agent编排这个层面,国内工程团队已经站进了第一梯队。下一关是真机考验——SWE-bench-Live之外,真实企业代码库里的脏活累活,才是框架能力的终极考场。