大模型榜单若只剩固定题库,很难回答一个更朴素的问题:写代码、做协作、答冷知识、跟工作流较劲时,到底谁更好用。实验室分数漂亮,不代表创作者真实场景里不翻车。9月16日,哔哩哔哩「AI无限竞技场」正式上线,并同步公布首期大模型测评榜单——把评测从题库,搬到UP主的真实工作流里。
哔哩哔哩是国内主要视频社区平台,近一年站内AI相关内容与讨论显著升温:评测、教程、吐槽与共建需求同步增长。「AI无限竞技场」被定位为汇集UP主大模型测评的竞技广场:不设统一命题限制,由来自不同分区的UP主以真实工作流、专业应用或趣味脑洞自主出题,在同题PK中直观呈现模型差异。
赛制与首期要点(平台公开口径):
所谓UP主实测竞技场,白话是把评测权部分交给会「真干活」的创作者,而不是只交给固定基准维护者。所谓榜首次数,白话是看「在多少个不同任务里被评为第一」,而不是只看某一个总分。对普通用户,这提供了比单一跑分更贴近使用的对照样本;对模型厂商,则意味着要同时应付代码、创作与协作等多类主观场景,而不能只卷某一榜单。
放在全球Arena/盲测与国内开放平台竞赛上下文里,B站选择用社区内容生产反哺评测集合,等于把「看视频选模型」产品化。竞品平台若只有官方分数墙、缺少可追看的实测视频与同题对照,说服力会弱一截;若只有段子式翻车切片、缺少可持续更新的榜单规则,也会沦为短时热搜。
产业影响上,若样本规模持续扩大且规则更透明,会成为用户侧选型的重要入口;若选题偏好过强、版本标注混乱,参考价值会被迅速质疑。需要把边界读清楚:UP主测评存在选题与偏好差异,不等于科学可复现基准;模型名与版本随时间快速迭代,榜单位次会波动。下一观察点是参赛测评样本量、规则文档是否公开可引用,以及厂商是否开始主动提供可复现的同题脚本。