大模型会写代码、会搜资料,但「读懂人心」一直缺一块硬工程——知境团队想把它做成可测、可训、可部署的能力,而不是停留在「看起来很懂你」的聊天体感。
发布主体是中国科学院计算技术研究所智能算法安全全国重点实验室「知境」团队。其定位很清楚:把社会心智(Social Mind)——也就是理解他人意图、情绪、关系与情境的能力——从模糊的人文议题,落成工程系统。对客服、教育、陪伴、协作型Agent来说,这几乎是下一道必考题。
7月24日,知境正式发布社会心智大模型技术体系,分评测、训练、部署三层推进。
评测侧: 推出SoMBench,拆解为3大一级维度、17个二级维度、71项细粒度任务与3481道专家评审实例。20个顶级大模型测试中,最强正确率仅72.08%,无一达到90%。换句话说,目前最强模型离「社会智能及格线」还有明显缺口。
训练侧: 以Zing模型体系搭配FLARE数据飞轮、两阶段训练与OPD在线蒸馏,目标是让模型持续吸收社会交互数据,而不是一次性刷完题库。
部署侧: 推出Actio架构,按需调用心理技能、心智记忆与社会知识——像给模型装上可切换的「情商工具箱」,而不是把所有能力糊进同一个黑盒。
成绩上,多模态Zing-27B五项综合均值79.80,超越GPT-5.5的78.44;文本Zing-32B均值76.32,略超DeepSeek-V4-Pro的75.90。数字本身不大惊小怪,但意义在于:在社会心智这条新尺子上,国产体系开始拿出可对照的公开成绩。更值得注意的是,现有顶级模型在SoMBench上最高也只到72.08%——说明「情商」并不是参数堆上去就自动出现的能力。
过去行业卷的是语言、推理与工具调用;下一步,谁能稳定理解「对方到底想要什么」,谁才更适合进入真人协作场景。客服转人工、教育陪伴、团队协作代理,都会先撞上社会智能这堵墙。知境把评测基准、训练飞轮和部署架构一起端出,等于给社会智能赛道立了一块路标。
接下来要看的是:SoMBench会不会被更多厂商跟测,Actio能否走进真实产品,以及社会心智能力会不会像工具调用一样,迅速变成Agent评测的标配项。