想打开大模型这个黑箱,过去常常要先再训一个小黑箱——至知这条路线的野心,是直接把现成权重拆成可拔可插的路径。
至知创新研究院(IQuest Research)是面向安全与可验证AI方向的研究机构,此次与Safe AI Forum、牛津大学、斯坦福大学、清华大学等合作者共同提出稀疏权重分解(Sparse Weight Decomposition,SWD)。机制可解释性要回答的问题很朴素:模型内部哪几条计算路径真正支撑某一任务。所谓任务回路,白话是一组「保留则能力还在、移除则能力塌」的内部单元;所谓Transcoder一类训练型替代表示,白话是先学一套新的稀疏特征,再在这套新单元上做干预——有效,但贵,而且可能解释的是替代误差,而不完全是原模型。
SWD的核心做法是:把预训练稠密权重矩阵分解为两个稀疏因子,二者共享的中间维度成为可独立评分、选择与消融的瓶颈单元,从而不必再训练独立替代网络。论文《Sparse Weight Decomposition for Efficient Circuit Extraction》(arXiv:2608.03913)给出可核验结果:在匹配替换保真度的单矩阵实验中,SWD使用的数据不到Transcoder等训练型基线的百分之一;在GPT-2、Qwen2.5与Qwen3.5-27B的任务回路实验中,通常以更少的瓶颈单元和活跃连接达到相同充分性、必要性目标;还可覆盖GPT-2 Small全部四十八个注意力与MLP权重矩阵,并提供无需校准文本的zero-data版本。代码与权重分别公开于GitHub(Veri-Safe/SWD)与Hugging Face(veri-safe/SWD)。
方法侧可拆开验收的几点:
可以把它想成:在一张密密麻麻的交通网里加一批「中转站」——每个站只连少量入口与出口,研究者既能看见读写方向,也能单独关掉某一站看车流怎么变。相对奇异值分解(SVD)一类稠密成分,SWD强调每个单元自身读写连接也要稀疏,否则「单元少」并不等于「路径少」。
对安全与对齐团队,更低数据成本意味着可以更频繁地按训练阶段做回路审计;对开源模型方,则提供了一种不必牺牲原模型保真度就能做因果干预的表面。产业层面,可解释性正在从「另训字典」转向「重组已有权重」——这更像运维动作,而不是一次性科研表演。
需要把边界读清楚。论文结果以作者实验设置为准,跨模型族与跨任务泛化仍待社区复现;「可干预」不等于「已解释清楚全部能力」。下一观察点是SWD在更大MoE模型与真实安全红队任务上的可迁移性——拆得开,还要在对抗场景里站得住。