至知研究院|提出SWD稀疏权重分解:机制可解释性新路线

PromptTree|阅读 0
2026/08/16 22:38
至知研究院SWD机制可解释性稀疏分解
至知创新研究院等提出SWD:直接分解预训练稠密权重为稀疏因子以抽取可干预回路,匹配保真度时数据成本不到训练型基线的百分之一,并在GPT-2至Qwen3.5-27B上验证;代码与权重已开源。

想打开大模型这个黑箱,过去常常要先再训一个小黑箱——至知这条路线的野心,是直接把现成权重拆成可拔可插的路径。

至知创新研究院(IQuest Research)是面向安全与可验证AI方向的研究机构,此次与Safe AI Forum、牛津大学、斯坦福大学、清华大学等合作者共同提出稀疏权重分解(Sparse Weight Decomposition,SWD)。机制可解释性要回答的问题很朴素:模型内部哪几条计算路径真正支撑某一任务。所谓任务回路,白话是一组「保留则能力还在、移除则能力塌」的内部单元;所谓Transcoder一类训练型替代表示,白话是先学一套新的稀疏特征,再在这套新单元上做干预——有效,但贵,而且可能解释的是替代误差,而不完全是原模型。

SWD的核心做法是:把预训练稠密权重矩阵分解为两个稀疏因子,二者共享的中间维度成为可独立评分、选择与消融的瓶颈单元,从而不必再训练独立替代网络。论文《Sparse Weight Decomposition for Efficient Circuit Extraction》(arXiv:2608.03913)给出可核验结果:在匹配替换保真度的单矩阵实验中,SWD使用的数据不到Transcoder等训练型基线的百分之一;在GPT-2、Qwen2.5与Qwen3.5-27B的任务回路实验中,通常以更少的瓶颈单元和活跃连接达到相同充分性、必要性目标;还可覆盖GPT-2 Small全部四十八个注意力与MLP权重矩阵,并提供无需校准文本的zero-data版本。代码与权重分别公开于GitHub(Veri-Safe/SWD)与Hugging Face(veri-safe/SWD)。

方法侧可拆开验收的几点:

  1. 干预表面:瓶颈单元像稀疏特征一样可归因、可排序、可消融,但直接长在原权重分解上。
  2. 数据成本:匹配保真度时,校准数据量显著低于训练型替代模块。
  3. 规模台阶:从GPT-2单矩阵扩到Qwen3.5-27B,并尝试全模型注意力/MLP替换后微调非零值。
  4. zero-data变体:完全不依赖校准文本时,仍可抽出有效回路,便于按checkpoint追踪。

可以把它想成:在一张密密麻麻的交通网里加一批「中转站」——每个站只连少量入口与出口,研究者既能看见读写方向,也能单独关掉某一站看车流怎么变。相对奇异值分解(SVD)一类稠密成分,SWD强调每个单元自身读写连接也要稀疏,否则「单元少」并不等于「路径少」。

对安全与对齐团队,更低数据成本意味着可以更频繁地按训练阶段做回路审计;对开源模型方,则提供了一种不必牺牲原模型保真度就能做因果干预的表面。产业层面,可解释性正在从「另训字典」转向「重组已有权重」——这更像运维动作,而不是一次性科研表演。

需要把边界读清楚。论文结果以作者实验设置为准,跨模型族与跨任务泛化仍待社区复现;「可干预」不等于「已解释清楚全部能力」。下一观察点是SWD在更大MoE模型与真实安全红队任务上的可迁移性——拆得开,还要在对抗场景里站得住。