多模态模型把高分辨率图像编成成百上千个视觉Token后,显存与KV Cache账单一起爆炸——紫东太初把答案写成「压的是消息,不是孤立图块」。
中国科学院自动化研究所紫东太初大模型团队长期做多模态大模型与高效推理。所谓视觉语言模型(VLM),白话就是既能看图又能答题的模型:图像先被切成大量视觉Token,再和文本一起送进解码器。每个Token都会占用计算,并长期占着提示KV Cache——分辨率越高、文档越长,冗余越贵。行业常见做法是Top-K:给每个Token打分,只留高分区域;问题是高分往往堆在同一显著区,文字、数字、坐标轴等分散证据容易被漏掉,低分Token一删细节也没了,于是出现「压缩必掉精度」。
针对这一卡点,团队提出核心集剪枝方法GMC(Grounded Message Coreset Pruning)。论文《Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression》(arXiv:2608.02134)把忠实压缩表述为:为解码器构造紧凑的「消息核心集」——因为文本查询消费的是全体视觉Token形成的集体消息,而不是彼此无关的图块。
方法拆成两段可核验机制:
GMC强调全程免训练、无额外OCR/检测器/辅助模型,可直接挂到Qwen、LLaVA等既有多模态模型。团队披露:在Qwen2.5-VL-7B上,完整模型约1296个视觉Token;减约80.2%仅留256个时,GMC-H2保留完整模型约97.78%平均能力;减约90.1%仅留128个时,GMC-L16仍约99.11%。在LLaVA-1.5-7B上,保留128或64个Token时平均性能接近完整模型。长文档场景下,面对约15876个原始视觉Token的输入,公开口径称在保持约98.87%问答质量时实现约1.258倍端到端加速,并减少约73.94%提示KV Cache;幻觉相关基准上亦称在相同Token预算下事实一致性更好。上述为论文与团队自测,外部复现仍待社区验证。
把GMC放进多模态部署坐标:产业真正缺的不是又一张「压缩率海报」,而是压缩后事实一致性是否还站得住。若「去冗余≈去噪」成立,高分辨率长文档与端侧部署的成本曲线会重写。下一观察点是开源实现与跨模型复现是否跟上——少Token不难,难的是少了还不瞎。