随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉 Token。大量 Token 持续参与解码计算、长期占用 KV Cache,带来显存开销大、推理速度慢、部署成本高等一系列问题,视觉 Token 冗余已成为多模态模型高效推理与规模化落地的核心瓶颈。
当前行业通用方案为传统 Top-K Token 筛选:对每个 Token 独立打分,仅保留得分最高的部分样本。但该方法存在明显缺陷:高分 Token 高度集中在画面显著区域,反复保留同质化冗余信息,极易遗漏文字、数字、坐标轴、目标空间关系等分散但关键的互补证据;同时低分 Token 被直接删除,携带细节信息永久丢失,导致模型推理失真、事实判断偏差、视觉幻觉增多,普遍存在「压缩必掉精度」的行业难题。

针对以上痛点,中国科学院自动化研究所紫东太初大模型团队,提出核心集剪枝方法 GMC(Grounded Message Coreset Pruning),实现了技术跨越式创新。

GMC 彻底跳出「筛选单个最优 Token」的传统思路,基于模型真实推理逻辑,认为视觉语言模型依赖的是全体 Token 构成的集体消息,而非孤立图像块。因此压缩不仅要确定「信息保留位置」,更要解决「保留 Token 的信息承载方式」。

核心创新:双阶段架构,从根源化解 Token 冗余与信息丢失矛盾
GMC 整体分为互补证据自适应筛选与群体互补信息传输两大核心阶段,在不训练、无额外模型依赖的前提下,实现高保真、高效率的视觉序列压缩。
1. 互补证据自适应筛选
GMC 同时从问题语义、视觉外观和空间位置三个角度构建证据。
首先,利用视觉语言模型内部原生的视觉-文本注意力,识别与当前问题直接相关的区域;其次,根据视觉特征之间的相似性保护图像中的不同外观结构,避免模型只关注当前已经被问题激活的内容;最后,通过原始图像坐标构建空间证据,保留图表、文档以及关系推理任务中重要的位置和几何信息。
在选择关键性 Token 时,GMC 根据其对“尚未覆盖证据”的新增贡献进行选择。当某一区域已经得到充分表示后,附近相似 Token 的价值会随之降低,系统会转而选择能够补充文字、目标、数字或空间关系的其他区域。由此,有限的 Token 预算可以被分配给多种互补信息,而不是反复集中在同一显著位置。
2. 群体互补信息传输
仅仅选出具有代表性的位置并不能完全解决信息丢失问题,因为未被选中的 Token 仍然携带着细节信息。
GMC 因此进一步提出 Population Transport 群体互补信息传输机制,将所有待删除 Token 的隐藏状态传输到最合适的代表 Token 中。该过程综合考虑视觉特征相似性和空间邻近关系,将大量视觉 Token 聚合为少量紧凑表示。语义匹配清晰的内容可以被传输到相似代表,而容易混淆的局部细节则更倾向于保留在附近位置。
聚合完成后,未选中的视觉 Token 被删除,模型随后在压缩后的 Token 序列上继续执行注意力计算。
与需要重新训练模型或引入外部工具的方法不同,GMC 不需要任务标签、参数更新、辅助检测器、OCR 模型或额外模型,可以直接应用于已有视觉语言多模态大模型中。同时,GMC 实现的是真实序列压缩,而不是简单地通过掩码隐藏 Token,因此能够实际减少后续解码层计算和 KV Cache 占用。
方案核心优势:零成本适配各类图文大模型
1、全程免训练,无额外依赖
无需模型微调、任务标签、外部 OCR / 检测器、辅助模型,开箱即用,直接兼容 Qwen、LLaVA 等主流视觉语言大模型;
2、压缩不降质,自带去噪增益
过滤无效冗余 Token 的同时完整留存推理所需视觉证据,多项基准测试中性能持平甚至优于原始完整模型;
3、抑制视觉幻觉,事实一致性更强
在 POPE、HallusionBench 等幻觉评测集表现突出,大幅减少压缩后模型错描述、信息缺失问题;
4、跨模型通用,全场景适配
可迁移至不同架构 7B 级多模态模型,覆盖通用图文问答、图表解析、长文档识别全业务场景。
权威实验结果:超高压缩率,解决 Token 冗余痛点
研究团队基于 TextVQA、ChartQA、MME、POPE、MMBench、GQA 等多项主流视觉理解基准,在 Qwen2.5-VL-7B-Instruct、LLaVA-1.5-7B 模型上完成全量验证。

在 Qwen2.5-VL-7B 上,完整模型包含 1296 个视觉 Token。当视觉 Token 数量减少 80.2%、仅保留 256 个时,GMC-H2 保留了完整模型 97.78% 的平均能力;当进一步减少 90.1%、仅保留 128 个视觉 Token 时,GMC-L16 仍保持 99.11% 的平均能力。
在 LLaVA-1.5-7B 上,GMC-L16 在分别保留 128 个和 64 个视觉 Token 时,平均性能达到完整模型的 99.76% 和 99.82%,表明该方法能够迁移到不同视觉语言模型架构。
GMC 方法性能与基线模型性能一致甚至略高于基线模型,表明 GMC 不仅可以减少计算量,甚至可以通过移除无关信息达到去噪效果,进而能够轻微提升模型的多模态理解能力。
除了常规视觉问答能力,研究团队还在 POPE、AMBER、HallusionBench 和 CHAIR 等基准上评估了模型的视觉幻觉。实验结果表明,在相同 Token 预算下,GMC 能够更加完整地保留事实判断所需的视觉证据,在显著压缩视觉序列的同时减少错误描述和信息遗漏。

在长文档问答场景中,面对包含 15876 个原始视觉 Token 的输入,GMC 在保持完整模型 98.87% 问答质量的情况下,实现了 1.258 倍端到端推理加速,并减少 73.94% 的提示 KV Cache,验证了该方法在实际部署中的效率优势。
随着多模态大模型向高分辨率、长上下文、复杂真实场景演进,Token 冗余带来的算力、显存成本问题,已经成为产业规模化落地的核心阻碍。
紫东太初 GMC 不仅是一款全新的核心集剪枝方法,更提供高效、可信的多模态部署新范式:视觉压缩的核心不是减少 Token 数量,而是以更低的计算代价,完整支撑模型精准推理所需的全局视觉信息。
针对视觉语言模型压缩与高效推理问题,云栈社区的人工智能板块也持续关注 Transformer、多模态、模型剪枝与推理加速等方向,可结合同类技术方案进一步交流。
未来紫东太初大模型团队将持续迭代 GMC 技术体系,适配更多大模型架构与复杂业务场景,持续破解多模态模型「算力成本与推理精度」的核心矛盾,推动国产多模态大模型高效、低成本、规模化落地。
论文地址:https://arxiv.org/abs/2608.02134v1