紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
免训练、开箱即用!
本条来自 量子位(AI / 中文),聚焦 technology、ai。 随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉Token。
免训练、开箱即用!
- 随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉Token
免训练、开箱即用!
随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉Token。
大量Token持续参与解码计算、长期占用KV Cache,带来 显存开销大、推理速度慢、部署成本高 等一系列问题,视觉Token冗余已成为多模态模型高效推理与规模化落地的核心瓶颈。
当前行业通用方案为传统Top‑K Token筛选:对每个Token独立打分,仅保留得分最高的部分样本。
但该方法存在明显缺陷:高分Token高度集中在画面显著区域,反复保留同质化冗余信息,极易遗漏文字、数字、坐标轴、目标空间关系等分散但关键的互补证据;
同时低分Token被直接删除,携带细节信息永久丢失,导致模型推理失真、事实判断偏差、视觉幻觉增多,普遍存在「压缩必掉精度」的行业难题。
针对以上痛点,中国科学院自动化研究所紫东太初大模型团队,提出 核心集剪枝方法GMC(Grounded Message Coreset Pruning) ,实现了技术跨越式创新。
GMC彻底跳出「筛选单个最优Token」的传统思路,基于模型真实推理逻辑,认为视觉语言模型依赖的是全体Token构成的 集体消息 ,而非孤立图像块。因此压缩不仅要确定「信息保留位置」,更要解决「保留Token的信息承载方式」。
GMC整体分为 互补证据自适应筛选 与 群体互补信息传输 两大核心阶段,在不训练、无额外模型依赖的前提下,实现高保真、高效率的视觉序列压缩。
GMC同时从问题语义、视觉外观和空间位置三个角度构建证据。
首先,利用视觉语言模型内部原生的视觉-文本注意力,识别与当前问题直接相关的区域;
其次,根据视觉特征之间的相似性保护图像中的不同外观结构,避免模型只关注当前已经被问题激活的内容;
最后,通过原始图像坐标构建空间证据,保留图表、文档以及关系推理任务中重要的位置和几何信息。
在选择关键性Token时,GMC根据其对“尚未覆盖证据”的新增贡献进行选择。
当某一区域已经得到充分表示后,附近相似Token的价值会随之降低,系统会转而选择能够补充文字、目标、数字或空间关系的其他区域。
由此,有限的Token预算可以被分配给多种互补信息,而不是反复集中在同一显著位置。
仅仅选出具有代表性的位置并不能完全解决信息丢失问题,因为未被选中的Token仍然携带着细节信息。
GMC因此进一步提出Population Transport群体互补信息传输机制,将所有待删除Token的隐藏状态传输到最合适的代表Token中。
该过程综合考虑视觉特征相似性和空间邻近关系,将大量视觉Token聚合为少量紧凑表示。
语义匹配清晰的内容可以被传输到相似代表,而容易混淆的局部细节则更倾向于保留在附近位置。
聚合完成后,未选中的视觉Token被删除,模型随后在压缩后的Token序列上继续执行注意力计算。
与需要重新训练模型或引入外部工具的方法不同,GMC不需要任务标签、参数更新、辅助检测器、OCR模型或额外模型,可以直接应用于已有视觉语言多模态大模型中。
同时,GMC实现的是真实序列压缩,而不是简单地通过掩码隐藏Token,因此能够实际减少后续解码层计算和KV Cache占用。
无需模型微调、任务标签、外部OCR / 检测器、辅助模型,开箱即用,直接兼容Qwen、LLaVA等主流视觉语言大模型;
过滤无效冗余Token的同时完整留存推理所需视觉证据,多项基准测试中性能持平甚至优于原始完整模型;
在POPE、HallusionBench等幻觉评测集表现突出,大幅减少压缩后模型错描述、信息缺失问题;
可迁移至不同架构7B级多模态模型,覆盖通用图文问答、图表解析、长文档识别全业务场景。
团队基于TextVQA、ChartQA、MME、POPE、MMBench、GQA等多项主流视觉理解基准,在Qwen2.5-VL-7B-Instruct、LLaVA-1.5-7B模型上完成全量验证。
1、 在Qwen2.5-VL-7B上, 完整模型包含1296个视觉Token。
当视觉Token数量减少80.2%、仅保留256个时,GMC-H2保留了完整模型97.78%的平均能力,当进一步减少90.1%、仅保留128个视觉Token时,GMC-L16仍保持99.11%的平均能力。
2、 在LLaVA-1.5-7B上, GMC-L16在分别保留128个和64个视觉Token时,平均性能达到完整模型的99.76%和99.82%,表明该方法能够迁移到不同视觉语言模型架构。
GMC方法性能与基线模型性能一致甚至略高于基线模型,表明GMC不仅可以减少计算量,甚至可以通过移除无关信息达到去噪效果,进而能够轻微提升模型的多模态理解能力。
除了常规视觉问答能力,研究团队还在POPE、AMBER、HallusionBench和CHAIR等基准上评估了模型的视觉幻觉。
实验结果表明,在相同Token预算下,GMC能够更加完整地保留事实判断所需的视觉证据,在显著压缩视觉序列的同时减少错误描述和信息遗漏。结果如下表所示:
在长文档问答场景中 ,面对包含15876个原始视觉Token的输入,GMC在保持完整模型98.87%问答质量的情况下,实现了1.258倍端到端推理加速,并减少73.94%的提示KV Cache,验证了该方法在实际部署中的效率优势。
随着多模态大模型向高分辨率、长上下文、复杂真实场景演进,Token冗余带来的算力、显存成本问题,已经成为产业规模化落地的核心阻碍。
紫东太初GMC不仅是一款全新的核心集剪枝方法,更提供高效、可信的多模态部署新范式:
视觉压缩的核心不是减少Token数量,而是以更低的计算代价,完整支撑模型精准推理所需的全局视觉信息 。
未来紫东太初大模型团队将持续迭代GMC技术体系,适配更多大模型架构与复杂业务场景,持续破解多模态模型「算力成本与推理精度」的核心矛盾,推动国产多模态大模型高效、低成本、规模化落地。
论文地址:https://arxiv.org/abs/2608.02134v1
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1
本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。
· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology、ai。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
除了常规视觉问答能力,研究团队还在POPE、AMBER、HallusionBench和CHAIR等基准上评估了模型的视觉幻觉。…