WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
今日情报播客来源我的
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
Market Intelligence/量子位

紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力

免训练、开箱即用!

思邈·2026.08.12·6 min 阅读
事件背景基于真实抓取数据整理

本条来自 量子位(AI / 中文),聚焦 technology、ai。 随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉Token。

Original Intelligence基于真实抓取数据整理

免训练、开箱即用!

  • 随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉Token

免训练、开箱即用!

随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉Token。

大量Token持续参与解码计算、长期占用KV Cache,带来 显存开销大、推理速度慢、部署成本高 等一系列问题,视觉Token冗余已成为多模态模型高效推理与规模化落地的核心瓶颈。

当前行业通用方案为传统Top‑K Token筛选:对每个Token独立打分,仅保留得分最高的部分样本。

但该方法存在明显缺陷:高分Token高度集中在画面显著区域,反复保留同质化冗余信息,极易遗漏文字、数字、坐标轴、目标空间关系等分散但关键的互补证据;

同时低分Token被直接删除,携带细节信息永久丢失,导致模型推理失真、事实判断偏差、视觉幻觉增多,普遍存在「压缩必掉精度」的行业难题。

针对以上痛点,中国科学院自动化研究所紫东太初大模型团队,提出 核心集剪枝方法GMC(Grounded Message Coreset Pruning) ,实现了技术跨越式创新。

GMC彻底跳出「筛选单个最优Token」的传统思路,基于模型真实推理逻辑,认为视觉语言模型依赖的是全体Token构成的 集体消息 ,而非孤立图像块。因此压缩不仅要确定「信息保留位置」,更要解决「保留Token的信息承载方式」。

GMC整体分为 互补证据自适应筛选 与 群体互补信息传输 两大核心阶段,在不训练、无额外模型依赖的前提下,实现高保真、高效率的视觉序列压缩。

GMC同时从问题语义、视觉外观和空间位置三个角度构建证据。

首先,利用视觉语言模型内部原生的视觉-文本注意力,识别与当前问题直接相关的区域;

其次,根据视觉特征之间的相似性保护图像中的不同外观结构,避免模型只关注当前已经被问题激活的内容;

最后,通过原始图像坐标构建空间证据,保留图表、文档以及关系推理任务中重要的位置和几何信息。

在选择关键性Token时,GMC根据其对“尚未覆盖证据”的新增贡献进行选择。

当某一区域已经得到充分表示后,附近相似Token的价值会随之降低,系统会转而选择能够补充文字、目标、数字或空间关系的其他区域。

由此,有限的Token预算可以被分配给多种互补信息,而不是反复集中在同一显著位置。

仅仅选出具有代表性的位置并不能完全解决信息丢失问题,因为未被选中的Token仍然携带着细节信息。

GMC因此进一步提出Population Transport群体互补信息传输机制,将所有待删除Token的隐藏状态传输到最合适的代表Token中。

该过程综合考虑视觉特征相似性和空间邻近关系,将大量视觉Token聚合为少量紧凑表示。

语义匹配清晰的内容可以被传输到相似代表,而容易混淆的局部细节则更倾向于保留在附近位置。

聚合完成后,未选中的视觉Token被删除,模型随后在压缩后的Token序列上继续执行注意力计算。

与需要重新训练模型或引入外部工具的方法不同,GMC不需要任务标签、参数更新、辅助检测器、OCR模型或额外模型,可以直接应用于已有视觉语言多模态大模型中。

同时,GMC实现的是真实序列压缩,而不是简单地通过掩码隐藏Token,因此能够实际减少后续解码层计算和KV Cache占用。

无需模型微调、任务标签、外部OCR / 检测器、辅助模型,开箱即用,直接兼容Qwen、LLaVA等主流视觉语言大模型;

过滤无效冗余Token的同时完整留存推理所需视觉证据,多项基准测试中性能持平甚至优于原始完整模型;

在POPE、HallusionBench等幻觉评测集表现突出,大幅减少压缩后模型错描述、信息缺失问题;

可迁移至不同架构7B级多模态模型,覆盖通用图文问答、图表解析、长文档识别全业务场景。

团队基于TextVQA、ChartQA、MME、POPE、MMBench、GQA等多项主流视觉理解基准,在Qwen2.5-VL-7B-Instruct、LLaVA-1.5-7B模型上完成全量验证。

1、 在Qwen2.5-VL-7B上, 完整模型包含1296个视觉Token。

当视觉Token数量减少80.2%、仅保留256个时,GMC-H2保留了完整模型97.78%的平均能力,当进一步减少90.1%、仅保留128个视觉Token时,GMC-L16仍保持99.11%的平均能力。

2、 在LLaVA-1.5-7B上, GMC-L16在分别保留128个和64个视觉Token时,平均性能达到完整模型的99.76%和99.82%,表明该方法能够迁移到不同视觉语言模型架构。

GMC方法性能与基线模型性能一致甚至略高于基线模型,表明GMC不仅可以减少计算量,甚至可以通过移除无关信息达到去噪效果,进而能够轻微提升模型的多模态理解能力。

除了常规视觉问答能力,研究团队还在POPE、AMBER、HallusionBench和CHAIR等基准上评估了模型的视觉幻觉。

实验结果表明,在相同Token预算下,GMC能够更加完整地保留事实判断所需的视觉证据,在显著压缩视觉序列的同时减少错误描述和信息遗漏。结果如下表所示:

在长文档问答场景中 ,面对包含15876个原始视觉Token的输入,GMC在保持完整模型98.87%问答质量的情况下,实现了1.258倍端到端推理加速,并减少73.94%的提示KV Cache,验证了该方法在实际部署中的效率优势。

随着多模态大模型向高分辨率、长上下文、复杂真实场景演进,Token冗余带来的算力、显存成本问题,已经成为产业规模化落地的核心阻碍。

紫东太初GMC不仅是一款全新的核心集剪枝方法,更提供高效、可信的多模态部署新范式:

视觉压缩的核心不是减少Token数量,而是以更低的计算代价,完整支撑模型精准推理所需的全局视觉信息 。

未来紫东太初大模型团队将持续迭代GMC技术体系,适配更多大模型架构与复杂业务场景,持续破解多模态模型「算力成本与推理精度」的核心矛盾,推动国产多模态大模型高效、低成本、规模化落地。

论文地址:https://arxiv.org/abs/2608.02134v1

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

❧
Industry Analysis规则派生 · 可核对

本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。

· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。

· 消费者:受众行为与偏好变化值得追踪。

· 品牌:本动向对品牌资产建设的启示。

· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。

Marketing Insight规则派生 · 可核对

· 核心话题:technology、ai。

· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?

Career Usage规则派生 · 可核对

面试中可引用「紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。

本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。

关联播客真实 RSS 单集
Pump and circumstance: is China the new OPEC?
The Intelligence · 2026.08.12
The Innovation Strategy Most Companies Miss
HBR IdeaCast · 2026.08.11
Spring, then fall: a weakened Muslim Brotherhood
The Intelligence · 2026.08.11
延伸信源A / B 级权威来源 · 供深挖
Marketing BrewACampaignAThe DrumAWARCAAdweekADigidayA
Business English提取正文真实商业词汇
ai
ai

除了常规视觉问答能力,研究团队还在POPE、AMBER、HallusionBench和CHAIR等基准上评估了模型的视觉幻觉。…

系统商务英语 →
关联 English Brief
从亚百毫秒级启动到生产级部署,腾讯云为何重构 Agent 沙箱?
InfoQ 中文
Vercel 发布新语言 Zero:代码不是写给人看的,而是写给 AI 的
InfoQ 中文
来源
阅读原文 · 量子位 ↗
发布:2026.08.12
类型:AI / 中文
话题:technology、ai
相关阅读
量子位/2026.08.11
一家新能源大厂,如何撑起全球最大AI算力超级单体?
量子位/2026.08.11
当AI开始“自作主张”,谁来为智能体戴上“项圈”?全球AI安全实战化大考,中国方案打入前三
InfoQ 中文/2026.08.13
从亚百毫秒级启动到生产级部署,腾讯云为何重构 Agent 沙箱?
The Verge/2026.08.13
Google’s Pixel 11 phone preorders come with up to $350 in gift cards
The Verge/2026.08.13
ICE wants to give agents electrified gloves that shock people into compliance
个人笔记
自动同步到云端