面向多模态推理的高效长上下文建模|AICon深圳
点击查看原文>

本条来自 InfoQ 中文(AI / 工程),聚焦 technology、ai。 AI摘要 大模型正从能力突破转向系统化工程落地,效率成为多模态长上下文场景规模化应用的核心瓶颈。庄博涵将分享算法—系统协同设计的最新实践,覆盖高效注意力、KV-cache优化与并行解码等关键技术路径。
点击查看原文>
- 多模态大模型效率瓶颈集中于长上下文推理开销;
- KV-cache压缩与缓存管理显著降低显存占用;
- Efficient AI:算法与 infra 协同设计
- AI摘要 大模型正从能力突破转向系统化工程落地,效率成为多模态长上下文场景规模化应用的核心瓶颈
点击查看原文>
AI摘要 大模型正从能力突破转向系统化工程落地,效率成为多模态长上下文场景规模化应用的核心瓶颈。庄博涵将分享算法—系统协同设计的最新实践,覆盖高效注意力、KV-cache优化与并行解码等关键技术路径。
多模态大模型效率瓶颈集中于长上下文推理开销;
KV-cache压缩与缓存管理显著降低显存占用;
并行解码与线性注意力支撑实时Agent交互需求。
适合AI基础设施工程师、大模型系统优化工程师、Agent架构师阅读。
大模型能力持续演进,但 AI 的下一阶段竞争正在发生变化。模型能力之外,如何构建可靠的智能体、完善 AI 工程体系,并让 AI 在复杂业务环境中稳定运行,正在成为产业探索的新重点。
8 月 21 日-22 日, AICon 全球人工智能开发与应用大会 将在深圳举办 。大会全日程现已 100%上线,来自产业一线的技术专家将围绕 Agent 工程化、大模型基础设施、AI Native 研发、具身智能等前沿方向,分享 AI 时代的技术探索与工程实践,共同探讨 AI 从能力突破走向系统构建的新路径。
浙江大学百人计划研究员庄博涵已确认出席 “ 大模型效率工程与 Agent 系统实践 ” 专题,并发表题为 《 面向多模态推理的高效长上下文建模 》 的主题分享。2026 年,多模态大模型正从“被动感知”走向“主动执行”,而不断增长的上下文长度与生成成本,使“效率”成为其规模化落地的核心瓶颈。本次分享围绕面向多模态理解与生成的高效推理,介绍团队在大模型“算法—系统协同设计”上的最新进展:高效注意力方面,覆盖支撑长上下文的稀疏 / 线性注意力;高效记忆方面,介绍基于 KV-cache 压缩与缓存管理的显存优化;高效解码方面,分享近期并行解码策略。在此基础上,串联多模态大模型(Agent)在理解、生成等核心能力上的实践;并进一步简单介绍面向视频生成对齐的高效扩散强化学习,以及在交互式世界模型评测上的探索。最后分享对高效基础模型未来走向的思考,包括 agentic loop 等。在本次演讲中,庄博涵将对此展开详细介绍。
庄博涵,浙江大学百人计划研究员、博士生导师,入选国家级高层次青年人才计划。主要研究高效大模型算法与系统协同优化,致力于打造极致 Token 性价比,并围绕 Agent Loops、World Models 和 Embodied AI 开展前沿研究。曾任 Monash University 长聘助理教授并创立 ZIP Lab,与多家全球头部科技企业保持深度科研合作。实验室首批 7 名博士毕业生均进入顶尖企业或高校,包括 DeepSeek、ByteDance Seed 等,多人入选头部人才计划;本科毕业生多赴世界一流高校攻读 PhD,有成员获 UC Berkeley 博士奖学金。他在本次会议的详细演讲内容如下:
Efficient AI:算法与 infra 协同设计
高效注意力:化解注意力随序列长度二次增长的瓶颈,支撑长上下文理解与长视频生成。
高效记忆:通过 KV-cache 压缩与缓存管理,突破长序列推理的显存瓶颈。
高效解码:通过并行解码提升推理吞吐、降低生成时延。
2. 多模态大模型(Agent)的核心能力:理解与生成
理解:在有限算力下高效理解长视频,并支撑空间推理与决策。(场景:空间推理、视频推理)
生成:以更低成本实现世界模型生成。(场景:3D 世界生成重建,长视频生成)
面向游戏,具身等仿真场景,World Model 不仅需要生成高质量视频,还需要支持低延迟的实时交互的生成速度,对此,我们团队做了很多工作。
在系统层面,我们提出了 FPSAttention 针对视频 DiT 的三维注意力进行改进。在 NVIDIA H20 上运行 Wan2.1-14B、生成 720p 视频时,注意力算子最高加速 7.09×,端到端视频生成加速 4.96×,同时保持生成质量基本无损。
在算法层面,我们也做了许多工作,其中 FlashBlock 在 block diffusion 范式探索新的缓存机制,在长文本和视频生成实验中实现最高 1.44× token 吞吐提升和 1.6× 注意力耗时降低,并且几乎不影响生成质量。近期的工作 Mirage 将视频模型的空间记忆保存在潜空间中,使得三维缓存的显存占用降低最高 55 倍,并且有最高 10x 的端到端加速,并且在 WorldScore 上取得了最佳结果。
根据我们针对 Block Diffusion 范式的系统与算法的研究,正在持续整合到我们的统一的框架 Inferix,Inferix 进一步提供面向 World Model 的 Block Diffusion 推理引擎,支持 KV-cache 管理、流式视频生成和交互式 world rollout
在现在的 Agent 框架,比如 Claude Code,Codex,OpenClaw 中,上下文长度正在越积越长,首轮 prefill 时间和 KV cache 的显存占用正在不断上升。
在系统层面,为了解决上述问题,我们提出了很多工作,比如 TriAttention 面向长推理中的 KV-cache 压缩,在 AIME25 的 32K token 生成实验中,在保持与完整注意力相当推理准确率的情况下,实现 2.5× 吞吐提升或 10.7× KV-cache 显存压缩。
在算法层面,我们也提出一些加速方案,例如我们探索在 Agent 任务中进行大小模型协同工作来提高效率。R-Stitch 根据熵来切换大小模型。其在不同尺寸的模型的推理任务上分别实现 3-4 倍的加速,同时保持接近完整大模型解码的准确率,而 Agent-as-a-Router 将模型选择本身设计成 Agent Loop,在 2900 个编码任务上测试,带 router 的框架的平均任务得分高于 opus 的分数,并且成本不到 opus 的一半。
效率与质量的权衡问题。稀疏/线性注意力、KV-cache 压缩等手段可显著降本提速,但往往会带来可控但非零的质量损失,且最优适配区间会随任务、模态、序列长度发生漂移,需要投入大量精力调参与验证,无法通过一套配置适配所有场景。
系统了解面向多模态理解与生成的高效推理全链路方法(稀疏 / 线性注意力、KV-cache 压缩与缓存管理、并行解码)及其算法—系统协同设计思路。
了解这些效率技术如何落地到多模态 Agent 的理解、生成等能力,以及视频生成对齐、世界模型评测的最新实践。
获得对高效基础模型未来方向的判断,为自身技术选型与工程落地提供参考。
除此之外,本次大会还策划了 AI Infra、推理工程与异构计算 、 超级个体与蜂群智能的共生进化 、 迈向机器人 AGI 的关键技术与产业实践 、 Agent 安全:从风险到可控 、 大模型效率工程与 Agent 系统实践 、 AI Agent 高价值商业场景实战 等 10 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。
日程已 100%上线!AICon 深圳站:10 大专题+1 个动手实验室、近 60 场重磅议题,集结浙大知名高校教授及阿里、腾讯、华为、快手、Google Cloud 团队等头部企业技术专家,聚焦 Agent 工程化,构建可靠智能的技术路径。更多详情可扫码或联系票务经理 13269078023 进行咨询。
本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。
· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology、ai。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「面向多模态推理的高效长上下文建模|AICon深圳」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
AI摘要 大模型正从能力突破转向系统化工程落地,效率成为多模态长上下文场景规模化应用的核心瓶颈。庄博涵将分享算法—系统协同设计的最新实践,覆盖高效注意力、KV-cache优化与并行解码等关键技术路径。…