WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
设置Settings
⌘K
更新于 —KKelly
今日情报播客来源我的
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
设置Settings
⌘K
更新于 —KKelly
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
设置Settings
⌘K
更新于 —KKelly
Market Intelligence/InfoQ 中文

MiniMax H3 团队 Reddit 被问爆:2K 要开源,图像模型在路上,Apache-2.0 也在考虑了

点击查看原文>

·2026.08.08·7 min 阅读
事件背景基于真实抓取数据整理

本条来自 InfoQ 中文(AI / 工程),聚焦 technology、ai。 AI摘要 MiniMax H3 团队在 Reddit r/StableDiffusion 社区举行 AMA,就模型架构、视频生成、推理优化等实际工程问题作出首次集中回应。社区关注焦点已从基准测试转向本地部署、稀疏注意力开放、Ref2Vid 清晰度等落地细节。官方未承诺后续开源计划,但确认当前权重开放范围与技术限制。

Original Intelligence基于真实抓取数据整理

点击查看原文>

  • 于是有开发者直接询问:用于最终 2K 输出的模型会不会发布?
  • 比 Sparse Attention 更直接的问题是:能不能少跑几步?
  • AI摘要 MiniMax H3 团队在 Reddit r/StableDiffusion 社区举行 AMA,就模型架构、视频生成、推理优化等实际工程问题作出首次集中回应

点击查看原文>

AI摘要 MiniMax H3 团队在 Reddit r/StableDiffusion 社区举行 AMA,就模型架构、视频生成、推理优化等实际工程问题作出首次集中回应。社区关注焦点已从基准测试转向本地部署、稀疏注意力开放、Ref2Vid 清晰度等落地细节。官方未承诺后续开源计划,但确认当前权重开放范围与技术限制。

H3 支持 2K 分辨率本地推理,需 80GB 显存;Sparse Attention 暂未开放,无明确时间表;Ref2Vid 模糊源于参考帧对齐误差,非模型能力缺陷。

适合 AI 工程师、多模态应用开发者、开源模型部署工程师阅读。

MiniMax H3 开放权重之后,开发者最关心的几个问题,终于有了官方回应。

8 月 7 日晚上 10 点,MiniMax H3 团队来到 Reddit 的 r/StableDiffusion 社区举行 AMA(Ask Me Anything)。

参与此次交流的包括 H3 研究负责人 dacongya,研究员 Luigi、Nero、Kiro,系统工程师 Reynor,以及 MiniMax 开发者关系负责人 Ryanlee。团队表示,讨论范围将涵盖模型架构与训练、视频生成、图生视频与参考生成、推理优化以及未来计划。

截至发稿时,帖子已经积累超过 300 条评论,目前已经在 Reddit 页面被标记为“Finished”。

而从整个讨论看,社区关注的重心已经从 H3 在某个 Benchmark 上超过了谁,换成了一些更实际的问题,比如 2K 能不能本地跑?Sparse Attention 什么时候开放?有没有 4 步版本?为什么 Ref2Vid 比 I2V 糊?能不能拿它直接生成图片?Context-IR 怎么在本地复现?MiniMax 以后还会不会继续开放模型?

这些问题,也恰好指向一个开放模型发布之后真正困难的部分——开放权重只是第一步,围绕训练、推理、工具链和模型能力边界的东西,到底能开放到什么程度,才真正决定一个模型最终能形成多大的开发者生态。

H3 是 MiniMax 7 月 31 日正式发布的全模态视频生成模型,可以同时理解文本、图像、视频和声音组成的上下文,并生成最长 15 秒、最高 2K 分辨率、带原生双声道的视频。MiniMax 当时表示,会在符合法律法规的前提下开放模型权重。

而在这次 AMA 中,MiniMax 第一次比较具体地回应了开放之后的下一步。

InfoQ 整理了 Reddit 社区中讨论热度比较高的提问和 H3 团队的回答,以飨读者。

社区最集中的问题,首先指向 H3 的 2K 能力。

H3 发布时,MiniMax 将 2K 输出背后的方案称为 In-context Regeneration。按照官方此前的解释,它没有走传统视频模型常见的独立超分路线,而是让模型结合原有的多模态上下文,对低分辨率结果再次生成高分辨率版本。这样做的目的,是让模型重新“生成”文字、纹理等信息,而不仅仅依赖超分算法从低分辨率像素中猜测细节。

但开放权重后,社区拿到的版本还无法完整复现线上 2K 能力。

于是有开发者直接询问:用于最终 2K 输出的模型会不会发布?

MiniMax 开发者关系负责人 Ryanlee 先给出了一个非常简短的肯定答复:“会,而且不会太久。”

随后,H3 研究员 Kiro 给出了更完整的技术解释。

他表示,H3-Regenerate-2K 本质上是第二阶段的条件生成过程,但并不是简单地把目前发布的 H3 Base Checkpoint 再运行一遍,更不是传统意义上的 Upscaler。

这个阶段实际上使用了一个专门面向更高目标分辨率的 latent-space DiT regeneration checkpoint。基础模型此前生成的内容会作为额外上下文输入,同时部分参考输入也会以更高分辨率提供给模型。

H3 在训练后期已经使用稀疏注意力,但目前开放版本仍然以 Full Attention 推理。随着视频分辨率和时长提高,Attention 的计算和显存开销会快速膨胀,因此 Sparse Attention 被不少开发者视为 H3 后续最重要的本地推理优化之一。

有人询问:H3 是否直接沿用了 MiniMax M3 大模型上的 MSA,也就是 MiniMax Sparse Attention?

Kiro 给出了明确答案:H3 没有使用 MSA。

H3 的方案更接近 MoBA-style block selection。其基本思路是利用相邻视觉 Token 高度相关的特征,将一组 Token 进行 mean pooling 得到 Block Representation,再利用这些表示判断哪些 Block 更重要,从而减少不必要的 Attention 计算,同时不需要额外训练一个 learned indexer。

目前,这套方案只针对视频 Token 做了三维稀疏化,图片和文本 Token 尚未进入同样的稀疏路径,不过团队正在研究进一步扩展。

MiniMax 表示,计划近期给社区提供一个相对保守的 Sparse Attention 参考实现,第一目标不是追求一个夸张的加速数字,而是做到没有可感知的质量损失。真正针对不同 GPU 获得最大加速,还需要进一步的硬件适配和社区参与。

如果这一实现最终如期开放,那么现在社区基于 Full Attention 测得的 H3 本地运行成本,很可能还不是它最终能够达到的效率水平。

比 Sparse Attention 更直接的问题是:能不能少跑几步?

H3 开放后,第三方 Turbo LoRA 很快就出现了,因此网友直接询问 MiniMax,会不会推出官方 4-step 或 8-step 版本。

Kiro 首先解释,目前发布的 H3 Checkpoint 本身已经包含 CFG Distillation,最终训练阶段也采用了一种特殊策略,因此模型本身已经具有一定低步数推理能力。

但它并不是一个专门针对极低步数蒸馏出来的模型。

在最初的回答中,Kiro 表示团队仍在研究进一步的 Step Distillation,但没有正式公布固定的 4/8-step 目标;随后在回答另一名网友关于 Turbo 版本的问题时,团队把路线图说得更具体了一些:MiniMax 正在积极考虑 4-NFE 或 8-NFE 这样的低步数版本。

但团队仍然强调,暂时无法承诺近期提供。默认目标首先是降低推理成本,同时尽量不产生用户能够明显感知的质量下降。

这与社区现在正在进行的尝试形成了有意思的反差。

目前第三方 H3 Turbo LoRA 已经迅速出现,LightX2V 甚至发布了 4-step Turbo LoRA 预览版本。

但社区测试同样发现,激进减少步数之后,人体结构、运动质量甚至音频都可能明显受损。有用户测试 Turbo 版本后直接评价,运动和 Anatomy 出现了明显退化;LightX2V 4-step 版本的早期测试中,也有人遇到音频质量严重下降。

所以 MiniMax 暂时不急着宣布一个“4 步 H3”,背后的问题并不是做不到,而是如何把加速和质量损失之间的账算清楚。

还有 Reddit 用户提到,生成的画面中,远处的角色总是会出现像素化和变形,无论是图生视频、文生视频还是参考图生视频都是如此。即便他使用了 2K 分辨率和 25 步采样,问题依然存在。他问道,要生成完美无像素化的片段,推荐的步数(Steps)、采样器(Sampler)、调度器(Scheduler)和分辨率(Resolution)是什么?还是说,这纯粹是 Minimax H3 的一个 bug?

Kiro 表示,他们团队也观察到了这个问题,尤其是在主体较小或距离较远时尤为明显。这将是团队后续重点改进的问题之一。

根据其内部实验,这个问题不能简单地归因于视觉 VAE 的压缩比,也不单是某个训练阶段造成的。它是一个复杂的系统级问题,涉及模型和训练流程中的多个环节。团队正在持续调研主要的影响因素,并会在未来的更新中努力加以改善。

❧
Industry Analysis规则派生 · 可核对

本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。

· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。

· 消费者:受众行为与偏好变化值得追踪。

· 品牌:本动向对品牌资产建设的启示。

· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。

Marketing Insight规则派生 · 可核对

· 核心话题:technology、ai。

· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?

Career Usage规则派生 · 可核对

面试中可引用「MiniMax H3 团队 Reddit 被问爆:2K 要开源,图像模型在路上,Apache-2.0 也在考虑了」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。

本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。

关联公司由品牌 / 正文匹配真实 dossier
小红书
China Internet & Platforms · 中国最具「种草」心智的生活方式社区,2013 年由毛文超、瞿芳创立于上海。月活已突破 4 亿,超…
关联播客真实 RSS 单集
Melissa Grady Dias (Measured Wellness) | From CMO to CEO: Using AI and Human Connection to Transform Health
The CMO Podcast · 2026.06.03
Why Great Turnarounds Start with Culture, Not Strategy
HBR IdeaCast · 2026.08.04
In arms’ way: Gaza-deal sticking points
The Intelligence · 2026.08.04
延伸信源A / B 级权威来源 · 供深挖
Marketing BrewACampaignAThe DrumAWARCAAdweekADigidayA
Business English提取正文真实商业词汇
ai
ai

AI摘要 MiniMax H3 团队在 Reddit r/StableDiffusion 社区举行 AMA,就模型架构、视频生成、推理优化等实际工程问题作出首次集中回应。社区关注焦点已从基准测试转向本地部署、稀疏注意力开放、Ref2Vid 清晰度等落地细节。官方未承诺后续开源计划,但确认当前权重开放范围与技术限制。…

系统商务英语 →
关联 English Brief
Michael Jordan’s Air Jordan 11 Got a Modern — and Affordable — Update and It’s Available Right Now
WWD
Zuckerberg’s yacht was closer, but someone else saved a stranded boat
The Verge
来源
阅读原文 · InfoQ 中文 ↗
发布:2026.08.08
类型:AI / 工程
话题:technology、ai
相关阅读
InfoQ 中文/2026.08.09
OpenAI给10亿用户免费换上GPT-5.6
InfoQ 中文/2026.08.09
从失控到可控:基于系统控制论的 Agent 安全防御体系设计与实践|AICon深圳
InfoQ 中文/2026.08.08
金融监管领域的 Harness 实践:让知识与数据驱动 Agent 稳定运行|AICon深圳
InfoQ 中文/2026.08.07
从回答问题到把事办完,消费Agent还缺什么?飞猪新一代 AI 产品 V10 的一次探索
InfoQ 中文/2026.08.07
从回答问题到把事办完,消费Agent还缺什么?飞猪新一代 AI 产品 V10 的一次探索
个人笔记
自动同步到云端