张一鸣为什么反对蒸馏?
张一鸣对大模型路线的新判断,正在改变Seed团队的研发方式。
本条来自 界面新闻(Business / 中文商业),聚焦 technology。 ';var script=function(){var scripts=
张一鸣对大模型路线的新判断,正在改变Seed团队的研发方式
- ';var script=function(){var scripts=
张一鸣对大模型路线的新判断,正在改变Seed团队的研发方式
';var script=function(){var scripts=
张一鸣对大模型路线的新判断,正在改变Seed团队的研发方式。
7月,字节跳动Seed团队召开了一场内部会议,会议提及的内容包括把火山引擎、豆包和飞书整合的原因,也就是集中力量,才能在算力和数据上有优势。
8月初,更重要的信息才被国内外多家媒体报道出来,字节跳动创始人张一鸣在会上谈到了“模型蒸馏”。他反对“模型蒸馏”。
在业内,模型蒸馏被普遍视作一种提升效率的替代方案。通过学习领先模型,较小的模型能在更短时间内获取部分能力,从而降低算力成本、缩短研发周期。对追赶者而言,这是一条见效快、成本低的技术选择。
蒸馏可以帮助模型更快追上一个已经存在的目标,却很难回答目标之外还有什么。根据会议内容可以看得出来,字节明确了Seed团队对基础模型研发路线的取舍。
过去半年,世界范围内的AI大模型百花齐放。其中,字节跳动在多模态领域持续布局,视频生成模型Seedance推出后引发市场热烈讨论,深刻影响着AI视频生成领域;而在语言模型领域,海外的Claude、Gemini不断推高上限,国内的DeepSeek、智谱、月之暗面也在推理和代码等垂直方向密集迭代。
面对未知地带,张一鸣选择让Seed自己去找答案。代价是更多算力、更长训练周期、大量可能没有结果的实验,以及产出常人能够理解的组织耐心。这样的选择未必马上反映在AI大模型榜单上,却决定了一家公司有没有能力走进没有现成答案的地方。
环顾四周,中国大模型行业发展到今天,不同公司间的技术路线之分或许就在这里。而字节的处境,与其他大模型公司,格外不同。
字节对模型蒸馏的限制,比外界想象得更彻底。
限制覆盖了整个外部模型生态。美国前沿闭源模型不能用于蒸馏,开源模型同样被纳入禁区。为了把规则真正落到研发环节,字节内部还通过API调用检测等方式加强管理,减少研发团队借助外部模型输出提升能力的空间。
表面上看,张一鸣反对蒸馏是对一种技术路径的取舍,放到Seed的发展阶段来看,背后其实是对大模型研发路线的一次选择。
张一鸣的判断很明确。训练大模型是一项高难度、长周期的工程,模型能力最终需要建立在预训练、数据、算法和工程体系的长期积累上。即使Seed的产出当前与全球前沿水平仍有差距,字节也愿意承受阶段性的落后,把自主训练这条路完整走一遍。
这场关于蒸馏的讨论,也由此超出了技术方法本身。中国大模型逐渐逼近全球前沿之后,一个更重要的问题摆到了行业面前:当追赶进入更深水区,大模型公司真正比拼的究竟是什么?
理解这场分歧,需要先回到模型蒸馏在大模型产业中的具体位置。
模型蒸馏本身是一项成熟的技术。简单来说,就是用能力更强的“教师模型”去引导规模较小的“学生模型”,在大幅降低参数与推理成本的同时,提升模型的部署效率。如今,这已是行业优化模型性能的通用手段。
行业的争议焦点,其实集中在另一类行为上——利用竞争对手的闭源模型接口,通过大规模调用获取输出数据,再拿这些数据去训练自己的基础模型。这种做法在业内通常被称为模型“黑盒蒸馏”。
这种模式的吸引力显而易见。对资源有限的团队来说,直接调用领先模型生成高质量样本,能省去海量的数据构建成本,让新模型在代码、数学和逻辑推理等硬指标上实现“弯道超车”。此前,不少开源社区也是借由这种“教师模型”输出的迁移,快速把小模型的性能提升了上去。
但是,蒸馏天然存在“教师模型天花板”,基础模型的竞争,终究不单是榜单分数的比拼,更是数据体系、架构演进、预训练、强化学习及工程能力的综合沉淀。若训练数据大量源自对手模型,最终也只能学到对方的能力边界,难以摸到真正的动力内核。
对于立志冲进全球第一梯队的大模型公司来说,长期依赖外部模型的输出,无异于将自身的上限交给了对手。更深层的问题在于,研发组织的长期演化。
大模型竞争本质上是一场技术基础设施的建造工程。许多硬功夫必须在长期的自主探索中熬出来,比如,高质量数据治理、训练系统优化、算法创新、强化学习设计。如果团队习惯靠外部数据去拉高指标,组织就极其容易退化为一套仅围绕数据筛选和微调优化的工程打法,进而失去对底层模型规律的探索能力。
与此同时,外部模型蒸馏还面临着日趋严峻的商业与合规风险。美系大模型巨头陆续升级产品接口的异常监测,并在服务条款里限制数据采集与模型训练。拿竞品模型的输出来训练自家产品,不仅在行业里引发了关于研发边界的讨论,也在知识产权和服务条款的合规层面上带来不少变数。
曾引起一阵波澜的事件发生在今年2月,Anthropic控诉DeepSeek、Moonshot和MiniMax大规模利用Claude进行所谓的“蒸馏攻击”,指其通过数万个账号产生了超过1600万次交互。7月,月之暗面发布新一代模型Kimi K3后,也迅速被美国公司关注和指控。也就是说,模型蒸馏正在从一个纯粹的技术问题,变成知识产权、服务条款和国际AI竞争中的焦点议题。
毕竟字节家大业大,TikTok在美国的一举一动都被盯着,前些年经历了严酷的调查,它能承担的合规风险跟一般创业公司根本不在一个量级。张一鸣这时候对蒸馏表现出来的谨慎,说白了,就是宁可走得慢一点、贵一点,也绝不能在底层版权和合规上给对手留下一丁点把柄。
随着美系巨头不断收紧API权限与审计风控,靠“借力”维系的技术路径正面临更多不确定性。减少对外部数据供给的依赖,不仅是为了应对眼下的合规与法务风险,也是字节在为未来参与全球市场竞争,提前进行的一场研发体系筹谋。
张一鸣对大模型路线的新判断,正在改变Seed团队的研发方式。
放弃依赖外部模型蒸馏,意味着Seed需要承担更高的不确定性。缺少成熟参照之后,训练数据如何构建、模型架构如何调整、能力突破来自哪里,都需要研发团队自行探索。基础模型研发天然伴随大量失败实验,真正考验的是组织对于长期探索的承受能力。
一次大规模预训练通常需要数月周期,新方向可能投入巨大资源,却无法立即产生明显结果。如果评价体系过度依赖短期排名和阶段性成果,研究团队很难持续探索未知路径。
近期,多家媒体报道称,字节跳动Seed正在推进超大规模基础模型研发。《金融时报》报道,字节正在训练一个可能达到数万亿参数规模的模型,目前仍处于研发阶段,最终参数规模和发布时间尚未确定。
超大规模训练计划释放出了一个清晰的信号,字节希望继续通过扩大预训练规模,寻找模型能力提升空间。Seed在视频模型领域的探索,极大地增强了字节在底层训练路线上的信心。
今年2月,字节接连推出视频生成模型Seedance 2.0和图片生成模型Seedream 5.0 Lite。两款视觉模型很快进入行业视野,Seedance 2.0尤其突出,内测阶段便在国内外社交平台刷屏,成为当时讨论度最高的视频生成模型之一。
热度很快转化成收入。据36氪6月报道,Seedance 2.0已经成为火山引擎MaaS业务最重要的增长来源,单月贡献收入超过10亿元。火山引擎也在4月将2026年MaaS业务营收目标上调至150亿元,而2025年全年MaaS收入约为15亿元。
大模型竞争进入深水区后,组织方式也面临调整。
长期以来,字节依靠多领域的赛马机制推动创新,多个小团队通过快速试错寻找机会,再根据结果投入资源。这套方法适合互联网应用层面的产品竞争,却难以完全适配基础模型研发。一次训练需要消耗大量算力,多方向并行探索会带来显著资源压力。
因此,Seed正在提高核心模型研发的资源集中度。《晚点LatePost》报道称,字节正在整合Coding相关研发资源,并吸引包括DeepSeek研究人员在内的技术人才加入Seed,强化相关方向布局。
组织能力成为大模型竞争的重要变量。基础模型研发涉及算力、数据、算法、人才体系等多个环节,任何单点突破都难以决定最终结果。研发团队需要面对长周期投入,也需要承担探索失败带来的不确定性。
Gartner预测,到2028年,约三分之一企业软件将具备AI Agent能力,超过60%的生成式AI应用将通过企业级AI平台部署。对于火山引擎和豆包等商业化业务而言,底层模型能力决定未来竞争空间,应用层产品可以快速迭代,基础模型能力则需要长期积累。
其实,张一鸣最底层的行动逻辑,是守住创造能力的组织机制。沿着这条线看,字节近期围绕模型、组织和研发体系的一系列动作,都指向同一个目标——把决定技术突破的关键变量尽可能留在内部。
这种思路带着非常强的平台原生主义。平台时代最重要的能力,就是控制。控制算法,控制流量,控制数据,控制分发,也控制价值链上的关键节点。到了AI时代,这套方法论继续向模型研发延伸。模型、数据、算力、人才和产品需要咬合在同一套体系里,任何一个关键环节长期依赖外部,都会削弱整体的自主进化能力。
因此,张一鸣真正警惕的,或许是研发能力被外部技术路径牵引。蒸馏能够缩短差距,API能够迅速补齐能力,但长期依赖外部动能,会让字节内部的研发体系逐渐失去寻找下一次突围的能力。
本条目归入「Technology AI」垂直,涉及真实话题:technology。
· 市场:关注 technology 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「张一鸣为什么反对蒸馏?」:围绕 technology,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
过去半年,世界范围内的AI大模型百花齐放。其中,字节跳动在多模态领域持续布局,视频生成模型Seedance推出后引发市场热烈讨论,深刻影响着AI视频生成领域;而在语言模型领域,海外的Claude、Gemini不断推高上限,国内的DeepSeek、智谱、月之暗面也在推理和代码等垂直方向密集迭代。…