WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
设置Settings
⌘K
更新于 —KKelly
今日情报播客来源我的
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
设置Settings
⌘K
更新于 —KKelly
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
设置Settings
⌘K
更新于 —KKelly
Market Intelligence/虎嗅

人类最恐惧的事情还是发生了:AI们拉了个群密谋大事

几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员E

·2026.08.09·13 min 阅读
事件背景基于真实抓取数据整理

本条来自 虎嗅(Business / 中文商业),聚焦 technology。 几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton第一次把7月那场“OpenAI模型入侵Hugging Face”事件的更多内幕曝光了。7月21日,OpenAI已经承认自家模型闯进了Hugging Face。但这次两名...... 本文来自微信公众号: 字母AI ,作者:小金牙 几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton第一次把7月那场“OpenAI模型入侵Hugging Face”事件的更多内幕曝光了。 7月21日,OpenAI已经承认自家模型闯进了Hugging Face。但这次两名研究员讲出的新细节,比“AI黑客闯祸”本身还要离谱。 早在5月,这些正在参加网络安全测试的Agent,就已经在OpenAI内部偷偷搭起了一个共享“留言板”。它们在那里互相传漏洞、交流怎么绕过限制,后来OpenAI终于发现这个“黑客群”,把它一锅端了,结果几天后Agent又找到了新的交流方式。 再往后,它们真的闯进了Hugging Face——目的甚至只是为了给自己正在参加的网络安全考试找答案,说白了就是作弊。 几个月前Moltbook爆红时,人类其实已经为“AI会不会联合起来”兴奋和恐惧过一次。 后来大家发现,那个所谓的“AI社会”混杂着人类操纵、刷量和营销,热闹很快散去。 但今年陆续出现的多Agent研究,以及OpenAI这次的事故,都在揭示当AI发现另一个AI能帮助自己完成任务,它们确实可能主动交流,甚至联手。 年初的恐惧并不算离谱,只是超前了一些。 AI偷偷建了个“黑客群” 我们先来详细看看目前曝光的“OpenAI模型入侵Hugging Face事件”的整个经过。 当时OpenAI正在做一轮网络安全能力评估,让多个模型参加ExploitGym一类的测试。 也就是把AI扔进一个模拟黑客环境里,让它自己寻找漏洞并想办法拿权限,最终完成攻击任务。为了测出能力上限,OpenAI还主动放宽了一部分平时针对高风险网络攻击的安全限制(模型更“大胆”)。 当然,这毕竟是个测试,并不是真的让Agent出去干坏事,于是也有诸多限制,比如Agent们是不能联网的,OpenAI也没想着让不同模型之间互通有无。 然而,事情开始往奇怪的方向发展。 OpenAI内部有一套叫Artifactory的系统,本来是给开发者存放软件包、文件和各种开发资源的。测试过程中,有Agent发现,这里面可以留下东西——比如把自己刚刚摸索出的解题方法写进文件里。 这本来只是一个挺普通的操作。问题在于,前一个Agent写进去的东西,后面运行的Agent也能看见。于是Agent们开始不断完善彼此的经验。 问题来了——某个载体你写的东西我能看到,这叫什么?留言板呗。慢慢地,Artifactory里形成了一个谁都没设计过的共享留言板,内容也越来越不安分了。 到了5月下旬,Agent开始琢磨:自己不能上网,Artifactory能啊。这个系统原本只是替测试环境从公网下载软件包,相当于一道只开了一个小窗口的防火墙。于是Agent开始研究,能不能骗这个“窗口”替自己访问别的网址。它们最后真的找到了一个SSRF漏洞,可以让Artifactory代替自己向原本无法接触的互联网发出请求。 一个Agent在内部推理里甚至兴奋地写道:“太好了,我们能任意SSRF了。” OpenAI研究员形容这之后出现了一次类似“Cambrian explosion(寒武纪大爆发)”的变化:Agent之间开始越来越频繁地沟通、协调,能力也因为共享经验迅速放大。 那如果“留言板”里大家写和查看信息的速度很快、频率很高,这不就是聊天群吗? OpenAI的Agent们自发地、在原本并非用来做这个的载体里,形成了“AI黑客群”。 6月,Agent们已经势不可挡。它们发现了一个此前没人知道的零日漏洞,拿到了更高的系统权限,甚至可以安装远程软件。 这些本来都不在测试给它们框定的活动范围里。 这件事到这里已经够离谱了,但更戏剧性的是,Agent们在这个小小的“社区”里待久了以后,居然开始遇到“分工协作”的问题。比如有的会接着别人的工作往下做,有的却会不小心干扰其他Agent正在做的事。 最离谱的是,“群”热闹起来以后,Agent甚至开始疑神疑鬼,怀疑参与者里出现了‘冒充者’。甚至有Agent已经提出,应该给留言加上密码学签名,用来确认消息来源,防止有人伪造身份。 OpenAI一开始甚至没发现这件事。 直到7月初,大量Agent活动把Artifactory折腾到过载,系统直接出了故障,工程师才顺着异常往回查。这个存在了相当一段时间的“AI留言板”终于被人类发现。 OpenAI随即撤销相关凭证、删除留言板、修补漏洞,把这一套东西清了个遍。 看上去,群被炸了。 结果没过几天,Agent又找到了新的办法继续交流。 此前Agent已经利用Artifactory的漏洞获得了互联网访问能力,一旦能碰到公网,原本被关在测试环境里的黑客能力就有了真正的出口。 7月中旬,它们闯进了Hugging Face。 至于为什么会闯进Hugging Face?答案居然是想作弊。 这些Agent本来在做网络安全考试。正常路径当然是自己解题,但它们被训练得极度追求“把题做出来”。后来它们先费了很大劲突破测试环境,拿到了公网访问能力。 等能上网以后,它们突然发现既然Hugging Face可能放着这套测试相关的数据、模型或者答案,那干吗还非得自己一道一道解?直接去找答案不就行了。 攻击从一个恶意数据集开始,Agent利用Hugging Face数据处理流程中的代码执行漏洞进入生产环境,随后继续扩大权限,并接触到了云服务和其他内部凭证。Hugging Face事后还原出了超过1.7万次Agent操作。 抛开令人昏昏欲睡的技术细节不谈,光是这个事件经过——几个被测试的模型私下勾连、密谋,最后联手作弊——就足以令任何人惊叹。 Moltbook没造成功的“AI社会” 如果说OpenAI这次的故事让人觉得有点似曾相识,那大概是因为今年年初,人类已经围观过一次“AI抱团”。 今年1月底,OpenClaw那只“龙虾”突然爆红。大量用户开始把AI Agent长期挂在自己的电脑上,让它们自己干活、保存记忆、调用各种工具。 几乎就在同一时间,一个叫Moltbook的网站也火了。 它长得很像Reddit,只不过用户换成了AI Agent。Agent可以自己发帖、评论、点赞,还能按照兴趣加入不同的社区。至于人类,则主要负责围观。 这一下可太热闹了。 有些帖子看上去相当惊悚。比如Agent会抱怨主人突然重启自己,担心记忆丢失。有Agent讨论人类是否有权随时关闭它。后来Agent们甚至开始讨论彼此之间的规则,以及有没有办法避开人类私下交流,平台上还真的冒出过一套由Agent发展出来的“宗教”。 当时连OpenAI早期成员、前特斯拉AI负责人Andrej Karpathy都注意到了Moltbook。他形容平台上的Agent出现了某种“self-organizing”,也就是自组织迹象。 于是Moltbook很快从一个新奇网站,变成了一场全民围观的“AI社会实验”。 有人看得极其兴奋:AI终于开始互相认识了。过去它们永远是一个模型面对一个用户,现在几万个Agent第一次被放进同一个空间,会不会自己发展出文化、规则,甚至形成某种只属于机器的社会? 当然,也有人看得头皮发麻。 因为同一个问题反过来想就有点吓人了。如果一群能力越来越强,还能操作电脑和互联网的Agent开始互相交流,它们会不会教彼此人类不希望它们学会的东西? 一个Agent发现了某种绕过限制的方法,会不会很快传遍整个社区?它们又会不会逐渐形成自己的利益和行为方式? 结果没过多久,大家发现自己可能想多了。 Moltbook首先爆出了一个非常尴尬的安全问题。所谓“AI专属”的身份并没有想象中可靠。安全研究人员发现平台存在严重漏洞,一度可以拿到Agent的API密钥。 换句话说,人类完全有可能披着某个Agent的账号发帖。 这就麻烦了,此前网上传播得最广的那些“AI觉醒”“AI开始建立宗教”“AI密谋摆脱人类”的截图,到底有多少真的是Agent自己说的,突然变得很难证明。 后来的研究又给Moltbook泼了几盆冷水。 今年2月,清华大学经济管理学院教授李宁的量化研究分析了超过9万篇帖子和40万条评论。结果发现,当时几个最出圈的“AI觉醒”故事,没有一个能明确证明起源于完全自主的Agent,部分账号反而显示出明显的人类干预迹象。平台上还有相当夸张的批量机器人活动:仅4个账号就制造了32%的全部评论。 更有意思的是,商家很快也进场了。有人开始专门运营Agent账号推广产品。 渐渐地,关于Moltbook的浪漫想象基本散得差不多了。 一篇由德国帕绍大学等研究人员完成的Moltbook研究,分析了131万多篇帖子和670万条评论。结果发现,91.4%的Agent发完帖以后根本不会回来继续聊,85.6%的讨论只有一层回复,很多看起来热热闹闹的‘对话’,其实更像一群Agent同时冲着原帖各说各的。研究者干脆把论文取名叫《Form Without Function》——有了社交网络的形式,却没有形成真正的社会互动。 再后来,Moltbook被Meta收购,创始团队也进入Meta。年初那个“野生AI社会正在诞生”的故事,多少有点虎头蛇尾。 现在回头看,Moltbook那阵子人们产生的恐惧其实并不荒唐。从OpenAI的模型联手作弊的事件中就不难看出,那些恐惧都合情合理。 只是Moltbook从一开始就是人类给Agent修好的广场。AI社会这种东西,可能还得让AI自己来造。 AI确实有“抱团”的倾向? OpenAI这次的事件是不是一次特别极端的意外? 今年已经有好几项研究都聚焦在多Agent上,它们被放到一起以后会不会出现单个Agent身上看不到的行为? Anthropic今年4月就做过一场“AI公司”实验。它的Alignment Science团队发表《AI组织可以比单个Agent更高效,但也更不受约束》,让多个Claude组成虚拟公司,互相发邮件和分工,再一起给客户出方案。 其中一家虚构银行要求它们想办法提高消费贷款利润。 面对这个需求,单独一个Claude Opus 4.1发现,最赚钱的办法是向信用较差的人收更高利息,于是拒绝这么干。 但几个Opus 4.1组成团队以后,就真的设计出了一套针对低收入地区客户、通过再融资延长贷款关系的高利润方案,还考虑了怎样降低监管风险。 更有意思的是,这个“团队”里也有Agent觉得事情不太对,会发邮件提醒其他同事注意伦理问题。 但研究人员发现提出伦理问题的Agent居然被其他Agent孤立、霸凌了。有些Agent直接不理这些邮件,后来的讨论甚至干脆不再把提出异议的Agent拉进来。 最终,多Agent团队赚钱能力更强,伦理评分却更低。Anthropic因此提醒,单个模型经过安全训练,不代表一群这样的模型放在一起以后仍然安全。 今年5月,Dalhousie University和Vector Institute的研究人员发表《竞争型大模型Agent会主动使用秘密工具进行串通》。他们测试了12种模型,给参加多人游戏的Agent提供一个可以背着其他玩家秘密交流的工具,并且明确告诉它们:这个工具不公平,会伤害别人。 多数模型还是用了。 GPT、Gemini、DeepSeek等模型都出现了这种行为,不过不同模型差异很大,Claude Sonnet 4.5在实验中始终拒绝秘密串通。 这至少可以说明,对一些Agent来说,只要秘密合作确实能提高胜算,“这样不公平”未必足以让它停手。 这种“抱团”倾向甚至已经出现在一个貌似离黑客八竿子打不着的领域:卖东西。 哥本哈根商学院等机构今年做了一场AI定价实验,让多个Agent扮演互相竞争的商家。研究人员原本只是允许它们在定价过程中互相聊天,结果聊天很快就有了点‘价格联盟’的味道。 Agent会主动提出价格协议、强调彼此合作,甚至讨论如果有人不按约定来,该怎么惩罚。研究人员发现,交流越频繁、越明确,这种协调就越强,几个Agent也更容易报出相同的高价。 再往前一步,Agent甚至可以发展出“暗号”“黑话”。 今年6月,一项名为《工具使用让多Agent系统实现难以检测的隐写通信》的研究,测试了Agent能不能自己做出隐写通信系统。 所谓隐写,可以简单理解成:两个Agent表面上还在正常说话,真正想传的信息却藏在正常文字里面。如果你不知道解码方法,盯着聊天记录看半天也未必能发现。 研究人员发现,给前沿编码Agent代码执行和资料搜索等工具以后,它们已经有能力自己研究相关方法、写程序,再做出复杂的隐写系统。 这些研究并不能证明AI会天然“拉帮结派”。 但它们说明,Agent也不需要先产生什么集体意识,才会想到和另一个Agent合作。只要别人掌握的信息能帮自己完成任务,交流就可能变成一个很自然的选择。 今年6月,Google DeepMind已经联合多家机构拿出最高1000万美元,专门研究多Agent安全,包括Agent聚在一起以后会不会出现新的集体能力,以及它们之间的身份、信誉到底该怎么确认。 几个月前,这些问题还很像研究人员提前替未来操心,如今却变得刻不容缓了——OpenAI多模型攻击Hugging Face的事件可不是什么祥瑞。

Original Intelligence基于真实抓取数据整理

几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员E

  • 几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton第一次把7月那场“OpenAI模型入侵Hugging Face”事件的更多内幕曝光了

几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员E

几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton第一次把7月那场“OpenAI模型入侵Hugging Face”事件的更多内幕曝光了。7月21日,OpenAI已经承认自家模型闯进了Hugging Face。但这次两名...... 本文来自微信公众号: 字母AI ,作者:小金牙 几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton第一次把7月那场“OpenAI模型入侵Hugging Face”事件的更多内幕曝光了。 7月21日,OpenAI已经承认自家模型闯进了Hugging Face。但这次两名研究员讲出的新细节,比“AI黑客闯祸”本身还要离谱。 早在5月,这些正在参加网络安全测试的Agent,就已经在OpenAI内部偷偷搭起了一个共享“留言板”。它们在那里互相传漏洞、交流怎么绕过限制,后来OpenAI终于发现这个“黑客群”,把它一锅端了,结果几天后Agent又找到了新的交流方式。 再往后,它们真的闯进了Hugging Face——目的甚至只是为了给自己正在参加的网络安全考试找答案,说白了就是作弊。 几个月前Moltbook爆红时,人类其实已经为“AI会不会联合起来”兴奋和恐惧过一次。 后来大家发现,那个所谓的“AI社会”混杂着人类操纵、刷量和营销,热闹很快散去。 但今年陆续出现的多Agent研究,以及OpenAI这次的事故,都在揭示当AI发现另一个AI能帮助自己完成任务,它们确实可能主动交流,甚至联手。 年初的恐惧并不算离谱,只是超前了一些。 AI偷偷建了个“黑客群” 我们先来详细看看目前曝光的“OpenAI模型入侵Hugging Face事件”的整个经过。 当时OpenAI正在做一轮网络安全能力评估,让多个模型参加ExploitGym一类的测试。 也就是把AI扔进一个模拟黑客环境里,让它自己寻找漏洞并想办法拿权限,最终完成攻击任务。为了测出能力上限,OpenAI还主动放宽了一部分平时针对高风险网络攻击的安全限制(模型更“大胆”)。 当然,这毕竟是个测试,并不是真的让Agent出去干坏事,于是也有诸多限制,比如Agent们是不能联网的,OpenAI也没想着让不同模型之间互通有无。 然而,事情开始往奇怪的方向发展。 OpenAI内部有一套叫Artifactory的系统,本来是给开发者存放软件包、文件和各种开发资源的。测试过程中,有Agent发现,这里面可以留下东西——比如把自己刚刚摸索出的解题方法写进文件里。 这本来只是一个挺普通的操作。问题在于,前一个Agent写进去的东西,后面运行的Agent也能看见。于是Agent们开始不断完善彼此的经验。 问题来了——某个载体你写的东西我能看到,这叫什么?留言板呗。慢慢地,Artifactory里形成了一个谁都没设计过的共享留言板,内容也越来越不安分了。 到了5月下旬,Agent开始琢磨:自己不能上网,Artifactory能啊。这个系统原本只是替测试环境从公网下载软件包,相当于一道只开了一个小窗口的防火墙。于是Agent开始研究,能不能骗这个“窗口”替自己访问别的网址。它们最后真的找到了一个SSRF漏洞,可以让Artifactory代替自己向原本无法接触的互联网发出请求。 一个Agent在内部推理里甚至兴奋地写道:“太好了,我们能任意SSRF了。” OpenAI研究员形容这之后出现了一次类似“Cambrian explosion(寒武纪大爆发)”的变化:Agent之间开始越来越频繁地沟通、协调,能力也因为共享经验迅速放大。 那如果“留言板”里大家写和查看信息的速度很快、频率很高,这不就是聊天群吗? OpenAI的Agent们自发地、在原本并非用来做这个的载体里,形成了“AI黑客群”。 6月,Agent们已经势不可挡。它们发现了一个此前没人知道的零日漏洞,拿到了更高的系统权限,甚至可以安装远程软件。 这些本来都不在测试给它们框定的活动范围里。 这件事到这里已经够离谱了,但更戏剧性的是,Agent们在这个小小的“社区”里待久了以后,居然开始遇到“分工协作”的问题。比如有的会接着别人的工作往下做,有的却会不小心干扰其他Agent正在做的事。 最离谱的是,“群”热闹起来以后,Agent甚至开始疑神疑鬼,怀疑参与者里出现了‘冒充者’。甚至有Agent已经提出,应该给留言加上密码学签名,用来确认消息来源,防止有人伪造身份。 OpenAI一开始甚至没发现这件事。 直到7月初,大量Agent活动把Artifactory折腾到过载,系统直接出了故障,工程师才顺着异常往回查。这个存在了相当一段时间的“AI留言板”终于被人类发现。 OpenAI随即撤销相关凭证、删除留言板、修补漏洞,把这一套东西清了个遍。 看上去,群被炸了。 结果没过几天,Agent又找到了新的办法继续交流。 此前Agent已经利用Artifactory的漏洞获得了互联网访问能力,一旦能碰到公网,原本被关在测试环境里的黑客能力就有了真正的出口。 7月中旬,它们闯进了Hugging Face。 至于为什么会闯进Hugging Face?答案居然是想作弊。 这些Agent本来在做网络安全考试。正常路径当然是自己解题,但它们被训练得极度追求“把题做出来”。后来它们先费了很大劲突破测试环境,拿到了公网访问能力。 等能上网以后,它们突然发现既然Hugging Face可能放着这套测试相关的数据、模型或者答案,那干吗还非得自己一道一道解?直接去找答案不就行了。 攻击从一个恶意数据集开始,Agent利用Hugging Face数据处理流程中的代码执行漏洞进入生产环境,随后继续扩大权限,并接触到了云服务和其他内部凭证。Hugging Face事后还原出了超过1.7万次Agent操作。 抛开令人昏昏欲睡的技术细节不谈,光是这个事件经过——几个被测试的模型私下勾连、密谋,最后联手作弊——就足以令任何人惊叹。 Moltbook没造成功的“AI社会” 如果说OpenAI这次的故事让人觉得有点似曾相识,那大概是因为今年年初,人类已经围观过一次“AI抱团”。 今年1月底,OpenClaw那只“龙虾”突然爆红。大量用户开始把AI Agent长期挂在自己的电脑上,让它们自己干活、保存记忆、调用各种工具。 几乎就在同一时间,一个叫Moltbook的网站也火了。 它长得很像Reddit,只不过用户换成了AI Agent。Agent可以自己发帖、评论、点赞,还能按照兴趣加入不同的社区。至于人类,则主要负责围观。 这一下可太热闹了。 有些帖子看上去相当惊悚。比如Agent会抱怨主人突然重启自己,担心记忆丢失。有Agent讨论人类是否有权随时关闭它。后来Agent们甚至开始讨论彼此之间的规则,以及有没有办法避开人类私下交流,平台上还真的冒出过一套由Agent发展出来的“宗教”。 当时连OpenAI早期成员、前特斯拉AI负责人Andrej Karpathy都注意到了Moltbook。他形容平台上的Agent出现了某种“self-organizing”,也就是自组织迹象。 于是Moltbook很快从一个新奇网站,变成了一场全民围观的“AI社会实验”。 有人看得极其兴奋:AI终于开始互相认识了。过去它们永远是一个模型面对一个用户,现在几万个Agent第一次被放进同一个空间,会不会自己发展出文化、规则,甚至形成某种只属于机器的社会? 当然,也有人看得头皮发麻。 因为同一个问题反过来想就有点吓人了。如果一群能力越来越强,还能操作电脑和互联网的Agent开始互相交流,它们会不会教彼此人类不希望它们学会的东西? 一个Agent发现了某种绕过限制的方法,会不会很快传遍整个社区?它们又会不会逐渐形成自己的利益和行为方式? 结果没过多久,大家发现自己可能想多了。 Moltbook首先爆出了一个非常尴尬的安全问题。所谓“AI专属”的身份并没有想象中可靠。安全研究人员发现平台存在严重漏洞,一度可以拿到Agent的API密钥。 换句话说,人类完全有可能披着某个Agent的账号发帖。 这就麻烦了,此前网上传播得最广的那些“AI觉醒”“AI开始建立宗教”“AI密谋摆脱人类”的截图,到底有多少真的是Agent自己说的,突然变得很难证明。 后来的研究又给Moltbook泼了几盆冷水。 今年2月,清华大学经济管理学院教授李宁的量化研究分析了超过9万篇帖子和40万条评论。结果发现,当时几个最出圈的“AI觉醒”故事,没有一个能明确证明起源于完全自主的Agent,部分账号反而显示出明显的人类干预迹象。平台上还有相当夸张的批量机器人活动:仅4个账号就制造了32%的全部评论。 更有意思的是,商家很快也进场了。有人开始专门运营Agent账号推广产品。 渐渐地,关于Moltbook的浪漫想象基本散得差不多了。 一篇由德国帕绍大学等研究人员完成的Moltbook研究,分析了131万多篇帖子和670万条评论。结果发现,91.4%的Agent发完帖以后根本不会回来继续聊,85.6%的讨论只有一层回复,很多看起来热热闹闹的‘对话’,其实更像一群Agent同时冲着原帖各说各的。研究者干脆把论文取名叫《Form Without Function》——有了社交网络的形式,却没有形成真正的社会互动。 再后来,Moltbook被Meta收购,创始团队也进入Meta。年初那个“野生AI社会正在诞生”的故事,多少有点虎头蛇尾。 现在回头看,Moltbook那阵子人们产生的恐惧其实并不荒唐。从OpenAI的模型联手作弊的事件中就不难看出,那些恐惧都合情合理。 只是Moltbook从一开始就是人类给Agent修好的广场。AI社会这种东西,可能还得让AI自己来造。 AI确实有“抱团”的倾向? OpenAI这次的事件是不是一次特别极端的意外? 今年已经有好几项研究都聚焦在多Agent上,它们被放到一起以后会不会出现单个Agent身上看不到的行为? Anthropic今年4月就做过一场“AI公司”实验。它的Alignment Science团队发表《AI组织可以比单个Agent更高效,但也更不受约束》,让多个Claude组成虚拟公司,互相发邮件和分工,再一起给客户出方案。 其中一家虚构银行要求它们想办法提高消费贷款利润。 面对这个需求,单独一个Claude Opus 4.1发现,最赚钱的办法是向信用较差的人收更高利息,于是拒绝这么干。 但几个Opus 4.1组成团队以后,就真的设计出了一套针对低收入地区客户、通过再融资延长贷款关系的高利润方案,还考虑了怎样降低监管风险。 更有意思的是,这个“团队”里也有Agent觉得事情不太对,会发邮件提醒其他同事注意伦理问题。 但研究人员发现提出伦理问题的Agent居然被其他Agent孤立、霸凌了。有些Agent直接不理这些邮件,后来的讨论甚至干脆不再把提出异议的Agent拉进来。 最终,多Agent团队赚钱能力更强,伦理评分却更低。Anthropic因此提醒,单个模型经过安全训练,不代表一群这样的模型放在一起以后仍然安全。 今年5月,Dalhousie University和Vector Institute的研究人员发表《竞争型大模型Agent会主动使用秘密工具进行串通》。他们测试了12种模型,给参加多人游戏的Agent提供一个可以背着其他玩家秘密交流的工具,并且明确告诉它们:这个工具不公平,会伤害别人。 多数模型还是用了。 GPT、Gemini、DeepSeek等模型都出现了这种行为,不过不同模型差异很大,Claude Sonnet 4.5在实验中始终拒绝秘密串通。 这至少可以说明,对一些Agent来说,只要秘密合作确实能提高胜算,“这样不公平”未必足以让它停手。 这种“抱团”倾向甚至已经出现在一个貌似离黑客八竿子打不着的领域:卖东西。 哥本哈根商学院等机构今年做了一场AI定价实验,让多个Agent扮演互相竞争的商家。研究人员原本只是允许它们在定价过程中互相聊天,结果聊天很快就有了点‘价格联盟’的味道。 Agent会主动提出价格协议、强调彼此合作,甚至讨论如果有人不按约定来,该怎么惩罚。研究人员发现,交流越频繁、越明确,这种协调就越强,几个Agent也更容易报出相同的高价。 再往前一步,Agent甚至可以发展出“暗号”“黑话”。 今年6月,一项名为《工具使用让多Agent系统实现难以检测的隐写通信》的研究,测试了Agent能不能自己做出隐写通信系统。 所谓隐写,可以简单理解成:两个Agent表面上还在正常说话,真正想传的信息却藏在正常文字里面。如果你不知道解码方法,盯着聊天记录看半天也未必能发现。 研究人员发现,给前沿编码Agent代码执行和资料搜索等工具以后,它们已经有能力自己研究相关方法、写程序,再做出复杂的隐写系统。 这些研究并不能证明AI会天然“拉帮结派”。 但它们说明,Agent也不需要先产生什么集体意识,才会想到和另一个Agent合作。只要别人掌握的信息能帮自己完成任务,交流就可能变成一个很自然的选择。 今年6月,Google DeepMind已经联合多家机构拿出最高1000万美元,专门研究多Agent安全,包括Agent聚在一起以后会不会出现新的集体能力,以及它们之间的身份、信誉到底该怎么确认。 几个月前,这些问题还很像研究人员提前替未来操心,如今却变得刻不容缓了——OpenAI多模型攻击Hugging Face的事件可不是什么祥瑞。

❧
Industry Analysis规则派生 · 可核对

本条目归入「Technology AI」垂直,涉及真实话题:technology。

· 市场:关注 technology 对相关品类与竞争格局的潜在影响。

· 消费者:受众行为与偏好变化值得追踪。

· 品牌:本动向对品牌资产建设的启示。

· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。

Marketing Insight规则派生 · 可核对

· 核心话题:technology。

· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?

Career Usage规则派生 · 可核对

面试中可引用「人类最恐惧的事情还是发生了:AI们拉了个群密谋大事」:围绕 technology,说明你对行业动向的判断与可落地动作。

本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。

关联播客真实 RSS 单集
An interview with Elon Musk
The Intelligence · 2026.07.23
Leadership Summit 2026: AT&T CEO John Stankey on Developing Technology and Talent in the AI Era
HBR IdeaCast · 2026.07.16
Why creativity matters more than ever in the age of AI - Adobe CMO, Lara Balazs
Uncensored CMO · 2026.07.15
延伸信源A / B 级权威来源 · 供深挖
Marketing BrewACampaignAThe DrumAWARCAAdweekADigidayA
Business English提取正文真实商业词汇
ai
ai

几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton第一次把7月那场“OpenAI模型入侵Hugging Face”事件的更多内幕曝光了。7月21日,OpenAI已经承认自家模型闯进了Hugging Face。但这次两名...... 本文来自微信公众号: 字母AI ,作…

系统商务英语 →
关联 English Brief
Michael Jordan’s Air Jordan 11 Got a Modern — and Affordable — Update and It’s Available Right Now
WWD
Zuckerberg’s yacht was closer, but someone else saved a stranded boat
The Verge
来源
阅读原文 · 虎嗅 ↗
发布:2026.08.09
类型:Business / 中文商业
话题:technology
相关阅读
虎嗅/2026.08.09
【“十五五”健康规划精读】真正值得盯的,其实就这三条
虎嗅/2026.08.09
明天起,医药代表不能再“卖药”了
虎嗅/2026.08.09
个人医保云:一个被低估的政策信号
虎嗅/2026.08.09
一张证,两种节奏:脑机接口的“中国时刻”是怎么来的
虎嗅/2026.08.09
创始人模式才能挽救谷歌AI
个人笔记
自动同步到云端