Codex 和 Claude Code 都跑偏了,前 OpenAI 研究员称 Jev 出现前 AI 世界是个悲剧
点击查看原文>

本条来自 InfoQ 中文(AI / 工程),聚焦 technology。 AI摘要 Jev 提出面向校准决策的强化学习(RLCD)框架,使 AI 输出可被代码直接消费的选择、评分与概率,支撑确定性可控的自动化。其核心目标是弥合大模型智能能力与工程化落地之间的接口断层。
点击查看原文>
- Swyx:RLCD 与 RLHF 的核心区别是什么?
- Swyx:为什么 Jev 不把拒答机制直接放进模型底层?
- Swyx: 你所说的可靠性是什么?开发者能否相信同一个版本的行为保持稳定?
- Swyx: 不依赖公开榜单,你们怎样判断模型是否真正做到了更高的性价比?
- AI摘要 Jev 提出面向校准决策的强化学习(RLCD)框架,使 AI 输出可被代码直接消费的选择、评分与概率,支撑确定性可控的自动化
点击查看原文>
AI摘要 Jev 提出面向校准决策的强化学习(RLCD)框架,使 AI 输出可被代码直接消费的选择、评分与概率,支撑确定性可控的自动化。其核心目标是弥合大模型智能能力与工程化落地之间的接口断层。
AI 自动化瓶颈不在智能上限,而在输出不可信、不可编程;RLCD 通过概率化决策输出实现不确定性量化;开发者可依置信阈值自主编排人机协作流程。
适合 AI 工程师、MLOps 架构师、平台型工具链开发者阅读。
“它会逐渐退到软件背景中,像数据库、正则表达式或其他基础设施一样,成为开发者随手调用的普通能力。”
这是 TypeSafe CEO、Jev 创始人 Diogo Almeida 对 AI 的设想:当智能真正融入软件,用户甚至不必意识到它的存在。但怎样才能让开发者放心地把判断交给 AI,而不用守在旁边反复检查?
几个月前,在 AI Engineer 大会的演讲中,这位曾参与 OpenAI InstructGPT 工作的研究者就提出,“下一个时代并不是 Claude Code”时代。在他看来,Claude Code 与 Codex 本质上仍属于同一个阶段——AI 的主要角色仍然是围绕人提供辅助。他关心的是,为什么 AI 如此聪明,能解决数学界的千禧年难题,却连最基础的活都无法实现自动化工作?
9 月 22 日,做客 Latent Space 播客接受采访时,Diogo 再次谈起这份不满,措辞更加直接:“在我看来,Jev 出现之前的 AI 世界,简直是个悲剧。”在他看来,问题在于:强大的“智能引擎”已经有了,把它接进实际业务流程的接口却仍然欠缺。
这一次,他带来了自己的答案——Jev。通过面向校准决策的强化学习(RLCD),团队希望让模型输出可供代码直接使用的选择、评分和概率,让开发者能够依据不确定性设置阈值,决定何时执行、何时交给人处理。
从参与训练听懂人类指令的模型,到尝试让代码直接调用智能,Diogo 为什么要重新选择训练目标?他又准备如何让 AI 成为像数据库一样普通的软件能力?这场两小时的访谈讲述了他的判断与尝试。
Swyx:对于那些可能不太了解情况或者只想得到确切答案的人来说,Jev 到底是什么?
Diogo Almeida: 目前最准确的称呼是 System One 模型,它的能力范围远远超出决策本身。这类模型的目标,在于让代码成为模型输出的直接使用者。
Swyx:你对 RLHF 的一个核心看法是:模型的回答会向用户想听的内容,而不是反映它对一件事真正的内部置信度。能具体谈谈吗?
Diogo Almeida: 几乎没人注意到 RLHF 的缺点,特别是“模式坍缩”(mode dropping)。RLHF 的模式坍缩会让模型偏向生成更安全、更常见的答案,而牺牲概率分布的真实校准,这既掩盖了长文本中的错误累积,也解释了为什么文本模型不擅长决策。
Swyx:RLCD 与 RLHF 的核心区别是什么?
Diogo Almeida: 区别首先在于优化目标:RLHF 侧重让模型遵循人的指令、给出获得认可的回答,RLCD 则希望模型成为软件能够可靠调用的能力。
Swyx:为什么 Jev 不把拒答机制直接放进模型底层?
Diogo Almeida: 我不反对安全本身,但我认为不应把特定价值判断直接写进通用模型底层能力,而应像数据库一样划清技术能力与具体使用责任的边界。
Swyx: 你所说的可靠性是什么?开发者能否相信同一个版本的行为保持稳定?
Diogo Almeida: 我更重视稳健性:问题含义没变,就不该因为加入无关字符而大幅改变判断,而不只是追求相同输入得到相同输出。已经部署的模型,我们不会悄悄修改,因为 API 是别人程序里的依赖。但我们会快速发布新版本,目前还不能承诺永久维护每个旧版本。
Swyx: 不依赖公开榜单,你们怎样判断模型是否真正做到了更高的性价比?
Diogo Almeida: 我们会通过内部评测比较成本和能力,追求同等成本下更强、同等能力下更便宜。我不反对评测,反对的是围绕榜单优化,让分数脱离真实价值。开发者最终还是要把模型放进自己的工作流,测量实际表现,不能只看价格、速度或一个总分。
Swyx: 开发者应该怎样组织任务,才能更可靠地使用 Jev?
Diogo Almeida: 我建议把复杂任务拆成最小、可以独立判断的语义单元,用结构化输入提供必要信息,再由代码控制最终行为。Choice 对应选择分支,Noul 对应条件判断,Score 对应评分、排序和筛选。每一步都可以单独评估、调整阈值;能力不足时,就转交人工或暂不部署。
Swyx: 对企业开发者来说,Jev 有哪些值得尝试的应用方向?
Diogo Almeida: 我们梳理了四类:分析因处理成本太高而闲置的“暗数据”;为实时流程提供快速判断;检查其他模型的调用和输出;把智能判断嵌入软件核心逻辑。我尤其看好暗数据分析和编程 Agent,但具体如何组合模型,仍要看它能否降低成本、解决原本解决不了的问题。
Swyx: 面对前沿 AI 的风险,放慢发展速度是唯一选择吗?
Diogo Almeida: 我认为,这种讨论往往默认大家必须沿着现有 RLVR 路线继续加大投入,但研究目标和技术路线都可以重新选择。为了提升表现而给模型多大行动空间,本身就是设计决定,不该被当作不可避免的前提。我更希望探索其他方向,让已有智能可靠地进入软件,自动化实际工作。
Swyx: 如果研究者在前沿实验室得不到资源,你会建议他们出来创业吗?
Diogo Almeida: 要看为什么离开。如果只是想自由尝试课题,现有实验室可能仍然最合适;如果找到了值得长期投入的新任务,我会支持创业。我不认为漂亮的研究履历会自动创造价值,也不看好拿到资金后重复已有工作的做法。先明确自己的核心目标,再围绕真正值得解决的问题展开研究。
Swyx: 欢迎来到录音室。就在本周,我的好朋友 Diogo 发布了 Jev,它几乎占领了社交平台的热点话题。此时此刻,你感觉怎么样?
Diogo Almeida: 情绪上来说,从来没有这么糟过。我现在简直像一具疲惫不堪的行尸走肉,因为同时发生的事情太多了,到处都有问题等着我处理。
但是,从心理层面来说,那反而完全不一样。我经常讲这件事,并且这几年我在那些大小项目活动里也反复说过,整个 AI 领域就像游乐园里的哈哈镜屋,所有人都像疯了一样。每个人都在说各种奇怪又说不通的话。
可是就这一周,我好像和现实更合拍了,像是突然之间感受到:“哦,大家终于看见了。”——AI 能做到的事情,远比过去人们想象的多。我们真的可能推动了一场由 AI 驱动的经济革命,这件事重新回到桌面上了,简直实在是太棒了。我特别兴奋的一点,是开发者真的能够理解我们在做什么,这种感觉非常强烈。我也想对这些开发者表达我长久的感激。我对整个开发者社区以及现在发生的一切都特别兴奋,真的太棒了。
Swyx: 你昨天还跟我说,你决定优先去做 town hall,也就是社区公开交流,而不是把时间都花在 VIP 和投资人之类的人身上。因为你希望确保真正得到你最多注意力的,是工程师、开发者这些真正使用产品的人。
Diogo Almeida: 是的。当时确实会有一种感觉,像是“天啊,我现在正在跟一些非常重要的人说话。”我可能不该透露是谁。但对我来说,如果在我那个列满了待聊对象的庞大日程表里,开发者社区竟然不在其中,这对我来说会很不舒服。实际上,如果按照我的理想状态,我会一直和开发者社区在一起交流。我刚才甚至在想,“我要不要一边走来你的演播室,一边开一场社区大会?”后来我又觉得,“不行,这也太疯狂了。”
Swyx: 对于那些可能不太了解情况或者只想得到确切答案的人来说, Jev 到底是什么?
Diogo Almeida: 这个问题其实挺难回答的,但我是这么看这件事的:我们需要一种全新的模型类别。至于这一类别到底叫什么,我们没有执着于某个名字。
目前我们想到最准确的称呼是 System 1 模型。之所以没有把它称为“决策模型”,是因为 System 1 的能力范围远远超出决策本身。我现在只能说这么多。我们原本没想到这次会成为一次这么受关注的发布,所以手里还有东西没有拿出来。
Swyx: 你们当时就该说这是一次“低调的研究预览”。
Diogo Almeida: 某种程度上确实就是,它其实真的有点像一个研究预览。总之,我们内部有几个词来描述出现的这一类新的模型。比如机器原生模型(machine-native)、System 1 模型、大型可编程模型(large programmable)。我的理解是, 这类模型的目标,在于让代码成为模型输出的直接使用者。
本条目归入「Technology AI」垂直,涉及真实话题:technology。
· 市场:关注 technology 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「Codex 和 Claude Code 都跑偏了,前 OpenAI 研究员称 Jev 出现前 AI 世界是个悲剧」:围绕 technology,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
AI摘要 Jev 提出面向校准决策的强化学习(RLCD)框架,使 AI 输出可被代码直接消费的选择、评分与概率,支撑确定性可控的自动化。其核心目标是弥合大模型智能能力与工程化落地之间的接口断层。…