OpenAI 高管亲述:我们是怎么在一周内做出 Jev 竞品的
点击查看原文>

本条来自 InfoQ 中文(AI / 工程),聚焦 technology。 AI摘要 OpenAI 在9月开发者日推出Dot及计算机操作能力,支持智能体在云端Linux环境运行浏览器与桌面应用。核心突破在于智能体具备多模态感知(截图、无障碍API、代码)与自主排错重试能力。当前仍需明确人在关键操作(如支付)中的介入边界。
点击查看原文>
- 主持人 Vibhu: 能力的提升主要来自模型,还是智能体运行框架?
- 主持人 Vibhu: 计算机操作接下来的主要瓶颈是什么?
- 主持人 Vibhu: 计算机操作将怎样改变软件开发流程?
- 主持人 Vibhu: 这次发布的 API 有哪些值得关注的变化?
- AI摘要 OpenAI 在9月开发者日推出Dot及计算机操作能力,支持智能体在云端Linux环境运行浏览器与桌面应用
点击查看原文>
AI摘要 OpenAI 在9月开发者日推出Dot及计算机操作能力,支持智能体在云端Linux环境运行浏览器与桌面应用。核心突破在于智能体具备多模态感知(截图、无障碍API、代码)与自主排错重试能力。当前仍需明确人在关键操作(如支付)中的介入边界。
智能体已支持多模态界面理解与交互;排错与重试机制显著提升任务完成率;人机责任边界(如金融操作)尚未标准化。
适合AI工程师、智能体架构师、API平台开发者阅读。
计算机操作(Computer use)的结果明明很容易验证,为什么这一技术的进展如此缓慢?AI 什么时候才能真的学会操作电脑?
今年 6 月,知名播客主持人 Dwarkesh Patel 提出的这个质疑,在行业内引发了不少争议。
三个月后,OpenAI 在 9 月 29 日的开发者日展示了 Dot、计算机操作和一系列新的开发者接口。每个 Dot 都可以使用一台独立的云端 Linux 电脑,既能打开浏览器,也能运行桌面应用;用户可以把原本需要自己在网页或软件里逐步完成的任务交给它处理。产品演示之后,这个问题反而更值得进一步细问:计算机操作现在究竟能做到哪一步,支撑智能体完成任务的能力又发生了什么变化?
开发者日结束后,Latent Space 的《The AI Engineer Podcast》与 OpenAI 的 CUA 团队和 API 平台负责人进行了深入探讨。播客首先采访了 Sky 联合创始人、现 OpenAI 计算机操作产品与工程负责人 Ari Weinstein。Ari 认为,过去一年最关键的进步,是智能体遇到障碍后更会排错和重试。它也不再只能看着截图逐步点击:页面结构、无障碍信息和自己编写的代码,都可以成为它操作软件的方式。但当智能体能够访问网站、处理付款,人该在哪些环节把关,仍是产品必须回答的问题。
OpenAI API 产品负责人 Nikunj Handa 在访谈中分享了为智能体开发在 API 层做的各种实践:从让模型在工具执行时继续推理,到快速决策、性能优化和上下文管理。当谈论到 Decisions API 时 ,Nikunj Handa 承认,这是受到了 Jev 启发而启动的,起初并不在研发计划之中。项目启动约一周,团队就已完成可运行的原型。他们没有重新训练模型,而是沿用 Luna 的权重,把输出约束成结构化结果,并专门优化推理系统,让首次决策返回时间尽可能短,多个问题还能并行批量处理;它更像一个极快的分类和决策层,能用于客服工单分类、评估打分和计算机操作,也能和 GPT Live 配合,让智能体在需要快速判断时更灵敏。
从“AI 为什么还不擅长操作电脑”的质疑出发,两场访谈逐渐把镜头拉近:智能体怎样发现自己做错了,怎样决定下一步,又怎样在漫长而琐碎的实际任务中持续工作。开发者日的演示给出的是结果,此次访谈则从产品和平台的不同视角出发,分享了他们在计算机操作方面的实践。
主持人 Vibhu: Dot 为每个智能体提供独立的云端电脑。用户应该如何探索它的能力?
Ari Weinstein: Dot 可以在云端 Linux 电脑上使用浏览器和桌面应用。一个实用的起点是梳理自己日常耗时的电脑任务,尝试将其中适合的任务委托给智能体。
主持人 Swyx: 有观点认为,计算机操作在过去两年几乎没有进步。实际情况如何?
Ari Weinstein: 过去,智能体通常能够启动任务,却容易在遇到问题后停滞。如今,它更善于排查错误、调整方法并重新尝试。这是近一年最显著的变化之一。
主持人 Vibhu: 能力的提升主要来自模型,还是智能体运行框架?
Ari Weinstein: 两者都在发挥作用。智能体现在可以结合截图、无障碍信息、页面结构和 Playwright 操作软件,也可以编写代码,一次执行多个步骤;模型本身的能力和速度同样在提高。
主持人 Vibhu: 计算机操作接下来的主要瓶颈是什么?
Ari Weinstein: 瓶颈分布在模型、推理、运行框架和信息呈现等多个环节。随着智能体执行速度提高,等待网站加载等操作本身的耗时,也变得越来越明显。
主持人 Swyx: 开发者通过 Agents API 使用计算机操作能力时,需要注意什么?
Ari Weinstein: 应根据任务限制智能体可访问的网站和应用,并在付款等可能产生重要后果的操作前征求用户同意。可靠性和恰当的安全检查,是建立用户信任的基础。
主持人 Vibhu: 计算机操作将怎样改变软件开发流程?
Ari Weinstein: 智能体可以实际打开并测试自己开发的软件。这样,编写代码与验证结果能够形成闭环,减少开发完成后完全由人接手测试的情况。
主持人 Vibhu: 这次发布的 API 有哪些值得关注的变化?
Nikunj Handa: 异步函数调用允许模型在工具运行期间继续执行,之后再获取结果;中途引导则允许开发者在模型运行过程中加入消息。这些能力有助于处理工具调用频繁、执行时间较长的任务。
主持人 Swyx: OpenAI 是如何开始开发 Decisions API 的?
Nikunj Handa: Jev 的推出引起了用户和内部团队的关注,此前 Decisions API 并不在开发计划中。团队先验证原型是否可行,再着手优化决策返回的速度。
主持人 Vibhu: Decisions API 适合解决什么问题?
Nikunj Handa: 目前明确的用途是快速分类,例如处理客服工单。它也可能用于某些需要迅速选择下一步动作的任务,但快速决策与完成复杂、长周期任务所需的能力不同。
主持人 Swyx: 如果同样使用 Luna,Decisions API 与普通的结构化输出有何区别?
Nikunj Handa: 首个版本没有重新训练模型,而是基于现有的 Luna 权重,对输出施加约束、并行处理多个问题,并专门优化首次决策返回的时间。
主持人 Swyx: 长时间运行的智能体如何应对上下文上限?
Nikunj Handa: 开发者可以设置阈值,让 Responses API 自动压缩上下文;也可以调用 /compact ,自行控制压缩时机。
主持人 Vibhu: 今天是 OpenAI DevDay,我们在现场录这期特别访谈。
主持人 Swyx: 我们是你们直播结束后接受的第一场播客访谈。
主持人 Vibhu: 今天请到的是 Ari,他负责计算机操作(Computer Use)智能体的产品和工程团队。在深入聊这项技术之前,能不能先回顾一下今天发布了哪些东西?
Ari Weinstein: 我们刚从主题演讲现场出来,今天有几项计算机操作方面的发布值得关注。
首先是 Dot,这是一个新的个人助理产品,里面有一些很令人期待的计算机操作功能。
还有 GPT-6.1 Sol,这是一个非常出色的新模型,我认为它尤其适合计算机操作,因为它在成本和速度上都有优势。我们好像公布过它的成本是 Astra 的五分之一;如果专门看计算机操作,成本只有七分之一,真的很了不起。
Agents API 现在也加入了计算机操作能力,开发者可以使用与 Codex、ChatGPT 中相同的实现来构建产品。现场还演示了现有功能,比如应用快照(app shots),可以把你正在电脑上处理的内容迅速带入 Codex 和 ChatGPT。
还有 Mac 上的原生计算机操作:Roman 让它自动给自己的应用截图,而它操作应用时,他仍然可以在电脑上做其他事情。所以,这场主题演讲确实很精彩。
主持人 Swyx: 更不用说还有 Decisions API。我先直接问一下:这些背后都是同一个模型,还是用同一套数据集蒸馏出来的不同模型?具体来说,计算机操作用的是 Decisions API,还是两者相对独立?
本条目归入「Technology AI」垂直,涉及真实话题:technology。
· 市场:关注 technology 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「OpenAI 高管亲述:我们是怎么在一周内做出 Jev 竞品的」:围绕 technology,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
AI摘要 OpenAI 在9月开发者日推出Dot及计算机操作能力,支持智能体在云端Linux环境运行浏览器与桌面应用。核心突破在于智能体具备多模态感知(截图、无障碍API、代码)与自主排错重试能力。当前仍需明确人在关键操作(如支付)中的介入边界。…