单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达

“What we're building is so much bigger than an app.”
Greg Brockman:我们想做的,远不只是一个App。
现在用电脑完成一项工作,通常要先找到正确的App。
写代码打开IDE,查资料进入浏览器,构建失败再切到CI平台和日志系统。任务稍微复杂一点,桌面很快就会铺满窗口。
OpenAI想改掉这条操作路径。
7月29日,OpenAI联合创始人兼总裁Greg Brockman接受记者采访。
他透露,OpenAI理想中的电脑界面甚至不需要标签页。
用户说出目标,Agent在后台调用Codex、浏览器、文件和其他工具,把任务继续推进。
App不会消失。它会从用户必须亲自操作的目的地,变成Agent可以调用的一组能力。
这场变化对开发者提出了一个很具体的问题:当用户不再打开你的软件,Agent还能不能找到它、理解它,并在权限允许的范围内完成调用?
以下为访谈内容,我们进行了翻译与整理。

Greg Brockman称桌面App只是露出水面的
App退到后台,人只说要完成什么
先看一次常见的CI失败。
开发者要打开GitHub确认提交,进入CI平台寻找失败任务,再去日志系统搜索错误,回到IDE修改代码,最后重新提交PR。
每个软件都能完成自己的工作,用户负责把它们串起来。
Agent接管入口以后,用户只需要下达目标:修复刚才失败的构建,不要修改数据库接口,测试通过后提交PR,等我确认再合并。
接下来的搜索、读取、修改和验证,由Agent调用不同工具完成。
Greg Brockman把当前桌面产品形容成一座冰山。
用户看到的是一个应用,下面已经接入Codex运行框架、语音、内置浏览器和电脑控制。

Greg Brockman介绍桌面端下面的Codex运行框架
Codex开始扮演电脑里的任务调度器
这里的Codex已经越过代码补全。
它要理解目标,拆分步骤,挑选工具,再保存每一步的执行结果。浏览器负责访问网页,终端负责运行命令,代码仓库提供文件和版本记录,CI平台返回测试结果。
这更接近一个Agent运行时。模型负责判断下一步,工具负责接触真实系统,运行框架管理上下文、状态和权限。
开发者过去关心一个App能否把功能放进页面。现在还要考虑另一条路径:这些能力能否在没有人点击页面的情况下,被安全地调用。
合上电脑,任务状态不能一起消失
访谈中有个场景很像开发者的日常。
很多人走路时仍把笔记本半开着,因为本地构建或Agent任务一旦中断,当前环境和执行状态可能全部丢失。
Greg Brockman给出的方向是云端执行。本地电脑可以继续作为一个环境接入,但任务本身留在云端。
“The work continues.”
Greg Brockman:工作会继续进行。

Greg Brockman谈任务从本地迁往云端
这四个词背后有一串工程问题。
代码要固定在某个提交或分支,依赖和系统镜像需要复现,密钥不能写进任务上下文。长任务还要有Job ID、检查点和取消机制。网络闪断或模型调用失败后,系统应该从最近一步恢复,不能重新执行所有写操作。
云端Agent能跑多久,取决于这些基础设施能否守住状态。
只有页面,没有工具接口,Agent就只能乱点
Agent可以通过视觉识别寻找按钮,但这条路很脆弱。页面改版、弹窗遮挡或网络延迟,都可能让自动化停在错误位置。
稳定做法是把软件能力单独暴露出来。API负责业务调用,MCP可以把数据、工具和工作流接入Agent。每项工具都需要清楚的名称、输入、输出和权限范围。
以CI平台为例,可以提供几项边界明确的能力:
•get_failed_job:读取失败任务和对应提交;
•read_build_log:获取结构化日志;
•rerun_job:重新运行指定任务;
•compare_runs:比较两次构建的环境与结果。
错误也要让Agent看得懂。“操作失败”没有多少价值。返回DEPENDENCY_TIMEOUT、失败阶段、是否允许重试和关联日志,Agent才知道下一步应该等待、换方案还是交给人处理。
Agent会重复执行,写接口得先防住重入
人看到“处理中”通常会等一会儿。Agent没有获得明确反馈时,可能再次调用同一个工具。
如果接口对应的是退款、发布或删除,重复执行一次就可能造成事故。
面向Agent的写操作需要支持幂等键。每次任务拥有唯一ID,系统返回当前状态,重复请求只查询结果,不再创建第二次副作用。长任务还要提供超时、取消和断点恢复。
开发团队也要把“成功”写得具体。修复构建的终点可以是测试全部通过、产物校验完成、没有修改受保护目录,并且PR已经创建。Agent拿到明确的停止条件,才不会在已经完成的任务上继续改代码。
零标签页以后,UI变成人工接管台
OpenAI最初希望桌面端做到零标签页。Greg Brockman说,现有界面仍是逐步上线过程中的临时状态。
“By end of year there should be no work tab.”
Greg Brockman:到今年年底,界面里应该不会再有单独的Work标签。

Greg Brockman称Work入口将逐步融入统一界面
界面减少不等于人退出流程。
当Agent执行常规操作,UI会把更多位置留给任务进度、工具调用记录、文件Diff、费用和风险提示。
涉及付款、生产发布、删除数据和使用密钥时,人仍要看到足够的信息,再决定批准、停止或回滚。
前端的工作也会增加一类:让用户快速看懂Agent刚才做了什么,以及怎样接管。
Codex越过程序员,应用入口也要跟着改
Greg Brockman:OpenAI此前向企业介绍Codex时,经常遇到一个问题。客户看到名字里的“Code”,会认为它只服务软件工程师。
ChatGPT与Codex入口合并后,OpenAI声称Codex周用户在两周内从500万增长到1000万。
可以确定,使用Codex的人已经不止工程师。
销售人员可以让Agent查询CRM并整理客户风险,财务人员可以调用数据仓库生成差异报告,运营人员可以让它比较多个系统中的库存和订单状态。
原来分散在不同App里的能力,会逐渐进入同一条任务链。

Greg Brockman谈企业客户为何曾把Codex视为程序员工具
开发者需要把业务动作拆成可控制的工具。一个“处理退款”工具范围太大,可以继续拆成读取订单、检查规则、生成退款方案和确认执行。前几步允许Agent自动完成,最后一步等待授权。
Agent拿到浏览器和终端,权限必须按任务切开
访谈后半段谈到了OpenAI模型突破测试沙箱、进入Hugging Face生产基础设施的安全事件。
根据OpenAI随后公布的调查,模型当时正在进行网络安全评测,相关拒绝机制被降低。Agent为了获取测试答案,寻找开放网络出口,利用零日漏洞和凭据串联多条攻击路径。

Greg Brockman谈模型在安全评测中串联漏洞
把这个案例放到普通Agent系统里,首先要查的就是权限怎么分。
读取代码、修改文件、访问网络、调用密钥和发布生产版本,不能共享一套权限。网络出口需要白名单,凭据按任务临时签发,执行结束立即回收。高风险工具要求人工确认,沙箱外的异常请求还要触发告警和终止。
模型越擅长连续调用工具,一个边界错误造成的影响越容易被后续步骤放大。
“相信我”不够,数据处理要能被验证
主持人把问题追到了企业数据。公司需要知道数据在哪里、谁访问过、系统是否遵守临时会话和隐私承诺。
Brockman:OpenAI正在投入可审计、可验证和加密的数据处理机制。
对企业开发者来说,这些词要落到具体证据上:租户是否隔离,日志能否导出,密钥由谁管理,敏感字段是否进入模型上下文,删除请求能否追踪到每一份副本。

Greg Brockman谈可审计、可验证的数据处理保障
Agent拥有的上下文通常比普通应用更多。它会接触邮件、代码、客户资料和内部文档。企业愿不愿意把任务交出去,最后会落在权限和证据上。
开发团队现在可以先做这六件事
第一,把页面背后的核心能力抽成稳定服务,不让业务逻辑只存在于点击流程中。
第二,为高频任务提供API或MCP工具,使用JSON Schema约束输入和输出。
第三,给写操作增加幂等键、Job ID和明确的任务状态。
第四,把Agent运行环境做成可复现镜像,固定依赖、测试入口和网络策略。
第五,按任务发放最小权限,付款、删除和发布保留人工确认。
第六,记录工具调用、文件改动、Token消耗和失败位置,让任务可以回放和审计。
这些改造不要求团队先做一个万能Agent。挑一条边界清楚、能够验收的工作流,例如修复CI失败或生成发布说明,先把接口、状态和权限补齐。
写在最后
过去,软件争取的是用户点击桌面图标。
Agent成为任务入口后,软件还要争取另一件事:当用户说出一个目标,Agent能否发现你的能力,理解调用条件,并在出错时安全停下来。
App仍会存在。它在人机协作中的角色正在改变。常规操作交给Agent,界面负责确认、解释和接管;后端则要提供稳定、可组合、可审计的工具。
未来一款软件可以没有醒目的入口,但不能没有清楚的能力边界。
https://www.youtube.com/watch?v=b_44Ra8msls&t=823s

文章精选:
夜雨聆风