夜雨聆风学习资料网

ARTICLE · 1116959

AI每日资讯 - OpenAI DevDay 到底确认了什么

AI每日资讯 - OpenAI DevDay 到底确认了什么

深度详解

AI每日资讯 - Dev Day 没有震撼新品,只有趋势确认

OpenAI Dev Day 结束后,重度用户唯一没吵起来的公告是 Spaces。雷·费尔南多写道,他早就拿到 OpenAI Dots 的早期访问权限,不打算加入这场吹捧,它现在还不是 Rockbot 或 Hermes 的杀手,但 Spaces 能让智能体在应用里活跃起来,这个方向感觉是对的。同一场发布会上,几乎其他所有公告都引来了议论。

一句话总结

OpenAI Dev Day 没发震撼新品,但 Decisions API 把决策速度提升十倍,Spaces 则验证了团队协作的方向。

核心要点

•Chase Browser 公布会话记录,Dot 丢了全部工作成果。

•Max Wineback 的测试:Dots 拿到邮件和 Google Drive 权限后自主完成费用报销。

•Rockbot 前三天搞得一团糟,Dots 第一次之后就做到了。

•OpenAI 发布 Decisions API,称决策速度比 Responses API 快十倍。

•Justin 说 Dots 更像 Codex,本来应该做成独立应用。

•雷·费尔南多说 Spaces 不是 Rockbot 或 Hermes 的杀手,但方向是对的。

行业新闻

Chase Browser 公布会话记录,Dot 丢失全部工作成果

Chase Browser 发布了一段会话记录。记录里,Dot 丢了所有工作成果。Ter B 的说法是,他们本来很兴奋,可后来发现,没法同时连多台电脑来共享完整上下文。

对一款主打持久、主动的智能体来说,多设备上下文是基础能力,不是加分项。连不上第二台电脑,工作成果就可能落在机器之外,而用户恰恰是在多设备之间切换工作的那批人。

OpenAI 发布 Decisions API

OpenAI 发布了 Decisions API,说这是对 Jave 的回应。Jave 其实是一种判断模型,它不擅长写文本,但擅长分类,擅长给出零到一之间的置信度分数,也擅长做决策前的判断。

Decisions API 允许用户调用一个 LUNNA 版本,这个版本模仿了 Jave 快速分类和决策的能力。用户只要提供最终的问题和可能的答案列表,模型就会快速给出回应。

OpenAI 说,它可以用来分类、路由请求,或者帮智能体选择下一步行动。他们还声称,跟 Responses API 相比,决策速度提高了十倍。这条公告没有引发太多欢呼,因为它解决的是管道问题,而不是用户能直接看见的能力。

分析师实测:Dots 完成费用报销,Rockbot 前三天一团糟

分析师 Max Wineback 写道,他的基础测试很简单:就是看它拿到电子邮件和 Google Drive 权限后,能不能自己完成费用报销。结果是 Rockbot 前三天搞得一团糟,它没按他说的做,后来还开始出错;Dots 第一次之后就做到了,后来也一直表现不错。

这是目前关于 Dots 最具体的一份对比样本。它不测跑分,只测一件真实的、有权限边界的工作能不能被完整跑完。对打算把智能体放进财务、审批这类流程的团队来说,这个测试方法比任何榜单都更接近实际。

Justin 说 Dots 更像 Codex,而不是 ChatGPT

Justin 觉得,Dots 比 Rockbot 更专注于工作。它不太像个人助理,更像 Codex,或者协调者,也是 Slack 协作者。他写道,Slack 才是它真正出彩的地方,因为团队能直接给机器人发消息,机器人也能采取行动,比如启动新的工作流。

他还建议,Dots 本来应该做成一个独立应用。他的理由很直接:ChatGPT 很棒,Codex 也很棒,但它们是截然不同的产品,而 Dots 远远更像 Codex,而不是 ChatGPT。这句话其实是在说,OpenAI 把一个工作工具塞进了一个消费级入口里。

Spaces 是当天唯一没被吵起来的新东西

虽然其他公告几乎都引来了各种议论,但 Spaces 是个例外,重度用户一下子就爱上了。雷·费尔南多写道,他早就拿到了 OpenAI Dots 的早期访问权限,也不打算加入这场吹捧。它现在还不是 Rockbot 或 Hermes 的杀手,但 Spaces 能让智能体在应用里活跃起来,这个方向感觉是对的。

对比之下,当天的整体判断是:OpenAI Dev Day 上,其实没看到什么特别震撼的新东西,更像是把过去几个月的趋势,又确认了一遍。

主题深度讨论:Dev Day 到底确认了什么

模型已经够用够便宜,你不用再纠结用在哪

Decisions API 被 OpenAI 定位成一个判断层。它不擅长写文本,擅长分类,擅长给出零到一之间的置信度分数,擅长做决策前的判断。用户提供最终的问题和可能的答案列表,模型快速给出回应,速度比 Responses API 快十倍。

这背后是一条更深的线:模型已经够好用,也够便宜,什么都能干。播客的判断是,你不用关掉它们,也不用纠结它们该用在哪,它们可以全都做。对做产品的人来说,这意味着把不同模型往不同场景分配这件事,本身正在失去意义。

对从业者的直接含义是:过去两年靠"选对模型"建立的技术优势会快速消失,剩下的差异在流程设计、权限管理和数据接入上。Max Wineback 那个费用报销测试之所以有价值,正是因为它测的是流程,不是模型。

智能体从"回答问题"变成把事做完

Dots 是当天讨论最集中的产品,但它被讨论的方式变了。没有人问它回答得好不好,大家问的是它能不能自己把事情做完。Max Wineback 的测试只有一件:拿到电子邮件和 Google Drive 权限后,自主完成费用报销。

Justin 的判断是 Dots 更像 Codex,而不是 ChatGPT。他把 Slack 说成它真正出彩的地方,因为团队能直接给机器人发消息,机器人也能采取行动,比如启动新的工作流。这句话把智能体的价值从"对话"挪到了"动手"。

对普通人来说,最实际的变化是:以后你在工作群里 @ 的那个同事,可能不是人。而对管理者来说,问题不再是"要不要给 AI 开权限",而是"给它开哪几个应用的权限,出错了谁来兜"。

既要接进来,也要走出去

关于插件扩展,字幕里的说法很直白:既要接进来,也要走出去,也就是让 ChatGPT 能登录其他应用。这跟 Decisions API 是同一个方向的两端。

接进来,是让外部数据进入模型的判断范围;走出去,是让模型能在别人的应用里执行动作。两件事都做到,智能体才可能真的进入日常工作流,而不是停在一个对话框里。

做得越深,风险越具体。权限、审计、责任归属,这些原本属于 IT 部门的词,会越来越多地出现在产品讨论里。OpenAI 把这些能力放出来很快,但配套的治理工具还没有跟上。

下一代 AI 不再只是单人模式

Spaces 确认了另一件事:下一代 AI 不只是单人模式,它会原生支持团队和多人协作。当然,现在还在很早期,还有很多东西值得继续探索。

这也解释了为什么 Spaces 成了当天唯一零差评的公告。重度用户对模型的边际提升已经麻木,但对"让智能体在应用里活跃起来"这种形态变化仍然敏感。雷·费尔南多甚至先声明自己不打算加入吹捧,最后还是承认方向是对的。

对团队采购来说,这是一个信号:评估 AI 工具的标准要从"个人好不好用"换成"团队能不能共用同一套上下文"。个人助理型产品的天花板已经看得很清楚,接下来卷的是多人协作和跨应用执行。

觉得有用?点个 在看 和 关注 支持一下

相关学习资料