夜雨聆风学习资料网

ARTICLE · 1019435

AI 日报|探访 OpenAI 智能体软件工厂

AI 日报|探访 OpenAI 智能体软件工厂

今天最值得关注:Gergely Orosz 探访 OpenAI:Codex 驱动的智能体软件工厂

AI 日报 · 2026-09-16

今天从 AI HOT 日报中精选 7 条。主新闻重点展开,其余 6 条压缩成快读:信息更少一点,判断更清楚一点。

01

Today's Lead

今日头条

Gergely Orosz 探访 OpenAI:Codex 驱动的智能体软件工厂

技术博主 Gergely Orosz(The Pragmatic Engineer)实地探访 OpenAI 总部,访谈七位工程师与工程负责人,写下这份内部实录:自约一月起,Codex 和 ChatGPT Work 已成为公司几乎所有工作的基础——而且这不是自上而下的命令,是自发形成的。

数据很直白:四个月内,财务、招聘、法务等非工程部门的 Codex 使用率从约 0% 冲到 90%;加入「/goal」长任务能力后,整体使用率从 60% 升至 90%,有工程师的会话线程一开就是几天。自今年一月起 IDE 使用率持续下降,PR 与代码评审的流程正在被重新构想。

更值得记下的是那座「智能体软件工厂」的运转方式:Perf Factory 监控生产环境,自动派出 Codex 智能体定位并修复性能回退;事故响应智能体 Sevbot 同样基于 Codex——收集现场、给出缓解方案、回答工程师提问,但暂不自动执行操作。所有文档已搬进源代码仓库,新员工入职第一课是「有问题先问 Codex」。Orosz 的观察是:工程细分正在消失,判断力与主动性成了核心竞争力,过去「不可能」的迁移与重写,如今一两名工程师就能完成。

需要注意的口径:OpenAI 内部版 Codex 接入了几乎全部内部系统,远比外部版本强大,这是一次内部实证,不是产品评测。

来源:https://newsletter.pragmaticengineer.com/p/openai-software-factory

02

Fast Read

模型与产品快读

01|Perplexity 自研 CobbleDB 替代 AWS DynamoDB,每年最多可节省一亿美元

Perplexity 宣布自研键值数据库 CobbleDB 替代 AWS DynamoDB 承接搜索热读取:核心基础设施由两名工程师带领数百个持续运行的编码智能体在两个月内完成,约四万行 Rust。生产实测批次读取中位延迟从 31.4ms 降至 5.60ms(约 5 倍),P99 从 123ms 降至 24.2ms。成本口径需分开看:「每年最多节省一亿美元」出自 CEO Aravind Srinivas 的宣布,官方研究博客的口径是较 DynamoDB 至少节省 20%。开源已列入计划。

来源:https://x.com/AravSrinivas/status/2099957318935028173

02|Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking

Google DeepMind 发布两款近实时语音对话模型:Gemini 3.8 Live 面向规模化与成本效率,Extended Thinking 版本面向复杂多步任务,可「边推理边说话」。两者均支持 97 种语言中途自动切换、近实时视觉理解,生成音频嵌入 SynthID 水印。发布即登顶 Artificial Analysis 语音到语音质量指数(82.6 分),把 9 月 15 日刚登顶的 GPT-Live-1(81.5 分)挤到第二。已通过 Gemini API、AI Studio 上线,扩展思考版同时进入 Gemini Live 应用与 Workspace。

来源:https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking

03|阶跃星辰发布 StepAudio 3 系列语音大模型,多款在 Artificial Analysis 榜单全球第一

阶跃星辰发布 StepAudio 3 系列,一次推出 Realtime、ASR、TTS、Gen、Music 五款模型。Realtime 支持原生全双工对话,推理与语音生成并行、工具调用异步执行,在 Artificial Analysis Conversational Dynamics 榜单以 98.9% 综合得分全球第一、语音推理榜 99.7% 同样第一;ASR 词错误率 1.7%,并列全球第一(评测数字经澎湃新闻、凤凰网科技等多家媒体报道转述)。与 Gemini 3.8 Live 同日发布,构成今天语音赛道的双线。

来源:https://mp.weixin.qq.com/s?__biz=MzkyNTYxNzg5Mg%3D%3D&mid=2247488074&idx=1&sn=7d92ce0f0098ec0c53b243df4709b522

03

Industry & Research

行业与研究快读

04|Vercel 将 inbound 销售团队从 10 人压缩至 1.25 人,AI 销售开发智能体年成本仅数千美元

Vercel COO Jeanne DeWitt Grosser 在 The Information 访谈中给出数据:inbound 销售开发实现 90% 自动化,团队从 10 人压缩至 1.25 人;自建客服智能体承接 93% 的支持工单;两条产线的年度基础设施成本都只有几千美元(SaaStr 转述口径为约 5000 美元/年),销售开发智能体 ROI 达 32 倍。她的判断值得抄下来:瓶颈不是模型,是已被编码固化的工作流。

来源:https://tomtunguz.com/single-digit-thousand-dollar-ai-sdr

05|Trail of Bits 批评 1Password 的 AI 补丁基准存在误导,并发布两个补丁验证 Agent 技能

安全公司 Trail of Bits 发文批评 1Password 8 月 6 日发布的 FLAWED 报告:其「AI 干净修复率仅 26%」的头条数字受四项实验设计选择影响失真——刻意指示智能体应用错误修复的提示词占 22% 数据、36% 的试验禁止编译测试、样本为刻意挑选的困难漏洞、模型未在最高推理档位测试。按其重新分析,剔除对抗性指令与禁测试试验后,3067 个补丁中 86% 成功阻断给定漏洞利用。公司同步开源 post-patch-validation 与 review-walkthrough 两个 Agent 技能。一场典型的评测方法学之争,值得做基准的人细读。

来源:https://blog.trailofbits.com/2026/09/15/1passwords-ai-patching-benchmark-is-misleading

06|404 Media 曝光 OpenAI 莉莉计划:人工审核 ChatGPT 聊天记录以优化模型

404 Media 披露 OpenAI 内部代号为「莉莉计划」(Project Lily)的项目(以下为该媒体报道口径):时薪超 50 美元的提示词审核员查看匿名化后的真实用户聊天记录,评估回复是否切题、是否出现 AI 式话术、说教与谄媚口吻。报道同时指出风险面:匿名过滤仍可能漏掉个人数据,会话版本附带用户记忆摘要,部分用户曾在对话中明确要求保密。OpenAI 向该媒体承认过滤环节存在遗漏可能,并在报道发布后更新了帮助页面。人工审核优化模型在各家普遍存在,Google 与 Anthropic 均有公示。

来源:https://www.ithome.com/1/002/750.htm

The End

今天值得带走的判断

探访稿里的软件工厂、两个月的数据库和压缩到 1.25 人的销售团队,今天都在说同一件事:智能体开始接管真实工作。下一个问题不再是它们能做什么,而是人该站上哪一道工序——OpenAI 给出的答案是判断、品味和对结果负责。

本文根据 AI HOT 2026-09-16 日报整理。摘要用于快速了解,具体事实与完整上下文请以原始来源为准。

END

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

相关学习资料

返回首页浏览学习资料