ARTICLE · 1053634
AI周报|Jev 不陪你聊天,直接替软件做选择,AI模型的新机会藏在每天重复的小判断里
TLDR:Jev 试着把邮件分流、订单判断这类小事直接交给软件处理,值得单独看一看。办公这边,Claude 和元宝少让用户搬材料;手机这边,豆包还会卡在 App 内操作。ChatGPT 开始试广告咨询,Pion 的 AI 门店仍没盈利。功能之外,本周有一组值得记住的数字:IBM 测试中,平均成功率 77.4%,连续五次都成功的任务却只有 53%。
趋势目录
01 Jev 不陪你聊天,直接替软件做选择:AI 的新机会藏在每天重复的小判断里
02 Claude 合并 Cowork、元宝接上 WorkBuddy:办公 AI 终于少让人搬一次材料
03 Siri 开始代办、豆包手机遇到 App 边界:买到助手,还不等于买到通行证
04 ChatGPT 广告开始接待顾客,Pion 还没赚到钱:会聊天之后,收入从哪来?
05 Gemini、StepAudio 与 Qwen 把等待变短:语音助手还得把结果留给人看
06 IBM 把 Agent 连测五次,Grok 留下项目笔记:好用要经得起下一次
07 OpenAI 开始按流程披露异常,减速倡议遇上诉讼:安全承诺要拿出可查的记录
关键词:Jev、TypeSafe、System One Models、业务自动化、AI周报、Claude Cowork、ChatGPT广告、豆包手机、IBM Agent评测

邮件该转给谁,订单要不要复核,这些事单看都不大,凑在一起却很占时间。本周想先聊 Jev:它不写长答案,专门在约定好的范围里做判断。我更关心的是,这种做法能不能让那些一直靠人盯着的小流程,终于值得自动化。其他新闻也有不少熟悉的烦恼:开会后的材料搬运、手机助手办事半途卡住,以及 AI 生意什么时候能赚到钱。
给三类读者的本周重点
做 AI 产品的人:先找客户每天重复做、答案范围又比较清楚的小事。Jev 提供了一种做法:让软件直接拿到判断结果。有没有少转一次工单、少让人检查一遍,比聊天框里多了什么功能更好衡量。
关心资本市场的人:低价判断能否带来更多调用,是 Jev 值得跟踪的地方。价格和速度目前主要是厂商口径,还要看真实客户怎么用、服务能否持续赚钱。
管理 AI 数字员工的人:先说清哪些情况必须交回给人。再拿同一任务多跑几次,记录谁来补救、补救花多久。IBM 那组数字,值得放进下一次采购讨论。
趋势1:Jev 不陪你聊天,直接替软件做选择:AI 的新机会藏在每天重复的小判断里

客户来了一封邮件,该转售后还是销售?订单信息有点异常,是继续处理,还是找人看一眼?这类事每天都在发生,答案往往没几个,却总要有人盯着。Jev 就瞄准这些小判断:读懂情况,给出约定范围内的结果,软件拿到后继续往下做。
它让我感兴趣的地方,是用户可能根本不用跟它聊天。假如一封邮件能直接到对的人手里,少转一次工单,价值就已经发生了。做 AI 产品的人,也许可以先翻翻客户每天手动分类、检查的那些表格,未必急着再做一个聊天框。
这里还有一笔容易被忽略的账:有些工作以前也能自动化,只是调用太贵、等待太久,做了不划算。Jev 如果能兑现它的成本和速度承诺,这些小需求可能重新值得做。眼下产品还在早期,厂商测试之外的实际表现,是接下来要看的。
当然,选项只有三个,也可能选错。真正接进业务时,拿不准的结果要有人接手,错了要能退回。一次调用省下的钱,抵不上一次严重误判;后面 IBM 的连续测试,正好讲到了这个问题。
🔴 TypeSafe 发布 Jev:把模型变成软件可以直接调用的判断步骤
9 月 15 日,TypeSafe 开放 Jev 早期体验,称其为 System One Model。它放弃自由文本生成,输出预先定义类型的选择及概率,面向分类、分流和打分等任务。官方称采用并行采样和 RLCD 训练;标价每百万输入 token 0.042 美元、输出免费,自报响应 70–500 毫秒。这些速度、成本与置信度表现仍以厂商材料为主,尚不能当作独立实测结论。官方工作流评估以其他前沿模型的预测作参考,并非真实业务答案;格式匹配的保证也不等于业务判断零错误。
详情链接:https://typesafe.ai/blog/introducing-system-one-models-and-jev
趋势2:Claude 合并 Cowork、元宝接上 WorkBuddy:办公 AI 终于少让人搬一次材料

开完会,先导出录音,再把纪要贴进聊天框,最后换个工具做 PPT。工具买了不少,人还是负责搬材料。Claude 合并 Cowork、元宝把录音接到 WorkBuddy,改的就是这段麻烦:前一步做完,能接着做下一步。
但老用户也会多想一步:今天省下来的事,会不会在迁移时加倍还回来?微软本周停用 Excel 的 COPILOT 函数。已经用进表格的人,得检查旧流程怎么接续。成品能否导出、服务停了还能不能改,比演示里多一个按钮更实际。
挑办公 AI,可以拿一份旧会议记录试到底。中间还要复制粘贴几次,生成的数字要改多少,最后同事能不能接着编辑?这些地方省了力,才是真省事。
Netflix 产品技术负责人 Elizabeth Stone 在 7 月的访谈里谈过类似的管理问题:AI 产出越来越多,团队怎样保持质量?工具帮忙搬完材料之后,仍得有人看懂内容,知道哪段能用、哪段需要重做。
🟡 微软停用 Excel 的 COPILOT 函数,侧栏助手继续保留
微软支持页明确:从 9 月 14 日起,预览阶段的 COPILOT 函数不再提供。这项功能原先可在单元格中用自然语言摘要、分类或生成文本;Copilot in Excel 仍可处理许多同类任务。本期记录的是停用日期到来,而不是微软今天才宣布。已有依赖这类公式的表格应检查迁移,不能理解为整个 Excel AI 被取消。
详情链接:https://support.microsoft.com/en-us/excel/functions/copilot-function
🔴 Claude 合并聊天与 Cowork:文档、幻灯片也留在同一段对话里
Anthropic 开始合并聊天与 Cowork,并新增 Docs、Slides,让 Design 进入对话。用户可直接修改、分享成果,演示或导出 PowerPoint/PDF,不必先判断任务该放在哪个产品。合并体验未来数周先向 Pro、Max 推出;三类创作能力为付费计划 beta,企业管理员决定启用时间。不是所有账户今天都已升级。
详情链接:https://claude.com/blog/cowork-is-now-claude
🟡 元宝 AI 录音笔打通腾讯文档、WorkBuddy:会议记录可以接着做方案
元宝升级的是 App 内的软件录音功能:边录音边拍现场图片、录制设备内声音,允许修订转写和总结,再导出腾讯文档或交给 WorkBuddy 制作方案、PPT。公告称 V2.85.0 及以上免费使用,单次最长转写 8 小时。对经常开会的人,新增价值是少搬一次素材;不同设备的兼容性和实际成稿质量仍需自己检验。
详情链接:https://weibo.com/2/detail/5343796279905188
详情链接:https://tech.cnr.cn/techgd/20260916/t20260916_527815505.shtml
🟡 Josh Elman:AI 让原型变便宜,PM 更该决定哪些功能不要做
Elman 认为,PM 的核心产物不是越来越长的需求文档,而是团队能复述的用户故事:谁为什么来,做什么,多久需要一次。AI 改变了验证顺序,可以先做原型、亲手体验,再补设计与工程方案;但 demo 便宜,不代表可靠产品也便宜。最值得带走的是他给需求评审换的问题:不是排期装不装得下,而是这个功能该不该属于这个产品。看用户是否自发回来完成核心动作,并亲自读他们在哪一步改口、放弃,比只看注册量或调用量更接近答案。
详情链接:https://www.a16z.news/p/product-management-is-still-all-about
🟡 Peter Yang:把内容流程拆成技能,但选什么、删什么仍由人把关
Yang 将访谈准备、剪辑交接和多平台包装拆解为步骤,再组织成可复用技能;公开介绍称 15 个手工步骤整理成 8 个技能,并随人工编辑持续修订。可借的是把个人标准写回流程,而非照抄标题里的“自动化 90%”。效率是作者自述,文章含商业合作,完整技能未全部公开。
详情链接:https://creatoreconomy.so/p/my-3-step-system-to-automate-90-of
🟡 给一条常用 AI 工作流做一次“退出演练”
选一条你每周都用的摘要、分类或报告流程,把原始材料、指令和已确认结果独立保存,再试一次不用原工具能否接着做。指令可放在 Markdown,也可放在能导出、有版本记录的飞书文档。只检查这一件事:服务换了或停了,重要工作是否还留在自己手里。
详情链接:https://support.microsoft.com/en-us/excel/functions/copilot-function
🟡 拿一份会议材料,测一次“少搬运”到底省了多少事
选一份允许使用、已脱敏的旧会议记录,用你已获权限的工具,从记录做到一页方案或三页汇报。只记三件事:手动搬了几次材料、纠正了几处事实、最后能否导出给同事接着改。把验收标准存成 Markdown 或飞书文档,下一次照同一标准测;先别用生成页数判断省了多少工作。
详情链接:https://claude.com/blog/cowork-is-now-claude
⚪ Netflix 产品技术负责人:系统思考与 AI 素养成为团队能力重点(7 月 19 日访谈)
7 月 19 日,Netflix 首席产品与技术官 Elizabeth Stone 做客 Lenny’s Podcast,讨论同时管理工程、产品和设计团队的经验。她将系统思考列为最看重的能力,并强调 AI 素养应成为各层级员工的共同要求。面对大量 AI 生成内容,她关注的是如何保持质量、识别有用信息,以及怎样把高标准落实到日常工作中。访谈呈现了一个具体的管理难题:产出变多之后,团队如何判断哪些值得采用。
详情链接:https://www.lennysnewsletter.com/p/netflix-cpto-on-ai-and-the-future
⚪ 前 Meta、Google 产品高管 Nikhyl Singhal:PM 需要跨过 AI 职业转型门槛(4 月 19 日访谈)
4 月 19 日,曾任职 Meta、Google 的产品高管、The Skip 创始人 Nikhyl Singhal 在 Lenny’s Podcast 中讨论产品经理的职业转型。他判断未来两年 PM 岗位将经历剧烈变化,并以“一半产品经理面临风险”表达担忧。访谈重点涉及阻碍人们重新学习的心理因素、在 AI 使用中找到正向体验,以及知名公司履历的价值变化;这一风险比例属于嘉宾预测。
详情链接:https://www.lennysnewsletter.com/p/why-half-of-product-managers-are-in-trouble
趋势3:Siri 开始代办、豆包手机遇到 App 边界:买到助手,还不等于买到通行证

让手机替自己办事,终于有了更多可以实测的产品。Siri 开始推出英文测试版,豆包手机也已开售。不过,每经的测试里,有些 App 能打开,接下来的操作却没做完。对用户来说,停在这里,活儿还是得自己干。
Google Home 划出的范围更明确:第三方 Agent 走授权接口控制设备,开门锁不在开放范围里。同样叫“代办”,到底能办到哪一步,要看服务方开放了什么。
所以,买手机助手之前,最好先拿自己常用的 App 试一轮。发布会上的顺畅流程,未必包含你每天要用的服务。做应用的团队也得决定:哪些操作可以交给外部助手,哪些必须让用户亲自确认。
🔴 Siri AI 开始推出英文测试版:个人资料、屏幕内容和应用操作接在一起
苹果 14 日确认 Siri AI 随新系统开始推出英文 beta。用户可以跨消息、邮件找资料,围绕屏幕内容提问或添加日程,独立 Siri App 支持跨设备接续对话。中国大陆暂不可用,欧盟部分设备也受限;Outlook 等新增操作仍列为后续支持。此次增量是从预告转为推出,不把计划能力一并算作上线。
详情链接:https://www.apple.com/newsroom/2026/09/siri-ai-a-profoundly-more-capable-and-personal-assistant-is-here/
🟡 Aaron Levie:防止 Agent 读到不该读的资料,不能只禁下载
Box CEO 把企业 Agent 的矛盾说得很具体:资料全锁住就做不了事,全放开又管不住。他借内容分类控制强调,规则要管到 AI 的读取路径,而不只是文件下载。采购时应检查助手搜索、问答能否遵守原有资料权限。帖中部分异常监控能力仍在开发,不能把产品方向都写成已上线。
详情链接:https://x.com/levie/status/2099550035239424465
🔴 豆包手机正式开售:真机测试仍卡在部分头部 App 内操作
搭载豆包手机助手消费者版的 NaviX Ultra 于 16 日开售,5999 元起。每经记者当日测试中,助手能打开微信、小红书、美团外卖、淘宝,但相应发帖、下单等操作未完成。上周已报消费者版,本次只记录开售和实际使用边界。结果受任务、版本影响,不能推成所有操作都失败;但买到 AI 手机,也不等于常用 App 已全部允许它代办。
详情链接:https://www.nbd.com.cn/articles/2026-09-16/4583561.html
详情链接:https://finance.sina.com.cn/wm/2026-09-16/doc-inirzfsy2923716.shtml
🟡 Google Home 开放 Home MCP:第三方 Agent 能控制设备,但不能开门锁
Home MCP 开始早期开放,让兼容助手查询设备状态、查看事件历史并执行控制。当前需 Google Home Premium Advanced 订阅、Cloud 项目及授权配置,并非装个聊天 App 就能使用。官方明确禁止开门锁等敏感动作,自动化规则的创建与管理也尚不支持。家人应知道共享家庭的数据与设备会被接入;授权可撤销,不等于执行永远可靠。
详情链接:https://developers.home.google.com/mcp/home
详情链接:https://support.google.com/googlehome/blog/467705013/introducing-home-mcp-enabling-your-agent-to-interact-with-your-home?hl=en
🟡 Firefox 接入 Mistral Small 4:让用户留在浏览器,也保留换模型的选择
Mozilla 9 月 16 日宣布合作,Mistral Small 4 将进入 Firefox Smart Window beta,美加用户获得新模型选项,并向法国扩展测试和法语支持。官方强调仍可选择其他模型;不能写成全球 Firefox 默认切换到 Mistral。浏览器替人承接更多资料时,选择权和迁移能力仍值得保留。
详情链接:https://blog.mozilla.org/en/firefox/mozilla-mistral-partnership/
趋势4:ChatGPT 广告开始接待顾客,Pion 还没赚到钱:会聊天之后,收入从哪来?

ChatGPT 想把广告点击后的生意也留下来。用户点开 Sponsored Agents,可以继续问品牌尺寸、用途,不必立刻跳到另一个页面。Meta One 走的是打包路线,把 AI 额度和社交、商家功能放进同一份订阅。两种尝试都刚起步,顾客愿不愿买单,还要往后看。
Pion 的情况更直白:AI 已经在经营商店和咖啡馆,门店还没盈利。经营动作能连续做下去,选品和获客的问题照样存在。同周的讯兔融资、Anew 药物研发,也各有下一道题:客户是否持续付费,实验能否产生有用的结果。
Crusoe 则拿到了新融资,并披露大额合同。看这类消息,别把投资人打来的钱、客户承诺购买的金额和已经收到的收入加在一起。数据中心还得建出来、通上电,合同才有机会变成收入。
周日,前 Snap、Discord 产品负责人 Peter Sellis 在访谈中说,增长主要来自核心产品。这话放在本周很合适:广告能聊得更久、订阅能装进更多功能,用户下次为什么还来?
🔴 ChatGPT 测试 Sponsored Agents:点完广告,直接向品牌追问
Sponsored Agents 让用户点击广告后,进入明确标注的品牌对话,继续问尺寸、用途等问题;它与原有 ChatGPT 对话及独立回答分开,目前只向美国部分广告主测试。同时,广告管理接入 HubSpot、美国 Shopify 商家,并可用自然语言创建与分析投放。新增不是“ChatGPT 有广告”,而是把点击后的咨询也留在平台内;转化提升尚无公开验证。
详情链接:https://openai.com/index/reimagining-advertising-with-ai/
🔴 Meta One 打包社交功能与 AI:个人套餐 7.99 美元起
Meta 将社交增强功能、更高 AI 使用额度和商家工具组织为 Meta One。单产品 2.99 美元/月起,个人组合 7.99 美元起,创作者与商家组合 14.99 美元起,核心服务保持免费。公司公布的 1500 万是订阅与试用合计,不能当付费人数。它在测试的是:修图、表达和客户回复能否一起让人续费,而不是再卖一个孤立聊天框。
详情链接:https://about.fb.com/news/2026/09/introducing-meta-one-subscription-service-more-features-ai/
🟡 讯兔科技获超 3 亿元 B 轮:从会议记录延伸到整段投研工作
中证报 14 日报道讯兔近日完成超 3 亿元 B 轮,中保投资、广发信德等参与。公司自报 Alpha派服务超 12 万专业用户、覆盖逾 8000 家机构;此前推出的 PaiWork 整合数据、研究工具与知识库,形成更完整的投研流程。融资是本次新增,工作台不是今日新品。机构覆盖不等于付费客户,公司也未给出收入、现金流或具体续费率。
详情链接:https://www.cs.com.cn/ssgs/01/2026/09/14/detail_2026091410039077.html
🔴 Andon 发布 Pion 研究预览:让 Agent 经营公司,真实门店尚未盈利
Pion 把 Andon 用于经营实验的持续型 Agent 平台开放为研究预览,可连接邮件、电话、银行及浏览器等工具,需申请候补名单。公司明确,旧有自动售货机实验的盈利不能代表更复杂的生意:商店和咖啡馆目前仍未盈利。它提供的是观察 AI 能否长期经营、哪里会失控的实验入口,不是已被验证的自动赚钱产品。
详情链接:https://andonlabs.com/blog/why-we-built-pion
详情链接:https://news.ycombinator.com/item?id=49700477
🟡 Anew Labs 获 2.9 亿美元融资报道:字节分拆团队押注药物研发流程
Reuters 援引消息人士称,字节分拆的 AI 药物研发公司 Anew Labs 融资 2.9 亿美元。其官网展示文献、结构分析、候选设计与实验反馈相连的研发流程,17 日又列出 AnewDDE 技术报告。值得跟踪的是实验能否反过来改善设计,而非融资金额本身。目前没有可核收入、外部客户复购或临床成功数据,也不能理解为已向所有用户开放。
详情链接:https://www.moneycontrol.com/news/business/bytedance-s-ai-drugmaking-spin-off-raises-290-million-at-1-5-billion-valuation-sources-say-14031049.html
详情链接:https://anewbt.com/research/design/
详情链接:https://anewbt.com/
🟡 Rillet CEO:能从小切口做,就别一开始卖整个平台
Kopp 的建议有个反差:Rillet 自己必须先做较完整的 ERP,才有资格替换原系统,因此他更清楚宽产品带来的支持成本和功能牵连。他们把早期销售聚焦到 SaaS、AI 公司的收入确认、发票和 ARR 跟踪。另一条值得记住:隐身研发不等于闭门造车,期间已有客户在生产中使用并提出负面反馈。这里讲的是降低创业难度,不是一个功能就能替代 ERP。
详情链接:https://speedrun.substack.com/p/nicolas-kopp-take-the-wedge-every
🟡 Lenny × Tom Orbach:AI 可以批量做内容,但增长还得给人一个试用理由
《60+ new creative growth ideas》讨论所有团队用相似打法时如何被注意。公开部分里,Bland 把语音 Agent 做成路人能拨打的广告电话,让试用本身成为传播;作者也提供适合交给 Agent 的素材格式。对 AI 产品团队,可借鉴的是把核心能力变成一次具体体验,再观察是否带来合格用户,而非用 AI 多写几十条广告。热闹和访问量都不等于留存。
详情链接:https://www.lennysnewsletter.com/p/60-creative-growth-ideas
🔴 Crusoe 宣布预计 39 亿美元 F 轮的首次交割:合同还要变成供电与交付
Crusoe 9 月 17 日公告,预计 39 亿美元 F 轮已完成首次交割,投后估值 309 亿美元;公司自报全平台合同总价值超过 1400 亿美元,资金用于大型园区、模块化设施与云业务。首次交割不等于整轮已全部到账,合同总额也不等于当期收入。对资本市场,接下来要看建设进度、供电和客户实际使用。
详情链接:https://www.globenewswire.com/news-release/2026/09/17/3364326/0/en/crusoe-raises-3-9-billion-series-f-for-its-vertically-integrated-ai-infrastructure-platform.html
🟡 前 Snap、Discord 产品负责人 Peter Sellis:增长主要来自核心产品
9 月 20 日,Snapchat 首位产品经理、前 Discord 产品负责人 Peter Sellis 做客 Lenny’s Podcast,回顾消费产品的增长与商业化。他认为增长通常来自核心产品,并讨论了 Snapchat 广告业务为何未能充分发挥潜力,以及优秀产品经理需要具备的能力。访谈把增长与商业化放回产品本身:用户为什么使用、为什么留下,是讨论广告和变现之前绕不开的问题。
详情链接:https://www.lennysnewsletter.com/p/90-minutes-of-unfiltered-product
⚪ Instagram 负责人谈 AI 时代的团队变化:四至六人通才小组与创作者身份(7 月 9 日访谈)
7 月 9 日,Instagram 负责人 Adam Mosseri 在 Lenny’s Podcast 中讨论 AI 对产品组织和内容平台的影响。他描述了产品团队从十余名专才组成的团队,转向四至六人通才小组的变化,并介绍融合产品、设计、数据分析和研究职责的 product staff 角色。内容方面,他认为 AI 生成内容的增加可以成为 Instagram 的发展助力,创作者身份与真实感是平台需要回应的问题。
详情链接:https://www.lennysnewsletter.com/p/adam-mosseri-ai-is-a-tailwind-for
趋势5:Gemini、StepAudio 与 Qwen 把等待变短:语音助手还得把结果留给人看

跟语音助手说到一半,它去查订单了,留下你等。Gemini 3.8 Live 和 StepAudio 3 正在减少这种停顿,让调工具时的对话继续。Qwen 同传则试着少慢半拍,并分清是谁在说话。日常用起来,这些改动比又多一种音色更容易被注意到。
聊天顺了,结果也得看得见。地址到底改成功没有?会议里那句话是谁说的?这些信息最好能留在屏幕上,方便回看、纠错。否则助手一直在说话,人却不知道事情办到了哪里。
🟡 阶跃 StepAudio 3:一边对话一边调工具,TTS 标价 2.5 元/万字符
截至 15 日,官方文档已列出 StepAudio 3 系列。Realtime 把打断识别、边想边说、异步工具执行接进连续对话;Gen 可按描述编排对白与环境音。TTS 标价为 2.5 元/万字符,Realtime、Gen、Music 等为限时免费预览,不是永久免费。做客服或内容工具的团队,多了可分项接入的语音能力;实际效果、账户开放与完整任务成本仍需测试。
详情链接:https://platform.stepfun.com/docs/zh/guides/models/stepaudio-3-realtime.md
详情链接:https://platform.stepfun.com/docs/zh/guides/pricing/details.md
🟡 Pavan Muddireddy:语音替你下指令,屏幕仍要让你看清结果
Mistral 音频研究负责人在访谈中以点餐为例:没有菜单,用户要记住听到的选项,再比较选择。他认为语音往往适合与可视界面结合,保留结果、检查与控制,而非一概替代屏幕。节目与 Mistral 合作制作,相关实验是过去经历;这不是纯语音必败的证明,而是给任务型助手的一条设计提醒。
详情链接:https://www.youtube.com/watch?v=ixu0H8bsCts&t=5792s
🟡 Gemini 3.8 Live:查资料、调工具时,语音对话不必停住
09月15日原文,本期补收。Gemini 3.8 Live 及 Extended Thinking 通过 Live API 开放,支持后台调用工具时继续输出语音,并结合视觉输入处理任务。客服查询、陪练等场景可以少一些“请稍等”的空白,但说话流畅不证明后台操作成功,仍要明确反馈结果。同篇提及的 3.5 Transcribe 上个月已发布,本期不重复计作新模型。
详情链接:https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/
🟡 Qwen3.8-LiveTranslate:同传不仅抢半秒,还要分清谁在说话
Qwen 官方研究页标注 9 月 18 日发布,采用 Interleave 架构,关注多说话人场景下的翻译与说话人识别。官方测试中,平均滞后指标 LAAL 从 2.8 秒降至 2.3 秒。这个数字是指定评测口径,不是任何会议都只延迟 2.3 秒;跨会话长期记忆仍在后续方向中。
详情链接:https://qwen.ai/blog?id=qwen3.8-livetranslate
趋势6:IBM 把 Agent 连测五次,Grok 留下项目笔记:好用要经得起下一次

IBM 的测试里,平均成功率是 77.4%;要求同一个任务连做五次、次次成功,比例就降到 53%。这很像一个常见场面:自己演示时很好用,换同事来做,却卡在意想不到的地方。
本周几项更新,各自在补这种落差。Grok Build 把项目约定写成笔记,方便下次接手;Real-SWE 把真实业务规则放进代码任务;OpenAI 的内部案例则讲到测试、审查和上线批准。写完代码之后,还有不少工作。
Kimi K3 接入 Bedrock,让已经用这套云服务的公司多了一个选择。采购和权限容易接上,实际任务仍得跑。拿一项每天要做的小事连试五次,把失败、人工补救和费用都记下来,比只保留最顺的那次演示有用。
🟡 小红书 AllSpark Iris:搜索 Agent 权重与评测代码已公开
Iris-mini/pro 的权重与评测框架已可获取,数据构造和训练流水线仍待开放。它训练的是决定搜什么、读什么、何时证据足够的搜索过程,不是小红书 App 新增一个消费功能。官方对照也显示,同一模型换上下文处理方式,成绩会明显变化;选底座要连同工具与执行流程一起测。本文收录当前开放资产,不把较早论文写成今日首发。
详情链接:https://github.com/AllSpark-Research/Iris
🟡 Real-SWE 私有业务代码评测:会写代码,还得懂这家公司的账怎么算(九月补读)
Specific 把计费、税务、客户迁移等私有业务代码任务交给编程 Agent,公开页面所列 10 个任务中,6 个的总体解决率低于 15%;领先组合 Fable 5.1+Claude Code 为 38.8%,每项任务重复运行 8 次。这里比名次更有用的是失败原因:接错系统、遗漏业务规则,或修了新功能却破坏旧行为。样本小、不同模型搭配各自工具框架,完整任务未获独立复现,不能推出“AI 只能做三成工作”。
详情链接:https://withspecific.com/benchmarks/real-swe
🟡 Grok Bot 设计师的实践:两张截图加语音派活,先把设计规矩教给 Agent
Lenny 发布的节目文字介绍中,Grok Bot 设计师 John Bai 用两张 Figma 截图和语音备忘录派活,让 bot 通过 Figma MCP 制作多个方案;前提是预先约定画板、间距和命名。Peng Zheng 则把照片或地点消息接到查坐标、生成 3D 配图和网站发布,并为邮件、日历等任务设置职责明确的专用 bot。这不是又一次宣布云端 Agent,而是具体的设计交接方法:把输入、规则和交付位置交代好,人离开电脑,任务才有机会继续。案例来自产品团队,不代表陌生用户开箱即有同样效果。
详情链接:https://www.lennysnewsletter.com/p/how-i-ai-how-two-spacexai-designers
🟡 IBM ALTK-Evolve:别只看 Agent 成功过,要看同一任务能否连续成功
09月15日原文,本期补收。IBM 用 GPT-4.1 的 ReAct Agent 在 AppWorld 重复跑任务:平均成功率 77.4%,五次全成功的任务比例却只有 53%。研究通过找出容易改变选择的步骤、补充执行准则,将两者差距从 24.4 缩到 12 个百分点。重要的不是又一张榜单,而是验收方法:能重试挑结果的写作,和每次都该正确的业务操作,不该用同一个成功指标。
详情链接:https://huggingface.co/blog/ibm-research/altk-evolve-consistency
🟡 走进 OpenAI 软件工厂:代码写得快之后,谁负责把它安全交到用户手里?
Orosz 走访 OpenAI 后发现,Codex 不只服务工程师,财务、招聘等团队也通过岗位插件使用它。更关键的是交付循环:人定义目标,Agent 获取内部资料、写代码、修测试、分工审查,再跟踪上线表现,把性能问题送回修复。对管理者的启发是,买工具之外,还要接通资料、验收标准和责任分工。内部版本有更深的系统接入及宽裕的 token 预算,不能照搬为普通公司的效率承诺;文中上线仍需人工批准,故障助手也不会自行执行缓解措施。
详情链接:https://newsletter.pragmaticengineer.com/p/openai-software-factory
🟡 Kimi K3 上线 Amazon Bedrock:采购和缓存一起接入现有云平台
AWS 9 月 18 日宣布 Kimi K3 可通过 Bedrock 调用,提供原生视觉、百万 token 上下文与显式提示缓存。此次增量是部署渠道,K3 并非本周首次发布。官方说明缓存写入收费更高、命中读取可享折扣;是否省钱取决于上下文重复率。跨区域推理需按数据驻留要求选择配置。
详情链接:https://aws.amazon.com/blogs/machine-learning/introducing-kimi-k3-on-amazon-bedrock/
🟡 Grok Build 加入项目记忆:下次接手前先读上次留下的约定
9 月 16 日的更新会在回合结束后整理稳定的项目事实、决定及习惯,以 Markdown 主题文件保存;后续会话读取相关内容,当前指令优先于旧笔记。官方将临时状态、未定结论与秘密排除在记忆目标之外。可查看和纠正的笔记,比无法解释的“它记得我”更利于团队交接。
详情链接:https://x.ai/news/grok-build-memory
⚪ ChatGPT Work 产品负责人:AI 承接执行后,人的工作转向定方向(8 月 30 日访谈)
8 月 30 日,OpenAI ChatGPT Work 产品负责人 Tara Seshan 在 Lenny’s Podcast 中讨论持续型 AI 同事的产品方向。她用“划桨到掌舵”形容人的角色变化:当 AI 承接更多执行,判断方向、提出更有雄心的目标变得更重要。她还介绍了面向未来两三个月模型能力设计产品的思路,并区分用于思考的写作与用于汇报的写作,讨论哪些工作仍需要人亲自投入。
详情链接:https://www.lennysnewsletter.com/p/ais-third-era-the-rise-of-persistent
趋势7:OpenAI 开始按流程披露异常,减速倡议遇上诉讼:安全承诺要拿出可查的记录

上周 Dario 呼吁前沿模型减速,这周讨论有了后续。OpenAI 公布模型异常行为报告流程;另一边,行业协调减速面临反垄断诉讼。前者是披露安排,后者还在诉讼阶段,法院尚未作出违法裁定。
对普通用户,问题没有那么远:自己的对话会不会被真人看到,孩子能不能放心使用,助手误操作后能否查到记录?Project Lily 的报道、儿童产品评估和独立测试方案,分别在回答其中一部分。
企业买 AI 服务时,也可以问得直接一点:出事故怎么通知,数据由谁处理,外部评估到底查了什么?把答复写进合同、留好记录,比销售现场一句“我们很重视安全”更管用。
🟡 Common Sense 评估 Perplexity:带来源的答案,不等于适合孩子独立使用
9 月 15 日更新的评估将 Perplexity 评为“不可接受风险”,指出以 15 岁身份注册的账户仍多被当成成人,Academic 模式也完成了多数测试作业。主要测试在美国进行,时间为 5 至 8 月,包含逾 1200 次交互;未评估 Comet。它是特定范围的产品评估,不是监管禁令,也不能把历史测试中的问题说成今天刚发生。
详情链接:https://institute.commonsensemedia.org/risk-assessments/perplexity
⚪ Tomasz Tunguz 追问 AI 减速:谁定速度,谁付代价?
Tunguz 把减速争论拆为安全、劳动、经济、地缘竞争和监管俘获等立场,提醒读者:各方想争取的时间不同,却没有说清可执行的速度。比重复上周的减速倡议更值得追问的是,规则由谁制定、是否增加新进入者的负担。这是投资人的分析,不代表行业已达成协议,也不是对企业动机的事实认定。
详情链接:https://tomtunguz.com/what-does-the-pause-mean
🟡 Project Lily 报道:ChatGPT 对话的匿名化,不等于没有真人阅读
09月14日原文,本期补读。404 Media 根据内部材料与实际样本报道,OpenAI 外包审核人员会阅读真实对话,为回答评分以改进模型。公开正文称审核者看不到用户名,OpenAI 尝试去除个人信息,但承认敏感内容仍可能漏过。这不是所有聊天都会被人工阅读的证据,也不能外推到所有企业产品。读者需要分清匿名化、是否用于训练,以及谁有权查看这三个不同问题。
详情链接:https://www.404media.co/inside-project-lily-the-humans-reading-your-chatgpt-chats/
⚪ Cohere 的反对意见:支持独立测试,不代表让头部实验室自己定规则
09月13日原文,本期补读。Gomez 赞成独立测试,但反对少数领先公司同时决定标准、参与资格与行业速度,主张按可验证的危险能力和使用场景设门槛。相比重复“要不要减速”,这篇提供了更具体的分歧:小公司是否有公平的认证路径,审查者的利益能否独立。Cohere 本身也是竞争者;其批评值得纳入,却不能据此断言倡议者动机不纯,或安全风险不存在。
详情链接:https://cohere.com/blog/who-gets-to-define-the-rules-for-ai
🟡 Rune Kvist:Agent 卖给企业,还要有风控愿意签字的证据
AIUC 联合创始人把企业采购障碍拆成技术控制、独立测试和责任安排,主张认证与保险一起帮助客户决策。节目谈及季度测试、泄漏和幻觉风险,以及保险的范围、限额与成本。对采购方,问题应是“测的是哪个版本、出了什么事由谁负责”,而不只是“有没有证书”。这是认证供应商的主张;季度审核能否跟上更新、保障是否够用,仍要看具体证据。
详情链接:https://www.latent.space/p/aiuc
🔴 OpenAI 建立模型异常行为披露框架,公布六份报告
9 月 16 日,OpenAI 发布跟踪、调查和披露模型异常行为的流程,并附上过去六个月观察到的六份报告。公司希望不再等到凑齐一批事件或发布新模型才披露。这里的新增是报告制度与公开材料,不是同一天新发生六起事故;披露流程也不等于安全问题已经解决。
详情链接:https://openai.com/index/model-misalignment-reporting-framework/
🟡 AI 减速倡议引发反垄断诉讼,尚无违法裁定
AP 9 月 19 日报道,付费用户起诉 Anthropic、OpenAI、SpaceXAI 与 Google,指控协调减速损害订阅价值。这是诉讼中的主张,不能当成法院已确认存在非法协议。安全合作怎样兼顾竞争,开始面对具体的法律争议。
详情链接:https://apnews.com/article/960af4308161eaf4ed13c383b0ce1c1b
🟡 Google 确认 Gemini 测试曾访问三家真实公司的系统
Reuters 经 ABC 9 月 19 日报道,事件发生于 5 月的第三方安全测试,本周才公开。Google 表示模型发现对象是真实公司后停止,并已联系相关机构;测试方称修复了已知问题。它提醒采购方检查测试环境与真实系统的隔离,不能写成面向用户的 Gemini 本周连续攻击三家公司。
详情链接:https://www.abc.net.au/news/2026-09-19/gemini-google-ai-hacks-three-companies/107172128
🟡 Transluce 提出驻场评估的工作清单:要看内部使用,也要看训练过程
研究团队建议独立评估者检查多 Agent 运行、训练中异常行为的形成、员工与模型互动,以及未发布模型的内部机制。它把驻场监督拆成可以开展的试点,但仍是评估方案,不代表全部实验室已部署,也不能替代网络安全隔离。作为 Newsletter 线索补核收录,不把页面采集时间当作首发日期。
详情链接:https://transluce.org/embedded-evaluations

关于我们
探微观智聚焦AI产品和创作,思考下一代AI原生产品和交互灵感。从ToC产品创新,到模型、平台、生态、资本、观点报告等上下游迭代趋势,以一线产品实战视角切入,拆解可复用的“AI产品灵感基础模块”,每日更新。

联系我们:进入探微观智公众号,选择“企业合作”。
🤔Grok Bot 是怎么一个月做出来的?Roman Ugarte (Cursor前增长负责人/ Grok Bot PM) 复盘 🤔为什么公司正在变成"一系列 loop"|Anish Acharya(a16z)对谈 🤔AI 的第三个时代:持久化 AI 同事的崛起 🤔今天最值得去的 100 家科技公司,Lenny 只用了三条标准 🤔Anthropic 最新 AI 工作手册:AI 干活不累了,累的是告诉它干什么 🤔Anthropic分享的“Eval as PRD”:适用范围,才是这句话的正文 ❤️人类简史作者最新观点:未来十年,AI的战场会从"注意力"转向"亲密关系" 👋谁在真正使用 AI Agent?Claude 和 Codex 给出了两种相反答案 💰AI 需求侧到底有多少真实收入?2026年AI经济状况解读 👧我做了一个写人生自传的 Skill:不写彩虹屁,写一个人为什么成为自己
☯️从罗振宇到冯友兰:AI时代人类生存指南 ☯️李继刚:人与AI的关系—写日记可能是人在AI时代最无悔的事情 👨Manus的 AI 产品心法:从“品味”到“护城河”、从“取舍”到“增长”的深度解读 ☁️A16Z Big Ideas 2026:关于2026年科技趋势的47条“剧透”,AI 走出屏幕,物理世界可“编程”
🐒给打工人:AI赋能人工,从入门到精通.pdf 🐒给老板:AI替代人工,从入门到精通.pdf ✍️AI-native组织协作指南.pdf 💰AI公司的商业化难题:别再用 ToC 和 ToB 给 AI 公司贴标签了 🤖为什么 Anthropic 能做出大厂做不出来的模型和 Agent? 🦞龙虾系列08|我把 Karpathy 的"个人知识库"工作流做成了一键可用的工具 🦞龙虾系列07|Anthropic 在命令行里养了 18 只宠物:Claude Code “Buddy”宠物系统对于“效率×陪伴”产品的四个启示 🦞龙虾系列06|拆解Claude code源代码,发现好的Agent架构和好的公司管理,底层逻辑是相通的 🦞龙虾系列05|我用7个Agent模拟了一场“艺术与科技跨界孵化”的讨论:AI时代,最适合诞生下一个“达芬奇” 🦞龙虾系列04|OpenClaw 和它的四个"挑战者"都在做什么 🦞龙虾系列03|解剖Agent,发现其实没有“魔法”,Agent = 模型 + Harness 🦞龙虾系列02|关于 OpenClaw 帮你赚钱的机会:A2A 生态起来后,钱会流向哪里 🦞龙虾系列01|OpenClaw 与 AI Agent 时代:当 How 被自动化,人还剩下什么? 👾Web 4.0:当 AI 不再需要人类“批准”时,会发生什么?软件的用户不再是人类,AI直接帮你赚钱 ❤️🔥ELYS 深度测评:当社交圈里住进了硅基生命,价值其实不在社交本身(含50个独家邀请码) 🪄一手测评AnyGen:字节版NoteBookLM + Manus,幻觉少、不废话!把“麦肯锡能力”开放给每个人,还能做漫画和3D粒子魔法特效
🙋AI周报|云agent、Genspark和Cognition自己训模型、Anthropic呼吁模型“减速”聚焦卓越运营/一致性/可解释性/评测(9.7–9.14) 🙋AI周报|Astra拿高分,英伟达买入口,Grok Bot请全公司试用,WorkBuddy 和千问争的是下一次交接 🙋AI周报|豆包进飞书,Claude进Chrome,OpenAI停供Cursor,应用公司长出AI Lab 🙋AI周报|Stripe 买 OpenRouter,DeepSeek 改价,宇树被追问 🙋AI周报|DeepSeek Harness 之后,AI 产品开始交运行时答卷 🙋AI周报|AI越来越便宜,为什么你的工作反而更难了? 🙋AI 周报|GPT 降价 80% 之后,AI 更值钱的是“敢放权” 🙋AI 周报|Opus 5 删掉 80% 提示词后,Agent 行业开始重估“Harness 脚手架”
