夜雨聆风学习资料网

ARTICLE · 1142372

AI周报|ChatGPT Intelligent UI把回答变成工具,Claude Haiku降价(9.28–10.8)

AI周报|ChatGPT Intelligent UI把回答变成工具,Claude Haiku降价(9.28–10.8)

假期回来,AI又换了几张面孔。

ChatGPT开始把回答做成能点、能算的小工具;Anthropic让处理重复工作的Haiku更便宜,还给Sonnet的缓存打了五折。

另一边,dots想继续跟进你关电脑后的工作,OpenAI甚至拉上合同软件公司Ironclad,一起教模型怎么设置审批流程、还继续深化和Atlassian 关于企业上下文管理的合作。

LongLake收购Amex GBT让AI roll-up收购进入商务差旅,这几件事放在一起,问的其实是一个很日常的问题:从你提出需求,到事情真正办完,中间还要自己折腾多少次?

TLDR:ChatGPT的Intelligent UI把部分回答变成可直接操作的工具;Haiku 5.5与Sonnet缓存降价,让高频重复任务更值得交给AI。dots、Atlassian和Ironclad把竞争推进到公司的具体工作;DeepSeek Harness、Claude Mods让用户能改工作台,权限和维护也得有人管。Beam与Mistral Large 4增加开放模型选项,但权重交付仍需等后续。Long Lake完成收购Amex GBT,则把AI改造推进到了企业所有权层面。 

趋势目录

  1. dots接班,Ironclad教规矩:AI能干活之后,还得懂“我们公司怎么干”
  2. Haiku降价、Sonnet缓存五折:最先划算的,是每天重复一千遍的小事
  3. DeepSeek让工作台更好改,Claude把访问分档:能装工具,也得知道谁有钥匙
  4. ChatGPT Intelligent UI 把答案变成小工具,Gemini帮人读小字:少折腾一步,比多写一屏更有用

关键词:AI周报、Intelligent UI、Claude Haiku 5.5、Sonnet 5.5、OpenAI dots、Ironclad、Atlassian、DeepSeek Harness、Claude Mods、Reflection Beam、Mistral Large 4、Long Lake、Amex GBT、AI roll-up 

给三类读者

做AI产品的人:ChatGPT已经能在回答里放小工具。只把模型答案重新包装一遍,会越来越难留住用户;能否让用户少搬一次数据、少切一次软件,更值得测。Ironclad还示范了另一条路:把你熟悉的工作标准带进模型训练。 

关心资本市场的人:Haiku降价、Sonnet缓存减半与Pro 500并存。便宜的基础调用和昂贵的高端服务可以同时增长;观察用量、收入与毛利,别用一张价目表替三者下结论。Beam和Mistral的权重交付也要与发布会分开看。Long Lake的收购还提示另一种收益路径:买下服务公司,用AI改善经营;要看整合投入、债务负担与真实利润,不能直接套软件公司的估值。 

管理AI数字员工的人:先列清可读资料、可改内容、验收人与停止条件。Ironclad研究中Astra的平均评分为55%,不是55%的任务已经端到端通过;重要流程仍要逐项验收。 

趋势1:dots接班,Ironclad教规矩:AI能干活之后,还得懂“我们公司怎么干”

让AI写一份合同摘要不难。让它知道超过多少金额找财务、什么条款找法务、哪个例外需要重新审批,就到了另一道门槛。dots提供持续工作的入口,Atlassian带来公司资料之间的关系,Ironclad则把具体工作拆成可训练、可验收的标准。三条新闻对应同一件事的三个环节。 

做企业产品的人多了一种筹码:你知道哪些情况容易出错,也知道怎样才算做对。Ironclad把这份经验带进了模型研发。但Astra在这组研究任务中的平均评分仍只有55%,交接单和验收人还省不了。评测进步可以很快,客户放心交权通常慢一些。 

Long Lake又往前走了一步:把Amex GBT买下来,自己推动AI改造。这是AI roll-up的一种做法:通过收购整合服务企业,取得客户关系和经营控制权,再把AI用进日常流程。它让卖软件的人变成了经营服务的人,也把整合与交付风险留在自己账上。能否赚到这笔钱,要看每笔服务成本有没有下降、客户是否留下,以及扣除技术投入和融资成本后还有多少利润。 

  • 🔴 OpenAI推出dots:配备云端电脑,持续跟进工作:dots由GPT-6 Astra驱动,可通过ChatGPT、Slack和Teams协作,向符合条件的Pro、Business Premium及企业用户逐步开放。后台主动研究限定只读;会改变账户或分享信息的动作仍受审批规则约束。常驻可用不等于无限执行额度。

    详情链接:https://openai.com/index/introducing-dots/

  • 🔴 Grok Team Bots发布:共享技能,保留个人对话边界:团队可为同一个Bot配置资料、插件和工作知识,也能把它邀请进Slack频道。官方明确,个人会话保持私有,各用户保留独立的上下文和记忆。共享Bot不意味着每个人都能读取同事的全部聊天。

    详情链接:https://x.ai/news/team-bots

  • 🟡 GitHub Copilot开放电脑操作预览:没有接口的软件也能尝试自动化:Copilot CLI及macOS、Windows应用加入电脑操作公测,可点击、输入、滚动并跨应用处理流程。操作应用前需获得批准,组织也能禁用该能力。它扩大了可自动化范围,尚不能据此推断所有旧系统都能稳定跑通。

    详情链接:https://github.blog/changelog/2026-10-01-github-copilot-can-now-interact-with-desktop-apps/

  • 🟡 Atlassian与OpenAI扩大合作:把GPT-6接入Rovo及企业工作资料:双方新协议将OpenAI模型引入Atlassian平台和Rovo。Rovo结合Teamwork Graph中人员、项目、文档及决策关系,为AI提供工作背景。合作指向减少重复解释与跨工具查找,公告本身没有给出可通用于各公司的生产率提升数字。

    详情链接:https://openai.com/index/atlassian-partnership/

  • 🔴 OpenAI与Ironclad联合训练:让AI学习合同流程里的业务规矩:双方将合同配置、审批和法律条款维护做成11项研究任务,并按每项8—50条标准验收。Astra平均评分55.0%,GPT-5.6 Sol为41.6%;模拟估计每次尝试用时由37.0分钟降至19.2分钟。这是研究评分和估算时间,不是客户真实节省工时,也不是任务通过率。训练未使用非公开客户合同。

    详情链接:https://openai.com/index/advancing-computer-use-with-ironclad/

  • 🔴 Long Lake完成约63亿美元收购Amex GBT:AI roll-up走进企业差旅:9月29日,Long Lake完成对企业差旅管理公司Amex GBT的全现金收购,交易估值约63亿美元,股东每股获9.50美元,股票停止交易,公司转为私有。融资结合股权与债务。Long Lake获General Catalyst等支持,计划将Nexus AI用于预订、客服和行程变更,现有客户合同及服务团队继续运作。交易已经落地,AI改造带来的利润提升仍待经营数据验证。

    详情链接:https://www.amexglobalbusinesstravel.com/resources/blog/long-lake-amex-gbt-acquisition-faq/

    详情链接:https://investors.amexglobalbusinesstravel.com/investors/news/news-details/2026/Long-Lake-the-Worlds-First-AI-Holding-Company-Completes-6-3-Billion-Acquisition-of-American-Express-Global-Business-Travel/default.aspx

趋势2:Haiku降价、Sonnet缓存五折:最先划算的,是每天重复一千遍的小事

客服分类、整理摘要、查一条记录,单次不贵,每天做上万次就很可观。Haiku 5.5争取这些高频工作,Sonnet则降低反复读取已有材料的费用。把每件小事都交给最贵模型,越来越像用加急专车送一张便签。 

不过,便宜要带着条件读:Haiku的最低单价有长度门槛,Sonnet能省多少取决于缓存,Pro 500仍在卖更高用量与速度。Beam和Mistral Large 4又给未来自行部署增加选项,但权重尚待交付。给产品算账时,价格、开放范围、完成率需要放在同一张表里。 

  • 🔴 Sonnet 5.5先提高效率,10月7日再把缓存读取价格减半:标准输入、输出价仍为每百万Token 2美元、10美元。Anthropic称输出快30%以上,内部测试中单任务成本最多降低30%。这一降幅来自任务效率,不是统一降价;复杂开放式工作仍是Opus 5.5的优势。10月7日,缓存读取从每百万Token 0.20美元降至0.10美元;标准输入、输出价未变。官方估算,多数Agent任务因此再省约20%,实际节省取决于缓存使用比例。

    详情链接:https://www.anthropic.com/claude-sonnet-5-5

    详情链接:https://www.anthropic.com/claude-haiku-5-5

  • 🔴 GPT-6.1 Sol发布:标准单价为Astra的五分之一:API输入、输出价为每百万Token 2美元、10美元,缓存输入0.10美元。模型在ChatGPT Work、Codex及API提供,发布时尚未接入Chat。官方称多类任务接近Astra,但这不代表每项能力相同。

    详情链接:https://openai.com/index/introducing-gpt-6-1-sol/

  • 🔴 Google发布Gemini 4 Argon,先向可信网络防御团队开放:Argon面向长程专业任务,输出上限提升至100万Token,先通过Fairwind计划逐步开放。公布的入门价为每百万输入2美元、输出10美元。这里的100万指输出上限,不能误写成上下文窗口;大众开放仍待后续。

    详情链接:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

  • 🟡 ChatGPT新增Pro 500:每月500美元购买更高用量与Astra Ultrafast:新档位包含Pro系列最高的内含用量,并在Work和Codex提供Astra Ultrafast。额度用完后可消耗账户积分;Pro 100、Pro 200单独买积分不能解锁此速度档。它是新的服务分层,不是全体用户统一涨价。

    详情链接:https://help-lb.openai.com/en/articles/6825453-chatgpt-release-notes

  • 🟡 Reflection公布首款Beam:501B总参数,权重仍待本月稍后发布:Reflection公布面向编程、推理与Agent任务的Beam,采用501B总参数、23B激活参数的稀疏架构。官方称完成大规模强化学习训练,目前仍在最终红队测试与评估,开放早期访问登记,计划本月稍后发布权重、技术报告等材料。此前的周末预告已推进到产品公布,尚不能写成权重已全面可下载。

    详情链接:https://www.axios.com/2026/10/04/reflection-open-weight-ai

    详情链接:https://reflection.ai/blog/introducing-beam

  • 🔴 Haiku 5.5发布:重复性工作有了更便宜的模型选项:模型面向摘要、分类、数据库查询及实时客服等高频任务。提示不超过100K Token时,每百万输入0.10美元、输出0.50美元;超过后分别为0.50美元、2.50美元,不能只拿最低档估预算。官方称相较Haiku 4.5平均运行成本约低75%。同次公告还为Max、Team订阅用户增加月度API额度。

    详情链接:https://www.anthropic.com/claude-haiku-5-5

  • 🔴 Mistral Large 4开放API预览,模型权重计划月底交付:Mistral在Studio推出新一代原生多模态模型预览,主打编程、Agent任务及企业场景;权重计划本月底发布。公告与模型文档的参数口径存在差异,本稿不混用。当前应区分“可以试API”与“已经能自行部署”,厂商性能主张仍需用自己的业务数据检验。

    详情链接:https://mistral.ai/news/mistral-large-4/

    详情链接:https://docs.mistral.ai/models/mistral-large

趋势3:DeepSeek让工作台更好改,Claude把访问分档:能装工具,也得知道谁有钥匙

 DeepSeek Harness把安装和插件管理带进桌面端,Claude Mods允许团队直接改工具行为。你的AI工作台可以更贴合公司习惯,随之而来的问题也很具体:同事装进来的那段代码,能碰到电脑里的哪些东西? 

Claude Mods明确没有独立沙箱;Anthropic新扩展的网络安全计划又按用途分三档开放。功能清单和权限清单不能混成一张。厂商还要投入1亿美元培养企业落地人才,也提醒管理者留出维护、培训与审核的预算。购买模型只是开始,持续把工具用对才是后面的工作。 

  • 🔴 DeepSeek Harness 0.2候选版:桌面端降低安装与插件管理门槛:官方仓库发布0.2.0候选版,桌面端可管理命令与插件,无需另装Node或pnpm。10月3日的0.2.1-alpha.1继续改进自动化展示,并调整扩展接口。它仍是快速迭代的预览项目,升级前要检查插件兼容性。

    详情链接:https://github.com/deepseek-ai/deepseek-harness/releases

    详情链接:https://www.deepseek.com/en/harness/

  • 🔴 Claude Code Mods发布:允许改工具行为,也把插件审查交给使用者:Mods用TypeScript改写提示、拦截工具调用或调整界面,适用于CLI和桌面端。官方提醒Mods没有独立沙箱,拥有与Claude Code相同的机器访问能力;团队管理配置可用sec-default限制危险覆盖。只安装可信代码仍是前提。

    详情链接:https://claude.com/resources/articles/claude-code-mods

  • 🟡 Anthropic承诺投入1亿美元,培养1万名企业落地工程师:Claude Frontier Academy计划在2027年底前培训1万名工程师,首批涉及Accenture、Bain、Deloitte等机构。参与者带着真实企业项目训练。这是人才培养承诺与计划规模,不能当成已经交付的工程师数量或已确认收入。

    详情链接:https://www.anthropic.com/news/claude-frontier-academy

  • 🟡 Claude for Government转为正式服务,按用量而非席位收费:面向美国联邦及州政府,通过FedRAMP High授权环境提供服务,配有预算上限、身份管理与审计。Claude Code CLI和Microsoft 365集成仍为早期访问。环境认证不等于任何敏感资料都能直接上传。

    详情链接:https://claude.com/resources/articles/claude-for-government-is-now-generally-available

  • 🟡 Anthropic扩展网络安全验证计划,按用途分三档开放能力:新版CVP将访问分成防御、授权红队与专门访问三个层级,审核要求和安全控制各不相同,覆盖包括Opus、Sonnet和Mythos在内的模型。计划面向合格安全人员与机构,较高权限仍有验证条件及运行约束;它并非向普通账户全面取消防护。

    详情链接:https://www.anthropic.com/news/cyber-verification-program

趋势4:ChatGPT Intelligent UI把答案变成小工具,Gemini帮人读小字:少折腾一步,比多写一屏更有用

问一笔钱怎么分,直接给能调整的计算器;读包装上的小字,先提示你把镜头挪好。ChatGPT Intelligent UI和Guided Vision用不同方式减少一段麻烦:用户不必先读懂说明,再自己找工具照着做。微软的流式语音则在缩短听完、等答、再说之间的停顿。 

这对应用公司是个具体提醒:聊天窗口正在自己长出工具。只靠把答案排得更漂亮,很容易被平台追上。更值得守住的是行业流程、独有数据和使用后的结果。对普通用户,判断新功能也很简单:以前要切三个页面,现在能不能就在这里做完? 

  • 🟡 Gemini Live上线Guided Vision:把镜头里的信息变成语音帮助:功能向兼容Android设备推出,可描述画面、读小字,并提示用户调整拍摄方向。Google与Aira合作,邀请千余名盲人及低视力测试者参与打磨。它解决的是日常获取信息的困难,不能替代高风险场景下的人类判断。

    详情链接:https://blog.google/innovation-and-ai/products/gemini-app/guided-vision-gemini-live/

  • 🟡 微软发布流式转写及两款语音生成模型:MAI-Transcribe-2-Streaming与MAI-Voice-2.1、Flash版本面向边听边回应的语音应用,通过Microsoft Foundry等渠道提供。听、理解、调用工具、说话共同决定等待时间,单个模型更快不代表整个服务已经实时。

    详情链接:https://microsoft.ai/news/our-first-streaming-transcription-model/

  • 🔴 ChatGPT上线GPT-6与Intelligent UI:回答里可以直接用计算器和交互工具:ChatGPT可根据问题组合文字、图表和交互元素,例如对比、计算器、分账工具与游戏,也可一边继续思考、一边补充回答。Plus、Pro、Business和Enterprise先开始推出,Free与Go从次日起扩展;付费档用GPT-6 Sol,Free与Go用Luna,企业端受管理员设置约束。分批推出不等于所有账号已经可用。

    详情链接:https://help.openai.com/en/articles/6825453-chatgpt-release-notes

科研补充与本期行动

  • 🟡 马上就做 - 先把一个持续任务交好班:挑一个可撤回、便于核对的任务,例如每日资料汇总。写清可读资料、禁止动作、验收人和停止条件。试跑一周,记录完成次数、返工和人工等待,再决定是否扩大范围。别把“始终在线”直接当成“值得全权委托”。

    详情链接:https://openai.com/index/introducing-dots/

  • 🟡 OpenAI公开数学研究结果与部分Lean证明,接受外部检验:OpenAI将内部前沿模型生成的数学结果放入GitHub,公开修订与引用流程,并为许多证明提供可由计算机检查的Lean形式化版本,后续继续补充。数学领域仍需逐项判断表述、正确性和意义;发布一批手稿,不等于所有结果已经获得同行认可。

    详情链接:https://openai.com/index/sharing-ai-progress-in-mathematics/


扫码加入社群,快人一步获取行业前沿信息!

关于我们

探微观智聚焦AI产品和创作,思考下一代AI原生产品和交互灵感。从ToC产品创新,到模型、平台、生态、资本、观点报告等上下游迭代趋势,以一线产品实战视角切入,拆解可复用的“AI产品灵感基础模块”,每日更新。

联系我们:进入探微观智公众号,选择“企业合作”。



阅读往期热文
心法
做法
周报

相关学习资料