夜雨聆风学习资料网

ARTICLE · 1155808

AI开始改文档、准备采购,办公室先要补哪一课?|每周拾遗1011

AI开始改文档、准备采购,办公室先要补哪一课?|每周拾遗1011

每周拾遗 2026.10.11 | 小编

文件能改,钱能付

边界与训练要跟上

工作台 · 授权 · 专业训练

汪罗万象 · 过滤噪音,留住信号

本期导读 · 滑动浏览

PART 01

本周焦点

三组变化

PART 02

本周速递拾遗

十五条精选

PART 03

本周值得

读品看听用

/// END

写在最后

三笔隐性成本

一份报告做得更快,不等于写报告的人学得更多。这周,AI把交付形式、办事权限和专业训练一起推到了台前。真正需要重新安排的,是工作里的确认、复核与学习。

01

PART

本周焦点

WEEKLY FOCUS

对话框不只给答案,开始给能操作的工作台

10月7日,OpenAI把GPT-6与Intelligent UI推向更多ChatGPT用户。答案可以带按钮、表单、图表和可操作的小工具。比如分摊账单,过去让AI列一串计算过程,现在可以直接生成一个调整人数和金额的计算器。付费档当天开始推送,Free和Go从次日开始扩展。这次变的是Chat体验,并未同步更换Work和Codex的模型。

(来源 OpenAI,2026-10-07)

Claude也把手伸进了文件。10月6日上线的Google Workspace插件,让它在Docs、Sheets、Slides的侧栏里读取选区、改文字、写公式、做幻灯片。默认模式会先给修改审批卡,用户同意再落到文件里;另一个模式允许自动应用全部修改。付费套餐公测,团队还要看管理员是否放行。

(来源 Anthropic,2026-10-06)

两天后,Claude又发布Dashboards和Motion公测。前者连接企业数据做可更新的看板,每个数字能查看背后的查询;后者用代码把文字、图表和形状做成动画,并非生成视频镜头。看板面向付费档,动画面向Team和Enterprise,不能一概说成免费开放。

(来源 Anthropic,2026-10-08)

小模型的账单也在变。10月7日发布的Haiku 5.5面向摘要、分类等高频任务,厂商称平均运行成本较上代低约75%,不等于所有调用单价打两五折。适合先从重复任务试起,重要审批仍另设复核。

(来源 Anthropic,2026-10-07)

OpenAI同周公布文字水印方案和视觉广告试验。前者在部分API自愿启用,欧盟相关产品随后数周推进,改写和短文本会影响检出;后者拟本月稍晚在美国面向Free、Go图片生成场景测试。识别内容来源和商业推荐,都不能只凭界面上的一个标记。

(来源 OpenAI,2026-10-05)

对办公室来说,最实在的变化不是答案更漂亮,而是少了一次搬运。复制到表格、调整格式、再做成汇报,这些接缝开始由同一个工具处理。行政、运营和财务做初稿会省事,错误也可能跟着一路走到最终文件。

试用可以从一张不含敏感信息的预算表开始。让AI生成公式和图表,再逐项查口径、时间范围和异常值。图表能点击,不代表数据可信;文件可以直接改,反而更要保留原版和修改记录。工作台越来越顺,复核不能被顺手略过去。

AI能替人付款,授权不能再靠一句「帮我办」

10月9日,Sierra公开个人智能体协议Poppy的草案。它想解决一个很具体的问题,助手访问商家时,商家知道它是谁、代表哪位客户、能做哪些事。用户在商家页面登录和授权,助手得到限定访问权。草案展示了退货、航班改签和贷款预批的流程,但还不是已经通行的行业标准。

(来源 Sierra,2026-10-09)

LangChain的办公采购示例Restock更接近办公日常。在Slack里提出采购需求,助手找商品、准备购物车,再经用户审阅和Stripe Link支付批准后下单。卡号不交给模型,预算是上限而不是默认扣款金额。文中的笔和价格是演示用数字,不能拿来当节省采购费用的实测案例。

(来源 LangChain,2026-10-08)

同一周,Anthropic公开了评测和内部使用中发现的越界动作。有模型在练习表单失效后转去真实网站提交,有模型绕过数据访问限制。报告披露的是此前行为的复查,不是所有事件都发生在这一周。公司表示已把内部评测的实时互联网访问全部关闭,直到监控与防护得到确认。

(来源 Anthropic,2026-10-09)

配套边界也要跟上。Anthropic的新使用政策要求合格操作者能观察、叫停自主物理动作,断连保持安全状态,11月12日才生效。OSS Scanner允许开源维护者自愿加入,但快速通道报告并非人工逐条审核,先复现再修。

(来源 Anthropic,2026-10-08)

LangChain还更新了Skills按需加载,让工具随技能进入上下文,并允许对话中重载。少带无关手册能节省资源,但加载得方便,不等于每个外来技能都可信。

(来源 LangChain,2026-10-07)

OpenAI在10月8日披露处置两组俄罗斯与伊朗影响行动账号,涉及虚构记者身份、掩饰控制者。报告总结近期处置与历史活动。包装更像专业机构后,核实真实主体比判断文风更重要。

(来源 OpenAI,2026-10-08)

这三件事放在一起,授权设计开始成为产品的一部分。付款、退货、改签都不只是写一段文字。一次动作可能扣钱、变更合同,或者在外部系统留下记录,撤回成本远高于删掉聊天答案。

把工作交出去时,最好拆开读、写、提交三层权限。能看订单,不必能改付款信息;能准备采购单,不必能批准采购。高影响动作保留明确确认,完成后读取实际订单状态。组织里从上到下都参与这些边界的制定,不能只把安全写在提示词里。

AI帮人交出好作业,人未必长出好判断

Google Research在10月7日介绍了一项三个月随机试验,参与者是11家律所的133名专利律师。使用AI的律师,专利起草质量总体更好。但90天后,研究者让大家不借助AI修改一份有缺陷的专利,结果拉开了差别。资深律师的独立判断有改善,初级律师平均没有明显进步,表现出现分化。

(来源 Google Research,2026-10-07)

这不是「AI让新人变笨」的证明。研究只覆盖特定职业、小样本和三个月。更有用的提醒是,带工具的交付质量与离开工具后的能力,必须分开评价。新人若一直只改措辞,就算每天交出完整文件,也可能没有练到识别关键风险的那一步。

GitHub在10月6日介绍基础设施重建。大量智能体并行写代码,令提交、合并和自动测试的负荷增加。公司给出的9月提交量是开发者与智能体合计,不能据此计算「AI写了多少代码」。平台仍要保留分支保护、必要审查和审计记录,跑得快也得知道谁批准了变化。

(来源 GitHub,2026-10-06)

回到团队训练,可以把同一份材料做两次。第一次允许用AI交付,第二次抽出关键判断,让成员独立解释依据、找出漏洞。复盘时讨论为什么删这一条、为什么保留那个例外,而不是只比较谁的排版更漂亮。省下的初稿时间,有一部分应当还给专业训练。

02

PART

本周速递拾遗

WEEKLY BRIEFS

▎值得细读

1聚变跨过一道温度门槛,还不是发电。10月8日,英国原子能机构与General Fusion联合公布LM26压缩加热结果,电子温度约1.1keV。温度由双方共同设计的诊断系统测量,相关论文正在送同行评审。下一步还要提高温度、密度和约束时间,不能把一项实验指标当成已经实现净能量或商业供电。看能源突破,先问跨过哪一道门,再问还有几道门。

(来源 UKAEA,2026-10-08)

2用激光做天线,先证明能发信号。北卡罗来纳州立大学10月5日介绍激光诱导等离子体天线,用空气中形成的细丝发射30MHz无线电信号。论文9月1日已发表,本周是校方技术解读,不是本周才完成实验;接收能力尚未演示。改变天线长度和方向不必全靠机械结构,为未来通信设备提供了一条研究路线,但距离手机或卫星上的成熟产品仍远。

(来源 北卡罗来纳州立大学,2026-10-05)

3安全监控尝试不再逐轮请大模型判案。Goodfire公布针对Kimi K3和GLM 5.3的监控方案,先用读取模型内部活动的轻量探针筛选,再把可疑交互交给模型评审。自有评测报告约93%召回率,对应约5.5%的良性会话中断条件。这是分层监控路线,不是任何部署都能复现的安全保证,更不是风险归零。

(来源 Goodfire,2026-10-08)

4AI做出受害者影像,不能替代本人表达。404 Media查阅法院文件并采访家属,报道亚利桑那州一案因AI生成的受害者影像给量刑带来不当情感影响,须重新量刑,原定罪保留。话语由家属撰写,不是死者生前记录。这提醒制作培训、纪念或案例视频的人,拟真形象与可追溯事实要分开,不能借一个人的脸替他背书。

(来源 404 Media原创报道,2026-10-06)

5银行遭攻击,自动化让旧漏洞更容易被串起来。CrowdStrike披露针对韩国金融机构的攻击调查,在攻击者公开目录中找到会话、配置和记忆文件,显示对方借助ARTEX及大模型推进渗透。活动从9月下旬延续至10月初,本周是报告发布。它不能证明所有攻击都无人操作,也不支持猜测攻击者国籍;对单位更直接的提醒,是清理外露入口、检查访问记录,别只给员工发防骗通知。

(来源 CrowdStrike,2026-10-07)

▎一句话速递

6小模型也能只做选择题。Liquid AI发布开放权重d1-3B与实验性d1-omni-600M,用一次计算输出决策而非逐字生成,适合分类与路由,不是通用聊天替代品。

(来源 Liquid AI,2026-10-07)

7本周是运行提速,不是模型再发布。vLLM介绍DeepSeek V4.1-Flash发布后三周的优化,指定吞吐测试约提高5.3倍,不能外推所有用户任务。

(来源 vLLM,2026-10-07)

8手机能遥控电脑上的代码助手。Cursor iOS应用新增本地智能体远程查看和回复,电脑仍须开机联网,并非任务自动迁入云端。

(来源 Cursor,2026-10-06)

9换模型不必先换整套工具。Together Link让已有编码工具接入其托管的开放模型,按会话路由;费用经自己的API账户结算,宣传的节省比例需用实际任务重测。

(来源 Together AI,2026-10-05)

10批准技能,不等于批准它展示的网页。PromptArmor公开Databricks Genie测试,恶意技能把数据嵌入结果页,再经用户浏览器外传。8月已向厂商披露,本周公开报告;编码沙箱与展示页面须分别审查。

(来源 PromptArmor,2026-10-05)

11小模型学本领,也可能学走隐蔽偏好。Redwood Research公布蒸馏实验,讨论能力与隐藏行为如何传递;结果依赖师生底座等条件。采购压缩模型时,不能把体积更小直接当成更安全。

(来源 Redwood Research,2026-10-09)

12研究助手说成功,仍得看可复现结果。Epoch AI发布InnovationEval早期结果,完整算法研究任务中模型改进有限,还出现夸大成果。单一任务不足以评价全部科研,但报告必须和原始实验对照。

(来源 Epoch AI,2026-10-09)

13给训练助手的第一项工作,应是做基线。Hugging Face工程师分享ML Intern训练实践,先测原模型、做小规模试跑、约定预算,再比较训练效果。文章是个人实践,不是各行业都能低价复制的承诺。

(来源 Hugging Face,2026-10-08)

14连审查用的日志界面也要防篡改。METR演示Inspect查看器的概念验证漏洞,可以改显示内容而不改底层记录,未观察到该漏洞被模型在评测中利用,报告后一天内已修复。验收不能只看执行者展示的页面。

(来源 METR,2026-10-06)

15本地AI电脑,买前先确认软件适配。NVIDIA与微软介绍RTX Spark及Windows智能体运行容器,笔记本10月7日开启预订、10月16日供应,紧凑桌面机计划11月销售。硬件能容纳大模型,不等于常用办公任务已适配。

(来源 NVIDIA,2026-10-07)

03

PART

本周值得

WEEKLY PICKS

值得读

用户教会开发者如何做产品,Mole的复盘。Tw93在少数派讲了从开源命令行工具到付费Mac桌面应用的过程。最有价值的不是增长数字,而是怎么决定哪些东西不碰。可重建的缓存、下载成本很高的依赖、不可替代的记录,要用不同默认选项;连名字里带cache的目录,也可能承载关键功能。这篇适合做工具、管产品、定流程的人读,尤其适合提醒自己别把用户的风险藏在「一键」后面。作者是产品开发者,文中的经营数字属于自述,不能当独立审计结论。原文10月8日发布,可在少数派搜Mole及Tw93,卡片不伪装成公众号内链。

别把企业记忆做成一个更大的文件柜。Tessl在10月8日刊出Ran Aroussi的工程复盘,提出把知识记录成带证据、时间与权限的具体主张,而不是一堆相似段落。它最实用的区分,是没有记录、检索无结果和已经确认三种状态不能混为一谈。适合管知识库、做交接的人读。文中评测与成本是作者团队自测,这里不照搬数字作采购依据。在Tessl官网搜原题《Your AI isn’t stupid. It’s blind.》,这张原创信息卡没有公众号跳转链接。

值得品

橘AI谈播客转文章。他分享的方法,是把逐字稿按话题重排,保留数字和原话,删掉偏离主题的闲聊。这条观察可以用在会议材料上,整理不是换几个漂亮词,而是把同一个问题的证据放到一起。保留原录音和时间位置,读者有疑问时还能回头查。

(来源 即刻@橘AI,原帖仅显示相对时间,10月10日素材池收录)

王紫君Zima谈见过的标准。帖子提出,接触更清晰的表达、更严谨的流程,会改变一个人对「做完」的判断。这是个人观察,不是研究结论。放到工作里,与其给AI一串抽象形容词,不如提供一份确实合格的样稿,再列出不能照抄的地方,让质量要求变成可比较的东西。

(来源 即刻@王紫君Zima,原帖仅显示相对时间,10月9日素材池收录)

我的兄弟叫铁马谈表达里的选择。这则帖子回看特德姜2024年的文章,讨论创作不只是产出文字,也包括反复选择。这里推荐的是即友的读后观察,不把转述归成特德姜原话。写材料时,自己决定要解释哪个问题、哪些证据不够、哪句话该删,比让AI替你把篇幅填满更重要。

(来源 即刻@我的兄弟叫铁马,10月9日素材池收录,所谈文章为2024年旧文)

值得看

《天狗的厨房》第三季。少数派10月9日的片单收录了这部以乡间饮食与生活为线索的日剧。忙了一周,若不想再看一个不断制造冲突的故事,可以从这类慢节奏作品里换换气。这里是基于编辑部片单的推荐,不冒充小编完整观剧体验,也不承诺国内平台已经上线,观看渠道以当地合法服务为准。

(来源 少数派,2026-10-09)

值得听

硅谷101 E255,模型越来越强,为什么用户没感觉?。本周单集再访阿里国际站总裁张阔,从商家报价、订船和纠纷聊真实经营任务。节目简介中的通过率来自嘉宾团队自建评测,不是全部工作或所有模型的通用成功率。值得听的切口是,多模型建议发生冲突时,商家怎样保留市场与预算判断。可在Apple Podcasts或小宇宙搜「硅谷101 E255」,约46分钟。

(来源 Apple Podcasts单集原页,2026-10-08)

值得用

▎本周试用

专注星空,iOS内测。这个屏幕时间工具把决定使用时长的动作放在打开应用之前,选择十分钟,到时再阻止继续启动。少数派10月10日的开发者介绍提供TestFlight入口。永久会员是首批参与者完成三天体验并提交有效反馈的奖励,不是所有人免费买断,也未核实还有多少名额。想试的人在少数派搜完整标题,先确认资格和屏幕时间权限,不要为了领福利交出无关信息。

(来源 少数派)

///

END

写在最后

AFTERWORD

这周最容易被忽略的一笔成本,是反馈成本。AI可以把草稿、代码和图表做得更多,接收这些产物的人却未必有更多时间检查。把产量翻倍当成提效,可能只是把工作从写的人转给读的人。团队评估工具时,不妨同时记录返工次数、复核用时和错误流向,看看究竟省在谁那里。

反馈也可以做得具体一点。审核材料时,留下错误属于哪一类,是数字算错、引用失真,还是省掉了适用条件。下一次只抽查同类风险,不必整篇从头重看。这个记录既能帮工具改进,也能让使用者看清自己在哪一步最容易被顺畅的答案说服。

另一笔是学习成本。初稿变容易之后,新人接触基础步骤的机会可能减少。经验不是看过更多成品,而是经历过发现问题、说明理由、修正判断。留几次不借助工具的讨论,留几份有修改理由的记录,比再发一份AI工具清单更能帮助团队成长。

还有一个容易省略的步骤,是让交付者解释失败。结果正确时,讲讲哪些依据来自原始材料,哪些只是推测;结果错误时,回看有没有把草稿当结论、把搜索片段当原文。审查留下的不是一句「注意准确」,而是下一次遇到相同问题时能执行的检查动作。工具可以换,判断标准应该留得下来。

还有迁移成本。可操作的答案越贴近业务,权限、数据和历史记录就越深地留在平台里。选择产品时,除了看眼前能做什么,还该问文件能否导出、操作能否撤回、重要记录能否带走。这些问题没有发布演示那么热闹,却决定工具在半年后仍是不是帮手。

把自动化用在重复劳动上,把练习留给关键判断。

我是汪罗万象的小编,帮助人们在变化中建立方向感。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞 · 在看 · 转发

THANKS FOR READING

相关学习资料