这周最实在的变化,是AI开始进入大家本来就在用的文件和电脑:ChatGPT能直接读取、整理并在授权后修改Google Drive里的资料,Codex桌面版也补上了Linux。
资讯精挑
1. GLM-5.3上线:底模没换,复杂任务更能跑到底
智谱在8月14日发布GLM-5.3。它沿用GLM-5.2的基座模型,提升主要来自更长时间、更复杂环境的后训练,重点加强多文件编程和长时间Agent任务。目前GLM Coding Plan用户已经可以使用,模型权重则计划在发布两周后开放。
已经订阅Coding Plan的人,可以拿一个过去需要反复提醒模型的真实任务重跑一次,例如跨三个文件修Bug、补测试再自检。重点看它能不能把任务做完,而不是只看第一版代码是否漂亮;没有编程需求的普通用户,没必要因为新跑分专门迁移。
2. ChatGPT接进Google Drive,文件不用来回下载了
连接Google Drive后,Plus、Pro、Business等符合条件的用户,可以在ChatGPT的资料库里浏览云盘文件,也能通过“+”或@直接把文件加入对话。文档、表格和幻灯片可以与聊天并排打开;在权限允许的情况下,ChatGPT还能把修改写回源文件。首批暂不包含Shared Drives。
这项更新最适合周报、会议纪要和项目资料整理。先选一个不重要的文件夹,让AI汇总三份旧文档并列出冲突信息。确认它能准确引用原文后,再考虑开放写回权限。
3. DeepSeek开始按高峰和闲时收费,批量任务要学会错峰
DeepSeek宣布,V4全系列新价格从北京时间8月17日零时生效。每天9:00—12:00、14:00—18:00为高峰时段,其余时间按高峰价的一半计费。以V4 Pro输出为例,闲时每百万Token为13.5元,高峰时为27元。
个人聊天未必能明显感受到差别,但做批量摘要、资料清洗和自动生成的人应该调整定时任务。能延后的作业尽量放到夜间,并记录一次完整任务的输入、输出和缓存命中量,别只盯着单项单价估成本。
4. Gemini 3.7 Flash上新,首发价打五折到年底
Google在8月13日发布Gemini 3.7 Flash,重点加强编程、知识工作和Agent任务。首发价为每百万Token输入0.75美元、输出3.75美元,有效期至2026年12月31日;Gemini Spark也从当天起切换到这一模型,面向160多个国家和地区的Google AI Pro与Ultra用户。
它更适合在意速度和批量成本的人。别先拿排行榜判断好坏,可以用同一份长文档或同一个网页任务,分别测试旧模型和3.7 Flash,比较完成时间、遗漏项和返工次数,这三个数字比“感觉更聪明”更有参考价值。
5. Codex桌面版补上Linux,Ubuntu、Debian和Fedora先行
OpenAI在8月14日开放ChatGPT Linux桌面版公开预览,把ChatGPT和Codex带到Ubuntu 24.04/26.04、Debian 13以及Fedora 43/44。Linux版已经支持内置浏览器和Chrome网页操作,但暂时还不能像macOS版那样控制其他桌面应用。
对长期在Linux上写代码的人,最大的价值是不用再为桌面体验切到另一台电脑。建议从测试仓库开始,跑一遍“读项目—改一处文档—查看差异”,顺手观察输入法、Wayland和文件权限是否稳定。它仍是预览版,先别拿关键项目冒险。
6. IndexTTS 2.5开源,五种语言能调情绪和语速
IndexTTS 2.5在8月10日开放代码与模型,支持中文、英文、日文、西班牙文和阿拉伯文。新版保留零样本音色克隆,增加细粒度情绪、语速和发音控制,语速可在0.5倍到2倍时长之间调整,推理也比IndexTTS 2更快。
做课程、播客和短视频的人,先别比“像不像某位名人”。同一段旁白能否稳定读出数字、专有名词和停顿,才更影响成片。可以用自己的声音做30秒样片,连续生成三次;音色稳定、错字少,再放进正式流程。
AI 趣闻
1. 一位神经外科医生和AI,解开了22年的数学猜想
北京协和医院神经外科医生金山木在研究经颅超声时接触到矩阵分析,后来用ChatGPT Work里的GPT-5.6 Sol连续运行约16小时,得到Crouzeix猜想的关键证明。数学家Alex Townsend、Anne Greenbaum以及猜想提出者Michel Crouzeix都审阅过手稿,认为证明成立;正式同行评议仍在进行。
真正有意思的是,作者把提示词、不同版本手稿、Lean形式化和审计过程都留了下来。这是一次人类选题、AI长时间探索、专家复核的合作实验,离“按一下按钮就自动成为数学家”还很远。
2. 一只机械秒表,难住了一圈多模态模型
有人上传机械秒表照片,让不同模型读出指针时间,正确答案约为526.3—526.4秒。这组社区测试里,Qwen3.8 Max几乎是唯一直接答对的模型;换成更难的表盘后,它同样会失手。
这不是标准化测评,却很适合提醒我们:模型会描述图片,不等于会精确读数。遇到仪表、票据和小字号表格,最好让AI说明读数依据,再由人核一遍关键数字。
3. DeepSeek编出一个不存在的API,还被自己“震惊”了
一次自主编码中,DeepSeek V4 Flash写出了e.Pointer.Capture(this)这个并不存在的调用,随后又在推理过程中连打感叹号,像是刚发现了一个了不起的新接口。社区顺势给它做了“震鲸”梗图。
好笑归好笑,这也是AI编程最典型的翻车方式:语法看着顺,接口名也像真的。处理陌生框架时,先让模型给出官方文档位置或最小可运行示例,比让它继续自信地补代码更省时间。
工具细选
1. Digest for Bilibili:把长视频变成带时间戳的学习笔记
这款Chrome、Edge扩展会在B站播放页旁打开侧栏,提供字幕阅读、双语对照、AI章节概览、划词解释和时间戳笔记。字幕来自B站接口,笔记和缓存保存在本地;AI功能需要配置自己的模型服务。
适合经常看课程、访谈和长评测的人。先挑一条30分钟、有完整字幕的视频,只测试“章节概览”和三条时间戳笔记,看看回看时能不能直接跳到关键段落。
安装入口:https://chromewebstore.google.com/detail/digest-for-bilibili/cfndfabkpfgihcgknbgfnkjlmndhhmfc
2. DreamPaper:科研图和汇报PPT先从模板里长出来
DreamPaper会先分析参考模板,再生成科研插图或学术幻灯片,支持Windows和macOS桌面版,不想配置Python可以直接下载安装包。它仍需要用户提供模型服务;资料、配置和产物保存在本机。项目采用非商业许可,个人学习和研究可以使用,商业接单不在许可范围内。
它更适合论文作者、研究生和需要技术汇报的人。先拿一页已经公开的研究方法,生成一张流程图或三页汇报稿,重点检查术语、箭头关系和数据是否正确,不要一次让它包办整场答辩。
3. Image To Slice:把一张UI效果图拆回可编辑图层
Image To Slice专门处理“AI已经画出好看的App或网页,但只得到一张扁平图片”这个问题。它会区分背景、切图素材和适合用代码实现的界面元素,补齐被按钮遮住的背景,再导入可编辑的Figma图层,或者导出HTML、CSS和图片资源。
它更适合设计师、前端和用生图模型做产品原型的人,安装门槛比普通浏览器插件高:需要Node.js 20.19以上、Figma Desktop和一个兼容API。先拆一张登录页,人工校准三到五个关键元素,再检查导入后的文字、按钮和背景是否真的可以继续编辑。
GitHub 热榜
这次不追最复杂的Agent框架,分别从求职作品集、办公演示和日常输入三个场景里挑一个。三个项目的用法不同,也都能用一个小任务先试,不必先搭服务器。
1. Public APIs:给求职作品集找一个真正能调用的数据源
Public APIs按天气、交通、图书、招聘、图片等类别整理了大量公开接口,并标注是否需要密钥、是否支持HTTPS和跨域。它本身不用安装,打开列表就能挑数据,适合想做小项目又卡在“做什么”的转岗者和编程初学者。
安全的第一步,是选一个标注为无需认证、支持HTTPS和CORS的接口,让AI帮你做成单页查询工具。作品集里同时写清需求、数据来源和你做过的修改,比直接展示一份AI生成的代码更有说服力。
项目链接:https://github.com/public-apis/public-apis
2. PPT Master:把资料做成真正可编辑的PowerPoint
PPT Master能把主题或文档变成原生PPTX,图形、图表、表格、演讲者备注和动画都可以继续编辑,也支持套用自己的模板。新手需要准备Python 3.10以上版本和一个能读写文件、执行命令的AI工具;项目提供Windows逐步安装说明,门槛属于“照着教程能跑”,不是点开即用。
别急着做几十页。拿一份两三千字的旧报告,让它生成5页内部汇报,再检查图表数据、字体替换和导出后的版式。能稳定改完第二轮,才说明它适合你的办公流程。
项目链接:https://github.com/hugohe3/ppt-master
3. FluidVoice:在Mac任何输入框里直接说话写字
FluidVoice是一款本地优先的macOS语音听写工具,可通过Homebrew一条命令安装,也能下载现成安装包。它支持全局快捷键、实时转写、直接写入其他应用,并可选Apple Speech、Whisper等不同语音模型;基础听写不要求云端API。
它适合写作者、重度聊天用户和经常口述需求的人。安装后先口述一段300字周报开头,记录错字、标点和手工修改时间,再与手机语音输入对比。当前主要支持macOS 15及以上,Windows和iOS仍在推进。
项目链接:https://github.com/altic-dev/FluidVoice
变现机会
1. 给课程和访谈做“长视频精读包”
交付物可以固定为一份章节目录、10条带时间戳的重点、3张知识卡片和一段300字摘要。客户优先找课程博主、播客主、付费社群和企业培训负责人,他们有长内容,却未必有人负责二次整理。
获客时先挑对方一条公开视频,只做前10分钟样稿并私信发送。首单控制在60分钟以内;客户真正付费的是准确的时间点和可直接分发的成品,不是泛泛的AI摘要。
2. 把旧报告翻新成“可编辑汇报PPT”
交付一套10页左右的原生PPTX、对应内容提纲和一次修改,客户可以继续换字、改图表。适合咨询顾问、销售、小公司负责人和研究人员,他们常有现成材料,只缺一份能上台讲的版本。
第一步找一份客户公开过的旧PPT,免费重做其中两页并加水印展示前后对比。先约定客户负责确认数据和版权素材,你负责结构、版式和可编辑交付。
3. 给内容创作者做“多语言配音样片”
交付物可以是三种语气的30秒试音、一个3分钟成片和对应字幕,客户优先找知识博主、课程团队、出海短视频账号和小型品牌。IndexTTS 2.5已经支持五种语言,也能调整语速和情绪,适合先做小样再决定是否扩成长内容。
先用自己的声音或客户明确提供的授权音频,给一个公开脚本做中英双语样片,再定向联系20位内容创作者。把专有名词、数字读法和返修次数写进交付清单,会比只说“AI配音”更容易成交。
写在最后
如果这周只做一个小任务,我建议从“拿一条30分钟视频,做出带时间戳的精读稿”开始。它不需要买新设备,做完既能判断工具是否好用,也能直接变成一个可展示、可试单的样品。
你更想让我下一期多挑哪一类内容:普通人能马上用的工具,还是已经有人拿来赚钱的真实案例?
我是 AI 挑山工小李
每天帮你挑出值得关注的 AI 重点。
这里整理了一些高性价比的 AI 工具
长按识别二维码查看

夜雨聆风