2026年08月13日 星期四
有料哥每日精选 · 不废话,只给干货
👊 有料哥日报:OpenRouter搞了个实时网页搜索基准测试,微软和xAI也没闲着,但今天真正值得盯的,是阿里甩出2.4T参数的MoE模型权重。AI圈现在卷的不是谁参数大,是谁敢把家底亮出来。另外,Research Gold那个“纯人工”的遮羞布,撕得挺响。
🔥 今日要闻(18条)
1. xAI 发布 Grok 4.6,强化长时运行智能体能力
Grok 4.6憋了个大招,专攻长时运行智能体,还硬啃复杂交互和视觉活。编码及知识工作基准直接顶到前沿,综合分追平GPT-5.6 Sol。但跑分追平不代表真能打,长跑不崩才算本事。
💬 有料哥点评:追平Sol?先让它自己跑完一场马拉松式任务再吹。
📌 来源:xAI:News(网页)
2. 阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文
阿里终于把Qwen-Max级别模型开源了,2.4T总参数的MoE怪兽,每次只激活95B,原生上下文256K还能拉到百万级。这波不是挤牙膏,是直接掀桌子,开源社区又多了一头能吃下大模型的巨兽。
💬 有料哥点评:2.4T参数开源是真豪横,但先问问你的显卡答不答应。
📌 来源:IT之家(RSS)
3. LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI
LTX-2.5把视频生成卷成“秒开”:两卡GB200下,10秒720P只需6.8秒,还顺手把ComfyUI焊死在原生集成里。Fast版带音频720p每秒0.09美元,10秒花0.9美元,年收入不到千万美元的组织直接白嫖。速度够快,价格够狠。
💬 有料哥点评:6.8秒出片是快,但GB200这配置,普通玩家怕是连车尾灯都看不到。
📌 来源:IT之家(RSS)
4. 微软首发自研推理模型MAI-Thinking-1
微软终于憋出自家推理模型MAI-Thinking-1,宣称从零自研并上线Foundry。CEO亲自站台,但别急着高潮——OpenAI的阴影还没散,这波是硬刚还是碰瓷,得看实测见真章。
💬 有料哥点评:从零自研?先证明不是拿OpenAI的代码换皮再说。
📌 来源:X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)
5. OpenRouter 推出实时网页搜索基准测试:如何为智能体选择引擎、深度与模型
OpenRouter整了个实时搜索基准榜,把模型、引擎、搜索轮次和预算摆上台面硬刚。结果很打脸:搜索预算从1轮加到25轮,BrowseComp得分近乎翻倍,成本只涨2.5到7倍;而选对模型比换引擎更值钱,分差15分对10分。失败率高的活儿,别傻堆深度,省点成本。点评:堆搜索轮数比换引擎划算?那你之前迷信的搜索API是交智商税了。
💬 有料哥点评:堆搜索轮数比换引擎划算?那你之前迷信的搜索API是交智商税了。
📌 来源:OpenRouter:Announcements(RSS)
6. Claude in Chrome 侧边栏升级为 Claude Cowork 会话
Chrome侧边栏的Claude现在改名“Claude Cowork”,会话自动存档,技能和连接器能在浏览器里直接干活,任务还能在桌面、网页、手机间无缝续跑。说白了,浏览器从工具升级成办公现场,但别急着高潮——这功能离真正替代工作流还差个生态打磨。
💬 有料哥点评:跨界续跑不稀罕,稀罕的是Claude终于学会把浏览器当“家”了,而不是当“临时工”。
📌 来源:Claude:Blog(网页)
7. WhatsApp 如何用端到端加密与可验证性构建 Scam Alert 诈骗提醒功能
WhatsApp整了个端到端加密下的本地AI诈骗识别,模型全在手机跑,消息不出门不上报,权重公开,遥测还有差分隐私兜底。目前Beta小范围测试,请安全社区来挑刺。加密聊天搞反诈,这步棋有点意思。
💬 有料哥点评:端到端加密还想抓骗子,全靠手机本地当警察,隐私是保住了,但骗子换套话术怕不是就得靠用户交学费来迭代。
📌 来源:Meta Engineering Blog(RSS)
8. Claude Code v2.1.229 发布:新增远程会话恢复、插件市场命令源及多项修复
Claude Code v2.1.229 上线,远程会话可恢复,自托管 runner 终于支持服务端 hook,插件市场命令源也来了。顺手修了流式输出丢失、窄屏渲染崩溃和 Windows 路径炸裂等毛病。重点是不再对危险 git/gh 命令自动点头,保住你的仓库底裤。
💬 有料哥点评:最值钱的是砍掉危险命令的自动批准——AI 犯蠢时,后悔药终于能生效了。
📌 来源:Claude Code:GitHub Releases(RSS)
9. Research Gold 号称“100%人类撰写、绝不使用AI”,实则全程由AI驱动
医学网站 Research Gold 嘴上高喊“纯人类撰写、绝无AI”,背地里却靠AI编造博士审稿人、盗用真人身份,连客服“Sarah”都是AI演的。骗人骗到医学圈,这不仅是学术不端,更是把科研诚信按在地上摩擦。
💬 有料哥点评:一边骂AI,一边用AI造假,这届骗子连装都不装一下。
📌 来源:Hacker News 热门(buzzing.cc 中文翻译)
10. RingCentral 如何用 ChatGPT Work 和 Codex 构建 AI 原生工作流
全员发ChatGPT Work和Codex,RingCentral把AI原生开发搞成了全员运动。一场挑战赛下来,数千名非技术员工也能交付能跑的项目。工程到运营全链条被AI重构,这波不是试点,是彻底摊牌。
💬 有料哥点评:AI原生不是口号,是全员KPI。技术平权后,摸鱼的连借口都没了。
📌 来源:OpenAI:官网动态(RSS · 排除企业/客户案例)
11. 空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈
谷歌研究用“知识画像”拆解大模型翻车根因:事实存储已近天花板,但调用时总掉链子——不是“没货”,而是“钥匙乱丢”。新基准WikiProfile用2150条事实×10问题,把错误精准分成五类,让“脑子空白”和“手滑拿错”原形毕露。
💬 有料哥点评:货架塞满了却找不到钥匙,这跟书到用时方恨少一个德行,先治手滑吧。
📌 来源:Google Research:Blog(网页)
12. Anthropic 联合独立研究者发布工人再培训项目证据综述
Anthropic携手独立学者David Roodman,翻遍56项美国随机对照试验和欧洲实验,给工人再培训项目做了一次“疗效”体检。结论?现实很骨感:靠短期培训硬扛AI对劳动力市场的结构性冲击,证据撑不起期待。别拿几张证书当救命稻草,系统性问题没那么好打发。
💬 有料哥点评:再培训项目要是真有用,AI冲击波早被培训成缓冲垫了。证据显示:安慰剂效应大于疗效。
📌 来源:Anthropic:Research(发表成果 · 网页)
13. 零基础用户半天上手AI的12步实操流程
别谈玄学,半天上手AI全靠硬配置和套路:16G内存打底,ChatGPT配Codex或WorkBuddy二选一。用语音输入,按“背景-痛点-需求”喂任务,靠苏格拉底式追问逼AI理清需求,再丢文件让它干活,最后把流程沉淀成Skill。记住,Codex选GPT-5.6 Sol,WorkBuddy认准Kimi K3。
💬 有料哥点评:AI没让你变笨,但照着这流程抄作业,你连动脑都省了——挺好。
📌 来源:公众号:数字生命卡兹克
14. DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验
DeepSeek V4 Pro正式版和Grok 4.6前后脚发布,一个1.6T一个1.5T,都拿“逼近Claude Fable 5”当遮羞布。参数堆得比天高,体验差多远心里没数?这哪是技术迭代,分明是怕被遗忘的集体自嗨。
💬 有料哥点评:一个靠堆参数,一个靠蹭热度,真逼近了谁?用户只关心能不能白嫖。
📌 来源:公众号:数字生命卡兹克
15. AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求
AutoGPT 团队发现AI从不主动看文档,就把指令塞进AGENTS.md和技能文件,放在代码旁。再用PR模板、测试计划、覆盖率门槛和CLA签名当门控,硬生生把AI提交的PR从废品调教成“勉强能用,但偏离路线图”。其中CLA签名因需要浏览器和OAuth,竟成了识别人类的探测器。
💬 有料哥点评:让AI签CLA防AI?这操作就像给机器人戴镣铐,结果发现镣铐只有人类才打得开。
📌 来源:GitHub Blog
16. 我写了一本 AI 教科书——AI 还要多久才能写得更好?
写完RLHF教科书后作者发现,AI在长文非虚构写作上已撞墙,GPT-4.5、Kimi K2这些写作尖子生也沦为旧时代残党。改错字、当编辑没问题,但一碰整章结构就糊成一团。编码数学逼近超人,写作却拖后腿,开放科学问题只能继续等。
💬 有料哥点评:改得了错别字,理不清章节,AI写作就像个高分低能的编辑,离“写书”还差一个大脑。
📌 来源:Nathan Lambert:Interconnects(RSS)
17. OpenRouter 工具调用指南:一次编写循环,切换模型字符串即可跨模型运行
OpenRouter 这波指南把“一次编写,处处运行”从口号变成实操——工具调用循环写一遍,Claude、GPT、开源模型随便切,只改字符串即可。JSON schema 通用,cURL、Python、JS 示例齐全。别吹生态,本质是省去重复造轮子的时间,但模型行为差异仍然得自己掂量。
💬 有料哥点评:工具调用统一了,模型翻车率可没统一,换字符串前先烧柱香。
📌 来源:OpenRouter:Announcements(RSS)
18. LangChain 详解:什么是 AI 智能体?
所谓AI智能体,就是让大模型自己跑循环、看结果、改策略,直到把活干完;工作流则是提前写好的剧本。一个求稳,一个求变,两者互补。分不清这层关系,就别指望搞出可靠的生产级系统。
💬 有料哥点评:连工作流和智能体都分不清就蹭AI?先问问自己到底要确定性还是灵活性。
📌 来源:LangChain:Blog(RSS)
👊 有料哥今日观察:阿里这次开放Qwen3.8-2.4T-A95B,明面上是秀开源肌肉,暗地里是在卡位智能体时代的推理成本。95B激活参数配合256K上下文,摆明了要抢长文档、复杂Agent场景的饭碗。SGLang和Miles同步跟进Day-0支持,说明生态方早已拿到内测资格,这不是临时起意。但真正值得玩味的是,DeepSeek V3.2让各家都坐不住了——闭源模型靠API收费的路子越来越窄,开源模型又都在拼稀疏激活的性价比。Qwen这个体量,推理成本能压到接近密集7B的水平,这才是对商业模型最狠的釜底抽薪。接下来看谁能把MoE的调度开销再砍一刀,谁就能笑到最后。
如果觉得有料哥的内容对你有用
👍 点个在看 💬 评论区聊聊你的看法 🔔 还没关注的点上方蓝字关注
有料哥日报 · 只说人话的AI观察家
夜雨聆风