
本期看点:Anthropic 发布 Claude Fable 5 与 Mythos 5;Google 开源 DiffusionGemma 离散扩散多模态模型;Z.ai 发布 GLM-5.2 ;OpenRouter 推出 Fusion 多模型融合;Addy Osmani 谈 Loop Engineering;Kimi K2.7 Code 发布。
编辑:TimLi
🔥 本周热点
Anthropic 发布 Claude Fable 5 与 Mythos 5:Mythos 级能力首次面向大众,6 月 12 日起暂停访问 - 6 月 9 日上线,Fable 5 是 Anthropic 迄今最强公开模型,软件工程、知识工作、视觉、科研等基准全面领先,任务越长优势越大。Stripe 实测在 5000 万行 Ruby 代码库一天完成全库迁移;Cognition FrontierCode 评分居前沿模型之首。定价 $10/$50 每百万 input/output token,不到 Mythos Preview 一半。部分敏感话题会回退到 Opus 4.8 响应,约 5% 会话触发安全护栏。Mythos 5 同底座但放宽部分限制,面向网络防御方。注意:6 月 12 日 Anthropic 宣布暂停两款模型访问,正在恢复中。
https://www.anthropic.com/news/claude-fable-5-mythos-5

Google 开源 DiffusionGemma 26B A4B:离散扩散 + MoE 多模态,单卡解码超 1100 tokens/s - Google DeepMind 6 月上线 Hugging Face,基于 Gemma 4 26B A4B MoE(25.2B 总参、3.8B 激活),用离散扩散替代逐 token 自回归:编码器缓存 prompt,解码器对 256 token「画布」并行去噪,H100 FP8 低 batch 下单用户超 1100 tokens/s。支持图文视频交错输入、256K 上下文、Thinking 模式、函数调用与 35+ 语言。MMLU Pro 77.6%、LiveCodeBench 69.1%,纯文本略逊 Gemma 4,但生成速度是核心卖点。Apache 2.0。
https://huggingface.co/google/diffusiongemma-26B-A4B-it

Z.ai 发布 GLM-5.2:可用 1M 上下文、High/Max 双档推理,Coding Plan 全量开放 - 6 月 13 日上线,GLM-5 系列第四款旗舰,主打 Agentic 编程与长时域任务。glm-5.2[1m] 支持 100 万 token 上下文、单次输出最高 131072 token,新增 High/Max 两档 thinking effort。Lite/Pro/Max/Team Coding Plan 用户立即可用,可换 base URL 接入 Claude Code、Cline、OpenClaw。独立 API 与 MIT 开源权重计划随后开放。官方未公布 SWE-bench 等独立评测,能力描述继承 GLM-5.1 的 744B MoE(40B 激活)底座。
https://openlm.ai/glm-5.2/

Google 推出 Gemini Live API 实时翻译:70+ 语言低延迟语音对语音,gemini-3.5-live-translate-preview - Live API 新增纯翻译模式,模型充当同声传译管道而非对话 Agent:连续流式处理、不等话轮结束,边说边译。配置 translationConfig.targetLanguageCode 指定目标语,echoTargetLanguage 控制输入已是目标语时是否复述。输入限 16kHz PCM 音频,输出 24kHz,建议 100ms 分块推送,可同时返回双语转写。不支持工具调用与文本输入;重口音、相似语种切换时语言检测可能不稳。客户端可用 v1alpha 临时 token 锁定翻译配置防篡改。
https://ai.google.dev/gemini-api/docs/live-api/live-translate?hl=zh-cn

OpenRouter 发布 Fusion:多模型并行调研 + 裁判融合,DRACO 基准超单模 Fable 5 - 6 月 12 日上线,一次 API 调用把 prompt 并行发给模型面板(均开 web search/fetch),裁判模型分析共识、矛盾与盲区后合成最终答案。DRACO 百题深度调研评测:Fable 5 + GPT-5.5 融合 69.0%,超 solo Fable 5 的 65.3%;Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro 预算面板 64.7%,成本仅前沿一半。Opus 4.8 融合同模型可 +6.7 分,说明合成步骤本身也有增益。用法:"model": "openrouter/fusion" 或插件自定义面板,也可作为 server tool 由主模型按需调用。
https://openrouter.ai/blog/announcements/fusion-beats-frontier/

月之暗面发布 Kimi K2.7 Code:1T MoE 编程 Agent 模型,思考 token 较 K2.6 降约 30% - 6 月 11 日上线 Hugging Face,基于 K2.6 强化真实长时域编程:1T 总参、32B 激活、256K 上下文、MoonViT 400M 视觉编码器。Kimi Code Bench v2 50.9→62.0,MCP Mark Verified 72.8→81.1,Kimi Claw 24/7 长时 Agent 基准 42.9→46.9。支持原生 INT4 量化,vLLM/SGLang/KTransformers 部署,API 已在 platform.moonshot.ai 开放,兼容 OpenAI/Anthropic 协议。
https://huggingface.co/moonshotai/Kimi-K2.7-Code

📖 教程与分享
宝玉解读 Codex 为何不推 Codex Design:Harness 可逆向,高精度可交互原型难在模型 - 6 月 13 日长文。宝玉区分 Agent 两层:Harness(提示词、工具链、UI 流程)是厨房,模型是厨师。Claude Design 的 Harness 他已逆向到 baoyu-design,可跑在其他模型上;真正拉开差距的是模型能否在画 UI 前想清楚数据结构、状态管理与交互联动。用「Mac 版 X 客户端」对比:Codex 能出能看的界面,但 sidebar 不能点、点赞无反馈,多轮才勉强凑合;Claude Opus 4.8 可流畅切换 Timeline、进出详情且状态保持。结论:GPT-5.5 还扛不住这活,产出物是 React+data.jsx 而非 Figma 静态稿。
https://baoyu.io/blog/2026-06-13/codex-design-model-gap

Addy Osmani 谈 Loop Engineering:别亲自 prompt,设计让 Agent 自己跑的循环系统 - 呼应 Peter Steinberger 与 Claude Code 负责人 Boris Cherny 的观点:从「你写 prompt、Agent 回一句」转向「你设计循环,系统自己发现任务、派发、验收、记状态」。循环五件套:定时 Automations 做发现与分拣、worktree 隔离并行、Skills 固化项目知识、MCP/插件连真实工具、子代理分工写码与验码;第六是落在磁盘的状态文件(AGENTS.md、Linear 等),因为模型跨会话会忘。Codex 与 Claude Code 能力已对齐:/goal 跑到可验证条件成立、/loop 按节奏重跑。提醒:验证、理解债务、认知投降三个风险反而更大,循环是杠杆不是甩手掌柜。
https://addyosmani.com/blog/loop-engineering/

YouMind 创始人玉伯回顾创业两周年:产品 0.1 到 1.0,三大收获与创作者工具定位 - 6 月 12 日 YouMind 满两周年,产品终于从 0.1 迭代到 1.0——两年才发正式版,主因是 AI 产品找 PMF 本就需要耐心,而非刻意克制。玉伯总结:好产品落在团队意愿、用户需求、实现能力三者的交集;增长则需要祛魅、理性与感性并行。YouMind 定位 AI 创作工作台,解决「打开空白文档不知如何下笔」——万物化稿、稿生万物,聚焦笔记/文章/播客/视频等创作者的上半层创意环节,而非红海的内容工厂。坚持诚实的创业者心态:不卷通用 Chatbot,先跑通几万付费用户的商业循环。
https://x.com/lifesinger/status/2065773982394339726

Lovable 设计师 Felix Haas 谈 AI 时代高性能团队:纸面资历不如创始人心态 - 6 月 14 日长帖,基于 Lovable 内部观察。Felix 认为团队快慢与学历头衔关系越来越小,关键是 mindset:高紧迫感、深度用户痴迷、愿为结果越出岗位边界——他用「创始人心态」描述这套行为,与是否挂 founder 头衔无关。AI 降低构建门槛后,瓶颈从「能不能做出来」转向「知不知道什么值得做」;最好的工程师和产品人都在像设计师一样思考体验与取舍。招聘应围绕 90 天可验证的成果与作品证据,而非简历上的 title 滤镜。
https://x.com/felixhhaas/status/2066168984177955157

🔧 模型与工具
NVIDIA 开源 SkillSpector:AI Agent Skills 安全扫描器,64 种漏洞模式 + 可选 LLM 语义分析 - 针对 Claude Code、Codex CLI、Gemini CLI 等技能生态的安全审计工具。研究显示 26.1% 技能含漏洞、5.2% 疑似恶意。支持扫描 Git 仓库、URL、zip、目录或单个 SKILL.md;静态分析覆盖 prompt 注入、数据外泄、权限提升、供应链、MCP 投毒等 16 类共 64 种模式,可选 LLM 二阶段语义评估,SC4 实时查 OSV.dev CVE。输出 Terminal/JSON/Markdown/SARIF,0–100 风险评分。skillspector scan ./my-skill/ 一行上手,Docker 可免装 Python,Apache 2.0。
https://github.com/NVIDIA/SkillSpector

Airtable Hyperagent 团队开源 hyperagent-public-skills:品牌、数据 viz、Airtable 等 12 款创作向技能 - Hyperagent 团队免费公开的 Agent Skills 合集,每条以 JSON 导出,遵循 agentskills.io 规范。涵盖 Airtable 看板工作追踪、品牌手册生成(三套差异化品牌概念一键切换)、NYT 风格数据可视化、Veo 超帧视频、黏土动画解说、地铁广告创意、景观设计与报价等场景。技能内嵌完整工作流指令与约束(如品牌生成器硬性禁止蓝紫渐变),适合在 Claude Code/Codex 等环境直接导入,快速复刻 Airtable 团队的创作 Agent 玩法。
https://github.com/alexmcdonnell-airtable/hyperagent-public-skills

MiniMax-M3 开源 - 稀宇科技旗舰多模态模型开源权重,约 428B 总参、23B 激活,从预训练第一步就做图文视频混合模态。核心是自研 MiniMax Sparse Attention,1M 上下文下较 M2 预填充 9×、解码 15× 加速,单 token 算力降至 1/20。Coding 与 Cowork 长时域 Agent 基准达前沿水平,支持 enabled/adaptive/disabled 三档 thinking。推荐 temperature=1.0、top_p=0.95,vLLM/SGLang/Transformers 均可本地部署,也可走 MiniMax API 与 Agent 产品。
https://huggingface.co/MiniMaxAI/MiniMax-M3


夜雨聆风