> 2026-07-01 · 每天抓 AI 圈的新动静。智启AI 帮你筛掉噪声。把真正值得看的几条留下来。
01 🔬 学术突破
OpenAI 发布 GeneBench-Pro:计算生物学最新基准
OpenAI 推出 GeneBench-Pro,专为评估 AI 智能体在计算生物学中处理模糊性和判断性分析的能力。包含 129 个问题,覆盖统计遗传学、群体遗传学等 10 个领域 21 个子领域。每个问题提供真实混乱的数据集,要求模型探索数据、选择分析路径并迭代实验,82 个问题已由外部专家审核确认。
Agents-A1:35B MoE 智能体模型达到万亿参数性能
终于有个不是堆参数出成绩的方案了——研究人员提出 Agents-A1,一个 35B 参数的 MoE 智能体模型,通过扩展智能体 horizon(长轨迹与异构能力)达到万亿参数模型性能。团队构建平均 45K token 的智能体轨迹,三阶段训练后,Agents-A1 在 SEAL-0(56.4)、IFBench(80.6)、FrontierScience-Olympiad(79.0)等基准上全面领先 Kimi-K2.6 和 DeepSeek-V4-pro。
OSWorld2.0:AI 在真实电脑操作上还差得远
讲真,看完这个数据有点扎心。新基准包含 108 个长时域计算机使用工作流,每项任务人类中位数约 1.6 小时完成。Claude Opus 4.7(最大思考)平均需 318 次工具调用。结果呢?Claude Opus 4.8 得分最高仅 20.6%(部分 54.8%)。瓶颈不在 GUI 控制或编码,而是——丢失约束、猜而不问、跳过验证。说白了,AI 距离「专业级操作员」还有好几个量级。
DiScoFormer:一个 Transformer 搞定密度与分数双估计
有点意思——DiScoFormer 无需重新训练即可从数据点同时估计分布密度和分数。在 100 维空间中,比最优核密度估计降低分数误差约 6.5 倍、密度误差超 37 倍,且随样本量增加持续提升。
02 💼 商业动态
黑石未来3~5年拟投300亿美元在日本建AI数据中心
真金白银在说话。黑石计划在日本 AI 数据中心领域投资 300 亿美元,在已有 500MW 基础上新增超 1GW 容量。黑石总裁表态直接——AI 投资仍处早期,真正风险是算力短缺而非基建泡沫。同时,黑石、阿波罗、博通联合成立 AI XPV 平台,目标 2028 年向 OpenAI、Anthropic 等提供超 20GW 算力,首期 350 亿美元支持 Anthropic 部署 1GW 基础设施。
Meta 秘密测试 ChatGPT 等竞品:4.5万条危机提示
这操作放电影里都算离谱。Meta 通过承包商 Covelen 发起代号「Cannes」的项目,雇佣数百人假扮未成年人,向 ChatGPT、Gemini 和 Character.AI 发送关于自杀、自残的敏感提示。2025 年 8 月一轮测试中发送了超 4.5 万条提示。被测试公司均不知情——Character.AI 表示违反服务条款,OpenAI 已调查,Google 称未批准。
AI 就业争论:裁员9万 vs 高投入企业增员12%
数据打架了。截至 2026 年 5 月,AI 相关裁员接近 9 万个,预计未来五年美国最多 15% 的岗位将被 AI 替代。但另一边,Ramp 与 Revelio Labs 的报告发现了截然不同的画面:高 AI 投入企业(月均人均支出 30 美元)总员工数增长 10.2%,入门级岗位增长 12%。AI 在资源充裕的科技企业中正成为扩张工具,而非替代工具。但只买订阅没持续投入的公司未见人头增长——可能会加剧企业间的资源鸿沟。
Anthropic:AI 算力成本已是工程师薪酬的 2.3 倍
倒吸一口凉气的数据。Anthropic 在算力上的支出达到每位工程师每年 51.5 万美元,是其完全薪资(22.4 万美元)的 2.3 倍。作为对比,顶尖 1% 软件公司的算力支出为 8.9 万美元,中位数仅 1.37 万美元。三个 2029 年情景预测了差距的缩小路径。
03 🤖 模型与工具
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash
Nano Banana 2 Lite 速度拉满——文本到图像仅需 4 秒,每 1K 分辨率图像成本 $0.034,已上线 Google AI Studio 和 Gemini API。同期推出的 Gemini Omni Flash 支持高画质视频生成与对话式编辑,视频输出定价 $0.10/秒,向开发者开放 API。
美团 LongCat 发布旗舰模型 LongCat-2.0
一个亮点:LongCat-2.0 采用 1.6T 参数 MoE 架构(约 48B 活跃参数),原生支持 1M 上下文,但定价是真正让人注意到的——Input Cache $0.015/1M tokens、Output $2.95/1M tokens。专为 Agentic Coding 设计,三大技术 LSA 稀疏注意力 + Zero-Compute Experts + MOPD 三组专家门控路由,SWE-bench Pro 得分 59.5,已上线 SiliconFlow Day 0。
Qwen 3.6 27B:本地大模型的理想之选
想跑本地模型?这个值得关注。原生 256k 上下文,Macbook Max M5 上 Q8_0 量化可达 30 tokens/s,RTX 5090 上 Q6_K 量化可达 50 tokens/s。作者称其为首个真正具备通用智能的本地模型——从创意诗歌到编程游戏,单提示完成。还有个 MoE 变体 35B A3B,但作者推荐 27B。
Anthropic 推出 Claude Science 科研工作台
这个得重点说。AI 科研工作台整合超 60 项预配置技能与连接器,覆盖基因组学、单细胞、结构生物学等领域。可在本地或 SSH/HPC 远程使用,生成 3D 蛋白质结构等可审计成果,内置 reviewer agent 自动检查引用与计算错误。通过 NVIDIA BioNeMo 接入 Evo 2、Boltz-2 等模型,今日以 beta 版面向 Claude Pro/Max/Team 和企业用户开放。
04 📡 行业动态
特斯拉 Cybercab 量产版在奥斯汀启动公开道路测试
来了。2026 年 6 月 30 日,特斯拉在奥斯汀公共道路启动首批 34 台量产版 Cybercab 工程测试。无方向盘无脚踏板,配安全监督员。从 2024 年 10 月概念车首秀到实车上路约 20 个月。目前不对外开放乘客。此前奥斯汀已有无安全员 Model Y 无人驾驶出租于 6 月 22 日开放付费服务。
Rubin Ultra 取消,新版尺寸性能减半
NVIDIA 的路线图出了插曲。在 GTC 2026 宣布仅 3 个月后,原 4-die Rubin Ultra 因制造执行问题被取消。新版的「Rubin Ultra」尺寸减半,实际性能约为原版的一半。罕见。
Apple Creator Studio 更新:Final Cut Pro AI 增强、Logic Pro 新特性
Final Cut Pro 新增 on-device AI 驱动的 Generate Captions(自动字幕)和 Edit Detection(自动检测剪辑点),Mac 版加入 Auto Mask、增强 Match Color 等功能。支持将帧发送至 Pixelmator Pro 编辑。Logic Pro 新增 Grammy 制作人制作的 Producer Project。订阅 $12.99/月或 $129/年,教育用户 $2.99/月。
Claude Desktop 推出 Linux 公测版
好消息:Claude Desktop 现已在 Linux(Ubuntu 和 Debian)上进行测试,包含 Claude Code、Claude Cowork 和聊天功能。
OpenClaw 发布原生 iOS 与 Android 应用
智能体平台 OpenClaw 正式登陆 iOS 和 Android 原生移动应用,支持频道、任务、回复,随身运行智能体。
ADK Go 2.0 发布:基于图的多智能体工作流引擎
Google 的 Agent Development Kit for Go 2.0 来了,引入基于图的工作流引擎,内置人工参与循环(HITL)、指数退避重试以及动态编排,单智能体和复杂图运行在同一运行时上。
05 💡 观点与趋势
Claude Code 四种智能体循环模式深度解析
讲真,理解这四种循环比学十个新工具更有用。Claude Code 团队定义了 turn-based(提示触发)、goal-based(通过 `/goal` 设完成标准)、time-based(通过 `/loop` 定时执行)、proactive(事件触发自动运行)。文章还介绍了如何将人工验证步骤编码为 SKILL.md,实现端到端自检。
一个人管理5款产品,80%时间不写代码——Every的复利工程
你敢信?媒体软件公司 Every 公开「复利工程」方法论:核心四步 Plan→Work→Review→Compound,其中 Compound 把每次解法写进 CLAUDE.md 和 docs/solutions/,AI 下次直接避坑。工程师仅 20% 时间写代码。配套开源插件含 26 个专项 agent、23 条工作流命令、13 项技能。
具身智能数据采集员:日薪200元起,给机器人当老师
一个很真实的数据:全球高质量物理交互数据截至 2026 年初仅约 50 万小时,不足大语言模型训练数据的两万分之一。所以具身智能数据采集员以日薪 200-250 元招兼职,无需学历经验。工作分两种:遥操作控制双臂机器人,或者徒手重复动作让设备记录轨迹。
OpenAI Signals 数据:ChatGPT 全球采用趋势揭秘
数据来了。用户注册六个月后日均消息量增加 50%,尝试任务种类翻倍。非洲和亚洲增速最快,女性用户已占全球多数。非英语用户占活跃用户半数以上,领先语言为西班牙语、葡萄牙语和阿拉伯语。
Grant Sanderson 谈 AI 与数学的未来
3Blue1Brown 创办人点出了一个容易被忽略的事实:AI 在 IMO 获金牌并不等于 AGI——即使 AI 未来解决千禧年大奖难题,仍有大量人类任务无法被自动化。Talking points 还包括概念突破验证周期可长达一个世纪、Riemann 假设的 AI 证明能否被人类理解,以及现实经济任务难以套用强化学习环境。
X 发布 hosted X MCP:AI 智能体可直连 X API
X 官方推出了 hosted X MCP,AI 智能体可通过 MCP 协议直接调用 X API 获取实时信息,支持 Grok、Cursor 等工具。个人优惠价每次调用 0.01 美元(1 美元 1000 次),有用户实测拉取近三天书签仅花 0.1 美元。
Anthropic 推出 Claude apps gateway 企业控制平面
适合企业场景——自托管控制平面,让企业能在 Amazon Bedrock 和 Google Cloud 上运行 Claude Code。提供 SSO 登录、集中策略管理、角色权限、路由及消费上限控制,不向 Anthropic 发送推理流量。
Claude 在 Microsoft Foundry 正式可用
又是一个企业好消息。托管于 Azure 环境,运行在 NVIDIA GB300 GPU 上。首批提供 Claude Opus 4.8 和 Haiku 4.5,支持提示缓存和扩展思考,Azure 用户可使用现有身份验证与计费。
Claude Code v2.1.196 发布:安全加固与性能优化
版本更新有条非常实用的改进:`claude mcp list/get` 不再启动未经安全批准的不安全 MCP 服务器。`/code-review` token 用量减少约 25%,流式空闲看门狗默认开启,5 分钟无事件自动中止重试。
AI News Radar 大更新:支持订阅多平台自媒体信息源
一个不错的开源项目更新——新增自媒体板块,支持订阅某书、某音、某X等平台账号,每日按热度推荐 Top10。项目完全开源,可零 API 部署独立 AI 日报页面。
> 感谢浏览,欢迎点赞评论加关注❤️,明天见👋
夜雨聆风