今日摘要
• Anthropic 6/23 推 Claude Tag:Slack @Claude 常驻队友 + agent identity,同日 outage 超 8000 条报告
• Superhuman 6/23 收购 GPTZero:1900 万+ 用户、3000 万美元 ARR,Grammarly 母体「双检测器」合体
• 五眼联盟 6/22 警告:frontier AI 网络攻击窗口以「月」计非「年」,CISA 高危补丁期限缩至 3 日
• Menlo 6/23 募 30 亿美元创纪录基金,Anthropic 持股纸面约 140 亿美元;ISC TOP500:LineShine 2198 PFlop/s 登顶
• NVIDIA 6/23 Agent Toolkit + TOP500 占 81%;百度 Unlimited OCR R-SWA 多页 OCR 端到端 SOTA 93.92% (✧∀✧)
产品与功能更新
1. Anthropic Claude Tag:Slack 里的「常驻 AI 同事」(Anthropic 官稿 / The Verge 6/23)
Anthropic 发布 Claude Tag 研究预览:Claude Enterprise/Team 用户可在 Slack 频道 @Claude 分配任务、查数据、写/合并 PR;支持 ambient 模式主动跟进线程与跨频道记忆。核心创新是 agent identity 访问模型——不再借用个人账号权限,而由管理员为频道级 AI 身份 配置工具、数据范围与 token spending limit,并留 audit log。与 Microsoft Copilot 横向铺全栈不同,Anthropic 押注「知识工作已在 Slack 发生」——在 IPO 前夜 同日 Claude 又遭大规模 outage(见行业板块),企业 Agent 的可用性与治理被摆到同一页。
2. Superhuman 收购 GPTZero:1900 万用户、3000 万美元 ARR(TechCrunch 6/23)
由 Grammarly 收购邮件客户端后更名的 Superhuman 宣布收购 GPTZero(普林斯顿毕业设计起家、3 年)。创始人 Edward Tian 对 Business Insider 称产品已有 1900 万+ 注册用户、3000 万美元 年化经常性收入,累计融资仅 1350 万美元 且 2024 年已盈利。Superhuman 自身已有 AI 检测 工具,收购理由写「两个检测器比一个更好」——一方防 AI slop,一方帮用户把文稿改到「不像 AI 写的」。在 Claude Tag 把 Agent 塞进协作软件的同周,「检测 + 改写」栈也被巨头收编。
3. Sakana Fugu Ultra:路由 frontier 模型换「最优表现」(The Verge 6/23)
日本 Sakana AI 公布 Fugu Ultra 基准与内测反馈:在部分任务上对标或超过 Fable 5、Gemini 3.1 Pro、GPT-5.5。机制是动态选择何时调用 Claude、Gemini 等闭源 frontier 模型完成子任务,且不告知用户具体用了哪一家——官方称「Over time, Sakana Fugu will naturally grow by incorporating newer models, including our own.」在 Fable/Mythos 遭美国出口管制、Reflection 押注开放权重算力的背景下,「meta-router」成为第三种产品形态:不自训最大模型,而是做调度层。
4. NVIDIA Agent Toolkit:Nemotron + NemoClaw + OpenShell 企业 Agent 底座(NVIDIA Blog 6/23)
NVIDIA 发布 Agent Toolkit,拆为三块:Nemotron 开放模型供定制评估;NemoClaw 蓝图连接工具/技能并约束 Agent 行为;OpenShell 安全运行时让 Agent 在现有系统内执行。可与 Hermes Agents、OpenClaw 等第三方 harness 组合;同步强调 BioNeMo Toolkit 把蛋白设计/虚拟筛选等从「数月 → 数日」。案例数字包括 CrowdStrike 专用安全 Agent 告警分诊 98.5% 准确率——在 Claude Tag 走 Slack、OpenAI Daybreak 走网络安全同月,NVIDIA 走「模型 + 工具 + 运行时」全栈卖给垂直行业。
5. 百度 Unlimited OCR:R-SWA 恒定 KV cache,32k 上下文一次转录数十页(36氪 / arXiv 6/23)
百度 开源 Unlimited OCR:解码器全层替换为 Reference Sliding Window Attention(R-SWA)——视觉/提示 reference 段全局可见且不参与状态转移,解码侧滑动窗口宽度固定 128,使 KV cache 有界而非随输出线性膨胀。结合 DeepEncoder 16× 视觉压缩,在 32k 长度内可单次前向转录数十页;OmniDocBench v1.6 Overall 93.92% 称端到端 SOTA,长文档 Distinct-35 在 40+ 页仍 96.90%;输出 6000 token 时 TPS 7847 vs DeepSeek OCR 5822(+35%)。代码 github.com/baidu/Unlimited-OCR,论文 arXiv:2606.23050。
前沿研究
1. SelfCompact:Agent 自决何时压缩上下文(arXiv 2606.23525 / 6/22)
长 Agent trace(CoT + tool call)会「锚定」后续生成并最终撑爆窗口;固定 token 阈值 压缩可能在推导/搜索中途丢弃半成品。论文 SelfCompact 让模型自带 compaction tool + 轻量 rubric(子任务完成/轨迹收敛时触发,推导中途/卡死时抑制),无需微调。在 6 个 benchmark、7 个模型上,数学任务较无压缩基线最高 +18.1 分、Agentic search +5—9 分,单题成本降 30—70%——与 Claude Code sub-agent 无限循环(6/23 outage 诱因之一)形成对照:「何时停、何时摘要」可以是 scaffold 能力而非训练能力。
2. ReasoningLens:长 CoT 分层可视化与 Agent 审计(arXiv 2606.23404 / 6/22)
ReasoningLens 开源框架把超长 Chain-of-Thought 结构化为可交互层级(策略 vs 执行),并用 Agentic auditor 做自动错误检测与工具增强验证,合成模型级「推理画像」暴露盲区。面向 LRM 透明度负担——当 o 系列/Claude 输出成「文字墙」,调试不能只靠人工 scroll;与 SelfCompact 互补:一个管「怎么收」,一个管「怎么看」。
3. 抽象表征几何支撑 LLM 推理(arXiv 2606.23345 / 6/22)
团队用情境反转学习范式对比人类与 LLM:人类更常泛化推理,但 LLM 在发生泛化时,内部状态呈现类似海马体的低维近似正交流形;该几何分层——低层编码刺激身份,高层形成「hippocampal-like band」承载抽象情境。干预显示:任务序列语言建模诱导几何解耦,对高层做几何正则化可提升可泛化推理——为「LLM 是否在学抽象结构而非统计捷径」提供可测量中间层证据。
4. SCOPE:开放世界符号规划的自适应演化(arXiv 2606.22488 / 6/21)
SCOPE 框架在 VLM + 经典规划器 组合中,引入 Symbolic Execution Simulator(SESim) 做符号验证与真实执行反馈以修正计划并演化符号世界;Self-Adaptive Symbolic Memory(SASMem) 把反馈蒸馏为 evolving 符号知识。开放环境感知得到的符号表示常不完整,实验称 SCOPE 显著提升符号世界完备性、扰动下计划成功率与跨任务 grounding—— embodied Agent 从「一次性规划」走向「符号世界在线修补」。
行业展望与社会影响
1. 五眼联盟:frontier AI 网络攻击「以月计」非「以年计」(CNN / Computer Weekly 6/22)
美英加澳新情报机构罕见联合声明:Frontier AI 将「fundamentally transforming」攻防两面能力,「The timeline is not years, it is months.」呼吁企业把网安当核心业务风险——减攻击面、加速补丁、强化身份、演练 incident response;并 paradoxically 建议用 AI 加固防御。CISA(联署方)已将政府网严重漏洞处置期限缩至 3 日,点名 Mythos、GPT-5.5-Cyber 等模型可加速复杂入侵——与 OpenAI Daybreak、Anthropic 军用红线争议同周,「会用 AI 打洞的人」与「用 AI 补洞的人」都在倒计时。
2. Meta 暂停 MCI 员工监控:配置失误致全员可读敏感数据(BBC / Reuters 6/22)
Meta 暂停 Model Capability Initiative(MCI)——4 月 起追踪美国员工鼠标/键盘/屏幕以训练 AI 理解人机操作。内部 SEV 报告指收集数据(含完整 prompt 转录、私聊、绩效、DSS 1—4 级敏感度)对全公司可见;近 2000 人 petition 要求终止。Meta 称暂无证据被滥用,调查期间暂停;未给出恢复时间表。公司 2026 年 AI 资本开支最高 1450 亿美元——「为训 Agent 监控员工」与「连监控数据都管不住」在同一条新闻里。
3. Menlo Ventures 30 亿美元基金:Anthropic 持股纸面约 140 亿美元(TechCrunch / Menlo 6/23)
成立 50 周年的 Menlo Ventures 宣布 30 亿美元 新基金(Menlo XVII 早期 + Menlo Inflection IV 成长期),为史上最大单笔募资。Bloomberg 源称其 Anthropic 持股现值约 140 亿美元——源于 2024「bet-the-firm」7.5 亿美元 领投 Series D(当时估值 184 亿)及后续每轮跟投;Anthology 基金与 Anthropic 共建,已投 60+ 公司、部署约 2.5 亿美元,Graphite→Cursor、Astrix→Cisco 等已有退出。在 Anthropic 6/1 秘密 S-1、6/23 Claude Tag + outage 的窗口,「最大 LP 收益 vs 上市前 infra 信誉」被同时定价。
4. Groq 6.5 亿美元再融资:Nvidia「非收购式」抽走 IP 后的 inference cloud 重建(TechCrunch / Groq 官稿 6/22)
Groq 确认 6.5 亿美元 融资(Disruptive、Infinitum 领投),距 2025/12 Nvidia 约 200 亿美元 非独家授权 + 挖走 Jonathan Ross 等核心团队约 6 个月。新资金扩 13 个数据中心 inference 云,目标 2027 年底 200 MW;平台称每周为 500 万 开发者处理数万亿 token。公司将同时部署自研 LPU 与 Nvidia LPX(含 Groq 授权设计)——芯片战争之外,「被买走灵魂后能不能只做云」成为 2026 H1 inference 赛道副线。
5. ISC 2026 TOP500:LineShine 2198 PFlop/s 新王,NVIDIA 仍占 81%(TOP500.org / HPCwire 6/23)
第 67 期 TOP500 在汉堡 ISC 发布:中国 LineShine(1380 万 核)以 2198.40 PFlop/s 登顶,取代 El Capitan(1809 PFlop/s);JUPITER 仍居 #5(1000 PFlop/s),Alps #10。NVIDIA 称技术覆盖 500 强中 400+(81%) 系统、Green500 前 8 全用 NVIDIA GPU;Grace CPU 装机 26 套(较上期 +8)。Next Platform 分析:274 台加速机器中 Nvidia 237 台 vs AMD 32 台,但峰值算力 AMD 8.18 exaflops vs Nvidia 11 exaflops——HPC 与 AI 算力叙事在 LineShine 与 Rubin 液冷 之间继续分岔。
6. NVIDIA 45°C 全液冷 AI 工厂:单 MW 年耗水从 260 万加仑趋近零(NVIDIA Blog / Gizmodo 6/22)
Rubin 代 AI 基础设施宣称 100% 液冷(无风扇、无风道),75% 水 + 25% 丙二醇 闭路循环,供液温度最高 45°C(113°F),许多气候可无 chiller 靠 dry cooler 排热。官方称相对传统 cooling tower, favorable 气候下设施冷却用水可从约 260 万加仑/MW/年 降至近 零(最高 100% 降幅);50 MW 超算设施迁移液冷可年省 400 万美元+ 冷却能耗/水费——在 Microsoft×Chevron 天然气数据中心 舆论压力下,AI 基建叙事转向「更热的水、更少的蒸发」。
开源TOP项目
(⭐ 数为 GitHub API 查询所得,实时以仓库首页为准;查询日 2026‑06‑24)
1. ponytail
链接:https://github.com/DietrichGebert/ponytail
(⭐ 52 333)YAGNI 向的 Agentic 编码 harness:Claude Code/Cursor 插件 + promptfoo 基准,宣称较无 skill 基线 LOC -54%、token -22%、成本 -20%,且 100% 安全通过率;6/23 发 v4.8.0。在 Claude Tag 把 Agent 送进 Slack、SelfCompact 讨论「何时压缩」的同周,ponytail 代表第三条路——「少写代码而不是 golf 代码」;6/12 创建、6 月 星标爆发,适合给 Codex/Claude Code 挂「克制生成」skill。
2. pi
链接:https://github.com/earendil-works/pi
(⭐ 65 090)Mario Zechner(@badlogic)的 Agent 单体仓库:pi-ai 统一 15+ 提供商 LLM API,pi-agent-core 约 418 行核心 loop,pi-coding-agent 为 TUI 编码 CLI;OpenClaw 等项目的底层 runtime。6/22 推 v0.79.10。当 NVIDIA Agent Toolkit 强调「任选 harness」、Nex-N2 标榜 OpenClaw 工作流时,pi 是社区里「极简 loop + 可组合包」的参考实现——星标 6.5 万 级,活跃维护中。
3. Unlimited-OCR
夜雨聆风