
GPT-5.6封锁11天仍不开放,"谁能用"开始比"谁更强"更关键。翁荔一篇Harness工程博客重新定义AI自我提升路径,OpenScience四天破千星对标Claude Science,腾讯混元Hy3把Agent任务解决率推到90%。
GPT-5.6封锁第11天,AI使用权开始被审批
OpenAI发布GPT-5.6系列(Sol/Terra/Luna)已经过去11天,三个模型全部处于"有限预览"状态,仅向一小群"可信合作伙伴"开放,名单与美国政府共享。白宫证实,财政部OFAC和科技政策办公室OSTP联合推动预审机制,国家网络总监办公室ONCD同步介入。
这不是发布延迟,而是"发布了但你不能用"。Sol模式在Terminal-Bench 2.1编程测试中拿到91.9%,超过Claude Mythos 5的88.0%。在漏洞挖掘测试中,它只用三分之一的Token就能达到竞品同等水平。Terra的定价只有GPT-5.5的一半——输入2.5美元/百万Token,输出15美元/百万Token,与Fable 5打平但价格只有四分之一。
问题在于,三个模型连Terra这个"日常办公均衡型"也被锁在同一个笼子里。封锁的实际效果,是给中国开源模型撕开了一个窗口。美团LongCat-2.0在OpenRouter上以"Owl Alpha"匿名身份领先了整整两个月,1.6万亿参数MoE架构,MIT协议开源,SWE-bench Pro跑出59.5%超过GPT-5.5的58.6%。Fable 5被封杀后GLM-5.2港股暴涨47%,两个半月没有回吐涨幅。
7月7日是一个交汇点:当天Anthropic的Fable 5免费使用窗口到期,7月8日正式进入每百万Token输入10美元、输出50美元的付费周期。一边是旧东家拧紧水龙头,另一边是新模型锁着不放,开发者的选择空间被压缩到史上最窄。
对开发者来说,最务实的策略是建立多模型路由层。为每一个关键工作负载维护至少两个可随时切换的替代方案,把"模型被锁的概率乘以迁移成本"写进技术选型文档——这个字段在2026年之前不存在,现在是每个AI技术负责人必须填的一行。LongCat-2.0、GLM-5.2、DeepSeek V4、腾讯Hy3,都在用开源或低价策略抢占这个窗口。

翁荔博客引爆Harness工程讨论
7月4日,前OpenAI安全研究副总裁、ThinkingMachinesLab联合创始人翁荔发布技术长文《Harness Engineering for Self-Improvement》,登上了GitHub Trending榜首,被业内称为"AI操作系统觉醒宣言"。
核心观点:当前大模型再强,也困在上下文窗口的"纸片牢笼"里。Harness——包裹模型的系统层"脚手架"——才是决定AI实际工作能力的关键变量。翁荔提出三阶段进化路径:第一阶是Agentic Context Engineering,让模型边干边写"操作手册",失败时自动提炼教训;第二阶是Meta-Context Engineering,由"元智能体"专门负责设计记忆衰减策略和任务优先级调度;第三阶是Meta-Harness,把Harness本身变成可编程、可测试、可进化的目标。
这不是空谈。微软Codex Agent在SWE-bench Verified基准中通过率从38%飙升至61%,核心突破不在模型微调,而在Harness引入了"持久化状态树"与"失败路径热备份"机制。Darwinian Gödel Machine项目验证,自演化Harness比人类专家手写的版本平均提升27%成功率,而且自己发现了3个连原作者都忽略的API调用时序漏洞。
翁荔同时指出五大风险:评估失焦(沙盒指标无法衡量真实世界质量)、权限塌方(2026年3月某金融Agent因Harness迭代失控误改风控模块)、记忆癌变(某科研Agent迭代17轮后状态树膨胀至2.3GB,64%是无效缓存)、多样性坍缩(83%的自优化循环在第五代后陷入局部最优)、长期性失语(从不计算技术债利息)。
这篇博客为什么重要?因为它把行业讨论的中心从"模型谁更强"拉回到了"系统怎么搭"。一个模型从80分到85分可能需要烧掉几亿美金的算力,但一个好的Harness架构能直接把70分模型的实际工作效果提升到85分。对于预算有限的团队来说,优化Harness比追新模型的ROI高得多。ClaudeCode上线半年,GitHub上超21万开发者主动提交Harness优化补丁,说明社区已经在朝这个方向投入真实精力。

OpenScience四天破千星,开源对标Claude Science
Anthropic 6月30日发布Claude Science面向科学家的AI科研工作台后仅六天,Synthetic Sciences就推出了开源替代品OpenScience。项目地址github.com/synthetic-sciences/openscience,7月3日创建,7月7日已获1289 Star、178 Fork,Apache-2.0协议,TypeScript编写。
OpenScience提供290+研究技能,覆盖机器学习(DeepSpeed、PEFT、TRL训练框架)、分子与临床生物学、化学信息学、论文与LaTeX、云计算(Modal、Tinker)等方向。集成了UniProt、RCSB PDB、Ensembl、ChEMBL、PubChem、arXiv、OpenAlex、Semantic Scholar等约30个科学数据库,Agent可以直接查询。
最大的差异是模型不可知。OpenScience支持Anthropic、OpenAI、Google以及国产的智谱、DeepSeek、Kimi等任意模型,用自己的API Key,项目中途可一键切换模型,内置实时价格面板区分低/中/高算力档位。所有数据保存在本地。安装方式:npm install -g @synsci/openscience,运行后自动打开浏览器工作区。
Synthetic Sciences已获得Y Combinator、红杉、a16z scout基金及多位天使投资人投资。创始人表示:科学AI应该是开放的,一家公司不应该拥有其他人用来发现新知识的工具,也不应该决定谁能使用它。
腾讯混元Hy3正式开源,Agent任务解决率达90%
腾讯混元Hy3正式版采用MoE架构,总参数295B,在内部组织的270位专家基于真实工作的模型盲测中展现出优于GLM5.1的表现,尤其在前端开发、数据与存储、CI/CD等类别优势显著。
海量产品Co-design测试结论是:主要场景中至少90%的Agent任务可以使用Hy3成功执行,覆盖数据处理、文档生成、研发分析、信息查询、网页制作、生活决策等办公与生活自动化场景。
开源方面Hy3采用Apache 2.0协议,全球开发者可免费商用,已陆续在OpenRouter、Hermes、Kilo、Cline、OpenClaw、OpenCode、CherryStudio等平台上线。业务侧已接入WorkBuddy、元宝、微信公众号等多个腾讯产品线。
Hermes Agent v0.18.0发布,21万星的"审判版本"
Hermes Agent(GitHub 210,932 Star,38,722 Fork,MIT协议)7月1日发布v0.18.0版本,代号"The Judgment Release"(审判版本)。这个版本两周内合并了998个PR,关闭了949个Issue,370+社区贡献者参与。
核心变化:P0和P1优先级Issue全部清零——约700个最高优先级问题在12天内全部关闭,并承诺从此保持P0/P1为零。MoA(混合智能体)从模式升级为可选模型,命名后的MoA预设像选普通模型一样直接选择,每个参考模型的推理过程都会完整展示,聚合答案实时流式输出。
/goal新增完成契约——你定义什么叫"完成",Agent根据实际证据判断是否达标,而不是模型自认为做完了。/learn命令可以把任何东西蒸馏成可复用技能:指向一个目录、一个URL,或五分钟前走过的工作流,自动写入符合CONTRIBUTING.md标准的Skill文件。/journey提供可播放的学习时间线,桌面端新增记忆图谱——终于能看到你的Agent学到了什么、什么时候学的,还能直接编辑或删除。
delegate_task支持后台扇出:多个子Agent并行运行,主会话不阻塞,全部完成后结果汇总为一条消息返回。Gateway新增scale-to-zero和drain协调,空闲时休眠、重启前优雅排空不丢会话。
杭州Agent大会自进化已成行业共识
智东西主办的Agent大会在杭州连开两天,64位嘉宾、61场演讲,锁定十大核心议题:Harness、自进化Agent、Coding Agent、多Agent协同、Skills、Computer-Use Agent、深度研究Agent、企业级AI Agent、AI Agent产品创新、Agentic Infra。
几个关键判断:
MemoraX AI创始人郝建业指出Agent真正落地的三大挑战:真实任务中持续调用工具、记忆自进化、安全长期可控。记忆不是越多越好,百万Token上下文远远不够,参数化、学习驱动的记忆管理系统将是未来方向。MemoraX将在7月底发布业界首个Agent Memory测评榜单。
蚂蚁百灵架构负责人李龙飞认为,Agent时代Token成本剧增,大模型竞争将从单点能力走向效率、原生工作流和可服务性的综合竞争。百灵大模型在Artificial Analysis评测中,Token消耗量只有对标模型的不到一半。
阿里巴巴Qoder推出桌面办公Agent路线:QoderWork作为常驻桌面的AgentRuntime,通过Skill系统、连接器、文件保护和MCP适配打通多软件上下文。QoderWake定位是配备独立电脑、账号、权限和队列的数字员工。从PC到Agent Computer的计算平台切换,预计3-5年内完成。
圆桌讨论中,清昴智能联合创始人姚航判断OpenClaw等智能体爆火提升了行业对Agent的关注度,同时突出了安全风险问题,促使企业将沙箱、私有化部署等安全措施提上日程。"可控性是一切0前面的那个1。"
夜雨聆风