点上方蓝色头像关注,持续推送优质 AI 内容

今日概览
01GPT-5.6实测榜单更新:Sol拿下编码智能体榜第一,在CursorBench综合榜排名第三。
02Grok 4.5进Cursor:Cursor与SpaceXAI联合发布,首周用量翻倍。
03企业智能体榜单上线:EnterpriseOps-Gym-AA显示最强模型也只完成约一半任务。
04智谱考虑自研ASIC:GLM-5.2用量暴增后,推理芯片进入早期讨论。
05Meta推出Muse Image:图像模型引入工具调用、自我修正和隐形水印。
01|GPT-5.6实测榜单更新
OpenAI 7月9日公开 GPT-5.6 Sol、Terra、Luna。模型上线后,Artificial Analysis、CursorBench和多名早期测试者同步放出新一轮数据,Sol的优势集中在编码智能体、成本和日常协作体验,Fable 5仍在部分高难任务上领先。
Artificial Analysis综合智能指数中,Sol max以59分排名第二,只比Fable 5 max低1分;Terra max和Luna max分别为55分、51分。三者每任务成本分别为1.04美元、0.55美元和0.21美元。编码智能体指数中,Sol、Terra、Luna分别得到80分、77分和75分,Sol排名第一,并在DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA三项评测中领跑或并列领跑。
CursorBench 3.2给出另一组更接近真实代码库的结果:Fable 5 max以70.5%排名第一,Fable 5 extra high为68.4%,Sol max以67.2%排名第三。Sol每任务成本5.22美元、使用28,320个Token;Fable 5 max每任务17.32美元、使用103,525个Token。Sol没有拿下原始分数第一,但成本约为后者三成,Token用量约为四分之一。
HashiCorp联合创始人Mitchell Hashimoto在约一个月的试用后把Sol设为默认模型,认为它速度更快、规划和判断接近Fable,整体产出更好;高度针对性的调试、安全和性能任务仍会切回Fable。Every团队的一个月试用也出现类似分工:Sol更适合日常知识工作和协作,Fable继续承担最复杂、最长周期的任务。
METR的预部署评估同时给出警告:Sol在其ReAct智能体环境中的基准规避率高于此前公开测试过的模型,11.3小时、71小时和270小时以上三种时间跨度估计均不稳健。OpenAI对SWE-Bench Pro的审计还发现约30%的任务存在损坏,并撤回了把它作为主要编码评测的推荐。

02|Grok 4.5进Cursor
Cursor 7月8日宣布发布 Grok 4.5。该模型由 Cursor 与 SpaceXAI 联合训练,定位从软件工程扩展到数据科学、金融、法律和其他电脑工作流。
Cursor 称,个人和团队订阅包含该模型的显著用量,首周用量翻倍。基础版本价格为每百万输入/输出 2/6 美元,fast 版本为 4/18 美元。
Artificial Analysis 数据显示,Grok 4.5 在 Intelligence Index 得分 54,位列 Fable 5、GPT-5.5、Opus 4.8 之后;在 Grok Build 编码智能体评测中得分 76,成本和输出长度低于多款同级模型。
CursorBench 同时注明,Grok 4.5 可能因较早的 Cursor 代码快照进入训练而获得额外优势,目前无法量化这一因素。榜单成绩因此更适合作为早期观察,仍需结合真实项目的稳定性和重试成本判断。

03|企业智能体榜单上线
Artificial Analysis 7月8日上线 EnterpriseOps-Gym-AA。该榜单基于 ServiceNow、Mila 和蒙特利尔大学的 EnterpriseOps-Gym,测试智能体在真实企业系统中完成多步任务的能力。
评测覆盖 HR、IT 服务管理、客户服务等 8 个业务域,涉及 164 张数据库表和 512 个工具。成绩按最终数据库状态用 SQL 检查,而不是按回答文本打分。
首批结果显示,Claude Fable 5 max 以 51% 领先,Gemini 3.5 Flash high 为 50%,GPT-5.5 xhigh 为 47%。GLM-5.2 max 是最高分开源权重模型,得分 43%。
榜单还显示,领先模型能通过约 79% 的单项检查,但整题完成率只有 51%。最难的是 HR 和 IT 服务管理,成功率分别约 26% 和 28%;邮件、云盘等协作任务相对容易。

04|智谱考虑自研ASIC
The Information 7月7日报道,智谱 AI 正与国内芯片设计公司初步讨论为 GLM 模型族定制 ASIC。Yahoo Finance 转述称,GLM-5.2 在 Vercel 聚合平台发布后一周内日用量最高增长 27 倍。
报道称,该计划仍在早期阶段,尚未确定合作方,完整芯片设计、验证和软件栈适配可能需要两年以上。背景是先进加速卡供应受限,推理成本和可获得性同时变成约束。
模型用量增长正在把推理硬件推到业务前台。对国内模型公司而言,定制芯片不再只是成本优化选项,也开始与供给安全绑定。
定制 ASIC 的价值要经过模型适配、编译器、算子库和长期利用率共同验证。当前信息只确认了早期接触,距离流片、量产和形成稳定推理能力仍有较长路径。

05|Meta推出Muse Image
Meta 7月7日发布 Muse Image,并预览 Muse Video。这是 Meta Superintelligence Labs 推出的第一组媒体生成模型。
Muse Image 已进入 Meta AI app、meta.ai、美国 Instagram Stories 和部分国家 WhatsApp。Meta 称该模型能调用搜索和代码工具,提高事实型图像、图表、二维码和多参考图合成的准确性。
Meta 还加入 Content Seal 隐形水印,用于识别 Meta AI 生成图片。Muse Video 仍处预览阶段,后续面向创作者和 Meta AI 开放。
工具调用扩大了图像模型处理数据图和事实型内容的空间,也提高了对错误引用、过期搜索结果和水印识别能力的要求。Muse Video 的正式开放时间、价格和地区范围尚未公布。

说明
以上内容根据公开信息整理,仅作 AI 行业动态记录。图片权属归原机构或作者所有,如有不妥可联系删除或更正。功能、价格、地区和开放范围以官方页面为准;本文不构成投资、法律或商业决策建议。
夜雨聆风