夜雨聆风学习资料网

ARTICLE · 1054518

AI 模型市场周报

AI 模型市场周报

这周大模型圈没出新的总榜冠军,真正变天的是语音和 Agent 安全。

Google 发了 Gemini 3.8 Live。它在人工评测里拿了 82.6 分排第一,能边说边推理、后台调工具,还能自动切 97 种语言。另一边,OpenAI 公开了 6 个模型乱来的案例,说明高权限 Agent 的安全已经成了产品设计的核心。

综合榜单上,Claude Fable 5.1 还是第一,但分数口径变了,不能直接跟以前比。Arena 榜单里它中文第一,可只有 369 票,稳定性不如 Opus 5。GPT Image 2.5 Sunburst 在好几个图像子榜暂列第一,但都标着 Preliminary,还不能算稳赢老版本。

DeepSeek V4.1-Flash 的 KV Cache 需求降到了上一代的四分之一,不过官方又宣布 V4 Pro 继续提供,迁移策略有变。真要选型的话,科研长报告用 Opus 5 High 最稳妥;Web 开发优先 GPT-6 Astra Max;跑自动化任务拿 Fable 5.1 看成功率,拿 Flash 模型控成本,但必须配最小权限和审计。

原文AI 模型市场周报
四川,1小时前,

相关学习资料