Andrej Karpathy宣布加入Anthropic,顶尖研究人才再次流向头部基础模型公司,进一步抬高行业对前沿研究竞争的关注。Anthropic发布“拓宽关于前沿 AI 的对话”计划,邀请宗教、哲学与伦理学者参与模型价值观讨论,继续强化其AI 对齐叙事。Claude Code团队发文解释为何开始把输出从Markdown转向HTML,核心是为了提升信息密度、交互性和团队协作可读性。OpenAI披露ChatGPT现在每周生成图片已超过15 亿张,说明图像生成正在成为通用 AI 产品中的高频能力。Google推出新的AI 智能搜索框,把AI Overviews与AI Mode整合进统一搜索体验,并支持多模态、多轮交互。一篇发表于PNAS的研究显示,经典的人类说服技巧同样会提高模型对不当请求的顺从率,说明模型安全仍面临新的社会工程风险。OpenAI推出Guaranteed Capacity服务,帮助客户提前锁定长期算力资源,方便在算力紧张环境下稳定规划关键工作负载。Google发布GeminiOmni,强调其已具备从任意输入生成任意内容、并进行物理推理与视频编辑的能力,多模态生成继续升级。GeminiSpark被定义为“全天候个人 AI 代理”,目标是把 Gemini 从回答问题的助手升级为可代执行任务的代理。ClaudeManaged Agents新增自托管沙箱与MCP隧道,让企业能在更强安全边界内运行智能体并连接私有网络资源。
大模型🔥
全球大模型🔥
GPT-5.5-high / OpenAI:Arena Elo 1506,当前位列综合榜第一。
Claude Opus 4.7 Thinking / Anthropic:Arena Elo 1505, 在高强度推理与编程维度仍非常强势。
Gemini-3.1-Pro / Google:Arena Elo 1505, 与第二名基本并列,长上下文与综合能力依旧稳健。
Gemini-3.5-Flash / Google:Arena Elo 1504, 在速度与效果平衡上保持头部位置。
Claude Opus 4.7 / Anthropic:Arena Elo 1503, 继续稳居全球第一梯队。
国内大模型🔥
Qwen3.7-Max / Alibaba:Arena Elo 1476, 当前在国内厂商模型中排名最高。
ERNIE-5.1 / Baidu:Arena Elo 1475, 紧跟头部,综合表现依然稳定。
GLM-5.1 / Z.ai:Arena Elo 1467, 保持继续国产第一梯队位置。
DeepSeek-V4-Pro / DeepSeek:Arena Elo 1467, 与 GLM-5.1 基本并列,推理与代码能力仍是亮点。
Seed 2.0 Pro / ByteDance:Arena Elo 1466, 在国际综合榜中继续维持较强竞争力。
GitHub 热门项目 Top 10
tinyhumansai/openhuman:一个强调私有化、本地化、个人 AI 超级智能的项目,适合想自己托管个人助手与 Agent 能力的人。