乐于分享
好东西不私藏

OpenAI 公布限量预览版 GPT-5.6 Sol 系列模型【AI 前沿 2026-06-27】

OpenAI 公布限量预览版 GPT-5.6 Sol 系列模型【AI 前沿 2026-06-27】

☀️ 今日速览 · 7 条2026-06-27

AI 简报

🧠 模型相关
– – – – – – – – – –

OpenAI 公布限量预览版 GPT-5.6 Sol 系列模型#1

英伟达发布Nemotron 3 Ultra NVFP4量化检查点#2

📡 行业动态
– – – – – – – – – –

Claude Fable 5分批重新上线?官方称系UI Bug#3

谷歌推理专家周登勇低调加入Meta#4

NVIDIA AI-Q 2.0 蓝图部署至 OCI#5

Hugging Face 支持一键运行 vLLM 服务器#6

🛠 工具生态
– – – – – – – – – –

Cline v4.0.0发布:迁移至SDK架构#7

#1 OpenAI 公布限量预览版 GPT-5.6 Sol 系列模型

⚡ OpenAI 发布 GPT-5.6 Sol、Terra、Luna 三款模型,Sol 在编程、生物、网络安全方面能力提升,同步公开定价。

OpenAI 发布 GPT-5.6 系列三款模型,但需要注意的是限定词-有限预览,官方账号提到:

我们相信应该广泛开放使用权,并计划在接下来几周里向所有用户提供 GPT‑5.6 系列:Sol、Terra 和 Luna。目前,根据美国政府的要求,我们先在 Codex 和 API 中,向一小部分值得信赖的合作伙伴推出限量预览版。

OpenAI称Sol 是其全新旗舰产品,比 GPT-5.5 有了阶跃式提升。Terra 提供了与 GPT-5.5 相当的性能,但成本降低了 2 倍,Luna 是其最具成本效益的模型,以最低成本提供强大的能力。

模型版本与定位GPT-5.6 Sol(前沿模型)、GPT-5.6 Terra(平衡模型,适合日常高效工作)、GPT-5.6 Luna(快速低价模型,适合高吞吐量任务)。

能力提升GPT-5.6 Sol 在编程、生物学、网络安全领域的智能体能力有提升。在 UC Berkeley 等机构合作的 ExploitGym 基准测试中,Sol、Terra、Luna 随推理能力增强均表现出网络安全能力提升。GPT-5.6 Sol 未超过其 Preparedness Framework 下的“Cyber Critical”阈值。

安全措施:OpenAI 称该模型配备了其最先进的安全堆栈,包括分层防护和自动化红队测试,相关细节发布在 GPT-5.6 Preview 系统卡中。

定价(每 1M tokens)Sol 输入 $5 / 输出 $30;Terra 输入 $2.50 / 输出 $15;Luna 输入 $1 / 输出 $6。

GPT-5.6 Sol 在 Terminal-Bench 2.1 上设定了新的技术巅峰,该基准测试复杂命令行工作流程,需要规划、迭代和工具协调。

OpenAI表示GPT-5.6 Sol 是其迄今为止在网络安全领域最强大的模型,加强了针对高风险网络活动和重复滥用的实时保护措施,花费数周时间通过人类红队测试以及超过 70 万个 A100 等效 GPU 小时的自动化测试来强化系统。

#2 英伟达发布Nemotron 3 Ultra NVFP4量化检查点

⚡ 英伟达将Nemotron 3 Ultra(550B)模型量化至NVFP4格式,模型体积从1121GB减至352.3GB,推理吞吐量最高提升5.9倍。

英伟达于2026年6月26日发布Nemotron 3 Ultra NVFP4检查点,该检查点基于NVIDIA Model Optimizer将Nemotron 3 Ultra(550B参数)模型从BF16量化至NVFP4格式。

模型体积:从BF16的1121GB压缩至352.3GB,缩减3.2倍。

推理性能:在解码密集型负载上,推理吞吐量最高达GLM-5.1 754B FP4模型的5.9倍。

精度表现:在几乎所有基准测试中匹配BF16精度。

硬件兼容:单个检查点可在NVIDIA Hopper和Blackwell架构上运行,Hopper自动切换至W4A16,Blackwell使用原生W4A4。

量化方法:采用“四六缩放”(four-over-six)策略,针对MoE路由专家层权重,将全局每张量权重缩放提升1.75倍,中位重建MSE降低16.4%。

工具支持:NVIDIA Model Optimizer 0.46版本(预计7月发布)将包含NVFP4_FOUR_OVER_SIX_CFG配置。

量化流程:支持Hugging Face Transformers和Megatron-LM两条路径。在16×B300上使用Megatron-LM,加载与校准时间从85分钟降至9分钟,总耗时从120分钟降至45分钟。

自动量化https://mtq.auto_quantize支持按位预算自动分配每层精度格式,Nemotron 3 Ultra在5.03有效比特/元素(BPE)时达到精度与效率平衡点。

#3 Claude Fable 5分批重新上线?官方称系UI Bug

⚡ Anthropic的Claude Fable 5模型在部分用户端重新出现,官方称系UI bug,非正式发布。

Anthropic的Claude Fable 5模型在部分用户端重新出现。

重新出现:2026年6月26日,X平台AI Infra研究员发现手机端Claude Code的模型选项中重新出现Fable 5,可进行SVG生成、git status和PR操作。

用户反馈:多名网友证实看到该模型,但部分用户无法发送消息。亚马逊AWS已可调用,需身份验证。

官方回应:Anthropic官方员工称未正式放出Fable 5,应为UI bug。

背景:Fable 5此前因“禁止外籍人士访问”原因全球下架。Anthropic联合创始人Tom Brown自6月15日起负责沟通回归事宜。

#4 谷歌推理专家周登勇低调加入Meta

⚡ 谷歌DeepMind推理团队创始人周登勇已加入Meta,在MSL担任研究科学家,已工作四个月。

谷歌DeepMind推理团队创始人周登勇(Denny Zhou)已离开谷歌,加入Meta,在MSL担任研究科学家,已低调工作四个月。

周登勇背景:2017年由李飞飞牵头从微软加入Google Brain,创建推理团队,后并入Google DeepMind Gemini团队。在CoT、Self-Consistency、Least-to-Most Prompting等LLM基础工作有贡献,谷歌学术引用量超过12.8万。2022年Google I/O上,Sundar Pichai展示的推理研究即来自其团队。

Meta近期其他人事:UC Berkeley教授宋晓冬(Dawn Song)以Meta MSL AI研究副总裁身份加盟,其创办的Virtue AI团队(含两位联创)整体并入Meta。宋晓冬在AI安全与可信AI领域有贡献,Google Scholar引用量约16.9万+。

谷歌近期人才流失:6月18日,Transformer论文核心作者Noam Shazeer加入OpenAI(2024年谷歌以27亿美元收购其创办的Character.AI后回归,不到两年再次离开)。6月19日,DeepMind副总裁、2024年诺贝尔化学奖得主John Jumper加入Anthropic。6月24日,Gemini核心贡献者Jonas Adler和Alexander Pritzel也加入Anthropic。

谷歌内部调整:据The Information报道,谷歌新成立约两个月的AI Coding突击队(Strike Team)权限升级,将Midtraining纳入研究范围,以Coding为最优先指标重构Gemini训练方式。DeepMind创始人谢尔盖·布林在内部备忘录中表示需紧急弥合Agent差距。

#5 NVIDIA AI-Q 2.0 蓝图部署至 OCI

⚡ NVIDIA 发布 AI-Q 2.0 蓝图,支持在 Oracle Cloud Infrastructure 上通过 Terraform 和 Helm 部署多智能

NVIDIA 于 6 月 26 日发布 AI-Q 2.0 蓝图,支持在 Oracle Cloud Infrastructure(OCI)上部署生产级多智能体系统。

发布方与时间:NVIDIA 开发者博客,2026 年 6 月 26 日。

产品名称:NVIDIA AI-Q Blueprint 2.0。

核心架构:基于 LangChain Deep Agents 和 NVIDIA NeMo Agent Toolkit 构建的多智能体系统,包含意图路由器、浅层研究智能体、深度智能体(规划子智能体 + 研究子智能体)。

部署方式:使用 Terraform 创建 OCI 资源(VCN、OKE 集群、负载均衡器、Vault),使用 Helm 在 OKE 上安装后端(FastAPI)、前端(https://Next.js)和 PostgreSQL 工作负载。

关键参数:需 OCI 租户访问权限、NGC API 密钥(格式 nvapi-...)、Tavily API 密钥(格式 tvly-...);本地需 Terraform 1.5+、kubectl 1.28+、Helm 3.x+、OCI CLI。

部署时间:约 20-25 分钟。

资源清单:Terraform 创建 VCN、OKE 增强集群(1 个节点池)、OCI 负载均衡器(HTTP 端口 80)、OCI Vault(AES-256 加密);Helm 安装 3 个工作负载(aiq-backendaiq-frontendaiq-postgres),PostgreSQL 使用动态预置的 10 GB 块存储卷。

可扩展性:模型、工具、RAG 后端、子智能体、评估器均可通过 YAML 配置或 NeMo Agent Toolkit 插件系统替换。

#6 Hugging Face 支持一键运行 vLLM 服务器

⚡ Hugging Face 推出新功能,用户可通过一条命令在 HF Jobs 上启动私有 OpenAI 兼容 LLM 端点。

Hugging Face 于 2025 年 6 月 26 日发布博客,宣布用户可通过一条命令在 HF Jobs 上运行 vLLM 服务器。

功能概述:用户可通过 hf jobs run 命令,使用官方 vllm/vllm-openai 镜像,指定 GPU 类型(如 --flavor a10g-large)并暴露端口(--expose 8000),启动一个私有、OpenAI 兼容的 LLM 端点。

使用前提:需要支付方式或正预付信用余额;安装 huggingface_hub>=1.20.0;本地登录 hf auth login

计费与停止:按秒计费,a10g-large 价格为 1.50 美元/小时。可通过 hf jobs cancel <job_id> 手动停止,或依赖 --timeout 自动停止。

扩展支持:支持更大模型,如 Qwen/Qwen3.5-122B-A10B 可在 h200x2 上运行,需设置 --tensor-parallel-size 2 等参数。

与 Inference Endpoints 的区别:HF Jobs 适合实验、一次性评估或批量生成,提供最大灵活性和控制;Inference Endpoints 适合生产环境,提供更细粒度访问控制和缩放到零功能。

#7 Cline v4.0.0发布:迁移至SDK架构

⚡ Cline发布v4.0.0,将VS Code扩展迁移至共享Cline SDK,新增插件市场、消息队列等功能。

SDK迁移:VS Code扩展运行时迁移至共享Cline SDK,统一处理Agent回合、工具调用、Plan/Act模式协调、MCP、检查点、遥测、提供商切换、任务历史等。

ClinePass:新增ClinePass功能,包括引导、提供商选择、注册与订阅交接、实时模型列表、授权与组织错误状态、额度不足提示。

插件市场:新增Customize市场,支持发现和管理Skills、MCP服务器、Plugins,含已安装/市场标签页、搜索过滤、安装卸载流程、启用禁用控制。

消息队列:Cline正在处理时提交的消息会进入队列,显示等待状态,可在执行前取消。

编辑与重生成:支持编辑之前用户消息并重新生成,重置聊天和重置代码操作更清晰。

提供商与模型:新增通用SDK提供商设置和模型目录支持,更新OpenAI兼容模型等。

MCP支持:插件和共享市场安装/卸载管道增加MCP支持。

── 2026-06-27 ──