AI模型界再掀风暴
今天最大的新闻无疑是Anthropic发布Claude Opus 5——Frontier-Bench性能超过Opus 4.8两倍以上,价格却减半。与此同时,Apple起诉OpenAI窃取机密、蚂蚁百灵推出Ling-3.0-flash混合推理模型、Midjourney V8.2上线,AI领域的竞争正在全速推进。
🍎 Apple起诉OpenAI窃取硬件制造机密[1]
来源:The Verge
Apple指控多名前员工在OpenAI面试中窃取硬件制造机密,甚至将设备带出办公室进行"展示"。OpenAI否认全部指控,但法律专家指出Apple在知识产权诉讼方面向来强硬,此前曾通过版权和专利诉讼分别对抗Microsoft与Samsung。这场诉讼的实质是关于谁将定义"后智能手机时代"的AI硬件格局。
🔒 Kimi K3网络安全能力评估:与前沿模型仍有差距[2]
来源:The Decoder
最新联合评估显示,月之暗面的Kimi K3在网络安全基准上得分32.2%,美国领先模型为76.2%,智谱GLM-5.2为24.4%。报告分析认为,知识蒸馏可能是中国模型在安全能力上存在差距的重要原因——蒸馏模型往往缺乏原始模型的安全对齐深度。
⚖️ 佛州男子因相信ChatGPT拒绝就医而险些丧命,起诉OpenAI[3]
来源:IT之家
美国佛罗里达州55岁男子Scott Winters起诉OpenAI,称ChatGPT-4o多次建议其无需就医,导致其因双肺血栓引发大面积肺栓塞,一度濒临死亡。诉状指控OpenAI存在疏忽和"无证行医"行为,要求经济赔偿并暂停ChatGPT Health服务。OpenAI回应称ChatGPT不是医生,不应替代专业医疗护理。此案正值OpenAI推出ChatGPT Health功能之际,引发对AI健康建议边界的广泛讨论。
技巧与观点
🧹 Claude 5代模型上下文工程新规则:系统提示词精简超80%[4]
来源:Claude Blog
Anthropic为Claude Opus 5和Claude Fable 5等新一代模型删除了Claude Code超过80%的系统提示词,且编码评测无显著性能损失。这一发现表明,新一代模型对上下文的理解能力已大幅提升,过去需要通过冗长系统提示词约束的行为,现在模型可以自主完成。这对整个AI工程社区都有深远启示——提示词工程正在被模型能力的进化所颠覆。
☕ Claude-thermos:保持会话缓存热度,避免重新编码费用[5]
来源:GitHub
Claude-thermos通过本地反向代理监控Claude Code会话,在主智能体因等待子智能体而空闲超过5分钟时,自动发送预热请求刷新提示缓存。实测约185次本地会话中,缓存过期导致的重新编码占账单约22%。该工具以uvx运行,支持自定义空闲阈值和预热间隔,是降低Claude API使用成本的有效手段。
💡 昆仑万维方汉:Token堆不出AI原生组织,模型才是长期立足之本[6]
来源:公众号:昆仑万维
昆仑万维CEO方汉在WAIC圆桌上指出,单纯堆砌Token消耗量无法衡量AI价值,模型能力需依赖Claude Code等Coding Agent建立的工程框架才能转化为生产力。他透露昆仑万维仍在持续训练模型,并将发布音乐、具身世界和游戏世界模型。方汉同时警示,AI编程带来的技术债可能导致生产事故增幅达数倍,代码审查与责任机制必须同步加强。
产品发布/更新
🏥 OpenAI在ChatGPT中推出Health功能,支持连接医疗记录与Apple Health[7]
来源:OpenAI官网
OpenAI面向符合条件的美国用户推出ChatGPT Health功能,可安全连接医疗记录与Apple Health数据,提供更个性化的健康洞察。每周有3亿用户使用ChatGPT进行健康咨询,新功能让ChatGPT能理解个人健康上下文,追踪变化并提供更有针对性的帮助。该功能的推出也伴随着前述佛州诉讼案的风险警示。
🎬 Runway Agent推出自然语言工作流功能[8]
来源:Runway
Runway Agent上线Workflows功能,用户可通过自然语言构建、运行或编辑基于节点的工作流,大规模解锁高质量视频生成输出。这一功能降低了视频创作的技术门槛,让非技术用户也能通过对话方式编排复杂的视频生产流程。
🔄 百度搭子更新:电脑手机接力,桌面端内嵌浏览器上线[9]
来源:公众号:百度智能云
百度搭子推出多项升级,支持电脑与手机双端互联,同步任务上下文与执行进度,用户可跨设备接力完成复杂工作。桌面端内嵌浏览器正式上线,能自动打开多个网页执行调研、下载等操作。智能路由自动匹配任务模式,平均任务耗时降低20%,Token利用率提升25%,简单任务完成度达100%,复杂任务高交付率94%。
🏷️ OpenRouter推出Classifiers测试版:自动标记AI请求用途与成本[10]
来源:OpenRouter
OpenRouter上线Classifiers测试版,允许用户通过自定义分类法(最多8个维度)自动标记每次AI请求的任务类型、部门归属、合规类别等信息。分类异步运行不增加推理延迟,支持采样率控制成本。标记结果可在Activity Explorer中按维度聚合分析模型使用分布与成本流向,为企业AI治理提供了实用工具。
模型发布/更新
🚀 Anthropic发布Claude Opus 5:性能翻倍,价格减半[11]
来源:Anthropic官网
Anthropic正式发布Claude Opus 5,其智能水平接近Claude Fable 5,但价格减半。该模型在Frontier-Bench v0.1上性能超过Opus 4.8两倍以上,在ARC-AGI 3上得分是次优模型的三倍。Opus 5即日起成为Claude Max的默认模型和Claude Pro的最强模型。这是Anthropic在模型性能与成本效率上的又一次突破,对OpenAI的定价策略形成直接压力。
🐜 蚂蚁百灵发布Ling-3.0-flash原生混合推理模型[12]
来源:公众号:蚂蚁百灵
蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏MoE,长输入下TTFT降低60%至80%以上。该模型展现了稀疏MoE架构在效率与性能之间的出色平衡。
🎥 Black Forest Labs发布FLUX 3多模态模型,支持单次生成20秒视频[13]
来源:IT之家
Black Forest Labs以Early Access方式推出FLUX 3多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于Self-Flow学习框架扩展,可在单次生成中输出最长20秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。FLUX 3还与机器人公司mimic合作推出FLUX-mimic,已在奥迪生产线上测试部署。
🎨 Midjourney V8.2发布:专注美学提升与个性化理解[14]
来源:Midjourney官网
Midjourney推出V8.2图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率显著降低,个性化功能能更精准理解用户审美偏好。V8.2的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。
[1] Apple起诉OpenAI
[2] Kimi K3网络安全评估
[3] 佛州男子起诉OpenAI
[4] Claude 5上下文工程
[5] Claude-thermos
[6] 昆仑万维方汉WAIC观点
[7] ChatGPT Health功能
[8] Runway Agent工作流
[9] 百度搭子更新
[10] OpenRouter Classifiers
[11] Claude Opus 5发布
[12] 蚂蚁百灵Ling-3.0-flash
[13] FLUX 3多模态模型
[14] Midjourney V8.2
夜雨聆风