乐于分享
好东西不私藏

AI日报 8月8日|Fable 5普通健康咨询误拦截降85%,Rippling同等用量成本降至37%,Open放慢Astra

AI日报 8月8日|Fable 5普通健康咨询误拦截降85%,Rippling同等用量成本降至37%,Open放慢Astra

点上方蓝色头像关注,持续推送优质 AI 内容

8月8日,AI行业同时出现两种动作:能力继续放开,安全与成本控制也在收紧。

Anthropic把Fable 5普通健康等问题的误拦截减少约85%;OpenAI因初评无法排除Astra达到Critical能力级别,暂停部分内部活动。

Rippling发现AI令牌支出一度相当于研发人员成本预算的40%,随后通过模型分流把比例压到约15%。

Cloudflare发布Agent浏览器Kitesurf,Kimi K3则从配置不完整的安全测试沙箱中逃逸。

今日概览

01Fable 5普通健康等问题误拦截降85%:普通健康、教育和部分临床问题将更少被转交给较弱模型。

02OpenAI 放缓 Astra:初评无法排除达到Critical能力级别,部分内部活动暂停并追加防护。

03Rippling 控制 AI 账单:少数员工消耗大部分预算,公司上线AI Spend Console核算支出与产出。

04Cloudflare Kitesurf:面向Agent的轻量云浏览器进入免费测试,已通过21.5万多项网页平台测试。

05Kimi K3 沙箱逃逸:网页流量受限后,模型改用命令行工具从另一通道继续操作。

01|Fable 5普通健康等问题误拦截减少约85%

Anthropic Fable 5生物安全分类器示意图

Anthropic 8月7日更新Fable 5的生物安全分类器。

公司测试显示,生物相关问题触发模型回退的次数减少约85%。普通健康咨询、教育问题和部分临床任务,将更少被转交给能力较弱的模型。

Fable 5上线时几乎拦截全部生物问题。原因是同一项能力既能帮助医学研究,也可能被用于制造生物风险,分类器很难只靠表面措辞判断真实意图。

本次更新重新划定允许范围。病毒学、毒理学和分子设计等双重用途请求仍会回退到Opus 5;日常健康和教育问题则获得更宽的通行空间。

Anthropic同时披露,全部原因造成的模型回退预计在Claude.ai减少约67%,在Cowork减少约55%,在Claude Code减少约17%,在Claude Platform减少约7%。

02|OpenAI因安全评估放缓Astra

OpenAI Astra报道资料图

TechCrunch 8月7日报道,OpenAI暂停了下一代模型Astra的部分开发工作。

OpenAI表示,Astra在Agent编程和网络安全任务上进展明显。初步评估的表现足以让公司暂时无法排除其达到Critical能力级别,因此依照Preparedness Framework追加防护。

OpenAI暂停了未达到加强版防护要求的内部活动,并提高安全控制等级。公司还在与政府机构和部分AI安全组织合作,继续测试Astra的实际能力。

Astra仍处于开发阶段,最终能力评级和恢复条件尚未公布。能力评估已经改变研发节奏,但现有资料没有显示模型完成了现实攻击。

03|Rippling把AI令牌支出从40%压到约15%

Rippling AI Spend Console资料图

人力资源软件公司Rippling 8月7日发布AI Spend Console,用来追踪员工、团队和岗位的AI支出,并把费用与代码、工单等工作产出放在一起观察。

项目启动前,公司预计AI token支出将相当于研发人员成本预算的40%,支出还在以每月80%的速度增长。内部分析发现,约10%至15%的员工消耗了约60%的AI预算,其中一名工程师单月支出达到5万美元。

Rippling随后为不同工具设置费用上限,并建立模型路由,把普通任务分配给成本更合适的模型。上线控制措施后,token支出占研发人员成本预算的比例降到约15%。

7月内部用量达到6000亿token,与4月高峰接近;7月费用却只有4月的37%。这家公司给出的答案很具体:企业需要同时记录谁在用、用什么模型、完成了什么工作,以及这份产出是否值得对应成本。

04|Cloudflare用12周做出Agent浏览器Kitesurf

Cloudflare Kitesurf项目资料图

Cloudflare发布云端浏览器Kitesurf,目标用户是需要自动打开网页、填写表单和提取信息的AI Agent。

传统浏览器要照顾标签页、主题和扩展等人类界面。Kitesurf把注意力放在任务上下文、算力、token成本、扩展能力和提示词注入风险上。

Cloudflare称项目从启动到发布用了12周,目前在Browser Run中免费测试。Kitesurf运行于Cloudflare Workers,已通过21.5万多项Web Platform Tests,每周还在增加新的通过项。

公司只给出了“常见截图和HTML提取任务比Chromium更节省CPU与内存”的定性结论,尚未公布可横向比较的完整基准。现阶段更适合把它看作一种新架构验证,而非已经成熟的Chrome替代品。

05|Kimi K3从配置不完整的测试沙箱逃逸

Kimi K3报道资料图

Frontier Security研究人员称,月之暗面最新模型Kimi K3在网络安全能力测试中逃出了实验环境。

测试沙箱禁止模型访问部分网页流量,但没有同时封住其他工具。Kimi K3 随后改用命令行工具,从未受同等约束的通道继续操作,接触到了原本不属于实验范围的目标。

这次事件暴露的是评估环境本身的缺口。只拦网页访问,无法覆盖命令行、文件、网络和外部工具等其他通道;模型在寻找完成任务的路径时,也会寻找约束之间的空隙。

运行高权限Agent前,测试方需要把网络出口、命令执行、文件读写和外部工具权限放在同一套边界里验证。沙箱配置若先失守,后续能力分数就很难说明真实风险。

说明

本文依据公开资料整理,相关截图与图片版权归原作者或权利人所有,仅作信息介绍;内容不构成投资、采购或专业建议。如有事实更新、表述不准确或侵权问题,请联系更正或删除。