当前时间: 1970-01-01 08:00:00
分类:办公文件
评论(0)
AI日报-2026年08月19日一、前沿模型与实验室
- OpenAI放慢高能力模型训练:OpenAI称Astra可能达到Critical cybersecurity capability门槛,已暂停最新部署模型的RL训练两周,最大frontier RL run仍在搁置;所有Sol级及以上模型的工具型RL训练和评测将纳入多阶段监控,当前估算监控额外消耗约20%推理算力。
二、产品、平台与基础设施
- AWS AgentCore Payments正式GA:服务新增MPP协议、x402 upto按量结算、基础设施层支出和时限双重上限,以及Coinbase、Stripe Privy钱包与CloudWatch审计;Agent可对API、MCP和付费内容自主付款,交易能力开始成为Agent运行时的原生组件。
- Gemini进入Android版Chrome:Google向美国全部Android用户开放网页总结、页面问答和Calendar、Keep联动,AI Pro与Ultra用户可用auto browse执行停车预订、周期订单和旅行安排;移动浏览器成为通用Agent分发入口。
- ChatGPT for Teens上线:OpenAI会把13至17岁用户及系统判定未满18岁的用户自动切换到青少年体验,默认提供Study Mode、作业提醒、Study Hours、家长控制与敏感内容保护;未成年人AI产品开始从附加开关转为独立默认策略。
- OpenAI与CodeAI建立教育合作:双方将向学生和教师提供AI素养资源,重点覆盖AI原理、质疑模型输出和负责任创造;教育产品竞争进一步从工具可用性延伸到使用方法与判断力训练。
- Sentence Transformers v6.0加入MultiVectorEncoder:Hugging Face将ColBERT式晚交互检索纳入统一API,兼容PyLate、Stanford ColBERT和ColPali模型,并覆盖文本、视觉、音频与视频;高质量多向量检索更容易进入现有RAG栈,但索引尺寸仍是主要成本。
- Asana用Codex压缩多年迁移项目:最多4个coding agents在隔离代码副本中并行工作,工程师每天两次检查并审核全部改动,以约1.5周工程投入和1.2万美元完成原估5年、约600万美元的Enzyme测试系统移除;Agent开始改变大型遗留迁移的经济可行性。
- Axonius构建多租户Agent隔离:其在数百个客户环境中使用专属AgentCore runtime、VPC ENI和会话级microVM,结束后销毁并清理内存,开发周期由预计8周缩短到10天;Agent平台的竞争点正在转向租户隔离、短期身份和成本边界。
- Jumio建设实时特征平台:Kinesis、Flink与SageMaker Feature Store方案部署到3个AWS区域,P95响应为16.9毫秒,并通过冷热分层每年节省约12万美元;传统实时ML基础设施仍是生产级AI系统的重要底座。
三、研究、开源与评测
- Agent记忆需要按能力校准:IBM Research在8个模型上发现,gpt-oss-120b采用选择性检索后任务完成率提升16.1个百分点且token仅增加5%,DeepSeek-V3.2使用完整记忆提升9.5个百分点,而已接近饱和的模型可能没有收益;记忆不应被视为统一开关。
- HarnessRisk揭示harness决定安全上限:128个三轮沙箱工作流覆盖6个生命周期阶段,14种模型与harness配置的攻击成功率为12.6%-80.9%,同一模型在不同harness上可相差4.3倍;模型安全评测不能替代完整部署栈评测。
- StartupBench暴露Agent交付缺口:97个市场验证工作流覆盖6个领域,最佳平均分为73.67,但严格完成率仅31.27%,金融任务平均54.48%最难;当前Agent更擅长高质量局部产出,距离可靠端到端交付仍有明显差距。
- LeakGauge低成本检测上下文泄漏:方法通过prefill token概率生成风险分数,在11个LLM的未见攻击上取得0.944-0.996 AUROC,附加参数少于500个、延迟10.34毫秒;不读取隐藏状态即可增加输入侧泄漏防线。
- MoNe压缩长上下文成本:该模块向冻结Transformer附加快速权重记忆,在128K token下将计算量和峰值GPU内存较ICL均降低约80%,参数开销6.4%;结果目前主要来自0.5B backbone和受控RULER任务,规模化验证仍待完成。
- D2ACCI让Agent记忆迭代可诊断:MemStack在LoCoMo、LongMemEval和PersonaMem-V2分别达到93.59%、90.93%和57.20%,完整诊断轨迹的DCR@3达到98%-100%,结果日志则为0%;记忆系统优化开始强调分阶段定位和切片回归,而非只看总分。
- TRUSS验证Agent Skill供应链:在SkillInject上漏洞检测精确率与召回率均达100%,自动修复降低两组模型的攻击成功率,并把Skill生成任务有效性从17.11%提高到52.94%、安全率从50.80%提高到100%;可执行Skill需要静态证据与沙箱行为验证的双重门禁。
- Operation Blue Skies进入空域级试验:Google与英国政府及航空伙伴启动30个月计划,在占全球凝结尾迹增温约5%的Shanwick空域开展两轮各约4个月的AI规避试验,每年约1万架航班经过试验时段;AI气候应用由单航司实验扩展到国家支持的空域协同。
四、政策、治理与安全
- OpenAI投入500万美元支持政府AI监督:未来一年将提供培训、技术支持和credits,并试点检查AI辅助决策输入、输出与工具使用的模型无关工具;治理能力建设开始与政府采用同步推进。
- FDA征求生成式AI医疗设备监管意见:监管机构启动公开反馈程序,评估生成式AI医疗设备的适用规则;医疗AI治理正在从静态算法审批转向持续变化模型的监管框架。
- 宾夕法尼亚州设立AI数据中心新规则:州长签署行政令,对AI数据中心落地提出新的州级要求;算力扩张的政策焦点继续向能源、基础设施和地方许可转移。
五、资本、产业与采用
- Etched估值升至210亿美元:Reuters报道称这家AI推理芯片公司完成7亿美元Series D,估值在不到一个月内翻倍;资本继续押注针对Transformer推理优化的专用硬件路线。
- Velaura AI晋级独角兽:Reuters引用报道显示,这家AI芯片设计公司完成1.1亿美元Series A,估值超过10亿美元;推理基础设施的创业融资从成熟公司向早期架构团队扩散。
AI线索
- Agent商业化正形成完整运行时层:支付、身份、隔离、审计、预算和多租户能力与模型能力同等重要。
- 研究热点从单次任务得分转向长期可靠性:harness安全、Skill供应链、记忆回归和端到端交付均要求可观测、可定位、可复现。
- 前沿能力加速与安全成本同步上升:OpenAI主动减速训练并接受约20%监控开销,说明安全工程已直接影响模型研发节奏与算力经济性。