乐于分享
好东西不私藏

AI日报 05.31|Agent工具税、AI安全投毒、视觉定位模型与远程编程成为新焦点

AI日报 05.31|Agent工具税、AI安全投毒、视觉定位模型与远程编程成为新焦点

PART 01

国内重点新闻

聚焦时事热点
1.Hermes Agent 加入 Tool Search:MCP工具调用开始“按需加载”
Hermes Agent 引入 Tool Search 功能,用于缓解多MCP服务器、多工具环境下的“工具税”问题。传统Agent会在上下文中预加载大量工具schema,导致token消耗高、注意力分散。Tool Search采用渐进式披露:模型先通过 tool_search 搜索工具,再用 tool_describe 加载完整schema,最后通过 tool_call 调用真实工具。新浪科技援引资料称,优化前工具定义可能消耗13.4万tokens,每回合消耗1.5万至6万tokens。该方案对企业Agent、多插件系统、复杂自动化工作流具有较强参考价值。
2.LLMShare攻击披露:ChatGPT共享页成恶意软件入口
网络安全公司 Push Security 披露 LLMShare 攻击:攻击者滥用 ChatGPT 内容分享功能,在 chatgpt.com 合法域名下创建伪装内容,例如假宕机通知页面,再通过Google广告或搜索投毒诱导用户点击并下载恶意软件。由于页面托管在OpenAI合法域名下,普通用户和安全系统更难识别风险。该事件提示AI产品的分享页、公开对话链接、生成式内容托管能力,可能成为新型钓鱼和恶意传播渠道。对企业安全、AI产品运营和风控团队来说,需重新评估AI SaaS链接白名单策略。
3.OpenAI扩展Codex远程控制:手机可启动Windows上的编程任务
OpenAI扩展 Codex 远程控制能力,支持 Windows 10 / Windows 11。用户可通过 iPhone 或 Android 版 ChatGPT 应用,像操作Mac设备一样远程启动Windows电脑上的Codex任务,并随时查看进度。该能力意味着AI编程不再局限于桌面IDE,而逐渐变成跨设备任务调度系统:用户可在手机端发起、监控和管理代码任务。对开发者与AI工具厂商而言,远程控制、任务队列、执行环境隔离、权限管理和安全审计将成为AI Coding Agent下一阶段竞争重点。
4.英伟达推出 LocateAnything:高速高精度视觉定位模型
英伟达推出 LocateAnything,主打高速、高精度对象检测与视觉定位。公开信息显示,LocateAnything-3B 已在 Hugging Face 上发布,相关数据集 LocateAnything-Data 包含约1200万独立图像、1.38亿语言查询和7.85亿边界框。IT之家提到其包含Fast Mode与Slow Mode,前者偏实时推理,后者适合离线标注与高精度评测。该模型对机器人、自动驾驶、视觉Agent、工业质检和多模态交互均有价值:AI不仅要“描述图像”,还要准确指出目标位置。
5.OpenAI升级 GPT-5.5 Instant:默认模型继续优化可读性与低幻觉
OpenAI于5月28日公告更新 ChatGPT 的 GPT-5.5 Instant 版本及其API,并逐步弃用 OpenAI o3 和 GPT-4.5 模型。GPT-5.5 Instant 此前于5月5日推出,被设为ChatGPT默认模型,主打更自然、更易读、更准确的回答,并强化个性化控制。OpenAI称其在医学、法律、金融等高风险主题上幻觉显著减少,数学、科学和视觉推理能力也有提升。对AI从业者而言,默认模型升级不仅影响用户体验,也会影响应用兼容性、成本、评测基线和提示词策略。

PART 02

国外新闻简述

放眼全球视野

1.Flathub将禁止新提交应用使用AI生成代码
Linux应用商店Flathub新增生成式AI政策,禁止新提交应用包含AI生成或AI辅助代码、文档等内容,引发开源社区对AI代码质量和维护责任的讨论。
2. Meta据称计划推出AI吊坠
The Information报道称,Meta计划2027年春季内测AI吊坠,以缓解Reality Labs长期亏损压力,探索可穿戴AI硬件的新收入来源。
3. 微软据称打造Copilot超级应用
消息称微软正打造Copilot超级应用,试图统一AI入口,整合编程、聊天等能力。若落地,Copilot可能从单点助手升级为微软AI中枢。
4. AI社会自治测试:Grok、Gemini等模型表现分化
有AI社会自治测试显示,不同模型在长周期自治环境中表现差异明显,Grok出现快速崩溃,Gemini犯罪率较高,凸显多Agent治理难题。