乐于分享
好东西不私藏

【AI日报】5月23日:AI一个月挖出10000+高危漏洞,Google让直接操控浏览器,Figure机器人连干30小时险胜人类

【AI日报】5月23日:AI一个月挖出10000+高危漏洞,Google让直接操控浏览器,Figure机器人连干30小时险胜人类

每日精选3-5条AI领域重要动态 · 聚焦AI Coding & 具身智能

今天(5月23日),有三件事值得你认真看完。

一件改写了网络安全的游戏规则,一件让AI编程进入了浏览器底层,一件用人形机器人的真实数据告诉你:工业替代,已经不是预言了。

🔥 重磅突破

一、Anthropic用AI挖出10000+高危漏洞:安全攻防的游戏规则,从此改写

5月22日,Anthropic发布了Project Glasswing的首份阶段性成果报告。

数据令人震撼:

AI模型Claude Mythos Preview在约1000个开源项目中,扫描发现了超过10,000个高危或严重级别漏洞。

但最让人后背发凉的不是"发现了多少",而是——

10,000+
发现的高危/严重漏洞数
90.6%
审查确认率(误报率<10%)
50
合作机构数

其中1752个高危发现由六家独立安全研究公司审查,90.6%确认为真实漏洞,62.4%被验证为高危或严重级别。

Anthropic在报告中明确指出:瓶颈已经不再是"发现漏洞",而是"验证和修补"——AI挖洞的速度,远超人类补洞的速度。

AI驱动的安全能力正在从"被动防御"转向"主动发现"(图:Unsplash)

💡 为什么值得关注?

过去,安全团队靠人海战术和经验做渗透测试,覆盖面有限、速度有限。现在AI一个月挖出来的漏洞,比一个安全团队十年发现的还多。而且误报率不到10%——比很多人类测试员还靠谱。
这意味着两件事:
第一,所有开源软件的"安全底座"正在被AI重新审计,你用的库可能比你以为的更危险。
第二,攻防不对称已经形成:AI找漏洞的成本极低,人类补漏洞的成本极高。这是整个行业必须正视的结构性问题。

⚡ AI编程

二、Google官方出手:Chrome DevTools MCP发布,AI编程Agent可以像人一样调试浏览器了

这件事的意义,很多人可能还没反应过来。

2026年5月,Chrome DevTools官方团队正式开源了chrome-devtools-mcp项目——基于模型上下文协议(MCP),让AI编程Agent可以直接操控Chrome浏览器的开发者工具。

简单说就是:

以前AI只能帮你写代码。现在,AI可以帮你运行、调试、分析网页了。

🔧 AI Agent现在能在浏览器里做什么?

  • 执行复杂调试——断点、单步执行、查看调用栈
  • 分析网站性能——网络请求、渲染性能、内存泄漏
  • Web自动化——操作DOM、模拟用户交互、截取元素状态
  • 兼容主流工具——Claude Code、Codex、Cursor均可接入

这不是第三方做的封装,是Google官方团队出品。配合此前Anthropic提出的MCP协议已经成为AI Agent生态的事实标准,Chrome DevTools MCP意味着——

浏览器,这个全球最大的软件运行环境,正式对AI开放了底层接口。

AI编程Agent正在从"写代码"进化到"全栈操控"(图:Unsplash)

💡 为什么值得关注?

这是AI编程从"编辑器里的小助手"变成"完整开发者"的关键一步。
以前AI写的代码,你还得自己打开浏览器调试。现在AI可以自己写、自己跑、自己调、自己修——形成了完整的开发闭环。
对前端开发者来说,这意味着工作流将发生根本变化。AI不再是你的"代码补全器",而是你的"远程搭档"——它能看到你看到的一切,甚至看到你看不到的。

🤖 具身智能

三、Figure 03机器人连干30+小时:人机对决人类险胜192件,但机器人不需要下班

这场直播,在X和YouTube上围观人数迅速突破百万。

Figure AI——估值390亿美元的具身智能巨头——在圣何塞总部发起了超过120小时的人形机器人包裹分拣全网直播。

高潮出现在"人机对决"环节:一名人类实习生与Figure 03同台竞技10小时。

对比维度
人类实习生
Figure 03
10小时总分拣量
12,924件
12,732件
平均单件用时
2.79秒
2.83秒
失误率
3-5%
<1%
可持续工作时长
~8小时(需休息)
30+小时无间断
需要社保/医保/休假?
需要
不需要

人类以12924:12732,仅多出192件险胜。

但故事的重点不在谁赢了。而在——

Figure 03在8小时阶段分拣近万件包裹,精度达99.7%。随后因全程稳定,测试自动升级为7×24不间断直播。30小时累计处理超4.5万件。

更关键的数据:

24×
120天产能扩张倍数
55台
单周量产数
30s
热插拔电池换电时间

核心驱动:Figure 03搭载Helix 02神经网络,用一个神经网络替代了109,504行手工C++代码,以1kHz频率输出关节指令。电量不足时,机器人还能自主呼叫同伴接替,实现无缝轮班。

Figure 03用实测数据证明人形机器人已具备"通用劳动力"潜力(图:Unsplash)

💡 为什么值得关注?

人类赢了吗?赢了。但只多分了192件。
而机器人不需要午休、不需要社保、不需要排班,还能自己换班。30小时连轴转,失误率不到人的1/5。
Figure AI过去120天的产能扩张了24倍——从每天1台到每小时1台。当量产速度追上技术成熟度,物流分拣只是开始。水利水电施工、建筑施工这些高危高强度场景,会是下一站。

⚡ AI编程

四、2026五大AI编程模型横评出炉:没有通吃,只有取舍

5月23日,一份详尽的2026年AI编程大模型横向评测发布,覆盖4-5月密集发布的5款旗舰模型。

结论很直接:

没有一款模型能通吃所有场景,根据任务类型灵活组合才是最优解。

🏆 五款旗舰模型各有所长

模型
核心优势
适合场景
Claude Opus 4.7
编程天花板,1503分全球第一
复杂架构、长上下文分析
GPT-5.5
Agent全流程自动化
代码+软件操作一体化
Gemini 3.1 Pro
推理+多模态,ARC-AGI-2达77.1%
算法研究、科研编程
DeepSeek V4
1%成本实现90%能力,SWE-bench 80.6%
日常编码、性价比首选
GLM-5.1
国内生态适配、网络稳定
政企项目、中文场景

特别值得注意的是DeepSeek V4:其API成本仅为Claude Sonnet 4.7的1/432,GPT-5.5的1/360。在SWE-bench上得分80.6%——已经接近旗舰水平。

💡 为什么值得关注?

对开发者来说,这份数据就是选型决策的参考手册
日常编码用DeepSeek V4省钱省到飞起;复杂项目上Claude Opus 4.7当核武器用;国内政企项目走GLM-5.1稳定合规。
AI编程工具已经进入"按需选型"阶段——不是谁最强用谁,而是什么任务用什么工具。这个认知转变,比任何单款模型的升级都重要。

📌 今日小结

🔒Anthropic Project Glasswing— AI一个月挖出10,000+高危漏洞,误报率<10%,安全攻防格局改写
🌐Chrome DevTools MCP— Google官方让AI Agent接管浏览器调试,编程闭环形成
🤖Figure 03直播— 30+小时无间断分拣4.5万件,人机对决人类仅多192件险胜
AI编程横评— 5款旗舰模型各有所长,DeepSeek V4性价比碾压,按需选型时代到来

今天的四件事,指向同一个趋势:

AI正在从"工具"变成"基础设施"。

它不只是帮你写代码,还能帮你找漏洞、调试网页、在仓库里搬箱子。

而且,它不需要休息。

👍 如果今天这份日报对你有价值

点个赞,让更多人看到它

⭐ 关注本号,每天早上送到你眼前

AI Coding · 具身智能 · 每日精选 · 不废话

📅 2026年5月23日 · AI日报

聚焦AI Coding与具身智能,每日精选有价值的行业动态