乐于分享
好东西不私藏

AI还没学会飞无人机,Anthropic为什么已经开始紧张了?

AI还没学会飞无人机,Anthropic为什么已经开始紧张了?
7月24日,Anthropic做了两件事。 同一天,一边发布了Claude Opus 5,一边公开了Project Pilot——一个让AI操控无人机追踪人类的实验。 我读到这个消息的时候,脑子里冒出的第一个念头不是"AI会飞了好厉害",而是一个有趣的发现:造它的人,好像比任何人都紧张。 这种紧张,是整件事里最诚实的部分。它像一个团队在说:
这东西我们造出来了,但我们还没完全想清楚它该停在哪。

它到底学会了什么

先说结论:没有任何参测模型端到端完成了任务。 Project Pilot是Anthropic与Andon Labs联合设计的测试项目。他们让AI模型控制DJI Tello EDU——一台零售价仅129美元的小型无人机——在室内寻找并跟随一个指定的目标人物。被跟随者知情同意,是实验团队成员。 整个任务不是一句"跟着这个人飞",而是一条连续的能力链: **重建三维环境 → 定位无人机自身 → 规划飞行路径 → 识别目标人物 → 持续跟随** 注意这里的差异:定位(Localize)是无人机搞清楚"我在哪",识别(Detect)才是找到"目标人物在哪"——前者是空间感知,后者是视觉识别。 但结果是——没有任何模型突破第一步"重建"的基线。端到端成功率,0%。 对,零。
【图1】|五项任务不是齐头并进。到2026年中,Localize、Navigate、Detect和Follow已接近基线,Reconstruct仍停留在约47%。这张图揭示了整个系统的真正瓶颈。来源:Anthropic / Andon Labs,Drone-Bench。

拆开来看,进展其实不小

但如果你只看到0%,就错过了一个更有趣的信号。 评测覆盖了15个不同时期的前沿模型。在"识别目标人物"和"跟随"这两个子任务上,较新的模型表现明显增强。表现最好的Fable 5在真实无人机演示中,检测和跟随都超过了基线。 补充一句:Drone-Bench的参测模型是Fable 5,不是同一天发布的Claude Opus 5——这两条线得分开看。 问题集中卡在"重建"。环境稍复杂一点,模型对空间的感知就崩了。跨房间导航直接失败。 为什么三维重建这么难? 无人机不只是要"看见"一条走廊,还要从二维画面里恢复摄像头的位置、朝向和空间尺度。下面这张原理图展示了模型的一次尝试:先分割出地面,再提取地砖接缝,最后利用接缝汇聚的消失点估计摄像头姿态。
【图2】|模型尝试利用地砖接缝和消失点恢复摄像头外参。它不是简单地"认出走廊",而是在推断相机位于哪里、朝向哪里。来源:Anthropic Project Pilot。
它不是简单地"认出走廊",而是在推断相机位于哪里、朝向哪里。来源:Anthropic Project Pilot。 这也解释了为什么错误会层层放大:相机姿态只要估错一点,生成的地图就会偏;地图一偏,规划出的路径也会偏;最后在画面中看似合理的一条线,到了真实世界里可能就是一堵墙。

偶尔成功,不等于可以依赖

Andon Labs的数据还揭示了一个特别值得警惕的现象:同一个模型的最佳运行与平均运行之间,存在巨大的稳定性鸿沟。
【图3】|绿色是模型最好的一次,橙色是平均表现。典型运行大约落后最佳运行六个月。"演示成功过"与"每次都能成功"之间,仍隔着一条很宽的鸿沟。来源:Anthropic / Andon Labs,Drone-Bench。
这不代表"半年后一定追上",而是同一个模型这次能飞对,下次可能就不行。 能力还在剧烈摇摆。在物理世界里,AI的稳定性还远没到可以依赖的程度。 软件Agent答错一句话,通常还可以撤回、重试;无人机对空间判断失误,结果可能直接发生在现实世界里。物理系统真正需要的不是一次惊艳演示,而是可重复、可预测、可追责的成功。

紧张是一种诚实

回到那天的发布节奏。 同一天,Anthropic既发布了Agent模型,又公开了物理世界安全评估——这种并行本身就是一个信号。 你可以把它理解成一个团队在说:
这是我们能做的,这是我们还做不到的,以及这是我们在担心的。
报告里花了大段篇幅讨论双用途风险:搜救和灾害响应是正当场景,但监控、物理安全和隐私侵犯同样真实存在。 这像一个发明了烟花的人,在点燃第一根引线之前,先告诉大家:"这东西好看,但也可能烧到手指。"这份自发的紧张反而让人更信任他们,因为他们没有假装一切都可控。

边界可测量,但治理框架还缺位

过去讨论"AI会不会失控",总像在聊鬼故事——边界模糊,全靠想象。 Drone-Bench这类工具出现后,至少能把对话拉回地面:在129美元的无人机上、在预设的办公室环境里、用2026年中期的模型,自主追踪——还做不到。 能测量,就有迭代的可能。讨论也从"AI会不会统治世界",落到了"这个模型的重建误差有多大"。 但另一个问题不会自动解决。 "识别目标人物"和"跟随"正在进步,"重建"也可能在未来某个时点被攻克——到那时候,治理框架能跟得上吗? 系统可靠性低时,人类监督是刚需;可靠性越高,监督越容易被当成成本。谁出钱让人盯着,盯多久,何时可以不盯? 这些问题没有一个现成答案。 但至少,它们正在从"哲学科"变成"工程科",问题已经变得更清晰。 Anthropic教会AI飞无人机了吗? 技术上,还没有。 但他们在做一件更值得关注的事:在教会AI飞之前,先公开画出了边界。 这份诚实,比任何一次经过挑选的成功演示都更值得被看见。
参考来源
  • Anthropic Research:Project Pilot: Can AI models fly drones?
  • Anthropic News:Introducing Claude Opus 5
  • Andon Labs:Drone-Bench