ARTICLE · 1092788
误差不到250米!美国情报界用新AI工具5分钟锁定任何视频拍摄地点!你还敢乱拍吗?
误差不到250米!美国情报界用新AI工具5分钟锁定任何视频拍摄地点!你还敢乱拍吗?情报高级研究计划局启动了一个叫LocUS的项目,要找一套系统,输入一段视频、一张照片或者一段录音,5分钟之内说出这段素材拍在哪儿,90%的预测误差控制在250米以内,搜索范围最大能到大约1550英里。 
按理来说,一张照片拍下来的不过是颜色和明暗,里头没有坐标,也没有地名,除了按快门的那个人,谁也不知道镜头前面是什么地方,但是实际上跟着一起进了画面的东西还有很多,房子的样子、路边种的是什么树,都在说着拍摄地的事。这是怎么回事呢? 看别人发的旅游照,很多人大致能猜出是南方还是北方,靠的都是些不起眼的细节,屋顶是平的还是带坡度的,路边的树是阔叶还是针叶,再看看土的颜色。人靠这一两眼能看出来的东西有限,机器不一样,机器看的是像素,能同时拿大量已知地点的照片来比对。 不同地方的房子长得不一样,用什么材料、窗户怎么开、屋顶多陡,都是照着当地的气候和用料习惯来的。 植物也差不多,一个地方长什么树,是当地气候和土壤选出来的,换个地方长不成那样。路上的东西更直接,警示牌上写什么字、车牌是什么样式、地面上怎么画标线,各国各州都有自己的规矩。 
同一种鸟,在不同地方叫出来的调子不一样,当地人一听就能分辨出来。视频里人说话带着口音,懂行的听两句就知道是哪儿的人。环境里还有别的声音,比如说某一种蝉在某个纬度以外就不叫了。 这不,画面线索和声音线索凑在一起,系统要做的就是把这些碎片拼起来,跟已有的地理数据库一项一项比对,最后给出一个位置。250米是个什么范围,大约就是一个街区到两个街区大小,落在城里已经很具体了。 搜索范围放到1550英里,意思是系统事先并不知道素材来自哪个国家、哪个州,得自己在大范围里搜。这一条比精度更难,因为线索的密度在世界各地差得远,城市里到处都是可比对的东西,荒郊野外可能几公里内什么参照物都没有。 要把这套本事练出来,喂进去的数据得是带位置标注的。一张照片要配一个准确的拍摄地点,一段录音要配一个准确的录制地点,标注越细,系统比对的时候越有底。这类数据在公开平台上并不少,只是过去没人拿来做这件事。 
情报高级研究计划局这个名字听着拗口,做的事倒是一贯的:挑那些看起来不太可能做成、一旦做成又很有用的技术来投。做不成的概率本来就高,成了的回报也大,LocUS属于这一类。 时间要求是冲着用途去的。情报高级研究计划局说得很明白,这套系统是要拿去打击人口贩卖、营救人质这类执法行动的。这类事情里,一段影像或者录音送过来,晚几个小时可能就全变了,5分钟是留给分析人员的窗口,超出这个时间,东西就没什么用了。 难的地方也不只是快。项目要求系统在素材质量很差的情况下也能干活,画面糊、光线暗、夜里拍的监控画面抖得厉害、音频被反复压缩得只剩个大概,这些都得接着算。还要求整个过程没有人工引导,不能靠人在旁边提示先看哪儿再看哪儿。 系统还得有全球泛化的能力,在一个地方训练出来的本事,换个没见过的大洲也得管用。人脸识别这类技术被明确排除在外,项目要的是定位地点,不是认人。 
可能有一些网友担心,这种东西做出来以后,普通人发张照片是不是就把自己卖了。这个担心不是没来由的。现在大家在社交平台上随手分享的照片、视频,本来就带着不少信息,只是过去没人有这个本事去一条条读出来。 一旦有了5分钟就能定位的系统,一张窗外拍的风景、一段带背景音的家庭录像,能说出去的东西就比过去多得多。官方把这技术定位在打击犯罪上,可一项能力造出来之后会用到哪些地方,从来不是研发阶段能框死的。 
定位这件事,过去一直是一项专业技能,得有人对着地图、对照着细节一点点查。往后这套本事装进机器里,几秒钟出一个结果,门槛就彻底变了。 地理信息第一次不再是看得懂的人才读得出来的东西,每一张随手拍的照片都在往外流地理信息。谁的照片在往外流,流出去的是什么,往后在按下发送键之前,大概得先想一想了。
一张照片、一段视频或者一段录音,5分钟之内定位到250米以内,情报高级研究计划局在做这件事



为什么非要卡在5分钟?

