夜雨聆风学习资料网

ARTICLE · 1140916

AI解读 | 让AI学会看清目标“本质”

AI解读 | 让AI学会看清目标“本质”

让AI学会看清目标“本质”

自动驾驶要认出前方的车和行人,机器人要找到桌上的杯子,监控要锁定可疑目标——这些技术背后都靠同一个本事:目标检测,让AI从一张图里找出有哪些东西,并框出它们的位置。

但我们总是发现:AI在实验室里表现挺好,一放到真实世界就经常“翻车”。为什么?因为现实场景变数太多:今天晴天,明天暴雨;白天光线充足,晚上黑漆漆;这个摄像头拍出来偏暖,那个偏冷;仿真软件里训练得好好的,一到真车上就不灵了。

传统目标检测模型主要靠看大量图片,记住物体的表面特征。比如“车一般有四个轮子、金属反光、在路上跑”。但这些表面特征换个场景就变了。AI一看:“这跟训练时长得不一样啊”,就不认识了。它学到的其实是相关性,而不是因果性——也就是“什么和什么经常一起出现”,而不是“什么东西是物体真正的本质”。

针对这个难题,中国科学院沈阳自动化研究所的科研团队,提出了一套新框架,名字叫跨模态因果感知层次表征学习,简称HierarchicalDG。

让AI同时看图和看字,借助“文字”理解本质

团队用到了视觉语言模型——你可以把它理解成一个既能看懂图片、又能读懂文字的AI,比如你给它一张猫的图,它能说出“这是一只猫”。这类模型脑子里存了大量“图像和文字对应”的知识。

HierarchicalDG把文字语义当成一种“因果提示”。就像给AI一本“因果字典”:不管晴天雨天,猫就是猫,它有耳朵、胡须、四条腿——这些是本质,而“毛色亮不亮、背景是什么”只是环境干扰。文字描述帮AI抓住了本质。

从“表面”走到“本质”

团队构建了一条五层学习链路:图像特征 → 场景注意力 → 目标表征 → 视觉子原型 → 因果原型。

你可以把它想象成剥洋葱:最外面一层是原始图像,往里一层是“场景里哪些区域重要”,再往里是“目标长什么样”,再往里是“同一类物体的共同模板”,最核心是“不受环境影响的因果本质”。

每剥一层,就离本质更近一步。

用“标准模板”引导分类,把不变性传下去

团队还学习了一种叫视觉原型的东西——你可以把它理解成每一类物体的“标准模板”。比如“车”的原型,不是某一辆具体的车,而是所有车共有的、不受天气光照影响的核心特征。

AI分类时,不是拿图片去硬匹配某张训练图,而是去比对“它像不像车的标准模板”。这样一来,类别层面的不变性就能一层层传递到目标和场景表征中,模型对数据分布变化的抵抗力自然就强了。

团队在五类基准测试任务上做了验证。结果显示,HierarchicalDG在多天气变化、图像扰动、真实图像到艺术图像迁移、跨相机和仿真到现实的五类任务中都取得了良好的跨场景泛化效果。也就是说,换个环境,它照样认得出。更妙的是,推理阶段不需要调用视觉语言模型分支,团队只在训练时借用它的知识,真正干活时把它“请出去”,所以既准又快,兼顾了泛化性能和推理效率。

声明:“AI解读”内容由人工智能技术工具自动生成,不代表中国科学院沈阳自动化研究所正式学术观点或完整研究成果,不作为学术论证依据。

SIA

关注我们

中国科学院沈阳自动化研究所

相关学习资料