当前时间: 2026-08-15 20:18:38
分类:办公文件
评论(0)
AI是怎么学会看图说话的?AI真的看懂了图片吗?
很多人第一次用多模态AI的时候,都会产生一种错觉。
AI看到的不是世界,而是模式
这个人大概率在巴黎旅游,而且心情不错。
对于模型来说,一张图片首先会被拆解成大量视觉Token。这些视觉Token经过神经网络编码后,进入模型内部的语义空间。
为什么AI会一本正经地看错东西
桌子旁边放着一部手机。
于是当视觉信息不够明确时,它会倾向于选择最符合经验的答案。
但现代AI已经不只是猜测
AI不过是在猜。
因为今天的多模态模型已经能够完成很多远超简单识别的任务。AI既在利用统计规律,也在形成越来越复杂的抽象表征。
图像并不是被翻译成文字
图片 → 视觉Token → 统一语义空间 → 推理
真正困难的其实是视频
AI真正缺少的,可能是世界模型
它很可能会掉下去。
所以AI到底看懂图片了吗?
它更像一个从数万亿张图片、视频和文本中成长起来的观察者。
最后留一个问题。