今天是2026年7月25日,学点东西的第60篇
AI 的多模态(Multimodal),指的是人工智能模型能够同时理解、关联、并生成多种信息形态(模态)——比如文本、图像、音频、视频等,而不是只会处理单一类型的数据。
"模态"就是信息的载体/形式。常见模态包括:
文本(文字、代码)
图像(照片、图表、绘画)
音频(语音、音乐)
视频(动态画面+声音)
还有 3D 模型、传感器数据、表格等
单模态 vs 多模态
单模态 AI(早期):只能处理一种。例如老式语音识别只听音频、早期 GPT-3 只处理文本、图像分类模型只看图。
多模态 AI:把多种模态放进同一个模型里,让它们"互相读懂"。例如你给一张图+一个问题,它能看图回答;你写一句话,它能生成对应的图或视频。

多模态VSAI Agent
多模态回答的是:AI 能"感知/生成"哪些类型的信息(文本、图像、音频、视频…)——这是能力维度。
AI Agent回答的是:AI 能不能自己"动起来"完成任务(自主规划、调用工具、多轮执行)——这是架构/角色维度。

把 AI 想象成一个人:
多模态 = 这个人的眼睛、耳朵、嘴巴、手(感官与表达器官)——决定他能接收和输出什么形式的信息。
Agent = 这个人的大脑决策 + 手脚执行(会不会自己定计划、找工具、把事做成)——决定他能不能主动把事办了。

夜雨聆风