知岳 AI 通识
多模态到底是什么?
AI 正在从“只会读文字”,走向“理解现实世界”
真正重要的,不是 AI 终于“会看图片了”。而是 AI 第一次开始同时理解不同类型的业务信息。 |
过去几年,我们和 AI 的交互方式其实非常单一:在输入框里打字,AI 读取文字,再用文字回答。无论是写文章、总结文件、做方案,还是分析问题,本质上都发生在一个纯文本世界里。
但现实世界从来不是纯文本的。企业每天产生的,也不仅仅是文字,还有照片、扫描件、表格、录音、电话、监控视频、设计图、商品图片、合同附件、设备数据……
人类理解世界,本身就是多模态的。我们用眼睛看,用耳朵听,用语言交流,再把不同来源的信息组合起来形成判断。因此,AI 下一阶段非常关键的一种能力,就是“多模态”。

01 / 什么是多模态?
“模态”,可以简单理解成一种信息形式。文字是一种模态,图片是一种模态,声音是一种模态,视频是一种模态,传感器数据也可以是一种模态。
所谓多模态 AI,本质上就是:让一个 AI 系统能够同时处理、理解并关联文字、图片、声音、视频等多种信息。
例如,当你把一张菜品照片发给 AI,再问“这道菜大概多少热量”,模型就需要同时理解图片里的食物与文字里的问题。它已经不只是做图片识别,而是在把不同类型的信息放进同一个认知体系。
02 / 多模态真正难的,不是“看见”,而是“对齐”
很多人以为,AI 能识别图片,就等于真正理解图片。其实不是。真正困难的是:AI 如何知道图片里的对象,与语言里的概念,是同一件事?
例如,图片里有一只猫,文字里写着“一只猫”。AI 必须知道两者表达的是同一个现实对象,这就是所谓的跨模态对齐。
一个高度简化的多模态流程
信息翻译 | → | 信息对齐 | → | 融合· 推理 · 输出 |
真正的突破,不是“多了一个摄像头”,而是不同信息第一次可以进入同一个认知系统。

03 / 为什么多模态会成为 AI 的重要方向?
原因很简单:真实世界本身就是多模态的。传统大模型主要依赖文字,但企业真实工作中的复杂任务,很少存在于一个干净的文本框里。
例如建筑企业的一笔付款资料,可能同时包含合同文本、发票扫描件、银行回单、付款申请表、项目台账、盖章文件和聊天记录。若 AI 只能处理文字,大量信息仍然要由人先整理。
如果 AI 能同时理解扫描件内容、表格字段、合同条款、项目名称和金额关系,它才真正有机会进入业务流程。多模态最大的意义,是扩大 AI 能够理解的现实信息边界。
04 / 多模态模型和多模态 Agent,不是一回事
多模态模型:能够理解更多信息的“大脑”
• 给它图片,它能解释图片;给它语音,它能理解内容;给它图文混合信息,它可以联合分析。它解决的核心问题是“理解”。
多模态 Agent:理解以后,还能继续做事的“系统”
• 例如识别一张设备故障照片后,继续查询设备手册、调取历史维修记录、判断原因、生成维修方案、创建工单,并记录处理结果。
一句话概括:多模态模型解决“我看懂了什么”,多模态 Agent 解决“看懂之后下一步做什么”。
05 / 为什么 Agent 越来越需要多模态?
因为现实工作不是纯文字任务。客户会发商品照片、订单截图、付款凭证、故障视频和语音消息;工程人员会直接拍现场照片并问“这里是不是有问题”。
如果 Agent 只能处理文字,它就像一个蒙着眼睛、堵着耳朵的助手。多模态让 Agent 获得更接近真实业务环境的感知入口。
从知岳科技的角度看,Agent 走向真实企业之后,多模态几乎是必然方向,因为企业数据本身就是多模态的。
06 / 多模态真正改变的,是企业的数据入口
过去企业数字化的一个重要限制,是现实世界的信息必须先被人转成结构化数据:财务人员先看发票再录入系统,员工先读合同再摘录字段,现场人员先拍照再写说明。
换句话说,大量企业所谓“信息化工作”,其实是在让人充当现实世界和软件系统之间的翻译器。
多模态正在改变这个结构。照片、语音、视频、PDF、扫描件可以直接进入 AI,由 AI 负责理解,再转成结构化字段、任务、报告、风险提示或系统动作。

过去,是人把现实翻译给软件。未来,越来越可能是 AI 直接理解现实,再把信息送入业务系统。 |
07 / 多模态在企业里,会先落在哪些场景?
文档与票据智能处理
合同、发票、回单、扫描件、表格、照片同时进入系统,完成识别、分类、字段提取、材料匹配与异常检查。
智能客服
客户可直接发送文字、语音、订单截图、产品图片或故障视频,系统不再要求客户先把一切翻译成文字。
企业知识库
知识库同时理解文档、图片、培训视频、会议录音、设计图与流程截图,让更多隐性经验被读取和调用。
质检与审核
图片信息 + 系统数据 + 业务规则联合判断,用于订单凭证、现场资料、商品图片、设备异常等场景。
内容生产
文字生图、图片生文、视频摘要、录音纪要等能力进入统一工作流,减少跨软件来回切换。

08 / 多模态并不意味着所有任务都应该上多模态
多模态通常意味着更高的计算成本、更复杂的模型调用、更长的推理链和更多潜在误判。所以真正合理的企业架构,不应该是“模型越大越好,模态越多越好”。
更合理的原则是:什么任务需要什么能力,就调用什么能力。若 80% 的工作只是分类文字、提取字段、生成回复,轻量文本模型可能已经足够;如果核心判断依赖图片、声音、视频或扫描件,多模态才真正产生价值。
AI 架构不是比谁配置最高,而是比谁用更低的成本完成更可靠的结果。
09 / 看见,不等于看对
多模态能力越来越强,但并不意味着它已经可靠到可以完全替代人工。复杂表格、细小文字、工程图纸、财务凭证、长视频、复杂空间关系,仍然可能出现误判。
更危险的是,它有时会给出一个非常合理的解释,但解释本身是错的。因此,企业级多模态系统还必须配套结果校验、置信度判断、规则引擎、人工复核、操作日志与权限控制。
多模态解决的是“信息入口更丰富”;企业真正需要的是“可靠地把这些信息转化成结果”。
10 / 从多模态,到多模态 Agent,再到具身智能
如果把近年的 AI 发展方向连起来看,会发现一条非常清晰的路线:
文本 AI | 主要理解语言 |
多模态 AI | 开始看见图片、听见声音、理解视频 |
Agent | 围绕目标调用工具、执行任务 |
多模态 Agent | 理解多种现实信息,并据此规划和行动 |
具身智能 | 拥有真实物理载体,进入现实环境完成任务 |
这条路线背后的方向高度一致:AI 正在从理解信息,逐渐走向理解世界,再走向参与世界。多模态,是纯数字智能走向现实智能之间的一座桥。
11 / 知岳科技的判断:企业真正需要的是“多模态工作流”
站在企业落地的角度,我们并不认为企业应该每天研究“哪个模型图片理解排名第一”“哪个模型视频能力更强”。这些能力当然重要,但最终决定商业价值的,仍然是它们有没有进入企业流程。
真正有价值的多模态应用,应该形成这样的闭环
客户资料文字 / 图片 / 语音 / 文件 | AI 理解识别需求与信息 | 知识与系统检索知识库· 调用工具 | 规则判断流程规则· 风险校验 |
结果输出方案 / 数据 / 操作 | 人工接管高风险与关键节点 | 持续反馈记录结果与异常 | 流程迭代形成可复用能力 |
知岳科技更关注的,并不是“AI 能不能看一张图片”,而是“AI 看完这张图片以后,能不能继续把这件事情做完”。
12 / 结语:AI 正在从“语言接口”,变成“世界接口”
过去的大模型,本质上是一种非常强大的语言接口。人类把世界翻译成文字,再告诉 AI;AI 再通过文字回答我们。多模态正在逐渐打破这个限制。
未来 AI 面对的输入,不再只是提示词。它面对的可能是一张照片、一段录像、一次电话、一个 PDF、一张发票、一段机器传感器信号,以及它们之间复杂的关系。
当多模态与 Agent 结合之后,AI 不仅开始“看懂世界”,还开始根据理解做出行动。
模型负责理解。Agent 负责行动。工作流负责让能力稳定发生。而企业最终购买的,从来不是“多模态”——企业真正愿意付费的,是结果。 |
知岳科技· AI 企业赋能与应用
让 AI 从“能理解”,走向“能完成”
夜雨聆风