乐于分享
好东西不私藏

用"智能体文档提取"解锁你文件里的数据

用"智能体文档提取"解锁你文件里的数据

用"智能体文档提取"解锁你文件里的数据

Landing AI Agentic Document Extraction · 完整中文实录

Unlock data from your files with Agentic Document Extraction

🎬 视频来源:DeepLearning.AI(YouTube)
📅 发布于 2026 年 1 月 26 日 | ⏱ 时长约 1 分 56 秒 | 👀 7,300+ 次观看
🔗 https://youtu.be/e1uGELOgp2M

PDF、发票、报表、合同——这些文件里锁着大量数据,传统 OCR 只能认字,读不懂版式。Landing AI(吴恩达创立的公司)在这段短片中介绍了他们的新方案 ADE(Agentic Document Extraction,智能体文档提取):像人一样"看"文档,再由智能体把内容可靠地提取出来。以下是完整文字实录(中译)。

· · ·

01|ADE:不是改良,而是全新范式

ADE 并不是在既有技术上往前迈了一小步,而是由我们的工程师开创的一种全新的文档 AI 方案。它属于"智能体时代"(agentic era)的产物,采用的是"视觉优先、以数据为中心"的方法。

这就是 ADE 的三大支柱:

① 视觉优先(Vision first)
② 以数据为中心(Data-centric)
③ 智能体化(Agentic)

02|三大支柱分别是什么意思?

这三大支柱各自的含义是什么?

视觉优先,意思是把文档当作视觉对象来对待——文档的含义不只存在于文字里,而是编码在版式(layout)、结构和空间关系之中。

以数据为中心,意思是在最高质量、经过精心筛选的数据上做训练。我们相信:正确的数据与正确的模型架构同样重要。

最后是智能体化——交付这样的系统:它会规划、决策、执行、验证,循环往复,直到结果达到质量阈值为止。

💡 要点:与"读字"的传统 OCR 不同,ADE 读的是"版面"——标题在哪、表格怎么排、图和文字什么关系,这些都参与决定内容的含义。这也是它能在复杂表格、图表、表单上大幅超越 OCR 的根本原因。

03|技术架构:从视觉底座到应用层

这张架构图真正说明了一个核心观点:视觉是 ADE 的根基。Landing AI 把多年积累的视觉技术专长,带到了文档 AI 这个问题上。

架构的最底层,是最先进的文档原生视觉模型(document-native vision models)——它们被训练得能像人类一样"看"文档

在这个底座之上,是负责解析与路由的智能体:文本、表格、图片等不同类型的内容块,会各自走各自的提取通路。

最顶层是智能体与应用层,聚焦用户在文档处理流程中真正需要的能力,例如字段提取(field extraction)和文档拆分(document splitting)。

架构一览:视觉模型底座(像人一样看文档)→ 智能体解析与路由(文本/表格/图片分路处理)→ 智能体与应用层(字段提取、文档拆分等实用功能)

04|DPT:文档预训练 Transformer 模型家族

前面提到的那些基础视觉模型,属于一个不断壮大的家族——文档预训练 Transformer(Document Pre-trained Transformer,简称 DPT)。

截至本次录制时,你可以选择 DPT-1、DPT-2 和 DPT-2 mini 三种模型。它们都能返回高质量的文档解析结果,包括:

📖 阅读顺序检测(reading order detection)
📐 版面布局检测(layout detection)
🔤 文字识别(text recognition)
🖼 图片描述生成(figure captioning)

· · ·

📌 关于本文
本文为视频《Unlock data from your files with Agentic Document Extraction》(DeepLearning.AI 频道,2026 年 1 月 26 日发布,时长约 1 分 56 秒)的完整中文译文,内容依据视频自动字幕逐段翻译整理。ADE 由 Landing AI 开发,可在 va.landing.ai 体验。译文如有疏漏,以原视频为准。