夜雨聆风学习资料网

ARTICLE · 1041787

阿柴科普|PDF里明明有图,AI为什么看不见?

阿柴科普|PDF里明明有图,AI为什么看不见?

整份 PDF 都传过去了,AI 能总结正文,一问图里的两条线,却说不清。图明明就在那儿,它到底看到了什么?

文件传成功了,图却可能没被送给模型。 先指定一页,让它说出图例和坐标轴写了什么,再对照原页。别只听它回答“我看到了”。

示意图|只取文字时,嵌在页面里的销量图可能没被送给模型;数据为示例。

两条线在哪一步不见了

拿一张示例销量图来说。橙色实线代表城东店,逐月上升;深棕虚线代表城西店,逐月下降。横轴是月份,纵轴是销量,单位是“杯”。

假设整张图作为图片插在 PDF 里,旁边写着“本季度两家店的销量变化如下”。你问哪家店销量在下降,答案就在往下走的虚线上。

但文件上传后,工具还要先处理它。有的入口只抽出文字,有的会把图像也交给模型。 如果只取文字、丢弃图片,模型收到的可能只有那句说明,没有两条线。

它能说出“这页讲的是门店销量”,却没依据判断哪家店在下降。再加一句“请仔细看图”,也补不上缺少的图片。

同一份PDF,为什么换个入口就不一样

以 ChatGPT 为例,截至 2026 年 9 月 18 日,产品说明把 PDF 视觉读取列为 Enterprise 企业版能力,其他套餐的文件检索只处理文字。企业版也要分入口:放进 GPT 知识库或项目文件区,走文字检索;在对话里上传,可以读取图像。 项目里的对话也算后者。

这里说的是 PDF 里的图,和单独上传图片是两回事。也不能推成“所有 AI 都看不了 PDF 图表”:Gemini API 就支持这类视觉处理。不过,这是开发者接口的能力,不能直接套到 Gemini 手机 App。

怎样检查它读的是不是这张图

回到销量图,把位置说清楚,比如“阅读器里的第 3 页,那张两家门店的月销量图”,再问:

先别分析原因。请说出图表标题、横轴和纵轴各是什么、纵轴单位,再说明每条线代表哪家店、是什么线型、怎样变化。看不清的地方直接指出,不要猜。

然后自己对照:单位是不是“杯”,橙色实线是不是城东店,往下走的是不是城西店的虚线。图例答对了,还得看走势有没有读反。

如果对不上,先别用它的结论。在支持看图的对话里,把这一页截成清晰图片补传,再问同一个问题。整页字太小,就截完整图表,把标题、坐标轴、单位和图例一起留住。

示意图|补传图表时,标题、单位和图例要一起保留;数据为示例。

只截两条线,它就少了店名和单位。看出一条线往下走,也说不清是哪家店、少卖了多少杯。

答不上来不一定是没收到图,也可能是图太糊、字太小,或模型读错了。补传之后仍要对照原图;要用具体数字,就再核对原始表格。别在“城西店销量下降”都没看对时,接着让它分析为什么增长。

资料来源

  • OpenAI:PDF 视觉读取与上传入口
  • OpenAI:文件上传与套餐范围
  • Google:Gemini API 的 PDF 文档处理
  • OpenAI:图片输入及读图限制
关注|长按识别,和阿柴一起把 AI 一点点用起来

相关学习资料