夜雨聆风学习资料网

ARTICLE · 1116990

PDF 转文本再向量化?这题你答错一半了

PDF 转文本再向量化?这题你答错一半了

PDF 转文本再向量化?这题你答错一半了

面试官:Agent 做 RAG,遇到 PDF 怎么处理?
你:先转文本,再切片入库?
面试官:你们家 PDF 是顺序纯文本吗?
真实业务里的 PDF 有目录、页眉页脚、双栏排版、表格、流程图、扫描件。
直接抽文本,检索库里全是断句、重复、缺页码、丢表格关系的碎片。
生产级答案是四层架构(都在图里):
❶ 识别解析:原生文本直接抽 / 扫描件先 OCR / 表格图表上多模态
❷ 结构还原:留住页码、标题层级、条款位置,答得流畅更要追得回来源
❸ 语义切片:按结构切不按字数切,每个 chunk 带 metadata + 上下文说明
❹ 工具调用:search_pdf / read_page / extract_table / analyze_chart / quote_source 按需调度
最后补上引用 + 评测闭环,合同财报审计场景才敢上线。
面试官听完就知道:这人不是只跑过 RAG Demo。
#大模型 #AI面试 #RAG #Agent开发 #大模型面试 #PDF解析

作者提示: 个人观点,仅供参考
天津,33分钟前,

相关学习资料