今天关注 PDF 智能路由库、科研 Agent 技能库、实时语音 Agent 框架三个开源项目,以及多模态分析式记忆、GUI Agent 跨平台蒸馏、自进化搜索 Agent 三篇论文。
一、pdf-inspector:先看一眼,再决定要不要花钱
是什么:pdf-inspector 是 Firecrawl 出品的 Rust PDF 检测与提取库,解决了所有 PDF 无差别送 OCR、白烧钱的问题。
怎么做:
核心原理:现在的文档管线像不看包装就把所有货送去开箱质检。它先花几十毫秒扫一眼内容流:里面已经有可提取的文字,就本地直接抽;确实是扫描件,才送去昂贵的 OCR。
- • 分类即路由:解析 xref 与页树,按采样策略在内容流里找
Tj/TJ(文本)和Do(图片)操作符,10–50ms 给出 TextBased/Scanned/ImageBased/Mixed 判定和置信度,还附一份pages_needing_ocr清单,支持按页路由而非整份送检。语料中约 54% 的 PDF 其实是文本型,这部分可直接跳过 OCR。 - • 一次解析两处复用:文档只加载一次,检测和提取共用同一份解析结果,不做重复 I/O;文本型 PDF 端到端控制在 200ms 内。
- • 无模型纯 Rust:不带任何 ML 模型,只依赖
lopdf,同一套解析器编译出 Python(PyO3)、Node/Bun(napi)、浏览器(WASM)绑定,前端也能本地跑、不走服务端。 - • 结构化输出到位:多栏阅读顺序、CID 字体解码、跨页续表、矩形+启发式双模式表格检测,直接输出 Markdown。在 opendataloader-bench 200 份语料上综合 0.875、表格 0.814,全程 0.47s,比 pymupdf4llm(17.1s)快约 36 倍。
上手方式:pip install maturin 后 maturin 构建,或 npm install @firecrawl/pdf-inspector、cargo add pdf-inspector,CLI 用 pdf2md;适合大规模文档入库、RAG 前置管线做成本分流。
项目地址:https://github.com/firecrawl/pdf-inspector
二、scientific-agent-skills:把 158 份实验手册交给 Agent
是什么:scientific-agent-skills 是一个面向科研的 Agent 技能库,解决了通用编码 Agent 不懂领域工作流、每次都要现查 API 的问题。
怎么做:
核心原理:让通用 Agent 做单细胞分析,就像让实习生第一天进实验室——工具都在架子上,但不知道该拿哪个、按什么顺序做。它提前把每个领域的标准操作写成手册放进技能库,Agent 照着流程走即可。
- • 158 个技能按域切分:生物信息与基因组学 26 个、科学交流 27 个、数据分析与可视化 22 个、机器学习 14 个,另有化学信息学、临床研究、医学影像、实验室自动化等;每个技能含
SKILL.md、代码示例、集成指南和参考资料。 - • 数据库统一入口:一个
database-lookup技能覆盖 PubChem、ChEMBL、UniProt 等 78 个公开库,加上 BioServices、BioPython、gget 等多库包,合计 100+ 科学数据库。 - • 测试与安全前置:凡带
scripts/的技能必须配测试套件,CI 强制阻断不合规 PR;另有仓库级结构契约测试(frontmatter、链接、脚本--help行为),并每周做一次 LLM 安全扫描且公开结果。 - • 走开放标准而非绑定:从原来的 Claude Scientific Skills 迁到开放 Agent Skills 标准,Cursor、Claude Code、Codex、Gemini CLI 等宿主都能装,不锁单一客户端。
上手方式:npx skills add K-Dense-AI/scientific-agent-skills 或 gh skill install,需 Python 3.13+ 与 uv;典型场景是药物发现管线、单细胞 RNA-seq 分析、多组学生物标志物发现。
项目地址:https://github.com/K-Dense-AI/scientific-agent-skills
三、livekit/agents:让 Agent 真的能接电话
是什么:livekit/agents 是一个实时语音 AI Agent 框架,解决了做语音 Agent 要自己搭 WebRTC 和模型编排的问题。
怎么做:
核心原理:文本 Agent 是一问一答,语音 Agent 得像真人打电话——要判断对方说完没有、能被打断、还得低延迟。它把 VAD、语音识别、大模型、语音合成串成一条实时流水线,开发者只写业务逻辑。
- • 四层抽象:Agent(带指令的 LLM 应用)、AgentSession(管一次交互)、entrypoint(会话起点,类似 HTTP handler)、AgentServer(主进程,负责作业调度)。
- • 语义轮次检测:用 transformer 模型判断用户是否讲完,而不是靠静音时长硬等,减少半句话被抢答。
- • 电话与 MCP 打通:对接 LiveKit SIP 栈直接支持呼入呼出;MCP 原生支持,一行代码接入外部工具服务器。
- • 三档运行模式:
console在终端用本地麦克风调试,dev热重载连云端,start生产模式;另配内置测试框架,可写 judge 校验 Agent 表现。
上手方式:pip install "livekit-agents[openai,deepgram,cartesia]",配好 LIVEKIT_URL 等三个环境变量即可跑;官方示例含外呼电话 Agent、餐厅订位、视频虚拟形象、多用户转录等。
项目地址:https://github.com/livekit/agents
四、AdaMM:记忆不该只会「翻」,还得会「算」
是什么:AdaMM 是一个多模态长期记忆框架,解决了记忆系统只能检索、不能对历史观测做统计的问题。
怎么做:
核心原理:现在的 Agent 记忆像一本翻得很快的日记本,问「上次去哪吃的」能翻到,但问「这三个月哪家去得最多」就抓瞎——那是数据库该干的活。它在检索记忆之外补了一层「分析记忆」,把反复出现的观测整理成能查能算的表。
- • 分析记忆是新抽象:把重复出现的多模态观测组织成可查询结构,支持过滤、聚合、排序、时间对比,与检索记忆互补而非替代。
- • 不预设 schema:不依赖应用方定义字段,而是从对话、图像和上下文元数据里抽出带溯源链接的属性-值观测,自动发现反复出现的字段结构并物化成可分析的表。
- • 规划器做分流:推理时由记忆感知的 planner 把一个问题拆成检索操作和分析操作,各自路由到对应工具。
- • 两个基准均有增益:在 MemEye 和 MemGallery 上分别最高提升 11.3% 和 7.3%。
论文地址:https://arxiv.org/abs/2607.29440
五、MAGA:只在「按错按钮」的地方使劲
是什么:MAGA 是一个 GUI Agent 多平台融合方法,解决了移动/网页/桌面专用模型合并后动作出错的问题。
怎么做:
核心原理:把三个各管一摊的专家合成一个通才,常见做法是直接平均权重,专家意见打架时输出的操作就废了。它换成让学生跟三位老师学,但只在学生「点错按钮」的那一步加大力度纠正,其余照抄的部分不浪费训练信号。
- • 按动作正确性分配信号:依据生成动作是否正确来重新分配训练权重,压掉冗余或无效的蒸馏信号,把学习集中在错误动作上——因为动作 token 才是 Agent 与环境唯一的接口。
- • 绕开两条老路的坑:权重合并会在专家分歧时破坏可执行动作;on-policy 蒸馏虽避开冲突监督,却对所有回复 token 一视同仁。
- • 只在训练期给提示:用 training-only hint 优化领域教师给出的监督信号,不改动学生的输入,推理时无额外开销。
- • 两个规模都最优:8B 上平均成功率超最强基线 2.0%,整体接近各领域教师的平均表现。
论文地址:https://arxiv.org/abs/2607.29320
六、SESA:出题的和答题的互相把对方逼进步
是什么:SESA 是一个自进化搜索 Agent 框架,解决了自博弈课程没有持久记忆、技能库又学自固定任务的问题。
怎么做:
核心原理:自博弈训练像每天自己出题自己做,做错了只反映在梯度里,明天照样出同一类题。它加了一本错题本:失败提炼成技能写回记忆,记忆改变解题者水平,水平又反过来改变出题者的难度——两边咬着螺旋上升。
- • 出题与解题分开参数化:challenger 负责出题,solver 单独参数化并且只有它能检索技能,避免出题方偷看答案。
- • 失败即技能:有信息量的失败被蒸馏成可复用技能写回记忆库;更新后的记忆改变 solver 行为和成功率,进而改变 challenger 的奖励与后续题目分布,前沿处产生新失败再改写记忆,形成双向闭环。
- • 技能能进参数也能留外部:检索到的技能会塑造在线策略训练轨迹,收益既沉淀进模型权重、也保留在外部技能库,因此支持无记忆部署,推理时检索变成可选项。
- • 七个基准验证:在开放域与多跳问答上平均准确率超 SSP 1.2–3.2 点,超技能增强基线 SkillRL 0.9 点;Qwen3 上关掉外部记忆仍保留 1.8–2.2 点增益,挂回技能库再加 0.5–1.0 点。
论文地址:https://arxiv.org/abs/2607.29468
Agent 应用开发商务合作,欢迎邮件联系 yangjie@sourcedreamai.com
夜雨聆风