是什么:OmniRoute 是一个统一 AI 网关,通过一个端点聚合 231+ 家模型提供商(含 50+ 免费),让 Claude Code、Cursor、Codex 等编程工具零成本调用 Claude/GPT/Gemini。
怎么做:
- • 核心原理:像手机里的双卡双待 + 智能选网。编程工具只认识一个"号码"(OmniRoute 端点),后台自动在 231 个模型间切换,免费线路优先、失败自动跳付费线路,不影响前端使用。
- • 关键做法:
- • RTK + Caveman 压缩:把上下文 token 压缩 15%-95%,同样对话消耗更少,免费额度更耐用。
- • 17 种 combo 路由:可并行走多个模型,取最快或最稳的返回,不是单点请求。
- • OAuth 自动续签 + 故障转移:令牌过期、某家限速时自动切换,开发流程不中断。
- • MCP/A2A + 多模态:不只是聊天补全,也支持工具协议和图文输入。
- • 上手方式:支持 Electron 桌面、PWA 和 Docker 部署,配好 .env 后把 Claude Code 的 base_url 指向本地 OmniRoute 端口即可开始。适合个人开发者想降低 AI 编程成本、团队想统一模型入口的场景。
项目地址:https://github.com/diegosouzapw/OmniRoute
2. olmocr:AI2 开源的 PDF 转 LLM 可读文本工具
是什么:olmocr 是 Allen AI 开源的 PDF 线性化工具包,用 7B 视觉语言模型把扫描件、论文、财报转成干净的 Markdown,每百万页成本低于 200 美元。
怎么做:
- • 核心原理:像给 PDF 雇了一个会看图也会排版的编辑。它不只 OCR 文字,还理解多栏、表格、公式、手写批注的位置关系,输出按阅读顺序排列的 Markdown。
- • 关键做法
- :
- • 基于 Qwen2.5-VL 微调 + GRPO 强化学习:在 olmOCR-Bench 上得分 82.4,超过 MinerU 和 Mistral OCR API。
- • vLLM 批量推理 + S3 多节点协调:单机或集群都能处理百万级文档,适合大规模数据集构建。
- • 远程/本地/Beaker 三种模式:没有 GPU 可接远程推理服务器;有 12GB 显存可本地跑;有 AWS 资源可用 Beaker 集群。
- • 上手方式:
pip install olmocr后一条命令转换 PDF 到 Markdown,学术论文、财报批量清洗、训练语料准备都能直接用它。Docker 镜像已包含模型,开箱即用。
项目地址:https://github.com/allenai/olmocr
3. VideoAgent:自然语言驱动的视频理解、编辑与重制 Agent
是什么:VideoAgent 是香港大学数据科学实验室开源的一体化视频 Agent 框架,用户用自然语言描述需求,系统自动完成视频分析、剪辑、配音或跨语言改编。
怎么做:
- • 核心原理:像把一群专业剪辑师、配音员、翻译放进一个项目组。你只说"剪一段 30 秒的电影高光并配上中文解说",项目经理(路由器)自动拆任务、派给不同子代理并行完成。
- • 关键做法
- :
- • 意图分解:把一句话需求拆成显式任务和隐式任务,避免调用不必要的工具,减少浪费。
- • 图驱动工作流 + 自评估:把子任务表达成工具节点图,工作流组成成功率 0.95;两步自评估循环不断修正中间结果。
- • Storyboard Agent 视觉检索:将用户输入转成细粒度视觉查询,在预标注视频素材库里精准找片段,而不是逐帧硬看。
- • 上手方式:Conda 环境配好后,安装 CosyVoice、Whisper、ImageBind 等可选模型,在 config.yml 填入 Claude/GPT/Gemini/DeepSeek 密钥,运行
python main.py即可。适合内容创作者、短视频团队、跨文化内容改编。
项目地址:https://github.com/HKUDS/VideoAgent
4. OpenPencil:并发 Agent 团队驱动的 AI 原生矢量设计工具
是什么:OpenPencil 是首个开源 AI 原生矢量设计工具,支持多 Agent 并行协作,用户用自然语言提示即可在实时画布上生成可编辑 UI。
怎么做:
- • 核心原理:像建筑设计里的"主方案 + 分区协作"。用户描述页面需求后,编排器把画布拆成多个区域,多个子代理同时设计不同部分,最后合并成完整矢量稿。
- • 关键做法
- :
- • 空间分解 + 子代理并行:自动把复杂界面拆成子任务,多个 Agent 同步生成 PenNode 结构,提高整体速度。
- • 角色推断与视觉后处理:根据节点名自动识别 Button、Card、Nav 等语义角色,并自动修复对比度、布局、填充问题,让弱模型也能出可用结果。
- • Design-as-Code + MCP 集成:设计稿可增量生成代码,支持通过 MCP 协议与外部工具链连接,实现从设计到代码的闭环。
- • 上手方式:
bun install && bun run dev启动,需安装 Bun 和 Zig 0.14.0 来构建本地 AI 插件。支持 13+ 家 OpenAI 兼容提供商(MiniMax、GLM、Kimi、DeepSeek 等)。适合 UI 设计师做快速原型、开发团队做设计到代码转换。
项目地址:https://github.com/ZSeven-W/openpencil
5. QVal:无需训练就能评估长程 Agent 的监督信号
是什么:QVal 是一个训练免费的测试平台,用来直接评估 LLM Agent 在长程任务中各种"密集监督信号"是否真正对齐 Q 值,避免把信号质量和训练工程混在一起讨论。
怎么做:
- • 核心原理:像给学生的每一步作业打分前先问"这步对最终答案有没有帮助"。QVal 用一个强参考策略的 Q 值作为标准,看监督信号给中间步骤的分数是否与真实价值一致,而不是等训练跑完再看最终成功率。
- • 关键做法
- :
- • 直接比较 21 种监督信号:覆盖自信度、自蒸馏、嵌入相似度等 7 大类方法,跨越 4 个环境、1,200+ 实验、6 个开源模型。
- • 与训练解耦:不需要训练就能判断哪种监督信号更好,研究迭代成本大幅下降。
- • 发现简单基线更稳:实验结果显示,简单的提示基线反而持续优于文献中复杂的密集监督方法,说明很多"花活"并不如想象中有效。
- • 适用场景:适合研究 Agent 训练的人快速筛选监督信号、企业在做 Agent 强化学习前评估奖励设计。
论文地址:https://arxiv.org/abs/2606.32034
6. SkillComposer:把 Agent 技能库自动组合成可执行计划
是什么:SkillComposer 提出了一种生成式技能组合方法,让 Agent 面对复杂任务时,从技能库里自动选出"用哪些技能、用几个、按什么顺序",并一次性生成可执行计划。
怎么做:
- • 核心原理:像厨师看菜谱做菜。过去 Agent 要么把全部菜谱摊在桌上再思考(慢且杂乱),要么只查一本菜谱就动手(容易漏)。SkillComposer 让 Agent 同时决定选哪几本、按什么顺序下锅,三个决策在一个解码步骤里完成。
- • 关键做法
- :
- • 约束自回归解码:把技能组合视为任务条件下的序列预测,子集、数量、顺序从单次解码中联合产出,天然捕获依赖关系。
- • 基于真实人类整理的技能库训练:训练数据来自生产级代码 Agent 的技能库,不是合成数据。
- • 在 GPT-5.2-Codex 和 Gemini-3-Pro 上提升显著:相比无技能基线,pass rate 分别提高 +23.1 和 +18.2 个百分点,同时提示 token 成本更低。
- • 适用场景:适合构建企业技能库、让代码 Agent 或复杂任务 Agent 自动复用已有技能,而不是每次从零规划。
论文地址:https://arxiv.org/abs/2606.32025
7. TRIAGE:给 Agent 强化学习加上"角色化"功劳分配
是什么:TRIAGE 是一个角色类型化的信用分配框架,用于解决 Agent 强化学习中"最终结果好,但中间步骤不一定都好"的奖励分配问题。
怎么做:
- • 核心原理:像复盘一场比赛。传统 GRPO 只看最终输赢给全队发同样的奖金,导致成功 rollouts 里的冗余动作也被奖励、失败 rollouts 里的有效探索也被惩罚。TRIAGE 把每个动作段按角色分为"关键进展 / 有效探索 / 无进展 / 倒退"四类,再分别给分。
- • 关键做法
- :
- • 结构化裁判(structured judge):判断每个动作段的语义角色,不靠人工设计规则。
- • 角色条件奖励:四类角色对应固定但有界的段级过程奖励,保留最终验证信号的方向,同时修正 outcome-only 的两个盲区。
- • ALFWorld / Search-QA / WebShop 上超越 GRPO:在成功 rollouts 中检测"倒退"是最大收益来源;在 ALFWorld 和 WebShop 上平均减少 10.4%-14.8% 的环境交互步数。
- • 适用场景:适合训练搜索、浏览、编辑等长程交互 Agent,让模型在失败时也能学到有用探索,在成功时不忘掉冗余动作。
论文地址:https://arxiv.org/abs/2606.32017
Agent 应用开发商务合作,欢迎邮件联系 yangjie@sourcedreamai.com
夜雨聆风