乐于分享
好东西不私藏

搭个能翻自己电脑的AI调研助手,聊聊技术选型那点事

搭个能翻自己电脑的AI调研助手,聊聊技术选型那点事

「在线AI调研工具什么都好,就是碰不到你硬盘里那堆PDF。」

回想之前某晚凌晨一点,我刚用完Gemini的DeepResearch查一个技术方向。报告挺全的,但我总觉得差点什么。我桌面上那堆本地文档,它一个都读不到。关掉浏览器,我盯着电脑发了会儿呆。

⭐点击『极客精益』→『...』→ 设为星标,觉得有用就点赞👍分享🔄推荐❤️


故事是这样的。

上个月我在研究一个技术方向,打开Gemini的DeepResearch,输入问题,等了几分钟,一篇带着引用的调研报告出来了。说实话,质量不错。

但总觉得哪里不对。

屏幕的光在黑暗里有点刺眼。

我桌面上有一堆本地PDF,技术文档、会议记录、之前研究的笔记。这些资料我的AI调研助手完全看不到。它搜遍全网,就是翻不了我的硬盘。

这个感觉很怪。明明我的资料就在那儿,但我得手动打开、翻找、整理,然后自己往脑子里塞。

AI帮了我90%的工作。

偏偏那10%最关键的部分,我自己的知识积累,它帮不上忙。

怎么解决呢?

说实话,我也没完全想好。

但总得试试吧。

01. 开源框架怎么选

动手之前,我先刷了一圈现有的开源方案。2026年这个赛道上,比较热的有四个:

local-deep-research,这个项目我关注很久了。它的核心理念就是「Everyone Local & Private」。架构上每个用户一个独立的SQLCipher数据库,AES-256加密,甚至管理员都读不到你的中间数据。它内置了一个多引擎并行搜索系统,arXiv、PubMed、GitHub、Wikipedia都能搜,再配合自托管的SearXNG元搜索引擎,还能聚合Google和Brave等230多个搜索源,相当于给系统装了一个隐私保护的统一搜索入口。它还支持通过LangChain挂载本地文档库当RAG源。最绝的是离线模式,配好Ollama本地模型,断网也能跑。SimpleQA基准测试上能做到约95%的准确率(搭配GPT-4.1-mini和自托管SearXNG)。

DeerFlow 2.0,字节跳动开源的项目。它已经不只是一个「调研工具」了,更像一个「超级Agent执行环境」。每个子Agent跑在独立的Docker沙箱里,有自己的文件系统,可以写代码、跑脚本、调API。基于LangGraph搭了个九层中间件链,数据隔离(ThreadData)、沙箱执行(Sandbox)、持久记忆(Memory)、用户澄清机制(Clarification)等,确保每一层的数据流转都可控可追溯。它能生成报告、PPT、播客脚本,你甚至可以一边看它干活一边手动调整研究计划。

open_deep_research,LangChain官方的参考实现。架构上解耦成四个独立角色,Planner负责规划、Researcher负责搜、Compression负责压缩、Final Report Model负责写报告。原生兼容MCP协议,你想挂载公司内部的ERP系统还是GitHub私有仓库,写个MCP Server就行。不过社区维护有点停滞了,生态上有点生锈的感觉。

gpt-researcher,最早火起来的开源调研Agent。它用的扁平化多Agent并发策略,号称引用准确率92%左右。但重度依赖第三方商业API,一旦断网很多硬编码的重试逻辑会导致线程崩溃。代码库里还堆了不少过时分支,工程健康度一般。

说实话,这四个我每个都折腾了至少一两天。local-deep-research安装最顺,DeerFlow的编排能力是真强,open_deep_research概念好但代码有点锈,gpt-researcher……嗯,不太敢上生产。

你问我推荐哪个?

我觉得不要只选一个。local-deep-research最适合当「研究引擎内核」,它把多搜索引擎、多数据源、多LLM Provider都封装好了,拿来就能用。DeerFlow适合当「编排层」,复杂的任务规划、Agent分组、沙箱隔离,它做得最好。两者配合:DeerFlow负责任务拆解和流程控制,local-deep-research负责具体的研究执行。有点像后端架构里的「网关+微服务」组合。

横向对比信息图

02. 模型怎么配?别让一个模型干所有活

这是我琢磨了很久的一件事。

很多人觉得「选个最强的模型就行了」。但深度调研这件事,它不是一个模型能搞定的。

你想啊,一个典型的调研流程是这样的:先并行搜一堆网页→过滤噪声→提取关键信息→多来源对比分析→规划下一步搜索方向→再搜→再分析→最后写成报告。

这里面不同步骤对模型能力的需求完全不同。

我试了好几轮才定下来这套方案。

不是一次想出来的。最开始我把所有任务都塞给一个模型,结果又慢又贵。后来才慢慢拆开。

现在大概是这么分的:

L0层,轻量过滤模型。处理海量原始搜索结果,去广告、剔除噪声、做初步摘要。这步不需要多聪明的模型,但要便宜、要快。Qwen 2.5 7B或者Mistral NeMo 12B就够了。部署在本地MLX/Ollama上,量化为4-bit,一台Mac Studio能扛几十路并发。

L1层,深度分析模型。负责任务规划、复杂段落理解、跨文献对比、工具调用决策。这步要求模型有强的推理能力和工具调用稳定性。我试了DeepSeek V4 Pro、GLM 4.6、Kimi K2.5这几个。Kimi K2.5的Agent Swarm能力让我印象很深,支持100个子Agent并行和1500次工具调用。GLM 4.6的200K上下文窗口和原生工具使用支持也表现稳定,在AIME、GPQA这些推理基准上与Claude Sonnet系列不相上下。说到基准,Terminal-Bench 2.0上Qwen 3.6 Max拿下了65.4%的得分,对比之下DeepSeek V4 Flash只有56.6%。数据不撒谎。

L2层,报告撰写模型。把汇总好的事实碎片整合成可读的报告。这步最看重语言质量和逻辑连贯性。如果有预算,Claude或者GPT-4.1是不错的选择。如果完全本地化,Qwen 3.6 Max配合27B密集模型也能胜任。

这套分层策略的好处很明显:90%的计算量由L0解决,9%由L1处理,只有1%需要调用昂贵的L2模型。 成本省了不是一点半点。

不过说实话,这套分层方案我还在调。L0和L1之间的边界有时候挺模糊的。比如一个搜索结果的摘要,到底是L0做了还是L1做?目前没有完美答案。

三层模型架构信息示意图

03. 架构蓝图:一张图说清怎么搭

有了框架和模型,接下来就是怎么把它们拼起来。

其实改了好几版了。最开始全揉在一起,后来才慢慢拆开。

现在大概是这么搭的:

最上层是一个API Gateway,接收用户请求,做权限校验和负载分配。

往下走是编排层,DeerFlow在这层负责。用户进来一个研究主题,Planner Agent先把它拆成若干子任务,「第一步搜这个关键词」「第二步读这几篇论文」「第三步对比一下两组数据」。每个子任务分配给专门的Execution Agent,跑在独立的Docker沙箱里,互不干扰。

再往下是研究引擎层,local-deep-research在这层。编排层把它当一个高级工具调用,「帮我去搜一下这个方向,要深度模式,广度设5,深度设3」。它就把多搜索引擎跑一轮,提取关键信息,返回结构化的结果。

存储层有四个东西:SQLCipher加密的关系库存会话和任务状态、Qdrant向量库存文档embedding、Neo4j图库存实体关系、Redis做缓存加速。

安全层是特别加的一道防线。我弄了个PII Shield脱敏代理,所有要发给云端L2模型的数据,先过一道脱敏,把里面的姓名、账户号替换成哈希标记,等结果回来再解密还原。这样即使调用GPT-4.1写报告,敏感数据也不会出本地网络。

其实PII Shield背后有一个更大的架构模式叫AirGapAgent,把原始数据处理和外部模型调用彻底隔离成两个独立的Agent。一个只负责脱敏和压缩,从不出网;另一个只负责拿着最小必要信息去调用外部API,从不接触原始数据。互相不碰对方的数据,物理上切断泄露渠道。这个模式不光用在PII Shield上,整个分层模型调度也是这个思路的延伸。

系统架构分层示意图

04. 硬件选型:买什么才不浪费钱

这个问题其实取决于你要跑多大的模型。

如果追求极致完全本地化,所有模型都在自己机器上跑。那我推荐Mac Studio,M4 Ultra版本,配192GB统一内存。Apple的MLX框架在统一内存架构上的优势很明显。同样跑Qwen 3.5-35B这个模型,短文本生成时MLX能做到大约57 tok/s,llama.cpp大约29 tok/s,差了一倍左右。但上下文拉长到八千Token以上,两者的有效吞吐都会掉到个位数。所以选哪个不能只看峰值数据,得看你实际的工作负载长什么样。

如果预算有限或者主要是云端API方案,那其实不需要太强的本地硬件。一台普通的Mac mini M4配个Ollama跑7B模型做L0过滤就够了。主力模型走API调用。

还有一种混合方案:本地跑L0和部分L1的模型,高难度任务走云端API。这是目前我觉得性价比最高的方式,既保证了日常使用的响应速度,又能在需要质量的时候调用最强的模型。

05. 不能不提的坑

说实话,这篇文章要是只讲好处不讲坑,那你读完之后信心满满去搭,大概率会翻车。

一个是多源信息打架。 同一个问题,A论文说效果提升40%,B报告说只有15%。AI面对这种冲突的时候,往往会偏向结构更清晰的那个来源,不一定是对的那个。破解方法是在系统里加一个「冲突判断节点」(Conflict Judgment Agent),要求它先分别列出不同来源的论据和置信度,再综合判断。

更进阶的做法是引入XoT(基于解释的思维,Explanation-based Thinking)框架。分两步走:第一步,让模型不急于给结论,而是对不同来源分别生成独立的解释说明,各说各的理。第二步,开一个「辩论回合」,冲突判断节点把几份解释横向对比,衡量各自的数据置信区间,最后才下结论。研究显示这种方法能把矛盾化解的F1精度提升20%以上。

还有一个是反爬越来越狠。 想从正经的新闻网站或者学术数据库抓数据,Cloudflare、DataDome这些东西早就等着你了。标准的Playwright伪装在2026年已经大面积失效。如果想认真搞,得用CloakBrowser这种从C++层面改Chromium的方案,目前有49处指纹暴露点修改(最新版已达57处),连CreepJS这种专业指纹审计工具都识别不出来。

再一个是长上下文的算力成本。 一次处理百万Token的长文档,即使MLX加速也很贵。不是钱的问题,是时间。动辄几十分钟到几小时。解决方案是「分段检索+分层摘要+多轮聚合」,别一股脑全塞给模型。

还有一个很要命的:引用幻觉。 AI会编引用。这是真的。它会引用一篇看起来完全合理的论文,但那篇论文根本不存在。解决方案是在系统里加一个Citation Validator Agent,对每个引用做二次验证。先批量对所有URL和DOI发HEAD请求,确认链接可达、没返回404;再对随机抽样的引用做文本一致性核对,确认报告里提到的数字或结论确实能在原文里找得到。双向验证都过了,才算真正过关。

06. 这东西到底适合谁

聊了这么多技术选型,最后绕不开一个问题:谁真的需要这个?

我琢磨了一下,大概有这么几类人。

有一种人,像自媒体创作者或者技术写作者。不需要强严谨性,但需要快速覆盖大量信息源。local-deep-research加一个中等模型就够了,部署成本最低,收益最直接。30分钟出一份技术趋势综述,够用。

还有一类,投研分析和行业研究员。需要高可信度的调研报告,引用要可追溯,数据要交叉验证。那就得上完整方案了,DeerFlow编排、分层模型、Citation Validator、知识图谱辅助。月费几百块的API费用换回来的效率提升,怎么算都值。

再就是医疗和金融场景。核心要求不是效率,而是合规和安全。患者数据绝对不能出医院网络,交易策略不能泄露给第三方。这类场景必须全链路本地化,从框架到模型到存储,全部在内网完成。Mac Studio加本地大模型加PII Shield,一个不能少。

至于我嘛,现在卡在第一层到第二层之间的位置,local-deep-research已经跑起来了,DeerFlow还在调试,Citation Validator还没写完。

怎么说呢。路还长,但至少第一步踩出去了。


读者互动:看到这儿的,大概都是对技术选型有点兴趣的朋友。如果你也在折腾类似的东西,或者在搭的过程中遇到什么坑,欢迎留言说说。我不一定能帮忙解决,但至少可以一起吐吐槽。

极客精益社区

局限性说明:本文的技术选型基于2026年5月的开源生态状况,框架版本和模型基准数据可能随时间变化。DeerFlow 2.0的沙箱隔离方案在极端高并发场景下的稳定性尚未充分验证。分层模型调度策略中的具体模型替换请以实际测试为准。文中提到的CloakBrowser等反反爬方案仅用于学术研究场景,请遵守目标网站的使用条款。

延伸阅读

  • • LearningCircuit/local-deep-research[1] - 最推荐的本地研究引擎,支持所有主流本地和云端LLM,多搜索引擎聚合,一键Docker部署
  • • bytedance/deer-flow[2] - 字节跳动开源的SuperAgent框架,LangGraph编排,沙箱隔离子Agent,支持多模态输出
  • • langchain-ai/open_deep_research[3] - LangChain官方参考实现,Deep Research Bench评分0.43,MCP原生兼容
  • • ml-explore/mlx-lm[4] - Apple Silicon上跑LLM的首选框架,与Ollama深度集成
  • • CloakHQ/CloakBrowser[5] - 隐身模式Chromium,C++源码级49处指纹修改,可过CreepJS检测

相关标签#AI深度调研 #本地AI #技术选型 #DeerFlow #local-deep-research #MLX #开源

引用链接

[1] LearningCircuit/local-deep-research: https://github.com/LearningCircuit/local-deep-research[2] bytedance/deer-flow: https://github.com/bytedance/deer-flow[3] langchain-ai/open_deep_research: https://github.com/langchain-ai/open_deep_research[4] ml-explore/mlx-lm: https://github.com/ml-explore/mlx-lm[5] CloakHQ/CloakBrowser: https://github.com/CloakHQ/CloakBrowser