夜雨聆风学习资料网

ARTICLE · 1083354

AI 和 Agent 这么多,医生到底怎么选?

AI 和 Agent 这么多,医生到底怎么选?

医生成长/数字工具指南

AI 和 Agent 这么多,医生到底怎么选?

常用工具、Work 模式与 token 消耗,一次讲清

下班后,你还要读论文、做课件、改科普。有人推荐 DeepSeek,有人说 Claude 好用,还有人让 Agent 一口气交付整套材料。等你打开软件,又发现里面有“Work”“深度研究”等入口。

它们到底是不是一回事?为什么只是让它做个 PPT,用量就消耗了不少?

让 AI 协助资料整理和任务执行,把专业判断留给医生。

先记住一个关系:AI 是技术大类,大模型提供理解与生成能力;我们打开的是应用产品,Agent 则是一种围绕目标持续执行任务的系统。这些概念可以重叠,不能把品牌硬分成“AI 阵营”和“Agent 阵营”。

对医生而言,选工具要先看任务:是解释一段话、追溯文献,还是制作可编辑课件?材料是否齐全?能否联网、读取文件和运行代码?这些条件比一个“最强 AI”的标签更有用。

本文介绍的是面向医生日常学习、科研、教学与科普的通用工具。功能核对至 2026 年 9 月 26 日;下列场景是选用建议,不是医学准确性排名。具体功能、地区可用性与额度以账号为准。

01先认识常见 AI 工具

多数通用助手都能解释、翻译、总结、改写和生成提纲。差异主要在于模型能力、联网来源、文件处理、工具连接和交付形式。同一款产品切换模式后,能做的事也可能明显不同。

图 1按任务认识 AI 产品,比按品牌贴标签更容易选用。

国内常用助手

产品

可以先用来做什么

医生选用时的关注点

DeepSeek

中文问答、推理讨论、写作与代码草稿。

适合梳理思路;复杂交付需确认当前文件和工具支持。[1]

豆包

日常交流、中文创作、图片与办公任务。

适合科普选题和通俗改写;医学表述仍须核对。[2]

Kimi

长材料阅读、深度研究、文档和 PPT 交付。

从论文整理接到课件制作较方便,注意引用与表格数字。[3]

千问

中文问答、搜索、网页总结与办公创作。

适合资料初筛与内容整理,区分模型回答与已检索证据。[4]

腾讯元宝

搜索、文档精读、写作与腾讯生态内容查询。

可找公众号等中文线索;医学依据要继续追到原始来源。[19]

文心助手

中文知识问答、内容创作与办公学习。

可尝试中文写作和资料问答,按实际入口确认功能。[20]

智谱清言

问答、写作、网页阅读与长文整理。

适合材料摘要和网页辅助阅读;浏览器插件与主产品有区别。[21]

讯飞星火

问答、翻译、文档阅读及相关科研助手。

可用于论文研读初稿;具体文件和语音能力取决于入口。[22]

国际常见助手及其侧重点

产品

可以先用来做什么

有何不同

ChatGPT

讨论问题、分析材料,研究与制作文件。

从对话到 Work、Codex,覆盖不同任务深度与交付形式。[5,11]

Claude

文稿修改、材料分析、研究与跨文件任务。

同一产品可以问答,也能连续执行;后文专门解释。[6]

Gemini

多模态问答、深度研究与 Google 资料协作。

适合已有 Google 工作环境者;读取账户资料需授权。[7]

Microsoft Copilot

问答与办公辅助;Microsoft 365 产品内协作文档。

Word、Excel、PowerPoint 内的能力有集成优势,注意许可证差异。[23]

Grok

问答、网页与 X 平台信息搜索。

适合发现动态和讨论线索;社交信息不能直接当医学证据。[24]

专门做研究、学习和视觉创作的工具

方向

代表工具

适合做什么

联网研究

Perplexity

找信息、整理来源与回溯链接;仍要检查原文是否支持结论。[9]

围绕资料学习

NotebookLM /                    Gemini Notebook

围绕选定来源问答并定位引用。部分官方页面已使用后一个名称。[8]

论文研究

Elicit、Consensus

Elicit 辅助检索、筛选与数据提取;Consensus 从论文检索生成回答,也提供研究 Agent。[25,26,34]

图片与视频

即梦、Midjourney

制作科普配图、封面或视觉素材;适合表达场景,精确医学示意需人工核验。[27,28]

这张清单涵盖 19 个常见产品或工具名称,仍不意味着每个医生都要全部安装。它们的功能大量重叠:可以拿同一份公开论文、同一条要求试两款,看谁遗漏更少、引用更容易追溯、文件更方便编辑。

学术工具也不能直接代替规范的系统综述。检索是否完整、纳排标准是否一致、数据是否提取正确、证据质量如何,仍需要研究者判断。产品写着“研究”或“医学模式”,不等于结论已经过临床验证。

02常见 Agent 的任务与差别

日常所说的“大模型 Agent”,通常在收到目标后,能选择步骤、调用工具,依据返回结果继续处理,直到交付或遇到需要人介入的问题。它的价值体现在把多步工作衔接起来。[16]

工具或平台

任务侧重点

与其他工具的主要区别

ChatGPT Work

研究、分析、文档、表格、课件等成品。

面向较完整的工作委托;执行范围取决于工具与授权。[5]

Claude 任务能力含原 Cowork 能力

围绕文件和外部应用完成整理、研究、办公任务。

聊天与 Cowork 正逐步整合,Agent 能力可出现在同一对话中。[6]

Manus

多步骤研究、网站与幻灯片等交付。

按目标委托任务;要写清数据来源和成品验收要求。[10]

Microsoft 365                    文件 Agent

在办公环境中生成 Word、Excel、PowerPoint 文件。

适合已有 Microsoft 工作环境者;可用功能取决于账户和许可。[35]

Codex /                    Claude Code

编写、修改、运行、调试代码。

更适合 R / Python 脚本与小工具;能运行不等于统计方法正确。[11,12]

OpenClaw俗称“龙虾”

自己部署,连接模型和工具,通过消息入口处理任务。

可做持续自动化,但需要配置与维护;本地运行不自动保证数据不出网。[13]

扣子 / Dify

搭建知识助手、Agent 或固定工作流。

它们是搭建平台;输出质量取决于模型、知识、流程与测试。[14,15]

这些系统通常都涉及模型、工具、任务状态和执行控制。区别在于擅长交付什么、能接入哪些应用、能否定期运行、需要多少技术配置。选择时也要看过程能否追溯、失败后是否能恢复。

Kimi 的深度研究、Consensus 的 Research Agent 等,也属于这类能力的实际入口。因此,前面的 AI 名单与这里的 Agent 名单出现重叠,是正常现象。[3,34]

普通医生可以先用现成的任务型产品。只有出现稳定、重复的需求,并有维护条件时,再考虑用平台自建智能体。

03Claude 与 Work 模式如何理解

Claude 到底是 AI 还是 Agent

两个说法指向不同层次,不是二选一。“Claude”可以指 Anthropic 的大模型系列,也可以指你打开的 Claude 助手产品。模型负责理解、推理与生成;产品再配置文件、搜索、代码等工具。[6,36]

图 2模型名称、产品名称和执行方式,需要分开理解。

让 Claude 解释论文中的一个术语,是对话式使用;让它读取多篇论文、核对表格、补查来源并制作课件,就是让产品以 Agent 方式完成任务。Claude Code 则是侧重编程的 Agent 产品。[12]

截至核对日期,Claude 官方正逐步把聊天与 Cowork 合并进同一对话。因此,有些用户能看到独立入口,有些已经无需选模式;这并不改变底层“模型加工具来完成任务”的关系。[6]

AI 里的 Work 模式 就等于 Agent 吗

具体到 ChatGPT Work,官方将它定义为面向研究、分析和文件交付的 Agent。它与聊天功能放在同一产品中,侧重完成一项工作。[5]

但“Work”并不是全行业统一的技术标准。别的产品叫“工作模式”,可能指办公模板、固定流程,也可能具有自主执行能力。判断时看它是否会选择下一步、实际调用工具、读取结果并调整。普通聊天也可能具备部分 Agent 能力;“深度思考”本身则只说明模型可能投入更多推理,不必然意味着它会操作工具。

对医生来说,可以这样提需求:“请根据这 8 篇论文生成证据表,再制作 10 页教学 PPT;缺失信息标注未报告,保留来源。”产品能否实际完成这条任务,比按钮叫不叫 Agent 更关键。

04Agent 为什么更消耗 token

Token 是模型处理信息的计量单位,并不固定等于一个汉字或一个英文单词。你输入的要求、文献内容和工具返回结果会形成输入;模型生成的文字、代码、工具调用参数等会形成输出。部分模型还使用不直接展示的推理 token。[29,30]

图 3一项任务往往包含多次模型调用,而不是只生成最后一段回答。

用量主要花在这些地方

① 多次调用。检索、阅读、比较、生成、检查,可能分别调用模型;遇到失败重试或改稿,还会增加轮次。

② 每轮要带上必要上下文。为接着做事,系统会提供任务说明、相关历史、材料和中间结果。长文、网页、日志越多,输入往往越大;并非每次都机械重传全部内容。

③ 工具说明与返回结果也占空间。模型需要知道工具怎么用,读取搜索结果、文件片段或报错后,再决定下一步。[29]

④ 推理与检查有额外用量。最终只看到一页答案,不代表模型只生成了一页内容。部分接口已把推理 token 计入输出,计算时不要再重复相加。[30]

⑤ 多个 Agent 分工会叠加。各自阅读、推理,再由主 Agent 汇总,都可能产生用量;并行主要节省等待时间,不保证省 token。[32]

图 4输出含可能的推理用量,未计算缓存折扣及工具费用。

Token 数、费用、等待时间并不相同。缓存可降低重复输入费用;搜索、生图和代码环境可能另行计费。工具程序运行本身不一定消耗模型 token,订阅“积分”也不能固定换算成 token 数。[31]

05不接 AI 模型的 Agent 还有用吗

要先分清“不接模型”指哪一种情况。不连接外部模型服务,不等于完全没有模型;没有大模型,也不等于所有自动化都失效。

情况

还可以做什么

失去或保留了什么

不接外部 API但使用本地模型

在硬件与模型能力允许时,仍能理解任务、选择工具和生成内容。

仍属于模型驱动的系统。API 只是调用服务的接口,不是智能的唯一来源。[13]

完全移除大模型保留规则和程序

已有代码可按规则备份、改名、去重、汇总固定表格或定时运行。

保留的是确定性自动化;对开放问题的理解、规划和解释能力通常明显受限。

现成框架断开模型且没有替代逻辑

界面、定时器、队列和工具连接可能还在。

依赖模型的节点会失败或停住,不能凭空判断下一步。具体能否运行取决于设计。[37]

Agent 的概念早于大模型

在人工智能教材中,Agent 是能够感知环境并采取行动的主体,早就包括按条件规则行动的系统,并不要求一定使用大语言模型。因此,“没有大模型就绝无 Agent”这个说法不准确。[33]

而现在大家谈的 Manus、Work,以及许多智能体平台中的 Agent,通常指大模型驱动的任务系统。抽掉负责判断的模型又不给替代方案,自然会失去核心能力。具体产品也可能把模型服务内置好,让普通用户无需自己配置接口。

那 Agent 框架到底提供了什么

模型之外,还要有人管理工具权限、保留任务进度、运行程序、处理错误、记录过程、安排定时任务,并把结果交给用户。Agent 系统的价值,是让模型能够在真实工作环境里持续做事。换一个模型、工具或执行流程,整体效果都可能改变。

如果你的任务只是“每天按固定规则汇总一张表”,普通脚本或工作流可能就够用;如果是“遇到新资料后决定读什么、查什么,再解释差异”,才更需要模型参与。工作流与 Agent 也可以组合使用。[16]

控制用量的实用办法:把来源、时间范围、篇数和输出格式一次说清;只提供相关资料;约定停止条件;需要改哪一处就指出哪一处。涉及关键证据时,应保留必要核查,不能只追求便宜。

06医生按场景选择工具

可以从一个通用助手加一个专用工具开始。先看它是否减少了你的查找、整理和返工时间,再决定是否订阅更多产品。

任务

可优先试用

给它的要求与人工核查点

概念学习                    科普与宣教

DeepSeek、豆包、千问、元宝、文心、ChatGPT、Claude 等。

说清受众和原始资料;核对医学事实、数字、禁忌与就医提示。

读已有论文                    比较指南

Kimi、Claude、ChatGPT;NotebookLM / Gemini Notebook。

要求页码、表号或原文位置;检查是否真的读到全文、补充材料与扫描表格。

找最新文献                    追踪研究线索

Perplexity、Elicit、Consensus,或 ChatGPT、Gemini、Kimi 的深度研究。

限定学会、期刊、PubMed 和注册平台等来源;回到原文核对,正式综述另按规范开展。

教学 PPT                    会议汇报

ChatGPT Work、Kimi、Claude 任务能力、Manus、Microsoft 365 文件 Agent。

先确认内容和证据,再排版;要求可编辑文件,图表标来源。

科研数据                    代码与小工具

文件分析工具;复杂或重复代码任务可用 Codex、Claude Code。

先明确统计方案、变量与缺失值规则;保留代码,复核方法和结果。

长期重复任务                    科室知识助手

扣子、Dify、OpenClaw,或现成产品的定时功能。

明确更新责任、访问权限、用量与失败处理;由技术人员协助配置和维护。

一条可以直接改着用的指令

请仅依据我上传的公开指南和论文,整理供住院医师学习的证据表。列出年份、人群、干预、主要终点和局限,每项关键结论标注页码或表号;缺失信息写“未报告”。先生成证据表,等我确认后再制作 10 页可编辑 PPT,不额外扩展检索。

涉及患者和诊疗,使用医院批准的系统与数据处理方式,不要直接上传可识别患者信息,也不要让通用 AI 独立决定诊断、处方或医嘱。引用、剂量、单位和适用人群,都应回到原始资料核对。[17]

AI 可以替你承担一部分阅读、整理与制作工作。医生需要保留的,是对证据和适用性的判断:这条结论从哪里来,是否适用于当前问题,还有哪些不确定。

07资料来源

产品与能力依据官方文档整理;链接可点击。技术原理另参考厂商工程文档与人工智能教材。

1. DeepSeek:产品官网

2. 豆包:桌面客户端与办公能力

3. Kimi:深度研究与多格式交付

4. 千问:产品官网

5. OpenAI:ChatGPT Work 与 Codex 的官方术语定义

6. Anthropic:Claude Cowork and chat are one Claude

7. Google:Use Deep Research in Gemini Apps

8. Google:Use chat in Gemini Notebook(原 NotebookLM 帮助页)

9. Perplexity:What is Pro Search?

10. Manus:Chat mode 与 Agent mode 的区别

11. OpenAI:Code generation / Codex

12. Anthropic:Claude Code overview

13. OpenClaw:What is OpenClaw?

14. 扣子:产品与智能体开发平台

15. Dify:平台、工作流与部署说明

16. Anthropic:Building effective agents

17. WHO:大模型的医疗应用、伦理与治理风险,2024

18. OpenAI:Deep research in ChatGPT

19. 腾讯:元宝官方产品介绍

20. 百度:文心助手与文心 App 官方介绍

21. 智谱:清言浏览器助手功能

22. 讯飞:星火助手与文档问答入口

23. Microsoft:Microsoft 365 Copilot 产品与能力

24. xAI:Grok 的 Web Search 与 X Search 工具

25. Elicit:检索、筛选与数据提取工作流

26. Consensus:How Consensus Works

27. 即梦:图片与视频创作能力

28. Midjourney:Getting Started Guide

29. OpenAI:Function calling 与工具 token 用量

30. OpenAI:Reasoning models 与推理 token

31. OpenAI:Prompt caching 与缓存计费

32. Anthropic:How we built our multi-agent research system

33. Russell 与 Norvig:Artificial Intelligence A Modern Approach,第 2 章

34. Consensus:Research Agent

35. Microsoft:Word、Excel 与 PowerPoint Agents

36. Anthropic:Claude Models overview

37. Dify:Agent 节点的模型配置要求

相关学习资料