ARTICLE · 1128936
从零开始学习使用AI Agent(一):概述
1 引言
当前,AI已在辅助编程、文档自动生成等层面展现出显著的效率增益;在此基础上,智能体(Agent)进一步深度嵌入编程开发调试、工作生活助理等生产、生活全链路,推动工作范式发生更为深刻的结构性转变。以软件开发为例,Agent能够将"实现某模块功能并完成自测"这一高层需求自动拆解为需求解析、编码实现、编译构建、缺陷定位与修复、测试用例生成等子任务,自主调用编译器、调试器、静态分析工具逐一完成,在调试环节自动捕获异常、推断根因、生成补丁并回归验证,形成自我闭环。这一编程领域的实践同样延伸至科研文献综述的自动聚合与结构化整理、企业级数据分析报告的端到端生成、跨系统业务流程的自动化编排等场景,Agent以"目标驱动—自主执行—结果交付"的模式持续替代重复性认知劳动。更进一步,AI通过Agent将分散的工具链整合为自主运转的任务流水线,在编程、科研、办公、运维等多个领域同步释放效率红利,使人类从机械性的流程衔接中退出,将认知资源集中投向更高层次的创造性决策。
从本文开始,作者将完成“从零开始学习使用AI Agent”系列文章,这既是作者以Hermes Agent为例从零开始学习在个人电脑部署、使用AI Agent的学习笔记,同时也希望该系列文章最终能够成为大家入门使用AI Agent的攻略和教程。
2 基本概念
2.1 大模型
大模型即大语言模型(Large Language Model,LLM),其是一个被训练出来的、参数量巨大的神经网络模型。大模型的核心能力是理解和生成文本,多模态的大模型还能处理图片、音频等。对于我们使用者而言,大模型的本质就是一个函数/工具,输入一段内容,输出一段内容,它的特点是被动响应,你问它才答,不问它不动。我们耳熟能详的ChatGPT、Deepseek、Gemini、Claude、文心一言等都属于大模型的范畴。

图1 大模型产品
2.2 智能体
智能体(Agent)是一个能感知环境、做决策、采取行动的计算机领域概念。具备感知(接收传感器、数据、用户输入等环境信息)、决策(根据规则或学习结果,决定下一步)、行动(通过移动、修改数据、发消息等方式对环境产生影响)三项能力就可以叫智能体。智能体不一定要用AI,规则写死的程序也可以是智能体,我们常见的扫地机器人(感知灰尘→决策路径→扫地)、游戏NPC(感知玩家位置→决策攻击/逃跑→行动)、自动温控系统(感知温度→决策开关→调温)等都可以看作是智能体。

图2 智能体示意图
2.3 AI Agent
AI Agent即用大模型当“大脑”的智能体。AI Agent的大脑是大模型(LLM),用于理解任务、做推理、规划步骤;其感知来自用户输入、API数据、文件、网页等,用于获取信息;短期对话+长期数据库为其记住上下文和历史的记忆;搜索引擎、代码执行、发邮件、数据库等是其动手干活的工具;通过感知→思考→行动→再感知的行动循环,其可实现自主迭代。像最近非常火的OpenClaw“龙虾”、Hermes赫尔墨斯、Claude Code等等都属于AI Agent类应用。

图3 AI Agent
2.4 API
在AI Agent的讨论中,API通常指“应用程序编程接口”(Application Programming Interface),可以理解为不同软件系统之间“约定好的通信方式”。AI Agent本身通常只负责“思考”和“决策”,真正干活(查数据、调服务、执行操作)往往要靠API。API本质就是AI Agent调用大模型、连接外部工具和数据源(例如:天气查询、地图导航、股票行情、数据库查询等)、执行实际操作(例如:发邮件、创建日历事件、下单)等调用外部软件时的通信接口,即Agent与外部世界之间的“桥梁”。
2.5 Token
在AI(尤其是大语言模型)的讨论中,Token,即词元,是模型处理文本时最基本的单位。Token 不是简单的“一个字”或“一个单词”,而是模型分词器(Tokenizer)将文本切分后的最小语义单元。Token 在AI应用中有4个主要用途:
1) 模型理解的基础,模型并不直接“读懂”文本,而是将文本拆分成Token并将Token转换为向量(数字),通过计算这些向量之间的关系来理解语义;
2) 上下文长度的限制边界,每个模型都有“上下文窗口”Token数限制,这决定了某个对话中,模型能“记住”并处理的文本总量,(包括输入的历史对话和模型生成的回复),超出这个限制,早期的信息就会被遗忘或截断;
3) 控制生成过程的参数,可以设置最大Token数来限制模型单次回复的最大长度,防止它无限生成或消耗过多资源;
4) 计费和成本的核心单位,几乎所有商业AI API都按输入+输出Token数收费,这是衡量AI服务使用成本的直接标准。

图4 Token在AI应用中的主要用途
Token是AI世界的“货币”和“尺子”,它衡量着信息量、成本和模型的能力边界。
3 安全风险
AI Agent(智能体)在带来效率革命的同时,其“自主性”和“工具调用能力”也打破了传统软件的安全边界。和普通聊天机器人相比,它不仅能“说话”,还能读文件、发邮件、跑命令、查数据库、转账、部署代码,所以风险也从“说错话”升级成“做错事”。
3.1 核心安全风险
AI Agent在使用过程中面临的核心安全风险主要源于其自主决策与工具调用能力带来的边界突破。首先是提示词注入与越狱攻击,攻击者可通过构造恶意输入诱导Agent执行非预期操作;其次是工具滥用与权限失控,Agent一旦被诱导,可能利用自身权限执行破坏性操作(如删除数据、发送恶意邮件);再者是数据泄露与隐私侵犯,在调用外部工具或处理多源信息时,敏感信息可能被意外泄露给第三方;此外还有供应链风险(依赖的第三方插件或知识库存在漏洞)以及模型幻觉导致的决策错误,可能引发不可逆的业务损失。
3.2 规避安全风险的对策