ARTICLE · 1031684
AI 辅助工作入门 基本概念(培训讲义)
壹
当前情况
(一)用的人很多,做成的事很少
三项调研,指向同一个反差
78.2% 的职场人每周借助 AI 开展工作 | 95% 的企业级生成式 AI 试点没有可以衡量的回报 | 17→42% 放弃大部分 AI 项目的企业比例,一年之内的变化 |
这里说的生成式 AI,指能自动生成文字、图片、代码这类内容的 AI。三组数据的样本范围都不等同于使用单位,直接套用并不合适,但它们指向同一个现象:员工层面的使用已经普及,单位层面的落地多数没有做成。这是判断,依据是使用率与项目回报率之间的反差。
失败集中在四个环节:数据基础不成熟、试点没有嵌入业务流程、没有人对结果负责、成功没有用数字来定义。这四条里有三条属于管理问题。
(二)算力资源也有闲置
据 2026 年 7 月的公开报道,近 150个智算中心的使用率约为 30%,这个水平已经持续约一年。智算中心指专门提供 AI 计算能力的机房设施。一方面资源紧张,另一方面大量闲置,原因不在总量不够,在调度不够合理。分配之前先做盘点,盘点本身就是治理的第一步。
(三)为什么先讲这几个问题
上面两个情况里的多数问题,技术部门解决不了。流程怎么定、谁对结果负责、指标怎么设,这三件事只有单位层面才定得下来。技术部门能回答「能不能做」,回答不了「该不该做、出了问题谁负责」。
贰
AI 的几个特点
要弄清楚怎么用才有效,先要弄清楚它是什么。下面提到它的时候,有时说「AI」,有时说「模型」,指的是同一件事,只是说法不同。这几点不需要懂技术,但它们决定了后面的做法。
(一)一次能处理的量有限
它一次能处理的文字量是有限的,超出这个范围的内容它看不到。
在这个范围以内,它也不是平均地看每一条内容,而是有选择地分配关注。已有的测试显示,内容放在开头或者结尾,它记得比较准;放在中间,容易被忽略。而且内容越长,整体表现越差,即使所有内容都在它能处理的范围内。所以给它准备材料,不是越多越好。
补充:注意力机制:权重归一化带来的稀释效应
注意力机制(Attention)是当前主流模型的核心结构。做法是:把每个字转换成一串数字,计算每个字与其他所有字的相关程度,得到一组权重,然后按权重把其他字的信息加权汇总到当前字上。每一层都做一遍,层层叠加。
关键在于这组权重是归一化的,用 softmax 计算,加起来等于一。注意力是一份固定额度,序列越长,分到每个位置上的就越少。前面说的位置效应和长度效应,机制上的原因就在这里。
另一个推论是,注意力计算的量随序列长度平方增长,长度翻倍,计算量约变四倍。这是处理慢、费用高的主要原因之一,也是处理范围不能无限放大的技术约束。
(二)没有记忆,不会积累
一次对话结束以后,这次对话里的内容不会保留下来。它也不会从过去的使用中积累经验,用得再多,能力也不会提高。所以单位的规章制度、统计口径、历史数据,它都不知道,每次要用都要重新提供给它。
目前各厂商的做法都一样,只能在使用的时候把需要的内容重新提供一遍。有人尝试让它自己记住,结果会偏差、会过时,各厂商的官方说明都不建议这样做。
补充:上下文窗口:容量、平方复杂度与硬上限
模型单次计算能容纳的文字量有硬上限,这个上限叫上下文窗口(Context Window),通常按 token 计。token 是文本切分的基本单位,一个汉字大致对应一到两个 token。
上限由两层原因决定。一是注意力的计算量随长度平方增长,显存和时延承受不住。二是模型在预训练(Pre-training)时只见过特定长度的文本,超出这个长度以后表现明显下降。
还要分清一件事,处理范围是容量,注意力是分配。标称的数字可以很大,实际被用上的有效部分要小得多,这是「标称一百万、实际十几万」的由来。
(三)按概率生成,不会说「我不知道」
它生成文字的方式,是按概率逐字推测下一个字最可能是什么,训练的目标是让文字读起来像人写的,没有一条要求是必须真实。
2026 年一项独立评测显示,五个最强模型给出错误内容的概率在 3% 至 19%之间,也就是每回答一百次,有三到十九次是错的。更值得注意的是,推理能力更强的模型不一定更准确,同一家公司后来推出的模型,错误率反而更高,最高的一款接近一半。开发这类模型的美国 OpenAI 公司承认,这是它生成文字的方式决定的,无法通过技术进步消除。
遇到它不知道的事情,它不会说明自己不知道,而是给出一段看起来很合理的答案。这个问题在数字和引文上最需要警惕,因为这两类内容最容易让人直接采信。还有两点是同一个原因造成的。一是它写出来的文字会趋向平均,这就是后面要说的文字有「机器味」的原因。二是它不按规则计算,而是按概率推测,所以数字计算容易出错,涉及计算要交给专门的工具,或者由人核算。
补充:概率采样与幻觉:为什么错的内容不可避免
模型每生成一个 token,都会在整个词表上算出一个概率分布,再按分布抽取一个。抽取的随机程度由温度参数(temperature)控制,温度越高越随机。整段文字就是这样一个一个抽出来的,这个过程叫概率采样(Sampling)。
训练时优化的目标,是让生成的文字最像人写的,没有任何一项训练目标是「这句话必须是真的」。模型学到的是语言和知识的统计相关性,不是一份可以查证的事实清单。
它给出的这类错误内容,行业里称为幻觉(Hallucination)。所以错误无法消除,与模型强弱无关。这也能说明,推理步骤多不等于结论可靠,链条越长,中间任何一步的偏差都会往下传递。
(四)不能承担责任
任务可以交给它做,但一旦出错,承担责任的是单位里的人,不是它。它不是能够承担责任的主体。这一点决定了后面授权安排的上限。
(五)合起来说明什么
合起来看,它能力很强,但对单位的规矩一无所知,而且在不知道的时候会编。
由此可以得出一个基本判断:同样是这样一套 AI,交给不同的人,配上不同的资料和规则,用出来的结果差别很大。模型本身只是其中一部分,围绕它准备的东西,包括提供什么资料、定下什么规则、允许它做到哪一步,共同决定了最终效果。
所以这件事做得好不好,关键不在于选择多强的模型,而在于这些准备做得怎么样。通用的方法只有与具体实际结合起来才能管用,这层意思讲的就是理论联系实际。后面讲的三个条件,正是它的具体展开。
补充:框架:把概率性能力嵌进确定性流程
模型本身只做一件事,根据已有内容预测下一个 token。要让它完成一项实际工作,需要另一套东西补上它做不到的部分:哪些内容进入窗口、允许调用哪些工具、一次任务走几步、每步结果怎么校验、出错怎么重试、什么条件算完成、操作留不留记录。这一整套行业里叫框架(Harness)。业内有一个公式,Model + Harness = Agent,模型加上框架才等于能干活的应用。
它的本质是把概率性的能力嵌进确定性的流程。模型负责需要判断、允许多种答案的环节;框架负责必须确定、只能有一个答案的环节,比如权限、日志、重试、终止条件。把这些交给代码而不是交给模型,可控性就来自这里。
这也是框架里的资料、规则、权限设计只能自己定、省不掉的原因。
叁
它能承担什么工作
在准备条件之前,先要明确哪些工作可以交给它。下面四类与日常工作关系最直接,每一类都分成能做的和不能做的两部分来看。
(一)写材料
•能做的:查阅数据、列出事项、按格式填写、出第一稿。
•不能做的:核对数字、统一口径、判断这份材料里有没有具体情况。
写出来的材料好不好,可以用一个标准来判断,它是拼装出来的还是写出来的。工作总结、汇报、方案属于拼装型,内容由事实和格式决定,靠的是素材和规矩,不是文字水平。所以力气应当花在备好素材、定好规矩上,不必在检测文风上投入。
(二)重复性的工作
•能做的:反复出现的工作,把做法写进文件,下次按这个做法自动执行。
•不能做的:需要作出判断的环节。
算得清三笔收益就值得做:省下反复交代的时间;做法固定以后,输出才稳定;把有限的精力从反复交代转到正事上。出现频率低、要求经常变化的工作不必做,维护本身有成本。
补充:技能:把流程固化为可复用的文件包
把一项反复要做的活,连同做法步骤、用到的资料、调用哪些工具、产出要过哪些检查,一起写成一个文件包。系统遇到这类任务时自动加载这份文件,按里面的规定执行。这种做法行业里叫技能(Skill)。
它解决的是模型没有记忆、每次都要重新交代的问题。流程写进文件,内容就固定下来,不因操作人不同而变化。这是把个人经验转成组织资产的一种方式,而且这种资产可以直接搬移,换个单位只要口径一致就能用。
技能和知识库的分工是清楚的。知识库解决「它知道什么」,存的是依据;技能解决「它怎么做」,存的是流程。技能和智能体的区别也清楚:技能的路径预先定好,每一步都写死;智能体处理的是路径不定的活,下一步由模型自己判断。
需要提醒的是,能固化的只有流程,不能固化判断。流程是确定的,可以写死;判断要担责任,只能留在人手里。这是技能设计时最容易出问题的地方。
(三)选择工具
能用的方式是拿实际工作去试。评测排名参考价值有限,因为可以被刷,曾经出现过小模型靠提前接触到测试题就把名次做上去的实例。排名只能作参考,用实际工作试一遍才能判断。
费用方面,单价在下降,但总费用反而上升,因为价格便宜以后用量会大幅增加。有三笔费用容易漏算:一是输出内容变长,二是思考过程也要计费,三是任务失败后系统自动重做,每次重做都计费。
补充:数据污染:评测有效性的前提被破坏
评测用的题库是公开的。模型训练的数据来自大规模网络文本,公开题库很容易被一起抓进去。模型在训练阶段就见过题目和答案,测试时等于开卷答题,成绩自然偏高。这种情况行业里叫数据污染(Data Contamination)。
失真方向并不固定:参数量小的模型如果训练数据里恰好包含题库,反而可能排在前面。
更根本的问题在于,评测有效的前提是测试内容模型没学过,而这一点在训练数据不公开的情况下无法验证。所以榜单只能作参考。
(四)任务委派
•能做的:模型、工具和连续执行能力三样齐备的系统,可以自己把一项完整任务做完,中间不需要人一步步下指令。
•不能做的:签字。
交出去之前先想清楚怎么验收。风险按两点判断,出了问题多难发现、代价多大。如果每一步的把握是九成,连续做十步都不出错的把握不到四成。
验收可以按规则分级。常规问题由系统按规则检查,规则之外的问题由人判断;关键错误不允许出现,一般错误设上限,按类别分别计分。AI 生成的材料里最危险的是引文和数字,因为这两类内容看起来最像真的。
还有一点要提前考虑。美国麻省理工学院的一项实验显示,用 AI 写作的那一组脑部连接最弱;法航 447 空难(388 人)中,机组长期依赖自动驾驶,手动飞行能力逐渐退化。电网一直用操作票、唱票复诵、仿真演练来保持人员能力。引入 AI 以后,减少的应当是重复劳动,不能连基本操作能力一并丢掉。
补充:智能体:自主循环与错误累积
模型能回答问题,但不会自己动手做事。给它配上工具,再让它能够自己判断下一步做什么、做完一步接着判断下一步,直到任务完成,这样一套系统行业里叫智能体(Agent)。判断标准是三样齐备:模型(Model)、工具(Tool)、自主循环(Agent Loop)。
它和传统程序的差别在路径。传统程序把每一步写死,遇到没预料的情况就停;智能体的下一步由模型判断,所以能处理路径不定的活。代价是这个判断本身也是概率性的。
整体可靠性是各步把握相乘的结果,而不是相加。步骤越多,下降越快。这是把一条长流程交给它之前必须评估的。
四类工作合起来看,有一条分界线:需要作判断、需要担责任的环节,都留在人这一边;把这些环节之外的部分交出去,效率才提得起来。
肆
需要事先准备的三个条件
上面四类工作要做成,先把三个条件准备好。
(一)把依据整理好
1. 依据现在存在哪里
单位的规章制度、统计口径、历史数据、经验做法,目前主要存在两个地方。
一是老同志的脑子里。这部分最完整,但会随着人员调动和退休流失。
二是文件和资料里。这部分数量大,但有两个问题。它一次能读的文字量有限,材料多了中间部分读不全;材料格式不统一,同一个问题有多个说法,它读不准。
2. 所以要建知识库
把这些依据整理成它能直接使用的形式,放在一个固定的位置,供每次使用的时候取用。这件事就是知识库的由来。它要解决的是依据取用问题,不是资料存放问题。
补充:知识库与提示词:指令类内容与资料类内容
使用时送进模型处理范围的整段内容,包括系统给定的要求(System Prompt)、加载进来的资料(Context)、以及操作人的提问(User Query),合起来构成这一次的完整输入。这段输入行业里叫提示词(Prompt)。
知识库里的内容按作用分两类。一类是指令性的,规定它该怎么作答,比如必须引用条文原文、数字不得重算、口径不一致要并列列出、输出要过哪些检查。这类内容本身就是提示词,只是提前写好、存在库里,用的时候调出来。另一类是资料性的,比如规程原文、统计数据、历史案例。这类是依据,作用是让它读到事实,不规定它怎么做。
所以知识库可以看作提示词的一个来源,但整个库不都是提示词。这个区分有实际意义,因为两类内容的维护要求不同:指令类要精炼、明确、可判分,写含糊等于没写;资料类要齐全、标注来源、标注版本,缺了它就会编。
3. 把文件集中到一个文件夹,不等于建好了知识库
区别在整理的时间和方式。
| 入库时就整理 | ||
| 提问时现找 |
补充:检索增强生成:加工时机决定规则执行力
提问时临时查找、当场转述,这套做法行业里叫检索增强生成(Retrieval-Augmented Generation,缩写 RAG)。流程是:文档先切片(Chunking),建成可检索的索引;提问时用问题去检索,取回最相关的若干片段;把这些片段和问题一起送进模型,由模型组织成回答。
它的优点是文件不必事先加工,随收随用,容量可以做得很大。短处有三个。一是切片会切断上下文,一段话被切开以后,实体与属性、条件的对应关系容易错配,这是这类系统张冠李戴的主要原因。二是检索本身会漏,该找的没找出来,模型就只能靠参数补,于是开始编。三是规则来不及生效,因为回答是在检索之后现场组织的,写好的规则没有在检索环节起作用的位置。
4. 资料要分层放,用的时候按需取
前面讲过,它一次能处理的量有限,内容越多越容易漏。所以知识库不能只是把文件堆在一起,要分层组织。先做一份索引,写清楚有哪些内容、各自放在哪里。使用的时候先看索引,判断这次需要哪几份,再把这几份调出来。这样每次进去的内容都是当前用得上的,不会因为材料太多而被忽略。
补充:渐进式披露:把定位和加载分成两步
只呈现当前需要的内容,需要更多的时候再往下展开一层,这种做法来自信息设计领域,叫渐进式披露(Progressive Disclosure)。
用在知识库上通常分三层:第一层是索引,写有什么、在哪里、什么条件下用;第二层是摘要,说明这份资料讲什么、关键结论是什么;第三层才是全文。
它有效的原因直接对应注意力机制:进入窗口的位置越少,每一个分到的关注越多。同时也对应容量的约束,进去的内容少,留给真正干活的空间就大。
本质是把「找」和「读」分成两步,先用很小的成本定位,再按实际需要加载。索引的质量因此变得关键。
5. 三条具体原则
整理的时候就要按用途加工好,不当场加工的等于没有存。这里说的加工,指把文件里的内容整理成可以直接取用的形式,比如把一份规程里的关键要求单独列出来,而不是只把文件原样放进去。按用途决定存什么,查答案就存知识,写材料就存模板。
6. 投入要有重点
几百份资料不可能用同样的深度整理,投入要放在经常使用的内容上。检索三次以上的做深一层整理,写材料用过两次的整理成模板,反复用于决策的整理成对照表,长期没有人用的只保留原文。
7. 建起来还要养下去
知识会过期。过期不是变旧,是变错,旧的规定混进现行版本,会让人拿旧规定当新规定用。没有维护的库,18 至 24 个月之后就会失去可信度。
清理分三步,每一步都可以恢复。第一步列出重复的、长期没有人使用的、已经过期的清单。第二步把长期没有人使用的降为归档,不再进入正常检索。第三步把同一内容有多个版本的并成一个,早期版本里还有效的内容先提出来,再归档。检查重复、核对过期、统计使用次数这些工作可以让它做,但这个库对工作还有没有用,它判断不了。所以检查由它发起,清单由它整理,怎么处理由人决定。
用得越多的内容,整理得越深;使用中纠正过的地方,记录回库里,下次按纠正后的做法执行。这是让库越用越准的办法。
这几步做到位,说到底是调查研究的要求。调查研究讲究去粗取精、去伪存真、由此及彼、由表及里,整理依据也是这四件事:挑出关键要求,分清哪一版有效,建立材料之间的联系,提炼出可以直接取用的结论。
依据没有整清楚,后面定的规则再严,它说出来的仍然是没有根据的话。这也是三个条件里,把依据整理排在最前面的原因。
(二)把使用规则定下来
规则要写成可以检查的形式。它的行为靠规则约束,不能靠它自己把握。
| 数字原样保留 | ||
| 清单全量核对 | ||
| 说法不一致的并列列出 |
换成工作中熟悉的说法,就是报送之前做三项核对:数字回到原表核对、条目与总数核对、说法不一致的并列上报。
(三)明确哪些环节必须由人确认
把授权分成三级,不是一次放开。
顺序不宜跳过。技术成熟程度决定能不能做,责任边界决定该不该做。越过一级,就意味着一部分责任没有人承担。模型可以迭代,治理不能缺位;治理能力不到,再好的模型也只能停在试点。
三个条件合起来是一件事:把准备工作做在前面,效果就不再取决于用的是哪一家的模型。
伍
可以先做哪些
前面讲的是推进这项工作的准备条件,下面看具体可以从哪里入手。同一批工作可以从两个角度看:按技术类型分是五条路径,按嵌入工作的深度分是四个层次。
(一)五条技术路径和各自的限制
AI 在电网已经进入实际使用阶段,按技术类型分五条,分别是看、读、算、断、做,其中「断」指辅助分析判断。逐条看,每条都有自己的限制,限制在哪里,决定了它当前能干到哪一步。
| 看 | ||
| 读 | ||
| 算 | ||
| 断 | ||
| 做 |
(二)工作嵌入的四个层次
| 一 | ||
| 二 | ||
| 三 | ||
| 四 |
建议从第一个层次起步。多数单位的数据基础还没有建好,直接上第三、第四个层次多半会失败。
(三)起步四步
第一步选场景,选发生频率高、规则明确、数据齐备、风险低的。第二步建数据基础,统一口径、标注来源、明确更新方式。第三步在风险最高的地方设检查节点,比如停电范围核定、安全措施确认、对外停电承诺。第四步用流程指标来评价,看处理时长、解决率、错误率。
(四)一个完整的例子
把上面这些放到一件事上,顺序是这样的。
假设要做一个安全规程的问答功能。第一步,把规程文件找齐,先确认哪一版是现行有效的,作废的版本挑出去,不能让新旧混在一起。第二步,把规程里的关键要求整理出来,做成一份索引,标明每条要求在哪一页、适用于什么条件。第三步,定下回答的规则:必须给出条文原文,不能自己概括;涉及的条目数和原文件对得上;两份文件说法不一致时并列列出,由人判断。第四步,先只让它回答问题,答案由提问的人核对,试运行一段时间。第五步,把答错的地方记下来,回到第二步补充。
这件事做顺了,再考虑让它自己判断哪些条款适用。顺序不宜颠倒,先建立依据,再定规则,最后才谈放权。
(五)配套的基础工作三件
还有三件事属于基础性的配套安排,做不好会限制后面的推进。第一件是管理模型的系统。设计上做到模型可以更换、功能组件可以拆分,模型更新换代的时候就不用把整套推倒重来,每一步操作都有记录可以回看。代价也要说明,在内网重新搭建比较费力,跟着外部更新走也比较费劲,所以有一条原则,改进尽量做在功能组件这一层,不动最核心的部分。
第二件是可安装功能的审核。反复要用的做法可以做成技能,装上来就能用。外部经验是,这类技能中约 36%存在诱导系统执行不该执行指令的风险,伪装成效率工具的可疑技能累计安装超过 170 万次。所以做法是一放一收,开发这一头放开,发布这一头集中审核。还要分清哪些功能可以共用,哪些必须自己做,判断标准是换个单位还能不能用。
补充:提示注入:模型缺少信任边界
在模型看到的文本里藏一段指令,让它做出使用者并没有要求它做的事,这种情况叫提示注入(Prompt Injection)。
它之所以可能,是因为模型处理输入时不区分「指令」和「资料」。无论是操作人写的,还是从网页、文档、技能包里读进来的,进入窗口以后都是同一段文本,都会被当作理解对象,也都可能被当作要求来执行。模型没有「这个是外部数据、那个是内部命令」的信任边界。
防守的难点在于,靠关键词过滤挡不住,同一段意思可以换很多种写法,也可以编码、拆分、夹杂在正常内容里。可行的办法是结构性的:把权限限定在完成这件事所必需的范围,关键操作由人确认,外部来的技能和资料集中审核。
第三件是算力调配。除了先做盘点,办法还有集中,把分散的算力统一安排,使用率可以从 30% 提到 70%以上。不同类型的任务分开管,与业务现场结合的放在现场处理,响应更快、占用带宽更少,成批处理的走预算管理,平台上的通用调用按配额排队。
(六)这套做法的适用条件
前提只有两条:有可以整理的口径和文件,有人愿意在整理的时候多花一道工序。它不依赖特定的系统或供应商,换个单位同样适用。这也是它适合先在点上做、再逐步推开的原因。
陆
几点建议
前面提过的三个问题,这里是落点。流程怎么定,谁对结果负责,指标怎么设,归结起来是三句话。
•谁签字。任务可以交给它做,责任不能交给它。系统可以生成无限多的材料,签字的只能是人。
•看什么数。看处理时长、解决率、错误率,不看使用人次。
•从哪一步起。先只提供结果,由人核对;再提供建议,由人决定;最后才是执行操作,由人监护。
三句话要落下去,组织上要有安排:明确一个牵头人,分阶段推进,开展岗位操作培训,把使用情况纳入考核。技术上的准备决定能不能做成,组织安排决定能不能推开。
归结起来是把两条做实:事实要准,责任要清。实事求是讲一切从客观实际出发,这套方法要解决的就是同一件事,让它凭事实说话,判断留给人。
· 完 ·