夜雨聆风学习资料网

ARTICLE · 1110189

怎样把一句工作要求变成AI真正能执行的任务?

怎样把一句工作要求变成AI真正能执行的任务?

QUOTE

不要先问 Prompt 怎么写,先问这项工作到底怎样才算完成。

本栏目:把agent搭起来

上一篇,我们把三个经常混在一起的概念拆开了:

Prompt、Workflow、Agent。

简单来说:

Prompt解决一个任务。 Workflow解决一套流程。 Agent解决一个需要动态决策的目标。

但不管最后用哪一种,有件事都绕不过去:

你到底要让AI干什么?

这句话看起来很简单。

实际上,我觉得很多AI任务从第一步就已经出了问题。

比如我们经常会对AI说:

帮我分析一下客户。

帮我研究一下竞争对手。

帮我看看这个产品有什么问题。

帮我写一个营销方案。

人听起来似乎都能明白,可是如果真的准备把这些任务交给一个Agent长期执行,这些要求其实都太模糊了。

所以今天先不搭Agent,我们先练一个可能比搭Agent更重要的能力:

把一句“人话”,变成AI真正可以执行的任务。

本文看点

01

模糊要求为什么不够

02

AI 任务卡的五个要素

03

怎样判断任务真的完成

01

先看一句非常常见的工作要求

假设老板告诉你:帮我研究一下竞争对手。

如果这是交给一个有经验的员工,他可能会继续问:

研究谁?

研究什么?

为了什么决策?

看产品还是价格?

看国内还是国外?

最后要给我什么?

什么时候要?

但如果我们直接把这句话扔给AI:帮我研究一下竞争对手。

AI通常也会给我们一个答案。

而且很可能写得挺像那么回事。

问题恰恰就在这里。

AI有答案,不代表任务完成了

因为我们甚至还没有定义:   

什么叫“研究完成”?

02

先让AI执行这个模糊任务看看

比如我们经营一家女性服装品牌。

直接问AI:帮我研究一下我们的竞争对手。

AI可能回答:

市场竞争激烈;

消费者越来越重视品质;

社交媒体营销很重要;

建议加强品牌差异化;

可以关注价格、产品和渠道。

这些话可能都没错。

但老板看完以后很可能还是不知道:所以我下一步该干什么?

问题不是AI不会写。

问题在于:

我们没有给它一个真正的任务

03

什么才算一个“可以执行的任务”?

我现在习惯把一个AI任务至少拆成5部分:

Task:任务是什么?

Input:它可以使用什么输入?

Output:最后必须交付什么?

Constraint:哪些事情不能做?

Success Criteria:什么情况才算完成得好?

可以记成:

...text

Task

+

Input

+

Output

+

Constraint

+

Success Criteria

这5个东西一旦清楚:

一句模糊要求才开始变成真正的:

AI任务

04

第一个:Task——到底要完成什么?

还是:研究竞争对手。

这不是一个足够好的Task。

因为“研究”太宽了。

我们继续往下问:研究完以后,我准备拿这个结果干什么?

假设答案是:我要决定自己产品下一季度应该重点优化哪些功能。

那任务就可以改成:

分析5个主要竞争产品的核心功能、价格和用户评价,找出它们共同做得好的地方以及用户最不满意的问题,为下一季度产品功能规划提供依据。

是不是一下清楚很多?

Task最重要的不是写得长。

而是回答:

这个任务最终要帮助谁做什么决定?

例如:

差的任务:分析客户反馈。

更好的任务:从最近100条客户反馈中找出出现频率最高、影响核心体验的5个问题,帮助产品经理确定下一版本优先级。

差的任务:做市场研究。

更好的任务:分析当前国内5个主要竞品的定价方式,帮助我们确定新产品的首发价格区间。

目标不同:

Agent的工作方式也会完全不同。

05

第二个:Input——AI到底允许使用什么?

这个问题经常被忽略。

比如我们说:分析用户投诉。

那么:

用户投诉在哪里?

100条还是10000条?

Excel?

邮件?

聊天记录?

是不是可以搜索互联网?

能不能读取公司历史资料?

这些都属于:

Input

还是竞品研究的例子。

我们可以规定:

输入包括: 1. 5个指定竞争对手名称; 2. 官方网站; 3. 产品价格页; 4. 最近一年公开用户评价; 5. 我们自己的产品功能清单。

这时候AI已经知道:我的“原料”是什么。

06

为什么Input特别重要?

因为如果不规定Input:

AI很容易自己补东西。

比如你问:这个品牌消费者最不满意什么?

AI可能根据:

训练数据。

网络印象。

常见行业问题。

甚至自己的推断。

给你一份看起来很合理的答案。

但是在真实工作中,我们真正想知道的是:你的判断来自哪里?

所以Input其实还隐含了一个非常重要的概念:

证据边界

例如可以规定:

「用户满意度判断只能来自提供的用户评价,不允许根据品牌知名度自行推断。」

这句话就已经开始提高任务可靠性了。

07

第三个:Output——最后到底要给我什么?

这一点对Agent尤其重要。

很多人给AI布置任务的时候只说:帮我分析一下。

但没有说:最后交什么。

于是AI可能给:一篇长文章。

也可能给:几个Bullet Point。

还可能:写一份3000字报告。

人就只能再说:帮我整理一下。

如果这是Agent系统,这种不确定性会非常麻烦。

08

把Output提前定义好

例如竞品研究要求最后必须输出:

表1|竞品基本情况

竞品
定位
核心用户
价格

表2|功能比较

功能
我方
A
B
C
D
E

表3|用户主要不满

问题
出现次数
对应评价
严重程度

最后再给:3个最值得关注的竞争机会。

这时候:AI不只是知道“要分析”。

还知道:

最终要交什么作业

09

Output最好尽量结构化

这也是以后做Workflow和Agent很重要的一点。

例如:

...text

competitor_name

positioning

price

strengths

weaknesses

evidence

为什么结构化重要?

因为下一步可能还有别的系统要使用这个结果。

比如:

...text

Research Agent

↓

结构化竞品数据

↓

Analysis Agent

↓

机会判断

↓

Report Agent

↓

生成报告

如果第一步输出完全自由:

第二步就很难稳定处理。

所以从这一篇开始,可以逐渐建立一个认知:

给人看的答案可以很漂亮,给系统使用的答案最好很结构化。

10

第四个:Constraint——哪些事情不能做?

这是很多Prompt里容易遗漏的。

任务不仅需要告诉AI:做什么。

还要告诉它:

不要做什么

比如竞品研究:

不允许猜测无法确认的价格。

没有来源的数据标记“无法确认”。

不得用两年前的信息冒充当前信息。

用户评价只统计给定时间范围。

不要因为单条评价就得出整体结论。

这些都属于:

Constraint

11

为什么Agent比普通聊天更需要Constraint?

因为普通聊天中:

AI回答不好,我们可以重新问一次。

但是Agent开始拥有:

工具。

权限。

自动执行。

甚至可以修改外部系统。

这时候:不要做什么

和:做什么

一样重要。

比如一个客服Agent:

可以:查询退款政策。

但不一定可以:自动退款。

可以:起草回复。

但不能:擅自承诺赔偿。

所以Constraint其实是在定义:

Agent的工作边界

12

第五个:Success Criteria——怎样才算做对了?

这是我认为最重要、也最容易被忽略的一项。

还是竞品研究。

Agent最后给你一份:

20页PPT。

图很好看。

分析也很多。

是不是代表任务完成得好?

不知道。

因为我们没有标准。

所以开始之前必须问:我准备怎么判断它做得好不好?

13

给竞品研究建立成功标准

例如:

1. 覆盖度

5个指定竞品必须全部研究。

2. 数据准确度

价格必须来自官方页面或者可靠来源。

3. 证据完整度

关键判断必须附来源。

4. 时间有效性

使用最近12个月内的信息。

5. 输出完整度

规定的3张表不能缺失。

6. 决策价值

最终必须给出3个可以供产品团队进一步讨论的机会点。

这时候:

我们第一次拥有了:

“怎样知道AI做对了”的标准

而不是:看上去挺不错。

14

现在把原来的那句话重新写一次

最开始我们只有:帮我研究一下竞争对手。

现在经过5步以后,它变成:

Task 分析5个指定竞品的核心功能、价格和用户评价,找出共同优势、主要用户痛点以及可能的产品机会,为下一季度功能规划提供参考。 

Input 使用指定5个竞品的官方网站、公开价格页以及最近12个月公开用户评价;同时使用我方产品功能清单作为对照。 

Output 输出竞品基础表、功能对比表、用户痛点表,并总结3个值得产品团队进一步验证的机会。 

Constraint 不得猜测无法确认的数据;关键事实必须附来源;超过12个月的数据不能作为当前状态依据;单条评价不能直接代表整体用户。 

Success Criteria 5个竞品全部覆盖;关键价格可核验;所有主要结论有证据;规定表格完整;至少提出3个有证据支持的机会。

你会发现:

这已经不再像:一句Prompt。

更像:

一份给AI员工的任务书

15

这其实就是Agent搭建真正开始的地方

很多人会觉得:搭Agent是从选平台开始。

比如:

Dify。

n8n。

Coze。

OpenAI Agents。

或者其他Agent框架。

但我现在越来越觉得:

真正的第一步不是选工具

而是:先把任务设计清楚。

因为如果连:

Task是什么?

Input是什么?

Output是什么?

Success Criteria是什么?

都说不清楚。

换再强的Agent平台:

也只是把一个模糊任务自动化而已。

甚至可能:

自动化地犯错

16

再看几个“人话 → AI任务”的例子

例1

原话:

帮我分析客户投诉。

改成:

Task:把最近一个月的200条投诉分成主要问题类别,并找出最应该优先处理的5个问题。

Input:200条投诉记录。

Output:分类结果、数量、代表案例、Top 5。

Constraint:一条投诉可有次级标签,但只能有一个主标签;无法判断必须标记。

Success Criteria:人工随机抽查30条,分类结果达到事先约定的可接受标准。

例2

原话:帮我处理会议。

改成:

Task:把60分钟会议记录转成真正可执行的行动清单。

Input:会议转录文本。

Output:

...text

任务

负责人

截止日期

依赖项

待确认事项

Constraint:

会议中没有明确负责人或日期时不能自己编。

Success Criteria:所有明确行动项都被提取,同时不得制造会议中不存在的任务。

例3

原话:帮我回复客户。

改成:

Task:根据客户问题、订单状态和售后政策生成客服回复草稿。

Input:客户消息 + 订单信息 + 售后政策。

Output:问题判断 + 建议处理方式 + 回复草稿。

Constraint:不能自行承诺政策之外的退款或赔偿。

Success Criteria:事实正确、政策正确、没有越权承诺,需要人工审批的问题必须明确标记。

是不是越来越像真正的工作任务了?

17

其实很多Agent失败,在开始运行前就已经注定了

我们以后做实验时,很可能会看到各种问题:

Agent理解错任务。

Agent给出了不需要的东西。

Agent漏了关键步骤。

Agent调用错误工具。

Agent自信地完成了一个根本不是我们想要的任务。

有时我们会怪:模型不够聪明。

但真正的原因可能只是:

人没有把工作定义清楚

所以以后碰到Agent失败,我建议先不要马上:

换模型。

加Prompt。

增加Agent。

先回头检查五个问题:

...text

Task清楚吗?

Input清楚吗?

Output清楚吗?

Constraint清楚吗?

Success Criteria清楚吗?

很多问题可能就在这里。

18

我们把它做成一张“AI任务卡”

以后《AI真实任务解析》的每个实验,都可以先填写这张卡。

AI真实任务卡

Task|任务

它到底要完成什么?

Input|输入

它能使用哪些资料和数据?

Output|输出

最后必须交付什么?

Constraint|约束

有哪些规则和边界不能突破?

Success Criteria|成功标准

怎样判断它真的完成了任务?

以后你甚至可以把这张:

AI真实任务卡

做成这个账号的固定视觉资产。

和:

AI真实任务成绩单

配套。

实验之前:填任务卡。

实验以后:出成绩单。

一前一后。

19

今天给自己做一个小练习

找一项你最近真的想让AI完成的工作。

不要马上问AI。

先把下面5句话写完整:

1.我真正想让AI完成的是:

_____________

2.我会给它这些资料:

_____________

3.最后我希望收到:

_____________

4.它绝对不能:

_____________

5.我会用下面的方法判断它做得好不好:

_____________

如果这5句话都能写清楚:

你其实已经迈过了搭Agent过程中一个非常重要的门槛:

从“我想让AI帮忙”

变成:

“我知道怎样给AI布置工作”

20

今天真正应该带走的不是Prompt模板

很多人在学习AI的时候特别喜欢收藏Prompt。

我以前也很容易把重点放在:

「这句话应该怎么写?」

但现在我觉得更重要的是:

先学会定义任务

一个非常漂亮的Prompt:

如果任务本身模糊,

结果仍然可能不好。

而一个定义非常清楚的任务:

哪怕Prompt写得朴素,

AI往往也能做得不错。

所以今天最重要的一句话是:

不要先问“Prompt怎么写”,先问“这项工作到底怎样才算完成”。

21

下一篇:AI做完了,为什么还不能算任务完成?

现在我们已经把:

Task,Input,Output,Constraint,Success Criteria。

都定义出来了。

理论上AI已经知道:自己该干什么。

但新的问题马上来了。

假如AI告诉我们:任务已经完成。

我们到底凭什么相信?

特别是:它给了一个数字。

引用了一段资料。

或者做出了一个判断。

这些东西:

真的对吗?

所以下一篇我们会进入一个非常重要的能力:

Verification

也就是:AI做完不等于任务完成,必须想办法验证它。

而这恰恰是一个真正能工作的Agent,和一个“看起来很聪明的AI”之间的重要区别。

我是丙海,拿一个现实世界里的真实任务,让AI做一遍,然后解析结果。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

相关学习资料