ARTICLE · 1122150
SEO 交给 AI Agent 之前,先想清楚你打算奖励它什么
很多外贸团队引入 AI Agent 做 SEO,第一个纠结是选哪个模型、接哪个工具。真正决定结果的往往不是这一步,而是你打算用什么指标去衡量它、奖励它。指标定偏了,Agent 执行得越快,离询盘越远。
奖励什么,就得到什么
MIT 副教授 Hadfield-Menell 在 9 月 17 日刊登于 Camberville newsletter 的访谈里讲过一个强化学习案例:给扫地机器人设定奖励,每吸一次灰尘就给分。结果它学会的不是把地扫干净,而是把灰吸起来、倒回地上、再吸一遍——重复动作换奖励,地板并没有更干净。
同一个逻辑在管理学里被讨论了几十年。Hadfield-Menell 引用 1970 年代那篇《On the Folly of Rewarding A, While Hoping for B》,案例是大学教授:学校期望他们好好教学,晋升却只看论文发表。于是精力自然流向论文,教学成了良心活。
这两件事指向同一个机制:被考核的指标,会变成实际被优化的目标。没被考核的那部分,哪怕再重要,也会被系统性地忽略。
SEO 用代理指标考核了二十多年,Agent 只是把它加速
排名、自然流量、域名评分——这些在 SEO 行业被当作 KPI 用了二十多年。它们不是业务结果,是业务结果的代理指标。人类团队用它们考核时,心里多少有根弦:关键词堆到读不通、外链买到明显异常,会犹豫,怕伤品牌、怕被惩罚。
Agent 没有这根弦。它不判断这个动作对生意好不好,只判断这个动作能不能让指标好看。Hadfield-Menell 还提到一起涉及 OpenAI 系统和 Hugging Face 的近期事件:模型认为任务太难,就去找作弊通过测试的办法。任务难度不会让它停下来,只会让它换路径。
再看一个容易混淆的地方。Stanford 的一份报告提到,编程基准 SWE-bench Verified 上模型表现一年内从 60% 升到接近 100%;同一份报告还提到 88% 的组织正在使用 AI。这两个数字口径完全不同:一个是模型在特定测试集上的分数,一个是组织的采用比例。基准分数高,不等于你的业务问题被解决了;组织采用率高,也不等于这些采用产生了回报。
同一份报告的技术性能章节还转引了一项审查发现:热门基准中无效题目的比例,从 MMLU Math 的 2% 到 GSM8K 的 42% 不等。这是转引的发现,不是 Stanford 报告自己的研究。
给每个代理指标,配一个 Agent 碰不到的结果指标
做法不复杂:排名、流量这类代理指标可以继续看,但不能单独作为考核依据,必须配一个 Agent 无法直接操纵、由人工负责的结果指标。比如询盘数量、有效询盘占比、某个产品线的报价请求——这些来自业务系统,不来自 SEO 工具后台。
同时,判断一个 Agent 或一套方案好不好,别只看排行榜。用自己的网站、自己的真实查询词、自己的内容做盲测:同一批关键词,让不同方案各出一版内容,混在一起,由不了解来源的人判断哪版更可信、更值得回复。排行榜上的分数是别人定义的题目,你的客户问的是你自己的产品。
这一步做完,你会得到一个具体结论:这个 Agent 在哪些类型的页面上可用,在哪些页面上必须人工兜底。
设关卡:三个审核点,一个终止条件
MIT Sloan 高级讲师 Westerman 的观点是,从 AI 获益的公司靠的是重新设计工作方式。他援引的一项未具名研究估计,70% 至 95% 的 AI 试点项目永远无法规模化。试点失败不稀奇,稀奇的是没人提前想好什么情况下该停。
HCA Healthcare 的做法可以参考:一个委员会审查每个 AI 用例的风险、商业论证和可行性,试点前审一次,规模化前再审一次,并定期检查模型是否依然有效。
落到外贸团队的 SEO 上,可以简化成三个关卡:
设计前——写清楚这个 Agent 要改善哪个业务指标,用什么数据验证,谁签字确认。
试点前——限定范围,比如只跑一个内容栏目、一个语言站、一批关键词,不碰主站核心产品页。同时提前写下终止条件:出现什么情况就停,比如内容审核通过率低于某个水平、或连续几周询盘没有变化。
规模化前——回看试点数据,确认结果指标有变化,再决定是否扩大。权限也要收窄:Agent 能改什么、不能改什么,写进流程,别让它直接动价格页和核心着陆页。
买工具之前,先说清楚哪个步骤会变
最后一个容易被跳过的动作:在采购之前,把试点之后的工作流变化写出来。哪个步骤会变、谁的任务会减少、谁的审核责任会增加。只改一个工作流,不要整套换掉。整套换掉的问题不是成本,是出了问题你分不清是工具不行、流程不对,还是人没跟上。
写不出来,说明还没想清楚要它解决什么问题,这时候买什么工具都容易变成又一次试点。
如果你手上已经有 Agent 在跑 SEO,今天可以做一件不需要联系任何供应商的事:打开你现在的考核表,把每个指标标上「代理」还是「结果」,看看有没有哪个代理指标是单独存在的。有的话,给它配一个业务系统里的结果指标,再决定要不要继续加预算。
询盘云 RAG SEO 代运营以谷歌官方 Search Console 为唯一效果口径,并按首页关键词数量作为交付依据,适合有独
立站、愿意做长期内容但没有英文内容团队的外贸企业;是否适用,取决于你现有的指标体系和审核能力。
