这两天,一个挺有意思的话题在 AI 圈里发酵起来了。
一篇主要靠“改 Prompt”来提升模型多样性的论文,被 ICML 2026 接收了。消息传开之后,很多人的第一反应都差不多: 现在连提示词工程都能发顶会了?
这句话听上去像在调侃,但它真正戳中的,其实不是学术圈的笑点,而是很多普通 AI 用户最近都能感受到的一种变化: 会不会用 AI,正在越来越像一种系统能力,而不再只是“会不会提几个指令”。

一篇被 ICML 接收的 Prompt 论文,让很多人第一次认真讨论“提示词到底算不算研究”
这篇引发争议的工作,核心方法并不复杂。它讨论的是大模型里的一个老问题: 模式坍缩。简单说,就是你让不同模型反复生成内容,它们会越来越倾向于给出最像“标准答案”的那一个版本,结果就是看起来稳定,但也越来越同质化。
作者给出的方案很“提示词工程”: 不去改模型参数,不去重训,只在提问时要求模型把多个候选回答和各自概率一起说出来。结果是,内容的多样性明显提升了。
如果只听到这里,很多人会本能地觉得,这不就是把一个小技巧写长了么?

从论文题目本身就能看出来,这项工作的主角并不是新模型,而是一种推理阶段的使用方法
但真正值得看见的,不是“改 Prompt 也能发论文”这件事本身,而是这背后暴露出的研究重心转移。
过去十几年,机器学习的主战场主要在训练侧。谁有更好的算法,谁有更大的模型,谁能把 benchmark 再推高一点,谁就更像站在舞台中央的人。可大模型时代往前走到今天,越来越多关键问题已经不是“模型能不能做”,而是“模型在什么条件下会这样做”“怎样引导它稳定做对”“怎样让它在不重训的情况下表现出更好的行为”。
这时候,提示词就不再只是用户层面的输入框技巧,而开始变成一种观察模型、操纵模型、解释模型的接口。

同一句关于咖啡的笑话请求,几个主流模型却高度趋同,这正是论文想解决的模式坍缩问题
换句话说,今天很多 Prompt,已经不像过去大家理解的那种“写得花一点、骗模型多给点内容”。它更像一种轻量级实验设计。
你给模型什么角色,限制它什么边界,让它暴露什么中间过程,要求它输出几个备选版本,逼它先拆任务再回答,或者让它先对自己的答案打分,这些动作表面上是“写提示词”,本质上却是在定义问题结构。
而一旦问题结构被定义,结果空间就变了。
这也是为什么“AI 提示词堪比论文”这个说法虽然夸张,却不是毫无道理。它真正变贵的,从来不是那一长串文字本身,而是那串文字背后的任务理解、评价标准和实验意识。

这类研究最有意思的地方,是它开始把 Prompt 从经验手感,往可解释的方法论上推进
很多人对 Prompt 的误解,其实都来自一个旧想象: 觉得提示词只是用户和模型聊天时的一点小聪明,谁会写几句模板,谁就多一点效率。
但现在更真实的局面是,Prompt 正在分化成两层东西。
一层是消费级 Prompt,也就是大家熟悉的那些万能模板、角色设定、格式要求、风格模仿。这一层的门槛确实在快速下降,而且越来越容易被产品内置掉。
另一层则是结构级 Prompt。它不只是告诉模型“你要写什么”,而是在安排模型“怎么思考、按什么标准判断、在哪里暴露分歧、如何减少坍缩、怎样提高可靠性”。这一层更接近研究、更接近工程,也更接近真正的竞争力。
所以真正的分水岭,可能不是谁背得出更多提示词,而是谁更会定义一个问题。

争议本身也说明了一件事:Prompt 已经不只是技巧讨论,而开始进入“什么算研究”的边界地带
这对普通用户意味着什么?
意味着以后最容易被淘汰的,很可能不是不会写 Prompt 的人,而是只会把 Prompt 当咒语的人。因为咒语会被产品收编,会被模板平台复制,会被系统默认化,最后谁都能用。
可那些真正能把 AI 用出差异的人,通常不是更擅长“套词”,而是更擅长拆问题、做约束、设验证、看反馈。他们会把一次调用,变成一条小流程;把一个回答,变成可比较的多个候选;把模糊需求,翻译成机器能执行的结构。
从这个意义上看,Prompt 被写进论文,不是提示词突然变高级了,而是 AI 使用门槛悄悄换了位置。
它不再主要考你会不会说,而开始考你会不会想。
如果把这件事浓缩成一句话,我会这么说:
AI 提示词之所以越来越像论文,不是因为字数变长了,而是因为真正值钱的部分,已经从“写一句话”变成了“定义一种方法”。
夜雨聆风