
让 AI 做个活动页、官网首页或产品 Demo,很多团队都会经历一个很熟悉的过程。
第一版出来时,大家会说:“挺快,功能也都有。”
再看五分钟,问题开始浮出来:导航、卡片、按钮都没错,颜色也没撞车,但这个页面放到十个同类产品里,谁也记不住。它像一个合格的作业,而不像一个有人做过取舍的设计。
这类“AI 味”,不一定是模型不会写网页样式代码(CSS)。在开放式页面创作任务中,一个常见原因是,团队只交代了要做什么,却没有把“做到什么程度才算过关”说出来。模型于是选了最熟悉、最不容易出错的组合:常规布局、默认组件、已经见过很多次的视觉套路。
Anthropic 关于长时间运行 AI 编程的工程文章《Harness design for long-running application development》[1]给出的做法是:把你的审美拆成一组可以逐项验收的原则,再让另一个角色专门挑毛病。
机器不用替你拥有审美。负责人得先把原来只会说“感觉不对”的判断,写成系统能执行的要求。
“好看”为什么不能直接当指令
一位设计负责人说“再高级一点”,通常脑子里已经有一套没说出口的参照物:什么叫克制,什么叫拥挤,什么是品牌自己的语气,什么又像了竞品模板。
模型没有这套默认共识。它收到“做一个高级的博物馆官网”时,只能从大量见过的页面里找一个最像的答案。这个答案往往完整、可用、风险低,但未必有身份感。
Anthropic 的实验从一个很实际的观察开始:Claude 能做出技术上没问题的前端,但默认会靠向安全、可预期的版式。更麻烦的是,让同一个模型回头评自己的作品,它很容易给出“已经不错”的解释。设计没有单元测试能直接判定“漂亮”或“不漂亮”,这句自评又缺少外部证据,很容易让迭代停在及格线附近。
设计任务卡住的地方在于:“好”没有被写成能让它拒绝平庸方案的验收语言。
这里需要分清两件事。
第一,审美当然不能被一个分数彻底代替。有人喜欢极简,有人喜欢密度;品牌要传达的性格也不相同。
第二,审美里有一部分可以变成可讨论的约束。比如:颜色、字体、图片和布局有没有共同指向一个身份;页面里有没有为了这个项目做过具体选择;字号、间距和对比度是否经得起使用;用户能不能不猜就找到主要操作。
前者是负责人要保留的判断权,后者是可以交给系统反复检查的部分。把这两层混在一起,团队就只能不断说“再改改”;把它们拆开,AI 才知道哪种改动是在靠近目标。

Anthropic 具体把审美拆成了什么
原文给两个不同角色同时放进了四条标准:负责产出页面的生成器,以及负责检查页面的评估器。它们不等于通用设计真理,但很适合拿来理解这套机制。
1. 设计质量(Design quality):颜色、字体、布局、图片和细节,是不是共同形成了一种清楚的气质,而不是各自都还行。 2. 原创性(Originality):页面里有没有项目特有的创意决定,还是组件库默认样式、模板布局和常见 AI 页面元素的拼装。 3. 工艺(Craft):字体层级、间距一致性、色彩协调和对比度这些基本功是否过关。 4. 功能性(Functionality):用户能否理解界面、找到主要操作并完成任务。
这张评分表的关键在于取舍。文章把设计质量和原创性在评分中所占的权重,也就是它们比其他项目更能影响总判断的程度,放得更重。模型通常已经能把工艺和功能性做到及格,风格和辨识度却更容易丢掉。
与其只说“不要有 AI 味”,不如问得具体一点:这页里有哪些选择,只有这个品牌、这个场景才会这样做?
例如,若任务是为一家当代艺术馆做网站,“用黑白大图和三列卡片”并不自动失败,但评估者要追问:展览内容、动线、作品之间的关系,为什么会导向这个呈现?如果答不上来,它可能只是一个熟练的模板。
权重决定系统会牺牲什么、奖励什么;把“原创性”写进高权重项,才是在明确告诉 AI:能用还不够。
标准里的措辞本身也会注入偏好。Anthropic 在提示里写了“最好的设计应达到博物馆级别”,即便还没有评估反馈,生成的方向也会被这句话牵引。审美不是最后打个分才加进去的;从需求、示例和禁忌的写法开始,它就在影响结果。
所以,别把“高级、年轻、有科技感”当作规范。它们太像情绪标签。更有用的写法是把它们落到可观察的行为:页面要留出怎样的呼吸感,哪些默认组件不能原样出现,用户第一次进入时要先感到什么、再做什么。
把“创作”和“挑错”拆开
很多人看到这里会说:我也让模型自我批评、再改一版,为什么效果不稳定?
因为生成和验收放在同一个角色里,反馈的独立性太弱。它刚为某个方案写完一长段实现,再要求它评估,很容易沿着原来的逻辑为自己辩护。它不是故意偷懒,而是没有得到一套足够有力的外部反证。
Anthropic 的做法是把两件事拆开:生成器负责产出网页代码(HTML、CSS 和 JavaScript);评估器拿到运行中的真实页面,用 Playwright MCP(一套让模型操作浏览器的工具接口)点击、浏览、截图,再按四项标准打分并写出具体批评。批评回到生成器手里,成为下一轮的输入。
整个过程就是:
先做出来 -> 找一个不负责交付的人按同一套尺子试用 -> 把不通过的地方说清楚 -> 再决定修旧方案还是换方向。

评估器不替人宣布“好看”。它负责指出生成器自己不太会主动提出的问题,并给出下一轮修改目标。
评估器也不是天然可靠。原文提到,早期的评估器会发现真实问题,随后又把问题说服成“不严重”,最后放行。作者回看评估日志,找出机器判断与自己判断分叉的地方,补充几则已经判好坏的案例让它作参照(少样本示例),再补上更细的分数拆解。
这和带新人做设计评审差不多。只说“严格一点”没用。你得摆出一两个真实案例:这个版本为什么整洁却没有品牌感,那个版本为什么元素多但用户仍能找到主操作。系统学到的是你的容忍范围,不是一个抽象的“品位”。
什么时候该推倒重来
如果每一轮都只是“把间距调一下、阴影改一下、再加一点动效”,系统会越来越精致,却仍然困在第一个方向里。
Anthropic 让生成器每轮评分后先做一次策略判断:如果当前方向在变好,就继续打磨;如果方向本身不对,就放弃它,换一套审美方案。一次实验中,荷兰艺术博物馆网站到了第九轮,还是一个完成度不错的深色首页;第十轮,它放弃原路径,改成带 CSS 透视感(一种用网页样式代码营造空间效果)的三维房间,用门洞在展厅之间导航,而不是滚动或普通点击。
多跑几轮不会自动带来灵感。这里同时要有两件事:评估标准持续指出通用方案的问题,系统也允许放弃当前方案。前者让它不满足于旧路,后者让它有机会换路。少了任何一个,循环都会停在“比上一版好一点”。
迭代会把一条路走得更完整。要有大的变化,系统得允许它承认:第一条路可能就选错了。
这也是产品团队在用 AI 辅助创作时常见的盲区。大家会规定“连续优化三轮”,却没有规定什么情况下应该换构图、换信息架构、换交互隐喻。结果看起来工作量很大,最后只是把第一版的保守判断做得更精致。
成本和边界
原文的实验每次会跑 5 到 15 轮,完整运行最长可到 4 小时。评估器操作的是可交互的页面,不是一张静态图;它要等页面、尝试路径、记录问题,因此成本和时间都是真实的。
而且分数上升不等于每一版都更讨人喜欢。作者也观察到,有时中间版本反而比最终版更合心意;随着评估器不断要求摆脱默认套路,实现复杂度也会增加。把“博物馆级”写进标准,还可能让不同任务都朝某种固定的“博物馆感”收敛。
评分表不能代替审美,它只会放大写进去的偏好。写标准的人决定哪些问题会被指出;设置权重的人决定系统为了原创性能牺牲多少简单性。
评分规则本身就是产品决策。它会放大你的偏好,也可能把你的偏见一并放大。
另外,评估器并非总值得保留。在同一篇文章后半段的模型升级实验中,Anthropic 发现,原本需要评估器兜底的一些任务已经能由生成器独立完成;评估器在任务刚好超出模型稳定能力边界时,才更值得它的额外成本。这个边界不会固定,模型一换、任务一变,就需要重测。
一个团队下周就能试的轻量版本
没必要一上来搭多智能体系统,也不需要为一张普通运营页跑十轮。先挑一个高价值、低频、确实需要风格区分的任务,例如新品官网首屏、重要客户方案或核心功能的演示原型(Demo)。
轻量实践先把参考、权重、独立评审和换方向条件写清楚,再决定是否值得投入多轮生成成本。
下面五步不是 Anthropic 原文给出的标准流程,而是根据这套机制为普通团队整理的轻量做法:
1. 找 3 个你愿意署名的参考,和 3 个你不想再看到的反例。 不要只贴链接。分别写出它们在信息密度、留白、品牌语气、交互动线上的具体差别。 2. 把“好”拆成 4 到 6 条验收项,并标出权重。 基本工艺、可用性、品牌一致性、项目特有性不必同分。权重就是团队的取舍声明。 3. 让生成和评审分成两个回合。 第一回合只负责产出;第二回合只能根据验收项找证据、写问题和给下一步建议。不要让它一边改一边给自己打高分。 4. 为“推倒重来”设触发条件。 例如连续两轮仍说不清本项目的独特选择,或原创性项没有提升,就停止修装饰,改信息架构、视觉隐喻或交互方式。 5. 每次保留中间版本和评审记录。 这既能让负责人挑回自己更喜欢的版本,也能慢慢积累“我们究竟在奖励什么”的案例库。
这不是靠一个提示词就能解决的事。提示词只是把标准送进模型的入口;团队还得准备一套能讨论、检查和推翻“好设计”的工作流程。
AI 不会自动长出你的审美。但当你把取舍、反例和验收边界写进系统,它至少不会再把“看起来没毛病”误当成“已经足够好”。
夜雨聆风