
你可能没注意到,但只要留心观察就会发现一个规律:几乎所有由大模型辅助生成的营销页面、产品落地页,都呈现出一种惊人的视觉一致性。这种一致性不是风格统一,而是一种更低级的"安全选择"——AI 倾向于选择那些在训练数据中出现频率最高的设计元素,因为这样"犯错"的概率最低。
这就导致了一个悖论:AI 能以极低成本产出设计稿,但这些设计稿在第一眼就会被识别为"AI 产物",从而丧失其本应具备的说服力和专业感。
一、Hallmark是什么
Hallmark 是一个反"AI 味"的设计技能包,由 Together AI 的 Nutlope 开发,装进 Claude Code、Cursor、Codex 等 AI 编码工具后,让这些工具生成的页面"像人做的,而不是 AI 生成的"。
它的核心理念只有一句话:好的设计不是"创造美",而是"避免丑"。
三个数字就能概括它的全部机制:
57 项反模式检查:每一条都是明确的、可执行的否定条件,全部通过才能交付 21 套完整主题:覆盖配色、字体、间距等所有设计变量,每次生成强制轮换 4 种调用方式:默认构建、audit 审计、redesign 重设计、study 设计提取
它不追求让你眼前一亮,只保证你不皱眉。这套"反 AI 味"的设计哲学,来自反 slop 设计领域的共识——Anthropic 的前端设计技能、Claude cookbook 的前端美学原则,以及 2026 年兴起的"触觉反抗"(tactile rebellion)运动。
二、谁应该用
Hallmark 不是给所有人准备的,它的目标用户非常明确:
最适合的人:
独立开发者 / 小团队——没有专职设计师,靠 AI 出落地页和产品页,最怕生成出来千篇一律的模板脸 AI 编码工具的重度用户——已经在用 Claude Code / Cursor / Codex 写代码的人,顺手装个技能就能让产出"像人做的",零额外成本 非设计师的产品 / 营销人员——不写代码但需要页面原型或活动页,用 AI 生成时靠它把关审美底线,防止"一眼假" 对设计质量有执念、需要客观标准的团队——不想靠个人审美拍脑袋,需要一套可重复的质量闸门来卡产出
不太适合的人:
有成熟设计系统的资深设计师团队——他们自己的设计标准大概率比这套规则更细、更贴合业务,装了反而束缚 完全不用 AI 编码工具的人——它依附于 AI 编码助手存在,没有这个使用场景就没有价值
一句话:谁用 AI 生成网页,谁就有用它把关的必要。
三、为什么用
痛点:AI 页面的"审美通胀"
AI 能极低成本地产出设计稿,但代价是视觉的同质化。它倾向于选择训练数据中出现频率最高的元素,因为"犯错"概率最低——于是页面都长得像一个模子刻出来的,第一眼就被识破。说服力、专业感,在"一眼 AI 味"面前荡然无存。
解法:不优化生成,而是构建审计层
Nutlope(Together AI 核心成员)在开发内部 AI 工作流时遭遇了同样的问题。他们发现,即便精心设计 Prompt,AI 依然会反复落回那几个最安全的视觉陷阱。于是,他们采取了一个反直觉的方案:不是优化生成,而是构建一个"审计层"。
这个审计层就是 Hallmark——一套针对 AI 生成内容的自动化设计审查协议。
57 项检查:堵死 AI 的偷懒捷径
Hallmark 将 AI 设计中最常见的"降智"模式列为不可逾越的红线:
结构性缺陷:固定数量的功能模块(通常是 3 个)被视为缺乏独立思考能力的标志,除非 Brief 明确要求,否则严禁出现。
装饰性作弊:任何形式的"模拟界面元素"——包括虚构的浏览器窗口、设备外壳、代码片段框——都被视为欺骗性设计而禁止。真实数据和真实截图是唯一被允许的呈现方式。
数据诚信:没有来源支撑的百分比增长数字、模糊的用户量描述(如"数万")被视为可信度杀手。如果数据不确定,必须标记为占位符而非编造。
排版陷阱:特定的视觉模式被标记为"一眼 AI 味"的特征,例如标签与标题并列的双行布局、斜体强调词的过度使用等。
这些标准的共同特点是:它们都是 AI 最倾向使用的"偷懒"选项。Hallmark 的设计逻辑就是堵死这些捷径,迫使 AI 跳出舒适区。
澄清:它是设计审查,不是代码审查
Hallmark 的"审计"和程序员熟悉的 Code Review 是两种不同的审查,不是一回事。
Code Review 检查的是代码本身:逻辑有没有 bug、有没有安全隐患、行号和文件定位准不准——007 里阿里开源的 OCR 干的就是这个。
而 Hallmark 检查的是设计质量:页面是不是 AI 模板脸、有没有编造数据、排版是不是"一眼 AI 味"、移动端有没有横向滚动。它输出的清单是"设计问题清单",不是"代码缺陷清单"。
所以准确的说法是:它是设计审查(Design Review),不是代码审查。一个管"这代码能不能跑",一个管"这页面好不好看"。两者互补——同一个项目,代码该不该重构是一回事,页面长得像不像 AI 生成的完全是另一回事。
多样性机制:防止工业级复制粘贴
如果说"57 项标准"是底线防御,Hallmark 的"多样性机制"则是主动进攻。
团队发现一个普遍现象:即使 AI 通过了审查,连续生成的多个项目依然会呈现出"家族相似性"。为了解决这个问题,Hallmark 引入了"时间维度"的约束:
主题轮换制度:系统内置了 21 套完整的视觉方案,涵盖配色、字体、间距等所有设计变量。每次生成必须使用与上次不同的主题,从物理层面防止视觉重复。
历史记忆检查:生成前,Hallmark 会自动检索最近 3 次的产出记录,确保新项目在宏观结构、色彩维度、信息层级上至少有 3 个层面的差异化。
这种机制的本质是强制注入"设计熵"——在确定性生成的基础上增加不确定性,从而对抗 AI 与生俱来的保守倾向。
闭环审查:AI 对 AI 的自我批评
Hallmark 最有趣的设计是其"自我评估循环"。内容生成后,系统会从六个维度对产出进行量化评分:
创意完整性:核心概念的表达是否清晰 视觉层级:信息组织是否逻辑自洽 执行精度:技术实现是否达到设计标准 内容具体化:描述是否避免空泛 克制程度:是否避免了不必要的装饰 差异维度:与历史产出的区别度
每个维度的评分范围为 1-5 分,任何单项得分低于 3 分的产出都会被直接驳回,强制重新生成。
更值得玩味的是,这套评分逻辑并非硬编码的规则,而是作为 AI 的"内在反思"过程实现的——AI 在生成结束后,会以审查者的身份重新审视自己的产出,这种"元认知"式的设计反而比人类审核更具一致性。
规则之上:可工程化的质量体系
Hallmark 的价值远不止于一个 Prompt 工具。它代表了一种全新的人机协作范式:用 AI 的确定性来约束 AI 的不确定性。
在生成式 AI 的应用中,我们面临一个核心矛盾:如何在利用 AI 效率的同时,保证产出的独特性和专业性?传统的"人力审核"模式效率低下且难以规模化,而"优化 Prompt"的路径已经接近瓶颈。
Hallmark 提供了第三种可能:将质量标准编码为系统规则。这种方式的优势在于:
一致性:每次审查的标准完全相同,不受审核者主观感受影响 可扩展性:规则可以随行业需求迭代更新 可移植性:审查逻辑独立于具体模型,可以跨平台复用
这实际上是把工业时代的"质量管理体系"引入了 AI 生成流程。
四、怎么用
安装:一条命令
npx skills add nutlope/hallmark或者手动拷贝 SKILL.md + references/ 目录:
~/.claude/skills/hallmark/ | |
.cursor/rules/hallmark.mdc | |
~/.codex/skills/hallmark/.codex/skills/hallmark/ |
装好后,它在你的 AI 助手对话里就"存在"了——不需要记命令,直接说需求就行。
四种调用方式
默认(建新页面):直接说"帮我做个 XX 的落地页",它自动选主题、过 57 项检查再输出。
事后审计(Audit):对已有的 AI 生成代码进行诊断,输出一份详细的问题清单和改进建议,但不直接修改代码。这适用于对历史产出的质量回溯。对应说法:"audit 一下这个页面"。
视觉置换(Redesign):保留原有的信息架构和文案内容,仅替换视觉层面的设计元素。这对于那些"内容没问题但视觉太 AI"的项目来说是最高效的优化路径。对应说法:"redesign 这个页面,换个气质"。
基因提取(Study):输入一个目标设计(截图或链接),Hallmark 会尝试解析其底层的设计逻辑——字体搭配原则、色彩关系、结构骨架——并生成一份可复用的设计规范文档。值得注意的是,此功能明确拒绝分析付费 UI 套件或现成模板,其设计哲学是"学习逻辑,而非复制成品"。对应说法:发一张截图或贴一个 URL。
组件模式
如果只是想改一个按钮、输入框、卡片这类单个元素,它会走更轻的流程:先读项目现有的设计 token 和框架,沿用项目风格,并强制做出 8 种交互状态——默认、hover、focus、active、disabled、loading、error、success。
推荐工作流
新手最稳的路径:先 audit 看问题清单,再决定要不要 redesign,别一上来就让它全盘重做。它内部有安全护栏:不会擅自删文件、动路由、改你的文案,删除任何东西前都会停下来向你确认。
五、总结
终极悖论:反同质化本身就是一种同质化
但这里有一个更深的陷阱。
当你把 57 条规则固化成质量闸门,所有通过闸门的产出都会带上相同的"合格指纹":没有假浏览器壳、没有魔法数字、没有三栏卡片、结构不重复……这些"正确设计"的累积,反而形成了一种新的模板。
所有人都在用 Hallmark,所有人的产出就会变得一样"正确",也一样无聊。
这不是假设。你可以想象一下:当 100 个团队都用同一套 57 条规则审查 AI 产出,最终通过审查的页面,必然会收敛到一种"Hallmark 式审美"——克制、真实、结构清晰,但也标准化、无个性。
这就像反兴奋剂检测的悖论:当所有运动员都严格遵守同一套检测标准,你得到的是"干净的比赛",但未必是"精彩的比赛"。规则能保证底线,却无法制造差异化。
更讽刺的是,Hallmark 的多样性机制(21 套主题轮换 + 历史记忆检查)试图解决这个问题,但它的解法依然是规则化的多样性——在给定的 21 套选项里选一个不同的,而不是真正的"自由选择"。这就好比自助餐提供了 21 道菜,你每次不能重复,但你终究只能在这 21 道菜里选。
因为 Hallmark 暴露了 AI 设计的一个根本困境:任何旨在消灭同质化的规则,最终都会成为新的同质化来源。
你禁止三栏卡片 → 大家开始用两栏和四栏 → 两栏和四栏变成新的同质化 你禁止斜体强调 → 大家改用加粗和下划线 → 加粗和下划线变成新的同质化 你禁止假数据 → 大家用"待确认"占位 → "待确认"变成新的同质化标签
规则的本质是"筛选器",筛选器的本质是"收敛"——它让所有输出都靠近某个标准。而当标准被固定,新的千篇一律就诞生了。
出路:让规则长出"后门"
那有没有可能跳出这个悖论?
Hallmark 自己的做法暗示了一个方向:规则必须内置"可逃逸"的路径。
比如它的 study 模式:你可以喂一个外部设计,让它提炼设计基因,而不是只在 21 套内置主题里选。这相当于给规则开了个"后门"——允许系统从外部世界引入新的可能性。
再比如它的"差异维度"评分:不是要求"必须不同",而是要求"必须有区别"——区别度可以来自任何维度,而不限于预设的选项。这给了 AI 一定的自由度去发现新的差异化路径。
真正的突破可能在于:规则不应该只定义"什么是不能做的",还应该定义"如何发现新的可能性"。这意味着系统需要具备一种"元规则"——能够自我更新、自我进化的规则,而不是固定不变的 57 条。
设计的未来:规则的自我消解
回到最初的问题:Hallmark 到底解决了什么?
它没有消灭千篇一律,它只是把千篇一律从"AI 偷懒的模板"转移到了"系统定义的标准"。这是一种进步,但不是终点。
真正的解决方案可能不是"更好的规则",而是"让规则变得不必要"——当 AI 真正理解了"为什么美"而不仅仅是"什么是正确",审美就不再是一套可以被编码的规则,而是一种可以被培养的判断力。
在那一天到来之前,Hallmark 的 57 条规则依然是目前最务实的选择:它用工程化的方式,把 AI 设计的底线画在了"不那么丑"的位置上。而这本身,已经是一种进步。
项目信息:Nutlope/hallmark(Together AI 出品,MIT 协议)
本文为独立视角分析,部分参考项目公开文档。核心观点:AI 审美不是主观判断,是可结构化、可量化、可自动化的工程问题——但任何固定的规则系统,最终都会成为新的同质化来源。
夜雨聆风