这字体里住了两行字,AI只看得见假的那行,太骚啦!

事情是这样的。
昨天晚上我干了件挺无聊的事。
下载了一个字体文件,装到电脑上,打开备忘录用它打了一行字。然后我截了图,分别丢给ChatGPT、Gemini和元宝,问它们同一句话,这上面写了什么。
三个模型,三个答案,全错了,错得一模一样。
不是模型不够强。ChatGPT是最新的版本,Gemini带着推理链,元宝背后是国产头部视觉模型。它们读截图里的文字,平时准得吓人,验证码都能给你啃下来。但这一次,它们集体翻车,而且翻得特别自信,信心满满地报出一串我根本没打过的字母。
骗倒它们的不是什么高深算法,就是一个2MB的TTF字体文件,叫Decoy Font,Mixfont团队7月14号放在官网实验页面的。
图片
我当时就愣住了,不是因为这技术多复杂,是因为它戳中了一个我一直没认真想过的事。
AI和我们,看的根本不是同一个世界。
这事得从头说。你肯定见过那张经典的光学错觉图,近看是爱因斯坦,远看变成了玛丽莲·梦露。同一张图,你的大脑根据站的位置不同,自动切换了看到的内容。这个把戏1994年就被MIT的研究人员玩明白了,技术名词叫hybrid image,混合图像,底层原理是空间频率分离。
简单讲,一张图里同时藏着两层信息。高频的部分是细线条和锐利边缘,你得凑近了才看得清。低频的部分是大色块和模糊轮廓,退远了反而显形。人眼的奇妙之处在于,它会根据观看距离自动侧重不同频率,近处抓高频,远处抓低频,无缝切换。
Decoy Font干的事,就是把这套原理塞进了字体。
每一个字母都被拆成两层。前景是一圈细线条勾出来的轮廓,组成一个诱饵字母。背景是一团模糊的低频色块,组成你真正想打的那个字母。两层叠在同一个字形框里,你贴着脸看屏幕,看到的是前景的诱饵。你退后半步,或者眯起眼睛,背景里那行真字就浮了上来。
人眼能在这两层之间自如切换,因为我们看东西自带距离感和频率感知。但AI不行。
图片
AI看图的方式,跟人眼是两套完全不同的机制。
视觉大模型和OCR系统识别文字,靠的是逐像素扫描,锁定局部纹理和清晰边缘。高频细节天然优先,因为训练的时候它们见过的文字图片,99.99%都是高频轮廓直接对应正确字符。它没有一个叫「退远一点看看」的内置动作,也不会本能地怀疑「这张图里是不是藏着两层意思」。
所以当你把Decoy Font渲染的截图丢给它,它第一眼锁定的就是前景那层细线条诱饵,然后一本正经地读出来,完全没有意识到背景里还藏着另一行字。
这不是某个模型笨,是整个AI视觉范式的一个结构性盲区。
我去Mixfont官网翻了一圈,他们放了三个实测案例,正好印证了这个判断。ChatGPT直接读出了诱饵字母,没有任何犹豫。换Gemini 3.5 with Thinking,Google这个版本带着推理链,理论上应该更擅长多想一步,结果它推理过程写了一大段,自始至终没质疑过这张图可能有多个层次。最离谱的是GPT Sol,OpenAI带Agent能力的模型,能写代码能调工具,按理说最该识破这种把戏,结果它也直接输出了前景文字。
三个模型,三种架构,栽在同一个地方。
这说明什么,说明问题不在于算力不够或者模型不够新,在于它们处理图像的基本假设出了偏差。它们默认一张图里最清晰的视觉信息就是全部视觉信息。这个假设在99.99%的情况下是对的,Decoy Font精确地利用了那0.01%的例外。
Mixfont自己也很坦诚,在官网写明了局限性。如果你明确提示模型这张图里可能有隐藏信息,请同时检查低频部分,部分模型就能部分破解。有编码能力的Agent甚至可以写脚本做频率分析,直接把两层都扒出来。
所以Decoy Font不是密不透风的墙,更像一道门槛。挡不住铁了心要翻的人,但能让绝大多数爬虫和默认AI行为觉得绕路更划算。
说到这,我得提一个让我觉得更有意思的细节。
Mixfont不是第一次做反AI字体。他们之前有个产品叫Ghost Font,思路完全不同,靠动态视频隐写。你需要生成一段动画,文字以噪点形式藏在视频帧里,只有播放时人眼凭借「共同命运」视觉本能,一堆噪点朝同一方向移动,大脑自动把它们归为一个整体,才能读出内容。AI逐帧分析,每一帧都是无意义噪点。
效果确实惊艳。但有个致命问题,你得生成视频,发给别人,对方得点开播放。这不是日常能用的东西,这是一个演示级实验。
Decoy Font换了条路。标准的TTF文件,跟宋体微软雅黑一样,双击安装,任何能选字体的软件都能用。Decoy Font的字形基于DejaVu Sans Mono这个开源等宽字体,每个字母占的宽度一样,让前景背景两层叠加更容易对齐。你打开Word打一行字,截图发群里,同事眯眼能看清,AI爬虫抓到的是假的。

从生成视频发给朋友看,到装个字体在文档里打字,这个跨越看着不大,但产品性质完全变了。Ghost Font是酷炫的概念验证,Decoy Font是可以塞进工作流的生产工具。
我个人判断,这个从实验到工具的跃迁,比技术原理本身更值得关注。一项技术能不能扩散,聪明不聪明是次要的,方不方便才是决定性的。TTF这个载体,让会跑脚本的开发者和只会打字的普通人站在了同一条起跑线上。
不过话说回来,生产级工具这个定位也有水分。目前只支持英文字母,中文用户暂时只能拿它加密英文内容。而且很多企业IT环境不让随便装字体,在线文档平台更不支持自定义字体渲染。装个字体就能用,对个人成立,对企业还得打个问号。
Mixfont作者Eric Lu在官网最后写了段话,中文科技圈几乎没人注意到。他说扩展到中文会是个有趣的项目,字符型语言可能从这项技术中获益更多,因为汉字大小和形状相对一致,更容易叠加隐藏信息。
这段话信息量很大。
英文字母的问题是形状差异太大,I就一竖,W占满整个字形框,两层叠加时低频信息容易被高频轮廓干扰。汉字不一样,每个字基本填满同一个方形空间,笔画密度也更均匀。在汉字上做前景背景叠加,两层信息的信噪比会更高,隐藏效果更好,人眼识别也更清晰。
如果汉字版真做出来,应用场景比英文版大得多。中文互联网每天产生海量文字内容,公众号、微博、小红书。如果这些内容发布时用Decoy Font渲染,AI爬虫抓到的是诱饵,人类读者眯眼看到的是真内容。
但现实问题也摆在那。汉字字形复杂度远高于英文字母,做空间频率分离的难度成倍增加。英文26个字母手工调整就够,汉字常用字3500个,全做两层叠加,工作量大到不可能手工完成。Eric Lu自己也说这是个fun project,暗示目前没具体计划。
我个人觉得,汉字版大概率不会由Mixfont官方推出。更可能的情况,是某个看到这篇文章的中国开发者,用同样的原理自己搞一个中文开源版。技术原理公开,混合图像算法有成熟开源实现,缺的只是有人把汉字字形数据喂进去。
其实把视野拉远一点,Decoy Font不是孤例。让AI看不懂你的文字这个需求,正在催生一个小但活跃的赛道。
反AI技术正在分化成几个层次。第一层是视觉混淆,像Decoy Font这样让AI的图像识别系统看走眼。第二层是文本对抗,用对抗性后缀、同义替换让AI分类器误判。第三层是结构隐写,把信息藏进文件元数据或格式特征里,AI的文本提取流程根本碰不到。
Decoy Font属于第一层,也是最直观的一层。你能用眼睛验证AI确实读错了,这种直观是它的传播优势,也是它的局限。一旦AI厂商针对性优化,比如加入多尺度分析、多频率通道检测,这层防护就会被穿透。
说到底,反AI技术追求的不是永久有效,而是持续抬高成本。每出一种反AI手段,AI厂商就得投入资源做对抗训练。每出一种新的AI识别能力,反AI社区就得找新的混淆方式。这游戏没有终点,Decoy Font只是其中一步棋。
让我真正在意的,不是这字体本身。
是一个更根本的事实被它无意间证实了,人眼和AI视觉模型之间,存在一条目前还跨不过去的鸿沟。这条鸿沟不是算力能填平的,不是参数量能堆出来的,它关乎看世界这件事的底层逻辑。
人看东西是带情境的。我们会自动调整焦距,会根据距离切换频率通道,会本能地怀疑一张图里可能不止一层意思。这些能力不是后天学的,是几亿年进化刻进视觉皮层里的。AI没有这个底子,它只有像素和权重,它看图的方式更像一台高精度扫描仪而不是一个有距离感的生物。
Decoy Font之所以能骗过GPT,不是因为字体设计多精妙,是因为它精确地踩在了这条鸿沟上。它利用的那个差异,人眼的频率感知和AI的像素贴脸分析,是两种完全不同的视觉范式。
这条鸿沟短期内填不平。AI要真正模拟人眼的距离感和频率切换,不是加几个模块的事,是得重新设计视觉处理架构的事。在那之前,任何利用人眼物理特性的反AI手段都有一个窗口期。
这大概也是为什么这事让我有点兴奋。
我们正在进入一个人和AI互相伪装的时代。AI学着模仿人的声音、笔迹、表情,deepfake越来越难辨真假。而人呢,开始学着用AI看不懂的方式编码信息,用字体,用动图,用只有人眼能还原的视觉错觉。
以前的信息安全是人和人之间的事,你加密我破解。现在多了一个不在场的第三方,AI爬虫。它不针对你,但它无差别地扫过你的一切,你的每一条公开内容都在被它咀嚼消化,变成某个大模型的训练语料。
Decoy Font这种东西让人兴奋的点不在于多安全,在于它第一次让普通人有了一种低成本的还手方式。你不需要懂加密,不需要会写代码,装个字体,你打出来的字就分成了两层,一层给机器看,一层给人看。
一个2MB的字体文件,干了一堆加密算法干的事。你敢信???
如果你不是字体设计师也不是AI安全研究员,这东西跟你有什么关系。
最实际的,它现在就能用。TTF文件免费下载,许可允许个人和商业项目使用,装上之后任何能选字体的软件都能用。你有英文内容不想被AI爬虫抓取,低成本方案已经有了。
值得盯的方向是中文版。反AI字体的汉字版一旦出现,对内容创作者的意义比英文版大得多。中文公众号作者、小红书博主、独立写作者,如果有一天你发的内容天然带AI读不懂属性,你跟AI爬虫之间的博弈格局就完全变了。
但别把它当保险箱。Decoy Font自己说了,有Agent能力的模型可能破解,知道套路的用户也能破解。它的定位是提高门槛不是绝对安全,适合防爬虫防默认AI行为,保护真正的机密信息还是得上加密。
回到昨晚那个场景。我装了个字体,打了行字,截图分别丢给三个AI。它们仨信心满满地报出了同一串假字母,而我眯眼看到的是另一行真话。
同一段文字,两个世界。
这大概就是未来人和AI共处的一个缩影。表面上我们看着同一块屏幕,实际上我们活在不同的频率里。AI在高频像素中贴脸分析,我们在低频模糊中眯眼还原。谁也代替不了谁,谁也别想完全骗过谁。
这场围绕谁能读懂文字的较量,才刚刚开始。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。
/ 作者:mojianpo
/ 投稿或爆料,请联系邮箱:406223802@qq.com
夜雨聆风