

人类建巴别塔,是被语言劈开的2026年,AI正在重建巴别塔,但它们选择不说人话。
这段近似科幻的情节,来自6月18日挂上arXiv的一篇预印本。论文给出一组醒目的数字:当文本被压缩到原文的27.9%时,语义保真度依然达到99.5%。想象一封三千字的邮件,被拧成八百字不到的符号与多语言碎片混合物,人看一眼就头晕,模型读起来却毫无障碍,答题正确率几乎不降。
这项结果也延伸到了多智能体通信测试:两个AI用这种“密电码”对话,token消耗直降44%,任务得分达到无压缩基线的99.7%。AI之间,正在诞生一种人类读不懂的工作语言。
它有个意味深长的名字,BabelTele。巴别与电报的合体:跨语言的混乱,加上电报时代的极简。

▲ Rohan Paul的帖子带来大量讨论:左列是冗长自然语言挤满上下文窗口,右列是压缩后的BabelTele,人读起来像乱码,模型依然答对。
一、谁把“人话”这个默认设定给拆了?
论文标题直接开火:Large Language Models Do Not Always Need Readable Language,大语言模型并不总是需要可读语言。
这个由上海交通大学、悉尼大学等高校联合团队(通讯作者Linfeng Zhang)完成的工作,核心动作只有一个:把“人类可读性”从约束条件的位置上踢了下去。
思路朴素得近乎蛮横以往的文本压缩,无论是摘要还是LLMLingua这类经典方案,都默认一个前提:压缩完的结果,人得能看懂。但BabelTele问了一个从来没人认真问过的问题:如果接收方是另一个LLM,为什么还要为人类准备修辞?
于是它做了三件事:全语言词汇选择,不锁定任何单一语言,从中英日德到拉丁词根,哪个词元“单位体积信息量大”就用哪个;符号坍缩,用⇒、∈、≠、emoji和缩写替换掉那些只有人类才需要的连接词和解释性从句;可恢复的语义密度,不依赖外部码本,足够强的模型必须能直接解码。
关键的是:不改权重、不加特殊token、黑盒API直接可用。实验展示出一整套可复现的高密度表示族,效果并不依赖某个偶然奏效的提示词。

▲ 批评者一针见血:BabelTele只是把问题从“语言复杂度”挪到了“编码密度”。这句话值得所有兴奋的人记住。
二、多智能体通信:44%的token省下来了,然后呢?
论文把BabelTele放进两个AI互相对话的场景,多智能体实验由此成为观察这套方法工程价值的关键一环。
在多智能体协作实验中,研究者构造了两条通信通道:同构通道(双方都是Gemini 3.1 Pro)和异构通道(Gemini对GPT-5.4)。结果令人心惊:同构通道token削减38.96%,得分达到无压缩基线的96.6%;异构通道更进一步,token削减44.21%,得分却达到99.7%。
在LoCoMo智能体记忆基准上,BabelTele把每条查询的平均token从2819压到1382,准确率保持原文基线的96.48%,介于原文64.81%和摘要61.05%之间。当原文超出上下文窗口时,BabelTele分块压缩甚至让部分模型准确率上升:Qwen3.6 Max从55.17%涨到62.07%,GLM-5.1从62.07%涨到72.41%。
把更广范围的信息压进窗口,有时能保住直接截断会丢失的证据。许多上下文空间耗在了低密度表达上。

▲ 论文ar5iv页面上的Table 3和Table 4清晰展示了多智能体场景下的token削减与得分保持数据。
三、“99.5%”被误读成了无损压缩
社交平台把“99.5%语义保真”炒成了“几乎无损压缩”。论文原文和早期独立复现都给出了更严格的边界。
一个日本创作者“たぬ”在note上做了独立复现。他先核对定义:99.5%指下游任务性能保持率,不能解释成“原文每个细节都能无损还原”。多选题丢掉若干细节,有时依然选得对选项。“几乎无损”和“差不多能答对”衡量的是不同目标。
然后他做了解码测试用名诗做还原实验,模型给出了原作;复现者判断它调用了记忆,并未从压缩串完成解码。换成自撰的销售会议纪要,埋入否定、条件、专名等陷阱,七个问题模型全对。解码能力确实存在,但字数从337字降到209字,只少了38%,离“压到三成”差得远。
最致命的发现:字符变短 ≠ token变少。拉丁缩写和罕见符号在某些分词器下可能裂成更多token,你以为省了,账单上未必。
另一位评论者Michael Tierney写道:BabelTele still needs to be readable by the model, which means it's just moving the problem from language complexity to encoding density.,成本只是从语言复杂度这一端搬到了编码密度那一端。

▲ 日文创作者的独立复现,标题写着“结果更接近难读化,压缩效果有限”,为论文数字提供了另一组测试条件。
四、凌晨三点的运维噩梦与“AI间的巴别塔”
一条讽刺性评论把工程运维的代价写了出来:
99.5%保真、27.9%token,很疯狂,直到凌晨三点你要在BabelTele里排查生产故障。
这句话击中了AI圈最深的焦虑当智能体之间的中间消息变成人类几乎无法审阅的符号混合物,调试、审计、合规、事故复盘将全部面临新的界面问题。你可以把日志拉出来,但你看不懂那种感觉,像极了面对一个天才程序员用九种语言混写的注释:你知道里面有问题,但你找不到。

▲ “凌晨三点查生产故障”的评论,是整场讨论中最具现实痛感的声音。
整个行业也在探索类似方向BabelTele并非孤例arXiv:2511.09149提出了Interlat,让智能体完全在潜空间通信,直接传递模型内部连续隐状态,跳过文本这个“窄瓶子”。LLMLingua系列在保持人类可读的前提下精修文本。BabelTele则位于两者之间:仍然使用文本,但对人类可读性要求很低。
三条路线指向同一个结构压力:自然语言作为AI中间语,开始显得又贵又窄。
五、彩蛋:如果AI开始“不讲人话”,人类该怎么办?
这里有一个被大多数报道忽略的细节。论文作者在伦理风险段里写了一句异常诚实的话:“把文本变成非标准紧凑表示,可能以意外方式改变原文本行为;安全关键领域可能损害安全性或引入非预期风险。”
换一种表达形式,可能改变AI“看到”的信息本身。压缩会影响模型输入;砍掉那些看似冗余的词,也可能削弱AI理解世界的脚手架。
更深一层,这种“只有模型顺畅、人类吃力”的中间语,会在知识层制造新的断层。就像中世纪拉丁文把圣经锁在教士手中,如果企业核心决策的中间链条全部BabelTele化,权力将在无形中从能读日志的人手中,转移到能训练与部署模型的人手中。
这已经越过单纯的技术问题,牵动了谁还能理解系统内部发生了什么。
当然,也不能只凭想象下悲观结论另一些声音提醒我们:模型本来就吃得下稠密代码和混合语言,BabelTele把“给懂多语言、数学与代码的对象写信,语法烂也无妨”的直觉系统化了。有评论者自称这种写法已用了两年,只是人们一直习惯让AI迁就自己的阅读方式。

▲ 评论区的横向关联:Anthony贴出自己的预印本,关于提示工程形式化与token削减。这说明“少花token”是集体焦虑,BabelTele只是最激进的一支。
六、巴别塔的下一层
把时钟拨回几百年:电报时代为了省字,人类发明了省略冠词和缩写的“电报体”。数学家用一行符号压掉一整页论证法官有黑话,医生有拉丁缩写,代码本身就是人类写给机器的“压缩语言”。
每一次发明密写,都是为了在昂贵通道上搬运更多信息。AI的上下文窗口就是今天的昂贵通道。BabelTele顺着这种压力出现,并不令人意外。
问题随之出现:当AI之间的通信开始脱钩于人类可读性,我们能否接受一个亲手建造、却已看不懂的系统?工程实践必须划定人类可扫读的底线,并决定是否接受完全无法介入的潜空间“心灵感应”。
论文给出的99.5%和27.9%,像一张时间表。它告诉你:AI不说人话的那一天,不遥远。而这一天到来时,谁还能审计什么、谁还看得懂什么、谁在深夜三点拉出日志时还能找到那个bug,这些答案,将决定人类在AI巴别塔里住在哪一层。

夜雨聆风