

如果有一天,你深夜三点被报警吵醒,打开日志,发现你的AI智能体们正在用一种你完全看不懂的“电报密文”互相沟通,这幅场景就来自2026年6月18日一篇论文的实验结果。
先看两个数字:27.9%和99.5%
前者是文本体积被压缩到的比例,你原本要写100个字的信息,AI用不到28个字就能传达。后者是语义保真度,压缩后的“外星文”,在AI眼里和原文几乎没区别。
这套密写让AI开始用自己才懂的“暗语”交流。
论文题为 Large Language Models Do Not Always Need Readable Language(大语言模型并不总是需要可读语言),作者团队来自上海交通大学、悉尼大学、合肥工业大学、西安交通大学、南京大学,通讯作者Linfeng Zhang。他们把这种面向模型而非面向人类的高密度文本,命名为,BabelTele。
“巴别”(Babel)+“电报”(Tele)一个指向语言分裂的混乱,一个指向极简压缩的秩序。名字本身就是答案的开头

▲ Rohan Paul的帖子带起了这波讨论,图中可以直观看到对比:左边自然语言冗长挤爆上下文,右边BabelTele又短又怪,人类看着头疼,模型却对答如流
为什么人类需要“废话”,而AI不需要?
先问一个反直觉的问题:你发微信时,为什么总要说“在吗?”“你好呀”“不好意思打扰一下,我想请教您一个问题”?
因为你是在为另一个人类打包信息 你需要礼貌、语气、冗余,来确保对方在情绪和语义上都愿意接收。哪怕对方是你同事,你也会加上“麻烦你了”“感谢感谢”。
LLM处理的是token:文本被切成子词或字符片段,模型在巨大参数空间里预测下一个token。训练语料里有新闻、小说、代码、公式、表格、多语言混写、表情符号和烂语法。对模型来说,“合法英文散文”只是一种常见表面形式,语义还可以装进别的容器。
于是论文作者做了一件有点“离经叛道”的事:既然读者是模型,为什么还要为人类准备修辞?
他们用零样本提示,让压缩模型遵循三条原则:全语言词汇选择(不锁定单一语言,中英日德、汉字、拉丁词根随便挑单位信息量大的)、符号坍缩(用⇒、∈、≠、∧、emoji替换冗长解释)、可恢复的语义密度(不靠外部码本,强模型应该直接读懂)。
关键点来了:不改权重、不加特殊token、黑盒API可用。 这跟那种往模型里塞私房暗号的“提示魔术”有本质区别。BabelTele是一类表示族,你可以把它理解成一套“电报发电原则”,无需固定密码本。
“人读不懂”也可以是设计选择
论文在QuALITY长文多选题上做了验证。结果有多夸张?
Dale-Chall可读性指数约16.70,难词比例约80%。 换成BabelTele后,人类大学生答题正确率明显下滑;但Gemini 3.1 Pro等指令模型依然保持高正确率。
人读不懂,模型读得懂。低可读、低似然,不等于语义崩坏。
这个结论在工程圈炸锅了一位叫Shinka的网友的评论堪称全篇最佳吐槽:
“27.9%的token换99.5%的保真度,简直是疯狂压缩,直到你在凌晨三点要在BabelTele里查生产故障。”
这段吐槽戳穿了两面性:省钱的时候有多爽,排障的时候就有多痛。 人类无法直接审计的中间消息,会把调试变成地狱模式,你盯着日志里一串“∵∃∈⇒∴”的符号混合物,除了问候AI的祖先,别无他法。

▲ 日本创作者用日语重新测试BabelTele,发现压缩率远达不到“三成”的宣传感,这提醒我们,数字需要拆开读
数字要拆开读:99.5%到底是什么?
这是全篇最值钱的一段请划重点
99.5%这个数字,并不表示“原文每个细节都能无损还原成人话”。它在论文语境里指下游任务性能的保持率,多选题上,压缩后只读BabelTele的模型,相对读原文的基线能保住多少正确率。
举个通俗的例子:考题问“以下哪个选项是对的”,你不需要还原全文每个字,只要抓住关键信息选对答案就行。多选题丢掉若干细节,照样能选对 所以“99.5%保真”更准确的翻译是:压缩后,AI的任务正确率只掉了0.5%左右。
日本创作者“たぬ”做了件特别有价值的事:用日语重新测试。结果很微妙,日文密写从337字到209字,只少约38%,远远达不到“压到三成”的宣传效果。他还发现一个工程陷阱:拉丁缩写和罕见符号在某些分词器下可能占多个token,字符变短≠token变少。他认为:其中“难读化”的成分高于压缩
这个复现提醒我们:论文里的惊人压缩率,高度依赖输入文本的冗余程度。冗长的英文长文才有压到三成的空间;本来就密的日文短文,只能算“难读化”论文自己也在局限里写明:效果依赖压缩,阅读配对与任务。
数字成立,离不开它的实验条件
多智能体通信:tokens砍掉四成,得分稳如老狗
更吸睛的实验出现在“多智能体通信”环节。
论文测试了两种配置:同构(双方都是Gemini 3.1 Pro)和异构(Gemini和GPT-5.4混用)。结果如下:
同构:token减少38.96%,得分达无压缩基线的96.6%; 异构:token减少44.21%,得分达无压缩基线的99.7%。

▲ 论文中的多智能体与智能体记忆实验表格,数据一目了然:大规模token削减,得分却几乎没有明显损失
注意异构那行:砍掉了44%的token,得分反而几乎追平原基线。 由此可见,BabelTele跨模型也能用,并呈现出系统性的可迁移结构。
在LoCoMo智能体记忆基准上,BabelTele把每查询token从约2819压到约1382,准确率62.53%,相对原文64.81%保住了96.48%。虽然压缩幅度弱于长文场景,但这恰恰说明:能砍掉的token,取决于原文有多“水”。
当一个多智能体系统全天候高频对话时,每句话省四成token意味着什么? 更低的API账单、更少的上下文污染、更快的响应延迟。这笔账,做智能体产品的团队比谁都会算。
这不仅仅是压缩:它是语言观的裂缝
把镜头拉远一点,BabelTele只是一个更大趋势的“早期信号弹”。
提示压缩谱系上,微软等机构推的LLMLingua系列早在用困惑度、信息熵来删冗余token,但人家还是坚持自然语言可读。BabelTele的分野在于:直接放弃人类可读性作为默认约束。 LLMLingua是“精修过人话”,BabelTele是“允许崩坏表面、只求模型能解的电报密写”。
潜空间通信那派更激进arXiv:2511.09149提出的Interlat,直接用模型最后一层的连续隐状态在智能体间传递“思想表示”,跳过把内部状态下采样成token的过程。作者把灵感比作“心灵感应”BabelTele至少还在文本通道上,走现有API和日志;Interlat则完全是系统内部的原生协议。
两者共同指向同一个结构压力:自然语言作为智能体中间语,开始显得又贵又窄。
文章末尾又提出一个问题:当AI系统内部发展出“只有模型顺畅、人类吃力”的中间语时,审计、合规、事故复盘将面对什么? 人类文明反复在通用可读与专家密写之间摆动,拉丁文曾是学者共同语,却把外行人关在门外;医学缩写提高专业效率,也制造致命误读。那些说“BabelTele会被安全团队打死”的评论,源于凌晨三点排查日志的现实压力。
最后:密语不会取代人话,但会让你重新理解“阅读”
回到最早的那个问题:AI之间说暗语,人类怎么办?
务实的答案是:手机基站的信号协议通常也不由用户阅读,AI中间消息可以类似处理。 但你得确保故障发生时,有工具能把那些“密文”翻译回人话供人审计。论文作者也在风险段提醒:把文本变成非标准紧凑表示,可能以意外方式改变原文本行为;安全关键领域可能损害安全性
另一个问题是:这会不会反过来改变人类写给AI看的“人话”?
毕竟评论区已经有人在说,自己混写多语言、公式和代码给模型看,“已经用了大约两年”。还有人在做把提示工程形式化、削减三成token的研究。“少说废话”正在从人类的修辞洁癖,变成AI经济学的刚需。
27.9%这个数字,也许明天会有更多复现把它拉回40%、50%。但方向是明确的:语言,作为信息的容器,正在被AI重新谈判。 我们花了几千年磨炼清晰表达,现在AI告诉我们:理解信息可以比完整表达更便宜。
那句话怎么说的来着?
BabelTele是给模型看的字,离给人看的诗很远。
但诗的年代,也许真的回不去了

夜雨聆风