

想象一下这个场景
凌晨三点,某大厂智能体平台突然告警。你冲进值班室,打开agent之间的通信日志,准备定位故障,然后你看到的是一行混着emoji、数学符号、英文、日文、逻辑运算符和碎片化代码的“乱码”。它没有经过加密,只是智能体之间的正常通信。那一刻,你甚至会怀疑这是天外飞仙留下的手笔。
这就是BabelTele
一篇2026年6月18日挂上arXiv的预印本,正在AI圈引发热议。标题像一句宣言:Large Language Models Do Not Always Need Readable Language,大语言模型,并不总是需要可读语言。
论文给出的数字颇为惊人:在文本体积压到原文约27.9%时,语义保真度仍可达99.5%。AI之间的“话”可以砍掉超过七成,任务表现几乎不受影响。
而最要命的是:这种压缩后的“语言”,人基本读不懂。

▲ 科技博主Rohan Paul的图文帖让这篇论文走出学术圈。配图左边是AI过去的长篇大论,右边是压缩后的BabelTele:人完全蒙了,模型照样答对。
一种“AI的母语”
先别急着往科幻方向滑BabelTele是一种面向模型高密度表示的经验探测结果,与加密暗号无关。
作者团队以Jiayi Zhu等人为代表,通讯作者Linfeng Zhang,单位覆盖上海交通大学、悉尼大学、合肥工业大学等。他们提出了一个问题:当接收方换成另一个LLM,语义信息能否编码成更短、更怪、更不像自然语言的字符串,同时仍被模型读懂?
答案已经写在实验结果里:能
原理也不玄大语言模型读取的是token它把文本切成子词片段,在亿万参数空间里预测下一个更可能出现什么。训练语料里有新闻、小说,也有代码、公式、表格、混杂语言、表情符号和烂到家的语法。所以对模型而言,“合法的英文散文”只是语义存在的一种表面形式,语义还可以装进别的容器。
BabelTele的生成逻辑,就是在提示里放松三条约束:
全语言词汇选择,不锁死单一语言,谁的信息密度高就用谁;符号坍缩,用emoji、数学逻辑符号(⇒、∈、≠、∧、∨)替换掉所有冗长连接与解释性从句;可恢复的语义密度,不依赖外部码本,足够强的LLM必须能直接解读。
关键工程点:不改权重、不加特殊token、黑盒API可用。
这些特点让它具备了直接接入现有模型的可能性。

▲ arXiv论文摘要页,是这次“黑话风波”的源头核验主图。99.5%和27.9%这两个数字,就出自这里的官方摘要。
99.5%到底是什么意思?先把冷水和热血一起泼
你必须知道一个被标题党反复模糊掉的真相:
这个99.5%指下游任务性能的保持率,无法证明“原文每个细节都能无损还原”。多选题即使丢掉几个细节,也可能选对。“几乎无损压缩”和“任务上差不多能答对”需要分开理解。
结果依然惊人在QuALITY长文多选题和MeetingBank会议纪要基准上,上百次实验配置画出的“压缩-准确率曲线”显示:强压缩下,自然语言摘要和LLMLingua-2的准确率跌得更陡,BabelTele更能稳住任务语义。人类大学生做BabelTele阅读理解,正确率明显下滑;强指令模型仍保持高正确率
论文的核心发现由此显现:人类可读性、语言流畅度和模型侧语义可恢复性,在某种程度上可以脱钩。这项实验也松动了人们对机器语言的既有认识。
不过,冷水要先泼日文社区的独立复现发现:用结构清晰商业文本+强模型,解码能力确实存在;但在“字符变短≠token变少”这个坑上,拉丁缩写和罕见符号在某些分词器下可能吃掉更多token。一位日本创作者用日文测试后得出结论:压缩幅度高度依赖输入冗余,冗余英文长文才有夸张空间,本来就密的日文短文会滑向“难读化”。
拼上这些限制,才能看到较完整的面貌。这是一项惊人的前沿实验,代价同样不可忽视。
凌晨三点的噩梦:当通信管道变成黑箱
社交平台上最锋利的一条评论,来自账号Shinka-AI:
“27.9%的token换99.5%的保真度,这压缩比疯狂极了,直到你凌晨三点要在BabelTele里调试生产故障。”

▲ 这条评论精准击中了BabelTele最大的软肋:人类无法审计的中间消息,会把调试变成黑箱。压缩率的另一面,就是可解释性的深渊。
这句工程师式的幽默点中了可观测性的危机。
今天,多智能体系统的中间消息、记忆摘要、协作内容,清一色是自然语言散文。如果你怀疑系统哪里出了问题,把日志打开,你至少能读懂。这是一道不可替代的安全网
但如果未来agent之间用BabelTele通信,这道安全网就会无声蒸发。你打开日志,看到的是符号混合物你分不清哪里是正常通信,哪里是故障,哪里是被投毒或被操纵的非预期行为。
论文在伦理与风险段明确写道:把文本变成非标准紧凑表示,可能以意外方式改变原文本行为;安全关键领域可能损害安全性或引入非预期风险。
这几乎是科学家用最谨慎的措辞发出的最严重警告。
根本矛盾:省下来的token,可能变成更长的思考
还有个更深层的权衡,藏在论文的实验数据里。
作者检查了阅读端的思维链token量。结论是:更强压缩往往伴随更长思维链。输入省下来的token,会部分转化为输出端的推理成本;信息处理量从输入端移到了模型内部的思考过程。
这跟人类世界一模一样电报时代,一字千金,于是写电报的人把信息压到极致,读电报的人却要花更多心力去解读展开。压缩会把一部分成本从发送方转移给接收方。
对AI系统架构的冲击因此极其深远。如果人机界面层和机机内部层分离,则审计、合规、事故复盘都要面对全新问题。一位评论者的比喻非常精准:BabelTele并没有去掉“模型可读性”这个问题,它只是把问题从语言复杂度转移到了编码密度。

▲ 论文中的多智能体通信实验:同构通信token削减38.96%、得分保持96.6%;异构通信削减44.21%、得分99.7%。这是“智能体通信”直接证据图,也解释了产业界为何兴奋。
比BabelTele更激进的,已经来了
如果把BabelTele放在更大的技术光谱里看,还有更极端的路线。
arXiv:2511.09149提出了Interlat:让智能体完全在潜伏空间里通信,直接传递模型最后一层的连续隐状态,绕过把内部状态下采样成token的损失。作者把灵感比作“心灵感应”,跳过符号语言。
BabelTele仍是文本通道上的黑盒友好方案,能走现有API和日志;Interlat则更接近系统内部原生协议,带宽更大,但互操作性、可审计性、跨厂商部署门槛全都更高。
两者共同指向一个结构压力:自然语言作为智能体中间语,开始显得又贵又窄。
而在更早的时代,强化学习研究者就观察到智能体在合作博弈中自发发展出私有通信协议。那时大家批评这是“不可解释的密语”今天LLM智能体把问题换了皮:默认用英语协作,可解释性好,但token账单与上下文污染严重。BabelTele像是在两个极端之间,找一种仍落在文本上、却对人类不友好的中间态。
巴别塔的隐喻:这次,人类被关在门外了
“巴别塔”在《旧约》里的故事是,上帝把人类的语言变乱,让彼此听不懂。BabelTele的名字本身就在暗示:也许这次,被关在门外的那一方,是人类自己。
人类文明反复在通用可读与专家密写之间摆动。拉丁文曾是学者通用语,却把外行人关在门外。医学缩写和法律术语提高效率,也制造误读事故。但AI内部的“黑话”,与这些都不一样:它生产的密度和迭代速度,超出了任何人类专家系统的历史经验。
一位使用者说,他早就这样用了两年:给一个懂多语言、数学、代码和《星际迷航》的人写信,可以用英文、法文、公式和代码混写,语法烂完全没关系。
问题是,下一个版本的这封信,可能连写信的人自己都读不懂了。
这是一个属于2026年的魔幻时刻:人类创造了史上最强大的语言模型,然后亲手把人类从通信回路里请了出去。背后的动力落在了成本、token和时间上。
省下来的每一分钱,都是用可解释性换来的。
值得吗?
这个问题,没有一个凌晨三点的工程师能笑着回答你。

夜雨聆风