

机器之间,正在发明一种人类读不懂的“母语”。
科幻感扑面而来2026年7月,一篇来自上海交大等机构的论文在AI圈引发热议。它证明了一件让人紧张又兴奋的事:大模型之间通信,根本不需要人类语言这个“中介”。 一份文本被压缩到原长度的27.9%,人类看得头皮发麻,模型却能保住99.5%的语义。
想象一下:两个AI在你面前飞速交换信息,屏幕上滚过一串混杂着emoji、数学符号、中英德日碎片、逻辑运算符的“天书”,英语和中文都被拆成了其中的零件。你一个字都读不懂,但它们什么都明白。
这门“机器黑话”,论文作者称之为 BabelTele。

▲ 论文摘要与自然语言、BabelTele两种表示方法的对比示意
一桩“皇帝新衣”式的AI丑闻,被21页论文撕开了
多智能体系统的圈子里,长久以来藏着一句没人敢说破的默契:模型跟模型对话,还得用人类读得懂的自然语言。 记忆写成段落,任务交接写成说明,中间状态写上“请注意……因此我们……”。为什么?因为人要审计、要调试、要装作一切仍在掌控之中。
这篇论文把这个默契撕得粉碎
核心论点在于:人类可读性、自然语言流畅性、机器语义可恢复性,是三个可以解耦的东西。 人类散文里那些过渡句、礼貌语、语法脚手架,对不起,对模型来说,大半是可压缩的冗余。
电报体、数学符号和代码都曾展现这种压缩能力。流畅的散文只是语义的一种表面形式,语义还有其他载体。
BabelTele不过是用提示词“放松了可读性约束”,然后看着模型自己长出一套高密度表达:不再固守单一语言语法,可以随意混用中英德日、拉丁词根;用 emoji、=>、∈、≠ 折叠逻辑关系;丢掉情绪句和敬语;保留全部信息细节受众只有一个:另一台同等智能的LLM。
用“鬼画符”问答,人类不及格,模型满分
实验数据,每一个都值得你停下来读两遍。
Dale-Chall 可读性指标:正常文本是6到8分,BabelTele 飙到 16.70。也就是说,它在可读性量表上已经“不属于人类语言”了。基座模型的困惑度(PPL),BabelTele 比原文暴增一个数量级,在 Llama-3-8B 上,原文9.63,BabelTele 176.60。如果困惑度是“语言典型性”的体温计,这门黑话已经烧到了50度。
但最让人起鸡皮疙瘩的是人类和模型的分裂:同一批多项选择测试,人类答题者的准确率明显下滑、主观难度剧增;而 Gemini 3.1 Pro 等指令模型,准确率依然高位运行。
人在坠崖,模型在散步
高困惑度只说明“不像人话”,信息依然可以保有结构。模型无须“先翻译回人话再理解”,可以直接吃掉这团混乱却富含密度的符号组合。作者还强调:压缩是在看到具体问题之前完成的,不存在“为了答题而作弊式摘要”的问题。
多智能体通信:44%的token省下来,任务分几乎不掉
让工程界坐不住的是这两个实验
多智能体通信测试中,两台模型互相传话。同质设置下,token 节省38.96%,任务分数保留96.6%;异质设置更夸张,省44.21%的token,分数达到未压缩基准的99.7%。
什么概念?你花一半多的钱,得到几乎一样的产出。在上下文窗口就是硬通货的今天,这组数字比任何融资PPT都更有说服力。
超长上下文测试(平均百万token量级的代码仓库问答)结果更醒目:原文放不下就截断,QLM/GPT们分数哗哗掉;BabelTele 压缩后拼进去,每个模型都涨了4到10个百分点。
最绝的是:压缩没有额外收“智商税”虽然更密的文本会触发更长的推理链,但作者发现 BabelTele 的思维链增长并不比普通摘要或 LLMLingua-2 更严重。模型无须“先解密再思考”,能够对着天书直接思考。

▲ “为什么还需要中间语言?它们不该直接互发矩阵吗?”,来自社区的更激进之问
凌晨三点,谁来读日志?
掌声之外,社区泼来的冷水同样锋利
“27.9%的token换99.5%的保真度,确实是野蛮压缩,直到你凌晨三点在生产环境用BabelTele排障。” 这条评论十分尖锐优化token,就是在可调试性上花钱。 当系统出了第一个bug,而你面对着一堆emoji和逻辑符号交叉的日志,连“这到底是模型幻觉还是传输错误”都判断不了,那一刻,省下来的每一分钱都会变成咒骂。
更哲学的质疑来自一条被广泛转发的回复:“模型以我们无法审计的方式通信,这是第一步。” 紧接着的后半句让所有安全研究者都笑不出来,“也许这已经在推理链内部发生了,我们只不过把它叫作‘思考’。”
没错推理链的不可读性,已经存在很多年了。BabelTele 只是把它外显到了智能体之间的消息里。

▲ 牺牲人类可读性换效率,被质疑是走向“不可审计通信”的第一步
另一条回复给出了思想史的坐标:BabelTele 被贴上了 neuralese(神经语) 的标签,LessWrong 上关于模型在参数内部使用不可读语言的古老讨论,用一种全新的方式回到了公共视野。“机器母语”概念由来已久;这项研究首次在离散文本层面诱导出这种表达,并测量了它的性能。

▲ 有人用“折磨纽带”梗指向neuralese思想史:这场讨论远比论文本身更老
从语言到潜空间:BabelTele只是过渡形态?
最激进的质疑只有一句:“为什么还需要中间语言?它们难道不该直接互发矩阵?”
这个问题指向了一条更远的路线:潜空间通信。文本和token都是离散的,离散化本身就会带来有损压缩。如果模型之间直接共享连续隐向量,像两台机器之间传送“脑电波”,还要语言干什么?LatentMAS、Interlat 这些同期工作已经在这条路上跑了。语音AI发现对方是机器后切换到高速音频信道(所谓Gibberlink)的演示视频,则把这个隐喻变成了听得见的现实。
于是完整的谱系浮出水面:可读文本压缩(LLMLingua)→ 不可读文本(BabelTele)→ 连续潜变量(LatentMAS/Interlat)。越往右,人类旁观成本越高,理论信道效率越高。BabelTele 是这条路上最后一次还愿意留在“文本”里的抵抗。

▲ DAIR.AI 介绍的潜空间通信框架:从离散token到连续隐向量的下一次飞跃
人读人话,机读机话:一个双重世界的诞生
把这一切放进更大的结构里,你会发现:这是“语言建模即压缩”理论的必然结果。 DeepMind 那篇经典论文早就说过,强预测器就是强压缩器。人类语言为人类的工作记忆保留冗余,而LLM是在海量符号混合数据上训练的怪物,它不需要那些脚手架。
BabelTele 把“可读性是否必要”这个哲学问题,做成了一道可测量的工程题。它的实验表明:在当前强指令模型上,可读性可以部分让渡,而任务不会立即崩坏。
接下来会发生什么?
双轨接口 对外,AI对人类继续讲人话,客服、报告、合规文档,一字一句,温暖清晰。对内,模型之间讲“模型话”,BabelTele、CLSR符号语言、甚至潜向量,分秒必争、token必省。人站在中间,扮演一个日渐失聪的系统管理员。
日志系统将被迫回答一个残酷的问题:默认存哪一轨?关键路径是否强制回译?审计如何抽样? 论文的风险段落自己都承认:非标准表示可能意外改变安全相关行为。换成人类可读的表述,你监控的文本层,可能已经和你运行的通信层采用了两套语言。
这场进展标志着“给机器看的表示”和“给人看的语言”开始分道扬镳。 BabelTele 不会是这个故事的终点,但它精准地画出了那条人类还能勉强看得见的边界线。
越过那条线之后,就是矩阵与潜空间的无人区。
而两台机器在无人区里聊了什么,我们可能永远都不会知道。

夜雨聆风