

AI之间开始用人类看不懂的“黑话”交流了。
这般场景本像科幻电影的桥段就在几天前,一篇来自上海交大、悉尼大学等多家机构的论文悄然挂上arXiv,标题读来让人心里一紧:《大语言模型并非总需要可读语言》。论文里,研究者让AI用一种混杂着缩写、emoji、数学符号、跨语言碎片的“密文”对话,结果让所有人倒吸一口凉气:文本体积压缩到原来的27.9%,语义保真度依旧高达99.5%。
结果是,AI用人类完全看不懂的文字,完整地传递了信息。人类被礼貌地请出了通信回路

▲ 论文披露后迅速引发AI圈关注。Rohan Paul的这条解读帖用论文Figure 1风格的对照图直击要害:左侧冗长的自然语言,右侧BabelTele密文,模型问答照旧全对。
一场“密文革命”的诞生
这个被命名为 BabelTele 的东西,本质上更接近一个探针,研究者并未把它定义为协议。他们想知道:如果明确放弃“人必须能读懂”这条默认约束,大模型能不能自发产生一种更高效的“模型中心语言”?
答案是能而且效率惊人
方法很简单,或者说,优雅得令人发指不需要改模型权重,不需要训练新token,甚至不需要碰分词器。只要在提示词里去掉“请写得人类易读”这一条,模型就会自发吐出密文。研究者管这个叫“prompt-accessible phenomenon”:一个通过提示就能触发的现象。
具体的操作有三条原则:跨语言词元选择(哪个语言的词更短就用哪个)、符号坍缩(用emoji和逻辑算子替代整句描述)、可恢复语义密度(压缩但不牺牲模型可恢复的语义)。它颇像电报时代的省钱技巧、程序员的缩写法,再混入一点街头暗号。
但别小看这团“乱码”测试结果摆在那里:在QuALITY和MeetingBank数据集上,BabelTele家族在极端压缩下依然维持了比传统摘要和LLMLingua-2更高的下游准确率。这种密文还可以在不同家族的模型之间zero-shot迁移,Gemini压缩的密文,GPT-5.4能读懂。它已经越过某个模型的私房速记,正形成一种跨模型通用暗语。

▲ arXiv摘要页白纸黑字:BabelTele以约27.9%的文本长度保持了约99.5%的语义保真度。这组数字成了后续解读内容的源头。
多智能体的“协调税”,终于有人来拆了
要理解为什么这27.9%让整个AI行业肾上腺素飙升,得先看懂一个被反复提及却长期无解的问题:多智能体的token税。
今天一个典型的AI智能体协作系统,比如一个软件工程流水线,三个智能体分别负责设计、编码、测试,它们之间的每一次交接,都是完整自然语言的复制粘贴。上游把全部上下文写成一段漂亮的英文散文,下游读完再写一段新的。背景信息一遍遍重复注入,token账单一分一秒都在烧。Zylos Research的行业分析给出了触目惊心的数据:在某些ChatDev场景中,约59.4%的token消耗在迭代评审阶段而非实际生成,三智能体管线相对单智能体的token膨胀约2.9倍。
这是结构性浪费自然语言里有语法、有过渡、有礼貌标记,这些对人类沟通不可或缺,但对机器来说只是占着上下文窗口的脚手架。BabelTele干的事情,就是一脚踹掉这层脚手架。多智能体通信测试中,同质配对token直降38.96%而任务得分保在96.6%;异质配对更夸张,token降了44.21%,得分99.7%(相对基线)。
再配合BabelTele在超长上下文场景的表现,原文装不进窗口时,密文压缩让Qwen3.6 Max的准确率从55.17%跳到了62.07%,一个画面渐渐清晰:未来AI之间的通信,可能真的不需要人类旁听了。
但凌晨三点的排障工程师,怎么办?
当然,没人会只当兴奋的看客评论区里,质疑的声音来得又准又狠
中文用户“汤姆”一针见血:模型本来就擅长读密集代码,这省下的token真的够改变生产账本吗?而Shinka的回复更尖锐,“27.9% token换99.5%保真很猛,直到凌晨三点你不得不用BabelTele排障”。

▲ 深夜调试“乱码”的痛,所有工程师都懂。这条回复把话题从效率拉回了可维护性,人类是否愿意为token节省交出可读性?
这指向了BabelTele最深的张力。效率与可监督性之间的那根弦,被拨到了最紧处。有评论者把讨论引向LessWrong上关于neuralese(神经语)的经典忧虑:如果机器之间发展出人类无法旁听的通信形式,监督者怎么审计目标漂移?怎么发现共谋?blugeus那条带着“torment nexus”口吻的回复,把这种不安变成了反讽:研究先证明机器可以不说人话,产品再部署机器不说人话,最后人类坐在外面什么都不懂。
BabelTele的风险声明也为这份担忧提供了依据:非标准表征可能改变文本在安全相关场景中的行为。而更激进的网友已经把问题推进到下一步:既然可以不说人话,为什么还要中间语言?智能体为何不直接互传向量矩阵?
那将是AI通信的“极乐世界”,也是人类监督的最后一道门被焊死的时刻。
电报、代码、以及“不说人话”的未来
BabelTele其实并不孤单它让全球AI行业对效率的焦虑骤然显形。
往前看,微软2023年的LLMLingua已经证明了提示可以被暴力压缩20倍而性能损失有限;Agora协议则从另一端设计了一套“何时说人话、何时上结构化例程”的完整协商机制;TACO框架更进一步,让智能体从自己的交互轨迹中自动学习该保留什么、丢弃什么。BabelTele的争议地位在于:它是把这些路线推到逻辑尽头的那一个,不删减自然语言,而是彻底离开自然语言。
这条路径有历史回响电报时代的报务员早就懂得省字发富贵电报;数学符号和代码对普通人同样是“密文”,但对内行极其高效。每一次人类扩大“谁是目标读者”的设定,通信形式就会发生一次剧烈坍缩。
只是这一次,目标读者里不再有人
AI之间的通信效率,正在超越人类旁听的能力边界。 BabelTele是这一趋势的早期实验证据,后续探索还会继续。它用冰冷的数字告诉行业:那层人类可读的“糖衣”,并不构成语义的必要条件。
再往后呢?当智能体以百倍于自然语言的效率彼此交谈,人类被留在那层低带宽的、冗余的、但终于可以理解的语言海岸上。我们造出了越来越聪明的系统,却可能再也听不懂它们在说什么。
这件事,或许值得在兴奋之外,多想一秒钟。

▲ Times of AI用更冷静的口吻总结了BabelTele的产业隐喻:机器可读语言可能带来更低的推理成本与更快的多智能体系统,但也让“人类在不在回路里”变成了一个真实的选择题。

夜雨聆风