想象一下这个场景:
凌晨三点,你的多智能体系统崩了。你打开日志,屏幕上显示的是这样一段东西,
Gov/deficits>US|14th-C⛪|Prices📈|cheap🍷/🌸|South(Wallonia)=FR
这段像乱码的内容,正是两个 AI 用来互相沟通的"语言"
你看不懂。你的同事看不懂。甚至连 AI 自己,如果没有上下文,也不一定看得懂
但在它们互相传递信息的那一刻,效果完美
一篇论文,让整个 AI 圈陷入沉思
2026 年 6 月 18 日,来自上海交通大学、悉尼大学、合肥工业大学、西安交通大学与南京大学的研究者们,在 arXiv 上悄悄上传了一篇预印本
标题平淡无奇:《Large Language Models Do Not Always Need Readable Language》(大语言模型并不总需要可读语言)
但里面的数字,让很多人读完第一遍就开始皱眉头

▲ BabelTele 论文首页,摘要与示意图展示自然语言和高密度文本的差异
论文的核心结论是:信息的接收者若为另一个大模型,自然语言也许根本没必要
研究者们提出了一种叫做 BabelTele(巴别电报) 的全新文本形式,混合缩写、符号、多语言碎片、表情符号,密度极高,人类几乎完全读不懂,但大模型却能从中精准提取语义
最强实验结果:文本体量压缩到原文的 27.9%,下游任务性能保持 99.5%
也就是说,把一份完整文件压缩到四分之一不到,AI 还是几乎答对了所有问题
"巴别电报"究竟长什么样?
论文里有一张对比图,非常直观。
左边是标准自然语言段落,讲述布鲁塞尔的政治经济背景,密密麻麻的完整句子右边是 BabelTele 版本,寥寥几个片段:Gov/deficits>US、14th-C⛪、Prices📈、cheap🍷/🌸、South(Wallonia)=FR
人类读右边,就像在看别人的烂笔记。但 AI 读完,照样能答题。
BabelTele 是一类"可读性放松的语义投影",并未规定固定协议它遵循三条原则:
- 全语言词元选择
:不拘一格,中文、英文、符号、表情,哪个密度高用哪个 - 符号坍缩
:用 📈、>这类紧凑符号替代冗长的语言结构 - 可恢复的语义密度
:压得再狠,也要让有能力的大模型能解出核心语义
这一切只靠一条提示词就能触发,无须训练、修改模型或调整分词器
这是一个零样本探针。研究者们用它在问:这种能力,大模型早就有了,只是没人问过
数字背后,真相更微妙
27.9% 的体量、99.5% 的保真,这两个数字很快引起关注理解它们的实际含义,才能合理判断这项研究
日本博主“たぬ”读完论文后亲自动手测试,写了一篇非常冷静的复盘他指出:
论文里的"99.5% 忠实度",指下游问答任务的相对得分,与原文内容能否 99.5% 无损还原无关。
它衡量的是任务保持率,不能当成内容重建率在多选题场景里,哪怕压缩过程丢了一些细节,AI 还是可能选对,因为题目本身有容错空间
他还尝试用日本著名诗作《雨ニモマケズ》来测试 BabelTele 解码,结果失败了模型认出了那首诗,直接从记忆里调出内容,并未执行解码
改用一篇自造的销售会议纪要(埋入否定、条件、限定与地点陷阱),同系列强模型7道题全对结论是:在结构清晰的商务文本上,BabelTele 的解码能力"像是真的"
这项测试划出了能力边界:BabelTele 在特定场景下非常有效,也有明显的适用范围
从多智能体系统到超长上下文:它适合哪些场景?
研究者们在三个场景下做了大规模测试,结论一个比一个有说服力
场景一:多智能体通信。
在双智能体协作的 DeepResearch Bench 上,同构设定(两个 Gemini 互传 BabelTele)token 削减 38.96%,性能保持 96.6%;异构设定(Gemini 与 GPT-5.4 互传)token 削减 44.21%,性能保持 99.7%
两个不同公司的模型,用同一套密语互传消息,居然异构比同构效果还好
场景二:智能体记忆。
在 LoCoMo 对话记忆基准上,BabelTele 压缩后准确率 62.53%,相对基线保持 96.48%;而自然语言摘要只有 61.05%,保持率 94.2%BabelTele 赢了摘要。
场景三:超长上下文"装不下"的情况。
当原文超出模型上下文窗口,无法全部送入时,硬截断 vs. BabelTele 分块压缩,Qwen3.6-Max 上,截断准确率 55.17%,BabelTele 62.07%
塞不下的时候,密语压缩比硬截断保留了更多有效证据
跨模型传递密语,效果取决于配对
跨模型实验结果是整篇论文里最迷人,也最令人警觉的部分
研究者们测了一个"压缩器 × 阅读器"矩阵:你用 A 模型压缩,再用 B 模型来读,效果如何?
结果是:大体可用,但强烈依赖配对。
不同模型的压缩风格差异极大:Gemini 3.1 Pro 可以把原文压到 95% 以上,GPT-5.4 相对保守在 75% 左右,其他模型多在 80%–90%GPT 和 Claude 压缩的结果更"便携",对其他读者掉分少;Qwen 和 Kimi 压缩的结果,换个读者读效果下降更明显
实验还有一个反常点:在 Qwen 家族内,换规模测试时,掉点并不随规模单调改善
模型规模无法简单解释这种现象。BabelTele 与不同方言之间的互通颇为相似:模型共享一部分语言基础,也各有自己的口音,转换时难免丢失信息
工程师的现实焦虑:凌晨三点的噩梦

▲ Emad Ghorbaninia 的评论直击要害:优化 token,代价是可调试性
当研究者们在兴奋地讨论 token 压缩率,工程师群体的反应则冷静得多
一位名叫 Emad Ghorbaninia 的开发者在 X 上写道:
"把 agent 间消息压成密集非人类语法,确实省了上下文。但这也意味着第一次出事故的时候,没有人,包括模型自己,能在没有解码器的情况下读懂日志。为 token 优化,就要在可调试性上付账。"
这句话说到了很多人的痛点。一套没有人看得懂的中间语言,意味着你的系统变成了一个对人类不透明的黑盒
另一位评论者的措辞更尖锐:
"BabelTele 仍须模型可读,等于把问题从语言复杂度挪到了编码密度。"
还有人问出了那个终极问题:"为什么还要中间语言?为什么不直接互相传矩阵?"

▲ Frederick Zimmerman 的灵魂发问:既然如此,为何不直接传矩阵?
矩阵,或者说:另一条更激进的路
这个问题,实际上已经有研究者在认真回答了
DAIR.AI 介绍的 LatentMAS 研究走得更远:智能体绕过文本层,直接在连续潜空间里协作,用最后一层的隐嵌入做自回归"潜思维",通过共享潜工作记忆无损传递
连文本中介都去掉了。



▲ LatentMAS:多智能体通信占据大量成本,潜向量可以替代自然语言消息
还有另一条路:让模型自己发明压缩语言
研究员 Rajan Agarwal 用强化学习训练压缩器,让模型在约束下学会自创 token 编码策略训练过程中,模型自发发明了激进剪枝、密标点,甚至主动切换到中文 token 以提高每 token 的信息密度,报告约 10 倍量级的上下文压缩

▲ Rajan Agarwal:用 RL 让模型自学压缩,Qwen 自发发现了用中文 token 提高信息密度
三条路,三种哲学:
- BabelTele:提示即可触发,仍走文本信道,对 API 友好,但人类读不懂
- LatentMAS:连文本都不要了,直接传隐向量,最彻底,但要求同栈基础设施
- RL 自创压缩:模型自己学,上限最高,但训练成本不低
三条路线对应同一个问题在不同工程约束下的三种答案:当接收者是 AI,通信语言要怎么设计?
技术之外,还有 AI 透明度问题
让我们退一步,看得更远一点。
工程压缩工具也好,AI 密语也罢,它们背后隐藏着一个越来越紧迫的问题:
当 AI 系统之间的协调越来越多地发生在人类不可读的信道上,我们还能监督它们在说什么吗?
这项现实的技术实验说明:大模型早已具备产生人类难以理解的高密度编码的能力提示词就能唤起这种能力,训练并非前提
研究者们把 BabelTele 定位为一种"实证探针",以科学实验追问:语言这件外衣,对 AI 来说究竟有多必要?
实验结果让人不安:必要性并没有想象中高
当然,这也意味着:机机信道和人机界面,未来可以,也应该,明确分开给模型看的中间状态,可以用密语压缩;给人类看的日志和审计记录,必须保持可读两套通道,各归其位。
这种分工依赖主动的工程设计,不能听任系统自行演变
尾声:一个旧词的新含义
1949 年,克劳德·香农发表信息论奠基之作他说:在信道容量有限时,好的通信系统应该追求有效传信
七十多年后,我们终于有了一种信道的两端都是"机器"的场景
香农的直觉,今天又一次被验证了,只不过这一次,被优化掉的冗余,是人类语言本身
BabelTele,巴别电报。名字里有《圣经》里的那座通天塔,那座让所有人语言不通、无法沟通的塔
讽刺的是,这篇论文想说的恰恰相反:
也许,那些大模型们,已经不再依赖我们的语言了
参考资料: 论文 arXiv 地址 https://arxiv.org/abs/2606.19857 | note.com 实践复现 | LatentMAS https://arxiv.org/abs/2511.20639
夜雨聆风