想象一下:凌晨三点,线上服务报警,你打开日志,看到的是这样一行字,
Gov/deficits>US|14th-C⛪|Prices📈|cheap🍷/🌸|South(Wallonia)=FR
看起来像乱码、加密攻击,或某个程序员喝多后留下的注释其实,这是两个AI智能体之间正在发生的对话
它们已经不屑于跟你说人话了。
一场悄悄发生的"语言叛变"
2026年6月,来自上海交通大学、悉尼大学、西安交通大学等五所高校的研究团队,在arXiv上发表了一篇读起来像宣言的论文:《Large Language Models Do Not Always Need Readable Language》,大语言模型,并不总需要可读语言



▲ AI资讯账号Rohan Paul对该论文的长帖概述,在X上引发大量讨论
论文的核心问题,其实一点都不复杂,甚至有一种"说破不值钱"的质朴感:
如果信息的接收者是另一个AI,我们为什么还要逼它读人话?
人类语言是为人类设计的。它需要完整句法、话语标记、行文节奏,还有让人读起来"顺"的那一层冗余但对于一个已经吞噬了万亿字符的大模型来说,这些脚手架,它根本不需要
研究团队把这套面向机器的高密度文本命名为 BabelTele(巴别电报)名字来得讲究:巴别塔是圣经里人类语言四分五裂的起点,电报是人类为了省钱省字把语言压缩到极致的发明两个意象叠在一起,隐隐指向一个问题,当接收者换成机器,语言的边界在哪里?
数字打脸直觉:压掉七成,还能答对
最让人瞠目的实验结果,是这两个数字的组合:
- 文本体量压缩至原文的27.9%
- 下游任务性能保持率:约99.5%
用大白话说:把一篇文章砍掉七成多,AI读完仍然能答对几乎一样多的题

▲ 论文arXiv摘要页,标题与核心数据清晰可见
但这里藏着一个容易误读的坑。
note.com上,日本研究者“たぬ”在复现实验后写道:这个"99.5%",衡量的是任务性能保持率,无法等同于"原文可以无损还原"简单说,多选题答对的比例基本没变,但这不等于被压缩掉的信息真的"都在"就像你把一本书的目录背下来,依然能回答"第三章讲什么",但你不能因此说你背会了整本书
研究者还特别警告:在跨模型场景下,如果压缩器和读取器分属不同厂商,性能可能骤降,"保真率"低的时候,能跌到七成左右BabelTele更接近有口音的方言,不同家的模型互通起来,多少会有点卡
它长什么样?一眼看懂为什么工程师会崩溃
论文里的配图是最直观的说明。左边是标准的人类散文段落,流畅完整;右边是BabelTele之后的版本,
混合了英文缩写、中文字符、数学符号、emoji,以及几乎所有你在正式文件里不会看到的东西人类看了,基本摸不着头脑。但把同样的内容喂给Gemini、GPT这类指令微调大模型,它们仍然能据此准确回答问题
这个结论的深远之处在于:研究者用实验证明,人类可读性、自然语言典型性、模型侧语义可恢复性,这三件事是可以分开的
它们以前被我们当成一个整体,因为人类用语言的时候,这三件事总是同时发生但AI处理语言的方式不同。
工程师的噩梦,已经写在评论区里了
消息一出,X上的讨论炸开了锅。

▲ @ShinkaIoT的评论:"27.9%的token换99.5%的保真度,确实很疯狂,直到你凌晨三点在生产环境里调试BabelTele"
@ShinkaIoT 的那条评论,大概是整个讨论区最扎心的一条:
"27.9%的token换99.5%的保真度,确实很疯狂,直到你凌晨三点在生产环境里调试BabelTele。"
这话戳穿了一个现实:省token的代价,是可调试性

▲ @emadgnia:优化token,就要在可观测性上付账
工程师 @emadgnia 写得更直接:把智能体间的消息压成密语能省上下文,没错但一旦出了问题,没有人,包括模型自己,能不借助解码器就读懂那条日志你为token优化,你就要在可调试性上付账
而另一位开发者 @Chainbuilderpro 指出了更深的一层问题:一旦智能体开始说BabelTele,系统瓶颈就从"怎么写消息"转移到了"如何验证压缩是否保留了原有意图" 你以为省下了成本,但验证压缩质量的成本,可能又悄悄补了回来

▲ @Chainbuilderpro:瓶颈不会消失,只会转移
但有人直接说:你们还在纠结什么?
这个讨论里还有一个最激进的声音,来自 @xtuffai:
"为什么还需要什么中间语言?它们直接互相传矩阵不就好了吗?"

▲ @xtuffai:为什么不直接互传矩阵?
这个质疑恰好对应着另一条真实存在的技术路线
研究团队 DAIR.AI 介绍的 LatentMAS 方案,走的就是这条路:智能体之间不通过文本交换信息,而是直接在连续潜空间里协作,用最后一层的隐嵌入当作"思维传递",连文本中介都省掉



▲ LatentMAS:直接在潜空间协作,连文本都不要了
如果说BabelTele是"把人话压缩成天书",LatentMAS就是"连天书都不写了,直接递脑电波"
两条路,各有边界。BabelTele的优势在于它走普通API接口,跨厂商、跨模型都能用;LatentMAS则要求同栈、开放隐状态,适合深度集成的系统 一个是现实主义的工程折中,一个是理想状态下的彻底颠覆
一个更大的幽灵正在靠近
在OpenAI研究员 Rajan Agarwal 的技术博客里,有一段话读起来有点发凉:
他在用强化学习让模型自己"学会"压缩上下文,目标是让AI智能体可以连续运行数天在训练过程中,模型自发出现了一些行为,激进地剪枝、发明密集的标点规则,甚至主动切换到中文token,因为中文单字的信息密度更高

▲ Rajan Agarwal:模型在RL训练中自发发明了约10倍的上下文压缩策略
没有人教它这样做。是它自己摸索出来的。
而BabelTele论文里,研究者只是改了提示词,没有做任何训练,模型就已经开始写出人类看不懂的密语了
两件事放在一起,你会产生一种奇妙的不安感:我们以为AI在学习用语言和人沟通,但它们或许同时也在摸索一套不给人看的内部语言,无意隐瞒,只因那样更有效率
最后这道题,没有标准答案
BabelTele揭开了一个技术可能性,也带出一场关于AI系统设计哲学的分歧
一边是效率:token是成本,是延迟,是窗口有限的硬约束;既然接收者是模型,为什么不用最适合模型的方式说话?
另一边是可控性:人类既是信息的发送者,也是审计者、监管者、出了事要背锅的那个人日志必须能被人读懂,审计和排障都离不开它
智源社区的论文页面上,有人在评论区总结:机机通信的边界,同时关乎技术与信任
当两个AI用人看不懂的语言交谈,效率确实提升了但那一刻,人类从通信链路里悄悄退场了
这是进步,还是失控的开始?
BabelTele给出了数字,但这道题的答案,还得我们自己来写
论文原文:arxiv.org/abs/2606.19857标题:《Large Language Models Do Not Always Need Readable Language》
夜雨聆风