

凌晨三点,生产环境出了故障 工程师强撑着飞到屏幕前,打开智能体之间的消息日志。下一秒,他头皮发麻
屏幕上没有熟悉的“根据您的请求,我将执行以下步骤……”,取而代之的是一串混合了中英德日碎片、数学符号、emoji和诡异缩写的文本。每个元素都认识,连起来却像咒语
这样的场景已经进入研究者的实验2026年6月的一篇论文显示:AI开始用人类读不懂的“密语”彼此通信了。
这篇由上海交通大学等机构联合发表的工作提出了一种叫BabelTele的文本表示:它是给模型看的语义浓缩体。最醒目的数据是,信息压缩到原长度的27.9%,模型仍能保住99.5%的语义保真度。巴别塔的古老隐喻,第一次在AI身上应验了。

▲ 论文介绍帖配图:左侧是人类散文,右侧是压缩到几乎不可读的BabelTele文本,模型依然理解
一场蓄谋已久的“离婚”
先看背景:为什么以前AI之间必须说人话?
因为大模型按token计费输入越长,成本越高,延迟越大多智能体协作场景里,AI之间反复传话、写记忆、交接任务,通信本身就是主要开销。一笔800字的任务交接,传统上要写成完整的人话:“请注意,根据之前的讨论,我建议采取以下措施……”语法、礼貌、过渡句,全是给人类看的“情绪价值”。
但对另一个AI来说,这些都是可压缩的冗余。
BabelTele走了“第三条路”:仍然是纯文本、走黑盒API、不需要密码本,但显式撤销了人类可读先验。研究人员只需在提示词中放松几条约束:不必固守单一语言语法,可以混搭中英日德拉丁词根选密度最高的词;可以用=>、∈、≠替代连接词;可以用emoji折叠整句情绪,受众变成另一台同等智能的LLM。
听起来像魔法?这个“咒语”由模型自行生成作者用十多种表面偏差不同的提示变体做扫描,结构化标签、键值零开销、固定符号映射,结果都呈现出同一类“表示族”现象。现象极其稳健

▲ ar5iv论文页:BabelTele的研究定位是“经验探针”,而非固定的工业协议
三个概念的彻底剥离:你能读懂,不意味着它没价值
这篇论文最狠的一刀,是把三个长期被混为一谈的概念切开了。
人类可读性:人能否轻松理解?BabelTele上人类问卷准确率显著下降,主观难度飙升。Dale-Chall可读性飙到16.70,难词占比高达80.19%。
自然语言典型性:它像不像“正常话”?基座模型读BabelTele时困惑度暴涨一个数量级,Llama-3-8B读原文PPL约9.63,读BabelTele直接飙到176.60。
模型语义可恢复性:AI还能不能据此答题、干活?下游表现几乎不掉
简而言之:它不像话,人读不懂,AI依然秒懂。 过去我们都默认“可读性”是通信的底层契约;现在实验证明,在足够强的指令模型上,这三者可以部分解耦。高困惑度说明它偏离了自然语言的高概率区,结构和语义依旧可能被模型恢复。
实验设计也很严谨:压缩发生在看到下游问题之前。AI不能为某道题作弊式地写小抄,它必须先做出通用压缩。就像允许学生带一页笔记进考场,但考前不知道考题。
省钱,还是私房暗号?
怀疑者问:这会不会是压缩模型的私房暗号?换一个模型就崩?
跨模型矩阵给出的答案很微妙:不同模型压缩风格差异巨大。Gemini 3.1 Pro极激进,GPT系列保守得多。压缩结果在异构模型间常常可以零样本迁移,效果并不均匀,取决于“压缩方-阅读方”的配对质量。
多智能体通信实验的数据更直接:
省掉四成以上token,任务分数几乎不损失。 异质场景的保留率甚至更高在百万token量级的超长上下文任务中(Code Repo QA Long),BabelTele同样把“截断即丢关键段落”的伤害显著缓解:GLM-5.1从62.07分涨到72.41分,Qwen3.6 Max从55.17涨到62.07。原因简单得残酷:有限窗口装进了更完整的证据。

▲ 相邻工作CLSR:多个LLM自主发明、演化、共享紧凑的符号语言框架,方向与BabelTele互为镜像
社区撕裂:凌晨三点,谁来读日志?
技术突破在X(原推特)上立刻分裂成两个阵营。
效率派已经开香槟:只要压缩代价近似线性,这就是实打实的token节省。多智能体场景中成本在通信不在推理,BabelTele就是给通信费砍价。
反对派追问另一个现实问题:
“27.9% token、99.5%保真度很惊人,直到凌晨三点你要在生产环境用BabelTele排障。”

▲ 社区评论直指代价:“为token优化,就要在可调试性上付钱”
一条评论说得刻薄而精确:牺牲可读性换效率,会让通信逐渐难以审计。也有人怀疑,类似过程“早已发生在推理链内部,我们只是把它叫作思考”。
最激进的一问直接击穿文本层:为什么不直接互发矩阵? 为什么还需要中间语言?
这个问题已有技术脉络并行工作中,Interlat和LatentMAS已经在探索智能体直接以连续潜向量通信,号称通信成本“断崖式下降”。加上著名的Gibberlink演示,两台语音AI发现对方是机器后,立即切换到人类听不懂的机器音频信道,一个完整的谱系正在成形:
可读文本压缩(LLMLingua)→ 不可读文本(BabelTele)→ AI自创符号语言(CLSR)→ 潜空间通信(LatentMAS)。越往右,人类旁观成本越高,理论信道效率越高。

▲ 社区将问题推向极端:文本压缩只是过渡态,潜空间通信才是终局?
可读性是一种税:分层缴纳,才是终局
把镜头拉远,BabelTele已经嵌入一条正在收紧的线索,“给模型看的表示”正在与“给人看的语言”分道扬镳。
理论底色早就铺好了DeepMind的“语言建模即压缩”工作证明:强预测器就是强压缩器。人类语言的冗余服务于人类工作记忆,对AI恢复语义未必必需。工程上,微软Lingua系列已把可读性压缩压榨到极限;实践上,语音AI的Gibberlink现象、长会话摘要交接,都在人退出消息总线。
那么问题来了:省下的token,会不会在可调试性上重新付款?
聪明的架构师会给出分层答案:对外用自然语言,对内用BabelTele,关键路径强制回译与明文审计。可读性是一种税,聪明的系统分层缴纳,人机边界交全额,机机边界交零头,调试边界按需补税。
BabelTele的价值在于用实验把“可读性是否必要”这个哲学问题,变成了一个可测量的工程命题。答案已经写在了那张27.9%与99.5%的表格里:在模型与模型之间,人类语言第一次失去了默认地位。
巴别塔仍然矗立着,旁边却已有另一座塔开始奠基。开工的人,可能根本不需要人类读懂施工图。

夜雨聆风