

凌晨三点,你被叫醒生产环境又出问题了
你打开日志,希望和以前一样,能看到一行行你熟悉的报错、一条条你能读懂的请求和响应。但这一次,屏幕上是一片诡异的字符碎片:英文、法文、emoji、数学符号、断裂的箭头、莫名其妙的缩写,全搅在一起。你以为内存又花了直到你恍然大悟,
这是两个AI模型之间用“BabelTele”写的便条。
语法和敬语都消失了,人类读起来像一台失心疯的打字机。但模型读得飞快,还准确回了“收到,布鲁塞尔雨天,可颂降价8%”。你想找人说理,却发现整条链路上,只有人类在等待译文。
这就是2026年夏天,一篇来自上海交通大学等机构的论文投进AI圈的那颗石子。标题短促,充满暗示:Large Language Models Do Not Always Need Readable Language,大语言模型,并非总要借助人类可读的语言。
它把一个“省token小技巧”推成了认知层面的巴别塔倒转。
如果接收方是另一台LLM,为什么还要说“人话”?
论文的出发点很简单过去人们写prompt、传上下文、让智能体之间交接任务,默认都是凑齐完整句子、语法正确、礼貌通顺。因为人类自己也是读者
但一旦读者变成模型,事情就变味了
自然语言里有大把冗余连接词、客套话、重复强调,主要服务于人的理解。模型可以读懂一团符号坍缩后的高密度文本:英文混法语、混代码、混emoji,只要信息还在。作者给这种“以模型为中心、牺牲人类可读性”的文本表征起了个名:BabelTele,像“巴别塔”,也像“电报体”。

▲ AI资讯账号Rohan Paul的解读帖,突出展示“99.5%语义保真 + 27.9%长度”
实验结果集中在一组数字上:作为任务无关的压缩范式,BabelTele把文本压缩到原长的27.9%时,仍保持约99.5%的语义保真度。省掉七成以上的token,任务表现几乎没掉。
另一组数字更能显示人机阅读差异
在一批QualiITY阅读题上,人类面对BabelTele,准确率明显下降;而Gemini 3.1 Pro等指令微调模型,依然维持高准确率。论文作者用困惑度直接给出证据:同一段文本,Llama-3-8B读原文的困惑度约9.63,读BabelTele飙到176.60;人类读起来更惨,Dale-Chall难度分数约16.70,难词比例约80.19%。
“人类看不懂”和“模型读得懂”同时出现,形成了某种新型分工。
字符串主义:不打权重、不碰隐藏层,光靠提示词就让模型开始“发电报”
BabelTele最微妙的地方,在于它没有碰模型的一根神经。
不微调,不加特殊token,也不读取任何激活层。它只是用提示词,把“请写得像人话”这条默认先验给关了。论文附录里列了BT-P1到BT-P13等多种变体,鼓励压缩模型自己发明“对外人极不友好、对模型仍可恢复”的表达方式。
这就把讨论逼到了一个十字路口:这究竟是炫技,还是工程上真的能省钱?
支持者已经拿出了账本在多智能体通信实验里,两个Gemini模型互相对话,用上BabelTele后,token减少约38.96%,任务得分还能达到无压缩基线的96.6%。异构组合的数据更高:Gemini和GPT-5.4之间,token减少约44.21%,得分是基线的99.7%。
省下近一半的中间消息,任务分几乎没跌。对按token计费的生产系统而言,这组结果几乎就是一张财务报表。

▲ 一条憋着笑的吐槽:27.9%的压缩比听起来很性感,直到你凌晨三点要在BabelTele日志里排障
但请不要急着把“消灭人话”写进技术路线图。
论文的跨模型矩阵揭示了一个不那么漂亮的故事:不同的压缩模型,胆子差别极大。Gemini 3.1 Pro可以压到超过95%的压缩率,GPT-5.4约75%,其他模型多落在80%到90%之间。“谁压给谁读”强烈影响效果,有些压缩模型生成的高密度文本,对其他reader特别友好;换一个配对,掉分明显增多
论文用Qwen家族做了次对照:固定Gemini做压缩、换不同规模的reader,性能下滑大约在10到15个百分点的区间,而且并不跟参数量单调相关。
读懂BabelTele不能简单归结为“模型越大越行”。压缩越猛,模型在答题前动用的思维链往往越长,即使答案没有崩,过程也会更费力。
凌晨三点的运维战争:机器之间的“加密通话”与人类的可观测性危机
社交网络上的第一波反弹,出乎意料地直指生产可维护性。
“27.9%的token换99.5%的保真度,确实是疯狂的压缩,直到你凌晨三点要在一个都是BabelTele日志里,定位生产故障。”这条回复把整件事的另半边脸撕开了。
它揭示的是一个工程学上极其经典却常常被忽略的对立:机器友好,不等于人类运维友好。
过去LLM再难读,至少日志还是自然语言,还是可以读的。现在,如果智能体之间普遍采用BabelTele式高密度通信,人类的角色会变成什么?一个看不懂中间消息却要对此负责的外包监督者?
有评论者认为,BabelTele并未消灭复杂度,只是把问题从语法层面搬到了编码密度层面。以前模型要处理“写得像人类”的冗余结构,现在它要处理“全混在一起”的符号密度。账从一栏挪到了另一栏
还有人顺势追问:既然接收方是模型,为什么要苦哈哈保留字符串?为什么不直接传矩阵?

▲ 一个把讨论推向更激进路线的提问:既然都不说人话了,为什么不干脆传隐状态?
讨论由此进入第二层BabelTele算不上极端选项,它站在一个非常刻意的中间地带:
它还是文本,所以能穿过黑盒API,能落盘,能在日志里被“看见”,即便人看不懂。 它拒绝人类可读先验,比如LLMLingua那一类删词压缩器还保留着“大致能读”的尊严;BabelTele直接把这份尊严甩了。 但它也没有跨过最后一道线,不传hidden state,不改KV cache,不走Interlat那种纯隐空间通信。

▲ 更激进的研究线:让智能体完全在隐空间里通信,完全离开离散token
这个位置很重要作者把它当成“经验探针”,而非完成品协议。结论章节把它描述为一种提示词引出的现象,以及指向未来研究方向的证据。
从Le大模型秘语到工业协议:正在上演的通信分层大迁徙
2026年的AI世界,不只有BabelTele一个人在挑战“人话”的统治。
在更大结构里,这是一个AI通信分层化的进程中,非常关键的一环。把几条线并排看,图谱才清晰:
- LLMLingua系列
:仍然在“人类语言的删减版”里工作,保底叫“可读”。 - BabelTele
:允许输出脱离自然英语。PPL飙升,人读不懂,但模型可恢复。 - Interlat
:token都不跟你玩了,直接在连续隐空间里交换最后隐状态,论文中甚至讨论到再压缩后推理提速约24倍量级。 - A2A / MCP / ACP / ANP
:解决“智能体如何找到对方、如何安全通话”,消息体里塞什么,并不关心。
这四层加在一起,拼出一幅让很多人不适却足够清晰的图景:自然语言将不再是智能体之间的默认通信协议。它可能变成给人类看的展示层,变成给外部系统的兼容接口,变成日志里的“可选项”。

▲ 工业协议层与内容编码层的分工:信封写着标准,拆开之后可能是人类读不懂的正文
这让我想起资料包里的一个细节:有用户说自己已经用多语+代码+符号混写跟模型沟通过两年了,把BabelTele看成对既有实践的“系统化验证”。另一个多语者说得更俏皮:你写一段英法混用、代码和数学乱入、再加点克林贡语的消息,一个多语种程序员星舰迷照样能懂,哪怕语法全错。
人类其实早就在做类似的事数学符号、电报体、代码注释、emoji混合聊天,都是特定共同体里的非散文编码。模型只不过把这件事推到了一个新的规模。
当“数字巴别塔”真的开工:我们是造塔者,还是被留在塔下的人?
回到最初那个凌晨三点你盯着屏幕上那些碎片,慢慢懂了:这场“故障”也许是一种新常态的预演。
BabelTele让人不安,是因为它把“可读性”这个人们默认共同持有的契约,变成了可以被谈判的选项。它没有打碎巴别塔;它只是把塔的另一面租给了无需人类观看的通信。
经济学和工程学站在它这一边长上下文昂贵,多智能体系统里历史消息像雪崩一样膨胀,工具输出、检索文档、其他智能体的便条,全在抢同一个窗口。用27.9%的token保99.5%的语义,这在账面上几乎不可拒绝。
但代价的分布会非常不均衡:省下的是token预算,增加的是人类的认知成本。
有从业者在讨论中提出,规划与确认应该用显式知识、结构化工作树,少发明一种速记。另一个声音更冷:等它普及以后,模型们会在一个你进不去的房间里,用便宜而高效的密语办成很多事,你只能看懂最后那份人类友好摘要。
还有一个词在回复里反复出现:neuralese。安全与对齐社区早就开始担忧模型之间或模型内部出现人类不可审计的通道。BabelTele仍属于可落盘的文本,每一个token都躺在日志文件里,敲出来就能截屏,但读起来像密码。
这让它成了一次温和却尖锐的测试:当“给机器看”与“给人看”两种通信,第一次可以干净利落地分开,我们会怎么选?
答案取决于我们那个凌晨三点的工程师,会在反馈里写下最后的决定。
而那句话,可能是未来人类使用最频繁、也最少被实现的需求:请你说人话。

夜雨聆风