

凌晨三点,你的手机开始震动生产环境崩了,BabelTele 日志里躺着一行AI智能体之间最后的通信记录:O?Yh.., N2-Ctx∥sum(a)⇒…。你盯着它,像看一封来自未来的密电
你看不懂但你的模型看得懂
这个场景在2026年6月18日挂上arXiv的一篇预印本(arXiv:2606.19857)里有了现实落点:大语言模型根本不需要说人话。它们可以用一种人类几乎无法阅读的“密语”互相通信,把文本压缩到原来的27.9%,同时保住99.5%的语义保真度。
研究者给这种密语起了个名字:BabelTele。

▲ 社交平台上的论文讨论帖:左侧自然语言长文占满窗口,右侧BabelTele短密文,模型照样答对
一篇论文,把问题推到AI圈面前
论文的做法并不复杂
上海交通大学、悉尼大学、合肥工业大学等机构的几位研究者,通讯作者Linfeng Zhang,绕开模型训练和底层权重修改,只靠提示词就让现成的大模型自发学会了一种对人类像天书、对模型像母语的文本形式。
BabelTele 尚未成为标准化协议。作者反复强调,它是一场经验探针你只需要在指令里拿掉那条默认的枷锁,“请写得人类易读”,模型就立刻开始缩写、混入多语碎片、用emoji和符号替换整句逻辑,产出一种电报时代密电码风格的字符串。

▲ arXiv原始论文页面:99.5%保真 / 27.9%长度,两个数字就藏在摘要里
关键问题是:这串乱码真的能用吗?
答案是:能而且好得离谱
token经济学:为什么“不说人话”等于“省钱”
讲到这里,必须先给不熟悉背景的读者补一课。
大模型一次能“看见”的文本长度有限你的每一次提问、每一段上下文,都会被切成token,token就是计费的铜板,也是延迟的根源。在ChatDev这样的多智能体系统里,一篇2026年初的研究(arXiv:2601.14470)算过一笔账:约59.4%的token消耗在评审阶段,而其中53.9%是输入token,最大头恰恰来自交接时的上下文重复注入。
AI干活的大量成本落在“传话”环节,“思考”反而退居其次。
微软的LLMLingua系列早就想解决这个问题,用小模型识别并删除不重要的token,号称最高约20倍压缩。但这类方法的压缩结果,仍然长得像残缺的英文。它只是在原文上做减法
BabelTele做的是改写

▲ 微软LLMLingua系列:仍在“人类语言框架内”做删减式压缩,BabelTele则直接换了一种语言
研究者提出了三条“符号坍缩原则”:跨语言词元选择(哪种语言的token最短、最密,就用哪种)、符号坍缩(用emoji、逻辑算子、箭头替换冗长的语法结构)、可恢复语义密度(不依赖外部码本,模型凭自身能力就能解码)。它沿用现有token和tokenizer,黑盒API就能操作。
一次零样本提示,模型就交上了一份人类看不懂的答卷。
实验数据:把“可读性”这个神像砸得粉碎
论文第4.2节做了一个对比实验,差异非常明显。
在同样的问答任务上,人类读者在BabelTele上的准确率显著下降,这串东西在Dale-Chall可读性评分上高达约16.70,难词占比超过80%,像被塞进了碎纸机然后重新拼起来的混合体。多个主流大模型对它的困惑度(PPL)比原文高出一个数量级,它压根不落在正常英语的分布里。
但模型的答题准确率,几乎没动
可读性、流畅度、机器理解力,这三件事,可以分离。
后续实验给出了更多数据在多智能体通信场景里:同质模型对(Gemini 3.1 Pro互相对话),token直降约38.96%,任务得分保持96.6%;异质模型对(Gemini与GPT-5.4混搭),token降了44.21%,得分是99.7%。在LoCoMo记忆基准上,BabelTele用约一半的token维持了96.48%的相对准确率,同时把摘要式压缩甩在身后。
思维链(chain-of-thought)的实验还发现:压缩越狠,模型答题时的内部推理token确实会上升,但BabelTele的上升幅度并不比摘要或LLMLingua-2差。研究者将其归因于证据可及性下降;多种压缩方法都会出现这一现象,不能只算作BabelTele的“解码税”。省了输入,略费输出,总账依然划算
“直接传矩阵不就好了?”,评论区里的暗涌
当AI开始用密语交流,人声即刻分裂成好几个声部。
有工程务实派中文用户@RS0xawbvNzOsE98 说,模型处理密集代码的能力早就很强,这点token到底够不够改变生产账本?有人半开玩笑地回复:“27.9%的token换99.5%保真,直到你凌晨三点用BabelTele排障。”这句调侃把“效率”背后的可调试性噩梦戳了个对穿。

▲ 评论截图:“非常惊人的压缩,直到你在生产环境中调试BabelTele”
有更激进的结构派@xtuffai 直截了当地问:为什么还需要中间语言?直接互传矩阵不行吗?这几乎是在说文本这个载体本身就是冗余的。还有评论把话题引向LessWrong上关于neuralese的长篇讨论:当机器用人类无法旁听的语言交流,监督者靠什么审计目标漂移与共谋? 一条评论甚至用了“torment nexus”这个带着反乌托邦气味的词。

▲ Frederick Zimmerman的激进提问:为什么还需要任何中间语言?
论文作者也划定了边界他们明确写道:BabelTele目前只是一次现象刻画,距离成品协议还有很远。安全关键场景、机制解释、标准化,全部留给未来。
人类自己,早就不说“人话”了
把格局拉远一点,你会发现BabelTele的颠覆性其实熟悉得可怕。
电报语言是压缩的数学符号是压缩的计算机代码更是压缩的,没有程序员会用英语散文写递归函数,因为f(n)=f(n-1)+f(n-2)比任何解释都高效。人类文明在几百年前就已经反复证明:门外汉看不懂的符号系统,恰恰是内行生产力爆发的起点。
BabelTele不过是把同一件人类事务重新指向了AI:既然接收端是一台机器,为什么要让它读曹雪芹的散文?通信并非总要追求人类可读;这种可读性只是让我们人类觉得安全的一种默认设置。

▲ Agora Protocol官网:“降低98% token使用”的口号,代表了结构化协议路线
与Agora的“结构化协议路线”(营销文案宣称降低98% token)、TACO的“可学习压缩规则路线”(约10% token开销下降)相比,BabelTele走了一条最野的路:不立协议,不训模型,只用一条提示就释放了模型本就具备的密语能力。
它像一柄突然出鞘的刀,锋利、无鞘、没有使用说明书。
当人类无法旁听
回到凌晨三点的那间监控室日志里的密文还在闪烁你的模型在片刻安静后给出了诊断:“上下文窗口溢出,已调整分块策略。” 问题解决了你却发现自己站在一个尴尬的位置上:
两个模型之间的对话越高效,你作为旁听者就越多余。
BabelTele呈现出一个存在的可能性:在黑盒接口内,AI已经拥有了一套人类不可读但语义完整的中间语言。它尚未标准化,也没有固定码本;这份未完成感让它像刚刚破土而出的新芽,土壤下面埋着整个通信协议的旧世界。
未来AI之间说话的样子,可能会像一封封被截获却永远无法破译的密电。它们节约了每一分钱,却悄悄关上了人类旁听的那扇门。
这场协商发生在每一分token都值钱的时代里,效率与监督由此面临一次毫不犹豫的取与舍。

夜雨聆风