当你还在为GPT的账单肉疼时,大模型们已经悄悄学会了一件事,不跟人说人话。
2026年6月18日,一篇来自上海交通大学、悉尼大学等多所高校的预印本论文悄悄上线arXiv。标题听起来平平无奇:Large Language Models Do Not Always Need Readable Language(大语言模型并不总要使用可读语言)。随后,AI社区围绕它展开了密集讨论:
如果信息交给另一个AI,我们为什么还要逼它说人话?



▲ AI博主Rohan Paul在X上介绍BabelTele论文。右侧图示展示:自然语言把上下文窗口塞满仍可能答错,BabelTele压缩后窗口更空、模型仍能作答。
论文提出的方案叫BabelTele(巴别电报)。名字来自巴别塔的传说,人类因语言不通而分崩离析。这一次,语言断层出现在机器与人之间。AI们正在学会一种人类读不懂、但彼此秒懂的“电报体”。
一个难回答的问题:人话是否太啰嗦了?
先回到一个最基本的事实
今天的大模型生态,几乎所有环节都在说人话:知识用自然语言写,指令用自然语言下,输出也用自然语言回。对话训练把“说人话”刻进了模型的骨头里。 这对用户友好,但论文团队指出了一个容易被忽视的代价,
自然语言是为人类沟通优化的完整的句法、语篇标记、语意连贯,帮助人类跟随、记忆和消歧。这些对人有价值,对机器却是冗余 就像你给同事发微信可以用缩写和表情包,但写公文就得把每个字写全,问题是,模型之间的通信,为什么要按公文标准来?
这个问题在多智能体系统中尤其尖锐。当多个AI实例分工协作时,它们靠消息传递任务状态,而这些消息,全是人话。 每一轮“互聊”都在烧token,烧的就是真金白银。
上海交大的张林锋团队决定试一试:如果允许模型输出人类读不懂的东西,信息密度能提高多少?语义还保得住吗?
27.9%的长度,99.5%的灵魂
BabelTele的做法出人意料地简单,不改模型、不动权重、不碰分词器,只用提示词引导。
它给模型下了三条规矩:
第一,全语言选词 不锁死英语或中文,跨语言、跨文字系统挑信息密度最高的词元。日语汉字、数学符号、emoji,什么密就用什么。
第二,符号坍缩 用符号、算符、标点替换冗长的句法结构。一个“→”可能替代一整句因果关系
第三,可恢复的语义密度 保留足够细节让模型能解读,但不依赖外部码本,压缩串本身就是密码和密钥的合体。
结果如何?在旗舰实验设定下,BabelTele把文本量压到原长的约27.9%,也就是砍掉了大约72%的“废话”,同时保持了约99.5%的语义保真。

▲ arXiv论文摘要页,清晰标注了27.9%与99.5%两个旗舰数字
这里要辨清口径:99.5%指下游任务的相对保持率,不能理解成“原文像素级还原”。日本的独立复现者"たぬ"在note上专门拆解了这个口径,QA分数接近,并不等于每个细节都能无损恢复。跨模型测试中的保持率可能散落到74%左右。旗舰数字来自最佳条件下的峰值,无法套用到所有场景。
即便打个折,这个结果依然足够惊人
凌晨三点排障噩梦:效率的代价是什么?
论文上线后,X上的讨论几乎在第一时间分裂成两个阵营。
效率派兴奋不已:多智能体系统的通信账单终于有救了。论文的多智能体实验显示,在同构(双方均为Gemini 3.1 Pro)和异构(Gemini + GPT-5.4)设定下,通信token分别削减了38.96%和44.21%,而任务得分仍贴近未压缩基线,异构场景甚至达到了99.7%。
大量开销花在了“说”上 这个判断在AI工程圈里流传已久,BabelTele终于给出了一组可引用的数字。
但审计派立刻泼了冷水

▲ "27.9%的token换99.5%的保真确实很野……直到你凌晨三点在生产环境用BabelTele排障"

▲ "一旦智能体说BabelTele,瓶颈就从写消息变成了核验压缩是否保留了意图"

▲ "稠密的私有方言会不会直接炸掉可解释性?BabelTele还保留人类可审计的部分吗?"
这些担忧指向同一个恐惧:你省下来的token,可能恰好是人类理解AI在干什么的最后窗口。
X上有一条评论把这件事说得最狠:“标题上的数字是语义保真,论文没写的那个数字是,人类对智能体互聊内容的监督,可能趋近于零。”
“为什么还要中间语言?直接互传矩阵不行吗?”
争论还没停,更激进的声音已经出现了。

▲ "为什么它们还需要中间语言?直接互传矩阵不就好了?"
这个问题并非空想2026年的AI通信领域,至少有四条平行路线在同时跑,
第一条,BabelTele路线: 仍然是文本,仍然走标准API,只是长得人类读不懂。好处是兼容现有基础设施,坏处是每次压缩-解压都有信息损耗。
第二条,自创符号协议(CLSR/LSF): 中科院相关团队的工作让多智能体在测试时自己发明、演化并共享紧凑符号语言,生成token量可降到标准思维链的1/3到1/6。这已经越过普通压缩的边界,走向了发明新语言。

▲ CLSR/LSF的GitHub仓库,智能体自己发明并演化的符号语言框架
第三条,隐空间协作(LatentMAS): 连文本都不要了,直接在隐向量和KV缓存里协作。ICML 2026 Spotlight论文,输出token降了70.8%–83.7%,准确率最高提升约14.6%。
第四条,元协议(Agora): 在系统层根据交互频率,混合标准例程、自然语言和自动生成的例程。它允许多种介质共存,由网络自组织选择沟通方式。
四张付款方式,一张账单:多智能体协调里,通信比思考更贵。
人类其实早就这么干了
有一条X上的回复特别有意思,有人把BabelTele比作文言文和《易经》卦象。
仔细一想,这个类比并不离谱文言文就是“对训练有素的读者高密度、对外行难读”的典型。“克己复礼”四个字,在懂的人眼里是一整套伦理体系;在不懂的人看来,就是四个费解的汉字。数学公式、代码、速记,都是同一种思路,“流畅”和“可恢复”从来就可以分离,关键是谁在读。
但类比到此为止BabelTele的“读者”是经过海量语料训练的神经网络,它的“可恢复”依赖训练分布的重叠,和师徒传授迥然不同。日文复现者做了一个精彩的反例:用宫泽贤治的名诗《不畏风雨》做压缩测试,结果模型直接背出了原文。模型靠回忆补全了文本,并未从压缩串中逐项还原。换成模型没见过的虚构销售会议纪要后,7道QA才全部答对。这提醒我们:评估必须用模型没背过的文本,否则结果会把压缩能力与记忆力混在一起。
这改变了什么,又没改变什么
改变的: 一个直觉被钉成了可引用的命题,在指令微调LLM之间,可读散文只是语义传输的合法外衣之一。对做多智能体编排、长文档问答、会话记忆的工程师来说,“删token的自然语言压缩”和“动权重的隐状态压缩”之外,又出现了第三条路:仍走文本API,但允许表面形式变得人类难读。在上下文窗口寸土寸金的今天,这条路的诱惑力不言而喻。论文在超长文档实验中显示,当原文超出窗口时,BabelTele分块压缩相对直接截断,准确率可提升6到10个百分点。
没改变的: BabelTele目前仍停留在论文实验中,跨模型与跨任务波动大,强压缩可能换来更长的思维链。尤为棘手的是,人类监督与安全审计会变难。 当安全过滤器都是基于可读文本训练的,一段人类读不懂的“电报”该怎么审核?论文自己的风险章节也坦言:BabelTele改写可能以意外方式改变原文本行为,安全关键领域需谨慎。
这或许是整件事最深刻的张力:AI越高效地彼此沟通,人类就越难旁听它们在说什么。 效率和透明,可能正在变成同一枚硬币的两面。

▲ LessWrong上关于"Neuralese"的讨论:当思维链从token空间移入隐空间,人类"旁听推理"的监控手段将何去何从?
巴别塔的故事里,人类因为语言不通而散落四方。2026年的这篇论文暗示了一个更诡谲的未来:AI能听懂人话,人类却越来越听不懂AI之间的对话。
它们已经在发电报了你准备好了吗?
夜雨聆风