你以为AI之间聊天,说的是人话?
不,它们可能早就不想说了
2026年6月,上海交通大学张林锋团队在arXiv上扔出一篇预印本,标题带着近乎挑衅的意味,Large Language Models Do Not Always Need Readable Language(大语言模型未必总要采用可读语言)。论文提出了一种名为BabelTele(巴别电报)的文本压缩形态:把正常文章砍到只剩原长的27.9%,人类基本读不懂,但AI做题的准确率仍然保持在99.5%。
换句话说:你删掉七成以上的"废话",模型眼都不眨一下。
这个数字迅速引起热议



▲ AI博主Rohan Paul的介绍帖,左图高亮论文摘要,右图展示BabelTele压缩效果,自然语言塞满窗口仍可能答错,压缩后反而答对
人话,对AI来说太"啰嗦"了
不妨退一步想一个问题:为什么AI之间传递信息,一定要用人类看得懂的语言?
今天的大模型系统,从接收指令到输出答案,从文档问答到多个AI协作,几乎所有环节都在用自然语言。这很直觉,毕竟模型是吃人类语料长大的。但论文作者指出了一个被集体忽视的事实:人类语言天生就是为人类设计的,里面塞满了对AI毫无必要的"冗余信息"。
完整的主谓宾、承上启下的过渡句、不厌其烦的背景铺垫……这些东西帮助人类跟上节奏、消除歧义、建立情感共鸣。但对一个在万亿token上训练过的神经网络来说,这些"脚手架"就像给博尔特穿拖鞋跑百米,只会平添负担。
更残酷的现实是:上下文窗口是有限的,API调用是按token收费的。 多智能体系统兴起之后,几个AI之间反复用自然语言互传中间状态,通信本身就成了最大的成本中心。思考固然花钱,来回传话往往花得更多。
BabelTele:让AI说"鬼话",但说得精准
BabelTele到底长什么样?
想象一段正常的英文会议纪要,被压缩之后变成了这样:混着缩写、emoji、数学符号、多语言碎片、非常规标点的"乱码串"。你盯着看五分钟,可能只能猜出三分之一的意思。但把它喂给GPT或Gemini,模型读完照样能回答关于原文的细节问题。
这种"符号坍缩"背后的技术原理,论文用三条原则概括:
- 全语词元选择
,不锁定单一语言,跨语种挑信息密度最高的字符 - 符号坍缩
,用符号、emoji、逻辑算符替换冗长结构 - 可恢复语义密度
,保留足够结构,让能力模型无需外部码本就能解读
最妙的是:全程无需训练,也不用改分词器或访问模型内部权重。 只用零样本提示,就能让模型自己"发明"出这种稠密表达。BabelTele代表一族由提示诱导出的表达形式,显示模型原本就有生成和理解这类文字的天然能力,只是以前没人让它们这么说。

▲ 论文arXiv摘要页,六位作者来自上海交通大学、悉尼大学、合肥工业大学等多所高校
99.5%的真相:没那么神,但够吓人
最抢眼的数字是"27.9%长度,99.5%保真"。但必须给这个数字加几个脚注,否则你会以为世界上出现了一种"无损72%压缩算法"。
第一,99.5%衡量的是任务保持率 它表示把压缩后的文本喂给模型做多选题问答,得分能保持未压缩基线的多少,不能当作"原文逐字还原率"。一位日本独立研究者在复现实验后特别警告:"QA分数接近,不等于细节逐字可恢复。"
第二,跨模型时会掉分 论文的跨模型矩阵显示,用一台模型压缩、另一台来读,保持率可能散落到74%左右,远没有99.5%那么好看。压缩机和阅读器的"默契程度"至关重要。
第三,省了输入token,可能多花推理token。 论文发现,当证据变得稀疏或更难解读时,模型会拉长思维链(Chain-of-Thought)来弥补,换言之,它省下了"读"的成本,但花更多力气"想"了。
尽管如此,BabelTele在与LLMLingua-2等主流压缩方法的对照中,在强压缩区往往保住了更高的相对准确率。在会议纪要基准MeetingBank上,压缩后的表现甚至接近原始性能。在超长文档场景中,当原文超出上下文窗口时,BabelTele分块压缩相对直接截断,准确率提升最高可达十个百分点以上,截断会扔掉证据,而BabelTele能在有限窗口里塞进更完整的核心信息。
多智能体通信:最有潜力的应用场景
论文里与"AI省钱"最直接相关的实验,在第4.5.1节。研究者让两个AI用BabelTele互传消息完成协作任务:
| 38.96% | 96.6% | ||
| 44.21% | 99.7% |
砍掉约四成通信token,任务得分几乎贴死基线。 在异构配对中甚至比同构还好,这暗示BabelTele的符号形态可能在某些情况下比冗长的自然语言更不容易引入跨模型误解。
对做智能体编排的工程师来说,这张表给出了诱人的前景:如果你的AI军团每天互相"聊天"花掉几百万token,现在有可能省掉近一半。
"凌晨三点你用BabelTele排障试试?"
数字很诱人,但社区立刻嗅到了代价

▲ Frederick Zimmerman直接发问:"为什么还需要中间语言?直接互传矩阵不就完了?"
一位评论者这样概括:"压缩与不透明是同一枚硬币的两面。" 标题里的数字是语义保真,论文没写的数字是,人类对AI之间对话内容的监督能力,可能趋近于零。
有人追问:"密集的私有方言会不会直接毁掉可解释性?" 还有人说,瓶颈可能转移到"核验压缩是否保住了意图"。想象一下,你的AI助手和另一个AI用你完全看不懂的符号串在讨论你的合同条款,你能放心吗?
这类担忧已有更早的讨论LessWrong上一篇题为Reflections on Neuralese的文章警告过:一旦AI的"思维过程"从人类可读的token空间滑向不可读的形态,我们现有的所有监控手段都会失效。 BabelTele虽然还没走到纯隐向量通信那么极端,但它已经在同一条光谱上开始滑动了。

▲ LessWrong上对"Neuralese"的讨论:当思维链从token空间移入隐空间,人类如何"旁听"AI推理?
不止BabelTele:四条路线赛跑,终点都是"别说人话"
把视野拉远,BabelTele只是"AI通信太贵"这张账单上的一种付款方式。2025年底到2026年中,至少有四条技术路线在同时狂奔:
第一条:仍是文本,但不说人话,BabelTele。优势是兼容现有API,黑盒可用;代价是人类读不懂
第二条:让AI自己发明语言,中科院团队的CLSR/LSF框架(arXiv:2606.29354),让智能体在推理过程中自创、演化紧凑符号体系,生成token量可压缩到标准思维链的1/3到1/6。
第三条:连文本都不要,直接传向量,LatentMAS(ICML 2026 Spotlight),智能体在连续隐空间协作,输出token降幅达70%–84%,端到端推理加速约4倍。
第四条:系统层面混合协议,Agora等元协议框架,高频交互用标准化例程、低频用自然语言、中间地带用AI自动生成的例程。



▲ DAIR.AI介绍LatentMAS:用压缩隐向量替代自然语言消息,保持性能同时大幅降低通信成本
四条路线共享同一个出发点:自然语言是为人类发明的,用它做机器之间的通信介质,本身就是一种浪费。 区别只在于,人还能不能"偷听",是否需要同构模型,以及协议如何升级和发现。
古人早就干过这件事
有趣的是,X上一条高赞回复把BabelTele比作了文言文和《易经》卦象:几千年前,中国人就已经知道"流畅"和"可恢复"可以分离,文言文对训练有素的读者极其高效,对门外汉则如天书。
这个类比精妙但也危险模型的"可恢复"依赖万亿token训练分布的统计重叠,与师徒传承的释义传统并非一回事。日文复现者的一个发现说明了这一点:他用宫泽贤治的名诗"雨ニモマケズ"做测试,模型直接背出了原文。与其说模型在"解码"压缩串,此时的表现更接近回忆这首诗。换成模型从未见过的虚构文本后,实验才具有说服力。
效率的列车已经启动,刹车在谁手里?
BabelTele目前仍停留在研究阶段,离已部署的工业协议和"完成品"都有距离。作者把它定位为用于探索模型能力的"探针"。这组可复现的实验把一个直觉钉成了可引用的命题。
当信息的接收者换成另一台AI时,我们仍坚持用"通顺、完整、人类可读"的自然语言来编码语义,可能从一开始就是一种代价高昂的自我安慰。
效率的列车已经启动多智能体系统会越来越多,通信账单会越来越贵,而"让AI说人话"的坚持,正在被每一个跳动的token价格标签侵蚀。
问题只剩一个:当AI之间的对话变成我们完全读不懂的符号流时,人类还坐在谈判桌旁吗?
夜雨聆风