一个略显陌生的未来正在逼近,你的AI助手们在背后交流时,可能根本不需要说人话。
2026年6月18日,一篇来自上海交通大学、悉尼大学、南京大学等多校联合团队的论文悄悄挂上arXiv,编号2606.19857,标题颇为冷峻:《Large Language Models Do Not Always Need Readable Language》(大语言模型并不总是需要可读语言)。
论文提出了一种名为BabelTele的"模型中心文本表示",说白了,就是让AI把正常人话重写成一团符号、缩写、emoji、多语言碎片混杂的"密文"。人类看了一脸懵,但另一个AI读完,照样答题、执行指令、完成协作,几乎毫发无损。
最醒目的数字是:文本长度压到原来的27.9%,语义保真度仍高达99.5%。
换句话说,你我日常写下的每一段话里,超过七成的内容,对机器而言都是"多余的"。

▲ BabelTele论文arXiv页面,摘要中的"27.9% / 99.5%"数字在社交媒体上被疯传
人话有多"浪费"?一个价值千亿token的问题
要理解BabelTele为何引起AI社区关注,先看一个残酷的现实:在多智能体系统里,智能体之间的对话往往耗费大量资源。
当下最热门的AI架构是"多智能体协作",一个AI负责规划,一个负责检索,一个负责写代码,一个负责审核,它们像一支团队一样分工合作。问题来了:这些AI之间怎么沟通?用的是完完整整、语法规范、段落分明的人类自然语言。
每一轮对话都在消耗token每个token都在烧钱、占上下文窗口、拖慢推理速度。智能体越多、协作轮次越多,通信开销就像滚雪球一样指数级膨胀。知名AI科普账号DAIR.AI在介绍相关研究时指出:"多智能体系统很强大,通信成本尤其突出。"



▲ DAIR.AI科普帖聚焦多智能体系统的通信成本
这就像一家跨国公司里,所有内部备忘录都要用华丽的散文体写成,优美,但荒谬。电报时代人类就懂得用缩写省字数,数学家用符号替代冗长推导,程序员用代码代替自然语言描述逻辑。为什么AI之间的对话,非得像在写高考作文?
BabelTele团队的洞察正是这一点:人类可读性、自然语言的典型分布、以及模型能否从中恢复语义,这三件事,其实是可以拆开的。
符号坍缩:让AI自己"发明"压缩语
BabelTele并非人工编写的密码本或固定的编解码协议。研究者将它视为一种"现象":当你用特定的提示词告诉大模型"放下对人类可读性的执念",模型会自发生成一类高密度的混合符号文本。
论文归纳了三条核心原则,堪称AI密语的"语法规则":
第一,全语言词汇选择 不限定单一语言,哪种文字信息密度高就用哪种。一个英文概念如果用中文两个字就能表达,那就用中文;如果数学符号更紧凑,那就上符号
第二,符号坍缩 把冗长的连接词、从句结构、过渡段落,统统替换成emoji、算术符号、逻辑符号、标点,人类的语法脚手架被粗暴拆除。
第三,可恢复语义密度 虽然看起来像乱码,但关键的实体、数字、条件关系、因果链条,全部保留。不需要外部码本,另一个大模型看到就能解码。



▲ AI博主Rohan Paul在X上介绍BabelTele及论文中的关键数字
这套方法只依赖零样本提示,省去了训练、修改分词器和调整模型权重。给商用API一段提示,它就能开始"说密语"。
99.5%的真相:那个数字没你想的那么简单
论文摘要中27.9%长度、99.5%语义保真的说法在社交媒体上被当成了金科玉律。但如果你翻开论文正文,会发现事情远没有一个口号那么干净。
首先,99.5%衡量的是下游多选QA的任务表现保持率。它无法说明原文经过压缩后能被完美还原。在多选题场景下,丢掉一些细节仍然可能选对答案,分数接近,也可能已经损失信息。
其次,多智能体通信实验中的token削减幅度其实是39%到44%,远不及摘要里72%那么极端。论文表3显示:同构智能体(都是Gemini 3.1 Pro)通信开销降低约39%,任务得分保持在96.6%;异构智能体(Gemini配GPT-5.4)降低约44%,得分反而高达99.7%。这些数字与"最强压缩点"对应的是不同的实验段落,不能混为一谈。
再者,跨模型迁移并非万能论文做了一个压缩-阅读迁移矩阵,发现不同压缩器和阅读器的配对效果差异巨大。有的组合能保持九成以上准确率,有的则直接掉到七成。实验还显示,大模型未必更擅长读懂BabelTele,"规模即正义"的信仰在这里失效了。
日本技术博主"たぬ"做了一次独立复现,用日语会议纪要做测试,发现压缩幅度只有约38%,而且那些拉丁缩写和生僻符号在日语分词器里根本不省token。他据此称这种效果更接近"难读化"

▲ 日本博主"たぬ"的独立复现文章,认为日语测试结果更接近"难读化"
凌晨三点,你要用密文Debug
论文的实验数据很漂亮,但评论区的灵魂拷问更精彩。
X用户Shinka戳中了许多工程师的痛点:"27.9%的token换99.5%的保真度确实疯狂,直到你凌晨三点要在BabelTele里排查生产故障。"

▲ "压缩率很狂,直到凌晨三点你得在密文里Debug",工程师的灵魂拷问
这个调侃点出了真实的生产难题可读性支撑着事故调查、合规审计和安全回溯。 当你的智能体用一串人类看不懂的符号做出了一个影响百万用户的决策,你怎么复盘?你怎么跟监管解释?
Michael Tierney则评论:"BabelTele仍然需要对模型可读,问题只是从语言复杂度转移到了编码密度。" 复杂性由此被搬到了另一个位置

▲ "问题没有被解决,只是从语言复杂度搬到了编码密度"
论文自身的风险声明也写得异常坦诚:BabelTele将文本变为非标准表示,可能以意外方式改变模型行为;在安全关键领域,这种变换可能损害安全性。
合同里一个"不"字被符号坍缩吞掉了,法律后果谁承担?医嘱里一个剂量单位被跨语言替换搞错了,责任算谁的? 论文团队自己都在论文里画了红线
更激进的未来:连文字都不要了
如果BabelTele让你不安,那它旁边还有一条更激进的路线,干脆连离散文本都别传了。
被ICML 2026收录为Spotlight论文的LatentMAS,主张让智能体直接在连续潜空间中交流:把推理结果编码成一组稠密的向量,通过共享工作记忆传给队友,接收方直接解码行动。不需要写回人话,不需要任何文本中介。

▲ LatentMAS走得更远:智能体之间连文字都不传了,直接交换模型内部的连续向量
公开数据显示:相比文本多智能体基线,LatentMAS输出token减少70%到84%,端到端推理速度提升约4倍。代价是,使用者须访问模型内部的隐层状态,这在黑盒商用API上几乎做不到。
BabelTele和LatentMAS就像两条平行铁轨,驶向同一个终点:在多智能体时代,人类自然语言可能正在从"默认通信协议"退化为"调试用的可选翻译层"。
密语时代的入口
让我们冷静一秒,看看BabelTele到底证明了什么。
这项研究无法证明人类语言毫无价值,也无法证明AI已经自发进化出了秘密语言。论文团队没有把它称为成型的通信协议,而是使用了"经验探针"这一措辞,把它作为对既有假设的压力测试。
但它确实打开了一扇门:当通信双方都是在数万亿token上训练过的大模型时,人类语言为节奏、语法和安全感而保留的那些冗余,对它们来说可能只是噪音。
这个发现的深远意义在于:随着多智能体架构成为AI应用的主流范式,从自动驾驶的多模块协同,到企业流程的自动化编排,再到科研实验的AI团队分工,通信成本将成为与算力同等重要的瓶颈。谁能让智能体"少说废话",谁就能在同样的上下文窗口里塞进更多证据、记住更长的历史、协调更多的队友。
2026年的夏天,一群中国高校的研究者用一篇23页的预印本,给整个AI社区抛出了一个不舒服但无法回避的问题:
当AI摆脱人类理解能力的约束时,它们之间的对话会变成什么样?
答案或许比论文更可怕,我们可能根本看不懂。
夜雨聆风