六月的一篇论文,正在让整个AI圈重新思考一个根本问题,机器和机器说话,还需要用人话吗?
答案可能让你不舒服:不需要
上海交通大学领衔的研究团队,在arXiv上甩出了一篇编号2606.19857的预印本,标题毫不含糊,《Large Language Models Do Not Always Need Readable Language》(大语言模型并不总是需要可读语言)。论文提出了一种名为BabelTele的文本压缩范式:让大模型把正常的人类语言,改写成一种混杂着缩写、符号、emoji、数学符号和多国语言碎片的"密文"。
人类看了,一头雾水
但另一个大模型读了,在论文最强设定的下游任务上,保住了99.5%的表现。
而这坨"密文"的体积,只有原文的27.9%。
对应的文本长度削减约72%,但这个数字衡量的是任务表现保持率,并非逐字无损还原。



▲ AI博主Rohan Paul的介绍帖在X上引发大量讨论,配图直观展示了自然语言与BabelTele的对比
你写给模型的内容,或许有70%可以压缩
这事儿要从一个朴素的直觉说起
你有没有想过,为什么我们说话要用完整的句子?因为人类依赖冗余语法帮助我们确认主谓宾关系,连词串起逻辑,反复出现的指代照顾短期记忆,语气词传递情绪。这些"脚手架"对人类理解至关重要,但对一个在万亿token语料上训练过的大模型来说,它们可能就是噪声。
论文引言里用了一个绝妙的类比:电报。 一百多年前,人类为了省电报费,就已经在系统性地压缩自然语言,"父病速归"四个字,把一封长信的意思表达得清清楚楚。数学公式、编程代码,也都是"牺牲可读性、换取精确与密度"的经典案例。
BabelTele做的事情,本质上就是给AI时代写一套新的电报码。只不过这次,发报的是机器,收报的也是机器。
三条原则:怎么把人话变成"机器密语"
BabelTele没有固定的密码本。研究团队通过零样本提示(zero-shot prompting)诱导大模型自发产生高密度文本表示,并总结出三条核心原则:
第一,全语言词汇选择 不执着于任何一种语言,而是跨语言、跨文字体系,哪种表达信息密度最高就用哪种。一个英文从句可能被替换成一个中文成语,一个法语短语可能被压缩成一个日语汉字词,只要模型能理解。
第二,符号坍缩 把冗长的连接词、从句结构,用紧凑的符号、emoji、数学和逻辑运算符直接替换。"因此我们可以得出结论"变成"∴","大于等于"变成"≥","如果……那么……"变成"→"。
第三,可恢复语义密度 虽然对人类几乎不可读,但实体、数字、条件关系、因果链这些关键信息必须保留完整,且不依赖任何外部码本,换一个模型来读,也能恢复出原始含义。


▲ 韩国开发者归纳BabelTele三条压缩原则,这篇论文正在全球多语言技术社区同步发酵
99.5%,这个数字到底有多"真"?
这可能是整篇文章最重要的一节
99.5%语义保真度,在X(原Twitter)的讨论中被许多人当成铁律引用。但严格来说,它的含义是:阅读压缩文本的模型,在下游多选问答任务上,相对于阅读原文时的任务表现保持率。
这个数字不能理解为"原文逐句无损还原"。多选题场景下,丢掉部分细节仍可能选对答案。日本技术博主“たぬ”专门做了一次动手审计:他用一份自己写的日语销售会议纪要做测试,里面埋入了否定句、限定条件、汇率但书等陷阱。结果是,强模型确实全部答对,"能读"是真的。但日语本身已经很"密",BabelTele压缩后字数只减少了约38%,远没有英文长文档上72%那么夸张。
压缩率对输入语言的冗余度极其敏感。 英文散文冗余多,压缩空间大;日语、中文本身信息密度就高,改写后提升有限,甚至可能因为引入拉丁缩写和生僻符号,在分词层面反而没省多少token。
论文本身也很诚实,跨模型迁移矩阵显示,换一对"压缩器,阅读器"组合后,语义保持率可以散落到七成区间。所以,"99.5%"仅代表最强配置下的最佳表现,无法当作普适常数。

▲ 论文arXiv原始页面,摘要中清晰标注了99.5%与27.9%的实验条件
杀手级场景:多智能体通信
读到这里你可能会问:人都读不懂了,这东西到底有什么用?
答案是,用在人类通常不会阅读的中间链路。
2025年以来,多智能体系统(Multi-Agent System)成了AI工程的主流架构。一个复杂任务被拆给规划者、检索者、程序员、审核者等多个AI角色,它们之间需要大量中间消息传递。这些消息,人类大多数时候根本不看,但每一条都在烧token、占上下文窗口。
论文专门做了多智能体通信实验同构设定下(双方都是Gemini 3.1 Pro),BabelTele削减了约39%的通信token,任务得分保持在未压缩基线的96.6%。异构设定下(Gemini 3.1 Pro与GPT-5.4配对),token削减达到44.21%,得分甚至保持了99.7%。
放到工程场景里,一个跑着十几个Agent的复杂工作流,光通信成本就可能直接砍掉近一半。在token按量计费的商业模型时代,这已经牵涉真金白银。

▲ 评论区一针见血:一旦智能体开始说BabelTele,瓶颈就从"写消息"变成了"验证压缩是否保住了意图"
凌晨三点,你要用密文debug吗?
当然,技术社区从来不缺冷静的声音
最尖锐的质疑来自工程实践层面:可调试性。一位叫Shinka的用户在Rohan Paul帖子下调侃,"压缩率很狂,直到凌晨三点你得对着BabelTele排查bug。"
这个调侃点中了系统设计的难题可读性既服务人类读者,也服务事故调查与合规审计。 当AI之间的对话变成人类无法审阅的"密语",一旦出现幻觉、意图偏移或安全事故,谁来定责?谁来溯源?
论文作者自己也在风险声明中明确写道:BabelTele将文本变为非标准表示,可能以意外方式改变模型行为;安全关键领域可能损害安全性在合同、医疗、金融等"一词之差即可翻转结果"的场景中,这种方法目前不适用。
这让人想起另一个更激进的方案,LatentMAS,由普林斯顿、UIUC、斯坦福联合提出,入选了ICML 2026 Spotlight。它连离散文本都不传了,直接让智能体在连续潜空间中交换隐状态向量。论文声称输出token减少了70%–83%,推理加速4倍以上。

▲ LatentMAS走得更远:连文字都不要了,直接传向量。BabelTele与它共享同一个核心洞察,多智能体的文本中介太贵、太冗
BabelTele和LatentMAS,一个还守在文本层面做压缩,一个已经彻底抛弃文本。它们共同指向一个无法回避的趋势:在AI-to-AI的通信场景中,人类语言不再拥有唯一席位,逐渐成了一种可选格式。
密语背后的问题
BabelTele让人感到不安的地方,可能还在技术之外。
它揭示了一个我们一直在回避的事实:人类语言的冗余原本就是一种feature。 那些"废话"、铺垫、重复、语气词和确认,照顾着人类有限的认知带宽、容易涣散的注意力和不可靠的记忆。语言中的冗余,是几千年进化出的抗噪机制。
大模型可以绕开其中一部分它们在万亿词的语料中见过足够多的模式,一个符号、一个emoji就能激活完整的语义网络。当信息的发送者和接收者均为机器时,人类语言的设计逻辑,就变成了一种昂贵的遗产负担。
这篇论文在多个语言社区引发持续讨论,绝非偶然。它击中了一根正在绷紧的神经:随着AI系统越来越多地"自己跟自己说话",人类在这条通信链路上的位置,也许会逐步退到旁观席。
BabelTele今天还只是一个"经验探针",一次学术实验。但它打开的那扇门,通向一个人类可能越来越看不懂的AI世界。
而门已经推开了一条缝
夜雨聆风