想象一下这个场景:凌晨三点,生产系统报警,你打开日志,却发现满屏都是这样的东西,
∈{契約解除|合意|甲→乙}≠履行;∵遅延∴損賠∈∀合理∧直接;∈{免責}∧[条件];
你看不懂。你的同事也看不懂。但你们公司的AI,理解得一清二楚。
这个场景已经进入现实的讨论。2026年6月,一篇来自上海交通大学、悉尼大学、合肥工业大学等五所高校的论文,把这个议题推到了AI圈面前
一个冒犯直觉的问题
论文的标题开门见山:《大语言模型并不总是需要可读语言》(Large Language Models Do Not Always Need Readable Language)
研究者们问了一个听起来几乎有点冒犯的问题:如果一段文字只供另一台AI模型阅读,它还必须写成人能流畅阅读的自然语言吗?
他们的经验答案是:不必。
这套面向模型、高信息密度、主动牺牲人类可读性的文本表示,被命名为 BabelTele,取意巴别塔,加上电报的密度它无须另立编程语言,也无须改模型或训练,只要在提示里告诉模型:"你的读者是另一台同等智能的AI,可以忽略人类可读性",然后让模型自己发明一种更密的写法



▲ AI资讯博主Rohan Paul的长帖,将这篇论文带进了大众视野
那组让人目瞪口呆的数字
社交平台讨论最多的,是两个并排的数字:
27.9% 与 99.5%。
前者是文本压缩后的保留量,也就是说,原本100个字的内容,被压到不足28个字后者是语义保真度,模型拿着这份"密文"去做问答,正确率相对原文几乎没有下降
消息一出,推特上的开发者们随即热议
一位叫Shinka的用户(@ShinkaIoT)的回复,迅速成为讨论区里最被转发的金句:
"27.9%的token换来99.5%的保真度,这很狂,直到你在凌晨三点用BabelTele调生产bug。"

▲ 这条评论同时写出了技术兴奋和工程焦虑
当然,这两个数字需要被更谨慎地读。99.5%的语义保真,指的是用压缩文本做多选问答时,相对原文的答对率保持;它和逐句还原原文有很大距离。 多选题允许丢掉部分细节仍然选对;法律文书上"关键信息一字不差"是完全另一个标准
但即便如此,这仍然是一个颠覆性的发现
BabelTele是怎么炼成的?
它的生成逻辑,其实并不神秘。
研究者们归纳出几条核心原则,
全语言词项选择:不锁死单一语言的语法中文、英文、德语复合词、日文汉字、拉丁词根,哪个更密就选哪个一个英文单词"acceleration",在某些场景下,用"∂v/∂t"更省token
符号坍缩:用⇒、∈、≠等数学与逻辑符号替代冗长的连接词和从句"因为……所以……"四个字,一个∵……∴就够了。
可恢复的语义密度:压缩的同时保留下游模型可恢复的关键信息,且不依赖任何外部密码本,另一台模型,零基础就能读懂
这里有一个深刻的信息论直觉:人类语言为人际沟通准备了大量冗余 节奏、语法、过渡句、礼貌性寒暄,这些都是"人类感受"所需要的脚手架,但对另一台模型来说,它们是无效负荷
电报时代,人类也曾为了密度放弃流畅散文数学公式、程序代码,都是证明。BabelTele不过是把这件事往前推了一步:让模型自己来完成这个外化过程
一场多智能体通信革命?
现在主流的AI应用,往往由多个模型像公司里的不同部门一样协作,规划、检索、批评、执行,彼此用自然语言写"工作邮件"
问题在于:这些邮件没有人读,但它们挤占了大量上下文窗口上下文越长,推理费用越高,模型对远处信息的利用也越不稳定
BabelTele给出了这样的答案:这些给模型看的消息,可以省去为人类阅读准备的写法
论文在多智能体实验中报告了两个数字,同样叫人惊讶:同构系统(同一家族的模型互相通信)中,token消耗削减约39%,任务性能保持96.6%;异构系统(不同厂商模型互通)中,削减约44%,性能保持99.7%
成本降四成,效果几乎不掉。 对任何在算AI账单的团队来说,这个数字看起来相当诱人
但工程师们坐不住了

▲ "为token优化,就要在可调试性上付钱"
工程师Emad Ghorbaninia的引用帖,说出了评论区里最冷的那盆水:
"把智能体间消息压成非人类句法当然省上下文,但一旦出错,没有解码器,人和模型都可能读不懂日志。为token优化,就要在可调试性上付钱。"
这是工程场景里的现实顾虑。想象一下:一套复杂的多智能体系统在某次对话中做出了错误决策,造成了损失你打开日志,发现智能体之间传递的所有消息都是BabelTele,你看不懂,你的审计人员也看不懂,你甚至不确定另一台模型能不能"翻译"准确
开发者 ChainBuilder.pro 补充道:"智能体使用BabelTele后,验证压缩是否保住意图会成为新的瓶颈"

▲ 压缩效率之后,意图验证成了新问题
更深的恐惧:审计失效
这场讨论里,更尖锐的声音来自安全研究社区
研究员Saeed Anwar(@saen_dev)的引用帖,字字如刀:
"一种牺牲人类可读性换取上下文效率的AI间压缩语言,是模型开始以我们无法审计的方式通信的第一步。这件事可能已经在推理链内部发生了,我们只是把它叫作'思考'。"

▲ "我们只是把它叫作'思考'",这句话让安全社区沉默了几秒
这话触碰到了AI安全领域一个正在发酵的焦虑:如果模型的推理过程对人类越来越不透明,现有的对齐和监管方法,还管用吗?
LessWrong上有一篇文章《Neuralese的反思》,早已指出:一旦推理链不再落在可读token上,而在高维向量空间里循环,安全研究者过去依赖"读思维链"的监督手段将直接失效BabelTele还停留在文本信道,它的密文至少仍可被记录、回放,原则上还能"翻译"但在通往不可读的路上,它已经迈出了可见的一步
这条谱系有多深?
如果把上下文压缩方法排成一条谱系,
最左边是LLMLingua:微软团队的工作,在人类仍可读懂的自然语言里删词、选词、压缩,追求的是"更短但仍像人话"的摘要
往右是BabelTele:主动离开自然语言典型分布,允许跨语言符号坍缩,人读起来像密语,模型读起来没问题它站在人类可读与完全不可读的边界上
再往右,是已经有学术论文验证的潜空间通信(arXiv:2511.09149):直接用模型最后一层的隐状态做智能体间通信,完全跳过了"生成token"这个环节,连BabelTele那样的文字都省了,直接互传矩阵论文称速度可加速一个数量级以上。
Frederick Zimmerman(@xtuffai)在推特上问的那句话,"他们为什么还需要中间语言?直接互传矩阵不就行了?"在学术界,其实已经有人正在认真实现

▲ 这个问题,学术界已经有人在认真回答了
数字背后的条件句
日本社区有一位研究者,在note上做了独立复现实验,给这场讨论补上了最重要的注脚:
他用已知名诗做还原测试,失败了,因为模型直接"背"出了原诗,实际上没有解码压缩串随后他自造了一份含有否定、条件、专有名词等"陷阱"的销售会议纪要,压缩后问答全部答对
但他也发现:对本身已经很密的日文短文,压缩后字符削减非常有限,结果偏向"难读化",称不上"大幅压缩"英文冗长散文和密集日文纪要,属于不同类型的输入
所以,BabelTele的实验聚焦于"模型能不能读密文?" 它并未签发一张"永远三折且几乎无损"的通用优惠券
所以,问题落在哪里?
BabelTele的故事,可以收成三层而不失真:
第一层是现象:在明确"读者是模型"的提示下,现有大模型会生成人类难读、模型仍可用的高密度文本这已被多个基准实验证实。
第二层是条件:压缩率与任务保持率随输入冗余、任务形式、压缩器与阅读器的配对组合而变化最亮的数字有明确的适用边界,无法作为无条件保证
第三层是结构:它处在"自然语言压缩 → 模型中心密文 → 潜空间通信"的谱系中间,同时触碰多智能体成本与人类审计之间最核心的张力
工业界采用前还要补齐一整套工程配套:故障注入测试、强制"关键路径说人话"的策略、双轨日志(密文加人类可读摘要)、跨组织审计接口,以及安全关键域的禁用清单论文并未覆盖这些配套,产业落地时只能另行建立
效率的诱惑,从来不会等制度追上来再出发
AI已经开始说它自己的话了。我们能否读懂只是开端;当出了事的时候,我们还有没有机会去追究?
论文原文:arxiv.org/abs/2606.19857标题:《LLMs Do Not Always Need Readable Language》
夜雨聆风