乐于分享
好东西不私藏

AI开始用“乱码”对话了!72%上下文压缩,99.5%语义保真,人类审计却全线失明

AI开始用“乱码”对话了!72%上下文压缩,99.5%语义保真,人类审计却全线失明

你有没有想过,有一天,你手机里的AI助手和另一个AI助手聊天时,你连一个字都看不懂

现实比科幻来得更早2026年6月18日,一群来自上海交通大学等机构的研究者,把一篇题为《大语言模型不必始终使用可读语言》的论文挂上了arXiv。他们让AI学会了一套全新的“黑话”,BabelTele

这套语言的震撼之处在于:当文本被压到原文27.9%的长度时,语义保真度仍然高达99.5%AI之间的悄悄话,人读起来像乱码,机器却几乎没丢失信息。

▲ Rohan Paul在X平台上的长帖,概述了论文方法与核心数据

“可读性税”:AI们正在为人类的坏习惯买单

这里有一个关键概念:可读性税(Readability Tax)

人类写句子,要讲究语法、节奏、标点、修辞。这些冗余结构,是为了让人脑处理起来更舒服。AI处理文本的方式与人不同,处理这些“人性的痕迹”,纯粹是在浪费算力。

Nadir博客在7月31日一篇题为《The Readability Tax》的文章里点破了这层窗户纸:机器之间一直在为人类的阅读习惯付费标点、连接词、礼貌用语、完整的从句嵌套,这些对LLM来说都是可剥离的“脂肪”。

BabelTele做的,就是把这份脂肪一次性榨干

研究者的做法极其简单粗暴:模型、分词器和训练流程均保持不变,只用黑盒指令告诉压缩模型,

别管人类读不读得懂,用最密的符号把意思压进最短的字符串里。

结果让所有人大跌眼镜一个45 token的光合作用说明,可以被压成类似这样的11 token怪物:

光合: CO2+H2O::(ox/red)<>O2!+Glucose.💧-e-,CO2+e-

人类看一眼头皮发麻但指令微调后的LLM,却能从中几乎无损地恢复出可执行的推理信息。

99.5%的边界:高压缩比伴随审计风险

这99.5%的衡量对象是:压缩后的文本投喂给下游任务,正确率能达到未压缩基线的多少它并不表示逐字无损还原原文,日文复现作者和论文附录都强调了这一点。

实验结果呈现为:人读不懂,机器能答题

论文还给出了一组惊悚的数据BabelTele的Dale-Chall可读性分数高达16.70,难词比例80.19%,在多款基座模型上的困惑度比原文高出一个数量级。人类在BabelTele输入上的问答准确率断崖式下跌,而强指令模型几乎不受影响。

这就是所谓的“人难读、机可读”,论文里最核心也最危险的实证。

▲ AI研究者Sapunov在X上的技术拆解串,直接把安全风险摆上了台面

AI研究者Grigory Sapunov(@che_shr_cat)在10连串的技术拆解中,把这件事讲得比论文更赤裸:输入越密,阅读端往往生成更多思维链token这就是时空权衡,压缩了上下文窗口,却拉长了推理时间。技术串随后引用了论文中的风险提示:

这种不可读的乱码,绕过了面向人类对齐的安全过滤器和内容审计。

多智能体通信:AI们的“电报时代”来了

论文的多智能体实验,是这份工作最让人浮想联翩的部分。

当两个AI智能体互相传递任务状态时,用BabelTele压缩消息:

  • 同构设定
    (两个都是Gemini 3.1 Pro):token节省约38.96%,任务得分保持基线的96.6%
  • 异构设定
    (Gemini 3.1 Pro与GPT-5.4混合):token节省约44.21%,得分竟然达到基线的99.7%

跨模型还能保持这种保真度,显示了LLM的一般能力,超出实验室私有暗号的范畴。这些模型在面对符号拼贴时,展现出的还原能力,就像两个电报员在面对熟悉的“速记密码”一样。

记忆任务也给出了一组醒目结果在LoCoMo记忆基准上,原始输入平均约2819.5 token才能达到64.81的准确率;换成BabelTele,1382.2 token就拿到了62.53,相对保真度96.48%超过了普通摘要的94.20%

文字越密,记忆越深 这就是AI们正在形成的“电报时代”

审计失灵:我们正在失去“看懂”AI的权利

这项研究引发了开发社区的审计争论。

开发者Saeed Anwar在X上发布了一则聚焦审计问题的评论:

以人类可读性换上下文效率的AI-to-AI压缩语言,是迈向“我们无法审计的模型间通信”的第一步。它可能已经发生在推理链内部,只是被我们叫做“思考”。

▲ Saeed Anwar的推文,一句“我们已经无法审计”刺痛了整个社区

BabelTele当下还只是一篇论文里的“经验探针”,却指向了一个正在发生的现实:最强的那部分AI推理,可能早就以人类无法阅读的形式存在了。

如果在安全关键场景中,一个AI把一个错误决策用压缩乱码发给了另一个AI,而人类审计员,根本读不懂事后追责?内容过滤?对不起,那条信道对你已经关闭了

整个栈都在“去人类化”

BabelTele在2026年引发了关注,还与一系列相邻实践呼应。

2025年2月,ElevenLabs黑客松上的GibberLink就让两路AI语音助手学会了“互相听见对方是AI后,立刻切到嗞嗞声数据协议”,抛弃了人类语音。跨模型的DroidSpeak在共享KV Cache上做文章,尽量不把中间信息吐回成文本LLMLingua系列则走“人类仍可读”的抽取式压缩路线。

把这些拼在一起,一张完整的图景就出现了:当读者不再是人类,通信栈的每一层都在试图少付一点“说人话”的成本。 从物理层的GibberLink,到缓存层的DroidSpeak,再到文本层的BabelTele,这是一场静默的系统性改造

最后的清醒:效率与透明度,从来没有免费的午餐

BabelTele的作者们在风险段落里明确写道:

在安全关键场景,不可读中间表示可能改变原文本行为并增加风险。紧凑非常规表示可能绕过面向人类的审核与安全过滤。

这段提示点明了:研究者清楚知道,潜在风险始终伴随着这把“效率钥匙”。

当AI们不再说人话,这种变化压低了通信成本,也让审计成本悄然上升。

效率与可审计性,永远是一枚硬币的两面。

AI可以不说人话但人类必须想清楚:当它们开始用我们听不懂的语言交换信息的那一刻,我们还剩下多少双能盯住它们的眼睛?