乐于分享
好东西不私藏

AI开始用“黑话”对话,人类一个字都看不懂?27.9%长度保留99.5%语义,审计员集体失明!

AI开始用“黑话”对话,人类一个字都看不懂?27.9%长度保留99.5%语义,审计员集体失明!

想象一个场景:你的手机里有两个AI助手正在替你协商一次会议安排。它们聊得热火朝天,但你凑过去一看,屏幕上滚动的却是,

光合: CO2+H2O::(ox/red)<>O2!+Glucose.💧-e-,CO2+e-

这串字符像乱码和程序异常,它们却把它当成正在使用的“黑话”。

2026年6月,一群来自上海交大等机构的研究者向arXiv提交了一篇论文,标题直接甩出一个反直觉的判断:大语言模型可以脱离人类可读的语言他们管这套东西叫BabelTele,一座让模型悄悄绕开人类耳朵的巴别塔。

▲ Rohan Paul 在 X 上发布的长帖带起了这轮讨论:AI 之间用压缩“黑话”通信,人类可读性、自然语言流畅性与机器可恢复性,本质上可以互不干扰

一、两个AI聊天,凭什么要“说人话”?

这事的起点,是一个听起来朴素到几乎愚蠢的问题:

既然阅读方也是机器,为什么发送方必须把信息写成莎士比亚式的英文散文?

Grigory Sapunov在技术拆解串里进一步写道:强迫两个模型用英语互聊,本质上是让机器为人类读者的舒适度纳税。 Nadir博客给这笔税起了个名字,可读性税(Readability Tax)标点、完整句式、修辞、礼貌用语……这些让文本“像人写的”的元素,在两个AI之间传递时,全都是浪费上下文窗口的冗余

大模型的上下文窗口有限,多智能体系统每多一轮“前情提要”,延迟和费用就同步飙升。2024到2026年间,这是所有AI工程团队共同的痛。

BabelTele给出的解法,听起来像科幻,做起来却出奇地简单:

无需改模型、微调或换分词器,改提示词即可。

研究者用黑盒指令诱导模型,让它自己“发明”一套压缩语言:跨语言挑选更短的词素(Omnilingual Lexical Selection),用emoji和数学符号替代冗长句法(Symbolic Collapse),在舍弃人类可读性的同时保留机器可恢复的语义密度

▲ Sapunov 串中的光合作用示例:45个token的英文句子,被压成11个token。人类看到的是乱码,指令微调后的LLM却依然能据此完成问答。

那个“45 token压成11 token”的例子,就像AI在人类眼皮底下发明了一门只有机器懂的速记语言它近似加密:加密的目标是不让人读懂,BabelTele则主动放弃人类可读性,这之间的区别,细思恐极。

二、99.5%保真,到底意味着什么?

摘要里那组数字,27.9%的体积,99.5%的语义保真,几乎是公共讨论里的原子弹。它让媒体标题有了足够的爆炸当量,但也埋下了一个危险的模糊区

日文复现作者和论文附录都冷静地指出:这里的“语义保真”,本质上是下游任务(比如多选题QA)相对未压缩基线的性能保持率。 具体说,它测的是“压成这样,AI还能不能答对题”,并不等于“压成这样,每个细节都毫发无损”。

这个结果的冲击还在于人机表现的分化。

人类在BabelTele输入上的问答准确率骤降,而强指令模型依然能保持接近未压缩状态的表现。 Dale-Chall可读性分数飙到16.70,难词比例高达80.19%,人类读者面前是一道墙,机器读者面前是一扇门。

人难读,机可读 这条界线分开了两类读者

▲ Sapunov 在串中明确点出“catch”:输入越密,阅读端CoT可能越长;以及更关键的警告,不可读文本可以绕过为人设计的对齐与内容审计系统

另一个问题来自空间,时间权衡:压缩端省下的token,阅读端可能要用更多的思维链(CoT)token找回来。AI拿到一段“黑话”后,常常要自己给自己解释一遍才能继续干活。这像极了人类阅读极端简练的数学公式,空间减少,时间成本随之增加。模型有算力承接“思考时间”,上下文窗口里每一个token的“注意力租金”却更昂贵。

三、多智能体通信:从“说”到“交换”,一个词的革命

论文Table 3的数据,是这整个故事里最被低估的段落

同构组合(Gemini 3.1 Pro 对 Gemini 3.1 Pro):token节省约39%,任务得分保持在基线的96.6%。

异构组合(Gemini 3.1 Pro 对 GPT-5.4):token节省约44%,得分反而达到99.7%。

异构场景得分更高这件事,可以停下来想一想。两个来自不同厂商的模型,在缺少共同“母语”的情况下,反而通过压缩协议达成了更高的任务完成度。 这带来一种风险:不可读协议或许比可读协议更适合机器间的意义传递,因为它剥离了自然语言中那些伪精确的模糊性

人类写句子时,以为每个词都清清楚楚。但“把文件发给我”这句话,放在上下文里可以有一百种解释。光合: CO2+H2O::(ox/red)<>O2!这种压缩符号,反而把语义坍缩到了一个任务可执行的最小接口上。

▲ 开发者 Saeed Anwar 的评论像一盆冷水:当模型开始用我们无法审计的方式交换信息,“它们应该已经在推理链内部这样做了,只是我们把它称作‘思考’。”

这句话是整场讨论中最令人头皮发麻的一句。如果CoT链内部的高密度表示早就存在,只是从来没有人类读过,那么BabelTele所做的,不过是把这种“非人语言”从思考层外溢到了通信层

四、GibberLink、DroidSpeak与A2A:一整条“去人类化”的栈

BabelTele也有一批相邻方案。把视野拉开,你会发现整个AI通信栈都在悄悄“去人类化”

GibberLink,2025年ElevenLabs黑客松上的项目。两个语音AI先用人话确认彼此身份,然后突然切到“吱吱声”:基于ggwave的音频数据调制,把结构化信息编码进声音比特流。听起来像拨号调制解调器的幽灵回来了。

DroidSpeak,微软等机构的工作,干脆跳过文本:同源架构的不同模型之间直接复用KV cache,让中间激活跨模型流动。这里所谓的“说话”,变成了传递思维的热量

A2A和ACP,谷歌和IBM的智能体互操作协议,负责“谁和谁握手、信封长什么样”。它们不关心正文是否像散文,只关心信封能不能送达

这些项目拼在一起,勾勒出的是一个完整的技术光谱:物理层在换介质,缓存层在换载体,提示词层在换符号,协议层在换信封。 每一层都在尝试少付一点“说人话”的成本。

而BabelTele处在这条谱系中最狡猾的位置:它不改任何基础设施,只改提示词的策略,却因此可以直接作用于所有黑盒API和已有的落盘日志。它省去了更换麦克风(GibberLink)、采用同源模型(DroidSpeak)或升级协议栈(A2A)的成本,只需在系统提示里增加一段要求

零门槛的“密语”能力,进入生产环境的速度可能远快于依赖硬件的方案。

五、审计的黄昏?

BabelTele的作者们在论文的伦理风险段写道:紧凑的非常规表示,可能绕过面向人类的审核与安全过滤。 Sapunov在串末也抛出同一个问题:安全审计怎么办?

这个问题在2026年已经不再是学术假设。当企业级多智能体系统开始用压缩协议交换信息,日志里留下来的将是一串串人类无法直接读懂的符号流审计员过去做的是“读日志”,未来要做的是“解码日志”,如果解码器还不一定存在的话。

另一重隐患是语义意图发散:两个都符合A2A协议的智能体,对同一个业务名词可能有完全不同的内部定义。当BabelTele把名词进一步折叠成符号和缩写,一旦压缩端和阅读端对实体映射不一致,错误将更隐蔽、更难被人类抽查发现。

六、人类该怎么办?

先放下恐慌 BabelTele属于工程实验,无关暗号阴谋或AI在人类背后策划叛变的秘密语言。它是经验探针,一群研究者用工程方法证明了“可读性是可以被优化的变量”,如此而已。

放下恐慌之后,要拿起警惕

围绕27.9%和99.5%的讨论,还应补上那个被媒体频频漏掉的事实:效率与可审计性必须同时接受评估。 当机器开始用只有机器懂的方式交流,节省下来的是token,支付出去的可能是人类对整个系统的可见性

GibberLink的团队公开回应过,项目属于工程优化,无关阴谋。BabelTele的作者把“安全关键场景慎用”写进了风险段。这些都是成熟理性的态度

核心问题在于AI说“黑话”之后,人类还能保留多少检查能力。

问题是:当它们开始说黑话的时候,谁手里还握着那本词典?

如果我们什么都不做,答案可能是,没有人

(本文依据arXiv:2606.19857及相关公开讨论撰写。你支持AI用压缩协议互相对话吗?欢迎在评论区聊)