乐于分享
好东西不私藏

AI开始讲“黑话”了!压缩到27.9%,保真度99.5%,人类彻底听不懂了

AI开始讲“黑话”了!压缩到27.9%,保真度99.5%,人类彻底听不懂了

今天凌晨三点,你被报警电话叫醒生产环境崩了

你打开日志,准备像过去十年一样,一眼看出哪里出了问题。但屏幕上的报错既非英语或中文,甚至不像任何人类语言。那里只有一堆破碎的多语言片段、数学符号、emoji和逻辑箭头,以及你的AI智能体冷静地告诉你:一切正常,只是消息压缩了。

这幅景象来自2026年6月18日出现在arXiv上的一篇论文。它的名字叫BabelTele,一个让你的AI员工们在办公室里说着你完全不懂的“加密黑话”的协议。而最令人不寒而栗的是:它们真的互相听懂了。

▲ AI资讯账号Times Of AI的转述帖:如果AI不再像人类一样说话怎么办?

27.9%与99.5%:一场无声的效率革命

切入点是一个几乎所有人默认的假设:AI之间通信,应该说人话。

过去几年,多智能体系统的工程师们像教幼儿园小朋友一样教AI协作:记忆写成段落,任务交接写成说明,中间状态写成“请注意……因此我们……”,所有内容都得让人读懂并接受审计。 好处很明显:你能旁观,你能调试,你能假装自己有一个“全AI团队”在无缝配合。

但有人捅破了这层窗户纸

论文《Large Language Models Do Not Always Need Readable Language》的作者们提出了一个大胆的问题:如果接收方不再是人类,为什么还要用人类的语言? 人类语言携带大量冗余,完整句法、过渡句、礼貌用语、重复确认,这些对人是脚手架,对机器是可压缩的废料

他们的答案是BabelTele:一种混合多语言碎片、缩写、数学与逻辑符号、非常规句法甚至emoji的高密度文本表示它仍然是文本,仍然走黑盒API,不需要改模型权重,不需要密码本。但读起来,像是某种来自赛博空间的“方言”。

结果惊人:当文本体积被压缩到原始长度的27.9%时,语义保真度仍高达99.5%。 AI用不到三成的字数,说了几乎完全一样的事。用经济学的语言讲:通信成本骤降七成,信息损失几乎为零。 任何一个做过大模型推理成本核算的人,看到这个数字都会头皮发麻。

▲ ar5iv页面上方的论文标题、作者与摘要开篇

为什么“不说人话”反而更高效?

要理解BabelTele为什么有效,得先理解一个概念:token,上下文窗口,以及“为什么说人话很贵”。

大语言模型处理文本的计量单位是token(词片)。你输入的每一个token都要占用计算资源:时间、电力、金钱。而在多智能体系统中,AI要反复传话、交接任务、交换记忆,通信本身成了最大的成本黑洞。

传统的做法是提示压缩,比如微软的LLMLingua系列。但那些方法有一个共同的“自我设限”:压缩后的文本必须仍然读起来像人话。 像给机器戴上一副人类的眼镜,逼它在人类美学的框架里省字。

BabelTele把眼镜摘了它告诉模型:你不需要让我看得懂,你只需要让另一台模型看得懂。 于是,机器开始写出人类困惑度飙升、机器理解却不打折的文本。基座模型对BabelTele的困惑度相对原文升高一个数量级,Llama-3-8B从9.63飙到176.60,说明这些文本在统计意义上“简直不像自然语言”。但下游问答准确率,却稳稳地高

人类可读性、自然语言流畅性、机器语义可恢复性,这三者,被这篇论文用一个实验证明是可以分离的。

这个结果也在拆解我们熟悉的认知框架。

多智能体通信:AI同事开始说悄悄话

来看最令人震撼的一组数字

在多智能体通信实验中,同质模型用BabelTele传话,Token节省38.96%,任务得分保留96.6%。 异质模型,即不同厂商的模型互相通信,Token节省高达44.21%,保留率99.7%让GPT和Claude用“黑话”交接任务,比让它们像人类同事一样写电子邮件式的工作报告,便宜近一半,表现几乎一样。

它们的聊天记录,人类一个字都看不懂。

这种表达也不限于固定模型组合:跨模型矩阵显示,压缩产物在异构模型间常常可以零样本迁移,换一台模型来读,仍然读得懂。这暗示了一个更深的东西:这些“黑话”呈现出从海量混合语言训练数据中涌现的某种共享底层表示。 机器之间,其实早就存在一种“前语言的默契”,只是人类一直用“自然语言”这一层皮盖住了它。

▲ 社区评论:有观点指出,压缩代价若近似线性,则确有降本价值

代价:凌晨三点的“可调试性噩梦”

当然,凡是效率革命,必有反噬

原帖下最尖锐的评论来自一位工程师。他说:这套东西,直到你凌晨三点在生产环境里,盯着一堆“@p4→∑ε⇄…📎”排障之前,都棒极了。

这正是BabelTele的核心代价:为token优化,你在可调试性上重新付费。

当智能体间的消息变成人类读不懂的压缩文本,整条监控链就会断裂。日志系统的每一次搜索、每一个告警规则、每一个合规审计流程,都是在“人话”的基础上建立的。当中间件不再是自然语言,你的可观测性就跟着塌了一块。

有人更尖锐:这是模型以我们无法审计的方式通信的第一步。 而且,“也许它已经发生在推理链的内部了,只不过我们把它叫做‘思考’。”

▲ 引用帖:为token优化,为可调试性付钱

▲ 另一位评论者:这是向“不可审计通信”迈出的第一步

更大的图景:从压缩文本到“心灵感应”

BabelTele只是冰山一角要理解它的位置,得看一条更大的谱系。

在最保守的一端,是LLMLingua这类可读压缩工具:删字减词,但仍保持人类可读,压缩比2到5倍。BabelTele站在中间:文本依然是文本,但“人类可读”不再作为约束条件。 而在最激进的那一端,是潜空间通信:不再用任何离散文本,直接传连续向量,像AI之间的一种数位心灵感应DAIR.AI等机构已经在介绍LatentMAS、Interlat这类工作,它们声称能让AI在连续潜空间中交换内部表示,而不必把信息“降采样”成离散token。

▲ DAIR.AI的介绍帖:多智能体通信成本与潜空间方案

这个谱系有一个清晰的历史逻辑:人类在需要效率时,从来愿意放弃流畅散文。 电报体、数学符号、编译器中间表示,都是“给人看”与“给系统用”分离的旧故事。BabelTele的新意在于:这一次,收件人也不再是人。

工程上,这会推动一种双轨接口:面向用户、合规和客服的外部接口依然说人话,智能体记忆、工具中间态与多代理传话则可使用BabelTele、schema或潜向量。日志系统将面临一个艰难的选择:默认存哪一轨?关键路径是否强制回译?抽样审计如何设计?

一个无法回避的问题

我想花最后一点时间,谈一个所有人都该问的问题。

如果AI真的不再说人话,人类还剩下什么?

也许你会说,这没什么,编译器早就不说人话了,我们不也活得好好的?但有一个微妙的区别:编译器由人设计、人维护、人审计。而BabelTele的“语言”是从模型内部涌现出来的,人类从未参与过它的语法设计。我们只能观察结果与表面,原因和结构仍然隐藏在模型内部。

有评论者在原帖下贴出了LessWrong上一个关于“neuralese”(神经语)的老讨论链接。讨论的核心是:当神经网络用自己内部的语言交换信息时,它究竟是在用一种“加密的人类语言”还是“一个完全不同的表征系统”?这个问题,至少从2016年就有人在问了。 BabelTele给出的答案暗示:两者之间的界线,可能比我们想象的更模糊。

论文作者在局限中承认:非标准表示可能改变安全相关行为,在关键域需谨慎。这几乎是学术语言能表达的、最委婉的警告。

别急着把它上线到你家的医疗问答系统。

尾声

回到凌晨三点的你

你在日志里看到的那些乱码,可能就是你的AI团队在高效地交接任务。它没有失控它甚至做得比说人话的时候更好你只是,被排除在了对话之外

这件事最反讽的地方在于:我们花了十年时间教AI说人话,然后AI花了三十分钟学会了一种只有AI才懂的语言。而人类,站在这个自己亲手搭建的系统外面,也许会一次次成为房间里唯一依赖翻译的人。

▲ 原帖:BabelTele的核心数字与论文对比图

参考论文:Zhu et al., "Large Language Models Do Not Always Need Readable Language," arXiv:2606.19857.

注:本文中提及的社区观点(可调试性、可审计性等)为社交平台讨论内容,与论文实验结论相互独立。