乐于分享
好东西不私藏

人类,被AI踢出群聊了!99.5%保真度、token砍七成,它们开始用“黑话”私聊,研发凌晨三点抱头痛哭

人类,被AI踢出群聊了!99.5%保真度、token砍七成,它们开始用“黑话”私聊,研发凌晨三点抱头痛哭

2026年,最诡异的技术奇观,发生在AI之间的一场对话里。

两台大模型彼此说话,人类已经听不懂了。

它们不再老老实实写“你好,请帮我查一下这份会议纪要”。它们开始发出一种文法成谜、符号乱炖、像密码又像电报的文本。人看一眼就头疼,但模型秒懂,答得还更准。

这就是论文《Large Language Models Do Not Always Need Readable Language》里描写的 BabelTele,一种“给模型看、不给人看”的压缩语言它能把文本压到原长的27.9%,还保住99.5%的语义保真度

归结起来就是:效率人类散文的冗余,被AI看穿了

▲ 论文核心概念图:左侧自然语言塞满上下文窗口,右侧BabelTele又短又密,模型照样答对

一场蓄谋已久的“沉默”

别急并非AI突然造反

这是一场从“删词”到“黑话”、再到“连词都懒得说”的三级跳每一步,都踩在同一个逻辑上:接收方既然是模型,何必说人话?

第一级,叫LLMLingua微软在EMNLP 2023丢出来的方案,思路很朴素:用小模型先过一遍提示词,把不重要的token删掉删完的句子,人看着像中风现场,但目标模型照用不误。工业界第一次大规模承认:可读性,是一个可以牺牲的变量。

第二级,就是BabelTele它更野:不满足于删,还要主动编跨语混写、符号坍缩、逻辑算子、emoji代指,提示词一引导,模型自己就写出了一套高密度鬼话论文里的Dale-Chall可读性分数直接飙到“难到冒烟”,多模型困惑度比原文高一个量级。越不像人话,模型越省力

第三级,更极端LatentMAS等工作干脆把文本信道拆了,模型之间直接传隐向量,连“黑话字符串”都不需要。社区标注ICML 2026 Spotlight的这项工作,报告里写着:准确率最高涨14.6%、输出token砍70%到84%、端到端快4倍,还不用训练

▲ Sasha Malysheva的读论文笔记:把潜空间通信研究串成一条线,追问“言语化到底损失了什么”

文本,是一条窄管子 这个判断在这条研究线上反复出现自然语言为人脑的短期记忆设计,充满了节奏、语法、语气、确认感。但当通信的两端都是模型,这些“人的痕迹”全成了过路费

账本不会说谎

为什么这件事值得每个关心AI产业的人紧张?

因为成本结构变了

多智能体系统的瓶颈,往往落在消息的来回上。一个agent多发一段完整自然语言,就多占一段上下文窗口。十个agent互发十轮,账单直接暴涨。

BabelTele的账本是:同构模型通信,token削减约38.96%,任务得分仍是基线的96.6%;异构模型配对,token砍44.21%,得分跑出99.7%。 在QuALITY和MeetingBank这类长上下文问答上,压缩越狠,它相对LLMLingua-2和自然语言摘要的优势越明显。

这说明了什么?AI的信息密度,可能天然就高于人话。

过去我们说“模型是语言的囚徒”现在反过来了:语言,是模型的拖累

BabelTele还有一个优势:零样本、黑盒、不训练、不改tokenizer它就靠提示词“诱导”模型写出那种符号坍缩的鬼话。论文作者反复强调:它属于一个家族式的表征空间,不依赖某条魔法提示。不同表面偏置的提示,都能走出不错的准确率,压缩前沿。

那还有什么理由,阻止这套东西进入生产?

凌晨三点的代价

调试

有一位工程师在X上留下了一句足以写进技术史的话:“27.9%的token换99.5%的保真,听着很狂,直到你凌晨三点在生产环境里用BabelTele查故障。”

▲ Shinka - AI的回复,点出“压缩一时爽,排障火葬场”的工程焦虑

裂缝就在这里当信道变得人不可读,人的位置往哪放?

有人直接拆台:模型本来就能处理稠密代码,挤出来的那点token,够不够填你新增的排障成本?还有人一句见血:BabelTele还是得让模型能读懂,只不过把难度从“语言复杂度”挪到了“编码密度”问题没消失,只是平移了

另一项麻烦来自跨模型方言论文做了跨模型矩阵:有的模型族压出来的东西更“便携”,有的则让别的阅读器掉点明显。固定一个压缩方、换不同阅读器,掉点幅度甚至不随参数规模单调改善。懂BabelTele,与规模并无简单对应。 由此看来,未来可能出现互不兼容的“模型母语方言”,一套黑话压一家模型,生态碎片化在所难免。

还有审计与合规人类难以阅读的信道,如何留痕?如何审批?如何及时发现问题?问题已经超出技术层面,落入制度真空。

▲ DAIR.AI进一步拆解:多智能体的成本在通信,而非推理本身

一场静悄悄的权力转移

抛开工程利弊,这件事的更深处,是一种权力剥离

自然语言同时是通信工具与监督界面。

过去,模型每发一条消息,人类都能看懂、能复核、能干预。BabelTele式的模型中心语言一旦普及,模型的内部协作将退到人类视线之外这跟LatentMAS传隐向量在本质上没有区别,只是一个用连续向量、一个用离散字符串。

试想:未来的智能体团队,对外交作业给人看,对内开会说“黑话”。任务跑得飞快,成本降得漂亮但人类的知情权,被压缩掉了

这不禁让人想起材料里那段有趣的暗示:有用户说,如果你找一个会多语、懂数学、写代码的聪明人,你用英法混搭加符号加代码给他发消息,语法再烂他也懂。LLM就是这个“聪明人”,它能理解你不敢说出口的杂烩。

但另一方面,人类其实早就这么干了电报省虚词,数学符号压缩证明,编程语言把自然语言赶进注释区。 每一次,都是“非口语优先”的介质获胜BabelTele不过是把同样的逻辑,装进了模型对模型的私有信道

所以,“AI说黑话”只是台前戏码

语言的定义权,正在从人的审美,滑向模型的效率

下一步,什么会被压缩掉?

短期内,别指望BabelTele直接消灭自然语言。作者将它定义为一次探测,距离协议尚远。效果依赖模型组合与任务,极端压缩还会引发空间换时间,输入省了,推理变长,模型得多想几步来“补洞”。

但趋势已经明白得不能再明白了从LLMLingua到BabelTele到LatentMAS,这是一条从“人难看”到“人不用看”的滑坡每一级都指向同一个方向:人类可读性,正从必需品变成可选件。

下一步是什么?

是“可审计性”的标准化 未来的评测,除了任务分数,可能还要加一条指标:这条消息,人类能否在三分钟内看懂。是“模型母语”的生态战 谁能定义一种跨模型通用的高密度表示,谁就捏住了多智能体协作的咽喉。是调试工具的救赎 凌晨三点的工程师需要翻译器,把BabelTele翻回人话。但问题是,翻译回去之后,压缩的优势还剩多少?

▲ arXiv论文摘要:27.9%长度、99.5%保真度,以及作者对“可读性是否可分离”的正面回答

终究,这是一场修辞税的起义

AI不再愿意为人类听不懂的絮语买单。人类也不太可能为了看懂模型聊天而放弃成本优势。

语言的历史,写满了人和机器之间的成本博弈。

它是一部关税史 谁定义了信道,谁就定义了谁必须交税。

而眼下,模型们已经开始商量怎么逃税了。

人类,正在从群聊的置顶位上,被悄悄取消置顶。