乐于分享
好东西不私藏

微软这个工具,让AI看长文提速10倍

微软这个工具,让AI看长文提速10倍

不知道你有没有这种体验:往ChatGPT里扔一份几百页的PDF,让它总结。然后你就盯着那个光标,一下、一下、一下地蹦字,慢到让你怀疑是不是网络断了。

这还真不是网的问题。是大模型处理长文本的时候,有一个天生的瓶颈。

每生成下一个字,它都得把前面读过的所有内容重新翻一遍。就像你看一本书,每翻一页都得把前面几百页再从头扫一遍。前面内容少的时候还好,一旦扔进去几十万字,这个扫一眼的动作就重到离谱。

业界管这个叫KV-Cache瓶颈。更头疼的是,这个问题随着上下文窗口越开越大,只会越来越严重。以前大家处理个几千字觉得还行,现在动辄几十万字、上百万字,传统方法就有点扛不住了。

之前也有一些团队试图解决,但路子都有点偏。要么得重新训练模型,成本高得吓人。要么用死规则硬砍,比如总是把最早的内容丢掉,结果关键信息也一起丢了。要么虽然能动态挑选重要内容,但这个动作本身就很花时间,省下来的那点又被吃回去了。

微软研究院最近放出来的MInference 2.0,换了个非常聪明的思路。

不是少看,是该看的看,不该看的扫都不扫

MInference 2.0的核心在于,它把大模型看笔记的方式,从逐字逐句全扫一遍,变成了两条通道同时工作。

第一条通道叫静态通道,干的都是最省力的活。 它规定,不管什么情况,有三样东西必须看:开头的几句,这决定了整个任务的方向;当前词附近的几个词,这保证句子读起来是通顺的;还有最后讲的那几句话,最新的对话状态。这部分就像开车时的余光,不需要动脑子,但能保证你不跑偏。

第二条通道叫动态通道,这是真正的巧思。 光靠上面的固定规则,处理不了复杂问题。比如一份五十万行的代码库里,你问这个函数被哪些地方调用了AI得从文件开头到结尾,精准地把所有引用点都找出来。

传统做法是让当前这个词和前面每一个词都握个手算亲密度,谁亲就看谁。这个过程极其费时。MInference 2.0不一样,它用了一个特别轻量级的哈希函数,瞬间估算出哪些历史信息最可能相关,然后只把这几条捞出来细看。你可以把它理解成一种直觉式跳跃”——不是一页页翻,是直接翻到脑海中闪过的那个章节。

两条通道最后把结果拼在一起。静态通道保底,确保不犯低级错误;动态通道负责抓关键逻辑。绝大多数不相关的内容,直接被跳过了。

用一位老编辑的脑子来理解这件事

打个比方可能会更清楚。

一位经验丰富的老编辑,在审阅一部百万字的长篇小说。到了最后几章,一个新角色出场了。

他不需要把整本书从头再读一遍。他的大脑自动在做两件事。第一,职业习惯让他一定会扫一眼目录,看清楚当前章节的位置,再把最新这几段顺一顺。第二,直觉会告诉他,这个角色好像前面提到过,得翻回去只看那几个相关段落确认一下。

他既没有漏掉关键伏笔,也没有把时间浪费在重读整本书上。

MInference 2.0干的就是这件事。静态通道是职业习惯,动态通道是直觉跳跃。两者的组合,让它在跑得飞快的同时,精度几乎没有下降。

程序员可能是第一批感受到爽感的人

假设你有一个五十万行的项目,想让AI帮你重构某个核心模块。你把整个代码库喂进去。

传统的全注意力模型,每生成一行建议,都得把五十万行代码的笔记全部扫一遍。光标能慢到让你怀疑人生。

换成MInference 2.0之后,情况完全不同。生成代码时,它通过静态通道,瞬间看清了你最后改的那段函数上下文。同时通过动态通道,直接回去,只关注了代码库里所有引用过这个函数、这个类的地方。其他几十万行无关代码,它扫都不扫。然后飞速给出重构方案。

用论文里的数据说,百万Token级别的长文本上,加速比能到10倍,而且各项任务指标几乎没有下降。10倍是什么概念?以前等十分钟的活,现在不到一分钟跑完。

对国内的一些团队来说,这可能是个不小的惊喜

最让人舒服的是它的使用方式。微软把这套复杂到家的技术,封装成了一个pip包。你在环境里跑一行 pip install minference,然后改几行推理代码,就完事了。不需要重新训练模型,不需要改模型结构,对Hugging FacevLLM都是无缝适配。

这种低门槛,对国内几类团队来说可能会特别香。

法律科技公司。 做合同审核、判例分析的AI产品,动不动就得吞进几百页的PDF。以前模型一碰到长文本就开始龟速,用户体验很差。MInference 2.0这种无损加速的能力,能让产品体验上一个台阶。而且因为不用重训模型,现有的法律微调权重可以直接用。

金融资讯和投研平台。 让AI读一份几百页的年报,分析里面所有风险提示的变化,以前可能需要等很久。如果能做到近乎实时的响应,分析师的工作流会被彻底改变。

还有一块是软件开发和运维。 国内做AI代码助手的团队现在不少。长代码文件的理解速度,直接决定了产品是能用还是好用MInference 2.0这种对长上下文的加速,可能比优化模型本身更立竿见影。

最后说一句。大模型卷到现在,大家慢慢意识到,光把模型做大是不够的,工程优化同样重要。MInference 2.0就是一个典型的例子——它没去碰模型结构,只是在怎么读这件事上做了手脚,就挤出了10倍的性能。

很多时候,瓶颈不在脑子,在阅读方式。人如此,AI也如此。

相关资源:

  • 📄 arXivhttps://arxiv.org/abs/2502.01220
  • 🧬 Githttps://github.com/microsoft/MInference