ARTICLE · 1150810
你有没有遇到过:同一段长文档扔给DeepSeek,早上问,答得明明白白,下午再问,突然就答非所问了
你有没有遇到过:同一段长文档扔给DeepSeek,早上问,答得明明白白,下午再问,突然就答非所问了
你有没有遇到过:同一段长文档扔给DeepSeek,早上问,答得明明白白,下午再问,突然就答非所问了。
大家都说AI抽风。昨天刷到字节Seed团队的论文,发现这风还真不是白抽的,人家连抽风的频率都测出来了。
原因说穿了不复杂。大模型为了省内存,会把读过的内容打包压缩再存起来,行话叫KV缓存压缩。但打包这事有个副作用:你的关键信息落在打包窗口的哪个位置,决定了它能不能被顺利找到。
同一份资料,关键数字落在好位置,检索准确率能到90%,往前挪几个字,掉到50%,模型瞬间变瞎。更绝的是,这波动还有周期,DeepSeek-V4每4个token一个轮回,V4.1改成2个,跟两代模型的压缩步长严丝合缝。最狠的基础版,同一道题换个位置,准确率能拉开40个百分点。后训练改善了不少,最新版缩到6个百分点,但周期还在。
所以下次看到跑分榜单,别光看平均分,那是高低点互相抵消出来的。不少人还摸索出个土办法:把关键信息放前面,别让它在压缩窗口里抽签。
所谓玄学,都是还没看懂的工程。
收录于AI资讯
作者提示: 个人观点,仅供参考
浙江,2小时前,