夜雨聆风学习资料网

ARTICLE · 1150668

�� DeepSeek 长文档时灵时不灵,最多差 40

�� DeepSeek 长文档时灵时不灵,最多差 40

🧠 DeepSeek 长文档时灵时不灵,最多差 40

你用 DeepSeek 问长文档,是不是经常遇到这情况:上次答得挺准,这次怎么问都答不到点上。重启一次、换个时间再试,又好了。

字节跳动团队最近做了个测试。他们让模型补全一段代码,正确答案明明是字符“8”。结果他们只改了代码前面注释的长度,代码本身一个字没动。注释长度稍微变一点,模型就开始在“8”和错误的“32”之间来回翻转。多打几个等号,就能让它从答对变成答错。

问题出在长文本处理的分块压缩上。为了省显存,模型会把文字切块压缩。副作用是,同一份信息落在不同位置,被压缩的完整度就不一样。这就导致检索时灵时不灵。同一个模型,好位置和差位置的准确率能差 40.2 个百分点。

更扎心的是,单看平均分根本发现不了问题。一个模型平均分追平了基线,但最差位置的表现却惨不忍睹。这说明只看榜单平均分,会系统性地掩盖这种位置失败。

所以关键问题别只问一遍。如果没答到点上,把那段内容换个位置再放一次,或者换句问法重新问。你可能只是第一次撞在了差的相位上。

#DeepSeek#KV缓存#长上下文#AI览无余#人工智能

原文🧠 DeepSeek 长文档时灵时不灵,最多差 40 个百分点
收录于AI 热点·速览报
作者提示: 个人观点,仅供参考
广东,1小时前,

相关学习资料