乐于分享
好东西不私藏

原来AI也是二游啊,DeepSeek V4 Pro配置专武后不熟Fable

原来AI也是二游啊,DeepSeek V4 Pro配置专武后不熟Fable

玩二游的人都懂:角色再强,不配专武,输出就是打折的。基础属性看着漂亮,实战一打就露馅——技能循环断、能量不够、机制吃不满。直到专武到手,伤害翻倍,手感直接起飞。

2026年8月中旬,社区里出现了一份很“二游”的对照报告:DeepSeek V4 × J-Space Capability Realization Report(作者Tiger3807861189,GitHub + Zenodo开源)。它把DeepSeek V4(尤其是V4-Pro-0813)比作一个潜力巨大的角色,而J-Space Cognition Suite就是它的专武。

报告结论很炸:在9项Benchmark里,V4-Pro-0813 + J-Space有7项排名第一

专武是什么?J-Space到底干了啥

J-Space不是微调,也不是换权重。它是一套推理时控制套件(inference-time harness / cognition suite),开源、模型无关,基于Anthropic对“J-space / 全局工作空间”的研究思路。

核心问题它想解决的是:能力实现损失(capability-realization loss)

DeepSeek V4本身很强,尤其在Agent、编程、工具调用场景。但真实长程任务里,经常出现一种“思维链二极管”现象:

  • • 短思维模式:反应快,但容易过早下结论、证据整合不足、跳过中间桥接。
  • • 长思维模式:分析很深,但容易陷入过度推演、行动延迟、状态漂移,迟迟不真正动手。

这两种模式一旦定型,会话里很难切换。报告推测这和模型对极简Harness接口的“过拟合”有关——启动条件、角色设定、工具清单稍微一变,推理路线就整条跑偏。

J-Space不改模型,而是在外面加一套“工作纪律”:

  • • 工作空间路由 + 状态账本(Goal / Core / Verified / Open / Next)
  • • 强制桥接再下结论
  • • 工具接缝刷新、验证覆盖、checkpoint、恢复机制
  • • 短模式补证据与复核,长模式强制绑定行动与Next

简单说,就是给模型一个结构化的内部记事本和自我监督协议,减少能力在执行过程中“漏掉”。

数据说话:7项第一是怎么来的

报告给出的对照表(V4-Pro-0813 vs +J-Space,并与GLM-5.3、Kimi-K3、Opus-4.8、Fable 5等对比):

Benchmark
V4-Pro裸跑
+J-Space
排名情况
提升幅度
HLE(无工具)
42.7
48.0
非第一(Fable 53.3更高)
+5.3
HLE(有工具)
60.0
67.7第一
+7.7
Terminal Bench 2.1
87.9
90.1第一
+2.2
NL2Repo
61.5
73.4第一
+11.9
CyberGym
83.3
86.8第一
+3.5
DeepSWE
62.7
72.0第一
+9.3
Toolathlon-Verified
74.1
79.5第一
+5.4
Agents' Last Exam
25.7
30.3第一
+4.6
AutomationBench(Public)
31.8
38.2
第二(GLM 48.2更高)
+6.4

确实是9项里7项第一。同模型对比最干净:所有项目都上涨,尤其是Agent/编程相关任务(NL2Repo、DeepSWE、Toolathlon、HLE有工具)提升明显。

Flash版本(V4-Flash-0731)也有类似增益,只是绝对值更低。

为什么这个“专武”这么香?

报告的核心洞察很实用:

很多时候,模型的天花板不是权重本身,而是运行时协议。你用的Harness、状态管理、验证纪律,直接决定了能力能释放多少。J-Space像是给角色加了专属机制:强制验证、状态不丢、短长模式都能兜底。

在真实Agent场景(长上下文、多工具、多步骤、需要中断恢复)里,这种“外部工作空间管理”比单纯堆参数更立竿见影。

但别盲目all-in,专武也有冷却时间

必须诚实说几点:

  1. 1. 单次运行结果,没有公开完整raw log、seed、置信区间。跨模型分数来自各厂商不同评测方法,不是统一Harness。
  2. 2. 社区复现有争议。有人在Terminal Bench子集做了高并发A/B,发现加了J-Space后分数没升甚至略降,同时token和耗时明显增加。作者也承认部分效率数字(比如2.53×速度、2.21×token效率)“确实夸张”,实际区间大概在1.6–3倍。
  3. 3. 报告自己写得很清楚:这是工程观察记录,不是正式学术论文;J-Space不补充缺失知识,效果因任务、环境、采样配置而异。

所以“全面吊打Fable 5”的病毒式传播有点过头了。同模型提升是报告最扎实的部分,跨模型“全面第一”需要更多独立验证。

结语:AI的二游时代已经到了

DeepSeek V4本身已经是开源里非常能打的角色,尤其是性价比和长上下文。但配上J-Space这种专武后,在部分高难度Agent Benchmark上确实能放出更接近“满配”的实力。

这给我们一个很现实的提醒:

模型是角色,Harness是专武,Prompt是圣遗物,工作流是队伍。只盯着模型排行榜已经不够了。真正能打的系统,是“模型 + 控制层 + 验证纪律”的组合。

想自己试试的话,J-Space Cognition Suite V3.6和对照报告都是开源的(GitHub上搜Tiger3807861189就能找到)。装上技能包,或者把SKILL.md当系统指令用,就能体验一下“配专武”的感觉。

二游玩家早就懂了:不配专武的角色,再强也是半成品。AI这边,现在也开始懂了。

文,图:Grok