ARTICLE · 1138027
前OpenAI核心成员Karpathy又说对了?
前OpenAI核心成员Karpathy又说对了?
你可能没听过 Andrej Karpathy 这个名字,但你大概率用过他参与定义的那套东西。
安德烈·卡帕西(生于1986年10月23日),是一位斯洛伐克裔加拿大籍人工智能研究员,他是OpenAI的联合创始人,专注于深度学习和计算机视觉。曾担任特斯拉人工智能和自动驾驶视觉部门总监,并于2024年创立了人工智能教育平台Eureka Labs。
2026年,他加入Anthropic公司,成为预训练团队的一员。
当年离开大厂后,他没有继续卷参数,反而把精力放在「把模型做小、做透」上:nanoGPT、从零讲神经网络的公开课,圈内几乎人手一份。
最近他又把一件事说得很直白:很多人每天在租用前沿大模型,可其中不少任务,一个 30 亿参数的小模型就能做完。真正该问的不是「小模型有没有大模型强」,而是「我这一千次调用里,有几次真的需要前沿模型」。
这句话刚传开,webAI 就甩出了一个对照物:TwIL-LM3-Pro。
它只有 36.6 亿参数,量化后大约 2.09 GiB,普通 CPU 或 4GB 显存就能跑,数据不出本机,也没有按次计费的 API 账单。底座是 IBM 的 Granite 4.2 3B,后面叠的是一套后训练流水线:LoRA 监督微调、检查点融合、WiSE-FT 权重插值,再加上熵加权的 GRPO 强化学习。
官方的判断很明确:优势不在参数规模,而在后训练。
在他们自己的评测里,数字相当扎眼。形式逻辑综合分比中国的 VibeThinker-3B 高约 35%,比 Qwen3.5-4B 高约 24%,比 Liquid AI 的 LFM2.5-8B-A1B 高约 47%,六项形式逻辑任务全部领先 VibeThinker-3B。
更广一点的推理上,BIG-Bench Hard 逻辑子集 95.4%(VibeThinker-3B 为 61.1%),小学应用题 SVAMP 95%,多步软推理 MuSR 64.1%,都是同体积模型里的最高纪录。第一代 TwIL 一个月下载超过 50 万次,Pro 是在这个基础上,形式逻辑综合分又相对提升了约 31%。
不过别把它当成下一个 ChatGPT。模型卡写得很清楚:它是面向形式逻辑的专用模型,擅长一阶逻辑翻译、蕴含判断、语义解析、Lean 证明批评这类结构化输出,没有额外做安全对齐和通用助手调优。
Karpathy 关心的那份「小模型工程栈」被整理成一份 18 页 PDF,从分词器、多阶段训练到本地推理都有涉及。
和这份 PDF 放在一起看,TwIL-LM3-Pro 更像一个例证:AI 可能正在进入后训练时代,谁能用更短的流水线,把够用的智能塞进你已经有的设备里,谁就不用再为每一次调用付钱。