大家好,我是琸皓。
今天谷歌 DeepMind 扔了个大消息:Gemma 开源模型家族的累计下载量,正式突破10 亿次。
2024 年 2 月才首次上线,从 0 到 10 亿,用了整整两年半。现在全球开发者基于 Gemma"爆改" 出了10 万个衍生变体,有的上了 NASA 卫星,有的钻进了 1 亿人的手机……
但说实话,10 亿下载只是个数字。真正让我觉得震撼的,是 Gemma 干的另一件事 ——用 AI 筛出了一条全新的抗癌通路,而且在活细胞里验证成功了。
今天就跟大家好好聊聊这件事。

一、AI 向癌症发起总攻:4000 种药虚拟筛选
先从最近一条轰动全球的新闻说起。就在昨天,全球 mRNA 巨头 Moderna 和默沙东联手,用 AI 治疗癌症的消息刷屏了。

但很多人不知道的是,早在今年 1 月,谷歌就带着 Gemma 悄悄入局了。
谷歌 DeepMind、谷歌 Research 和耶鲁大学团队,基于 Gemma 开发了一个27B 参数模型,叫Cell2Sentence-Scale 27B,简称C2S-Scale。

这个模型只做了一件事:把一个细胞写成一句话。
听着好像很简单,但背后解决的是一个卡了癌症免疫治疗很多年的大难题。
二、什么是 "冷肿瘤"?为什么免疫系统看不见癌细胞?
这里要划个重点,给不懂生物的朋友翻译一下。
癌症免疫治疗有个卡了很多年的坎,叫"冷肿瘤"。
通俗讲,免疫系统抓坏细胞,靠的是细胞主动 "举牌子"—— 把自己内部的蛋白碎片挂到细胞表面,等于告诉免疫细胞:我这儿不对劲,来查我。

这个动作学名叫"抗原呈递",挂牌子用的那个架子叫MHC-I。
"冷肿瘤" 的问题就是:它不举牌。
免疫细胞从旁边走过去,什么都看不见。再好的免疫治疗药,也打不到一个隐形的靶子。
那怎么让冷肿瘤 "举牌" 呢?免疫系统里有个 "警报信号" 叫干扰素。但在真实的肿瘤里,干扰素的水平通常很低,几乎等同于不存在。
于是研究团队给 C2S-Scale 出了一道非常刁钻的题:
找一种药,它自己不负责拉警报,但只要环境里有一点微弱的警报声,就能把这个声音放大到足以让细胞举牌。
这个 "只在特定条件下起效" 的要求,是整个实验最难的地方。
[配图:双上下文虚拟筛选实验设计示意图]
三、把细胞变成一句话,然后让 AI 读
C2S-Scale 最聪明的地方,在于它做了一个很朴素的转换。
单细胞测序的数据本来是一大坨高维向量,人看不懂,语言模型更看不懂。C2S-Scale 的做法是:把基因名按活跃程度从高到低排成一串,最活跃的排最前面,串成一串。
一个细胞,变成了一句由 "基因名" 组成的句子。

这么一转,不用改 Gemma 任何架构,就能直接 "读" 细胞了。而且它还能顺带把论文摘要、细胞元数据这些纯文字的东西一起吃进去,第一次在同一个模型里被同一套机制处理。
接下来是论文最核心的设计 ——双上下文虚拟筛选(dual-context virtual screen)。

让 C2S-Scale 同时在两个 "平行世界" 里做同一场实验:
- 世界 A(免疫上下文阳性)
:真实患者的原发肿瘤样本,环境里有微弱的干扰素信号 - 世界 B(免疫上下文中性)
:培养的细胞系数据,完全没有干扰素活动

然后把4000 多种药物,一个一个丢进这两个世界里跑一遍。要找的目标很刁钻:只在 A 里起效、在 B 里毫无动静的药。
结果很有意思。C2S-Scale 命中的候选药物中,只有10%-30%在过往文献里被提到过。剩下七成以上,跟这个筛选目标毫无已知关联。
而最终被挑出来的那个,叫silmitasertib(代号 CX-4945),一种 CK2 激酶抑制剂。模型给它打的标签叫 "context split"—— 上下文劈叉:在世界 A 里效果强烈,在世界 B 里几乎为零。
论文中,团队称 C2S-Scale 真正提出了一个新的、可以被证伪的假设。
四、活细胞实验验证:抗原呈递提升约 50%
假设归假设,真伪要靠活细胞实验验证。
团队采用了人源神经内分泌细胞模型,关键在于,这些细胞模型在模型训练时从未出现过 —— 也就是说,这是对模型泛化能力的真正考验。
三组对照结果如下:
单用 silmitasertib:抗原呈递没有变化 单用低剂量干扰素:有轻微提升 - 两个一起上:抗原呈递提升约 50%
这是AI 第一次,提出全新的机理性治疗通路,并在活细胞中得到验证。
说句实在话,这个意义怎么强调都不为过。以前 AI 在医疗领域的应用,大多是辅助诊断、影像识别、药物筛选(从已知药物里找),但这次是 AI从零提出了一条全新的治疗机制,而且实验验证成功了。
这意味着 AI 不只是 "加速已有研究",而是开始具备 "提出新假设、发现新通路" 的能力了。
五、Gemma 的 10 亿之路:从 0 到 10 亿用了两年半
聊完抗癌,再回头说说 Gemma 本身。
开源 AI 模型 10 亿次下载,上一个达到这个量级的还是 Llama 那个时代。
谷歌首次发布 Gemma 时,首批模型只有2B、7B两个尺寸。它和 Gemini"师出同门",但路线完全不同:旗舰 Gemini 主打前沿模型能力,Gemma 则被设计成更轻、更容易本地部署的开放模型。开发者能直接拿到权重,在自己的电脑、手机和边缘设备上运行。

自 2024 年之后,Gemma 的增长速度越来越离谱:
2025 年 3 月,Gemma 发布一周年时,下载量刚刚突破1 亿 2025 年 12 月,超过3 亿 2026 年 4 月 Gemma 4 发布时,累计下载量超过4 亿 今年第二季度,已超9 亿 现在,正式冲过10 亿
与此同时,一个庞大的 Gemma 生态诞生了。
六、Gemma 还干了这些事:上太空、下海听海豚
除了入局癌症,Gemma 还被送上了太空,向地球发送了第一条信息:"地球人,你好"。
[配图:Gemma 在太空 GPU 上运行 / NASA 卫星相关图]
这是历史上第一次,有大模型在太空里的高性能 GPU 上跑起来。
不仅如此,Gemma 还钻入海里,破译了海豚的声音。这款模型叫DolphinGemma,它直接接收海豚声音,寻找其中重复出现的模式和序列,并尝试预测:下一声海豚叫声会是什么。

上天下海,Gemma 的应用场景已经远远超出了 "聊天机器人" 的范畴。
七、Gemma 宇宙大爆发:官方目录上线
今天在宣布 10 亿下载的同时,谷歌还正式上线了一个新的官方 GitHub 库 ——Awesome Gemma,相当于 Gemmaverse 的官方目录。
这里集中收录了 AI 社区微调模型、教程、开发者工具,以及各种 Gemma 应用。
八、我的判断:AI 的未来,是悄无声息地融入每一台硬件
最后说点我的看法。
过去两年的大模型战争,很容易被理解成一场 "谁的模型最聪明" 的比赛。大家都在比参数、比跑分、比谁更像人。
但 Gemma 的 10 亿下载,展示了另一个维度:AI 更具颠覆性的路径,是悄无声息地融入每一台硬件。
Gemma 不是最聪明的模型,它甚至不是谷歌最旗舰的模型。但它轻、它开源、它能在手机和边缘设备上跑,这让它有机会渗透到每一个角落 —— 手机里、卫星上、海豚研究中、癌症实验室里。
10 亿下载不是终点,而是一个生态爆发的起点。当 10 万个衍生变体在各个领域跑起来的时候,Gemma 的价值才真正开始显现。
而 AI 抗癌这件事,更让我确信:AI 不只是工具,它正在成为科学发现的 "合作者"。提出新假设、验证新通路,这些以前只有人类科学家能做的事,AI 现在也能参与了。
当然,AI 提出的假设还需要人类实验验证,AI 筛出的药物还需要漫长的临床试验。但至少,AI 给了我们一个全新的 "找药" 方式,让那些可能被人类忽略的角落,重新被照亮。
你们怎么看 Gemma 的 10 亿下载和 AI 抗癌的突破?觉得 AI 在医疗领域的应用,是噱头还是真的能改变世界?评论区聊聊你的想法。
夜雨聆风