1. 看重成本的新阶段
DeepSeekv4Flash的7月31日版,先是宣布定价低至¥2/Mtoken。 这个价格低到了不仅让同品质友商毫无招架之力,甚至影响AI行业的估值逻辑。 8月6日,DeepSeek又官宣要调整价格,大概率会涨价。
2. 低价不等于亏损补贴
如果DeepSeek是亏损换客户,那这就不是技术进步,而营销行为了,不值得热议。 而近期DeepSeek要调整价格的新闻,也在加深这种顾虑,很多人会认为是DeepSeek亏不起了要涨价。
后文估算了token生产成本。常见的8卡服务器,只要能做到每秒生产35000个token,而每天有一半的Token能卖出去,成本收益即可打平。 DeepSeek从利益动机上来说,不需要补贴客户积累日活月活,不需要烧钱换营收。人家不指着这个挣钱,但也不会刻意烧钱搞抽象。 就算你认为DeepSeek在搞抽象,我们可以去OpenRouter查一查,几个Token厂商自己出硬件自己部署DeepSeek报价,是0.28美刀。
我知道世界是复杂的,高价背后未必是暴利,更可能是天量的浪费。去年我还写过《其他云产品明明拥有暴利但海量浪费》的文章,云厂商打磨十年还是这样,AI行业当然可以存在浪费。 模型技术团队过去专注的是发布新模型,其主导思想更关注模型训练。过去大家不想也没精力关注生产Token的成本。但时代变了。 DeepSeek宣布要大幅提价,更像是在给其他模型厂商一个喘息的机会,给他们3-6个月的时间,补齐Token生产效率的短板。
3. Token生产成本的四大要素
资源成本 生产能力 售出时长 和软件人力开销。
每日资源成本 ÷ (每秒Token生产能力 × Token售出的秒数 ),这三大要素就能决定每个Token的极限成本。
每日资源成本¥3000,每天售出秒数43200秒,外加2块钱每M Token。
3000/43200/2*1000000=34722,每秒生产生产35000个Token就能盈利。
如果均摊硬件和+IDC开销,每天成本是3000,这是一台什么样的8卡服务器? 这种配置的8卡服务器,经过性能调优以后,能不能每秒输出35000个token?
4. 简单聊聊节省成本的方法
4.1 每日资源成本
4.2 每秒Token生产能力
我把模型调优分为动态调优和静态调优,按照这个方法分类有好处。 静态调优就类似于20年前做数据库,因为原厂软件不完善,写个备份恢复脚本都会被当做神迹。但实际上模型原厂、硬件原厂、vLLM和SGLang这类软件原厂,都在快速填补这些技术缝隙。 动态调优,就是我们做在线服务时,根据客户的业务需求和现场的资源环境进行的各种参数调整。比如PD分离究竟几P几D,比如KV cache offload到本地硬盘。只要这些工作没有标准答案,就属于动态调优。
4.3 Token售出的秒数
Token消费是个高延迟业务,所以我们可以通过各种跨节点调度的方式,努力提高Token的售出秒数。
现在想来,DeepSeek涨价有个合理的理由,那就是它发现了:现在每天都供不应求可以卖5万秒6万秒;但未来友商追上来了,可能每天就只能卖2万秒了。
4.4 平台软件和人力开销
5. 珍惜调整方向的时机
首先,管理层的观念要跟上。上一阶段是在比拼模型能力,现阶段是在比拼Token成本。 其次,降本增效大概率不难。因为从未做过降本增效的领域,稍微动一动就能清理出大量的浪费。 第三,随着大家生产token的规模增大数十倍,资源议价能力会大幅增加、建设效率会大幅提高、人力开销会大幅摊薄。 第四,即使Token本身不能卖高价了,Token上下游还有很多可以收费的地方啊。但那是新的议题了,我也没彻底想清楚,所以本文不展开聊。
我们都讨厌烧钱换营收,但是由产研体系发起的降价,这是产研体系的自信和荣誉。
夜雨聆风