夜雨聆风学习资料网

ARTICLE · 980997

AI产业链-02:GPU这么厉害,为什么还需要别的芯片?

AI产业链-02:GPU这么厉害,为什么还需要别的芯片?
我看芯片讨论,经常碰到一种说法:专用芯片成本低,迟早把GPU替代掉。
乍一听挺顺。专门干一件事的,总该比什么都能干的更划算吧?
可真到掏钱买设备的时候,这笔账没那么简单。
打个比方,我要开一家早餐店,每天卖几万个同样的包子,买条专用生产线可能很合适。机器一开,大小、重量都差不多,省人,出货快。
但如果今天卖包子,明天试蛋糕,后天客户又要烧卖,这条线就未必好用了。机器便宜归便宜,改一次花多少钱,停几天,谁来修,都得算。
芯片也有类似的问题。
CPU比较灵活,系统运行、任务调度,以及不少零碎复杂的工作,都需要它。GPU擅长把大量相似计算同时铺开做,所以在很多AI任务里很能打。ASIC则是为特定用途设计的芯片,取舍更明确,有机会把目标任务做得更省。
这里别误会,专用芯片也能做训练,并不是只管推理。
我更关心的,其实是设备买回来以后,有多少时间真正在干有用的活。
假设两套方案,满负荷时完成同样工作的能力一样。一套每年固定成本1200万元,有效利用率60%;另一套连迁移维护算上只要1000万元,但有效利用率只有35%。
按有效产出来摊,后面那套反而更贵。这还只是教学假设,真比较时,任务质量、耗电这些也要统一口径。
便宜的设备闲在那里,照样花钱。
还有一笔容易漏掉:换工具的成本。
原来程序跑得好好的,工程师也熟悉。换芯片以后,软件要不要改,出了问题谁解决,多久能恢复到原来的水平?
这就是软件生态值钱的地方。它不只是大家用习惯了,而是一堆已经解决过的问题,不必重新解决。
所以有些方案看着贵,客户还是买。少折腾几个月,业务早点上线,可能就值回来了。
但我也不觉得,生态好就能永远高枕无忧。
小客户省下的钱,可能还不够付迁移费用。大客户每天跑那么多任务,单次省一点,几年下来就是大数目。只要任务足够稳定,它当然有动力搞专用方案。
问题到了供应商这边,又变了。
拿下一个大客户,很漂亮。可客户下一代还找不找你?开发费用谁出?项目突然取消,备好的货算谁的?
这些问题,跑分回答不了。
所以我不太愿意押一种芯片通吃。CPU有它要处理的事,GPU有灵活性和软件积累,专用芯片有针对特定任务优化的空间。再看看产业里这些公司在干什么,就更有意思了。
谷歌自己做TPU,英伟达的GPU也照样用。网上还在争专用芯片什么时候干掉GPU,人家两边的生意都在做。
我觉得挺好。客户要什么就卖什么,没必要为了证明自己当年的判断正确,连钱都不赚了。
而且买得多了,谁不想多一个供应商?我去买个家电都知道比价,花这么多钱建机房,总不能对方报多少,我就点头多少。
当然,自研也不是白捡便宜。设计、软件、团队,样样要钱。采购部门少付的那笔钱,可能转头就发给研发部门了。最后省没省,得合起来看,不能各部门都宣布自己取得重大胜利,公司一算账,钱没了。
英伟达这边也一样。
大家老说CUDA生态好。这话没错,但好在哪里?对客户来说,就是程序能跑,工程师会用,出了问题有工具查。真要换一套,折腾三个月还没上线,老板恐怕也没心情欣赏新芯片的参数。
可生态再好,客户也会算账。省下来的钱要是足够养一支迁移团队,人家就真会养。
所以我不太相信客户永远离不开谁。离不开,有时候只是暂时还不值得搬家。房租涨到一定程度,连沙发怎么搬都能研究明白。
博通的位置也挺有意思。它做定制AI加速器相关业务,也做网络互联。
你们争哪颗芯片厉害,它还可以做把芯片连起来的生意。毕竟一大堆设备摆进去,数据传不过去,贵得要命的芯片就在那儿等。看着是高科技,忙起来也怕堵车。
但拿到大客户订单,也别高兴得太早。
客户今天说一起定义未来,明天预算一改,未来先往后放放。前期开发谁付钱,备好的货谁接,合同里最好已经写清楚。发布会上大家站得再近,也不能替代付款条款。
国内这边,我更想吐槽的是,有些讨论太着急宣布生态成熟了。
支持多少模型、适配多少框架,一张图能列得密密麻麻。我看完还是想问:客户自己装,顺不顺?模型换个版本,还能不能跑?出了问题,是查文档就能解决,还是得把厂商工程师请到现场?
华为推进CANN开放,做的就是软件和开发者这块功课。但开放了,不等于这些问题已经全部解决。
每来一个客户,都派一队人过去照顾,当然也能把项目做下来。只是我得分清,这是产品越来越好用了,还是工程师越来越辛苦了。
最怕的是演示时十分钟跑通,客户回去折腾两星期。芯片没闲着,人也没闲着,就是业务迟迟没干上。
所以我看国内芯片进展,挺想听一点不那么热闹的消息:某个客户用了一批,第二批接着买,而且这次不用厂商天天派人盯着。
这事听起来不够振奋,没有全球领先,也没有重新定义。
但我觉得,能让客户少打几个求助电话,可能比发布会多讲半小时都有用。

相关学习资料

返回首页浏览学习资料