ARTICLE · 1078689
国产显卡换套软件,推理吞吐翻近7倍
国产显卡换套软件,推理吞吐翻近7倍

据量子位报道,文生视频吞吐翻近 7 倍。同一台国产显卡没换芯片,只改了软件,硬件还是那块硬件。
发生了什么
据量子位报道,这套叫 Meta-Infer 的推理引擎在国产 PCIe 显卡上跑通了推理任务。据量子位称,测试口径定为单机 8 卡、5 秒、768P。据量子位披露,文生视频 296 条/时、参考图生视频 131 条/时。
据量子位消息,高端 B300 的文生视频 439 条/时、参考图生视频 225 条/时。据量子位披露,国产卡分别约是它的 67% 和 58%。据量子位消息,约 2.6 台 6000D 顶 1 台 B300 的文生视频吞吐、参考图生视频约 2.9 台。
据量子位消息,叠 LoRA 后比例缩到约 1.5 台和 1.7 台。
为什么值得你注意
据量子位了解,性能差距缩小没动硬件,全来自软件栈、缓存策略和模型优化。据量子位了解,35 组配对测试里并行提交带来 11.26% 吞吐提升。据量子位指出,全部优化收在推理引擎内部,不改模型权重、不改结构。
和你有什么关系
量子位披露,背景是高端算力成本高、供给紧。据量子位写道,成本更友好的 PCIe 显卡有机会在部分推理指标上够到高端卡水准。风险也实在:这是单源工程实践,不是通用结论。具体哪块卡、哪个模型能吃这波红利,还得看厂商适配。别看到开头那个倍数,就以为手里的老卡能原地起飞。
硬件上限由芯片定,实际能发挥多少,看软件。