阮咸AI助手,更换模型架构,执行效率提升50%+ 阮咸AI助手一直在用ollama框架作为本地大模型后端,ollama使用简单、配置方便,这也是目前针对本地大模型应用的主要开源框架,但是其资源冗余、效率低下,不能完全发挥硬件性能,但目前需求的不断增加,轻量化单机硬件性能压力较大,影响部分功能需求的应用。 另外ollama本身对高效量化模型支持能力非常差,在部分需求场景下我们需要“更聪明”的模型,显然,ollama框架在这个需求点上已经不太适合,而且ollama也不具备压缩的能力,完全靠“堆硬件”方式基础实现,不利于整体使用成本的下降。 所以我们准备更换整个模型后端,逐步舍弃ollama,采用效率更高、更激进的方式,使整体运行效率至少有50%的提升,尽最大可能释放轻量化硬件的全部效能! 目前我们已经完成了新框架的执行验证,效果喜人!预计在6月中下旬,我们会完成阮咸AI助手整个后端逻辑的更换,届时,一台笔记本电脑配阮咸AI助手,在某些需求场景下是可以硬扛“GPU服务器”的!