乐于分享
好东西不私藏

AI语音软件,数据从哪来

AI语音软件,数据从哪来

做AI语音软件,最常被问的一个问题:数据从哪来?

AI不是凭空聪明的。它要学,要大量的语音数据。

数据从哪来?三个来源。

第一个来源,自己录。

最简单的来源。自己说,自己录,自己标。

“开灯”,录一百遍。“关灯”,录一百遍。不同人,不同语气,不同场景。

自己录的数据,干净,准,但量少。一个人录,一个月能录几千条。

几千条,够做一个小模型。要做得好,不够。

第二个来源,方言采集。

做温州柳市方言,需要本地人录。找本地朋友,一句句录。

方言采集最难。不是难在录,难在找对人。

要找纯正的本地人,说的是地道方言。口音不纯的,录进去反而乱。

方言采集,慢工出细活。一个方言,采集几个月,很正常。

第三个来源,公开数据集。

网上有一些公开的语音数据集。中文的、英文的,都有。

这些数据集,能用。但质量参差,要筛选。

而且,公开数据集里,方言少。普通话多,方言几乎没有。

做方言,还是得自己采。

三个来源加起来,才能做出好模型。

自己录打底,方言采集做差异化,公开数据集补充。

数据从哪来?从一点一滴积累来。

允董的方言数据,就是这样来的。一个字一个字录,一句话一句话采。

数据够了,AI才准。数据不够,AI就是个摆设。