做AI语音软件,最常被问的一个问题:数据从哪来?
AI不是凭空聪明的。它要学,要大量的语音数据。
数据从哪来?三个来源。
第一个来源,自己录。
最简单的来源。自己说,自己录,自己标。
“开灯”,录一百遍。“关灯”,录一百遍。不同人,不同语气,不同场景。
自己录的数据,干净,准,但量少。一个人录,一个月能录几千条。
几千条,够做一个小模型。要做得好,不够。
第二个来源,方言采集。
做温州柳市方言,需要本地人录。找本地朋友,一句句录。
方言采集最难。不是难在录,难在找对人。
要找纯正的本地人,说的是地道方言。口音不纯的,录进去反而乱。
方言采集,慢工出细活。一个方言,采集几个月,很正常。
第三个来源,公开数据集。
网上有一些公开的语音数据集。中文的、英文的,都有。
这些数据集,能用。但质量参差,要筛选。
而且,公开数据集里,方言少。普通话多,方言几乎没有。
做方言,还是得自己采。
三个来源加起来,才能做出好模型。
自己录打底,方言采集做差异化,公开数据集补充。
数据从哪来?从一点一滴积累来。
允董的方言数据,就是这样来的。一个字一个字录,一句话一句话采。
数据够了,AI才准。数据不够,AI就是个摆设。


夜雨聆风