做方言AI语音,最难的一关,是方言识别。
很多人以为,普通话能识别,方言也能。错了。
方言识别,比普通话难十倍。
第一个难,没有标准。
普通话有标准发音,字典里写得清清楚楚。AI按字典学,就能识别。
方言没有标准。同一个词,隔壁村和这个村,发音不一样。
温州柳市方言,镇上人说和村里人说,声调都不同。AI学了这个村,听不懂那个村。
第二个难,没有数据。
普通话的数据,网上几百万小时。方言的数据,网上几乎没有。
没有数据,AI学不了。必须自己采。一个村一个村跑,一个人一个人录。
采集慢,标注更难。录完的音,要一句句标文字。标注错了,AI学歪了。
第三个难,同音字多。
方言里,很多词发音一样,意思不同。AI听到一个音,分不清是哪个词。
普通话也有同音字,但语境帮得上。方言语境少,AI容易搞混。
第四个难,口音混杂。
现在的人,方言里夹普通话。一半方言一半普通话,AI听到的是混合语音。
混合语音,比纯方言还难。AI要会切换,会判断,哪句是方言,哪句是普通话。
这四个难,每个都不好过。
所以,方言AI语音,是大厂不愿意碰的硬骨头。
小团队做,就做一个方言,做深做透。一个村一个村解决,一句方言一句方言攻克。
允董专注温州柳市方言。方言识别难,但做深了,用户就离不开。


夜雨聆风