做AI语音软件,最难的是什么?
很多人说,是技术。是算法,是模型,是准确率。
错了。最难的不是技术。
技术可以买,可以学,可以找外包。有钱,技术问题能解决。
最难的是数据,是场景,是用户习惯。
第一个难,数据。
AI要学习,要数据。语音数据,从哪来?
普通话的数据,网上一大把。方言的数据,网上几乎没有。
温州柳市方言的数据,必须自己采。一个字一个字录,一句话一句话标。
数据采集,慢,累,枯燥。但没数据,AI学不会。
第二个难,场景。
AI在实验室里,准确率99%。放到用户家里,准确率80%。
为什么?场景不同。
用户家里有电视声、有小孩吵、有空调嗡嗡响。AI听到的,不是干净的声音。
场景的复杂度,实验室模拟不了。只能在真实环境里,一遍遍测试,一遍遍调。
第三个难,用户习惯。
用户怎么说,怎么问,怎么用,AI不知道。
有的用户说"开灯",有的用户说"把灯开一下"。AI要两种都听得懂。
有的用户问的时候很快,有的用户问的时候停顿。AI要都能识别。
用户习惯千人千面。AI要适应各种习惯,才能让大多数人满意。
这三个难,都比技术难。
技术有钱能解决。数据、场景、习惯,有钱也快不了。
必须花时间,花精力,一点点积累。
允董做AI语音软件,花时间在数据、场景、习惯上。技术是基础,数据场景习惯才是核心。


夜雨聆风