16.9MBの音声認識「Whistle」が示す、端末内AIの次の一歩
Cactus Computeが公開したWhistleは、音声を文字起こしするための小型モデルだ。面白いのは、単に「軽い」だけではなく、同社の別モデルNeedleと同じCPU向けエンジンで動き、1つのバイナリから文字起こしとtool callの両方につなげられる点にある。スマホ、ウェアラブル、ロボット、スマートホーム、車載機器、マイコンまで想定していて、しかも音声データは端末の外に出ない。大きなクラウドに投げず、端末の中で完結する音声AIを本気でやろうとしている記事だと読んだ。 元記事によると、Whistleは「speech recognition model for mobiles, wearables, robots, smart home, automotive and microcontrollers」として発表された。モデル本体は16.9 MBの1ファイルで、CPU上で動き、依存関係はない。しかもNeedleと同じC++エンジン、同じcontainer、同じquantisationで読み込める。つまりWhistleは、別物の音声認識ソフトを新たに足したというより、同じ実行基盤の
papoo.work