# Kitten TTS、高品質なテキスト読み上げのCPU動作を目指す

このオープンソースプロジェクトは、ONNXベースのモデルを小型に保ちながら、実用的な音声合成を目指しているとしている。

NeoTechNews編集部

Kitten TTSは、開発者とユーザーの双方にとって重要な問題、つまりGPUに依存せずに優れたテキスト読み上げ性能を実現する方法を解決しようとしている。GitHubのプロジェクトページによると、このライブラリはONNX上に構築されたオープンソースの軽量TTSシステムで、モデルの規模は1,500万から8,000万パラメーター、ディスク上の容量は約25~80メガバイトだ。掲げる約束は十分明確で、CPUのみのハードウェア上で高品質な音声合成を実現するというものだ。

この制約は、TTSを実行できる場所を変えるため重要だ。GPUを必要とするツールはデモでは印象的でも、特にノートパソコン、小型サーバー、組み込み環境では、日常的なアプリケーションに使いにくい場合がある。Kitten TTSは、推論を特殊なワークロードとして扱わずに開発者が利用できる、より省リソースな選択肢として位置付けられている。多くの製品にとって、それが実際に出荷される機能とロードマップに残ったままの機能との差になり得る。

プロジェクトはまた、現在は開発者向けプレビュー段階だとしており、これは過大評価を避けるための有用な注意点だ。ページには、リリース間でAPIが変更される可能性があることや、一部のユーザーからkitten-tts-nano-0.8-int8モデルの問題が報告されていることが記されている。この種の警告は盛り込む価値がある。新しい音声ライブラリは、本当に安定するかなり前から完成度が高く見えることが多いためだ。プレビューという表示は、完成ではなく、活発に開発中であることを示している。

それでも、機能は幅広い。リポジトリによると、ユーザーはテキストから音声を合成してNumPy配列にしたり、音声をオーディオファイルへ直接書き込んだり、音声を生成せずにテキストを正規化したりできる。また、結果には、ライブラリが略語、日付、時刻、数字、通貨、句読点をどのように正規化したかを示す範囲情報を含められるという。こうした機能は、整ったデモ用入力だけでなく、扱いにくい現実のテキストへの対応に役立つため、実運用環境でTTSをより有用にする。

Hugging Face Spaces上のブラウザーデモは、このプロジェクトへのもう一つの入り口となる。オープンソースの音声ツールは見つけてもらうのに苦労することが多く、ウェブデモがあれば、統合するかどうかを決める前にモデルの音声を聞きやすくなるため、これは重要だ。GitHubページは商用サポート、カスタム音声、エンタープライズライセンスにも言及しており、このプロジェクトがオープンな配布と本格的な導入への道筋との両立を図っていることをうかがわせる。

このリリースの背景には、より大きな技術的潮流がある。開発者は、最大規模のモデルや最も高価なハードウェアを必要としない、ローカルまたはエッジ環境に適したAIツールをますます求めている。小型のTTSスタックは、端末上のアシスタント、オフラインアプリ、アクセシビリティーツール、低遅延の音声合成を必要とするバックエンドサービスなど、より多くの場所で音声出力を利用できるようにすることで、その変化に適合できる。

Kitten TTSがうたわれている通りに機能するなら、最も興味深い点は新奇性ではなく実用性かもしれない。広範に実行できるほど小型のまま、実用に足る性能を約束している。品質と効率が相反しがちな分野では、これは価値ある組み合わせだ。そのため、開発者が結局CPUで十分だと気付けば、静かに普及していく可能性のあるプロジェクトの一つとなっている。