AudioCraft

AudioCraftとは、2023年6月にMeta（facebook）がオープンソースの下で公開した人工知能による音声に特化したPython向けのライブラリです。 PyTorchの上に構築されています。

AudioCraftには学習と推論のサンプルコードが含まれています。とくに推論については高品質な音楽を生成できるAudioGenとMusicGenという2つの推論モデルが同梱されています。

ライセンス

AudioGenやMusicGenで生成した音楽は非商用に限りYouTubeなどでも使用できます。本モデルを使用していることを説明欄に明記し、かつ収益化してはならない（≒広告を入れてはならない）という点に注意してください。

Python 3.10では動かないようです。 Python 3.9にダウングレードしたら動きました。

まずビデオカードの敷居が高い。AudioCraftで中規模の推論モデルを実行するためには少なくとも16GBのVRAMを持つGPUを必要とします。

軽く試した感じでは時間30秒に設定した mediumモデルでVRAM使用量は11GB前後となっています。やはりVRAM12GBのビデオカードではかなり厳しいと思われます。

速度を求めないならメインメモリが多めのRyzen APUかMac (Apple Silicon)を使用するのが手軽かと思います。