ACE-Stepをローカルで動かして音楽生成|インストールから出力まで

ACE-Stepをローカルで動かして音楽生成|インストールから出力まで

※本記事にはプロモーション(広告・アフィリエイトリンク)を含みます。

ACE-Stepは、テキストプロンプトと歌詞から楽曲をまるごと生成できるオープンソースの音楽生成モデルです。ライセンスはApache 2.0で、商用プロジェクトでも制約なく使えます。この記事では、ローカルGPU環境へのインストールから音声ファイルを出力するまでの手順を書きます。ComfyUIやStable Diffusionをすでに動かしている環境でのVRAM共存まわりにも触れます。

ACE-Stepの特徴とライセンス

ACE-Stepは、AIスタートアップ Stepfun が2025年に公開した音楽生成モデルです。GitHubリポジトリ(https://github.com/ace-step/ACE-Step)で公開されており、HuggingFaceからモデルウェイトをダウンロードして使います。

項目 内容
ライセンス Apache 2.0(商用利用・改変・再配布が自由)
入力 テキストプロンプト+歌詞テキスト(歌詞は任意)
出力形式 WAV / MP3
対応言語(歌詞) 英語・中国語
GPU要件 CUDA対応、VRAM 8GB以上推奨(公式ドキュメント記載)

Apache 2.0は商用利用・改変・再配布をすべて許可するライセンスです。CatVTONやIDM-VTONはCC BY-NC-SA 4.0で商用利用が禁止されていますが、ACE-Stepにはその制約がありません。FLUX Schnell・Wan2.1と並んで、商用案件に使えるオープンソースの音楽生成モデルのひとつです(執筆時点)。歌詞を渡せばボーカル入りの楽曲も生成できるのが大きな特徴で、動画BGMやゲームBGMなど用途が広いです。

必要な環境

この記事ではLinux / CUDA対応GPUの環境を対象とします。公式ドキュメントが示す要件は以下です。

  • GPU: CUDA対応(VRAM 8GB以上推奨)
  • Python: 3.10以上
  • CUDA Toolkit: 11.8または12.x(PyTorchバージョンに合わせる)
  • ストレージ: モデルウェイト含め10GB前後

Windowsでも動作する可能性はありますが、公式手順はLinux/macOSを前提としています。環境によって結果が異なる場合があります。

インストール手順

1. クローンと仮想環境

git clone https://github.com/ace-step/ACE-Step.git
cd ACE-Step
python3 -m venv venv
source venv/bin/activate

仮想環境を分けるのは、ComfyUIやSD WebUIのPython依存と干渉させないためです。

2. 依存パッケージのインストール

pip install -e .

公式READMEに記載された手順です。torch のバージョン競合が起きた場合は、先にCUDA対応版のPyTorchを手動インストールしてから再実行します。

# CUDA 12.1向けを先に入れる例
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
pip install -e .

CUDAバージョンは nvcc --version で確認できます。対応するPyTorchインストールコマンドはPyTorch公式サイト(https://pytorch.org/get-started/locally/)で生成されます。

3. モデルウェイトのダウンロード

初回起動時に自動ダウンロードされますが、事前取得しておくと起動が速くなります。

pip install huggingface_hub
huggingface-cli download ACE-Step/ACE-Step --local-dir ./checkpoints

ウェイトの合計サイズは執筆時点で数GB程度です。

音楽を生成する

Gradio UIで生成する

python app.py

ブラウザで http://localhost:7860 を開くとUIが表示されます。

パラメータ 説明 設定例
Audio Duration 楽曲の長さ(秒) 30〜60
Prompt 音楽スタイルの説明 upbeat electronic dance music with synthesizer
Lyrics 歌詞テキスト 空白でインストゥルメンタル
Guidance Scale プロンプト追従度 7.0前後

プロンプトは英語で書くほうが精度が出やすいとされています(公式リポジトリのサンプルより)。ジャンル・楽器・テンポ・雰囲気を組み合わせるのが基本です。例:cinematic orchestral music, slow tempo, emotional, strings and piano

Pythonスクリプトから呼び出す

以下はリポジトリのサンプルをもとにした構造例です。バージョンによって引数名や返り値が変わる可能性があるため、実際の使用時は公式リポジトリの最新サンプルを参照してください。

from acestep.pipeline import ACEStepPipeline

pipe = ACEStepPipeline(
    checkpoint_dir="./checkpoints",
    device="cuda",
)

output = pipe(
    prompt="cinematic orchestral music, epic and emotional",
    lyrics="",         # 空文字でインストゥルメンタル
    audio_duration=30,
)
# 出力の保存方法はリポジトリのサンプルに従ってください

複数プロンプトをリストにして一括生成し、気に入ったものを選ぶフローが実用的です。

GPUを他のサービスと共存させる

ComfyUIやSD WebUIと同じGPUを使う場合、同時起動するとVRAMが不足します。ACE-Stepは生成中にVRAMを大量に確保するため、VRAM 12GB程度のGPUでも他のプロセスと同時稼働は難しい場合があります。

プロセスを止める際はポートからPIDを特定する方法が安全です。

# ComfyUIのデフォルトポートは8188
ss -tlnp | grep :8188
kill <PID>

pkill -f はコマンド文字列への部分マッチで自身のSSHセッションまで終了するリスクがあるため避けてください。ComfyUIのカスタムノードと同様に、環境さえ整えてしまえば起動・停止のルーティンで管理できると考えられます。

よくあるエラーと対処をまとめます。

エラー 原因と対処
CUDA out of memory 他のGPUプロセスを停止してから再実行する
ModuleNotFoundError: No module named 'acestep' venv内で pip install -e . を実行していない
ダウンロードが止まる huggingface-cli download を再実行すると再開する
生成音声がノイズのみ プロンプトが短すぎるか、ステップ数が少ない可能性あり
torch.cuda.is_available() がFalse PyTorchとCUDAのバージョンが合っていない。PyTorch公式サイトで対応コマンドを確認する

まとめ

ACE-Stepは git clone → pip install -e . → モデルダウンロードの3ステップで動き出す、Apache 2.0のローカル音楽生成モデルです。歌詞を渡せば歌唱入り楽曲も生成でき、商用案件にも使えます。

次のステップとして、Pythonスクリプトからバッチ生成する仕組みを作ることをおすすめします。プロンプトのバリエーションをリストにして複数パターンを一括出力し、用途に合ったものを選ぶ運用が、BGM制作において実用的なフローになるでしょう。

よくある質問

ACE-Stepは無料で商用利用できますか?

Apache 2.0ライセンスのため、モデル自体は無料で商用利用も可能です(執筆時点)。利用規約はHuggingFaceのモデルページで確認してください。実行にはCUDA対応GPUが必要です。

VRAM 8GBのGPUで動きますか?

公式ドキュメントの推奨要件がVRAM 8GB以上です。ただしOSや他のGPUプロセスと共有している場合は不足することがあります。12GB以上あれば余裕を持って動かせます。

歌詞なしのインストゥルメンタル楽曲も生成できますか?

Lyricsフィールドを空欄にするとインストゥルメンタルで生成されます。APIでは空文字列を渡してください。プロンプトで楽器構成を指定すると意図した雰囲気に近づきます。