FLUX Schnell RTX 3060で512×512を何秒で出せるか

※本記事にはプロモーション(広告・アフィリエイトリンク)を含みます。
RTX 3060 12GB で FLUX Schnell を導入するとき、「512×512 を何秒で何枚出せるか」は計画の基準になる。本記事は筆者の実測データではなく、Black Forest Labs の公式仕様・NVIDIA の公開スペック・コミュニティに投稿されたベンチマーク報告をもとに、速度の目安と影響する変数を整理したものだ。数字に幅が出る理由も含めて読んでほしい。
FLUX Schnellとは——4ステップ蒸留モデルの設計思想
Black Forest Labs が公開している FLUX.1 ファミリーには、Dev・Schnell・Pro の3系統がある(執筆時点)。このうち Schnell(ドイツ語で「速い」の意)は 推論ステップ数 4 に特化した蒸留モデルで、ライセンスは Apache 2.0。商用利用が可能な点が、非商用ライセンスの多い他の高性能モデルと大きく異なる。
アーキテクチャは Diffusion Transformer(DiT)ベースで、パラメータ数は約 12B。SD 1.5(約 0.9B)や SDXL(約 3.5B)と比べて大きく、bf16/fp16 のままでは VRAM 要求が 24GB 近くになる。RTX 3060 12GB で動作させるには fp8 量子化が事実上の前提条件になる。
| モデル | 推奨ステップ数 | ライセンス | VRAM(fp8時・目安) |
|---|---|---|---|
| FLUX Schnell | 4 | Apache 2.0 | 約 8〜10 GB |
| FLUX Dev | 25〜50 | 非商用 | 約 8〜10 GB |
| SDXL | 20〜30 | CreativeML Open RAIL+M | 約 6〜8 GB |
| SD 1.5 | 20〜30 | CreativeML Open RAIL-M | 約 2〜4 GB |
※ VRAM 値はモデル単体の目安。VAE・テキストエンコーダー・ControlNet の追加で増加する。
RTX 3060 12GBでの動作環境——fp8量子化の選択
Black Forest Labs は公式リポジトリで fp8 量子化済みチェックポイントを配布している。ComfyUI では flux1-schnell-fp8.safetensors(または GGUF 形式)を models/diffusion_models/ に配置するのが一般的な手順だ。テキストエンコーダーについても、T5XXL を fp8 バージョン(t5xxl_fp8_e4m3fn.safetensors)にすることで VRAM 消費をさらに削減できる。
同ハードウェアでのオフロード設定の挙動については RTX 3060 12GBでSD 3.5 Largeを動かすoffload設定とfp8量子化 に詳しくまとめている。FLUX Schnell でも考え方は共通で、オフロードを有効にすると VRAM は節約できるが CPU↔VRAM 間の転送がボトルネックになり生成速度は落ちる。
ComfyUI で最低限必要なファイル構成の例:
models/
├── diffusion_models/
│ └── flux1-schnell-fp8.safetensors
├── vae/
│ └── ae.safetensors
└── clip/
├── clip_l.safetensors
└── t5xxl_fp8_e4m3fn.safetensors
512×512の生成速度——公開ベンチマークから読める傾向
これは筆者が計測したデータではない点を先に明記する。Reddit の r/StableDiffusion・ComfyUI の GitHub Issues・Discord に投稿されたベンチマーク報告を見ると、RTX 3060 12GB + FLUX Schnell fp8 + 512×512 + 4ステップ + オフロードなしの構成で、1枚あたり 3〜8 秒程度という範囲の報告が多い。
この幅が大きい理由として、以下の変数が効いていると考えられる:
- システム RAM の速度(オフロード使用時の転送速度に直結)
- ComfyUI のバージョンと
torch.compileの有効/無効 - バッチサイズ(1枚ずつ vs まとめて処理)
- 他プロセスによる VRAM の先行使用量
5 秒/枚を中央値と仮定すれば 1 時間で 720 枚という計算になるが、これはあくまで推算であり、環境によって大きく変わる可能性がある。
他のアーキテクチャとの比較:
| 構成 | ステップ数 | 512×512 速度(報告の傾向) |
|---|---|---|
| FLUX Schnell fp8・オフロードなし | 4 | 3〜8 秒/枚 |
| FLUX Schnell fp8・VAEオフロード有り | 4 | 8〜20 秒/枚(推算) |
| SD 1.5 + LCM-LoRA | 6 | 1〜2 秒/枚 |
| SDXL Turbo | 1〜4 | 2〜5 秒/枚 |
※ すべて公開報告にもとづく傾向値。保証値ではない。
ステップ数だけ見れば FLUX Schnell は LCM と同程度だが、モデルサイズが約 13 倍あるため 1 ステップあたりの計算量が多く、結果として枚数では LCM-LoRA 構成に劣る傾向がある。品質と速度のどちらを優先するかで選択肢が変わる。
速度を決める設定パラメータ
ステップ数は 4 が基準
FLUX Schnell は 4 ステップに最適化されているが、2〜3 ステップでも動作するという報告がある。ただし品質劣化が出やすく、Black Forest Labs 公式ドキュメントも 4 ステップを基準として示しているため、枚数稼ぎを目的にステップを減らすのは品質トレードオフとして認識しておく必要がある。
Guidance Scale は 1.0 固定
FLUX Schnell の Guidance Scale(CFG)は 1.0 が公式推奨値。SDXL や SD 1.5 で使う 7〜12 とは別の設定思想で、1.0 以外に変えると品質が落ちやすいとされている。速度への影響はほぼない。
torch.compile による高速化の可能性
ComfyUI + PyTorch 2.x 環境では torch.compile を有効にすると、初回コンパイル(数分かかることがある)後のスループットが向上するという報告がある。RTX 3060 での効果幅は CUDA バージョンや環境によって異なり、劇的な改善を保証できるものではないが、長時間バッチ生成を行うなら試す価値はある。
枚数を積む運用での注意点
連続稼働時の発熱
NVIDIA 公式スペックによると RTX 3060 の TDP は 170W。画像生成は GPU 使用率が高くなりやすく、長時間連続稼働で温度が上昇するケースが報告されている。ケースの排気構成とサーマルパッドの状態は、大量バッチを始める前に確認しておくべきだ。
解像度と速度のトレードオフ
512×512 は FLUX Schnell が速く動く解像度だが、1024×1024 に上げると処理時間はピクセル数以上に増える。トランスフォーマーのアテンション計算がシーケンス長の 2 乗で効くためだ。枚数を優先するなら 512×512 で生成 → Real-ESRGAN 等でアップスケールという分業が、速度と品質のバランス上有効と考えられる。
まとめ
RTX 3060 12GB での FLUX Schnell 512×512 生成は、fp8 量子化 + 4 ステップが動作の前提条件。公開報告から読み取れる速度の目安は 3〜8 秒/枚だが、オフロード設定・torch.compile・他プロセスとの共存で数倍の差が出る可能性がある。SD 1.5 + LCM-LoRA のような軽量高速構成と比べると枚数では劣るが、モデル品質と Apache 2.0 ライセンス(商用利用可)が選ぶ理由になる。
次に取る行動:ComfyUI に flux1-schnell-fp8.safetensors をセットし、512×512・4ステップ・CFG 1.0 で 1 枚生成して秒数を記録する。その数字が、バッチ計画を立てるための自環境の一次データになる。
よくある質問
FLUX SchnellはRTX 3060 12GBのVRAMに収まりますか?
fp8量子化済みチェックポイントを使えば8〜10GB程度に収まる報告が多いですが、VAEのオフロード設定や他プロセスとの共存次第で変わります。12GBはギリギリのラインのため、他のGPUプロセスを停止した状態での起動が基本です。
FLUX Schnellのステップ数を2や3に減らして速くできますか?
2〜3ステップでも動作するという報告はありますが、品質劣化が出やすいとされています。Black Forest Labs公式ドキュメントは4ステップを基準として示しており、速度優先でのステップ削減は品質とのトレードオフです。
FLUX SchnellとSD 1.5ではどちらが512×512の生成が速いですか?
公開報告の傾向から見ると、SD 1.5+LCM-LoRA(6ステップ)は1〜2秒/枚、FLUX Schnell fp8(4ステップ)は3〜8秒/枚とLCM構成が速い傾向があります。ただしFLUX SchnellはApache 2.0ライセンスで商用利用できる点が優位です。