ホーム AI・LLM モデルFLOPs利用率の計算 作成日: 2026年7月20日 21:33 モデルFLOPs利用率の計算 入力 ワークロード推論(トークンあたり2N)パラメータ数70トークンスループット2,000ピーク性能989 AI・LLM モデルFLOPs利用率の計算 モデルFLOPs利用率(MFU)を計算する。パラメータ数、トークンスループット、ピークTFLOP/sから、アクセラレータの浮動小数点演算のピーク性能のうち実際にモデルが達成した割合を求める。 入力 ワークロード ワークロード 推論 トークンあたり2N 順伝播のみを数えるか、学習の1ステップ全体を数えるか。トークンあたりのコストはパラメータあたりおよそ2演算(推論)または6演算(学習、順伝播と逆伝播)です。 パラメータ数 モデルのパラメータ数(十億単位)。ワークロード係数と組み合わせ、処理するトークンあたりに実行される浮動小数点演算数を見積もるのに用います。 トークンスループット ハードウェア上で端から端まで測定した、1秒あたりに処理されるトークン数。学習の場合は、下のピーク値に数えたすべてのアクセラレータにわたる全体の毎秒トークン数です。 ハードウェア ピーク性能 モデルが動作する精度における公称ピーク浮動小数点演算性能(TFLOP/s)を、関与するすべてのアクセラレータにわたって合計した値。例えばH100 1台あたり、密な16ビット演算でおよそ989 TFLOP/sです。 結果 値を入力すると計算結果が表示されます。 モデルFLOPs利用率 % ピークに対する達成浮動小数点演算速度の割合。989 TFLOP/sのうち... TFLOP/sは...にあたります。高いほどハードウェアの演算がより十分に活かされています。 詳細 達成性能 この実行が持続する推定浮動小数点演算速度。ワークロード係数に70十億パラメータと毎秒2,000トークンを掛けた値で、およそ... TFLOP/sです。 共有 レポートを印刷 リセット 埋め込み この計算機を埋め込む プレビュー このコードをページに貼り付けると計算機を表示できます。 コードをコピー この計算を共有 このリンクを開くと、入力した値がそのまま表示されます。 リンクをコピー 共有する XFacebookLINE メール 最終更新: 2026-06-22 モデルFLOPs利用率 モデルFLOPs利用率(MFU)は、モデルの実行がアクセラレータの理論上の演算性能をどれだけ使えているかを測る指標である。同じハードウェアを持つ2つのクラスタでも、実際の出力は数倍も異なりうる。MFUはその差を捉える単一の数値であり、ワークロードが実際に行う浮動小数点演算をハードウェアが公称するピークで割ったものである。この計算は、パラメータ数、トークンスループット、アクセラレータのピークTFLOP/sからそれを見積もる。 MFUが示すもの ハードウェアの提供元はピーク性能を公称する。現行のデータセンター向けアクセラレータでは16ビットでおよそ毎秒数千TFLOPの規模だが、これはデータがすでにレジスタにある完璧な融合積和演算の流れを前提とする。実際のワークロードがそれを持続させることはない。MFUは達成された割合を示すため、MFUが40%であれば、その実行は理論ピークの40%にあたる演算を引き出していることになる。これは学習や推論の構成がよく最適化されているかを判断し、ある変更が実際に効果を生んだかを判断するための標準的な物差しである。 計算式 順伝播はトークンあたり・パラメータあたりおよそ2演算、学習の1ステップは逆伝播を加えて合計でおよそ6演算かかる。ワークロード係数 kk(推論で二、学習で六)、パラメータ数 NN(十億単位)、スループット vv(毎秒トークン数)とすると、達成性能と利用率は次のとおりである。 A=k⋅N⋅v1000U=AP\begin{aligned} A &= \frac{k \cdot N \cdot v}{1000} \\ U &= \frac{A}{P} \end{aligned}AU=1000k⋅N⋅v=PA ここで AA は達成性能(TFLOP/s)、PP は実行に関与するすべてのアクセラレータにわたって合計したピーク性能(TFLOP/s)、UU は利用率である。1000で割ることで、十億パラメータと毎秒トークン数の積をTFLOP/sに換算する。 計算例 700億パラメータのモデルが、密な16ビット演算で989 TFLOP/sと定格された単一のアクセラレータ上で、毎秒2,000トークンの推論をサービングする場合を考える。 A=2×70×20001000=280 TFLOP/sU=280989≈0.283=28.3%\begin{aligned} A &= \frac{2 \times 70 \times 2000}{1000} = 280\ \text{TFLOP/s} \\ U &= \frac{280}{989} \approx 0.283 = 28.3\% \end{aligned}AU=10002×70×2000=280 TFLOP/s=989280≈0.283=28.3% この実行はチップのピークの4分の1強を使っている。これは時間の多くを乗算ではなく重みの読み込みに費やすメモリ律速の復号では典型的な値である。より計算律速である、よく調整された大規模モデルの学習ジョブは、35%から55%の間に収まることがより多い。 なぜ100%に届かないか 実際の実行はメモリ転送、アクセラレータ間の通信、パイプラインの空き、そしてアテンションや正規化のような純粋な行列積ではない層に時間を失う。完璧な利用率はそうしたオーバーヘッドが一切存在しないことを意味する。MFUの実用的な使い方は比較である。同じワークロードとハードウェアで最適化の前後に測定し、数値が高ければ支払っている演算がより多く有用な仕事をしている。この見積もりを駆動するトークンあたりの演算数はトークンあたりFLOPsの計算で、同じハードウェアのメモリ帯域幅側は推論スループットの計算で扱う。 よくある質問 (FAQ)どの程度のMFUが良いとされますか大規模モデルの学習では、よく調整されたシステムは通常、モデルFLOPs利用率をおよそ35%から55%の範囲で報告します。この指標を広めたPaLMの研究はおよそ46%を報告しました。推論時の利用率は、メモリ律速の復号中はアクセラレータが計算よりも重みの読み込みに多くの時間を費やすため、通常より低くなります。普遍的な目標値はありません。有用な比較は、同じハードウェア上の同じワークロードで最適化の前後を比べることであり、数値が高いほど支払った演算がより多く有用な仕事をしていることを意味します。 学習がパラメータあたり6演算で推論が2演算なのはなぜですか順伝播は支配的な行列積において、トークンあたり・パラメータあたりおよそ2演算(1回の乗算と1回の加算)を行います。学習はこれに、活性値と重みの両方に関する勾配を計算する逆伝播を加えます。逆伝播は順伝播のおよそ2倍のコストなので、合計でトークンあたり・パラメータあたりおよそ6演算になります。これらは標準的な一次近似の見積もりで、大規模モデルでは小さいアテンションなどの項を無視しています。 利用率が100%に届かないのはなぜですかピーク性能は、データがすでにレジスタにある状態で連続した融合積和演算を行うという理論値です。実際の実行はメモリ転送、アクセラレータ間の通信、パイプラインの空き、純粋な行列積ではないアテンションや正規化の層、計算ユニットを完全に満たせないカーネルに時間を失います。利用率が1に近いということはそうしたオーバーヘッドが一切存在しないことを意味し、実際には起こりません。 免責事項 MFUは一次近似のFLOP見積もり(推論で2N、学習で6N)を用いており、アテンションなどの小さい項を省いています。またピーク値が実行の精度とアクセラレータ数に一致すると仮定しています。すべての演算を厳密に数えたものではなく、比較のための効率指標として扱ってください。 次のおすすめ トークンあたりFLOPsの計算 順伝播の2N、学習の6Nという経験則を用い、モデルのパラメータ数(十億単位)からトランスフォーマーがトークンあたりに行う浮動小数点演算数を見積もる。 詳しく解説推論スループットの計算 モデルサイズ、重みの精度、アクセラレータのメモリ帯域幅から、大規模言語モデルの復号速度に対するメモリ帯域幅の上限(単一ストリームの毎秒トークン数の上限)を見積もる。 詳しく解説 200+ ツール · 10 言語対応 · 完全無料 推論・サービングの他の計算 トークンあたりFLOPsの計算バッチ推論スループットの計算モデルFLOPs利用率の計算画像入力トークン数の計算実効トークン毎秒の計算推論スループットの計算 +2 more Show less 推論レイテンシの計算投機的デコーディングの高速化の計算 AI・LLMの他のカテゴリ コスト・料金 1ドルあたりトークン数の計算GPU クラウド費用を計算GPU利用率コストの計算LLMファインチューニング費用の計算LLMレート制限の計画LLM学習のカーボンフットプリントの計算LLM学習時間とコストの計算LLM月額コストの計算エージェントコストの計算コンテキストコストの増加の計算コンテキスト長の判定システムプロンプトの償却コストトークンから単語数への変換トークンコスト計算バッチAPIの節約額の計算プロンプトキャッシュの節約額の計算ベクトルDBコストの計算ベクトルDBサイズの計算音声合成コストの計算音声文字起こしコストの計算画像生成コストの計算関数呼び出しのトークンオーバーヘッド構造化出力のトークンオーバーヘッド自己ホストとAPIの損益分岐の計算推論エネルギーコストの計算埋め込みコストの計算学習・スケーリング Chinchilla最適トークン数LLMトレーニングVRAMの計算LoRA の学習パラメータ数を計算データセットのトークン数の計算データ並列スケーリングの計算パイプライン並列のバブルの計算学習FLOPsの計算学習率ウォームアップの計算計算最適なモデルサイズ計算予算から求めるエポック数勾配累積のメモリ計算実効バッチサイズの計算ハードウェア・メモリ KVキャッシュサイズの計算LLM推論のVRAM計算MoE のアクティブパラメータ数を計算Transformerのパラメータ数の計算アテンションメモリの計算モデルに必要なGPU台数の計算モデルのダウンロード時間の計算量子化によるモデルサイズの計算RAG・埋め込み RAGチャンク分割の設計評価 A/Bテスト有意性の計算LLM評価のサンプルサイズの計算pass@k の計算パープレキシティの計算すべてのツール コサイン類似度の計算 この計算機は役に立ちましたか? 役に立った 改善が必要 改善が必要 どのような点が改善されると良いですか? フィードバックを送信 Powered by OneCalc ↗
最終更新: 2026-06-22 モデルFLOPs利用率 モデルFLOPs利用率(MFU)は、モデルの実行がアクセラレータの理論上の演算性能をどれだけ使えているかを測る指標である。同じハードウェアを持つ2つのクラスタでも、実際の出力は数倍も異なりうる。MFUはその差を捉える単一の数値であり、ワークロードが実際に行う浮動小数点演算をハードウェアが公称するピークで割ったものである。この計算は、パラメータ数、トークンスループット、アクセラレータのピークTFLOP/sからそれを見積もる。 MFUが示すもの ハードウェアの提供元はピーク性能を公称する。現行のデータセンター向けアクセラレータでは16ビットでおよそ毎秒数千TFLOPの規模だが、これはデータがすでにレジスタにある完璧な融合積和演算の流れを前提とする。実際のワークロードがそれを持続させることはない。MFUは達成された割合を示すため、MFUが40%であれば、その実行は理論ピークの40%にあたる演算を引き出していることになる。これは学習や推論の構成がよく最適化されているかを判断し、ある変更が実際に効果を生んだかを判断するための標準的な物差しである。 計算式 順伝播はトークンあたり・パラメータあたりおよそ2演算、学習の1ステップは逆伝播を加えて合計でおよそ6演算かかる。ワークロード係数 kk(推論で二、学習で六)、パラメータ数 NN(十億単位)、スループット vv(毎秒トークン数)とすると、達成性能と利用率は次のとおりである。 A=k⋅N⋅v1000U=AP\begin{aligned} A &= \frac{k \cdot N \cdot v}{1000} \\ U &= \frac{A}{P} \end{aligned}AU=1000k⋅N⋅v=PA ここで AA は達成性能(TFLOP/s)、PP は実行に関与するすべてのアクセラレータにわたって合計したピーク性能(TFLOP/s)、UU は利用率である。1000で割ることで、十億パラメータと毎秒トークン数の積をTFLOP/sに換算する。 計算例 700億パラメータのモデルが、密な16ビット演算で989 TFLOP/sと定格された単一のアクセラレータ上で、毎秒2,000トークンの推論をサービングする場合を考える。 A=2×70×20001000=280 TFLOP/sU=280989≈0.283=28.3%\begin{aligned} A &= \frac{2 \times 70 \times 2000}{1000} = 280\ \text{TFLOP/s} \\ U &= \frac{280}{989} \approx 0.283 = 28.3\% \end{aligned}AU=10002×70×2000=280 TFLOP/s=989280≈0.283=28.3% この実行はチップのピークの4分の1強を使っている。これは時間の多くを乗算ではなく重みの読み込みに費やすメモリ律速の復号では典型的な値である。より計算律速である、よく調整された大規模モデルの学習ジョブは、35%から55%の間に収まることがより多い。 なぜ100%に届かないか 実際の実行はメモリ転送、アクセラレータ間の通信、パイプラインの空き、そしてアテンションや正規化のような純粋な行列積ではない層に時間を失う。完璧な利用率はそうしたオーバーヘッドが一切存在しないことを意味する。MFUの実用的な使い方は比較である。同じワークロードとハードウェアで最適化の前後に測定し、数値が高ければ支払っている演算がより多く有用な仕事をしている。この見積もりを駆動するトークンあたりの演算数はトークンあたりFLOPsの計算で、同じハードウェアのメモリ帯域幅側は推論スループットの計算で扱う。 よくある質問 (FAQ)どの程度のMFUが良いとされますか大規模モデルの学習では、よく調整されたシステムは通常、モデルFLOPs利用率をおよそ35%から55%の範囲で報告します。この指標を広めたPaLMの研究はおよそ46%を報告しました。推論時の利用率は、メモリ律速の復号中はアクセラレータが計算よりも重みの読み込みに多くの時間を費やすため、通常より低くなります。普遍的な目標値はありません。有用な比較は、同じハードウェア上の同じワークロードで最適化の前後を比べることであり、数値が高いほど支払った演算がより多く有用な仕事をしていることを意味します。 学習がパラメータあたり6演算で推論が2演算なのはなぜですか順伝播は支配的な行列積において、トークンあたり・パラメータあたりおよそ2演算(1回の乗算と1回の加算)を行います。学習はこれに、活性値と重みの両方に関する勾配を計算する逆伝播を加えます。逆伝播は順伝播のおよそ2倍のコストなので、合計でトークンあたり・パラメータあたりおよそ6演算になります。これらは標準的な一次近似の見積もりで、大規模モデルでは小さいアテンションなどの項を無視しています。 利用率が100%に届かないのはなぜですかピーク性能は、データがすでにレジスタにある状態で連続した融合積和演算を行うという理論値です。実際の実行はメモリ転送、アクセラレータ間の通信、パイプラインの空き、純粋な行列積ではないアテンションや正規化の層、計算ユニットを完全に満たせないカーネルに時間を失います。利用率が1に近いということはそうしたオーバーヘッドが一切存在しないことを意味し、実際には起こりません。 免責事項 MFUは一次近似のFLOP見積もり(推論で2N、学習で6N)を用いており、アテンションなどの小さい項を省いています。またピーク値が実行の精度とアクセラレータ数に一致すると仮定しています。すべての演算を厳密に数えたものではなく、比較のための効率指標として扱ってください。