ホーム AI・LLM 計算最適なモデルサイズ 作成日: 2026年7月20日 21:33 計算最適なモデルサイズ 入力 計算予算6,000パラメータあたりトークン数20 AI・LLM 計算最適なモデルサイズ petaFLOP/s・日で与えた学習計算予算から、固定したパラメータあたりトークン比のもとで6NDルールを逆算し、Chinchilla計算最適なパラメータ数とトークン数を求める。 入力 計算予算 計算予算 使用できる学習計算量(petaFLOP/s・日)。1単位は1 petaFLOP/sを1日維持した量、すなわち8.64 × 10¹⁹回の浮動小数点演算。 パラメータあたりトークン数 逆算の際に固定するパラメータあたりトークン数の比。Chinchilla計算最適な値は20付近。 結果 値を入力すると計算結果が表示されます。 最適パラメータ数 所与の予算と比に対して計算最適なモデルサイズ(十億パラメータ単位)。6NDルールを逆算して求めたもので、約...十億。 最適トークン数 最適なモデルサイズと対にする学習トークン数(十億単位)。パラメータあたり20トークンに...十億パラメータを掛けた値で、約...十億。 詳細 最適トークン数(兆) 同じ最適トークン数を読みやすいように兆単位で表したもので、約...。 共有 レポートを印刷 リセット 埋め込み この計算機を埋め込む プレビュー このコードをページに貼り付けると計算機を表示できます。 コードをコピー この計算を共有 このリンクを開くと、入力した値がそのまま表示されます。 リンクをコピー 共有する XFacebookLINE メール 最終更新: 2026-06-22 計算最適なモデルサイズ 学習計算量が固定で与えられたとき、その計算量でどれほど大きなモデルを作り、何トークンで学習すべきかに答えるのがChinchillaのスケーリング則です。計算最適な配分は、予算すべてをサイズに費やすのではなく、パラメータとデータを歩調を合わせて対にします。この計算では、petaFLOP/s・日で与えた計算予算を受け取り、パラメータあたりトークン比を固定したうえで6NDルールを逆算し、最適なパラメータ数とトークン数を返します。 計算予算の配分 学習計算量は6NDルールでよく近似されます。すなわちパラメータ1つ・トークン1つあたり約6回の浮動小数点演算です。Chinchillaの研究は、固定した予算では、モデルサイズとデータセットサイズがおよそパラメータあたり20トークンの比で一緒に増えるときに損失が最小になることを示しました。この比を固定すると、計算式はパラメータ数だけの関係に変わり、所与の予算が支えるモデルサイズについて解くことができます。 計算式 予算を petaFLOP/s・日で表した CC、パラメータあたりトークン比を rr とします。予算をFLOPsに換算し、6 N D6\,N\,D ルールに D=rND = rN を代入すると 6⋅N⋅rN=CFLOPs6 \cdot N \cdot rN = C_{\text{FLOPs}} となり、パラメータ数とトークン数は次のようになります。 N=1109C⋅8.64×10196rD=r⋅N\begin{aligned} N &= \frac{1}{10^{9}}\sqrt{\frac{C \cdot 8.64 \times 10^{19}}{6r}} \\ D &= r \cdot N \end{aligned}ND=10916rC⋅8.64×1019=r⋅N ここで NN は十億単位の最適パラメータ数、DD は十億単位の最適トークン数です。係数 8.64×10198.64 \times 10^{19} は petaFLOP/s・日をFLOPsに換算し、10910^{9} で割ることで NN を十億単位で表します。トークン数をパラメータ数に結びつけると計算量がパラメータ数の2乗で増えるため、平方根が現れます。 計算例 予算を6,000 petaFLOP/s・日、中心的な比をパラメータあたり20トークンとします。 N=11096000×8.64×10196×20≈65.7 十億D=20×65.7≈1314.5 十億=1.31 兆\begin{aligned} N &= \frac{1}{10^{9}}\sqrt{\frac{6000 \times 8.64 \times 10^{19}}{6 \times 20}} \approx 65.7\ \text{十億} \\ D &= 20 \times 65.7 \approx 1314.5\ \text{十億} = 1.31\ \text{兆} \end{aligned}ND=10916×206000×8.64×1019≈65.7 十億=20×65.7≈1314.5 十億=1.31 兆 この予算は、約657億パラメータのモデルを約1.31兆トークンで学習するのが最適な使い道です。平方根の依存性のため、予算を2倍にしても最適パラメータ数は2倍ではなく、おおむね2の平方根倍にしか増えません。 限界 これは固定した学習予算における計算最適な学習損失だけを反映します。モデルを提供するコストは考慮しておらず、運用上は小さいモデルをより多くのトークンで学習させるほうが良い選択になることが多いため、実際に運用されるモデルはこの計算が返すパラメータ数より小さいことがしばしばあります。固定した比そのものもデータセットとアーキテクチャによって変わる概算値であり、実際の学習はピーク性能の一部しか維持できません。同じトレードオフのデータ側はChinchilla最適トークン数が、選んだ構成の生の計算量は学習FLOPsの計算が扱います。 よくある質問 (FAQ)固定した計算予算は、モデルサイズとデータにどう配分すべきですか。Chinchillaのスケーリング則は、固定した学習予算では、予算の大半をパラメータに費やすより、パラメータと学習トークンを一緒に増やすときに損失が最小になることを示しています。パラメータあたりトークン比を20付近に固定し、その予算について6NDの計算式を解くと、使用できる計算量を最大限に活かすモデルサイズとデータセットサイズが得られます。予算が大きいほど、それに比例して大きなモデルとデータセットを支えられます。 なぜモデルサイズは計算量の平方根に比例するのですか。6NDルールのもとでの学習計算量は、6 × パラメータ数 × トークン数です。トークン数をパラメータあたり一定の比 r に固定すると、トークン数は r × N に等しくなり、計算量は 6 × r × N² となります。計算量はパラメータ数の2乗で増えるため、計算予算からパラメータ数を復元するには平方根をとる必要があります。すなわち N は、計算量を6rで割った値の平方根に等しくなります。トークン数はそのあと r × N として求まります。 petaFLOP/s・日とは何ですか。petaFLOP/s・日は、1 petaFLOP/s(毎秒10¹⁵回の浮動小数点演算)を丸1日維持して得られる計算量です。1日の86,400秒を掛けると8.64 × 10¹⁹回の演算になります。生の演算回数は桁が扱いにくくなるため、大規模な学習の計算予算を報告・比較する標準的な単位として用いられます。 免責事項 これは一次近似である6NDルールを、固定したパラメータあたりトークン比のもとで逆算したもので、計算最適な学習損失のみを反映します。推論コスト(しばしば小さいモデルを長く学習させるほうが有利になる要因)や、ピークを下回るハードウェア稼働率は考慮していません。結果は計画立案のための概算として扱ってください。 次のおすすめ Chinchilla最適トークン数 パラメータあたり約20トークンというChinchillaの法則を使い、モデルにとって計算最適な学習トークン数と、それに伴う学習計算量(FLOPs)を求める。 詳しく解説学習FLOPsの計算 パラメータ数と学習トークン数から、6NDルールでTransformerの学習に必要な浮動小数点演算量を概算する。総FLOPsとpetaFLOP/s・日の両方で表示。 詳しく解説 200+ ツール · 10 言語対応 · 完全無料 学習・スケーリングの他の計算 Chinchilla最適トークン数LLMトレーニングVRAMの計算LoRA の学習パラメータ数を計算データセットのトークン数の計算データ並列スケーリングの計算計算最適なモデルサイズ +6 more Show less パイプライン並列のバブルの計算学習FLOPsの計算学習率ウォームアップの計算計算予算から求めるエポック数勾配累積のメモリ計算実効バッチサイズの計算 AI・LLMの他のカテゴリ コスト・料金 1ドルあたりトークン数の計算GPU クラウド費用を計算GPU利用率コストの計算LLMファインチューニング費用の計算LLMレート制限の計画LLM学習のカーボンフットプリントの計算LLM学習時間とコストの計算LLM月額コストの計算エージェントコストの計算コンテキストコストの増加の計算コンテキスト長の判定システムプロンプトの償却コストトークンから単語数への変換トークンコスト計算バッチAPIの節約額の計算プロンプトキャッシュの節約額の計算ベクトルDBコストの計算ベクトルDBサイズの計算音声合成コストの計算音声文字起こしコストの計算画像生成コストの計算関数呼び出しのトークンオーバーヘッド構造化出力のトークンオーバーヘッド自己ホストとAPIの損益分岐の計算推論エネルギーコストの計算埋め込みコストの計算推論・サービング トークンあたりFLOPsの計算バッチ推論スループットの計算モデルFLOPs利用率の計算画像入力トークン数の計算実効トークン毎秒の計算推論スループットの計算推論レイテンシの計算投機的デコーディングの高速化の計算ハードウェア・メモリ KVキャッシュサイズの計算LLM推論のVRAM計算MoE のアクティブパラメータ数を計算Transformerのパラメータ数の計算アテンションメモリの計算モデルに必要なGPU台数の計算モデルのダウンロード時間の計算量子化によるモデルサイズの計算RAG・埋め込み RAGチャンク分割の設計評価 A/Bテスト有意性の計算LLM評価のサンプルサイズの計算pass@k の計算パープレキシティの計算すべてのツール コサイン類似度の計算 この計算機は役に立ちましたか? 役に立った 改善が必要 改善が必要 どのような点が改善されると良いですか? フィードバックを送信 Powered by OneCalc ↗
最終更新: 2026-06-22 計算最適なモデルサイズ 学習計算量が固定で与えられたとき、その計算量でどれほど大きなモデルを作り、何トークンで学習すべきかに答えるのがChinchillaのスケーリング則です。計算最適な配分は、予算すべてをサイズに費やすのではなく、パラメータとデータを歩調を合わせて対にします。この計算では、petaFLOP/s・日で与えた計算予算を受け取り、パラメータあたりトークン比を固定したうえで6NDルールを逆算し、最適なパラメータ数とトークン数を返します。 計算予算の配分 学習計算量は6NDルールでよく近似されます。すなわちパラメータ1つ・トークン1つあたり約6回の浮動小数点演算です。Chinchillaの研究は、固定した予算では、モデルサイズとデータセットサイズがおよそパラメータあたり20トークンの比で一緒に増えるときに損失が最小になることを示しました。この比を固定すると、計算式はパラメータ数だけの関係に変わり、所与の予算が支えるモデルサイズについて解くことができます。 計算式 予算を petaFLOP/s・日で表した CC、パラメータあたりトークン比を rr とします。予算をFLOPsに換算し、6 N D6\,N\,D ルールに D=rND = rN を代入すると 6⋅N⋅rN=CFLOPs6 \cdot N \cdot rN = C_{\text{FLOPs}} となり、パラメータ数とトークン数は次のようになります。 N=1109C⋅8.64×10196rD=r⋅N\begin{aligned} N &= \frac{1}{10^{9}}\sqrt{\frac{C \cdot 8.64 \times 10^{19}}{6r}} \\ D &= r \cdot N \end{aligned}ND=10916rC⋅8.64×1019=r⋅N ここで NN は十億単位の最適パラメータ数、DD は十億単位の最適トークン数です。係数 8.64×10198.64 \times 10^{19} は petaFLOP/s・日をFLOPsに換算し、10910^{9} で割ることで NN を十億単位で表します。トークン数をパラメータ数に結びつけると計算量がパラメータ数の2乗で増えるため、平方根が現れます。 計算例 予算を6,000 petaFLOP/s・日、中心的な比をパラメータあたり20トークンとします。 N=11096000×8.64×10196×20≈65.7 十億D=20×65.7≈1314.5 十億=1.31 兆\begin{aligned} N &= \frac{1}{10^{9}}\sqrt{\frac{6000 \times 8.64 \times 10^{19}}{6 \times 20}} \approx 65.7\ \text{十億} \\ D &= 20 \times 65.7 \approx 1314.5\ \text{十億} = 1.31\ \text{兆} \end{aligned}ND=10916×206000×8.64×1019≈65.7 十億=20×65.7≈1314.5 十億=1.31 兆 この予算は、約657億パラメータのモデルを約1.31兆トークンで学習するのが最適な使い道です。平方根の依存性のため、予算を2倍にしても最適パラメータ数は2倍ではなく、おおむね2の平方根倍にしか増えません。 限界 これは固定した学習予算における計算最適な学習損失だけを反映します。モデルを提供するコストは考慮しておらず、運用上は小さいモデルをより多くのトークンで学習させるほうが良い選択になることが多いため、実際に運用されるモデルはこの計算が返すパラメータ数より小さいことがしばしばあります。固定した比そのものもデータセットとアーキテクチャによって変わる概算値であり、実際の学習はピーク性能の一部しか維持できません。同じトレードオフのデータ側はChinchilla最適トークン数が、選んだ構成の生の計算量は学習FLOPsの計算が扱います。 よくある質問 (FAQ)固定した計算予算は、モデルサイズとデータにどう配分すべきですか。Chinchillaのスケーリング則は、固定した学習予算では、予算の大半をパラメータに費やすより、パラメータと学習トークンを一緒に増やすときに損失が最小になることを示しています。パラメータあたりトークン比を20付近に固定し、その予算について6NDの計算式を解くと、使用できる計算量を最大限に活かすモデルサイズとデータセットサイズが得られます。予算が大きいほど、それに比例して大きなモデルとデータセットを支えられます。 なぜモデルサイズは計算量の平方根に比例するのですか。6NDルールのもとでの学習計算量は、6 × パラメータ数 × トークン数です。トークン数をパラメータあたり一定の比 r に固定すると、トークン数は r × N に等しくなり、計算量は 6 × r × N² となります。計算量はパラメータ数の2乗で増えるため、計算予算からパラメータ数を復元するには平方根をとる必要があります。すなわち N は、計算量を6rで割った値の平方根に等しくなります。トークン数はそのあと r × N として求まります。 petaFLOP/s・日とは何ですか。petaFLOP/s・日は、1 petaFLOP/s(毎秒10¹⁵回の浮動小数点演算)を丸1日維持して得られる計算量です。1日の86,400秒を掛けると8.64 × 10¹⁹回の演算になります。生の演算回数は桁が扱いにくくなるため、大規模な学習の計算予算を報告・比較する標準的な単位として用いられます。 免責事項 これは一次近似である6NDルールを、固定したパラメータあたりトークン比のもとで逆算したもので、計算最適な学習損失のみを反映します。推論コスト(しばしば小さいモデルを長く学習させるほうが有利になる要因)や、ピークを下回るハードウェア稼働率は考慮していません。結果は計画立案のための概算として扱ってください。