ホーム AI・LLM Chinchilla最適トークン数 作成日: 2026年7月20日 21:33 Chinchilla最適トークン数 入力 パラメータ数70パラメータあたりトークン数20 AI・LLM Chinchilla最適トークン数 パラメータあたり約20トークンというChinchillaの法則を使い、モデルにとって計算最適な学習トークン数と、それに伴う学習計算量(FLOPs)を求める。 入力 モデル パラメータ数 モデルのパラメータ数(十億単位)。最適トークン数はこの値に正比例して増える。 パラメータあたりトークン数 パラメータ1つあたりの学習トークン数。Chinchillaの結果は計算最適な比を20付近に置くが、運用を見据えたモデルはそれを大きく超えて学習されることも多い。 結果 値を入力すると計算結果が表示されます。 最適トークン数 推奨される学習トークン数(十億単位)。70十億パラメータにパラメータあたり20トークンを掛けた値で、約...十億。 最適トークン数(兆) 同じ推奨トークン数を読みやすいように兆単位で表したもので、約...。 詳細 学習計算量 このトークン数で学習する場合の計算量を6NDルール(パラメータ1つ・トークン1つあたり6回の演算)で求めたもので、約...回の浮動小数点演算。 共有 レポートを印刷 リセット 埋め込み この計算機を埋め込む プレビュー このコードをページに貼り付けると計算機を表示できます。 コードをコピー この計算を共有 このリンクを開くと、入力した値がそのまま表示されます。 リンクをコピー 共有する XFacebookLINE メール 最終更新: 2026-06-22 Chinchilla最適トークン数 Chinchillaのスケーリングの結果は、言語モデルのサイズの決め方を大きく変えました。固定した計算予算のもとで最も高い精度が得られるのは、モデルをできるだけ大きくすることではなく、パラメータと学習トークンを一緒に増やすこと、すなわちパラメータ1つにおよそ20トークンの学習データを対にすることだと示したのです。この計算では、その比を適用し、パラメータ数から計算最適なトークン数と、それが意味する学習計算量を求めます。 計算最適な比 Chinchilla以前の主流の慣行は、計算予算の大半をパラメータに費やし、データには比較的わずかしか割かず、サイズに対して学習不足のモデルを生んでいました。2022年のDeepMindの研究は数百回の学習にわたってスケーリング則を当てはめ、所与の予算では、モデルサイズとデータセットサイズが歩調を合わせて増えるときに損失が最小になることを見いだしました。経験的な均衡点は、最適なデータセットをパラメータあたり約20トークンに置きます。したがって NN パラメータのモデルは、約 20 N20\,N トークンで学習すべきということになります。 計算式 十億単位のパラメータ数 NN と、パラメータあたりトークン数の比 rr を用いると、最適トークン数とそれに伴う学習計算量は次のようになります。 D=N⋅rC=6⋅N⋅D⋅1018\begin{aligned} D &= N \cdot r \\ C &= 6 \cdot N \cdot D \cdot 10^{18} \end{aligned}DC=N⋅r=6⋅N⋅D⋅1018 ここで DD は十億単位の最適学習トークン数、CC は浮動小数点演算による学習計算量です。計算量は 6 N D6\,N\,D ルールに従い、パラメータ一つ・トークン一つあたり約六回の演算を課します。係数 101810^{18} は、NN と DD の十億という単位を絶対数に戻すためのものです。 計算例 700億パラメータのモデルと、中心的な比であるパラメータあたり20トークンを考えます。 D=70×20=1400 十億トークン=1.4 兆C=6×70×1400×1018=5.88×1023 FLOPs\begin{aligned} D &= 70 \times 20 = 1400\ \text{十億トークン} = 1.4\ \text{兆} \\ C &= 6 \times 70 \times 1400 \times 10^{18} = 5.88 \times 10^{23}\ \text{FLOPs} \end{aligned}DC=70×20=1400 十億トークン=1.4 兆=6×70×1400×1018=5.88×1023 FLOPs 計算最適なデータセットは約1.4兆トークンで、その学習には約 5.88×10235.88 \times 10^{23} 回の演算がかかります。比を、たとえばパラメータあたり100トークンに引き上げると、トークン数も計算量も正比例して増えます。 限界 20対1の比は固定した学習予算で学習損失を最小化しますが、完成したモデルを提供するコストはあえて無視しています。多くのリクエストに答えるモデルは、Chinchilla最適よりはるかに多いトークンで学習されることが多くあります。小さいモデルを長く学習させたほうが、同じ品質をより安く提供できるためです。最適な比はデータセット・トークナイザ・アーキテクチャによっても変わるため、20は定数ではなく中心的な概算値です。固定した計算予算にモデルを合わせる相補的な問題は計算最適なモデルサイズが、選んだ構成の生の計算量は学習FLOPsの計算が扱います。 よくある質問 (FAQ)Chinchillaのスケーリングの結果とは何ですか。Chinchillaの結果は2022年にDeepMindが発表したもので、それ以前の大規模モデルが学習不足だったことを示しました。固定した計算予算のもとでは、予算の大半をパラメータに費やすより、モデルサイズと学習トークンを一緒に増やすほうが精度が最も向上します。 この研究は数百回の学習にわたってスケーリング則を当てはめ、計算最適な配分はパラメータ1つあたり約20トークンを対にすると結論づけました。これは、はるかに低い比で学習されていた従来のモデルからの大きな転換でした。 なぜパラメータあたり約20トークンなのですか。この比は、学習データに当てはめたスケーリング則から導かれます。固定した計算予算のもとでは、パラメータを増やす限界的な効果とトークンを増やす限界的な効果が釣り合うときに損失が最小になります。Chinchillaの研究で得られた経験的な指数は、その均衡点をパラメータあたり約20トークンに置きます。正確な値はデータセットとアーキテクチャに依存するため、20は精密な定数ではなく中心的な概算値です。 パラメータあたり20トークンは今も適切な目標ですか。20は固定した学習予算で学習損失を最小化する計算最適な比ですが、推論コストを無視しています。多くのリクエストを処理するモデルは、Chinchilla最適よりはるかに多いトークンで学習されることが少なくありません。小さいモデルを長く学習させたほうが、学習が計算最適でなくとも運用は安く済むためです。 この理由から、広く使われるいくつかのモデルは100以上の比で学習されており、20は上限ではなく基準値と捉えるべきです。 免責事項 パラメータあたり20トークンという比はChinchillaのスケーリング則から得た中心的な概算値で、データセットとアーキテクチャによって変わります。これは学習計算量のみを最適化したもので、推論コストは考慮しておらず、推論コストを踏まえると小さいモデルをより多くのトークンで学習させるほうが妥当な場合も多くあります。結果は出発点として用い、固定的な規則とは見なさないでください。 次のおすすめ 計算最適なモデルサイズ petaFLOP/s・日で与えた学習計算予算から、固定したパラメータあたりトークン比のもとで6NDルールを逆算し、Chinchilla計算最適なパラメータ数とトークン数を求める。 詳しく解説学習FLOPsの計算 パラメータ数と学習トークン数から、6NDルールでTransformerの学習に必要な浮動小数点演算量を概算する。総FLOPsとpetaFLOP/s・日の両方で表示。 詳しく解説 200+ ツール · 10 言語対応 · 完全無料 学習・スケーリングの他の計算 Chinchilla最適トークン数LLMトレーニングVRAMの計算LoRA の学習パラメータ数を計算データセットのトークン数の計算データ並列スケーリングの計算パイプライン並列のバブルの計算 +6 more Show less 学習FLOPsの計算学習率ウォームアップの計算計算最適なモデルサイズ計算予算から求めるエポック数勾配累積のメモリ計算実効バッチサイズの計算 AI・LLMの他のカテゴリ コスト・料金 1ドルあたりトークン数の計算GPU クラウド費用を計算GPU利用率コストの計算LLMファインチューニング費用の計算LLMレート制限の計画LLM学習のカーボンフットプリントの計算LLM学習時間とコストの計算LLM月額コストの計算エージェントコストの計算コンテキストコストの増加の計算コンテキスト長の判定システムプロンプトの償却コストトークンから単語数への変換トークンコスト計算バッチAPIの節約額の計算プロンプトキャッシュの節約額の計算ベクトルDBコストの計算ベクトルDBサイズの計算音声合成コストの計算音声文字起こしコストの計算画像生成コストの計算関数呼び出しのトークンオーバーヘッド構造化出力のトークンオーバーヘッド自己ホストとAPIの損益分岐の計算推論エネルギーコストの計算埋め込みコストの計算推論・サービング トークンあたりFLOPsの計算バッチ推論スループットの計算モデルFLOPs利用率の計算画像入力トークン数の計算実効トークン毎秒の計算推論スループットの計算推論レイテンシの計算投機的デコーディングの高速化の計算ハードウェア・メモリ KVキャッシュサイズの計算LLM推論のVRAM計算MoE のアクティブパラメータ数を計算Transformerのパラメータ数の計算アテンションメモリの計算モデルに必要なGPU台数の計算モデルのダウンロード時間の計算量子化によるモデルサイズの計算RAG・埋め込み RAGチャンク分割の設計評価 A/Bテスト有意性の計算LLM評価のサンプルサイズの計算pass@k の計算パープレキシティの計算すべてのツール コサイン類似度の計算 この計算機は役に立ちましたか? 役に立った 改善が必要 改善が必要 どのような点が改善されると良いですか? フィードバックを送信 Powered by OneCalc ↗
最終更新: 2026-06-22 Chinchilla最適トークン数 Chinchillaのスケーリングの結果は、言語モデルのサイズの決め方を大きく変えました。固定した計算予算のもとで最も高い精度が得られるのは、モデルをできるだけ大きくすることではなく、パラメータと学習トークンを一緒に増やすこと、すなわちパラメータ1つにおよそ20トークンの学習データを対にすることだと示したのです。この計算では、その比を適用し、パラメータ数から計算最適なトークン数と、それが意味する学習計算量を求めます。 計算最適な比 Chinchilla以前の主流の慣行は、計算予算の大半をパラメータに費やし、データには比較的わずかしか割かず、サイズに対して学習不足のモデルを生んでいました。2022年のDeepMindの研究は数百回の学習にわたってスケーリング則を当てはめ、所与の予算では、モデルサイズとデータセットサイズが歩調を合わせて増えるときに損失が最小になることを見いだしました。経験的な均衡点は、最適なデータセットをパラメータあたり約20トークンに置きます。したがって NN パラメータのモデルは、約 20 N20\,N トークンで学習すべきということになります。 計算式 十億単位のパラメータ数 NN と、パラメータあたりトークン数の比 rr を用いると、最適トークン数とそれに伴う学習計算量は次のようになります。 D=N⋅rC=6⋅N⋅D⋅1018\begin{aligned} D &= N \cdot r \\ C &= 6 \cdot N \cdot D \cdot 10^{18} \end{aligned}DC=N⋅r=6⋅N⋅D⋅1018 ここで DD は十億単位の最適学習トークン数、CC は浮動小数点演算による学習計算量です。計算量は 6 N D6\,N\,D ルールに従い、パラメータ一つ・トークン一つあたり約六回の演算を課します。係数 101810^{18} は、NN と DD の十億という単位を絶対数に戻すためのものです。 計算例 700億パラメータのモデルと、中心的な比であるパラメータあたり20トークンを考えます。 D=70×20=1400 十億トークン=1.4 兆C=6×70×1400×1018=5.88×1023 FLOPs\begin{aligned} D &= 70 \times 20 = 1400\ \text{十億トークン} = 1.4\ \text{兆} \\ C &= 6 \times 70 \times 1400 \times 10^{18} = 5.88 \times 10^{23}\ \text{FLOPs} \end{aligned}DC=70×20=1400 十億トークン=1.4 兆=6×70×1400×1018=5.88×1023 FLOPs 計算最適なデータセットは約1.4兆トークンで、その学習には約 5.88×10235.88 \times 10^{23} 回の演算がかかります。比を、たとえばパラメータあたり100トークンに引き上げると、トークン数も計算量も正比例して増えます。 限界 20対1の比は固定した学習予算で学習損失を最小化しますが、完成したモデルを提供するコストはあえて無視しています。多くのリクエストに答えるモデルは、Chinchilla最適よりはるかに多いトークンで学習されることが多くあります。小さいモデルを長く学習させたほうが、同じ品質をより安く提供できるためです。最適な比はデータセット・トークナイザ・アーキテクチャによっても変わるため、20は定数ではなく中心的な概算値です。固定した計算予算にモデルを合わせる相補的な問題は計算最適なモデルサイズが、選んだ構成の生の計算量は学習FLOPsの計算が扱います。 よくある質問 (FAQ)Chinchillaのスケーリングの結果とは何ですか。Chinchillaの結果は2022年にDeepMindが発表したもので、それ以前の大規模モデルが学習不足だったことを示しました。固定した計算予算のもとでは、予算の大半をパラメータに費やすより、モデルサイズと学習トークンを一緒に増やすほうが精度が最も向上します。 この研究は数百回の学習にわたってスケーリング則を当てはめ、計算最適な配分はパラメータ1つあたり約20トークンを対にすると結論づけました。これは、はるかに低い比で学習されていた従来のモデルからの大きな転換でした。 なぜパラメータあたり約20トークンなのですか。この比は、学習データに当てはめたスケーリング則から導かれます。固定した計算予算のもとでは、パラメータを増やす限界的な効果とトークンを増やす限界的な効果が釣り合うときに損失が最小になります。Chinchillaの研究で得られた経験的な指数は、その均衡点をパラメータあたり約20トークンに置きます。正確な値はデータセットとアーキテクチャに依存するため、20は精密な定数ではなく中心的な概算値です。 パラメータあたり20トークンは今も適切な目標ですか。20は固定した学習予算で学習損失を最小化する計算最適な比ですが、推論コストを無視しています。多くのリクエストを処理するモデルは、Chinchilla最適よりはるかに多いトークンで学習されることが少なくありません。小さいモデルを長く学習させたほうが、学習が計算最適でなくとも運用は安く済むためです。 この理由から、広く使われるいくつかのモデルは100以上の比で学習されており、20は上限ではなく基準値と捉えるべきです。 免責事項 パラメータあたり20トークンという比はChinchillaのスケーリング則から得た中心的な概算値で、データセットとアーキテクチャによって変わります。これは学習計算量のみを最適化したもので、推論コストは考慮しておらず、推論コストを踏まえると小さいモデルをより多くのトークンで学習させるほうが妥当な場合も多くあります。結果は出発点として用い、固定的な規則とは見なさないでください。