Skip to content

LLM推論のVRAM計算

大規模言語モデルを推論で動かすのに必要なGPUのVRAMを、パラメータ数、重みの精度、KVキャッシュや活性化、断片化のための実行時オーバーヘッドから見積もります。

入力

モデル

実行環境

%
0 – 200 %

結果

値を入力すると計算結果が表示されます。

詳細

この計算機を埋め込む

プレビュー

このコードをページに貼り付けると計算機を表示できます。

この計算を共有

このリンクを開くと、入力した値がそのまま表示されます。

200+ ツール · 10 言語対応 · 完全無料

この計算機は役に立ちましたか?

改善が必要

どのような点が改善されると良いですか?