Skip to content

Calculadora de VRAM para Inferência de LLM

Estime a VRAM de GPU necessária para servir um modelo de linguagem grande em inferência a partir do número de parâmetros, da precisão dos pesos e da sobrecarga de execução do cache KV, das ativações e da fragmentação.

Entradas

Modelo

Execução

%
0 – 200 %

Resultados

Insira um valor para ver os resultados.

Detalhes

Incorporar esta calculadora

Pré-visualização

Cole este código na sua página para exibir a calculadora.

Compartilhar este cálculo

Quem abrir este link verá seus valores já preenchidos.

Compartilhar via

200+ calculadoras · 10 idiomas · 100% grátis

Esta calculadora foi útil para você?

Não

Como podemos melhorar esta calculadora?