Calculadora de VRAM para Inferência de LLM
Entradas
| Parâmetros | 7 |
|---|---|
| Precisão dos pesos | FP16 / BF16 (16 bits) |
| Sobrecarga de execução | 20 % |
Calculadora de VRAM para Inferência de LLM
Estime a VRAM de GPU necessária para servir um modelo de linguagem grande em inferência a partir do número de parâmetros, da precisão dos pesos e da sobrecarga de execução do cache KV, das ativações e da fragmentação.
Entradas
Modelo
Execução
Resultados
Insira um valor para ver os resultados.
Detalhes
VRAM para inferência de LLM
Servir um modelo de linguagem grande começa com uma pergunta direta: ele caberá na GPU? A resposta é dominada pelos pesos do modelo, mas os pesos sozinhos subestimam a necessidade, porque um servidor de inferência também precisa manter o cache KV, as ativações que percorrem cada camada e alguma memória perdida para a fragmentação. Esta calculadora estima a VRAM total a partir de três entradas — o número de parâmetros, a precisão em que os pesos são armazenados e uma sobrecarga de execução que reúne o restante em um único valor ajustável.
Os pesos definem o piso
Os pesos de um modelo são seu maior custo fixo de memória. Cada parâmetro é armazenado em uma precisão escolhida: pesos completos de 16 bits ocupam dois bytes cada, a quantização de 8 bits ocupa um byte e a de 4 bits ocupa meio byte. Assim, um número de parâmetros em bilhões, armazenado a bits, ocupa
W=8N⋅b GBUm bilhão de parâmetros de 16 bits dá exatamente 2 GB, e é por isso que um modelo 7B precisa de 14 GB só para os pesos. Dividir a contagem de bits por oito converte bits em bytes, e como os parâmetros são contados em bilhões e a memória em gigabytes, as unidades se alinham diretamente.
Adicionando a sobrecarga de execução
Os pesos são apenas o piso. Durante a inferência, o servidor mantém um cache KV com as chaves e os valores de atenção de cada token em processamento, aloca ativações conforme cada requisição passa pelas camadas e perde um pouco de memória para a fragmentação. O total é
V=W⋅(1+o)onde é a sobrecarga expressa como fração do tamanho dos pesos. O cache KV é o componente maior e mais variável — ele cresce com o comprimento do contexto e o número de requisições simultâneas — então a sobrecarga adequada depende muito da carga de trabalho. Vinte por cento é um ponto de partida razoável para prompts curtos em lotes modestos; serviço de contexto longo e alta vazão pode elevar isso bem mais.
Exemplo resolvido
Considere um modelo de 7 bilhões de parâmetros servido em precisão de 16 bits com 20 por cento de sobrecarga:
WV=87×16=14 GB=14×(1+0,20)=16,8 GBO total de 16,8 GB cabe confortavelmente em uma placa de 24 GB, mas não deixa espaço em uma de 16 GB. Para rodar o mesmo modelo em uma GPU menor, baixar para 8 bits reduziria os pesos à metade, para 7 GB, e levaria o total para perto de 8,4 GB. A relação entre o tamanho do modelo e a precisão é explorada em mais detalhe em Calculadora de Tamanho do Modelo por Quantização.
Fazendo um modelo caber
Como a memória escala diretamente com os bits por peso, a quantização é a alavanca mais direta: de 16 para 8 bits reduz à metade a memória dos pesos, e de 8 para 4 bits a reduz novamente à metade, geralmente com uma perda modesta e aceitável na qualidade da saída. Quando mesmo um modelo quantizado excede um único acelerador, as alternativas são dividir os pesos entre várias GPUs ou descarregar parte do modelo na memória do sistema, a um custo acentuado de velocidade. Estimar quantos aceleradores um modelo precisa é tratado em Calculadora de Número de GPUs por Modelo. Trate o número aqui como uma estimativa de planejamento e confirme-o contra uma execução real de serviço, já que o framework, o comprimento do contexto e o tamanho do lote alteram o número verdadeiro.
Perguntas frequentes (FAQ)
O que a sobrecarga de execução cobre?
Além dos pesos, um servidor de inferência precisa manter o cache KV, que armazena as chaves e os valores de atenção de cada token em processamento, as ativações produzidas conforme cada requisição percorre as camadas e uma folga perdida para a fragmentação de memória. O cache KV é a parte maior e mais variável: ele cresce com o comprimento do contexto e o número de requisições simultâneas, então um servidor que lida com prompts longos ou lotes grandes pode precisar de muito mais do que o padrão de vinte por cento sugere.
A porcentagem única de sobrecarga reúne tudo isso em um valor ajustável.
Como sei se um modelo cabe em uma determinada GPU?
Compare a estimativa de VRAM total com a memória do acelerador de destino, deixando uma margem para o sistema operacional e o driver. Um modelo de 7 bilhões de parâmetros em 16 bits precisa de aproximadamente 17 GB incluindo a sobrecarga, o que cabe confortavelmente em uma placa de 24 GB, mas não em uma de 16 GB.
Se a estimativa exceder uma única GPU, o modelo precisa ser quantizado, dividido entre várias GPUs ou parcialmente descarregado na memória do sistema, com grande custo de velocidade.
Quanta memória a quantização economiza?
A memória escala diretamente com os bits por peso, então passar de 16 bits para 8 bits reduz à metade a memória dos pesos e passar para 4 bits a reduz a um quarto. Um modelo de 13 bilhões de parâmetros precisa de cerca de 26 GB de pesos em 16 bits, mas de apenas 13 GB em 8 bits e aproximadamente 6,5 GB em 4 bits, antes da sobrecarga.
A precisão mais baixa permite que modelos maiores caibam em placas menores, com uma perda modesta e geralmente aceitável de qualidade da saída em 8 e 4 bits.
Aviso legal
Esta é uma estimativa de primeira ordem. A VRAM real depende do framework de serviço, do comprimento do contexto, do tamanho do lote e da precisão do cache KV, tudo reunido em uma única porcentagem de sobrecarga aqui. Dimensione o hardware com folga e confirme com uma carga de trabalho real antes de decidir.