Calculadora de Número de GPUs por Modelo
Entradas
| VRAM do modelo | 140 |
|---|---|
| Memória por GPU | 80 |
| Fração utilizável | 90 % |
Calculadora de Número de GPUs por Modelo
Estime quantos aceleradores são necessários para manter um modelo na memória, a partir do total de VRAM exigido, da memória por GPU e de uma fração utilizável que considera a sobrecarga do framework e a fragmentação.
Entradas
Modelo
Hardware
Resultados
Insira um valor para ver os resultados.
Detalhes
Número de GPUs por modelo
Um modelo de linguagem grande precisa caber na memória do acelerador antes de poder atender a um único token. Quando o modelo é maior do que uma GPU, ele é dividido entre várias, e a primeira pergunta de planejamento é simplesmente quantos dispositivos são necessários. Esta calculadora responde a isso a partir de três números: o total de VRAM que o modelo precisa, a memória de cada GPU e a fração dessa memória que uma implantação real consegue de fato usar.
Por que um modelo abrange várias GPUs
Um acelerador moderno carrega uma quantidade fixa de memória de alta largura de banda — 80 GB em uma H100, 141 GB em uma H200. Um modelo cujos pesos e buffers de execução excedem esse valor não pode viver em um único dispositivo, então é fragmentado. O paralelismo de tensores é o método usual: cada camada é dividida entre o grupo, cada GPU mantém uma fatia dos pesos, e os resultados parciais são costurados com uma etapa de comunicação coletiva em cada camada. O grupo então se comporta como um único dispositivo maior. O número que esta calculadora produz descreve esse único grupo fortemente acoplado, não um conjunto de réplicas independentes.
A memória utilizável fica abaixo do valor nominal
Uma GPU nunca entrega toda a sua memória anunciada ao modelo. O contexto CUDA, o alocador de cache do framework, os tensores de ativação e a fragmentação entre alocações tomam uma parcela, e durante o atendimento o cache de chave-valor cresce com o comprimento do contexto e o tamanho do lote. Tratar cerca de 80 a 90 por cento do valor nominal como utilizável deixa uma margem realista; aproximar-se do valor cheio convida a falhas de falta de memória sob carga.
A fórmula
Com requisito do modelo de gigabytes, memória por GPU de gigabytes e fração utilizável , o número de dispositivos e a memória total são
nT=⌈g⋅fM⌉=n⋅gonde é o número de GPUs e é a memória nominal combinada delas. O teto arredonda para cima porque um modelo não pode rodar em um acelerador fracionário.
Exemplo resolvido
Considere um modelo que precisa de 140 GB de VRAM em GPUs com 80 GB cada, com 90 por cento da memória utilizável:
nT=⌈80×0.9140⌉=⌈72140⌉=⌈1.94⌉=2=2×80=160 GBDuas GPUs bastam, com 160 GB de memória nominal contra um requisito de 140 GB — folga confortável para o cache de chave-valor. Um modelo de 350 GB no mesmo hardware precisa de GPUs.
Além do mínimo
O número aqui responde apenas à questão do ajuste. Adicionar aceleradores além desse ponto compra folga de memória — um cache de chave-valor maior, um lote maior, espaço para contextos mais longos — e eleva a vazão, em vez de mudar se o modelo cabe, enquanto a sobrecarga de comunicação da fragmentação corrói gradualmente a eficiência por GPU. Dimensionar para desempenho é um exercício separado. Para estimar o requisito de memória subjacente que alimenta a entrada , veja a Calculadora de VRAM para Inferência de LLM, e para converter um número de dispositivos em um custo de execução, a Calculadora de Custo de GPU na Nuvem.
Perguntas frequentes (FAQ)
O que é paralelismo de tensores?
O paralelismo de tensores fragmenta cada camada de um modelo entre vários aceleradores, de modo que cada GPU mantém uma fatia dos pesos e calcula parte de cada multiplicação de matrizes. Os resultados parciais são combinados com uma etapa de comunicação coletiva em cada camada.
É a técnica que permite que um modelo maior do que um dispositivo caiba em um grupo deles, e é a razão pela qual o número desta calculadora descreve um único grupo fortemente acoplado, em vez de réplicas independentes.
Por que a memória utilizável fica abaixo do valor nominal?
Uma GPU nunca oferece toda a sua memória anunciada para um modelo. O contexto CUDA, o alocador de cache do framework, os tensores de ativação e a fragmentação entre alocações consomem espaço, e o cache de chave-valor cresce com o comprimento do contexto e o tamanho do lote durante o atendimento. Tratar cerca de 80 a 90 por cento como utilizável deixa uma margem realista; aproximar-se do valor nominal arrisca erros de falta de memória sob carga.
O que acontece se forem adicionadas mais GPUs do que o modelo precisa?
Aceleradores extras adicionam folga de memória que pode manter um cache de chave-valor maior, suportar um lote maior ou deixar espaço para contextos mais longos. Além do ponto em que a memória deixa de ser a restrição, adicionar GPUs eleva principalmente a vazão, em vez de o ajuste, e a sobrecarga de comunicação da fragmentação pode corroer a eficiência por GPU.
O número mínimo aqui responde apenas à questão do ajuste; dimensionar para desempenho é uma decisão separada.
Aviso legal
Esta estimativa cobre apenas o ajuste de memória e arredonda para cima até aceleradores inteiros. Não dimensiona vazão, latência ou interconexão, e a fração utilizável varia com o framework, o comprimento do contexto e o tamanho do lote. Confirme com a implantação real antes de provisionar.