Calculadora de número de GPU para un modelo
Datos de entrada
| VRAM del modelo | 140 |
|---|---|
| Memoria por GPU | 80 |
| Fracción aprovechable | 90 % |
Calculadora de número de GPU para un modelo
Estima cuántos aceleradores hacen falta para alojar un modelo en memoria, a partir de su requisito total de VRAM, la memoria por GPU y una fracción aprovechable que tiene en cuenta la sobrecarga del framework y la fragmentación.
Datos de entrada
Modelo
Hardware
Resultados
Introduce un valor para ver los resultados.
Detalles
Número de GPU para un modelo
Un modelo de lenguaje grande tiene que caber dentro de la memoria del acelerador antes de poder servir un solo token. Cuando el modelo es mayor que una GPU, se reparte entre varias, y la primera pregunta de planificación es sencillamente cuántos dispositivos hacen falta. Esta calculadora lo responde a partir de tres números: la VRAM total que necesita el modelo, la memoria de cada GPU y la fracción de esa memoria que un despliegue real puede aprovechar de verdad.
Por qué un modelo abarca varias GPU
Un acelerador moderno lleva una cantidad fija de memoria de alto ancho de banda: 80 GB en una H100, 141 GB en una H200. Un modelo cuyos pesos y búferes de ejecución superan esa cifra no cabe en un solo dispositivo, así que se reparte. El paralelismo de tensores es el método habitual: cada capa se divide entre el grupo, cada GPU guarda una porción de los pesos y los resultados parciales se cosen con un paso de comunicación colectiva en cada capa. El grupo se comporta entonces como un único dispositivo mayor. El número que produce esta calculadora describe ese único grupo fuertemente acoplado, no un conjunto de réplicas independientes.
La memoria aprovechable está por debajo de la nominal
Una GPU nunca entrega al modelo toda su memoria anunciada. El contexto CUDA, el asignador con caché del framework, los tensores de activación y la fragmentación entre asignaciones se llevan una parte, y durante el servicio la caché clave-valor crece con la longitud de contexto y el tamaño de lote. Tratar aproximadamente el 80 a 90 por ciento de la cifra nominal como aprovechable deja un margen realista; acercarse a la cifra completa invita a fallos por falta de memoria bajo carga.
La fórmula
Con un requisito del modelo de gigabytes, una memoria por GPU de gigabytes y una fracción aprovechable , el número de dispositivos y la memoria total son
nT=⌈g⋅fM⌉=n⋅gdonde es el número de GPU y su memoria nominal combinada. El techo redondea hacia arriba porque un modelo no puede ejecutarse en un acelerador fraccionario.
Ejemplo resuelto
Tomemos un modelo que necesita 140 GB de VRAM en GPU de 80 GB cada una, con el 90 por ciento de la memoria aprovechable:
nT=⌈80×0,9140⌉=⌈72140⌉=⌈1,94⌉=2=2×80=160 GBDos GPU bastan, con 160 GB de memoria nominal frente a un requisito de 140 GB: un margen cómodo para la caché clave-valor. Un modelo de 350 GB en el mismo hardware necesita GPU.
Más allá del mínimo
El número de aquí responde solo a la cuestión del ajuste. Añadir aceleradores más allá de ese punto compra margen de memoria —una caché clave-valor mayor, un tamaño de lote más alto, espacio para contextos más largos— y eleva el rendimiento en lugar de cambiar si el modelo cabe, mientras que la sobrecarga de comunicación del reparto erosiona poco a poco la eficiencia por GPU. Dimensionar para el rendimiento es un ejercicio aparte. Para estimar el requisito de memoria subyacente que alimenta la entrada , véase la Calculadora de VRAM para inferencia de LLM, y para convertir un número de dispositivos en un coste de ejecución, la Calculadora de coste de GPU en la nube.
Preguntas frecuentes (FAQ)
¿Qué es el paralelismo de tensores?
El paralelismo de tensores reparte cada capa de un modelo entre varios aceleradores, de modo que cada GPU contiene una porción de los pesos y calcula una parte de cada multiplicación de matrices. Los resultados parciales se combinan con un paso de comunicación colectiva en cada capa.
Es la técnica que permite que un modelo mayor que un solo dispositivo quepa en un grupo de ellos, y es la razón por la que el número de esta calculadora describe un único grupo fuertemente acoplado y no réplicas independientes.
¿Por qué la memoria aprovechable está por debajo de la cifra nominal?
Una GPU nunca ofrece al modelo toda su memoria anunciada. El contexto CUDA, el asignador con caché del framework, los tensores de activación y la fragmentación entre asignaciones consumen espacio, y la caché clave-valor crece con la longitud de contexto y el tamaño de lote durante el servicio.
Tratar aproximadamente el 80 a 90 por ciento como aprovechable deja un margen realista; acercarse a la cifra nominal arriesga errores por falta de memoria bajo carga.
¿Qué ocurre si se añaden más GPU de las que el modelo necesita?
Los aceleradores adicionales aportan margen de memoria que puede alojar una caché clave-valor mayor, admitir un tamaño de lote más alto o dejar espacio para contextos más largos. Más allá del punto en que la memoria deja de ser la restricción, añadir GPU eleva sobre todo el rendimiento en lugar del ajuste, y la sobrecarga de comunicación del reparto puede erosionar la eficiencia por GPU.
El número mínimo de aquí responde solo a la cuestión del ajuste; dimensionar para el rendimiento es una decisión aparte.
Aviso legal
Esta estimación cubre únicamente el ajuste en memoria y redondea hacia arriba a aceleradores enteros. No dimensiona para el rendimiento, la latencia ni la interconexión, y la fracción aprovechable varía con el framework, la longitud de contexto y el tamaño de lote. Conviene confirmarlo con el despliegue real antes de aprovisionar.