Calculadora de tokens efectivos por segundo
Datos de entrada
| Tokens por segundo máximos por acelerador | 2.500 |
|---|---|
| Aceleradores | 8 |
| Utilización | 70 % |
Calculadora de tokens efectivos por segundo
Estime el rendimiento sostenido de tokens de una flota de inferencia a partir de la velocidad máxima por acelerador, el número de aceleradores y la utilización: la capacidad realista, no el pico de un único flujo.
Datos de entrada
Flota
Resultados
Introduce un valor para ver los resultados.
Detalles
Tokens efectivos por segundo
La velocidad máxima de tokens de un único acelerador es una cifra de referencia captada en su mejor momento. El rendimiento que una implantación completa sostiene de verdad a lo largo de un día es otra cosa: el tráfico sube y baja, los aceleradores quedan parcialmente inactivos y se reserva capacidad para los picos. Esta calculadora estima esa tasa sostenida, a escala de flota, a partir del pico por acelerador, el número de aceleradores y un factor de utilización: la cifra con la que se debería planificar la capacidad.
Rendimiento máximo frente a sostenido
Es fácil sobrestimar la capacidad sumando cifras máximas. El pico supone que cada acelerador está saturado con lotes completos en todo instante, algo que nunca se cumple en una flota real a lo largo del tiempo real. La demanda es desigual, el equilibrio de carga es imperfecto y los operadores mantienen holgura deliberadamente para absorber las subidas. El factor de utilización integra todo eso en un solo multiplicador, convirtiendo un techo optimista en una cifra que se puede prometer a una carga de trabajo.
La fórmula
veffTd=vg⋅G⋅u=veff⋅86400donde es el pico por acelerador en tokens por segundo, es el número de aceleradores, es la fracción de utilización, es el rendimiento sostenido y son los tokens atendidos por día (un día tiene 86.400 segundos). El rendimiento escala de forma casi lineal con el número de aceleradores cuando cada uno asume una parte independiente del tráfico.
Ejemplo resuelto
Tomemos una flota de 8 aceleradores, cada uno con una referencia de 2.500 tokens por segundo con agrupación por lotes completa, funcionando a una utilización del 70 %:
veffTd=2500×8×0.7=14000 tokens/s=14000×86400≈1.21×109 tokens/dıˊaLa flota sostiene 14.000 tokens por segundo y puede atender aproximadamente 1.200 millones de tokens al día. Obsérvese cuánto queda eso por debajo del pico ingenuo de 20.000 tokens por segundo: el 30 % de la capacidad perdido por una utilización imperfecta es justamente el margen que una mejor agrupación por lotes y planificación podrían recuperar.
Uso para la planificación
Compare la cifra de tokens al día con la demanda prevista: divida la demanda entre esta capacidad para hallar cuántas flotas de este tamaño se necesitan, y añada después margen para los picos por encima de la media. Como la salida aumenta tanto con el número de aceleradores como con la utilización, un objetivo puede alcanzarse comprando más hardware o elevando la utilización; lo segundo suele ser la palanca más barata. El propio pico por acelerador procede de una prueba de referencia por lotes, examinada en la Calculadora de rendimiento de inferencia por lotes, y la consecuencia en coste de funcionar por debajo de la plena utilización se trata en la Calculadora del coste de utilización de GPU.
Preguntas frecuentes (FAQ)
¿En qué se diferencia esto del rendimiento máximo?
El rendimiento máximo es el que alcanza un único acelerador en un momento en que está plenamente agrupado por lotes y saturado. El rendimiento efectivo es el que sostiene una flota completa a lo largo del tiempo una vez que interviene el mundo real: el tráfico llega de forma desigual, algunos aceleradores quedan parcialmente inactivos, los lotes no siempre están llenos y se mantiene capacidad en reserva para los picos.
Multiplicar el pico por acelerador por el número de aceleradores da un techo teórico; multiplicar por la utilización lo reduce a una cifra que se puede prometer de verdad. La planificación de capacidad debería usar la cifra efectiva, no el pico.
¿De dónde sale el pico por acelerador?
Se mide mejor evaluando el modelo concreto sobre el hardware concreto con el tamaño de lote que se pretende usar, porque depende del tamaño del modelo, la precisión, la longitud de secuencia y la pila de servicio.
Como comprobación de sensatez, un límite teórico basado en el ancho de banda de memoria da una cota superior para la decodificación de un único flujo, y el servicio por lotes la multiplica por el número de solicitudes simultáneas. Use una cifra de referencia cuando disponga de ella y el límite teórico solo como techo optimista.
¿Cómo se usa esto para planificar la capacidad?
Compare el rendimiento efectivo, o la cifra de tokens al día, con la demanda prevista. Si una carga de trabajo necesita cierto número de tokens al día, divida esa cifra entre la capacidad diaria para hallar cuántas flotas de este tamaño se requieren, y añada después margen para los picos por encima de la media.
Como la salida escala tanto con el número de aceleradores como con la utilización, un objetivo puede alcanzarse añadiendo hardware o elevando la utilización mediante una mejor agrupación por lotes y planificación; lo segundo suele ser más barato.
Aviso legal
Esto supone que el rendimiento escala de forma lineal con el número de aceleradores y que un único factor de utilización capta todas las pérdidas del mundo real. Las redes, el equilibrio de carga, las longitudes de secuencia desiguales y la latencia de cola pueden reducir aún más la salida sostenida. Realice pruebas de referencia sobre el hardware objetivo y mantenga margen por encima de la demanda media.