HARDWARE PARA LLM LOCAL
La pregunta no es “qué GPU compro”.
Es qué carga debe sostener.
El hardware se dimensiona después de conocer modelo, cuantización, longitud de contexto, concurrencia, latencia objetivo y margen de crecimiento.
ORDEN CORRECTO
Primero workload. Después modelo. Recién después hardware.
Tarea
Definimos qué hará el sistema y qué calidad mínima tiene que alcanzar.
Modelo y precisión
El benchmark determina tamaños y cuantizaciones aceptables, no una ficha de marketing.
Demanda
Usuarios simultáneos, tokens de entrada/salida, contexto y ventanas de uso cambian el dimensionamiento.
Serving
Runtime, batching, cache y paralelismo pueden cambiar radicalmente la capacidad del mismo equipo.
COMPONENTES
Qué evaluamos en una arquitectura física.
EVITAR SOBREDIMENSIONAR
Más GPU no arregla una mala decisión de sistema.
Puede aumentar costo y latencia sin mejorar la tarea concreta.
Ventanas enormes consumen memoria y no reemplazan un buen RAG.
Un demo fluido puede degradarse cuando aparece concurrencia real.
La arquitectura debe tolerar cambios de modelo y crecimiento sin obligar a rehacer todo.
DIMENSIONAMIENTO
Podemos calcular qué infraestructura tiene sentido para tu carga.
Sin empezar por una marca ni por una GPU específica.