Herramientas · Inferencia de LLM
Calculadora de VRAM
Parámetros, cuantización y contexto → memoria necesaria, y en qué equipos cabe.
- Pesos
- KV cache
- Margen (runtime, buffers, activaciones)
- Total
¿Dónde cabe?
- GeForce RTX 507012 GB
- GeForce RTX 508016 GB
- GeForce RTX 309024 GB
- GeForce RTX 409024 GB
- Radeon RX 7900 XTX24 GB
- GeForce RTX 509032 GB
- NVIDIA RTX 6000 Ada Generation48 GB
- NVIDIA H100 SXM5 80 GB80 GB
- NVIDIA RTX PRO 6000 Blackwell Workstation Edition96 GB
- AMD Ryzen AI Max+ 395 (Strix Halo, Radeon 8060S, 128 GB)128 GB
- DGX Spark (128 GB)128 GB
- Apple M4 Max (GPU 40 núcleos, 128 GB)128 GB
- NVIDIA H200 SXM 141 GB141 GB
- B200192 GB
- AMD Instinct MI300X192 GB
- Apple M3 Ultra (GPU 80 núcleos, 512 GB)512 GB
«2×» = harían falta dos unidades (con tensor parallel o pipeline). En equipos de memoria unificada, el sistema operativo reserva parte de la RAM: cuenta con un 10-15 % menos.
Cómo se calcula
La memoria de inferencia tiene tres sumandos. El primero es fijo: los pesos, que ocupan parámetros × bytes por parámetro. Un modelo de 70 000 millones de parámetros en FP16 (2 bytes) necesita 141 GB; en Q4_K_M (≈ 0,58 bytes de media, porque no todas las capas se cuantizan igual) baja a unos 41 GB. En un modelo Mixture of Experts hay que cargar todos los expertos aunque cada token solo use unos pocos: los «parámetros activos» reducen el cálculo, no la memoria.
El segundo crece con el contexto: la KV cache guarda, para cada token procesado y cada capa, los vectores clave y valor de la atención. Con grouped-query attention el tamaño por token es 2 × capas × KV heads × dimensión de cabeza × bytes. Llama 3.3 70B: 2 × 80 × 8 × 128 × 2 bytes = 320 KiB por token, es decir 2,5 GB por cada 8 192 tokens. Los modelos con ventanas locales (Gemma 3, Llama 4, GPT-OSS) solo dejan crecer la caché en parte de sus capas; los de atención latente (DeepSeek, Kimi, GLM) comprimen K y V en un vector pequeño por token. La calculadora usa la arquitectura real de cada modelo, leída de su config.json.
El tercero es el margen: el contexto CUDA o Metal, los buffers de activaciones del prefill, el grafo de cómputo y la fragmentación. Aquí se estima como un 8 % de los pesos más 0,6 GB. En la práctica varía con el motor (llama.cpp, vLLM, MLX, ExLlama) y con el tamaño del lote.
Lo que no incluye
- La descarga parcial a RAM (offload): permite arrancar modelos que no caben, pero cada capa en CPU se paga en velocidad (ver tokens por segundo).
- Los modelos multimodales: el codificador de visión suma entre 0,4 y 2 GB.
- Las capas con estado fijo de los modelos híbridos (Mamba/atención lineal): ocupan poco y no crecen con el contexto.
Para entender por qué el ancho de banda importa tanto como la capacidad, sigue por inferencia de LLM en local y ancho de banda de memoria. Para decidir compra, cómo elegir GPU para IA.
Otras herramientas
- Tokens por segundo — Velocidad esperable de un LLM
- Explorador Roofline — ¿Te limita el cálculo o la memoria?
- Comparador de GPUs — Todas las cifras, ordenables
- Calculadora de ancho de banda — Bus × velocidad ÷ 8
- Memoria de entrenamiento — Full, LoRA o QLoRA