Herramientas · Inferencia de LLM

Calculadora de VRAM

Parámetros, cuantización y contexto → memoria necesaria, y en qué equipos cabe.

Cuantización de pesos 0,58 B/parám.

Precisión de la KV cache

Cada usuario o petición en paralelo necesita su propia KV cache.

GB

Pesos
KV cache
Margen (runtime, buffers, activaciones)
Total

¿Dónde cabe?

  • GeForce RTX 507012 GB
  • GeForce RTX 508016 GB
  • GeForce RTX 309024 GB
  • GeForce RTX 409024 GB
  • Radeon RX 7900 XTX24 GB
  • GeForce RTX 509032 GB
  • NVIDIA RTX 6000 Ada Generation48 GB
  • NVIDIA H100 SXM5 80 GB80 GB
  • NVIDIA RTX PRO 6000 Blackwell Workstation Edition96 GB
  • AMD Ryzen AI Max+ 395 (Strix Halo, Radeon 8060S, 128 GB)128 GB
  • DGX Spark (128 GB)128 GB
  • Apple M4 Max (GPU 40 núcleos, 128 GB)128 GB
  • NVIDIA H200 SXM 141 GB141 GB
  • B200192 GB
  • AMD Instinct MI300X192 GB
  • Apple M3 Ultra (GPU 80 núcleos, 512 GB)512 GB

«2×» = harían falta dos unidades (con tensor parallel o pipeline). En equipos de memoria unificada, el sistema operativo reserva parte de la RAM: cuenta con un 10-15 % menos.

Cómo se calcula

La memoria de inferencia tiene tres sumandos. El primero es fijo: los pesos, que ocupan parámetros × bytes por parámetro. Un modelo de 70 000 millones de parámetros en FP16 (2 bytes) necesita 141 GB; en Q4_K_M (≈ 0,58 bytes de media, porque no todas las capas se cuantizan igual) baja a unos 41 GB. En un modelo Mixture of Experts hay que cargar todos los expertos aunque cada token solo use unos pocos: los «parámetros activos» reducen el cálculo, no la memoria.

El segundo crece con el contexto: la KV cache guarda, para cada token procesado y cada capa, los vectores clave y valor de la atención. Con grouped-query attention el tamaño por token es 2 × capas × KV heads × dimensión de cabeza × bytes. Llama 3.3 70B: 2 × 80 × 8 × 128 × 2 bytes = 320 KiB por token, es decir 2,5 GB por cada 8 192 tokens. Los modelos con ventanas locales (Gemma 3, Llama 4, GPT-OSS) solo dejan crecer la caché en parte de sus capas; los de atención latente (DeepSeek, Kimi, GLM) comprimen K y V en un vector pequeño por token. La calculadora usa la arquitectura real de cada modelo, leída de su config.json.

El tercero es el margen: el contexto CUDA o Metal, los buffers de activaciones del prefill, el grafo de cómputo y la fragmentación. Aquí se estima como un 8 % de los pesos más 0,6 GB. En la práctica varía con el motor (llama.cpp, vLLM, MLX, ExLlama) y con el tamaño del lote.

Lo que no incluye

  • La descarga parcial a RAM (offload): permite arrancar modelos que no caben, pero cada capa en CPU se paga en velocidad (ver tokens por segundo).
  • Los modelos multimodales: el codificador de visión suma entre 0,4 y 2 GB.
  • Las capas con estado fijo de los modelos híbridos (Mamba/atención lineal): ocupan poco y no crecen con el contexto.

Para entender por qué el ancho de banda importa tanto como la capacidad, sigue por inferencia de LLM en local y ancho de banda de memoria. Para decidir compra, cómo elegir GPU para IA.

Otras herramientas

Escribe para buscar en artículos, herramientas y glosario. Esc para cerrar.