Publicado el 25 de julio de 2026 · Revisado el 25 de julio de 2026
Cuánta RAM y CPU necesitas realmente para correr un modelo de IA local (sin exagerar)
Antes de comprar un servidor "por si acaso" para correr tu propio modelo de IA, esta guía te muestra cómo calcular en serio cuánta RAM y CPU necesitas según el tamaño del modelo y la cuantización que uses — para no pagar de más ni quedarte corto.
Uno de los errores más comunes al montar tu propio servidor de IA (con Ollama, por ejemplo) es calcular los recursos al ojo: "voy a comprar el servidor más grande que pueda pagar, por si acaso". Eso casi siempre termina en pagar de más por capacidad que nunca vas a usar, o en el error contrario — comprar corto y descubrir que el modelo ni siquiera carga. Esta guía te da una forma real de calcular qué necesitas, según el modelo que quieras correr.
1. Entiende de qué depende el consumo de RAM
Antes de mirar cualquier tabla de specs, hay que entender la regla base: el consumo de memoria de un modelo de lenguaje depende principalmente de dos cosas — cuántos parámetros tiene el modelo (7B, 13B, 70B, etc.) y con qué nivel de cuantización lo vas a correr. La cuantización es, en corto, comprimir los "pesos" del modelo para que ocupen menos espacio en memoria a cambio de una pérdida mínima de precisión. Sin entender esto, cualquier número de RAM que veas en una tabla te va a parecer arbitrario.
2. Usa la regla práctica para estimar RAM por tamaño de modelo
La aproximación que usa la comunidad de Ollama y llama.cpp es esta: un modelo cuantizado a 4 bits (el estándar más común para correr en local) ocupa aproximadamente medio gigabyte de RAM por cada mil millones de parámetros, más un margen de 20-30% para el contexto y el sistema operativo. En la práctica:
- Un modelo de 7B (7 mil millones de parámetros) necesita entre 6 y 8 GB de RAM disponible.
- Un modelo de 13B necesita entre 10 y 16 GB.
- Un modelo de 34B necesita entre 24 y 32 GB.
- Un modelo de 70B necesita entre 40 y 48 GB, y ya empieza a justificar un servidor con GPU dedicada en vez de correrlo solo en CPU.
Si usas una cuantización más agresiva (por ejemplo 2 bits en vez de 4) bajas el consumo de RAM, pero sacrificas calidad de respuesta de forma notoria — no es gratis, así que no lo hagas solo para ahorrar memoria si la calidad del modelo es lo que te importa.
3. No confundas "puede cargar" con "responde a una velocidad usable"
Aquí es donde la mayoría se lleva la sorpresa real: un modelo puede cargar perfectamente en la RAM que calculaste, y aun así responder tan lento que se vuelve inútil para un uso real. Correr un modelo solo con CPU (sin GPU) funciona, pero la velocidad de generación depende directamente de cuántos núcleos y qué tan rápida es la memoria RAM del servidor — no solo de la cantidad total. Como regla general, más núcleos de CPU ayudan a que las respuestas salgan más rápido, pero el salto real de velocidad viene de tener una GPU con suficiente VRAM para cargar el modelo ahí en vez de en RAM del sistema.
4. Decide si necesitas GPU según tu caso de uso
Si vas a usar el modelo para pruebas, desarrollo, o consultas ocasionales donde esperar unos segundos por respuesta no es un problema, un servidor solo con CPU y la RAM calculada arriba es suficiente — es la opción más económica. Si en cambio necesitas que el modelo responda en tiempo real (un chatbot de atención al cliente, un asistente que se usa todo el día), vas a necesitar una GPU con VRAM suficiente para el modelo que elegiste — la misma tabla de arriba aplica, pero contando VRAM de la GPU en vez de RAM del sistema.
5. Deja margen para el contexto, no solo para el modelo
Un detalle que casi nadie calcula: cuanto más larga sea la conversación o el documento que le pases al modelo (la "ventana de contexto"), más memoria adicional consume, por encima del modelo mismo. Si vas a trabajar con documentos largos o conversaciones extensas, súmale al menos un 20% extra de margen sobre los números de la tabla — no calcules al límite exacto.
Si después de calcular tus necesidades reales el resultado apunta a un modelo grande (34B en adelante) o a un uso con GPU dedicada, en /planes/vds y /planes/servidores-dedicados tenemos opciones pensadas para ese nivel de carga.
Artículos relacionados
Carolina
CTO - NAP Latino
www.naplatino.com
soporte@naplatino.com
