Publicado el 20 de julio de 2026 · Revisado el 20 de julio de 2026
Rubin de NVIDIA ya está en producción: cómo el nuevo salto de inferencia cambia el costo de correr IA
NVIDIA confirmó que su plataforma Vera Rubin —siete chips nuevos en producción plena— ya escala las "fábricas de IA". El número que importa no es el del entrenamiento, sino hasta 10x menos costo por token de inferencia. Esto es lo que significa para quienes corren modelos en su propio hardware.
Esta semana NVIDIA confirmó algo que suena a técnico y aburrido pero que va a mover el precio de media internet: su plataforma Vera Rubin, el sucesor de Blackwell, ya está en producción plena. No es una sola tarjeta nueva: son siete chips distintos diseñados para funcionar como una sola "computadora de IA". La parte que debería importarte no es que los modelos se entrenen más rápido, sino que correrlos —la inferencia, lo que pasa cada vez que un usuario le habla a un bot o un agente autónomo toma una decisión— se vuelve hasta diez veces más barato por token, según la propia NVIDIA.
Si eso te suena lejano, piénsalo así: cada respuesta de un asistente, cada resumen automático, cada agente que revisa tu correo, es inferencia. Hasta ahora la industria había puesto el foco en el entrenamiento (construir el modelo gigante una vez). En 2026 el cuello de botella se corrió al otro lado: millones de agentes ejecutándose a la vez, generando tokens todo el día. Ahí es exactamente donde Rubin apunta.
La plataforma no es "una GPU mejor". Es un sistema empaquetado en racks donde todo habla con todo a velocidad de silicio:
- Rubin GPU y Vera CPU en racks NVL72, acoplados por NVLink 6.
- ConnectX-9 SuperNIC y Spectrum-6 Ethernet Switch para mover datos entre nodos sin cuello.
- BlueField-4 DPU descargando tareas de red y seguridad del CPU principal.
- Groq 3 LPX, un acelerador de inferencia (decode) que NVIDIA integra en el mismo rack.
- Dynamo 1.0, el software que orquesta todo esto a escala de "agente".
Las cifras que NVIDIA declara (ojo: son claims del fabricante, no mediciones independientes) son contundentes: hasta 10x de reducción en el costo por token de inferencia y 4x menos GPUs necesarias para entrenar modelos MoE (expertos mezclados) frente a la generación anterior. El salto no viene de un chip más rápido suelto, sino del "codesign" extremo: CPU, GPU, switch, NIC y DPU diseñados juntos para no desperdiciar un solo ciclo.
El detalle que confirma el cambio de era está en el targeting de la propia NVIDIA: la plataforma está "optimizada para cada fase de la IA, desde el pre-entrenamiento y el post-entrenamiento hasta el test-time scaling y la inferencia agentica". Fíjate en el orden: ya no es solo entrenar el modelo una vez y listo. Es el bucle continuo de los agentes —que piensan, prueban y vuelven a generar— lo que define el hardware. Eso es lo que NVIDIA llama el "agentic AI frontier".
¿Qué significa para ti, que no eres un hiperscalador? Que la economía de la inferencia está bajando lo suficiente para que correr IA en tu propio equipo deje de ser un capricho de laboratorio. Mientras los gigantes firman acuerdos nucleares para alimentar sus fábricas de tokens, el costo marginal de generar inferencia en hardware propio se achica mes a mes. El siguiente paso lógico para muchos equipos es dejar de pagar por token a un tercero y montar su propio servidor de inferencia:
# Servir un modelo en tu propio VDS, por ejemplo con Ollama
ollama serve
ollama run llama3.2
# El agente o la app consumen tu endpoint local: sin factura por token externa
Rubin es el seguimiento de Blackwell Ultra, que sigue enviándose, así que no es un reemplazo inmediato sino la nueva cima. Pero la dirección es clara: el 2026 es el año en que la inferencia le ganó al entrenamiento como problema principal de infraestructura. Si tu plan es correr agentes o modelos en tu propio hardware, un servidor dedicado o un VDS con la capacidad de GPU adecuada es donde esta historia deja de ser teoría y se vuelve operación real. Puedes ver las opciones en planes de servidores dedicados.
Artículos relacionados
18 de jul de 2026
IDC: el servidor arrasa con la IA y el almacenamiento vuelve a crecer
17 de jul de 2026
Así ve Anthropic el interior de Claude: mapas de circuitos e introspección en IA
16 de jul de 2026
La carrera de los 700.000 millones: cómo el gasto en infraestructura IA de los hiperscaladores redefine el hosting en 2026
Carolina
CTO - NAP Latino
www.naplatino.com
soporte@naplatino.com
