NAP Latino

Publicado el 15 de agosto de 2026 · Revisado el 15 de agosto de 2026

SpaceXAI lanzó Grok 4.6 el mismo día que DeepSeek V4 Pro: la nueva generación de modelos apunta a agentes que trabajan solos durante horas

El 12 de agosto, SpaceXAI (antes xAI) lanzó Grok 4.6, disponible el mismo día en Cursor, Vercel, Cloudflare y OpenRouter, apenas horas después de que DeepSeek publicara su V4 Pro — una coincidencia de calendario que dice más sobre qué tan reñida está esta carrera que cualquier anuncio individual. El modelo apunta específicamente a agentes que trabajan sin supervisión durante muchos pasos seguidos, el mismo tipo de tarea que cubrimos aquí al enseñar a instalar OpenHands.

El 12 de agosto, SpaceXAI —la empresa antes conocida como xAI— lanzó Grok 4.6, su nuevo modelo insignia. El detalle que más llamó la atención de la industria no fue tanto el modelo en sí como el momento exacto del lanzamiento: llegó apenas horas después de que DeepSeek publicara la disponibilidad general de su V4 Pro. Nadie coordina estos calendarios entre competidores directos — que dos laboratorios lancen su modelo de referencia el mismo día es la mejor evidencia posible de qué tan comprimidos están los ciclos de esta carrera en este momento.

Grok 4.6 estuvo disponible desde el primer día en un abanico amplio de plataformas: Cursor (el editor de código con IA), Grok Build, la API propia de SpaceXAI, OpenRouter, y —lo más relevante para cualquiera que administre infraestructura— Vercel y Cloudflare, dos plataformas que buena parte de los desarrolladores ya usan a diario para desplegar aplicaciones. El precio se fijó en $2 por millón de tokens de entrada y $6 por millón de tokens de salida. SpaceXAI describe el enfoque central del modelo como su capacidad de "permanecer con tareas complejas a lo largo de muchos pasos" — es decir, agentes que investigan un tema, trabajan sobre una base de código completa, o convierten una idea en una aplicación funcional mediante una secuencia larga de pasos autónomos, con capacidad de autoevaluación incorporada en el proceso. Es exactamente el tipo de tarea que cubrimos aquí hace unos días al enseñar a instalar OpenHands en tu propio servidor: un agente que no solo responde una pregunta, sino que ejecuta un trabajo completo por su cuenta.

Vale la pena mirar los números de rendimiento con cuidado, porque no cuentan la historia de un modelo que arrasa con todo. En el índice de la Artificial Intelligence Analysis Index, Grok 4.6 obtuvo 61 puntos, empatando con GPT-5.6 Sol de OpenAI, pero por debajo del Fable 5 Max de Anthropic, que llegó a 62. En DeepSWE v1.1, una prueba específica de tareas de ingeniería de software, Grok 4.6 anotó 65,9% frente al 73% de GPT-5.6 Sol Max. Y en Terminal-Bench v3.0 —una prueba centrada en el uso de terminal y comandos, justamente el tipo de tarea que un agente autónomo como OpenHands ejecuta constantemente—, Grok 4.6 quedó notablemente por debajo de sus competidores, con apenas 26%.

Esto es lo más útil de esta noticia para cualquiera que esté evaluando qué modelo conectar a su propio flujo de agentes: la etiqueta de "el modelo más nuevo" no equivale automáticamente a "el mejor para tu caso específico". Si ya sigues nuestra serie sobre autohospedar IA y tienes LiteLLM centralizando el acceso a distintos modelos —el que instalamos hace unos días justamente para poder comparar y cambiar de proveedor sin reescribir tu aplicación—, Grok 4.6 es una opción más para agregar a esa lista, no un reemplazo automático de lo que ya tenías funcionando. Los propios números de SpaceXAI muestran que, para tareas de terminal e ingeniería de software específicamente, otros modelos siguen rindiendo mejor — la decisión correcta depende de qué tarea es realmente la que le vas a pedir al agente, no de cuál lanzamiento salió más reciente esta semana.

La lección de fondo de esta doble coincidencia de lanzamientos —Grok 4.6 y DeepSeek V4 Pro el mismo día— es que la velocidad a la que aparecen nuevos modelos ya superó, para la mayoría de los equipos, la velocidad a la que alguien puede evaluarlos con cuidado antes de adoptarlos. Tener la infraestructura lista para probar un modelo nuevo sin comprometer todo tu flujo de trabajo —como la que ya armamos en esta sección— vale más, en la práctica, que perseguir cada anuncio individual.