NAP Latino

Publicado el 24 de agosto de 2026 · Revisado el 24 de agosto de 2026

Qué es Hermes y cómo instalar tu propio agente de IA que ejecuta comandos reales en tu servidor, sin pagar por token

Hermes, de Nous Research, es un modelo de lenguaje abierto entrenado específicamente para "llamadas a herramientas" — la capacidad que separa a un chatbot que solo conversa de un agente que de verdad ejecuta comandos, lee archivos y actúa en tu servidor. En esta guía instalamos Ollama, el modelo compatible con herramientas, y Hermes Agent encima, todo corriendo en tu propio VPS o servidor, sin depender de la API de pago de ningún proveedor externo.

Hay una diferencia grande entre un modelo de IA que te responde preguntas y un modelo que puede leer un archivo de tu servidor, correr un comando y decidir el siguiente paso según lo que encontró. Lo primero es un chatbot. Lo segundo es un agente, y depende de una capacidad técnica específica que no todos los modelos tienen bien entrenada: las "llamadas a herramientas" (tool calling), el mecanismo por el cual el modelo no solo genera texto, sino que sabe cuándo y cómo invocar una función real —ejecutar un comando, leer un archivo, hacer una petición web— y qué hacer con el resultado.

Hermes, desarrollado por Nous Research, es una familia de modelos de lenguaje abiertos (licencia Apache 2.0) entrenada específicamente para eso. Sobre esa base, Nous Research lanzó también Hermes Agent, un framework de agente de código abierto que conecta el modelo con tu terminal: le das una instrucción en lenguaje natural y el agente decide qué comandos correr, qué archivos leer, y va reportando el resultado. Todo esto puedes correrlo en tu propio servidor con Ollama, sin mandar una sola instrucción a un servidor externo ni pagar por token.

Antes de empezar: qué necesita tu servidor

Esto no es una guía liviana como instalar un plugin de WordPress — Hermes necesita recursos reales para funcionar bien. Con 8 GB de RAM podés correr un modelo pequeño (3B), pero para tener soporte confiable de herramientas —el punto central de esta guía— necesitás el modelo gemma4:31b, que exige 32 GB de RAM o más y al menos 8 núcleos de CPU (una GPU con 8+ GB de VRAM ayuda muchísimo con la velocidad, pero no es obligatoria). Sin GPU, un modelo de este tamaño responde entre 2 y 5 tokens por segundo — lento, pero funcional para tareas de administración que no son urgentes.

Paso 1: instalar Ollama

Ollama es lo que se encarga de correr el modelo en tu servidor y exponerlo como una API local, sin que tengas que lidiar directamente con los archivos del modelo:

curl -fsSL https://ollama.com/install.sh | sh

Confirmá que quedó activo y escuchando:

ollama --version
curl http://localhost:11434/api/tags

Paso 2: descargar el modelo con soporte de herramientas

No cualquier modelo sirve para esto — necesitás uno entrenado para tool calling. De las opciones disponibles en Ollama, gemma4:31b es la que soporta llamadas a herramientas de forma confiable (modelos más chicos como gemma2:9b o llama3.2:3b solo sirven para chat, no para que el agente ejecute acciones reales):

ollama pull gemma4:31b

Probá que responde antes de seguir:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma4:31b",
    "messages": [{"role": "user", "content": "Saluda"}],
    "max_tokens": 50
  }'

Paso 3: aumentar el contexto del modelo (paso que casi nadie hace, y sin el cual Hermes no funciona bien)

Por defecto, Ollama limita el contexto a apenas 2.048 tokens — muy poco para que un agente recuerde archivos leídos, comandos ejecutados y el hilo de la conversación. Hermes necesita al menos 64.000 tokens de contexto para funcionar de forma útil. Creamos una versión del modelo con ese límite ampliado:

cat > /tmp/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF

ollama create gemma4-64k -f /tmp/Modelfile

De acá en adelante usás gemma4-64k en vez de gemma4:31b en la configuración de Hermes.

Paso 4: instalar y configurar Hermes Agent

Corré el asistente de instalación:

hermes setup

Cuando te pregunte por el proveedor, elegí Custom Endpoint y completá:

  • Base URL: http://localhost:11434/v1
  • API Key: dejala vacía, o escribí no-key
  • Modelo: gemma4-64k

Si preferís editarlo directo, el archivo de configuración vive en ~/.hermes/config.yaml:

model:
  default: "gemma4-64k"
  provider: "custom"
  base_url: "http://localhost:11434/v1"

Paso 5: tu primera prueba real

Arrancá una sesión con:

hermes

Y probá con algo concreto, no una pregunta genérica — la idea es ver al agente ejecutar acciones, no solo responder texto:

List all Python files in this directory and count the lines of code in each

Si tu servidor corre solo con CPU, la primera respuesta puede tardar varios minutos sin mostrar nada en pantalla mientras el modelo procesa el prompt inicial — no es que se colgó, es la naturaleza de correr un modelo grande sin GPU. Si te resulta desesperante esperar, vale la pena ajustar el timeout en ~/.hermes/.env con HERMES_API_TIMEOUT=1800 para que el agente no se corte antes de tiempo.

¿Vale la pena frente a pagar por una API en la nube?

Para una sesión típica de trabajo (unos 100.000 tokens de entrada, 20.000 de salida), usar Claude o GPT-4o por API te cuesta entre 0,60 y 0,80 dólares. Corriendo Hermes localmente, el costo real es solo el consumo eléctrico de tu servidor — centavos, no dólares. La contrapartida es velocidad y calidad de razonamiento: para tareas rutinarias de administración (leer logs, organizar archivos, correr scripts simples) un modelo local como este es suficiente; para razonamiento complejo, un modelo en la nube todavía rinde más. Nada te impide configurar los dos: Hermes local para el día a día, y un proveedor externo como respaldo solo cuando la tarea lo exige.

Un agente que ejecuta comandos reales en tu servidor necesita RAM y CPU de sobra para no quedarse corto justo cuando lo estás usando — esto no corre bien en un plan compartido.

Conoce los planes de servidores dedicados de NAP Latino.