Cristian Tala_

Mejores modelos IA para agentes N8N: comparativa con benchmark real (Septiembre 2026)

Si construyes agentes en N8N o Hermes, elegir el modelo correcto importa más que casi cualquier otro factor: una decisión equivocada puede 10× tu factura mensual sin mejorar la calidad visible. Acá: 10 modelos comparados con tests reales de tool calling, JSON workflows y latencia.

⚠️ Nota: "agente N8N" no es una sola cosa. Difiere si tu workflow tiene 1 LLM call vs 20 encadenadas, si necesita parsing estructurado vs texto libre, si la latencia importa al usuario o es batch nocturno.

Última actualización: 2026-09-03 · datos abiertos en GitHub

Top 10 modelos para N8N (priorizando tool calling + velocidad)

Ordenados por score en el pilar Agentes. Tool calling es badge de capacidad, no entra en el score global v4.13.0.

#ModeloTarea real en agente$ in/out per MTok/sLicense
1Claude Sonnet 4.69.40$3.00 / $15.0047Propietaria
2Gemma 4 31B9.36$0.10 / $0.3450Gemma Terms
3Claude Opus 4.89.34$5.00 / $25.0060Propietaria
4Claude Opus 4.79.29$5.00 / $25.0057Propietaria
5Qwen 3.7 Max9.29$1.48 / $4.4256Propietaria
6Kimi K29.29$0.57 / $2.3033Modified MIT
7Gemini 3.7 Flash9.28$0.38 / $1.88111Propietaria
8MiMo-V2.5 Pro9.27$0.43 / $0.8749Propietaria
9Kimi K39.27$3.00 / $15.0037Open source
10GLM 5.29.26$0.49 / $1.5453MIT

Filtra por tu volumen y restricciones en la calculadora interactiva.

¿Qué modelo elegir según tu agente N8N?

Si tu agente hace 100-500 calls/día con tool calling crítico

Qwen 3.7 Flash es la mejor combinación medida: 8,18 en tool calling —el más alto del corte barato— con calidad 8,46 y $0,20 por cada 1.000 llamadas. El JSON output es robusto, testeado en code_generation/n8n_workflow_json.

Si lo que te duele es la espera y no el costo, Llama 4 Scout 17B responde en 7,6 s contra los 28 s de Qwen, y paga por eso medio punto de tool calling (7,62) y $0,48. En un workflow de 5-10 llamadas encadenadas, esa diferencia son minutos por corrida.

Hasta el 16 de agosto de 2026 acá recomendábamos Llama 3.1 8B Instant en Groq, que respondía en 1,3 s gracias a su LPU. Groq lo apagó, junto con Llama 3.3 70B Versatile. Vale decir lo que se perdió: ningún modelo del ranking iguala esa latencia por otra ruta. Groq recomienda migrar a GPT-OSS, y ahí conviene mirar el número que su anuncio no menciona: GPT-OSS marca 6,4-6,5 en tool calling contra 8,0 del que reemplaza. Si tu agente solo redacta, es un buen cambio; si llama herramientas, es un retroceso.

Si construyes un SaaS con miles de calls/mes

Mistral Small 4 ($0.15/$0.60) o Ministral 14B ($0.20/$0.20) son los más eficientes. Para 10,000 calls/mes a 1,800 tokens promedio: Mistral ~$11/mes, Devstral ~$5/mes vs ~$162/mes con Claude Sonnet 4.6.

Si tu agente requiere razonamiento (no solo tool calling)

Hermes 4 70B tiene "hybrid reasoning" — combina respuestas rápidas con modo razonamiento profundo cuando lo amerita. DeepSeek R1 es backup sólido si necesitas reasoning puro.

Si quieres open-source para correr local + N8N self-hosted

Mistral Small 4 (Apache 2.0, 24B) cabe en hardware modesto y soporta tool calling OpenAI-compatible. Ministral 14B es alternativa también Apache 2.0. Para más detalles sobre setup local: modelos open-source local.

Si N8N corre en un servidor con poco budget

NVIDIA NIM ofrece 135+ modelos GRATIS con 40 RPM — más que suficiente para agentes con uso secuencial moderado. Modelos disponibles: Llama 3.3, Mistral Small, Nemotron Ultra.

Caso real: agente de Cristian para ecosistemastartup.com

Cristian Tala (autor del benchmark) usa N8N para automatizar la generación de contenido de su blog ecosistemastartup.com. El agente investiga noticias del ecosistema startup chileno/latinoamericano, sintetiza y genera borradores. Modelo en producción: Qwen 3.5 397B Cloud via Ollama Cloud (incluido en suscripción ~$30/mes, sin costo por call).

Por qué no eligió uno del top 5 del benchmark global: el caso de uso es contenido largo en español sobre actualidad, donde Qwen 3.5 supera en context preservation y tono natural. Lección: el ranking global es referencia, pero valida en tu caso real.

Preguntas frecuentes

¿Cómo configuro un modelo del benchmark en N8N?

N8N tiene nodo 'OpenAI Chat Model' — usa cualquier endpoint OpenAI-compatible. Configura: baseURL: https://openrouter.ai/api/v1 (o Groq, NVIDIA NIM, Ollama Cloud), tu API key y el model del benchmark. Ejemplo: mistralai/mistral-small-2603.

¿Qué pasa si el modelo open-source que elijo deja de funcionar?

Modelos open-source en OpenRouter pueden deprecar. Estrategia: tener un fallback configurado. N8N permite chains con if/error — primer modelo Mistral Small 4, fallback a Llama 3.3 Groq, fallback final a GPT-4.1.

¿Tool calling funciona igual en todos los modelos del benchmark?

No. Tool calling es OpenAI-compatible en mayoría pero la robustez varía. El benchmark mide esto como badge; los del top 10 de agentes tienen tool calling testado robusto.

¿Cuánto cuesta correr un agente N8N con 1000 calls/día?

Asumiendo 300 input + 1500 output tokens promedio (~30K calls/mes): Llama 3.3 Groq ~$25/mes, Mistral Small 4 ~$32/mes, Ministral 14B ~$15/mes, Claude Sonnet 4.6 ~$162/mes. El benchmark es la diferencia entre $15 y $162 por la misma calidad práctica.

¿Debería usar un modelo distinto por nodo en N8N?

Sí, es buena práctica. Routing/clasificación con Gemini Flash Lite (rápido, barato), generación con Llama 3.3 Groq, validación final con GPT-4.1 si es crítico. Stack híbrido suele superar al single-modelo en costo y calidad.

Prueba la calculadora con tu caso real

Filtra por presupuesto mensual, calidad mínima, velocidad requerida y tipo de tarea. En 30 segundos encuentras el mejor para ti.

Ir a la calculadora →

Ver también: alternativas a Claude · alternativas a ChatGPT · alternativas a Gemini · open-source local

{contrato}