Mejores modelos IA para agentes N8N: comparativa con benchmark real (Junio 2026)
Si construís agentes en N8N o Hermes, elegir el modelo correcto importa más que casi cualquier otro factor: una decisión equivocada puede 10× tu factura mensual sin mejorar la calidad visible. Acá: 10 modelos comparados con tests reales de tool calling, JSON workflows y latencia.
⚠️ Nota: "agente N8N" no es una sola cosa. Difiere si tu workflow tiene 1 LLM call vs 20 encadenadas, si necesita parsing estructurado vs texto libre, si la latencia importa al usuario o es batch nocturno.
Top 10 modelos para N8N (priorizando tool calling + velocidad)
| # | Modelo | Score | $ in/out per M | Tok/s | License |
|---|---|---|---|---|---|
| 1 | Mistral Large 3 675B | 7.93 | $0.50 / $1.50 | 56 | Apache 2.0 |
| 2 | Qwen 3.6 35B base (OpenRouter FP8) | 6.52 | $0.14 / $1.00 | 152 | Apache 2.0 |
| 3 | Ministral 14B | 8.02 | $0.20 / $0.20 | 78 | Apache 2.0 |
| 4 | Qwen 3.5 35B | 6.04 | $0.14 / $1.00 | 130 | Apache 2.0 |
| 5 | Qwen 3-Next 80B Instruct | 7.47 | $0.09 / $1.10 | 107 | Apache 2.0 |
| 6 | Claude Haiku 4.5 | 7.12 | $1.00 / $5.00 | 106 | Propietaria |
| 7 | Llama 4 Scout 17B | 5.37 | $0.10 / $0.30 | 133 | Llama Community |
| 8 | Qwen3-Coder-Next (OpenRouter FP8) | 5.31 | $0.11 / $0.80 | 106 | Apache 2.0 |
| 9 | MiniMax M2.5 | 6.77 | $0.15 / $0.90 | 61 | MIT |
| 10 | Qwen 3.5 397B | 6.00 | $0.39 / $2.45 | 66 | Apache 2.0 |
¿Qué modelo elegir según tu agente N8N?
Si tu agente hace 100-500 calls/día con tool calling crítico
Llama 3.1 8B Instant (Groq) es la elección dominante. 367 tok/s significa que workflows
con 5-10 LLM calls encadenados se sienten instantáneos. El JSON output es robusto — testeado en
code_generation/n8n_workflow_json.
Si construís un SaaS con miles de calls/mes
Mistral Small 4 ($0.15/$0.60) o Ministral 14B ($0.20/$0.20) son los más eficientes. Para 10,000 calls/mes a 1,800 tokens promedio: Mistral ~$11/mes, Devstral ~$5/mes vs ~$162/mes con Claude Sonnet 4.6.
Si tu agente requiere razonamiento (no solo tool calling)
Hermes 4 70B tiene "hybrid reasoning" — combina respuestas rápidas con modo razonamiento profundo cuando lo amerita. DeepSeek R1 es backup sólido si necesitás reasoning puro.
Si querés open-source para correr local + N8N self-hosted
Mistral Small 4 (Apache 2.0, 24B) cabe en hardware modesto y soporta tool calling OpenAI-compatible. Ministral 14B es alternativa también Apache 2.0. Para más detalles sobre setup local: modelos open-source local.
Si N8N corre en un servidor con poco budget
NVIDIA NIM ofrece 135+ modelos GRATIS con 40 RPM — más que suficiente para agentes con uso secuencial moderado. Modelos disponibles: Llama 3.3, Mistral Small, Nemotron Ultra.
Caso real: agente de Cristian para ecosistemastartup.com
Cristian Tala (autor del benchmark) usa N8N para automatizar la generación de contenido de su blog ecosistemastartup.com. El agente investiga noticias del ecosistema startup chileno/latinoamericano, sintetiza y genera borradores. Modelo en producción: Qwen 3.5 397B Cloud via Ollama Cloud (incluido en suscripción ~$30/mes, sin costo por call).
Por qué no eligió uno del top 5 del benchmark global: el caso de uso es contenido largo en español sobre actualidad, donde Qwen 3.5 supera en context preservation y tono natural. Lección: el ranking global es referencia, pero validá en tu caso real.
Preguntas frecuentes
¿Cómo configuro un modelo del benchmark en N8N?
N8N tiene nodo 'OpenAI Chat Model' — usa cualquier endpoint OpenAI-compatible. Configurá: baseURL: https://openrouter.ai/api/v1 (o Groq, NVIDIA NIM, Ollama Cloud), tu API key y el model del benchmark. Ejemplo: mistralai/mistral-small-2603.
¿Qué pasa si el modelo open-source que elijo deja de funcionar?
Modelos open-source en OpenRouter pueden deprecar. Estrategia: tener un fallback configurado. N8N permite chains con if/error — primer modelo Mistral Small 4, fallback a Llama 3.3 Groq, fallback final a GPT-4.1.
¿Tool calling funciona igual en todos los modelos del benchmark?
No. Tool calling es OpenAI-compatible en mayoría pero la robustez varía. El benchmark mide esto como badge; los del top 10 de agentes tienen tool calling testado robusto.
¿Cuánto cuesta correr un agente N8N con 1000 calls/día?
Asumiendo 300 input + 1500 output tokens promedio (~30K calls/mes): Llama 3.3 Groq ~$25/mes, Mistral Small 4 ~$32/mes, Ministral 14B ~$15/mes, Claude Sonnet 4.6 ~$162/mes. El benchmark es la diferencia entre $15 y $162 por la misma calidad práctica.
¿Debería usar un modelo distinto por nodo en N8N?
Sí, es buena práctica. Routing/clasificación con Gemini Flash Lite (rápido, barato), generación con Llama 3.3 Groq, validación final con GPT-4.1 si es crítico. Stack híbrido suele superar al single-modelo en costo y calidad.
Probá la calculadora con tu caso real
Filtrá por presupuesto mensual, calidad mínima, velocidad requerida y tipo de tarea. En 30 segundos encontrás el mejor para vos.
Ir a la calculadora →