Modelos IA open-source para correr local: comparativa por hardware (Junio 2026)
Correr modelos local te da: cero costos por call, privacidad total de datos, y latencia sin red. Pero la pregunta correcta no es "qué modelo es el mejor" sino "qué modelo cabe en mi hardware y rinde para mi caso". Esta página cruza el benchmark con requisitos de RAM/VRAM reales para Mac M-series, NVIDIA DGX Spark, GPUs dedicadas y servers.
⚠️ Importante: "open-source" tiene matices. Apache 2.0 (Mistral, Devstral, Qwen base, DeepSeek) podés usar comercialmente sin restricción. Llama tiene cláusulas (limitada para 700M+ MAU). Verificá la licencia para tu caso comercial.
Mejores modelos open-source por hardware
Mac M2/M3/M4 con 16GB RAM
| Modelo | Quant | Score | License | Notas |
|---|---|---|---|---|
| Ministral 14B (24B) | Q4_K_M (~14GB) | 7.95 | Apache 2.0 | Tight pero corre |
| Mistral Small 4 (24B) | Q4_K_M (~14GB) | 7.62 | Apache 2.0 | Mejor calidad/tamaño |
| DeepSeek V4 Flash (236B/21B activos) | Q4_K_M (~140GB) | 8.28* | MIT | * Score cloud, no cabe en 16GB |
| Phi-4 (14B) | Q4_K_M (~9GB) | — | MIT | Excelente para judge tasks |
Mac M-series 32GB RAM
| Modelo | Quant | Score | License | Notas |
|---|---|---|---|---|
| Mistral Small 4 (24B) | Q5_K_M (~17GB) | 7.62 | Apache 2.0 | Top calidad/recursos |
| Qwen 3-Next 80B (Dic 2025) | Q5_K_M (~22GB) | — | Apache 2.0 | Coding profesional |
| Qwen 3.6 35B base | Q4_K_M (~22GB) | 7.32 | Apache 2.0 | Versatil |
| Llama 3.3 70B | Q3_K_M (~30GB) | 7.70* | Llama 3 | * Score con Groq, no local |
NVIDIA DGX Spark (128GB unified) o servers GPU 80GB+
| Modelo | Quant | Score | License | Notas |
|---|---|---|---|---|
| DeepSeek V4 Flash | Q4_K_M (~140GB) | 8.28 | MIT | Top open-source large |
| Qwen 3.6 35B base | Q5_K_M (~25GB) | 7.32 | Apache 2.0 | Balance calidad/tamaño |
| Llama 3.3 70B | Q5_K_M (~50GB) | 7.70* | Llama 3 | * Score Groq, local más lento |
| Nemotron Ultra 253B | Q4_K_M (~150GB) | — | Open weights | Demasiado grande para Spark |
¿Qué modelo elegir según tu caso local?
Privacidad de datos crítica (LegalTech, HealthTech)
Mistral Small 4 (Apache 2.0) cubre el 80% de casos sin que ningún byte salga de tu hardware. Para modelos más grandes con alguna privacidad: DeepSeek V4 Flash en DGX Spark o server GPU.
Coding offline para tus proyectos
Ministral 14B (24B Apache 2.0) en Mac M-series 16GB+. Para proyectos grandes: Qwen 3-Next 80B en 32GB+. Ambos optimizados para código.
Generación de contenido en español sin API costs
Qwen 3.6 35B base (Apache 2.0) en Mac M-series. Para mejor calidad y hardware potente: Qwen 3.5 397B Cloud via Ollama Cloud (incluido en suscripción ~$30/mes sin costo per call). Caso real: Cristian usa este último para ecosistemastartup.com.
Agente N8N self-hosted
Mistral Small 4 via Ollama (puerto 11434) — N8N apunta su nodo OpenAI Chat al
localhost:11434/v1. Cero latencia de red, cero costo per call. Detalles en
modelos para N8N.
LLM-as-Judge / evaluación de outputs
Phi-4 (Microsoft, 14B, MIT) — exactamente lo que usa este benchmark como juez. Cero conflicto de interés (no es de ningún proveedor evaluado), cabe en 9GB y la rúbrica está en español publicada en el repo.
Preguntas frecuentes
¿Cómo instalo Ollama y descargo un modelo?
Mac/Linux: curl -fsSL https://ollama.com/install.sh | sh. Después ollama pull mistral-small:24b-instruct-2503-q5_K_M. Para correr: ollama run mistral-small. API OpenAI-compatible expuesta en http://localhost:11434/v1.
¿Qué pasa con la velocidad local vs API?
Local en Mac M3 Max ~30-50 tok/s, en M4 Max ~50-70 tok/s. Comparado con Groq (240+ tok/s) o Gemini Flash (145+ tok/s) es mucho más lento. Pero la latencia de primer token (TTFT) local es 0ms vs ~200-500ms del API — para chat conversacional la sensación es similar.
¿Open-source local sirve para producción comercial?
Sí, con Apache 2.0/MIT (Mistral, Devstral, Qwen base, DeepSeek, Phi-4). Llama 3 tiene cláusula de >700M MAU pero para 99% de startups latinas no es problema. Verificá siempre la licencia del modelo específico antes de comercializar.
¿NVIDIA DGX Spark vale la pena para emprendedores?
Depende del volumen. DGX Spark (~$3,000) cuesta ~$80/mes amortizado a 3 años. Si tu uso de API es >$80/mes Y los datos son sensibles, sí. Si es <$50/mes, OpenRouter sigue ganando.
¿Quantization Q3 vs Q4 vs Q5 — cuánto pierdo?
Q5_K_M: pérdida casi imperceptible (~1-2% en métricas). Q4_K_M: pérdida ~3-5%, balance recomendado. Q3_K_M: pérdida 8-15%, sólo si necesitás meter el modelo en RAM justa. Para casos comerciales, mantenete en Q4 o Q5.
¿Cómo combino modelos local con APIs cuando local no alcanza?
Pattern de 'fallback chain': tu app intenta local primero (Ollama), si timeout o error cae a API (OpenRouter, Groq). N8N permite esto con nodos If/Error. Ahorra costos en 80% de casos y mantiene robustez.
Probá la calculadora con tu caso real
Filtrá por presupuesto mensual, calidad mínima, velocidad requerida y tipo de tarea. En 30 segundos encontrás el mejor para vos.
Ir a la calculadora →