Modelos IA open-source para correr local: comparativa por hardware (Junio 2026)

Correr modelos local te da: cero costos por call, privacidad total de datos, y latencia sin red. Pero la pregunta correcta no es "qué modelo es el mejor" sino "qué modelo cabe en mi hardware y rinde para mi caso". Esta página cruza el benchmark con requisitos de RAM/VRAM reales para Mac M-series, NVIDIA DGX Spark, GPUs dedicadas y servers.

⚠️ Importante: "open-source" tiene matices. Apache 2.0 (Mistral, Devstral, Qwen base, DeepSeek) podés usar comercialmente sin restricción. Llama tiene cláusulas (limitada para 700M+ MAU). Verificá la licencia para tu caso comercial.

Última actualización: 2026-07-15 · datos abiertos en GitHub

Mejores modelos open-source por hardware

Mac M2/M3/M4 con 16GB RAM

ModeloQuantScoreLicenseNotas
Ministral 14B (24B)Q4_K_M (~14GB)7.95Apache 2.0Tight pero corre
Mistral Small 4 (24B)Q4_K_M (~14GB)7.62Apache 2.0Mejor calidad/tamaño
DeepSeek V4 Flash (236B/21B activos)Q4_K_M (~140GB)8.28*MIT* Score cloud, no cabe en 16GB
Phi-4 (14B)Q4_K_M (~9GB)MITExcelente para judge tasks

Mac M-series 32GB RAM

ModeloQuantScoreLicenseNotas
Mistral Small 4 (24B)Q5_K_M (~17GB)7.62Apache 2.0Top calidad/recursos
Qwen 3-Next 80B (Dic 2025)Q5_K_M (~22GB)Apache 2.0Coding profesional
Qwen 3.6 35B baseQ4_K_M (~22GB)7.32Apache 2.0Versatil
Llama 3.3 70BQ3_K_M (~30GB)7.70*Llama 3* Score con Groq, no local

NVIDIA DGX Spark (128GB unified) o servers GPU 80GB+

ModeloQuantScoreLicenseNotas
DeepSeek V4 FlashQ4_K_M (~140GB)8.28MITTop open-source large
Qwen 3.6 35B baseQ5_K_M (~25GB)7.32Apache 2.0Balance calidad/tamaño
Llama 3.3 70BQ5_K_M (~50GB)7.70*Llama 3* Score Groq, local más lento
Nemotron Ultra 253BQ4_K_M (~150GB)Open weightsDemasiado grande para Spark

Score = del benchmark cloud. Local con misma quantization da scores similares pero menor velocidad.

¿Qué modelo elegir según tu caso local?

Privacidad de datos crítica (LegalTech, HealthTech)

Mistral Small 4 (Apache 2.0) cubre el 80% de casos sin que ningún byte salga de tu hardware. Para modelos más grandes con alguna privacidad: DeepSeek V4 Flash en DGX Spark o server GPU.

Coding offline para tus proyectos

Ministral 14B (24B Apache 2.0) en Mac M-series 16GB+. Para proyectos grandes: Qwen 3-Next 80B en 32GB+. Ambos optimizados para código.

Generación de contenido en español sin API costs

Qwen 3.6 35B base (Apache 2.0) en Mac M-series. Para mejor calidad y hardware potente: Qwen 3.5 397B Cloud via Ollama Cloud (incluido en suscripción ~$30/mes sin costo per call). Caso real: Cristian usa este último para ecosistemastartup.com.

Agente N8N self-hosted

Mistral Small 4 via Ollama (puerto 11434) — N8N apunta su nodo OpenAI Chat al localhost:11434/v1. Cero latencia de red, cero costo per call. Detalles en modelos para N8N.

LLM-as-Judge / evaluación de outputs

Phi-4 (Microsoft, 14B, MIT) — exactamente lo que usa este benchmark como juez. Cero conflicto de interés (no es de ningún proveedor evaluado), cabe en 9GB y la rúbrica está en español publicada en el repo.

Preguntas frecuentes

¿Cómo instalo Ollama y descargo un modelo?

Mac/Linux: curl -fsSL https://ollama.com/install.sh | sh. Después ollama pull mistral-small:24b-instruct-2503-q5_K_M. Para correr: ollama run mistral-small. API OpenAI-compatible expuesta en http://localhost:11434/v1.

¿Qué pasa con la velocidad local vs API?

Local en Mac M3 Max ~30-50 tok/s, en M4 Max ~50-70 tok/s. Comparado con Groq (240+ tok/s) o Gemini Flash (145+ tok/s) es mucho más lento. Pero la latencia de primer token (TTFT) local es 0ms vs ~200-500ms del API — para chat conversacional la sensación es similar.

¿Open-source local sirve para producción comercial?

Sí, con Apache 2.0/MIT (Mistral, Devstral, Qwen base, DeepSeek, Phi-4). Llama 3 tiene cláusula de >700M MAU pero para 99% de startups latinas no es problema. Verificá siempre la licencia del modelo específico antes de comercializar.

¿NVIDIA DGX Spark vale la pena para emprendedores?

Depende del volumen. DGX Spark (~$3,000) cuesta ~$80/mes amortizado a 3 años. Si tu uso de API es >$80/mes Y los datos son sensibles, sí. Si es <$50/mes, OpenRouter sigue ganando.

¿Quantization Q3 vs Q4 vs Q5 — cuánto pierdo?

Q5_K_M: pérdida casi imperceptible (~1-2% en métricas). Q4_K_M: pérdida ~3-5%, balance recomendado. Q3_K_M: pérdida 8-15%, sólo si necesitás meter el modelo en RAM justa. Para casos comerciales, mantenete en Q4 o Q5.

¿Cómo combino modelos local con APIs cuando local no alcanza?

Pattern de 'fallback chain': tu app intenta local primero (Ollama), si timeout o error cae a API (OpenRouter, Groq). N8N permite esto con nodos If/Error. Ahorra costos en 80% de casos y mantiene robustez.

Probá la calculadora con tu caso real

Filtrá por presupuesto mensual, calidad mínima, velocidad requerida y tipo de tarea. En 30 segundos encontrás el mejor para vos.

Ir a la calculadora →

Ver también: alternativas a Claude · alternativas a ChatGPT · alternativas a Gemini · modelos para N8N