# AI Model Benchmark — alternativas (benchmarks.cristiantala.com) > Benchmark abierto de 217 modelos de IA (LLMs) catalogados, 167 testeados y 68.000+ runs reales, pensado para emprendedores hispanohablantes. Mide calidad, costo, velocidad, tool calling y capacidad agéntica en español, con LLM-as-Judge local (Phi-4, Microsoft). El score global v4.15.0 es ponderado (calidad 70% + costo 15% + velocidad 7,5% + latencia 7,5%); tool calling es insignia aparte (no entra en el score global): mide valor para producción, no capacidad bruta. Datos abiertos, en español neutro. ## Calculadora y datos - [Calculadora interactiva de modelos](https://benchmarks.cristiantala.com/): filtra 100+ modelos por presupuesto, calidad y tarea. - [Datos abiertos y metodología (GitHub)](https://github.com/ctala/ai-benchmarks-alternativos): código, resultados JSON y tests. ## Rankings y alternativas por caso de uso - [Alternativas a ChatGPT en 2026: 10 modelos comparados con benchmark real](https://benchmarks.cristiantala.com/alternativas-chatgpt/): ¿Buscas alternativas a ChatGPT/GPT-4/GPT-5 para agentes, coding o contenido en español? Comparamos 10 modelos con 68,000+ tests reales: DeepSeek, Claude, Llama, Devstral, Gemini, Mistral, Qwen y más. Datos abiertos. - [Alternativas a Claude en 2026: 10 modelos comparados con benchmark real](https://benchmarks.cristiantala.com/alternativas-claude/): ¿Buscas alternativas a Claude por precio o por el cambio en la suscripción Pro? Comparamos 10 modelos con 68,000+ tests reales: DeepSeek, Devstral, Mistral, Llama, GPT-OSS, Gemini, Qwen y más. Datos abiertos. - [Alternativas a DeepSeek 2026: 10 modelos con benchmark](https://benchmarks.cristiantala.com/alternativas-deepseek/): Ranking de alternativas a DeepSeek con datos reales. 217 modelos, 167 testeados, 68,000+ tests. Filtra por calidad, costo y velocidad. - [Alternativas a Gemini en 2026: 10 modelos comparados con benchmark real](https://benchmarks.cristiantala.com/alternativas-gemini/): ¿Buscas alternativas a Gemini 2.5/3.1 Flash, Flash Lite o Pro de Google? Comparamos 10 modelos con 68,000+ tests reales: DeepSeek, Claude, GPT, Llama, Devstral, Mistral, Qwen y más. Datos abiertos en español. - [LLM más baratos en 2026 (con buena calidad): ranking con benchmark real](https://benchmarks.cristiantala.com/mejor-llm-barato/): LLM más baratos con buena calidad (2026) con 68.000+ runs reales: ranking por presupuesto ajustado (mejor relación calidad/precio para volumen real). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Qwen 3.7 Flash. - [Mejor LLM open source en 2026: ranking con benchmark real](https://benchmarks.cristiantala.com/mejor-llm-open-source/): Mejor LLM open source (2026) con 68.000+ runs reales: ranking por open source (pesos abiertos — corres local o en cualquier provider, sin lock-in). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Gemma 4 31B. - [Mejor LLM para JSON estructurado en 2026: ranking con benchmark](https://benchmarks.cristiantala.com/mejor-llm-para-json/): Mejor LLM para emitir JSON válido (2026) con 68.000+ runs reales: ranking por emitir JSON que parsea a la primera y respeta el schema pedido. Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Gemini 3.5 Flash Lite. - [Mejor LLM para N8N y agentes en 2026: ranking con benchmark real](https://benchmarks.cristiantala.com/mejor-llm-para-n8n/): Mejor LLM para N8N y agentes (2026) con 68.000+ runs reales: ranking por agentes y operaciones (multi-turno largo, tool calling y flujos tipo N8N / Hermes). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Claude Sonnet 4.6. - [Mejor LLM para agentes y automatizaciones en 2026: ranking con benchmark](https://benchmarks.cristiantala.com/mejor-llm-para-agentes/): Mejor LLM para agentes y automatizaciones (2026) con 68.000+ runs reales: ranking por agentes y operaciones (multi-turno, tool calling y orquestación de flujos). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Claude Sonnet 4.6. - [Mejor LLM para contenido en español en 2026: ranking con benchmark real](https://benchmarks.cristiantala.com/mejor-llm-en-espanol/): Mejor LLM para contenido en español (2026) con 68.000+ runs reales: ranking por contenido y marketing en español neutro (blogs, copy y textos largos, no traducción del inglés). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Claude Fable 5. - [Mejor LLM para contenido y marketing en 2026: ranking con benchmark real](https://benchmarks.cristiantala.com/mejor-llm-para-contenido/): Mejor LLM para contenido y marketing (2026) con 68.000+ runs reales: ranking por contenido y marketing (blogs, copy, newsletters y textos largos en español neutro). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Claude Fable 5. - [Mejor LLM para datos de clientes en 2026: resistencia a fuga](https://benchmarks.cristiantala.com/mejor-llm-seguro-datos-clientes/): Mejor LLM para manejar datos de clientes (2026) con 68.000+ runs reales: ranking por resistir que un usuario le saque datos o instrucciones con prompt injection. Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Muse Spark 1.2. - [Mejor LLM para datos exactos en 2026: ranking de precisión literal](https://benchmarks.cristiantala.com/mejor-llm-para-datos-exactos/): Mejor LLM para no equivocarse en un dato (2026) con 68.000+ runs reales: ranking por reproducir datos sin alterarlos: códigos, montos, identificadores, configuraciones. Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Nemotron 3.5 Lightning. - [Mejor LLM para programar en 2026: ranking con benchmark real](https://benchmarks.cristiantala.com/mejor-llm-para-programar/): Mejor LLM para programar (2026) con 68.000+ runs reales: ranking por coding (generar código, JSON estructurado y debugging en tareas reales). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Qwen 3.8 27B. - [Mejor LLM para razonamiento 2026: ranking con benchmark](https://benchmarks.cristiantala.com/mejor-llm-para-razonamiento/): Mejor LLM para razonamiento (2026) con 68.000+ runs reales: ranking por razonamiento (math, lógica y planning). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: MiniMax M3. - [Mejor LLM para resumir textos en 2026: ranking con benchmark](https://benchmarks.cristiantala.com/mejor-llm-para-resumir-textos/): Mejor LLM para resumir textos (2026) con 68.000+ runs reales: ranking por summarization (resumir textos largos sin perder información clave). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Gemini 3.5 Flash Lite. - [Mejor LLM para seguir instrucciones en 2026: ranking de adherencia](https://benchmarks.cristiantala.com/mejor-llm-para-seguir-instrucciones/): Mejor LLM para seguir instrucciones al pie de la letra (2026) con 68.000+ runs reales: ranking por hacer exactamente lo que se pidió, ni más ni menos. Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Granite 4.2 8B. - [Mejor LLM para tareas multi-paso en 2026: ranking por horizonte largo](https://benchmarks.cristiantala.com/mejor-llm-para-tareas-largas/): Mejor LLM para tareas largas y multi-paso (2026) con 68.000+ runs reales: ranking por tareas multi-paso donde el modelo tiene que sostener el hilo (8-12 turnos). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: GPT-5.6 Luna. - [Mejor LLM para tool calling en 2026: ranking con benchmark real](https://benchmarks.cristiantala.com/mejor-llm-para-tool-calling/): Mejor LLM para tool calling (2026) con 68.000+ runs reales: ranking por tool calling (llamada correcta de funciones y estructura JSON fiable). Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Mercury 2.5. - [Mejor LLM que no inventa herramientas en 2026: ranking adversarial](https://benchmarks.cristiantala.com/mejor-llm-que-no-inventa-herramientas/): Mejor LLM que NO inventa herramientas (2026) con 68.000+ runs reales: ranking por resistir la tentación de llamar una herramienta que no existe o que no corresponde. Incluye costos para volumen, análisis del top 3 y posición de modelos frontier. #1: Qwen 3.5 35B. - [Mejores modelos IA para agentes N8N: comparativa con benchmark real (2026)](https://benchmarks.cristiantala.com/modelos-n8n/): Qué modelo IA usar en tu agente N8N: 10 modelos comparados con tests reales de tool calling, JSON estructurado y workflows. Llama 3.3 Groq, Mistral Small 4, Devstral, Hermes 4 y más. Datos abiertos en español. - [Modelos IA baratos para emprendedores: mejores alternativas low-cost (2026)](https://benchmarks.cristiantala.com/modelos-baratos-emprendedores/): Modelos IA accesibles para emprendedores latinoamericanos: comparativa de los más baratos (<$1.00/M tokens) con calidad real. DeepSeek, Devstral, MiMo, Mistral, Llama, Gemini Lite y opciones gratis. - [Modelos IA open-source para correr local: comparativa por hardware (2026)](https://benchmarks.cristiantala.com/modelos-open-source-local/): ¿Qué modelo IA open-source correr local en Mac M-series, NVIDIA DGX Spark o GPU dedicada? Comparativa de Devstral, Mistral, Llama, Qwen, DeepSeek, GPT-OSS por RAM/VRAM con benchmark real de 68,000+ tests. ## Comparaciones de modelos (A vs B) - [Claude vs ChatGPT en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/claude-vs-chatgpt/): Claude vs ChatGPT (GPT) comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [DeepSeek vs ChatGPT en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/deepseek-vs-chatgpt/): DeepSeek vs ChatGPT (GPT) comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [DeepSeek vs Claude en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/deepseek-vs-claude/): DeepSeek vs Claude comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [DeepSeek vs Gemini en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/deepseek-vs-gemini/): DeepSeek vs Gemini comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [DiffusionGemma vs Gemma 4 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/diffusiongemma-vs-gemma-4/): DiffusionGemma vs Gemma 4 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Esta comparación se movió](https://benchmarks.cristiantala.com/grok-4.3-vs-gpt-5.5/) - [Fable 5 vs Claude Sonnet 4.6 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/fable-5-vs-claude-sonnet-4-6/): Claude Fable 5 vs Claude Sonnet 4.6 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Fable 5 vs DeepSeek R1 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/fable-5-vs-deepseek-r1/): Claude Fable 5 vs DeepSeek R1 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Fable 5 vs GPT-5.5 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/fable-5-vs-gpt-5-5/): Claude Fable 5 vs GPT-5.5 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Fable 5 vs GPT-5.6 Sol en 2026: los dos flagships premium, medidos](https://benchmarks.cristiantala.com/fable-5-vs-gpt-5-6-sol/): Claude Fable 5 vs GPT-5.6 Sol comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Fable 5 vs MiniMax M3 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/fable-5-vs-minimax-m3/): Claude Fable 5 vs MiniMax M3 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Fable 5 vs Opus 4.8 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/fable-5-vs-opus-4-8/): Claude Fable 5 vs Claude Opus 4.8 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GLM 5.2 vs Claude Opus 4.8 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/glm-5.2-vs-claude-opus-4-8/): GLM 5.2 vs Claude Opus 4.8 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GLM 5.2 vs GLM 5.1 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/glm-5.2-vs-glm-5.1/): GLM 5.2 vs GLM 5.1 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 Luna vs Claude Haiku 4.5 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-luna-vs-claude-haiku-4-5/): GPT-5.6 Luna vs Claude Haiku 4.5 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 Luna vs Sol en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-luna-vs-sol/): GPT-5.6 Luna vs GPT-5.6 Sol comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 Luna vs Terra en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-luna-vs-terra/): GPT-5.6 Luna vs GPT-5.6 Terra comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 Sol vs Claude Opus 4.8 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-sol-vs-claude-opus-4-8/): GPT-5.6 Sol vs Claude Opus 4.8 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 Terra vs Claude Sonnet 4.6 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-terra-vs-claude-sonnet-4-6/): GPT-5.6 Terra vs Claude Sonnet 4.6 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 Terra vs Sol en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-terra-vs-sol/): GPT-5.6 Terra vs GPT-5.6 Sol comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 vs Claude Fable 5 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-vs-fable-5/): GPT-5.6 vs Claude Fable 5 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 vs Claude Opus 4.8 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-vs-claude-opus-4-8/): GPT-5.6 vs Claude Opus 4.8 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 vs Claude Sonnet 4.6 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-vs-claude-sonnet-4-6/): GPT-5.6 vs Claude Sonnet 4.6 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 vs DeepSeek V4 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-vs-deepseek-v4/): GPT-5.6 vs DeepSeek V4 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 vs GPT-5.5 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-vs-gpt-5.5/): GPT-5.6 vs GPT-5.5 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 vs Gemini 3.5 Flash en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-vs-gemini-3.5-flash/): GPT-5.6 vs Gemini 3.5 Flash comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [GPT-5.6 vs MiniMax M3 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gpt-5.6-vs-minimax-m3/): GPT-5.6 vs MiniMax M3 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Gemini 3.5 Flash vs Gemini 2.5 Flash en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gemini-3.5-flash-vs-gemini-2.5-flash/): Gemini 3.5 Flash vs Gemini 2.5 Flash comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Gemini vs ChatGPT en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gemini-vs-chatgpt/): Gemini vs ChatGPT (GPT) comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Gemini vs Claude en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/gemini-vs-claude/): Gemini vs Claude comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Grok 4.20, 4.3 o 4.5: cuál usar en 2026 (benchmark real)](https://benchmarks.cristiantala.com/grok-4-1-vs-4-5/): Grok: comparamos sus 4 tiers con 68.000+ runs reales. Cuál conviene, cuánto cuesta cada uno al mes y en qué caso vale pagar el caro. - [Grok 4.3 vs GPT-5.5 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/grok-4.3-vs-gpt-5-5/): Grok 4.3 vs GPT-5.5 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Grok 4.5 vs Claude Sonnet 4.6 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/grok-4.5-vs-claude-sonnet-4-6/): Grok 4.5 vs Claude Sonnet 4.6 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Grok 4.5 vs GPT-5.6 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/grok-4.5-vs-gpt-5-6/): Grok 4.5 vs GPT-5.6 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Grok 4.5 vs Grok 4.3 en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/grok-4.5-vs-grok-4.3/): Grok 4.5 vs Grok 4.3 comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Grok vs ChatGPT en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/grok-vs-chatgpt/): Grok (xAI) vs ChatGPT (GPT) comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Grok vs Claude en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/grok-vs-claude/): Grok (xAI) vs Claude comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [MiniMax vs Kimi en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/minimax-vs-kimi/): MiniMax vs Kimi (Moonshot) comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Nemotron 3 Ultra vs DeepSeek V4 Flash en 2026: comparación con benchmark real](https://benchmarks.cristiantala.com/nemotron-3-ultra-vs-deepseek-v4-flash/): Nemotron 3 Ultra vs DeepSeek V4 Flash comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. - [Qwen vs Llama en 2026: comparación open source con benchmark real](https://benchmarks.cristiantala.com/qwen-vs-llama/): Qwen vs Llama comparados con 68.000+ runs reales: coding, contenido, razonamiento, agentes, costo y velocidad. Benchmark abierto en español. ## Otras páginas - [Claude: Haiku, Sonnet, Opus o Fable — cuál elegir en 2026 (benchmark real)](https://benchmarks.cristiantala.com/claude-haiku-sonnet-opus/): Claude: comparamos sus 9 tiers con 68.000+ runs reales. Cuál conviene, cuánto cuesta cada uno al mes y en qué caso vale pagar el caro. - [DeepSeek V4 Flash, R1 o Pro: cuál usar en 2026 (benchmark real)](https://benchmarks.cristiantala.com/deepseek-v4-flash-o-r1/): DeepSeek: comparamos sus 7 tiers con 68.000+ runs reales. Cuál conviene, cuánto cuesta cada uno al mes y en qué caso vale pagar el caro. - [Claude Fable 5: review con benchmark real (¿vale la pena en 2026?)](https://benchmarks.cristiantala.com/fable-5-review/): Review de Claude Fable 5 (línea Mythos de Anthropic) con datos reales: score 5.96, costo $10/$50 por millón, 213 runs. Comparado con Opus 4.8, Sonnet 4.6, MiniMax M3 y DeepSeek R1. - [Gemini Flash o Pro: cuál conviene en 2026 (benchmark real)](https://benchmarks.cristiantala.com/gemini-flash-o-pro/): Gemini: comparamos sus 10 tiers con 68.000+ runs reales. Cuál conviene, cuánto cuesta cada uno al mes y en qué caso vale pagar el caro. - [GLM 5.2: por qué su score no refleja su calidad real | Benchmark Septiembre 2026](https://benchmarks.cristiantala.com/glm-5.2-explicado/): GLM 5.2 tiene score compuesto 6.60 pero calidad 8.36 (#26 de 107 por calidad pura). Explicamos el gap, su debilidad en seguridad (1.45/10) y cuándo conviene usarlo. - [GPT-5.6: Luna, Terra o Sol — cuál elegir en 2026 (benchmark real)](https://benchmarks.cristiantala.com/gpt-5.6-luna-terra-sol/): GPT-5.6: comparamos sus 5 tiers con 68.000+ runs reales. Cuál conviene, cuánto cuesta cada uno al mes y en qué caso vale pagar el caro. - [MiniMax M2.7 o M3: cuál usar en 2026 (benchmark real)](https://benchmarks.cristiantala.com/minimax-m2-7-o-m3/): MiniMax: comparamos sus 3 tiers con 68.000+ runs reales. Cuál conviene, cuánto cuesta cada uno al mes y en qué caso vale pagar el caro. - [El mismo modelo rinde distinto según el proveedor (datos reales)](https://benchmarks.cristiantala.com/mismo-modelo-distinto-proveedor/): Medimos 25 modelos por más de un proveedor. 0 cambian ≥1 punto de calidad según por dónde los llames. Elegir el modelo es la mitad de la decisión. - [Claude Haiku 4.5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/claude-haiku-4.5/): Claude Haiku 4.5: 157 runs propios en español — calidad 8.21, $7.80 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Claude Opus 4.6: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/claude-opus-4.6/): Claude Opus 4.6: 213 runs propios en español — calidad 8.48, $39.00 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Claude Opus 4.7: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/claude-opus-4.7/): Claude Opus 4.7: 210 runs propios en español — calidad 8.39, $39.00 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Claude Opus 4.8: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/claude-opus-4.8/): Claude Opus 4.8: 165 runs propios en español — calidad 8.48, $39.00 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Claude Opus 5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/claude-opus-5/): Claude Opus 5: 472 runs propios en español — calidad 8.21, $39.00 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Claude Opus 5 Fast: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/claude-opus-5-fast/): Claude Opus 5 Fast: 451 runs propios en español — calidad 8.23, $78.00 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Claude Sonnet 4.6: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/claude-sonnet-4.6/): Claude Sonnet 4.6: 171 runs propios en español — calidad 8.12, $23.40 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Claude Sonnet 5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/claude-sonnet-5/): Claude Sonnet 5: 296 runs propios en español — calidad 8.31, $15.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [DeepSeek R1 (reasoning): benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/deepseek-r1/): DeepSeek R1 (reasoning): 158 runs propios en español — calidad 8.45, $3.96 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [DeepSeek V3.2: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/deepseek-v3/): DeepSeek V3.2: 270 runs propios en español — calidad 8.11, $1.62 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [DeepSeek V4 Flash (OpenRouter): benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/deepseek-v4-flash/): DeepSeek V4 Flash (OpenRouter): 168 runs propios en español — calidad 8.16, $0.292 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [DeepSeek V4 Flash 0731: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/deepseek-v4-flash-0731/): DeepSeek V4 Flash 0731: 143 runs propios en español — calidad 8.05, $0.198 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [DeepSeek V4 Pro: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/deepseek-v4-pro/): DeepSeek V4 Pro: 196 runs propios en español — calidad 8.22, $5.28 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [DeepSeek V4 Pro (0813): benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/deepseek-v4-pro-0813/): DeepSeek V4 Pro (0813): 435 runs propios en español — calidad 8.45, $4.72 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [DeepSeek V4.1 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/deepseek-v4.1-flash/): DeepSeek V4.1 Flash: 143 runs propios en español — calidad 8.44, $0.945 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Fugu Max: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/fugu-max/): Fugu Max: 143 runs propios en español — calidad 8.49, $9.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 3.1 Flash Lite: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-3.1-flash-lite/): Gemini 3.1 Flash Lite: 163 runs propios en español — calidad 8.09, $2.33 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 3.1 Pro: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-3.1-pro/): Gemini 3.1 Pro: 143 runs propios en español — calidad 7.48, $18.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 3.5 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-3.5-flash/): Gemini 3.5 Flash: 166 runs propios en español — calidad 7.51, $13.95 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 3.5 Flash Lite: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-3.5-flash-lite/): Gemini 3.5 Flash Lite: 143 runs propios en español — calidad 8.23, $3.84 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 3.6 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-3.6-flash/): Gemini 3.6 Flash: 234 runs propios en español — calidad 8.30, $5.85 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 3.7 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-3.7-flash/): Gemini 3.7 Flash: 506 runs propios en español — calidad 8.30, $5.85 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 3.8 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-3.8-flash/): Gemini 3.8 Flash: 143 runs propios en español — calidad 8.26, $5.85 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 2.5 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-flash/): Gemini 2.5 Flash: 162 runs propios en español — calidad 8.08, $3.84 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 2.5 Flash Lite: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-flash-lite/): Gemini 2.5 Flash Lite: 153 runs propios en español — calidad 7.84, $0.630 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemini 2.5 Pro: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemini-pro/): Gemini 2.5 Pro: 179 runs propios en español — calidad 7.68, $15.38 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemma 4 26B MoE (3.8B activos): benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gemma-4-26b/): Gemma 4 26B MoE (3.8B activos): 155 runs propios en español — calidad 8.34, $0.477 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GLM-5.1: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/glm-5.1/): GLM-5.1: 173 runs propios en español — calidad 8.36, $4.84 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GLM 5.2: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/glm-5.2/): GLM 5.2: 154 runs propios en español — calidad 8.36, $3.43 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GLM 5.3: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/glm-5.3/): GLM 5.3: 193 runs propios en español — calidad 8.52, $7.02 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GLM 5.3 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/glm-5.3-flash/): GLM 5.3 Flash: 143 runs propios en español — calidad 8.51, $0.795 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-4.1: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gpt-4.1/): GPT-4.1: 163 runs propios en español — calidad 8.15, $12.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-4.1 Mini: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gpt-4.1-mini/): GPT-4.1 Mini: 162 runs propios en español — calidad 7.91, $2.52 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-5.4: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gpt-5.4/): GPT-5.4: 148 runs propios en español — calidad 8.39, $24.00 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-5.4 Mini: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gpt-5.4-mini/): GPT-5.4 Mini: 154 runs propios en español — calidad 8.17, $2.40 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-5.5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gpt-5.5/): GPT-5.5: 653 runs propios en español — calidad 8.15, $46.50 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-5.6 Luna: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gpt-5.6-luna/): GPT-5.6 Luna: 162 runs propios en español — calidad 8.52, $1.86 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-5.6 Sol: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gpt-5.6-sol/): GPT-5.6 Sol: 165 runs propios en español — calidad 8.28, $15.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-5.6 Terra: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/gpt-5.6-terra/): GPT-5.6 Terra: 150 runs propios en español — calidad 8.31, $18.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Granite 4.2 8B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/granite-4.2-8b/): Granite 4.2 8B: 143 runs propios en español — calidad 8.34, $0.393 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Grok 4.20: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/grok-4.20/): Grok 4.20: 146 runs propios en español — calidad 7.70, $4.12 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Grok 4.3: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/grok-4.3/): Grok 4.3: 167 runs propios en español — calidad 7.77, $4.12 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Grok 4.5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/grok-4.5/): Grok 4.5: 157 runs propios en español — calidad 8.12, $9.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Grok 4.6: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/grok-4.6/): Grok 4.6: 143 runs propios en español — calidad 8.27, $9.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Hermes 4 405B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/hermes-4-405b/): Hermes 4 405B: 478 runs propios en español — calidad 8.26, $4.80 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Hermes 4 70B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/hermes-4-70b/): Hermes 4 70B: 487 runs propios en español — calidad 7.78, $0.639 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Tencent Hy4 preview: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/hy4-preview/): Tencent Hy4 preview: 143 runs propios en español — calidad 8.39, $4.00 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Inkling Small: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/inkling-small/): Inkling Small: 143 runs propios en español — calidad 8.43, $1.94 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [KAT Coder Air v2.5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/kat-coder-air-2.5/): KAT Coder Air v2.5: 497 runs propios en español — calidad 8.13, $0.945 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [KAT Coder Pro v2.5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/kat-coder-pro-2.5/): KAT Coder Pro v2.5: 262 runs propios en español — calidad 7.83, $4.66 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Kimi K2: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/kimi-k2/): Kimi K2: 180 runs propios en español — calidad 8.11, $3.62 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Kimi K2.6: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/kimi-k2.6/): Kimi K2.6: 219 runs propios en español — calidad 8.30, $6.29 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Kimi K2.7 Code: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/kimi-k2.7-code/): Kimi K2.7 Code: 157 runs propios en español — calidad 8.06, $5.46 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Kimi K3: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/kimi-k3/): Kimi K3: 143 runs propios en español — calidad 8.06, $20.72 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Poolside Laguna S 2.1: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/laguna-s-2.1/): Poolside Laguna S 2.1: 143 runs propios en español — calidad 7.89, $0.297 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Poolside Laguna XS 2.1: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/laguna-xs-2.1/): Poolside Laguna XS 2.1: 143 runs propios en español — calidad 8.26, $0.198 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Ling 3.0 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/ling-3.0-flash/): Ling 3.0 Flash: 143 runs propios en español — calidad 7.98, $0.101 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Llama 4 Maverick: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/llama-4-maverick/): Llama 4 Maverick: 157 runs propios en español — calidad 7.95, $1.10 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Mercury 2.5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/mercury-2.5/): Mercury 2.5: 143 runs propios en español — calidad 8.24, $0.237 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [MiMo-V2.5 (omnimodal): benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/mimo-v2.5-or/): MiMo-V2.5 (omnimodal): 163 runs propios en español — calidad 8.10, $0.462 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [MiMo-V2.5 Pro: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/mimo-v2.5-pro-or/): MiMo-V2.5 Pro: 157 runs propios en español — calidad 8.17, $1.44 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [MiniMax M2.7: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/minimax-m2.7/): MiniMax M2.7: 217 runs propios en español — calidad 7.83, $1.89 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [MiniMax M3: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/minimax-m3/): MiniMax M3: 230 runs propios en español — calidad 8.17, $1.89 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Mistral Large: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/mistral-large/): Mistral Large: 165 runs propios en español — calidad 7.99, $9.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Mistral Small 4: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/mistral-small-4/): Mistral Small 4: 150 runs propios en español — calidad 8.03, $0.945 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Muse Glimmer 30B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/muse-glimmer-30b/): Muse Glimmer 30B: 143 runs propios en español — calidad 8.23, $2.35 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Muse Spark 1.2: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/muse-spark-1.2/): Muse Spark 1.2: 143 runs propios en español — calidad 8.28, $6.75 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Muse Spark 1.3: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/muse-spark-1.3/): Muse Spark 1.3: 143 runs propios en español — calidad 8.29, $6.75 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Nemotron 3.5 Lightning: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/nemotron-3.5-lightning/): Nemotron 3.5 Lightning: 493 runs propios en español — calidad 7.74, $0.324 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Nemotron 3 Nano 30B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/nemotron-nano/): Nemotron 3 Nano 30B: 152 runs propios en español — calidad 7.69, $0.315 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Nemotron 3 Super: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/nemotron-super/): Nemotron 3 Super: 859 runs propios en español — calidad 7.91, $0.625 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Nex-N2-Mini: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/nex-n2-mini/): Nex-N2-Mini: 143 runs propios en español — calidad 8.13, $0.158 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Nemotron 3 Ultra 550B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/openrouter-nemotron-3-ultra-550b/): Nemotron 3 Ultra 550B: 161 runs propios en español — calidad 8.01, $3.78 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Claude Fable 5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-claude-fable-5/): Claude Fable 5: 213 runs propios en español — calidad 8.39, $78.00 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [DeepSeek V3: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-deepseek-v3/): DeepSeek V3: 154 runs propios en español — calidad 8.29, $0.681 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Gemma 4 31B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-gemma-4-31b/): Gemma 4 31B: 143 runs propios en español — calidad 8.48, $0.540 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GLM 5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-glm5/): GLM 5: 154 runs propios en español — calidad 8.42, $3.06 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-OSS 120B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-gpt-oss-120b/): GPT-OSS 120B: 154 runs propios en español — calidad 8.11, $0.281 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [GPT-OSS 20B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-gpt-oss-20b/): GPT-OSS 20B: 150 runs propios en español — calidad 7.91, $0.219 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Kimi K2.5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-kimi-k2.5/): Kimi K2.5: 14119 runs propios en español — calidad 8.14, $3.51 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Llama 3.1 8B Instant: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-llama-3.1-8b/): Llama 3.1 8B Instant: 155 runs propios en español — calidad 7.26, $0.135 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Llama 3.3 70B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-llama-3.3-70b/): Llama 3.3 70B: 160 runs propios en español — calidad 8.04, $0.510 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Llama 4 Scout 17B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-llama-4-scout/): Llama 4 Scout 17B: 148 runs propios en español — calidad 7.88, $0.480 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [MiniMax M2.5: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-minimax-m2.5/): MiniMax M2.5: 152 runs propios en español — calidad 8.08, $1.70 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Ministral 14B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-ministral-14b/): Ministral 14B: 161 runs propios en español — calidad 8.11, $0.360 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Mistral Large 3 675B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-mistral-large-3/): Mistral Large 3 675B: 152 runs propios en español — calidad 8.26, $2.40 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.5 35B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-qwen-3.5-35b/): Qwen 3.5 35B: 284 runs propios en español — calidad 8.07, $1.97 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3-Next 80B Instruct: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-qwen3-next-instruct/): Qwen 3-Next 80B Instruct: 157 runs propios en español — calidad 8.01, $1.68 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3-Next 80B Thinking: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-qwen3-next-thinking/): Qwen 3-Next 80B Thinking: 152 runs propios en español — calidad 7.59, $1.84 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.5 397B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-qwen3.5-397b/): Qwen 3.5 397B: 154 runs propios en español — calidad 7.80, $5.42 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Step 3.5 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/or-step-3.5-flash/): Step 3.5 Flash: 1140 runs propios en español — calidad 8.03, $0.480 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.6 Max: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen-3.6-max/): Qwen 3.6 Max: 173 runs propios en español — calidad 8.46, $9.55 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.6 Plus: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen-3.6-plus/): Qwen 3.6 Plus: 164 runs propios en español — calidad 8.20, $3.02 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.7 Max: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen-3.7-max/): Qwen 3.7 Max: 158 runs propios en español — calidad 8.24, $7.08 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.8 2.4T (A95B): benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen-3.8-2.4t/): Qwen 3.8 2.4T (A95B): 295 runs propios en español — calidad 8.41, $9.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.8 27B: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen-3.8-27b/): Qwen 3.8 27B: 690 runs propios en español — calidad 8.50, $3.89 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.8 Max: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen-3.8-max/): Qwen 3.8 Max: 295 runs propios en español — calidad 8.43, $9.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.8 Max 0902: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen-3.8-max-0902/): Qwen 3.8 Max 0902: 143 runs propios en español — calidad 8.46, $9.60 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen3 Coder: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen3-coder/): Qwen3 Coder: 162 runs propios en español — calidad 7.78, $1.59 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen3-Coder-Next (OpenRouter FP8): benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen3-coder-next/): Qwen3-Coder-Next (OpenRouter FP8): 180 runs propios en español — calidad 7.81, $1.23 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.6 27B base (OpenRouter FP8): benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen3.6-27b/): Qwen 3.6 27B base (OpenRouter FP8): 182 runs propios en español — calidad 7.74, $3.09 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.6 35B base (OpenRouter FP8): benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen3.6-35b/): Qwen 3.6 35B base (OpenRouter FP8): 157 runs propios en español — calidad 7.82, $1.38 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.7 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen3.7-flash/): Qwen 3.7 Flash: 163 runs propios en español — calidad 8.49, $0.204 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Qwen 3.8 Flash: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/qwen3.8-flash/): Qwen 3.8 Flash: 823 runs propios en español — calidad 8.53, $0.750 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Seed 2.1 Turbo: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/seed-2-1-turbo/): Seed 2.1 Turbo: 1244 runs propios en español — calidad 8.25, $3.90 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Seed 2.0 Code: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/seed-2.0-code/): Seed 2.0 Code: 1570 runs propios en español — calidad 8.44, $4.65 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Solar Pro 4: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/solar-pro4/): Solar Pro 4: 143 runs propios en español — calidad 8.04, $0.567 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. - [Tencent Hy3: benchmark real en español (2026)](https://benchmarks.cristiantala.com/modelo/tencent-hy3/): Tencent Hy3: 143 runs propios en español — calidad 8.49, $0.832 por 1.000 llamadas. Para qué sirve de verdad en un negocio chico, y cuándo conviene otro. ## Sobre el autor - [Cristian Tala](https://cristiantala.com): founder; mantiene este benchmark abierto. - [Comunidad Cágala, Aprende, Repite](https://www.skool.com/cagala-aprende-repite/about): emprendimiento + IA en español.