Gemini: ¿Flash o Pro?
Google vende Pro como el tier serio y Flash como el barato. Los medimos a todos con la misma suite. El resultado no es el que sugiere el precio.
La respuesta corta
El tier de más calidad es 3.7 Flash. Y el más caro cuesta 30× lo que el más barato.
Costos a 3.000 llamadas/mes (≈100 por día). Ajústalo a tu volumen en la calculadora. Y baja un poco: hay un caso donde el caro sí vale la pena, y no es el que te venden.
Los 9 tiers, uno al lado del otro
| Tier | Calidad | Coding | Contenido | Razon. | Agentes | Costo/mes | Latencia | Score |
|---|---|---|---|---|---|---|---|---|
| 2.5 Flash Lite ← el más barato | 7.84 | 9.0 | 7.9 | 7.3 | 7.2 | ≈$2/mes | 5.3s | 4.78 |
| 3.1 Flash Lite | 8.09 | 9.1 | 8.5 | 8.0 | 7.1 | ≈$7/mes | 4.1s | 6.32 |
| 3.7 Flash | 8.30 | 9.8 | 8.5 | 8.0 | 7.3 | ≈$9/mes | 14.9s | 6.81 |
| 3.5 Flash Lite | 8.23 | 9.7 | 8.3 | 7.9 | 7.5 | ≈$12/mes | 4.6s | 7.09 |
| 2.5 Flash | 8.08 | 8.8 | 8.3 | 7.4 | 7.9 | ≈$12/mes | 11.7s | 5.67 |
| 3.6 Flash | 8.30 | 9.8 | 8.7 | 7.9 | 7.3 | ≈$18/mes | 12.7s | 6.71 |
| 3.5 Flash | 7.51 | 7.3 | 7.9 | 6.9 | 7.7 | ≈$42/mes | 12.8s | 1.87 |
| 2.5 Pro | 7.68 | 8.3 | 7.8 | 7.1 | 7.7 | ≈$46/mes | 47.9s | 2.31 |
| 3.1 Pro | 7.48 | 7.3 | 7.7 | 7.1 | 7.3 | ≈$56/mes | 24.3s | 1.28 |
3.1 Pro cuesta 30 veces más que 2.5 Flash Lite y no gana en ninguna categoría. La escalera de precios no está comprada con calidad: está comprada con otra cosa (contexto, límites de uso, prioridad en cola).
| Qué le pedís | 2.5 Flash Lite$0.63 | 3.1 Flash Lite$2.33 | 3.7 Flash$2.93 | 3.5 Flash Lite$3.84 | 2.5 Flash$3.84 | 3.6 Flash$5.85 | 3.5 Flash$13.95 | 2.5 Pro$15.38 | 3.1 Pro$18.60 | ¿El precio compra algo? |
|---|---|---|---|---|---|---|---|---|---|---|
| Auditar un negocioEncontrar el error en un P&L, la causalidad falsa, la métrica envenenada | 6.45 | 6.80 | 8.07 | 7.17 | 6.45 | 7.76 | 8.40 | 8.00 | 8.40 | Empatan 3.5 Flash y 3.1 Pro |
| PlanificarArmar un plan cuya aritmética cierre y respete las restricciones | 9.20 | 9.20 | 8.93 | 9.20 | 9.20 | 9.07 | 9.20 | 9.20 | 9.20 | Empatan arriba 7 de 9 |
| Escribir con restriccionesNo repetir el dato falso del brief, no meter el CTA prohibido | 7.20 | 9.33 | 8.13 | 7.07 | 7.33 | 8.89 | 9.33 | 9.33 | 9.33 | Empatan arriba 4 de 9 |
| Razonamiento profundoMatemática, lógica formal, estimaciones Fermi | 6.99 | 8.33 | 6.20 | 7.18 | 7.36 | 6.53 | 3.17 | 5.28 | 3.17 | Gana 3.1 Flash Lite |
| CódigoGenerar y corregir código que funcione | 8.88 | 8.96 | 9.52 | 9.39 | 8.67 | 9.40 | 6.92 | 7.09 | 7.25 | Gana 3.7 Flash |
| Agentes largosMantener el hilo y las restricciones a lo largo de muchos turnos | 7.83 | 8.33 | 9.81 | 9.28 | 8.92 | 9.37 | 9.29 | 8.40 | 7.96 | Gana 3.7 Flash |
| Multi-turnoConversaciones de ida y vuelta sin perder el contexto | 7.21 | 8.00 | 7.17 | 7.83 | 8.00 | 6.92 | 8.50 | 6.88 | 7.50 | Gana 3.5 Flash |
Cómo leer esto sin equivocarte
Que dos tiers empaten no significa que sean idénticos: significa que esta medición no los distingue. Con 103 corridas, cada número tiene un margen alrededor; cuando ese margen se solapa, la diferencia que ves es ruido, no señal. Si volviera a correr el test mañana, el orden podría darse vuelta sin que nada haya cambiado en los modelos.
La consecuencia práctica es simple: si la calidad empata, la decisión es de precio y de velocidad. Y si el proveedor quiere que pagues más, que te diga exactamente qué compras — con su margen de error al lado.
Antes de migrar, haz esto
Ya sabes cuál gana en el papel. No lo cambies a ciegas: toma el mejor de cada familia y pásales cinco prompts reales tuyos, de los que ya corres en producción. Una comparación general te dice quién arranca adelante; tu caso decide quién gana. Son veinte minutos y te ahorran una migración equivocada.
Y una advertencia: este resultado se recalcula con cada lote de modelos nuevos. Como el score de cada modelo es relativo a todos los demás, un modelo nuevo mueve a todos. El ganador de hoy puede no serlo el mes que viene.
Cada vez que corro un lote nuevo, publico el recálculo ahí — con los datos crudos y lo que cambió de lugar. Es también donde hay gente tomando esta misma decisión. Entrar es gratis.
¿Qué mide este benchmark?
No es un benchmark académico (para eso están MMLU, HumanEval o SWE-bench). Es un benchmark aplicado para emprendedores hispanohablantes: mide qué modelo conviene poner en producción para casos reales, con lo que los benchmarks oficiales no cubren — costo en provider real, velocidad, español neutro y agentes multi-turno.
Contamos con 207 modelos catalogados, 157 testeados y 65.000+ runs reales evaluados por un LLM-as-Judge local (Phi-4, de Microsoft — sin conflicto de interés), en 4 pilares:
- Coding — generar código, JSON estructurado y debugging en tareas reales (plugins WordPress, scripts, templates de N8N).
- Contenido y marketing — blogs, copy y textos largos en español neutro (no traducción del inglés).
- Razonamiento — matemáticas, lógica formal y planificación multi-paso.
- Agentes y operaciones — multi-turno largo, tool calling y flujos tipo N8N / Hermes.
Dos números distintos, no los confundas. Las tablas por tarea de esta página se ordenan por calidad en esa tarea: capacidad pura, sin mezclar precio. Es la respuesta a "¿quién lo hace mejor?".
El score global es otra cosa: una función ponderada (calidad 70% + costo 15% + velocidad 7,5% + latencia 7,5%) que responde "¿qué conviene poner en producción?". Ahí un modelo barato y rápido sí puede superar a uno más capaz pero caro. Los dos números sirven — para preguntas distintas.
Tool calling va como insignia aparte (no suma al score global): indica si el modelo soporta herramientas, no su calidad. Límite conocido: el juez es Phi-4 (14B) y varios modelos evaluados son más capaces que él — ordena bien, pero comprime las diferencias en la cima. Leé un empate como "el juez no los distingue", no como "son idénticos". Metodología y tests completos.