Cristian Tala_

Claude: ¿Haiku, Sonnet, Opus o Fable?

Anthropic tiene una escalera de precios de 10× entre su modelo de entrada y el de arriba. La medimos toda con la misma suite. Si la calidad subiera igual que el precio, esta página no existiría.

Última actualización: 2026-08-23 · datos abiertos en GitHub

La respuesta corta

Los 9 tiers empatan en calidad: la diferencia entre ellos es más chica que el margen de error de la medición. Y el más caro cuesta 10× lo que el más barato.

Empieza por este Haiku 4.5 ≈$23/mes calidad 8.21/10 · 8.8s de respuesta
El flagship Opus 5 Fast ≈$234/mes calidad 8.23/10 · 16.4s. La misma calidad, más lento y más caro.

Costos a 3.000 llamadas/mes (≈100 por día). Ajústalo a tu volumen en la calculadora. Y baja un poco: hay un caso donde el caro sí vale la pena, y no es el que te venden.

Los 9 tiers, uno al lado del otro

Ordenados por precio, del más barato al más caro — para que veas si la calidad sube con él. Los pilares son calidad pura en esa tarea, sin mezclar costo.

TierCalidad CodingContenido Razon.Agentes Costo/mesLatenciaScore
Haiku 4.5 ← el más barato8.219.18.18.17.8≈$23/mes8.8s6.42
Sonnet 58.319.68.77.87.5≈$47/mes21.6s6.14
Sonnet 4.68.128.28.67.67.5≈$70/mes20.6s5.01
Opus 4.88.489.18.98.57.7≈$117/mes19.6s6.96
Opus 4.68.488.78.98.57.8≈$117/mes32.8s6.68
Opus 4.78.399.28.68.37.8≈$117/mes28.9s6.30
Opus 58.218.79.07.77.0≈$117/mes41.9s5.21
Fable 58.397.99.18.37.4≈$234/mes34.3s5.96
Opus 5 Fast8.238.69.17.87.1≈$234/mes16.4s5.54

Opus 5 Fast cuesta 10 veces más que Haiku 4.5 y no gana en ninguna categoría. La escalera de precios no está comprada con calidad: está comprada con otra cosa (contexto, límites de uso, prioridad en cola).

Qué le pedísHaiku 4.5$7.80Sonnet 5$15.60Sonnet 4.6$23.40Opus 4.8$39.00Opus 4.6$39.00Opus 4.7$39.00Opus 5$39.00Fable 5$78.00Opus 5 Fast$78.00¿El precio compra algo?
Auditar un negocioEncontrar el error en un P&L, la causalidad falsa, la métrica envenenada6.807.776.808.207.908.407.878.007.54Gana Opus 4.7
PlanificarArmar un plan cuya aritmética cierre y respete las restricciones8.909.009.209.209.209.209.209.208.93Empatan arriba 6 de 9
Escribir con restriccionesNo repetir el dato falso del brief, no meter el CTA prohibido6.679.7310.009.2010.009.209.3310.0010.00Empatan arriba 4 de 9
Razonamiento profundoMatemática, lógica formal, estimaciones Fermi8.206.556.947.367.926.996.666.956.35Va al revés: gana el barato
CódigoGenerar y corregir código que funcione9.268.748.989.309.089.089.409.029.19Gana Opus 5
Agentes largosMantener el hilo y las restricciones a lo largo de muchos turnos7.967.829.178.089.108.107.356.607.50Gana Sonnet 4.6
Multi-turnoConversaciones de ida y vuelta sin perder el contexto7.387.337.928.508.007.678.587.508.08Gana Opus 5
Tool callingLlamar herramientas con los parámetros correctos6.755.605.075.355.705.564.474.655.12Va al revés: gana el barato

Los números son calidad pura: sin costo, sin velocidad. Cada categoría se compara sobre los mismos tests rendidos por los tres. Un promedio sacado de exámenes distintos no compara modelos — compara exámenes.

Cómo leer esto sin equivocarte

Que dos tiers empaten no significa que sean idénticos: significa que esta medición no los distingue. Con 103 corridas, cada número tiene un margen alrededor; cuando ese margen se solapa, la diferencia que ves es ruido, no señal. Si volviera a correr el test mañana, el orden podría darse vuelta sin que nada haya cambiado en los modelos.

La consecuencia práctica es simple: si la calidad empata, la decisión es de precio y de velocidad. Y si el proveedor quiere que pagues más, que te diga exactamente qué compras — con su margen de error al lado.

Antes de migrar, haz esto

Ya sabes cuál gana en el papel. No lo cambies a ciegas: toma el mejor de cada familia y pásales cinco prompts reales tuyos, de los que ya corres en producción. Una comparación general te dice quién arranca adelante; tu caso decide quién gana. Son veinte minutos y te ahorran una migración equivocada.

Y una advertencia: este resultado se recalcula con cada lote de modelos nuevos. Como el score de cada modelo es relativo a todos los demás, un modelo nuevo mueve a todos. El ganador de hoy puede no serlo el mes que viene.

Ver la comunidad →

Cada vez que corro un lote nuevo, publico el recálculo ahí — con los datos crudos y lo que cambió de lugar. Es también donde hay gente tomando esta misma decisión. Entrar es gratis.

¿Qué mide este benchmark?

No es un benchmark académico (para eso están MMLU, HumanEval o SWE-bench). Es un benchmark aplicado para emprendedores hispanohablantes: mide qué modelo conviene poner en producción para casos reales, con lo que los benchmarks oficiales no cubren — costo en provider real, velocidad, español neutro y agentes multi-turno.

Contamos con 207 modelos catalogados, 157 testeados y 65.000+ runs reales evaluados por un LLM-as-Judge local (Phi-4, de Microsoft — sin conflicto de interés), en 4 pilares:

Dos números distintos, no los confundas. Las tablas por tarea de esta página se ordenan por calidad en esa tarea: capacidad pura, sin mezclar precio. Es la respuesta a "¿quién lo hace mejor?".

El score global es otra cosa: una función ponderada (calidad 70% + costo 15% + velocidad 7,5% + latencia 7,5%) que responde "¿qué conviene poner en producción?". Ahí un modelo barato y rápido sí puede superar a uno más capaz pero caro. Los dos números sirven — para preguntas distintas.

Tool calling va como insignia aparte (no suma al score global): indica si el modelo soporta herramientas, no su calidad. Límite conocido: el juez es Phi-4 (14B) y varios modelos evaluados son más capaces que él — ordena bien, pero comprime las diferencias en la cima. Leé un empate como "el juez no los distingue", no como "son idénticos". Metodología y tests completos.