Cristian Tala_

El mismo modelo no rinde igual según quién lo sirva

Eliges un modelo mirando un ranking. Después lo llamas por el proveedor que tenías a mano. Y resulta que esa segunda decisión, la que nadie te ayuda a tomar, te puede costar más calidad que la primera.

Hoy ningún modelo medido por más de un camino cambia más de 1 punto de calidad según el proveedor. La velocidad y la latencia cambian, y bastante — mira la tabla.

Los datos

Estos son todos los modelos que medimos por más de un camino, con al menos 50 runs en cada uno. La columna Δ calidad es la diferencia entre el mejor y el peor proveedor del mismo modelo. Si el modelo fuera lo único que importa, esa columna sería cero en todas las filas.

ModeloSe llama porCalidadtok/sTTFTRunsΔ calidad
Kimi K2.5OpenRouter8.104462.1s14115+0.67
NVIDIA NIM7.432873.5s553
Claude Sonnet 5Claude Code (CLI)8.885560.6s123+0.57
OpenRouter8.316821.6s296
Qwen 3.5 397BNVIDIA NIM8.362449.1s94+0.56
Ollama Cloud8.027035.4s56
OpenRouter7.806482.4s154
GPT-OSS 20BOpenRouter7.919522.4s150+0.53
Groq7.385883.2s91
GPT-OSS 120BOpenRouter8.115339.4s154+0.39
Ollama Cloud7.727513.4s84
Qwen 3-Next 80B ThinkingOpenRouter7.5215429.6s156+0.35
NVIDIA NIM7.1710617.8s184
Gemma 4 31BOpenRouter8.484717.2s143+0.33
OpenRouter8.469159.7s84
NVIDIA NIM8.152563.3s92
Claude Opus 5Claude Code (CLI)8.494683.7s113+0.28
OpenRouter8.215841.9s472
MiniMax M2.7API directa del fabricante8.095322.7s271+0.26
OpenRouter7.834547.8s217
Ministral 14BOpenRouter8.117123.2s161+0.25
NVIDIA NIM7.862151.0s85
Nemotron 3 Nano Omni 30B-A3B ReasoningOpenRouter7.9916033.5s147+0.23
NVIDIA NIM7.7620210.6s86
Llama 4 Scout 17BOpenRouter7.881367.7s148+0.22
Groq7.662362.4s97
Claude Fable 5Claude Code (CLI)8.615827.0s102+0.22
OpenRouter8.394434.3s213
DeepSeek V4 ProOpenRouter8.415863.0s431+0.19
OpenRouter8.224754.9s196
Nemotron Nano 9B v2OpenRouter8.023655.4s134+0.19
NVIDIA NIM7.835425.9s86
Mistral Large 3 675BNVIDIA NIM8.4411146.6s82+0.18
OpenRouter8.265324.6s152
Claude Sonnet 4.6Claude Code (CLI)8.294945.4s93+0.17
OpenRouter8.124720.6s171
Claude Opus 4.7OpenRouter8.395728.9s210+0.12
Claude Code (CLI)8.275332.9s70
Qwen 3-Next 80B InstructNVIDIA NIM8.136216.9s95+0.12
OpenRouter8.0110710.0s157
Claude Opus 4.8OpenRouter8.486019.6s165+0.10
Claude Code (CLI)8.385848.4s109
Claude Haiku 4.5Claude Code (CLI)8.2910222.2s86+0.08
OpenRouter8.21968.8s157
GLM 5OpenRouter8.424676.9s154+0.07
NVIDIA NIM8.357124.5s84
MiniMax M3OpenRouter8.176849.7s230+0.06
API directa del fabricante8.113264.5s89
Step 3.5 FlashNVIDIA NIM8.094334.1s68+0.06
OpenRouter8.035831.2s1140
DeepSeek V4 FlashOpenRouter8.166229.5s168+0.01
NVIDIA NIM8.152555.2s81

La calidad es el promedio del juez sobre tareas reales (0-10). El TTFT es el tiempo hasta el primer token. No usamos el score global del ranking acá a propósito: ese es un z-score contra toda la población y se recalcula cada vez que entra un modelo nuevo. Estas tres columnas son crudas — no se mueven.

Por qué pasa esto

Un proveedor no te entrega "el modelo". Te entrega su forma de servirlo, y ahí hay decisiones que cambian el resultado:

Qué hacer con esto

  1. Cuando leas cualquier benchmark —incluido el nuestro— preguntá por dónde midieron. Un número sin proveedor es medio número. Nosotros medimos todo por OpenRouter justamente para que la comparación entre modelos sea limpia: si cada modelo se mide en su propia infra, no estás comparando modelos, estás comparando datacenters.
  2. Si te cambiaste de proveedor y "el modelo empeoró", no era tu impresión. Medilo antes de culpar al prompt.
  3. El proveedor más rápido no es gratis. A veces la velocidad viene de una cuantización que te está costando calidad. Esa es una decisión que puedes tomar — pero tienes que saber que la estás tomando.

Cómo salió este dato

Por un error nuestro, honestamente. Durante meses el benchmark midió unos modelos en OpenRouter y otros en NVIDIA NIM, Groq o la API directa del fabricante. Eso era un bug: el ranking estaba midiendo modelo × infraestructura y no el modelo, al punto de que un mismo modelo llegó a ocupar dos puestos distintos del ranking.

Al arreglarlo (todo se mide en un plano común) podríamos haber borrado las mediciones duplicadas. No lo hicimos: son el único experimento natural que tenemos sobre esto. El bug resultó ser el dato más útil.

Antes de migrar, haz esto

Ya sabes cuál gana en el papel. No lo cambies a ciegas: toma el mejor de cada familia y pásales cinco prompts reales tuyos, de los que ya corres en producción. Una comparación general te dice quién arranca adelante; tu caso decide quién gana. Son veinte minutos y te ahorran una migración equivocada.

Y una advertencia: este resultado se recalcula con cada lote de modelos nuevos. Como el score de cada modelo es relativo a todos los demás, un modelo nuevo mueve a todos. El ganador de hoy puede no serlo el mes que viene.

Ver la comunidad →

Cada vez que corro un lote nuevo, publico el recálculo ahí — con los datos crudos y lo que cambió de lugar. Es también donde hay gente tomando esta misma decisión. Entrar es gratis.

¿Qué mide este benchmark?

No es un benchmark académico (para eso están MMLU, HumanEval o SWE-bench). Es un benchmark aplicado para emprendedores hispanohablantes: mide qué modelo conviene poner en producción para casos reales, con lo que los benchmarks oficiales no cubren — costo en provider real, velocidad, español neutro y agentes multi-turno.

Contamos con 207 modelos catalogados, 157 testeados y 65.000+ runs reales evaluados por un LLM-as-Judge local (Phi-4, de Microsoft — sin conflicto de interés), en 4 pilares:

Dos números distintos, no los confundas. Las tablas por tarea de esta página se ordenan por calidad en esa tarea: capacidad pura, sin mezclar precio. Es la respuesta a "¿quién lo hace mejor?".

El score global es otra cosa: una función ponderada (calidad 70% + costo 15% + velocidad 7,5% + latencia 7,5%) que responde "¿qué conviene poner en producción?". Ahí un modelo barato y rápido sí puede superar a uno más capaz pero caro. Los dos números sirven — para preguntas distintas.

Tool calling va como insignia aparte (no suma al score global): indica si el modelo soporta herramientas, no su calidad. Límite conocido: el juez es Phi-4 (14B) y varios modelos evaluados son más capaces que él — ordena bien, pero comprime las diferencias en la cima. Leé un empate como "el juez no los distingue", no como "son idénticos". Metodología y tests completos.