Cada pocas semanas sale un modelo de IA que «supera a todos», y cada ranking dice una cosa distinta. El 14 de septiembre de 2026, sin ir más lejos, Claude Fable 5.1 es el número uno en BenchLM, LiveBench y Artificial Analysis, GPT-6 Astra lo es en LLM Stats y en la clasificación de desarrollo web de Arena, y en la clasificación general de texto de Arena manda un modelo anterior, Claude Fable 5. Ninguno se equivoca: miden cosas distintas.
Lo que conviene saber antes de fiarse de una tabla:
- Hay tres formas de medir un LLM (un modelo de lenguaje, lo que hay detrás de ChatGPT, Claude o Gemini): exámenes con respuestas que se corrigen solas, como LiveBench; votos de personas que comparan dos respuestas a ciegas, como Arena; y agregadores que juntan cientos de pruebas en una sola nota, como BenchLM, LLM Stats o Artificial Analysis.
- Las diferencias en cabeza suelen ser empates. En Arena, los diez primeros de texto están separados por 13 puntos con márgenes de error de hasta ±11; en BenchLM, el primero y el segundo, por medio punto.
- Un ranking de uso no es un ranking de calidad. OpenRouter muestra qué modelos se usan más a través de su servicio, y ahí ganan los baratos.
- La mejor comprobación sigue siendo la tuya: usar los rankings para quedarse con dos o tres candidatos y probarlos con tus propias preguntas.
| Web | Cómo mide | Lo mejor | Lo peor |
| Arena | Votos a ciegas entre dos respuestas | Millones de votos y márgenes de error visibles | Premia el estilo y la preferencia, no el acierto |
| LiveBench | Preguntas nuevas corregidas automáticamente | Difícil de «hacer trampa» memorizando | Tandas cada varios meses y pocos modelos |
| BenchLM | Agrega 435 pruebas en una nota | Separa lo medido de lo estimado | Nota compuesta difícil de auditar |
| LLM Stats | Agrega pruebas públicas, precio y velocidad | Más de 300 modelos con precio y velocidad | Textos desfasados y modelos que no se pueden usar |
| Artificial Analysis | Pasa las pruebas por su cuenta | Mismas condiciones para todos y coste por tarea | El índice cambia de versión a menudo |
| OpenRouter | Uso real a través de su API | Dice qué se usa de verdad | No mide calidad |
| Epoch AI | Índice de capacidad a largo plazo | Compara modelos de años distintos | Sirve para ver la evolución, no para elegir modelo hoy |
Tres formas de medir un modelo, y por qué no coinciden
Casi todos los rankings de modelos de IA se apoyan en una de estas tres ideas, o en una mezcla. Saber cuál usa cada uno explica la mayoría de las contradicciones.
Exámenes que se corrigen solos
Son los benchmarks de toda la vida: una batería de problemas de matemáticas, programación, lógica o comprensión con una respuesta correcta que se comprueba automáticamente. Su gran ventaja es que no dependen de la opinión de nadie. Tienen dos problemas conocidos:
- La contaminación. Si las preguntas están publicadas en internet, acaban dentro de los datos con los que se entrena el siguiente modelo, que las «recuerda» en vez de resolverlas.
- La saturación. Cuando todos los modelos buenos sacan un 95 %, la prueba deja de distinguirlos. Por eso los rankings retiran pruebas y añaden otras nuevas cada pocos meses.
Hay un tercer matiz: muchas cifras que circulan las publica el propio fabricante al lanzar el modelo, con las pruebas y los ajustes que más le favorecen.
Votos de personas
La alternativa es preguntar a la gente. Alguien escribe una pregunta, recibe dos respuestas de modelos anónimos y vota la que prefiere. Con millones de votos se calcula una puntuación parecida a la del ajedrez: ganar a un modelo fuerte suma más que ganar a uno flojo.
Mide algo que los exámenes no captan, cómo de útil y agradable resulta una respuesta para una persona real. A cambio, una respuesta larga, bien formateada y segura de sí misma tiende a ganar votos aunque tenga un error que el votante no detecta.
Agregadores
Los agregadores recogen resultados de decenas o cientos de pruebas, a veces también votos, precios y velocidad, y los combinan en una sola nota. Son la forma más rápida de hacerse una idea, pero la nota final depende de qué pruebas entran, cuánto pesa cada una y qué se hace cuando a un modelo le faltan resultados. Dos agregadores con los mismos datos pueden ordenar distinto los primeros puestos.
Arena (antes LMArena): el ranking de los votos
Arena es el ranking de IA más citado. Nació en 2023 como Chatbot Arena, un proyecto de investigación de la Universidad de California en Berkeley. Después se llamó LMArena y el 28 de enero de 2026 pasó a llamarse Arena, con dominio nuevo, arena.ai. Hoy es una empresa que habla de más de 5 millones de usuarios al mes, y la dirección antigua, lmarena.ai, redirige a la nueva.
Funciona así: escribes una pregunta, dos modelos anónimos responden y votas la mejor. Después se revelan los nombres. Con esos votos se ordena a los modelos en clasificaciones separadas de texto, desarrollo web, visión, documentos, imagen, vídeo, búsqueda y agentes.
A 13 de septiembre de 2026, la clasificación de texto sumaba 8.146.274 votos y 402 modelos. Tiene además 29 categorías, entre ellas programación, matemáticas, escritura creativa y español.
Lo mejor
- Mide a personas usando la IA de verdad, con preguntas reales en vez de un examen fijo que se pueda memorizar.
- Enseña la incertidumbre. Cada modelo lleva su margen de error y un «rango de puesto», que indica entre qué posiciones podría estar en realidad.
- Corrige el estilo por defecto. Aplica un ajuste para que una respuesta no gane solo por ser más larga o tener más negritas.
- Separa por tareas. El mismo modelo puede ir 24.º en texto y 1.º en desarrollo web, que es justo lo que le pasa a GPT-6 Astra.
- Es gratis y sirve para probar. Tiene un modo para comparar dos modelos elegidos por ti con tus propias preguntas.
Lo peor
- Preferir no es acertar. Un votante que pregunta algo que no domina no sabe si la respuesta es correcta, solo si le convence.
- Los primeros puestos son casi siempre empates. En texto, del 1.º al 10.º hay 13 puntos, y el modelo que va 8.º podría estar en cualquier puesto entre el 1.º y el 24.º.
- Las categorías pequeñas son poco fiables. La de español tiene 160.421 votos, un 2 % del total, y su cuarto clasificado podría estar en cualquier puesto entre el 1.º y el 44.º.
- Los modelos nuevos tardan en asentarse. Con pocos miles de votos, su puntuación todavía puede moverse bastante, y algunos aparecen marcados como preliminares.
- Ha tenido polémica. En abril de 2025, el estudio The Leaderboard Illusion documentó que algunas grandes empresas probaban en privado muchas variantes antes de un lanzamiento y publicaban solo la mejor. Meta llegó a probar 27 antes de Llama 4. El mismo estudio calculó que Google y OpenAI habían recibido cerca del 20 % de los datos cada una, frente al 29,7 % que sumaban 83 modelos abiertos juntos.
- Tus preguntas no son privadas. Arena avisa de que guarda lo que escribes para sus evaluaciones y comparte parte de los votos con los fabricantes. No es sitio para pegar datos personales ni de trabajo.
LiveBench: el examen que se renueva
LiveBench es un benchmark creado en 2024 por investigadores de Abacus.AI, la Universidad de Nueva York, NVIDIA y otras universidades, entre ellos Yann LeCun. Lo patrocina Abacus.AI. Su idea es atacar el problema de la contaminación: las preguntas salen de fuentes recientes (competiciones de matemáticas, artículos científicos, noticias) y se renuevan cada cierto tiempo, para que ningún modelo las haya visto al entrenarse.
Todas las respuestas tienen una solución objetiva y se corrigen automáticamente, sin que otro modelo de IA haga de juez. Las pruebas se agrupan en siete categorías: razonamiento, programación, programación con agentes, matemáticas, análisis de datos, lenguaje y seguimiento de instrucciones. La nota general es la media de las siete.
Lo mejor
- Es la forma más limpia de medir capacidad bruta. Si un modelo acierta, es que ha resuelto el problema, no que convenza a nadie.
- Resiste bien la memorización, porque las preguntas nuevas no estaban publicadas cuando se entrenaron los modelos.
- Es abierto. El código está publicado y las preguntas de tandas anteriores, también, así que cualquiera puede repetir las pruebas.
- Deja comparar por categorías, útil si solo te importa, por ejemplo, programar o analizar datos.
Lo peor
- Se actualiza menos de lo que promete. Nació prometiendo preguntas nuevas cada mes, pero la tanda vigente es del 25 de junio de 2026 y la anterior, del 8 de enero. Entre mayo y noviembre de 2025 tampoco hubo ninguna.
- Evalúa pocos modelos. La última tanda tiene 57, frente a los cientos de Arena o de los agregadores. Si el modelo que te interesa no está, no hay dato.
- No mide cómo se lee una respuesta. Una solución correcta pero confusa puntúa igual que una clara.
- Quien lo patrocina también compite. Abacus.AI evalúa ahí sus propios modelos Smaug. El mejor de ellos, una versión ajustada de Kimi K3, queda por encima del original, 79,5 frente a 79,2, pero lejos del podio.
BenchLM: el agregador que admite lo que no sabe
BenchLM reúne en una sola tabla resultados de pruebas, precios, velocidad y tamaño de contexto. A 10 de septiembre de 2026 seguía 489 modelos y 435 pruebas, y los ordena con una nota propia, BenchAlign, que combina los resultados de las pruebas con votos de personas y con índices elaborados por otros.
Su rasgo más interesante es cómo trata los huecos. Si a un modelo le faltan pruebas, no le pone un cero ni se limita a las que eligió publicar su fabricante: estima su nivel con lo que hay y lo marca. De ahí salen dos etiquetas, Supported, cuando hay pruebas independientes suficientes, y Estimated, cuando la nota es una estimación con más margen de error. De los modelos que puntúa, 130 son de la primera clase y 102 de la segunda.
Lo mejor
- Deja claro cuánto se sabe de cada modelo. Además de la etiqueta, cada nota lleva un intervalo: el líder, Claude Fable 5.1, tiene 84,61 puntos, pero su nota real podría estar entre 78,2 y 91,0.
- No mezcla peras con manzanas. Calibra cada prueba antes de combinarla, en vez de promediar porcentajes de exámenes con dificultades distintas.
- Tiene clasificaciones por uso: programación, agentes, contexto largo, documentos, ciberseguridad, modelos abiertos, modelos chinos y europeos…
- Da respuestas prácticas, como el mejor modelo abierto o el que da casi la misma nota que el líder por menos dinero.
- Los datos se pueden descargar en CSV y JSON.
Lo peor
- La nota final es difícil de auditar. De las 435 pruebas, solo una parte cuenta para la nota. En programación, por ejemplo, pesan 7 y otras 58 se muestran solo como referencia.
- Los primeros puestos se solapan. Con intervalos de más de 10 puntos, el orden entre los tres primeros (84,61, 84,08 y 81,97) no significa gran cosa. El segundo, GPT-6 Astra, además, tiene la nota estimada.
- Lo mantiene una sola persona, según su propia página, y la web tiene publicidad y enlaces de afiliado. Asegura que los afiliados no influyen en las notas.
- Está pensado para empresas y desarrolladores. Mucha jerga, precios de la API por millón de tokens y poca orientación para quien solo quiere saber qué chat usar.
LLM Stats: mucho catálogo, con letra pequeña
LLM Stats se presenta como un «centro de benchmarks de IA». Su tabla principal ordena 390 modelos con una nota propia, el LLM Stats Score, que calcula a partir de pruebas públicas, y los acompaña de notas de razonamiento, programación y agentes, tamaño de contexto, velocidad, precio y licencia. Tiene también clasificaciones para modelos abiertos, generación de imágenes y vídeo, y voz, y un apartado de arenas de votos.
Según su metodología, los resultados sin verificar se marcan en la web y no cuentan para la nota, y los precios se contrastan con facturación real.
Lo mejor
- Es el catálogo más amplio de un vistazo, con precio, velocidad y licencia en la misma fila que las notas.
- Filtra por lo que importa: solo modelos abiertos, los últimos 30 o 90 días, precio o tamaño.
- Separa lo verificado de lo que no. Los resultados sin confirmar se ven, pero no suben la nota.
- Tiene páginas por tipo de modelo: imagen, vídeo, voz a texto, texto a voz y embeddings, que otros rankings no cubren.
Lo peor
- Mete en la tabla modelos que no se pueden usar. El cuarto puesto es Claude Mythos Preview, marcado como no lanzado.
- Tiene textos desfasados. Su propia sección de preguntas frecuentes cita todavía como punteros de 2026 a DeepSeek V3 y R1, Grok 4 o Gemini 3 Pro, varias generaciones por detrás de lo que dice la tabla de al lado.
- La metodología es un resumen. Explica de dónde salen los datos, pero no cómo pesa cada prueba en la nota, y remite al contacto para más detalles.
- Vende servicios a quienes evalúa. Ofrece benchmarks a medida, etiquetado de datos y una API con sus datos, algo habitual en el sector, pero conviene saberlo.
- Pide verificar que eres humano antes de dejarte navegar, algo molesto para una consulta rápida.
Otros rankings que conviene conocer
Los cuatro anteriores no son los únicos. Estos tres cubren huecos que los demás dejan.
Artificial Analysis: las pruebas, hechas por su cuenta
Artificial Analysis no se limita a recoger resultados: pasa las pruebas él mismo, en las mismas condiciones para todos los modelos. Su Intelligence Index, que ya va por la versión 4.3, combina diez evaluaciones, entre ellas Terminal-Bench, SciCode y Humanity’s Last Exam. Mide además la velocidad real a través de los distintos proveedores y cuánto cuesta completar cada tarea del índice. En la web aparecen 650 modelos, y otros rankings, como BenchLM, lo usan como fuente.
- Lo mejor: es independiente de lo que publique el fabricante, y el coste por tarea descubre modelos baratos por token que salen caros porque «piensan» demasiado.
- Lo peor: el índice cambia de versión con frecuencia. La 4.3 sustituyó una prueba y actualizó otra, así que una nota de hace unos meses no se puede comparar con una de hoy. Además, se centra en tareas de trabajo, programación y ciencia, y no mide cómo escribe un modelo ni si sus respuestas gustan.
OpenRouter: lo que se usa de verdad
OpenRouter es un servicio que da acceso a cientos de modelos con una sola API, y publica qué modelos procesan más tokens a través de él. El 13 de septiembre de 2026, los primeros eran GPT-5.6 Luna, Hy4 preview de Tencent y GLM 5.3 Flash. Ninguno de los tres encabeza los rankings de calidad.
- Lo mejor: es el termómetro de lo que eligen los desarrolladores cuando pagan de su bolsillo, y tiene desgloses por programación, idiomas o llamadas a herramientas. Sus datos son libres, con licencia CC BY 4.0.
- Lo peor: la propia OpenRouter avisa de que mide adopción, no calidad. Solo cuenta el tráfico que pasa por su servicio, las versiones gratuitas se cuentan por separado y un modelo que escribe mucho procesa más tokens sin que eso signifique que guste más.
Epoch AI: la evolución a largo plazo
Epoch AI es un centro de investigación sobre la evolución de la IA. Su Epoch Capabilities Index convierte los resultados de muchas pruebas en una sola escala de capacidad general, pensada para comparar modelos de años distintos aunque las pruebas antiguas ya estén saturadas. Tiene versiones específicas para programación, matemáticas y ciberseguridad.
- Lo mejor: es la referencia para ver cuánto avanzan los modelos y a qué ritmo, sin el ruido del lanzamiento de la semana.
- Lo peor: no está pensado para decidir qué modelo usar hoy, y no incluye precio ni velocidad.
Quién va primero en cada ranking, septiembre de 2026
Así estaban los rankings a mediados de septiembre de 2026. La foto cambiará con el próximo lanzamiento, pero sirve para ver cómo la misma pregunta da respuestas distintas:
| Ranking | Primero | Segundo | Qué hay que saber |
| Arena, texto (13 sept.) | Claude Fable 5 (1.506) | Claude Opus 4.6 high (1.505) | GPT-6 Astra va 24.º, con solo 2.693 votos |
| Arena, desarrollo web (13 sept.) | GPT-6 Astra (1.800) | Claude Fable 5.1 (1.758) | La clasificación con más distancia entre modelos |
| LiveBench (tanda del 25 jun.) | Claude Fable 5.1 (83,4) | Claude Fable 5 (83,0) | GPT-6 Astra, tercero con 82,2 |
| BenchLM (10 sept.) | Claude Fable 5.1 (84,61) | GPT-6 Astra (84,08) | La nota de GPT-6 Astra está marcada como estimada |
| LLM Stats (14 sept.) | GPT-6 Astra (59,9) | Claude Fable 5.1 (55,9) | La mayor distancia entre los dos |
| Artificial Analysis (índice 4.3) | Claude Fable 5.1 (53,4) | GPT-6 Astra (52,8) | Tercero, Claude Opus 5 (50,7) |
| OpenRouter, uso (13 sept.) | GPT-5.6 Luna | Hy4 preview (Tencent) | Mide tokens procesados, no calidad |
Cómo leer esta tabla
- Arriba hay un empate técnico entre Claude Fable 5.1 y GPT-6 Astra. Cuatro de las seis clasificaciones de calidad los ponen en los dos primeros puestos. En BenchLM y en Artificial Analysis los separa menos de un punto, y solo se distancian de verdad en LLM Stats y en el desarrollo web de Arena.
- Que GPT-6 Astra vaya 24.º en el texto de Arena no significa que sea peor que 23 modelos. Lleva muy pocos votos, su margen de error es de ±12 puntos y su posición real podría estar en cualquier puesto entre el 5.º y el 51.º. Hace falta tiempo para que se asiente.
- Que un modelo antiguo gane en votos tampoco es raro. Claude Fable 5 y Claude Opus 4.6 acumulan decenas de miles de votos cada uno y su nota es estable, mientras que la de los recién llegados todavía oscila.
- El más usado no aparece en ningún podio de calidad. GPT-5.6 Luna encabeza OpenRouter sin aparecer en los primeros puestos de ninguna clasificación de calidad: el uso responde también al precio y a la velocidad.
Cómo usar los rankings para elegir modelo
Ningún ranking responde por sí solo a «cuál es el mejor LLM». Combinados, sí sirven para acertar. Este es un método que funciona:
- Empieza por la tarea, no por la clasificación general. Si vas a programar, mira las clasificaciones de programación; si vas a escribir en español, la categoría de español de Arena. Un modelo puede ir primero en general y décimo en lo tuyo.
- Cruza un examen con un ranking de votos. Por ejemplo, LiveBench o Artificial Analysis con Arena. Si un modelo sale arriba en los dos, es buena señal: resuelve bien y además sus respuestas convencen a la gente.
- Trata las diferencias pequeñas como empates. Si los márgenes de error se solapan o los separa menos de un par de puntos, los dos valen lo mismo para ti.
- Mira la fecha y los votos. Un modelo con pocos días o pocos miles de votos todavía no tiene la nota asentada.
- Pon el precio al lado. Si pagas por uso, el coste por tarea de Artificial Analysis o la columna de precio de BenchLM y LLM Stats pueden hacer que el tercero sea mejor compra que el primero. Si usas un chat con suscripción, lo que cuenta es qué modelo incluye tu plan.
- Prueba los dos o tres finalistas con tus propias preguntas. El modo de comparación de Arena es gratis y deja enfrentar dos modelos a la vez. Usa preguntas reales de tu trabajo, sin datos personales ni confidenciales.
Qué no hacer
- Fiarse de una sola cifra del fabricante. Las notas que acompañan a un lanzamiento se eligen para quedar bien. Espera a que las repitan fuentes independientes, que suele llevar unos días.
- Cambiar de modelo por cada titular. Un salto de dos puntos en un agregador no se nota en el uso diario.
- Confundir el modelo con la aplicación. Los rankings evalúan modelos concretos, a menudo con el máximo nivel de razonamiento. La versión gratuita de un chat puede usar otro modelo, o el mismo con menos esfuerzo.
Si lo que buscas son modelos para ejecutar en tu propio ordenador, el problema es otro: además de la calidad, importa qué cabe en tu memoria. Para eso está LLMFit, que calcula qué modelos locales puede mover tu PC. Y si quieres empezar sin pagar, en las mejores herramientas de IA gratis están los chats con plan gratuito.
Preguntas frecuentes
¿Cuál es el mejor LLM ahora mismo?
A mediados de septiembre de 2026, Claude Fable 5.1 y GPT-6 Astra comparten los primeros puestos en casi todos los rankings de calidad, con diferencias que caben en el margen de error. Cuál te conviene depende de la tarea: GPT-6 Astra destaca en desarrollo web en Arena y Claude Fable 5.1 lidera las notas generales de BenchLM, LiveBench y Artificial Analysis.
¿Qué ranking de IA es más fiable?
Ninguno por separado. LiveBench es el más difícil de manipular, porque corrige respuestas objetivas con preguntas nuevas, pero evalúa pocos modelos. Arena refleja mejor lo que prefiere la gente, pero premia el estilo. Artificial Analysis pasa las pruebas por su cuenta y añade coste y velocidad. Lo recomendable es cruzar al menos dos.
¿Qué pasó con LMArena?
Cambió de nombre. El 28 de enero de 2026, LMArena pasó a llamarse Arena y se mudó a arena.ai. Antes se llamaba Chatbot Arena, y la dirección antigua redirige a la nueva.
¿Hay algún ranking de modelos en español?
Arena tiene una categoría de español dentro de su clasificación de texto. A 13 de septiembre de 2026 sumaba 160.421 votos, suficientes para orientarse pero con márgenes de error mucho más amplios que la clasificación general.
¿Por qué los rankings no coinciden?
Porque miden cosas distintas: acierto en exámenes, preferencia de personas o una media ponderada de muchas pruebas. Cada uno elige además qué pruebas usa y cómo trata a los modelos a los que les faltan resultados.
¿Me puedo fiar de los benchmarks que publican OpenAI, Google o Anthropic?
Como referencia, sí. Pero cada fabricante elige qué pruebas enseña y en qué condiciones las pasa, así que conviene esperar a que fuentes independientes como Artificial Analysis, LiveBench o Arena confirmen las cifras.
¿Cada cuánto cambia el primer puesto?
Con cada lanzamiento importante, y en 2026 los grandes laboratorios publican modelos nuevos con mucha frecuencia. Por eso tiene más sentido fijarse en qué modelos aparecen arriba en varias webs a la vez que en quién es el número uno esta semana.










