Respuesta corta
Lo esencial
El modelo más capaz y el que mejor encaja en tu trabajo pueden ser distintos. Este Benchmark IA compara capacidad y coste con una instantánea fechada de Artificial Analysis y utiliza OpenRouter como referencia de adopción. Consulta el gráfico, identifica candidatos dentro de tu presupuesto y prueba después con tus propias tareas. Mantendremos esta misma página al revisar los modelos y las novedades.
- Compara modelos con su configuración de razonamiento: cambiar el esfuerzo también cambia el resultado y el gasto.
- El gráfico mide dólares por tarea del benchmark, no el precio de una consulta de tu empresa.
- Las novedades son un punto de partida para probar; las decisiones dependen de calidad, tiempo de respuesta y coste por caso aceptado.
Qué encontrarás en este Benchmark IA
Esta es la primera edición de nuestro observatorio, con corte editorial a 30 de septiembre de 2026. Reunimos una selección de modelos generalistas y varias configuraciones de los lanzamientos recientes para entender qué cambia cuando aumenta el esfuerzo de razonamiento. No pretende recoger cada modelo existente: priorizamos diversidad de creadores, alternativas económicas y opciones de mayor capacidad.
La fecha de consulta importa tanto como el nombre. Los precios, las evaluaciones y los modelos disponibles cambian. Cada revisión conservará la URL /blog/benchmark-ia/, actualizará la ficha y explicará los cambios. Es una publicación de revisión editorial; los datos no se refrescan en directo al abrir la página.
Inteligencia frente a coste: el mapa de modelos
Cada punto representa un modelo y una configuración. La inteligencia sube en el eje vertical; el coste aumenta hacia la derecha. Para comparar importes muy diferentes utilizamos una escala logarítmica: pasar de 0,01 a 0,1 dólares ocupa la misma distancia que pasar de 0,1 a 1. La zona superior izquierda reúne más capacidad con menos gasto dentro de esta medida.
Línea discontinua: frontera de eficiencia de esta selección. Los números remiten a la tabla. Toca un punto para ver su ficha.
22 configuraciones visibles
| N.º / modelo | Configuración | Índice AA | USD / tarea AA |
|---|---|---|---|
| 01 / Claude Opus 5.5Anthropic | max · con fallback | 58 | 5,98 US$ |
| 02 / Claude Sonnet 5.5Anthropic | max · con fallback | 56 | 7,60 US$ |
| 03 / Claude Opus 5.5Anthropic | high · con fallback | 54 | 1,82 US$ |
| 04 / GPT-6 AstraOpenAI | max | 53 | 3,26 US$ |
| 05 / GPT-6.1 SolOpenAI | max | 52 | 0,72 US$ |
| 06 / Claude Sonnet 5.5Anthropic | xhigh · con fallback | 52 | 2,74 US$ |
| 07 / GPT-6.1 SolOpenAI | xhigh | 51 | 0,39 US$ |
| 08 / Claude Opus 5.5Anthropic | medium · con fallback | 51 | 1,34 US$ |
| 09 / GPT-6.1 SolOpenAI | high | 50 | 0,32 US$ |
| 10 / GPT-6.1 SolOpenAI | medium | 48 | 0,21 US$ |
| 11 / Muse Spark 1.3Meta | max | 48 | 1,60 US$ |
| 12 / MiMo-V2.6-ProXiaomi | Configuración publicada | 46 | 0,13 US$ |
| 13 / Grok 4.7SpaceXAI | high | 46 | 2,73 US$ |
| 14 / GLM-5.3Z AI | max | 45 | 2,01 US$ |
| 15 / Qwen3.8 Max (0902)Alibaba | Configuración publicada | 45 | 5,41 US$ |
| 16 / Kimi K3Kimi | max | 44 | 2,00 US$ |
| 17 / GLM-5.3-FlashZ AI | Configuración publicada | 42 | 0,25 US$ |
| 18 / Gemini 3.8 FlashGoogle | high | 41 | 1,24 US$ |
| 19 / DeepSeek V4.1 FlashDeepSeek | max | 39 | 0,27 US$ |
| 20 / MiMo-V2.6-FlashXiaomi | Configuración publicada | 38 | 0,06 US$ |
| 21 / GPT-6 LunaOpenAI | max | 37 | 0,07 US$ |
| 22 / GPT-6 LunaOpenAI | low | 21 | 0,0045 US$ |
Fuente: Artificial Analysis. Consulta: . Puntuaciones enteras de la tabla pública; los empates pueden ocultar diferencias decimales. El coste pertenece a las tareas del benchmark; no es el precio de una consulta de tu negocio ni de una suscripción.
Descargar datos · CSVLa línea discontinua une las opciones para las que ninguna otra configuración visible tiene igual o mayor puntuación a menor o igual coste, con al menos una mejora. Se llama frontera de Pareto. Al filtrar por creador se calcula dentro de ese grupo. Estar fuera de la línea no descarta un modelo: puede encajar mejor por idioma, herramientas, disponibilidad o tiempo de respuesta. Los empates del índice se muestran con la precisión entera publicada.
Qué está cambiando esta semana
GPT-6.1 Sol: un lanzamiento que merece entrar en la prueba
La ficha de GPT-6.1 Sol en Artificial Analysis fecha su lanzamiento el 29 de septiembre. Su configuración max registra 52 puntos y 0,72 USD por tarea del índice. También incluimos medium, high y xhigh para comparar el salto de gasto. Nuestra lectura: conviene ensayar varios esfuerzos con la misma tarea antes de elegir max como ajuste habitual.
Claude Sonnet 5.5 y Opus 5.5: revisar el esfuerzo, además del apellido
Sonnet 5.5 aparece con fecha de lanzamiento del 28 de septiembre: su configuración max con fallback alcanza 56 puntos y 7,60 USD por tarea AA. Opus 5.5, publicado el 22 de septiembre, registra 58 puntos y 5,98 USD en max con fallback. Son resultados de esas configuraciones evaluadas; el nombre comercial por sí solo no permite anticipar cuánto costará resolver un caso.
El extremo económico también se mueve
GPT-6 Luna en max registra 37 puntos y 0,07 USD por tarea del índice. MiMo-V2.6-Flash figura en la selección con 38 puntos y 0,06 USD. Estos resultados invitan a probar alternativas para trabajos repetitivos con salida verificable. Que una tarea sea frecuente no significa que tolere errores: el control de calidad sigue formando parte del proceso.
OpenRouter, Artificial Analysis y Arena: qué mirar en cada uno
| Referencia | Qué aporta | Cómo usarla |
|---|---|---|
| Artificial Analysis | Evaluaciones de capacidad, coste por tarea y rendimiento | Preparar una lista corta con la misma versión de índice y configuración |
| OpenRouter Rankings | Uso observado de modelos dentro de su plataforma | Detectar adopción y tendencias; distinguir uso de capacidad |
| Arena | Comparaciones y preferencias de usuarios por categorías | Contrastar tareas de conversación o creación con evaluaciones técnicas |
OpenRouter Rankings explica que ordena su clasificación de uso por tokens procesados. Su apartado de benchmarks incorpora además puntuaciones de Artificial Analysis. Conviene leer el eje de cada gráfico: volumen de uso, precio de entrada y coste por tarea describen cosas distintas. Arena ofrece otra perspectiva por categorías. No mezclamos sus puntuaciones con el índice AA en el mismo eje.
Otras señales de actualidad que conviene seguir
Agentes: la prueba empieza a parecerse más al trabajo
La metodología del índice v4.3.2 incorpora, entre otras evaluaciones, AutomationBench-AA y Terminal-Bench 4.0. Para una empresa, la pregunta útil es si el sistema termina un flujo con varias herramientas y estados. Resolver un mensaje aislado no demuestra que pueda conciliar documentos, gestionar una excepción y dejar un registro comprensible.
Documentos, imágenes y vídeo necesitan su propia comparación
Analizar una factura fotografiada, redactar una respuesta y generar un vídeo son trabajos diferentes. El índice de este gráfico compara modelos de lenguaje y no demuestra calidad de generación de imagen, voz o vídeo. Para producción creativa conviene consultar las evaluaciones específicas de imagen, vídeo y voz y probar material real: texto pequeño, coherencia, duración, revisiones y coste del resultado utilizable.
Menos gasto por token no garantiza menos gasto por trabajo
Un agente puede pedir información, llamar a una herramienta, revisar su respuesta y repetir. El resultado depende del número de pasos y de lo que haya que corregir. La documentación de contabilidad de uso de OpenRouter permite consultar consumo y coste. Para decidir, agrupa todas las llamadas del mismo caso y añade la revisión humana.
Qué probar según el trabajo de tu empresa
| Trabajo | Primer criterio | Prueba que decide |
|---|---|---|
| Clasificar solicitudes o extraer campos | Coste bajo con formato verificable | Campos correctos, casos incompletos y tasa de revisión |
| Responder con documentación propia | Uso fiel de las fuentes | Citas que sostienen la respuesta y abstención cuando falta evidencia |
| Programar o usar varias herramientas | Finalización del flujo | Tarea resuelta con permisos, validaciones y errores de herramienta |
| Redactar contenido de marca | Calidad editorial en español | Correcciones necesarias, tono y fidelidad a los hechos |
| Conversar en tiempo real | Respuesta completa a tiempo | Espera percibida y calidad con la configuración más rápida aceptable |
Nuestra propuesta es elegir tres candidatos: uno económico, uno equilibrado y uno de mayor capacidad. Somételos al mismo conjunto de casos y a las mismas reglas de aceptación. En cómo elegir un modelo de IA para tu empresa explicamos una prueba práctica. Para llevar el resultado a presupuesto, consulta cómo calcular el coste real de la IA.
Cómo leemos los datos y sus límites
- Misma referencia: índice AA v4.3.2 y coste medio ponderado por tarea del mismo benchmark. Las cifras proceden de evaluaciones públicas; no son pruebas ejecutadas por Logic2b.
- Coste comparable: incorpora el consumo y las tarifas que utiliza el evaluador, incluido razonamiento y caché cuando corresponden. No multiplicar este valor por tus consultas para presupuestar.
- Configuración visible: low, medium, high, xhigh y max identifican esfuerzo. En las filas de Claude mantenemos la condición con fallback de la fuente; no equivale a una configuración sin respaldo.
- Precisión: mantenemos los enteros y los costes de la tabla consultada. No atribuimos significación estadística a diferencias pequeñas ni construimos una clasificación universal.
- Selección: un modelo ausente puede no estar incluido en esta edición. Las futuras incorporaciones necesitan puntuación y coste verificables bajo la misma metodología.
Registro de actualizaciones
| Fecha | Edición | Qué incorpora |
|---|---|---|
| 30 sep 2026 | Primera edición · índice AA v4.3.2 | 22 configuraciones de 10 creadores, gráfico, filtros, tabla, CSV y revisión de lanzamientos recientes |
En la siguiente revisión actualizaremos el corte de datos, incorporaremos modelos con resultados verificados y revisaremos las conclusiones. Si cambia la versión del benchmark, lo indicaremos: puntuaciones de versiones distintas no forman una serie histórica directamente comparable.
Preguntas frecuentes · 04
Dudas habituales
¿Qué modelo de IA es el mejor ahora?
Depende del trabajo y la configuración. El gráfico permite comparar inteligencia y coste dentro del benchmark AA; la decisión final necesita pruebas con tus tareas, tiempos de respuesta y reglas de aceptación.
¿El coste del gráfico es el precio por millón de tokens?
No. Es el coste medio ponderado en dólares por tarea del Artificial Analysis Intelligence Index. El precio por token y la suscripción de un asistente son medidas diferentes.
¿Este benchmark se actualiza automáticamente?
No. Cada edición se revisa editorialmente, conserva esta URL y publica una fecha de consulta y un registro de cambios. No se presentan datos como si fueran en directo.
¿Por qué aparece varias veces el mismo modelo?
Cada punto representa una configuración de esfuerzo de razonamiento. Cambiar el esfuerzo puede modificar la capacidad medida y el coste, aunque el nombre del modelo sea el mismo.
Fuentes y referencias
- Artificial Analysis · tabla de modelos consultada el 30/09/2026
- Artificial Analysis · metodología del Intelligence Index
- GPT-6.1 Sol · ficha y fecha de lanzamiento
- Claude Sonnet 5.5 · ficha y fecha de lanzamiento
- Claude Opus 5.5 · ficha y fecha de lanzamiento
- GPT-6 Luna · ficha del modelo
- MiMo-V2.6-Flash · ficha del modelo
- OpenRouter · rankings de uso y benchmarks
- Arena · clasificación por categorías
- OpenRouter · contabilidad de uso
Contenido revisado por Logic2b el . Los ejemplos de proceso son orientativos y deben adaptarse a cada negocio.
Del benchmark a tu proceso
Definimos contigo una tarea, los criterios de aceptación y un piloto medible para elegir la IA que encaja en tu empresa.
Explorar automatización con IA