---
title: "Benchmark IA: modelos, inteligencia y coste actualizados | Logic2b"
description: "Un observatorio para elegir con criterio: modelos actuales, gráfico de inteligencia frente a coste, novedades y claves para aplicar la IA en tu empresa. Edición de septiembre de 2026."
datePublished: 2026-09-30
dateModified: 2026-09-30
lang: es-ES
source_url:
  html: https://logic2b.com/blog/benchmark-ia/
  md: https://logic2b.com/blog/benchmark-ia/index.md
---

Ruta: [Inicio](https://logic2b.com/) › [Blog](https://logic2b.com/blog)

23 / IA Artículo del archivo

# Benchmark IA

Un observatorio para elegir con criterio: modelos actuales, gráfico de inteligencia frente a coste, novedades y claves para aplicar la IA en tu empresa. Edición de septiembre de 2026.

**Autor**

[Andreu Mariner](https://logic2b.com/blog/autor/andreu-mariner)

**Publicado**

30 sep 2026

**Actualizado**

30 sep 2026

**Lectura**

8 min

**Apartados**

08

**Palabras**

1413

**Figuras**

04

En este artículo

1. Qué encontrarás en este Benchmark IA
2. Inteligencia frente a coste: el mapa de modelos
3. Qué está cambiando esta semana
4. OpenRouter, Artificial Analysis y Arena: qué mirar en cada uno
5. Otras señales de actualidad que conviene seguir
6. Qué probar según el trabajo de tu empresa
7. Cómo leemos los datos y sus límites
8. Registro de actualizaciones

Volver arriba

Respuesta corta

## Lo esencial

El modelo más capaz y el que mejor encaja en tu trabajo pueden ser distintos. Este Benchmark IA compara capacidad y coste con una instantánea fechada de Artificial Analysis y utiliza OpenRouter como referencia de adopción. Consulta el gráfico, identifica candidatos dentro de tu presupuesto y prueba después con tus propias tareas. Mantendremos esta misma página al revisar los modelos y las novedades.

- Compara modelos con su configuración de razonamiento: cambiar el esfuerzo también cambia el resultado y el gasto.
- El gráfico mide dólares por tarea del benchmark, no el precio de una consulta de tu empresa.
- Las novedades son un punto de partida para probar; las decisiones dependen de calidad, tiempo de respuesta y coste por caso aceptado.

## Qué encontrarás en este Benchmark IA

Esta es la primera edición de nuestro observatorio, con corte editorial a **30 de septiembre de 2026**. Reunimos una selección de modelos generalistas y varias configuraciones de los lanzamientos recientes para entender qué cambia cuando aumenta el esfuerzo de razonamiento. No pretende recoger cada modelo existente: priorizamos diversidad de creadores, alternativas económicas y opciones de mayor capacidad.

La fecha de consulta importa tanto como el nombre. Los precios, las evaluaciones y los modelos disponibles cambian. Cada revisión conservará la URL **/blog/benchmark-ia/**, actualizará la ficha y explicará los cambios. Es una publicación de revisión editorial; los datos no se refrescan en directo al abrir la página.

## Inteligencia frente a coste: el mapa de modelos

Cada punto representa **un modelo y una configuración**. La inteligencia sube en el eje vertical; el coste aumenta hacia la derecha. Para comparar importes muy diferentes utilizamos una escala logarítmica: pasar de 0,01 a 0,1 dólares ocupa la misma distancia que pasar de 0,1 a 1. La zona superior izquierda reúne más capacidad con menos gasto dentro de esta medida.

Observatorio / IA 30 septiembre 2026

**Más capacidad, menos coste: encuentra tus candidatos** Artificial Analysis Intelligence Index v4.3.2. Selección editorial de configuraciones consultadas el 30 septiembre 2026. Activa los filtros o selecciona un punto para consultar sus datos.

Índice AA v4.3.2 22 configuraciones 10 creadores

Línea discontinua: frontera de eficiencia de esta selección. Los números remiten a la tabla. Toca un punto para ver su ficha.

**GPT-6.1 Sol · max** OpenAI · 52 puntos · 0,72 US$ por tarea AA

22 configuraciones visibles

**Configuraciones evaluadas · inteligencia y coste de la misma instantánea**

| N.º / modelo | Configuración | Índice AA | USD / tarea AA |
| --- | --- | --- | --- |
| 01 / Claude Opus 5.5 Anthropic | max · con fallback | 58 | 5,98 US$ |
| 02 / Claude Sonnet 5.5 Anthropic | max · con fallback | 56 | 7,60 US$ |
| 03 / Claude Opus 5.5 Anthropic | high · con fallback | 54 | 1,82 US$ |
| 04 / GPT-6 Astra OpenAI | max | 53 | 3,26 US$ |
| 05 / GPT-6.1 Sol OpenAI | max | 52 | 0,72 US$ |
| 06 / Claude Sonnet 5.5 Anthropic | xhigh · con fallback | 52 | 2,74 US$ |
| 07 / GPT-6.1 Sol OpenAI | xhigh | 51 | 0,39 US$ |
| 08 / Claude Opus 5.5 Anthropic | medium · con fallback | 51 | 1,34 US$ |
| 09 / GPT-6.1 Sol OpenAI | high | 50 | 0,32 US$ |
| 10 / GPT-6.1 Sol OpenAI | medium | 48 | 0,21 US$ |
| 11 / Muse Spark 1.3 Meta | max | 48 | 1,60 US$ |
| 12 / MiMo-V2.6-Pro Xiaomi | Configuración publicada | 46 | 0,13 US$ |
| 13 / Grok 4.7 SpaceXAI | high | 46 | 2,73 US$ |
| 14 / GLM-5.3 Z AI | max | 45 | 2,01 US$ |
| 15 / Qwen3.8 Max (0902) Alibaba | Configuración publicada | 45 | 5,41 US$ |
| 16 / Kimi K3 Kimi | max | 44 | 2,00 US$ |
| 17 / GLM-5.3-Flash Z AI | Configuración publicada | 42 | 0,25 US$ |
| 18 / Gemini 3.8 Flash Google | high | 41 | 1,24 US$ |
| 19 / DeepSeek V4.1 Flash DeepSeek | max | 39 | 0,27 US$ |
| 20 / MiMo-V2.6-Flash Xiaomi | Configuración publicada | 38 | 0,06 US$ |
| 21 / GPT-6 Luna OpenAI | max | 37 | 0,07 US$ |
| 22 / GPT-6 Luna OpenAI | low | 21 | 0,0045 US$ |

Fuente: [Artificial Analysis](https://artificialanalysis.ai/leaderboards/models). Consulta: 30 septiembre 2026. Puntuaciones enteras de la tabla pública; los empates pueden ocultar diferencias decimales. El coste pertenece a las tareas del benchmark; no es el precio de una consulta de tu negocio ni de una suscripción.

[Descargar datos · CSV](https://logic2b.com/blog/benchmark-ia/datos.csv)

La línea discontinua une las opciones para las que ninguna otra configuración visible tiene igual o mayor puntuación a menor o igual coste, con al menos una mejora. Se llama **frontera de Pareto**. Al filtrar por creador se calcula dentro de ese grupo. Estar fuera de la línea no descarta un modelo: puede encajar mejor por idioma, herramientas, disponibilidad o tiempo de respuesta. Los empates del índice se muestran con la precisión entera publicada.

## Qué está cambiando esta semana

### GPT-6.1 Sol: un lanzamiento que merece entrar en la prueba

La ficha de [GPT-6.1 Sol en Artificial Analysis](https://artificialanalysis.ai/models/gpt-6-1-sol) fecha su lanzamiento el 29 de septiembre. Su configuración max registra 52 puntos y 0,72 USD por tarea del índice. También incluimos medium, high y xhigh para comparar el salto de gasto. Nuestra lectura: conviene ensayar varios esfuerzos con la misma tarea antes de elegir max como ajuste habitual.

### Claude Sonnet 5.5 y Opus 5.5: revisar el esfuerzo, además del apellido

[Sonnet 5.5](https://artificialanalysis.ai/models/claude-sonnet-5-5) aparece con fecha de lanzamiento del 28 de septiembre: su configuración max con fallback alcanza 56 puntos y 7,60 USD por tarea AA. [Opus 5.5](https://artificialanalysis.ai/models/claude-opus-5-5), publicado el 22 de septiembre, registra 58 puntos y 5,98 USD en max con fallback. Son resultados de esas configuraciones evaluadas; el nombre comercial por sí solo no permite anticipar cuánto costará resolver un caso.

### El extremo económico también se mueve

[GPT-6 Luna en max](https://artificialanalysis.ai/models/gpt-6-luna) registra 37 puntos y 0,07 USD por tarea del índice. [MiMo-V2.6-Flash](https://artificialanalysis.ai/models/mimo-v2-6-flash) figura en la selección con 38 puntos y 0,06 USD. Estos resultados invitan a probar alternativas para trabajos repetitivos con salida verificable. Que una tarea sea frecuente no significa que tolere errores: el control de calidad sigue formando parte del proceso.

## OpenRouter, Artificial Analysis y Arena: qué mirar en cada uno

| Referencia | Qué aporta | Cómo usarla |
| --- | --- | --- |
| Artificial Analysis | Evaluaciones de capacidad, coste por tarea y rendimiento | Preparar una lista corta con la misma versión de índice y configuración |
| OpenRouter Rankings | Uso observado de modelos dentro de su plataforma | Detectar adopción y tendencias; distinguir uso de capacidad |
| Arena | Comparaciones y preferencias de usuarios por categorías | Contrastar tareas de conversación o creación con evaluaciones técnicas |

[OpenRouter Rankings](https://openrouter.ai/rankings) explica que ordena su clasificación de uso por tokens procesados. Su apartado de benchmarks incorpora además puntuaciones de Artificial Analysis. Conviene leer el eje de cada gráfico: volumen de uso, precio de entrada y coste por tarea describen cosas distintas. [Arena](https://arena.ai/leaderboard) ofrece otra perspectiva por categorías. No mezclamos sus puntuaciones con el índice AA en el mismo eje.

## Otras señales de actualidad que conviene seguir

### Agentes: la prueba empieza a parecerse más al trabajo

La [metodología del índice v4.3.2](https://artificialanalysis.ai/methodology/intelligence-benchmarking) incorpora, entre otras evaluaciones, AutomationBench-AA y Terminal-Bench 4.0. Para una empresa, la pregunta útil es si el sistema termina un flujo con varias herramientas y estados. Resolver un mensaje aislado no demuestra que pueda conciliar documentos, gestionar una excepción y dejar un registro comprensible.

### Documentos, imágenes y vídeo necesitan su propia comparación

Analizar una factura fotografiada, redactar una respuesta y generar un vídeo son trabajos diferentes. El índice de este gráfico compara modelos de lenguaje y no demuestra calidad de generación de imagen, voz o vídeo. Para producción creativa conviene consultar las [evaluaciones específicas de imagen, vídeo y voz](https://artificialanalysis.ai/) y probar material real: texto pequeño, coherencia, duración, revisiones y coste del resultado utilizable.

### Menos gasto por token no garantiza menos gasto por trabajo

Un agente puede pedir información, llamar a una herramienta, revisar su respuesta y repetir. El resultado depende del número de pasos y de lo que haya que corregir. La documentación de [contabilidad de uso de OpenRouter](https://openrouter.ai/docs/cookbook/administration/usage-accounting) permite consultar consumo y coste. Para decidir, agrupa todas las llamadas del mismo caso y añade la revisión humana.

## Qué probar según el trabajo de tu empresa

| Trabajo | Primer criterio | Prueba que decide |
| --- | --- | --- |
| Clasificar solicitudes o extraer campos | Coste bajo con formato verificable | Campos correctos, casos incompletos y tasa de revisión |
| Responder con documentación propia | Uso fiel de las fuentes | Citas que sostienen la respuesta y abstención cuando falta evidencia |
| Programar o usar varias herramientas | Finalización del flujo | Tarea resuelta con permisos, validaciones y errores de herramienta |
| Redactar contenido de marca | Calidad editorial en español | Correcciones necesarias, tono y fidelidad a los hechos |
| Conversar en tiempo real | Respuesta completa a tiempo | Espera percibida y calidad con la configuración más rápida aceptable |

Nuestra propuesta es elegir tres candidatos: uno económico, uno equilibrado y uno de mayor capacidad. Somételos al mismo conjunto de casos y a las mismas reglas de aceptación. En [cómo elegir un modelo de IA para tu empresa](https://logic2b.com/blog/elegir-modelo-ia-empresa) explicamos una prueba práctica. Para llevar el resultado a presupuesto, consulta [cómo calcular el coste real de la IA](https://logic2b.com/blog/coste-real-ia-empresa).

## Cómo leemos los datos y sus límites

- **Misma referencia:** índice AA v4.3.2 y coste medio ponderado por tarea del mismo benchmark. Las cifras proceden de evaluaciones públicas; no son pruebas ejecutadas por Logic2b.
- **Coste comparable:** incorpora el consumo y las tarifas que utiliza el evaluador, incluido razonamiento y caché cuando corresponden. No multiplicar este valor por tus consultas para presupuestar.
- **Configuración visible:** low, medium, high, xhigh y max identifican esfuerzo. En las filas de Claude mantenemos la condición con fallback de la fuente; no equivale a una configuración sin respaldo.
- **Precisión:** mantenemos los enteros y los costes de la tabla consultada. No atribuimos significación estadística a diferencias pequeñas ni construimos una clasificación universal.
- **Selección:** un modelo ausente puede no estar incluido en esta edición. Las futuras incorporaciones necesitan puntuación y coste verificables bajo la misma metodología.

## Registro de actualizaciones

| Fecha | Edición | Qué incorpora |
| --- | --- | --- |
| 30 sep 2026 | Primera edición · índice AA v4.3.2 | 22 configuraciones de 10 creadores, gráfico, filtros, tabla, CSV y revisión de lanzamientos recientes |

En la siguiente revisión actualizaremos el corte de datos, incorporaremos modelos con resultados verificados y revisaremos las conclusiones. Si cambia la versión del benchmark, lo indicaremos: puntuaciones de versiones distintas no forman una serie histórica directamente comparable.

Preguntas frecuentes · 04

## Dudas habituales

**¿Qué modelo de IA es el mejor ahora?**

Depende del trabajo y la configuración. El gráfico permite comparar inteligencia y coste dentro del benchmark AA; la decisión final necesita pruebas con tus tareas, tiempos de respuesta y reglas de aceptación.

**¿El coste del gráfico es el precio por millón de tokens?**

No. Es el coste medio ponderado en dólares por tarea del Artificial Analysis Intelligence Index. El precio por token y la suscripción de un asistente son medidas diferentes.

**¿Este benchmark se actualiza automáticamente?**

No. Cada edición se revisa editorialmente, conserva esta URL y publica una fecha de consulta y un registro de cambios. No se presentan datos como si fueran en directo.

**¿Por qué aparece varias veces el mismo modelo?**

Cada punto representa una configuración de esfuerzo de razonamiento. Cambiar el esfuerzo puede modificar la capacidad medida y el coste, aunque el nombre del modelo sea el mismo.

## Fuentes y referencias

1. [Artificial Analysis · tabla de modelos consultada el 30/09/2026](https://artificialanalysis.ai/leaderboards/models)
2. [Artificial Analysis · metodología del Intelligence Index](https://artificialanalysis.ai/methodology/intelligence-benchmarking)
3. [GPT-6.1 Sol · ficha y fecha de lanzamiento](https://artificialanalysis.ai/models/gpt-6-1-sol)
4. [Claude Sonnet 5.5 · ficha y fecha de lanzamiento](https://artificialanalysis.ai/models/claude-sonnet-5-5)
5. [Claude Opus 5.5 · ficha y fecha de lanzamiento](https://artificialanalysis.ai/models/claude-opus-5-5)
6. [GPT-6 Luna · ficha del modelo](https://artificialanalysis.ai/models/gpt-6-luna)
7. [MiMo-V2.6-Flash · ficha del modelo](https://artificialanalysis.ai/models/mimo-v2-6-flash)
8. [OpenRouter · rankings de uso y benchmarks](https://openrouter.ai/rankings)
9. [Arena · clasificación por categorías](https://arena.ai/leaderboard)
10. [OpenRouter · contabilidad de uso](https://openrouter.ai/docs/cookbook/administration/usage-accounting)

Contenido revisado por Logic2b el 30 sep 2026. Los ejemplos de proceso son orientativos y deben adaptarse a cada negocio.

Del benchmark a tu proceso

Definimos contigo una tarea, los criterios de aceptación y un piloto medible para elegir la IA que encaja en tu empresa.

[Explorar automatización con IA](https://logic2b.com/automatizacion-ia)

Sigue leyendo Primero, más de IA

## Sigue leyendo más ideas del estudio.

[Ver todo el blog](https://logic2b.com/blog)

IA 30 sep 2026 7 min de lectura

### [Cuánto cuesta usar IA en una empresa: del token al trabajo resuelto](https://logic2b.com/blog/coste-real-ia-empresa)

Estructura 08 apartados, 1162 palabras

Leer artículo

IA 30 sep 2026 7 min de lectura

### [Cómo elegir un modelo de IA para tu empresa: una prueba con tus propios datos](https://logic2b.com/blog/elegir-modelo-ia-empresa)

Estructura 08 apartados, 1127 palabras

Leer artículo

IA 18 sep 2026 12 min de lectura

### [Copilotos de IA en empresa: cuándo actuar y cuándo pedir confirmación](https://logic2b.com/blog/copilotos-ia-empresa)

Estructura 08 apartados, 938 palabras

Leer artículo

---

Logic2b S.L. · Castellón (España) · [info@logic2b.com](mailto:info@logic2b.com) · [Contacto](https://logic2b.com/contacto/) · [Auditoría gratuita](https://logic2b.com/auditoria/) · [Índice para IA](https://logic2b.com/llms.txt)
