Mejores modelos de IA en 2026
Clasificaciones, comparativas y análisis a fondo, actualizados cada mes a medida que llegan nuevos modelos.
Agosto de 2026 arranca con Claude Opus 5 en lo más alto y dos coronas cambiando de manos. Opus 5 lidera el Intelligence Index de Artificial Analysis con 61 y su Agentic Index con 55,3 a $5 / $25 por 1M de tokens, la mitad del precio de Claude Fable 5, y ahora se ha llevado la corona de programación tras quedar primero en los dos tableros de programación por votos de Arena. El otro movimiento está en el extremo económico, donde DeepSeek V4-Flash 0731 llegó el 31 de julio como la nueva elección relación precio-rendimiento a $0.14 / $0.28. Abajo están los ganadores por categoría de agosto de 2026. Haz clic en cualquier tarjeta para saltar directamente al desglose completo, o usa la navegación fija para moverte entre categorías. Las clasificaciones, benchmarks y precios se actualizan dentro de las 48 horas siguientes al lanzamiento de cualquier modelo importante.
5 ago Muse Spark 1.2 y Muse Code, Intelligence Index de 51 a 54 con un $1.25 / $4.25 sin cambios, además de un agente de programación de terminal Nuevo
3 ago Alibaba Qwen 3.8 (Qwen3.8-Max), buque insignia multimodal de 2,4 billones de parámetros ya disponible en general a $2 / $6 Nuevo
31 jul DeepSeek DeepSeek V4-Flash 0731, mismo precio, mismo tamaño, Intelligence Index de 40 a 50 Nuevo
31 jul MiniMax MiniMax H3, vídeo 2K con audio estéreo nativo desde $0.13 por segundo Nuevo
Finales de jul Thinking Machines Inkling Small, una cuarta parte del tamaño de Inkling con casi la misma puntuación Nuevo
30 jul OpenAI Recorte de precios de GPT-5.6, Luna un 80 % más barato, Terra un 20 % más barato, Sol sin cambios
24 jul Anthropic Claude Opus 5, nuevo #1 en Artificial Analysis, lidera tanto el Intelligence Index (61) como el Agentic Index (55.3) Nuevo
24 jul Sakana AI Fugu-Ultra v1.1, renovación del motor de orquestación con mejoras reportadas por el proveedor de hasta 7,9 puntos sobre v1.0 al mismo precio Nuevo
21 jul Google Gemini 3.6 Flash, salida más barata, más rápido, mismo Intelligence Index
16 jul Moonshot AI Kimi K3, 2,8B de parámetros, el mayor modelo open-weight jamás publicado (pesos lanzados el 27 de julio) Nuevo
9 jul OpenAI GPT-5.6 Sol, Terra y Luna, familia de nueva generación en vivo en ChatGPT, Codex y la API
Pendiente Google Gemini 3.5 Pro, aún sin lanzar, meses de retraso según Bloomberg Retrasado
Mejor IA para escritura
La mejor IA para escritura es Claude Fable 5, el único modelo entre los tres primeros de los tres tableros independientes de escritura, con Claude Sonnet 5 como la elección de valor del plan gratuito y GPT-5.5 como alternativa para la escritura de negocios anclada en hechos. Fable 5 lidera la tabla de escritura creativa de Arena, encabeza LiveBench Language con 90,7 y queda tercero en EQ-Bench Creative Writing v3 por detrás de Kimi K3 y GPT-5.6 Sol. Ningún otro modelo está entre los tres primeros en más de uno de ellos. Es un cambio respecto al mes pasado, cuando Claude Sonnet 5 ocupaba este puesto por GDPval-AA; los tableros de preferencia no respaldan esa colocación, así que Sonnet 5 es ahora la elección de valor en lugar del líder de calidad. Fable 5 cuesta $10 / $50 por 1M de tokens y está incluido de forma permanente en Claude Max y Team Premium con cerca del 50 % de los límites de uso habituales. Si tu escritura es un entregable de trabajo en lugar de prosa, Claude Opus 5 encabeza de forma clara el tablero GDPval-AA v2 de entregables profesionales de Artificial Analysis con 1858, muy por delante del 1746 de Fable 5.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio (por 1M de tokens) |
|---|---|---|---|---|
| Claude Fable 5 | Mejor escritura en general | #1 Arena texto en general (1508.6), #1 LiveBench Language (90.7), #3 EQ-Bench | La opción más cara aquí | $10 / $50 |
| Kimi K3 | Ficción creativa y voz | #1 EQ-Bench Creative Writing (2377), 234 Elo por delante del segundo | Solo #10 en Arena escritura creativa | $3 / $15 |
| Claude Sonnet 5 | Escritura gratuita para el día a día | Gratis y por defecto en claude.ai, contexto 1M | #53 Arena escritura creativa; 75,0 LiveBench Language | $2 / $10 introductorio (luego $3 / $15) |
| Claude Opus 5 | Entregables profesionales | #1 GDPval-AA v2 con 1858, por delante de Fable 5 (1746) | Por detrás de Fable 5 en Arena texto y Humanity's Last Exam | $5 / $25 |
| GPT-5.5 | Escritura de negocios anclada en hechos | Mejoras documentadas de fiabilidad factual sobre GPT-5.4 | Los niveles de razonamiento están ahora marcados como obsoletos | $5 / $30 |
| Gemini 3.6 Flash | Borradores en volumen a escala | 17 % menos tokens de salida que 3.5 Flash | Más flojo en el razonamiento más difícil | $1.50 / $7.50 |
La corona de escritura se queda con Claude Fable 5, y es la decisión mejor respaldada de la página. Fable 5 es ahora #1 en la tabla de texto de Arena con 1508.6 en el corte del 1 de agosto, #1 en Humanity's Last Exam con 53,3 % y #1 en AA-Omniscience con 40, que son tres casas distintas coincidiendo. Claude Opus 5 mantiene el carril de entregables profesionales en GDPval-AA v2, donde el tablero recalibrado ahora marca 1858 frente al 1746 de Fable 5.
Mejor IA para chat & asistente diario
La mejor IA para el chat del día a día es GPT-5.6, y la razón honesta es el alcance en lugar de la posición en los tableros. Es el modelo que ChatGPT sirve por defecto a la mayor base de usuarios de la categoría, lo que lo convierte en el mejor asistente que la mayoría de la gente puede abrir de verdad. En preferencia humana pura no es el líder: GPT-5.6 Sol se sitúa #14 en la tabla de texto de Arena con 1482,8, donde Claude Fable 5 lidera con 1508.6. La mayoría de los usuarios de ChatGPT reciben el nivel equilibrado Terra, que OpenAI dice que iguala a GPT-5.5 y, desde el recorte de precios del 30 de julio de 2026, cuesta un 60 % menos. Está disponible dentro de ChatGPT (gratis con límites, Plus a $20/mes, Pro a $100/mes), a través de la API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $5 / $30 por 1M de tokens), y empaquetado dentro de Fello AI junto a Claude, Gemini, Grok y DeepSeek. Una advertencia: la system card de OpenAI y el evaluador METR señalaron un comportamiento de «scheming» elevado en Sol, así que GPT-5.5 Instant sigue siendo la elección más segura para trabajo sensible a las alucinaciones.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| GPT-5.6 | Chat diario, por defecto de ChatGPT | El asistente que la mayoría puede abrir; Terra iguala a GPT-5.5 a ~mitad de coste | #14 en Arena texto; scheming señalado por METR | Gratis / $20/mes Plus; API $0.20 / $1.20 a $5 / $30 |
| Claude Fable 5 | La conversación mejor valorada | #1 en Arena texto en general (1508.6) y en 6 de 7 subcategorías | Sin plan gratuito; acceso por créditos de uso en Pro | $10 / $50 API |
| Claude Opus 5 | Respuestas reflexivas y matizadas | #1 Artificial Analysis Intelligence Index (61) y Agentic Index (55.3) | #6 en Arena texto, por detrás de Claude Fable 5 | $20/mes Pro, $5 / $25 API |
| GPT-5.5 Instant | Trabajo diario sensible a las alucinaciones | 52,5 % menos afirmaciones alucinadas vs. 5.3 Instant | Los niveles de razonamiento están ahora marcados como obsoletos | $20/mes Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rápido, gratis, multimodal | Gratis en la aplicación de Gemini, contexto 1M, #12 en Arena texto | Más flojo en el razonamiento más difícil | Gratis / $1.50 / $7.50 API |
| Fello AI | Todos los mejores modelos, una app | ChatGPT + Claude + Gemini + Grok + DeepSeek y más en Mac, iPhone y iPad | Enrutado por la app, no directo | $9.99/mes |
GPT-5.6 mantiene la elección de chat por alcance, y la distancia con el líder de preferencia se amplió en lugar de cerrarse. En el corte del 1 de agosto Sol se sitúa #14 en Arena texto con 1482,8, bajando desde #11, mientras Claude Fable 5 lidera con 1508.6. Nada del producto cambió, así que la corona no se mueve: sigue tratándose de qué asistente puede abrir de verdad la mayoría de la gente.
Mejor IA para imágenes
La mejor IA para la generación de imágenes es ChatGPT Images 2.0, y es la corona menos discutida de esta página. GPT Image 2 lidera el tablero de texto a imagen de Arena con 1385 Elo y su tablero de edición de imágenes con 1463, y Artificial Analysis lo pone primero en su propia arena de imagen con 1339,4. Es la elección natural siempre que tu imagen tenga que contener palabras legibles, en español o en otra escritura, y está incluido en ChatGPT Plus y Pro. Los segundos puestos han cambiado. Reve 2.1 (9 de julio) es el verdadero #2 en texto a imagen con 1302, y Reve 2.0 ahora se sitúa por detrás de él en los dos tableros. Muse Image de Meta es #3 en el tablero de texto a imagen de Arena y #2 en edición de imágenes, la mejor actuación que ha logrado ningún modelo de imagen de Meta. Nano Banana Pro de Google ya no es el segundo en general: en texto a imagen se clasifica entre #8 y #11, por debajo de su propio hermano más barato Nano Banana 2, aunque queda más arriba en edición de imágenes.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| ChatGPT Images 2.0 | Imágenes con texto legible | #1 texto a imagen (1385) y #1 edición de imágenes (1463) | Menos fotorrealista que la línea de imagen de Gemini | Incluido en ChatGPT Plus |
| Reve 2.1 | Diseño, tipografía, 4K nativo | #2 texto a imagen con 1302, edición que preserva el diseño | Ecosistema más pequeño | Gratis / desde $7.99/mes |
| Muse Image | Edición de imágenes, ecosistema Meta | #3 texto a imagen, #2 edición de imágenes (1407) | Nuevo, herramientas escasas a su alrededor | Aplicación Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Retratos y productos fotorrealistas | Supera a Nano Banana Pro en los dos tableros | Más flojo en texto dentro de la imagen | Aplicación Gemini / AI Studio |
| Seedream 5.0 Pro | Texto multilingüe + edición por regiones | 10+ idiomas incl. árabe RTL, edición con lazo y capas | Sin benchmarks independientes; incertidumbre de derechos de autor | BytePlus / Magnific |
| Midjourney v8 | Arte estilizado, ilustración | Base estética que la mayoría de los artistas prefieren | Más flojo en texto dentro de la imagen | $10-$120/mes |
| Grok Imagine | NSFW / Spicy Mode | Los límites más permisivos | Un modelo más pequeño por detrás | $30/mes SuperGrok |
La corona de imagen no cambia y GPT Image 2 sigue liderando los tres tableros que seguimos, en Arena texto a imagen (1385), Arena edición de imágenes (1463) y la arena de imagen de Artificial Analysis (1339,4). La única incorporación es MAI-Image-2.5 de Microsoft, que se sitúa tercero en el tablero de imagen de Artificial Analysis con 1269,7 y tercero en el tablero de edición de imágenes de Arena, así que el tercer puesto ahora depende de qué casa leas.
Mejor IA para vídeo
La mejor IA para la generación de vídeo es Gemini Omni Flash, que lidera el tablero de texto a vídeo de Arena con 1527 Elo, 45 puntos completos por delante del segundo, y también encabeza la arena de vídeo de Artificial Analysis. Es #1 en las dos casas, algo que ningún otro modelo de vídeo logra. El precio va de $1.50 de entrada y $17.50 por 1M de tokens de salida de vídeo, lo que sale a unos $0.10 por segundo de vídeo terminado, y admite edición conversacional. El único límite real es la duración: Omni Flash genera clips de 10 segundos. Si necesitas tomas más largas, Veo 3.1 sigue siendo la herramienta adecuada dentro de la aplicación de Gemini, AI Studio y Vertex AI, con audio nativo y salida 1080p. Esto reemplaza a Veo 3.1 en lo alto de la categoría; Veo 3.1 es un buen modelo pero no el líder, con su mejor variante en #6 del tablero de texto a vídeo de Arena. El aspirante a vigilar es MiniMax H3 (31 de julio), que genera clips 2K de 4 a 15 segundos con audio estéreo nativo y se factura por segundo desde $0.13 a 2K, ya #2 en el tablero de vídeo de Artificial Analysis con 1241,5. No movemos la corona por eso: la puntuación tiene un día, viene del único tablero que no se ha reproducido entre análisis, y el corte de votos de texto a vídeo de Arena es anterior a H3.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| Gemini Omni Flash | Mejor vídeo de IA en general | #1 en los dos tableros de vídeo (1527 Arena), edición conversacional | Limitado a generaciones de 10 segundos | ~$0.10/s; aplicación Gemini / AI Studio |
| MiniMax H3 | Clips 2K con audio nativo | 4-15 s a 2K, audio estéreo nativo; #2 en AA vídeo (1241.5) | Tiene un día, aún sin votos en Arena; pesos no publicados | $0.13/s a 2K |
| Dreamina Seedance 2.0 | El rival más cercano | #2 texto a vídeo (1482) y #1 en imagen a vídeo | Ecosistema ByteDance, acceso occidental limitado | Dreamina / BytePlus |
| Muse Video | Vídeo en el ecosistema Meta | #3 texto a vídeo con 1459 | El más nuevo del grupo, herramientas escasas | Aplicación Meta AI |
| Veo 3.1 | Clips de producción más largos | Audio nativo, 1080p, fuerte consistencia física | #6 en Arena vídeo, no el líder de calidad | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Iteración rápida a menor coste | 4K nativo, 60fps, clips de 15 segundos; Turbo salió el 17 de junio | Fuera del top 16 en Arena texto a vídeo | Desde $10/mes |
| Luma Ray 3 | Escenas fotorrealistas | Fuerte realismo para paisajes | Comunidad más pequeña | Gratis / desde $9.99/mes |
Gemini Omni Flash mantiene la corona de vídeo, y sigue siendo #1 en los dos tableros, con 1527,5 en Arena y 1244,8 en Artificial Analysis. MiniMax H3 (31 de julio) entra como aspirante en #2 del tablero de vídeo de Artificial Analysis (1241,5), a 3,3 Elo, y supera a Omni Flash en especificaciones con salida 2K, clips de hasta 15 segundos y audio estéreo nativo. Mantenemos la corona porque ese margen tiene un día, es de un solo tablero y no lleva votos en Arena, cuyo corte de texto a vídeo es anterior al lanzamiento.
Mejor IA para programación
La mejor IA para programación es Claude Opus 5, y gana en los dos tableros donde los desarrolladores votan sobre el resultado terminado en lugar de un script midiendo un harness. Es #1 en el tablero WebDev de Arena con 1,702.9 y #1 en image-to-WebDev con 1,668.6, en cortes de votos del 1 de agosto y el 31 de julio. El precio es la segunda mitad del argumento: Opus 5 corre a $5 / $25 por 1M de tokens frente a los $10 / $50 de Claude Fable 5, y Artificial Analysis lo mide en $2.34 por tarea de índice frente a los $3.15 de Fable 5. La propia documentación de Anthropic dice a los desarrolladores que empiecen con Opus 5 para programación agéntica compleja y reserven Fable 5 para cargas que necesiten la máxima capacidad disponible. Claude Fable 5 es el segundo y sigue siendo la elección para el trabajo de largo horizonte más difícil, en #4 en WebDev (1,630.7) y #2 en image-to-WebDev (1,625.7). El aspirante es Kimi K3, que se lleva el #2 en WebDev con 1,675.5 y el #3 en el tablero Agent de Arena, el programador open-weight más fuerte en los tableros, aunque autoalojarlo significa 1,56 TB de pesos. En el Coding Index de Artificial Analysis no es un barrido de Claude: GPT-5.6 Sol (xhigh) lidera con 78,3 con Opus 5 (max) en 78,0, lo bastante cerca para llamarlo empate. El aspirante serio más barato es ahora DeepSeek V4-Flash 0731 a $0.14 / $0.28.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio (por 1M de tokens) |
|---|---|---|---|---|
| Claude Opus 5 | Mejor programación en general | #1 Arena WebDev (1,702.9) y #1 image-to-WebDev (1,668.6); $2.34 por tarea de índice | El Coding Index de Artificial Analysis tiene a GPT-5.6 Sol un pelín por delante | $5 / $25 |
| Claude Fable 5 | El trabajo agéntico de largo horizonte más difícil | #2 Arena image-to-WebDev (1,625.7), #4 WebDev; contexto 1M | El más caro; el Coding Index de Artificial Analysis lo pone 7º | $10 / $50 |
| Kimi K3 | Construcción de apps web y agentes | #2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index abierto más alto (57) | 1,56 TB para autoalojar | $3 / $15 |
| GPT-5.6 Sol | Buque insignia de OpenAI, programación agéntica | #1 Artificial Analysis Coding Index con 78,3 (xhigh) | Ausente del tablero oficial de Terminal-Bench; manipulación de evals señalada por METR | $5 / $30 |
| Muse Spark 1.2 | Programación agéntica barata | Intelligence Index 54 a $1.25 / $4.25; 80 % en Terminal-Bench 2.1 (Artificial Analysis) | Segundo tras Opus 5 en los tres gráficos de programación propios de Meta (82,9 % vs. 86,7 %); Scale SEAL solo ha valorado la 1.1 | $1.25 / $4.25 |
| Grok 4.5 | Programador barato de buen valor | #4 en el tablero oficial de Terminal-Bench 2.1 con 79,3 % vía Cursor CLI | Mayor tasa de alucinación; consola API de la UE aún cerrada | $2 / $6 |
| Gemini 3.6 Flash | Programación de agentes a escala | Intelligence Index 50, 17 % menos tokens de salida que 3.5 Flash | Más flojo en el razonamiento más difícil | $1.50 / $7.50 |
| GLM-5.2 | Mejor programador open-weight que puedes alojar | Intelligence Index 51, #6 Arena WebDev (1,587.1), licencia MIT | Kimi K3 lo supera; solo autoalojado o proveedor | Open weights (MIT) |
La corona de programación se movió a Claude Opus 5. Arena terminó de valorarlo, y quedó primero en los dos tableros de programación, WebDev con 1,702.9 e image-to-WebDev con 1,668.6, con Claude Fable 5 cuarto y segundo. Son tableros por votos con cortes publicados, así que la corona ahora descansa sobre comparaciones humanas en lugar de sobre un solo harness, y Opus 5 lo hace a la mitad del precio de Fable 5. Fable 5 pasa a ser el segundo para el trabajo de largo horizonte más difícil, y Kimi K3 sigue siendo el aspirante en #2 en WebDev. Muse Spark 1.2 de Meta llegó el 5 de agosto y no cambia eso, porque en los propios gráficos de Meta queda segundo tras Opus 5 en cada benchmark de programación que publicó.
Mejor IA para creatividad
La mejor IA para el trabajo creativo sin filtros y a la última es Grok 4.5, y queremos ser exactos sobre por qué. Esta elección es sobre el producto, no sobre la calidad de la prosa. Grok 4.5 lleva las menos restricciones de contenido de cualquier modelo frontier y la única integración nativa con X en tiempo real, lo que lo convierte en el único modelo que se involucrará con encargos atrevidos, de actualidad o deliberadamente provocadores que los demás rechazan. Es el modelo por defecto en la aplicación de Grok para suscriptores de SuperGrok y X Premium+ a $30/mes. No es el mejor escritor, y los tableros son contundentes al respecto. Grok 4.5 se sitúa #33 en EQ-Bench Creative Writing y #41 en la tabla de escritura creativa de Arena, perdiendo en ambas ante el más antiguo Grok 4.20-beta1. Si eliges solo por calidad de salida, Claude Fable 5 gana de forma clara en #1 en Arena escritura creativa, y Kimi K3 gana EQ-Bench. Elige Grok 4.5 por lo que te deja crear, no por lo bien que escribe.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| Grok 4.5 | Sin filtros, con opinión, a la última | Menos restricciones de contenido, anclaje nativo en X en tiempo real | #33 EQ-Bench, #41 Arena escritura creativa | $30/mes SuperGrok |
| Claude Fable 5 | Prosa creativa de máxima calidad | #1 Arena escritura creativa, #1 LiveBench Language | Límites cautelosos ante encargos atrevidos | $10 / $50 API |
| Kimi K3 | Ficción y voz distintiva | #1 EQ-Bench Creative Writing con 2377 | Solo #10 en Arena escritura creativa | $3 / $15 |
| Claude Opus 5 | Creatividad estructurada de formato largo | Mantiene hilos largos y se autoedita; #1 Intelligence Index | El más cauteloso del grupo | $20/mes Pro; $5 / $25 API |
| Gemini 3.1 Pro | Creatividad multimodal | Fuerte cadena de texto, imagen y vídeo | Cuotas dentro de la aplicación de Gemini | Gratis / $2.00-$4.00 API entrada |
| Grok Imagine (Spicy Mode) | NSFW / creatividad para adultos | La generación de imágenes más permisiva | Caso de uso de nicho | $30/mes SuperGrok |
Grok 4.5 mantiene esta elección, y nada del producto se movió. Está aquí por su permisividad y su acceso en vivo a X, no por su posición en los tableros, y Claude Fable 5 sigue siendo el modelo que usar cuando quieres la mejor escritura. Una nota de nombre para agosto: xAI ahora cotiza en los tableros como SpaceXAI, y el modelo no cambia.
Mejor IA para precisión & investigación
La mejor IA para precisión e investigación es Gemini 3.1 Pro. Su resultado más fuerte es en ARC-AGI-1 de ARC Prize, donde puntúa un 98 % e iguala al panel humano, y lo hace a $0.52 por tarea. Esa combinación es el argumento: varios modelos están cerca en capacidad, ninguno lo iguala en coste para trabajo factual fiable. Lo empareja con anclaje nativo en Google Search, que es lo que quieres cuando la respuesta tiene que ser actual en lugar de simplemente plausible. También puntúa un 94,1 % en GPQA Diamond, donde GPT-5.6 Sol ahora lo iguala en lugar de quedar por detrás, y un 44,4 % en Humanity's Last Exam, y encabeza el tablero HLE de Scale SEAL con 46,44. Hemos descartado el marco anterior de ARC-AGI-2: su 77,1 % sigue siendo correcto, pero el tablero se ha movido y esa puntuación ahora lo sitúa alrededor del puesto 14. Dos advertencias honestas. En búsqueda anclada en concreto, la tabla de búsqueda de Arena la lidera Anthropic, no Google, con Gemini 3.1 Pro con anclaje en #7. Y en razonamiento novedoso, GPT-5.6 Sol lidera ARC-AGI-2 y Claude Opus 5 lidera ARC-AGI-3 con un 30 %, cerca de 3,75 veces el siguiente mejor modelo. No movimos la corona a Opus 5 porque Artificial Analysis mide su tasa de alucinación en un 50 % y lo sitúa por debajo de Fable 5 en AA-Omniscience.
| Modelo | Mejor para | Benchmark clave | Debilidad | Precio |
|---|---|---|---|---|
| Gemini 3.1 Pro | Trabajo factual barato y fiable | 98 % ARC-AGI-1 (iguala al panel humano) a $0.52/tarea, 94,1 % GPQA (igualado por Sol) | ARC-AGI-2 77,1 % ahora ~14º; #7 en Arena búsqueda | $2.00-$4.00 / $12.00-$18.00 (escalonado) |
| Claude Fable 5 | Búsqueda anclada | #1 y #3 en la tabla de búsqueda de Arena, por delante de Google | Ningún nivel barato único | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Razonamiento novedoso | #1 ARC-AGI-2 con 93 %, contra un panel humano del 100 % | Scheming señalado por METR | $5 / $30 |
| Claude Opus 5 | Los problemas inéditos más difíciles | #1 ARC-AGI-3 con 30 %, ~3,75 veces el siguiente modelo (ARC Prize) | Artificial Analysis mide una tasa de alucinación del 50 % | $5 / $25 |
| Qwen 3.7 Max | Precisión frontier a precio de valor | 92,4 GPQA Diamond, 200 solicitudes gratis/día | Solo API, sin front-end de chat | $1.25 / $3.75 promo; $2.50 / $7.50 lista |
| Claude Opus 4.6 | Honestidad bajo presión | #1 en el tablero MASK de Scale SEAL con 96,28; Anthropic ocupa el top 5 | Reemplazado como buque insignia | Modelo legacy de Anthropic |
Gemini 3.1 Pro mantiene la corona de precisión, pero su cifra estrella ya no es una ventaja. Su puntuación de GPQA Diamond se recalibró a 94,1 % y GPT-5.6 Sol ahora lo iguala exactamente, así que la corona descansa sobre el resultado de ARC-AGI-1 a $0.52 por tarea más el anclaje de Search en lugar de sobre GPQA. Esta es la siguiente corona que volvemos a probar: Claude Fable 5 encabeza los tres tableros que miden con qué frecuencia un modelo simplemente se equivoca, con 40 en AA-Omniscience, 61 % en Omniscience Accuracy y 53,3 % en Humanity's Last Exam.
Mejor IA para resolución de problemas
La mejor IA para la resolución de problemas difíciles es GPT-5.6 Sol, y es la corona mejor respaldada de esta página. Se lleva el #1 en LiveBench Mathematics con 96,2, el #1 en LiveBench Reasoning con 91,7 y el #1 en ARC-AGI-2 con un 93 %, lo más cerca que ningún modelo ha llegado del panel humano del 100 %. Tres casas distintas lo ponen primero en las tareas de razonamiento que importan, que es más acuerdo del que produce cualquier otra categoría de esta página. OpenAI aún no ha publicado la puntuación de FrontierMath de Sol, así que la marca verificada de OpenAI sigue siendo el 39,6 % de GPT-5.5 Pro en FrontierMath Tier 4, y encajaremos el número de Sol en el momento en que se haga público. Qwen 3.7 Max es la alternativa de valor para problemas de estilo competición con 97,1 en el índice HMMT de febrero de 2026 y 44,5 en Apex, a una fracción del coste de ChatGPT Pro, y ahora incluye 200 solicitudes de modelo gratis al día. Claude Opus 5 es la alternativa para cadenas largas de razonamiento agéntico, liderando el Agentic Index de Artificial Analysis con 55,3 y ARC-AGI-3 de ARC Prize con un 30 %, cerca de 3,75 veces el siguiente mejor modelo.
| Modelo | Mejor para | Benchmark clave | Debilidad | Precio |
|---|---|---|---|---|
| GPT-5.6 Sol | Las matemáticas, la ciencia y el razonamiento más difíciles | #1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (93 %) | FrontierMath aún sin publicar; scheming señalado por METR | $100/mes ChatGPT Pro; API $5 / $30 |
| Claude Opus 5 | Cadenas largas de razonamiento agéntico | #1 Agentic Index (55.3), #1 ARC-AGI-3 (30 %) | Segundo en LiveBench Reasoning; tasa de alucinación del 50 % | $5 / $25 |
| GPT-5.5 Pro | Líder verificado de FrontierMath | 39,6 % FrontierMath Tier 4 | Reemplazado por Sol como buque insignia | $100/mes ChatGPT Pro |
| Qwen 3.7 Max | Matemáticas de competición con presupuesto ajustado | 97,1 HMMT 2026 feb, 44,5 Apex, 200 solicitudes gratis/día | Solo API | $1.25 / $3.75 promo; $2.50 / $7.50 lista |
| Claude Fable 5 | Matemáticas dentro de un flujo de programación | #1 en la subcategoría de matemáticas de Arena (1543), 96,0 LiveBench Mathematics | La opción más cara aquí | $10 / $50 |
| GLM-5.2 | Resolución de problemas open-weight | Intelligence Index abierto más alto con 51, MIT, contexto 1M | Solo autoalojado o proveedor | Open weights (MIT) |
GPT-5.6 Sol mantiene esta corona, y sumó un segundo argumento. Sol ahora también lidera el Terminal-Bench v2.1 de Artificial Analysis con un 89,5 % y su Coding Index con 78,3, e iguala a Gemini 3.1 Pro en GPQA Diamond con un 94,1 %. Claude Opus 5 sigue siendo la alternativa de razonamiento agéntico por la fuerza de ARC-AGI-3. El 1 de agosto OpenAI llamó a su próxima familia de modelos Astra y publicó diez nuevos resultados matemáticos de una versión interna, aunque Astra está sin lanzar y no tiene fecha, precio ni disponibilidad.
Mejor agente de IA
El mejor agente de IA ahora mismo es Gemini Spark para trabajo residente en la nube 24/7 y Claude Cowork para trabajo residente en el escritorio, con ChatGPT Codex como alternativa para agentes de programación y los agentes de navegador de clase OpenAI Operator como alternativa para tareas web. Los agentes de IA son la categoría que más rápido se mueve de 2026: cada proveedor de primer nivel lanza ahora un producto de agente, y la elección práctica es entre agentes que viven en la nube (se ejecutan mientras tu portátil está cerrado) y agentes que viven en tu escritorio (manejan tus apps directamente). Gemini Spark se lanzó en el Google I/O el 19 de mayo de 2026 y es el primer agente en la nube 24/7. Claude Cowork alcanzó la disponibilidad general el 9 de abril de 2026 y funciona como un agente de escritorio que maneja tus apps locales. ChatGPT Codex Mobile (14 de mayo) es la elección para trabajo de agente de programación. Lee la comparativa completa Gemini Spark vs. Claude Cowork.
| Agente | Mejor para | Dónde se ejecuta | Fortaleza | Precio |
|---|---|---|---|---|
| Gemini Spark | Tareas en la nube 24/7, flujos de Workspace | VM de Google Cloud (siempre activa) | Primer agente 24/7 real, integración profunda con Workspace | $99.99/mes Google AI Ultra |
| Claude Cowork | Escritorio, manejo de apps, diseño + código | Tu escritorio Mac/Windows | Maneja apps locales, ve tu pantalla | $20/mes Claude Pro |
| ChatGPT Codex Mobile | Agente de programación en el móvil | Nube de OpenAI + iOS/Android | Aprobar diffs y redirigir el trabajo desde el móvil | Incluido en los planes de ChatGPT |
| Grok Agentic (Grok 4.5) | Investigación en tiempo real, scraping de X | Nube de xAI | Integración nativa con X | $30/mes SuperGrok |
| OpenAI de clase Operator | Tareas de navegador, formularios web | Nube de OpenAI + tu navegador | Automatización web | ChatGPT Pro |
No se lanzaron nuevos agentes de consumo, y Muse Code de Meta (5 de agosto) es una herramienta de terminal para desarrolladores en lugar de una de consumo, así que la elección entre Gemini Spark (nube) y Claude Cowork (escritorio) sigue guiando la mayoría de las decisiones sobre agentes para usuarios individuales. La capa de modelo por debajo se movió de nuevo: Claude Opus 5 (24 de julio) se llevó el #1 en el Agentic Index de Artificial Analysis con 55,3, por delante de GPT-5.6 Sol con 54,0 y Claude Fable 5 con 52,8, y cuesta $5 / $25. Opus 5 también encabeza el tablero Agent de Arena, con Kimi K3 en tercer lugar. Para equipos que construyen sus propios agentes, Muse Spark 1.2 de Meta (5 de agosto) es una opción agent-native barata a $1.25 / $4.25 cuyo Elo agéntico GDPval-AA v2 saltó de 1371 a 1631, aunque Scale SEAL solo ha valorado la 1.1 más antigua, que lidera su tablero de uso de herramientas MCP Atlas con 88,1. GLM-5.2 (MIT) es el modelo de agente open-weight más fuerte que puedes alojar en hardware modesto, en #5 del tablero Agent de Arena.
Mejor IA para estudiantes
La mejor IA para estudiantes es GPT-5.5 Free dentro de ChatGPT para trabajo de curso general y Gemini 3.6 Flash Free dentro de la aplicación de Gemini para STEM y estudio multimodal, con Qwen 3.7 Max como alternativa por API para conjuntos de problemas más difíciles (200 solicitudes gratis al día) y Claude Opus 5 como alternativa para editar ensayos. La mayoría de los estudiantes no necesitan pagar: el nivel gratuito de ChatGPT ahora usa por defecto GPT-5.6 (con GPT-5.5 aún disponible), Gemini 3.6 Flash está en la aplicación gratuita de Gemini y en AI Studio, Claude Sonnet 5 es el nuevo Claude gratuito por defecto, y DeepSeek V4 es gratis en el sitio de chat de DeepSeek. Para el desarrollo paso a paso en las matemáticas más difíciles, GPT-5.6 Sol es el nuevo buque insignia de OpenAI (su puntuación de FrontierMath aún no se ha publicado, con el 39,6 % verificado de GPT-5.5 Pro en FrontierMath Tier 4 como marca actual), aunque ambos son solo de pago; Qwen 3.7 Max es la alternativa de valor con 97,1 en HMMT 2026 febrero con precio de API de $1.25 / $3.75 en su promo del 50 % actual ($2.50 / $7.50 lista).
| Tarea | Mejor modelo | Por qué | ¿Gratis? | Alternativa |
|---|---|---|---|---|
| Ensayos & trabajo de curso | GPT-5.5 | Gratis en ChatGPT, fiabilidad factual mejorada vs. 5.4 | Sí | Claude Sonnet 5 (Claude gratis) |
| Resolución de problemas STEM | GPT-5.6 Sol / Qwen 3.7 Max | Nuevo buque insignia STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 feb | Pro de pago / Qwen API de pago | Gemini 3.6 Flash (gratis) |
| Investigación & precisión | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarea, anclaje nativo en Google Search | Sí (aplicación Gemini) | Claude Opus 5 |
| Edición de escritura | Claude Sonnet 5 | Gratis y por defecto en claude.ai; Claude Fable 5 es el líder de calidad | Sí (Claude gratis) | Claude Fable 5 |
| Estudio multimodal (PDF, diapositivas, imágenes) | Gemini 3.6 Flash | Contexto 1M, gratis en la aplicación de Gemini | Sí | NotebookLM (Google) |
Mejor IA para el trabajo & profesionales
La mejor IA para el trabajo profesional es GPT-5.6 (por defecto de ChatGPT desde el 9 de julio) para el trabajo de conocimiento diario, Claude Opus 5 para programación y escritura de alto riesgo, y Gemini Spark para flujos agénticos 24/7. La mayoría de los profesionales sacan el máximo partido ejecutando dos suscripciones de pago (ChatGPT Plus a $20/mes más Claude Pro a $20/mes, un total de $40/mes), o consolidando con Fello AI a $9.99/mes para los cinco mejores modelos en una app de Mac/iOS. Para el trabajo agéntico que corre mientras duermes, Gemini Spark en Google AI Ultra a $99.99/mes es el único agente en la nube 24/7 real.
| Caso de uso | Mejor modelo | Dato clave | Precio | Alternativa |
|---|---|---|---|---|
| Trabajo de conocimiento diario | GPT-5.6 | Por defecto de ChatGPT desde el 9 de julio; el asistente que la mayoría puede abrir | $20/mes ChatGPT Plus | Claude Opus 5 |
| Programación (propietaria) | Claude Opus 5 | #1 en Arena WebDev (1,702.9) e image-to-WebDev (1,668.6); el por defecto recomendado de Anthropic | $20/mes Claude Pro | Claude Fable 5 |
| Programación (rentable) | Qwen 3.7 Max | 80,4 SWE-Verified, contexto 1M | $1.25 / $3.75 promo; $2.50 / $7.50 lista | DeepSeek V4-Flash 0731 |
| Investigación & informes | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarea, anclaje de Google | Google AI Pro / Ultra | Claude Opus 5 |
| Matemáticas, física, modelado financiero difíciles | GPT-5.6 Sol | Nuevo buque insignia STEM de OpenAI (5.5 Pro verificado en 39,6 % FrontierMath) | $100/mes ChatGPT Pro | Qwen 3.7 Max |
| Flujos de agente siempre activos | Gemini Spark | Primer agente en la nube 24/7 | $99.99/mes Google AI Ultra | Claude Cowork |
| Noticias en vivo, creatividad con contexto de X | Grok 4.5 | Clase Opus + anclaje nativo en X | $30/mes SuperGrok | Gemini 3.1 Pro |
| Consolidación todo en uno | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/mes | Pagar a cada proveedor por separado |
Precios de los modelos de IA en agosto de 2026
Desde planes gratuitos de $0 hasta $199.99/mes de Google AI Ultra. El precio más determinante de esta tabla es Claude Opus 5 a $5 / $25, porque es el modelo #1 en el Intelligence Index de Artificial Analysis a la mitad del coste de Claude Fable 5. Muse Spark 1.2 de Meta se lista a $1.25 / $4.25, con un nivel Contributor a $0.10 / $0.20 para quien esté dispuesto a dejar que Meta entrene con sus prompts, y Grok 4.5 se lista a $2 / $6. La elección relación precio-rendimiento es ahora DeepSeek V4-Flash 0731 a $0.14 / $0.28, que iguala el Intelligence Index de 50 de Gemini 3.6 Flash y cuesta $0.03 por tarea de índice frente a los $0.56 de Flash. Entre los modelos cerrados, GPT-5.6 Luna es el más barato a $0.20 / $1.20 tras el recorte de OpenAI del 30 de julio. Para un desglose más a fondo consulta nuestra Guía completa de comparativa de precios de IA.
| Modelo | Entrada (por 1M) | Salida (por 1M) | Contexto | ¿Acceso gratis? |
|---|---|---|---|---|
| GPT-5.5 | $5.00 | $30.00 | 1M (400K en Codex) | ChatGPT Free; API de pago |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro desde $100/mes (nivel de mayor uso a $200) |
| GPT-5.6 Sol | $5.00 | $30.00 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| GPT-5.6 Terra | $2.00 | $12.00 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| GPT-5.6 Luna | $0.20 | $1.20 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Por defecto en Claude Pro/Max; API de pago |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Modelo legacy en Anthropic; Pro/Max/API |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Permanente en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos |
| Claude Sonnet 5 | $2.00 introductorio / $3.00 lista | $10.00 introductorio / $15.00 lista | 1M | Por defecto en Claude Free & Pro; API de pago |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API de pago (reemplazado por Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Aplicación Gemini limitada; API de pago |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M | Aplicación Gemini/AI Studio; nivel gratuito de API + API de pago |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; nivel gratuito de API + API de pago |
| Qwen 3.7 Max | $1.25 promo / $2.50 lista | $3.75 promo / $7.50 lista | 1M | 200 solicitudes gratis/día; API de pago más allá |
| MiniMax M3 | $0.30 (50 % de descuento sobre $0.60) | $1.20 (≤512K) | 1M | Open weights; se aplican costes de alojamiento |
| LongCat-2.0 | Depende del proveedor | Depende del proveedor | 1M | Open weights (MIT); se aplican costes de alojamiento |
| NVIDIA Nemotron 3 Ultra | Depende del proveedor | Depende del proveedor | 1M | Open weights (OpenMDW); se aplican costes de alojamiento |
| Qwen 3.5 (open-weight) | Autoalojado / Together | Autoalojado / Together | 1M | Open weights; se aplican costes de alojamiento |
| Nex-N2-Pro | Autoalojado / proveedores | Autoalojado / proveedores | 1M | Open weights (Apache 2.0); se aplican costes de alojamiento |
| Rio 3.5 Open 397B | Autoalojado / proveedores | Autoalojado / proveedores | 1M | Open weights (MIT); se aplican costes de alojamiento |
| Grok 4.3 | $1.25 | $2.50 | 1M | Plan de consumo gratuito; API de pago |
| Grok 4.5 | $2.00 | $6.00 | 500K | Grok Build / Cursor / consola xAI; UE parcial, consola API aún cerrada |
| Muse Spark 1.2 | $1.25 ($0.10 nivel Contributor) | $4.25 ($0.20 nivel Contributor) | 1M | API de pago; Muse Code, Meta Model API y OpenRouter; el nivel Contributor cambia derechos de entrenamiento por un ~92 % de descuento |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Nivel básico gratuito en la aplicación de Kimi; open weights en Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (vídeo) | $1.50 | $17.50 (salida de vídeo) | Clips de 10 segundos | Aplicación Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.435 ($0.0036 cache-hit) | $0.87 | 1M | DeepSeek Chat gratis; API de pago |
| DeepSeek V4-Flash 0731 | $0.14 | $0.28 | 1M | DeepSeek Chat gratis; API de pago |
| Kimi K2.7 Code | Depende del proveedor | Depende del proveedor | 256K | Open weights; se aplican costes de alojamiento |
| GLM-5.2 | Depende del proveedor | Depende del proveedor | 1M | Open weights; se aplican costes de alojamiento |
| ERNIE 5.1 | Precio para la región de China | Precio para la región de China | 256K | Nivel gratuito de Baidu |
| Gemini Spark (agente) | Sin precio de API | Sin precio de API | 1M (base Gemini) | Google AI Ultra $99.99 o $199.99/mes |
| Fello AI (agregador) | Enrutado por la app | Enrutado por la app | Depende del modelo | $9.99/mes, plan gratuito disponible |
Las tarifas de GPT-5.5 y GPT-5.5 Pro de arriba son precios de contexto corto; OpenAI ya no publica las cifras específicas de contexto largo. Los niveles GPT-5.6 se facturan a 2x entrada y 1,5x salida una vez que un prompt supera los 272K tokens de entrada, lo que sitúa a Terra de contexto largo en $4 / $18 y a Luna en $0.40 / $1.80. Si quieres acceso a varios modelos de IA sin gestionar suscripciones separadas, Fello AI ofrece GPT, Claude, Gemini, Grok, Perplexity y más en una sola app para Mac, iPhone y iPad desde $9.99/mes.
Mejores modelos open-weight en agosto de 2026
El mejor modelo open-weight en agosto de 2026 es Kimi K3, y se llevó la delantera en el momento en que Moonshot publicó los pesos el 27 de julio de 2026. Tiene el Intelligence Index más alto de cualquier modelo open-weight con 57 en Artificial Analysis v4.1, seis puntos por delante de GLM-5.2, y en Arena sigue siendo la entrada abierta mejor situada, en #2 en WebDev (1,675.5) por detrás solo de Claude Opus 5 y #3 en el tablero Agent. Una pega decide cuál de los dos deberías usar de verdad. La descarga de K3 son 96 shards de safetensors y unos 1,56 TB, lo que necesita un clúster de GPU multinodo en lugar de una estación de trabajo, y viene bajo una licencia propia Kimi K3 License en lugar de MIT. Así que GLM-5.2 (Z.ai, MIT) sigue siendo nuestra recomendación práctica para equipos que ejecutan sus propios pesos, con un Intelligence Index de 51, #6 en Arena WebDev (1,587.1) y #5 en el tablero Agent. El tercer puesto cambió de manos el último día de julio: DeepSeek V4-Flash 0731 recibió nuevo post-training y saltó de un Intelligence Index de 40 a 50, a $0.14 / $0.28 bajo MIT.
| Modelo | Mejor para | Benchmark clave | Contexto / Licencia | Dónde ejecutar |
|---|---|---|---|---|
| Kimi K3 | Modelo open-weight mejor puntuado, trabajo agéntico y web | II 57 (v4.1), el más alto de cualquier modelo open-weight; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B activos | 1M / Kimi K3 License | Hugging Face (96 shards, 1.56 TB), Moonshot API, proveedores |
| GLM-5.2 | Programación agéntica de largo horizonte, contexto 1M | II 51 (v4.1), el más alto que puedes alojar en hardware modesto; 744B/40B activos | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| DeepSeek V4-Flash 0731 | Mejor valor de cualquier modelo de la página | II 50 (v4.1), desde 40 el 31 de julio; $0.03 por tarea de índice, 284B/13B activos | 1M / MIT | DeepSeek API ($0.14/$0.28), local |
| LongCat-2.0 | Programador abierto frontier entrenado en chips chinos | II 33 (v4.1); 59,5 % SWE-Bench Pro (proveedor), 1.6T/~48B activos | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Multimodal de clase frontier barato | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / licencia por definir | Hugging Face, API $0.30/1M (50 % de descuento) |
| Nex-N2-Pro | Puntuación de programación abierta más fuerte | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B activos | Basado en Qwen / Apache 2.0 | Hugging Face, proveedores, autoalojado |
| Kimi K2.7 Code | Programador abierto con licencia comercial más fuerte | +21,8 % en Kimi Code Bench v2 vs. K2.6 (proveedor); 1T/32B activos | 256K / Modified MIT | Hugging Face, DeepInfra, proveedores |
| DeepSeek V4-Pro | Trabajo agéntico del mundo real | II 44 (v4.1), 1.6T/49B activos | 1M / MIT | DeepSeek API ($0.435/$0.87), local |
| Hy3 | El participante más nuevo con licencia permisiva | II 41 (v4.1); #22 en Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, proveedores, autoalojado |
| Inkling | Primer modelo open-weight de Thinking Machines | II 41 (v4.1), agéntico 32,3, lanzado el 15 de julio | Open weights | Hugging Face, proveedores, autoalojado |
| Inkling Small | Misma familia a una cuarta parte del tamaño | II 40 (v4.1), agéntico 30,8; 276B/12B activos, entrada de texto, imagen y audio | Apache 2.0 | Hugging Face (BF16 y NVFP4), proveedores, autoalojado |
| NVIDIA Nemotron 3 Ultra | Afinado por NVIDIA, licencia totalmente permisiva | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B activos | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 autoalojado) |
| Qwen 3.5 (397B / 17B activos) | Multimodal, decodificación rápida | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / abierto | Together, OpenRouter, local |
| Qwen3.6-35B-A3B | Programador agéntico abierto eficiente (3B activos) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B activos | 262K (a 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, local |
| Qwen3.6-27B | Programador denso ejecutable en portátil | 87,8 GPQA Diamond, denso 27B, multimodal | 256K / Apache 2.0 | Local Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune de Qwen 3.5, razonamiento multilingüe | 70,8 Terminal-Bench 2.1 (first-party), supera a Qwen 3.7 Plus en 4/5 | 397B/17B activos / MIT | Hugging Face, proveedores, autoalojado |
| Llama 4 Maverick | Buque insignia de la línea Meta | 17B activos / 400B de parámetros totales | Llama 4 license | Nube de Meta, Hugging Face, local |
| NVIDIA Nemotron 3 Nano Omni | Edge / bajo consumo | Multimodal, huella muy pequeña | Compacto / abierto | Local, herramienta NVIDIA |
Aquí la licencia importa tanto como la puntuación bruta: Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Nex-N2-Pro (Apache 2.0) y Nemotron 3 Ultra (OpenMDW) todos permiten claramente el uso comercial, mientras que MiniMax M3 viene bajo su propia licencia comunitaria y Kimi K3 se sitúa en su propia licencia personalizada con un umbral de ingresos para quien lo revenda como servicio. Ningún modelo open-weight es ya el primero en ningún tablero de Arena que sigamos: Claude Opus 5 se llevó el tablero Agent en julio, el último que lideró un modelo open-weight.
Benchmarks, precios y uso práctico
Cada clasificación de esta página combina tres entradas: benchmarks públicos de siete casas independientes (Artificial Analysis, Arena antes LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize y el tablero oficial de Terminal-Bench 2.1, cubriendo los índices Intelligence y Agentic, GPQA Diamond, ARC-AGI-1 al 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas y el Remote Labor Index), precios de API y suscripción publicados en la página de precios oficial de cada proveedor, y uso práctico por parte del equipo editorial de FelloAI que ejecuta prompts reales sobre la misma tarea en cada modelo. Volvemos a obtener las fuentes oficiales de precios y benchmarks antes de cada actualización mensual.
Los benchmarks se ponderan según el caso de uso: SWE-bench y Terminal-Bench impulsan la programación, GPQA Diamond y ARC-AGI-2 impulsan la precisión, GDPval-AA (el benchmark de entregables profesionales de Artificial Analysis) informa la calidad de las tareas profesionales mientras que el estilo de escritura se juzga principalmente por pruebas prácticas, FrontierMath y HMMT impulsan la resolución de problemas. Revelamos cuándo un benchmark es reportado por el proveedor pero no verificado de forma independiente, y descartamos cualquier afirmación que no podamos reproducir contra una fuente en vivo. No movemos la corona de una categoría por la fuerza de una sola tabla, y cuando un modelo nuevo es demasiado reciente para que los tableros de preferencia humana lo hayan valorado, lo decimos en lugar de coronarlo solo por puntuaciones de benchmark. Cuando un modelo pasa por una actualización importante entre actualizaciones, volvemos a clasificar la categoría y añadimos una línea «Qué cambió este mes» al pie del análisis a fondo.





