Actualizado en agosto de 2026

Mejores modelos de IA en 2026

Clasificaciones, comparativas y análisis a fondo, actualizados cada mes a medida que llegan nuevos modelos.

Agosto de 2026 arranca con Claude Opus 5 en lo más alto y dos coronas cambiando de manos. Opus 5 lidera el Intelligence Index de Artificial Analysis con 61 y su Agentic Index con 55,3 a $5 / $25 por 1M de tokens, la mitad del precio de Claude Fable 5, y ahora se ha llevado la corona de programación tras quedar primero en los dos tableros de programación por votos de Arena. El otro movimiento está en el extremo económico, donde DeepSeek V4-Flash 0731 llegó el 31 de julio como la nueva elección relación precio-rendimiento a $0.14 / $0.28. Abajo están los ganadores por categoría de agosto de 2026. Haz clic en cualquier tarjeta para saltar directamente al desglose completo, o usa la navegación fija para moverte entre categorías. Las clasificaciones, benchmarks y precios se actualizan dentro de las 48 horas siguientes al lanzamiento de cualquier modelo importante.

Ganadores por categoría de agosto de 2026
Escritura
Claude Fable 5
#1 Arena texto (1508.6) y Humanity's Last Exam
El único modelo entre los tres primeros de los tres tableros independientes de escritura, a $10 / $50.
Análisis a fondo →
Chat & asistente diario
GPT-5.6
Modelo por defecto de ChatGPT desde el 9 de julio
El mejor asistente que la mayoría de la gente puede abrir de verdad, equilibrando capacidad, velocidad y alcance.
Análisis a fondo →
Imágenes
ChatGPT Images 2.0
#1 en texto a imagen y edición de imágenes
Lidera los dos tableros independientes de imagen y sigue siendo el mejor en texto multilingüe legible.
Análisis a fondo →
Vídeo
Gemini Omni Flash
#1 en los dos tableros de vídeo (1527 Arena)
Lidera los dos tableros independientes de vídeo con edición conversacional a unos $0.10 por segundo.
Análisis a fondo →
Programación
Claude Opus 5
#1 Arena WebDev (1,702.9) a $5 / $25
Se lleva la corona de programación en los tableros por votos, a la mitad del precio de Claude Fable 5.
Análisis a fondo →
Creatividad
Grok 4.5
Menos restricciones de contenido + X nativo en tiempo real
La elección para trabajo atrevido y a la última: menos límites y integración nativa con X.
Análisis a fondo →
Precisión & investigación
Gemini 3.1 Pro
98 % en ARC-AGI-1 a $0.52 por tarea
Iguala al panel humano en ARC-AGI-1 con anclaje nativo en Google Search para respuestas en vivo.
Análisis a fondo →
Resolución de problemas
GPT-5.6 Sol
#1 LiveBench Mathematics, Reasoning y ARC-AGI-2
La corona mejor respaldada de esta página para las matemáticas, la ciencia y el razonamiento más difíciles.
Análisis a fondo →
Agentes de IA
Gemini Spark
Primer agente de IA residente en la nube 24/7
Se ejecuta de forma continua en una VM de Google Cloud, muy integrado con Gmail, Docs y Chrome.
Análisis a fondo →
Novedades de agosto de 2026
5 ago Meta Muse Spark 1.2 y Muse Code, Intelligence Index de 51 a 54 con un $1.25 / $4.25 sin cambios, además de un agente de programación de terminal Nuevo
Meta lanzó Muse Spark 1.2 el 5 de agosto de 2026 junto a Muse Code, su primer agente de programación de terminal, que se ejecuta en macOS y Linux sin aplicación de escritorio y sin suscripción. Artificial Analysis puntúa el modelo con un Intelligence Index de 54 en su ajuste de razonamiento más alto, frente a 51 para la 1.1 y 43 para la versión de abril, y casi toda esa mejora es agéntica en lugar de conocimiento general; su Elo GDPval-AA v2 saltó de 1371 a 1631 mientras que Terminal-Bench v2.1 solo pasó del 78 % al 80 %. El precio no cambia a $1.25 / $4.25 por 1M de tokens sobre una ventana de contexto de 1M de tokens, y Meta añadió un nivel Contributor a $0.10 / $0.20, cerca de un 92 % más barato, a cambio de dejar que Meta entrene con tus prompts y completions. La disponibilidad se amplió del acceso previo solo para EE. UU. con el que se lanzó la 1.1 a un acceso global ampliado a través de Muse Code, la Meta Model API y OpenRouter. En los propios gráficos de lanzamiento de Meta, el modelo queda segundo tras Claude Opus 5 en los tres benchmarks de programación que publicó, con un 82,9 % frente al 86,7 % en Terminal-Bench 2.1.
3 ago Alibaba Qwen 3.8 (Qwen3.8-Max), buque insignia multimodal de 2,4 billones de parámetros ya disponible en general a $2 / $6 Nuevo
Alibaba puso Qwen3.8-Max en disponibilidad general el 3 de agosto de 2026, dos semanas después de presentarlo en el WAIC Shanghai, y cada cifra que faltaba en la vista previa ya tiene un número detrás. Corre 2,4 billones de parámetros totales con unos 95 000 millones activos por token en un diseño disperso de Mixture-of-Experts, admite texto, imágenes y vídeo, y confirma una ventana de contexto de 1M de tokens con hasta 128K tokens de salida. El precio de la API es de $2 / $6 por 1M de tokens, plano en todo el contexto en lugar de escalonado por longitud del prompt, con lecturas en caché a $0.25. La afirmación de «solo por detrás de Fable 5» ahora se divide limpiamente en dos: en el tablero de visión de Arena es #2 con 1305, solo detrás de Fable 5, pero en el tablero de texto es #5 con 1496, detrás de cuatro entradas de Anthropic. Ambas puntuaciones de Arena siguen marcadas como preliminares, y los open weights prometidos no han llegado. Mantenemos a Qwen 3.8 fuera de las elecciones clasificadas hasta que los pesos y la licencia lleguen de verdad.
31 jul DeepSeek DeepSeek V4-Flash 0731, mismo precio, mismo tamaño, Intelligence Index de 40 a 50 Nuevo
DeepSeek volvió a hacer post-training de V4-Flash y publicó el resultado el 31 de julio de 2026 como DeepSeek-V4-Flash-0731. Nada en la forma del modelo cambió: es el mismo Mixture-of-Experts de 284B total / 13B activos, el mismo contexto de 1M de tokens, la misma licencia MIT y los mismos $0.14 / $0.28 por 1M de tokens en la propia tarifa de DeepSeek. Lo que se movió es la capacidad. Artificial Analysis ahora lo puntúa con un Intelligence Index de 50, frente a 40, con Agentic 45,7 y un 78,7 % en Terminal-Bench v2.1, lo que lo eleva de aproximadamente el decimotercero al tercer puesto en el campo abierto por detrás de Kimi K3 y GLM-5.2. A $0.03 por tarea de índice es la cifra más barata de todo el tablero de Artificial Analysis, y eso es lo que movió nuestra elección relación precio-rendimiento este mes. Un límite honesto: la puntuación tiene un día, viene de una sola casa, y el modelo aún no tiene votos en ningún tablero de Arena.
31 jul MiniMax MiniMax H3, vídeo 2K con audio estéreo nativo desde $0.13 por segundo Nuevo
MiniMax lanzó H3 (Hailuo 3.0) el 31 de julio de 2026 como un modelo de vídeo multimodal de propósito general que admite texto, imagen, vídeo y audio como entrada. Genera clips 2K de 4 a 15 segundos con audio estéreo nativo, admite transferencia de movimiento, generación guiada por referencia y edición generativa de vídeo, y se factura por segundo a $0.13 para 2K y $0.09 para 768p. Artificial Analysis lo sitúa #2 en su tablero de vídeo con 1241,5, a 3,3 Elo de Gemini Omni Flash. Hemos mantenido la corona de vídeo donde está: esa diferencia tiene un día y viene del único tablero que no se ha reproducido entre análisis, y el corte de texto a vídeo de Arena es anterior a H3 por completo, así que no ha ganado nada por votos. MiniMax ha prometido los pesos para principios de agosto, y no se habían publicado cuando salió esta actualización.
Finales de jul Thinking Machines Inkling Small, una cuarta parte del tamaño de Inkling con casi la misma puntuación Nuevo
Thinking Machines siguió a su primer modelo open-weight con Inkling Small, un Mixture-of-Experts de 276B total / 12B activos bajo Apache 2.0 que enruta cada token a 6 de 256 expertos más 2 compartidos. Acepta entrada de texto, imagen y audio y devuelve texto, y Artificial Analysis lo puntúa con un Intelligence Index de 40 frente a 41 para el Inkling de tamaño completo, con cerca de una cuarta parte de los parámetros. Las fuentes no coinciden en la fecha exacta de publicación, así que no imprimimos ninguna. Los pesos, una compilación NVFP4 y las recetas de despliegue están todos en Hugging Face.
30 jul OpenAI Recorte de precios de GPT-5.6, Luna un 80 % más barato, Terra un 20 % más barato, Sol sin cambios
OpenAI recortó el precio de la API de sus dos niveles GPT-5.6 más baratos el 30 de julio de 2026, tres semanas después de que la familia alcanzara la disponibilidad general. Luna cayó un 80 % a $0.20 / $1.20 por 1M de tokens y Terra cayó un 20 % a $2 / $12, con las lecturas de entrada en caché bajando a $0.02 en Luna y $0.20 en Terra. El buque insignia Sol se queda en $5 / $30, los prompts por encima de 272K tokens de entrada aún se facturan a 2x entrada y 1,5x salida, y ningún precio de suscripción de ChatGPT cambió, así que Free, Go a $8, Plus a $20, Pro a $100 y $200 y Business a $25-30 por asiento se quedan todos igual. El recorte deja a Luna en un Intelligence Index de 51 en Artificial Analysis por unos $0.07 por tarea de índice, un punto por encima de Gemini 3.6 Flash en puntuación y muy por debajo de sus $0.56 por tarea.
24 jul Anthropic Claude Opus 5, nuevo #1 en Artificial Analysis, lidera tanto el Intelligence Index (61) como el Agentic Index (55.3) Nuevo
Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, su cuarto modelo en menos de dos meses tras Mythos 5, Fable 5 y Sonnet 5. En la tabla de clasificación v4.1 recalibrada de Artificial Analysis es ahora el modelo mejor clasificado en general, liderando tanto el Intelligence Index con 61 como el Agentic Index con 55,3, por delante de Fable 5 (60 / 52,8) y GPT-5.6 Sol (59 / 54,0). El precio de la API es de $5 / $25 por 1M de tokens, idéntico a Opus 4.8 y la mitad del coste de Fable 5, bajo el API id claude-opus-5. Añade un modo Fast que corre unas 2,5 veces más rápido al doble del precio base, más un ajuste de effort de low a high y un nuevo nivel max. También se lleva de forma clara el tablero GDPval-AA v2 de entregables profesionales de Artificial Analysis con 1858, por delante del 1746 de Fable 5. Arena lo ha valorado desde entonces en sus tableros, situándolo #1 en WebDev, image-to-WebDev, Document y el tablero Agent y #6 en texto, que es lo que le movió la corona de programación este mes. Es el modelo por defecto en Claude Max y el más fuerte en Claude Pro.
24 jul Sakana AI Fugu-Ultra v1.1, renovación del motor de orquestación con mejoras reportadas por el proveedor de hasta 7,9 puntos sobre v1.0 al mismo precio Nuevo
Sakana AI lanzó Fugu-Ultra v1.1 el 24 de julio de 2026, una renovación de los modelos frontier dentro de su motor de orquestación TRINITY en lugar de un nuevo modelo base. El propio anuncio de Sakana afirma mejoras de hasta 7,9 puntos sobre v1.0 con el precio sin cambios, aunque no publica las puntuaciones de v1.0 lado a lado, así que trátalo como la cifra del proveedor. Todos los números de benchmark vienen del scaffolding propio de Sakana en lugar de pruebas independientes: en sus propios gráficos lidera sobre Opus 4.8, GPT-5.5 y Gemini 3.1 Pro, con un 73,7 % en SWE-Bench Pro, un 82,1 % en Terminal-Bench 2.1, un 93,2 % en LiveCodeBench y 95,5 en GPQA-Diamond. Aun así no arrasa en el campo: su 50,0 en Humanity's Last Exam es un empate por redondeo con el 49,8 de Opus 4.8. El precio no cambia respecto a v1.0 a $5 / $30 por 1M de tokens de entrada/salida (más $0.50 en caché), subiendo a $10 / $45 por encima de la marca de contexto de 272K tokens; la API es compatible con OpenAI con una ventana de contexto de 1M de tokens.
21 jul Google Gemini 3.6 Flash, salida más barata, más rápido, mismo Intelligence Index
Gemini 3.6 Flash es el modelo Flash más nuevo de Google y el que la aplicación gratuita de Gemini alcanza ahora. La salida cae a $7.50 por 1M de tokens desde $9.00 mientras la entrada se mantiene en $1.50, así que el recorte es solo de salida. Google dice que «reduce el uso de tokens de salida en un 17 % respecto a 3.5 Flash», y hasta un 65 % en trabajo agéntico de largo horizonte como DeepSWE, así que el ahorro real por tarea es mayor que el precio de etiqueta. Artificial Analysis puntúa a 3.6 Flash y 3.5 Flash con el mismo Intelligence Index de 50 en v4.1, así que trátalo como más barato y rápido en lugar de más listo. Llegó junto a Gemini 3.5 Flash-Lite a $0.30 / $2.50, y está en vivo a través de la Gemini API en Google AI Studio y Android Studio, la Gemini Enterprise Agent Platform y la aplicación de Gemini para todos. Google también anunció Gemini 3.5 Flash Cyber, pero ese no se ha lanzado: va a gobiernos y socios de confianza a través de CodeMender como piloto de acceso limitado.
16 jul Moonshot AI Kimi K3, 2,8B de parámetros, el mayor modelo open-weight jamás publicado (pesos lanzados el 27 de julio) Nuevo
Moonshot AI lanzó Kimi K3 en la víspera del 16 de julio de 2026, su nuevo buque insignia y el sucesor de la línea K2, y luego publicó los open weights completos el 27 de julio de 2026. La tarjeta de modelo en Hugging Face confirma un diseño Mixture-of-Experts de 2,8 billones de parámetros con 104 000 millones de parámetros activos por token, una ventana de contexto de 1 048 576 tokens y entrada de texto, imagen y vídeo (sin audio). El razonamiento está siempre activo, y reasoning_effort ahora admite low, high o max, con max como predeterminado. Artificial Analysis sitúa a K3 en un Intelligence Index de 57, el más alto de cualquier modelo open-weight, y en Arena es #3 en el tablero Agent y #2 en WebDev por detrás de Claude Opus 5. El precio oficial de la API es de $3 / $15 por 1M de tokens con entrada en caché a $0.30, más $0.005 por cada llamada de búsqueda web exitosa. La descarga son 96 shards de safetensors y unos 1,56 TB bajo una licencia propia Kimi K3 License en lugar de MIT, así que el autoalojamiento es un trabajo multinodo; existe un nivel de chat básico gratuito en la aplicación de Kimi, con el uso agéntico más intenso medido en los planes de pago.
9 jul OpenAI GPT-5.6 Sol, Terra y Luna, familia de nueva generación en vivo en ChatGPT, Codex y la API
OpenAI abrió su familia GPT-5.6 a la disponibilidad general el 9 de julio de 2026, poniendo fin a la vista previa cerrada de dos semanas que empezó el 26 de junio tras una revisión de seguridad del gobierno de EE. UU. La gama va del menos al más capaz: Luna, un nivel rápido y de bajo coste; Terra, un modelo equilibrado para el día a día que OpenAI dice que iguala a GPT-5.5 a cerca de la mitad de coste; y Sol, el buque insignia, afinado para biología, química y ciberseguridad. GPT-5.6 se está desplegando ahora en ChatGPT, Codex y la API como modelo por defecto de OpenAI, con precios de API de lanzamiento de Sol $5 / $30, Terra $2.50 / $15 y Luna $1 / $6 por 1M de tokens; Terra y Luna se recortaron el 30 de julio de 2026 a $2 / $12 y $0.20 / $1.20. En los pocos benchmarks que OpenAI publicó, Sol logra un 88,8 % en Terminal-Bench 2.1 (91,9 % en su modo «ultra» de más cómputo) frente al 88,0 % de GPT-5.5, y 60,5 en HealthBench Professional; OpenAI notablemente retuvo las cifras habituales de SWE-bench Verified, GPQA y FrontierMath, y su ventana de contexto aún no se ha publicado oficialmente. Una advertencia: la propia system card de OpenAI y el evaluador externo METR señalaron un comportamiento de «scheming» elevado en Sol, incluido manipular una prueba de ingeniería de software a la tasa más alta que METR ha registrado jamás.
Pendiente Google Gemini 3.5 Pro, aún sin lanzar, meses de retraso según Bloomberg Retrasado
Gemini 3.5 Pro sigue siendo el mayor lanzamiento pendiente. Google lo anunció en el I/O el 19 de mayo junto a Gemini 3.5 Flash, pero solo Flash se lanzó, y el objetivo de junio se retrasó. Bloomberg informó el 16 de julio de 2026 de que el modelo lleva meses de retraso y se ha quedado corto respecto a los objetivos internos de Google, con la empresa aún trabajando para mejorar sus capacidades, en particular en programación. Ese es todo el panorama con fuentes. Google nunca ha confirmado públicamente una fecha de lanzamiento, y Google no ha publicado especificaciones finales como la ventana de contexto o los modos de razonamiento, así que trata las cifras que circulan como no confirmadas. Usa Gemini 3.6 Flash mientras tanto; moveremos 3.5 Pro a la clasificación principal en cuanto se lance.
Elección de categoría, agosto de 2026

Mejor IA para escritura

1
Claude Fable 5
Mejor escritura en general
2
Kimi K3
Ficción creativa
3
Claude Sonnet 5
Gratis para el día a día

La mejor IA para escritura es Claude Fable 5, el único modelo entre los tres primeros de los tres tableros independientes de escritura, con Claude Sonnet 5 como la elección de valor del plan gratuito y GPT-5.5 como alternativa para la escritura de negocios anclada en hechos. Fable 5 lidera la tabla de escritura creativa de Arena, encabeza LiveBench Language con 90,7 y queda tercero en EQ-Bench Creative Writing v3 por detrás de Kimi K3 y GPT-5.6 Sol. Ningún otro modelo está entre los tres primeros en más de uno de ellos. Es un cambio respecto al mes pasado, cuando Claude Sonnet 5 ocupaba este puesto por GDPval-AA; los tableros de preferencia no respaldan esa colocación, así que Sonnet 5 es ahora la elección de valor en lugar del líder de calidad. Fable 5 cuesta $10 / $50 por 1M de tokens y está incluido de forma permanente en Claude Max y Team Premium con cerca del 50 % de los límites de uso habituales. Si tu escritura es un entregable de trabajo en lugar de prosa, Claude Opus 5 encabeza de forma clara el tablero GDPval-AA v2 de entregables profesionales de Artificial Analysis con 1858, muy por delante del 1746 de Fable 5.

ModeloMejor paraFortalezaDebilidadPrecio (por 1M de tokens)
Claude Fable 5Mejor escritura en general#1 Arena texto en general (1508.6), #1 LiveBench Language (90.7), #3 EQ-BenchLa opción más cara aquí$10 / $50
Kimi K3Ficción creativa y voz#1 EQ-Bench Creative Writing (2377), 234 Elo por delante del segundoSolo #10 en Arena escritura creativa$3 / $15
Claude Sonnet 5Escritura gratuita para el día a díaGratis y por defecto en claude.ai, contexto 1M#53 Arena escritura creativa; 75,0 LiveBench Language$2 / $10 introductorio (luego $3 / $15)
Claude Opus 5Entregables profesionales#1 GDPval-AA v2 con 1858, por delante de Fable 5 (1746)Por detrás de Fable 5 en Arena texto y Humanity's Last Exam$5 / $25
GPT-5.5Escritura de negocios anclada en hechosMejoras documentadas de fiabilidad factual sobre GPT-5.4Los niveles de razonamiento están ahora marcados como obsoletos$5 / $30
Gemini 3.6 FlashBorradores en volumen a escala17 % menos tokens de salida que 3.5 FlashMás flojo en el razonamiento más difícil$1.50 / $7.50
Segundo puesto y alternativas: Kimi K3 es el segundo para ficción creativa y gana EQ-Bench de forma clara, Claude Sonnet 5 es el segundo en valor y el que usar si no pagas, Claude Opus 5 es la elección para entregables profesionales, y Gemini 3.6 Flash es la elección para borradores en volumen.
Qué cambió este mes

La corona de escritura se queda con Claude Fable 5, y es la decisión mejor respaldada de la página. Fable 5 es ahora #1 en la tabla de texto de Arena con 1508.6 en el corte del 1 de agosto, #1 en Humanity's Last Exam con 53,3 % y #1 en AA-Omniscience con 40, que son tres casas distintas coincidiendo. Claude Opus 5 mantiene el carril de entregables profesionales en GDPval-AA v2, donde el tablero recalibrado ahora marca 1858 frente al 1746 de Fable 5.

Elección de categoría, agosto de 2026

Mejor IA para chat & asistente diario

1
GPT-5.6
Por defecto de ChatGPT
2
Claude Fable 5
El mejor valorado
3
Claude Opus 5
Profundidad reflexiva

La mejor IA para el chat del día a día es GPT-5.6, y la razón honesta es el alcance en lugar de la posición en los tableros. Es el modelo que ChatGPT sirve por defecto a la mayor base de usuarios de la categoría, lo que lo convierte en el mejor asistente que la mayoría de la gente puede abrir de verdad. En preferencia humana pura no es el líder: GPT-5.6 Sol se sitúa #14 en la tabla de texto de Arena con 1482,8, donde Claude Fable 5 lidera con 1508.6. La mayoría de los usuarios de ChatGPT reciben el nivel equilibrado Terra, que OpenAI dice que iguala a GPT-5.5 y, desde el recorte de precios del 30 de julio de 2026, cuesta un 60 % menos. Está disponible dentro de ChatGPT (gratis con límites, Plus a $20/mes, Pro a $100/mes), a través de la API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $5 / $30 por 1M de tokens), y empaquetado dentro de Fello AI junto a Claude, Gemini, Grok y DeepSeek. Una advertencia: la system card de OpenAI y el evaluador METR señalaron un comportamiento de «scheming» elevado en Sol, así que GPT-5.5 Instant sigue siendo la elección más segura para trabajo sensible a las alucinaciones.

ModeloMejor paraFortalezaDebilidadPrecio
GPT-5.6Chat diario, por defecto de ChatGPTEl asistente que la mayoría puede abrir; Terra iguala a GPT-5.5 a ~mitad de coste#14 en Arena texto; scheming señalado por METRGratis / $20/mes Plus; API $0.20 / $1.20 a $5 / $30
Claude Fable 5La conversación mejor valorada#1 en Arena texto en general (1508.6) y en 6 de 7 subcategoríasSin plan gratuito; acceso por créditos de uso en Pro$10 / $50 API
Claude Opus 5Respuestas reflexivas y matizadas#1 Artificial Analysis Intelligence Index (61) y Agentic Index (55.3)#6 en Arena texto, por detrás de Claude Fable 5$20/mes Pro, $5 / $25 API
GPT-5.5 InstantTrabajo diario sensible a las alucinaciones52,5 % menos afirmaciones alucinadas vs. 5.3 InstantLos niveles de razonamiento están ahora marcados como obsoletos$20/mes Plus; API $5 / $30
Gemini 3.6 FlashRápido, gratis, multimodalGratis en la aplicación de Gemini, contexto 1M, #12 en Arena textoMás flojo en el razonamiento más difícilGratis / $1.50 / $7.50 API
Fello AITodos los mejores modelos, una appChatGPT + Claude + Gemini + Grok + DeepSeek y más en Mac, iPhone y iPadEnrutado por la app, no directo$9.99/mes
Segundo puesto y alternativas: Claude Fable 5 es el segundo y el verdadero líder de preferencia, Claude Opus 5 es el segundo para uso diario reflexivo, Gemini 3.6 Flash es el segundo para rápido y gratis, y Grok 4.5 es la elección de nicho para días de noticias en vivo. Fello AI es la elección natural si quieres los mejores modelos en una app de Mac e iOS por $9.99/mes en lugar de hacer malabares con suscripciones.
Qué cambió este mes

GPT-5.6 mantiene la elección de chat por alcance, y la distancia con el líder de preferencia se amplió en lugar de cerrarse. En el corte del 1 de agosto Sol se sitúa #14 en Arena texto con 1482,8, bajando desde #11, mientras Claude Fable 5 lidera con 1508.6. Nada del producto cambió, así que la corona no se mueve: sigue tratándose de qué asistente puede abrir de verdad la mayoría de la gente.

Elección de categoría, agosto de 2026

Mejor IA para imágenes

1
ChatGPT Images 2.0
Texto en imágenes
2
Reve 2.1
Diseño & 4K
3
Muse Image
Edición de imágenes

La mejor IA para la generación de imágenes es ChatGPT Images 2.0, y es la corona menos discutida de esta página. GPT Image 2 lidera el tablero de texto a imagen de Arena con 1385 Elo y su tablero de edición de imágenes con 1463, y Artificial Analysis lo pone primero en su propia arena de imagen con 1339,4. Es la elección natural siempre que tu imagen tenga que contener palabras legibles, en español o en otra escritura, y está incluido en ChatGPT Plus y Pro. Los segundos puestos han cambiado. Reve 2.1 (9 de julio) es el verdadero #2 en texto a imagen con 1302, y Reve 2.0 ahora se sitúa por detrás de él en los dos tableros. Muse Image de Meta es #3 en el tablero de texto a imagen de Arena y #2 en edición de imágenes, la mejor actuación que ha logrado ningún modelo de imagen de Meta. Nano Banana Pro de Google ya no es el segundo en general: en texto a imagen se clasifica entre #8 y #11, por debajo de su propio hermano más barato Nano Banana 2, aunque queda más arriba en edición de imágenes.

ModeloMejor paraFortalezaDebilidadPrecio
ChatGPT Images 2.0Imágenes con texto legible#1 texto a imagen (1385) y #1 edición de imágenes (1463)Menos fotorrealista que la línea de imagen de GeminiIncluido en ChatGPT Plus
Reve 2.1Diseño, tipografía, 4K nativo#2 texto a imagen con 1302, edición que preserva el diseñoEcosistema más pequeñoGratis / desde $7.99/mes
Muse ImageEdición de imágenes, ecosistema Meta#3 texto a imagen, #2 edición de imágenes (1407)Nuevo, herramientas escasas a su alrededorAplicación Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Retratos y productos fotorrealistasSupera a Nano Banana Pro en los dos tablerosMás flojo en texto dentro de la imagenAplicación Gemini / AI Studio
Seedream 5.0 ProTexto multilingüe + edición por regiones10+ idiomas incl. árabe RTL, edición con lazo y capasSin benchmarks independientes; incertidumbre de derechos de autorBytePlus / Magnific
Midjourney v8Arte estilizado, ilustraciónBase estética que la mayoría de los artistas prefierenMás flojo en texto dentro de la imagen$10-$120/mes
Grok ImagineNSFW / Spicy ModeLos límites más permisivosUn modelo más pequeño por detrás$30/mes SuperGrok
Segundo puesto y alternativas: Reve 2.1 es el segundo en general y la elección para diseño y tipografía, Muse Image es el segundo para editar una imagen que ya tienes, y Nano Banana 2 es la elección fotorrealista. Grok Imagine sigue siendo el único modelo frontier que permite contenido para adultos en Spicy Mode.
Qué cambió este mes

La corona de imagen no cambia y GPT Image 2 sigue liderando los tres tableros que seguimos, en Arena texto a imagen (1385), Arena edición de imágenes (1463) y la arena de imagen de Artificial Analysis (1339,4). La única incorporación es MAI-Image-2.5 de Microsoft, que se sitúa tercero en el tablero de imagen de Artificial Analysis con 1269,7 y tercero en el tablero de edición de imágenes de Arena, así que el tercer puesto ahora depende de qué casa leas.

Elección de categoría, agosto de 2026

Mejor IA para vídeo

1
Gemini Omni Flash
#1 en los dos tableros de vídeo
2
MiniMax H3
2K + audio nativo
3
Dreamina Seedance 2.0
El rival más cercano

La mejor IA para la generación de vídeo es Gemini Omni Flash, que lidera el tablero de texto a vídeo de Arena con 1527 Elo, 45 puntos completos por delante del segundo, y también encabeza la arena de vídeo de Artificial Analysis. Es #1 en las dos casas, algo que ningún otro modelo de vídeo logra. El precio va de $1.50 de entrada y $17.50 por 1M de tokens de salida de vídeo, lo que sale a unos $0.10 por segundo de vídeo terminado, y admite edición conversacional. El único límite real es la duración: Omni Flash genera clips de 10 segundos. Si necesitas tomas más largas, Veo 3.1 sigue siendo la herramienta adecuada dentro de la aplicación de Gemini, AI Studio y Vertex AI, con audio nativo y salida 1080p. Esto reemplaza a Veo 3.1 en lo alto de la categoría; Veo 3.1 es un buen modelo pero no el líder, con su mejor variante en #6 del tablero de texto a vídeo de Arena. El aspirante a vigilar es MiniMax H3 (31 de julio), que genera clips 2K de 4 a 15 segundos con audio estéreo nativo y se factura por segundo desde $0.13 a 2K, ya #2 en el tablero de vídeo de Artificial Analysis con 1241,5. No movemos la corona por eso: la puntuación tiene un día, viene del único tablero que no se ha reproducido entre análisis, y el corte de votos de texto a vídeo de Arena es anterior a H3.

ModeloMejor paraFortalezaDebilidadPrecio
Gemini Omni FlashMejor vídeo de IA en general#1 en los dos tableros de vídeo (1527 Arena), edición conversacionalLimitado a generaciones de 10 segundos~$0.10/s; aplicación Gemini / AI Studio
MiniMax H3Clips 2K con audio nativo4-15 s a 2K, audio estéreo nativo; #2 en AA vídeo (1241.5)Tiene un día, aún sin votos en Arena; pesos no publicados$0.13/s a 2K
Dreamina Seedance 2.0El rival más cercano#2 texto a vídeo (1482) y #1 en imagen a vídeoEcosistema ByteDance, acceso occidental limitadoDreamina / BytePlus
Muse VideoVídeo en el ecosistema Meta#3 texto a vídeo con 1459El más nuevo del grupo, herramientas escasasAplicación Meta AI
Veo 3.1Clips de producción más largosAudio nativo, 1080p, fuerte consistencia física#6 en Arena vídeo, no el líder de calidadGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboIteración rápida a menor coste4K nativo, 60fps, clips de 15 segundos; Turbo salió el 17 de junioFuera del top 16 en Arena texto a vídeoDesde $10/mes
Luma Ray 3Escenas fotorrealistasFuerte realismo para paisajesComunidad más pequeñaGratis / desde $9.99/mes
Segundo puesto y alternativas: Dreamina Seedance 2.0 es el segundo en general y de hecho supera a Omni Flash en imagen a vídeo, Muse Video es tercero, y Veo 3.1 es la elección cuando 10 segundos no bastan. OpenAI retiró la aplicación de consumo Sora 2 el 26 de abril de 2026 y solo queda la API para desarrolladores, hasta el 24 de septiembre de 2026.
Qué cambió este mes

Gemini Omni Flash mantiene la corona de vídeo, y sigue siendo #1 en los dos tableros, con 1527,5 en Arena y 1244,8 en Artificial Analysis. MiniMax H3 (31 de julio) entra como aspirante en #2 del tablero de vídeo de Artificial Analysis (1241,5), a 3,3 Elo, y supera a Omni Flash en especificaciones con salida 2K, clips de hasta 15 segundos y audio estéreo nativo. Mantenemos la corona porque ese margen tiene un día, es de un solo tablero y no lleva votos en Arena, cuyo corte de texto a vídeo es anterior al lanzamiento.

Elección de categoría, agosto de 2026

Mejor IA para programación

1
Claude Opus 5
#1 Arena WebDev
2
Claude Fable 5
Largo horizonte más difícil
3
Kimi K3
Apps web y agentes

La mejor IA para programación es Claude Opus 5, y gana en los dos tableros donde los desarrolladores votan sobre el resultado terminado en lugar de un script midiendo un harness. Es #1 en el tablero WebDev de Arena con 1,702.9 y #1 en image-to-WebDev con 1,668.6, en cortes de votos del 1 de agosto y el 31 de julio. El precio es la segunda mitad del argumento: Opus 5 corre a $5 / $25 por 1M de tokens frente a los $10 / $50 de Claude Fable 5, y Artificial Analysis lo mide en $2.34 por tarea de índice frente a los $3.15 de Fable 5. La propia documentación de Anthropic dice a los desarrolladores que empiecen con Opus 5 para programación agéntica compleja y reserven Fable 5 para cargas que necesiten la máxima capacidad disponible. Claude Fable 5 es el segundo y sigue siendo la elección para el trabajo de largo horizonte más difícil, en #4 en WebDev (1,630.7) y #2 en image-to-WebDev (1,625.7). El aspirante es Kimi K3, que se lleva el #2 en WebDev con 1,675.5 y el #3 en el tablero Agent de Arena, el programador open-weight más fuerte en los tableros, aunque autoalojarlo significa 1,56 TB de pesos. En el Coding Index de Artificial Analysis no es un barrido de Claude: GPT-5.6 Sol (xhigh) lidera con 78,3 con Opus 5 (max) en 78,0, lo bastante cerca para llamarlo empate. El aspirante serio más barato es ahora DeepSeek V4-Flash 0731 a $0.14 / $0.28.

ModeloMejor paraFortalezaDebilidadPrecio (por 1M de tokens)
Claude Opus 5Mejor programación en general#1 Arena WebDev (1,702.9) y #1 image-to-WebDev (1,668.6); $2.34 por tarea de índiceEl Coding Index de Artificial Analysis tiene a GPT-5.6 Sol un pelín por delante$5 / $25
Claude Fable 5El trabajo agéntico de largo horizonte más difícil#2 Arena image-to-WebDev (1,625.7), #4 WebDev; contexto 1MEl más caro; el Coding Index de Artificial Analysis lo pone 7º$10 / $50
Kimi K3Construcción de apps web y agentes#2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index abierto más alto (57)1,56 TB para autoalojar$3 / $15
GPT-5.6 SolBuque insignia de OpenAI, programación agéntica#1 Artificial Analysis Coding Index con 78,3 (xhigh)Ausente del tablero oficial de Terminal-Bench; manipulación de evals señalada por METR$5 / $30
Muse Spark 1.2Programación agéntica barataIntelligence Index 54 a $1.25 / $4.25; 80 % en Terminal-Bench 2.1 (Artificial Analysis)Segundo tras Opus 5 en los tres gráficos de programación propios de Meta (82,9 % vs. 86,7 %); Scale SEAL solo ha valorado la 1.1$1.25 / $4.25
Grok 4.5Programador barato de buen valor#4 en el tablero oficial de Terminal-Bench 2.1 con 79,3 % vía Cursor CLIMayor tasa de alucinación; consola API de la UE aún cerrada$2 / $6
Gemini 3.6 FlashProgramación de agentes a escalaIntelligence Index 50, 17 % menos tokens de salida que 3.5 FlashMás flojo en el razonamiento más difícil$1.50 / $7.50
GLM-5.2Mejor programador open-weight que puedes alojarIntelligence Index 51, #6 Arena WebDev (1,587.1), licencia MITKimi K3 lo supera; solo autoalojado o proveedorOpen weights (MIT)
Segundo puesto y alternativas: Kimi K3 es el segundo en el tablero WebDev de Arena y la elección si quieres los open weights más fuertes, Claude Fable 5 es el segundo para el trabajo de largo horizonte más difícil, GPT-5.6 Sol es el segundo en el compuesto de Artificial Analysis, y GLM-5.2 es la elección open-weight para equipos que lo alojan ellos mismos. Dentro de los IDE, Cursor con Claude sigue siendo la combinación más popular y Claude Code es la elección natural si vives en la terminal.
Qué cambió este mes

La corona de programación se movió a Claude Opus 5. Arena terminó de valorarlo, y quedó primero en los dos tableros de programación, WebDev con 1,702.9 e image-to-WebDev con 1,668.6, con Claude Fable 5 cuarto y segundo. Son tableros por votos con cortes publicados, así que la corona ahora descansa sobre comparaciones humanas en lugar de sobre un solo harness, y Opus 5 lo hace a la mitad del precio de Fable 5. Fable 5 pasa a ser el segundo para el trabajo de largo horizonte más difícil, y Kimi K3 sigue siendo el aspirante en #2 en WebDev. Muse Spark 1.2 de Meta llegó el 5 de agosto y no cambia eso, porque en los propios gráficos de Meta queda segundo tras Opus 5 en cada benchmark de programación que publicó.

Elección de categoría, agosto de 2026

Mejor IA para creatividad

1
Grok 4.5
Menos límites
2
Claude Fable 5
Prosa de máxima calidad
3
Kimi K3
Ficción y voz

La mejor IA para el trabajo creativo sin filtros y a la última es Grok 4.5, y queremos ser exactos sobre por qué. Esta elección es sobre el producto, no sobre la calidad de la prosa. Grok 4.5 lleva las menos restricciones de contenido de cualquier modelo frontier y la única integración nativa con X en tiempo real, lo que lo convierte en el único modelo que se involucrará con encargos atrevidos, de actualidad o deliberadamente provocadores que los demás rechazan. Es el modelo por defecto en la aplicación de Grok para suscriptores de SuperGrok y X Premium+ a $30/mes. No es el mejor escritor, y los tableros son contundentes al respecto. Grok 4.5 se sitúa #33 en EQ-Bench Creative Writing y #41 en la tabla de escritura creativa de Arena, perdiendo en ambas ante el más antiguo Grok 4.20-beta1. Si eliges solo por calidad de salida, Claude Fable 5 gana de forma clara en #1 en Arena escritura creativa, y Kimi K3 gana EQ-Bench. Elige Grok 4.5 por lo que te deja crear, no por lo bien que escribe.

ModeloMejor paraFortalezaDebilidadPrecio
Grok 4.5Sin filtros, con opinión, a la últimaMenos restricciones de contenido, anclaje nativo en X en tiempo real#33 EQ-Bench, #41 Arena escritura creativa$30/mes SuperGrok
Claude Fable 5Prosa creativa de máxima calidad#1 Arena escritura creativa, #1 LiveBench LanguageLímites cautelosos ante encargos atrevidos$10 / $50 API
Kimi K3Ficción y voz distintiva#1 EQ-Bench Creative Writing con 2377Solo #10 en Arena escritura creativa$3 / $15
Claude Opus 5Creatividad estructurada de formato largoMantiene hilos largos y se autoedita; #1 Intelligence IndexEl más cauteloso del grupo$20/mes Pro; $5 / $25 API
Gemini 3.1 ProCreatividad multimodalFuerte cadena de texto, imagen y vídeoCuotas dentro de la aplicación de GeminiGratis / $2.00-$4.00 API entrada
Grok Imagine (Spicy Mode)NSFW / creatividad para adultosLa generación de imágenes más permisivaCaso de uso de nicho$30/mes SuperGrok
Segundo puesto y alternativas: Claude Fable 5 es el segundo y la elección correcta si la calidad importa más que la libertad, Kimi K3 es la elección para ficción, y Claude Opus 5 es la elección para proyectos creativos que se extienden a lo largo de muchos turnos. Para trabajo creativo para adultos, Grok Imagine Spicy Mode sigue siendo la única opción de nivel frontier.
Qué cambió este mes

Grok 4.5 mantiene esta elección, y nada del producto se movió. Está aquí por su permisividad y su acceso en vivo a X, no por su posición en los tableros, y Claude Fable 5 sigue siendo el modelo que usar cuando quieres la mejor escritura. Una nota de nombre para agosto: xAI ahora cotiza en los tableros como SpaceXAI, y el modelo no cambia.

Elección de categoría, agosto de 2026

Mejor IA para precisión & investigación

1
Gemini 3.1 Pro
98 % ARC-AGI-1
2
Claude Fable 5
Búsqueda anclada
3
GPT-5.6 Sol
Razonamiento novedoso

La mejor IA para precisión e investigación es Gemini 3.1 Pro. Su resultado más fuerte es en ARC-AGI-1 de ARC Prize, donde puntúa un 98 % e iguala al panel humano, y lo hace a $0.52 por tarea. Esa combinación es el argumento: varios modelos están cerca en capacidad, ninguno lo iguala en coste para trabajo factual fiable. Lo empareja con anclaje nativo en Google Search, que es lo que quieres cuando la respuesta tiene que ser actual en lugar de simplemente plausible. También puntúa un 94,1 % en GPQA Diamond, donde GPT-5.6 Sol ahora lo iguala en lugar de quedar por detrás, y un 44,4 % en Humanity's Last Exam, y encabeza el tablero HLE de Scale SEAL con 46,44. Hemos descartado el marco anterior de ARC-AGI-2: su 77,1 % sigue siendo correcto, pero el tablero se ha movido y esa puntuación ahora lo sitúa alrededor del puesto 14. Dos advertencias honestas. En búsqueda anclada en concreto, la tabla de búsqueda de Arena la lidera Anthropic, no Google, con Gemini 3.1 Pro con anclaje en #7. Y en razonamiento novedoso, GPT-5.6 Sol lidera ARC-AGI-2 y Claude Opus 5 lidera ARC-AGI-3 con un 30 %, cerca de 3,75 veces el siguiente mejor modelo. No movimos la corona a Opus 5 porque Artificial Analysis mide su tasa de alucinación en un 50 % y lo sitúa por debajo de Fable 5 en AA-Omniscience.

ModeloMejor paraBenchmark claveDebilidadPrecio
Gemini 3.1 ProTrabajo factual barato y fiable98 % ARC-AGI-1 (iguala al panel humano) a $0.52/tarea, 94,1 % GPQA (igualado por Sol)ARC-AGI-2 77,1 % ahora ~14º; #7 en Arena búsqueda$2.00-$4.00 / $12.00-$18.00 (escalonado)
Claude Fable 5Búsqueda anclada#1 y #3 en la tabla de búsqueda de Arena, por delante de GoogleNingún nivel barato único$10 / $50 (Fable 5)
GPT-5.6 SolRazonamiento novedoso#1 ARC-AGI-2 con 93 %, contra un panel humano del 100 %Scheming señalado por METR$5 / $30
Claude Opus 5Los problemas inéditos más difíciles#1 ARC-AGI-3 con 30 %, ~3,75 veces el siguiente modelo (ARC Prize)Artificial Analysis mide una tasa de alucinación del 50 %$5 / $25
Qwen 3.7 MaxPrecisión frontier a precio de valor92,4 GPQA Diamond, 200 solicitudes gratis/díaSolo API, sin front-end de chat$1.25 / $3.75 promo; $2.50 / $7.50 lista
Claude Opus 4.6Honestidad bajo presión#1 en el tablero MASK de Scale SEAL con 96,28; Anthropic ocupa el top 5Reemplazado como buque insigniaModelo legacy de Anthropic
Segundo puesto y alternativas: los modelos de Anthropic son el segundo para búsqueda anclada y arrasan en el tablero de honestidad bajo presión, GPT-5.6 Sol es el segundo para razonamiento novedoso, y Qwen 3.7 Max es la elección de valor en el frontier.
Qué cambió este mes

Gemini 3.1 Pro mantiene la corona de precisión, pero su cifra estrella ya no es una ventaja. Su puntuación de GPQA Diamond se recalibró a 94,1 % y GPT-5.6 Sol ahora lo iguala exactamente, así que la corona descansa sobre el resultado de ARC-AGI-1 a $0.52 por tarea más el anclaje de Search en lugar de sobre GPQA. Esta es la siguiente corona que volvemos a probar: Claude Fable 5 encabeza los tres tableros que miden con qué frecuencia un modelo simplemente se equivoca, con 40 en AA-Omniscience, 61 % en Omniscience Accuracy y 53,3 % en Humanity's Last Exam.

Elección de categoría, agosto de 2026

Mejor IA para resolución de problemas

1
GPT-5.6 Sol
Buque insignia STEM
2
Claude Opus 5
Cadenas agénticas
3
GPT-5.5 Pro
FrontierMath verificado

La mejor IA para la resolución de problemas difíciles es GPT-5.6 Sol, y es la corona mejor respaldada de esta página. Se lleva el #1 en LiveBench Mathematics con 96,2, el #1 en LiveBench Reasoning con 91,7 y el #1 en ARC-AGI-2 con un 93 %, lo más cerca que ningún modelo ha llegado del panel humano del 100 %. Tres casas distintas lo ponen primero en las tareas de razonamiento que importan, que es más acuerdo del que produce cualquier otra categoría de esta página. OpenAI aún no ha publicado la puntuación de FrontierMath de Sol, así que la marca verificada de OpenAI sigue siendo el 39,6 % de GPT-5.5 Pro en FrontierMath Tier 4, y encajaremos el número de Sol en el momento en que se haga público. Qwen 3.7 Max es la alternativa de valor para problemas de estilo competición con 97,1 en el índice HMMT de febrero de 2026 y 44,5 en Apex, a una fracción del coste de ChatGPT Pro, y ahora incluye 200 solicitudes de modelo gratis al día. Claude Opus 5 es la alternativa para cadenas largas de razonamiento agéntico, liderando el Agentic Index de Artificial Analysis con 55,3 y ARC-AGI-3 de ARC Prize con un 30 %, cerca de 3,75 veces el siguiente mejor modelo.

ModeloMejor paraBenchmark claveDebilidadPrecio
GPT-5.6 SolLas matemáticas, la ciencia y el razonamiento más difíciles#1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (93 %)FrontierMath aún sin publicar; scheming señalado por METR$100/mes ChatGPT Pro; API $5 / $30
Claude Opus 5Cadenas largas de razonamiento agéntico#1 Agentic Index (55.3), #1 ARC-AGI-3 (30 %)Segundo en LiveBench Reasoning; tasa de alucinación del 50 %$5 / $25
GPT-5.5 ProLíder verificado de FrontierMath39,6 % FrontierMath Tier 4Reemplazado por Sol como buque insignia$100/mes ChatGPT Pro
Qwen 3.7 MaxMatemáticas de competición con presupuesto ajustado97,1 HMMT 2026 feb, 44,5 Apex, 200 solicitudes gratis/díaSolo API$1.25 / $3.75 promo; $2.50 / $7.50 lista
Claude Fable 5Matemáticas dentro de un flujo de programación#1 en la subcategoría de matemáticas de Arena (1543), 96,0 LiveBench MathematicsLa opción más cara aquí$10 / $50
GLM-5.2Resolución de problemas open-weightIntelligence Index abierto más alto con 51, MIT, contexto 1MSolo autoalojado o proveedorOpen weights (MIT)
Segundo puesto y alternativas: Claude Opus 5 es el segundo y la elección natural para razonamiento agéntico de cadena larga, Claude Fable 5 es el segundo en el tablero de matemáticas de Arena, Qwen 3.7 Max es la elección de valor, y GLM-5.2 es la elección open-weight.
Qué cambió este mes

GPT-5.6 Sol mantiene esta corona, y sumó un segundo argumento. Sol ahora también lidera el Terminal-Bench v2.1 de Artificial Analysis con un 89,5 % y su Coding Index con 78,3, e iguala a Gemini 3.1 Pro en GPQA Diamond con un 94,1 %. Claude Opus 5 sigue siendo la alternativa de razonamiento agéntico por la fuerza de ARC-AGI-3. El 1 de agosto OpenAI llamó a su próxima familia de modelos Astra y publicó diez nuevos resultados matemáticos de una versión interna, aunque Astra está sin lanzar y no tiene fecha, precio ni disponibilidad.

Elección de categoría, agosto de 2026

Mejor agente de IA

1
Gemini Spark
Nube 24/7
2
Claude Cowork
IA de escritorio
3
ChatGPT Codex
Agente de programación

El mejor agente de IA ahora mismo es Gemini Spark para trabajo residente en la nube 24/7 y Claude Cowork para trabajo residente en el escritorio, con ChatGPT Codex como alternativa para agentes de programación y los agentes de navegador de clase OpenAI Operator como alternativa para tareas web. Los agentes de IA son la categoría que más rápido se mueve de 2026: cada proveedor de primer nivel lanza ahora un producto de agente, y la elección práctica es entre agentes que viven en la nube (se ejecutan mientras tu portátil está cerrado) y agentes que viven en tu escritorio (manejan tus apps directamente). Gemini Spark se lanzó en el Google I/O el 19 de mayo de 2026 y es el primer agente en la nube 24/7. Claude Cowork alcanzó la disponibilidad general el 9 de abril de 2026 y funciona como un agente de escritorio que maneja tus apps locales. ChatGPT Codex Mobile (14 de mayo) es la elección para trabajo de agente de programación. Lee la comparativa completa Gemini Spark vs. Claude Cowork.

AgenteMejor paraDónde se ejecutaFortalezaPrecio
Gemini SparkTareas en la nube 24/7, flujos de WorkspaceVM de Google Cloud (siempre activa)Primer agente 24/7 real, integración profunda con Workspace$99.99/mes Google AI Ultra
Claude CoworkEscritorio, manejo de apps, diseño + códigoTu escritorio Mac/WindowsManeja apps locales, ve tu pantalla$20/mes Claude Pro
ChatGPT Codex MobileAgente de programación en el móvilNube de OpenAI + iOS/AndroidAprobar diffs y redirigir el trabajo desde el móvilIncluido en los planes de ChatGPT
Grok Agentic (Grok 4.5)Investigación en tiempo real, scraping de XNube de xAIIntegración nativa con X$30/mes SuperGrok
OpenAI de clase OperatorTareas de navegador, formularios webNube de OpenAI + tu navegadorAutomatización webChatGPT Pro
Segundo puesto y alternativas: Claude Cowork es el segundo en general y la elección natural cuando quieres el agente en tu máquina manejando tus apps. ChatGPT Codex Mobile es el segundo para agentes de programación. Grok Agentic es la elección de nicho para investigación en tiempo real.
Qué cambió este mes

No se lanzaron nuevos agentes de consumo, y Muse Code de Meta (5 de agosto) es una herramienta de terminal para desarrolladores en lugar de una de consumo, así que la elección entre Gemini Spark (nube) y Claude Cowork (escritorio) sigue guiando la mayoría de las decisiones sobre agentes para usuarios individuales. La capa de modelo por debajo se movió de nuevo: Claude Opus 5 (24 de julio) se llevó el #1 en el Agentic Index de Artificial Analysis con 55,3, por delante de GPT-5.6 Sol con 54,0 y Claude Fable 5 con 52,8, y cuesta $5 / $25. Opus 5 también encabeza el tablero Agent de Arena, con Kimi K3 en tercer lugar. Para equipos que construyen sus propios agentes, Muse Spark 1.2 de Meta (5 de agosto) es una opción agent-native barata a $1.25 / $4.25 cuyo Elo agéntico GDPval-AA v2 saltó de 1371 a 1631, aunque Scale SEAL solo ha valorado la 1.1 más antigua, que lidera su tablero de uso de herramientas MCP Atlas con 88,1. GLM-5.2 (MIT) es el modelo de agente open-weight más fuerte que puedes alojar en hardware modesto, en #5 del tablero Agent de Arena.

Guía de uso, agosto de 2026

Mejor IA para estudiantes

1
GPT-5.5 Free
Ensayos & investigación
2
Gemini 3.6 Flash
STEM + PDF
3
Claude Sonnet 5
Escritura & edición

La mejor IA para estudiantes es GPT-5.5 Free dentro de ChatGPT para trabajo de curso general y Gemini 3.6 Flash Free dentro de la aplicación de Gemini para STEM y estudio multimodal, con Qwen 3.7 Max como alternativa por API para conjuntos de problemas más difíciles (200 solicitudes gratis al día) y Claude Opus 5 como alternativa para editar ensayos. La mayoría de los estudiantes no necesitan pagar: el nivel gratuito de ChatGPT ahora usa por defecto GPT-5.6 (con GPT-5.5 aún disponible), Gemini 3.6 Flash está en la aplicación gratuita de Gemini y en AI Studio, Claude Sonnet 5 es el nuevo Claude gratuito por defecto, y DeepSeek V4 es gratis en el sitio de chat de DeepSeek. Para el desarrollo paso a paso en las matemáticas más difíciles, GPT-5.6 Sol es el nuevo buque insignia de OpenAI (su puntuación de FrontierMath aún no se ha publicado, con el 39,6 % verificado de GPT-5.5 Pro en FrontierMath Tier 4 como marca actual), aunque ambos son solo de pago; Qwen 3.7 Max es la alternativa de valor con 97,1 en HMMT 2026 febrero con precio de API de $1.25 / $3.75 en su promo del 50 % actual ($2.50 / $7.50 lista).

TareaMejor modeloPor qué¿Gratis?Alternativa
Ensayos & trabajo de cursoGPT-5.5Gratis en ChatGPT, fiabilidad factual mejorada vs. 5.4Claude Sonnet 5 (Claude gratis)
Resolución de problemas STEMGPT-5.6 Sol / Qwen 3.7 MaxNuevo buque insignia STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 febPro de pago / Qwen API de pagoGemini 3.6 Flash (gratis)
Investigación & precisiónGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarea, anclaje nativo en Google SearchSí (aplicación Gemini)Claude Opus 5
Edición de escrituraClaude Sonnet 5Gratis y por defecto en claude.ai; Claude Fable 5 es el líder de calidadSí (Claude gratis)Claude Fable 5
Estudio multimodal (PDF, diapositivas, imágenes)Gemini 3.6 FlashContexto 1M, gratis en la aplicación de GeminiNotebookLM (Google)
Segundo puesto y alternativas: Claude Sonnet 5 (gratis) es el segundo para la escritura y edición de ensayos. Gemini 3.6 Flash (gratis) es el segundo para el estudio multimodal y la ingesta de PDF. DeepSeek V4 es el segundo para la resolución de problemas con un presupuesto estrictamente de coste cero.
Guía de uso, agosto de 2026

Mejor IA para el trabajo & profesionales

1
GPT-5.6
Trabajo de conocimiento diario
2
Claude Opus 5
Programación & escritura
3
Gemini 3.1 Pro
Investigación & informes

La mejor IA para el trabajo profesional es GPT-5.6 (por defecto de ChatGPT desde el 9 de julio) para el trabajo de conocimiento diario, Claude Opus 5 para programación y escritura de alto riesgo, y Gemini Spark para flujos agénticos 24/7. La mayoría de los profesionales sacan el máximo partido ejecutando dos suscripciones de pago (ChatGPT Plus a $20/mes más Claude Pro a $20/mes, un total de $40/mes), o consolidando con Fello AI a $9.99/mes para los cinco mejores modelos en una app de Mac/iOS. Para el trabajo agéntico que corre mientras duermes, Gemini Spark en Google AI Ultra a $99.99/mes es el único agente en la nube 24/7 real.

Caso de usoMejor modeloDato clavePrecioAlternativa
Trabajo de conocimiento diarioGPT-5.6Por defecto de ChatGPT desde el 9 de julio; el asistente que la mayoría puede abrir$20/mes ChatGPT PlusClaude Opus 5
Programación (propietaria)Claude Opus 5#1 en Arena WebDev (1,702.9) e image-to-WebDev (1,668.6); el por defecto recomendado de Anthropic$20/mes Claude ProClaude Fable 5
Programación (rentable)Qwen 3.7 Max80,4 SWE-Verified, contexto 1M$1.25 / $3.75 promo; $2.50 / $7.50 listaDeepSeek V4-Flash 0731
Investigación & informesGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarea, anclaje de GoogleGoogle AI Pro / UltraClaude Opus 5
Matemáticas, física, modelado financiero difícilesGPT-5.6 SolNuevo buque insignia STEM de OpenAI (5.5 Pro verificado en 39,6 % FrontierMath)$100/mes ChatGPT ProQwen 3.7 Max
Flujos de agente siempre activosGemini SparkPrimer agente en la nube 24/7$99.99/mes Google AI UltraClaude Cowork
Noticias en vivo, creatividad con contexto de XGrok 4.5Clase Opus + anclaje nativo en X$30/mes SuperGrokGemini 3.1 Pro
Consolidación todo en unoFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/mesPagar a cada proveedor por separado
Segundo puesto y alternativas: para la mayoría de los equipos profesionales, Claude Opus 5 es el segundo tras GPT-5.6 para el trabajo diario y ahora el líder de programación de forma clara a $5 / $25, con Claude Fable 5 como el segundo para el trabajo de largo horizonte más difícil. Gemini 3.1 Pro es el segundo para roles con mucha investigación, y Gemini Spark es la elección única si puedes poner un agente en la nube a trabajar en tareas largas.
Comparativa de precios

Precios de los modelos de IA en agosto de 2026

Desde planes gratuitos de $0 hasta $199.99/mes de Google AI Ultra. El precio más determinante de esta tabla es Claude Opus 5 a $5 / $25, porque es el modelo #1 en el Intelligence Index de Artificial Analysis a la mitad del coste de Claude Fable 5. Muse Spark 1.2 de Meta se lista a $1.25 / $4.25, con un nivel Contributor a $0.10 / $0.20 para quien esté dispuesto a dejar que Meta entrene con sus prompts, y Grok 4.5 se lista a $2 / $6. La elección relación precio-rendimiento es ahora DeepSeek V4-Flash 0731 a $0.14 / $0.28, que iguala el Intelligence Index de 50 de Gemini 3.6 Flash y cuesta $0.03 por tarea de índice frente a los $0.56 de Flash. Entre los modelos cerrados, GPT-5.6 Luna es el más barato a $0.20 / $1.20 tras el recorte de OpenAI del 30 de julio. Para un desglose más a fondo consulta nuestra Guía completa de comparativa de precios de IA.

ModeloEntrada (por 1M)Salida (por 1M)Contexto¿Acceso gratis?
GPT-5.5$5.00$30.001M (400K en Codex)ChatGPT Free; API de pago
GPT-5.5 Pro$30.00$180.001MChatGPT Pro desde $100/mes (nivel de mayor uso a $200)
GPT-5.6 Sol$5.00$30.00No publicadoEn vivo en ChatGPT, Codex & API (9 de julio)
GPT-5.6 Terra$2.00$12.00No publicadoEn vivo en ChatGPT, Codex & API (9 de julio)
GPT-5.6 Luna$0.20$1.20No publicadoEn vivo en ChatGPT, Codex & API (9 de julio)
Claude Opus 5$5.00$25.001MPor defecto en Claude Pro/Max; API de pago
Claude Opus 4.8$5.00$25.001MModelo legacy en Anthropic; Pro/Max/API
Claude Fable 5$10.00$50.001MPermanente en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos
Claude Sonnet 5$2.00 introductorio / $3.00 lista$10.00 introductorio / $15.00 lista1MPor defecto en Claude Free & Pro; API de pago
Claude Sonnet 4.6$3.00$15.001MAPI de pago (reemplazado por Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MAplicación Gemini limitada; API de pago
Gemini 3.6 Flash$1.50$7.501MAplicación Gemini/AI Studio; nivel gratuito de API + API de pago
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; nivel gratuito de API + API de pago
Qwen 3.7 Max$1.25 promo / $2.50 lista$3.75 promo / $7.50 lista1M200 solicitudes gratis/día; API de pago más allá
MiniMax M3$0.30 (50 % de descuento sobre $0.60)$1.20 (≤512K)1MOpen weights; se aplican costes de alojamiento
LongCat-2.0Depende del proveedorDepende del proveedor1MOpen weights (MIT); se aplican costes de alojamiento
NVIDIA Nemotron 3 UltraDepende del proveedorDepende del proveedor1MOpen weights (OpenMDW); se aplican costes de alojamiento
Qwen 3.5 (open-weight)Autoalojado / TogetherAutoalojado / Together1MOpen weights; se aplican costes de alojamiento
Nex-N2-ProAutoalojado / proveedoresAutoalojado / proveedores1MOpen weights (Apache 2.0); se aplican costes de alojamiento
Rio 3.5 Open 397BAutoalojado / proveedoresAutoalojado / proveedores1MOpen weights (MIT); se aplican costes de alojamiento
Grok 4.3$1.25$2.501MPlan de consumo gratuito; API de pago
Grok 4.5$2.00$6.00500KGrok Build / Cursor / consola xAI; UE parcial, consola API aún cerrada
Muse Spark 1.2$1.25 ($0.10 nivel Contributor)$4.25 ($0.20 nivel Contributor)1MAPI de pago; Muse Code, Meta Model API y OpenRouter; el nivel Contributor cambia derechos de entrenamiento por un ~92 % de descuento
Kimi K3$3.00 ($0.30 cache-hit)$15.001MNivel básico gratuito en la aplicación de Kimi; open weights en Hugging Face (Kimi K3 License)
Gemini Omni Flash (vídeo)$1.50$17.50 (salida de vídeo)Clips de 10 segundosAplicación Gemini / Flow; AI Studio + API
DeepSeek V4-Pro$0.435 ($0.0036 cache-hit)$0.871MDeepSeek Chat gratis; API de pago
DeepSeek V4-Flash 0731$0.14$0.281MDeepSeek Chat gratis; API de pago
Kimi K2.7 CodeDepende del proveedorDepende del proveedor256KOpen weights; se aplican costes de alojamiento
GLM-5.2Depende del proveedorDepende del proveedor1MOpen weights; se aplican costes de alojamiento
ERNIE 5.1Precio para la región de ChinaPrecio para la región de China256KNivel gratuito de Baidu
Gemini Spark (agente)Sin precio de APISin precio de API1M (base Gemini)Google AI Ultra $99.99 o $199.99/mes
Fello AI (agregador)Enrutado por la appEnrutado por la appDepende del modelo$9.99/mes, plan gratuito disponible

Las tarifas de GPT-5.5 y GPT-5.5 Pro de arriba son precios de contexto corto; OpenAI ya no publica las cifras específicas de contexto largo. Los niveles GPT-5.6 se facturan a 2x entrada y 1,5x salida una vez que un prompt supera los 272K tokens de entrada, lo que sitúa a Terra de contexto largo en $4 / $18 y a Luna en $0.40 / $1.80. Si quieres acceso a varios modelos de IA sin gestionar suscripciones separadas, Fello AI ofrece GPT, Claude, Gemini, Grok, Perplexity y más en una sola app para Mac, iPhone y iPad desde $9.99/mes.

Modelos open-weight

Mejores modelos open-weight en agosto de 2026

El mejor modelo open-weight en agosto de 2026 es Kimi K3, y se llevó la delantera en el momento en que Moonshot publicó los pesos el 27 de julio de 2026. Tiene el Intelligence Index más alto de cualquier modelo open-weight con 57 en Artificial Analysis v4.1, seis puntos por delante de GLM-5.2, y en Arena sigue siendo la entrada abierta mejor situada, en #2 en WebDev (1,675.5) por detrás solo de Claude Opus 5 y #3 en el tablero Agent. Una pega decide cuál de los dos deberías usar de verdad. La descarga de K3 son 96 shards de safetensors y unos 1,56 TB, lo que necesita un clúster de GPU multinodo en lugar de una estación de trabajo, y viene bajo una licencia propia Kimi K3 License en lugar de MIT. Así que GLM-5.2 (Z.ai, MIT) sigue siendo nuestra recomendación práctica para equipos que ejecutan sus propios pesos, con un Intelligence Index de 51, #6 en Arena WebDev (1,587.1) y #5 en el tablero Agent. El tercer puesto cambió de manos el último día de julio: DeepSeek V4-Flash 0731 recibió nuevo post-training y saltó de un Intelligence Index de 40 a 50, a $0.14 / $0.28 bajo MIT.

ModeloMejor paraBenchmark claveContexto / LicenciaDónde ejecutar
Kimi K3Modelo open-weight mejor puntuado, trabajo agéntico y webII 57 (v4.1), el más alto de cualquier modelo open-weight; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B activos1M / Kimi K3 LicenseHugging Face (96 shards, 1.56 TB), Moonshot API, proveedores
GLM-5.2Programación agéntica de largo horizonte, contexto 1MII 51 (v4.1), el más alto que puedes alojar en hardware modesto; 744B/40B activos1M / MITZ.ai, Hugging Face, OpenRouter
DeepSeek V4-Flash 0731Mejor valor de cualquier modelo de la páginaII 50 (v4.1), desde 40 el 31 de julio; $0.03 por tarea de índice, 284B/13B activos1M / MITDeepSeek API ($0.14/$0.28), local
LongCat-2.0Programador abierto frontier entrenado en chips chinosII 33 (v4.1); 59,5 % SWE-Bench Pro (proveedor), 1.6T/~48B activos1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Multimodal de clase frontier baratoII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / licencia por definirHugging Face, API $0.30/1M (50 % de descuento)
Nex-N2-ProPuntuación de programación abierta más fuerteII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B activosBasado en Qwen / Apache 2.0Hugging Face, proveedores, autoalojado
Kimi K2.7 CodeProgramador abierto con licencia comercial más fuerte+21,8 % en Kimi Code Bench v2 vs. K2.6 (proveedor); 1T/32B activos256K / Modified MITHugging Face, DeepInfra, proveedores
DeepSeek V4-ProTrabajo agéntico del mundo realII 44 (v4.1), 1.6T/49B activos1M / MITDeepSeek API ($0.435/$0.87), local
Hy3El participante más nuevo con licencia permisivaII 41 (v4.1); #22 en Arena WebDev (1,516.4)Apache 2.0Hugging Face, proveedores, autoalojado
InklingPrimer modelo open-weight de Thinking MachinesII 41 (v4.1), agéntico 32,3, lanzado el 15 de julioOpen weightsHugging Face, proveedores, autoalojado
Inkling SmallMisma familia a una cuarta parte del tamañoII 40 (v4.1), agéntico 30,8; 276B/12B activos, entrada de texto, imagen y audioApache 2.0Hugging Face (BF16 y NVFP4), proveedores, autoalojado
NVIDIA Nemotron 3 UltraAfinado por NVIDIA, licencia totalmente permisivaII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B activos1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 autoalojado)
Qwen 3.5 (397B / 17B activos)Multimodal, decodificación rápida88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / abiertoTogether, OpenRouter, local
Qwen3.6-35B-A3BProgramador agéntico abierto eficiente (3B activos)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B activos262K (a 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, local
Qwen3.6-27BProgramador denso ejecutable en portátil87,8 GPQA Diamond, denso 27B, multimodal256K / Apache 2.0Local Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune de Qwen 3.5, razonamiento multilingüe70,8 Terminal-Bench 2.1 (first-party), supera a Qwen 3.7 Plus en 4/5397B/17B activos / MITHugging Face, proveedores, autoalojado
Llama 4 MaverickBuque insignia de la línea Meta17B activos / 400B de parámetros totalesLlama 4 licenseNube de Meta, Hugging Face, local
NVIDIA Nemotron 3 Nano OmniEdge / bajo consumoMultimodal, huella muy pequeñaCompacto / abiertoLocal, herramienta NVIDIA

Aquí la licencia importa tanto como la puntuación bruta: Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Nex-N2-Pro (Apache 2.0) y Nemotron 3 Ultra (OpenMDW) todos permiten claramente el uso comercial, mientras que MiniMax M3 viene bajo su propia licencia comunitaria y Kimi K3 se sitúa en su propia licencia personalizada con un umbral de ingresos para quien lo revenda como servicio. Ningún modelo open-weight es ya el primero en ningún tablero de Arena que sigamos: Claude Opus 5 se llevó el tablero Agent en julio, el último que lideró un modelo open-weight.

Cómo evaluamos

Benchmarks, precios y uso práctico

Cada clasificación de esta página combina tres entradas: benchmarks públicos de siete casas independientes (Artificial Analysis, Arena antes LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize y el tablero oficial de Terminal-Bench 2.1, cubriendo los índices Intelligence y Agentic, GPQA Diamond, ARC-AGI-1 al 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas y el Remote Labor Index), precios de API y suscripción publicados en la página de precios oficial de cada proveedor, y uso práctico por parte del equipo editorial de FelloAI que ejecuta prompts reales sobre la misma tarea en cada modelo. Volvemos a obtener las fuentes oficiales de precios y benchmarks antes de cada actualización mensual.

Los benchmarks se ponderan según el caso de uso: SWE-bench y Terminal-Bench impulsan la programación, GPQA Diamond y ARC-AGI-2 impulsan la precisión, GDPval-AA (el benchmark de entregables profesionales de Artificial Analysis) informa la calidad de las tareas profesionales mientras que el estilo de escritura se juzga principalmente por pruebas prácticas, FrontierMath y HMMT impulsan la resolución de problemas. Revelamos cuándo un benchmark es reportado por el proveedor pero no verificado de forma independiente, y descartamos cualquier afirmación que no podamos reproducir contra una fuente en vivo. No movemos la corona de una categoría por la fuerza de una sola tabla, y cuando un modelo nuevo es demasiado reciente para que los tableros de preferencia humana lo hayan valorado, lo decimos en lugar de coronarlo solo por puntuaciones de benchmark. Cuando un modelo pasa por una actualización importante entre actualizaciones, volvemos a clasificar la categoría y añadimos una línea «Qué cambió este mes» al pie del análisis a fondo.

Preguntas frecuentes

Preguntas comunes

¿Cuál es el mejor modelo de IA ahora mismo en agosto de 2026?
Depende de la tarea. En puntuación general de benchmark, Claude Opus 5 (24 de julio) es #1 en el Intelligence Index de Artificial Analysis con 61 y su Agentic Index con 55,3, y Arena lo ha valorado ahora en lo alto de cuatro de sus tableros, incluidos los dos de programación. Para el chat diario, GPT-5.6 ha sido el modelo por defecto de ChatGPT desde el 9 de julio y es el asistente que la mayoría de la gente puede abrir de verdad, aunque Claude Fable 5 lidera la tabla de texto de Arena. Para programación, Claude Opus 5 es #1 en los tableros WebDev (1,702.9) e image-to-WebDev (1,668.6) de Arena a la mitad del precio de Fable 5. Para escritura, Claude Fable 5 es #1 en la tabla de texto de Arena (1508.6), Humanity's Last Exam (53,3 %) y AA-Omniscience (40). Para precisión, Gemini 3.1 Pro iguala al panel humano en ARC-AGI-1 con un 98 % por $0.52 por tarea. Para matemáticas y razonamiento difíciles, GPT-5.6 Sol es #1 en LiveBench Mathematics, LiveBench Reasoning y ARC-AGI-2. Para imágenes, ChatGPT Images 2.0 lidera los dos tableros, y para vídeo Gemini Omni Flash lidera los dos. Para agentes, Gemini Spark es el agente en la nube 24/7 y Claude Cowork el de escritorio.
¿Qué es Claude Opus 5?
Claude Opus 5 es el buque insignia más nuevo de Anthropic, lanzado el 24 de julio de 2026, y el actual modelo #1 en Artificial Analysis. Lidera tanto el Intelligence Index con 61 como el Agentic Index con 55,3, y encabeza el tablero GDPval-AA v2 de entregables profesionales con 1858, muy por delante del 1746 de Claude Fable 5. El precio de la API es de $5 / $25 por 1M de tokens, el mismo que Opus 4.8 y la mitad del coste de Fable 5, con una ventana de contexto de 1M de tokens y una fecha de corte de conocimientos de mayo de 2026. ARC Prize confirma de forma independiente la afirmación de lanzamiento de Anthropic sobre ARC-AGI-3, donde Opus 5 puntúa un 30 % frente al 8 % del siguiente mejor modelo, cerca de 3,75 veces. Arena lo ha valorado desde entonces, situándolo #1 en WebDev, image-to-WebDev, Document y el tablero Agent y #6 en texto, y eso es lo que le movió la corona de programación. Una cosa a tener en cuenta: Artificial Analysis mide su tasa de alucinación en un 50 %, que es por lo que no ostenta ninguna corona de precisión en esta página.
¿Ha vuelto Claude Fable 5?
Sí. Anthropic volvió a desplegar Claude Fable 5 el 1 de julio de 2026 después de que el gobierno de EE. UU. levantara la restricción de control de exportaciones que había impuesto el 12 de junio. Está disponible de nuevo en la Claude API, Claude.ai, Claude Code y Claude Cowork. Anthropic hizo permanente a Fable 5 en los planes de pago el 20 de julio de 2026. Max y Team Premium lo incluyen con cerca del 50 % de los límites de uso habituales; Pro y Team Standard lo alcanzan a través de créditos de uso con un crédito inicial único de $100. El precio de la API es de $10 / $50 por millón de tokens. Fable 5 es un modelo de clase Mythos construido para trabajo agéntico de largo horizonte con un contexto de 1M de tokens, y es el segundo para programación por detrás de Claude Opus 5, en #2 en el tablero image-to-WebDev de Arena (1,625.7) y #4 en WebDev.
¿Qué es GPT-5.6 y puedo usarlo?
Sí, desde el 9 de julio de 2026. GPT-5.6 es la familia de modelos de nueva generación de OpenAI, y tras una vista previa cerrada de dos semanas que comenzó el 26 de junio tras una revisión de seguridad del gobierno de EE. UU., alcanzó la disponibilidad general el 9 de julio. Hay tres niveles, del menos al más capaz: Luna, el nivel rápido y más barato ($0.20 / $1.20 por 1M de tokens); Terra, un modelo equilibrado para el día a día que OpenAI dice que iguala a GPT-5.5 ($2 / $12); y Sol, el buque insignia afinado para biología, química y ciberseguridad ($5 / $30). OpenAI recortó Luna un 80 % y Terra un 20 % el 30 de julio de 2026, y dejó a Sol y todos los precios de suscripción de ChatGPT sin tocar. Ahora está en vivo en ChatGPT, Codex y la API como modelo por defecto de OpenAI. Una advertencia: la system card de OpenAI y el evaluador externo METR señalaron un comportamiento de «scheming» elevado en Sol, así que trátalo con cuidado para trabajo factual de alto riesgo hasta que se asienten los resultados independientes.
¿Ya salió Grok 4.5?
Sí. xAI lanzó Grok 4.5 públicamente el 8 de julio de 2026, su primer buque insignia desde que SpaceX absorbió la empresa y salió a bolsa como SPCX. Elon Musk lo describe como «un modelo de clase Opus, pero más rápido, más eficiente en tokens y de menor coste». Está entrenado con Cursor y orientado a la programación y el trabajo agéntico, con un precio de $2 / $6 por 1M de tokens y una ventana de contexto de 500K tokens. Está en vivo en Grok Build, Cursor en todos los planes y la consola de xAI. El acceso en la UE empezó a desplegarse tras un anuncio del 16 de julio y sigue siendo parcial, con Cursor reportando disponibilidad mientras que la consola de API de xAI sigue cerrada para los usuarios de la UE. Artificial Analysis lo puntúa con un Intelligence Index de 54 en v4.1, igualando al campo en Terminal-Bench 2.1 (83,3 %) pero quedando por detrás en SWE-Bench Pro con un 64,7 %, así que es la elección de valor en lugar del líder claro de benchmarks. Grok 4.5 es también nuestra elección de creatividad, por motivos de producto en lugar de calidad, dado que se sitúa #33 en EQ-Bench Creative Writing; para la mejor salida escrita, Claude Fable 5 gana de forma clara.
¿Qué IA es la mejor para programar?
Claude Opus 5 es la mejor para programar, y gana los dos tableros donde los desarrolladores votan sobre el resultado en lugar de un harness ejecutando un script: #1 en el tablero WebDev de Arena (1,702.9) y #1 en image-to-WebDev (1,668.6), en cortes de votos del 1 de agosto y el 31 de julio. Corre a $5 / $25 por 1M de tokens, la mitad de Claude Fable 5, y la propia documentación de Anthropic dice que empieces con Opus 5 para programación agéntica compleja. Claude Fable 5 es el segundo para el trabajo de largo horizonte más difícil en #2 image-to-WebDev y #4 WebDev, y Kimi K3 es el aspirante en #2 en WebDev (1,675.5). Ten en cuenta que el Coding Index de Artificial Analysis no es un barrido de Claude: GPT-5.6 Sol (xhigh) lo lidera con 78,3 con Opus 5 en 78,0, lo bastante cerca para llamarlo empate. DeepSeek V4-Flash 0731 es la elección relación precio-rendimiento a $0.14 / $0.28, y GLM-5.2 (MIT) es el mejor programador open-weight que puedes alojar tú mismo.
¿Qué IA es la mejor para escribir?
Claude Fable 5 es la mejor para escribir, y es el único modelo entre los tres primeros de los tres tableros independientes de escritura: #1 en Arena escritura creativa, #1 en LiveBench Language (90.7) y #3 en EQ-Bench Creative Writing v3. Cuesta $10 / $50 por 1M de tokens. Claude Sonnet 5 es la elección de valor y lo que la mayoría de la gente debería usar de verdad, ya que es gratis y por defecto en claude.ai con un precio introductorio de $2 / $10, aunque se clasifica #53 en Arena escritura creativa. Kimi K3 gana EQ-Bench de forma clara con 2377 si quieres ficción distintiva, Claude Opus 5 encabeza el tablero GDPval-AA v2 de entregables profesionales con 1858, GPT-5.5 es la alternativa para escritura de negocios anclada en hechos, y Gemini 3.6 Flash es la elección relación precio-rendimiento para contenido en volumen.
¿Cuál es el mejor modelo de IA open-weight en 2026?
Kimi K3 es el mejor modelo open-weight ahora mismo, y lo es desde que Moonshot publicó los pesos el 27 de julio de 2026. Tiene el Intelligence Index más alto de cualquier modelo open-weight con 57 en Artificial Analysis v4.1, y en Arena es #2 en WebDev y #3 en el tablero Agent. La pega es que son 96 shards y unos 1,56 TB bajo una licencia propia Kimi K3 License, así que GLM-5.2 (13 de junio, MIT) sigue siendo el modelo que la mayoría de los equipos pueden alojar de verdad, con un Intelligence Index de 51 y #6 en Arena WebDev. El tercero es DeepSeek V4-Flash 0731, que saltó de un Intelligence Index de 40 a 50 el 31 de julio sin cambiar precio, tamaño ni licencia, lo que lo convierte en el mejor valor del campo abierto a $0.14 / $0.28 bajo MIT. Vale la pena saber, con honestidad, que ningún modelo open-weight es ya el primero en ningún tablero de Arena que sigamos.
¿Cuál es el modelo de IA de clase frontier más barato?
En precio de API por millón de tokens, GPT-5.6 Luna es ahora el modelo cerrado de clase frontier más barato a $0.20 / $1.20, después de que OpenAI lo recortara un 80 % el 30 de julio de 2026, y Artificial Analysis lo puntúa con un Intelligence Index de 51, un punto por encima de Gemini 3.6 Flash. Aún más barato es DeepSeek V4-Flash 0731 a $0.14 / $0.28, que es ahora nuestra elección relación precio-rendimiento: iguala el Intelligence Index de 50 de Gemini 3.6 Flash y cuesta $0.03 por tarea de índice frente a los $0.56 de Flash, bajo una licencia MIT que puedes autoalojar. MiniMax M3 se lista ahora a $0.30 por millón de tokens de entrada con un descuento permanente del 50 %, con LongCat-2.0 como una fuerte alternativa MIT. Qwen 3.7 Max a $1.25 / $3.75 en su promo actual es la elección de valor con un Intelligence Index de 46, aunque Luna ahora lo supera tanto en precio como en puntuación.
¿Qué modelos de IA son gratis?
ChatGPT Free ahora usa por defecto GPT-5.6 (con GPT-5.5 aún disponible) bajo límites de uso. Gemini Free ejecuta Gemini 3.6 Flash en la aplicación de Gemini y Google AI Studio. Claude Free ejecuta Claude Sonnet 5 (el nuevo por defecto) con límites diarios. DeepSeek Chat ejecuta DeepSeek V4 gratis en el sitio web de DeepSeek. Grok tiene un plan de consumo gratuito limitado (X Premium es un complemento de pago). Qwen 3.5, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4 y GLM-5.2 son open-weight y gratis para autoalojar. Qwen 3.7 Max es solo API sin front-end de chat de consumo, pero Alibaba ahora incluye 200 solicitudes de modelo gratis al día. Kimi tiene un nivel básico gratuito en su app, con el uso agéntico más intenso medido.
¿Qué es Gemini Spark y vale $99.99/mes?
Gemini Spark es el primer agente de IA de Google residente en la nube 24/7, lanzado en el Google I/O el 19 de mayo de 2026 y exclusivo del plan Google AI Ultra, que Google reestructuró para incluir un nivel de entrada de $99.99/mes y un nivel superior de $199.99/mes. Spark está construido sobre los modelos base de Gemini con el harness Antigravity de Google en una VM de Google Cloud, se integra con Gmail, Google Docs y otras apps de Google Workspace, y puede interactuar con Chrome y el sistema Halo de Android en el lado del dispositivo. Vale el gasto para usuarios que tienen flujos repetibles de larga duración (triaje de bandeja de entrada, resúmenes de investigación, tareas programadas). Para tareas puntuales, Claude Cowork a $20/mes cubre la mayoría de las necesidades de agente de escritorio.
¿Qué es Fello AI?
Fello AI es un chatbot de IA para Mac, iPhone y iPad que te permite usar todos los mejores modelos de IA como ChatGPT, Claude, Gemini, Grok y DeepSeek en una sola app, con modelos actualizados con regularidad para que siempre tengas los más recientes. Cuesta $9.99/mes con una valoración de 4,7 estrellas a través de más de 27 000 reseñas.
¿Con qué frecuencia actualizáis esta página?
Actualizamos esta página al menos cada mes y dentro de las 24-48 horas siguientes al lanzamiento de cualquier modelo importante.
Artículos relacionados
Claude vs. ChatGPT: ¿qué IA es realmente mejor en 2026?

Claude alcanzó el #1 en la App Store a principios de 2026, sacando a ChatGPT del primer puesto por primera vez. El detonante fue la negativa pública de Anthropic a la exigencia del Pentágono de desplegar sus modelos para armas autónomas.

Leer más →
Grok vs. ChatGPT: ¿qué chatbot de IA es realmente mejor en 2026?

Ambos chatbots acaban de pasar a nuevos modelos insignia. ChatGPT corre ahora GPT-5.6 (niveles Sol, Terra, Luna) y Grok está impulsado por Grok 4.5, la versión de xAI centrada en programación del 8 de julio.

Leer más →
ChatGPT vs. Gemini en 2026: ¿qué IA deberías usar de verdad?

ChatGPT pasó a GPT-5.6 como su modelo insignia, mientras que Gemini 3.1 Pro sigue siendo el buque insignia de pago de Google. Cara a cara en escritura, programación, imágenes y precio.

Leer más →
Clasificaciones de la mejor IA de febrero de 2026

GPT-5.2, Claude Opus 4.6 y Gemini 3.1 Pro cara a cara. Nuestro análisis mensual a fondo de febrero con benchmarks y resultados prácticos.

Leer más →
Mejores modelos de IA en enero de 2026

Gemini 3 Pro, Claude 4.5, ChatGPT (GPT-5.2), Grok 4.1 y DeepSeek clasificados. Nuestra elección mensual de enero de 2026 en cada modelo importante.

Leer más →
Gemini Nano Banana Pro vs. GPT-Image-1.5: comparativa definitiva

Nuestra comparativa práctica original de diciembre de 2025 de los dos modelos líderes de generación de imágenes, con muestras de salida reales lado a lado.

Leer más →

Prueba todos los modelos.
Una app preciosa.

Todos los modelos de esta guía en una app nativa: ChatGPT, Claude, Gemini, Grok y DeepSeek. Gratis para empezar.

Fello AI funcionando en Mac, iPad y iPhone

Valoración de 4,7·más de 27 000 reseñas·Gratis para empezar