Melhores modelos de IA em 2026
Classificações, comparações e análises aprofundadas, atualizadas todos os meses à medida que chegam novos modelos.
Agosto de 2026 abre com o Claude Opus 5 no topo e duas coroas a mudar de mãos. O Opus 5 lidera o Intelligence Index da Artificial Analysis com 61 e o seu Agentic Index com 55,3 a $5 / $25 por 1M de tokens, metade do preço do Claude Fable 5, e assumiu agora a coroa da programação depois de terminar em primeiro nos dois quadros de programação por votos da Arena. O outro movimento dá-se na extremidade económica, onde o DeepSeek V4-Flash 0731 chegou a 31 de julho como a nova escolha de relação preço-desempenho a $0.14 / $0.28. Abaixo estão os vencedores por categoria de agosto de 2026. Clique em qualquer cartão para saltar diretamente para a análise completa, ou utilize a navegação fixa para passar de categoria em categoria. As classificações, benchmarks e preços são atualizados no prazo de 48 horas após o lançamento de qualquer modelo importante.
5 ago. Muse Spark 1.2 e Muse Code, Intelligence Index de 51 para 54 a um valor inalterado de $1.25 / $4.25, mais um agente de programação em terminal Novo
3 ago. Alibaba Qwen 3.8 (Qwen3.8-Max), modelo de topo multimodal de 2,4 biliões de parâmetros agora disponível para todos a $2 / $6 Novo
31 jul. DeepSeek DeepSeek V4-Flash 0731, mesmo preço, mesmo tamanho, Intelligence Index de 40 para 50 Novo
31 jul. MiniMax MiniMax H3, vídeo 2K com áudio estéreo nativo a partir de $0.13 por segundo Novo
Final de jul. Thinking Machines Inkling Small, um quarto do tamanho do Inkling com uma pontuação quase igual Novo
30 jul. OpenAI Descida de preço do GPT-5.6, Luna 80 % mais barato, Terra 20 % mais barato, Sol inalterado
24 jul. Anthropic Claude Opus 5, novo #1 na Artificial Analysis, lidera tanto o Intelligence Index (61) como o Agentic Index (55.3) Novo
24 jul. Sakana AI Fugu-Ultra v1.1, renovação do motor de orquestração com ganhos reportados pelo fornecedor de até 7,9 pontos sobre a v1.0 ao mesmo preço Novo
21 jul. Google Gemini 3.6 Flash, saída mais barata, mais rápido, mesmo Intelligence Index
16 jul. Moonshot AI Kimi K3, 2,8B de parâmetros, o maior modelo open-weight alguma vez lançado (pesos publicados a 27 de julho) Novo
9 jul. OpenAI GPT-5.6 Sol, Terra e Luna, família de nova geração em direto no ChatGPT, Codex e na API
Pendente Google Gemini 3.5 Pro, ainda por lançar, meses atrasado segundo a Bloomberg Atrasado
Melhor IA para escrita
A melhor IA para escrita é o Claude Fable 5, o único modelo entre os três primeiros dos três quadros independentes de escrita, com o Claude Sonnet 5 como escolha de relação qualidade-preço da versão gratuita e o GPT-5.5 como alternativa para escrita empresarial ancorada em factos. O Fable 5 lidera o quadro de escrita criativa da Arena, encabeça o LiveBench Language com 90,7 e fica em terceiro no EQ-Bench Creative Writing v3 atrás do Kimi K3 e do GPT-5.6 Sol. Nenhum outro modelo está entre os três primeiros em mais do que um deles. É uma mudança face ao mês passado, quando o Claude Sonnet 5 ocupava este lugar no GDPval-AA; os quadros de preferência não sustentam essa colocação, pelo que o Sonnet 5 é agora a escolha de relação qualidade-preço em vez do líder de qualidade. O Fable 5 custa $10 / $50 por 1M de tokens e está incluído em permanência no Claude Max e Team Premium a cerca de 50 % dos limites de utilização habituais. Se a sua escrita for um entregável de trabalho em vez de prosa, o Claude Opus 5 arrebata por completo o quadro GDPval-AA v2 de entregáveis profissionais da Artificial Analysis com 1858, bem à frente dos 1746 do Fable 5.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço (por 1M de tokens) |
|---|---|---|---|---|
| Claude Fable 5 | Melhor escrita no geral | #1 Arena texto no geral (1508.6), #1 LiveBench Language (90.7), #3 EQ-Bench | A opção mais cara aqui | $10 / $50 |
| Kimi K3 | Ficção criativa e voz | #1 EQ-Bench Creative Writing (2377), 234 Elo à frente do segundo | Apenas #10 na Arena escrita criativa | $3 / $15 |
| Claude Sonnet 5 | Escrita gratuita para o dia a dia | Grátis e predefinido no claude.ai, contexto 1M | #53 Arena escrita criativa; 75,0 LiveBench Language | $2 / $10 introdutório (depois $3 / $15) |
| Claude Opus 5 | Entregáveis profissionais | #1 GDPval-AA v2 com 1858, à frente do Fable 5 (1746) | Atrás do Fable 5 na Arena texto e no Humanity's Last Exam | $5 / $25 |
| GPT-5.5 | Escrita empresarial ancorada em factos | Ganhos documentados de fiabilidade factual sobre o GPT-5.4 | Níveis de raciocínio agora marcados como obsoletos | $5 / $30 |
| Gemini 3.6 Flash | Rascunhos em massa à escala | 17 % menos tokens de saída do que o 3.5 Flash | Mais fraco no raciocínio mais difícil | $1.50 / $7.50 |
A coroa da escrita fica com o Claude Fable 5, e é a decisão mais bem fundamentada da página. O Fable 5 é agora #1 no quadro de texto da Arena com 1508.6 na data de fecho de 1 de agosto, #1 no Humanity's Last Exam com 53,3 % e #1 no AA-Omniscience com 40, o que são três casas diferentes a concordar. O Claude Opus 5 mantém a faixa dos entregáveis profissionais no GDPval-AA v2, onde o quadro reajustado marca agora 1858 contra os 1746 do Fable 5.
Melhor IA para chat & assistente do dia a dia
A melhor IA para o chat do dia a dia é o GPT-5.6, e a razão honesta é o alcance em vez da posição nos quadros. É o modelo que o ChatGPT serve por predefinição à maior base de utilizadores da categoria, o que faz dele o melhor assistente que a maioria das pessoas consegue realmente abrir. Em preferência humana pura não é o líder: o GPT-5.6 Sol situa-se em #14 no quadro de texto da Arena com 1482,8, onde o Claude Fable 5 lidera com 1508.6. A maioria dos utilizadores do ChatGPT recebe o nível equilibrado Terra, que a OpenAI diz igualar o GPT-5.5 e que, desde a descida de preço de 30 de julho de 2026, custa 60 % menos. Está disponível dentro do ChatGPT (grátis com limites, Plus a $20/mês, Pro a $100/mês), através da API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $5 / $30 por 1M de tokens), e integrado dentro do Fello AI a par do Claude, Gemini, Grok e DeepSeek. Uma ressalva: o system card da OpenAI e o avaliador METR assinalaram um comportamento de «scheming» elevado no Sol, pelo que o GPT-5.5 Instant continua a ser a escolha mais segura para trabalho sensível a alucinações.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| GPT-5.6 | Chat do dia a dia, predefinição do ChatGPT | O assistente que a maioria consegue abrir; o Terra iguala o GPT-5.5 a ~metade do custo | #14 na Arena texto; scheming assinalado pelo METR | Grátis / $20/mês Plus; API $0.20 / $1.20 a $5 / $30 |
| Claude Fable 5 | A conversa mais bem avaliada | #1 na Arena texto no geral (1508.6) e em 6 de 7 subcategorias | Sem versão gratuita; acesso por créditos de utilização no Pro | $10 / $50 API |
| Claude Opus 5 | Respostas ponderadas e matizadas | #1 Artificial Analysis Intelligence Index (61) e Agentic Index (55.3) | #6 na Arena texto, atrás do Claude Fable 5 | $20/mês Pro, $5 / $25 API |
| GPT-5.5 Instant | Trabalho diário sensível a alucinações | 52,5 % menos afirmações alucinadas vs 5.3 Instant | Níveis de raciocínio agora marcados como obsoletos | $20/mês Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rápido, grátis, multimodal | Grátis na aplicação Gemini, contexto 1M, #12 na Arena texto | Mais fraco no raciocínio mais difícil | Grátis / $1.50 / $7.50 API |
| Fello AI | Todos os melhores modelos, uma aplicação | ChatGPT + Claude + Gemini + Grok + DeepSeek e mais no Mac, iPhone e iPad | Encaminhado pela aplicação, não direto | $9.99/mês |
O GPT-5.6 mantém a escolha de chat pelo alcance, e a distância para o líder de preferência alargou-se em vez de se fechar. Na data de fecho de 1 de agosto o Sol situa-se em #14 na Arena texto com 1482,8, a descer de #11, enquanto o Claude Fable 5 lidera com 1508.6. Nada mudou quanto ao produto, pelo que a coroa não se move: continua a ser sobre qual o assistente que a maioria das pessoas consegue realmente abrir.
Melhor IA para imagens
A melhor IA para a geração de imagens é o ChatGPT Images 2.0, e é a coroa menos contestada desta página. O GPT Image 2 lidera o quadro de texto para imagem da Arena com 1385 Elo e o seu quadro de edição de imagens com 1463, e a Artificial Analysis coloca-o em primeiro na sua própria arena de imagem com 1339,4. É a escolha natural sempre que a sua imagem tem de conter palavras legíveis, em português ou noutra escrita, e está incluído no ChatGPT Plus e Pro. Os segundos lugares mudaram. O Reve 2.1 (9 de julho) é o verdadeiro #2 em texto para imagem com 1302, e o Reve 2.0 situa-se agora atrás dele nos dois quadros. O Muse Image da Meta é #3 no quadro de texto para imagem da Arena e #2 em edição de imagens, o melhor desempenho que algum modelo de imagem da Meta alguma vez alcançou. O Nano Banana Pro da Google já não é o segundo no geral: em texto para imagem classifica-se entre #8 e #11, abaixo do seu próprio irmão mais barato Nano Banana 2, embora se coloque mais alto em edição de imagens.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| ChatGPT Images 2.0 | Imagens com texto legível | #1 texto para imagem (1385) e #1 edição de imagens (1463) | Menos fotorrealista do que a linha de imagem Gemini | Incluído no ChatGPT Plus |
| Reve 2.1 | Layout, tipografia, 4K nativo | #2 texto para imagem com 1302, edição que preserva o layout | Ecossistema mais pequeno | Grátis / a partir de $7.99/mês |
| Muse Image | Edição de imagens, ecossistema Meta | #3 texto para imagem, #2 edição de imagens (1407) | Novo, ferramentas escassas em redor | Aplicação Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Retratos e produtos fotorrealistas | Supera o Nano Banana Pro nos dois quadros | Mais fraco em texto dentro da imagem | Aplicação Gemini / AI Studio |
| Seedream 5.0 Pro | Texto multilíngue + edição por regiões | 10+ idiomas incl. árabe RTL, edição com laço e camadas | Sem benchmarks independentes; incerteza de direitos de autor | BytePlus / Magnific |
| Midjourney v8 | Arte estilizada, ilustração | Base estética que a maioria dos artistas prefere | Mais fraco em texto dentro da imagem | $10-$120/mês |
| Grok Imagine | NSFW / Spicy Mode | As barreiras mais permissivas | Um modelo mais pequeno por trás | $30/mês SuperGrok |
A coroa da imagem está inalterada e o GPT Image 2 continua a liderar os três quadros que seguimos, na Arena texto para imagem (1385), Arena edição de imagens (1463) e na arena de imagem da Artificial Analysis (1339,4). O único acrescento é o MAI-Image-2.5 da Microsoft, que se situa em terceiro no quadro de imagem da Artificial Analysis com 1269,7 e em terceiro no quadro de edição de imagens da Arena, pelo que o terceiro lugar depende agora de qual a casa que lê.
Melhor IA para vídeo
A melhor IA para a geração de vídeo é o Gemini Omni Flash, que lidera o quadro de texto para vídeo da Arena com 1527 Elo, 45 pontos completos à frente do segundo lugar, e também encabeça a arena de vídeo da Artificial Analysis. É #1 nas duas casas, algo que nenhum outro modelo de vídeo consegue. O preço vai de $1.50 na entrada e $17.50 por 1M de tokens de saída de vídeo, o que dá cerca de $0.10 por segundo de vídeo terminado, e suporta edição conversacional. O único limite real é a duração: o Omni Flash gera clips de 10 segundos. Se precisar de planos mais longos, o Veo 3.1 continua a ser a ferramenta certa dentro da aplicação Gemini, no AI Studio e no Vertex AI, com áudio nativo e saída 1080p. Isto substitui o Veo 3.1 no topo da categoria; o Veo 3.1 é um bom modelo mas não o líder, com a sua melhor variante em #6 no quadro de texto para vídeo da Arena. O candidato a vigiar é o MiniMax H3 (31 de julho), que gera clips 2K de 4 a 15 segundos com áudio estéreo nativo e é faturado por segundo a partir de $0.13 em 2K, já #2 no quadro de vídeo da Artificial Analysis com 1241,5. Não movemos a coroa por isso: a pontuação tem um dia, vem do único quadro que não se reproduziu entre análises, e o corte de votos de texto para vídeo da Arena é anterior ao H3.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| Gemini Omni Flash | Melhor vídeo de IA no geral | #1 nos dois quadros de vídeo (1527 Arena), edição conversacional | Limitado a gerações de 10 segundos | ~$0.10/s; aplicação Gemini / AI Studio |
| MiniMax H3 | Clips 2K com áudio nativo | 4-15 s em 2K, áudio estéreo nativo; #2 no AA vídeo (1241.5) | Um dia de existência, ainda sem votos na Arena; pesos não publicados | $0.13/s em 2K |
| Dreamina Seedance 2.0 | O concorrente mais próximo | #2 texto para vídeo (1482) e #1 em imagem para vídeo | Ecossistema ByteDance, acesso ocidental limitado | Dreamina / BytePlus |
| Muse Video | Vídeo no ecossistema Meta | #3 texto para vídeo com 1459 | O mais recente do grupo, ferramentas escassas | Aplicação Meta AI |
| Veo 3.1 | Clips de produção mais longos | Áudio nativo, 1080p, forte consistência física | #6 na Arena vídeo, não o líder de qualidade | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Iteração rápida a menor custo | 4K nativo, 60fps, clips de 15 segundos; o Turbo saiu a 17 de junho | Fora do top 16 na Arena texto para vídeo | A partir de $10/mês |
| Luma Ray 3 | Cenas fotorrealistas | Forte realismo para paisagens | Comunidade mais pequena | Grátis / a partir de $9.99/mês |
O Gemini Omni Flash mantém a coroa do vídeo, e continua a ser #1 nos dois quadros, com 1527,5 na Arena e 1244,8 na Artificial Analysis. O MiniMax H3 (31 de julho) entra como candidato em #2 no quadro de vídeo da Artificial Analysis (1241,5), a 3,3 Elo, e bate o Omni Flash em especificações com saída 2K, clips até 15 segundos e áudio estéreo nativo. Mantemos a coroa porque essa margem tem um dia, é de um único quadro e não traz votos na Arena, cujo corte de texto para vídeo é anterior ao lançamento.
Melhor IA para programação
A melhor IA para programação é o Claude Opus 5, e vence nos dois quadros onde os programadores votam no resultado final em vez de um script a medir um harness. É #1 no quadro WebDev da Arena com 1,702.9 e #1 em image-to-WebDev com 1,668.6, em cortes de votos de 1 de agosto e 31 de julho. O preço é a segunda metade do argumento: o Opus 5 corre a $5 / $25 por 1M de tokens contra os $10 / $50 do Claude Fable 5, e a Artificial Analysis mede-o em $2.34 por tarefa de índice contra os $3.15 do Fable 5. A própria documentação da Anthropic diz aos programadores para começarem com o Opus 5 para programação agêntica complexa e reservarem o Fable 5 para cargas que precisem da capacidade mais alta disponível. O Claude Fable 5 é o segundo e continua a ser a escolha para o trabalho de longo horizonte mais difícil, em #4 no WebDev (1,630.7) e #2 em image-to-WebDev (1,625.7). O candidato é o Kimi K3, que arrebata o #2 no WebDev com 1,675.5 e o #3 no quadro Agent da Arena, o programador open-weight mais forte dos quadros, embora auto-alojá-lo signifique 1,56 TB de pesos. No Coding Index da Artificial Analysis não é uma varrida da Claude: o GPT-5.6 Sol (xhigh) lidera com 78,3 com o Opus 5 (max) em 78,0, perto o suficiente para lhe chamar empate. O candidato sério mais barato é agora o DeepSeek V4-Flash 0731 a $0.14 / $0.28.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço (por 1M de tokens) |
|---|---|---|---|---|
| Claude Opus 5 | Melhor programação no geral | #1 Arena WebDev (1,702.9) e #1 image-to-WebDev (1,668.6); $2.34 por tarefa de índice | O Coding Index da Artificial Analysis tem o GPT-5.6 Sol um nadinha à frente | $5 / $25 |
| Claude Fable 5 | O trabalho agêntico de longo horizonte mais difícil | #2 Arena image-to-WebDev (1,625.7), #4 WebDev; contexto 1M | O mais caro; o Coding Index da Artificial Analysis coloca-o em 7.º | $10 / $50 |
| Kimi K3 | Construção de apps web e agentes | #2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index aberto mais alto (57) | 1,56 TB para auto-alojar | $3 / $15 |
| GPT-5.6 Sol | Modelo de topo da OpenAI, programação agêntica | #1 Artificial Analysis Coding Index com 78,3 (xhigh) | Ausente do quadro oficial Terminal-Bench; manipulação de avaliações assinalada pelo METR | $5 / $30 |
| Muse Spark 1.2 | Programação agêntica barata | Intelligence Index 54 a $1.25 / $4.25; 80 % no Terminal-Bench 2.1 (Artificial Analysis) | Segundo atrás do Opus 5 nos três gráficos de programação próprios da Meta (82,9 % vs 86,7 %); a Scale SEAL só avaliou a 1.1 | $1.25 / $4.25 |
| Grok 4.5 | Programador barato de boa relação qualidade-preço | #4 no quadro oficial Terminal-Bench 2.1 com 79,3 % via Cursor CLI | Taxa de alucinação mais alta; consola API da UE ainda fechada | $2 / $6 |
| Gemini 3.6 Flash | Programação de agentes à escala | Intelligence Index 50, 17 % menos tokens de saída do que o 3.5 Flash | Mais fraco no raciocínio mais difícil | $1.50 / $7.50 |
| GLM-5.2 | Melhor programador open-weight que consegue alojar | Intelligence Index 51, #6 Arena WebDev (1,587.1), licença MIT | O Kimi K3 supera-o; apenas auto-alojamento ou fornecedor | Open weights (MIT) |
A coroa da programação passou para o Claude Opus 5. A Arena terminou de o avaliar, e ficou em primeiro nos dois quadros de programação, WebDev com 1,702.9 e image-to-WebDev com 1,668.6, com o Claude Fable 5 em quarto e segundo. São quadros por votos com cortes publicados, pelo que a coroa assenta agora em comparações humanas em vez de num único harness, e o Opus 5 fá-lo a metade do preço do Fable 5. O Fable 5 passa a ser o segundo para o trabalho de longo horizonte mais difícil, e o Kimi K3 continua a ser o candidato em #2 no WebDev. O Muse Spark 1.2 da Meta chegou a 5 de agosto e não muda isso, porque nos próprios gráficos da Meta termina em segundo atrás do Opus 5 em cada benchmark de programação que publicou.
Melhor IA para criatividade
A melhor IA para trabalho criativo sem filtros e na moda é o Grok 4.5, e queremos ser exatos quanto ao porquê. Esta escolha é sobre o produto, não sobre a qualidade da prosa. O Grok 4.5 tem as menos restrições de conteúdo de qualquer modelo frontier e a única integração nativa com o X em tempo real, o que faz dele o único modelo que se envolve com briefings ousados, atuais ou deliberadamente provocadores que os outros recusam. É o modelo predefinido na aplicação Grok para subscritores SuperGrok e X Premium+ a $30/mês. Não é o melhor escritor, e os quadros são diretos quanto a isso. O Grok 4.5 situa-se em #33 no EQ-Bench Creative Writing e #41 no quadro de escrita criativa da Arena, perdendo em ambos para o mais antigo Grok 4.20-beta1. Se escolher apenas pela qualidade da saída, o Claude Fable 5 vence por completo em #1 na Arena escrita criativa, e o Kimi K3 vence o EQ-Bench. Escolha o Grok 4.5 pelo que lhe permite criar, não por quão bem escreve.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| Grok 4.5 | Sem filtros, com opinião, na moda | As menos restrições de conteúdo, ancoragem nativa no X em tempo real | #33 EQ-Bench, #41 Arena escrita criativa | $30/mês SuperGrok |
| Claude Fable 5 | Prosa criativa da mais alta qualidade | #1 Arena escrita criativa, #1 LiveBench Language | Barreiras cautelosas em briefings ousados | $10 / $50 API |
| Kimi K3 | Ficção e voz distintiva | #1 EQ-Bench Creative Writing com 2377 | Apenas #10 na Arena escrita criativa | $3 / $15 |
| Claude Opus 5 | Criatividade estruturada de formato longo | Mantém fios longos e autoedita-se; #1 Intelligence Index | O mais cauteloso do grupo | $20/mês Pro; $5 / $25 API |
| Gemini 3.1 Pro | Criativo multimodal | Forte cadeia de texto, imagem e vídeo | Quotas dentro da aplicação Gemini | Grátis / $2.00-$4.00 API entrada |
| Grok Imagine (Spicy Mode) | NSFW / criativo para adultos | A geração de imagens mais permissiva | Caso de utilização de nicho | $30/mês SuperGrok |
O Grok 4.5 mantém esta escolha, e nada se moveu quanto ao produto. Está aqui pela sua permissividade e pelo seu acesso em direto ao X, não pela posição nos quadros, e o Claude Fable 5 continua a ser o modelo a utilizar quando quer a melhor escrita. Uma nota de nome para agosto: a xAI cota agora nos quadros como SpaceXAI, e o modelo está inalterado.
Melhor IA para precisão & investigação
A melhor IA para precisão e investigação é o Gemini 3.1 Pro. O seu resultado mais forte é no ARC-AGI-1 da ARC Prize, onde pontua 98 % e iguala o painel humano, e fá-lo a $0.52 por tarefa. Essa combinação é o argumento: vários modelos estão próximos em capacidade, nenhum o iguala no custo para trabalho factual fiável. Combina-o com ancoragem nativa na Pesquisa Google, o que quer quando a resposta tem de ser atual em vez de meramente plausível. Também pontua 94,1 % no GPQA Diamond, onde o GPT-5.6 Sol agora o iguala em vez de ficar atrás, e 44,4 % no Humanity's Last Exam, e encabeça o quadro HLE da Scale SEAL com 46,44. Abandonámos o enquadramento anterior via ARC-AGI-2: os seus 77,1 % continuam corretos, mas o quadro moveu-se e essa pontuação coloca-o agora à volta do 14.º lugar. Duas ressalvas honestas. Na pesquisa ancorada em concreto, o quadro de pesquisa da Arena é liderado pela Anthropic, não pela Google, com o Gemini 3.1 Pro com ancoragem em #7. E no raciocínio inédito, o GPT-5.6 Sol lidera o ARC-AGI-2 e o Claude Opus 5 lidera o ARC-AGI-3 com 30 %, cerca de 3,75x o modelo seguinte. Não movemos a coroa para o Opus 5 porque a Artificial Analysis mede a sua taxa de alucinação em 50 % e coloca-o abaixo do Fable 5 no AA-Omniscience.
| Modelo | Melhor para | Benchmark-chave | Ponto fraco | Preço |
|---|---|---|---|---|
| Gemini 3.1 Pro | Trabalho factual barato e fiável | 98 % ARC-AGI-1 (iguala o painel humano) a $0.52/tarefa, 94,1 % GPQA (igualado pelo Sol) | ARC-AGI-2 77,1 % agora ~14.º; #7 na Arena pesquisa | $2.00-$4.00 / $12.00-$18.00 (escalonado) |
| Claude Fable 5 | Pesquisa ancorada | #1 e #3 no quadro de pesquisa da Arena, à frente da Google | Sem um único nível barato | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Raciocínio inédito | #1 ARC-AGI-2 com 93 %, contra um painel humano de 100 % | Scheming assinalado pelo METR | $5 / $30 |
| Claude Opus 5 | Os problemas inéditos mais difíceis | #1 ARC-AGI-3 com 30 %, ~3,75x o modelo seguinte (ARC Prize) | A Artificial Analysis mede uma taxa de alucinação de 50 % | $5 / $25 |
| Qwen 3.7 Max | Precisão frontier a preço vantajoso | 92,4 GPQA Diamond, 200 pedidos grátis/dia | Apenas API, sem front-end de chat | $1.25 / $3.75 promo; $2.50 / $7.50 tabela |
| Claude Opus 4.6 | Honestidade sob pressão | #1 no quadro MASK da Scale SEAL com 96,28; a Anthropic ocupa o top 5 | Substituído como modelo de topo | Modelo legacy da Anthropic |
O Gemini 3.1 Pro mantém a coroa da precisão, mas o seu número de destaque já não é uma vantagem. A sua pontuação GPQA Diamond foi reajustada para 94,1 % e o GPT-5.6 Sol iguala-o agora exatamente, pelo que a coroa assenta no resultado do ARC-AGI-1 a $0.52 por tarefa mais a ancoragem da Pesquisa em vez de no GPQA. Esta é a próxima coroa que voltamos a testar: o Claude Fable 5 encabeça os três quadros que medem quão frequentemente um modelo simplesmente erra, com 40 no AA-Omniscience, 61 % no Omniscience Accuracy e 53,3 % no Humanity's Last Exam.
Melhor IA para resolução de problemas
A melhor IA para a resolução de problemas difíceis é o GPT-5.6 Sol, e é a coroa mais bem fundamentada desta página. Arrebata o #1 no LiveBench Mathematics com 96,2, o #1 no LiveBench Reasoning com 91,7 e o #1 no ARC-AGI-2 com 93 %, o mais perto que algum modelo alguma vez chegou do painel humano de 100 %. Três casas distintas colocam-no em primeiro nas tarefas de raciocínio que importam, o que é mais concordância do que produz qualquer outra categoria desta página. A OpenAI ainda não publicou a pontuação FrontierMath do Sol, pelo que a marca OpenAI verificada continua a ser os 39,6 % do GPT-5.5 Pro no FrontierMath Tier 4, e inseriremos o número do Sol no momento em que for tornado público. O Qwen 3.7 Max é a alternativa de relação qualidade-preço para problemas de estilo competição com 97,1 no índice HMMT de fevereiro de 2026 e 44,5 no Apex, a uma fração do custo do ChatGPT Pro, e inclui agora 200 pedidos de modelo grátis por dia. O Claude Opus 5 é a alternativa para longas cadeias de raciocínio agêntico, liderando o Agentic Index da Artificial Analysis com 55,3 e o ARC-AGI-3 da ARC Prize com 30 %, cerca de 3,75x o modelo seguinte.
| Modelo | Melhor para | Benchmark-chave | Ponto fraco | Preço |
|---|---|---|---|---|
| GPT-5.6 Sol | A matemática, a ciência e o raciocínio mais difíceis | #1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (93 %) | FrontierMath ainda por publicar; scheming assinalado pelo METR | $100/mês ChatGPT Pro; API $5 / $30 |
| Claude Opus 5 | Longas cadeias de raciocínio agêntico | #1 Agentic Index (55.3), #1 ARC-AGI-3 (30 %) | Segundo no LiveBench Reasoning; taxa de alucinação de 50 % | $5 / $25 |
| GPT-5.5 Pro | Líder verificado do FrontierMath | 39,6 % FrontierMath Tier 4 | Substituído pelo Sol como modelo de topo | $100/mês ChatGPT Pro |
| Qwen 3.7 Max | Matemática de competição com orçamento apertado | 97,1 HMMT 2026 fev., 44,5 Apex, 200 pedidos grátis/dia | Apenas API | $1.25 / $3.75 promo; $2.50 / $7.50 tabela |
| Claude Fable 5 | Matemática dentro de um fluxo de programação | #1 na subcategoria de matemática da Arena (1543), 96,0 LiveBench Mathematics | A opção mais cara aqui | $10 / $50 |
| GLM-5.2 | Resolução de problemas open-weight | Intelligence Index aberto mais alto com 51, MIT, contexto 1M | Apenas auto-alojamento ou fornecedor | Open weights (MIT) |
O GPT-5.6 Sol mantém esta coroa, e ganhou um segundo argumento. O Sol lidera agora também o Terminal-Bench v2.1 da Artificial Analysis com 89,5 % e o seu Coding Index com 78,3, e iguala o Gemini 3.1 Pro no GPQA Diamond com 94,1 %. O Claude Opus 5 continua a ser a alternativa de raciocínio agêntico pela força do ARC-AGI-3. A 1 de agosto a OpenAI deu à sua próxima família de modelos o nome Astra e publicou dez novos resultados matemáticos de uma versão interna, embora o Astra não tenha sido lançado e não tenha data, preço nem disponibilidade.
Melhor agente de IA
O melhor agente de IA neste momento é o Gemini Spark para trabalho residente na cloud 24/7 e o Claude Cowork para trabalho residente no ambiente de trabalho, com o ChatGPT Codex como alternativa para agentes de programação e os agentes de navegador de classe OpenAI Operator como alternativa para tarefas web. Os agentes de IA são a categoria que mais depressa se move em 2026: cada fornecedor de topo lança agora um produto de agente, e a escolha prática é entre agentes que vivem na cloud (funcionam enquanto o seu portátil está fechado) e agentes que vivem no seu ambiente de trabalho (conduzem as suas aplicações diretamente). O Gemini Spark foi lançado na Google I/O a 19 de maio de 2026 e é o primeiro agente na cloud 24/7. O Claude Cowork atingiu a disponibilidade geral a 9 de abril de 2026 e funciona como um agente de ambiente de trabalho que conduz as suas aplicações locais. O ChatGPT Codex Mobile (14 de maio) é a escolha para trabalho de agente de programação. Leia a comparação completa Gemini Spark vs Claude Cowork.
| Agente | Melhor para | Onde funciona | Ponto forte | Preço |
|---|---|---|---|---|
| Gemini Spark | Tarefas na cloud 24/7, fluxos do Workspace | VM da Google Cloud (sempre ativa) | Primeiro verdadeiro agente 24/7, integração profunda com o Workspace | $99.99/mês Google AI Ultra |
| Claude Cowork | Ambiente de trabalho, condução de aplicações, design + código | O seu ambiente de trabalho Mac/Windows | Conduz aplicações locais, vê o seu ecrã | $20/mês Claude Pro |
| ChatGPT Codex Mobile | Agente de programação no telemóvel | Cloud da OpenAI + iOS/Android | Aprovar diffs e reencaminhar o trabalho a partir do telemóvel | Incluído nos planos ChatGPT |
| Grok Agentic (Grok 4.5) | Investigação em tempo real, scraping do X | Cloud da xAI | Integração nativa com o X | $30/mês SuperGrok |
| OpenAI de classe Operator | Tarefas de navegador, formulários web | Cloud da OpenAI + o seu navegador | Automação web | ChatGPT Pro |
Não saíram novos agentes de consumo, e o Muse Code da Meta (5 de agosto) é uma ferramenta de terminal para programadores em vez de uma de consumo, pelo que a escolha entre o Gemini Spark (cloud) e o Claude Cowork (ambiente de trabalho) continua a guiar a maioria das decisões sobre agentes para utilizadores individuais. A camada de modelo por baixo deles moveu-se de novo: o Claude Opus 5 (24 de julho) arrebatou o #1 no Agentic Index da Artificial Analysis com 55,3, à frente do GPT-5.6 Sol com 54,0 e do Claude Fable 5 com 52,8, e custa $5 / $25. O Opus 5 também encabeça o quadro Agent da Arena, com o Kimi K3 em terceiro. Para equipas que constroem os seus próprios agentes, o Muse Spark 1.2 da Meta (5 de agosto) é uma opção agent-native barata a $1.25 / $4.25 cujo Elo agêntico GDPval-AA v2 saltou de 1371 para 1631, embora a Scale SEAL só tenha avaliado a mais antiga 1.1, que lidera o seu quadro de utilização de ferramentas MCP Atlas com 88,1. O GLM-5.2 (MIT) é o modelo de agente open-weight mais forte que consegue alojar em hardware modesto, em #5 no quadro Agent da Arena.
Melhor IA para estudantes
A melhor IA para estudantes é o GPT-5.5 Free dentro do ChatGPT para trabalho de curso geral e o Gemini 3.6 Flash Free dentro da aplicação Gemini para STEM e estudo multimodal, com o Qwen 3.7 Max como alternativa por API para conjuntos de problemas mais difíceis (200 pedidos grátis por dia) e o Claude Opus 5 como alternativa para revisão de ensaios. A maioria dos estudantes não precisa de pagar: o nível gratuito do ChatGPT usa agora o GPT-5.6 por predefinição (com o GPT-5.5 ainda disponível), o Gemini 3.6 Flash está na aplicação gratuita Gemini e no AI Studio, o Claude Sonnet 5 é a nova predefinição gratuita do Claude, e o DeepSeek V4 é grátis no site de chat da DeepSeek. Para o desenvolvimento passo a passo na matemática mais difícil, o GPT-5.6 Sol é o novo modelo de topo da OpenAI (a sua pontuação FrontierMath ainda não foi publicada, com os 39,6 % verificados do GPT-5.5 Pro no FrontierMath Tier 4 como marca atual), embora ambos sejam apenas pagos; o Qwen 3.7 Max é a alternativa de relação qualidade-preço com 97,1 no HMMT 2026 fevereiro com preço de API de $1.25 / $3.75 na sua promo atual de 50 % ($2.50 / $7.50 tabela).
| Tarefa | Melhor modelo | Porquê | Grátis? | Alternativa |
|---|---|---|---|---|
| Ensaios & trabalho de curso | GPT-5.5 | Grátis no ChatGPT, fiabilidade factual melhorada vs 5.4 | Sim | Claude Sonnet 5 (Claude grátis) |
| Resolução de problemas STEM | GPT-5.6 Sol / Qwen 3.7 Max | Novo modelo de topo STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 fev. | Pro pago / Qwen API pago | Gemini 3.6 Flash (grátis) |
| Investigação & precisão | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarefa, ancoragem nativa na Pesquisa Google | Sim (aplicação Gemini) | Claude Opus 5 |
| Revisão de escrita | Claude Sonnet 5 | Grátis e predefinido no claude.ai; o Claude Fable 5 é o líder de qualidade | Sim (Claude grátis) | Claude Fable 5 |
| Estudo multimodal (PDFs, slides, imagens) | Gemini 3.6 Flash | Contexto 1M, grátis na aplicação Gemini | Sim | NotebookLM (Google) |
Melhor IA para o trabalho & profissionais
A melhor IA para trabalho profissional é o GPT-5.6 (predefinição do ChatGPT desde 9 de julho) para trabalho de conhecimento diário, o Claude Opus 5 para programação e escrita de alto risco, e o Gemini Spark para fluxos agênticos 24/7. A maioria dos profissionais tira o máximo partido ao manter duas subscrições pagas (ChatGPT Plus a $20/mês mais Claude Pro a $20/mês, um total de $40/mês), ou ao consolidar com o Fello AI a $9.99/mês para os cinco melhores modelos numa aplicação de Mac/iOS. Para trabalho agêntico que corre enquanto dorme, o Gemini Spark no Google AI Ultra a $99.99/mês é o único verdadeiro agente na cloud 24/7.
| Caso de utilização | Melhor modelo | Dado-chave | Preço | Alternativa |
|---|---|---|---|---|
| Trabalho de conhecimento diário | GPT-5.6 | Predefinição do ChatGPT desde 9 de julho; o assistente que a maioria consegue abrir | $20/mês ChatGPT Plus | Claude Opus 5 |
| Programação (proprietária) | Claude Opus 5 | #1 na Arena WebDev (1,702.9) e image-to-WebDev (1,668.6); a predefinição recomendada pela Anthropic | $20/mês Claude Pro | Claude Fable 5 |
| Programação (económica) | Qwen 3.7 Max | 80,4 SWE-Verified, contexto 1M | $1.25 / $3.75 promo; $2.50 / $7.50 tabela | DeepSeek V4-Flash 0731 |
| Investigação & briefings | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarefa, ancoragem Google | Google AI Pro / Ultra | Claude Opus 5 |
| Matemática, física, modelação financeira difíceis | GPT-5.6 Sol | Novo modelo de topo STEM da OpenAI (5.5 Pro verificado em 39,6 % FrontierMath) | $100/mês ChatGPT Pro | Qwen 3.7 Max |
| Fluxos de agente sempre ativos | Gemini Spark | Primeiro agente na cloud 24/7 | $99.99/mês Google AI Ultra | Claude Cowork |
| Notícias em direto, criativo com contexto do X | Grok 4.5 | Classe Opus + ancoragem nativa no X | $30/mês SuperGrok | Gemini 3.1 Pro |
| Consolidação tudo-em-um | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/mês | Pagar a cada fornecedor em separado |
Preços dos modelos de IA em agosto de 2026
De versões gratuitas a $0 até $199.99/mês do Google AI Ultra. O preço mais determinante desta tabela é o Claude Opus 5 a $5 / $25, porque é o modelo #1 no Intelligence Index da Artificial Analysis a metade do custo do Claude Fable 5. O Muse Spark 1.2 da Meta é listado a $1.25 / $4.25, com um nível Contributor a $0.10 / $0.20 para quem estiver disposto a deixar a Meta treinar com os seus prompts, e o Grok 4.5 é listado a $2 / $6. A escolha de relação preço-desempenho é agora o DeepSeek V4-Flash 0731 a $0.14 / $0.28, que iguala o Intelligence Index de 50 do Gemini 3.6 Flash e custa $0.03 por tarefa de índice contra os $0.56 do Flash. Entre os modelos fechados, o GPT-5.6 Luna é o mais barato a $0.20 / $1.20 após a descida da OpenAI de 30 de julho. Para uma análise mais aprofundada, consulte o nosso Guia completo de comparação de preços de IA.
| Modelo | Entrada (por 1M) | Saída (por 1M) | Contexto | Acesso grátis? |
|---|---|---|---|---|
| GPT-5.5 | $5.00 | $30.00 | 1M (400K no Codex) | ChatGPT Free; API paga |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro a partir de $100/mês (nível de maior utilização a $200) |
| GPT-5.6 Sol | $5.00 | $30.00 | Não publicado | Em direto no ChatGPT, Codex & API (9 de julho) |
| GPT-5.6 Terra | $2.00 | $12.00 | Não publicado | Em direto no ChatGPT, Codex & API (9 de julho) |
| GPT-5.6 Luna | $0.20 | $1.20 | Não publicado | Em direto no ChatGPT, Codex & API (9 de julho) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Predefinição no Claude Pro/Max; API paga |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Modelo legacy na Anthropic; Pro/Max/API |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Permanente no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos |
| Claude Sonnet 5 | $2.00 introdutório / $3.00 tabela | $10.00 introdutório / $15.00 tabela | 1M | Predefinição no Claude Free & Pro; API paga |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API paga (substituído pelo Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Aplicação Gemini limitada; API paga |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M | Aplicação Gemini/AI Studio; nível API gratuito + API paga |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; nível API gratuito + API paga |
| Qwen 3.7 Max | $1.25 promo / $2.50 tabela | $3.75 promo / $7.50 tabela | 1M | 200 pedidos grátis/dia; API paga para além disso |
| MiniMax M3 | $0.30 (50 % de desconto sobre $0.60) | $1.20 (≤512K) | 1M | Open weights; custos de alojamento aplicáveis |
| LongCat-2.0 | Depende do fornecedor | Depende do fornecedor | 1M | Open weights (MIT); custos de alojamento aplicáveis |
| NVIDIA Nemotron 3 Ultra | Depende do fornecedor | Depende do fornecedor | 1M | Open weights (OpenMDW); custos de alojamento aplicáveis |
| Qwen 3.5 (open-weight) | Auto-alojamento / Together | Auto-alojamento / Together | 1M | Open weights; custos de alojamento aplicáveis |
| Nex-N2-Pro | Auto-alojamento / fornecedores | Auto-alojamento / fornecedores | 1M | Open weights (Apache 2.0); custos de alojamento aplicáveis |
| Rio 3.5 Open 397B | Auto-alojamento / fornecedores | Auto-alojamento / fornecedores | 1M | Open weights (MIT); custos de alojamento aplicáveis |
| Grok 4.3 | $1.25 | $2.50 | 1M | Plano de consumo gratuito; API paga |
| Grok 4.5 | $2.00 | $6.00 | 500K | Grok Build / Cursor / consola xAI; UE parcial, consola API ainda fechada |
| Muse Spark 1.2 | $1.25 ($0.10 nível Contributor) | $4.25 ($0.20 nível Contributor) | 1M | API paga; Muse Code, Meta Model API e OpenRouter; o nível Contributor troca direitos de treino por um desconto de ~92 % |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Nível básico gratuito na aplicação Kimi; open weights no Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (vídeo) | $1.50 | $17.50 (saída de vídeo) | Clips de 10 segundos | Aplicação Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.435 ($0.0036 cache-hit) | $0.87 | 1M | DeepSeek Chat grátis; API paga |
| DeepSeek V4-Flash 0731 | $0.14 | $0.28 | 1M | DeepSeek Chat grátis; API paga |
| Kimi K2.7 Code | Depende do fornecedor | Depende do fornecedor | 256K | Open weights; custos de alojamento aplicáveis |
| GLM-5.2 | Depende do fornecedor | Depende do fornecedor | 1M | Open weights; custos de alojamento aplicáveis |
| ERNIE 5.1 | Preço para a região China | Preço para a região China | 256K | Nível gratuito da Baidu |
| Gemini Spark (agente) | Sem preço de API | Sem preço de API | 1M (base Gemini) | Google AI Ultra $99.99 ou $199.99/mês |
| Fello AI (agregador) | Encaminhado pela aplicação | Encaminhado pela aplicação | Depende do modelo | $9.99/mês, versão gratuita disponível |
As tarifas do GPT-5.5 e GPT-5.5 Pro acima são preços de contexto curto; a OpenAI já não publica os números específicos de contexto longo. Os níveis GPT-5.6 são faturados a 2x a entrada e 1,5x a saída assim que um prompt ultrapassa os 272K tokens de entrada, o que coloca o Terra de contexto longo em $4 / $18 e o Luna em $0.40 / $1.80. Se quiser acesso a vários modelos de IA sem gerir subscrições separadas, o Fello AI disponibiliza GPT, Claude, Gemini, Grok, Perplexity e mais numa única aplicação para Mac, iPhone e iPad a partir de $9.99/mês.
Melhores modelos open-weight em agosto de 2026
O melhor modelo open-weight em agosto de 2026 é o Kimi K3, e assumiu a liderança no momento em que a Moonshot publicou os pesos a 27 de julho de 2026. Detém o Intelligence Index mais alto de qualquer modelo open-weight com 57 na Artificial Analysis v4.1, seis pontos à frente do GLM-5.2, e na Arena continua a ser a entrada aberta mais bem posicionada, em #2 no WebDev (1,675.5) atrás apenas do Claude Opus 5 e #3 no quadro Agent. Um senão decide qual dos dois deve realmente utilizar. A transferência do K3 são 96 shards safetensors e cerca de 1,56 TB, o que precisa de um cluster de GPU multi-nó em vez de uma estação de trabalho, e chega sob uma licença própria Kimi K3 License em vez de MIT. Por isso o GLM-5.2 (Z.ai, MIT) continua a ser a nossa recomendação prática para equipas que fazem correr os seus próprios pesos, num Intelligence Index de 51, #6 na Arena WebDev (1,587.1) e #5 no quadro Agent. O terceiro lugar mudou de mãos no último dia de julho: o DeepSeek V4-Flash 0731 foi novamente pós-treinado e saltou de um Intelligence Index de 40 para 50, a $0.14 / $0.28 sob MIT.
| Modelo | Melhor para | Benchmark-chave | Contexto / Licença | Onde executar |
|---|---|---|---|---|
| Kimi K3 | Modelo open-weight mais bem pontuado, trabalho agêntico e web | II 57 (v4.1), o mais alto de qualquer modelo open-weight; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B ativos | 1M / Kimi K3 License | Hugging Face (96 shards, 1.56 TB), Moonshot API, fornecedores |
| GLM-5.2 | Programação agêntica de longo horizonte, contexto 1M | II 51 (v4.1), o mais alto que consegue alojar em hardware modesto; 744B/40B ativos | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| DeepSeek V4-Flash 0731 | Melhor relação qualidade-preço de qualquer modelo da página | II 50 (v4.1), de 40 a 31 de julho; $0.03 por tarefa de índice, 284B/13B ativos | 1M / MIT | DeepSeek API ($0.14/$0.28), local |
| LongCat-2.0 | Programador aberto frontier treinado em chips chineses | II 33 (v4.1); 59,5 % SWE-Bench Pro (fornecedor), 1.6T/~48B ativos | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Multimodal de classe frontier barato | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / licença por definir | Hugging Face, API $0.30/1M (50 % de desconto) |
| Nex-N2-Pro | Pontuação de programação aberta mais forte | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B ativos | Baseado em Qwen / Apache 2.0 | Hugging Face, fornecedores, auto-alojamento |
| Kimi K2.7 Code | Programador aberto com licença comercial mais forte | +21,8 % no Kimi Code Bench v2 vs K2.6 (fornecedor); 1T/32B ativos | 256K / Modified MIT | Hugging Face, DeepInfra, fornecedores |
| DeepSeek V4-Pro | Trabalho agêntico em condições reais | II 44 (v4.1), 1.6T/49B ativos | 1M / MIT | DeepSeek API ($0.435/$0.87), local |
| Hy3 | O mais recente participante com licença permissiva | II 41 (v4.1); #22 na Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, fornecedores, auto-alojamento |
| Inkling | Primeiro modelo open-weight da Thinking Machines | II 41 (v4.1), agêntico 32,3, lançado a 15 de julho | Open weights | Hugging Face, fornecedores, auto-alojamento |
| Inkling Small | Mesma família a um quarto do tamanho | II 40 (v4.1), agêntico 30,8; 276B/12B ativos, entrada de texto, imagem e áudio | Apache 2.0 | Hugging Face (BF16 e NVFP4), fornecedores, auto-alojamento |
| NVIDIA Nemotron 3 Ultra | Afinado pela NVIDIA, licença totalmente permissiva | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B ativos | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 auto-alojamento) |
| Qwen 3.5 (397B / 17B ativos) | Multimodal, descodificação rápida | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / aberto | Together, OpenRouter, local |
| Qwen3.6-35B-A3B | Programador agêntico aberto eficiente (3B ativos) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B ativos | 262K (até 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, local |
| Qwen3.6-27B | Programador denso executável em portátil | 87,8 GPQA Diamond, denso 27B, multimodal | 256K / Apache 2.0 | Local Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune de Qwen 3.5, raciocínio multilíngue | 70,8 Terminal-Bench 2.1 (first-party), bate o Qwen 3.7 Plus em 4/5 | 397B/17B ativos / MIT | Hugging Face, fornecedores, auto-alojamento |
| Llama 4 Maverick | Modelo de topo da linha Meta | 17B ativos / 400B de parâmetros no total | Llama 4 license | Cloud da Meta, Hugging Face, local |
| NVIDIA Nemotron 3 Nano Omni | Edge / baixo consumo | Multimodal, pegada muito reduzida | Compacto / aberto | Local, ferramenta NVIDIA |
Aqui a licença importa tanto como a pontuação bruta: Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Nex-N2-Pro (Apache 2.0) e Nemotron 3 Ultra (OpenMDW) permitem todos claramente a utilização comercial, ao passo que o MiniMax M3 chega sob a sua própria licença comunitária e o Kimi K3 assenta na sua própria licença personalizada com um limiar de receita para quem o revenda como serviço. Nenhum modelo open-weight é já o primeiro em qualquer quadro da Arena que seguimos: o Claude Opus 5 arrebatou o quadro Agent em julho, o último que um modelo open-weight liderou.
Benchmarks, preços e utilização prática
Cada classificação desta página combina três entradas: benchmarks públicos de sete casas independentes (Artificial Analysis, Arena antiga LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize e o quadro oficial Terminal-Bench 2.1, cobrindo os índices Intelligence e Agentic, GPQA Diamond, ARC-AGI-1 a 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas e o Remote Labor Index), preços de API e subscrição publicados na página de preços oficial de cada fornecedor, e utilização prática pela equipa editorial da FelloAI que executa prompts reais sobre a mesma tarefa em cada modelo. Voltamos a obter as fontes oficiais de preços e benchmarks antes de cada atualização mensal.
Os benchmarks são ponderados consoante o caso de utilização: o SWE-bench e o Terminal-Bench impulsionam a programação, o GPQA Diamond e o ARC-AGI-2 impulsionam a precisão, o GDPval-AA (o benchmark de entregáveis profissionais da Artificial Analysis) informa a qualidade das tarefas profissionais ao passo que o estilo de escrita é avaliado sobretudo por testes práticos, o FrontierMath e o HMMT impulsionam a resolução de problemas. Revelamos quando um benchmark é reportado pelo fornecedor mas não verificado de forma independente, e descartamos qualquer afirmação que não conseguimos reproduzir contra uma fonte em direto. Não movemos a coroa de uma categoria pela força de um único quadro, e quando um modelo novo é demasiado recente para que os quadros de preferência humana o tenham avaliado, dizemo-lo em vez de o coroar apenas por pontuações de benchmark. Quando um modelo passa por uma atualização importante entre atualizações, reclassificamos a categoria e acrescentamos uma linha «O que mudou este mês» no fundo da análise aprofundada.





