O Kimi K2.6 é o novo modelo de IA open source da Moonshot AI, da China, lançado a 20 de abril de 2026. Acaba de igualar o GPT-5.5 no benchmark de programação mais exigente do setor, a cerca de 80% menos por milhão de tokens. A corrida dos pesos abertos continuou a avançar depressa. A Moonshot lançou entretanto o Kimi K3, de 2,8 biliões de parâmetros, e o GLM 5.2 ultrapassou o GPT-5.5 no SWE-bench Pro. Com 1 bilião de parâmetros no total, 32 mil milhões ativos por token e uma janela de contexto de 256K tokens, o K2.6 é agora o modelo de pesos abertos #1 no Artificial Analysis Intelligence Index.

Neste artigo vai encontrar o que o Kimi K2.6 realmente faz bem, onde ainda perde para o Claude Opus 4.7 e o GPT-5.5, exatamente quanto custa e as formas mais simples de o usar num Mac sem alugar a sua própria GPU. Vamos também abordar como se compara ao DeepSeek V4, o outro gigante chinês de open source da mesma semana.

As principais conclusões

  • O Kimi K2.6 foi lançado a 20 de abril de 2026 como um modelo de pesos abertos Mixture-of-Experts de 1 bilião de parâmetros com 32 mil milhões ativos e uma janela de contexto de 256K.
  • Pontua 58,6 no SWE-Bench Pro, empatado com o GPT-5.5 e à frente do DeepSeek V4 Pro e do Gemini 3.1 Pro (o Claude Opus 4.7 lidera com 64,3).
  • O preço oficial da API da Moonshot é de $0.95 / $4.00 por 1M de tokens (entrada/saída), com entrada em cache a partir de apenas $0.16/M.
  • O K2.6 é gratuito no kimi.com e na Kimi App; os pesos estão disponíveis no Hugging Face sob uma licença MIT modificada.
  • Novidade em destaque: enxames de 300 agentes capazes de executar 4.000 passos coordenados e sessões autónomas de 13 horas.

O que é o Kimi K2.6?

Do editor

Todos os modelos de IA numa só aplicação

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 e mais numa só aplicação nativa para Mac e iPhone.

Descarregue já!

O Kimi K2.6 é o mais recente modelo de topo da Moonshot AI, um laboratório sediado em Pequim que tem lançado modelos de IA open source a um ritmo mais próximo de uma startup do que de um centro de investigação apoiado pelo Estado. O modelo é o sucessor direto do Kimi K2.5 e do Kimi K2 Thinking, ambos já perto do topo das tabelas de classificação de open source. A corrida do open source estende-se agora muito para lá da China, com a câmara municipal do Rio de Janeiro a lançar o Rio 3.5 Open 397B em junho de 2026.

O K2.6 mantém a mesma arquitetura Mixture-of-Experts dos seus antecessores, com 1 bilião de parâmetros no total e 32 mil milhões ativos por token distribuídos por 384 experts (8 selecionados por passagem). Os grandes saltos em relação ao K2.5 não estão no tamanho bruto. O K2.6 é muito mais forte em programação agêntica de longo horizonte, aceita entrada de visão e introduz enxames de agentes, em que uma única tarefa é dividida por até 300 subagentes a correr em paralelo.

É importante notar que o K2.6 tem pesos abertos. Qualquer pessoa pode descarregar o modelo a partir do Hugging Face sob uma licença MIT modificada. Há uma condição associada. Se implementar o K2.6 dentro de um produto comercial com mais de 100 milhões de utilizadores ativos mensais ou $20M de receita mensal, tem de exibir «Kimi K2» de forma proeminente na sua interface. Para todos os que ficam abaixo destes limiares, a licença é funcionalmente MIT.

O que mudou do Kimi K2.5 para o K2.6

A arquitetura é idêntica à do K2.5. A diferença está no pós-treino. A Moonshot afirma ter investido substancialmente mais capacidade de computação de treino em três áreas: estabilidade de longo horizonte, seguimento de instruções e coordenação de enxames. O resultado é um modelo que faz as mesmas coisas que o K2.5 fazia, mas obtém resultados nitidamente melhores quando a tarefa demora mais do que alguns minutos a concluir.

Números concretos dos próprios benchmarks da Moonshot:

  • A precisão da geração de código subiu 12% em relação ao K2.5
  • A estabilidade em contexto longo melhorou 18%
  • A taxa de sucesso na invocação de ferramentas atinge agora 96,6%
  • As tarefas de programação de longo horizonte mostram uma melhoria de 185% na taxa de conclusão
  • A taxa de alucinação caiu de 65% para 39%, uma redução de cerca de 40%
  • O Terminal-Bench 2.0 saltou de 50,8 para 66,7
  • A capacidade dos enxames de agentes triplicou, de 100 subagentes e 1.500 passos para 300 subagentes e 4.000 passos

Se já estiver a usar o K2.5 através do OpenRouter ou da API da Moonshot, a atualização é essencialmente gratuita. Não há alterações que quebrem a API, nem novas dependências, nem um escalão de preços diferente para o K2.6. Muda a string com o nome do modelo no seu código e essa é toda a migração.

Kimi K2.6 vs GPT-5.5, Claude Opus 4.7 e DeepSeek V4

Aqui está a comparação que mais importa para a decisão de atualizar.

Modelo SWE-Bench Pro SWE-Bench Verified Contexto Entrada $/M Saída $/M Pesos abertos
Kimi K2.6 58,6 80,2 256K $0.95 $4.00 Sim
GPT-5.5 58,6 88,7 400K $5.00 $30.00 Não
Claude Opus 4.7 64,3 87,6 1M $5.00 $25.00 Não
DeepSeek V4 Pro 55,4 80,6 1M $0.44 (promo) / $1.74 $0.87 (promo) / $3.48 Sim
Gemini 3.1 Pro 54,2 80,6 1M $2.00 $12.00 Não

Algumas leituras honestas sobre esta tabela.

No SWE-Bench Pro, o benchmark de engenharia de software mais difícil no mundo real, o Kimi K2.6 está empatado com o GPT-5.5 em 58,6. O Claude Opus 4.7 lidera agora com 64,3, mas custa cerca de 5x mais na entrada e mais de 6x mais na saída. Pelo preço, o K2.6 é o modelo de programação com melhor relação custo-eficiência disponível atualmente.

Olhe para a pontuação global do Intelligence Index da Artificial Analysis e o cenário muda. O GPT-5.5 lidera com 60 contra o Kimi K2.6 com 54, com o Claude Opus 4.7 em 57. Por isso, o K2.6 não é um modelo de fronteira universal. É um especialista que por acaso se especializa naquilo para que a maioria das pessoas usa IA, que é escrever, depurar e raciocinar sobre código.

O preço conta uma história diferente. Só o DeepSeek V4 Pro fica abaixo do K2.6, e apenas com preços promocionais até 5 de maio de 2026. Depois disso, o V4 Pro volta a $1.74/$3.48 por milhão de tokens, o que recoloca o K2.6 na liderança de valor no custo de entrada. O K2.6 também bate o V4 Pro no SWE-Bench Pro (58,6 vs 55,4), embora o V4 Pro tenha uma janela de contexto muito maior, de 1M. Para todos os escalões e tarifas por token num só lugar, consulte o nosso guia de preços e tarifas de API do Kimi.

Onde o K2.6 realmente se destaca é na capacidade agêntica. Demonstrou-se que o sistema de enxame de 300 subagentes corre durante 13 horas ininterruptas com mais de 4.000 chamadas a ferramentas numa única sessão. Esse tipo de estabilidade de longo horizonte costumava ser território do Claude.

Em que o Kimi K2.6 é realmente bom

Os números dos benchmarks contam uma história; os pontos fortes práticos contam outra.

Tarefas de programação de longo horizonte. O K2.6 é o primeiro modelo open source que lida de forma fiável com trabalho de programação que demora horas, e não minutos. Pontua 66,7 no Terminal-Bench 2.0, acima dos 50,8 do K2.5. Na prática, pode deixá-lo sozinho a refatorar um projeto, correr testes e corrigir o que falha sem perder o fio ao que estava a fazer.

Investigação agêntica na web. No BrowseComp (um benchmark de navegação e investigação autónomas), o K2.6 pontua 83,2, colocando-o à frente do GPT-5.4 e a curta distância do Claude Opus 4.7. Combinado com a funcionalidade de enxame de agentes, isto torna o K2.6 uma boa escolha para tarefas de investigação autónoma em que quer que o modelo procure as fontes por conta própria.

Design orientado por código. O K2.6 foi treinado para produzir código que gera resultados visuais (gráficos, sites, disposições de slides, painéis) em vez de apenas funções simples. É a mesma direção que o Claude Design seguiu, mas com pesos abertos e uma fração do custo de API.

Redução de alucinações. Análises independentes relatam que a taxa de alucinação caiu de 65% no K2.5 para 39% no K2.6. Ainda é alta em termos absolutos, mas a tendência importa; em fluxos de trabalho agênticos intensivos em ferramentas, cada facto omitido acumula-se.

Dentro do enxame de agentes: como funcionam os 300 subagentes do K2.6

O enxame de agentes é a funcionalidade em destaque, e é genuinamente diferente de tudo o resto do lado do open source.

A maioria das frameworks multiagente (CrewAI, AutoGen, LangGraph) obriga-o a definir agentes e orquestração manualmente. Decide que agente trata de que subtarefa, liga a passagem de mensagens e espera que nada falhe. O enxame de agentes do Kimi K2.6 faz esse trabalho por si. A partir de um único prompt, o modelo decompõe a tarefa em subtarefas heterogéneas, cria subagentes especializados, corre-os em paralelo e funde os seus resultados através de um coordenador de estado partilhado.

A arquitetura é hierárquica. Um único agente Arquiteto analisa o seu prompt, desenha o esquema de dados, escolhe a pilha tecnológica e define a árvore do projeto. Depois, esquadrões especializados formam-se por baixo dele. Para a construção típica de uma aplicação web, um Esquadrão de Frontend de 120 agentes escreve componentes de interface em paralelo, com agentes individuais a tratar da lógica de formulários, das animações e dos estilos responsivos em simultâneo. Outros esquadrões tratam do backend, do devops, dos testes e da integração.

Por cima de tudo isto está o próprio K2.6, a atuar como um coordenador adaptativo. Faz corresponder dinamicamente tarefas a agentes com base nos seus perfis de competências, acompanha o progresso em tempo real e, quando um subagente estagna ou falha, o coordenador deteta-o e reatribui ou regenera a subtarefa sem intervenção humana.

Os números de capacidade (300 agentes, 4.000 passos) não são teóricos. A Moonshot demonstrou o K2.6 a correr durante 13 horas ininterruptas numa única construção autónoma, com o enxame a manter-se coerente todo o tempo. O K2.5 ficava-se pelos 100 agentes e 1.500 passos. O K2.6 triplica ambos, e é isso que faz a diferença entre «constrói-me uma pequena funcionalidade» e «constrói-me uma aplicação de produção inteira».

Para a maioria dos leitores, isto importa de duas formas práticas. Primeiro, pode entregar ao K2.6 uma tarefa muito maior do que entregaria a um agente de modelo único e confiar que ele mantém a cabeça no lugar. Segundo, deixa de precisar de alugar ferramentas dispendiosas de orquestração multiagente para fazer trabalho de programação em paralelo. O enxame está integrado no modelo.

Kimi Code: o agente de programação de terminal que a maioria das pessoas ainda não experimentou

A par do lançamento do modelo K2.6, a Moonshot tem vindo a lançar discretamente o Kimi Code, um agente de programação de IA baseado em terminal que compete diretamente com o Claude Code e o OpenAI Codex. Para o panorama completo de custos do concorrente estabelecido, consulte o nosso guia de preços do Claude Code.

O Kimi Code é uma ferramenta de CLI que corre na diretoria do seu projeto e obtém permissões de execução totais na sua máquina local. Ao contrário de um chatbot que apenas sugere código, o Kimi Code lê ficheiros diretamente, edita-os, executa comandos de shell, obtém páginas web e ajusta o seu plano à medida que trabalha. Integra-se com o VSCode, Cursor, JetBrains e Zed através do Agent Client Protocol (ACP), para que possa continuar a usar o seu editor enquanto o Kimi trata do trabalho.

A configuração é simples. Instala a CLI, escreve kimi na diretoria do seu projeto, inicia sessão uma vez com /login e depois corre /init para deixar o agente analisar a estrutura do seu projeto e gerar um ficheiro AGENTS.md (essencialmente um manual do projeto que melhora a precisão em todas as tarefas seguintes). A partir daí, pergunta em português corrente e o Kimi Code executa.

O modelo de interação é híbrido: prima Ctrl-X para alternar entre o Modo Agente (conversa, planeamento, edições de código) e o Modo Shell (execução nativa de comandos). Está mais próximo em espírito do Claude Code do que de uma interface de chat, com a vantagem adicional de correr no modelo de classe fronteira mais barato do mercado.

Se já está a pagar pelo Claude Code ou pelo Codex e vê as contas a somar, esta é a troca que se paga a si própria mais depressa. Para uma alternativa chinesa proprietária com compatibilidade nativa com a API da Anthropic, veja a nossa análise do Qwen3.7-Max.

Quanto custa o Kimi K2.6?

O K2.6 é um dos modelos sérios de classe fronteira mais baratos do mercado atualmente.

Onde o usa Entrada $/M Saída $/M Notas
kimi.com (web/app) Grátis Grátis Versão gratuita generosa, acesso total ao K2.6
API da Moonshot (direta) $0.95 $4.00 A entrada em cache desce para $0.16/M
OpenRouter ~$0.74 ~$4.66 Encaminhado por vários fornecedores; o preço varia de hora a hora
Cloudflare Workers AI Disponível Disponível Preço por pedido, implementação na edge
Microsoft Azure AI Foundry Disponível Disponível Preços de contrato empresarial
Auto-hospedado (pesos abertos) $0 $0 Paga pelo hardware/eletricidade em vez disso

Para comparação, o Claude Opus 4.7 custa $5/$25 por milhão de tokens e o GPT-5.5 custa $5/$30 por milhão de tokens. Se corre agentes de programação pesados e vigia a fatura da API, o K2.6 é a mudança de custo/desempenho mais agressiva desde o DeepSeek V3, há um ano.

Pode correr o Kimi K2.6 num Mac?

Sim, mas com ressalvas. O lançamento completo em safetensors de 595 GB é território de hardware de servidor. O caminho realista para um Mac são as versões quantizadas em GGUF, que já estão no Hugging Face pela mão da Unsloth, da Ubergarm e da AesSedai.

Mesmo a mais pequena versão prática quantizada em 2 bits precisa de mais de 350 GB de memória unificada para correr, colocando o K2.6 fora do alcance de tudo exceto um Mac Studio M5 Ultra no máximo com 512 GB de memória unificada. Para a maioria dos leitores, isso não é realista.

Se tem um MacBook Pro M5 ou um Mac de 64 a 96 GB, é melhor olhar para modelos open source mais pequenos como o DeepSeek V4 Flash ou o Llama 4 Scout, que abordamos no nosso guia para correr modelos de IA open source em Macs M5. Para o K2.6 especificamente, o caminho mais limpo num Mac é usá-lo através da cloud, seja no kimi.com, através da API ou dentro de uma aplicação multimodelo.

Como começar a usar o Kimi K2.6 hoje

Há quatro caminhos práticos de entrada, consoante o que quer fazer.

1. Experimente-o gratuitamente no kimi.com. Abra o kimi.com, inicie sessão e comece a conversar. A versão gratuita dá-lhe acesso total ao K2.6 com o modo de pensamento ativado, sem cartão de crédito. Esta é a forma mais rápida de ver se o modelo é o certo para o seu fluxo de trabalho antes de se comprometer com o que quer que seja.

2. Use a aplicação móvel Kimi. O mesmo modelo, em iOS ou Android. Útil se trabalha sobretudo a partir do telemóvel e quer um modelo de classe fronteira que não exija uma subscrição da OpenAI ou da Anthropic.

3. Ligue-o às suas ferramentas atuais através do OpenRouter. A maioria das aplicações de IA e plugins de IDE (Cline, Roo Code, Continue, Open WebUI, Cursor com modelos personalizados) suporta o OpenRouter como backend. Adicione a sua chave do OpenRouter, mude o seletor de modelo para moonshotai/kimi-k2.6 e está feito. O preço através do OpenRouter ronda os $0.74 de entrada / $4.66 de saída por milhão de tokens.

4. Vá direto através da API da Moonshot. Se corre cargas de trabalho de produção ou quer o custo mais baixo, registe-se para uma chave de API em platform.kimi.ai e use $0.95 de entrada / $4.00 de saída por milhão de tokens, com a entrada em cache a descer para $0.16/M em contexto repetido. Este é o caminho mais barato para trabalho agêntico de alto volume.

Para programadores de Mac especificamente, o Kimi Code é o caminho que vale a pena experimentar primeiro. A configuração é uma única instalação de CLI e, assim que tiver corrido /init no seu projeto, pode entregar-lhe tarefas da mesma forma que as entregaria ao Claude Code, exceto que o K2.6 vai executá-las por cerca de um quinto do preço.

Onde entra o Fello AI

Se não quer gerir chaves de API, contas do OpenRouter e quatro separadores de chat diferentes, o caminho mais simples num Mac é uma aplicação de IA multimodelo.

O Fello AI foi feito exatamente para isto. Uma subscrição de $9.99/mês dá-lhe o ChatGPT, o Claude, o Gemini, o Grok, o DeepSeek e o Kimi numa única aplicação nativa de macOS, com atualizações de modelos a chegar à medida que novas versões de fronteira são lançadas. Esse agrupamento importa mais em 2026 do que importava há um ano, porque nenhum modelo isolado vence todas as tarefas. Quer modelos de fronteira de código fechado para algumas cargas de trabalho, modelos open source como o Kimi e o DeepSeek para outras, e uma forma de alternar entre eles sem voltar a colar o seu prompt.

Para utilizadores de Mac que querem a configuração mais simples possível, sem contas de API e sem faturas por token, é essa a jogada.

Vale a pena mudar para o Kimi K2.6?

Para a maioria dos leitores, a resposta honesta é: sim para trabalho intensivo de programação, não como substituto completo do ChatGPT.

Se vive num IDE, corre agentes de programação autónomos ou consome tokens de API no Claude Code ou no Cursor, o K2.6 é a mudança de custo por qualidade mais convincente do mercado neste momento. Se o Cursor é a sua ferramenta diária, compare os seus planos no nosso guia de escalões de preços do Cursor. O facto de os pesos serem abertos significa que continuará a ficar mais barato à medida que fornecedores externos competem.

Se sobretudo conversa, escreve, planeia e raciocina, o GPT-5.5 e o Claude Opus 4.7 continuam a parecer um passo à frente, especialmente na qualidade subjetiva da escrita e no seguimento de instruções. O K2.6 é rápido e barato, mas corre prolixo e fica demasiado ansioso nas chamadas a ferramentas.

A verdadeira jogada vencedora para a maioria das pessoas é usá-los a todos através de uma única aplicação de Mac e escolher a ferramenta certa por tarefa. É essa a mudança estrutural que a fronteira do open source está a forçar em 2026; nenhum modelo isolado é a resposta.

FAQ

O que é o Kimi K2.6?

O Kimi K2.6 é um modelo de IA open source lançado pela Moonshot AI a 20 de abril de 2026. Usa uma arquitetura Mixture-of-Experts de 1 bilião de parâmetros com 32 mil milhões de parâmetros ativos e uma janela de contexto de 256K tokens.

O Kimi K2.6 é melhor do que o GPT-5.5?

Nos benchmarks de programação SWE-Bench Pro, o Kimi K2.6 iguala o GPT-5.5 em 58,6. No Intelligence Index global, o GPT-5.5 continua a liderar com 60 contra 54 do K2.6. O Kimi é cerca de 5x mais barato na entrada e mais de 7x mais barato na saída por milhão de tokens.

O Kimi K2.6 é gratuito?

Sim. O Kimi K2.6 é gratuito no kimi.com e na aplicação móvel Kimi. A API custa $0.95 por milhão de tokens de entrada e $4.00 por milhão de tokens de saída.

Posso correr o Kimi K2.6 no meu Mac?

O modelo completo é grande demais para a maioria dos Macs. Existem versões quantizadas em GGUF, mas ainda precisam de mais de 350 GB de memória unificada, o que significa um Mac Studio M5 Ultra com 512 GB. A maioria dos utilizadores de Mac deve correr o K2.6 através do kimi.com ou de uma aplicação multimodelo como o Fello AI.

Onde posso descarregar o Kimi K2.6?

Os pesos oficiais do modelo estão no Hugging Face em huggingface.co/moonshotai/Kimi-K2.6 sob uma licença MIT modificada. Existem versões quantizadas em GGUF da Unsloth e de outros contribuidores da comunidade.

O que é o enxame de agentes do Kimi?

O enxame de agentes do Kimi K2.6 é um sistema multiagente integrado que decompõe um único prompt em até 300 subagentes paralelos e os corre ao longo de até 4.000 passos coordenados. O K2.6 atua como coordenador, atribuindo tarefas automaticamente e recuperando de falhas.

O que é o Kimi Code?

O Kimi Code é o agente de programação de IA baseado em terminal da Moonshot, semelhante ao Claude Code ou ao OpenAI Codex. Corre como uma CLI na diretoria do seu projeto, integra-se com o VSCode, Cursor, JetBrains e Zed através do Agent Client Protocol, e usa o K2.6 como modelo subjacente.