A Moonshot AI publicou os pesos completos do Kimi K3 a 27 de julho de 2026, onze dias depois de o modelo ter entrado em funcionamento na aplicação Kimi. O repositório na Hugging Face contém 96 fragmentos safetensors que totalizam cerca de 1,56 TB. Com 2,8 biliões de parâmetros totais, com 104 mil milhões ativos por token, o K3 é o maior modelo aberto que alguém já lançou. A Moonshot chama-lhe o primeiro modelo aberto de classe 3B do mundo, e essa afirmação tem agora um botão de descarregar por trás.

As pontuações independentes também chegaram, e são fortes sem serem uma vitória absoluta. O Kimi K3 pontua 57 no Intelligence Index da Artificial Analysis, à frente de todos os outros modelos de open weights e atrás apenas de três fechados. Abaixo tem as especificações verificadas, o que a licença de facto permite, as tarifas oficiais da API que a Moonshot já publicou e uma leitura honesta de como o K3 se compara com o Claude Opus 5.

Principais conclusões

  • Os open weights saíram a 27 de julho de 2026, 96 fragmentos e cerca de 1,56 TB na Hugging Face, sob uma Kimi K3 License personalizada em vez da MIT.
  • Um design Mixture-of-Experts com 2,8 biliões de parâmetros totais, 104 mil milhões ativados por token e uma janela de contexto de 1 048 576 tokens.
  • Aceita entrada de texto, imagem e vídeo, raciocina sempre e expõe agora um esforço de raciocínio baixo, alto e máximo em vez de apenas máximo.
  • O preço oficial da API é de $3.00 por milhão de tokens de entrada e $15.00 de saída, descendo para $0.30 na entrada em cache, a mesma tarifa anunciada do Claude Sonnet 5.
  • Pontua 57 no Artificial Analysis Intelligence Index, o melhor resultado de open weights, com o GLM-5.2 a seguir com 51.

O que é o Kimi K3?

Do editor

Todos os modelos de IA numa só aplicação

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 e mais numa só aplicação nativa para Mac e iPhone.

Descarregue já!

O Kimi K3 é o grande modelo de linguagem de topo da Moonshot AI, lançado a 16 de julho de 2026 e disponibilizado como open weights a 27 de julho. Usa um design Mixture-of-Experts com 2,8 biliões de parâmetros totais, dos quais 104 mil milhões ativam em cada token, e lê uma janela de contexto de 1 milhão de tokens. A própria documentação da Moonshot confirma que aceita entrada de texto, imagem e vídeo.

O intervalo entre o lançamento e os pesos foi planeado, e a Moonshot disse-o na altura. A sua publicação de lançamento prometia os ficheiros “até 27 de julho de 2026”, enquanto a equipa trabalhava “de perto com parceiros de inferência e mantenedores de open source para alinhar detalhes técnicos e garantir uma implementação fiável em todo o ecossistema”. O relatório técnico saiu com os pesos, em vez de vir a reboque.

EspecificaçãoKimi K3
ProgramadorMoonshot AI
Lançado16 de julho de 2026 (pesos a 27 de julho de 2026)
ArquiteturaMixture-of-Experts (MoE)
Parâmetros totais2,8 biliões
Parâmetros ativados104 mil milhões por token
Camadas93 (69 Kimi Delta Attention, 24 Gated MLA)
Experts896 no total, 16 selecionados por token
Codificador de visãoMoonViT-V2, 401M de parâmetros
Janela de contexto1 048 576 tokens
Tipos de entradaTexto, imagem, vídeo
QuantizaçãoPesos MXFP4, ativações MXFP8
Controlo de raciocínioreasoning_effort baixo / alto / máximo, predefinição máximo
LicençaKimi K3 License (personalizada, não MIT)

Com 2,8 biliões de parâmetros, o Kimi K3 é o maior modelo aberto lançado até à data, confortavelmente acima do V4-Pro da DeepSeek, com 1,6 biliões. O design Mixture-of-Experts significa que só uma pequena fração desses parâmetros dispara em cada token, por isso o custo de computação efetivo mantém-se muito abaixo do que a contagem bruta sugere. Ativar 16 de 896 experts é um rácio de esparsidade invulgarmente alto. Essa escolha é central para a forma como a Moonshot espremeu desempenho de fronteira da arquitetura.

Análise de Inteligência, Desempenho e Preço do Kimi K3 pela Artificial Analysis [fonte]

Open weights do Kimi K3: o que saiu de facto

É esta a parte que mudou a 27 de julho, e é a razão pela qual o K3 importa mais do que a sua linha de benchmark. Todos os outros modelos deste nível de capacidade são uma API que aluga. O K3 é um ficheiro que pode ter na mão.

O que está no repositório

O repositório na Hugging Face contém 120 ficheiros, dos quais 96 são fragmentos safetensors, e o descarregamento completo dá cerca de 1,56 TB. A Moonshot disponibiliza o modelo em pesos MXFP4 nativos com ativações MXFP8, aplicados através de treino consciente da quantização a partir da fase de fine-tuning supervisionado. É por isso que um modelo de 2,8 biliões de parâmetros cabe em 1,56 TB em vez de várias vezes esse valor, e significa que não está a descarregar uma quantização com perdas feita pela comunidade, está a descarregar o que a Moonshot treinou.

A procura foi imediata. Um dia depois de os ficheiros serem publicados, o repositório mostrava cerca de 99 000 descarregamentos e mais de 7300 likes, contados a 28 de julho de 2026. Para um checkpoint que quase ninguém consegue alojar na própria máquina, é muito tráfego, e grande parte serão fornecedores de inferência, projetos de quantização e laboratórios de investigação em vez de particulares.

A Moonshot nomeia três motores de inferência como runtimes recomendados, o vLLM, o SGLang e o TokenSpeed, cada um com a sua própria receita publicada para o K3. O relatório técnico saiu com os pesos, em vez de vir a reboque, por isso os detalhes da arquitetura também são públicos.

A Kimi K3 License não é MIT

Leia isto antes de planear um produto à volta dela.

A licença concede os direitos habituais de usar, copiar, modificar, distribuir, sublicenciar, fazer fine-tuning e vender, o que se lê como MIT para a maioria dos leitores. Duas cláusulas anexam depois condições que a MIT não tem.

A primeira é um limiar de receita para a revenda. Se gere um negócio de model-as-a-service e a sua receita ultrapassar os 20 milhões de dólares em quaisquer 12 meses consecutivos, tem de assinar um acordo separado com a Moonshot antes de usar o K3 comercialmente. A segunda é uma regra de atribuição. Qualquer produto construído sobre o K3 com mais de 100 milhões de utilizadores ativos mensais, ou mais de 20 milhões de dólares de receita mensal, tem de exibir o nome “Kimi K3” de forma bem visível na sua interface.

Ambas as condições são dispensadas para uso puramente interno, ou seja, tudo o que nunca expõe o modelo ou os seus resultados a terceiros. Para um programador individual, uma startup ou um grupo de investigação, o efeito prático é nulo. Para um hyperscaler a revender inferência, é uma negociação. É também por isto que o GLM e a sua licença MIT ainda ganham em liberdade de licença, mesmo que o K3 ganhe em capacidade.

O que é preciso para correr o Kimi K3 por conta própria

Descarregável não é o mesmo que executável. Um checkpoint de 1,56 TB precisa de um cluster de GPU multinó para servir em contexto completo, por isso “pode alojá-lo internamente” é verdade para laboratórios e equipas de infraestrutura sérias, não para alguém com uma única estação de trabalho. Se quer um modelo aberto que consiga mesmo correr no seu próprio hardware, os modelos Kimi mais pequenos e o GLM continuam a ser as opções realistas. A nossa síntese dos melhores modelos de IA open source ordena-os pelo que o hardware exige.

A arquitetura por trás do salto

A Moonshot reporta cerca de 2,5x de melhoria na eficiência global de escalabilidade face ao Kimi K2. Em termos simples, o K3 converte computação bruta em inteligência utilizável de forma muito mais eficaz do que a geração anterior. Três mudanças carregam a maior parte do peso, e as três estão agora documentadas no relatório técnico público.

Kimi Delta Attention

A Kimi Delta Attention (KDA) é um mecanismo de atenção linear híbrida, e 69 das 93 camadas do modelo usam-na, correndo as restantes 24 em Gated MLA. A atenção padrão fica mais lenta e mais gulosa de memória à medida que as sequências crescem, que é exatamente o problema com um milhão de tokens. A Moonshot reporta que a KDA permite uma descodificação até 6,3x mais rápida em contextos de um milhão de tokens, o que importa para trabalho agentivo, onde um modelo lê e raciocina repetidamente sobre enormes extensões de código ou documentos.

Attention Residuals

Os Attention Residuals (AttnRes) tratam de como a informação se move ao longo da profundidade da rede, e não ao longo do comprimento da sequência. Em vez de acumular representações de forma uniforme camada a camada, os AttnRes recuperam representações de forma seletiva ao longo da profundidade. A Moonshot diz que isto proporciona cerca de 25% mais eficiência de treino acrescentando menos de 2% de computação extra, e abriu o código da técnica ainda em 2026 antes de a integrar no K3.

Stable LatentMoE e treino em MXFP4

A terceira peça é a framework Stable LatentMoE, que torna treinável a esparsidade agressiva de 16 em 896 experts sem a instabilidade que costuma vir de levar o MoE tão longe. Ao lado dela está a decisão de treinar em MXFP4 a partir da fase de fine-tuning em vez de quantizar depois, que é o que mantém os pesos lançados tanto pequenos como fiéis ao modelo que a Moonshot avaliou.

Uma demonstração que a Moonshot destacou é reveladora. A equipa apontou o K3 a otimizar o seu próprio kernel de treino AttnRes à escala de produção, 96 camadas, um modelo de 8192 dimensões e 8192 tokens. Ao longo de 15 horas de iteração ininterrupta, o K3 concebeu um novo algoritmo de kernel em duas fases, fundiu kernels preservando a numérica e cortou o tempo de forward mais backward de 283,6 ms para 114,4 ms. É o tipo de tarefa de engenharia de longo horizonte em que a maioria dos modelos encalha ao fim de minutos.

Uma janela de contexto de 1 milhão de tokens

O Kimi K3 lida com até 1 048 576 tokens num único contexto, cerca de quatro vezes a janela de 256K do K2.6. Isso chega para conter uma base de código inteira, uma pilha de documentos longos ou uma execução de agente longa e de vários passos sem perder o fio. Também iguala a janela que a Anthropic dá ao Claude Opus 5 e ao Sonnet 5, por isso a vantagem de contexto longo que o Kimi costumava ter sobre os modelos de topo fechados estreitou-se para um empate.

Entrada multimodal e raciocínio sempre ativo

O K3 aceita texto, imagens e vídeo, o que o leva para lá da linha K2, focada no texto, para território multimodal a sério. A lista de modelos da Moonshot afirma claramente que o K3, o K2.7 Code e o K2.6 aceitam todos entrada de vídeo, e o cartão do modelo reporta 90,0 no Video-MME com legendas. O raciocínio está sempre ativo, e o parâmetro reasoning_effort suporta agora baixo, alto e máximo, com o máximo como predefinição. No lançamento só o máximo estava disponível, por isso os níveis de esforço prometidos chegaram entretanto.

Como o Kimi K3 se sai nos benchmarks

Vivem aqui duas perguntas distintas. O que dizem os quadros independentes sobre o Kimi K3, e o que afirma a própria bateria de avaliação da Moonshot? O quadro independente só chegou depois do lançamento, por isso é o melhor ponto de partida, e os números do fornecedor fazem mais sentido depois de o ter visto.

O que dizem os quadros independentes

A Artificial Analysis pontua o Kimi K3 em 57 no seu Intelligence Index. Entre todas as 264 linhas desse quadro, exatamente seis variantes pontuam mais alto, e pertencem a apenas três modelos, o Claude Opus 5 com 61, o Claude Fable 5 com 60 e o GPT-5.6 Sol com 59. Contra a concorrência aberta, não é sequer renhido, com o GLM-5.2 a seguir com 51 e o DeepSeek V4 Pro com 44.

O mesmo quadro pontua o K3 em 50,1 no seu Agentic Index e 76,2 em programação, nos dois casos o melhor resultado de open weights e nos dois casos atrás do Opus 5 e do GPT-5.6 Sol. Um número corta no sentido inverso, a velocidade de saída. A Artificial Analysis regista o K3 em cerca de 33 tokens por segundo, contra 55 do Opus 5 e 81 do GPT-5.6 Sol, por isso o K3 é o modelo mais lento do grupo de fronteira.

No quadro WebDev da Arena, onde humanos votam às cegas em front ends gerados, o K3 pontuou 1681,6 no fecho da votação de 27 de julho. É o segundo geral, atrás do Claude Opus 5 com 1725,3 e à frente do Claude Fable 5 com 1629,1, do GPT-5.6 Sol com 1623,1 e do GLM-5.2 com 1586,8. O K3 detinha o primeiro lugar isolado no lançamento, antes de o Opus 5 chegar a 24 de julho e lho tirar.

O quadro Agent da Arena, que classifica o quão bem os modelos orquestram ferramentas em tarefas reais, coloca atualmente o Kimi K3 em primeiro com 0,148, à frente do Claude Fable 5 com 0,099 e do GLM 5.2 com 0,091. Leia esse com uma ressalva, porque o Claude Opus 5 ainda não aparece nesse quadro. No quadro geral de texto, o K3 fica em 11.º com 1485,8 pontos em 3559 votos, um lembrete de que a preferência bruta em conversa e a capacidade agentiva não são a mesma coisa.

Os benchmarks de programação da própria Moonshot

A Moonshot publicou uma bateria ampla a comparar o Kimi K3 com o Claude Fable 5, o GPT-5.6 Sol, o Claude Opus 4.8, o GPT-5.5 e o GLM-5.2, todos corridos com o esforço máximo de pensamento. Estas são as execuções do próprio fornecedor, com o K3 avaliado no arnês Kimi Code em várias linhas, por isso trate-as como alegações da Moonshot e não como resultados independentes.

BenchmarkKimi K3Fable 5GPT-5.6 SolOpus 4.8GPT-5.5GLM-5.2
DeepSWE67.570.073.059.067.046.2
ProgramBench77.876.877.671.970.863.7
Terminal-Bench 2.188.388.088.884.683.482.7
FrontierSWE81.286.671.366.764.967.3
SWE-Marathon42.035.039.040.014.013.0
Kimi Code Bench 2.072.976.964.871.769.064.2

Lendo isto de forma direta, o Kimi K3 vence o ProgramBench e o SWE-Marathon de forma clara e fica a menos de meio ponto do líder no Terminal-Bench 2.1. No FrontierSWE fica em segundo atrás do Fable 5, mas bem à frente de tudo o resto. As próprias notas de rodapé da Moonshot acrescentam uma ressalva que vale a pena carregar: o Claude Fable 5 acionou salvaguardas de segurança em 35% das tarefas do SWE-Marathon nessa avaliação, o que pode ter puxado a sua pontuação para baixo.

Benchmarks de trabalho agentivo e de conhecimento

BenchmarkKimi K3Fable 5GPT-5.6 SolOpus 4.8GLM-5.2
BrowseComp91.288.090.484.3n/d
MCPMark-Verified94.587.492.976.4n/d
GDPval-AA v2 (Elo)1,6861,7471,7361,5931,510
AA-Briefcase (Elo)1,5481,5831,4951,3541,260
JobBench54.357.445.448.443.4
SpreadsheetBench 234.834.732.431.628.1
AutomationBench30.829.129.727.212.9
OSWorld 2.058.366.162.655.7n/d

O Kimi K3 lidera o BrowseComp, o MCPMark, o SpreadsheetBench 2 e o AutomationBench, e fica em segundo no AA-Briefcase, o benchmark agentivo de longo horizonte, batendo o GPT-5.6 Sol e ficando apenas atrás do Fable 5. Uma nota de rodapé importa no BrowseComp, que os 91,2 usam uma estratégia de compactação de contexto acionada aos 300K tokens. Corrido com a janela completa de 1M e sem gestão de contexto, o K3 pontua 90,4, que continua a ser o melhor número da coluna.

Em uso de computador, tanto o Fable 5 como o GPT-5.6 Sol batem o K3 no OSWorld 2.0, por isso o modelo aberto não está à frente em toda a linha. Obteve 93,5% no GPQA Diamond, ao nível do GPT-5.5 e à frente dos 91,2 do GLM-5.2, e 94,6 no Harvey Lab-AA, a melhor pontuação dessa linha de qualquer modelo da tabela.

O próprio resumo da Moonshot é mais contido do que foi a cobertura. O seu blogue de lançamento diz que o desempenho geral do K3 “ainda fica atrás dos modelos proprietários mais poderosos, o Claude Fable 5 e o GPT 5.6 Sol”, embora demonstre desempenho de nível de fronteira em toda a bateria. Quando um laboratório subvaloriza o seu próprio modelo, é normalmente esse o número em que confiar.

Kimi K3 vs Claude Opus 5

A comparação que toda a gente faz é Kimi K3 vs Claude, e o confronto mudou a 24 de julho, quando a Anthropic lançou o Claude Opus 5. A tabela de lançamento da Moonshot foi construída contra o Claude Opus 4.8, que era o modelo de topo em funcionamento na altura, por isso essas colunas acima ficam atribuídas ao 4.8. Para uma decisão que está a tomar hoje, o Opus 5 é o modelo do outro lado da tabela.

ModeloProgramadorContextoOpen weightsPreço API por 1M
Kimi K3Moonshot AI1 048 576Sim, Kimi K3 License$3 / $15
Claude Opus 5Anthropic1MNão$5 / $25
Claude Fable 5Anthropic1MNão$10 / $50
GLM-5.2Z.ai1MSim, MIT$1.40 / $4.40
Kimi K2.6Moonshot AI262 144Sim, MIT modificada$0.95 / $4

No preço, o K3 é o vencedor claro, a $3 / $15 contra $5 / $25 do Opus 5 e $10 / $50 do Fable 5. Na capacidade medida, o Opus 5 lidera, por quatro pontos no Artificial Analysis Intelligence Index e por 44 pontos no quadro WebDev da Arena. A Anthropic não publica qualquer valor de SWE-bench para o Opus 5, por isso quem lhe citar um não o está a citar da Anthropic.

A verdadeira separação não é a pontuação, é o que fica a possuir. O Opus 5 é o modelo mais forte e a opção por defeito mais segura para programação em produção, e é a nova predefinição da Anthropic no Claude Max. O K3 é o que pode descarregar, auditar, fazer fine-tuning e correr dentro da sua própria rede, o que nenhum modelo Claude permite a qualquer preço. Se está a escolher entre modelos de topo para um trabalho específico, o nosso guia sobre que modelo de IA usar em cada caso desmonta a decisão tarefa a tarefa.

Preços do Kimi K3

A Moonshot já publicou tarifas oficiais, o que retira as estimativas de terceiros que circularam no lançamento. O preço do Kimi K3 é de $3.00 por milhão de tokens de entrada e $15.00 por milhão de tokens de saída, com a entrada em cache a $0.30, um desconto de 90% que importa muito se estiver sempre a reenviar o mesmo contexto longo.

ModeloEntrada (falha de cache)Entrada (acerto de cache)SaídaContexto
kimi-k3$3.00$0.30$15.001 048 576
kimi-k2.7-code$0.95$0.19$4.00262 144
kimi-k2.7-code-highspeed$1.90$0.38$8.00262 144
kimi-k2.6$0.95$0.16$4.00262 144
kimi-k2.5$0.60$0.10$3.00262 144

Essas tarifas colocam o K3 exatamente no mesmo preço anunciado do Claude Sonnet 5, que também é de $3 na entrada e $15 na saída, enquanto pontua quatro pontos mais alto no Artificial Analysis Intelligence Index. Face aos dois modelos Claude que o superam, o K3 fica 40% mais barato do que o Opus 5 e 70% mais barato do que o Fable 5. A ferramenta de pesquisa na web integrada é faturada em separado a $0.005 por chamada bem-sucedida, embora a Moonshot assinale atualmente essa ferramenta como em revisão e desaconselhe depender dela no curto prazo.

O K3 é um claro passo acima em custo face à linha K2, o que reflete a sua pegada maior e o raciocínio sempre ativo. Se a sua carga de trabalho não precisa de escala de nível de fronteira, o K2.6 ou o K2.7 Code continuam muito mais baratos. Na plataforma da API, o K3 fica disponível assim que fizer um carregamento bem-sucedido de pelo menos $1, e o seu carregamento acumulado define os seus limites de tarifa. A nossa análise completa dos preços do Kimi compara cada plano e tarifa de API lado a lado.

A procura tem superado o hardware da Moonshot. A 20 de julho de 2026, a empresa suspendeu novas subscrições do Kimi. Disse que a procura nas 48 horas anteriores tinha “empurrado para perto dos limites da nossa capacidade atual” e que iria “reabrir novos lugares de subscrição por lotes” à medida que acrescentasse hardware, numa declaração publicada pelo South China Morning Post. Os subscritores existentes mantiveram o acesso. O aperto ainda não passou por completo. A Moonshot está agora a terminar o desconto de carregamento de lançamento do K3 a 29 de julho de 2026 em vez de 12 de agosto, como estava planeado, e a sua própria documentação de preços aponta como razão as recentes restrições de recursos de computação.

Como usar o Kimi K3

Há quatro formas de chegar ao Kimi K3 agora que os pesos são públicos, e qual delas encaixa depende de querer uma janela de conversa, um agente de terminal, uma API ou os ficheiros em bruto. Eis a ordem prática.

  1. Aplicação Kimi e Playground. O caminho mais rápido é a aplicação Kimi ou o Playground web, onde o K3 é selecionável para utilizadores com sessão iniciada. Esta é a opção sem código para testar o modelo com os seus próprios prompts.
  2. Kimi Code CLI. A Moonshot diz que o K3 funciona melhor dentro do seu próprio agente de terminal, onde escolhe o modelo com o comando /model. O K3 também se integra no Codex CLI, no Claude Code, no OpenCode e no Hermes Agent através das integrações documentadas da Moonshot.
  3. A API. Os programadores chamam o kimi-k3 através da plataforma da API do Kimi, que oferece endpoints compatíveis com a OpenAI e com a Anthropic. Suporta chamada de ferramentas, saída estruturada por JSON-schema, cache de contexto e o controlo reasoning_effort, e o K3 também está listado em agregadores como o OpenRouter.
  4. Open weights. O checkpoint completo está na Hugging Face sob a Kimi K3 License, e a Moonshot recomenda o vLLM, o SGLang ou o TokenSpeed para o servir. Conte com o descarregamento de 1,56 TB e com o hardware multinó de que precisa.

Prefere não andar a fazer malabarismo com uma subscrição separada para cada novo modelo? Aplicações como o Fello põem os poderosos modelos de IA atuais num só lugar, o que ajuda enquanto um lançamento como este assenta. Para uma visão mais ampla do campo aberto, a nossa síntese dos melhores modelos de IA open source disponíveis agora coloca a linhagem do K3 em contexto. Se está a pesar especificamente os modelos abertos chineses, a nossa explicação sobre o que é o GLM e como compete é um bom complemento.

O negócio por trás da Moonshot AI

O Kimi K3 chega num momento decisivo para a Moonshot AI, a startup de Pequim fundada em 2023 por Yang Zhilin. A empresa está, segundo consta, a angariar entre 1 e 2 mil milhões de dólares numa nova ronda que a avaliaria em até 31,5 mil milhões de dólares. Isso é cerca de 50% mais alto do que os 20 mil milhões de dólares que atingiu em maio, quando angariou 2 mil milhões de dólares. Se a ronda fechar no valor pretendido, marcaria um aumento de sete vezes na avaliação desde dezembro de 2025, quando a Moonshot valia pouco mais de 4 mil milhões de dólares. Um número maior já está alinhado atrás dele. A Bloomberg reportou a 22 de julho que a Moonshot planeia uma ronda final pré-IPO com uma avaliação pré-investimento de até 50 mil milhões de dólares, com as conversas a começar em agosto e uma entrada em bolsa em Hong Kong possível em seis meses.

A estratégia de open source é central para o ímpeto. Quando a Moonshot abriu o código do Kimi K2.6 em abril de 2026, subiu a segundo grande modelo de linguagem mais usado no OpenRouter em meados de 2026. Isso colocou um laboratório fundado três anos antes à frente da maioria dos laboratórios de fronteira ocidentais nas tabelas de utilização independentes. Lançar os pesos do K3 estende esse manual a um modelo de classe de fronteira.

O momento não foi acidental. O Kimi K3 chegou mesmo antes da Conferência Mundial de Inteligência Artificial de 2026 em Xangai, onde se esperava que o Presidente chinês Xi Jinping traçasse as prioridades de IA de Pequim. Dias depois, nessa mesma conferência, a Alibaba mostrou uma pré-visualização do Qwen 3.8, o seu próprio rival de 2,4 biliões de parâmetros. A reação no Ocidente foi uma mistura de espanto e alarme, com observadores a notar que a China parece estar a fechar aquilo que já foi uma confortável dianteira americana.

Porque é que o Kimi K3 importa

O Kimi K3 não é apenas mais um lançamento de modelo. Com os pesos públicos, é o maior modelo de open weights alguma vez lançado, entregando aos programadores capacidade à escala de fronteira que podem descarregar, inspecionar e correr eles próprios. Isso é um desafio direto aos modelos de topo fechados e de preço premium que definiram o topo do mercado.

A distância que fecha é mais estreita do que o título sugere e mais larga do que parece.

Quatro pontos no Artificial Analysis Intelligence Index separam o K3 do Claude Opus 5, mas seis pontos separam o K3 do melhor modelo aberto que veio antes dele. O campo aberto mexeu-se mais este mês do que o campo fechado.

O contexto de negócio torna a ambição clara. A família Kimi da Moonshot terá, segundo consta, ultrapassado os 300 milhões de dólares em receita recorrente anualizada em meados de junho e, de acordo com o relatório de lançamento da TechCrunch, a empresa está a angariar capital novo com uma alegada avaliação de 31,5 mil milhões de dólares, com uma ronda pré-IPO maior alinhada atrás dela. Um laboratório bem financiado a lançar um modelo aberto gigante a preços agressivos é exatamente o tipo de pressão que remodela o que todos os outros cobram. Para ver o quão depressa o lado fechado se está a mexer, o nosso guia sobre como tirar o máximo do GPT-5.6 é um contraponto útil.

Em resumo

O Kimi K3 entregou o que prometeu. Os pesos são públicos, a licença é viável para quase toda a gente que os vai realmente usar, e os preços são oficiais e baixos. Os quadros independentes confirmam agora que é o modelo aberto mais forte que existe, por uma margem clara. O que não é, é o melhor modelo que existe, e a própria Moonshot di-lo.

A nossa recomendação: use o K3 quando os open weights, o custo ou um contexto de um milhão de tokens são aquilo de que precisa. Mantenha o Claude Opus 5 no radar para a programação em produção mais difícil, onde ainda lidera em todos os quadros independentes que avaliaram ambos. Se quer a versão prática desse compromisso, a nossa análise do Claude Opus 5 cobre o que o lado fechado oferece agora por $5 por milhão de tokens.

O Kimi K3 dá para uma comparação frente a frente. Com o Fello AI, pode correr o Kimi a par do Claude, do GPT-5.6, do Gemini, do DeepSeek e da Perplexity numa só aplicação nativa para Mac, iPhone e iPad. Envie a mesma tarefa de programação ou de investigação a todos os modelos de fronteira ao mesmo tempo e veja qual deles ganha mesmo no seu trabalho, sem andar a fazer malabarismo com contas separadas. Quando chega um modelo aberto tão capaz, a forma mais rápida de o julgar é um teste lado a lado.

FAQ

Os open weights do Kimi K3 estão disponíveis?

Sim. A Moonshot publicou os pesos completos do Kimi K3 na Hugging Face a 27 de julho de 2026, onze dias após o lançamento. O repositório contém 96 fragmentos safetensors, cerca de 1,56 TB no total, disponibilizados sob a Kimi K3 License personalizada.

O Kimi K3 é open source?

É de open weights e não open source no sentido estrito. A Kimi K3 License permite uso, modificação, distribuição e venda comercial. Um negócio de model-as-a-service que ganhe mais de 20 milhões de dólares em quaisquer 12 meses precisa de um acordo separado, e os produtos com mais de 100 milhões de utilizadores mensais têm de creditar o Kimi K3 no ecrã.

Quantos parâmetros tem o Kimi K3?

O Kimi K3 tem 2,8 biliões de parâmetros totais num design Mixture-of-Experts, dos quais 104 mil milhões ativam por token. A Moonshot chama-lhe o primeiro modelo aberto de classe 3B do mundo, e o cartão do modelo confirma ambos os valores.

O Kimi K3 é melhor do que o Claude Opus 5?

Na capacidade medida, não. O Claude Opus 5 pontua 61 no Artificial Analysis Intelligence Index contra 57 do Kimi K3, e lidera o quadro WebDev da Arena. O K3 ganha no preço, a $3 e $15 por milhão de tokens contra $5 e $25, e é o único dos dois que pode descarregar e correr por conta própria.

Quanto custa o Kimi K3?

O preço oficial da API é de $3.00 por milhão de tokens de entrada e $15.00 por milhão de tokens de saída, descendo para $0.30 por milhão na entrada em cache. A pesquisa na web é faturada em separado a $0.005 por chamada bem-sucedida, e o modelo fica disponível na plataforma da API após um carregamento de pelo menos $1.