No dia 16 de julho de 2026, a startup chinesa Moonshot AI lançou o Kimi K3, um modelo de linguagem com 2,8 trilhões de parâmetros e janela de contexto de 1 milhão de tokens. O modelo é o maior de pesos abertos já anunciado, com desempenho que rivaliza com o Claude Fable 5, da Anthropic, e o GPT-5.6 Sol, da OpenAI. Mas o que realmente chama a atenção é o preço: US$ 15 por milhão de tokens de saída, contra US$ 50 do Fable 5. O Kimi K3 chega em um momento em que a guerra de preços entre modelos de IA está mais acirrada do que nunca.

O preço do Kimi K3 em números
O Kimi K3 custa US$ 3 por milhão de tokens de entrada (sem cache) e US$ 15 por milhão de tokens de saída. Para entradas em cache, o valor cai para US$ 0,30 por milhão de tokens. A Moonshot afirma que sua API oficial atinge taxas de cache hit acima de 90% em cargas de trabalho de programação, o que reduz drasticamente o custo efetivo para uso repetitivo.
Na comparação direta com os modelos americanos de ponta, o K3 é 70% mais barato que o Claude Fable 5 (US$ 50 por milhão de tokens de saída) e 50% mais barato que o GPT-5.6 Sol (US$ 30). Em termos de custo por tarefa no Intelligence Index do Artificial Analysis, o K3 sai a US$ 0,94, contra US$ 1,04 do Sol e US$ 1,80 do Claude Opus 4.8.
Kimi K3 vs DeepSeek V4 Flash: o abismo de preço
O DeepSeek V4 Flash, lançado em abril de 2026, custa US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída. Com cache hit, o valor despenca para US$ 0,0028 por milhão de tokens de entrada. Isso significa que o K3 é cerca de 53 vezes mais caro que o V4 Flash no custo de saída por token.
Em custo por tarefa, a diferença é ainda mais gritante: o DeepSeek V4 Flash custa US$ 0,04 por tarefa no Intelligence Index, contra US$ 0,94 do K3. Ou seja, para cada tarefa concluída com o K3, é possível fazer cerca de 23 tarefas com o V4 Flash pelo mesmo valor.
O K3 é um modelo de raciocínio (reasoning), enquanto o V4 Flash não é. O K3 ativa raciocínio máximo em todas as requisições, o que consome mais tokens de saída. O Artificial Analysis registrou que o K3 usou 130 milhões de tokens de saída em sua avaliação completa, contra uma mediana de 63 milhões entre modelos comparáveis. Na prática, o custo por tarefa do K3 tende a ser maior do que a tabela de preços por token sugere.
DeepSeek V4 Flash: o rei do custo-benefício
O DeepSeek V4 Flash tem 284 bilhões de parâmetros totais (13 bilhões ativos por token, em arquitetura MoE), com janela de contexto de 1 milhão de tokens e até 384 mil tokens de saída. Ele suporta modos de raciocínio (non-thinking, think-high e think-max) e é distribuído sob licença MIT.
Em benchmarks, o V4 Flash atinge 88,1% no GPQA Diamond (contra 93,5% do K3) e 91,6% no LiveCodeBench. Não é um modelo de fronteira como o K3, mas entrega desempenho sólido para a vasta maioria dos casos de uso cotidianos: chatbots, extração de dados, assistência de programação e tarefas de roteamento.
O V4 Flash está disponível na API oficial da DeepSeek, no OpenRouter e também no Ollama Cloud, o que o torna acessível sem necessidade de infraestrutura própria. Para times que processam milhões de requisições por mês, a diferença de custo é transformadora: um milhão de chamadas de API com 2.000 tokens de entrada em cache e 300 tokens de saída custa cerca de US$ 117 no V4 Flash. A mesma carga no K3 custaria milhares de dólares.
Onde o Kimi K3 está disponível
O Kimi K3 está disponível desde o lançamento na API oficial da Moonshot (api.moonshot.ai, compatível com OpenAI SDK), no Kimi Code, no Kimi Work e no site kimi.com. O OpenRouter também oferece acesso imediato com o ID moonshotai/kimi-k3, mantendo os mesmos preços oficiais de US$ 3/US$ 15.
Os pesos completos do modelo serão liberados em 27 de julho sob licença MIT modificada. Até lá, o K3 funciona apenas como modelo hospedado. Após a liberação, provedores como Fireworks e vLLM devem oferecer suporte, mas a recomendação oficial de hardware é de pelo menos 64 aceleradores, o que torna a execução local impraticável para a maioria dos desenvolvedores.
O DeepSeek V4 Flash, por outro lado, já está disponível para download e execução local, além de estar presente no Ollama Cloud e em dezenas de provedores. Para quem quer testar sem se comprometer, a DeepSeek oferece 5 milhões de tokens grátis para novas contas na API.
O fim dos preços ultrabaixos chineses?
O Kimi K3 marca uma mudança de estratégia da Moonshot. O modelo anterior, K2.6, custava US$ 0,95 de entrada e US$ 4,00 de saída. O K3 triplicou o preço do predecessor. Isso sinaliza que a era dos modelos chineses de fronteira com preços ultrabaixos pode estar chegando ao fim, pelo menos para os modelos mais capazes.
Ainda assim, o K3 é mais barato que os equivalentes americanos. E o DeepSeek V4 Flash continua sendo a opção mais econômica do mercado para quem não precisa do desempenho absoluto de fronteira. A escolha entre K3 e V4 Flash se resume a uma questão de custo versus capacidade: para tarefas que exigem o melhor raciocínio possível, o K3 é a opção. Para volume e economia, o V4 Flash continua imbatível.
Fontes: Kimi K3 Tech Blog – Moonshot AI, DeepSeek API Pricing, SiliconANGLE – Moonshot throws down the gauntlet, The Decoder – K3 nears GPT-5.6 Sol, Artificial Analysis – DeepSeek V4 Flash vs Kimi K2.6, Awesome Agents – Kimi K3




