Início tecnologia

Projeto em C roda o Kimi K3 sem GPU e com 8 GB de RAM

Um projeto escrito em C99 conseguiu executar o Kimi K3, modelo da chinesa Moonshot AI com 2,78 trilhões de parâmetros, usando uma única CPU e apenas 8,24 GB de RAM. A demonstração não transforma um computador comum em um chatbot veloz, mas mostra como a arquitetura do modelo permite trocar memória por armazenamento.

Robô executa modelo de IA em computador local
Imagem gerada usando o Magnific

O código está disponível no GitHub e não usa GPU, PyTorch, ONNX Runtime ou bibliotecas BLAS. O motor inteiro ocupa cerca de 176 KB, enquanto o checkpoint do Kimi K3 ocupa aproximadamente 1,56 TB. A diferença entre os dois números resume o tamanho do experimento.

O que o projeto em C realmente faz

O Kimi K3 é um modelo Mixture of Experts, ou MoE. Em vez de usar todos os parâmetros para cada token, um roteador seleciona apenas parte dos especialistas disponíveis. Segundo o cartão oficial do modelo, o K3 tem 896 especialistas e ativa 16 por token.

O projeto mantém os especialistas roteados no SSD e os lê somente quando o roteador precisa deles. O restante do modelo também é organizado em camadas que podem ser carregadas e descartadas durante a execução. A técnica usa os recursos de leitura direta do Linux e depende de um armazenamento local rápido, de preferência NVMe.

Essa abordagem não reduz o modelo nem cria uma versão compactada para uso doméstico. O motor trabalha com o checkpoint original disponível para o projeto e tenta preservar a mesma saída em diferentes limites de memória. O repositório relata resultados idênticos entre configurações de RAM, com a memória funcionando como um controle de velocidade, não como uma barreira absoluta.

A conta fecha, mas a velocidade não

A demonstração publicada pelo autor registra cerca de 32,69 segundos por token no perfil de menor memória, com pico de 8,24 GB de RAM. Em uma configuração com aproximadamente 128 GB, o tempo cai para cerca de 10,69 segundos por token. Mesmo assim, nenhum dos dois cenários se aproxima da resposta instantânea esperada de um assistente de IA.

O custo é transferido para o armazenamento. Além do checkpoint de 1,56 TB, o processo precisa de aproximadamente 109 GB para reorganizar a parte densa do modelo. O sistema também precisa ser Linux em arquitetura x86-64, com suporte a AVX2 e FMA. Windows e macOS não fazem parte do alvo principal do motor.

A explicação sobre MoE não é nova. O guia da Hugging Face sobre Mixture of Experts já descreve como roteadores escolhem especialistas por token. A novidade deste projeto é levar essa ideia ao limite do armazenamento, mantendo no SSD a maior parte dos pesos e aceitando uma latência enorme para provar que a execução é possível.

Uma prova de conceito, não um chatbot local

O próprio resultado precisa ser lido com cuidado. Rodar o Kimi K3 em 8 GB de RAM não significa que qualquer notebook possa baixar o modelo, nem que o sistema ofereça uma experiência adequada para conversar, programar ou analisar documentos. São necessários quase 1,7 TB de espaço livre, uma unidade rápida e uma distribuição Linux compatível.

Para quem está no Brasil, a principal barreira não é apenas comprar mais memória. O projeto exige uma unidade de armazenamento de alta capacidade, uma conexão capaz de baixar mais de um terabyte e energia para manter a CPU e o SSD trabalhando durante longos períodos. Em um computador doméstico, o tempo de espera e o custo do conjunto tornam a experiência pouco atraente diante de modelos menores ou serviços hospedados.

O resultado ainda é valioso. Ele separa três conceitos que costumam aparecer misturados nas manchetes sobre IA: o tamanho total de um modelo, a quantidade de memória necessária para executá-lo e a velocidade dessa execução. O Kimi K3 cabe na primeira medida de RAM, mas só porque o projeto aceita usar o SSD como uma memória muito mais lenta.

O projeto em C não elimina os limites da inteligência artificial local. Ele mostra onde esses limites estão e como uma implementação cuidadosa pode contorná-los por algum tempo. Para uso diário, modelos menores continuam sendo a escolha mais sensata. Para quem estuda sistemas de IA, porém, o experimento oferece uma aula prática sobre roteamento, cache e movimentação de dados.

O Tambotech já explicou como o Kimi K3 chegou ao mercado de modelos abertos. Agora, o projeto em C acrescenta outra camada à história: o modelo pode ser executado fora de uma infraestrutura de GPUs, desde que o usuário aceite trocar velocidade por espaço em disco.

Fonte: GitHub do projeto kimi-k3-in-c | Moonshot AI no Hugging Face | Hugging Face sobre Mixture of Experts