Início tecnologia

Ornith 1.0: a IA de programação grátis que cabe no seu PC

Um modelo de 5 GB rodando no seu computador de graça consertou cinco bugs de um projeto em Python sem errar nenhum sozinho. Rodou o teste, viu o erro, achou a causa, corrigiu, rodou de novo, confirmou que o trabalho havia sido resolvido. Esse é o Ornith 1.0, uma família de modelos abertos com licença MIT lançada em 25 de junho de 2026 pela DeepReinforce, projetada para funcionar como agente de programação. O vídeo do canal ViktorKav no YouTube, publicado em 16 de julho, aplicou a mesma bateria de testes usada nos modelos pagos GPT 5.6 e Claude, e o resultado coloca o Ornith no centro de um debate real: até onde uma IA gratuita chega quando roda na sua própria máquina.

Ornith
Logo do Ornith 1.0

Este artigo se baseia no que está oficialmente documentado e em uso no mercado hoje, não em especulação. Os dados do model card da DeepReinforce, os benchmarks públicos no Hugging Face e o teste prático do ViktorKav são as fontes principais, complementadas por dados de hardware da comunidade.

O que é o Ornith 1.0

O Ornith 1.0 não é um modelo treinado do zero. Ele pega dois modelos abertos grandes, o Gemma 4 do Google e o Qwen 3.5 da Alibaba, e aplica um pós-treino por reforço em cima. O processo tem um nome: self-scaffolding. Em vez de treinar o modelo só para acertar uma resposta, o treino ensina ele a montar o próprio processo de raciocínio, o passo a passo de ferramentas que leva à resposta. O card do modelo deixa claro que ele foi desenhado para uma coisa específica: trabalhar como agente, ler repositório, rodar comando no terminal, escrever código, testar e corrigir. Não promete chatbot, não promete redação, não promete conhecimento geral.

A família tem quatro tamanhos: 9B denso, 31B denso, 35B MoE e 397B MoE. Os dois que cabem em hardware de consumidor são o 9B, com cerca de 5 GB em quantização Q4, e o 35B MoE, com cerca de 21 GB. O 397B, que supera o Claude Opus 4.7 nos benchmarks oficiais com 82,4% no SWE-bench Verified, dificilmente roda no computador que você tem em casa. Os números que o modelo reivindica para os menores também são altos: 69,4% no SWE-bench Verified para o 9B e 75,6% para o 35B, benchmarks onde o modelo recebe problemas reais de projetos abertos e tem que resolver sozinho.

Uma pegadinha detectada no model card: ele recomenda uma temperatura para uso normal, mas os testes oficiais foram medidos com outra. O número da propaganda não foi produzido na configuração que eles mandam você usar. O Ornith também exige uma versão atualizada do Ollama. O ViktorKav precisou atualizar a sua, que estava três versões atrás.

O teste prático e a loteria do modelo pequeno

O ViktorKav aplicou quatro testes nos dois modelos que cabem em casa, e rodou cada prova seis vezes. No primeiro teste, um projeto de loja com cinco bugs de lógica, o 9B passou em quatro de seis tentativas. Nas duas que falharam, ele diagnosticou os bugs corretamente, mas em uma não mexeu em nenhum arquivo e na outra morreu no meio da frase. O 35B passou em seis de seis, com consistência de tempo. A capacidade existe no modelo pequeno, mas a confiabilidade do relato não. Ele diz que fez e você acaba tendo que conferir sempre.

No segundo teste, com bugs sutis e interdependentes onde consertar um revela o outro, o 9B passou três vezes seguidas, com 18 testes verdes nas três tentativas. O 35B fechou em 81 segundos. O problema não está na dificuldade da tarefa, mas na consistência. O benchmark mede o primeiro pedido, mas se o seu trabalho é no sexto, o modelo pequeno já não está mais lá. Em sete pedidos encadeados, o 9B empacou em tarefas simples como mudar um desconto, ficando 40 minutos gerando raciocínio interno sem chegar à resposta. O 35B completou a sessão e lembrou de uma regra definida seis pedidos antes.

O ViktorKav descobriu um problema que afeta qualquer usuário de Ollama: o programa aceita 262 mil tokens de contexto, mas por padrão carrega só 32 mil. Uma sessão de agente estoura esse limite rapidinho e o modelo perde o começo da conversa. O que parece esquecimento é um corte. Uma variável de ambiente conserta isso na hora.

Local, cloud e a questão do hardware

O Ornith 1.0 roda em casa via Ollama, sem chave de API, sem custo por token e sem o seu código sair da máquina. A comparação direta é com ferramentas como OpenCode, um agente de código aberto para o terminal que se conecta a qualquer provedor de modelo, local ou na nuvem. O OpenCode funciona como camada de interface: ele não é o modelo, é o agente que usa o modelo. Com o Ornith local, você aponta o OpenCode para o endpoint do Ollama e tem um agente de programação rodando sem mensalidade. Essa combinação é o que mais se aproxima de ter um Claude Code gratuito em casa.

Na outra ponta estão os modelos pagos em nuvem, como Claude e GPT 5.6. Os quatro modelos pagos fecharam a primeira prova com resultado máximo no teste do ViktorKav. O Ornith 9B de graça chegou ao mesmo resultado na maioria das vezes, mas a loteria de consistência é o que separa o gratuito do pago. O 35B foi previsível em todas as seis rodadas, o que levanta a questão de hardware.

O 35B exige 21 GB de VRAM para rodar rápido, o que significa uma RTX 4090, que custa entre R$ 8.000 e R$ 12.000 no Brasil. Dá para rodar na memória RAM comum, mas a velocidade despenca. O 9B, com 5 GB, cabe em máquinas acessíveis. Um notebook com 16 GB de RAM e GPU integrada carrega o 9B em Q4, mas a 3 a 5 tokens por segundo no processador. Com uma GPU de 6 GB, como uma RTX 3060 usada por cerca de R$ 1.500, o 9B roda com folga. O 35B é mais rápido que o 9B na mesma máquina, porque é MoE: cada token ativa só 3 bilhões de parâmetros dos 35 bilhões totais. Os 77 tokens por segundo do 35B contra 52 do 9B mostram isso, mas com contexto cheio o 35B cai para 38.

ARM, Mac e máquinas sem GPU

Os modelos GGUF do Ornith no Hugging Face incluem formatos com online repacking para processadores ARM, o que significa que o 9B pode rodar em um Raspberry Pi 5 com 8 GB de RAM, embora devagar. Um teste da Adafruit com modelos de 3 a 4 bilhões de parâmetros no Raspberry Pi mostrou velocidades de 8 a 9 tokens por segundo. O Ornith 9B, com o triplo desses parâmetros, seria mais lento, mas funcional para tarefas em lote onde a velocidade não é crítica. Em um computador de baixo custo sem GPU dedicada, com 16 GB de RAM, o 9B roda no processador a cerca de 5 tokens por segundo. Não serve para uma sessão interativa de programação, mas resolve correção de bugs isolada.

Para quem tem um Mac com chip da série M, a situação é melhor. Um M4 Max com 64 GB de memória unificada roda o 35B com folga e ainda deixa espaço para contexto. A memória unificada da Apple elimina a separação entre VRAM e RAM, o que faz chips M serem a opção mais barata para rodar modelos grandes localmente sem comprar uma placa de vídeo separada. O 9B em Q4 roda até em notebooks modestos. O 35B é o ponto onde o modelo para de ser loteria e vira ferramenta.

O que dá para fazer hoje

Tarefa fechada com teste para verificar, os dois modelos já fazem igual aos pagos. Sessão de trabalho com pedidos encadeados exige o 35B. E qualquer coisa que ele diga, confira, porque o relato ainda não dá para confiar. O 9B é a porta de entrada para quem tem máquina modesta. O 35B é a ferramenta para quem tem hardware suficiente. Ambos estão no Hugging Face da DeepReinforce sob licença MIT.

Fontes: ViktorKav (YouTube), GitHub da DeepReinforce, Hugging Face (Ornith 9B), Hugging Face (Ornith 35B), Site oficial do Ornith, MarkTechPost, OpenCode, Adafruit (Raspberry Pi LLMs)