A Robbyant, empresa de inteligência artificial embodyada do Ant Group, abriu o código do LingBot-Map em abril de 2026. O projeto acumula mais de 12 mil estrelas no GitHub e usa uma câmera RGB comum para reconstruir cenas em três dimensões em tempo real, a aproximadamente 20 quadros por segundo. O diferencial é manter a memória quase constante em sequências longas, sem o esquecimento progressivo que afeta os concorrentes. A licença é Apache-2.0.

O que é o LingBot-Map
LingBot-Map é um modelo de fundação feed-forward para reconstrução 3D em streaming. Em vez de processar um conjunto completo de imagens de uma só vez, como fazem os métodos offline tradicionais, ele opera quadro a quadro, conforme o vídeo chega. Para cada novo frame, o modelo estima a posição da câmera e gera um mapa de profundidade, construindo uma nuvem de pontos da cena sob demanda.
A Robbyant é a unidade de IA embodyada do Ant Group, conglomerado chinês dono do Alipay. A empresa já abriu o código de outros modelos da família LingBot: LingBot-Depth (percepção espacial), LingBot-VLA (visão-linguagem-ação), LingBot-World (simulação de ambiente) e LingBot-VA (controle robótico por vídeo). O objetivo declarado é construir a base para robôs, veículos autônomos e dispositivos de realidade aumentada que percebam o espaço tridimensional sem sensores caros.
No repositório do GitHub, o projeto tem 12,4 mil estrelas, 1,3 mil forks e 103 commits. Os pesos do modelo estão disponíveis no Hugging Face e no ModelScope, em três versões: lingbot-map (equilibrado), lingbot-map-long (sequências longas) e lingbot-map-stage1 (treinamento intermediário compatível com VGGT). Os concorrentes diretos incluem CUT3R, TTT3R, Wint3R e Stream3R, todos métodos online que processam vídeo de forma incremental, mas que sofrem com perda de memória em sequências longas.
Tecnologia e o problema da memória
O núcleo do LingBot-Map é o Geometric Context Transformer (GCT), uma arquitetura que resolve o problema central da reconstrução em streaming: o que guardar na memória e em que formato. A inspiração vem do SLAM clássico, que há décadas divide o estado em três partes: uma referência global, uma janela local e um mapa de trajetória. O LingBot-Map substitui a otimização manual por atenção aprendida de ponta a ponta, mantendo três contextos complementares.
O primeiro é o anchor context, que ancora coordenadas e escala. O segundo é a pose-reference window, uma janela deslizante de quadros recentes que retém características visuais densas para geometria local. O terceiro é a trajectory memory, que comprime todo o histórico em tokens compactos de seis posições por quadro, descartando os tokens de imagem pesados. Essa compressão mantém o consumo de memória e processamento quase constante, mesmo em sequências de mais de 10 mil quadros. O backbone é um Vision Transformer inicializado com DINOv2, e a inference usa paged KV cache com FlashInfer para alcançar os 20 FPS.
Recursos já existentes
O repositório já entrega o código completo de inference, scripts de benchmark, um demo de renderização e os pesos pré-treinados. Os resultados em sete datasets internacionais colocam o LingBot-Map à frente de todos os métodos online e também dos offline. Na lista principal de recursos:
- Inference em streaming a ~20 FPS em resolução 518×378, com memória quase constante em sequências de 10.000+ quadros
- Dois modos de inference: Direct Output e Visual Odometry (VO), com seleção automática de keyframes
- Três checkpoints disponíveis: equilibrado, sequências longas e estágio 1 (compatível com VGGT para inference bidirecional)
- Benchmark completo em sete datasets: ETH3D, 7-Scenes, TUM RGB-D, Neural RGB-D, Oxford Spires, KITTI e Tanks and Temples
- Suporte a FlashInfer para performance otimizada e SDPA como fallback nativo do PyTorch
- Demo de renderização de nuvem de pontos com cenas de múltiplos cômodos, aéreas, driving e roaming
Resultados e o que está por vir
Os números são a parte que impressiona. No Oxford Spires, dataset de larga escala com iluminação desafiadora, o LingBot-Map atingiu erro de trajetória (até) de 6,42 metros, contra 12,87 do DA3 e 10,52 do VIPE, ambos métodos offline. O melhor concorrente online, CUT3R, ficou em 18,16 metros, quase o triplo. No ETH3D, o F1 de reconstrução chegou a 98,98, mais de 21 pontos percentuais acima do segundo lugar. No Tanks and Temples, o até foi de 0,20, 3,8 vezes menor que o Stream3R.
O projeto recebe atualizações frequentes. Em junho de 2026, a equipe corrigiu um bug no backend SDPA que degradava a performance em sequências longas. Em maio, liberou os scripts de avaliação para KITTI e Oxford Spires. A comunidade já abriu 49 issues ativas, e a equipe responde regularmente com esclarecimentos sobre o protocolo de avaliação. A paper técnica está publicada no arXiv, sob o título “Geometric Context Transformer for Streaming 3D Reconstruction”, assinada por 11 pesquisadores da Robbyant.
O LingBot-Map chegou para mostrar que reconstrução 3D em tempo real não precisa de sensores caros nem de processamento offline. Com uma câmera RGB comum e 20 quadros por segundo, o modelo da Robbyant constrói mapas tridimensionais que superam os métodos mais pesados da categoria. Para quem trabalha com robótica, veículos autônomos ou realidade aumentada, o repositório no GitHub é um ponto de partida concreto.
Fontes: GitHub – Robbyant/lingbot-map, Business Wire, arXiv, Robbyant Technology, Hugging Face




