Série: Aprendendo a Programar com IA

Como a RakuAI Funciona — de Ponta a Ponta

O caminho de ponta a ponta do escaneamento pelo celular a um mundo espacial conduzido por IA.

Escaneie um cômodo com seu celular. Trinta segundos depois, um splat gaussiano 3D existe. Agora peça ao Claude — ou ao ChatGPT, ou ao Gemini — para consultá-lo, anotá-lo, mover coisas nele. Esse é o discurso inteiro. Este post é o relato honesto de como cada etapa realmente funciona, o que está em produção hoje, e o que ainda está travado por créditos de GPU.

Este é um tipo diferente de post para o blog. Os posts de sábado de costume são sobre um problema específico resolvido ou uma semana específica sobrevivida. Este recua para o panorama completo — o que é a RakuAI, como suas peças se conectam, e qual é de fato o fosso competitivo quando você o rastreia de ponta a ponta. É o post que eu gostaria que existisse na primeira vez que tive que explicar isso a um parceiro desenvolvedor que queria a história real, não a versão da apresentação de vendas.

A premissa em uma frase

Você escaneia um lugar real com um celular. O escaneamento se torna um splat gaussiano 3D — uma reconstrução fotorrealista feita de milhões de pequenos elipsoides transparentes. O splat é servido através de um runtime que o expõe como ferramentas que qualquer LLM pode chamar. O LLM pode consultar a cena, raciocinar sobre o que ela contém, e — sob as permissões certas — mutá-la. Sem licença de game engine. Sem integração por fornecedor. Sem prisão a um único modelo.

Essa é a ideia de “Escaneie. Depois converse com ele.” Aqui está como cada peça dessa cadeia funciona.

Etapa 1: Captura — vídeo do celular para frames brutos

O ponto de entrada é um Progressive Web App em rakuai.com/capture-app/. Ele roda em um navegador móvel sem instalação. O usuário grava de 30 a 60 segundos de vídeo, caminhando devagar ao redor do sujeito — um cômodo, um objeto, um espaço que vale a pena preservar.

O PWA empacota os frames de vídeo e os envia para POST /api/v1/capture no backend, que roda no Azure Container Apps em api.rakuai.com. O backend é um serviço FastAPI — ~9.500 endpoints REST — que autentica o upload, registra metadados (nome de arquivo original, tipo de conteúdo, timestamp de captura), e armazena o pacote de entrada bruto no Azure Blob Storage.

Essa parte está em produção. O caminho de upload funciona hoje, para qualquer pessoa que se cadastre.

Etapa 2: Reconstrução — extração de características COLMAP para nuvem de pontos

O backend despacha uma tarefa de reconstrução para um executor de job do Container Apps chamado recon-worker. A primeira coisa que ele faz é rodar o COLMAP — a biblioteca de Structure from Motion — através dos frames enviados. O COLMAP identifica características correspondentes entre os frames e calcula posições de câmera, produzindo uma nuvem de pontos 3D esparsa.

Essa etapa é limitada por CPU e não requer GPU. Roda hoje.

Etapa 3: Treinamento do splat — o Brush transforma uma nuvem de pontos em um splat gaussiano

Esta é a etapa intensiva em computação. O worker de reconstrução alimenta a nuvem de pontos do COLMAP e os frames originais no Brush v0.3.0, um treinador de 3D Gaussian Splatting. O Brush ajusta milhões de pequenos gaussianos 3D à cena — cada gaussiano é um elipsoide no espaço 3D com posição, orientação, escala, opacidade, e cor dependente da visão. A saída é um arquivo .ply ou .spz armazenado no Azure Blob Storage junto com a entrada.

Honestidade: esta etapa requer uma GPU. A cota de GPU no Azure A10 está em revisão. Os créditos do AWS Activate estão pendentes de aprovação (solicitados em 28-05-2026). Até que um desses chegue, o worker de reconstrução de produção recorre a um backend simulado — a arquitetura está conectada, o caminho de GPU ainda não está em produção. Isto é acesso antecipado, não um produto de consumo finalizado.

Etapa 4: O runtime MCP — 17 ferramentas + ~9.500 endpoints de passthrough

Esta é a parte que torna o splat um objeto espacial vivo em vez de um arquivo estático.

O runtime é um engine em C++: 18 DLLs nativas, 30.738 funções exportadas entre subsistemas de física, renderização, áudio, rastreamento, estado multiplayer, e orquestração de IA. Verde no CI no Windows, Linux e macOS desde abril de 2026.

Em cima do engine, o servidor MCP expõe duas superfícies:

17 ferramentas nativas (5 somente-leitura + 12 de mutação) — o contrato tipado que qualquer agente externo usa para interagir com uma cena. Ferramentas somente-leitura funcionam em todo ambiente. Ferramentas de mutação exigem concessões explícitas de permissão e são negadas por padrão em produção.

~9.500 endpoints de passthrough — a superfície completa do FastAPI da raku-api, exposta através do relay MCP. Qualquer uma das rotas do backend pode ser alcançada através do relay, dando a um LLM acesso ao histórico de captura, status de tarefas, metadados de cena, e a superfície de consulta completa do backend.

O servidor MCP é hospedado em api.rakuai.com no Azure Container Apps. O relay para Claude Desktop, ChatGPT e Gemini está em produção. O servidor fala transporte stdio, registra toda chamada em uma trilha de auditoria, e aplica limites de taxa por sessão.

Etapa 5: Acesso multi-fornecedor a LLMs — o fosso competitivo de fato

Qualquer modelo que fale Model Context Protocol pode se conectar ao runtime e chamar ferramentas contra uma cena capturada sem uma integração personalizada. Claude, ChatGPT, Gemini, Copilot — o contrato é o mesmo para todos eles.

O runtime escreve o contrato uma vez. Os modelos se adaptam ao contrato. Quando um novo laboratório de modelos lança um cliente MCP, ele funciona contra o runtime sem nenhuma mudança de código do nosso lado.

O runtime não tem opinião sobre qual modelo está do outro lado. Ele mantém a autoridade sobre física, colisão, pontuação, renderização, e estado de cena. O modelo contribui com consultas e intenção. Nenhum dos dois lados precisa saber que o outro existe exceto através da superfície tipada de ferramentas.

Esse é o fosso competitivo: captura honesta do mundo físico, armazenada como uma representação 3D sem perdas, consultável por qualquer LLM que fale um protocolo aberto. Não preso a um modelo. Não preso a um caso de uso. Não preso a um fornecedor de hardware.

O que está em produção hoje versus o que é roteiro

Em produção hoje: - PWA de captura pelo celular, upload para o Azure Blob - Extração de características COLMAP e nuvem de pontos - Infraestrutura de backend (FastAPI ~9.500 endpoints REST, armazenamento de tarefas Redis, limites de taxa por nível) - Runtime MCP com 17 ferramentas nativas + ~9.500 endpoints de passthrough - Relay MCP hospedado para Claude, ChatGPT, Gemini - Contrato de ferramentas multi-fornecedor (stdio, negado por padrão, log de auditoria completo) - Nível gratuito e nível Pro Beta (Pro Beta é $0 durante o período de beta)

Travado (acesso antecipado — esperado em dias): - Treinamento real de splat por GPU no Azure A10 (cota em revisão) - Treinamento real de splat por GPU no AWS G5 (créditos do Activate em revisão)

Roteiro (ainda não lançado): - Visualizador de splat ao vivo no PWA de captura (o renderizador de splat gaussiano three.js está conectado; o demo de ponta a ponta requer um splat treinado) - Concessões de mutação de produção por autosserviço - Ecossistema de adaptadores de terceiros (adaptadores de referência próprios existem; o ecossistema amplo é roteiro)

Membro do NVIDIA Inception desde maio de 2026.

Por que “somente-inferência” não é uma limitação

O runtime não treina modelos. Não faz fine-tuning de modelos. Não exige que você rode um modelo dentro dele. O modelo que você já tem — seja lá qual for, onde quer que viva, como quer que seja licenciado — se conecta através do MCP e conduz o runtime de fora.

Essa é uma escolha de arquitetura deliberada. Treinamento e inferência são preocupações separadas. O runtime é bom em física espacial, gerenciamento de estado determinístico, sincronização multiusuário, e renderização de baixa latência. O laboratório de modelos é bom em raciocínio, geração, e linguagem. O contrato MCP é a fronteira entre eles. Nenhum dos dois lados precisa fazer o trabalho do outro.

Somente-inferência também significa nenhuma exigência de residência de GPU para servir. A etapa intensiva em computação (treinamento de splat) é um custo único por captura. Tudo depois disso é geometria e consultas MCP — roda nas mesmas instâncias do Azure Container Apps que servem a API.

O resumo honesto

O pipeline é: vídeo do celular → COLMAP → Gaussian splatting via Brush → Azure Blob → runtime MCP → qualquer LLM. Quatro das cinco etapas estão em produção. A quinta (treinamento de splat por GPU) está conectada e aguardando créditos. O visualizador para fechar o ciclo no navegador é o próximo marco.

Se você quer experimentar o lado de captura hoje, o PWA está em rakuai.com/capture-app/. Se você quer conduzir uma cena via MCP a partir do Claude Desktop, o guia está em /developers/claude-desktop.html. Se você quer entender a superfície completa de ferramentas, está em /mcp.html.

Escaneie. Depois converse com ele.

← Todos os posts