Série: Aprendendo a Programar com IA

Escaneie. Depois converse com ele. — RakuAI Capture para espaços do dia a dia

Escaneie um cômodo real, depois deixe seu assistente lê-lo e medi-lo.

Você pega seu celular, caminha pela sua sala por trinta segundos, e toca em enviar. Alguns minutos depois você tem uma reconstrução 3D daquele cômodo — e assim que o treinamento de splat por GPU estiver online (chegando em dias), isso se torna um splat gaussiano fotorrealista arrastável, feito de milhões de pequenos elipsoides transparentes — hospedado em uma URL que você pode compartilhar. Depois você abre o Claude, ou o ChatGPT, ou o Gemini, aponta para o seu servidor Raku MCP, e pergunta: “Esse sofá vai caber ao longo da parede do fundo?” O assistente lê a cena, mede o espaço, e te responde.

Essa é a ideia do Raku Capture. Um celular. Sem rig, sem marcadores, sem software de 3D de desktop, sem instalação. O resultado não é uma foto — é uma cena conversável: um objeto espacial vivo sobre o qual seu assistente de IA pode consultar, medir, e raciocinar.

Este post é o relato honesto de como isso é hoje, o que ainda está por vir, e por que a combinação de captura honesta e um runtime de IA de protocolo aberto é algo genuinamente novo.

O que o Gaussian splatting realmente é

A maioria das ferramentas de captura 3D produz malhas — uma pele de triângulos sobreposta à forma estimada de um espaço. Malhas parecem plausíveis de fora e se desfazem de perto. O Gaussian splatting é diferente. Ele preenche a cena com milhões de pequenos elipsoides 3D — cada um posicionado, orientado, escalado, e ajustado em cor para corresponder ao que uma câmera real viu de um ângulo real. O resultado é denso, dependente da visão, e fotorrealista de um jeito que triângulos não conseguem igualar.

O nome técnico é 3D Gaussian Splatting (3DGS). O formato de arquivo é `.spz` (comprimido) ou `.ply` (intercâmbio). Você não pode tocá-lo ou quebrá-lo; você pode girá-lo, dar zoom nele, e apontar uma IA para ele.

O Raku usa o Brush v0.3.0 como treinador de Gaussian splatting. Ele roda em uma GPU (Azure A10, AWS G5, ou Nebius H100 — mais sobre isso abaixo). A etapa de Structure-from-Motion do COLMAP que a precede — transformando seus frames de vídeo em uma nuvem de pontos 3D esparsa — roda em CPU e está em produção hoje.

Como funciona o fluxo de captura

Etapa um: abra o PWA. O ponto de entrada é um QR code em rakuai.com/capture.html. Escaneie-o com seu celular. O app de captura abre no seu navegador móvel — sem App Store, sem APK, sem conta necessária para experimentar. Ele roda como um Progressive Web App.

Etapa dois: grave um escaneamento. Caminhe devagar pelo espaço — ou ao redor do objeto, ou ao longo da parede que te interessa. Trinta a sessenta segundos de filmagem estável já bastam. O app envia os frames para o backend do Raku via `POST /capture/upload`. Seu escaneamento vai para o Azure Blob Storage imediatamente.

Etapa três: reconstrução. O backend despacha uma tarefa de reconstrução para o `recon-worker` — um executor de job do Container Apps. Ele roda o COLMAP através dos seus frames, calcula posições de câmera, e produz uma nuvem de pontos 3D esparsa. Essa etapa é limitada por CPU e roda hoje, para todo escaneamento.

Etapa quatro: treinamento do splat. A saída do COLMAP alimenta o Brush, que ajusta milhões de gaussianos aos seus frames. Essa é a etapa limitada por GPU. Honestidade: a cota de GPU no Azure A10 está em revisão; os créditos do AWS Activate estão pendentes (solicitados em 28 de maio). Até que um desses chegue, as reconstruções recorrem à nuvem de pontos esparsa. Isto é acesso antecipado, não um produto finalizado. Caminhos reais de GPU são esperados em dias.

Etapa cinco: o splat vive. O arquivo `.spz` treinado fica em `api.rakuai.com/splats/.spz`. Você recebe um link compartilhável e um visualizador interativo. Arraste para girar. Belisque para dar zoom. É o seu cômodo, preservado como um objeto 3D mensurável.

A parte que torna tudo útil: MCP

O visualizador interativo é satisfatório. O runtime MCP é o que torna o splat de fato útil.

MCP — Model Context Protocol — é o protocolo aberto que permite que um assistente de IA externo chame ferramentas tipadas contra um serviço externo. O Raku expõe sua cena capturada através de duas superfícies:

17 ferramentas nativas — um contrato tipado para ler e mutar uma cena espacial. As ferramentas somente-leitura (consultar posições de objetos, medir distâncias, obter metadados de cena) funcionam em todo nível, incluindo o gratuito. Ferramentas de mutação (mover objetos, anotar, atualizar estado de cena) exigem concessões explícitas de permissão e são negadas por padrão.

~9.500 endpoints de passthrough — a superfície completa do FastAPI do backend do Raku, exposta através do relay MCP. Histórico de captura, status de tarefas, qualidade de reconstrução, metadados de cena — tudo alcançável a partir de qualquer cliente MCP.

O servidor MCP roda em `api.rakuai.com`. Ele fala transporte stdio. Toda chamada é registrada em uma trilha de auditoria imutável. Limites de taxa por sessão são aplicados.

MCP está disponível em todo nível, incluindo o gratuito. Conectar seu assistente de IA a uma cena capturada não é um recurso Pro.

Fazendo perguntas ao seu assistente sobre um espaço

Uma vez que você conectou seu assistente de IA ao Raku via MCP, as perguntas que você pode fazer se tornam espaciais e fundamentadas em vez de hipotéticas:

“Esse sofá vai caber ao longo da parede do fundo?” — O assistente chama `measure_distance` entre as duas paredes, compara com as dimensões do sofá que você fornece, e te dá um número real, não uma estimativa.

“Qual é a distância da janela até a mesa?” — `query_scene_objects` localiza ambos, `measure_distance` retorna o espaço em centímetros.

“O que está na estante no canto?” — `query_scene_objects` retorna os objetos que o runtime identificou naquela região.

“Como esse cômodo ficaria com a escrivaninha girada noventa graus?” — Com uma concessão de mutação, o assistente pode reposicionar a escrivaninha no modelo de cena e renderizar novamente a visão.

Essas não são resultados de busca. São medições e observações feitas contra uma representação 3D do seu espaço real. O assistente traz a linguagem e o raciocínio. O Raku traz o substrato espacial.

Claude, ChatGPT, Gemini, e Copilot funcionam todos. O contrato MCP é o mesmo para todos eles. Quando um novo assistente de IA lança suporte a MCP, ele funciona contra o Raku sem nenhuma mudança de código do nosso lado.

O que está em produção hoje versus o que está chegando

Em produção hoje: - PWA de escaneamento pelo celular — sem instalação, entrada por QR code, envia para o Azure Blob - Extração de características COLMAP e nuvem de pontos esparsa - Infraestrutura de backend (FastAPI ~9.500 endpoints, armazenamento de tarefas Redis, limites de taxa por nível) - Runtime MCP com 17 ferramentas nativas + ~9.500 endpoints de passthrough - Relay MCP hospedado para Claude, ChatGPT, Gemini, Copilot - Nível gratuito (10 capturas/dia, 1 GB, retenção de 7 dias, MCP incluído) - Pro Beta — \$0 durante o período de beta, será \$14,99/mês no lançamento geral com pelo menos 30 dias de aviso antes de qualquer cobrança

Travado (acesso antecipado — esperado em dias): - Treinamento real de splat por GPU no Azure A10 (cota em revisão) - Treinamento real de splat por GPU no AWS G5 (créditos do Activate em revisão) - Visualizador de splat 3D ao vivo no app de captura (o renderizador three.js está conectado; precisa de um splat treinado para exibir)

Roteiro: - Concessões de mutação de produção por autosserviço - Fila de reconstrução de qualidade superior para o Pro - Ecossistema de adaptadores de terceiros

Membro do NVIDIA Inception desde maio de 2026. Cinco patentes concedidas nos EUA (prioridade de julho de 2012).

Honestidade sobre o que é

O Raku Capture é uma reconstrução de nível celular e prosumer. Não é um instrumento de levantamento topográfico. Não é uma ferramenta profissional de fotogrametria. Não vai te dar precisão milimétrica ou modelos prontos para CAD.

O que vai te dar é um splat gaussiano 3D fotorrealista do seu espaço, produzido a partir de uma caminhada com o celular, acessível a qualquer LLM via MCP. Para as perguntas que a maioria das pessoas quer fazer sobre um espaço real — “isso cabe?”, “qual é a distância daquilo?”, “o que tem ali?” — é preciso o suficiente para ser genuinamente útil.

O visualizador de splat ainda não foi lançado em capture.html. O demo de ponta a ponta ao vivo (escanear no celular, ver o splat no navegador, perguntar algo ao assistente) requer um splat treinado, e o treinamento por GPU é o único portão ainda aberto. Esse portão é esperado para fechar em dias.

Começando

Se você quer experimentar o lado de captura hoje: rakuai.com/capture.html — escaneie o QR code com seu celular.

Se você quer conectar seu assistente de IA via MCP: /developers/claude-desktop.html — o guia do Claude Desktop; mesmo padrão para todos os assistentes.

Se você quer entender a superfície completa de ferramentas MCP: /mcp.html.

Escaneie. Depois converse com ele.

← Todos os posts