Escanéalo. Luego háblale. — RakuAI Capture para espacios cotidianos
Sacas tu teléfono, caminas por tu sala de estar durante treinta segundos y pulsas subir. Unos minutos después tienes una reconstrucción 3D de esa habitación, y una vez que el entrenamiento de splats con GPU esté en línea (llega en cuestión de días), eso se convierte en un splat gaussiano fotorrealista y manipulable hecho de millones de diminutos elipsoides transparentes, alojado en una URL que puedes compartir. Luego abres Claude, o ChatGPT, o Gemini, lo apuntas a tu servidor MCP de Raku, y preguntas: “¿Cabrá este sofá a lo largo de la pared del fondo?” El asistente lee la escena, mide el hueco y te lo dice.
Esa es la idea de Raku Capture. Un teléfono. Sin rig, sin marcadores, sin software 3D de escritorio, sin instalación. El resultado no es una foto, es una escena con la que se puede hablar: un objeto espacial vivo que tu asistente de IA puede consultar, medir y sobre el que puede razonar.
Este artículo es el relato honesto de cómo se ve eso hoy, qué está todavía por llegar, y por qué la combinación de captura honesta y un runtime de IA de protocolo abierto es algo genuinamente nuevo.
Qué es en realidad el Gaussian splatting
La mayoría de las herramientas de captura 3D producen mallas: una piel de triángulos colocada sobre la forma estimada de un espacio. Las mallas parecen plausibles desde fuera y se desmoronan de cerca. El Gaussian splatting es distinto. Llena la escena con millones de diminutos elipsoides 3D, cada uno posicionado, orientado, escalado y ajustado en color para coincidir con lo que una cámara real vio desde un ángulo real. El resultado es denso, dependiente de la vista y fotorrealista de una manera que los triángulos no pueden igualar.
El nombre técnico es 3D Gaussian Splatting (3DGS). El formato de archivo es `.spz` (comprimido) o `.ply` (de intercambio). No puedes tocarlo ni romperlo; puedes rotarlo, hacer zoom sobre él y apuntarle una IA.
Raku usa Brush v0.3.0 como entrenador de Gaussian splatting. Se ejecuta en una GPU (Azure A10, AWS G5, o Nebius H100; más sobre eso a continuación). El paso de Structure-from-Motion con COLMAP que lo precede, convertir tus fotogramas de video en una nube de puntos 3D dispersa, se ejecuta en CPU y está en producción hoy.
Cómo funciona el flujo de captura
Paso uno: abre la PWA. El punto de entrada es un código QR en rakuai.com/capture.html. Escanéalo con tu teléfono. La app de captura se abre en tu navegador móvil, sin App Store, sin APK, sin cuenta requerida para probarla. Se ejecuta como una Progressive Web App.
Paso dos: graba un escaneo. Camina despacio por el espacio, o alrededor del objeto, o a lo largo de la pared que te interesa. De treinta a sesenta segundos de metraje estable son suficientes. La app sube los fotogramas al backend de Raku mediante `POST /capture/upload`. Tu escaneo va a Azure Blob Storage de inmediato.
Paso tres: reconstrucción. El backend despacha un trabajo de reconstrucción a `recon-worker`, un ejecutor de trabajos de Container Apps. Ejecuta COLMAP sobre tus fotogramas, calcula posiciones de cámara y produce una nube de puntos 3D dispersa. Este paso depende de la CPU y se ejecuta hoy, para cada escaneo.
Paso cuatro: entrenamiento del splat. La salida de COLMAP alimenta a Brush, que ajusta millones de gaussianas a tus fotogramas. Este es el paso que depende de la GPU. Honestamente: la cuota de GPU en Azure A10 está en revisión; los créditos de AWS Activate están pendientes (solicitados el 28 de mayo). Hasta que uno de esos llegue, las reconstrucciones recurren a la nube de puntos dispersa. Esto es acceso anticipado, no un producto terminado. Se esperan rutas reales de GPU en cuestión de días.
Paso cinco: el splat vive. El archivo `.spz` entrenado se aloja en `api.rakuai.com/splats/
La parte que lo hace útil: MCP
El visor interactivo es satisfactorio. El runtime MCP es lo que hace que el splat sea realmente útil.
MCP, Model Context Protocol, es el protocolo abierto que permite que un asistente de IA externo invoque herramientas tipadas contra un servicio externo. Raku expone tu escena capturada a través de dos superficies:
17 herramientas nativas: un contrato tipado para leer y mutar una escena espacial. Las herramientas de solo lectura (consultar posiciones de objetos, medir distancias, obtener metadatos de escena) funcionan en todos los niveles, incluido el gratuito. Las herramientas de mutación (mover objetos, anotar, actualizar el estado de la escena) requieren concesiones de permiso explícitas y se deniegan por defecto.
~9,500 endpoints de passthrough: toda la superficie FastAPI del backend de Raku, expuesta a través del relay MCP. Historial de capturas, estado de trabajos, calidad de reconstrucción, metadatos de escena, todo accesible desde cualquier cliente MCP.
El servidor MCP se ejecuta en `api.rakuai.com`. Habla transporte stdio. Cada llamada se registra en un rastro de auditoría inmutable. Se aplican límites de tasa por sesión.
MCP está en todos los niveles, incluido el gratuito. Conectar tu asistente de IA a una escena capturada no es una función Pro.
Hacerle preguntas a tu asistente sobre un espacio
Una vez que has conectado tu asistente de IA a Raku por MCP, las preguntas que puedes hacer se vuelven espaciales y concretas en lugar de hipotéticas:
“¿Cabrá este sofá a lo largo de la pared del fondo?” — El asistente invoca `measure_distance` entre las dos paredes, lo compara contra las dimensiones del sofá que tú proporcionas, y te da un número real, no una estimación.
“¿A qué distancia está la ventana del escritorio?” — `query_scene_objects` localiza ambos, `measure_distance` devuelve el hueco en centímetros.
“¿Qué hay en el estante de la esquina?” — `query_scene_objects` devuelve los objetos que el runtime ha identificado en esa región.
“¿Cómo se vería esta habitación con el escritorio rotado noventa grados?” — Con una concesión de mutación, el asistente puede reposicionar el escritorio en el modelo de escena y volver a renderizar la vista.
Estos no son resultados de búsqueda. Son mediciones y observaciones hechas contra una representación 3D de tu espacio real. El asistente aporta el lenguaje y el razonamiento. Raku aporta el sustrato espacial.
Claude, ChatGPT, Gemini y Copilot funcionan todos. El contrato MCP es el mismo para todos ellos. Cuando un nuevo asistente de IA lanza soporte para MCP, funciona contra Raku sin ningún cambio de código de nuestra parte.
Qué está en producción hoy frente a qué está por llegar
En producción hoy: - PWA de escaneo desde el teléfono, sin instalación, entrada por QR, subidas a Azure Blob - Extracción de características COLMAP y nube de puntos dispersa - Infraestructura del backend (FastAPI ~9,500 endpoints, almacén de trabajos Redis, límites de tasa por nivel) - Runtime MCP con 17 herramientas nativas + ~9,500 endpoints de passthrough - Relay MCP alojado para Claude, ChatGPT, Gemini, Copilot - Nivel gratuito (10 capturas/día, 1 GB, retención de 7 días, MCP incluido) - Pro Beta — \$0 durante el periodo beta, será \$14.99/mes en disponibilidad general con al menos 30 días de aviso antes de cualquier cargo
Bloqueado (acceso anticipado, se espera en cuestión de días): - Entrenamiento real de splats con GPU en Azure A10 (cuota en revisión) - Entrenamiento real de splats con GPU en AWS G5 (créditos de Activate en revisión) - Visor de splats 3D en vivo en la app de captura (el renderizador de three.js está conectado; necesita un splat entrenado para mostrarse)
Hoja de ruta: - Concesiones de mutación de producción de autoservicio - Cola de reconstrucción de mayor calidad para Pro - Ecosistema de adaptadores de terceros
Miembro de NVIDIA Inception desde mayo de 2026. Cinco patentes de EE. UU. concedidas (prioridad de julio de 2012).
Honestidad sobre lo que es
Raku Capture es una reconstrucción de nivel teléfono y de nivel prosumidor. No es un instrumento de topografía. No es una herramienta de fotogrametría profesional. No te dará precisión al milímetro ni modelos listos para CAD.
Lo que sí te dará es un splat gaussiano 3D fotorrealista de tu espacio, producido a partir de un recorrido con el teléfono, accesible para cualquier LLM a través de MCP. Para las preguntas que la mayoría de la gente quiere hacer sobre un espacio real (“¿cabrá esto?”, “¿qué tan lejos está eso?”, “¿qué hay ahí?”), es lo bastante preciso como para ser genuinamente útil.
El visor de splats aún no se ha lanzado en capture.html. La demo en vivo de extremo a extremo (escanear en el teléfono, ver el splat en el navegador, hacerle una pregunta al asistente) requiere un splat entrenado, y el entrenamiento con GPU es la única puerta que sigue abierta. Se espera que esa puerta se cierre en cuestión de días.
Cómo empezar
Si quieres probar hoy el extremo de captura: rakuai.com/capture.html, escanea el QR con tu teléfono.
Si quieres conectar tu asistente de IA por MCP: /developers/claude-desktop.html, la guía de Claude Desktop; el mismo patrón sirve para todos los asistentes.
Si quieres entender toda la superficie de herramientas MCP: /mcp.html.
Escanéalo. Luego háblale.