Cómo cuatro programas impulsan el cómputo detrás de Raku Capture

Las cuatro capas de cómputo detrás de Raku Capture y el programa que hay bajo cada una.

Raku Capture parece simple desde fuera. Caminas por una habitación con tu teléfono, y unos minutos después hay un splat gaussiano 3D de esa habitación que un asistente de IA puede medir y en el que puede actuar a través de MCP. Bajo esa simplicidad hay un pipeline que exige cómputo serio de GPU en más de una capa.

Somos una startup autofinanciada en el estado de Washington. No levantamos una ronda para comprar ese cómputo. Lo que hicimos en su lugar fue unirnos a los programas para startups que operan las grandes plataformas, y resultó que cada uno fue útil en un lugar distinto. Ningún programa por sí solo cargó con todo. Cada uno eliminó un cuello de botella en una capa de la pila, y las capas se suman hasta formar un producto que funciona.

Queremos ser cuidadosos con el planteamiento aquí. Habríamos encontrado otro camino a través de cada una de estas capas eventualmente. Las startups siempre lo hacen. La afirmación honesta es más modesta y aun así vale la pena dejarla escrita. Estos programas nos permitieron avanzar por las capas en meses en lugar de trimestres, y nos permitieron hacerlo sin ceder participación accionaria ni foco.

Aquí está la pila, capa por capa.

NVIDIA Inception, la capa de entrenamiento

El corazón del pipeline es el entrenamiento de splats. Una sesión de captura produce un flujo de imágenes posicionadas, y un entrenador convierte esas imágenes en un splat gaussiano 3D. Entrenamos con Brush, un entrenador de splatting de código abierto, en GPU de clase A10G y L40S.

Nos unimos a NVIDIA Inception en mayo de 2026. El programa nos da el catálogo NGC, de donde vienen nuestras imágenes de contenedor CUDA reforzadas, y el Deep Learning Institute, que es cómo una empresa pequeña mantiene actualizadas sus habilidades de GPU sin un presupuesto de formación. También nos puso dentro de un ecosistema donde las personas que construyen la próxima generación de hardware de visión pueden encontrarnos.

La calidad del entrenamiento es el producto. Cuando el splat sale nítido, todo lo que viene después se siente como magia. Cuando sale borroso, nada de lo que viene después puede salvarlo. Inception está bajo la capa que más nos importa.

AWS Activate, la capa de reconstrucción

Antes de que se pueda entrenar nada, la captura en bruto tiene que convertirse en geometría. Un worker de GPU recoge los fotogramas subidos y resuelve las poses de cámara con structure from motion. Luego ejecuta el paso de entrenamiento y empaqueta el resultado como un archivo SPZ que el visor puede transmitir en streaming.

Esos workers de reconstrucción se ejecutan en instancias AWS G5, que llevan la misma clase de GPU A10G contra la que entrenamos. Somos participantes de AWS Activate, y Activate es lo que hizo razonable que una empresa autofinanciada mantuviera capacidad real de GPU a un mensaje de cola de distancia en lugar de a un ciclo de adquisición de distancia.

Esta es también la capa donde vive el trabajo de visión robótica. La misma ruta de reconstrucción que maneja una sala de estar maneja un pasillo de almacén o una celda de fábrica, y la salida es una escena métrica que un planificador robótico o un flujo de inspección puede consumir.

Microsoft for Startups, la capa de servicio

Todo lo anterior produce artefactos. Algo todavía tiene que servirlos. La API de producción con la que hablan los teléfonos y los asistentes de IA se ejecuta en Azure Container Apps, junto a nuestra base de datos y nuestro almacenamiento de objetos. Cada subida de captura y cada llamada a una herramienta MCP aterriza ahí primero.

RakuAI es miembro de Microsoft for Startups, y los créditos de Azure del programa sostienen esa capa de servicio. Servir es la parte menos glamorosa de la pila y la parte que los usuarios sienten más directamente. Cuando la API va lenta, el producto va lento, sin importar cuán bueno sea el splat.

GitHub, la capa de entrega

La última capa es cómo se lanza todo esto. Cada cambio a la plataforma, desde el motor hasta este sitio web, pasa por GitHub. Revisores automatizados comentan cada pull request en minutos. Un merge a main despliega a producción sin que un humano toque un servidor, y el sitio que estás leyendo lo sirve GitHub Pages.

Para un equipo diminuto, ese ciclo de entrega es la diferencia entre lanzar a diario y lanzar mensualmente. También es lo que hace seguro dejar que agentes de IA hagan aquí trabajo de ingeniería real, porque cada cambio pasa por la misma ruta revisada y reversible.

Por qué importa el planteamiento por capas

Sería una mejor historia decir que cualquiera de estos programas salvó a la empresa. No sería cierto. Lo que sí es cierto es que una pila de captura espacial tiene capas distintas, y un cuello de botella en cualquier capa estrangula todo el pipeline. Capacidad de entrenamiento sin una capa de servicio es una demo. Una capa de servicio sin un ciclo de entrega es un pasivo. Lo útil de este conjunto de programas es que resultó que se alinearon uno por capa.

La misma pila sirve a dos futuros a la vez. Del lado empresarial es visión robótica, donde las instalaciones capturadas se convierten en escenas sobre las que pueden razonar planificadores y herramientas de inspección. Del lado del consumidor son las gafas inteligentes y los mundos de simulación, con el motor espacial debajo de ambos. Las capas no cambian entre esos futuros. Solo cambia la escala.

Si eres un fundador mirando fijamente un agujero con forma de GPU en tu plan, el consejo práctico es dejar de pensar en estos programas como una sola bolsa de créditos genéricos. Mapea primero tu pila. Luego empareja cada programa con la capa donde realmente ayuda.

Programas

Notas de los programas

NVIDIA Inception es un programa gratuito para startups de IA. La membresía de RakuAI no implica que NVIDIA respalde los productos de RakuAI. “AWS” y “AWS Activate” son marcas registradas de Amazon.com, Inc. o sus filiales. La participación de RakuAI no implica que AWS respalde los productos de RakuAI. Microsoft, Azure y Microsoft for Startups son marcas registradas del grupo de empresas Microsoft. La participación de RakuAI no implica que Microsoft respalde los productos de RakuAI. GitHub es una marca registrada de GitHub, Inc. El uso que RakuAI hace de GitHub no implica que GitHub respalde los productos de RakuAI.

← Todas las entradas