Comment quatre programmes alimentent le calcul derrière Raku Capture

Les quatre couches de calcul derrière Raku Capture et le programme sous chacune.

Raku Capture paraît simple de l’extérieur. Vous parcourez une pièce avec votre téléphone, et quelques minutes plus tard il existe un splat gaussien 3D de cette pièce qu’un assistant IA peut mesurer et dans lequel il peut agir via MCP. Sous cette simplicité se trouve un pipeline qui exige du calcul GPU sérieux à plus d’une couche.

Nous sommes une startup autofinancée dans l’État de Washington. Nous n’avons pas levé de tour de table pour acheter ce calcul. Ce que nous avons fait à la place, c’est rejoindre les programmes pour startups que font tourner les grandes plateformes, et il s’est avéré que chacun était utile à un endroit différent. Aucun programme unique n’a porté l’ensemble. Chacun a supprimé un goulot d’étranglement à une couche de la pile, et les couches s’additionnent pour former un produit fonctionnel.

Nous voulons être prudents avec le cadrage ici. Nous aurions fini par trouver un autre chemin à travers chacune de ces couches. Les startups le font toujours. L’affirmation honnête est plus modeste et vaut quand même la peine d’être consignée. Ces programmes nous ont permis de traverser les couches en mois plutôt qu’en trimestres, et ils nous ont permis de le faire sans céder de capital ni de concentration.

Voici la pile, couche par couche.

NVIDIA Inception, la couche d’entraînement

Le cœur du pipeline est l’entraînement de splat. Une session de capture produit un flux d’images posées, et un entraîneur transforme ces images en un splat gaussien 3D. Nous entraînons avec Brush, un entraîneur de splatting open source, sur des GPU de classe A10G et L40S.

Nous avons rejoint NVIDIA Inception en mai 2026. Le programme nous donne accès au catalogue NGC, d’où viennent nos images de conteneur CUDA endurcies, et au Deep Learning Institute, qui est comment une petite entreprise maintient ses compétences GPU à jour sans budget de formation. Il nous a aussi placés à l’intérieur d’un écosystème où les personnes qui construisent la prochaine génération de matériel de vision peuvent nous trouver.

La qualité de l’entraînement est le produit. Quand le splat est net, tout ce qui suit en aval ressemble à de la magie. Quand il est flou, rien en aval ne peut le sauver. Inception se trouve sous la couche qui nous importe le plus.

AWS Activate, la couche de reconstruction

Avant que quoi que ce soit puisse être entraîné, la capture brute doit devenir de la géométrie. Un travailleur GPU récupère les images envoyées et résout les poses de caméra par structure from motion. Il fait ensuite tourner la passe d’entraînement et empaquette le résultat comme un fichier SPZ que la visionneuse peut diffuser.

Ces travailleurs de reconstruction tournent sur des instances AWS G5, qui portent la même classe de GPU A10G contre laquelle nous entraînons. Nous sommes participants d’AWS Activate, et Activate est ce qui a rendu raisonnable pour une entreprise autofinancée de garder une vraie capacité GPU à un message de file d’attente plutôt qu’à un cycle d’approvisionnement.

C’est aussi la couche où vit le travail de vision robotique. Le même chemin de reconstruction qui traite un salon traite une allée d’entrepôt ou une cellule d’usine, et la sortie est une scène métrique qu’un planificateur robotique ou un flux d’inspection peut exploiter.

Microsoft for Startups, la couche de service

Tout ce qui précède produit des artefacts. Quelque chose doit encore les servir. L’API de production à laquelle parlent les téléphones et les assistants IA tourne sur Azure Container Apps, à côté de notre base de données et de notre stockage d’objets. Chaque envoi de capture et chaque appel d’outil MCP y atterrit d’abord.

RakuAI est membre de Microsoft for Startups, et les crédits Azure du programme portent cette couche de service. Servir est la partie la moins glamour de la pile et celle que les utilisateurs ressentent le plus directement. Quand l’API est lente, le produit est lent, peu importe la qualité du splat.

GitHub, la couche de livraison

La dernière couche est la façon dont tout cela est livré. Chaque changement de la plateforme, du moteur jusqu’à ce site web, transite par GitHub. Des relecteurs automatisés commentent chaque pull request en quelques minutes. Une fusion vers main déploie en production sans qu’un humain ne touche à un serveur, et le site que vous lisez est servi par GitHub Pages.

Pour une toute petite équipe, cette boucle de livraison est la différence entre livrer quotidiennement et livrer mensuellement. C’est aussi ce qui rend sûr de laisser des agents IA faire du vrai travail d’ingénierie ici, parce que chaque changement passe par le même chemin relu et réversible.

Pourquoi le cadrage en couches compte

Ce serait une meilleure histoire de dire que l’un ou l’autre de ces programmes a sauvé l’entreprise. Ce ne serait pas vrai. Ce qui est vrai, c’est qu’une pile de capture spatiale a des couches distinctes, et qu’un goulot d’étranglement à n’importe quelle couche étrangle tout le pipeline. Une capacité d’entraînement sans couche de service est une démo. Une couche de service sans boucle de livraison est un passif. Ce qui est utile dans cet ensemble de programmes, c’est qu’ils se sont trouvés alignés un par couche.

La même pile sert deux futurs à la fois. Côté entreprise, c’est la vision robotique, où des installations capturées deviennent des scènes que des planificateurs et des outils d’inspection peuvent exploiter par le raisonnement. Côté grand public, ce sont les lunettes connectées et les mondes de simulation, avec le moteur spatial en dessous des deux. Les couches ne changent pas entre ces futurs. Seule l’échelle change.

Si vous êtes un fondateur qui fixe un trou en forme de GPU dans votre plan, le conseil pratique est d’arrêter de penser à ces programmes comme un seul bassin de crédits génériques. Cartographiez d’abord votre pile. Puis associez chaque programme à la couche où il aide réellement.

Programmes

Notes sur les programmes

NVIDIA Inception est un programme gratuit pour les startups IA. L’adhésion de RakuAI n’implique pas que NVIDIA approuve les produits de RakuAI. « AWS » et « AWS Activate » sont des marques déposées d’Amazon.com, Inc. ou de ses filiales. La participation de RakuAI n’implique pas qu’AWS approuve les produits de RakuAI. Microsoft, Azure et Microsoft for Startups sont des marques déposées du groupe de sociétés Microsoft. La participation de RakuAI n’implique pas que Microsoft approuve les produits de RakuAI. GitHub est une marque déposée de GitHub, Inc. L’utilisation de GitHub par RakuAI n’implique pas que GitHub approuve les produits de RakuAI.

← Tous les articles