Wie vier Programme die Rechenleistung hinter Raku Capture antreiben

Die vier Rechen-Ebenen hinter Raku Capture und das Programm hinter jeder einzelnen.

Raku Capture wirkt von außen einfach. Man geht mit seinem Telefon durch einen Raum, und wenige Minuten später gibt es einen 3D-Gaussian-Splat dieses Raums, den ein KI-Assistent über MCP vermessen und in dem er handeln kann. Unter dieser Einfachheit liegt eine Pipeline, die auf mehr als einer Ebene ernsthafte GPU-Rechenleistung verlangt.

Wir sind ein bootstrapped Startup im Bundesstaat Washington. Wir haben keine Finanzierungsrunde aufgenommen, um diese Rechenleistung zu kaufen. Stattdessen sind wir den Startup-Programmen beigetreten, die die großen Plattformen betreiben, und es stellte sich heraus, dass jedes davon an einer anderen Stelle nützlich war. Kein einzelnes Programm hat die ganze Last getragen. Jedes hat einen Engpass auf einer Ebene des Stacks beseitigt, und die Ebenen summieren sich zu einem funktionierenden Produkt.

Wir möchten hier vorsichtig mit der Einordnung sein. Wir hätten irgendwann einen anderen Weg durch jede dieser Ebenen gefunden. Startups tun das immer. Die ehrliche Aussage ist kleiner und trotzdem festzuhalten wert. Diese Programme haben es uns erlaubt, die Ebenen in Monaten statt in Quartalen zu durchlaufen, und sie haben es uns erlaubt, das zu tun, ohne Eigenkapital oder Fokus aufzugeben.

Hier ist der Stack, Ebene für Ebene.

NVIDIA Inception, die Trainingsebene

Das Herzstück der Pipeline ist das Splat-Training. Eine Capture-Sitzung erzeugt einen Strom posierter Bilder, und ein Trainer verwandelt diese Bilder in einen 3D-Gaussian-Splat. Wir trainieren mit Brush, einem Open-Source-Splatting-Trainer, auf GPUs der Klassen A10G und L40S.

Wir sind im Mai 2026 NVIDIA Inception beigetreten. Das Programm gibt uns Zugang zum NGC-Katalog, aus dem unsere gehärteten CUDA-Container-Images stammen, sowie zum Deep Learning Institute, wodurch ein kleines Unternehmen seine GPU-Kenntnisse ohne Schulungsbudget aktuell hält. Es hat uns außerdem in ein Ökosystem gebracht, in dem uns die Leute finden können, die die nächste Generation von Vision-Hardware bauen.

Trainingsqualität ist das Produkt. Wenn der Splat gestochen scharf ist, fühlt sich alles Nachgelagerte wie Magie an. Wenn er matschig ist, kann nichts Nachgelagertes das retten. Inception liegt unter der Ebene, die uns am meisten interessiert.

AWS Activate, die Rekonstruktionsebene

Bevor irgendetwas trainiert werden kann, muss aus dem rohen Capture Geometrie werden. Ein GPU-Worker übernimmt die hochgeladenen Bilder und löst die Kamerapositionen per Structure from Motion. Anschließend führt er den Trainingsdurchlauf aus und verpackt das Ergebnis als SPZ-Datei, die der Viewer streamen kann.

Diese Rekonstruktions-Worker laufen auf AWS-G5-Instanzen, die dieselbe A10G-GPU-Klasse tragen, gegen die wir trainieren. Wir sind Teilnehmer von AWS Activate, und Activate ist das, was es für ein bootstrapped Unternehmen vernünftig gemacht hat, echte GPU-Kapazität eine Warteschlangen-Nachricht entfernt zu halten statt einen Beschaffungszyklus entfernt.

Auf dieser Ebene lebt auch die Arbeit an Robotersicht. Derselbe Rekonstruktionspfad, der ein Wohnzimmer verarbeitet, verarbeitet auch einen Lagerhausgang oder eine Fabrikzelle, und die Ausgabe ist eine metrische Szene, die ein Roboterplaner oder ein Inspektionsworkflow verwerten kann.

Microsoft for Startups, die Serving-Ebene

Alles Vorherige erzeugt Artefakte. Etwas muss sie trotzdem ausliefern. Die Produktions-API, mit der Telefone und KI-Assistenten sprechen, läuft auf Azure Container Apps, direkt neben unserer Datenbank und unserem Objektspeicher. Jeder Capture-Upload und jeder MCP-Tool-Aufruf landet zuerst dort.

RakuAI ist Mitglied von Microsoft for Startups, und Azure-Guthaben aus dem Programm tragen diese Serving-Ebene. Serving ist der am wenigsten glamouröse Teil des Stacks und der Teil, den Nutzer am direktesten spüren. Wenn die API langsam ist, ist das Produkt langsam, egal wie gut der Splat ist.

GitHub, die Auslieferungsebene

Die letzte Ebene ist, wie all das überhaupt ausgeliefert wird. Jede Änderung an der Plattform, von der Engine bis zu dieser Website, läuft über GitHub. Automatisierte Reviewer kommentieren jeden Pull Request innerhalb weniger Minuten. Ein Merge nach main deployt in Produktion, ohne dass ein Mensch einen Server anfasst, und die Seite, die Sie gerade lesen, wird von GitHub Pages ausgeliefert.

Für ein winziges Team ist diese Auslieferungsschleife der Unterschied zwischen täglichem und monatlichem Ausliefern. Sie ist außerdem das, was es sicher macht, KI-Agenten hier echte Engineering-Arbeit machen zu lassen, denn jede Änderung durchläuft denselben geprüften und rückgängig machbaren Pfad.

Warum die Ebenen-Betrachtung wichtig ist

Es würde eine bessere Geschichte ergeben zu sagen, dass eines dieser Programme allein das Unternehmen gerettet hat. Es wäre nicht wahr. Wahr ist, dass ein Spatial-Capture-Stack unterschiedliche Ebenen hat und ein Engpass auf jeder beliebigen Ebene die gesamte Pipeline drosselt. Trainingskapazität ohne Serving-Ebene ist eine Demo. Eine Serving-Ebene ohne Auslieferungsschleife ist ein Risiko. Das Nützliche an dieser Auswahl an Programmen ist, dass sie zufällig jeweils genau eine Ebene abdecken.

Derselbe Stack bedient zwei Zukünfte gleichzeitig. Auf der Unternehmensseite ist das Robotersicht, wo erfasste Anlagen zu Szenen werden, über die Planer und Inspektionswerkzeuge nachdenken können. Auf der Verbraucherseite sind das Smart Glasses und Simulationswelten, mit der räumlichen Engine unter beiden. Die Ebenen ändern sich zwischen diesen Zukünften nicht. Nur der Maßstab tut es.

Wenn Sie ein Gründer sind, der auf ein GPU-förmiges Loch in seinem Plan starrt, lautet der praktische Rat, aufzuhören, diese Programme als einen einzigen Pool generischer Guthaben zu betrachten. Kartieren Sie zuerst Ihren Stack. Ordnen Sie dann jedes Programm der Ebene zu, auf der es tatsächlich hilft.

Programme

Hinweise zu den Programmen

NVIDIA Inception ist ein kostenloses Programm für KI-Startups. Die Mitgliedschaft von RakuAI impliziert nicht, dass NVIDIA die Produkte von RakuAI unterstützt. „AWS” und „AWS Activate” sind Marken von Amazon.com, Inc. oder seinen verbundenen Unternehmen. Die Teilnahme von RakuAI impliziert nicht, dass AWS die Produkte von RakuAI unterstützt. Microsoft, Azure und Microsoft for Startups sind Marken der Microsoft-Unternehmensgruppe. Die Teilnahme von RakuAI impliziert nicht, dass Microsoft die Produkte von RakuAI unterstützt. GitHub ist eine Marke von GitHub, Inc. Die Nutzung von GitHub durch RakuAI impliziert nicht, dass GitHub die Produkte von RakuAI unterstützt.

← Alle Beiträge