RakuAI 如何運作——端到端全解析
用手機掃描一個房間。三十秒後,一個 3D 高斯潑濺(Gaussian splat)就誕生了。接著請 Claude——或 ChatGPT、或 Gemini——查詢它、標註它、移動裡面的東西。這就是整個賣點。這篇文章是誠實的說明:每個步驟實際上如何運作、今天哪些已經上線、哪些還卡在 GPU 額度上。
對這個部落格來說,這是一篇不太一樣的文章。平常的週六文章都在講解決了某個特定問題,或熬過了某個特定的一週。這篇則往後退一步看全貌——RakuAI 是什麼、它的各個部件如何連接,以及當你端到端追蹤下來,護城河到底是什麼。這是我第一次向一位想聽真實故事、而非簡報版本的開發者夥伴解釋這一切時,希望當時就存在的那篇文章。
一句話講完前提
你用手機掃描一個真實的地方。掃描變成一個 3D 高斯潑濺——由數百萬個微小半透明橢球組成的擬真重建。這個潑濺透過一個執行環境提供服務,該環境將它以工具形式開放給任何 LLM 呼叫。LLM 可以查詢場景、推理其中包含什麼,並且——在適當的權限下——修改它。不需要遊戲引擎授權。不需要為每個供應商各做整合。不被任何模型綁定。
這就是「掃描它,然後跟它對話」的想法。以下是這條鏈上每個環節的運作方式。
步驟 1:擷取——從手機影片到原始影格
入口是位於 rakuai.com/capture-app/ 的漸進式網頁應用程式(PWA)。它在行動瀏覽器中執行,無需安裝。使用者錄製 30 到 60 秒的影片,繞著主體緩慢走動——一個房間、一件物品、一個值得保存的空間。
PWA 將影片影格打包並上傳到後端的 POST /api/v1/capture,後端執行於 Azure Container Apps 上的 api.rakuai.com。後端是一個 FastAPI 服務——約 9,500 個 REST 端點——負責驗證上傳、記錄中繼資料(原始檔名、content-type、擷取時間戳),並將原始輸入包存到 Azure Blob Storage。
這部分已經上線。上傳路徑今天就能用,任何註冊的人都可以。
步驟 2:重建——從 COLMAP 特徵萃取到點雲
後端將重建工作分派給一個名為 recon-worker 的 Container Apps 工作執行器。它做的第一件事是對上傳的影格執行 COLMAP——運動恢復結構(Structure from Motion)函式庫。COLMAP 在各影格之間辨識匹配的特徵並計算相機位置,產出稀疏的 3D 點雲。
這個步驟受 CPU 限制,不需要 GPU。它今天就在運作。
步驟 3:潑濺訓練——Brush 把點雲變成高斯潑濺
這是運算密集的步驟。重建工作器將 COLMAP 點雲和原始影格餵給 Brush v0.3.0,一個 3D 高斯潑濺(3D Gaussian Splatting)訓練器。Brush 將數百萬個小型 3D 高斯體擬合到場景上——每個高斯體是 3D 空間中的一個橢球,具有位置、方向、尺度、不透明度以及隨視角變化的顏色。輸出是一個 .ply 或 .spz 檔案,與輸入一起存到 Azure Blob Storage。
誠實地說:這個步驟需要 GPU。 Azure A10 的 GPU 配額正在審核中。AWS Activate 額度待核准(2026-05-28 申請)。在其中一項到位之前,正式環境的重建工作器會退回到模擬後端——架構已接好,GPU 路徑尚未上線。這是搶先體驗,不是完成品等級的消費性產品。
步驟 4:MCP 執行環境——17 個工具 + 約 9,500 個直通端點
這是讓潑濺成為一個活的空間物件、而非靜態檔案的部分。
執行環境是一個 C++ 引擎:18 個原生 DLL、橫跨物理、渲染、音訊、追蹤、多人狀態與 AI 協調等子系統的 30,738 個匯出函式。自 2026 年 4 月起在 Windows、Linux 和 macOS 上 CI 全綠。
在引擎之上,MCP 伺服器開放兩個介面:
17 個原生工具(5 個唯讀 + 12 個變更)——任何外部代理與場景互動所使用的型別化契約。唯讀工具在所有環境中都能用。變更工具需要明確的權限授予,在正式環境中預設拒絕。
約 9,500 個直通端點——raku-api 的完整 FastAPI 介面,透過 MCP 中繼開放。後端的任何路由都能經由中繼觸及,讓 LLM 能存取擷取歷史、工作狀態、場景中繼資料,以及後端的完整查詢介面。
MCP 伺服器託管於 Azure Container Apps 上的 api.rakuai.com。給 Claude Desktop、ChatGPT 和 Gemini 用的中繼已經上線。伺服器使用 stdio 傳輸,將每次呼叫記錄到稽核軌跡,並執行每工作階段的速率限制。
步驟 5:多供應商 LLM 存取——真正的護城河
任何會說 Model Context Protocol 的模型都能連上執行環境,對已擷取的場景呼叫工具,無需客製整合。Claude、ChatGPT、Gemini、Copilot——契約對所有模型都是同一份。
執行環境把契約寫一次,模型來適應契約。當一個新的模型實驗室推出 MCP 客戶端時,它就能直接對接執行環境,我們這邊不需要改任何程式碼。
執行環境對線路另一端是哪個模型沒有任何立場。它掌握物理、碰撞、計分、渲染與場景狀態的權威;模型貢獻查詢與意圖。除了型別化的工具介面之外,雙方都不需要知道彼此的存在。
這就是護城河:對實體世界的誠實擷取,以無損的 3D 表示形式儲存,可被任何會說開放協定的 LLM 查詢。不被單一模型綁定。不被單一使用情境綁定。不被單一硬體供應商綁定。
今天已上線 vs. 仍在藍圖上
今天已上線: - 手機擷取 PWA,上傳到 Azure Blob - COLMAP 特徵萃取與點雲 - 後端基礎設施(FastAPI 約 9,500 個 REST 端點、Redis 工作儲存、依層級調整的速率限制) - 具備 17 個原生工具 + 約 9,500 個直通端點的 MCP 執行環境 - 給 Claude、ChatGPT、Gemini 的託管 MCP 中繼 - 多供應商工具契約(stdio、預設拒絕、完整稽核紀錄) - 免費層與 Pro Beta 層(Pro Beta 在測試期間為 $0)
受限中(搶先體驗——預計數日內開放): - Azure A10 上的真實 GPU 潑濺訓練(配額審核中) - AWS G5 上的真實 GPU 潑濺訓練(Activate 額度審核中)
藍圖(尚未推出): - 擷取 PWA 內的即時潑濺檢視器(three.js 高斯潑濺渲染器已接好;端到端展示需要一個訓練完成的潑濺) - 自助式的正式環境變更權限授予 - 第三方轉接器生態系(第一方參考轉接器已存在;廣泛的生態系仍在藍圖上)
自 2026 年 5 月起為 NVIDIA Inception 成員。
為什麼「純推論」不是限制
執行環境不訓練模型,不微調模型,也不要求你在它裡面跑模型。你已經擁有的模型——不管它是什麼、在哪裡執行、採用什麼授權——透過 MCP 連進來,從外部驅動執行環境。
這是刻意的架構選擇。訓練與推論是分開的關注點。執行環境擅長空間物理、確定性的狀態管理、多使用者同步和低延遲渲染。模型實驗室擅長推理、生成和語言。MCP 契約是兩者之間的邊界。任何一方都不必去做另一方的工作。
純推論也意味著服務端沒有 GPU 常駐需求。運算密集的步驟(潑濺訓練)是每次擷取的一次性成本。之後的一切都是幾何運算和 MCP 查詢——跑在提供 API 服務的同一批 Azure Container Apps 執行個體上。
誠實的總結
管線是:手機影片 → COLMAP → Brush 高斯潑濺 → Azure Blob → MCP 執行環境 → 任何 LLM。五個步驟中有四個已上線。第五個(GPU 潑濺訓練)已接好線,正在等額度。在瀏覽器裡把迴圈閉合起來的檢視器是下一個里程碑。
如果你今天就想試試擷取端,PWA 在 rakuai.com/capture-app/。如果你想從 Claude Desktop 透過 MCP 驅動一個場景,指南在 /developers/claude-desktop.html。如果你想了解完整的工具介面,請看 /mcp.html。
掃描它,然後跟它對話。