RakuAI 是如何端到端运作的
用你的手机扫描一个房间。三十秒后,一个 3D 高斯溅射体就诞生了。现在让 Claude——或者 ChatGPT,或者 Gemini——去查询它、给它添加注释、在里面移动物体。这就是整套构想。这篇文章是关于每一步实际如何运作的诚实说明:今天已经上线的是什么,哪些还卡在 GPU 额度上。
这是这个博客上一篇不太一样的文章。往常的星期六文章通常讲的是某个具体问题的解决,或是某一周具体的生存记录。这一篇则要退后一步,看全局——RakuAI 到底是什么,它的各个部分是如何连接起来的,以及当你端到端地追溯它时,真正的护城河到底是什么。这是我希望在第一次向一位想要真实故事、而不是推介资料版本的开发者合作伙伴解释这一切时,就已经存在的那篇文章。
一句话讲清楚前提
你用手机扫描一个真实的地方。这次扫描变成了一个 3D 高斯溅射体——一个由数百万个微小的透明椭球体构成的照片级真实感重建。这个溅射体通过一个运行时被提供出来,该运行时将其暴露为任何 LLM 都能调用的工具。LLM 可以查询这个场景,推理它包含的内容,并且——在合适的权限下——对它进行变更。不需要游戏引擎许可证。不需要针对每个厂商做集成。不会被锁定在某一个模型上。
这就是「扫描它,然后和它对话」这个想法。下面是这个链条中每一环节的实际运作方式。
第一步:捕获——手机视频到原始帧
入口是位于 rakuai.com/capture-app/ 的一个渐进式网页应用(PWA)。它在移动端浏览器中运行,无需安装。用户录制 30 到 60 秒的视频,缓慢地围绕拍摄对象走动——一个房间、一件物品、一个值得保存下来的空间。
这个 PWA 将视频帧打包,上传到后端的 POST /api/v1/capture,该后端运行在 Azure Container Apps 上的 api.rakuai.com。后端是一个 FastAPI 服务——约 9,500 个 REST 端点——负责验证上传身份、记录元数据(原始文件名、内容类型、捕获时间戳),并将原始输入包存储到 Azure Blob Storage 中。
这一部分是已经上线的。上传路径今天对任何注册用户都是可用的。
第二步:重建——COLMAP 特征提取到点云
后端将一个重建任务派发给一个名为 recon-worker 的 Container Apps 任务运行器。它做的第一件事是在上传的帧上运行 COLMAP——这个运动恢复结构(Structure from Motion)库。COLMAP 识别帧与帧之间的匹配特征,计算相机位置,生成一个稀疏的 3D 点云。
这一步是 CPU 密集型的,不需要 GPU。它今天就能运行。
第三步:溅射体训练——Brush 把点云变成高斯溅射体
这是计算密集型的一步。重建工作节点将 COLMAP 点云和原始帧一起送入 Brush v0.3.0,一个 3D 高斯溅射训练器。Brush 会为场景拟合出数百万个微小的 3D 高斯体——每个高斯体都是 3D 空间中的一个椭球体,具有位置、朝向、尺度、不透明度和依赖视角的颜色。输出是一个 .ply 或 .spz 文件,和输入一起存储到 Azure Blob Storage 中。
说句实话:这一步需要 GPU。 Azure A10 上的 GPU 额度还在审核中。AWS Activate 额度还在等待批准(申请于 2026-05-28 提交)。在其中任何一个到位之前,生产环境的重建工作节点会回退到一个模拟后端——架构已经搭好,但 GPU 路径还没有上线。这是抢先体验,不是一个成品消费级产品。
第四步:MCP 运行时——17 个工具 + 约 9,500 个透传端点
正是这一部分让这个溅射体变成一个活的空间对象,而不是一个静态文件。
这个运行时是一个 C++ 引擎:18 个原生 DLL,跨物理、渲染、音频、追踪、多人游戏状态和 AI 编排等子系统共导出 30,738 个函数。自 2026 年 4 月起,在 Windows、Linux 和 macOS 上持续保持 CI 全绿。
在引擎之上,MCP 服务器暴露出两个表面:
17 个原生工具(5 个只读 + 12 个可变更)——这是任何外部智能体用来和场景交互的类型化契约。只读工具在任何环境中都可用。变更类工具需要显式的权限授予,在生产环境中默认拒绝。
约 9,500 个透传端点——通过 MCP 中继暴露出来的 raku-api 的完整 FastAPI 表面。后端的任何路由都可以通过这个中继访问到,让 LLM 能够获取捕获历史、任务状态、场景元数据,以及后端的完整查询表面。
MCP 服务器托管在 Azure Container Apps 上的 api.rakuai.com。面向 Claude Desktop、ChatGPT 和 Gemini 的中继已经上线。服务器采用 stdio 传输,把每一次调用都记录到审计跟踪中,并按会话强制执行速率限制。
第五步:多厂商 LLM 接入——真正的护城河
任何会说 Model Context Protocol 的模型,都能连接到这个运行时,对一个已捕获的场景调用工具,而不需要定制集成。Claude、ChatGPT、Gemini、Copilot——对它们来说契约都是一样的。
运行时只需编写一次契约。模型去适配这个契约。当一家新的模型实验室发布一个 MCP 客户端时,它无需我们这边做任何代码改动,就能直接对接这个运行时工作。
这个运行时对另一端接入的是哪个模型没有任何偏好。它始终保留对物理、碰撞、计分、渲染和场景状态的主导权。模型贡献的是查询和意图。除了通过这套类型化的工具表面之外,双方都不需要知道对方的存在。
这就是护城河所在:对物理世界的诚实捕获,以无损的 3D 表示形式存储,可被任何会说一个开放协议的 LLM 查询。不锁定于某一个模型。不锁定于某一种用例。不锁定于某一个硬件厂商。
今天已上线的和路线图上的
今天已上线: - 手机捕获 PWA,上传到 Azure Blob - COLMAP 特征提取和点云 - 后端基础设施(FastAPI 约 9,500 个 REST 端点、Redis 任务存储、按等级感知的速率限制) - 拥有 17 个原生工具 + 约 9,500 个透传端点的 MCP 运行时 - 面向 Claude、ChatGPT、Gemini 的托管 MCP 中继 - 多厂商工具契约(stdio、默认拒绝、完整审计日志) - 免费等级和 Pro Beta 等级(Pro Beta 在测试期间为 $0)
受限中(抢先体验——预计数日内上线): - Azure A10 上的真实 GPU 溅射体训练(额度审核中) - AWS G5 上的真实 GPU 溅射体训练(Activate 额度审核中)
路线图(尚未交付): - 捕获 PWA 中的实时溅射体查看器(three.js 高斯溅射渲染器已经接好;端到端演示还需要一个训练好的溅射体) - 自助式生产环境变更授权 - 第三方适配器生态系统(第一方参考适配器已存在;广泛的生态系统还在路线图上)
自 2026 年 5 月起成为 NVIDIA Inception 会员。
为什么「仅做推理」不是一种局限
这个运行时不训练模型,不对模型做微调,也不要求你在其内部运行一个模型。你已经拥有的那个模型——无论它是什么、部署在哪里、以何种方式授权——都通过 MCP 从外部连接进来,驱动这个运行时。
这是一个深思熟虑的架构选择。训练和推理是分开的关切点。这个运行时擅长空间物理、确定性状态管理、多用户同步和低延迟渲染。模型实验室擅长推理、生成和语言。MCP 契约就是两者之间的边界。任何一方都不需要去做另一方的工作。
仅做推理也意味着服务端不需要常驻 GPU。计算密集的那一步(溅射体训练)是每次捕获仅需一次的成本。在那之后的一切都只是几何运算和 MCP 查询——运行在与提供 API 服务相同的 Azure Container Apps 实例上。
诚实的总结
这条流水线是:手机视频 → COLMAP → Brush 高斯溅射 → Azure Blob → MCP 运行时 → 任意 LLM。五个步骤中的四个已经上线。第五个(GPU 溅射体训练)已经接好,正在等待额度到位。在浏览器中闭合这个循环的查看器是下一个里程碑。
如果你今天就想试试捕获这一端,PWA 在 rakuai.com/capture-app/。如果你想从 Claude Desktop 通过 MCP 驱动一个场景,指南在 /developers/claude-desktop.html。如果你想了解完整的工具表面,它在 /mcp.html。
扫描它。然后和它对话。