系列: 與 AI 一起學寫程式

為接受 ChatGPT、Claude 與 Gemini 的指揮而生

任何雲端 LLM 透過一個助理服務指揮執行環境。

為接受任何模型的指揮而生 意圖 token 作為控制輸入——在模擬步驟上,每一畫格 ChatGPT Claude Gemini XRAssistantService 與模型無關的意圖協定 執行環境模擬步驟 語音管線 · 視線 · 動作 持續地、在飛行中被執行
不是貼進 AR 裡的聊天機器人——模型的意圖串流是第一級的控制輸入。

「這個產品跑在某一家供應商的模型上」的時代很短。RakuAI 的設計,讓任何模型——ChatGPT、Claude、Gemini,或你的模型——都能即時駕馭一個 AR 體驗。帶最好的模型來。執行環境已經準備好了。

今天大多數整合雲端 LLM 的遊戲引擎,做法都和你預期的一樣。一個模型被拴進編輯器,成為一塊聊天面板。你對著聊天面板打字。面板寫出一些內容或一些程式碼。而對這一切毫不知情的執行環境,稍後才去跑那個產出的東西。

Raku 做的不是這個。Raku 正被打造成把「接受雲端 LLM 的指揮」當成執行環境的事,而不是創作上的便利。這個週末的工作把這一點變得明確。

落地了什麼

這個週末執行環境橫跨一百一十八個 commit。頭條項目:

  • 一個 XRAssistantService,把雲端 LLM 的回應接進語音管線,作為第一級的執行環境功能
  • 眼動追蹤的注視點渲染,含多設定檔效能最佳化
  • 一個 OpenXR XR_EXT_eye_gaze_interaction provider
  • XR 執行環境的手部追蹤與手勢辨識
  • 具 71 關節骨架的全身追蹤
  • 眼動追蹤基礎設施中的凝視偵測與駐留計時器
  • 高解析度透視、深度感測與光照估計
  • 一條 Wi-Fi 7 卸載渲染管線,含主機伺服器與延遲監控
  • 一條用於即時多人 AR 姿態與狀態同步的低延遲差量通道
  • Android XR 的次毫米錨點服務
  • 為沒有 Android XR 堆疊的 Android 裝置準備的 ARCore 感測器橋
  • 一個多層 HUD 合成器與疊加 API
  • 用於場景理解的 AR Surface Demo 與 Room Visualizer 範例

其中有幾個是值得一談的頭條。Wi-Fi 7 卸載渲染管線是一個。XRAssistantService 是另一個。兩者都是合作夥伴形狀的工程。

XRAssistantService,以及它真正的用途

XRAssistantService 是我們至今出貨過最乾淨的一塊「引夥伴上鉤」的工程。它的形狀是:

執行環境有一條語音管線。使用者說話。語音轉文字在裝置本地以低延遲運行。文字串流進助理服務。助理服務把文字交給雲端 LLM。雲端 LLM 串流回代表意圖的 token:根據使用者說的話,AR 體驗接下來該做什麼。執行環境解析那條串流,在飛行中把它變成執行環境的動作。回應的文字轉語音也是串流的。

我想讓開發者和實驗室注意的一點是,LLM 不是每個使用者回合被呼叫一次。語音管線可以在一個回合進行中持續把 token 串流給模型(在後端支援得當的情況下),而模型可以持續產出讓執行環境連續執行的意圖。這才是「把接受雲端 LLM 的指揮當成執行環境的事」的真正含義。它不是貼進 AR 體驗裡的聊天機器人。它是執行環境把模型的意圖串流,當作和使用者視線同等優先級的控制輸入。

這個介面在設計上與模型無關。ChatGPT 能駕馭它。Claude 能駕馭它。Gemini 能駕馭它。一個裝置端的小模型也能駕馭它。任何能產出符合助理服務協定的意圖 token 串流的東西,都能駕馭它。我們這個週末造的,是任何這樣的模型與執行環境其餘部分之間的整合層。

如果你在其中一家實驗室,而且正在讀這篇:這就是我們想和你談的整合。我們不想要一種特殊的合作關係,讓你的模型成為引擎唯一能對話的模型。我們想要你的模型成為引擎能對話的模型中最好的那一個,因為整合是開放的,而你的模型產出的體驗,會比其他任何人的模型產出的體驗更好。

Wi-Fi 7 卸載渲染管線

這是另一塊合作夥伴形狀的工程。AR 眼鏡有一個熱包絡。熱包絡很小。塞在那個熱包絡裡的運算範圍,比某些體驗想渲染的東西更小。傳統的答案是在體驗上妥協。Wi-Fi 7 的答案,是把畫格的一部分放在一台有線連接的運算盒上渲染(一支手機、一個腰包、同一個房間裡的一台桌機),然後把結果串流過來。

這個週末,卸載渲染管線端對端落地了。主機伺服器可以跑在任何地方。眼鏡上的執行環境透過 Wi-Fi 7 和主機對話。畫格延遲受到監控,當連線閃斷時——它一定會閃斷——執行環境能優雅地降級回本地渲染。

為什麼這對夥伴很重要:這代表硬體夥伴不必把桌機等級的 GPU 塞進眼鏡,也能出貨桌機等級的體驗。運算可以放在運算最便宜的地方。連線才是關鍵。我們正圍繞著連線來打造執行環境。

OpenXR 的鷹架

這個週末有一批 commit 是為了 OpenXR 相容性。XR_EXT_eye_gaze_interaction。手部追蹤。ARKit 和 ARCore 的 provider 模式。OpenXR 在這個程式碼庫裡之所以重要,是因為它正是我們希望這顆引擎能跨硬體夥伴移植的那一層。如果一個硬體夥伴出貨了 OpenXR 相容的執行環境,這顆引擎就能在上面出貨。我們這個月打造的介面,刻意站在標準這一側而不是供應商專屬那一側,因為那正是引擎保持中立的方式。

誠實面對還沒完成的部分

這個週末有幾樣東西是以 WIP 的狀態落地的。手部追蹤的 PR 尤其還沒接完。有一個 PoseStabilizer 連結錯誤,我們正在後續 PR 修。眼動追蹤有了凝視偵測,但駐留計時器與應用層的整合還沒完成。全身追蹤進來了,但手勢辨識的部分還需要更多範例。

我想把這件事說清楚,因為代理驅動開發工作的模式,就是同一週會落地很多 WIP,而 WIP 會在 PR 標題裡被明確標出。如果你讀這個週末的 commit 紀錄、在幾個地方看到「[WIP]」,那是刻意的。完整的交付物會在接下來兩週內成形。

我希望合作夥伴與開發者從中看到什麼

如果你是正在打造下一個重量級模型的 AI 實驗室,而且你在意一個把你模型的輸出當成模擬步驟上的控制輸入的 AR 執行環境,來找我談。XRAssistantService 整合層將於 2025 年 11 月在這顆引擎中出貨,並在年底前成為一個可以接入的穩定介面。

如果你是正在打造內建 Wi-Fi 7、且有外部運算故事的 AR 眼鏡的硬體夥伴,卸載渲染管線正是你的硬體為之而生的工作負載。執行環境已經為它準備好了。

如果你是正在想這顆引擎能讓你打造哪些體驗的開發者,答案已經開始在 commit 紀錄裡浮現。能在使用者話說到一半就回應的語音驅動 AR 體驗,是做得到的。帶次毫米錨定的即時多人 AR,是做得到的。兩者所需的運算,住在眼鏡上或住在有線那頭,取決於你的體驗需要什麼。

一百一十八個 commit,盛大的週末。週日晚上的引擎,和週六打開筆電時的引擎,已經不一樣了。

你的模型屬於模擬步驟

RakuAI 的 XRAssistantService 是一個與模型無關的介面,把意圖串流進一個活生生的 AR 體驗。如果你打造前沿模型,這就是我們想和你談的整合。

← 所有文章