當 2021 年的機器人,裝上 2026 年的 AI 大腦 Ubitus × Kebbi 的 Physical AI 實驗
26-09-03
撰文:商務行銷總監 許朝欽 (Bull Hsu)、編輯:行銷副理 呂宜家(Helen Lyu)
一台已經服役多年的服務型機器人,到了生成式 AI 的時代,還有沒有新的可能?
當大家談到 AI 機器人時,注意力往往集中在更新的晶片、更強的算力,或全新設計的人形機器人。但在展場、校園、商場與服務場域裡,其實已經存在大量具備螢幕、麥克風、喇叭、相機與可動關節的機器人,只是受限於當年的軟硬體設計,通常只能執行固定指令、播放預錄內容,或沿著預先設定好的流程互動。
所以我們想做一個很單純的實驗:
如果不換掉身體,只接上新的 AI 大腦,會發生什麼事?
這次,我們以 Kebbi Air H201 為基礎,保留原有的感測、顯示、聲音與肢體能力,不更換主機板,也不把大型模型塞進機身,而是透過一個輕量 Android App,把即時語音辨識、LLM 對話、語音合成與機器人動作控制串接起來。
結果不只是「它會回答問題了」。同一台機器人開始可以看見有人靠近、主動打招呼、理解自然語句、進行多輪對話,也能在回答時同步顯示字幕、眨眼、對嘴、揮手或跳舞;當使用者再次開口或觸碰螢幕,它也能停止原本的回答,回到聆聽狀態。它的身體沒有變,但它與人的互動方式已經完全不同。
從固定指令,到真正理解人的意圖
傳統語音機器人最常見的限制,是使用者必須「配合機器」。例如要說特定關鍵字、固定句型,或依照預設步驟操作。一旦說法改變、句子停頓、現場有噪音,互動就很容易失敗。
新的 AI 互動方式則相反。使用者不需要背誦指令,而是直接用自然語言表達需求。系統持續接收語音辨識結果,判斷使用者是否說完、是否正在呼叫角色,並保留前後文讓後續追問可以延續。為了減少誤觸發,也能設定只有聽到指定角色名稱時才進入回應。
更重要的是,對話不再是機器人單方面把一段內容播完。當使用者中途再次開口,或觸碰螢幕時,系統會停止目前的語音與動作,重新回到聆聽狀態。這種「可以被打斷」的能力,看起來只是小功能,實際上卻決定了人會不會把它當成真正的互動對象。
從這一刻開始,機器人不再只是執行預先寫好的 command,而是在嘗試理解:
人真正想要它做什麼。
從 AI 回答,到 Physical Action
如果只是把 Chatbot 搬到機器人螢幕上,其實還沒有真正發揮「機器人有身體」這件事的價值。因此,我們讓 LLM 不只生成文字回答,也能提出對應的表演意圖。
例如說「很高興見到你」時同步揮手;介紹左右方向時,舉起對應的手;談到開心的內容時,也能搭配合適的表情與動作。所有動作都必須先經過 App 端的安全白名單,再交由機器人 SDK 執行。這裡開始出現一個很重要的差異。
Generative AI 的典型輸出是:Text / Image / Audio
AI 進入 Physical World,輸出開始變成:Speech / Expression / Motion / Device Action
也就是說,真正的核心不再只是「AI 生成了什麼內容」,而是:
AI 是否能把人的意圖轉換成可執行的實體行為。
可以把這個過程簡化成:
Human Intent → Perception → Reasoning → Action Planning → Physical Action → Feedback
這就是我們在這次 Kebbi 實驗裡真正想探索的最小 Physical AI loop。
身體和大腦,不一定要一起老化
這次架構採用的是「薄 App + AI Gateway + Robot SDK」。Kebbi 本身繼續負責它擅長的事情:收音、播放聲音、顯示表情與執行肢體動作;較吃運算資源的 STT、LLM 與 TTS,則交由外部 AI 服務處理。
其中比較重要的是,Android App 並不直接綁定單一模型或單一雲端服務,而是透過標準化介面連接 AI Gateway。未來如果要替換語音辨識模型、LLM 或聲音模型,不需要重新改寫整個機器人端。
這帶出另一個我們認為很重要的概念:
The Brain and the Body Can Evolve Separately.
硬體可能使用五年、八年,甚至更久。但 AI 模型可能幾個月就有一次重大進步。如果兩者綁在一起,機器人的智慧程度就會被限制在出廠那一刻;但如果把感測與動作留在 device,把 intelligence 放在一個可以持續升級的 AI layer,硬體生命週期與 AI 生命週期就能被拆開。
這也意味著:
- LLM 可以更換
- STT / TTS 可以升級
- RAG 知識可以持續更新
- Persona 可以重新設定
- 語言與角色可以依市場切換
- 同一套硬體可以服務完全不同的使用情境
目前開發的原型也已經支援繁中與日本展示模式,切換時不只是介面文字改變,而是 STT、LLM prompt、TTS、角色名稱、喚醒方式與前台狀態一起切換。所以真正被延長的,不只是硬體壽命。而是這台設備「可以被重新定義用途」的時間。
真正困難的地方,是 AI 進入現實世界之後
把 STT、LLM、TTS API 各自跑起來並不困難。真正的工程挑戰,是讓它們在一台真實機器人上面,長時間、自然、安全地一起工作。這次開發裡,我們特別感受到三件事。
1. Perception 必須可靠
瀏覽器裡的文字輸入很乾淨,但真實空間不是。距離、方向、現場噪音、不同說話者,以及機器人本身麥克風特性,都會影響語音辨識結果。因此實機端仍需要做收音門檻、底噪校準、增益調整,以及異常恢復。Physical AI 的第一個條件,不是 AI 會不會回答。而是它能不能穩定地感知真實世界。
2. AI 可以提出行動,但執行必須可控
LLM 可以提供創意與 reasoning,但真正控制實體裝置時,不能讓模型直接呼叫任何 SDK 功能。因此所有機器人動作都必須先經過白名單與實機驗證,再由 deterministic control layer 執行。可以把這個原則理解成:
LLM can decide what to do.
Deterministic systems must guarantee how it is safely done.
3. Physical AI 必須永遠能回到正確狀態
真人使用時會打斷、網路可能短暫中斷、麥克風可能失效,語音、字幕、嘴型與動作也可能不同步。因此系統需要 cancellation、state recovery、watchdog 與診斷機制,避免機器人卡在「說一半、動一半」的狀態。原型也因此加入狀態顯示、延遲紀錄、麥克風 watchdog,以及服務停止後恢復官方介面的處理。
這些事情聽起來不像最華麗的 AI 技術,卻往往決定了一個 Physical AI prototype 能不能真正走出實驗室。
下一步,不一定是一台機器人一個 AI
Kebbi 是一個很好的起點,但我們認為更值得探索的方向,是:
One Intelligence Layer, Many Physical Bodies.
未來的 AI 不一定只屬於某一台機器人。同一個 AI Agent 可以理解人的意圖、保存 context、進行 planning,再根據不同任務去使用不同設備。例如一個人說:
「請幫我把某個物品拿過來。」
AI 不一定需要自己有輪子、有手臂。它可以理解需求後:
→ 確認物品
→ 找到可用的 AMR
→ 派發任務
→ 等待機器人回報
→ 確認任務完成
→ 再把結果告訴使用者
到了這個階段,AI 不再只是「某一台 robot 的功能」。它開始變成一個存在於不同 robots、sensors、devices 之上的 Intelligence Layer。

不是所有 Physical AI,都需要從新機器開始
這次 Kebbi 實驗目前仍是一個持續演進中的 prototype。但它讓我們看到另一種 Physical AI 的可能性。未來當企業想導入 AI 時,不一定每一次都要先購買一台全新的智慧機器。很多既有設備其實已經擁有足夠的「身體」:麥克風、螢幕、相機、喇叭、sensor、motor、network。缺少的可能只是:
一個能理解語言、掌握情境、進行 reasoning,並把結果轉換成 device action 的智慧層。
這個概念不只適用於 Kebbi,也可能延伸到既有服務機器人、資訊站、數位看板、AMR,甚至其他具有控制介面的實體設備。原文也已經提出既有設備 AI 延壽、展場、教育、公共空間等延伸場景。
這次,我們沒有打造一台新的機器人。我們只是重新定義了一台舊機器人可以做什麼。Kebbi 的螢幕、麥克風、相機與馬達都沒有改變。改變的是它如何理解人、如何決定回應,以及如何把數位世界中的 AI reasoning 轉換成真實世界的行動。也許這正是 Physical AI 接下來值得探索的一個方向:
未來的智慧,不一定來自更新的身體,
而可能來自一個可以持續進化的大腦。Same body. New intelligence.
關於優必達
優必達(Ubitus)是首家獲得 NVIDIA 投資的台灣科技公司,在 GPU 虛擬化技術與 雲端串流技術領域具備全球領先地位,並持續為各產業提供世界級的雲端與 AI 解決方案。
優必達與 國立臺灣大學(National Taiwan University)、東京大學(The University of Tokyo) 等頂尖學術機構合作,致力於開發符合在地語言與文化脈絡的 繁體中文與日文大型語言模型(LLM)。
同時,優必達亦提供多元的 AIGC(AI 生成內容)服務,包括:
- UbiArt:AI 圖像生成服務
- UbiONE:AI 虛擬角色解決方案
- UbiAnchor:AI 虛擬新聞主播
- Ubi-chan(AI VTuber):官方品牌大使,展現優必達在生成式 AI 領域的創新成果
作為雲端遊戲領域的全球領導者,優必達提供完整的一站式解決方案,協助遊戲開發商快速將遊戲導入雲端,並支援電信業者建置自有的雲端遊戲平台。此外,優必達的技術亦廣泛應用於全球互動式媒體與虛擬實境(VR)內容的即時串流服務。
聯繫我們
TEL : +81-3-6435-3295 (Tokyo)
+886-2-2717-6123 (Taipei)
Media contact: pr@ubitus.ai
Business inquiry: contact@ubitus.ai
Website: www.ubitus.ai