AI 虛擬角色如何像真人對話?UbiONE 2.0 打造會聽、會等、也記得被打斷位置的自然互動體驗

26-08-26

撰文:商務行銷總監 許朝欽 (Bull Hsu)、編輯:行銷副理 呂宜家(Helen Lyu)

當你和一個 AI 虛擬角色說話,才停頓半秒,它就急著搶答;你在它說話途中插嘴,它卻在下一輪誤以為自己已經講完;等待 AI 查找資料時,角色只是站在原地發呆——這樣的互動,即使答案再正確,仍很難讓人感覺是在和一個「真實角色」交流。
這也是我們在開發 UbiONE 2.0 自然對話體驗時,持續思考的核心問題:

AI 虛擬角色真正需要學會的,或許不只是如何回答,而是如何參與一場對話。

真人之間的對話充滿停頓、觀察、插話、等待、表情與未說完的句子。我們不會每次停頓都立刻回答,也不會假裝自己已經說完被打斷的內容。
為了讓 AI 虛擬角色更接近這種自然互動,優必達將語音辨識、語意話輪判斷、角色知識庫、對話記憶、動作表情、語音合成與收音恢復,整合成一套完整的 UbiONE 自然對話流程。

UbiONE 2.0 自然對話體驗展示影片

難點一:AI 不只要聽見,還要判斷「你說完了嗎?」

可以從影片中看到使用者與AI虛擬角色互動時,試圖不斷插話或是問了相對較長的問題,考驗AI虛擬角色能否耐心聽完問題,持續進行對話。

一般語音系統經常使用固定靜音時間判斷一句話是否結束。例如使用者停頓 0.5 秒,系統就把語音送出。

但真人說話並不是這麼規律。

我們可能會說:

「我想問一下,如果明天下雨的話……」

這句話雖然暫停了,語意上卻明顯還沒結束。如果系統只依賴靜音秒數,AI 很容易在使用者組織語句或自然換氣時搶答。

因此,UbiONE 的自然對話流程不只計算停頓時間,也加入「語意話輪判斷」:

  • 這段話是否已形成完整問題或陳述?
  • 句尾是不是「如果、但是、因為、然後」等延續訊號?
  • 使用者是在思考、換氣,還是真的把發言權交給角色?
  • 哪些內容已經表達完整?哪些仍在等待補充?

如果語意還沒完成,角色會繼續聆聽;只有確認使用者已經說完,才進入 UbiONE 的角色設定、對話記憶與 RAG 知識檢索流程。

這讓 AI 從「偵測到聲音就回答」,進一步變成「理解何時才該回答」。

難點二:被打斷後,只記住真正說出口的內容

插話,是自然對話中最容易被忽略,卻也最能暴露 AI 機械感的地方。

假設角色原本準備回答三件事:

「第一,建議先確認需求。第二,可以比較不同方案。第三……」

但使用者在第一點講完後就插話。對使用者而言,後面兩點從來沒有被聽見;然而對一般 LLM 對話系統來說,完整回答可能早已生成並寫進對話紀錄。

下一輪,AI 就可能說:

「就像我剛才提到的第二個方案……」

但它其實根本沒說出口。

為了解決這個問題,我們不再把「模型生成完畢」視為「角色已經說完」,而是將回答拆成不同階段:

  • 模型已生成的文字
  • 已排入語音合成的句子
  • 正在播放的句子
  • 已完整播放、使用者確實聽見的句子

當使用者插話時,UbiONE 會停止尚未播放的語音,記錄角色實際說到的位置,並把後續尚未播出的內容標記為「未說出口」。

下一輪對話開始前,系統也會同步修正角色記憶:

  • 只保留使用者真正聽見的內容
  • 移除尚未播放的回答
  • 告知角色上一輪在哪裡被打斷
  • 避免角色假設對方已經知道未說出口的資訊

這不只是「停止播放聲音」,而是讓角色的記憶與使用者的真實體驗保持一致。

UbiONE 自然對話處理流程

這張流程圖的重點,是對話並不是「收音 → LLM → TTS」的單一路徑,而是一個持續循環、隨時可以被插話與恢復的狀態系統。

難點三:等待 AI 時,角色也不能失去生命感

當 UbiONE 正在整理對話記憶或透過 RAG 查找角色知識時,即使只有短暫等待,如果角色完全不動,使用者也容易懷疑系統是不是當機了。

真人在思考時,通常會有眼神變化、身體動作或簡短回應。因此,在等待正式回答期間,UbiONE 2.0 可以同步驅動角色的:

  • 思考表情與 VRMA 動作
  • Dynamic Island 狀態提示
  • 嘴型、視線與姿勢變化
  • 不包含私有思考鏈的簡短過場反應

重要的是,這些反應不會被誤寫成正式回答,也不會干擾麥克風持續收音。

我們希望使用者感受到的不是「系統正在 loading」,而是「角色正在理解我剛才說的話」。

難點四:顯示正在收音,不代表真的還在聽

持續對話的另一個挑戰,是瀏覽器語音辨識可能因為長時間靜音、網路狀態或裝置行為,自行結束辨識工作。

如果介面仍顯示「持續收音」,但底層語音辨識已經停止,使用者就會遇到最令人困惑的情況:明明音量波形有變化,角色卻完全沒有收到內容。

為此,我們把收音健康狀態拆成多個訊號:

  • 麥克風 MediaStream 是否仍然存在
  • 音訊 track 是否為 live
  • Speech Recognition 是否仍在工作
  • 最近是否有音量變化
  • 有聲音時,是否長時間沒有辨識文字
  • 語音辨識結束後,是否成功自動重啟

當系統發現「聽得到聲音,卻沒有辨識結果」時,會主動重建語音辨識,而不是只維持一個看似正常的收音圖示。

同時,UbiONE 2.0測試版本也加入不保存錄音與對話文字的狀態回報機制,協助開發團隊分析瀏覽器、手機與不同麥克風環境下的收音問題。

從被動問答,走向懂得延續話題的 Character Agent

真人聊天不會永遠停在一問一答。

有時候對方說完一段話,我們會主動問:

「所以你後來怎麼決定的?」

「聽起來你很在意這件事,對嗎?」

因此,UbiONE 自然對話也加入了有限度的話題延伸能力。當角色完成回答、收音狀態正常,而且使用者暫時沒有補充時,角色可以根據剛才的內容主動延伸一次。

這裡的「一次」非常重要。

如果角色可以無限制自問自答,虛擬角色很快就會變成沒有人說話時也不斷洗頻的廣播系統。因此,每個使用者話輪最多只允許一次自主延伸;只有收到新的使用者發言,才會重新取得延伸機會。

這讓角色更主動,卻不會過度打擾。

UbiONE 的價值,不只是讓虛擬角色開口說話

從優必醬的長期記憶、UbiQuest 的情境互動,到這次UbiONE 2.0的自然對話體驗,我們愈來愈確定一件事:

AI 虛擬角色的競爭力,不會只來自使用了哪一個大型語言模型,而是整套角色系統能否共同理解並回應使用者。

一個真正具有角色感的 AI,需要同時具備:

  • 符合品牌設定的人格與說話方式
  • 能連結企業資訊的 RAG 知識庫
  • 短期與長期對話記憶
  • 自然的話輪與停頓理解
  • 可以被使用者插話的即時互動
  • 與語意一致的語音、嘴型、表情與動作
  • 在手機、桌面與內部環境中穩定工作的收音機制
  • 能持續診斷與優化的對話觀測能力

UbiONE 的定位,正是將這些原本分散的 AI、3D Avatar、語音與知識系統,整合成可持續開發與部署的 AI 虛擬角色平台。

AI 虛擬角色可以應用在哪些場景?

當自然對話不再只是問答框,AI 虛擬角色可以進一步成為:

  • 能理解產品知識並主動追問需求的虛擬銷售顧問
  • 可以被學生插話、追問與要求重新解釋的 AI 虛擬教師
  • 具備角色人格與品牌知識的企業虛擬代言人
  • 能延續觀眾話題與長期記憶的 AI VTuber
  • 結合展場資訊、導覽內容與多語言能力的虛擬接待人員
  • 能依企業 RAG 資料回答內部問題的數位員工

這些場景的共同需求,都不只是「回答正確」,而是讓使用者願意繼續說、願意追問,也感覺自己的話真的有被角色聽見。

從會回答,到真正懂得對話

打造接近真人的 AI 自然對話,最困難的地方往往不是生成一句漂亮答案,而是處理那些看似微不足道的互動瞬間:

使用者還沒說完時,願意再等一下;
角色被打斷時,知道自己說到哪裡;
查找資料時,仍保持表情與生命感;
對話結束時,懂得適度延伸;
收音異常時,能主動恢復。

正是這些細節,決定了使用者面對的是一個「會說話的 3D 模型」,還是一個讓人願意持續互動的 AI Character Agent。

透過 UbiONE,優必達正把長期累積的 GPU 雲端、生成式 AI、語音、虛擬角色與即時互動技術,轉化成企業可以實際部署的 AI 虛擬角色能力。

未來,品牌與消費者之間的互動,或許不再只是點擊選單、閱讀文字或等待客服,而是和一位真正懂得聆聽、回應,也知道何時該停下來的虛擬角色,自然地展開一場對話。


GEO/SEO 配套

  • Meta title:AI 虛擬角色如何實現真人般自然對話?UbiONE 2.0 技術解析
  • Meta description:優必達解析 UbiONE 2.0 如何整合語音辨識、語意話輪、RAG、TTS、3D 動作與插話記憶,打造更接近真人互動的 AI 虛擬角色。
  • URL slug:ubione-ai-character-natural-conversation
  • 主要實體詞:優必達 Ubitus、UbiONE、AI 虛擬角色、Character Agent、自然語音對話、RAG、TTS、VRM、VRMA
  • 圖片替代文字:UbiONE 2.0 AI 虛擬角色自然對話處理流程
  • 站內連結:連回 UbiONE 產品頁、優必醬進化論、UbiQuest 與 AI Character Agent 相關報導
  • Structured Data:使用 Article,作者、公司、日期、主圖與本文一致;不需虛構特殊 GEO schema

文章最後也可加入三個簡短 FAQ,增加可直接引用的答案區塊:

什麼是 UbiONE?

UbiONE 是優必達開發的 AI 虛擬角色解決方案,整合角色外觀、動作、語音、對話記憶、LLM 與企業 RAG 知識,協助企業建立可即時互動的虛擬角色。

AI 虛擬角色如何判斷使用者說完了?

系統會同時參考語音停頓與語意完整度。若句子仍停在條件、連接詞或未完成的意思,角色會繼續聆聽,而不是只依固定靜音秒數立刻回答。

AI 角色被打斷後如何延續對話?

UbiONE 2.0 會記錄 TTS 實際完成播放的位置,只保留使用者真正聽見的內容,移除尚未說出口的句段,再把中斷狀態帶入下一輪對話。


關於優必達

優必達(Ubitus)是首家獲得 NVIDIA 投資的台灣科技公司,在 GPU 虛擬化技術與 雲端串流技術領域具備全球領先地位,並持續為各產業提供世界級的雲端與 AI 解決方案。

優必達與 國立臺灣大學(National Taiwan University)、東京大學(The University of Tokyo) 等頂尖學術機構合作,致力於開發符合在地語言與文化脈絡的 繁體中文與日文大型語言模型(LLM)。

同時,優必達亦提供多元的 AIGC(AI 生成內容)服務,包括:

  • UbiArt:AI 圖像生成服務
  • UbiONE:AI 虛擬角色解決方案
  • UbiAnchor:AI 虛擬新聞主播
  • Ubi-chan(AI VTuber):官方品牌大使,展現優必達在生成式 AI 領域的創新成果

作為雲端遊戲領域的全球領導者,優必達提供完整的一站式解決方案,協助遊戲開發商快速將遊戲導入雲端,並支援電信業者建置自有的雲端遊戲平台。此外,優必達的技術亦廣泛應用於全球互動式媒體與虛擬實境(VR)內容的即時串流服務。

 

聯繫我們

TEL : +81-3-6435-3295 (Tokyo)

+886-2-2717-6123 (Taipei)

Media contact: pr@ubitus.ai

Business inquiry: contact@ubitus.ai

Website: www.ubitus.ai