AIバーチャルキャラクターは、どのように人間のように会話できるのか? UbiONE 2.0が実現する、聞き、待ち、中断された位置も記憶する自然なインタラクション体験

26-08-26

Author: Bull, BD & MKT Director | Editor: Helen, Deputy Marketing Manager

AIバーチャルキャラクターに話しかけたとき、わずか0.5秒ほど沈黙しただけで急いで答え始める。キャラクターが話している途中でこちらが割り込むと、次のやり取りでは、すでに最後まで話し終えたかのように誤解している。AIが資料を探している間、キャラクターはただその場でぼんやり立っているだけ。

このようなインタラクションでは、たとえ答えが正しくても、「本物のキャラクター」と交流しているようには感じにくいものです。

これは、私たちが UbiONE 2.0 の自然対話体験を開発する中で、継続的に考えてきた核心的な課題でもあります。

AIバーチャルキャラクターが本当に学ぶべきことは、単に「どう答えるか」ではなく、「どのように会話に参加するか」なのかもしれません。

人間同士の会話には、間、観察、割り込み、待つこと、表情、そして言いかけの言葉が含まれています。私たちは、相手が少し沈黙するたびにすぐ返事をするわけではありません。また、途中で遮られた内容を、すでに話し終えたかのように扱うこともありません。

AIバーチャルキャラクターをこうした自然なインタラクションに近づけるため、ユビタスは音声認識、意味に基づくターンテイキング判断、キャラクター知識ベース、会話記憶、動作・表情、音声合成、そして収音復旧を統合し、UbiONEの自然対話フローとして構築しました。

UbiONE 2.0 自然対話体験デモ動画

動画では、ユーザーがAIバーチャルキャラクターと対話する際に、何度も割り込もうとしたり、比較的長い質問をしたりする様子を見ることができます。これにより、AIバーチャルキャラクターが質問を最後まで辛抱強く聞き、会話を継続できるかを検証しています。

難点1:AIは聞こえるだけでなく、「話し終えたか」を判断する必要がある

一般的な音声システムでは、一文が終わったかどうかを固定された無音時間で判断することがよくあります。たとえば、ユーザーが0.5秒沈黙すると、システムはその音声を処理に送ります。

しかし、人間の話し方はそれほど規則的ではありません。

たとえば、私たちは次のように話すことがあります。

「ちょっと聞きたいのですが、もし明日雨が降った場合……」

この文は一度止まっていますが、意味としては明らかにまだ終わっていません。システムが無音秒数だけに依存すると、ユーザーが言葉を整理している途中や自然に息継ぎをしているときに、AIが簡単に割り込んでしまいます。

そのため、UbiONEの自然対話フローでは、停止時間を計算するだけでなく、意味に基づくターンテイキング判断 を加えています。

  • この発話は、すでに完全な質問または陳述になっているか
  • 文末が「もし」「しかし」「なぜなら」「それから」などの継続を示す表現になっていないか
  • ユーザーは考えているのか、息継ぎをしているのか、それとも本当に発話権をキャラクターに渡したのか
  • どの内容はすでに完全に表現され、どの内容はまだ補足を待っているのか

意味がまだ完了していない場合、キャラクターは聴き続けます。ユーザーが話し終えたと確認できて初めて、UbiONEのキャラクター設定、会話記憶、RAG知識検索フローへ進みます。

これにより、AIは「音声を検知したら答える」段階から、「いつ答えるべきかを理解する」段階へ進化します。

難点2:中断された後は、本当に口に出した内容だけを記憶する

割り込みは、自然な会話の中で見落とされやすい一方で、AIの機械らしさが最も表れやすい部分でもあります。

たとえば、キャラクターが本来3つのポイントを答えようとしていたとします。

「第一に、まず要件を確認することをおすすめします。第二に、複数のプランを比較できます。第三に……」

しかし、ユーザーが第一のポイントを聞いた後で割り込んだとします。ユーザーから見ると、第二、第三のポイントは一度も聞いていません。しかし一般的なLLM対話システムでは、完全な回答がすでに生成され、会話履歴に書き込まれている可能性があります。

次のターンでAIはこう言ってしまうかもしれません。

「先ほど申し上げた二つ目の案のように……」

しかし実際には、それは口に出していません。

この問題を解決するため、私たちは「モデル生成が完了したこと」を「キャラクターが話し終えたこと」とは見なさないようにしました。その代わり、回答を以下の段階に分けています。

  • モデルが生成したテキスト
  • 音声合成に送られた文
  • 現在再生中の文
  • 完全に再生され、ユーザーが実際に聞いた文

ユーザーが割り込んだ場合、UbiONEはまだ再生されていない音声を停止し、キャラクターが実際にどこまで話したかを記録します。そして、まだ再生されていない後続内容を「未発話」としてマークします。

次の会話ターンが始まる前に、システムはキャラクターの記憶も同期して修正します。

  • ユーザーが実際に聞いた内容だけを保持する
  • まだ再生されていない回答を削除する
  • 前のターンでどこで中断されたかをキャラクターに伝える
  • 未発話の情報を相手がすでに知っているとキャラクターが仮定しないようにする

これは単に「音声再生を止める」だけではありません。キャラクターの記憶とユーザーの実際の体験を一致させるための仕組みです。

UbiONE 自然対話処理フロー

このフローチャートのポイントは、会話が「収音 → LLM → TTS」という単一の経路ではないという点です。むしろ、常に循環し、いつでも割り込まれ、復帰できる状態システムなのです。

難点3:AIを待っている間も、キャラクターは生命感を失ってはならない

UbiONEが会話記憶を整理しているときや、RAGを通じてキャラクター知識を検索しているとき、たとえ短い待ち時間であっても、キャラクターがまったく動かなければ、ユーザーはシステムが停止したのではないかと感じやすくなります。

人間は考えているとき、通常、視線の変化、身体の動き、または短い反応を見せます。そのため、正式な回答を待っている間、UbiONE 2.0 ではキャラクターの以下の要素を同時に駆動できます。

  • 思考中の表情とVRMAモーション
  • Dynamic Islandのステータス表示
  • 口形、視線、姿勢の変化
  • 非公開の思考過程を含まない短い橋渡し反応

重要なのは、これらの反応が正式な回答として誤って記録されることがなく、マイクによる継続的な収音も妨げないという点です。

私たちがユーザーに感じてほしいのは、「システムがロード中である」という感覚ではなく、「キャラクターが今の話を理解しようとしている」という感覚です。

難点4:収音中と表示されていても、本当に聞き続けているとは限らない

継続的な会話におけるもう一つの課題は、ブラウザの音声認識が長時間の無音、ネットワーク状態、またはデバイスの挙動によって、自動的に認識処理を終了してしまう場合があることです。

インターフェース上では「継続収音」と表示されているにもかかわらず、内部の音声認識がすでに停止している場合、ユーザーは非常に分かりにくい状況に直面します。音量波形は明らかに変化しているのに、キャラクターはまったく内容を受け取っていないのです。

この問題に対応するため、私たちは収音の健全性を複数の信号に分解しました。

  • マイクのMediaStreamがまだ存在しているか
  • 音声trackがlive状態か
  • Speech Recognitionがまだ動作しているか
  • 直近で音量変化があったか
  • 音声があるにもかかわらず、長時間認識文字が出ていないか
  • 音声認識終了後に、自動再起動が成功したか

システムが「音は聞こえているのに、認識結果が出ていない」と検知した場合、見かけ上正常なマイクアイコンを維持するだけでなく、音声認識を能動的に再構築します。

同時に、UbiONE 2.0のテスト版では、録音や会話テキストを保存しない状態レポート機能も追加しました。これにより、開発チームはブラウザ、スマートフォン、さまざまなマイク環境における収音問題を分析できます。

受け身の質疑応答から、話題を継続できるCharacter Agentへ

人間同士の会話は、常に一問一答にとどまるわけではありません。

相手が話し終えたあと、私たちは自分から次のように尋ねることがあります。

「それで、最終的にどう決めたのですか?」

「それはかなり気にしていることのように聞こえますね?」

そのため、UbiONEの自然対話にも、限定的な話題拡張機能を追加しました。キャラクターが回答を終え、収音状態が正常で、ユーザーが一時的に補足しない場合、キャラクターは直前の内容に基づいて一度だけ自発的に話題を広げることができます。

ここで重要なのは、「一度だけ」という点です。

キャラクターが無制限に自問自答できてしまうと、仮想キャラクターはすぐに、誰も話していないのに発話し続ける放送システムになってしまいます。

そのため、各ユーザーの発話ターンにつき、自律的な話題拡張は最大一回までに制限しています。新しいユーザー発話を受け取ったときにのみ、再び話題を拡張する機会が与えられます。

これにより、キャラクターはより能動的になりながらも、過度に邪魔をしない存在になります。

UbiONEの価値は、仮想キャラクターに話させることだけではない

ユビちゃんの長期記憶、UbiQuestの文脈的インタラクション、そして今回のUbiONE 2.0自然対話体験を通じて、私たちは一つのことをますます確信しています。

AIバーチャルキャラクターの競争力は、どの大規模言語モデルを使っているかだけで決まるものではありません。キャラクターシステム全体が、ユーザーを理解し、応答できるかどうかにかかっています。

本当にキャラクター性を備えたAIには、以下の要素が同時に必要です。

  • ブランド設定に合った人格と話し方
  • 企業情報と連携できるRAG知識ベース
  • 短期および長期の会話記憶
  • 自然なターンテイキングと間の理解
  • ユーザーが割り込めるリアルタイムインタラクション
  • 意味内容と一致した音声、口形、表情、動作
  • スマートフォン、デスクトップ、社内環境で安定して動作する収音機構
  • 継続的に診断・最適化できる対話観測能力

UbiONEの位置づけは、もともと分散していたAI、3D Avatar、音声、知識システムを、継続的に開発・展開できるAIバーチャルキャラクタープラットフォームとして統合することにあります。

AI バーチャルキャラクターはどのような場面で活用できるのか?

自然対話が単なるQ&Aボックスではなくなると、AIバーチャルキャラクターはさらに次のような存在になれます。

  • 製品知識を理解し、顧客ニーズを能動的に聞き出すバーチャル営業コンサルタント
  • 学生が割り込み、追加質問し、再説明を求められるAIバーチャル教師
  • キャラクター人格とブランド知識を備えた企業バーチャルアンバサダー
  • 視聴者の話題と長期記憶を継続できるAI VTuber
  • 展示会情報、案内内容、多言語対応を組み合わせたバーチャル受付担当
  • 企業RAGデータに基づいて社内質問に回答できるデジタル社員

これらの場面に共通するニーズは、単に「正しく答える」ことではありません。ユーザーが話し続けたい、さらに質問したい、自分の言葉が本当にキャラクターに届いていると感じられることです。

回答できる存在から、本当に会話を理解する存在へ

人間に近いAI自然対話を実現するうえで最も難しいのは、美しい回答文を一つ生成することではありません。むしろ、一見小さく見えるインタラクションの瞬間をどう扱うかです。

ユーザーがまだ話し終えていないとき、もう少し待てること。

キャラクターが中断されたとき、自分がどこまで話したかを把握していること。

資料を検索しているときも、表情と生命感を保つこと。

会話が終わるとき、適度に話題を広げられること。

収音異常が起きたとき、能動的に復旧できること。

こうした細部こそが、ユーザーが向き合っている相手が「話せる3Dモデル」なのか、それとも継続的に関わりたいと思える AI Character Agent なのかを決定します。

UbiONEを通じて、ユビタスは長年蓄積してきたGPUクラウド、生成AI、音声、バーチャルキャラクター、リアルタイムインタラクション技術を、企業が実際に導入できるAIバーチャルキャラクター能力へと転換しています。

未来のブランドと消費者のインタラクションは、メニューをクリックすること、文字を読むこと、またはカスタマーサポートを待つことだけではなくなるかもしれません。真に聞き、応答し、いつ立ち止まるべきかを理解するバーチャルキャラクターと、自然に会話を始めるものになるでしょう。


GEO/SEO対応

  • Meta title:AIバーチャルキャラクターはいかに人間のような自然対話を実現するのか?UbiONE 2.0 技術解析
  • Meta description:ユビタスが、UbiONE 2.0における音声認識、意味に基づくターンテイキング、RAG、TTS、3Dモーション、割り込み記憶の統合により、より人間に近いインタラクションを持つAIバーチャルキャラクターをどのように実現しているかを解説します。
  • URL slug:ubione-ai-character-natural-conversation
  • 主要エンティティ語:ユビタス Ubitus、UbiONE、AIバーチャルキャラクター、Character Agent、自然音声対話、RAG、TTS、VRM、VRMA
  • 画像代替テキスト:UbiONE 2.0 AIバーチャルキャラクター自然対話処理フロー
  • 内部リンク:UbiONE製品ページ、ユビちゃん進化論、UbiQuest、AI Character Agent関連レポートへリンク
  • Structured Data:Articleを使用し、著者、会社、日付、メイン画像、本文を一致させます。特殊なGEO schemaを無理に作成する必要はありません。

FAQ

UbiONEとは何ですか?

UbiONEは、ユビタスが開発したAIバーチャルキャラクターソリューションです。キャラクター外観、動作、音声、会話記憶、LLM、企業RAG知識を統合し、企業がリアルタイムに対話できるバーチャルキャラクターを構築できるよう支援します。

AIバーチャルキャラクターは、ユーザーが話し終えたことをどのように判断しますか?

システムは、音声の停止時間と意味の完全性を同時に参照します。文が条件、接続詞、または未完了の意味で終わっている場合、キャラクターは固定された無音秒数だけで即座に答えるのではなく、引き続き聴き続けます。

AIキャラクターは中断された後、どのように会話を継続しますか?

UbiONE 2.0は、TTSが実際に再生を完了した位置を記録し、ユーザーが本当に聞いた内容だけを保持します。まだ口に出していない文節を削除し、中断状態を次の会話ターンへ引き継ぎます。


ユビタスについて

ユビタスは、NVIDIA から出資を受けた台湾初のテクノロジー企業であり、高度なGPU仮想化技術およびクラウドストリーミング技術において、世界的に高い評価を受けており、さまざまな産業分野に向けて、世界水準のクラウドおよび AI ソリューションを提供しています。

また、台湾大学(National Taiwan University)や東京大学(The University of Tokyo) などのトップ大学と連携し、繁体中国語および日本語に対応したローカライズ大規模言語モデル(LLM)の研究・開発を推進しています。

ユビタスは以下を含む多様なAIGC(AI生成コンテンツ)サービス を展開しています。

  • UbiArt:AI画像生成ソリューション
  • UbiONE:AIバーチャルキャラクターソリューション
  • UbiAnchor:AI搭載バーチャルニュースアンカー
  • Ubi-chan(AI VTuber)生成AI技術を体験する公式ブランドアンバサダー

さらに、クラウドゲーム分野のパイオニアとして、ゲームスタジオ向けにクラウド対応を実現するエンドツーエンドのソリューションを提供するとともに、通信事業者による独自クラウドゲーミングサービスの構築を支援しています。同技術は、インタラクティブコンテンツやVRを含むマルチメディア配信にも活用されています。

 

お問い合わせ先

TEL : +81-3-6435-3295 (東京)

+886-2-2717-6123 (台北)

メディアに関するお問い合わせ : pr@ubitus.ai

事業に関するお問い合わせ : contact@ubitus.ai

Webサイト: www.ubitus.ai