重要ポイント

  • 発表: Googleは2026年9月24日、Gemini 3.8 Live with Live Avatarを発表し、米国および欧州連合のGemini Enterprise顧客向けに一般提供を開始した。
  • 技術: ほぼリアルタイムの映像生成によるアニメーションアバターで、97言語に対応したリップシンクを実現し、文の途中での言語切り替えやバックグラウンドでの非同期ツール実行が可能。
  • 導入状況: 既に稼働している初期顧客にはCox Automotive、Equal AI、Salesforceがあり、GoogleはHeyGen、OpenAI、Anthropicなどの競合を追う市場に参入した。

ネイティブなマルチモーダル対話

Googleはほぼリアルタイムの映像生成と、自社のネイティブ音声対話モデルを組み合わせた。アバターは視覚入力と音声入力を同時に処理し、カメラや画面共有を通じてユーザーが見せるものを理解し、表情、リップシンク、滑らかな会話の切り替えで応答する。これは音声合成に映像を重ねたものではなく、その場で生成される視覚的な存在そのものだ。

この機能はGemini Enterpriseの顧客向けに提供され、米国と欧州連合にエンドポイントを持ち、専用スループットと企業向けコンプライアンスを備えている。



Google、企業向けGemini 3.8 Live Avata... - Foto 1

97言語、途切れなし

Live Avatarは97言語に対応し、同一の会話の中で言語を切り替えても映像の忠実度が損なわれたり視覚的なずれが生じたりしない。The Vergeによると、あるデモ映像ではアバターが英語と日本語を話し、口の動きが両方の言語に正確に同期していたという。グローバル企業にとっては、すべての市場で単一の視覚的エージェントを使えることを意味し、手動での切り替えなしに言語を自動検出する。

話しながら作業する

アバターはシステムコールを起動し、データを検証し、会話を途切れさせることなくバックグラウンドで複雑なタスクを完了できる。Googleのデモでは、アバターがホテルの宿泊客とチェックインの会話をしながら、裏側でシステム処理が並行して進む様子が示された。別のデモでは、保険担当のエージェントが顧客のカメラで映し出された損害を分析する間、Agent Development Kitで構築されたエージェントチームが保険契約を確認し、保険金請求書類を準備していた。



Google、企業向けGemini 3.8 Live Avata... - Foto 2

開発者はGoogleのAgent Development Kitを通じてこれらの機能を統合でき、従来の音声認識(speech-to-text)システムを経由せずに、メモリと音声ストリーミングを定義できる。

ブランドに合わせた顔

組織はプリセットのアバターライブラリから選択するか、参照画像をもとにカスタムアバターを生成し、類似性、ブランドスタイル、キャラクターのアイデンティティを保持できる。カスタムアバターの作成には企業向けの許可リストを通じたアクセスが必要で、これはGoogleが意図的に設けたフィルターだ。

信頼性の問題:SynthIDと保護策

Googleは、身元を尊重しAI生成コンテンツの透明性を保つための保護策を導入したと述べており、生成されたすべての音声・映像ストリームには目に見えないSynthIDの電子透かしが刻まれている。

既に活用を始めている企業

Cox Automotiveは、Autotrader上でリアルタイムに車両の検索と比較を案内するショッピングアシスタントを構築した。Equal AIはインドの9言語で1日100万件以上のライブ通話を処理しており、割り込み処理や多言語会話における改善が報告されている。SalesforceはAgentforceにGemini 3.8 Liveの機能を統合しつつある。



Google、企業向けGemini 3.8 Live Avata... - Foto 3

他のすべての人にとって何が変わるのか

Live Avatarの各バリアントは、数時間ではなく数分程度の連続的なやり取りしか維持できず、現時点ではこの機能は企業向けに限定されている。今回の発表は、Gemini 3.5 Proの遅延やOpenAI、Anthropicによる競合製品の発表が報じられる中、Googleにとって微妙なタイミングで行われた。Live Avatarは、HeyGenのようなスタートアップに対抗するGoogleの立ち位置を示すものであり、アバターが別製品ではなくモデルのランタイムに直接統合されている点が優位性となっている。