
記事の理解を助けるための画像
Googleがリアルタイム対話AIの新機能を発表
Googleは9月24日(現地時間)、音声と映像をリアルタイムで処理するAI機能「Gemini 3.8 Live with Live Avatar」を公開した。多言語の音声同期に対応し、97言語をサポートするとしている。
また、AIが生成したコンテンツには識別用のSynthIDウォーターマークを適用すると発表した。
企業向けサービスとして提供開始
新機能はGoogleの企業向けサービス「Gemini Enterprise」で利用できる。Google Cloudによると、9月25日から米国と欧州連合(EU)地域のエンドポイントで、Gemini EnterpriseコンソールおよびGemini Live APIを通じて提供される。
プロビジョニング処理量のオプションにも対応する。一方、Live Avatar向けのカスタムアバター作成機能は、現在、企業向けの許可リストに含まれる顧客に限定して提供されている。
料金や性能評価では複数の指標が示される
Google Cloudは発表時点で具体的な料金を公開しておらず、Gemini EnterpriseやAgent Platformの料金ページを案内している。DataCampが示した情報では、100万トークンあたりの料金は音声入力3ドル、音声出力12ドル、テキスト入力0.75ドル、テキスト出力4.50ドルとされている。
性能面では、Google自身の発表ページにベンチマークや競合モデルとの比較数値は掲載されていない。独立評価機関Artificial Analysisの指標では、Gemini 3.8 Live Extended Thinkingや標準版について、音声対話性能やタスク成功率など複数の評価結果が公開されている。
ただし、評価結果は指標や調査元によって差があり、特定分野では他社モデルが上回るデータも示されている。
AIの課題も残る
DataCampはGemini 3.8 Liveシリーズについて、依然として誤情報生成(ハルシネーション)の可能性があり、脱獄攻撃への耐性改善や速度低下、タイムアウトへの対応が必要だと指摘している。
リアルタイム音声・映像を扱うAI技術は、企業の顧客対応やサービス提供への活用が期待される一方、精度や安全性の向上が引き続き重要な課題となっている。
コメント
コメントを投稿