グーグル・ディープマインド、文章・画像・動画・音声を扱うオープン埋め込みモデル「EmbeddingGemma 2」公開

グーグル・ディープマインド、文章・画像・動画・音声を扱うオープン埋め込みモデル「EmbeddingGemma 2」公開

記事の理解を助けるための画像

グーグルがマルチモーダル対応の新たなAIモデルを公開

グーグル・ディープマインドは現地時間10月6日、テキスト、画像、動画、音声を1つのモデルで処理できるオープン埋め込みモデル「EmbeddingGemma 2」を公開した。AIシステムが異なる種類の情報を同じ形式のデータとして扱えるようにする技術で、検索や情報整理などへの活用が想定される。

公開されたマルチモーダル版のパラメータ数は7億4000万(740M)。モデルの重みは「Hugging Face」と「Kaggle」でApache 2.0ライセンスのもと無償提供される。Apache 2.0は商用利用も認められるオープンソース向けライセンスで、開発者は「google/embeddinggemma-2」のモデルIDから利用できる。

グーグルは、EmbeddingGemma 2を最初からマルチモーダル対応で設計されたオープン埋め込みモデルの中で高い性能を持つモデルとして紹介した。今後は「Gemini Enterprise Agent Platform」のModel Gardenでも利用可能にする予定だとしている。

スマートフォンなど端末内での利用も想定

EmbeddingGemma 2は、大規模なクラウド処理だけでなく、端末内で動作させる用途も意識した設計となっている。

モデルはテキスト処理部分270M、画像を処理するビジョンエンコーダー170M、音声処理用オーディオエンコーダー300Mで構成される。テキスト専用の270Mモデルも別途用意された。文脈処理能力は8000トークン、出力ベクトルは768次元で、必要に応じて512、256、128次元へ縮小できる。

グーグルは量子化技術を適用した場合のメモリー使用量も公開した。Google Pixel 11 Pro上では、テキスト処理のみで約191MB、マルチモーダル機能を利用すると約567MBのメモリーを使用するとしている。

また、EmbeddingGemma 2を活用し、インターネット接続なしで動作するMac向け会議録アプリも登場した。このアプリでは、複数のアプリから取得した会議記録や対面会議の内容を端末内で整理できるという。

前モデル比でコード分野などの性能向上を強調

グーグルが公開した性能比較では、前世代モデル「EmbeddingGemma 1」との比較結果を示した。

AIモデル評価指標の一つであるMTEB Code(NDCG@10)では、EmbeddingGemma 2が78.68点となり、EmbeddingGemma 1の68.76点から9.92ポイント向上した。一方、多言語テキスト性能を測るMTEB multilingualのMean(Task)スコアは61.36点で、前モデルの61.15点との差は小さかった。

このほか、画像分野のMIEB(lite)、動画分野のMMEB v2 Video、音声検索分野のMSEB Retrievalでも数値を公開した。ただし、これらの項目については前モデルや他社モデルとの比較データは示されていない。

低次元化や利用時の制限も提示

グーグルはEmbeddingGemma 2の利用にあたり、ベクトルの圧縮による性能低下にも注意を促している。

128次元まで縮小した場合、テキストやコード処理では元の性能の約90%を維持する一方、画像・動画・音声検索では約75%まで低下する可能性があるという。グーグルは、マルチモーダル検索で128次元を利用する場合は実際のデータで事前検証するよう推奨している。256次元では品質低下はほとんどないとしている。

また、音声処理は1回あたり約5.5分までに制限されるほか、テキスト処理では推奨される作業用接頭語を使用しない場合、埋め込み品質が低下する可能性がある。対応言語についても、100以上の言語で同じ性能を保証するものではないと説明している。

グーグルは、実社会の大規模データで学習したモデルには社会的・文化的な偏りが反映される可能性がある点もモデルカードで示し、利用時の確認を求めている。

Source: Original Korean article - Trendy News Korea

コメント