Googleは2026年10月6日、文章や画像、音声などを検索に使えるAIモデル「EmbeddingGemma 2」を公開しました。Googleによると、音声メモから動画を探すなど、異なる種類の情報を端末内で検索する仕組みに利用できます。
文章と音声、画像を同じ仕組みで探す
EmbeddingGemma 2は、Gemma 4を基盤とする「埋め込みモデル」です。埋め込みとは、情報の特徴を数値に置き換え、内容の近さを比べられるようにする仕組みです。Googleによると、テキスト・コード・画像・動画・音声を共通の仕組みで扱えます。文章を手がかりに音声録音を検索することもできます。
モデルの規模を表すパラメーター数は7億4000万です。テキストだけの構成は2億7000万で、画像や音声を処理する部分は必要に応じて追加できます。モデルのデータはHugging FaceとKaggleで配布されています。
日本での提供状況、提供時期、日本語対応、日本向けの料金は、発表には書かれていません。
暮らしと仕事への影響
注目点は、通信せずに端末内で完結する検索や情報取得に使えることです。外部へ送らずに手元の情報を探す仕組みを作りたい場合、検討の対象になります。ただし、今回公開されたのは開発に使うモデルです。スマホの検索機能が一斉に変わるという発表ではありません。
Googleによると、検索用の数値データを短縮し、端末内のデータベースの保存量やメモリ使用量を最大6分の1にできます。導入を考える側は、検索したい情報の種類に合わせて構成を選び、使う端末で必要なメモリを確認することが大切です。
関西の暮らしと仕事での使いどころ
例えば、店の商品写真や説明動画を、接客中に思いついた言葉で探す仕組みが考えられます。家庭では、音声メモを手がかりに、保存した動画を見つける使い方も候補になります。これは活用例であり、関西の店舗や家庭への導入が発表されたわけではありません。
検討する際は、まず探したいものが文章だけなのか、画像や音声も含むのかを整理するとよさそうです。公開されたモデルと、すぐ使えるアプリは分けて見ときたいですね。