← Все новости
Как Google научил крошечную модель понимать текст, картинки, видео и звук: разбираем EmbeddingGemma 2

Как Google научил крошечную модель понимать текст, картинки, видео и звук: разбираем EmbeddingGemma 2

6 октября 2026 года Google DeepMind выпустила EmbeddingGemma 2 — открытую модель эмбеддингов, которая превращает в векторы текст, код, изображения, видео и аудио. Все они попадают в одно общее 768-мерное пространство, поэтому их можно сравнивать между собой, например искать видео по текстовому запросу.Главная особенность модели — размер. По данным Google, на Pixel 11 Pro текстовая часть занимает около 191 МБ оперативной памяти, а полная мультимодальная версия — около 567 МБ. Поэтому такой поиск можно запускать прямо на устройстве, а не отправлять данные на сервер.В этой статье мы разберём, как устроена модель, за счёт чего она такая компактная, как с ней работать и о каких граблях лучше узнать заранее. Читать далее