Большинство привычных AI-сервисов устроено одинаково: пользователь отправляет запрос в облако, где его обрабатывает большая модель, а затем получает готовый ответ. Для ChatGPT, Gemini или генерации изображений такая схема кажется естественной. Но она не обязана быть единственной.

6 октября Google DeepMind представила EmbeddingGemma 2 — компактную открытую модель для работы с текстом, кодом, изображениями, видео и аудио. Она рассчитана в том числе на смартфоны и ноутбуки и может выполнять поиск и сопоставление данных непосредственно на устройстве, без обязательной отправки информации на внешний сервер.

Сам по себе релиз выглядит техническим. Но за ним стоит гораздо более интересная история: часть AI постепенно становится локальной. И это может заметно изменить то, как будут устроены приложения, корпоративные системы и персональные ассистенты.

Это не маленький ChatGPT

EmbeddingGemma 2 не пишет статьи, не поддерживает разговор и не пытается заменить полноценную языковую модель. Её задача — понимать, насколько разные объекты похожи друг на друга по смыслу.

Представим, что на ноутбуке лежат несколько тысяч фотографий и видео. Пользователь вводит: «Найди видео, где человек идёт по берегу моря». Обычный файловый поиск практически бесполезен, если в названии ролика нет этих слов.

Embedding-модель работает иначе. Она превращает запрос и содержимое файлов в математические представления и ищет объекты, которые находятся рядом друг с другом по смыслу.

И самое интересное в новой модели Google — разные типы информации теперь можно поместить в одно общее смысловое пространство. Текстовый запрос можно сопоставить с фотографией, аудиозапись — с фрагментом видео, изображение — с документом. Google приводит, например, сценарий, когда по голосовой заметке можно найти конкретный момент в видео.

Для пользователя это выглядит почти банально: написал, что ищешь, — получил нужный файл. Для приложения внутри происходит довольно серьёзное изменение.

Одна модель вместо нескольких отдельных систем

До сих пор мультимодальный поиск часто приходилось собирать из нескольких компонентов. Видео можно сначала расшифровать, изображение описать текстом, звук пропустить через speech-to-text, а затем уже отправлять всё это в текстовую поисковую систему.

EmbeddingGemma 2 изначально работает с несколькими типами данных. Модель объединяет текст, изображения, видео и аудио в общем 768-мерном embedding-пространстве; код также поддерживается текстовой частью модели.

Это важно не потому, что «мультимодальность» красиво звучит в презентации. Чем меньше промежуточных систем требуется продукту, тем проще сделать AI-функцию быстрой и достаточно компактной для обычного устройства.

740 миллионов параметров — теперь это мало

Полная EmbeddingGemma 2 содержит 740 млн параметров. Ещё несколько лет назад такая цифра выглядела бы огромной. На фоне современных генеративных моделей это уже компактный класс.

Причём архитектура модульная. Для задач только с текстом и кодом можно использовать 270 млн параметров. При необходимости отдельно подключаются визуальный энкодер на 170 млн и аудиоэнкодер на 300 млн. То есть разработчику не обязательно загружать всю модель, если приложению не нужны все типы данных одновременно.

Google приводит и более наглядные цифры. После квантования текстовая конфигурация на Pixel 11 Pro требует примерно 191 МБ активной оперативной памяти, а полный мультимодальный вариант — около 567 МБ. Это уже масштаб не серверной стойки с GPU, а обычного потребительского устройства.

И вот здесь начинается действительно интересная часть.

AI может работать там же, где находятся ваши данные

Когда модель запускается локально, фотографию необязательно сначала загружать куда-то в облако, чтобы понять, что на ней изображено. Необязательно отправлять на внешний сервер аудиозапись, документ или всю коллекцию личных файлов только ради того, чтобы найти один нужный фрагмент.

EmbeddingGemma 2 предназначена в том числе для on-device search, локального RAG, классификации и поиска. Google отдельно подчёркивает возможность строить сценарии, которые полностью работают офлайн.

Для обычного пользователя это может означать более умный поиск по собственной медиатеке. Для бизнеса последствия интереснее.

Компания может иметь тысячи договоров, презентаций, фотографий, инструкций, записей звонков, видео, технических документов и других материалов. Большая часть этих данных сегодня существует в разных системах и фактически не связана между собой.

Смысловой поиск позволяет задать системе человеческий вопрос вместо попытки вспомнить название папки.

Например: «Найди презентацию проекта, где мы использовали деревянный фасад и панорамное остекление». Или: «Покажи фотографии номера с террасой и видом на море». Или: «Найди в записях созвонов момент, где клиент обсуждал перенос запуска на ноябрь».

Это уже совсем другой интерфейс к данным компании.

Локальный AI особенно интересен для корпоративных систем

Последние пару лет AI-автоматизация часто строилась по одной архитектуре: данные компании отправляются большой облачной модели, модель что-то анализирует и возвращает результат.

Такая схема никуда не исчезнет. Большие модели пока намного сильнее в сложных рассуждениях, генерации и многоэтапной работе.

Но далеко не для каждой операции нужен гигантский AI в дата-центре. Найти документ, определить тип файла, сопоставить изображение с запросом, выбрать нужный кусок контекста или маршрутизировать запрос можно небольшой локальной моделью. А уже затем — если задача действительно требует серьёзного рассуждения — передать небольшой релевантный фрагмент более мощной модели.

Получается гибридная архитектура: простая и чувствительная работа выполняется локально, тяжёлая — в облаке.

И, вероятно, именно так будет устроена значительная часть будущих AI-продуктов.

RAG тоже постепенно выходит из дата-центра

Один из самых очевидных сценариев для EmbeddingGemma 2 — Retrieval-Augmented Generation, или RAG.

Если совсем просто, сначала система ищет информацию, относящуюся к вопросу пользователя, а затем генеративная модель формирует ответ уже на основе найденных материалов.

Google предлагает сочетать EmbeddingGemma 2 с генеративными моделями Gemma. Первая модель занимается локальным поиском и retrieval, вторая — рассуждением и формированием ответа. Причём обе могут использоваться в локальном pipeline.

Например, на рабочем ноутбуке может находиться база внутренних документов. Embedding-модель индексирует её и находит несколько действительно нужных фрагментов. Генеративная модель получает не весь архив компании, а только релевантный контекст и отвечает на вопрос.

Это не отменяет облачные решения. Но делает локальных корпоративных ассистентов значительно реальнее.

Для приложений появляется новый слой

Сегодня пользователь в основном воспринимает AI как отдельный интерфейс. Есть ChatGPT. Есть Gemini. Есть Алиса. Чтобы воспользоваться AI, нужно открыть специальный сервис и что-то ему написать.

Локальные модели позволяют двигаться в другую сторону.

AI может вообще не иметь собственного окна. Он просто становится функцией операционной системы или приложения.

Поиск в галерее понимает содержание фотографий. Файловый менеджер ищет документы по смыслу. Монтажная программа находит нужный момент в нескольких часах видео. CRM понимает содержание заметок менеджеров. Корпоративная база ищет одновременно по PDF, фотографиям, аудио и внутренним документам.

Пользователь может даже не знать название модели, которая это делает.

И, возможно, именно это будет признаком зрелости AI: технология перестанет постоянно демонстрировать себя и просто начнёт работать внутри продукта.

Есть ещё одна причина — стоимость

Облачный AI оплачивается вычислениями. Один запрос может стоить совсем немного, но когда AI становится частью интерфейса и совершает тысячи или миллионы фоновых операций, экономика меняется.

Не обязательно отправлять каждую фотографию, каждый поисковый запрос и каждый внутренний документ в облачный API, если часть обработки можно выполнить на уже купленном устройстве пользователя.

Локальное выполнение не бесплатно — оно использует процессор, память и энергию устройства. Но оно меняет саму модель затрат: часть вычислительной нагрузки переносится с серверной инфраструктуры разработчика на клиентское устройство.

Для массовых продуктов это может быть очень существенным преимуществом.

Открытая модель здесь важнее бренда Google

EmbeddingGemma 2 опубликована Google под лицензией Apache 2.0, а веса доступны через Hugging Face и Kaggle. Google также заявляет поддержку распространённых инструментов, включая Transformers, MLX, llama.cpp, Ollama и LM Studio.

Поэтому интересен не только конкретный продукт Google. Модель можно рассматривать как ещё один признак более крупного изменения: мощные AI-компоненты постепенно становятся достаточно маленькими, чтобы разработчики могли встраивать их непосредственно в свои продукты.

Не обязательно строить всё вокруг чужого чат-интерфейса. Можно взять конкретную AI-возможность — например, смысловой поиск — и сделать её незаметной частью собственного приложения.

Облако не исчезает

Было бы слишком просто сделать из этого вывод, что большие дата-центры скоро станут не нужны.

Скорее происходит разделение труда.

Самые тяжёлые модели продолжат жить в облаке и требовать серьёзных вычислительных ресурсов. Там останутся сложные агентные задачи, глубокое рассуждение, большая генерация и работа с огромным контекстом.

А ближе к пользователю будут переезжать функции, которым важны скорость, приватность и постоянная доступность: поиск, retrieval, классификация, обработка персонального контекста и часть мультимодального анализа.

Поэтому EmbeddingGemma 2 интересна не тем, что Google выпустила ещё одну AI-модель.

Она показывает направление, в котором AI становится меньше, локальнее и менее заметным.

Следующий этап развития AI может выглядеть не как ещё один чат на экране. Он может выглядеть как отсутствие необходимости открывать чат вообще.