Визуальный поисковый сервис Google Lens, интегрированный в экосистему Google Gemini, пережил грандиозную технологическую эволюцию, превратившись из простого сканера статичных фотографий в полноценного мультимодального видеоассистента реального времени.

Благодаря внедрению новейших моделей компьютерного зрения и языковых трансформеров сервис теперь способен понимать динамический видеоряд и отвечать на голосовые вопросы пользователя о том, что происходит в объективе камеры.

В этой статье мы подробно разберем новые возможности Google Lens, механизм мультимодального поиска и то, как эти функции меняют опыт онлайн-покупок и решения повседневных задач.

Видеопоиск в реальном времени

До недавнего времени возможности Google Lens ограничивались статичными снимками: пользователи фотографировали вывески для перевода, определяли породы собак, виды комнатных растений или достопримечательности.

Новейшее обновление, представленное на конференции Google I/O и запущенное осенью 2024 года, позволяет записывать короткое видео непосредственно в приложении Lens и одновременно задавать вопрос голосом.

Например, если у вас барахлит двигатель газонокосилки или на листьях комнатного растения появились странные пятна, вам больше не нужно мучительно подбирать слова для поисковой строки. Достаточно навести камеру, нажать кнопку записи и спросить: «Почему листья пожелтели и как их вылечить?».

Искусственный интеллект Google Gemini в реальном времени проанализирует видеопоток, распознает объект в движении и выдаст исчерпывающий ответ в формате AI Overview.

Мультимодальность: синтез видео, звука и текста

Ключевой технологический прорыв заключается в бесшовном объединении трех модальностей: — Видеокадры: фиксация динамики, ракурсов и контекста окружения. — Голос: понимание смыслового акцента вопроса с учетом разговорных оборотов. — Генеративный синтез знаний: формирование структурированной выжимки из миллиардов веб-страниц поискового индекса.

Такой подход устраняет необходимость в многократных уточняющих запросах. Вместо попыток описать загадочный значок на приборной панели автомобиля вы просто показываете его камере — и нейросеть сразу объясняет причину индикации и алгоритм действий.

Эволюция товарного поиска: Shopping Graph

Google Lens стал мощнейшим драйвером электронной коммерции благодаря глубокой интеграции с базой данных Shopping Graph:

  • Мгновенное распознавание товаров: наведя камеру на прохожего в стильном пальто или на журнальный столик в кафе, вы моментально получаете карточки товаров с актуальными ценами, отзывами покупателей и прямыми ссылками на интернет-магазины.
  • Уточняющий поиск по атрибутам: если вам понравился фасон увиденного дивана, но нужен другой цвет или материал, достаточно добавить голосовую или текстовую команду: «такой же, но синий велюр». Алгоритм отфильтрует предложения магазинов точно под ваши критерии.

Голосовые запросы к статичным изображениям

Помимо видео, существенно обновился и классический поиск по фото: пользователи могут мгновенно прикреплять устный комментарий к сделанному кадру без необходимости печатать на клавиатуре.

Функция особенно удобна на улице, за рулем или во время выполнения бытовых задач, когда руки заняты.

Взгляд в будущее визуального интеллекта

Нововведения в Google Lens — лишь первый шаг к эпохе носимых умных устройств и очков дополненной реальности (AR).

В гонку за визуальное понимание мира активно включились Meta с умными очками Ray-Ban и OpenAI с мультимодальным режимом GPT-4o. Мы находимся в самом начале пути, когда камера смартфона превращается в полноценные «глаза» искусственного интеллекта, помогающие человеку легко ориентироваться в физической реальности.

This post is also available in: Español Français Italiano English