Чтобы выигрывать в визуальном и мультимодальном поиске, сочетайте качественные изображения с описательными именами файлов, alt-текстами, структурированными данными ImageObject и VideoObject и контекстом, называющим изображённое. AI сопоставляет пиксели с текстом, поэтому чётко подписанные изображения попадают в ответы.
Поиск уже давно перестал быть чисто текстовым. Люди наводят камеру на товар, бросают скриншот в чат или просят AI сравнить два фото. Если ваши изображения и видео не созданы так, чтобы их понимали машины, вы невидимы в этой быстрорастущей части поиска.
Что такое мультимодальный поиск на самом деле
Мультимодальный поиск означает, что запрос и ответ могут одновременно охватывать текст, изображения, видео и аудио. Google Lens позволяет искать камерой. Google AI Mode и AI Overviews читают загруженное изображение и отвечают на вопросы о нём. ChatGPT и Perplexity принимают скриншоты и фото и рассуждают над ними. Под капотом современные модели превращают пиксели и текст в общее представление, а затем сопоставляют визуальный запрос со всем, что проиндексировано.
Вывод для нас прямой: изображение больше не украшение. Это объект, по которому можно искать. Задача — сделать так, чтобы машина поняла, что показывает ваш визуал и почему это правильный ответ.
Изменение поведения реально. Вместо того чтобы набирать слова, люди наводят камеру или вставляют картинку и спрашивают «что это?» или «где купить дешевле?». Тот, кто оптимизирует только под текстовые ключи, полностью пропускает эти запросы, потому что в них нет слов, пока их не добавит сама модель.
Оптимизируйте изображения под AI и Google Lens
Lens и AI-модели распознают изображение, сочетая пиксели со всеми текстовыми сигналами вокруг. Дайте им сильные и согласованные сигналы.
- Используйте оригинальные изображения высокого разрешения. Чёткий, хорошо освещённый, незахламлённый визуал легче классифицировать. Стоковые фото, которыми пользуются все, — слабый отличительный сигнал.
- Называйте файлы описательно.
matovaya-chernaya-kofemashina.jpgлучше, чемIMG_4471.jpg. Имя файла — реальный сигнал. - Отдавайте современные форматы и правильные размеры. WebP или AVIF, адаптивный
srcsetи корректные размеры держат изображение быстрым и полностью отрисованным, чтобы его проиндексировали. - Размещайте изображение рядом с релевантным текстом. Модели сильно опираются на окружающий текст, подпись и ближайший заголовок, чтобы решить, что изображено. Картинка, затерянная в галерее без контекста, трудно интерпретируется.
- Держите объект однозначным. Один чёткий объект на изображение лучше захламлённого коллажа, когда вы хотите, чтобы его распознали и сопоставили.
- Показывайте товар в нескольких ракурсах. Фронтальное фото, деталь и изображение в использовании дают модели больше точек для сопоставления с разными запросами пользователей.
Особенно для товарного и how-to контента именно здесь выигрывается трафик из Lens. Кто-то фотографирует предмет; Lens пытается его сопоставить; выигрывает страница с лучшими подписями и контекстом.
Alt-тексты и подписи по-прежнему весомы
Alt-текст не потерял актуальности в эпоху AI. Он её приобрёл. Alt-текст — это главное, читаемое машиной описание того, что показывает изображение, и мультимодальные системы используют его как надёжную метку для сопоставления с запросами. Это также требование доступности.
Пишите его хорошо:
- Описывайте содержание и назначение, а не ключевые слова. «Бариста наливает латте-арт в белую чашку» — полезно; «кофе кофе эспрессо лучший кофе» — спам.
- Будьте конкретны и лаконичны. Одно точное предложение лучше расплывчатой фразы или кучи ключей.
- Используйте подписи для контекста, обращённого к человеку, который усиливает alt-текст. Подписи читают чаще основного текста и дают моделям ещё один согласованный сигнал.
- Не набивайте и не дублируйте. Одинаковый alt-текст на многих изображениях говорит модели, что ваша разметка ненадёжна.
Структурированные данные для изображений и видео
Структурированные данные — это способ передать системам явное, однозначное описание вашего медиа.
- ImageObject позволяет объявить URL изображения, подпись, автора, лицензию и содержание. Он поддерживает лицензионные значки и помогает AI доверять изображению и атрибутировать его.
- VideoObject незаменим для видео. Добавьте
name,description,thumbnailUrl,uploadDate,durationи ссылку на транскрипт илиcaption. Именно это делает видео пригодным для видеорезультатов и цитирования в AI-ответах. - Держите схему и видимый контент согласованными. Если разметка описывает то, чего нет на странице, вы подрываете доверие, а не строите его.
Структурированные данные не спасут плохое изображение, но превращают хорошее и удачно размещённое изображение в такое, которое система уверенно поймёт и покажет.
Не забывайте про видео
Видео — самый недооптимизированный мультимодальный актив, который я вижу. AI-ответы всё чаще вытягивают клипы и моменты, а не только целые видео.
- Добавляйте полные транскрипты. Транскрипт превращает видео в текст, который модель может прочитать, сопоставить и процитировать. Это самый действенный шаг видео-SEO.
- Давайте разделы и таймкоды. Чёткие сегменты помогают системам показать именно тот момент, который отвечает на запрос.
- Пишите настоящие заголовки и описания. Относитесь к ним как к title страницы, прямо называя тему.
- Размещайте с обходимым плеером и
VideoObject. Если бот не видит, что видео существует, он не сможет его ранжировать. - Добавляйте обзорную миниатюру и краткое резюме в тексте рядом. Это даёт модели текстовую опору даже тогда, когда она не «смотрит» само видео, и повышает шанс, что из него возьмут цитату.
Заслужите место в мультимодальных ответах
Соберём всё вместе: попадание в мультимодальный AI-ответ имеет свой шаблон.
- Сделайте визуал узнаваемым. Качественное изображение, описательное имя файла, точный alt-текст.
- Оберните его согласованным контекстом. Подпись, ближайший заголовок и текст, которые называют объект и отвечают на вероятный вопрос.
- Объявите его структурированными данными. ImageObject или VideoObject, чтобы система уверенно разобрала ваше медиа.
- Отвечайте на вопрос, который подразумевает визуал. Если на фото товар, страница должна указать, что это, что оно делает и для кого, в предложениях, которые легко извлечь.
- Держите это быстрым и обходимым. Отрисовка и индексация — входные ворота; изображение, которое бот не может получить, не процитируют.
Главный вывод
Относитесь к каждому изображению и видео как к ответу, по которому ищут, а не как к украшению страницы. Сочетайте сильный оригинальный визуал с точным alt-текстом, согласованными подписями и контекстом и разметкой ImageObject или VideoObject. Делайте это последовательно — и вы станете кандидатом на результаты Lens и мультимодальные AI-ответы, пока большинство сайтов до сих пор выкладывают безымянные JPG.
FAQ
Как оптимизировать изображения под Google Lens и AI-поиск?
Используйте чёткие оригинальные изображения с описательными именами файлов и alt-текстами, размещайте каждое рядом с поясняющим текстом и добавляйте структурированные данные ImageObject. Lens и AI сопоставляют визуал с текстом, поэтому ясная подпись делает изображение узнаваемым.
Важен ли alt-текст для AI-визуального поиска?
Да, больше чем когда-либо. Alt-текст — главный текстовый сигнал, который сообщает AI, что изображено, улучшает доступность и даёт мультимодальным моделям надёжное описание для сопоставления с запросом.
Какие структурированные данные помогают в мультимодальном и видеопоиске?
Используйте ImageObject для изображений и VideoObject для видео с подписями, миниатюрами, длительностью и транскриптами. Эти данные помогают системам понимать, индексировать и показывать ваш визуальный контент в расширенных и AI-результатах.
Нечастые заметки про SEO и GEO. Без спама.