Изображения для ИИ: видимость в мультимодальном поиске
ИИ больше не только читает, он видит. Разбираем, как работает мультимодальный поиск и как alt, имена файлов, контекст и оригинальные изображения дают видимость.
Долгие годы мы воспринимали искусственный интеллект как систему, которая только читает: сканирует слова, разбирает предложения и выдаёт ответ. Но сегодняшние генеративные системы уже не просто читают — они ещё и видят. Они могут взглянуть на фотографию товара, инфографику или снимок экрана и понять, что на них изображено: объект, сцену, цвета и даже текст, написанный поверх картинки. Это вход в новый мир, который называют "мультимодальным поиском", и для видимости вашего бренда он значит гораздо больше, чем может показаться.
Проблема в том, что большинство сайтов малого бизнеса по-прежнему готовят изображения только для человеческого глаза: красивые фотографии, которые ничего не сообщают машине, бессмысленные имена файлов, пустой атрибут alt. Когда ИИ не может "прочитать" изображение, он его игнорирует — и оставляет вас за пределами ответа. В этой статье мы шаг за шагом разбираем, как устроен мультимодальный поиск, как ИИ понимает изображение и как подготовить визуальные материалы бренда и для людей, и для машин.
Что такое мультимодальный поиск
Мультимодальный поиск означает, что система ИИ способна одновременно обрабатывать несколько "модальностей" — текст, изображения, а иногда звук и видео — вместе. Раньше для поисковой системы изображение по сути сводилось к тексту вокруг него: движок читал не саму фотографию, а лишь имя файла и атрибут alt. Сегодня же такие системы, как Gemini и ChatGPT, могут напрямую смотреть на пиксели изображения и описывать их содержимое.
Практическое следствие очевидно: пользователь больше не только набирает слова. Он может загрузить фотографию и спросить: "что это, где купить, что похожее вы посоветуете?" Или задать вопрос текстом, а система ответит, опираясь и на текстовые, и на визуальные источники. Изображение перестало быть украшением страницы — оно стало частью ответа. Когда ваши визуальные материалы правильно поняты машиной, ваши шансы появиться в этом новом слое ответов растут. Когда нет — даже лучшие фотографии товара превращаются для машины в пустой кадр.
Этот сдвиг идёт в двух направлениях. С одной стороны, люди теперь ищут с помощью изображений: фотографируют товар и спрашивают "что это и где найти похожее?", делятся снимком экрана или наводят камеру на предмет, чтобы узнать, что это. С другой стороны, генеративные системы всё чаще помещают изображения в собираемые ими ответы, поэтому оказаться той картинкой, что показана рядом с ответом, само по себе становится новой формой видимости. В обоих направлениях выигрывают бренды, чьи визуальные материалы машина способна понять.
Как ИИ "понимает" изображение
Современные модели компьютерного зрения превращают фотографию в числовую форму, которая отражает объекты на ней, сцену и связи между ними. Они распознают кожаный кошелёк как кожаный кошелёк, а кофемашину как кофемашину; читают текст на изображении с помощью оптического распознавания символов; оценивают цвет, фактуру и композицию. Иными словами, машина больше не видит "фотографию чего-то" — она видит объект, который может назвать. Качество изображения тоже влияет на это прочтение: чёткий, хорошо освещённый снимок с ясным предметом интерпретируется куда легче, чем перегруженный или размытый кадр.
Но здесь есть важная граница: модель способна понять, что изображено на картинке, однако сама по себе она не знает, что это изображение принадлежит именно вашему бренду. Связывает фотографию с конкретным бизнесом, товаром или сущностью окружающий контекст и согласованные сигналы. Когда машина распознаёт вас как чёткую сущность, ей гораздо легче отнести ваши изображения к правильному владельцу. Именно поэтому стратегию работы с изображениями нельзя отделить от задачи превратить бренд в сущность, понятную машинам: если неясно, кто вы, то неясно и кому принадлежат ваши изображения. Узнаваемые, последовательные визуальные приметы — логотип, упаковка, единый стиль съёмки товара — укрепляют связь, привязывающую изображение к вашему бренду.
Атрибут alt и имена файлов: первые подсказки для машины
Каким бы мощным ни становилось машинное зрение, атрибут alt и имена файлов по-прежнему остаются самыми ясными и прямыми подсказками, которые вы даёте машине. Атрибут alt существует ради доступности — для незрячих посетителей, использующих программы чтения с экрана, — но именно поэтому он описывает изображение простым, наглядным языком и выполняет ту же работу для машин. Хорошо написанный alt становится надёжной опорой, на которую система опирается при интерпретации изображения.
Хороший alt действительно описывает картинку: не "изображение", а "картхолдер ручной работы из коричневой кожи, показан в открытом виде". С именами файлов то же самое: "IMG_export.jpg" не говорит машине ничего, а "korichnevyy-kozhanyy-kartholder.jpg" несёт контекст. Та же логика распространяется на подписи и текст непосредственно вокруг изображения. Несколько надёжных принципов:
- Описывайте, а не набивайте ключевые слова: alt должен быть естественной фразой, а не грудой терминов.
- Делайте имена файлов читаемыми и осмысленными; разделяйте слова дефисами и избегайте пробелов.
- Пишите то, что изображение действительно показывает, чтобы утверждение на странице и картинка подтверждали друг друга.
- Для чисто декоративных изображений, не несущих смысла, оставить alt пустым — вполне допустимый выбор.
- Пишите alt на языке изображения и вашей аудитории; на многоязычном сайте каждая языковая версия заслуживает собственного alt.
Важно, чтобы эти подсказки согласовывались между собой. Когда имя файла, атрибут alt, подпись и окружающий абзац говорят об одном и том же, машина интерпретирует изображение с гораздо большей уверенностью. При этом alt не обязан дословно повторять подпись; они должны дополнять друг друга и указывать на одно и то же утверждение на странице.
Контекст и оригинальность: одного изображения мало
Изображение гораздо сильнее вместе с текстом вокруг него. Интерпретируя фотографию, ИИ смотрит не только на пиксели, но и на то, под каким заголовком она стоит, рядом с каким абзацем расположена и на какой странице находится. Картинка рядом с релевантным, поясняющим текстом понятна куда лучше, чем висящая в пустоте. Иначе говоря, контекст, в который вы помещаете изображение, зачастую так же важен, как и само изображение.
Подпись прямо под изображением — часто самый ценный, но и самый недооценённый сигнал: короткая строка на языке читателя сообщает и людям, и машинам, что это за изображение и почему оно здесь. Не менее важна техническая доступность — до самого файла изображения должно быть можно добраться. Картинку, которая подгружается только после действия, спрятана за блокировкой или отдаётся необычным образом, система нередко вообще не обрабатывает. Изображение разумного размера, в стандартном веб-формате и напрямую доступное, скорее всего и будет прочитано.
Здесь же вступает в игру оригинальность. Стоковые фотографии, которыми пользуются все, не сообщают машине ничего особенного о вашем бренде; если одна и та же картинка встречается на десятках сайтов, она вас не выделяет. А оригинальные визуальные материалы, показывающие ваш собственный товар, вашу команду, ваш процесс и вашу реальную работу, служат сигналом доверия и для людей, и для машин. То, какой бренд ИИ решает процитировать, во многом связано с сигналами авторитетности и доверия, и оригинальное, хорошо оформленное изображение — один из них: оно говорит, что за этим контентом стоит настоящий бизнес.
Изображения товаров и структурированные данные
На коммерческих страницах изображения особенно важны, потому что покупатель редко принимает решение, не увидев товар. Если ИИ собирается включить товар в ответ, он хочет понять, что это, кому он подходит и как выглядит. Здесь на помощь приходят структурированные данные: разметка Product и ImageObject явно связывает изображение с конкретным товаром, его характеристиками и наличием. Машине больше не нужно гадать — связь изложена перед ней прямо и однозначно.
Одна витринная фотография редко отвечает на практические вопросы покупателя. Показать товар с разных ракурсов, в реальном использовании и с ощущением масштаба — значит рассказать и покупателю, и машине гораздо больше. И учтите одно: поскольку ИИ умеет читать текст на изображении, не прячьте важные факты только внутри графики. Такие сведения, как цена, характеристики или условия, должны присутствовать на странице и обычным текстом; изображение должно подкреплять эту информацию, а не заменять её.
К сожалению, многие страницы товаров полны изображений, которые машина не может прочитать, или шаблонных фотографий без всякого контекста. То, почему ИИ пропускает страницу вашего товара, часто связано с изображениями не меньше, чем с текстом. Настоящие фотографии товара, разные ракурсы, сцены использования и поддерживающая их чистая разметка заметно повышают шансы, что ваша страница появится в мультимодальных ответах.
Место изображений в GEO
Оптимизация изображений — не отдельная тактика, а часть большей картины. Генеративная оптимизация (GEO) отвечает на вопрос, называет и цитирует ли ИИ ваш бренд в своих ответах, и изображения становятся всё более весомой составляющей этой видимости. Когда текст, сигналы сущности и визуальные материалы работают вместе, машине проще понять вас и порекомендовать.
Но приносит ли ваша работа результат? Видимостью управляют через измерение, а не через предположения. Вы можете начать измерять уже сегодня, на какие вопросы вы отвечаете, звучит ли ваше имя в ответах и где вырывается вперёд конкурент. Rocketly GEO Suite сегодня измеряет, упоминается и цитируется ли ваш бренд в Google AI Overviews; измерение по нескольким системам, таким как ChatGPT и Perplexity, находится в дорожной карте. Когда ваши изображения рассказывают машине ясную историю, увидеть своё место в этих измерениях становится проще.
Часто задаваемые вопросы
Машинное зрение уже так развито — нужен ли ещё атрибут alt?
Да. Атрибут alt в первую очередь нужен ради доступности, и одного этого уже достаточно. Кроме того, не каждая система обрабатывает пиксели изображения одинаково глубоко; alt, имя файла и окружающий текст — самые надёжные подсказки, которые сообщают машине, что изображено, не оставляя места двусмысленности. Поэтому, даже когда модели зрения становятся сильнее, alt остаётся страховкой, закрепляющей смысл.
Вредят ли стоковые изображения моей видимости в ИИ?
Прямого штрафа нет, но стоковые изображения не выделяют вас среди конкурентов. Когда одна и та же фотография встречается на десятках сайтов, она не сообщает машине ничего уникального о вашем бренде. Оригинальные снимки вашего собственного товара и работы несут более сильный сигнал доверия и подлинности. Когда есть возможность, вложение в оригинальные изображения почти всегда окупается лучше.
Измеряет ли Rocketly, видит ли ИИ мои изображения?
Rocketly GEO Suite не сканирует ваши изображения по одному; на деле он измеряет, упоминает и цитирует ли ИИ ваш бренд по тем вопросам покупателей, которые вы отслеживаете, — сегодня в рамках Google AI Overviews. Изображения — один из входных сигналов, питающих эту видимость; хорошо подготовленные визуальные материалы помогают вам появляться в ответах, а измерение показывает результат этих усилий.