Um in der visuellen und multimodalen Suche zu gewinnen, kombiniere hochwertige, klar benannte Bilder mit beschreibendem Alt-Text, ImageObject- und VideoObject-Strukturdaten und Kontext, der benennt, was zu sehen ist. AI gleicht Pixel mit Text ab, also werden klar beschriftete Bilder in multimodalen Antworten ausgespielt.
Suche ist schon eine Weile nicht mehr rein textlich. Leute richten die Kamera auf ein Produkt, werfen einen Screenshot in einen Chat oder lassen eine AI zwei Fotos vergleichen. Wenn deine Bilder und Videos nicht so gebaut sind, dass Maschinen sie verstehen, bist du in diesem schnell wachsenden Teil der Suche unsichtbar.
Was multimodale Suche wirklich ist
Multimodale Suche heisst, dass Anfrage und Antwort zugleich Text, Bild, Video und Audio umfassen koennen. Google Lens laesst dich mit der Kamera suchen. Google AI Mode und AI Overviews lesen ein hochgeladenes Bild und beantworten Fragen dazu. ChatGPT und Perplexity nehmen Screenshots und Fotos an und schliessen darueber. Unter der Haube wandeln moderne Modelle Pixel und Text in eine gemeinsame Repraesentation um und gleichen dann eine visuelle Anfrage mit allem Indexierten ab.
Die Lehre fuer uns ist klar: Ein Bild ist keine Deko mehr. Es ist ein abfragbares Objekt. Die Aufgabe ist, dafuer zu sorgen, dass die Maschine erkennt, was dein Visual zeigt und warum es die richtige Antwort ist.
Der Verhaltenswechsel ist real. Statt Begriffe zu tippen, halten Leute die Kamera drauf oder fuegen ein Bild ein und fragen "Was ist das?" oder "Wo bekomme ich das guenstiger?". Wer nur fuer Text-Keywords optimiert, verpasst diese Anfragen komplett, weil sie gar keine Worte enthalten, bis das Modell welche vergibt.
Optimiere Bilder fuer AI und Google Lens
Lens und AI-Modelle erkennen ein Bild, indem sie die Pixel mit jedem Textsignal ringsum kombinieren. Gib ihnen starke, konsistente Signale.
- Nutze originale Bilder in hoher Aufloesung. Scharfe, gut ausgeleuchtete, aufgeraeumte Visuals lassen sich leichter klassifizieren. Stockfotos, die alle nutzen, sind schwache Unterscheidungsmerkmale.
- Benenne Dateien beschreibend.
matt-schwarze-espressomaschine.jpgschlaegtIMG_4471.jpg. Der Dateiname ist ein echtes Signal. - Liefere moderne Formate und korrekte Groessen. WebP oder AVIF, responsives
srcsetund passende Dimensionen halten das Bild schnell und vollstaendig gerendert, damit es indexiert werden kann. - Platziere das Bild neben relevantem Text. Modelle stuetzen sich stark auf den umgebenden Text, die Bildunterschrift und die naechste Ueberschrift, um zu entscheiden, was ein Bild zeigt. Ein Bild ohne Kontext in einer Galerie ist schwer zu deuten.
- Halte das Motiv eindeutig. Ein klares Motiv pro Bild schlaegt eine ueberladene Collage, wenn du willst, dass es erkannt und zugeordnet wird.
Gerade bei Produkt- und How-to-Inhalten wird hier der Lens-Traffic gewonnen. Jemand fotografiert einen Artikel; Lens versucht die Zuordnung; die Seite mit den besten Beschriftungen und dem besten Kontext gewinnt.
Alt-Text und Bildunterschriften zaehlen weiter
Alt-Text hat in der AI-Aera nicht an Bedeutung verloren. Er hat gewonnen. Alt-Text ist eine primaere, maschinenlesbare Beschreibung dessen, was ein Bild zeigt, und multimodale Systeme nutzen ihn als verlaessliches Label zum Abgleich mit Anfragen. Zudem bleibt er eine Anforderung der Barrierefreiheit.
Schreib ihn gut:
- Beschreibe Inhalt und Zweck, keine Keywords. "Barista giesst Latte Art in eine weisse Tasse" ist nuetzlich; "Kaffee Kaffee Espresso bester Kaffee" ist Spam.
- Sei praezise und knapp. Ein treffender Satz schlaegt eine vage Phrase oder einen Keyword-Haufen.
- Nutze Bildunterschriften fuer den menschlichen Kontext, der den Alt-Text verstaerkt. Unterschriften werden mehr gelesen als der Fliesstext und geben Modellen ein weiteres passendes Signal.
- Stopf nicht voll und dupliziere nicht. Identischer Alt-Text ueber viele Bilder sagt einem Modell, dass deine Beschriftung unzuverlaessig ist.
Strukturierte Daten fuer Bilder und Video
Strukturierte Daten sind der Weg, Engines eine explizite, eindeutige Beschreibung deiner Medien zu liefern.
- ImageObject laesst dich URL, Bildunterschrift, Urheber, Lizenz und Inhalt eines Bildes deklarieren. Es unterstuetzt Lizenz-Badges und hilft AI-Systemen, dem Bild zu vertrauen und es zuzuordnen.
- VideoObject ist fuer Video unverzichtbar. Nimm
name,description,thumbnailUrl,uploadDate,durationund einen Verweis auf ein Transkript odercaptionauf. Das macht ein Video fuer Video-Ergebnisse und die Zitation in AI-Antworten qualifiziert. - Halte Schema und sichtbaren Inhalt konsistent. Beschreibt das Markup etwas, das die Seite nicht zeigt, untergraebst du Vertrauen, statt es aufzubauen.
Strukturierte Daten retten kein schlechtes Bild, aber sie machen aus einem guten, gut platzierten Bild eines, das eine Engine sicher versteht und ausspielt.
Vergiss das Video nicht
Video ist das am staerksten unteroptimierte multimodale Asset, das ich sehe. AI-Antworten ziehen zunehmend Clips und Momente, nicht nur ganze Videos.
- Fuege vollstaendige Transkripte hinzu. Ein Transkript verwandelt dein Video in Text, den ein Modell lesen, zuordnen und zitieren kann. Das ist der wirkungsvollste Video-SEO-Schritt.
- Biete Kapitel und Zeitmarken. Klare Segmente helfen Engines, genau den Moment auszuspielen, der eine Frage beantwortet.
- Schreib echte Titel und Beschreibungen. Behandle sie wie Seitentitel, mit klar benanntem Thema.
- Hoste mit crawlbarem Player und
VideoObject. Sieht ein Bot nicht, dass das Video existiert, kann er es nicht ranken.
Verdiene dir einen Platz in multimodalen Antworten
Alles zusammengefasst folgt das Auftauchen in einer multimodalen AI-Antwort einem Muster.
- Mach das Visual identifizierbar. Gutes Bild, beschreibender Dateiname, praeziser Alt-Text.
- Umgib es mit passendem Kontext. Bildunterschrift, nahe Ueberschrift und Text, die das Motiv benennen und die wahrscheinliche Frage beantworten.
- Deklariere es mit strukturierten Daten. ImageObject oder VideoObject, damit die Engine deine Medien sicher parst.
- Beantworte die Frage, die das Visual nahelegt. Zeigt das Bild ein Produkt, sollte die Seite in extrahierbaren Saetzen sagen, was es ist, was es tut und fuer wen.
- Halte es schnell und crawlbar. Rendering und Indexierung sind das Tor; ein Bild, das ein Bot nicht laden kann, wird nicht zitiert.
Das Fazit
Behandle jedes Bild und Video als abfragbare Antwort, nicht als Seiten-Deko. Kombiniere starke, originale Visuals mit praezisem Alt-Text, passenden Unterschriften und Kontext sowie ImageObject- oder VideoObject-Markup. Tu das konsequent, und du wirst fuer Lens-Ergebnisse und multimodale AI-Antworten infrage kommen, waehrend die meisten Seiten noch namenlose JPGs ausliefern.
FAQ
Wie optimiere ich Bilder fuer Google Lens und AI-Suche?
Nutze scharfe, originale Bilder mit beschreibenden Dateinamen und Alt-Text, platziere jedes Bild neben erklaerendem Text und ergaenze ImageObject-Strukturdaten. Lens und AI gleichen visuelle Inhalte mit Text ab, klare Beschriftung macht dein Bild identifizierbar.
Zaehlt Alt-Text noch fuer AI-gestuetzte visuelle Suche?
Ja, mehr denn je. Alt-Text ist ein zentrales Textsignal, das AI-Systemen sagt, was ein Bild zeigt, die Barrierefreiheit staerkt und multimodalen Modellen eine verlaessliche Beschreibung zum Abgleich mit einer Anfrage liefert.
Welche strukturierten Daten helfen bei multimodaler und Video-Suche?
Nutze ImageObject fuer Bilder und VideoObject fuer Videos, inklusive Untertitel, Thumbnails, Dauer und Transkripte. Diese Strukturdaten helfen Engines, deine visuellen Medien zu verstehen, zu indexieren und in Rich- und AI-Ergebnissen auszuspielen.
Gelegentliche Notizen zu SEO & GEO. Kein Spam.