• Expert View

Der Blick war da, die Bedeutung nicht

AI-Screenings sagen zuverlässig voraus, wohin Betrachter schauen, deutlich weniger über die Wirkung des Motivs.

Thomas Krombach
AI Consultant bei mindline

Aktualisiert
14. September 2026

Werbemittel oder Verpackungen werden heute geprüft, bevor sie überhaupt getestet oder gelauncht werden, und zwar zunehmend von KI-Systemen, die vorhersagen, wohin der Blick der Betrachter wandert. Was solche Verfahren leisten und wo ihre Grenzen liegen, lässt sich an einem Beispiel zeigen.

Eine Produktverpackung für Teebeutel der Marke Teekanne mit dem Geschmack Kamille (Abb. 1): links das Markenlogo, mittig die stichpunktartige Produktbeschreibung und rechts eine große Darstellung eines gefüllten Teeglases. Das Produkt nimmt viel Fläche ein und sitzt prominent – man würde also erwarten, dass der Blick dort hängen bleibt.

Teekanne-Verpackung, Sorte Kamille.

Abbildung 1: Teekanne-Verpackung, Sorte Kamille.

Wird es nicht, denn das Screening zeigt: Der Blick der Betrachter wandert an genau dieser Stelle vorbei. Stattdessen bleibt er an Produkttitel, Produktbeschreibung, Firmenlogo und Zertifizierung hängen. Das Produkt selbst – das Teeglas – hingegen liegt in einem Bereich, der deutlich geringer betrachtet wird (Abb. 2).

Der Befund ist klar und überprüfbar. Ob er Konsequenzen für die weitere Gestaltung der Verpackung hat, steht damit aber noch nicht fest. Die in diesem Artikel vorgestellten KI-Werkzeuge sind für solche Situationen konzipiert, um zu testen, wohin der Blick fällt. Was sie allerdings nicht sagen, ist, ob das übersehene Teeglas für den Verkauf ein entscheidendes Problem ist. Diese Frage jedoch führt über das hinaus, was eine Maschine beantworten kann – beantworten muss sie ein Mensch, der das Produkt kennt. Und der kommt hier zu einem klaren Urteil: Die Abbildung des Teeglases ist vor allem dekorativ; die kaufrelevanten Angaben sind Marke, Sorte und Zertifizierung. Dass der Blick dort liegt, ist kein Fehler, sondern die richtige Reihenfolge.

Eye-Tracking-Heatmap der Teekanne-Kamille-Verpackung. Die Fixationen konzentrieren sich auf Produkttitel, Logo, Produktbeschreibung und Zertifizierung – das groß platzierte Teeglas bleibt weitgehend unbeachtet.

Abbildung 2: Eye-Tracking-Heatmap der Teekanne-Kamille-Verpackung. Die Fixationen konzentrieren sich auf Produkttitel, Logo, Produktbeschreibung und Zertifizierung – das groß platzierte Teeglas bleibt weitgehend unbeachtet.

Drei Fragen, ein Messwert

Ob ein Werbemittel wirkt, entscheidet sich an drei Fragen. Wird es überhaupt gesehen? Was kommt bei den Betrachtern an? Und ist das Angekommene das, was gewollt war? Dabei bauen die Fragen aufeinander auf. Ohne Aufmerksamkeit kommt nichts an, und was nicht ankommt, kann auch nicht wirken.

An der ersten Frage arbeitet inzwischen eine ganze Werkzeugklasse. Sie prognostiziert aus dem Bildmaterial heraus, worauf der Blick fällt, ohne dass dafür jemand befragt oder vor einen Eye-Tracker gesetzt werden müsste. Ein verbindlicher Standard ist das noch nicht, aber es geschieht immer häufiger.

Drei dieser Systeme haben wir uns genauer angesehen. Neurons und Brainsuite arbeiten weitgehend nach demselben Prinzip: Beide sind auf umfangreichen Eye-Tracking-Datensätzen trainiert und sagen Blickpfade direkt aus dem Bildmaterial vorher. VISATT, ein jüngerer deutscher Anbieter, geht einen etwas anderen Weg und setzt stärker auf Heuristiken, also auf Regeln, die aus der Wahrnehmungsforschung abgeleitet sind, statt auf ein trainiertes Modell.

So unterschiedlich die Verfahren im Detail sind, sie laufen doch auf Ähnliches hinaus: Wohin geht der Blick, und wie lange bleibt er dort? Das ist keine Beschränkung, die man den Werkzeugen vorhalten müsste, sondern die Folge dessen, was sich überhaupt maschinell erfassen lässt. Blickverhalten ist ein hartes, beobachtbares Maß. Deutung und Zielerfüllung sind es nicht.

Wird es gesehen?

Die erste Frage lässt sich mit diesen Verfahren beantworten, und darin liegt ihr eigentlicher Nutzen. Sie decken Sichtbarkeitsfehler auf: ein Logo, das im Layout untergeht, ein Claim, der dort steht, wo kaum jemand hinsieht, oder, wie in dem obigen Verpackungsdesign, ein Produkt, das viel Fläche einnimmt und trotzdem wenig Betrachtung erhält. Dass ein solcher Befund vorliegt, heißt noch nicht, dass ein Fehler vorliegt – nur, dass jemand hinsehen muss.

Dazu kommt ein Punkt, der in der Praxis oft schwerer wiegt als die Genauigkeit im Einzelfall. Der eigentliche Engpass ist nämlich nicht, wie genau ein einzelnes Motiv geprüft wird, sondern wie viele überhaupt geprüft werden. Ein Eye-Tracking im Labor ist so aufwendig, dass es immer nur für eine Handvoll Leitmotive in Frage kommt. Alles, was daran hängt, die zwanzigste Bannergröße, das Anzeigenformat für einen einzelnen Handelspartner, die kurzfristige Adaption, läuft ungeprüft durch. Ein automatisiertes Screening dagegen lässt sich auf jedes einzelne Motiv anwenden, das im Projekt anfällt. Und es erzeugt einen Lerneffekt über Serien hinweg: Wer viele Motive systematisch prüft, erkennt Muster, die aus einem einzelnen Test nie hervorgegangen wären.

Was kommt an?

Ein Screening kann jedoch nicht zeigen, wie genau die Stellen, auf die sich der Betrachter fokussiert, wahrgenommen werden.

Im obigen Beispiel liegt das Auge des Betrachters nicht auf dem Teeglas. Jedoch zeigen die fokussierten Stellen trotzdem, worauf sich das Produkt bezieht. Die Kombination aus der Marke Teekanne und Kamille macht es einfach zu erkennen, dass es sich bei dem Produkt um Kamillentee handelt. Somit ist es ein einfach verständliches Design.

Noch schwerer wiegt ein zweiter Fall: wenn die Produktaussage nicht im Text steht, sondern im Bild selbst. Man stelle sich eine Verpackung vor, die ihre zentrale Eigenschaft visuell vorführt, statt sie auszuloben – etwa ein Material, das seine Farbe je nach Umgebung verändert, gezeigt an zwei Zuständen desselben Objekts nebeneinander. Wer die Gegenüberstellung als Gegenüberstellung erkennt, versteht die Produkteigenschaft sofort. Wer sie nicht erkennt, sieht zwei Objekte. Entscheidend ist: Ein Screening sieht in beiden Fällen dasselbe. Der Blick liegt genau dort, wo er liegen soll, die Verweildauer ist auskunftsfähig, die Heatmap spricht für das Motiv. Gemessen an der Aufmerksamkeit funktioniert es. Nur ist die Aussage bei einem Teil der Betrachter nicht angekommen – der Blick war da, die Bedeutung nicht.

Dass Blickdaten diese Unterscheidung nicht abbilden, zeigt eine neurophysiologische Untersuchung zu visuellen Metaphern in der Werbung. García-Madariaga et al. legten 43 Probanden 28 Anzeigenmotive in drei Komplexitätsstufen vor und zeichneten die Reaktionen parallel per EEG, Eye-Tracking und Hautleitwert auf. Das Eye-Tracking wies deutliche Unterschiede in der Betrachtungsdauer aus – ob die Motive verstanden wurden, lässt sich daraus jedoch nicht ableiten. Die Autoren halten fest, dass Eye-Tracking bei visuellen Metaphern kein geeignetes Maß für die kognitive Verarbeitung ist, sondern die Aufmerksamkeit erfasst, die einem Motiv gilt (Frontiers in Psychology 11:760, 2020, https://doi.org/10.3389/fpsyg.2020.00760).

Das gilt allgemeiner. Zwar sagt eine Heatmap zuverlässig, wohin der Blick wandert und wie lange er dort verweilt, doch sagt sie nichts darüber, wie das Gesehene gedeutet wird. Bei anderen Motiven können zwei Betrachter auf identische Verläufe kommen und die Anzeige trotzdem gegensätzlich lesen, der eine als Ironie, der andere als ernst gemeinte Behauptung. Die Fixation ist in beiden Fällen dieselbe, die Bedeutung nicht.

Ein weiteres Risiko liegt in der Markenzuordnung, und auch das lässt sich an diesem Motiv durchspielen. Angenommen, neben dem Teeglas würde eine prominente Person abgebildet. Die Blickverteilung könnte sich dann ändern und die Fixation läge auf diesem Bereich, in dem auch das Glas Tee zu sehen ist, also dort, wo sie hingehört. Trotzdem könnte am Ende die Person erinnert werden anstelle des Produktes. Für diesen Fall gibt es in der Werbeforschung den Begriff Vampireffekt: Ein auffälliges Element zieht den Blick zuverlässig auf sich und verdrängt dabei, wofür geworben wird. Die Aufmerksamkeitsprognose kann dabei vollkommen korrekt sein und trotzdem die falsche Entscheidung nahelegen, weil sie misst, wo geschaut wird, nicht, was hängen bleibt.

Ist das Angekommene das Gewollte?

Die dritte Frage können diese Systeme schon deshalb nicht beantworten, weil ihnen die entscheidende Information fehlt. Sie wissen nicht, was die Anzeige erreichen soll. Ein Motiv kann provozieren wollen, beruhigen wollen, ein Produkt erklären oder eine Marke in Erinnerung rufen, und je nachdem ist derselbe Messwert ein gutes oder ein schlechtes Zeichen.

Dazu kommt, dass ein hoher Aufmerksamkeitswert für sich genommen nichts darüber sagt, warum jemand hinsieht. Ein Bild, das lange betrachtet wird, kann fesseln oder irritieren. Es kann interessant sein oder schwer verständlich. Auf der Ebene des Blickverhaltens sieht beides gleich aus. Welche der beiden Lesarten zutrifft, entscheidet erst jemand, der Marke, Wettbewerb und Zielgruppe kennt und weiß, was mit dem Motiv beabsichtigt war.

Das ist keine Frage der Rechenleistung. Die Anbieter arbeiten daran, mehr Kontext in ihre Modelle zu holen, und möglicherweise lässt sich damit künftig ein Teil dieser Lücke schließen. Heute ist die Absicht hinter einem Motiv kein Bestandteil dessen, was diese Tools verarbeiten.

Konsequenz: Kommunikationsziel vor Screening

Man könnte einwenden, dass die Anbieter längst mehr versprechen als reine Aufmerksamkeit. Viele geben inzwischen auch Werte für emotionale Aktivierung oder Werbeerinnerung aus.

Damit ist das Problem jedoch nicht gelöst, sondern lediglich verlagert. Wohin jemand schaut, kann man direkt beobachten und nachprüfen. Ob jemand emotional aktiviert ist, kann man nicht beobachten. Das muss man erst über Umwege messen, und jeder dieser Umwege bringt eigene Unsicherheit mit.

Für die Praxis folgt daraus eine Reihenfolge. Das Kommunikationsziel muss formuliert sein, bevor das Screening beginnt, nicht danach. Nur so lässt sich beurteilen, ob ein gemessener Aufmerksamkeitswert im konkreten Fall überhaupt wünschenswert ist. Wird ein Element gar nicht wahrgenommen, kann das direkt über die weitere Bearbeitung entscheiden. Fällt der Befund positiv aus, heißt das nur, dass das Motiv eine genauere Betrachtung verdient, nicht, dass es funktioniert.

Daraus folgt ein hybrides Design: breit screenen, schmal messen. Die automatisierte Prüfung deckt die volle Bandbreite an Motiven, Formaten und Adaptionen ab und filtert die Fälle heraus, die eine nähere Betrachtung lohnen. Die aufwendigere, personengestützte Untersuchung konzentriert sich dann auf genau diese engere Auswahl. Wird die erste, prüfbare Frage konsequent automatisiert, wird Budget frei für die Fragen, die sich nur mit Menschen klären lassen.

Fazit

Aus alldem folgt keine Warnung vor diesen Werkzeugen, sondern eine Einsatzregel. Neurons, Brainsuite und VISATT leisten zuverlässig, wofür sie gebaut sind. Sie zeigen, welche Teile eines Motivs gesehen werden und welche nicht, und sie tun das schnell und günstig genug, dass man sie auf jedes Motiv anwenden kann, nicht nur auf die Leitmotive der Werbekampagne.

Genau darin liegt ihr Wert. Sie machen ein Verfahren besser, weil sie eine Prüfung dorthin bringen, wo bisher gar nicht geprüft wurde. Was sie nicht sind, ist ein Ersatz für ein Testing. Von den drei Fragen – wird es gesehen, kommt es an, ist das Angekommene das Gewollte – beantworten sie die erste, und das gründlich. Die zweite und die dritte können sie nicht beantworten, und zwar nicht, weil die Modelle noch zu klein wären, sondern weil ihnen fehlt, was dafür nötig ist: die Absicht hinter dem Motiv und das Ziel, dem es dienen soll.

Damit ist auch gesagt, wo die eigentliche Arbeit liegt. Diese Werkzeuge erzeugen Daten, und zwar mehr, als man früher je über ein Motiv hatte. Was sie nicht mitliefern, ist die Entscheidung, welcher dieser Befunde der relevante ist. Ein Ergebnis, das gut aussieht, kann bedeutungslos sein, und ein unauffälliger Wert kann auf das eigentliche Problem zeigen. Wer in dieser Menge das Wesentliche finden will, muss selbst hinsehen, und zwar mit einer Vorstellung davon, wonach er sucht.

Dass die große Abbildung des Teeglases hier vor allem Dekoration ist und der Blick trotzdem am Richtigen hängt, war keine Auskunft des Screenings. Das hat jemand entschieden, der weiß, was dieses Produktdesign erreichen sollte.

Analysen und Beratungen rund um AI Tech Tools sowie Startups. Für Marktforscher und Marketing-Entscheider.

Alle Tools
Beratungstermin vereinbaren