Vier Ebenen der Messung beantworten vier verschiedene Fragen. Wer sie vermischt, erhält eine Zahl, die präzise aussieht und nichts belegt.
Die vier Ebenen der Messung
Werbewirkung ist kein einzelner Zustand, sondern eine Kette. Am Anfang steht der Kontakt, am Ende möglicherweise eine Handlung. Zwischen beiden liegen mehrere Schritte, und jeder Schritt lässt sich messen. Die entscheidende Frage ist nicht, ob gemessen wird, sondern welche Ebene eine Kennzahl beschreibt.
Die erste Ebene ist die Auslieferung. Hier wird gemessen, ob ein Werbemittel überhaupt ausgespielt wurde: Impressionen, Abrufe, Sichtbarkeitswerte, Reichweiten, Kontaktsummen. Diese Ebene beschreibt die Verteilung der Kontakte und nichts darüber hinaus.
Die zweite Ebene ist die Befragung. Hier wird gemessen, ob der Kontakt wahrgenommen wurde und ob sich Erinnerung oder Einstellung verändert haben. Typische Größen sind gestützte und ungestützte Erinnerung, Markenbekanntheit, Zuschreibungen von Eigenschaften und Kaufabsichten. Diese Ebene beschreibt Zustände im Publikum, aber sie erfasst sie über Selbstauskunft.
Die dritte Ebene ist das beobachtete Verhalten. Hier wird gemessen, was Menschen tatsächlich getan haben: Klicks, Anmeldungen, Anfragen, Warenkorbvorgänge. Diese Ebene ist näher an der Handlung, aber sie ist nicht gleichbedeutend mit einem zusätzlichen Kauf, weil auch hier die Frage offenbleibt, ob die Handlung ohne den Kontakt unterblieben wäre.
Die vierte Ebene ist das Geschäftsergebnis. Hier wird gemessen, was sich in Absatz, Umsatz oder Deckungsbeitrag niedergeschlagen hat. Diese Ebene ist die wirtschaftlich relevante, und sie ist am schwierigsten zuzuordnen, weil viele Faktoren gleichzeitig auf sie einwirken.
Die praktische Konsequenz ist einfach: Eine Kennzahl gehört immer zu genau einer dieser Ebenen, und eine Aussage darf nicht über die Ebene hinausreichen, aus der die Kennzahl stammt. Die häufigste Fehlinterpretation besteht darin, eine Kennzahl der ersten Ebene als Beleg für die vierte Ebene zu verwenden.
Zuordnung und Inkrementalität
Der Begriff der Attribution beschreibt ein Rechenverfahren. Es verteilt ein beobachtetes Ergebnis auf die Kontakte, die ihm vorausgegangen sind. Je nach Regel geschieht das dem letzten Kontakt, dem ersten Kontakt, gleichmäßig über alle Kontakte oder nach einem datenbasierten Gewichtungsmodell. Alle diese Verfahren haben eines gemeinsam: Sie setzen eine Zuordnung voraus, die sie nicht selbst belegen.
Die Inkrementalität beschreibt dagegen einen Vergleich. Sie fragt, welcher Teil eines Ergebnisses eingetreten wäre, wenn es den Kontakt nicht gegeben hätte. Diese Frage lässt sich nur mit einer Vergleichsgruppe beantworten, die denselben äußeren Bedingungen ausgesetzt ist und den Kontakt nicht erhält. Der Unterschied zwischen beiden Ansätzen ist grundsätzlich und nicht graduell.
Ein Attributionsmodell kann in einem wachsenden Markt hohe Werte liefern, ohne dass die Kampagne etwas bewirkt hat. Eine Inkrementalitätsmessung kann einen kleinen Wert liefern, obwohl die Kampagne entscheidend war, wenn die Vergleichsgruppe durch andere Einflüsse verzerrt war. Beide Verfahren haben Schwächen, aber nur eines von beiden ist überhaupt in der Lage, eine Ursache-Wirkung-Aussage zu tragen.
Der Beitrag zur Kontaktdefinition im Media-Mix zeigt, warum diese Unterscheidung in der Praxis zusätzlich erschwert wird. Kontakte verschiedener Kanäle sind nicht deckungsgleich, und die Überschneidungen sind häufig unbekannt. Wer auf dieser Grundlage attribuiert, verteilt Ergebnisse über eine Fläche, deren Grenzen er nicht kennt.
Rechenmodell zum inkrementellen Lift
Die Logik der Inkrementalität lässt sich mit einer kleinen Modellrechnung verdeutlichen. Angenommen werden zwei Gruppen von je 1.000 Personen, die aus derselben Grundgesamtheit stammen und zufällig zugeteilt wurden.
In der Testgruppe, die den Werbekontakt erhalten hat, werden 240 Käufe beobachtet. Das entspricht einer Kaufrate von 24 Prozent. In der Kontrollgruppe, die keinen Kontakt erhalten hat, werden 200 Käufe beobachtet. Das entspricht 20 Prozent.
Der absolute Lift ist die Differenz der Kaufraten und beträgt 4 Prozentpunkte. Der relative Lift setzt diese Differenz ins Verhältnis zur Kontrollgruppe und beträgt 20 Prozent. Beide Werte beschreiben denselben Sachverhalt, und beide werden in der Praxis verwendet. Die Verwechslung der beiden Größen ist eine der häufigsten Ursachen für überzogene Erfolgsmeldungen: Aus 4 Prozentpunkten werden schnell 20 Prozent Ertragssteigerung.
Aus dieser Rechnung lassen sich drei methodische Anforderungen ableiten, die in der Praxis häufig verletzt werden.
Erstens muss die Zuteilung zufällig erfolgen. Eine Aufteilung nach Regionen, Filialen oder Kundengruppen ist keine zufällige Zuteilung und kann systematische Unterschiede enthalten, die das Ergebnis erklären.
Zweitens muss die Kontrollgruppe tatsächlich keinen Kontakt erhalten. In vielen Kampagnen ist das nicht durchsetzbar, weil ein Teil der Werbung nicht zielgenau gesteuert werden kann. In diesem Fall wird die Kontrollgruppe faktisch zu einer Gruppe mit geringerem Kontakt, und die gemessene Differenz unterschätzt den tatsächlichen Effekt.
Drittens muss das Ergebnis vor der Messung definiert werden. Wer die Erfolgsgröße nach Kenntnis der Daten auswählt, findet fast immer eine Kennzahl, die einen Effekt zeigt. Diese Praxis ist der häufigste Grund dafür, dass Messungen sich in späteren Wiederholungen nicht bestätigen.
Was eine Statistik über Werkzeuge sagt
Ein Beispiel für eine Kennzahl, die einer anderen Ebene angehört als sie in der Diskussion häufig dargestellt wird, ist die Erhebung des Statistischen Bundesamtes zur Nutzung von Technologien der künstlichen Intelligenz in Unternehmen. Die Erhebung weist für das Jahr 2025 einen Anteil von 26 Prozent der Unternehmen aus, die Technologien der künstlichen Intelligenz nutzen. Nach Beschäftigtengrößenklassen steigt dieser Anteil deutlich an: Er liegt bei 57 Prozent in Unternehmen mit mehr als 250 Beschäftigten und bei 23 Prozent in Unternehmen mit 10 bis 49 Beschäftigten.
Für die Nutzungszwecke weist die Erhebung innerhalb der nutzenden Unternehmen unter anderem 52 Prozent für die Erzeugung von Bildern, Videos und Ton aus sowie 42 Prozent für Spracherkennung und 35 Prozent für die Erzeugung natürlicher Sprache einschließlich Programmiercode. Diese Zahlen sind präzise und aussagekräftig, aber sie betreffen eine Frage, die mit Werbewirkung nichts zu tun hat.
Die Unterscheidung ist methodisch wesentlich. Die Erhebung erfasst betriebliche Werkzeugnutzung. Sie erfasst nicht die Qualität der erzeugten Werbemittel, nicht die Wahrnehmung beim Publikum und nicht den Absatz. Eine Aussage über die Wirkung von Werbung lässt sich daraus nicht ableiten, und zwar unabhängig davon, wie hoch der Anteil ausfällt.
Für die Bewertung von Kommunikation ist diese Abgrenzung deshalb wichtig, weil Werkzeugnutzung und Wirkung in der Diskussion häufig kurzgeschlossen werden. Der Satz, dass die Mehrheit der Unternehmen KI für Bild und Ton einsetzt, ist eine Aussage über Produktionsverfahren. Er ist keine Aussage darüber, ob die so erzeugten Mittel besser oder schlechter wirken.
Welche Kennzahl welche Frage beantwortet
Aus den vorstehenden Überlegungen ergibt sich ein Katalog, der jeder Kennzahl eine Frage zuordnet. Die folgende Übersicht ist als Arbeitsgrundlage gedacht und nicht als abschließende Systematik.
Wer wissen will, ob eine Kampagne ausgeliefert wurde, misst Impressionen, Sichtbarkeit und Reichweite. Wer wissen will, ob sie wahrgenommen wurde, misst gestützte und ungestützte Erinnerung. Wer wissen will, ob sie die Einstellung verändert hat, misst Zuschreibungen und Präferenzen. Wer wissen will, ob sie Handlungen ausgelöst hat, misst Klicks und Anfragen, muss aber die Basishandlungen abziehen. Wer wissen will, ob sie Geld verdient hat, braucht einen Vergleich mit einer Kontrollgruppe.
Diese Zuordnung hat eine unbequeme Konsequenz. Die Fragen, die wirtschaftlich am wichtigsten sind, lassen sich am schwersten beantworten. Auslieferungsdaten sind in jedem modernen Kampagnensystem unmittelbar verfügbar, Inkrementalitätsmessungen erfordern dagegen eine bewusste Anlage vor dem Start. Wer eine Ursache-Wirkung-Aussage treffen will, muss die Messung deshalb vor der Kampagne einplanen und nicht danach.
Ein zweiter Punkt betrifft die Rolle von Wiedererkennungsgrößen. Die Zuordnung einer Marke zu einem Element ist eine Wahrnehmungsgröße und keine Absatzgröße. Der Beitrag zur Prüfung von Wiedererkennung beschreibt, wie sich Zuordnungsstärke messen lässt und warum ein solcher Wert keine Absatzprognose darstellt.
Ein dritter Punkt betrifft die Einordnung öffentlicher Kampagneninformationen. Eine Dokumentation beschreibt die Planung, nicht das Ergebnis. Der Beitrag zur Einordnung der Migros-Kampagne zeigt, welche Fragen eine solche Dokumentation beantwortet und welche offenbleiben.
Schließlich ist die Belegfrage von der Messfrage zu trennen. Ob eine Aussage belegbar ist, ist eine rechtliche Frage; ob eine Kampagne gewirkt hat, ist eine empirische. Der Beitrag dazu, welche Belege eine Werbeaussage trägt, ordnet die rechtlichen Anforderungen ein.
Empfehlung für die Praxis
Vier Empfehlungen lassen sich aus diesen Überlegungen ableiten.
Erstens sollte jede Kennzahl mit der Frage berichtet werden, die sie beantwortet. Eine Zahl ohne Frage wird in der Diskussion fast zwangsläufig überinterpretiert.
Zweitens sollte für jede Kampagne mindestens eine inkrementelle Messung vorgesehen werden, auch wenn sie nur einen Teil der Maßnahme abdeckt. Eine kleine belastbare Aussage ist mehr wert als eine große unbelastbare.
Drittens sollten Kennzahlen der Auslieferung nicht in der Sprache der Wirkung berichtet werden. Die Formulierung entscheidet darüber, ob eine Zahl später richtig gelesen wird.
Viertens sollten Messungen wiederholt werden. Eine einzelne Beobachtung ist ein Datenpunkt, keine Erkenntnis. Werbewirkung zeigt sich in der Wiederholung, und ein Ergebnis, das sich nicht reproduzieren lässt, ist keine Grundlage für Entscheidungen.
Inkrementeller Lift: Testgruppe gegen Kontrollgruppe
Kontrollgruppe ohne WerbekontaktTestgruppe mit Werbekontakt
Nutzung von KI in Unternehmen: Anteile und Verwendungszweck
UnternehmensanteilVerwendungszweck innerhalb der nutzenden Unternehmen
Häufige Fachfragen
Beweist ein hoher ROAS einen kausalen Werbeerfolg?
Nein. Der Return on Ad Spend ordnet Erlöse nach den gewählten Attributionsregeln zu und setzt sie ins Verhältnis zu den Medienkosten. Er berücksichtigt keine Basiskäufe, die ohnehin stattgefunden hätten. Ein ROAS von vier kann aus einer Kampagne stammen, die keinen einzigen zusätzlichen Kauf ausgelöst hat, wenn die zugeordneten Käufe auch ohne sie erfolgt wären.
Bedeutet der Anstieg generativer KI-Nutzung eine höhere Kampagnenleistung?
Nein. Die Erhebung des Statistischen Bundesamtes erfasst die betriebliche Nutzung von Technologien. Sie sagt nichts über die Qualität der erzeugten Werbemittel, nichts über die Wahrnehmung beim Publikum und nichts über den Absatz. Zwischen dem Einsatz eines Werkzeugs und einem messbaren Werbeeffekt liegt dieselbe Kette von Ebenen wie bei jeder anderen Produktionsentscheidung.
Quellen und Belege
Externe Quellen sind mit vollständiger bibliografischer Angabe und Fundstelle ausgewiesen.
- S04Statistisches Bundesamt: Unternehmen mit Nutzung von Technologien der künstlichen Intelligenz nach Beschäftigtengrößenklassen, Stand 24. November 2025.
Amtliche Statistik zur Nutzung von KI-Technologien in Unternehmen, gegliedert nach Beschäftigtengrößenklassen und Technologiearten. Wird in Abschnitt 4 herangezogen und dort methodisch von Werbewirkungskennzahlen getrennt.



