ChatGPT Ads · Tests & Optimierung

ChatGPT Ads testen: Welche Anzeige funktioniert wirklich besser?

Ein guter Test bedeutet nicht, fünf Anzeigen zu starten und nach zwei Tagen die höchste Klickrate zum Sieger zu erklären. Du brauchst eine klare Hypothese, vergleichbare Bedingungen, sauberes Tracking und genug Daten für eine sinnvolle Entscheidung.

Hier lernst du Schritt für Schritt, welche Varianten du bei ChatGPT Ads sinnvoll testen kannst, was du besser getrennt hältst, welche Kennzahlen zu welchem Ziel passen und wie du vermeidest, aus zu wenig Daten die falschen Schlüsse zu ziehen.

Von Luisa Luer – Digital Marketing Expertin seit 2014

Zuerst die wichtigste Unterscheidung

Mehrere Anzeigen sind ein Varianten-Test – aber nicht automatisch ein klassischer 50/50-A/B-Test

OpenAI empfiehlt ausdrücklich, mehrere Anzeigen innerhalb einer Anzeigengruppe zu verwenden, um unterschiedliche Botschaften für dasselbe Thema auszuprobieren. In der aktuell öffentlich dokumentierten Hilfe und API ist jedoch kein separater Experimentmodus beschrieben, der eine garantiert gleichmäßige 50/50-Ausspielung zweier Varianten sicherstellt.

Warum ist dieser Unterschied wichtig? Bei einem klassischen A/B-Test möchtest du möglichst nur eine Variable verändern und beiden Varianten vergleichbare Chancen geben. Nur dann kannst du einen Leistungsunterschied halbwegs sauber auf diese eine Veränderung zurückführen. Wenn Variante A deutlich mehr Auslieferung erhält als B, vergleichst du nicht mehr zwei exakt gleich behandelte Testgruppen. Das macht den Test nicht wertlos – aber die Interpretation muss vorsichtiger werden.

Deshalb solltest du bei ChatGPT Ads nicht nur fragen: „Welche Anzeige hat mehr Klicks?“, sondern zuerst prüfen: Wie viele Impressionen bekam jede Variante, wie hoch waren CTR und Conversion-Rate und wie teuer war das gewünschte Ergebnis? Absolute Zahlen ohne Auslieferungskontext können schnell in die falsche Richtung führen.

Was du im Ads Manager praktisch machen kannst

Du kannst mehrere Anzeigen innerhalb derselben Anzeigengruppe anlegen und ihre Performance auf Anzeigenebene vergleichen. Das eignet sich gut für unterschiedliche Titel, Beschreibungen oder Creatives rund um dasselbe Angebot und dieselbe Kundensituation.

Was du nicht einfach voraussetzen solltest

Gehe nicht automatisch davon aus, dass Variante A und B exakt gleich viele Impressionen, Klicks oder Budgetanteile erhalten. Wenn die Auslieferung unterschiedlich ist, musst du Raten und Kostenkennzahlen vergleichen – nicht nur absolute Klick- oder Conversion-Zahlen.

Wichtig für die Auswertung

Wenn eine Anzeige 5.000 Impressionen und die andere nur 700 erhält, sagt „Anzeige A hat mehr Conversions“ zunächst wenig. Vergleiche zusätzlich CTR, Conversion-Rate und Kosten pro Ergebnis – und prüfe, ob beide Varianten überhaupt genug Daten gesammelt haben.

Nicht einfach irgendetwas ändern

Jeder gute Test beginnt mit einer klaren Hypothese

Eine Hypothese beschreibt, was du veränderst, warum du glaubst, dass es besser funktionieren könnte und anhand welcher Kennzahl du das beurteilen willst. Dadurch wird aus „mal schauen“ ein Test, aus dem du wirklich lernen kannst.

Warum brauchst du überhaupt eine Hypothese? Ohne vorher festgelegte Vermutung neigt man dazu, nach dem Test genau die Kennzahl herauszusuchen, die gut aussieht. Vielleicht hat Variante B mehr Klicks, Variante A aber mehr Käufe. Wenn du vorher nicht festgelegt hast, welches Ziel zählt, kannst du dir im Nachhinein praktisch jede Variante „schönreden“.

Eine gute Hypothese zwingt dich außerdem dazu, über die Ursache nachzudenken. Du testest dann nicht einfach eine neue Überschrift, sondern zum Beispiel die Annahme: „Einsteiger klicken eher, wenn wir ihre Unsicherheit direkt ansprechen, statt nur den Kursinhalt zu nennen.“ Selbst wenn die Hypothese nicht aufgeht, hast du etwas über deine Zielgruppe gelernt.

1

Beobachtung

Beispiel: Viele Besucher klicken, aber nur wenige kaufen.

2

Vermutung

Vielleicht weckt die Anzeige Erwartungen, die auf der Landingpage nicht klar genug eingelöst werden.

3

Veränderung

Eine neue Variante benennt Preis, Umfang oder Zielgruppe klarer.

4

Messung

Nicht nur CTR vergleichen, sondern auch Conversion-Rate und Kosten pro Ergebnis.

Hypothese als einfacher Satz

Wenn wir [eine konkrete Sache] ändern, erwarten wir [eine konkrete Wirkung], weil [Begründung]. Wir bewerten das anhand von [Kennzahl].

Sechs sinnvolle Testbereiche

Teste zuerst die großen strategischen Unterschiede – danach die Details

Der größte Lerngewinn entsteht meist nicht dadurch, ob ein Button gelb oder grün ist. Bei ChatGPT Ads sind Kundensituation, Botschaft, Creative, Angebot und Zielseite deutlich größere Hebel.

1. Botschaft / Nutzenargument

Teste verschiedene Gründe zu klicken: konkrete Situation, praktischer Nutzen, entscheidendes Produktdetail oder häufige Unsicherheit.

Warum? Zwei Anzeigen können dasselbe Produkt bewerben und trotzdem völlig unterschiedliche psychologische Fragen beantworten. Die eine sagt nur, was das Produkt ist, die andere nimmt eine konkrete Hürde. Dadurch lernst du, welches Argument in dieser Gesprächssituation stärker ist.

Beispiel: „Excelkurs für Einsteiger“ gegen „Excel ohne Vorkenntnisse lernen“. Gewinnt die zweite Variante bei Conversions, könnte nicht „Excelkurs“ das entscheidende Argument gewesen sein, sondern die Sicherheit, dass keine Vorkenntnisse nötig sind.

2. Creative-Konzept

Vergleiche Produktfoto, Anwendungssituation, sichtbaren Nutzen oder Entscheidungshilfe – nicht vier nahezu identische Bilder.

Warum? Große Creative-Konzepte testen unterschiedliche Wahrnehmungen. Ein Produktfoto beantwortet „Was ist das?“, eine Anwendungsszene eher „Passt das zu meiner Situation?“. Das liefert deutlich mehr Erkenntnis als dieselbe Szene einmal mit hellem und einmal mit dunklem Hintergrund.

Wichtig: Titel und Beschreibung dabei möglichst stabil halten. Sonst weißt du nicht, ob das Bild oder die Textänderung den Unterschied verursacht hat.

3. Context-Hint-Ansatz

Teste unterschiedliche Kundensituationen oder Intent-Gruppen getrennt. Weil Context Hints auf Anzeigengruppenebene liegen, gehören deutlich verschiedene Situationen in getrennte Anzeigengruppen.

Warum? Jemand, der sich gerade grundsätzlich informiert, reagiert auf andere Argumente als jemand, der zwei konkrete Anbieter vergleicht. Wenn du beide Situationen vermischst, erhältst du nur einen Durchschnitt – und der kann verschleiern, dass eine Anzeige in einer Situation sehr gut und in der anderen sehr schlecht funktioniert.

4. Angebot

Ein Ratgeber, Webinar oder Vergleich kann bei früher Recherche besser passen als „Jetzt Demo buchen“. Weiter unten im Funnel kann ein direkteres Angebot sinnvoller sein.

Warum? Das Angebot muss zur mentalen Bereitschaft des Nutzers passen. Wer gerade erst ein Problem verstehen will, ist möglicherweise noch nicht bereit für einen Kauf oder ein Verkaufsgespräch. Ein niedrigerer nächster Schritt kann deshalb mehr qualifizierte Bewegung im Funnel erzeugen – auch wenn er zunächst weniger „verkaufsnah“ wirkt.

5. Landingpage

Vergleiche eine allgemeine Produktseite mit einer Seite, die exakt auf die beworbene Situation eingeht. Behalte dabei Anzeige und Kontext möglichst konstant.

Warum? Der Klick ist nur der Übergang. Wenn die Anzeige „für Einsteiger ohne Vorkenntnisse“ verspricht, die Landingpage aber mit Fachbegriffen, zehn Produktvarianten und keiner klaren Einsteigerführung startet, entsteht ein Bruch. Dann kann die Anzeige gut sein und die Conversion trotzdem schwach bleiben.

6. Funnel-Stufe / Intent

Informationssuche, Kategorievergleich, Wettbewerbervergleich und konkrete Kaufabsicht sind unterschiedliche Situationen. Messe sie getrennt, statt alles in einem Durchschnitt verschwinden zu lassen.

Warum? Eine niedrigere Conversion-Rate bei früher Recherche muss nicht bedeuten, dass diese Zielgruppe wertlos ist. Sie kann einfach weiter vom Kauf entfernt sein. Ohne Trennung würdest du möglicherweise einen wichtigen oberen Funnel-Bereich abschalten, nur weil du ihn mit kaufnahen Nutzern vergleichst.

Sinnvolle Testreihenfolge

Erst Konzept , dann Feinschliff

Wenn du mit wenig Budget startest, solltest du nicht gleichzeitig zehn kleine Design-Details testen. Finde zuerst heraus, welche grundsätzliche Richtung funktioniert.

Stufe 1: Kundensituation

Welche Situation oder welcher Intent bringt die wertvollsten Besucher? Beispiel: „Einsteiger sucht Lösung“ gegen „Nutzer vergleicht konkrete Alternativen“.

Stufe 2: Angebot

Welche nächste Handlung passt zu dieser Situation? Ratgeber, Produktseite, Vergleich, Demo, Anfrage oder Kauf?

Stufe 3: Botschaft & Creative

Welche Argumentation und welches Bild bringen die richtige Person zum Klick und anschließend zur gewünschten Handlung?

Stufe 4: Feindetails

Erst jetzt lohnen kleinere Tests zu Formulierungen, Bildausschnitt, Zusatzinformation oder einzelnen Landingpage-Elementen.

Sauberer Anzeigenvergleich

Ändere möglichst nur eine zentrale Variable gleichzeitig

Wenn du Titel, Bild, Context Hint, Landingpage und Angebot gleichzeitig austauschst, kannst du zwar sehen, welche Gesamtvariante besser läuft – aber nicht, warum.

Warum ist das problematisch? Stell dir vor, Variante B erzielt 30 % mehr Conversions. Wenn gleichzeitig Bild, Headline und Landingpage geändert wurden, weißt du nicht, welcher Bestandteil den Effekt ausgelöst hat. Du kannst den Erfolg deshalb beim nächsten Test kaum gezielt wiederholen.

Ein sauberer Ein-Variablen-Test ist vor allem dann wertvoll, wenn du Lerneffekte aufbauen willst. Du erfährst zum Beispiel erst, dass Anwendungsszenen besser funktionieren, dann dass innerhalb dieser Szenen ein konkreter Nutzen stärker ist und danach vielleicht, dass eine bestimmte Formulierung den Einwand reduziert. So entsteht Schritt für Schritt eine belastbare Werbelogik.

SAUBERER TEST

Bildkonzept testen

Gleich Context Hints · Titel · Beschreibung · Landingpage · Angebot

Unterschied Produktfoto vs. Anwendungssituation

Wenn sich die Performance unterscheidet, kannst du die Abweichung zumindest deutlich besser dem Creative-Konzept zuordnen.

SCHLECHT INTERPRETIERBAR

Alles gleichzeitig austauschen

Variante A Produktfoto + Nutzen-Titel + Produktseite

Variante B Lifestylebild + Rabatt-Titel + Vergleichsseite

Variante B kann gewinnen – du weißt danach aber nicht, ob Bild, Preisargument oder Landingpage den Unterschied verursacht hat.

Welche Ebene eignet sich wofür?

Kampagne, Anzeigengruppe und Anzeige haben unterschiedliche Testaufgaben

OpenAI strukturiert Ads in drei Ebenen. Wenn du die falsche Variable auf der falschen Ebene vergleichst, vermischst du schnell Budget, Intent und Creative.

Kampagne

Geschäftsziel, Objective, Budget, Länder und grundlegende Kampagnenlogik. Geeignet für größere Strategie-Tests.

Anzeigengruppe

Gemeinsames Produkt, Kundenbedürfnis, Context Hints und Gebotslogik. Geeignet für Intent- oder Use-Case-Tests.

Anzeige

Titel, Beschreibung, Bild und Ziel-URL. Geeignet für Botschafts- und Creative-Varianten innerhalb desselben Themas.

Landingpage

Die Zielseite ist kein eigener Ads-Manager-Level, beeinflusst aber Conversion und Relevanz stark. Änderungen sauber dokumentieren.

Wenn du möglichst kontrolliert vergleichen willst

Separate Kampagnen können bei größeren Tests mehr Kontrolle über das Budget geben

Graphite berichtet aus eigenen Kampagnen, dass A/B-Tests als getrennte Kampagnen sauberer sein können als als getrennte Anzeigengruppen, weil das Budget auf Kampagnenebene sitzt und die Plattform Spend zwischen Anzeigengruppen verschieben kann. Das ist ein Praxisbefund von Graphite – keine offizielle OpenAI-Regel.

Warum kann eine getrennte Kampagne helfen? Wenn du zwei große Strategien vergleichst und beide in derselben Kampagne liegen, kann eine davon deutlich mehr Budget erhalten. Das erschwert einen fairen Vergleich. Mit getrennten Kampagnen kannst du beiden Ansätzen bewusster eigenes Budget geben und verhindern, dass eine Hypothese schon deshalb kaum Daten bekommt, weil die andere früh mehr Auslieferung erhält.

Der Nachteil: Zu viele Kampagnen fragmentieren Daten und erhöhen den Pflegeaufwand. Deshalb lohnt sich diese Trennung vor allem für größere strategische Tests, nicht für jede kleine Headline-Änderung.

Gut für größere Hypothesen

Zum Beispiel zwei unterschiedliche Intent-Territorien oder zwei deutlich verschiedene Funnel-Strategien, denen du bewusst eigenes Budget geben möchtest.

Nicht für jede Kleinigkeit

Für zwei Headline-Varianten brauchst du nicht automatisch zwei Kampagnen. Sonst wird das Konto unnötig kompliziert und Daten verteilen sich auf zu viele Einheiten.

Immer Bedingungen dokumentieren

Gleiche Laufzeit, Länder, Objective, Conversion-Definition und möglichst ähnliche Budgets machen den Vergleich nachvollziehbarer.

Ohne Tracking kein belastbarer Test

Richte Conversion-Messung und URL-Parameter vor dem Teststart ein

OpenAI stellt Pixel und Conversions API für Website-Ereignisse bereit. Zusätzlich unterstützt Ads Manager statische und dynamische Query-Parameter. Damit kannst du Kampagnen, Anzeigengruppen und Anzeigen auch in deinem eigenen Analytics- oder CRM-System auseinanderhalten.

Warum muss das vor dem Start stehen? Ein Test ist nur so gut wie seine Messung. Wenn du erst nach einer Woche bemerkst, dass Käufe nicht sauber erfasst wurden oder alle Varianten unter derselben URL ohne Kennzeichnung landen, kannst du die fehlenden Informationen meist nicht zuverlässig rekonstruieren. Dann hast du Werbebudget ausgegeben, aber kaum gelernt.

Tracking hilft außerdem, Unterschiede zu erkennen, die Ads Manager allein nicht vollständig beantworten kann. Bei Leads kann zum Beispiel Variante A mehr Formulare erzeugen, während Variante B weniger, dafür aber deutlich bessere Anfragen bringt. Diese Qualität siehst du oft erst im CRM oder in deiner eigenen Auswertung.

OpenAI Pixel

Geeignet für browserseitige Conversion-Ereignisse wie Registrierung, Lead oder Kauf. Vor dem Test sollte geprüft werden, ob die relevanten Ereignisse zuverlässig ankommen.

Conversions API

Serverseitige Ereignisse können die Messung ergänzen. Wenn Pixel und CAPI dasselbe Ereignis senden, sollte eine gemeinsame Event-ID zur Deduplizierung verwendet werden.

UTM- und dynamische Parameter

OpenAI unterstützt unter anderem Makros für Campaign-, Ad-Group- und Ad-ID. Ergänze zusätzlich verständliche eigene UTM-Namen, damit du Berichte später ohne ID-Rätsel lesen kannst.

Praktische Namenslogik

Kampagne: DE_Excelkurs_Conversions · Anzeigengruppe: Einsteiger_Formeln · Anzeige: Nutzen_A · Anzeige: Sicherheit_B

So erkennst du auch in Exporten und Analytics sofort, welche Hypothese hinter einer Variante steckt.

Die richtige Kennzahl zum richtigen Ziel

Der Gewinner ist nicht immer die Anzeige mit der höchsten CTR

Ads Manager liefert inzwischen Kennzahlen auf Kampagnen-, Anzeigengruppen- und Anzeigenebene. Welche davon entscheidend ist, hängt davon ab, was du mit dem Test erreichen willst.

Warum reicht eine Kennzahl nicht? Jede Kennzahl beantwortet nur eine Teilfrage. CTR sagt, wie häufig nach einer Impression geklickt wurde. CPC sagt, was dieser Klick gekostet hat. Conversion-Rate zeigt, wie häufig nach dem Klick das gewünschte Ziel erreicht wurde. CPA zeigt, was dieses Ergebnis gekostet hat. Erst gemeinsam erkennst du, ob eine Anzeige nur Aufmerksamkeit erzeugt oder tatsächlich wirtschaftlich funktioniert.

Awareness / Views

Primär: Impressionen, CPM, Reichweiten-/Auslieferungsentwicklung.
Zusätzlich: CTR kann zeigen, ob das Creative Interesse erzeugt, ist aber nicht automatisch das Hauptziel.

Traffic / Clicks

Primär: Klicks, CTR und CPC.
Zusätzlich: Sitzungsqualität auf der Website, Scrolltiefe oder weitere Engagement-Signale, wenn sie sinnvoll gemessen werden.

Leads / Conversions

Primär: Conversions, Conversion-Rate und Kosten pro Conversion.
Zusätzlich: Leadqualität – besonders wichtig bei B2B und Dienstleistungen.

E-Commerce

Primär: Bestellungen, Umsatz, Kosten pro Bestellung und ROAS, soweit für deine Conversion-Messung verfügbar.
Wichtig: Nicht jede Conversion ist wirtschaftlich gleich wertvoll.

Beispiel: Warum die höchste CTR verlieren kann

Variante A: 1.000 Impressionen, 80 Klicks = 8 % CTR. Daraus entstehen 2 Käufe.
Variante B: 1.000 Impressionen, 50 Klicks = 5 % CTR. Daraus entstehen 5 Käufe.

Wenn du nur die CTR ansiehst, gewinnt A deutlich. Nach dem Klick sieht es aber anders aus: A wandelt 2,5 % der Klicks in Käufe um, B dagegen 10 %. Variante B zieht also weniger Menschen an, aber offenbar die passenderen.

Die wichtigste Frage lautet deshalb nicht „Welche Anzeige bekommt die meisten Klicks?“, sondern „Welche Anzeige bringt die richtigen Menschen wirtschaftlich zum gewünschten Ergebnis?“

Attribution richtig verstehen

Ein Klick ist nicht der einzige Weg zur Conversion – View-through kann Ergebnisse sichtbar machen

OpenAI unterstützt inzwischen flexible Click-through-Zeitfenster von 7, 14 oder 30 Tagen sowie optional ein eintägiges View-through-Fenster. Wenn eine Person nach einer berechtigten Impression konvertiert, ohne dass ein qualifizierender Klick die Conversion übernimmt, kann sie als View-through-Conversion gezählt werden.

Warum ist das für Tests wichtig? Manche Anzeigen wirken nicht nur über den direkten Klick. Eine Person kann ein Angebot sehen, später selbst zur Website zurückkehren und dort kaufen. Wenn du ausschließlich Last-Click-Daten betrachtest, unterschätzt du möglicherweise Varianten, die eher Erinnerung oder Vertrauen erzeugen.

Gleichzeitig solltest du View-through nicht unkritisch als „von der Anzeige verursacht“ interpretieren. Es handelt sich um Attribution innerhalb eines definierten Fensters. Genau deshalb sind stabile Einstellungen und – bei größeren Budgets – zusätzliche Incrementality-Tests sinnvoll.

Click-through

Die Person klickt die Anzeige und führt innerhalb deines gewählten Attributionsfensters eine gemessene Handlung aus.

View-through

Die Person sieht die Anzeige, klickt nicht, konvertiert aber innerhalb eines Tages. Bei einer qualifizierenden Impression kann diese Conversion separat erfasst werden.

Keine Multi-Touch-Attribution

OpenAI beschreibt die aktuelle Logik ausdrücklich als Last-Touch-Attribution, nicht als vollständige Multi-Touch-Betrachtung der gesamten Customer Journey.

Attributionsfenster im Test nicht heimlich ändern

Wenn du mitten im Vergleich das Reporting-Fenster änderst, kann dieselbe Kampagne plötzlich mehr oder weniger zugeordnete Conversions zeigen. Halte die Einstellung während eines Vergleichs stabil und dokumentiere sie.

Warum du nicht zu früh entscheiden solltest

Ads Manager aktualisiert Kennzahlen nicht alle gleichzeitig

Ein häufiger Testfehler ist, aktuelle Zahlen miteinander zu vergleichen, obwohl ein Teil der Daten noch nicht vollständig verarbeitet wurde.

Warum entstehen dadurch falsche Gewinner? Klickdaten können bereits sichtbar sein, während Kosten oder Conversions noch nachlaufen. Dann sieht eine Variante vorübergehend sehr effizient aus, obwohl die später zugeordneten Ergebnisse das Bild noch verändern. Besonders problematisch ist das, wenn du eine Anzeige früh pausierst: Sie bekommt dann gar keine Chance mehr, ihre nachlaufenden Conversions vollständig zu zeigen.

Impressionen

Werden laut OpenAI in der Regel ungefähr alle 15 Minuten aktualisiert.

Klicks & CTR

Werden ebenfalls typischerweise ungefähr alle 15 Minuten aktualisiert.

Ausgaben

Können ungefähr 7–8 Stunden hinter der aktuellen Auslieferung liegen.

Conversions

Können 24–48 Stunden benötigen, bis zugeordnete Ergebnisse im Reporting erscheinen.

Kein „Gewinner“ am selben Abend

Wenn du heute Mittag einen Test startest, ist eine Bewertung am Abend besonders bei Conversion-Zielen kaum belastbar. Warte, bis die relevanten Daten nachgelaufen sind, bevor du eine Variante pausierst.

Wie viele Daten brauchst du?

Es gibt keine magische Zahl – entscheidend ist, wie groß der Unterschied und wie stabil das Signal ist

OpenAI veröffentlicht aktuell keine feste Mindestzahl an Impressionen, Klicks oder Conversions, ab der eine Anzeigenvariante automatisch als „Gewinner“ gilt. Deshalb solltest du nicht mit erfundenen Schwellenwerten arbeiten.

Warum gibt es keine sinnvolle Universalzahl? Ein Test mit 2 % versus 2,1 % Conversion-Rate braucht viel mehr Daten, um einen echten Unterschied zu erkennen, als ein Test mit 2 % versus 8 %. Außerdem hängt die nötige Datenmenge davon ab, wie häufig dein Zielereignis überhaupt vorkommt. Bei einem günstigen Klickziel sammelst du schneller Daten als bei einem hochpreisigen B2B-Abschluss.

Für kleine Konten ist deshalb wichtiger, zwischen Signal und Beweis zu unterscheiden. Ein deutlicher Trend kann eine gute nächste Hypothese liefern, ohne dass du so tun musst, als wäre das Ergebnis statistisch endgültig.

Sehr wenig Daten

10 gegen 14 Klicks oder 1 gegen 2 Conversions sind eher Hinweise als belastbare Beweise. Kleine Zufallsschwankungen können das Ergebnis komplett drehen.

Klares und stabiles Muster

Je größer der Unterschied zwischen Varianten und je länger er über zusätzliche Daten bestehen bleibt, desto mehr Vertrauen kannst du in die Richtung gewinnen.

Business-Kennzahl schlägt Vanity Metric

Wenn A die höhere CTR hat, B aber deutlich günstigere qualifizierte Leads bringt, ist B für dein Geschäft wahrscheinlich die wichtigere Variante.

Bei kleinem Budget: explorativ statt pseudo-wissenschaftlich

Wenn dein Traffic für einen statistisch sauberen Split-Test nicht reicht, ist das kein Grund, gar nichts zu testen. Bezeichne das Ergebnis einfach korrekt als Test-and-Learn-Signal und bestätige gute Hypothesen später mit weiteren Daten.

Testdauer richtig einordnen

DEPT empfiehlt mindestens 90 Tage – aber für den Kanaltest, nicht für jede Headline

Nach sechs Monaten Erfahrung im US-Pilot empfiehlt DEPT, ChatGPT Ads lange genug laufen zu lassen, um sinnvolle Evidenz zu erzeugen. Genannt werden mindestens 90 Tage mit konzentriertem Budget rund um ein priorisiertes Produkt, eine Zielgruppe oder ein Intent-Territorium.

Warum so lange für den Kanaltest? Ein neuer Werbekanal kann von Woche zu Woche schwanken: Nachfrage, Auktion, Creative-Auslieferung und Lernkurve verändern sich. Wenn du nach wenigen Tagen entscheidest, bewertest du möglicherweise nur eine Momentaufnahme. Ein längerer Zeitraum hilft dir zu erkennen, ob ein Muster wiederholt auftritt und ob der Kanal über verschiedene Wochen hinweg wirtschaftlich funktionieren kann.

Was daraus sinnvoll folgt

Bewerte ChatGPT Ads nicht nach einer einzigen Woche und verteile ein kleines Testbudget nicht gleichzeitig auf zehn Produkte, zwanzig Anzeigengruppen und fünf Funnel-Stufen.

Was daraus nicht folgt

Du musst nicht jede einzelne Bild- oder Textvariante 90 Tage unverändert laufen lassen. Einzelne Varianten kannst du früher austauschen, wenn genügend vergleichbare Daten vorliegen oder ein klarer Qualitätsfehler sichtbar wird.

Messung über den Klick hinaus

Die Customer Journey in ChatGPT kann früher beginnen als der Website-Klick

OpenAI erweitert die Messung derzeit deutlich. Das ist besonders relevant, weil Menschen in ChatGPT häufig recherchieren, vergleichen und abwägen, bevor sie eine Website besuchen oder kaufen.

OpenAI: View-through-Effekte

OpenAI berichtet in einer frühen globalen Analyse tiefer Funnel-Ziele, dass 52,7 % der berechtigten eintägigen View-through-Conversions innerhalb einer Stunde nach der zugeordneten Anzeigenimpression erfolgten.

Incrementality statt nur Attribution

OpenAI arbeitet mit Partnern an Geo-Experimenten, um den kausalen zusätzlichen Effekt von ChatGPT Ads zu messen – also nicht nur, welcher Kanal die Conversion zuletzt zugeschrieben bekommt.

Beispiel Dose

OpenAI nennt eine WorkMagic-Geo-Lift-Studie, die für Dose 2,3-mal mehr inkrementelle Bestellungen schätzte, als Last-Click-Attribution erfasste. Das ist ein einzelner Fall und kein allgemeiner Benchmark.

Praktische Konsequenz

Bei größeren Budgets solltest du langfristig nicht nur „welche Anzeige bekam den letzten Klick?“ fragen, sondern auch „welchen zusätzlichen Geschäftseffekt erzeugt der Kanal?“.

Externe Test- und Praxiserfahrungen

Was frühe Kampagnen zeigen – und wie du daraus eigene Hypothesen ableitest

Die Plattform ist noch jung. Deshalb sind externe Cases wertvoll, sollten aber nicht als allgemeingültige Benchmarks behandelt werden. Nutze sie als Ideen für deine eigenen Tests.

DEPT: nicht zu viele Variablen gleichzeitig

DEPT empfiehlt nach sechs Monaten US-Pilot, Budget zunächst auf ein priorisiertes Produkt, eine Zielgruppe oder ein Intent-Territorium zu konzentrieren. Zu starke Fragmentierung macht es schwieriger zu erkennen, was tatsächlich die Performance beeinflusst.

DEPT Learnings ansehen ↗

Graphite: Budget als Testbudget behandeln

Graphite und Similarweb analysierten 98.000+ Anzeigen und 8.000+ Landingpages. Graphites Playbook empfiehlt, den Kanal weiterhin als Test statt als fest etablierten Kernkanal zu budgetieren und Creatives schrittweise zu skalieren.

Graphite Playbook ansehen ↗

InterTeam: Angebot an den Intent anpassen

InterTeam berichtet aus Dutzenden Kampagnentests für drei B2B-SaaS-Kunden, dass unterschiedliche Gesprächssituationen andere Angebote brauchen: Informationsinhalte bei früher Recherche, Vergleichsseiten bei Wettbewerbervergleichen und Demo-Angebote bei hoher Kaufabsicht.

InterTeam Case ansehen ↗

InterTeam: Vergleichs-Creatives als Testidee

Bei Wettbewerber-Vergleichssituationen funktionierten laut InterTeam einfache Vergleichs-Creatives mit klarer Nutzenbotschaft besonders gut. Für dein Konto ist das keine Garantie, aber eine konkrete Hypothese, die du gegen eine generischere Produktanzeige testen kannst.

Vergleichsstrategie ansehen ↗

Beispiel für einen kleinen Testplan

So kannst du mit vier Varianten systematisch statt chaotisch testen

Beispiel: Du bewirbst einen Excelkurs für Einsteiger. Angebot, Landingpage und Kundensituation bleiben zunächst gleich.

A · Angebot

Titel fokussiert direkt auf „Excelkurs für Einsteiger“.

B · Problem

Titel greift Unsicherheit auf: „Excel ohne Vorkenntnisse“.

C · Nutzen

Text betont konkrete Lernziele: Formeln, Tabellen, Auswertungen.

D · Sicherheit

Text reduziert Einwand: Schritt für Schritt und ohne Vorkenntnisse.

Danach nicht sofort vier neue Variablen öffnen

Wenn beispielsweise „Sicherheit“ deutlich besser konvertiert, entwickle als nächsten Schritt zwei neue Varianten innerhalb dieses Ansatzes. So baust du Erkenntnisse aufeinander auf, statt nach jedem Test wieder bei null zu beginnen.

Der komplette Ablauf

So gehst du bei einem ChatGPT-Ads-Test Schritt für Schritt vor

Wenn du Tests immer nach demselben Ablauf aufsetzt, werden Ergebnisse leichter vergleichbar und du übersiehst weniger wichtige Einstellungen.

1. Problem benennen

Was möchtest du verbessern? Zu wenig Klicks, zu teure Leads, schwache Conversion oder unklare Leadqualität?

2. Hypothese formulieren

Welche konkrete Veränderung könnte dieses Problem lösen – und warum?

3. Hauptkennzahl festlegen

Woran erkennst du, ob die Hypothese wirtschaftlich funktioniert?

4. Vergleich sauber bauen

Halte alles konstant, was nicht Teil der Hypothese ist.

5. Tracking prüfen

Teste Conversion-Ereignisse, URLs und Parameter, bevor Budget fließt.

6. Daten sammeln

Greife nicht nach wenigen Klicks ein, sofern kein technischer oder inhaltlicher Fehler vorliegt.

7. Gesamtergebnis bewerten

Sieh dir Haupt- und Kontrollkennzahlen gemeinsam an – nicht nur die schönste Zahl.

8. Nächste Hypothese ableiten

Ein Test endet nicht mit „Gewinner A“, sondern mit der Frage: Was haben wir gelernt und was testen wir als Nächstes?

Der wichtigste Denkfehler

Optimierung bedeutet nicht, jedes Mal etwas Neues zu erfinden. Gute Optimierung baut auf vorherigen Erkenntnissen auf. Wenn eine bestimmte Kundensituation, Botschaft oder Creative-Idee wiederholt funktioniert, entwickelst du genau diesen Ansatz weiter – statt beim nächsten Test wieder völlig zufällig zu starten.

Einfaches Testprotokoll

Dokumentiere jeden Test so, dass du in drei Monaten noch weißt, was du gelernt hast

Gerade bei mehreren Kampagnen geht schnell verloren, warum eine Variante erstellt wurde. Ein kleines Protokoll verhindert, dass du später dieselbe Idee noch einmal testest oder falsche Schlussfolgerungen ziehst.

Warum lohnt sich das schon bei kleinen Konten? Nach einigen Wochen erinnerst du dich oft noch daran, welche Anzeige gewonnen hat – aber nicht mehr daran, welche Hypothese dahinterstand, welche Landingpage damals aktiv war oder ob das Tracking zwischenzeitlich geändert wurde. Ohne diese Informationen ist ein scheinbar gutes Ergebnis schwer reproduzierbar.

Hypothese

Was glaubst du und warum?

Veränderte Variable

Was ist zwischen A und B anders?

Kontrollierte Variablen

Was bleibt bewusst gleich?

Startdatum

Wann beginnt der Vergleich?

Primäre Kennzahl

Woran entscheidest du?

Sekundäre Kennzahlen

Welche Werte verhindern eine Fehlinterpretation?

Ergebnis

Was ist tatsächlich passiert?

Nächster Test

Welche neue Hypothese folgt daraus?

Wenn der Test keinen klaren Sieger zeigt

„Kein Unterschied“ ist kein gescheiterter Test

Viele erwarten von jedem Test einen eindeutigen Gewinner. In der Praxis liegen Varianten häufig nah beieinander – besonders bei kleinen Datenmengen. Das ist trotzdem eine verwertbare Erkenntnis.

Beide Varianten ähnlich

Dann ist die getestete Veränderung möglicherweise kein großer Hebel. Das spart dir Zeit: Statt weiter an diesem Detail zu feilen, kannst du eine größere Hypothese testen – zum Beispiel ein anderes Nutzenargument oder eine andere Kundensituation.

Zu wenig Daten

Dann lautet das Ergebnis nicht „A und B sind gleich“, sondern schlicht „noch keine belastbare Entscheidung möglich“. Konzentriere Budget stärker, verlängere den Test oder reduziere die Anzahl paralleler Varianten.

Unterschiedliche Kennzahlen erzählen verschiedene Geschichten

Wenn A mehr Klicks, B aber bessere Conversions bringt, musst du zum Geschäftsziel zurück. Für eine Traffic-Kampagne kann A sinnvoll sein; für profitable Verkäufe kann B klar wichtiger sein.

Zehn typische Testfehler

Diese Fehler machen deine Ergebnisse unvergleichbar oder wertlos

1. Nach wenigen Klicks entscheiden

Kleine Zahlen schwanken stark. Ein frühes 3:1 ist noch kein belastbarer Beweis.

2. Nur CTR vergleichen

Eine Anzeige kann viele Klicks erzeugen und gleichzeitig schlechtere Leads oder Käufe bringen.

3. Mehrere Dinge gleichzeitig ändern

Dann weißt du nachher nicht, welche Veränderung den Unterschied verursacht hat.

4. Unterschiedliche Intent-Gruppen mischen

Frühe Recherche und konkrete Kaufabsicht haben andere Erfolgswahrscheinlichkeiten.

5. Reporting-Lag ignorieren

Spend und Conversions können später nachlaufen als Klicks und Impressionen.

6. Tracking nach Teststart reparieren

Fehlende oder falsch konfigurierte Events lassen sich für frühere Conversions nicht einfach rückwirkend sauber ergänzen.

7. Attribution während des Tests wechseln

Dann vergleichst du Kennzahlen, die nach unterschiedlichen Regeln berechnet wurden.

8. Budget zu stark aufsplitten

Zu viele Kampagnen und Varianten können dafür sorgen, dass keine einzelne genügend Daten sammelt.

9. Leadqualität ignorieren

Ein billiger Lead ist kein guter Lead, wenn er nie Kunde werden kann.

10. Gewinner nie erneut prüfen

Der Kanal verändert sich schnell. Was heute gewinnt, sollte später erneut gegen neue Hypothesen antreten.

Wann solltest du eine Variante pausieren?

Nicht nach Gefühl – sondern nach klarer Entscheidungsregel

Definiere vor dem Start, welches Ergebnis für dich zählt. Das reduziert die Versuchung, einen Test genau dann abzubrechen, wenn die Lieblingsvariante gerade vorne liegt.

Warum eine Entscheidungsregel vorab? Sonst entsteht schnell Cherry Picking: Gewinnt deine Lieblingsanzeige bei der CTR, erklärst du CTR zur wichtigsten Kennzahl. Verliert sie dort, aber hat einen etwas günstigeren CPC, wirkt plötzlich CPC wichtiger. Eine vorher festgelegte Hauptkennzahl zwingt dich, den Test nach dem tatsächlichen Geschäftsziel zu beurteilen statt nach der schönsten Zahl.

Klarer Qualitätsfehler

Falscher Preis, kaputter Link, missverständliche Aussage oder unpassende Landingpage? Dann musst du nicht auf mehr Daten warten – korrigiere den Fehler.

Genug Daten, wirtschaftlich klar schlechter

Wenn eine Variante über eine sinnvolle Datenmenge dauerhaft höhere Kosten pro Ergebnis und keine bessere Ergebnisqualität zeigt, kannst du sie pausieren.

Zu wenig Daten

Dann ist „kein Gewinner“ ein völlig legitimes Ergebnis. Fasse Varianten zusammen, verlängere den Zeitraum oder konzentriere Budget stärker.

Unterschied nur bei CTR

Prüfe zuerst, ob sich Conversion-Rate, CPA oder Leadqualität ebenfalls verbessern. Sonst optimierst du möglicherweise nur auf Neugier.

Vor jedem Test

Der 10-Punkte-Check für einen brauchbaren ChatGPT-Ads-Test

1. Hypothese klar?

Du weißt, was du ändern willst und warum.

2. Nur eine Hauptvariable?

Der Unterschied zwischen den Varianten ist interpretierbar.

3. Gleiches Geschäftsziel?

Du vergleichst nicht Traffic gegen Conversions.

4. Intent vergleichbar?

Die Varianten richten sich an dieselbe oder bewusst getrennte Kundensituation.

5. Tracking getestet?

Pixel, CAPI und relevante Events funktionieren vor dem Start.

6. URL-Parameter sauber?

Du kannst Varianten in Analytics und CRM auseinanderhalten.

7. Primäre Kennzahl festgelegt?

Du entscheidest nicht nach der Kennzahl, die gerade am besten aussieht.

8. Reporting-Lag berücksichtigt?

Conversions und Spend dürfen vollständig nachlaufen.

9. Genug Daten?

Du behandelst kleine Stichproben als Hinweis, nicht als endgültigen Beweis.

10. Erkenntnis dokumentiert?

Das Ergebnis fließt in den nächsten Test ein.

Passende nächste Schritte

Nach dem Test kommt die Landingpage- und Conversion-Auswertung

Landingpage optimieren

Prüfe, ob die Zielseite die Botschaft aus Anzeige und Gesprächssituation ohne Bruch fortsetzt.

Landingpage optimieren →

Anzeigentexte verbessern

Entwickle klar unterscheidbare Botschaften statt derselben Aussage mit anderen Wörtern.

Anzeigentexte ansehen →

Anzeigenbilder testen

Vergleiche Produkt, Anwendung, Nutzen und Entscheidungshilfe als unterschiedliche Creative-Konzepte.

Creatives optimieren →

Für Strategie und praktische Umsetzung

Tests vorbereiten und direkt im Ads Manager nachvollziehbar umsetzen

ChatGPT-Ads-Leitfaden

Für Kundensituationen, Context Hints, Werbebotschaften, Testhypothesen, Prompts und die strategische Planung deiner Anzeigenvarianten.

ChatGPT-Ads-Leitfaden ansehen →

ChatGPT Ads Praxisguide: Ads Manager, Plugin & erste Kampagne

Mehr als 70 eigene Screenshots zeigen dir die Oberfläche und den praktischen Aufbau von Konto, Kampagne, Anzeigengruppe und Anzeigen.

Praxisguide ansehen →

Häufige Fragen

ChatGPT Ads testen: Die wichtigsten Antworten

Kann ich bei ChatGPT Ads einen klassischen A/B-Test machen?

OpenAI empfiehlt mehrere Anzeigenvarianten innerhalb einer Anzeigengruppe. In der aktuell öffentlich dokumentierten Hilfe und API ist jedoch kein eigener Experimentmodus beschrieben, der eine garantierte 50/50-Ausspielung zweier Varianten sicherstellt. Behandle Anzeigenvergleiche deshalb als strukturierte Varianten-Tests und prüfe die tatsächliche Auslieferung.

Was sollte ich bei ChatGPT Ads zuerst testen?

Beginne mit großen strategischen Unterschieden: Kundensituation, Angebot, Botschaft und Creative-Konzept. Kleine Änderungen an einzelnen Wörtern oder Designdetails liefern meist weniger Lerngewinn, solange noch nicht klar ist, welche Grundrichtung funktioniert.

Wie viele Anzeigenvarianten sollte ich gleichzeitig testen?

Es gibt keine allgemein gültige optimale Zahl. Wichtig ist, dein Budget nicht so stark aufzusplitten, dass keine Variante genügend Daten erhält. Starte lieber mit wenigen klar unterscheidbaren Hypothesen und erweitere schrittweise.

Wie lange sollte ein ChatGPT-Ads-Test laufen?

Für einzelne Anzeigenvarianten gibt OpenAI keine feste Testdauer vor. Warte mindestens, bis relevante Reporting-Verzögerungen berücksichtigt sind und genügend Daten für deine Zielkennzahl vorliegen. DEPT empfiehlt für die Bewertung des Kanals insgesamt einen Test-and-Learn-Zeitraum von mindestens 90 Tagen mit konzentriertem Budget.

Welche Kennzahl ist bei einem Anzeigentest am wichtigsten?

Das hängt vom Ziel ab. Bei Traffic sind CTR und CPC wichtig, bei Leads oder Verkäufen vor allem Conversion-Rate, Kosten pro Ergebnis, Umsatz beziehungsweise ROAS und die Qualität der gewonnenen Kunden. Eine hohe CTR allein macht eine Variante nicht automatisch zum Gewinner.

Warum sollte ich nicht direkt nach dem Start entscheiden?

OpenAI aktualisiert Kennzahlen unterschiedlich schnell. Impressionen, Klicks und CTR werden typischerweise ungefähr alle 15 Minuten aktualisiert, ausgabenbezogene Daten können etwa 7 bis 8 Stunden verzögert sein und zugeordnete Conversions können 24 bis 48 Stunden benötigen.

Kann ich View-through-Conversions in die Auswertung einbeziehen?

Ja. Ads Manager unterstützt optional ein eintägiges View-through-Berichtsfenster. Zusätzlich kannst du ein Click-through-Fenster von 7, 14 oder 30 Tagen wählen. Halte die Einstellung während eines Tests stabil, damit deine Ergebnisse vergleichbar bleiben.

Sollte ich verschiedene Context Hints in derselben Anzeigengruppe testen?

Verwandte Formulierungen können innerhalb einer gemeinsamen Anzeigengruppe sinnvoll sein. Deutlich unterschiedliche Kundensituationen oder Use Cases, die andere Botschaften oder Landingpages benötigen, solltest du laut OpenAI in separate Anzeigengruppen aufteilen.

Quellen & Recherche

Aktuelle OpenAI-Messung plus externe Test- und Kampagnenerfahrungen

Funktionen, Kennzahlen, Attribution und Reporting-Zeiten stammen aus aktuellen OpenAI-Dokumentationen. DEPT, Graphite und InterTeam ergänzen die offizielle Hilfe um praktische Erfahrungen aus realen Kampagnen. Externe Ergebnisse werden als Testideen und Erfahrungswerte genutzt, nicht als allgemeingültige Benchmarks.