Lerne, wie du Hypothese, Stichprobe, Laufzeit und Signifikanz vorab festlegst, typische Fehler vermeidest und Tests belastbar auswertest.
Ein A/B-Test eignet sich, wenn du zwei klar definierte Varianten unter vergleichbaren Bedingungen prüfen kannst, genügend Traffic vorhanden ist und eine messbare Zielhandlung existiert. Für offene Fragen zum Verhalten oder zu den Motiven deiner Besucher ist er ungeeignet, weil er Unterschiede misst, aber deren Ursachen nicht erklärt.
Verbinde eine beobachtete Auffälligkeit mit einer vermuteten Ursache, einer konkreten Änderung und der erwarteten Wirkung auf eine Zielmetrik. Beispiel: Wenn Lieferzeit und Versandkosten direkt am Preis stehen, steigt die Add-to-Cart-Rate, weil wichtige Kaufbedingungen früher sichtbar sind. So lässt sich die Annahme eindeutig prüfen.
Lege vor dem Start genau eine primäre Zielmetrik fest, die direkt zur Hypothese passt, etwa Käufe, Registrierungen oder abgeschlossene Formulare. Sekundäre Metriken können mögliche Nebenwirkungen zeigen. Sie sollten aber nicht nachträglich zur Entscheidungsgrundlage werden, nur weil ihr Ergebnis günstiger aussieht.
Die erforderliche Stichprobe hängt von der bisherigen Conversion Rate, dem kleinsten wirtschaftlich relevanten Effekt und der akzeptierten Irrtumswahrscheinlichkeit ab. Berechne sie vor dem Start für jede Variante. Je kleiner der Effekt ist, den du erkennen möchtest, desto mehr Besucher und Conversions benötigt der Test.
Lege die Laufzeit anhand der benötigten Stichprobe und typischer Nutzungsmuster fest. Der Test sollte mindestens einen vollständigen Geschäftszyklus mit relevanten Wochen- und Wochentagen abdecken. Beende ihn weder nach einem kurzfristigen Ausschlag noch allein an einem festen Datum, wenn die geplante Stichprobe noch nicht erreicht ist.
Statistische Signifikanz beschreibt, wie gut das beobachtete Ergebnis mit der Annahme vereinbar ist, dass kein Unterschied besteht. Sie sagt nicht, ob der Effekt wirtschaftlich relevant ist. Prüfe zusätzlich Effektgröße, Konfidenzintervall, Datenqualität und mögliche Fehler bei der Traffic-Verteilung. Vermeide tägliches Peeking mit vorzeitigem Abbruch.
Bei wenig Traffic dauern aussagekräftige A/B-Tests oft zu lange oder bleiben unentschieden. Nutze dann Heatmaps, Session Replays, Smart Funnels, Rage Clicks, Befragungen oder moderierte Nutzertests, um konkrete Probleme zu finden. Technische oder offensichtliche Bedienfehler solltest du direkt beheben, statt ihre Korrektur gegen eine fehlerhafte Variante zu testen.