A/B Testing Tool: Leitfaden für valide Tests

Lerne, wie du Hypothese, Stichprobe, Laufzeit und Signifikanz vorab festlegst, typische Fehler vermeidest und Tests belastbar auswertest.

Wann ist ein A/B-Test die richtige Methode?

Ein A/B-Test eignet sich, wenn du zwei klar definierte Varianten unter vergleichbaren Bedingungen prüfen kannst, genügend Traffic vorhanden ist und eine messbare Zielhandlung existiert. Für offene Fragen zum Verhalten oder zu den Motiven deiner Besucher ist er ungeeignet, weil er Unterschiede misst, aber deren Ursachen nicht erklärt.

Wie formuliere ich eine testbare Hypothese?

Verbinde eine beobachtete Auffälligkeit mit einer vermuteten Ursache, einer konkreten Änderung und der erwarteten Wirkung auf eine Zielmetrik. Beispiel: Wenn Lieferzeit und Versandkosten direkt am Preis stehen, steigt die Add-to-Cart-Rate, weil wichtige Kaufbedingungen früher sichtbar sind. So lässt sich die Annahme eindeutig prüfen.

Welche Zielmetrik sollte ich für den Test wählen?

Lege vor dem Start genau eine primäre Zielmetrik fest, die direkt zur Hypothese passt, etwa Käufe, Registrierungen oder abgeschlossene Formulare. Sekundäre Metriken können mögliche Nebenwirkungen zeigen. Sie sollten aber nicht nachträglich zur Entscheidungsgrundlage werden, nur weil ihr Ergebnis günstiger aussieht.

Wie groß muss die Stichprobe für einen A/B-Test sein?

Die erforderliche Stichprobe hängt von der bisherigen Conversion Rate, dem kleinsten wirtschaftlich relevanten Effekt und der akzeptierten Irrtumswahrscheinlichkeit ab. Berechne sie vor dem Start für jede Variante. Je kleiner der Effekt ist, den du erkennen möchtest, desto mehr Besucher und Conversions benötigt der Test.

Wie lange sollte ein A/B-Test laufen?

Lege die Laufzeit anhand der benötigten Stichprobe und typischer Nutzungsmuster fest. Der Test sollte mindestens einen vollständigen Geschäftszyklus mit relevanten Wochen- und Wochentagen abdecken. Beende ihn weder nach einem kurzfristigen Ausschlag noch allein an einem festen Datum, wenn die geplante Stichprobe noch nicht erreicht ist.

Wie werte ich statistische Signifikanz richtig aus?

Statistische Signifikanz beschreibt, wie gut das beobachtete Ergebnis mit der Annahme vereinbar ist, dass kein Unterschied besteht. Sie sagt nicht, ob der Effekt wirtschaftlich relevant ist. Prüfe zusätzlich Effektgröße, Konfidenzintervall, Datenqualität und mögliche Fehler bei der Traffic-Verteilung. Vermeide tägliches Peeking mit vorzeitigem Abbruch.

Welche Alternativen gibt es bei wenig Traffic?

Bei wenig Traffic dauern aussagekräftige A/B-Tests oft zu lange oder bleiben unentschieden. Nutze dann Heatmaps, Session Replays, Smart Funnels, Rage Clicks, Befragungen oder moderierte Nutzertests, um konkrete Probleme zu finden. Technische oder offensichtliche Bedienfehler solltest du direkt beheben, statt ihre Korrektur gegen eine fehlerhafte Variante zu testen.