kondeor.ai unterstützt über 80 statistische Methoden sowie sechs Verfahren der qualitativen Textanalyse. Übersicht aller Methoden, nach Themenbereich gruppiert, mit einer verständlichen Erklärung sowohl aus studentischer als auch aus unternehmerischer Sicht.
Deskriptive Statistik
Deskriptive Statistik
Für Studierende: Die deskriptive Statistik fasst eine metrische Variable durch Lagemaße (Mittelwert, Median), Streuungsmaße (Standardabweichung, Interquartilsabstand) und Verteilungsform (Schiefe, Kurtosis) zusammen, ohne eine Hypothese zu testen. Meist der erste Schritt vor jeder weiterführenden Analyse — zeigt Ausreißer, Schiefe und mögliche Dateneingabefehler, bevor diese ein Testergebnis verzerren.
Für Unternehmen: Damit verschaffen Sie sich einen ersten Überblick über eine Kennzahl — zum Beispiel: Wie hoch ist der durchschnittliche Bestellwert, und wie stark streut er zwischen Kund:innen? Kein Test, keine Hypothese, einfach ein solider erster Blick auf Ihre Daten, bevor Sie tiefer einsteigen.
Häufigkeitstabelle (nominal/ordinal)
Für Studierende: Die Häufigkeitstabelle fasst eine nominale/ordinale Variable durch die Verteilung ihrer Ausprägungen zusammen — absolute und relative Häufigkeit je Kategorie, kumulierte Prozente sowie den Modus (häufigste Ausprägung). Kein Test, keine Hypothese, meist der erste Schritt vor weiterführenden Analysen kategorialer Daten — zeigt seltene oder leere Kategorien und mögliche Kodierfehler.
Für Unternehmen: Damit verschaffen Sie sich einen ersten Überblick über eine kategoriale Kennzahl — zum Beispiel: Wie verteilen sich Ihre Kund:innen auf die verschiedenen Tarife, und welcher Tarif ist der häufigste? Kein Test, keine Hypothese, einfach eine klare Aufstellung, bevor Sie tiefer einsteigen.
Verteilungsanpassung
Für Studierende: Die Verteilungsanpassung prüft, welcher theoretischen Verteilung (Normal-, Poisson-, Gamma-, Weibull-, Lognormal-, Exponential- oder Negativ-Binomial-Verteilung) eine metrische Variable am ehesten folgt — über Kennwertvergleich, grafische Diagnostik (Q-Q-Plot) und Anpassungsgütemaße (z. B. AIC zwischen konkurrierenden Verteilungen). Wichtig als Vorstufe, wenn eine spätere Methode eine bestimmte Verteilungsannahme voraussetzt (z. B. Weibull für Ausfallzeiten).
Für Unternehmen: Damit finden Sie heraus, welchem typischen Muster Ihre Daten folgen — zum Beispiel, ob Wartezeiten eher exponentiell oder Ausfälle eher nach einem Weibull-Muster verteilt sind. Das ist oft ein Zwischenschritt, wenn eine spätere Analyse eine bestimmte Verteilungsform voraussetzt, etwa bei Lebensdauer- oder Risikoanalysen.
Spezielle Mittelwerte (geometrisch/harmonisch, CAGR)
Für Studierende: Spezielle Mittelwerte decken Fälle ab, in denen das arithmetische Mittel irreführend wäre: das geometrische Mittel für Wachstumsraten über mehrere Perioden (z. B. CAGR), das harmonische Mittel für Verhältniszahlen (z. B. Durchschnittsgeschwindigkeit bei konstanter Strecke). Bei starkem Wachstum/Schrumpfung über Zeit liefert das arithmetische Mittel systematisch verzerrte Werte.
Für Unternehmen: Damit berechnen Sie eine durchschnittliche Wachstumsrate korrekt — zum Beispiel den durchschnittlichen jährlichen Umsatzzuwachs über fünf Jahre (CAGR), statt die einzelnen Jahresraten einfach arithmetisch zu mitteln, was bei schwankendem Wachstum ein verzerrtes Bild ergibt.
Mehrfachantworten (Häufigkeiten)
Für Studierende: Bei Fragen mit mehreren möglichen Antworten („Mehrfachnennungen“) werden die Einzelvariablen zu einem Mehrfachantwortenset zusammengefasst – als Dichotomien (je Option ja/nein) oder als Kategorien. Ausgewertet werden Häufigkeiten, Prozent der Antworten und Prozent der Fälle; beide Prozentangaben unterscheiden sich, weil eine Person mehrere Antworten geben kann.
Für Unternehmen: Wertet Fragen wie „Welche Kanäle nutzen Sie? (Mehrfachnennung möglich)“ korrekt aus: wie viele Befragte jede Option genannt haben und wie sich die Nennungen verteilen – ohne dass Mehrfachnennungen die Prozentwerte verzerren.
Anteilstests
Chi-Quadrat-Test
Für Studierende: Der Chi-Quadrat-Unabhängigkeitstest prüft, ob ein Zusammenhang zwischen zwei kategorialen Variablen besteht, indem beobachtete mit erwarteten Häufigkeiten in einer Kreuztabelle verglichen werden (H₀: Variablen sind unabhängig). Voraussetzung: erwartete Zellhäufigkeiten überwiegend ≥5 — bei Verletzung alternativ Fisher's Exact Test. Effektstärke: Cramérs V.
Für Unternehmen: Damit prüfen Sie, ob zwei Merkmale zusammenhängen — zum Beispiel: Hängt die Wahl des Tarifs vom Wohnort ab? Das Ergebnis zeigt Ihnen, ob es sich lohnt, diese Gruppen unterschiedlich anzusprechen, oder ob der Zusammenhang nur zufällig aussieht.
McNemar-Test
Für Studierende: Der McNemar-Test prüft, ob sich der Anteil einer binären Variable zwischen zwei verbundenen Messungen derselben Einheiten signifikant verändert hat (z. B. Zustimmung vorher/nachher) — er nutzt dabei nur die diskordanten Zellpaare (Wechsel in eine Richtung vs. die andere), konkordante Fälle tragen keine Information zum Unterschied bei.
Für Unternehmen: Damit prüfen Sie, ob sich eine Ja/Nein-Einschätzung bei denselben Personen über die Zeit verändert hat — zum Beispiel: Stimmen nach einer Werbekampagne mehr Personen einer Aussage zu als vorher? Nur die tatsächlichen Meinungswechsel zählen, keine Person, die durchgängig gleich geantwortet hat.
Fishers exakter Test
Für Studierende: Fishers exakter Test prüft wie der Chi-Quadrat-Test einen Zusammenhang zwischen zwei kategorialen Variablen in einer Kreuztabelle, berechnet die Signifikanz aber exakt über die hypergeometrische Verteilung statt approximativ — geeignet gerade bei kleinen Stichproben oder niedrigen erwarteten Zellhäufigkeiten (<5), wo die Chi-Quadrat-Approximation unzuverlässig wird.
Für Unternehmen: Damit prüfen Sie einen Zusammenhang zwischen zwei Merkmalen, wenn Ihre Stichprobe klein ist — der übliche Chi-Quadrat-Test wird dann ungenau. Fishers exakter Test liefert auch bei wenigen Fällen ein verlässliches Ergebnis, etwa bei einer kleinen Pilotbefragung.
Chi-Quadrat-Anpassungstest
Für Studierende: Der Chi-Quadrat-Anpassungstest prüft, ob die beobachteten Häufigkeiten einer einzelnen kategorialen Variable von einer erwarteten/theoretischen Verteilung abweichen (H₀: beobachtete = erwartete Verteilung) — anders als der Unabhängigkeitstest vergleicht er nicht zwei Variablen, sondern eine Variable gegen einen festen Referenzwert.
Für Unternehmen: Damit prüfen Sie, ob die tatsächliche Verteilung eines Merkmals von einer erwarteten Verteilung abweicht — zum Beispiel: Entsprechen die Anteile der Zahlungsarten in Ihren Daten den erwarteten Marktanteilen, oder gibt es eine auffällige Verschiebung?
Cochran's Q-Test
Für Studierende: Cochran's Q-Test erweitert den McNemar-Test auf mehr als zwei verbundene dichotome Messungen derselben Einheiten (H₀: alle Anteile sind gleich) — z. B. Zustimmung zu derselben Aussage über drei oder mehr Messzeitpunkte. Bei Signifikanz zeigen paarweise McNemar-Nachtests, welche Zeitpunkte sich konkret unterscheiden.
Für Unternehmen: Damit prüfen Sie, ob sich eine Ja/Nein-Einschätzung bei denselben Personen über mehr als zwei Messzeitpunkte verändert hat — zum Beispiel Zustimmung zu einer Maßnahme, gemessen vor, während und nach der Umsetzung, bei denselben Befragten.
Binomialtest
Für Studierende: Der Binomialtest prüft, ob der beobachtete Anteil einer dichotomen Variable signifikant von einem erwarteten/theoretischen Anteilswert abweicht (H₀: p = p₀), exakt berechnet über die Binomialverteilung — geeignet gerade bei kleinen Stichproben, wo eine Normalapproximation (z-Test für Anteile) unzuverlässig wäre.
Für Unternehmen: Damit prüfen Sie, ob ein beobachteter Anteil von einem erwarteten Wert abweicht — zum Beispiel: Liegt Ihre tatsächliche Rücklaufquote signifikant unter den branchenüblichen 20 %, oder ist die Abweichung nur Zufall?
Wald-Wolfowitz Runs Test
Für Studierende: Der Wald-Wolfowitz Runs Test prüft, ob die Reihenfolge einer dichotomen/binären Sequenz zufällig ist, indem die Anzahl der 'Runs' (Folgen gleicher aufeinanderfolgender Werte) gegen die bei Zufälligkeit erwartete Anzahl geprüft wird — zu wenige Runs deuten auf Clusterbildung hin, zu viele auf ein alternierendes Muster.
Für Unternehmen: Damit prüfen Sie, ob eine Abfolge von Ja/Nein-Ereignissen zufällig ist oder einem Muster folgt — zum Beispiel, ob Reklamationen gleichmäßig über die Zeit verteilt auftreten oder sich auffällig in Serien häufen, was auf eine systematische Ursache hindeuten würde.
Gruppenvergleiche
t-Test (unabhängig)
Für Studierende: Der t-Test für unabhängige Stichproben prüft, ob sich die Mittelwerte einer metrischen Variable zwischen zwei unabhängigen Gruppen signifikant unterscheiden (H₀: μ₁ = μ₂). Voraussetzungen: Normalverteilung der AV in beiden Gruppen (bei kleinen Stichproben relevant), Varianzhomogenität (Levene-Test) — bei Verletzung: Welch-Test. Nichtparametrische Alternative bei starker Abweichung von der Normalverteilung: Mann-Whitney-U-Test. Fehlen in den verwendeten Variablen Werte, lässt sich die Analyse im Ergebnis per Knopf mit Multipler Imputation neu rechnen: Die fehlenden Werte werden fünfmal plausibel ergänzt, die Analyse wird je Datensatz gerechnet und die Ergebnisse werden nach Rubins Regeln gepoolt. Das ist in der Regel verlässlicher als das Weglassen unvollständiger Fälle, weil keine Information verloren geht und die Unsicherheit durch die Ergänzung im Standardfehler berücksichtigt wird.
Für Unternehmen: Damit prüfen Sie, ob ein beobachteter Unterschied zwischen zwei Gruppen real ist oder nur Zufall — zum Beispiel: Geben Kund:innen, die Kampagne A gesehen haben, im Schnitt mehr aus als jene mit Kampagne B? Das Ergebnis zeigt Ihnen, ob Sie diesem Unterschied vertrauen können. Haben einzelne Befragte Fragen ausgelassen, müssen Sie diese Fälle nicht verwerfen: Per Knopf rechnet kondeor.ai die Analyse mit statistisch ergänzten Werten neu. So bleiben alle Antworten im Ergebnis, ohne es zu verzerren.
Gepaarter t-Test
Für Studierende: Der t-Test für gepaarte/verbundene Stichproben prüft, ob sich der Mittelwert einer metrischen Variable zwischen zwei Messzeitpunkten derselben Personen signifikant unterscheidet (H₀: μ_Differenz = 0). Voraussetzung: Die Differenzwerte sind annähernd normalverteilt. Nichtparametrische Alternative: Wilcoxon-Vorzeichen-Rang-Test.
Für Unternehmen: Damit prüfen Sie, ob sich bei denselben Personen zwischen zwei Zeitpunkten wirklich etwas verändert hat — zum Beispiel: Ist die Zufriedenheit nach einer Schulung höher als davor, bei denselben Mitarbeitenden gemessen? So erkennen Sie, ob eine Maßnahme tatsächlich wirkt.
Mann-Whitney-U-Test
Für Studierende: Der Mann-Whitney-U-Test vergleicht die Rangverteilung einer AV zwischen zwei unabhängigen Gruppen (H₀: beide Verteilungen sind gleich) — die nichtparametrische Alternative zum t-Test. Passt bei echt ordinaler AV, aber auch bei metrischer AV mit verletzter Normalverteilungsannahme oder kleinen Stichproben, da er ohne Verteilungsannahme auskommt.
Für Unternehmen: Damit vergleichen Sie zwei Gruppen, wenn Ihre Daten nicht der Normalverteilung folgen oder Sie nur wenige Fälle haben — etwa bei stark schiefen Bewertungsskalen. Das Ergebnis sagt Ihnen, ob eine Gruppe tendenziell höhere Werte hat als die andere, robust auch gegenüber Ausreißern.
Wilcoxon-Vorzeichenrang-Test
Für Studierende: Der Wilcoxon-Vorzeichen-Rang-Test prüft, ob sich zwei verbundene Messungen derselben Einheiten in ihrer zentralen Tendenz unterscheiden (H₀: Median der Differenzen = 0) — die nichtparametrische Alternative zum gepaarten t-Test. Passt bei ordinaler AV oder bei metrischer AV mit verletzter Normalverteilungsannahme der Differenzwerte.
Für Unternehmen: Damit prüfen Sie, ob sich bei denselben Personen zwischen zwei Zeitpunkten etwas verändert hat, wenn Ihre Werte nicht normalverteilt sind — zum Beispiel bei Zufriedenheits-Skalen mit stark schiefer Verteilung. Robuste Alternative zum gepaarten t-Test.
Einfaktorielle ANOVA
Für Studierende: Die einfaktorielle Varianzanalyse prüft mittels F-Statistik, ob sich die Mittelwerte einer metrischen AV zwischen drei oder mehr Gruppen unterscheiden (H₀: alle Gruppenmittelwerte sind gleich). Voraussetzungen: Normalverteilung je Gruppe, Varianzhomogenität (Levene-Test). Bei Signifikanz zeigt ein Post-hoc-Test (z. B. Tukey HSD), welche Gruppenpaare sich konkret unterscheiden. Nichtparametrische Alternative: Kruskal-Wallis-Test.
Für Unternehmen: Damit vergleichen Sie mehr als zwei Gruppen gleichzeitig — zum Beispiel die Kundenzufriedenheit über drei Filialstandorte hinweg. Das Ergebnis zeigt Ihnen zunächst, ob sich überhaupt irgendwo ein Unterschied zeigt, und mit einem Folgetest, zwischen welchen Standorten genau.
Zweifaktorielle ANOVA
Für Studierende: Die zweifaktorielle Varianzanalyse prüft die Haupteffekte zweier kategorialer Faktoren sowie deren Interaktionseffekt auf eine metrische AV. Besonders aufschlussreich ist der Interaktionseffekt: Er zeigt, ob sich die Wirkung eines Faktors je nach Ausprägung des anderen Faktors unterscheidet. Voraussetzungen wie bei der einfaktoriellen ANOVA, zusätzlich möglichst ausgeglichene Zellbesetzung.
Für Unternehmen: Damit prüfen Sie zwei Einflussfaktoren gleichzeitig — zum Beispiel, ob Geschlecht UND Altersgruppe die Produktbewertung beeinflussen, und ob sich diese beiden Faktoren gegenseitig verstärken oder abschwächen. Das macht Zielgruppen-Kombinationen sichtbar, die ein einfacher Vergleich übersehen würde.
ANOVA mit Messwiederholung
Für Studierende: Die ANOVA mit Messwiederholung prüft, ob sich der Mittelwert einer metrischen AV über mehr als zwei Messzeitpunkte derselben Einheiten signifikant verändert (H₀: alle Zeitpunkt-Mittelwerte sind gleich). Zusätzliche Voraussetzung gegenüber der einfaktoriellen ANOVA: Sphärizität (Mauchly-Test; bei Verletzung Korrektur nach Greenhouse-Geisser). Nichtparametrische Alternative: Friedman-Test.
Für Unternehmen: Damit prüfen Sie, ob sich bei denselben Personen über mehr als zwei Zeitpunkte etwas verändert hat — zum Beispiel die Kundenzufriedenheit, gemessen vor, kurz nach und drei Monate nach der Einführung eines neuen Services, bei denselben Kund:innen.
Mixed ANOVA
Für Studierende: Die Mixed ANOVA kombiniert einen Messwiederholungsfaktor (within-subjects, z. B. Zeit) mit einem unabhängigen Gruppierungsfaktor (between-subjects, z. B. Behandlungsgruppe) in einem Modell. Der entscheidende Effekt ist meist die Interaktion: Verläuft die Veränderung über die Zeit in den Gruppen unterschiedlich? Voraussetzungen kombinieren die von RM-ANOVA (Sphärizität) und unabhängiger ANOVA (Varianzhomogenität).
Für Unternehmen: Damit prüfen Sie, ob sich eine Entwicklung über die Zeit zwischen verschiedenen Gruppen unterschiedlich zeigt — zum Beispiel: Verbessert sich die Zufriedenheit nach einer Schulung in der Experimentalgruppe stärker als in der Kontrollgruppe? Genau diese unterschiedliche Entwicklung ist meist die eigentlich interessante Frage.
Kruskal-Wallis-Test
Für Studierende: Der Kruskal-Wallis-Test vergleicht die Rangverteilung einer AV zwischen drei oder mehr unabhängigen Gruppen (H₀: alle Verteilungen sind gleich) — die nichtparametrische Erweiterung des Mann-Whitney-U-Tests auf mehr als zwei Gruppen. Passt bei ordinaler AV oder metrischer AV mit verletzter Normalverteilungsannahme. Bei Signifikanz zeigen paarweise Post-hoc-Tests, welche Gruppen sich konkret unterscheiden — wahlweise Dunn-Test (mit Bonferroni-Korrektur) oder der Dwass-Steel-Critchlow-Fligner-Test (DSCF), der bei allen paarweisen Vergleichen eine Alternative ohne die teils konservative Bonferroni-Korrektur bietet.
Für Unternehmen: Damit vergleichen Sie mehr als zwei Gruppen, wenn Ihre Daten nicht normalverteilt sind — zum Beispiel Bewertungen über mehrere Filialen hinweg bei einer stark schiefen Skala. Robuste Alternative zur einfaktoriellen ANOVA.
Friedman-Test
Für Studierende: Der Friedman-Test vergleicht die Rangverteilung einer AV über mehr als zwei Messzeitpunkte derselben Einheiten (H₀: alle Zeitpunkte sind rangmäßig gleich verteilt) — die nichtparametrische Alternative zur ANOVA mit Messwiederholung. Passt bei ordinaler AV oder metrischer AV mit verletzter Normalverteilungsannahme.
Für Unternehmen: Damit prüfen Sie eine Entwicklung über mehr als zwei Zeitpunkte bei denselben Personen, wenn Ihre Werte nicht normalverteilt sind — zum Beispiel Zufriedenheitsbewertungen zu drei Messzeitpunkten auf einer schiefen Skala.
MANCOVA
Für Studierende: Die MANCOVA erweitert die MANOVA um eine oder mehrere Kovariaten, deren Einfluss auf die abhängigen Variablen herausgerechnet (kontrolliert) wird, bevor der Gruppenunterschied geprüft wird — reduziert Fehlervarianz und erhöht so die Teststärke, wenn die Kovariate tatsächlich mit den AVs zusammenhängt.
Für Unternehmen: Damit vergleichen Sie Gruppen auf mehreren Ergebnisgrößen gleichzeitig und rechnen dabei einen Störfaktor heraus — zum Beispiel Zufriedenheit UND Loyalität zwischen drei Filialen vergleichen, während Sie das unterschiedliche Durchschnittsalter der Kundschaft je Filiale kontrollieren.
MANOVA
Für Studierende: Die MANOVA prüft, ob sich Gruppen gleichzeitig auf mehreren korrelierten metrischen AVs unterscheiden (H₀: Gruppen-Zentroide sind gleich) — statt mehrere einzelne ANOVAs zu rechnen, was die Fehlerwahrscheinlichkeit kumuliert. Testkriterium meist Pillai's Trace (robust) oder Wilks' Lambda. Voraussetzungen: multivariate Normalverteilung, Homogenität der Kovarianzmatrizen (Box-M-Test).
Für Unternehmen: Damit vergleichen Sie Gruppen auf mehreren zusammenhängenden Ergebnisgrößen gleichzeitig, statt jede einzeln zu testen — zum Beispiel Zufriedenheit UND Weiterempfehlungsbereitschaft gemeinsam über drei Filialen, was auch Zusammenhänge zwischen den beiden Größen berücksichtigt.
ANCOVA
Für Studierende: Die ANCOVA erweitert die ANOVA um eine oder mehrere Kovariaten, deren Einfluss auf die AV herausgerechnet wird, bevor der Gruppenunterschied geprüft wird — reduziert Fehlervarianz und kontrolliert einen systematischen Störfaktor. Zusätzliche Voraussetzung: Homogenität der Regressionssteigungen (kein Kovariate×Gruppe-Interaktionseffekt).
Für Unternehmen: Damit vergleichen Sie Gruppen fair, auch wenn sie sich in einem anderen relevanten Merkmal unterscheiden — zum Beispiel Kundenzufriedenheit zwischen zwei Filialen vergleichen, während Sie das unterschiedliche Durchschnittseinkommen der Kundschaft je Filiale herausrechnen.
Einstichproben-t-Test
Für Studierende: Der Einstichproben-t-Test prüft, ob der Mittelwert einer metrischen Variable signifikant von einem festen, vorab definierten Vergleichswert abweicht (H₀: μ = μ₀) — keine zweite Gruppe nötig. Voraussetzung: annähernde Normalverteilung der Variable, relevant bei kleinen Stichproben.
Für Unternehmen: Damit prüfen Sie, ob ein Durchschnittswert von einem festen Zielwert oder Normwert abweicht — zum Beispiel: Liegt die durchschnittliche Lieferzeit signifikant über dem vertraglich vereinbarten Zielwert von drei Tagen?
Dreifaktorielle ANOVA
Für Studierende: Die dreifaktorielle Varianzanalyse erweitert die zweifaktorielle ANOVA auf drei kategoriale Faktoren gleichzeitig — geprüft werden alle drei Haupteffekte, alle drei Zweifach-Interaktionen sowie die Dreifach-Interaktion. Letztere ist oft schwer interpretierbar und benötigt eine ausreichend große Stichprobe, da die Zellenzahl mit jedem Faktor multiplikativ wächst.
Für Unternehmen: Damit prüfen Sie drei Einflussfaktoren gleichzeitig auf ein Ergebnis — zum Beispiel Region, Kundensegment UND Saison bei der Umsatzentwicklung. Zeigt auch komplexe Muster, bei denen sich Effekte erst in bestimmten Kombinationen aller drei Faktoren zeigen — braucht dafür aber eine ausreichend große Stichprobe pro Kombination.
Äquivalenztest (TOST)
Für Studierende: Der Äquivalenztest (TOST, zwei einseitige Tests nach Lakens) prüft, ob sich zwei Gruppen, zwei Messzeitpunkte oder ein Mittelwert und ein Referenzwert höchstens um eine vorab festgelegte, praktisch unbedeutende Spanne unterscheiden. Wichtig, weil ein nicht signifikanter t-Test keine Gleichheit belegt – er zeigt nur, dass kein Unterschied nachgewiesen wurde. Die Äquivalenzgrenzen (z. B. ±0,3 Cohens d) müssen inhaltlich begründet sein.
Für Unternehmen: Belegt, dass zwei Varianten gleichwertig sind – etwa ein günstigerer Lieferant liefert die gleiche Zufriedenheit oder ein neues Verfahren die gleichen Ergebnisse. Ein normaler Test kann das nicht zeigen, er kann nur Unterschiede nachweisen.
Zusammenhang & Korrelation
Korrelation (Pearson/Spearman/Kendall)
Für Studierende: Der Korrelationskoeffizient (Pearson bei linearem Zusammenhang und metrischen Variablen, Spearman bei monotonem Zusammenhang oder Ordinaldaten) quantifiziert Stärke und Richtung des Zusammenhangs zweier Variablen zwischen -1 und +1. Wichtig: Korrelation impliziert keine Kausalität, und Ausreißer können den Koeffizienten stark verzerren — vorab Streudiagramm prüfen. Fehlen in den verwendeten Variablen Werte, lässt sich die Analyse im Ergebnis per Knopf mit Multipler Imputation neu rechnen: Die fehlenden Werte werden fünfmal plausibel ergänzt, die Analyse wird je Datensatz gerechnet und die Ergebnisse werden nach Rubins Regeln gepoolt. Das ist in der Regel verlässlicher als das Weglassen unvollständiger Fälle, weil keine Information verloren geht und die Unsicherheit durch die Ergänzung im Standardfehler berücksichtigt wird. Bei der Korrelation gilt das für Pearson.
Für Unternehmen: Damit prüfen Sie, ob zwei Kennzahlen zusammenhängen — zum Beispiel Werbeausgaben und Umsatz. Ein hoher Wert zeigt einen engen Zusammenhang, sagt aber noch nicht, dass das eine das andere verursacht — die Ursache dahinter müssen Sie fachlich einordnen. Haben einzelne Befragte Fragen ausgelassen, müssen Sie diese Fälle nicht verwerfen: Per Knopf rechnet kondeor.ai die Analyse mit statistisch ergänzten Werten neu. So bleiben alle Antworten im Ergebnis, ohne es zu verzerren.
Partielle Korrelation
Für Studierende: Die partielle Korrelation quantifiziert den Zusammenhang zwischen zwei Variablen, nachdem der lineare Einfluss einer dritten (Kontroll-)Variable aus beiden herausgerechnet wurde — deckt auf, ob ein beobachteter Zusammenhang tatsächlich direkt besteht oder größtenteils durch die dritte Variable vermittelt wird (Scheinkorrelation).
Für Unternehmen: Damit prüfen Sie, ob ein Zusammenhang zwischen zwei Kennzahlen wirklich direkt besteht oder nur scheinbar, weil eine dritte Größe beide beeinflusst — zum Beispiel: Hängen Umsatz und Mitarbeiterzahl wirklich direkt zusammen, oder erklärt das eher die Filialgröße beide gemeinsam?
Punkt-biseriale Korrelation
Für Studierende: Die punkt-biseriale Korrelation ist ein Spezialfall der Pearson-Korrelation für den Zusammenhang zwischen einer dichotomen (0/1) und einer metrischen Variable — mathematisch äquivalent zum t-Test für unabhängige Stichproben, aber als standardisierte Effektstärke zwischen -1 und +1 statt als Signifikanztest interpretierbar.
Für Unternehmen: Damit quantifizieren Sie, wie stark ein Ja/Nein-Merkmal mit einer Zahl zusammenhängt — zum Beispiel, wie eng die Zugehörigkeit zu einem Treueprogramm mit dem Bestellwert zusammenhängt, ausgedrückt als ein einziger Kennwert zwischen -1 und +1.
Kendalls W (Konkordanzkoeffizient)
Für Studierende: Kendalls W (Konkordanzkoeffizient) quantifiziert, wie stark mehrere Rater in ihrer Rangordnung derselben Objekte übereinstimmen (0 = keine Übereinstimmung, 1 = perfekte Übereinstimmung) — mathematisch verwandt mit dem Friedman-Test, aber als deskriptives Übereinstimmungsmaß interpretiert statt als Signifikanztest.
Für Unternehmen: Damit prüfen Sie, wie einig sich mehrere Personen bei einer Rangfolge sind — zum Beispiel, wenn mehrere Bewerter:innen dieselben Bewerbungen unabhängig voneinander in eine Reihenfolge bringen. Ein hoher Wert zeigt, dass die Rangfolge kaum von der bewertenden Person abhängt.
Vorhersage & Regression
Lineare Regression
Für Studierende: Die lineare Regression modelliert eine metrische AV als gewichtete Summe eines oder mehrerer Prädiktoren. Die Koeffizienten geben an, um wie viele Einheiten sich die AV bei einer Erhöhung des Prädiktors um eine Einheit ändert (ceteris paribus bei mehreren Prädiktoren). Voraussetzungen (Gauß-Markov): Linearität, Homoskedastizität der Residuen, keine starke Multikollinearität (VIF prüfen), annähernd normalverteilte Residuen. Fehlen in den verwendeten Variablen Werte, lässt sich die Analyse im Ergebnis per Knopf mit Multipler Imputation neu rechnen: Die fehlenden Werte werden fünfmal plausibel ergänzt, die Analyse wird je Datensatz gerechnet und die Ergebnisse werden nach Rubins Regeln gepoolt. Das ist in der Regel verlässlicher als das Weglassen unvollständiger Fälle, weil keine Information verloren geht und die Unsicherheit durch die Ergänzung im Standardfehler berücksichtigt wird.
Für Unternehmen: Damit finden Sie heraus, welche Faktoren ein Ergebnis erklären und wie stark — zum Beispiel, welchen Einfluss Preis, Werbebudget und Saison auf den Umsatz haben. Das Ergebnis lässt sich auch für Prognosen nutzen: Wie würde sich der Umsatz bei einer Preisänderung voraussichtlich entwickeln? Haben einzelne Befragte Fragen ausgelassen, müssen Sie diese Fälle nicht verwerfen: Per Knopf rechnet kondeor.ai die Analyse mit statistisch ergänzten Werten neu. So bleiben alle Antworten im Ergebnis, ohne es zu verzerren.
Logistische Regression
Für Studierende: Die logistische Regression modelliert die Wahrscheinlichkeit eines binären Ereignisses (0/1) in Abhängigkeit von einem oder mehreren Prädiktoren über die Logit-Verknüpfung. Koeffizienten werden meist als Odds Ratios interpretiert (exp(β)): Werte >1 erhöhen, Werte <1 verringern die Chance auf das Ereignis. Gütemaße: Pseudo-R², Klassifikationsgenauigkeit, ROC-AUC.
Für Unternehmen: Damit sagen Sie eine Ja/Nein-Entscheidung voraus und verstehen, was sie beeinflusst — zum Beispiel, ob eine Kundin kündigt oder nicht. Das Ergebnis zeigt Ihnen, welche Merkmale die Wahrscheinlichkeit erhöhen oder senken, und lässt sich nutzen, um gefährdete Kund:innen frühzeitig zu erkennen.
Ordinale Regression
Für Studierende: Die ordinale Regression (meist proportional-odds-Modell) modelliert eine AV mit mehr als zwei geordneten Kategorien (z. B. Likert-Skala) unter Ausnutzung der Rangordnung — im Unterschied zur multinomialen Regression, die diese Ordnung ignorieren würde. Voraussetzung: Proportional-Odds-Annahme (die Koeffizienten gelten gleichermaßen für alle Schwellenwerte) — prüfbar über einen eigenen Test.
Für Unternehmen: Damit sagen Sie eine abgestufte Bewertung voraus, die eine natürliche Reihenfolge hat — zum Beispiel eine Zufriedenheitsskala von 'sehr unzufrieden' bis 'sehr zufrieden'. Nutzt diese Reihenfolge gezielt aus, statt sie wie bei einer einfachen Kategorie-Vorhersage zu ignorieren.
Poisson-Regression
Für Studierende: Die Poisson-Regression modelliert eine Zähldaten-AV (nicht-negative Ganzzahlen, z. B. Anzahl Ereignisse pro Zeiteinheit) in Abhängigkeit von Prädiktoren — setzt voraus, dass Mittelwert und Varianz der AV annähernd gleich sind. Bei Überdispersion (Varianz > Mittelwert, häufig in der Praxis) liefert die Negativ-Binomial-Regression verlässlichere Standardfehler.
Für Unternehmen: Damit sagen Sie voraus, wie oft ein Ereignis in einem festen Zeitraum auftritt — zum Beispiel die Anzahl der Kundenbeschwerden pro Monat in Abhängigkeit von Filialgröße und Personalstand. Geeignet, wenn es um Zählungen geht, nicht um Durchschnittswerte.
Negativ-Binomial-Regression
Für Studierende: Die Negativ-Binomial-Regression modelliert wie die Poisson-Regression eine Zähldaten-AV, lässt aber einen zusätzlichen Dispersionsparameter zu — geeignet, wenn die Varianz der AV deutlich größer ist als ihr Mittelwert (Überdispersion), was bei der Poisson-Regression zu unterschätzten Standardfehlern und fälschlich signifikanten Ergebnissen führen würde.
Für Unternehmen: Damit sagen Sie Häufigkeiten voraus, die stärker schwanken, als eine einfache Zählverteilung erwarten lässt — zum Beispiel Reklamationszahlen, die in manchen Filialen ungewöhnlich stark ausschlagen. Liefert dadurch verlässlichere Aussagen darüber, welche Einflussfaktoren wirklich signifikant sind.
Gamma-Regression
Für Studierende: Die Gamma-Regression modelliert eine positive, rechtsschiefe metrische AV (z. B. Wartezeit, Kosten, Schadenshöhe) über eine Gamma-verteilte Fehlerstruktur statt der Normalverteilungsannahme der linearen Regression — passend, wenn die Streuung mit dem Niveau der AV zunimmt, was bei solchen Größen typisch ist.
Für Unternehmen: Damit sagen Sie Größen voraus, die nie negativ werden können und oft stark nach oben ausreißen — zum Beispiel Reparaturkosten oder Bearbeitungsdauer. Passt oft besser als eine gewöhnliche lineare Regression, wenn wenige sehr hohe Werte das Bild sonst verzerren würden.
Robuste Regression
Für Studierende: Die robuste Regression schätzt wie die lineare Regression den Zusammenhang zwischen Prädiktoren und einer metrischen AV, gewichtet einflussreiche Beobachtungen (Ausreißer) dabei aber automatisch herunter (z. B. über M-Schätzer), statt sie wie die gewöhnliche Kleinste-Quadrate-Schätzung überproportional stark einzubeziehen.
Für Unternehmen: Damit erhalten Sie ein verlässlicheres Ergebnis, wenn einzelne extreme Werte eine gewöhnliche Regression verzerren würden — zum Beispiel ein paar außergewöhnlich große Bestellungen, die den Zusammenhang zwischen Werbebudget und Umsatz sonst überzeichnen. Die robuste Regression lässt sich davon weniger beeindrucken.
Multinomiale Regression
Für Studierende: Die multinomiale logistische Regression erweitert die binäre logistische Regression auf eine AV mit mehr als zwei, nicht geordneten Kategorien. Für jede Kategorie (relativ zu einer Referenzkategorie) werden eigene Koeffizienten geschätzt, interpretierbar wiederum als Odds Ratios gegenüber der Referenzkategorie.
Für Unternehmen: Damit sagen Sie eine Auswahl zwischen mehreren Optionen voraus — zum Beispiel, welchen von drei Tarifen eine Person wählt. Das Ergebnis zeigt Ihnen, welche Merkmale für welche Wahl typisch sind, und hilft bei der gezielten Ansprache unterschiedlicher Kundensegmente.
Zero-Inflated-Regression
Für Studierende: Die Zero-Inflated-Regression modelliert eine Zähldaten-AV mit deutlich mehr Nullen, als ein Standard-Zählmodell (Poisson/Negativ-Binomial) erwarten würde — kombiniert zwei Prozesse: einen für 'strukturelle' Nullen (Ereignis kann per se nicht auftreten) und einen für die eigentliche Zählverteilung. Ein Vuong-Test kann prüfen, ob das Zero-Inflated-Modell wirklich besser passt als das einfache Zählmodell.
Für Unternehmen: Damit sagen Sie Häufigkeiten voraus, bei denen 'null' viel öfter vorkommt, als eine normale Zählverteilung erklären könnte — zum Beispiel Anzahl der Reklamationen, wenn ein großer Teil der Kund:innen aus strukturellen Gründen nie reklamiert. Das Modell trennt diese beiden Ursachen sauber.
Beta-Regression
Für Studierende: Die Beta-Regression modelliert eine AV, die ein Anteilswert zwischen 0 und 1 ist (z. B. Marktanteil, Zufriedenheitsquote), über eine Beta-verteilte Fehlerstruktur — respektiert dabei automatisch die natürliche Begrenzung auf das Intervall (0,1), was eine gewöhnliche lineare Regression nicht tut (sie könnte Werte außerhalb dieses Bereichs vorhersagen).
Für Unternehmen: Damit sagen Sie eine Quote oder einen Anteil voraus — zum Beispiel den Anteil zufriedener Kund:innen je Filiale in Abhängigkeit von Servicequalität. Das Modell berücksichtigt automatisch, dass ein Anteil nie unter 0 % oder über 100 % liegen kann.
Residuenanalyse
Für Studierende: Die Residuenanalyse prüft nach einer Regression systematisch deren Voraussetzungen: Homoskedastizität (Streuung der Residuen konstant über die Vorhersagewerte), Normalverteilung der Residuen (Q-Q-Plot, Shapiro-Wilk), sowie einflussreiche Einzelbeobachtungen (Cook's Distance, Leverage). Ergänzend prüft der VIF (Varianzinflationsfaktor) auf Multikollinearität zwischen den Prädiktoren und der Durbin-Watson-Test auf Autokorrelation der Residuen (relevant vor allem bei Zeitreihen- oder Verlaufsdaten). Wichtig, um zu beurteilen, ob den geschätzten Koeffizienten und p-Werten vertraut werden kann.
Für Unternehmen: Damit prüfen Sie, ob Sie einer Regression überhaupt vertrauen können — zum Beispiel, ob wenige extreme Einzelfälle das Ergebnis über Gebühr beeinflusst haben, oder ob die Streuung der Fehler an einem Ende der Vorhersage deutlich größer ist als am anderen. Ein wichtiger Kontrollschritt nach jeder Regression.
Quantilregression
Für Studierende: Die Quantilregression modelliert den Effekt von Prädiktoren nicht nur auf den Mittelwert (wie die lineare Regression), sondern auf beliebige Quantile (z. B. Median, 10 %- oder 90 %-Quantil) der AV-Verteilung — besonders aufschlussreich bei schiefen Verteilungen, wo sich ein Effekt am oberen und unteren Rand der Verteilung deutlich unterscheiden kann. Berechnet werden standardmäßig fünf Quantile (τ = .10/.25/.50/.75/.90), mit Bootstrap-Standardfehlern statt der bei schiefen Verteilungen unzuverlässigeren asymptotischen Schätzung.
Für Unternehmen: Damit prüfen Sie, ob ein Einflussfaktor überall gleich stark wirkt, oder nur bei besonders hohen oder niedrigen Werten — zum Beispiel, ob sich Werbewirkung bei Vielkäufer:innen anders auswirkt als bei Gelegenheitskäufer:innen. Ein gewöhnlicher Mittelwertvergleich würde diesen Unterschied überdecken.
Regularisierte Regression (Ridge/LASSO)
Für Studierende: Regularisierte Regression (Ridge, LASSO, Elastic Net) fügt der gewöhnlichen Regression einen Strafterm auf die Koeffizientengröße hinzu, um Overfitting bei vielen oder stark korrelierten Prädiktoren zu vermeiden. Ridge schrumpft Koeffizienten gleichmäßig gegen null, LASSO kann sie exakt auf null setzen (Variablenselektion), Elastic Net kombiniert beides (per Mischungsparameter α). Die Stärke der Strafe (λ, bei Elastic Net zusätzlich α) wird nicht von Hand festgelegt, sondern per Kreuzvalidierung (10-fold) so gewählt, dass der Vorhersagefehler minimal wird.
Für Unternehmen: Damit erhalten Sie ein stabileres, besser generalisierbares Modell, wenn Sie viele mögliche Einflussfaktoren gleichzeitig einbeziehen wollen — zum Beispiel Dutzende Kundenmerkmale zur Umsatzprognose. LASSO kann dabei automatisch die weniger wichtigen Merkmale ganz aus dem Modell entfernen.
Multivariate Verfahren
Explorative Faktorenanalyse
Für Studierende: Die explorative Faktorenanalyse reduziert eine größere Zahl korrelierter Items auf wenige zugrundeliegende Faktoren (latente Dimensionen). Vorgehen: Eignungsprüfung (KMO-Kriterium, Bartlett-Test), Faktorextraktion (z. B. Hauptachsen), Rotation (z. B. Varimax für orthogonale, Promax für korrelierte Faktoren) zur besseren Interpretierbarkeit der Ladungen. Die Anzahl der zu extrahierenden Faktoren wird per Parallelanalyse und MAP-Kriterium (Minimum Average Partial) empfohlen — beide gelten als zuverlässiger als das bloße Eigenwert-über-1-Kriterium (Kaiser-Guttman).
Für Unternehmen: Damit bündeln Sie viele Einzelfragen zu wenigen aussagekräftigen Dimensionen — zum Beispiel aus 20 Zufriedenheitsfragen drei übergeordnete Themenblöcke wie 'Service', 'Preis' und 'Produktqualität'. Das macht komplexe Befragungen übersichtlich und leichter kommunizierbar.
Cluster-Analyse (k-Means)
Für Studierende: Die k-means-Clusteranalyse gruppiert Fälle anhand mehrerer metrischer Variablen in k möglichst homogene, untereinander möglichst verschiedene Gruppen, basierend auf der euklidischen Distanz zu iterativ optimierten Clusterzentren. Die Anzahl k wird vorab festgelegt (z. B. Ellbogen-Kriterium oder Silhouetten-Koeffizient zur Orientierung), Variablen sollten vorher standardisiert werden.
Für Unternehmen: Damit finden Sie natürliche Kundengruppen in Ihren Daten, ohne dass Sie die Gruppen vorher kennen müssen — zum Beispiel Segmente mit ähnlichem Kaufverhalten. Das Ergebnis eignet sich gut für zielgruppenspezifisches Marketing oder Produktangebote.
Diskriminanzanalyse
Für Studierende: Die Diskriminanzanalyse prüft, welche Variablen bereits bekannte Gruppen am besten trennen, und leitet daraus eine Klassifikationsfunktion ab. Anders als die Clusteranalyse setzt sie bekannte Gruppenzugehörigkeit voraus. Die Güte der Trennung wird über Wilks' Lambda geprüft (H₀: die Diskriminanzfunktion trennt die Gruppen nicht besser als der Zufall) — je näher an 0, desto besser die Trennung. Voraussetzungen: multivariate Normalverteilung je Gruppe, Homogenität der Kovarianzmatrizen (bei Verletzung: quadratische statt lineare Diskriminanzanalyse, siehe LDA/QDA).
Für Unternehmen: Damit finden Sie heraus, welche Merkmale bereits bekannte Gruppen am besten unterscheiden — zum Beispiel, was treue von abwandernden Kund:innen unterscheidet. Das Modell lässt sich anschließend nutzen, um neue Fälle automatisch der wahrscheinlichsten Gruppe zuzuordnen.
Hierarchische Clusteranalyse
Für Studierende: Die hierarchische Clusteranalyse gruppiert Fälle schrittweise (agglomerativ: von Einzelfällen zu immer größeren Clustern) anhand einer Distanzmetrik und einer Linkage-Methode (z. B. Ward für kompakte, gleich große Cluster). Ergebnis ist ein Dendrogramm, aus dem die Clusteranzahl erst nachträglich (visuell oder über einen Schwellenwert) abgeleitet wird, statt vorab festgelegt zu werden.
Für Unternehmen: Damit finden Sie Gruppen in Ihren Daten, ohne vorab eine feste Anzahl festlegen zu müssen — das Ergebnis ist eine Baumstruktur, die zeigt, welche Fälle sich wie ähnlich sind, und Sie entscheiden erst danach, wie viele Gruppen für Ihren Zweck sinnvoll sind.
Latente Klassenanalyse (LCA)
Für Studierende: Die Latente Klassenanalyse (LCA) deckt unbeobachtete (latente) Untergruppen in Daten anhand kategorialer/dichotomer Indikatorvariablen auf — im Unterschied zur Clusteranalyse ein modellbasierter, probabilistischer Ansatz: jeder Fall erhält eine geschätzte Zugehörigkeitswahrscheinlichkeit zu jeder Klasse statt einer harten Zuordnung. Modellgüte über Informationskriterien (AIC/BIC) zwischen Lösungen mit unterschiedlicher Klassenanzahl.
Für Unternehmen: Damit decken Sie versteckte Untergruppen in Ihren Daten auf, basierend auf Antwortmustern — zum Beispiel unterschiedliche Kundentypen anhand mehrerer Ja/Nein-Fragen zum Kaufverhalten. Anders als bei der klassischen Clusteranalyse bekommt jede Person eine Wahrscheinlichkeit statt einer starren Zuordnung.
LDA/QDA (ML-Klassifikator)
Für Studierende: LDA/QDA sind ML-Klassifikatoren mit bekannter Gruppenzugehörigkeit, methodisch eng verwandt mit der klassischen Diskriminanzanalyse, aber als Benchmark-Vergleich mehrerer Modellvarianten angelegt: LDA nimmt gleiche Kovarianzmatrizen über die Gruppen an (lineare Trenngrenze), QDA erlaubt gruppenspezifische Kovarianzmatrizen (quadratische, flexiblere Trenngrenze) — auf Kosten von mehr zu schätzenden Parametern.
Für Unternehmen: Damit vergleichen Sie zwei Varianten eines Klassifikationsmodells bei bekannten Gruppen — die einfachere Variante (LDA) nimmt an, dass sich die Gruppen nur in der Lage unterscheiden, die flexiblere (QDA) erlaubt auch unterschiedliche Streuungsmuster je Gruppe. Nützlich, um die beste Vorhersagegüte für Ihren konkreten Datensatz zu finden.
Kausalanalyse & Strukturmodelle
Mediationsanalyse
Für Studierende: Die Mediationsanalyse prüft, ob (und wie stark) der Effekt einer unabhängigen Variable X auf eine abhängige Variable Y über eine dritte Variable M (den Mediator) vermittelt wird — zerlegt den Gesamteffekt in einen direkten Effekt (X→Y ohne M) und einen indirekten Effekt (X→M→Y), meist über Bootstrap-Konfidenzintervalle auf Signifikanz geprüft.
Für Unternehmen: Damit verstehen Sie nicht nur, DASS zwei Dinge zusammenhängen, sondern WARUM — zum Beispiel: Wirkt sich eine Schulung auf die Kundenzufriedenheit aus, weil sie zu besserem Service führt? Der indirekte Effekt über den Service zeigt Ihnen, wie viel des Gesamteffekts sich so erklären lässt.
Moderationsanalyse
Für Studierende: Die Moderationsanalyse prüft, ob die Stärke oder Richtung des Effekts von X auf Y von der Ausprägung einer dritten Variable W abhängt — modelliert über einen Interaktionsterm (X×W). Bei Signifikanz zeigt eine Simple-Slopes-Analyse den X→Y-Effekt getrennt für niedrige/mittlere/hohe Werte von W.
Für Unternehmen: Damit prüfen Sie, ob ein Effekt für alle gleich stark gilt, oder nur unter bestimmten Bedingungen — zum Beispiel, ob sich Werbung nur bei jüngeren Kund:innen auf den Umsatz auswirkt, bei älteren aber kaum. Das hilft, Maßnahmen gezielter auf die Gruppen zuzuschneiden, bei denen sie wirklich wirken.
Mehrebenenanalyse (Mixed Models)
Für Studierende: Die Mehrebenenanalyse (Mixed Models) berücksichtigt eine geschachtelte/geclusterte Datenstruktur (z. B. Mitarbeitende innerhalb von Filialen, Messwiederholungen innerhalb von Personen), indem sie feste Effekte (wie in der Regression) mit zufälligen Effekten (Varianz zwischen den Clustern) kombiniert — ignoriert man die Clusterung, werden Standardfehler systematisch unterschätzt. Erweiterungen für binäre und Zähldaten-AVs verfügbar. Berichtet werden u. a. R² marginal (erklärte Varianz nur durch die festen Effekte) und R² conditional (zusätzlich inklusive der zufälligen Effekte) sowie ein LR-Test, der prüft, ob ein Modell mit zufälligen Effekten das Modell tatsächlich signifikant verbessert. Ist die abhängige Variable nicht metrisch, wird ein verallgemeinertes Mehrebenenmodell (GLMM) gerechnet: logistisch für zweistufige Ergebnisse (z. B. bestanden/nicht bestanden) oder Poisson für Zähldaten (z. B. Anzahl der Besuche). Neben verschachtelten Ebenen (Schülerinnen und Schüler in Klassen) sind auch gekreuzte Zufallseffekte möglich, etwa wenn dieselben Personen mehrere Items bewerten und sowohl Personen als auch Items streuen.
Für Unternehmen: Damit werten Sie Daten korrekt aus, die in Gruppen verschachtelt sind — zum Beispiel Mitarbeiterbefragungen, bei denen Personen innerhalb derselben Filiale ähnlicher antworten als über Filialen hinweg. Eine gewöhnliche Regression würde diese Ähnlichkeit ignorieren und zu falsch sicheren Ergebnissen führen. Funktioniert auch, wenn das Ergebnis eine Ja/Nein-Entscheidung ist (z. B. Kauf ja oder nein) oder eine Anzahl (z. B. Beschwerden pro Filiale) – jeweils unter Berücksichtigung, dass Kundinnen und Kunden zu Filialen oder Regionen gehören.
Konfirmatorische Faktorenanalyse (CFA)
Für Studierende: Die konfirmatorische Faktorenanalyse (CFA) prüft eine vorab theoretisch festgelegte Faktorstruktur (welches Item zu welchem Faktor gehört), im Unterschied zur explorativen Faktorenanalyse, die die Struktur erst entdeckt. Modellgüte über Fit-Indizes (CFI, TLI, RMSEA, SRMR) beurteilt — kein einzelner Signifikanztest, sondern ein Zusammenspiel mehrerer Kennwerte. Bei unzureichender Passung zeigen Modifikationsindizes, welche zusätzliche Pfad- oder Ladungsbeziehung die Passung am stärksten verbessern würde. Bei fehlenden Werten kann FIML (Full Information Maximum Likelihood) statt listenweisem Fallausschluss genutzt werden.
Für Unternehmen: Damit bestätigen Sie, ob eine bereits angenommene Struktur von Fragen zu Themenblöcken auch wirklich zu Ihren Daten passt — zum Beispiel, ob sich fünf Fragen tatsächlich wie erwartet zu 'Servicequalität' zusammenfassen lassen, statt diese Struktur erst zu suchen wie bei der explorativen Variante.
Strukturgleichungsmodell (SEM)
Für Studierende: Das Strukturgleichungsmodell (SEM) kombiniert ein Messmodell (mehrere Indikatoren pro latentem Faktor, wie bei der CFA) mit Strukturpfaden zwischen mehreren latenten Faktoren gleichzeitig — erlaubt komplexe Theoriemodelle mit mehreren abhängigen und unabhängigen latenten Konstrukten in einem einzigen, gemeinsam geschätzten Modell statt mehrerer getrennter Regressionen. Die Modellgüte wird wie bei der CFA über Fit-Indizes (CFI, RMSEA, SRMR) beurteilt; bei fehlenden Werten kann FIML (Full Information Maximum Likelihood) statt Fallausschluss genutzt werden.
Für Unternehmen: Damit testen Sie ein komplexes Theoriemodell mit mehreren zusammenhängenden Konzepten auf einmal — zum Beispiel, wie Servicequalität die Zufriedenheit beeinflusst, die wiederum die Loyalität beeinflusst, wobei jedes Konzept selbst aus mehreren Fragen gemessen wird. Alles in einem Modell statt in mehreren Einzelschritten.
Serielle Mediation (PROCESS Modell 6)
Für Studierende: Die serielle Mediation (PROCESS Modell 6) prüft eine Wirkungskette mit zwei Mediatoren in fester Reihenfolge: X wirkt auf M1, M1 auf M2 und M2 auf Y. Getestet werden alle indirekten Effekte (über M1, über M2 und über beide nacheinander) mit Bootstrap-Konfidenzintervallen.
Für Unternehmen: Zeigt, über welche Zwischenschritte eine Maßnahme wirkt – z. B. Werbung erhöht die Bekanntheit, Bekanntheit das Vertrauen und Vertrauen schließlich die Kaufabsicht – und welcher Weg am meisten beiträgt.
Moderierte Mediation (PROCESS Modell 7/14)
Für Studierende: Die moderierte Mediation (PROCESS Modell 7 bzw. 14) prüft, ob ein indirekter Effekt von einer dritten Variable W abhängt – entweder auf dem Pfad von X zum Mediator (Modell 7) oder vom Mediator zu Y (Modell 14). Kennwert ist der Index der moderierten Mediation; die bedingten indirekten Effekte werden für verschiedene Ausprägungen von W berichtet.
Für Unternehmen: Zeigt, für wen ein Wirkmechanismus gilt – z. B. ob eine Kampagne nur bei jüngeren Kundinnen und Kunden über mehr Vertrauen zu höherer Kaufbereitschaft führt, bei älteren aber nicht.
Wachstumskurvenmodell
Für Studierende: Wachstumskurvenmodelle beschreiben individuelle Verläufe über mehrere Messzeitpunkte: einen mittleren Startwert und eine mittlere Veränderung (linear oder quadratisch) sowie deren Streuung zwischen Personen. Gerechnet als Mehrebenenmodell und/oder als latentes Wachstumsmodell (SEM), optional mit zeitvariierenden Kovariaten. Im Unterschied zur ANOVA mit Messwiederholung werden auch unterschiedliche Messzeitpunkte und fehlende Messungen gut verarbeitet.
Für Unternehmen: Zeigt, wie sich eine Kennzahl über die Zeit entwickelt – im Durchschnitt und wie unterschiedlich einzelne Kundinnen, Kunden oder Standorte dabei verlaufen, z. B. ob die Zufriedenheit nach einer Einführung steigt und bei wem schneller.
Skalenanalyse & Reliabilität
Reliabilitätsanalyse (Cronbachs Alpha)
Für Studierende: Die Reliabilitätsanalyse (Cronbachs Alpha, bei Bedarf McDonalds Omega) quantifiziert die interne Konsistenz mehrerer Items, die dieselbe latente Eigenschaft messen sollen — ein hoher Wert (üblich: ≥0,7) deutet darauf hin, dass die Items tatsächlich dasselbe Konstrukt erfassen. Trennschärfe je Item zeigt, ob ein einzelnes Item die Skala eher schwächt.
Für Unternehmen: Damit prüfen Sie, ob mehrere Fragen einer Skala wirklich dasselbe messen — zum Beispiel fünf Fragen zur Kundenzufriedenheit, die Sie zu einem Gesamtwert zusammenfassen wollen. Ein hoher Wert zeigt, dass sich das rechtfertigt; ein niedriger, dass die Fragen zu unterschiedliche Dinge erfassen.
Intraklassenkorrelation (ICC)
Für Studierende: Die Intraklassenkorrelation (ICC) quantifiziert den Grad der Übereinstimmung zwischen zwei oder mehr Ratern/Messungen derselben metrischen Größe — es existieren mehrere Varianten (z. B. ICC(2,1) für zufällige Rater, ICC(3,1) für feste Rater), Auswahl abhängig vom Studiendesign. Einstufung nach Landis & Koch als grobe Orientierung.
Für Unternehmen: Damit prüfen Sie, wie verlässlich eine Messung ist, wenn sie von mehreren Personen oder Verfahren stammt — zum Beispiel, wie einig sich zwei Qualitätsprüfer:innen bei derselben numerischen Bewertung sind. Ein hoher Wert zeigt, dass die Messung unabhängig davon, wer misst, zu ähnlichen Ergebnissen kommt.
Bayes'sche Verfahren
Bayesianischer Test (t-Test/ANOVA/Korrelation)
Für Studierende: Der bayesianische Test (für t-Test, ANOVA oder Korrelation) liefert statt eines p-Werts einen Bayes-Faktor, der die relative Evidenz für die Alternativ- gegenüber der Nullhypothese quantifiziert — erlaubt dadurch auch, Evidenz FÜR die Nullhypothese auszudrücken (kein signifikanter Unterschied ≠ keine Evidenz), was ein klassischer p-Wert nicht kann.
Für Unternehmen: Damit können Sie – anders als beim klassischen p-Wert – auch aussagen, wie stark die Evidenz für 'kein Unterschied' spricht, nicht nur, dass keiner gefunden wurde. Nützlich, wenn Sie aktiv zeigen wollen, dass sich zwei Varianten wirklich nicht unterscheiden, statt nur, dass der Unterschied nicht nachweisbar war.
Medizinische Statistik
Kaplan-Meier-Überlebenszeitanalyse
Für Studierende: Die Kaplan-Meier-Überlebenszeitanalyse schätzt die Wahrscheinlichkeit, ein Ereignis (z. B. Ausfall, Abwanderung) bis zu einem bestimmten Zeitpunkt noch nicht erlebt zu haben — berücksichtigt dabei korrekt zensierte Fälle (Beobachtung endete, ohne dass das Ereignis eintrat, z. B. Studienende). Gruppenvergleiche über den Log-Rank-Test.
Für Unternehmen: Damit schätzen Sie, wie lange es typischerweise dauert, bis ein Ereignis eintritt — zum Beispiel, wie viele Kund:innen nach welcher Zeit abwandern. Funktioniert auch korrekt mit Kund:innen, die zum Auswertungszeitpunkt noch aktiv sind (deren 'Ausfallzeit' also noch unbekannt ist).
Cox-Regression
Für Studierende: Die Cox-Regression modelliert den Einfluss von Prädiktoren auf das Ereignisrisiko (Hazard) über die Zeit, ohne eine bestimmte Verteilung der Überlebenszeit selbst anzunehmen (semi-parametrisch) — Koeffizienten interpretierbar als Hazard Ratios (exp(β)): Werte >1 erhöhen, Werte <1 verringern das Risiko. Voraussetzung: proportionale Hazards (prüfbar über Schoenfeld-Residuen).
Für Unternehmen: Damit finden Sie heraus, welche Faktoren das Risiko eines Ereignisses erhöhen oder senken, und wie stark — zum Beispiel, welchen Einfluss Vertragslaufzeit und Nutzungshäufigkeit auf das Abwanderungsrisiko haben. Geeignet, wenn Sie nicht nur OB, sondern auch WANN ein Ereignis eintritt, berücksichtigen wollen.
ROC-Kurve & AUC
Für Studierende: Die ROC-Kurve stellt Sensitivität gegen 1-Spezifität über alle möglichen Cutoff-Werte eines kontinuierlichen Scores dar, wenn der tatsächliche binäre Ausgang bekannt ist. Die Fläche unter der Kurve (AUC, 0,5=Zufall, 1,0=perfekt) fasst die Trennschärfe in einem Kennwert zusammen; der Youden-Index liefert den optimalen Cutoff-Punkt.
Für Unternehmen: Damit bewerten Sie, wie gut ein Score oder Modell zwischen zwei Ausgängen unterscheidet — zum Beispiel, wie gut ein Risiko-Score tatsächliche Kündiger:innen von treuen Kund:innen trennt. Zeigt außerdem den besten Schwellenwert, ab dem Sie den Score als Warnsignal nutzen sollten.
Diagnostischer Test (Sens./Spez.)
Für Studierende: Die diagnostische Testgüte berechnet für einen binären Test gegen einen bekannten Referenzstandard: Sensitivität (Anteil korrekt erkannter positiver Fälle), Spezifität (Anteil korrekt erkannter negativer Fälle), sowie Vorhersagewerte (PPV/NPV, abhängig von der Prävalenz) und Likelihood-Ratios — inkl. Konfidenzintervallen zur Einschätzung der Präzision.
Für Unternehmen: Damit prüfen Sie, wie zuverlässig ein Ja/Nein-Prüfverfahren tatsächlich ist, verglichen mit einer bekannten 'wahren' Antwort — zum Beispiel, wie gut ein automatisiertes Prüfverfahren fehlerhafte Teile tatsächlich erkennt, und wie oft es fälschlich Alarm schlägt oder einen Fehler übersieht.
Bland-Altman-Analyse
Für Studierende: Die Bland-Altman-Analyse vergleicht zwei Messverfahren oder Rater für dieselbe metrische Größe grafisch und quantitativ — trägt die Differenz gegen den Mittelwert beider Messungen auf, um systematische Verzerrung (Bias) und die Streubreite der Übereinstimmung (Limits of Agreement) sichtbar zu machen, statt nur eine einzelne Korrelation zu berichten.
Für Unternehmen: Damit prüfen Sie, ob zwei Messverfahren für dieselbe Größe austauschbar sind — zum Beispiel ein neues, günstigeres Messgerät gegen das bisherige. Zeigt nicht nur, OB beide ähnlich messen, sondern auch, ob eines systematisch höher oder niedriger misst als das andere.
Maschinelles Lernen
Entscheidungsbaum (CART)
Für Studierende: Der Entscheidungsbaum (CART) teilt die Daten schrittweise anhand des Prädiktors und Schwellenwerts, der die Zielgröße am besten trennt (Unreinheitsmaße: Gini-Index oder Entropie bei Klassifikation, Varianzreduktion bei Regression), bis ein Abbruchkriterium erreicht ist — Ergebnis ist eine nachvollziehbare Folge von Wenn-Dann-Regeln, leicht interpretierbar, aber anfällig für Overfitting ohne Beschneidung (Pruning). Das Pruning folgt der 1-SE-Regel: statt des Baums mit dem geringsten Kreuzvalidierungsfehler wird der kleinste Baum gewählt, dessen Fehler noch innerhalb einer Standardfehlerbreite des Minimums liegt — bevorzugt also bewusst Einfachheit gegenüber minimaler Optimierung.
Für Unternehmen: Damit erhalten Sie ein Vorhersagemodell, das sich wie eine Reihe einfacher Wenn-Dann-Entscheidungen lesen lässt — zum Beispiel 'Wenn Vertragslaufzeit < 12 Monate UND Nutzung sinkend, dann hohes Abwanderungsrisiko'. Gut geeignet, wenn Nachvollziehbarkeit wichtiger ist als maximale Vorhersagegenauigkeit.
Conditional Inference Tree
Für Studierende: Der Conditional Inference Tree funktioniert wie ein gewöhnlicher Entscheidungsbaum, wählt Splits aber über formale Signifikanztests statt reiner Unreinheitsmaße (Gini/Entropie) aus — vermeidet dadurch systematisch die Verzerrung klassischer CART-Bäume hin zu Prädiktoren mit vielen möglichen Splitpunkten und braucht kein separates Pruning, da der Baum stoppt, sobald kein Split mehr signifikant ist. Ausgegeben wird zu jedem Split der zugehörige p-Wert, sodass direkt nachvollziehbar bleibt, warum an dieser Stelle geteilt wurde.
Für Unternehmen: Damit erhalten Sie einen Entscheidungsbaum wie beim klassischen CART, aber mit statistisch fundierterer Aufteilung — vermeidet die Tendenz, Merkmale mit vielen möglichen Ausprägungen künstlich zu bevorzugen, was bei einem gewöhnlichen Baum passieren kann.
Random Forest
Für Studierende: Random Forest kombiniert viele Entscheidungsbäume (Ensemble), die jeweils auf einer zufälligen Stichprobe der Fälle (Bagging) und einer zufälligen Teilmenge der Prädiktoren pro Split trainiert werden — die finale Vorhersage ist der Mehrheitsentscheid (Klassifikation) bzw. Mittelwert (Regression) aller Bäume. Reduziert die Overfitting-Neigung eines einzelnen Baums deutlich, auf Kosten der direkten Interpretierbarkeit. Die Modellgüte lässt sich ohne separate Testdaten am Out-of-Bag-Error (OOB) ablesen — jeder Baum wird nur an den Fällen getestet, die nicht in seiner eigenen Bagging-Stichprobe waren. Die Variable Importance (nach mittlerer Abnahme der Genauigkeit, MDA, oder des Gini-Index, MDI) zeigt zumindest, welche Prädiktoren am meisten zur Vorhersage beitragen.
Für Unternehmen: Damit erhalten Sie ein deutlich treffsicheres Vorhersagemodell, indem viele einzelne 'Meinungen' (Entscheidungsbäume) kombiniert werden statt nur einer — vergleichbar mit einer Gruppenentscheidung statt einer Einzelmeinung. Kostet dafür etwas an Nachvollziehbarkeit gegenüber einem einzelnen Entscheidungsbaum.
Gradient Boosting
Für Studierende: Gradient Boosting baut wie Random Forest ein Ensemble aus Entscheidungsbäumen, trainiert diese aber sequenziell statt unabhängig voneinander: Jeder neue Baum lernt gezielt, die Fehler der bisherigen Bäume zu korrigieren. Liefert bei sorgfältiger Abstimmung (Lernrate, Baumanzahl, -tiefe) meist eine höhere Vorhersagegüte als Random Forest, ist aber überfitting-anfälliger und rechenintensiver. Die Hyperparameter (u. a. Baumanzahl) werden über 5-fold-Kreuzvalidierung bestimmt; die Relative Influence je Prädiktor zeigt, wie stark dieser insgesamt zur Fehlerreduktion über alle Bäume beigetragen hat — das Gegenstück zur Variable Importance bei Random Forest.
Für Unternehmen: Damit erhalten Sie oft die höchste Vorhersagegüte unter den Baum-basierten Verfahren — jeder neue Baum konzentriert sich gezielt auf die Fälle, die die bisherigen Bäume noch falsch eingeschätzt haben. Braucht dafür sorgfältigere Abstimmung als Random Forest, um nicht die Trainingsdaten auswendig zu lernen.
Support Vector Machine (SVM)
Für Studierende: Die Support Vector Machine (SVM) sucht die Trennlinie/-ebene zwischen Klassen, die den größtmöglichen Abstand (Margin) zu den nächstgelegenen Datenpunkten beider Klassen hat — bei nicht-linear trennbaren Daten über einen Kernel-Trick (z. B. RBF-Kernel) in einen höherdimensionalen Raum projiziert, in dem eine lineare Trennung möglich wird.
Für Unternehmen: Damit finden Sie eine möglichst robuste Trennlinie zwischen zwei Gruppen — zum Beispiel zwischen betrugsverdächtigen und unauffälligen Transaktionen. Funktioniert auch, wenn sich die Gruppen nicht durch eine einfache gerade Linie trennen lassen, sondern ein komplexeres Muster nötig ist.
k-Nearest-Neighbours (kNN)
Für Studierende: k-Nearest-Neighbours (kNN) sagt für einen neuen Fall die Klasse (Mehrheitsentscheid) oder den Wert (Mittelwert) der k ähnlichsten Fälle im Trainingsdatensatz voraus, basierend auf einer Distanzmetrik (meist euklidisch) — kein eigentliches 'Training' eines Modells, die Vorhersage erfolgt direkt zur Laufzeit anhand der gespeicherten Daten. Die Wahl von k beeinflusst maßgeblich Bias-Varianz-Trade-off und wird per Leave-One-Out-Kreuzvalidierung (LOO-CV) optimiert. Da die Distanzberechnung sonst von Variablen mit größerer Skala dominiert würde, werden alle Prädiktoren vorab z-standardisiert.
Für Unternehmen: Damit sagen Sie einen neuen Fall anhand seiner 'Nachbarn' voraus — zum Beispiel: Wie haben sich Kund:innen mit ähnlichem Profil in der Vergangenheit verhalten? Intuitiv nachvollziehbar, funktioniert aber am besten bei überschaubar vielen, gut vergleichbaren Merkmalen.
Naive Bayes
Für Studierende: Naive Bayes ist ein probabilistischer Klassifikator, der über den Satz von Bayes die Wahrscheinlichkeit jeder Klasse gegeben die Prädiktorwerte berechnet — die 'naive' (oft verletzte, aber praktisch meist unproblematische) Annahme: alle Prädiktoren sind untereinander bedingt unabhängig gegeben die Klasse. Schnell, robust bei vielen Prädiktoren (z. B. Textklassifikation), aber schlechter kalibrierte Wahrscheinlichkeiten als andere Verfahren. Für metrische Prädiktoren wird die Gauß-Variante (Gauß-NB) verwendet, die je Klasse eine Normalverteilung schätzt; ausgegeben werden neben der Klassenzuordnung auch die A-priori-Wahrscheinlichkeiten je Klasse (deren relative Häufigkeit vor Berücksichtigung der Prädiktoren).
Für Unternehmen: Damit klassifizieren Sie neue Fälle schnell und mit wenig Rechenaufwand — klassisch bei der Spam-Erkennung eingesetzt (welche Wörter deuten auf Spam hin), funktioniert aber generell gut bei vielen Merkmalen gleichzeitig. Einfach und robust, wenn auch nicht immer das genaueste Verfahren.
Neuronales Netz
Für Studierende: Das (einfache Feedforward-)neuronale Netz verkettet mehrere Schichten gewichteter, nichtlinear transformierter Verknüpfungen, um komplexe, nichtlineare Zusammenhänge zwischen Prädiktoren und Zielgröße zu modellieren — flexibler als klassische Regressionsmodelle, aber bei kleinen Stichproben overfitting-anfällig und kaum direkt interpretierbar (Blackbox-Charakter). Die Anzahl der Hidden Nodes (verdeckte Neuronen) bestimmt die Modellkomplexität; wie bei kNN werden alle Prädiktoren vorab z-standardisiert, da sonst Variablen mit größerer Skala das Training dominieren.
Für Unternehmen: Damit modellieren Sie komplexe Zusammenhänge, die sich mit einfacheren Modellen nicht gut abbilden lassen — geeignet bei vielen Einflussfaktoren mit komplizierten Wechselwirkungen. Braucht dafür genügend Daten und liefert weniger direkt nachvollziehbare Erklärungen als ein einfacheres Modell.
Zeitreihenanalyse
Zeitreihenanalyse (ARIMA)
Für Studierende: Die Zeitreihenanalyse (ARIMA) modelliert eine zeitlich geordnete Messreihe über autoregressive Terme (Abhängigkeit von vergangenen Werten), Differenzierung (zur Entfernung von Trends) und gleitende Durchschnitte (Abhängigkeit von vergangenen Fehlern) — liefert eine Prognose künftiger Werte inklusive Konfidenzintervall, das mit wachsendem Prognosehorizont breiter wird. Die passende Modellordnung wird automatisch über auto.arima nach AICc-Optimierung gewählt; ein ADF-Test prüft vorab, ob die Reihe stationär ist oder differenziert werden muss, ein Ljung-Box-Test im Anschluss, ob in den Residuen noch unerklärte Autokorrelation steckt.
Für Unternehmen: Damit erstellen Sie eine Prognose für eine Kennzahl, die Sie regelmäßig über die Zeit messen — zum Beispiel den Monatsumsatz für die nächsten sechs Monate. Das Ergebnis zeigt nicht nur einen Punktwert, sondern auch, wie unsicher die Prognose ist, je weiter Sie in die Zukunft blicken.
Exponential Smoothing (Holt-Winters)
Für Studierende: Exponential Smoothing (Holt-Winters) prognostiziert eine Zeitreihe, indem vergangene Beobachtungen mit exponentiell abnehmendem Gewicht (jüngere Werte zählen mehr) kombiniert werden — erweiterbar um Trend- und Saisonkomponenten. Einfacher zu handhaben als ARIMA und oft ähnlich gut, besonders bei klar erkennbarer Saisonalität. Welche Kombination aus Fehler-, Trend- und Saisonkomponente (additiv oder multiplikativ, gedämpft oder nicht) am besten passt, wird automatisch per AICc-Vergleich zwischen den Modellvarianten gewählt, nicht von Hand festgelegt.
Für Unternehmen: Damit prognostizieren Sie eine Zeitreihe auf eine Art, bei der aktuellere Werte automatisch stärker gewichtet werden als ältere — gut geeignet, wenn sich Muster über die Zeit allmählich verschieben, zum Beispiel bei saisonal schwankenden Verkaufszahlen.
KI-Zeitreihenprognose (TiRex)
Für Studierende: Die KI-gestützte Zeitreihenprognose (TiRex) nutzt ein vortrainiertes Foundation-Modell statt eines klassischen statistischen Modells wie ARIMA — kann dadurch auch bei kurzen Historien oder komplexen, nicht-linearen Mustern robuste Prognosen liefern, ohne dass ein Modell erst manuell an die spezifische Reihe angepasst werden muss (Zero-Shot-Prognose). Die Unsicherheit wird als P10–P90-Band ausgegeben (80 % der erwarteten Werte liegen in diesem Bereich), direkt vergleichbar mit dem klassischen ARIMA-Konfidenzintervall.
Für Unternehmen: Damit erhalten Sie eine Prognose über ein modernes KI-Modell statt einer klassischen statistischen Methode — besonders nützlich, wenn Ihre Zeitreihe kurz ist oder ungewöhnliche Muster zeigt, bei denen ein klassisches Modell erst aufwendig angepasst werden müsste.
Strukturbruch-Erkennung
Für Studierende: Die Strukturbruch-Erkennung testet, ob sich ein Modellparameter (z. B. Niveau oder Trend) einer Zeitreihe zu einem unbekannten Zeitpunkt sprunghaft verändert hat, statt über den gesamten Zeitraum konstant zu bleiben — der Test schätzt den wahrscheinlichsten Bruchzeitpunkt selbst, statt dass er vorab bekannt sein muss. Bei einem angegebenen Zeitpunkt kommt der Chow-Test zum Einsatz; ist der Bruchzeitpunkt unbekannt und sollen mehrere Brüche gefunden werden, die Bai-Perron-Mehrfachsuche (BIC-optimale Anzahl an Bruchpunkten).
Für Unternehmen: Damit finden Sie heraus, ob und wann sich das grundlegende Niveau einer Kennzahl sprunghaft verändert hat — zum Beispiel durch eine neue Marketingstrategie oder eine externe Krise. Das Verfahren findet den Zeitpunkt selbst, Sie müssen ihn nicht vorher kennen.
Ausreißererkennung in Zeitreihen
Für Studierende: Die Ausreißererkennung in Zeitreihen identifiziert einzelne auffällige Zeitpunkte, die deutlich vom erwarteten Verlauf abweichen (additive Ausreißer: einmaliger Sprung; Niveauverschiebungen: dauerhafter Versatz) — im Unterschied zur Strukturbruch-Erkennung geht es um einzelne Auffälligkeiten, nicht um eine generelle Trendänderung. Erkannt werden die Auffälligkeiten über den Rest einer STL-Zerlegung (bzw. Loess-Glättung) nach Herausrechnen von Trend und Saisonalität, mit einer robusten IQR-Schwelle auf diesem Rest — so werden auch bei stark saisonalen Reihen (z. B. Tourismus- oder Umsatzdaten) nur echte Auffälligkeiten markiert, keine normalen saisonalen Schwankungen.
Für Unternehmen: Damit finden Sie einzelne ungewöhnliche Zeitpunkte in einer Messreihe — zum Beispiel einen einzelnen Tag mit auffällig hohen Ausfällen, der sich vom sonstigen Muster abhebt. Anders als bei der Strukturbruch-Erkennung geht es hier um einzelne Ausreißer, nicht um eine dauerhafte Veränderung.
STL-Zerlegung (Trend/Saison/Rest)
Für Studierende: Die STL-Zerlegung teilt eine Zeitreihe additiv (oder multiplikativ) in drei Komponenten: Trend (langfristige Entwicklung), Saison (wiederkehrendes Muster fester Periodenlänge) und Rest (unerklärte Schwankung) — nützlich, um die zugrunde liegende Entwicklung von saisonalen Effekten zu trennen, oder um eine saisonbereinigte Reihe für weitere Analysen zu erhalten. Die robuste Variante dämpft den Einfluss einzelner Ausreißer auf die Trend-/Saisonschätzung; Trend- und Saisonstärke-Kennzahlen quantifizieren zusätzlich, wie viel der Gesamtvarianz auf welche Komponente entfällt.
Für Unternehmen: Damit trennen Sie eine Zeitreihe in ihre Bestandteile auf — zum Beispiel, wie viel des sommerlichen Umsatzanstiegs reine Saisonalität ist und wie viel echtes Wachstum. Auch nützlich, um eine 'bereinigte' Reihe ohne saisonale Schwankungen für weitere Auswertungen zu erhalten.
CUSUM-Test auf Parameterstabilität
Für Studierende: Der CUSUM-Test (kumulierte Summe) prüft, ob ein Modellparameter (meist der Mittelwert) einer Zeitreihe über die Zeit stabil bleibt, indem kumulierte Abweichungen vom erwarteten Wert laufend aufsummiert werden — ein systematischer Trend in der kumulierten Summe deutet auf eine schleichende, nicht notwendigerweise abrupte Parameteränderung hin. Konkret verwendet: der OLS-CUSUM-Test nach Brown, Durbin und Evans, der auf kumulierten OLS-Residuen basiert; der erste Zeitpunkt, an dem die kumulierte Summe die Konfidenzgrenzen überschreitet, dient als Näherung für den Bruchzeitpunkt.
Für Unternehmen: Damit überwachen Sie fortlaufend, ob ein Prozess stabil bleibt oder sich schleichend verändert — zum Beispiel, ob die durchschnittliche Bearbeitungszeit allmählich zunimmt, ohne dass ein einzelner auffälliger Sprung sichtbar wäre. Erkennt gerade solche langsamen, kumulativen Verschiebungen gut.
Meta-Analyse
Meta-Analyse
Für Studierende: Die Meta-Analyse fasst Effektgrößen mehrerer unabhängiger Studien zu einem gewichteten Gesamteffekt zusammen (Studien mit größerer Präzision erhalten mehr Gewicht) — standardmäßig als Random-Effects-Modell (REML-Schätzung mit Knapp-Hartung-Korrektur, geht von unterschiedlichen wahren Effekten je Studie aus), auf Wunsch als Fixed-Effects-Modell für praktisch identische Studien; zusätzlich wird das Prädiktionsintervall berichtet. Grundlage ist eine Studientabelle mit einer Zeile pro Studie (Cohens d bzw. Hedges g, Korrelation r oder Odds Ratio), keine Rohdaten. Prüft zusätzlich Heterogenität zwischen den Studien (Q-Test, I², τ² als geschätzte Streuung der wahren Effekte) sowie mögliche Publikationsverzerrung (Egger-Test, Trim-and-Fill, Funnel-Plot), da nur ein Teil aller durchgeführten Studien tatsächlich veröffentlicht wird; der Forest-Plot zeigt jede Studie mit Konfidenzintervall neben dem Gesamteffekt.
Für Unternehmen: Damit fassen Sie die Ergebnisse mehrerer vergleichbarer Studien oder Untersuchungen zu einer verlässlicheren Gesamtaussage zusammen — zum Beispiel den durchschnittlichen Effekt einer Maßnahme über mehrere unabhängige Erhebungen hinweg, gewichtet nach deren jeweiliger Stichprobengröße und Präzision.
Datengewichtung
Designgewichtung
Für Studierende: Die Designgewichtung rechnet bei einer Stichprobe mit bekannten, ungleichen Auswahlwahrscheinlichkeiten (z. B. Übergewichtung kleiner Untergruppen im Studiendesign) die Ergebnisse auf die tatsächliche Grundgesamtheit hoch — jeder Fall erhält ein inverses Gewicht proportional zu seiner Auswahlwahrscheinlichkeit, damit Kennwerte repräsentativ bleiben. Der Design-Effekt (Deff) zeigt an, wie stark die Gewichtung die Präzision der Schätzung gegenüber einer echten Zufallsstichprobe verringert — daraus ergibt sich das effektive N, die tatsächlich nutzbare Informationsmenge, die meist kleiner ist als die reine Fallzahl.
Für Unternehmen: Damit korrigieren Sie eine Stichprobe, bei der bestimmte Gruppen bewusst über- oder unterrepräsentiert wurden (z. B. um auch kleine Kundensegmente statistisch belastbar zu erfassen), sodass die Gesamtergebnisse trotzdem die tatsächliche Zusammensetzung Ihrer Kundschaft widerspiegeln.
Häufigkeitsgewichtung
Für Studierende: Die Häufigkeitsgewichtung expandiert einen Datensatz, in dem mehrere identische Fälle als eine einzelne Zeile mit einer Anzahlspalte kodiert sind (z. B. aus einer bereits aggregierten Kreuztabelle), vor der eigentlichen Analyse auf die tatsächliche Fallzahl — rein technische Aufbereitung, verändert keine inhaltlichen Ergebnisse gegenüber einem vollständig ausgeschriebenen Datensatz.
Für Unternehmen: Damit arbeiten Sie mit bereits verdichteten Daten weiter, bei denen jede Zeile für mehrere identische Fälle mit einer Anzahl steht — zum Beispiel eine fertige Häufigkeitstabelle statt der Rohdaten jeder einzelnen Person. Rechnet intern so, als lägen alle Einzelfälle vor.
Analysegewichtung
Für Studierende: Analysegewichte korrigieren bei ungleicher Präzision zwischen Beobachtungen (z. B. unterschiedlich große Teilstichproben, aus denen je ein Kennwert stammt) über eine inverse Varianzgewichtung — im Unterschied zur Designgewichtung geht es hier nicht um Repräsentativität gegenüber einer Grundgesamtheit, sondern um eine statistisch effizientere Schätzung, wenn manche Beobachtungen verlässlicher sind als andere.
Für Unternehmen: Damit lassen Sie präzisere Datenpunkte stärker in ein Ergebnis einfließen als unsichere — zum Beispiel, wenn einzelne Werte aus großen, verlässlichen Teilstichproben stammen und andere aus kleinen, unsicheren. Anders als bei der Designgewichtung geht es hier nicht um Repräsentativität, sondern um Präzision.
Textanalyse (offene Antworten)
Induktive Kategorienbildung
Für Studierende: Die induktive Kategorienbildung entwickelt die Kategorien direkt aus dem Material („bottom-up“): Die offenen Antworten werden gelesen, ähnliche Aussagen zusammengefasst und zu einem Kategoriensystem mit Häufigkeiten und Beispielzitaten verdichtet. Geeignet, wenn es noch kein Kategoriensystem gibt. Zwei KI-Modelle kodieren unabhängig, ihre Übereinstimmung wird mit Cohens Kappa geprüft.
Für Unternehmen: Zeigt, worüber die Befragten in ihren offenen Antworten tatsächlich sprechen – ohne vorgegebene Schubladen. Sie erhalten die wichtigsten Themenfelder mit Häufigkeiten und typischen Zitaten, z. B. für die Auswertung von Kundenfeedback.
Deduktive Kategorienbildung
Für Studierende: Bei der deduktiven Kategorienbildung ist das Kategoriensystem vorgegeben („top-down“), etwa aus Theorie oder früheren Studien. Jede Antwort wird den vorgegebenen Kategorien zugeordnet; Ergebnis sind Häufigkeiten und Beispielzitate je Kategorie. Die Zuordnung lässt sich als neue Variable in den Datensatz übernehmen.
Für Unternehmen: Ordnet offene Antworten Ihren eigenen, vorgegebenen Kategorien zu – z. B. „Preis“, „Service“, „Produktqualität“. So werden Freitexte zählbar und mit anderen Fragen des Fragebogens vergleichbar.
Sentimentanalyse
Für Studierende: Die Sentimentanalyse bewertet die Stimmung jeder Antwort auf einer fünfstufigen Skala von negativ bis positiv und zeigt die Verteilung mit Beispielen je Stufe. Die Bewertung lässt sich als neue Variable übernehmen und dann z. B. zwischen Gruppen vergleichen.
Für Unternehmen: Zeigt auf einen Blick, wie positiv oder negativ Ihre Kundinnen und Kunden in offenen Antworten urteilen – mit typischen Aussagen je Stimmungslage und der Möglichkeit, die Stimmung weiter nach Zielgruppen auszuwerten.
Themen und Schlüsselwörter
Für Studierende: Ermittelt die häufigsten Themen und Schlüsselbegriffe in den offenen Antworten mit Häufigkeiten und typischen Formulierungen – ein schneller Überblick, weniger systematisch als eine Kategorienbildung.
Für Unternehmen: Der schnelle Überblick über offene Antworten: Welche Themen und Begriffe fallen am häufigsten? Gut geeignet für eine erste Sichtung großer Mengen an Freitext.
Qualitative Inhaltsanalyse nach Mayring
Für Studierende: Die qualitative Inhaltsanalyse nach Mayring bildet Kategorien regelgeleitet und nachvollziehbar: mit Definition, Ankerbeispielen und Kodierregeln je Kategorie. Im deutschsprachigen Raum ein Standardverfahren für Abschlussarbeiten; zwei KI-Modelle kodieren unabhängig, die Übereinstimmung wird mit Cohens Kappa geprüft.
Für Unternehmen: Eine besonders gründliche und nachvollziehbare Auswertung offener Antworten mit dokumentierten Regeln und Beispielen je Kategorie – geeignet, wenn die Ergebnisse methodisch belastbar dokumentiert werden müssen.
Grounded Theory
Für Studierende: Die Grounded Theory (Glaser/Strauss) entwickelt aus dem Material schrittweise eine Theorie: offenes Kodieren (Konzepte), axiales Kodieren (Zusammenhänge) und selektives Kodieren (Kernkategorie). Geeignet für explorative Fragestellungen, bei denen neue Erklärungsansätze entstehen sollen.
Für Unternehmen: Geht über das Zählen von Themen hinaus: Aus den offenen Antworten wird schrittweise ein Erklärungsmodell entwickelt – z. B. warum Kundinnen und Kunden abwandern oder was ein Erlebnis prägt.