Repräsentativität
Repräsentativität bezeichnet in der Statistik und der empirischen Forschung die Frage, inwieweit eine Stichprobe beziehungsweise die aus ihr gewonnenen Ergebnisse eine festgelegte Grundgesamtheit hinsichtlich bestimmter Merkmale oder Fragestellungen angemessen abbilden. Der Ausdruck „repräsentative Stichprobe“ wird dabei nicht einheitlich verwendet. In einer verbreiteten Bedeutung gilt eine Stichprobe als repräsentativ hinsichtlich eines Merkmals, wenn dessen Verteilung in der Stichprobe der Verteilung in der Grundgesamtheit hinreichend ähnlich ist. Eine solche Aussage setzt voraus, dass die betreffende Verteilung in der Grundgesamtheit bekannt ist.[1]
Davon zu unterscheiden ist die Frage, unter welchen Bedingungen von einer Stichprobe mit Verfahren der Inferenzstatistik auf eine Grundgesamtheit geschlossen werden kann. Bei einer Wahrscheinlichkeitsstichprobe besitzt jedes Element der Grundgesamtheit eine positive und bekannte Einschlusswahrscheinlichkeit. Nur bei der einfachen Zufallsstichprobe sind diese Wahrscheinlichkeiten für alle Elemente gleich; bei komplexeren Stichprobenplänen können sie unterschiedlich sein und müssen bei der Schätzung berücksichtigt werden.[2]
Repräsentativität spielt insbesondere bei Meinungsumfragen, in der Marktforschung, der Wahlforschung und anderen Stichprobenerhebungen eine Rolle, deren Ergebnisse auf eine größere Grundgesamtheit übertragen werden sollen.
Zufallsstichprobe und Repräsentativität
[Bearbeiten | Quelltext bearbeiten]Eine Zufallsstichprobe und eine in bestimmten Merkmalen „repräsentative“ Stichprobe sind unterschiedliche Konzepte. Die Zufälligkeit bezeichnet das Verfahren, mit dem die Stichprobe gezogen wird. Repräsentativität im Sinne einer ähnlichen Merkmalsverteilung bezeichnet dagegen eine Eigenschaft des Ergebnisses der Auswahl.[1]
Auch eine korrekt gezogene einfache Zufallsstichprobe muss daher kein exaktes verkleinertes Abbild der Grundgesamtheit sein. Besteht eine Grundgesamtheit beispielsweise zu gleichen Teilen aus zwei Gruppen A und B, so enthält eine einfache Zufallsstichprobe von 100 Elementen nicht zwangsläufig genau 50 Elemente aus jeder Gruppe. Die Wahrscheinlichkeit für genau diese Zusammensetzung beträgt
Eine Abweichung von der Populationsverteilung kann bei einer Zufallsstichprobe somit allein durch den Zufall entstehen. Umgekehrt kann eine nicht zufällig ausgewählte Stichprobe für einzelne bekannte Merkmale sehr genau der Struktur der Grundgesamtheit entsprechen. Daraus folgt jedoch nicht, dass sie auch hinsichtlich anderer Merkmale die Grundgesamtheit abbildet.[1]
Bei einer Quotenstichprobe wird beispielsweise gezielt versucht, die Verteilung ausgewählter Merkmale wie Alter oder Geschlecht an bekannte Verteilungen der Grundgesamtheit anzupassen. Dies verbessert Schätzungen für andere Merkmale jedoch nur dann, wenn die Quotenmerkmale sowohl mit dem Auswahlmechanismus als auch mit den interessierenden Untersuchungsmerkmalen ausreichend zusammenhängen. Eine Quotierung kann deshalb eine unbekannte Stichprobenverzerrung nicht grundsätzlich ausschließen.[3]
Für Wahrscheinlichkeitsstichproben stellt die Stichprobentheorie Verfahren bereit, mit denen die Unsicherheit von Schätzungen aus dem Stichprobenplan abgeleitet werden kann. Bei nichtprobabilistischen Stichproben fehlen bekannte Einschlusswahrscheinlichkeiten. Rückschlüsse auf eine Grundgesamtheit erfordern dann zusätzliche, häufig nur schwer überprüfbare Modellannahmen. Auch die Verwendung von Quoten oder nachträglichen Gewichten beseitigt dieses Problem nicht grundsätzlich.[3]
Beurteilung von Stichprobenerhebungen
[Bearbeiten | Quelltext bearbeiten]Welche Anforderungen an eine Stichprobe gestellt werden, hängt von der konkreten Fragestellung ab. Eine Erhebung kann beispielsweise für Aussagen über die Bevölkerung eines ganzen Staates ausreichend genau sein, für kleine räumliche Gebiete oder seltene Bevölkerungsgruppen aber nur ungenaue Schätzungen liefern. Repräsentativität ist insbesondere für die Schätzung von Verteilungen, etwa von Anteils- oder Mittelwerten, von Bedeutung.
Für die Prüfung von Zusammenhangs- oder Kausalhypothesen kann dagegen die interne Validität wichtiger sein als die Übertragbarkeit auf eine gesamte Bevölkerung. Auch nichtprobabilistische Stichproben können daher für bestimmte explorative Untersuchungen oder Experimente geeignet sein, wenn keine statistische Verallgemeinerung auf eine Grundgesamtheit beabsichtigt ist. Daraus folgt jedoch keine externe Validität der Ergebnisse.[3]
Für die Beurteilung einer Stichprobenerhebung sind insbesondere Angaben zu folgenden Punkten wichtig:[2][3]
- die sachliche, räumliche und zeitliche Abgrenzung der Grundgesamtheit;
- der verwendete Auswahlrahmen und mögliche Über- oder Unterabdeckungen;
- die Stichprobentechnik und bei Wahrscheinlichkeitsstichproben die Einschlusswahrscheinlichkeiten;
- bei nichtprobabilistischen Verfahren wie einer Quotenstichprobe die verwendeten Auswahl- oder Quotenmerkmale;
- die ursprünglich ausgewählte und die tatsächlich realisierte Stichprobengröße sowie Ausschöpfungsquote und Antwortausfälle;
- die Erhebungsmethode;
- verwendete Gewichtungs- und Anpassungsverfahren;
- Angaben zur statistischen Unsicherheit der Schätzungen.
Soweit geeignete Informationen über die Grundgesamtheit vorhanden sind, können zudem bekannte Randverteilungen, etwa nach Alter, Region oder anderen Merkmalen, mit der realisierten Stichprobe verglichen werden. Eine Übereinstimmung bei solchen Merkmalen belegt allerdings nicht automatisch eine entsprechende Übereinstimmung bei anderen Merkmalen.[1]
Stichprobengröße und statistische Genauigkeit
[Bearbeiten | Quelltext bearbeiten]Die notwendige Stichprobengröße hängt unter anderem von der gewünschten Genauigkeit der statistischen Schlüsse und dem verwendeten Stichprobenplan ab. Bei einer einfachen Zufallsstichprobe lässt sich der notwendige Stichprobenumfang beispielsweise aus einem vorgegebenen tolerierbaren Stichprobenfehler und einer Irrtumswahrscheinlichkeit bestimmen.[2]
Eine größere Stichprobe erhöht bei einem gegebenen Wahrscheinlichkeitsdesign im Allgemeinen die Präzision der Schätzung. Sie beseitigt jedoch keine systematischen Verzerrungen. Eine große, systematisch verzerrte Stichprobe kann deshalb einen falschen Wert mit hoher Präzision schätzen.[3]
Ein häufig genanntes historisches Beispiel ist das Literary-Digest-Desaster bei der Präsidentschaftswahl in den Vereinigten Staaten 1936. Die Zeitschrift The Literary Digest stützte ihre Vorhersage auf mehr als zwei Millionen zurückgesandte Fragebögen und sagte einen Sieg von Alf Landon über Franklin D. Roosevelt voraus. Die Adressen waren unter anderem Telefonverzeichnissen und Kraftfahrzeugregistern entnommen worden. George Gallup sagte dagegen mit einer wesentlich kleineren, etwa 50.000 Personen umfassenden Quotenstichprobe den Sieg Roosevelts voraus.[4]
Das Beispiel zeigt vor allem, dass ein großer Stichprobenumfang systematische Auswahlfehler nicht ausgleicht. Es ist dagegen kein allgemeiner Beleg für die Überlegenheit von Quotenstichproben: Bei der US-Präsidentschaftswahl 1948 scheiterten auch Gallups Quotenprognosen, während eine kleinere Wahrscheinlichkeitsstichprobe den späteren Sieger Harry S. Truman richtig bestimmte.[4]
Fehlerquellen
[Bearbeiten | Quelltext bearbeiten]Die Verallgemeinerbarkeit von Stichprobenergebnissen kann durch verschiedene Fehlerquellen beeinträchtigt werden. Dabei ist nicht allein die Art des Erhebungsmediums entscheidend.[3]
- Abdeckungsfehler: Der Auswahlrahmen stimmt nicht vollständig mit der angestrebten Grundgesamtheit überein. Teile der Grundgesamtheit können fehlen (undercoverage) oder Einheiten enthalten sein, die nicht zur Grundgesamtheit gehören (overcoverage).[2]
- Stichprobenfehler: Auch eine korrekt gezogene Zufallsstichprobe unterscheidet sich aufgrund zufälliger Schwankungen von der Grundgesamtheit. Diese Unsicherheit kann bei Wahrscheinlichkeitsstichproben statistisch quantifiziert werden.[2]
- Antwortausfälle: Wenn ausgewählte Einheiten nicht an der Erhebung teilnehmen und sich ihre interessierenden Merkmale systematisch von denen der Teilnehmenden unterscheiden, kann eine Antwortausfallverzerrung entstehen.[3]
- Selbstselektion: Bei offenen oder freiwilligen Erhebungen entscheiden mögliche Teilnehmer selbst über ihre Teilnahme. Sind Teilnahmebereitschaft und Untersuchungsmerkmal miteinander verbunden, kann Selbstselektion zu systematischen Verzerrungen führen.[3]
- Quotierung und Gewichtung: Die Anpassung an bekannte Verteilungen ausgewählter Hilfsmerkmale kann Unterschiede zwischen Stichprobe und Grundgesamtheit verringern. Sie gewährleistet jedoch keine Übereinstimmung bei Merkmalen, die nicht ausreichend durch diese Hilfsvariablen erfasst werden.[5][3]
Insbesondere bei Online-Umfragen ist zwischen der Erhebungsform und dem Auswahlverfahren zu unterscheiden. Eine Online-Erhebung ist nicht allein deshalb nichtprobabilistisch, weil sie über das Internet durchgeführt wird. Problematisch für Rückschlüsse auf eine Grundgesamtheit sind vor allem Verfahren, bei denen sich die Teilnehmenden selbst rekrutieren oder ihre Einschlusswahrscheinlichkeiten unbekannt sind.[3]
Anwendung in der Praxis
[Bearbeiten | Quelltext bearbeiten]In der Praxis werden häufig komplexe Stichprobenpläne verwendet. Dabei können bestimmte Teile der Grundgesamtheit bewusst mit unterschiedlichen Wahrscheinlichkeiten ausgewählt werden. Solche Unterschiede sind kein Fehler des Stichprobenplans, müssen aber bei der Auswertung berücksichtigt werden. Bei der sogenannten Designgewichtung werden die Gewichte üblicherweise aus den inversen Einschlusswahrscheinlichkeiten abgeleitet.[5]
Zusätzliche Anpassungsgewichte können eingesetzt werden, wenn sich die realisierte Stichprobe beispielsweise durch Antwortausfälle von der ursprünglich geplanten Stichprobe unterscheidet und geeignete Informationen über bekannte Randverteilungen der Grundgesamtheit zur Verfügung stehen. Eine solche Gewichtung kann Verzerrungen reduzieren, aber fehlende Informationen über den Auswahl- oder Teilnahmeprozess nicht beliebig ersetzen.[5][3]
Ein Anwendungsbeispiel in Deutschland ist die Allgemeine Bevölkerungsumfrage der Sozialwissenschaften (ALLBUS). Seit 1980 werden für ihre Querschnittserhebungen regelmäßig Zufallsstichproben der deutschen Bevölkerung befragt.[6]
Literatur
[Bearbeiten | Quelltext bearbeiten]- Siegfried Gabler, Sabine Häder: Stichproben in der Theorie. In: GESIS Survey Guidelines. GESIS – Leibniz-Institut für Sozialwissenschaften, Mannheim 2015, doi:10.15465/gesis-sg_009 (gesis.org [PDF; abgerufen am 18. August 2026]).
- Siegfried Gabler, Jan-Philipp Kolb, Matthias Sand, Stefan Zins: Gewichtung. In: GESIS Survey Guidelines. GESIS – Leibniz-Institut für Sozialwissenschaften, Mannheim 2015, doi:10.15465/gesis-sg_007 (gesis.org [PDF; abgerufen am 18. August 2026]).
- Björn Rohr, Barbara Felderer, Henning Silber, Jessica Daikeler, Joss Roßmann, Jette Schröder: When are non-probability surveys fit for my purpose? In: GESIS Survey Guidelines. GESIS – Leibniz-Institut für Sozialwissenschaften, Mannheim 2024, doi:10.15465/gesis-sg_en_050 (englisch, gesis.org [PDF; abgerufen am 18. August 2026]).
- Alberto Marradi: Representative Samples, Random Sampling. In: Cambio. Rivista sulle trasformazioni sociali. Band 12, Nr. 23, 2022, S. 213–233, doi:10.36253/cambio-12691 (englisch, fupress.net [abgerufen am 18. August 2026]).
- Jelke Bethlehem: Sunday shopping – The case of three surveys. In: Survey Research Methods. Band 9, Nr. 3, 2015, S. 221–230, doi:10.18148/srm/2015.v9i3.6202 (englisch, uni-konstanz.de [abgerufen am 18. August 2026]).
Weblinks
[Bearbeiten | Quelltext bearbeiten]Einzelnachweise
[Bearbeiten | Quelltext bearbeiten]- 1 2 3 4 Alberto Marradi: Representative Samples, Random Sampling. In: Cambio. Rivista sulle trasformazioni sociali. Band 12, Nr. 23, 2022, S. 213–233, doi:10.36253/cambio-12691 (englisch, fupress.net [abgerufen am 18. August 2026]).
- 1 2 3 4 5 Siegfried Gabler, Sabine Häder: Stichproben in der Theorie. In: GESIS Survey Guidelines. GESIS – Leibniz-Institut für Sozialwissenschaften, Mannheim 2015, doi:10.15465/gesis-sg_009 (gesis.org [PDF; abgerufen am 18. August 2026]).
- 1 2 3 4 5 6 7 8 9 10 11 Björn Rohr, Barbara Felderer, Henning Silber, Jessica Daikeler, Joss Roßmann, Jette Schröder: When are non-probability surveys fit for my purpose? In: GESIS Survey Guidelines. GESIS – Leibniz-Institut für Sozialwissenschaften, Mannheim 2024, doi:10.15465/gesis-sg_en_050 (englisch, gesis.org [PDF; abgerufen am 18. August 2026]).
- 1 2 Jelke Bethlehem: Sunday shopping – The case of three surveys. In: Survey Research Methods. Band 9, Nr. 3, 2015, S. 221–230, doi:10.18148/srm/2015.v9i3.6202 (englisch, uni-konstanz.de [abgerufen am 18. August 2026]).
- 1 2 3 Siegfried Gabler, Jan-Philipp Kolb, Matthias Sand, Stefan Zins: Gewichtung. In: GESIS Survey Guidelines. GESIS – Leibniz-Institut für Sozialwissenschaften, Mannheim 2015, doi:10.15465/gesis-sg_007 (gesis.org [PDF; abgerufen am 18. August 2026]).
- ↑ ALLBUS – Daten und Dokumentation. GESIS – Leibniz-Institut für Sozialwissenschaften, abgerufen am 18. August 2026.