Wat zijn steekproefdistributies? - Chapter 5

Statistische gevolgtrekking (statistical inference) wordt gebruikt om conclusies over een populatie of proces te trekken op basis van data. Deze data wordt samengevat door middel van toetsen, zoals gemiddelden, proporties en hellingscoëfficiënten van regressielijnen. Er zijn verschillende stappen en mogelijkheden om vanuit data die verkregen is in een steekproef, met behulp van kansberekening een gevolgtrekking te maken, om voorspellingen voor de toekomst te doen.

Wat zijn statistische gevolgtrekkingen?

Als we door middel van een steekproef een conclusie over een bijbehorende populatie willen trekken, dan hebben we het over statistische gevolgtrekkingen (statistical inference).

  • Een parameter is een getal dat de populatie beschrijft. Een parameter is een vaststaand getal, maar in de praktijk kennen we deze waarde niet. We weten bijvoorbeeld niet precies hoeveel Nederlanders tegen abortus zijn.
  • Een statistiek is een getal dat een steekproef beschrijft. De waarde van een statistiek is bekend nadat we een steekproef hebben geselecteerd, maar deze waarde kan per steekproef wel verschillen. We gebruiken vaak een statistiek om een onbekende parameter te schatten.

Wat is spreiding binnen de steekproef?

Sampling variabiliteit houdt in dat de waarde van een statistiek per steekproef zal variëren. Random steekproeven verwijderen vertekening (bias) door een steekproef te trekken op basis van toevalsverschijnselen. Zo een steekproef kan echter wel misleidende resultaten geven, omdat er met elke steekproef andere waarden gepaard gaan. Het blijkt echter zo te zijn dat het trekken van vele random steekproeven (van dezelfde grootte en uit dezelfde populatie) een voorspelbare spreiding per steekproef met zich meebrengt. Statistische gevolgtrekkingen zijn gebaseerd op het idee dat de betrouwbaarheid van steekproeven afhangt van het herhalen van steekproefprocedures. We vragen ons dus af wat er zou gebeuren als we allemaal verschillende steekproeven (van dezelfde grootte) trekken uit een populatie. Om deze vraag te beantwoorden kan het volgende gedaan worden:

  • Allereerst moeten er veel steekproeven uit een populatie getrokken worden.
  • Vervolgens moet de steekproefproportie voor elke steekproef berekend worden. Denk bijvoorbeeld aan het deel van de steekproef dat abortus steunt.
  • Daarna moet er een histogram van alle proporties gemaakt worden.
  • Tot slot moeten de vorm, het centrum, de spreiding en uitbijters aan de hand van een histogram bekeken worden.

Het is in de praktijk te duur om heel veel steekproeven uit dezelfde populatie te trekken. We kunnen dit proces echter wel imiteren door random cijfers te gebruiken. Het gebruik van random cijfers uit een tabel of door middel van computersoftware om kansverschijnselen te imiteren, wordt simulatie genoemd.

Wat is steekproefdistributie?

De steekproefdistributie (sampling distribution) van een statistiek is de distributie van alle waarden die de statistiek aanneemt in alle mogelijke steekproeven van dezelfde grootte en uit dezelfde populatie. Als deze distributie door middel van een histogram bekeken wordt, dan blijkt het volgende:

  • Een histogram heeft een normale verdeling. Dit betekent dat veel steekproeven dezelfde resultaten geven, terwijl er enkele afwijkende steekproeven zijn.
  • Ook blijkt uit een histogram dat de gemiddelden uit de steekproeven steeds bijna hetzelfde zijn. Dit betekent dat de geschatte proportie niet vertekend (biased) is als schatter van p (proportie in de populatie).
  • In de praktijk blijkt ook dat waarden uit steekproeven van behoorlijke grootte (bijvoorbeeld >2500) veel minder spreiding hebben dan waarden uit kleinere steekproeven (bijvoorbeeld met een grootte van 100). Dit omdat grotere steekproeven een betere representatie zijn van de populatie dan kleinere steekproeven.

Wat zijn bias en spreiding?

  • Vertekening (bias) gaat over het middelpunt van een steekproefdistributie. Een statistiek die een parameter beschrijft, is niet vertekend (unbiased) als het gemiddelde van de bijbehorende steekproefdistributie gelijk is aan de echte waarde van de geschatte parameter.
  • De variabiliteit van een statistiek wordt beschreven door de spreiding van de bijbehorende steekproefdistributie. Deze spreiding wordt bepaald door het steekproefontwerp en de grootte van de steekproef (n). Statistieken van grotere steekproeven kennen minder spreiding.
  • Weinig bias kan samengaan met veel variabiliteit en weinig variabiliteit kan gepaard gaan met veel bias. In een goed onderzoek is er sprake van weinig spreiding en zo min mogelijk bias.

Hoe kun je bias en spreiding verminderen?

Bias kan verminderd worden door steekproeven op random wijze te selecteren. Als we met een lijst van de gehele populatie beginnen, dan zorgt het trekken van een SRS voor zo min mogelijk bias. De waarden van een statistiek die middels een SRS zijn berekend, onder- en overschatten de waarde van de populatieparameter niet op systematische wijze. Grote random steekproeven geven bijna altijd een schatting van een parameter die dicht bij de echte waarde ligt.

De spreiding van een statistiek kan verminderd worden door een grote steekproef te gebruiken. Je kunt de spreiding zo klein maken als je wilt, door een steekproef te selecteren die groot genoeg is. De grootte van de steekproef zegt dus iets over de mate waarin de steekproef representatief is voor de populatieparameter. Resultaten van een steekproef worden vaak gepresenteerd samen met de beschrijving van een zogenaamd foutenmarge. Deze marge beschrijft hoe groot de kans is dat de gevonden statistieken niet representatief zijn voor de populatie.

De spreiding van een statistiek hangt niet af van de grootte van de populatie, zolang de populatie maar minstens 100 keer zo groot is als de steekproef. Het is belangrijk om te onthouden dat een steekproefdistributie alleen laat zien hoe een statistiek varieert door randomisatie. Een steekproefdistributie zegt niets over bias, welke veroorzaakt zou kunnen zijn door onvoldoende dekking of non-respons.

Wat zijn de kenmerken van een steekproefdistributie van een steekproefgemiddelde?

Wanneer data het gevolg is van een random wijze van steekproeven trekken, dan is een toets een random variabele die met kansberekeningen begrepen kan worden.

  • Een toets van een random steekproef of een gerandomiseerd experiment is een random variabele.
  • De kansdistributie van een toets wordt de steekproefdistributie (sampling distribution) genoemd. Zo een distributie laat zien hoe een toets (zoals een gemiddelde) zal variëren wanneer herhaaldelijk een steekproef getrokken zou worden.
  • De populatiedistributie van een variabele is een distributie die alle waarden bevat die een variabele aanneemt bij leden van de populatie. De populatiedistributie is ook de kansdistributie van een variabele wanneer we random een individu uit de populatie trekken.

Wat zijn categorische en kwantitatieve data?

Tellingen en proporties zijn discrete random variabelen en beschrijven categorische data. De toetsen om kwantitatieve variabelen mee te beschrijven zijn echter continuerend van aard. Voorbeelden zijn het steekproefgemiddelde, percentielen en de standaarddeviatie.

Steekproefgemiddelden worden vaak gebruikt om een algemeen beeld te geven van een steekproef.

Wat zijn kenmerken van steekproefgemiddelden (x̄)?

Er zijn twee belangrijke feiten als het aankomt op steekproefgemiddelden:

  1. Steekproefgemiddelden zijn minder variabel dan individuele observaties.
  2. Steekproefgemiddelden zijn normaler verdeeld dan individuele observaties.

Wat zijn het gemiddelde en de standaarddeviatie van (x̄)?

Het steekproefgemiddelde (x̄) is een schatting van het gemiddelde μ van de populatie, net zoals p̂ een schatting is van de populatieproportie p. De steekproefdistributie van x̄ wordt bepaald door (1) het design dat gebruikt wordt om data te verzamelen, (2) de steekproefgrootte n en (3) de populatiedistributie.

  • Het steekproefgemiddelde van een SRS van grootte n is: x̄ = 1/n (X1 + X2 + X3 + … + Xn). Het n aantal metingen zijn waarden van n random variabelen X1, X2, …, Xn. Een enkele Xi is een meting van een enkel individu dat random uit de populatie getrokken is en deze meting heeft daarom de distributie van de populatie. Als de populatie in vergelijking tot de steekproef groot is, dan kunnen we X1, X2, …, Xn zien als onafhankelijke random variabelen die allemaal dezelfde distributie hebben. De conclusie is dus dat het gemiddelde van x̄ hetzelfde is als het gemiddelde van de populatie. Om deze reden is x̄ een foutloze schatter van de het onbekende populatiegemiddelde μ.
  • De standaarddeviatie van het steekproefgemiddelde is: x̄ = σ/√n. Zoals bij de steekproefproportie, vermindert ook de spreiding van de steekproefdistributie van een steekproefgemiddelde als de steekproefgrootte stijgt.

Kortom: het steekproefgemiddelde is hetzelfde als het populatiegemiddelde, omdat x̄ als een foutloze voorspeller van μ wordt gezien. De standaarddeviatie van de steekproef is de standaarddeviatie van de populatie gedeeld door de wortel van het aantal deelnemers.

Hoe nauwkeurig voorspelt x̄ het populatiegemiddelde μ?

Omdat de waarden van x̄ per steekproef variëren moeten we deze vraag beantwoorden aan de hand van de steekproefdistributie. We weten dat x̄ een foutloze voorspeller van μ is en daarom zullen de waarden van x̄ bij herhaalde steekproeven niet systematisch te hoog of te laag zijn in relatie tot μ. Veel steekproeven zullen een x̄ geven die dichtbij μ ligt als de steekproefdistributie rond de waarde van μ zal liggen. De precisie van de schatting van μ hangt af van de spreiding van de steekproefdistributie.

Wat is de centrale limiettheorie?

We hebben tot nu toe het middenpunt en de spreiding van de kansdistributie van x̄ besproken, maar de vorm van deze distributie is nog niet aan de orde geweest. De vorm van de distributie van x̄ hangt af van de vorm van de populatiedistributie. Als de populatiedistributie normaal verdeeld is, dan is de distributie van het steekproefgemiddelde dat ook.

  • Als een populatie een N(μ,σ) distributie heeft, dan heeft x̄ van n aantal observaties een N(μ.,σ/√n) distributie. In de praktijk zijn veel populaties echter niet normaal verdeeld. Toch is het bij grote steekproeven zo dat de distributie van x̄ dan toch bij benadering normaal verdeeld is. Het maakt in dat geval dus niet uit welke vorm de populatiedistributie heeft, als de populatie maar een duidelijke standaarddeviatie (σ) heeft. Dit feit wordt ook wel de centrale limiettheorie genoemd.

Kortom: als je een grote SRS van n uit welke populatie dan ook trekt (met gemiddelde μ en standaarddeviatie σ), dan zal de steekproefdistributie van het steekproefgemiddelde (x̄) bij benadering

normaalverdeeld zijn: x̄ = N(μ,σ/√n).

Wat zijn andere kenmerken van de centrale limiettheorie?

Er zijn drie andere feiten die te maken hebben met de centrale limiet theorie:

  • Ten eerste is de normaalbenadering voor steekproefproporties en tellingen een voorbeeld van de centrale limiettheorie. Dit is waar, omdat een steekproefproportie als een steekproefgemiddelde gezien kan worden.
  • Daarnaast heeft een lineaire combinatie van normaal verdeelde random variabelen ook een normaal verdeelde distributie. Dus: als X en Y onafhankelijke normaal verdeelde random variabelen zijn en a en b vaste getallen zijn, dan is aX+bY ook normaal verdeeld.
  • Tot slot is het zo dat algemene versies van de centrale limiettheorie stellen dat de distributie van een optelling of een gemiddelde van veel kleine random hoeveelheden bijna normaal verdeeld is. Dit is zelfs waar wanneer de hoeveelheden niet onafhankelijk van elkaar zijn. Ze mogen echter niet te sterk met elkaar correleren.

Hoe ziet een steekproefdistributie eruit voor tellingen en proporties?

Wat zijn tellingen?

Een random variabele X is een telling (count) als we tellen hoe vaak een bepaalde uitkomst voorkomt. Je kunt bijvoorbeeld tellen hoe vaak mensen ‘ja’ antwoorden op de vraag of prostitutie legaal moet zijn.

  • Als het aantal observaties n is, dan is de steekproefproportie: p̂ = X/n. X staat voor de telling, bijvoorbeeld het aantal mensen dat achter de legalisering van prostitutie staat.

Wat is een binomiale distributie?

Bij een binomiale distributie hoort een aantal kenmerken:

  • Er zijn n aantal observaties.
  • Deze n observaties zijn allemaal onafhankelijk.
  • Elke observatie valt in één van twee categorieën. Deze categorieën noemen we voor het gemak ‘succes’ en ‘falen’.
  • De kans op een succes (we noemen dit ‘p’) is voor elke observatie hetzelfde.

Voorbeeld:

Het n aantal keer werpen met een munt. Elke keer heb je 0.5 kans op kop of munt. De uitkomsten zijn onafhankelijk van elkaar: als je een keer munt hebt gegooid vergroot dat niet de kans dat je de volgende keer ook munt zult gooien. Als we kop ‘succes’ noemen, dan is p de kans op kop en deze kans blijft hetzelfde als we de volgende keer weer een munt werpen.

  • De distributie van X (de telling van het aantal successen in een binomiale setting) wordt helemaal bepaald door het aantal observaties (n) en de kans op succes (p).
  • De mogelijke waarden van X zijn hele cijfers tussen 0 en n.
  • We korten de binomiale distributie af met B(n,p).
  • De binomiale distributie is van belang wanneer we conclusies over de populatie willen trekken over de proportie ‘successen’. Het kiezen van een SRS uit een populatie is echter niet echt een binomiale situatie.
  • Een populatie bevat proportie p van successen. Als de populatie veel groter dan de steekproef is, dan heeft telling X (aantal successen in een SRS van grootte n) bijna de binomiale distributie B(n,p).
  • Deze benadering van de binomiale distributie wordt groter als de populatie steeds groter wordt in relatie tot de steekproef. De vuistregel is dat we de binomiale steekproefdistributie gebruiken voor tellingen wanneer de populatie minstens 20 keer zo groot is als de steekproef.

Hoe bereken je binomiale kansen?

Vaak kunnen binomiale kansen berekend worden door middel van software. Het is ook mogelijk om tabel C achterin het boek te raadplegen. Om deze tabel te gebruiken moet de kans op individuele uitkomsten voor de binomiale random variabele X geweten worden.

Wat zijn het binomiale gemiddelde en de standaarddeviatie?

Wat zijn het gemiddelde (μx) en de standaarddeviatie (σx) van binomiale kansen? Het gemiddelde kunnen we raden. Als Piet 75% van de keren succes heeft, dan is het gemiddelde bij 12 gebeurtenissen 75% van 12, dus 9. Dat is μx wanneer X dus B(12,0.75) is.

  • Dit betekent dat we np kunnen berekenen om het gemiddelde te vinden. We noemen een succes vaak p of 1 en geen succes is een 0 (of 1-p). Kortom: μx=np.
  • De standaarddeviatie (σx) berekenen we als volgt. Eerst berekenen we de np(1-p). Vervolgens trekken we hier de wortel uit.

Wat zijn steekproefproporties?

Hoeveel procent van de volwassenen is voor abortus? Bij steekproefdistributies willen we vaak schatten wat de proportie p van ‘successen’ in een populatie is. Onze schatter van de steekproefproportie van successen is:

  • p̂= X/n. Het is hierbij van belang om te weten dat p̂ niet hetzelfde is als telling X. De telling X neemt een heel getal aan tussen de 0 en n, maar een proportie is altijd een getal tussen de 0 en 1. In een binomiale situatie heeft telling X een binomiale distributie. p̂ heeft juist geen binomiale distributie. We kunnen echter wel kansberekeningen voor p̂ uitvoeren door deze op te schrijven in de vorm van telling X. Vervolgens kunnen we gebruik maken van binomiale berekeningen. De eerste stap is het vinden van het gemiddelde en de standaarddeviatie van een steekproefproportie.
  • Laat p de steekproefproportie van successen in een SRS van grootte n zijn. Deze SRS is getrokken uit een grote populatie met een populatieproportie p van successen. Het gemiddelde van p̂ is p. De standaarddeviatie van p̂ = √p(1-p) / n. Deze formule voor de standaarddeviatie gebruiken we als de populatie 20 keer zo groot is als de steekproef.

Het feit dat het gemiddelde van p = p̂, zegt dus dat de steekproefproportie een foutloze schatter (unbiased estimator) is van de populatieproportie p. Wanneer een steekproef uit een nieuwe populatie wordt getrokken (met een andere waarde voor de populatieproportie p), dan verandert de steekproefdistributie van p̂ richting de nieuwe waarde van p. De spreiding van p̂ wordt minder als de steekproefgrootte stijgt. De variantie of standaarddeviatie worden dan dus kleiner Dit betekent dat de steekproefproportie van een grote steekproef dicht zal liggen bij de populatiepropotie p.

Wat is de normaalbenadering voor tellingen en proporties?

De steekproefdistributie van een steekproefproportie  p̂ is bijna normaal verdeeld. Nu weten we dat de distributie van p̂ een binomiale telling is van steekproefgrootte n. In de praktijk is het zo dat de steekproefproportie p̂, maar ook telling X, bijna normaal verdeeld zijn in grote steekproeven.

  • Trek een SRS van grootte n uit een grote populatie met populatieproportie p van successen. Als X dan de telling van het aantal successen in de steekproef is, dan geldt: p̂ = X / n. Als n groot is, dan zijn de steekproefdistributies van zowel p̂ als X bijna normaalverdeeld:
  • X is bijna N(np, √np(1-p) 
  • p̂ is bijna N(p, √p(1-p) / n 
  • De vuistregel is dat we deze benaderingen alleen gebruiken voor waarden van p waarbij geldt: np ≥ 10 en n(1-p) is ook ≥ 10. De accuraatheid van deze normaalbenaderingen wordt beter naarmate de steekproefgrootte n stijgt. De benaderingen zijn het beste voor een vaste n wanneer p gelijk is aan 0.5. De benaderingen zijn het minst accuraat wanneer p zich rond de 0 of de 1 bevindt.

Wat is de continuïteitscorrectie?

Als we een binomiale kansberekening willen maken voor bijvoorbeeld X ≥ 10, dan moet er rekening mee gehouden worden dat het in de praktijk gaat om alle waarden tussen de 9.5 en 10.5. De kans die bij X ≥ 10 hoort, is eigenlijk hetzelfde als de kans die bij X ≥ 10.5 hoort. Er wordt voor de kansberekening daarom uitgegaan van 10.5 in plaats van 10. Dit wordt de continuïteitscorrectie voor de normaalbenadering genoemd.

Wat is het binomiale coëfficiënt?

Om het aantal manieren waarop k aantal successen bij n aantal observaties geschikt kunnen worden uit te rekenen, wordt de binomiale coëfficiënt gebruikt:

De formule voor binomiale coëfficiënten gebruikt de factor notatie (factoral notation). De factor n! voor elk positief getal n is:

  • n! = nx(n-1)x(n-2)x…x3x2x1. Ook geldt van 0! = 1.
  • De notatie n boven k heeft niets te maken van n/k.
  • Als X de binomiale distributie B(n,p) met n observaties en kans p van succes voor elke observatie heeft, dan zijn de mogelijke waarden van X 0,1,2,3…n.

Wat zijn Poissonverdelingen?

Een telling X heeft een binomiale verdeling wanneer deze geproduceerd wordt in een binomiale setting. Als één of meerdere facetten van deze setting niet kloppen, zal de telling X een andere verdeling hebben. We komen vaak tellingen tegen die open zijn, dat wil zeggen dat ze niet gebaseerd zijn op een vast aantal n observaties. In deze situaties kan de Poissonverdeling gebruikt worden. Deze telling representeert het aantal gebeurtenissen (noem deze ‘successen’) die voorkomen in een vastgestelde meetunit, bijvoorbeeld binnen een bepaalde tijd, regio of ruimte. Deze verdeling kan gebruikt worden onder de volgende condities:

  • Het aantal successen dat voorkomt in twee niet overlappende meetunits is onafhankelijk
  • De kans dat een succes voorkomt in een meetunit is hetzelfde voor alle units van gelijke grootte en is proportioneel aan de grootte van de unit.
  • De kans dat meer dan één gebeurtenis voorkomt in een meetunit is te verwaarlozen voor hele kleine units. Ofwel: de gebeurtenissen komen één voor één voor.
  • Voor de Poissonverdelingen is μ van het aantal successen per meetunit de enige belangrijke kwantiteit. De standaarddeviatie van de verdeling is √μ.
  • Wanneer het gemiddelde van de Poissonverdeling groot is, kan het moeilijk zijn om Poissonkansen te berekenen met een rekenmachine of software. Gelukkig is het zo dat wanneer μ groot is, de kansen benaderd kunnen worden door de normaalverdeling met gemiddelde μ en standaarddeviatie √μ te gebruiken.

Image

Access: 
Public

Image

Join: WorldSupporter!

Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>

Check: concept of JoHo WorldSupporter

Concept of JoHo WorldSupporter

JoHo WorldSupporter mission and vision:

  • JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.

JoHo concept:

  • As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
  • JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.

Join JoHo WorldSupporter!

for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for

Check: how to help

Image

 

 

Contributions: posts

Help others with additions, improvements and tips, ask a question or check de posts (service for WorldSupporters only)

Image

Image

Share: this page!
Follow: Social Science Supporter (author)
Add: this page to your favorites and profile
Statistics
2978
Submenu & Search

Search only via club, country, goal, study, topic or sector