Wanneer en hoe wordt de normaalverdeling gebruikt? - Chapter 3

Het concept van de normale verdeling wordt uitgelegd, en we bespreken hoe we de normaliteit van een steekproef kunnen beoordelen. Als er iets bekend is over de verdeling van gebeurtenissen, weet je ook wat over de kansen van deze gebeurtenissen.

Welke andere verdelingen bestaan er?

Alle verdelingen van scores proberen op een bepaalde manier de scores weer te geven. Zo geeft het taartdiagram de percentages van elke populatie weer door verschillen in grootte van de taartpunten per populatie. Deze percentages kunnen omgezet worden in kansen, oftewel de kans dat een gebeurtenis voorkomt. Daarnaast kunnen percentages opgeteld worden, zodat verschillende populaties samengenomen worden in de kans op een gebeurtenis. Daarnaast kennen we het staafdiagram, met aparte staven of blokken per frequentie. Deze stelt ons beter in staat om categorieën te vergelijken dan de taartdiagram; kijk simpelweg naar de hoogte van de staaf per categorie, en lijkt visueel meer op de distributies die in de statistiek worden gebruikt. Het verschil met een histogram, is dat de X-as in een staafdiagram ook een nominale schaal kan hebben, en dit is niet mogelijk bij een histogram.

Waarom is de normaalverdeling belangrijk?

De normaalverdeling is een van de belangrijkste verdelingen in de statistiek, omdat:

  1. We verwachten dat veel van de afhankelijke variabelen waar we mee werken normaal verdeeld zijn in de populatie.
  2. Als een variabele (ongeveer) normaal verdeeld is, kunnen we vervolgens uitspraken gaan doen over waarden van die variabele (het is vaak een voorwaarde om analyses te doen).
  3. Wanneer een oneindig aantal steekproeven wordt getrokken van een populatie, zal de verdeling van die steekproefgemiddelden neigen naar een normaalverdeling.
  4. De meeste statistische programma’s gaan er vanuit dat de observaties normaal verdeeld zijn.

In een histogram dat een normaalverdeling toont, is altijd een soort bel-vormige vorm te zien met de meeste scores in het midden (en dus een hoge piek), en richting de zijkanten een heuvel naar beneden. Het is een symmetrische, unimodale verdeling, met oneindige limieten. De horizontale as (abscis) representeert verschillende waarden van variabele X, en de verticale as (ordinaat) is ook wel de dichtheid en heeft te maken met de frequentie van of kans op een bepaalde waarde van X.

Carl Friedrich Gauss was een onderzoeker die de normaalverdeling tot zijn huidige vorm heeft gebracht, waardoor de verdeling ook vaak de Gaussiaanse verdeling wordt genoemd. De volgende formule geeft de normaalverdeling weer:

\[f(X)=\frac{1}{\sigma\sqrt{2\pi}}(e)^{-\frac{(X-\mu)^2}{2\sigma^2}}\]

Deze formule wordt bijna niet gebruikt, omdat de informatie van de verdeling ook in een tabel te vinden is. Door het gebruik van de juiste tabel kunnen er uitspraken over kansen gedaan worden.

De standaard normaalverdeling

Een tabel van de normaal distributie is afhankelijk van de waarden van het gemiddelde en de standaarddeviatie. Aangezien je niet voor elke combinatie hiervan een tabel kan opstellen wordt de standaard normaalverdeling gebruikt. De standaard normaalverdeling heeft een gemiddelde van 0 en een standaarddeviatie van 1. De distributie wordt daardoor N(0,1), waarbij N aangeeft dat het een normaalverdeling is, met 0 als waarde voor μ en 1 als waarde voor σ2. Door dit gemiddelde en deze standaarddeviatie, kunnen we deze standaard normaalverdeling in een tabel weergeven en dit toepassen op andere verdelingen.

Neem bijvoorbeeld een normaalverdeling met een gemiddelde van 50 en een SD van 10. De scores hebben betrekking op een gehele populatie van gedragsprobleemscores uit de YSR (Youth Selfreport Form). We willen weten welke scores horen bij de top 5% of 10% van de populatie. We hebben een tabel die de kansen weergeeft dat een individu een bepaalde score krijgt (die van de standaard normaalverdeling). We moeten dus de voorbeeldverdeling omzetten in een standaard normaalverdeling (en de ruwe scores worden omgezet in standaardscores).

Om dit te doen, moeten we het gemiddelde (en alle X-waarden) -50 doen, en de standaarddeviatie naar 1 krijgen door te delen door 10. De formule van de getransformeerde distributie genaamd z is:

\[z=\frac{x-\mu}{sigma} en voor dit specifieke geval dus: \[z=\frac{X-50}{10}

Alles wat je over standaardscore zi kan zeggen, kan je ook over Xi zeggen. Z is een cruciale kwantiteit, omdat de verdeling niet afhangt van µ en σ2. Deze omzetting in z-scores heeft geen effect op de vorm van de verdeling of de plaats van de observaties. We veranderen puur de eenheid. Door het omzetten in z-scores worden bepaalde dingen veel duidelijker: een score van 60 is nu een score 1. 60 was één standaarddeviatie (10 punten) boven het gemiddelde, en dat is het nog steeds, maar nu heeft het daadwerkelijk een waarde 1. Een score van 45 was 0.5 standaarddeviatie onder het gemiddelde, en is nu een z-score van -0.5. Een z-score geeft dus aan hoeveel standaarddeviaties een X-waarde boven of onder het gemiddelde ligt.

Let op: Het omzetten in z-scores past niet de vorm van de verdeling aan. Was een distributie niet normaal voordat het getransformeerd werd, dan is hij na transformeren nog steeds niet normaal.

Tabellen van de standaard normaalverdeling gebruiken.

Voorbeeld 1

Stel dat we willen weten hoe groot de kans is om meer dan 1 standaarddeviatie boven het gemiddelde te scoren in gedragsproblemen. Het gebied onder de curve van de standaard normaalverdeling, kan direct vertaald worden naar een kans. Oftewel: als je het gebied onder de curve uitrekent, weet je de kans op die score.

In dit geval willen we weten hoe groot het gebied onder de curve is vanaf z = 1 (want dat is gelijk aan 1 standaarddeviatie). In Appendix z (Howell, 2013) is te vinden dat het gebied van het gemiddelde tot z = 1 gelijk staat aan 0.3413. Ook geeft de appendix de ‘grotere portie’, dat wil zeggen het gehele gebied onder de curve tot z = 1, en de ‘kleinere portie’ ofwel het gehele gebied onder de curve vanaf z = 1. Deze laatste score willen we in dit geval hebben, en is 0.1587. De kans dat een kind dus meer dan één standaarddeviatie boven het gemiddelde van de populatie scoort, is .1587.

De Appendix heeft geen waarden staan van negatieve z waarden. Dit komt omdat de verdeling symmetrisch is, en alle z waarden en bijbehorende scores dus ook. Het gebied boven z = 1 is hetzelfde als bij z = -1. De kans is dus ook .1587 dat een kind meer dan één standaarddeviatie onder het gemiddelde scoort.

Voorbeeld 2

Stel dat we de kans willen weten dat een score tussen de 30 en de 40 valt. Eerst zet je de scores om in z scores (met de z formule). We willen de kans weten dat een score tussen -1.0 standaarddeviatie en -2.0 standaarddeviatie valt. Uit de Appendix z blijkt dat het gebied van het gemiddelde tot z = -2, 0.4772 is, en van gemiddelde tot z = -1.0 is het 0.3413. Het verschil tussen die gebieden is het gebied dat we zoeken en is dus 0.1359 groot. De kans dat een score tussen de 30 en 40 valt is .1359. Dit lijkt niet belangrijk om te weten, maar als je kind bijvoorbeeld 75 scoort op gedragsproblemen is er reden tot zorgen, aangezien deze score maar in .62% van de kinderen voorkomt.

Op welke manier worden kanslimieten bepaald?

In de statistiek zijn we vaak geïnteresseerd in waarschijnlijkheden. Tussen welke waarden zal een score waarschijnlijk vallen? Hiervoor kunnen we limieten stellen: "Als ik een willekeurig kind neem uit deze populatie, dan zal in 95% van de gevallen de score liggen tussen …. en …. " Als we dit in een normale verdeling bekijken, dan zoeken we het gebied waarin 95% van de scores vallen, en dus het gebied daarbuiten: de resterende 5%. Omdat de verdeling symmetrisch is, valt aan beide staarten de buitenste 2.5% af. Hierbij hoort een z- waarde van ± 1.96. 95% van de tijd zal een score tussen de 1.96 standaarddeviatie boven het gemiddelde, en 1.96 standaarddeviatie onder het gemiddelde vallen.

Deze z score is vervolgens om te zetten in een ruwe score X, door middel van de z formule.

\[\frac{1}{\sigma\sqrt{2\pi}}(e)^{-\frac{(X-\mu)^2}{2\sigma^2}}\]

Voor ons voorbeeld worden de limieten: 50 ± (1.96)(10) = 50 ± 19.6 = 30.4 en 69.9. De kans dat de score van het kind tussen 30.4 en 69.6 ligt is dus 95%. Scores boven 69.6 zouden dus weleens een probleem kunnen betekenen. Dit lijkt op het voorspellingsinterval.

Zijn de data normaal verdeeld?

De simpelste manier om de verdeling van data te checken, is door een normaalverdeling bovenop een histogram te plakken. Toch kan dit vaak misleidend zijn. Een veel betere aanpak is om Q-Q plots te gebruiken (kwantiel-kwantiel plots).

Van een perfecte normaalverdeling met gemiddelde = 0 en standaarddeviatie = 1 kunnen we makkelijk cut-off scores berekenen, zoals welke waarde de laagste 1% (of ook wel het eerste percentiel) van de verdeling markeert. Dit kunnen we doen voor elke waarde van 0.00 < p < 1.00 (waarbij p staat voor kans). De resultaten zijn de verwachte kwantielen van een normaalverdeling.

Ga nu kijken naar de data die je werkelijk hebt verzameld. Wanneer de eigenlijke data ook precies normaalverdeeld is, zullen de verkregen kwantielen precies gelijk zijn aan de verwachte kwantielen. Maar wat als het niet een perfecte normaalverdeling is? Dan moeten we bekijken in hoeverre de waarden afwijken van een normale verdeling. De manier om dit te doen is om verwachte en verkregen kwantielen tegen elkaar te plotten in een figuur (relatief de Y as en de X as). Als de verdeling normaal is, vormt de plot een rechte lijn met een hoek van 45 graden. Als de verdeling niet normaal is, zal er een afwijking in de lijn zijn (een kromming bijvoorbeeld).

De Kolmogorov-Smirnov test

Dit is de meest bekende test voor normaliteit, en is beschikbaar bij SPSS onder de non-parametrische testen. De meeste mensen raden het gebruik van deze test echter af, omdat hij soms normaliteit afwijst of juist goedkeurt terwijl het tegenovergestelde het geval is. Bij kleine steekproeven wordt de verdeling al snel als normaal gezien, terwijl ze soms niet-normaal verdeeld zijn. bij erg grote steekproeven wordt juist bij kleine afwijkingen de normaliteitshypothese afgewezen, terwijl deze kleine afwijkingen vaak geen probleem zijn.

Standaard diagnostische testen kunnen worden omgezet zodat ze een vast gemiddelde en een vaste standaarddeviatie hebben met de volgende formule:

\[\text{Nieuwe score} = \text{nieuwe standaarddeviatie}\cdot z + \text{nieuw gemiddelde}\]

Scoringssystemen met een gemiddelde van 50 en een standaarddeviatie van 10 heten T-scores.

Image

Access: 
Public

Image

Join: WorldSupporter!

Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>

Check: concept of JoHo WorldSupporter

Concept of JoHo WorldSupporter

JoHo WorldSupporter mission and vision:

  • JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.

JoHo concept:

  • As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
  • JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.

Join JoHo WorldSupporter!

for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for

Check: how to help

Image

 

 

Contributions: posts

Help others with additions, improvements and tips, ask a question or check de posts (service for WorldSupporters only)

Image

Image

Share: this page!
Follow: Psychology Supporter (author)
Add: this page to your favorites and profile
Statistics
2410
Submenu & Search

Search only via club, country, goal, study, topic or sector