Welke technieken worden gebruikt bij resampling en non-parametrische databenaderingen? - Chapter 18

De meeste statistische procedures in de voorgaande hoofdstukken waren parametrische testen: testen zoals de t test met aannames of schattingen van parameters (in de populatie). Een klasse testen, die niet afhangt van parameterschattingen zijn de non-parametrische testen of distributie-vrije testen (er is geen verdeling/distributie te maken). De meeste testen onder deze noemer zijn resampling testen. Deze testen baseren hun conclusies op een groot aantal steekproeven uit de populatie onder de aanname dat de nulhypothese juist is en vergelijken dit met de ‘resampled’ resultaten.

De resampling procedures die werken met ruwe scores zijn ofwel bootstrapping testen of randomisering testen. Deze technieken worden nu verder besproken.

Welke voor- en nadelen hebben non-parametrische testen?

Het grote voordeel van non-parametrische testen is dat ze niet afhangen van strenge voorwaarden over de vorm van de populaties. Er zijn wel voorwaarden over de steekproefverdeling, maar veel algemener van aard (er wordt bijvoorbeeld geen normale verdeling vereist). De assumpties van parametrische testen kunnen echter vaak wel tegen overschrijdingen.

Een ander kenmerk is dat veel non-parametrische testen gevoeliger zijn voor medianen dan voor gemiddelden. Dus bij een onderzoek met data waarbij je je interesseert in medianen is een non-parametrische test geschikt.

Veel non-parametrische testen rangschikken hun ruwe scores en werken met deze rangen. Daardoor zijn ze minder gevoelig voor extreme scores.

Een groot nadeel van non-parametrische testen is hun (vaak) lage power in vergelijking met de parametrische testen. Voor dezelfde power heeft een non-parametrische test vaak meer observaties nodig. Met een bepaalde set data zal een parametrische test dus eerder een valse nulhypothese verwerpen dan een non-parametrische. Dit is zelfs het geval als de assumpties van de parametrische test deels overschreden zijn.

Wanneer wordt bootstrapping gebruikt?

Bootstrapping is als procedure met name interessant wanneer we geïnteresseerd zijn in de mediaan. Het wordt meestal gebruikt bij het schatten van parameters, met name variatie. Bij bootstrapping wordt data telkens opnieuw gesampled met teruglegging uit een bepaalde populatie. Permutatie testen daarentegen, zijn testen die steekproeven trekken zonder teruglegging.

Stel dat we de betrouwbaarheidsgrenzen van een gemiddelde van een populatie willen vaststellen. Als de populatie normaal verdeeld is, gebruiken we het steekproefgemiddelde en de -standaarddeviatie als schattingen voor de populatie. Maar, dit kan alleen als ook de steekproefverdeling normaal is. Wanneer de populatie niet normaal verdeeld is, of we zeer kleine steekproeven hebben, is bootstrapping een goed alternatief.

Voorbeeld met mediaan

We verzamelen geheugenscores van een examen bij twintig participanten in de leeftijd van 80-84 jaar. We verwachten een negatieve scheefheid in de data: sommige van de participanten zullen verminderd cognitief functioneren op deze leeftijd. Van deze data willen we betrouwbaarheidsgrenzen berekenen op de mediaan.

De eerste stap is aannemen dat de populatie precies zo is verdeeld als onze steekproef. Vervolgens gaan we een populatie creëren door herhaaldelijk steekproeven te trekken uit onze bestaande steekproef, met teruglegging. Zo’n populatie gecreëerd uit het evenbeeld van een steekproef heet een pseudo-populatie.

Van elke steekproef die we trekken (elk van n = 20), berekenen we de mediaan. Uiteindelijk krijgen we een verdeling van medianen, waaruit we de betrouwbaarheidsinterval kunnen afleiden. Dit wordt makkelijk gedaan door een computer software programma.

In dit voorbeeld is de mogelijkheid aan scores zeer beperkt (tussen 2 en 12). De verdeling van medianen is dus vrij discreet. Normaal willen we bij betrouwbaarheidsintervallen de laagste en hoogste 2,5% van de observaties afscheiden maar nu kan dat niet. Bij discrete verdelingen is het beter om de limieten te berekenen waarbij bijvoorbeeld de score onder de 10 valt (en dan in het percentage mensen of observaties).

Voorbeeld met correlatiecoëfficiënt

Verdergaand op het voorbeeldonderzoek van eerder, kijken we nu naar 123 volwassenen tussen de 60 en 97 jaar, en onderzoeken we de relatie tussen geheugenprestaties en leeftijd. We verwachten een negatieve correlatie en zijn met name geïnteresseerd in de betrouwbaarheidsgrenzen van deze correlatie.

De bootstrap benadering is het trekken van 123 participanten uit de steekproef, met teruglegging, en de correlatie tussen de variabelen te berekenen. Na dit proces een groot aantal keer te herhalen, zoeken we de 2,5 en 97,5 percentielen in de verdeling en vinden zo het betrouwbaarheidsinterval. In het voorbeeld zijn deze grenzen -.43 en -.11. Doordat nul niet in dit interval ligt, kunnen we concluderen dat de correlatie significant is.

Bij grote correlaties zal de steekproefverdeling scheef zijn en de betrouwbaarheidsgrenzen asymmetrisch.

Wanneer worden permutatie testen gebruikt?

In tegenstelling tot bootstrapping, trekken permutatie testen steekproeven zonder teruglegging. Dit is een procedure van randomisering waarbij de set observaties willekeurig wordt gehusseld en willekeurig aan condities worden toegewezen.

Twee gekoppelde steekproeven

Als voorbeeld een onderzoek naar de rol van beta-endorfines als reactie op stress. De onderzoekers wilden weten of deze stof toenam bij stressvolle situaties. Ze onderzochten het niveau van endorfine bij negentien patiënten, twaalf uur vóór een operatie, en tien minuten vóór de operatie. Dit zijn scoreparen, en we zijn geïnteresseerd in de verschilscores. De nulhypothese is dat de gemiddelde verschilscore 0.0 is (geen effect). Als we naar de verschilscores per participant kijken, zien we dat de verdeling van deze scores zeer positief scheef is, een standaard t test is dus niet geschikt.

Het idee achter de permutatie is dat, bij een ware nulhypothese, oftewel dat stress de beta-endorfine niveaus niet beïnvloedt, de gevonden stressniveaus van elk meetmoment afkomstig kunnen zijn. Een score van 13.5 kan van het twaalf uur meetmoment zijn, of van het tien minuten moment (want het is dan puur een toevals-kans). Vervolgens geldt dat ook de verschilscores puur kans zijn, en negatief of positief kunnen zijn. De permutatie neemt een groot aantal steekproeven uit de data en schrijft willekeurig positieve en negatieve signalen toe aan de verschilscores. Hierdoor krijgen we een verdeling van verschilscores met ieder een eigen mediaan. Dit is dus de steekproefverdeling van verschillen wanneer H0 waar is. We vergelijken vervolgens de verkregen mediaanverschillen met deze distributie om H0 te testen.

De verdeling van de mediaan als H0 juist is, is symmetrisch rondom de nul. In de ruwe data in het voorbeeld vonden we een mediaan verschilscore van 6. Als we die opzoeken in de steekproefverdeling, blijkt dat een waarde 6 van de mediaan extreem is onder H0. Van de 10.000 steekproeven waren slechts 18 kleiner dan -6 of groter dan 6: een tweezijdige kans van 18/10.000 = .0018. We kunnen de nulhypothese verwerpen: endorfine niveaus nemen toe als stress toeneemt.

Wat is de Wilcoxon’s Rang-Som test?

Dit is een traditionele non-parametrische test, en is geschikt voor twee onafhankelijke steekproeven (bijna een analoog van de t test). De nulhypothese is dat de twee steekproeven willekeurig van identieke populaties zijn getrokken. De logica achter de test is als volgt:

We hebben twee groepen in de behandeling, met n1 observaties in groep 1 en n2 observaties in groep 2. We nemen aan dat de nulhypothese onjuist is, en dat de scores van groep 1 over het algemeen lager zijn dan de scores van groep 2. Wanneer we alle observaties van beide groepen zouden rangschikken van laag naar hoog, verwachten we dat de lagere rangen meestal groep 1 scores betreffen en de hogere rangen groep 2 scores. De som van rangen van elke groep zal dan verschillen: de som van groep 1 is veel kleiner dan die van groep 2.

Bij een ware nulhypothese heeft elke groep een paar hoge en een paar lage rangen (willekeurig) en zal de som van de rangen per groep grofweg gelijk zijn.

Voorbeeld

Een voorbeeld waarbij deze test wordt gebruikt, is een onderzoek naar het verband tussen stressvolle levensgebeurtenissen (het aantal hiervan) en hartpatiënt zijn of een orthopedische patiënt. Je zou verwachten dat hartpatiënten meer stress hebben.

We hebben zes hartpatiënten en vijf orthopedische patiënten en het aantal stressvolle gebeurtenissen per persoon. Deze scores rangschikken we van laag naar hoog, ongeacht groep. Als n1 nemen we de kleinste groep (in dit geval orthopedische groep): we berekenen de som van de rangen Ws = 21. In Wilcoxon’s tabel kan de kritieke waarde worden opgezocht bij n1 = 5 en n2 = 6: deze is 18. Om een significant verschil tussen de groepen aan te tonen bij een alfa van .025 moet Ws kleiner of gelijk aan 18 zijn. We hebben geen significant verschil, aangezien onze Ws groter was dan 18. We kunnen de statistiek Ws’ uitrekenen om te zien wat de som van ranken voor de kleinste groep geweest was als we de rangorde omgedraaid hadden naar van hoogste naar laagste:

  • Ws’= 2W - Ws. 2W = n1(n1 + n2 + 1).

De Appendix voor Ws kan gebruikt worden tot n1 en n2 van 25. Voor grotere waarden gebruiken we het volgende:

  • Gemiddelde = n1(n1 + n2 + 1)/2
  • Standaardfout = 

\[\sqrt{\frac{n_1n_2(n_1+n_2+1)}{12}}\]

\[Z=\frac{W_s-\frac{n_1(n_1+n_2+1)}{2}}{\sqrt{\frac{n_1n_2(n_1+n_2+1)}{12}}}\]

Bij gelijke scores zijn er verschillende manieren om hier mee om te gaan: gelijke scores geven, kiezen door een munt op te gooien of ongelijke ranken geven zodat het moeilijker wordt H0 te verwerpen. Meestal wordt de eerste optie gebruikt.

Wilcoxon’s test is eigenlijk een permutatie test op gerangschikte data. Een standaard permutatie test kan uitgevoerd worden op de rangen en hetzelfde resultaat zou eruit komen. Een test gelijk aan de Wilcoxon’s test is de Mann-Whitney U statistiek. De relatie tussen de twee is perfect lineair, met de formule:

\[U=\frac{n_1(n_1+n_2+1)}{2-W_s}\]

Wat is de Wilcoxon’s matched-pairs test?

Wilcoxon heeft niet alleen de populairste non-parametrische test voor onafhankelijke groepen ontwikkeld, maar ook die voor gematchte groepen (scoreparen). De nulhypothese die getest wordt, is dat de twee steekproeven van identieke populaties komen of van symmetrische populaties met hetzelfde gemiddelde. Het toetst ook de nulhypothese dat de verdeling van verschilscores symmetrisch is rond nul.

Voorbeeld

We willen weten of langdurig joggen de bloeddruk kan verlagen. We meten de bloeddruk bij participanten, laten ze dan een programma van zes maanden volgen waarin ze veel joggen, en meten dan weer de bloeddruk. We verwachten een lagere bloeddruk aan het eind.

We beginnen met de verschilscores te berekenen van elk scorepaar. Dan rangschikken we die verschilscores zonder te letten op de waarde (positief of negatief). De rangen nemen de waarde over. Per groep sommen we uiteindelijk de rangen op.

Om de significantie te berekenen nemen we de absolute waarde van de twee sommen en kiezen daar de kleinste uit (en noemen hem T). Deze vergelijken we in Appendix T (Howell, 2013: 703).

 

Voor:

130

170

125

170

130

130

125

160

Na:

120

163

140

135

143

136

124

120

Verschil:

10

7

-15

35

-13

-6

1

40

Rang:

5

4

2

7

6

3

1

8

Rang met waarde:

5

4

-2

7

-6

-3

1

8

T+ = ∑ positieve rangen = 27

T- = ∑ negatieve rangen = -9

 

 

 

 

 

 

De kleinste som is die van T-, dus T = 9. In Appendix T hoort bij een n = 8 en een alfa van .025 de kritieke waarde T = 3 of 4, dus we verwerpen de nulhypothese niet. Bloeddruk verandert dus niet na zes maanden joggen.

Gelijke scores kunnen voorkomen, waardoor de verschilscore nul is. Deze participanten worden niet meegenomen in het onderzoek. Het kan ook voorkomen dat we dezelfde rangen hebben. Hierbij kunnen we de rangen opbreken zoals we willen.

Bij een steekproef met een n groter dan 50 gaan we over de limiet van Appendix T. Dan geldt echter dat we de steekproefverdeling van T als normaal verdeeld kunnen zien, en kunnen we een z score berekenen aan de hand van T en n.\

  • Gemiddelde = n(n+1)/4
  • Standaardfout = 

\[\sqrt{\frac{n(n+1)(2n+1)}{24}}\]

\[Z=\frac{T-\frac{n(n=1)}{4}}{\sqrt{\frac{n(n+1)(2n+1)}{24}}}\]

Wat is de sign test?

De sign (teken) test gaat nog verder dan de Wilcoxon test en kijkt alleen naar het teken (+/-) van de verschilscores. Hierdoor verliest het nog meer power.  We maken gebruik van een tabel met verwachtte frequenties voor elke cel en berekenen chi-kwadraat:

\[\frac{\sum{(O-E)^2}}{E}\]

Wanneer wordt de Kruskal-Wallis one-way ANOVA gebruikt?

Dit is de Wilcoxon rang-som test voor drie of meer onafhankelijke groepen. Het test de hypothese dat alle steekproeven uit identieke populaties komen. We rangschikken weer de scores en berekenen weer de som van de rangen. Elke som noemen we Ri (met i verschillend per groep). Bij een juiste nulhypothese verwachten we dat de Ri’s min of meer gelijk zijn.

De verschillen tussen de Ri’s wordt uitgedrukt in de term H:

\[H=\frac{12}{N(N+1)}\sum{\frac{R_j^2}{n_i}}-3(N+1)\]

  • waarbij k het aantal groepen is, ni het aantal observaties in groep i, Ri de som van rangen in groep i en N de totale steekproefgrootte. Deze term kan in de χ² verdeling worden opgezocht met k-1 df.

Hoe werkt Friedman’s rang test voor herhaalde metingen?

Deze test lijkt sterk op een herhaalde metingen ANOVA, maar werkt met rangen in plaats van ruwe scores. De nulhypothese is dat de scores voor elke behandeling uit identieke populaties komen. De formule voor het toetsen van de nulhypothese is:

\[X_F^2=\frac{12}{Nk(k+1)}\sum{R_i^2}-3N(k+1)\]

  • waarbij Ri de som van de rangen is voor de i-de conditie, N het aantal participanten en k het aantal condities. De XF2-waarde kan opgezocht worden in een standaard X2 verdeling met k-1 df.

Image

Access: 
Public

Image

Join: WorldSupporter!

Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>

Check: concept of JoHo WorldSupporter

Concept of JoHo WorldSupporter

JoHo WorldSupporter mission and vision:

  • JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.

JoHo concept:

  • As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
  • JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.

Join JoHo WorldSupporter!

for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for

Check: how to help

Image

 

 

Contributions: posts

Help others with additions, improvements and tips, ask a question or check de posts (service for WorldSupporters only)

Image

Image

Share: this page!
Follow: Psychology Supporter (author)
Add: this page to your favorites and profile
Statistics
2730
Submenu & Search

Search only via club, country, goal, study, topic or sector