Samenvatting van Statistical Methods for Psychology van Howell - 8e druk

Samenvatting bij Statistical Methods for Psychology

    Lees verder voor de samenvattingen per hoofdstuk

    Image

    Check: summaries and supporting content in full
    Welke begrippen zijn belangrijk bij correlationeel en experimenteel onderzoek? - Chapter 1

    Welke begrippen zijn belangrijk bij correlationeel en experimenteel onderzoek? - Chapter 1

    In dit hoofdstuk worden statistische begrippen uitgelegd aan de hand van een praktisch voorbeeld: een groep onderwijzers heeft een cursus samengesteld, die als doel heeft om middelbare scholieren om te leren gaan met stress. Dit zou vervolgens een uitwerking moeten hebben op hun gevoel van eigenwaarde.

    Welke belangrijke termen zijn er?

    Het gaat te ver om de gehele populatie van middelbare scholieren in het land te onderzoeken, dat zijn er teveel en het is niet logisch is om alle scholieren te testen als nog niet duidelijk is of de cursus werkt. Daarom wordt een steekproef getrokken uit de populatie. Het liefst een willekeurige (random) steekproef. Om een willekeurige steekproef te trekken moet een set procedures gevolgd worden, die ervoor zorgen dat elke student in de populatie evenveel kans heeft om geselecteerd te worden. Een puur willekeurige steekproef bestaat eigenlijk niet. Na het trekken van de steekproef moet via willekeurige toewijzing de helft van de proefpersonen aan de cursus worden toegewezen, en de andere helft krijgt geen cursus.

    Een populatie is het geheel aan gebeurtenissen waarin men geïnteresseerd is. Hier zijn dat dus de eigenwaarde scores van alle middelbare scholieren in een bepaald gebied. Populaties kunnen enorm in grootte variëren. Omdat het onmogelijk is om de hele populatie te meten, maken we gebruik van een steekproef, waarna we uitspraken proberen te doen over de gehele populatie. De representativiteit van de uitkomsten van de steekproef voor de populatie zijn afhankelijk van hoe willekeurig de steekproef getrokken was. Als deze weinig willekeurig is, zal het minder betekenisvol zijn, omdat het geen goede reflectie is van de populatie.

    Hoe goed een steekproef de populatie representeert, wordt uitgedrukt in externe validiteit. Dit heeft te maken met hoe goed je conclusies kan trekken over de populatie vanuit de steekproef. Hoe representatief een steekproef is, ligt aan het type onderzoek. Een steekproef kan tegelijkertijd ook een populatie zijn: de scores van een klas kunnen als steekproef gebruikt worden voor de scores van alle leerlingen op een school, maar wanneer men alleen geïnteresseerd is in de scores van die klas, is dit de gehele populatie. Het willekeurig selecteren van participanten is belangrijk voor het generaliseren van de resultaten van de steekproef naar de populatie. Dit generaliseren is minder geloofwaardig wanneer een steekproef niet representatief is voor de populatie. Wanneer dit wel het geval is, hebben de schattingen validiteit.

    Naast externe validiteit is er ook interne validiteit. Dit heeft te maken met het willekeurig toewijzen van participanten aan een conditie. We willen zeker weten dat de resultaten uit het onderzoek voortkomen uit de verschillen tussen de groepen door de verschillende behandeling (het volgen van de cursus of niet) en niet door bestaande verschillen tussen de groepen, zoals dat één groep vooral uit verlegen scholieren bestaat en de andere uit assertieve scholieren. Dit zou bijvoorbeeld kunnen gebeuren als studenten zichzelf kunnen opgeven voor de cursus.

    Wat zijn variabelen en welke soorten zijn er?

    Na het selecteren van participanten en het toewijzen aan een van de groepen, moet bekeken worden hoe elke groep behandeld wordt en welke variabelen worden gemeten. Een variabele is een eigenschap van een object of gebeurtenis die verschillende waarden kan hebben, zoals haarkleur. In het voorbeeldonderzoek zijn variabelen bijvoorbeeld eigenwaarde, geslacht, sociale steun en de behandelconditie.

    Variabelen kunnen afhankelijk of onafhankelijk zijn. De onafhankelijke variabele is de variabele die gecontroleerd wordt. In dit geval is het groepslidmaatschap (wel of geen cursus). Wij bepalen wie welke behandeling krijgt, maar ook wat die behandelingen inhouden. Geslacht kunnen we niet controleren, maar we kunnen wel kiezen welk geslacht we onderzoeken en dat we mannen en vrouwen willen vergelijken. Het resultaat van het onderzoek zijn de afhankelijke variabelen, zoals de eigenwaarde scores of gevoelens van persoonlijke controle. Afhankelijke variabelen zijn meestal kwantitatief en continu. Onafhankelijke variabelen kunnen zowel kwantitatief als kwalitatief en discreet als continu zijn.

    Discrete variabelen zijn variabelen met een beperkt aantal mogelijke waarden, zoals geslacht of de klas waarin een middelbare scholier zit. Continue variabelen kunnen, in theorie, elke waarde tussen het laagste en hoogste punt op de schaal aannemen. Dit zijn variabelen zoals leeftijd en de score op eigenwaarde.

    Kwantitatief versus kwalitatief

    Kwantitatieve data (ook wel meet-data) is het resultaat van een bepaalde meting, zoals een cijfer voor een toets, het gewicht, of scores op een eigenwaarde schaal. Er is gebruik gemaakt van een meetinstrument om te kijken hoeveel van een bepaalde eigenschap een object bezit.

    Kwalitatieve data wordt ook wel frequentie data of categorische data genoemd. Hierbij worden dingen gecategoriseerd (ingedeeld), zoals ‘15 mensen werden geclassificeerd als ‘zeer angstig’, 33 als ‘neutraal’, en 12 als ‘weinig angstig’. De data bestaat uit frequenties voor elke categorie.

    Welke velden in de statistiek zijn belangrijk?

    Als de variabelen gekozen zijn en het onderzoek is afgenomen, houden we ruwe data over: de scores. Twee velden in de statistiek houden zich bezig met deze data.

    1. Beschrijvende statistieken worden gebruikt om de data te beschrijven. We kunnen gemiddelden berekenen, de scores in een grafiek uitbeelden en op zoek gaan naar extreme scores. Dit veld werd lang als een oninteressant deel in de statistiek gezien. John Tukey liet echter met explorerende data-analyse zien dat het bestuderen van ruwe data nodig is voordat verdere analyses gedaan kunnen worden.
    2. Inferentiële (‘gevolgtrekkende’) statistieken gaat over het maken van inferenties over de populatie op basis van een bepaalde steekproef. Door middel van inferentiële statistieken proberen we hier antwoord op te geven. Wanneer een meting betrekking heeft op de gehele populatie, heet het een parameter. Wanneer het alleen betrekking heeft op de steekproef, is het een statistiek. Statistieken zijn dus schattingen van wat de parameter zal zijn.

    Welke soorten meetschalen zijn er?

    Halverwege de jaren ’50 zijn schalen gemaakt waarin variabelen konden worden ingedeeld. Tegenwoordig hecht men hier niet veel waarde meer aan, maar de termen blijven vaak voorkomen. Bij de volgende schalen geldt, dat elke schaal de eigenschappen overneemt van de schalen die daar vóór kwamen.

    Nominale schalen zijn eigenlijk geen schalen: ze delen items niet in op een bepaalde dimensie, maar labelen ze alleen. Sekse is bijvoorbeeld een nominale variabele: een participant is een man of een vrouw, maar geen van beide opties is beter/hoger/meer waard dan de ander. Categorische data wordt meestal gemeten op een nominale schaal.

    Ordinale schalen zijn de simpelste schalen: ze ordenen mensen, objecten of gebeurtenissen langs een continuüm. We kunnen niets zeggen over de intervallen tussen de schaalpunten. Zo is een commandant lager in rang dan een kapitein, maar hoger dan een soldaat. Maar het verschil tussen commandant en kapitein hoeft niet gelijk te zijn aan het verschil tussen soldaat en commandant.

    Interval schalen bevatten gelijke intervallen tussen de schaalpunten, zoals graden Celsius. Een verschil van tien graden op de thermometer betekent altijd hetzelfde. Wat de interval schaal niet kan zeggen, is iets over verhoudingen. We kunnen niet zeggen dat 20°C de helft zo heet is als 40°C, of twee keer zo heet als 10°C.

    Ratio schalen hebben een waar nulpunt (0°C is bijvoorbeeld geen waar nulpunt, want temperatuur houdt bij deze waarde niet op). Voorbeelden zijn lengte, volume of tijd. We kunnen nu ook zeggen dat tien seconden twee keer zo lang is als vijf seconden.

    Om de schaal van een variabele te definiëren moet je kijken naar de onderliggende variabele die gemeten wordt. Bijvoorbeeld: als we temperatuur gebruiken om iemands comfort te meten, dan is de schaal niet meer interval, want comfortintervallen zijn niet van gelijke grootte.

    Access: 
    Public
    Hoe werkt het beschrijven en verkennen van data? - Chapter 2

    Hoe werkt het beschrijven en verkennen van data? - Chapter 2

    Hoe kun je data plotten?

    In dit hoofdstuk wordt getoond hoe data gestructureerd kan worden zodat het beter te interpreteren is. Ruwe data is namelijk slechts een verzameling getallen. Structuur kan worden aangebracht door de data in een grafiek weer te geven. Een voorbeeld: om te kijken hoe mensen gegevens uit hun geheugen terughalen, wordt een experiment gedaan waarbij één, drie of vijf getallen worden getoond op een scherm. Daarna wordt één getal getoond, waarna op de positieve knop gedrukt wordt als het getal in de eerdere reeks voorkwam, of op de negatieve als die er niet in voorkwam. Reactietijden worden hierbij gemeten. Dit resulteert in een reeks reactietijden die we in een tabel kunnen zetten. Een frequentie distributie kan de data ordenen, door aan te geven hoe vaak een bepaalde reactietijd voorkwam. De proefpersoon reageert bijvoorbeeld 5 keer binnen 50/100 van een seconde. Zo wordt zichtbaar welke reactietijd het meest voorkomt.

    Welke kenmerken heeft een histogram?

    De frequentie distributie is goed uit te beelden in een figuur, bijvoorbeeld een histogram. De verticale as geeft de frequentie weer, en de horizontale as de reactietijden. Om willekeurige ‘noise’ te verwijderen, omdat dit waarschijnlijk geen betekenis heeft, kunnen frequenties samengevoegd worden in blokken van 5/100 van een seconde. De belangrijkste trends in de data blijven zo zichtbaar. Wanneer gebruikgemaakt wordt van samengevoegde frequenties, ofwel intervallen, dan zijn de ware grenzen van die intervallen de decimale waarden die halverwege vallen tussen de top van één interval en de onderkant van de volgende. Bijvoorbeeld: Het interval 35-39 omvat alle waarden tussen de 34.5 (ondergrens) en 39.5 (bovengrens).

    Voor nog meer overzichtelijkheid zou je in een grafiek of tabel ook alleen de middenpunten kunnen weergeven: het gemiddelde van de boven- en ondergrens van een interval. Bij het gebruik van intervallen is het verstandig om tussen de 10 tot 12 intervallen te hebben. Gebruik daarbij zoveel mogelijk natuurlijke breekpunten, dus bijvoorbeeld 0-9, 10-19 etc. In het voorbeeld heeft de participant één keer een waarde behaald van 125/100 van een seconde, een zeer langzame reactietijd in vergelijking met de andere scores. Deze waarde wordt een uitschieter genoemd (‘outlier’), omdat hij sterk afwijkt van de rest van de data. Vaak zijn uitschieters fouten in het opnemen van de data.

    Wanneer worden vloeiende lijnen op data toegepast?

    Histogrammen worden gebruikt om data op een handige manier uit te beelden, maar ze hebben hun tekortkomingen. Zo wordt data niet helder uitgebeeld bij kleine steekproeven, omdat kleine veranderingen in intervalgrootte al grote veranderingen teweeg brengen in de distributievorm. Om een betere weergave te krijgen, moet een vloeiende curve op de data worden toegepast.

    Een normale curve

    De normale curve wordt ook wel de bell-curve genoemd vanwege de vorm: hij is het hoogst in het midden van de distributie en loopt symmetrisch af naar beneden aan beide kanten van dit midden. Deze vorm in de curve hoort bij een normaalverdeling. Hier wordt later verder op ingegaan.

    Kernel dichtheidsplot

    Bij een normale curve worden maar een paar gegevens gebruikt, namelijk het gemiddelde en de standaarddeviatie van de data. Er wordt geen rekening gehouden met de eigenlijke distributievorm. Individuele scores spelen dus geen rol in de plot. De Kernel dichtheidsplot is het tegenovergestelde: het gebruikt juist individuele data en doet niets met het gemiddelde of de standaarddeviatie. De Kernel plot houdt rekening met het feit dat elke observatie of score een bepaalde mate van toeval bevat. Een score van 80/100 had net zo goed 79/100 of 85/100 kunnen zijn. Elke score heeft zo een eigen distributie van mogelijke scores. De Kernel plot telt in feite al deze losse normaalverdelingen op en maakt daar een totale verdeling van die beter in de buurt komt van de werkelijke verdeling.

    Welke voordelen heeft een steel-en-blad weergave?

    Het nadeel van histogrammen is dat ze gebruikmaken van intervallen, waardoor de individuele scores verloren gaan. Het nadeel van frequentieverdelingen is dat ze juist individuele scores gebruiken, maar de data niet voldoende samenvatten. De ‘stem-and-leaf’ weergave vermijdt beide kritiekpunten.

    Om deze methode uit te leggen, wordt de volgende dataset gebruikt: een dataset van het aantal minuten per week dat 100 studenten elektronische spellen spelen. In tabel 1 staat een deel van de scores, namelijk die tussen de 40 en 80 minuten per week.

     

    Tabel 1

     

     

    Ruwe data

    Steel

    Blad

     

    0

    00000000000233566678

     

    1

    2223555579

     

    2

    33577

    40 41 41 42 43 43 44

    3

    22278999

    46 46 46 47 48 49 49

    4

    01123346667899

    52 54 55 55 57 58 59

    5

    24557899

    63 67

    6

    37

    71 75 75 76 76 78 79

    7

    1556689

     

    8

    34779

     

    9

    466

     

    10

    23677

    De cijfers die de tientallen maken (de 4, 5, 6 en 7 hier) heten de leidende getallen of de meest significante getallen. Deze leidende getallen vormen de steel, of verticale as, van de weergave. Van de 14 scores in de 40 was er één 40, twee 41s, één 42, etc. De eenheden in deze getallen (de 0, 1, 2 etc.) heten de volgende (of minder significante) getallen. Zij vormen de bladeren. Naast het getal 4 onder de steel zie je deze eenheid getallen terugkomen. Eén nul, twee enen, etc. In de tabel kun je teruglezen hoeveel studenten een bepaalde tijd spelletjes spelen. 11 studenten spelen 0 minuten per week spelletjes, 1 student speelt 2 minuten, etc. De getallen onder de kolom ‘blad’ geven een liggend histogram weer.

    Soms is de groepering te grof voor de doeleinden. Een oplossing zou kunnen zijn om de intervallen in de ‘blad’ kolom kleiner te maken. In plaats van het samenvoegen van 40 tot 49, kun je er ook voor kiezen om intervallen te maken van 40-41, 42-43, 44-45 etc. (zie tabel 2). In dat geval krijgt de ‘blad’ kolom bijvoorbeeld de variabelen 4, 4t en 4f respectievelijk (de ‘t’ staat voor ‘two’ en ‘three’, de ‘f’ voor ‘four’ en ‘five’). De enige voorwaarde hierbij is, dat elk interval even groot moet zijn.

    Tabel 2

     

     

    Ruwe data

    Steel

    Blad

    42 42 42 43 43 43 43 43

    4t

    22233333

    44 44 44 45 45

    4f

    44455

    Steel-en-blad weergaven zijn voornamelijk praktisch wanneer twee verschillende distributies vergeleken worden. Daarbij worden de twee distributies aan weerszijden van de steel getoond.

    Met welke termen kan data beschreven worden?

    De normaalverdeling is symmetrisch: hoog in het midden en naar beide kanten even snel dalend. Niet elke distributie zal er zo uitzien. Een bimodale distributie heeft bijvoorbeeld twee pieken. Als een distributie maar één piek heeft, heet het een unimodale distributie. Modaliteit verwijst naar het aantal grote pieken in een distributie. Een distributie kan ook asymmetrisch zijn, in dat de verdeling aan één van beide zijden van de piek langer uitloopt. Een distributie met een ‘staart’ naar de linkerkant heeft een negatieve scheefheid (‘skew’), een distributie met een staart naar rechts heeft een positieve scheefheid.

    Ten slotte is er kurtosis of piekvormigheid. Dit is een maat voor de concentratie van scores in het midden of in de staarten van de distributie.

    1. Mesokurtisch: een normaalverdeling (de piek zit in het midden).
    2. Platykurtisch: een verdeling met een plattere curve (meer scores tussen de staarten en het centrum in).
    3. Leptokurtisch: een verdeling met een steilere piek, maar ook dikkere staarten (meer scores in het centrum en in de staarten).

    Hoe de verdeling van scores is, wordt pas zichtbaar als de steekproef groot genoeg is.

    Welke notatiesysteem wordt gebruikt in de statistiek?

    In de statistiek is er (nog) geen standaard notatiesysteem dat wordt gehanteerd. Een simpel notatiesysteem zou kunnen worden gebruikt. Ook al is er dan sprake van iets minder precisie, het begrip hierdoor wel enorm verhoogd wordt.

    Variabelen

    Over het algemeen geeft een hoofdletter, vaak X of Y, een variabele als geheel weer. Een subscript bij die letter is een individuele waarde van die variabele. Om naar een enkele score te refereren zonder een specifieke score te selecteren, schrijf je Xi.

    Opsomming

    Een van de meest gebruikte symbolen is de hoofdletter sigma (Σ), de standaardnotatie voor opsomming. Letterlijk betekent het: ‘tel alles wat volgt bij elkaar op’. Zo moet je bij ΣXi alle Xi’en optellen (voor het gemak wordt de ‘i’ hier vaak bij weggelaten). Let ook op bij ΣX2, wat betekent ‘tel alle X2’en op’. (ΣX)2 daarentegen geeft aan dat eerst de X’en opgeteld moeten worden, en dit daarna in het kwadraat gedaan moet worden. Bij ∑XY worden de producten van de waarden van X en Y bij elkaar opgeteld.

    Dubbel subscript

    Een dubbel subscript kan gebruikt worden om te specificeren welke waarde van X bedoeld wordt. Bij een tabel kun je bijvoorbeeld aangeven welke rij en kolom je bedoelt (de ide rij en de jde kolom): X2,3 betekent dan de waarde in rij 2, kolom 3. Aanduiding 1 betekent dat alle Xij’en opgeteld moeten worden voor de i waarden 1 en 2 en de j waarden 1 tot en met 5.

    Aanduiding 1

    \[\sum {^{2}_{i}} = 1 \sum {^{5}_{j}} = 1X_{ij}  \]

    Wat is de centrale tendens?

    Metingen van de centrale tendens, of ook wel ‘metingen van locatie’, zijn die metingen die aantonen waar op de schaal de distributie zich centreert. Er zijn drie manieren om dit te doen: de modus, de mediaan, en het gemiddelde. De manieren verschillen in de hoeveelheid data die ze gebruiken: de modus is gebaseerd op slechts enkele data punten, de mediaan negeert de meeste data en het gemiddelde wordt berekend met gebruik van alle data.

    1. Modus (Mo): wordt het minst gebruikt en is vaak het minst bruikbaar. Dit is simpelweg de meest voorkomende score, ofwel, de score die de meeste participanten hadden (het hoogste punt in de distributie). In het geval dat twee aangrenzende scores even vaak voorkomen, wordt hieruit het gemiddelde genomen. Wanneer deze twee scores ver uit elkaar liggen, is de verdeling bimodaal en is het handiger om twee modi te noemen.
    2. Mediaan (Mdn): de score die correspondeert met het punt waarop of onder 50% van de scores vallen als de data geordend is op numerieke volgorde. Daarom wordt het ook wel het 50e percentiel genoemd. Stel dat we de scores 4, 6, 8, 9 en 16 hebben, dan is 8 de mediaan. Bij een even aantal scores, dus 4, 6, 8, 12, 15 en 16, valt de mediaan tussen de 8 en de 12. In dat geval wordt het gemiddelde van de twee middelste scores als mediaan genomen (10). Een handige formule om het scorenummer te vinden waar de mediaan valt, is die van de mediaan locatie: (N+1)/2. Dus, bij vijf scores ligt de mediaan bij ((5+1)/2 =3) het derde nummer in de geordende reeks. Bij een uitkomst van 6,5, is de mediaan het gemiddelde van het zesde en zevende nummer.
    3. Gemiddelde: deze meting van de centrale tendens wordt het meest gebruikt: \[\bar{X}\] Het gemiddelde is de som van de scores, gedeeld door het aantal scores, oftewel: 

    \[\frac{\sum{\bar{X}}}{N}\]

    Welke voor- en nadelen hebben de mediaan, modus en gemiddelde?

    Wanneer de distributie vrijwel symmetrisch is, liggen de mediaan en het gemiddelde dicht bij elkaar. Als de verdeling ook unimodaal is, ligt ook de modus dichtbij de mediaan en het gemiddelde. In alle andere gevallen moet goed nagedacht worden welke meting wordt gebruikt.

    Modus: De modus is per definitie een score die werkelijk voorkomt. Dit is bij het gemiddelde en de mediaan niet (altijd) zo. De modus representeert daarnaast ook de grootste groep mensen.

    Mediaan: Het grote voordeel van de mediaan is, net als bij de modus, dat het niet beïnvloed wordt door extreme waarden. Dit is dus een goede optie in onderzoeken waarbij extreme waarden voorkomen, wanneer deze extreme waarden niet van belang zijn.

    Gemiddelde: Het gemiddelde wordt het meest gebruikt. Een groot nadeel van het gemiddelde is echter dat het beïnvloed wordt door extreme scores en dat de waarde van het gemiddelde soms geen bestaande score is. De interpretatie van de gemeten variabele vereist ook geloof in de intervaleigenschappen van de data. Toch is het gemiddelde een sterke meting, door bepaalde voordelen. De belangrijkste is dat het gemiddelde gemanipuleerd kan worden in berekeningen. Daarnaast kan het gebruikt worden om een populatiegemiddelde te schatten: een steekproefgemiddelde is vaak een betere schatting van een populatiegemiddelde dan een modus of mediaan.

    ‘Bijgeknipt’ gemiddelde

    Dit zijn gemiddelden, berekent over data waarbij een deel van de scores is weggelaten (aan het uiteinden van de staarten). Bij een 10% bijgeknipt gemiddelde over 100 scores, worden aan elk uiteinde de laatste tien scores weggelaten en wordt het gemiddelde van de overige scores berekend. Door het bijknippen vallen extreme waarden weg, waardoor de schatting van het populatiegemiddelde stabieler is. De extreme scores in een scheve verdeling trekken het gemiddelde naar zich toe en door deze scores te verwijderen wordt de verdeling normaler.

    Op welke manier kan variabiliteit gemeten worden?

    Het is handig om te weten waar de data zich centreert. Daarnaast is het ook belangrijk om te meten in hoeverre de afzonderlijke scores afwijken van een gemiddelde, mediaan of modus. Dit heet de dispersie, of veranderlijkheid, rond een punt. Over het algemeen wordt er gekeken naar de dispersie rondom het gemiddelde.

    Om dispersie uit te leggen, wordt het volgende voorbeeld gebruikt: twee onderzoekers willen onderzoeken wat een gezicht aantrekkelijk maakt: bijzondere kenmerken of juist een ‘algemene’ look. Om dit te onderzoeken, maken ze foto’s op de computer: gezichten samengesteld uit vier verschillende gezichten (Set 4), waar dus nog wat bijzonderheid in te zien is, en gezichten samengesteld uit 32 gezichten (Set 32). Studenten beoordelen beide foto’s op een schaal van 1 tot 5. Uit het onderzoek blijkt, dat Set 32 gezichten als aantrekkelijker worden beoordeeld. Daarnaast blijkt, dat de scores van Set 32 gezichten veel dichter bij elkaar liggen dan bij Set 4 gezichten (de scores zijn homogener). Dit verschil in veranderlijkheid willen we met een meting weergeven.

    Range

    De range is een meting van afstand van de laagste tot de hoogste score. De laagste score bij Set 4 was 1.20, de hoogste score 4.02, dus de range is 4.02 - 1.20 = 2.82 eenheden. De range is echter compleet afhankelijk van extreme waarden, of zelfs uitbijters, en kan hierdoor een verkeerd beeld schetsen.

    Interkwartiel range en andere statistieken

    De interkwartiel range probeert de afhankelijkheid van extreme waarden te verminderen. Deze wordt namelijk uitgerekend door eerst de bovenste en onderste 25% van de distributie weg te laten. Het punt dat de onderste 25% van de verdeling afsnijdt, heet het eerste kwartiel of Q1. Het punt voor de bovenste 25% heet het derde kwartiel of Q3. De mediaan is daarbij het tweede kwartiel. De interkwartiel range is het verschil tussen het eerste en het derde kwartiel (Q3 – Q1). Interkwartielen zijn belangrijk in boxplots, daarover later meer.

    Er wordt echter vaak teveel data weggelaten. Het weghalen van data moet gerechtvaardigd zijn en kan dan elk percentage bevatten dat men wilt. Over het algemeen wil je scores weghalen die komen door fouten of ongebruikelijke gebeurtenissen, zodat de variabiliteit niet verwijderd wordt. Er kan ook gebruik gemaakt worden van getrimde steekproeven. Hierbij wordt de Winsorized steekproef gebruikt. Een 10% Winsorized steekproef houdt in dat de laagste 10% van de scores verwijderd wordt en vervangen door kopieën van de laagste 10% scores die overblijft. Dit wordt ook bij de hoogste 10% zo gedaan.

    De gemiddelde deviatie

    Op het eerste gezicht lijkt de makkelijkste manier om afstanden vanaf het gemiddelden te meten, om alle afwijkingen (deviaties) uit te rekenen en hiervan het gemiddelde te nemen. Maar, omdat de helft van de scores een positieve deviatie zal hebben en de andere helft een negatieve, krijg je uiteindelijk altijd een opgetelde deviatie van 0. Dit werkt dus niet.

    De gemiddelde absolute deviatie

    De absolute waarde van een getal is die waarde zonder + of – teken. Hierdoor lossen we het probleem op dat opgetelde deviaties altijd 0 opleveren. Alle absolute deviaties worden opgeteld en het gemiddelde wordt hiervan genomen om tot de gemiddelde absolute deviatie te komen. Toch wordt deze nauwelijks gebruikt, omdat andere metingen handiger zijn.

    Variantie en standaarddeviatie

    De steekproefvariantie (s2) heeft een andere oplossing voor het probleem dat alle deviaties opgeteld op 0 uitkomen (populatievariantie heeft als notatie σ2). Deze gebruikt namelijk het feit dat een negatief getal in het kwadraat positief wordt. We tellen de gekwadrateerde deviaties op, en delen dan door N-1. We gebruiken geen N, omdat N-1 een betere schatting geeft van de populatie variantie. Vaak gebruiken we een subscript om aan te geven voor welke variabele de variantie berekend wordt: s2x. De formule hiervoor is:

    \[\frac{\sum(x-\bar{x})^2}{N-1}\]

    Gebruikmakend van het voorbeeld wordt de formule voor Set 4 (X):

    \[s^2_x=\frac{(1.20-2.64)^2+(1.82-2.64)^2+...+(4.02-2.64)^2}{20-1}=\frac{8.1569}{19}=0.4293\]

    Voor set 32 (Y) geldt:

    \[s^2_y=\frac{(3.13-3.26)^2+(3.17-3.26)^2+...+(3.38-3.26)^2}{20-1}=\frac{0.0903}{19}=0.0048\]

    Uit deze formule komen gekwadrateerde eenheden. Omdat dit niet handig is met vergelijken, is de laatste stap om de wortel uit deze eenheden te nemen. Dit is de standaarddeviatie (s of σ of soms SD). Het is de positieve gekwadrateerde wortel van de variantie. In het voorbeeld wordt een s gevonden van 0.66 voor Set 4, en 0.07 voor Set 32. Dit houdt in dat, gemiddeld genomen, de scores voor Set 4 0.66 eenheden van het gemiddelde afwijken. Voor Set 32 wijken scores slechts 0.07 van het gemiddelde af.

    De standaarddeviatie kan ook worden gebruikt om uit te drukken hoeveel scores niet meer dan één standaarddeviatie van het gemiddelde afwijken. Voor normaalverdelingen geldt over het algemeen dat twee derde van de scores binnen één standaarddeviatie van het gemiddelde af ligt. Ongeveer 95% van de scores vallen binnen twee standaarddeviaties van het gemiddelde.

    Een andere formule voor de variantie is:

    \[\frac{\sum{X^2}-\frac{(\sum{X})^2}{N}}{N-1}\]

    Een andere formule voor de standaarddeviatie is:

    \[s_x=\sqrt{\frac{\sum{X^2}-\frac{(\sum{X})^2}{N}}{N-1}}\]

    Deze formules worden niet veel meer gebruikt, omdat het veel handberekeningen vereist.

    Bij het uitrekenen van variantie en standaarddeviatie moet men erg voorzichtig zijn met extreme waarden, omdat deze metingen daar erg gevoelig voor zijn. Een extreme waarde heeft vanzelfsprekend een hoge deviatie van het gemiddelde. En hoge deviaties van gemiddelden worden disproportioneel gerepresenteerd in de variantie.

    Waarvoor wordt de variatiecoëfficiënt gebruikt?

    Stel dat we twee verschillende testen hebben om het langetermijngeheugen te meten. Een van de testen heeft data met een gemiddelde van 15 en een standaarddeviatie van 3.5. De andere test heeft data met een gemiddelde van 75 en een standaarddeviatie van 10.5. Voor welke test wordt gekozen? Misschien kies je de tweede, omdat die meer variatie in scores heeft en een grotere standaarddeviatie. De standaarddeviatie is echter gebaseerd op afwijkingen van he gemiddelde. Omdat de tweede test een hoger gemiddelde heeft, kunnen waarden hier makkelijker van afwijken. Om de standaarddeviatie te beoordelen, moeten we dus rekening houden met de grootte van het gemiddelde. Om de twee testen te kunnen vergelijken, moeten we dus de gemiddelden meenemen in de berekening. Dit doe je met de variatiecoëfficiënt (CV) = standaarddeviatie/gemiddelde. Vermenigvuldigen met 100 zorgt voor een percentage. De eerste test heeft een variatiecoëfficiënt van 23.3. De tweede test heeft een variatiecoëfficiënt van 14. Op basis van deze informatie zou je de eerste test kiezen.

    Wat is een onpartijdige schatter?

    Hoewel we meestal werken met steekproeven, proberen we altijd iets te zeggen over de populatie waarop de steekproef betrekking heeft. We gebruiken statistieken (data van steekproeven) om een schatting te maken van parameters (karakteristieken van populaties). Statistieken worden uitgedrukt in Romeinse letters en parameters in Griekse letters. Zo is het populatiegemiddelde μ (mu). Hoe goed de schatting van de parameter is, is dus afhankelijk van de statistiekkeuze. Schattingen kunnen partijdig en onpartijdig zijn. We zoeken over het algemeen naar onpartijdige.

    Stel dat we van een populatie het gemiddelde weten. Als we hieruit een steekproef trekken, zal het gemiddelde dichtbij μ liggen. Toch zal het niet precies gelijk zijn aan μ. Wat we kunnen doen, is een oneindig aantal steekproeven trekken. Het gemiddelde van al die steekproeven zal wel gelijk zijn aan μ. In het geval dat de verwachte waarde van een steekproef (dus wanneer we veel steekproeven achter elkaar zouden doen) gelijk is aan μ, noemen we dat een onpartijdige schatter.

    Steekproefgemiddelde en –variantie zijn onpartijdige schatters van hun parameters. Om steekproefvariantie onpartijdig te maken, moeten we echter wel delen door (N – 1) in plaats van door N. Er gaat een vrijheidsgraad verloren, omdat μ voorspelt moet worden uit het steekproefgemiddelde. Dit wordt weergegeven in de noemer van de breuk.

    Wanneer wordt gebruik gemaakt van boxplots?

    Een boxplot is, net als een steel-en-blad weergave, een manier om data op een handige manier uit te beelden. Eerder hebben we gezien dat de mediaan locatie gevonden wordt door (N+1)/2. Om een boxplot te maken, hebben we daarnaast het eerste en derde kwartiel nodig. De makkelijkste manier om die te vinden, is middels de kwartiel locatie.

    • Kwartiel locatie: \[\frac{\text{mediaan locatie}+1}{2}\]

    Net als bij de mediaan locatie vertelt de kwartiel locatie, welke scores de kwartielen zijn. Naast het eerste en derde kwartiel, maakt de boxplot gebruik van de interkwartiel range (de afstand tussen eerste en derde kwartiel), binnen afrastering en aangrenzende waarden. Binnen afrastering is het punt dat 1,5 keer de interkwartielafstand onder of boven het kwartiel valt. Stel dat de interkwartielafstand 2 is, dan is de binnen afrastering 2 x 1.5 = 3 punten verder dan de kwartielen. Aangrenzende waarden zijn de waarden in de data die het dichtst bij de binnen afrastering liggen. Stel dat de binnen afrastering tussen de -1 en 7 ligt. De laagste werkelijke waarde kan 1 zijn en dit wordt dan de lagere aangrenzende waarde genoemd. Als 7 het hoogste getal is in de binnen afrastering, dan noemen we dit de hogere aangrenzende waarde.

    Een handig hulpmiddel bij binnen afrastering en aangrenzende waarden is ze te zien als een weiland met koeien, met een hek eromheen. Het hek is de afrastering. De koeien die het dichtst bij het hek staan, maar nog wel in het veld, zijn de aangrenzende waarden. De koeien daarbuiten tellen we niet mee: dat zijn uitbijters.

    Om een boxplot te tekenen, maken we eerst een schaal die alle scores omvat. Dan tekenen we een rechthoekige box van Q1 naar Q3, met een verticale lijn voor de locatie van de mediaan daarin. Links en rechts van de box komen lijnen (de snorharen) van de kwartielen naar de aangrenzende waarden. De punten die extremer zijn dan de aangrenzende waarden, worden buiten de boxplot aangegeven met een punt.

    Uit de boxplot kunnen we afleiden, dat het centrale deel van de distributie vrij symmetrisch is: de mediaanlijn ligt in het midden van de box. Ook zien we dat de distributie positief scheef is, omdat de snorhaar aan de rechterkant langer is dan die aan de linkerkant. Tenslotte laat de boxplot heel duidelijk zien dat er vier uitbijters zijn. Uitbijters kunnen ontstaan door een fout in de metingen, in het opnemen of verwerken van de data of het kan een waarde zijn die daadwerkelijk zo extreem is. Boxplots zijn vooral handig om de dispersie van de data te onderzoeken. Ze zijn daarom makkelijk te gebruiken bij het vergelijken van groepen. De positie van de boxplot kan vertellen waar de gemiddelde scores van een groep zich centreren.

    Met het statistiekprogramma SPSS zijn metingen van centrale tendens en dispersie ook uit te voeren. Door middel van Analyze/Compare means/Means krijg je beschrijvende statistieken. Door Graphs/Interactive/Boxplot krijg je de boxplot te zien.

    Wat zijn percentielen, kwartielen en decielen?

    Naast kwartielen, kunnen scores ook op andere manieren worden verdeeld. Bij decielen wordt de verdeling in tienden verdeeld, waarbij het eerste deciel de laagste 10% van de scores is, het tweede deciel de laagste 20%, etc. Percentielen worden vaak gebruikt, waarbij waarden in de distributie in honderden worden verdeeld. Het 81e percentiel is het punt in de distributie waaronder 81% van de scores ligt. Al deze verdelingstermen horen onder de algemene statistische tak van de kwantielen, ook wel fractielen.

    Welk effect heeft lineaire transformatie?

    Het transformeren van inches naar centimeters en graden Fahrenheit naar graden Celsius is mogelijk. Deze transformaties vallen onder lineaire transformaties, waarbij X wordt vermenigvuldigd met een bepaalde constante en een constante erbij wordt opgeteld:

    \[X_\text{nieuw}=bX_\text{oud}+a\]

    • a en b zijn hierbij de constanten

    Om het gemiddelde en variantie van de nieuwe schaal te vinden, zijn ook formules gemaakt.

    • Wanneer een constante bij data wordt opgeteld, wordt dezelfde constante ook opgeteld bij het gemiddelde:

    \[X_\text{nieuw}=X_\text{oud}\pm a\] betekent ook:

    \[\bar{X}_\text{nieuw}=\bar{X}_\text{oud}\pm a\]

    • Als de data vermenigvuldigd (of gedeeld) wordt met een constante, wordt het gemiddelde ook met deze constante vermenigvuldigd (of gedeeld):

    \[X_\text{nieuw}=bX_\text{oud}\] betekent ook \[\bar{X}_\text{nieuw}=b\bar{X}_\text{oud}\]

    • Als de data gedeeld wordt met een constante, wordt het gemiddelde ook met deze constante gedeeld:

    \[X_\text{nieuw}=\frac{X_\text{oud}}{b}\] betekent ook \[\bar{X}_\text{nieuw}=\frac{\bar{X}_\text{oud}}{b}\]

    • Wanneer een constante wordt opgeteld of afgetrokken van de data, blijft de variantie en de standaarddevaitie hetzelfde. Dus bij Xnieuw = Xoud ± a is:

    \[s^2_\text{nieuw}=s^2_\text{oud}\]

    • Scores die vermenigvuldigd worden door een constante leiden tot het vermenigvuldigen van de variantie door het kwadraat van de constante en de standaarddeviatie door de constante:

    \[X_\text{nieuw}=bX_\text{oud}\] leidt tot \[s^2_\text{nieuw}=b^2s^2_\text{oud}\] en \[s_\text{nieuw}=bs_\text{oud}\]

    • Scores die gedeeld worden door een constante leiden tot het delen van de variantie door het kwadraat van de constante en de standaarddeviatie door de constante:

    \[X_\text{nieuw}=\frac{X_\text{oud}}{b}\] leidt tot \[s^2_\text{nieuw}=\frac{s^2_\text{oud}}{b}\] en \[s_\text{nieuw}=\frac{s_\text{oud}}{b}\]

    Centreren

    Data wordt steeds vaker gecentreerd. Hierbij wordt het steekproefgemiddelde afgetrokken van alle observaties. Het nieuwe gemiddelde wordt dan 0.00, maar standaarddeviatie en variantie blijven gelijk.

    Reflectie

    Dit wordt vaak gebruikt. Met reflectie wordt de volgorde van een schaal omgedraaid. In veel onderzoeken wordt de helft van de vragen positief en de andere helft negatief gesteld, om te voorkomen dat mensen zonder na te denken steeds hetzelfde cijfer invullen. Om de scores te vergelijken op een vijfpuntsschaal, moeten de negatieve items omgedraaid worden (dus een 5 wordt een 1, een 4 een 2 etc.). Dit heet reflectie en wordt bereikt door een lineaire transformatie. In dit geval wordt gebruik gemaakt van de formule: Xnieuw = 6 - Xoud. Hierdoor wordt het gemiddelde ook veranderd, maar is er geen invloed op de variantie en standaarddeviatie.

    Standaardiseren

    Als bij centreren het gemiddelde van elke observatie wordt afgetrokken resulteert dit in afwijkingsscores (hoe ver ze afwijken van het gemiddelde). Centreren wordt meestal gebruikt bij regressie. Vaak worden na het centreren de afwijkingsscores gedeeld door de standaarddeviatie, waarna de scores standaardscores heten. Dit proces heet standaardisering. Door standaardisering creëer je in feite scores in standaarddeviatie-eenheden. Een gestandaardiseerde score van 0.46 is een score die 0.46 standaarddeviaties boven het gemiddelde zit.

    Wat is het doel van non-lineaire transformaties?

    Lineaire transformaties veranderen data, maar hebben geen invloed op de vorm van een verdeling. Non-lineaire transformaties hebben dit juist tot doel. Ze kunnen een scheve verdeling symmetrischer maken, of het effect van uitschieters verkleinen.

    Access: 
    Public
    Wanneer en hoe wordt de normaalverdeling gebruikt? - Chapter 3

    Wanneer en hoe wordt de normaalverdeling gebruikt? - Chapter 3

    Het concept van de normale verdeling wordt uitgelegd, en we bespreken hoe we de normaliteit van een steekproef kunnen beoordelen. Als er iets bekend is over de verdeling van gebeurtenissen, weet je ook wat over de kansen van deze gebeurtenissen.

    Welke andere verdelingen bestaan er?

    Alle verdelingen van scores proberen op een bepaalde manier de scores weer te geven. Zo geeft het taartdiagram de percentages van elke populatie weer door verschillen in grootte van de taartpunten per populatie. Deze percentages kunnen omgezet worden in kansen, oftewel de kans dat een gebeurtenis voorkomt. Daarnaast kunnen percentages opgeteld worden, zodat verschillende populaties samengenomen worden in de kans op een gebeurtenis. Daarnaast kennen we het staafdiagram, met aparte staven of blokken per frequentie. Deze stelt ons beter in staat om categorieën te vergelijken dan de taartdiagram; kijk simpelweg naar de hoogte van de staaf per categorie, en lijkt visueel meer op de distributies die in de statistiek worden gebruikt. Het verschil met een histogram, is dat de X-as in een staafdiagram ook een nominale schaal kan hebben, en dit is niet mogelijk bij een histogram.

    Waarom is de normaalverdeling belangrijk?

    De normaalverdeling is een van de belangrijkste verdelingen in de statistiek, omdat:

    1. We verwachten dat veel van de afhankelijke variabelen waar we mee werken normaal verdeeld zijn in de populatie.
    2. Als een variabele (ongeveer) normaal verdeeld is, kunnen we vervolgens uitspraken gaan doen over waarden van die variabele (het is vaak een voorwaarde om analyses te doen).
    3. Wanneer een oneindig aantal steekproeven wordt getrokken van een populatie, zal de verdeling van die steekproefgemiddelden neigen naar een normaalverdeling.
    4. De meeste statistische programma’s gaan er vanuit dat de observaties normaal verdeeld zijn.

    In een histogram dat een normaalverdeling toont, is altijd een soort bel-vormige vorm te zien met de meeste scores in het midden (en dus een hoge piek), en richting de zijkanten een heuvel naar beneden. Het is een symmetrische, unimodale verdeling, met oneindige limieten. De horizontale as (abscis) representeert verschillende waarden van variabele X, en de verticale as (ordinaat) is ook wel de dichtheid en heeft te maken met de frequentie van of kans op een bepaalde waarde van X.

    Carl Friedrich Gauss was een onderzoeker die de normaalverdeling tot zijn huidige vorm heeft gebracht, waardoor de verdeling ook vaak de Gaussiaanse verdeling wordt genoemd. De volgende formule geeft de normaalverdeling weer:

    \[f(X)=\frac{1}{\sigma\sqrt{2\pi}}(e)^{-\frac{(X-\mu)^2}{2\sigma^2}}\]

    Deze formule wordt bijna niet gebruikt, omdat de informatie van de verdeling ook in een tabel te vinden is. Door het gebruik van de juiste tabel kunnen er uitspraken over kansen gedaan worden.

    De standaard normaalverdeling

    Een tabel van de normaal distributie is afhankelijk van de waarden van het gemiddelde en de standaarddeviatie. Aangezien je niet voor elke combinatie hiervan een tabel kan opstellen wordt de standaard normaalverdeling gebruikt. De standaard normaalverdeling heeft een gemiddelde van 0 en een standaarddeviatie van 1. De distributie wordt daardoor N(0,1), waarbij N aangeeft dat het een normaalverdeling is, met 0 als waarde voor μ en 1 als waarde voor σ2. Door dit gemiddelde en deze standaarddeviatie, kunnen we deze standaard normaalverdeling in een tabel weergeven en dit toepassen op andere verdelingen.

    Neem bijvoorbeeld een normaalverdeling met een gemiddelde van 50 en een SD van 10. De scores hebben betrekking op een gehele populatie van gedragsprobleemscores uit de YSR (Youth Selfreport Form). We willen weten welke scores horen bij de top 5% of 10% van de populatie. We hebben een tabel die de kansen weergeeft dat een individu een bepaalde score krijgt (die van de standaard normaalverdeling). We moeten dus de voorbeeldverdeling omzetten in een standaard normaalverdeling (en de ruwe scores worden omgezet in standaardscores).

    Om dit te doen, moeten we het gemiddelde (en alle X-waarden) -50 doen, en de standaarddeviatie naar 1 krijgen door te delen door 10. De formule van de getransformeerde distributie genaamd z is:

    \[z=\frac{x-\mu}{sigma} en voor dit specifieke geval dus: \[z=\frac{X-50}{10}

    Alles wat je over standaardscore zi kan zeggen, kan je ook over Xi zeggen. Z is een cruciale kwantiteit, omdat de verdeling niet afhangt van µ en σ2. Deze omzetting in z-scores heeft geen effect op de vorm van de verdeling of de plaats van de observaties. We veranderen puur de eenheid. Door het omzetten in z-scores worden bepaalde dingen veel duidelijker: een score van 60 is nu een score 1. 60 was één standaarddeviatie (10 punten) boven het gemiddelde, en dat is het nog steeds, maar nu heeft het daadwerkelijk een waarde 1. Een score van 45 was 0.5 standaarddeviatie onder het gemiddelde, en is nu een z-score van -0.5. Een z-score geeft dus aan hoeveel standaarddeviaties een X-waarde boven of onder het gemiddelde ligt.

    Let op: Het omzetten in z-scores past niet de vorm van de verdeling aan. Was een distributie niet normaal voordat het getransformeerd werd, dan is hij na transformeren nog steeds niet normaal.

    Tabellen van de standaard normaalverdeling gebruiken.

    Voorbeeld 1

    Stel dat we willen weten hoe groot de kans is om meer dan 1 standaarddeviatie boven het gemiddelde te scoren in gedragsproblemen. Het gebied onder de curve van de standaard normaalverdeling, kan direct vertaald worden naar een kans. Oftewel: als je het gebied onder de curve uitrekent, weet je de kans op die score.

    In dit geval willen we weten hoe groot het gebied onder de curve is vanaf z = 1 (want dat is gelijk aan 1 standaarddeviatie). In Appendix z (Howell, 2013) is te vinden dat het gebied van het gemiddelde tot z = 1 gelijk staat aan 0.3413. Ook geeft de appendix de ‘grotere portie’, dat wil zeggen het gehele gebied onder de curve tot z = 1, en de ‘kleinere portie’ ofwel het gehele gebied onder de curve vanaf z = 1. Deze laatste score willen we in dit geval hebben, en is 0.1587. De kans dat een kind dus meer dan één standaarddeviatie boven het gemiddelde van de populatie scoort, is .1587.

    De Appendix heeft geen waarden staan van negatieve z waarden. Dit komt omdat de verdeling symmetrisch is, en alle z waarden en bijbehorende scores dus ook. Het gebied boven z = 1 is hetzelfde als bij z = -1. De kans is dus ook .1587 dat een kind meer dan één standaarddeviatie onder het gemiddelde scoort.

    Voorbeeld 2

    Stel dat we de kans willen weten dat een score tussen de 30 en de 40 valt. Eerst zet je de scores om in z scores (met de z formule). We willen de kans weten dat een score tussen -1.0 standaarddeviatie en -2.0 standaarddeviatie valt. Uit de Appendix z blijkt dat het gebied van het gemiddelde tot z = -2, 0.4772 is, en van gemiddelde tot z = -1.0 is het 0.3413. Het verschil tussen die gebieden is het gebied dat we zoeken en is dus 0.1359 groot. De kans dat een score tussen de 30 en 40 valt is .1359. Dit lijkt niet belangrijk om te weten, maar als je kind bijvoorbeeld 75 scoort op gedragsproblemen is er reden tot zorgen, aangezien deze score maar in .62% van de kinderen voorkomt.

    Op welke manier worden kanslimieten bepaald?

    In de statistiek zijn we vaak geïnteresseerd in waarschijnlijkheden. Tussen welke waarden zal een score waarschijnlijk vallen? Hiervoor kunnen we limieten stellen: "Als ik een willekeurig kind neem uit deze populatie, dan zal in 95% van de gevallen de score liggen tussen …. en …. " Als we dit in een normale verdeling bekijken, dan zoeken we het gebied waarin 95% van de scores vallen, en dus het gebied daarbuiten: de resterende 5%. Omdat de verdeling symmetrisch is, valt aan beide staarten de buitenste 2.5% af. Hierbij hoort een z- waarde van ± 1.96. 95% van de tijd zal een score tussen de 1.96 standaarddeviatie boven het gemiddelde, en 1.96 standaarddeviatie onder het gemiddelde vallen.

    Deze z score is vervolgens om te zetten in een ruwe score X, door middel van de z formule.

    \[\frac{1}{\sigma\sqrt{2\pi}}(e)^{-\frac{(X-\mu)^2}{2\sigma^2}}\]

    Voor ons voorbeeld worden de limieten: 50 ± (1.96)(10) = 50 ± 19.6 = 30.4 en 69.9. De kans dat de score van het kind tussen 30.4 en 69.6 ligt is dus 95%. Scores boven 69.6 zouden dus weleens een probleem kunnen betekenen. Dit lijkt op het voorspellingsinterval.

    Zijn de data normaal verdeeld?

    De simpelste manier om de verdeling van data te checken, is door een normaalverdeling bovenop een histogram te plakken. Toch kan dit vaak misleidend zijn. Een veel betere aanpak is om Q-Q plots te gebruiken (kwantiel-kwantiel plots).

    Van een perfecte normaalverdeling met gemiddelde = 0 en standaarddeviatie = 1 kunnen we makkelijk cut-off scores berekenen, zoals welke waarde de laagste 1% (of ook wel het eerste percentiel) van de verdeling markeert. Dit kunnen we doen voor elke waarde van 0.00 < p < 1.00 (waarbij p staat voor kans). De resultaten zijn de verwachte kwantielen van een normaalverdeling.

    Ga nu kijken naar de data die je werkelijk hebt verzameld. Wanneer de eigenlijke data ook precies normaalverdeeld is, zullen de verkregen kwantielen precies gelijk zijn aan de verwachte kwantielen. Maar wat als het niet een perfecte normaalverdeling is? Dan moeten we bekijken in hoeverre de waarden afwijken van een normale verdeling. De manier om dit te doen is om verwachte en verkregen kwantielen tegen elkaar te plotten in een figuur (relatief de Y as en de X as). Als de verdeling normaal is, vormt de plot een rechte lijn met een hoek van 45 graden. Als de verdeling niet normaal is, zal er een afwijking in de lijn zijn (een kromming bijvoorbeeld).

    De Kolmogorov-Smirnov test

    Dit is de meest bekende test voor normaliteit, en is beschikbaar bij SPSS onder de non-parametrische testen. De meeste mensen raden het gebruik van deze test echter af, omdat hij soms normaliteit afwijst of juist goedkeurt terwijl het tegenovergestelde het geval is. Bij kleine steekproeven wordt de verdeling al snel als normaal gezien, terwijl ze soms niet-normaal verdeeld zijn. bij erg grote steekproeven wordt juist bij kleine afwijkingen de normaliteitshypothese afgewezen, terwijl deze kleine afwijkingen vaak geen probleem zijn.

    Standaard diagnostische testen kunnen worden omgezet zodat ze een vast gemiddelde en een vaste standaarddeviatie hebben met de volgende formule:

    \[\text{Nieuwe score} = \text{nieuwe standaarddeviatie}\cdot z + \text{nieuw gemiddelde}\]

    Scoringssystemen met een gemiddelde van 50 en een standaarddeviatie van 10 heten T-scores.

    Access: 
    Public
    Hoe werkt het testen van hypothesen? - Chapter 4

    Hoe werkt het testen van hypothesen? - Chapter 4

    In dit hoofdstuk worden de procedures besproken om hypotheses te testen. In een typisch experiment willen we een groep mensen, die een bepaalde behandeling ondergaan, vergelijken met normale of algemene scores van mensen (die geen behandeling of experiment hebben ondergaan). Alleen beschrijvende statistieken zijn dan niet genoeg: die kunnen niet vertellen of het verschil dat we vinden tussen twee groepen door toeval komt of door het effect van de experimentele behandeling.

    Stel je hebt een set scores die normaal verdeeld zijn, met een populatiegemiddelde van 50 en een standaarddeviatie van 10. De scores van de personen zullen verschillen. Bij het trekken van een steekproef uit deze populatie, zal het gemiddelde niet precies 50 zijn. Dit is namelijk afhankelijk van welke personen in de steekproef zitten. Het is een variatie in gemiddelden die we variatie door kans of error variantie noemen. Een synoniem dat hierbij ook gebruikt wordt, is steekproef error: doordat een steekproef een selectie aan scores uit een populatie heeft, zal een steekproefwaarde (zoals het gemiddelde) waarschijnlijk afwijken van die van de populatie. De term ‘error’ betekent hier dus niet ‘fout’, maar puur dat er een afwijking is.

    Voorbeelden

    Het eerste voorbeeld voor het proces van hypothese testen gaat over cursusevaluaties: is er een relatie tussen hoe studenten een vak beoordelen en welk cijfer ze verwachten te krijgen voor dat vak. Misschien zullen studenten die een vak niet denken te halen of nooit naar de colleges kwamen, het vak onterecht een lage beoordeling geven. Stel dat we een steekproef trekken van 50 vakken, waarbij we een trend vinden dat studenten die denken dat ze een hoog cijfer krijgen, een goede beoordeling geven, en studenten die een laag cijfer verwachten, een lage beoordeling geven. Hoe weten we of dit een trend is, die representatief is voor de populatie, of die een toevalstreffer is in deze steekproef?

    Een ander voorbeeld: onderzoekers ontdekten dat als een oude (lage status) auto afsloeg wanneer een stoplicht op groen sprong, 84% van de tijd de auto erachter ging toeteren. Maar, wanneer de auto die afsloeg een dure (hoge status) auto was, toeterden anderen maar 50% van de tijd. Is dit verschil van 84% en 50%:

    • Toeval, het komt door steekproef error (random verschillen tussen steeproeven): we kunnen niet concluderen dat de status van een auto toeter-gedrag beïnvloed.
    • Een groot en betrouwbaar verschil. Het is geen steekproef error, dus mensen toeteren minder snel naar auto’s met een hoge status.

    Om te onderzoeken of iets toeval is of een werkelijk verschil, gebruiken we hypothese testen. Data is vaak ambigue, want hoe weet je nou of het verschil tussen twee groepen komt door de manier waarop de steekproef getrokken is of doordat er daadwerkelijk een verschil is tussen de twee groepen? Wanneer de verschillen tussen gemiddelden zeer klein zijn, zijn deze waarschijnlijk ontstaan door kans. Als een verschil groot is, dan is er waarschijnlijk meer dan alleen kans of toeval in het spel. Maar wanneer is een verschil ‘groot’ of juist ‘klein’? Hiervoor gebruiken we de steekproefverdeling.

    Waartoe dient een steekproefverdeling?

    Stel dat we onderzoeken hoe lang het duurt om een parkeerplek te verlaten, wanneer iemand staat te wachten om jouw plek in te rijden versus wanneer niemand staat te wachten. Uit het onderzoek blijkt, dat mensen er gemiddeld 32.18 seconden over doen als niemand wacht, en 39.06 als wel iemand staat te wachten (mensen lijken dus langer over uitrijden te doen als iemand wacht). Het zou kunnen dat het gevonden verschil niet voorkomt in de gehele populatie, maar resultaat is van de getrokken steekproeven. Dan is het verschil toe te schrijven aan steekproeferror. De andere verklaring is dat het daadwerkelijk langer duurt om uit een parkeerplek te rijden als er iemand staat te wachten. Maar is het verschil in het voorbeeld groot genoeg om niet meer aan toeval toe te kunnen schrijven?

    Een steekproefverdeling geeft aan welke waarden we kunnen verwachten bij een bepaalde statistiek onder vooraf gedefinieerde condities. De standaarddeviatie van deze verdeling, hier genaamd de standaard error van de verdeling, reflecteert de variatie in steekproefgemiddelden bij herhaalde metingen. Met steekproefverdelingen kan bekeken worden hoe groot de kans is dat de vooraf gedefinieerde condities daadwerkelijk bestaan. Het is een verdeling van waarden (de steekproefgemiddelden) voor een bepaalde variabele, bij herhaalde steekproeven (het doorlopen van hetzelfde experiment voor een groot aantal steekproeven).

    Een steekproefverdeling van verschillen tussen gemiddelden geeft de verschillen tussen gemiddelden van oneindige paren van random steekproeven weer. We gaan er even vanuit dat de populatie gemiddelden en standaarddeviatie identiek zijn. We trekken dan een heleboel paren van random steekproeven, waarbij we de gemiddelden met elkaar vergelijken. Deze worden vervolgens in een histogramverdeling weergegeven, waarbij het midden van de verdeling bij 0.0 ligt (omdat we verwachten dat, gemiddeld genomen, verschillen tussen steekproefgemiddelden 0.0 zijn). Omdat we weten welk verschil in steekproefgemiddelden we kunnen verwachten wanneer de populaties in geheel gelijk zijn, kunnen we de vraag omdraaien en kijken welke steekproefwaarde een bewijs is dat de populaties niet aan elkaar gelijk zijn.

    Laten we teruggaan naar het voorbeeld van de parkeertijd. We willen weten of de vertrektijd wanneer iemand staat te wachten verschilt van wanneer niemand staat te wachten. Een manier om dat te doen is door te testen wat de kans is, dat we een verschil in gemiddelden van 6.88 seconden vinden als de gemiddelden van de populaties gelijk zijn. Stel dat we dit uitrekenen en vinden dat de kans op een verschil in gemiddelden van 6.88 slechts 0.0006 is. Dan kunnen we zeggen: Als de steekproeven getrokken zijn uit populaties met gelijke gemiddelden, dan is de kans om een steekproefgemiddelde verschil te vinden van 6.88 slechts .0006. Dit is een zeer kleine kans, dus kunnen we redelijkerwijs concluderen dat de steekproeven van populaties afkomen met verschillende gemiddelden. Mensen doen er dus langer over om te vertrekken als iemand op hun parkeerplek wacht.

    Welke theorie is belangrijk bij hypothesetesten?

    De hypothesetest

    1. Stel een onderzoekshypothese op, bijvoorbeeld mensen doen er langer over om te vertrekken als iemand op hun parkeerplek wacht.
    2. Verzamel steekproeven van beide condities (tijd met wachtende mensen/niet wachtend).
    3. Stel een nulhypothese (H0) op, dat de steekproeven van populaties komen met eenzelfde gemiddelde: vertrektijden hangen niet af van het feit of iemand staat te wachten.
    4. Stel een steekproefverdeling van verschillen tussen gemiddelden op, aangenomen dat H0 waar is.
    5. Bereken de kans van een gemiddelden verschil minstens zo groot als die we hebben gevonden in de steekproef.
    6. Beslis op basis van die kans of we H0 kunnen verwerpen of behouden. Als we H0 verwerpen, houdt dat in dat de populatiegemiddelden niet gelijk zijn.

    De nulhypothese

    De nulhypothese heeft een belangrijke rol in hypothesetesten. Het is soms wat verwarrend omdat we een hypothese opstellen die precies tegengesteld is aan wat we hopen te vinden. De term nulhypothese komt van het feit dat het stelt dat de populatiegemiddelden niet van elkaar verschillen: μ1 – μ2 = 0. We stellen deze hypothese op, omdat we niet kunnen bewijzen dat iets juist is, maar wel dat iets fout is. Daarnaast biedt het een startpunt voor statistische testen. We hebben namelijk vaak geen alternatieve hypothese om mee te starten. Wanneer we de nulhypothese verwerpen, nemen we de alternatieve hypothese aan.

    Statistische conclusies

    Als we geen significant verschil vinden tussen de steekproefgemiddelden, en de H0 niet verwerpen, hebben we meer problemen om dit te interpreteren. Betekent dit dat de nulhypothese waar is, of is hij voorlopig nog niet verworpen? We kunnen in feite nooit de nulhypothese bewijzen: als we 3000 mensen ontmoeten met twee armen, wil dat niet bewijzen dat alle mensen twee armen hebben. Er kan er nog één rondlopen met één arm. Fisher concludeert dus dat wanneer we de nulhypothese niet kunnen verwerpen, we nog niet genoeg data hebben gevonden om de nulhypothese aan te nemen. Fisher zou meer data gaan verzamelen, en concluderen dat het onderzoek heeft ‘gefaald in het verwerpen van de nulhypothese’.

    Neyman en Pearson stellen dat we de nulhypothese simpelweg kunnen accepteren: we zullen hem aannemen als waar, tot het tegendeel wordt bewezen. Hierbij bestaat echter de kans dat we een nulhypothese onterecht accepteren: als waar zien, terwijl hij onwaar is. Om een goede beslissing te nemen moet men rekening houden met de kans dat de nulhypothese ten onrechte geaccepteerd of verworpen wordt.

    Welke test statistieken zijn van toepassing?

    Voorbeelden van steekproefstatistieken zijn de mediaan, de variantie, de range et cetera. Ze beschrijven steekproefeigenschappen. Teststatistieken hebben betrekking op statistische procedures en hebben hun eigen steekproefverdelingen. Dit zijn statistieken zoals t, F en χ2. De t test wordt onder andere gebruikt om te bepalen of twee steekproeven uit populaties met hetzelfde gemiddelde afkomstig zijn. De nulhypothese is daarbij H0 : μ1 = μ2. We zouden de steekproefverdeling van t empirisch kunnen verkrijgen door oneindig steekproeven te trekken van identieke populaties, t berekenen voor elk steekproefpaar en deze waarden in een grafiek zetten. In dit geval is H0 waar, omdat de steekproeven uit identieke populaties getrokken zijn. Vervolgens kunnen we een bepaalde waarde van t van een steekproef vergelijken met de steekproefverdeling. Deze procedure geldt voor alle teststatistieken: alle steekproefverdelingen kunnen op dezelfde wijze gemaakt worden.

    Hoe beslis je over de nulhypothese?

    Terug naar het voorbeeld over de wachttijd bij parkeren. We moeten beslissen of een gebeurtenis met een kans van .0006 reden genoeg is om H0 te verwerpen. In de statistiek is hier een vuistregel voor bedacht, namelijk dat we H0 kunnen verwerpen wanneer de kans kleiner of gelijk is aan .05 (p ≤ .05), of anders wanneer deze kleiner of gelijk is aan .01 (iets conservatiever). Deze kanswaarden noemen we ook wel het significantieniveau of verwerpingsniveau van de test. Elke uitkomst met een kans, onder H0, kleiner dan of gelijk aan het significantieniveau valt in het verwerpingsgebied en dus wordt H0 verworpen. In het voorbeeld is het duidelijk dat .0006 kleiner is dan .05.

    Wat zijn Type I en Type II errors?

    Als we een beslissing nemen in een statistische test, is er altijd een kans dat we de verkeerde kiezen. Als statisticus kunnen we echter vrij goed specificeren wat de kans is dat onze beslissing de verkeerde was. Neem het parkeertijdvoorbeeld. De staat de verdeling van steekproefgemiddelde-verschillen wanneer de nulhypothese waar is, kan weergegeven worden in een normaalverdeling. De werkelijke score die de hoogste 5% markeert (een waarde van X) heet de kritieke waarde. In dit geval is deze waarde 4.94.

    H0 verwerpen we wanneer de uitkomst in de hoogste 5% van de verdeling valt, oftewel wanneer deze in het gemarkeerde gebied komt. Maar, in 5% van de gevallen zal de score in dat gebied vallen terwijl de wachttijd in feite niet verschilt tussen de groepen. We hebben dus 5% kans dat we H0 verwerpen terwijl de nulhypothese eigenlijk waar was. Dit type error heet het Type I error, en is de kans om de nulhypothese te verwerpen terwijl hij eigenlijk waar is. We drukken dit uit in α (alfa). Om de kans op een Type I error te verkleinen, kunnen we het significantieniveau verkleinen naar .01. Hiermee vergroten we echter de kans op een Type II error: het aanhouden van H0, terwijl deze onjuist is. De kans hierop is uitgedrukt in β (bèta). Het lastige is dat we niet weten hoe de verdeling eruit ziet als H0 onjuist en de alternatieve hypothese juist is.

    De juiste beslissing over hoe groot het significantieniveau moet zijn, hangt af van wat je onderzoekt. Als het belangrijk is om Type I errors te voorkomen (een nieuwe therapie gaan gebruiken terwijl hij eigenlijk niet werkt), dan gebruik je een strenge (kleine) α. Wil je Type II errors voorkomen, dan moet de α groter zijn. In de meeste gevallen zullen we de precieze waarde van β niet weten, omdat we niet weten hoe de werkelijke distributie van een bepaalde populatie is.

    In Tabel 3 staan de error types nog een keer opgesomd. De power van een test is de kans op het verwerpen van H0 wanneer die ook daadwerkelijk vals is. Omdat β de kans is op het onjuist aanhouden van H0, staat de power gelijk aan 1 – β.

    Tabel 3

     

     

     

    Werkelijke situatie

    Beslissing

    H0 is juist

    H0 is onjuist

    H0 verwerpen

    Type I error p = α

    Juiste beslissing p = 1 – β = power

    H0 niet verwerpen

    Juiste beslissing p = 1 - α

    Type II error p = β

        

    Wat is het verschil tussen één- en tweezijdig testen?

    In het parkeertijdvoorbeeld waren we alleen geïnteresseerd in de gebeurtenis waarbij mensen langer deden over uitrijden wanneer iemand stond te wachten. H0 werd alleen in die situatie verworpen. Stel dat iemand echter 15 seconden sneller uitreed wanneer iemand stond te wachten, dan hadden we H0 niet verworpen ondanks dit enorme verschil. Dit is een eenzijdige of directionele test. Om deze situaties te voorkomen, moeten we specificeren dat we de nulhypothese verwerpen bij een extreem hoge én extreem lage uitkomst. Als we de bovenste 5% en onderste 5% verwerpen, zouden we H0 in totaal 10% van de tijd (α = .10) verwerpen. We moeten dus de laagste en hoogste 2,5% verwerpen. Dit heet tweezijdig of niet-directioneel testen. Het kan hierdoor wel gebeuren dat een score die met een eenzijdige test wel in het verwerpingsgebied viel, nu niet in het verwerpingsgebied valt, omdat het maar 2,5% is i.p.v. 5%.

    Tweezijdige testen komen veel vaker voor. Ten eerste omdat we vaak niet weten in welke richting een mogelijk verschil zal voorkomen. Daarnaast is het een voorzorgsmaatregel: ook in het geval waarbij we een verschil een bepaalde kant op verwachten, kun je je hiermee indekken. Ook is het soms lastig om een eenzijdige test te definiëren. De uiteindelijke keus voor eenzijdig of tweezijdig testen is afhankelijk van de ernst van errors.

    Wat betekent het als je de nulhypothese verwerpt?

    Bij het verwerpen van de nulhypothese is het belangrijk om goed te weten wat dit precies inhoudt. Wanneer we bijvoorbeeld een hypothese verwerpen bij p = .045, betekent dit niet dat de kans dat H0 juist is, .045 is. Wat we aantonen is dat als de nulhypothese juist zou zijn, de kans om een verschil te vinden zoals we hebben gevonden slechts .045 is. Het is een conditionele kans: de kans op de data gegeven dat H0 waar is - p(D|H0).

    Is er een alternatieve manier van hypothese testen?

    Volgens Jones en Tukey en Harris zijn er drie mogelijke hypothesen: µ1 < µ2, µ1 > µ2 of µ1 =µ2. De derde is de traditionele nulhypothese. Deze nulhypothese kan echter niet juist zijn als er gebruik gemaakt wordt van twee populaties, die op het onderwerp van onderzoek compleet van elkaar verschillen. De nulhypothese is nooit helemaal waar, maar de data laat ons soms niet de mogelijkheid te achterhalen welk gemiddelde groter is. Jones en Tukey stellen voor dat we niet van tevoren een richting bepalen, maar bepalen of het resultaat extreem is aan beide zijden. Wanneer extreem in lage staart: µ1 < µ2, wanneer extreem in hoge staart: µ1 > µ2. Als beide niet kloppen, dan is er onvoldoende data om een keus te maken. Jones en Tukey stellen de kans dat de nulhypothese juist is op .00. Er is hoe dan ook een verschil. De enige fout die gemaakt kan worden is dat de verkeerde richting geconcludeerd wordt. De kans hierop is .025 procent.

    De effectgrootte is de grootte van het effect van een bepaalde meting. Hier wordt veel gebruik van gemaakt. Het begrip ‘significant verschil’ wordt gebruikt om aan te tonen dat het statistisch significant is, niet dat het een belangrijk verschil is. Het verschil is niet ontstaan door kans.

    Een voorbeeld

    In dit voorbeeld werken we het hypothesetesten uit voor een onderzoek naar vingertik snelheid. Uit onderzoek blijkt dat mensen met bepaalde beperkingen minder snel hun vingers kunnen bewegen. We weten van de normale populatie vrouwen dat het gemiddelde 47.8 is met een standaarddeviatie van 5.3. Stel dat we een patiënt hebben met een snelheid van 35. Is dit laag genoeg om een indicatie te zijn voor een beperking?

    We stellen een nulhypothese op dat de patiënt niet beperkt is (oftewel dat ze uit een populatie komt met een gemiddelde van 47.8): H0 : μ = 47.8. De alternatieve hypothese is in dit geval dat ze beperkt is, dus dat haar gemiddelde niet gelijk is aan 47.8 (in dit geval is het een eenzijdige test want we zijn alleen geïnteresseerd in een score onder het normale gemiddelde): H1 : μ < 47.8. We kiezen α = .05 als significantieniveau en niet .01, omdat type II fouten erger bevonden worden. Dit zou namelijk betekenen dat we de patiënt niet als beperkt identificeren, terwijl ze dat wel is.

    Nu rekenen we de kans uit dat een niet-beperkt persoon een score van 35 behaald. Hiervoor bereken je eerst de z score die bij deze ruwe score hoort.

    \[z=\frac{X-\mu}{\sigma}=\frac{35-47.8}{5.3}=-2.42\]

    De score van de patiënt is 2.42 standaarddeviaties onder het gemiddelde. In de Appendix vinden we dat de kans om een z waarde gelijk aan of onder -2.42 te krijgen slechts .0078 is. Deze kans is minder dan de 5% significantieniveau en we verwerpen de nulhypothese. De patiënt is waarschijnlijk beperkt.

    Access: 
    Public
    Welke basisconcepten van kansberekening zijn belangrijk? - Chapter 5

    Welke basisconcepten van kansberekening zijn belangrijk? - Chapter 5

    In hoofdstuk 3 is al een begin gemaakt met kansberekening, bijvoorbeeld wanneer je ziet dat 19% van de kinderen tussen de 52 en 56 scoort: je kunt concluderen dat de kans dat een random kind tussen deze scores valt .19 is.

    Welke visies op kansberekening zijn er?

    Bij voorbeelden over kansberekening wordt vaak gebruikt gemaakt van smarties (zoals M&M’s). Stel dat we weten welk percentage van elke kleur in een zak zit (bruin = 13%, rood = 23%, geel = 30%, groen = 34%). De kans om een gele smartie te pakken is .30. Dit voorbeeld toont één definitie van kansberekening:

    Als iets op A manieren kan gebeuren en op B manieren niet kan gebeuren, en als de kans op elke mogelijke manier even groot is (elke smartie in de zak heeft evenveel kans om gepakt te worden) dan is de kans op een gebeurtenis A/(A+B) en de kans dat het niet gebeurt B/(A+B). De kans op een gele smartie is .30, en er zitten 100 smarties in de zak. Het kan dus 30 keer voorkomen dat een gele smartie wordt gepakt, en 70 keer dat een andere wordt gepakt. De kans op A is: p(A) = 30/(30+70) = .30.

    Deze visie op kansberekening is de analytische visie.

    Een andere visie is de frequentische visie: wanneer we telkens een smartie uit de zak graaien en telkens het totaal weer aanvullen tot 100, dan zullen we ontdekken dat ongeveer 30% van de keren er een gele smartie gepakt wordt. Hoe groter het aantal ‘steekproeven’, hoe dichter deze frequentie bij de werkelijke waarde (namelijk 30%) zal komen.

    Een derde visie is de subjectieve kansberekening: kansberekening op basis van onze subjectieve overtuiging van kans. Bayes stelling is hier essentieel voor. Elke aanpak leidt tot hetzelfde resultaat.

    Terminologie

    In de kansberekening spreekt men vaak over een gebeurtenis: een stukje data in feite. Een gebeurtenis kan verwijzen naar van alles: het trekken van een koning uit een stapel kaarten, een bepaalde score op een vragenlijst, of als we smarties uit een zak pakken, zijn de gebeurtenissen de 6 verschillende mogelijke kleuren.

    Twee gebeurtenissen zijn onafhankelijk van elkaar, wanneer het voorkomen (of niet voorkomen) van de één geen effect heeft op het wel of niet voorkomen van de ander.

    Wanneer een gebeurtenis de ander uitsluit, zijn deze twee gebeurtenissen wederzijds exclusief. Je kunt bijvoorbeeld niet in het eerste jaar én het tweede jaar zitten. Een set gebeurtenissen is allesomvattend of grondig wanneer het alle mogelijke uitkomsten bevat. De gebeurtenissen ‘eerstejaars, tweedejaars of derdejaars’ zijn allesomvattend voor bachelor studenten waarbij de bachelor drie jaar heeft.

    Kansen vallen tussen de 0.00 en 1.00. De kans 1.00 geeft aan dat de gebeurtenis hoe dank ook plaatsvindt en bij 0.00 vindt de gebeurtenis sowieso niet plaats.

    Welke regels zijn van toepassing bij kansberekening?

    Twee sets regels zijn het belangrijkst in de kansberekening: de additieve en vermenigvuldigingsregels.

    1. De additieve regel.

    We weten hoe we de kans kunnen berekenen om een gele smartie uit de zak te halen, of juist een groene. Maar wat als ik wil weten wat de kans is op een gele of groene, in plaats van een andere kleur in de mix?

    Gegeven een set wederzijds exclusieve gebeurtenissen, is de kans op het voorkomen van een of andere gebeurtenis gelijk aan de som van afzonderlijke kansen.

    Dus: p(groen of geel) = p(groen) + p(geel). Met de exclusiviteit wordt bedoeld dat als een getrokken smartie groen is, hij niet geel kan zijn.

    2. De vermenigvuldigingsregel.

    Stel dat ik twee smarties pak, en de eerste vervang voordat ik de tweede pak. Wat is de kans dat ik bij de eerste keer pakken een gele pak, en bij de tweede keer weer?

    De kans op het gezamenlijk voorkomen van twee of meer onafhankelijke gebeurtenissen is gelijk aan het product van hun individuele kansen.

    Dus in dit geval: p(geel, geel) = p(geel) x p(geel). Daarbij is het weer belangrijk dat de twee gebeurtenissen onafhankelijk zijn. Zo kan je ook zeggen: p(vrouw, geboren in januari) = .50 x 1/12 = .042 (geslacht en geboortemaand zijn niet afhankelijk van elkaar).

    Deze regels zijn te combineren. Wat is bijvoorbeeld de kans dat ik een groende en gele smartie pak, ongeacht de volgorde waarin ik ze pak? P(groen, geel) = .34 x .30 en de kans op p(geel, groen) = .30 x .34. De totale kans is deze twee opgeteld.

    Steekproef met vervanging

    In het smarties voorbeeld werden steekproeven getrokken, waarbij telkens de gepakte smartie werd vervangen. Door dit vervangen blijft de kans op een bepaald kleur smartie gelijk. Als we smarties niet vervangen, dan hangt de kans op een gele smartie in Steekproef 2 af, van welke smartie in Steekproef 1 werd gepakt.

    Wat zijn gezamenlijke en conditionele kansen?

    Een gezamenlijke kans is simpelweg de kans op het samengaan van twee of meer gebeurtenissen. Bijvoorbeeld de kans dat een verdachte zowel blank is, en de doodstraf krijgt (in een studie, die blanken en niet-blanken hierin vergelijkt). Gezamenlijke kans is genoteerd als p(A, B). Als de twee gebeurtenissen onafhankelijk zijn, kunnen we de kans makkelijk berekenen met een vermenigvuldiging. Zo niet, dan is er een andere berekening nodig (die komt later).

    Een conditionele kans is de kans dat een gebeurtenis voorkomt, gegeven dat een andere gebeurtenis is voorgekomen. Dit is bijvoorbeeld de kans dat een persoon aids oploopt, gegeven het feit dat hij of zij via injecties drugs heeft gespoten. Deze kansen zijn vaak genoteerd als ‘als … zo is, dan …’ De conditionele kans wordt genoteerd als p(A | B), zoals p(aids ∣ drugsgebruik).

    Voorbeeld

    Stel dat een radiostation 100 mensen interviewt over het gebruik van gordels en daarbij ook vraagt of ze kinderen hebben. In Tabel 4 staan de uitkomsten weergegeven.

    Tabel 4

     

     

     

    Kinderen

    Wel gordel dragen

    Niet gordel dragen

    Totaal

    Wel kinderen

    15

    5

    20

    Geen kinderen

    15

    65

    80

    Totaal

    30

    70

    100

    De simpele kans dat iemand uit de steekproef een gordel draagt is 30/100 = .30. De gezamenlijke kans dat iemand kinderen heeft en een gordel draagt is 15/100 = .15 (let op: hier is de kans niet te berekenen door vermenigvuldigen van kansen, want uit het onderzoek blijkt dat ouderschap en gordel dragen niet onafhankelijk zijn van elkaar). De conditionele kans dat iemand een gordel draagt, gegeven dat hij kinderen heeft, is 15/20 =.75.

    Wat is het verschil tussen discrete en continue variabelen?

    Een discrete variabele kan een beperkt aantal waarden aannemen, terwijl een continue variabele in principe een oneindig aantal verschillende waarden heeft. Een discrete variabele neemt een waarde aan van het kleine aantal mogelijke waarde. Als een variabele vele mogelijke waarden heeft die tenminste van ordinale schaal zijn, wordt deze variabele als continue variabele behandeld. De distributies van de twee soorten variabelen verschillen ietwat als het op kansberekening aankomt. Met discrete variabelen kan je spreken van de kans op een specifieke uitkomst, bij continue variabelen spreek je van de kans op een uitkomst binnen een interval.

    Discreet

    Wanneer we een discrete variabele uitzetten in een grafiek, krijg je een histogram met voor elke waarde van de variabele (X-as) een bepaalde frequentie (Y-as). Een voorbeeld is een onderzoek naar levensgeluk, waarbij mensen op een 5-punt schaal aan kunnen geven hoe gelukkig ze zijn (1=helemaal niet, tot 5=helemaal wel). De relatieve frequentie per antwoordcategorie (ook wel de proportie) kan direct omgezet worden in een kans. Dus, wanneer 38 mensen van een steekproef van 100 aangeven dat ze ‘erg gelukkig zijn, is de kans dat iemand ‘erg’ antwoordt .38.

    Continue

    Bij een continue variabele ziet de grafiek er heel anders uit. Er zijn geen aparte frequenties aan te geven in staven, maar de grafiek is een grillige, aaneengesloten lijn. Hoe normaler de verdeling, hoe meer deze lijn op een belvorm zal lijken. De Y-as wordt hierbij als dichtheid gelabeld. Je kan dit het beste zien als de hoogte van de curve bij verschillende X-waarden. Dichtheid kan niet direct omgezet worden in een kans. Een voorbeeld is de verdeling van ‘leeftijd moeder bij eerste geboorte’. Het heeft hierbij geen zin om uitspraken te doen over specifieke uitkomsten, want er zullen bijvoorbeeld maar weinig mensen zijn die precies op hun 20e jaar de bevalling van hun eerste kind hebben. het is logischer om van intervallen te spreken, namelijk ongeveer 20 jaar. In dat geval kunnen we een staaf maken in de grafiek van de ondergrens naar de bovengrens van het interval, en dan geldt dat: de oppervlakte van de staaf, gedeeld door de oppervlakte onder de gehele distributielijn, gelijk is aan de kans op een score in dat interval.

    Wat zijn permutaties en combinaties?

    Permutaties en combinaties zijn concepten die vallen binnen de combinatoriek: de afdeling binnen de wiskunde die zich bezighoudt met het bepalen op hoeveel manieren objecten samengevoegd kunnen worden (op hoeveel manieren kan ik twee winnaars uit vijf kandidaten kiezen).

    Permutaties

    Stel dat we een loterij hebben met vier mogelijke prijzen (300, 200, 100 en 0 euro), en vier mensen doen mee (A, B, C en D). Hun namen gaan in een hoed en de eerste naam die eruit komt, wint de eerste prijs, et cetera. Van elke mogelijke volgorde waarin de namen uit de hoed komen, is een rijtje te maken: ABCD, ABDC, ACBD etc. Elke volgorde is een unieke code of permutatie van de vier namen. De formule is:

    \[P^r_n=\frac{N!}{(N-r)!}

    • Waarbij er N objecten zijn die in r keer gepakt worden.
    • Het symbool N! wordt gelezen als N factoriaal en is het product van alle mogelijkheden van N tot 1. 0! is altijd 1.

    Voor ons voorbeeld geldt:

    \[P^4_4=\frac{4!}{(4-4)!}=\frac{4!}{0!}=\frac{(4\times3\times2\times1)}{1}=24\]

    Dit geeft aan dat er 24 permutaties gemaakt kunnen worden.

    In het geval dat we alleen de eerste twee lootjes een prijs geven, is de formule simpelweg:

    \[P^4_2=\frac{4!}{(4-2)!}=\frac{(4\times3\times2\times1)}{2}=12\]

    • Twaalf permutaties zijn mogelijk.

    Combinaties

    Combinaties verschillen van permutaties, in dat we nu niet meer kijken naar de volgorde waarin we objecten selecteren. Dus in het geval van de loterij trekken we twee namen uit de hoed, maar beiden krijgen dezelfde prijs. Het resultaat AB is dan hetzelfde als BA; we zijn alleen geïnteresseerd in combinaties. De formule hiervoor is:

    \[C^n_t=\frac{N!}{r!(N-r)!}

    In het voorbeeld: 

    \[C^4_2=\frac{4!}{2!(4-2)!}=\frac{(4\times3\times2\times1)}{(2\times1\times2\times1)}=6\]

    In andere woorden: met vier deelnemers kunnen we zes verschillende sets winnaars kiezen.

    Wat is de stelling van Bayes?

    De stelling van Bayes heeft betrekking op kansberekening. Het vertelt ons hoe we kansberekeningen kunnen aanpassen als we telkens meer informatie hierover krijgen. Stel dat je moet aangeven hoe groot je de kans schat dat Frank is vermoord door Piet (je weet alleen dat jij Piet niet aardig vindt). Je schat de kans op p = .10. Dan krijg je te horen dat Piet rond het tijdstip van de moord in de buurt van Franks huis is gezien. Je vergroot de kans tot p = .30 (et cetera). Bij Bayes’ stelling zijn kansen meestal subjectieve kansen.

    Een voorbeeld

    Een fietser heeft een steroïde test ondergaan en is positief bevonden. Hij beweert onschuldig te zijn. Wat is de kans dat hij schuldig of juist onschuldig is? We beginnen met de voorafgaande kans: namelijk de kans dat de fietser een drugsgebruiker is, voordat we verdere informatie verzamelen (uit statistieken blijkt, dat 15% van de fietsers steroïden gebruikt). Wat we willen weten, is de latere (posterior) kans, namelijk de kans nadat we aanvullende data hebben gekregen. We hebben aanvullende data (Tabel 5): 96% van de steroïde gebruikers test positief op de steroïde test. 8% van de niet-gebruikers test ook positief.

    Tabel 5

     

     

    Kansen

    p

    Informatiebron

    p(fietser is gebruiker) p(G)

    .15

    Bekend uit statistieken

    p(fietser is niet-gebruiker) p(NG)

    .85

    “

    p(fietser is gebruiker en positief getest) p(P | G)

    .96

    Van steroïde test bedrijf

    p(fietser is niet-gebruiker en positief getest) p(P | NG)

    .08

    “

    p(fietser is positief getest en blijkt gebruiker te zijn) p(G | P)

    ?

    Ons doel

    Met Bayes’ stelling kunnen we de kans berekenen dat de geteste fietser steroïden heeft gebruikt. G staat voor gebruiker, NG voor niet-gebruiker en P voor positieve test.

    \[p(G|P)=\frac{p(P|G)\cdotp(G)}{p(P|G)\cdotp(G)+p(P|NG)\cdotp(NG)}=\frac{(.96)\cdot(.15)}{(.96)\cdot(.15)+(.08)\cdot(.85)}=\frac{.144}{.144+.068}\approx{.68}\]

    Vóór de drugstest bekend was, zouden we de subjectieve kans op zijn schuld schatten op .15 (op basis van eerdere statistieken). Nu is de kans veel groter.

    De algemene formule is:

    \[\frac{p(D|H)\cdotp(H)}{p(D|H)\cdotp(H)+p(D|\bar{H})\cdotp(\bar{H})}\]

    • Hierbij staat H voor hypothese, D voor data en H voor ‘niet H’.

    Binomiale distributie

    Een van de bekendste kansverdelingen is de binomiale verdeling. Deze verdeling wordt gebruikt wanneer elke kanstrekking resulteert in een of twee wederzijds exclusieve uitkomsten. Deze kanstrekkingen worden ook wel Bernoulli trials genoemd (zoals het opgooien van een muntje). De binomiale verdeling is een voorbeeld van een discrete verdeling, omdat we bij het opgooien van muntjes 3 of 5 keer kop kunnen gooien, maar niet 3.45 keer kop. De formule hiervoor is:

    \[\frac{N!}{X!(N-X)!}\]

    met:

    • p(X) = de kans op X successen
    • N = het aantal trials
    • p = de kans op een succes op één trial
    • q = (1- p) de kans op falen
    • CNX = het aantal combinaties van N dingen die X per keer gepakt worden

    Het eerste deel van de formule - N!/(X!(N-X)!) - geeft het aantal verschillende volgordes voor bijvoorbeeld drie successen en vier keer falen.

    Een binomiale verdeling is ook uit te zetten in een figuur. Hiervoor berekenen we eerst voor elke mogelijke uitkomst een kans. Bijvoorbeeld: wanneer we tien keer een munt opgooien, hoe vaak komt er kop boven. Dit kan tussen de 0 en 10 keer zijn, waarbij de kans naarmate kop vaker boven komt, kleiner wordt. Wanneer we elke kans weten, zetten we het aantal keer kop uit op de X-as, en de kans daarop op de Y-as. De Y-as toont dus geen frequentie, maar een kans. Dat komt doordat het discrete uitkomsten zijn en geen continue. Deze verdeling is wiskundig bereikt, met statistieken op de x-as (aantal successen) in plaats van individuele observaties of gebeurtenissen.

    Gemiddelde en variantie

    Wanneer p = q = .50, zoals bij het opgooien van een munt, zal de binomiale verdeling symmetrisch zijn. De formules voor gemiddelde, variantie en standaarddeviatie zijn altijd:

    • Gemiddelde = Np
    • Variantie = Npq
    • Standaarddeviatie = √Npq

    Voor de binomiale verdeling geldt dat de verdeling normaler wordt bij getallen van p en q, die dichtbij .50 liggen. Daarnaast wordt de distributie symmetrischer en meer normaal, bij een hoger aantal trials. We gebruiken de vuistregel dat wanneer Np en Nq niet groter zijn dan 5, de distributie bijna normaal is, waardoor de schattingen redelijk goed zijn als we de verdeling als normaal behandelen.

    Hoe gebruik je de binomiale verdeling bij hypothese testen?

    In veel gevallen waarin we de binomiale verdeling zouden kunnen gebruiken, is de chi-kwadraat test even bruikbaar (uitgelegd in het volgende hoofdstuk). Hier worden alleen situaties genoemd waarin de binomiale verdeling beter is.

    Stel dat we een experiment opzetten, waarbij iemand heel kort (2ms) een letter of een cijfer te zien krijgt op een scherm, en dan moet raden wat zij zag. Hiervoor hebben we gezien hoe we uitrekenen wat de verdeling van mogelijke uitkomsten is. Stel dat we daar vonden dat een proefpersoon van de acht keer tonen, zeven keer juist raadde. Betekent deze data dat zij beter kan raden dan op puur kansniveau?

    De onderzoekshypothese H1 is dat ze het beter doet dan op kansniveau (p > .50). De nulhypothese is dat haar gedrag niet beter is dan kansniveau (H0 : p = .50). De binomiale verdeling maken we op basis van de nulhypothese, dus met p = .50, en dan rekenen we uit wat de kans is dat de proefpersoon op basis van deze verdeling zeven of acht keer goed zou raden (want onze H1 was dat p > .50).

    Voor de kans op zeven correcte trials uit acht trials totaal geldt:

    \[p(7)=C^8_7p^7q^1=(\frac{8!}{7!1!})(.5)^7(.5)^1=8(0078)(.5)=8(.0039)=.0312\]

    Tel deze op bij de kans op acht correcte trials (gelijk aan .0039) en we vinden dat de kans op ten minste 7 correcte trials slechts .035 is. We verwerpen H0 wanneer α kleiner of gelijk is aan .05. We kunnen H0 verwerpen: onze proefpersoon doet het beter dan we zouden verwachten puur op kansniveau.

    Wat is een multinomiale verdeling?

    De multinomiale verdeling is een speciale vorm van binomiale verdeling, waarbij er meer dan twee mogelijke uitkomsten zijn (bijvoorbeeld bij het rollen van een dobbelsteen). Als we de kans van een aantal uitkomsten X willen berekenen bij k gebeurtenissen, dan is die kans gelijk aan:

    \[p(X_1,X_2,...,X_k)=\frac{N!}{X_1!X_2!...X_k!}p_1^{X1}p_2^{X2}...p_k^{Xk}\]

    Stel dat we een dobbelsteen hebben met twee rode kanten, drie zwarte en één witte kant. We weten de kans om een bepaalde kleur boven te krijgen: rood 2/6 = .333, zwart 3/6 = .500 en wit 1/6 = .167. Als we tien keer gooien, wat is dan de kans op vier zwarte, drie rode en drie witte?

    \[p(4,3,3)=\frac{10!}{4!3!3!}(.500)^4(.333)^3(.167)^3=4200\times.0625\times.0369\times.0047=.0455\]

    Access: 
    Public
    Wanneer en hoe wordt de chi-kwadraat test gebruikt? - Chapter 6

    Wanneer en hoe wordt de chi-kwadraat test gebruikt? - Chapter 6

    Wanneer we te maken krijgen met categorische data, bestaat deze data uit frequenties van observaties die in twee of meer categorieën vallen. In het vorige hoofdstuk keken we naar gebeurtenissen die slechts twee mogelijke uitkomsten hadden. In dit hoofdstuk kijken we naar gebeurtenissen die twee of meer uitkomsten kunnen hebben. Daarnaast komen situaties aan bod die twee onafhankelijke variabelen hebben, en waarbij we willen onderzoeken of ze echt onafhankelijk zijn. Voor beide situaties is de juiste test de chi-kwadraat test.

    Hoe verschilt de chi-kwadraat verdeling van andere verdelingen?

    De formule voor de chi-kwadraat functie wijkt af van andere functies, omdat het slechts één parameter heeft. De rest zijn constanten. De normaal verdeling heeft er twee parameters (μ en σ), de chi-kwadraat heeft alleen k als parameter. In de statistische wereld staat k voor het aantal vrijheidsgraden (degrees of freedom df). Vrijheidsgraden worden vaak weergegeven als χ²3 of χ²(3).  Hoe groter k wordt, hoe symmetrischer de verdeling. Het gemiddelde en de variantie nemen toe als k toeneemt. Verder geldt:

    • Gemiddelde = k
    • Variantie = 2k

    Hoe is de chi-kwadraat test opgebouwd?

    Deze test is gebaseerd op de chi-kwadraat verdeling. We beginnen met een voorbeeld met twee categorieën. Therapeutische tast is een behandelmethode waarbij menselijke energie wordt gebruikt om iemand te helen. Als experiment werden deze therapeuten geblinddoekt en de onderzoeker hield haar hand boven één van hun handen, en de therapeuten moesten aangeven boven welke hand haar hand hing. Van de 280 trials waren de therapeuten in 123 gevallen correct: een percentage van 44%. Op basis van kans zouden de therapeuten het vaker juist moeten hebben (140 trials - 50%). Wat we willen weten is of dit verschil met hetgeen wat we zouden verwachten significant is (oftewel, of we kunnen concluderen dat op de trials niet willekeurig gekozen werd). Hiervoor is een goodness-of-fit test nodig.

    De chi-kwadraat formule maakt gebruik van de geobserveerde frequenties en de verwachte frequenties. De geobserveerde frequenties zijn de werkelijke frequenties in de data. De verwachtte frequenties zijn de frequenties, die je zou verwachten wanneer de nulhypothese waar is. We verwachten, wanneer de antwoorden berust zijn op kans, 123 correcte keuzes. De geobserveerde frequentie aan juiste antwoorden noemen we O, de verwachte frequentie noemen we E (expected). De formule voor de chi-kwadraat is:

    \[X^2=\sum\frac{(O-E)^2}{E}\]

    • Waarbij je voor elke categorie de berekening uitvoert, en optelt. De χ² statistiek voor het voorbeeld is (123-140)2/140 = 4.129.

    Hoe ziet de tabel van chi-kwadraat verdeling eruit?

    Nu we een waarde hebben voor χ² moeten we deze vergelijken met de χ² verdeling om de kans te bepalen dat een waarde van χ² minstens zo extreem voorkomt, gegeven dat de nulhypothese waar is. Hiervoor kun je de standaard tabelverdeling van χ² gebruiken. De tabel maakt gebruik van vrijheidsgraden. Voor een eendimensionale tabel geldt: df = (k -1), het aantal categorieën min één. In het voorbeeld hebben we dus 1 df. In de tabel staat dat een χ² van 3.84 de bovenste 5% van de verdeling markeert. Onze χ² is groter dan 3.84, namelijk 4.129, dus kunnen we de nulhypothese verwerpen: participanten waren minder accuraat dan pure kans zou voorspellen.

    Een probleem is dat de chi-kwadraat verdeling continue is, terwijl de mogelijke waarden van chi-kwadraat discreet zijn (vooral bij kleine steekproefgroottes). Het passen van een discrete verdeling in een continue verdeling is een slechte fit.

    Een voorbeeld met meer dan twee categorieën

    Hiervoor kijken we naar het spel steen-papier-schaar (SPS). Stel dat we 75 kinderen observeren die SPS spelen en de frequentie van elk symbool tellen per trial (zie Tabel 6).

    Tabel 6

     

     

     

    Symbool

    Steen

    Papier

    Schaar

    Geobserveerd

    29

    22

    24

    Verwacht

    25

    25

    25

    Hieruit blijkt dat kinderen vaker voor steen kiezen. Dit kan puur toeval zijn. We kunnen berekenen of de afwijking van het verwachtte groot genoeg is om te zeggen dat kinderen echt vaker steen kiezen.

    Voor de berekening van χ² kan de formule weer gebruikt worden, alleen zijn er nu drie categorieën, dus hebben we 2 df.

    \[\frac{(29-25)^2}{25}+\frac{(22-25)^2}{25}+\frac{(24-25)^2}{25}=1.04\]

    De kritieke waarde van χ² bij 2 df blijkt 5.99 te zijn. Een stuk hoger dan 1,04 dus. Dit geeft aan dat de kinderen puur bij toeval elk symbool kozen.

    Twee classificatie variabelen

    In de vorige voorbeelden spraken we over één dimensie (of classificatie variabele). Vaak zijn er echter meerdere classificatie variabelen en willen we weten of die onafhankelijk van elkaar zijn. Wanneer ze niet onafhankelijk zijn, zijn ze in minder of meerdere mate contingent op of afhankelijk van elkaar. In een contingentie tabel kunnen we de verdelingen van elke variabele tegen elkaar afzetten.

    In een contingentie tabel staan de frequenties die we zouden verwachten als de twee variabelen onafhankelijk waren (tussen haakjes). De verwachtte frequentie wordt bereikt door het vermenigvuldigen van de totalen van de rij en kolom waar het om gaat (dit zijn marginale totalen) en dit getal te delen door de totale steekproefgrootte. Dit is weer te geven in een formule: Eij = RiCj / N. Eij is hierbij de verwachtte frequentie voor de cel in rij i en kolom j. Ri en Cj zijn de rij en kolom totalen.

    Zie tabel 7 voor een voorbeeld.

    Tabel 7

     

    Doodstraf of niet

     

    Ras v/d verdachte

    Wel

    Niet

    Totaal

    Niet-blank

    22 (15.11)

    250 (257.60)

    272

    Blank

    22 (29)

    500 (494.32)

    522

    Totaal

    44

    750

    792

    Bijvoorbeeld: het verwachte aantal niet-blanken die de doodstraf krijgen is:

    \[E(\text{expected})=\frac{44\times272}{792}=15.11\]

    De kans dat een observatie in rij 1 valt is het totaal van die rij gedeeld door het totaal aantal cellen. Dit geldt ook voor kolommen. De verwachtte frequentie, als de observaties onafhankelijk zijn, kan verkregen worden door deze twee kansen met elkaar te vermenigvuldigen en dit resultaat te vermenigvuldigen met N.

    De waarde van χ² is weer met dezelfde formule te berekenen:

    \[\sum\frac{(O-E)^2}{E}\]

    • In dit voorbeeld gaat het om vier cellen.

    Vrijheidsgraden

    Uit de contingentie tabel is het aantal vrijheidsgraden af te leiden door:

    • df = (R – 1)(C – 1) met R en C het aantal rijen en kolommen in de tabel. Het aantal vrijheidsgraden is in het voorbeeld dus df = 1.

    In dit voorbeeld hoort bij het aantal vrijheidsgraden een kritieke waarde van 3.84. Stel dat we een χ² hadden gevonden van 5.65, dan overschrijdt dit de kritieke waarde en kunnen we de nulhypothese verwerpen. De nulhypothese was dat de variabelen onafhankelijk van elkaar zijn. Wanneer een verdachte niet-blank was, kreeg deze in dit geval eerder de doodstraf.

    Veel boeken vinden dat de Yates’ correctie voor continuïteit gebruikt moet worden voor 2x2 tabellen, vooral bij kleine verwachte frequenties. Dit wordt gedaan door de absolute waarde van elke teller met een halve eenheid te verlagen voor het te kwadrateren.

    Fisher’s Exacte Test

    In Fisher’s Exacte Test wordt van de rij- en kolom totalen elke mogelijke 2x2 tabel gemaakt, en dan uitgerekend wat de som is van de kansen op een tabel met extremere resultaten dan de tabel met de huidige resultaten. Als die som kleiner is dan α, wordt de nulhypothese verworpen en wordt er geconcludeerd dat de twee variabelen in de contingentie tabel een significant verband hebben. Deze test is een conditionele test omdat het uitgaat van bestaande waarden (die in de tabel). Het voordeel van deze test is dat het niet gebaseerd is op de chi-kwadraat verdeling en dus niet aan deze assumpties hoeft te voldoen. Het is echter ook een controversiële test, omdat het conditioneel is. Daarnaast moet je duidelijk van tevoren stellen of je een eenzijdige of tweezijdige test wil doen. Meestal komt uit Fisher’s Exacte Test en de Pearson’s chi-kwadraat dezelfde uitkomst. Fisher’s test is echter alleen te gebruiken bij 2x2 tabellen.

    Welke voorwaarden zijn er voor de Pearson chi-kwadraat?

    Een van de belangrijkste voorwaarden om de chi-kwadraat test te gebruiken, is een redelijke grootte van verwachte frequenties. Kleine verwachte frequenties kunnen voor problemen zorgen. Ze zorgen namelijk voor een beperkt aantal contingentie tabellen en dus voor een beperkt aantal waarden voor chi-kwadraat. De continue χ² verdeling kan deze discrete verdeling niet goed beschrijven.

    Over het algemeen is de regel dat alle verwachte frequenties minstens vijf moeten zijn. Bij kleinere frequenties is het aan te raden Fisher’s Exacte Test te gebruiken, omdat die niet gebaseerd is op de χ² distributie. Bij verwachtte frequenties van één in een cel van een 2x2 tabel kan de chi-kwadraat met de volgende formule gevonden worden:

    \[X^2_{adj}=\frac{X^2\times{N}}{N-1}\]

    De Fisher’s Exact Test wordt gebruikt voor de verwachtte waarden groter dan één.

    χ² voor ordinale data

    Wanneer de χ² wordt uitgerekend voor een contingentie tabel, maakt het niet uit hoe de rijen of kolommen gerangschikt zijn: de volgorde maakt niet uit in de berekening. Maar wat als de volgorde van rijen of kolommen wel van belang is? Bijvoorbeeld in het geval, waarbij we patiënten met een eetstoornis aan een behandeling mee laten doen, en meten wie stopt met de behandeling of niet. Daarbij letten we op het aantal traumatische gebeurtenissen dat de patiënt heeft meegemaakt in haar jeugd. Dit probleem moet opgelost worden door middel van correlaties. Dit komt terug in hoofdstuk tien over correlatietechnieken.

    Welke voorwaarden zijn er voor de chi-kwadraat test?

    De voorwaarde van onafhankelijkheid

    De chi-kwadraat test onderzoekt de onafhankelijkheid van variabelen, zoals bij een contingentietabel. Een belangrijke voorwaarde om de test te mogen uitvoeren is, dat de observaties onafhankelijk van elkaar zijn. Dit houdt in dat de keuze van de ene participant geen invloed heeft op de keuze van een andere participant.

    De inclusie van niet-voorvallende waarden

    Stel dat we willen weten hoeveel studenten van stad en platteland positief zijn over de instelling van de zomertijd. Van de twintig studenten van het platteland zijn 16 mensen voor en van de twintig studenten uit de stad zijn 10 mensen voor. Voor het uitrekenen van de χ² moeten we echter ook weten hoeveel mensen negatief denken over de zomertijd (oftewel de ‘niet-voorvallende waarden’). Wanneer je niet-voorvallende waarden niet meeneemt in de berekening, wordt de waarde van χ² onterecht kleiner, en de kans op het verwerpen van H0 ook.

    Wanneer we kijken naar de steekproefverdeling van χ², kunnen we stellen dat de test eenzijdig is: we verwerpen H0 alleen wanneer onze waarde van χ² extreem rechts in de verdeling ligt. In feite is de chi-kwadraat test non directioneel.

    Hoe moet onderzoek aangepast worden bij herhaalde metingen?

    De voorwaarde van onafhankelijke data stelt dat de verkregen scores niet van elkaar afhankelijk mogen zijn. Maar wanneer metingen herhaald worden bij dezelfde mensen, dan moeten we ons onderzoek aanpassen. We willen namelijk dat de verandering die we onderzoeken alleen door het experiment komt en niet door andere variabelen (zoals ouder worden, meer ervaring hebben, et cetera). De standaardfout van veranderingsscores geeft aan in hoeverre de scores afhankelijk van elkaar zijn. Stelt dat we een interventie starten om het hulpvaardig gedrag onder kinderen te vergroten. We meten kinderen vóór en na de interventie en noteren of ze wel of niet hulpvaardig zijn. In dit geval moeten we per kind meten of die op tijdstip 1 en 2 wel of geen hulp bood aan anderen (zie Tabel 8a).

    Tabel 8a

     

    Na interventie

     

    Voor interventie

    Ja

    Nee

    Totaal

    Ja

    38

    4

    42

    Nee

    12

    18

    30

    Totaal

    50

    22

    72

    In deze tabel is af te leiden welke kinderen zijn veranderd in het hulpvaardig zijn. Dit zijn alleen die kinderen in de dikgedrukte frequenties. De test die hierbij gebruikt kan worden, is McNemar’s test: hierbij worden uit een contingentietabel alleen de twee diagonale cellen gebruikt. De verwachte frequentie is dat in elke situatie de helft van de kinderen verandert.

    Voor deze test zetten we de waarden waar we geïnteresseerd in zijn, in een nieuwe tabel (Tabel 8b).

    Tabel 8b

     

     

     

    Voor interventie

    Nee > Ja

    Ja > Nee

    Totaal

    Geobserveerd

    12

    4

    16

    verwacht

    8

    8

    16

    De formule wordt:

    \[X^2=\sum\frac{(O-E)^2}{E}=\frac{(4-8)^2}{8}+\frac{(12-8)^2}{8}=4\]

    De χ² overschrijdt de kritieke waarde (χ² = 3.84) en de nulhypothese kan worden verworpen. We concluderen dat de interventie succesvol was, en dat de kinderen hulpvaardiger zijn geworden.

    Wat zijn waarschijnlijkheidsratio's?

    Een andere manier om categorische data te analyseren is door middel van waarschijnlijkheidsratio’s. Bij grotere steekproeven kan zowel deze als de standaard Pearson chi-kwadraat gebruikt worden, bij kleinere steekproefgroottes is de Pearson chi-kwadraat beter. Waarschijnlijkheidsratio’s worden gebruikt in log-lineaire modellen voor het analyseren van contingentie tabellen.

    Simpel gezegd berekenen we de kans of waarschijnlijkheid dat de data die we hebben verkregen, zou voorkomen als de nulhypothese waar is, en de kans dat de data voorkomt bij een alternatieve hypothese. Als de data waarschijnlijker is onder de alternatieve hypothese, verwerpen we H0. Als de data waarschijnlijker is onder de nulhypothese, dan behouden we H0. De waarschijnlijkheidsratio is kortom de ratio van deze twee waarschijnlijkheden en wordt uitgedrukt in χ².

    De formule is:  

    \[X^2_{(C-1)}=2\sum{O_i}ln(\frac{O_i}{E_i})\]

    • waarbij ‘ln’ staat voor natuurlijk logaritme en Oi en Ei de geobserveerde en verwachte frequenties zijn voor elke cel. Het aantal vrijheidsgraden is C-1. Bij contingentie tabellen wordt dezelfde formule gebruikt, maar dan met vrijheidsgraden  (R-1)(C-1).

    Waarvoor wordt de Mantel-Haenszel statistiek gebruikt?

    Bij de bovenstaande 2x2 tabellen is de interpretatie vrij simpel, maar wat als we willen controleren voor een derde variabele (‘conditioneel op’). Bijvoorbeeld wanneer we naar de relatie kijken tussen stress (hoog/laag) en mentale status (normaal/verstoord) in verschillende omgevingen. Hiervoor wordt de Mantel-Haenszel statistiek (ook wel Cochran-Mantel-Haenszel statistiek genoemd) gebruikt.

    Als voorbeeld wordt de Simpson paradox gebruikt: de situatie waarin de relatie tussen twee variabelen omkeert wanneer je een derde variabele erin meerekent.

    Bij een universiteit werd bekend dat voor een bepaald jaar 48% van de mannelijke inschrijvers werden toegelaten, en slechts 30% van de vrouwelijke. Dit lijkt discriminatie, maar omdat de toelatingen per faculteit worden geregeld, moeten we ook dit meenemen in het onderzoek. De Mantel-Haenszel statistiek is ontworpen om de data van elke faculteit apart te onderzoeken (we conditioneren op faculteit). Hierna wordt de data van elke faculteit opgeteld.

    In feite maakt de Mantel-Haenszel berekening dus losse 2x2 tabellen voor elke faculteit, met het aantal mannen en vrouwen die toegelaten of geweigerd zijn. De Mantel-Haenszel statistiek wordt weergegeven door M2. De statistiek kan als een chi-kwadraat met één vrijheidsgraad beoordeeld worden. Uit het onderzoek kwam een M2 van 0.096, welke een kans had van .76. De nulhypothese dat toelating onafhankelijk is van geslacht kan dus niet verworpen worden.

    Welke manieren zijn er om de grootte van effect weer te geven?

    Of een verband wel of niet statistisch significant is, door middel van de overschrijdingskans, vertelt nog niet of het verband praktisch significant is: of het een belangrijke vondst is. Naast een significantietest is het belangrijk om de grootte van het effect weer te geven. Hier zijn twee verschillende manieren voor.

    Ten eerste is er de d-familie van Rosenthal, die gebaseerd is op de verschillen tussen de gemeten groepen. Ten tweede is er de r-familie (ofwel de associatie metingen), die een soort correlatiecoëfficiënt geeft tussen de twee onafhankelijke variabelen.

    Voorbeeld

    Bij een studie naar hartaanvallen nam een grote groep mannen dagelijks een aspirine of een placebo, en werden zij lange tijd gevolgd om te onderzoeken welke groep meer kans had op een hartaanval. Dit is een prospectieve studie omdat de behandeling eerst wordt gegeven en toekomstige uitkomsten van belang zijn. De studie is ook wel een cohort studie, omdat er twee cohorten (groepen) participanten zijn. In een gerandomiseerde klinische trial worden participanten willekeurig toegewezen aan condities. Een retrospectieve studie of case-control design zou terugkijken in de tijd bij mensen die wel of niet een hartaanval hebben gehad, om te zien hoe hun medicijngebruik was. Uit het onderzoek komt een statistisch significant resultaat, wat inhoudt dat er een relatie is tussen of iemand wel of niet dagelijks aspirine neemt, en of hij later een hartaanval kreeg.

    d-familie: risico’s en odds

    Dit zijn twee belangrijke concepten bij 2x2 tabellen en worden vaak door de war gehaald. Het risico is de kans op een hartaanval bij mensen in de aspirine- of placebogroep (bijvoorbeeld 0.94% versus 1.69%). Het verschil in risico is dus .77%. Dit lijkt niet veel, maar het gaat hier wel over hartaanvallen. Het probleem met het risico verschil is dat de grootte afhangt van het algehele risiconiveau. Een andere notatiemanier is middels een risico ratio of relatief risico: 1.69%/0.94% = 1.798. Het risico op een hartaanval wanneer je geen aspirine slikt, is dus 1.8 keer hoger dan wanneer je dit wel slikt.

    Rekenen we uit door het aantal hartaanvallen delen door het totaal aantal mensen in die groep (b/v 104/11.037 = .94%). De odds op een hartaanval voor iemand in de aspirine groep is het aantal hartaanvallen delen door het totaal aantal mensen die geen hartaanval kregen (104/10933 = 0.0095) in die groep. De odds ratio is dan dus de ratio van het aantal hartaanvallen versus geen hartaanvallen. De odds ratio kan ook gevormd worden door twee odds door elkaar te delen. Bijvoorbeeld: Odds|GeenAspirine/Odds|Aspirine = .0174/.0095 = 1.83.

    De odds ratio heeft een aantal voordelen, naast de risico ratio die eigenlijk altijd uitgerekend wordt. Zo is de odds ratio bruikbaarder in een retrospectieve studie, wanneer we bijvoorbeeld terugkijken in het verleden of hartpatiënten of normale mensen meer aspirine gebruikten. Risico is toekomst georiënteerd. Daarnaast is de odds ratio zeer geschikt bij kleine kans gebeurtenissen zoals hartaanvallen, omdat het dan een goede schatting geeft van wat de risico ratio zou zijn. De odds ratio is even goed voor prospectieve, retrospectieve en cross-sectionele studies. Daarnaast is de natuurlijke log van de odds ratio [ln(OR)] erg handig bij bijvoorbeeld logistische regressie en log-lineaire modellen.

    Odds ratios in 2 x K en 2 x 2 x K tabellen

    In het geval van een 2 x k tabel (met meer dan twee rijen), is de odds ratio niet meer zo voor de hand liggend, omdat het niet duidelijk is wat onze ratio moet vormen. In dat geval is het verstandig om per set een odds ratio uit te rekenen en deze met elkaar te vergelijken.

    In het geval van een 2 x 2 x k tabel, dus wanneer een 2x2 tabel wordt herhaald voor verschillende afdelingen/faculteiten etc., kunnen we de kansratio voor alle afdelingen uitrekenen met de formule:

    \[\text{OR}\text{(odds ratio)}=\frac{\sum{(\frac{n_{11k}n_{12k}}{n_{...k}})}}{(\frac{n_{12k}n_{21k}}{n_{...k}})}\]

    Tabel 9

     

     

     

    Afdeling

    Data

    \[\frac{n_{11k}n_{12k}}{n_{...k}}\]

    \[\frac{n_{12k}n_{21k}}{n_{...k}}\]

    A

    15 9

    15 x 6/44 = 2.05

    9 x 14/44 = 2.86

     

    14 6

     

     

    B

    30 16

    30 x 10/80 = 3.75

    16 x 24/80 = 4.8

     

    24 10

     

     

    Som totaal

     

    5.80

    7.66

    De OR in de voorbeeld tabel (Tabel 9) komt dus uit op 5.80/7.66 = 0.76.

    r-familie metingen

    De d-familie metingen vergelijken verschillen (differences) tussen condities, door middel van risico- of kansratio’s. Een oudere methode is het bekijken van correlaties tussen twee variabelen (en correlaties worden uitgedrukt in r). Deze methode wordt niet vaak gebruikt, vooral omdat de interpretatie ervan niet duidelijk is. Wat betekent het, wanneer de correlatie tussen variabele X en Y .02 is? Daarom heeft de d-familie in dit geval de voorkeur.

    In 2x2 tabellen wordt de correlatiecoëfficiënt phi genoemd (griekse letter φ), welke de correlatie tussen twee dichotome (met één of twee waarden) variabelen aangeeft.

    \[\varphi=\sqrt{\frac{X^2}{N}}\]

    Bij grotere tabellen hebben we Cramer’s V nodig:

    \[V=\sqrt{\frac{X^2}{N(k-1)}}\]

    waarbij N de steekproefgrootte is en k de kleinere is van het aantal rijen of kolommen (bij k=2 zijn de twee formules gelijk!)

    Hoe wordt overeenstemming gemeten?

    Kappa (K)

    Bij categorische data is het vaak van belang om te meten in hoeverre beoordelaars overeenstemmen in hun oordeel. Stel dat we bijvoorbeeld willen meten of 30 adolescenten problemen vertonen, met een indeling van ‘geen problemen’ (1), ‘problemen op school’ (2) en ‘problemen thuis’ (3). We vragen twee beoordelaars (clinici) om dit te onderzoeken, zodat we de twee beoordelingen kunnen vergelijken. Middels een contingentietabel (Tabel 10) onderzoeken we hoe vaak de beoordelaars op elke schaal hebben gescoord. Stel dat we vinden dat de beoordelaars het in 20 van de 30 gevallen eens zijn (de diagonale cellen), dan is er 66% overeenstemming. Dit is het percentage van overeenstemming. Daarnaast vinden de beoordelaars beiden dat de meerderheid van de adolescenten geen problemen vertonen.

    Het probleem met alleen uitrekenen van een percentage, is dat we geen rekening houden met de mogelijkheid dat de beoordelaars per toeval dezelfde classificatie geven. Om te corrigeren voor kans, ontwikkelde Cohen de statistiek kappa (κ). Hiervoor worden de verkregen en verwachte frequenties voor elke classificatie gebruikt. De verwachte frequentie van de classificatie Geen probleem is bijvoorbeeld (20x20)/30 = 13.33.

    \[K=\frac{\sum{f_0}-\sum{f_E}}{N-\sum{f_E}}\]

    waarbij f0 de verkregen frequentie is op de diagonaal en fE de verwachtte.

    Tabel 10

     

    Beoordelaar 1

     

     

    Beoordelaar 2

    Geen probleem

    School

    Thuis

    Totaal

    Geen probleem

    16 (13.33)

    1

    3

    20

    School

    0

    2 (.33)

    0

    2

    Thuis

    4

    2

    2 (1.33)

    8

    Totaal

    20

    5

    5

    30

    Stel dat kappa uitkomt op K = .33. Dit houdt in dat we na correctie voor kans 33% overeenstemming hebben tussen de beoordelaars. Dit is veel lager dan de eerder uitgerekende waarde van 66%.

    Access: 
    Public
    Welke hypothese testen voor gemiddelden zijn er? - Chapter 7

    Welke hypothese testen voor gemiddelden zijn er? - Chapter 7

    In dit hoofdstuk introduceren we de t test als een procedure voor hypothese testen, in het geval van kwantitatieve data (in plaats van categorische data). Bij kwantitatieve data onderzoeken we verschillen tussen groepen of personen, of de relatie tussen variabelen. We willen bijvoorbeeld onderzoeken of een behandeling effect heeft gehad, door de gemiddelde score van de behandelde groep en de controlegroep te vergelijken.

    Hoe ziet de steekproefverdeling van het gemiddelde eruit?

    Wanneer we rekenen met steekproefgemiddelden, moeten we vaak gebruikmaken van de verdeling van het gemiddelde. De verdeling van gemiddelden wordt samengevat in de centrale limietstelling: gegeven een populatie met gemiddelde μ en variantie σ², heeft de steekproefverdeling van het gemiddelde een gemiddelde gelijk aan μ, een variantie gelijk aan σ²/n, en een standaarddeviatie gelijk aan σ/√n. De verdeling wordt steeds normaler naarmate de n (steekproefgrootte) toeneemt. Hoe snel de verdeling normaler wordt bij hogere n is afhankelijk van de vorm van de originele populatie. De steekproefverdeling van het gemiddelde van een populatie die normaal is, zal een normale verdeling hebben onafhankelijk van n. Als de populatie symmetrisch, maar niet-normaal verdeeld is, zal de steekproefverdeling van het gemiddelde bijna normaal zijn. Bij een scheve verdeling van de populatie moet de steekproefgrootte tenminste 30 zijn, om de steekproefverdeling van het gemiddelde normaal te krijgen.

    Een uniforme verdeling is een verdeling waarbij elke waarde even waarschijnlijk is. Het heeft een gemiddelde van de helft van de range en een standaarddeviatie van de range gedeeld door de wortel van 12.

    Hoe werkt hypothese testen als σ bekend is?

    Door de centrale limietstelling weten we alle belangrijke karakteristieken van de steekproefverdeling van het gemiddelde. Wanneer we een populatiegemiddelde onderzoeken, weten we meestal niet de variantie van die populatie. Hier worden de gevallen besproken waarin we σ wel weten.

    De Youth Self Report Inventory (YSR) wordt gebruikt om gedragsproblemen bij kinderen te meten. De test is uitgebreid afgenomen over de hele wereld, waardoor populatiegemiddelde en standaarddeviatie bekend zijn (50 en 10). Stel dat we gedragsproblemen onderzoeken bij een steekproef van kinderen (n = 150) van depressieve ouders. We willen weten of die meer of minder gedragsproblemen hebben dan ‘het gemiddelde kind’. De hypotheses zijn:

    • H0 : μ = 50
    • H1 : μ ≠ 50. (deze alternatieve hypothese is tweezijdig, we verwerpen H0 bij zowel een hoger of lager gemiddelde).

    Uit ons onderzoek komt een steekproefgemiddelde van 54.64. Voor de hypothesetest beginnen we met de standaardformule voor z, die we aanpassen naar gemiddelde en standaardfout (in plaats van score en standaarddeviatie).

    \[z=\frac{X-\mu}{\sigma}\] wordt

    \[z=\frac{\bar{X}-\mu}{\sigma\bar{X}}=\frac{\bar{X}-\mu}{\frac{\sigma}{\sqrt{n}}}\]

    In dit geval is de z = (56,65-50)/ (10/√150) = 6,64/0,816 ≈ 8,14

    De gevonden z kan vervolgens opgezocht worden in de Appendix z. In dit geval is het een significante z-score.

    Bij het hypothesetesten van een steekproefgemiddelde tegen een populatiegemiddelde, moeten we aannemen dat de steekproefverdeling van het gemiddelde (vrijwel) normaal is. Dit kunnen we aannemen wanneer ofwel de populatie normaal verdeeld is, ofwel wanneer de steekproefgrootte groot genoeg is.

    Hoe werkt hypothese testen als σ onbekend is?

    Over het algemeen weten we de waarde van σ niet, en moeten we die schatten met de steekproef standaarddeviatie (s). Wanneer we σ vervangen door s, kunnen we echter niet meer gebruikmaken van de z formule, maar gebruiken we de t test.

    De t test gebruikt s² als schatting van σ². Het probleem hierbij is, dat de verdeling van s² positief scheef is, vooral bij kleine steekproeven. Door die scheefheid zal een waarde van s² al snel de grootte van σ² onderschatten, zeker bij kleinere steekproeven. Doordat s² waarschijnlijk kleiner is dan σ² en in de noemer staat, zal de t waarde waarschijnlijk groter zijn dan de z waarde zou zijn. Hierdoor kunnen we niet in de z-tabel kijken, omdat er dan in meer dan 5% type I fouten gemaakt worden. De oplossing voor dit probleem is de t verdeling. Deze is in de Appendix te vinden.

    \[t=\frac{\bar{X}-\mu}{s\bar{X}}=\frac{\bar{X}-\mu}{\frac{s}{\sqrt{n}}}=\frac{\bar{X}-\mu}{\sqrt{\frac{s^2}{n}}}\]

    Wanneer de verdeling van s2 verdwijnt door meer vrijheidsgraden, zal s de populatie standaarddeviatie ook minder onderschatten. Hierdoor zal t normaler verdeeld zijn en meer op z lijken.  De verdeling van t maakt gebruik van n - 1 vrijheidsgraden.

    Voorbeeld

    Als voorbeeld gebruiken we een studie naar laag geboortegewicht (LGG) bij kinderen. Deze kinderen ontwikkelen vaak problemen, waaronder niet-responsief of onvoorspelbaar zijn. Een interventie trainde moeders om beter op hun kinderen te reageren, met de verwachting dat de moeilijkheden door LGG zouden verminderen. Er waren drie groepen: een LGG experimentele groep, een LGG controlegroep en een normaal geboortegewicht groep. Een psychomotorische test werd afgenomen bij de kinderen toen ze 6 maanden oud waren.

    Een eerste stap is het onderzoeken van de data op scheefheid, door bijvoorbeeld een steel-en-blad display te maken. Een gebrek aan scheefheid geeft aan, dat de steekproefverdeling van het gemiddelde eerder normaal zal zijn. Ook moet gecheckt worden of er geen of weinig uitschieters zijn, die de uitkomsten kunnen beïnvloeden (bijvoorbeeld door middel van een boxplot). Uit het onderzoek komt een gemiddelde van 103.24 uit de LGG groep, met een standaarddeviatie van 13.51. De normen voor de psychomotorische test stellen een gemiddelde van 100. De steekproefgrootte van dit onderzoek is 56. Met een t test onderzoeken we of dit verschil significant is.

    • t = (103,24 - 100) / (13,51/√56≈ 1,79, met 51-1 = 50 vrijheidsgraden

    In dit geval willen we tweezijdig testen, dus bij een overschrijdingskans van 2,5% aan elke kant. In Appendix t hoort bij t0.025 een kritieke waarde van 2.009. De notatie hiervan is t0.025(50) = 2.009. In het geval van tverkregen > t0.025 kunnen we concluderen dat de nulhypothese verworpen kan worden: LGG kinderen testen significant hoger op de psychomotorische test dan kinderen met een normaal geboortegewicht.

    Bootstrapping

    Bij bootstrapping trek je uit de verkregen data een groot aantal steekproeven (vergelijkbaar met het trekken van steekproeven uit een populatie). Door herhaalde steekproeven trekken, krijg je een verdeling van steekproefgemiddelden waarmee je hypotheses kunt testen of waarmee je de variabiliteit van een statistiek kan schatten.

    Waar worden betrouwbaarheidsintervallen voor gebruikt?

    Betrouwbaarheidsintervallen kunnen helpen in het beschrijven van resultaten uit het hypothesetesten. Wanneer we een specifieke schatting hebben van een parameter, noemen we dat een puntschatting. Er zijn daarnaast ook intervalschattingen, die de grenzen aangeven waarbinnen waarschijnlijk het ware populatiegemiddelde (μ) ligt. Dit zijn de betrouwbaarheidsgrenzen, die het betrouwbaarheidsinterval maken. We willen weten hoe hoog en hoe laag de μ-waarde kan zijn, waarbij we H0 nog niet verwerpen. Dit geeft dan de grenzen aan waarbinnen we de nulhypothese behouden. Een makkelijkere manier is om de formule voor t in te vullen met de kritieke waarde van t die je eerder hebt gevonden. De kritieke waarde is een absolute waarde en kan dus negatief of positief zijn (een kritieke waarde van 2.50 is dus ook -2.50).

    Stel dat we weten dat x̄ = 1.5, s = 0.5, n = 10. Wanneer we tweezijdig testen is de kritieke waarde van t bij α = .05 bij t.025(9): 2.262. De formule wordt dan:

    \[\frac{1.5-\mu}{\frac{0.5}{\sqrt{10}}}\pm 2.262\]

    • Dit kan je herschrijven als μ = ± 2,262(0,158) + 1,5 = ± 0,357 + 1,5
    • μboven = + 0,357 + 1,5 = 1,86
    • μonder = - 0,357 + 1,5 = 1,14

    Het 95% betrouwbaarheidsinterval wordt: CI.95 = 1,14 < μ < 1,86. De kans is 95% dat μ tussen 1,14 en 1,86 valt. Het wordt ook wel het geloofwaardigheidsinterval genoemd. Als μ buiten dit interval valt leidt dit tot het afwijzen van de nulhypothese. Goed om te weten is dat μ constant blijft, maar dat het interval van experiment naar experiment veranderd.

    Extreme waarden vinden

    Door middel van de z formule is het mogelijk om waarden te ontdekken die ‘extreem’ zijn. Dit wordt bijvoorbeeld gebruikt om mensen te selecteren voor een behandeling, waarbij mensen die meer dan 1,5 standaarddeviatie van het gemiddelde afwijken, uitgekozen worden. Bij een gemiddelde van 50 en standaarddeviatie van 10 ziet het er als volgt uit:

    • z = 1,5. 1,5 = (X-50)/10. X is dan 1,5(10) + 50 = 65. Iedereen die boven de 65 scoort, wordt geselecteerd.

    Bij single case studies kan de t-verdeling gebruikt worden en wordt de individuele score behandeld als een steekproef van n = 1. We gebruiken de formule:

    \[\frac{(X_1-\bar{X})}{s\sqrt{\frac{n+1}{n}}}\]

    Stel ons gemiddelde is 40 en de standaarddeviatie is 8 van een steekproef met 10 mensen. De individuele score is 31. t is dan (31-40)/9√11/10 ≈ 1,05. Er zijn 9 vrijheidsgraden en de kritische waarde voor α=.05 hierbij is 1,83. Deze persoon scoort dus niet extreem.

    Om een t-test uit te voeren met SPSS dienen de volgende stappen genomen te worden: Analyze > Compare Means > One Sample t Test. De grenzen van het betrouwbaarheidsinterval in SPSS zijn altijd 1,00 minder dan als ze met de hand uitgerekend worden.

    Waarvoor wordt de paired samples t-test gebruikt?

    Soms hebben we herhaalde metingen, waarbij participanten meerdere keren een test krijgen en we het verschil tussen hun gemiddelden willen onderzoeken. Hiervoor gebruiken we de paired samples t-test, of herhaalde metingen t-test.

    Stel dat we meisjes met anorexia laten meedoen aan een interventie, en hen wegen voor en na de interventie. Het verschil in gewicht toont aan, hoeveel ze zijn aangekomen tijdens de interventie. De vraag is of dit door de therapie komt of bijvoorbeeld door het verstrijken van tijd. We testen de nulhypothese dat het gemiddelde in de populatie voor de interventie gelijk is aan het gemiddelde na de interventie, oftewel H0 : μvoor = μna

    De scores van voor en na de behandeling kunnen verwerkt worden in één set scores: verschilscores, waarbij je μvoor - μna berekend. Als H0 waar is en de behandeling geen effect had, dan zal het gemiddelde van de verschilscores nul zijn. De nulhypothese wordt nu dat het gemiddelde van de verschilscores (μD) gelijk is aan nul:

    • μD = μvoor - μna = 0.

    Nu kunnen we de t statistiek weer uitrekenen (met D als gemiddelde van verschilscores en sD als de standaarddeviatie en n is het aantal verschilscores):

    \[t=\frac{\bar{D}-\mu}{s_{\bar{D}}}=\frac{\bar{D}-\mu}{s_D\sqrt{n}}\]

    • In dit geval is μ = 0, want dat is de nulhypothese.

    Het aantal vrijheidsgraden is wederom n-1. Er gaat één vrijheidsgraad verloren, omdat de variantie van de verschilscores een schatting is van de populatievariantie en deze verkregen wordt door middel van het steekproefgemiddelde. Het betrouwbaarheidsinterval is op dezelfde manier te berekenen als de one sample t-toets.

    Effectgrootte

    Ook bij het werken met verschilscores zijn effectgroottes van groot belang. Bij verschilscores wordt het effect uitgedrukt met Cohen’s d. Cohen rapporteerde effect met de volgende formule:

    \[d=\frac{\mu_1-\mu_2}{\sigma}\]

    ​​​​​​​Een verschilscore kan worden weergegeven als getal, als percentage, of zoals bij Cohen’s d als standaarddeviatie eenheid. De teller bevat het verschil tussen de populatiegemiddelden, terwijl de noemer de standaarddeviatie weergeeft van één van de populaties (en niet van de verschilscores). Deze formule kan ook gebruikt worden met steekproefresultaten, waarbij μ1 - μ2 vervangen wordt door X1-X2 en σ vervangen wordt door sx1. De d wordt dan weergegeven met een dakje erboven, omdat het een schatting is. Uit het voorbeeld van de anorexia interventie kwam een d van 1.45. Dit houdt in, dat de meisjes gemiddeld 1.5 standaarddeviatie van hun gewicht vóór de interventie aan waren gekomen. In andere situaties wordt soms de gemiddelde standaarddeviatie van de twee populaties genomen.

    De paired sample t-toets kan gebruikt worden als de steekproeven gerelateerd (of gecorreleerd) zijn. Dat kan wanneer elke persoon twee scores heeft, zoals voor en na de behandeling. Maar ook wanneer bijvoorbeeld man en vrouw getest worden op huwelijkse tevredenheid. Wat alle experimenten met elkaar gelijk hebben is dat de ene score wat zegt over de andere score in het paar, oftewel de scores zijn gerelateerd.

    Wanneer er bepaalde data mist, bijvoorbeeld als de vrouw wel, maar de man niet de vragenlijst over hun kind heeft ingevuld. Normaal worden de incomplete paren eruit gegooid en de gepaarde t-toets uitgevoerd op e overige data. Het kan echter ook op een andere manier waarbij wel alle data gebruikt wordt, maar men er vanuit gaat dat de gemiste data random is en niet systematisch. Er is een test die de t-waarde neemt voor de paren waar beide scores aanwezig zijn en de t-waarde voor de incomplete paren. Vervolgens worden deze t-statistieken gecombineerd. Dit wordt vooral gebruikt als er veel data mist.

    Notatie

    Stel dat we de resultaten willen opschrijven van de anorexia-interventie. Dit zou er als volgt uit kunnen zien: ‘Van 16 patiënten werd het gewicht voor en na de interventie gemeten. De gemiddelde gewichtstoename voor de N = 16 meisjes was 6.52 pond, met een standaarddeviatie van 7.21. Een tweezijdige t-test op gewichtstoename was statistisch significant (t(15) = 3.98, p < .05). Gemiddeld genomen nam het gewicht van de patiënten toe tijdens de interventie. Het 95% betrouwbaarheidsinterval was 3.12 – 10.80. Cohen’s d = 1.6 toont aan dat de gewichtstoename meer dan 1.5 standaarddeviaties van het oorspronkelijke gewicht was.’

    Hoe werkt het hypothese testen bij twee onafhankelijke steekproeven?

    De t test wordt het meest gebruikt bij testen van verschillen tussen twee onafhankelijke groepen. Bijvoorbeeld wanneer we prestaties vergelijken tussen een controlegroep en een experimentele groep (die een bepaalde behandeling heeft ondergaan). We willen weten of het verschil groot genoeg is om er vanuit te gaan dat de twee steekproeven uit verschillende populaties komen.

    Verdeling van verschillen tussen gemiddelden

    Wanneer we gemiddelden van twee verschillende populaties vergelijken, testen we een nulhypothese in de vorm van H0 : μ1 – μ2 = 0. Hierbij hoort een steekproefverdeling van alle mogelijke verschilscores tussen de populatiegemiddelden. In het geval van twee normaal verdeelde populaties, is de verdeling van verschilscores ook een normaal verdeling. De variantie van deze verdeling kun je vinden door de variantie som wet: de variantie van een som of verschil van twee onafhankelijke variabelen is gelijk aan de som van hun varianties.

    \[\sigma^2_{X_1-X_2}=\sigma^2_{X_1}+\sigma^2_{X_2}=\frac{\sigma^2_1}{n_1}+\frac{\sigma^2_2}{n_2}\]

    De t statistiek

    Voor de t formule hebben we de standaardfout van verschillen tussen gemiddelden, s², nodig. Onze ‘score’ bij testen van onafhankelijke steekproeven is de verschilscore van gemiddelden Het gemiddelde van de steekproefverdeling is μ1 – μ2 = 0, dus deze kunnen we weglaten uit de formule.

    \[t=\frac{(X_1-X_2)-(\mu_1-\mu_2)}{\sqrt{\frac{s^2_1}{n_1}+\frac{s^2_2}{n_2}}}=\frac{X_1-X_2}{\sqrt{\frac{s^2_1}{n_1}+\frac{s^2_2}{n_2}}}\]

    Gepoolde varianties

    De eerder gegeven formule voor t kan alleen gebruikt worden bij gelijke steekproefgroottes. Wanneer de steekproeven niet even groot zijn, moeten de varianties worden aangepast. Dit heet de gepoolde variantie. Vaak nemen we aan dat σ²1 = σ²2 (de steekproeven komen uit populaties met gelijke varianties). Wat we ook kunnen doen, is de steekproefvarianties nemen die we hebben gevonden (s²1 en s²2) en een gewogen gemiddelde maken van die twee (op basis van hun vrijheidsgraden). Deze nieuwe schatting s²p (p van ‘pooled’), wordt de gepoolde variantie schatting genoemd:

    \[s^2_p=\frac{(n_1-1)s^2_1+(n_2-1)s^2_2}{n_1+n_2-2}\]

    • De teller bevat de gewogen som van varianties en de noemer de som van de gewichten.

    De t formule wordt met de gepoolde variantie:

    \[t=\frac{X_1-X_2}{\sqrt{s^2_p(\frac{1}{n_1}+\frac{1}{n_2})}}\]

    Er wordt gewerkt met n1 + n2 - 2 vrijheidsgraden.

    Betrouwbaarheidsinterval

    Ook bij een t test van verschillen tussen gemiddelden is een betrouwbaarheidsinterval nuttig. Deze is exact hetzelfde als bij een enkele steekproef, alleen is het gemiddelde vervangen door het verschil tussen gemiddelden, en de standaardfout een standaardfout van gemiddelden. De formule voor een 95% betrouwbaarheidsinterval wordt:

    \[\text{CI}_{.95}=(X_1-X_2)\pm t_{.025}^{s\bar{X}_1-\bar{X}_2}\]

    De notatie van het betrouwbaarheidsinterval is bijvoorbeeld 3.02 ≤ (μ1 – μ2) ≤ 9.54. De kans .95 dat het ware verschil tussen populatiegemiddelden in dit interval valt.

    Effectgroottes

    Voor effectgrootte kunnen we weer gebruikmaken van Cohen´s d, maar nu is de standaarddeviatie de gepoolde variantie van de twee populaties.

    \[d=\frac{X_1-X_2}{s_p}\]

    Ook voor effectgroottes kan een betrouwbaarheidsinterval worden opgesteld

    Als interpretatie van effectgroottes heeft Cohen wat algemene richtlijnen opgesteld:

    • d = .20 is een klein effect
    • d = .50 een medium effect
    • d = .80 een groot effect

    Het noteren van de resultaten van een onafhankelijke t-toets is gelijk aan het noteren bij een gepaarde t-test.

    Hoe ga je om met heterogeniteit van variantie?

    Een van de voorwaarden voor de t test is homogeniteit van variantie (σ²1 = σ²2). Pas bij homogeniteit van variantie kunnen we t bepalen, eventueel na poolen van de steekproefvarianties.

    Bij heterogene varianties laten we het poolen achterwege:

    \[t'=\frac{X_1-X_2}{\sqrt{\frac{s^2_1}{n_1}+\frac{s^2_2}{n_2}}}\]

    • waarbij we uitgaan van heterogene varianties.

    Helaas is de steekproefverdeling van t’ niet bekend, maar wel een benadering hiervan. Een voorbeeld is de Welch-Satterthwaite oplossing. Zij stellen het aantal vrijheidsgraden op:

    \[df'=\frac{(\frac{s^2_1}{n_1}+\frac{s^2_2}{n_2})}{\frac{(\frac{s^2_1}{n_1})^2}{n_1-1}+\frac{\frac({s^2_2}{n_2})^2}{n_2-1}}\]

    Hoe bepalen we of de varianties heterogeen zijn, aangezien we de populatie varianties niet weten? Levene stelde voor elke X-waarde te verplaatsen met de absolute afwijking van het groepsgemiddelde:

    \[d_{ij}=|X_{ij}-\bar{X}_j|\]

    Vervolgens kan een two-sample t-toets op de dijs uitgevoerd worden. Wanneer t significant is verschillende varianties van de twee groepen.

    De t toets is robuust, oftewel niet (of amper) beïnvloedt door kleine afwijkingen van de onderliggende assumpties. Er zijn twee assumpties voor de onafhankelijke t-toets: (1) normaliteit van de steekproefverdeling van verschillen tussen gemiddelden en (2) homogeniteit van de variantie. Daarnaast is het relevant of de steekproefgroottes gelijk of ongelijk zijn. Als de steekproefgroottes gelijk zijn is het overschrijden van de homogeniteitsassumptie van weinig belang. Als de ware populatie ongeveer de gelijke vorm heeft als die van de steekproef of als ze beide symmetrisch zijn, zijn schendingen van normaliteit niet zo erg. Bij scheve verdelingen ontstaan serieuze problemen, tenzij de varianties gelijk zijn.

    Access: 
    Public
    Wat is de power van een statistische test? - Chapter 8

    Wat is de power van een statistische test? - Chapter 8

    In dit hoofdstuk wordt het concept power van een statistische test besproken. Veel experimenten houden zich vooral bezig met het zo klein mogelijk maken van de kans op een Type I fout: het vinden van een verschil, dat er eigenlijk niet is. Power heeft betrekking op een ander type fout, namelijk de Type II: het niet vinden van een verschil, dat er wel is. De kans hierop wordt ook wel β genoemd, en power = 1- β. Power is de kans van het correct verwerpen van de nulhypothese, oftewel het correct concluderen dat er een verschil is.

    Wat houdt het concept power in?

    Power geeft de kans dat een nulhypothese correct verworpen wordt. Een omslachtige manier om dit zelf uit te rekenen, is door een steekproef te nemen (waarvan populatiegemiddelde en standaarddeviatie bekend zijn) en hiervan de t waarde te bepalen. Vervolgens herhalen we dit proces 9.999 keer, waardoor we 10.000 t waarden hebben. Van die t waarden kunnen we vervolgens bepalen hoeveel van die waarden groter waren dan de kritieke waarde van t. Stel dat 86% van de resultaten groter waren dan de kritieke waarde, dan is de power van het experiment .86.

    Welke factoren beïnvloeden de power?

    Power is een functie van een aantal variabelen, namelijk (1) α, de kans op een type I fout, (2) de alternatieve hypothese, (3) de steekproefgrootte en (4) de gebruikte test. Elk heeft zijn eigen invloed op hoe groot de power zal zijn.

    Power als functie van α

    Als we de overschrijdingskans α vergroten (door het cut off punt naar links te verschuiven), zal de kans op het verwerpen van de nulhypothese simultaan toenemen (dit doen we immers bij p < α). Dit verkleint de kans op het onjuist behouden van de nulhypothese (β) en vergroot de power. Een grotere α geeft wel meer kans op een Type I fout.

    Power als functie van H1

    Als de alternatieve hypothese H1 meer afwijkt van de nulhypothese H0, wordt logischerwijs de kans groter dat we dit verschil zullen ontdekken. De power wordt dus groter, maar er is nog een redelijk grote kans op type II fout.

    Power als functie van n en σ²

    De makkelijkste manier om power te beïnvloeden is met de steekproefgrootte n. Dit heeft te maken met de steekproefverdeling van het gemiddelde. Bij hypothesetesten vergelijken we gemiddelden, en maken we gebruik van de steekproefverdeling van die gemiddelden. De formule voor de variantie in die verdeling is:

    \[\sigma^2_{\bar{X}}=\frac{\sigma^2}{n}\]

    De variantie van de verdeling wordt dus kleiner als n groter wordt of σ² kleiner wordt.

    Als de variantie van een verdeling kleiner wordt, wordt de verdeling spitser, met kleinere staarten. De verdelingen van H0 en H1 zullen dan minder overlappen, wat de kans vergroot op het juist verwerpen van H0.

    Hoe wordt de power berekent?

    Power is dus afhankelijk van de hoeveelheid overlap tussen de steekproefverdelingen onder H0 en H1. Deze overlap wordt bepaald door de afstand tussen μ1en μ2en de standaardfout.  Voor het berekenen van power hebben we effectgrootte d nodig. Deze wordt namelijk berekend door de gemiddelden van beide groepen in de populatie (μ1en μ2) van elkaar af te trekken, en te delen door de standaarddeviatie. We kunnen d op verschillende manieren vinden (aflopend van best tot minst):

    1. Eerder onderzoek: we kunnen naar steekproefgemiddelden en varianties van andere studies kijken en die als uitgangspunt nemen om μ1en μ2 en σ te schatten.
    2. Zelf inschatten wat belangrijk is: veel onderzoekers willen uit hun onderzoek een bepaald effect vinden, om te kunnen zeggen dat het een belangrijk/groot effect is. Stel dat we minstens 40 punten verschil op een bepaalde behandeling willen behalen, en de standaarddeviatie van deze test al weten (100), dan is d = 40/100 = .40.
    3. Een laatste redmiddel is het zelf kiezen van d aan de hand van Cohen’s richtlijnen.

    Tabel 11

     

     

    Effectgrootte

    D

    Percentage overlap

    Klein

    .20

    .92

    Medium

    .50

    .80

    Groot

    .80

    .69

    Het percentage overlap geeft aan hoeveel de twee distributies (H0 en H­1) overlappen en dus ook een maat voor het geproduceerde verschil door de behandeling.

    Effectgrootte en n samennemen

    Omdat power beïnvloed wordt door n, moet die in de formule worden ingevoegd. De statistiek δ (Griekse letter delta) representeert deze combinatie van d en n, en afhankelijk van de test die we willen doen, zal de formule anders zijn.

    Hoe wordt de power berekent bij een één steekproef t-test?

    Bij een t-test in een enkele steekproef is de formule:

    \[\delta=d\sqrt{n}\]

    Stel dat we een intelligentieonderzoek doen bij 25 cliënten met psychische problemen, en we willen weten wat de power is voor het vinden van tenminste vijf punten verschil tussen de algemene populatie en deze groep. We weten dat μ0 = 100, σ = 15 en μ1 = 105.

    • d = (105-100)/15 = 0.33
    • δ = 0.33√25= 1.65

    Deze waarde van de power is vervolgens in de Appendix Power op te zoeken, afhankelijk van of de onderzoeker een- of tweezijdig test en afhankelijk van de α. Bij een tweezijdige test met α = .05 ligt de bijbehorende power tussen .36 en .40. Dit betekent dat als H0 onjuist is en μ1 echt 105 is, de onderzoeker slechts in 38% van de tijd een statistisch significant verschil zal vinden tussen haar steekproefgemiddelde en de populatie. In 62% van de gevallen is er dus sprake van een type II fout.

    De onderzoeker zal hier niet blij mee zijn, en wil de power vergroten. Dit kan door α te verhogen naar .10, maar een betere optie is om de steekproef te vergroten. Voor een power van .80 moet δ = 2.80 zijn.

    • n = (δ/d)2 = (2,80/0,33)2 = 71.91.

    Voor een power van .80 moeten er dus 72 cliënten in de steekproef worden opgenomen. We settelen voor een power van .80, omdat de steekproefgrootte te groot wordt voor hogere power. Dit is niet vaak niet haalbaar voor de middelen van de onderzoeker.

    Noncentraliteit parameters

    δ is een noncentraliteit parameter. t is verdeeld rond nul onafhankelijk of de nulhypothese waar is, zolang μ het ware gemiddelde van de verdeling is. Als H0:μ = μ0 waar is, zal:

    \[t=\frac{\bar{X}-\mu_0}{\frac{s}{\sqrt{n}}}\]

    rond nul verdeeld zijn, maar als H0 onjuist is en μ ≠ μ0, dan zal t niet rond nul verdeeld zijn. Dan zal de t verdeling gecentreerd zijn rondom:

    \[\delta=\frac{\mu_1-\mu_0}{\sigma\sqrt{n}}\]

    Deze wisseling van gemiddelde van de distributie heet mate van noncentraliteit.

    Als we op zoek gaan naar power, kijken we naar de kans dat de waarde van de noncentrale distributie groter is dan de kritieke waarde van t onder H0. β staat gelijk aan de waarden tussen ± t.025.

    Hoe wordt de power berekent voor verschillen tussen twee onafhankelijke gemiddelden?

    Wanneer we het verschil tussen twee onafhankelijke gemiddelden willen onderzoeken, lijkt de powertest sterk op die voor slechts één gemiddelde. Nu staat in de teller het verschil tussen de gemiddelden voor H1 en voor H0, maar omdat bij de nulhypothese μ1= μ2 = 0, kunnen we die weglaten uit de formule.

    \[d=\frac{(\mu_1-\mu_2)}{\sigma}\]

    Gelijke steekproefgroottes

    Bij twee onafhankelijke gemiddelden, en evenveel participanten per steekproef is de bijbehorende formule voor δ: δ = d √n/2 waarbij n het aantal participanten in één van de steekproeven is (bijv. 25 per sample).

    Voor een power van .80 is dus te berekenen hoeveel participanten er moeten zijn. Uit Appendix Power is af te lezen dat δ = 2,80 moet zijn.

    • n = 2(δ/d)2. Dus 2(2,80/0,50)2 = 62,72

    Ongelijke steekproefgroottes

    In het geval dat er ongelijke aantallen in elke steekproef zitten (wat vaak zal zijn), moeten we een aanpassing doen in de formule. Bij vrijwel gelijke steekproeven die een redelijk groot aantal participanten hebben, kan ervoor gekozen worden de kleinere n te nemen als uitgangspunt. Een andere procedure is het wegen van de steekproefgroottes en daar een gewogen gemiddelde uit te nemen. Dit is het harmonisch gemiddelde (Xn) van een k aantal steekproeven:

    \[X_n=\frac{k}{\sum(\frac{1}{X_i})}\]

    Dus bij 2 steekproefgroottes (n1 en n2):

    \[\bar{n_n}=\frac{2}{(\frac{1}{n_1}+\frac{1}{n_2})}=\frac{2n_1n_2}{(n_1+n_2)}\]

    In de berekening van δ wordt dan gebruik gemaakt van \[\bar{n_n}\]. Dit wordt de effectieve steekproefgrootte genoemd.

    Hoe wordt de power berekent bij gepaarde t test?

    Het berekenen van power is lastiger bij twee gepaarde steekproeven. Een extra parameter wordt hier toegevoegd. In een gepaarde t test is de formule voor d:

    \[d=\frac{(\mu_1-\mu_2)}{\sigma_{X_1-X_2}}\]

    Het probleem is, dat σx1-x2 de standaarddeviatie is van de verschilscores van de twee populaties. Deze kunnen we wel uitrekenen, met ρ (rho); de correlatie tussen X1 en X2. De variantie som wet geeft de volgende formule:

    \[\sigma_{X_1\pm{X_2}}=\sigma^2_{X_1}+\sigma^2_{X_2}\pm2\rho\sigma_{X_1}\sigma_{X_2}\]

    Met de assumptie homogeniteit van variantie (σ2X1 = σ2X2 = σ2) geldt:

    \[\sigma^2_{X_1-X_2}=2\sigma^2-2\rho\sigma^2=2\sigma^2(1-\rho)\]

    \[\sigma_{X_1-X_2}=\sigma\sqrt{2(1-\rho)}\]

    Bij herhaalde metingen geldt weer de formule van power van de enkele steekproef: δ = d√n. Als ρ vermindert, neemt ook de power af. Met ρ = 0 zijn de gepaarde steekproeven eigenlijk onafhankelijk. In deze situatie is het gepaarde steekproef ontwerp echter nog steeds krachtiger dan het ontwerp voor onafhankelijke groepen.

    De ‘p’-waarde voor statistische significantie vertelt niet altijd genoeg. Een betrouwbaarheidsinterval kan over veel extra informatie beschikken.

    Wat is retrospectieve power?

    De voorgaande berekeningen gaven een a priori power schatting: de power die we berekenen voordat het experiment uitgevoerd is, op basis van schattingen van de populatieparameters voor gemiddelde, correlatie, variantie etc. De laatste jaren is de post hoc of retrospectieve power belangrijker geworden: power die wordt uitgerekend na het experiment, op basis van de resultaten. Een van de redenen waarom deze wordt berekend, is om de ontwerpen van toekomstig onderzoek te verbeteren. Daarnaast kan het worden gebruikt om studies te evalueren (zoals bij een meta-analyse).

    Access: 
    Public
    Hoe wordt de relatie tussen variabelen berekend? - Chapter 9

    Hoe wordt de relatie tussen variabelen berekend? - Chapter 9

    De voorgaande hoofdstukken gingen over de verschillen tussen steekproefgemiddelden. Dit hoofdstuk begint met onderzoek naar relaties tussen variabelen. Het verschil is dat er bij verschillen tussen gemiddelden vaak maar weinig kwantitatieve of kwalitatieve niveaus van de onafhankelijke variabele gebruikt worden, terwijl bij relaties tussen variabelen er meestal veel kwantitatieve niveaus zijn. Vaak gaat het hierbij om het aantonen dat de afhankelijke variabele een bepaalde functie is van de onafhankelijke variabele.

    Correlatie en regressie zijn twee onderwerpen die sterk verweven zijn, maar toch anders zijn. Bij simpele correlatie en regressie kijken we naar N participanten die voor twee variabelen geobserveerd of getest zijn. Stel dat we kijken naar rensnelheid van een muis in een doolhof (Y). Dit is een willekeurige variabele waarover we geen controle hebben. Wanneer we de relatie van Y bekijken met het aantal keer dat de rat op een knopje drukt voordat het uiteindelijk lukt (X), hebben we twee willekeurige, niet te beïnvloeden variabelen. In dat geval gebruiken we de term correlatie. Beide variabelen zullen variëren per experiment (het zijn random variabelen) en hebben een steekproef error.

    In het geval waar X een van tevoren bepaalde variabele is, gespecificeerd door de onderzoeker (bijvoorbeeld: het aantal voedselkorrels dat de rat krijgt per goed gelukte poging), spreken we van regressie.

    Dit onderscheid gaat niet altijd op. Soms is regressie het doel als beide variabelen random zijn. Een ander verschil tussen correlatie en regressie is, dat wanneer we Y willen voorspellen op basis van X, we spreken van regressie. Maar, als we alleen de relatie tussen twee variabelen willen weergeven (zonder enige invloed te hebben), spreken we van correlatie.

    Waarvoor wordt een scatterplot gebruikt?

    Een handige manier om de relatie tussen twee variabelen te onderzoeken is met een scatterplot. Elke proefpersoon wordt daarbij weergegeven door een stip met coördinaten, die de waarden op variabelen X en Y aangeven.

    Normaliter staat de voorspellende variabele op de X-as en de criterium variabele op de Y-as. De criterium variabele wordt voorspeld vanuit de voorspellende variabele. Als het echter om een correlatiecoëfficiënt gaat, is het niet altijd duidelijk welke variabele X en welke variabele Y is. In dit geval maakt het niet uit hoe de variabelen gelabeld worden. In een scatterplot wordt zo goed mogelijk een lijn door de puntenwolk getrokken. Die lijn heet de regressielijn van Y voorspeld door X (oftewel Y op X) en geeft de beste voorspelling van Yi voor een Xi-waarde. Wanneer de regressielijn recht is, heet de relatie tussen de variabelen een lineaire relatie. Is de lijn krom, dan is er sprake van een curvilineaire relatie.

    De mate waarin de punten in de puntenwolk om deze regressielijn liggen is gerelateerd aan de correlatie (r) tussen X en Y. Hoe dichter de punten (de behaalde resultaten) bij de regressielijn liggen (de voorspelde waarde), hoe hoger de correlatie. Het correlatiecoëfficiënt kan vorm aannemen tussen de -1 en 1, waarbij een perfecte correlatie 1.00 is (en alle punten op de lijn liggen). + of - geeft de richting van de relatie aan en beïnvloedt niet de mate van de relatie.

    Een voorbeeld

    Stel dat we de relatie tussen stress en mentale gezondheid onderzoeken. Dit laatste meten we met een checklist. Ten eerste is het belangrijk te onderzoeken of beide variabelen normaal verdeeld zijn en weinig extreme waarden hebben. Voor een onderzoek naar correlatie moeten beiden wat variantie hebben (anders is het niet mogelijk om verschillen in stress te vergelijken met verschillen in mentale gezondheid).

    Hoe wordt de covariantie berekend?

    De eerste stap voor het berekenen van de correlatie is het berekenen van de covariantie (covxyof sxy), die de mate weergeeft waarin twee variabelen samen variëren.

    \[cov_{xy}=\frac{\sum(X-X)(Y-Y)}{N-1}\]

    Het lijkt erg op de variantie, want als de Y’s vervangen worden door X’en (of de X’en vervangen door Y’s) krijgen we s2x (of s2y). De formule wordt ook wel gegeven door:

    \[\frac{\sum{XY}-\frac{\sum{X}\sum{Y}}{N}}{N-1}\]

    We verwachten een sterk positieve relatie: grotere waarden van X (stress) geven grotere waarden van Y (mentale gezondheid). Dit zal een grote covariantie-waarde geven. Als er sprake geweest was van een sterke negatieve relatie, zou de som van de producten van de afwijkingen van gemiddelden groot en negatief zijn. Als er geen relatie is tussen de variabelen zal de som uitkomen rond de nul. De covariantie van het voorbeeld is 1,336.

    De Pearson product-moment correlatiecoëfficiënt (r)

    Om de correlatiecoëfficiënt te berekenen, moeten we nog rekening houden met de standaarddeviaties van X en Y.

    \[r=\frac{cov_{XY}}{s_Xs_Y}\]

    De correlatie loopt van -1,00 tot 1,00.

    Uit het voorbeeld komt een correlatie van r = .529. Dit betekent niet dat er 53% relatie is tussen stress en symptomen. Het geeft alleen de sterkte van de relatie aan tussen de twee variabelen; hoe dichterbij de ± 1,00, hoe sterker de relatie. De + en - geven de richting van de relatie aan, waarbij een positieve correlatie aangeeft dat als X hoger is, Y ook hoger is.

    Aangepaste r

    De r die net is berekend, is geen goede schatting van de correlatiecoëfficiënt van de populatie (ρ – rho). Zeker bij een klein aantal observaties zal de coëfficiënt r afwijken van ρ. Om hiervoor te corrigeren, berekenen we de aangepaste correlatiecoëfficiënt raang:

    \[r_{aang}:\sqrt{1-\frac{(1-r^2)(N-1)}{N-2}}\]

    Voor het voorbeeld geldt een aangepaste r van .522. Dit ligt niet ver af van de Pearson correlatie r (.529). Wanneer de steekproef vrij groot is, zal r weinig afwijken van raang.

    Wat laat een regressielijn zien?

    De positieve relatie die werd aangetoond met r = .529, is ook af te leiden met de regressielijn. Een positieve relatie zal een stijgende lijn laten zien. De formule voor de regressielijn is die voor een rechte lijn:

    \[\hat{Y}=bX+a\]

    • Ŷ = de voorspelde waarde van Y
    • b = de helling van de regressielijn (hoeveel Ŷ verandert bij een één-eenheid-verschil in X)
    • a = het snijpunt (de waarde van Ŷ waar X=0)
    • X = de waarde van de voorspellende variabele

    De regressielijn moet die lijn worden, die het best over de puntenwolk past: de lijn waar alle puntscores zo dicht mogelijk bij liggen. Om die lijn te vinden, moeten we a en b weten. We moeten hierbij gebruik maken van de errors van voorspelling, namelijk de (Y-Ŷ) afwijkingen. Dit wordt ook het residu genoemd. De lijn die deze errors minimaliseert, is de lijn die we zoeken. Deze som van errors kunnen we echter niet minimaliseren, dus doen we dat met de som van gekwadrateerde errors, ∑(Y -Ŷ). De normale vergelijkingen voor a en b zijn.

    \[a=\hat{Y}-\bar{X}\]

    \[b=\frac{cov_{xy}}{s^2_x}\]

    Om de regressielijn te trekken kunnen twee X-waarden getekend worden, met bijbehorende berekende Ŷ-waarden en deze punten kunnen met een rechte lijn verbonden worden.

    Interpretatie van de regressielijn

    Soms is alleen de regressievergelijking al informatief, zoals in het voorspellen van een score op het examen gebaseerd op eerdere resultaten. Meestal willen we echter geen individuele voorspellingen weten, maar algemenere principes achterhalen. Daar is de regressielijn ook nuttig bij.

    Snijpunt

    Het snijpunt is het punt van Ŷ waar X = 0. Dit kan een nuttige betekenis hebben, maar alleen als de variabele X daadwerkelijk betekenisvol is. Stel dat we kijken naar de relatie tussen eigenwaarde (Y) en gewichtsverlies (X), dan kunnen we uit het snijpunt afleiden hoeveel eigenwaarde een persoon heeft die geen gewicht heeft verloren. Maar, als X het gewicht zelf weergeeft, is het onzin te kijken naar eigenwaarde van iemand die 0 kilo weegt. In dat geval is het zinnig om de data te centreren: van elke waarde van X trek je het gemiddelde van X af. Hierdoor representeert X = 0 het gemiddelde X, en het snijpunt geeft dan de waarde van Y bij X is het gemiddelde. Dit centreren heeft geen effect op de helling of correlatiecoëfficiënt.

    Gestandaardiseerde regressie coëfficiënten

    Wanneer de data gestandaardiseerd wordt geeft een verschil van één eenheid in X een verschil van één standaarddeviatie weer. Als de helling bijv. 0,75 is (voor gestandaardiseerde data) zal voor elke standaarddeviatie toename in X, Ŷ drie kwart standaarddeviaties toenemen. De helling bij gestandaardiseerde data wordt gestandaardiseerde regressie coëfficiënt of β genoemd.

    Bij gestandaardiseerde data geldt sx = sy = s2x = 1, waarbij de helling en correlatiecoëfficiënt gelijk zijn. Een correlatie van r = .80 geeft dus aan dat één standaarddeviatie verhoging van X is geassocieerd met achttienden standaarddeviatie verhoging van Y. Er wordt echter nooit gesproken van oorzaak en gevolg. Het is een correlationeel verband.

    Welke andere lijnen zijn belangrijk?

    Een rechte lijn is niet altijd de beste manier om data te beschrijven. In sommige situaties is een kromme lijn beter. Hier zijn verschillende manieren voor die vallen onder scatterplot smoothers. Voorbeelden zijn splines en loess. Om tot de lijn te komen worden de Y waarden dichtbij de doelwaarde van de voorspeller gemiddeld. Soms geven deze lijnen een beter overzicht van de relatie tussen de variabelen.

    Hoe accuraat is de voorspelling?

    Standaarddeviatie als errormeting

    De beste voorspelling voor een individueel geval is het gemiddelde en voor de error de standaarddeviatie van Y.

    \[s_Y=\sqrt{\frac{\sum{(Y-\bar{Y})^2}}{N-1}}\]

    De teller van de breuk is de sum of squares van Y (SSY). De noemer is het aantal vrijheidsgraden.

    \[s^2_Y=\frac{SS_Y}{df}\]

    Schatting van standaardfout

    Wanneer we de relevante X-waarde en de regressievergelijking hebben, is de beste voorspelling voor een individu met Ŷ. De standaardfout is gegeven door de volgende formule:

    \[S_{Y\times{X}}=\sqrt{\frac{\sum{(Y-\hat{Y})^2}}{N-2}}\]

    De teller van deze breuk geeft de SSresidu, namelijk de variabiliteit na het voorspellen van Y uit X. SY∙X is de schatting van de standaardfout. Het kwadraat is de residuele variantie of errorvariantie.

    De set Y’s die overeenkomen met een bepaalde X-waarde heet de conditionele verdeling van Y. Bij bovenstaande formule zou je voor elke observatie van Y de berekening moeten uitvoeren en dit bij elkaar optellen. Dit is onnodig veel werk, een veel snellere procedure maakt gebruik van de correlatie r2.

    \[S_{Y\times{X}}=s_Y\sqrt{(1-r^2)\frac{N-1}{N-2}}\]

    Bij grote steekproeven is (N-1)/(N-2) ongeveer 1, waardoor sY∙X geschreven kan worden als:

    \[\sqrt{1-r^2}\]

    Uit deze formules is af te leiden dat als r toeneemt, de standaardschattingsfout afneemt. Daarom moet er altijd voorzichtigheid zijn bij het interpreteren van voorspellingen. Daarnaast geldt SSresidu = SSY(1-r2).

    r² als maat voor variabiliteit

    SSresidu kan ook op een andere manier worden weergegeven:

    \[SS_Y-SS_Y(r^2)\]

    Een andere formule voor r2 is:

    \[\frac{(SS_Y-SS_{residu})}{SS_Y}=\frac{SS_{\hat{Y}}}{SS_Y}\]

    Stel dat we geïnteresseerd zijn in de relatie tussen rookgedrag (X) en leeftijd van overlijden (Y). Mensen sterven niet allemaal op hetzelfde moment, dus er is variatie in variabele Y, ongeacht het rookgedrag. Dit is de SSy. Sommige mensen roken meer dan anderen, ongeacht leeftijd van overlijden. Dit is de SSx. Het onderzoek toont aan dat rokers eerder overlijden dan niet-rokers, waar we een regressielijn van kunnen maken. Door die lijn kunnen we ook voorspellen hoe lang iemand te leven heeft (of voorspelde levensverwachting). Dit wordt vastgelegd in:

    \[SS_{\hat{Y}}=\sum(\hat{Y}-Y)^2\]

    De variabiliteit in Y verklaard door de variabiliteit in X. De laatste bron van variabiliteit in scores is die variantie in Y die we niet kunnen verklaren door X, en heet SSresidu.

    Stel dat alle niet-rokers bij een leeftijd van 70 jaar overlijden, en alle rokers, terwijl ze allemaal evenveel roken, op 65 jaar. Alle variatie in levensverwachting is te voorspellen vanuit de variatie in rookgedrag, dus geldt:

    \[SS_{\hat{Y}}=SS_Y\]

    en SSresidu = 0. In alledaagse situaties is er altijd wat variatie die niet te voorspellen is door X. Wat we willen is specificeren welk percentage van de variatie in levensverwachting wel door X te voorspellen is, en daarvoor kunnen we r2 gebruiken.

    Stel dat we vinden dat de correlatie tussen roken en levensverwachting .80 is, dan is dus .802 = 64% van de variatie in levensverwachting te voorspellen door rookgedrag. Het geeft geen oorzaak-gevolg relatie aan. r2 is makkelijker te interpreteren dan r, omdat het aangeeft hoeveel variabiliteit verklaard wordt door de variabiliteit in een andere meting. r2 is de proportionele reductie in error. Als X niet gebruikt wordt op Y te voorspellen is de error SSY.

    Soms wordt de proportionele verbetering in voorspelling (PIP) gebruikt:

    \[1-\sqrt{(1-r^2)}\]

    Het is de vermindering in geschatte standaardfout bij grote steekproeven en de reductie in breedte van het betrouwbaarheidsinterval. Het meet error in standaarddeviatie eenheden, terwijl r2 error meet in sums of squares.

    Welke assumpties moeten gedaan worden voor regressie en correlatie?

    Ten eerste moet er sprake zijn van homogeniteit van varianties. Dit houdt in, dat de variantie van Y bij elke waarde van X even groot is (in de populatie). Dit is belangrijk wanneer we voor significantie testen met s2Y∙X. Daarnaast moeten de waarden van Y overeenkomend met de bijbehorende X-waarden normaal verdeeld zijn rondom Ŷ. Wanneer we op zoek zijn naar de steekproefcorrelatie, vervangen we de regressie model assumpties met de assumptie dat we een steekproef trekken van een bivariate normaalverdeling. De conditionele verdelingen in deze verdeling zijn de verdelingen van Y en X gegeven een specifieke waarde van X of Y. Wanneer we kijken naar alle Y-waarden, onafhankelijk van X, spreken we van de marginale verdeling van Y. Als laatste gaan we er vanuit dat de relatie tussen X en Y lineair is.

    Betrouwbaarheidsintervallen

    Stel dat we een toekomstige participant onderzoeken op stressniveau, en dan zijn of haar symptomen willen voorspellen. Dan hebben we een voorspellingsinterval nodig, die zowel de variantie van Y, voorspeld door X, moet omvatten en de variantie van observaties. De standaardfout wordt gegeven door:

    \[s'_{Y\times X}=s_{Y\times X}\sqrt{1+\frac{1}{N}+\frac{(X_i-\bar{X})^2}{(N-1)s^2_X}}\]

    De teller van de breuk geeft de afwijking van de individuele score van het gemiddelde van X weer. De formule voor het voorspellingsinterval wordt dan:

    \[CI(Y)=\hat{Y}\pm(t_{\frac{a}{2}})(s' _{Y\times X})\]

    Dit interval is het smalst voor waarden van X dichtbij X̄, maar wordt breder als I X - X̄ I vergroot.

    De standaardfout voor een betrouwbaarheidsinterval van gemiddelde Y voor een specifieke waarde van X is:

    \[s"_{Y\times X}=s_{Y\times X}\sqrt{\frac{1}{N}+\frac{(X_i-\bar{X})^2}{(N-1)s^2_X}}\]

    en dit geeft een betrouwbaarheidsinterval van:

    \[CI(Y)=\hat{Y}\pm(t_{\frac{a}{2}})(s" _{Y\times X})\]

    In SPSS kan je zowel het voorspellingsinterval als betrouwbaarheidsinterval krijgen door Save/Prediction Intervals - Mean and Individual.

    Welke hypothesetesten worden gebruikt?

    De significantie van r

    Bij het hypothesetesten bij correlaties, wordt meestal de nulhypothese getest dat de correlatie tussen X en Y in de populatie, oftewel ρ, nul is. Het verwerpen van de nulhypothese betekent, dat er een correlatie is en dus een bepaalde lineaire relatie. Dit wordt bepaald met een t-toets:

    \[t=\frac{r\sqrt{N-2}}{\sqrt{1-r^2}}\]

    • met vrijheidsgraden N-2.

    Veel onderzoekers rekenen in plaats van een t statistiek de F statistiek uit. Dit is simpelweg de t waarde in het kwadraat.

    De significantie van b

    Wanneer X en Y correleren, en er een lineaire relatie is, dan zal de helling van de regressielijn niet gelijk zijn aan nul en b een bepaalde waarde anders dan nul hebben. Dit is het geval bij één voorspellende variabele, maar wanneer er meerdere voorspellende variabelen zijn, hoeft de helling niet voor elk van deze variabelen significant te zijn.

    b* is het parametrische equivalent van b, namelijk de helling als we X en Y metingen op de hele populatie hadden.

    De standaardfout is:

    \[s_b=\frac{s_{Y\times X}}{s_x\sqrt{N-1}}\]

    Om te testen dat de populatiehelling nul is, gebruiken we de volgende formule voor t:

    \[t=\frac{b-b*}{s_b}=\frac{b}{\frac{s_{Y\times X}}{s_X\sqrt{N-1}}}=bs_x\sqrt{N-1}\]

    • met N-2 vrijheidsgraden.

    Het betrouwbaarheidsinterval van b* is:

    \[CI(b*)=b\pm(t_{\frac{a}{2}})(\frac{s_{Y\times X}}{s_X\sqrt{N-1}})\]

    Verschil tussen twee onafhankelijke b’s

    Het kan zijn dat je bij een onderzoek twee onderzoeksgroepen hebt met beide een andere helling. Met de volgende manier kan je testen of dit verschil in helling significant is.

    H0 = b*1 = b*2 en de steekproefverdeling van b1 - b2 is normaal met een gemiddelde van nul en standaardfout van:

    \[s_{b_1-b_2}=\sqrt{s^2_{b_1}+s^2_{b_2}}\]

    met:

    \[t=\frac{(b_1-b_2)}{s^2_{b_1}+s^2_{b_2}}\]

    met N1 + N2 - 4 vrijheidsgraden.

    De standaardfout van b is in de vorige alinea behandeld en maakt de formule dus tot:

    \[s_{b_1-b_2}=\sqrt{\frac{s^2_{Y\times{X_1}}}{s^2_{X_1}(N_1-1)}+\frac{s^2_{Y\times{X_2}}}{s^2_{X_2}(N_2-1)}}\]

    Wanneer we uitgaan van homogeniteit van error varianties kunnen we de twee schattingen samennemen, gewogen naar vrijheidsgraden:

    \[s^2_{Y\times X}=\frac{((N_1-2)s^2\times{Y\times{X_1}}+(N_2-2)s^2_{Y\times{X_2}})}{(N_1+N_2-4)}\]

    Het verschil tussen twee onafhankelijke rs testen

    Stel dat we twee onafhankelijke steekproeven hebben en de correlaties van beide steekproeven willen vergelijken. Als de correlaties van de bijbehorende populaties niet gelijk zijn aan nul (ρ ≠ 0), dan zullen de rs niet normaal verdeeld zijn en kunnen we geen t test uitvoeren. We moeten de correlaties eerst omvormen tot r’ (r accent):

    • r’ = (0,5)loge |(1+r)/(1-r)|

    r’ is wel normaal verdeeld rond ρ’ met standaardfout:

    \[s_{r'}=\frac{1}{\sqrt{N-3}}\]

    Hierna rekenen we de bijbehorende z-waarde uit:

    \[z=\frac{(r'_1-r'_2)}{\sqrt{\frac{1}{N_1-3}+\frac{1}{N_2-3}}}\]

    Wanneer de gevonden z waarde de kritieke waarde overschrijdt, verwerpen we de nulhypothese. De conclusie is daarbij, dat de correlaties van beide steekproefgroepen niet gelijk zijn.

    Testen dat ρ gelijk is aan een bepaalde waarde

    Om uit te rekenen of ρ gelijk is aan een bepaalde waarde, wordt de standaardfout:

    \[\frac{1}{\sqrt{N-3}}\]

    gebruikt met:

    \[z=\frac{(r'-\rho')}{\sqrt{\frac{1}{N-3}}}\]

    Hiernaast kan ook het betrouwbaarheidsinterval bepaald worden:

    \[CI(\rho')=r'\pm z_{\frac{a}{2}}\sqrt{\frac{1}{N-3}}\]

    Welke factoren beïnvloeden correlatie?

    Range beperkingen

    Sommige studies beperken de correlatie tussen X en Y. De scatterplot die van deze ‘beperkte’ waarden wordt gemaakt, zal nooit een perfecte weergave zijn van de eigenlijk behaalde scores. De daarover berekende correlatie zal dan ook afwijken. Meestal wordt r door het beperken van de range verkleind. Het kan echter vergroot worden als door de range beperkingen een curvilineaire relatie verdwijnt.

    Heterogene subsamples

    Soms worden in een steekproef verschillende variabelen samengenomen, zoals mannen en vrouwen, terwijl die ongelijk scoren op de afhankelijke variabele. Bijvoorbeeld bij het onderzoeken van lengte x gewicht. Mannen zijn over het algemeen langer en zwaarder dan vrouwen. De relatie tussen lengte en gewicht kan dus beïnvloed worden door het samennemen van beide geslachten, waardoor de gehele correlatie af kan wijken van de correlaties voor de geslachten apart.

    Hoe bereken je de power voor r?

    Om power te berekenen, moeten we eerst d (de effectgrootte) weten:

    • d = ρ1 – ρ0 = ρ1 – 0 = ρ1. ρ1 is de correlatie in de populatie gedefinieerd door H1.

    Daarna kunnen we δ berekenen met:

    \[\delta=d\sqrt{N-1}=\rho_1\sqrt{N-1}\]

    en de δ waarde zoeken we op in de Appendix Power.

    Access: 
    Public
    Welke andere correlatietechnieken zijn er? - Chapter 10

    Welke andere correlatietechnieken zijn er? - Chapter 10

    De Pearson correlatiecoëfficiënt r wordt gebruikt bij lineaire relaties tussen twee variabelen, waarbij die variabelen continu zijn. Daarnaast zijn er assumpties van normaliteit en homogeniteit van variantie. Bij andere soorten data is een andere vorm van r nodig. Waar alle testen van correlatie in gelijk zijn, is dat ze proberen de relatie tussen twee variabelen te meten. Er is altijd een bepaalde volgorde in de variabelen, zodanig dat een hogere score meer van die variabele representeert.

    In sommige gevallen is er wel een relatie tussen variabelen, die echter geen bepaalde volgorde aanneemt. Stel dat we mensen indelen op basis van hun politieke partij, en dan de relatie tussen partij en bepaalde overtuigingen onderzoeken. Er zal misschien een associatie zijn, maar er is geen volgorde of orde in deze associatie. In dat geval meten we niet de correlatie, maar de associatie.

    We berekenen een correlatiecoëfficiënt om een schatting te maken van de correlatie in de populatie. Daarnaast wordt het vaak gebruik in berekeningen van andere statistieken. Als de correlatiecoëfficiënt gekwadrateerd wordt geeft dit aan hoeveel variatie in een variabele verklaard wordt door de variatie in een andere variabele. Dit geeft een effectgrootte weer.

    Waarvoor wordt punt-biseriële correlatie gebruikt?

    Punt-biseriële correlatie (rpb)

    In het geval van een dichotome variabele, een variabele met twee niveaus (sekse, slagen/falen, experiment/controle), is dezelfde formule te gebruiken als voor de normale Pearson r. Deze variabelen zijn niet continu van aard, en een normale verdeling is daarom niet geschikt. Dit creëert vooral problemen voor het schatten van de populatie variabele ρ. Hoe dit op te lossen is, komt later. De standaard Pearson coëfficiënt is gewoon uit te rekenen en heet in dit geval de punt-biseriële coëfficiënt (rpb). Hierbij is er dus één variabele dichotoom en één ongeveer continue en ongeveer normaal verdeeld.

    Voor het berekenen van rpb moet elk niveau van de dichotome variabele een score krijgen, zoals man = 0, vrouw = 1. Hoe deze variabelen worden gecodeerd, maakt niet uit.

    Stel dat we onderzoeken wat het verband is tussen sekse en gewicht. De correlatie (via de normale r formule) is -.58. Het negatief-teken kunnen we negeren, dit betekent alleen dat het gemiddelde gewicht van groep 1 (vrouw) lager is dan dat van groep 0 (man). r2 betekent weer variatie: -.582 = 34% van de variatie in gewicht kan verklaard worden door sekse.

    Bij dichotome variabelen gebeurt er iets interessants met de formule voor de regressielijn. De intercept (a) is de waarde van Y wanneer X = 0. Omdat X = 0 de waarde is voor mannen, is het intercept gelijk aan het gemiddeld gewicht voor mannen. De helling van de regressielijn (b), is de verandering in Y bij een toename in X van één eenheid. X + 1 is de verandering van man naar vrouw, en omdat de regressielijn door de gemiddelden van het gewicht van de mannen en vrouwen snijdt, is deze verandering gelijk aan het verschil in gemiddeld gewicht.

    Relatie tussen rpb en t

    Voor de relatie tussen rpb en t geldt:

    \[r^2_{pb}=\frac{t^2}{(t^2+df)}\]

    De t is hier verkregen uit de t test voor verschil tussen gemiddelden en df = N1 + N2  - 2.

    Door de formule anders te schrijven, is de t test af te leiden om de significantie van r2pbt e testen met een nulhypothese (H0 : ρ = 0).

    \[\frac{r_{pb}\sqrt{N-2}}{\sqrt{1-r^2_{pb}}}\]

    Effectgrootte

    Een laatste stap is het berekenen van de effectgrootte. Hiervoor kan weer de Cohen’s d gebruikt worden.

    \[d=\frac{(\mu_1-\mu_2)}{\sigma}\]

    Er is een directe relatie tussen de gekwadrateerde punt-biseriële correlatiecoëfficiënt en d:

    \[d=\frac{\bar{X_1}-\bar{X_2}}{s_{pooled}}=\sqrt{\frac{df(n_1+n_2)r^2_{pb}}{n_1n_2(1-r^2_{pb})}}\]

    Stel dat we in het voorbeeld een effectgrootte vinden van d = 1.4. De conclusie hierbij is, dat het verschil tussen de gemiddelde gewichten van mannen en vrouwen 1.4 standaarddeviatie is.

    Het betrouwbaarheidsinterval wordt gevonden met de standaardfout van gestandaardiseerde gemiddelde verschillen:

    \[s_d=\sqrt{\frac{d^2}{2(n_1-1)(n_2-1)}+\frac{N}{n_1n_2}}\]

    Met z.025 = 1,96, worden de betrouwbaarheidsgrenzen aangegeven met:

    • d ± sd(z.025) = d ± sd x 1,96

    Waarvoor wordt de phi-coëfficiënt gebruikt?

    De punt-biseriële coëfficiënt wordt gebruikt wanneer een van de twee variabelen dichotoom is. Wanneer beide variabelen dichotoom zijn, zoals bij de relatie tussen sekse en werkstatus (wel of niet werken), gebruiken we de φ (phi) coëfficiënt.

    De φ coëfficiënt is weer gelijk aan Pearson r en kent dezelfde formule. De variabelen moeten hierbij gecodeerd worden naar keuze (bijvoorbeeld beiden met waarden 0 en 1). Om de significantie van φ te testen tegen H0 : ρ = 0 is een chi-kwadraat test nodig met 1 vrijheidsgraad. Hiervoor geldt:

    \[X^2=N\varphi^2\]

    en andersom geldt:

    \[\varphi=\sqrt{\frac{x^2}{N}}\]

    De chi-kwadraat waarde is ook te berekenen met een contingentie tabel. χ² geeft de statistische significantie van een relatie en φ geeft de mate van deze relatie

    Dit heen en weer gaan tussen χ en φ kan belangrijk zijn bij het interpreteren van een resultaat. Stel dat we een φ vinden van .11. De variatie in scores, verklaard door de relatie tussen de twee variabelen, is dan slechts 1.2%. De bijbehorende χ² kan echter wel een groot significant effect geven, wanneer de steekproef groot genoeg is.

    Wat is het verschil tussen biseriële en tetrachorische correlatie?

    Het is niet altijd zo zwart-wit als je bent vrouw of je bent man. Zo zitten er in falen of slagen een soort niveaus; enorm falen, een beetje falen, net slagen, etc. De biseriële correlatie neemt deze normaal verdeelde dichotome variabele mee. Een tetrachorische correlatie is het analoog van phi, met normaliteit voor beide variabelen.

    Welke correlatiecoëfficiënten worden gebruikt bij geordende data?

    Bij sommige experimenten wordt een rangvolgorde aangegeven een objecten of personen, en willen de onderzoekers de relatie weten tussen de twee sets van rangvolgordes (bijvoorbeeld de rangvolgorde in populaire steden vergelijken in 1990 en 2000).

    In andere situaties kunnen rangvolgordes zelf gecreëerd worden, waarbij ruwe scores worden omgezet in rangen. Hierdoor worden uitschieters minder van belang.

    Data rangschikken

    Stel dat we de volgende ruwe data hebben, die we op oplopende volgorde zetten:

    • X : [2, 4, 4, 5, 7, 13, 13, 13, 18]
    • Rang : 1, 2.5, 2.5, 4, 5, 7, 7, 7, 9

    De laagste waarde (2) krijgt rangnummer 1. De volgende twee waarden zijn gelijk (4). Ze zouden normaal rang 2 en 3 krijgen, dus nu krijgen ze de gemiddelde rang (2.5). Voor de volgende twee scores (5 en 7) zijn rang 4 en 5. We hebben dan drie dezelfde waarden (13), die rang 6,7,8 zouden krijgen, maar nu het gemiddelde (7) als rang krijgen.

    Spearman’s correlatie coëfficiënt (rs)

    Bij gerangschikte data gebruiken we Spearman’s correlatiecoëfficiënt voor gerangschikte data (rs), ook wel Spearman’s rho genoemd. Hiervoor bestaat een originele formule, maar over het algemeen wordt dezelfde formule als die voor Pearson r gebruikt.

    rs is lastig te testen op statistische significantie, omdat de data niet normaal verdeeld is. Ook het berekenen van betrouwbaarheidsintervallen is daardoor niet praktisch. De meeste onderzoekers behandelen rs als een normale r en zijn dan voorzichtig met het trekken van conclusies bij grensgevallen.

    Kendall’s Tau (τ)

    Naast rs is Kendall’s tau (τ) te gebruiken bij gerangschikte data. Spearman ziet de rangen als scores en berekent de correlatie tussen de rangen, maar Kendall baseert zijn τ op het aantal omzettingen (inversies) in de rangen. Zie Tabel 12 voor een voorbeeld. Beide variabelen (Alcohol en Tabak) zijn te rangschikken in oplopende volgorde. Bij een perfect ordinale relatie tussen de twee, zijn er geen inversies, maar in dit geval zijn die er wel. De kolom ‘omzettingen’ wordt berekend door naar de tweede variabele te kijken en te tellen hoeveel rangen onder de huidige rang in de tabel lager zijn. Dus, bij rij 1 heeft Tabak rangnummer 4, en onder deze waarde komen drie waarden die lager zijn, dus heeft het drie omzettingen. Bij rij 3 heeft Tabak rangnummer 3, en daaronder is alleen rangnummer 2 lager dus heeft het één omzetting.

    Tabel 12

     

    Land

    Alcohol

    Tabak

    RangA

    RangT

    Omzettingen

    A

    4.00

    5.60

    1

    4

    3

    B

    4.12

    2.71

    2

    1

    0

    C

    4.80

    4.63

    3

    3

    1

    D

    4.98

    3.13

    4

    2

    0

           

    Tau berekenen

    Om τ te berekenen, hebben we eerst het aantal paren scores nodig. Dit is te vinden met de formule N(N-1)/2. In dit geval dus 4(4-1)/2 = 6. Sommige van die paren zijn omzettingen (ook wel disharmonisch : D, genoemd). Het aantal paren dat bestaat uit omzettingen is te vinden door de laatste kolom op te tellen. In dit geval vier omzettingen. Het aantal niet-omgezette paren is het totaal aantal paren min het aantal omzettingen. Dat zijn er hier dus twee.

    \[\tau=1-\frac{2(\text{aantal inversies})}{\text{aantal paren van objecten}}=\frac{2D}{\frac{N(N-1)}{2}}\]

    • waarbij D het aantal inversies is.

    Stel dat uit het onderzoek een τ komt van .35. Hiermee zeggen we dat wanneer de twee variabelen samen random in een steekproef worden getrokken, de kans op eenzelfde rang bij die twee variabelen .35 hoger is dan de kans dat ze in omgekeerde volgorde gerangschikt zijn.

    Significantie van τ

    De verdeling van τ is normaal, wanneer N groter is dan of gelijk is aan tien. Hierdoor kunnen we met de standaardfout τ, de z waarde berekenen.

    \[s_{\tau}=\sqrt{\frac{2(2N+5)}{9N(N-1)}}\]

    en

    \[z=\frac{\tau}{s_{\tau}}\]

    Met de z waarde is op te zoeken of de overschrijdingskans statistisch significant is.

    Voor het betrouwbaarheidsinterval geldt:

    • CI = τ ± 1,96sτ

    Hoe gaat de analyse van geordende data in zijn werk?

    Stel dat we bij onafhankelijke variabelen de relatie willen onderzoeken, maar te maken krijgen met geordende data (ordinale variabelen). Dan is een chi-kwadraat test niet voldoende, omdat deze geen rekening houdt met ordening in de variabelen.

    Als voorbeeld een onderzoek naar de relatie tussen drop-out uit een eetstoornis-behandeling en het aantal traumatische gebeurtenissen dat de patiënten in hun jeugd hebben meegemaakt. Drop-out (het uitvallen uit de behandeling) is een dichotomie en kan gescoord worden als 0 (blijven) en 1 (uitvallen). Voor het aantal traumatische ervaringen krijgt iedere patiënt een score tussen 0 en 4.

    Pearson’s r

    De beste methode om de relatie te onderzoeken, is door de twee variabelen simpelweg te correleren. De correlatie tussen de twee variabelen is .23, met een p van .02. Dit is groter dan de gestelde alfa van .05 dus de correlatie is significant.

    Door middel van deze r kunnen we een Chi-kwadraat-achtige statistiek (M2) berekenen, waarmee we de lineaire relatie tussen de twee variabelen kunnen achterhalen.

    • M2 = (N – 1)r2

    Dit is een chi-kwadraat met één vrijheidsgraad. Vervolgens kunnen we dit lineaire deel van de pearson chi-kwadraat aftrekken om de afwijking van lineairiteit te krijgen. Ook de vrijheidsgraden worden van elkaar afgetrokken. Vervolgens kan bekeken worden of de afwijking van lineairiteit significant is.

    Wanneer wordt Kendall’s coëfficiënt van overeenstemming gebruikt?

    Stel dat zes onderzoekers acht kleuren moeten rangschikken naar ‘meest aangename kleur’. Wanneer alle onderzoekers de kleuren op dezelfde manier rangschikken (dus kleur A krijgt van iedereen rang 1), dan zouden de opgetelde rangen per kleur sterk verschillen (kleur A krijgt dan 6 punten, kleur B bijvoorbeeld 12, etc.). Wanneer er weinig overeenkomst is tussen de onderzoekers, dan heeft elke kleur een aantal hogere en lagere rangen en zal het rangtotaal per kleur grofweg gelijk zijn.

    Kendall maakt gebruik van dit rangtotaal en stelt dat bij random gedrag, of weinig overeenkomst, tussen onderzoekers, de variatie in rangtotalen laag is. Deze ratio aan variatie noemde hij W.

    W = variantie van kolomtotalen / maximaal mogelijke variantie van kolomtotalen.

    \[W=\frac{12\sum{T^2_j}}{k^2N(N^2-1)}-\frac{3(N+1)}{(N-1)}\]

    • waarbij Tj de kolomtotalen aangeeft, N het aantal items die geordend moet worden en k het aantal onderzoekers, waarbij de noemer de maximaal mogelijke variantie is.

    W is geen standaard correlatiecoëfficiënt, maar is wel om te rekenen tot een rs.: rs = (kW - 1) / (k-1).

    Bij k > 7 kan de nulhypothese dat er geen overeenstemming is tussen de onderzoekers getest worden met: χ²(N-1) = k(N-1)W met N-1 vrijheidsgraden.

    Access: 
    Public
    Hoe werkt de analyse van variantie? - Chapter 11

    Hoe werkt de analyse van variantie? - Chapter 11

    In dit hoofdstuk wordt ingegaan op de variantieanalyse, als procedure voor het testen van verschillen tussen twee of meer gemiddelden.

    De analyse van variantie (ANOVA) is al lange tijd de meest gebruikte statistische test in psychologisch onderzoek. Het stelt ons namelijk in staat om, zoals de t test, verschillen tussen steekproefgemiddelden te onderzoeken, maar dan voor een k aantal gemiddelden. Ook kan de ANOVA het effect van twee of meer onafhankelijke variabelen, inclusief het interactie-effect, op een afhankelijke variabele onderzoeken.

    Een voorbeeld

    Stel dat we onderzoeken in hoeverre agressie toeneemt bij mensen die gedronken hebben, bij minder of meer afleiding van die agressie. Hiervoor laten we vijf groepen mensen, die evenveel gedronken hebben, een taak uitvoeren die steeds moeilijker is per groep.

    Wat is de ANOVA?

    In dit hoofdstuk wordt de one-way ANOVA nader uitgelegd. Dit is de variantieanalyse voor één onafhankelijke (one way) variabele.

    Stel dat we een gok willen doen over de individuele score van iemand in een experiment. In dat experiment zijn meerdere groepen proefpersonen. De beste gok is het populatiegemiddelde. Een andere manier om achter die score te komen, is het gemiddelde van de groep waar de persoon in hoort, uit te rekenen.

    • Xij = µ + τj, waarbij τj voor het verschil tussen het groepsgemiddelde en het grote gemiddelde staat.

    Zijn score zal echter enigszins afwijken van dat groepsgemiddelde, wat we uitdrukken in ε (van ‘error’). Dit leidt tot de volgende formule:

    • X = μ + τj + εij, waarbij εij het verschil tussen de individuele score en het groepsgemiddelde weergeeft. Dit is het structurele model van variantie analyse.

    Welke assumpties moeten gedaan worden voor de ANOVA?

    Voor het uitvoeren van een ANOVA geldt een aantal voorwaarden of aannames.

    Homogeniteit van variantie

    Ten eerste stelt de ANOVA dat van elke populatie (in ons geval van elke groep in het onderzoek) de variantie gelijk is. σ21 = σ22 = σ23, etc. Deze voorwaarde wordt homogeniteit van variantie genoemd, of homoscedasticiteit. σ2e staat voor error variantie, de variantie die niet gerelateerd is aan behandelingsverschillen.

    In veel gevallen is deze voorwaarde niet heel belangrijk. De ANOVA kan dan nog steeds uitgevoerd worden, hoewel de resultaten voorzichtiger moeten worden bekeken. Soms kan heterogeniteit van variantie wel voor problemen zorgen.

    Normaalverdeling

    De tweede aanname is, dat bij elke conditie of steekproefgroep de scores normaal verdeeld zijn. Omdat afwijking van het gemiddelde ook wel error wordt genoemd, heet deze voorwaarde ook weleens ‘de normale verdeling van error’. Kleine afwijkingen van normaliteit zorgen vaak niet voor problemen.

    Onafhankelijkheid

    De derde aanname is dat de observaties of scores onafhankelijk zijn van elkaar. Dit wil zeggen dat als we één observatie weten, dat dit niets zegt over een andere observatie. Dit kan misgaan wanneer de proefpersonen niet random worden toegewezen aan een groep.

    De nulhypothese

    De nulhypothese bij het voorbeeld onderzoek, is dat de verschillen in groepsgemiddelden tussen de verschillende niveaus van afleiding zeer klein zijn. De notatie hiervoor is:

    • H0 : μ1 = μ2 = μ3… etc.

    Wat is er belangrijk bij mean squares?

    Door de assumpties normaliteit en homogeniteit van varianties, kunnen de verdelingen alleen verschillen in hun gemiddelden. Voor het onderzoeken van de nulhypothese moeten we een bepaalde schatting maken van de populatievariantie (σ2e), zonder aan te nemen dat de nulhypothese juist of onjuist is. In het voorbeeldonderzoek zijn vijf groepen te onderscheiden, elk met hun eigen populatievariantie. Hieruit volgt dat de verwachte variantie in de totale populatie gelijk is aan het gemiddelde van die vijf.

    \[\sigma^2_e=s^2_e=s^2_j=\frac{\sum{s^2_j}}{k}\]

    • met als k het aantal ‘behandelingen’ of groepen

    Deze schatting van de populatievariantie heet de MSerror, ook wel MSwithin.

    Naast deze populatievariantie is er de steekproefvariantie, ofwel de variantie die we verkrijgen uit de vijf groepen in de steekproef. Wanneer de nulhypothese waar is, en de steekproeven dus uit dezelfde populatie getrokken zijn, gaan we ervan uit dat de steekproefvariantie gelijk is aan de populatievariantie gedeeld door de steekproefgrootte: de steekproeven zijn dan een goede weerspiegeling van de populatie. Voor deze populatievariantie is de formule:

    \[\frac{\sigma^2_e}{n}=s^{\frac{2}{X}}\]

    of

    \[\sigma^2_e=n^{2^{\frac{2}{X}}}\]

    • waarbij n de grootte van elke steekproef is.

    Deze schatting van de populatievariantie heet de MSbehandeling.

    We hebben nu twee schattingen van de populatievariantie. Voor MSbehandeling geldt dat deze alleen juist is bij een juiste nulhypothese. Wanneer de twee schattingen dus gelijk zijn, hebben we bewijs voor de juistheid van H0. Zijn ze ongelijk, dan hebben bewijs om H0 te verwerpen. Dit is precies wat de ANOVA doet.

    Variantie schatting

    Het behandelingseffect is het verschil tussen het gemiddelde van de behandeling en het grote gemiddelde. De variantie van de ware populatie gemiddelden geven we weer als θ2τ:

    \[\theta^2_{\tau}=\frac{\sum(\mu_j-\mu)^2}{k-1}=\sum{\tau^2_j}\]

    De verwachte waarde (E) kan geformuleerd worden als:

    • E(MSerror) = σ2e
    • E(MSbehandeling) = σ2e + nθ2τ

    Als H0 juist is, zijn E(MSerror) en E(MSbehandeling) gelijk, omdat θ2τ nul is. Als H0 onjuist is zal E(MSerror) kleiner zijn dan E(MSbehandeling).

    Welke berekeningen zijn van toepassing bij de ANOVA?

    Hoewel bij de ANOVA meestal een computer te pas zal komen, is het toch handig iets te weten van de onderliggende berekeningen.

    Veel van de berekeningen over variantie hebben te maken met sums of squares (SS). Dit is de som van de gekwadrateerde afwijkingen van het gemiddelde:

    \[\frac{\sum(X-\bar{X})^2}{(n-1)}=\frac{\frac{\sum{X^2}-(\sum{X})^2}{n}}{(n-1)}\]

    Hierbij is n-1 het aantal vrijheidsgraden.

    Controleren van voorwaarden

    Een eerste stap bij het berekenen van de ANOVA is het controleren van de voorwaarden. Men moet kijken of de verdelingen normaal verdeeld zijn of bijvoorbeeld scheef of bimodaal. Een belangrijke voorwaarde is die van homogeniteit van variantie. Van elke groep/conditie in het onderzoek moet de variantie bekeken worden. Is er een groot verschil tussen de varianties, dan is de ANOVA nog steeds uit te voeren. Hiervoor geldt dat de totale analyse (dus met alle groepen tegelijk) robuust is tegen schending van de voorwaarde, vooral als elke groep evenveel participanten bevat.

    De analyse

    Wanneer een one-way ANOVA uitgevoerd wordt, zal de uitdraai van computersoftware eruit zien als in Tabel 13.

    Tabel 13

    Bron

    df

    SS

    MS

    F

    Behandelingen

    4

    61.40

    15.35

    6.88*

    Error

    55

    122.50

    2.23

     

    Totaal

    59

    183.90

     

     

    *p < .05

     

     

     

     

    • SStotaal is de sum of squares voor alle observaties: SStotal = ∑(Xij-X)2

    De SSbehandeling in de tabel is de som van de afwijkingen van de groepsgemiddelden van het totale gemiddelde:

    • SSbehandeling = n∑(Xj - Yj)2. SSerror = SStotaal - SSbehandeling.

    Daarbij is SSerror gelijk aan de som van variantie binnen elke groep (variantie die niet is te verklaren door behandeleffecten).

    • Oftewel, SSerror = SSwithin1 + SSwithin2 + etc.

    Voor de vrijheidsgraden (df) kolom gelden de volgende berekeningen:

    • dftotaal = N -1 met N als het aantal proefpersonen
    • dfbehandeling = k – 1 met k als het aantal groepen
    • dferror = dftotaal - dftbehandeling

    De MS kolom geeft de twee schattingen van de populatievariantie σ²e, en daarvoor geldt

    MS = SS/df. MSerror staat voor de populatievariantie, los van het feit of H0waar is of niet. Het is het gemiddelden van de binnengroepsvariantie als de steekproefgroottes gelijk zijn. MSbehandeling is de variantie van gemiddelden vermenigvuldigd met n.

    De laatste kolom geeft de F statistiek. Deze wordt berekend door MSbehandeling/MSerror. Wanneer H0 waar is, zouden MSerror en MSbehandeling min of meer gelijk aan elkaar moeten zijn, en is de ratio ongeveer 1. Wanneer de ratio afwijkt van 1, is dat een bewijs dat H0 onjuist is. Een andere manier om naar de F statistiek te kijken is in een formule met verwachtte waarden: E(MSbehandeling)/E(MSerror) = (σ2e + nθ2τ) / σ2e. De ratio zal 1 zijn als θ2τ is nul, wanneer θ2τ groter is dan nul, zal de ratio groter zijn dan 1.

    Maar hoe groot moet de ratio zijn om de nulhypothese te verwerpen? Hiervoor gebruiken we de F distributie, welke in de F appendix is uitgeschreven (Howell, 2013: p.692). De vrijheidsgraden van teller (MSbehandeling) en noemer (MSerror) zijn respectievelijk k – 1 en k(n-1) – met n het aantal proefpersonen per groep.

    Stel dat F = 6.80 bij 4 en 55 df. De uiteindelijke notatie van de ANOVA is dan: F.05(4,55) = 2.54, dus bij een α = .05 zouden we de nulhypothese verwerpen. De verschillen tussen de behandelgroepen zijn significant. F(4,55) = 6.80, p < .05.

    Conclusies

    Op basis van de gevonden F hebben we de nulhypothese verworpen: de verschillen tussen groepen waren significant. Maar, dit betekent alleen dat tenminste één populatiegemiddelde verschilt van een ander populatiegemiddelde. Welke verschillen is niet duidelijk. Dit komt in het volgende hoofdstuk.

    Hoe voer je de ANOVA uit in SPSS?

    Om de éénweg ANOVA in SPSS uit te voeren, moet men de volgende menu’s volgen: Analyze > Compare Means > One-Way ANOVA. In ‘Options’ kunnen beschrijvende statistieken en gemiddelden plots opgevraagd worden. Een andere optie i.p.v. Compare Means > One-Way ANOVA is ‘General Linear Model > Univariate’.

    In de output geeft de eerste lijn ‘Corrected Model’. Dit geeft het gecombineerde effect van twee of meer onafhankelijke variabelen. Als er dus maar één variabele is, geeft deze lijn dezelfde sum of squares als de behandelingsgroep. ‘Intercept’ is een test van de nulhypothese dat het grote gemiddelde nul is in de populatie. Dit is meestal niet interessant.

    Wat is de procedure bij ongelijke steekproefgroottes?

    Meestal proberen onderzoekers behandelgroepen te creëren met evenveel proefpersonen (een gebalanceerd design). Dit lukt niet altijd. Wanneer de groepen niet even groot zijn, moet de ANOVA aangepast worden. De aanpassing zit in de SSbehandeling. De formule hiervoor is normaal het aantal proefpersonen per groep, maal de som van de gekwadrateerde afwijkingen van het gemiddelde:

    \[SS_{behandeling}=n\sum(\bar{X_j}-\bar{X})^2\]

    Wanneer de n per groep verschilt, moeten we hiervoor corrigeren. We vermenigvuldigen de groepsgrootte met de afwijkingen van het gemiddelde per groep. Hierdoor zal een grotere steekproef meer bijdragen aan de SSbehandeling.

    \[SS_{behandeling}=n\sum(n_j(\bar{X_j}-\bar{X})^2)\]

    Er moet wel rekening gehouden worden met gemiste data. Als deze data random gemist wordt is er geen probleem, maar als er een systematische reden voor is levert dit serieuze problemen op.

    Wat gebeurt er als de voorwaarden geschonden worden?

    De ANOVA is over het algemeen een zeer robuuste test. Dit betekent dat de voorwaarden tot op zekere hoogte geschonden kunnen worden, zonder dat dit grote gevolgen heeft voor de test. Als de populaties redelijk symmetrisch verdeeld zijn, en als de grootste variantie niet meer dan vier keer zo groot is als de kleinste, is de ANOVA nog valide. Als de steekproefgroottes erg veel verschillen is de test minder robuust tegen heterogeniteit van varianties.

    Met ongelijke varianties ligt de ware F-waarde tussen de F met 1 en (n-1) vrijheidsgraden en de F met (k-1) en k(n-1) vrijheidsgraden. Box stelde voor Fobt te vergelijken met Fα(1,n-1). Wanneer dit significant is, zijn de gemiddelden significant anders onafhankelijk van de (on)gelijkheid van varianties. De test is echter extreem conservatief. Een andere methode is de Welch procedure. Deze wordt gebruikt wanneer men heterogene varianties verwacht. Hier zijn verschillende formules voor:

    \[W_k=\frac{n_k}{s^2_k}\]

    \[\bar{X}=\frac{\sum{W^{\bar{X}}_k}}{\sum{W_k}}\]

    \[F"=\frac{\frac{\sum{W_k(\bar{X_k}}-\bar{X})^2}{k-1}}{1+\frac{2(k-2)}{k^2-1}\sum(\frac{1}{n_k-1})(1-\frac{W_k}{\sum{W_k}})^2}\]

    Deze F’’ is verdeeld als F met k-1 en vrijheidsgraden:

    \[df' :\frac{k^2-1}{3\sum(\frac{1}{n_k-1})(1-\frac{W_k}{\sum{W_k}})^2}\]

    Welke soorten transformaties zijn er?

    De Welch methode kan alleen wanneer de steekproeven getrokken zijn uit normaal verdeelde populatie. Wanneer dit niet het geval is kan de data ook getransformeerd worden. Een kanttekening hierbij is wel, dat de conclusies die dan uit het onderzoek komen wellicht niet altijd overeenkomen met wat je wilde aantonen. Transformaties moeten altijd vermeld worden. Standaarddeviaties kunnen niet omgezet worden.

    1. Logaritmische transformaties

    Een transformatie naar logaritmen is praktisch wanneer de standaarddeviatie correleert met het gemiddelde, of wanneer de data sterk positief scheef is. Een logaritme is een macht: afhankelijk van de basis is het een uitdrukking tot welke macht het getal wordt behaald. Dus, log10(25) = 1.398 want 101.398 = 25. In de statistiek wordt vaak de ‘natuurlijke logaritme’ gebruikt, met de basis e = 2.718. loge is ook wel ln. Deze transformaties zullen standaarddeviaties bij grote steekproeven meer reduceren dan standaarddeviaties bij kleine steekproeven.

    Een nadeel van het logaritme is dat deze niet gebruikt kan worden op negatieve of naar 0 neigende ruwe data. In dat geval is het mogelijk om een constante aan alle scores toe te voegen, zodat die allemaal positief worden.

    2. Vierkantswortel transformatie

    Als het gemiddelde correleert met de variantie, gebruiken we een vierkantswortel transformatie, zoals van de vorm Y =√X, Als de X-waarden klein zijn kunnen bijvoorbeeld de volgende formules gebruikt worden:

    • Y = √X +0.5 of Y = √X + √X+1

    Het is echter moeilijk om te weten of de correlatie met de variantie veel groter (of kleiner) is dan de correlatie met de standaarddeviatie. Daarom kunnen ook beide transformaties uitgevoerd worden.

    3. Wederzijdse transformatie

    Deze transformatie is handig bij het verminderen van de invloed van extreme waarden. Hierbij berekenen we een nieuwe X van de vorm 1/X of -1/X. Hierdoor hebben de uitbijters minder effect op de grootte van de standaarddeviatie.

    4. Arcsine transformatie

    Bij een binomiale verdeling, waarbij de variantie afhankelijk is van het gemiddelde hebben de groepen met verschillende gemiddelden verschillende varianties. Dit brengt problemen mee. Een handige transformatie is de arcsine transformatie (sin-1 op rekenmachine):

    • Y = 2 arcsin √p. P is hier de proportie correct.

    Bij een correlatie tussen de variantie en het gemiddelde kan zowel de vierkantswortel als de arcsine transformatie gebruikt worden. Het verschil is dat de vierkantswortel transformatie de scheve staart samendrukt, terwijl de arcsine transformatie beide staarten uitrekt. De arcsine transformatie is nuttiger bij proporties.

    5. Getrimde steekproef

    Naast het transformeren van de ruwe data, is het ook mogelijk om een selectie te maken uit de data om de heterogeniteit van variantie te verminderen. Dit is het trimmen (inkorten) van de data, en is vooral handig wanneer een verdeling ‘zware staarten’ heeft, ofwel veel scores in de staarten. Bij meerdere groepen, trim je elke groep op dezelfde wijze. Het trimmen gebeurt door een bepaald percentage aan beide uiteinden te verwijderen.

    Bij een Winsorized steekproef worden de scores ook getrimd, maar worden de weggehaalde scores vervangen door de dan overblijvende extreemste score. Dus wanneer uitschieters 3 en 7 weg worden gehaald, en de volgende score is een 10, dan worden de 3 en 7 vervangen door twee keer een 10. Als er vier scores verwijderd en vervangen zijn, wordt er gewerkt met N-1-4 vrijheidsgraden.

    Wanneer transformaties gebruiken?

    Transformaties zijn nuttig bij sterk van normaal afwijkende verdelingen en bij heterogene varianties. Daarnaast zijn ze toegestaan om de variantie of vorm aan te passen. Transformaties moeten wel gekozen worden voordat de statistische test uitgevoerd wordt, in plaats van daarna. Transformaties kunnen ook gebruikt worden bij negatief scheve verdelingen, maar dan moet de data eerste vermenigvuldigd worden met -1 en moet er een constante worden toegevoegd of afgetrokken.

    Wat is het verschil tussen fixed en random modellen?

    Bij het onderzoeken van behandelingseffecten, is het soms van belang om te kijken naar het soort model waar mee gewerkt wordt. Bij een fixed-model ANOVA worden de behandelniveaus, of behandelgroepen, zorgvuldig geselecteerd en blijven deze gelijk wanneer het experiment wordt herhaald. Bij een random model worden de behandelniveaus door een willekeurig proces verkregen, en variëren deze dus per herhaling.

    Effectgrootte

    Net als bij de andere statistische testen hebben we aan alleen een significant resultaat niet genoeg. We moeten ook weten of de resultaten in praktische zin van belang zijn. In het geval van de F statistiek is de r- familie van effectgroottes geschikt. In het geval van de ANOVA representeert de effectgrootte hoeveel van de variatie in de afhankelijke variabele kan worden toegeschreven aan een behandeleffect (de grootte van het experimentele effect). Twee van de meest voorkomende statistieken zijn η² en ω².

    Eta-kwadraat η²

    Dit is de simpelste meting van het effect. SSbehandeling is een maat voor hoeveel van de observatieverschillen door de verschillende behandelingen tot stand komen. SStotaal is de maat voor de verschillen in de complete dataset. Deze twee SS’s gedeeld door elkaar geven een percentage van de variatie door de behandeling:

    • η² = SSbehandeling / SStotaal

    Deze statistiek heet eta-kwadraat, maar wordt ook wel correlatie ratio genoemd. Wanneer de sum of squares niet bekend zijn, kan eta-kwadraat ook anders uitgerekend worden:

    • η² = 1 / (1+ (dferror / (F x dfbehandeling)))

    Er kan ook gekeken worden naar percentage reductie in error (PRE). SStotaal geeft de variabiliteit van alle observaties, zonder te kijken naar groepslidmaatschap. SSerror geeft de variatie binnen groepen. Het verschil hier tussen is SSbehandeling. Dus SSbehandeling/SStotaal geeft aan hoeveel de voorspellingserror verminderd is door groepslidmaatschap mee te nemen.

    η² gaat er vanuit dat de regressielijn door de gemiddelden van elke groep gaat. Dit is echter niet zo, waardoor de metingen biased zullen zijn. η² is de effectgrootte met de meeste bias. Het is echter goed te gebruiken bij het maken van statements over een bepaalde data set of om een idee te krijgen van de effectgrootte. Het resultaat η² begint steeds meer op andere metingen te lijken als de steekproeven groter worden.

    Omega-kwadraat ω²

    Omega-kwadraat ω²

    De omega-kwadraat is een goede maat voor het effect bij gebalanceerde designs (met gelijke n’s). Er zijn twee formules voor ω², voor een fixed of random onafhankelijke variabele. De laatste komt vrij weinig voor, dus hieronder alleen de formule voor fixed designs:
    ω² = (SSbehandeling - (k-1)MSerror)/(SStotaal + MSerror)
    Deze statistiek heeft minder bias dan η².

    Wortel-gemiddelde-gekwadrateerde gestandaardiseerde effect (RMSSE)

    Hierbij wordt gebruik gemaakt van de d-familie van effectgrootte.

    \[d=\sqrt{\frac{1}{k-1}\sum(\frac{\mu_j-\mu}{\sigma})^2}\]

    Voor elke groep wordt het verschil genomen tussen het gemiddelde en het grote gemiddelde, waarna dit wordt gedeeld door de standaarddeviatie. Dit heet het gestandaardiseerde effect. Vervolgens wordt dit gekwadrateerd en gemiddeld over alle groepen. Dit geeft het gemiddelde gekwadrateerde gestandaardiseerde effect. Doordat hier de wortel van genomen wordt heet het dus het ‘wortel-gemiddelde-gekwadrateerde gestandaardiseerde effect’.

    Hoe wordt de power van een ANOVA berekend?

    De berekening van de power van een ANOVA lijkt sterk op die bij een t test, alleen is de notatie anders. Net als bij t wordt de statistiek phi prime (φ’) berekent, waaruit vervolgens phi (φ) voortkomt. Hierna wordt power opgezocht in de noncentrale F verdeling.

    Stel dat we data verzamelen op de activiteit van ratten, na het injecteren van een bepaalde hoeveelheid medicijn. We hebben vijf groepen ratten, die elk een verschillende hoeveelheid van het medicijn ingespoten krijgen. Door middel van resampling verkrijgen we een steekproefverdeling: we trekken uit de vijf groepen ratten herhaaldelijk een steekproef en berekenen telkens de F statistiek. Wanneer we dit 10.000 keer hebben gedaan, kijken we hoe vaak de F de kritieke waarde overschrijdt. Dit is de definitie van power.

    Tegenwoordig hebben statistische programma’s een optie voor het berekenen van power. Meerdere websites hebben (gratis) power calculators.

    \[\frac{E(MS_{behandeling})}{E(MS_{error})}=\frac{\frac{\sigma^2_e+n\sum{\tau^2_j}}{k-1}}{\sigma^2_e}\]

    Als H0 waar is dan is ∑τ2j = 0 en is F = MSbehandeling/MSerror met een gemiddelde van de verdeling van: dferror/(dferror-2). Dit gemiddelde ligt dichtbij 1.00.

    Als H0 onjuist is, wordt de ratio:

    \[\frac{E(MS_{behandeling})}{E(MS_{error})}=1+\frac{\frac{n\sum{\tau^2_j}}{(k-1)}}{\sigma^2_e}=1+\frac{\lambda}{k-1}\]

    • waarbij

    \[\lambda=\frac{n\sum{\tau^2_j}}{\sigma^2_e}\]

    • Deze statistiek heet lambda of noncentraliteitsparameter.

    De effectgrootte wordt gegeven met:

    \[\varphi'=f=\sqrt{\frac{\frac{\sum{a^2_j}}{k}}{MS_{error}}}\]

    Access: 
    Public
    Hoe kunnen gemiddelden van behandelgroepen vergeleken worden? - Chapter 12

    Hoe kunnen gemiddelden van behandelgroepen vergeleken worden? - Chapter 12

    Dit hoofdstuk gaat verder in op de ANOVA, hoe de gemiddelden van de behandelgroepen met elkaar vergeleken kunnen worden.

    Wanneer de ANOVA uitgevoerd is, en een significante F is gevonden, weten we alleen dat niet alle populatiegemiddelden gelijk zijn. De significantie vertelt ons niet welke gemiddelden van elkaar verschillen (bijvoorbeeld bij het vergelijken van cognitieve therapie, medicatie of geen behandeling – welke werkt en welke niet).

    Een kanttekening hierbij is, dat onderzoekers tegenwoordig steeds minder waarde hechten aan deze omnibus F over alle groepen tegelijk. Zelfs wanneer deze F niet significant is, kan het waardevol zijn om groepen afzonderlijk met elkaar te vergelijken.

    Welke soorten error rates zijn er?

    Er zijn veel verschillende testen ontworpen voor het vergelijken van meerdere groepsgemiddelden, hier worden de meest gebruikte besproken. Wat de testen gemeen hebben, is dat ze ieder proberen om de kans op Type I fouten zo klein mogelijk te houden (de kans op het onjuist verwerpen van de nulhypothese). De error rate per vergelijking (PV) is de kans op het maken van een Type I fout bij deze vergelijking. De PV is afhankelijk van onze gekozen α. Als we werken met een α van .05, dan is de PV .05.

    Wanneer we na een ANOVA meerdere groepsgemiddelden met elkaar gaan vergelijken, zijn we in feite bezig met een serie (of familie) van testen. De kans dat die familie van conclusies tenminste één Type I fout bevat is de familie error rate (FE). Bij een experiment waar slechts twee gemiddelden worden vergeleken, zullen PV en FE gelijk zijn aan elkaar.

    Voor meerdere vergelijkingen geldt:

    • PV : α = α’
    • FE : α = 1 – (1 – α’)c

    waar α’ de error rate voor één vergelijking is, en c het aantal vergelijkingen

    Nulhypothese

    We zijn nu uitgegaan van een complete, of omnibus, nulhypothese. Dat wil zeggen dat de nulhypothese is dat alle populatiegemiddelden gelijk zijn. We gebruiken echter vaker beperkte nulhypothesen, zoals µ1 = µ2 = µ3, µ4 = µ5 en µ6 = µ7. FE kan niet altijd worden opgesteld zonder het patroon van populatiegemiddelden te weten.

    Er werd altijd onderscheid gemaakt tussen a priori vergelijkingen (gekozen voor data verzameling) en post hoc vergelijkingen (gekozen na data verzameling). Tegenwoordig zijn er andere opties: kiezen voor een paar vergelijkingen op basis van theorie of vergelijkingen maken tussen alle mogelijke paren van gemiddelden.

    De regel was altijd dat multiple comparisons alleen uitgevoerd mochten worden bij een significante F-toets. Tegenwoordig weten we dat de multiple comparisons kunnen leiden tot significante verschillen tussen gemiddelden, ook al was de algehele F-toets niet significant. De multiple comparisons mogen dus altijd uitgevoerd worden. Wat is dan nog de reden om een F-toets uit te voeren? Traditie, dus dat blijft er nog wel een tijdje in.

    Een voorbeeld

    In een experiment wordt gekeken hoe ratten een tolerantie ontwikkelen tegen morfine. Net als bij het eten van pittig eten geldt hierbij dat bij herhaaldelijke toediening van morfine tegen pijn, het lichaam minder reageert op het medicijn. Steeds meer morfine is nodig voordat het werkt. De ratten worden op een steeds warmer wordend oppervlak gezet, en onderzoekers tellen hoe lang het duurt voordat de rat zijn poten likt (een teken van pijn). De hypothese is, dat wanneer een rat vaker een morfine-injectie heeft gehad vóór het experiment, hij sneller weer pijn zal voelen (zo snel als een rat die geen injectie heeft gehad).

    Het interessante bij morfine tolerantie is dat dieren (en mensen) vaak een tegenreactie ontwikkelen. Het lichaam is gewend geraakt aan de toevoeging van het medicijn, en heeft daardoor een grotere sensitiviteit voor pijn (maar deze wordt weggenomen door de morfine). Wanneer we dan echter een zoutoplossing (zonder werking) inspuiten, wordt deze hypersensitiviteit niet weggenomen en zal de pijngrens zeer laag zijn. De hypothese is dus dat wanneer dieren plots een zoutoplossing toegediend krijgen na een serie morfine, ze snel hun poten zullen likken.

    Een derde hypothese betreft de omstandigheden van het toedienen van morfine. De hypersensitiviteit bij morfine wordt ook veroorzaakt door de setting van toedienen: als het dier weet dat hij in kooi X altijd morfine krijgt, gaat het lichaam daar onbewust op reageren. Wanneer het dier in een nieuwe setting (kooi Y) geïnjecteerd wordt met morfine, wordt deze hypersensitiviteit niet getriggerd. Het dier reageert dan als een dier dat voor het eerst met morfine wordt ingespoten.

    Het experiment

    In het experiment worden vijf groepen ratten onderzocht. Elke groep heeft vier trials, en we verzamelen data van de vierde trial. De groepsnamen hebben betrekking op de behandeling in de eerste drie trials, en dan de laatste trial:

    1. Groep M-M: morfine in de eerste drie trials en ook in de vierde, in dezelfde setting. We verwachten morfinetolerantie en dus een normale pijnreactie
    2. Groep M-S: morfine in de eerste drie trials en zoutoplossing in de laatste, zelfde setting. Door te wisselen naar zoutoplossing verwachten we een hypersensitiviteit en dus een snelle pijnreactie.
    3. Groep Mc-M: morfine in de eerste drie trials in hun eigen kooi, en morfine in de laatste in een andere setting. Door de wisseling van setting wordt de hypersensitiviteit niet getriggerd -en verwachten we een late pijnreactie. Er wordt geen morfine tolerantie opgebouwd.
    4. Groep S-M: zoutoplossing in de eerste drie trials en morfine in de vierde. Deze dieren hebben geen tolerantie opgebouwd en we verwachten de minste pijngevoeligheid.
    5. Groep S-S: alle vier de trials zoutoplossing.

    Onze hypothese is:

    • S-M = Mc-M > M-M ? S-S > M-S

    Deze hypothese geeft aan dat groep S-M het minst gevoelig is voor pijn, terwijl groep M-S de hoogste pijngevoeligheid heeft. Groepen Mc-M en S-M zijn gelijk, omdat de signalen in de eerste drie trials niet aanwezig zijn in de test trial. Groepen M-M en S-S staan in het midden. Of deze groepen gelijk zijn aan elkaar is afhankelijk van hoe snel morfine tolerantie ontwikkelt. Het vraagteken geeft aan dat er geen voorspelling is.

    Omnibus test

    Eerst testen we met een ANOVA of het experiment in zijn geheel significant was. Uit het experiment komt een significante F, wat aanduidt dat er verschillen zijn tussen de groepen. De berekende η² is .76, wat betekent dat de behandelverschillen voor 76% van de variatie in het experiment zorgen (een grote portie).

    A priori vergelijken

    Om twee gemiddelden te vergelijken, zijn standaard t testen een prima methode. Daarom wordt hiermee begonnen. De t test is één vorm van een a priori vergelijking tussen gemiddelden, ook wel een contrast genoemd.

    Meerdere t testen

    Wanneer zoals bij het voorbeeldonderzoek vooraf al vergelijkingen worden opgesteld, kunnen meerdere individuele t testen tussen de afzonderlijke groepen gedaan worden. Bij homogene varianties vervangen we de individuele varianties door MSerror en gebruiken we dferror vrijheidsgraden. Bij heterogene varianties en gelijke groepsgroottes, gebruiken we geen MSerror, maar de individuele steekproefvarianties en gebruiken we 2(n-1) vrijheidsgraden. Bij heterogene varianties en ongelijke steekproefgroottes gebruiken we de individuele varianties en de vrijheidsgraden worden aangepast met de Welch-Satterthwaite methode (zie hoofdstuk 7).

    Een grote fout die soms gemaakt wordt, is het onjuist en overbodig toepassen van de t test bij meerdere vergelijkingen. Dit maakt de familie error rate enorm hoog. Maar, wanneer we bijvoorbeeld slechts twee vergelijkingen maken, is de t test een goede methode. In het geval van het voorbeeld zouden we de hypothese kunnen testen dat een verandering van testomgeving de tolerantie tegen morfine tegengaat (en dus dat Mc-M minder pijn ervaart dan M-M). De algemene formule voor t, waarbij de individuele varianties vervangen zijn door MSerror:

    \[t=\frac{\bar{X_i}-\bar{X_j}}{\sqrt{\frac{2MS_{error}}{n}}}\]

    In ons voorbeeld dat Mc-M minder pijn ervaart dan M-M zou dit leiden tot een t-waarde van 6,72. Deze waarde is groter dan t.025(35) = 2,03 en dus wordt de nulhypothese verworpen. Het veranderen van de setting waarin morfine gegeven wordt vermindert dus de morfine tolerantie.

    Lineair contrast

    De individuele t test is onderdeel van een overkoepelende techniek, die gebruikt maakt van lineaire contrasten. Waar de t test één groep met een andere groep vergelijkt, kunnen we bij lineaire contrasten één of meerdere groepen met elkaar vergelijken.

    In een lineair contrast maken we gebruik van een lineaire combinatie. De lineaire combinatie is een gewogen som van behandelgemiddelden:

    \[L=a_1\bar{X}+a_2\bar{X}+...+a_k\bar{X_k}=\sum{a\bar{X}}\]

    Wanneer alle aj’s gelijk zijn aan 1, is L de som van de gemiddelden. Wanneer alle aj’s gelijk zijn aan 1/k, is L het gemiddelde van de gemiddelden.

    Bij een lineair contrast is ∑aj = 0. Dit kan bijvoorbeeld gebruikt worden om gemiddelden te vergelijken of het gemiddelde van één conditie met het gecombineerde gemiddelde van meerdere andere condities. Een voorbeeld: a1 = 1, a2 = -1 en a3 = 0

    \[\Psi=(1)\bar{X_1}+(-1)\bar{X_2}+(0)\bar{X_1}-\bar{X_2}\]

    Stel dat we drie condities hebben, en het gemiddelde van condities 1 en 2 met conditie 3 willen vergelijken. Daarbij zijn a1= ½, a2= ½, a3= -1. Met de gemiddelden van de condities ingevoerd in de formule, krijgen we ψ:

    \[\Psi=(\frac{1}{2})X_1+(\frac{1}{2})X_2+(-1)X_3=\frac{X_1+X_2}{2-X_3}\]

    Sum of squares

    Met ψ kunnen we vervolgens heel makkelijk de sums of squares berekenen:

    \[SS_{contrast}=\frac{n\Psi^2}{\sum{a^2_j}}=\frac{n(\sum{aX_{jj}})^2}{\sum{a^2_j}}\]

    Dit is een component van SSbehandeling met 1 vrijheidsgraad.

    Verder geldt, dat bij een bepaald aantal contrasten we voor de totale sums of squares in de behandeling zorgen:

    • SSbehandeling = SScontrast1 + SScontrast2 + …

    Bij bovenstaande is SSbehandeling volledig gepartitioneerd (verdeeld).

    De keuze voor a

    Bij het kiezen van coëfficiënt a is het vaak het makkelijkst om de groepen binnen elke vergelijkingsgroep in gewicht te verdelen. Bijvoorbeeld bij het vergelijken van zeven condities, waarbij we de eerste vier met de laatste drie willen vergelijken. De eerste vergelijkingsgroep heeft vier condities, dus voor X1 tot en met X4 geldt aj = 1/4. De tweede vergelijkingsgroep heeft drie gemiddelden, dus geldt voor elk gemiddelde aj = 1/3. We maken de tweede groep negatief, zodat ∑aj = 0.

    Tabel 14

     

     

     

     

     

     

     

    Gemiddelde

    X1

    X2

    X3

    X4

    X5

    X6

    X7

    aj

    1/4

    1/4

    1/4

    1/4

    -1/3

    -1/3

    -1/3

    \[\sum{\bar{X}a_{jj}}=\frac{1}{4}(\bar{X_1}+\bar{X_2}+\bar{X_3}+\bar{X_4})-\frac{1}{3}(\bar{X_5}+\bar{X_6}+\bar{X_7})\]

    Significantie

    Omdat we bij lineaire contrasten altijd twee groepen vergelijken, is het aantal vrijheidsgraden altijd één. Hierdoor kunnen we de SS direct omzetten in MS, en delen door MSerror om de significantie F te berekenen.

    \[F=\frac{MS_{contrast}}{MS_{error}}=\frac{(\frac{n\Psi^2}{\sum{a^2_j}})}{MS_{error}}=\frac{n\Psi^2}{\sum{a^2_j}MS_{error}}\]

    F heeft dan één vrijheidsgraad.

    Bij het berekenen van F moet rekening gehouden worden met de familie error rate. Bij elke vergelijking die gemaakt wordt, neemt deze error rate toe. Bij vier contrasten, zoals in het voorbeeldonderzoek, nadert FE de .20 als alle nulhypotheses waar zijn. Er zijn verschillende manieren om de error rate te verlagen:

    • Elke vergelijking met een strengere α onderzoeken (zoals α = .01).
    • Minder contrasten maken: als een contrast eigenlijk niet interessant is, maak het dan niet.
    • Bonferroni t (Dunn’s test). De test is gebaseerd op het feit dat de kans op één of meer gebeurtenissen nooit hoger is dan de kans op de som van de individuele kansen. Als er drie vergelijkingen gemaakt worden, elk met een α = .05, is de totale kans op een type I fout dus hooguit .15. Deze test komt erop neer dat we elk contrast testen tegen een kleinere α, waardoor de FE alsnog op slechts .05 uitkomt. Bij vier contrasten bijvoorbeeld test je elk contrast tegen α = .05/4 = 0.125. De test is alleen geschikt bij een beperkt aantal a priori vergelijkingen, en niet bij post hoc toetsen, aangezien dan alle mogelijke vergelijkingen genomen worden, ook al zijn deze wellicht niet interessant.

    Orthogonale contrasten

    Orthogonale contrasten zijn contrasten die onafhankelijk zijn van elkaar. Dit houdt in, dat we tussen de vergelijkingsgroepen of sets geen uitspraken kunnen doen over hun verhoudingen. Dus, wanneer we weten dat X1 groter is dan het gemiddelde van X2 en X3, dan weten we nog niet of X4 groter is dan X5. Hadden we echter nog een contrast gehad tussen X1 en X2, dan zouden we kunnen gokken dat X1 waarschijnlijk groter is dan X2. Deze laatste contrasten zijn dan niet onafhankelijk van elkaar.

    Bij orthogonale, onafhankelijke contrasten geldt, dat de SS’s van alle contrasten samen opgeteld SSbehandeling maken.

    Gegeven dat de steekproeven even groot zijn, zijn er drie criteria waaraan voldaan moet worden om orthogonale contrasten te zijn:

    1. ∑aj = 0
    2. ∑ajbj = 0 (a en b zijn coëfficiënten van verschillende contrasten)
    3. Het aantal vergelijkingen is gelijk aan het aantal vrijheidsgraden voor behandelingen. Dan is de som van SScontrast gelijk aan SSbehandeling

    Getrimde gemiddelden

    In sommige gevallen zal een distributie lange staarten hebben, en willen we gemiddelden vergelijken van getrimde datasets. Wilcox raadt een inkorting van 20% aan. Dit leidt tot een vermindering in steekproefgrootte, maar tot verhoging van power. Stel dat we 50 observaties hebben, dan korten we (.20)(50) = 10 observaties aan elke kant van de staart in. Als getrimde gemiddelde gebruiken we het gemiddelde van de resterende 30 scores. Voor de variantie gebruiken we een Winsorized steekproef waarbij we de laagste 10 scores vervangen door de 11e laagste score, en hetzelfde voor de andere kant. De formule voor de variantie is, als s2Wi de variantie van de Winsorized steekproef is:

    \[s^2_W=\frac{(n_j-1)s^2_{W_i}}{h_j(h_j-1)}\]

    • met n het totaal aantal scores en h de getrimde scores

    De t test formule is vervolgens weer als vanouds:

    \[t_W=\frac{\bar{Y_{t_i}}-\bar{Y_{t_j}}}{\sqrt{s^2_{W_\bar{X_i}}+s^2_{W_\bar{X_j}}}}\]

    met vrijheidsgraden:

    \[df_w=\frac{(s^2_{W_\bar{X_i}}+s^2_{W_\bar{X_j}})^2}{s^2_{W_\bar{X_i}}(h_i-1)+s^2_{W_\bar{X_j}}(h_j-1)}\]

    Welke betrouwbaarheidsintervallen worden gebruikt?

    Bij het berekenen van de totale F (over de gehele studie), gebruiken we betrouwbaarheidsintervallen met een r-familie statistiek zoals η². Bij het vergelijken van individuele gemiddelden gebruiken we de d –familie. Het handigste is om uit te gaan van lineaire contrasten, omdat we daarbij groepen gemiddelden kunnen vergelijken. In dat geval berekenen we de F van het contrast en nemen daar de wortel van.

    Voor het betrouwbaarheidsinterval geldt, waar ψ de waarde is van het contrast:

    • CI.95 = (Ψj) ± t.025serror
    \[s_{error}=\sqrt{\frac{2MS_{error}}{n}}\]

    Hoe bereken je de effectgrootte?

    Het berekenen van de effectgrootte gaat in feite zoals bij een t test, maar dan in andere notatie. We weten dat ψ het contrast is tussen twee gemiddelden, oftewel het verschil in gemiddelden. Dit kan dus de teller vervangen in de formule voor de effectgrootte:

    \[\hat{d}=\frac{\Psi}{s_e}=\frac{\sum{a\bar{X_i}}}{s_e}\]

    • waar se een schatting is van de within groups standaarddeviatie

    Voor se wordt meestal de wortel genomen uit MSerror. Andere manieren zijn: de wortel van de gemiddelde variantie of gebruik van de standaarddeviatie van de controlegroep.

    De effectgrootte d zal uiteindelijk aangeven hoeveel standaarddeviaties het verschil is tussen de gemiddelden.

    Wanneer worden Post Hoc vergelijkingen gebruikt?

    De post hoc benadering heeft de voorkeur wanneer er veel hypotheses zijn in een experiment, of wanneer hypotheses pas vorm krijgen nadat de data bekeken is. Post hoc technieken die vaak gebruikt worden, staan hieronder.

    Fisher’s Least Significant Difference (LSD) procedure

    Fisher’s LSD is een van de oudste methoden. Hij is vooral geschikt bij een beperkt aantal (tot en met drie) gemiddelden die worden vergeleken. De procedure is simpelweg het vergelijken van gemiddelden door middel van de t test. Het verschil tussen een post hoc LSD en a priori t test, is dat de eerste een significante omnibus F vereist. Dit beschermt de FE, maar alleen als de complete nulhypothese juist niet.

    Studentized Range (q)

    Veel van de post hoc testen zijn gebaseerd op deze statistiek q. De formule ervoor is:

    \[q_r=\frac{\bar{X_l}-\bar{X_s}}{\sqrt{\frac{MS_{error}}{n}}}\]

    • waarbij Xl en Xs het grootste en kleinste gemiddelde zijn en r is het aantal behandelingen in de set.

    De formule voor q (bij r gemiddelden en n scores per condities) lijkt erg op de formule voor t, behalve dat t een √2 in de noemer heeft:

    \[t=\frac{\bar{X_i}-\bar{X_j}}{\sqrt{\frac{2MS_{error}}{n}}}\]

    De q is dus een lineaire functie van t. Van t kan je dus altijd naar q: t = √2. De q is echter speciaal ontworpen voor wanneer we met voorbedachten rade twee gemiddelden (de grootste en de kleinste) uit een set gemiddelden kiezen (bij t kiezen we willekeurig). De statistiek q heeft een eigen appendix (Howell, 2013: 699) met kritieke waarden voor elke r.

    Wat houdt Tukey’s test in?

    De Tukey’s test is een belangrijke test voor het vergelijken van gemiddelden, die gebruikmaakt van de q. Door dit gebruik van q krijgen we meer controle over de α, wat het een favoriete test maakt bij veel mensen.

    Bij Tukey ordenen we eerst de gemiddelden van elke conditie naar grootte. Elke paarsgewijze vergelijking wordt vervolgens getest bij de maximale r (elk paar gemiddelden wordt getest alsof ze dus maximaal uit elkaar liggen). Wanneer we de kritieke waarde van q weten (waarbij dus de nulhypothese wordt verworpen), kunnen we deze in de formule invullen, samen met MSerror en n, en berekenen wat het minimale verschil is tussen twee gemiddelden om significant te zijn:

    \[q=\sqrt{\frac{MS_{error}}{n}}=X_i-\bar{X_j}\]

    Stel, we hebben vijf condities met de gemiddelden 4, 10, 11, 24 en 29. Bij r = 5 en 35 df hoort een kritieke q van 4.07. MSerrorhebben we berekend op 32.00. We herschrijven de formule tot:

    \[4,07\sqrt{\frac{MS_{error}}{n}}= 8,14\]

    Wanneer het verschil tussen gemiddelden groter is dan 8.14, is de q test significant. Van de bovenstaande gemiddelden weten we dan:

    (gem. 1 = gem. 2 = gem. 3) ≠ (gem. 4 = gem. 5) waarbij het ‘is gelijk’ teken betekent dat we de nulhypothese van gelijkheid niet konden verwerpen, niet dat we bewezen hebben dat ze gelijk zijn.

    Een kanttekening bij Tukey’s test is, dat de condities even groot moeten zijn, anders moet voor ongelijke steekproefgroottes gecorrigeerd worden met een aangepaste formule.

    Benjamini-Hochberg test

    Benjamini en Hochberg hebben een test bedacht die sequentieel is en niet gebaseerd op FE, maar op False Discovery Rate (FDR). FE geeft de kans op één of meer type I fouten en doet net alsof alle conclusies fout zijn, wanneer er maar één type I fout gemaakt wordt. FDR benadert het anders: ‘welk percentage van de significante resultaten is een foute ontdekking?’

    • FDR = aantal onjuiste verwerpingen / aantal totale verwerpingen

    Welke test kies je wanneer?

    Wanneer je je test van tevoren plant en slechts één vergelijking interessant vindt, dan kies je meestal de standaard t test. Wanneer het een complexe vergelijking is, kies je een lineair contrast. Met meerdere contrasten is de Bonferroni t het beste.

    Bij een groot aantal groepen en veel vergelijkingen is Tukey’s test aan te raden. De Benjamini-Hocberg test kan gebruikt worden als men het niet erg vindt dat er af en toe een type I fout tussen zit, zodat er meer power is voor de andere contrasten.

    Hoe werkt trendanalyse?

    Het voorgaande stuk hield zich bezig met het vergelijken van gemiddelden van verschillende condities. Maar wat als de condities een bepaald verband met elkaar hebben? Bijvoorbeeld wanneer we geïnteresseerd zijn in de effecten van een bepaalde dosis aspirine per dag, op het voorkomen van hartfalen. We willen weten of meer aspirine meer effect heeft: we zijn geïnteresseerd in een trend.

    Een trend heeft verschillende vormen. Ten eerste kan er een lineaire trend zijn, waarbij meer van het medicijn leidt tot een beter effect (een rechte lijn). Ten tweede kan er een kwadratische trend zijn, waarbij het effect van de dosering toeneemt tot een bepaald hoogste punt, en daarna afvlakt of zelfs het effect weer afneemt (een boog). Ten slotte is ook een combinatie mogelijk van lineair en kwadratisch.

    Voorbeeld

    Als voorbeeld nemen we weer de studie van het verband tussen alcohol en agressie uit het vorige hoofdstuk. De participanten moeten hierbij een afleidende taak doen, waarbij wordt gemeten in hoeverre dit hun agressie onderdrukt. Het idee is hierbij dat wellicht te veel afleiding weer kan leiden tot frustratie en dus agressie (mogelijk een kwadratisch verband). Een one-way ANOVA gaf een significante F van 6.90, dus er zijn significante verschillen tussen de vijf condities. De volgende vraag is of de variantie in de data door een lineaire of kwadratische functie verklaard kan worden.

    Voor een trendanalyse maken we weer gebruik van de lineaire contrasten. Het verschil is, dat we hier andere coëfficiënten gebruiken in de formule voor ψ. Welke coëfficiënten we moeten gebruiken, staat in de Appendix Polynomiaal (Howell, 2013: 697; zie hieronder). Nog steeds moet gelden dat ∑aj = 0 en ∑ajbj = 0

    Tabel 15

     

     

     

     

     

    Lineair

    -2

    -1

    0

    1

    2

    Kwadratisch

    2

    -1

    -2

    -1

    2

    Uit de formule voor ψ vinden we een contrast van 0.0425. Hiermee kunnen we de SSlineair berekenen:

    \[SS_{lineair}=\frac{n\Psi^2}{\sum{a^2_j}}=0.002\]

    En F vinden we met de formule waarbij SSlineair = MSlineair vanwege 1 df.

    • F = 0.009, bij 1 en 55 df. Uit de appendix F is de kritieke waarde F.05(1,55) = 4.015. Onze gevonden waarde voor F is veel kleiner, en dus behouden we H0: er is geen lineaire trend tussen onze gemiddelden.

    Vanuit een boxplot kunnen we echter afleiden dat er wellicht sprake is van een kwadratische trend in de data. Wat we allereerst controleren, is of er de residuele variantie na het toevoegen van de lineaire component significant groter is dan de error variantie, waarvan we weten dat het aanwezig is.

    • SSresidu = SSbehandeling - SSlineair
    • = 62.460 – 0.002
    • = 62.458
    • dfresidu = dfbehandeling - dflineair
    • = 4 - 1 = 3
    • MSresidu = SSresidu / dfresidu= 20.82
    • Fresidu = MSresidu/ MSerror = 9.20

    Omdat onze Fresidu groter is dan de kritieke waarde voor F(3,55), verwerpen we de nulhypothese en stellen dat er genoeg variantie over is om te verklaren. Nu kunnen we de kwadratische component berekenen, hetzelfde als bij de lineaire alleen met andere coëfficiënten. F = 24.17. Deze F is wel significant: er is een kwadratische trend in onze data.

    Ongelijke intervallen

    Een trendanalyse zoals hierboven is gemakkelijk te doen, maar alleen wanneer de intervallen van de onafhankelijke variabele (zoals de afleiding) gelijk zijn. Wanneer de intervallen ongelijk zijn, kunnen we de coëfficiënten niet uit de Appendix Polynomiaal halen, maar moeten we ze zelf berekenen. Hier wordt verder niet op ingegaan.

    Access: 
    Public
    Hoe gebruik je de ANOVA bij twee of meer onafhankelijke variabelen? - Chapter 13

    Hoe gebruik je de ANOVA bij twee of meer onafhankelijke variabelen? - Chapter 13

    In dit hoofdstuk wordt de ANOVA besproken bij twee of meer onafhankelijke variabelen, ook wel factoren. Stel dat we een onderzoek doen naar het terughalen van informatie uit het geheugen. We laten mensen een lijst woorden leren op verschillende manieren van het tellen van het aantal letters in het woord tot het verbeelden van het woord. De eerste onafhankelijke variabele is dus de Onthoud Conditie. Daarnaast willen we weten of leeftijd invloed heeft op het terughalen van informatie, dit maakt de tweede variabele. Het experiment heeft nu een two-way factoriaal design (‘two’ voor het aantal onafhankelijke variabelen).

    Elke combinatie van niveaus van de twee variabelen heet een cel. Xijk geeft aan dat het gaat om een X-waarde uit de i-de rij en de j-de kolom, als k-de observatie in de ij-de cel.

    Een factoriaal design heeft twee of meer onafhankelijke variabelen, waarbij elk niveau van elke variabele aan elkaar gekoppeld is. Als we dus vijf Onthoud Condities hebben en twee Leeftijden (jong/oud), dan hebben we tien verschillende groepen participanten. Daarom wordt het design ook wel, in dit geval, 2 x 5 factoriaal genoemd. Designs worden ook wel genoemd naar het aantal onafhankelijke variabelen, dus bij twee variabelen: two-way factorial. Wanneer dezelfde participanten in meerdere groepen deelnemen is er sprake van een repeated-measures design.

    Het voordeel van een factoriaal design is dat de resultaten breder en nauwkeuriger te interpreteren zijn: we kunnen in het voorbeeld ook het effect van leeftijd onderzoeken op het terughalen van informatie. Terwijl we ook over de variabelen apart nuttige dingen kunnen zeggen. Daarnaast geven factoriele designs de kans om de interactie van variabelen te onderzoeken. We kunnen kijken of jongere participanten meer verschillen in resultaten tussen de Onthoud Condities dan de oudere participanten bijvoorbeeld. Ook zijn er minder participanten nodig.

    Voorbeeld

    We gaan verder met het voorbeeldonderzoek naar het terughalen van woorden uit het geheugen. We voeren het onderzoek uit en plotten de gemiddelde scores per participant in een tabel. Eén manier om naar de data te kijken, is puur te kijken naar de gemiddelde score van de jonge groep (ongeacht conditie) versus de oude groep. Dit is het algemene effect van leeftijd. Daartegenover kunnen we alleen kijken naar de gemiddelden van de vijf condities, en leeftijd negeren. Dit is het algemene effect van Conditie.

    Wat ook kan, is het onderzoeken van de verschillende niveaus van één factor, op slechts één niveau van de andere factor. Bijvoorbeeld door het vergelijken van jongeren en ouderen op de Tel Onthoud Conditie. Dit heet een simpel effect of soms een conditioneel effect.

    Welke berekeningen zijn belangrijk?

    Voor veel van de calculaties worden de formules gebruikt zoals bij de one-way ANOVA in de vorige hoofdstukken. SStotaal is weer gelijk aan de gekwadrateerde som van alle verschillen tussen de individuele scores en het totaalgemiddelde:

    \[SS_{totaal}=\sum(\bar{X}-X)^2\]

    Daarnaast berekenen we een SS voor beide factoren (leeftijd L en Conditie C). Elke factor apart is eigenlijk gelijk aan de SSbehandeling die we bij een one-way ANOVA berekenen. In de formule vermenigvuldigen we met n participanten per groep (dus 10 in dit geval) over c niveaus van de andere variabele (dus voor SSA geldt: 10 x 5).

    \[SS_L=nc\sum(\bar{X_i}-X)^2\]

    De laatste term is een maat voor de variatie van individuele cellen in de overzichtstabel: SScellen. Voor elke cel is er een gemiddelde, waarvan we het verschil met het totaalgemiddelde berekenen. Dit wordt gekwadrateerd en opgeteld. Vervolgens vermenigvuldigd met n observaties per groep.

    \[SS_{cellen}=n\sum(\bar{X_{ij}}-X)^2\]

    SScellen vertelt ons hoeveel de celgemiddelden verschillen. Dit kan op drie manieren: (1) ze komen van verschillende niveaus van leeftijd, (2) ze komen van verschillende niveaus van conditie, of (3) er is een interactie tussen leeftijd en conditie. SSL vertelt ons hoeveel van dit verschil door verschillen in leeftijd komt, en SSC vertelt ons hoeveel van dit verschil door verschillen in conditie komt. Het overige komt door het interactie-effect.

    • SSLC = SScellen - SL - SC

    Nu moeten we SSerror berekenen. Hierbij geldt:

    • SSerror = SStotaal – (SSL + SSC + SSLC). Dit is hetzelfde als SSerror = SStotaal - SS­cellen

    Voor de vrijheidsgraden geldt:

    • dftotaal = N – 1 (met N het totaal aantal participanten)
    • dfL en dfC = aantal niveaus – 1
    • dfLC = dfL x dfC
    • dferror = dftotaal- dfLC - dfL – dfC of ac(n - 1), omdat elke cel n-1 df heeft en er ac cellen zijn

    Daarna berekenen we de MS door elke SS te delen door de bijbehorende df.

    Om F te berekenen, delen we elke MS door MSerror. Zowel de factoren Leeftijd en Conditie apart, als hun interactie, krijgen dus een F score.

    Interpretatie

    Uit het onderzoek komen alle drie de F scores significant. Het hoofdeffect van leeftijd is dat jongere participanten meer woorden onthouden dan oudere participanten. Het hoofdeffect van conditie is dat de taken met meer verwerkingsdiepte leiden tot het onthouden van meer woorden dan de taken met minder verwerkingsdiepte.

    Een significant interactie-effect houdt in, dat het effect van de ene variabele afhangt van het niveau van de andere variabele. Dus, jongere participanten deden het een stuk beter bij de moeilijkere verwerktaken, maar ongeveer even goed bij de makkelijke taken, zoals het rijmen, als de oudere participanten. Wanneer we Conditie plotten in een grafiek, en een aparte lijn maken per leeftijd, dan zien we de interactie in het feit dat de lijnen niet parallel lopen. Let op: wanneer de lijnen grillig lopen, maar wel parallel aan elkaar, dus in hetzelfde patroon, is er dus géén interactie.

    Het model

    De formule voor het two-way design is een uitbreiding op die van de one-way:

    \[X_{ijk}=\mu+\alpha_i+\beta_j+\alpha\beta_{ij}+e_{ijk}\]

    Waarbij:
    • Xijk = een enkele score
    • μ = het totaalgemiddelde
    • αi = het effect van Factor Ai = μAi – μ
    • βj = het effect van Factor Bj = μBj – μ
    • αβij = het interactie-effect van Factor Ai en Factor Bj
    • eijk = eenheid van error van observatie Xijk
    • N(0, σ2e)

    Wanneer wordt het simpele effect berekend?

    Wanneer significante interacties zijn gevonden, kan het belangrijk zijn om de data verder te analyseren: welke niveaus van de variabelen zorgen voor verschillende scores? Hiervoor is het simpele effect te berekenen. Reken altijd alleen de simpele effecten uit waarin je geïnteresseerd bent. Bij teveel simpele effecten, wort de familie error rate te hoog of verlies je power.

    Voor de SS gebruiken we de eerdere formule voor de factor, maar met een kleine aanpassing in het weglaten van het aantal niveaus van de andere factor, bijvoorbeeld:

    SSC bij Oude groep = Σ(X1j - X1)2, waarbij we de data gebruiken van de oude participanten

    De vrijheidsgraden vinden we door het aantal niveaus per factor -1 (dus bij Leeftijd 2-1 = 1).

    De MS vinden we weer door SS/df.

    Met deze informatie is de F te berekenen voor elke mogelijke combinatie in de interactie apart. Conditie is te koppelen aan Jonge, en Oude mensen, en Leeftijd is te koppelen aan vijf verschillende condities (zie Tabel 16 als voorbeeld).

    Tabel 16

    Bron

    df

    SS

    MS

    F

    Condities

     

     

     

     

    C bij jong

    4

    35.21

    8.80

    1.10

    C bij oud

    4

    450.13

    112.53

    14.05*

    Leeftijd

     

     

     

     

    L bij C1

    1

    3.00

    3.00

    0.37

    L bij C2

    1

    4.00

    4.00

    0.50

    L bij C3

    1

    25.01

    25.01

    3.12*

    L bij C4

    1

    35.32

    35.32

    4.41*

    L bij C5

    1

    200.10

    200.10

    24.97*

     

     

     

     

     

    Error

    90

    360.20

    8.01

     

    *p < .05

     

     

     

     

    Als we kijken naar het effect van leeftijd, dan zien we dat leeftijdsverschillen niet voorkomen bij de lagere niveau taken zoals tellen en rijmen, maar wel bij de hogere niveaus.

    Voorbeeld

    Het volgende voorbeeld behandelt de variantieanalyse met computerberekeningen. Onderzoekers waren geïnteresseerd in de invloed van roken op prestatie. Ze lieten participanten één van drie taken doen (een doelwit zoeken, een stuk tekst onthouden en een rijvaardigheidsspelletje). De afhankelijke variabele is het aantal fouten dat de participant maakt. Er waren drie groepen gebaseerd op rookgedrag: Actief roken (tijdens of net voor de taak), Rokers die tot 3 uur voor de taak niet hadden gerookt, en Niet rokers. Uit de SPSS output zijn de volgende termen belangrijk om te noemen.

    De regel ‘corrected model’ in de output is de som van de algemene effecten en de interactie, en is significant in dit geval (p = .000). ‘Intercept’ is een test op het grote gemiddelde en sinds deze significant is, zegt dit dat het grote gemiddelde verschilt van 0,00. ‘Corrected total’ noemen wij normaal totaal en ‘Total’ is ∑X2/N. Zowel de algemene effecten voor Taak en Rookgroep zijn significant, alsook de interactie tussen Taak x Rookgroep.

    Simpel effect

    Om te achterhalen welke gemiddelden significant van elkaar verschillen kunnen de testen uitgevoerd worden die in hoofdstuk 12 genoemd zijn, zoals lineaire contrasten en Bonferroni t-toets.

    Stel dat we specifiek willen weten wat het effect is van roken op de cognitieve (onthoud) taak. We willen de actieve rokers en de niet rokers vergelijken. In SPSS kiezen we om alleen naar de data van de cognitieve taak te kijken door Data/Select Cases. Met Compare Means/One-way ANOVA krijgen we de uitslag. De F is significant: actieve rokers doen het minder goed op de test dan niet rokers.

    Hoe wordt de power van een factoriaal design berekent?

    De berekening van de power van een factoriaal design is in feite hetzelfde als bij de one-way designs. Nu hebben we echter meer dan één onafhankelijke variabele, waarbij we het effect berekenen van elke variabele apart:

    \[\varphi'\alpha=\sqrt{\frac{\sum{\alpha^2_j}}{a\sigma^2_e}}\]

    \[\varphi\alpha=\varphi'\alpha\sqrt{nb}\]

    Voor behandeling Bj, worden de α’s vervangen door β’s.

    Voor het interactie-effect van beide variabelen geldt:

    \[\varphi'\alpha\beta=\sqrt{\frac{\sum{\alpha\beta^2_{ij}}}{ab\sigma^2_e}}\]

    \[\varphi\alpha\beta=\varphi'\alpha\beta\sqrt{n}\]

    waar αβij = μ – μi. – μj. + μij. μi. is het parametrisch gemiddelde van Variabele A (over alle niveaus van B) en μ.j van Variabele B over alle niveaus van A.

    Zie Tabel 17 voor fictieve resultaten van de rookstudie. De gemiddelden van alle groepen staan genoemd, alsook de parametrische gemiddelden.

    Tabel 17

     

    Patroon

    Cognitief

    Rijden

    Gemiddelde

    Niet-roker

    9.40

    28.90

    2.45

    13.58

    Roker

    9.60

    39.80

    6.55

    18.65

    Actief roker

    9.93

    48.50

    9.78

    22.74

    Gemiddelde

    9.64

    39.07

    6.26

    18.32

    De power is in dit geval .295.

    Als extra factoren of variabelen variantie verklaren, die normaal onder de error variantie valt, heeft een factorieel design meer power. Als er random factoren aan een model met fixed factoren worden toegevoegd, kan dit ten koste gaan van power.

    Welke andere experimentele designs zijn er?

    Tot nu toe hebben we de traditionele benadering van het vergelijken van gemiddelden gevolgd. Een onderzoeker kiest een paar niveaus van elke onafhankelijke variabele, en kruist die met elkaar.

    Soms wijken onderzoekers af van deze traditionele aanpak. Zo worden onafhankelijke variabelen soms willekeurig genomen (zoals Klas als factor gebruiken), waardoor we een willekeurige factor krijgen. Willekeurige factoren gaan vaak samen met een nested design, waarbij één onafhankelijke variabele genesteld ligt in de ander. Als we Klas als factor gebruiken, maar bij het trekken van de steekproef tien klassen uit district A en tien uit district B gebruiken, dan zit eigenlijk binnen de Klas variabele nog een variabele genesteld. Dit heet een nested design.

    In het volgende stuk worden enkele afwijkende designs behandeld, telkens met dezelfde data maar met andere namen waar nodig.

    Elke statistische test interpreteert de F-toets op de volgende manier: ‘stel de nulhypothese is juist en het experiment is 10.000 keer herhaald, hoe vaak zal de F-waarde zo extreem zijn als in dit experiment?’ Een fixed effect design is een design waarin de niveaus van de onafhankelijek variabele vast zijn en hetzelfde zijn van de ene replicatie naar de ander. De enige term in de formule voor dit model die verandert, is de error eijk.

    \[X_{ijk}=\mu+\alpha_i+\beta_j+\alpha\beta_{ij}+e_{ijk}\]

    Gekruist design met fixed variabelen

    Het originele voorbeeld dat we hier gebruiken, van het effect van onthoud-methode op het terughalen van informatie, is een gekruist experimenteel design met fixed factoren. Elk niveau van de ene onafhankelijke variabele wordt gekoppeld met elk niveau van de andere (in dit geval leeftijd en onthoud-conditie). Deze niveaus zijn fixed omdat we deze expres gekozen hebben.

    Gekruist design met random variabele

    Soms zullen we een ontwerp hebben met een fixed factor en een willekeurige of random factor. Stel dat we willen testen of mensen sneller hoofdletters dan kleine letters herkennen. De lettergrootte is een fixed factor. Door een steekproef uit het alfabet selecteren we vijf letters die we gebruiken in het experiment (A, G, D, K, W). Deze variabele ‘letters’ is een random factor.

    Omdat één van de factoren willekeurig is, zullen we bij een herhaling van het experiment andere letters selecteren en zullen de F waardes dus ook verschillen op basis van de letters die we selecteren. Een belangrijk feit hierbij is, dat het hebben van een random effect de test voor het fixed effect (in dit geval: Lettergrootte) verandert.

    Om te laten zien welk effect random factoren hebben, moeten we kijken naar de verwachte mean squares. Deze worden weergegeven in tabel 18:

    Tabel 18

    Fixed

    Random

    Gemixt

    Bron

    A vast / B vast

    A random / B random

    A vast / B random

    A

    σ2e + nbθ2α

    σ2e + nσ2αβ + nbσ2α

    σ2e + nσ2αβ + nbθ2α

    B

    σ2e + naθ2β

    σ2e + nσ2αβ + naσ2β

    σ2e + naσ2β

    AB

    σ2e + nθ2αβ

    σ2e + nσ2αβ

    σ2e + nσ2αβ

    Error

    σ2e

    σ2e

    σ2e

    Bij een fixed en een random variabele wordt de F test voor de fixed variabele:

    • Voor random variabele: E(F) = E(MSb/MSerror) = (σ2e + nbσ2β)/ σ2e
    • Voor interactie effect: E(F) = E(MSAB/MSerror) = (σ2e + nσ2αβ)/ σ2e
    • Voor fixed variabele: E(F) = MSA/MSAB = E(σ2e + nσ2αβ + nbσ2α)/( σ2e + nσ2αβ)

    Nested designs

    Stel dat we willen onderzoeken of vrouwelijke studenten van een universiteit betere therapeuten zijn dan mannelijke studenten. De faculteit trekt een steekproef uit alle afgestudeerden van dat jaar (n = 10) en splitst ze op basis van geslacht. Dan laten we elk met tien cliënten werken en we kijken naar behandeleffectiviteit. Het Geslacht is in dit geval een fixed variabele, omdat we hier expres naar kijken. We noemen Therapeut een random factor omdat we willekeurig een steekproef hebben getrokken. Daarnaast is Therapeut een nested factor omdat dit niet af te splitsen is van Geslacht: Marie wordt nooit een mannelijk therapeut en Bob nooit een vrouwelijke, ze zijn dus niet te kruisen.

    De variabiliteit in F is afhankelijk van random error en afhankelijk van welke therapeuten uit de steekproef komen. Omdat het om een nested design gaat, kunnen  we geen interactie-effect berekenen. Het effect voor Geslacht wordt op de normale manier te berekenen, maar voor de variabele Therapeut kunnen we alleen verschillen tussen therapeuten binnen vrouwen en binnen mannen berekenen. De notatie hiervoor is ‘Therapeut binnen Geslacht’ of Therapeut(Geslacht). De formule is:

    \[X_{ijk}=\mu+\alpha_i+\beta_{j(i)}+e_{ijk}\]

    • waarbij we met βj(i)aangeven dat Therapeut in Geslacht ligt

    Voor het berekenen van de effecten in een nested design, zijn de meeste berekeningen voor de hand liggend. De SSgeslacht is weer de gekwadrateerde afwijkingen voor elk geslacht, keer het aantal observaties per geslacht. Voor het Geneste effect nemen we het simpele effect van therapeuten voor mannen en vrouwen apart, en tellen die effecten op:

    • SStherapeut(geslacht) = SS­therapeut(man) + SStherapeut(vrouw)

    Voor de error berekenen we de SSerror voor elke Therapeut/Geslacht cel en tellen deze op.

    Voor de berekening van F geldt, bij een nested design met een random variabele binnen een fixed variabele, dat er twee error termen gebruikt worden. Error1 voor Geslacht en Error2 voor Therapeut(Geslacht). Error1 is gelijk aan Therapeut(Geslacht).

    Door het gebruik van een random factor is de power enorm afgenomen. De power is afhankelijk van het aantal participanten en het aantal niveaus van een random variabele.

    Hoe wordt de effectgrootte van de gehele ANOVA berekent?

    Voor het berekenen van een effect van de gehele ANOVA (de totale F), gebruiken we een r-familie meting. Voor een contrast tussen gemiddelden is een d meting handiger.

    r-familie

    Voor de η² van variabele A geldt: SSA/SStotaal. Voor het interactie-effect tussen A en B geldt: SSAB/SStotaal. Deze maat van het effect is vrij slecht, omdat hij niet goed het ware effect in de populatie weergeeft. Een betere statistiek is ω². De formule hiervan is hetzelfde voor de fixed en random variabelen, alleen de componenten in de formule worden anders berekend.

    σ2totaal is de som van alle variantiebronnen (A, B, AB en error) en σ2effect s de variantie voor het effect van de onafhankelijke variabele waarin we geïnteresseerd zijn, bijvoorbeeld A: σ2a

    Voor de fixed variabele (A) geldt:

    \[\omega^2_{\alpha}=\frac{\sigma^2_a}{\sigma^2_{totaal}}=\frac{\sigma^2_a}{(\sigma^2_a+\sigma^2_{\beta}+\sigma^2_{a\beta}+\sigma^2_e)}\]

    Voor de random variabele (A) geldt:

    \[\sigma^2_a=\frac{(a-1)(MS_A-MS_{AB})}{nab}\]

    Partieel effect

    Een betere maat van het effect is het partieel effect (partieel ω²), waarbij we het effect van de factor berekenen op basis van een deel van de variatie (zoals roken plus error) in plaats van de totale variatie SStotaal.

    • partieel ω² = σ2effect / (σ2effect + σ2e)

    d-familie

    Bij het bekijken van individuele groepen of sets van groepen is de d-familie beter te gebruiken. De d berekening wordt vrij gecompliceerd wanneer steekproefgroottes ongelijk zijn (ongebalanceerd design). Hier wordt alleen een gebalanceerd design besproken met gelijke aantallen in de steekproef.

    \[d=\frac{\hat{\Psi}}{s}\]

    • waarbij d het verschil tussen de groepen geeft in standaarddeviaties. De ‘hoedjes’ geven aan dat het schattingen zijn met gebruik van de steekproefdata.

    We gaan terug naar het voorbeeld van het Terughalen van informatie (een aantal woorden), bij Jongere en Oudere mensen en middels verschillende Onthoud Condities. Stel dat we geïnteresseerd zijn in het verschil tussen de ‘makkelijkere’ onthoud-methodes Tellen en Rijmen, versus de moeilijkere Adjectief (bijvoeglijk naamwoord) en Verbeelden.

    Voor het contrast maken we de coëfficiënten:

    Tabel 19

     

     

     

     

    Tellen

    Rijmen

    Adjectief

    Verbeelden

    Intentie

    -1/2

    -1/2

    1/2

    1/2

    0

    \[\Psi=(\frac{1}{2})(Gem_{tellen})+(-\frac{1}{2})(Gem_{rijmen})+(\frac{1}{2})(Gem_{adjectief})+(\frac{1}{2})(Gem_{verbeelden})+(0)(Gem_{intentie})\]

    Hierover kan vervolgens ook de t-waarde berekend worden. In de formule voor de effectgrootte komt de error term voor. Bij een normale one-way ANOVA op de Conditie variabele zou de term alleen de SSerror bevatten, maar de variabele leeftijd zal de scores beïnvloeden en hiervoor moeten we in de formule een aanpassing maken. Daarom brengen we SSleeftijd en SSleeftijd∙conditie ook in de formule (en wanneer we het effect van leeftijd onderzoeken, zullen we daartegenover rekening moeten houden met conditie).

    \[s_{error}=\sqrt{\frac{SS_{error}+SS_{Leeftijd}+SS_{L\times C}}{df_{error}+df_{Leeftijd}+df_{L\times C}}}\]

    Vervolgens kan de effectgrootte (d-waarde) berekend worden.

    Bij simpele effecten gebruiken we dezelfde berekeningen als hierboven. De error term s is die van het bijbehorende algemene effect.

    Hoe is de rapportage van de bevindingen opgebouwd?

    De rapportage van bevindingen van het onderzoek zou de volgende uitspraken kunnen bevatten:

    • Er was een significant Leeftijd effect (F(1,88)= 30.01, p < .05, ω² = .065), waarbij jongere participanten meer items onthielden dan oudere.
    • Er was ook een significant Conditie effect (F(4,90)= 45.13, p < .05, ω² = .544), en inspectie van de gemiddelden toonde dat er meer items onthouden werden wanneer de verwerking dieper was.
    • Ook de Leeftijd bij Conditie was significant (F(4,90)= 5.66, p < .05, ω² = .06), met een sterker effect voor conditie bij jongere participanten.
    • Een contrast van de lagere niveaus van verwerking versus de hogere niveaus toonde een statistisch significant effect met betere resultaten voor hogere niveaus (t (90) = 7.98, p < .05). Dit correspondeert met een effectgrootte van d = 2.05, wat aanduidt dat participanten met hogere niveaus van verwerking gemiddeld twee standaarddeviaties hoger scoren. Dit effect wordt nog groter wanneer we alleen kijken naar de jongere participanten d = 2.55.

    Wat is de procedure bij ongelijke steekproefgroottes?

    Eerder is al uitgelegd hoe we bij een one-way ANOVA kunnen corrigeren voor ongelijke steekproefgroottes. Bij meer complexe designs is de oplossing niet zo simpel. De rijen, kolommen en interactie effecten zijn niet meer onafhankelijk, waardoor de interpretatie bemoeilijkt wordt. De meest redelijke en algemene aanpak voor het corrigeren van ongelijke steekproefgroottes maakt gebruik van een computer berekening (zoals in SPSS).

    Welke hogere orde factoriale designs zijn er?

    In dit hoofdstuk is het factoriale design uitgelegd voor een design met twee factoren. Het design is echter ook vaak te gebruiken bij drie of meer factoren. De berekeningen zijn grofweg hetzelfde, het grote verschil zit in de aanwezigheid van meer dan één interactie-term. Neem de formule voor een design met drie factoren:

    \[X_{ijkl}=\mu+\alpha_i+\beta_j+\gamma_k+\alpha\beta_{ij}+\alpha\gamma_{ik}+\beta\gamma_{jk}+\alpha\beta\gamma_{ijk}+e_{ijkl}\]

    We zien hierbij twee soorten interactie-termen. De αβij, αγik en βγjk termen zijn eerste-orde interacties. Een tweede-orde interactie is de term αβγijk, die de drie variabelen samen neemt. Dit is in feite de interactie tussen AB op verschillende niveaus van C of AC en B of BC en A.

    Om de sum of squares van de interacties te verkrijgen wordt eigenlijk hetzelfde gedaan als bij een two-way design.  Voor SSBC nemen we de BxC cel gemiddelden, verkrijgen SScellenBC, en trekken hier de hoofdeffecten van B en C af. Ditzelfde geldt voor SSAB en SSAC. Voor SSABC kijken we naar de AxBxC cel gemiddelden, verkrijgen we SScellenABC en tekken de hoofdeffecten en lagere-orde interacties eraf voor SSABC.

    Voorbeeld

    We onderzoeken de rijvaardigheid van onervaren (A1) en ervaren (A2) mensen. Deze mensen rijden op drie typen wegen: eerste klas (B1), tweede klas (B­2) en derde klas (B3), en overdag (C1) of ’s nachts (C2). We hebben een 2 x 3 x 2 factoriaal design.

    Elke conditie krijgt vier participanten (in totaal 48 participanten), en we meten rijvaardigheid met het aantal stuurcorrecties over één kilometer.

    De berekeningen voor de algemene effecten zijn hetzelfde als bij een one-way ANOVA. Voor de eerste-orde interacties gelden de berekeningen als uitgelegd in de two-way ANOVA. Een nieuwe berekening is die van de tweede-orde interactie. Hiervoor moet eerst SScelABC berekend worden, wat de totale variatie is in cel gemiddelden in het hele design. Daarvan moet vervolgens de variatie worden afgetrokken die door de algemene effecten en de eerste-orde interacties wordt veroorzaakt. Dan blijft vanzelf de variatie over die alleen door het gedeelde effect van alle drie de variabelen is veroorzaakt: SSABC.

    • SSerror is vervolgens makkelijk te berekenen door SStotaal – SSABC.

    Uit de berekeningen komt een significant resultaat naar voren van alle hoofdeffecten en de interactie AC. Hiervoor kunnen we vervolgens dieper naar de verschillen gaan kijken (Howell, 2013: 450). Een plot van variabele C op de X-as, aantal stuurcorrecties op de Y-as en voor A1 en A2 in de grafiek laat zien, dat de onervaren bestuurder veel meer stuurcorrecties maakt wanneer er ’s nachts gereden wordt in vergelijking met overdag. Er is weinig verschil bij de ervaren bestuurder (een vrijwel horizontale lijn). Wellicht is er alleen een significant simpel effect van C bij onervaren bestuurders. Hiervoor berekenen we SSc voor A1 en A2 apart, en vervolgens voor beide A’s een aparte F. Uiteindelijk blijken de simpele effecten voor zowel onervaren als ervaren bestuurders significant: beide groepen bestuurders rijden significant slechter in het donker.

    Het simpele interactie effect is het effect van de interactie tussen twee variabelen bij individuele niveaus van de derde variabele.

    Access: 
    Public
    Hoe werkt de variantieanalyse bij herhaalde metingen designs? - Chapter 14

    Hoe werkt de variantieanalyse bij herhaalde metingen designs? - Chapter 14

    Dit hoofdstuk behandelt de variantieanalyse bij experimenten waar dezelfde participant bij alle niveaus van de onafhankelijke variabele(n) wordt gemeten.

    In voorgaande hoofdstukken hadden de verschillende cellen in de studie verschillende participanten, waardoor de cellen onafhankelijk waren. In designs waarbij dezelfde participant meerdere keren wordt gemeten, geldt dit niet meer. Dit leidt tot ingewikkelder formules. Vrijwel iedereen zal zulke analyses dan ook uitvoeren door middel van de computer. Het doel van het hoofdstuk is om de achterliggende berekeningen aan het licht te brengen voor een beter begrip van de analyse.

    In een herhaalde-metingen ontwerp worden participanten meerdere keren gemeten. In het geval waarbij de participanten drie keer worden gemeten (X1, X2 en X3), is er waarschijnlijk sprake van een correlatie tussen hun scores: de betere participanten bij X1 presteren waarschijnlijk ook beter op de andere meetmomenten. Een van de voordelen van het herhaalde-metingen ontwerp is dat we deze correlatie of afhankelijkheid tussen de scores van dezelfde persoon kunnen scheiden van de totale variatie: we zeven het effect door afhankelijkheid weg. De participant verschillen kunnen verwijderd worden van de error, waardoor de error onafhankelijk is van behandeling tot behandeling.

    Verschillen tussen de participanten (dus binnen behandelingen) hebben niets te maken met het behandeleffect. Als deze verschillen eruit gehaald kunnen worden zal dit leiden tot een betere schatting van de error. Er zijn twee manieren om dit te doen:

    1. Alle bijdragen van de participanten worden samengenomen door de gemiddelden gelijk te maken:

    \[X'_{ij}=X_{ij}-\bar{X_i}\]

    • x̄i is het gemiddelde van de i-de participant. De participanten zullen nu dezelfde gemiddelden hebben en de overige verschillen komen door error of behandelingen.

    2. Om alleen de variatie door behandeleffect over te houden, beginnen we met het aftrekken van de SSbetween subj (SS tussen participanten) van SStotaal. Van de variatie binnen de subjecten is een deel afkomstig van de behandelingen en een deel door error.

    De totale variantie (met kn-1 df) wordt verdeeld in between subjects (met n-1 df) en within subjects (met n(k-1) df). Vervolgens kan de within subjects verder worden onderverdeeld in ‘tussen behandelingen’ (met k-1 df) en error (met (n-1)(k-1) df).

    Wat is het achterliggende model bij herhaalde-metingen analyse?

    Het model achter de herhaalde-metingen analyse is:

    • Xij = µ + πi + тj + πтij + eij, waarbij:
    • μ = het totale gemiddelde
    • πi = een constante voor de i-de participant, die weergeeft hoeveel hij verschilt van de gemiddelde persoon
    • τj = een constante voor de j-de behandeling, die weergeeft hoeveel dat behandelgemiddelde verschilt van het gemiddelde behandelgemiddelde
    • πτij = de participant x behandeling interactie
    • eij = de error voor persoon i in behandeling j

    Hierbij gelden twee assumpties: πi, eij en πтij zijn onafhankelijk en normaal verdeeld rond nul binnen elke behandeling. Hun varianties zijn homogeen over de behandelingen.

    Voor het berekenen of er sprake is van een significant effect gebruiken we de volgende formule (incl. interactie):

    \[F=\frac{E(MS_{between subject})}{E(MS_{error})}=\frac{(\sigma^2_e+k\sigma^2_{\pi})}{\sigma^2_e+\sigma^2_{\pi\tau}}\]

    en

    \[F=\frac{E(MS_{behandeling})}{E(MS_{error})}=\frac{(\sigma^2_e+\sigma^2_{\pi\tau}+n\Theta^2_{\tau})}{\sigma^2_e+\sigma^2_{\pi\tau}}\]

    Wat is er belangrijk bij de covariantie?

    Een belangrijke voorwaarde voor de herhaalde-metingen analyse is dat de covarianties tussen de metingen gelijk zijn aan elkaar. Om dit te controleren, kunnen we in een tabel de varianties van de metingen uiteenzetten. De diagonaal geeft de varianties binnen elke behandeling. De off-diagonal elementen zijn de covarianties tussen de behandelingen. Bij constante varianties binnen een behandeling en tussen de behandelingen, hebben we compound symmetry (samenstelling symmetrie). Over het algemeen wordt deze voorwaarde sfericiteit (letterlijk: bolvormigheid) genoemd. Zonder sfericiteit kan het zijn dat de F-waarden niet verdeeld zijn zoals in de tabellen staat aangegeven.

    Als de cellen onafhankelijk zijn in een variantieanalyse, zijn de covarianties altijd nul. Bij herhaalde metingen is dit niet het geval en moeten we aannemen dat de covarianties elijk zijn. Bij de multivariate variantieanalyse is de assumptie van gelijke covarianties niet nodig. Deze methode wordt later geïntroduceerd.

    Een voorbeeld

    Als voorbeeld kijken we naar een studie over migraine en de werking van ontspanningstechnieken daarbij. We laten negen participanten met migraine de duur van hun hoofdpijn noteren. Na twee weken baseline geven we ze drie weken lang een training in ontspanning. De afhankelijke variabele is de duur van de hoofdpijn. Voor elke week rekenen we de gemiddelde duur uit, met XW als weekgemiddelde. X.. staat voor het totale gemiddelde, en XS voor het gemiddelde per participant.

    • Voor SStotaal geldt:

    \[\sum(X-\bar{X})^2\]

    • Voor SSsubjects geldt:

    \[w\sum(\bar{X_s}-\bar{X_{..}})^2\]

    • Voor SSweken geldt:

    \[n\sum(\bar{X_W}-\bar{X})^2\]

    • En SSerror = SStotaal – SSsubjects – SSweken

    De Fweken (= 84.01) is een significante score bij F.05 (4, 32) = 2.68. We kunnen de nulhypothese (H0: μ1 = μ2 = .. = μ5) verwerpen: het ontspanningsprogramma leidt tot een vermindering van de duur van de hoofdpijn.

    De error term is gelijk aan het interactie effect tussen participant en weken in dit geval. Het grote voordeel van de herhaalde-metingen analyse, is dat door het gebruik van dezelfde groep participanten de error term een stuk kleiner wordt. Dit zorgt voor een grotere F.

    Contrasten

    We weten nu dat dat er statistisch significante verschillen tussen de vijf weken zitten, maar niet waar deze verschillen zich bevinden. Stel dat we de weken voorafgaand aan de behandeling (week 1 en 2) willen vergelijken met het gemiddelde van de drie trainingsweken. Dit doen we met een contrast. Week 1 en 2 krijgen coëfficiënt 1/2, en week 3 t/m 5 krijgen

    -1/3. De formule voor het contrast is zoals eerder:

    \[\hat{\Psi}=\frac{1}{2}\bar{X_1}+\frac{1}{2}\bar{X_2}+(-\frac{1}{3})\bar{X_3}+(-\frac{1}{3})\bar{X_4}+(-\frac{1}{3})\bar{X_5}\]

    Dan geldt:

    \[t={\hat{\Psi}}{\sqrt{\frac{(\sum{a^2_i})MS_{error}}{n}}}\]

    • de error term is van de totale analyse.

    In het geval van ons voorbeeld is de t = 18,21 met 32 df, en duidelijk significant

    Effectgrootte

    Voor de effectgrootte geldt weer:

    \[d=\frac{\hat{\Psi}}{s_{error}}\]

    Het contrast is middels hierboven te berekenen, maar voor serror moeten we een aanvullende berekening maken. We willen een error term die uniek is voor het betreffende contrast. De beste serror is de standaarddeviatie van het gemiddelde van de baseline (vóór de behandeling) scores. Als d=4.98, kunnen we zeggen dat de hoofdpijnen tijdens de training vijf standaarddeviaties minder waren dan tijdens de baseline.

    Andere designs – één between subjects en één within subjects variabele

    Het voorgaande was een simpel voorbeeld waarbij we één onafhankelijke variabele hadden (naast de participanten) en elke participant op elk niveau van die variabele testten. Natuurlijk zijn veel variaties mogelijk op de herhaalde-metingen analyse. Hier volgen wat voorbeelden.

    Stel dat we de tolerantie van ratten onderzoeken op een medicijn dat hun motorische activiteit verminderd. Net als bij het voorbeeld van de morfine-tolerantie, krijgen ratten snel weerstand tegen het medicijn en neemt hun motorische activiteit weer toe. We willen onderzoeken of de tolerantie omgeving gebonden is. We hebben een groep ‘Zelfde’, die een aantal keer wordt ingespoten met het medicijn en op de testdag weer, in dezelfde omgeving. De groep ‘Anders’ krijgt ook injecties maar op de testdag op een andere plek. Een controlegroep kreeg telkens een zoutoplossing toegediend, en pas op de testdag voor het eerst het medicijn. We verwachten dat de ‘Anders’ groep ongeveer reageert zoals de controlegroep, omdat de testomgeving waarin ze het medicijn krijgen, veranderd is. Er zal dus waarschijnlijk geen tolerantie optreden.

    De afhankelijke variabele is motorische activiteit. We meten na de injectie zes keer elke vijf minuten de activiteit (daarna gaat het medicijn uit het systeem). Elke groep heeft dus zes meetmomenten.

    Er is een aantal variatietermen die van belang zijn. De totale variatie bestaat ten eerste uit Between subjects variatie enerzijds en Within subjects anderzijds. Bij SSbetween horen de verschillen tussen groepen participanten SSgroepen en de verschillen tussen participanten in dezelfde groep SSwithin groups. Bij SSwithin hoort SSinterval (het hoofdeffect van interval), SSI x G (de interactieterm) en SSI x SS within groups.

    Hiervoor geldt:

    • SSwithin subjects = SStotaal – SSbetween subjects
    • SSwithin groups = SSbetween subjects – SSgroups
    • SSI x SS within groups = SSwithin subjects – SSintervals - SSIG

    Between subjects

    Wanneer we de intervallen even negeren, en per participant één gemiddelde score nemen over de totale tijd, dan krijgen we drie groepen scores op basis van Groep (Controle, Zelfde en Anders). De analyse die daar van toepassing is, is de one-way ANOVA met onafhankelijke groepen. De error term die we dan gebruiken, noemen we ook wel errorbetween.

    Within subjects

    De term Interval x SS Within groups wordt ook wel errorwithin genoemd, en we gebruiken hem als error term voor de within-subjects effecten. De SSinterval x Ss within groups is de som van de sum of squares voor de I x S interacties, apart berekend voor elke groep.

    Vrijheidsgraden

    De individuele verschillen zullen door de analyse er uit gefilterd worden. Uit de ruwe scores is te halen dat de ‘Anders’ groep inderdaad meer lijkt op de controlegroep, dan de ‘Zelfde’ groep. De berekeningen zijn verder bekend. Of een factor between-subjects of within-subjects is maakt niet uit, de berekening van de SS blijft hetzelfde. Het heeft echter wel invloed op de berekening van de F-waarde.

    Voor de algemene effecten Intervallen, Groepen en Participanten geldt dat het aantal df gelijk is aan het aantal niveaus min 1. Voor de interacties geldt het product van de betreffende hoofdeffecten. De overige vrijheidsgraden zijn als volgt te berekenen:

    • dfwithin subjects = dftotaal - dfbetween subjects
    • dfSs within groups = dfbetween subjects - dfgroups
    • dfIxSs within groups = dfwithin subjects - dfinterval - dfIG

    De mean squares worden opnieuw gevonden door de sum of squares te delen door hun vrijheidsgraden.

    F

    Voor het berekenen van de F krijgen we een tabel met vijf F scores. Voor de algemene effecten Groep en Intervallen en voor de interactie-term is er een significant effect. De interactie-term weerspiegelt dat het injecteren van een dier in een nieuwe omgeving de opgebouwde tolerantie bijna helemaal opheft. Een verdere analyse van de resultaten komt later.

    Voorwaarde checken

    Voor deze studie geldt weer dat we moeten checken op voorwaarden, namelijk die van normaliteit, homogeniteit van variantie en sfericiteit van Σ. Voor dat laatste betekent het dat we aannemen dat de variantie van individuele gemiddelden binnen een niveau van Groep hetzelfde is als die in de andere niveaus van Groep (de between-subjects term). Schending van deze assumptie is echter niet zo’n groot probleem. Bij onafhankelijke groepen met homogene varianties is sfericiteit in orde, omdat de off-diagonals nul zijn.

    Twee andere assumpties zijn:

    1. De individuele variantie-covariantie matrixed zijn hetzelfde voor alle niveaus van G.
    2. De variantie matrix voldoet aan compound symmetrie. Dit is echter een erg strenge assumptie, en vaak is het al genoeg om aan te nemen dat de standaardfouten van de verschillen tussen paren van Interval gemiddelden constant zijn. Dat wil zeggen:

    \[\sigma^2_{{I_i}-\bar{I_j}}\]

    Aanpassen van vrijheidsgraden

    Voor een afwijking in de sfericiteit kan nog gecorrigeerd worden met een aanpassing in het aantal vrijheidsgraden. De vrijheidsgraden voor de F-toets zullen als volgt zijn:

    • (g - 1)(i - 1)ε, g(n - 1)(i - 1)ε

    De variantieanalyse is wel vrij robuust voor schending van de voorwaarde.

    Simpele effecten

    De interactie-term was significant, maar nu moet nog worden onderzocht hoe de interactie tot stand komt. De eerste stap is het plotten van de drie groepen en het bekijken van de verschillen. Hieruit is zichtbaar dat de ‘Zelfde’ groep altijd hoger scoort dan de andere twee groepen en dat de activiteit erg afneemt na het eerste interval. Ook is duidelijk dat de 'Anders' groep na het eerste interval vrijwel gelijk is aan de Controlegroep, zoals we hadden voorspeld. Daarnaast neemt de ‘Zelfde’ groep over vier intervallen af, terwijl de ‘Zelfde’ en controlegroep na het tweede interval niet meer afnemen, maar ongeveer gelijk blijven.

    Voor het berekenen van de simpele effecten moeten we corrigeren voor sfericiteit, als deze voorwaarde is geschonden. Dit doen we door een aparte error term te berekenen voor elk simpel effect (dus, als we kijken naar het simpele effect van Interval op de Controlegroep, spreekt de error term puur voor dat effect).

    Wanneer we de simpele effecten van Interval op elk van de drie groepen apart berekenen, hebben we in feite te maken met een herhaalde-metingen analyse (one-way) op elke groep. Voor elke analyse krijgen we vanzelf een aparte error term. Alle analyses van interval op de drie groepen zijn significant.

    Wanneer we de between-subjects effecten (Groep op Interval 1 bijvoorbeeld) willen berekenen, kunnen we kiezen voor de methode hierboven, maar we verliezen hiermee veel vrijheidsgraden (we hebben immers zes intervallen). In feite doen we zes keer een one-way ANOVA. Om meer vrijheidsgraden te behouden, poolen we de error term (een soort gemiddelde over de zes losse analyses). De juiste error term vinden we door SSwithin cell = SSwithin group+ SSI x S within group.

    Elke analyse wordt vervolgens met dezelfde error term uitgevoerd. De F-waarde wordt op de volgende manier berekend:

    • f’ = (u + v)2/(u2/dfu + v2/dfv), waarbij
    • u = SSSs within groups
    • v = SSIxSs within groups

    Uit de analyses blijkt dat alleen bij Interval I een significant verschil was tussen de groepen.

    Wat is de procedure bij twee between-subjects variabelen en één within-subjects variabele?

    De berekeningen bij meer variabelen lijken sterk op die met slechts twee variabelen. Stel dat we de preventie van HIV infectie onderzoeken met twee behandelingen: een gedragstraining (GT) van acht weken en een twee uur durend onderwijsprogramma als controleconditie (OC). We meten voor de behandeling, vlak erna, en zes en twaalf maanden na afsluiting, bij zowel mannelijke als vrouwelijke adolescenten. Het design is 2x2x4 met interventie en sekse als between-subjects factor en tijd als de within-subjects factor. De afhankelijke variabele is de frequentie van condoomgebruik. In Tabel 20 is de somtabel van de analyses gegeven.

    Tabel 20

    Bron

    df

    SS

    MS

    F

    Between subjects

    39

    21490.34

     

     

    Groep (conditie)

    1

    107.26

    107.26

    0.21

    Sekse

    1

    3358.06

    3358.06

    6.73*

    GXS

    1

    63.78

    63.78

    0.13

    Ss within groups

    36

    17961.28

    498.93

     

    Within subjects

    120

    13914.25

     

     

    Tijd

    3

    274.07

    91.36

    0.90

    TXG

    3

    1377.82

    459.27

    4.51*

    TXS

    3

    779.92

    259.97

    2.55

    TXGXS

    3

    476.42

    158.81

    1.56

    TXSs within groups

    108

    11006.03

    101.91

     

     

     

     

     

     

    *p < .05

     

     

     

     

    • SSwithin subjects = SStotaal - SS­between subjects
    • SSSs within groups = SS­between subjects - SSG - SSS - SSGS
    • SSTxSs within groups = SSwithin subjects - SST - SSTG - SSTS - SSTGS

    De laatste twee termen zijn errortermen van between-subjects en within-subjects effecten.

    In de tabel zien we dat het algemene effect voor Sekse significant is. Dit houdt in dat er een verschil is tussen jongens en meisjes. De meisjes blijken een lagere frequentie te rapporteren van condoomgebruik dan jongens (na latere analyse blijkt dit te liggen aan een lagere frequentie van seks). Het interactie effect voor TijdxGroep is wat de onderzoekers interessant vonden en dit is significant. Ze wilden dat de GT groep zou veranderen over tijd (een hogere condoomfrequentie) en de OC niet. En dit is gebeurd. We zijn niet geïnteresseerd in het algemene effect van groep: we willen dat de groepen gelijk zijn bij de pretest, en dit zorgt voor verduistering van groepseffecten tijdens de behandeling (een significant effect zou dus een probleem kunnen vormen).

    Simpele effecten

    Eerste bekijken we de between-subject simpele effecten: hoofdefecten van groep en sekse op elk tijdstip, en sekse x groep simpel interactie effect op elk tijdstip. We willen het interactie-effect TijdxGroep nader gaan bekijken. De makkelijkste manier om dit te doen is door aparte two-way analyses (GroepxSekse) voor elk niveau van de Tijd variabele (op elk meetmoment) uit te voeren. Zo kunnen we bijvoorbeeld bekijken of GT en OC significant van elkaar verschillen op de zes maanden follow-up meting. Doe alleen die analyses waar je interesse in hebt, want elke aparte ANOVA vergroot de kans op een Type I error.

    Je kan de F-waarde acepteren of de errortermen van de vier analyses poolen en deze term gebruiken in de berekening. Bij heterogene termen, is het niet handig om ze te poolen. Bij homogene varianties kan het wel, omdat er dan meer vrijheidsgraden zijn.

    Hiernaast kunnen we within-subjects effecten bekijken, zoals het simpele effect van Tijd voor elke Groep apart. Zo kunnen we onderzoeken of de GT groep significant over tijd verandert. Wanneer we het simpele effect van GT over tijd berekenen, blijkt uit de analyse dat er wel een significant verschil is voor Sekse (meisjes hebben een lagere frequentie van condoomgebruik), maar niet voor Tijd of TijdxSekse interactie. Dit betekent, dat wanneer we het gemiddelde nemen over sekse, er geen significante verandering is in het condoomgebruik tussen de twee interventies. Dit simpele effect weerlegt dus het algemene significante effect van TijdxGroep wat we eerder vonden.

    Wat is de procedure bij twee within-subjects variabelen en één between-subjects variabele?

    Bij meerdere between subjects variabelen kunnen we makkelijk een uitbreiding maken van ons originele model, door een extra hoofd en interactie effect toe te voegen. Dit is niet zo met meerdere within subjects variabelen. Nu krijgen we namelijk meerdere error termen. Een voorbeeld hiervan is dat we het vorige onderzoek uitbreiden met een extra conditiegroep. In dit geval zullen er vier errortermen zijn.

    Dit kan als volgt worden uitgevoerd in SPSS: Analyze > General Linear Model > Repeated Measures. Er kan worden aangegeven welke plots men wil zien, welke contrasten uit te voeren en welke beschrijvende statistieken men wil zien.

    Op welke manier bereken je de intraclass correlatie?

    Een belangrijk onderdeel van het uitvoeren van analyses is het bekijken of de metingen wel betrouwbaar zijn. Stel dat we meerdere onderzoekers het gedrag van participanten laten beoordelen. Dan willen we in een ideaal geval dat alle onderzoekers precies dezelfde scores geven aan de participant. Wanneer we dan variatie in scores hebben, is dit door de participant en niet door verschillen tussen beoordelaars of random error.

    In een andere situatie beoordelen de onderzoekers de kinderen wel op gelijke volgorde, maar komen de niveaus van het gedrag in de beoordeling niet overeen. In dit geval is er variabiliteit tussen de kinderen, maar ook tussen de beoordelaars. Er is echter nog steeds weinig random error. Dit is het meest realistische model. In een situatie waarin de beoordelaars het niet alleen oneens zijn over de niveaus, maar ook over de volgorde van de kinderen, komt een groot deel van de variabiliteit door errorvariantie.

    De intraclass correlatie is een manier om de mate van overeenstemming tussen beoordelaars weer te geven. De meest gebruikte methode om de intraclass correlatie te vinden, is als volgt. We zien de beoordelaars als een willekeurige steekproef van alle mogelijke beoordelaars. Deze mensen beoordelen dezelfde groep participanten. Voor de score van een participant geldt:

    \[X_{ij}=\mu+\alpha_i+\pi_j+\alpha\pi_{ij}+e_{ij}\]

    waarbij α het effect is van de i-de beoordelaar, πj voor het effect van de j-de participant, απij de interactie tussen hen (de mate waarin de beoordelaar anders gaat beoordelen wanneer hij die participant ziet) en eij de error. Voor een effectgrootte meting (zoals de r2 familie) berekenen we een variantie ratio. Dus geldt:

    • Intraclass correlatie =

    \[\frac{\sigma^2_{\pi}}{(\sigma^2_{\alpha}+\sigma^2_{\pi}+\sigma^2_{\alpha\pi}+\sigma^2_e)}\]

    Als de meeste variatie komt door verschillen tussen participanten, en niet door verschillen tussen beoordelaars, dan zal de ratio de 1.00 naderen. Hoe meer verschillen tussen beoordelaars, hoe kleiner de ratio zal worden. Dit gebeurd ook bij een beoordelaar x participant interactie en als er veel error in de ratings aanwezig is.

    In dit geval is de formule voor de intraclass correlatie:

    • (MSparticipant - MSBxP)/(MSparticipant + (j - 1)MSBxP + j(MSbeoordelaar - MSBxP)/n). j is hierbij het aantal beoordelaars en n het aantal participanten.

    Wat is er nog meer belangrijk bij herhaalde-metingen designs?

    Naast de betrouwbaarheid van de scores, krijgen we bij herhaalde metingen designs ook te maken met een opeenvolgings-effect of carry-over effect. Dit houdt in dat de eerste of eerdere behandeling de reactie op een volgende behandeling beïnvloedt. Er moet dan goed nagedacht worden of men een herhaalde-metingen design wil gebruiken.

    Bij een herhaalde metingen analyse zal een drop-out uit de studie vaak betekenen dat de scores voor die participant bij elke meting missen. Hierdoor blijven de aantallen scores proportioneel, maar wel met ongelijke groepsgroottes. Als een participant een deel van het onderzoek mee heeft gedaan, is aan te raden hem helemaal uit de data te verwijderen. Wanneer maar één of twee scores missen, kunnen deze vervangen worden door schattingen.

    Het verschil tussen een herhaalde-metingen ontwerp en normale factoriële ontwerpen, is dat de off-diagonal elementen van ∑ niet nul zijn, oftewel de behandelingen zijn gecorreleerd. Het herhaald gebruiken van participanten leidt tot deze correlaties, maar dit is ook het geval bij gematchte steekproeven.

    Waartoe dient het mixed models design?

    Een van de nadelen van het originele model van herhaalde metingen is dat deze gevoelig is voor sfericiteit van de data. Daarnaast moet de dataset compleet zijn. Als een participant één score mist in de reeks, dan moet deze verwijderd worden uit de analyse. Een alternatieve methode voor herhaalde metingen, die niet afhangt van sfericiteit of complete data, is het mixed models design (of hiërarchisch modeleren). In dit ontwerp maken we gebruik van maximum likelihood of restricted maximum likelihood (REML).

    Het mixed model is te ingewikkeld om met de hand te berekenen, een programma zoals SPSS is nodig. In de SPSS is de tabel ‘Covariance Parameters’ te vinden. De ‘CS diagonal offset’ geeft de residuele variantie weer. Het is de error term voor within-subjects tests bij gebalanceerde ontwerpen. De ‘CS covariance’ lijn is de variantie van de intercepten.

    Als er twee modellen zijn, moet beoordeeld worden welke beter is. Hierbij kan gekeken worden naar de ‘Information Criteria’. Het model met een lagere waarde van Akaike’s Information Criterion (AIC) of Bayesian Information Criterion (BIC) is het betere model. Mixed models zijn handig in het vergelijken van modellen. Het grote nadeel van het mixed model is dat het moeilijk te specificeren is, en ook moeilijk te interpreteren.

    Access: 
    Public
    Wat is de procedure bij multipele regressie? - Chapter 15

    Wat is de procedure bij multipele regressie? - Chapter 15

    In dit hoofdstuk hebben we de situatie waarbij we één criterium variabele Y hebben, en meerdere predictors (voorspellers) X1, X2, etc., en we willen Y voorspellen op basis van alle predictors. Vanwege de uitgebreide berekeningen wordt in het hoofdstuk vooral ingegaan op de computer-analyses.

    Wat is multipele lineaire regressie?

    Bij multipele regressie willen we bijvoorbeeld de prestatie van leerlingen op een masteropleiding voorspellen aan de hand van hun gemiddelde in de bachelor (X1), het aantal vakken dat ze hebben gevolgd in de bachelor (X2) en de kwaliteit van hun cv (X3). Vaak kijken we naar de relatie tussen variabelen en niet naar de voorspelling via de regressievergelijking.

    De multipele regressieformule is:

    \[\hat{Y}=b_0+b_1X_1+b_2X_2+...+b_pX_p\]

    waarbij b0 de intercept is en b1 en b2 regressie coëfficiënten voor de voorspellers X1 en X2. We proberen nog steeds

    \[\sum(Y-\bar{Y})^2\]

    zo klein mogelijk te houden, zodat de voorspelde waarde zo dicht mogelijk bij de ware waarden van Y liggen.

    Voorbeeld

    Als voorbeeld kijken we naar een studie over de kwaliteit van primair en secundair onderwijs, en hoe we die kunnen verbeteren. Een onderzoeker verzamelde data van 50 staten in de VS, waaronder de hoeveelheid geld die aan onderwijs werd besteed, de student/leraar ratio, het salaris van de leraar, het percentage studenten dat meedeed aan de SAT examens, en de gecombineerde SAT score. Het percentage studenten die de ACT heeft gedaan en de gemiddelde ACT score kunnen hier nog aan worden toegevoegd. We zijn geïnteresseerd in de kwaliteit van het onderwijs, dus we kijken naar de prestatie op de SAT (een schooltest).

    Een eerste stap is het plotten van de data, om te controleren voor een normale verdeling. Dit doen we met histogrammen, qqplots en scatterplots. Hierin is zichtbaar dat de variabelen niet normaal verdeeld zijn. De criterium variabele en drie voorspellers zijn redelijk normaal verdeeld, terwijl de verdeling van het percentage studenten die de SAT’s gemaakt heeft bimodaal verdeeld is. De relatie tussen PctSAT en SAT is curvilineair, maar kan met een loge transformatie meer lineair gemaakt worden.

    Daarna kunnen relaties tussen de verschillende predictors en SAT prestatie berekend worden, door middel van een Pearson correlatie. We gaan ervanuit dat als er meer geld aan onderwijs besteed wordt, de uitkomst van de SAT beter is. Hieruit blijkt dat uitgaven aan onderwijs in een staat en de prestatie op de SAT negatief samenhangen

    (r = -.381, p = .006) en deze correlatie is significant. Dit zou betekenen dat hoe meer we uitgeven aan onderwijs, hoe slechter de kinderen presteren. Niet wat je zou verwachten dus. Een verklaring hiervoor is dat niet alle universiteiten geïnteresseerd zijn in de SAT score, en in sommige staten slechts een klein percentage de SAT test krijgt. De topuniversiteiten die de SAT wel afnemen nemen alleen de beste studenten aan. Daardoor varieert het percentage studenten die de SAT’s maakt enorm tussen de staten. In de staten waar weinig studenten de SAT’s doen, zal dit waarschijnlijk zijn omdat zij naar de beste scholen toe willen en dus beter presteren. Wat hier gebeurt, is dat het percentage studenten dat in een staat meedoet aan de SAT, de gemiddelde score beïnvloedt.

    Een volgende stap is daarom te kijken wat de relatie is tussen uitgaven aan onderwijs en prestatie op de SAT, wanneer we controleren voor het percentage deelnemers aan de SAT (PercSAT). In feite brengen we nu twee predictors tegelijkertijd bij de SAT score. Wat we daarbij doen, is de relatie tussen uitgaven en SAT scores bekijken bij een constante PercSAT. Dit gebeurt door middel van SPSS: we laten SPSS berekenen wat de gemiddelde correlatie is van uitgave en SAT score per waarde van PercSAT (dus bij 40%, 50%, etc.). Met de werkelijke data is dit niet te doen, want we hebben maar 50 staten. SPSS maakt de berekeningen op basis van een hypothetische populatie aan staten van vele duizenden staten.

    De analyse

    Wanneer we de analyse uitvoeren, zien we het verschil tussen één predictor en beide predictors tegelijkertijd (Tabel 21). Bij alleen uitgaven als predictor is de correlatie met SAT score -.381. Wanneer PercSAT erbij komt, wordt de correlatie .941 (zie tabel Model samenvatting).

    Tabel 21: Model samenvatting

    Model

    R

    R kwadraat

    Aangepaste R2

    Standaard schattingsfout

    1

    .381

    .145

    .127

    69.909

    2

    .941

    .886

    .881

    25.781

    Zoals in de tabel te zien, worden de correlaties positief weergegeven. Dat is altijd het geval bij multipele regressie, terwijl de simpele Pearson correlatie positief en negatief kan zijn. De R kwadraat kolom geeft aan hoeveel variatie van de SAT scores verklaard is door de voorspeller(s). Bij Model 1 verklaren we 14,5% van de variatie in SAT scores met alleen uitgave als predictor. De aangepaste R2 is een schatting van de gekwadrateerde correlatie in de populatie.

    Waar komt ANOVA kijken?

    Model

    SS

    df

    MS

    F

    Sig.

    1 Regressie

    39722.06

    1

    39722.06

    8.13

    .006

    2 Regressie

    243065.91

    2

    121532.95

    182.83

    .000

    In de tabel ANOVA wordt de significantie van de regressie getest. We toetsen of de multipele correlatiecoëfficiënt significant verschilt van nul. Bij Model 1, met een correlatie van -.381, hoort een F van 8.13. De kans dat we een correlatie krijgen die zo hoog is, terwijl de nulhypothese eigenlijk waar is, is slechts .006. We mogen de nulhypothese dus verwerpen.

    Bij Model 2 zijn twee predictors in het spel. De tabel ANOVA geeft aan of de multipele correlatie van beide voorspellers significant verschilt van nul. De overschrijdingskans is .000, dus de correlatie is significant. Als laatste kunnen we ook nog vragen of de predictors apart significant bijdragen aan de relatie (zie Tabel 21).

    Tabel 22: Coëfficiënten

    Model

    Niet gestandaar-

    diseerde

    coëfficiënten

    Gestandaa-rdiseerde coëfficiënten

     

    95% betrouwbaarheidsinterval voor B

     

    B

    Standaard

    fout

    Beta

    t

    Sig.

    Ondergrens

    Bovengrens

    1 Constante

    1089.29

    44.39

     

    24.54

    .000

    1000.04

    1178.55

    Uitgave

    -20.89

    7.33

    -.381

    -2.85

    .006

    -35.63

    -6.16

    2 Constante

    1147.10

    16.70

     

    68.68

    .000

    1113.50

    1180.70

    Uitgave

    11.13

    3.26

    .20

    3.41

    .001

    4.56

    17.70

    PercSAT

    -78.20

    4.47

    -1.04

    -17.49

    .000

    -87.20

    -69.21

    Uit Tabel 22 kunnen we de coëfficiënten afleiden van de multipele regressieformule. Voor Model 2 vinden we dat de coëfficiënt voor uitgaven 11.13 is, en voor PercSAT -78.20. Het intercept b0 is de constante 1147.10. Dit geeft de volgende regressievergelijking:

    \[\hat{Y}=1147.10+11.13(Uitgave)-78.20(PercSAT)\]

    Deze vergelijking kan ingevuld om de gemiddelde SAT score in een staat te voorspellen. Deze voorspelde score kan afwijken van het werkelijke gemiddelde. Deze afwijking heet de residuele error.

    Vergelijk Model 1 met Model 2: nu we gecontroleerd hebben voor PercSAT is de relatie tussen uitgaven en prestatie ineens positief geworden (een positieve coëfficiënt): hoe meer er uit gegeven wordt aan onderwijs, hoe hoger de SAT score. Uit de kolom ‘Sig.’ kunnen we afleiden dat beide predictors significant bijdragen aan de relatie.

    Een andere interpretatie

    De verschillen in SAT komen deels door verschillen in Uitgave en deels door verschillen in PercSAT. We willen de verschillen in SAT en Uitgave, die door PercSAT komen, elimineren, en vervolgens deze nieuwe variabelen correleren. Wat je kan doen is de voorspelde waarden krijgen bij het voorspellen van Uitgave uit PercSAT. Deze scores trek je af van de ware scores. Het overige zijn residuen (ResidUitgave), die onafhankelijk zijn van PercSAT. Hetzelfde kan je doen voor de SAT scores, wat ResidSAT geeft, onafhankelijk van PercSAT. Deze aangepaste variabelen kunnen in een regressieanalyse geanalyseerd worden. De correlatie tussen deze aangepaste variabelen is .445.

    Een andere optie is de voorspelde SAT scores berekenen. Deze noemen we VoorspSAT. Vervolgens bekijken we de correlatie tussen de voorspelde SAT scores en de eigenlijke SAT scores, die .941 is. Dit is onze multipele correlatie.

    Hoe worden meer predictors toegevoegd?

    Als uitbreiding op de voorgaande analyse kunnen we nog meer predictors toevoegen. Middels de tabel ‘coëfficiënten’ (zoals Tabel 7) is dan te controleren of de toevoeging van die predictors significant bijdraagt.

    Bij meerdere predictors kan SPSS ook informatie geven over tolerantie en de variantie inflatie factor (VIF). VIF is de mate waarin de predictor variabelen onderling gecorreleerd zijn (dit heet multicollineariteit). Hoe meer de predictors onderling correleren, hoe groter de standaardfout van het regressiecoëfficiënt wordt, hoe groter het betrouwbaarheidsinterval wordt en hoe kleiner de t waarde van de coëfficiënt. We willen dus zo min mogelijk collineariteit en daarom een lage VIF.

    Tolerantie wordt berekend door 1 - R2j, waarbij Rj de multipele correlatie is tussen variabele j en alle andere predictor variabelen. We willen dus een zo hoog mogelijke tolerantie: hoe hoger de tolerantie, hoe minder overlap tussen de predictors. Bij zeer lage toleranties kan de stabiliteit van het model in gevaar zijn. Als een predictor perfect gecorreleerd is met andere predictors heet dit een singular covariantie matrix. Het model wordt dan niet genereerd door computer software.

    Let op dat de grootte van de coëfficiënten geen indicatie is voor de belangrijkheid van de bijbehorende predictor. Ook al is de coëfficiënt voor uitgaven veel kleiner dan die van PercSAT, dit heeft alleen te maken met de standaarddeviaties van de predictors.

    Wanneer worden gestandaardiseerde regressie-coëfficiënten gebruikt?

    Het belang van een predictor is niet direct af te leiden uit zijn regressie-coëfficiënt. Toch kunnen we wel iets zeggen over de bijdrage van een predictor aan de regressie-formule. Hiervoor standaardiseren we onze variabelen (dit zet het gemiddelde op 0 en de standaarddeviatie op 1). De regressie-coëfficiënten heten dan gestandaardiseerde regressie-coëfficiënten en worden in SPSS ‘Beta’ genoemd (β). In het voorbeeld wordt de regressie-formule:

    \[\hat{Y}=0.023Z_{Uitgaven}-1.040Z_{PercSAT}\]

    (bij gestandaardiseerde variabelen is het intercept gelijk aan 0).

    We zien dat wanneer Zuitgaven toeneemt met 1, en wanneer we PercSAT constant houden, dat Y dan 0.203 standaarddeviaties toeneemt. Wanneer ZPercSAT toeneemt met 1, is dat een verschil in Y van -1.040. Hieruit kunnen we afleiden dat PercSAT waarschijnlijk een belangrijke predictor is dan Uitgaven (een grove schatting).

    Een regressiecoëfficiënt toetsen we altijd voor significantie. Het maakt niet uit of dit gedaan wordt met de ruwe score coëfficiënten of gestandaardiseerde coëfficiënten. Voor de toets hebben we de standaardfout van de statistiek nodig. Dit is de variabiliteit van de statistiek over de herhaalde steekproeven. De toets is als volgt:

    \[t=\frac{b_j-b_j*}{s_{b_j}}\]

    • met N - p - 1 vrijheidsgraden.

    Om de nulhypothese: bj* = 0 te testen gebruiken we t = bj/sbj.

    Waartoe dient de resampling methode?

    De resampling methode is een alternatief voor de traditionele berekening van hierboven. Hierbij nemen we onze steekproef van 50 staten in de VS als populatie, en door middel van herhaaldelijk steekproeftrekken met vervanging uit deze populatie maken we een verdeling van mogelijke coëfficiënten. We pakken telkens een steekproef, berekenen de regressie coëfficiënten en noteren deze. Wanneer we dit 10.000 keer gedaan hebben, plotten we de coëfficiënten en berekenen het 95% interval door aan beide kanten van de verdeling 2,5% af te halen. Als de waarde 0 niet in het betrouwbaarheidsinterval voorkomt, dan kunnen we concluderen dat de coëfficiënt significant anders is dan 0.

    Residuele variantie

    Met de regressieformule probeerden we in het voorbeeld de SAT score te verklaren door middel van verschillende predictors. Toch gaan we er ook van uit dat de SAT score niet volledig te verklaren is door de predictor variabelen. Een deel van de score zal resultaat zijn van error. Deze error wordt residuele variantie/error genoemd (MSerror):

    \[MS_{error}=\frac{\sum{(Y-\hat{Y})^2}}{N-p-1}\]

    Natuurlijk hopen we de MSerror zo klein mogelijk te houden – hoe meer we kunnen verklaren van Y hoe beter. De wortel uit de MSerror is de schatting van de standaardfout.

    Welke assumpties moeten gedaan worden?

    Wanneer de X-variabelen random zijn, maken we de assumptie dat de verdeling van Y, X1, X2, …, Xpmultivariaat normaal is. Afwijkingen hiervan zijn meestal geen groot probleem, omdat de toetsen redelijk robuust zijn. We zijn vooral geïnteresseerd in of R groot of klein is en niet zo zeer of het significant is. Een significante R van .10 verklaard namelijk maar 1% van de variantie. Bij X-variabelen die fixed zijn, maken we de assumptie dat de conditionele verdelingen van Y normaal en onafhankelijk verdeeld zijn. Kleine afwijkingen zijn ook hier niet noodzakelijkerwijs een probleem.

    Wat is de multipele correlatiecoëfficiënt?

    Uit Tabel 6 bleek dat de multipele correlatie tussen SAT score en de twee predictors (Model 2) gelijk was aan .941. Dit is de multipele correlatiecoëfficiënt en wordt vaak genoteerd als R0,123…p waarbij we aangeven dat het voorspeld is van 1,2,3…p predictors tegelijkertijd. Het is eigenlijk de correlatie tussen Y en Ŷ.

    Ondanks R zijn we vaak meer geïnteresseerd in R2, omdat dit het percentage verklaarde variantie geeft. R2 is echter geen unbiased schatting van de populatieparameter. De hoeveelheid bias is afhankelijk van N en p. bij N = p + 1 is de voorspelling perfect en R dus 1. Een schatting van R2 die minder biased is:

    \[\text{estimated}R^2=1-\frac{(1-R^2)(N-1)}{N-p-1}\]

    Dit is de ‘Adjusted R Square’ in SPSS output.

    R ligt altijd tussen de 0 en 1 in.

    De significantie van R2

    De significante bijdrage van elke predictor apart kunnen we al onderzoeken door middel van de regressie-coëfficiënt. Maar wat we eerst zouden moeten vragen is: voorspellen de variabelen samen de Y beter dan kans niveau? (de overkoepelende relatie).

    Dit doe je door middel van de multipele correlatiecoëfficiënt. De nulhypothese wordt:

    • H0: R = 0*.

    R* is dan de correlatiecoëfficiënt in de populatie. We toetsen met:

    \[F=\frac{(N-p-1)R^2}{p(1-R^2)}\]

    • met N onderwerpen/proefpersonen/(in dit geval staten) en p predictoren. Er zijn p en N-p-1 vrijheidsgraden bij betrokken.

    Voor het voorbeeld geldt een F van 182.64. Hierbij hoort een p-waarde van .000 en dus is de F-waarde significant.

    Over het algemeen willen we tenminste tien observaties per voorspeller. Een andere regel is dat N tenminste 50 hoger moet zijn dan p. Er wordt ook voorgesteld dat N > p + 40. Er kan ook gekeken worden naar de hoogte van de power die men wil hebben. Hierop kan dan het aantal participanten worden afgesteld.

    Partiële en semi-partiële correlatie

    De (semi-)partiële correlatiecoëfficiënten controleren voor het effect van één of meer andere variabelen (een proces genaamd ‘partialling out’).

    Partiële correlatie

    De partiële correlatie r01.2 is de correlatie tussen twee variabelen met één of meer variabelen weggenomen uit zowel X als Y. Stel dat we de relatie tussen inkomen en schoolprestaties onderzoeken. We vinden een significante correlatie tussen de twee. Dit betekent nog niet dat succes op school leidt tot een hoger inkomen. Het zou verklaard kunnen worden door IQ: dit leidt zowel tot hogere schoolprestaties als een hoger inkomen. De manier om dit te onderzoeken is de partiële correlatie te berekenen tussen schoolprestatie en inkomen, met IQ weggehaald uit beide variabelen.

    Voor de partiële correlatie doen we een aparte regressieanalyse op beide variabelen met de te controleren variabelen (in het voorbeeld: inkomen op IQ en schoolprestatie op IQ). Van beide analyses nemen we het residu. Dit is de portie variatie, die niet wordt verklaard door IQ. De correlatie hiertussen is de partiële correlatie.

    De notatie voor de partiële correlatiecoëfficiënt is r01.23..p, waarbij links van de punt de gecorreleerde variabelen staan en rechts van de punt de variabelen waarvoor is gecontroleerd.

    De partiële correlatie in het kwadraat geeft de verklaarde variatie. In het voorbeeld is de gekwadrateerde partiële correlatie .198, wat betekent dat 20% van de variatie in SAT scores (die niet verklaard wordt door PercSAT) kan verklaard worden door Uitgaven (die niet verklaard wordt door PercSAT). Of: 20% van de variatie in SAT scores, onafhankelijk van PercSAT, wordt verklaard door die portie van Uitgaven, onafhankelijk van PercSAT.

    Semi-partiële correlatie

    De semi-partiële correlatie wordt ook wel de deelcorrelatie genoemd. Het is de correlatie tussen de criterium Y en een gecontroleerde (partialled) predictor variabele. Waar de partiële correlatie dus een variabele wegneemt uit zowel criterion als de predictor, doen we dat hier alleen uit de predictor. De semi-partiële correlatie is de correlatie van Y met dat deel van X1 dat onafhankelijk is van X2 (het residu).

    De notatie voor de semi-partiële correlatie is: r0(1.2) waarbij we variabele 2 weghalen uit predictor 1. Voor de correlatie geldt:

    • r20(1.2) = R20.12 - r202.

    Significantie

    De significantie van de (semi-)partiële correlaties hoeft niet apart getest te worden. Als de test op de regressie-coëfficiënten significant was, dan zijn de Beta, partiële en semi-partiële coëfficiënten ook significant.

    De partiële en semi-partiële correlaties kunnen in Venn diagrammen worden weergegeven.

    Wat zijn onderdrukkingsvariabelen?

    Wanneer alle correlaties van variabelen met het criterium positief zijn, verwachten we ook positieve regressiecoëfficiënten. Soms is een regressiecoëfficiënt significant negatief. Deze variabele wordt dan een onderdrukkingsvariabele genoemd. Een voorbeeld om dit te verduidelijken: stel we nemen een geschiedenistentamen af die in een korte tijd voltooid moet worden, om achter de kennis van geschiedenis te komen. De kennis van geschiedenis heeft niets te maken met leessnelheid. Echter is de prestatie op de toets hier wel van afhankelijk. Variantie in scores komt dus door leessnelheid en kennis. We willen ontdekken welke studenten het tentamen halen doordat ze snel lezen, en welke studneten het niet halen doordat ze langzaam lezen. Dit wordt bereikt door ‘leessnelheid’ als onderdrukkende variabele te gebruiken. Het onderdrukt een deel van de error in de scores.

    Wat is Cook’s D?

    Voordat de bovenstaande analyses worden uitgevoerd, is het altijd belangrijk eerst goed naar de data te kijken. Eerder checkten we al de grafische weergaven van de variabelen, daarnaast moet gekeken worden naar uitschieters. Als er geen normale uitschieters zijn, kunnen er wel multivariate uitschieters zijn. Dit zijn ongewone combinaties van scores. Als we weten dat er geen uitschieters zijn en dat de verdelingen redelijk normaal zijn, voeren we een preliminaire regressie analyse uit met alle variabelen. Belangrijk hierbij is:

    1. Afstand is belangrijk voor het identificeren van potentiële uitschieters in de afhankelijke variabele (Y). Een gebruikelijke afstand is die tussen Yi en Ŷi. Dit is de afstand tussen elk punt en de regressielijn.
    2. Hefboom (hi) is belangrijk voor het identificeren van potentiële uitschieters in de onafhankelijke variabelen. Het meet de mate waarin een score afwijkt van de predictor variabelen.
    3. Invloed: een combinatie van afstand en hefboomwerking. Het identificeert invloedrijke observaties. Een score is invloedrijk wanneer de regressie sterk verandert bij verwijdering van die score.

    De invloed van een punt kan alleen hoog zijn, als het hoge waarden heeft op afstand en hefboom. De algemene maat voor invloed is de Cook’s D. Het is een maat voor de verandering in SS in de regressie-coëfficiënt wanneer de observatie/score uit de data wordt verwijderd en de analyse wordt uitgevoerd. De regel hierbij is, dat een Cook’s D groter dan 1.00 afwijkend is.

    Als er geen variabelen zijn met onevenredige invloed op de regressievergelijking, betekent dit niet dat we ons geen zorgen hoeven te maken. We moeten kijken nar de plot van de residuen tegen de voorspelde waarden om te zien of er een normale verdeling is. Daarnaast checken we de Q-Q plot van de residuen voor normaliteit.

    Modellen vergelijken

    Stel dat we, zoals in het voorbeeld, twee modellen hebben die nested ofwel hiërarchisch zijn: een aantal variabelen in het ene model komt voor in het andere model. (Model 1: predictor A, B, C, D en Model 2: A en B). We willen onderzoeken of het ene model significant beter is dan het andere: hiervoor kijken we naar de SS uit de multipele regressieanalyse. Eerst voeren we die voor beide modellen uit (Tabel 23).

    Tabel 23

    Model

    SS

    df

    MS

    F

    Sig.

    1 Regressie

    243.689,5

    4

    60922.385

    85.539

    .000

    Residu

    30.618,141

    45

    680.403

     

     

    Totaal

    274.307,7

    49

     

     

     

     

    Model

    SS

    df

    MS

    F

    Sig.

    2 Regressie

    243.069,5

    2

    121534.65

    85.539

    .000

    Residu

    31.238,38

    47

    664.646

     

     

    Totaal

    274.307,7

    49

     

     

     

    Model 1 heeft een R2 van .888 en model 2 heeft een R2 van .886. Het eerste model verklaard dus iets meer variantie. Allereerst berekenen we het verschil in SSregressie = 243.689,5 - 243.069,5 = 620,2 = SSverschil. Het aantal vrijheidsgraden is het verschil in aantal voorspellers. In dit geval is dit 2. MSverschil is vervolgens SSverschil/df = 620,2/2 = 310,1. Deze MS testen we vervolgens met de volgende formule:

    \[F=\frac{\frac{SS_{\text{reg(full)}}-SS_{\text{reg(reduced)}}}{df_{\text{reg(full)}}-df_{\text{reg(reduced)}}}}{MS_\text{residual(full)}}= \frac{\frac{243.689,5 - 243.069,3}{2}}{664,646} = 0.47\]

    met als noemer de MS voor model 2, omdat die het ‘grote’ model is met alle variabelen (model 1 heeft een selectie uit die variabelen). De F is bij 2 en 45 df (let op! 2 df want dit is het aantal vrijheidsgraden van de verschilscore in SS) niet significant. Met extra twee predictors verklaren we niet significant meer variatie.

    Stel dat de modellen niet hiërarchisch zijn, maar elk model andere variabelen bevat? Wanneer we dan de modellen willen vergelijken, kunnen we niet simpelweg de SS verschillen testen. In dit geval gebruiken we Akaikes Informatie Criterion (AIC), een computergestuurde test. Hoe kleiner de AIC, hoe beter het model. Er kan helaas niet getest worden of het verschil in de AIC’s ook significant is.

    Op welke manier worden de predictor variabelen gekozen?

    Het kiezen van de juiste predictors om in je analyse mee te nemen, kan moeilijk zijn. Zeker wanneer er veel variabelen in de data zijn opgenomen. Een aantal manieren om variabelen te kiezen:

    1. Tolerantie: eerder werd uitgelegd dat tolerantie de mate van overlap tussen predictors aangeeft. Kies variabelen met een zo hoog mogelijke tolerantie en zo min mogelijk overlap.
    2. ‘Alle subsets regressie’: kijk naar (alle) mogelijke subsets van predictors en kies de set die optimaal is (bijvoorbeeld die de grootste R2 heeft). Dit kan je zelf doen, of bij veel variabelen door middel van een speciaal computerprogramma (dan kun je vragen: geef me de beste zes modellen met de hoogste R2 bij vier predictoren). De beste modellen kan je selecteren op basis van: (1) de grootte van R2, (2) de grootte van MSresidu, (3) de statistiek Mallow’s Cp of (4) de statistiek PRESS. Mallow’s Cp vergelijkt groottes van errortermen in het ene model met de error term in het complete model met alle voorspellers. PRESS maakt voorspellingen van de data met alle gevallen behalve degene die voorspeld wordt. Een nadeel van ‘alle subsets regressie’ is dat er een groot potentieel is voor kans.
    3. Omgekeerde eliminatie: dit is een stapsgewijze procedure. We beginnen met een model met alle predictors, en bekijken de regressie-coëfficiënten. De variabele die het minst bijdraagt aan het model verwijderen we. Vervolgens voeren we de analyse opnieuw uit zonder deze voorspeller. We halen weer de predictor eruit die het minst bijdraagt. Dit proces herhalen we, totdat alle predictors statistisch significant zijn. Computerprogramma’s hebben hier ook een optie voor, onder de naam ‘F to remove/enter’ of ‘p to remove/enter’. Kiezen we voor p, dan kun je p to remove op .05 zetten en komen alleen significante variabelen in het model. Een nadeel is dat ook deze methode leidt tot kansmodellen.
    4. Stapsgewijze regressie: in feite de vorige methode maar dan omgekeerd. Van alle methoden is dit waarschijnlijk de beste. We beginnen met een model met alleen variabele 1, omdat deze de hoogste validiteit (correlatie met criterium) heeft. Dan berekenen we alle semi-partiëlen (correlaties met alle andere variabelen). De variabele met de hoogste semi-partiële correlatie zal de hoogste toename in R2 geven, dus die nemen we op in de analyse (stel dat dat variabele 2 was). We voeren een regressie uit van Y op X1 en X2 en berekenen of de variabele significant bijdraagt aan de analyse. Dit kan door de regressiecoëfficiënt of de semipartiële correlatie te testen. Er kan ook gekeken worden of R2 significant vergroot is. Dit doen we met de volgende F-waarde:

    \[F_{(f-r, N-f-1)}=\frac{(N-f-1)(R^2_f-R^2_r)}{(f-r)(1-R^2_f)}\]

    • met R2 gebaseerd op f en r predictoren. R2f is de R2voor het volledige model en R2r is de R2 voor het beperkte model.

    Dit proces herhalen we totdat een nieuwe variabele niet meer significant bijdraagt. Variabelen die onder ‘F to remove’ vallen worden eerste verwijderd voordat de volgende variabele wordt toegevoegd. Methoden zonder deze stap heten forward selectie methoden.

    Cross-validatie

    Een probleem is het cross-valideren van een regressievergelijking bij een onafhankelijke data set. Stel we breken onze data in twee of meer sets. Voor de eerste set berekenen we de regressievergelijking. Deze coëfficiënten zetten we vervolgens af tegen de andere dataset om voorspelde waarden van Y te krijgen. We kijken dan naar de relatie tussen Y en Ŷcv. Bij een goede validiteit van de regressievergelijkingen moet deze correlatie hoog zijn. R2cv is meestal wel lager dan R2. We proberen dus een regressievergelijking te maken die voor meerdere datasets te gebruiken is. Echter is elke set anders, en zal het niet altijd valide zijn.

    Missende scores

    Een manier om met missende scores om te gaan, is om de participant in zijn geheel uit de studie te verwijderen wanneer hij scores mist (casewise/listwise verwijdering). Dit kan leiden tot kleine steekproefgroottes of een steekproef die niet meer betrouwbaar is (als een bepaald type participant uit de studie valt).

    Een andere methode is pairwise verwijdering. Hierbij houden we de participant en gebruiken de data waar mogelijk: als hij data heeft op X en Y, houden we hem in de berekening van rXY, etc. Het nadeel hiervan is, dat de intercorrelatie tussen variabelen verstoord kan worden (omdat hij er soms wel bij zit en soms niet).

    Een derde methode is het vervangen van de missende scores door een optimale schatting. Er zijn verschillende manieren om dit te doen, maar een veel gebruikte manier is om de gemiste score te voorspellen met een regressievergelijking.

    Wat is het belang van individuele variabelen?

    We willen soms weten welke variabele het belangrijkst is in het voorspellen van Y. βj2 wordt weleens als maat hiervoor genomen. β2 is namelijk de unieke bijdrage van een variabele aan de voorspelling van Y. Het zegt dus niets over de bijdrage die gedeeld is met andere variabelen. Daarnaast kan het onstabiel zijn tussen steekproeven als de variabelen onderling hoog gecorreleerd zijn.

    Een andere mate van belangrijkheid is de semi-partiële correlatie tussen de voorspeller j en het criterium. Dit is een goede maat als het hoofddoel voorspelling is en niet verklaring.

    Hoe worden afgeronde coëfficiënten gebruikt?

    Bij het berekenen van regressie-coëfficiënten is gebleken dat deze sterk kunnen fluctueren tussen steekproeven uit dezelfde populatie, zonder dat dit R drastisch beïnvloedt. Hierdoor zullen onderzoekers soms de coëfficiënten benaderen, door de regressie-coëfficiënten af te ronden naar een heel getal. Dit heeft weinig invloed op R!

    Wat zijn mediërende en modererende relaties?

    In de psychologie zijn vaak mediatoren en moderatoren van belang: variabelen die een rol spelen in de relatie tussen twee andere variabelen.

    Mediatie

    Een mediator medieert de relatie tussen twee andere variabelen. Bijvoorbeeld: de mate van zelfvertrouwen die ik heb medieert tussen de hoeveelheid zorg die ik van mijn ouders heb gehad en hoe ik zelf denk over het opvoeden van mijn kinderen. (Verzorgende ouders leidt tot hoog zelfvertrouwen, leidt tot vertrouwen in zelf opvoeden). Dit is als volgt weer te geven in een figuur:

                                A                 Mediator                     B

    Onafhankelijke variabele            C             Afhankelijke variabele

    Baron en Kenny hebben veel geschreven over mediatie. Er zijn volgens hen drie stappen die moeten voldoen, wil er sprake zijn van mediatie. Zij stellen dat we eerst moeten aantonen dat de onafhankelijke variabele een significante relatie heeft met de mediator. Daarna moet een significante relatie worden aangetoond tussen mediator en afhankelijke variabele, en tussen de onafhankelijke en de afhankelijke variabele.

    De volgende stap is demonstreren dat wanneer de mediator en onafhankelijke variabele samen gebruikt worden om de afhankelijke te voorspellen, het pad tussen onafhankelijke en afhankelijke variabele (c) minder sterk (liefst niet-significant) wordt.

    Voorbeeld

    Terug naar het voorbeeld over ouderlijke zorg en het zelf opvoeden van kinderen. De eerste stap is het berekenen van de correlaties tussen deze twee variabelen en de mediator (zelfvertrouwen). Alle correlaties zijn significant. De volgende stap is om zelfvertrouwen en ouderlijke zorg als predictors in een multipele regressie in te voeren voor voorspelling van de afhankelijke variabele. In Model 1 is alleen ouderlijke zorg als predictor ingevoerd, in model 2 zowel deze als de mediator. Bij het toevoegen van de mediator zelfvertrouwen blijkt, dat ouderlijke zorg niet meer significant is. Zelfvertrouwen heeft dus een mediërende rol tussen ouderlijke zorg en zekerheid over latere eigen opvoeding van onze kinderen. In dit voorbeeld is het resultaat vrij makkelijk: verzorgende ouders hebben, leidt tot hoger zelfvertrouwen en daardoor voelen we ons zekerder over zelf ouder worden.

    In de output van SPSS staat ook een ‘part correlation’. Dit is wat wij kennen als de semi-partiële correlatie.

    Sobel’s test

    Maar wanneer pad ‘c’ niet helemaal verdwijnt en nog significant is, wat dan? Een manier is de Sobel test, waarbij we vragen of het volledige mediërende pad van onafhankelijke naar mediator naar afhankelijke variabele significant is. Hiervoor hebben we de regressie-coëfficiënten en standaardfouten van de twee paden nodig.

    De standaardfout van de Beta (sβ) wordt niet gegeven en moeten we dus berekenen:

    • t = β/sβ dus sβ = β/t

    Stel dat geldt voor pad (a): sβ = 0.09 en voor pad (b) sβ = 0.11.
    We kunnen nu de regressie-coëfficiënt berekenen van het totale pad (a)-(b) door βa x βb = 0.41 x 0.32 = 0.13. Voor de standaardfout van het totale pad geldt:

    \[s_{\beta_a\beta_b}=\sqrt{\beta_a^2s_b^2+\beta_b^2s_a^2-s_a^2s_b^2}\]

    In het voorbeeld is dit gelijk aan 0,052. De t ratio wordt dan:

    • t = βaβb/s­βaβb = 2,48.

    Het aantal vrijheidsgraden is N-3. Deze t is significant. We hebben bewijs voor een mediërend pad van ouderlijke zorg, via zelfvertrouwen naar vertrouwen in opvoeding.

    Bootstrapping

    Een andere methode om de significantie van het indirecte pad te testen is door middel van bootstrapping. Hierbij creëren we 10.000 ‘bootstrap steekproeven’ uit de observaties en berekenen telkens de regressie-coëfficiënten en βaβb. Hiervan maken we een distributie, waaruit we het 95% betrouwbaarheidsinterval halen. Als dit interval de 0,00 waarde niet bevat, is het indirecte pad significant.

    Moderatie

    Bij modererende relaties verandert de relatie tussen onafhankelijke en afhankelijke variabele, door de derde (moderator)variabele. Bijvoorbeeld: we onderzoeken de invloed van dagelijkse stress-events op het aantal symptomen van stress dat een student aangeeft. Daarbij stellen we dat wanneer de student veel sociale steun heeft (in zijn omgeving), hij minder symptomen laat zien dan iemand met weinig sociale steun.

    De eerste stap in de verzamelde data is het berekenen van de correlaties. We vinden dat stress-events significant gecorreleerd is met symptomen, steun correleert niet significant.

    De volgende stap is het centreren van de data om de twee variabelen stressvolle gebeurtenissen en sociale steun samen te voegen. We maken verschilscores door het gemiddelde van de variabele van elke score van die variabele af te trekken. Iemand met een score 0 op stress-events heeft dan het gemiddeld aantal stress-events. Het doel van het centreren is het verlagen van de correlatie tussen de algemene effecten en de interacties.

    Van de gecentreerde variabelen maken we een product, dat onze interactieterm wordt (stress-eventscentrxsteuncentr). Deze interactieterm stoppen we samen met de stress-events en steun variabelen in een regressie-analyse. De afhankelijke variabele is het aantal symptomen. In de output vinden we dat R2 significant is, evenals de predictor stress-eventscenter en de interactieterm. De variabele sociale steun is niet significant. Een plot van de interactieterm kan duidelijk maken, hoe de interactie werkt. Hieruit blijkt, dat met hoge sociale steun, verhogingen in stressvolle gebeurtenissen geassocieerd zijn met kleine verhoging van het aantal symptomen. Bij lagere niveaus van sociale steun en verhoging in stressvolle gebeurtenissen ontstaan veel meer symptomen.

    Wanneer wordt logistische regressie gebruikt?

    Logistische regressie is een techniek waarbij een regressie-analyse wordt uitgevoerd bij een dichotome afhankelijke variabele. Bijvoorbeeld in het geval waar we de reactie op een behandeling willen voorspellen, en de participanten ofwel ‘overleven’ of ‘niet overleven’ (zoals bij kanker). De kansen van logistische regressie liggen tussen 0 en 1. Daarnaast kunnen de onafhankelijke variabelen zowel categorisch of continu zijn.

    Stel dat we dit onderzoeken, en onze Uitkomst coderen we 1 voor mensen die beter worden of geheel genezen zijn, en 0 voor mensen die niet genazen of dood zijn gegaan. Als predictor nemen we allereerst de overlevingskans die de arts ten tijde van de diagnose gaf (OverlKans), in procenten.

    Als we de relatie tussen OverlKans en Uitkomst in een grafiek weergeven, zien we dat de kans op overleven groter is voor mensen die meer verbeteren. Wanneer we veel proefpersonen hebben, kunnen we de gemiddelde Uitkomst voor elke waarde van OverlKans berekenen (een conditioneel gemiddelde, omdat het afhangt van de waarde van OverlKans).

    Wat betreft de analyse, zal lineaire regressie in dit geval een slechte keus zijn. Omdat we te maken hebben met voorspellende waarden, zullen kansen voorbij de waarden 0 en 1 gaan, wat onmogelijk is. Daarnaast is er zeer weinig variantie in dit model: bij iedereen met een lage OverlKans zal een 0 hebben en bijna iedereen met hoge waarden op OverlKans heeft een 1.

    De relatie tussen Uitkomst en OverlKans is geen lineaire relatie, maar een sigmoidale (s-vormige).

    Logistische regressie is eigenlijk een lineaire regressie op gecensureerde data. Dit houdt in, dat er een kritieke waarde is in de data, en alle waarden daarboven krijgen het label ‘verbeterd’ en alle waarden daaronder krijgen het label ‘niet verbeterd’. Hier zijn dus geen gradaties in; mensen die dood zijn gegaan vallen onder hetzelfde label als mensen die een klein beetje achteruitgegaan zijn. Er is wel een methode om de data te veranderen, zodat we een lineaire functie krijgen: door de scores om te zetten naar kansen, en vervolgens naar log odds[log(p/1-p)], met p de kans op verbetering en 1-p de kans op geen verbetering. We krijgen dan een formule van de vorm:

    Log odds = b0 + b1OverlKans. Dit heet een logit transformatie. Hierbij is de b1 de toename in log odds als OverlKans één eenheid toeneemt. De log odds zullen positief zijn voor odds groter dan 1 en negatief voor odds kleiner dan 1.

    In de output van SPSS vergelijken we het model zonder predictoren met het model met één predictor. Hiervoor kijken we naar de -2log likelihood. Deze is 77,3457 voor het model zonder predictoren en 37,323 voor het model met één predictor. Het verschil hier tussen (40,022) geeft de vermindering in X2 weer die komt door het toevoegen van een voorspeller. Dit verschil kan bekeken worden met 1 df. Het significantieniveau is .000 en dus is OverlKans een significante bijdrager aan de voorspelling.

    De computer zoekt de best passende waarden van b0 en b1. Uit de SPSS test komen de optimale constante en coëfficiënt:

    • Log odds = -0.0812 OverlKans + 2.6836

    De negatieve coëfficiënt houdt in, dat we de kans op zieker worden afneemt, als de OverlKans toeneemt. De log odds nemen af als de kans op overleven verhoogt. Uit de formule leiden we af, dat wanneer OverlKans met één eenheid toeneemt, de log odds op zieker worden afneemt met 0.0812. Dit zegt ons niet zoveel, daarom zetten we de coëfficiënt om in een odds (door te exponentiëren: e-0.0812 = 0.9220). Als OverlKans met één toeneemt, vermenigvuldigt de kans op zieker worden met 0.9220. Anders gezegd: als twee mensen hun OverlKans te horen krijgen, en de tweede persoon heeft één punt meer op OverlKans, dan heeft zij een 7.8% lagere kans op verslechtering. De odds worden ook in de SPSS output gegeven onder ‘Exp(B)’.

    Meerdere predictoren

    Bij meer dan één predictor verandert er in feite niets aan de uitvoer van de analyse. SPSS geeft van elke predictor apart aan of het een significante bijdrage levert aan het model, en wederom geeft de coëfficiënt aan in welke richting het verband is (negatief/positief). We kijken hiervoor weer naar het verschil in -2log likelihood tussen de modellen. Het aantal vrijheidsgraden staat altijd gelijk aan het aantal extra predictoren. Ook dichotome predictors zijn mogelijk (zoals man/vrouw). Stel dat sekse een predictor was in het model, en het coëfficiënt 0.40 bleek te zijn (man =1, vrouw=2). De exponent zou 1.49 zijn. Dit houdt in, dat bij alle andere variabelen constant gehouden, de kans dat een vrouw beter wordt 1.5 keer groter is dan de kans dat een man beter wordt.

    Access: 
    Public
    Op welke manier kunnen variantie- en covariantieanalyse gezien worden als General Linear Models? - Chapter 16

    Op welke manier kunnen variantie- en covariantieanalyse gezien worden als General Linear Models? - Chapter 16

    De variantieanalyse en de multipele regressie hebben veel met elkaar gemeen. De variantieanalyse vertelt ons dat drie behandelingen (T1, T2 en T3) verschillende gemiddelden hebben, de multipele regressie zegt dat de gemiddelden gerelateerd zijn aan de behandelingen (T1, T2 en T3). Dit komt eigenlijk op hetzelfde neer.

    Wat is het Algemeen Lineair Model?

    De ANOVA is eigenlijk een speciale versie van de multipele lineaire regressie, die een onderdeel is van het General Linear Model (algemeen lineair model). Dit hoofdstuk gaat verder in op het algemeen lineair model, zowel met algemene concepten als berekeningen. Deze berekeningen zijn toegevoegd voor de volledigheid, maar het gaat om het begrijpen van het model.

    Lineair model

    Het model voor multipele regressie is: Yi = b0 + b1X1i + b2X2i + … + ei. Dit kan ook met vectoren genoteerd worden: y = b0 + b1x1 + b2x2 + … + e. y en x’en zijn de (n∙1) vectoren van de data, e de (n∙1) vector van errors en b0 de (n∙1) vector van de intercept elementen. Het kan ook geschreven worden als: y = Xb + e, met X als n∙(p+1) matrix van predictoren en b als (p+1)∙1 als vector van de regressiecoëfficiënten.

    Het model van een eenweg variantieanalyse is:

    \[Y_{ij}=\mu+T_j+e_{ij}\]

    Design matrixes

    Dit is een matrix van gecodeerde/dummy/tellervariabelen die aangeven bij welke groep een participant hoort. De matrix heeft p + 1 kolommen (met p het aantal behandelingen en een kolom voor gemiddelde μ). Per participant is er een rij. Elke participant krijgt een 1 voor μ, omdat die bij elke observatie wordt berekend. Dan krijgt de participant een 1 voor de groep waar zij bij hoort, en een score 0 op de andere groepen.

    S

    μ

    A1

    A2

    A3

    1

    1

    1

    0

    0

    2

    1

    1

    0

    0

    3

    1

    0

    1

    0

    Het traditionele model voor de ANOVA heeft de vorm:

    \[Y_{ij}=\mu+T_j+e_{ij}\] 

    • met de iste participant en de jste behandeling.

    Omdat de ANOVA een onderdeel is van het GLM, kunnen we deze formule anders schrijven, gebruikmakend van de matrix, in de vorm: y = Xb + e, wat weer lijkt op het basismodel voor de multipele regressie formule. 

    Factorieel design

    Bij een two-way ANOVA of een ANOVA met nog meer factoren, breiden we voort op dit model van de matrix. Als voorbeeld de two-way ANOVA met gelijke ns. Het algemene model is:

    \[Y_{ij}=\mu+\alpha_i+\beta_j+\alpha\beta_{ij}+e_{ijk}\]

    De α en β termen kunnen we middels een design matrix weer uitbreiden. Maar wat doen we met de interactie-term? Dit is een vermenigvuldigd effect van de twee componenten in de interactie. Stel dat we een 2x2 factoriaal design hebben, dan krijgen we:

     

     

    A1

    B1

    AB11

    a1b1

    1

    1

    1

    a1b2

    1

    -1

    -1

    a2b1

    -1

    1

    -1

    a2b2

    -1

    -1

    1

    waarbij 1 en -1 aangeven of de participant A1of A2 of B1of B2kreeg en de derde kolom is de interactie tussen A en B. de interactiegetallen zijn bepaald door de getallen uit rij A en B te vermenigvuldigen (bijv. 1x1 = 1). Het aantal kolommen per variabele is gelijk aan het aantal vrijheidsgraden voor dat effect (=aantal niveaus -1).

    Nu een voorbeeld met een 2x3 factoriaal design. A heeft twee niveaus en dus 1 df, B heeft drie niveaus en dus 2 df.

     

     

    A1

    B1

    B2

    AB11

    AB12

    a1b1

    1

    1

    0

    1

    0

    a1b2

    1

    0

    1

    0

    1

    a1b3

    1

    -1

    -1

    -1

    -1

    a2b1

    -1

    1

    0

    -1

    0

    a2b2

    -1

    0

    1

    0

    -1

    a2b3

    -1

    -1

    -1

    1

    1

    Kolom A maakt onderscheid tussen de twee behandelniveaus A1 en A2. Kolom B1 maakt onderscheid tussen mensen in B1 en niet in B1. Kolom B2 doet dit ook. Hierbij geldt dat participanten in de eerste a-1 en b-1 behandelniveaus een score 1 of 0 krijgen. Participanten in ade of bde behandelingsniveau krijgen -1. AB11 is het product van kolommen A1 en B1, evenals AB12 van A1 en B2.

    Dit is uit te breiden naar grotere factoriele ontwerpen.

    Hoe werkt ANOVA bij ongelijke steekproefgroottes?

    Bij ongelijke steekproefgroottes in de ANOVA zijn de rijen, kolommen en interactie-effecten niet meer volledig onafhankelijk van elkaar, waardoor de variantie overlapt. Wanneer we dan een model met variabelen A, B en AB vergelijken met een model met alleen A en B, dan krijgen we niet het gebied van de AB cirkel, want een deel hiervan kan verklaard worden door A of B. SSAB geeft de unieke variantie van AB weer na het aanpassen voor A en B.

    Om dit op te lossen, zijn verschillende modellen ontworpen die in SPSS Model I t/m III genoemd worden. De keuze voor een bepaald model hangt samen met de relatie tussen steekproefgrootte en behandeling. Model III meestal geschikt, omdat deze de gemiddelden ongewogen (voor steekproefgrootte) test.

    Welke kennis is belangrijk over de eenweg Covariantie-analyse?

    Ook voor de covariantie-analyse geldt, dat deze (vooral met meer dan één covariaat) lastig met de hand te berekenen is. Toch is achtergrondkennis handig bij het begrijpen van SPSS uitvoer.

    Stel dat we willen onderzoeken of kleinere auto’s makkelijker te besturen zijn. We hebben drie verschillende autogroottes drie groepen bestuurders, met aanzienlijke verschillen in rijervaring tussen bestuurders. We kunnen individuen hier niet op matchen, dus nemen we aan dat de gemiddelde rijervaring tussen de groepen gelijk is. De afhankelijke variabele is het aantal stuurfouten en de covariaat is rijervaring. Wat we namelijk willen, is de prestaties van bestuurders onderzoeken onafhankelijk van hun rijervaring, maar puur wat we verwachten vanwege de grootte van de auto. We verminderen hiermee de error.

    Het kan voorkomen dat de groepen verschillen op de covariaat. In dit geval werken we met aangepaste gemiddelden. Deze representeren de beste gok van het gemiddelde als de groepen niet verschillen op de covariaat. De covariantie-analsye bekijkt vervolgens of deze aangepaste gemiddelden significant van elkaar verschillen. Hiernaast verminderen we ook nog de errorterm door de variantie verklaar door de covariaat eruit te halen.

    Voorwaarden

    Bij de covariantie-analyse gelden de normale voorwaarden van de ANOVA (normaal verdeling en homogeniteit van variantie) plus twee extra voorwaarden. De eerste is dat de relatie tussen Y en de covariaat C lineair is. De tweede is homogeniteit van regressie: dat de regressie-coëfficiënten gelijk zijn tussen de behandelingen oftewel dat de regressielijnen parallel zijn.

    De analyse

    De covariantie is in feite een ANOVA, waarbij we het effect van de covariaat eruit willen filteren. We gaan ervan uit dat de totale variatie in Y verklaard kan worden door C, het behandeleffect (α) en de error. Wanneer we SSregressie C,α vergelijken met SSregressie C, dan zal het verschil de variatie zijn door het behandeleffect.

    We nemen weer het onderzoek uit hoofdstuk 11 (ANOVA) waarbij ratten een stofje ingespoten kregen die hun motorische activiteit tijdelijk verhoogd. Naarmate ratten gewend raken aan hun omgeving, gaan ze weer minder bewegen. De onderzoekers in deze studie wilden zeker weten dat hun behandeleffecten echt alleen door de behandeling kwamen. Daarom namen ze de activiteit na de injectie als een percentage van de activiteit van die bepaalde rat vóór de injectie (om verschillen in pre-injectie activiteit uit te sluiten). Een andere methode was geweest om een covariantie-analyse uit te voeren op post-injectie activiteit met pre-injectie verschillen als covariaat. We controleren dus voor het feit, dat groepen wellicht al verschilden op pre-injectie activiteit. Doordat de ratten willekeurig zijn ingedeeld in groepen, verwachten we echter geen verschillen te zien van te voren.

    Eerst testen we de data voor homogeniteit van regressie. De nulhypothese is:

    1. H0 : b1* = b2* = …= b5*

    Als de regressie-coëfficiënten gelijk zijn aan elkaar, geldt dat de interactie-term van effect x covariaat niet significant is. Het weghalen van deze term uit de formule zal weinig tot geen invloed hebben op de variatie in het model. Nu vergelijken we de R2 van het model mét interactie-term met het model zonder interactie-term.

    • R2τ,C= .804
    • R2τ,C,Cτ = .824

    Een F test over de verschilscore tussen deze twee is niet sterk genoeg: we kunnen voldoen aan de voorwaarde voor homogene regressie. De analyses hierna kunnen we dus doen zonder interactie-term:

    SS berekenen

    Uit de data van de regressieanalyses (Howell, 2013: p.599) is af te leiden dat de SSregressieτc gelijk is aan 82.64 (dit is met behandeleffect en covariaat). De SSresidu is 20,13, wat de onverklaarde variantie weergeeft. Wanneer we de SSregressie bekijken zonder behandeleffect groepen, daalt de SS naar 73.42. Het verschil tussen deze twee getallen is de variatie die niet verklaard wordt door de covariaat en noemen we SSbehandel(adj) (met adj van ‘aangepast’). In dit geval is de SS aangepast voor het feit dat de vijf groepen ratten verschilden op de pretest meting.

    Omgekeerd moeten we voor de SScovariaat het model met zowel covariaat als behandelvariabelen vergelijken met een model met alleen de behandel variabelen. Het verschil hiertussen is toe te wijzen aan de covariaat. De tabel van de analyse ziet er dan als volgt uit:

    Tabel 24

    Bron

    df

    SS

    MS

    F

    Covariaat

    1

    38.34

    38.34

    78.11*

    Behandel(adj)

    4

    9.22

    2.31

    4.70*

    Residu

    41

    20.12

    0.49

     

    Totaal

    46

    102.77

     

     

    *p < .05

    Voor behandel(adj) is het aantal vrijheidsgraden (k-1) met k het aantal groepen
    Voor covariaat is het aantal df gelijk aan het aantal covariaten (=1)

    De error (residu) heeft N-k-c df.

    Uit de tabel zien we dat het effect van behandeling, wanneer we het effect van de covariaat uitfilteren, nog significant is. Na controle voor pre-injectie verschillen in activiteit, verschillen de ratten alsnog op post-injectie activiteit.

    Aangepaste gemiddelden

    Nu we weten dat de post-injectie activiteit verschilt tussen de groepen, is het handig om te berekenen wat die gemiddelde activiteit per groep zou zijn wanneer de groepen niet verschillend waren op de pre-injectie metingen. Dit zijn de aangepaste gemiddelden en die vinden we met gebruik van de covariaat en behandelingen als predictors.

    Voor het volledig model (met covariaat erbij), vonden we de volgende formule met gemiddelden:

    • Yij = 0,4347(Pre) - 0,5922(T1) + 0,0262(T2) + 0,8644(T3) + 0,0738(T4) + 0,2183

    Om de aangepaste gemiddelden te berekenen, vullen we voor T1 etc. een 0, 1 of -1 in, afhankelijk van om welke groep het gaat. (Pre) is de gemiddelde pre-injectie score en is bij alle groepen 4.806.

    De aangepaste gemiddelden worden dan: 1,7153; 2,3336; 3,1719; 2,3813; 1,9353. Vervolgens kan getest worden of de  aangepaste gemiddelden gelijk zijn in de populatie met de volgende formule:

    \[F_{(1,N-a-1)}=\frac{(\bar{Y'_j}-\bar{Y'_k})^2}{MS'_{error}[(\frac{1}{n_j}+\frac{1}{n_k})+\frac{(c_j-c_k)^2}{SS_{e(c)}}]}\]

    In de output van SPSS is een ‘spread versus level’ plot op te vragen. Deze zet de groepsgemiddelden af tegen de groepsvarianties. Bij homogene varianties, die onafhankelijk zijn van de gemiddelden, moet deze plot er willekeurig uitzien.

    Hoe worden de effectgroottes berekent?

    Een effectgrootte berekenen bij covariantie is wat lastiger dan bij een ANOVA, omdat we keuzes moeten maken over de te vergelijken gemiddelden en de errorterm. Ook hier geldt dat we gebruikmaken van de r-familie bij een omnibus F test, en de d-familie bij specifieke contrasten.

    r-familie

    De maat die we hier gebruiken is η², en wordt berekend door SSbehandeling te delen door de SStotaal. Het is zowel mogelijk om de SSbehandeling van de afhankelijke variabele in ANOVA te gebruiken als die in de covariantie. In het geval waar de covariaat natuurlijk varieert in de populatie (zoals in ons voorbeeld van pre-injectie activiteit), kunnen we de SSbehandeling nemen uit de covariantie-analyse. De SStotaal is dan uit die analyse de onaangepaste:

    • η² = SSbehandeling(aangepast)/SStotaal
    • η² = SSbehandeling(aangepast)/SStotaal

    Er kan ook gekeken worden naar het verschil in R2 tussen het model met alleen de covariaat en het model met zowel de covariaat als de behandeling. Hier komt hetzelfde antwoord uit.

    d-familie

    Als voorbeeld nemen we het contrast tussen de controle groep en de 0.5 μg injectie-groep, omdat de onderzoekers daar het grootste verschil verwachtten. Omdat we een covariantie-analyse hebben uitgevoerd, moeten we rekenen met de aangepaste gemiddelden. Voor de twee groepen waren die respectievelijk 1.715 en 3.172.

    \[d=\frac{\hat{\Psi}}{\hat{\sigma}}\]

    Bij het vergelijken van twee gemiddelden is ψ simpelweg het verschil daartussen.

    Voor de waarde van σ moeten we een keuze maken. Eén manier is de wortel nemen van MSerror uit de ANOVA (een maat voor de gemiddelde variatie binnen elke groep). Een andere manier is de wortel uit MSerror van de covariantie-analyse gebruiken. Deze maakt echter gebruik van aangepaste gemiddelden en maakt de interpretatie lastiger. Als de covariaat normaal varieert in de populatie kiezen we voor de MSerrorin de variantieanalyse zonder covariaat. In het voorbeeld komt een waarde van d = 1.23 uit de analyse. Dit houdt in dat injectie met 0.5 μg medicijn leidt tot een toename van post-injectie activiteit van bijna één en een kwart standaarddeviatie ten opzichte van de controlegroep.

    Hoe werkt de interpretatie van een covariantie-analyse?

    In het voorbeeld met de activiteit van ratten gingen we ervan uit dat de covariaat, pre-injectie activiteit, voor elke groep hetzelfde was. We hadden namelijk de groepen willekeurig samengesteld, waardoor de gemiddelde pre-injectie activiteit overal gelijk zal zijn. In dat geval zorgt de covariantie-analyse voor een verminderde error en verwijdert het mogelijke bias in de afhankelijke variabele, die veroorzaakt kan worden door groepsverschillen op de covariaat. Dit is de ideale toepassing van de covariantie.

    Soms zullen we echter een covariaat meten na het uitvoeren van een behandeling.

    Hierdoor zullen de groepen niet gelijk zijn op de covariaat. Je vraagt dan wat de gemiddelden van de groepen zouden zijn, als ze niet verschilden op de covariaat. De covariaat kan in dit geval echter een onderdeel zijn van het behandeleffect en de interpretatie van de analyse wordt dus moeilijk. Een alternatief is dan de true-score covariantie-analyse.

    Wanneer participanten helemaal niet willekeurig aan behandelgroepen worden toegewezen (in een nonequivalent groepsontwerp), zoals bij een design met bestaande groepen (klaslokalen/scholen), kunnen we niet aannemen dat verschillen tussen de groepen door de behandeling komen. Het zou kunnen dat er voor de behandeling al verschillen waren tussen de groepen.

    Rapportage

    Rapportage van covariantie-analyses zou er zo uit kunnen zien:

    We onderzochten de activiteit in ratten na injectie met medicijn X. Ratten werden willekeurig toegewezen aan één van vijf groepen met 0, 0.1, 0.5, 1 en 2 μg X. Daarna werd activiteit gemeten. Vanwege variatie in activiteit vóór de injectie, werd deze pre-injectie activiteit meegenomen als covariaat in de analyse. De covariantie-analyse was significant (F(4,41) = 4.694, p = .003) met het sterkste effect bij de middelste doseringen.

    De factoranalyse van covariantie

    De covariantie-analyse kan ook gebruikt worden bij factoriale designs. SSregressie c,α,β,αβ is de variatie door een combinatie van covariaat, algemene effecten A en B en de AB interactie. Bij factordesigns met gelijke groepsgroottes geldt dat algemene effecten en interacties orthogonaal zijn. Wanneer we dus het verschil uitrekenen tussen:

    SSregressie c,α,β,αβ - SSregressie c,α,β houden we de variatie over die veroorzaakt wordt door de AB interactie. Maar, door deze orthogonale kwaliteit van de effecten, filteren we in feite alleen de covariaat uit voor dit effect.

    Hetzelfde geldt voor effect A:

    • SSregressie c,α,β,αβ- SSregressie c, β, αβ. En ook voor effect B.

    De error term is de variatie die overblijft nadat we controleren voor A, B, en AB en de covariaat. De term hiervoor is: SSresidu c,α,β,αβ

    De onafhankelijke variabele en de covariaat delen een deel van de verklaarde variantie, waardoor deze sum of squares samen niet de SStotaal maken. Het aantal vrijheidsgraden voor de hoofdeffecten van variabele A en B is het aantal categorieën min één. Het product van de vrijheidsgraden van de hoofdeffecten maakt het aantal vrijheidsgraden voor de interactie. Het aantal vrijheidsgraden voor de error term is: N-ab-c, waarbij a, b en c het aantal categorieën van de variabelen A, B en covariaat weergeven. De covariaat maakt gebruik van c df.

    Voorbeeld

    Als voorbeeld nemen we het rookonderzoek uit hoofdstuk 13 (ANOVA). Hierbij moesten rokers en niet-rokers een aantal taken uitvoeren en werd gekeken naar het aantal fouten dat zij hierbij maakten. Er waren drie groepen: Actieve rokers (die rookten tijdens de taak), Recente rokers (rookten tot 3 uur van tevoren) en Niet-Rokers. Naast het aantal fouten werd er gekeken naar mate van afgeleid zijn (hoe hoger de score, hoe erger). We hebben drie taken en drie behandelgroepen, het factoriale design is dus 3x3. Als covariaat nemen we de afleidbaarheid.

    Als we de covariantie-analyse vergelijken met de ANOVA, blijkt dat de MSerror een stuk kleiner is bij de covariantie. Dit komt omdat de covariaat (afleidbaarheid) veel van de variatie in Error verklaart die in de ANOVA nog onduidelijk was.

    Aangepaste gemiddelden

    We willen weten wat de gemiddelden van de groepen geweest zouden zijn, als de covariaat geen invloed had gehad. Voor het volledige model van het voorbeeld geldt de formule:

    \[Y=b_0+b_1C+b_2T_1b_3T_2+b_4G_1+b_5G_2+b_6TG_{11}+b_7TG_{12}+b_8TG_{21}+b_9TG_{22}\]

    We zetten C (covariaat) op een vaste C’ = 112.52 voor alle behandelingen, omdat we willen weten wat de Y’s zouden zijn zonder verschil op C. Nu gaan we per cel (Taak x Groep) de gemiddelde Y’ berekenen door de gemiddelden in de formule in te vullen. We krijgen voor Cel1,1 bijvoorbeeld deze rij regressie-coëfficiënten:

    1 0 1 0 1 0 0 0

    De aangepaste gemiddelden kunnen vergeleken worden. Voor elke vergelijking is een andere error term nodig.

    Welke stap neem je naar meerdere covariaten?

    De stap naar meerdere covariaten in een model is zeer simpel. In de term R2c,α,β,αβ kan C net zo goed staan voor een set covariaten (leeftijd, IQ en schooltype bijvoorbeeld). SSAB(adj) is nog steeds de SS totaal – SS covariaat+algemene effecten.

    Welke alternatieve designs zijn er?

    Naast de covariantie-analyse zijn er nog meer manieren om rekening te houden met een covariaat. In de stratificatie procedure bijvoorbeeld, worden participanten in paren verdeeld op basis van gelijkheid op de covariaat. Vervolgens worden ze gelijk verdeeld over de verschillende behandelingsgroepen. In de ANOVA kunnen we vervolgens een effect berekenen met deze ‘blokken’. In het geval waar de relatie tussen Y en C niet lineair is, is dit ‘matchen’ van participanten de betere optie in vergelijking met de covariantie-analyse.

    Een andere manier is het gebruik van verschilscores. Door C (score voor de test) af te trekken van bijbehorende score Y (score na de test), blijft een verschilscore over waarin gecontroleerd is voor de covariaat. Deze score kan als afhankelijke variabele gebruikt worden in een variantie analyse. Maar dit kan alleen als C en Y vergelijkbare metingen zijn (je kunt geen IQ met rijvaardigheid vergelijken). Dit is wel een gevaarlijke procedure: als bCY (hellingshoek)veel afwijkt van 1.00 (precies 1,00 komt weinig voor), dan kan deze procedure een heel andere uitkomst geven dan een normale covariantie-analyse.

    Access: 
    Public
    Wanneer en hoe wordt log-lineaire analyse gebruikt? - Chapter 17

    Wanneer en hoe wordt log-lineaire analyse gebruikt? - Chapter 17

    Wat zijn log-lineaire modellen?

    Log-lineaire modellen zijn modellen die kunnen worden gebruikt om afzonderlijke gegevens van experimenten met meerdere onafhankelijke variabelen te onderzoeken. Met meerdere bedoelen we meer dan twee onafhankelijke variabelen. In het geval van twee onafhankelijke variabelen heeft het log-lineaire model niet veel meer te bieden dan de standaardbenadering (bijvoorbeeld een Chi-kwadraat-test). Voor gevallen met een hogere dimensie, bijvoorbeeld drie-, vier- of vijf-dimensionale situaties, hebben log-lineaire modellen de voorkeur. Om log-lineaire modellen echter beter te begrijpen, zullen we beginnen met eenvoudige contingentietabellen met twee dimensies (variabelen) omdat deze veel gemakkelijker te begrijpen zijn.

    Een belangrijk kenmerk van log-lineaire modellen is dat ze zowel afhankelijke als onafhankelijke variabelen behandelen, waardoor het onderscheid tussen deze wordt genegeerd. Meestal worden in dit geval relaties onderzocht die symmetrisch zijn. Symmetrische relaties zijn relaties waarin alle variabelen gelijk worden behandeld als afhankelijke variabelen. Asymmetrische relaties daarentegen maken wel onderscheid tussen afhankelijke en onafhankelijke variabelen. Log-lineaire modellen kunnen beide behandelen, maar het verschil komt meer in interpretatie dan in wiskunde. Voor symmetrische modellen wordt de interesse gelijkmatig verdeeld. Voor asymmetrische modellen, zal de interesse zich meer richten op de afhankelijke variabele en de relatie met onafhankelijke variabelen.

    Hoe wordt een log-lineaire analyse opgesteld voor twee onafhankelijke variabelen?

    Zoals hierboven vermeld, zullen we beginnen met het geval van twee onafhankelijke variabelen. Niet omdat een log-lineair model meer te bieden heeft dan de standaardbenadering, maar omdat het veel gemakkelijker is om dit scenario uit te leggen en te begrijpen. Voor complexere scenario's laten we steeds meer berekeningen over aan computersoftware.

    Voorbeeld

    Stel dat we een onderzoek doen naar de aanleg van jurrors. We verwachten dat jurrors hun oordeel over verdachten baseren op het vermeende gedrag van het slachtoffer. Daarom proberen advocaten vaak een strategie te volgen om de jurrors te laten geloven dat het slachtoffer op een of andere manier verantwoordelijk is voor de misdaad, bijvoorbeeld door het verleden van het slachtoffer aan te vallen. Voor dit voorbeeld verkrijgen we een contingentietabel (zie tabel 25) met twee variabelen: de mate waarin het slachtoffer als 'fout' werd beschouwd en het feitelijke vonnis. Merk op dat de verwachte frequenties volgens de standaardtest van onafhankelijkheid van deze twee variabelen tussen haakjes worden toegevoegd.

    Tabel 25.

     Verdict (oordeel) 
    Aandeel slachtofferSchuldigNiet schuldigTotaal
        Laag153
    (127.6)
    24
    (49.4)
    177
        Hoog105
    (130.4)
    76 
    (50.6)
    181
        Totaal258100358

    Wanneer we de formule voor de Chi-kwadraat statistiek gebruiken, dat is:

    \[X^2=\frac{\sum{(O-E)^2}}{E}\]

    (dit is de Chi-kwadraat formule)

    resulteert dat in 35.93, wat significant is met α = .05. Als we dit nu veranderen in de likelihood -ratio statistic, dan krijgen we: 

    \[\frac{\sum{(f_{ij}-F_{ij})^2}}{F_{ij}}\]

    De verandering in notatie komt dus, kortgezegd, erop neer dat de geobserveerde cel frequenties in cel cij worden omgezet in fij en de verwachtre frequenties in diezelfde cel worden omgezet in Fij. 

    Model 1 ("Equiprobability model")

    Met behulp van het simpelste model; het equiprobability-model, dat is het model waarin we veronderstellen dat respondenten zichzelf willekeurig over de vier cellen verdelen, verkrijgen we:

    • Waargenomen: 153; 24; 105; 76
    • Verwacht: 89,5; 89,5; 89,5; 89.5

    Vervolgens is de waarschijnlijkheidsratio-test:

    • X2 = 2 Σ fij ln (fij / Fij)
    • = 2 (153 ln (153 / 89.5) + 24 ln (24 / 89.5) + 105 ln (105 / 89.5) + 76 ln (76 / 89.5)
    • = 109,6

    Deze test-statistiek kan worden onderzocht met behulp van de Chi-kwadraatverdeling met 4 - 1 = 3 vrijheidsgraden. Met behulp van de appendixtabel voor de Chi-kwadraatverdeling vinden we dat X2.05 (3) = 7.82. Daarom kunnen we de nulhypothese verwerpen en concluderen dat dit model niet goed past bij de gegevens.

    Model 2 en 3 (Conditionele equiprobability modellen)

    Het eerste model, het equiprobability-model, paste niet goed in de gegevens. In dit eerste model was er geen variabele die bijdroeg aan de waargenomen frequenties. We gaan nu verder met een tweede model, het voorwaardelijke of conditionele equiprobability-model, waarbij de waargenomen frequenties afhankelijk zijn van één variabele. In dit geval gebruiken we Oordeel als de voorwaardelijke variabele. We verkrijgen nu:

    • Waargenomen: 153; 24; 105; 76
    • Verwacht: 129; 50; 129; 50

    Dit resulteert in een waarschijnlijkheidsratio-test van 37,4 met 4 - 2 = 2 vrijheidsgraden. Merk op dat we nu slechts twee vrijheidsgraden hebben, omdat we een andere beperking hebben opgelegd: de celfrequenties in elke kolom moeten de verwachte frequentie voor dat model optellen. Hier levert het resultaat X2.05 (2) = 5,99 op waarvoor we opnieuw de nulhypothese zullen verwerpen. Dit tweede model past dus ook niet in de waargenomen gegevens.

    Het voorwaardelijke equiprobability-model zou ook kunnen worden ontwikkeld voor de variabele "Aandeel". Wederom is het resultaat echter een significante teststatistiek, wat betekent dat het model niet goed past bij de gegevens.

    Model 4 (wederzijds afhankelijkheidsmodel)

    We gaan nu verder met het vierde model, het wederzijdse afhankelijkheidsmodel, waarin we aannemen dat de twee factoren gezamenlijk werken, maar onafhankelijk om de verwachte celfrequenties te behandelen.

    Als we uitgaan van de onafhankelijkheid van de twee variabelen, verkrijgen we:

    \[F_{ij}=\frac{RT*CT}{GT}=\frac{f_i*F_j}{f...}\]

    waarbij RT (fi.) verwijst naar het rijstotaal, CT (f.j) naar het kolomtotaal en GT naar het eindtotaal. Voor deze berekening gebruiken we de verwachte frequenties zoals vermeld in Tabel 25 en verkrijgen we een waarschijnlijkheidsverhouding X2 = 37,4 die significant is bij 1 vrijheidsgraden. We concluderen dus dat een model dat een onafhankelijkheid tussen de twee variabelen (schuldig en oordeel) voorstelt, ook niet goed past bij de gegevens.

    Verzadigd model

    Het laatste model is een uitbreiding van het model van wederzijdse afhankelijkheid. We voegen nu het interactie-effect toe tussen Verdict en Fault. Dit model heeft evenveel parameters als cellen (dat wil zeggen 4: een intercept, een rij-effect, een kolom-effect en een interactie-effect). Dit model past perfect bij de data met X2 = 0.00. Daarom concluderen we dat we de gegevens niet adequaat kunnen aanpassen, tenzij we een interactie tussen de variabelen toestaan.

    Hoe een log-lineair model te specificeren?

    De notatie die wordt gebruikt voor log-lineaire modellen lijkt in het begin misschien wat lastig, maar is nauw verwant aan het model dat we in de variantieanalyse hebben gespecificeerd. Vergeet niet dat we in vorige hoofdstukken modellen hadden zoals:

    \[X_{ijk}=\mu+\alpha_i+\beta_j+\alpha\beta_{ij}+e_{ijk}\]

    Het log-lineaire model heeft termen die hier parallel aan zijn. De parameter τ (tau) lijkt sterk op het (grand) gemiddelde μ en de behandelingseffecten worden omgezet in de natuurlijke logaritme van tau, weergegeven als λ (lambda). Dit resulteert in een specificatie van de vijf modellen zoals gerapporteerd in tabel 26.

    Table 26.

    ModelRepresentatieX2dfp
    1. Equiprobabilityln(Fij) = λ109.63<.05
    2. Conditionele equiprobabilityln(Fij) = λ + ln(Fij) + λiV37.42<.05
    3.  Conditionele equiprobabilityln(Fij) = λ + ln(Fij) + λiF109.52<.05
    4. Wederzijdse afhankelijkheidln(Fij) = λ + ln(Fij) +  λiV + λiF37.41<.05
    5. Verzadigdln(Fij) = λ + ln(Fij) +  λiV + λiF + λiVF0.000-

    Conditionele odds en odds ratio

    We introduceren nog twee concepten die van belang zijn bij log-lineaire modellering: conditionele odds en odds ratio. In ons voorbeeld is de conditionele odds om schuldig te worden bevonden, wanneer het slachtoffer wordt beschouwd als een laag aandeel hierin te hebben, 153/24 = 6.4. Dus in de groep met weinig aandeel zijn de kansen om schuldig te te worden bevonden 6.4: 1. Met andere woorden, voor elke persoon in de groep met laag slachtoffersaandeel die niet schuldig wordt bevonden, worden 6.4 schuldig bevonden. Evenzo is de conditionele odds om schuldig te worden bevonden, waneer het slachtoffer als hoog op Aandeel werd beschouwd, 1.4. Ten tweede, als er geen interactie is tussen Oordeel en Aandeel, wordt verwacht dat de odds ratio ongeveer 1,00 is. In plaats daarvan vinden we in het voorbeeld een odds ratio (Ω) van 6.4 / 1.1.4 = 4.6. Dit betekent dat de kans dat een verdachte schuldig wordt bevonden in de lage aandeel conditie 4,6 keer groter is dan de kans dat een verdachte schuldig wordt bevonden in de hoge aandeel conditie. Zo kunnen we dus concluderen dat de strategie "het slachtoffer de schuld geven" lijkt te werken.

    Assumpties

    De assumpties van log-lineaire modellen zijn vergelijkbaar met die van de traditionele Chi-kwadraat-test. Er zijn geen assumpties over populatieverdelingen. Er wordt echter wel aangenomen dat de waarnemingen onafhankelijk zijn. Bovendien moeten de verwachte frequenties, net als bij de Chi-square test, groot genoeg zijn om aan te nemen dat de frequenties in elke cel normaal verdeeld zijn over herhaalde steekproeven. We hebben opnieuw alle verwachte frequenties nodig o die groter zijn dan één en streven naar (als vuistregel) het geval waarin niet meer dan 20% van de cellen verwachte frequenties minder dan vijf hebben. Het grootste probleem met log-lineaire modellen doet zich voor in het geval van schaarse matrices (sparse matrices), dat wil zeggen wanneer de contingentietabel veel lege cellen bevat. In deze situaties wordt geadviseerd om categorieën te combineren op basis van een theoretische reden, of variabelen samen te voegen, of de steekproefgrootte te verhogen.

    Hoe kun je log-lineair modellen testen?

    Het centrale probleem bij log-lineaire modellering is het kiezen van welk model het beste bij de gegevens past. Gewoonlijk worden deze modellen stapsgewijs getest. Merk op dat we nooit een verzadigd model passen omdat we hopen dat het past - dat weten we van tevoren (het is het meest complexe model en past daarom het beste bij de data). We passen dit model meestal toe in de hoop dat het zal helpen om eenvoudiger modellen te identificeren door niet-significante effecten te identificeren. Kortom, een gebruikelijke benadering voor log-lineaire modelaanpassing is de stapsgewijze procedure, waarbij men begint met het verzadigde model en vervolgens onderzoekt wat er in verschillende delen van het model gebeurt (om die uit te kunnen sluiten in het uiteindelijke model).

    Hoe kun je een log-lineair model voor drie variabelen gebruiken?

    We gaan nu verder met het drie-dimensionale scenario, dat wil zeggen de situatie met drie variabelen. In deze situaties kan de standaard Chi-kwadraatanalyse geen volledig inzicht in de gegevens opleveren.

    Er zijn verschillende opties beschikbaar in SPSS om log-lineaire modellen te berekenen voor meer dan twee variabelen: SPSS GENLOG, SPSS LOGLINEAR en SPSS HILOGLINEAR.

    Om het drie-weg log-lineaire model te illustreren, breiden we ons vorige voorbeeld uit met een derde variabele: moraal.

    Table 27.

      Moraal 
    OordeelAandeel
    slachtoffer
    HoogNeutraalLaagRij total
    SchuldigLaag
    Hoog
    Totaal
    42
    23
    65
    79
    65
    144
    32
    17
    49
    153
    104
    258
    Niet schuldigLaag
    Hoog
    Totaal
    4
    11
    15
    12
    41
    53
    8
    24
    32
    24
    76
    100
     Kolom Total8019781358

    In dit voorbeeld, zijn er 18 (!) hypotheses te onderzoeken. Een aantal daarvan staan hieronder benoemd (M = Moraal; V = Verdict (oordeel) en A = Aandeel)

    • ln(Fij) = λ + λM
    • ln(Fij) = λ + λV
    • ln(Fij) = λ + λM + λV
    • ln(Fij) = λ + λM + λV + λMV
    • ln(Fij) = λ + λA + λM + λV + λMV 
    • ln(Fij) = λ + λA + λM + λV + λMV + λAM 
    • ln(Fij) = λ + λA + λM + λV + λMV + λAM + λAV + λAMV 

    Het laatste model (model 7) is het verzadigde model. 

    Hoe de resultaten van een log-lineaire analyse te interpreteren?

    Voor deze cursus is het niet zo belangrijk om de wiskunde en berekeningen achter log-lineaire modellen volledig te begrijpen. Het gaat er echter om dat je de resultaten van deze modellen kunt interpreteren. Daarbij zijn de belangrijkste effecten vrij gemakkelijk te begrijpen en vergelijkbaar met wat in vorige hoofdstukken is besproken. Maar hoe kunnen we de interactie-effecten interpreteren? Stel dat we in het hierboven besproken voorbeeld een interactie-effect vinden tussen Aandeel (slachtoffer) en Oordeel (verdachte). Wanneer wordt vastgesteld dat het slachtoffer weinig aandeel heeft gemaakt, is de kans voor de verdachte voor een schuldig oordeel 6.38. In plaats daarvan, wanneer het slachtoffer wordt gezien als zijnde hoog in aandeel, is de kans op een schuldig vonnis te zijn slechts 1.38. De odds-ratio is dus 6,38 / 1,38 = 4,62. En de odds ratio is ln (4.62) = 1.53. Kort samengevat houdt dit in dat het schuldoordeel duidelijk afhangt van de mate waarin het slachtoffer wordt beschouwd een aandeel te hebben in het geheel. 

    Tentamen ticket

    • Log-lineaire modellen lijken erg op de traditionele Chi-kwadraat test. Ze hebben de voorkeur in het scenario van meer dan twee variabelen. Voor deze cursus is het niet belangrijk om de wiskunde achter deze modellen volledig te begrijpen. Om de essentie van dit hoofdstuk te vatten, volstaat het om te oefenen met de notatie en interpretatie van een log-lineair model met drie variabelen. 
    Access: 
    Public
    Welke technieken worden gebruikt bij resampling en non-parametrische databenaderingen? - Chapter 18

    Welke technieken worden gebruikt bij resampling en non-parametrische databenaderingen? - Chapter 18

    De meeste statistische procedures in de voorgaande hoofdstukken waren parametrische testen: testen zoals de t test met aannames of schattingen van parameters (in de populatie). Een klasse testen, die niet afhangt van parameterschattingen zijn de non-parametrische testen of distributie-vrije testen (er is geen verdeling/distributie te maken). De meeste testen onder deze noemer zijn resampling testen. Deze testen baseren hun conclusies op een groot aantal steekproeven uit de populatie onder de aanname dat de nulhypothese juist is en vergelijken dit met de ‘resampled’ resultaten.

    De resampling procedures die werken met ruwe scores zijn ofwel bootstrapping testen of randomisering testen. Deze technieken worden nu verder besproken.

    Welke voor- en nadelen hebben non-parametrische testen?

    Het grote voordeel van non-parametrische testen is dat ze niet afhangen van strenge voorwaarden over de vorm van de populaties. Er zijn wel voorwaarden over de steekproefverdeling, maar veel algemener van aard (er wordt bijvoorbeeld geen normale verdeling vereist). De assumpties van parametrische testen kunnen echter vaak wel tegen overschrijdingen.

    Een ander kenmerk is dat veel non-parametrische testen gevoeliger zijn voor medianen dan voor gemiddelden. Dus bij een onderzoek met data waarbij je je interesseert in medianen is een non-parametrische test geschikt.

    Veel non-parametrische testen rangschikken hun ruwe scores en werken met deze rangen. Daardoor zijn ze minder gevoelig voor extreme scores.

    Een groot nadeel van non-parametrische testen is hun (vaak) lage power in vergelijking met de parametrische testen. Voor dezelfde power heeft een non-parametrische test vaak meer observaties nodig. Met een bepaalde set data zal een parametrische test dus eerder een valse nulhypothese verwerpen dan een non-parametrische. Dit is zelfs het geval als de assumpties van de parametrische test deels overschreden zijn.

    Wanneer wordt bootstrapping gebruikt?

    Bootstrapping is als procedure met name interessant wanneer we geïnteresseerd zijn in de mediaan. Het wordt meestal gebruikt bij het schatten van parameters, met name variatie. Bij bootstrapping wordt data telkens opnieuw gesampled met teruglegging uit een bepaalde populatie. Permutatie testen daarentegen, zijn testen die steekproeven trekken zonder teruglegging.

    Stel dat we de betrouwbaarheidsgrenzen van een gemiddelde van een populatie willen vaststellen. Als de populatie normaal verdeeld is, gebruiken we het steekproefgemiddelde en de -standaarddeviatie als schattingen voor de populatie. Maar, dit kan alleen als ook de steekproefverdeling normaal is. Wanneer de populatie niet normaal verdeeld is, of we zeer kleine steekproeven hebben, is bootstrapping een goed alternatief.

    Voorbeeld met mediaan

    We verzamelen geheugenscores van een examen bij twintig participanten in de leeftijd van 80-84 jaar. We verwachten een negatieve scheefheid in de data: sommige van de participanten zullen verminderd cognitief functioneren op deze leeftijd. Van deze data willen we betrouwbaarheidsgrenzen berekenen op de mediaan.

    De eerste stap is aannemen dat de populatie precies zo is verdeeld als onze steekproef. Vervolgens gaan we een populatie creëren door herhaaldelijk steekproeven te trekken uit onze bestaande steekproef, met teruglegging. Zo’n populatie gecreëerd uit het evenbeeld van een steekproef heet een pseudo-populatie.

    Van elke steekproef die we trekken (elk van n = 20), berekenen we de mediaan. Uiteindelijk krijgen we een verdeling van medianen, waaruit we de betrouwbaarheidsinterval kunnen afleiden. Dit wordt makkelijk gedaan door een computer software programma.

    In dit voorbeeld is de mogelijkheid aan scores zeer beperkt (tussen 2 en 12). De verdeling van medianen is dus vrij discreet. Normaal willen we bij betrouwbaarheidsintervallen de laagste en hoogste 2,5% van de observaties afscheiden maar nu kan dat niet. Bij discrete verdelingen is het beter om de limieten te berekenen waarbij bijvoorbeeld de score onder de 10 valt (en dan in het percentage mensen of observaties).

    Voorbeeld met correlatiecoëfficiënt

    Verdergaand op het voorbeeldonderzoek van eerder, kijken we nu naar 123 volwassenen tussen de 60 en 97 jaar, en onderzoeken we de relatie tussen geheugenprestaties en leeftijd. We verwachten een negatieve correlatie en zijn met name geïnteresseerd in de betrouwbaarheidsgrenzen van deze correlatie.

    De bootstrap benadering is het trekken van 123 participanten uit de steekproef, met teruglegging, en de correlatie tussen de variabelen te berekenen. Na dit proces een groot aantal keer te herhalen, zoeken we de 2,5 en 97,5 percentielen in de verdeling en vinden zo het betrouwbaarheidsinterval. In het voorbeeld zijn deze grenzen -.43 en -.11. Doordat nul niet in dit interval ligt, kunnen we concluderen dat de correlatie significant is.

    Bij grote correlaties zal de steekproefverdeling scheef zijn en de betrouwbaarheidsgrenzen asymmetrisch.

    Wanneer worden permutatie testen gebruikt?

    In tegenstelling tot bootstrapping, trekken permutatie testen steekproeven zonder teruglegging. Dit is een procedure van randomisering waarbij de set observaties willekeurig wordt gehusseld en willekeurig aan condities worden toegewezen.

    Twee gekoppelde steekproeven

    Als voorbeeld een onderzoek naar de rol van beta-endorfines als reactie op stress. De onderzoekers wilden weten of deze stof toenam bij stressvolle situaties. Ze onderzochten het niveau van endorfine bij negentien patiënten, twaalf uur vóór een operatie, en tien minuten vóór de operatie. Dit zijn scoreparen, en we zijn geïnteresseerd in de verschilscores. De nulhypothese is dat de gemiddelde verschilscore 0.0 is (geen effect). Als we naar de verschilscores per participant kijken, zien we dat de verdeling van deze scores zeer positief scheef is, een standaard t test is dus niet geschikt.

    Het idee achter de permutatie is dat, bij een ware nulhypothese, oftewel dat stress de beta-endorfine niveaus niet beïnvloedt, de gevonden stressniveaus van elk meetmoment afkomstig kunnen zijn. Een score van 13.5 kan van het twaalf uur meetmoment zijn, of van het tien minuten moment (want het is dan puur een toevals-kans). Vervolgens geldt dat ook de verschilscores puur kans zijn, en negatief of positief kunnen zijn. De permutatie neemt een groot aantal steekproeven uit de data en schrijft willekeurig positieve en negatieve signalen toe aan de verschilscores. Hierdoor krijgen we een verdeling van verschilscores met ieder een eigen mediaan. Dit is dus de steekproefverdeling van verschillen wanneer H0 waar is. We vergelijken vervolgens de verkregen mediaanverschillen met deze distributie om H0 te testen.

    De verdeling van de mediaan als H0 juist is, is symmetrisch rondom de nul. In de ruwe data in het voorbeeld vonden we een mediaan verschilscore van 6. Als we die opzoeken in de steekproefverdeling, blijkt dat een waarde 6 van de mediaan extreem is onder H0. Van de 10.000 steekproeven waren slechts 18 kleiner dan -6 of groter dan 6: een tweezijdige kans van 18/10.000 = .0018. We kunnen de nulhypothese verwerpen: endorfine niveaus nemen toe als stress toeneemt.

    Wat is de Wilcoxon’s Rang-Som test?

    Dit is een traditionele non-parametrische test, en is geschikt voor twee onafhankelijke steekproeven (bijna een analoog van de t test). De nulhypothese is dat de twee steekproeven willekeurig van identieke populaties zijn getrokken. De logica achter de test is als volgt:

    We hebben twee groepen in de behandeling, met n1 observaties in groep 1 en n2 observaties in groep 2. We nemen aan dat de nulhypothese onjuist is, en dat de scores van groep 1 over het algemeen lager zijn dan de scores van groep 2. Wanneer we alle observaties van beide groepen zouden rangschikken van laag naar hoog, verwachten we dat de lagere rangen meestal groep 1 scores betreffen en de hogere rangen groep 2 scores. De som van rangen van elke groep zal dan verschillen: de som van groep 1 is veel kleiner dan die van groep 2.

    Bij een ware nulhypothese heeft elke groep een paar hoge en een paar lage rangen (willekeurig) en zal de som van de rangen per groep grofweg gelijk zijn.

    Voorbeeld

    Een voorbeeld waarbij deze test wordt gebruikt, is een onderzoek naar het verband tussen stressvolle levensgebeurtenissen (het aantal hiervan) en hartpatiënt zijn of een orthopedische patiënt. Je zou verwachten dat hartpatiënten meer stress hebben.

    We hebben zes hartpatiënten en vijf orthopedische patiënten en het aantal stressvolle gebeurtenissen per persoon. Deze scores rangschikken we van laag naar hoog, ongeacht groep. Als n1 nemen we de kleinste groep (in dit geval orthopedische groep): we berekenen de som van de rangen Ws = 21. In Wilcoxon’s tabel kan de kritieke waarde worden opgezocht bij n1 = 5 en n2 = 6: deze is 18. Om een significant verschil tussen de groepen aan te tonen bij een alfa van .025 moet Ws kleiner of gelijk aan 18 zijn. We hebben geen significant verschil, aangezien onze Ws groter was dan 18. We kunnen de statistiek Ws’ uitrekenen om te zien wat de som van ranken voor de kleinste groep geweest was als we de rangorde omgedraaid hadden naar van hoogste naar laagste:

    • Ws’= 2W - Ws. 2W = n1(n1 + n2 + 1).

    De Appendix voor Ws kan gebruikt worden tot n1 en n2 van 25. Voor grotere waarden gebruiken we het volgende:

    • Gemiddelde = n1(n1 + n2 + 1)/2
    • Standaardfout = 

    \[\sqrt{\frac{n_1n_2(n_1+n_2+1)}{12}}\]

    \[Z=\frac{W_s-\frac{n_1(n_1+n_2+1)}{2}}{\sqrt{\frac{n_1n_2(n_1+n_2+1)}{12}}}\]

    Bij gelijke scores zijn er verschillende manieren om hier mee om te gaan: gelijke scores geven, kiezen door een munt op te gooien of ongelijke ranken geven zodat het moeilijker wordt H0 te verwerpen. Meestal wordt de eerste optie gebruikt.

    Wilcoxon’s test is eigenlijk een permutatie test op gerangschikte data. Een standaard permutatie test kan uitgevoerd worden op de rangen en hetzelfde resultaat zou eruit komen. Een test gelijk aan de Wilcoxon’s test is de Mann-Whitney U statistiek. De relatie tussen de twee is perfect lineair, met de formule:

    \[U=\frac{n_1(n_1+n_2+1)}{2-W_s}\]

    Wat is de Wilcoxon’s matched-pairs test?

    Wilcoxon heeft niet alleen de populairste non-parametrische test voor onafhankelijke groepen ontwikkeld, maar ook die voor gematchte groepen (scoreparen). De nulhypothese die getest wordt, is dat de twee steekproeven van identieke populaties komen of van symmetrische populaties met hetzelfde gemiddelde. Het toetst ook de nulhypothese dat de verdeling van verschilscores symmetrisch is rond nul.

    Voorbeeld

    We willen weten of langdurig joggen de bloeddruk kan verlagen. We meten de bloeddruk bij participanten, laten ze dan een programma van zes maanden volgen waarin ze veel joggen, en meten dan weer de bloeddruk. We verwachten een lagere bloeddruk aan het eind.

    We beginnen met de verschilscores te berekenen van elk scorepaar. Dan rangschikken we die verschilscores zonder te letten op de waarde (positief of negatief). De rangen nemen de waarde over. Per groep sommen we uiteindelijk de rangen op.

    Om de significantie te berekenen nemen we de absolute waarde van de twee sommen en kiezen daar de kleinste uit (en noemen hem T). Deze vergelijken we in Appendix T (Howell, 2013: 703).

     

    Voor:

    130

    170

    125

    170

    130

    130

    125

    160

    Na:

    120

    163

    140

    135

    143

    136

    124

    120

    Verschil:

    10

    7

    -15

    35

    -13

    -6

    1

    40

    Rang:

    5

    4

    2

    7

    6

    3

    1

    8

    Rang met waarde:

    5

    4

    -2

    7

    -6

    -3

    1

    8

    T+ = ∑ positieve rangen = 27

    T- = ∑ negatieve rangen = -9

     

     

     

     

     

     

    De kleinste som is die van T-, dus T = 9. In Appendix T hoort bij een n = 8 en een alfa van .025 de kritieke waarde T = 3 of 4, dus we verwerpen de nulhypothese niet. Bloeddruk verandert dus niet na zes maanden joggen.

    Gelijke scores kunnen voorkomen, waardoor de verschilscore nul is. Deze participanten worden niet meegenomen in het onderzoek. Het kan ook voorkomen dat we dezelfde rangen hebben. Hierbij kunnen we de rangen opbreken zoals we willen.

    Bij een steekproef met een n groter dan 50 gaan we over de limiet van Appendix T. Dan geldt echter dat we de steekproefverdeling van T als normaal verdeeld kunnen zien, en kunnen we een z score berekenen aan de hand van T en n.\

    • Gemiddelde = n(n+1)/4
    • Standaardfout = 

    \[\sqrt{\frac{n(n+1)(2n+1)}{24}}\]

    \[Z=\frac{T-\frac{n(n=1)}{4}}{\sqrt{\frac{n(n+1)(2n+1)}{24}}}\]

    Wat is de sign test?

    De sign (teken) test gaat nog verder dan de Wilcoxon test en kijkt alleen naar het teken (+/-) van de verschilscores. Hierdoor verliest het nog meer power.  We maken gebruik van een tabel met verwachtte frequenties voor elke cel en berekenen chi-kwadraat:

    \[\frac{\sum{(O-E)^2}}{E}\]

    Wanneer wordt de Kruskal-Wallis one-way ANOVA gebruikt?

    Dit is de Wilcoxon rang-som test voor drie of meer onafhankelijke groepen. Het test de hypothese dat alle steekproeven uit identieke populaties komen. We rangschikken weer de scores en berekenen weer de som van de rangen. Elke som noemen we Ri (met i verschillend per groep). Bij een juiste nulhypothese verwachten we dat de Ri’s min of meer gelijk zijn.

    De verschillen tussen de Ri’s wordt uitgedrukt in de term H:

    \[H=\frac{12}{N(N+1)}\sum{\frac{R_j^2}{n_i}}-3(N+1)\]

    • waarbij k het aantal groepen is, ni het aantal observaties in groep i, Ri de som van rangen in groep i en N de totale steekproefgrootte. Deze term kan in de χ² verdeling worden opgezocht met k-1 df.

    Hoe werkt Friedman’s rang test voor herhaalde metingen?

    Deze test lijkt sterk op een herhaalde metingen ANOVA, maar werkt met rangen in plaats van ruwe scores. De nulhypothese is dat de scores voor elke behandeling uit identieke populaties komen. De formule voor het toetsen van de nulhypothese is:

    \[X_F^2=\frac{12}{Nk(k+1)}\sum{R_i^2}-3N(k+1)\]

    • waarbij Ri de som van de rangen is voor de i-de conditie, N het aantal participanten en k het aantal condities. De XF2-waarde kan opgezocht worden in een standaard X2 verdeling met k-1 df.
    Access: 
    Public
    Access: 
    Public

    Image

    Join: WorldSupporter!

    Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>

    Check: concept of JoHo WorldSupporter

    Concept of JoHo WorldSupporter

    JoHo WorldSupporter mission and vision:

    • JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.

    JoHo concept:

    • As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
    • JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.

    Join JoHo WorldSupporter!

    for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for

    Check: how to help

    Image

     

     

    Contributions: posts

    Help others with additions, improvements and tips, ask a question or check de posts (service for WorldSupporters only)

    Image

    Check: more related and most recent topics and summaries

    Image

    Share: this page!
    Follow: Psychology Supporter (author)
    Add: this page to your favorites and profile
    Statistics
    4425
    Submenu & Search

    Search only via club, country, goal, study, topic or sector