Op welke manier kunnen variantie- en covariantieanalyse gezien worden als General Linear Models? - Chapter 16
De variantieanalyse en de multipele regressie hebben veel met elkaar gemeen. De variantieanalyse vertelt ons dat drie behandelingen (T1, T2 en T3) verschillende gemiddelden hebben, de multipele regressie zegt dat de gemiddelden gerelateerd zijn aan de behandelingen (T1, T2 en T3). Dit komt eigenlijk op hetzelfde neer.
- Wat is het Algemeen Lineair Model?
- Design matrixes
- Hoe werkt ANOVA bij ongelijke steekproefgroottes?
- Welke kennis is belangrijk over de eenweg Covariantie-analyse?
- Hoe worden de effectgroottes berekent?
- Hoe werkt de interpretatie van een covariantie-analyse?
- Welke stap neem je naar meerdere covariaten?
- Welke alternatieve designs zijn er?
Wat is het Algemeen Lineair Model?
De ANOVA is eigenlijk een speciale versie van de multipele lineaire regressie, die een onderdeel is van het General Linear Model (algemeen lineair model). Dit hoofdstuk gaat verder in op het algemeen lineair model, zowel met algemene concepten als berekeningen. Deze berekeningen zijn toegevoegd voor de volledigheid, maar het gaat om het begrijpen van het model.
Lineair model
Het model voor multipele regressie is: Yi = b0 + b1X1i + b2X2i + … + ei. Dit kan ook met vectoren genoteerd worden: y = b0 + b1x1 + b2x2 + … + e. y en x’en zijn de (n∙1) vectoren van de data, e de (n∙1) vector van errors en b0 de (n∙1) vector van de intercept elementen. Het kan ook geschreven worden als: y = Xb + e, met X als n∙(p+1) matrix van predictoren en b als (p+1)∙1 als vector van de regressiecoëfficiënten.
Het model van een eenweg variantieanalyse is:
\[Y_{ij}=\mu+T_j+e_{ij}\]
Design matrixes
Dit is een matrix van gecodeerde/dummy/tellervariabelen die aangeven bij welke groep een participant hoort. De matrix heeft p + 1 kolommen (met p het aantal behandelingen en een kolom voor gemiddelde μ). Per participant is er een rij. Elke participant krijgt een 1 voor μ, omdat die bij elke observatie wordt berekend. Dan krijgt de participant een 1 voor de groep waar zij bij hoort, en een score 0 op de andere groepen.
S | μ | A1 | A2 | A3 |
1 | 1 | 1 | 0 | 0 |
2 | 1 | 1 | 0 | 0 |
3 | 1 | 0 | 1 | 0 |
Het traditionele model voor de ANOVA heeft de vorm:
\[Y_{ij}=\mu+T_j+e_{ij}\]
- met de iste participant en de jste behandeling.
Omdat de ANOVA een onderdeel is van het GLM, kunnen we deze formule anders schrijven, gebruikmakend van de matrix, in de vorm: y = Xb + e, wat weer lijkt op het basismodel voor de multipele regressie formule.
Factorieel design
Bij een two-way ANOVA of een ANOVA met nog meer factoren, breiden we voort op dit model van de matrix. Als voorbeeld de two-way ANOVA met gelijke ns. Het algemene model is:
\[Y_{ij}=\mu+\alpha_i+\beta_j+\alpha\beta_{ij}+e_{ijk}\]
De α en β termen kunnen we middels een design matrix weer uitbreiden. Maar wat doen we met de interactie-term? Dit is een vermenigvuldigd effect van de twee componenten in de interactie. Stel dat we een 2x2 factoriaal design hebben, dan krijgen we:
| A1 | B1 | AB11 |
a1b1 | 1 | 1 | 1 |
a1b2 | 1 | -1 | -1 |
a2b1 | -1 | 1 | -1 |
a2b2 | -1 | -1 | 1 |
waarbij 1 en -1 aangeven of de participant A1of A2 of B1of B2kreeg en de derde kolom is de interactie tussen A en B. de interactiegetallen zijn bepaald door de getallen uit rij A en B te vermenigvuldigen (bijv. 1x1 = 1). Het aantal kolommen per variabele is gelijk aan het aantal vrijheidsgraden voor dat effect (=aantal niveaus -1).
Nu een voorbeeld met een 2x3 factoriaal design. A heeft twee niveaus en dus 1 df, B heeft drie niveaus en dus 2 df.
| A1 | B1 | B2 | AB11 | AB12 |
a1b1 | 1 | 1 | 0 | 1 | 0 |
a1b2 | 1 | 0 | 1 | 0 | 1 |
a1b3 | 1 | -1 | -1 | -1 | -1 |
a2b1 | -1 | 1 | 0 | -1 | 0 |
a2b2 | -1 | 0 | 1 | 0 | -1 |
a2b3 | -1 | -1 | -1 | 1 | 1 |
Kolom A maakt onderscheid tussen de twee behandelniveaus A1 en A2. Kolom B1 maakt onderscheid tussen mensen in B1 en niet in B1. Kolom B2 doet dit ook. Hierbij geldt dat participanten in de eerste a-1 en b-1 behandelniveaus een score 1 of 0 krijgen. Participanten in ade of bde behandelingsniveau krijgen -1. AB11 is het product van kolommen A1 en B1, evenals AB12 van A1 en B2.
Dit is uit te breiden naar grotere factoriele ontwerpen.
Hoe werkt ANOVA bij ongelijke steekproefgroottes?
Bij ongelijke steekproefgroottes in de ANOVA zijn de rijen, kolommen en interactie-effecten niet meer volledig onafhankelijk van elkaar, waardoor de variantie overlapt. Wanneer we dan een model met variabelen A, B en AB vergelijken met een model met alleen A en B, dan krijgen we niet het gebied van de AB cirkel, want een deel hiervan kan verklaard worden door A of B. SSAB geeft de unieke variantie van AB weer na het aanpassen voor A en B.
Om dit op te lossen, zijn verschillende modellen ontworpen die in SPSS Model I t/m III genoemd worden. De keuze voor een bepaald model hangt samen met de relatie tussen steekproefgrootte en behandeling. Model III meestal geschikt, omdat deze de gemiddelden ongewogen (voor steekproefgrootte) test.
Welke kennis is belangrijk over de eenweg Covariantie-analyse?
Ook voor de covariantie-analyse geldt, dat deze (vooral met meer dan één covariaat) lastig met de hand te berekenen is. Toch is achtergrondkennis handig bij het begrijpen van SPSS uitvoer.
Stel dat we willen onderzoeken of kleinere auto’s makkelijker te besturen zijn. We hebben drie verschillende autogroottes drie groepen bestuurders, met aanzienlijke verschillen in rijervaring tussen bestuurders. We kunnen individuen hier niet op matchen, dus nemen we aan dat de gemiddelde rijervaring tussen de groepen gelijk is. De afhankelijke variabele is het aantal stuurfouten en de covariaat is rijervaring. Wat we namelijk willen, is de prestaties van bestuurders onderzoeken onafhankelijk van hun rijervaring, maar puur wat we verwachten vanwege de grootte van de auto. We verminderen hiermee de error.
Het kan voorkomen dat de groepen verschillen op de covariaat. In dit geval werken we met aangepaste gemiddelden. Deze representeren de beste gok van het gemiddelde als de groepen niet verschillen op de covariaat. De covariantie-analsye bekijkt vervolgens of deze aangepaste gemiddelden significant van elkaar verschillen. Hiernaast verminderen we ook nog de errorterm door de variantie verklaar door de covariaat eruit te halen.
Voorwaarden
Bij de covariantie-analyse gelden de normale voorwaarden van de ANOVA (normaal verdeling en homogeniteit van variantie) plus twee extra voorwaarden. De eerste is dat de relatie tussen Y en de covariaat C lineair is. De tweede is homogeniteit van regressie: dat de regressie-coëfficiënten gelijk zijn tussen de behandelingen oftewel dat de regressielijnen parallel zijn.
De analyse
De covariantie is in feite een ANOVA, waarbij we het effect van de covariaat eruit willen filteren. We gaan ervan uit dat de totale variatie in Y verklaard kan worden door C, het behandeleffect (α) en de error. Wanneer we SSregressie C,α vergelijken met SSregressie C, dan zal het verschil de variatie zijn door het behandeleffect.
We nemen weer het onderzoek uit hoofdstuk 11 (ANOVA) waarbij ratten een stofje ingespoten kregen die hun motorische activiteit tijdelijk verhoogd. Naarmate ratten gewend raken aan hun omgeving, gaan ze weer minder bewegen. De onderzoekers in deze studie wilden zeker weten dat hun behandeleffecten echt alleen door de behandeling kwamen. Daarom namen ze de activiteit na de injectie als een percentage van de activiteit van die bepaalde rat vóór de injectie (om verschillen in pre-injectie activiteit uit te sluiten). Een andere methode was geweest om een covariantie-analyse uit te voeren op post-injectie activiteit met pre-injectie verschillen als covariaat. We controleren dus voor het feit, dat groepen wellicht al verschilden op pre-injectie activiteit. Doordat de ratten willekeurig zijn ingedeeld in groepen, verwachten we echter geen verschillen te zien van te voren.
Eerst testen we de data voor homogeniteit van regressie. De nulhypothese is:
- H0 : b1* = b2* = …= b5*
Als de regressie-coëfficiënten gelijk zijn aan elkaar, geldt dat de interactie-term van effect x covariaat niet significant is. Het weghalen van deze term uit de formule zal weinig tot geen invloed hebben op de variatie in het model. Nu vergelijken we de R2 van het model mét interactie-term met het model zonder interactie-term.
- R2τ,C= .804
- R2τ,C,Cτ = .824
Een F test over de verschilscore tussen deze twee is niet sterk genoeg: we kunnen voldoen aan de voorwaarde voor homogene regressie. De analyses hierna kunnen we dus doen zonder interactie-term:
SS berekenen
Uit de data van de regressieanalyses (Howell, 2013: p.599) is af te leiden dat de SSregressieτc gelijk is aan 82.64 (dit is met behandeleffect en covariaat). De SSresidu is 20,13, wat de onverklaarde variantie weergeeft. Wanneer we de SSregressie bekijken zonder behandeleffect groepen, daalt de SS naar 73.42. Het verschil tussen deze twee getallen is de variatie die niet verklaard wordt door de covariaat en noemen we SSbehandel(adj) (met adj van ‘aangepast’). In dit geval is de SS aangepast voor het feit dat de vijf groepen ratten verschilden op de pretest meting.
Omgekeerd moeten we voor de SScovariaat het model met zowel covariaat als behandelvariabelen vergelijken met een model met alleen de behandel variabelen. Het verschil hiertussen is toe te wijzen aan de covariaat. De tabel van de analyse ziet er dan als volgt uit:
Tabel 24
Bron | df | SS | MS | F |
Covariaat | 1 | 38.34 | 38.34 | 78.11* |
Behandel(adj) | 4 | 9.22 | 2.31 | 4.70* |
Residu | 41 | 20.12 | 0.49 |
|
Totaal | 46 | 102.77 |
|
|
*p < .05
Voor behandel(adj) is het aantal vrijheidsgraden (k-1) met k het aantal groepen
Voor covariaat is het aantal df gelijk aan het aantal covariaten (=1)
De error (residu) heeft N-k-c df.
Uit de tabel zien we dat het effect van behandeling, wanneer we het effect van de covariaat uitfilteren, nog significant is. Na controle voor pre-injectie verschillen in activiteit, verschillen de ratten alsnog op post-injectie activiteit.
Aangepaste gemiddelden
Nu we weten dat de post-injectie activiteit verschilt tussen de groepen, is het handig om te berekenen wat die gemiddelde activiteit per groep zou zijn wanneer de groepen niet verschillend waren op de pre-injectie metingen. Dit zijn de aangepaste gemiddelden en die vinden we met gebruik van de covariaat en behandelingen als predictors.
Voor het volledig model (met covariaat erbij), vonden we de volgende formule met gemiddelden:
- Yij = 0,4347(Pre) - 0,5922(T1) + 0,0262(T2) + 0,8644(T3) + 0,0738(T4) + 0,2183
Om de aangepaste gemiddelden te berekenen, vullen we voor T1 etc. een 0, 1 of -1 in, afhankelijk van om welke groep het gaat. (Pre) is de gemiddelde pre-injectie score en is bij alle groepen 4.806.
De aangepaste gemiddelden worden dan: 1,7153; 2,3336; 3,1719; 2,3813; 1,9353. Vervolgens kan getest worden of de aangepaste gemiddelden gelijk zijn in de populatie met de volgende formule:
\[F_{(1,N-a-1)}=\frac{(\bar{Y'_j}-\bar{Y'_k})^2}{MS'_{error}[(\frac{1}{n_j}+\frac{1}{n_k})+\frac{(c_j-c_k)^2}{SS_{e(c)}}]}\]
In de output van SPSS is een ‘spread versus level’ plot op te vragen. Deze zet de groepsgemiddelden af tegen de groepsvarianties. Bij homogene varianties, die onafhankelijk zijn van de gemiddelden, moet deze plot er willekeurig uitzien.
Hoe worden de effectgroottes berekent?
Een effectgrootte berekenen bij covariantie is wat lastiger dan bij een ANOVA, omdat we keuzes moeten maken over de te vergelijken gemiddelden en de errorterm. Ook hier geldt dat we gebruikmaken van de r-familie bij een omnibus F test, en de d-familie bij specifieke contrasten.
r-familie
De maat die we hier gebruiken is η², en wordt berekend door SSbehandeling te delen door de SStotaal. Het is zowel mogelijk om de SSbehandeling van de afhankelijke variabele in ANOVA te gebruiken als die in de covariantie. In het geval waar de covariaat natuurlijk varieert in de populatie (zoals in ons voorbeeld van pre-injectie activiteit), kunnen we de SSbehandeling nemen uit de covariantie-analyse. De SStotaal is dan uit die analyse de onaangepaste:
- η² = SSbehandeling(aangepast)/SStotaal
- η² = SSbehandeling(aangepast)/SStotaal
Er kan ook gekeken worden naar het verschil in R2 tussen het model met alleen de covariaat en het model met zowel de covariaat als de behandeling. Hier komt hetzelfde antwoord uit.
d-familie
Als voorbeeld nemen we het contrast tussen de controle groep en de 0.5 μg injectie-groep, omdat de onderzoekers daar het grootste verschil verwachtten. Omdat we een covariantie-analyse hebben uitgevoerd, moeten we rekenen met de aangepaste gemiddelden. Voor de twee groepen waren die respectievelijk 1.715 en 3.172.
\[d=\frac{\hat{\Psi}}{\hat{\sigma}}\]
Bij het vergelijken van twee gemiddelden is ψ simpelweg het verschil daartussen.
Voor de waarde van σ moeten we een keuze maken. Eén manier is de wortel nemen van MSerror uit de ANOVA (een maat voor de gemiddelde variatie binnen elke groep). Een andere manier is de wortel uit MSerror van de covariantie-analyse gebruiken. Deze maakt echter gebruik van aangepaste gemiddelden en maakt de interpretatie lastiger. Als de covariaat normaal varieert in de populatie kiezen we voor de MSerrorin de variantieanalyse zonder covariaat. In het voorbeeld komt een waarde van d = 1.23 uit de analyse. Dit houdt in dat injectie met 0.5 μg medicijn leidt tot een toename van post-injectie activiteit van bijna één en een kwart standaarddeviatie ten opzichte van de controlegroep.
Hoe werkt de interpretatie van een covariantie-analyse?
In het voorbeeld met de activiteit van ratten gingen we ervan uit dat de covariaat, pre-injectie activiteit, voor elke groep hetzelfde was. We hadden namelijk de groepen willekeurig samengesteld, waardoor de gemiddelde pre-injectie activiteit overal gelijk zal zijn. In dat geval zorgt de covariantie-analyse voor een verminderde error en verwijdert het mogelijke bias in de afhankelijke variabele, die veroorzaakt kan worden door groepsverschillen op de covariaat. Dit is de ideale toepassing van de covariantie.
Soms zullen we echter een covariaat meten na het uitvoeren van een behandeling.
Hierdoor zullen de groepen niet gelijk zijn op de covariaat. Je vraagt dan wat de gemiddelden van de groepen zouden zijn, als ze niet verschilden op de covariaat. De covariaat kan in dit geval echter een onderdeel zijn van het behandeleffect en de interpretatie van de analyse wordt dus moeilijk. Een alternatief is dan de true-score covariantie-analyse.
Wanneer participanten helemaal niet willekeurig aan behandelgroepen worden toegewezen (in een nonequivalent groepsontwerp), zoals bij een design met bestaande groepen (klaslokalen/scholen), kunnen we niet aannemen dat verschillen tussen de groepen door de behandeling komen. Het zou kunnen dat er voor de behandeling al verschillen waren tussen de groepen.
Rapportage
Rapportage van covariantie-analyses zou er zo uit kunnen zien:
We onderzochten de activiteit in ratten na injectie met medicijn X. Ratten werden willekeurig toegewezen aan één van vijf groepen met 0, 0.1, 0.5, 1 en 2 μg X. Daarna werd activiteit gemeten. Vanwege variatie in activiteit vóór de injectie, werd deze pre-injectie activiteit meegenomen als covariaat in de analyse. De covariantie-analyse was significant (F(4,41) = 4.694, p = .003) met het sterkste effect bij de middelste doseringen.
De factoranalyse van covariantie
De covariantie-analyse kan ook gebruikt worden bij factoriale designs. SSregressie c,α,β,αβ is de variatie door een combinatie van covariaat, algemene effecten A en B en de AB interactie. Bij factordesigns met gelijke groepsgroottes geldt dat algemene effecten en interacties orthogonaal zijn. Wanneer we dus het verschil uitrekenen tussen:
SSregressie c,α,β,αβ - SSregressie c,α,β houden we de variatie over die veroorzaakt wordt door de AB interactie. Maar, door deze orthogonale kwaliteit van de effecten, filteren we in feite alleen de covariaat uit voor dit effect.
Hetzelfde geldt voor effect A:
- SSregressie c,α,β,αβ- SSregressie c, β, αβ. En ook voor effect B.
De error term is de variatie die overblijft nadat we controleren voor A, B, en AB en de covariaat. De term hiervoor is: SSresidu c,α,β,αβ
De onafhankelijke variabele en de covariaat delen een deel van de verklaarde variantie, waardoor deze sum of squares samen niet de SStotaal maken. Het aantal vrijheidsgraden voor de hoofdeffecten van variabele A en B is het aantal categorieën min één. Het product van de vrijheidsgraden van de hoofdeffecten maakt het aantal vrijheidsgraden voor de interactie. Het aantal vrijheidsgraden voor de error term is: N-ab-c, waarbij a, b en c het aantal categorieën van de variabelen A, B en covariaat weergeven. De covariaat maakt gebruik van c df.
Voorbeeld
Als voorbeeld nemen we het rookonderzoek uit hoofdstuk 13 (ANOVA). Hierbij moesten rokers en niet-rokers een aantal taken uitvoeren en werd gekeken naar het aantal fouten dat zij hierbij maakten. Er waren drie groepen: Actieve rokers (die rookten tijdens de taak), Recente rokers (rookten tot 3 uur van tevoren) en Niet-Rokers. Naast het aantal fouten werd er gekeken naar mate van afgeleid zijn (hoe hoger de score, hoe erger). We hebben drie taken en drie behandelgroepen, het factoriale design is dus 3x3. Als covariaat nemen we de afleidbaarheid.
Als we de covariantie-analyse vergelijken met de ANOVA, blijkt dat de MSerror een stuk kleiner is bij de covariantie. Dit komt omdat de covariaat (afleidbaarheid) veel van de variatie in Error verklaart die in de ANOVA nog onduidelijk was.
Aangepaste gemiddelden
We willen weten wat de gemiddelden van de groepen geweest zouden zijn, als de covariaat geen invloed had gehad. Voor het volledige model van het voorbeeld geldt de formule:
\[Y=b_0+b_1C+b_2T_1b_3T_2+b_4G_1+b_5G_2+b_6TG_{11}+b_7TG_{12}+b_8TG_{21}+b_9TG_{22}\]
We zetten C (covariaat) op een vaste C’ = 112.52 voor alle behandelingen, omdat we willen weten wat de Y’s zouden zijn zonder verschil op C. Nu gaan we per cel (Taak x Groep) de gemiddelde Y’ berekenen door de gemiddelden in de formule in te vullen. We krijgen voor Cel1,1 bijvoorbeeld deze rij regressie-coëfficiënten:
1 0 1 0 1 0 0 0
De aangepaste gemiddelden kunnen vergeleken worden. Voor elke vergelijking is een andere error term nodig.
Welke stap neem je naar meerdere covariaten?
De stap naar meerdere covariaten in een model is zeer simpel. In de term R2c,α,β,αβ kan C net zo goed staan voor een set covariaten (leeftijd, IQ en schooltype bijvoorbeeld). SSAB(adj) is nog steeds de SS totaal – SS covariaat+algemene effecten.
Welke alternatieve designs zijn er?
Naast de covariantie-analyse zijn er nog meer manieren om rekening te houden met een covariaat. In de stratificatie procedure bijvoorbeeld, worden participanten in paren verdeeld op basis van gelijkheid op de covariaat. Vervolgens worden ze gelijk verdeeld over de verschillende behandelingsgroepen. In de ANOVA kunnen we vervolgens een effect berekenen met deze ‘blokken’. In het geval waar de relatie tussen Y en C niet lineair is, is dit ‘matchen’ van participanten de betere optie in vergelijking met de covariantie-analyse.
Een andere manier is het gebruik van verschilscores. Door C (score voor de test) af te trekken van bijbehorende score Y (score na de test), blijft een verschilscore over waarin gecontroleerd is voor de covariaat. Deze score kan als afhankelijke variabele gebruikt worden in een variantie analyse. Maar dit kan alleen als C en Y vergelijkbare metingen zijn (je kunt geen IQ met rijvaardigheid vergelijken). Dit is wel een gevaarlijke procedure: als bCY (hellingshoek)veel afwijkt van 1.00 (precies 1,00 komt weinig voor), dan kan deze procedure een heel andere uitkomst geven dan een normale covariantie-analyse.
Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>
Concept of JoHo WorldSupporter
JoHo WorldSupporter mission and vision:
- JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.
JoHo concept:
- As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
- JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.
Join JoHo WorldSupporter!
for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for
Work for JoHo WorldSupporter?
Volunteering: WorldSupporter moderators and Summary Supporters
Volunteering: Share your summaries or study notes
Student jobs: Part-time work as study assistant in Leiden
- Insurance for emigrants, expats and living abroad: international insurance for expats and emigrants
- Insurance for activities abroad: Backpacking Travel abroad Intern abroad Study abroad Volunteer abroad Work abroad
- Insurance: ACS Globe Traveller Caremed Insurances Expatriate Travel Insurance IMG’s GlobeHopper World Nomads Insurance SafetyWing Insurance JoHo Special ISIS verzekering NL/BE Working Nomad verzekering NL/BE More about Insurance for abroad
Search only via club, country, goal, study, topic or sector
Select any filter and click on Search to see results








