Wat is de procedure bij multipele regressie? - Chapter 15
In dit hoofdstuk hebben we de situatie waarbij we één criterium variabele Y hebben, en meerdere predictors (voorspellers) X1, X2, etc., en we willen Y voorspellen op basis van alle predictors. Vanwege de uitgebreide berekeningen wordt in het hoofdstuk vooral ingegaan op de computer-analyses.
- Wat is multipele lineaire regressie?
- Waar komt ANOVA kijken?
- Hoe worden meer predictors toegevoegd?
- Wanneer worden gestandaardiseerde regressie-coëfficiënten gebruikt?
- Waartoe dient de resampling methode?
- Welke assumpties moeten gedaan worden?
- Wat is de multipele correlatiecoëfficiënt?
- Wat zijn onderdrukkingsvariabelen?
- Wat is Cook’s D?
- Op welke manier worden de predictor variabelen gekozen?
- Wat is het belang van individuele variabelen?
- Hoe worden afgeronde coëfficiënten gebruikt?
- Wat zijn mediërende en modererende relaties?
- Wanneer wordt logistische regressie gebruikt?
Wat is multipele lineaire regressie?
Bij multipele regressie willen we bijvoorbeeld de prestatie van leerlingen op een masteropleiding voorspellen aan de hand van hun gemiddelde in de bachelor (X1), het aantal vakken dat ze hebben gevolgd in de bachelor (X2) en de kwaliteit van hun cv (X3). Vaak kijken we naar de relatie tussen variabelen en niet naar de voorspelling via de regressievergelijking.
De multipele regressieformule is:
\[\hat{Y}=b_0+b_1X_1+b_2X_2+...+b_pX_p\]
waarbij b0 de intercept is en b1 en b2 regressie coëfficiënten voor de voorspellers X1 en X2. We proberen nog steeds
\[\sum(Y-\bar{Y})^2\]
zo klein mogelijk te houden, zodat de voorspelde waarde zo dicht mogelijk bij de ware waarden van Y liggen.
Voorbeeld
Als voorbeeld kijken we naar een studie over de kwaliteit van primair en secundair onderwijs, en hoe we die kunnen verbeteren. Een onderzoeker verzamelde data van 50 staten in de VS, waaronder de hoeveelheid geld die aan onderwijs werd besteed, de student/leraar ratio, het salaris van de leraar, het percentage studenten dat meedeed aan de SAT examens, en de gecombineerde SAT score. Het percentage studenten die de ACT heeft gedaan en de gemiddelde ACT score kunnen hier nog aan worden toegevoegd. We zijn geïnteresseerd in de kwaliteit van het onderwijs, dus we kijken naar de prestatie op de SAT (een schooltest).
Een eerste stap is het plotten van de data, om te controleren voor een normale verdeling. Dit doen we met histogrammen, qqplots en scatterplots. Hierin is zichtbaar dat de variabelen niet normaal verdeeld zijn. De criterium variabele en drie voorspellers zijn redelijk normaal verdeeld, terwijl de verdeling van het percentage studenten die de SAT’s gemaakt heeft bimodaal verdeeld is. De relatie tussen PctSAT en SAT is curvilineair, maar kan met een loge transformatie meer lineair gemaakt worden.
Daarna kunnen relaties tussen de verschillende predictors en SAT prestatie berekend worden, door middel van een Pearson correlatie. We gaan ervanuit dat als er meer geld aan onderwijs besteed wordt, de uitkomst van de SAT beter is. Hieruit blijkt dat uitgaven aan onderwijs in een staat en de prestatie op de SAT negatief samenhangen
(r = -.381, p = .006) en deze correlatie is significant. Dit zou betekenen dat hoe meer we uitgeven aan onderwijs, hoe slechter de kinderen presteren. Niet wat je zou verwachten dus. Een verklaring hiervoor is dat niet alle universiteiten geïnteresseerd zijn in de SAT score, en in sommige staten slechts een klein percentage de SAT test krijgt. De topuniversiteiten die de SAT wel afnemen nemen alleen de beste studenten aan. Daardoor varieert het percentage studenten die de SAT’s maakt enorm tussen de staten. In de staten waar weinig studenten de SAT’s doen, zal dit waarschijnlijk zijn omdat zij naar de beste scholen toe willen en dus beter presteren. Wat hier gebeurt, is dat het percentage studenten dat in een staat meedoet aan de SAT, de gemiddelde score beïnvloedt.
Een volgende stap is daarom te kijken wat de relatie is tussen uitgaven aan onderwijs en prestatie op de SAT, wanneer we controleren voor het percentage deelnemers aan de SAT (PercSAT). In feite brengen we nu twee predictors tegelijkertijd bij de SAT score. Wat we daarbij doen, is de relatie tussen uitgaven en SAT scores bekijken bij een constante PercSAT. Dit gebeurt door middel van SPSS: we laten SPSS berekenen wat de gemiddelde correlatie is van uitgave en SAT score per waarde van PercSAT (dus bij 40%, 50%, etc.). Met de werkelijke data is dit niet te doen, want we hebben maar 50 staten. SPSS maakt de berekeningen op basis van een hypothetische populatie aan staten van vele duizenden staten.
De analyse
Wanneer we de analyse uitvoeren, zien we het verschil tussen één predictor en beide predictors tegelijkertijd (Tabel 21). Bij alleen uitgaven als predictor is de correlatie met SAT score -.381. Wanneer PercSAT erbij komt, wordt de correlatie .941 (zie tabel Model samenvatting).
Tabel 21: Model samenvatting
Model | R | R kwadraat | Aangepaste R2 | Standaard schattingsfout |
1 | .381 | .145 | .127 | 69.909 |
2 | .941 | .886 | .881 | 25.781 |
Zoals in de tabel te zien, worden de correlaties positief weergegeven. Dat is altijd het geval bij multipele regressie, terwijl de simpele Pearson correlatie positief en negatief kan zijn. De R kwadraat kolom geeft aan hoeveel variatie van de SAT scores verklaard is door de voorspeller(s). Bij Model 1 verklaren we 14,5% van de variatie in SAT scores met alleen uitgave als predictor. De aangepaste R2 is een schatting van de gekwadrateerde correlatie in de populatie.
Waar komt ANOVA kijken?
Model | SS | df | MS | F | Sig. |
1 Regressie | 39722.06 | 1 | 39722.06 | 8.13 | .006 |
2 Regressie | 243065.91 | 2 | 121532.95 | 182.83 | .000 |
In de tabel ANOVA wordt de significantie van de regressie getest. We toetsen of de multipele correlatiecoëfficiënt significant verschilt van nul. Bij Model 1, met een correlatie van -.381, hoort een F van 8.13. De kans dat we een correlatie krijgen die zo hoog is, terwijl de nulhypothese eigenlijk waar is, is slechts .006. We mogen de nulhypothese dus verwerpen.
Bij Model 2 zijn twee predictors in het spel. De tabel ANOVA geeft aan of de multipele correlatie van beide voorspellers significant verschilt van nul. De overschrijdingskans is .000, dus de correlatie is significant. Als laatste kunnen we ook nog vragen of de predictors apart significant bijdragen aan de relatie (zie Tabel 21).
Tabel 22: Coëfficiënten
Model | Niet gestandaar- diseerde coëfficiënten | Gestandaa-rdiseerde coëfficiënten |
| 95% betrouwbaarheidsinterval voor B | |||
| B | Standaard fout | Beta | t | Sig. | Ondergrens | Bovengrens |
1 Constante | 1089.29 | 44.39 |
| 24.54 | .000 | 1000.04 | 1178.55 |
Uitgave | -20.89 | 7.33 | -.381 | -2.85 | .006 | -35.63 | -6.16 |
2 Constante | 1147.10 | 16.70 |
| 68.68 | .000 | 1113.50 | 1180.70 |
Uitgave | 11.13 | 3.26 | .20 | 3.41 | .001 | 4.56 | 17.70 |
PercSAT | -78.20 | 4.47 | -1.04 | -17.49 | .000 | -87.20 | -69.21 |
Uit Tabel 22 kunnen we de coëfficiënten afleiden van de multipele regressieformule. Voor Model 2 vinden we dat de coëfficiënt voor uitgaven 11.13 is, en voor PercSAT -78.20. Het intercept b0 is de constante 1147.10. Dit geeft de volgende regressievergelijking:
\[\hat{Y}=1147.10+11.13(Uitgave)-78.20(PercSAT)\]
Deze vergelijking kan ingevuld om de gemiddelde SAT score in een staat te voorspellen. Deze voorspelde score kan afwijken van het werkelijke gemiddelde. Deze afwijking heet de residuele error.
Vergelijk Model 1 met Model 2: nu we gecontroleerd hebben voor PercSAT is de relatie tussen uitgaven en prestatie ineens positief geworden (een positieve coëfficiënt): hoe meer er uit gegeven wordt aan onderwijs, hoe hoger de SAT score. Uit de kolom ‘Sig.’ kunnen we afleiden dat beide predictors significant bijdragen aan de relatie.
Een andere interpretatie
De verschillen in SAT komen deels door verschillen in Uitgave en deels door verschillen in PercSAT. We willen de verschillen in SAT en Uitgave, die door PercSAT komen, elimineren, en vervolgens deze nieuwe variabelen correleren. Wat je kan doen is de voorspelde waarden krijgen bij het voorspellen van Uitgave uit PercSAT. Deze scores trek je af van de ware scores. Het overige zijn residuen (ResidUitgave), die onafhankelijk zijn van PercSAT. Hetzelfde kan je doen voor de SAT scores, wat ResidSAT geeft, onafhankelijk van PercSAT. Deze aangepaste variabelen kunnen in een regressieanalyse geanalyseerd worden. De correlatie tussen deze aangepaste variabelen is .445.
Een andere optie is de voorspelde SAT scores berekenen. Deze noemen we VoorspSAT. Vervolgens bekijken we de correlatie tussen de voorspelde SAT scores en de eigenlijke SAT scores, die .941 is. Dit is onze multipele correlatie.
Hoe worden meer predictors toegevoegd?
Als uitbreiding op de voorgaande analyse kunnen we nog meer predictors toevoegen. Middels de tabel ‘coëfficiënten’ (zoals Tabel 7) is dan te controleren of de toevoeging van die predictors significant bijdraagt.
Bij meerdere predictors kan SPSS ook informatie geven over tolerantie en de variantie inflatie factor (VIF). VIF is de mate waarin de predictor variabelen onderling gecorreleerd zijn (dit heet multicollineariteit). Hoe meer de predictors onderling correleren, hoe groter de standaardfout van het regressiecoëfficiënt wordt, hoe groter het betrouwbaarheidsinterval wordt en hoe kleiner de t waarde van de coëfficiënt. We willen dus zo min mogelijk collineariteit en daarom een lage VIF.
Tolerantie wordt berekend door 1 - R2j, waarbij Rj de multipele correlatie is tussen variabele j en alle andere predictor variabelen. We willen dus een zo hoog mogelijke tolerantie: hoe hoger de tolerantie, hoe minder overlap tussen de predictors. Bij zeer lage toleranties kan de stabiliteit van het model in gevaar zijn. Als een predictor perfect gecorreleerd is met andere predictors heet dit een singular covariantie matrix. Het model wordt dan niet genereerd door computer software.
Let op dat de grootte van de coëfficiënten geen indicatie is voor de belangrijkheid van de bijbehorende predictor. Ook al is de coëfficiënt voor uitgaven veel kleiner dan die van PercSAT, dit heeft alleen te maken met de standaarddeviaties van de predictors.
Wanneer worden gestandaardiseerde regressie-coëfficiënten gebruikt?
Het belang van een predictor is niet direct af te leiden uit zijn regressie-coëfficiënt. Toch kunnen we wel iets zeggen over de bijdrage van een predictor aan de regressie-formule. Hiervoor standaardiseren we onze variabelen (dit zet het gemiddelde op 0 en de standaarddeviatie op 1). De regressie-coëfficiënten heten dan gestandaardiseerde regressie-coëfficiënten en worden in SPSS ‘Beta’ genoemd (β). In het voorbeeld wordt de regressie-formule:
\[\hat{Y}=0.023Z_{Uitgaven}-1.040Z_{PercSAT}\]
(bij gestandaardiseerde variabelen is het intercept gelijk aan 0).
We zien dat wanneer Zuitgaven toeneemt met 1, en wanneer we PercSAT constant houden, dat Y dan 0.203 standaarddeviaties toeneemt. Wanneer ZPercSAT toeneemt met 1, is dat een verschil in Y van -1.040. Hieruit kunnen we afleiden dat PercSAT waarschijnlijk een belangrijke predictor is dan Uitgaven (een grove schatting).
Een regressiecoëfficiënt toetsen we altijd voor significantie. Het maakt niet uit of dit gedaan wordt met de ruwe score coëfficiënten of gestandaardiseerde coëfficiënten. Voor de toets hebben we de standaardfout van de statistiek nodig. Dit is de variabiliteit van de statistiek over de herhaalde steekproeven. De toets is als volgt:
\[t=\frac{b_j-b_j*}{s_{b_j}}\]
- met N - p - 1 vrijheidsgraden.
Om de nulhypothese: bj* = 0 te testen gebruiken we t = bj/sbj.
Waartoe dient de resampling methode?
De resampling methode is een alternatief voor de traditionele berekening van hierboven. Hierbij nemen we onze steekproef van 50 staten in de VS als populatie, en door middel van herhaaldelijk steekproeftrekken met vervanging uit deze populatie maken we een verdeling van mogelijke coëfficiënten. We pakken telkens een steekproef, berekenen de regressie coëfficiënten en noteren deze. Wanneer we dit 10.000 keer gedaan hebben, plotten we de coëfficiënten en berekenen het 95% interval door aan beide kanten van de verdeling 2,5% af te halen. Als de waarde 0 niet in het betrouwbaarheidsinterval voorkomt, dan kunnen we concluderen dat de coëfficiënt significant anders is dan 0.
Residuele variantie
Met de regressieformule probeerden we in het voorbeeld de SAT score te verklaren door middel van verschillende predictors. Toch gaan we er ook van uit dat de SAT score niet volledig te verklaren is door de predictor variabelen. Een deel van de score zal resultaat zijn van error. Deze error wordt residuele variantie/error genoemd (MSerror):
\[MS_{error}=\frac{\sum{(Y-\hat{Y})^2}}{N-p-1}\]
Natuurlijk hopen we de MSerror zo klein mogelijk te houden – hoe meer we kunnen verklaren van Y hoe beter. De wortel uit de MSerror is de schatting van de standaardfout.
Welke assumpties moeten gedaan worden?
Wanneer de X-variabelen random zijn, maken we de assumptie dat de verdeling van Y, X1, X2, …, Xpmultivariaat normaal is. Afwijkingen hiervan zijn meestal geen groot probleem, omdat de toetsen redelijk robuust zijn. We zijn vooral geïnteresseerd in of R groot of klein is en niet zo zeer of het significant is. Een significante R van .10 verklaard namelijk maar 1% van de variantie. Bij X-variabelen die fixed zijn, maken we de assumptie dat de conditionele verdelingen van Y normaal en onafhankelijk verdeeld zijn. Kleine afwijkingen zijn ook hier niet noodzakelijkerwijs een probleem.
Wat is de multipele correlatiecoëfficiënt?
Uit Tabel 6 bleek dat de multipele correlatie tussen SAT score en de twee predictors (Model 2) gelijk was aan .941. Dit is de multipele correlatiecoëfficiënt en wordt vaak genoteerd als R0,123…p waarbij we aangeven dat het voorspeld is van 1,2,3…p predictors tegelijkertijd. Het is eigenlijk de correlatie tussen Y en Ŷ.
Ondanks R zijn we vaak meer geïnteresseerd in R2, omdat dit het percentage verklaarde variantie geeft. R2 is echter geen unbiased schatting van de populatieparameter. De hoeveelheid bias is afhankelijk van N en p. bij N = p + 1 is de voorspelling perfect en R dus 1. Een schatting van R2 die minder biased is:
\[\text{estimated}R^2=1-\frac{(1-R^2)(N-1)}{N-p-1}\]
Dit is de ‘Adjusted R Square’ in SPSS output.
R ligt altijd tussen de 0 en 1 in.
De significantie van R2
De significante bijdrage van elke predictor apart kunnen we al onderzoeken door middel van de regressie-coëfficiënt. Maar wat we eerst zouden moeten vragen is: voorspellen de variabelen samen de Y beter dan kans niveau? (de overkoepelende relatie).
Dit doe je door middel van de multipele correlatiecoëfficiënt. De nulhypothese wordt:
- H0: R = 0*.
R* is dan de correlatiecoëfficiënt in de populatie. We toetsen met:
\[F=\frac{(N-p-1)R^2}{p(1-R^2)}\]
- met N onderwerpen/proefpersonen/(in dit geval staten) en p predictoren. Er zijn p en N-p-1 vrijheidsgraden bij betrokken.
Voor het voorbeeld geldt een F van 182.64. Hierbij hoort een p-waarde van .000 en dus is de F-waarde significant.
Over het algemeen willen we tenminste tien observaties per voorspeller. Een andere regel is dat N tenminste 50 hoger moet zijn dan p. Er wordt ook voorgesteld dat N > p + 40. Er kan ook gekeken worden naar de hoogte van de power die men wil hebben. Hierop kan dan het aantal participanten worden afgesteld.
Partiële en semi-partiële correlatie
De (semi-)partiële correlatiecoëfficiënten controleren voor het effect van één of meer andere variabelen (een proces genaamd ‘partialling out’).
Partiële correlatie
De partiële correlatie r01.2 is de correlatie tussen twee variabelen met één of meer variabelen weggenomen uit zowel X als Y. Stel dat we de relatie tussen inkomen en schoolprestaties onderzoeken. We vinden een significante correlatie tussen de twee. Dit betekent nog niet dat succes op school leidt tot een hoger inkomen. Het zou verklaard kunnen worden door IQ: dit leidt zowel tot hogere schoolprestaties als een hoger inkomen. De manier om dit te onderzoeken is de partiële correlatie te berekenen tussen schoolprestatie en inkomen, met IQ weggehaald uit beide variabelen.
Voor de partiële correlatie doen we een aparte regressieanalyse op beide variabelen met de te controleren variabelen (in het voorbeeld: inkomen op IQ en schoolprestatie op IQ). Van beide analyses nemen we het residu. Dit is de portie variatie, die niet wordt verklaard door IQ. De correlatie hiertussen is de partiële correlatie.
De notatie voor de partiële correlatiecoëfficiënt is r01.23..p, waarbij links van de punt de gecorreleerde variabelen staan en rechts van de punt de variabelen waarvoor is gecontroleerd.
De partiële correlatie in het kwadraat geeft de verklaarde variatie. In het voorbeeld is de gekwadrateerde partiële correlatie .198, wat betekent dat 20% van de variatie in SAT scores (die niet verklaard wordt door PercSAT) kan verklaard worden door Uitgaven (die niet verklaard wordt door PercSAT). Of: 20% van de variatie in SAT scores, onafhankelijk van PercSAT, wordt verklaard door die portie van Uitgaven, onafhankelijk van PercSAT.
Semi-partiële correlatie
De semi-partiële correlatie wordt ook wel de deelcorrelatie genoemd. Het is de correlatie tussen de criterium Y en een gecontroleerde (partialled) predictor variabele. Waar de partiële correlatie dus een variabele wegneemt uit zowel criterion als de predictor, doen we dat hier alleen uit de predictor. De semi-partiële correlatie is de correlatie van Y met dat deel van X1 dat onafhankelijk is van X2 (het residu).
De notatie voor de semi-partiële correlatie is: r0(1.2) waarbij we variabele 2 weghalen uit predictor 1. Voor de correlatie geldt:
- r20(1.2) = R20.12 - r202.
Significantie
De significantie van de (semi-)partiële correlaties hoeft niet apart getest te worden. Als de test op de regressie-coëfficiënten significant was, dan zijn de Beta, partiële en semi-partiële coëfficiënten ook significant.
De partiële en semi-partiële correlaties kunnen in Venn diagrammen worden weergegeven.
Wat zijn onderdrukkingsvariabelen?
Wanneer alle correlaties van variabelen met het criterium positief zijn, verwachten we ook positieve regressiecoëfficiënten. Soms is een regressiecoëfficiënt significant negatief. Deze variabele wordt dan een onderdrukkingsvariabele genoemd. Een voorbeeld om dit te verduidelijken: stel we nemen een geschiedenistentamen af die in een korte tijd voltooid moet worden, om achter de kennis van geschiedenis te komen. De kennis van geschiedenis heeft niets te maken met leessnelheid. Echter is de prestatie op de toets hier wel van afhankelijk. Variantie in scores komt dus door leessnelheid en kennis. We willen ontdekken welke studenten het tentamen halen doordat ze snel lezen, en welke studneten het niet halen doordat ze langzaam lezen. Dit wordt bereikt door ‘leessnelheid’ als onderdrukkende variabele te gebruiken. Het onderdrukt een deel van de error in de scores.
Wat is Cook’s D?
Voordat de bovenstaande analyses worden uitgevoerd, is het altijd belangrijk eerst goed naar de data te kijken. Eerder checkten we al de grafische weergaven van de variabelen, daarnaast moet gekeken worden naar uitschieters. Als er geen normale uitschieters zijn, kunnen er wel multivariate uitschieters zijn. Dit zijn ongewone combinaties van scores. Als we weten dat er geen uitschieters zijn en dat de verdelingen redelijk normaal zijn, voeren we een preliminaire regressie analyse uit met alle variabelen. Belangrijk hierbij is:
- Afstand is belangrijk voor het identificeren van potentiële uitschieters in de afhankelijke variabele (Y). Een gebruikelijke afstand is die tussen Yi en Ŷi. Dit is de afstand tussen elk punt en de regressielijn.
- Hefboom (hi) is belangrijk voor het identificeren van potentiële uitschieters in de onafhankelijke variabelen. Het meet de mate waarin een score afwijkt van de predictor variabelen.
- Invloed: een combinatie van afstand en hefboomwerking. Het identificeert invloedrijke observaties. Een score is invloedrijk wanneer de regressie sterk verandert bij verwijdering van die score.
De invloed van een punt kan alleen hoog zijn, als het hoge waarden heeft op afstand en hefboom. De algemene maat voor invloed is de Cook’s D. Het is een maat voor de verandering in SS in de regressie-coëfficiënt wanneer de observatie/score uit de data wordt verwijderd en de analyse wordt uitgevoerd. De regel hierbij is, dat een Cook’s D groter dan 1.00 afwijkend is.
Als er geen variabelen zijn met onevenredige invloed op de regressievergelijking, betekent dit niet dat we ons geen zorgen hoeven te maken. We moeten kijken nar de plot van de residuen tegen de voorspelde waarden om te zien of er een normale verdeling is. Daarnaast checken we de Q-Q plot van de residuen voor normaliteit.
Modellen vergelijken
Stel dat we, zoals in het voorbeeld, twee modellen hebben die nested ofwel hiërarchisch zijn: een aantal variabelen in het ene model komt voor in het andere model. (Model 1: predictor A, B, C, D en Model 2: A en B). We willen onderzoeken of het ene model significant beter is dan het andere: hiervoor kijken we naar de SS uit de multipele regressieanalyse. Eerst voeren we die voor beide modellen uit (Tabel 23).
Tabel 23
Model | SS | df | MS | F | Sig. |
1 Regressie | 243.689,5 | 4 | 60922.385 | 85.539 | .000 |
Residu | 30.618,141 | 45 | 680.403 |
|
|
Totaal | 274.307,7 | 49 |
|
|
|
Model | SS | df | MS | F | Sig. |
2 Regressie | 243.069,5 | 2 | 121534.65 | 85.539 | .000 |
Residu | 31.238,38 | 47 | 664.646 |
|
|
Totaal | 274.307,7 | 49 |
|
|
|
Model 1 heeft een R2 van .888 en model 2 heeft een R2 van .886. Het eerste model verklaard dus iets meer variantie. Allereerst berekenen we het verschil in SSregressie = 243.689,5 - 243.069,5 = 620,2 = SSverschil. Het aantal vrijheidsgraden is het verschil in aantal voorspellers. In dit geval is dit 2. MSverschil is vervolgens SSverschil/df = 620,2/2 = 310,1. Deze MS testen we vervolgens met de volgende formule:
\[F=\frac{\frac{SS_{\text{reg(full)}}-SS_{\text{reg(reduced)}}}{df_{\text{reg(full)}}-df_{\text{reg(reduced)}}}}{MS_\text{residual(full)}}= \frac{\frac{243.689,5 - 243.069,3}{2}}{664,646} = 0.47\]
met als noemer de MS voor model 2, omdat die het ‘grote’ model is met alle variabelen (model 1 heeft een selectie uit die variabelen). De F is bij 2 en 45 df (let op! 2 df want dit is het aantal vrijheidsgraden van de verschilscore in SS) niet significant. Met extra twee predictors verklaren we niet significant meer variatie.
Stel dat de modellen niet hiërarchisch zijn, maar elk model andere variabelen bevat? Wanneer we dan de modellen willen vergelijken, kunnen we niet simpelweg de SS verschillen testen. In dit geval gebruiken we Akaikes Informatie Criterion (AIC), een computergestuurde test. Hoe kleiner de AIC, hoe beter het model. Er kan helaas niet getest worden of het verschil in de AIC’s ook significant is.
Op welke manier worden de predictor variabelen gekozen?
Het kiezen van de juiste predictors om in je analyse mee te nemen, kan moeilijk zijn. Zeker wanneer er veel variabelen in de data zijn opgenomen. Een aantal manieren om variabelen te kiezen:
- Tolerantie: eerder werd uitgelegd dat tolerantie de mate van overlap tussen predictors aangeeft. Kies variabelen met een zo hoog mogelijke tolerantie en zo min mogelijk overlap.
- ‘Alle subsets regressie’: kijk naar (alle) mogelijke subsets van predictors en kies de set die optimaal is (bijvoorbeeld die de grootste R2 heeft). Dit kan je zelf doen, of bij veel variabelen door middel van een speciaal computerprogramma (dan kun je vragen: geef me de beste zes modellen met de hoogste R2 bij vier predictoren). De beste modellen kan je selecteren op basis van: (1) de grootte van R2, (2) de grootte van MSresidu, (3) de statistiek Mallow’s Cp of (4) de statistiek PRESS. Mallow’s Cp vergelijkt groottes van errortermen in het ene model met de error term in het complete model met alle voorspellers. PRESS maakt voorspellingen van de data met alle gevallen behalve degene die voorspeld wordt. Een nadeel van ‘alle subsets regressie’ is dat er een groot potentieel is voor kans.
- Omgekeerde eliminatie: dit is een stapsgewijze procedure. We beginnen met een model met alle predictors, en bekijken de regressie-coëfficiënten. De variabele die het minst bijdraagt aan het model verwijderen we. Vervolgens voeren we de analyse opnieuw uit zonder deze voorspeller. We halen weer de predictor eruit die het minst bijdraagt. Dit proces herhalen we, totdat alle predictors statistisch significant zijn. Computerprogramma’s hebben hier ook een optie voor, onder de naam ‘F to remove/enter’ of ‘p to remove/enter’. Kiezen we voor p, dan kun je p to remove op .05 zetten en komen alleen significante variabelen in het model. Een nadeel is dat ook deze methode leidt tot kansmodellen.
- Stapsgewijze regressie: in feite de vorige methode maar dan omgekeerd. Van alle methoden is dit waarschijnlijk de beste. We beginnen met een model met alleen variabele 1, omdat deze de hoogste validiteit (correlatie met criterium) heeft. Dan berekenen we alle semi-partiëlen (correlaties met alle andere variabelen). De variabele met de hoogste semi-partiële correlatie zal de hoogste toename in R2 geven, dus die nemen we op in de analyse (stel dat dat variabele 2 was). We voeren een regressie uit van Y op X1 en X2 en berekenen of de variabele significant bijdraagt aan de analyse. Dit kan door de regressiecoëfficiënt of de semipartiële correlatie te testen. Er kan ook gekeken worden of R2 significant vergroot is. Dit doen we met de volgende F-waarde:
\[F_{(f-r, N-f-1)}=\frac{(N-f-1)(R^2_f-R^2_r)}{(f-r)(1-R^2_f)}\]
- met R2 gebaseerd op f en r predictoren. R2f is de R2voor het volledige model en R2r is de R2 voor het beperkte model.
Dit proces herhalen we totdat een nieuwe variabele niet meer significant bijdraagt. Variabelen die onder ‘F to remove’ vallen worden eerste verwijderd voordat de volgende variabele wordt toegevoegd. Methoden zonder deze stap heten forward selectie methoden.
Cross-validatie
Een probleem is het cross-valideren van een regressievergelijking bij een onafhankelijke data set. Stel we breken onze data in twee of meer sets. Voor de eerste set berekenen we de regressievergelijking. Deze coëfficiënten zetten we vervolgens af tegen de andere dataset om voorspelde waarden van Y te krijgen. We kijken dan naar de relatie tussen Y en Ŷcv. Bij een goede validiteit van de regressievergelijkingen moet deze correlatie hoog zijn. R2cv is meestal wel lager dan R2. We proberen dus een regressievergelijking te maken die voor meerdere datasets te gebruiken is. Echter is elke set anders, en zal het niet altijd valide zijn.
Missende scores
Een manier om met missende scores om te gaan, is om de participant in zijn geheel uit de studie te verwijderen wanneer hij scores mist (casewise/listwise verwijdering). Dit kan leiden tot kleine steekproefgroottes of een steekproef die niet meer betrouwbaar is (als een bepaald type participant uit de studie valt).
Een andere methode is pairwise verwijdering. Hierbij houden we de participant en gebruiken de data waar mogelijk: als hij data heeft op X en Y, houden we hem in de berekening van rXY, etc. Het nadeel hiervan is, dat de intercorrelatie tussen variabelen verstoord kan worden (omdat hij er soms wel bij zit en soms niet).
Een derde methode is het vervangen van de missende scores door een optimale schatting. Er zijn verschillende manieren om dit te doen, maar een veel gebruikte manier is om de gemiste score te voorspellen met een regressievergelijking.
Wat is het belang van individuele variabelen?
We willen soms weten welke variabele het belangrijkst is in het voorspellen van Y. βj2 wordt weleens als maat hiervoor genomen. β2 is namelijk de unieke bijdrage van een variabele aan de voorspelling van Y. Het zegt dus niets over de bijdrage die gedeeld is met andere variabelen. Daarnaast kan het onstabiel zijn tussen steekproeven als de variabelen onderling hoog gecorreleerd zijn.
Een andere mate van belangrijkheid is de semi-partiële correlatie tussen de voorspeller j en het criterium. Dit is een goede maat als het hoofddoel voorspelling is en niet verklaring.
Hoe worden afgeronde coëfficiënten gebruikt?
Bij het berekenen van regressie-coëfficiënten is gebleken dat deze sterk kunnen fluctueren tussen steekproeven uit dezelfde populatie, zonder dat dit R drastisch beïnvloedt. Hierdoor zullen onderzoekers soms de coëfficiënten benaderen, door de regressie-coëfficiënten af te ronden naar een heel getal. Dit heeft weinig invloed op R!
Wat zijn mediërende en modererende relaties?
In de psychologie zijn vaak mediatoren en moderatoren van belang: variabelen die een rol spelen in de relatie tussen twee andere variabelen.
Mediatie
Een mediator medieert de relatie tussen twee andere variabelen. Bijvoorbeeld: de mate van zelfvertrouwen die ik heb medieert tussen de hoeveelheid zorg die ik van mijn ouders heb gehad en hoe ik zelf denk over het opvoeden van mijn kinderen. (Verzorgende ouders leidt tot hoog zelfvertrouwen, leidt tot vertrouwen in zelf opvoeden). Dit is als volgt weer te geven in een figuur:
A Mediator B
Onafhankelijke variabele C Afhankelijke variabele
Baron en Kenny hebben veel geschreven over mediatie. Er zijn volgens hen drie stappen die moeten voldoen, wil er sprake zijn van mediatie. Zij stellen dat we eerst moeten aantonen dat de onafhankelijke variabele een significante relatie heeft met de mediator. Daarna moet een significante relatie worden aangetoond tussen mediator en afhankelijke variabele, en tussen de onafhankelijke en de afhankelijke variabele.
De volgende stap is demonstreren dat wanneer de mediator en onafhankelijke variabele samen gebruikt worden om de afhankelijke te voorspellen, het pad tussen onafhankelijke en afhankelijke variabele (c) minder sterk (liefst niet-significant) wordt.
Voorbeeld
Terug naar het voorbeeld over ouderlijke zorg en het zelf opvoeden van kinderen. De eerste stap is het berekenen van de correlaties tussen deze twee variabelen en de mediator (zelfvertrouwen). Alle correlaties zijn significant. De volgende stap is om zelfvertrouwen en ouderlijke zorg als predictors in een multipele regressie in te voeren voor voorspelling van de afhankelijke variabele. In Model 1 is alleen ouderlijke zorg als predictor ingevoerd, in model 2 zowel deze als de mediator. Bij het toevoegen van de mediator zelfvertrouwen blijkt, dat ouderlijke zorg niet meer significant is. Zelfvertrouwen heeft dus een mediërende rol tussen ouderlijke zorg en zekerheid over latere eigen opvoeding van onze kinderen. In dit voorbeeld is het resultaat vrij makkelijk: verzorgende ouders hebben, leidt tot hoger zelfvertrouwen en daardoor voelen we ons zekerder over zelf ouder worden.
In de output van SPSS staat ook een ‘part correlation’. Dit is wat wij kennen als de semi-partiële correlatie.
Sobel’s test
Maar wanneer pad ‘c’ niet helemaal verdwijnt en nog significant is, wat dan? Een manier is de Sobel test, waarbij we vragen of het volledige mediërende pad van onafhankelijke naar mediator naar afhankelijke variabele significant is. Hiervoor hebben we de regressie-coëfficiënten en standaardfouten van de twee paden nodig.
De standaardfout van de Beta (sβ) wordt niet gegeven en moeten we dus berekenen:
- t = β/sβ dus sβ = β/t
Stel dat geldt voor pad (a): sβ = 0.09 en voor pad (b) sβ = 0.11.
We kunnen nu de regressie-coëfficiënt berekenen van het totale pad (a)-(b) door βa x βb = 0.41 x 0.32 = 0.13. Voor de standaardfout van het totale pad geldt:
\[s_{\beta_a\beta_b}=\sqrt{\beta_a^2s_b^2+\beta_b^2s_a^2-s_a^2s_b^2}\]
In het voorbeeld is dit gelijk aan 0,052. De t ratio wordt dan:
- t = βaβb/sβaβb = 2,48.
Het aantal vrijheidsgraden is N-3. Deze t is significant. We hebben bewijs voor een mediërend pad van ouderlijke zorg, via zelfvertrouwen naar vertrouwen in opvoeding.
Bootstrapping
Een andere methode om de significantie van het indirecte pad te testen is door middel van bootstrapping. Hierbij creëren we 10.000 ‘bootstrap steekproeven’ uit de observaties en berekenen telkens de regressie-coëfficiënten en βaβb. Hiervan maken we een distributie, waaruit we het 95% betrouwbaarheidsinterval halen. Als dit interval de 0,00 waarde niet bevat, is het indirecte pad significant.
Moderatie
Bij modererende relaties verandert de relatie tussen onafhankelijke en afhankelijke variabele, door de derde (moderator)variabele. Bijvoorbeeld: we onderzoeken de invloed van dagelijkse stress-events op het aantal symptomen van stress dat een student aangeeft. Daarbij stellen we dat wanneer de student veel sociale steun heeft (in zijn omgeving), hij minder symptomen laat zien dan iemand met weinig sociale steun.
De eerste stap in de verzamelde data is het berekenen van de correlaties. We vinden dat stress-events significant gecorreleerd is met symptomen, steun correleert niet significant.
De volgende stap is het centreren van de data om de twee variabelen stressvolle gebeurtenissen en sociale steun samen te voegen. We maken verschilscores door het gemiddelde van de variabele van elke score van die variabele af te trekken. Iemand met een score 0 op stress-events heeft dan het gemiddeld aantal stress-events. Het doel van het centreren is het verlagen van de correlatie tussen de algemene effecten en de interacties.
Van de gecentreerde variabelen maken we een product, dat onze interactieterm wordt (stress-eventscentrxsteuncentr). Deze interactieterm stoppen we samen met de stress-events en steun variabelen in een regressie-analyse. De afhankelijke variabele is het aantal symptomen. In de output vinden we dat R2 significant is, evenals de predictor stress-eventscenter en de interactieterm. De variabele sociale steun is niet significant. Een plot van de interactieterm kan duidelijk maken, hoe de interactie werkt. Hieruit blijkt, dat met hoge sociale steun, verhogingen in stressvolle gebeurtenissen geassocieerd zijn met kleine verhoging van het aantal symptomen. Bij lagere niveaus van sociale steun en verhoging in stressvolle gebeurtenissen ontstaan veel meer symptomen.
Wanneer wordt logistische regressie gebruikt?
Logistische regressie is een techniek waarbij een regressie-analyse wordt uitgevoerd bij een dichotome afhankelijke variabele. Bijvoorbeeld in het geval waar we de reactie op een behandeling willen voorspellen, en de participanten ofwel ‘overleven’ of ‘niet overleven’ (zoals bij kanker). De kansen van logistische regressie liggen tussen 0 en 1. Daarnaast kunnen de onafhankelijke variabelen zowel categorisch of continu zijn.
Stel dat we dit onderzoeken, en onze Uitkomst coderen we 1 voor mensen die beter worden of geheel genezen zijn, en 0 voor mensen die niet genazen of dood zijn gegaan. Als predictor nemen we allereerst de overlevingskans die de arts ten tijde van de diagnose gaf (OverlKans), in procenten.
Als we de relatie tussen OverlKans en Uitkomst in een grafiek weergeven, zien we dat de kans op overleven groter is voor mensen die meer verbeteren. Wanneer we veel proefpersonen hebben, kunnen we de gemiddelde Uitkomst voor elke waarde van OverlKans berekenen (een conditioneel gemiddelde, omdat het afhangt van de waarde van OverlKans).
Wat betreft de analyse, zal lineaire regressie in dit geval een slechte keus zijn. Omdat we te maken hebben met voorspellende waarden, zullen kansen voorbij de waarden 0 en 1 gaan, wat onmogelijk is. Daarnaast is er zeer weinig variantie in dit model: bij iedereen met een lage OverlKans zal een 0 hebben en bijna iedereen met hoge waarden op OverlKans heeft een 1.
De relatie tussen Uitkomst en OverlKans is geen lineaire relatie, maar een sigmoidale (s-vormige).
Logistische regressie is eigenlijk een lineaire regressie op gecensureerde data. Dit houdt in, dat er een kritieke waarde is in de data, en alle waarden daarboven krijgen het label ‘verbeterd’ en alle waarden daaronder krijgen het label ‘niet verbeterd’. Hier zijn dus geen gradaties in; mensen die dood zijn gegaan vallen onder hetzelfde label als mensen die een klein beetje achteruitgegaan zijn. Er is wel een methode om de data te veranderen, zodat we een lineaire functie krijgen: door de scores om te zetten naar kansen, en vervolgens naar log odds[log(p/1-p)], met p de kans op verbetering en 1-p de kans op geen verbetering. We krijgen dan een formule van de vorm:
Log odds = b0 + b1OverlKans. Dit heet een logit transformatie. Hierbij is de b1 de toename in log odds als OverlKans één eenheid toeneemt. De log odds zullen positief zijn voor odds groter dan 1 en negatief voor odds kleiner dan 1.
In de output van SPSS vergelijken we het model zonder predictoren met het model met één predictor. Hiervoor kijken we naar de -2log likelihood. Deze is 77,3457 voor het model zonder predictoren en 37,323 voor het model met één predictor. Het verschil hier tussen (40,022) geeft de vermindering in X2 weer die komt door het toevoegen van een voorspeller. Dit verschil kan bekeken worden met 1 df. Het significantieniveau is .000 en dus is OverlKans een significante bijdrager aan de voorspelling.
De computer zoekt de best passende waarden van b0 en b1. Uit de SPSS test komen de optimale constante en coëfficiënt:
- Log odds = -0.0812 OverlKans + 2.6836
De negatieve coëfficiënt houdt in, dat we de kans op zieker worden afneemt, als de OverlKans toeneemt. De log odds nemen af als de kans op overleven verhoogt. Uit de formule leiden we af, dat wanneer OverlKans met één eenheid toeneemt, de log odds op zieker worden afneemt met 0.0812. Dit zegt ons niet zoveel, daarom zetten we de coëfficiënt om in een odds (door te exponentiëren: e-0.0812 = 0.9220). Als OverlKans met één toeneemt, vermenigvuldigt de kans op zieker worden met 0.9220. Anders gezegd: als twee mensen hun OverlKans te horen krijgen, en de tweede persoon heeft één punt meer op OverlKans, dan heeft zij een 7.8% lagere kans op verslechtering. De odds worden ook in de SPSS output gegeven onder ‘Exp(B)’.
Meerdere predictoren
Bij meer dan één predictor verandert er in feite niets aan de uitvoer van de analyse. SPSS geeft van elke predictor apart aan of het een significante bijdrage levert aan het model, en wederom geeft de coëfficiënt aan in welke richting het verband is (negatief/positief). We kijken hiervoor weer naar het verschil in -2log likelihood tussen de modellen. Het aantal vrijheidsgraden staat altijd gelijk aan het aantal extra predictoren. Ook dichotome predictors zijn mogelijk (zoals man/vrouw). Stel dat sekse een predictor was in het model, en het coëfficiënt 0.40 bleek te zijn (man =1, vrouw=2). De exponent zou 1.49 zijn. Dit houdt in, dat bij alle andere variabelen constant gehouden, de kans dat een vrouw beter wordt 1.5 keer groter is dan de kans dat een man beter wordt.
Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>
Concept of JoHo WorldSupporter
JoHo WorldSupporter mission and vision:
- JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.
JoHo concept:
- As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
- JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.
Join JoHo WorldSupporter!
for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for
Work for JoHo WorldSupporter?
Volunteering: WorldSupporter moderators and Summary Supporters
Volunteering: Share your summaries or study notes
Student jobs: Part-time work as study assistant in Leiden
- Insurance for emigrants, expats and living abroad: international insurance for expats and emigrants
- Insurance for activities abroad: Backpacking Travel abroad Intern abroad Study abroad Volunteer abroad Work abroad
- Insurance: ACS Globe Traveller Caremed Insurances Expatriate Travel Insurance IMG’s GlobeHopper World Nomads Insurance SafetyWing Insurance JoHo Special ISIS verzekering NL/BE Working Nomad verzekering NL/BE More about Insurance for abroad
Search only via club, country, goal, study, topic or sector
Select any filter and click on Search to see results








