Welke correlationele technieken zijn er? - Chapter 8

Welke doelen hebben correlationele technieken?

Voor wetenschappers is het niet alleen erg belangrijk om te onderzoeken of variabelen gecorreleerd zijn. Daarnaast is het voor hen namelijk ook van belang hoe en waarom bepaalde variabelen gecorreleerd zijn. Dit kunnen ze achterhalen door middel van vier verschillende technieken. Deze zullen we in dit hoofdstuk bespreken. Deze technieken zorgen ervoor (1) dat we formules kunnen ontwerpen die beschrijven hoe variabelen gerelateerd zijn. Deze formules zorgen er ook voor dat we voorspellingen kunnen maken, (2) dat we de richting van de causaliteit tussen twee of meer gecorreleerde variabelen kunnen uitzoeken, (3) dat we de relatie tussen variabelen kunnen meten op basis van verschillende analyseniveaus en (4) dat we dimensies kunnen vaststellen die ten grondslag liggen aan een aantal correlaties. Deze dimensies kunnen vastgesteld worden door middel van factoranalyse.

Het voorspellen van gedrag

Regressieanalyses worden toegepast nadat is gebleken dat bepaalde variabelen gecorreleerd zijn. Door middel van regressieanalyse kunnen we regressieformules (‘regression equations’) ontwerpen, waarmee we scores kunnen voorspellen. Als bekend is dat iemand een bepaalde x-score heeft, dan kunnen we deze score invullen in de formule en zo de score op de y-variabele voorspellen. We kunnen bijvoorbeeld een regressieformule ontwerpen waarmee we de academische prestatie van studenten voorspellen op basis van hun cijfergemiddelde op de middelbare school. Het is belangrijk om te onthouden dat correlatie altijd gaat over lineaire verbanden. Lineaire verbanden worden omschreven door rechte lijnen. Deze lijnen kunnen bijvoorbeeld getrokken worden door een puntenwolk die een bepaalde richting op lijkt te gaan. Wetenschappers proberen een regressieformule te ontwerpen voor die lijn. Wanneer zij deze formule hebben gevonden, dan kunnen ze scores vrij nauwkeurig voorspellen.

  • Een regressieformule ziet er als volgt uit: y=β0+ β1x. In deze formule is β0 de hellingscoëfficiënt en β1 het intercept. β0 noemen we ook wel de constante (‘regression constant’/ ‘bèta zero’). β1 wordt ook wel de regressiecoëfficiënt (‘slope’, hellingshoek) genoemd.

  • De variabele die we willen voorspellen noemen we de afhankelijke variabele, criteriumvariabele of de uitkomstvariabele (‘dependent variabele’/ ‘criterion variable’/ ‘outcome variable’). Dit is de y-variabele.

  • De x-variabele wordt ook wel de voorspellende variabele (‘predictor variable’) genoemd.

Hoe ziet multipele regressieanalyse eruit?

Soms maken wetenschappers gebruik van meerdere x-variabelen om de y-variabele mee te voorspellen. Academische prestatie kan bijvoorbeeld voorspeld worden aan de hand van zowel motivatie, als het cijfergemiddelde op de middelbare school en leergierigheid. Over het algemeen verhoogt het gebruik van meerdere x-variabelen de nauwkeurigheid van de voorspelling. Hoe meer x-variabelen er worden gebruikt, hoe nauwkeuriger de voorspelling waarschijnlijk zal zijn.

Wanneer meerdere x-variabelen worden gebruikt om de y-variabele te voorspellen, dan is er sprake van multipele regressieanalyse. Er zijn drie vormen van multipele regressie: (1) standaard multipele regressie, (2) stapsgewijze multipele regressie en (3) hiërarchische multipele regressie. Deze drie vormen verschillen van elkaar in hoe de voorspellende variabelen (x-variabelen) worden toegevoegd aan de regressievergelijking, wanneer deze vergelijking wordt opgesteld.

Standaard multipele regressie

Bij standaard multipele regressie (ook wel ‘simultaneous multiple regression’ genoemd) worden alle x-variabelen tegelijkertijd in de regressieanalyse ingevoerd. We kunnen academische prestatie bijvoorbeeld voorspellen aan de hand van drie predictoren: motivatie, leergierigheid en het cijfergemiddelde op de middelbare school. De formule zou bijvoorbeeld y (werkresultaat) = -2.80 + .17 (motivatie) + 1.30 (leergierigheid) + .90 (cijfergemiddelde) kunnen zijn.

Stapsgewijze multipele regressie

Bij stapsgewijze multipele regressie (‘stepwise multiple regression’) worden niet alle predictoren in één keer in de regressieanalyse ingevoerd. De predictoren worden hier namelijk één voor één ingevoerd. Bij de eerste stap wordt de predictor ingevoerd die waarschijnlijk de sterkste voorspeller is van de y-variabele. Dit is dus de x-variabele die het meest correleert met de y-variabele. Tijdens de tweede stap wordt de x-variabele toegevoegd die daarna het meeste toevoegt aan de voorspelling van de y-variabele. De variabele die tijdens de tweede stap wordt ingevoerd, verklaart de meeste variantie in y bovenop de variantie die door de eerste predictor wordt verklaard. De predictor die tijdens de tweede stap ingevoerd wordt, hoeft niet per definitie de variabele te zijn die het op één na beste correleert met de y-variabele.

Een stapsgewijze regressieanalyse voegt x-variabelen toe aan de vergelijking, gebaseerd op hun vermogen om de unieke variantie van de y-variabele te voorspellen. Bij stapsgewijze multipele regressie kan bij het voorspellen van academische prestatie bijvoorbeeld eerst het cijfergemiddelde als predictorvariabele ingevoerd worden, vervolgens motivatie en tenslotte leergierigheid. Motivatie zou als tweede voorspeller ingevoerd worden als deze na de eerste variabele de meeste unieke variantie in academische prestatie kan voorspellen. Dat is bijvoorbeeld niet het geval als de variantie die door motivatie voorspeld wordt, al helemaal wordt ‘opgeslokt’ door het cijfergemiddelde. Dan voegt motivatie op unieke wijze weinig toe en zou leergierigheid beter tijdens deze tweede stap ingevoerd kunnen worden. Het stapsgewijs invoeren van predictoren houdt op wanneer (1) alle predictorvariabelen die een unieke bijdrage blijken te leveren aan het voorspellen van de uitkomstvariabele vastgesteld zijn en/of (2) de overige predictorvariabelen geen unieke variantie meer blijken te kunnen voorspellen.

Hiërarchische multipele regressie

Bij hiërarchische multipele regressie wordt de volgorde waarin de predictoren worden ingevoerd bepaald door de onderzoeker. De onderzoeker baseert zijn of haar keuzes op van tevoren vastgelegde hypothesen.

Er worden dus steeds nieuwe variabelen aan de regressieanalyse toegevoegd. Toch kan de unieke bijdrage van elke variabele worden vastgesteld. Deze unieke bijdrage kan worden berekend door het effect van alle andere variabelen (die eerder zijn toegevoegd) statistisch te verwijderen.

Door hiërarchische multipele regressie kunnen (1) verstorende variabelen (‘confounding variables’) verwijderd worden en (2) hypothesen over mediërende variabelen (‘mediation variables’) getest worden. Verstorende variabelen en mediërende variabelen zorgen er onder andere voor dat we niet kunnen concluderen dat er sprake is van een causatie, zelfs al is er sprake van een perfecte correlatie. Deze twee soorten variabelen kunnen de uitkomstvariabele namelijk beïnvloeden zonder dat de onderzoeker daar weet van heeft. Verstorende variabelen (‘confounding variables’) komen vaak samen voor. Hierdoor zijn hun effecten vaak lastig te onderscheiden. We kunnen hun effecten echter wel testen. Ook het effect van mediators kunnen we testen door middel van de hiërarchische multiple regressieanalyse. Een mediator is een variabele die de relatie tussen x en y beïnvloedt. Het kan hierdoor lijken alsof x en y direct in hoge mate correleren, terwijl deze correlatie ligt aan een gedeelde onderliggende variabele; de mediator. Als de relatie tussen x en y wordt beïnvloed door een derde variabele (z), dan is deze variabele een mediator.

Wanneer is er sprake van multipele correlatie?

Wetenschappers willen niet alleen een regressieformule ontwerpen om y-scores van mensen mee te voorspellen; ze willen ook weten hoe goed een predictorvariabele (x) de uitkomstvariabele (y) voorspelt. Onderzoekers willen dus de bruikbaarheid van hun regressieformule beschrijven. Wanneer er sprake is van meerdere voorspellers (predictoren, ofwel x-variabelen), berekenen onderzoekers de multiple correlatiecoëfficient (R).

R beschrijft de relatie tussen y en een set voorspellers. De multipele correlatiecoëfficiënt kan een waarde aannemen tussen de .00 en 1.00. Hoe groter R, hoe beter de regressieformule de uitkomstvariabele kan voorspellen. De multiple correlatiecoëfficient kan gekwadrateerd worden. Dit principe werkt hetzelfde als het kwadrateren van de Pearson correlatie (r). Wanneer R gekwadrateerd wordt, weten we wat de proportie variantie in de uitkomstvariabele (y) is die verklaard kan worden door een set van predictoren. Leergierigheid, motivatie en het cijfergemiddelde op de middelbare school kunnen bijvoorbeeld samen 40% van de variantie in academische prestatie verklaren. Dit betekent dat 60% van de variantie in academische prestatie verklaard kan worden door andere variabelen die niet meegenomen zijn in het onderzoek.

Hoe kan de richting van de correlatie bepaald worden?

Zoals eerder gezegd kunnen we geen uitspraken doen over causaliteit op basis van alleen correlatie. Toch kan de richting van de relatie wel bepaald worden, al is dit nooit met volledige zekerheid. We kunnen dus vaststellen of y waarschijnlijk door x wordt verklaard, of dat x waarschijnlijk door y wordt verklaard. Er zijn twee technieken waarmee we veel kunnen zeggen over de richting van de relatie tussen twee variabelen: (1) ‘cross-lagged panel design’ en (2) ‘structural equations modelling’.

Cross-lagged panel design

Bij het cross-lagged panel design wordt de correlatie tussen x en y twee keer op twee verschillende momenten berekend. Daarna kunnen er verschillende combinaties gemaakt worden en correlaties berekend worden. Zo kan de correlatie tussen x uit de eerste meting en y uit de tweede meting berekend worden. Ook kan de correlatie tussen x uit de tweede meting en y uit de eerste meting berekend worden. Als variabele x variabele y veroorzaakt, dan zou de correlatie tussen x op de eerste meting en y op de tweede meting groter moeten zijn dan de correlatie tussen y op de eerste meting en x op het tweede moment. Dit komt doordat de relatie tussen een oorzaak (in dit geval x) en het gevolg (y) sterker zou moeten zijn als de causale variabele gemeten is voordat het effect plaatsvindt, in plaats van daarna.

Structural equations modelling

Een betere, maar meer ingewikkelde manier om causale hypothesen te testen op basis van correlationele onderzoeken is ‘structural equations modelling’. Sommige causale verklaringen voor de relaties tussen variabelen zijn logischer dan andere. Stel dat we de relatie tussen variabele x, y en z proberen te begrijpen. We kunnen bijvoorbeeld voorspellen dat variabele x variabele y veroorzaakt en variabele y variabele z veroorzaakt (xàyàz). Hierbij moet niet alleen uit onderzoek blijken dat x en y gecorreleerd zijn, maar ook dat de relatie tussen x en y sterker is dan de relatie tussen x en z. Als dit niet het geval is, dan kunnen we concluderen dat de xàyàz hypothese niet klopt. Om structural equations modelling uit te voeren, moet de onderzoeker eerst precieze voorspellingen doen (ook wel modellen genoemd). Zoals blijkt uit het voorbeeld, bestaat deze voorspelling uit de vraag hoe drie of meer variabelen causaal aan elkaar gerelateerd zijn. Elke voorspelling geeft een idee van hoe de variabelen aan elkaar gerelateerd zouden moeten zijn. Neem bijvoorbeeld 2 hypothesen. Hypothese A stelt dat xàyàz. Hypothese B stelt dat xàzày. Omdat ze van elkaar verschillen in volgorde, verwachten we dat deze hypothesen elk een ander patroon van correlaties hebben.

Door structural equations modelling kunnen we de correlatiematrix die op basis van een hypothese (model) verwacht wordt, vergelijken met de echte correlatiematrix. Als de verwachte en de daadwerkelijke correlatiemix op elkaar lijken, dan is bewijs gevonden voor de hypothese. Structural equations-analyses geven steeds een fit index. Deze laat zien in hoeverre een hypothesemodel past bij de gevonden data. Door de fit indexen van alle voorspelde modellen te vergelijken, kunnen we bepalen of sommige modellen beter bij de data passen dan andere modellen. Structural equations-modellen kunnen erg complex zijn. Dit is vooral het geval als er onderzoek gedaan wordt naar veel verschillende variabelen. Wanneer er maar één meting wordt gedaan bij elk construct uit de analyse, worden structurele vergelijkingen ook wel ‘path analysis’ genoemd. Als er meerdere metingen worden gebruikt voor elk construct, dan wordt ook wel van ‘latent variable modelling’ gesproken. Dit omdat wordt gedacht dat alle metingen een onderliggende (latente) variabele meten. Door structural equations modelling kunnen we een beeld krijgen van de plausibiliteit van causale hypothesen.

Wat wordt bedoeld met geneste data?

Veel van de onderzoeksdata in de gedragswetenschappen zijn genest (‘nested’). Wat het begrip ‘genest’ precies inhoudt, kan het beste uitgelegd worden met een voorbeeld. Als een onderzoeker bijvoorbeeld geïnteresseerd is in welke variabelen van invloed zijn op schoolprestatie op de basisschool, dan kan hij of zij een aantal scholen selecteren. Vervolgens kan hij of zij binnen deze scholen een aantal klassen selecteren. Tenslotte kan de onderzoeker een aantal kinderen binnen deze klassen selecteren. We zeggen dan dat de klassen in de school, en daarbinnen de kinderen in die klassen genest zijn. Een geneste datastructuur heeft zijn voor- en nadelen. Een belangrijk nadeel is dat bij geneste designs de responsen van deelnemers niet onafhankelijk van elkaar zijn. Kinderen in een klas hebben bijvoorbeeld dezelfde docent, hetzelfde lesmateriaal en worden ook nog eens direct door elkaar beïnvloed. Voor statistische analyses is het echter van belang dat de scores van deelnemers onafhankelijk van elkaar zijn. Gelukkig kan door middel van ‘multilevel modelling’ goed omgegaan worden met het feit dat responsen niet onafhankelijk van elkaar zijn. Bij multilevel modelling worden eerst verschillende niveaus onderscheiden. Vervolgens wordt gekeken door welke factoren deze niveaus worden beïnvloed. Multilevel modelling maakt het mogelijk om de relatie tussen de variabelen over de hele onderzoeksopzet te onderzoeken. Alle ‘levels’ in de onderzoeksopzet kunnen dus worden vergeleken. In het voorbeeld van het onderzoek naar schoolprestaties op basisscholen, kunnen de variabelen binnen de scholen met die binnen de klassen worden vergeleken. Multilevel modelling wordt ook wel ‘multilevel random coefficient analysis’ of ‘hierarchical lineair modelling’ genoemd.

Hoe kunnen onderliggende dimensies ontdekt worden?

Factoranalyse is een verzamelnaam voor een aantal statistische technieken dat gebruikt wordt om de relaties tussen een groot aantal variabelen te analyseren. Het doel van de factoranalyse is om onderliggende dimensies of factoren vast te stellen. Deze verklaren de relaties die zijn gevonden tussen de variabelen.

Als we de correlaties tussen veel variabelen analyseren, dan zien we dat sommige variabelen vooral met elkaar gecorreleerd zijn terwijl andere variabelen vooral met andere variabelen gecorreleerd zijn. Dit komt waarschijnlijk door het feit dat de hoog gecorreleerde variabelen hetzelfde algemene construct meten, terwijl laag gecorreleerde variabelen verschillende constructen meten. Het gevolg hiervan is dat het waarschijnlijker is om een onderliggende dimensie (factor) vast te stellen wanneer de correlaties tussen bepaalde variabelen hoog zijn. Factoranalyse wordt dus gebruikt om onderliggende factoren (latente variabelen) vast te stellen, die de gevonden correlaties tussen meerdere variabelen kunnen verklaren.

Wat is factoranalyse?

Wanneer er maar weinig variabelen zijn, kunnen factoren relatief makkelijk worden vastgesteld. Zijn er echter veel variabelen, dan is het beter om gebruik te maken van complexe wiskundige berekeningen. Deze worden hier niet behandeld, maar het is wel nuttig om te weten wat de achterliggende gedachte achter de berekening is. Factoranalyse stelt het minimale aantal factoren vast dat nodig is om de relatie tussen de vele variabelen te verklaren. Als alle variabelen perfect gecorreleerd zijn (r = 1.00), dan zal er maar één factor uit de factoranalyse voortvloeien. Als de variabelen allemaal helemaal niet gecorreleerd zijn (r = .00), dan vloeien er evenveel factoren uit de factoranalyse als dat er variabelen zijn. Met een factormatrix kan gezien worden in hoeverre verschillende variabelen laden op (correleren met) een factor. In hoeverre een variabele laadt op een factor, wordt aangegeven met een factorlading. Als variabelen minstens .30 laden op een factor, dan worden deze variabelen op de tabel bij elkaar gezet. Zo kan er makkelijker worden gekeken naar wat deze variabelen met elkaar gemeen hebben. Dit is voordelig, want op die manier kunnen de factoren geïnterpreteerd en gelabeld worden.

Het gebruik van factoranalyse

De factoranalyse heeft drie basisdoeleinden:

  1. Het vaststellen van de onderliggende structuur van psychologische constructen. Hierdoor kan een kader voor het begrijpen van gedrag worden opgesteld.

  2. Het reduceren van een groot aantal individuele data tot een kleinere, overzichtelijkere set van data. Het overzichtelijker maken van de data maakt het ten eerste makkelijker om statistische procedures uit te voeren. Daarnaast verwijdert het overbodige elementen. Tenslotte hebben analyses die gebaseerd zijn op factoren in het algemeen meer power en zijn ze betrouwbaarder, vergeleken met metingen die gebaseerd zijn op individuele items.

  3. Het ontwerpen van attitude- en persoonlijkheidstesten. Wanneer antwoorden op vragen in een vragenlijst opgeteld moeten worden tot een enkele score, dan moeten we wel eerst zeker weten dat deze items daadwerkelijk hetzelfde construct meten. Factoranalyse wordt in dit geval gebruikt om uit te zoeken welke items bij één factor horen. Als uit zo’n analyse echter blijkt dat de items samengaan met meer dan één factor, dan is het niet verstandig om de antwoorden op deze items op te tellen om uitspraken te doen over hoe iemand scoort op één construct (bijvoorbeeld depressie). Er is dan immers sprake van meerdere onderliggende variabelen.

Voor wetenschappers is het niet alleen erg belangrijk om te onderzoeken of variabelen gecorreleerd zijn. Daarnaast is het voor hen namelijk ook van belang hoe en waarom bepaalde variabelen gecorreleerd zijn. Dit kunnen ze achterhalen door middel van vier verschillende technieken. Deze zullen we in dit hoofdstuk bespreken. Deze technieken zorgen ervoor (1) dat we formules kunnen ontwerpen die beschrijven hoe variabelen gerelateerd zijn. Deze formules zorgen er ook voor dat we voorspellingen kunnen maken, (2) dat we de richting van de causaliteit tussen twee of meer gecorreleerde variabelen kunnen uitzoeken, (3) dat we de relatie tussen variabelen kunnen meten op basis van verschillende analyseniveaus en (4) dat we dimensies kunnen vaststellen die ten grondslag liggen aan een aantal correlaties. Deze dimensies kunnen vastgesteld worden door middel van factoranalyse.

Image

Access: 
Public

Image

Join: WorldSupporter!

Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>

Check: concept of JoHo WorldSupporter

Concept of JoHo WorldSupporter

JoHo WorldSupporter mission and vision:

  • JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.

JoHo concept:

  • As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
  • JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.

Join JoHo WorldSupporter!

for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for

Check: how to help

Image

 

 

Contributions: posts

Help others with additions, improvements and tips, ask a question or check de posts (service for WorldSupporters only)

Image

Image

Share: this page!
Follow: Psychology Supporter (author)
Add: this page to your favorites and profile
Statistics
2852
Submenu & Search

Search only via club, country, goal, study, topic or sector