Hoe ziet correlationeel onderzoek er uit? - Chapter 7
- Wat is de correlatiecoëfficiënt?
- Hoe worden correlaties weergegeven in een assenstelsel?
- Wat wordt er gedaan met de gevonden correlatiecoëfficiënt?
- Wanneer is er sprake van statistische significantie?
- Wat is het verschil tussen directionele en niet-directionele hypothesen?
- Welke factoren beïnvloeden de correlatie negatief?
- Wat is het verschil tussen correlatie en causaliteit?
Vaak zijn wetenschappers geïnteresseerd in de vraag of twee variabelen samenhangen. Deze variabelen kunnen bijvoorbeeld verlegenheid en zelfvertrouwen, temperatuur en agressie of faalangst en academische prestatie zijn. We bepalen of een variabele aan een andere variabele gerelateerd is, door te kijken of de variabelen covariëren; dus samen variëren. Als zelfvertrouwen zou samenhangen met verlegenheid, dan zouden hoge scores op zelfvertrouwen samen moeten gaan met lage scores op verlegenheid en vice versa. Als echter blijkt dat er geen consistente relatie bestaat tussen verlegenheid en zelfvertrouwen, dan kunnen we concluderen dat deze variabelen niet samenhangen. Hiervan zou bijvoorbeeld sprake zijn wanneer hoge scores op zelfvertrouwen even vaak gepaard gaan met hoge als met lage scores op verlegenheid. Twee variabelen covariëren dus als ze samen omhoog en omlaag gaan. Wanneer onderzoekers willen weten of variabelen samenhangen, maken ze gebruiken van correlationeel onderzoek (‘correlational research’). Correlationeel onderzoek wordt gebruikt om te kijken of twee of meer variabelen aan elkaar gerelateerd zijn, en in welke mate. De samenhang tussen twee variabelen wordt uitgedrukt in een correlatiecoëfficiënt. Zo kan een wetenschapper bijvoorbeeld geïnteresseerd zijn in hoeverre een eigenschap als extraversie erfelijk of aangeleerd is. Hij kan daarvoor een correlatie berekenen tussen de extraversie van een kind en de extraversie van de biologische ouders en ook een correlatie berekenen tussen de extraversie van een kind en de extraversie van de adoptieouders. Bij een hogere correlatie tussen de extraversie van het kind en die van de biologische ouders zou een onderzoeker kunnen concluderen dat extraversie eerder een aangeboren dan een aangeleerde eigenschap is.
Wat is de correlatiecoëfficiënt?
Een correlatiecoëfficiënt is een statistiek die laat zien in welke mate twee variabelen lineair gerelateerd zijn. Er kan een correlatie berekend worden tussen welke twee variabelen dan ook. De enige voorwaarde is dat we de scores van deelnemers moeten hebben op beide variabelen. De Pearson correlatiecoëfficiënt (r) wordt het meest gebruikt als correlatiemaat. Een berekende r ligt altijd tussen de -1 en +1. Bij een correlatiecoëfficiënt zijn twee factoren van belang: het teken van de correlatie (- of +) en de grootte van de correlatie.
Het teken (‘sign’) laat zien wat de richting is van de relatie. Variabelen kunnen positief (+), maar ook negatief (-) gecorreleerd zijn. Bij een positieve correlatie is het zo dat hoge scores op de ene variabele samengaan met hoge scores op de andere variabele. Ook is het zo dat lage scores op de ene variabele samengaan met lage scores op de andere variabele. Hoge scores op extraversie zouden bijvoorbeeld kunnen samengaan met hoge scores op avontuurlijkheid. Van een negatieve correlatie is sprake wanneer lage scores op de ene variabele, samengaan met hoge scores op de andere variabele of omgekeerd. Een hoge score op faalangst kan bijvoorbeeld samengaan met een lage score op een tentamen.
De grootte van een correlatie (‘magnitude of correlation’) is een numerieke waarde. Deze waarde is onafhankelijk van het teken van de correlatie. Wanneer een correlatie nul is (r=.00), dan zijn de bestudeerde variabelen niet lineair aan elkaar gerelateerd. Als de waarde van de correlatie echter toeneemt, dan wordt de relatie steeds sterker. Een correlatie van +.78 is dus sterker dan een correlatie van +.30. Het teken van een correlatie (+ of -) zegt niets over de grootte van een correlatie, maar alleen iets over de richting. Een correlatie van +.78 is dus even sterk als een correlatie van -.78 De magnitude of correlation (numerieke waarde) van de correlatie laat dus zien hoe groot een correlatie is.
Hoe worden correlaties weergegeven in een assenstelsel?
De relatie tussen twee variabelen kan gepresenteerd worden in een assenstelsel met een x- en y-as. Voor elke deelnemer kan een punt getekend worden waarbij de scores op de x- en y-as samenkomen. In het assenstelsel ontstaat op deze manier een puntenwolk (‘scatter plot’).
Positieve correlaties hebben een specifieke vorm als puntenwolk: ze beginnen linksonder en hebben een soort stijgende lijn naar rechtsboven toe. Hoge scores op variabele x gaan samen met hoge scores op variabele y.
Negatieve correlaties beginnen linksboven en dalen af naar rechtsonder.
Hoe sterker een correlatie is, hoe smaller de puntenwolk is. Bij een perfecte correlatie (-1.00 of + 1.00) liggen alle punten op een rechte lijn. Bij een correlatie van .00 is er echter geen sprake van samenhang tussen de variabelen. Hier liggen alle punten willekeurig verspreid en is er geen lijn te ontdekken in de data.
Soms zijn relaties boogvormig (curvilineair). Voor zulke relaties kunnen we geen correlatie berekenen, dat kan alleen voor lineaire verbanden.
Wat wordt er gedaan met de gevonden correlatiecoëfficiënt?
Als we weten dat de correlatie tussen twee variabelen +.25 is, wat zegt dit getal dan precies? Om een correlatiecoëfficiënt helemaal te begrijpen, moeten we deze kwadrateren. Dat komt doordat een correlatiecoëfficiënt niet op ratioschaal ligt. Om deze reden kunnen we geen rekenkundige berekeningen uitvoeren met deze coëfficiënt. We kunnen niet vermenigvuldigen en delen met deze statistiek. Bovendien kunnen we de correlatiecoëfficiënten niet vergelijken. Dat de coëfficiënt niet op ratioschaal ligt, houdt in dat een correlatie van +.80 niet twee keer zo groot is als een correlatie van +.40.
Het kwadrateren van een correlatiecoëfficiënt leidt tot de coëfficiënt van bepaling (‘coëfficiënt of determination’) die wel op ratioschaal ligt. De totale variantie in een dataset kan worden opgedeeld in systematische variantie en errorvariantie. Systematische variantie is dat deel van de totale variantie dat gerelateerd is aan de variabelen die onderzocht worden. Errorvariantie is het deel dat hier juist niet aan gerelateerd is. Hoe groter de proportie systematische variantie is, hoe sterker de relatie tussen de variabelen. De coëfficiënt van bepaling laat zien hoeveel van de variantie in de ene variabele wordt verklaard door de andere variabele. Als de correlatie tussen de extraversie van een kind en de extraversie van een ouder +.25 is, dan is de coëfficiënt van bepaling dus .25x.25 = .0625. Dit betekent dat 6.25% van de variantie in de totale variantie van de extraversiescores van de kinderen gerelateerd is aan de extraversiescores van ouders. Dit betekent ook dat 93.75% van de variantie in de scores van de kinderen niet wordt verklaard door de extraversiescores van de ouders. Er zijn dus nog veel meer factoren die de variantie in de extraversiescores van de kinderen verklaren, maar deze variabelen kennen we niet, of deze hebben we niet meegenomen in het onderzoek.
Als twee variabelen ongerelateerd zijn (r=.00), dan verklaart de ene variabele helemaal geen variantie van de andere variabele. In andere woorden: er is geen systematische variantie tussen de data. De Pearson-formule laat zien dat zowel met de x- als de y-variabele gerekend moet worden om de correlatie te berekenen. Eerst moet Σxy – (Σx)(Σy)/n berekend worden. Vervolgens moet dit gedeeld worden door de wortel van de uitkomst van (Σx²- (Σx)²/n))(Σ y²- (Σy)²/n)).
Wanneer is er sprake van statistische significantie?
Vaak willen wetenschappers weten of de r die ze berekend hebben statistisch significant is. Van statistische significantie is sprake wanneer een correlatiecoëfficiënt die op basis van een steekproef gevonden is heel waarschijnlijk ook geen nul is in de populatie. Stel: de relatie tussen twee variabelen is .00 in de populatie. De vraag is of een wetenschapper dit ook echt zal vinden op basis van een kleine steekproef die hij of zij uit de populatie heeft getrokken. Door meetfouten kan het voorkomen dat een onderzoeker toch een correlatie vindt op basis van de steekproef, terwijl de correlatie in de populatie nul is. Gelukkig kunnen we de kans schatten dat de waarde van r die voortvloeit uit een steekproef, ook echt hetzelfde is in de populatie.
Als de kans dat de correlatie in de populatie ook geen nul is zeer laag is (vaak kleiner dan 0.05), dan is er sprake van statistische significantie. De statistische significantie van een correlatiecoëfficiënt wordt beïnvloed door drie factoren: (1) de grootte van de steekproef, (2) de grootte van de correlatie (‘magnitude of correlation’) en (3) de mate waarin we zeker willen zijn van de conclusie die we op basis van de steekproef hebben getrokken (de mate van voorzichtigheid van de onderzoeker).
De grootte van de steekproef is van belang voor de statistische significantie. Bij een grotere steekproef heeft de onderzoeker er meer vertrouwen in dat de correlatie die hij heeft gevonden ook daadwerkelijk niet nul is in de populatie. De grootte van de correlatie hangt samen met statistische significantie, want hoe groter de gevonden correlatie, hoe kleiner de kans is dat deze in de populatie nul is. Een wetenschapper die een correlatie vindt van .70 tussen twee variabelen, heeft er dus meer vertrouwen in dat deze variabelen in de populatie ook samenhangen, dan een wetenschapper die een correlatie van .15 vindt.
Tot slot is het van belang hoe voorzichtig een wetenschapper wenst te zijn met het trekken van conclusies over of de correlatie tussen twee variabelen echt nul zou kunnen zijn in de populatie. Vaak stellen wetenschappers dat de gevonden correlatie statistisch significant is wanneer er een kans bestaat van minder dan 5% dat deze nul is in de populatie.
Sterke en zwakke correlaties
Bij grote steekproeven is het zo dat zelfs zeer kleine correlaties snel statistisch significant worden. Een significante correlatie zegt ons alleen dat de kans zeer klein is dat de correlatie nul is in de populatie. De aanwezigheid van significantie vertelt ons dus niet of de relatie tussen de variabelen sterk is. Hoe sterk een correlatie is, hangt namelijk samen met de grootte van de correlatie en niet met de statistische significantie van de correlatie. De vuistregel is dat een correlatie van .10 als zwak, een correlatie van .30 als gemiddeld en een correlatie van .50 en hoger als sterk wordt beschouwd.
Wat is het verschil tussen directionele en niet-directionele hypothesen?
Wanneer een onderzoeker een correlationeel onderzoek opzet, kan hij of zij kiezen uit twee soorten hypothesen. Een directionele hypothese voorspelt welke richting de correlatie op gaat. Dit houdt in dat deze hypothese voorspelt of de correlatie positief of negatief zal zijn. Een niet-directionele hypothese voorspelt alleen dat twee variabelen gecorreleerd zullen zijn, maar niet of deze correlatie positief of negatief zal zijn. Directionele hypothesen worden het meest gebruikt.
Welke factoren beïnvloeden de correlatie negatief?
Door allerlei factoren kan de correlatiecoëfficiënt onder- of overschat worden. Het is daarom belangrijk om te letten op drie factoren die de sterkte van een correlatie ten onrechte kunnen verhogen of verlagen. Deze factoren zijn (1) ‘restricted range’, (2) uitbijters (‘outliers’) en (3) de betrouwbaarheid van meetinstrumenten.
Restricted range: deze bestaat uit de waarden die op de x-as en de y-as gekozen worden. Wanneer de y-as bijvoorbeeld van 200 tot 1600 gaat, dan geeft dit een andere puntenwolk dan wanneer de y-as van 1000 tot 1500 gaat. Het beeld van de puntenwolk verandert daardoor meteen. Dit is vooral een probleem als de scores in een curve lopen. Het kan voorkomen dat (als gevolg van de restricted range) slechts de helft van deze curve wordt afgebeeld. Wanneer er maar één helft van de curve wordt getoond, lijkt het ten onrechte alsof er sprake is van een lineaire relatie tussen de twee variabelen, in plaats van een curvilineaire relatie.
Uitbijters (‘outliers’): dit zijn scores die zo duidelijk afwijken van de data dat je je kunt afvragen of deze scores wel in de data thuishoren. De meeste wetenschappers vinden dat een score een uitbijter is, wanneer deze meer dan drie standaarddeviaties afwijkt van het gemiddelde. Er wordt onderscheid gemaakt tussen twee soorten uitbijters: (1) ‘on-line outliers’: de score valt in het patroon van de lijn in de puntenwolk, maar is toch extreem hoog of laag en zorgt ervoor dat de waarde van r omhoog schiet en (2) ‘off-line outliers’: de score valt niet in het patroon van de lijn in de puntenwolk en zorgt ervoor dat de waarde van r ten onrechte afneemt.
De betrouwbaarheid van meetinstrumenten: onbetrouwbare meetinstrumenten zorgen ervoor dat de correlatiecoëfficiënt te laag is. Hoe minder betrouwbaar het meetinstrument, hoe lager de correlatie.
Wat is het verschil tussen correlatie en causaliteit?
Het is belangrijk om stil te staan bij het feit dat correlatie geen causaliteit betekent. Zelfs al is er sprake van een perfecte correlatie, kan er niet gezegd worden dat de ene variabele de andere veroorzaakt. Als er bijvoorbeeld een correlatie bestaat tussen extraversie en zelfvertrouwen, dan kunnen we niet zeggen dat extraversie een oorzaak is van zelfvertrouwen of dat zelfvertrouwen een oorzaak is van extraversie.
Voordat we kunnen concluderen dat er sprake is van causaliteit, moet aan drie voorwaarden worden voldaan: (1) covariantie, (2) richting en (3) uitsluiting van de invloed van andere variabelen.
Allereerst moeten variabelen dus samen variëren; een hoge score op de x-variabele moet systematisch samengaan met een lage score op de y-variabele of juist met een hoge score op de y-variabele. Aan deze voorwaarden kan goed worden voldaan, namelijk door de correlatie te berekenen.
De tweede voorwaarde is die van richting. Dit houdt in dat de oorzaak noodzakelijkerwijs vooraf moet gaan aan het gevolg. Aan deze voorwaarde kan echter niet worden voldaan door een correlatie te berekenen. Omdat de x- en y-variabele vaak op hetzelfde moment worden gemeten, is het lastig om uitspraken te doen over de richting: leidt x tot y of leidt y tot x?
Ook aan de derde voorwaarde kan niet worden voldaan door het simpelweg berekenen van de correlatie. Het kan namelijk best zo zijn dat een derde variabele (z) zowel variabele x als variabele y beïnvloedt. Uit onderzoek blijkt bijvoorbeeld dat eenzaamheid en depressie met elkaar samenhangen. Dit betekent echter niet dat eenzaamheid depressie veroorzaakt, want het zou ook zo kunnen zijn dat zowel eenzaamheid als depressie worden veroorzaakt door een andere variabele. Deze variabele zou bijvoorbeeld de grootte van iemands sociale netwerk kunnen zijn.
Gedeeltelijke correlatie
Al mogen we nooit op basis van een correlatie spreken over causaliteit, toch kunnen we door middel van een aantal technieken wel inschatten welke variabele de andere waarschijnlijk veroorzaakt. Deze technieken zijn natuurlijk nooit helemaal bindend, maar ze kunnen een specifieke causale verklaring wel ondersteunen. Daarnaast kunnen ze wel met zekerheid aangeven wanneer twee variabelen niet correleren.
Als blijkt dat x en y gecorreleerd zijn, dan zijn er drie mogelijkheden denkbaar: (1) x veroorzaakt y, (2) y veroorzaakt x en (3) een andere variabele z veroorzaakt zowel x als y. Een onechte correlatie (‘spurious correlation’) is een correlatie tussen twee variabelen (x en y) die niet komt door een directe relatie tussen deze variabelen, maar door hun gedeelde relatie met een derde variabele (z). Het effect van een derde variabele kan worden getoetst door middel van een statistische procedure die gedeeltelijke correlatie (‘partial correlation’) heet. Een gedeeltelijke correlatie is een correlatie tussen twee variabelen waarbij de invloed van één of meer variabelen statistisch verwijderd is. Als we bijvoorbeeld willen weten of de relatie tussen x en y ontstaat door variabele z, dan kunnen we de variabiliteit in x en y die hoort bij z buiten beschouwing laten en bekijken of x en y dan nog steeds gecorreleerd zijn. Als x en y dan gecorreleerd blijven, dan is het onwaarschijnlijk dat z de relatie tussen x en y veroorzaakt. Als x en y niet meer gecorreleerd blijken te zijn, dan is z waarschijnlijk wel de oorzaak van de relatie tussen x en y.
Andere correlatiematen
De Pearson r correlatie kan gebruikt worden wanneer zowel variabele x als variabele y op interval- of ratioschaal liggen.
Wanneer één of beide variabelen ordinaal is/zijn, dan wordt de ‘Spearman rank-order correlation’ gebruikt als correlatiemaat.
Soms zijn de x- en y-variabele dichotoom. Dit betekent dat er maar twee mogelijkheden per variabele zijn. Een voorbeeld is dat variabele x staat voor sekse en variabele y voor of iemand wel of niet zijn of haar rijbewijs heeft behaald. Als er sprake is van twee dichotome variabelen, dan wordt de phi coëfficiënt als correlatiemaat gebruikt.
Wanneer één van de variabelen dichotoom is en de andere op interval- of ratioschaal ligt, kan er gebruik gemaakt worden van de punt-biseriële correlatie (‘point biserial correlation’). Als we dus kijken naar de relatie tussen sekse en maagdelijkheid dan is een phi coëfficiënt handig, maar als we kijken naar de relatie tussen sekse en lengte, dan is een punt biseriële correlatie juist aan te raden.
Het is belangrijk om te beseffen dat we niet altijd gebruikmaken van correlatiecoëfficiënten bij het analyseren van data. Vaak wordt er gebruik gemaakt van andere soorten statistieken. Deze worden later behandeld.
Vaak zijn wetenschappers geïnteresseerd in de vraag of twee variabelen samenhangen. Deze variabelen kunnen bijvoorbeeld verlegenheid en zelfvertrouwen, temperatuur en agressie of faalangst en academische prestatie zijn. We bepalen of een variabele aan een andere variabele gerelateerd is, door te bekijken of de variabelen covariëren; dus samen variëren. Als zelfvertrouwen zou samenhangen met verlegenheid, dan zouden hoge scores op zelfvertrouwen samen moeten gaan met lage scores op verlegenheid en vice versa. Als echter blijkt dat er geen consistente relatie bestaat tussen verlegenheid en zelfvertrouwen, dan kunnen we concluderen dat deze variabelen niet samenhangen. Hiervan zou bijvoorbeeld sprake zijn wanneer hoge scores op zelfvertrouwen even vaak gepaard gaan met hoge als met lage scores op verlegenheid. Twee variabelen covariëren dus als ze samen omhoog en omlaag gaan. Wanneer onderzoekers willen weten of variabelen samenhangen, maken ze gebruiken van correlationeel onderzoek (‘correlational research’). Correlationeel onderzoek wordt gebruikt om te kijken of twee of meer variabelen aan elkaar gerelateerd zijn, en in welke mate. De samenhang tussen twee variabelen wordt uitgedrukt in een correlatiecoëfficiënt. Zo kan een wetenschapper bijvoorbeeld geïnteresseerd zijn in hoeverre een eigenschap als extraversie erfelijk of aangeleerd is. Hij kan daarvoor een correlatie berekenen tussen de extraversie van een kind en de extraversie van de biologische ouders en ook een correlatie berekenen tussen de extraversie van een kind en de extraversie van de adoptieouders. Bij een hogere correlatie tussen de extraversie van het kind en die van de biologische ouders zou een onderzoeker kunnen concluderen dat extraversie eerder een aangeboren dan een aangeleerde eigenschap is.
Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>
Concept of JoHo WorldSupporter
JoHo WorldSupporter mission and vision:
- JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.
JoHo concept:
- As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
- JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.
Join JoHo WorldSupporter!
for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for
Work for JoHo WorldSupporter?
Volunteering: WorldSupporter moderators and Summary Supporters
Volunteering: Share your summaries or study notes
Student jobs: Part-time work as study assistant in Leiden
- Insurance for emigrants, expats and living abroad: international insurance for expats and emigrants
- Insurance for activities abroad: Backpacking Travel abroad Intern abroad Study abroad Volunteer abroad Work abroad
- Insurance: ACS Globe Traveller Caremed Insurances Expatriate Travel Insurance IMG’s GlobeHopper World Nomads Insurance SafetyWing Insurance JoHo Special ISIS verzekering NL/BE Working Nomad verzekering NL/BE More about Insurance for abroad
Search only via club, country, goal, study, topic or sector
Select any filter and click on Search to see results








