Wat is de validiteit en betekenis van een test? - Chapter 8
Wat is validiteit?
Validiteit gaat om de mate waarin de test aan zijn doel beantwoordt. Afhankelijk dus van het doel moet men elke keer weer kijken of een test valide is, validiteit kan dus niet gezien worden als een eigenschap van de test zelf. Het gemeenschappelijke kenmerk van de doelen bij testgebruik is dat het niet gaat om het testgedrag zelf, maar om wat het testgedrag kan zeggen over ander gedrag dat buiten het testgedrag ligt.
Het valideringsproces is het proces van het verzamelen van evidentie voor de rechtvaardiging van de sprong van testgedrag naar iets anders. Validiteit is de mate waarin die rechtvaardiging is gevonden.
Validiteit wordt dus gekoppeld aan het doel van het testen: als voorspeller van gedrag of als operationalisering van een psychologisch begrip.
De test als voorspeller van ander gedrag
Het doel is het voorspellen van gedrag of een prestatie buiten de testsituatie. Het gaat om het doen van uitspraken over feiten waarvoor geen directe evidentie is op basis van andere met die feiten samenhangende gegevens. Deze feiten kunnen in de toekomst (predictie), het heden (paradictie) of het verleden (postdictie) liggen. In de theorie spreekt men hier van predictieve validiteit.
Enige relativering: ook al bestaat er er een aantoonbare relatie tussen begrippen, als deze begrippen niet goed geoperationaliseerd zijn, heeft de voorspelling weinig kans van slagen. Alleen wanneer zowel de test als het te voorspellen gedrag aantoonbare uitingen zijn van eigenschappen waartussen een aantoonbare relatie bestaat, kan de test een adequate voorspelling opleveren. Een blinde acceptatie van een voorspellende test (predictor) en de relatie daarvan met gedrag buiten de test (criterium) is niet realistisch.
De test als operationalisering van een psychologisch begrip
Het kan ook gaan om de theoretische begrippen waarmee men een verklaring kan geven van het testgedrag. Het doel is het meten van begrippen zelf. Men noemt dit begripsvaliditeit.
Enige relativering: ook al is het onderzoek niet gericht op het voorspellen van ander gedrag, toch levert dergelijk onderzoek informatie op over het voorspellend vermogen van de test. Als er een theoretisch relatie mag worden verondersteld tussen intelligentie en schoolsucces, kan men daarvan gebruik maken om van een nieuwe test vast te stellen of deze wel intelligentie meet en niet iets anders.
Wat zijn predictieve validiteit en begripsvaliditeit?
Alle gebruik van psychologische tests valt onder deze twee doelstellingen, dit houdt in dat alle variëteiten in het validiteitsbegrip binnen één van beide soorten validiteit vallen.
Predictieve validiteit. Onder de eerste doelstelling vallen bijvoorbeeld de toelating, de selectie, de beroepsadvisering, de classificatie en de differentiële predictie. De centrale (validiteits)vraag is hier in hoeverre een test daadwerkelijk een juiste voorspelling mogelijk maakt.
Begripsvaliditeit. Onder de tweede doelstelling vallen bijvoorbeeld de theoretische analyse van begrippen en het experiment ter toetsing van theorieën. De centrale vraag is hier in hoeverre de test het bedoelde psychologische begrip dekt.
Er moet niet een al te dwingend onderscheid gemaakt worden tussen beide toepassingen van tests; het beschrijven van een begrip of persoon dient altijd een buiten de test gelegen doel. Testen als activiteit op zich heeft geen zin. Sommigen vinden het onderscheid niet nodig, zij zien predictieve validiteit als specifieke vorm van begripsvaliditeit; de relatie tussen predictor en criterium zijn een onderdeel van het theoretische netwerk van het geoperationaliseerde begrip. Toch worden ze afzonderlijk behandeld; in het onderwijs en de personeelspsychologie wordt veel gebruik wordt gemaakt van het voorspellend vermogen van tests. Hierbij komen andere methodologische principes aan de orde dan bij het proces van begripsvalidering.
Welke andere onderscheidingen in validiteit zijn er?
Welke vier belangrijke soorten validiteit kunnen er worden onderscheiden?
Naast de genoemde predictieve validiteit en begripsvaliditeit, zijn er vier soorten validiteit die vanaf de eerste publicatie een belangrijke rol spelen: (1) predictieve validity, (2) concurrent validity, (3) content validity of inhoudsvaliditeit en (4) construct validity.
1. Predictive validity of voorspellende validiteit
Er wordt nagegaan in hoeverre voorspellingen gebaseerd op de testprestatie overeenkomen met gegevens en observaties die op een later tijdstip zijn verzameld. Het verschil met deze validiteit en eerder genoemde predictieve validiteit is dat bij deze validiteit de voorspelling gekoppeld is aan de resultaten in de toekomst terwijl bij de predictieve validiteit de voorspelling ook als het criterium van het heden en het verleden kan worden gebruikt.
2. Concurrent validity of gelijktijdige validiteit
Men vergelijkt testresultaten met gelijktijdig beschikbare criteriumgegevens. Het verschil met predictive validity is het moment van het verzamelen van de criteriumgegevens: gelijktijdig in plaats van in de toekomst. Deze vorm van validatie komt veel voor. Het onderscheid tussen predictive en concurrent validity is waardevol; als men niet op een toekomstig criterium kan wachten, kan men een gelijktijdig criterium gebruiken. Maar de resultaten moeten niet zonder meer gegeneraliseerd worden naar een toekomstig criterium.
3. Content validity of inhoudsvaliditeit
Er wordt gekeken hoezeer de inhoud van de test een universum van situaties, kennisinhouden of vaardigheden weergeeft, waarover met betrekking tot de onderzochte conclusies moeten worden getrokken. Het wordt vooral veel gebruikt bij onderwijskundig meten (bijvoorbeeld in hoeverre men uit een proefwerk Franse grammatica conclusies mag trekken over het gehele kennisdomein van Franse grammatica).
Bij inhoudsvaliditeit gaat het vooral om subjectieve oordelen, niet om de achterliggende correlaties. Men probeert de subjectiviteit van de oordelen te verkleinen door met verschillende beoordelaars te werken.
Inhoudsvaliditeit komt dicht in de buurt van 'face-validity'. Een formele definitie van inhoudsvaliditeit zou kunnen zijn 'de sterkte van de samenhang tussen de testscore en de totaalscore op het gehele itemdomein'. Die totaalscore is in de praktijk echter niet beschikbaar, waardoor er gebruik gemaakt moet worden van een representatieve steekproef, met behulp van equivalente tests. En dat lijkt weer veel op parallellie. Maar een goede betrouwbaarheid betekent niet automatisch ook een goede (inhouds)validiteit.
Bij studietoetsen kan men wel met empirisch onderzoek belangrijke informatie verzamelen, maar daarmee worden de grenzen van inhoudsvaliditeit overschreden en komt men op het terrein van de begripsvaliditeit.
4. Construct validity of constructvaliditeit
Men onderzoekt welke psychologische kwaliteiten (hypothetische constructen) door een test gemeten worden. Dit construct wordt vervolgens weergegeven in de testprestatie. Construct validity bestaat uit drie onderdelen:
De begrippen uitzoeken die kunnen worden gezien als een verklaring voor testprestatie door een logische bestudering van de test: psychologische verbeeldingskracht.
Vanuit de theorie waarop het construct is gebaseerd toetsbare hypothesen afleiden: een logische operatie.
Via empirisch onderzoek deze hypothesen toetsen: een methodologisch proces.
Constructvaliditeit lijkt heel veel op begripsvaliditeit, hoewel de laatste beter de eenheid in het validiteitsbegrip kan bewaren. Constructvaliditeit houdt zich bezig met de exploratieve vraag wat een test eigenlijk meet. Begripsvaliditeit houdt zich bezig met de vraag of een test daadwerkelijk kan worden opgevat als een operationalisering van een specifieke, door de onderzoeker beoogde eigenschap. De definitie van begripsvaliditeit is dus breder dan die van constructvaliditeit.
Welke andere onderscheiding kunnen er gemaakt worden in validiteit?
In de loop van de jaren zijn er nieuwe vormen van validiteit bij gekomen. Er worden er vier besproken. De eerste twee zijn specifieke varianten van begripsvaliditeit en de laatste twee zijn eraan verwant: (1) synthetische validiteit, (2) congruent validity of soortgenootvaliditeit, (3) face-validity of indruksvaliditeit en (4) incremental validity.
1. Synthetische validiteit
Synthetische validiteit richt zich op functie-elementen in plaats van op de functie en de taak als geheel; identificeerbare en op zichzelf zinvolle onderdelen van criteriumgedrag zijn belangrijk. Op basis van de afzonderlijk voorspelde elementen wordt vervolgens de voorspelling van de hele functie gesynthetiseerd. Het is een stap in de richting van begripsvalidering. Deze vorm is praktisch toepasbaar in de selectie- en beroepskeuzepsychologie.
2. Congruent validity of soortgenootvalditeit
Deze geeft de mate van correlatie aan tussen twee tests die dezelfde eigenschap meten. Een nieuwe test wordt vergeleken met een bestaande test, niet met als doel die andere testprestaties te voorspellen, maar om vast te stellen in hoeverre de nieuwe test inderdaad hetzelfde meet. Het is een onderdeel in het proces van begripsvalidering.
3. Face-validity of indruksvaliditeit
Een leek of een psycholoog heeft de indruk dat er een relatie bestaat tussen test en criterium of de betekenis van de test, dit is alleen nog niet onderzocht door middel van empirisch onderzoek. Dit is niet altijd een nuttige en soms zelf wel een gevaarlijke eigenschap van de test: veel tests zijn jarenlang alleen gebruikt omdat ze een indrukvaliditeit bezaten, dat zorgde ervoor dat er geen werkelijk valideringsonderzoek werd gedaan. Ook wel ‘faith validity’ genoemd.
Indrukvaliditeit kan wèl nuttig zijn als de test voldoende predictieve of begripsvaliditeit bezit: voor de onderzochte kan het nuttig zijn het gevoel te hebben iets zinvols te doen (transparantheid). Maar, transparantheid is alleen wenselijk en niet noodzakelijk: een test hoeft niet door leken begrepen te worden om nuttig te zijn.
4. Incremental validity of toegevoegde validiteit
Onderzoekt niet alleen de relatie tussen test en criterium, maar ook de verhoging van de validiteit door de verbetering van voorspellingen. Men vraagt zich af of het gerechtvaardigd is naast de reeds aanwezige informatie om nog een test te gebruiken. Komt op het terrein van de predictieve validiteit.
Wat is predictieve validiteit?
Een criterium is een gebeurtenis, gedrag of prestatie in het verleden, heden of toekomst. Normaal gesproken beschikt men niet over criteriuminformatie; daar is de test voor nodig. Een belangrijke vraag is hoe goed dit criterium valt te voorspellen. Dat wordt als volgt gedaan. Men bepaalt op grond van eerder gedaan empirisch onderzoek de relatie tussen testprestaties en criteriumprestaties. Vervolgens bepaalt men op grond hiervan de testprestaties en kan men met behulp van regressieanalyse de meest waarschijnlijke criteriumscores schatten.
Regressie-analyse is het bepalen van de rechte lijn (Y = a+ bX) die het best past bij de puntenwolk (als de gemiddelde gekwadrateerde verticale afstand van alle punten tot de lijn het kleinst is). In de toepassing van bijvoorbeeld een toets weten we de criteriumprestatie van de leerling nog niet, maar met behulp van zijn toetsprestatie kunnen we de meest waarschijnlijke criteriumscore schatten door de toetsprestatie X in te vullen in het regressiemodel.
Dit basismodel is eenvoudig, maar heeft bezwaren.
Hoe kan het criteriumbegrip nader bepaald worden?
Het begrip criterium levert nogal wat verwarring op. Thorndike (1949) heeft een drietal type criteria onderscheiden:
Uiteindelijk ('ultimate') criterium: het uiteindelijke doel van een test, het meest ideale criterium, maar te abstract en zelden of nooit beschikbaar.
Tussentijds ('intermediate') criterium: het tussendoel, wordt vaak gekozen in plaats van het uiteindelijke criterium.
Onmiddellijk ('immediate') criterium: het directe doel, wordt soms ook gekozen in plaats van het uiteindelijk criterium.
Er treden twee problemen op bij deze onderscheiding:
Abstractieniveau: de vraag in hoeverre het criterium ter beschikking staat, het te kwantificeren of te operationaliseren is.
Temporeel: de vraag hoe ver verwijderd het criterium in tijd ligt. Het uiteindelijk criterium ligt ver in de tijd; het tussentijds en het onmiddellijk criterium liggen dichterbij.
Verduidelijking van het bovenstaande onderscheid in het begrip 'criterium' in vier stappen:
Allereerst moet bekeken worden voor welk einddoel van een organisatie/instelling een voorspelling gedaan moet worden. Dat is direct af te leiden van het bestaansrecht van de organisatie.
Vervolgens concretiseert men dit einddoel in termen van zichtbare resultaten. Dit noemt men ‘conceptuele criterium’ naar Astin (1964). Dit conceptuele criterium bevindt zich in het laagste niveau van abstractie in de rangorde van relevante doelstellingen, aldus Astin.
Van het conceptuele criterium wordt nu een criteriummaat of -score afgeleid. Deze criteriummaten zijn duidelijke, eenduidige scores of uitspraken die betrekking hebben op het door het criterium bepaalde gedrag of prestaties. Dit criteriumgedrag is relevant waarneembaar gedrag. Een aantal opmerkingen over criteriummaat en criteriumgedrag:
- Criteriummaat geeft criteriumgedrag kwantitatief weer.
- Een onbetrouwbare criteriumscore en predictorscore leidt tot een lage predictieve validiteit.
- Men kan niet door empirisch onderzoek achter de relatie tussen criteriumgedrag (c.q. criteriumscore) en het achterliggende conceptuele criterium komen. Bij het conceptuele criterium is nog te weinig geoperationaliseerd voor concreet empirisch onderzoek. Bij bepaling van de relatie tussen het criteriumgedrag en het conceptuele criterium gaat het om de mate van de relevantie. Deze relevantie kan eerder door rationeel oordelen dan door empirisch onderzoek bepaald worden. Als men beseft dat empirische toetsing niet nodig is dan hoeft men niet 'oneindig en frustrerend' validiteitsonderzoek te doen.
- Predictieve validiteit bepalen. Eerst zijn criteriumgedrag gekozen en criteriummaat vastgesteld. Empirisch onderzoek in de vorm van predictieve validatie wordt dan pas gedaan wanneer besloten is een bepaalde criteriumprestatie te nemen als concretisering van een conceptueel criterium. Een gekozen criteriummaat is wél vergelijkbaar met andere criteriummaten. Men vergelijkt de relatie tussen conceptuele criteria. Als de relatie zwak is, moet men kijken wat het beste criterium is. De vraag is wie de verantwoordelijkheid heeft voor de keuze van het conceptuele criterium. Hier is men van mening dat de psycholoog zich met deze keuze moet bezighouden want:
- Hij heeft als taak het bewustwordingsproces over impliciete keuzes van het doel bij de opdrachtgever te stimuleren.
- Hij kan onaanvaardbare elementen in de keuze van het criterium onderkennen.
- Hij heeft onderzoekservaring en -gegevens.
Het is wenselijk niet alleen voor de keuze van de tests maar ook voor de criteriumscore een zo groot mogelijke betrouwbaarheid te verkrijgen. Bij de keuze van criteriumgedragingen is het vaak zo dat de betrouwbaarheid van de criteriummaten omgekeerd evenredig is met hun relevantie. Een criteriummaat moet dus zó betrouwbaar zijn dat de test nog betrouwbaar is, maar niet zoveel dat het geen beeld meer geeft van het conceptuele criterium.
Hoe kan een test of testbatterij met predictieve validiteit opgezet worden?
Bij het kiezen van test, het samenstellen van een testbatterij en bij de bepaling van predictieve validiteit zijn zes fasen te onderscheiden.
Fase 1: Operationalisering van het criterium
Het operationaliseren van het criteriumgedrag in een zo exact mogelijke criteriummaat.
Fase 2: Keuze en constructie van tests
Het kiezen van mogelijke tests of de constructie van mogelijke items waaruit tests kunnen worden gemaakt. Afhankelijk van omstandigheden, verwerkingsmogelijkheden, de theoretische aanpak, de mate van rationele bestudering en de analyseerbaarheid van het te voorspellen criterium, zal de samengestelde test goed of minder goed functioneren.
Fase 3: Proefafneming van bestaande of nieuwe tests
Proefafnames op verschillende groepen proefpersonen. Deze groepen moeten zoveel mogelijk overeenkomen met de uiteindelijke populatie die getest moet worden. Afwijkingen tussen steekproef en populatie zijn:
- Niet erg bij gemiddelden omdat betrouwbaarheid en validiteit niet veranderen bij variatie van gemiddelden.
- Wel erg bij spreiding; betrouwbaarheid en validiteit veranderen wel bij spreidingsvariatie.
Door middel van een gestratificeerde steekproef vooraf rekening houden met de samenstelling van de populatie op relevante demografische en persoonlijke variabelen, zorgt voor een representatieve steekproef. Want een aselecte grote steekproef voldoet vaak niet vanwege moeilijk bereikbare deelgroepen. Als een test op een niet-representatieve steekproef is gebouwd, kan er niet zonder meer gegeneraliseerd worden naar andere groepen.
Er wordt onderscheid gemaakt tussen het vooronderzoek en het hoofdonderzoek. Een vooronderzoek dient als grove zeef of het begrepen wordt, items niet te moeilijk/makkelijk zijn en of de testtijd realistisch is (een kleine niet-representatieve steekproef is voldoende). Een hoofdonderzoek dient om de definitieve test te construeren (grote, representatieve steekproef nodig).
Het vooronderzoek (met behulp van proefafnames) heeft verschillende doelen. Men doet verschillende proefafnames omdat men verschillende beslissingen moet nemen, elke beslissing wordt al verwerkt voor de volgende nieuwe proefafname.
Eerste proefafname: Het verzamelen van informatie voor een itemanalyse indien de test moet worden geconstrueerd. De itemanalyse bestaat uit het bepalen van de moeilijkheidsgraad en de item-restcorrelatie:
Moeilijkheidsgraad: extreem moeilijke/makkelijke items zijn alleen gewenst als de test ook extreme personen moet kunnen meten (adaptief testen). Het onderzoeken van de moeilijkheid levert ook informatie op over het functioneren van items.
Item-restcorrelatie: de correlatie van elk item met de totaalscore op de overige items; een hoge correlatie betekent dat een item veel gemeen heeft met de andere items en dus dezelfde eigenschap meet. Hiermee kan een relatief betrouwbare testscore verkregen worden.
Tweede proefafname: Een schatting maken van de betrouwbaarheid, de juiste testlengte en het beste snelheidskarakter voor de gehele test. En een indruk krijgen van de validiteit waarvoor criteriumscores uit de eerste fase gebruikt worden.
Op basis van gegevens uit fase 3 wordt de definitieve test samengesteld.
Fase 4: Validatie van de testprocedure
1. Het valideringsonderzoek
In deze fase vindt de echte validatie van de test plaats. De voorspelling gebeurt vaak met een beschikbaar criterium in plaats van met een toekomstig criterium, want validatie is lastiger naarmate het criterium verder weg in de tijd ligt. Criteriumscores zijn dus ook direct beschikbaar, men hoopt de gegevens te kunnen gebruiken voor het bedoelde pas in de toekomst te bepalen predictiemodel. Maar generalisatie naar de realiteit van de situatie die men wil voorspellen is niet altijd mogelijk omdat:
- Tijdens de proefafname kan de motivatie van de proefpersonen minder zijn dan in de echte testsituatie.
- Eigenschappen en instelling van de proefpersoon kunnen erg verschillen van de echte situatie (zoals bij een sollicitatie of examen).
Er zijn een aantal bezwaren tegen de ideale validatieprocedure van tests, namelijk wachten tot de echte criteriumgegevens beschikbaar komen:
- De lange duur van het onderzoek.
- Variatiebeperking of 'restriction of range' op de criterium- en predictorvariabele, omdat er door uitval zowel zeer geschikte als juist niet geschikte uit de aanvankelijke onderzoeksgroep verdwijnen. Hierdoor nemen zowel betrouwbaarheid als validiteit af.
- Het oordeel van een latere beoordelaar kan al beïnvloed zijn door eerdere testuitslagen. Dit wordt ook wel contaminatie van het criterium genoemd. Hierdoor komt de validiteitscoëfficiënt mooier naar voren dan in werkelijkheid het geval is.
2. Het vaststellen van de validiteit
De meest gangbare methode bij het validatie-onderzoek is een schatting te maken van de (lineaire) correlatie door middel van de Pearson-product-momentcorrelatie. Dit klopt echter niet altijd. Er zijn twee bekende uitzonderingen waarbij de product-momentcorrelatie een lage waarde oplevert terwijl er wel een interessante relatie bestaat:
Kromlijnige relatie. Een lage testscore gaat gepaard met een lage criteriumscore, een hogere testscore met een hogere criteriumscore, maar een zeer hoge testscore weer met een lage criteriumscore. In plaats van de moment-productcorrelatie kan de correlatieratio η (èta) gebruikt worden: een correlatiemaat die onafhankelijk is van de vorm van de exacte relatie.
Heteroscedastische relatie. Er bestaat wel een verband tussen de lagere waarden van twee variabelen, maar niet tussen de hogere waarden. Naarmate X toeneemt, neemt de spreiding van Y ook toe. In plaats van de moment-productcorrelatie kan de correlatiecoëfficiënt θ (thèta) gebruikt worden: geeft de gemiddelde relatie over de verschillende niveaus van de testscore weer.
Veel relaties zijn niet perfect homoscedastisch (is overal gelijke spreiding van Y), daarom moet de relatie tussen X en Y goed onderzocht worden en er mag niet kritiekloos gebruik gemaakt worden van de moment-productcorrelatie.
Testscores kunnen ook op andere manieren gebruikt worden bij een voorspelling. Namelijk als:
Suppressorvariabele. Stel: X1 en X2 correleren met elkaar, X1 correleert met Y, maar X2 correleert niet met Y. X2 correleert kennelijk met het deel van X1 dat niet met Y correleert. Als we met behulp van X2 dit deel uit X1 halen, dan blijft er een gecorrigeerde variabele (X'1) over die sterker met Y correleert dan de ongecorrigeerde versie. Zo maakt X2 het mogelijk dat X1 een beter voorspeller wordt voor Y. X2 is de suppressorvariabele omdat hij het niet-relevante deel van X1 bij de voorspelling van Y onderdrukt.
Voorbeeld: taalvaardigheid X2 (suppressor) speelt een rol in een toets voor rekenvaardigheid X1 waarmee geschiktheid voor Y wordt voorspeld; taalvaardigheid is hiervoor niet van belang, rekenvaardigheid wel. Door de scores op de rekentoets X1 te corrigeren voor taalvaardigheid X2 kan een betere voorspelling van Y worden gekregen.
Moderatorvariabele. Een variabele die zelf niet hoeft te correleren met Y, maar wel de relatie van andere variabelen met Y beïnvloedt. Het is belangrijk om rekening mee te houden; ze verduidelijken de relatie tussen test en criterium en maken duidelijk dat tests soms maar in een beperkt aantal deelgroepen uit een populatie bruikbaar zijn.
Voorbeeld: een testscore correleert wel voor mannen met Y, maar niet voor vrouwen; de correlatie voor een gemengde populatie is matig, maar in afzonderlijke groepen mannen en vrouwen geheel anders. Sekse is de moderatorvariabele.
Interactie-effect. Twee variabelen correleren apart met Y en hebben daarnaast ook nog een interactie-effect op Y. Als beide variabelen een hoge score hebben, wordt de correlatie met het criterium extra verhoogd: noemt men ook ‘moderated regression’.
Fase 5: Samenstelling van de predictorbatterij
De tests waarvoor een bruikbare validiteit vastgesteld is, worden gecombineerd in een maximaal voorspellende testbatterij. Als techniek om een goede samenhang te krijgen in de keuze van tests, neemt men vaak de multiple/meervoudige regressie-analyse: de testscores wegen en optellen tot een voorspelling van Y. Een regressiegewicht is relatief groot als de test hoog correleert met criterium Y en laag met andere tests; dus als de unieke bijdrage van de test aan de voorspelling van Y relatief groot is. Het meest ideaal is een testbatterij met tests die onderling laag correleren (weinig overlap) en alle hoog met Y correleren; ze verklaren alle een uniek aspect van Y. Het is namelijk zinloos als tests in een batterij alle ongeveer hetzelfde meten, dat wordt afgestraft in het regressiemodel met lage gewichten voor diverse van deze tests. Het geeft geen extra bijdrage aan de voorspelling van Y.
De multiple correlatie is een maat voor het succes van de gehele testbatterij voor de voorspelling van Y; de correlatie van de totaalscore gebaseerd op de hele testbatterij met het geobserveerde criterium Y.
Fase 6: Kruisvalidering ('cross-validation')
De laatste fase is de kruisvalidatie. In een tweede onderzoek op een onafhankelijk steekproef vergelijkbaar met de eerste steekproef, worden de gevonden correlaties uit de eerste steekproef onderzocht of ze niet uit te veel toevallige relaties zijn ontstaan.
De reden hiervoor is dat een regressiemodel komt vaak tot stand komt na trail-and-error – voorspellers worden weggelaten of juist toegevoegd – en het uiteindelijke model is dan vaak het resultaat van het proberen van veel varianten. Naarmate de steekproef kleiner is, leunt het meer op de toevallige samenstelling. Als gevolg daarvan worden naast goede ook foute beslissingen genomen. Die fouten stapelen zich op als men meer modellen probeert, dat noemt men kanskapitalisatie. Hierdoor past het model goed bij die ene toevallige steekproef, maar niet meer bij de rest van de populatie. Dat kan voorkomen worden door vooraf de theorie goed te bestuderen en op voorhand al modellen uit te sluiten. En nagaan in hoeverre het uiteindelijk gekozen model door steekproeffouten tot stand is gekomen.
Om een indruk krijgen van de mate waarin kanskapitalisatie zich heeft voorgedaan kan men:
Een nieuwe steekproef trekken die even groot is (is duur en tijdrovend).
De bestaande steekproef aselect splitsen in twee gelijke delen: de kansrijkste voorspellingsmodellen op de ene helft uitproberen en kruisvalidering doen van het uiteindelijk gekozen model op de andere helft.
Kruisvalidering: het op basis van steekproef 1 gekozen model wordt in steekproef 2 gebruikt om daar voor elke persoon een schatting te maken van diens criteriumscore. Deze schatting wordt gecorreleerd met de geobserveerde criteriumscore Y, zodat voor steekproef 2 een multiple correlatie wordt verkregen, maar op basis van het model uit de steekproef 1. Deze correlatie wordt vergeleken met de multiple correlatie uit steekproef 1: als deze twee correlaties niet veel verschillen is er weinig kanskapitalisatie, maar als er een groot verschil is, is het model buiten steekproef 1 blijkbaar niet bruikbaar; de validatie is mislukt.
Kruisvalidering is erg belangrijk in elk onderzoek waar een effect of relatie wordt onderzocht. Een model dat bij kruisvalidering overeind blijft – een robuust model – maakt meer kans om tot de juiste beslissingen te leiden.
Welke differentiatie kan er gemaakt worden in het criteriumonderzoek?
De resultaten van het empirisch valideringsonderzoek zijn vaak niet erg veelbelovend. Een lage correlatie en validiteit zeggen echter niet altijd dat de test slecht is; het hangt ervan af of er voorafgaand aan de voorspelling al relevante informatie beschikbaar was (niet verkregen door een test). Tests die misschien minder valide zijn, maar wel een beroep doen op unieke eigenschappen, kunnen een extra bijdrage aan de voorspelling leveren.
Er zijn een aantal verklaringen voor die lage validiteit:
Door de erg lage betrouwbaarheid van gebruikte criteria. Er is te weinig aandacht voor het ontwerpen van een betrouwbare criteriummaat; de gebruikelijke schoolcijfers, bedrijfsbeoordelingen en psychiatrische classificaties zijn vaak onvoldoende betrouwbaar. De constructie van een criteriummaat moet net zo zorgvuldig gebeuren als de constructie van een predictormaat.
Door de afwijking van de homoscedasticiteit en lineariteit van de relatie tussen test en criterium, zodat de gebruikelijke product-moment-correlatie een te somber beeld geeft van de sterkte van de relatie. Dat moet onderzocht worden door middel van een visuele inspectie van de scatter plot (puntenwolk).
Doordat in het validatie-onderzoek men met té heterogene groepen werkt. Men moet dan aparte subgroepen maken en per groep aparte validiteiten berekenen. Het is ook belangrijk om de juiste covariaten en moderatorvariabelen te vinden. Het gaat dus om de vraag of er er kan worden uitgegaan van één voorspellingsmodel voor alle groepen of dat er per relevante groep een apart model nodig is. Dat is te onderzoeken met regressiemodellen voor geneste gegevens: multiniveaumodellen.
Externe variabelen die de correlatie tussen test en criterium beïnvloeden, worden niet genoeg onderkend; hetzelfde criterium kan in verschillende organisaties verschillende betekenissen hebben. Aangezien het criterium verschilt per organisatie, moeten voorspellingsmodellen zowel uiteenlopende predictoren als uiteenlopende criteriummaten bevatten.
Onterechte vereenvoudiging van het criterium. Men gaat uit van een te eenvoudig beeld, waarin een complex criteriumgedrag is samengevat in een enkele criteriummaat. Daarnaast is het criteriumgedrag is niet zonder meer generaliseerbaar in tijd maar gebonden aan het moment van de meting. Men moet zich niet richten op een momentopname (statisch criterium), maar op veranderingen tussen momentopnamen (dynamisch criterium). Daarmee kan men de mate van verandering, groei en verbetering tussen twee momenten voorspellen.
In hoeverre is validiteitsgeneralisatie mogelijk?
De vraag is in hoeverre tests en functies inwisselbaar zijn, en dus in hoeverre we met dezelfde voorspellingssituatie te maken hebben. In dat geval is er namelijk geen nieuw valideringsonderzoek nodig. Predictieve validiteit wordt ook wel gezien als in hoge mate situatiespecifiek en generaliseerbaar.
Schmidt en Hunter (1977) hebben een methodiek ontwikkeld om te kijken of dit wel zo is:
Voor alle combinaties van een specifieke test en gedrag in een speciale functie worden de validiteitscoëfficiënten bepaald en de daarbij horende standaarddeviatie. De conclusie van Schmidt en Hunter is dat validiteitsresultaten weinig situatie-specifiek zijn.
Het onderzoek naar validiteitsgeneralisatie waarbij een schatting gemaakt wordt van de effectiviteit. Op basis van de effectiviteit en de ondergrens van de validiteit binnen een categorie van tests en functies kunnen uitspraken gedaan worden over de te verwachten validiteiten in toekomstige selectiesituaties met dezelfde categorie tests. De conclusie van Schmidt en Hunter is dat effectiviteit groot is en de validiteit vaak constant zal zijn over situaties.
Methodologische artefacten die de grote variatie in validiteitscoëfficiënten zouden kunnen verklaren, aldus Smith en Hunter:
- Steekproeffouten: hieronder vallen factoren als een kleine steekproefgrootte (waardoor toevalsinvloeden verhoudingsgewijs een grote invloed hebben) en min of meer subtiele verschillen in samenstelling van de steekproeven (waardoor deze niet volledig representatief zijn voor de achterliggende populatie).
- Onbetrouwbaarheid van test en criterium.
- Beperking van de variatiebreedte: over een smal interval van test- en/of criteriumscores valt de correlatie lager uit dan over een breed interval.
De belangrijkste bezwaren tegen het onderzoek van Schmidt en Hunter zijn:
- Door het gebruik van ruw geschatte criteria wordt de hypothese dat validiteit onafhankelijk van de situatie zou zijn meer bevestigd.
- De correctie van de variantie van de validiteitscoëfficiënten zou te sterk zijn en er wordt alleen voor bepaalde artefacten gecorrigeerd. De hypothese dat de validiteit onafhankelijk is van de situatie wordt door deze overcorrectie bevestigd.
Welke beperkingen heeft de predictieve validiteit?
De beste predictoren worden vastgesteld met regressie-analyse (hoog correlerende krijgen een zwaarder gewicht). De vraag is of deze statistische selectie ook leidt tot inzicht in de vraag waarom een testbatterij het criterium goed voorspelt. Het is belangrijk om te weten waarom een bepaalde predictor het criterium zo goed voorspelt; de achterliggende psychologische principes moeten begrepen worden.
De predictieve validiteit houdt zich bezig met de vraag of de test een belangrijk criterium kan voorspellen. Men moet zich echter niet beperken tot deze predictieve validiteit, voor zowel empirische als praktische verdieping zijn begripsvaliditeit en de betekenisanalyse onmisbaar. Redenen hiervoor zijn:
Bij begrip van de (afwezigheid) van samenhang kunnen er hypothesen gevormd worden om de predictieve validiteit te verbeteren.
Bij een extreme empirische benadering moet de validering over alle mogelijk predictoren gaan. In de praktijk echter wordt al gestart met een keuze van tests gebaseerd op een analyse van het criterium en de test. Daarvoor wordt ook al gebruik gemaakt van de betekenis- en begripsvaliditeit.
Bij een unieke of zeldzame situatie waarvoor het erg moeilijk is om een criterium vast te stellen. Er kunnen alleen hypothesen hierover geformuleerd worden.
Bij beschrijving van het psychologische beeld van de onderzochte wordt gebruik gemaakt van de betekenis en de theorie van de test.
Betekenisanalyse en begripsvaliditeit bieden de mogelijkheid de aard en de betekenis van het criterium te analyseren.
Begripsvaliditeit krijgt pas door de betekenisanalyse zin en inhoud. De betekenisanalyse onderzoekt met hypothetische begrippen wat de test meet en welk psychologisch begrip het testgedrag verklaart.
Wat is betekenis en begripsvaliditeit?
Wat is begripsvalidering?
Aan begripsvalidering gaat meestal een proces van betekenisanalyse vooraf: het beantwoorden van de vraag wat een test (of items) zou kunnen betekenen. Betekenisanalyse kent dezelfde fasen als bij de theorievorming en algemene toetsing:
Fase 1: Betekenisanalyse; een creatieve fase
Er wordt een theorie gecreëerd dat het testgedrag hypothetisch kan verklaren. Kenmerken van deze eerste fase zijn:
- De procedure en methodiek zijn niet voorgeschreven en bindend (creatief).
- De voorspelling moet ondubbelzinnig te onderzoeken zijn, zodat er geen discussie over mogelijk is.
- Er is geen bewijs dat een test wel of niet een theoretische betekenis heeft, het bevestigen van de hypothese kan een theorie alleen versterken (of verzwakken bij niet-bevestigen).
- Het is net zo belangrijk alternatieve hypothesen te kunnen verwerpen als de oorspronkelijk theorie te kunnen bevestigen.
In deze fase zijn er twee methoden volgens Campbell (1960) om het testgedrag te kunnen valideren:
- Trekvaliditeit: gedrag verklaren met behulp van een persoonlijkheidstrek of geschiktheidsdimensie (het gaat dus niet noodzakelijk om een theorie).
- Nomologische validiteit: testgedrag wel verklaren door een theorie door het gedrag te in verband te brengen met een ‘nomologisch netwerk’. Een nomologisch netwerk is een theoretisch kader aan begrippen en relaties hiertussen.
Voorbeeld: validering van het Taylor Manifest Anxiety Scale (TMAS): trekvalidering: door de beoordelingen van het angstniveau van patiënten als criterium te nemen; nomologische validering: door het testgedrag op de TMAS te relateren aan de Hull-Spence-leertheorie (= een nomologisch netwerk).
Trekvalidering wordt vaker gebruikt dan nomologische validering; Borsboom staat zelfs afwijzend ten opzichte van nomologische validering – omdat er te weinig specificatie is van de te verwachten correlaties. Dit boek staat er niet afwijzend tegenover.
Er is een gradueel onderscheid tussen trekvalidering en nomologische validering. Vaak is er een onvoldoende gedetailleerde theorie, waardoor de testconstructie een wat exploratiever karakter heeft; men stelt achteraf pas vast wat de test meet, maar de onderzoeker had vooraf vaak wel een theoretische idee van het begrip dat hij probeerde te onderzoeken (uit eerder empirisch onderzoek). Daarnaast zijn theorieën nooit ‘af’, maar ontwikkelen, veranderen en wijzigen voortdurend. De validering van de test levert een bijdrage aan de verdere theorievorming. Tests spelen ook een dominante rol in de psychologische theorievorming; het levert meetgegevens op waarmee hypothesen over relaties getoetst kunnen worden (bijvoorbeeld onderzoeksgegevens van de Stanford-Binet-test hebben bijgedragen aan wat men onder intelligentie verstaat).
De manier waarop gemeten wordt bepaalt dus mede het de definitie van het begrip in het brede kader van het nomologisch netwerk, met name in een vakgebied dat nog in de kinderschoenen staat. De testontwikkelaar begint echter niet in een vacuüm, maar sluit aan bij bestaande ideeën. Maar als de test de beste operationalisering daarvan is, gaat de test een belangrijke rol spelen in de ontwikkeling van de theorie.
Fase 2: De begripsvalidering
Empirische toetsing vindt plaats om voorspellingen gebaseerd op de potentiële verklaring van het testgedrag te onderzoeken. De functies van deze voorspellingen zijn:
- Het bevestigen van de hypothetische verklaring (confirmerende validiteit).
- Het verwerpen van alternatieve verklaringen (discriminante validiteit).
Er zijn twee vormen van begripsvalidering: in een praktisch niet-experimenteel kader en in een experimenteel kader. Maar begripsvalidering vindt altijd plaats volgens strikte methodologische spelregels, dit in tegenstelling tot het proces van betekenisanalyse.
Hoe verloopt de betekenisanalyse?
De vermoedens en verwachtingen van de onderzoeker over de te meten eigenschap vormen de basis voor de theorievorming over het testgedrag. Als de onderzoeker werkt vanuit een duidelijk theoretisch uitgangspunt, hoeft er niet aan betekenisanalyse gedaan worden, en kan hij meteen doorgaan met begripsvalidering.
Het zoeken naar een verklaring van testgedrag kan door middel van het analyseren van inhoudelijke of formele kenmerken van het testgedrag. Er zijn twee soorten onderzoek: structuuronderzoek en relatieonderzoek.
Structuuronderzoek
Ontleding van de structuurkenmerken van de test kan op twee manieren leiden tot inzicht in de betekenis van het testgedrag:
- Psychologische analyses van de inhoud van de vragen en de opdrachten die leiden tot veronderstellingen die nog wel moeten worden getoetst. Dat kan door proberen een indruk te krijgen van het oplossingsproces tijdens het oplossen van de vragen of door het bestuderen van de literatuur over de items.
- Analyses van de formele kenmerken van de test, zoals het verschil tussen twee type tests of de testscorecorrelatie op twee verschillende tijdstippen.
Relatieonderzoek
Gegevens uit relatie-onderzoek kunnen worden gebruikt als bron voor ideeën, er zijn vier vormen:
- Spreiding en normen. Het bestuderen van gegevens over spreiding en normen in verschillende groepen geeft informatie over wat de test meet.
- Experimenteel onderzoek. Door experimenten kan men over de betekenis van het testgedrag suggesties doen.
- Factoranalyse. Dit is een methode om een groot aantal variabelen samen te vatten in een kleiner aantal factoren, zodat de inzichtelijkheid toeneemt en waardoor er hypothesen gemaakt kunnen worden over de eigenschappen die aan deze factoren ten grondslag liggen. Een factor is de gewogen som van itemscores of testscores. Factoranalyse gaat uit van correlaties of covarianties tussen testscores. Als de correlaties allemaal ongeveer nul zijn, zijn de testprestaties onafhankelijk van elkaar: de tests meten elk een andere eigenschap en bevatten elk unieke informatie over het individu. Als de correlaties hoog zijn, vertonen de tests veel ‘overlap’ met elkaar: de tests meten dezelfde eigenschap en één enkele factor kan de structuur in de gegevens verklaren. De werkelijkheid ligt vaak tussen deze uitersten in; het aantal factoren dat de tests kan beschrijven, is vaak kleiner dan het aantal tests, maar slechts één factor komt maar zelden voor. Factoren kunnen worden onderscheiden in:
- Specifieke factoren die zijn gekoppeld aan (een gedeelte van) een test.
- Groepsfactoren die een kleiner gedeelte van de tests vertegenwoordigen.
- Algemene factoren, waarmee vrijwel alle tests min of meer samenhangen.
Op basis van de psychologische interpretatie van de factoren kan de betekenis van het testgedrag verhelderd worden. Factoranalyse is een bruikbare methode, maar de waarde ervan hangt af van een aantal voorwaarden en uitgangspunten:
- De aard van de steekproef waarop men de analyse uitvoert. Een structuur van factoren wordt scherper door het contrast tussen hoge en lage correlaties (een heterogene steekproef levert hogere correlaties op).
- De hoeveelheid en de aard van de variabelen die in de analyse worden opgenomen. Testbetekenis wordt door de betekenis van andere (test)variabelen uitgedrukt.
- De namen die worden gegeven aan de factoren komen tot stand door een subjectieve inhoudsanalyse van de test.
- Mathematische en technische keuzes hebben invloed op het resultaat. Omdat factoren constructies zijn van de onderzoeker, zijn die keuzes arbitrair en moeten expliciet gemaakt worden.
Factoranalyse moet niet klakkeloos worden toegepast; de onderzoeker moet zich bewust zijn van de vooronderstellingen en de beperkingen.
- Wat kan de test voorspellen? Wat de test kan voorspellen zegt iets over wat de test meet; er is een wisselwerking tussen betekenisanalyse en predictieve validiteit.
Een combinatie van verbeelding (creatieve ideeën) en systematische analyse (efficiënte manier) is dus belangrijk bij structuur- en relatieonderzoek om antwoord op de betekenisvraag te krijgen.
Welke alternatieve verklaringen zijn er?
Begripsvalidering gebeurt enerzijds door de oorspronkelijke hypothese te confirmeren en anderzijds door concurrerende hypothesen die alternatieve verklaringen voor het testgedrag geven te verwerpen. Het is niet altijd zinnig om deze alternatieven te verwerpen, om twee redenen: de eerste is dat de waarde van het verwerpen samenhangt met de waarde van de experimentele opzet, door een onjuiste of slordige opzet kan ten onrechte een alternatieve verklaring worden verworpen. Alternatieve hypothesen moeten een eerlijke kans krijgen. Ten tweede hangt de waarde af van de plausibiliteit van de alternatieve verklaring.
Het vinden van alternatieve verklaringen is ook een creatief proces. Maar het is toch verstandig om enkele alternatieven altijd te controleren (als een soort routine):
1. Samenhang met intelligentie
Het is verstandig prestatie- en gedragstests altijd te correleren met intelligentietests, waarvan de formele kenmerken op de onderzochte test lijken.
2. Sociale wenselijkheid als onbedoelde eigenschap
Dat vormt vooral bij persoonlijkheidsvragenlijsten een probleem. Een test die onbedoeld sociale wenselijkheid meet, functioneert niet goed. Er zijn twee vormen van sociale wenselijkheid:
Een individuele vorm: per individu verschilt de opvatting over wat sociaal wenselijke antwoorden zijn. Te onderzoeken door een individu per testvraag ook de mate van sociaal wenselijkheid te laten geven. De correlatie tussen beide gegevens geeft de mate van sociaal wenselijkheid van de test. En het kan onderzicht worden door te kijken naar het verschil in antwoorden tussen anonieme en niet-anonieme tests.
Een algemene vorm: er is een algemeen aanvaarde opvatting over wat sociaal wenselijke antwoorden zijn. Te onderzoeken door een algemene sociale-wenselijkheidssleutel te construeren gebaseerd op de antwoorden over sociale wenselijkheid van testvragen gegeven door een groep proefpersonen.
Sociale wenselijkheid is een veelvoorkomend fenomeen, maar de meeste goede vragenlijsten hebben toch wel een bruikbare correlatie met externe criteria: de neiging tot het geven van sociaal wenselijke antwoorden kan voor de voorspelling van ander gedrag relevant zijn, waardoor de vragenlijsten toch praktisch bruikbaar zijn.
Het is echter ook verstandig sociale wenselijkheid te verminderen. Dat kan door een subtielere opzet van de vragenlijst of procedure, namelijk bij de formulering van items en de testinstructie, in de manier waarop de test wordt voorgelegd, in de keuze van de titel van de test, door te kiezen voor een bepaalde testvorm (bijvoorbeeld ‘forced-choice’-vorm) of door een correctie achteraf.
3. Antwoordtendenties
Een antwoordtendentie is de neiging tot een consistent keuzepatroon. Dit komt tot uiting in het antwoordgedrag op tests, los van de inhoud van de vragen, en dat op een betrouwbare manieren kan verschillen tussen proefpersonen. Er zijn verschillende antwoordtendenties:
Instemtendentie: er wordt overmatig ingestemd met de richting van de vraag.
Positievoorkeur: sommige posities bij antwoordmogelijkheden worden geprefereerd boven andere. Een bekende is de voorkeur voor het derde antwoord bij vierkeuzevragen in kennistoetsen.
Semantische interpretaties van de keuzecategorieën: de individuele interpretatie van de verbale frequentie-aanduidingen varieert. Voorbeeld: sommigen kiezen bij dezelfde frequentie voor ‘zelden’ waar anderen voor ‘soms’ zouden kiezen.
Sequentietendentie: neigingen tot het volgen van bepaalde regels in de opeenvolging van de gemaakte keuzen of de verdelingen over de keuzemogelijkheden. Bijvoorbeeld even vaak ‘ja’ als ‘nee’ willen kiezen of niet te veel dezelfde antwoorden achter elkaar willen geven.
Snelheidstendentie versus precisietendentie: mensen kunnen (van nature of door de eigen interpretatie van de instructies) de neiging hebben de nadruk te leggen op snelheid/kwantiteit of op juistheid/precisie.
Uitvoerigheidstendentie: de neiging tot uitvoerigheid komt met name voor bij open vragen. Het kan nadelig zijn voor de persoon als er antwoord wordt gegeven op vragen die niet worden gesteld en misschien wel onjuist zijn.
Gistendentie: sommige mensen hebben meer de neiging om te gaan raden dan anderen. Veel raden is voordeliger.
Voorkeur voor formele kenmerken: de neiging om af te gaan op formele kenmerken van de keuzemogelijkheden. Zoals bijvoorbeeld de neiging het langste of meest ingewikkelde antwoord te selecteren.
Sociale wenselijkheid als antwoordtendentie hangt af van de definitie van antwoordtendentie: bij antwoordtendentie als antwoordwijze ontstaan door de vorm van de vraag hoort sociale wenselijkheid, die ontstaat door de inhoud van de vraag, niet. Antwoordtendenties worden veroorzaakt door de vorm van de vraag, sociale wenselijkheid door de inhoud van de vraag.
Er kan pas rekening mee gehouden worden als het een waarneembare consistentie vertoont. Speciale vragenlijsten om bepaalde antwoordtendenties te meten om zo onderscheid te kunnen maken tussen mensen, hebben weinig meer opgeleverd dan globale en stereotype gedragsindicaties. Het is belangrijk om er rekening mee te houden bij de betekenisanalyse, en ook belangrijk bij de constructie van items.
Wat is de relatie tussen betrouwbaarheid en validiteit?
De begrippen betrouwbaarheid en validiteit moeten theoretisch goed worden gescheiden:
Betrouwbaarheid: de betrouwbaarheidsschatting geeft een betrouwbaarheidsinterval voor de betrouwbare testscore (klassieke testtheorie) en de persoonsparameter (item-responstheorie). Is een indicatie van de nauwkeurigheid van de meting.
Validiteit: wat de test meet (staat los van de nauwkeurigheid), en deze meting kan met verschillende graden van betrouwbaarheid plaatsvinden.
Met een lage betrouwbaarheid meet de test wel de eigenschap, maar dan met veel ruis en dat is nauwelijks valide te noemen, want individuele verschillen in testscores zijn dan grotendeels gevolg van meetfouten en nauwelijks van systematische verschillen in de bedoelde eigenschap. Een grote meetfout betekent een lage correlatie met andere variabelen en dus een lage predictieve validiteit.
Multitrek-multimethode-benadering
Er is een methode ontwikkeld die testen evalueert in de context van validiteits- en betrouwbaarheidsonderzoek (Campbell en Fiske, 1959), de multitrek-multimethode-matrix. Deze methode onderscheidt zowel confirmerende en discriminante validiteit als betrouwbaarheid. De evaluatieprocedure van de test moet zowel verschillende trekken (voor de betekenis van de test) als verschillende methoden (voor de discriminantie met andere testen) omvatten.
De multitrek-multimethode-matrix toont alle correlaties die uit alle combinaties van trekken en methoden ontstaan. Deze matrix toont:
Betrouwbaarheid door de monotrek-monomethode-overlap, correlaties voor dezelfde trekken en methoden (b-waarden).
Confirmerende validiteit door de monotrek-heteromethode-overlap, correlaties voor dezelfde trekken en verschillende methoden (v-waarden).
Methodevariantie door heterotrek-monomethode-overlap, correlaties voor verschillende trekken en dezelfde methode (m-waarden).
Heterotrek-heteromethode-overlap, de correlaties voor verschillende trekken en eigenschappen (d-waarden).
Vier overweging met betrekking tot de validiteitsverwachtingen:
De v-waarden moeten verschillen significant van 0; ze moeten zo hoog zijn dat er met de test verder gewerkt kan worden (confirmerende validiteit).
De v-waarden moeten hoger zijn dan de d-waarden; dan is de validiteit van die variabele hoger dan de correlatie tussen die variabele en andere variabelen die er niets mee gemeen hebben.
De v-waarden moeten hoger zijn dan de m-waarden; twee onafhankelijke maten van dezelfde trek moeten hoger correleren dan twee verschillende trekken die met dezelfde methode zijn gemeten.
Het correlatiepatroon van de m-waarden moet ongeveer gelijk zijn aan die van de d-waarden.
Door deze laatste drie verwachtingen kan de discriminante validiteit vastgesteld worden. Namelijk dat de test niet met andere trekken ongewenst hoog correleert en dat de methode zelf niet voor de hoge v-waarden verantwoordelijk is.
Deze benadering laat zien dat de test-hertestmethode in de categorie valt van dezelfde methode en dezelfde trek. De correlatie ervan zegt dus iets over de herhaalbaarheid van de meting van de eigenschap. Bij paralleltests is de correlatie tussen twee paralleltests een b-waarde. Maar als ze erg afwijken van parallellie, dan is een meting van dezelfde trek met verschillende methoden, dus is de correlatie de v-waarde: confirmerende validiteit.
De multitrek-multimethodebenadering is een model om zowel de betrouwbaarheid als de confirmerende en discriminerende validiteit van een test te onderzoeken.
Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>
Concept of JoHo WorldSupporter
JoHo WorldSupporter mission and vision:
- JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.
JoHo concept:
- As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
- JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.
Join JoHo WorldSupporter!
for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for
Work for JoHo WorldSupporter?
Volunteering: WorldSupporter moderators and Summary Supporters
Volunteering: Share your summaries or study notes
Student jobs: Part-time work as study assistant in Leiden
- Insurance for emigrants, expats and living abroad: international insurance for expats and emigrants
- Insurance for activities abroad: Backpacking Travel abroad Intern abroad Study abroad Volunteer abroad Work abroad
- Insurance: ACS Globe Traveller Caremed Insurances Expatriate Travel Insurance IMG’s GlobeHopper World Nomads Insurance SafetyWing Insurance JoHo Special ISIS verzekering NL/BE Working Nomad verzekering NL/BE More about Insurance for abroad
Search only via club, country, goal, study, topic or sector
Select any filter and click on Search to see results








