Samenvatting van Testtheorie: Inleiding in de theorie van de psychologische test en zijn toepassingen van Drenth en Sijtsma - 4e druk

Samenvatting bij Testtheorie: Inleiding in de theorie van de psychologische test en zijn toepassingen

    Lees verder voor de samenvattingen per hoofdstuk

    Image

    Check: summaries and supporting content in full
    Hoe verloopt de historische testontwikkeling van het testen? - Chapter 1

    Hoe verloopt de historische testontwikkeling van het testen? - Chapter 1

    De wetenschappelijke testontwikkeling kwam tot bloei in de 20e eeuw. Maar ook daarvoor werd er al aan vormen van testonderzoek gedaan. De ontwikkeling van testdiagnostiek kent grofweg vier perioden, elke periode begon met een belangrijke gebeurtenis, namelijk:

    • De periode tot het verschijnen van de Binet-Simon-test.

    • De periode tussen het verschijnen van de Binet-Simon-test en de Eerste Wereldoorlog.

    • De periode tussen het begin van de Eerste Wereldoorlog tot de Tweede Wereldoorlog.

    • De periode tussen het begin van de Tweede Wereldoorlog tot heden.

    Hoe verliep de testontwikkeling tot aan de Binet-Simon-test?

    1905 is een belangrijke mijlpaal voor de ontwikkeling van de testdiagnostiek; in dit jaar verscheen de eerste versie van de Binet-Simon-test – de eerste waardevolle intelligentietest. Uiteraard gingen hier een hoop ontwikkelingen aan vooraf binnen diverse disciplines:

    Psychiatrie

    In Frankrijk ontstond eind 18e eeuw een verhoogde interesse in de geestelijke abnormaliteit en zwakzinnigheid. Men begon krankzinnigheid en zwakzinnigheid van elkaar te onderscheiden, waarbij mensen als Esquirol, Séguin, Charcot, Janet en Binet zwakzinnigheid niet beschouwden als ziekte, maar als een gebrek aan intellectuele vaardigheden. Ook in Duitsland veranderde de visie op geestelijke abnormaliteit. In beide landen werd hier steeds meer onderzoek naar gedaan, waardoor er een behoefte ontstond aan methoden om verschillen tussen geesteszieken en verschillende niveaus in zwakzinnigheid te kunnen duiden.

    Experimentele psychologie

    Naast de psychiatrie, ontstond ook binnen de experimentele psychologie – voornamelijk beoefend in Duitsland – een toegenomen interesse in geestelijke abnormaliteit en onderzoek hiernaar. De experimentele psychologie had door haar manier van onderzoek doen (namelijk controle en exacte beschrijving) veel invloed op de testtheorie. Met de oprichting van zijn experimentele laboratorium in Leipzig, luidde Wundt in 1879 het begin in van systematisch grootschalig experimenteel onderzoek. Naast een stimulerende werking, had het ook een remmende werking omdat met zich aanvankelijk vooral richtte op generaliseerbaarheid, waardoor afwijkingen en individuele verschillen werden toegeschreven aan experimenteerfouten. En daarnaast beperkte het onderzoek zich tot primaire sensorische en motorische functies. Later, met de publicatie van een artikel van Cattell in het tijdschrift Mind in 1890, kwam er meer aandacht voor individuele verschillen. In 1893 werd er binnen de American Psychological Association (APA) een commissie ingesteld met als taak tests te registreren en de gebruiksmogelijkheden van deze tests te formuleren.

    Genetica

    Een derde ontwikkelingslijn die van invloed is geweest op testontwikkeling, is de genetica, wat men name invloed had op de statistische kant van het testonderzoek. Darwin kaartte het probleem aan van de erfelijkheid van lichamelijke eigenschappen. Eind 19e eeuw verrichtte Galton diverse antropometrische onderzoekingen die gekenmerkt werden door drie elementen, die later een pijler van het wetenschappelijk testonderzoek zouden gaan vormen, namelijk:

    1. De wenselijkheid van het onderzoek naar individuele verschillen.
    2. De noodzaak van systematisering van onderzoekstechnieken (om resultaten te kunnen vergelijken en conclusies te kunnen generaliseren).
    3. Normatief denken: het weergeven van onderzoeksresultaten in statistische termen. Pearson was hierdoor geïnspireerd en heeft veel betekend voor de statistiek en testpsychologie (correlatiecoëfficiënt, rangcorrelatie, multiple correlatie, factoranalyse etc.).

    Deze eerste periode werd dus gekenmerkt door de behoefte van de psychiatrie aan diagnosemogelijkheden, de traditie van de experimentele psychologie met betrekking tot gestandaardiseerde onderzoeksprocedures en de interesse van de genetica in de verschillen tussen mensen. Maar er was nog geen psychologisch testen op grote schaal, het was theoretisch gericht en onderzoeksresultaten werden weinig toegepast. Dat is grotendeels te verklaren door de keuze voornamelijk de psychofysische functies te meten (sensorisch, motorisch en geheugenprocessen), maar geen onderzoek te doen naar complexe intelligentiefuncties.

    Hoe verliep de periode tussen het verschijnen van de Binet-Simon-test tot de Eerste Wereldoorlog?

    In 1905 verscheen de eerste intelligentietest – ontwikkeld door Binet en Simon – die ook echt een praktische functie had. Hij moest onderzoek doen naar de mogelijkheid om op scholen onderscheid te kunnen maken tussen luie en incapabele kinderen – tussen kinderen die niet konden en kinderen die niet wilden. Samen met medewerker Simon maakte hij 30 opgaven die een steekproef vormden van de verschillende opgaven die kinderen op school en in het dagelijks leven tegenkwamen. De opgaven waren voornamelijk verbaal, met variërende problemen, getest op 50 normale en enkele zwakzinnige kinderen en werden in volgorde van moeilijkheid aangeboden. Binet’s benadering was om drie redenen vernieuwend:

    1. Hij legde het accent op complexe mentale processen – zoals begrip, geheugen, probleemoplossend vermogen en verbeeldingskracht – in plaats van eenvoudige mentale processen.
    2. Daarnaast had hij een empirisch uitgangspunt; ideeën, omgezet in testopgaven, werden empirisch getoetst, waarna niet functionele opgaven werden aangepast of verwijderd.
    3. Ten slotte kwam hij met het voorstel een totaalscore te gebruiken als weergave van het intelligentieniveau.

    Binet introduceerde verder het begrip ‘mentale leeftijd’, waardoor een praktische indicatie kon worden verkregen van het intelligentieniveau. De test werd in verschillende landen vertaald en/of aangepast. Hoewel het werk van Binet in praktisch opzicht veel betekend heeft, was dit in theoretisch opzicht aanzienlijk minder het geval. Zo ontbrak er een theorie over de samenstellende elementen van intelligentie.

    Spearman heeft hier onderzoek naar gedaan en formuleerde aan de hand van dit onderzoek de twee-factorentheorie waarbij hij stelde dat er in alle tests twee intelligentiefactoren een rol speelden; een algemene (g-)factor en een specifieke (s-)factor. Intelligentie was volgens hem de g-factor die uit een serie intelligentietests (zoals die van Binet) gehaald kan worden.

    Hoewel de intelligentiemeting grote vooruitgang boekte in deze periode, werd nog niet op grote schaal getest en ook van valideringsonderzoek was er nog geen sprake.

    Hoe verliep de testontwikkeling tussen het begin van de Eerste Wereldoorlog en de Tweede Wereldoorlog?

    De testontwikkeling kwam door het uitbreken van de Eerste Wereldoorlog in een stroomversnelling. De psychologie werd voor het eerst regelmatig in de praktijk toegepast en de testpsychologie kreeg een steeds grotere rol bij de beslissingsproblematiek van selectie en plaatsing met betrekking tot functies en opleidingen. Dat was in Europa de aanleiding tot de erkenning van de psychologische test als beslissingsinstrument. In 1917, toen ook de Verenigde Staten bij de oorlog betrokken raakte, kwam de echte doorbraak. Er ontstond een noodzaak om snel en efficiënt te testen. Dit vormde het begin van de ontwikkeling van de groepsgewijs af te nemen schriftelijke test, waarvan de Army Alpha de eerste was (een schriftelijke test waarmee men in korte tijd het intelligentieniveau van grote groepen kon bepalen).

    Na de Eerste Wereldoorlog ontstond er een verschil in testontwikkeling in Amerika en Europa. In Europa – destijds gedomineerd door de Gestaltpsychologie, fenomenologie en personalisme – lag het accent vooral op de individuele diagnostiek. Met name de individuele observatietest werd uiterst populair.

    In Amerika – destijds gedomineerd door behaviorisme en positivisme – kregen met name de kwantitatief verwerkbare groepstests veel aanhang. Door een toenemend aantal immigranten uit vele landen van herkomst ontstond er een behoefte aan minder taal- en cultuurafhankelijke tests. In 1917 werd een volledig non-verbale intelligentietest gepubliceerd. In 1918 volgde de Army Bèta (een test die géén beroep deed op taalkennis of verbale vaardigheden). Maar de betrouwbaarheid van non-verbale tests was kleiner dan die van verbale tests. Ondanks de aandacht voor groepstests, werden in de VS ook veel individuele testbatterijen ontwikkeld, waarvan de Terman Merrill en de Wechsler series wellicht de belangrijkste waren.

    Engeland bevond zich meer in een tussenpositie tussen Europa en de VS. Hoewel de ontwikkeling van groepstest geen grote bloei doormaakte zoals de VS die doormaakte, was er, net als in de VS en in tegenstelling tot andere Europese landen, wel veel aandacht voor de objectieve evaluatie van schoolprestaties. ‘Vrije-antwoordenexamens’ maakten plaats voor examens met meerkeuzevragen. In 1939 werd Raven’s Progressive Matrices ontwikkeld; een meerkeuze-intelligentietest met reeksen patronen met een stijgende moeilijkheidsgraad.

    Hoewel er tijdens deze periode vaak geen theorieën ten grondslag lagen aan het gebruik van diverse tests, stimuleerde Thurstone (1931) wel de kritische evaluatie van de test zelf. Zo moesten testresultaten volgens hem betrouwbare testscores opleveren en diende de relatie tussen test en criterium al voor het toepassen van de test te zijn aangetoond. Dankzij deze opvattingen kreeg de statistiek een belangrijke rol in de testpsychologie. Ook begon men het begrip intelligentie in deze periode breder op te vatten; naast de algemene en specifieke factoren, werden door diverse onderzoekers – waaronder Thurstone – de groepsfactoren geïntroduceerd (verbal comprehension, word fluency, number facility, spacial visualization, associative memory, perceptual speed, reasoning).

    Verder ontstond er gedurende deze periode aandacht voor de ontwikkeling van persoonlijkheidstests, waaronder observatietests (met name in West-Europa populair), persoonlijkheidsvragenlijsten en projectietests.

    Samenvatting van de ontwikkelingen van testtheorie en testgebruik tussen beide wereldoorlogen:

    1. Ontwikkelingen en gebruik namen stormachtig toe, maar de theoretische en methodologische verantwoording bleef vaak gebrekkig of achterwege.
    2. Er waren accentverschillen tussen Europa en de VS:
      • Verenigde Staten: het bepalen van de kansen van de persoon op een positief resultaat in de te voorspellen situatie stond daar centraal. Tests werden gebruikt om te bepalen tot welke ‘klasse’ iemand behoorde, ook wel de actuarische methode genoemd (wordt ook gebruikt bij bepalen van kansen bij verzekeringsrisico’s).
      • Europa: een meer fenomenologische of intuïtieve methode stond daar centraal; het accent lag op de totaliteit van de persoon, diens beleven, structuur en dynamiek. Tests hadden er meer een ondergeschikte rol en conclusies waren niet kwantitatief (in kansen), maar een beschrijvende analyse.

    Hoe verliep de testontwikkeling vanaf het begin van de Tweede Wereldoorlog tot nu?

    Welke ontwikkelingen waren er in de Verenigde Staten?

    De testontwikkeling bloeide tijdens en na de Tweede Wereldoorlog. Door de grote en belangrijke keurings- en selectiediensten van de krijgsmacht, ging zij op het gebied van selectie, testontwikkeling en psychiatrisch-medische keuringen samenwerken met psychologen. Hierdoor nam niet alleen het aantal selectie- en diagnostische tests toe, maar ontstond er ook een sterke professionalisering van het beleid en werden de psychologische principes van testonderzoek meer constructiever en kritischer.

    In 1947 werd de Educational Testing Service (ETS) opgericht, met als doel tegemoet te komen aan de behoeften van het Amerikaanse onderwijs- en opleidingsveld op het gebied van de toelating tot en evaluatie van het onderwijs. Zeer belangrijk hierbij was dat het beleid binnen de ETS niet alleen de focus legde op toegepast onderzoek en testconstructie, maar ook gericht was op fundamenteel psychometrisch onderzoek.

    De communicatie over tests, testonderzoek en de psychometrie verliep via vele wetenschappelijke en vaktijdschriften en (hand)boeken, zowel op inleidend niveau, als op gespecialiseerd niveau. Binnen het terrein van de selectiepsychologie stond, vooral in de jaren na de Tweede Wereldoorlog, de testtheorie centraal. Aanvankelijk werd, onder andere door Thorndike, selectie vooral gezien als toegepaste testpsychologie. Later werd dit, onder andere door Cronbach, meer beschouwd als een beslissingssituatie. Verder zijn veel belangrijke invloeden uitgegaan van het boek Technical recommendations for psychological tests and diagnostic technieques, gepubliceerd in 1954 door een Testcommissie van de APA. Ook het onderwijskundig meten en de schaaltheorie hadden een belangrijke invloed op de testtheorie en de acceptatie van testtheoretische principes.

    Al met al vond er in de Verenigde Staten dus een sterke groei van het aantal tests plaats – waarbij ook de computer een grote rol heeft gehad, wat gepaard ging met grondige bezinning op de theoretische basis.

    Welke ontwikkelingen waren er in Europa, met name Nederland?

    De testontwikkeling in Europa verliep minder snel. Pas vanaf de jaren ‘60/70 begon de ontwikkeling van de testtheorie en –constructie tot bloei te komen. De boeken van o.a. Rasch (1960) en Fischer (1974) en diverse wetenschappelijke en vaktijdschriften hebben hierbij een grote rol gespeeld.

    In Nederland werd de testontwikkeling in de jaren ‘40/50 zeer gekenmerkt – en zelfs beperkt – door de oriëntatie van de psychologie op de intuïtie van de psycholoog, wat een objectieve en kwantitatieve benadering in de weg stond. Stimulering van testgebruik en de algemene ontwikkeling van de Nederlandse psychologie naar het Amerikaanse model werd eind jaren ’50 vooral in gang gezet door psychologen als Kouwer, De Groot, Van de Geer en Van der Giessen. In 1959 werd door het Nederlands Instituut van Psychologen (NIP) een Test Research Commissie (tegenwoordig Commissie Testaangelegenheden Nederland, COTAN) ingesteld. Deze commissie had als doel de communicatie tussen psychologen te verbeteren en het testonderzoek te bevorderen.

    Verder werden tijdens deze periode in Nederland schoolvorderingstests ontwikkeld, welke in Engeland en de VS al zeer veel werden gebruikt. In Nederland deed de testtheorie pas in de jaren ’70 haar intrede bij de beoordeling van school- en opleidingsprestaties. De Groot stelde voor een landelijk centraal instituut voor toetsontwikkeling op te richtten en hierbij het model van de Amerikaanse ETS aan te houden. Dit voorstel werd gerealiseerd in de vorm van de oprichting van het Centraal Instituut voor ToetsOntwikkeling (CITO).

    In 1987 werd het IOPS – Interuniversitair Onderzoeksinstituut voor Psychometrie en Sociometrie opgericht; voor het bundelen van promotieonderzoek

    Access: 
    Public
    Wat zijn de definitie, kenmerken en toepassingen van de test? - Chapter 2

    Wat zijn de definitie, kenmerken en toepassingen van de test? - Chapter 2

    Wat is een test?

    Welke onderdelen bevat een test?

    Een verantwoorde en gepubliceerde test bestaat doorgaans uit drie onderdelen: testmateriaal, testformulieren en een testhandleiding.

    Testmateriaal

    Het testmateriaal is afhankelijk van de soort test. Het testmateriaal bij een schriftelijke intelligentietest zal bijvoorbeeld bestaan uit een boekje met opgaven die opgelost moeten worden. Als de individuele prestaties van een persoon getest moeten worden, kunnen er legpuzzels, tekenpapier of bouwstenen als testmateriaal gebruikt worden. Soms is het geen materiaal in de strikte zin van het woord, zoals een onderwerp voor een vrije discussie.

    Testformulieren

    Testformulieren worden gebruikt om de resultaten van de test op te schrijven om hieruit conclusies of interpretaties te kunnen trekken. Ze kunnen worden ingevuld door de testleider (bij observatietests) of door de geteste persoon zelf (bij vragenlijsten).

    Testhandleiding

    Een testhandleiding geeft aan hoe de test gebruikt dient te worden. Een goede testhandleiding moet aan de volgende vier eisen voldoen:

    1. Een goede testinstructie. Er moet duidelijkheid zijn over de gang van zaken tijdens de test. Dit wordt bereikt door de testprocedure, uitleg, proefopgaven etc.

    2. De verwerkingsprocedure. Dit zijn de instructies over hoe de test (numeriek) gescoord en verwerkt dient te worden. Daarvoor zijn de sleutels van de opgaven nodig: aanwijzingen welke antwoorden (on)juist zijn of (contra)indicatief voor een bepaald verschijnsel en hoe deze antwoorden van scores voorzien moeten worden.

    3. Normtabellen. Hiermee worden de scores vergeleken met die van de representatieve normgroep. Dat is een voorwaarde voor nadere interpretatie en evaluatie van de testprestatie.

    4. De wetenschappelijke kwaliteit van de test. Hierbij gaat het om de betrouwbaarheid van de test, wat de test betekent en wat het voorspelt.

    Wat is een eerste omschrijving van een test?

    Bij een test gaat het om een systematisch onderzoek met een bepaald doel. Het doel kan zijn het voorspellen, classificeren of beschrijven van een individu in vergelijking met andere mensen.

    Welke kenmerken heeft een test waardoor het onderscheiden kan worden van het voorwetenschappelijk oordeel?

    Een psychologische test is een systematisch onderzoek van gedrag met behulp van speciaal geselecteerde vragen of opgaven, met de bedoeling inzicht te krijgen in een kenmerk van de onderzochte in vergelijking met anderen. Men heeft niet altijd een test nodig om zich een oordeel te vormen over menselijk gedrag. Een psychologische test gebruiken is pas dan gerechtvaardigd als het een juister beeld oplevert dan het voorwetenschappelijk oordeel, of als het een verbetering of een aanvulling hierop kan betekenen en als de kosten of ethische bezwaren niet onoverkomelijk zijn. Het gebruiken van een psychologische test heeft zes voordelen (kenmerken) boven het voorwetenschappelijk oordeel:

    1. Efficiëntie.
    2. Standaardisatie.
    3. Normering van de testresultaten.
    4. Het principe van objectiviteit.
    5. De eis van betrouwbaarheid.
    6. Validiteit en de betekenis van een test.

    Efficiëntie

    In het dagelijks leven zijn veel situaties die een oordeel kunnen verschaffen over bijvoorbeeld de intelligentie van een persoon. Het probleem is echter dat men moet wachten tot deze situaties zich voordoen. Daarnaast is intelligentie in het alledaagse contact tussen mensen een ‘bijproduct’ en komt daarmee niet tot z'n recht (men is er niet zo mee bezig). Intelligentietests daarentegen zijn speciaal samengesteld, niet afhankelijk van toeval en storende invloeden kunnen geweerd worden binnen de testsituatie.

    Standaardisatie

    Bij een psychologische testafname streeft men ernaar de test op precies dezelfde manier, onder precies dezelfde condities bij iedereen af te nemen. Dit is het standaardiseren van de situatie en is nodig voor de vergelijkbaarheid van de resultaten. Een test kan meer of minder beantwoorden aan de eis van standaardisatie. Als er geen standaardisatie aanwezig is er geen sprake van een test. Standaardisatie maakt een test betrouwbaar en vergelijkbaar. In de praktijk is de inhoud en de situatie steeds verschillend.

    Normering

    Om de resultaten van personen te vergelijken, is het nodig om te weten hoe groot de afstand tussen de resultaten ongeveer is. Dat moet zo exact mogelijk worden geschat, want door exactheid kan men kleinere verschillen vaststellen. In de praktijk kunnen we een schatting maken van wie intelligenter is dan wie, maar de vraag is hoeveel intelligenter. Bij grote verschillen maakt zo'n schatting niet zoveel uit, maar juist bij kleine verschillen is het nodig een exact instrument te hebben. De eenvoudigste vorm van normering is het vaststellen van een rangorde van zeer goede tot zeer slechte prestaties. De normen worden vastgesteld op een groep proefpersonen (een steekproef).

    Vaak kunnen de afstanden tussen testscores in de normering worden opgenomen; dat kan weergegeven worden in een discrete verdeling. Deze discrete verdeling kan benaderd worden met een normaalverdeling, maar eerst moet worden vastgesteld of dat wel redelijk is (met statistische toetsen, zoals de Kolmogorov-Smirnov-toets). Is het redelijk, dan kan men een geschikt gemiddelde en een geschikte standaarddeviatie kiezen en de schaal van de testscores omzetten naar die onder de normaalverdeling met het gekozen gemiddelde en spreiding. Daarmee verandert de schaal, maar houden de personen dezelfde rangorde. Het omzetten naar een normaalverdeling wordt meestal gedaan als de steekproef uit een normaal verdeelde populatie komt en men steekproeffouten wil ‘gladstrijken’. Nieuwe verdelingskenmerken (gemiddelde en standaarddeviatie) kiezen doet men om een ‘handige’ schaal te krijgen (bijvoorbeeld intelligentie heeft een gemiddelde van 100 en de standaarddeviatie is 15).

    Behalve dat normering nuttig is voor het interpreteren van resultaten, is het een noodzakelijke voorwaarde voor het gebruik van een test. Soms kan men wel een test gebruiken die niet genormeerd is, bijvoorbeeld in experimenteel onderzoek. Maar eigenlijk heeft men bij alle tests normen nodig, dus ook bij observatietests en projectieve technieken.

    Objectiviteit

    Met objectiviteit wordt bedoeld dat wie het onderzoek ook doet, het resultaat steeds hetzelfde moet zijn, en dat openheid, reproduceerbaarheid van de test en evaluatie mogelijk zijn. Als men twee personen onafhankelijk van elkaar dezelfde test laat doen onder dezelfde omstandigheden, dan kan men de resultaten met elkaar vergelijken met behulp van bijvoorbeeld correlatie-onderzoek en kan men de procedure op haar objectiviteit toetsen. Dit wordt interbeoordelaarsbetrouwbaarheid genoemd. De interbeoordelaarsbetrouwbaarheid kan uitgedrukt worden in een statische maat die afhankelijk is van het soort gegevens dat beschikbaar is:

    1. Rangcorrelatie (als beide beoordelaars een rangorde produceren).
    2. Product-momentcorrelatie (als de beoordelingen niet alleen een rangorde vormen, maar de afstanden tussen de plaatsen op de rangorde ook betekenis hebben).
    3. Cohen’s kappa (als de personen ingedeeld worden in categorieën, is er geen rangorde of afstand, maar kan de mate waarin de beoordelaars tot dezelfde indeling komen berekend worden).

    Het berekenen van Cohen’s Kappa gaat als volgt. Bereken de kans dat persoon A en persoon B het bij een aselect gekozen proefpersoon met elkaar eens zijn: P0. Dan bekijk je wat de statistische onafhankelijkheid is; dit is de overeenstemming die er zou zijn als de beoordelaars hun eigen frequentieverdeling aanhouden. Makkelijker gezegd, dit is de toevalskans: Pt. Dan bereken je Cohens Kappa met de volgende formule:

    (P0 = overeenstemmingskans, Pt = toevalskans).

    Het is mogelijk bij observatietests en projectietests een verantwoorde mate van objectiviteit te bereiken door:

    • Het waarneembare gedrag te beschrijven en niet te interpreteren. Dit verhoogt de objectiviteit en verlaagt de subjectiviteit. Observatie- en projectietests worden vaak niet als volwaardige tests gebruikt, men gebruikt hen voor het verkrijgen van ideeën en voor het creëren van hypothesen.
    • Registratie in plaats van evaluatie van het gedrag. Door inbreng van de verwerker worden de resultaten subjectiever.
    • Een duidelijk voorgeschreven verwerkingsprocedure.
    • Objectiviteit als de grondhouding van de wetenschapsbeoefenaar. Dus geen invloeden van buitenaf, van bijvoorbeeld de maatschappij, de organisatie, de onderzoeker etc.

    Betrouwbaarheid

    Als we een meting nog eens doen op dezelfde manier, dan moet de uitkomst gelijk zijn aan de uitkomst van de eerste meting. Dit is beter mogelijk bij een lengtemeting dan bij een intelligentiemeting. Eigenlijk is het niet mogelijk om twee onafhankelijke metingen te verkrijgen in de psychologie. Metingen moeten onder dezelfde condities plaatsvinden (standaardisatie), maar toevalsinvloeden zijn niet door standaardisatie te ondervangen. Betrouwbaarheid is wenselijk en zelfs noodzakelijk omdat meetresultaten herhaalbaar moeten kunnen zijn; het moet niets of nauwelijks iets uitmaken wanneer iemand getest wordt.

    Validiteit

    Een goede test heeft een vaststaande psychologische betekenis. Dat wil zeggen dat de betekenis aan de praktijk getoetst is. Er is dus geen plaats voor fenomenologische beschrijvingen en alternatieve verklaringen. Valide testen kunnen niet zomaar overal toegepast worden; het moet altijd gebaseerd zijn op empirisch onderzoek waarin de bedoelde samenhang is aangetoond.

    Hoe kunnen eigenschappen gemeten worden door middel van tests?

    Welke meetniveaus en toegestane operaties zijn er?

    In de praktijk gebruikt men de termen ‘testen’ en ‘meten’ door elkaar. Door middel van tests kunnen we allerlei eigenschappen meten. Van ‘meten’ is sprake zodra getallen volgens een consistente procedure aan objecten worden toegekend. Dit leidt tot de vier bekende meetniveaus. De vier meetschalen, van laag naar hoog, zijn de nominale schaal, ordinale schaal, intervalschaal en de verhoudingsschaal.

    De nominale schaal

    Op deze schaal gebruikt men getallen om categorieën te onderscheiden en objecten in te delen. Er is geen sprake van een rangorde, het gaat slechts om de verschillende getallen. Op de nominale schaal is geen enkele rekenkundige bewerking mogelijk. Er zijn wel berekeningen die aangepast zijn aan het nominale niveau (bijvoorbeeld Cohen’s kappa).

    De ordinale schaal

    Bij deze schaal is er sprake van een rangorde, dus van meer of minder. Getallen worden gebruikt om categorieën of objecten te ordenen. Ook hier mogen niet alle rekenkundige bewerkingen uitgevoerd worden, maar het is wel mogelijk om een rangorde met een andere rangorde te vergelijken: de rangcorrelatie.

    De intervalschaal

    Bij deze schaal is er niet alleen een rangorde van minder of meer, maar ook de afstanden tussen de verschillende posities zijn belangrijk en hebben betekenis. De afstanden tussen de verschillende posities zijn trouwens gelijk. Een intervalschaal heeft geen absoluut nulpunt, maar een arbitrair nulpunt (zoals bijvoorbeeld temperatuur); de verhoudingen tussen de afstanden blijven gelijk als je het nulpunt verschuift. Er zijn wiskundige berekeningen toegestaan; lineaire transformaties van het type Y = a + bX (ondanks dat het nulpunt met factor a is verschoven en de eenheid met factor b is vermenigvuldigd, blijven de verhoudingen gelijk).

    Men gaat er vaak te makkelijk vanuit dat testscores op intervalniveau worden gemeten, maar dat wordt vaak niet empirisch ondersteund. Maar het is wel handig om intervaleigenschappen te veronderstellen, omdat dan rekenkundige bewerkingen kunnen worden uitgevoerd. Een eenmaal gekozen schaal moet verder gehandhaafd blijven worden om verwarring te voorkomen.

    De verhoudingsschaal (ratioschaal)

    Alle rekenkundige bewerkingen zijn hier toegestaan omdat er sprake is van een gelijke afstand tussen de verschillende posities op de schaal en van een absoluut nulpunt. Voorbeelden hiervan zijn lengte en gewicht.

    De genoemde schalen zijn de hoofdsoorten; ze geven aan welke numerieke transformaties zijn toegestaan – namelijk diegene die de betekenis van de vergelijking van meetwaarden behouden. Binnen de psychologie zijn er weinig metingen op een verhoudingsschaal; hoogstens op een intervalschaal en meestal is de ordinale schaal voldoende. Er zijn ook verschillende tussensoorten mogelijk, zoals de verschilschaal, waarop transformaties van het type Y = a + X zijn toegestaan: scores op de X-schaal mogen met constante a worden vermeerderd of verminderd (negatieve a).

    Welke opvattingen zijn er over meten?

    In de psychologie was lang het probleem dat men eigenschappen niet rechtstreeks kan meten. In de 19e eeuw stond de fysica model voor het meten in de psychologie; het ideaal was psychologische eigenschappen meten zoals bijvoorbeeld het begrip ‘lengte’ wordt gemeten. Maar dit ideaal was te hoog gegrepen en ging er ook aan voorbij dat ook veel fysische eigenschappen (net als psychologische) niet direct observeerbaar zijn. In de fysica loste men dat op door middels experimenten de relaties tussen objecten te verhelderen, zodat men vervolgens voor die eigenschap een bruikbare schaal kon kiezen. Eenheden zoals Becquerel en Ohm zijn niet direct observeerbaar (radioactiviteit en weerstand), maar schalen die het resultaat zijn van theorievorming en experimenten. In de psychologie zijn theorieën en begrippen altijd abstracter en diffuser gedefinieerd, en in experimenten is het gedrag van proefpersonen minder goed te manipuleren. Hierdoor kunnen hooguit zwakke of matige verbanden worden gevonden in experimenten, die vaak ook nog eens niet goed repliceerbaar zijn. Dus kunnen er hooguit arbitraire schalen worden gevonden.

    De oplossing van Stevens hiervoor is het operationalisme: de meting als uitkomst van de procedure. Hierdoor wordt de test gelijkgesteld aan de uitkomst en is bijvoorbeeld intelligentie datgene ‘wat de test meet’. Een testconstructie is dan pure technologie en staat los van de psychologische theorievorming. Er was hierdoor minder aandacht voor psychologische metingen; theorie- en kennisvorming bestonden nog nauwelijks. Operationalisme werd omarmd omdat men hiermee verlost was van het lastige problemen van ‘meten volgens het fysische model’. Maar dat is in feite ontkenning van het meetprobleem. Testontwikkeling werd zo een technologisch recept zonder wetenschappelijke bijdrage. Dat is onjuist: het meten van psychologische eigenschappen en het onderzoek naar de betekenis van testscores leveren juist een wetenschappelijke bijdrage.

    De wetenschap kan niet zonder betrouwbare en valide metingen. Ondanks de kritiek op het operationalisme, is de schaalindeling van Stevens erg bruikbaar. Het wijst erop dat men weliswaar alles met getallen kan doen, maar dat het de betekenis van getallen is, die bepaalt welke bewerkingen erop zijn toegestaan. Bovendien dwingt het ertoe goed na te denken over welke bewerkingen en conclusies wel of niet met de meetwaarden te verantwoorden zijn.

    Wat is de gangbare procedure voor het meten van psychologische eigenschappen?

    Behalve dat men bij het operationalisme testen gelijk stelt aan meten, is het ook zo dat men het scoren van tests gelijk stelt aan het meten. In feite gaat het hier echter om ‘tellen’, meten wordt het pas als men conclusies trekt over een bepaalde eigenschap op basis van het aantal tellingen.

    Er zijn vier stappen die nodig zijn om te komen tot een meting:

    1. De identificatie van de te meten eigenschap.
    2. Operationalisering van de eigenschap.
    3. Onderzoek en kwantificering van reacties.
    4. Terugkoppeling naar de theorie.

    Identificatie van de te meten eigenschap

    Daarbij moet men vaststellen wat de achterliggende theorie is over de te meten eigenschap en alternatieve theorieën in kaart brengen. Zonder onderbouwing is zinvolle meting onmogelijk – dan wordt de eigenschap namelijk datgene wat de test meet. Het heeft geen validering of voorspellende waarde. Er zijn een aantal problemen bij het identificeren van de eigenschap en de keuze van de theorie:

    • Er is te weinig theorievorming over veel psychologische eigenschappen.

    • Eigenschappen worden vaak beschreven in algemene en abstracte termen, waardoor het lastig is dit gedrag te herkennen.

    • Sommige psychologische eigenschappen zijn niet altijd waarneembaar in gedrag.

    • Voor sommige eigenschappen is het lastig een test te bedenken waarmee het bedoelde gedrag kan worden opgeroepen.

    • Het grootste probleem zijn eigenschappen met een onduidelijke of dubieuze theoretische status. Veel eigenschappen komen op en verdwijnen weer, zonder empirische onderbouwing.

    Operationalisering van de eigenschap (‘operationalisering’ is anders dan het ‘operationalisme’)

    Operationalisering is het specificeren van de operaties die nodig zijn om de eigenschap te meten. Psychologische eigenschappen zijn echter hypothetische begrippen en dus niet direct waarneembaar, waardoor de operaties het niet rechtstreeks kunnen meten. Er is dus nog een extra stap nodig van de meetoperaties naar de eigenschap zelf. Er zijn twee stappen nodig om te komen tot een operationalisatie:

    1. Het definiëren van de gedragingen die kenmerkend zijn voor de bedoelde eigenschap.

    2. Stimuli (items) afstemmen aan deze gedragingen, zodat ze die reacties uitlokken die een indicatie geven van de bedoelde eigenschap.

    Onderzoek en kwantificering van reacties

    De kwalitatief gegeven reacties (verbaal of gedrag) worden geregistreerd en moeten gekwantificeerd worden (omgezet naar getallen). Bij een item heeft één antwoord vaak een hoger niveau op een achterliggende eigenschap, deze krijgt een hogere numerieke waarde (score).

    Terugkoppeling naar de theorie

    De uitkomsten van statistische analyse hebben gevolgen voor de theorie over de gemeten uitkomst; het kan aanvullende ondersteuning geven voor deze theorie. Zo’n theorie bestaat meestal uit een nomologisch netwerk: een theorie ter verklaring van waarneembare verschijnselen, waarbinnen de gemeten eigenschap een plaats heeft.

    Deze procedure sluit aan bij de statistische methoden om tests te construeren en meeteigenschappen vast te stellen.

    1. Klassieke testtheorie: nadruk op betrouwbaarheid.

    2. Item-responstheorie: nadruk op hoe de testprestatie tot stand komt.

    3. Representational measurement: er is alleen sprake van een meting als de formele relaties tussen de testscores overeenkomen met de relaties die in de empirie bestaan.

    Voorbeeld: als Jan een hogere testscore heeft dan Piet op een test die pretendeert ruimtelijk inzicht te meten, dan moet er dus een aantoonbare relatie bestaan tussen het ruimtelijk inzicht van Jan en Piet, dat zo duidelijk is dat je kunt concluderen dat Jan een hoger niveau heeft dan Piet. Helaas zijn veel psychologische eigenschappen niet waarneembaar; ruimtelijk inzicht is niet direct waarneembaar, behalve met een test. Representational measurement is dus geen geschikte methode voor het meten van psychologische (hypothetische) eigenschappen. Toch heeft het wel tot belangrijke inzichten geleid over het meten in de psychologie.

    Wat is de definitie van een test?

    Een test wordt als volgt gedefinieerd: 'Een test is een systematische classificatie- of meetprocedure, waarbij het mogelijk wordt een uitspraak te doen over één of meer empirisch-theoretisch gefundeerde eigenschappen van de onderzochte of over specifiek niet-testgedrag, door uit te gaan van een objectieve verwerking van reacties van hem/haar, in vergelijking tot die van anderen, op een aantal gestandaardiseerde, zorgvuldig gekozen stimuli'. Een test is dus een systematische meetprocedure om uitspraken te doen over een individu, die reageert op gestandaardiseerde stimuli in vergelijking met de reactie van anderen.

    Welke toepassingsmogelijkheden zijn er?

    Er zijn drie toepassingsmogelijkheden van de psychologische test, namelijk (1) de beoordeling van individuen, (2) de beoordeling van groepen en (3) de beoordeling van situaties en methoden.

    Beoordeling van individuen

    De beoordeling van individuen kan op zes verschillende manieren, afhankelijk van het doel van het onderzoek:

    1. Criterium

    Als er sprake is van een criterium waaraan het individu wel of niet kan voldoen. De test correleert met het criterium. Bijvoorbeeld wel of niet een bepaalde opleiding volgen.

    2. Meerdere criteria

    Als er een keuze gemaakt moet worden uit meerdere criteria die verschillen qua niveau en/of kwaliteit. Bijvoorbeeld het kiezen van een studierichting. De test moet niet alleen correleren met het criterium, differentiatie moet dan ook mogelijk zijn.

    3. Onderlinge verhoudingen van testscores bij één persoon (ipsatieve scores)

    Als men iemands zwakke en sterke punten en zijn interesses wil weten, is de onderlinge verhouding van de verschillende scores in een testserie belangrijk, niet hun hoogte. Met ipsatieve scores wordt bedoeld dat de testscores van één persoon met elkaar vergeleken worden en niet met een externe standaard.

    4. Ontwikkelingen van een persoon

    Als men de ontwikkeling van een persoon wil volgen wordt hetzelfde onderzoek met hetzelfde individu herhaald op een ander tijdstip. Het doel is om erachter te komen of de persoon zich op een bepaald gebied ontwikkeld heeft. Bijvoorbeeld een longitudinaal onderzoek. Het gaat hier ook om interne vergelijking.

    5. Beschrijving van het onderzochte

    Als er een beschrijving van de onderzochte gegeven moet worden, bijvoorbeeld in de hypothesevormende fase van een individueel onderzoek. Er zijn verschillende mogelijke vormen van beschrijvingen:

    • Een intern rapport: de psycholoog geeft een subjectieve beschrijving van het gedrag van de onderzochte of een beschrijving van de testprestaties.
    • Een extern rapport: een verklarende beschrijving aan bijvoorbeeld de ouders van de onderzochte, het kan ook pedagogische adviezen en psychologische uitspraken bevatten.

    6. Counseling

    Counseling is een niet-directieve vorm van therapie. Het testonderzoek wordt gebruikt als startpunt (stand van zaken) en van daaruit gaat de hulpverlener samen met de cliënt de problemen van de cliënt analyseren, bewust maken en herformuleren.

    Hoe kunnen groepen beoordeeld worden?

    Bij de beoordeling van groepen worden de verschillen tussen de groepen onderzocht. Het gaat hier voornamelijk om vergelijkend onderzoek. Men is geïnteresseerd in de grootte van het verschil van een bepaalde eigenschap tussen groepen. Dit is vaak een voorstadium voor het individuele onderzoek. Eigenlijk is individueel onderzoek altijd gebaseerd op onderzoek tussen groepen (vanwege de normen).

    Hoe kan de invloed van situaties en methoden beoordeeld worden?

    Met methoden bedoelt men bijvoorbeeld behandeling, opleiding en beïnvloeding en met situaties bijvoorbeeld stress of participatief leiderschap. Een manier is om bij groepen dezelfde methoden in verschillende situaties te gebruiken en dan te kijken naar de resultaten. Of men gebruikt in de dezelfde situatie andere methoden. Het gaat dan niet zozeer om groepsverschillen maar om de situaties en de methoden. Voorbeeld: een schoolvorderingstoets is zowel een evaluatie van het kennisniveau van individuele leerlingen als van het functioneren van de docent.

    Averechtse diagnostiek (Hofstee, 1969) is dat als een test een bepaalde correlatie heeft met een criterium, men dit kan gebruiken om voorspellingen te doen over de kansen op criteriumsucces, maar deze correlatie zegt ook heel veel over het criterium zelf.

    Access: 
    Public
    Welke indelingen, onderscheidingen en begrippen zijn er omtrent testtheorie? - Chapter 3

    Welke indelingen, onderscheidingen en begrippen zijn er omtrent testtheorie? - Chapter 3

    De testindeling die in het volgende hoofdstuk gemaakt is, beoogt twee doelen te bereiken:

    1. De lezer een systematisch overzicht geven van beschikbare tests en testmethodieken.

    2. Veelgebruikte begrippen op een samenhangende wijze introduceren en behandelen.

    Tests kunnen op twee verschillende manieren ingedeeld worden. De indeling naar testgedrag is de belangrijkste indeling. De tweede indeling is op basis van de verschillende manieren van testinstructie en -afname. Er is ook nog een derde indeling mogelijk; indelen op basis van het soort testvragen waar de test uit bestaat. Hier wordt in hoofdstuk 4 verder op ingegaan.

    Hoe kunnen tests ingedeeld worden op basis van testgedrag?

    Bijna alle overzichten gaan uit van de indeling van tests naar testgedrag. Er zijn echter ook andere indelingen mogelijk, zo stelt Visser een indeling voor op basis van het gebruiksdoel of de meetpretentie. Een groot bezwaar tegen dit voorstel is dat in verschillende gebruikssituaties er geheel verschillende meetpretenties (doelen) aan de orde zijn. En bovendien is dit niet de meest gangbare en internationale indeling. Indeling op basis van gedrag heeft echter ook nadelen; het aangeven in welke categorie een psychologische eigenschap thuishoort is niet altijd ondubbelzinnig.

    Bij het uitgaan van testgedrag wordt er onderscheid gemaakt tussen tests voor prestatieniveau en tests voor gedragswijze. Bij de eerste gaat het om de maximale prestatie van de onderzochte persoon, het is duidelijk wat goed en wat fout is. Bij de laatste is niet van tevoren bekend wat goed en wat fout is, de maximale prestatie wordt niet verkregen door de prestatie op de test; het is belangrijk hoe iemand iets doet en op welke wijze de prestatie of reactie plaatsvindt.

    Welk onderscheid is er te maken bij tests voor prestatieniveau?

     

    Enkelvoudige algemene niveautestsVeelvoudige algemene niveautestsSpeciale niveautestsVorderingtests 
    Individuele niveautestsTestbatterijen voor intteligentiefactorenTests voor speciale intelligentiefactoren'Achievement tests'
    Individuele ontwikkelingtests voor volwassenenTestbatterijen voor geschikthedenTestbatterijen voor speciale geschiktheden'Proficiency' tests
    Algemene collectieve intelligentietests Tests voor speciale niet-intelligentiefactoren 

    Bij de tests voor prestatieniveau zijn vier tests te onderscheiden, namelijk:

    1. Enkelvoudige algemene niveautests.
    2. Veelvoudige algemene niveautests.
    3. Speciale niveautests.
    4. Vorderingstests.

    1. Enkelvoudige algemene niveautests

    Enkelvoudige algemene niveautests zijn de grootste en belangrijkste tests. Bij deze tests gaat het om een niveaubepaling van de intelligentie; het gaat dus niet om de verschillende intelligentiegebieden. Er zijn drie enkelvoudige algemene niveautests. De eerste twee zijn individuele tests en de derde is een groepstest:

    1. Individuele intelligentietests voor volwassenen: Het intelligentieniveau wordt vastgesteld nadat intelligentie min of meer als volgroeid mag worden beschouwd (vanaf 15 à 17 jaar). Voorbeelden zijn de WAIS, GIT en Terman-Merrill. Deze tests hebben intelligentienormen voor alle leeftijd, inclusief de ouderdom.

    2. Individuele ontwikkelingstests voor kinderen: Het doel van deze tests is het meten van de intelligentie tijdens de ontwikkeling. De intelligentiescore van het kind wordt vergeleken met de testprestaties van leeftijdsgenoten. Soms wordt het vergeleken met de chronologische leeftijd om te bepalen hoe snel of hoe langzaam de intelligentie-ontwikkeling heeft plaatsgevonden. Voorbeelden zijn de WISC-R en Rakit.

    3. Algemene collectieve intelligentietests: Deze tests gebeuren vaak schriftelijk en groepsgewijs. Ze zijn breed en gevarieerd samengesteld. Er zijn collectieve intelligentietests voor volwassenen en voor kinderen, en collectieve non-verbale intelligentietests. Deze laatste hebben meestal niet een maximale brede samenstelling, omdat er geen verbaal materiaal gebruikt wordt. Ze zijn nuttig bij het testen van niet-geletterden en bij populaties met een verschillende culturele en taalkundige achtergrond.

    2. Veelvoudige algemene niveautests

    Bij veelvoudige algemene niveautests is differentiatie wel belangrijk. Een verschil met bovenstaande tests is dat deze tests afzonderlijk gezien voldoende betrouwbaar zijn en onderling voldoende afhankelijk zijn. Er zijn twee categorieën van veelvoudige algemene niveautests:

    1. Testbatterijen voor intelligentiefactoren: De verschillende items in een test worden samengevoegd tot enkele factoren. De meest bekende factoren zijn die van Thurnstone (Verbal, Number, Spatial, Word fluency, Memory, Reasoning). De PMA, een testbatterij samengesteld door Thurstone, probeert deze factoren 'zuiver' te meten. Een voorbeeld in Nederland is de testserie voor 'hoger niveau' van Drenth. Een alternatief voor de factoren van Thurnstone is het factoranalytische systeem van Guilford. Hij leidde uit de praktijk een aantal factoren af en noemde het de 'structure of intellect theory'.

    2. Testbatterijen voor geschiktheid oftewel 'multiple aptitude' tests: Het gaat om het meten van vermogens waarmee iemand zich voor een maatschappelijke taak of schoolopleidingseisen kan bekwamen (geschiktheden). Eigenlijk gaat het om leergeschiktheid. Leerfactoren kunnen soms hetzelfde, maar ook iets heel anders zijn dan intelligentiefactoren, zoals bijvoorbeeld motorische vaardigheden. Voorbeelden van dergelijke tests zijn de leerpotentiaaltests, DAT (Differential Aptitude Testbattery) en GATB (General Aptitude Test Battery).

    3. Speciale niveautests

    Speciale niveautests richten zich op een bepaald segment van begaafdheid, bijvoorbeeld een intelligentie-aspect, geschiktheid of een vaardigheid. Ze vallen vaak niet onder intelligentie maar ze zijn wel belangrijk. Er zijn drie categorieën van speciale niveautests:

    1. Tests voor speciale intelligentiefactoren: Dit kunnen bijvoorbeeld tests zijn die zich alleen richten op ruimtelijk inzicht, woordkennis etc. Op basis van de theorie van Guilford komen we tot drie gebieden. De eerste is die van het divergent denken (creativiteit). De onderzochte moet oplossingen bedenken voor een probleem waarvoor er vele oplossingen mogelijk zijn. De antwoorden worden aan de hand van drie criteria beoordeeld; hoeveelheid oplossingen, aantal verschillende principes en originaliteit. Het tweede gebied is die van de behavorial-dimensie (sociale intelligentie). Uit onderzoek blijkt dat het moeilijk te onderscheiden is van andere intelligentiefactoren. Het laatste gebied is kritisch denken. Ook dit is moeilijk te onderscheiden. Eigenlijk is de vraag of iets wel of niet onder intelligentie valt afhankelijk van de definitie die je aanhoudt.

    2. Tests voor speciale geschiktheden oftewel 'special aptitude tests': Er zijn twee soorten, de eerste soort zijn tests voor leergeschiktheden die zich richten op leercondities bijvoorbeeld geheugentests, tempotests en concentratietests. Bijvoorbeeld de Bourdon-Wiersma test, Grünbaumtest en het onderdeel ‘snelheid en nauwkeurigheid uit de DAT. Ook tests die gericht zijn op specifieke leergeschiktheden vallen hieronder. De tweede soort zijn tests voor werkgeschiktheid die zich richten op typische vaardigheden die nodig zijn voor maatschappelijke functies, bijvoorbeeld geschiktheid als piloot of chauffeur.

    3. Tests voor speciale niet-intelligentiefactoren: Deze tests richten zich op vaardigheden of capaciteiten die belangrijk zijn voor een maatschappelijke functie of klinische diagnostiek. Er zijn drie soorten, namelijk (1) motoriektests (tests voor reactiesnelheden, lichaamsbeheersing en coördinatie; het gaat hierbij om de beeldvorming van de motoriek), (2) artistieke tests (men probeert een esthetisch oordeel te geven) en (3) sensorische tests (waarbij het gaat om gehoorscherpte, diepte zien, etc., het gaat hierbij om de beeldvorming van sensorische vaardigheden).

    4. Vorderingstests

    De cruciale vraag bij een vorderingstest is of iemand het doel van een opleiding heeft bereikt. Let wel: vorderingstests zijn niet hetzelfde als kennistests, want het doel van een opleiding is vaak niet alleen het verkrijgen van kennis. Er zijn twee soorten vorderingstests:

    1. Achievement test: dit is een kennistest die meer specifiek gericht is op schoolvorderingen. Bijvoorbeeld de CITO-toets.
    2. Proficiency test: dit is een vaardigheidstest die meer algemeen gericht is op vaardigheden buiten de cognitieve sfeer en kennis.

    In Nederland lijken proefwerk en schriftelijk examen het meest op de kennistest. Er is een vloeiende overgang tussen de kennistest en de vaardigheidstest. Strikt genomen zijn ‘begrijpend lezen’, ‘begrijpend luisteren’ en ‘rekenvaardigheid’ ook vaardigheidstests.

    Welk onderscheid is er te maken bij tests voor gedragswijze?

     

    ObservatiesSomato-fysiologische methodenZelfbeoordelingenKwalitatieve prestatietests
    Individuele observatietestsMorfologisch onderzoekInteressetests

    Niveautests voor gedragswijze:

    • Experimentele tests
    • Motoriektests
    • Intelligentietests
    • Karkatertests
    • Cognitieve/ perceptuele stijlen
    GroepsobservatiesFysiologisch onderzoekWaarde-attitudestests 
      Biologische vrangelijst

    Projectietests:

    • Perceptie-tests
    • Intrepretatie-tests
    • Expressie-tests
    • Constructie-tests
    • Associatie-tests
    • Keuze-tests
      Persoonlijkheids-vragen 

    Het prestatievermogen bepalen is makkelijker dan het bepalen van gedragswijze. Er zijn drie problemen bij het bepalen van gedragswijze:

    1. Minder generaliseerbaarheid: Metingen van prestatieniveau zijn eenvoudig generaliseerbaar naar het praktische functioneren, maar gedrag in een testsituatie is niet altijd hetzelfde als gedrag in het dagelijks leven.

    2. Geen objectief criterium: Er is geen objectief criterium waarmee testprestaties kunnen worden vergeleken, dus er is sprake van weinig objectiviteit en betrouwbaarheid bij het vergelijken van testprestaties.

    3. Minder stabiliteit van persoonlijkheidstrekken: Persoonlijkheidstrekken zijn vaak minder stabiel en kunnen per situatie verschillen en hebben een minder gelijkmatige invloed op gedrag.

    Maar onderzoek naar persoonlijkheid is praktisch en psychologisch wel van belang en er zijn veel testen om de persoonlijkheid te meten. Er zijn vier verschillende test voor gedragswijze, die zullen hieronder worden besproken, namelijk (1) observatietests, (2) somato-fysiologische tests, (3) zelfbeoordelingen en (4) kwalitatieve prestatietests.

    1. Observatietests

    In vergelijking met andere tests voor gedragswijze is een observatietest een indirecte test omdat het om observaties en interpretaties van de psycholoog gaat. Er zijn twee soorten observatietests:

    1. Individuele observatietests: Een persoon wordt geobserveerd. Er wordt gelet op werkgedrag, houding, mimiek, uiterlijk gedrag en sociaal contact. De observator kan neutraal of geheel betrokken zijn. Meestal weet de onderzochte dat hij/zij geobserveerd wordt. Bij het gebruik van een one-way screen hoeft dat niet het geval te zijn.

    2. Groepsobservatietests: Een groep mensen dat gezamenlijk aan een opdracht bezig is, wordt geobserveerd. Dit soort tests komen voor in zogenaamde ‘assessment centers’ voor de selectie van managers. Een andere vorm is een vorm waarbij deelnemers elkaar beoordelen en de psycholoog de beoordelingen verder verwerkt. Dit noemt men ‘peer rating’ of ‘buddy rating’. Een voorbeeld is een sociogram: ieder groepslid moet aangeven wie sympathiek is, wie leider is etc. Op basis van deze keuzes wordt een patroon van relaties in de interacties zichtbaar.

    2. Somato-fysiologische methoden

    Men gaat er vanuit dat er een verband is tussen fysieke/fysiologische aspecten en gedragskenmerken. Door middel van metingen van lichamelijke kenmerken of processen probeert men uitspraken te doen over de psychologische kwaliteiten van de onderzochte. Er zijn twee soorten methoden.

    1. Morfologisch onderzoek: Met behulp van somatische kenmerken (hele lichaam, hoofd of gezicht) probeert men iets te zeggen over persoonlijkheidskenmerken. De validiteit is erg laag.

    2. Fysiologisch onderzoek: Voorbeelden van fysiologisch onderzoek zijn: biochemische indices, elektro-encefalogram (EEG), elektrocardiogram, bloeddruk en bloedvolume, oogbewegingen, oogposities en pupildiameter, elektrodermale verschijnselen. Deze fysiologische maten blijken een verband te hebben met psychologische variabelen die belangrijk zijn voor het persoonlijkheidsonderzoek. Sommige verbanden zijn empirisch vastgesteld, maar onverklaard. Soms zijn er theoretische verklaringen gegeven. Ontwikkelingen hierin worden steeds belangrijker voor gedragsdiagnostiek.

    3. Zelfbeoordelingen

    Zelfbeoordelingen worden meestal afgenomen in de vorm van vragenlijsten. Ze zijn lang gewantrouwd omdat ze niet echt objectief zouden zijn. Een andere vorm is via empirisch onderzoek, er wordt dan gekeken of er een bepaald patroon is in de wijze van beantwoorden. Op basis daarvan kan men een psychologische interpretatie geven aan elke vraag. Deze methode levert meer valide conclusies op. Uit theoretische onderzoeken uit praktijkervaring blijkt de zelfbeoordeling toch een waardevolle methode te zijn. Er zijn vier soorten zelfbeoordelingen:

    1. Interessetests: Deze tests hebben betrekking op interesses en kunnen gebruikt worden bij het bepalen van school- of beroepskeuzes.

    2. Waarde- en attitudetests: Deze tests onderzoeken waarden en attitudes (houdingen). Bijvoorbeeld de California-F-Scale geeft aan in hoeverre iemand dogmatisch, conservatief en bevooroordeeld staat tegenover de politiek, cultuur en sociale factoren. Of de Schaal voor Interpersoonlijke Waarden, die meet zes waarden, namelijk sociale steun, erkenning, altruïsme, conformiteit, onafhankelijkheid en leiderschap.

    3. Biografische vragenlijsten: ​​Dit zijn systematische schriftelijke anamneses, oftewel vragenlijsten over biografische gegevens. De te voorspellen criteria zijn vaak specifiek, en het aantal biografische gegevens is groot en complex. Daarom wordt hiervoor meestal een specifieke vragenlijst gemaakt.

    4. Persoonlijkheidsvragenlijsten: Het gaat hier om persoonlijkheidstrekken, zoals neuroticisme, extraversie enzovoort. De proefpersoon krijgt eenvoudige vragen die met deze persoonlijkheidstrekken samenhangen. Uitgaande van persoonlijkheidsvragenlijsten zijn er drie soorten constructies:

      • Zuiver empirisch samengestelde vragenlijsten op basis van hun relatie met een relevant geacht criterium. Bijvoorbeeld de PMT meet één trek; de MMPI meet een aantal trekken;

      • Via factoranalyse of clusteranalyse. De items worden samengesteld uit een groot aantal persoonlijkheidstests. Bijvoorbeeld 16PF en GZTS;

      • Vanuit een theorie over persoonlijkheid of temperament. Bijvoorbeeld de Amsterdamse Biografische Vragenlijst, de NEO-PI-R of de NEO-FFI.

    Er zijn ook zelfbeoordelingsmethoden die anders werken dan met vragenlijsten. Enkele voorbeelden zijn:

    1. De Osgoodschalen of de methode van de semantische differentiaal: De proefpersoon moet een aantal objecten, gebeurtenissen of een serie eigenschappen beoordelen op een aantal bipolaire dimensies, zoals mooi/lelijk, sterk/zwak of glad/ruw. Door factoranalyse kwamen de onderzoekers tot drie significante dimensies waarop de antwoorden van de proefpersonen gescoord kunnen worden. Deze zijn: evaluatie (goed/slecht), activiteit (actief/passief) en potentie (sterk/zwak). Deze dimensies bleken niet sterk cultuurgebonden te zijn. Door de beoordelingen van de respondenten over te brengen op deze 3 dimensies, krijgt men een indruk van hun beleving van bepaalde verschijnselen (zoals huwelijk, liefde, rechtvaardigheid, hun beroep of zichzelf).

    2. De Role Construct Repertoire van Kelly (de Rep-test): De proefpersonen beoordelen zichzelf, hun leraar, vader of andere relevante personen op een checklist met adjectiva over persoonlijkheidsontwikkeling. Op deze manier ontstaan constructen over de persoonlijkheid.

    3. Q-technique of Q-sort: Iemand wordt gevraagd een serie uitspraken te sorteren op basis van de gelijkenis met bijvoorbeeld zichzelf (‘self-sort’), het ideaal (‘ideal-sort’) of de gemiddelde mens (‘average-sort’). Niet alleen de absolute scores, maar ook de afwijkingsscores worden geïnterpreteerd, want die blijken diagnostische betekenis te hebben. Bijvoorbeeld de discrepantie tussen het ideale zelfbeeld en het waargenomen zelfbeeld.

    4. Kwalitatieve prestatietests

    Bij kwalitatieve prestatietests wordt het resultaat (prestatie) van de onderzochte anders beoordeeld of geïnterpreteerd; namelijk als een indicatie voor een persoonlijkheidstrek of een klinisch syndroom. De onderzochte weet niet wat de bedoeling is van de test. Er zijn twee soorten kwalitatieve prestatietests:

    1. Niveautests voor gedragswijze

    De prestatie wordt beoordeeld aan de hand van een duidelijke norm voor wat goed of fout is. Men gaat er vanuit dat de score samenhangt met een persoonlijkheidstrek of met een klinisch diagnostische categorie. Bovendien gaat het in eerste instantie niet om een capaciteit of vaardigheid. Er zijn vijf categorieën niveautests voor gedragswijze (gebaseerd op de aard van de opdracht):

    1. Experimentele tests: Onderzoeksresultaten uit het laboratorium blijken bruikbaar te zijn voor persoonlijkheidsdiagnostiek.

    2. Motoriektests: Motorische verschijnselen vertonen samenhang met persoonlijkheidsaspecten, zoals bijvoorbeeld coördinatieproeven.

    3. Intelligentietests: De totaalscore wordt gebruikt voor klinische- of persoonlijkheidsdiagnostiek. Bijvoorbeeld de intelligentietests voor de diagnostiek van disfuncties in de hersenen en hersenbeschadigingen, zoals de Bender Gestalt Test.

    4. Karaktertests: Proberen het karakter, de zedelijke aspecten of de wilskracht te meten. Bijvoorbeeld de volhardingstests. De tests zijn vaak onbetrouwbaar en afhankelijk van de specifieke tijd in de geschiedenis en het ‘zedelijk klimaat’.

    5. Cognitieve of perceptuele stijlen: Een cognitieve stijl is de manier waarop iemand informatie organiseert en bij een perceptuele stijl gaat het om waarnemingsgegevens, die subjectief worden opgenomen en verwerkt. Voorbeelden zijn: RFT (Rod and Frame Test), EFT (Embedded Figures Test) en BAT (Body Adjustment Test).

    2. Projectietests

    Vaak ambigue opdrachten waarop een persoon vrij mag reageren. In zijn reactie laat de persoon iets zien van zijn motieven. De psycholoog gebruikt coderings- en interpretatiecategorieën gebaseerd op kwalitatieve kenmerken van de reacties op de testopgaven. Er zijn zes categorieën projectietests of projectieve methoden.

    1. Perceptietests: De onderzochte reageert op ongestructureerde (inkt)vlekken, elke zingeving en duiding wordt door de psycholoog geïnterpreteerd. Bijvoorbeeld de Rorschachtest of Holtzman Inkblot Test.

    2. Interpretatietests: Men moet vanuit persoonlijke interpretatie de afgebeelde situatie interpreteren of met elkaar in verband brengen. Bijvoorbeeld de Thematic Apperception Test (TAT) of de Vier-Platen-Test.

    3. Expressietests:Bijvoorbeeld de boomtest of de grafologie.

    4. Constructietests: Ook wel speeltests, bijvoorbeeld de Scenotest.

    5. Associatietests: Bijvoorbeeld de zinaanvullingstest of de frustratietest.

    6. Keuzetests: Bijvoorbeeld de Szonditest.

    Wat zijn voorbeelden van tests en voldoen ze aan de zes kenmerken van tests?

    RAKIT – algemene intelligentie (revisie Amsterdamse KinderIntelligentieTest)

    De test bestaat uit 12 deeltests die samen de algemene intelligentie meten van kinderen van 4-11 jaar. De test heeft een lange en een korte versie (voor een gedifferentieerd beeld of een globale indruk), en sluit aan bij Thurstone (zeven intelligentiefactoren) en Guilford (drie dimensies). Wordt door COTAN beoordeeld als een goede test.

    De test voldoet aan de zes kenmerken van een test (zie H2) waardoor deze onderscheiden wordt van het voorwetenschappelijk oordeel:

    1. Efficiëntie: door het groot aantal gevarieerde taken kan in relatief korte tijd een vrij volledig beeld gekregen worden van het complexe intelligentiebegrip. Observatie ‘in vivo’ zou veel meer tijd kosten.

    2. Standaardisatie: de test wordt individueel voorgelegd en duurt 2-2,5 uur. Heeft zeer gedetailleerde richtlijnen voor de proefleider, de handleiding bevat veel aanwijzingen over de procedure en gedetailleerde instructies per deeltest. Er wordt nadrukkelijk genoemd dat zich niet houden aan de aanwijzingen de testprestaties nadelig kan beïnvloeden.

    3. Normering: genormeerd op basis van zeven leeftijdsgroepen (4,5-11 jaar) van duizenden proefpersonen. Groepen zijn samengesteld op basis van regio, urbanisatiegraad, schoolgrootte, leeftijd en sekse. De ruwe testscores zijn omgezet naar een goed te interpreteren schaal. En er is een samenvattende score van de algemene intelligentie beschikbaar.

    4. Objectiviteit: over het algemeen objectief, maar soms ook een subjectieve beoordeling. De uiteindelijke testscore wordt verkregen met een goed omschreven (maar complexe) scoringsprocedure. Er kan niet worden uitgesloten dat verschillende beoordelaars tot verschillende scores komen.

    5. Betrouwbaarheid: de betrouwbaarheid is gegeven voor drie leeftijdsgroepen – wat voor de ene leeftijd betrouwbaar is, hoeft namelijk niet voor de andere leeftijd betrouwbaar te zijn. De deeltests zijn in alle leeftijdsgroepen redelijk tot voldoende betrouwbaar, de totaalscore is zelfs zeer betrouwbaar.

    6. Validiteit: de samenhang van de deeltests met externe variabelen is onderzocht om de betekenis vast te stellen. Vastgesteld kan worden dat de RAKIT een aantal relevante criteria (CITO-scores, vervolgonderwijs) behoorlijk goed kan voorspellen.

    Test voor transitief redeneren – specifieke test (computertest Bouwmeester)

    Transitief redeneren is op basis van voorgaande kennis (premissen) een antwoord op een probleem af te leiden. Het kunnen afleiden van transitieve relaties is belangrijk voor het onderwijs en dagelijks leven bij het nemen van rationele beslissingen (bijvoorbeeld bepalen in welke winkel een bepaald product het goedkoopst is). De test bestaat uit 16 taken (via de computer); per taak krijgt men eerst de premissen te zien, waarbij het kind bijvoorbeeld moet aangeven welke stok het langst is. Daarna wordt gevraagd naar de relatie tussen twee stokken die nog niet als premissenpaar zijn gegeven, maar die wel af te leiden is uit de premissen.

    Voldoet de test voor transitief redeneren aan de zes kenmerken van een test?

    1. Efficiëntie: diverse relevante aspecten van transitief redeneren komen in korte tijd aan bod.

    2. Standaardisatie: het kan afgenomen worden door een getrainde proefleider aan individuele kinderen; de kinderen krijgen uitleg en proeftaken. De proefleider reageert op vragen op een vooraf goed doordachte manier – zonder het oplossingsproces te sturen. Testtijd is ongeveer een half uur (varieert per leeftijd).

    3. Normering: het wordt alleen in wetenschappelijk onderzoek gebruikt. Er zijn geen normen voor individuele diagnostiek beschikbaar.

    4. Objectiviteit: de reacties worden via de computer geregistreerd, de uitleg is gestandaardiseerd. De objectiviteit was voldoende hoog.

    5. Betrouwbaarheid: betrouwbaarheid van de somscore op de items was ook voldoende hoog.

    6. Validiteit: volgens Piaget zijn er twee vaardigheden voor transitief redeneren, maar volgens Bouwmeester is er maar één (hooguit daarnaast nog verbale vaardigheid voor de verbale taken). De onderzoeken van Bouwmeester geven nauwkeurig weer wat de test meet.

    NEO – meting van de Big-Five persoonlijkheidsstructuur

    Deze test meet vijf dominante persoonlijkheidskenmerken:

    1. Neuroticisme: emotionele labiliteit versus emotionele stabiliteit: angst speelt een dominante rol.

    2. Extraversie: extraversie versus introversie: naar binnen of naar buiten gerichte energie, aandacht en oriëntatie.

    3. Openheid: openstaan voor ervaringen versus conventionaliteit en geslotenheid: intellectuele nieuwsgierigheid, voorkeur voor variatie en esthetiek.

    4. Altruïsme: altruïsme versus egoïsme: georiënteerd op de belangen van anderen, hulpvaardig, gericht op samenwerken.

    5. Consciëntieusheid: de mate van goed georganiseerd zijn, volhardend, ambitieus, betrouwbaar en gewetensvol handelen.

    De test wordt gebruikt bij patiënten, voor arbeidsselectie en bij de beoordeling van de geschiktheid voor trainingen en opleidingen. Het wordt ook veel gebruikt in wetenschappelijk onderzoek. De test heeft een korte en een lange versie en maakt onderscheid op zes facetten per eigenschap. De lange versie heeft 240 items en geeft een genuanceerd beeld van de 30 facetten. Als voorbeeld de zes facetten van Neuroticisme:

    1. Angst: de mate waarin men bang, zorgelijk, nerveus, gespannen en schrikachtig is.

    2. Ergernis: de mate waarin men frustratie, boosheid en haat ervaart.

    3. Depressie: de mate waarin men schuld, verdriet, hopeloosheid en eenzaamheid ervaart.

    4. Schaamte: de mate waarin men verlegen is en gevoelig is voor spot en beoordeling van anderen.

    5. Impulsiviteit: de mate waarin men zijn verlangens en gevoelens slecht beheerst.

    6. Kwetsbaarheid: de mate waarin men spanning en stress slecht beheerst.

    De items zijn uitspraken in de ‘ik-vorm’ die gaan over een facet van de eigenschap. De respondent geeft per item aan in hoeverre hij het met de uitspraak eens is (helemaal oneens / oneens / neutraal / eens / helemaal eens), en krijgt een score van 1 tot 5 punten; hoger betekent dat positie op de schaal voor die eigenschap hoger is.

    Voldoet de NEO aan de zes kenmerken van een test?
    1. Efficiëntie: door zich een voorstelling te maken van een groot aantal verschillende situaties, kan in korte tijd een indruk verkregen worden van de vijf persoonlijkheidstrekken.

    2. Standaardisatie: de tests kunnen individueel en groepsgewijs worden afgenomen. NEO-FFI duurt 10-15 minuten, NEO-PI-R duurt 40-50 minuten.

    3. Normering: per trek wordt de deeltestscore berekend door de itemscores bij elkaar op te tellen. Er wordt aangenomen dat de scores in de populatie op een normaalverdeling liggen; men krijgt dan een nieuwe score op een schaal van 1-9, die correspondeert met gelijke delen onder de normaalverdeling: stanines. Deze normen zijn vastgesteld voor diverse deelpopulaties met behulp van steekproeven met duizenden proefpersonen.

    4. Objectiviteit: de scoring is objectief doordat per item is vastgesteld hoeveel punten men krijgt bij elk antwoord. Zo komt elke psycholoog tot hetzelfde antwoord.

    5. Betrouwbaarheid: de betrouwbaarheid van de verkorte versie varieert per bevolkingsgroep en per eigenschap van 0.57 tot 0.88. De COTAN beoordeelt het als voldoende.

    6. Validiteit: van elke eigenschap is de samenhang onderzocht met variabelen die psychisch, sociaal en lichamelijk welbevinden representeren. De COTON vindt dat de betekenis van de testscores in voldoende mate is aangetoond, maar dat er onvoldoende onderzoek is geweest naar de voorspellende waarde.

    Hoe kunnen tests ingedeeld worden naar instructie en afname?

    Er zijn twee onderscheidingen in afneming en instructie mogelijk, namelijk individuele test versus groepstest en snelheidstest versus niveautest.

    Wat is het verschil tussen individuele tests en groepstests?

    Individuele tests

    Bij een individuele test is er sprake van een individuele testsituatie en individuele instructie. Er is een individuele relatie tussen de testleider en de onderzochte, de vragen worden stuk voor stuk geformuleerd of aangeboden en reacties/prestaties worden persoonlijk vastgelegd. Is vooral in Europa populair. Voordelen aan deze test zijn (1) de mogelijkheid om de onderzochte te stimuleren, (2) controle op de situatie en op de inhoud en (3) de mogelijkheid tot observatie van de onderzochte. Nadelen zijn de geringe efficiëntie en dat de informatie niet op een systematische wijze verkregen wordt.

    Groepstests

    Bij een groepstest geeft de testleider instructies aan een groep. Een voordeel is efficiëntie en de besparing van geld en tijd. Nadelen zijn problemen met de orde houden en het risico op afkijken; zaken die invloed kunnen hebben op de testprestatie. Hoe groot een groep mag zijn, hangt af van de aard van de test, het doel van het onderzoek en de leeftijd van de onderzochten. Bij patiënten, jonge kinderen en in ontwikkelingslanden is groepsgewijs testen moeilijker en bij kinderen jonger dan 5 jaar helemaal onmogelijk.

    Zowel individuele test als groepstest kunnen schriftelijk en via de computer worden afgenomen. Individuele tests kunnen daarnaast ook mondeling worden afgenomen of middels een verrichtingstest.

    Wat is het verschil tussen een snelheidstest en een niveautest?

    Een snelheidstest wordt ook wel speedtest genoemd. Een niveautest noemt men ook wel powertest. Uitgaande van een vaste periode kijkt men bij een snelheidstest hoe snel iemand een bepaalde opdracht af heeft.

    Snelheidstest

    • Veel opgaven, dus het is nooit binnen de toegestane tijd af.
    • De opgaven zijn ongeveer even moeilijk.
    • De opgaven zijn vaak bijzonder gemakkelijk.
    • Bij de beoordeling worden fouten vaak niet meegerekend.

    Niveautest

    • Opgaven zijn niet even moeilijk.
    • Opgaven lopen van makkelijk naar moeilijk.
    • Iedereen kan de makkelijkste oefeningen maken en vrijwel niemand de moeilijkste.
    • Geen tijdslimiet (hoewel in de praktijk vaak wel, maar dan ruim genomen).
    • Beoordeling op basis van de correcte oplossingen.

    Een interessante vraag is of tests, onder de verschillende voorwaarden van snelheid of niveau, toch dezelfde eigenschap kunnen meten. Het lijkt dat snelheidstests samenhangen met kwantiteit en niveautests met kwaliteit. Er is een positieve correlatie gevonden tussen de prestaties onder beperkte en onbeperkte tijd.

    Meili kwam met twee hypothesen met betrekking tot de verhouding tussen snelheid en niveau:

    1. De snelheid waarmee gemakkelijk opgaven worden opgelost geeft geen aanwijzing voor het vermogen moeilijk opgaven op te lossen.

    2. De snelheid waarmee moeilijke opgaven worden beantwoord is wel een aanwijzing voor het vermogen als zodanig om deze problemen op te lossen, maar weer niet voor de snelheid waarmee eenvoudiger taken worden verricht.

    Er is een gedeeltelijke bevestiging van beide hypothesen gevonden: de snelheid bij makkelijke opgaven stond los van de intelligentie en de snelheid van werken bij moeilijke opdrachten.

    Model van Van der Ven: de precisiescore is de proportie goede antwoorden en de snelheidsscores is het aantal geprobeerde items. De correlatie tussen precisie en snelheid kan door deze twee scores worden verklaard – onder de aannamen dat precisie en snelheid onafhankelijk van elkaar zijn. Maar dit model werd bekritiseerd door Van den Wollenberg. Als alternatief voor de precisiescore stelde hij de persoonsscore uit het Rasch-model voor. Hij vond ook dat precisie en snelheid niet helemaal onafhankelijk zijn en dat er meer eigenschappen ten grondslag liggen aan de testprestatie dan deze twee alleen.

    Bij het testen van woordenschat, kennisniveau en sensorische of artistieke vaardigheden is het snelheidselement niet belangrijk. Als het wel belangrijk is, moet de mate van de snelheid empirisch worden bepaald, afhankelijk van wat men wil weten of voorspellen. De optimale praktische uitvoering van een tijdslimiet (wel of niet, en hoe lang dan) hangt samen met de betrouwbaarheid en betekenis van de test.

    Welk onderscheid kan er gemaakt worden op basis van testvragen?

    De belangrijkste begrippen in verband met de onderscheidingen op basis van testvragen zijn: cultuurvrije en niet-cultuurvrije tests en directe en indirecte tests.

    Wat is het verschil tussen cultuurvrije en niet-cultuurvrije tests?

    Het gaat hier meer om een continuüm dan om een tegenstelling. Een zuivere cultuurvrije test bestaat niet en men moet er ook niet naar streven. De mens wordt altijd beïnvloed door zijn omgeving. Ook non-verbale tests zijn niet helemaal cultuurvrij. Non-verbale tests blijken vaak laag te correleren met allerlei relevante criteria. Misschien komt dit omdat de taal eruit gehaald is, die mogelijk een wezenlijke bijdrage levert aan het begrip intelligentie.

    Het is beter om het complexe begrip ‘cultuur’ te vervangen voor een begrip dat beter omschreven kan worden, zoals het begrip ‘skill’. Om mee te kunnen doen aan een test heeft men bepaalde vaardigheden, 'skills', nodig, zoals het kunnen horen van instructies: vaardigheden die men met de test juist niet wil meten. Sommige skills zijn fysiologisch bepaald (kunnen horen of zien), anderen worden beïnvloed door cultuur of omgevingsinvloeden (kunnen lezen, schrijven etc.).

    De invloed van skill-verschillen kan op drie manieren worden gereduceerd:

    1. Door het verkleinen van de skill-verschillen zelf, door bijvoorbeeld de instructie uit te breiden.

    2. Door interpretaties en testscores te beperken tot slechts dat deel van de populatie dat de vereiste skills bezit.

    3. Door het ontwikkelen van ‘skill reduced tests’, bijvoorbeeld de Design Construction Test van Ord, de SON (voor doven). Het doel is de groep te vergroten waarbinnen uit de testscores conclusies over de te meten capaciteit kunnen worden getrokken.

    Wat is het verschil tussen directe en indirecte tests?

    Een belangrijke vraag is of het doel van de test bekend is bij de onderzochte. Vrijwel alle projectiemethoden en de meeste zelfbeoordelingen en persoonlijkheidsvragenlijsten vallen onder indirecte tests; de onderzochte weet het doel van de test niet. Bij directe tests weet en begrijpt de onderzochte het doel van de test. Zoals bij bijna alle prestatietests en vorderingstests, biografische informatielijsten en opinie- en attitudetest.

    Vragenlijsten kunnen ook in een indirecte vorm gegoten zijn. De meeste zelfbeoordelingen en persoonlijkheids-vragenlijsten zijn in zekere zin indirect: onderzochte weet niet hoe de vragen zullen leiden tot een interpretatie over de persoonlijkheid, interesse of attitude.

    Wat is het verschil tussen vrije-antwoordtests en keuze-antwoordtests?

    Vrije-antwoordentest en keuze-antwoordentests worden ook wel open versus gesloten vragen of ongecodeerde versus geprecodeerde vragen, genoemd. Het gaat hier om het verschil in uitvoering van de test. Hoofdstuk 4 gaat hier dieper op in.

    Access: 
    Public
    Hoe worden items opgebouwd en reacties gekwantificeerd in tests en vragenlijsten? - Chapter 4

    Hoe worden items opgebouwd en reacties gekwantificeerd in tests en vragenlijsten? - Chapter 4

    Tests en vragenlijsten zijn opgebouwd uit items. Items zijn stimuli waar de respondenten op moeten reageren. Uit hun reacties (het geobserveerde gedrag) kan een niet-observeerbare eigenschap afgeleid worden. Er zijn veel varianten van items die op drie manieren ingedeeld kunnen worden:

    1. Naar de activiteit die van de respondent wordt gevraagd.
    2. Naar de vorm van het antwoord van de respondent.
    3. Naar de uiterlijke verschijning van het item.

    Hoe kunnen items ingedeeld worden naar de activiteit die van de respondent wordt gevraagd?

    Bij verscheidene tests en vragenlijsten stimuleren de items de respondent om te reageren. Uit dit gedrag wordt een psychologische eigenschap afgeleid. We maken onderscheid tussen:

    Theoretische opdrachten

    Met theoretische opdrachten meet men meestal cognitieve capaciteiten en vaardigheden. Voorbeelden zijn: verkeersvragen uit het theoretisch rijexamen en reken- en taalopdrachten uit de CITO-toets. De antwoorden op dit soort opdrachten zijn (gedeeltelijk) goed of (gedeeltelijk) fout

    Stellingen

    Met stellingen meet men vaak persoonlijkheidstrekken, meningen, houdingen of voorkeuren. De respondent geeft aan of hij het met de stelling eens is, of in welke mate. De antwoorden op stellingen zijn niet goed of fout, maar geven aan waar de respondent denkt dat hij staat op de schaal van de eigenschap die gemeten wordt.

    Vragen

    Ook vragen meten meningen, houdingen of voorkeuren, maar nu wordt directer naar een stellingname van de respondent gevraagd: 'bent u voorstander van…'. Antwoorden zijn niet goed of fout, maar geven een standpunt of houding aan.

    Praktijkproeven

    Bij praktijkproeven worden capaciteiten en vaardigheden gemeten. Voorbeelden hiervan zijn het praktisch rijexamen of een managementgame, waarbij in een spelsituatie managementeigenschappen als samenwerking, leiderschap en organisatietalent worden beoordeeld door een psycholoog. De reacties van de respondent kunnen geclassificeerd worden als goed of fout of als adequaat of inadequaat.

    Er zijn ook nog andere mogelijkheden, zoals bij projectietests; de gevraagde activiteit is hier juist een zo ‘vrij’ mogelijke reactie.

    Hoe kunnen items ingedeeld worden naar de vorm waarin het antwoord wordt gegeven?

    Hierbij onderscheiden we de open vragen en gesloten vragen.

    Open vraagvorm

    De respondent bepaalt helemaal zelf hoe hij reageert. Open vragen, maar ook open opdrachten op essayopdrachten, hebben als voordeel dat ze de respondent vaak meer creativiteit in het antwoord bieden. Als je bijvoorbeeld creatief schrijven wilt meten, zijn dit soort vragen zeer geschikt. Bij open vragen zal de subjectiviteit van de onderzoeker invloed hebben op de interpretatie van de antwoorden.

    Gesloten vraagvorm

    Bij de gesloten vraag, ook wel de multiple-choicevraag (meerkeuzevraag), of geprecodeerde vraag, daarentegen, wordt alleen een keuze gevraagd. Er wordt alleen naar kennis gevraagd, waarbij de respondent kiest uit een beperkt aantal geformuleerde reacties.

    Maar hoewel bij open vragen meer informatie beschikbaar komt, is het beoordelen en categoriseren hiervan voor de onderzoeker arbeidsintensief. Ook de respondent kost het tijd. Daarnaast begrijpt de respondent niet altijd de vraag goed, maar geeft dan een wel (niet-relevant) antwoord, zodat de middels de vraag te meten eigenschap of gedrag niet gemeten kan worden. Daarom is het belangrijk de vraag zo helder mogelijk te stellen, en niet of weinig ruimte laten om de vraag anders te interpreteren. Wat ook meespeelt is dat niet alle respondenten even duidelijk antwoorden, of dat ze de taal niet of niet goed beheersen, of een onleesbaar handschrift hebben, waardoor het antwoord moeilijk te interpreteren is.

    Deze problemen kun je bij gesloten vragen ondervangen door gebruik te maken van een rating scale item, er is dan sprake van bijvoorbeeld 5 mogelijkheden op een schaal van 'niet van toepassing' naar 'wel van toepassing'. Voordeel is dat het antwoorden snel gaat, en het categoriseren ook, je kunt dan meer vragen stellen en dat komt de validiteit en betrouwbaarheid ten goede.

    Bij meerkeuzevragen is één antwoord het juiste. Het lastige bij het maken van deze vragen is het bedenken van de foute antwoorden, die moeten liefst enigszins waarschijnlijk zijn, zodat de keuze voor het juiste antwoord moeilijker wordt. Maar juist het inschatten van de moeilijkheidsgraad is voor de vragenmakers lastig.

    Een ander nadeel van meerkeuzevragen is de zogenaamde 'gokkans', door te raden kunnen respondenten vragen goed hebben. Er zijn technieken om de gokkans te verkleinen (de toevalscorrectie, zie hoofdstuk 5), maar als je niet wilt dat de respondenten gaan gokken, kun je als vragenmaker beter voor open vragen kiezen.

    Vaak is de kritiek dat gesloten vragen alleen (feiten)kennis meten door middel van herkenning, bij open vragen zouden dan meer begrip, inzicht en creativiteit van de respondent worden gevraagd. Maar een meta-analyse van Mellenbergh concludeert dat men vaak met meerkeuzevragen hetzelfde kan meten als met open vragen, mits de meerkeuzevragen goed geconstrueerd zijn. Ook ‘hogere’ functies (begrip, toepassing, analyse) zijn te meten. Het meten van ‘hogere’ functies met open vragen moet niet overschat worden; de beoordeling is onbetrouwbaar, subjectief en oncontroleerbaar. Uit het onderzoek bleek dat meerkeuzevragen betere voorspellers zijn dan open vragen.

    Hoe kunnen items ingedeeld worden naar de uiterlijke verschijning van het item?

    Geprecodeerde items kunnen we indelen in items voor prestatieniveautests en items voor tests voor gedragswijze.

    Welke items kunnen worden gebruikt voor prestatieniveautests?

    Prestatieniveautests zijn bijvoorbeeld meerkeuzetoetsen bij een studie of intelligentietests. Het item bestaat van zo'n test bestaat uit een stelling, vraag, bewering of uitspraak met twee tot vijf antwoordmogelijkheden. Een item kan worden opgedeeld in de stam (de uitspraak minus de antwoorden, de gesleutelde respons (het goede antwoord) en de afleiders (de foute antwoorden). Er is een grote variatie binnen de antwoordvormen, er wordt onderscheid gemaakt tussen meerkeuze-items op basis van drie principes:

    1. Kiezen

    Er moet een keuze gemaakt worden uit de gegeven antwoorden. Daarbij zijn verschillende vormen mogelijk:

    • Tweekeuzevorm: ja of nee, juist of onjuist etc.
    • (In)correcte antwoordvorm: slechts één van de antwoorden is de juiste of onjuiste.
    • Meest/minst-juiste-antwoordvorm: uit vier (of meer) plausibele antwoorden moet het meest juiste gekozen worden.
    • Verschillende antwoordenvorm: uit een aantal mogelijkheden moet één of meer antwoorden gekozen worden – soms wel en soms niet gefixeerd (waarbij aangeven wordt hoeveel er gekozen moeten worden).
    • Complexe vormen: er zijn allerlei complexe vormen te bedenken, bijvoorbeeld de gecombineerde-antwoordvorm: uitspraak waarin twee stellingen (a en b) verbonden zijn door een conjunctie (c); er moet gekozen worden of ‘a’, ‘a en b’, ‘b’ of ‘a, b en c’ juist is.

    2. Rangschikken

    De keuzemogelijkheden moeten in volgorde van juistheid, toepasbaarheid of voorkeur geplaatst worden. Voordeel hiervan is dat er veel informatie kan worden verkregen. Soms is een rangorde meer adequaat dan een verplichte of vrije keuze.

    3. Toeschrijving (matching)

    Bij deze vragen moeten twee rijen met begrippen aan elkaar gekoppeld worden; de juiste combinatie moet worden gemaakt tussen het ene begrip en het bijbehorende andere begrip. Het voordeel hiervan is dat er veel informatie verzameld kan worden in slecht één opgave. Het nadeel is dat de keuzes niet onafhankelijk van elkaar zijn; hoe minder onzekere combinaties overblijven, hoe groter de gokkans wordt. Dat kan ondervangen worden door één van beide rijen te verdubbelen.

    Welke items kunnen worden gebruikt bij tests voor gedragswijzen?

    Bij persoonlijkheids- of attitudetests kruist de respondent vaak op een schaal aan in welke mate hij het met een uitspraak eens is. Het aantal antwoordmogelijkheden kan variëren, maar er moet met een aantal dingen rekening gehouden worden:

    1. De vorm en instructie moeten voorkomen dat de respondent tussen twee antwoorden in een kruisje zet.

    2. Er moet gekozen worden voor een even of oneven aantal items. Een even aantal keuzemogelijkheden dwingt de respondent om een kant moet kiezen, maar de meeste testconstructeurs kiezen voor een oneven schaal, meestal de Likertschaal (met 5 keuzemogelijkheden), waarbij vermeden wordt dat iemand voorkeur moet uitspreken.

    3. Keuze voor het aantal antwoordmogelijkheden. Respondenten kunnen meestal niet meer dan zeven verschillende antwoordmogelijkheden onderscheiden, meer keuzes aanbieden is daarom niet zinvol.

    4. De beschrijving van de schaalposities (‘labels’). Het benoemen van de stappen op de schaal kan tot interpretatieverschillen tussen respondenten leiden, maar het weglaten zorgt voor meer verschillende interpretaties. Dat zou tegengegaan kunnen worden door alleen de twee uitersten op de schaal te benoemen, bijvoorbeeld van 'geheel mee eens' tot 'geheel mee oneens'.

    Hoe kunnen de antwoorden gekwantificeerd worden?

    Welke informatiebronnen kunnen er bij de kwantificering gebruikt worden?

    De kwalitatieve reacties van de respondenten op de items uit een test moeten gekwantificeerd worden, oftewel in getallen worden omgezet, zodat een beeld ontstaat van de eigenschap die gemeten wordt. Met behulp van statistiek kun je dan bepalen of een respondent systematisch gedrag vertoont. Als dit het geval is heeft de test goede meeteigenschappen, zo niet dan zijn de reacties geen zinvolle indicaties van de te meten eigenschap.

    Sommige psychologen vinden dat je door kwantificering informatie weglaat, zodat je iemands persoonlijkheid eigenlijk niet zinvol kunt diagnosticeren. Maar het gaat er juist om constant en systematisch gedrag van iemand op te sporen en dat kan alleen door te kwantificeren. Ook diagnoses van andere psychologen kunnen meespelen bij het oordeel over iemands gedrag, maar als die tegenstrijdig zijn, kunnen ze beter buiten beschouwing worden gelaten. Maar in het algemeen is het beter om meerdere informatiebronnen te gebruiken. Overigens, ook als een test niet goed blijkt te voorspellen, dan moet hij worden vervangen.

    Hoe kunnen itemscores verkregen worden?

    Om de kwalitatieve reacties op de items te kunnen kwantificeren, moeten de antwoordmogelijkheden gerangschikt kunnen worden op een schaal die de eigenschap meet. Aan deze antwoordcategorieën worden scores toegekend, er wordt daarbij onderscheid gemaakt tussen dichotome items (twee antwoordcategorieën, goede antwoord krijgt meer punten) en polytome items (drie of meer antwoordcategorieën, afhankelijk van de ordening worden punten toegekend per antwoord).

    De aan de antwoordcategorieën op de items toegekende getallen worden scores genoemd – alleen de ordening is hierbij van belang, niet de getallen op zichzelf. De items zouden gewogen kunnen worden (sommige items wegen dan zwaarder mee in de uitkomst dan anderen), maar dat is meestal niet wenselijk. Een dringend advies is om alle items uit de test dezelfde scores te geven, alleen dan zijn de items gelijkwaardig. Items verschillend wegen kan alleen bij goede theoretische onderbouwing.

    Hoe kan de kwaliteit van de items beoordeeld worden in het vooronderzoek?

    Vooronderzoek

    Bij het construeren van een test wordt eerst de kwaliteit van de items onderzocht. Tijdens het vooronderzoek wordt met een kleine niet-representatieve steekproef (20 tot 100 personen) vastgesteld welke items uit de voorlopige testversie slecht werken.

    Hoofdonderzoek

    Tijdens de tweede fase, het hoofdonderzoek, wordt een grote (tussen 500 en 2000 personen), representatieve steekproef gehouden. Groot omdat je populatie vaak kunt onderverdelen in relevante deelgroepen. Representatief omdat de gehele populatie vertegenwoordigd moet zijn, vaak gebruikt men daarom een gestratificeerde steekproef. Daarbij maakt men een steekproef waarbij alle deelgroepen even groot zijn, ook al is een bepaalde deelgroep in de populatie relatief klein.

    Het doel van het hoofdonderzoek is om de kwaliteit van de hele test te bepalen, daarom kunnen er in de tweede fase ook nog items wegvallen als die slecht blijken te werken. Daarbij kijk je naar betrouwbaarheid, validiteit en normen van de test.

    Hoe verloopt het vooronderzoek van dichotome items?

    Om bij het vooronderzoek vast te kunnen stellen of een item (bijvoorbeeld een meerkeuzevraag bij een tentamen) goed of slecht werkt, kijk je naar de relatieve frequentie van de antwoorden. De relatieve frequentie van het goede antwoord (de gesleutelde respons) noemen we de p-waarde, de relatieve frequenties van de andere (foute) antwoordmogelijkheden (afleiders geheten) zijn de a-waarden. Als de a-waarden niet veel van elkaar verschillen, heb je sterke aanwijzingen dat je een goed werkend item hebt. Maar er zijn ook verschillende andere mogelijkheden, zoals:

    1. Als alle antwoordmogelijkheden dezelfde relatieve frequentie opleveren, heeft iedereen waarschijnlijk het antwoord gegokt (uniforme verdeling). Om zeker te weten of iedereen heeft gegokt, is er aanvullende evidentie nodig en het item mag geen correlaties hebben met andere items. De inhoud van het item moet worden bekeken; het kan te moeilijk zijn of slecht geformuleerd.

    2. Als het juiste antwoord een erg hoge relatieve frequentie heeft (dicht bij 1), kan dat erop duiden dat het item te makkelijk was, maar er kan ook gewoon goed gestudeerd zijn. Een andere mogelijkheid is dat de afleiders niet plausibel genoeg zijn.

    3. Als een relatieve frequentie het hoogst is bij een fout antwoord, kan het zijn dat de afleider als zogenaamde 'instinker' heeft gewerkt. Maar het kan ook zijn dat deze afleider eigenlijk (ook) het juiste antwoord is.

    Hoe verloopt het vooronderzoek van polytome items?

    Hierboven hadden we het over dichotome items, dat betekent dat er twee antwoordcategorieën zijn: goed of fout. Als er drie of meer antwoordcategorieën zijn, is het item polytoom. Ook hier kijk je naar de relatieve frequentieverdeling van de scores om te zien of een item goed of slecht werkt. Mogelijke patronen zijn:

    1. Alle antwoordcategorieën worden benut, sommige iets meer dan anderen. Deze verdeling geeft aan dat mensen gematigd reageren op een stelling, er zijn ook voor- en tegenstanders. Het item functioneert goed, want er is een goede spreiding van respondenten. Het gemiddelde kan berekend worden als de gewogen som van de itemscores: per item moet de som van de itemscores berekend worden, waarbij elke score wordt gewogen met de relatieve frequentie.

    2. De verdeling is uitgesproken scheef. Deze verdeling geeft aan dat bijvoorbeeld niemand de laagste en vrijwel iedereen de hoogste score geeft. Het maakt geen onderscheid tussen personen; een dergelijk item is te populair in de betreffende populatie (maar kan ook te makkelijk, impopulair of te moeilijk zijn). Het kan wel interessant zijn in opinieonderzoek; het geeft namelijk aan waar in de populatie de onder- of bovengrens ligt van het niveau van een bepaalde attitude over een bepaalde zaak.

    Access: 
    Public
    Hoe worden tests afgenomen en verwerkt? - Chapter 5

    Hoe worden tests afgenomen en verwerkt? - Chapter 5

    ​​​​​

    Hoe worden tests afgenomen?

    Bij het afnemen van tests zijn er veel factoren waar rekening mee gehouden dient te worden, zoals:

    1. De objectieve testsituatie.
    2. Gedrag van de proefpersonen.
    3. Gedrag van de proefleider.

    Hoe kunnen de antwoorden gescoord worden?

    Er wordt onderscheid gemaakt tussen de scoring van open vragen en van meerkeuze-items. Ook wordt er ingegaan op het gebruik van de toevalscorrectie.

    De objectieve testsituatie

    Hierbij is standaardisatie belangrijk. Dit betekent dat de onderzochten in maximaal gelijke omstandigheden moeten worden getest. Dit geldt zowel voor groepstests als voor individuele tests. Voorwaarden hiervoor zijn:

    • Standaardisatie van testcondities, dat wil zeggen dat de proefleider zich zo goed mogelijk aan de instructies moet houden: de proefpersonen worden in gelijke omstandigheden getest.
    • Omgevingsinvloeden moeten zoveel mogelijk voorkomen worden.
    • Geen storingen tijdens de testafname.
    • Een goede controle zodat afkijken en spieken niet mogelijk zijn.

    Bovenstaande punten spelen vooral een rol in een groepstestsituatie en bij snelheidstests.

    Gedrag van de proefpersonen

    Sommigen zijn meer gemotiveerd en coöperatief, terwijl anderen dat niet zijn. Ook kan een proefpersoon moe zijn waardoor hij of zij de een slechtere prestatie levert dan normaal. Standaardisatie van de proefpersonen is moeilijker te realiseren dan standaardisatie van de testsituatie. Er zijn een aantal factoren die men wel onder controle kan houden, namelijk:

    • Ervoor zorgen dat de onderzochte fit is.
    • Nagaan of er geen sprake is (geweest) van een sterke emotionele opwinding.
    • Door duidelijke extra instructie wordt de opdracht vaak beter begrepen.
    • Er voor zorgen dat de proefpersonen niet van tevoren weten wat de inhoud van de test is.

    Naast deze factoren zijn er ook andere factoren die van invloed kunnen zijn op de testprestatie, zoals voorgaande ervaringen of trainingen waardoor de onderzochte vertrouwd is met testen (‘test-wiseness’). Ook verwachtingen over moeilijkheid, eigen resultaten en consequenties hebben invloed. Deze hangen sterk samen met de sociaal-economische klasse van de onderzochte. De reactie van de proefleider op het slagen of falen van de proefpersoon heeft ook invloed, een adequate houding van de onderzoeker is dus vereist.

    Een ander punt wat invloed heeft is angst voor de gevolgen van een slechte testprestatie (testangst en examenangst). Hermans (1968) omschrijft twee soorten van angst die sterk met elkaar samenhangen: positieve faalangst (een geringe mate van angst heeft een positieve invloed op de prestatie) en negatieve faalangst (een sterke mate van angst heeft een negatieve invloed op de prestatie).

    Gedrag van de proefleider

    Hier kan er verschil zijn in training, ervaring, inzicht, etc. Voor een proefleider is het van belang dat hij of zij de proefpersonen zo objectief mogelijk benadert. Met name bij individuele tests is er een wisselwerking tussen de testleider en de proefpersoon. Dat kan eenvoudiger gecontroleerd worden dan het gedrag van de proefpersoon. Belangrijk daarbij is:

    1. De testleider moet voldoende algemene ervaring hebben met testen en hij moet de test ook goed beheersen.
    2. Hij neemt beslissingen met goed psychologisch inzicht.
    3. Hij moet geen vooroordelen of sympathieën hebben, hij moet zichzelf dwingen tot strikte controle en zelfcorrectie en voorkomen dat hij ‘ideaaltypen’ wil ontdekken (bijvoorbeeld de ‘echte’ gevoelsarme psychopaat).

    Hoe men met deze problemen om kan gaan, hangt af van het belang van het onderzoek. Men kan elementen van de testsituatie in de evaluatie verwerken (als het doel is het genereren van hypothesen of doelen voor verder onderzoek). Men kan ook ‘doen alsof’ de invloeden genegeerd kunnen worden. Eventueel kan men bij de interpretatie van de objectieve scores rekening houden met ongewenste invloeden.

    Bij een dergelijke objectieve benadering offeren we iets op van het unieke van de persoon en de situatie, maar we reduceren daarbij de onbetrouwbaarheid, waardoor de vergelijkbaarheid toeneemt.

    Hoe kunnen de antwoorden gescoord worden?

    Er wordt onderscheid gemaakt tussen de scoring van open vragen en van meerkeuze-items. Ook wordt er ingegaan op het gebruik van de toevalscorrectie.

    Hoe kunnen reacties op items met een open-vraagvorm gescoord worden?

    Reacties op open vraag kunnen verbaal en non-verbaal zijn. Een voorbeeld van een non-verbaal antwoord is dat aan kinderen wordt gevraagd om door een doolhof naar het eindpunt te komen (test uit de RAKIT). Bij deze vorm is er sprake van een grote subjectiviteit en lage interbeoordelaarsbetrouwbaarheid. Dit kan men ondervangen met een zo goed mogelijk coderingssysteem dat ten eerste volledig en ten tweede duidelijk en ondubbelzinnig is. Bijvoorbeeld en checklist, een lijst waarop wordt bijgehouden welke eigenschappen wel of niet aanwezig zijn.

    Er zijn echter ook vrije-antwoordentests met een grote betrouwbaarheid, zoals de TAT. Het is niet zo dat een grote interbeoordelaarsovereenstemming automatisch betekent dat er sprake is van een betere validiteit; overeenstemming is wel noodzakelijk, maar niet voldoende voorwaarde voor validiteit. De checklist is te beschouwen als een ‘test’ en moet aan dezelfde voorwaarden voldoen.

    Hoe kunnen reacties op geprecodeerde items gescoord worden?

    Belangrijk hier zijn de accuraatheid (zo goed mogelijk) en de efficiëntie (zo snel en goedkoop mogelijk) bij de scoring. Bij de keuze-antwoordenvorm kent men drie manieren van scoring:

    1. Handscoringsmethode. Correctoren tellen het aantal goede en foute antwoorden en vergelijken dat met de correct ingevulde sleutel. Het nadeel is dat het veel tijd kost en er worden veel fouten gemaakt.

    2. Zelfscoringsmethode. Is sneller en efficiënter dan de eerste, maar het materiaal is wel duurder. Hierbij wordt het antwoordformulier onder een tweede vel geplaatst, waarop een aantal cirkeltjes staan die precies vallen onder plaatsten waar het goede antwoord op het antwoordformulier moet worden aangestreept. Zo wordt de score direct op het doordrukformulier geregistreerd.

    3. Machinescoring. Dit is de snelste methode van verwerking, waarbij een antwoord op een computer gegeven wordt. De computer berekent automatisch of het antwoord goed of fout is en kan een terugkoppeling geven. De gegevens kunnen meteen worden toegevoegd aan het gegevensbestand die naast informatie over de onderzochte ook informatie kan geven over de test zelf en de onderzochte groep, zoals verdelingen, spreidingen, rangordes etc.

    Wat is de toevalscorrectie en hoe kan het uitgevoerd worden?

    Toevalscorrectie is alleen nodig bij de keuze-antwoordenvorm en ter ondervanging van het bezwaar dat de onderzochte slechts door te raden hoog scoort. Het aantal goede antwoorden door kennis (XC) kan berekend worden door van het totale aantal goed (X) het deel af te trekken dat door gissen goed was: het aantal fout (k-X) gedeeld door A-1. De formule voor toevalscorrectie is:

    (XC = gecorrigeerde score, X = aantal goed, k = aantal items, k-X = aantal fout, A = aantal antwoordmogelijkheden).

    De correctieformule bij niet-ingevulde vragen berust op hetzelfde idee. Naar verwachting zou bij blind gissen een deel van die items goed zijn, dat wordt opgeteld bij het aantal ‘goed’:

    (Xf = aantal 'fout', k-X-Xf = aantal niet-ingevulde items).

    Er zijn vier bezwaren tegen deze correctieformules:

    1. De formules zien eruit alsof we precies weten wat correct beantwoord is, maar in het echt is er geen scherpe lijn tussen zeker weten en puur gissen. Door partiële kennis kan de werkelijke giskans hoger zijn dan de blinde giskans (ondercorrectie door de formule), of bij een erg verleidelijke afleider is de giskans juist kleiner (overcorrectie). Eigenlijk gelden de formules alleen voor iemand die niets van de stof af weet.
    2. Iemand kan ook een foutief antwoord geven door verkeerde informatie of verkeerd inzicht. Het is dan onrechtvaardig dat er via de formule door deze fout punten van de goede antwoorden afgetrokken worden.
    3. XC heeft een grotere variantie dan X: de gecorrigeerde score (XC), die gebaseerd is op tweekeuze-items, heeft een 4x zo grote variantie als de ongecorrigeerde score (X) en dus een 2x zo grote standaarddeviatie. Dat heeft een ongewenst effect op andere berekeningen; als men de gecorrigeerde testscore optelt bij andere testscores (bijvoorbeeld bij intelligentietests) krijgt de test met de gecorrigeerde scores een 2x zo groot gewicht, zonder dat dit te rechtvaardigen is.
    4. Bij een lineaire relatie tussen XC en X geldt dat de correlatie tussen XC en X gelijk is aan 1: dus r(XC, X) = 1. Dit gegeven heeft drie belangrijke consequenties:
      • De ordening van personen en de afstand tussen personen volgens XC is dezelfde als die volgens X; de giscorrectie heeft daarvoor geen gevolgen. Maar sommige personen kunnen daardoor wel onder de aftestgrens vallen, terwijl dat op basis van de ongecorrigeerde testscore niet was gebeurd. Voor het individu kan de giscorrectie dus grote gevolgen hebben. Een oplossing daarvoor is het aanpassen van de aftestgrens.
      • De correlatie van de ongecorrigeerde testscore (X) en een andere testscore (Y) is gelijk aan de correlatie tussen XC en Y. Dat impliceert dat men met beide scores evengoed criteriumscore Y kan voorspellen; de gecorrigeerde score is hiervoor dus net zo geschikt als de ongecorrigeerde score.
      • De betrouwbaarheid van X en XC is gelijk. Maar dat geldt niet voor formule, omdat in deze formule de relatie tussen XC en X niet lineair is.

    Conclusie: in het algemeen wordt geadviseerd correctieformules niet te gebruiken. Bij de keuze-antwoordenvorm is het beter het aantal goede antwoorden te tellen. De instructie aan de respondenten moet zijn dat men beter alle antwoorden kan invullen, ook als ze het niet weten, omdat gissen rendabeler is dan niets invullen. Een positief bijeffect hiervan is dat door deze instructie een uniforme antwoordstrategie wordt bevorderd; verschillen tussen scores komen dan niet vanwege het verschil in wel of niet durven gissen. En als iedereen deze strategie volgt, is de giscorrectie op individueel niveau overbodig. Wel moet de aftestgrens aangepast worden. Voorbeeld: k = 32 en A = 4: iemand kan door gissen 8 vragen goed hebben, dus dit moet als ondergrens genomen worden. Bij een gewenst kennispercentage van 60% moet de aftestgrens zijn: 8 + 0.6(32 – 8) = 22.4 (in plaats van 19.2).

    De Groot en Van Nearssens bespraken alternatieve scoringsprocedures: als bij alle respondenten de optimale antwoordstrategie duidelijk is (gissen als je het niet weet), dan neemt de betrouwbaarheid en validiteit van de gecorrigeerde testscore niet significant toe boven dat van de ongecorrigeerde testscore. De beste scoringsprocedure in de praktijk is dus simpelweg het tellen van het aantal goede antwoorden.

    Moeten itemscores gewogen worden?

    Een cruciale vraag is of alle vragen even zwaar wegen. Uit onderzoek blijkt dat weging niet nodig is omdat het ten eerste bijzonder extra veel werk vergt en ten tweede blijkt uit correlatie-onderzoek een hoge correlatie tussen gewogen- en niet gewogen totaalscores. Het is dus beter om langere testen te maken, waardoor de betrouwbaarheid toeneemt, en goed na te denken over de inhoud van de items, waardoor de validiteit toeneemt.

    Welke invloed heeft het gebruik van de computer gehad op het testen?

    Veel tests kunnen ook per computer afgenomen worden (zoals de NEO-persoonlijkheidsvragenlijst). De onderzochte krijgt op het scherm een stimulus of item te zien en moet reageren via het toetsenbord, waarna de volgende verschijnt. De respons wordt direct gecodeerd en na afloop volgt de testscore plus eventuele andere informatie (zoals scores op de deeltests of normen). Er wordt onderscheid gemaakt tussen de technologische en de wetenschappelijke bijdrage van de computer aan de testpraktijk.

    1. Technologische bijdragen. Afneming, opslag en administratie van items, administratie van testgegevens en psychologische rapportage.
    2. Wetenschappelijke bijdragen. Inhoudelijke psychologische veranderingen en psychometrische veranderingen door het gebruik van de computer.

    Welke technologische bijdragen en veranderingen had de computer op het testen?

    Administratieve veranderingen. Het gegevensbestand is door de computer geautomatiseerd en de terugkoppeling van de resultaten gebeurt snel. Tevens is een test in de computer eenvoudig te veranderen.

    De itembank. In een itembank kan men een grote verzameling items aanleggen en opslaan, dat is voornamelijk nuttig in het onderwijs (zoals een tentamenbank). Behalve het item zelf worden er ook andere gegevens opgeslagen, zoals psychometrische gegevens over de moeilijkheid, de kwaliteit van de afleiders, administratieve gegevens, het onderwerp waar het item over gaat en of het gaat om kennis of inzicht.

    Het geautomatiseerde systeem van Nitko en Hsu (1984) voor leerkrachten op scholen. Het systeem bestaat uit drie componenten: (1) een bestand met gegevens van leerlingen en van schoolklassen, (2) een onderdeel van itemanalyse en (3) de mogelijkheid om zelf een itembank te maken en de vorige te veranderen. De drie onderdelen kunnen met elkaar communiceren.

    On-line testing van Baker. Dat is een test waarbij de leerling kan zelf bepalen of hij de stof beheerst en de computer vraagt om een toets. Het nadeel hiervan is dat er surveillance nodig is om te voorkomen dat items uitlekken of dat iemand anders de toets maakt.

    Een andere toepassing in het onderwijs is het diagnostisch toetsen (McArthur & Choppin, 1984). Deze test ontdekt deficiënties in deelvaardigheden, waar aan gewerkt zou kunnen worden (bijvoorbeeld wiskundige problemen waarbij diverse vaardigheden nodig zijn om een probleem op te kunnen lossen).

    Een andere technologische verandering is de vorm van de aangeboden items. Het kan nu via bewegende beelden op de computer en men kan kijken hoe de proefpersoon daar op reageert.

    Welke wetenschappelijke bijdragen en veranderingen had de computer op het testen?

    Het meten van intelligentiecomponenten. Hunt en Pell (1985) menen dat de computer ingezet kan worden bij de meting van intelligentiecomponenten zoals individuele verschillen in ruimtelijk-visueel redeneren, geheugen en aandacht en ook bij individuele verschillen in leerpotentieel.

    Een probleem door het gebruik van computers bij het testen van personen kan zijn dat men door testangst en door ervaring met computers verschillen krijgt in testprestatie. Dit is te ondervangen door veel te oefenen met computers. Toch blijft er een verschil bestaan, vergelijkbaar met verschillen in taalbeheersing.

    Uit onderzoeken naar de verschillen in testprestatie bij het testen met computers en met de conventionele methoden blijkt dat deze verschillen niet groot zijn. Toch is het raadzaam de normen van conventionele tests niet zomaar toe te passen bij computergestuurde tests.

    Er zijn een aantal verschillen tussen conventionele en computergestuurde tests. Het is onmogelijk om bij computergestuurde tests items over te slaan zonder een toets in te drukken (‘passive omitting’) hierdoor ontstaat er een andere verdeling van itemscores dan bij conventionele tests. Ook is er een verschil in presentatie en vormgeving. Deze factoren lijken weinig invloed te hebben op de testprestaties.

    Wat is adaptief testen?

    Adaptief testen is testen op maat. Iedere respondent krijgt een test op zijn of haar niveau. Dat levert meer informatie op over het niveau en de test zal niet te moeilijk of te makkelijk zijn, waardoor het minder frustrerend is. Het idee berust op de item-responstheorie. Als de moeilijkheid van het item en het niveau van de persoon samenvallen, is de meting het meest nauwkeurig; dan is de subjectieve kans op een positief antwoord 0.5 (middelmatige moeilijkheid: de kans op een goed antwoord is even groot als de kans op een fout antwoord).

    Het afstemmen van items op het niveau van de persoon gaat als volgt: de respondent krijgt één of meerdere items die in de populatie een gemiddelde moeilijkheid hebben, op basis van zijn itemscores maakt de computer een eerste schatting van de meetwaarde van die persoon. Het volgende item wordt zo gekozen dat de moeilijkheid samenvalt met deze meetwaarde. Op basis daarvan en van de eerste schatting wordt een nieuwe schatting gemaakt (met een iets grotere nauwkeurigheid). Op basis van die schatting wordt het volgende items gekozen. Dit gaat door tot er een meetwaarde geschat is die een goede nauwkeurigheid heeft, dan is de testsessie klaar. Deze stapsgewijze bepaling van iemands meetwaarde heeft een aantal kenmerken:

    1. De schatting van iemands meetwaarde komt met iedere stap dichter bij de gezochte waarde, en de moeilijkheid en meetwaarde komen steeds meer overeen.
    2. De schatting is nauwkeuriger als er meer items zijn gepresenteerd – als men lang genoeg door gaat, is het zelfs perfect (praktisch niet haalbaar, maar dat hoeft geen probleem te zijn).

    Om achteraf de scores van verschillende respondenten te kunnen vergelijken is een itembank nodig van ten minste 150 à 200 items. Metingen binnen de item-responstheorie zijn onafhankelijk van het moeilijkheidsniveau van de test (ze kunnen daarvoor gecorrigeerd worden). De voorwaarde is dat de itembank helemaal moet voldoen aan de eisen van de item-responstheorie.

    De klassieke standaardtest is een slecht meetinstrument voor personen met extreme waarden; ze worden onnauwkeurig getest. Terwijl bij adaptief testen iemand wel items krijgt op zijn of haar niveau. Volgens Weiss (1985) meet een adaptieve test even nauwkeurig als een standaardtest als het ongeveer een half maal de lengte van een standaardtest heeft (vuistregel).

    Drie toepassingen van adaptief testen binnen de onderwijsevaluatie zijn (1) het bepalen of iemand geslaagd is, (2) of iemands prestatie binnen de grenzen van een specifiek interval ligt en (3) of iemand in een specifiek leerstofgebied voortgang heeft geboekt (Weiss & Kingsburry, 1984).

    Op welke manieren kunnen de scores bewerkt worden en wat zijn normen?

    Ruwe score

    De gewone basisscore van iemand noemen we de ruwe score, dat is de som van de scores X op alle k items g

    Bewerkte score

    De ruwe score heeft op zichzelf weinig betekenis, maar moet bewerkt worden om betekenis te krijgen. Er zijn drie soorten bewerkte scores:

    1. Gebaseerd op een vergelijking met een absolute standaard.
    2. Gebaseerd op een deling (door bijvoorbeeld leeftijd of schoolklas): ervan onafhankelijk gemaakt.
    3. Gebaseerd op de relatieve positie in een referentiegroep: genormeerde scores, waarvan er twee soorten zijn, namelijk (1) gebaseerd op een rangorde van de ruwe scores, zoals percentielen, en (2) gebaseerd op het gemiddelde en de spreiding van de ruwe scores, zoals standaardscores.

    Normen

    Niet bij elke bewerkte score is er sprake van een norm. Soms kunnen bewerkte scores afhankelijk zijn van de prestaties van anderen, zonder dat er sprake is van een testnorm, bijvoorbeeld in een klas. Een norm is een referentiekader voor de evaluatie van de ruwe scores, gebaseerd op de verdeling in de populatie. Het kader wordt geschat op basis van een representatieve steekproef. Uit deze definitie blijkt dat:

    1. Normen afhankelijk zijn van de normeringssteekproef die gebruikt is.
    2. Door normering hebben toevalligheden van de groep geen invloed op de beoordeling van het individu.
    3. De prestatie van het individu kan los van de groep beoordeeld worden door normen (bijvoorbeeld de CITO geeft aan waar iemand staat in de populatie, niet in zijn klas).

    Het gebruik en de berekening van normen is niet noodzakelijk. Men kan soms ook een eenvoudigere vorm van bewerkte scores gebruiken, zoals rangschikking of het percentage goede antwoorden. Dit is handig bij het kiezen uit een groep sollicitanten. Bovendien kan men soms ruwe scores gebruiken. Met name als het gaat om het verband tussen test- en criteriumscores zijn er geen bewerkte scores nodig.

    Er is een vloeiende overgang van de vergelijking binnen een onderzochte groep naar het gebruik van normen. Als de onderzochte groep groter wordt en meer op de populatie lijkt, lijkt het meer op vergelijken met een norm. De twee belangrijke punten bij het gebruik van normen bij het normerings- of testonderzoek zijn (1) dat de kenmerken van de onderzochte groep vermeldt moeten worden en (2) dat er rekening gehouden moet worden met veranderingen in de populatie, met een mogelijk normherziening als gevolg. Dat laatste geldt ook voor vertaalde testen: meestal verliezen normen bij een testvertaling hun waarde.

    Hoe kunnen de testprestatie vergeleken worden met een absolute standaard?

    De prestatie van een persoon wordt in de eerste instantie niet vergeleken met de prestatie van anderen, maar met een absolute maatstaf die gebaseerd is op psychologische of onderwijskundige analyse van kennis, inzicht of vaardigheden. Men noemt deze vorm van meten ook wel de 'criterion-reference measurement', het absoluut meten. Daartegenover staat de 'norm-reference measurement', het normatief meten.

    Het is niet zo goed bruikbaar bij het vergelijken van proefpersonen, zoals binnen de psychologie veel gebeurt. Vergelijkingen met een absolute standaard komt met name voor binnen onderwijskunde. Daar is men meer bezig met het beoordelen in welke mate welke leerlingen een bepaald doel hebben bereikt (hoeveel kennis en vaardigheid ze hebben verworven). Dat is onafhankelijk van hoe de medeleerlingen gepresteerd hebben.

    Absoluut meten is arbitrair en discutabel als men niet eerst de doelen van het proces dat men bij de onderzochte wil evalueren geanalyseerd heeft, en of dat wel op een betrouwbare manier getest kan worden.

    Wat zijn verhoudingsnormen en hoe kan dat toegepast worden?

    De testscores worden gedeeld door een andere variabele en als zodanig onafhankelijk gemaakt van de betreffende variabele, bijvoorbeeld IQ is de Mentale Leeftijd gedeeld door de Chronologische Leeftijd vermenigvuldigd met 100. 

    De mentale leeftijd wordt bepaald door een test, een kind moet opdrachten maken in oplopende moeilijkheid. In theorie maakt een kind tot aan een bepaalde mentale leeftijd de opdrachten goed en daarna lukt het niet meer. Maar in de praktijk begint een kind steeds meer fouten te maken of slaat een lastige vraag over. De laatste leeftijd waarop in de test nog geen fouten worden gemaakt, noemt men de basale leeftijd.

    Hierbij maken we wel een aantal kritische kanttekeningen:

    1. De mentale leeftijd is een testscore en geen leeftijdsmaat. De chronologische leeftijd is eigenlijk ook geen leeftijdsscore maar de verwachte testprestatie van iemand op die leeftijd. Het gaat dus om de vergelijking met de prestaties van anderen. Men gaat er bovendien vanuit dat er boven de vijftien jaar geen verschillen meer zijn tussen de verschillende leeftijden.

    2. Het IQ-begrip is geen constante factor. Want het blijkt dat:

      • Sommige vragen afhankelijk zijn van zowel vorming en scholing als van intelligentie.

      • Bij sommige kinderen de lichamelijke en fysiologische groei (die invloed heeft op de psychologische groei) niet parallel loopt aan de gemiddelde intelligentiegroei.

      • Leermogelijkheden, motivatie en emotionele bereidheid invloed hebben op intelligentie en op de verschillen tussen leeftijdsgenoten.

    3. Normaal blijft men bij het berekenen van het IQ boven de hoogste leeftijd waarop de test nog onderscheidt, steeds delen door de topleeftijd (meestal 15, 16 of 17 jaar). Maar op hogere leeftijd nemen intellectuele prestaties af, en er is geen correctie daarvoor.

    4. Er is geen sprake van een evenredige toename van spreiding bij hogere leeftijden. Een achterstand van een jaar op zesjarige leeftijd is twee keer zo erg als een jaar achterstand op twaalfjarige leeftijd.

    Conclusie: Ondanks deze bezwaren heeft intelligentie wel waarde als ontwikkelingsbegrip, via intelligentie kan men vaststellen of een kind voor of achter is op leeftijdsgenoten.

    Wat zijn vergelijking en normen gebaseerd op een rangorde?

    Rangorde

    De eenvoudigste manier om de testprestaties tussen individuen te analyseren, is door middel van rangordening. Een bepaalde score voor een bepaalde positie wordt gebaseerd op de groep waar men in zit. Er is geen sprake van een norm. Het nadeel is dat het niets betekent buiten de bewuste groep.

    Percentielscores en percentiele normen

    Percentielscores zijn zeer populair en kennis van groepsgrootte is niet vereist. Er zijn 99 punten (percentielen) die een scoreverdeling opdelen in 100 groepen van gelijke grootte, elk 1% van de waarneming. Bijvoorbeeld iemand met een ruwe score waarbij het de percentiel score 0.87 hoort, heeft een percentiel rang van 87, dat wil zeggen dat 87% van de testscores van de normgroep daarbeneden ligt. De bekendste percentielen zijn: P50 (mediaan), P25 (eerste kwartiel, Q1) en P75 (derde kwartiel, Q3).

    Een probleem is dat bij een relatief grote groep van onderzochten met dezelfde ruwe score er weinig differentiatie mogelijk is in de percentielscores. Dit kan men oplossen via lineaire interpolatie: bijvoorbeeld 21% van de getesten heeft een ruwe score van 66 of lager en 27% heeft een ruwe score van 67 of lager. Dan heeft 6% een ruwe score gelijk aan 67. De percentielscore die bij deze ruwe score hoort is dan als volgt te berekenen: 21 + 0.5 (27-21) = 24.

    Door scores aan te duiden in percentielscores is men niet meer afhankelijk van de absolute groepsgrootte maar wel van niveau, spreiding en toevallige kenmerken van de groep. Percentiele normen daarentegen zijn niet afhankelijk van groepskenmerken. De voordelen percentiele normen zijn:

    • Denvoudig en snel te berekenen.
    • Gemakkelijk toe te passen.
    • Inzichtelijk en ook te begrijpen voor niet-deskundigen.

    Een nadeel van percentielscores is dat het gaat om een ordinale schaal waardoor er (1) geen deelbewerkingen mogelijk zijn (er mogen met percentielscores geen gemiddelden en varianties berekend worden) en (2) het zinloos is de frequentieverdelingen van percentiele en ruwe scores te vergelijken (alle frequentieverdelingen van percentielscores zijn gelijk en rechthoekig van vorm).

    Percentielen verdelen het aantal scores in 100 groepen, decielen verdelen de scores in 10 gelijke klassen en vigintielen: verdelen de scores in 20 gelijke klassen

    Rangordescores en -normen zijn daar bruikbaar waar men snel een beeld wil hebben van de relatieve positie van de onderzochte in een groep of in de populatie. Ze hebben teveel tekortkomingen voor wetenschappelijk onderzoek.

    Wat zijn vergelijking en normen gebaseerd op gemiddelde en spreiding?

    Standaardscores en -normen hebben niet dezelfde bezwaren als percentiele normen, namelijk de ordinale schaal en de onvergelijkbaarheid. Er is een verschil tussen standaardscores (ruwe scores onderverdeeld in standaardscore-eenheden) en standaardnormen (bij een representatie van een populatie).

    Standaardscores of z-scores

    Een standaardscore geeft aan hoeveel standaardafwijkingen (is een spreidingsmaat) een score boven of onder het gemiddelde ligt. Alle oorspronkelijke scores worden uitgedrukt in afwijkingen van het gemiddelde (de teller van de formule). Deze afwijkingen worden uitgedrukt in eenheden van de oorspronkelijke standaarddeviatie; door ze te delen door deze standaarddeviatie (de noemer van de formule):

    (z = standaardscore, X = ruwe score, X = gemiddelde, SX = standaarddeviatie).

    Van de ruwe score (X) wordt het gemiddelde (X̄) afgetrokken: de afwijkingsscore. De afwijkingsscore wordt gedeeld door de standaarddeviatie van X (SX). Er blijft dan een positief of negatief getal over:

    • Negatieve standaardscores: ruwe scores die onder het gemiddelde liggen.
    • Positieve standaardscores: ruwe scores die boven het gemiddelde liggen.

    Omdat men soms kleine of negatieve getallen lastig vindt, kun je met lineaire transformatie de scores transformeren zodat het gemiddelde op 100 of 50 ligt en de spreiding op 10 of 20 (als gevolg van lineaire transformatie verandert alleen het gemiddelde en/of de standaarddeviatie en niet de onderlinge afstand tussen de scores of de vorm van de scoreverdeling). Standaardscores behouden dezelfde verdelingskenmerken als ruwe scores (behalve dus het gemiddelde en de standaarddeviatie).

    Genormaliseerde standaardscores

    Genormaliseerde standaardscores worden verkregen uit niet-lineaire transformaties die de verdeling van X dusdanig vervormen dat er wel een normaalverdeling ontstaat: sommige score-eenheden worden uitgerekt, anderen ineengedrukt. Zo ontstaat een verdeling met percentages die afgeleid zijn uit de eigenschappen van een normaalverdeling:

    • 34% van de groep valt tussen X̄ en (X̄ + 1SX) en tussen X̄ en (X̄ – 1SX) (binnen 1 standaarddeviatie).

    • 13.5% valt tussen (X̄ + 1SX) en (X̄ + 2SX) en tussen (X̄ – 1SX) en (X̄ – 2SX) (tussen 1 en 2 standaarddeviaties).

    • 2.5 % valt tussen (X̄ + 2SX) en (X̄ + 3SX) en tussen (X̄ – 2SX) en (X̄ – 3SX) (tussen 2 en 3 standaarddeviaties).

    Constructie: uitzoeken welke ruwe scores de percentages aangeven die horen bij de standaardscore-eenheden in een normaalverdeling. Deze ruwe scores worden omgezet in genormaliseerde standaardscores. Deze normalisering suggereert een normaalverdeling, ook al gold dat niet voor de ruwe scores – soms kan deze kunstmatige ingreep nauwelijks gerechtvaardigd worden. Een uitzondering hierop is als men weet uit eerder onderzoek (met een grotere steekproef) dat de testscores bij benadering normaal verdeeld zijn. Dan kan men hiermee steekproefonregelmatigheden gladstrijken.

    Bezwaar: normalisering is vaak problematisch omdat het niet strookt met de werkelijkheid. Hypothetische begrippen (zoals intelligentie) zijn anders dan meetbare begrippen (zoals lengte en gewicht) die wel normaal verdeeld zijn: een hypothetische eigenschap is afhankelijk van de meetmethode: de test beïnvloedt de vorm van de verdeling. Met ingrepen is de verdeling dan wel normaal te maken, maar dat is geen bewijs dat intelligentie ook normaal verdeeld is.

    Rechtvaardiging: vanwege het gemak en de bruikbaarheid. De testscores hebben geen verdere uitleg nodig, scores zijn vergelijkbaar etc. Het gebruik ervan veronderstelt een intervalschaal (met gelijke eenheden): dit onderscheidt ze ten opzichte van andere bewerkte scores (maar dit gemak is niet altijd een sterk argument voor deze transformatie).

    Overige genormaliseerde standaardscores

    1. T-scores: Men gaat uit van een gemiddelde van vijftig een spreiding van tien. Veel tests zijn op deze manier genormaliseerd (op advies van de APA).

    2. Stanines: Er is niet (zoals bij T-scores) sprake van een exacte overeenkomst met een bepaalde ruwe score maar ze vertegenwoordigen een breedte van een halve standaarddeviatie. Ze lopen van 1 tot 9 en het midden van de 5e stanine komt overeen met het gemiddelde van de verdeling. De toekenning gebeurt op basis van een tabel. Het gebruik ervan is aantrekkelijk, omdat het aantal mogelijke scores beperkt is en vanwege de associatie rapportcijfers. Maar, rapportcijfers lopen van 1 tot 10 en het cijfer 6 staat voor een ‘voldoende’, terwijl op de stanineschaal 5 het gemiddelde is. Sommigen vinden de stanineschaal te grof is, met name in het midden van de verdeling.

    3. Deviatie-IQ: Er is geen sprake van een quotiënt maar van standaardnormen met een gemiddelde van honderd. Dus de mentale leeftijd wordt niet met de chronologische leeftijd vergeleken, maar de testprestaties worden per leeftijdsklasse verwerkt tot genormaliseerde standaardscores, zoals bijvoorbeeld bij de WAIS.

    Access: 
    Public
    Wat is betrouwbaarheid? - Chapter 6

    Wat is betrouwbaarheid? - Chapter 6

    Betrouwbaarheid wordt in dit hoofdstuk belicht vanuit de betekenis van herhaalbaarheid van metingen. Met herhaalbaarheid bedoelt men dat een test twee of meer keer aan dezelfde persoon wordt voorgelegd onder dezelfde condities. Men kijkt dan naar de variatie in de testscores. Deze koppeling tussen herhaalbaarheid en betrouwbaarheid roept twee vragen op:

    • Is het zinvol metingen van psychologische eigenschappen bij een specifieke persoon te herhalen?
    • Wat wordt bedoeld met gelijkblijvende condities tijdens testafname?

    Wat is herhaalbaarheid van metingen?

    Is het zinvol metingen van psychologische eigenschappen bij een specifieke persoon te herhalen?

    Het antwoord is nee, herhaalde metingen van dezelfde eigenschappen bij dezelfde persoon zijn niet zinvol omdat er twee effecten kunnen optreden:

    1. Geheugeneffect. Een test levert dezelfde score op omdat de persoon de antwoorden herinnert.
    2. Leereffect. De testscore neemt toe omdat de persoon tijdens het beantwoorden bijleert.

    Er is dus sprake van geheugen en leerprocessen. Dit zal na verloop van tijd weer stabiliseren. Maar dit is een geconstrueerd voorbeeld en niet empirisch aangetoond. We moeten het herhalen van metingen zien als hypothetisch, als een gedachte-experiment. Herhaalde metingen worden ook wel onafhankelijke replicaties genoemd.

    Wat wordt bedoeld met gelijkblijvende condities tijdens testafname?

    Onder gelijkblijvende condities vallen:

    • Kenmerken van de testomgeving en testprocedure (items, instructie, testruimte etc.).
    • Psychologische eigenschappen van de persoon, die voor de meting relevant zijn: De betrouwbaarheid wordt door zowel de bedoelde (bijvoorbeeld numerieke vaardigheden) als de onbedoelde eigenschappen (bijvoorbeeld woordbegrip) bepaald en ook de emotionele reacties die items kunnen oproepen bepalen mede de betrouwbaarheid. De mogelijkheid dat personen tussen afnemingen veranderen op één of meer relevante eigenschappen blijft wel openstaan. Voorwaarde hiervoor is wel dat de veranderingen kenmerkend is voor de eigenschap zelf (bijvoorbeeld motivatie, emotionaliteit en stemming) en niet veroorzaakt wordt door het testen zelf – en dus onafhankelijk zijn.
    • Lichamelijke en fysiologische processen (bijvoorbeeld motoriek en waarneming).

    Het gedachte-experiment houdt rekening met het feit dat personen van afname tot afname veranderen met betrekking tot één of meer relevante eigenschappen. Het blijkt dat testscores toch verschillen bij gelijkblijvende condities. Dit komt doordat invloeden op testprestaties onsystematisch en onvoorspelbaar verschillen bij het herhalen van een test. Voorbeelden van factoren die toevallig invloed hebben op testgedrag zijn: black-out, opeens een helder moment, plotselinge hoestbui, slaperigheid etc. Het probleem is dat deze factoren onduidelijk zijn en ook niet duidelijk is in welke mate ze een testprestatie beïnvloeden. Maar ze moeten gebonden zijn aan een specifieke testsessie, anders is het geen onvoorspelbaar toevallig optredend fenomeen meer, maar een eigenschap die ook mede bepalend is voor de testprestatie.

    De klassieke testtheorie houdt zich bezig met het in kaart brengen van de relatieve inbreng op de testprestatie van (1) onvoorspelbare invloeden en (2) systematisch werkzame eigenschappen (van de persoon en van de testsituatie).

    Onafhankelijke replicaties zijn de hypothetische herhaalde metingen waarin (1) de verschillende metingen onafhankelijk van elkaar zijn (geen leereffecten en geen herinneringen), (2) de testsituatie onveranderd blijft en (3) alle voor de meting relevante eigenschappen van de persoon van invloed zijn op diens testprestatie. In deze situatie zijn ook steeds factoren aanwezig die de testprestatie op onvoorspelbare manier beïnvloeden.

    Wat is de klassieke testtheorie?

    De klassieke testtheorie stamt uit het begin van de vorige eeuw (Spearman, 1904), de eerste uitwerking werd gedaan door Gullikson (1950) en de eerste definitieve formulering door Novick (1966). Daarna was er met name aandacht voor een nieuwe klasse van testmodellen: de item-responstheorie.

    Wat zijn de betrouwbare score en de meetfout?

    In de klassieke testtheorie gaat men er vanuit dat iemands testscore (Xij) bestaat uit: Xij = Ti + Eij/

    1. Betrouwbare score (Ti): het constante systematische deel. De gemiddelde geobserveerde score die persoon i heeft behaald over een groot aantal (q) onafhankelijke replicaties van de test.

    2. Meetfout (Eij): een aantal toevallige, niet-systematische componenten die op onvoorspelbare wijze per herhaling variëren, gedefinieerd als: Eij = Xij - Ti.

    T is afkomstig van True score (betrouwbare score) en E van Error (meetfout). Een bezwaar tegen het gebruik van de naam true (ware) score is dat het lijkt of de score refereert aan iets wat buiten de testsituatie bestaat, maar dat is niet waar, het gaat om de gemiddelde representatieve testprestatie. Een nuchtere indicatie van wat iemand gemiddeld presteert (capaciteiten) of aan gedrag laat zien (persoonlijkheidstrekken), ontdaan van toevalligheden. In de sport is men weliswaar geïnteresseerd in uitschieters (toevallige hogere scores), maar in het maatschappelijk leven wil men stabiliteit.

    Een betrouwbare score heeft ook een psychologische betekenis: als de test volgens doordachte psychologische principes tot stand is gekomen (vanuit een theorie), dan zal de testscore samenhangen met andere psychologische variabelen. Met de testscore is het dan mogelijk gedrag buiten de testsituatie te voorspellen.

    De definitie van de meetfout is tautologisch (gebaseerd op een cirkelredenering): de meetfout is het resterende deel van de geobserveerde score wanneer de betrouwbare score ervan afgetrokken is. Het is dus geen referentie aan oorzaken van meetfouten die buiten de test en testsituatie bestaan.

    Welke eigenschappen hebben de betrouwbare score en de meetfout voor het individu?

    Er zijn twee eigenschappen af te leiden voor persoon i over q onafhankelijke replicaties van een specifieke test:

    1. De gemiddelde meetfout is gelijk aan nul: positieve en negatieve invloeden vallen tegen elkaar weg.

    2. De spreiding van persoon i is gelijk aan de spreiding van de geobserveerde scores.
      De standaarddeviatie S(Ei) is en kan, als de betrouwbare score (Ti) gelijk is aan de gemiddelde geobserveerde score, herschreven worden als: S(Ei) = S(Xi).

    De standaardmeetfout is de standaarddeviatie van de meetfout van persoon i. Men gaat er in de klassieke testtheorie vanuit dat de standaardmeetfout voor alle mensen die de test afleggen gelijk is, ongeacht hun ware T-score, maar dat is niet altijd realistisch. Bijvoorbeeld bij meerkeuzevragen is de standaardfout van mensen die veel gissen (lage T) groter dan van mensen die veel goede antwoorden weten (hoge T).

    Bij het meten van fysische kenmerken (zoals lengte) is de standaardmeetfout erg klein, maar bij psychologische eigenschappen (zoals intelligentie) is er wel een aanzienlijke standaardmeetfout. De reden hiervoor is dat onderlinge psychologische processen met behulp van een test niet zo nauwkeurig kunnen worden beschreven als fysische processen met de daarvoor geschikte meetapparatuur. Dat wordt veroorzaakt door allerlei factoren die niet kunnen worden gecontroleerd en die per meting een onvoorspelbare invloed hebben.

    Welke eigenschappen hebben de betrouwbare score en de meetfout in de populatie?

    Het gaat hierbij om een populatie van personen waarbij van ieder individu één testscore beschikbaar is. Voor een willekeurig persoon i is het testmodel nu: Xi = Ti + Ei. We maken twee vooronderstellingen over meetfouten:

    1. De gemiddelde meetfout is gelijk aan nul.
    2. De meetfouten correleren met geen enkele andere variabele waar ze geen van uitmaken: r(E,Y) = 0.
      • Meetfouten correleren wel met variabelen waar wel wel deel van uitmaken: r(E,X) > 0.
      • Meetfouten en betrouwbare score correleren niet met elkaar: r(E,T) = 0.

    Er zijn twee eigenschappen af te leiden over het gemiddelde en de variantie van de geobserveerde score in de populatie:

    1. De gemiddelde geobserveerde score is gelijk aan de gemiddelde betrouwbare score.
    2. De variantie van de geobserveerde score is gelijk aan de som van de variantie van de betrouwbare score en de variantie van de meetfout: S2 (X) = S2 (T) + S2 (E).

    Wat is de betrouwbaarheid van testscores en de standaardmeetfout?

    Wat is de definitie van betrouwbaarheid?

    De betrouwbaarheid (rXX’) van de testscore gemeten in een populatie van personen is de verhouding van de variantie van de betrouwbare score en de geobserveerde score.

    Wat zijn acceptabele waarden van betrouwbaarheid?

    De betrouwbaarheid ligt tussen 0 en 1. Daar zijn drie dingen van af te leiden:

    1. De betrouwbaarheid is niet-negatief: we nemen aan dat de variantie van X is altijd groter dan 0 want niet iedereen heeft dezelfde testscore. De variantie van T is dan niet negatief, dus de betrouwbaarheid is ook niet negatief.

    2. De minimumwaarde is 0: de minimumwaarde van de betrouwbaarheid is gelijk aan 0 als de teller S2 (T) gelijk aan 0 is. Dan hebben alle personen dezelfde betrouwbare score en is alle geobserveerde variatie te wijten aan meetfouten; de test meet geen enkel betrouwbaar verschil en is dus als test mislukt.

    3. De maximumwaarde is 1: als de variantie van de meetfouten S²(E) gelijk is aan nul, dan is S²(T) = S²(X) . De betrouwbaarheid is dan gelijk aan 1; iedereen heeft dezelfde meetfout. Maar omdat de gemiddelde meetfout ook gelijk is aan 0, betekent dit dat we iedereen zonder meetfouten meten, zodat X = T . Dan is de meting dus foutenvrij; de testscore dus gelijk aan de betrouwbare score en de betrouwbaarheid is dan 1.

    Er wordt onderscheid gemaakt tussen twee belangrijke praktische situaties van testen:

    1. Wetenschappelijk onderzoek: dan gaat het om uitspraken over groepen – dus niet over individuele testprestaties – en schat men groepsgemiddelden en correlaties. Bij een te lage betrouwbaarheid bestaat de testprestatie voornamelijk uit meetfouten en is het moeilijk om verschillen in gemiddelden en correlaties te vinden die niet gelijk zijn aan 0. Men houdt als vuistregel een betrouwbaarheid aan die hoger is dan 0.7.

    2. Individuele diagnostiek: dan gaat het over beslissingen over individuen, en moet de betrouwbaarheid hoog zijn. Er is geen harde ondergrens omdat het uiteindelijk gaat of individuele testscores significant van elkaar of van een aftestgrens verschillen – en daarvoor biedt een minimum betrouwbaarheidseis geen garantie. De vuistregel is een betrouwbaarheid die hoger is dan 0.9.

    Wat is de standaardmeetfout van de testscore?

    De standaardmeetfout van de testscore kan worden afgeleid uit de vorige twee formules en wordt geschreven als.

    In de klassieke testtheorie zijn betrouwbaarheid en standaardmeetfout erg belangrijk omdat:

    • Ze nuttig zijn bij het schatten van de nauwkeurigheid van een meting met behulp van een specifieke test in een specifieke populatie.
    • Ze een indruk kunnen geven van de mate waarin de testscores bij een onafhankelijke replicatie van de meting zouden verschillen.

    Welke belangrijke onderscheidingen kunnen er gemaakt worden?

    Net als opsplitsing van een geobserveerde score in een betrouwbaar en een toevallig deel kunnen we een testscore opsplitsen in een bedoeld en een onbedoeld deel. Als voorbeeld een test die rigiditeit meet, maar waarbij sommige items ook een emotionele of agressieve reactie kunnen oproepen. Ook kan woordbegrip bij enkele items een rol spelen:

    1. Bedoelde scorecomponent: de rigiditeitstrek.
    2. Onbedoelde scorecomponent: emotionaliteit, agressiviteit, woordbegrip – en bevat daarnaast ook de meetfout.

    Dus: het onbedoelde scorecomponent valt niet samen met de meetfout en het onbedoelde scorecomponent valt niet samen met de betrouwbare score. Het is ook belangrijk om in te zien dat een test met een hoge betrouwbaarheid niet noodzakelijk betekent dat men datgene meet wat men bedoelt te meten.

    Hoe kan de betrouwbaarheid bepaald worden?

    Er zijn twee bepalingen van de betrouwbaarheid te noemen:

    1. Herhaalde meting. Deze bestaat uit:

    • De parallelvormmethode, hierbij gebruikt men paralleltests. Deze tests zijn equivalent en inwisselbaar.
    • De test-hertestmethode, hierbij gaat het om het tweemaal afnemen van dezelfde test.

    2. Eenmalige meting. Deze bestaat uit:

    • De splitsingsmethode waarbij men een test splitst in twee helften, elke helft bevat evenveel items.
    • De interne-consistentiemethode, covariantie tussen alle individuele items.

     

    Herhaal de metingParralelvormmethodeParraleltest
     Test-hertestmethodeDezelfde test
    Eenmalige metingSplitsingmethodeTwee helften
     Interne-consistentie methodeItems 

    Wat is de parallelvormmethode?

    In plaats van tweemaal dezelfde test, kan men twee inwisselbare, maar niet identieke tests gebruiken. De correlaties tussen scores van twee paralleltests zijn gelijk aan de betrouwbaarheid van de afzonderlijke testscores. Test I en II zijn parallel als voor de scores XI en XII geldt dat:

    1. Persoon i heeft op beide tests identieke betrouwbare scores: TiI = TiII.

    2. De spreiding (variantie) van de ruwe score in de populatie is gelijk op beide tests: S2 (XI) = S2 (XII).

    Lord en Novick spreken bij deze vooronderstellingen van pseudo-parallellie.

    Uit deze eigenschappen volgt dat de correlatie tussen XI en XII gelijk is aan de betrouwbaarheid van zowel XI als XII apart: r(Xi,XII) = rXX' dus de betrouwbaarheid is de correlatie tussen de twee parallelle testscores.

    Als men twee versies heeft gemaakt, is het mogelijk achteraf te controleren of ze daadwerkelijk parallel zijn. Als twee testversies I en II parallel zijn, dan moeten de volgende drie eigenschappen gelden voor de ruwe scores XI en XII:

    1. De gemiddelde geobserveerde scores op beide tests zijn gelijk: x̄I = x̄II.

    2. De varianties van geobserveerde scores zijn gelijk: S2 (XI) = S2 (XII).

    3. De correlaties van XI en XII met variabele Y (criterium) zijn gelijk: r(XI,Y) = r(XII,Y).

    De derde eigenschap is de belangrijkste; de eerste twee kan eenvoudig bereikt worden door de testscores te standaardiseren. De derde eigenschap kan in de praktijk maar voor een beperkt aantal variabelen Y worden onderzocht, maar dat hoeft geen probleem te zijn: als XI en XII dezelfde correlaties hebben met bijvoorbeeld vijf onderling laag correlerende variabelen (Y1, …, Y5), dan volgen hieruit zoveel beperkingen voor de andere correlaties dat de correlatie tussen TI en TII wel hoog moet zijn.

    In de praktijk bestaan er geen echte paralleltests, dus de correlaties tussen de scores op beide versies in de populatie zijn kleiner dan als het om echte paralleltests zou gaan.

    Wat is de test-hertestmethode?

    De test-hertestmethode is een poging om het ideaal van onafhankelijke replicaties te realiseren. Dezelfde test wordt met een behoorlijke tussentijd tweemaal aan dezelfde groep personen aangeboden. Als het onafhankelijke replicaties zijn dan is de correlatie tussen beide verkregen ruwe scores in de populatie gelijk aan de betrouwbaarheid van de test. Dus r(X1,X2) = rXX'. De test-hertest methode is een goede methode als er in de tijd tussen de twee tests geen veranderingen hebben plaatsgevonden met betrekking tot de eigenschap die door de test wordt gemeten. Het geeft dan een goede betrouwbaarheid.

    Vier redenen waarom r(X1, X2) soms geen goede maat voor betrouwbaarheid is:

    1. De testmethode zelf. Door het testen ontstaan leereffecten en geheugeneffecten waardoor er verschillen bij de tweede meting ontstaan. Dit is vooral het geval bij opvallende items, bij korte tests en bij een korte tijdsinterval tussen de afnames. Bovendien kan ook een attitude- of instellingsverandering optreden door kritische vragen in de test.

    2. Leer- en geheugeneffecten verschillen per persoon, dus veroorzaken niet dezelfde veranderingen bij iedereen.

    3. Men kan zich afvragen hoe groot het tijdsinterval moet zijn. Bij een klein interval is de kans op uitval klein, maar dan wordt de kans op herinnering en beïnvloeding wel groter.

    4. Uitval: de beschikbare groep proefpersonen wordt kleiner naarmate het interval langer is. Uitval is vaak niet aselect, bijvoorbeeld personen met extreme scores op een test van neuroticisme vallen vaker uit.

    Het voordeel is dat het iets vertelt over in hoeverre de testprestatie over een bepaalde periode stabiel blijft, inclusief alle krachten die tussentijds van invloed zijn. De correlatie geeft een indruk van de stabiliteit (dat wordt soms ook betrouwbaarheid genoemd, maar is een ander soort betrouwbaarheid).

    Wat is de splitsingsmethode?

    De splitsingsmethode is een efficiënte variant van de parallelvormmethode, omdat er twee halve tests gebruikt worden in plaats van twee hele tests. Men doet dit als volgt: men deelt een test in twee even lange helften die men de proefpersonen aanbiedt. Pas achteraf wordt per testhelft een ruwe score bepaald. Als beide scores echt parallel zijn dan is hun correlatie in de populatie gelijk aan de betrouwbaarheid van de scores op een halve test. Op basis van de correctie op de verkregen betrouwbaarheid wordt de betrouwbaarheid van de hele test bepaald. Om dit te kunnen bepalen moeten we twee dingen weten:

    1. Wat de invloed is van de testlengte op de betrouwbaarheid. Hiervoor wordt de Spearman-Brown formule gebruikt (K = verlengingsfactor, rXX’ = betrouwbaarheid, rKK = betrouwbaarheid verlengde/verkorte test).

    2. Wat de betrouwbaarheid van de hele test is via de splitsingsmethode (r22 = betrouwbaarheid op de gehele test).

    Deze formule gaat er vanuit dat de testdelen parallel zijn. Als dat niet zo is wordt de betrouwbaarheid lager. Het splitsen van een test levert nog geen zuivere parallellie op. Mogelijkheden tot het verhogen van parallellie zijn:

    1. De test niet splitsen in een makkelijke en moeilijke helft; moeilijke items kunnen iets heel anders kunnen meten dan makkelijke items. Dus het liefst moet er een gelijkmatige verdeling zijn van makkelijke en moeilijke items over beide tests.

    2. Geen splitsing in eerste en tweede helft van de test, omdat verveling, vermoeidheid etc. in de tweede helft kan optreden. Het is beter met even en oneven rangnummers te werken.

    3. Items op inhoud met elkaar paren: in de verschillende versies items plaatsen die qua inhoud veel op elkaar lijken. Het probleem is wel dat niet alle items met een ander item gepaard kunnen worden, maar toch verdeeld moeten worden.

    De samenstelling van twee parallelle testhelften is dus vaak arbitrair; het is lastig om een keuze te maken tussen diverse mogelijkheden. Een oplossing zou zijn om voor elke splitsingsmogelijkheid de betrouwbaarheid volgens de splitsingsmethode te schatten, en hier het gemiddelde van te nemen. Dit hoeft niet daadwerkelijk uitgevoerd te worden: Cronbachs alfa is een methode om de betrouwbaarheid te bepalen die precies gelijk is aan de gemiddelde splitsingsbetrouwbaarheid van alle mogelijke splitsingen van de test in twee helften.

    Wat is de interne-consistentie-methode?

    De interne-consistentie-methode is gebaseerd op het gegeven dat individuele items in een test inwisselbaar zijn. Inwisselbaarheid is minder streng gedefinieerd dan parallellie. Een test wordt eenmalig voorgelegd aan een (representatieve) groep, waarna alle covarianties tussen de items en de variantie van de ruwe score X worden berekend. Deze resultaten worden (samen met k) ingevuld in één van de coëfficiënten van interne consistentie die worden gebruikt als schatting van de betrouwbaarheid. De meest gebruikte zijn:

    • Alfacoëfficiënt: van Cronbach (1951) en is de meest bekende.

    • Lambda2-coëfficiënt: is de voorganger van de alfacoëfficiënt van Guttman (1945).

    • KR20-coëfficiënt: is een variant van Kuder en Richardson (1937) op alfa; alleen voor dichotoom gescoorde items.

    Waarom is alfa een ondergrens voor de betrouwbaarheid?

    In de populatie is alfa de ondergrens van de betrouwbaarheid: rXX’ ≥ alfa. Als alle items voornamelijk dezelfde eigenschap meten, komen de alfa en de betrouwbaarheid overeen. Dat betekent dus dat ingewikkelde procedures (parallelmethode, splitsingsmethode etc.) niet nodig zijn, maar dat de betrouwbaarheid gewoon met een formule te berekenen is. De basis van het bewijs voor deze stelling is als volgt:

    1. De variantie van elke variabele is groter of gelijk aan nul.

    2. De variantie van het verschil van betrouwbare scores op twee variabelen is niet-negatief.

    3. De covariantie tussen de betrouwbare scores op twee items Tg en Th kan geschreven worden als een gemiddeld product van afwijkingsscores.

    4. Meetfouten correleren nul met variabelen waar ze zelf niet inzitten.

    5. Het herschrijven van deze formules levert op dat de betrouwbaarheid gelijk is aan de alfacoëfficiënt.

    Volgens Novick en Lewis is alfa gelijk aan de betrouwbaarheid als de items voldoen aan een equivalentie-eis die minder streng is dan parallellie. Maar itemscores voldoen in de praktijk niet aan de eis van equivalentie. Dit houdt in dat alfa altijd een systematische onderschatting van de betrouwbaarheid oplevert.

    Wat is er te zeggen over alfa als ondergrens in relatie tot populatie en steekproef?

    Alfa is de ondergrens van de betrouwbaarheid in de populatie, maar in de praktijk wordt alfa geschat met behulp van een steekproef. Een grote representatieve steekproef (minstens 500 proefpersonen) benadert de waarde van alfa in de populatie. Hoe kleiner de steekproefgrootte, hoe meer de steekproeven door toeval van elkaar verschillen, hoe groter de fluctuatie in alfa – de geschatte waarde van alfa uit de steekproef kan zelfs hoger zijn dan de alfa in de populatie en dus hoger dan de werkelijke betrouwbaarheid.

    Hoe moet alfa geïnterpreteerd en gebruikt worden?

    Alternatieve formule. Een andere bekende vorm van alfa is die van Kuder en Richardson: KR20 . Die is gelijk aan alfa bij dichotoom gescoorde items.

    (pg = proportie goede antwoorden, qg proportie foute antwoorden).

    Berekening van Alfa. Om alfa te berekenen moeten we verschillende variabelen kennen en invullen, namelijk:

    1. Testlente k;

    2. Inter-item-covarianties: alle varianties tussen de items, dat zijn er ½k(k-1);

    3. Variantie van de testscores (gedefinieerd als de som van de itemscores), dat kan op twee manieren worden berekend, (1) door de testscore X in te vullen in formule voor de variantie en (2) door de formule voor de variantie van een somvariabele gebruiken.

    Varianties en covarianties kunnen worden geordend in een variantie-covariantiematrix.

    Selectie van items ter verhoging van alfa. Uit de formule voor alfa is af te leiden dat we het beste items kunnen selecteren waarvan de covarianties met de andere k–1-items in hoge mate positief zijn. Het is lastig te bepalen wanneer een item voldoende bijdraagt om geselecteerd te worden, daarom moeten items beoordeeld worden op hun correlatie met de somscore op de andere k–1-items; namelijk de item-restcorrelatie. De item-restcorrelatie van item g vat de informatie in de k–1 afzonderlijke covarianties handig samen. Per item hoeft er dus maar één item-restcorrelatie berekend en geïnterpreteerd te worden in plaats van k–1 inter-item-covarianties. Dat is efficiënter en wordt in de praktijk meer gebruikt.

    De mythe van interne consistentie. Alfa wordt vaak gebruikt als maat voor interne consistentie. In plaats van interne consistentie gebruikt men ook wel de term homogeniteit. Men bedoelt dan dat alfa aangeeft in hoeverre de items in een test dezelfde eigenschappen meten. Twee kritische noten bij deze opvatting met betrekking tot alfa:

    1. Alfa is in veel gevallen een toenemende functie van het aantal items in de test. Volgens Cronbach zou de interne consistentie van een test en het aantal items los van elkaar moeten staan. Maar een hoge waarde van alfa geeft aan dat de systematiek van de meting bepalender is dan toevallige score componenten in de testprestatie.

    2. Alfa kan een hoge waarde hebben terwijl de test in sterke mate heterogeen is. Alfa zegt dus niets over de homogeniteit van een test.

    Alfa kan dus beter niet gebruikt worden als maat voor interne consistentie of homogeniteit van een test. Het is beter alfa te gebruiken als ondergrens voor betrouwbaarheid want het geeft in de praktijk een systematische onderschatting van betrouwbaarheid weer. Voor een indruk van interne consistentie zijn technieken als factoranalyse en item-response modellen geschikt.

    Welke alternatieven voor alfa zijn er?

    1. De lambda2-coëfficient volgens Guttman geeft ook de ondergrens voor betrouwbaarheid van een test aan.

    2. Mucoëfficiënten: lambda2 en alfacoëfficiënt maken samen deel uit van een oneindig lange reeks ondergrenzen voor de betrouwbaarheid: de mucoëfficiënten. Ze zijn genummerd: mu0, mu1, mu2 etc. Een kenmerk van de mu-reeks is dat de coëfficiënten kunnen worden geordend naar oplopende grootte: mu0 ≤ mu1 ≤ mu2 ≤ mu3 ≤ ... ≤ rXX' (mu0 = alfa en mu1 = lambda2).

    In de populatie ligt lambda2 minstens zo dicht bij de betrouwbaarheid als alfa; dan kan men in de praktijk dus beter lambda2 gebruiken. Volgens Ten Berge en Zegers kan men zelfs beter mu2 of mu3 gebruiken bij een test met weinig items. Ze adviseren om over het algemeen mu1 (lambda2) te gebruiken. Opvallend is dat alfa vaker wordt gerapporteerd dan lambda2 (terwijl lambda2 eenvoudiger en ouder is). Beiden worden berekend door SPSS.

    Alle mucoëfficiënten zijn gelijk aan betrouwbaarheid onder de voorwaarde dat de testitems voldoen aan de equivalentie-eis. Maar omdat deze eis in de praktijk te strikt is, zijn de mucoëfficiënten kleiner dan de betrouwbaarheid.

    Welke speciale onderwerpen moeten er benoemd worden?

    Wat is lineaire regressie?

    Lineaire regressie is een methode om een onbekende variabele Y op basis van scores op een bekende variabele X te schatten. Er wordt een model gemaakt voor de relatie van X met Y door te zoeken naar de lineaire functie die de puntenwolk zo goed mogelijk benadert: het lineaire regressiemodel. Dan kan X daar worden ingevuld om een schatting van Y te krijgen. In de regressievergelijking Ŷ = a + bX worden de schattingen van constanten a en b ingevuld.

    De standaarddeviaties van X en Y, de correlatie tussen X en Y en de gemiddelden van X en Y moeten bekend zijn. Als de correlatie tussen X en Y niet perfect is (dus: |r(X,Y)| < 1), dan is er een bepaalde mate van onnauwkeurigheid in de schatting van Y. Het verschil tussen de geobserveerde en de geschatte waarde, Yi – Ŷi , is het residu. Het gemiddelde residu Mres is gelijk aan 0, zodat de variantie van de residuen gelijk is aan het gemiddelde gekwadrateerde residu.

    De standaardschattingsfout SY.X (standaarddeviatie van de schattingsfout) geeft een indruk van de onnauwkeurigheid van de schatting van Y.

    Het 95%-betrouwbaarheidsinterval kan voor de onbekende Yi berekend worden op basis van SY.X en Ŷi (de standaardschattingsfout en de geschatte Y). De betekenis van een betrouwbaarheidsinterval is dat de werkelijke Y-waarde in 95% van de gevallen tussen de berekende waarden ligt, niet dat de kans erop 95% is (die kans is namelijk 1 (wel) of 0 (niet)). Grote steekproeven geven veel nauwkeurigere schattingen dan kleine steekproeven.

    Welke twee methoden zijn er om de betrouwbare score te schatten en welke methode is nauwkeuriger?

    Er zijn twee schattingsmethoden voor de bepaling van de juistheid van de schatting van iemands betrouwbare score T.

    Methode 1: Bij deze methode wordt gebruik gemaakt van de standaardmeetfout. Bij schatting van T wordt de geobserveerde score gebruikt. De schatting is geldig omdat aangetoond kan worden dat bij een willekeurige afname de meest waarschijnlijke waarde voor de meetfout 0 is. Het is een maat voor de onnauwkeurigheid van de schatting: de standaarddeviatie van de schattingsfouten is gelijk aan de standaardmeetfout.

    Methode 2: In deze methode wordt gebruik gemaakt van de standaardschattingsfout. Deze schatting wordt beschouwd als een lineair regressieprobleem. Er wordt gebruik gemaakt van een lineaire vergelijking. Naast de ruwe score worden tevens de gemiddelde score en de betrouwbaarheid in de populatie gebruikt om T te schatten. Er zijn drie stappen nodig om de regressieformule te herschrijven:

    1. Volgens formule is de gemiddelde X gelijk aan de gemiddelde T.

    2. Volgens formule is S(T)/S(X) gelijk aan de wortel van de betrouwbaarheid.

    3. Volgens de klassieke testtheorie is de correlatie tussen X en T gelijk aan de wortel van de betrouwbaarheid.

    Dat allemaal invullen in de regressieformule (en herschrijven) levert de geschatte betrouwbaarheid op.

    De standaarddeviatie van de schattingsfouten is hier dus de standaardschattingsfout

    De standaardschattingsfout is en de standaarddeviatie van de betrouwbare score is.

    Beide schattingen hebben een standaarddeviatie: onder aanname van een normale verdeling kan een betrouwbaarheidsinterval berekend worden (bij een 95%-betrouwbaarheidsinterval zullen 95% van de berekende intervallen de ware score bevatten).

    De eerste methode is minder zorgvuldig dan de tweede methode. Daarvoor zijn meerdere redenen:

    1. De standaardmeetfout uit de eerste methode gebruikt de variantie van de ruwe score en de standaardschattingsfout gebruikt de variantie van de betrouwbare score. De variantie van de betrouwbare score is kleiner of gelijk aan die van de ruwe score, dus is methode 1 nauwkeuriger.

    2. Methode 2 gebruikt meer relevante informatie dan methode 1; naast de ruwe score wordt ook de gemiddelde score en de betrouwbaarheid in de populatie gebruikt.

    3. Het 95%-betrouwbaarheidsinterval van methode 2 is korter dan die van methode 1.

    Hoe kunnen testscores vergeleken worden?

    In de praktijk zijn testscores behoorlijk onnauwkeurige schattingen van de betrouwbare score: een betrouwbaarheid van 0.90 levert nog steeds brede betrouwbaarheidsintervallen op. Men krijgt een hogere betrouwbaarheid door meer items in de test op te nemen; het aantal mogelijke testscores X neemt toe en de schaal wordt langer. Hierdoor neemt de spreiding van de testscores S(X) ook toe en wordt de standaardmeetfout 2x zo groot. Het betrouwbaarheidsinterval voor T gebaseerd op methode 1 wordt ook 2x zo lang.

    Dat lijkt intuïtief niet te kloppen; bij een hogere betrouwbaarheid zou je toch een kleinere standaardmeetfout en een korter betrouwbaarheidsinterval verwachten? Leidt een hogere betrouwbaarheid dan tot een onnauwkeuriger meting? Dat is niet waar, de winst zit erin dat de betrouwbaarheidsintervallen voor individuele personen nu verder uit elkaar liggen – en dus minder snel overlappen – waardoor het gemakkelijker wordt om significante verschillen te vinden. De winst in nauwkeurigheid is niet absoluut, maar relatief; de lengte van het betrouwbaarheidsinterval moet worden gezien worden naast de lengte van de schaal.

    Dan blijft natuurlijk staan dat in absolute zin het betrouwbaarheidsinterval wel lang blijft – en het verschil tussen testscores erg groot moet zijn om significant te zijn. Maar testscores zijn uiteindelijk toch wel betrouwbaar genoeg voor praktisch gebruik, en wel om deze redenen:

    1. Tests zijn goede meetinstrumenten als hun standaardmeetfout of standaardschattingsfout klein is ten opzichte van de lengte van de schaal (en de volledige schaallengte moet daadwerkelijk in de populatie zijn benut). Hiervoor zijn veel items nodig (hoeveel precies is afhankelijk van onder andere de kwaliteit van de items en het aantal categorieën waarin men personen wil onderscheiden). De standaardmeetfout en de standaardschattingsfout geven (in relatie tot de lengte van de schaal) meer informatie over de nauwkeurigheid van een meting dan de betrouwbaarheid.

    2. Het gebruik van tests in wetenschappelijk onderzoek vereist een minder hoge meetnauwkeurigheid dan voor individueel testgebruik. Wel moet de testscore nog steeds behoorlijk betrouwbaar zijn, maar om verschillen tussen groepen te kunnen bepalen, is de steekproefgrootte belangrijker.

    3. Het geringe aantal items in een test (dat betekent een korte schaallengte en een relatief grote standaardmeetfout) kan bij belangrijke beslissingen over een persoon gecompenseerd worden door meerdere testprestaties en andere gegevens bij de uitspraak over die persoon te betrekken.

    Wat is de invloed van de testlengte op de betrouwbaarheid?

    Spearman-Brown-formule

    De Spearman-Brown-formule drukt het verband uit tussen betrouwbaarheid en testlengte, gebaseerd op de veronderstelling van parallelle metingen (rKK = betrouwbaarheid verlengde test).

    Testverlenging

    Met behulp van de gewenste betrouwbaarheid kan de verlengingsfactor K berekend worden.

    De betrouwbaarheid van de verlengde test rKK is een monotoon toenemende functie van verlengingsfactor K.

    Er is een verband tussen de lengte van een test en de betrouwbaarheid van deze test:

    1. Hoe meer items er aan de test worden toegevoegd des te minder winst krijgt de betrouwbaarheid. Vooral bij de eerste items wordt de meeste betrouwbaarheidswinst behaald.

    2. Vanwege praktische redenen is het niet zinvol om een test met een lage betrouwbaarheid te verlengen om zo voldoende betrouwbaarheid te krijgen: (1) het kost veel tijd en het kan vermoeiend zijn en demotiverend werken voor de proefpersonen als ze een heel lange test moeten invullen, (2) het is moeilijk om veel verschillende items te construeren die dezelfde eigenschap moeten meten en (3) testverlenging heeft weinig nut voor de validiteit van een testscore.

    Het verlengen van een test is alleen nuttig als er niet te veel items (afhankelijk van het type test) zijn en de aanvangsbetrouwbaarheid niet al te laag is (≥ 0.6). Er moet ook rekening gehouden te worden met het feit dat het bepalen van het verband tussen lengte en betrouwbaarheid gebaseerd is op de aanname van parallelle metingen. Parallellie is echter een ideaal waaraan in de praktijk niet aan voldaan kan worden.

    Wat is de relatie tussen betrouwbaarheid en validiteit?

    De correlatie van een testscore met het criterium, datgene wat we willen voorspellen, kan worden beperkt door de betrouwbaarheid van de testscore. De correlatiecoëfficiënt duidt de validiteit van een test aan, zodoende kan de validiteit van de testscore ook beperkt worden door de betrouwbaarheid:

    • Een test met een lage betrouwbaarheid zal ook geringe validiteit hebben.
    • Een test met een hoge betrouwbaarheid is een noodzakelijke maar niet voldoende voorwaarde voor een hoge validiteit, want de validiteit is ook afhankelijk van de samenhang van de testscore en het criterium.

    Bij verlenging van een test neemt de validiteitswinst slechts weinig toe omdat de inhoud van de test niet verandert als de test langer wordt. Hierdoor kan het criterium ook niet beter voorspeld worden. De geringe toename van de validiteitswinst is alleen te danken aan de vermindering van meetfouten door testverlenging.

    Betrouwbaarheidsindex

    De betrouwbaarheidsindex heeft de bovengrens aan voor de correlatie van X met Y; namelijk maximaal de correlatie tussen de ruwe score en de betrouwbare score.

    Validiteitscoëfficiënt

    De validiteitscoëfficiënt is de validiteit uitgedrukt in de correlatiecoëfficiënt. Deze profiteert nauwelijks van een toenemende testlengte (en de daarmee toenemende betrouwbaarheid). Dat komt doordat de test door verlenging niet inhoudelijk veranderd, waardoor het criterium ineens beter voorspeld kan worden. De kleine toename die er is komt door het terugdringen van meetfouten die de samenhang tussen X en Y enigszins vertroebelen.

    Attenuatiecorrectie

    De attenuatiecorrectie is een formule om de validiteit van de verlengde test rK(X,Y) te bepalen als zowel X als Y door testverlenging perfect betrouwbaar zouden worden gemaakt. Voor de theorievorming is het belangrijk de berekende validiteit met deze formule te corrigeren; de gecorrigeerde validiteit kan inzicht geven in de vraag in hoeverre test en criterium een beroep doen op dezelfde psychologische eigenschap. Na correctie voor de betrouwbaarheid, verwacht men een hoge correlatie als ze hetzelfde meten en een lage correlatie als ze niet hetzelfde meten.

    Wat is de betrouwbaarheid van de verschilscores?

    Een vraag bij psychodiagnostiek is welke waarde men kan hechten aan een gevonden verschil in testscores van dezelfde persoon. Het kan zijn dat het verschil veroorzaakt wordt door de onbetrouwbaarheid van de testscore(s). Het is dus belangrijk om te weten wat de betrouwbaarheid van een gevonden verschil is om een goede voorspelling te kunnen doen.

    De betrouwbaarheid van het verschil tussen de testscores is gering:

    • Wanneer de betrouwbaarheid van de testscores laag is. De verschilscores bestaan waarschijnlijk vooral uit meetfouten omdat de lage betrouwbaarheid van de testscores aanduiding is voor een grote meetfout.
    • Als de covariantie (de samenhang) van de testscores sterk is. Dit betekent dat hun betrouwbare scores veel op elkaar lijken zodat het verschil tussen de testscores vooral uit meetfouten zal bestaan.

    Op grond van testscoreverschillen worden in de praktijk vaak allerlei beslissingen genomen zoals bij werving- en selectiecriteria. Maar men moet heel voorzichtig zijn bij het interpreteren van scoreverschillen, vooral bij samenhangende testscores. Een goede beslissing kan alleen gemaakt worden wanneer:

    • De tests zo onafhankelijk mogelijk zijn. Hoe lager de correlatie van de testscores hoe beter.
    • Beide testscores zo betrouwbaar mogelijk zijn.

    Bij de 'DAT' test heeft men bijvoorbeeld wel rekening gehouden met verschilscoreproblematiek. Bij andere tests zoals de WAIS hecht men teveel waarde aan hoog correlerende testscores. Conclusie: door onbetrouwbare verschilscores zullen besluiten die gebaseerd zijn op de analyse van profielen (verkregen uit de testscores) weinig waarde hebben.

    Latente-klassenanalyse is een recente statistische ontwikkeling waarmee mensen geclassificeerd worden op basis van hun scoreprofielen. Er wordt nagegaan in hoeverre er deelgroepen te onderscheiden zijn op basis van de scoreprofielen. Als dat gevonden is, wordt er per deelgroep een interpretatie gegeven van de specifieke kenmerken, met behulp van de p-waarden: proportie positieve antwoorden per item. Het is ‘latent’ omdat het aantal en de interpretatie van de deelgroepen achteraf wordt vastgesteld – ze worden uit de gegevens berekend en zijn niet vooraf gedefinieerd. De bruikbaarheid ervan moet nog blijken.

    Wat is de relatie tussen betrouwbaarheid en spreiding van scores?

    Er is een sterk positief verband tussen de spreiding van betrouwbare scores en meetfouten, enerzijds en de betrouwbaarheid anderzijds. Het gemiddelde van de standaardmeetfouten van individuen in diverse populaties, gegeven een vaste test, zal weinig variëren. De variantie van de betrouwbare scores zal daarentegen wel verschillen. En als de variantie van een betrouwbare testscore afneemt bij een vaste meetfoutenvariantie, neemt de betrouwbaarheid eveneens af. Dit betekent dat bijvoorbeeld voor een test ingevuld door een specifieke deelpopulatie van 13- en 14-jarigen men een lagere betrouwbaarheid zal vinden dan in de gezamenlijke populatie dertien en veertien jarigen. Men kan dus alleen een test afnemen bij de populatie waarvoor de test is ontwikkeld.

    Wat is de betrouwbaarheid van heterogene tests?

    Vaak worden testbatterijen bestaande uit deeltests ontwikkeld als er ingewikkelde begrippen zoals intelligentie worden onderzocht. Intelligentie bestaat uit verschillende aspecten, elk aspect wordt apart gemeten. Aangenomen wordt dat deze aspecten redelijk onafhankelijke intelligentiekenmerken representeren. Deze onafhankelijkheid komt naar voren in de geringe covariantie of lage correlaties tussen scores op deeltests. Omdat men ook een indicatie wil van iemands algemene niveau, bekijkt men niet alleen het scorepatroon op de verschillende deeltests maar bekijkt men ook de totaalscore op alle deeltests samen. De betrouwbaarheid van een totaalscore gebaseerd op heterogene delen van de test, kan goed bepaald worden door de gestratificeerde alfa-coëfficiënt (alfastrat).

    Wat is er bekend over de generaliseerbaarheid van metingen?

    Onafhankelijke replicaties leiden niet automatisch tot een unieke betrouwbaarheid per test. 'De test-hertest-methode geeft een beeld van de generaliseerbaarheid van de meting in de tijd, de paralleltest-methode geeft aan in hoeverre metingen verkregen met de ene testversie generaliseerbaar zijn naar op hetzelfde moment verkregen meetwaarden van de andere parallelle testversie.

    Generaliseerbaarheidstheorie

    Cronbach meende dat het doel van testen altijd generalisatie is; generalisatie in de tijd, over vraagvorm, vraaginhoud of over soortgelijke tests. Een universum is het totaal van voorwaarden die men hanteert bij het generaliseren. Men spreekt dan van een universumscore en niet van een betrouwbare score. De universumscore is de gemiddelde testprestatie berekend over het universum van condities. De universumscore verschilt afhankelijk van de definitie van het universum, maar het is ook afhankelijk van de betrouwbaarheid van de meting. Deze betrouwbaarheid noemt men generaliseerbaarheid. Bij generaliseerbaarheid horen ook de toevallige fouten, E, oftewel de foutenterm. Ook de foutenterm is afhankelijk van de definitie van het universum en daarmee varieert tevens de generaliseerbaarheid.

    Wat voor besluit kan er genomen worden?

    De betrouwbaarheid van een meting heeft betrekking op de herhaalbaarheid ervan (onafhankelijke replicatie). De vraag is in hoeverre de waargenomen score naar verwachting anders uitvalt.

    Bij betrouwbaarheid is het niet automatisch zo dat er sprake is van validiteit, wel is het zo dat een onbetrouwbare testscore (het bestaat dan alleen uit meetfouten) ook invalide is, want meetfouten correleren nergens mee.
     

    Access: 
    Public
    Welke nieuwe ontwikkelingen zijn er in de testtheorie en constructie? - Chapter 7

    Welke nieuwe ontwikkelingen zijn er in de testtheorie en constructie? - Chapter 7

    Na de klassieke testtheorie kwam de item-responstheorie, een klasse van aanverwante modellen, waaronder die van Lord, Rasch en Birnbaum. De klassieke testtheorie is nuttig, want men heeft er ervaring mee, bovendien is het makkelijk te begrijpen en levert het praktisch bruikbare resultaten op. Hoewel de moderne testtheorie gedomineerd wordt door de item-responstheorie, gaan nog veel tests gaan via de principes van de klassieke testtheorie.

    De item-responsmodellen hebben meeteigenschappen die onderdeel zijn van die modellen. Deze modellen kunnen gecontroleerd worden door statistische methoden. Als het model dan een goede beschrijving van de scores geeft, kan deze toegepast worden in de praktijk. Dit heet ‘meten bij implicatie’. In de klassieke testtheorie zijn de metingen populatie-afhankelijk. Bij item-responsmodellen is er sprake van populatie-onafhankelijk meten. Dit betekent dat de betrouwbare score, en dus ook de totaalscore, afhankelijk zijn van het moeilijkheidsniveau van de gebruikte test. In de klassieke context maakt iedereen dezelfde test, zodat het moeilijkheidsniveau van de test constant wordt gehouden. Zo kunnen verschillen tussen geteste personen verklaard worden aan de hand van hun verschillen in niveau.

    Wat is populatie-onafhankelijkheid? Als we beschikken over een grote verzameling items, die allemaal dezelfde eigenschap meten en we ervan uitgaan dat nagegaan is dat het item-responsmodel past bij de testgegevens, dan maakt het voor de vergelijking van de meetwaarden van de personen niet uit wat het niveau van de tests was (adaptief testen).

    Naast theoretische voordelen biedt de item-responstheorie praktische toepassingen die met de klassieke testtheorie nog niet mogelijk waren.

    Welke principes en begrippen worden gebruikt in de item-responstheorie?

    Score op item g: Xg

    Het gaat met name om modellen voor dichotome items (geven bijvoorbeeld aan of een antwoord goed of fout is). Er zijn twee soorten antwoorden:

    1. Het positieve antwoord: itemscore is gelijk aan 1, Xg = 1;
    2. Het negatieve antwoord: Xg = 0.

    Er bestaan ook item-responsmodellen voor items met drie of meer geordende scores, maar die zijn complexer.

    Meetwaarde van persoon i: θi (thèta)

    De item-responstheorie uit dat van kans dat persoon i met meetwaarde θi een specifieke respons geeft op item g. Deze kans wordt, behalve door kenmerken van personen (meetwaarde θi), ook bepaald door kenmerken van het item (zoals moeilijkheid en discriminerend vermogen). Met een vaste waarde van θ zijn de kansen op een positief en een negatief antwoord samen 1. Andere uitkomsten zijn er niet.

    Succeskans: P(Xg = 1|θ)

    De succeskans is de kans op een positief antwoord. Deze kans wordt bepaald door kenmerken van zowel personen (meetwaarde θi) als items (moeilijkheid δg en discriminerend vermogen αg). Een kans van bijvoorbeeld 0.70 op een item betekent dat iemand in 70% van de onafhankelijke replicaties het goede antwoord geeft.

    Item-responsfunctie

    In de item-responstheorie wordt de succeskans opgevat als een functie van de te meten psychologische eigenschap. Over de vorm van de functie zijn een aantal dingen te zeggen:

    1. De succeskans is een monotoon niet-dalende functie van de schaal waarop de functie wordt gemeten. Dit betekent dat de functie stijgt of constant is.

    2. Ten tweede is de succeskans over grote intervallen van de schaal vrijwel constant laag of hoog. Er is een kritisch gebied waar de helling relatief steil is en waar de succeskans dus snel toeneemt. In dit kritische gebied zijn personen met verschillende meetwaarden goed te onderscheiden.

    Het algemene model

    Drie kenmerken van de items bepalen de exacte vorm van de item-responsfunctie:

    1. Pseudokansniveau γg (gamma): personen met een lage meetwaarde hebben een succeskans die groter is dan nul. Bij meerkeuze-items kan men altijd blind gissen. De blinde giskans op een positief antwoord is bij een vierkeuze-item 0.25. In de praktijk kan de giskans lager zijn, omdat men vaak voor aantrekkelijke maar foutieve antwoorden kiest bij gissen. Vandaar dat Hambleton en Swaminathan (1985) pleiten voor de term pseudokansniveau in plaats van giskans. Bij open vragen is het pseudokansniveau natuurlijk gelijk aan nul.

    2. Moeilijkheid δg (delta): de curve heeft een specifieke locatie ten opzichte van de schaal. Items rechts zijn moeilijker, de succeskans wordt daar kleiner.

    3. Discriminerend vermogen αg (alfa): hoe steiler de curve in het kritisch gebied, hoe groter het aantal personen dat een lage of een hoge succeskans hebben en hoe scherper de verdeling van personen op de θ-schaal in tweeën wordt gedeeld. Kleine veranderingen in meetwaarde θ hebben grote veranderingen in de succeskans tot gevolg.

    Als de itemkenmerken bekend zijn, kan men voor een specifieke meetwaarde θ de succeskans op het item bepalen.

    Welke modellen zijn er in de item-responstheorie?

    De diverse item-responsmodellen zijn bijzondere versies van het algemene model. Deze modellen hebben allen als uitgangspunt dat er een monotoon niet-dalend verband bestaat tussen de succeskans op een item en de schaal waarop de psychologische eigenschap wordt gemeten. Ze verschillen in de keuze van de specifieke wiskundige functie voor de item-responsfunctie.

    Sommige modellen zijn strenger, met andere woorden ze leggen veel meer structuur aan op het antwoordgedrag van personen en aan patronen van itemscores. Andere modellen zijn minder streng en geven een grotere vrijheid aan antwoordgedrag en gegevensstructuur. De strengere modellen zijn van betere kwaliteit maar zijn vaak praktisch niet toepasbaar, bij de minder strenge modellen is precies het omgekeerde het geval.

    De connotatie ‘streng’ en ‘zwak’ verwijst naar de mate waarin modellen restricties opleggen aan antwoordgedrag. De modellen worden besproken in volgorde van streng naar minder streng.

    Wat is het Rasch-model?

    Het Rasch-model is het strengst van de item-responsmodellen en wordt ook wel het één-parameter logistisch model genoemd.

    De meeteigenschappen van het Rasch-model zijn:

    1. Moeilijkheidsparameter. De items mogen verschillen in moeilijkheid.
    2. Géén pseudokansniveauparameter. Bij elk item dat aan de eisen van het model voldoet, nadert de kleinste succeskans tot nul. Gissen naar een positief antwoord is niet mogelijk, de pseudokansniveauparameter is gelijk aan nul. Als gissen wel een positieve score oplevert is het Rasch-model niet geschikt voor de analyse van de gegevens.
    3. Géén discriminatieparameter. Het discriminerend vermogen van alle items uit een test die aan het Rasch-model voldoen is gelijk.
    4. Metrische schaal. De eigenschappen van de schaal waarop men meet zijn afhankelijk van de keuze van het type Rasch-model. Er zijn alleen transformaties toegestaan die géén invloed op de succeskans hebben. De eigenschappen van de schaal zijn afhankelijk van de gekozen versie. Men kan kiezen voor: (1) ratioschalen (meting die plaatsvindt op een antilogaritmische schaal met ratio-eigenschappen), (2) verschilschalen (meting op een logaritmische schaal die verschiltransformaties toelaat) of (3) meting op intervalniveau.

    Populatie-onafhankelijkheid: een belangrijk kenmerk van de meting volgens het Rasch-model is de populatie-onafhankelijkheid van de meetwaarden. Dit betekent:

    • Personen zijn te vergelijken, onafhankelijk van de moeilijkheidsgraad van de items die gebruikt zijn.
    • Items zijn te vergelijken zonder afhankelijk te zijn van de personen die aan de meting hebben deelgenomen.

    Kanttekening: populatie-onafhankelijkheid geldt alleen maar voor deelpopulaties die gevormd kunnen worden uit een totale populatie. Appels kunnen ook hier niet met peren worden vergeleken, maar goudrenetten wel met golden delicious in de totale populatie van appels.

    De eigenschap van het Rasch-model is dat voor elke persoon met hetzelfde aantal items goed (X) dezelfde θ-waarde wordt geschat (personen met alles goed of alles fout doen om technische redenen niet mee). Conclusies die dan uit de geschatte θ- en δg-waarden getrokken kunnen worden zijn:

    1. De θ-waarden staan op een andere schaal dan X: de θ-schaal is lastiger te interpreteren, maar nuttig vanwege het meetniveau en de populatie-onafhankelijkheid. Voor rapportage is het handiger θ om te rekenen naar een bekende schaal (zoals schoolcijfers), of om met ruwe scores of percentielen te werken.

    2. De θ-scores kunnen zowel positief als negatief zijn: omdat de procedure zo is uitgevoerd dat het gemiddelde van de θ’s gelijk is aan 0 (arbitrair gekozen – de kleinste θ had ook als 0 gekozen kunnen worden), heeft het teken (+ of -) van de θ-waarde geen inhoudelijke betekenis.

    3. De standaardmeetfout per θ-waarde varieert per gemiddelde θ-waarde: dit in tegenstellig tot de klassieke testtheorie; zo is duidelijk dat voor extreem hoge en lage θ-waarden de nauwkeurigheid het kleinst is, en in het midden van de schaal het grootst. De 90%-betrouwbaarheidsintervallen variëren ook met θ.

    4. De betrouwbaarheidsintervallen zijn relatief lang: de geschatte meetwaarden dienen dus ver uiteen te liggen wil er sprake zijn van een significant verschil. En dus is er groot aantal items nodig.

    Wat zijn modellen met twee of drie itemparameters?

    Deze modellen zijn op te vatten als veralgemeniseringen van het Rasch-model (of het Rasch-model als speciaal geval van deze twee modellen) en zijn dus minder streng. Als het Rasch-model een adequate verklaring geeft voor de testgegevens, dan zijn ook deze modellen bruikbaar. Andersom is dat niet het geval.

    Wat is het Birnbaum-model?

    Dit model is het strengst en wordt ook wel het twee-parameter logistisch model genoemd, omdat naast de moeilijkheid ook het discriminerend vermogen in de formule is opgenomen. 

    Meeteigenschappen van het Birnbaum-model zijn:

    1. Discriminerend vermogen. Als de items van de test aan de eisen van dit model voldoen dan hebben ze over het algemeen een verschillend discriminerend vermogen.
    2. Moeilijkheidsparameter. Items mogen verschillen in moeilijkheid (net als bij Rasch-model).
    3. Géén pseudokansniveau. Net als het Rasch-model nadert de succeskans tot nul als het item voldoet aan de eisen van het model. Analyse volgens dit model is dus niet mogelijk bij gegevens die verkregen zijn met items waarbij personen het antwoord kunnen raden (giskans > 0).
    4. Intervalschaal schaal. Meting vindt plaats (evenals bij het Rasch-model) op een metrische schaal, waarop intervallen serieus worden genomen. De eenheid en het nulpunt van de meting kunnen arbitrair worden gekozen.

    Populatie-onafhankelijkheid: meting volgens Birnbaum is evenals bij het Rasch model populatie-onafhankelijk. Het geeft wel meer problemen dan bij het Rasch-model, omdat de meting van personen wel onafhankelijk is van het item maar niet van het discriminerend vermogen. De keuze van een bepaalde deelpopulatie heeft gevolgen voor de ordening van de succeskansen. Deze ordening is bij het Rasch-model populatie-onafhankelijk. In dit model verschilt deze ordening per deelpopulatie.

    Het kiezen van een minder streng model levert verlies aan meeteigenschappen op. Bij dit Birnbaum-model kunnen alleen personen populatie-onafhankelijk worden gemeten en items niet.

    Wat is het drie-parameter logistisch model?

    In dit model worden weer minder restricties opgelegd aan het testgedrag, vergeleken met het Rasch- en Birnbaum-model. Er zijn drie itemparameters opgenomen: moeilijkheid, discriminerend vermogen en pseudokansniveau, waarin items uit dezelfde test mogen variëren.

    Het Rasch-model is een speciaal geval van deze formule; door γ = 0 aan te nemen voor alle items en door alle discriminatieparameters te normeren op 1 (α = 1). Door alleen γ = 0 aan te nemen krijg je het Birnbaum-model.

    Kenmerken van dit model zijn:

    • Wel meting op de intervalschaal.
    • Meetwaarden van personen zijn populatie-onafhankelijk te bepalen indien bekend is wat de populatie-afhankelijke itemkenmerken zijn.
    • Itemkenmerken zijn gebonden aan een vaste populatie van personen.

    Wat zijn de modellen volgens Mokken?

    Volgens Mokken zijn de relatief strenge modellen niet gerechtvaardigd omdat er over veel psychologische eigenschappen te weinig kennis bestaat. De modellen leggen teveel beperkingen op aan de testgegevens. Bij het Rasch-model kunnen items alleen variëren in moeilijkheid, terwijl zij in werkelijkheid ook op andere kenmerken zullen verschillen. Het drie-parameter logistisch model vereist dat voor respondenten met hoge θ-waarden de kans op het goede antwoord naar 1 nadert, maar sommige items kunnen zo moeilijk zijn, dat ook deze respondenten het fout hebben. Alle drie de modellen veronderstellen eerst een lage vrijwel constante meetwaarde, daarna snel stijgend en dan een constante waarde die dicht bij 1 ligt, maar dat hoeft niet bij alle (psychologische) eigenschappen zo te werken.

    Er zijn twee Mokken-modellen: het model van monotone homogeniteit en het model van de dubbele monotonie.

    Wat is het model van monotone homogeniteit?

    Dit is het minst restrictieve model van de twee Mokken-modellen en is een verzameling van items waarvan ieder item een beroep doet op dezelfde eigenschap (homogeniteit). Tevens kan het antwoordgedrag op ieder item door middel van een monotone functie worden beschreven.

    Er zijn geen restrictie op het antwoordgedrag van de proefpersonen op de items door middel van een specifieke responsformule (dat is wel het geval bij de voorgaande modellen) omdat er over veel psychologische begrippen nog te weinig kennis bestaat. De enige restrictie is dat de item-responsfuncties monotoon niet-dalend zijn. Het antwoordgedrag van een persoon op een item is een resultante van persoon en item. Er is geen exacte specificatie van de wijze waarop dit antwoordgedrag wordt bepaald. Het antwoordgedrag moet afspiegeling zijn van de psychologische eigenschap die wordt gemeten op de θ-schaal: als θ toeneemt, neemt ook de succeskans toe, maar zonder restricties aan hoe die toename precies verloopt.

    De meeteigenschappen van dit model zijn:

    1. De items kunnen variëren in moeilijkheid, discriminerend vermogen en pseudokansniveau.

    2. Personen kunnen worden geordend op θ met behulp van hun totaalscores op X. De meetwaarde θ kan niet met dit model geschat worden (wel met de drie voorgaande modellen), daarom is het fijn dat personen wel op θ geordend kunnen worden. Dat kan theoretisch ongeacht testlengte k, maar praktisch wordt de betrouwbaarheid lager bij minder items.

    3. Meting van personen geschiedt op een ordinale schaal. De verschilschaal (Rasch-model) en intervalschaal (Birnbaum-model) raken we hiermee kwijt. Maar de ordinale schaal is in veel toepassingen voldoende (zoals bij een sollicitatieprocedure).

    4. Vanwege de zwakke vooronderstellingen is er minder verlies van items, dit leidt tot hogere betrouwbaarheid van X.

    5. Itemparameters θ, δ, en andere itemparameters kunnen niet geschat worden. Wel kan de p-waarde (proportie 1-en) berekend worden; hoe groter de p-waarde, hoe gemakkelijker of populairder het item.

    Populatie-onafhankelijkheid: de ordening van personen is populatie-onafhankelijk. Het maakt niet uit of de test wordt samengesteld uit een itemdomein dat verenigbaar is met de eisen van het model van monotone homogeniteit, de ordening blijft dezelfde. De ordening van items naar moeilijkheid is wel populatie-afhankelijk.

    Rasch en Birnbaum-modellen zijn speciale gevallen van dit model. De item-responscurve worden niet door een specifieke functie vastgelegd wat wel het geval is bij Rasch en Birnbaum-modellen.

    Wat is het model van dubbele monotonie?

    Dit is een model dat wel leidt tot populatie-onafhankelijke ordening van zowel personen als items: het is een speciaal geval van het model van monotone homogeniteit. De eisen van het model van dubbele monotonie zijn:

    • De item-responsfuncties zijn monotoon niet-dalend.
    • De functies mogen elkaar niet snijden: de functies mogen elke denkbare vorm hebben, maar niet dalend zijn en elkaar niet snijden. Dat lijkt op het Rasch-model (is ook stijgend en niet niet snijdend), maar is dan wat vrijer.

    Meeteigenschappen van dit model zijn:

    • Ordinale schaal. Populatie-onafhankelijke ordening van zowel personen als items; personen kunnen met behulp van X worden geordend op θ.
    • De p-waarden van items liggen ook op een ordinale schaal: de ordening van items naar afnemende p-waarde correspondeert met toenemende moeilijkheid.

    Populatie-onafhankelijkheid: de ordening van personen is populatie-onafhankelijk en de ordening van items is populatie-onafhankelijk (items kunnen geordend worden met behulp van hun p-waarden). Maar de testscores X en de p-waarden zijn niet vergelijkbaar; personen kunnen wel met elkaar op een schaal vergeleken worden en items ook, maar personen en items kunnen niet onderling vergeleken worden.

    Hoe zijn de item-responsmodellen onderling aan elkaar gerelateerd?

    Het Rasch-model is een speciaal geval van het Birnbaum-model en dat is weer een speciaal geval van het drie-parameter logistisch model. Ze veronderstellen alle drie dat items uit een test dezelfde eigenschap meten, en elk heeft een eigen formule waarmee wordt aangegeven wat het verband is tussen de succeskans op een item en de schaal (θ) waarop de psychologische eigenschap wordt gemeten: een monotoon stijgend verband. Het model van monotone homogeniteit veronderstelt ook dat dit verband monotoon is, maar zonder verdere restricties aan de vorm. Dat maakt de bovenstaande drie modellen speciale gevallen van het model van monotone homogeniteit.

    Van algemeen naar specifiek: model van monotone homogeniteit → drie-parameter logistisch model → Birnbaum-model → Rasch-model.

    Testgegevens die met een specifiek model verklaard kunnen worden, kunnen ook met een algemener model verklaard worden. Andersom geldt dat niet altijd.

    Het model van dubbele monotonie is een speciaal geval van het model van monotone homogeniteit (voegt er een extra restrictie aan toe). Het Rasch-model is een speciaal geval het model van dubbele monotonie (veronderstelt niet alleen dat items niet snijden, maar ook dat ze parallel zijn).

    Van algemeen naar specifiek: model van monotone homogeniteit → model van dubbele monotonie → Rasch-model.

    Het Venn-diagram laat de relatie tussen de modellen zien. Als een ellips geheel binnen een andere ellips valt is dit model een speciaal geval van het andere model. Als de ellipsen elkaar overlappen kunnen er deelverzamelingen van items gekozen worden met itemparameters, waarvan beide modellen een verklaring kunnen geven. Als de ellipsen een uniek deel hebben kan alleen van items die in dit unieke deel vallen, dat specifieke model een beschrijving geven.

    Hoe kan met de item-responsmodellen gemeten worden?

    Wanneer de testtheorie toegepast wordt op de gegevens van de test dan heeft dit tot gevolg dat personen en eventueel ook items op een schaal worden afgebeeld. De item-responstheorie heeft de volgende eigenschappen:

    1. Meten bij implicatie:
      • De schaaleigenschappen volgen uit het specifieke item-responsmodel (en hoeven dus niet te worden aangenomen, zoals bij klassieke testtheorie: meten bij fiat). Bij de Rasch en Mokken-modellen gelden de theoretisch afleidbare schaaleigenschappen in de praktijk ook. Dit komt omdat het empirisch te onderzoeken is of een model een goede verklaring geeft van het antwoordgedrag.
    2. Het type meting:
      • Mokken-modellen: meting op ordinale schaal.
      • Birnbaum, drie-parameter logistisch en Rasch-modellen: meting op een metrische schaal (interval-, verschil en rationiveau).
    3. Ordening:
      • Birnbaum, drie-parameter logistisch en Rasch-modellen: items en personen worden op dezelfde schaal afgebeeld.
      • Mokken-modellen: vanwege de ordinale meting aparte ordening van personen en items.
    4. Populatie onafhankelijkheid:
      • Rasch-model: zowel de meting van personen als items zijn populatie-onafhankelijk.
      • Birnbaum en drie-parameter logistisch model: alleen de meting van personen is populatie-onafhankelijk.
      • Mokkens model van monotone homogeniteit: ordening van personen is populatie-onafhankelijk.
      • Mokkens model van dubbele monotonie: ordening van personen en items is populatie-onafhankelijk.

    Wat is de betekenis van metrische schalen en hoe kan het gebruikt worden?

    Meting met behulp van een metrische schaal (ratio-, interval- of verschilschaal) moet niet direct in psychologische termen worden vertaald. In het praktische gebruik van een testscore hebben deze schaaleigenschappen geen absolute betekenis (iemand heeft niet 2x zoveel van een bepaalde eigenschap). Er zijn een aantal bewerkingen van meetwaarden om een schaal van handige interpretaties te voorzien (Eggen, Kelderman, 1987):

    1. De schaal kan worden omgezet naar het gemiddelde en de spreiding die kenmerkend zijn voor de normgroep. Door een bepaalde verdeling van de scores in de normgroep kan een specifieke score hierbinnen meteen geïnterpreteerd worden.

    2. De meetwaarden kunnen worden gerelateerd aan één of meer populatie-onafhankelijke referentiepunten die de mogelijkheid bieden voor een zinnige inhoudelijke interpretatie.

    3. De omzetting in percentielscores.

    4. De omzetting van meetwaarden in succeskansen en daarvan afgeleide schaaltypen. ‘Odds’ is de verhouding tussen de kans op een positief antwoord en de kans op een negatief antwoord op hetzelfde item voor een vaste meetwaarde.

    5. De laatste bewerking is het omzetten van de schaal uit de item-responstheorie in de schaal van de klassieke testtheorie (omzetting van de θ-schaal in de schaal van de betrouwbare T-score).

    Hoe kan de nauwkeurigheid van de meting gewaarborgd worden?

    Het is belangrijk zowel bij de klassieke testtheorie als bij de item-responstheorie dat de scores van personen betrouwbaar ten opzichte van elkaar of van een normscore kunnen worden onderscheiden. Hierin is de item-responstheorie een verfijning van de klassieke testtheorie.

    In de klassieke testtheorie wordt de precisie van de meting uitgedrukt in de standaardmeetfout. Het uitgangspunt hierbij is dat deze constante standaardmeetfout voor een test op ieder scoreniveau gebruikt kan worden. Dit is echter in de praktijk niet altijd zo; een test meet de psychologische eigenschap niet op de hele schaal overal even precies. Dat wil zeggen dat een test geschikter kan zijn voor de ene persoon dan voor de ander, dat de test preciezer meet voor de één dan voor de ander.

    Lokale betrouwbaarheid: een te gemakkelijke of moeilijke test geeft voor de meting van θi weinig informatie: het meetinstrument en het te meten object passen niet bij elkaar. Wanneer de test goed bij de persoon past, dan is θi nauwkeuriger geschat. Er kan hiervan een informatiefunctie worden gemaakt. Hoe groter de informatiefunctie, hoe nauwkeuriger de meting.

    Informatiefunctie

    Er kan voor ieder afzonderlijk item en voor de gehele test een informatiefunctie worden bepaald. Deze functies hebben bij bepaalde waarden op de schaal hun maximum: daar meet de test of het item het nauwkeurigst en is het optimaal informatief. Hoe groter de waarden van de informatiefunctie, des te nauwkeuriger de meting.

    • Bij de Rasch en Birnbaum-modellen mag een informatiefunctie wel, omdat ze aannemen dat de schattingen van persoons- en itemparameters beschikbaar zijn voor de schatting van de informatiefunctie. Ieder item uit de test levert een onafhankelijke bijdrage tot de precisie van de meting van een persoon. Men werkt hier volgens de principes van het adaptief testen. Men meet zo nauwkeurig mogelijk door aan proefpersonen die items voor te leggen die qua moeilijkheid zoveel mogelijk gelijk zijn aan zijn of haar niveau.

    • Bij Mokken-modellen mag een informatiefunctie niet omdat zij niet uit gaan van schattingen van persoons- en itemparameters.

    Hoe kan de item-responstheorie praktisch gebruikt worden?

    Wat is een itembank en hoe kan het gebruikt worden?

    Bezwaren tegen het gebruik van standaardtests:

    1. Weinig inhoudsvaliditeit. De standaardtest geeft in geringe mate het inhoudelijke kennis of vaardigheidsdomein weer en prestaties op verschillende tests zijn niet goed vergelijkbaar.
    2. Geen standaardpopulaties. Standaardtests veronderstellen standaardpopulaties, maar in de praktijk ontstaan er veel veranderingen in de populatie.
    3. Individualisering van het leerproces. Iedereen leert anders en in een ander tempo, daardoor is niet iedereen op een gegeven tijdstip even ver gevorderd.
    4. Problemen bij het meten van ontwikkelingen en veranderingen, zoals geheugeneffecten. Verandering meten kost minimaal twee meetmomenten, de tweede meting is echter géén onafhankelijke replicatie.
    5. Vloer- en plafondeffecten. Bijvoorbeeld een test is bij de tweede meting te gemakkelijk geworden (plafondeffect).

    De problemen van standaardtests kan men verkleinen door een groot domein van items te maken die men gebruikt om nieuwe tests te maken. Men noemt dit domein een itembank. Een itembank is 'een relatief grote verzameling van gemakkelijk toegankelijke testvragen'. Relatief groot verwijs naar het feit dat er veel meer items zijn dan in een standaardtest. Met gemakkelijk toegankelijk bedoelt men dat de items gemakkelijk te selecteren en op te nemen zijn in een test.

    Van der Linden (1983) noemt het samengaan van de itembank en item-responstheorie het moderne complex van theorie en toepassing van tests. Hiertegenover staat het klassieke complex van standaardtests en de klassieke testtheorie. Het samengaan van de itembank en de item-responstheorie is mogelijk vanwege de populatie-onafhankelijkheid van metingen.

    Populatie-onafhankelijkheid heeft tot gevolg:

    • Dat items uit een itembank op dezelfde schaal kunnen worden afgebeeld als ze voldoen aan het desbetreffende item-responsmodel. Bovendien kan men meetwaarden aan hen toekennen, dit noemt men calibreren. Gecalibreerde items van verschillende tests die hetzelfde psychologische begrip meten kan men vervolgens afbeelden op een gemeenschappelijke schaal, men noemt dit het equivaleren van itemkenmerken.
    • Dat ongeacht de keuze van de items, dezelfde meetwaarde wordt geschat. De meetwaarde is populatie-onafhankelijk, maar de nauwkeurigheid of betrouwbaarheid van de schatting is dat niet (is afhankelijk van de gebruikte items).
    • Dat testscores van verschillende tests met elkaar vergeleken kunnen worden. Dit noemt men ook equivalering van testscores.

    Twee methoden om items in een bank op te slaan zijn:

    1. Items opslaan naar onderwerp of plaats in het curriculum. Nadelen: er moeten steeds weer nieuwe categorieën gemaakt worden als nieuwe items niet passen in de bestaande categorieën. Items zijn slechts per categorie oproepbaar en men kan de itemkenmerken niet onbeperkt combineren.
    2. Items rangschikken op basis van één of meer sleutelwoorden. Deze manier van opslaan is veel flexibeler dan de eerste en men kan er meer mee.

    Behalve inhoudelijke informatie kan men in een itembank ook technische informatie opnemen, zoals informatie over moeilijkheid, discriminerend vermogen en pseudokansniveau.

    Hoe kan een test geconstrueerd worden op basis van een itembank?

    Metingen gebaseerd op tests uit de itembank hoeven niet beter te zijn dan die gebaseerd zijn op een standaardtest. Voor een specifieke toepassing is het vooral lastig om de geschikte items uit de itembank te selecteren. Er kunnen aan zowel aan de te selecteren items als de uiteindelijke test een aantal eisen worden gesteld, als we willen dat de test zo nauwkeurig mogelijk meet, over:

    1. De samenstelling van de test qua onderwerp.
    2. De bovengrens voor het aantal te selecteren items (in verband met de testtijd).

    Het is moeilijk om uit de itembank die deelverzameling items te halen die aan alle eisen voldoen, zeker als het een grote itembank betreft.

    Om een preciezer beeld van het probleem van itemselectie te krijgen, kan men een testinformatiefunctie (ook wel doelinformatiecurve genoemd) construeren. Er wordt hierbij een grensscore (aftestgrens, cesuur) bepaald: deze score bepaalt de grens tussen bijvoorbeeld wel of niet slagen voor toets. De test moet nauwkeurig rond de grensscore scoren, met andere woorden de functiewaarden moeten in en rond de grensscore groot zijn. Degene die de test construeert moet beslissen wat de minimumwaarde van de informatiefunctie in en rond de grensscore moet zijn.

    De som van de iteminformatiefuncties is gelijk aan de testinformatiefunctie. Men probeert nu bij de itemselectie, de items zó te selecteren dat het oppervlak onder de doelinformatiefunctie met zo min mogelijk iteminformatiefuncties helemaal afgedekt wordt.

    Wanneer tests na elkaar geconstrueerd worden treedt het probleem op dat een item geselecteerd kan zijn voor de eerste test hoewel dit item beter in de tweede test had gepast. Het item kan echter niet voor beide tests gebruikt worden.

    Als er onnauwkeurigheden geconstateerd worden op een schaal dan kan op basis van een doelinformatiecurve een bestaande test veranderd worden door items uit de itembank te selecteren en aan de test toe te voegen.

    Hoe kan men adaptieve tests maken met een itembank?

    Adaptief testen is pas mogelijk als men beschikt over een itembank. Op basis van de opgeslagen itemparameters en de persoonsparameters van een specifiek persoon kan men items voor de persoon selecteren. Voorafgaand hieraan moet men onderzocht hebben of het antwoordgedrag van de proefpersoon op de items waaruit de adaptieve test wordt samengesteld, voldoet aan de eisen van het item-responsmodel. Hierbij kunnen problemen ontstaan vanwege de strenge eisen van de modellen en de praktische vereisten van de toepassing. Als een test valide is, moeten alle aspecten van het te meten kenmerk gedekt worden. Het probleem is echter dat item-responsmodellen veronderstellen dat alle items hetzelfde meten.

    Het kiezen van items verschilt per model. Bij het Rasch-model en het Birnbaum-model zal men het item kiezen dat in moeilijkheid zo dicht mogelijk bij de geschatte persoonsparameter ligt. Bij het drie-parameter logistisch model is het meest geschikte volgende item afhankelijk van een combinatie van de drie itemkenmerken tezamen.

    In plaats van steeds één voor één items te kiezen en berekeningen daarop te doen, kan men ook steeds twee of meer items aanbieden en dan pas berekeningen uitvoeren. Dit kan via:

    • Two-stage testing: eerst iedereen dezelfde korte test van middelmatige moeilijkheid laten maken, en dan voor het tweede stadium tests van uiteenlopend moeilijkheidsniveau klaarleggen; welke test men krijgt hangt af van de prestatie op test 1. Is vooral handig als men respondenten aan een categorieën wil toewijzen (zoals laag, middelmatig of hoog). Door de eerste schifting door middel van een voortest wordt er in de tweede fase nauwkeuriger gemeten.
    • Multi-stage testing: er zijn diverse andere varianten mogelijk tussen two-stage en adaptief testen.

    Deze vormen zijn minder nauwkeurig dan de item-voor-item aanpak maar ze kunnen met weinig hulpmiddelen worden uitgevoerd.

    Voordelen van adaptief testen:

    1. Een nauwkeurige meting per proefpersoon.
    2. De proefpersonen krijgen tests op hun niveau, waardoor er minder concentratieverlies of frustratie is.
    3. De testprocedure is geautomatiseerd en objectief. Hierdoor hebben testleiders geen kans om onbedoeld respondenten te helpen of te ontmoedigen. En scoringsfouten zijn uitgesloten.
    4. Efficiënter. Het heeft een korte testtijd en er is een snelle terugkoppeling van testresultaten mogelijk.
    5. Testprestaties verkregen door middel van verschillende tests kunnen met elkaar vergeleken worden.

    Een groot nadeel bij het adaptief testen is dat het niet eenvoudig is om grote itembanken te construeren waarvan alle items testgedrag oproepen dat met behulp van één van de item-responsmodellen kan worden beschreven. Als de reacties niet helemaal passen binnen het item-responsmodel is dit geen ramp, omdat er altijd wel enig verschil bestaat tussen een model en de empirische gegevens. Het is wel belangrijk te weten hoe groot het verschil is, zodat men geen erge missers maakt bij het trekken van conclusies en het nemen van beslissingen.

    Andere nadelen zijn de hoge kosten (met name bij grootschalige toepassingen) en dat het lastig is om psychologische begrippen te operationaliseren.

    Wat is vraagonzuiverheid en hoe kan het onderzocht worden?

    Als men mensen uit verschillende populaties met elkaar moet vergelijken, is het belangrijk zich af te vragen of personen uit de ene populatie systematisch bevoordeeld of benadeeld worden omdat de test in de verschillende populaties op verschillende wijzen functioneert. Het onderzoek hiernaar noemt men het onderzoek naar vraagonzuiverheid of vraagpartijdigheid. Bij vraagonzuiverheid ontstaan er verschillen in testscores tussen populaties. Deze verschillen moeten worden toegeschreven aan variatie in eigenschappen die men niet bedoelde te meten (onbedoelde eigenschappen).

    Er is sprake van vraagonzuiverheid wanneer personen met dezelfde θ-waarde verschillende succeskansen hebben, er zijn dan verschillende item-responsfuncties van het item zijn in beide populaties. Als er sprake is van een zuiver (goed functionerend) item dan hebben personen uit verschillende populaties met dezelfde θ-waarde dezelfde kans om het item goed te beantwoorden. De item-responsfunctie van het item is in dat geval in beide groepen gelijk.

    Men gaat er eigenlijk vanuit dat twee personen met dezelfde θ-waarde, afkomstig uit verschillende populaties, dezelfde succeskans op een specifiek item moeten hebben. Is dit niet het geval dan bepalen andere factoren de testprestatie.

    Er zijn verschillende methoden om vraagonzuiverheid te onderzoeken:

    1. Itemkenmerken vergelijken. Als de item-responsfunctie in twee groepen gelijk is, dan heeft het in beide groepen dezelfde moeilijkheid, hetzelfde discriminerende vermogen en hetzelfde pseudokansniveau. Deze drie itemparameters leiden tot verschillende vraagonzuiverheid. Als alleen de moeilijkheid verschilt, betekent dit dat de succeskansen voor personen uit de ene groep altijd groter zijn dan de succeskansen voor personen uit de andere groep. Als alleen het discriminerend vermogen verschilt dan worden in beide groepen sommige personen benadeeld.
    2. Het oppervlak tussen de item-responsfuncties berekenen: hoe groter dit oppervlak, hoe sterker de onzuiverheid.
    3. Nagaan of de succeskansen per θ-waarde gelijk zijn: als ze gelijk zijn is er sprake van zuiverheid, en als ze niet gelijk zijn is er onzuiverheid.

    Het geven van een inhoudelijk-psychologische verklaring van statistisch gebleken onzuiverheid is noodzakelijk. Drie onderzoeksstrategieën voor de verklaring van vraagonzuiverheid zijn:

    1. Inspectie van partijdige items naar opvallende kenmerken, een ad-hoc strategie. Nadeel: het kan leiden tot speculatie.
    2. Het leggen van een verband tussen eigenschappen van personen enerzijds en kritische kenmerken van partijdige items en vergelijking met onpartijdige items anderzijds. Nadeel: correlatie is geen causaliteit.
    3. Experimenteel onderzoek naar de oorzaken van vraagonzuiverheid.

    Wat betekenen afwijkende scorepatronen en hoe kan het onderzocht worden?

    Soms wijken individuen af van anderen uit dezelfde populatie, wat niet logisch is gezien hun θ-waarde en itemkenmerken. In dat geval bevat de θ-waarde niet alle informatie over het individu en er is extra informatie te verkrijgen uit het patroon van de itemscores. Voorbeelden van situaties waarin afwijkende scores te verwachten zijn:

    1. Bij studietoetsen. De item-responsmodellen voorspellen dat het percentage goede antwoorden afneemt naarmate de items moeilijker worden. Maar door gissen kan iemand toch hoog scoren en door een slechte voorbereiding kan iemand een gemakkelijker item missen. Hierdoor krijgt men een scorepatroon waarin goede en foute antwoorden gelijkmatig over gemakkelijke en moeilijke items verdeeld zijn. Ook door bedrog en fraude (afkijken en spieken) kan men een afwijkend patroon krijgen; opvallend veel goede antwoorden bij moeilijke items ten opzichte van de makkelijke items.
    2. Het onderzoek van Van der Flier in de populatie van Tanzaniaanse en Keniaanse leerlingen met twee verbale redeneertests. Na correctie van de afwijkingen bleken de Keniaanse kinderen betere testscores te hebben.
    3. Onderzoek naar deelvaardigheden die noodzakelijk zijn voor het oplossen van een probleem, maar die door de leerling onvoldoende worden beheerst. Door het de herkenbaarheid van het afwijkende patroon kunnen we de oorzaak van fouten opsporen.
    4. Een proefpersoon die over goede vaardigheden beschikt maar weinig ervaring heeft met het invullen van antwoorden op een formulier voor automatische scoring, waardoor de antwoorden op de verkeerde plek ingevuld worden (voorbeeld van Hulin).

    De verschillende methoden die zijn voorgesteld om afwijkende scorepatronen te onderzoeken gaan uit van het principe dat als men iemands meetwaarde en de itemkenmerken van alle items in de test kent, men de kans op een specifieke score op een gegeven item kan berekenen. Vervolgens kan men de kans op een gevonden patroon van itemscores berekenen en kan men bepalen of de gevonden patronen te verwachten zijn.

    Persoon-responsfunctie

    De persoon-responsfunctie is het spiegelbeeld van de item-responsfunctie: het geeft de succeskans van een persoon met een gegeven θ-waarde als functie van de moeilijkheid van items. Vier voorbeelden van persoon-responsfuncties:

    1. Monotoon dalend: als de item-responsfuncties van de k items elkaar niet snijden (Rasch, dubbele monotonie) neemt de persoon-responsfunctie monotoon af als de items moeilijker worden. De succeskans neemt af en kan niet toenemen.
    2. Horizontaal over de hele linie: de succeskans is niet afhankelijk van de moeilijkheid, blijkbaar heeft de persoon zich niet goed voorbereid.
    3. In het begin relatief laag: de gemakkelijke items waren relatief moeilijk, de persoon had in het begin mogelijk last van testangst.
    4. Aan het eind relatief hoog: na een aanvankelijke daling stijgt de functie bij moeilijke items. Dat kan duiden op bedrog of de persoon kende de moeilijke items al (item exposure).

    Onderzoek naar vraagonzuiverheid en onderzoek naar afwijkende scorepatronen gaan hand in hand. Als het item onzuiver is, is de persoon afwijkend. Het is raadzaam onzuivere items te verwijderen en te vervangen door zuivere items. Afwijkende personen moeten dan herwaardeerd worden met betrekking tot hun prestatie. Net als bij onderzoek naar vraagonzuiverheid moeten statistische afwijkingen inhoudelijk-psychologisch worden verklaard, maar het onderzoek richt zich in dit geval op personen in plaats van op items. Verklaringen kunnen hier ook variëren van speculatie tot een gecontroleerd experiment.

    Welke speciale onderwerpen zijn ook belangrijk?

    Hoe werkt de item-responstheorie voor polytoom gescoorde items?

    In persoonlijkheidsvragenlijsten worden vaak rating-scale items gebruikt, met drie of meer geordende antwoordcategorieën; een hogere score betekent een hogere positie op de schaal van de eigenschap. Item-responsmodellen voor dergelijke scores bepalen een responsfunctie voor elke score die op een item mogelijk is. De kans op een specifieke itemscore wordt voor iedere score apart gemodelleerd.

    De kans op de laagste score is groot voor respondenten met lage θ-waarden en neemt af als de θ-waarde toeneemt. Er is voor elke score een locatie op de θ-schaal waar de kans op die score het hoogst is. Elke itemscore heeft bij elke θ-waarde een positieve kans, maar die kansen verschillen, zodat per θ-waarde meestal één score het meest waarschijnlijk is.

    Item-responsmodellen voor polytome functies zijn veel ingewikkelder, er moet ook bepaald worden of een model past bij de gegevens en het schatten van de itemkenmerken is lastiger.

    Hoe verhouden de klassieke testtheorie en de item-responstheorie zich tot elkaar?

    Sommige auteurs zien klassieke testtheorie en item-responstheorie als elkaars tegenovergestelde. Andere auteurs menen dat ze elkaar aanvullen.

    Voordelen van de item-responstheorie ten opzichte van de klassieke testtheorie zijn:

    1. De item-responsmodellen kunnen als nulhypothese op de testgegevens worden getoetst: past een model bij de gegevens, dan wordt het model niet verworpen en gelden de eigenschappen van het model voor de gegevens. Bij de klassieke theorie kan het passen van het model niet goed worden onderzocht.
    2. Personen worden populatie-onafhankelijk gemeten waardoor testprestaties van verschillende tests voor dezelfde eigenschap op dezelfde schaal afgebeeld kunnen worden. In de klassieke theorie zijn de metingen populatie-afhankelijk.
    3. De betrouwbaarheid van de meting varieert over de schaal, zo kan men erachter komen dat een test voor de ene persoon geschikter is dan voor de ander. In de klassieke theorie wordt de betrouwbaarheid op de hele schaal even groot verondersteld.

    De praktische voordelen van de klassieke testtheorie:

    1. Het is eenvoudiger en daardoor beter toegankelijk.
    2. Het is maar de vraag of de validiteit van de test zoveel minder is.
    3. De klassieke testtheorie ‘werkt’ bij testconstructie bijna altijd; item-restcorrelaties kunnen worden gebruikt om eventueel items weg te laten en zo de rest betrouwbaarder te maken.
    4. De toenemende betrouwbaarheid bij een toenemend aantal items is erg gunstig.

    De strenge item-responsmodellen verwerpen soms veel items, maar de vooronderstellingen van de klassieke testtheorie kunnen vaak niet empirisch gecontroleerd worden; de item-responstheorie is wel controleerbaar en dus kwetsbaarder.

    In Nederland wordt de klassieke testtheorie nog het meest gebruikt, behalve bij de grootschalige CITO. In de VS wordt de item-responstheorie vaker gebruikt (ook voor psychologisch meten).

    Wat is de rol van de item-responstheorie in de psychologische theorievorming?

    Is statistisch gebleken dat er sprake is dan vraagonzuiverheid of afwijkendheid van scores, dan is er een psychologische verklaring nodig om het te begrijpen. In een bepaalde benadering binnen de psychometrie zet men niet alleen testprestaties om in meetwaarden, maar wordt er ook naar een psychologische verklaring gezocht voor de totstandkoming van de testprestatie: het cognitieve oplossingsproces. Het zijn de ‘psychologische’ onderwerpen uit de item-responstheorie (vraagonzuiverheid, afwijkendheid, cognitieve oplossingsproces) die acceptatie van deze theorie zullen bevorderen.

    Access: 
    Public
    Wat is de validiteit en betekenis van een test? - Chapter 8

    Wat is de validiteit en betekenis van een test? - Chapter 8

    Wat is validiteit?

    Validiteit gaat om de mate waarin de test aan zijn doel beantwoordt. Afhankelijk dus van het doel moet men elke keer weer kijken of een test valide is, validiteit kan dus niet gezien worden als een eigenschap van de test zelf. Het gemeenschappelijke kenmerk van de doelen bij testgebruik is dat het niet gaat om het testgedrag zelf, maar om wat het testgedrag kan zeggen over ander gedrag dat buiten het testgedrag ligt.

    Het valideringsproces is het proces van het verzamelen van evidentie voor de rechtvaardiging van de sprong van testgedrag naar iets anders. Validiteit is de mate waarin die rechtvaardiging is gevonden.

    Validiteit wordt dus gekoppeld aan het doel van het testen: als voorspeller van gedrag of als operationalisering van een psychologisch begrip.

    De test als voorspeller van ander gedrag

    Het doel is het voorspellen van gedrag of een prestatie buiten de testsituatie. Het gaat om het doen van uitspraken over feiten waarvoor geen directe evidentie is op basis van andere met die feiten samenhangende gegevens. Deze feiten kunnen in de toekomst (predictie), het heden (paradictie) of het verleden (postdictie) liggen. In de theorie spreekt men hier van predictieve validiteit.

    Enige relativering: ook al bestaat er er een aantoonbare relatie tussen begrippen, als deze begrippen niet goed geoperationaliseerd zijn, heeft de voorspelling weinig kans van slagen. Alleen wanneer zowel de test als het te voorspellen gedrag aantoonbare uitingen zijn van eigenschappen waartussen een aantoonbare relatie bestaat, kan de test een adequate voorspelling opleveren. Een blinde acceptatie van een voorspellende test (predictor) en de relatie daarvan met gedrag buiten de test (criterium) is niet realistisch.

    De test als operationalisering van een psychologisch begrip

    Het kan ook gaan om de theoretische begrippen waarmee men een verklaring kan geven van het testgedrag. Het doel is het meten van begrippen zelf. Men noemt dit begripsvaliditeit.

    Enige relativering: ook al is het onderzoek niet gericht op het voorspellen van ander gedrag, toch levert dergelijk onderzoek informatie op over het voorspellend vermogen van de test. Als er een theoretisch relatie mag worden verondersteld tussen intelligentie en schoolsucces, kan men daarvan gebruik maken om van een nieuwe test vast te stellen of deze wel intelligentie meet en niet iets anders.

    Wat zijn predictieve validiteit en begripsvaliditeit?

    Alle gebruik van psychologische tests valt onder deze twee doelstellingen, dit houdt in dat alle variëteiten in het validiteitsbegrip binnen één van beide soorten validiteit vallen.

    1. Predictieve validiteit. Onder de eerste doelstelling vallen bijvoorbeeld de toelating, de selectie, de beroepsadvisering, de classificatie en de differentiële predictie. De centrale (validiteits)vraag is hier in hoeverre een test daadwerkelijk een juiste voorspelling mogelijk maakt.

    2. Begripsvaliditeit. Onder de tweede doelstelling vallen bijvoorbeeld de theoretische analyse van begrippen en het experiment ter toetsing van theorieën. De centrale vraag is hier in hoeverre de test het bedoelde psychologische begrip dekt.

    Er moet niet een al te dwingend onderscheid gemaakt worden tussen beide toepassingen van tests; het beschrijven van een begrip of persoon dient altijd een buiten de test gelegen doel. Testen als activiteit op zich heeft geen zin. Sommigen vinden het onderscheid niet nodig, zij zien predictieve validiteit als specifieke vorm van begripsvaliditeit; de relatie tussen predictor en criterium zijn een onderdeel van het theoretische netwerk van het geoperationaliseerde begrip. Toch worden ze afzonderlijk behandeld; in het onderwijs en de personeelspsychologie wordt veel gebruik wordt gemaakt van het voorspellend vermogen van tests. Hierbij komen andere methodologische principes aan de orde dan bij het proces van begripsvalidering.

    Welke andere onderscheidingen in validiteit zijn er?

    Welke vier belangrijke soorten validiteit kunnen er worden onderscheiden?

    Naast de genoemde predictieve validiteit en begripsvaliditeit, zijn er vier soorten validiteit die vanaf de eerste publicatie een belangrijke rol spelen: (1) predictieve validity, (2) concurrent validity, (3) content validity of inhoudsvaliditeit en (4) construct validity.

    1. Predictive validity of voorspellende validiteit

    Er wordt nagegaan in hoeverre voorspellingen gebaseerd op de testprestatie overeenkomen met gegevens en observaties die op een later tijdstip zijn verzameld. Het verschil met deze validiteit en eerder genoemde predictieve validiteit is dat bij deze validiteit de voorspelling gekoppeld is aan de resultaten in de toekomst terwijl bij de predictieve validiteit de voorspelling ook als het criterium van het heden en het verleden kan worden gebruikt.

    2. Concurrent validity of gelijktijdige validiteit

    Men vergelijkt testresultaten met gelijktijdig beschikbare criteriumgegevens. Het verschil met predictive validity is het moment van het verzamelen van de criteriumgegevens: gelijktijdig in plaats van in de toekomst. Deze vorm van validatie komt veel voor. Het onderscheid tussen predictive en concurrent validity is waardevol; als men niet op een toekomstig criterium kan wachten, kan men een gelijktijdig criterium gebruiken. Maar de resultaten moeten niet zonder meer gegeneraliseerd worden naar een toekomstig criterium.

    3. Content validity of inhoudsvaliditeit

    Er wordt gekeken hoezeer de inhoud van de test een universum van situaties, kennisinhouden of vaardigheden weergeeft, waarover met betrekking tot de onderzochte conclusies moeten worden getrokken. Het wordt vooral veel gebruikt bij onderwijskundig meten (bijvoorbeeld in hoeverre men uit een proefwerk Franse grammatica conclusies mag trekken over het gehele kennisdomein van Franse grammatica).

    Bij inhoudsvaliditeit gaat het vooral om subjectieve oordelen, niet om de achterliggende correlaties. Men probeert de subjectiviteit van de oordelen te verkleinen door met verschillende beoordelaars te werken.

    Inhoudsvaliditeit komt dicht in de buurt van 'face-validity'. Een formele definitie van inhoudsvaliditeit zou kunnen zijn 'de sterkte van de samenhang tussen de testscore en de totaalscore op het gehele itemdomein'. Die totaalscore is in de praktijk echter niet beschikbaar, waardoor er gebruik gemaakt moet worden van een representatieve steekproef, met behulp van equivalente tests. En dat lijkt weer veel op parallellie. Maar een goede betrouwbaarheid betekent niet automatisch ook een goede (inhouds)validiteit.

    Bij studietoetsen kan men wel met empirisch onderzoek belangrijke informatie verzamelen, maar daarmee worden de grenzen van inhoudsvaliditeit overschreden en komt men op het terrein van de begripsvaliditeit.

    4. Construct validity of constructvaliditeit

    Men onderzoekt welke psychologische kwaliteiten (hypothetische constructen) door een test gemeten worden. Dit construct wordt vervolgens weergegeven in de testprestatie. Construct validity bestaat uit drie onderdelen:

    1. De begrippen uitzoeken die kunnen worden gezien als een verklaring voor testprestatie door een logische bestudering van de test: psychologische verbeeldingskracht.

    2. Vanuit de theorie waarop het construct is gebaseerd toetsbare hypothesen afleiden: een logische operatie.

    3. Via empirisch onderzoek deze hypothesen toetsen: een methodologisch proces.

    Constructvaliditeit lijkt heel veel op begripsvaliditeit, hoewel de laatste beter de eenheid in het validiteitsbegrip kan bewaren. Constructvaliditeit houdt zich bezig met de exploratieve vraag wat een test eigenlijk meet. Begripsvaliditeit houdt zich bezig met de vraag of een test daadwerkelijk kan worden opgevat als een operationalisering van een specifieke, door de onderzoeker beoogde eigenschap. De definitie van begripsvaliditeit is dus breder dan die van constructvaliditeit.

    Welke andere onderscheiding kunnen er gemaakt worden in validiteit?

    In de loop van de jaren zijn er nieuwe vormen van validiteit bij gekomen. Er worden er vier besproken. De eerste twee zijn specifieke varianten van begripsvaliditeit en de laatste twee zijn eraan verwant: (1) synthetische validiteit, (2) congruent validity of soortgenootvaliditeit, (3) face-validity of indruksvaliditeit en (4) incremental validity.

    1. Synthetische validiteit

    Synthetische validiteit richt zich op functie-elementen in plaats van op de functie en de taak als geheel; identificeerbare en op zichzelf zinvolle onderdelen van criteriumgedrag zijn belangrijk. Op basis van de afzonderlijk voorspelde elementen wordt vervolgens de voorspelling van de hele functie gesynthetiseerd. Het is een stap in de richting van begripsvalidering. Deze vorm is praktisch toepasbaar in de selectie- en beroepskeuzepsychologie.

    2. Congruent validity of soortgenootvalditeit

    Deze geeft de mate van correlatie aan tussen twee tests die dezelfde eigenschap meten. Een nieuwe test wordt vergeleken met een bestaande test, niet met als doel die andere testprestaties te voorspellen, maar om vast te stellen in hoeverre de nieuwe test inderdaad hetzelfde meet. Het is een onderdeel in het proces van begripsvalidering.

    3. Face-validity of indruksvaliditeit

    Een leek of een psycholoog heeft de indruk dat er een relatie bestaat tussen test en criterium of de betekenis van de test, dit is alleen nog niet onderzocht door middel van empirisch onderzoek. Dit is niet altijd een nuttige en soms zelf wel een gevaarlijke eigenschap van de test: veel tests zijn jarenlang alleen gebruikt omdat ze een indrukvaliditeit bezaten, dat zorgde ervoor dat er geen werkelijk valideringsonderzoek werd gedaan. Ook wel ‘faith validity’ genoemd.

    Indrukvaliditeit kan wèl nuttig zijn als de test voldoende predictieve of begripsvaliditeit bezit: voor de onderzochte kan het nuttig zijn het gevoel te hebben iets zinvols te doen (transparantheid). Maar, transparantheid is alleen wenselijk en niet noodzakelijk: een test hoeft niet door leken begrepen te worden om nuttig te zijn.

    4. Incremental validity of toegevoegde validiteit

    Onderzoekt niet alleen de relatie tussen test en criterium, maar ook de verhoging van de validiteit door de verbetering van voorspellingen. Men vraagt zich af of het gerechtvaardigd is naast de reeds aanwezige informatie om nog een test te gebruiken. Komt op het terrein van de predictieve validiteit.

    Wat is predictieve validiteit?

    Een criterium is een gebeurtenis, gedrag of prestatie in het verleden, heden of toekomst. Normaal gesproken beschikt men niet over criteriuminformatie; daar is de test voor nodig. Een belangrijke vraag is hoe goed dit criterium valt te voorspellen. Dat wordt als volgt gedaan. Men bepaalt op grond van eerder gedaan empirisch onderzoek de relatie tussen testprestaties en criteriumprestaties. Vervolgens bepaalt men op grond hiervan de testprestaties en kan men met behulp van regressieanalyse de meest waarschijnlijke criteriumscores schatten.

    Regressie-analyse is het bepalen van de rechte lijn (Y = a+ bX) die het best past bij de puntenwolk (als de gemiddelde gekwadrateerde verticale afstand van alle punten tot de lijn het kleinst is). In de toepassing van bijvoorbeeld een toets weten we de criteriumprestatie van de leerling nog niet, maar met behulp van zijn toetsprestatie kunnen we de meest waarschijnlijke criteriumscore schatten door de toetsprestatie X in te vullen in het regressiemodel.

    Dit basismodel is eenvoudig, maar heeft bezwaren.

    Hoe kan het criteriumbegrip nader bepaald worden?

    Het begrip criterium levert nogal wat verwarring op. Thorndike (1949) heeft een drietal type criteria onderscheiden:

    1. Uiteindelijk ('ultimate') criterium: het uiteindelijke doel van een test, het meest ideale criterium, maar te abstract en zelden of nooit beschikbaar.

    2. Tussentijds ('intermediate') criterium: het tussendoel, wordt vaak gekozen in plaats van het uiteindelijke criterium.

    3. Onmiddellijk ('immediate') criterium: het directe doel, wordt soms ook gekozen in plaats van het uiteindelijk criterium.

    Er treden twee problemen op bij deze onderscheiding:

    1. Abstractieniveau: de vraag in hoeverre het criterium ter beschikking staat, het te kwantificeren of te operationaliseren is.

    2. Temporeel: de vraag hoe ver verwijderd het criterium in tijd ligt. Het uiteindelijk criterium ligt ver in de tijd; het tussentijds en het onmiddellijk criterium liggen dichterbij.

    Verduidelijking van het bovenstaande onderscheid in het begrip 'criterium' in vier stappen:

    1. Allereerst moet bekeken worden voor welk einddoel van een organisatie/instelling een voorspelling gedaan moet worden. Dat is direct af te leiden van het bestaansrecht van de organisatie.

    2. Vervolgens concretiseert men dit einddoel in termen van zichtbare resultaten. Dit noemt men ‘conceptuele criterium’ naar Astin (1964). Dit conceptuele criterium bevindt zich in het laagste niveau van abstractie in de rangorde van relevante doelstellingen, aldus Astin.

    3. Van het conceptuele criterium wordt nu een criteriummaat of -score afgeleid. Deze criteriummaten zijn duidelijke, eenduidige scores of uitspraken die betrekking hebben op het door het criterium bepaalde gedrag of prestaties. Dit criteriumgedrag is relevant waarneembaar gedrag. Een aantal opmerkingen over criteriummaat en criteriumgedrag:

      • Criteriummaat geeft criteriumgedrag kwantitatief weer.
      • Een onbetrouwbare criteriumscore en predictorscore leidt tot een lage predictieve validiteit.
      • Men kan niet door empirisch onderzoek achter de relatie tussen criteriumgedrag (c.q. criteriumscore) en het achterliggende conceptuele criterium komen. Bij het conceptuele criterium is nog te weinig geoperationaliseerd voor concreet empirisch onderzoek. Bij bepaling van de relatie tussen het criteriumgedrag en het conceptuele criterium gaat het om de mate van de relevantie. Deze relevantie kan eerder door rationeel oordelen dan door empirisch onderzoek bepaald worden. Als men beseft dat empirische toetsing niet nodig is dan hoeft men niet 'oneindig en frustrerend' validiteitsonderzoek te doen.
    4. Predictieve validiteit bepalen. Eerst zijn criteriumgedrag gekozen en criteriummaat vastgesteld. Empirisch onderzoek in de vorm van predictieve validatie wordt dan pas gedaan wanneer besloten is een bepaalde criteriumprestatie te nemen als concretisering van een conceptueel criterium. Een gekozen criteriummaat is wél vergelijkbaar met andere criteriummaten. Men vergelijkt de relatie tussen conceptuele criteria. Als de relatie zwak is, moet men kijken wat het beste criterium is. De vraag is wie de verantwoordelijkheid heeft voor de keuze van het conceptuele criterium. Hier is men van mening dat de psycholoog zich met deze keuze moet bezighouden want:
      • Hij heeft als taak het bewustwordingsproces over impliciete keuzes van het doel bij de opdrachtgever te stimuleren.
      • Hij kan onaanvaardbare elementen in de keuze van het criterium onderkennen.
      • Hij heeft onderzoekservaring en -gegevens.

    Het is wenselijk niet alleen voor de keuze van de tests maar ook voor de criteriumscore een zo groot mogelijke betrouwbaarheid te verkrijgen. Bij de keuze van criteriumgedragingen is het vaak zo dat de betrouwbaarheid van de criteriummaten omgekeerd evenredig is met hun relevantie. Een criteriummaat moet dus zó betrouwbaar zijn dat de test nog betrouwbaar is, maar niet zoveel dat het geen beeld meer geeft van het conceptuele criterium.

    Hoe kan een test of testbatterij met predictieve validiteit opgezet worden?

    Bij het kiezen van test, het samenstellen van een testbatterij en bij de bepaling van predictieve validiteit zijn zes fasen te onderscheiden.

    Fase 1: Operationalisering van het criterium

    Het operationaliseren van het criteriumgedrag in een zo exact mogelijke criteriummaat.

    Fase 2: Keuze en constructie van tests

    Het kiezen van mogelijke tests of de constructie van mogelijke items waaruit tests kunnen worden gemaakt. Afhankelijk van omstandigheden, verwerkingsmogelijkheden, de theoretische aanpak, de mate van rationele bestudering en de analyseerbaarheid van het te voorspellen criterium, zal de samengestelde test goed of minder goed functioneren.

    Fase 3: Proefafneming van bestaande of nieuwe tests

    Proefafnames op verschillende groepen proefpersonen. Deze groepen moeten zoveel mogelijk overeenkomen met de uiteindelijke populatie die getest moet worden. Afwijkingen tussen steekproef en populatie zijn:

    • Niet erg bij gemiddelden omdat betrouwbaarheid en validiteit niet veranderen bij variatie van gemiddelden.
    • Wel erg bij spreiding; betrouwbaarheid en validiteit veranderen wel bij spreidingsvariatie.

    Door middel van een gestratificeerde steekproef vooraf rekening houden met de samenstelling van de populatie op relevante demografische en persoonlijke variabelen, zorgt voor een representatieve steekproef. Want een aselecte grote steekproef voldoet vaak niet vanwege moeilijk bereikbare deelgroepen. Als een test op een niet-representatieve steekproef is gebouwd, kan er niet zonder meer gegeneraliseerd worden naar andere groepen.

    Er wordt onderscheid gemaakt tussen het vooronderzoek en het hoofdonderzoek. Een vooronderzoek dient als grove zeef of het begrepen wordt, items niet te moeilijk/makkelijk zijn en of de testtijd realistisch is (een kleine niet-representatieve steekproef is voldoende). Een hoofdonderzoek dient om de definitieve test te construeren (grote, representatieve steekproef nodig).

    1. Het vooronderzoek (met behulp van proefafnames) heeft verschillende doelen. Men doet verschillende proefafnames omdat men verschillende beslissingen moet nemen, elke beslissing wordt al verwerkt voor de volgende nieuwe proefafname.

    2. Eerste proefafname: Het verzamelen van informatie voor een itemanalyse indien de test moet worden geconstrueerd. De itemanalyse bestaat uit het bepalen van de moeilijkheidsgraad en de item-restcorrelatie:

      • Moeilijkheidsgraad: extreem moeilijke/makkelijke items zijn alleen gewenst als de test ook extreme personen moet kunnen meten (adaptief testen). Het onderzoeken van de moeilijkheid levert ook informatie op over het functioneren van items.

      • Item-restcorrelatie: de correlatie van elk item met de totaalscore op de overige items; een hoge correlatie betekent dat een item veel gemeen heeft met de andere items en dus dezelfde eigenschap meet. Hiermee kan een relatief betrouwbare testscore verkregen worden.

    3. Tweede proefafname: Een schatting maken van de betrouwbaarheid, de juiste testlengte en het beste snelheidskarakter voor de gehele test. En een indruk krijgen van de validiteit waarvoor criteriumscores uit de eerste fase gebruikt worden.

    Op basis van gegevens uit fase 3 wordt de definitieve test samengesteld.

    Fase 4: Validatie van de testprocedure

    1. Het valideringsonderzoek

    In deze fase vindt de echte validatie van de test plaats. De voorspelling gebeurt vaak met een beschikbaar criterium in plaats van met een toekomstig criterium, want validatie is lastiger naarmate het criterium verder weg in de tijd ligt. Criteriumscores zijn dus ook direct beschikbaar, men hoopt de gegevens te kunnen gebruiken voor het bedoelde pas in de toekomst te bepalen predictiemodel. Maar generalisatie naar de realiteit van de situatie die men wil voorspellen is niet altijd mogelijk omdat:

    • Tijdens de proefafname kan de motivatie van de proefpersonen minder zijn dan in de echte testsituatie.
    • Eigenschappen en instelling van de proefpersoon kunnen erg verschillen van de echte situatie (zoals bij een sollicitatie of examen).

    Er zijn een aantal bezwaren tegen de ideale validatieprocedure van tests, namelijk wachten tot de echte criteriumgegevens beschikbaar komen:

    • De lange duur van het onderzoek.
    • Variatiebeperking of 'restriction of range' op de criterium- en predictorvariabele, omdat er door uitval zowel zeer geschikte als juist niet geschikte uit de aanvankelijke onderzoeksgroep verdwijnen. Hierdoor nemen zowel betrouwbaarheid als validiteit af.
    • Het oordeel van een latere beoordelaar kan al beïnvloed zijn door eerdere testuitslagen. Dit wordt ook wel contaminatie van het criterium genoemd. Hierdoor komt de validiteitscoëfficiënt mooier naar voren dan in werkelijkheid het geval is.

    2. Het vaststellen van de validiteit

    De meest gangbare methode bij het validatie-onderzoek is een schatting te maken van de (lineaire) correlatie door middel van de Pearson-product-momentcorrelatie. Dit klopt echter niet altijd. Er zijn twee bekende uitzonderingen waarbij de product-momentcorrelatie een lage waarde oplevert terwijl er wel een interessante relatie bestaat:

    1. Kromlijnige relatie. Een lage testscore gaat gepaard met een lage criteriumscore, een hogere testscore met een hogere criteriumscore, maar een zeer hoge testscore weer met een lage criteriumscore. In plaats van de moment-productcorrelatie kan de correlatieratio η (èta) gebruikt worden: een correlatiemaat die onafhankelijk is van de vorm van de exacte relatie.

    2. Heteroscedastische relatie. Er bestaat wel een verband tussen de lagere waarden van twee variabelen, maar niet tussen de hogere waarden. Naarmate X toeneemt, neemt de spreiding van Y ook toe. In plaats van de moment-productcorrelatie kan de correlatiecoëfficiënt θ (thèta) gebruikt worden: geeft de gemiddelde relatie over de verschillende niveaus van de testscore weer.

    Veel relaties zijn niet perfect homoscedastisch (is overal gelijke spreiding van Y), daarom moet de relatie tussen X en Y goed onderzocht worden en er mag niet kritiekloos gebruik gemaakt worden van de moment-productcorrelatie.

    Testscores kunnen ook op andere manieren gebruikt worden bij een voorspelling. Namelijk als:

    1. Suppressorvariabele. Stel: X1 en X2 correleren met elkaar, X1 correleert met Y, maar X2 correleert niet met Y. X2 correleert kennelijk met het deel van X1 dat niet met Y correleert. Als we met behulp van X2 dit deel uit X1 halen, dan blijft er een gecorrigeerde variabele (X'1) over die sterker met Y correleert dan de ongecorrigeerde versie. Zo maakt X2 het mogelijk dat X1 een beter voorspeller wordt voor Y. X2 is de suppressorvariabele omdat hij het niet-relevante deel van X1 bij de voorspelling van Y onderdrukt.

      • Voorbeeld: taalvaardigheid X2 (suppressor) speelt een rol in een toets voor rekenvaardigheid X1 waarmee geschiktheid voor Y wordt voorspeld; taalvaardigheid is hiervoor niet van belang, rekenvaardigheid wel. Door de scores op de rekentoets X1 te corrigeren voor taalvaardigheid X2 kan een betere voorspelling van Y worden gekregen.

    2. Moderatorvariabele. Een variabele die zelf niet hoeft te correleren met Y, maar wel de relatie van andere variabelen met Y beïnvloedt. Het is belangrijk om rekening mee te houden; ze verduidelijken de relatie tussen test en criterium en maken duidelijk dat tests soms maar in een beperkt aantal deelgroepen uit een populatie bruikbaar zijn.

      • Voorbeeld: een testscore correleert wel voor mannen met Y, maar niet voor vrouwen; de correlatie voor een gemengde populatie is matig, maar in afzonderlijke groepen mannen en vrouwen geheel anders. Sekse is de moderatorvariabele.

    3. Interactie-effect. Twee variabelen correleren apart met Y en hebben daarnaast ook nog een interactie-effect op Y. Als beide variabelen een hoge score hebben, wordt de correlatie met het criterium extra verhoogd: noemt men ook ‘moderated regression’.

    Fase 5: Samenstelling van de predictorbatterij

    De tests waarvoor een bruikbare validiteit vastgesteld is, worden gecombineerd in een maximaal voorspellende testbatterij. Als techniek om een goede samenhang te krijgen in de keuze van tests, neemt men vaak de multiple/meervoudige regressie-analyse: de testscores wegen en optellen tot een voorspelling van Y. Een regressiegewicht is relatief groot als de test hoog correleert met criterium Y en laag met andere tests; dus als de unieke bijdrage van de test aan de voorspelling van Y relatief groot is. Het meest ideaal is een testbatterij met tests die onderling laag correleren (weinig overlap) en alle hoog met Y correleren; ze verklaren alle een uniek aspect van Y. Het is namelijk zinloos als tests in een batterij alle ongeveer hetzelfde meten, dat wordt afgestraft in het regressiemodel met lage gewichten voor diverse van deze tests. Het geeft geen extra bijdrage aan de voorspelling van Y.

    De multiple correlatie is een maat voor het succes van de gehele testbatterij voor de voorspelling van Y; de correlatie van de totaalscore gebaseerd op de hele testbatterij met het geobserveerde criterium Y.

    Fase 6: Kruisvalidering ('cross-validation')

    De laatste fase is de kruisvalidatie. In een tweede onderzoek op een onafhankelijk steekproef vergelijkbaar met de eerste steekproef, worden de gevonden correlaties uit de eerste steekproef onderzocht of ze niet uit te veel toevallige relaties zijn ontstaan.

    De reden hiervoor is dat een regressiemodel komt vaak tot stand komt na trail-and-error – voorspellers worden weggelaten of juist toegevoegd – en het uiteindelijke model is dan vaak het resultaat van het proberen van veel varianten. Naarmate de steekproef kleiner is, leunt het meer op de toevallige samenstelling. Als gevolg daarvan worden naast goede ook foute beslissingen genomen. Die fouten stapelen zich op als men meer modellen probeert, dat noemt men kanskapitalisatie. Hierdoor past het model goed bij die ene toevallige steekproef, maar niet meer bij de rest van de populatie. Dat kan voorkomen worden door vooraf de theorie goed te bestuderen en op voorhand al modellen uit te sluiten. En nagaan in hoeverre het uiteindelijk gekozen model door steekproeffouten tot stand is gekomen.

    Om een indruk krijgen van de mate waarin kanskapitalisatie zich heeft voorgedaan kan men:

    1. Een nieuwe steekproef trekken die even groot is (is duur en tijdrovend).

    2. De bestaande steekproef aselect splitsen in twee gelijke delen: de kansrijkste voorspellingsmodellen op de ene helft uitproberen en kruisvalidering doen van het uiteindelijk gekozen model op de andere helft.

    Kruisvalidering: het op basis van steekproef 1 gekozen model wordt in steekproef 2 gebruikt om daar voor elke persoon een schatting te maken van diens criteriumscore. Deze schatting wordt gecorreleerd met de geobserveerde criteriumscore Y, zodat voor steekproef 2 een multiple correlatie wordt verkregen, maar op basis van het model uit de steekproef 1. Deze correlatie wordt vergeleken met de multiple correlatie uit steekproef 1: als deze twee correlaties niet veel verschillen is er weinig kanskapitalisatie, maar als er een groot verschil is, is het model buiten steekproef 1 blijkbaar niet bruikbaar; de validatie is mislukt.

    Kruisvalidering is erg belangrijk in elk onderzoek waar een effect of relatie wordt onderzocht. Een model dat bij kruisvalidering overeind blijft – een robuust model – maakt meer kans om tot de juiste beslissingen te leiden.

    Welke differentiatie kan er gemaakt worden in het criteriumonderzoek?

    De resultaten van het empirisch valideringsonderzoek zijn vaak niet erg veelbelovend. Een lage correlatie en validiteit zeggen echter niet altijd dat de test slecht is; het hangt ervan af of er voorafgaand aan de voorspelling al relevante informatie beschikbaar was (niet verkregen door een test). Tests die misschien minder valide zijn, maar wel een beroep doen op unieke eigenschappen, kunnen een extra bijdrage aan de voorspelling leveren.

    Er zijn een aantal verklaringen voor die lage validiteit:

    1. Door de erg lage betrouwbaarheid van gebruikte criteria. Er is te weinig aandacht voor het ontwerpen van een betrouwbare criteriummaat; de gebruikelijke schoolcijfers, bedrijfsbeoordelingen en psychiatrische classificaties zijn vaak onvoldoende betrouwbaar. De constructie van een criteriummaat moet net zo zorgvuldig gebeuren als de constructie van een predictormaat.

    2. Door de afwijking van de homoscedasticiteit en lineariteit van de relatie tussen test en criterium, zodat de gebruikelijke product-moment-correlatie een te somber beeld geeft van de sterkte van de relatie. Dat moet onderzocht worden door middel van een visuele inspectie van de scatter plot (puntenwolk).

    3. Doordat in het validatie-onderzoek men met té heterogene groepen werkt. Men moet dan aparte subgroepen maken en per groep aparte validiteiten berekenen. Het is ook belangrijk om de juiste covariaten en moderatorvariabelen te vinden. Het gaat dus om de vraag of er er kan worden uitgegaan van één voorspellingsmodel voor alle groepen of dat er per relevante groep een apart model nodig is. Dat is te onderzoeken met regressiemodellen voor geneste gegevens: multiniveaumodellen.

    4. Externe variabelen die de correlatie tussen test en criterium beïnvloeden, worden niet genoeg onderkend; hetzelfde criterium kan in verschillende organisaties verschillende betekenissen hebben. Aangezien het criterium verschilt per organisatie, moeten voorspellingsmodellen zowel uiteenlopende predictoren als uiteenlopende criteriummaten bevatten.

    5. Onterechte vereenvoudiging van het criterium. Men gaat uit van een te eenvoudig beeld, waarin een complex criteriumgedrag is samengevat in een enkele criteriummaat. Daarnaast is het criteriumgedrag is niet zonder meer generaliseerbaar in tijd maar gebonden aan het moment van de meting. Men moet zich niet richten op een momentopname (statisch criterium), maar op veranderingen tussen momentopnamen (dynamisch criterium). Daarmee kan men de mate van verandering, groei en verbetering tussen twee momenten voorspellen.

    In hoeverre is validiteitsgeneralisatie mogelijk?

    De vraag is in hoeverre tests en functies inwisselbaar zijn, en dus in hoeverre we met dezelfde voorspellingssituatie te maken hebben. In dat geval is er namelijk geen nieuw valideringsonderzoek nodig. Predictieve validiteit wordt ook wel gezien als in hoge mate situatiespecifiek en generaliseerbaar.

    Schmidt en Hunter (1977) hebben een methodiek ontwikkeld om te kijken of dit wel zo is:

    1. Voor alle combinaties van een specifieke test en gedrag in een speciale functie worden de validiteitscoëfficiënten bepaald en de daarbij horende standaarddeviatie. De conclusie van Schmidt en Hunter is dat validiteitsresultaten weinig situatie-specifiek zijn.

    2. Het onderzoek naar validiteitsgeneralisatie waarbij een schatting gemaakt wordt van de effectiviteit. Op basis van de effectiviteit en de ondergrens van de validiteit binnen een categorie van tests en functies kunnen uitspraken gedaan worden over de te verwachten validiteiten in toekomstige selectiesituaties met dezelfde categorie tests. De conclusie van Schmidt en Hunter is dat effectiviteit groot is en de validiteit vaak constant zal zijn over situaties.

    Methodologische artefacten die de grote variatie in validiteitscoëfficiënten zouden kunnen verklaren, aldus Smith en Hunter:

    • Steekproeffouten: hieronder vallen factoren als een kleine steekproefgrootte (waardoor toevalsinvloeden verhoudingsgewijs een grote invloed hebben) en min of meer subtiele verschillen in samenstelling van de steekproeven (waardoor deze niet volledig representatief zijn voor de achterliggende populatie).
    • Onbetrouwbaarheid van test en criterium.
    • Beperking van de variatiebreedte: over een smal interval van test- en/of criteriumscores valt de correlatie lager uit dan over een breed interval.

    De belangrijkste bezwaren tegen het onderzoek van Schmidt en Hunter zijn:

    • Door het gebruik van ruw geschatte criteria wordt de hypothese dat validiteit onafhankelijk van de situatie zou zijn meer bevestigd.
    • De correctie van de variantie van de validiteitscoëfficiënten zou te sterk zijn en er wordt alleen voor bepaalde artefacten gecorrigeerd. De hypothese dat de validiteit onafhankelijk is van de situatie wordt door deze overcorrectie bevestigd.

    Welke beperkingen heeft de predictieve validiteit?

    De beste predictoren worden vastgesteld met regressie-analyse (hoog correlerende krijgen een zwaarder gewicht). De vraag is of deze statistische selectie ook leidt tot inzicht in de vraag waarom een testbatterij het criterium goed voorspelt. Het is belangrijk om te weten waarom een bepaalde predictor het criterium zo goed voorspelt; de achterliggende psychologische principes moeten begrepen worden.

    De predictieve validiteit houdt zich bezig met de vraag of de test een belangrijk criterium kan voorspellen. Men moet zich echter niet beperken tot deze predictieve validiteit, voor zowel empirische als praktische verdieping zijn begripsvaliditeit en de betekenisanalyse onmisbaar. Redenen hiervoor zijn:

    • Bij begrip van de (afwezigheid) van samenhang kunnen er hypothesen gevormd worden om de predictieve validiteit te verbeteren.

    • Bij een extreme empirische benadering moet de validering over alle mogelijk predictoren gaan. In de praktijk echter wordt al gestart met een keuze van tests gebaseerd op een analyse van het criterium en de test. Daarvoor wordt ook al gebruik gemaakt van de betekenis- en begripsvaliditeit.

    • Bij een unieke of zeldzame situatie waarvoor het erg moeilijk is om een criterium vast te stellen. Er kunnen alleen hypothesen hierover geformuleerd worden.

    • Bij beschrijving van het psychologische beeld van de onderzochte wordt gebruik gemaakt van de betekenis en de theorie van de test.

    • Betekenisanalyse en begripsvaliditeit bieden de mogelijkheid de aard en de betekenis van het criterium te analyseren.

    Begripsvaliditeit krijgt pas door de betekenisanalyse zin en inhoud. De betekenisanalyse onderzoekt met hypothetische begrippen wat de test meet en welk psychologisch begrip het testgedrag verklaart.

    Wat is betekenis en begripsvaliditeit?

    Wat is begripsvalidering?

    Aan begripsvalidering gaat meestal een proces van betekenisanalyse vooraf: het beantwoorden van de vraag wat een test (of items) zou kunnen betekenen. Betekenisanalyse kent dezelfde fasen als bij de theorievorming en algemene toetsing:

    Fase 1: Betekenisanalyse; een creatieve fase

    Er wordt een theorie gecreëerd dat het testgedrag hypothetisch kan verklaren. Kenmerken van deze eerste fase zijn:

    • De procedure en methodiek zijn niet voorgeschreven en bindend (creatief).
    • De voorspelling moet ondubbelzinnig te onderzoeken zijn, zodat er geen discussie over mogelijk is.
    • Er is geen bewijs dat een test wel of niet een theoretische betekenis heeft, het bevestigen van de hypothese kan een theorie alleen versterken (of verzwakken bij niet-bevestigen).
    • Het is net zo belangrijk alternatieve hypothesen te kunnen verwerpen als de oorspronkelijk theorie te kunnen bevestigen.

    In deze fase zijn er twee methoden volgens Campbell (1960) om het testgedrag te kunnen valideren:

    1. Trekvaliditeit: gedrag verklaren met behulp van een persoonlijkheidstrek of geschiktheidsdimensie (het gaat dus niet noodzakelijk om een theorie).
    2. Nomologische validiteit: testgedrag wel verklaren door een theorie door het gedrag te in verband te brengen met een ‘nomologisch netwerk’. Een nomologisch netwerk is een theoretisch kader aan begrippen en relaties hiertussen.

    Voorbeeld: validering van het Taylor Manifest Anxiety Scale (TMAS): trekvalidering: door de beoordelingen van het angstniveau van patiënten als criterium te nemen; nomologische validering: door het testgedrag op de TMAS te relateren aan de Hull-Spence-leertheorie (= een nomologisch netwerk).

    Trekvalidering wordt vaker gebruikt dan nomologische validering; Borsboom staat zelfs afwijzend ten opzichte van nomologische validering – omdat er te weinig specificatie is van de te verwachten correlaties. Dit boek staat er niet afwijzend tegenover.

    Er is een gradueel onderscheid tussen trekvalidering en nomologische validering. Vaak is er een onvoldoende gedetailleerde theorie, waardoor de testconstructie een wat exploratiever karakter heeft; men stelt achteraf pas vast wat de test meet, maar de onderzoeker had vooraf vaak wel een theoretische idee van het begrip dat hij probeerde te onderzoeken (uit eerder empirisch onderzoek). Daarnaast zijn theorieën nooit ‘af’, maar ontwikkelen, veranderen en wijzigen voortdurend. De validering van de test levert een bijdrage aan de verdere theorievorming. Tests spelen ook een dominante rol in de psychologische theorievorming; het levert meetgegevens op waarmee hypothesen over relaties getoetst kunnen worden (bijvoorbeeld onderzoeksgegevens van de Stanford-Binet-test hebben bijgedragen aan wat men onder intelligentie verstaat).

    De manier waarop gemeten wordt bepaalt dus mede het de definitie van het begrip in het brede kader van het nomologisch netwerk, met name in een vakgebied dat nog in de kinderschoenen staat. De testontwikkelaar begint echter niet in een vacuüm, maar sluit aan bij bestaande ideeën. Maar als de test de beste operationalisering daarvan is, gaat de test een belangrijke rol spelen in de ontwikkeling van de theorie.

    Fase 2: De begripsvalidering

    Empirische toetsing vindt plaats om voorspellingen gebaseerd op de potentiële verklaring van het testgedrag te onderzoeken. De functies van deze voorspellingen zijn:

    1. Het bevestigen van de hypothetische verklaring (confirmerende validiteit).
    2. Het verwerpen van alternatieve verklaringen (discriminante validiteit).

    Er zijn twee vormen van begripsvalidering: in een praktisch niet-experimenteel kader en in een experimenteel kader. Maar begripsvalidering vindt altijd plaats volgens strikte methodologische spelregels, dit in tegenstelling tot het proces van betekenisanalyse.

    Hoe verloopt de betekenisanalyse?

    De vermoedens en verwachtingen van de onderzoeker over de te meten eigenschap vormen de basis voor de theorievorming over het testgedrag. Als de onderzoeker werkt vanuit een duidelijk theoretisch uitgangspunt, hoeft er niet aan betekenisanalyse gedaan worden, en kan hij meteen doorgaan met begripsvalidering.

    Het zoeken naar een verklaring van testgedrag kan door middel van het analyseren van inhoudelijke of formele kenmerken van het testgedrag. Er zijn twee soorten onderzoek: structuuronderzoek en relatieonderzoek.

    Structuuronderzoek

    Ontleding van de structuurkenmerken van de test kan op twee manieren leiden tot inzicht in de betekenis van het testgedrag:

    1. Psychologische analyses van de inhoud van de vragen en de opdrachten die leiden tot veronderstellingen die nog wel moeten worden getoetst. Dat kan door proberen een indruk te krijgen van het oplossingsproces tijdens het oplossen van de vragen of door het bestuderen van de literatuur over de items.
    2. Analyses van de formele kenmerken van de test, zoals het verschil tussen twee type tests of de testscorecorrelatie op twee verschillende tijdstippen.

    Relatieonderzoek

    Gegevens uit relatie-onderzoek kunnen worden gebruikt als bron voor ideeën, er zijn vier vormen:

    1. Spreiding en normen. Het bestuderen van gegevens over spreiding en normen in verschillende groepen geeft informatie over wat de test meet.
    2. Experimenteel onderzoek. Door experimenten kan men over de betekenis van het testgedrag suggesties doen.
    3. Factoranalyse. Dit is een methode om een groot aantal variabelen samen te vatten in een kleiner aantal factoren, zodat de inzichtelijkheid toeneemt en waardoor er hypothesen gemaakt kunnen worden over de eigenschappen die aan deze factoren ten grondslag liggen. Een factor is de gewogen som van itemscores of testscores. Factoranalyse gaat uit van correlaties of covarianties tussen testscores. Als de correlaties allemaal ongeveer nul zijn, zijn de testprestaties onafhankelijk van elkaar: de tests meten elk een andere eigenschap en bevatten elk unieke informatie over het individu. Als de correlaties hoog zijn, vertonen de tests veel ‘overlap’ met elkaar: de tests meten dezelfde eigenschap en één enkele factor kan de structuur in de gegevens verklaren. De werkelijkheid ligt vaak tussen deze uitersten in; het aantal factoren dat de tests kan beschrijven, is vaak kleiner dan het aantal tests, maar slechts één factor komt maar zelden voor. Factoren kunnen worden onderscheiden in:
      • Specifieke factoren die zijn gekoppeld aan (een gedeelte van) een test.
      • Groepsfactoren die een kleiner gedeelte van de tests vertegenwoordigen.
      • Algemene factoren, waarmee vrijwel alle tests min of meer samenhangen.

    Op basis van de psychologische interpretatie van de factoren kan de betekenis van het testgedrag verhelderd worden. Factoranalyse is een bruikbare methode, maar de waarde ervan hangt af van een aantal voorwaarden en uitgangspunten:

    1. De aard van de steekproef waarop men de analyse uitvoert. Een structuur van factoren wordt scherper door het contrast tussen hoge en lage correlaties (een heterogene steekproef levert hogere correlaties op).
    2. De hoeveelheid en de aard van de variabelen die in de analyse worden opgenomen. Testbetekenis wordt door de betekenis van andere (test)variabelen uitgedrukt.
    3. De namen die worden gegeven aan de factoren komen tot stand door een subjectieve inhoudsanalyse van de test.
    4. Mathematische en technische keuzes hebben invloed op het resultaat. Omdat factoren constructies zijn van de onderzoeker, zijn die keuzes arbitrair en moeten expliciet gemaakt worden.

    Factoranalyse moet niet klakkeloos worden toegepast; de onderzoeker moet zich bewust zijn van de vooronderstellingen en de beperkingen.

    • Wat kan de test voorspellen? Wat de test kan voorspellen zegt iets over wat de test meet; er is een wisselwerking tussen betekenisanalyse en predictieve validiteit.

    Een combinatie van verbeelding (creatieve ideeën) en systematische analyse (efficiënte manier) is dus belangrijk bij structuur- en relatieonderzoek om antwoord op de betekenisvraag te krijgen.

    Welke alternatieve verklaringen zijn er?

    Begripsvalidering gebeurt enerzijds door de oorspronkelijke hypothese te confirmeren en anderzijds door concurrerende hypothesen die alternatieve verklaringen voor het testgedrag geven te verwerpen. Het is niet altijd zinnig om deze alternatieven te verwerpen, om twee redenen: de eerste is dat de waarde van het verwerpen samenhangt met de waarde van de experimentele opzet, door een onjuiste of slordige opzet kan ten onrechte een alternatieve verklaring worden verworpen. Alternatieve hypothesen moeten een eerlijke kans krijgen. Ten tweede hangt de waarde af van de plausibiliteit van de alternatieve verklaring.

    Het vinden van alternatieve verklaringen is ook een creatief proces. Maar het is toch verstandig om enkele alternatieven altijd te controleren (als een soort routine):

    1. Samenhang met intelligentie

    Het is verstandig prestatie- en gedragstests altijd te correleren met intelligentietests, waarvan de formele kenmerken op de onderzochte test lijken.

    2. Sociale wenselijkheid als onbedoelde eigenschap

    Dat vormt vooral bij persoonlijkheidsvragenlijsten een probleem. Een test die onbedoeld sociale wenselijkheid meet, functioneert niet goed. Er zijn twee vormen van sociale wenselijkheid:

    • Een individuele vorm: per individu verschilt de opvatting over wat sociaal wenselijke antwoorden zijn. Te onderzoeken door een individu per testvraag ook de mate van sociaal wenselijkheid te laten geven. De correlatie tussen beide gegevens geeft de mate van sociaal wenselijkheid van de test. En het kan onderzicht worden door te kijken naar het verschil in antwoorden tussen anonieme en niet-anonieme tests.

    • Een algemene vorm: er is een algemeen aanvaarde opvatting over wat sociaal wenselijke antwoorden zijn. Te onderzoeken door een algemene sociale-wenselijkheidssleutel te construeren gebaseerd op de antwoorden over sociale wenselijkheid van testvragen gegeven door een groep proefpersonen.

    Sociale wenselijkheid is een veelvoorkomend fenomeen, maar de meeste goede vragenlijsten hebben toch wel een bruikbare correlatie met externe criteria: de neiging tot het geven van sociaal wenselijke antwoorden kan voor de voorspelling van ander gedrag relevant zijn, waardoor de vragenlijsten toch praktisch bruikbaar zijn.

    Het is echter ook verstandig sociale wenselijkheid te verminderen. Dat kan door een subtielere opzet van de vragenlijst of procedure, namelijk bij de formulering van items en de testinstructie, in de manier waarop de test wordt voorgelegd, in de keuze van de titel van de test, door te kiezen voor een bepaalde testvorm (bijvoorbeeld ‘forced-choice’-vorm) of door een correctie achteraf.

    3. Antwoordtendenties

    Een antwoordtendentie is de neiging tot een consistent keuzepatroon. Dit komt tot uiting in het antwoordgedrag op tests, los van de inhoud van de vragen, en dat op een betrouwbare manieren kan verschillen tussen proefpersonen. Er zijn verschillende antwoordtendenties:

    • Instemtendentie: er wordt overmatig ingestemd met de richting van de vraag.

    • Positievoorkeur: sommige posities bij antwoordmogelijkheden worden geprefereerd boven andere. Een bekende is de voorkeur voor het derde antwoord bij vierkeuzevragen in kennistoetsen.

    • Semantische interpretaties van de keuzecategorieën: de individuele interpretatie van de verbale frequentie-aanduidingen varieert. Voorbeeld: sommigen kiezen bij dezelfde frequentie voor ‘zelden’ waar anderen voor ‘soms’ zouden kiezen.

    • Sequentietendentie: neigingen tot het volgen van bepaalde regels in de opeenvolging van de gemaakte keuzen of de verdelingen over de keuzemogelijkheden. Bijvoorbeeld even vaak ‘ja’ als ‘nee’ willen kiezen of niet te veel dezelfde antwoorden achter elkaar willen geven.

    • Snelheidstendentie versus precisietendentie: mensen kunnen (van nature of door de eigen interpretatie van de instructies) de neiging hebben de nadruk te leggen op snelheid/kwantiteit of op juistheid/precisie.

    • Uitvoerigheidstendentie: de neiging tot uitvoerigheid komt met name voor bij open vragen. Het kan nadelig zijn voor de persoon als er antwoord wordt gegeven op vragen die niet worden gesteld en misschien wel onjuist zijn.

    • Gistendentie: sommige mensen hebben meer de neiging om te gaan raden dan anderen. Veel raden is voordeliger.

    • Voorkeur voor formele kenmerken: de neiging om af te gaan op formele kenmerken van de keuzemogelijkheden. Zoals bijvoorbeeld de neiging het langste of meest ingewikkelde antwoord te selecteren.

    Sociale wenselijkheid als antwoordtendentie hangt af van de definitie van antwoordtendentie: bij antwoordtendentie als antwoordwijze ontstaan door de vorm van de vraag hoort sociale wenselijkheid, die ontstaat door de inhoud van de vraag, niet. Antwoordtendenties worden veroorzaakt door de vorm van de vraag, sociale wenselijkheid door de inhoud van de vraag.

    Er kan pas rekening mee gehouden worden als het een waarneembare consistentie vertoont. Speciale vragenlijsten om bepaalde antwoordtendenties te meten om zo onderscheid te kunnen maken tussen mensen, hebben weinig meer opgeleverd dan globale en stereotype gedragsindicaties. Het is belangrijk om er rekening mee te houden bij de betekenisanalyse, en ook belangrijk bij de constructie van items.

    Wat is de relatie tussen betrouwbaarheid en validiteit?

    De begrippen betrouwbaarheid en validiteit moeten theoretisch goed worden gescheiden:

    • Betrouwbaarheid: de betrouwbaarheidsschatting geeft een betrouwbaarheidsinterval voor de betrouwbare testscore (klassieke testtheorie) en de persoonsparameter (item-responstheorie). Is een indicatie van de nauwkeurigheid van de meting.

    • Validiteit: wat de test meet (staat los van de nauwkeurigheid), en deze meting kan met verschillende graden van betrouwbaarheid plaatsvinden.

    Met een lage betrouwbaarheid meet de test wel de eigenschap, maar dan met veel ruis en dat is nauwelijks valide te noemen, want individuele verschillen in testscores zijn dan grotendeels gevolg van meetfouten en nauwelijks van systematische verschillen in de bedoelde eigenschap. Een grote meetfout betekent een lage correlatie met andere variabelen en dus een lage predictieve validiteit.

    Multitrek-multimethode-benadering

    Er is een methode ontwikkeld die testen evalueert in de context van validiteits- en betrouwbaarheidsonderzoek (Campbell en Fiske, 1959), de multitrek-multimethode-matrix. Deze methode onderscheidt zowel confirmerende en discriminante validiteit als betrouwbaarheid. De evaluatieprocedure van de test moet zowel verschillende trekken (voor de betekenis van de test) als verschillende methoden (voor de discriminantie met andere testen) omvatten.

    De multitrek-multimethode-matrix toont alle correlaties die uit alle combinaties van trekken en methoden ontstaan. Deze matrix toont:

    • Betrouwbaarheid door de monotrek-monomethode-overlap, correlaties voor dezelfde trekken en methoden (b-waarden).

    • Confirmerende validiteit door de monotrek-heteromethode-overlap, correlaties voor dezelfde trekken en verschillende methoden (v-waarden).

    • Methodevariantie door heterotrek-monomethode-overlap, correlaties voor verschillende trekken en dezelfde methode (m-waarden).

    • Heterotrek-heteromethode-overlap, de correlaties voor verschillende trekken en eigenschappen (d-waarden).

    Vier overweging met betrekking tot de validiteitsverwachtingen:

    1. De v-waarden moeten verschillen significant van 0; ze moeten zo hoog zijn dat er met de test verder gewerkt kan worden (confirmerende validiteit).

    2. De v-waarden moeten hoger zijn dan de d-waarden; dan is de validiteit van die variabele hoger dan de correlatie tussen die variabele en andere variabelen die er niets mee gemeen hebben.

    3. De v-waarden moeten hoger zijn dan de m-waarden; twee onafhankelijke maten van dezelfde trek moeten hoger correleren dan twee verschillende trekken die met dezelfde methode zijn gemeten.

    4. Het correlatiepatroon van de m-waarden moet ongeveer gelijk zijn aan die van de d-waarden.

    Door deze laatste drie verwachtingen kan de discriminante validiteit vastgesteld worden. Namelijk dat de test niet met andere trekken ongewenst hoog correleert en dat de methode zelf niet voor de hoge v-waarden verantwoordelijk is.

    Deze benadering laat zien dat de test-hertestmethode in de categorie valt van dezelfde methode en dezelfde trek. De correlatie ervan zegt dus iets over de herhaalbaarheid van de meting van de eigenschap. Bij paralleltests is de correlatie tussen twee paralleltests een b-waarde. Maar als ze erg afwijken van parallellie, dan is een meting van dezelfde trek met verschillende methoden, dus is de correlatie de v-waarde: confirmerende validiteit.

    De multitrek-multimethodebenadering is een model om zowel de betrouwbaarheid als de confirmerende en discriminerende validiteit van een test te onderzoeken.

    Access: 
    Public
    Welke bijdrage levert de test in het beslissingsproces? - Chapter 9

    Welke bijdrage levert de test in het beslissingsproces? - Chapter 9

    Wanneer er een keuze moet worden gemaakt tussen verschillende alternatieven, vindt er voor die keuze altijd een zekere beoordeling plaats. Dit hoofdstuk zal in gaan op de vraag welke bijdrage een test aan dit beslissingsproces kan leveren.

    De waarde van een test valt uiteen in twee delen. De wetenschappelijk waarde van een test wordt bepaald door de wetenschappelijk waarde van de te meten eigenschap. De praktische waarde van een test hangt af van het succes van de beslissingen die met behulp van de test kunnen worden genomen.

    De test moet een bijdrage leveren aan een beoordeling of beslissing, om deze bijdrage te kunnen beoordelen moet gekeken worden naar de kans op succes en de waardering van dat succes. Deze kansen en waarderingen verschillen per beslissingssituatie.

    Er wordt altijd beoordeeld en op basis daarvan beslist, de vraag is wat een test hieraan kan toevoegen. In een situatie zonder test is er vaak ook al redelijk wat informatie beschikbaar voor het maken van een ‘juiste’ beslissing. Daarom moet er bij het vaststellen van de praktische waarde van een test niet worden vergeleken met een random keuzeproces (aldus Cronbach en Gleser). Beter is om de situatie met test te vergelijken met de a-prioristrategie (het totaal aan voorspellingsmogelijkheden zonder de test).

    Dit wordt ook wel ‘incremental validity’ genoemd: de waarde van een test wordt bepaald door de toevoeging die een test geeft aan het a-prioriniveau van voorspellingsmogelijkheden. Hoe onafhankelijker de test is van de reeds beschikbare informatie, des te groter diens waarde dus is.

    Overigens moet worden gesteld dat er voor een aantal (vaak zeer eenvoudige) functies de ‘antecedent probability’ of ‘base rate’ (het gehalte geschikte personen in de bevolking) zeer groot is. Een random toewijzing, dus zonder gebruik van een test, zal in deze gevallen adequaat genoeg zijn. Een test zal hier daarom van weinig toevoegende waarde zijn.

    De praktische waarde van een test kan niet los worden gezien van het beslissingsproces zelf. We zullen hieronder daarom de verschillende soorten beslissingen, de meest voorkomende beslissingen in de testtheorie, en de beslissingsprocedure bij een ‘open vraag’ bespreken.

    Welke indelingsprincipes (taxonomie) zijn er met betrekking tot het nemen van beslissingen over mensen?

    Een beslissing bestaat altijd uit de volgende drie componenten:

    1. Eén of meer individuen waarover de beslissing wordt genomen.

    2. Twee of meer behandelingen waar men bij de beslissing uit moet kiezen (het woord ‘behandeling’ moet ruim opgevat worden).

    3. De informatie met behulp waarvan de beslissing kan worden genomen.

    Wanneer er bepaalde vaststaande regels worden gevolgd bij het nemen van een beslissing, is er sprake van een beslissingsstrategie. Deze bestaat meestal uit de volgende cyclus: ‘nader onderzoek – tests – informatie – informatieverwerking’. Deze cyclus kan diverse malen worden herhaald, net zo lang totdat er genoeg informatie beschikbaar is voor het maken van een definitieve beslissing.

    Vaak komen de normatieve en de empirische, feitelijke strategie niet met elkaar overeen. Niet alle beslissingsstrategieën worden even duidelijk en consequent toegepast. Extra informatie, gevoelsmatige ideeën, slordigheden en inconsequenties sluipen in de beslissingsstrategie en hebben invloed op de uiteindelijke beslissing.

    Beslissingen kunnen worden opgedeeld aan de hand van drie principes: (1) het onderscheid tussen individueel en institutioneel, (2) de onderlinge relatie van de alternatieven en (3) beslissingen die met behulp van univariate informatie genomen worden. Deze principes worden hieronder besproken.

    1. Het onderscheid tussen individuele en institutionele beslissingen

    Individuele beslissingen. De uitwerking van een beslissing is per persoon verschillend, de waarde van een bepaalde beslissing moet dan ook voor ieder individu apart worden bekeken. Bij individuele beslissingen gaat het om eenmalige beslissingen waarbij volledig rekening wordt gehouden met de persoon waarvoor of waardoor de beslissing wordt genomen. Bijvoorbeeld: beroepskeuze, schoolkeuze of keuze voor een studiepakket. Het rendement van de beslissing verschilt per individu.

    Institutionele beslissingen. Bij institutionele beslissingen is er sprake van een waardesysteem dat voor alle te nemen beslissingen opgaat. Er is een bepaalde reeks beslissingsregels voorhanden die geldend is voor meerdere beslissingen tegelijk. Er kan hierdoor in een keer een groot aantal gelijksoortige beslissingen worden genomen. Omdat het hier niet om een eenmalige beslissing gaat, maar om meerdere, kan er worden gesproken over een gemiddeld rendement. Het totale rendement van een institutionele beslissingsstrategie valt samen met het gemiddelde rendement van de op zichzelf staande beslissingen. Voorbeelden van institutionele beslissingen zijn: rijexamen, toelatingsprocedures voor scholen, plaatsing bij een bedrijf of therapiekeuze in een kliniek.

    2. De onderlinge relatie tussen de verschillende keuzemogelijkheden

    De onderlinge relatie tussen de verschillende keuzemogelijkheden is van invloed op de keuze voor een bepaalde test. Er zijn twee mogelijkheden:

    1. Univariaat. Wanneer er alleen sprake is van een kwantitatief verschil (niveauverschil) tussen de mogelijkheden, en ze qua aard dus niet van elkaar verschillen, is dezelfde informatie voor beide mogelijkheden toereikend. Het variëren van de norm is dan voldoende. Deze beslissing wordt univariaat genoemd; wanneer er alleen sprake is van een niveauverschil, kan worden volstaan met één schaaldimensie. Een voorbeeld van dit type beslissing is de keuze tussen verschillende schoolniveaus.

    2. Multivariaat. Er wordt gesproken van multivariate informatie als de alternatieven kwalitatief van elkaar verschillen. Naast een eventueel niveauverschil is er nu ook sprake van een structureel verschil. Bijvoorbeeld het verschil tussen opleidingen, beroepen, en stoornissen. Bij zulke kwalitatief verschillende alternatieven is een differentiële voorspelling noodzakelijk. Dit is een voorspelling die berust op een multivariate analyse. Voorbeelden van testinformatie die multivariaat van aard is, zijn profielscores, verschilscores en scorepatronen.

    3. Onderscheid binnen univariate beslissingen

    Beslissingen die met behulp van univariate informatie zijn genomen, kunnen vervolgens weer in twee subgroepen worden onderverdeeld: de keuze voor één enkele behandeling (treatment), of de keuze tussen meerdere mogelijkheden. In het eerste geval gaat het om de keuze tussen ‘wel’ of ‘niet’, deze beslissingen worden dichotoom genoemd. In het tweede geval gaat het om het indelen in verschillende klassen.

    Deze driedeling brengt ons tot de volgende taxonomie van beslissingen:

       Institutionele beslissingenIndividuele beslissingen
    Univariate informatieDichotomie (wel/niet)-SelectieJa/Nee-keuze
     Klassen-Plaatsing (niveauverschil)Niveaukeuze
    Multivariate informatie -Plaatsing (kwalitatieve verschillen)Soortkeuze 

    Hierbij kunnen nog een aantal onderscheidingen worden gemaakt:

    1. In het bedrijfsleven en in de schoolse praktijk kan een beslissingen zowel univariate als multivariate gevolgen hebben: plaatsing voor een bepaald niveau heeft indirect ook gelijk een zekere selectie tot gevolg.

    2. Er kunnen zich een tweetal complicaties voordoen inzake plaatsingsmogelijkheden. Het aantal plaatsen dat ingevuld kan worden kan te weinig zijn (numerus fixus) of te veel (lerarentekort). In zulke gevallen hangt de beslissing niet alleen af van de geschiktheid van de kandidaten, maar ook van de beschikbaarheid/vraag van de treatments.

    3. Bij plaatsingsbeslissingen maakt het verschil of het gaat om een variabele of een vaststaande behandeling. Gaat het om een statische, van tevoren vaststaande behandeling, of is er binnen de behandeling nog mogelijkheid tot bijstellen?

    4. Een laatste onderscheid wordt gemaakt naar de vraag of de beslissingen in één fase plaatsvindt (‘single stage’ of ‘non-sequential decisions’) of meerdere fasen in beslag neemt (‘sequential decisions’). Een veelvoorkomend voorbeeld van dit laatste is het vooronderzoek.

    Wat is het enkelvoudige selectie- c.q. afwijzingsmodel?

    Enkelvoudige selectie, ofwel het klassieke geschiktheidonderzoek. Met deze test wordt onderzocht of een individu wel of niet aan de eisen voldoet en dus wel of niet toegelaten kan worden. Deze vorm van selectie wordt ook wel het afwijzingsmodel genoemd, omdat het er eigenlijk omgaat de ongeschikte individuen uit te selecteren. Een enkelvoudige selectie is een institutionele beslissing, op basis van univariate informatie.

    Hoe gaat enkelvoudige selectie bij het gebruik van een enkele test?

    Hoe hoog moet de correlatie met het criterium minimaal zijn zodat de test zinvol is in het selectieproces? De effectiviteit hangt af van meer factoren dan alleen van de validiteit van de test; soms is een lage correlatie toch nuttig of een heeft hoge correlatie toch weinig waarde.

    De resultaten van individuen in een selectieprocedure zijn onder te verdelen in vier groepen.

    1. Positieve missers (A): individuen die door hun testscore als onvoldoende beoordeeld zijn, maar het in de praktijk een voldoende criteriumscore behalen. Worden onterecht afgewezen.
    2. Positieve treffers (B): individuen die door hun testscore als voldoende beoordeeld zijn, en in de praktijk ook voldoen aan de kritische criteriumscore. Worden terecht geselecteerd.
    3. Negatieve treffers (C): individuen die door hun testscore als onvoldoende beoordeeld zijn, en het in de praktijk, dus met hun criteriumscore ook niet redden. Worden terecht afgewezen.
    4. Negatieve missers (D): individuen die door hun testscore als voldoende beoordeeld zijn, maar in de praktijk het niet redden (onvoldoende criteriumscore). Worden onterecht geselecteerd.

    Hieruit kunnen verschillende maten worden berekend:

    • De selectieratio is het percentage dat wordt aangenomen (positief bevonden kandidaten):
    • De toevalskans (‘antcedent probability’ of ‘base rate’) is het percentage geschikte individuen wanneer de selectie random plaatsvindt, of iedereen wordt aangenomen:
    • De succesratio is het aantal positieve treffers, ofwel het percentage succesvolle individuen binnen de geselecteerde groep:
    • Uit deze berekeningen kan afgeleid worden of het percentage succesvolle kandidaten na de selectieprocedure hoger ligt dan na een aselecte toelating.

    De succesratio bepaalt de effectiviteit van de selectie. Het is daarom belangrijk om te weten waardoor de succesratio bepaald wordt:

    1. De succesratio wordt bepaald door de validiteit van de test. Ofwel de correlatie van de test en het criterium. Hoe hoger de correlatie, hoe minder fouten er bij de selectieprocedure gemaakt zullen worden, en dus hoe groter de succesratio.

    2. De succesratio is ook afhankelijk van de toevalskans. Hoe groter de toevalskans, hoe groter de succesratio. Voor de toevalskans is enerzijds de kwaliteit van het aanbod bepalend en anderzijds de strengheid van de criteriumprestaties.

    3. Ook de selectieratio is van invloed op de succesratio. Wanneer er meer mensen kunnen worden afgewezen, wordt de succesratio kleiner.

    Deze drie verbanden hebben voor de daadwerkelijk beslissing en de evaluatie daarvan een aantal vervelende gevolgen. De absolute waarde van de validiteit van een test heeft op zichzelf weinig betekenis, er moet ook met andere factoren, zoals toevalskans en selectieratio rekening gehouden worden. Zes gevolgen hiervan zijn:

    1. Het selecteren van ongeschikte kandidaten. Dit hoeft niet aan de test te liggen, maar kan ook het gevolg zijn van een kwalitatief slecht aanbod, of een kwantitatief laag aanbod.

    2. Er is nog een tweede reden waarom fouten in de selectie niet altijd aan de test te wijten zijn. In het beslissingsproces spelen naast de subjectiviteit van de test en de testpsycholoog, ook die van de opdrachtgever een rol. Ook hij speelt een rol bij het bepalen van de selectievoorwaarden (de kritische testscore). De volgende zaken kunnen hierbij van invloed zijn: het niveau van het aanbod, de grote van de vraag, welke succesratio nastrevenswaardig is, hoeveel risico men wil nemen dat een ongeschikte persoon aangenomen wordt en de noodzaak tot het vullen van de vacatures.

    3. Een bepaalde validiteit heeft niet steeds dezelfde waarde voor een beslissing. Wanneer een toevalskans extreem groot is, heeft zelfs een valide test weinig tot geen positief effect. Omdat de meeste kandidaten aan de criteria voldoen, kan de test de succesratio nauwelijks verhogen, maar wel verlagen. Selectie met behulp van een test leiden in dit soort gevallen namelijk tot het afwijzen van een relatief groot aantal geschikte individuen. Omgekeerd geldt dus ook dat als er maar weinig geschikte kandidaten zijn, zelfs een test met een relatief lage validiteit toch een grote bijdrage kan leveren door veel ongeschikte kandidaten af te wijzen

    4. Wanneer de selectieratio hoog is ten opzicht van de toevalskans, moet de validiteit erg groot zijn om tot een goede selectie te kunnen komen. Voor het vaststelen van de succesratio, de toevalskans, de validiteit en de selectieratio kan gebruik worden gemaakt van de tabellen van Taylor en Russell, indien drie van de vier bekend zijn.

    5. Het verhogen van de aftestgrens (er worden dan minder mensen geselecteerd) heeft een positieve invloed op de succesratio. Er worden dan namelijk minder mensen onterecht geselecteerd. Dit heeft echter ook tot gevolg dat er meer mensen onterecht worden afgewezen. Er bestaat dus een problematische relatie tussen positieve (A) en negatieve (D) missers. Het beleid inzake de aftestgrens wordt bepaald door de volgende factoren:

      • Er zijn situaties waarin het aannemen van ongeschikte mensen ernstige gevolgen heeft.

      • Er zijn daarentegen ook situatie waarin het risico tot het aannemen van negatieve treffers graag genomen wordt, om de kans tot het vinden van die ene persoon met die specifieke eigenschap te vergroten. Het gaat hierbij dan om een relatief zeldzame eigenschap die vooraf moeilijk vastgesteld kan worden.

      • Als laatste bestaan er situaties waarin zowel de positieve als de negatieve missers zoveel mogelijk vermeden moeten worden. Zaak is in deze om de verticale kritische testlijn zo te plaatsen dat de uitkomst van (A+D) zo laag mogelijk is.

    6. Het vraag en aanbodprobleem. Wanneer er relatief veel mensen zijn, kan er streng worden geselecteerd en zal dit leiden tot veel positieve missers en maar weinig negatieve missers. Omgekeerd zal er bij te weinig kandidaten, afhankelijk van de ernst van de vacature, minder streng geselecteerd worden. Dit leidt tot minder positieve missers, maar wel tot meer negatieve missers. Ook al zijn de waarden van de verschillende beslissingsuitkomsten bekend, dan nog is het vaststellen van de beste aftestgrens erg moeilijk. De invoering van tests bij selecties met een erg kleine toevalskans maken de beslissingsstrategie vaak niet effectiever. Meehl en Rosen stelden zelfs dat het gebruik van tests in situaties met een gemiddelde validiteit maar een lage toevalskans, het maken van fouten bij de selectie zelfs kan vergroten. Hiervan is sprake in bijvoorbeeld de klinische psychologie.

    Utiliteit van een testprocedure

    Utiliteit is de opbrengst van de selectieprocedure. We gaan uit van een situatie waarin een hogere criteriumscore wordt gewaardeerd met een hogere utiliteit. De netto-utiliteit (ΔU) per onderzochte kan berekend worden met de formule: [9.1] (SU = standaarddeviatie utiliteit, rXU = correlatie tussen predictor en utiliteit, ξ(X’) = ordinaat (één van de twee coördinaten van een bepaald punt), C = gemiddelde kosten van de procedure per onderzochte).

    Deze formule is gebaseerd op de lineaire regressie van utiliteit U op predictor X, waarbij de helling van de regressielijn wordt bepaald door de coëfficiënt SUrXU. De netto-utiliteit wordt bepaald door vier factoren:

    1. De standaarddeviatie van de utiliteitsscores (SU) zegt iets over of een betere of slechtere prestatie veel of weinig uitmaakt voor de organisatie; als een kleine toename in criteriumprestatie voor de organisatie toch van grote waarde is, zal de nuttigheid van het testonderzoek ook groot zijn, en kan een minder valide test toch voor een utiliteitstoename zorgen.

    2. De correlatie tussen test en utiliteit (rXU) en tussen test en criterium is lineair gerelateerd aan het nuttige effect van de test. De bijdrage van de test aan de utiliteit is recht evenredig met zijn validiteit: een test met correlatie 0.60 is tweemaal zo nuttig als een test met correlatie 0.30.

    3. De selectieratio is van invloed op de utiliteit; de nuttigheid van het testonderzoek is per persoon maximaal bij een maximale ordinaat (‘hoogte’) onder de normaalcurve.

    4. Bij een bepaalde spreiding in criteriumscores, validiteit en selectieratio kan berekend worden of de kosten van het testprogramma opwegen tegen het uiteindelijke rendement van de selectieprocedure.

    Hoe gaat enkelvoudige selectie bij het gelijktijdig gebruik van diverse tests?

    Zeker in gevallen wanneer het gaat om een heterogeen criterium is het niet mogelijk om een goede voorspelling te geven op basis van een enkele test. Beter is het om deze gevallen gebruik te maken van een testbatterij; een verzameling van tests die bij voorkeur allemaal zo hoog mogelijk correleren met het criterium, maar zo min mogelijk met elkaar. Er zijn verschillende procedures om afzonderlijke tests te combineren.

    Procedure van gewogen samenstelling (compensatorisch)

    De verschillende test kunnen grofweg op twee manieren worden gecombineerd om tot een goede selectie te komen.

    1. Ten eerste kan dit op een actuarische, ofwel statistische manier. Hierbij worden de successcores zorgvuldig gewogen en de succeskansen berekend.

    2. De tweede manier is niet-statistisch, maar gevoelsmatig van aard. Het gaat om een intuïtief proces van wegen en voorspellen, die per situatie erg kan verschillen.

    De strijd tussen deze twee methoden is na vele onderzoeken beslecht in het voordeel van de actuarische methode (Meehl kwam overigens al eerder tot deze conclusie). De actuarische methode is nauwkeuriger, zorgt voor de minste missers en leidt dus tot de beste selectie. Dat kan verklaard worden doordat bij de intuïtieve methode vooroordelen, stereotypen en ongeverifieerde veronderstellingen ook een rol spelen (naast ervaring en kennis).

    Procedure van veelvoudige minimumscore c.q. multiple cut-off procedure (conjunctief)

    Bij deze procedure wordt voor elke afzonderlijke test een kritische testscore vastgesteld. Een kandidaat wordt dus alleen geselecteerd indien hij op alle test voldoende heeft gescoord. Compensatie is hierbij dus niet mogelijk. De veelvoudige minimumscore is in tegenstelling tot de gewogen samenstelling (die is compensatorisch) conjunctief.

    Combinatie van compensatorische en conjunctieve methode

    Een combinatie van beiden is echter ook mogelijk, dan is binnen bepaalde minimumgrenzen de relatie compensatorisch.

    Hoe kan de selectie opgesplitst worden in een of meerdere fasen?

    In het geval van een grote groep kandidaten is het vaak effectiever om trapsgewijs te testen. Er vindt dan een voorselectie plaats die de toevalskans voor het definitieve onderzoek doet toenemen. Deze voorselectie dient valide te zijn met betrekking tot het criterium. Vooral bij een groot aanbod is een middelmatig valide test vaak al voldoende voor het doen toenemen van de toevalskans.

    De sequentiële beslissingsmodellen kunnen ook wat ingewikkelder van aard zijn. Bij een eerste eenvoudige screening worden de meest ongeschikte en de meeste geschikte kandidaten geselecteerd. Vervolgens vinden er nog een aantal testen plaats om de minder duidelijke kandidaten al dan niet te selecteren. Het voordeel van trapsgewijs testen is dat het veel tijd en geld kan besparen, zonder dat dit ten koste gaat van het selectieproces. Cronbach en Gleser toonden aan dat er verschillende sequentiële strategieën mogelijk zijn, waarvan de effectiviteit per situatie kan variëren. Met name in het geval van complexe onderzoeken (groots, kostbaar, moeilijk of vervelend voor de betrokkenen) zijn sequentiële strategieën erg toereikend.

    Wat zijn plaatsingsbeslissingen en hoe kunnen ze worden genomen?

    Bij de tot nu toe besproken beslissingsstrategieën ging het om de keuze tussen het aannemen of afwijzen van de kandidaten. Bij plaatsing gaat het echter om de keuze tussen verschillende alternatieven. Ook hierbij kan er onderscheid worden gemaakt tussen kwantitatief en kwalitatieve verschillende mogelijkheden, en dus tussen univariate en multivariate informatie.

    Hoe verloopt de plaatsing bij een niveauverschil?

    De besliskunde is de leer die zich bezighoud met het vinden van de meest adequate beslissingsstrategieën. Hierbij spelen twee elementen een rol.

    1. Allereerst wordt de kans berekend op het behalen van de verschillende alternatieven. Deze kans wordt bepaald door de correlatie tussen test en criterium.

    2. Ten tweede wordt rekening gehouden met de waarden van de beslisser. Het toekennen van waarden aan de verschillende mogelijkheden is vaak erg lastig, maar noodzakelijk voor het komen tot de beste beslissing.

    De besliskunde is relevant voor zowel individuele (waarde wordt door het individu bepaald en kan per persoon verschillen) als institutionele beslissingen (waarde wordt door de organisatie bepaald en is constant voor veel beslissingen).

    De beste beslissing is de beslissing met het meeste rendement (E). Stel dat we beschikken over de volgende informatie:

    • P(A) = de kans op het behalen van alternatief A
    • P(-A) = de kans op het niet behalen van alternatief A
    • W(A) = de waarde voor het behalen van alternatief A
    • W(-A) = de waarde voor het niet behalen van alternatief A

    Het optimale rendement (E) van de beslissing voor A is dan: E (rendement) = P(A) * W(A) + P(-A) * W(-A).

    Er zijn een aantal relaties tussen het beslissingsrendement en de testprestatie:

    1. Parallellie: rendementen voor twee plaatsingen nemen even snel toe, maar de ene is altijd hoger dan de andere. Er moet gekozen worden voor de hoogste.

    2. Samenvallen: rendementen voor twee plaatsingen vallen samen en nemen even snel toe. Het maakt niet uit welke gekozen wordt.

    3. Lineair kruisen: de rendementsfuncties snijden elkaar, als de testscore beneden een bepaald punt valt, moet gekozen worden voor de ene; als de score erboven valt, moet gekozen worden voor de ander.

    4. Niet-lineair kruisen: de rendementsfuncties snijden elkaar twee keer omdat de ene niet lineair is. Het hangt van het punt op de x-as af voor welke plaatsing gekozen moet worden.

    Bij 1 en 2 is de keuze voor een bepaalde plaatsing onafhankelijk van de testscore, maar bij 3 en 4 hangt het van de hoogte van de testscore af bij welke het rendement het grootst is.

    In vele gevallen is dit optimale rendement echter niet haalbaar. Soms kan slechts een beperkt aantal mensen worden opgenomen in een bepaald alternatief. Omgekeerd moeten sommige functies zo snel mogelijk worden ingevuld, omdat dit anders ernstige gevolgen heeft. Aan deze twee beperkingen kan nog worden toegevoegd dat er vaak een bepaalde discrepantie bestaat tussen de waardesystemen van de verschillende partijen inzake de beslissing (bijvoorbeeld school en leerling). Deze beperkingen leiden vaak tot niet bevredigende beslissingen. Vaak wordt in zulke gevallen de beslissing op gevoel genomen. Dit is echter niet nodig. Men hoeft zich niet perse het totale rendement ten doel te stellen, maar kan ook streven naar de maximaal mogelijke winst, of naar een zo klein mogelijk verlies.

    Hoe verloopt de plaatsing bij kwalitatieve verschillen?

    Op zich lijkt deze beslissing erg op de hiervoor besproken beslissing: de waarde van de verschillende keuzes moet worden vastgesteld, en de kans op succes moet worden berekend, waarna het verwachte rendement volgens de gegeven formule berekend kan worden.

    Het verschil zit hem in de manier van testen, dus in het berekenen van de kans op succes. Bij beslissingen tussen alternatieven met een niveauverschil kan men met één test volstaan. Wanneer alternatieven kwalitatief van elkaar verschillen, is dit niet meer mogelijk. Er moet dan gebruik worden gemaakt van twee verschillende tests, die elk zo goed mogelijk correleren met hun eigen criterium. Om goed te kunnen bepalen voor welk alternatief de kandidaat meer geschikt is, moet men zich richten op de verschillen die er bestaan tussen de criteria. Het gaat er dus om een differentiële voorspelling te doen.

    Niet langer is voor de waarde van de test de correlatie met het te meten criterium van belang, maar ook de mate van de differentiële validiteit. Deze laatste vorm van validiteit wordt bepaald door de samenhang tussen de score van eigenschap X en het verschil van de twee criteriumscores (Y1 – Y2).

    De volgende formule wordt hiervan gegeven: [9.2] (r = correlatie; S = standaardafwijking).

    Uit deze formule is af te leiden dat r groter wordt naarmate het verschil tussen de correlaties r(X,Y1) en r(X,Y2) groter is.

    Wanneer er een restrictie aan het aantal te plaatsen personen wordt verbonden, wordt de kwalitatieve plaatsing een moeilijke aangelegenheid. Men grijpt in dit soort gevallen dan ook vaak terug op irrationele, gevoelsmatige beslissingen. Soms lijken zulke beslissingen op de ‘cut en fit method’ van Ghiselli. Bij deze methode wordt eerst de kandidaat met de hoogste testscore op de voor hem meest adequate positie geplaatst. De overige kandidaten worden vervolgens verdeeld over de rest van de functies.

    Soms worden er ogenschijnlijk onlogische beslissingen genomen bij keuzeproblemen. Dit heeft vaak alles te maken met het belang dat aan de verschillende functies wordt gehecht. Is functie A veel belangrijker dan functie B, dan zal men zich hoofdzakelijk richten op het zo optimaal mogelijk invullen van functie A, zonder zich erg druk te maken over de consequenties daarvoor voor functie B. Wanneer het niet veel haast heeft een vacature in te vullen, kan er zelfs besloten worden enige tijd te wachten met de hoop of het zicht op een ‘betere’ populatie.

    Hoe kunnen individuele beslissingen genomen worden?

    Individuele beslissingen zijn beslissingen die worden genomen voor of door individuen met een eigen persoonlijk waardesysteem, waardoor deze beslissingen een uniek karakter hebben. Ook hierbij gaat het om kansen en waarderingen. Het verschil met institutionele beslissingen is dat de evaluatie van de resultaat individueel is en per individu kan verschillen. Ook hierbij kan het om kwantitatief of kwalitatief verschillende alternatieven gaan, het onderscheid is de aard van de informatie die gebruikt wordt. Bij kwalitatief verschillende alternatieven moet die informatie een hoge differentiële validiteit hebben. Ook bij individuele beslissingen kan een rationeel beslissingsmodel gebruikt worden.

    Voorbeeld 1. Een persoon moet beslissen om functie E wel of niet te accepteren. De kans op succes is 0.60 en de kans op falen is 0.40. Ook de waarde van succes of falen is belangrijk: falen is 3x zo ernstig als succes. De berekening is dan: E (rendement) = 0.60 * 1 + 0.40 * -3 = -0.60. Het verwachte rendement is negatief: hij kan de functie beter niet nemen. Maar een ander persoon, met een kleinere kans op succes, namelijk 0.45, die de functie zo graag wil dat de waarde van succes 2x zo groot is als van falen, kan de functie toch accepteren. De berekening is dan: E (rendement) = 0.45 * 2 + 0.55 * -1 = 0.35.

    Voorbeeld 2. Een kwalitatieve keuze tussen technische opleiding F en commerciële opleiding G. De kans op succes in F is 0.80 en de kans op slagen in G is 0.60. De waarde voor succes voor F is 10 en de waarde voor G is 15, de negatieve waarde bij falen is te verwaarlozen. De kosten voor de studies (moeite, tijd en kosten) moeten ook gewaardeerd worden in termen die vergelijkbaar zijn met de waarde voor succes: voor F is dat 2 en voor G is dat 4. De berekeningen zijn:

    • EF (rendement F) = 0.80 * 10 – 2 = 6.
    • EG (rendement G) = 0.60 * 15 – 4 = 5.

    Opleiding F heeft het grootste verwachte rendement en is de beste keuze.

    Voorbeeld 3. Een schoolkeuze, waarbij in overweging genomen wordt het wel of niet halen van een diploma en de mogelijkheid dat slechts enkele klassen met succes doorlopen worden. De volgende kansen komen uit het testonderzoek:

    • Havo-diploma 0.20, slechts 3 klassen 0.30 en hooguit 1 klas 0.50.
    • VMBO-diploma 0.10, slechts 3 klassen 0.20 en hooguit 1 klas 0.70.

    De waardering van de verschillende mogelijkheden is:

    • Havo-diploma 15, 3 klassen 5, 1 klas 2.
    • VMBO-diploma 10, 3 klassen 2, 1 klas 1.

    Als de kostenfactor te verwaarlozen is, zijn de verwachte rendementen te berekenen:

    • Ehavo (rendement havo) = 0.20 * 15 + 0.30 * 5 + 0.50 * 2 = 5.5.
    • EVMBO (rendement VMBO) = 0.10 * 10 + 0.20 * 2 + 0.70 * 1 = 2.1.

    De keuze voor havo is in dit geval het best.

    Drie opmerkingen bij deze drie vereenvoudigde voorbeelden:

    1. De exacte kansbepaling is meestal niet zo eenvoudig als hier wordt gesuggereerd.
    2. Ook de waardering is niet eenvoudig, maar een psycholoog kan daar wel bij helpen.
    3. Binnen een keuze moet er vaak met meer mogelijkheden, variaties en schade/kostenposten rekening worden gehouden dan in de voorbeelden.

    Wat de voorbeelden wel laten zien is dat ook elementen uit het individuele beslissingsproces te analyseren zijn en dat door deze rationele aanpak de mogelijkheden en moeilijkheden duidelijker worden.

    Hoe kunnen beslissingen bij open vragen genomen worden?

    Tot nu toe zijn er beslissingen besproken waarbij sprake was van slechts een beperkt aantal alternatieven. Bij open vragen gaat het om een onbeperkte veelheid aan mogelijkheden. Voordat tot het beslissingsproces wordt overgaan, is het bij open vragen erg belangrijk de vraag of het probleem goed te analyseren. Soms blijkt namelijk dat het wel degelijk om een gerichte vraag gaat, of dat het probleem een heel ander gebied behelsd (bijvoorbeeld niet de psychologie maar de pedagogiek). Ook kan het zijn dat de vraag nog te vaag is om met een oplossing te kunnen komen, of dat de verwachtingen met betrekking tot de oplossing niet reëel zijn.

    Het daadwerkelijke beslissingsproces kan het beste worden opgedeeld in verschillende fasen:

    1. De eerste testfase heeft tot doel het grote aantal mogelijkheden in te perken tot een beperkt aantal of een gerichte aanname. Voor deze eerste fase is een test nodig die een grote aantal mogelijkheden kan bestrijken; betrouwbaarheid is in deze nog niet heel belangrijk.
    2. Voor de tweede testfase is dit dat wel. Hierin moet namelijk gekomen worden tot een beslissing tussen de reeds beperkte keuzes, of tot toetsing van de gericht aanname.

    Het verschil tussen de tests in de eerste en tweede fase is door Cornbach en Gleser uitgelegd met behulp van de informatietheorie. Het is een algemeen verschijnsel dat kwaliteit ten koste gaat van kwantiteit. Een test kan niet én over bandwijdte én over zuiverheid beschikken. Ook bij het informatieproces gaat het een ten koste van het ander. Wanneer langs een kanaal meerdere boodschappen tegelijk worden gezonden, zal men weliswaar meer horen (grote bandwijdte), maar zal hetgeen dat overkomt minder zuiver zijn. Stuurt men slechts één boodschap langs een kanaal, dus zal deze zeer zuiver ontvangen worden, maar is de bandwijdte erg klein.

    Er bestaat dus een spanning tussen bandwijdte en zuiverheid. Voor het opstellen van een test betekent dit dat er telkens moet worden afgewogen wat meer nastrevenswaardig is. Voor sommige tests staat vooral de zuiverheid voorop (tests omtrent een definitieve conclusie en klassieke testbenaderingen, zoals intelligentietests). Voor andere is dat juist de bandwijdte (diagnostische methoden als observatietest, open-vraaginstrumenten).

    Om de zuiverheid bij tests waar de bandwijdte in eerste instantie voorop staat toch enigszins te handhaven, zijn er een aantal criteria ontwikkeld:

    • Het proces van afname moet goed gestandaardiseerd zijn, en het verwerkingssysteem moet in voldoende mate objectief zijn.
    • De test moet genoeg items bevatten om voldoende spreiding in de testprestaties op te kunnen leveren.
    • Van de relevante populaties moeten de specifieke normgegevens bekend zijn.
    • De kenmerken die worden beoordeeld moeten worden opgenomen in een theorie over een psychologisch ‘construct’. Hierin worden de kenmerken geoperationaliseerd.

    De brede-bandtechniek is onmisbaar (in de eerste fase) bij een open vraag. Om tot een definitieve uitspraak (tweede fase) te kunnen komen, moet er echter een gericht toetsingsonderzoek plaatsvinden.

    Bij het uitvoeren van brede-bandtests voor exploratieve doeleinden is de psycholoog van grote invloed. Toch zijn er een aantal richtlijnen die een goed en efficiënt testgebruik kunnen bevorderen:

    • Bij het ontwikkelen van hypothesen moet maximaal worden aangesloten bij reeds beschikbare gegevens uit de literatuur of de eigen ervaring.
    • Bij het vormen van hypothesen moet altijd gebruik worden gemaakt van impliciete en expliciete theorieën. Hierbij is het belangrijk dat men zich baseert op empirisch gegronde theorieën, en dus niet op onduidelijke metafysische theorieën.
    • Men moet zich niet baseren op slecht geconstrueerde projectietests, waarvan de testtechnische kwaliteit ondermaats is.

    Wat kan hierover besloten worden?

    Bij beslissingen over personen is de praktische waarde van de test ondergeschikt aan het belang en de waarde van deze beslissingen. Er zijn méér criteria belangrijk dat alleen de validiteit en betrouwbaarheid.

    Access: 
    Public
    Welke ethische kwesties zijn belangrijk bij het testen? - Chapter 10

    Welke ethische kwesties zijn belangrijk bij het testen? - Chapter 10

    Uit voorgaande hoofdstukken is duidelijk geworden dat de test niet de verantwoordelijkheid van de beslisser over kan nemen, maar wel een betekenisvolle factor is in het beslissingsproces. De publieke opinie is niet onverdeeld positief over psychologische tests, de kritiek is soms terecht, maar soms ook generaliserend. Er wordt vaak geen onderscheid gemaakt tussen het testgebruik in de praktijk en de principiële mogelijkheden en kwaliteiten van tests – en dat is onterecht.

    Er wordt soms gesuggereerd dat sollicitanten moeten oefenen met tests om zo een hogere score te krijgen en te worden aangenomen. Maar dat is misleidend; de testscore verbetert weliswaar, maar de geschiktheid van de sollicitant voor de functie niet. Er moet overigens wel onderscheid gemaakt worden tussen het oefenen van de testopgaven zelf en het goed informeren van iemand door middel van een toelichting bij de test en voorbeeldopgaven (met als doel de standaardisering van de testsituatie).

    Hoewel sommige kritiek niet overtuigend is, is het ook niet goed om bezwaren te negeren. Drie redenen daarvoor:

    1. Kritiek bevat ook waarheid.

    2. De weerstand tegen het testen is een realiteit waarmee rekening gehouden moet worden.

    3. De psychologie heeft het voor een deel ook zelf veroorzaakt, doordat men (1) te veel pretendeert met tests (zoals de mogelijkheid van accurate metingen, onbetwistbare voorspellingen etc.), (2) misconcepties heeft laten ontstaan (bijvoorbeeld dat een intelligentietest een aangeboren, vaste en onveranderbare eigenschap meet), (3) aanleiding heeft gegeven tot misbruik van testgegevens (geen vertrouwelijkheid gewaarborgd, onvoldoende openheid gegeven etc.) en (4) te weinig aandacht heeft gegeven aan de publiciteit, waardoor een magisch of dreigend beeld kon ontstaan.

    Toch bestaat er ook een ethische code voor psychologen; de NIP-ethiek (1961) en een Algemene Standaard Testgebruik (AST-NIP, 2004). Er is dus wel veel aandacht aan besteed, maar de problemen zijn lastig en ingewikkeld.

    Enkele opmerkingen over de achtergrond van (negatieve) attitudes over testen en testgebruik:

    1. Negatieve ervaringen. Soms wordt een negatieve houding veroorzaakt door een negatieve ervaring met testonderzoek (bijvoorbeeld afgewezen voor een functie), de test fungeert dan als zondebok. Maar onderzoek van Brim en Fiske wijst uit dat eigen ervaringen geen grote rol spelen bij het ontstaan van attitudes over testen.

    2. Irrationele angsten. Een negatieve houding kan ook veroorzaakt worden door een algemeen onbehagen over de toenemende bureaucratisering en vertechnisering van de maatschappij, waardoor de mens zelf weinig controle meer heeft. Men keert zich tegen de symptomen van maatschappelijke veranderingen, zoals tests. De test wordt geacht de vrijheid te ontnemen, zelfstandigheid in te perken en het privéleven binnen te dringen.

    3. Controle, determinatie en bureaucratie. De vraag blijft staan of het testen niet onpersoonlijke, rigide en mechanistische processen aanmoedigt en of voorspellingen niet zullen leiden tot controle en determinatie van menselijk gedrag. Vooral binnen instituten is er een reëel gevaar van het nemen van bureaucratische beslissingen over mensen. Dat probleem wordt echter niet veroorzaakt door het testonderzoek, maar is inherent aan het beslissingsproces zelf.

    Welke levensbeschouwelijke en menselijke bezwaren zijn er?

    De uniciteit van de mens en de onmogelijkheid dit te meten

    Een levensbeschouwelijk bezwaar is dat het wezen van de mens niet te vatten is met instrumenten als tests. Maar hiermee krijgt de test een pretentie die hij niet heeft en nooit zal kunnen hebben. Bij testen gaat het niet om het vatten van het essentiële van de mens, maar om waarneembaar gedrag, dat geclassificeerd, gekwantificeerd en vergeleken kan worden. Op basis van deze vergelijking kan een uitspraak gedaan worden.

    De vooronderstelling is dat mensen allerlei gemeenschappelijke eigenschappen hebben en qua gedrag op bepaalde punten vergelijkbaar zijn. Maar dat zegt natuurlijk niet dat mensen op alle andere eigenschappen te vergelijken zijn. Er is weliswaar geen ruimte voor uniciteit van de mens, maar het principe van die uniciteit wordt zeker niet ontkend.

    De rollen van psycholoog en onderzochte

    Een ander bezwaar is dat het testen de mens reduceert tot een onpersoonlijk object en er geen rekening wordt gehouden met de menselijke waardigheid. Hier gaat hierbij om de situatie en de rollen van de onderzochte en de onderzoeker. Daarom moet er bij het onderzoek een persoonlijke introductie zijn en duidelijkheid gegeven worden over het doel van het onderzoek. Ook mogen er geen machtsverhoudingen zijn en moeten tests een juiste moeilijkheidsgraad hebben, waardoor de motivatie en het gevoel van waardigheid wordt vergroot (adaptieve tests zijn daarbij ideaal). Een goede indrukvaliditeit (face validity) kan hierbij ook nuttig zijn.

    Dit bezwaar gaat ook over de ondergeschikte rol en afhankelijkheidspositie van de geteste. Maar dit gaat meer over de institutionele beslissingssituatie dan over de test zelf; de waarden van de organisatie en die van het individu kunnen botsen. Maar het afwijzen van een ongeschikte kandidaat is niet altijd schadelijk voor de kandidaat; het kan ook voorkomen dat hij een functie krijgt die niet bij hem past. Toch mag dit niet gegeneraliseerd worden in een bevoogdende houding tegenover de onderzochte; een afwijzing betekent niet per se dat iemand niet geschikt is:

    1. Of men geschikt is voor een functie is relatief; men is meer of minder geschikt, maar wordt bij een afkeuring altijd ongeschikt geacht.

    2. De beslissing tot aannemen of afwijzen is ook afhankelijk van de kwantiteit en kwaliteit van het totale aanbod van kandidaten.

    Hier kan de psycholoog in moeilijkheden komen: in de oorspronkelijk NIP-ethiek staat dat het welzijn en belang van de cliënt (onderzochte) de primaire taak van de psycholoog moet zijn. Maar in de praktijk ligt de prioriteit van de psycholoog vaak bij het instituut dat hem in dienst genomen heeft. Discrepantie tussen de ‘leer’ en het ‘leven’. Uitwegen uit dit dilemma zijn:

    1. De leer aan het leven aanpassen. Volgens sommigen heeft een psycholoog geen speciale verantwoordelijkheden voor de individuele mens als object van onderzoek en advies.

    2. Altijd het belang van het individu dienen. Volgens anderen moeten de doelstellingen en waarden van de organisatie ondergeschikt gemaakt worden aan die van het individu, ze vinden dat een psycholoog vuile handen maakt als hij voor een bedrijf werkt.

    Premissen waar een principiële verwerping van selectie op gebaseerd zou moeten zijn:

    1. Er zijn geen individuele verschillen in vakbekwaamheid en geschiktheid om deze vakbekwaamheid te leren.

    2. Het is niet goed een keuze te maken uit sollicitanten gebaseerd op vakbekwaamheid en aanleg.

    3. Een geformaliseerd vastliggend normensysteem voor het beoordelen van de arbeidsprestatie is niet acceptabel.

    Maar deze premissen zijn wetenschappelijk niet vol te houden; de eerste is niet waar omdat er wel degelijk individuele verschillen zijn. En de derde is niet houdbaar omdat anders organisaties in chaos vervallen. Het tweede standpunt is nog wel te verdedigen, maar ook hier zijn bezwaren tegen:

    • Het zonder meer toekennen van gelijke kansen aan iedereen (lui, onbekwaam, ijverig of geschikt) is ethisch ook niet ideaal.

    • Loting in plaats van selectie (noodzakelijk als er beperkte plaatsen zijn) is in strijd met streven naar optimale benutting van de vaak beperkte middelen.

    • De kans is erg klein dat een werkgever het advies om te loten overneemt. Zonder testonderzoek valt men terug op alternatieve methoden van beoordelen, waarvan het voorspellend vermogen nog geringer is dan dat van tests (en ook ethisch niet verantwoord zijn, zoals status, geld en (familie)betrekkingen).

    De herziene NIP-ethiek (1976) lost dit probleem op door een verbreding van het begrip ‘cliënt’; zowel onderzochte als instituut. De psycholoog staat in dienst van beide partijen en doet een poging tot een ideale match tussen beiden. Voor beide partijen is het noodzakelijk dat er voldoende informatie gegeven wordt:

    • Sollicitant: informatie over functie-eisen, beloning en promotie.

    • Organisatie: informatie over de capaciteiten en behoeften van het individu.

    Beide partijen hebben recht op een vertrouwelijke behandeling en informatie en openheid over de beslissingsprocedure. De beslissing komt tot stand middels gemeenschappelijke exploratie waarbij voor alle partijen duidelijk wordt wat hun behoeften en verlangens zijn en wat daarvan gerealiseerd kan worden.

    Welke technische en methodologische bezwaren zijn er?

    Ook hier het probleem dat er onvoldoende onderscheid wordt gemaakt tussen praktisch slecht functionerende tests en het principe van de test als zodanig. Kritiek is juist bij slechte tests, maar onjuist bij goede tests. Tegen algemene kritiek moet men moet vaktechnische argumenten gebruiken.

    De psychometrische kwaliteit van tests

    Veel tests hebben helaas onvoldoende betrouwbaarheid, begrips- of predictieve validiteit, of hebben geen adequate normtabellen. Dergelijke tests gebruiken voor het nemen van beslissingen is onverantwoord. Volgens het COTAN heeft, van de tests die in Nederland in de omloop zijn, 33% onvoldoende betrouwbaarheid, 35% onvoldoende begripsvaliditeit, 67% onvoldoende predictieve validiteit en 59% onvoldoende normen. Vergeleken met de vorige beoordelingsronde is wel een lichte verbetering te zien. Slechts 21% van de tests scoorden in 1992 voldoende op zowel validiteit als normen. Daarnaast zijn er ook nog tests in de omloop die zo dubieus zijn dat ze niet door het COTAN beoordeeld worden.

    Maar, goede tests worden waarschijnlijk vaker gebruikt dan minder goede tests en bij een voorselectie is het gebruik van een ‘onvoldoende’ test wel geoorloofd omdat er geen definitieve beslissingen gemaakt worden.

    AST-NIP heeft het standpunt dat tests (psychodiagnostische instrumenten) alleen gebruikt mogen worden als de theoretische herkomst, betrouwbaarheid, validiteit en normering voldoende zijn volgens de criteria van het COTAN. Als een psycholoog toch een andere test wil gebruiken, moet hij dat goed kunnen beargumenteren.

    Van veel tests is de betrouwbaarheid en validiteit nog niet vastgesteld (experimenteel stadium of vertaalde test), deze kunnen beter niet gebruikt worden voor selectie of plaatsing: ‘een test is onbruikbaar tot het tegendeel blijkt’. Maar de eis van perfectie is in de praktijk niet altijd haalbaar, daarom mag een test wel gebruikt worden als hij het aantal juiste beslissingen doet toenemen ten opzichte van de situatie zonder test.

    Dat laatste is dus een empirisch argument tegenover een technisch bezwaar; empirische resultaten hebben uiteindelijk het laatste woord. Dat argument geldt ook voor bezwaren tegen bijvoorbeeld meerkeuze-items; daarbij heeft empirisch onderzoek uitgewezen dat er dezelfde mentale processen mee gemeten kunnen worden als met open vragen, en zelfs objectiever en betrouwbaarder zijn.

    Het stereotypen-bestendigend karakter van tests

    Een methodologisch bezwaar tegen het gebruik van tests als selectie-instrument is dat ze ondernemende en creatievere kandidaten afwijzen en alleen mensen die zich conformeren, aannemen. Het zou leiden tot homogenisering. Maar hierbij gaat het niet om kritiek op de gekozen test, maar op het gekozen criterium; als men een conformist wil, zal dat in het criterium tot uiting komen, en de test helpt alleen om dat doel te halen. Een test kan hier juist nuttig zijn als het gebruikt wordt om het criterium kritisch te analyseren.

    Op welke manier kunnen tests misbruikt worden?

    Wat is het probleem van schending van vertrouwen?

    Schending van vertrouwen is de belangrijkste bron van ongenoegen. Er moet onderscheid gemaakt worden tussen wetenschappelijk onderzoek (anonieme proefpersonen) en een praktisch onderzoek waarin iemand wordt getest. In het eerste geval is er geen probleem, in het tweede geval is het lastiger, met name als de psycholoog verslag moet uitbrengen naar een derde (opdrachtgever). Er zijn dan twee gevaren:

    1. Het gevaar dat niet-psychologen inzicht krijgen in de testgevens of gegeven antwoorden. Daarom stelt AST-NIP dat alleen bewerkte testuitslagen mogen worden verstrekt, en de ruwe gegevens niet.

    2. Er is geen garantie dat alleen de opdrachtgever het rapport leest en het niet voor andere doeleinden wordt gebruikt. Daarom is er een AST-NIP richtlijn dat het rapport niet voor andere doelen dan het oorspronkelijke mag worden gebruikt, dat de onderzochte het onderzoek elk moment mag laten stoppen en toestemming moet geven voor het rapport wordt doorgestuurd.

    Bij het verstrekken van informatie aan collega-psychologen is (bij institutionele beslissingen) de toestemming van de betrokkenen nodig.

    Er is het gevaar van misinterpretatie als de resultaten zonder voldoende toelichting aan de cliënt worden gegeven. Volgens AST-NIP heeft de cliënt recht op een nabespreking wat meer is dan alleen inzage in het rapport. Cliënt heeft ook recht op inzage in het rapport vóór het naar de opdrachtgever gaat, recht op blokkering, aanvulling, correctie of verwijdering van gegevens, recht op een afschrift van het rapport en recht op inzage in en afschrift van het gehele onderzoeksdossier. De opdrachtgever moet vooraf op te hoogte worden gesteld van deze rechten van de cliënt. Alleen een rechterlijke uitspraak kan de psycholoog verplichten het rapport aan derden te laten zien als de cliënt dat niet wil.

    Wat is het probleem van misleiding?

    Het probleem van misleiding is het grootst bij indirecte tests, waarbij de onderzochte niet weet wat de test meet. Ook bij tests waar kwalitatieve interpretaties aan gegeven worden, weet de onderzochte niet hoe het geïnterpreteerd zal worden. Bij wetenschappelijk onderzoek is er meestal geen probleem; de anonimiteit moet gewaarborgd blijven, de proefpersoon moet vrijwillig meedoen en mag geen schade worden toegebracht en het doel moet (in elk geval achteraf) duidelijk worden uitgelegd. Ook bij therapieën en advies is er geen probleem, omdat de cliënt zelf de opdrachtgever is. Maar als er een conflict van belangen is, kunnen er problemen ontstaan, zoals bij selectie- en plaatsingsbeslissingen. In zo’n geval is de meest valide methode het best geschikt (en niet de meest transparante methode); onder voorwaarde dat de cliënt goed wordt voorgelicht hoeven niet alle procedures uitentreuren door de cliënt worden doorgrondt.

    Wat is het probleem van binnendringen in het privéleven?

    Het binnendringen in het privéleven kan niet los gezien worden van het doel ervan. Er is geen sprake van binnendringen als men niet werkelijk geïnteresseerd is in wat men ziet (bijvoorbeeld bij de MMPI gaat het niet om de waarheid van de antwoorden en worden de antwoorden ook onpersoonlijk verwerkt). Bij machinale scores ziet de psycholoog zelf alleen maar de bewerkte scores. Men moet het probleem ook niet overschatten, verreweg de meeste items zijn acceptabel op dit punt. Het binnendringen in het privéleven is echter wel mogelijk, maar dat is niet beperkt tot tests; een belastingformulier, curriculum vitae of interview doet dat ook.

    Het belang van het recht op privacy moet worden afgewogen tegen andere belangen:

    1. Het recht op kennis. Kennis verkrijgen is ook heel belangrijk en dat geldt ook voor wetenschappelijke kennis; inzicht verkrijgen in menselijk gedrag en motieven.

    2. De noodzaak bepaalde mensen te weren. Uit de maatschappij of bepaalde sectoren ervan; een beschaafde maatschappij heeft recht op enige controle over de vrijheid van leden (Vernon, 1963). Dat geldt ook voor de strijd tegen terrorisme. De veiligheid van de burger prevaleert in bepaalde gevallen boven de privacy van de verdachte.

    3. De wenselijkheid van optimale benutting van kwaliteiten, capaciteiten en kennis. Hiervoor is ook informatie nodig en er kan van mensen toegang gevraagd worden tot privégegevens.

    Privacy kan dus niet tot elke prijs worden gegarandeerd, het belang van anderen of de maatschappij kan zwaarder wegen. Er moet een evenwicht gevonden worden tussen de verschillende belangen.

    Wat is het probleem van discriminatie?

    Er is al langere tijd discussie of de psychologische test leidt tot discriminatie van minderheidsgroepen, bezwaren zijn:

    1. Tests zijn niet goed gestandaardiseerd voor minderheidsgroepen.

    2. Tests meten vooral aspecten die bevoorrechte groepen beter hebben kunnen ontwikkelen.

    3. Tests zijn voornamelijk gebaseerd op valideringsonderzoek op beperkte (vaak blanke) groepen, waarvan de resultaten dan gegeneraliseerd worden naar andere populaties.

    Deze bezwaren hebben betrekking op de ‘fairness’ (tegenovergestelde van ‘bias’) van testgebruik, gebaseerd op de ideologie van gelijke kansen in de Civil Rights Act (1964) in de VS.

    Verdedigers van tests stellen juist dat de test objectief registreert en dat het de sociale en economische omstandigheden zijn die oneerlijk zijn. De test stelt alleen objectief vast wat iemand kan en weet. Met behulp van de test kan discriminatie juist worden tegengegaan omdat de beoordeling dan daadwerkelijk op iemands capaciteiten wordt gebaseerd in plaats van op vooroordelen. Daarom zijn met name de minderheidsgroepen zelf vaak positief over testgebruik.

    Wat wel discriminerend kan zijn is de interpretatie of het gebruik van de test:

    1. Testinterpretatie. Wanneer men verschillen tussen populaties interpreteert als verschillen in aangeboren potentieel (bijvoorbeeld intelligentie). Dit aangeboren potentieel, ‘Intelligentie A’ (volgens Vernon), kan niet los van omgevingsinvloeden gemeten worden. Het resultaat van een meting is altijd een indicatie van ‘Intelligentie B’: het fenotypische aspect van cognitieve vermogens (het resultaat van de interactie tussen genen en omgeving). De ene test meet ‘Intelligentie A’ beter dan de ander (verwijst meer naar het genetische component). Sommige tests zijn dus meer geschikt voor cultureel vergelijkend onderzoek dan andere (WAIS en Standford-Binet zijn ongeschikt).

    2. Testgebruik. Discriminatie in testgebruik komt met name voor bij selectie; minderheidsgroepen die gemiddeld lager scoren op tests krijgen minder kans. Daarbij kan onderscheid gemaakt worden tussen twee strategieën: de maximalisering van de doelmatigheid en de maximalisering van gelijke kansen.

    Strategie van de maximalisering van de doelmatigheid

    Daarbij worden personen met de grootste kans op succes in de functie geselecteerd door de validiteit te maximaliseren. Er is géén sprake van discriminatie als een score op de selectietest voor alle onderzochten (ongeacht hun groep) overeenkomt met eenzelfde score op de prestatie in de functie. Het verband tussen testprestatie en criteriumprestatie is in beide groepen gelijk, er is alleen een niveauverschil. Er wordt wèl gediscrimineerd als in de ene groep een bepaalde testscore met een systematisch hogere criteriumscore correleert dan in de andere groep; de regressielijnen vallen niet samen en snijden elkaar niet. Personen in de ene groep met een bepaalde criteriumscore worden afgewezen, waar personen in de andere groep met dezelfde score nog wel worden geselecteerd.

    Discriminatie betekent hier dat dezelfde aftestgrens voor de ene groep een hogere criteriumscore betekent dan voor de andere groep, waardoor de laatste groep bevoordeeld wordt ten opzichte van de eerste groep. In een dergelijk geval zullen er verschillende aftestgrenzen gebruikt moeten worden voor de verschillende groepen. Op deze manier lijkt discriminatie een psychometrisch probleem te zijn dat ook psychometrisch opgelost moet worden, maar zo eenvoudig is het niet:

    • Het probleem lijkt de correlatie van het criterium met de test te zijn, maar als de criteriumprestatie geen eerlijk beeld geeft van iemands werkelijke prestatie (door bijvoorbeeld bevooroordeelde beoordelingen of minder kansen door cultuur- of taalproblemen), dan is het criterium zelf het probleem en dus ook de test die ermee correleert. De oplossing hiervoor is een ‘zuivering’ van het criterium.

    • Er kan sprake zijn van directe en indirecte discriminatie door variabelen in het model op te nemen die de validiteit verbeteren. Directe discriminatie ontstaat door variabelen als sekse, sociaaleconomische klasse of etnische groep in het model op te nemen. Indirecte discriminatie ontstaat door variabelen als motivatie, attitudes, kennis of taalbeheersing op te nemen, omdat deze variabelen ook kunnen correleren met de direct discriminerende variabelen.

    Er zijn twee benaderingen binnen het model van de maximalisering van de doelmatigheid:

    1. Ongekwalificeerd individualisme. Alles wat de validiteit verhoogt wordt (als predictor of als moderator) in het model opgenomen, zowel de gebruikelijke testscores als biografische gegevens. Dit wordt gelegitimeerd met het doel: het selecteren van de meest geschikte personen. Dus als het horen bij een allochtone groep de succeskansen verminderd, worden deze personen door dit model uitgesloten (predictor krijgt in het meervoudige regressiemodel een negatief gewicht).

    2. Gekwalificeerd individualisme. Het direct discrimineren van minderheidsgroepen, vrouwen of lagere sociaaleconomische klasse wordt niet geaccepteerd, waardoor deze variabelen geen rol mogen spelen in het model, ook al zouden ze de voorspelbaarheid verhogen. A-priori wordt vastgesteld op welke aspecten niet gediscrimineerd mag worden en dus niet als variabelen in het model mogen worden opgenomen. Hiermee probeert men de validiteit te maximaliseren en tegelijk toch ook directe discriminatie te vermijden, maar indirecte discriminatie wordt hiermee niet vermeden.

    Strategie van de maximalisering van gelijke kansen

    De selectieprocedure kan naast het maximaliseren van de doelmatigheid ook gericht zijn op het maximaliseren van gelijke kansen. De meest extreme strategie is loting: alle kandidaten hebben gelijke kansen. Nadeel hiervan is dat het niet ten goede komt aan de doelmatigheid. Er zijn verschillende strategieën met nog wel enige doelmatigheid, maar die toch streven naar het bevorderen van gelijke kansen.

    1. Gewogen loting. Een hogere score geeft een hogere kans in de loting, zoals bij de toelating tot de studie geneeskunde; een hoger eindexamencijfer geeft een grotere kans.

    2. Gecorrigeerd individualisme. Alle predictoren worden gecorrigeerd op hun samenhang met discriminerende variabelen, het resultaat is een residuscore (restscore). Een voorbeeld is dat scores op een test voor logisch redeneren gecorrigeerd worden voor hun samenhang met de score op een woordenschattest. Deze residuscores kunnen worden gebruikt voor de selectie bij een functie waar woordenschat niet echt relevant is.

    3. Quotasysteem. Uit iedere minderheidscategorie wordt een bepaald percentage aangenomen, naar rato van bijvoorbeeld de verhoudingen in de groep die zich aangemeld heeft of naar in het verleden gebleken succesvolle percentages.

    Het streven naar maximale doelmatigheid (validiteit) en maximale gelijke kansen zijn met elkaar in conflict. Het is dus een subjectieve beslissing hoeveel doelmatigheid je wilt opofferen om gelijke kansen te bevorderen.

    Conclusie: het is niet goed de test zelf te beschuldigen van discriminatie, het is de interpretatie of het gebruik van de testgegevens die daartoe kunnen leiden. Het is inherent aan het selectiedoel dat minderheidsgroepen een geringere kans hebben. Gelijke kansen gaan ten koste van de doelmatigheid.

    Wat kan hierover geconcludeerd worden?

    Dit hoofdstuk ging over het grensgebied tussen wetenschap en praktijk, een lastig gebied waar voorzichtig mee om moet worden gegaan. Sommige problemen hebben empirisch wetenschappelijke oplossingen, andere vragen moeten benaderd worden vanuit de ethiek en levensbeschouwing.

    Access: 
    Public
    Begrippenlijst van Testtheorie: Inleiding in de theorie van de psychologische test van Drenth en Sijtsma - 4e druk

    Begrippenlijst van Testtheorie: Inleiding in de theorie van de psychologische test van Drenth en Sijtsma - 4e druk

    Wat zijn de definitie, kenmerken en toepassingen van de test? - Chapter 2

    Test

    Systematisch onderzoek van gedrag met het doel inzicht te krijgen in een psychologisch kenmerk van degene die onderzocht wordt in vergelijking tot anderen, door middel van geselecteerde vragen. Er sprake van efficiëntie, standaardisatie, normering, objectiviteit, betrouwbaarheid en validiteit.

    Efficiëntie

    Het niet afhankelijk zijn van het moment waarin het gedrag zich voordoet.

    Standaardisatie

    Het mogelijk maken van vergelijkingen tussen testprestaties door middel van het standaardiseren van de condities en invloeden op die testprestatie; de onderzochten worden getest in maximaal gelijke omstandigheden.

    Normering

    Het mogelijk maken van vergelijkingen tussen testprestaties door het vaststellen van een rangorde, bijvoorbeeld van zeer goed tot zeer slecht.

    Objectiviteit

    Het resultaat hetzelfde moet zijn, ongeacht wie het onderzoek doet. Openheid en reproduceerbaarheid van de test en evaluatie moeten mogelijk zijn.

    Cohens Kappa

    Maat voor overeenkomst tussen beoordelaars.

    Betrouwbaarheid

    Als een test op verschillende moment dezelfde score oplevert, heeft deze een hoge betrouwbaarheid.

    Validiteit

    De test meet wat het beoogt te meten. Alternatieve verklaringen zijn weerlegd.

    Nominale schaal

    Het gebruik van getallen om categorieën te onderscheiden en objecten in te delen. Er zijn geen rekenkundige operaties mogelijk.

    Ordinale schaal

    Er is sprake van een rangorde. Niet alle rekenkundige operaties kunnen toegepast worden, maar het is wel mogelijk om rangordes te vergelijken.

    Intervalschaal

    Er is sprake van een rangorde, waarbij de afstanden tussen de verschillen een positieve betekenis hebben. Er is sprake van een arbitrair nulpunt en de verhouding van afstanden tussen meetwaarden blijft constant.

    Verhoudingsschaal

    Er is sprake van een rangorde met betekenis van de afstanden tussen de verschillen en een absoluut nulpunt. Alle rekenkundige bewerkingen zijn toegestaan.

    Operationalisme

    Als een meting gelijk gesteld wordt aan de uitkomst van een test. Deze opvatting zorgde ervoor dat men minder aandacht ging besteden aan theorievorming en kennisvorming.

    Operationalisering

    Het toelichten van de operaties die nodig zijn om de eigenschap te meten. Hiervoor moet gedrag worden vastgesteld dat typisch is voor een eigenschap en vervolgens moeten stimuli hierop afgesteld worden.

    Representational measurement

    Er kan alleen sprake zijn van een meting als de relaties tussen testscores overeenkomen met de relaties in wetenschappelijk onderzoek over datgene waarover maatwaarden iets zeggen.

    Averechtse diagnostiek

    Als een test een bepaalde correlatie heeft met een criterium, kan men dit gebruiken om voorspellingen te doen over de kansen op criteriumsucces, maar deze correlatie zegt ook heel veel over het criterium zelf

    Welke indelingen, onderscheidingen en begrippen zijn er omtrent testtheorie? - Chapter 3

    Tests voor prestatieniveau

    Tests voor prestatieniveau gaan uit van de maximale prestatie van de onderzochte persoon; er is een duidelijk norm voor goed en fout.

    Test voor gedragswijze

    Tests voor gedragswijze gaan over hoe iemand iets doet; er is geen duidelijk goed of fout.

    Enkelvoudige algemene niveautests

    Leiden tot een enkele indicatie van intelligentie. Er zijn drie deelcategorieën: individuele ontwikkelingstests, individuele intelligentietests voor volwassenen en algemene collectieve intelligentietests.

    Individuele ontwikkelingstest

    De intelligentiescore wordt vergeleken met die van leeftijdsgenoten.

    Individuele intelligentietests voor volwassenen

    Deze test is gericht op het vaststellen van het intelligentieniveau als dit niveau niet meer toe- of afneemt.

    Collectieve algemene intelligentietest

    Deze tests kunnen groepsgewijs worden afgenomen.

    Veelvoudige algemene niveautests

    Zorgen voor een nadere differentiatie, en niet slecht voor een enkele indicatie. Er zien twee typen: testbatterijen voor intelligentiefactoren en testbatterijen voor geschiktheden.

    Testbatterijen voor intelligentiefactoren

    Hebben als doel dat elke deeltest één dimensie van intelligentie meet, bijvoorbeeld 'word fluency' of 'reasoning'.

    Testbatterijen voor geschiktheden

    Meet de vermogens die iemand in staat stellen om aan een maatschappelijk taak of schooleis te voldoen. Het gaat vooral om leergeschiktheid.

    Speciale niveautests

    Toegespitst op een bepaald aspect van de begaafdheid. Er zijn drie typen: tests voor speciale intelligentiefactoren, tests voor speciale geschikheden en tests voor speciale niet-intelligentiefactoren

    Tests voor speciale intelligentiefactoren

    Tests die uitsluitend eigenschappen als ruimtelijk inzicht, numerieke vaardigheid of woordkennis meten.

    Tests voor speciale geschiktheden

    Tests voor leergeschiktheden, zoals geheugentests en concentratietests, en tests voor werkgeschikheden, zoals tests voor geschiktheid als piloot.

    Tests voor speciale niet-intelligentiefactoren

    Gaat om capaciteiten of vaardigheden, waarvan de meting belangrijk kan zijn voor diagnose of functie in de maatschappij. Bijvoorbeeld: motoriektests of gehoortests.

    Vorderingentests

    Meten in hoeverre de onderzochte het doel van een opleiding heeft bereikt.

    Observatietests

    De informatie komt van een onafhankelijke beoordelaar die de onderzochte observeert; er is dus sprake van indirecte gegevens. Er zijn twee typen: individuele observatietests en groepsobservatietests.

    Individuele observatietests

    Slecht één persoon wordt geobserveerd.

    Groepsobservatietests

    De beoordeling van een groep mensen die gezamenlijk een opdracht uitvoeren.

    Somato-fysiologische methoden

    Geven een indicatie van psychologische kwaliteiten door middel van het meten van lichamelijk kenmerken of processen. Er zijn twee soorten: morfologische methoden en fysiologische methoden.

    Morfologische methoden

    Zuiver somatische kenmerken worden onderzocht als indicaties voor persoonlijkheid.

    Fysiologische methoden

    Hiertoe worden gerekend: biochemische indices, elektro-encefalogram, hersenscanners, elektrocardiogram, metingen van bloeddruk en bloedvolume, registratie van oogbeweging en meting van elektrodermale verschijnselen.

    Zelfbeoordelingen

    De respondent beoordeelt zijn eigen functioneren. Er zijn verschillende soorten: interessetests, waarde- en attitudetests, biografische vragenlijsten en persoonlijkheidsvragenlijsten.

    Interessetests

    Meten interesses om zo een school- of werkkeuze te ondersteunen.

    Waarden- en attitudetests

    Meten waarden en attitudes.

    Biografische vragenlijsten

    Gaan over het leven van de onderzochte persoon.

    Persoonlijkheidsvragenlijsten

    Zijn gericht op het meten van veel aspecten van de persoonlijkheid.

    Kwalitatieve prestatietests

    De onderzochte krijgt een opdracht, waarbij het gaat om de wijze waarop de opdracht wordt uitgevoerd om zo inzicht te krijgen in persoonlijkheid of een klinisch syndroom. Er zijn twee soorten: niveautests voor gedragswijze en projectieve techniek.

    Niveautests voor gedragswijze

    Hier vallen onder: experimentele tests, motoriektests, intelligentietests voor klinisch gebruik, karaktertests en cognitieve stijlen.

    Projectietests

    Er wordt een ambigue opdracht weergegeven, waarop de onderzochte vrij mag reageren. Er zijn zes soorten: perceptietests, interpretatietests, expressietests, constructietests, associatietests en keuzetests.

    Individuele tests

    Er is een individuele relatie tussen testleider en onderzochte. De testleider formuleert de vragen en legt de antwoorden vast.

    Groepstesten

    Er is sprake van een groep en de testleider geeft slecht een instructie, surveilleert en verzamelt voltooide opgaven.

    Snelheidstests

    Meet hoe snel de onderzochte kan werken, door uit te gaan van een vaste tijd waarin zo veel mogelijk vragen moeten worden beantwoord.

    Prestatietests

    Kenmerkt zich door opgaven die variëren in moeilijkheidsgraad.

    Directe tests

    Als de betekenis van de test bekend is aan de onderzochte.

    Indirecte tests

    Als de betekenis van de test onbekend is aan de onderzochte.

    Hoe worden items opgebouwd en reacties gekwantificeerd in tests en vragenlijsten? - Chapter 4

    Items

    De stimuli waarop de respondenten reageren. Items zijn de basiselementen van tests.

    Theoretische opdracht

    Voorbeeld van een item om cognitieve vaardigheden te meten.

    Stelling

    Voorbeeld van een item om opinies, persoonlijkheidstrekken, houdingen en voorkeuren te meten. De respondent moet aangeven in hoeverre hij het wel of niet eens is met de stelling.

    Vraag

    Voorbeeld van een item om opinies, houdingen en voorkeuren te meten.

    Praktijkproef

    Voorbeeld van een item om vast te stellen of de respondent in staat is tot een vaardigheid.

    Stam

    De uitspraak in een meerkeuzevraag (exclusief antwoorden).

    Gesleutelde respons

    Het goede antwoord bij meerkeuzevragen.

    Afleiders

    De foute antwoorden bij meerkeuzevragen.

    Rangschikking

    De respondent moet de keuzemogelijkheden in een bepaalde volgorde plaatsen, bijvoorbeeld juistheid of voorkeur.

    Toeschrijving

    Combineren van twee begrippen uit rijtjes, ook wel matching.

    Likert-items

    Items met vijf antwoordmogelijkheden.

    Kwantificering

    Het omzetten van een kwalitatief reactie naar een getal, bijvoorbeeld 1 (goed antwoord) en 0 (fout antwoord).

    Dichotoom item

    Als een item twee antwoordcategorieën heeft, bijvoorbeeld goed en fout.

    P-waarde

    De relatieve frequentie op het goede antwoord.

    A-waarden

    De relatieve frequenties op het foute antwoord.

    Polytoom item

    Als een item drie of meer antwoordcategorieën heeft.

    Hoe worden tests afgenomen en verwerkt? - Chapter 5

    Testangst

    Angst voor de gevolgen van een slechte testprestatie. Iets anders dan 'angstigheid' als persoonlijkheidstrek.

    Positieve faalangst

    Bevorderlijk voor prestatie.

    Negatieve faalangst

    Nadelig voor prestatie.

    Handscoring

    Correctoren tellen het aantal goed en aantal fout gemaakte vragen met behulp van een sleutel.

    Zelfscoring

    Meestal wordt hierbij een tweede vel onder het antwoordformulier geplaatst, met cirkels bij het goede antwoord. De antwoorden van de respondent drukken door op dit vel. De corrector hoeft alleen nog te kijken of de cirkeltjes overlappen.

    Machinescoring

    Op speciale antwoordformulieren moet het juiste antwoord worden aangegeven. Een computer kijkt het vervolgens na.

    Xc

    Op gokken gecorrigeerde testscores. Het aantal goede antwoorden dat door kennis tot stand is gekomen.

    Itembank

    Een grote verzameling items, die kan worden opgeslagen op de computer.

    On-line testing

    De leerling bepaalt zelf het moment waarop hij in staat is tot het maken van de toets.

    Adaptief testen

    Iedere respondent krijgt een test die is aangepast naar zijn niveau. Hiervoor moeten de items voldoen aan de eisen van de item-responstheorie (hoofdstuk 7).

    Klassieke benadering van testen

    Iedereen krijgt dezelfde test gerepresenteerd. Er is geen sprake van optimaal geschikte items, waardoor extreem hoge of lage meetwaarden onnauwkeurig zijn.

    Ruwe score

    Basisscore, heeft weinig betekenis. Kan staan voor verschillende dingen: aantal goede antwoorden, aantal foute antwoorden, de soms van de scores op de rating scales of het aantal mislukte pogingen op een handvaardigheidstest.

    Norm

    Referentiekader voor de evaluatie van de ruwe scores, gebaseerd op de verdeling in de populatie.

    Vergelijking met absolute standaard

    Er wordt geen gebruik gemaakt van scores van anderen, maar van een absolute maatstaf, die gebaseerd is op psychologische of onderwijskundige analyse van kennis, inzicht of vaardigheden.

    Verhoudingsnormen

    De testscores worden gedeeld door een andere variabele, bijvoorbeeld de berekening van het IQ door de mentale leeftijd te delen door de chronologische leeftijd.

    Standaardscores

    Als ruwe scores worden omgerekend naar standaardscores, door X (ruwe score) te verminderen met het gemiddelde en vervolgens te delen door de standaarddeviatie.

    Zx

    De standaardscore. Verminder X met het gemiddelde en deel dat vervolgens door de standaarddeviatie.

    Sx

    De standaarddeviatie.

    Genormaliseerde standaardscores

    Worden verkregen uit niet-lineaire transformaties, die de verdeling van X vervormen tot een normaalverdeling.

    Overige standaardscores

    Onder andere t-scores, stanines en deviatie-IQ.

    Wat is betrouwbaarheid? - Chapter 6

    Betrouwbaarheid

    De mate van herhaalbaarheid van metingen; in hoeverre variëren de testscores, als de test onder dezelfde condities bij dezelfde persoon wordt afgenomen?

    Ti

    Systematisch deel van de testscore van persoon i, varieert niet per herhaling (dus geen j). Staat voor true score.

    Eij

    Toevallig deel van de testscore van replicatie j en persoon i. Staat voor error, ofwel meetfout.

    Rxx'

    Betrouwbaarheid van testscore binnen een populatie. Is gelijk aan de verhouding van de varianties van betrouwbare score en geobserveerde score, dus het systematische deel van de variantie.

    Parallelvormmethode

    Als er twee inwisselbare maar niet identieke tests worden afgenomen.

    Paralleltestbetrouwbaarheid

    De correlatie tussen parallelle tests.

    Test-hertestmethode

    Het afnemen van dezelfde test, nadat er een behoorlijke tijd is verstreken.

    Test-hertestbetrouwbaarheid

    De correlaties tussen de scores van twee afnames van dezelfde test.

    Leereffect

    Als iemand door oefening anders (meestal beter) presteert op een test.

    Splitsingsmethode

    Eén test wordt afgenomen, die in twee helften is gesplitst met evenveel items. Per helft wordt de ruwe score bepaald en kan via de Spearman-Brown-formule de betrouwbaarheid berekend worden.

    Interne-consistentiemethode

    Eén test wordt afgenomen, waarna alle covarianties en de variantie van de ruwe score worden berekend. Aan de hand daarvan kan de betrouwbaarheid worden gemeten.

    Cronbachs alfa

    Bekendste coëfficiënt van interne consistentie.

    Gestratificeerde alfa-coëfficiënt

    De betrouwbaarheid van een totaalscore gebaseerd op heterogene delen van de test.

    Universum

    Het totaal van voorwaarden die men hanteert bij het generaliseren.

    Welke nieuwe ontwikkelingen zijn er in de testtheorie en constructie? - Chapter 7

    Meten bij implicatie

    Als de meeteigenschappen van een model ook in praktische toepassingen van de test gelden. Kenmerk van een item-responsmodel.

    Meten bij fiat

    Als wordt aangenomen dat bepaalde eigenschappen geldig zijn, maar dit niet kan worden aangenomen. Kenmerk van het klassieke testmodel.

    Populatie-onafhankelijk meten

    Als het niveau van de test losstaat van de vergelijking van meetwaarden tussen personen.

    Populatie-afhankelijk meten

    Als de betrouwbare score (en dus totaalscore) afhankelijk is van hoe moeilijk de gebruikte test is.

    Item-responstheorie

    Zorgt ervoor dat we uitspraken kunnen doen over de kans dat persoon i met meetwaarde θi een respons geeft op item g.

    Succeskans

    Kans op een positief antwoord. Aangeduid als P(Xg = ɪІθ)

    Monotoon niet-dalend

    De functie stijgt of is constant, kenmerk van de formule voor succeskans.

    Pseudokansniveau

    Kans dat op item g het goede antwoord wordt gegeven door mensen met een zeer lage meetwaarde, θ. Aangegeven door P(Xg = ɪІθ) = γg.

    Locatieparameter

    Het punt op de θ-schaal dat halverwege ligt tussen het pseudokansniveau en de maximale succeskans. Ook wel de moeilijkheidsparameter.

    Kritisch gebied

    Als de helling vrij stijl is en dus succeskans dus snel toeneemt. Personen zijn goed van elkaar te onderscheiden, wat hun succeskans op het item betreft.

    Rasch-model

    Strengste van de item-responsmodellen, ook wel het een-parameter logistische model. Voor zeer kleine θ-waarden is de succeskans vrijwel gelijk aan nul en de pseudokansniveauparameter komt niet voor. Alle items hebben hetzelfde discriminerend vermogen en de metingen zijn populatie-onafhankelijk.

    Birnbaum-model

    Veralgemenisering van het Rasch-model. Het model laat toe dat de items in een test verschillen in discriminerend vermogen. Items mogen variëren in moeilijkheid en voor lage θ-waarden is de succeskans vrijwel gelijk aan nul. De metingen zijn populatie-onafhankelijk, maar de moeilijkheids- en discriminatieparameters kunnen niet populatie-onafhankelijk bepaald worden.

    Drie-parameter logistisch model

    Een model met drie parameters, het pseudokansniveau is hieraan toegevoegd. Meetwaarden van personen zijn alleen populatie-onafhankelijk te bepalen als de afhankelijke itemparameters bekend zijn.

    Model van monotone homogeniteit

    Valt onder de modellen van Mokken. De modellen zijn wel monotoon niet-dalend, maar hebben verder gen beperkingen. Ze vertonen dus meer schommeling dan de eerdere modellen. De ordening van personen is populatie-onafhankelijk.

    Model van dubbele monotonie

    Valt onder de modellen van Mokken, is een speciaal geval van het model van monotone homogeniteit. De item-responsfuncties zijn monotoon niet-dalend. Daarbij mogen ze elkaar niet snijden. De ordening van personen in populatie-onafhankelijk.

    Lokale betrouwbaarheid

    Het informatiegehalte van een item voor de schatting van θ. Op het maximum van de informatiefunctie geeft het item de meeste informatie.

    Itembank

    Relatief grote verzameling van gemakkelijk toegankelijke testvragen.

    Doelinformatiefunctie

    Functie waarin de minima worden weergegeven die voor de maker van de test nog acceptabel zijn. De waarden moeten groot zijn bij θ0, de zelf bepaalde grensscore.

    Adaptief testen

    Iedere respondent krijgt een test die past bij zijn niveau. Hiervoor moeten de itemparameters zijn opgeslagen, zodat ze aansluiten bij de persoonsparameter θ

    Vraagonzuiverheid

    Gaat over de vraag in hoeverre de betrouwbaarheid en validiteit van items in het geding zijn als de test wordt gebruikt in verschillende populaties. De item-responsfuncties van een item verschilt bij personen met dezelfde θ-waarde uit andere populaties.

    Zuiver item

    Er is geen sprake van vraagonzuiverheid; als personen uit verschillen groepen maar met dezelfde θ-waarde dezelfde kans hebben om een vraag goed te beantwoorden.

    Item exposure

    Als de persoon-responsfunctie relatief hoog is aan het einde. De persoon kende de moeilijkste items al.

    Wat is de validiteit en betekenis van een test? - Chapter 8

    Validiteit

    De mate waarin de test aan het eigen doel beantwoordt.

    Predictieve validiteit

    Sluit aan bij het doel van het voorspellen van criteriumgedrag. De centrale vraag is: hoe goed is het criterium te voorspellen?

    Begripsvaliditeit

    Sluit aan bij het doel van het meten van een eigenschap. De centrale vraag is: in hoeverre wordt het psychologische begrip getest?

    Predictive validity

    In welke mate de voorspellingen worden bevestigd.

    Concurrent validity

    Men vergelijkt testresultaten met een gelijktijdig beschikbaar criterium.

    Content validity

    Ook wel inhoudsvaliditeit. Er wordt gekeken hoezeer de inhoud van de test een universum van situaties, kennisinhouden of vaardigheden weergeeft, waarover met betrekking tot de onderzochte conclusies moeten worden getrokken.

    Construct validity

    Kijkt naar welke psychologische eigenschappen door de test worden gemeten.

    Synthetische validiteit

    Kijkt naar onderdelen van het criteriumgedrag en niet naar het criterium als geheel.

    Congruent validity

    Ook wel soortgenootvaliditeit. Geeft aan in hoeverre de test correleert met andere testen die hetzelfde zouden moeten meten.

    Face validity

    Ook wel indrukvaliditeit. Geeft aan in hoeverre de relatie tussen de test en hetgeen gemeten duidelijk lijkt.

    Incremental validity

    Gaat over in hoeverre voorspellingen met behulp van de test beter zijn dan voorspellingen op basis van al aanwezige informatie.

    Conceptuele criterium

    Concretisering van het organisatiedoel in termen van resultaten.

    Criteriummaat

    Afgeleid van conceptuele criterium. Expliciete, duidelijke uitspraken met betrekking tot het criteriumgedrag.

    Criteriumgedrag

    Waarneembaar gedrag dat belangrijk is voor het conceptuele criterium.

    Variatiebeperking

    Ook wel restriction of range. Gevolg van het wegselecteren van bepaalde groepen proefpersonen (bijvoorbeeld met een lage score).

    Suppressor variabele

    Een variabele die het niet-relevante deel bij de voorspelling van Y onderdrukt.

    Moderatorvariabelen

    Een variabele die zelf niet of nauwelijks hoeft te correleren met een

    criteriumscore Y, maar die wel de relatie van andere variabelen met Y beïnvloedt.

    Kruisvalidering

    Ook wel cross validation. Het voorspellingsmodel wordt gecontroleerd

    Trekvalidering

    Gaat over de vraag in hoeverre testgedrag kan worden verklaard door een persoonlijkheidstrek of geschiktheid, los van psychologische theorieën.

    Nomologische validering

    Gaat om de vraag in hoeverre het testgedrag verklaard kan worden door een psychologische theorie.

    Confirmerende validering

    Om een hypothese te bevestigen.

    Discriminante validering

    Om alternatieve hypotheses te verwerpen.

    Factoranalyse

    Gebruikt om een groot aantal variabelen te verminderen, dus het samenvatten van informatie.

    Factor

    Gewogen som van itemscores of testscores. Er zijn drie soorten: algemene factoren (hangen samen met vrijwel alle tests), groepsfactoren (vertegenwoordigen een kleiner deel van tests), en specifieke factoren (horen bij één test).

    Sociale wenselijkheid

    Als respondenten niet eerlijk antwoord geven, maar dat invullen wat ze sociaal wenselijk achten. Kan zowel individueel als op groepsniveau plaatsvinden.

    Antwoordtendenties

    Neiging tot een bepaald keuzepatroon, los van waar de vragen over gaan.

    Instemtendentie

    Overmatig instemmen met de richting van de vraag.

    Positievoorkeur

    Als een bepaalde positie de voorkeur heeft, bijvoorbeeld steeds negatief.

    Semantische interpretatie

    Variatie door iemands opvatting over de antwoordcategorieën, bijvoorbeeld als iemand steeds 'soms' antwoord waar een ander 'zelden' kiest.

    Sequentietendentie

    Als iemand kiest over een bepaalde verdeling bij het antwoorden, of zich houdt aan bepaalde regels, bijvoorbeeld niet te vaak hetzelfde antwoord achter elkaar.

    Snelheidstendentie

    Neiging tot snel antwoord.

    Precisietendentie

    Neiging tot precies antwoord. Ongeveer het tegenovergestelde van snelheidstendentie.

    Uitvoerigheidtendentie

    Neiging tot een uitvoerig antwoord, vooral bij vrije-antwoordentests.

    Gistendentie

    Neiging tot gissen.

    Voorkeur voor formele kenmerken

    Neiging om te kiezen op basis van formele kenmerken, bijvoorbeeld steeds het meest ingewikkelde antwoord.

    Wat is de validiteit en betekenis van een test? - Chapter 9

    Antecedent probability

    Het percentage geschikte personen in de populatie

    Individuele beslissingen

    Er wordt gedacht vanuit het individu dat de beslissing moet nemen.

    Institutionele beslissingen

    Er wordt een groot aantal soortgelijke beslissingen genomen. Bijvoorbeeld de toelatingsprocedure voor een school of het examen voor een rijbewijs.

    Univariate informatie

    Als informatie op één dimensie past.

    Multivariatie informatie

    Als de keuzealternatieveren niet op één dimensie passen en dus van aard verschillen.

    Enkel treatment

    Gebaseerd op niet/wel

    Verschillende alternatieven

    Indelen in twee of meer klassen.

    Enkelvoudige selectie

    Als er in het onderzoek wordt gekeken naar één criterium met twee mogelijkheden: voldoen of niet voldoen aan de eisen. Hoort bij het afwijzingsmodel: het gaat om het weren van zo veel mogelijk ongeschikte kandidaten.

    Selectieratio

    Aangenomen kandidaten.

    Toevalskans

    Aantal geschikte kandidaten bij toeval.

    Succesratio

    Aantal succesvolle kandidaten.

    Veelvoudige minimumscore

    Bij deze procedure wordt voor elke afzonderlijke test een kritische testscore vastgesteld.

    Access: 
    Public
    Access: 
    Public

    Image

    Check more: click and go to more related summaries or chapters

    Psychodiagnostiek en psychologische communicatie: De beste studieboeken samengevat

    Join: WorldSupporter!

    Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>

    Check: concept of JoHo WorldSupporter

    Concept of JoHo WorldSupporter

    JoHo WorldSupporter mission and vision:

    • JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.

    JoHo concept:

    • As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
    • JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.

    Join JoHo WorldSupporter!

    for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for

    Check: how to help

    Image

     

     

    Contributions: posts

    Help others with additions, improvements and tips, ask a question or check de posts (service for WorldSupporters only)

    Image

    Check: more related and most recent topics and summaries

    Image

    Share: this page!
    Follow: Psychology Supporter (author)
    Add: this page to your favorites and profile
    Statistics
    3952 1 1
    Submenu & Search

    Search only via club, country, goal, study, topic or sector