Welke nieuwe ontwikkelingen zijn er in de testtheorie en constructie? - Chapter 7
Na de klassieke testtheorie kwam de item-responstheorie, een klasse van aanverwante modellen, waaronder die van Lord, Rasch en Birnbaum. De klassieke testtheorie is nuttig, want men heeft er ervaring mee, bovendien is het makkelijk te begrijpen en levert het praktisch bruikbare resultaten op. Hoewel de moderne testtheorie gedomineerd wordt door de item-responstheorie, gaan nog veel tests gaan via de principes van de klassieke testtheorie.
De item-responsmodellen hebben meeteigenschappen die onderdeel zijn van die modellen. Deze modellen kunnen gecontroleerd worden door statistische methoden. Als het model dan een goede beschrijving van de scores geeft, kan deze toegepast worden in de praktijk. Dit heet ‘meten bij implicatie’. In de klassieke testtheorie zijn de metingen populatie-afhankelijk. Bij item-responsmodellen is er sprake van populatie-onafhankelijk meten. Dit betekent dat de betrouwbare score, en dus ook de totaalscore, afhankelijk zijn van het moeilijkheidsniveau van de gebruikte test. In de klassieke context maakt iedereen dezelfde test, zodat het moeilijkheidsniveau van de test constant wordt gehouden. Zo kunnen verschillen tussen geteste personen verklaard worden aan de hand van hun verschillen in niveau.
Wat is populatie-onafhankelijkheid? Als we beschikken over een grote verzameling items, die allemaal dezelfde eigenschap meten en we ervan uitgaan dat nagegaan is dat het item-responsmodel past bij de testgegevens, dan maakt het voor de vergelijking van de meetwaarden van de personen niet uit wat het niveau van de tests was (adaptief testen).
Naast theoretische voordelen biedt de item-responstheorie praktische toepassingen die met de klassieke testtheorie nog niet mogelijk waren.
Welke principes en begrippen worden gebruikt in de item-responstheorie?
Score op item g: Xg
Het gaat met name om modellen voor dichotome items (geven bijvoorbeeld aan of een antwoord goed of fout is). Er zijn twee soorten antwoorden:
- Het positieve antwoord: itemscore is gelijk aan 1, Xg = 1;
- Het negatieve antwoord: Xg = 0.
Er bestaan ook item-responsmodellen voor items met drie of meer geordende scores, maar die zijn complexer.
Meetwaarde van persoon i: θi (thèta)
De item-responstheorie uit dat van kans dat persoon i met meetwaarde θi een specifieke respons geeft op item g. Deze kans wordt, behalve door kenmerken van personen (meetwaarde θi), ook bepaald door kenmerken van het item (zoals moeilijkheid en discriminerend vermogen). Met een vaste waarde van θ zijn de kansen op een positief en een negatief antwoord samen 1. Andere uitkomsten zijn er niet.
Succeskans: P(Xg = 1|θ)
De succeskans is de kans op een positief antwoord. Deze kans wordt bepaald door kenmerken van zowel personen (meetwaarde θi) als items (moeilijkheid δg en discriminerend vermogen αg). Een kans van bijvoorbeeld 0.70 op een item betekent dat iemand in 70% van de onafhankelijke replicaties het goede antwoord geeft.
Item-responsfunctie
In de item-responstheorie wordt de succeskans opgevat als een functie van de te meten psychologische eigenschap. Over de vorm van de functie zijn een aantal dingen te zeggen:
De succeskans is een monotoon niet-dalende functie van de schaal waarop de functie wordt gemeten. Dit betekent dat de functie stijgt of constant is.
Ten tweede is de succeskans over grote intervallen van de schaal vrijwel constant laag of hoog. Er is een kritisch gebied waar de helling relatief steil is en waar de succeskans dus snel toeneemt. In dit kritische gebied zijn personen met verschillende meetwaarden goed te onderscheiden.
Het algemene model
Drie kenmerken van de items bepalen de exacte vorm van de item-responsfunctie:
Pseudokansniveau γg (gamma): personen met een lage meetwaarde hebben een succeskans die groter is dan nul. Bij meerkeuze-items kan men altijd blind gissen. De blinde giskans op een positief antwoord is bij een vierkeuze-item 0.25. In de praktijk kan de giskans lager zijn, omdat men vaak voor aantrekkelijke maar foutieve antwoorden kiest bij gissen. Vandaar dat Hambleton en Swaminathan (1985) pleiten voor de term pseudokansniveau in plaats van giskans. Bij open vragen is het pseudokansniveau natuurlijk gelijk aan nul.
Moeilijkheid δg (delta): de curve heeft een specifieke locatie ten opzichte van de schaal. Items rechts zijn moeilijker, de succeskans wordt daar kleiner.
Discriminerend vermogen αg (alfa): hoe steiler de curve in het kritisch gebied, hoe groter het aantal personen dat een lage of een hoge succeskans hebben en hoe scherper de verdeling van personen op de θ-schaal in tweeën wordt gedeeld. Kleine veranderingen in meetwaarde θ hebben grote veranderingen in de succeskans tot gevolg.
Als de itemkenmerken bekend zijn, kan men voor een specifieke meetwaarde θ de succeskans op het item bepalen.
Welke modellen zijn er in de item-responstheorie?
De diverse item-responsmodellen zijn bijzondere versies van het algemene model. Deze modellen hebben allen als uitgangspunt dat er een monotoon niet-dalend verband bestaat tussen de succeskans op een item en de schaal waarop de psychologische eigenschap wordt gemeten. Ze verschillen in de keuze van de specifieke wiskundige functie voor de item-responsfunctie.
Sommige modellen zijn strenger, met andere woorden ze leggen veel meer structuur aan op het antwoordgedrag van personen en aan patronen van itemscores. Andere modellen zijn minder streng en geven een grotere vrijheid aan antwoordgedrag en gegevensstructuur. De strengere modellen zijn van betere kwaliteit maar zijn vaak praktisch niet toepasbaar, bij de minder strenge modellen is precies het omgekeerde het geval.
De connotatie ‘streng’ en ‘zwak’ verwijst naar de mate waarin modellen restricties opleggen aan antwoordgedrag. De modellen worden besproken in volgorde van streng naar minder streng.
Wat is het Rasch-model?
Het Rasch-model is het strengst van de item-responsmodellen en wordt ook wel het één-parameter logistisch model genoemd.
De meeteigenschappen van het Rasch-model zijn:
- Moeilijkheidsparameter. De items mogen verschillen in moeilijkheid.
- Géén pseudokansniveauparameter. Bij elk item dat aan de eisen van het model voldoet, nadert de kleinste succeskans tot nul. Gissen naar een positief antwoord is niet mogelijk, de pseudokansniveauparameter is gelijk aan nul. Als gissen wel een positieve score oplevert is het Rasch-model niet geschikt voor de analyse van de gegevens.
- Géén discriminatieparameter. Het discriminerend vermogen van alle items uit een test die aan het Rasch-model voldoen is gelijk.
- Metrische schaal. De eigenschappen van de schaal waarop men meet zijn afhankelijk van de keuze van het type Rasch-model. Er zijn alleen transformaties toegestaan die géén invloed op de succeskans hebben. De eigenschappen van de schaal zijn afhankelijk van de gekozen versie. Men kan kiezen voor: (1) ratioschalen (meting die plaatsvindt op een antilogaritmische schaal met ratio-eigenschappen), (2) verschilschalen (meting op een logaritmische schaal die verschiltransformaties toelaat) of (3) meting op intervalniveau.
Populatie-onafhankelijkheid: een belangrijk kenmerk van de meting volgens het Rasch-model is de populatie-onafhankelijkheid van de meetwaarden. Dit betekent:
- Personen zijn te vergelijken, onafhankelijk van de moeilijkheidsgraad van de items die gebruikt zijn.
- Items zijn te vergelijken zonder afhankelijk te zijn van de personen die aan de meting hebben deelgenomen.
Kanttekening: populatie-onafhankelijkheid geldt alleen maar voor deelpopulaties die gevormd kunnen worden uit een totale populatie. Appels kunnen ook hier niet met peren worden vergeleken, maar goudrenetten wel met golden delicious in de totale populatie van appels.
De eigenschap van het Rasch-model is dat voor elke persoon met hetzelfde aantal items goed (X) dezelfde θ-waarde wordt geschat (personen met alles goed of alles fout doen om technische redenen niet mee). Conclusies die dan uit de geschatte θ- en δg-waarden getrokken kunnen worden zijn:
De θ-waarden staan op een andere schaal dan X: de θ-schaal is lastiger te interpreteren, maar nuttig vanwege het meetniveau en de populatie-onafhankelijkheid. Voor rapportage is het handiger θ om te rekenen naar een bekende schaal (zoals schoolcijfers), of om met ruwe scores of percentielen te werken.
De θ-scores kunnen zowel positief als negatief zijn: omdat de procedure zo is uitgevoerd dat het gemiddelde van de θ’s gelijk is aan 0 (arbitrair gekozen – de kleinste θ had ook als 0 gekozen kunnen worden), heeft het teken (+ of -) van de θ-waarde geen inhoudelijke betekenis.
De standaardmeetfout per θ-waarde varieert per gemiddelde θ-waarde: dit in tegenstellig tot de klassieke testtheorie; zo is duidelijk dat voor extreem hoge en lage θ-waarden de nauwkeurigheid het kleinst is, en in het midden van de schaal het grootst. De 90%-betrouwbaarheidsintervallen variëren ook met θ.
De betrouwbaarheidsintervallen zijn relatief lang: de geschatte meetwaarden dienen dus ver uiteen te liggen wil er sprake zijn van een significant verschil. En dus is er groot aantal items nodig.
Wat zijn modellen met twee of drie itemparameters?
Deze modellen zijn op te vatten als veralgemeniseringen van het Rasch-model (of het Rasch-model als speciaal geval van deze twee modellen) en zijn dus minder streng. Als het Rasch-model een adequate verklaring geeft voor de testgegevens, dan zijn ook deze modellen bruikbaar. Andersom is dat niet het geval.
Wat is het Birnbaum-model?
Dit model is het strengst en wordt ook wel het twee-parameter logistisch model genoemd, omdat naast de moeilijkheid ook het discriminerend vermogen in de formule is opgenomen.
Meeteigenschappen van het Birnbaum-model zijn:
- Discriminerend vermogen. Als de items van de test aan de eisen van dit model voldoen dan hebben ze over het algemeen een verschillend discriminerend vermogen.
- Moeilijkheidsparameter. Items mogen verschillen in moeilijkheid (net als bij Rasch-model).
- Géén pseudokansniveau. Net als het Rasch-model nadert de succeskans tot nul als het item voldoet aan de eisen van het model. Analyse volgens dit model is dus niet mogelijk bij gegevens die verkregen zijn met items waarbij personen het antwoord kunnen raden (giskans > 0).
- Intervalschaal schaal. Meting vindt plaats (evenals bij het Rasch-model) op een metrische schaal, waarop intervallen serieus worden genomen. De eenheid en het nulpunt van de meting kunnen arbitrair worden gekozen.
Populatie-onafhankelijkheid: meting volgens Birnbaum is evenals bij het Rasch model populatie-onafhankelijk. Het geeft wel meer problemen dan bij het Rasch-model, omdat de meting van personen wel onafhankelijk is van het item maar niet van het discriminerend vermogen. De keuze van een bepaalde deelpopulatie heeft gevolgen voor de ordening van de succeskansen. Deze ordening is bij het Rasch-model populatie-onafhankelijk. In dit model verschilt deze ordening per deelpopulatie.
Het kiezen van een minder streng model levert verlies aan meeteigenschappen op. Bij dit Birnbaum-model kunnen alleen personen populatie-onafhankelijk worden gemeten en items niet.
Wat is het drie-parameter logistisch model?
In dit model worden weer minder restricties opgelegd aan het testgedrag, vergeleken met het Rasch- en Birnbaum-model. Er zijn drie itemparameters opgenomen: moeilijkheid, discriminerend vermogen en pseudokansniveau, waarin items uit dezelfde test mogen variëren.
Het Rasch-model is een speciaal geval van deze formule; door γ = 0 aan te nemen voor alle items en door alle discriminatieparameters te normeren op 1 (α = 1). Door alleen γ = 0 aan te nemen krijg je het Birnbaum-model.
Kenmerken van dit model zijn:
- Wel meting op de intervalschaal.
- Meetwaarden van personen zijn populatie-onafhankelijk te bepalen indien bekend is wat de populatie-afhankelijke itemkenmerken zijn.
- Itemkenmerken zijn gebonden aan een vaste populatie van personen.
Wat zijn de modellen volgens Mokken?
Volgens Mokken zijn de relatief strenge modellen niet gerechtvaardigd omdat er over veel psychologische eigenschappen te weinig kennis bestaat. De modellen leggen teveel beperkingen op aan de testgegevens. Bij het Rasch-model kunnen items alleen variëren in moeilijkheid, terwijl zij in werkelijkheid ook op andere kenmerken zullen verschillen. Het drie-parameter logistisch model vereist dat voor respondenten met hoge θ-waarden de kans op het goede antwoord naar 1 nadert, maar sommige items kunnen zo moeilijk zijn, dat ook deze respondenten het fout hebben. Alle drie de modellen veronderstellen eerst een lage vrijwel constante meetwaarde, daarna snel stijgend en dan een constante waarde die dicht bij 1 ligt, maar dat hoeft niet bij alle (psychologische) eigenschappen zo te werken.
Er zijn twee Mokken-modellen: het model van monotone homogeniteit en het model van de dubbele monotonie.
Wat is het model van monotone homogeniteit?
Dit is het minst restrictieve model van de twee Mokken-modellen en is een verzameling van items waarvan ieder item een beroep doet op dezelfde eigenschap (homogeniteit). Tevens kan het antwoordgedrag op ieder item door middel van een monotone functie worden beschreven.
Er zijn geen restrictie op het antwoordgedrag van de proefpersonen op de items door middel van een specifieke responsformule (dat is wel het geval bij de voorgaande modellen) omdat er over veel psychologische begrippen nog te weinig kennis bestaat. De enige restrictie is dat de item-responsfuncties monotoon niet-dalend zijn. Het antwoordgedrag van een persoon op een item is een resultante van persoon en item. Er is geen exacte specificatie van de wijze waarop dit antwoordgedrag wordt bepaald. Het antwoordgedrag moet afspiegeling zijn van de psychologische eigenschap die wordt gemeten op de θ-schaal: als θ toeneemt, neemt ook de succeskans toe, maar zonder restricties aan hoe die toename precies verloopt.
De meeteigenschappen van dit model zijn:
De items kunnen variëren in moeilijkheid, discriminerend vermogen en pseudokansniveau.
Personen kunnen worden geordend op θ met behulp van hun totaalscores op X. De meetwaarde θ kan niet met dit model geschat worden (wel met de drie voorgaande modellen), daarom is het fijn dat personen wel op θ geordend kunnen worden. Dat kan theoretisch ongeacht testlengte k, maar praktisch wordt de betrouwbaarheid lager bij minder items.
Meting van personen geschiedt op een ordinale schaal. De verschilschaal (Rasch-model) en intervalschaal (Birnbaum-model) raken we hiermee kwijt. Maar de ordinale schaal is in veel toepassingen voldoende (zoals bij een sollicitatieprocedure).
Vanwege de zwakke vooronderstellingen is er minder verlies van items, dit leidt tot hogere betrouwbaarheid van X.
Itemparameters θ, δ, en andere itemparameters kunnen niet geschat worden. Wel kan de p-waarde (proportie 1-en) berekend worden; hoe groter de p-waarde, hoe gemakkelijker of populairder het item.
Populatie-onafhankelijkheid: de ordening van personen is populatie-onafhankelijk. Het maakt niet uit of de test wordt samengesteld uit een itemdomein dat verenigbaar is met de eisen van het model van monotone homogeniteit, de ordening blijft dezelfde. De ordening van items naar moeilijkheid is wel populatie-afhankelijk.
Rasch en Birnbaum-modellen zijn speciale gevallen van dit model. De item-responscurve worden niet door een specifieke functie vastgelegd wat wel het geval is bij Rasch en Birnbaum-modellen.
Wat is het model van dubbele monotonie?
Dit is een model dat wel leidt tot populatie-onafhankelijke ordening van zowel personen als items: het is een speciaal geval van het model van monotone homogeniteit. De eisen van het model van dubbele monotonie zijn:
- De item-responsfuncties zijn monotoon niet-dalend.
- De functies mogen elkaar niet snijden: de functies mogen elke denkbare vorm hebben, maar niet dalend zijn en elkaar niet snijden. Dat lijkt op het Rasch-model (is ook stijgend en niet niet snijdend), maar is dan wat vrijer.
Meeteigenschappen van dit model zijn:
- Ordinale schaal. Populatie-onafhankelijke ordening van zowel personen als items; personen kunnen met behulp van X worden geordend op θ.
- De p-waarden van items liggen ook op een ordinale schaal: de ordening van items naar afnemende p-waarde correspondeert met toenemende moeilijkheid.
Populatie-onafhankelijkheid: de ordening van personen is populatie-onafhankelijk en de ordening van items is populatie-onafhankelijk (items kunnen geordend worden met behulp van hun p-waarden). Maar de testscores X en de p-waarden zijn niet vergelijkbaar; personen kunnen wel met elkaar op een schaal vergeleken worden en items ook, maar personen en items kunnen niet onderling vergeleken worden.
Hoe zijn de item-responsmodellen onderling aan elkaar gerelateerd?
Het Rasch-model is een speciaal geval van het Birnbaum-model en dat is weer een speciaal geval van het drie-parameter logistisch model. Ze veronderstellen alle drie dat items uit een test dezelfde eigenschap meten, en elk heeft een eigen formule waarmee wordt aangegeven wat het verband is tussen de succeskans op een item en de schaal (θ) waarop de psychologische eigenschap wordt gemeten: een monotoon stijgend verband. Het model van monotone homogeniteit veronderstelt ook dat dit verband monotoon is, maar zonder verdere restricties aan de vorm. Dat maakt de bovenstaande drie modellen speciale gevallen van het model van monotone homogeniteit.
Van algemeen naar specifiek: model van monotone homogeniteit → drie-parameter logistisch model → Birnbaum-model → Rasch-model.
Testgegevens die met een specifiek model verklaard kunnen worden, kunnen ook met een algemener model verklaard worden. Andersom geldt dat niet altijd.
Het model van dubbele monotonie is een speciaal geval van het model van monotone homogeniteit (voegt er een extra restrictie aan toe). Het Rasch-model is een speciaal geval het model van dubbele monotonie (veronderstelt niet alleen dat items niet snijden, maar ook dat ze parallel zijn).
Van algemeen naar specifiek: model van monotone homogeniteit → model van dubbele monotonie → Rasch-model.
Het Venn-diagram laat de relatie tussen de modellen zien. Als een ellips geheel binnen een andere ellips valt is dit model een speciaal geval van het andere model. Als de ellipsen elkaar overlappen kunnen er deelverzamelingen van items gekozen worden met itemparameters, waarvan beide modellen een verklaring kunnen geven. Als de ellipsen een uniek deel hebben kan alleen van items die in dit unieke deel vallen, dat specifieke model een beschrijving geven.
Hoe kan met de item-responsmodellen gemeten worden?
Wanneer de testtheorie toegepast wordt op de gegevens van de test dan heeft dit tot gevolg dat personen en eventueel ook items op een schaal worden afgebeeld. De item-responstheorie heeft de volgende eigenschappen:
- Meten bij implicatie:
- De schaaleigenschappen volgen uit het specifieke item-responsmodel (en hoeven dus niet te worden aangenomen, zoals bij klassieke testtheorie: meten bij fiat). Bij de Rasch en Mokken-modellen gelden de theoretisch afleidbare schaaleigenschappen in de praktijk ook. Dit komt omdat het empirisch te onderzoeken is of een model een goede verklaring geeft van het antwoordgedrag.
- Het type meting:
- Mokken-modellen: meting op ordinale schaal.
- Birnbaum, drie-parameter logistisch en Rasch-modellen: meting op een metrische schaal (interval-, verschil en rationiveau).
- Ordening:
- Birnbaum, drie-parameter logistisch en Rasch-modellen: items en personen worden op dezelfde schaal afgebeeld.
- Mokken-modellen: vanwege de ordinale meting aparte ordening van personen en items.
- Populatie onafhankelijkheid:
- Rasch-model: zowel de meting van personen als items zijn populatie-onafhankelijk.
- Birnbaum en drie-parameter logistisch model: alleen de meting van personen is populatie-onafhankelijk.
- Mokkens model van monotone homogeniteit: ordening van personen is populatie-onafhankelijk.
- Mokkens model van dubbele monotonie: ordening van personen en items is populatie-onafhankelijk.
Wat is de betekenis van metrische schalen en hoe kan het gebruikt worden?
Meting met behulp van een metrische schaal (ratio-, interval- of verschilschaal) moet niet direct in psychologische termen worden vertaald. In het praktische gebruik van een testscore hebben deze schaaleigenschappen geen absolute betekenis (iemand heeft niet 2x zoveel van een bepaalde eigenschap). Er zijn een aantal bewerkingen van meetwaarden om een schaal van handige interpretaties te voorzien (Eggen, Kelderman, 1987):
De schaal kan worden omgezet naar het gemiddelde en de spreiding die kenmerkend zijn voor de normgroep. Door een bepaalde verdeling van de scores in de normgroep kan een specifieke score hierbinnen meteen geïnterpreteerd worden.
De meetwaarden kunnen worden gerelateerd aan één of meer populatie-onafhankelijke referentiepunten die de mogelijkheid bieden voor een zinnige inhoudelijke interpretatie.
De omzetting in percentielscores.
De omzetting van meetwaarden in succeskansen en daarvan afgeleide schaaltypen. ‘Odds’ is de verhouding tussen de kans op een positief antwoord en de kans op een negatief antwoord op hetzelfde item voor een vaste meetwaarde.
De laatste bewerking is het omzetten van de schaal uit de item-responstheorie in de schaal van de klassieke testtheorie (omzetting van de θ-schaal in de schaal van de betrouwbare T-score).
Hoe kan de nauwkeurigheid van de meting gewaarborgd worden?
Het is belangrijk zowel bij de klassieke testtheorie als bij de item-responstheorie dat de scores van personen betrouwbaar ten opzichte van elkaar of van een normscore kunnen worden onderscheiden. Hierin is de item-responstheorie een verfijning van de klassieke testtheorie.
In de klassieke testtheorie wordt de precisie van de meting uitgedrukt in de standaardmeetfout. Het uitgangspunt hierbij is dat deze constante standaardmeetfout voor een test op ieder scoreniveau gebruikt kan worden. Dit is echter in de praktijk niet altijd zo; een test meet de psychologische eigenschap niet op de hele schaal overal even precies. Dat wil zeggen dat een test geschikter kan zijn voor de ene persoon dan voor de ander, dat de test preciezer meet voor de één dan voor de ander.
Lokale betrouwbaarheid: een te gemakkelijke of moeilijke test geeft voor de meting van θi weinig informatie: het meetinstrument en het te meten object passen niet bij elkaar. Wanneer de test goed bij de persoon past, dan is θi nauwkeuriger geschat. Er kan hiervan een informatiefunctie worden gemaakt. Hoe groter de informatiefunctie, hoe nauwkeuriger de meting.
Informatiefunctie
Er kan voor ieder afzonderlijk item en voor de gehele test een informatiefunctie worden bepaald. Deze functies hebben bij bepaalde waarden op de schaal hun maximum: daar meet de test of het item het nauwkeurigst en is het optimaal informatief. Hoe groter de waarden van de informatiefunctie, des te nauwkeuriger de meting.
Bij de Rasch en Birnbaum-modellen mag een informatiefunctie wel, omdat ze aannemen dat de schattingen van persoons- en itemparameters beschikbaar zijn voor de schatting van de informatiefunctie. Ieder item uit de test levert een onafhankelijke bijdrage tot de precisie van de meting van een persoon. Men werkt hier volgens de principes van het adaptief testen. Men meet zo nauwkeurig mogelijk door aan proefpersonen die items voor te leggen die qua moeilijkheid zoveel mogelijk gelijk zijn aan zijn of haar niveau.
Bij Mokken-modellen mag een informatiefunctie niet omdat zij niet uit gaan van schattingen van persoons- en itemparameters.
Hoe kan de item-responstheorie praktisch gebruikt worden?
Wat is een itembank en hoe kan het gebruikt worden?
Bezwaren tegen het gebruik van standaardtests:
- Weinig inhoudsvaliditeit. De standaardtest geeft in geringe mate het inhoudelijke kennis of vaardigheidsdomein weer en prestaties op verschillende tests zijn niet goed vergelijkbaar.
- Geen standaardpopulaties. Standaardtests veronderstellen standaardpopulaties, maar in de praktijk ontstaan er veel veranderingen in de populatie.
- Individualisering van het leerproces. Iedereen leert anders en in een ander tempo, daardoor is niet iedereen op een gegeven tijdstip even ver gevorderd.
- Problemen bij het meten van ontwikkelingen en veranderingen, zoals geheugeneffecten. Verandering meten kost minimaal twee meetmomenten, de tweede meting is echter géén onafhankelijke replicatie.
- Vloer- en plafondeffecten. Bijvoorbeeld een test is bij de tweede meting te gemakkelijk geworden (plafondeffect).
De problemen van standaardtests kan men verkleinen door een groot domein van items te maken die men gebruikt om nieuwe tests te maken. Men noemt dit domein een itembank. Een itembank is 'een relatief grote verzameling van gemakkelijk toegankelijke testvragen'. Relatief groot verwijs naar het feit dat er veel meer items zijn dan in een standaardtest. Met gemakkelijk toegankelijk bedoelt men dat de items gemakkelijk te selecteren en op te nemen zijn in een test.
Van der Linden (1983) noemt het samengaan van de itembank en item-responstheorie het moderne complex van theorie en toepassing van tests. Hiertegenover staat het klassieke complex van standaardtests en de klassieke testtheorie. Het samengaan van de itembank en de item-responstheorie is mogelijk vanwege de populatie-onafhankelijkheid van metingen.
Populatie-onafhankelijkheid heeft tot gevolg:
- Dat items uit een itembank op dezelfde schaal kunnen worden afgebeeld als ze voldoen aan het desbetreffende item-responsmodel. Bovendien kan men meetwaarden aan hen toekennen, dit noemt men calibreren. Gecalibreerde items van verschillende tests die hetzelfde psychologische begrip meten kan men vervolgens afbeelden op een gemeenschappelijke schaal, men noemt dit het equivaleren van itemkenmerken.
- Dat ongeacht de keuze van de items, dezelfde meetwaarde wordt geschat. De meetwaarde is populatie-onafhankelijk, maar de nauwkeurigheid of betrouwbaarheid van de schatting is dat niet (is afhankelijk van de gebruikte items).
- Dat testscores van verschillende tests met elkaar vergeleken kunnen worden. Dit noemt men ook equivalering van testscores.
Twee methoden om items in een bank op te slaan zijn:
- Items opslaan naar onderwerp of plaats in het curriculum. Nadelen: er moeten steeds weer nieuwe categorieën gemaakt worden als nieuwe items niet passen in de bestaande categorieën. Items zijn slechts per categorie oproepbaar en men kan de itemkenmerken niet onbeperkt combineren.
- Items rangschikken op basis van één of meer sleutelwoorden. Deze manier van opslaan is veel flexibeler dan de eerste en men kan er meer mee.
Behalve inhoudelijke informatie kan men in een itembank ook technische informatie opnemen, zoals informatie over moeilijkheid, discriminerend vermogen en pseudokansniveau.
Hoe kan een test geconstrueerd worden op basis van een itembank?
Metingen gebaseerd op tests uit de itembank hoeven niet beter te zijn dan die gebaseerd zijn op een standaardtest. Voor een specifieke toepassing is het vooral lastig om de geschikte items uit de itembank te selecteren. Er kunnen aan zowel aan de te selecteren items als de uiteindelijke test een aantal eisen worden gesteld, als we willen dat de test zo nauwkeurig mogelijk meet, over:
- De samenstelling van de test qua onderwerp.
- De bovengrens voor het aantal te selecteren items (in verband met de testtijd).
Het is moeilijk om uit de itembank die deelverzameling items te halen die aan alle eisen voldoen, zeker als het een grote itembank betreft.
Om een preciezer beeld van het probleem van itemselectie te krijgen, kan men een testinformatiefunctie (ook wel doelinformatiecurve genoemd) construeren. Er wordt hierbij een grensscore (aftestgrens, cesuur) bepaald: deze score bepaalt de grens tussen bijvoorbeeld wel of niet slagen voor toets. De test moet nauwkeurig rond de grensscore scoren, met andere woorden de functiewaarden moeten in en rond de grensscore groot zijn. Degene die de test construeert moet beslissen wat de minimumwaarde van de informatiefunctie in en rond de grensscore moet zijn.
De som van de iteminformatiefuncties is gelijk aan de testinformatiefunctie. Men probeert nu bij de itemselectie, de items zó te selecteren dat het oppervlak onder de doelinformatiefunctie met zo min mogelijk iteminformatiefuncties helemaal afgedekt wordt.
Wanneer tests na elkaar geconstrueerd worden treedt het probleem op dat een item geselecteerd kan zijn voor de eerste test hoewel dit item beter in de tweede test had gepast. Het item kan echter niet voor beide tests gebruikt worden.
Als er onnauwkeurigheden geconstateerd worden op een schaal dan kan op basis van een doelinformatiecurve een bestaande test veranderd worden door items uit de itembank te selecteren en aan de test toe te voegen.
Hoe kan men adaptieve tests maken met een itembank?
Adaptief testen is pas mogelijk als men beschikt over een itembank. Op basis van de opgeslagen itemparameters en de persoonsparameters van een specifiek persoon kan men items voor de persoon selecteren. Voorafgaand hieraan moet men onderzocht hebben of het antwoordgedrag van de proefpersoon op de items waaruit de adaptieve test wordt samengesteld, voldoet aan de eisen van het item-responsmodel. Hierbij kunnen problemen ontstaan vanwege de strenge eisen van de modellen en de praktische vereisten van de toepassing. Als een test valide is, moeten alle aspecten van het te meten kenmerk gedekt worden. Het probleem is echter dat item-responsmodellen veronderstellen dat alle items hetzelfde meten.
Het kiezen van items verschilt per model. Bij het Rasch-model en het Birnbaum-model zal men het item kiezen dat in moeilijkheid zo dicht mogelijk bij de geschatte persoonsparameter ligt. Bij het drie-parameter logistisch model is het meest geschikte volgende item afhankelijk van een combinatie van de drie itemkenmerken tezamen.
In plaats van steeds één voor één items te kiezen en berekeningen daarop te doen, kan men ook steeds twee of meer items aanbieden en dan pas berekeningen uitvoeren. Dit kan via:
- Two-stage testing: eerst iedereen dezelfde korte test van middelmatige moeilijkheid laten maken, en dan voor het tweede stadium tests van uiteenlopend moeilijkheidsniveau klaarleggen; welke test men krijgt hangt af van de prestatie op test 1. Is vooral handig als men respondenten aan een categorieën wil toewijzen (zoals laag, middelmatig of hoog). Door de eerste schifting door middel van een voortest wordt er in de tweede fase nauwkeuriger gemeten.
- Multi-stage testing: er zijn diverse andere varianten mogelijk tussen two-stage en adaptief testen.
Deze vormen zijn minder nauwkeurig dan de item-voor-item aanpak maar ze kunnen met weinig hulpmiddelen worden uitgevoerd.
Voordelen van adaptief testen:
- Een nauwkeurige meting per proefpersoon.
- De proefpersonen krijgen tests op hun niveau, waardoor er minder concentratieverlies of frustratie is.
- De testprocedure is geautomatiseerd en objectief. Hierdoor hebben testleiders geen kans om onbedoeld respondenten te helpen of te ontmoedigen. En scoringsfouten zijn uitgesloten.
- Efficiënter. Het heeft een korte testtijd en er is een snelle terugkoppeling van testresultaten mogelijk.
- Testprestaties verkregen door middel van verschillende tests kunnen met elkaar vergeleken worden.
Een groot nadeel bij het adaptief testen is dat het niet eenvoudig is om grote itembanken te construeren waarvan alle items testgedrag oproepen dat met behulp van één van de item-responsmodellen kan worden beschreven. Als de reacties niet helemaal passen binnen het item-responsmodel is dit geen ramp, omdat er altijd wel enig verschil bestaat tussen een model en de empirische gegevens. Het is wel belangrijk te weten hoe groot het verschil is, zodat men geen erge missers maakt bij het trekken van conclusies en het nemen van beslissingen.
Andere nadelen zijn de hoge kosten (met name bij grootschalige toepassingen) en dat het lastig is om psychologische begrippen te operationaliseren.
Wat is vraagonzuiverheid en hoe kan het onderzocht worden?
Als men mensen uit verschillende populaties met elkaar moet vergelijken, is het belangrijk zich af te vragen of personen uit de ene populatie systematisch bevoordeeld of benadeeld worden omdat de test in de verschillende populaties op verschillende wijzen functioneert. Het onderzoek hiernaar noemt men het onderzoek naar vraagonzuiverheid of vraagpartijdigheid. Bij vraagonzuiverheid ontstaan er verschillen in testscores tussen populaties. Deze verschillen moeten worden toegeschreven aan variatie in eigenschappen die men niet bedoelde te meten (onbedoelde eigenschappen).
Er is sprake van vraagonzuiverheid wanneer personen met dezelfde θ-waarde verschillende succeskansen hebben, er zijn dan verschillende item-responsfuncties van het item zijn in beide populaties. Als er sprake is van een zuiver (goed functionerend) item dan hebben personen uit verschillende populaties met dezelfde θ-waarde dezelfde kans om het item goed te beantwoorden. De item-responsfunctie van het item is in dat geval in beide groepen gelijk.
Men gaat er eigenlijk vanuit dat twee personen met dezelfde θ-waarde, afkomstig uit verschillende populaties, dezelfde succeskans op een specifiek item moeten hebben. Is dit niet het geval dan bepalen andere factoren de testprestatie.
Er zijn verschillende methoden om vraagonzuiverheid te onderzoeken:
- Itemkenmerken vergelijken. Als de item-responsfunctie in twee groepen gelijk is, dan heeft het in beide groepen dezelfde moeilijkheid, hetzelfde discriminerende vermogen en hetzelfde pseudokansniveau. Deze drie itemparameters leiden tot verschillende vraagonzuiverheid. Als alleen de moeilijkheid verschilt, betekent dit dat de succeskansen voor personen uit de ene groep altijd groter zijn dan de succeskansen voor personen uit de andere groep. Als alleen het discriminerend vermogen verschilt dan worden in beide groepen sommige personen benadeeld.
- Het oppervlak tussen de item-responsfuncties berekenen: hoe groter dit oppervlak, hoe sterker de onzuiverheid.
- Nagaan of de succeskansen per θ-waarde gelijk zijn: als ze gelijk zijn is er sprake van zuiverheid, en als ze niet gelijk zijn is er onzuiverheid.
Het geven van een inhoudelijk-psychologische verklaring van statistisch gebleken onzuiverheid is noodzakelijk. Drie onderzoeksstrategieën voor de verklaring van vraagonzuiverheid zijn:
- Inspectie van partijdige items naar opvallende kenmerken, een ad-hoc strategie. Nadeel: het kan leiden tot speculatie.
- Het leggen van een verband tussen eigenschappen van personen enerzijds en kritische kenmerken van partijdige items en vergelijking met onpartijdige items anderzijds. Nadeel: correlatie is geen causaliteit.
- Experimenteel onderzoek naar de oorzaken van vraagonzuiverheid.
Wat betekenen afwijkende scorepatronen en hoe kan het onderzocht worden?
Soms wijken individuen af van anderen uit dezelfde populatie, wat niet logisch is gezien hun θ-waarde en itemkenmerken. In dat geval bevat de θ-waarde niet alle informatie over het individu en er is extra informatie te verkrijgen uit het patroon van de itemscores. Voorbeelden van situaties waarin afwijkende scores te verwachten zijn:
- Bij studietoetsen. De item-responsmodellen voorspellen dat het percentage goede antwoorden afneemt naarmate de items moeilijker worden. Maar door gissen kan iemand toch hoog scoren en door een slechte voorbereiding kan iemand een gemakkelijker item missen. Hierdoor krijgt men een scorepatroon waarin goede en foute antwoorden gelijkmatig over gemakkelijke en moeilijke items verdeeld zijn. Ook door bedrog en fraude (afkijken en spieken) kan men een afwijkend patroon krijgen; opvallend veel goede antwoorden bij moeilijke items ten opzichte van de makkelijke items.
- Het onderzoek van Van der Flier in de populatie van Tanzaniaanse en Keniaanse leerlingen met twee verbale redeneertests. Na correctie van de afwijkingen bleken de Keniaanse kinderen betere testscores te hebben.
- Onderzoek naar deelvaardigheden die noodzakelijk zijn voor het oplossen van een probleem, maar die door de leerling onvoldoende worden beheerst. Door het de herkenbaarheid van het afwijkende patroon kunnen we de oorzaak van fouten opsporen.
- Een proefpersoon die over goede vaardigheden beschikt maar weinig ervaring heeft met het invullen van antwoorden op een formulier voor automatische scoring, waardoor de antwoorden op de verkeerde plek ingevuld worden (voorbeeld van Hulin).
De verschillende methoden die zijn voorgesteld om afwijkende scorepatronen te onderzoeken gaan uit van het principe dat als men iemands meetwaarde en de itemkenmerken van alle items in de test kent, men de kans op een specifieke score op een gegeven item kan berekenen. Vervolgens kan men de kans op een gevonden patroon van itemscores berekenen en kan men bepalen of de gevonden patronen te verwachten zijn.
Persoon-responsfunctie
De persoon-responsfunctie is het spiegelbeeld van de item-responsfunctie: het geeft de succeskans van een persoon met een gegeven θ-waarde als functie van de moeilijkheid van items. Vier voorbeelden van persoon-responsfuncties:
- Monotoon dalend: als de item-responsfuncties van de k items elkaar niet snijden (Rasch, dubbele monotonie) neemt de persoon-responsfunctie monotoon af als de items moeilijker worden. De succeskans neemt af en kan niet toenemen.
- Horizontaal over de hele linie: de succeskans is niet afhankelijk van de moeilijkheid, blijkbaar heeft de persoon zich niet goed voorbereid.
- In het begin relatief laag: de gemakkelijke items waren relatief moeilijk, de persoon had in het begin mogelijk last van testangst.
- Aan het eind relatief hoog: na een aanvankelijke daling stijgt de functie bij moeilijke items. Dat kan duiden op bedrog of de persoon kende de moeilijke items al (item exposure).
Onderzoek naar vraagonzuiverheid en onderzoek naar afwijkende scorepatronen gaan hand in hand. Als het item onzuiver is, is de persoon afwijkend. Het is raadzaam onzuivere items te verwijderen en te vervangen door zuivere items. Afwijkende personen moeten dan herwaardeerd worden met betrekking tot hun prestatie. Net als bij onderzoek naar vraagonzuiverheid moeten statistische afwijkingen inhoudelijk-psychologisch worden verklaard, maar het onderzoek richt zich in dit geval op personen in plaats van op items. Verklaringen kunnen hier ook variëren van speculatie tot een gecontroleerd experiment.
Welke speciale onderwerpen zijn ook belangrijk?
Hoe werkt de item-responstheorie voor polytoom gescoorde items?
In persoonlijkheidsvragenlijsten worden vaak rating-scale items gebruikt, met drie of meer geordende antwoordcategorieën; een hogere score betekent een hogere positie op de schaal van de eigenschap. Item-responsmodellen voor dergelijke scores bepalen een responsfunctie voor elke score die op een item mogelijk is. De kans op een specifieke itemscore wordt voor iedere score apart gemodelleerd.
De kans op de laagste score is groot voor respondenten met lage θ-waarden en neemt af als de θ-waarde toeneemt. Er is voor elke score een locatie op de θ-schaal waar de kans op die score het hoogst is. Elke itemscore heeft bij elke θ-waarde een positieve kans, maar die kansen verschillen, zodat per θ-waarde meestal één score het meest waarschijnlijk is.
Item-responsmodellen voor polytome functies zijn veel ingewikkelder, er moet ook bepaald worden of een model past bij de gegevens en het schatten van de itemkenmerken is lastiger.
Hoe verhouden de klassieke testtheorie en de item-responstheorie zich tot elkaar?
Sommige auteurs zien klassieke testtheorie en item-responstheorie als elkaars tegenovergestelde. Andere auteurs menen dat ze elkaar aanvullen.
Voordelen van de item-responstheorie ten opzichte van de klassieke testtheorie zijn:
- De item-responsmodellen kunnen als nulhypothese op de testgegevens worden getoetst: past een model bij de gegevens, dan wordt het model niet verworpen en gelden de eigenschappen van het model voor de gegevens. Bij de klassieke theorie kan het passen van het model niet goed worden onderzocht.
- Personen worden populatie-onafhankelijk gemeten waardoor testprestaties van verschillende tests voor dezelfde eigenschap op dezelfde schaal afgebeeld kunnen worden. In de klassieke theorie zijn de metingen populatie-afhankelijk.
- De betrouwbaarheid van de meting varieert over de schaal, zo kan men erachter komen dat een test voor de ene persoon geschikter is dan voor de ander. In de klassieke theorie wordt de betrouwbaarheid op de hele schaal even groot verondersteld.
De praktische voordelen van de klassieke testtheorie:
- Het is eenvoudiger en daardoor beter toegankelijk.
- Het is maar de vraag of de validiteit van de test zoveel minder is.
- De klassieke testtheorie ‘werkt’ bij testconstructie bijna altijd; item-restcorrelaties kunnen worden gebruikt om eventueel items weg te laten en zo de rest betrouwbaarder te maken.
- De toenemende betrouwbaarheid bij een toenemend aantal items is erg gunstig.
De strenge item-responsmodellen verwerpen soms veel items, maar de vooronderstellingen van de klassieke testtheorie kunnen vaak niet empirisch gecontroleerd worden; de item-responstheorie is wel controleerbaar en dus kwetsbaarder.
In Nederland wordt de klassieke testtheorie nog het meest gebruikt, behalve bij de grootschalige CITO. In de VS wordt de item-responstheorie vaker gebruikt (ook voor psychologisch meten).
Wat is de rol van de item-responstheorie in de psychologische theorievorming?
Is statistisch gebleken dat er sprake is dan vraagonzuiverheid of afwijkendheid van scores, dan is er een psychologische verklaring nodig om het te begrijpen. In een bepaalde benadering binnen de psychometrie zet men niet alleen testprestaties om in meetwaarden, maar wordt er ook naar een psychologische verklaring gezocht voor de totstandkoming van de testprestatie: het cognitieve oplossingsproces. Het zijn de ‘psychologische’ onderwerpen uit de item-responstheorie (vraagonzuiverheid, afwijkendheid, cognitieve oplossingsproces) die acceptatie van deze theorie zullen bevorderen.
Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>
Concept of JoHo WorldSupporter
JoHo WorldSupporter mission and vision:
- JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.
JoHo concept:
- As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
- JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.
Join JoHo WorldSupporter!
for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for
Work for JoHo WorldSupporter?
Volunteering: WorldSupporter moderators and Summary Supporters
Volunteering: Share your summaries or study notes
Student jobs: Part-time work as study assistant in Leiden
- Insurance for emigrants, expats and living abroad: international insurance for expats and emigrants
- Insurance for activities abroad: Backpacking Travel abroad Intern abroad Study abroad Volunteer abroad Work abroad
- Insurance: ACS Globe Traveller Caremed Insurances Expatriate Travel Insurance IMG’s GlobeHopper World Nomads Insurance SafetyWing Insurance JoHo Special ISIS verzekering NL/BE Working Nomad verzekering NL/BE More about Insurance for abroad
Search only via club, country, goal, study, topic or sector
Select any filter and click on Search to see results








