Hoe worden tests afgenomen en verwerkt? - Chapter 5
Hoe worden tests afgenomen?
Bij het afnemen van tests zijn er veel factoren waar rekening mee gehouden dient te worden, zoals:
- De objectieve testsituatie.
- Gedrag van de proefpersonen.
- Gedrag van de proefleider.
Hoe kunnen de antwoorden gescoord worden?
Er wordt onderscheid gemaakt tussen de scoring van open vragen en van meerkeuze-items. Ook wordt er ingegaan op het gebruik van de toevalscorrectie.
De objectieve testsituatie
Hierbij is standaardisatie belangrijk. Dit betekent dat de onderzochten in maximaal gelijke omstandigheden moeten worden getest. Dit geldt zowel voor groepstests als voor individuele tests. Voorwaarden hiervoor zijn:
- Standaardisatie van testcondities, dat wil zeggen dat de proefleider zich zo goed mogelijk aan de instructies moet houden: de proefpersonen worden in gelijke omstandigheden getest.
- Omgevingsinvloeden moeten zoveel mogelijk voorkomen worden.
- Geen storingen tijdens de testafname.
- Een goede controle zodat afkijken en spieken niet mogelijk zijn.
Bovenstaande punten spelen vooral een rol in een groepstestsituatie en bij snelheidstests.
Gedrag van de proefpersonen
Sommigen zijn meer gemotiveerd en coöperatief, terwijl anderen dat niet zijn. Ook kan een proefpersoon moe zijn waardoor hij of zij de een slechtere prestatie levert dan normaal. Standaardisatie van de proefpersonen is moeilijker te realiseren dan standaardisatie van de testsituatie. Er zijn een aantal factoren die men wel onder controle kan houden, namelijk:
- Ervoor zorgen dat de onderzochte fit is.
- Nagaan of er geen sprake is (geweest) van een sterke emotionele opwinding.
- Door duidelijke extra instructie wordt de opdracht vaak beter begrepen.
- Er voor zorgen dat de proefpersonen niet van tevoren weten wat de inhoud van de test is.
Naast deze factoren zijn er ook andere factoren die van invloed kunnen zijn op de testprestatie, zoals voorgaande ervaringen of trainingen waardoor de onderzochte vertrouwd is met testen (‘test-wiseness’). Ook verwachtingen over moeilijkheid, eigen resultaten en consequenties hebben invloed. Deze hangen sterk samen met de sociaal-economische klasse van de onderzochte. De reactie van de proefleider op het slagen of falen van de proefpersoon heeft ook invloed, een adequate houding van de onderzoeker is dus vereist.
Een ander punt wat invloed heeft is angst voor de gevolgen van een slechte testprestatie (testangst en examenangst). Hermans (1968) omschrijft twee soorten van angst die sterk met elkaar samenhangen: positieve faalangst (een geringe mate van angst heeft een positieve invloed op de prestatie) en negatieve faalangst (een sterke mate van angst heeft een negatieve invloed op de prestatie).
Gedrag van de proefleider
Hier kan er verschil zijn in training, ervaring, inzicht, etc. Voor een proefleider is het van belang dat hij of zij de proefpersonen zo objectief mogelijk benadert. Met name bij individuele tests is er een wisselwerking tussen de testleider en de proefpersoon. Dat kan eenvoudiger gecontroleerd worden dan het gedrag van de proefpersoon. Belangrijk daarbij is:
- De testleider moet voldoende algemene ervaring hebben met testen en hij moet de test ook goed beheersen.
- Hij neemt beslissingen met goed psychologisch inzicht.
- Hij moet geen vooroordelen of sympathieën hebben, hij moet zichzelf dwingen tot strikte controle en zelfcorrectie en voorkomen dat hij ‘ideaaltypen’ wil ontdekken (bijvoorbeeld de ‘echte’ gevoelsarme psychopaat).
Hoe men met deze problemen om kan gaan, hangt af van het belang van het onderzoek. Men kan elementen van de testsituatie in de evaluatie verwerken (als het doel is het genereren van hypothesen of doelen voor verder onderzoek). Men kan ook ‘doen alsof’ de invloeden genegeerd kunnen worden. Eventueel kan men bij de interpretatie van de objectieve scores rekening houden met ongewenste invloeden.
Bij een dergelijke objectieve benadering offeren we iets op van het unieke van de persoon en de situatie, maar we reduceren daarbij de onbetrouwbaarheid, waardoor de vergelijkbaarheid toeneemt.
Hoe kunnen de antwoorden gescoord worden?
Er wordt onderscheid gemaakt tussen de scoring van open vragen en van meerkeuze-items. Ook wordt er ingegaan op het gebruik van de toevalscorrectie.
Hoe kunnen reacties op items met een open-vraagvorm gescoord worden?
Reacties op open vraag kunnen verbaal en non-verbaal zijn. Een voorbeeld van een non-verbaal antwoord is dat aan kinderen wordt gevraagd om door een doolhof naar het eindpunt te komen (test uit de RAKIT). Bij deze vorm is er sprake van een grote subjectiviteit en lage interbeoordelaarsbetrouwbaarheid. Dit kan men ondervangen met een zo goed mogelijk coderingssysteem dat ten eerste volledig en ten tweede duidelijk en ondubbelzinnig is. Bijvoorbeeld en checklist, een lijst waarop wordt bijgehouden welke eigenschappen wel of niet aanwezig zijn.
Er zijn echter ook vrije-antwoordentests met een grote betrouwbaarheid, zoals de TAT. Het is niet zo dat een grote interbeoordelaarsovereenstemming automatisch betekent dat er sprake is van een betere validiteit; overeenstemming is wel noodzakelijk, maar niet voldoende voorwaarde voor validiteit. De checklist is te beschouwen als een ‘test’ en moet aan dezelfde voorwaarden voldoen.
Hoe kunnen reacties op geprecodeerde items gescoord worden?
Belangrijk hier zijn de accuraatheid (zo goed mogelijk) en de efficiëntie (zo snel en goedkoop mogelijk) bij de scoring. Bij de keuze-antwoordenvorm kent men drie manieren van scoring:
Handscoringsmethode. Correctoren tellen het aantal goede en foute antwoorden en vergelijken dat met de correct ingevulde sleutel. Het nadeel is dat het veel tijd kost en er worden veel fouten gemaakt.
Zelfscoringsmethode. Is sneller en efficiënter dan de eerste, maar het materiaal is wel duurder. Hierbij wordt het antwoordformulier onder een tweede vel geplaatst, waarop een aantal cirkeltjes staan die precies vallen onder plaatsten waar het goede antwoord op het antwoordformulier moet worden aangestreept. Zo wordt de score direct op het doordrukformulier geregistreerd.
Machinescoring. Dit is de snelste methode van verwerking, waarbij een antwoord op een computer gegeven wordt. De computer berekent automatisch of het antwoord goed of fout is en kan een terugkoppeling geven. De gegevens kunnen meteen worden toegevoegd aan het gegevensbestand die naast informatie over de onderzochte ook informatie kan geven over de test zelf en de onderzochte groep, zoals verdelingen, spreidingen, rangordes etc.
Wat is de toevalscorrectie en hoe kan het uitgevoerd worden?
Toevalscorrectie is alleen nodig bij de keuze-antwoordenvorm en ter ondervanging van het bezwaar dat de onderzochte slechts door te raden hoog scoort. Het aantal goede antwoorden door kennis (XC) kan berekend worden door van het totale aantal goed (X) het deel af te trekken dat door gissen goed was: het aantal fout (k-X) gedeeld door A-1. De formule voor toevalscorrectie is:
(XC = gecorrigeerde score, X = aantal goed, k = aantal items, k-X = aantal fout, A = aantal antwoordmogelijkheden).
De correctieformule bij niet-ingevulde vragen berust op hetzelfde idee. Naar verwachting zou bij blind gissen een deel van die items goed zijn, dat wordt opgeteld bij het aantal ‘goed’:
(Xf = aantal 'fout', k-X-Xf = aantal niet-ingevulde items).
Er zijn vier bezwaren tegen deze correctieformules:
- De formules zien eruit alsof we precies weten wat correct beantwoord is, maar in het echt is er geen scherpe lijn tussen zeker weten en puur gissen. Door partiële kennis kan de werkelijke giskans hoger zijn dan de blinde giskans (ondercorrectie door de formule), of bij een erg verleidelijke afleider is de giskans juist kleiner (overcorrectie). Eigenlijk gelden de formules alleen voor iemand die niets van de stof af weet.
- Iemand kan ook een foutief antwoord geven door verkeerde informatie of verkeerd inzicht. Het is dan onrechtvaardig dat er via de formule door deze fout punten van de goede antwoorden afgetrokken worden.
- XC heeft een grotere variantie dan X: de gecorrigeerde score (XC), die gebaseerd is op tweekeuze-items, heeft een 4x zo grote variantie als de ongecorrigeerde score (X) en dus een 2x zo grote standaarddeviatie. Dat heeft een ongewenst effect op andere berekeningen; als men de gecorrigeerde testscore optelt bij andere testscores (bijvoorbeeld bij intelligentietests) krijgt de test met de gecorrigeerde scores een 2x zo groot gewicht, zonder dat dit te rechtvaardigen is.
- Bij een lineaire relatie tussen XC en X geldt dat de correlatie tussen XC en X gelijk is aan 1: dus r(XC, X) = 1. Dit gegeven heeft drie belangrijke consequenties:
- De ordening van personen en de afstand tussen personen volgens XC is dezelfde als die volgens X; de giscorrectie heeft daarvoor geen gevolgen. Maar sommige personen kunnen daardoor wel onder de aftestgrens vallen, terwijl dat op basis van de ongecorrigeerde testscore niet was gebeurd. Voor het individu kan de giscorrectie dus grote gevolgen hebben. Een oplossing daarvoor is het aanpassen van de aftestgrens.
- De correlatie van de ongecorrigeerde testscore (X) en een andere testscore (Y) is gelijk aan de correlatie tussen XC en Y. Dat impliceert dat men met beide scores evengoed criteriumscore Y kan voorspellen; de gecorrigeerde score is hiervoor dus net zo geschikt als de ongecorrigeerde score.
- De betrouwbaarheid van X en XC is gelijk. Maar dat geldt niet voor formule, omdat in deze formule de relatie tussen XC en X niet lineair is.
Conclusie: in het algemeen wordt geadviseerd correctieformules niet te gebruiken. Bij de keuze-antwoordenvorm is het beter het aantal goede antwoorden te tellen. De instructie aan de respondenten moet zijn dat men beter alle antwoorden kan invullen, ook als ze het niet weten, omdat gissen rendabeler is dan niets invullen. Een positief bijeffect hiervan is dat door deze instructie een uniforme antwoordstrategie wordt bevorderd; verschillen tussen scores komen dan niet vanwege het verschil in wel of niet durven gissen. En als iedereen deze strategie volgt, is de giscorrectie op individueel niveau overbodig. Wel moet de aftestgrens aangepast worden. Voorbeeld: k = 32 en A = 4: iemand kan door gissen 8 vragen goed hebben, dus dit moet als ondergrens genomen worden. Bij een gewenst kennispercentage van 60% moet de aftestgrens zijn: 8 + 0.6(32 – 8) = 22.4 (in plaats van 19.2).
De Groot en Van Nearssens bespraken alternatieve scoringsprocedures: als bij alle respondenten de optimale antwoordstrategie duidelijk is (gissen als je het niet weet), dan neemt de betrouwbaarheid en validiteit van de gecorrigeerde testscore niet significant toe boven dat van de ongecorrigeerde testscore. De beste scoringsprocedure in de praktijk is dus simpelweg het tellen van het aantal goede antwoorden.
Moeten itemscores gewogen worden?
Een cruciale vraag is of alle vragen even zwaar wegen. Uit onderzoek blijkt dat weging niet nodig is omdat het ten eerste bijzonder extra veel werk vergt en ten tweede blijkt uit correlatie-onderzoek een hoge correlatie tussen gewogen- en niet gewogen totaalscores. Het is dus beter om langere testen te maken, waardoor de betrouwbaarheid toeneemt, en goed na te denken over de inhoud van de items, waardoor de validiteit toeneemt.
Welke invloed heeft het gebruik van de computer gehad op het testen?
Veel tests kunnen ook per computer afgenomen worden (zoals de NEO-persoonlijkheidsvragenlijst). De onderzochte krijgt op het scherm een stimulus of item te zien en moet reageren via het toetsenbord, waarna de volgende verschijnt. De respons wordt direct gecodeerd en na afloop volgt de testscore plus eventuele andere informatie (zoals scores op de deeltests of normen). Er wordt onderscheid gemaakt tussen de technologische en de wetenschappelijke bijdrage van de computer aan de testpraktijk.
- Technologische bijdragen. Afneming, opslag en administratie van items, administratie van testgegevens en psychologische rapportage.
- Wetenschappelijke bijdragen. Inhoudelijke psychologische veranderingen en psychometrische veranderingen door het gebruik van de computer.
Welke technologische bijdragen en veranderingen had de computer op het testen?
Administratieve veranderingen. Het gegevensbestand is door de computer geautomatiseerd en de terugkoppeling van de resultaten gebeurt snel. Tevens is een test in de computer eenvoudig te veranderen.
De itembank. In een itembank kan men een grote verzameling items aanleggen en opslaan, dat is voornamelijk nuttig in het onderwijs (zoals een tentamenbank). Behalve het item zelf worden er ook andere gegevens opgeslagen, zoals psychometrische gegevens over de moeilijkheid, de kwaliteit van de afleiders, administratieve gegevens, het onderwerp waar het item over gaat en of het gaat om kennis of inzicht.
Het geautomatiseerde systeem van Nitko en Hsu (1984) voor leerkrachten op scholen. Het systeem bestaat uit drie componenten: (1) een bestand met gegevens van leerlingen en van schoolklassen, (2) een onderdeel van itemanalyse en (3) de mogelijkheid om zelf een itembank te maken en de vorige te veranderen. De drie onderdelen kunnen met elkaar communiceren.
On-line testing van Baker. Dat is een test waarbij de leerling kan zelf bepalen of hij de stof beheerst en de computer vraagt om een toets. Het nadeel hiervan is dat er surveillance nodig is om te voorkomen dat items uitlekken of dat iemand anders de toets maakt.
Een andere toepassing in het onderwijs is het diagnostisch toetsen (McArthur & Choppin, 1984). Deze test ontdekt deficiënties in deelvaardigheden, waar aan gewerkt zou kunnen worden (bijvoorbeeld wiskundige problemen waarbij diverse vaardigheden nodig zijn om een probleem op te kunnen lossen).
Een andere technologische verandering is de vorm van de aangeboden items. Het kan nu via bewegende beelden op de computer en men kan kijken hoe de proefpersoon daar op reageert.
Welke wetenschappelijke bijdragen en veranderingen had de computer op het testen?
Het meten van intelligentiecomponenten. Hunt en Pell (1985) menen dat de computer ingezet kan worden bij de meting van intelligentiecomponenten zoals individuele verschillen in ruimtelijk-visueel redeneren, geheugen en aandacht en ook bij individuele verschillen in leerpotentieel.
Een probleem door het gebruik van computers bij het testen van personen kan zijn dat men door testangst en door ervaring met computers verschillen krijgt in testprestatie. Dit is te ondervangen door veel te oefenen met computers. Toch blijft er een verschil bestaan, vergelijkbaar met verschillen in taalbeheersing.
Uit onderzoeken naar de verschillen in testprestatie bij het testen met computers en met de conventionele methoden blijkt dat deze verschillen niet groot zijn. Toch is het raadzaam de normen van conventionele tests niet zomaar toe te passen bij computergestuurde tests.
Er zijn een aantal verschillen tussen conventionele en computergestuurde tests. Het is onmogelijk om bij computergestuurde tests items over te slaan zonder een toets in te drukken (‘passive omitting’) hierdoor ontstaat er een andere verdeling van itemscores dan bij conventionele tests. Ook is er een verschil in presentatie en vormgeving. Deze factoren lijken weinig invloed te hebben op de testprestaties.
Wat is adaptief testen?
Adaptief testen is testen op maat. Iedere respondent krijgt een test op zijn of haar niveau. Dat levert meer informatie op over het niveau en de test zal niet te moeilijk of te makkelijk zijn, waardoor het minder frustrerend is. Het idee berust op de item-responstheorie. Als de moeilijkheid van het item en het niveau van de persoon samenvallen, is de meting het meest nauwkeurig; dan is de subjectieve kans op een positief antwoord 0.5 (middelmatige moeilijkheid: de kans op een goed antwoord is even groot als de kans op een fout antwoord).
Het afstemmen van items op het niveau van de persoon gaat als volgt: de respondent krijgt één of meerdere items die in de populatie een gemiddelde moeilijkheid hebben, op basis van zijn itemscores maakt de computer een eerste schatting van de meetwaarde van die persoon. Het volgende item wordt zo gekozen dat de moeilijkheid samenvalt met deze meetwaarde. Op basis daarvan en van de eerste schatting wordt een nieuwe schatting gemaakt (met een iets grotere nauwkeurigheid). Op basis van die schatting wordt het volgende items gekozen. Dit gaat door tot er een meetwaarde geschat is die een goede nauwkeurigheid heeft, dan is de testsessie klaar. Deze stapsgewijze bepaling van iemands meetwaarde heeft een aantal kenmerken:
- De schatting van iemands meetwaarde komt met iedere stap dichter bij de gezochte waarde, en de moeilijkheid en meetwaarde komen steeds meer overeen.
- De schatting is nauwkeuriger als er meer items zijn gepresenteerd – als men lang genoeg door gaat, is het zelfs perfect (praktisch niet haalbaar, maar dat hoeft geen probleem te zijn).
Om achteraf de scores van verschillende respondenten te kunnen vergelijken is een itembank nodig van ten minste 150 à 200 items. Metingen binnen de item-responstheorie zijn onafhankelijk van het moeilijkheidsniveau van de test (ze kunnen daarvoor gecorrigeerd worden). De voorwaarde is dat de itembank helemaal moet voldoen aan de eisen van de item-responstheorie.
De klassieke standaardtest is een slecht meetinstrument voor personen met extreme waarden; ze worden onnauwkeurig getest. Terwijl bij adaptief testen iemand wel items krijgt op zijn of haar niveau. Volgens Weiss (1985) meet een adaptieve test even nauwkeurig als een standaardtest als het ongeveer een half maal de lengte van een standaardtest heeft (vuistregel).
Drie toepassingen van adaptief testen binnen de onderwijsevaluatie zijn (1) het bepalen of iemand geslaagd is, (2) of iemands prestatie binnen de grenzen van een specifiek interval ligt en (3) of iemand in een specifiek leerstofgebied voortgang heeft geboekt (Weiss & Kingsburry, 1984).
Op welke manieren kunnen de scores bewerkt worden en wat zijn normen?
Ruwe score
De gewone basisscore van iemand noemen we de ruwe score, dat is de som van de scores X op alle k items g
Bewerkte score
De ruwe score heeft op zichzelf weinig betekenis, maar moet bewerkt worden om betekenis te krijgen. Er zijn drie soorten bewerkte scores:
- Gebaseerd op een vergelijking met een absolute standaard.
- Gebaseerd op een deling (door bijvoorbeeld leeftijd of schoolklas): ervan onafhankelijk gemaakt.
- Gebaseerd op de relatieve positie in een referentiegroep: genormeerde scores, waarvan er twee soorten zijn, namelijk (1) gebaseerd op een rangorde van de ruwe scores, zoals percentielen, en (2) gebaseerd op het gemiddelde en de spreiding van de ruwe scores, zoals standaardscores.
Normen
Niet bij elke bewerkte score is er sprake van een norm. Soms kunnen bewerkte scores afhankelijk zijn van de prestaties van anderen, zonder dat er sprake is van een testnorm, bijvoorbeeld in een klas. Een norm is een referentiekader voor de evaluatie van de ruwe scores, gebaseerd op de verdeling in de populatie. Het kader wordt geschat op basis van een representatieve steekproef. Uit deze definitie blijkt dat:
- Normen afhankelijk zijn van de normeringssteekproef die gebruikt is.
- Door normering hebben toevalligheden van de groep geen invloed op de beoordeling van het individu.
- De prestatie van het individu kan los van de groep beoordeeld worden door normen (bijvoorbeeld de CITO geeft aan waar iemand staat in de populatie, niet in zijn klas).
Het gebruik en de berekening van normen is niet noodzakelijk. Men kan soms ook een eenvoudigere vorm van bewerkte scores gebruiken, zoals rangschikking of het percentage goede antwoorden. Dit is handig bij het kiezen uit een groep sollicitanten. Bovendien kan men soms ruwe scores gebruiken. Met name als het gaat om het verband tussen test- en criteriumscores zijn er geen bewerkte scores nodig.
Er is een vloeiende overgang van de vergelijking binnen een onderzochte groep naar het gebruik van normen. Als de onderzochte groep groter wordt en meer op de populatie lijkt, lijkt het meer op vergelijken met een norm. De twee belangrijke punten bij het gebruik van normen bij het normerings- of testonderzoek zijn (1) dat de kenmerken van de onderzochte groep vermeldt moeten worden en (2) dat er rekening gehouden moet worden met veranderingen in de populatie, met een mogelijk normherziening als gevolg. Dat laatste geldt ook voor vertaalde testen: meestal verliezen normen bij een testvertaling hun waarde.
Hoe kunnen de testprestatie vergeleken worden met een absolute standaard?
De prestatie van een persoon wordt in de eerste instantie niet vergeleken met de prestatie van anderen, maar met een absolute maatstaf die gebaseerd is op psychologische of onderwijskundige analyse van kennis, inzicht of vaardigheden. Men noemt deze vorm van meten ook wel de 'criterion-reference measurement', het absoluut meten. Daartegenover staat de 'norm-reference measurement', het normatief meten.
Het is niet zo goed bruikbaar bij het vergelijken van proefpersonen, zoals binnen de psychologie veel gebeurt. Vergelijkingen met een absolute standaard komt met name voor binnen onderwijskunde. Daar is men meer bezig met het beoordelen in welke mate welke leerlingen een bepaald doel hebben bereikt (hoeveel kennis en vaardigheid ze hebben verworven). Dat is onafhankelijk van hoe de medeleerlingen gepresteerd hebben.
Absoluut meten is arbitrair en discutabel als men niet eerst de doelen van het proces dat men bij de onderzochte wil evalueren geanalyseerd heeft, en of dat wel op een betrouwbare manier getest kan worden.
Wat zijn verhoudingsnormen en hoe kan dat toegepast worden?
De testscores worden gedeeld door een andere variabele en als zodanig onafhankelijk gemaakt van de betreffende variabele, bijvoorbeeld IQ is de Mentale Leeftijd gedeeld door de Chronologische Leeftijd vermenigvuldigd met 100.
De mentale leeftijd wordt bepaald door een test, een kind moet opdrachten maken in oplopende moeilijkheid. In theorie maakt een kind tot aan een bepaalde mentale leeftijd de opdrachten goed en daarna lukt het niet meer. Maar in de praktijk begint een kind steeds meer fouten te maken of slaat een lastige vraag over. De laatste leeftijd waarop in de test nog geen fouten worden gemaakt, noemt men de basale leeftijd.
Hierbij maken we wel een aantal kritische kanttekeningen:
De mentale leeftijd is een testscore en geen leeftijdsmaat. De chronologische leeftijd is eigenlijk ook geen leeftijdsscore maar de verwachte testprestatie van iemand op die leeftijd. Het gaat dus om de vergelijking met de prestaties van anderen. Men gaat er bovendien vanuit dat er boven de vijftien jaar geen verschillen meer zijn tussen de verschillende leeftijden.
Het IQ-begrip is geen constante factor. Want het blijkt dat:
Sommige vragen afhankelijk zijn van zowel vorming en scholing als van intelligentie.
Bij sommige kinderen de lichamelijke en fysiologische groei (die invloed heeft op de psychologische groei) niet parallel loopt aan de gemiddelde intelligentiegroei.
Leermogelijkheden, motivatie en emotionele bereidheid invloed hebben op intelligentie en op de verschillen tussen leeftijdsgenoten.
Normaal blijft men bij het berekenen van het IQ boven de hoogste leeftijd waarop de test nog onderscheidt, steeds delen door de topleeftijd (meestal 15, 16 of 17 jaar). Maar op hogere leeftijd nemen intellectuele prestaties af, en er is geen correctie daarvoor.
Er is geen sprake van een evenredige toename van spreiding bij hogere leeftijden. Een achterstand van een jaar op zesjarige leeftijd is twee keer zo erg als een jaar achterstand op twaalfjarige leeftijd.
Conclusie: Ondanks deze bezwaren heeft intelligentie wel waarde als ontwikkelingsbegrip, via intelligentie kan men vaststellen of een kind voor of achter is op leeftijdsgenoten.
Wat zijn vergelijking en normen gebaseerd op een rangorde?
Rangorde
De eenvoudigste manier om de testprestaties tussen individuen te analyseren, is door middel van rangordening. Een bepaalde score voor een bepaalde positie wordt gebaseerd op de groep waar men in zit. Er is geen sprake van een norm. Het nadeel is dat het niets betekent buiten de bewuste groep.
Percentielscores en percentiele normen
Percentielscores zijn zeer populair en kennis van groepsgrootte is niet vereist. Er zijn 99 punten (percentielen) die een scoreverdeling opdelen in 100 groepen van gelijke grootte, elk 1% van de waarneming. Bijvoorbeeld iemand met een ruwe score waarbij het de percentiel score 0.87 hoort, heeft een percentiel rang van 87, dat wil zeggen dat 87% van de testscores van de normgroep daarbeneden ligt. De bekendste percentielen zijn: P50 (mediaan), P25 (eerste kwartiel, Q1) en P75 (derde kwartiel, Q3).
Een probleem is dat bij een relatief grote groep van onderzochten met dezelfde ruwe score er weinig differentiatie mogelijk is in de percentielscores. Dit kan men oplossen via lineaire interpolatie: bijvoorbeeld 21% van de getesten heeft een ruwe score van 66 of lager en 27% heeft een ruwe score van 67 of lager. Dan heeft 6% een ruwe score gelijk aan 67. De percentielscore die bij deze ruwe score hoort is dan als volgt te berekenen: 21 + 0.5 (27-21) = 24.
Door scores aan te duiden in percentielscores is men niet meer afhankelijk van de absolute groepsgrootte maar wel van niveau, spreiding en toevallige kenmerken van de groep. Percentiele normen daarentegen zijn niet afhankelijk van groepskenmerken. De voordelen percentiele normen zijn:
- Denvoudig en snel te berekenen.
- Gemakkelijk toe te passen.
- Inzichtelijk en ook te begrijpen voor niet-deskundigen.
Een nadeel van percentielscores is dat het gaat om een ordinale schaal waardoor er (1) geen deelbewerkingen mogelijk zijn (er mogen met percentielscores geen gemiddelden en varianties berekend worden) en (2) het zinloos is de frequentieverdelingen van percentiele en ruwe scores te vergelijken (alle frequentieverdelingen van percentielscores zijn gelijk en rechthoekig van vorm).
Percentielen verdelen het aantal scores in 100 groepen, decielen verdelen de scores in 10 gelijke klassen en vigintielen: verdelen de scores in 20 gelijke klassen
Rangordescores en -normen zijn daar bruikbaar waar men snel een beeld wil hebben van de relatieve positie van de onderzochte in een groep of in de populatie. Ze hebben teveel tekortkomingen voor wetenschappelijk onderzoek.
Wat zijn vergelijking en normen gebaseerd op gemiddelde en spreiding?
Standaardscores en -normen hebben niet dezelfde bezwaren als percentiele normen, namelijk de ordinale schaal en de onvergelijkbaarheid. Er is een verschil tussen standaardscores (ruwe scores onderverdeeld in standaardscore-eenheden) en standaardnormen (bij een representatie van een populatie).
Standaardscores of z-scores
Een standaardscore geeft aan hoeveel standaardafwijkingen (is een spreidingsmaat) een score boven of onder het gemiddelde ligt. Alle oorspronkelijke scores worden uitgedrukt in afwijkingen van het gemiddelde (de teller van de formule). Deze afwijkingen worden uitgedrukt in eenheden van de oorspronkelijke standaarddeviatie; door ze te delen door deze standaarddeviatie (de noemer van de formule):
(z = standaardscore, X = ruwe score, X = gemiddelde, SX = standaarddeviatie).
Van de ruwe score (X) wordt het gemiddelde (X̄) afgetrokken: de afwijkingsscore. De afwijkingsscore wordt gedeeld door de standaarddeviatie van X (SX). Er blijft dan een positief of negatief getal over:
- Negatieve standaardscores: ruwe scores die onder het gemiddelde liggen.
- Positieve standaardscores: ruwe scores die boven het gemiddelde liggen.
Omdat men soms kleine of negatieve getallen lastig vindt, kun je met lineaire transformatie de scores transformeren zodat het gemiddelde op 100 of 50 ligt en de spreiding op 10 of 20 (als gevolg van lineaire transformatie verandert alleen het gemiddelde en/of de standaarddeviatie en niet de onderlinge afstand tussen de scores of de vorm van de scoreverdeling). Standaardscores behouden dezelfde verdelingskenmerken als ruwe scores (behalve dus het gemiddelde en de standaarddeviatie).
Genormaliseerde standaardscores
Genormaliseerde standaardscores worden verkregen uit niet-lineaire transformaties die de verdeling van X dusdanig vervormen dat er wel een normaalverdeling ontstaat: sommige score-eenheden worden uitgerekt, anderen ineengedrukt. Zo ontstaat een verdeling met percentages die afgeleid zijn uit de eigenschappen van een normaalverdeling:
34% van de groep valt tussen X̄ en (X̄ + 1SX) en tussen X̄ en (X̄ – 1SX) (binnen 1 standaarddeviatie).
13.5% valt tussen (X̄ + 1SX) en (X̄ + 2SX) en tussen (X̄ – 1SX) en (X̄ – 2SX) (tussen 1 en 2 standaarddeviaties).
2.5 % valt tussen (X̄ + 2SX) en (X̄ + 3SX) en tussen (X̄ – 2SX) en (X̄ – 3SX) (tussen 2 en 3 standaarddeviaties).
Constructie: uitzoeken welke ruwe scores de percentages aangeven die horen bij de standaardscore-eenheden in een normaalverdeling. Deze ruwe scores worden omgezet in genormaliseerde standaardscores. Deze normalisering suggereert een normaalverdeling, ook al gold dat niet voor de ruwe scores – soms kan deze kunstmatige ingreep nauwelijks gerechtvaardigd worden. Een uitzondering hierop is als men weet uit eerder onderzoek (met een grotere steekproef) dat de testscores bij benadering normaal verdeeld zijn. Dan kan men hiermee steekproefonregelmatigheden gladstrijken.
Bezwaar: normalisering is vaak problematisch omdat het niet strookt met de werkelijkheid. Hypothetische begrippen (zoals intelligentie) zijn anders dan meetbare begrippen (zoals lengte en gewicht) die wel normaal verdeeld zijn: een hypothetische eigenschap is afhankelijk van de meetmethode: de test beïnvloedt de vorm van de verdeling. Met ingrepen is de verdeling dan wel normaal te maken, maar dat is geen bewijs dat intelligentie ook normaal verdeeld is.
Rechtvaardiging: vanwege het gemak en de bruikbaarheid. De testscores hebben geen verdere uitleg nodig, scores zijn vergelijkbaar etc. Het gebruik ervan veronderstelt een intervalschaal (met gelijke eenheden): dit onderscheidt ze ten opzichte van andere bewerkte scores (maar dit gemak is niet altijd een sterk argument voor deze transformatie).
Overige genormaliseerde standaardscores
T-scores: Men gaat uit van een gemiddelde van vijftig een spreiding van tien. Veel tests zijn op deze manier genormaliseerd (op advies van de APA).
Stanines: Er is niet (zoals bij T-scores) sprake van een exacte overeenkomst met een bepaalde ruwe score maar ze vertegenwoordigen een breedte van een halve standaarddeviatie. Ze lopen van 1 tot 9 en het midden van de 5e stanine komt overeen met het gemiddelde van de verdeling. De toekenning gebeurt op basis van een tabel. Het gebruik ervan is aantrekkelijk, omdat het aantal mogelijke scores beperkt is en vanwege de associatie rapportcijfers. Maar, rapportcijfers lopen van 1 tot 10 en het cijfer 6 staat voor een ‘voldoende’, terwijl op de stanineschaal 5 het gemiddelde is. Sommigen vinden de stanineschaal te grof is, met name in het midden van de verdeling.
Deviatie-IQ: Er is geen sprake van een quotiënt maar van standaardnormen met een gemiddelde van honderd. Dus de mentale leeftijd wordt niet met de chronologische leeftijd vergeleken, maar de testprestaties worden per leeftijdsklasse verwerkt tot genormaliseerde standaardscores, zoals bijvoorbeeld bij de WAIS.
Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>
Concept of JoHo WorldSupporter
JoHo WorldSupporter mission and vision:
- JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.
JoHo concept:
- As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
- JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.
Join JoHo WorldSupporter!
for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for
Work for JoHo WorldSupporter?
Volunteering: WorldSupporter moderators and Summary Supporters
Volunteering: Share your summaries or study notes
Student jobs: Part-time work as study assistant in Leiden
- Insurance for emigrants, expats and living abroad: international insurance for expats and emigrants
- Insurance for activities abroad: Backpacking Travel abroad Intern abroad Study abroad Volunteer abroad Work abroad
- Insurance: ACS Globe Traveller Caremed Insurances Expatriate Travel Insurance IMG’s GlobeHopper World Nomads Insurance SafetyWing Insurance JoHo Special ISIS verzekering NL/BE Working Nomad verzekering NL/BE More about Insurance for abroad
Search only via club, country, goal, study, topic or sector
Select any filter and click on Search to see results








