Wat is betrouwbaarheid? - Chapter 6

Betrouwbaarheid wordt in dit hoofdstuk belicht vanuit de betekenis van herhaalbaarheid van metingen. Met herhaalbaarheid bedoelt men dat een test twee of meer keer aan dezelfde persoon wordt voorgelegd onder dezelfde condities. Men kijkt dan naar de variatie in de testscores. Deze koppeling tussen herhaalbaarheid en betrouwbaarheid roept twee vragen op:

  • Is het zinvol metingen van psychologische eigenschappen bij een specifieke persoon te herhalen?
  • Wat wordt bedoeld met gelijkblijvende condities tijdens testafname?

Wat is herhaalbaarheid van metingen?

Is het zinvol metingen van psychologische eigenschappen bij een specifieke persoon te herhalen?

Het antwoord is nee, herhaalde metingen van dezelfde eigenschappen bij dezelfde persoon zijn niet zinvol omdat er twee effecten kunnen optreden:

  1. Geheugeneffect. Een test levert dezelfde score op omdat de persoon de antwoorden herinnert.
  2. Leereffect. De testscore neemt toe omdat de persoon tijdens het beantwoorden bijleert.

Er is dus sprake van geheugen en leerprocessen. Dit zal na verloop van tijd weer stabiliseren. Maar dit is een geconstrueerd voorbeeld en niet empirisch aangetoond. We moeten het herhalen van metingen zien als hypothetisch, als een gedachte-experiment. Herhaalde metingen worden ook wel onafhankelijke replicaties genoemd.

Wat wordt bedoeld met gelijkblijvende condities tijdens testafname?

Onder gelijkblijvende condities vallen:

  • Kenmerken van de testomgeving en testprocedure (items, instructie, testruimte etc.).
  • Psychologische eigenschappen van de persoon, die voor de meting relevant zijn: De betrouwbaarheid wordt door zowel de bedoelde (bijvoorbeeld numerieke vaardigheden) als de onbedoelde eigenschappen (bijvoorbeeld woordbegrip) bepaald en ook de emotionele reacties die items kunnen oproepen bepalen mede de betrouwbaarheid. De mogelijkheid dat personen tussen afnemingen veranderen op één of meer relevante eigenschappen blijft wel openstaan. Voorwaarde hiervoor is wel dat de veranderingen kenmerkend is voor de eigenschap zelf (bijvoorbeeld motivatie, emotionaliteit en stemming) en niet veroorzaakt wordt door het testen zelf – en dus onafhankelijk zijn.
  • Lichamelijke en fysiologische processen (bijvoorbeeld motoriek en waarneming).

Het gedachte-experiment houdt rekening met het feit dat personen van afname tot afname veranderen met betrekking tot één of meer relevante eigenschappen. Het blijkt dat testscores toch verschillen bij gelijkblijvende condities. Dit komt doordat invloeden op testprestaties onsystematisch en onvoorspelbaar verschillen bij het herhalen van een test. Voorbeelden van factoren die toevallig invloed hebben op testgedrag zijn: black-out, opeens een helder moment, plotselinge hoestbui, slaperigheid etc. Het probleem is dat deze factoren onduidelijk zijn en ook niet duidelijk is in welke mate ze een testprestatie beïnvloeden. Maar ze moeten gebonden zijn aan een specifieke testsessie, anders is het geen onvoorspelbaar toevallig optredend fenomeen meer, maar een eigenschap die ook mede bepalend is voor de testprestatie.

De klassieke testtheorie houdt zich bezig met het in kaart brengen van de relatieve inbreng op de testprestatie van (1) onvoorspelbare invloeden en (2) systematisch werkzame eigenschappen (van de persoon en van de testsituatie).

Onafhankelijke replicaties zijn de hypothetische herhaalde metingen waarin (1) de verschillende metingen onafhankelijk van elkaar zijn (geen leereffecten en geen herinneringen), (2) de testsituatie onveranderd blijft en (3) alle voor de meting relevante eigenschappen van de persoon van invloed zijn op diens testprestatie. In deze situatie zijn ook steeds factoren aanwezig die de testprestatie op onvoorspelbare manier beïnvloeden.

Wat is de klassieke testtheorie?

De klassieke testtheorie stamt uit het begin van de vorige eeuw (Spearman, 1904), de eerste uitwerking werd gedaan door Gullikson (1950) en de eerste definitieve formulering door Novick (1966). Daarna was er met name aandacht voor een nieuwe klasse van testmodellen: de item-responstheorie.

Wat zijn de betrouwbare score en de meetfout?

In de klassieke testtheorie gaat men er vanuit dat iemands testscore (Xij) bestaat uit: Xij = Ti + Eij/

  1. Betrouwbare score (Ti): het constante systematische deel. De gemiddelde geobserveerde score die persoon i heeft behaald over een groot aantal (q) onafhankelijke replicaties van de test.

  2. Meetfout (Eij): een aantal toevallige, niet-systematische componenten die op onvoorspelbare wijze per herhaling variëren, gedefinieerd als: Eij = Xij - Ti.

T is afkomstig van True score (betrouwbare score) en E van Error (meetfout). Een bezwaar tegen het gebruik van de naam true (ware) score is dat het lijkt of de score refereert aan iets wat buiten de testsituatie bestaat, maar dat is niet waar, het gaat om de gemiddelde representatieve testprestatie. Een nuchtere indicatie van wat iemand gemiddeld presteert (capaciteiten) of aan gedrag laat zien (persoonlijkheidstrekken), ontdaan van toevalligheden. In de sport is men weliswaar geïnteresseerd in uitschieters (toevallige hogere scores), maar in het maatschappelijk leven wil men stabiliteit.

Een betrouwbare score heeft ook een psychologische betekenis: als de test volgens doordachte psychologische principes tot stand is gekomen (vanuit een theorie), dan zal de testscore samenhangen met andere psychologische variabelen. Met de testscore is het dan mogelijk gedrag buiten de testsituatie te voorspellen.

De definitie van de meetfout is tautologisch (gebaseerd op een cirkelredenering): de meetfout is het resterende deel van de geobserveerde score wanneer de betrouwbare score ervan afgetrokken is. Het is dus geen referentie aan oorzaken van meetfouten die buiten de test en testsituatie bestaan.

Welke eigenschappen hebben de betrouwbare score en de meetfout voor het individu?

Er zijn twee eigenschappen af te leiden voor persoon i over q onafhankelijke replicaties van een specifieke test:

  1. De gemiddelde meetfout is gelijk aan nul: positieve en negatieve invloeden vallen tegen elkaar weg.

  2. De spreiding van persoon i is gelijk aan de spreiding van de geobserveerde scores.
    De standaarddeviatie S(Ei) is en kan, als de betrouwbare score (Ti) gelijk is aan de gemiddelde geobserveerde score, herschreven worden als: S(Ei) = S(Xi).

De standaardmeetfout is de standaarddeviatie van de meetfout van persoon i. Men gaat er in de klassieke testtheorie vanuit dat de standaardmeetfout voor alle mensen die de test afleggen gelijk is, ongeacht hun ware T-score, maar dat is niet altijd realistisch. Bijvoorbeeld bij meerkeuzevragen is de standaardfout van mensen die veel gissen (lage T) groter dan van mensen die veel goede antwoorden weten (hoge T).

Bij het meten van fysische kenmerken (zoals lengte) is de standaardmeetfout erg klein, maar bij psychologische eigenschappen (zoals intelligentie) is er wel een aanzienlijke standaardmeetfout. De reden hiervoor is dat onderlinge psychologische processen met behulp van een test niet zo nauwkeurig kunnen worden beschreven als fysische processen met de daarvoor geschikte meetapparatuur. Dat wordt veroorzaakt door allerlei factoren die niet kunnen worden gecontroleerd en die per meting een onvoorspelbare invloed hebben.

Welke eigenschappen hebben de betrouwbare score en de meetfout in de populatie?

Het gaat hierbij om een populatie van personen waarbij van ieder individu één testscore beschikbaar is. Voor een willekeurig persoon i is het testmodel nu: Xi = Ti + Ei. We maken twee vooronderstellingen over meetfouten:

  1. De gemiddelde meetfout is gelijk aan nul.
  2. De meetfouten correleren met geen enkele andere variabele waar ze geen van uitmaken: r(E,Y) = 0.
    • Meetfouten correleren wel met variabelen waar wel wel deel van uitmaken: r(E,X) > 0.
    • Meetfouten en betrouwbare score correleren niet met elkaar: r(E,T) = 0.

Er zijn twee eigenschappen af te leiden over het gemiddelde en de variantie van de geobserveerde score in de populatie:

  1. De gemiddelde geobserveerde score is gelijk aan de gemiddelde betrouwbare score.
  2. De variantie van de geobserveerde score is gelijk aan de som van de variantie van de betrouwbare score en de variantie van de meetfout: S2 (X) = S2 (T) + S2 (E).

Wat is de betrouwbaarheid van testscores en de standaardmeetfout?

Wat is de definitie van betrouwbaarheid?

De betrouwbaarheid (rXX’) van de testscore gemeten in een populatie van personen is de verhouding van de variantie van de betrouwbare score en de geobserveerde score.

Wat zijn acceptabele waarden van betrouwbaarheid?

De betrouwbaarheid ligt tussen 0 en 1. Daar zijn drie dingen van af te leiden:

  1. De betrouwbaarheid is niet-negatief: we nemen aan dat de variantie van X is altijd groter dan 0 want niet iedereen heeft dezelfde testscore. De variantie van T is dan niet negatief, dus de betrouwbaarheid is ook niet negatief.

  2. De minimumwaarde is 0: de minimumwaarde van de betrouwbaarheid is gelijk aan 0 als de teller S2 (T) gelijk aan 0 is. Dan hebben alle personen dezelfde betrouwbare score en is alle geobserveerde variatie te wijten aan meetfouten; de test meet geen enkel betrouwbaar verschil en is dus als test mislukt.

  3. De maximumwaarde is 1: als de variantie van de meetfouten S²(E) gelijk is aan nul, dan is S²(T) = S²(X) . De betrouwbaarheid is dan gelijk aan 1; iedereen heeft dezelfde meetfout. Maar omdat de gemiddelde meetfout ook gelijk is aan 0, betekent dit dat we iedereen zonder meetfouten meten, zodat X = T . Dan is de meting dus foutenvrij; de testscore dus gelijk aan de betrouwbare score en de betrouwbaarheid is dan 1.

Er wordt onderscheid gemaakt tussen twee belangrijke praktische situaties van testen:

  1. Wetenschappelijk onderzoek: dan gaat het om uitspraken over groepen – dus niet over individuele testprestaties – en schat men groepsgemiddelden en correlaties. Bij een te lage betrouwbaarheid bestaat de testprestatie voornamelijk uit meetfouten en is het moeilijk om verschillen in gemiddelden en correlaties te vinden die niet gelijk zijn aan 0. Men houdt als vuistregel een betrouwbaarheid aan die hoger is dan 0.7.

  2. Individuele diagnostiek: dan gaat het over beslissingen over individuen, en moet de betrouwbaarheid hoog zijn. Er is geen harde ondergrens omdat het uiteindelijk gaat of individuele testscores significant van elkaar of van een aftestgrens verschillen – en daarvoor biedt een minimum betrouwbaarheidseis geen garantie. De vuistregel is een betrouwbaarheid die hoger is dan 0.9.

Wat is de standaardmeetfout van de testscore?

De standaardmeetfout van de testscore kan worden afgeleid uit de vorige twee formules en wordt geschreven als.

In de klassieke testtheorie zijn betrouwbaarheid en standaardmeetfout erg belangrijk omdat:

  • Ze nuttig zijn bij het schatten van de nauwkeurigheid van een meting met behulp van een specifieke test in een specifieke populatie.
  • Ze een indruk kunnen geven van de mate waarin de testscores bij een onafhankelijke replicatie van de meting zouden verschillen.

Welke belangrijke onderscheidingen kunnen er gemaakt worden?

Net als opsplitsing van een geobserveerde score in een betrouwbaar en een toevallig deel kunnen we een testscore opsplitsen in een bedoeld en een onbedoeld deel. Als voorbeeld een test die rigiditeit meet, maar waarbij sommige items ook een emotionele of agressieve reactie kunnen oproepen. Ook kan woordbegrip bij enkele items een rol spelen:

  1. Bedoelde scorecomponent: de rigiditeitstrek.
  2. Onbedoelde scorecomponent: emotionaliteit, agressiviteit, woordbegrip – en bevat daarnaast ook de meetfout.

Dus: het onbedoelde scorecomponent valt niet samen met de meetfout en het onbedoelde scorecomponent valt niet samen met de betrouwbare score. Het is ook belangrijk om in te zien dat een test met een hoge betrouwbaarheid niet noodzakelijk betekent dat men datgene meet wat men bedoelt te meten.

Hoe kan de betrouwbaarheid bepaald worden?

Er zijn twee bepalingen van de betrouwbaarheid te noemen:

1. Herhaalde meting. Deze bestaat uit:

  • De parallelvormmethode, hierbij gebruikt men paralleltests. Deze tests zijn equivalent en inwisselbaar.
  • De test-hertestmethode, hierbij gaat het om het tweemaal afnemen van dezelfde test.

2. Eenmalige meting. Deze bestaat uit:

  • De splitsingsmethode waarbij men een test splitst in twee helften, elke helft bevat evenveel items.
  • De interne-consistentiemethode, covariantie tussen alle individuele items.

 

Herhaal de metingParralelvormmethodeParraleltest
 Test-hertestmethodeDezelfde test
Eenmalige metingSplitsingmethodeTwee helften
 Interne-consistentie methodeItems 

Wat is de parallelvormmethode?

In plaats van tweemaal dezelfde test, kan men twee inwisselbare, maar niet identieke tests gebruiken. De correlaties tussen scores van twee paralleltests zijn gelijk aan de betrouwbaarheid van de afzonderlijke testscores. Test I en II zijn parallel als voor de scores XI en XII geldt dat:

  1. Persoon i heeft op beide tests identieke betrouwbare scores: TiI = TiII.

  2. De spreiding (variantie) van de ruwe score in de populatie is gelijk op beide tests: S2 (XI) = S2 (XII).

Lord en Novick spreken bij deze vooronderstellingen van pseudo-parallellie.

Uit deze eigenschappen volgt dat de correlatie tussen XI en XII gelijk is aan de betrouwbaarheid van zowel XI als XII apart: r(Xi,XII) = rXX' dus de betrouwbaarheid is de correlatie tussen de twee parallelle testscores.

Als men twee versies heeft gemaakt, is het mogelijk achteraf te controleren of ze daadwerkelijk parallel zijn. Als twee testversies I en II parallel zijn, dan moeten de volgende drie eigenschappen gelden voor de ruwe scores XI en XII:

  1. De gemiddelde geobserveerde scores op beide tests zijn gelijk: x̄I = x̄II.

  2. De varianties van geobserveerde scores zijn gelijk: S2 (XI) = S2 (XII).

  3. De correlaties van XI en XII met variabele Y (criterium) zijn gelijk: r(XI,Y) = r(XII,Y).

De derde eigenschap is de belangrijkste; de eerste twee kan eenvoudig bereikt worden door de testscores te standaardiseren. De derde eigenschap kan in de praktijk maar voor een beperkt aantal variabelen Y worden onderzocht, maar dat hoeft geen probleem te zijn: als XI en XII dezelfde correlaties hebben met bijvoorbeeld vijf onderling laag correlerende variabelen (Y1, …, Y5), dan volgen hieruit zoveel beperkingen voor de andere correlaties dat de correlatie tussen TI en TII wel hoog moet zijn.

In de praktijk bestaan er geen echte paralleltests, dus de correlaties tussen de scores op beide versies in de populatie zijn kleiner dan als het om echte paralleltests zou gaan.

Wat is de test-hertestmethode?

De test-hertestmethode is een poging om het ideaal van onafhankelijke replicaties te realiseren. Dezelfde test wordt met een behoorlijke tussentijd tweemaal aan dezelfde groep personen aangeboden. Als het onafhankelijke replicaties zijn dan is de correlatie tussen beide verkregen ruwe scores in de populatie gelijk aan de betrouwbaarheid van de test. Dus r(X1,X2) = rXX'. De test-hertest methode is een goede methode als er in de tijd tussen de twee tests geen veranderingen hebben plaatsgevonden met betrekking tot de eigenschap die door de test wordt gemeten. Het geeft dan een goede betrouwbaarheid.

Vier redenen waarom r(X1, X2) soms geen goede maat voor betrouwbaarheid is:

  1. De testmethode zelf. Door het testen ontstaan leereffecten en geheugeneffecten waardoor er verschillen bij de tweede meting ontstaan. Dit is vooral het geval bij opvallende items, bij korte tests en bij een korte tijdsinterval tussen de afnames. Bovendien kan ook een attitude- of instellingsverandering optreden door kritische vragen in de test.

  2. Leer- en geheugeneffecten verschillen per persoon, dus veroorzaken niet dezelfde veranderingen bij iedereen.

  3. Men kan zich afvragen hoe groot het tijdsinterval moet zijn. Bij een klein interval is de kans op uitval klein, maar dan wordt de kans op herinnering en beïnvloeding wel groter.

  4. Uitval: de beschikbare groep proefpersonen wordt kleiner naarmate het interval langer is. Uitval is vaak niet aselect, bijvoorbeeld personen met extreme scores op een test van neuroticisme vallen vaker uit.

Het voordeel is dat het iets vertelt over in hoeverre de testprestatie over een bepaalde periode stabiel blijft, inclusief alle krachten die tussentijds van invloed zijn. De correlatie geeft een indruk van de stabiliteit (dat wordt soms ook betrouwbaarheid genoemd, maar is een ander soort betrouwbaarheid).

Wat is de splitsingsmethode?

De splitsingsmethode is een efficiënte variant van de parallelvormmethode, omdat er twee halve tests gebruikt worden in plaats van twee hele tests. Men doet dit als volgt: men deelt een test in twee even lange helften die men de proefpersonen aanbiedt. Pas achteraf wordt per testhelft een ruwe score bepaald. Als beide scores echt parallel zijn dan is hun correlatie in de populatie gelijk aan de betrouwbaarheid van de scores op een halve test. Op basis van de correctie op de verkregen betrouwbaarheid wordt de betrouwbaarheid van de hele test bepaald. Om dit te kunnen bepalen moeten we twee dingen weten:

  1. Wat de invloed is van de testlengte op de betrouwbaarheid. Hiervoor wordt de Spearman-Brown formule gebruikt (K = verlengingsfactor, rXX’ = betrouwbaarheid, rKK = betrouwbaarheid verlengde/verkorte test).

  2. Wat de betrouwbaarheid van de hele test is via de splitsingsmethode (r22 = betrouwbaarheid op de gehele test).

Deze formule gaat er vanuit dat de testdelen parallel zijn. Als dat niet zo is wordt de betrouwbaarheid lager. Het splitsen van een test levert nog geen zuivere parallellie op. Mogelijkheden tot het verhogen van parallellie zijn:

  1. De test niet splitsen in een makkelijke en moeilijke helft; moeilijke items kunnen iets heel anders kunnen meten dan makkelijke items. Dus het liefst moet er een gelijkmatige verdeling zijn van makkelijke en moeilijke items over beide tests.

  2. Geen splitsing in eerste en tweede helft van de test, omdat verveling, vermoeidheid etc. in de tweede helft kan optreden. Het is beter met even en oneven rangnummers te werken.

  3. Items op inhoud met elkaar paren: in de verschillende versies items plaatsen die qua inhoud veel op elkaar lijken. Het probleem is wel dat niet alle items met een ander item gepaard kunnen worden, maar toch verdeeld moeten worden.

De samenstelling van twee parallelle testhelften is dus vaak arbitrair; het is lastig om een keuze te maken tussen diverse mogelijkheden. Een oplossing zou zijn om voor elke splitsingsmogelijkheid de betrouwbaarheid volgens de splitsingsmethode te schatten, en hier het gemiddelde van te nemen. Dit hoeft niet daadwerkelijk uitgevoerd te worden: Cronbachs alfa is een methode om de betrouwbaarheid te bepalen die precies gelijk is aan de gemiddelde splitsingsbetrouwbaarheid van alle mogelijke splitsingen van de test in twee helften.

Wat is de interne-consistentie-methode?

De interne-consistentie-methode is gebaseerd op het gegeven dat individuele items in een test inwisselbaar zijn. Inwisselbaarheid is minder streng gedefinieerd dan parallellie. Een test wordt eenmalig voorgelegd aan een (representatieve) groep, waarna alle covarianties tussen de items en de variantie van de ruwe score X worden berekend. Deze resultaten worden (samen met k) ingevuld in één van de coëfficiënten van interne consistentie die worden gebruikt als schatting van de betrouwbaarheid. De meest gebruikte zijn:

  • Alfacoëfficiënt: van Cronbach (1951) en is de meest bekende.

  • Lambda2-coëfficiënt: is de voorganger van de alfacoëfficiënt van Guttman (1945).

  • KR20-coëfficiënt: is een variant van Kuder en Richardson (1937) op alfa; alleen voor dichotoom gescoorde items.

Waarom is alfa een ondergrens voor de betrouwbaarheid?

In de populatie is alfa de ondergrens van de betrouwbaarheid: rXX’ ≥ alfa. Als alle items voornamelijk dezelfde eigenschap meten, komen de alfa en de betrouwbaarheid overeen. Dat betekent dus dat ingewikkelde procedures (parallelmethode, splitsingsmethode etc.) niet nodig zijn, maar dat de betrouwbaarheid gewoon met een formule te berekenen is. De basis van het bewijs voor deze stelling is als volgt:

  1. De variantie van elke variabele is groter of gelijk aan nul.

  2. De variantie van het verschil van betrouwbare scores op twee variabelen is niet-negatief.

  3. De covariantie tussen de betrouwbare scores op twee items Tg en Th kan geschreven worden als een gemiddeld product van afwijkingsscores.

  4. Meetfouten correleren nul met variabelen waar ze zelf niet inzitten.

  5. Het herschrijven van deze formules levert op dat de betrouwbaarheid gelijk is aan de alfacoëfficiënt.

Volgens Novick en Lewis is alfa gelijk aan de betrouwbaarheid als de items voldoen aan een equivalentie-eis die minder streng is dan parallellie. Maar itemscores voldoen in de praktijk niet aan de eis van equivalentie. Dit houdt in dat alfa altijd een systematische onderschatting van de betrouwbaarheid oplevert.

Wat is er te zeggen over alfa als ondergrens in relatie tot populatie en steekproef?

Alfa is de ondergrens van de betrouwbaarheid in de populatie, maar in de praktijk wordt alfa geschat met behulp van een steekproef. Een grote representatieve steekproef (minstens 500 proefpersonen) benadert de waarde van alfa in de populatie. Hoe kleiner de steekproefgrootte, hoe meer de steekproeven door toeval van elkaar verschillen, hoe groter de fluctuatie in alfa – de geschatte waarde van alfa uit de steekproef kan zelfs hoger zijn dan de alfa in de populatie en dus hoger dan de werkelijke betrouwbaarheid.

Hoe moet alfa geïnterpreteerd en gebruikt worden?

Alternatieve formule. Een andere bekende vorm van alfa is die van Kuder en Richardson: KR20 . Die is gelijk aan alfa bij dichotoom gescoorde items.

(pg = proportie goede antwoorden, qg proportie foute antwoorden).

Berekening van Alfa. Om alfa te berekenen moeten we verschillende variabelen kennen en invullen, namelijk:

  1. Testlente k;

  2. Inter-item-covarianties: alle varianties tussen de items, dat zijn er ½k(k-1);

  3. Variantie van de testscores (gedefinieerd als de som van de itemscores), dat kan op twee manieren worden berekend, (1) door de testscore X in te vullen in formule voor de variantie en (2) door de formule voor de variantie van een somvariabele gebruiken.

Varianties en covarianties kunnen worden geordend in een variantie-covariantiematrix.

Selectie van items ter verhoging van alfa. Uit de formule voor alfa is af te leiden dat we het beste items kunnen selecteren waarvan de covarianties met de andere k–1-items in hoge mate positief zijn. Het is lastig te bepalen wanneer een item voldoende bijdraagt om geselecteerd te worden, daarom moeten items beoordeeld worden op hun correlatie met de somscore op de andere k–1-items; namelijk de item-restcorrelatie. De item-restcorrelatie van item g vat de informatie in de k–1 afzonderlijke covarianties handig samen. Per item hoeft er dus maar één item-restcorrelatie berekend en geïnterpreteerd te worden in plaats van k–1 inter-item-covarianties. Dat is efficiënter en wordt in de praktijk meer gebruikt.

De mythe van interne consistentie. Alfa wordt vaak gebruikt als maat voor interne consistentie. In plaats van interne consistentie gebruikt men ook wel de term homogeniteit. Men bedoelt dan dat alfa aangeeft in hoeverre de items in een test dezelfde eigenschappen meten. Twee kritische noten bij deze opvatting met betrekking tot alfa:

  1. Alfa is in veel gevallen een toenemende functie van het aantal items in de test. Volgens Cronbach zou de interne consistentie van een test en het aantal items los van elkaar moeten staan. Maar een hoge waarde van alfa geeft aan dat de systematiek van de meting bepalender is dan toevallige score componenten in de testprestatie.

  2. Alfa kan een hoge waarde hebben terwijl de test in sterke mate heterogeen is. Alfa zegt dus niets over de homogeniteit van een test.

Alfa kan dus beter niet gebruikt worden als maat voor interne consistentie of homogeniteit van een test. Het is beter alfa te gebruiken als ondergrens voor betrouwbaarheid want het geeft in de praktijk een systematische onderschatting van betrouwbaarheid weer. Voor een indruk van interne consistentie zijn technieken als factoranalyse en item-response modellen geschikt.

Welke alternatieven voor alfa zijn er?

  1. De lambda2-coëfficient volgens Guttman geeft ook de ondergrens voor betrouwbaarheid van een test aan.

  2. Mucoëfficiënten: lambda2 en alfacoëfficiënt maken samen deel uit van een oneindig lange reeks ondergrenzen voor de betrouwbaarheid: de mucoëfficiënten. Ze zijn genummerd: mu0, mu1, mu2 etc. Een kenmerk van de mu-reeks is dat de coëfficiënten kunnen worden geordend naar oplopende grootte: mu0 ≤ mu1 ≤ mu2 ≤ mu3 ≤ ... ≤ rXX' (mu0 = alfa en mu1 = lambda2).

In de populatie ligt lambda2 minstens zo dicht bij de betrouwbaarheid als alfa; dan kan men in de praktijk dus beter lambda2 gebruiken. Volgens Ten Berge en Zegers kan men zelfs beter mu2 of mu3 gebruiken bij een test met weinig items. Ze adviseren om over het algemeen mu1 (lambda2) te gebruiken. Opvallend is dat alfa vaker wordt gerapporteerd dan lambda2 (terwijl lambda2 eenvoudiger en ouder is). Beiden worden berekend door SPSS.

Alle mucoëfficiënten zijn gelijk aan betrouwbaarheid onder de voorwaarde dat de testitems voldoen aan de equivalentie-eis. Maar omdat deze eis in de praktijk te strikt is, zijn de mucoëfficiënten kleiner dan de betrouwbaarheid.

Welke speciale onderwerpen moeten er benoemd worden?

Wat is lineaire regressie?

Lineaire regressie is een methode om een onbekende variabele Y op basis van scores op een bekende variabele X te schatten. Er wordt een model gemaakt voor de relatie van X met Y door te zoeken naar de lineaire functie die de puntenwolk zo goed mogelijk benadert: het lineaire regressiemodel. Dan kan X daar worden ingevuld om een schatting van Y te krijgen. In de regressievergelijking Ŷ = a + bX worden de schattingen van constanten a en b ingevuld.

De standaarddeviaties van X en Y, de correlatie tussen X en Y en de gemiddelden van X en Y moeten bekend zijn. Als de correlatie tussen X en Y niet perfect is (dus: |r(X,Y)| < 1), dan is er een bepaalde mate van onnauwkeurigheid in de schatting van Y. Het verschil tussen de geobserveerde en de geschatte waarde, Yi – Ŷi , is het residu. Het gemiddelde residu Mres is gelijk aan 0, zodat de variantie van de residuen gelijk is aan het gemiddelde gekwadrateerde residu.

De standaardschattingsfout SY.X (standaarddeviatie van de schattingsfout) geeft een indruk van de onnauwkeurigheid van de schatting van Y.

Het 95%-betrouwbaarheidsinterval kan voor de onbekende Yi berekend worden op basis van SY.X en Ŷi (de standaardschattingsfout en de geschatte Y). De betekenis van een betrouwbaarheidsinterval is dat de werkelijke Y-waarde in 95% van de gevallen tussen de berekende waarden ligt, niet dat de kans erop 95% is (die kans is namelijk 1 (wel) of 0 (niet)). Grote steekproeven geven veel nauwkeurigere schattingen dan kleine steekproeven.

Welke twee methoden zijn er om de betrouwbare score te schatten en welke methode is nauwkeuriger?

Er zijn twee schattingsmethoden voor de bepaling van de juistheid van de schatting van iemands betrouwbare score T.

Methode 1: Bij deze methode wordt gebruik gemaakt van de standaardmeetfout. Bij schatting van T wordt de geobserveerde score gebruikt. De schatting is geldig omdat aangetoond kan worden dat bij een willekeurige afname de meest waarschijnlijke waarde voor de meetfout 0 is. Het is een maat voor de onnauwkeurigheid van de schatting: de standaarddeviatie van de schattingsfouten is gelijk aan de standaardmeetfout.

Methode 2: In deze methode wordt gebruik gemaakt van de standaardschattingsfout. Deze schatting wordt beschouwd als een lineair regressieprobleem. Er wordt gebruik gemaakt van een lineaire vergelijking. Naast de ruwe score worden tevens de gemiddelde score en de betrouwbaarheid in de populatie gebruikt om T te schatten. Er zijn drie stappen nodig om de regressieformule te herschrijven:

  1. Volgens formule is de gemiddelde X gelijk aan de gemiddelde T.

  2. Volgens formule is S(T)/S(X) gelijk aan de wortel van de betrouwbaarheid.

  3. Volgens de klassieke testtheorie is de correlatie tussen X en T gelijk aan de wortel van de betrouwbaarheid.

Dat allemaal invullen in de regressieformule (en herschrijven) levert de geschatte betrouwbaarheid op.

De standaarddeviatie van de schattingsfouten is hier dus de standaardschattingsfout

De standaardschattingsfout is en de standaarddeviatie van de betrouwbare score is.

Beide schattingen hebben een standaarddeviatie: onder aanname van een normale verdeling kan een betrouwbaarheidsinterval berekend worden (bij een 95%-betrouwbaarheidsinterval zullen 95% van de berekende intervallen de ware score bevatten).

De eerste methode is minder zorgvuldig dan de tweede methode. Daarvoor zijn meerdere redenen:

  1. De standaardmeetfout uit de eerste methode gebruikt de variantie van de ruwe score en de standaardschattingsfout gebruikt de variantie van de betrouwbare score. De variantie van de betrouwbare score is kleiner of gelijk aan die van de ruwe score, dus is methode 1 nauwkeuriger.

  2. Methode 2 gebruikt meer relevante informatie dan methode 1; naast de ruwe score wordt ook de gemiddelde score en de betrouwbaarheid in de populatie gebruikt.

  3. Het 95%-betrouwbaarheidsinterval van methode 2 is korter dan die van methode 1.

Hoe kunnen testscores vergeleken worden?

In de praktijk zijn testscores behoorlijk onnauwkeurige schattingen van de betrouwbare score: een betrouwbaarheid van 0.90 levert nog steeds brede betrouwbaarheidsintervallen op. Men krijgt een hogere betrouwbaarheid door meer items in de test op te nemen; het aantal mogelijke testscores X neemt toe en de schaal wordt langer. Hierdoor neemt de spreiding van de testscores S(X) ook toe en wordt de standaardmeetfout 2x zo groot. Het betrouwbaarheidsinterval voor T gebaseerd op methode 1 wordt ook 2x zo lang.

Dat lijkt intuïtief niet te kloppen; bij een hogere betrouwbaarheid zou je toch een kleinere standaardmeetfout en een korter betrouwbaarheidsinterval verwachten? Leidt een hogere betrouwbaarheid dan tot een onnauwkeuriger meting? Dat is niet waar, de winst zit erin dat de betrouwbaarheidsintervallen voor individuele personen nu verder uit elkaar liggen – en dus minder snel overlappen – waardoor het gemakkelijker wordt om significante verschillen te vinden. De winst in nauwkeurigheid is niet absoluut, maar relatief; de lengte van het betrouwbaarheidsinterval moet worden gezien worden naast de lengte van de schaal.

Dan blijft natuurlijk staan dat in absolute zin het betrouwbaarheidsinterval wel lang blijft – en het verschil tussen testscores erg groot moet zijn om significant te zijn. Maar testscores zijn uiteindelijk toch wel betrouwbaar genoeg voor praktisch gebruik, en wel om deze redenen:

  1. Tests zijn goede meetinstrumenten als hun standaardmeetfout of standaardschattingsfout klein is ten opzichte van de lengte van de schaal (en de volledige schaallengte moet daadwerkelijk in de populatie zijn benut). Hiervoor zijn veel items nodig (hoeveel precies is afhankelijk van onder andere de kwaliteit van de items en het aantal categorieën waarin men personen wil onderscheiden). De standaardmeetfout en de standaardschattingsfout geven (in relatie tot de lengte van de schaal) meer informatie over de nauwkeurigheid van een meting dan de betrouwbaarheid.

  2. Het gebruik van tests in wetenschappelijk onderzoek vereist een minder hoge meetnauwkeurigheid dan voor individueel testgebruik. Wel moet de testscore nog steeds behoorlijk betrouwbaar zijn, maar om verschillen tussen groepen te kunnen bepalen, is de steekproefgrootte belangrijker.

  3. Het geringe aantal items in een test (dat betekent een korte schaallengte en een relatief grote standaardmeetfout) kan bij belangrijke beslissingen over een persoon gecompenseerd worden door meerdere testprestaties en andere gegevens bij de uitspraak over die persoon te betrekken.

Wat is de invloed van de testlengte op de betrouwbaarheid?

Spearman-Brown-formule

De Spearman-Brown-formule drukt het verband uit tussen betrouwbaarheid en testlengte, gebaseerd op de veronderstelling van parallelle metingen (rKK = betrouwbaarheid verlengde test).

Testverlenging

Met behulp van de gewenste betrouwbaarheid kan de verlengingsfactor K berekend worden.

De betrouwbaarheid van de verlengde test rKK is een monotoon toenemende functie van verlengingsfactor K.

Er is een verband tussen de lengte van een test en de betrouwbaarheid van deze test:

  1. Hoe meer items er aan de test worden toegevoegd des te minder winst krijgt de betrouwbaarheid. Vooral bij de eerste items wordt de meeste betrouwbaarheidswinst behaald.

  2. Vanwege praktische redenen is het niet zinvol om een test met een lage betrouwbaarheid te verlengen om zo voldoende betrouwbaarheid te krijgen: (1) het kost veel tijd en het kan vermoeiend zijn en demotiverend werken voor de proefpersonen als ze een heel lange test moeten invullen, (2) het is moeilijk om veel verschillende items te construeren die dezelfde eigenschap moeten meten en (3) testverlenging heeft weinig nut voor de validiteit van een testscore.

Het verlengen van een test is alleen nuttig als er niet te veel items (afhankelijk van het type test) zijn en de aanvangsbetrouwbaarheid niet al te laag is (≥ 0.6). Er moet ook rekening gehouden te worden met het feit dat het bepalen van het verband tussen lengte en betrouwbaarheid gebaseerd is op de aanname van parallelle metingen. Parallellie is echter een ideaal waaraan in de praktijk niet aan voldaan kan worden.

Wat is de relatie tussen betrouwbaarheid en validiteit?

De correlatie van een testscore met het criterium, datgene wat we willen voorspellen, kan worden beperkt door de betrouwbaarheid van de testscore. De correlatiecoëfficiënt duidt de validiteit van een test aan, zodoende kan de validiteit van de testscore ook beperkt worden door de betrouwbaarheid:

  • Een test met een lage betrouwbaarheid zal ook geringe validiteit hebben.
  • Een test met een hoge betrouwbaarheid is een noodzakelijke maar niet voldoende voorwaarde voor een hoge validiteit, want de validiteit is ook afhankelijk van de samenhang van de testscore en het criterium.

Bij verlenging van een test neemt de validiteitswinst slechts weinig toe omdat de inhoud van de test niet verandert als de test langer wordt. Hierdoor kan het criterium ook niet beter voorspeld worden. De geringe toename van de validiteitswinst is alleen te danken aan de vermindering van meetfouten door testverlenging.

Betrouwbaarheidsindex

De betrouwbaarheidsindex heeft de bovengrens aan voor de correlatie van X met Y; namelijk maximaal de correlatie tussen de ruwe score en de betrouwbare score.

Validiteitscoëfficiënt

De validiteitscoëfficiënt is de validiteit uitgedrukt in de correlatiecoëfficiënt. Deze profiteert nauwelijks van een toenemende testlengte (en de daarmee toenemende betrouwbaarheid). Dat komt doordat de test door verlenging niet inhoudelijk veranderd, waardoor het criterium ineens beter voorspeld kan worden. De kleine toename die er is komt door het terugdringen van meetfouten die de samenhang tussen X en Y enigszins vertroebelen.

Attenuatiecorrectie

De attenuatiecorrectie is een formule om de validiteit van de verlengde test rK(X,Y) te bepalen als zowel X als Y door testverlenging perfect betrouwbaar zouden worden gemaakt. Voor de theorievorming is het belangrijk de berekende validiteit met deze formule te corrigeren; de gecorrigeerde validiteit kan inzicht geven in de vraag in hoeverre test en criterium een beroep doen op dezelfde psychologische eigenschap. Na correctie voor de betrouwbaarheid, verwacht men een hoge correlatie als ze hetzelfde meten en een lage correlatie als ze niet hetzelfde meten.

Wat is de betrouwbaarheid van de verschilscores?

Een vraag bij psychodiagnostiek is welke waarde men kan hechten aan een gevonden verschil in testscores van dezelfde persoon. Het kan zijn dat het verschil veroorzaakt wordt door de onbetrouwbaarheid van de testscore(s). Het is dus belangrijk om te weten wat de betrouwbaarheid van een gevonden verschil is om een goede voorspelling te kunnen doen.

De betrouwbaarheid van het verschil tussen de testscores is gering:

  • Wanneer de betrouwbaarheid van de testscores laag is. De verschilscores bestaan waarschijnlijk vooral uit meetfouten omdat de lage betrouwbaarheid van de testscores aanduiding is voor een grote meetfout.
  • Als de covariantie (de samenhang) van de testscores sterk is. Dit betekent dat hun betrouwbare scores veel op elkaar lijken zodat het verschil tussen de testscores vooral uit meetfouten zal bestaan.

Op grond van testscoreverschillen worden in de praktijk vaak allerlei beslissingen genomen zoals bij werving- en selectiecriteria. Maar men moet heel voorzichtig zijn bij het interpreteren van scoreverschillen, vooral bij samenhangende testscores. Een goede beslissing kan alleen gemaakt worden wanneer:

  • De tests zo onafhankelijk mogelijk zijn. Hoe lager de correlatie van de testscores hoe beter.
  • Beide testscores zo betrouwbaar mogelijk zijn.

Bij de 'DAT' test heeft men bijvoorbeeld wel rekening gehouden met verschilscoreproblematiek. Bij andere tests zoals de WAIS hecht men teveel waarde aan hoog correlerende testscores. Conclusie: door onbetrouwbare verschilscores zullen besluiten die gebaseerd zijn op de analyse van profielen (verkregen uit de testscores) weinig waarde hebben.

Latente-klassenanalyse is een recente statistische ontwikkeling waarmee mensen geclassificeerd worden op basis van hun scoreprofielen. Er wordt nagegaan in hoeverre er deelgroepen te onderscheiden zijn op basis van de scoreprofielen. Als dat gevonden is, wordt er per deelgroep een interpretatie gegeven van de specifieke kenmerken, met behulp van de p-waarden: proportie positieve antwoorden per item. Het is ‘latent’ omdat het aantal en de interpretatie van de deelgroepen achteraf wordt vastgesteld – ze worden uit de gegevens berekend en zijn niet vooraf gedefinieerd. De bruikbaarheid ervan moet nog blijken.

Wat is de relatie tussen betrouwbaarheid en spreiding van scores?

Er is een sterk positief verband tussen de spreiding van betrouwbare scores en meetfouten, enerzijds en de betrouwbaarheid anderzijds. Het gemiddelde van de standaardmeetfouten van individuen in diverse populaties, gegeven een vaste test, zal weinig variëren. De variantie van de betrouwbare scores zal daarentegen wel verschillen. En als de variantie van een betrouwbare testscore afneemt bij een vaste meetfoutenvariantie, neemt de betrouwbaarheid eveneens af. Dit betekent dat bijvoorbeeld voor een test ingevuld door een specifieke deelpopulatie van 13- en 14-jarigen men een lagere betrouwbaarheid zal vinden dan in de gezamenlijke populatie dertien en veertien jarigen. Men kan dus alleen een test afnemen bij de populatie waarvoor de test is ontwikkeld.

Wat is de betrouwbaarheid van heterogene tests?

Vaak worden testbatterijen bestaande uit deeltests ontwikkeld als er ingewikkelde begrippen zoals intelligentie worden onderzocht. Intelligentie bestaat uit verschillende aspecten, elk aspect wordt apart gemeten. Aangenomen wordt dat deze aspecten redelijk onafhankelijke intelligentiekenmerken representeren. Deze onafhankelijkheid komt naar voren in de geringe covariantie of lage correlaties tussen scores op deeltests. Omdat men ook een indicatie wil van iemands algemene niveau, bekijkt men niet alleen het scorepatroon op de verschillende deeltests maar bekijkt men ook de totaalscore op alle deeltests samen. De betrouwbaarheid van een totaalscore gebaseerd op heterogene delen van de test, kan goed bepaald worden door de gestratificeerde alfa-coëfficiënt (alfastrat).

Wat is er bekend over de generaliseerbaarheid van metingen?

Onafhankelijke replicaties leiden niet automatisch tot een unieke betrouwbaarheid per test. 'De test-hertest-methode geeft een beeld van de generaliseerbaarheid van de meting in de tijd, de paralleltest-methode geeft aan in hoeverre metingen verkregen met de ene testversie generaliseerbaar zijn naar op hetzelfde moment verkregen meetwaarden van de andere parallelle testversie.

Generaliseerbaarheidstheorie

Cronbach meende dat het doel van testen altijd generalisatie is; generalisatie in de tijd, over vraagvorm, vraaginhoud of over soortgelijke tests. Een universum is het totaal van voorwaarden die men hanteert bij het generaliseren. Men spreekt dan van een universumscore en niet van een betrouwbare score. De universumscore is de gemiddelde testprestatie berekend over het universum van condities. De universumscore verschilt afhankelijk van de definitie van het universum, maar het is ook afhankelijk van de betrouwbaarheid van de meting. Deze betrouwbaarheid noemt men generaliseerbaarheid. Bij generaliseerbaarheid horen ook de toevallige fouten, E, oftewel de foutenterm. Ook de foutenterm is afhankelijk van de definitie van het universum en daarmee varieert tevens de generaliseerbaarheid.

Wat voor besluit kan er genomen worden?

De betrouwbaarheid van een meting heeft betrekking op de herhaalbaarheid ervan (onafhankelijke replicatie). De vraag is in hoeverre de waargenomen score naar verwachting anders uitvalt.

Bij betrouwbaarheid is het niet automatisch zo dat er sprake is van validiteit, wel is het zo dat een onbetrouwbare testscore (het bestaat dan alleen uit meetfouten) ook invalide is, want meetfouten correleren nergens mee.
 

Image

Access: 
Public

Image

Join: WorldSupporter!

Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>

Check: concept of JoHo WorldSupporter

Concept of JoHo WorldSupporter

JoHo WorldSupporter mission and vision:

  • JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.

JoHo concept:

  • As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
  • JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.

Join JoHo WorldSupporter!

for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for

Check: how to help

Image

 

 

Contributions: posts

Help others with additions, improvements and tips, ask a question or check de posts (service for WorldSupporters only)

Image

Image

Share: this page!
Follow: Psychology Supporter (author)
Add: this page to your favorites and profile
Statistics
2585
Submenu & Search

Search only via club, country, goal, study, topic or sector