Hoe werkt het testen van hypothesen? - Chapter 4
In dit hoofdstuk worden de procedures besproken om hypotheses te testen. In een typisch experiment willen we een groep mensen, die een bepaalde behandeling ondergaan, vergelijken met normale of algemene scores van mensen (die geen behandeling of experiment hebben ondergaan). Alleen beschrijvende statistieken zijn dan niet genoeg: die kunnen niet vertellen of het verschil dat we vinden tussen twee groepen door toeval komt of door het effect van de experimentele behandeling.
Stel je hebt een set scores die normaal verdeeld zijn, met een populatiegemiddelde van 50 en een standaarddeviatie van 10. De scores van de personen zullen verschillen. Bij het trekken van een steekproef uit deze populatie, zal het gemiddelde niet precies 50 zijn. Dit is namelijk afhankelijk van welke personen in de steekproef zitten. Het is een variatie in gemiddelden die we variatie door kans of error variantie noemen. Een synoniem dat hierbij ook gebruikt wordt, is steekproef error: doordat een steekproef een selectie aan scores uit een populatie heeft, zal een steekproefwaarde (zoals het gemiddelde) waarschijnlijk afwijken van die van de populatie. De term ‘error’ betekent hier dus niet ‘fout’, maar puur dat er een afwijking is.
- Waartoe dient een steekproefverdeling?
- Welke theorie is belangrijk bij hypothesetesten?
- Welke test statistieken zijn van toepassing?
- Hoe beslis je over de nulhypothese?
- Wat zijn Type I en Type II errors?
- Wat is het verschil tussen één- en tweezijdig testen?
- Wat betekent het als je de nulhypothese verwerpt?
- Is er een alternatieve manier van hypothese testen?
Voorbeelden
Het eerste voorbeeld voor het proces van hypothese testen gaat over cursusevaluaties: is er een relatie tussen hoe studenten een vak beoordelen en welk cijfer ze verwachten te krijgen voor dat vak. Misschien zullen studenten die een vak niet denken te halen of nooit naar de colleges kwamen, het vak onterecht een lage beoordeling geven. Stel dat we een steekproef trekken van 50 vakken, waarbij we een trend vinden dat studenten die denken dat ze een hoog cijfer krijgen, een goede beoordeling geven, en studenten die een laag cijfer verwachten, een lage beoordeling geven. Hoe weten we of dit een trend is, die representatief is voor de populatie, of die een toevalstreffer is in deze steekproef?
Een ander voorbeeld: onderzoekers ontdekten dat als een oude (lage status) auto afsloeg wanneer een stoplicht op groen sprong, 84% van de tijd de auto erachter ging toeteren. Maar, wanneer de auto die afsloeg een dure (hoge status) auto was, toeterden anderen maar 50% van de tijd. Is dit verschil van 84% en 50%:
- Toeval, het komt door steekproef error (random verschillen tussen steeproeven): we kunnen niet concluderen dat de status van een auto toeter-gedrag beïnvloed.
- Een groot en betrouwbaar verschil. Het is geen steekproef error, dus mensen toeteren minder snel naar auto’s met een hoge status.
Om te onderzoeken of iets toeval is of een werkelijk verschil, gebruiken we hypothese testen. Data is vaak ambigue, want hoe weet je nou of het verschil tussen twee groepen komt door de manier waarop de steekproef getrokken is of doordat er daadwerkelijk een verschil is tussen de twee groepen? Wanneer de verschillen tussen gemiddelden zeer klein zijn, zijn deze waarschijnlijk ontstaan door kans. Als een verschil groot is, dan is er waarschijnlijk meer dan alleen kans of toeval in het spel. Maar wanneer is een verschil ‘groot’ of juist ‘klein’? Hiervoor gebruiken we de steekproefverdeling.
Waartoe dient een steekproefverdeling?
Stel dat we onderzoeken hoe lang het duurt om een parkeerplek te verlaten, wanneer iemand staat te wachten om jouw plek in te rijden versus wanneer niemand staat te wachten. Uit het onderzoek blijkt, dat mensen er gemiddeld 32.18 seconden over doen als niemand wacht, en 39.06 als wel iemand staat te wachten (mensen lijken dus langer over uitrijden te doen als iemand wacht). Het zou kunnen dat het gevonden verschil niet voorkomt in de gehele populatie, maar resultaat is van de getrokken steekproeven. Dan is het verschil toe te schrijven aan steekproeferror. De andere verklaring is dat het daadwerkelijk langer duurt om uit een parkeerplek te rijden als er iemand staat te wachten. Maar is het verschil in het voorbeeld groot genoeg om niet meer aan toeval toe te kunnen schrijven?
Een steekproefverdeling geeft aan welke waarden we kunnen verwachten bij een bepaalde statistiek onder vooraf gedefinieerde condities. De standaarddeviatie van deze verdeling, hier genaamd de standaard error van de verdeling, reflecteert de variatie in steekproefgemiddelden bij herhaalde metingen. Met steekproefverdelingen kan bekeken worden hoe groot de kans is dat de vooraf gedefinieerde condities daadwerkelijk bestaan. Het is een verdeling van waarden (de steekproefgemiddelden) voor een bepaalde variabele, bij herhaalde steekproeven (het doorlopen van hetzelfde experiment voor een groot aantal steekproeven).
Een steekproefverdeling van verschillen tussen gemiddelden geeft de verschillen tussen gemiddelden van oneindige paren van random steekproeven weer. We gaan er even vanuit dat de populatie gemiddelden en standaarddeviatie identiek zijn. We trekken dan een heleboel paren van random steekproeven, waarbij we de gemiddelden met elkaar vergelijken. Deze worden vervolgens in een histogramverdeling weergegeven, waarbij het midden van de verdeling bij 0.0 ligt (omdat we verwachten dat, gemiddeld genomen, verschillen tussen steekproefgemiddelden 0.0 zijn). Omdat we weten welk verschil in steekproefgemiddelden we kunnen verwachten wanneer de populaties in geheel gelijk zijn, kunnen we de vraag omdraaien en kijken welke steekproefwaarde een bewijs is dat de populaties niet aan elkaar gelijk zijn.
Laten we teruggaan naar het voorbeeld van de parkeertijd. We willen weten of de vertrektijd wanneer iemand staat te wachten verschilt van wanneer niemand staat te wachten. Een manier om dat te doen is door te testen wat de kans is, dat we een verschil in gemiddelden van 6.88 seconden vinden als de gemiddelden van de populaties gelijk zijn. Stel dat we dit uitrekenen en vinden dat de kans op een verschil in gemiddelden van 6.88 slechts 0.0006 is. Dan kunnen we zeggen: Als de steekproeven getrokken zijn uit populaties met gelijke gemiddelden, dan is de kans om een steekproefgemiddelde verschil te vinden van 6.88 slechts .0006. Dit is een zeer kleine kans, dus kunnen we redelijkerwijs concluderen dat de steekproeven van populaties afkomen met verschillende gemiddelden. Mensen doen er dus langer over om te vertrekken als iemand op hun parkeerplek wacht.
Welke theorie is belangrijk bij hypothesetesten?
De hypothesetest
- Stel een onderzoekshypothese op, bijvoorbeeld mensen doen er langer over om te vertrekken als iemand op hun parkeerplek wacht.
- Verzamel steekproeven van beide condities (tijd met wachtende mensen/niet wachtend).
- Stel een nulhypothese (H0) op, dat de steekproeven van populaties komen met eenzelfde gemiddelde: vertrektijden hangen niet af van het feit of iemand staat te wachten.
- Stel een steekproefverdeling van verschillen tussen gemiddelden op, aangenomen dat H0 waar is.
- Bereken de kans van een gemiddelden verschil minstens zo groot als die we hebben gevonden in de steekproef.
- Beslis op basis van die kans of we H0 kunnen verwerpen of behouden. Als we H0 verwerpen, houdt dat in dat de populatiegemiddelden niet gelijk zijn.
De nulhypothese
De nulhypothese heeft een belangrijke rol in hypothesetesten. Het is soms wat verwarrend omdat we een hypothese opstellen die precies tegengesteld is aan wat we hopen te vinden. De term nulhypothese komt van het feit dat het stelt dat de populatiegemiddelden niet van elkaar verschillen: μ1 – μ2 = 0. We stellen deze hypothese op, omdat we niet kunnen bewijzen dat iets juist is, maar wel dat iets fout is. Daarnaast biedt het een startpunt voor statistische testen. We hebben namelijk vaak geen alternatieve hypothese om mee te starten. Wanneer we de nulhypothese verwerpen, nemen we de alternatieve hypothese aan.
Statistische conclusies
Als we geen significant verschil vinden tussen de steekproefgemiddelden, en de H0 niet verwerpen, hebben we meer problemen om dit te interpreteren. Betekent dit dat de nulhypothese waar is, of is hij voorlopig nog niet verworpen? We kunnen in feite nooit de nulhypothese bewijzen: als we 3000 mensen ontmoeten met twee armen, wil dat niet bewijzen dat alle mensen twee armen hebben. Er kan er nog één rondlopen met één arm. Fisher concludeert dus dat wanneer we de nulhypothese niet kunnen verwerpen, we nog niet genoeg data hebben gevonden om de nulhypothese aan te nemen. Fisher zou meer data gaan verzamelen, en concluderen dat het onderzoek heeft ‘gefaald in het verwerpen van de nulhypothese’.
Neyman en Pearson stellen dat we de nulhypothese simpelweg kunnen accepteren: we zullen hem aannemen als waar, tot het tegendeel wordt bewezen. Hierbij bestaat echter de kans dat we een nulhypothese onterecht accepteren: als waar zien, terwijl hij onwaar is. Om een goede beslissing te nemen moet men rekening houden met de kans dat de nulhypothese ten onrechte geaccepteerd of verworpen wordt.
Welke test statistieken zijn van toepassing?
Voorbeelden van steekproefstatistieken zijn de mediaan, de variantie, de range et cetera. Ze beschrijven steekproefeigenschappen. Teststatistieken hebben betrekking op statistische procedures en hebben hun eigen steekproefverdelingen. Dit zijn statistieken zoals t, F en χ2. De t test wordt onder andere gebruikt om te bepalen of twee steekproeven uit populaties met hetzelfde gemiddelde afkomstig zijn. De nulhypothese is daarbij H0 : μ1 = μ2. We zouden de steekproefverdeling van t empirisch kunnen verkrijgen door oneindig steekproeven te trekken van identieke populaties, t berekenen voor elk steekproefpaar en deze waarden in een grafiek zetten. In dit geval is H0 waar, omdat de steekproeven uit identieke populaties getrokken zijn. Vervolgens kunnen we een bepaalde waarde van t van een steekproef vergelijken met de steekproefverdeling. Deze procedure geldt voor alle teststatistieken: alle steekproefverdelingen kunnen op dezelfde wijze gemaakt worden.
Hoe beslis je over de nulhypothese?
Terug naar het voorbeeld over de wachttijd bij parkeren. We moeten beslissen of een gebeurtenis met een kans van .0006 reden genoeg is om H0 te verwerpen. In de statistiek is hier een vuistregel voor bedacht, namelijk dat we H0 kunnen verwerpen wanneer de kans kleiner of gelijk is aan .05 (p ≤ .05), of anders wanneer deze kleiner of gelijk is aan .01 (iets conservatiever). Deze kanswaarden noemen we ook wel het significantieniveau of verwerpingsniveau van de test. Elke uitkomst met een kans, onder H0, kleiner dan of gelijk aan het significantieniveau valt in het verwerpingsgebied en dus wordt H0 verworpen. In het voorbeeld is het duidelijk dat .0006 kleiner is dan .05.
Wat zijn Type I en Type II errors?
Als we een beslissing nemen in een statistische test, is er altijd een kans dat we de verkeerde kiezen. Als statisticus kunnen we echter vrij goed specificeren wat de kans is dat onze beslissing de verkeerde was. Neem het parkeertijdvoorbeeld. De staat de verdeling van steekproefgemiddelde-verschillen wanneer de nulhypothese waar is, kan weergegeven worden in een normaalverdeling. De werkelijke score die de hoogste 5% markeert (een waarde van X) heet de kritieke waarde. In dit geval is deze waarde 4.94.
H0 verwerpen we wanneer de uitkomst in de hoogste 5% van de verdeling valt, oftewel wanneer deze in het gemarkeerde gebied komt. Maar, in 5% van de gevallen zal de score in dat gebied vallen terwijl de wachttijd in feite niet verschilt tussen de groepen. We hebben dus 5% kans dat we H0 verwerpen terwijl de nulhypothese eigenlijk waar was. Dit type error heet het Type I error, en is de kans om de nulhypothese te verwerpen terwijl hij eigenlijk waar is. We drukken dit uit in α (alfa). Om de kans op een Type I error te verkleinen, kunnen we het significantieniveau verkleinen naar .01. Hiermee vergroten we echter de kans op een Type II error: het aanhouden van H0, terwijl deze onjuist is. De kans hierop is uitgedrukt in β (bèta). Het lastige is dat we niet weten hoe de verdeling eruit ziet als H0 onjuist en de alternatieve hypothese juist is.
De juiste beslissing over hoe groot het significantieniveau moet zijn, hangt af van wat je onderzoekt. Als het belangrijk is om Type I errors te voorkomen (een nieuwe therapie gaan gebruiken terwijl hij eigenlijk niet werkt), dan gebruik je een strenge (kleine) α. Wil je Type II errors voorkomen, dan moet de α groter zijn. In de meeste gevallen zullen we de precieze waarde van β niet weten, omdat we niet weten hoe de werkelijke distributie van een bepaalde populatie is.
In Tabel 3 staan de error types nog een keer opgesomd. De power van een test is de kans op het verwerpen van H0 wanneer die ook daadwerkelijk vals is. Omdat β de kans is op het onjuist aanhouden van H0, staat de power gelijk aan 1 – β.
Tabel 3 |
|
| |
| Werkelijke situatie | ||
Beslissing | H0 is juist | H0 is onjuist | |
H0 verwerpen | Type I error p = α | Juiste beslissing p = 1 – β = power | |
H0 niet verwerpen | Juiste beslissing p = 1 - α | Type II error p = β | |
Wat is het verschil tussen één- en tweezijdig testen?
In het parkeertijdvoorbeeld waren we alleen geïnteresseerd in de gebeurtenis waarbij mensen langer deden over uitrijden wanneer iemand stond te wachten. H0 werd alleen in die situatie verworpen. Stel dat iemand echter 15 seconden sneller uitreed wanneer iemand stond te wachten, dan hadden we H0 niet verworpen ondanks dit enorme verschil. Dit is een eenzijdige of directionele test. Om deze situaties te voorkomen, moeten we specificeren dat we de nulhypothese verwerpen bij een extreem hoge én extreem lage uitkomst. Als we de bovenste 5% en onderste 5% verwerpen, zouden we H0 in totaal 10% van de tijd (α = .10) verwerpen. We moeten dus de laagste en hoogste 2,5% verwerpen. Dit heet tweezijdig of niet-directioneel testen. Het kan hierdoor wel gebeuren dat een score die met een eenzijdige test wel in het verwerpingsgebied viel, nu niet in het verwerpingsgebied valt, omdat het maar 2,5% is i.p.v. 5%.
Tweezijdige testen komen veel vaker voor. Ten eerste omdat we vaak niet weten in welke richting een mogelijk verschil zal voorkomen. Daarnaast is het een voorzorgsmaatregel: ook in het geval waarbij we een verschil een bepaalde kant op verwachten, kun je je hiermee indekken. Ook is het soms lastig om een eenzijdige test te definiëren. De uiteindelijke keus voor eenzijdig of tweezijdig testen is afhankelijk van de ernst van errors.
Wat betekent het als je de nulhypothese verwerpt?
Bij het verwerpen van de nulhypothese is het belangrijk om goed te weten wat dit precies inhoudt. Wanneer we bijvoorbeeld een hypothese verwerpen bij p = .045, betekent dit niet dat de kans dat H0 juist is, .045 is. Wat we aantonen is dat als de nulhypothese juist zou zijn, de kans om een verschil te vinden zoals we hebben gevonden slechts .045 is. Het is een conditionele kans: de kans op de data gegeven dat H0 waar is - p(D|H0).
Is er een alternatieve manier van hypothese testen?
Volgens Jones en Tukey en Harris zijn er drie mogelijke hypothesen: µ1 < µ2, µ1 > µ2 of µ1 =µ2. De derde is de traditionele nulhypothese. Deze nulhypothese kan echter niet juist zijn als er gebruik gemaakt wordt van twee populaties, die op het onderwerp van onderzoek compleet van elkaar verschillen. De nulhypothese is nooit helemaal waar, maar de data laat ons soms niet de mogelijkheid te achterhalen welk gemiddelde groter is. Jones en Tukey stellen voor dat we niet van tevoren een richting bepalen, maar bepalen of het resultaat extreem is aan beide zijden. Wanneer extreem in lage staart: µ1 < µ2, wanneer extreem in hoge staart: µ1 > µ2. Als beide niet kloppen, dan is er onvoldoende data om een keus te maken. Jones en Tukey stellen de kans dat de nulhypothese juist is op .00. Er is hoe dan ook een verschil. De enige fout die gemaakt kan worden is dat de verkeerde richting geconcludeerd wordt. De kans hierop is .025 procent.
De effectgrootte is de grootte van het effect van een bepaalde meting. Hier wordt veel gebruik van gemaakt. Het begrip ‘significant verschil’ wordt gebruikt om aan te tonen dat het statistisch significant is, niet dat het een belangrijk verschil is. Het verschil is niet ontstaan door kans.
Een voorbeeld
In dit voorbeeld werken we het hypothesetesten uit voor een onderzoek naar vingertik snelheid. Uit onderzoek blijkt dat mensen met bepaalde beperkingen minder snel hun vingers kunnen bewegen. We weten van de normale populatie vrouwen dat het gemiddelde 47.8 is met een standaarddeviatie van 5.3. Stel dat we een patiënt hebben met een snelheid van 35. Is dit laag genoeg om een indicatie te zijn voor een beperking?
We stellen een nulhypothese op dat de patiënt niet beperkt is (oftewel dat ze uit een populatie komt met een gemiddelde van 47.8): H0 : μ = 47.8. De alternatieve hypothese is in dit geval dat ze beperkt is, dus dat haar gemiddelde niet gelijk is aan 47.8 (in dit geval is het een eenzijdige test want we zijn alleen geïnteresseerd in een score onder het normale gemiddelde): H1 : μ < 47.8. We kiezen α = .05 als significantieniveau en niet .01, omdat type II fouten erger bevonden worden. Dit zou namelijk betekenen dat we de patiënt niet als beperkt identificeren, terwijl ze dat wel is.
Nu rekenen we de kans uit dat een niet-beperkt persoon een score van 35 behaald. Hiervoor bereken je eerst de z score die bij deze ruwe score hoort.
\[z=\frac{X-\mu}{\sigma}=\frac{35-47.8}{5.3}=-2.42\]
De score van de patiënt is 2.42 standaarddeviaties onder het gemiddelde. In de Appendix vinden we dat de kans om een z waarde gelijk aan of onder -2.42 te krijgen slechts .0078 is. Deze kans is minder dan de 5% significantieniveau en we verwerpen de nulhypothese. De patiënt is waarschijnlijk beperkt.
Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>
Concept of JoHo WorldSupporter
JoHo WorldSupporter mission and vision:
- JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.
JoHo concept:
- As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
- JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.
Join JoHo WorldSupporter!
for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for
- Login of registreer om te kunnen reageren
- 2514 keer gelezen
Work for JoHo WorldSupporter?
Volunteering: WorldSupporter moderators and Summary Supporters
Volunteering: Share your summaries or study notes
Student jobs: Part-time work as study assistant in Leiden
- Login of registreer om te kunnen reageren
- 3132 keer gelezen
- Insurance for emigrants, expats and living abroad: international insurance for expats and emigrants
- Insurance for activities abroad: Backpacking Travel abroad Intern abroad Study abroad Volunteer abroad Work abroad
- Insurance: ACS Globe Traveller Caremed Insurances Expatriate Travel Insurance IMG’s GlobeHopper World Nomads Insurance SafetyWing Insurance JoHo Special ISIS verzekering NL/BE Working Nomad verzekering NL/BE More about Insurance for abroad
Search only via club, country, goal, study, topic or sector
Select any filter and click on Search to see results








