Welke hypothese testen voor gemiddelden zijn er? - Chapter 7
In dit hoofdstuk introduceren we de t test als een procedure voor hypothese testen, in het geval van kwantitatieve data (in plaats van categorische data). Bij kwantitatieve data onderzoeken we verschillen tussen groepen of personen, of de relatie tussen variabelen. We willen bijvoorbeeld onderzoeken of een behandeling effect heeft gehad, door de gemiddelde score van de behandelde groep en de controlegroep te vergelijken.
- Hoe ziet de steekproefverdeling van het gemiddelde eruit?
- Hoe werkt hypothese testen als σ bekend is?
- Hoe werkt hypothese testen als σ onbekend is?
- Waar worden betrouwbaarheidsintervallen voor gebruikt?
- Waarvoor wordt de paired samples t-test gebruikt?
- Hoe werkt het hypothese testen bij twee onafhankelijke steekproeven?
- Hoe ga je om met heterogeniteit van variantie?
Hoe ziet de steekproefverdeling van het gemiddelde eruit?
Wanneer we rekenen met steekproefgemiddelden, moeten we vaak gebruikmaken van de verdeling van het gemiddelde. De verdeling van gemiddelden wordt samengevat in de centrale limietstelling: gegeven een populatie met gemiddelde μ en variantie σ², heeft de steekproefverdeling van het gemiddelde een gemiddelde gelijk aan μ, een variantie gelijk aan σ²/n, en een standaarddeviatie gelijk aan σ/√n. De verdeling wordt steeds normaler naarmate de n (steekproefgrootte) toeneemt. Hoe snel de verdeling normaler wordt bij hogere n is afhankelijk van de vorm van de originele populatie. De steekproefverdeling van het gemiddelde van een populatie die normaal is, zal een normale verdeling hebben onafhankelijk van n. Als de populatie symmetrisch, maar niet-normaal verdeeld is, zal de steekproefverdeling van het gemiddelde bijna normaal zijn. Bij een scheve verdeling van de populatie moet de steekproefgrootte tenminste 30 zijn, om de steekproefverdeling van het gemiddelde normaal te krijgen.
Een uniforme verdeling is een verdeling waarbij elke waarde even waarschijnlijk is. Het heeft een gemiddelde van de helft van de range en een standaarddeviatie van de range gedeeld door de wortel van 12.
Hoe werkt hypothese testen als σ bekend is?
Door de centrale limietstelling weten we alle belangrijke karakteristieken van de steekproefverdeling van het gemiddelde. Wanneer we een populatiegemiddelde onderzoeken, weten we meestal niet de variantie van die populatie. Hier worden de gevallen besproken waarin we σ wel weten.
De Youth Self Report Inventory (YSR) wordt gebruikt om gedragsproblemen bij kinderen te meten. De test is uitgebreid afgenomen over de hele wereld, waardoor populatiegemiddelde en standaarddeviatie bekend zijn (50 en 10). Stel dat we gedragsproblemen onderzoeken bij een steekproef van kinderen (n = 150) van depressieve ouders. We willen weten of die meer of minder gedragsproblemen hebben dan ‘het gemiddelde kind’. De hypotheses zijn:
- H0 : μ = 50
- H1 : μ ≠ 50. (deze alternatieve hypothese is tweezijdig, we verwerpen H0 bij zowel een hoger of lager gemiddelde).
Uit ons onderzoek komt een steekproefgemiddelde van 54.64. Voor de hypothesetest beginnen we met de standaardformule voor z, die we aanpassen naar gemiddelde en standaardfout (in plaats van score en standaarddeviatie).
\[z=\frac{X-\mu}{\sigma}\] wordt
\[z=\frac{\bar{X}-\mu}{\sigma\bar{X}}=\frac{\bar{X}-\mu}{\frac{\sigma}{\sqrt{n}}}\]
In dit geval is de z = (56,65-50)/ (10/√150) = 6,64/0,816 ≈ 8,14
De gevonden z kan vervolgens opgezocht worden in de Appendix z. In dit geval is het een significante z-score.
Bij het hypothesetesten van een steekproefgemiddelde tegen een populatiegemiddelde, moeten we aannemen dat de steekproefverdeling van het gemiddelde (vrijwel) normaal is. Dit kunnen we aannemen wanneer ofwel de populatie normaal verdeeld is, ofwel wanneer de steekproefgrootte groot genoeg is.
Hoe werkt hypothese testen als σ onbekend is?
Over het algemeen weten we de waarde van σ niet, en moeten we die schatten met de steekproef standaarddeviatie (s). Wanneer we σ vervangen door s, kunnen we echter niet meer gebruikmaken van de z formule, maar gebruiken we de t test.
De t test gebruikt s² als schatting van σ². Het probleem hierbij is, dat de verdeling van s² positief scheef is, vooral bij kleine steekproeven. Door die scheefheid zal een waarde van s² al snel de grootte van σ² onderschatten, zeker bij kleinere steekproeven. Doordat s² waarschijnlijk kleiner is dan σ² en in de noemer staat, zal de t waarde waarschijnlijk groter zijn dan de z waarde zou zijn. Hierdoor kunnen we niet in de z-tabel kijken, omdat er dan in meer dan 5% type I fouten gemaakt worden. De oplossing voor dit probleem is de t verdeling. Deze is in de Appendix te vinden.
\[t=\frac{\bar{X}-\mu}{s\bar{X}}=\frac{\bar{X}-\mu}{\frac{s}{\sqrt{n}}}=\frac{\bar{X}-\mu}{\sqrt{\frac{s^2}{n}}}\]
Wanneer de verdeling van s2 verdwijnt door meer vrijheidsgraden, zal s de populatie standaarddeviatie ook minder onderschatten. Hierdoor zal t normaler verdeeld zijn en meer op z lijken. De verdeling van t maakt gebruik van n - 1 vrijheidsgraden.
Voorbeeld
Als voorbeeld gebruiken we een studie naar laag geboortegewicht (LGG) bij kinderen. Deze kinderen ontwikkelen vaak problemen, waaronder niet-responsief of onvoorspelbaar zijn. Een interventie trainde moeders om beter op hun kinderen te reageren, met de verwachting dat de moeilijkheden door LGG zouden verminderen. Er waren drie groepen: een LGG experimentele groep, een LGG controlegroep en een normaal geboortegewicht groep. Een psychomotorische test werd afgenomen bij de kinderen toen ze 6 maanden oud waren.
Een eerste stap is het onderzoeken van de data op scheefheid, door bijvoorbeeld een steel-en-blad display te maken. Een gebrek aan scheefheid geeft aan, dat de steekproefverdeling van het gemiddelde eerder normaal zal zijn. Ook moet gecheckt worden of er geen of weinig uitschieters zijn, die de uitkomsten kunnen beïnvloeden (bijvoorbeeld door middel van een boxplot). Uit het onderzoek komt een gemiddelde van 103.24 uit de LGG groep, met een standaarddeviatie van 13.51. De normen voor de psychomotorische test stellen een gemiddelde van 100. De steekproefgrootte van dit onderzoek is 56. Met een t test onderzoeken we of dit verschil significant is.
- t = (103,24 - 100) / (13,51/√56≈ 1,79, met 51-1 = 50 vrijheidsgraden
In dit geval willen we tweezijdig testen, dus bij een overschrijdingskans van 2,5% aan elke kant. In Appendix t hoort bij t0.025 een kritieke waarde van 2.009. De notatie hiervan is t0.025(50) = 2.009. In het geval van tverkregen > t0.025 kunnen we concluderen dat de nulhypothese verworpen kan worden: LGG kinderen testen significant hoger op de psychomotorische test dan kinderen met een normaal geboortegewicht.
Bootstrapping
Bij bootstrapping trek je uit de verkregen data een groot aantal steekproeven (vergelijkbaar met het trekken van steekproeven uit een populatie). Door herhaalde steekproeven trekken, krijg je een verdeling van steekproefgemiddelden waarmee je hypotheses kunt testen of waarmee je de variabiliteit van een statistiek kan schatten.
Waar worden betrouwbaarheidsintervallen voor gebruikt?
Betrouwbaarheidsintervallen kunnen helpen in het beschrijven van resultaten uit het hypothesetesten. Wanneer we een specifieke schatting hebben van een parameter, noemen we dat een puntschatting. Er zijn daarnaast ook intervalschattingen, die de grenzen aangeven waarbinnen waarschijnlijk het ware populatiegemiddelde (μ) ligt. Dit zijn de betrouwbaarheidsgrenzen, die het betrouwbaarheidsinterval maken. We willen weten hoe hoog en hoe laag de μ-waarde kan zijn, waarbij we H0 nog niet verwerpen. Dit geeft dan de grenzen aan waarbinnen we de nulhypothese behouden. Een makkelijkere manier is om de formule voor t in te vullen met de kritieke waarde van t die je eerder hebt gevonden. De kritieke waarde is een absolute waarde en kan dus negatief of positief zijn (een kritieke waarde van 2.50 is dus ook -2.50).
Stel dat we weten dat x̄ = 1.5, s = 0.5, n = 10. Wanneer we tweezijdig testen is de kritieke waarde van t bij α = .05 bij t.025(9): 2.262. De formule wordt dan:
\[\frac{1.5-\mu}{\frac{0.5}{\sqrt{10}}}\pm 2.262\]
- Dit kan je herschrijven als μ = ± 2,262(0,158) + 1,5 = ± 0,357 + 1,5
- μboven = + 0,357 + 1,5 = 1,86
- μonder = - 0,357 + 1,5 = 1,14
Het 95% betrouwbaarheidsinterval wordt: CI.95 = 1,14 < μ < 1,86. De kans is 95% dat μ tussen 1,14 en 1,86 valt. Het wordt ook wel het geloofwaardigheidsinterval genoemd. Als μ buiten dit interval valt leidt dit tot het afwijzen van de nulhypothese. Goed om te weten is dat μ constant blijft, maar dat het interval van experiment naar experiment veranderd.
Extreme waarden vinden
Door middel van de z formule is het mogelijk om waarden te ontdekken die ‘extreem’ zijn. Dit wordt bijvoorbeeld gebruikt om mensen te selecteren voor een behandeling, waarbij mensen die meer dan 1,5 standaarddeviatie van het gemiddelde afwijken, uitgekozen worden. Bij een gemiddelde van 50 en standaarddeviatie van 10 ziet het er als volgt uit:
- z = 1,5. 1,5 = (X-50)/10. X is dan 1,5(10) + 50 = 65. Iedereen die boven de 65 scoort, wordt geselecteerd.
Bij single case studies kan de t-verdeling gebruikt worden en wordt de individuele score behandeld als een steekproef van n = 1. We gebruiken de formule:
\[\frac{(X_1-\bar{X})}{s\sqrt{\frac{n+1}{n}}}\]
Stel ons gemiddelde is 40 en de standaarddeviatie is 8 van een steekproef met 10 mensen. De individuele score is 31. t is dan (31-40)/9√11/10 ≈ 1,05. Er zijn 9 vrijheidsgraden en de kritische waarde voor α=.05 hierbij is 1,83. Deze persoon scoort dus niet extreem.
Om een t-test uit te voeren met SPSS dienen de volgende stappen genomen te worden: Analyze > Compare Means > One Sample t Test. De grenzen van het betrouwbaarheidsinterval in SPSS zijn altijd 1,00 minder dan als ze met de hand uitgerekend worden.
Waarvoor wordt de paired samples t-test gebruikt?
Soms hebben we herhaalde metingen, waarbij participanten meerdere keren een test krijgen en we het verschil tussen hun gemiddelden willen onderzoeken. Hiervoor gebruiken we de paired samples t-test, of herhaalde metingen t-test.
Stel dat we meisjes met anorexia laten meedoen aan een interventie, en hen wegen voor en na de interventie. Het verschil in gewicht toont aan, hoeveel ze zijn aangekomen tijdens de interventie. De vraag is of dit door de therapie komt of bijvoorbeeld door het verstrijken van tijd. We testen de nulhypothese dat het gemiddelde in de populatie voor de interventie gelijk is aan het gemiddelde na de interventie, oftewel H0 : μvoor = μna
De scores van voor en na de behandeling kunnen verwerkt worden in één set scores: verschilscores, waarbij je μvoor - μna berekend. Als H0 waar is en de behandeling geen effect had, dan zal het gemiddelde van de verschilscores nul zijn. De nulhypothese wordt nu dat het gemiddelde van de verschilscores (μD) gelijk is aan nul:
- μD = μvoor - μna = 0.
Nu kunnen we de t statistiek weer uitrekenen (met D als gemiddelde van verschilscores en sD als de standaarddeviatie en n is het aantal verschilscores):
\[t=\frac{\bar{D}-\mu}{s_{\bar{D}}}=\frac{\bar{D}-\mu}{s_D\sqrt{n}}\]
- In dit geval is μ = 0, want dat is de nulhypothese.
Het aantal vrijheidsgraden is wederom n-1. Er gaat één vrijheidsgraad verloren, omdat de variantie van de verschilscores een schatting is van de populatievariantie en deze verkregen wordt door middel van het steekproefgemiddelde. Het betrouwbaarheidsinterval is op dezelfde manier te berekenen als de one sample t-toets.
Effectgrootte
Ook bij het werken met verschilscores zijn effectgroottes van groot belang. Bij verschilscores wordt het effect uitgedrukt met Cohen’s d. Cohen rapporteerde effect met de volgende formule:
\[d=\frac{\mu_1-\mu_2}{\sigma}\]
Een verschilscore kan worden weergegeven als getal, als percentage, of zoals bij Cohen’s d als standaarddeviatie eenheid. De teller bevat het verschil tussen de populatiegemiddelden, terwijl de noemer de standaarddeviatie weergeeft van één van de populaties (en niet van de verschilscores). Deze formule kan ook gebruikt worden met steekproefresultaten, waarbij μ1 - μ2 vervangen wordt door X1-X2 en σ vervangen wordt door sx1. De d wordt dan weergegeven met een dakje erboven, omdat het een schatting is. Uit het voorbeeld van de anorexia interventie kwam een d van 1.45. Dit houdt in, dat de meisjes gemiddeld 1.5 standaarddeviatie van hun gewicht vóór de interventie aan waren gekomen. In andere situaties wordt soms de gemiddelde standaarddeviatie van de twee populaties genomen.
De paired sample t-toets kan gebruikt worden als de steekproeven gerelateerd (of gecorreleerd) zijn. Dat kan wanneer elke persoon twee scores heeft, zoals voor en na de behandeling. Maar ook wanneer bijvoorbeeld man en vrouw getest worden op huwelijkse tevredenheid. Wat alle experimenten met elkaar gelijk hebben is dat de ene score wat zegt over de andere score in het paar, oftewel de scores zijn gerelateerd.
Wanneer er bepaalde data mist, bijvoorbeeld als de vrouw wel, maar de man niet de vragenlijst over hun kind heeft ingevuld. Normaal worden de incomplete paren eruit gegooid en de gepaarde t-toets uitgevoerd op e overige data. Het kan echter ook op een andere manier waarbij wel alle data gebruikt wordt, maar men er vanuit gaat dat de gemiste data random is en niet systematisch. Er is een test die de t-waarde neemt voor de paren waar beide scores aanwezig zijn en de t-waarde voor de incomplete paren. Vervolgens worden deze t-statistieken gecombineerd. Dit wordt vooral gebruikt als er veel data mist.
Notatie
Stel dat we de resultaten willen opschrijven van de anorexia-interventie. Dit zou er als volgt uit kunnen zien: ‘Van 16 patiënten werd het gewicht voor en na de interventie gemeten. De gemiddelde gewichtstoename voor de N = 16 meisjes was 6.52 pond, met een standaarddeviatie van 7.21. Een tweezijdige t-test op gewichtstoename was statistisch significant (t(15) = 3.98, p < .05). Gemiddeld genomen nam het gewicht van de patiënten toe tijdens de interventie. Het 95% betrouwbaarheidsinterval was 3.12 – 10.80. Cohen’s d = 1.6 toont aan dat de gewichtstoename meer dan 1.5 standaarddeviaties van het oorspronkelijke gewicht was.’
Hoe werkt het hypothese testen bij twee onafhankelijke steekproeven?
De t test wordt het meest gebruikt bij testen van verschillen tussen twee onafhankelijke groepen. Bijvoorbeeld wanneer we prestaties vergelijken tussen een controlegroep en een experimentele groep (die een bepaalde behandeling heeft ondergaan). We willen weten of het verschil groot genoeg is om er vanuit te gaan dat de twee steekproeven uit verschillende populaties komen.
Verdeling van verschillen tussen gemiddelden
Wanneer we gemiddelden van twee verschillende populaties vergelijken, testen we een nulhypothese in de vorm van H0 : μ1 – μ2 = 0. Hierbij hoort een steekproefverdeling van alle mogelijke verschilscores tussen de populatiegemiddelden. In het geval van twee normaal verdeelde populaties, is de verdeling van verschilscores ook een normaal verdeling. De variantie van deze verdeling kun je vinden door de variantie som wet: de variantie van een som of verschil van twee onafhankelijke variabelen is gelijk aan de som van hun varianties.
\[\sigma^2_{X_1-X_2}=\sigma^2_{X_1}+\sigma^2_{X_2}=\frac{\sigma^2_1}{n_1}+\frac{\sigma^2_2}{n_2}\]
De t statistiek
Voor de t formule hebben we de standaardfout van verschillen tussen gemiddelden, s², nodig. Onze ‘score’ bij testen van onafhankelijke steekproeven is de verschilscore van gemiddelden Het gemiddelde van de steekproefverdeling is μ1 – μ2 = 0, dus deze kunnen we weglaten uit de formule.
\[t=\frac{(X_1-X_2)-(\mu_1-\mu_2)}{\sqrt{\frac{s^2_1}{n_1}+\frac{s^2_2}{n_2}}}=\frac{X_1-X_2}{\sqrt{\frac{s^2_1}{n_1}+\frac{s^2_2}{n_2}}}\]
Gepoolde varianties
De eerder gegeven formule voor t kan alleen gebruikt worden bij gelijke steekproefgroottes. Wanneer de steekproeven niet even groot zijn, moeten de varianties worden aangepast. Dit heet de gepoolde variantie. Vaak nemen we aan dat σ²1 = σ²2 (de steekproeven komen uit populaties met gelijke varianties). Wat we ook kunnen doen, is de steekproefvarianties nemen die we hebben gevonden (s²1 en s²2) en een gewogen gemiddelde maken van die twee (op basis van hun vrijheidsgraden). Deze nieuwe schatting s²p (p van ‘pooled’), wordt de gepoolde variantie schatting genoemd:
\[s^2_p=\frac{(n_1-1)s^2_1+(n_2-1)s^2_2}{n_1+n_2-2}\]
- De teller bevat de gewogen som van varianties en de noemer de som van de gewichten.
De t formule wordt met de gepoolde variantie:
\[t=\frac{X_1-X_2}{\sqrt{s^2_p(\frac{1}{n_1}+\frac{1}{n_2})}}\]
Er wordt gewerkt met n1 + n2 - 2 vrijheidsgraden.
Betrouwbaarheidsinterval
Ook bij een t test van verschillen tussen gemiddelden is een betrouwbaarheidsinterval nuttig. Deze is exact hetzelfde als bij een enkele steekproef, alleen is het gemiddelde vervangen door het verschil tussen gemiddelden, en de standaardfout een standaardfout van gemiddelden. De formule voor een 95% betrouwbaarheidsinterval wordt:
\[\text{CI}_{.95}=(X_1-X_2)\pm t_{.025}^{s\bar{X}_1-\bar{X}_2}\]
De notatie van het betrouwbaarheidsinterval is bijvoorbeeld 3.02 ≤ (μ1 – μ2) ≤ 9.54. De kans .95 dat het ware verschil tussen populatiegemiddelden in dit interval valt.
Effectgroottes
Voor effectgrootte kunnen we weer gebruikmaken van Cohen´s d, maar nu is de standaarddeviatie de gepoolde variantie van de twee populaties.
\[d=\frac{X_1-X_2}{s_p}\]
Ook voor effectgroottes kan een betrouwbaarheidsinterval worden opgesteld
Als interpretatie van effectgroottes heeft Cohen wat algemene richtlijnen opgesteld:
- d = .20 is een klein effect
- d = .50 een medium effect
- d = .80 een groot effect
Het noteren van de resultaten van een onafhankelijke t-toets is gelijk aan het noteren bij een gepaarde t-test.
Hoe ga je om met heterogeniteit van variantie?
Een van de voorwaarden voor de t test is homogeniteit van variantie (σ²1 = σ²2). Pas bij homogeniteit van variantie kunnen we t bepalen, eventueel na poolen van de steekproefvarianties.
Bij heterogene varianties laten we het poolen achterwege:
\[t'=\frac{X_1-X_2}{\sqrt{\frac{s^2_1}{n_1}+\frac{s^2_2}{n_2}}}\]
- waarbij we uitgaan van heterogene varianties.
Helaas is de steekproefverdeling van t’ niet bekend, maar wel een benadering hiervan. Een voorbeeld is de Welch-Satterthwaite oplossing. Zij stellen het aantal vrijheidsgraden op:
\[df'=\frac{(\frac{s^2_1}{n_1}+\frac{s^2_2}{n_2})}{\frac{(\frac{s^2_1}{n_1})^2}{n_1-1}+\frac{\frac({s^2_2}{n_2})^2}{n_2-1}}\]
Hoe bepalen we of de varianties heterogeen zijn, aangezien we de populatie varianties niet weten? Levene stelde voor elke X-waarde te verplaatsen met de absolute afwijking van het groepsgemiddelde:
\[d_{ij}=|X_{ij}-\bar{X}_j|\]
Vervolgens kan een two-sample t-toets op de dijs uitgevoerd worden. Wanneer t significant is verschillende varianties van de twee groepen.
De t toets is robuust, oftewel niet (of amper) beïnvloedt door kleine afwijkingen van de onderliggende assumpties. Er zijn twee assumpties voor de onafhankelijke t-toets: (1) normaliteit van de steekproefverdeling van verschillen tussen gemiddelden en (2) homogeniteit van de variantie. Daarnaast is het relevant of de steekproefgroottes gelijk of ongelijk zijn. Als de steekproefgroottes gelijk zijn is het overschrijden van de homogeniteitsassumptie van weinig belang. Als de ware populatie ongeveer de gelijke vorm heeft als die van de steekproef of als ze beide symmetrisch zijn, zijn schendingen van normaliteit niet zo erg. Bij scheve verdelingen ontstaan serieuze problemen, tenzij de varianties gelijk zijn.
Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>
Concept of JoHo WorldSupporter
JoHo WorldSupporter mission and vision:
- JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.
JoHo concept:
- As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
- JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.
Join JoHo WorldSupporter!
for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for
- Login of registreer om te kunnen reageren
- 2523 keer gelezen
Work for JoHo WorldSupporter?
Volunteering: WorldSupporter moderators and Summary Supporters
Volunteering: Share your summaries or study notes
Student jobs: Part-time work as study assistant in Leiden
- Login of registreer om te kunnen reageren
- 2986 keer gelezen
- Insurance for emigrants, expats and living abroad: international insurance for expats and emigrants
- Insurance for activities abroad: Backpacking Travel abroad Intern abroad Study abroad Volunteer abroad Work abroad
- Insurance: ACS Globe Traveller Caremed Insurances Expatriate Travel Insurance IMG’s GlobeHopper World Nomads Insurance SafetyWing Insurance JoHo Special ISIS verzekering NL/BE Working Nomad verzekering NL/BE More about Insurance for abroad
Search only via club, country, goal, study, topic or sector
Select any filter and click on Search to see results








