Welke basisconcepten van kansberekening zijn belangrijk? - Chapter 5
In hoofdstuk 3 is al een begin gemaakt met kansberekening, bijvoorbeeld wanneer je ziet dat 19% van de kinderen tussen de 52 en 56 scoort: je kunt concluderen dat de kans dat een random kind tussen deze scores valt .19 is.
- Welke visies op kansberekening zijn er?
- Welke regels zijn van toepassing bij kansberekening?
- Wat zijn gezamenlijke en conditionele kansen?
- Wat is het verschil tussen discrete en continue variabelen?
- Wat zijn permutaties en combinaties?
- Wat is de stelling van Bayes?
- Hoe gebruik je de binomiale verdeling bij hypothese testen?
- Wat is een multinomiale verdeling?
Welke visies op kansberekening zijn er?
Bij voorbeelden over kansberekening wordt vaak gebruikt gemaakt van smarties (zoals M&M’s). Stel dat we weten welk percentage van elke kleur in een zak zit (bruin = 13%, rood = 23%, geel = 30%, groen = 34%). De kans om een gele smartie te pakken is .30. Dit voorbeeld toont één definitie van kansberekening:
Als iets op A manieren kan gebeuren en op B manieren niet kan gebeuren, en als de kans op elke mogelijke manier even groot is (elke smartie in de zak heeft evenveel kans om gepakt te worden) dan is de kans op een gebeurtenis A/(A+B) en de kans dat het niet gebeurt B/(A+B). De kans op een gele smartie is .30, en er zitten 100 smarties in de zak. Het kan dus 30 keer voorkomen dat een gele smartie wordt gepakt, en 70 keer dat een andere wordt gepakt. De kans op A is: p(A) = 30/(30+70) = .30.
Deze visie op kansberekening is de analytische visie.
Een andere visie is de frequentische visie: wanneer we telkens een smartie uit de zak graaien en telkens het totaal weer aanvullen tot 100, dan zullen we ontdekken dat ongeveer 30% van de keren er een gele smartie gepakt wordt. Hoe groter het aantal ‘steekproeven’, hoe dichter deze frequentie bij de werkelijke waarde (namelijk 30%) zal komen.
Een derde visie is de subjectieve kansberekening: kansberekening op basis van onze subjectieve overtuiging van kans. Bayes stelling is hier essentieel voor. Elke aanpak leidt tot hetzelfde resultaat.
Terminologie
In de kansberekening spreekt men vaak over een gebeurtenis: een stukje data in feite. Een gebeurtenis kan verwijzen naar van alles: het trekken van een koning uit een stapel kaarten, een bepaalde score op een vragenlijst, of als we smarties uit een zak pakken, zijn de gebeurtenissen de 6 verschillende mogelijke kleuren.
Twee gebeurtenissen zijn onafhankelijk van elkaar, wanneer het voorkomen (of niet voorkomen) van de één geen effect heeft op het wel of niet voorkomen van de ander.
Wanneer een gebeurtenis de ander uitsluit, zijn deze twee gebeurtenissen wederzijds exclusief. Je kunt bijvoorbeeld niet in het eerste jaar én het tweede jaar zitten. Een set gebeurtenissen is allesomvattend of grondig wanneer het alle mogelijke uitkomsten bevat. De gebeurtenissen ‘eerstejaars, tweedejaars of derdejaars’ zijn allesomvattend voor bachelor studenten waarbij de bachelor drie jaar heeft.
Kansen vallen tussen de 0.00 en 1.00. De kans 1.00 geeft aan dat de gebeurtenis hoe dank ook plaatsvindt en bij 0.00 vindt de gebeurtenis sowieso niet plaats.
Welke regels zijn van toepassing bij kansberekening?
Twee sets regels zijn het belangrijkst in de kansberekening: de additieve en vermenigvuldigingsregels.
1. De additieve regel.
We weten hoe we de kans kunnen berekenen om een gele smartie uit de zak te halen, of juist een groene. Maar wat als ik wil weten wat de kans is op een gele of groene, in plaats van een andere kleur in de mix?
Gegeven een set wederzijds exclusieve gebeurtenissen, is de kans op het voorkomen van een of andere gebeurtenis gelijk aan de som van afzonderlijke kansen.
Dus: p(groen of geel) = p(groen) + p(geel). Met de exclusiviteit wordt bedoeld dat als een getrokken smartie groen is, hij niet geel kan zijn.
2. De vermenigvuldigingsregel.
Stel dat ik twee smarties pak, en de eerste vervang voordat ik de tweede pak. Wat is de kans dat ik bij de eerste keer pakken een gele pak, en bij de tweede keer weer?
De kans op het gezamenlijk voorkomen van twee of meer onafhankelijke gebeurtenissen is gelijk aan het product van hun individuele kansen.
Dus in dit geval: p(geel, geel) = p(geel) x p(geel). Daarbij is het weer belangrijk dat de twee gebeurtenissen onafhankelijk zijn. Zo kan je ook zeggen: p(vrouw, geboren in januari) = .50 x 1/12 = .042 (geslacht en geboortemaand zijn niet afhankelijk van elkaar).
Deze regels zijn te combineren. Wat is bijvoorbeeld de kans dat ik een groende en gele smartie pak, ongeacht de volgorde waarin ik ze pak? P(groen, geel) = .34 x .30 en de kans op p(geel, groen) = .30 x .34. De totale kans is deze twee opgeteld.
Steekproef met vervanging
In het smarties voorbeeld werden steekproeven getrokken, waarbij telkens de gepakte smartie werd vervangen. Door dit vervangen blijft de kans op een bepaald kleur smartie gelijk. Als we smarties niet vervangen, dan hangt de kans op een gele smartie in Steekproef 2 af, van welke smartie in Steekproef 1 werd gepakt.
Wat zijn gezamenlijke en conditionele kansen?
Een gezamenlijke kans is simpelweg de kans op het samengaan van twee of meer gebeurtenissen. Bijvoorbeeld de kans dat een verdachte zowel blank is, en de doodstraf krijgt (in een studie, die blanken en niet-blanken hierin vergelijkt). Gezamenlijke kans is genoteerd als p(A, B). Als de twee gebeurtenissen onafhankelijk zijn, kunnen we de kans makkelijk berekenen met een vermenigvuldiging. Zo niet, dan is er een andere berekening nodig (die komt later).
Een conditionele kans is de kans dat een gebeurtenis voorkomt, gegeven dat een andere gebeurtenis is voorgekomen. Dit is bijvoorbeeld de kans dat een persoon aids oploopt, gegeven het feit dat hij of zij via injecties drugs heeft gespoten. Deze kansen zijn vaak genoteerd als ‘als … zo is, dan …’ De conditionele kans wordt genoteerd als p(A | B), zoals p(aids ∣ drugsgebruik).
Voorbeeld
Stel dat een radiostation 100 mensen interviewt over het gebruik van gordels en daarbij ook vraagt of ze kinderen hebben. In Tabel 4 staan de uitkomsten weergegeven.
Tabel 4 |
|
|
|
Kinderen | Wel gordel dragen | Niet gordel dragen | Totaal |
Wel kinderen | 15 | 5 | 20 |
Geen kinderen | 15 | 65 | 80 |
Totaal | 30 | 70 | 100 |
De simpele kans dat iemand uit de steekproef een gordel draagt is 30/100 = .30. De gezamenlijke kans dat iemand kinderen heeft en een gordel draagt is 15/100 = .15 (let op: hier is de kans niet te berekenen door vermenigvuldigen van kansen, want uit het onderzoek blijkt dat ouderschap en gordel dragen niet onafhankelijk zijn van elkaar). De conditionele kans dat iemand een gordel draagt, gegeven dat hij kinderen heeft, is 15/20 =.75.
Wat is het verschil tussen discrete en continue variabelen?
Een discrete variabele kan een beperkt aantal waarden aannemen, terwijl een continue variabele in principe een oneindig aantal verschillende waarden heeft. Een discrete variabele neemt een waarde aan van het kleine aantal mogelijke waarde. Als een variabele vele mogelijke waarden heeft die tenminste van ordinale schaal zijn, wordt deze variabele als continue variabele behandeld. De distributies van de twee soorten variabelen verschillen ietwat als het op kansberekening aankomt. Met discrete variabelen kan je spreken van de kans op een specifieke uitkomst, bij continue variabelen spreek je van de kans op een uitkomst binnen een interval.
Discreet
Wanneer we een discrete variabele uitzetten in een grafiek, krijg je een histogram met voor elke waarde van de variabele (X-as) een bepaalde frequentie (Y-as). Een voorbeeld is een onderzoek naar levensgeluk, waarbij mensen op een 5-punt schaal aan kunnen geven hoe gelukkig ze zijn (1=helemaal niet, tot 5=helemaal wel). De relatieve frequentie per antwoordcategorie (ook wel de proportie) kan direct omgezet worden in een kans. Dus, wanneer 38 mensen van een steekproef van 100 aangeven dat ze ‘erg gelukkig zijn, is de kans dat iemand ‘erg’ antwoordt .38.
Continue
Bij een continue variabele ziet de grafiek er heel anders uit. Er zijn geen aparte frequenties aan te geven in staven, maar de grafiek is een grillige, aaneengesloten lijn. Hoe normaler de verdeling, hoe meer deze lijn op een belvorm zal lijken. De Y-as wordt hierbij als dichtheid gelabeld. Je kan dit het beste zien als de hoogte van de curve bij verschillende X-waarden. Dichtheid kan niet direct omgezet worden in een kans. Een voorbeeld is de verdeling van ‘leeftijd moeder bij eerste geboorte’. Het heeft hierbij geen zin om uitspraken te doen over specifieke uitkomsten, want er zullen bijvoorbeeld maar weinig mensen zijn die precies op hun 20e jaar de bevalling van hun eerste kind hebben. het is logischer om van intervallen te spreken, namelijk ongeveer 20 jaar. In dat geval kunnen we een staaf maken in de grafiek van de ondergrens naar de bovengrens van het interval, en dan geldt dat: de oppervlakte van de staaf, gedeeld door de oppervlakte onder de gehele distributielijn, gelijk is aan de kans op een score in dat interval.
Wat zijn permutaties en combinaties?
Permutaties en combinaties zijn concepten die vallen binnen de combinatoriek: de afdeling binnen de wiskunde die zich bezighoudt met het bepalen op hoeveel manieren objecten samengevoegd kunnen worden (op hoeveel manieren kan ik twee winnaars uit vijf kandidaten kiezen).
Permutaties
Stel dat we een loterij hebben met vier mogelijke prijzen (300, 200, 100 en 0 euro), en vier mensen doen mee (A, B, C en D). Hun namen gaan in een hoed en de eerste naam die eruit komt, wint de eerste prijs, et cetera. Van elke mogelijke volgorde waarin de namen uit de hoed komen, is een rijtje te maken: ABCD, ABDC, ACBD etc. Elke volgorde is een unieke code of permutatie van de vier namen. De formule is:
\[P^r_n=\frac{N!}{(N-r)!}
- Waarbij er N objecten zijn die in r keer gepakt worden.
- Het symbool N! wordt gelezen als N factoriaal en is het product van alle mogelijkheden van N tot 1. 0! is altijd 1.
Voor ons voorbeeld geldt:
\[P^4_4=\frac{4!}{(4-4)!}=\frac{4!}{0!}=\frac{(4\times3\times2\times1)}{1}=24\]
Dit geeft aan dat er 24 permutaties gemaakt kunnen worden.
In het geval dat we alleen de eerste twee lootjes een prijs geven, is de formule simpelweg:
\[P^4_2=\frac{4!}{(4-2)!}=\frac{(4\times3\times2\times1)}{2}=12\]
- Twaalf permutaties zijn mogelijk.
Combinaties
Combinaties verschillen van permutaties, in dat we nu niet meer kijken naar de volgorde waarin we objecten selecteren. Dus in het geval van de loterij trekken we twee namen uit de hoed, maar beiden krijgen dezelfde prijs. Het resultaat AB is dan hetzelfde als BA; we zijn alleen geïnteresseerd in combinaties. De formule hiervoor is:
\[C^n_t=\frac{N!}{r!(N-r)!}
In het voorbeeld:
\[C^4_2=\frac{4!}{2!(4-2)!}=\frac{(4\times3\times2\times1)}{(2\times1\times2\times1)}=6\]
In andere woorden: met vier deelnemers kunnen we zes verschillende sets winnaars kiezen.
Wat is de stelling van Bayes?
De stelling van Bayes heeft betrekking op kansberekening. Het vertelt ons hoe we kansberekeningen kunnen aanpassen als we telkens meer informatie hierover krijgen. Stel dat je moet aangeven hoe groot je de kans schat dat Frank is vermoord door Piet (je weet alleen dat jij Piet niet aardig vindt). Je schat de kans op p = .10. Dan krijg je te horen dat Piet rond het tijdstip van de moord in de buurt van Franks huis is gezien. Je vergroot de kans tot p = .30 (et cetera). Bij Bayes’ stelling zijn kansen meestal subjectieve kansen.
Een voorbeeld
Een fietser heeft een steroïde test ondergaan en is positief bevonden. Hij beweert onschuldig te zijn. Wat is de kans dat hij schuldig of juist onschuldig is? We beginnen met de voorafgaande kans: namelijk de kans dat de fietser een drugsgebruiker is, voordat we verdere informatie verzamelen (uit statistieken blijkt, dat 15% van de fietsers steroïden gebruikt). Wat we willen weten, is de latere (posterior) kans, namelijk de kans nadat we aanvullende data hebben gekregen. We hebben aanvullende data (Tabel 5): 96% van de steroïde gebruikers test positief op de steroïde test. 8% van de niet-gebruikers test ook positief.
Tabel 5 |
|
|
Kansen | p | Informatiebron |
p(fietser is gebruiker) p(G) | .15 | Bekend uit statistieken |
p(fietser is niet-gebruiker) p(NG) | .85 | “ |
p(fietser is gebruiker en positief getest) p(P | G) | .96 | Van steroïde test bedrijf |
p(fietser is niet-gebruiker en positief getest) p(P | NG) | .08 | “ |
p(fietser is positief getest en blijkt gebruiker te zijn) p(G | P) | ? | Ons doel |
Met Bayes’ stelling kunnen we de kans berekenen dat de geteste fietser steroïden heeft gebruikt. G staat voor gebruiker, NG voor niet-gebruiker en P voor positieve test.
\[p(G|P)=\frac{p(P|G)\cdotp(G)}{p(P|G)\cdotp(G)+p(P|NG)\cdotp(NG)}=\frac{(.96)\cdot(.15)}{(.96)\cdot(.15)+(.08)\cdot(.85)}=\frac{.144}{.144+.068}\approx{.68}\]
Vóór de drugstest bekend was, zouden we de subjectieve kans op zijn schuld schatten op .15 (op basis van eerdere statistieken). Nu is de kans veel groter.
De algemene formule is:
\[\frac{p(D|H)\cdotp(H)}{p(D|H)\cdotp(H)+p(D|\bar{H})\cdotp(\bar{H})}\]
- Hierbij staat H voor hypothese, D voor data en H voor ‘niet H’.
Binomiale distributie
Een van de bekendste kansverdelingen is de binomiale verdeling. Deze verdeling wordt gebruikt wanneer elke kanstrekking resulteert in een of twee wederzijds exclusieve uitkomsten. Deze kanstrekkingen worden ook wel Bernoulli trials genoemd (zoals het opgooien van een muntje). De binomiale verdeling is een voorbeeld van een discrete verdeling, omdat we bij het opgooien van muntjes 3 of 5 keer kop kunnen gooien, maar niet 3.45 keer kop. De formule hiervoor is:
\[\frac{N!}{X!(N-X)!}\]
met:
- p(X) = de kans op X successen
- N = het aantal trials
- p = de kans op een succes op één trial
- q = (1- p) de kans op falen
- CNX = het aantal combinaties van N dingen die X per keer gepakt worden
Het eerste deel van de formule - N!/(X!(N-X)!) - geeft het aantal verschillende volgordes voor bijvoorbeeld drie successen en vier keer falen.
Een binomiale verdeling is ook uit te zetten in een figuur. Hiervoor berekenen we eerst voor elke mogelijke uitkomst een kans. Bijvoorbeeld: wanneer we tien keer een munt opgooien, hoe vaak komt er kop boven. Dit kan tussen de 0 en 10 keer zijn, waarbij de kans naarmate kop vaker boven komt, kleiner wordt. Wanneer we elke kans weten, zetten we het aantal keer kop uit op de X-as, en de kans daarop op de Y-as. De Y-as toont dus geen frequentie, maar een kans. Dat komt doordat het discrete uitkomsten zijn en geen continue. Deze verdeling is wiskundig bereikt, met statistieken op de x-as (aantal successen) in plaats van individuele observaties of gebeurtenissen.
Gemiddelde en variantie
Wanneer p = q = .50, zoals bij het opgooien van een munt, zal de binomiale verdeling symmetrisch zijn. De formules voor gemiddelde, variantie en standaarddeviatie zijn altijd:
- Gemiddelde = Np
- Variantie = Npq
- Standaarddeviatie = √Npq
Voor de binomiale verdeling geldt dat de verdeling normaler wordt bij getallen van p en q, die dichtbij .50 liggen. Daarnaast wordt de distributie symmetrischer en meer normaal, bij een hoger aantal trials. We gebruiken de vuistregel dat wanneer Np en Nq niet groter zijn dan 5, de distributie bijna normaal is, waardoor de schattingen redelijk goed zijn als we de verdeling als normaal behandelen.
Hoe gebruik je de binomiale verdeling bij hypothese testen?
In veel gevallen waarin we de binomiale verdeling zouden kunnen gebruiken, is de chi-kwadraat test even bruikbaar (uitgelegd in het volgende hoofdstuk). Hier worden alleen situaties genoemd waarin de binomiale verdeling beter is.
Stel dat we een experiment opzetten, waarbij iemand heel kort (2ms) een letter of een cijfer te zien krijgt op een scherm, en dan moet raden wat zij zag. Hiervoor hebben we gezien hoe we uitrekenen wat de verdeling van mogelijke uitkomsten is. Stel dat we daar vonden dat een proefpersoon van de acht keer tonen, zeven keer juist raadde. Betekent deze data dat zij beter kan raden dan op puur kansniveau?
De onderzoekshypothese H1 is dat ze het beter doet dan op kansniveau (p > .50). De nulhypothese is dat haar gedrag niet beter is dan kansniveau (H0 : p = .50). De binomiale verdeling maken we op basis van de nulhypothese, dus met p = .50, en dan rekenen we uit wat de kans is dat de proefpersoon op basis van deze verdeling zeven of acht keer goed zou raden (want onze H1 was dat p > .50).
Voor de kans op zeven correcte trials uit acht trials totaal geldt:
\[p(7)=C^8_7p^7q^1=(\frac{8!}{7!1!})(.5)^7(.5)^1=8(0078)(.5)=8(.0039)=.0312\]
Tel deze op bij de kans op acht correcte trials (gelijk aan .0039) en we vinden dat de kans op ten minste 7 correcte trials slechts .035 is. We verwerpen H0 wanneer α kleiner of gelijk is aan .05. We kunnen H0 verwerpen: onze proefpersoon doet het beter dan we zouden verwachten puur op kansniveau.
Wat is een multinomiale verdeling?
De multinomiale verdeling is een speciale vorm van binomiale verdeling, waarbij er meer dan twee mogelijke uitkomsten zijn (bijvoorbeeld bij het rollen van een dobbelsteen). Als we de kans van een aantal uitkomsten X willen berekenen bij k gebeurtenissen, dan is die kans gelijk aan:
\[p(X_1,X_2,...,X_k)=\frac{N!}{X_1!X_2!...X_k!}p_1^{X1}p_2^{X2}...p_k^{Xk}\]
Stel dat we een dobbelsteen hebben met twee rode kanten, drie zwarte en één witte kant. We weten de kans om een bepaalde kleur boven te krijgen: rood 2/6 = .333, zwart 3/6 = .500 en wit 1/6 = .167. Als we tien keer gooien, wat is dan de kans op vier zwarte, drie rode en drie witte?
\[p(4,3,3)=\frac{10!}{4!3!3!}(.500)^4(.333)^3(.167)^3=4200\times.0625\times.0369\times.0047=.0455\]
Join with a free account for more service, or become a member for full access to exclusives and extra support of WorldSupporter >>
Concept of JoHo WorldSupporter
JoHo WorldSupporter mission and vision:
- JoHo wants to enable people and organizations to develop and work better together, and thereby contribute to a tolerant and sustainable world. Through physical and online platforms, it supports personal development and promote international cooperation is encouraged.
JoHo concept:
- As a JoHo donor, member or insured, you provide support to the JoHo objectives. JoHo then supports you with tools, coaching and benefits in the areas of personal development and international activities.
- JoHo's core services include: study support, competence development, coaching and insurance mediation when departure abroad.
Join JoHo WorldSupporter!
for a modest and sustainable investment in yourself, and a valued contribution to what JoHo stands for
Work for JoHo WorldSupporter?
Volunteering: WorldSupporter moderators and Summary Supporters
Volunteering: Share your summaries or study notes
Student jobs: Part-time work as study assistant in Leiden
- Insurance for emigrants, expats and living abroad: international insurance for expats and emigrants
- Insurance for activities abroad: Backpacking Travel abroad Intern abroad Study abroad Volunteer abroad Work abroad
- Insurance: ACS Globe Traveller Caremed Insurances Expatriate Travel Insurance IMG’s GlobeHopper World Nomads Insurance SafetyWing Insurance JoHo Special ISIS verzekering NL/BE Working Nomad verzekering NL/BE More about Insurance for abroad
Search only via club, country, goal, study, topic or sector
Select any filter and click on Search to see results








