Wetenschapper die onderzoeksdata bestudeert aan een bureau

Waarom een statistisch significant resultaat in de praktijk weinig kan betekenen

Een onderzoek concludeert dat een nieuw supplement de cognitieve prestaties “significant” verbetert, en prompt verschijnen er koppen in de media over een doorbraak. Maar ergens onderaan het artikel staat een klein detail: de deelnemers scoorden gemiddeld 0,4 punt hoger op een test van 100 punten. Statistisch significant, ja. Maar wat heb je daar in de praktijk aan? Dat is precies waar het begrip “statistisch significant” mensen op het verkeerde been zet.

Wat ‘significant’ écht betekent

In de statistiek draait significantie om één getal: de p-waarde. Die waarde zegt iets over hoe waarschijnlijk het is dat je het gevonden resultaat zou zien als er in werkelijkheid helemaal geen effect bestaat. Een p-waarde onder de 0,05 wordt traditioneel “statistisch significant” genoemd.

Wat dat níét betekent: dat het effect groot is, relevant is, of dat je er iets aan hebt in het dagelijks leven. De p-waarde zegt niets over de grootte van het effect. Het is puur een kansberekening.

Stel je voor dat je een dobbelsteen gooit en twaalf keer op rij een even getal gooit. Dat is verrassend weinig waarschijnlijk als de dobbelsteen eerlijk is. Je zou dat “significant” kunnen noemen. Maar dat betekent nog niet dat de dobbelsteen zwaar gemanipuleerd is, of dat die afwijking er in de praktijk iets toe doet. Het zegt alleen dat het resultaat onwaarschijnlijk is bij toeval. Niet meer dan dat.

De vergrootglastruc: hoe een grote steekproef alles significant maakt

Hier zit een van de meest onderschatte valkuilen van statistisch nieuws. Hoe meer deelnemers een studie heeft, hoe gemakkelijker het is om significantie te bereiken, zelfs bij piepkleine effecten.

Concreet voorbeeld: stel dat onderzoekers bij 80.000 deelnemers een gemiddelde bloeddrukdaling meten van 1 mmHg na gebruik van een bepaald supplement. Met zo’n enorme steekproef is die daling statistisch significant. De p-waarde duikt netjes onder de 0,05. De krantenkop schrijft zichzelf.

Maar wat betekent 1 mmHg voor jou thuis? Je bloeddruk schommelt in de loop van een dag al 10 tot 20 mmHg door zaken als opstaan, een kop koffie drinken of een druk gesprek. Een daling van 1 mmHg is voor vrijwel niemand klinisch relevant. Toch heet het resultaat officieel “significant”.

Wij van Curious.be zien dit patroon regelmatig terugkomen in gezondheidsjournalistiek: hoe groter de studie, hoe minder de kop je vertelt over wat het effect voor jou betekent.

Effect size: het getal dat journalisten weglaten

Wat je eigenlijk wilt weten, is hoe groot het effect is. Statistici meten dat met zoiets als Cohen’s d of andere maten voor effectgrootte of ze rapporteren het verschil in absolute risico’s. Maar dat laatste zie je in krantenkoppen zelden.

Een veelgebruikt trucje is het rapporteren van relatief risico. “Dit medicijn verlaagt het risico op hartaanval met 30 procent” klinkt indrukwekkend. Maar stel dat het absolute risico voor de gemiddelde gezonde vijftiger al erg laag was, namelijk 1 op 1.000 per jaar. Een verlaging van 30 procent brengt dat naar ongeveer 1 op 1.430. Het absolute voordeel is minder dan een half procent. Dat is niet niks, maar het is ook lang niet zo overweldigend als “30 procent minder risico” doet vermoeden.

Zonder die absolute getallen kun je een resultaat eigenlijk niet beoordelen. Relatieve percentages zonder context zijn halve informatie.

Hetzelfde principe bij geld

Statistisch significante resultaten duiken ook op in financiële vergelijkingen, soms op een manier die weinig praktische waarde heeft. Stel dat een studie aantoont dat spaarrekening A gemiddeld 0,03 procentpunt meer rente oplevert dan spaarrekening B, en dat dit verschil statistisch significant is over een grote dataset van rekeninghouders.

Op 10.000 euro spaargeld is dat verschil 3 euro per jaar. Over tien jaar, met rente op rente, loopt het iets verder op, maar het verdwijnt volledig in de ruis van je eigen keuzes: wanneer je geld opneemt, of je soms spaart in een lagere belastingschijf, of je een bonus hebt ontvangen. De statistische significantie zegt hier technisch iets kloppends, maar in jouw situatie stelt het bijna niets voor.

Tenzij je over miljoenen beschikt. Dan maakt 0,03 procentpunt wél een merkbaar verschil. Hier zie je hoe de praktische betekenis van statistische significantie volledig afhangt van context.

Vier vragen die je stelt vóórdat je een krantenkop gelooft

Gelukkig hoef je geen statisticus te zijn om beter om te gaan met onderzoeksnieuws. Vier vragen zijn voldoende:

  • Hoe groot is het absolute effect? Niet het relatieve percentage, maar het concrete getal. Van hoeveel naar hoeveel? Bij het hartaanvalvoorbeeld hierboven: van 1 op 1.000 naar 1 op 1.430.
  • Hoeveel deelnemers waren er? Een studie met 200.000 deelnemers kan elk minimaal verschil significant maken. Hoe groter de groep, hoe kritischer je moet kijken naar de grootte van het effect zelf.
  • Is er een effect size gerapporteerd? Cohen’s d, NNT (number needed to treat), of gewoon het absolute risicoverschil. Als dat ontbreekt in het artikel, zoek dan de originele studie op of wees sceptisch.
  • Wie profiteert er van de framing? Betaalde een farmaceutisch bedrijf het onderzoek? Heeft de onderzoeksgroep er belang bij dat het resultaat groot lijkt? Dat maakt het resultaat niet automatisch fout, maar het is een reden om extra kritisch te lezen.

Wanneer kleine effecten er juist wél toe doen

Het is eerlijk om te vermelden dat er contexten zijn waar statistische significantie bij kleine effecten absoluut de juiste maatstaf is. Bij de veiligheidscontrole van voedingsmiddelen wil je weten of een bepaalde stof al in minieme concentraties gevaarlijk is. Daar is elke detecteerbare afwijking relevant.

Hetzelfde geldt voor zeldzame bijwerkingen van medicijnen. Als een vaccin bij 1 op de 100.000 mensen een ernstige bijwerking veroorzaakt, is dat een klein absoluut risico, maar het is wel degelijk iets wat je wilt weten en monitoren. Of bij industriële kwaliteitscontrole: een afwijking van 0,01 millimeter in een vliegtuigonderdeel is weinig in absolute termen, maar kan grote gevolgen hebben.

De vuistregel is: hoe groter de potentiële schade van een klein effect, hoe relevanter statistische significantie wordt als signaal. Bij gezondheidsadviezen voor gezonde mensen of bij financiële keuzes is de drempel meestal veel hoger.

Wat je morgen anders doet

Eén concreet gedragsadvies: zoek bij elk onderzoeksbericht dat je tegenkomt altijd naar de absolute getallen achter het percentage. Niet “30 procent minder risico”, maar van hoeveel naar hoeveel per duizend mensen. Dat ene getal verandert hoe je de kop leest.

En wees extra kritisch bij studies met meer dan 10.000 deelnemers die geen effect size vermelden. Een grote steekproef zonder context over de grootte van het effect is een teken dat je verder moet vragen voordat je iets gelooft, aanpast of deelt. De statistische significantie praktisch betekenis geven: dat is precies wat die ene extra vraag doet.

Statistisch significantie zegt alleen iets over de kans dat een resultaat door toeval ontstaan is, niet over de grootte of de praktische waarde van dat resultaat. Een effect kan tegelijk significant en verwaarloosbaar zijn. Wij van Curious.be raden aan om bij elk onderzoeksbericht te vragen: hoe groot is het absolute effect, hoeveel deelnemers waren er, en wat betekent dit voor iemand in het dagelijks leven? Die vragen geven meer houvast dan de vraag of iets al dan niet significant is.

Total
0
Shares
Vorige
Wat gebeurt er als een orgaan faalt: van dialyse tot transplantatie uitgelegd
Een patiënt die dialyse ondergaat in een ziekenhuisomgeving met medische apparatuur op de achtergrond

Wat gebeurt er als een orgaan faalt: van dialyse tot transplantatie uitgelegd

Je plast nauwelijks meer, je enkels zwellen op en je bent moe op een manier die

Ook interessant