Een nieuwe leesmethode lijkt pas echt te werken als leerlingen daarna beter presteren. Toch kan ook extra begeleiding, een gemotiveerde docent of een verschil tussen klassen de uitkomst hebben beïnvloed. Met interne validiteit beoordeel je hoe zeker je kunt zeggen dat het onderzochte effect werkelijk door de onafhankelijke variabele komt en niet door een verborgen factor. Hieronder leg ik uit hoe dat in onderwijsonderzoek werkt, welke fouten vaak voorkomen en hoe je de kwaliteit van een studie praktisch beoordeelt.
De betrouwbaarheid van een oorzaak-gevolgconclusie hangt hiervan af
- Oorzaak en effect: de verandering in leerresultaten moet overtuigend aan de onderzochte aanpak kunnen worden gekoppeld.
- Controlegroep: een vergelijkbare groep maakt het makkelijker om andere verklaringen uit te sluiten.
- Veelvoorkomende bedreigingen: voorkennis, uitval, geschiedenis, testeffecten en verschillen tussen docenten kunnen resultaten vertekenen.
- Randomisatie: willekeurige toewijzing vermindert de kans dat groepen vooraf al van elkaar verschillen.
- Belangrijke grens: een studie kan intern sterk zijn, maar de uitkomsten niet automatisch naar alle scholen vertalen.
Wat betekent dit begrip in onderwijsonderzoek
De kernvraag is eenvoudig: heeft de onderzochte aanpak het verschil veroorzaakt? Stel dat leerlingen die met een digitale rekentool werken na acht weken hogere scores halen. Dan moet je nagaan of die vooruitgang door de tool komt, of bijvoorbeeld door meer oefentijd, een extra enthousiaste leerkracht of een toets die toevallig goed aansloot bij de lessen.
Een onderzoek heeft een sterke interne kwaliteit wanneer zulke alternatieve verklaringen zo veel mogelijk zijn uitgesloten. Het gaat dus vooral om de geloofwaardigheid van een causaal verband. Een verband betekent dat twee zaken samen veranderen; causaliteit betekent dat de ene verandering de andere waarschijnlijk veroorzaakt.
Dit begrip is vooral belangrijk bij experimenten en interventiestudies. Bij een beschrijvend onderzoek kun je bijvoorbeeld vaststellen dat leerlingen die vaak lezen betere woordenschat hebben. Daaruit volgt nog niet dat meer lezen automatisch de oorzaak is. Misschien hebben deze leerlingen ook meer steun thuis of beginnen ze al met een grotere woordenschat.
Het verschil met externe validiteit
Interne kwaliteit gaat over de vraag of de conclusie binnen dit specifieke onderzoek klopt. Externe validiteit gaat over de vraag of je de uitkomst kunt toepassen op andere leerlingen, scholen of situaties.
| Vraag | Waar gaat het over? | Voorbeeld in het onderwijs |
|---|---|---|
| Interne validiteit | Is de interventie werkelijk de oorzaak van het effect? | Verbeterden de scores door de nieuwe leesmethode? |
| Externe validiteit | Zijn de resultaten toepasbaar buiten de onderzochte groep? | Werkt de methode ook op andere scholen en bij andere leerjaren? |
| Betrouwbaarheid | Geeft de meting bij herhaling vergelijkbare resultaten? | Levert dezelfde toets onder gelijke omstandigheden ongeveer dezelfde uitkomst op? |
Ik zie vaak dat onderzoekers vooral praten over een grote steekproef, terwijl de opzet zelf minder zorgvuldig is. Een studie met 1.000 leerlingen kan nog steeds een zwakke conclusie opleveren als de interventiegroep structureel andere begeleiding kreeg dan de controlegroep.
Welke factoren kunnen de conclusie vertekenen
Een bedreiging ontstaat zodra een andere factor een plausibele verklaring vormt voor het gevonden resultaat. In onderwijsonderzoek zijn die factoren meestal niet spectaculair. Juist alledaagse verschillen tussen leerlingen, lessen en meetmomenten maken het lastig om een effect zuiver te beoordelen.
Verschillen tussen de groepen
Wanneer sterk gemotiveerde leerlingen vaker voor een nieuwe methode kiezen, kunnen hun betere resultaten ten onrechte aan die methode worden toegeschreven. Hun motivatie was dan al vóór de start hoger. Willekeurige toewijzing aan een interventie- of controlegroep helpt om zulke verschillen eerlijker over de groepen te verdelen.
Gebeurtenissen tijdens het onderzoek
Een schoolonderzoek duurt soms maanden. In die periode kan er van alles gebeuren: een lockdown, een schoolwissel, een nieuwe leerkracht of een intensieve toetsweek. Als zulke gebeurtenissen vooral één groep raken, is het moeilijk om het effect nog uitsluitend aan de interventie toe te schrijven.
Uitval van deelnemers
Leerlingen die weinig vooruitgang boeken, stoppen mogelijk eerder met deelname. Als juist deze leerlingen uit de nameting verdwijnen, lijkt de aanpak succesvoller dan hij werkelijk is. Daarom moet een onderzoek niet alleen melden hoeveel leerlingen begonnen, maar ook hoeveel deelnemers de eindmeting haalden en waarom anderen uitvielen.
Het effect van voorkennis en herhaalde toetsen
Een voormeting kan nodig zijn om beginniveaus te vergelijken, maar de toets zelf kan leerlingen ook voorbereiden op de nameting. Ze herkennen vraagtypen of onthouden onderdelen. Een stijgende score zegt dan niet automatisch dat de onderwijsaanpak heeft gewerkt.
Verwachtingen van docent en leerling
Een docent die enthousiast is over een nieuwe methode kan onbewust meer uitleg, feedback of aanmoediging geven. Leerlingen merken bovendien soms welke aanpak volgens de onderzoeker kansrijk is. Blindering, waarbij betrokkenen zo min mogelijk weten welke uitkomst wordt verwacht, is in scholen niet altijd volledig haalbaar, maar duidelijke instructies en gestandaardiseerde lessen beperken dit probleem.
Hoe ontwerp je een onderzoek met meer causale zekerheid
Een sterke onderzoeksopzet begint vóór de eerste toets. Ik zou eerst precies vastleggen wat de interventie inhoudt, welke uitkomst wordt gemeten en welke omstandigheden voor beide groepen gelijk moeten blijven. Zonder die basis wordt een statistische analyse al snel een reparatie achteraf.
- Formuleer een toetsbare verwachting. Beschrijf welke verandering je verwacht, bij welke leerlingen en binnen welke periode.
- Kies een passende controlegroep. Deze groep volgt bij voorkeur de gebruikelijke aanpak of een duidelijk omschreven alternatief.
- Meet het beginniveau. Leg voorkennis, motivatie en relevante achtergrondkenmerken vast voordat de interventie start.
- Verdeel deelnemers zo eerlijk mogelijk. Randomisatie heeft de voorkeur. Als dat niet kan, gebruik dan gematchte groepen of corrigeer aantoonbare verschillen statistisch.
- Werk met vaste procedures. Gebruik dezelfde toetsinstructies, meetmomenten en registratie voor alle groepen.
- Leg afwijkingen vast. Noteer ziekte, lesuitval, wijzigingen in de uitvoering en verschillen in deelname.
- Analyseer volgens het oorspronkelijke plan. Voorkom dat je achteraf alleen de uitkomst kiest die het gunstigst lijkt.
Een controlegroep is geen magische oplossing. Als de groepen op meerdere punten sterk verschillen, blijft voorzichtigheid nodig. Ook randomisatie maakt een studie niet automatisch goed wanneer de interventie onduidelijk is of de toets niet meet wat de onderzoeker beweert te meten.
Lees ook: Lijn 3 in groep 3 - De complete gids voor een vliegende start
Randomisatie, matching en voor- en nameting
| Methode | Sterk punt | Beperking |
|---|---|---|
| Randomisatie | Verkleint systematische verschillen tussen groepen. | Niet altijd praktisch of toegestaan binnen een school. |
| Matching | Maakt groepen vergelijkbaar op bijvoorbeeld leeftijd en beginniveau. | Onbekende verschillen kunnen alsnog blijven bestaan. |
| Voor- en nameting | Laat zien hoeveel leerlingen tijdens het onderzoek veranderen. | Een voormeting kan zelf invloed hebben op de nameting. |
| Cluster-randomisatie | Hele klassen of scholen worden toegewezen, waardoor leerlingen minder informatie tussen condities uitwisselen. | Er zijn vaak meer klassen nodig om betrouwbare verschillen te vinden. |
In een schoolomgeving vind ik cluster-randomisatie vaak realistischer dan het verdelen van leerlingen binnen één klas. Leerlingen praten met elkaar, docenten wisselen materialen uit en een interventie verspreidt zich snel. De prijs daarvoor is dat verschillen tussen klassen of scholen zwaarder meetellen in de analyse.
Een concreet voorbeeld met een nieuwe leesmethode

Stel dat twaalf basisscholen een nieuwe methode voor begrijpend lezen testen. Zes scholen gebruiken de methode en zes scholen gaan door met hun bestaande aanpak. Na tien weken maken alle leerlingen dezelfde gestandaardiseerde toets.
De eerste uitkomst lijkt duidelijk wanneer de interventiegroep gemiddeld 7 punten meer vooruitgaat. Toch is die conclusie pas overtuigend als de scholen bij de start vergelijkbaar waren, de lessen ongeveer even lang duurden en de toets op dezelfde manier is afgenomen.
Er zijn verschillende alternatieve verklaringen denkbaar. Misschien kregen de zes interventiescholen extra training van een taaladviseur. Misschien vielen op de controlescholen meer leerlingen uit. Of de nieuwe methode werd vooral ingezet in klassen met relatief lage beginscores, waardoor een deel van het verschil door natuurlijke inhaalgroei ontstond.
Een zorgvuldig rapport vermeldt daarom meer dan alleen de gemiddelde score. Het laat ook zien:
- hoeveel leerlingen en klassen per groep deelnamen;
- wat de gemiddelde beginscores waren;
- hoe de methode in de praktijk is uitgevoerd;
- hoeveel leerlingen de nameting niet maakten;
- of het effect in meerdere klassen zichtbaar was;
- hoe groot het verschil was en hoe onzeker die schatting is.
Een statistisch significant resultaat is daarbij niet automatisch een onderwijskundig belangrijk resultaat. Een gemiddelde winst van 1 punt kan volgens een berekening overtuigend zijn, maar in de klas nauwelijks verschil maken. Ik kijk daarom altijd naar de omvang van het effect én de kwaliteit van de uitvoering.
Hoe beoordeel je zelf de kwaliteit van een studie
Je hoeft geen statisticus te zijn om een eerste kritische beoordeling te maken. Lees een onderzoeksrapport met vijf eenvoudige vragen in gedachten. Daarmee zie je vaak snel of de conclusie stevig staat of vooral op aannames rust.
- Was er een geloofwaardige vergelijking? Zonder controlegroep of goed onderbouwde alternatieve aanpak blijft oorzaak en gevolg onzeker.
- Waren de groepen bij de start vergelijkbaar? Let op voorkennis, leeftijd, taalniveau, motivatie en schooltype.
- Werd de interventie overal hetzelfde uitgevoerd? Een methode die per klas sterk verschilt, is moeilijk eerlijk te evalueren.
- Hoe werd de uitkomst gemeten? Een betrouwbare toets is belangrijk, maar ook de vraag of die toets het bedoelde leerdoel werkelijk meet.
- Wat gebeurde er met uitval en afwijkingen? Ontbrekende gegevens mogen niet stilletjes uit het verhaal verdwijnen.
Let ook op taalgebruik. Woorden als “bewijst” en “altijd” zijn in onderwijsstudies meestal te stellig. Een degelijk rapport spreekt eerder over aanwijzingen, waarschijnlijkheid en de omstandigheden waaronder het effect werd gevonden.
Onderzoek met hoge interne kwaliteit kan nog steeds beperkt zijn door een kleine steekproef, een korte looptijd of een specifieke doelgroep. Dat maakt de studie niet waardeloos, maar het bepaalt wel hoe ver je de conclusie mag doortrekken. Een goede conclusie is precies zo breed als het bewijs toelaat.
Wat je als student of docent vooral moet onthouden
De belangrijkste les is dat een hoger toetsresultaat nog geen bewijs is dat een onderwijsinterventie werkt. Eerst moet duidelijk zijn welke andere factoren het resultaat kunnen verklaren en hoe de onderzoekers daarmee zijn omgegaan.
Wie zelf onderzoek uitvoert, bereikt meestal meer met een heldere controlegroep, vaste meetprocedures en transparante rapportage dan met een ingewikkeld model achteraf. Wie onderzoek leest, doet er goed aan niet alleen naar de uitkomst te kijken, maar vooral naar de route waarlangs die uitkomst tot stand kwam.
Dat is uiteindelijk de praktische waarde van dit begrip. Het helpt om sterke onderwijsverbeteringen te onderscheiden van veelbelovende ideeën die nog onvoldoende zijn getest.