Assessment-apps: de volledige gids
Een assessment-app neemt een test af en zet de uitkomst om in een oordeel: geschikt, gevorderd, geslaagd, aandachtspunt. Dat oordeel raakt iemands baan, opleiding of certificaat. Het ontwerp gaat daarom maar voor een klein deel over de vragen; het gaat over de vraag of de uitkomst eerlijk is, uitlegbaar, en bestand tegen wie ermee wil sjoemelen.
In het kort
- De vragenbank is het product; de app is de verpakking. Zonder gevalideerde vragen meet de app niets, hoe mooi hij ook scoort.
- Elke uitkomst moet uitlegbaar zijn aan de kandidaat. Een score zonder onderbouwing is bij selectie juridisch kwetsbaar en menselijk onbehoorlijk.
- Bij werving en selectie is een assessment-app volgens de Europese AI-verordening een hoog-risicotoepassing zodra er AI in zit. Dat brengt verplichtingen mee.
- Toezicht op afstand is een keuze met een prijs: het houdt fraude buiten en het houdt ook eerlijke kandidaten onder druk.
Wat een assessment-app is en wat het niet is
Een assessment-app meet kennis, vaardigheid of geschiktheid en koppelt daar een oordeel aan. Het is geen quiz en geen leeromgeving.
Alle hoofdstukkenHet woord assessment wordt gebruikt voor alles van een instaptoets bij een cursus tot een selectieprocedure voor een directiefunctie. De kern is steeds hetzelfde: iemand maakt opdrachten, de app scoort ze, en het resultaat heeft gevolgen.
Een assessment-app is een meetinstrument met een oordeel eraan. De kwaliteit zit in het instrument, niet in de app.
Dat onderscheid bepaalt het hele project. Een quiz-app mag speels zijn en mag fout zitten; niemand verliest er iets bij. Een assessment-app die een kandidaat afwijst op een vraag die dubbelzinnig was, heeft iemand onterecht benadeeld. Elke vraag in de bank moet daarom gemaakt en getoetst zijn door iemand die weet wat de vraag meet en of hij dat betrouwbaar doet. Dat is werk van een vakinhoudelijk expert of een testpsycholoog, niet van een ontwikkelaar.
De toepassingen lopen uiteen. Een opleider wil een instaptoets die bepaalt op welk niveau iemand instroomt. Een werkgever wil een vaardigheidstoets vóór het gesprek, zodat het gesprek over de juiste kandidaten gaat. Een brancheorganisatie wil een certificeringsexamen dat overal hetzelfde is en waarvan de uitslag standhoudt. Een bedrijf wil zijn eigen medewerkers periodiek toetsen op veiligheidskennis, met een bewijs per persoon.
Wat het niet is: een leeromgeving. Leren en toetsen zijn twee dingen die elkaar raken maar andere eisen stellen. Een leeromgeving mag hints geven en fouten laten herstellen; een assessment niet. Wie beide wil, bouwt ze als twee delen die gegevens delen, niet als één scherm.
De vragenbank: waar de kwaliteit zit
Een goede vragenbank heeft per vraag een doel, een moeilijkheid en een meetgeschiedenis. Zonder die drie is de score een getal zonder betekenis.
Alle hoofdstukkenDe app kan nog zo goed scoren; als de vragen niet deugen, meet hij niets. De vragenbank is daarom het eerste en het langstlopende onderdeel van het project.
- Doel
- welk kennisdomein of welke vaardigheid de vraag meet, en op welk niveau
- Vorm
- meerkeuze, open, rangschikken, een casus met vervolgvragen, een praktijkopdracht
- Zwaarte
- hoe moeilijk de vraag bleek: het percentage kandidaten dat hem goed had
- Onderscheid
- of goede kandidaten hem vaker goed hebben dan zwakke; zo niet, dan meet hij niets
De laatste twee kolommen komen pas na gebruik. Een vraag die iedereen goed heeft, onderscheidt niemand; een vraag die de beste kandidaten vaker fout hebben dan de rest, is dubbelzinnig of fout. Een assessment-app die per vraag bijhoudt hoe hij presteert, maakt de bank elke ronde beter. Een app die alleen de totaalscore bewaart, leert niets.
Meerkeuzevragen zijn het makkelijkst te scoren en het moeilijkst goed te maken. De afleiders moeten geloofwaardig zijn zonder verdedigbaar te zijn; dat is een vak. Open vragen meten meer maar vragen een beoordelaar, of een geautomatiseerde beoordeling die u dan moet kunnen verantwoorden. Praktijkopdrachten meten het meest en schalen het minst. Kies per doel, en meng.
AVG en AI-verordening bij selectie
Een assessment bij werving is een verwerking met grote gevolgen. De AVG eist uitlegbaarheid en menselijke tussenkomst; de AI-verordening zet er bij AI-gebruik een hoog-risicoregime bovenop.
Alle hoofdstukkenZodra een assessment meebeslist over wie een baan of een opleiding krijgt, kijkt de wet mee. Niet om het te verbieden, maar om te eisen dat het uitlegbaar en eerlijk gebeurt.
De praktische vertaling: bouw de app zo dat elke uitkomst terug te voeren is op onderdelen die een mens kan lezen. 'Score 62 op rekenvaardigheid, 48 op ruimtelijk inzicht, beide onder de norm voor deze functie' is een oordeel dat een recruiter kan uitleggen en een kandidaat kan begrijpen. 'Geschiktheid 41%' is dat niet, ook als het model erachter goed is.
Voor toetsen buiten werving, zoals een certificeringsexamen of een interne kennistoets, is het regime lichter, maar de uitgangspunten blijven: de kandidaat weet wat wordt gemeten, krijgt uitleg bij de uitkomst, en kan bezwaar maken bij een mens.
Waar het meestal misgaat
De meeste assessment-apps mislukken niet op techniek maar op een norm die niemand heeft vastgesteld, en op toezicht dat óf te licht is óf te zwaar.
Alle hoofdstukkenEen assessment dat de verkeerde mensen laat slagen, is erger dan geen assessment: het geeft een vals gevoel van zekerheid. Drie patronen komen steeds terug.
Zo blijft het assessment geloofwaardig
- De norm (wat is geslaagd, wat is geschikt) is vooraf vastgesteld en onderbouwd, niet achteraf op de uitslagen.
- Vragen worden per kandidaat in een andere volgorde en uit een grotere bank getrokken.
- De kandidaat weet vooraf hoe lang, hoeveel en met welk toezicht.
- Een afwijkend patroon (te snel, te goed, te gelijk aan een ander) wordt gemeld aan een mens, niet automatisch bestraft.
Zo verliest het zijn waarde
- De norm wordt bijgesteld zodat het juiste aantal mensen slaagt.
- Alle kandidaten krijgen dezelfde twintig vragen in dezelfde volgorde; na een week staan ze online.
- Toezicht via webcam zonder uitleg; eerlijke kandidaten presteren slechter door de stress.
- Een tijdslimiet die niet is getoetst en de langzame denker straft in plaats van de onwetende.
Toezicht op afstand verdient een eigen afweging. Een webcam die de kandidaat filmt, een browser die niets anders toelaat, een algoritme dat oogbewegingen volgt: het houdt fraude buiten en het maakt van elke kandidaat een verdachte. Voor een certificeringsexamen met een groot belang kan dat gerechtvaardigd zijn; voor een instaptoets is het buiten proportie. En het verwerkt beelden en biometrie, wat de AVG-lat weer verhoogt. Kies het toezicht dat past bij wat er op het spel staat.
Het derde patroon is de norm die niemand heeft vastgesteld. Wat is 'geschikt'? Als het antwoord na de eerste ronde wordt bepaald op basis van wie er toevallig goed scoorde, meet het assessment de groep, niet de eis. Stel de norm vast met mensen van wie u het niveau kent, vóór de eerste echte kandidaat.
Adaptief toetsen, scoring en rapportage
Adaptieve toetsen zijn korter en nauwkeuriger, maar vragen een grotere en beter gekalibreerde bank. De rapportage bepaalt of iemand met de uitkomst iets kan.
Alle hoofdstukkenTussen het laatste antwoord en het oordeel zit een rekensom, en daarna een rapport. Beide bepalen of de app bruikbaar is voor wie ermee moet beslissen.
| Aanpak | Hoe het werkt | Wat het vraagt |
|---|---|---|
| Vaste toets | Iedereen dezelfde set, of een willekeurige trekking uit de bank per onderdeel | Een bank van minstens een paar keer de toetslengte, en een norm per onderdeel |
| Adaptief | De volgende vraag hangt af van het vorige antwoord; de toets zoekt het niveau op | Een bank waarin elke vraag een gekalibreerde moeilijkheid heeft, uit eerder gebruik |
| Casus | Een situatie met vervolgvragen die op elkaar bouwen | Auteurs die casussen kunnen schrijven; scoring die rekening houdt met samenhang |
| Praktijk | Een opdracht die wordt uitgevoerd en beoordeeld, in de app of erbuiten | Beoordelaars met een rubriek, en een manier om hun oordelen te vergelijken |
Adaptief toetsen is aantrekkelijk omdat het korter is en nauwkeuriger rond het niveau van de kandidaat. Het werkt alleen als elke vraag een betrouwbare moeilijkheid heeft, en die komt uit eerder gebruik. Een nieuwe bank kan niet adaptief beginnen; hij begint vast, verzamelt gegevens, en wordt adaptief als de moeilijkheden bekend zijn. Wie meteen adaptief wil, koopt een gekalibreerde bank of accepteert een seizoen van meten.
De rapportage is waar de meeste apps te weinig aandacht aan besteden. De recruiter, de docent of de examencommissie wil per kandidaat zien wat er is gemeten, hoe dat zich verhoudt tot de norm en tot de groep, en waar de twijfel zit. De kandidaat wil hetzelfde in begrijpelijke taal. Een pdf met een cijfer is voor geen van beiden genoeg.
Wat het kost, en wat dat bepaalt
Niet het aantal kandidaten bepaalt de prijs, maar de vragenbank, de vraagvormen, het toezicht en de juridische toets die het doel vereist.
Alle hoofdstukkenHonderd of tienduizend kandidaten per jaar maakt voor de bouw weinig uit. Wat de prijs drijft, is hoe rijk de vragen zijn, hoe streng het toezicht en hoe zwaar de gevolgen.
- Vraagvormen
- meerkeuze is bekend werk; open vragen met beoordeling en praktijkopdrachten zijn eigen modules
- Bank
- de vragen zelf zijn geen bouwwerk maar vakwerk; reken die uren apart, bij een expert
- Toezicht
- een tijdslimiet en willekeurige volgorde is licht; webcam en browservergrendeling is een eigen laag
- Toetsing
- bij selectie: juridische toets, documentatie en een bias-onderzoek vóór ingebruikname
Wat meestal meevalt: het afnemen zelf. Een kandidaat uitnodigen, laten inloggen, vragen tonen, antwoorden bewaren, scoren: dat zijn bekende onderdelen. Wat tegenvalt: alles eromheen. De bank vullen en valideren, de norm vaststellen, de rapportage ontwerpen die een mens kan lezen, en bij selectie de documentatie die de wet vraagt. Dat is meer dan de helft van het werk en het is grotendeels uw werk.
Vraag ook wat er al bestaat. Voor kennistoetsen en certificering zijn er platforms met gekalibreerde banken; voor selectie zijn er aanbieders met gevalideerde tests en de juridische verantwoording erbij. Zelf bouwen wordt interessant als uw vragen uniek zijn, als de toets in uw eigen proces moet zitten, of als u de gegevens en de uitleg in eigen hand wilt.
Van vragenbank naar werkend assessment
Stel eerst vast wat geschikt of geslaagd betekent, bouw dan de bank, toets hem op bekende mensen en zet de app pas daarna op echte kandidaten.
Alle hoofdstukkenDe volgorde hieronder begint niet bij de app maar bij de vraag wat u wilt weten en wat u ermee doet. De app is de laatste stap.
- Bepaal doel en gevolgWat meet het assessment, en wat gebeurt er met de uitkomst. Bij selectie: laat een jurist meelezen.
- Stel de norm vastMet mensen van wie u het niveau kent. Wat scoren zij, en waar ligt dus de grens.
- Bouw de bankPer vraag doel, vorm en verwachte zwaarte. Minstens een paar keer de toetslengte.
- Toets de bankTien tot twintig bekende mensen. Vragen die niet onderscheiden, gaan eruit of worden herschreven.
- Bouw de appAfnemen, scoren, rapporteren, en per vraag bijhouden hoe hij presteert. Toezicht passend bij het belang.
- Meet en herijkElk kwartaal: welke vragen presteren, klopt de norm nog, wijkt een groep systematisch af.
Veelgestelde vragen
De vragen die het vaakst terugkomen zodra het concreet wordt.
Wat is het verschil tussen een assessment-app en een quiz-app?
Het gevolg. Een quiz mag fout zitten; niemand verliest er iets bij. Een assessment koppelt een oordeel aan de uitkomst dat iemands baan, opleiding of certificaat raakt. Daarom moeten de vragen gevalideerd zijn, de norm onderbouwd en de uitkomst uitlegbaar.
Mag een app zelf kandidaten afwijzen?
Bij selectie in beginsel niet. De AVG geeft mensen het recht niet te worden onderworpen aan een uitsluitend geautomatiseerd besluit met grote gevolgen. Bouw de app zo dat hij een mens informeert die beslist, en dat die mens de uitkomst kan uitleggen. Voor een kennistoets met een vaste cesuur ligt het anders, maar ook daar hoort bezwaar bij een mens.
Wat betekent de AI-verordening voor ons?
Als er AI in de beoordeling zit en de toets wordt gebruikt bij werving, selectie of beoordeling van werknemers, geldt het hoog-risicoregime: documentatie, menselijk toezicht, toetsing op vooringenomenheid en registratie. Een app die alleen vaste antwoorden scoort zonder AI, valt daar niet onder. Laat een jurist vaststellen aan welke kant u zit.
Hoeveel vragen hebben we nodig?
Minstens een paar keer de lengte van de toets, zodat kandidaten niet dezelfde set krijgen. Voor adaptief toetsen meer, en elke vraag moet dan een bekende moeilijkheid hebben uit eerder gebruik. Een nieuwe bank begint vast en wordt adaptief als er genoeg gegevens zijn.
Is toezicht via webcam nodig?
Alleen als het belang het rechtvaardigt. Voor een certificeringsexamen met een groot belang kan het; voor een instaptoets is het buiten proportie en het verwerkt beelden, wat de AVG-lat verhoogt. Een willekeurige trekking uit een grote bank, een tijdslimiet en een melding bij afwijkende patronen houden het meeste al buiten.
Kunnen we een bestaand toetsplatform gebruiken?
Vaak wel, zeker voor kennistoetsen en certificering. Zelf bouwen wordt interessant als uw vragen uniek zijn, als de toets in uw eigen proces moet zitten, of als u de gegevens en de uitleg in eigen hand wilt. Voor selectie met gevalideerde psychologische tests is een gespecialiseerde aanbieder meestal de betere keuze.
Hoe weten we of het assessment eerlijk is?
Door het te meten. Per vraag: onderscheidt hij goede van zwakke kandidaten? Per groep: scoort een groep systematisch anders zonder dat de functie dat verklaart? Per norm: komen de mensen van wie u het niveau kent, aan de juiste kant uit? Wie dat elk kwartaal bekijkt, heeft een eerlijk assessment; wie het nooit bekijkt, weet het niet.
Benieuwd of uw toets als app kan?
Stuur ons wat u wilt meten en wat u met de uitkomst doet, dan zeggen wij welke vraagvormen daarbij passen, welk toezicht proportioneel is en wat de wet in uw geval vraagt. U spreekt iemand van Appfront, het bureau achter deze site.