Gratis toolsPrijzenMobiele app
Inloggen
Begin gratisBegin gratis
Vraag het Bo
  • Vraag Bo allesAntwoorden uit je colleges, met bronvermelding
  • AI-flashcardsMaak een deck voor hoofdstuk 4
  • Image OcclusionDek de labels op een schema af
  • ProefexamensMaak een proefexamen met 20 vragen
  • MindmapsLaat zien hoe deze begrippen samenhangen
  • StudiegidsenVat het hele hoofdstuk samen
  • AI-samenvattingVat het college van vrijdag samen
  • AI-quizOverhoor me op hoofdstuk 4
  • SpiekbriefjesEén pagina voor het examen
Begin gratisBegin gratisInloggen
  • Vraag Bo alles
  • AI-flashcards
  • Image Occlusion
  • Proefexamens
  • Mindmaps
  • Studiegidsen
  • AI-samenvatting
  • AI-quiz
  • Spiekbriefjes
Gratis toolsPrijzenMobiele app
  • Hoe we testen
  • We nakijken ons eigen werk niet
  • Wat we vonden
  • Hoe we echt beslissen
  • Waarom we dit opnieuw doen
  • Wat dit voor jou betekent
Back to blog
10 Aug 20265 min read

Welke AI schrijft eigenlijk jouw studiemateriaal? We testten er vijf en kozen op kwaliteit

We lieten GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 en DeepSeek V4 Pro los op hetzelfde echte collegemateriaal en liet ze blind beoordelen. Dit kwam eruit.

  • LHLuis Henrich-Bandis
Loading...
Vraag Bo van alles

Upload je colleges en aantekeningen. Bo leest ze en antwoordt op basis van je eigen cursusmateriaal.

Oefentoetsen van je cursus

Bo schrijft een volledig proefexamen op basis van de onderwerpen en colleges die je kiest.

Flashcards in seconden

Bo zet je slides en leesmateriaal om in kant en klare flashcard decks.

Mindmaps en samenvattingen

Zie hoe je concepten samenhangen, of krijg een heldere samenvatting van elk college.

Jouw vak, niet het hele internet.

Functies

  • Vraag Bo
  • AI-flashcards
  • Image Occlusion
  • AI-examens
  • Mindmaps
  • Studiegidsen
  • AI-samenvatting
  • AI-quiz
  • Spiekbriefjes

Gratis tools

  • Flashcard-generator
  • Quizgenerator
  • Mindmap-generator
  • Studiegids-generator
  • PDF samenvatten
  • Flashcards uit slides

Vergelijkingen

  • vs ChatGPT
  • vs Quizlet
  • vs Anki
  • vs YouLearn
  • Alle vergelijkingen

Bronnen

  • Woordenlijst
  • Antwoorden
  • Hoe Bo werkt
  • Waarom StudyPDF
  • Toepassingen

Bedrijf

  • Prijzen
  • FAQ
  • Missie
  • Creatorprogramma
  • Enterprise
  • Contact
  • Wijzigingslog

Juridisch

  • Privacy
  • Voorwaarden
  • Colofon
© 2026 StudyPDFFree to start. No card required.

Als een AI-tool jouw studiemateriaal maakt, vertrouw je op een model dat je nooit hebt gekozen en meestal niet eens kunt zien. Het is dus een terechte vraag welk model wij gebruiken en hoe we dat besloten.

Het korte antwoord: voor het schrijven van flashcards, quizzen en oefententamens draaien we op dit moment GPT-5.6 in zijn krachtigste uitvoering. Het lange antwoord is hoe we daar kwamen, want we kiezen niet op prijs, niet op ranglijstjes en niet op welk model die maand in het nieuws was. We testen ze op het soort materiaal dat jij uploadt.

Dit was de laatste ronde.

Hoe we testen

Het lastige aan modellen vergelijken is dat bijna niets stil blijft staan. Andere zoekactie, andere brontekst, andere uitkomst. Dus zetten we alles vast behalve het model.

We namen drie echte documenten uit echte vakken, bewust verschillend van vorm:

  • Een dichtbeschreven boekhoudglossarium, van voor tot achter definities
  • Een schrale psychologie-diaset, een paar bullets per dia
  • Uitgebreide marketingaantekeningen, echte alinea's

Daarna bevroren we het bronmateriaal en de instructies, en wisselden we alleen het model. Dertig runs, één voor één, met flashcards en quizzen uit elk document, met exact de instructies die het product ook gebruikt.

Vijf modellen, van vijf verschillende labs: GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 en DeepSeek V4 Pro.

We nakijken ons eigen werk niet

Hier gaan modelvergelijkingen meestal mis. Als je de uitkomsten zelf beoordeelt, vind je wat je verwachtte te vinden. Laat je één AI beoordelen, dan heb je gemeten welke uitkomst het meest op de schrijfstijl van die AI lijkt.

De beoordeling ging daarom naar een panel van drie beoordelaars van drie verschillende bedrijven. Elke beoordelaar zag alle vijf de sets naast elkaar, met door elkaar gehusselde labels, zonder manier om te zien welk model wat had geschreven. Ze beoordeelden of elke kaart echt door de bron gedekt werd, of de set het hele onderwerp bestreek, of de vragen helder en niet herhalend waren, of de moeilijkheid klopte met wat gevraagd was, en of een echte student er bij het herhalen wat aan heeft.

Drie van de beoordelaars deden zelf mee, en daar mag je wantrouwig over zijn. Dus we controleerden het: we vergeleken welke plek elke beoordelaar zijn eigen werk gaf met de plek die de andere beoordelaars datzelfde werk gaven. Niemand blies zichzelf op. DeepSeek beoordeelde zijn eigen set zelfs strenger dan de anderen deden.

Wat we vonden

Het was geen afstraffing. Vier van de vijf modellen eindigden dicht bij elkaar, dicht genoeg dat we op basis hiervan geen winnaar tussen hen uitroepen.

Onderbouwing, wat het zwaarst weegt: GPT-5.6 het hoogst met 4,83 van 5, Gemini 3.1 Pro op 4,78 en Grok 4.5 en Kimi K3 allebei op 4,67. Onderbouwing betekent dat elke kaart echt uit jouw document komt en niet verzonnen is. Een zelfverzekerd foute flashcard is erger dan geen flashcard, dus op dit cijfer geven we niets weg.

Vraagkwaliteit: opnieuw GPT-5.6 het hoogst met 4,78, Kimi K3 vlak erachter op 4,67, daarna Gemini op 4,39 en Grok op 4,11. Dit meet of elk item één heldere gedachte toetst, beantwoordbaar is en geen herschreven dubbel van een andere kaart is.

Dekking: hier verloren we. Grok 4.5 scoorde 4,50, Gemini 3,72, en GPT-5.6 werd laatste van de kopgroep met 3,28. Dekking betekent je over het hele document verdelen in plaats van blijven hangen bij de stukken waar het makkelijkst over te schrijven viel. Dat is een echte zwakte van wat we vandaag leveren, en die staat op onze lijst.

Eén model bleef duidelijk achter: DeepSeek V4 Pro werd laatste op onderbouwing, vraagkwaliteit en algemene plek, en was daarnaast veruit het traagst, ongeveer 80 seconden tegenover zo'n 23 voor de snelste. In het algemeen is het een sterk model. Voor deze specifieke klus was het niet concurrerend.

Hoe we echt beslissen

Kwaliteit is de filter. Snelheid is alleen de tiebreak.

DeepSeek viel af op kwaliteit, en geen enkele lage prijs had dat veranderd. Tussen de vier die overbleven is de eerlijke lezing dat ze dicht bij elkaar liggen, dus kijken we waar een nipte keuze bij een studietool op zou moeten draaien: onderbouwing en vraagkwaliteit, want die bepalen of de set je het juiste leert.

GPT-5.6 stond op allebei bovenaan. Het bleek toevallig ook het snelste van de vijf, ongeveer 23 seconden per set tegenover 30 voor Grok, 45 voor Kimi en 80 voor DeepSeek. Dat is een prettige bijkomstigheid, niet de reden.

Was de volgorde omgekeerd geweest, was het snelste model dat met de wankelste onderbouwing, dan hadden we het trage uitgebracht. Precies die keuze hebben we eerder al gemaakt.

Waarom we dit opnieuw doen

Elk model in deze vergelijking is jonger dan een jaar, en minstens één ervan is vervangen voordat het volgende semester eindigt. Een modelkeuze die één keer gemaakt en nooit herzien wordt, verandert ongemerkt in de keuze van wie in 2025 het snelst leverde.

Dit is dus een terugkerende test, geen eenmalige actie. Dezelfde drie documenten, dezelfde bevroren instructies, hetzelfde blinde panel, nieuwe kandidaten zodra ze er zijn. Wint een nieuw model op onderbouwing en vraagkwaliteit, dan wisselen we, en die wissel is saai omdat de testbank er al staat.

Wat dit voor jou betekent

Twee praktische dingen.

Elke kaart die je genereert wordt, nog voordat hij bij jou komt, beoordeeld op de vraag of hij terug te voeren is op jouw eigen document. Dat is de eigenschap waarop we boven alles optimaliseren, ook boven snelheid.

En als een set ooit te oppervlakkig of te smal aanvoelt voor wat je tentamen echt vraagt, zeg dan tegen Bo dat hij hem moeilijker moet maken of meer stof moet dekken. De instellingen voor moeilijkheid en omvang zijn echt, en dekking is precies de dimensie waarvan we weten dat er ruimte is.