Når et KI-verktøy lager studiematerialet ditt, stoler du på en modell du aldri har valgt og som regel ikke engang kan se. Så det er et rimelig spørsmål hvilken vi bruker, og hvordan vi bestemte oss.
Kort svar: for å skrive læringskort, quizer og øvingseksamener kjører vi i dag GPT-5.6 i den kraftigste utgaven. Det lange svaret er hvordan vi kom dit, for vi velger ikke etter pris, ikke etter rangeringslister, og ikke etter hvilken modell som var i nyhetene den måneden. Vi tester dem på den typen materiale du laster opp.
Her er siste runde.
Det vanskelige med å sammenligne modeller er at nesten ingenting står stille. Annet søk, annen kildetekst, annet resultat. Så vi fryser alt bortsett fra modellen.
Vi tok tre ekte dokumenter fra ekte emner, bevisst ulike i form:
- Et tett regnskapsglossar, definisjoner fra ende til annen
- Et tynt psykologi-lysbildesett, noen få kulepunkter per lysbilde
- Lange markedsføringsnotater, ordentlige avsnitt
Deretter frøs vi kildematerialet og instruksjonene, og byttet bare modellen. Tretti kjøringer, én om gangen, med læringskort og quizer fra hvert dokument, med nøyaktig de instruksjonene produktet bruker.
Fem modeller, fra fem ulike laboratorier: GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 og DeepSeek V4 Pro.
Det er her modellsammenligninger vanligvis sporer av. Retter du resultatene selv, finner du det du forventet å finne. Lar du én KI vurdere, har du målt hvilket resultat som ligner mest på den KI-ens egen stil.
Vurderingen gikk derfor til et panel med tre dommere fra tre ulike selskaper. Hver dommer så alle fem settene side om side, med stokkede merkelapper, uten mulighet til å vite hvilken modell som hadde skrevet hva. De vurderte om hvert kort faktisk var dekket av kilden, om settet dekket hele temaet, om spørsmålene var klare og ikke gjentakende, om vanskelighetsgraden svarte til den bestilte, og om en ekte student får noe ut av det når hen repeterer.
Tre av dommerne stilte også selv, og det er rimelig å være skeptisk til. Så vi sjekket det: vi sammenlignet plasseringen hver dommer ga sitt eget resultat med plasseringen de andre dommerne ga det samme resultatet. Ingen blåste opp seg selv. DeepSeek vurderte til og med sitt eget sett strengere enn de andre gjorde.
Det ble ikke et jordskred. Fire av de fem modellene endte i en tett gruppe, tett nok til at vi ikke vil utrope noen vinner mellom dem på dette grunnlaget.
Kildeforankring, det som betyr mest: GPT-5.6 høyest med 4,83 av 5, Gemini 3.1 Pro på 4,78, og Grok 4.5 og Kimi K3 begge på 4,67. Forankring betyr at hvert kort faktisk kommer fra ditt dokument og ikke er oppdiktet. Et selvsikkert feil læringskort er verre enn ingen kort, så på dette tallet gir vi ikke etter.
Spørsmålskvalitet: igjen GPT-5.6 høyest med 4,78, Kimi K3 like bak på 4,67, så Gemini på 4,39 og Grok på 4,11. Dette måler om hvert element tester én klar idé, kan besvares, og ikke er en omskrevet dublett av et annet kort.
Dekning: her tapte vi. Grok 4.5 fikk 4,50, Gemini 3,72, og GPT-5.6 kom sist i toppgruppen med 3,28. Dekning betyr å spre seg over hele dokumentet i stedet for å klumpe seg der det var lettest å skrive. Det er en reell svakhet ved det vi leverer i dag, og den står på lista vår.
Én modell lå klart etter: DeepSeek V4 Pro ble sist på forankring, spørsmålskvalitet og totalplassering, og var dessuten desidert tregest, rundt 80 sekunder mot omtrent 23 for den raskeste. Generelt er det en dyktig modell. På akkurat denne jobben var den ikke konkurransedyktig.
Kvalitet er filteret. Hastighet avgjør bare ved uavgjort.
DeepSeek røk ut på kvalitet, og ingen lav pris ville endret det. Mellom de fire som sto igjen er den ærlige lesningen at de er jevne, så vi ser på hva et jevnt tilfelle bør avgjøres av for et studieverktøy: forankring og spørsmålskvalitet, fordi det er de som avgjør om settet lærer deg det riktige.
GPT-5.6 lå øverst på begge. Den var tilfeldigvis også den raskeste av de fem, rundt 23 sekunder per sett mot 30 for Grok, 45 for Kimi og 80 for DeepSeek. Det er en fin bonus, ikke grunnen.
Hadde rekkefølgen vært motsatt, altså om den raskeste modellen hadde hatt den svakeste forankringen, ville vi sendt den trege. Vi har tatt nøyaktig den avgjørelsen før.
Hver modell i denne sammenligningen er under ett år gammel, og minst én av dem er erstattet før neste semester er over. Et modellvalg tatt én gang og aldri revidert blir stille og rolig valget til den som leverte raskest i 2025.
Dette er altså en gjentakende test, ikke en engangsgreie. Samme tre dokumenter, samme frosne instruksjoner, samme blinde panel, nye utfordrere etter hvert som de kommer. Når en ny modell vinner på forankring og spørsmålskvalitet, bytter vi, og byttet er kjedelig fordi prøvebenken allerede finnes.
To praktiske ting.
Hvert kort du lager blir vurdert, før det i det hele tatt når deg, på om det kan spores tilbake til ditt eget dokument. Det er egenskapen vi optimaliserer for foran alt annet, også foran hastighet.
Og hvis et sett noen gang føles for grunt eller for smalt for det eksamen faktisk spør om, be Bo gjøre det vanskeligere eller dekke mer av stoffet. Innstillingene for vanskelighetsgrad og omfang er reelle, og dekning er nettopp dimensjonen der vi vet vi har rom å gå på.