Gratis verktøyPriserMobilapp
Logg inn
Kom i gang gratisKom i gang gratis
Ask Bo
  • Spør Bo om hva som helstSvar fra dine egne forelesninger, med kilde
  • AI-flashcardsLag et sett til kapittel 4
  • Image OcclusionSkjul tekstene på en figur
  • ØvingsprøverLag en prøve med 20 spørsmål
  • TankekartVis hvordan ideene henger sammen
  • StudieguiderOppsummer hele emnet
  • AI-sammendragOppsummer fredagens forelesning
  • AI-quizQuiz meg i kapittel 4
  • JukselapperÉn side til eksamen
Kom i gang gratisKom i gang gratisLogg inn
  • Spør Bo om hva som helst
  • AI-flashcards
  • Image Occlusion
  • Øvingsprøver
  • Tankekart
  • Studieguider
  • AI-sammendrag
  • AI-quiz
  • Jukselapper
Gratis verktøyPriserMobilapp
  • Hvordan vi tester
  • Vi retter ikke vår egen prøve
  • Hva vi fant
  • Hvordan vi faktisk bestemmer
  • Hvorfor vi gjentar dette
  • Hva dette betyr for deg
Back to blog
10 Aug 20265 min read

Hvilken KI skriver egentlig studiematerialet ditt? Vi testet fem og valgte på kvalitet

Vi kjørte GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 og DeepSeek V4 Pro på det samme ekte forelesningsmaterialet og fikk dem vurdert blindt. Dette kom ut.

  • LHLuis Henrich-Bandis
Loading...
Spør Bo om hva som helst

Last opp forelesninger og notater. Bo leser dem og svarer ut fra ditt eget pensum.

Øvingseksamener fra kurset ditt

Bo skriver et komplett eksamenssett ut fra temaene og forelesningene du velger.

Flashcards på sekunder

Bo gjør slides og pensumtekster om til ferdige flashcard-sett.

Tankekart og sammendrag

Se hvordan begrepene henger sammen, eller få et ryddig sammendrag av en forelesning.

Faget ditt, ikke hele internett.

Funksjoner

  • Spør Bo
  • AI-flashcards
  • Image Occlusion
  • AI-eksamener
  • Tankekart
  • Studieguider
  • AI-sammendrag
  • AI-quiz
  • Jukselapper

Gratis verktøy

  • Flashcard-generator
  • Quiz-generator
  • Tankekart-generator
  • Studieguide-generator
  • PDF-sammendrag
  • Flashcards fra slides

Sammenlign

  • vs ChatGPT
  • vs Quizlet
  • vs Anki
  • vs YouLearn
  • Alle sammenligninger

Ressurser

  • Ordliste
  • Svar
  • Slik fungerer det
  • Hvorfor StudyPDF
  • Bruksområder

Selskap

  • Priser
  • FAQ
  • Misjon
  • Creator-program
  • Enterprise
  • Kontakt
  • Changelog

Juridisk

  • Personvern
  • Vilkår
  • Juridisk info
© 2026 StudyPDFFree to start. No card required.

Når et KI-verktøy lager studiematerialet ditt, stoler du på en modell du aldri har valgt og som regel ikke engang kan se. Så det er et rimelig spørsmål hvilken vi bruker, og hvordan vi bestemte oss.

Kort svar: for å skrive læringskort, quizer og øvingseksamener kjører vi i dag GPT-5.6 i den kraftigste utgaven. Det lange svaret er hvordan vi kom dit, for vi velger ikke etter pris, ikke etter rangeringslister, og ikke etter hvilken modell som var i nyhetene den måneden. Vi tester dem på den typen materiale du laster opp.

Her er siste runde.

Hvordan vi tester

Det vanskelige med å sammenligne modeller er at nesten ingenting står stille. Annet søk, annen kildetekst, annet resultat. Så vi fryser alt bortsett fra modellen.

Vi tok tre ekte dokumenter fra ekte emner, bevisst ulike i form:

  • Et tett regnskapsglossar, definisjoner fra ende til annen
  • Et tynt psykologi-lysbildesett, noen få kulepunkter per lysbilde
  • Lange markedsføringsnotater, ordentlige avsnitt

Deretter frøs vi kildematerialet og instruksjonene, og byttet bare modellen. Tretti kjøringer, én om gangen, med læringskort og quizer fra hvert dokument, med nøyaktig de instruksjonene produktet bruker.

Fem modeller, fra fem ulike laboratorier: GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 og DeepSeek V4 Pro.

Vi retter ikke vår egen prøve

Det er her modellsammenligninger vanligvis sporer av. Retter du resultatene selv, finner du det du forventet å finne. Lar du én KI vurdere, har du målt hvilket resultat som ligner mest på den KI-ens egen stil.

Vurderingen gikk derfor til et panel med tre dommere fra tre ulike selskaper. Hver dommer så alle fem settene side om side, med stokkede merkelapper, uten mulighet til å vite hvilken modell som hadde skrevet hva. De vurderte om hvert kort faktisk var dekket av kilden, om settet dekket hele temaet, om spørsmålene var klare og ikke gjentakende, om vanskelighetsgraden svarte til den bestilte, og om en ekte student får noe ut av det når hen repeterer.

Tre av dommerne stilte også selv, og det er rimelig å være skeptisk til. Så vi sjekket det: vi sammenlignet plasseringen hver dommer ga sitt eget resultat med plasseringen de andre dommerne ga det samme resultatet. Ingen blåste opp seg selv. DeepSeek vurderte til og med sitt eget sett strengere enn de andre gjorde.

Hva vi fant

Det ble ikke et jordskred. Fire av de fem modellene endte i en tett gruppe, tett nok til at vi ikke vil utrope noen vinner mellom dem på dette grunnlaget.

Kildeforankring, det som betyr mest: GPT-5.6 høyest med 4,83 av 5, Gemini 3.1 Pro på 4,78, og Grok 4.5 og Kimi K3 begge på 4,67. Forankring betyr at hvert kort faktisk kommer fra ditt dokument og ikke er oppdiktet. Et selvsikkert feil læringskort er verre enn ingen kort, så på dette tallet gir vi ikke etter.

Spørsmålskvalitet: igjen GPT-5.6 høyest med 4,78, Kimi K3 like bak på 4,67, så Gemini på 4,39 og Grok på 4,11. Dette måler om hvert element tester én klar idé, kan besvares, og ikke er en omskrevet dublett av et annet kort.

Dekning: her tapte vi. Grok 4.5 fikk 4,50, Gemini 3,72, og GPT-5.6 kom sist i toppgruppen med 3,28. Dekning betyr å spre seg over hele dokumentet i stedet for å klumpe seg der det var lettest å skrive. Det er en reell svakhet ved det vi leverer i dag, og den står på lista vår.

Én modell lå klart etter: DeepSeek V4 Pro ble sist på forankring, spørsmålskvalitet og totalplassering, og var dessuten desidert tregest, rundt 80 sekunder mot omtrent 23 for den raskeste. Generelt er det en dyktig modell. På akkurat denne jobben var den ikke konkurransedyktig.

Hvordan vi faktisk bestemmer

Kvalitet er filteret. Hastighet avgjør bare ved uavgjort.

DeepSeek røk ut på kvalitet, og ingen lav pris ville endret det. Mellom de fire som sto igjen er den ærlige lesningen at de er jevne, så vi ser på hva et jevnt tilfelle bør avgjøres av for et studieverktøy: forankring og spørsmålskvalitet, fordi det er de som avgjør om settet lærer deg det riktige.

GPT-5.6 lå øverst på begge. Den var tilfeldigvis også den raskeste av de fem, rundt 23 sekunder per sett mot 30 for Grok, 45 for Kimi og 80 for DeepSeek. Det er en fin bonus, ikke grunnen.

Hadde rekkefølgen vært motsatt, altså om den raskeste modellen hadde hatt den svakeste forankringen, ville vi sendt den trege. Vi har tatt nøyaktig den avgjørelsen før.

Hvorfor vi gjentar dette

Hver modell i denne sammenligningen er under ett år gammel, og minst én av dem er erstattet før neste semester er over. Et modellvalg tatt én gang og aldri revidert blir stille og rolig valget til den som leverte raskest i 2025.

Dette er altså en gjentakende test, ikke en engangsgreie. Samme tre dokumenter, samme frosne instruksjoner, samme blinde panel, nye utfordrere etter hvert som de kommer. Når en ny modell vinner på forankring og spørsmålskvalitet, bytter vi, og byttet er kjedelig fordi prøvebenken allerede finnes.

Hva dette betyr for deg

To praktiske ting.

Hvert kort du lager blir vurdert, før det i det hele tatt når deg, på om det kan spores tilbake til ditt eget dokument. Det er egenskapen vi optimaliserer for foran alt annet, også foran hastighet.

Og hvis et sett noen gang føles for grunt eller for smalt for det eksamen faktisk spør om, be Bo gjøre det vanskeligere eller dekke mer av stoffet. Innstillingene for vanskelighetsgrad og omfang er reelle, og dekning er nettopp dimensjonen der vi vet vi har rom å gå på.