Quand un outil d'IA fabrique tes supports de révision, tu fais confiance à un modèle que tu n'as jamais choisi et que tu ne peux généralement même pas voir. C'est donc une question légitime : lequel utilisons-nous, et comment avons-nous décidé ?
La réponse courte : pour écrire les fiches, les quiz et les examens blancs, nous utilisons actuellement GPT-5.6 dans sa version la plus performante. La réponse longue, c'est le chemin qui y mène, car nous ne choisissons ni sur le prix, ni sur les classements, ni sur le modèle dont on parlait ce mois-là. Nous les testons sur le type de matériel que tu déposes.
Voici la dernière session.
Le difficile, dans une comparaison de modèles, c'est que presque rien ne reste immobile. Recherche différente, texte source différent, résultat différent. Nous figeons donc tout sauf le modèle.
Nous avons pris trois documents réels issus de vrais cours, volontairement différents :
- Un glossaire de comptabilité dense, des définitions du début à la fin
- Un diaporama de psychologie très aéré, quelques puces par diapositive
- Des notes de marketing longues, de vrais paragraphes
Puis nous avons figé le matériel source et les consignes, et changé uniquement le modèle. Trente exécutions, une par une, pour générer fiches et quiz à partir de chaque document, avec exactement les consignes utilisées dans le produit.
Cinq modèles, issus de cinq laboratoires différents : GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 et DeepSeek V4 Pro.
C'est là que les comparaisons de modèles dérapent d'habitude. Si tu notes toi-même les résultats, tu trouves ce que tu t'attendais à trouver. Si tu laisses une seule IA noter, tu as mesuré quel résultat ressemble le plus au style de cette IA.
La notation est donc allée à un jury de trois juges venant de trois entreprises différentes. Chaque juge voyait les cinq ensembles côte à côte, avec les étiquettes mélangées, sans moyen de savoir quel modèle avait écrit quoi. Ils ont noté si chaque fiche était réellement appuyée par la source, si l'ensemble couvrait tout le sujet, si les questions étaient claires et non répétitives, si la difficulté correspondait à celle demandée, et si un vrai étudiant en tirerait quelque chose en révisant.
Trois des juges concouraient également, et c'est une raison légitime de se méfier. Nous l'avons donc vérifié : nous avons comparé le rang que chaque juge attribuait à sa propre production avec celui que les autres juges lui donnaient. Personne ne s'est gonflé. DeepSeek a même noté son propre ensemble plus sévèrement que les autres.
Ce ne fut pas un raz-de-marée. Quatre des cinq modèles ont terminé dans un mouchoir de poche, assez serré pour que nous ne revendiquions aucun vainqueur entre eux sur cette base.
L'ancrage dans la source, ce qui compte le plus : GPT-5.6 en tête avec 4,83 sur 5, Gemini 3.1 Pro à 4,78, Grok 4.5 et Kimi K3 à 4,67. L'ancrage signifie que chaque fiche vient vraiment de ton document et n'est pas inventée. Une fiche assurée et fausse est pire que pas de fiche du tout, donc sur ce chiffre nous ne cédons rien.
La qualité des questions : encore GPT-5.6 en tête avec 4,78, Kimi K3 juste derrière à 4,67, puis Gemini à 4,39 et Grok à 4,11. On mesure si chaque élément teste une idée claire, peut recevoir une réponse, et n'est pas le doublon reformulé d'une autre fiche.
La couverture : là, nous avons perdu. Grok 4.5 obtient 4,50, Gemini 3,72, et GPT-5.6 finit dernier du groupe de tête avec 3,28. La couverture, c'est se répartir sur tout le document plutôt que de se concentrer sur les passages les plus faciles à traiter. C'est une vraie faiblesse de ce que nous livrons aujourd'hui, et elle est sur notre liste.
Un modèle est nettement en retrait : DeepSeek V4 Pro termine dernier sur l'ancrage, la qualité des questions et le classement général, et il est aussi de loin le plus lent, environ 80 secondes contre à peu près 23 pour le plus rapide. C'est un modèle capable en général. Sur cette tâche précise, il n'était pas compétitif.
La qualité est le filtre. La vitesse ne sert qu'à départager.
DeepSeek a été éliminé sur la qualité, et aucun prix bas n'y aurait changé quoi que ce soit. Entre les quatre restants, la lecture honnête est qu'ils sont proches. Nous regardons donc ce sur quoi un cas serré doit se jouer pour un outil de révision : l'ancrage et la qualité des questions, car ce sont eux qui déterminent si l'ensemble t'apprend la bonne chose.
GPT-5.6 était premier sur les deux. Il se trouve qu'il était aussi le plus rapide des cinq, environ 23 secondes par ensemble contre 30 pour Grok, 45 pour Kimi et 80 pour DeepSeek. C'est un bonus agréable, pas la raison.
Si l'ordre avait été inversé, si le modèle le plus rapide avait été celui à l'ancrage le plus fragile, nous aurions livré le lent. Nous avons déjà pris exactement cette décision.
Tous les modèles de cette comparaison ont moins d'un an, et au moins l'un d'eux sera remplacé avant la fin du prochain semestre. Un choix de modèle fait une fois et jamais réexaminé devient discrètement le choix de celui qui a livré le plus vite en 2025.
C'est donc un test récurrent, pas un coup unique. Mêmes trois documents, mêmes consignes figées, même jury à l'aveugle, nouveaux prétendants à mesure qu'ils arrivent. Quand un nouveau modèle gagne sur l'ancrage et la qualité des questions, nous changeons, et le changement est sans drame parce que le banc d'essai existe déjà.
Deux choses concrètes.
Chaque fiche que tu génères est évaluée, avant même de t'arriver, sur sa capacité à être retracée jusqu'à ton propre document. C'est la propriété que nous optimisons avant toutes les autres, y compris la vitesse.
Et si un ensemble te paraît trop superficiel ou trop étroit par rapport à ce que demande ton examen, dis à Bo de le rendre plus difficile ou de couvrir davantage de matière. Les réglages de difficulté et de portée sont réels, et la couverture est justement la dimension où nous savons avoir de la marge.