Darmowe narzędziaCennikAplikacja mobilna
Zaloguj się
Zacznij za darmoZacznij za darmo
Zapytaj Bo
  • Zapytaj Bo o wszystkoOdpowiedzi z twoich wykładów, z odnośnikami
  • Fiszki z AIZrób mi talię do rozdziału 4
  • Image OcclusionZasłoń podpisy na schemacie
  • Egzaminy próbneStwórz próbny egzamin z 20 pytaniami
  • Mapy myśliPokaż, jak łączą się te pojęcia
  • Przewodniki do naukiStreść cały dział
  • Streszczenie z AIStreść piątkowy wykład
  • Quiz z AIOdpytaj mnie z rozdziału 4
  • ŚciągiJedna strona na egzamin
Zacznij za darmoZacznij za darmoZaloguj się
  • Zapytaj Bo o wszystko
  • Fiszki z AI
  • Image Occlusion
  • Egzaminy próbne
  • Mapy myśli
  • Przewodniki do nauki
  • Streszczenie z AI
  • Quiz z AI
  • Ściągi
Darmowe narzędziaCennikAplikacja mobilna
  • Jak testujemy
  • Nie sprawdzamy własnej pracy
  • Co znaleźliśmy
  • Jak naprawdę decydujemy
  • Dlaczego robimy to ponownie
  • Co to znaczy dla ciebie
Back to blog
10 Aug 20265 min read

Która SI naprawdę pisze twoje materiały do nauki? Sprawdziliśmy pięć i wybraliśmy według jakości

Uruchomiliśmy GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 i DeepSeek V4 Pro na tym samym prawdziwym materiale z wykładów i oddaliśmy je do ślepej oceny. Oto wynik.

  • LHLuis Henrich-Bandis
Loading...
Zapytaj Bo o cokolwiek

Prześlij swoje wykłady i notatki. Bo je czyta i odpowiada na podstawie twojego materiału z kursu.

Egzaminy próbne z twojego kursu

Bo pisze pełny egzamin próbny na podstawie tematów i wykładów, które wybierzesz.

Fiszki w kilka sekund

Bo zamienia twoje slajdy i lektury w gotowe do nauki talie fiszek.

Mapy myśli i streszczenia

Zobacz, jak łączą się twoje pojęcia, albo otrzymaj przejrzyste streszczenie dowolnego wykładu.

Twój kurs, nie cały internet.

Funkcje

  • Zapytaj Bo
  • Fiszki z AI
  • Image Occlusion
  • Egzaminy z AI
  • Mapy myśli
  • Przewodniki do nauki
  • Streszczenie z AI
  • Quiz z AI
  • Ściągi

Darmowe narzędzia

  • Generator fiszek
  • Generator quizów
  • Generator map myśli
  • Generator przewodników do nauki
  • Streszczanie PDF
  • Fiszki ze slajdów

Porównania

  • vs ChatGPT
  • vs Quizlet
  • vs Anki
  • vs YouLearn
  • Wszystkie porównania

Materiały

  • Słownik
  • Odpowiedzi
  • Jak działa Bo
  • Dlaczego StudyPDF
  • Zastosowania

Firma

  • Cennik
  • FAQ
  • Misja
  • Program dla twórców
  • Enterprise
  • Kontakt
  • Lista zmian

Informacje prawne

  • Prywatność
  • Regulamin
  • Informacje prawne
© 2026 StudyPDFFree to start. No card required.

Kiedy narzędzie SI tworzy twoje materiały do nauki, ufasz modelowi, którego nigdy nie wybierałeś i którego zwykle nawet nie widzisz. Uczciwie jest więc zapytać, którego używamy i jak podjęliśmy tę decyzję.

Krótka odpowiedź: do pisania fiszek, quizów i egzaminów próbnych używamy obecnie GPT-5.6 w jego najmocniejszej wersji. Dłuższa odpowiedź to droga, która nas tam doprowadziła, bo nie wybieramy według ceny, rankingów ani tego, o którym modelu akurat mówiono w danym miesiącu. Testujemy je na takim materiale, jaki wgrywasz ty.

Oto ostatnia runda.

Jak testujemy

Trudność w porównywaniu modeli polega na tym, że prawie nic nie stoi w miejscu. Inne wyszukiwanie, inny tekst źródłowy, inny wynik. Dlatego zamrażamy wszystko poza modelem.

Wzięliśmy trzy prawdziwe dokumenty z prawdziwych kursów, celowo różne w charakterze:

  • Gęsty słownik pojęć księgowych, definicje od początku do końca
  • Ubogi zestaw slajdów z psychologii, kilka punktów na slajd
  • Obszerne notatki marketingowe, prawdziwe akapity

Potem zamroziliśmy materiał źródłowy i instrukcje, zmieniając wyłącznie model. Trzydzieści przebiegów, jeden po drugim, z fiszkami i quizami z każdego dokumentu, dokładnie na tych instrukcjach, których używa produkt.

Pięć modeli z pięciu różnych laboratoriów: GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 i DeepSeek V4 Pro.

Nie sprawdzamy własnej pracy

To właśnie tutaj porównania modeli zwykle się psują. Jeśli sam oceniasz wyniki, znajdujesz to, czego się spodziewałeś. Jeśli ocenia je jedna SI, zmierzyłeś, który wynik najbardziej przypomina styl tej SI.

Ocena trafiła więc do panelu trzech sędziów z trzech różnych firm. Każdy sędzia widział wszystkie pięć zestawów obok siebie, z przetasowanymi etykietami, bez możliwości ustalenia, który model co napisał. Oceniali, czy każda fiszka ma faktyczne pokrycie w źródle, czy zestaw obejmuje cały temat, czy pytania są jasne i nie powtarzają się, czy trudność odpowiada zamówionej i czy prawdziwy student wyniesie z tego coś przy powtórce.

Trzech sędziów samych stawało w szranki i słusznie budzi to podejrzliwość. Sprawdziliśmy to więc: porównaliśmy miejsce, które każdy sędzia przyznał własnemu wynikowi, z miejscem, jakie temu samemu wynikowi dali pozostali sędziowie. Nikt się nie zawyżył. DeepSeek ocenił własny zestaw nawet surowiej niż pozostali.

Co znaleźliśmy

To nie było miażdżące zwycięstwo. Cztery z pięciu modeli zmieściły się w bardzo ciasnej grupie, na tyle blisko, że na tej podstawie nie ogłosimy między nimi zwycięzcy.

Oparcie w źródle, rzecz najważniejsza: GPT-5.6 najwyżej z wynikiem 4,83 na 5, Gemini 3.1 Pro 4,78, a Grok 4.5 i Kimi K3 po 4,67. Oparcie w źródle oznacza, że każda fiszka naprawdę pochodzi z twojego dokumentu, a nie została zmyślona. Pewna siebie i błędna fiszka jest gorsza niż jej brak, więc przy tej liczbie nie ustępujemy.

Jakość pytań: znowu GPT-5.6 najwyżej z 4,78, Kimi K3 tuż za nim z 4,67, potem Gemini z 4,39 i Grok z 4,11. Mierzy to, czy każdy element sprawdza jedną jasną myśl, da się na niego odpowiedzieć i nie jest przeformułowanym duplikatem innej fiszki.

Pokrycie materiału: tu przegraliśmy. Grok 4.5 uzyskał 4,50, Gemini 3,72, a GPT-5.6 wypadł ostatni w czołowej grupie z 3,28. Pokrycie oznacza rozłożenie się na cały dokument zamiast skupiania się na fragmentach, o których najłatwiej było napisać. To realna słabość tego, co dziś dostarczamy, i jest na naszej liście.

Jeden model wyraźnie odstawał: DeepSeek V4 Pro był ostatni w oparciu w źródle, jakości pytań i miejscu ogólnym, a przy tym zdecydowanie najwolniejszy, około 80 sekund wobec mniej więcej 23 u najszybszego. Ogólnie to zdolny model. Do tego konkretnego zadania nie był konkurencyjny.

Jak naprawdę decydujemy

Jakość jest filtrem. Szybkość rozstrzyga tylko remis.

DeepSeek odpadł na jakości i żadna niska cena tego by nie zmieniła. Między czterema, które zostały, uczciwy odczyt jest taki, że są blisko siebie, patrzymy więc na to, od czego przy narzędziu do nauki powinien zależeć bliski wynik: na oparcie w źródle i jakość pytań, bo to one decydują, czy zestaw uczy cię właściwych rzeczy.

GPT-5.6 był najlepszy w obu. Okazał się przy tym najszybszy z całej piątki, około 23 sekundy na zestaw wobec 30 u Groka, 45 u Kimi i 80 u DeepSeeka. To miły dodatek, nie powód.

Gdyby kolejność była odwrotna, gdyby najszybszy model miał najsłabsze oparcie w źródle, wypuścilibyśmy ten wolniejszy. Dokładnie taką decyzję już kiedyś podjęliśmy.

Dlaczego robimy to ponownie

Każdy model w tym porównaniu ma mniej niż rok, a przynajmniej jeden z nich zostanie zastąpiony przed końcem następnego semestru. Wybór modelu dokonany raz i nigdy nierewidowany po cichu staje się wyborem tego, kto najszybciej wypuścił coś w 2025 roku.

To więc test cykliczny, a nie jednorazowy. Te same trzy dokumenty, te same zamrożone instrukcje, ten sam ślepy panel, nowi pretendenci w miarę jak się pojawiają. Kiedy nowy model wygra w oparciu w źródle i jakości pytań, zmieniamy, a zmiana jest nudna, bo stanowisko testowe już stoi.

Co to znaczy dla ciebie

Dwie praktyczne rzeczy.

Każda fiszka, którą generujesz, jest oceniana, zanim w ogóle do ciebie trafi, pod kątem tego, czy da się ją prześledzić z powrotem do twojego własnego dokumentu. To właśnie ta cecha jest dla nas ważniejsza od wszystkich innych, także od szybkości.

A jeśli kiedyś zestaw wyda ci się zbyt płytki albo zbyt wąski wobec tego, o co pyta twój egzamin, powiedz Bo, żeby zrobił go trudniejszym albo objął więcej materiału. Ustawienia trudności i zakresu są prawdziwe, a pokrycie to dokładnie ten wymiar, w którym wiemy, że mamy jeszcze pole do poprawy.