Ferramentas grátisPreçosApp para celular
Entrar
Começar grátisComeçar grátis
Pergunte ao Bo
  • Pergunte tudo ao BoRespostas tiradas das suas aulas, com fontes
  • Flashcards com IAFaz um baralho para o capítulo 4
  • Image OcclusionCobre as legendas de um diagrama
  • Provas de treinoCria um simulado de 20 questões
  • Mapas mentaisMostra como essas ideias se conectam
  • Guias de estudoResume a unidade inteira
  • Resumo com IAResume a aula de sexta
  • Quiz com IAMe testa sobre o capítulo 4
  • ColasUma página para a prova final
Começar grátisComeçar grátisEntrar
  • Pergunte tudo ao Bo
  • Flashcards com IA
  • Image Occlusion
  • Provas de treino
  • Mapas mentais
  • Guias de estudo
  • Resumo com IA
  • Quiz com IA
  • Colas
Ferramentas grátisPreçosApp para celular
  • Como testamos
  • Não corrigimos o nosso próprio teste
  • O que encontrámos
  • Como decidimos na verdade
  • Porque repetimos isto
  • O que isto significa para ti
Back to blog
10 Aug 20265 min read

Que IA escreve mesmo o teu material de estudo? Testámos cinco e escolhemos pela qualidade

Corremos GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 e DeepSeek V4 Pro sobre o mesmo material de aulas real e mandámos avaliar às cegas. Foi isto que deu.

  • LHLuis Henrich-Bandis
Loading...
Pergunte qualquer coisa ao Bo

Envie suas aulas e anotações. O Bo lê tudo e responde com base no material do seu curso.

Provas de prática do seu curso

O Bo escreve uma prova completa a partir dos tópicos e aulas que você escolher.

Flashcards em segundos

O Bo transforma seus slides e leituras em decks de flashcards prontos para estudar.

Mapas mentais e resumos

Veja como seus conceitos se conectam, ou receba um resumo claro de qualquer aula.

Seu curso, não a internet.

Recursos

  • Pergunte ao Bo
  • Flashcards com IA
  • Image Occlusion
  • Provas com IA
  • Mapas mentais
  • Guias de estudo
  • Resumo com IA
  • Quiz com IA
  • Colas

Ferramentas gratuitas

  • Gerador de flashcards
  • Gerador de quiz
  • Gerador de mapas mentais
  • Gerador de guias de estudo
  • Resumidor de PDF
  • Flashcards de slides

Comparações

  • vs ChatGPT
  • vs Quizlet
  • vs Anki
  • vs YouLearn
  • Todas as comparações

Materiais

  • Glossário
  • Respostas
  • Como o Bo funciona
  • Por que StudyPDF
  • Casos de uso

Empresa

  • Preços
  • Perguntas frequentes
  • Missão
  • Programa de criadores
  • Enterprise
  • Contato
  • Registro de mudanças

Jurídico

  • Privacidade
  • Termos
  • Aviso legal
© 2026 StudyPDFComece de graça. Sem cartão.

Quando uma ferramenta de IA cria o teu material de estudo, estás a confiar num modelo que nunca escolheste e que normalmente nem consegues ver. Por isso é justo perguntar qual usamos e como decidimos.

A resposta curta: para escrever flashcards, quizzes e exames de treino usamos neste momento o GPT-5.6 na sua versão mais capaz. A resposta longa é o caminho até lá, porque não escolhemos pelo preço, nem por tabelas classificativas, nem pelo modelo que estava nas notícias naquele mês. Testamo-los no tipo de material que tu carregas.

Foi esta a última ronda.

Como testamos

O difícil em comparar modelos é que quase nada fica quieto. Pesquisa diferente, texto de origem diferente, resultado diferente. Por isso fixamos tudo exceto o modelo.

Pegámos em três documentos reais de cursos reais, propositadamente diferentes na forma:

  • Um glossário de contabilidade denso, definições de uma ponta à outra
  • Um conjunto de slides de psicologia muito escasso, uns poucos tópicos por slide
  • Apontamentos longos de marketing, parágrafos a sério

Depois congelámos o material de origem e as instruções, mudando apenas o modelo. Trinta execuções, uma de cada vez, gerando flashcards e quizzes de cada documento com exatamente as instruções que o produto usa.

Cinco modelos, de cinco laboratórios diferentes: GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 e DeepSeek V4 Pro.

Não corrigimos o nosso próprio teste

É aqui que as comparações de modelos costumam descarrilar. Se és tu a pontuar os resultados, encontras aquilo que esperavas encontrar. Se deixares uma só IA pontuar, mediste qual resultado mais se parece com o estilo dessa IA.

A avaliação foi então entregue a um painel de três juízes de três empresas diferentes. Cada juiz viu os cinco conjuntos lado a lado, com as etiquetas baralhadas, sem forma de saber que modelo escreveu qual. Avaliaram se cada cartão estava mesmo sustentado pela fonte, se o conjunto cobria o tema todo, se as perguntas eram claras e não repetitivas, se a dificuldade correspondia à pedida e se um estudante real ganharia alguma coisa ao rever.

Três dos juízes também estavam em prova, e isso merece desconfiança. Por isso verificámos: comparámos o lugar que cada juiz deu ao seu próprio resultado com o lugar que os outros juízes deram a esse mesmo resultado. Ninguém se inflacionou. O DeepSeek até avaliou o seu próprio conjunto com mais dureza do que os outros.

O que encontrámos

Não foi uma goleada. Quatro dos cinco modelos ficaram muito juntos, próximos o suficiente para não reclamarmos um vencedor entre eles com esta evidência.

Sustentação na fonte, o que mais importa: GPT-5.6 no topo com 4,83 em 5, Gemini 3.1 Pro com 4,78, e Grok 4.5 e Kimi K3 ambos com 4,67. Sustentação significa que cada cartão vem mesmo do teu documento e não foi inventado. Um flashcard confiante e errado é pior do que nenhum flashcard, por isso neste número não abrimos mão.

Qualidade das perguntas: de novo GPT-5.6 no topo com 4,78, Kimi K3 logo atrás com 4,67, depois Gemini com 4,39 e Grok com 4,11. Mede se cada item testa uma ideia clara, é respondível e não é um duplicado reescrito de outro cartão.

Cobertura: aqui perdemos. Grok 4.5 obteve 4,50, Gemini 3,72, e o GPT-5.6 ficou em último no grupo da frente com 3,28. Cobertura significa espalhar-se pelo documento inteiro em vez de se concentrar nas partes sobre as quais era mais fácil escrever. É uma fraqueza real do que entregamos hoje e está na nossa lista.

Um modelo ficou claramente atrás: o DeepSeek V4 Pro foi último em sustentação, qualidade das perguntas e lugar geral, e foi ainda de longe o mais lento, cerca de 80 segundos contra uns 23 do mais rápido. Em geral é um modelo capaz. Neste trabalho específico não foi competitivo.

Como decidimos na verdade

A qualidade é o filtro. A velocidade só desempata.

O DeepSeek caiu pela qualidade, e nenhum preço baixo teria mudado isso. Entre os quatro que sobraram, a leitura honesta é que estão próximos, por isso olhamos para aquilo de que um caso renhido deve depender numa ferramenta de estudo: sustentação na fonte e qualidade das perguntas, porque são elas que determinam se o conjunto te ensina a coisa certa.

O GPT-5.6 estava no topo em ambas. Calhou ser também o mais rápido dos cinco, cerca de 23 segundos por conjunto contra 30 do Grok, 45 do Kimi e 80 do DeepSeek. É um bónus simpático, não a razão.

Se a ordem tivesse sido a inversa, se o modelo mais rápido fosse o de sustentação mais frágil, teríamos lançado o lento. Já tomámos exatamente essa decisão.

Porque repetimos isto

Todos os modelos desta comparação têm menos de um ano, e pelo menos um deles estará substituído antes de o próximo semestre acabar. Uma escolha de modelo feita uma vez e nunca revista torna-se silenciosamente a escolha de quem lançou mais depressa em 2025.

Portanto isto é um teste recorrente, não um caso isolado. Os mesmos três documentos, as mesmas instruções congeladas, o mesmo painel às cegas, novos candidatos à medida que aparecem. Quando um modelo novo ganhar em sustentação e qualidade das perguntas, mudamos, e a mudança é aborrecida porque a bancada de testes já existe.

O que isto significa para ti

Duas coisas práticas.

Cada cartão que geras é avaliado, antes sequer de chegar até ti, quanto a poder ser rastreado até ao teu próprio documento. É essa a propriedade que otimizamos acima de todas as outras, incluindo a velocidade.

E se algum conjunto te parecer demasiado superficial ou demasiado estreito para o que o teu exame pede, diz ao Bo para o tornar mais difícil ou para cobrir mais matéria. As definições de dificuldade e de âmbito são reais, e a cobertura é precisamente a dimensão onde sabemos que temos margem.