Cuando una herramienta de IA crea tu material de estudio, estás confiando en un modelo que nunca elegiste y que normalmente ni siquiera puedes ver. Así que es justo preguntar cuál usamos y cómo lo decidimos.
La respuesta corta: para escribir tarjetas, cuestionarios y exámenes usamos actualmente GPT-5.6 en su versión más capaz. La respuesta larga es cómo llegamos ahí, porque no elegimos por precio, ni por rankings, ni por el modelo que salía en las noticias ese mes. Los probamos con el tipo de material que tú subes.
Esta fue la última ronda.
Lo difícil de comparar modelos es que casi nada se queda quieto. Distinta búsqueda, distinto texto de origen, distinto resultado. Así que fijamos todo excepto el modelo.
Tomamos tres documentos reales de cursos reales, deliberadamente distintos entre sí:
- Un glosario de contabilidad denso, definiciones de principio a fin
- Un juego de diapositivas de psicología muy escueto, unas pocas viñetas por diapositiva
- Apuntes largos de marketing, párrafos de verdad
Después congelamos el material de origen y las instrucciones, y cambiamos solo el modelo. Treinta ejecuciones, una detrás de otra, generando tarjetas y cuestionarios de cada documento con exactamente las mismas instrucciones que usa el producto.
Cinco modelos, de cinco laboratorios distintos: GPT-5.6, Gemini 3.1 Pro, Grok 4.5, Kimi K3 y DeepSeek V4 Pro.
Aquí es donde las comparativas de modelos suelen torcerse. Si puntúas tú los resultados, encuentras lo que esperabas encontrar. Si dejas que una sola IA los puntúe, has medido qué resultado se parece más al estilo de esa IA.
Así que la evaluación fue a un panel de tres jueces de tres empresas distintas. Cada juez vio los cinco conjuntos uno al lado del otro, con las etiquetas mezcladas, sin forma de saber qué modelo escribió cuál. Puntuaron si cada tarjeta estaba realmente respaldada por la fuente, si el conjunto cubría todo el tema, si las preguntas eran claras y no repetitivas, si la dificultad coincidía con la pedida y si un estudiante real sacaría provecho al repasar.
Tres de los jueces también competían, y eso merece sospecha. Así que lo comprobamos: comparamos el puesto que cada juez dio a su propio resultado con el puesto que le dieron los demás jueces. Nadie se infló. DeepSeek incluso calificó su propio conjunto con más dureza que los otros.
No fue una goleada. Cuatro de los cinco modelos quedaron muy juntos, lo bastante como para que no proclamemos un ganador entre ellos con esta evidencia.
Fundamentación en la fuente, lo que más importa: GPT-5.6 fue el más alto con 4,83 sobre 5, Gemini 3.1 Pro con 4,78, y Grok 4.5 y Kimi K3 con 4,67. Fundamentación significa que cada tarjeta sale de verdad de tu documento y no está inventada. Una tarjeta segura de sí misma y equivocada es peor que ninguna tarjeta, así que en este número no cedemos.
Calidad de las preguntas: de nuevo GPT-5.6 el más alto con 4,78, Kimi K3 cerca con 4,67, después Gemini con 4,39 y Grok con 4,11. Mide si cada elemento evalúa una idea clara, se puede responder y no es un duplicado reformulado de otra tarjeta.
Cobertura: aquí perdimos. Grok 4.5 sacó 4,50, Gemini 3,72, y GPT-5.6 quedó último del grupo de cabeza con 3,28. Cobertura significa repartirse por todo el documento en lugar de concentrarse en las partes más fáciles de redactar. Es una debilidad real de lo que entregamos hoy, y está en nuestra lista.
Un modelo quedó claramente atrás: DeepSeek V4 Pro fue último en fundamentación, calidad de preguntas y puesto general, y además fue con diferencia el más lento, unos 80 segundos frente a unos 23 del más rápido. En general es un modelo capaz. Para este trabajo concreto no fue competitivo.
La calidad es el filtro. La velocidad solo desempata.
DeepSeek quedó eliminado por calidad, y ningún precio bajo lo habría cambiado. Entre los cuatro restantes, la lectura honesta es que están cerca, así que miramos aquello de lo que debería depender un caso ajustado en una herramienta de estudio: fundamentación y calidad de las preguntas, porque son las que determinan si el conjunto te enseña lo correcto.
GPT-5.6 fue el mejor en ambas. Además resultó ser el más rápido de los cinco, unos 23 segundos por conjunto frente a 30 de Grok, 45 de Kimi y 80 de DeepSeek. Eso es una ventaja añadida, no el motivo.
Si el orden hubiera sido el inverso, si el modelo más rápido hubiera sido el de fundamentación más floja, habríamos lanzado el lento. Ya hemos tomado exactamente esa decisión antes.
Todos los modelos de esta comparativa tienen menos de un año, y al menos uno estará reemplazado antes de que acabe el próximo semestre. Una elección de modelo hecha una vez y nunca revisada se convierte calladamente en la elección de quien lanzó más rápido en 2025.
Por eso esto es una prueba recurrente, no algo puntual. Los mismos tres documentos, las mismas instrucciones congeladas, el mismo panel a ciegas, y nuevos aspirantes según llegan. Cuando un modelo nuevo gane en fundamentación y calidad de preguntas, cambiamos, y el cambio es aburrido porque el banco de pruebas ya existe.
Dos cosas prácticas.
Cada tarjeta que generas se evalúa, antes de llegarte, según si se puede rastrear hasta tu propio documento. Esa es la propiedad que optimizamos por encima de todo lo demás, incluida la velocidad.
Y si alguna vez un conjunto te parece demasiado superficial o demasiado estrecho para lo que pide tu examen, dile a Bo que lo haga más difícil o que cubra más material. Los ajustes de dificultad y alcance son reales, y la cobertura es justamente la dimensión donde sabemos que tenemos margen de mejora.