Precisión
Cuánto acierta. Y cuánto falla.
0,92
AUC del análisis profundo
Probabilidad de que, ante un texto de IA y uno humano al azar, el de IA puntúe más alto. 1 sería perfecto; 0,5, tirar una moneda.
1 %
Humanos marcados como IA
Textos humanos que salen como «muy probablemente IA» (probabilidad ≥ 0,85). Es la cifra que más nos importa mantener baja.
38 %
IA señalada como «muy probable»
Textos de IA que superan ese mismo umbral. El resto suele quedar como «no concluyente», no como humano.
El equilibrio
Detectar más o acusar menos.
Todo detector tiene que elegir. Si baja el listón, atrapa más IA pero también acusa a más personas inocentes. Nosotros elegimos el listón alto: preferimos que se nos escape un texto de IA a señalar a alguien que ha hecho su trabajo.
| Umbral | IA detectada | Humanos marcados | Uso |
|---|---|---|---|
| 0,35 | 86 % | 28 % | Por debajo: «parece humano» |
| 0,50 | 81 % | 14 % | Solo comparativo |
| 0,65 | 68 % | 5 % | Solo comparativo |
| 0,80 | 43 % | 1 % | Solo comparativo |
| 0,85 | 38 % | 1 % | «Muy probablemente IA» |
En detalle
Por tipo de texto.
Con el umbral 0,5, que no usamos para afirmar nada pero sirve para comparar. Así ves qué es fácil y qué es difícil.
- Claude · 18 textos94 %
- ChatGPT · 10 textos80 %
- Gemini · 9 textos56 %
- Literatura (Gutenberg) · 33 textos0 %
- Enciclopedia (Wikipedia) · 25 textos8 %
- Noticias (Wikinoticias) · 50 textos16 %
- Libros de texto (Wikilibros) · 20 textos25 %
- Apuntes y exámenes de alumnos · 9 textos44 %
Sin maquillaje
Dónde fallamos.
Apuntes, exámenes y libros de texto
Los apuntes que resumen un libro de texto (y los propios libros) usan frases hechas y definiciones conocidas, y eso los hace muy previsibles. Es el caso que más nos preocupa: por eso el resultado intermedio es «no concluyente» y no «IA». Estamos reuniendo más textos de alumnos para mejorar aquí.
IA a la que se pide «que no parezca IA»
Gemini, sobre todo cuando se le pide sonar humano, es lo que más se nos escapa. Sale como «no concluyente» más a menudo que como IA.
Noticias cortas y formales
Las noticias humanas escritas con estilo de agencia se parecen a la IA en el estilo y en lo previsible.
Metodología
Cómo lo medimos.
Usamos 37 textos generados por IA (Claude, ChatGPT y Gemini, incluidos textos a los que se pidió expresamente sonar humanos) y 137 textos humanos: literatura de dominio público, artículos de Wikipedia, noticias de Wikinoticias y capítulos de libros de texto de Wikilibros anteriores a 2022 (antes de ChatGPT), y apuntes y exámenes reales de alumnos escritos sin IA.
Las cifras salen de una validación cruzada en 5 partes: cada texto se puntúa con un modelo entrenado sin él. Es la forma honesta de estimar cómo funcionará con textos nuevos.
Es una muestra pequeña y la iremos ampliando; las cifras se actualizan cada vez que recalibramos (octubre de 2026). El análisis de estilo por sí solo tiene un AUC de 0,78.
¿Quieres comprobarlo tú?
Analizar un texto