Saltar al contenido

Precisión

Cuánto acierta. Y cuánto falla.

Muchos detectores presumen de un 99 % de acierto sin decir cómo lo miden. Aquí tienes nuestras cifras reales, medidas con textos que el modelo no había visto, y también los casos en los que fallamos.

0,92

AUC del análisis profundo

Probabilidad de que, ante un texto de IA y uno humano al azar, el de IA puntúe más alto. 1 sería perfecto; 0,5, tirar una moneda.

1 %

Humanos marcados como IA

Textos humanos que salen como «muy probablemente IA» (probabilidad ≥ 0,85). Es la cifra que más nos importa mantener baja.

38 %

IA señalada como «muy probable»

Textos de IA que superan ese mismo umbral. El resto suele quedar como «no concluyente», no como humano.

El equilibrio

Detectar más o acusar menos.

Todo detector tiene que elegir. Si baja el listón, atrapa más IA pero también acusa a más personas inocentes. Nosotros elegimos el listón alto: preferimos que se nos escape un texto de IA a señalar a alguien que ha hecho su trabajo.

Detección y falsos positivos según el umbral
UmbralIA detectadaHumanos marcadosUso
0,3586 %28 %Por debajo: «parece humano»
0,5081 %14 %Solo comparativo
0,6568 %5 %Solo comparativo
0,8043 %1 %Solo comparativo
0,8538 %1 %«Muy probablemente IA»

En detalle

Por tipo de texto.

Con el umbral 0,5, que no usamos para afirmar nada pero sirve para comparar. Así ves qué es fácil y qué es difícil.

Textos de IA detectados
  • Claude · 18 textos94 %
  • ChatGPT · 10 textos80 %
  • Gemini · 9 textos56 %
Textos humanos marcados por error
  • Literatura (Gutenberg) · 33 textos0 %
  • Enciclopedia (Wikipedia) · 25 textos8 %
  • Noticias (Wikinoticias) · 50 textos16 %
  • Libros de texto (Wikilibros) · 20 textos25 %
  • Apuntes y exámenes de alumnos · 9 textos44 %

Sin maquillaje

Dónde fallamos.

Apuntes, exámenes y libros de texto

Los apuntes que resumen un libro de texto (y los propios libros) usan frases hechas y definiciones conocidas, y eso los hace muy previsibles. Es el caso que más nos preocupa: por eso el resultado intermedio es «no concluyente» y no «IA». Estamos reuniendo más textos de alumnos para mejorar aquí.

IA a la que se pide «que no parezca IA»

Gemini, sobre todo cuando se le pide sonar humano, es lo que más se nos escapa. Sale como «no concluyente» más a menudo que como IA.

Noticias cortas y formales

Las noticias humanas escritas con estilo de agencia se parecen a la IA en el estilo y en lo previsible.

Metodología

Cómo lo medimos.

Usamos 37 textos generados por IA (Claude, ChatGPT y Gemini, incluidos textos a los que se pidió expresamente sonar humanos) y 137 textos humanos: literatura de dominio público, artículos de Wikipedia, noticias de Wikinoticias y capítulos de libros de texto de Wikilibros anteriores a 2022 (antes de ChatGPT), y apuntes y exámenes reales de alumnos escritos sin IA.

Las cifras salen de una validación cruzada en 5 partes: cada texto se puntúa con un modelo entrenado sin él. Es la forma honesta de estimar cómo funcionará con textos nuevos.

Es una muestra pequeña y la iremos ampliando; las cifras se actualizan cada vez que recalibramos (octubre de 2026). El análisis de estilo por sí solo tiene un AUC de 0,78.

¿Quieres comprobarlo tú?

Analizar un texto