¿Son fiables los detectores de texto generado por IA? Así funcionan Pangram, GPTZero, etc.

Por Juan González Villa

Los detectores de IA no certifican que un texto lo haya escrito una IA o un humano, sólo te dicen si contiene patrones similares a los de otros textos generados por IA. ¿Podemos fiarnos de herramientas como Pangram y GPTZero, o es fácil engañarlos? Vamos a verlo con datos:

¿Qué método usan los principales detectores?

Los detectores de IA más comunes siguen el mismo método: son redes neuronales entrenadas con dos grupos de textos, uno con textos generados por IA, y otro con textos que con toda certeza fueron escritos por humanos.

Para llegar a tasas de efectividad aceptables se necesitan cientos de miles o incluso millones de textos. En esta fase, el modelo aprende patrones estadísticos de uno y otro grupo.

Estos patrones pueden ser el vocabulario elegido, combinaciones de palabras, pero también la sintaxis, puntuación, repeticiones, estructura de las frases y del texto en general, etc.

A continuación, se le presentan a la red neuronal miles de textos donde se ha ocultado la etiqueta IA/Humano y, de acuerdo a lo que ha aprendido, debe predecir si pertenecen a uno u otro grupo.

En una primera pasada va a cometer bastantes errores, pero los errores se retroalimentan a la red y puede aprender de los casos en los que ha fallado, ajustando sus pesos para acertar más en la próxima ronda. Este proceso se repite muchas veces.

Una forma de perfeccionar las predicciones es alimentarlo con textos cada vez más difíciles de diferenciar, y si el detector ya está en producción o beta, casos en los que los usuarios han protestado por el veredicto (si la protesta es fiable). Así el modelo va añadiendo a su entrenamiento casos menos habituales.

Pero en algún momento tienen que cortar el entrenamiento de cada versión del detector, por lo que siempre va a haber casos extremos que no han visto y por tanto no saben detectar (escritura humana con patrones muy parecidos a la IA, y viceversa).

Cada proveedor tiene sus datasets de entrenamiento y sus técnicas para ajustarlo, pero este es el método general que comparten los detectores más populares, como Pangram, Originality o GPTZero.

¿Sirven para identificar marcas de agua?

No, estas herramientas no sirven para identificar marcas de agua, porque como expliqué en mi post sobre watermarking en texto, para detectar una marca de agua hay que conocerla (o conocer la clave que la descifra).

Por tanto, estos detectores sólo miden hasta qué punto un texto presenta los patrones que ha visto previamente en textos generados por IA. Pero no pueden certificar que el texto procede de un LLM (y mucho menos pueden decirte qué modelo concreto generó el texto).

¿Es fiable el veredicto de un detector de IA?

Lo primero, hay que entender que pueden fallar de dos formas:

1. Falso positivo es cuando etiquetan como IA un texto que en realidad ha sido escrito por un humano. Cuando los detectores eran muy básicos circulaban por las redes varios errores garrafales, como marcar como IA pasajes de la Biblia o la Declaración de Independencia de los Estados Unidos, pero hoy este tipo de errores son mucho menos frecuentes.

Por dar datos recientes: en un análisis realizado sobre 495 textos de unas 500 palabras, Pangram y GPTZero incurrieron en 0 falsos positivos. Dado el tamaño de la muestra y una confianza del 90%, se puede estimar que su tasa de falsos positivos es igual o menor a un 0,5%. Originality lo hizo peor (tuvo 19 falsos positivos, un 4%).

2. Falso negativo. Es cuando se les escapa un texto generado por LLM y lo marcan como si fuera humano. En circunstancias normales los detectores actuales también presentan buenas cifras (por debajo del 1%), pero existen tácticas para engañar al detector.

La clave es darle a la IA ejemplos de lo que quieres y pedirle que lo imite. Sólo con proporcionarle a la IA 5 ejemplos de textos de 500 palabras de un autor concreto la tasa de falsos negativos sube mucho, con valores entre el 10% (Pangram) y el 18% (Originality).

Esta técnica parece funcionar mejor con el estilo propio de papers científicos. Tras darle a un LLM 5 fragmentos de papers de un autor concreto como ejemplo, los detectores lo hicieron peor aún, con un rango de error entre el 24% (GPTZero) y 29% (Originality).

Resumiendo: según datos publicados en julio de 2026 por Epoch AI (una entidad independiente), Pangram y GPTZero son los más fiables, y por detrás estaría Originality.

Aún así, los 3 tienen serios problemas de falsos negativos cuando intencionalmente se intenta confundir a los detectores imitando un estilo humano concreto (incluyendo ejemplos adecuados en el prompt).

Nota: Pangram lanzó a finales de julio una nueva versión, Pangram 4, que afirman tiene mejores tasas de acierto que Pangram 3 (al cual pertenecen los datos que he compartido).

Por último, dos factores que afectan a la efectividad son el idioma y la extensión del texto. En el technical report de Pangram 4 vemos que su tasa de falsos negativos aumenta ligeramente en español, francés y alemán (respecto al inglés), y de manera considerable en idiomas no occidentales, como urdu y persa.

La extensión también importa. Los detectores tienden a ser menos efectivos con textos de 50 o 100 palabras, que con textos de 500. Por debajo de 100 palabras, mantente escéptico ante el veredicto de un detector (y por debajo de 50, ni siquiera tiene sentido usar un detector).

Conclusión

Los datos son claros: aunque tienen una tasa de efectividad bastante aceptable, no existe el detector 100% infalible a día de hoy, ya que sigue siendo posible “disfrazar” de humano el output de una IA para engañar a las herramientas de detección.

Aunque los detectores afinen su clasificador, seguirá habiendo un pequeño porcentaje de falsos negativos, porque los métodos de simulación humana también se harán más sofisticados.

Suscríbete a 10 Links Azules, nuestra newsletter de SEO

    1 comentario en «¿Son fiables los detectores de texto generado por IA? Así funcionan Pangram, GPTZero, etc.»

    1. Después de leer el artículo y también el que enlazas sobre los detectores de texto generado por IA, me parece que aquí hay una cuestión bastante más interesante que simplemente saber si un texto lo ha escrito una persona o una IA.
      Por ejemplo, si yo escribo personalmente un comentario, pero antes de publicarlo le pido a ChatGPT que me ayude a ordenar las ideas, corregir la redacción o incluso reformular alguna frase, ¿qué sería exactamente? ¿Texto humano, texto generado por IA o una mezcla de ambos?
      Y al revés: si un texto lo genera una IA pero después una persona lo revisa, modifica, añade sus propias ideas y lo deja con su estilo personal, ¿en qué momento deja de ser “texto de IA”?
      Me interesa especialmente esta cuestión porque creo que los detectores pueden estar intentando responder a una pregunta que quizá no está bien planteada: no tanto “¿esto lo ha escrito una IA?”, sino “¿cuánto de este texto procede de una IA y cuánto de una persona?”.
      Por cierto, como en mi comentario anterior me dijiste que Pangram 4 lo clasificó como 100% humano, voy a hacer una pequeña prueba con este comentario. 😄
      Lo publico tal cual salga de aquí, sin editarlo, y vemos qué dice Pangram esta vez.

      ¿Te animas a pasar también este comentario por Pangram y decirme qué resultado te da?

      Responder

    Deja un comentario