deslopify.me

Investigación

Investigación

Los límites de la detección de IA

La literatura publicada coincide: la detección forense de IA presenta sesgos contra hablantes no nativos de inglés, se desmorona ante paráfrasis ligeras, confunde textos canónicos memorizados con IA, y choca con un límite teórico que la ingeniería no puede arreglar. Estas herramientas tienen usos acotados. No son la respuesta adecuada para decisiones de alto riesgo sobre una persona concreta, y por eso construimos algo distinto.

Cuatro límites documentados

1 · Sesgo contra hablantes no nativos de inglés

Stanford HAI, Liang et al. 2023 (Patterns) probaron 7 detectores líderes de IA sobre 91 redacciones del TOEFL escritas enteramente por hablantes no nativos de inglés. Los detectores marcaron el 61,3 % de estas redacciones humanas como IA de media. El 97,8 % fue marcado por al menos un detector; el 19,8 % por los siete. El mecanismo es estructural: los detectores aprenden que la diversidad léxica limitada y la sintaxis simple parecen IA, pero esos son también los rasgos superficiales del inglés como L2. Los autores observaron que mejorar la elección léxica en las redacciones del TOEFL reducía la mala clasificación, y que simplificar las redacciones de hablantes nativos aumentaba su mala clasificación, confirmando el mecanismo.

2 · Evasión por paráfrasis

Krishna et al. NeurIPS 2023 (arXiv:2303.13408): el parafraseador DIPPER bajó la tasa de verdaderos positivos de DetectGPT del 70,3 % al 4,6 % con una tasa de falsos positivos del 1 %. Sadasivan et al. 2023 mostraron que la misma dinámica generaliza: la paráfrasis ligera vence a detectores neuronales, clasificadores zero-shot y esquemas de marca de agua. Los propios datos de Copyleaks muestran que su precisión cae del 100 % al 50 % en texto reescrito a través de QuillBot.

Cómo nos comparamos en la misma prueba

Hicimos el mismo ejercicio sobre nuestro propio conjunto de calibración. Los tres anclajes de slop alto (marketing IA, listicle de LinkedIn, memo de jerga corporativa), pasados por Claude con un prompt que preserva explícitamente registro y tono (es decir, paráfrasis superficial, sin cambio de registro), desplazan nuestro score compuesto una media de −17 puntos (uno de tres se quedó dentro de su banda de calibración). Los mismos anclajes pasados por un prompt que mejora genuinamente la voz (varía la longitud de las frases, evita los tricolones, añade un ejemplo concreto) desplazan el score una media de −33 puntos (cero de tres se quedaron en banda). El delta de solo-reescritura es aproximadamente la mitad del delta de reescritura sustantiva, que es lo que esperaríamos: el score sigue el registro estilístico en lugar de los tokens superficiales, así que el slop reescrito sigue leyéndose como slop.

Eso no es lo mismo que "nuestro score sobrevive a la paráfrasis". Cae. Sólo cae menos que los fracasos publicados de la detección basada en clasificadores bajo el mismo patrón de prueba. El benchmark está abierto en el repo; reejecuta cuando cambien los motores.

3 · Textos canónicos memorizados

Un patrón de fallo documentado en múltiples clasificadores líderes en 2023–2025: textos fundacionales de dominio público — la Constitución de EE. UU., la Biblia, la Declaración de Independencia — se marcan como generados por IA. El mecanismo es estructural: los grandes modelos de lenguaje están tan intensamente entrenados con estos documentos que el modelo ha aprendido a producir texto estadísticamente similar, y cualquier detector que use perplejidad o firmas estadísticas similares heredará el parecido. Mejores datos de entrenamiento no lo arreglarán; el parecido es inherente al enfoque.

4 · Un límite teórico

Sadasivan et al. 2023 (arXiv:2303.11156, University of Maryland, más de 186 citas): un argumento desde la teoría de la información de que, a medida que los modelos de lenguaje convergen sobre la distribución de la escritura humana, el límite superior de precisión de cualquier detector tiende al nivel del azar. Mejores datos de entrenamiento no cerrarán esta brecha. Es un límite del problema en sí. Cuanto más se acerquen los LLM a escribir como humanos, menos puede hacer cualquier clasificador.

Lo que ha pasado en la prensa y los tribunales

Estos modos de fallo tienen consecuencias fuera del papel. Las suspensiones académicas impulsadas por detección han producido procedimientos legales entre 2024 y 2025 (consultables públicamente; con cobertura en Poets & Quants, periódicos universitarios y comentarios legales), centrados a menudo en la tasa de falsos positivos sobre hablantes no nativos de inglés que cuantifican Liang et al. Por lo general, los tribunales se han negado a paralizar los procesos académicos en curso, pero los expedientes y el debate de políticas alrededor son públicos.

Las cifras de precisión comercializadas en la categoría están comúnmente en el rango del 99 %. La brecha con la precisión medida de manera independiente sobre conjuntos de prueba amplios es significativa; la brecha en los modos de fallo específicos de arriba (no nativos de inglés, entrada parafraseada, texto canónico de dominio público) es aún mayor. Precisión de marketing y precisión medida no son el mismo número.

Por qué construimos algo diferente

La detección forense de IA vende un veredicto binario a gatekeepers (docentes, reclutadores, editores). El veredicto tiene consecuencias, las metodologías son opacas, y los modos de fallo están en la literatura publicada. La brecha entre las afirmaciones de marketing y las mediciones reproducibles se está ampliando.

No jugamos en esa liga. deslopify puntúa registro estilístico en una escala continua de 0 a 100 y muestra los fragmentos de texto que determinan la puntuación, capa por capa. Eso cambia lo que la herramienta puede y no puede hacer:

  • Sin riesgo de acusación falsa. No hay veredicto de "usaste IA" del que acusar falsamente a nadie.
  • El problema de sesgo de Liang es descomponible. Quien escribe en inglés como L2 puede ver que su capa léxica se disparó mientras la estructural y la epistémica se mantuvieron limpias, y leer eso como señal de registro, no como acusación de IA. Ninguno de los clasificadores binarios expone eso.
  • El problema del texto memorizado no aplica. El Slop Score no es una afirmación sobre autoría. El slop en un documento fundacional seguiría siendo slop; el score real (bajo) refleja voz y especificidad, no firmas estadísticas.

La lectura honesta

Los detectores de IA tienen usos acotados: moderación masiva de contenido, triaje de primera pasada. Los construidos con más cuidado lo reconocerán si se les empuja. No tienen el rigor exigible en un tribunal ni en una evaluación académica. Los modos de fallo publicados arriba son la razón. Cualquiera que use un detector para tomar una decisión de alto riesgo sobre una persona concreta debería leer el paper de Liang primero.

Si llegaste aquí buscando una recomendación de detector: no uses uno para castigar a individuos. Úsalo como señal suave, emparejada con la lectura atenta que harías de todos modos. Para quien escribe, un diagnóstico es una herramienta más útil que un veredicto: te dice a qué suena tu prosa, en lugar de adivinar de qué lado está. La página de limitaciones cubre dónde esta herramienta se equivoca.