deslopify.me

Investigación

Investigación

Benchmarks abiertos

Tres mediciones reproducibles que delimitan qué hace el Slop Score y dónde deja de funcionar. Cada script está en el repo; cada cifra de esta página salió de una ejecución en vivo del motor. Cuando cambiamos los motores, reejecutamos las cifras.

La industria de detectores anuncia cifras únicas de precisión (99 %, 99,9 %, "1 falso positivo entre 10.000") que casi nunca se reproducen en conjuntos de prueba independientes. Nosotros publicamos tres benchmarks ortogonales en su lugar. Miden cosas distintas y fallan de maneras distintas, y ese es el punto: juntos muestran dónde el Slop Score aguanta y dónde se rompe.

1 · Anclajes de calibración (fijados en CI)

El control estricto. Seis textos de referencia fijados en nuestra suite de tests. Cualquier cambio en el motor que empuje uno fuera de banda hace que el build falle y no se pueda mergear. Los textos publicados y sus bandas están en la página de calibración.

Anclaje

Banda

Texto de marketing IA por defecto

80100

Publicación de 'thought leader' en LinkedIn (IA)

6595

Memo de jerga corporativa (humano, cercano al slop)

4270

Ensayo argumentativo llano (humano)

030

Ensayo personal literario (humano)

022

Párrafo de libro infantil (humano)

022

2 · Anclajes experimentales del marco Zhang & Gosline (4 paradigmas)

Un conjunto aparte, más laxo, inspirado en Zhang & Gosline 2023 (el paper de MIT/Berkeley), que probó cuatro paradigmas de generación de contenido en evaluaciones ciegas con 1.203 participantes sobre texto persuasivo. Usamos esos paradigmas como prueba de estrés para la zona intermedia confusa de nuestro score, donde se mezclan contribuciones de IA y humano. Validado el 2026-05-28: la afirmación falsable de que nuestro score produce un orden monótono sobre los cuatro paradigmas Z&G se sostiene. Las bandas abajo son valores observados ±10. No están en el control estricto; se revalidan cuando cambian los motores.

Paradigma

Banda (observada ±10)

Solo humano

022

Humano aumentado (humano escribe, IA como referencia)

2949

Spec de producto / híbrido

1636

IA aumentada (IA escribe, humano como referencia)

5676

Solo IA

7999

Léelo como una verificación de coherencia sobre la afirmación arquitectónica. Si los cuatro paradigmas dejan de ordenarse monótonamente (human_only < augmented_human < augmented_ai < ai_only), el cambio en el motor rompió algo y el build no debería salir.

3 · Resistencia a paráfrasis

Un modo de fallo bien documentado en la detección de IA basada en clasificadores es la paráfrasis: Krishna et al. 2023 bajaron la tasa de verdaderos positivos de DetectGPT del 70,3 % al 4,6 % con una vuelta de DIPPER; los datos públicos de GPTZero muestran que su precisión cae a la mitad sobre texto reescrito por un parafraseador. El contexto teórico está en los límites de la detección de IA. Hacemos el mismo tipo de ejercicio sobre nuestros propios anclajes de slop alto con dos prompts:

  • Paráfrasis superficial. Reformular pero preservar registro, tono y ausencia de voz. Esto es el análogo de QuillBot / DIPPER: una reescritura solo estilística que NO debería engañar a un detector basado en registro.
  • Reescritura sustantiva. Mejorar activamente la voz (variar ritmo, eliminar tricolones, añadir ejemplos con nombres concretos). Esto es lo que hace nuestro propio rewriter y debería bajar el score 25+ puntos.

Anclaje

Orig

Superf.

Sustant.

ai_marketing

95

74(-21)

58(-37)

linkedin_slop

88

66(-22)

61(-27)

corporate_memo

64

56(-8)

29(-35)

Sobre tres anclajes de slop alto, la paráfrasis superficial desplaza el score una media de −17 puntos (1 de 3 se mantuvo en su banda original), mientras que la reescritura sustantiva lo desplaza −33 puntos (0 de 3 se mantuvieron en banda). El delta superficial es aproximadamente la mitad del sustantivo. El score no es a prueba de paráfrasis. Es aproximadamente dos veces más resistente que un score al que una reescritura estilística engaña, que es el listón que la mayoría de detectores no superan.

Lo que aún no medimos

Las brechas conocidas. Si ves otra, el correo de la lista de espera nos llega.

  • Robustez real entre modelos. Nuestros anclajes de calibración usan salida de modelos Claude; no tenemos un benchmark que pase salidas de GPT-4o / Gemini / Llama por el mismo motor y confirme que todas caen en la banda IA. El razonamiento arquitectónico dice que el score se basa en el registro y debería generalizar (los motores deterministas se basan en patrones, no en la perplejidad, así que un sesgo de un solo modelo sería sorprendente). Aún os debemos la medición.
  • Idiomas más allá del inglés, alemán y español. Esos tres tienen diccionarios léxicos completos, bancos de regex estructurales y prompts de juez Sonnet; el score es significativo y los resaltados apuntan a los tramos correctos. Otros idiomas pasan por los motores pero los números son ruido. Añadir un idioma requiere la misma pipeline de redacción. Ver limitaciones conocidas.
  • Cadena iterada de paráfrasis. Una ronda de paráfrasis es la prueba de arriba. No sabemos cómo se comporta el score tras 3–5 rondas de reescritura sucesiva, que se acerca más a cómo un usuario decidido intentaría realmente eludir la detección.
  • Suelo de texto corto. Por debajo de ~150 palabras los motores deterministas no tienen suficiente muestra para que sus normalizaciones por 500 palabras sean estables. Tenemos evidencia anecdótica de que el score es poco fiable por debajo del suelo; no tenemos un umbral publicado.
  • Tasa de falsos positivos en inglés L2. El hallazgo de Stanford 2023 sobre hablantes no nativos de inglés (61 % de falsos positivos en detectores competidores) es la razón por la que publicamos sub-scores por motor y añadimos el banner de interpretación de registro L2. No hemos pasado un corpus L2 por nuestro motor para medir nuestra propia FPR. Deberíamos.

Cómo reproducir

Los benchmarks son abiertos y re-ejecutables en el repo de GitHub. Los comandos están en el README; si una cifra de esta página no se reproduce, es un bug, decídnoslo.