Investigación
Los estudios detrás del Slop Score
A continuación encontrarás resúmenes en lenguaje claro de la literatura académica y de los estudios del sector que dieron forma a cómo esta herramienta mide el slop estilístico. Cada afirmación enlaza a su fuente; cuando los estudios discrepan, enlazamos ambos.
Todas estas páginas enlazan fuentes primarias y marcan dónde una fuente tiene interés propio (un proveedor de detectores que publique "los humanos no pueden detectar IA" te está vendiendo algo). Cuando dos fuentes se contradicen, enlazamos ambas.
A qué suena el slop
Nuestra definición editorial. El slop es un registro estilístico —prosa sin voz propia, plagada de matizaciones, intercambiable—, no un veredicto sobre autoría de IA. A qué suena en 20, en 60, en 90.
¿Detectan los humanos los textos de IA?
Seis estudios, dos conclusiones opuestas. Lectores no entrenados aciertan al azar (~50 %) con los modelos de frontera modernos; los especialistas con formación previa llegan al 60–70 % en géneros que conocen. Repasamos cada estudio, incluido uno cuyo hallazgo va en dirección contraria a cómo se cita habitualmente.
Los límites de la detección de IA
Sesgo contra hablantes no nativos de inglés (Liang 2023 en Stanford: 61 % de falsos positivos en redacciones del TOEFL). Evasión por paráfrasis (Krishna 2023 en NeurIPS). Texto canónico memorizado. Un límite teórico de Sadasivan et al. Por qué construimos un diagnóstico, no un veredicto.
Los lectores prefieren el marketing de IA en pruebas a ciegas
Zhang & Gosline 2023 (MIT Sloan / Berkeley Haas, 1.203 participantes): en pruebas a ciegas, los anuncios escritos por IA superaron a los anuncios de expertos humanos en satisfacción y disposición a pagar. Los lectores no evitan la prosa de IA; prefieren a los humanos sólo cuando se les dice cuál es cuál. Por qué slop ≠ baja calidad.
¿Qué parte de la web es ya IA?
Los estudios del sector convergen cerca del 50 % de los nuevos artículos escritos principalmente por IA y el 74 % de páginas nuevas con algún tipo de intervención de IA, con sólo un pequeño porcentaje totalmente IA. Las cifras no coinciden porque cada medición proviene de un detector; la dirección sí coincide.
Benchmarks abiertos
Cómo rinde el Slop Score frente a los anclajes de calibración fijados en CI, los anclajes experimentales del marco Zhang & Gosline (4 paradigmas) y los deltas de resistencia a paráfrasis (−17 superficial vs −33 sustantivo). Además de lo que aún no podemos medir.
Por qué publicamos esto
La industria de detectores de IA promociona cifras de precisión por encima del 95 % que se desmoronan en conjuntos de prueba independientes (Liang 2023; Sadasivan et al.). La respuesta honesta a "¿qué tan bueno es este score?" es que la calibración se sostiene sobre el registro estilístico y se rompe ante paráfrasis adversaria — y te mostramos exactamente dónde. Para eso están estas páginas.
Si encuentras un error o un estudio que deberíamos añadir, nos llega a través del correo de la lista de espera. Actualizamos las citas cuando cambia la literatura.