Investigación
Los lectores prefieren el marketing de IA en pruebas ciegas
En un estudio con 1.203 participantes en MIT Sloan y Berkeley Haas, el marketing generado por IA superó al de expertos humanos en satisfacción y disposición a pagar, cuando quien leía no sabía cuál era cuál. El efecto es favoritismo humano, no aversión a la IA — y por eso no llamamos al slop 'baja calidad'.
El estudio
Yunhao Zhang (MIT Sloan, Berkeley Haas) y Renee Gosline (MIT Sloan), en asociación con Accenture, realizaron un experimento preinscrito 3 × 4 entre sujetos con 1.203 participantes reclutados a través de CloudResearch Connect. El paper completo está en SSRN como #4453958.
- Cuatro paradigmas de generación de contenido:
- Solo experto humano
- Solo IA (ChatGPT-4)
- Humano aumentado (humano escribe la versión final, borrador IA como referencia)
- IA aumentada (IA escribe la versión final, borrador humano como referencia)
- Tres condiciones de información: base (quien evalúa no sabe quién/qué lo escribió), parcialmente informada (quien evalúa sabe que uno de los cuatro paradigmas lo produjo pero no cuál), totalmente informada (a quien evalúa se le dice el paradigma exacto antes de cada pieza).
- Contenido: textos publicitarios de 100 palabras para cinco productos minoristas y contenido persuasivo de 100 palabras para cinco campañas (objetivos no controvertidos: parar el racismo, comer menos comida basura, etc.).
- Redactores humanos: diez creadores de contenido profesionales de una consultora con 175.000 millones de USD de capitalización, que realizaron la tarea en horario laboral remunerado.
Lo que encontraron
En ciego: gana la IA
En la condición base (ciega), el contenido solo-IA puntuó por encima del de expertos humanos en satisfacción (5,29 vs 4,93, p < 0,001) y en log disposición a pagar (4,83 vs 4,61, p = 0,01). El paradigma IA-Aumentada (IA escribe el final, con un borrador humano de referencia) quedó al nivel de solo-IA. Humano-Aumentado (humano escribe el final, borrador IA como referencia) fue indistinguible de solo-Humano.
Reformulado: con el mismo contenido, sin información sobre autoría, los lectores ciegos pagaron más por la versión escrita por IA. El efecto replica en medidas de satisfacción, disposición a pagar, interés y persuasión, y se mantiene cuando los anuncios de producto y los mensajes de campaña se analizan por separado. Es lo opuesto de lo que la mayor parte de la literatura sobre aversión a algoritmos predecía para tareas subjetivas.
Dile que es un experto humano: gana el humano
Cuando a quien leía se le decía que una pieza la había escrito un experto humano, su satisfacción reportada con esa pieza subía (+0,09, p = 0,003) y su disposición a pagar subía (+0,18, p < 0,0001). Cuando se le decía que una pieza involucraba IA, la calidad percibida no bajaba. El desplazamiento es asimétrico.
Sin "prime de calidad"
La explicación alternativa obvia, que saber que quien escribe es un profesional de primer nivel los predispone a esperar más calidad, se puso a prueba y se descartó. En la condición "parcialmente informada", donde quien lee sabe que los cuatro paradigmas existen pero no cuál produjo la pieza que tiene delante, la calidad percibida no sube. El efecto solo se dispara cuando a quien lee se le dice específicamente que un experto humano escribió esta pieza. Esa es la huella de un sesgo a favor de los humanos por categoría, no de un efecto de priming informativo.
Qué significa esto para el "slop"
Este hallazgo da forma a cómo hablamos del Slop Score.
Si los lectores ciegos prefieren el marketing en estilo IA, entonces el registro slop no es baja calidad, y no vamos a fingir que lo sea. Para contenido persuasivo corto donde quien lee paga por claridad sobre un producto, el registro IA está haciendo el trabajo. Llamarlo slop y recomendar reescribirlo sería un consejo equivocado.
El registro slop se convierte en problema cuando el género es uno donde la voz es el valor: ensayos personales, opinión, periodismo, libros con ghostwriter, trabajos escolares, cualquier sitio donde quien lee quiere sentir que una persona concreta le está hablando. Para esos géneros, el estudio de Zhang/Gosline no aplica (no probaron escritura ensayística de formato largo) y el registro slop es exactamente el fallo que el score quiere sacar a la luz.
Lo que nos deja la línea honesta: tu score importa para contenido donde la voz importa. Para todo lo demás, es una curiosidad. Lo decimos también en la página "a qué suena el slop".
Lo otro que esto implica
Si decirle a quien lee que algo está escrito por un humano sube la calidad percibida, ese es un efecto transferible. Un texto que se lee como si lo hubiera escrito una persona concreta dispara el mismo favoritismo aunque a quien lee no se le haya dicho nada sobre autoría. Las señales de "suena humano" hacen el trabajo. El Slop Score mide el mismo mecanismo desde la dirección opuesta: en qué medida tu escritura no logra activar esas señales.
Nos gustaría más investigación sobre esto. Zhang & Gosline probaron contenido persuasivo corto y dejaron la escritura de voz de formato largo fuera; sospechamos que el efecto de favoritismo es mucho mayor ahí. Si lo estudias y quieres un conjunto de datos público y medible de calificaciones humanas frente a las puntuaciones de slop por pieza, escríbenos.
Referencia bibliográfica
Zhang, Y. & Gosline, R. (2023). Human Favoritism, Not AI Aversion: People's Perceptions (and Bias) Toward Generative AI, Human Experts, and Human-GAI Collaboration in Persuasive Content Generation. Working paper, MIT Sloan / Berkeley Haas, en asociación con Accenture Applied Intelligence y la MIT Initiative on the Digital Economy. SSRN 4453958.