Un estudio realizado desde Cornell Tech ha demostrado cómo pueden usar Reddit, el famoso foro de Internet, para manipular los resultados de búsquedas con IA. Según explican, un simple comentario, que se puede escribir en segundos, puede influir en las respuestas generadas por las herramientas que utiliza la Inteligencia Artificial. Incluso mencionan que un breve texto de 13 palabras ha sido suficiente.
Por qué influyen los comentarios de Reddit
Cuando haces una búsqueda en Google, muchos resultados son un resumen generado por IA con información recogida en foros como Reddit. Esos comentarios van a influir en las búsquedas de los usuarios y este estudio de Cornell Tech ha demostrado que es realmente sencillo.
Esto demuestra el temor de muchos sobre lo que está pasando en Internet, y es que la IA ofrece información que puede llegar a ser peligrosa. Un ejemplo es el caso de la recomendación de Google, a través de AI Overviews, de echar pegamento a la salsa de pizza. Esto venía de un comentario de Reddit antiguo que, en realidad, se trataba de una broma.
Los agentes de IA, como los de la búsqueda de Google, se guían mucho de las plataformas de este tipo, donde los usuarios generan información. En los sistemas de código abierto examinados en el estudio, entre el 16,7 % y el 23,4 % de las URL recuperadas provenían de fuentes generadas por los usuarios, siendo Reddit la que presentaba la mayor proporción.
Esto es algo que hemos podido comprobar en RedesZone, ya que, al realizar diferentes búsquedas en Google, en muchos casos aparece Reddit en las primeras posiciones. Este estudio muestra que, además, Google Overviews también lo tiene muy en cuenta. Ya vimos que la IA engaña al pedir algo aleatorio.
Cómo funciona este ataque
Este ataque ha sido denominado como Envenenamiento de Recuperación de Agentes Web (WARP, por sus siglas en inglés). Los investigadores indican que consta de tres etapas:
- Primera: los atacantes identifican hilos de Reddit que aparecen repetidamente en búsquedas relacionadas con una temática. Esas páginas van a ser sus objetivos.
- Segunda: a partir de ahí, generan un breve texto para integrarse en ese hilo y pueden promocionar un servicio o cualquier cosa.
- Tercera: publican el contenido como comentario, respuesta o edición. Cuando un motor de búsqueda lo indexa, queda disponible para la IA.
El ataque, por tanto, no requiere de tener acceso al sistema de Inteligencia Artificial, sino simplemente capacidad de contribuir con contenido a una plataforma pública como es Reddit.
Algo similar puede ocurrir con otras plataformas como Wikipedia, donde también los usuarios pueden participar y es algo muy tenido en cuenta por los buscadores.
En el informe indican que, en las pruebas de fragmentos de búsqueda, aproximadamente 13 palabras de texto manipulado fueron suficientes para que un producto ficticio se mencionara entre el 38 % y el 51 % de las respuestas después de que el agente de IA recuperara el contenido manipulado. Si ese mismo mensaje se difunde en múltiples fuentes, las tasas de mención aumentan hasta un 62 %.
