General
Así usaron millones de artículos de prensa OpenAI y Microsoft para entrenar a sus IA y acabar con la web: "Quizá es el mayor robo de la historia"
"Es un robo asombroso, de proporciones sin precedentes", quizás "el mayor robo de trabajo de la historia de la humanidad". Con estas palabras se refería el director de Ciencias Aplicadas de Microsoft a las prácticas usadas por OpenAI para alimentar los modelos de ChatGPT, según se recoge en uno de los escritos presentados por la defensa de The New York Times en el juicio que mantiene junto a 11 publicaciones contra las dos tecnológicas por el uso de su contenido sin consentimiento para entrenar IA y cuyos primeros documentos han sido publicados por un juzgado de Nueva York. Durante casi 90 páginas, los abogados del medio de comunicación recogen documentos internos, citas y entrevistas con directivos de la empresa en los que reconocen abiertamente que están extrayendo el contenido protegido de los medios de forma ilegal y el daño que prevén que su modelo de negocio cause a la industria mediática. La única mención divergente en este sentido la hizo el CEO de Microsoft, Satya Nadella, al que se cita en una declaración bajo juramento en la que dijo que el contenido bajo licencia debería pagarse si se usa. "Si hubiera sabido que OpenAI había scrapeado y entrenado en información tras muros de pago, hubiéramos invocado nuestro derecho a pedirle que reentrenaran los modelos", asegura el directivo. Sin embargo, las comunicaciones de los equipos de ambas firmas son muy diferentes. El grado de canibalización de la web por parte de las tecnológicas llegó a preocupar a los investigadores de Microsoft. En un documento aseguraban que se estaba creando un "bucle idiotizador" que iba a dañar tanto al mundo de la IA como a toda la web, en referencia a que cada vez habría menos contenido original y más creado por los chatbots, por lo que los modelos de IA tendrían menos con los que entrenarse. En OpenAI los remilgos a la hora de hacerse con toda la información posible eran nulos. El escrito de los abogados de The New York Times hace referencia a una cadena de mensajes en la que un investigador se dirige a Greg Brockman, presidente de la compañía y le ofrece "una herramienta para saltarse el muro de pago de The New York Times". "Oh, genial", contesta Brockman. Otros responsables del desarrollo de los modelos que alimentan ChatGPT concuerdan en que no existía ninguna política para evitar descargar de Internet contenido protegido, ni para eliminarlo posteriormente de los conjuntos de datos de entrenamiento. De hecho, la plataforma llegó a tener varias aplicaciones desarrolladas por terceros destinadas explícitamente a romper muros de pago y disponibles para cualquier usuario. Estos datos tampoco fueron detectados en Microsoft, que por ejemplo, tuvo acceso a todo lo que se utilizó para entrenar a GPT-3 antes de subir los modelos a su nube. Además, la empresa de Seattle desarrolló sus propios proyectos como Mango, que tenían como fin ayudar a OpenAI a conseguir más datos y que tampoco pidió nunca permiso a los editores de noticias para obtener información directamente de sus páginas web. OpenAI no empezó a establecer controles sobre las páginas que se descargaban hasta septiembre de 2023, casi un año después de lanzar ChatGPT. Estos mecanismos se reforzaron luego en enero de 2025, además de avalar la creación del protocolo conjunto para impedir las descargas en masa para creadores de contenido, que consistía en incluir en sus códigos el rastro robot.txt, un archivo de texto que indicaba a los bots que descargaban contenido que esta página lo había prohibido. Sin embargo, los abogados de The New York Times aseguran que el texto mostrado por ChatGPT relacionado con su medio muestra cómo los investigadores de OpenAI crearon una vía para ignorar estos avisos y trabajar con esos datos igualmente. Efecto dañino Los análisis realizados durante la investigación muestran que ChatGPT fue entrenado con millones de artículos de The New York Times y otros medios como el Chicago Tribune, que también habían rechazado ceder sus contenidos gratis. Para ello, la tecnológica llegó a comprar a una fundación todos los ejemplares del periódico neoyorquino entre 1987 y 2007 bajo el pretexto de utilizarlos para fines de investigación. En un documento, uno de los líderes de producto de ChatGPT reconocía que los medios de comunicación se enfrentaban a una "amenaza existencial" ante un producto que les permitía sustituirlo "ampliamente" y que lo reemplazaría "más y más" a medida que mejorara. "No importa cómo de grandes mostremos los enlaces, la gente no va a pinchar", apuntaba un ingeniero involucrado en el desarrollo de ChatGPT. Los datos recopilados por las partes respaldan esta teoría. Según la información de Microsoft, un usuario que accediera a información del Times a través de Copilot tenía entre un 87% y un 91% menos de posibilidades de pinchar en un enlace que uno que usara una búsqueda tradicional, una situación que habría empeorado para las páginas web con el lanzamiento de las vistas previas con IA.
Source
El Mundo
· José M. Rodríguez Silva