Documentos judiciales recientemente desclasificados en el caso de The New York Times contra OpenAI y Microsoft revelan que las empresas sabían que sus modelos de IA dañarían la web. Los documentos muestran que el Director de Ciencia Aplicada de Microsoft, Brent Hecht, describió la extracción de datos para entrenar sus modelos como el 'mayor robo de trabajo en la historia de la humanidad' y dijo que hacía una 'burla completa de la idea de uso justo.'

Microsoft ha intentado distanciarse de las afirmaciones de Hecht, con el portavoz Alex Haurek diciendo que 'Estos comentarios reflejan la perspectiva individual de un empleado, no son un análisis legal y no representan las vistas de la empresa.' Sin embargo, está claro que la situación ha llegado a pasar, con Google Zero y la IA comiéndose la web.

La presentación judicial incluye citas de una variedad de figuras, incluyendo a Satya Nadella, Sam Altman y otros empleados de OpenAI. Nadella admitió que los chatbots han reemplazado la búsqueda y eliminado la necesidad de ir directamente a la fuente para obtener información. Un documento interno de Microsoft describió la situación como un 'ciclo de destrucción' que perjudicaría tanto a sus modelos como a la web.

El cofundador de OpenAI, Greg Brockman, estaba más interesado en los posibles beneficios, diciendo que la empresa podría ganar 'gazillions' de dólares a través de la IA comercial. A pesar de las afirmaciones de intención altruista, parece que OpenAI era consciente de la tendencia de ChatGPT a reproducir material con copyright 'al pie de la letra.' La empresa reconoció que prevenir la memorización era importante para minimizar las violaciones de copyright, pero los empleados admitieron que GPT-4 'memorizó una tonelada de datos y por lo tanto será increíblemente bueno en la regurgitación.'

La presentación incluye ejemplos de ChatGPT que produce largas cadenas de copias directas de artículos en The New York Times, Mercury News, The Denver Post, LifeHacker y Eurogamer en respuesta a consultas. Microsoft sabía cómo se percibiría su extracción en gran escala de Internet y admitió que 'casi nadie tenía la intención de que su contenido se utilizara de esta manera, ni están compensados por su uso.' Nick Turley de OpenAI dijo que una vez que obtienes una respuesta de su chatbot, no hay 'buena razón para hacer clic' en un enlace a la fuente.

Microsoft se cita admitiendo que 'los LLM son un producto que destruye su propia cadena de suministro' porque es un sustituto de sus propios datos de entrenamiento en muchos casos. Los propios expertos en medios y economía de OpenAI atribuyeron la caída del tráfico de referencia para sitios como The New York Times directamente a resúmenes de IA como los resúmenes de IA de Google. Especularon que las referencias de búsqueda pueden estar bajando hasta un 60 por ciento.

Parece claro que tanto Microsoft como OpenAI sabían que iban a dañar irreparablemente a la industria editorial y dañar su propio producto, pero continuaron adelante en busca de beneficios. La situación tiene implicaciones significativas para el futuro de la web y la industria editorial, con el auge de la búsqueda de zero clic y el potencial para la optimización del motor de respuestas para perturbar aún más los modelos de búsqueda tradicionales.

Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.