Los editores están demandando. Cloudflare se ha convertido en el vigilante de la internet. Y las empresas de IA están descubriendo que pueden haber envenenado su propio pozo.

Getty Images
Una versión de este artículo apareció originalmente en el boletín de IA y Tecnología de Quartz. Regístrese aquí para recibir las últimas noticias, análisis y conocimientos sobre IA y tecnología directamente en su bandeja de entrada..
Cuando OpenAI recopiló datos de Internet para entrenar la primera versión de ChatGPT, la web era un buffet digital listo para ser tomado. Años de publicaciones en blogs, enormes repositorios de libros, interminables discusiones en Reddit $RDDT, todo estaba allí, sin protección y gratis. La cantidad de datos necesarios era asombrosa, pero solo estaba esperando ser cosechada.
Únete a más de 500.000 lectores que comienzan su día con Quartz.
Al suscribirte, aceptas nuestros Términos de servicio y Política de privacidad.
Esa era ha terminado.
Los editores están demandando por el uso pasado y exigiendo pago por contenido futuro. Cloudflare se ha convertido en el portero de Internet, bloqueando los rastreadores de IA por defecto a menos que paguen. Los datos de alta calidad necesarios para entrenar la próxima generación de modelos de IA ya no están simplemente disponibles, y las compañías de IA están descubriendo que pueden haber envenenado su propio pozo.
Los números cuentan la historia de un cambio dramático. Según el análisis de Cloudflare, Claude de Anthropic realizó casi 71,000 solicitudes de página por cada referencia única que envió de regreso a los editores. La proporción de OpenAI fue de 1,600 solicitudes por referencia, mientras que Perplexity registró más de 200 a 1. Compare eso con motores de búsqueda tradicionales como Google $GOOGL, que mantuvieron una proporción de aproximadamente 9 a 1, una relación que, a pesar de todas las quejas que los editores han tenido con ello a lo largo de los años, ahora parece una asociación justa.
Desde que Google lanzó AI Overviews en mayo de 2024, la proporción de búsquedas de noticias que resultan en cero clics a sitios web de editores ha saltado del 56% a casi el 69%. El tráfico orgánico a sitios de noticias se desplomó de más de 2.3 mil millones de visitas en su punto máximo a menos de 1.7 mil millones para mayo de 2025.
El colapso del tráfico está devastando a los editores que construyeron sus modelos de negocio en torno a los ingresos por publicidad y la participación de los lectores. Las compañías de medios digitales han respondido con despidos masivos, y algunos analistas sugieren que los cierres son inminentes.
Esto crea un ciclo de retroalimentación destructivo: a medida que los editores producen menos contenido o lo encierran, las empresas de IA pierden acceso a la información fresca y de alta calidad que necesitan para mantener sus modelos actuales y precisos. La web corre el riesgo de volverse cada vez más obsoleta y sintética, poblada más por contenido generado por IA que por la experiencia y el periodismo humanos.
Los editores están contraatacando en los tribunales con una ola de demandas que podrían obligar a grandes pagos. Anthropic recientemente acordó pagar al menos 1.5 mil millones de dólares para resolver una demanda colectiva de autores, lo que equivale a aproximadamente $3,000 por libro.
Reddit, que firmó acuerdos de licencia por valor de 203 millones de dólares a principios de 2024, ya está buscando acuerdos más lucrativos. La empresa está en conversaciones con Google y OpenAI para acuerdos que incluirían precios dinámicos, permitiendo a Reddit cobrar más a medida que sus datos se vuelven cada vez más vitales para las respuestas de IA.
Incluso las empresas que históricamente han defendido la información gratuita se están uniendo a la economía del peaje. WalletHub recientemente extrajo 40,000 páginas de contenido financiero del acceso público, haciéndolo disponible solo para usuarios registrados. El CEO Odysseas Papadimitriou comparó la situación con tratar con la mafia: "O cierran la carretera en la que está tu restaurante y ningún cliente puede llegar, o mantienen la carretera despejada pero abren un restaurante al lado del tuyo y te obligan a servir a sus clientes gratis."
Cloudflare, que maneja aproximadamente el 20% de todo el tráfico de internet, respondió a la enorme cantidad de tráfico de bots que raspan la web para el entrenamiento de IA cambiando el ajuste predeterminado de internet. En lugar de permitir acceso libre a los rastreadores de IA a menos que sean bloqueados específicamente, la empresa ahora los bloquea por defecto a menos que paguen por licencias de contenido.
"El acuerdo que Google hizo para tomar contenido a cambio de enviarte tráfico simplemente ya no tiene sentido," el CEO de Cloudflare, Matthew Prince escribió en una publicación de blog.
La industria está tratando de crear orden a partir del caos. Un consorcio de editoriales y empresas tecnológicas ha introdujo el estándar Really Simple Licensing (RSL), que requeriría que los rastreadores de IA presenten tokens de licencia válidos antes de acceder al contenido. El sistema cuenta con el respaldo de importantes actores como O'Reilly Media, Reddit, Yahoo y Medium.
Pero las soluciones técnicas enfrentan límites prácticos. Como señaló Pete Pachal, periodista y crítico de medios, hay "innumerables" formas para que las empresas de IA accedan a contenido bloqueado a través de retransmisiones, sistemas de terceros y diferentes tipos de bots. Incluso las medidas de bloqueo sofisticadas a menudo se convierten en juegos de "golpear al topo".
Google, atrapado en su propia contradicción, admitió recientemente en una presentación judicial que "la web abierta ya está en rápido declive" — un marcado contraste con las declaraciones públicas de los ejecutivos de que "la web está prosperando."
La admisión refleja una nueva realidad para las empresas de inteligencia artificial: la era del almuerzo gratis ha terminado. La próxima generación de modelos de inteligencia artificial requerirá no solo mejores algoritmos, sino también chequeras más grandes. La pregunta no es si las empresas de inteligencia artificial tendrán que pagar por los datos. Lo harán. La pregunta es cuánto estarán dispuestas a gastar y si los creadores de internet finalmente obtendrán su parte justa de la fiebre del oro de la inteligencia artificial.