Cloudflare permite bloquear entrenamiento de IA sin afectar Googlebot
La nueva función de Cloudflare Cloudflare ha introducido una innovadora función que permite a los sitios web desactivar el entrenamiento de inteligencia artificial (IA) sin bloquear los bots de...

La nueva función de Cloudflare
Cloudflare ha introducido una innovadora función que permite a los sitios web desactivar el entrenamiento de inteligencia artificial (IA) sin bloquear los bots de búsqueda como Googlebot. Esta nueva configuración, denominada ‘Disallow AI Training’, se integra en el archivo robots.txt, permitiendo que los motores de búsqueda sigan rastreando el contenido para fines de búsqueda, mientras se evita que los datos sean utilizados para entrenar modelos de IA.
Tabla de contenidos
Antes de esta actualización, los sitios que deseaban evitar que sus datos fueran usados para entrenamiento de IA debían optar por bloquear por completo los bots de búsqueda, lo cual afectaba negativamente su visibilidad en los motores de búsqueda. Con esta nueva opción, Cloudflare ofrece una solución equilibrada que protege el contenido de ser utilizado para entrenar IA sin sacrificar la indexación en buscadores.
Cómo funciona la configuración ‘Disallow AI Training’
La clave de esta función es su implementación en el archivo robots.txt, un archivo que los webmasters utilizan para gestionar el comportamiento de los bots de búsqueda. Al activar ‘Disallow AI Training’, los sitios pueden especificar que ciertos bots, como Googlebot, Applebot y Bingbot, continúen accediendo al contenido para fines de búsqueda, pero sin permitir el uso de esos datos para el entrenamiento de IA.
El proceso es posible gracias a una designación que Cloudflare denomina ‘Accountable’. Esta etiqueta se otorga a los operadores de rastreadores que cumplen con ciertos requisitos, como ofrecer una forma de optar por no participar en el entrenamiento de IA y proporcionar visibilidad a nivel de URL sobre qué páginas se han hecho disponibles para entrenamiento.
Impacto en los motores de búsqueda
Google, Apple y Microsoft han sido algunos de los primeros en cumplir con los requisitos de ‘Accountable’, asegurando que sus bots puedan seguir rastreando para búsqueda sin utilizar los datos para entrenamiento de IA. Esto significa que los sitios que utilizan esta nueva función no verán afectada su visibilidad en motores de búsqueda populares.
Sin embargo, para que un operador de rastreadores sea considerado ‘Accountable’, debe cumplir con ciertas condiciones, como permitir la exclusión del entrenamiento de IA a través de robots.txt y ofrecer métricas sobre cómo se ha utilizado el contenido en las búsquedas. Esto proporciona un nivel de transparencia y control que antes no estaba disponible para los webmasters.
Beneficios para los administradores de sitios web
Para los administradores de sitios web, esta nueva opción de Cloudflare representa una gran ventaja. Pueden proteger su contenido de ser utilizado para entrenar modelos de IA sin comprometer su presencia en línea. Esto es especialmente importante para sitios que dependen del tráfico de búsqueda para generar ingresos o atraer visitantes.
Además, al evitar que los datos sean utilizados para entrenamiento de IA, los sitios pueden mantener un mayor control sobre cómo se utiliza su contenido, lo que es crucial en un entorno en el que los datos son cada vez más valiosos. Esta capacidad de gestión y control es un paso significativo hacia la protección de la propiedad intelectual en línea. Protección de marca es un componente clave en este enfoque estratégico.
Conclusión
La introducción de la función ‘Disallow AI Training’ por parte de Cloudflare es un avance importante para los sitios web que desean proteger sus datos sin perder visibilidad en los motores de búsqueda. Al permitir que los bots de búsqueda continúen accediendo al contenido mientras se evita su uso para entrenamiento de IA, Cloudflare ofrece una solución equilibrada que beneficia tanto a los webmasters como a los motores de búsqueda.
En un mundo donde los datos son cada vez más valiosos, tener la capacidad de controlar cómo se utilizan es crucial. Esta función representa un paso adelante en la protección de los derechos de contenido y la privacidad en línea.












