CCBot
Operado por Common Crawl · Alimenta un conjunto de datos compartido utilizado por múltiples empresas
CCBot es el crawler de Common Crawl, una organización sin ánimo de lucro que publica un archivo abierto de la web. A diferencia de los bots de una única empresa, este archivo es descargado y utilizado para entrenamiento por numerosos laboratorios de IA. Bloquear CCBot permite excluirse de este conjunto de datos compartido, no de los modelos de una empresa concreta.
Qué hace
El objetivo principal de CCBot es crear el archivo abierto de la web de Common Crawl. Common Crawl publica este conjunto de datos abiertamente y es ampliamente utilizado por desarrolladores de IA y machine learning como material de entrenamiento, en lugar de constituir un rastreo propietario de un único operador.
Common Crawl señala que CCBot respeta el estándar robots.txt. Dado que el archivo es acumulativo, bloquear CCBot a partir de ahora no elimina el contenido que ya haya sido recopilado en versiones anteriores del archivo.
Por qué el bloqueo es opcional
- Solo afecta a si tu contenido futuro pasa a formar parte de un conjunto de datos abierto y compartido que los desarrolladores de IA pueden utilizar.
- Common Crawl documenta que CCBot respeta el estándar robots.txt.
- Bloquearlo no revierte la inclusión previa de contenido en versiones anteriores del archivo de Common Crawl.
Identificación y robots.txt
CCBot
La documentación oficial de Common Crawl contiene información adicional sobre su verificación.
User-agent: CCBot
Disallow: /