¿Qué bots de IA deberían acceder a tu sitio web?
Este directorio incluye crawlers de IA identificables y agentes activados por el usuario, tokens de control de robots.txt y las principales plataformas de IA con acceso a la web pero sin una identidad de bot documentada públicamente: qué hace cada uno y nuestra recomendación de GEO cuando corresponde.
No hay resultados que coincidan con la búsqueda y los filtros seleccionados.
Obtiene una página en respuesta directa a una acción o solicitud específica de un usuario de ChatGPT.
Rastrea contenido para ChatGPT Search. OpenAI vincula directamente su acceso con la posibilidad de que el contenido sea encontrado, mostrado y citado.
Recopila contenido público que puede utilizarse para entrenar futuros modelos de OpenAI.
Visita las páginas de destino enviadas como anuncios de ChatGPT para comprobar el cumplimiento de las políticas y su relevancia. No está relacionado con la visibilidad en búsquedas ni con el entrenamiento de modelos.
Obtiene páginas cuando una solicitud de un usuario de Claude requiere contenido web actualizado.
Indexa la web para mejorar la calidad y la relevancia de los resultados de búsqueda de Claude.
Recopila contenido web que podría utilizarse para entrenar futuros modelos de Claude.
Puede obtener una página directamente para responder a una pregunta específica de un usuario y citarla en la respuesta.
Construye el índice de búsqueda de Perplexity; oficialmente no se utiliza para entrenar modelos fundacionales.
Es la base del índice de búsqueda de Google, que también alimenta las funciones de IA de Google. No recomendamos bloquearlo en un sitio comercial.
Es un token de control de robots (no un crawler) que determina si el contenido ya rastreado puede utilizarse para entrenar y proporcionar grounding a Gemini.
Obtiene páginas en tiempo real para generar respuestas asistidas por IA con fuentes; no se utiliza para entrenar modelos.
Obtiene contenido web específico bajo demanda para las funciones de Meta AI.
Recopila e indexa contenido para los sistemas de IA de Meta.
Obtiene páginas web a petición del usuario para proporcionar respuestas de IA actualizadas.
Crawler automatizado que indexa contenido web para las funciones de búsqueda de Mistral AI.
Crawler automatizado que recopila contenido web para los conjuntos de datos de entrenamiento de la IA generativa de Mistral.
Impulsa Siri, Spotlight y Safari; ahora también se utiliza como contexto en tiempo real para las respuestas de IA de Apple.
Es un token de control de robots que determina si los datos de Applebot pueden utilizarse para entrenar modelos fundacionales.
Recopila contenido web para los servicios de Amazon, incluidos los sistemas de respuesta de Alexa.
Se utiliza para experiencias de búsqueda como Alexa; Amazon afirma que no se utiliza para entrenar modelos de IA generativa.
Obtiene una página en nombre de una solicitud de Alexa/Amazon iniciada por un usuario para acceder a información actualizada.
Construye el conjunto de datos de Common Crawl, ampliamente utilizado en el ecosistema de ML/LLM.
Crawler de entrenamiento · Crawler de ByteDance asociado con la recopilación de datos para sus productos de IA.
Plataformas de IA sin una identidad de bot pública
Estas plataformas impulsan asistentes de IA ampliamente utilizados, pero no han publicado un User-Agent específico para su crawler ni rangos de IP propios, por lo que su tráfico no puede verificarse ni controlarse de forma selectiva mediante robots.txt a día de hoy.
Impulsa Qwen Chat y Quark. Alibaba no ha publicado un User-Agent específico para su bot ni rangos de IP propios para el tráfico de acceso a la web.
Impulsa el chat de DeepSeek y sus respuestas enriquecidas con búsquedas. No se ha documentado públicamente ninguna identidad de crawler o bot de acceso a la web.
Responde preguntas dentro de X y de la aplicación Grok, y en ocasiones cita contenido web actualizado, sin disponer de una identidad de bot publicada.