epoptes
GuíasEntrar

Crawlers de IA: qué permitir en el robots.txt para GPTBot, ClaudeBot y PerplexityBot

Actualizado: 4 de agosto de 2026

Si tu robots.txt bloquea los crawlers de IA, tu contenido nunca llega a los modelos y eres invisible en sus respuestas. Para que te vean, permite explícitamente los principales: GPTBot y OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot y Google-Extended. Son unas pocas líneas con efecto inmediato.

Qué hace cada bot

No todos hacen lo mismo, y la distinción importa al decidir qué permites:

  • GPTBot — recopila contenido para el entrenamiento de los modelos de OpenAI.
  • OAI-SearchBot — alimenta la búsqueda en vivo de ChatGPT (esto afecta a lo que ve el usuario hoy).
  • ChatGPT-User — actúa cuando un usuario pide explícitamente a ChatGPT que abra tu página.
  • ClaudeBot — el equivalente de Anthropic para Claude.
  • PerplexityBot — para el motor de respuestas de Perplexity.
  • Google-Extended — no es un crawler; es un interruptor que controla si tu contenido se usa en los productos de IA de Google.

El problema que no ves

Muchas webs bloquean estos bots sin saberlo: por el ajuste por defecto de un plugin de seguridad, una configuración del CDN, o un robots.txt copiado de internet.

El resultado es silencioso — no da error, simplemente nunca apareces en las respuestas. Merece la pena comprobarlo antes que nada.

Ejemplo de robots.txt que permite la IA

La lógica es simple: un grupo por bot con permiso explícito. Para lo esencial:

  • User-agent: GPTBot / Allow: /
  • User-agent: OAI-SearchBot / Allow: /
  • User-agent: ChatGPT-User / Allow: /
  • User-agent: ClaudeBot / Allow: /
  • User-agent: PerplexityBot / Allow: /
  • User-agent: Google-Extended / Allow: /
  • Y no olvides la línea Sitemap: con la URL completa de tu sitemap.

¿Debo permitirlos todos?

Es una decisión de negocio, no técnica. Si vives de que los clientes te encuentren, la respuesta es casi siempre sí — bloquear los bots te hace invisible justo donde se está moviendo la búsqueda.

Si tienes contenido de pago o un archivo que no quieres que se use para entrenamiento, puedes permitir los bots de búsqueda (OAI-SearchBot, PerplexityBot) y restringir los de entrenamiento. Es un término medio legítimo.

Qué comprobar ahora

  • Abre tu web añadiendo /robots.txt al final y lee lo que hay.
  • Busca cualquier Disallow que afecte a los user-agents anteriores.
  • Asegúrate de que existe una línea Sitemap.
  • Revisa también tu CDN o firewall — puede bloquear bots antes de que lleguen al robots.txt.

Preguntas frecuentes

Si permito los bots, ¿me «roban» el contenido?

Lo usan para generar respuestas, a menudo citando la fuente. La pregunta práctica es: ¿prefieres que te mencionen a ti o a tu competidor? Para la mayoría de negocios la visibilidad vale más.

¿Es vinculante el robots.txt?

Es una convención que los grandes proveedores respetan. No es una barrera técnica — para bloquear de verdad necesitas reglas a nivel de servidor o CDN.

¿Cuánto tarda en verse el cambio?

Desbloquear es un requisito, no una garantía. Los bots deben volver a pasar y los modelos actualizarse — cuenta semanas o meses.

Mira dónde estás en la IA — gratis

La micro-auditoría gratuita te muestra en 2 minutos si ChatGPT te nombra para tus propias palabras clave.

Empezar el check gratis →