← / Notas

Mi sitio era invisible para ChatGPT (y quizá el tuyo también)

IA GEO Cloudflare Astro

Hoy descubrí algo incómodo: mi portafolio funcionaba perfecto en el navegador, pero para ChatGPT, Claude y Perplexity no existía. Y no tengo idea de desde cuándo estaba así.

Cómo lo detecté

Una prueba simple con curl, cambiando el User-Agent:

# Navegador normal
curl -s -o /dev/null -w "%{http_code}" -A "Mozilla/5.0 ..." https://juannoh.dev/
# → 200

# GPTBot (el crawler de ChatGPT)
curl -s -o /dev/null -w "%{http_code}" -A "... GPTBot/1.2 ..." https://juannoh.dev/
# → 403

Lo mismo con ClaudeBot y PerplexityBot: 403 Forbidden.

Mi primera sospecha fue el robots.txt, pero el mío permitía todo. El bloqueo venía de más arriba: de Cloudflare, que desde mediados de 2025 bloquea los crawlers de IA por defecto en los dominios nuevos. Yo nunca activé nada — venía así de fábrica.

Por qué importa en 2026

Los números de este año son claros: alrededor del 68% de las búsquedas en Google terminan sin ningún clic, y más de un tercio de las personas ya empieza a buscar directamente en un chat de IA. Si alguien le pregunta a ChatGPT “¿quién desarrolla plataformas con IA en Cancún?”, el modelo intenta leer las fuentes… y mi sitio le cerraba la puerta en la cara.

Ojo: bloquear crawlers de IA no siempre es un error. Si vives de tu contenido — un blog de recetas, un medio, cursos de paga — es una decisión válida: es tu contenido y tú decides quién lo consume. Pero un portafolio personal existe para que te encuentren y te verifiquen. Bloquear ahí es un tiro en el pie.

Qué cambié

  1. Desactivé el bloqueo en Cloudflare. Está en Security → Settings → filtro “Bot traffic” → regla “Block AI bots” → “Do not block (allow crawlers)”. Cinco minutos, incluido el tiempo de encontrarlo.
  2. Agregué un llms.txt. Un archivo de texto en la raíz del sitio que resume en Markdown quién soy, qué hago, mis proyectos y cómo contactarme. Es como el robots.txt, pero en vez de decirle al crawler qué puede leer, le da la versión condensada y correcta de todo.
  3. Revisé mi schema JSON-LD (Person, WebSite, y BlogPosting en estas notas): datos estructurados que le dicen a los buscadores y a los modelos exactamente quién es la entidad detrás del sitio.
  4. Abrí esta sección de notas. El schema y el llms.txt ayudan a que te lean; para que te citen necesitas decir algo propio.

La moraleja

En la era del SEO clásico la pregunta era “¿me encuentra Google?”. En 2026 hay una segunda igual de importante: ¿me puede leer la IA? — y la respuesta puede ser “no” sin que te hayas enterado, por un default de tu CDN.

Haz la prueba del curl con tu dominio. Te toma un minuto. A mí no haberla hecho antes me costó quién sabe cuánto tiempo de invisibilidad.