Mi sitio era invisible para ChatGPT (y quizá el tuyo también)
Hoy descubrí algo incómodo: mi portafolio funcionaba perfecto en el navegador, pero para ChatGPT, Claude y Perplexity no existía. Y no tengo idea de desde cuándo estaba así.
Cómo lo detecté
Una prueba simple con curl, cambiando el User-Agent:
# Navegador normal
curl -s -o /dev/null -w "%{http_code}" -A "Mozilla/5.0 ..." https://juannoh.dev/
# → 200
# GPTBot (el crawler de ChatGPT)
curl -s -o /dev/null -w "%{http_code}" -A "... GPTBot/1.2 ..." https://juannoh.dev/
# → 403
Lo mismo con ClaudeBot y PerplexityBot: 403 Forbidden.
Mi primera sospecha fue el robots.txt, pero el mío permitía todo. El bloqueo venía de más arriba: de Cloudflare, que desde mediados de 2025 bloquea los crawlers de IA por defecto en los dominios nuevos. Yo nunca activé nada — venía así de fábrica.
Por qué importa en 2026
Los números de este año son claros: alrededor del 68% de las búsquedas en Google terminan sin ningún clic, y más de un tercio de las personas ya empieza a buscar directamente en un chat de IA. Si alguien le pregunta a ChatGPT “¿quién desarrolla plataformas con IA en Cancún?”, el modelo intenta leer las fuentes… y mi sitio le cerraba la puerta en la cara.
Ojo: bloquear crawlers de IA no siempre es un error. Si vives de tu contenido — un blog de recetas, un medio, cursos de paga — es una decisión válida: es tu contenido y tú decides quién lo consume. Pero un portafolio personal existe para que te encuentren y te verifiquen. Bloquear ahí es un tiro en el pie.
Qué cambié
- Desactivé el bloqueo en Cloudflare. Está en Security → Settings → filtro “Bot traffic” → regla “Block AI bots” → “Do not block (allow crawlers)”. Cinco minutos, incluido el tiempo de encontrarlo.
- Agregué un
llms.txt. Un archivo de texto en la raíz del sitio que resume en Markdown quién soy, qué hago, mis proyectos y cómo contactarme. Es como elrobots.txt, pero en vez de decirle al crawler qué puede leer, le da la versión condensada y correcta de todo. - Revisé mi schema JSON-LD (
Person,WebSite, yBlogPostingen estas notas): datos estructurados que le dicen a los buscadores y a los modelos exactamente quién es la entidad detrás del sitio. - Abrí esta sección de notas. El schema y el
llms.txtayudan a que te lean; para que te citen necesitas decir algo propio.
La moraleja
En la era del SEO clásico la pregunta era “¿me encuentra Google?”. En 2026 hay una segunda igual de importante: ¿me puede leer la IA? — y la respuesta puede ser “no” sin que te hayas enterado, por un default de tu CDN.
Haz la prueba del curl con tu dominio. Te toma un minuto. A mí no haberla hecho antes me costó quién sabe cuánto tiempo de invisibilidad.