SiteIndex
Deja la web lista para que la encuentren los buscadores y los asistentes de IA, y acaba midiendo en vez de opinando.
Cuándo se usa
Al publicar una web nueva, al preparar un lanzamiento, o cuando llevas semanas y no sales en Google.
SKILL.md
# SiteIndex
Que la web sea descubrible: que los rastreadores puedan entrar, entiendan qué es
cada página, y que además te puedan citar los asistentes de IA.
## Regla 0: los números se verifican, nunca se recitan
Todo lo que lleve un número caduca: longitudes recomendadas de título, umbrales
de Core Web Vitals, campos obligatorios de los datos estructurados y, sobre todo,
los nombres de los bots. Se comprueban en la fuente oficial en el momento. Si no
se puede verificar, se dice que no está verificado. No se inventa.
## El orden, que importa
**1. Los porteros.** Lee el robots.txt que ya hay antes de escribir nada. Bloquea
solo lo inútil o duplicado y enlaza el sitemap. Recuerda que es un cartel, no un
candado, y que bloquear ahí más poner noindex se anula solo: el bot nunca llega a
leer la etiqueta.
**2. La decisión de IA, que es del cliente y no tuya.** Hay dos grupos y las
consecuencias son distintas. Los de entrenamiento (GPTBot, ClaudeBot, CCBot,
Google-Extended, Bytespider) se pueden bloquear sin perder visibilidad. Los de
búsqueda y respuesta (OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User,
PerplexityBot, Perplexity-User) te borran de las respuestas de IA si los
bloqueas. La trampa clásica: Google-Extended NO afecta a tu posición ni a tu
indexación en Google, solo al entrenamiento de Gemini.
**3. Cimientos que no se negocian.** HTTPS, una sola versión canónica del dominio
con 301 desde la otra, contenido presente en la versión móvil, 404 de verdad, y
contenido visible en el HTML servido y no solo tras ejecutar JavaScript. Si la
web lleva movimiento, cruza aquí con FrontLaxWeb: el storytelling al scroll es
donde ese fallo nace, porque el texto acaba dentro de algo que solo existe cuando
monta el JavaScript.
**4. Sitemap y alta.** Solo URLs indexables y finales, nada con noindex ni
redirigido. Se sube a Search Console y a Bing Webmaster Tools.
**5. La cabecera, página a página.** Título y descripción propios, un solo h1,
canonical cuando el mismo contenido es alcanzable por varias URLs, y Open Graph
con imagen, que es lo que se ve al pegar el enlace en un chat.
**6. Varios idiomas.** Cada idioma con su propia URL (/es/, /en/), que es lo que
significa esa barra que ves en tantas direcciones: no es detección, es que son
páginas distintas. Se anotan con hreflang, y las tres reglas que más se rompen
son que cada versión se liste a sí misma, que los enlaces sean de ida y vuelta, y
que haya un x-default. El canonical de cada idioma apunta a SÍ MISMO: si el de
/es/ apunta a /en/, acabas de sacar la versión española del índice. Y nada de
redirigir automáticamente por idioma o por país, que es el error gordo: Googlebot
rastrea sin cabecera Accept-Language y sobre todo desde IPs de Estados Unidos,
así que cae siempre en la misma versión y las demás no se indexan nunca. Se
detecta, se sugiere con un aviso, y decide la persona.
**7. JSON-LD.** Que describa lo que se VE en la página, y validado antes de darlo
por bueno.
**8. Que te citen las IA.** Responde en las dos o tres primeras frases debajo de
cada encabezado y desarrolla después. Tablas para comparar, listas para procesos,
preguntas frecuentes reales. Y revisa el robots.txt antes de culpar al contenido.
**9. Medir, que es donde acaba el trabajo.** Search Console, PageSpeed, los logs
del servidor para ver qué bots entran de verdad, y preguntar tú mismo a los
asistentes una vez al mes para ver si te citan.
## Los fallos que más veces rompen una indexación
Antes de tocar nada en una web que no sale, descarta por orden: un noindex
olvidado de la fase de desarrollo, un Disallow de todo el sitio heredado del
entorno de pruebas, un sitio nuevo sin dar de alta y sin un solo enlace entrante,
las dos versiones del dominio vivas a la vez, un canonical que apunta a otra
página, contenido que solo existe tras ejecutar JavaScript, y una redirección
automática por idioma en un sitio multiidioma.
## Lo que queda fuera
Entregabilidad de correo, geo SEO local y enlaces entrantes. Se dice de frente en
vez de improvisar, y para el correo se dan las herramientas: Spamhaus y MXToolbox
Email Health, las dos en la sección de recursos de este sitio.