Para que ChatGPT y Perplexity citen tu web hacen falta tres cosas, y en este orden: que sus rastreadores puedan entrar, que el contenido que buscan esté en el HTML que reciben, y que cada respuesta se pueda extraer por separado sin leer la página entera. Si falla el primer punto, los otros dos dan igual.
Es un cambio incómodo porque no hay Search Console para esto, nadie te avisa de que estás fuera y la mayoría de las webs que no aparecen no tienen un problema de contenido: tienen un rastreador bloqueado y no lo saben. En esta guía verás qué rastreador importa de verdad, dónde está el bloqueo que casi nadie mira, cómo hay que escribir para que un modelo pueda citarte y cómo comprobar si algo de esto funciona.
En resumen
- El rastreador que da citas no es el que todo el mundo bloquea. En ChatGPT es
OAI-SearchBot;GPTBotes para entrenamiento y bloquearlo no te quita ni una cita. - El bloqueo más común no está en tu robots.txt. Está en Cloudflare o en el WAF de tu hosting, y es silencioso.
- Sin HTML servido desde el servidor no hay cita. Estos rastreadores apenas ejecutan JavaScript.
- La unidad de citación no es la página, es el párrafo. Se recupera un fragmento, no un artículo.
- Lo que más pesa está fuera de tu web: que otros te mencionen y te comparen.
- No hay panel oficial. Se mide con los logs del servidor y con una batería fija de preguntas.
Qué significa exactamente «que te citen»
Conviene separar dos cosas que se confunden todo el rato, porque llevan a decisiones opuestas.
Entrenamiento es cuando tu contenido forma parte de los datos con los que se entrenó un modelo. Queda diluido entre miles de millones de documentos, no genera enlace y no puedes comprobarlo. Recuperación es lo que pasa cuando alguien pregunta algo hoy: el sistema busca en un índice, coge unas cuantas páginas, extrae de ellas lo que responde a la pregunta y muestra la respuesta con enlaces a las fuentes.
Las citas que ves en ChatGPT y en Perplexity vienen de lo segundo, no de lo primero. Esto tiene una consecuencia práctica muy concreta: puedes negarte a que te usen para entrenar y seguir apareciendo citado. Son rastreadores distintos, con nombres distintos, y se controlan por separado.
Los rastreadores que importan
Estos son los que hay que conocer, con el nombre exacto que se usa en robots.txt, según la documentación oficial de cada uno:
| Rastreador | De quién | Para qué sirve | ¿Te da citas? |
|---|---|---|---|
OAI-SearchBot |
OpenAI | Indexar para las funciones de búsqueda de ChatGPT | Sí |
GPTBot |
OpenAI | Rastrear contenido para entrenar modelos | No |
ChatGPT-User |
OpenAI | Visitar una página cuando un usuario lo pide en la conversación | Sí, puntualmente |
PerplexityBot |
Perplexity | Indexar para los resultados de búsqueda de Perplexity | Sí |
Perplexity-User |
Perplexity | Visitar una página para responder a un usuario concreto | Sí, puntualmente |
Dos matices que valen dinero. El primero: OpenAI documenta que GPTBot es para entrenamiento y OAI-SearchBot para «mostrar sitios web en los resultados de búsqueda de ChatGPT». Son cosas distintas. Mucha web bloqueó GPTBot en 2023 por una decisión perfectamente razonable sobre su propiedad intelectual, y después ha dado por hecho que estaba fuera de ChatGPT. No lo está, siempre que deje pasar a OAI-SearchBot.
El segundo: Perplexity documenta que Perplexity-User «generalmente ignora las reglas de robots.txt», porque la visita la desencadena una persona, no un rastreo automático. Es decir, ni hace falta que lo permitas ni te sirve de mucho prohibirlo.
Cómo queda en el robots.txt
Si quieres citas pero no quieres ceder contenido para entrenamiento, la configuración es esta:
# Sí a la búsqueda: es lo que genera citas y enlaces
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# No al entrenamiento
User-agent: GPTBot
Disallow: /
Y aquí va la trampa que se lleva por delante a más de una web bien intencionada: en robots.txt, el grupo más específico sustituye por completo al grupo User-agent: *, no se suma a él. Si tienes un bloque general con veinte Disallow y luego escribes un bloque para OAI-SearchBot con un Allow: / suelto, ese rastreador deja de respetar los veinte Disallow anteriores. Lo que quieras bloquear para él hay que repetirlo dentro de su grupo.
El bloqueo que no ves: Cloudflare y el WAF
Este es, con diferencia, el motivo más frecuente por el que una web correcta no aparece nunca. Tu robots.txt puede estar perfecto y aun así los rastreadores no llegan, porque los está parando una capa anterior.
Cloudflare lleva desde 2024 ofreciendo una regla gestionada del tipo «bloquear bots de IA», activada por defecto en muchas zonas nuevas. El problema es que esa regla trata igual al rastreador que te entrena y al que te cita: si bloquea a OAI-SearchBot, ChatGPT deja de poder citarte; si bloquea a PerplexityBot, Perplexity deja de encontrarte. Desde el punto de vista del panel todo parece bien, porque tú nunca activaste nada.
Y hay fecha en el calendario: Cloudflare ha anunciado que a partir del 15 de septiembre de 2026 bloqueará por defecto a los rastreadores «de uso mixto» —los que no separan búsqueda, agentes y entrenamiento— en páginas que sirvan anuncios. Aplica a clientes nuevos, a sitios nuevos de clientes existentes y a todas las cuentas del plan gratuito. Los rastreadores exclusivamente de búsqueda no se ven afectados. Si tu web está en Cloudflare, esto es algo que conviene revisar antes de esa fecha, no después.
La comprobación es de dos minutos. Desde una terminal:
curl -A "OAI-SearchBot" -I https://tudominio.com/una-pagina-importante
curl -A "PerplexityBot" -I https://tudominio.com/una-pagina-importante
Si ves un 200, bien. Si ves un 403, un 503 o una pantalla de desafío, ahí está tu problema de visibilidad en IA, y no hace falta que toques ni una coma del contenido hasta arreglarlo. Ojo: esto solo prueba el filtrado por user-agent. Algunos sistemas verifican además el rango de IP, así que la confirmación definitiva está en los logs de acceso del servidor: busca esos nombres y mira si aparecen y con qué código de respuesta.
Si tu web se pinta con JavaScript, no existe
Los rastreadores de IA son, en general, mucho más simples que Googlebot: piden el HTML y se quedan con lo que viene dentro. No esperan a que se ejecute el JavaScript ni renderizan la página como un navegador.
Esto deja fuera a cualquier web construida como aplicación de cliente pura —React, Vue o Angular sin renderizado en servidor— por muy bien escrita que esté. El rastreador recibe un <div id="root"></div> vacío y sigue su camino.
La prueba, otra vez, en una línea:
curl -s https://tudominio.com/tu-articulo | grep -c "una frase concreta de tu texto"
Si devuelve 0, tu contenido no está en el HTML. La solución es renderizado en servidor o generación estática, que es exactamente lo que resuelve una arquitectura headless con Next.js: el visitante y el rastreador reciben HTML completo desde el primer byte.
Escribe para que te extraigan, no para que te lean entero
Aquí está el cambio de mentalidad más difícil, porque va en contra de cómo nos han enseñado a redactar.
Un motor generativo no lee tu artículo de principio a fin para decidir si te cita. Trocea las páginas en fragmentos, busca los que responden a la pregunta y usa esos. La unidad de citación es el párrafo, no la página. Un párrafo brillante que solo se entiende habiendo leído los tres anteriores es, a efectos prácticos, invisible.
De ahí salen cinco reglas muy concretas:
- Responde en las dos primeras frases que siguen al encabezado. El contexto, los matices y la historia van después. Si la respuesta está en el párrafo octavo, el fragmento que se recupera es el primero, y el primero no responde.
- Titula con la pregunta real. «Cuánto cuesta mantener una web al año» funciona; «Nuestro enfoque del mantenimiento» no lo busca nadie y no responde a nada.
- Que cada fragmento se sostenga solo. Nada de «como decíamos más arriba» o «este proceso». Repite el sujeto aunque te suene redundante al releerlo: quien lo va a leer no ha visto lo de arriba.
- Da cifras con unidad, ámbito y fecha. «Entre 900 y 2.500 € al año para una web corporativa en España, datos de 2026» es citable. «Depende del proyecto» no lo es.
- Usa listas y tablas para lo comparable. Se extraen mucho mejor que la misma información en prosa.
Un ejemplo del antes y el después, con el mismo contenido:
Antes: «En nuestra experiencia, tras años trabajando con clientes de distintos sectores, hemos comprobado que la cuestión del mantenimiento genera muchas dudas, y por eso queremos dedicar unas líneas a explicar cómo lo enfocamos nosotros…»
Después: «Mantener una web corporativa cuesta entre 900 y 2.500 € al año en España (2026). El precio depende de cuatro factores: número de integraciones, frecuencia de publicación, nivel de soporte y si incluye o no hosting gestionado.»
El segundo se puede citar entero, sin recortar y sin contexto. El primero no dice nada.
Datos estructurados y entidad
Los datos estructurados con Schema.org no son una palanca mágica —ningún motor ha confirmado que citar dependa de ellos— pero cuestan poco y alimentan los índices y grafos de conocimiento que estos sistemas consultan. Lo que merece la pena: Article con autor y fechas, Organization con sameAs apuntando a tus perfiles reales, FAQPage cuando la página tenga preguntas de verdad, y BreadcrumbList. Van en JSON-LD.
Más importante que el marcado es la coherencia de entidad: que tu nombre, tu descripción y tu ámbito sean idénticos en tu web, en LinkedIn, en Google Business Profile y en cualquier directorio donde estés. Un modelo tiene que poder resolver que todas esas menciones son la misma empresa. Si en un sitio eres «NVDigital», en otro «NV Digital Studio» y en otro «Nueva Visión Digital», estás repartiendo tu propia autoridad en tres entidades que no se reconocen entre sí.
Ayuda también el HTML semántico: encabezados en orden, un solo <h1>, listas que son listas. Facilita el troceado.
Lo que más pesa no está en tu web
Esta es la parte que menos gusta y la que más diferencia marca.
Un motor generativo desconfía, con buen criterio, de lo que una empresa dice de sí misma. Cuando tiene que recomendar proveedores de algo, no se apoya en la página «Por qué elegirnos» de cada candidato: se apoya en páginas que hablan de varios a la vez. Comparativas, listados sectoriales, hilos de foros, reseñas, notas de prensa, entradas de Wikipedia, respuestas en comunidades.
La consecuencia estratégica es incómoda pero clara: ser el sujeto de la página de otro vale más que cualquier cosa que publiques en la tuya. En la práctica eso significa aparecer en comparativas y listados de tu sector, tener fichas coherentes en los directorios que importan en tu nicho, participar de verdad donde se discute tu especialidad y conseguir menciones en medios sectoriales. Es trabajo lento y no se automatiza. También es lo que hace que la competencia no te alcance en un trimestre.
Es, por cierto, el mismo principio de autoridad que sostiene el posicionamiento clásico en Google: lo que cambia es el formato del resultado, no la lógica de la confianza.
llms.txt: qué es y qué esperar
El archivo llms.txt es una propuesta para dar a los modelos un índice en markdown de tu contenido más importante. La idea es buena y montarlo cuesta una tarde.
Ahora la parte honesta, porque hay mucho humo alrededor: Google ha declarado expresamente que su buscador no lo usa, ningún motor grande ha confirmado que sus citas dependan de él, y en los análisis de tráfico de bots las peticiones a /llms.txt siguen siendo marginales. Ponlo si quieres, porque no hace daño y el coste es bajo. No lo pongas esperando que mueva la aguja, y desconfía de quien te lo venda como el factor decisivo.
Cómo medir si esto funciona
No existe un Search Console para motores generativos. Se mide combinando tres fuentes, y ninguna sirve sola:
- Logs del servidor. Es la única verdad sobre el acceso. Filtra por
OAI-SearchBot,PerplexityBot,ChatGPT-UseryPerplexity-User, y mira frecuencia, qué URLs visitan y qué código devuelves. Si no aparecen, tienes un problema de acceso, no de contenido. - Tráfico de referencia. En GA4 o en la analítica que uses, las visitas desde
chatgpt.comyperplexity.aillegan identificadas. Son pocas comparadas con Google, pero suelen convertir bien: llegan con la decisión medio tomada. - Una batería fija de preguntas. Escribe entre 20 y 30 preguntas que un cliente haría de verdad, lánzalas una vez al mes en ChatGPT y en Perplexity, y anota si te citan, en qué posición y a quién citan en tu lugar.
Dos avisos sobre el tercer punto. Las respuestas no son deterministas: la misma pregunta dos veces puede dar fuentes distintas, así que una prueba suelta no demuestra nada y hay que mirar la tendencia sobre el conjunto. Y hazlas sin sesión iniciada o en ventana temporal, porque el historial personaliza los resultados y acabarás midiendo tu propia huella.
Un plan de 30 días
Por orden, porque el orden importa: no tiene sentido reescribir nada si el rastreador no puede entrar.
- Semana 1 — Acceso. Revisa el
robots.txtcon la lógica de grupos de arriba. Comprueba Cloudflare o el WAF con loscurlde este artículo. Verifica que tu contenido está en el HTML. Localiza los rastreadores en los logs. - Semana 2 — Estructura. Elige las cinco páginas que responden a las preguntas más comerciales de tu negocio y reescríbelas con la regla de las dos primeras frases. Solo cinco.
- Semana 3 — Entidad. Unifica nombre y descripción en todas partes, añade
OrganizationconsameAsyArticle, y haz una lista de las diez páginas de terceros donde deberías aparecer y no apareces. - Semana 4 — Medición. Monta la batería de preguntas y guarda la foto inicial. Sin línea base no vas a saber si algo de esto ha servido.
Errores frecuentes
- Bloquear todo lo que suene a IA. Decisión legítima si no quieres ceder contenido, pero entonces asume que no vas a aparecer. Lo que no tiene sentido es bloquearlo todo y quejarse de no salir.
- Publicar cincuenta artículos flojos. El volumen no mueve nada aquí. Una página que responde de verdad a una pregunta concreta vale más que cincuenta que la rodean.
- Copiar la respuesta que da hoy el modelo. Si escribes lo que ya dice ChatGPT, no aportas nada que merezca una cita.
- Medir una vez y sacar conclusiones. Un test aislado en un sistema no determinista no es un dato.
- Tratarlo como un proyecto que se termina. Los índices se refrescan y las citas rotan. Esto se parece más a un mantenimiento que a una obra.
Preguntas frecuentes
¿Bloquear GPTBot me quita citas en ChatGPT?
No. GPTBot se usa para rastrear contenido destinado al entrenamiento de modelos. Las citas de las búsquedas de ChatGPT dependen de OAI-SearchBot, que es un rastreador distinto y se configura por separado.
¿Se puede pagar para que ChatGPT o Perplexity te citen?
Las citas orgánicas no se compran. Es otra cosa distinta de los formatos publicitarios que estas plataformas están desarrollando, que van identificados como anuncios.
¿Cuánto tarda en notarse?
Arreglar un bloqueo se nota en cuanto el rastreador vuelve a pasar, normalmente en días o pocas semanas. Ganar presencia donde no la tienes es cuestión de meses, porque depende sobre todo de menciones de terceros que no controlas.
¿Necesito llms.txt para que me citen?
No hay evidencia de que sea necesario. Google ha dicho que no lo usa y ningún motor grande ha confirmado que sus citas dependan de él. Es barato de añadir; no lo consideres una prioridad.
¿Y si quiero aparecer citado pero no que entrenen con mi contenido?
Es exactamente el escenario que permite la separación de rastreadores: permite OAI-SearchBot y PerplexityBot, y bloquea GPTBot. Ten en cuenta que los rastreadores disparados por un usuario concreto, como Perplexity-User, pueden no respetar el robots.txt según la propia documentación de Perplexity.
En una frase
Que ChatGPT y Perplexity te citen no va de escribir para robots: va de dejarles entrar, servirles HTML de verdad y escribir respuestas que se sostengan solas. Lo primero es una tarde de configuración; lo segundo, una decisión técnica; lo tercero, una forma distinta de redactar que además mejora la web para las personas.
Si quieres saber por dónde andas, empieza por lo barato: lanza los dos curl de este artículo contra tu web y mira los logs. En diez minutos sabrás si tienes un problema de acceso o de contenido, que son dos conversaciones muy distintas. Y si prefieres que lo miremos nosotros, cuéntanos qué tienes y te decimos qué haríamos, en qué orden y por qué.
Fuentes
- OpenAI — Bots, documentación oficial de
OAI-SearchBot,GPTBotyChatGPT-User. - Perplexity — PerplexityBot, documentación oficial de
PerplexityBotyPerplexity-User. - TechCrunch — Cloudflare’s new policy pushes AI companies to pay for publishers’ content (julio de 2026), sobre el bloqueo por defecto a partir del 15 de septiembre de 2026.



