Cómo aparece tu tienda en las respuestas de ChatGPT y Gemini
Hay rastreadores que entrenan modelos y rastreadores que buscan en vivo. Son cosas distintas, se bloquean por separado, y confundirlos es la forma más rápida de desaparecer de las respuestas sin enterarte.
Tu tienda aparece en las respuestas de ChatGPT, Claude, Gemini o Perplexity cuando el asistente busca en la web en ese momento, y eso lo controlan agentes distintos de los de entrenamiento: OAI-SearchBot en OpenAI, Claude-SearchBot y Claude-User en Anthropic, PerplexityBot en Perplexity y Googlebot en Google, porque Google-Extended solo afecta al entrenamiento de Gemini y su propia documentación dice que no afecta a la inclusión en la Búsqueda. Bloquear GPTBot o ClaudeBot no te quita de esas respuestas; bloquear los de búsqueda sí. Y para que te citen no hace falta ningún archivo especial: hacen falta datos concretos en texto, la respuesta al principio y datos estructurados que coincidan con lo que se ve en la página.
Un rastreador que entrena no es un rastreador que busca
Cuando alguien le pregunta a ChatGPT "sofá chaise longue de menos de 900 euros en España", pasan dos cosas que casi todo el mundo mezcla en una sola.
Para seguir: Qué datos de producto lee un buscador cuando hay un modelo 3D en la ficha.
La primera es que el modelo ya venía entrenado. Ese entrenamiento ocurrió meses antes, con contenido recogido por un rastreador cuyo único trabajo es recopilar texto para entrenar.
La segunda es que el asistente sale a buscar en la web en ese instante, abre páginas y cita fuentes. Eso lo hace otro agente, con otro nombre y otra política.
Son dos grifos separados y se cierran por separado en tu robots.txt. Cerrar el del entrenamiento no te quita de las respuestas en vivo. Cerrar el de la búsqueda sí.
OpenAI lo dice sin rodeos: los sitios excluidos de OAI-SearchBot "no se mostrarán en las respuestas de búsqueda de ChatGPT", aunque pueden seguir apareciendo como enlaces de navegación. De GPTBot dice otra cosa distinta: bloquearlo indica que tu contenido no debe usarse para entrenar sus modelos base. Dos frases separadas porque son dos decisiones separadas.
Los nombres reales, proveedor por proveedor
Todo lo que hay en esta tabla sale de la documentación de cada proveedor, no de listas de terceros. Si un nombre no aparece en su página oficial, no está aquí.
| Proveedor | Agente | Para qué sirve, según su documentación | Qué pasa si lo bloqueas |
|---|---|---|---|
| OpenAI | GPTBot | Entrenamiento de sus modelos generativos de base | Indica que tu contenido no debe usarse para entrenar. No te quita de las respuestas con búsqueda |
| OpenAI | OAI-SearchBot | Mostrar sitios en los resultados de las funciones de búsqueda de ChatGPT | No apareces en las respuestas de búsqueda de ChatGPT, aunque puedes seguir saliendo como enlace de navegación |
| OpenAI | ChatGPT-User | Determinadas acciones del usuario dentro de ChatGPT y de los GPTs personalizados | Su documentación no detalla la consecuencia |
| OpenAI | OAI-AdsBot | Validar la seguridad de páginas enviadas como anuncios en ChatGPT | Solo afecta a la publicidad, no a la visibilidad orgánica |
| Anthropic | ClaudeBot | Recoger contenido web que puede contribuir al entrenamiento de sus modelos | Señala que tu material futuro queda fuera de sus conjuntos de entrenamiento |
| Anthropic | Claude-User | Visitar páginas cuando un usuario le hace una pregunta a Claude | Claude no puede recuperar tu contenido para responder a un usuario, y baja tu visibilidad en búsqueda dirigida por el usuario |
| Anthropic | Claude-SearchBot | Recorrer la web para mejorar la relevancia y la exactitud de los resultados de búsqueda | Deja de indexar tu contenido, lo que puede reducir tu visibilidad en los resultados |
| Googlebot | Construir el índice de la Búsqueda, y con él las funciones de IA integradas en Búsqueda | Sales de la Búsqueda y, con ella, de AI Overviews y AI Mode | |
| Google-Extended | Token de producto para gestionar si tu contenido se usa para entrenar futuras generaciones de Gemini | No afecta a tu inclusión en la Búsqueda de Google ni se usa como señal de ranking | |
| Perplexity | PerplexityBot | Mostrar y enlazar sitios en los resultados de Perplexity. No se usa para entrenar modelos de base | Perplexity deja de enlazarte en sus resultados |
| Perplexity | Perplexity-User | Acciones del usuario dentro de Perplexity | Según su documentación, por lo general ignora robots.txt porque la petición la inicia una persona |
La lista cambia cada pocos meses: hoy Anthropic documenta tres agentes y OpenAI cuatro, y hace un año no era así. Si copias el robots.txt de un artículo del año pasado vas a bloquear agentes que ya no existen y a dejar pasar justo los que ahora deciden tu visibilidad. Vuelve a mirar las páginas oficiales antes de tocar nada.
Google es el caso raro y conviene entenderlo
Google no funciona como los otros tres. Google-Extended no es un rastreador que abre páginas: su documentación lo describe como un token de producto independiente que sirve para gestionar si el contenido que Google ya ha rastreado puede usarse para entrenar futuras generaciones de Gemini. Y añade una frase que tranquiliza a mucha gente: Google-Extended "no afecta a la inclusión de un sitio en la Búsqueda de Google" ni se usa como señal de ranking.
La otra cara es menos cómoda. Lo que aparece en AI Overviews y en AI Mode no depende de Google-Extended. Google explica que la IA está integrada en la Búsqueda y que, precisamente por eso, el control del que dispone el dueño de un sitio son las directivas de robots.txt para Googlebot. Traducido: no existe un botón de "sí a la Búsqueda, no a la IA". Puedes recortar el fragmento con nosnippet, data-nosnippet o max-snippet, pero eso también te recorta el fragmento normal en los resultados de siempre.
Antes de escribir nada, mira quién te bloquea ya
Abre tudominio.com/robots.txt y léelo entero. En Shopify ese archivo se genera desde una plantilla del tema, robots.txt.liquid. Shopify recomienda usar los objetos Liquid que vienen de serie y avisa de que las reglas por defecto se actualizan de forma regular para que siempre se apliquen las buenas prácticas de SEO. Si tu agencia sustituyó la plantilla por texto plano hace dos años, llevas dos años sin esas actualizaciones, y es muy probable que haya algún Disallow que ya nadie recuerda haber puesto.
El segundo sitio que hay que mirar es tu CDN o tu cortafuegos. Cloudflare ha anunciado que el 15 de septiembre de 2026 cambia los valores por defecto para los dominios nuevos que se incorporen: las categorías Training y Agent quedarán bloqueadas por defecto en las páginas que muestran anuncios, mientras que la categoría Search seguirá permitida. Quien no quiera ese cambio puede marcarlo en sus ajustes de seguridad antes de esa fecha. Si tu tienda entra en Cloudflare después, habrá decisiones tomadas por ti que no has tomado tú.
Qué hace que te citen
Aquí no hay truco, y lo dice la propia Google en su página sobre funciones de IA: no hay requisitos adicionales para aparecer en AI Overviews o en AI Mode, ni son necesarias optimizaciones especiales. Y remata algo que ahorra dinero: no necesitas crear archivos legibles por máquina nuevos, archivos de texto para IA ni marcado adicional para salir en esas funciones. Si alguien te vende un llms.txt como la gran palanca, enséñale esa frase.
Lo que sí importa, y vale igual para la Búsqueda que para un asistente:
- Datos concretos en texto. Medidas exactas, material, peso, plazo de entrega, condiciones de devolución. Un asistente solo puede responder "¿cabe este sofá en un hueco de 2,40 m?" si el 2,40 está escrito en alguna parte de la página.
- La respuesta al principio. Si la pregunta es el titular, la respuesta va en el primer párrafo, no en el octavo.
- Datos estructurados que coinciden con lo visible. Para una ficha de producto, Google pide como mínimo name, image y un offers anidado con price y priceCurrency. Su guía general es tajante: no marques contenido que no sea visible para los lectores de la página.
- Autoría y responsable visibles. Google pregunta de forma literal si es evidente para tus visitantes quién ha escrito el contenido.
Lo que no funciona
Rellenar de palabras clave sigue siendo lo que siempre fue. Google define el keyword stuffing como llenar una página de palabras clave o de números para intentar manipular el ranking, y pone como ejemplo repetir las mismas palabras o frases hasta que suena poco natural.
Generar cien artículos flojos es peor, porque ya tiene nombre y política propia. Google lo llama abuso de contenido a escala y lo define como generar muchas páginas cuyo propósito principal es manipular el ranking en lugar de ayudar a los usuarios, citando de forma expresa el uso de herramientas de IA generativa para producir muchas páginas sin añadir valor. No es una zona gris de interpretación: está escrito en sus políticas de spam.
Y hay una tercera que vemos mucho en catálogos de mobiliario: dar por hecho que el visor 3D habla por ti.
Un visor de realidad aumentada no le dice nada a un modelo de lenguaje. El GLB de nuestra mesa de demo pesa 257 KB y tiene 4.861 triángulos, y ahí dentro está la geometría real del producto, pero ningún rastreador va a deducir de eso que la mesa mide 120 por 75 cm. El model-viewer.min.js que sirve el visor pesa 913 KB, y lo cargamos diferido justo por esto: no debe estorbar a la carga de lo que sí se lee. Las medidas van en texto y en el marcado, o no existen.
Qué haría con una tienda de mobiliario esta semana
- Abrir el robots.txt y anotar qué agentes están bloqueados hoy, con nombre y número de línea.
- Decidir grifo a grifo. Una postura razonable para una tienda que quiere vender: dejar pasar los de búsqueda y los de acción del usuario (OAI-SearchBot, Claude-SearchBot, Claude-User, PerplexityBot) y decidir aparte, con calma, si quieres ceder contenido al entrenamiento (GPTBot, ClaudeBot, Google-Extended). Aparecer y entrenar son conversaciones distintas.
- Meter medidas, material y peso en texto en cada ficha, no solo en una imagen de cotas que ningún rastreador lee.
- Revisar que el marcado de producto lleva precio, moneda y disponibilidad, y que coincide con lo que se ve en pantalla.
- Tratar el 3D y la AR como lo que son: una palanca de conversión dentro de la ficha, no una palanca de citación. Cómo se monta está en cómo añadir 3D a Shopify, y qué se gana con ello en qué gana una tienda con realidad aumentada.
Y la parte honesta: si tu catálogo tiene diez referencias y vendes sobre todo por Instagram, esto no es tu prioridad de este trimestre. Ordena antes las fichas. Aparecer citado en un asistente es un subproducto de tener fichas bien hechas, no un canal que se compre aparte. Si dudas de si tu catálogo da para 3D, la respuesta corta está en si tu catálogo es candidato a AR, el contexto completo en la guía de realidad aumentada en ecommerce, y si prefieres que lo miremos contigo, escríbenos desde contacto.
De dónde salen los datos
- OpenAI, Bots and crawlers, documentación para desarrolladores. Consultada el 26 de agosto de 2026.
- Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler?, centro de ayuda. Consultada el 26 de agosto de 2026.
- Google Search Central, Google common crawlers. Consultada el 26 de agosto de 2026.
- Google Search Central, AI features and your website. Consultada el 26 de agosto de 2026.
- Perplexity, Perplexity Crawlers, documentación oficial. Consultada el 26 de agosto de 2026.
- Google Search Central, Spam policies for Google web search. Consultada el 26 de agosto de 2026.
- Cloudflare, Your site, your rules: new AI traffic options for all customers, blog oficial. Consultada el 26 de agosto de 2026.
- Shopify, robots.txt.liquid, documentación de temas. Consultada el 26 de agosto de 2026.
- Google Search Central, Merchant listing (Product) structured data. Consultada el 26 de agosto de 2026.
- Google Search Central, Structured data general guidelines. Consultada el 26 de agosto de 2026.
- Google Search Central, Creating helpful, reliable, people-first content. Consultada el 26 de agosto de 2026.
Equipo de investigación de insiti. Escribimos sobre lo que nos encontramos metiendo catálogos de mobiliario en 3D y en realidad aumentada: lo que funciona, lo que no y los números de verdad. Si algo de aquí te cuadra mal con tu experiencia, cuéntanoslo.