Actualización de permisos tras reintentos (7 de septiembre): hemos repetido hasta tres veces la lectura de los archivos que no se pudieron comprobar. Consulta los resultados revisados en Bee LLM. Las cifras de la primera ronda que aparecen a continuación se conservan como registro original.
¿La Casa Blanca permite el rastreo de los bots de IA? ¿Y la NASA? Es una forma de abrir una pregunta que también afecta a cualquier empresa: ¿qué pueden consultar los rastreadores de búsqueda cuando llegan a su web?
En Bee LLM hemos analizado 5.381 dominios de los rankings de visibilidad orgánica de Semrush en España y Estados Unidos, más seis casos editoriales. El estudio está terminado y los resultados se pueden consultar por dominio y por bot. Aquí explico qué hemos encontrado y cómo interpretarlo antes de cambiar la configuración de una web.
Consultar la tabla completa: buscar una web y filtrar por bot o semáforo
Qué dicen los datos
Estos recuentos utilizan los 5.381 dominios de la muestra principal. Los seis casos adicionales quedan fuera de los porcentajes.
| Resultado | Dominios | Porcentaje |
|---|---|---|
| Restricción declarada para al menos uno de los tres bots | 338 | 6,3 % |
| Los tres tienen permiso y responden en la prueba | 2.368 | 44,0 % |
| Permisos sin confirmar para alguno de los tres bots | 1.746 | 32,4 % |
Las filas no forman un reparto exhaustivo ni deben sumarse: un dominio puede tener un permiso sin confirmar para un bot y una restricción conocida para otro. Tampoco contamos un resultado incierto como un permiso.
La Casa Blanca responde; en la NASA el resultado queda sin confirmar
En la prueba de whitehouse.gov, los tres bots principales de búsqueda tenían permiso en las rutas comprobadas y recibieron una respuesta satisfactoria. El análisis siguió la redirección y comprobó también los permisos del destino.
En nasa.gov, la evidencia obtenida desde nuestra conexión no permitió confirmar el acceso de los tres bots. Eso no demuestra que la NASA bloquee a los rastreadores oficiales. Describe el resultado de nuestra comprobación.
El estudio incluye también Casa Real, CIA, Vaticano y otros casos conocidos. Cada dominio permite abrir el detalle de las reglas, las respuestas y la fecha de la prueba.
Permitir búsqueda y permitir entrenamiento son decisiones distintas
Encontramos 385 dominios que restringen GPTBot y permiten OAI-SearchBot. Es una distinción útil: GPTBot recopila contenido para entrenamiento; OAI-SearchBot está relacionado con la búsqueda de ChatGPT. OpenAI documenta sus funciones y controles por separado.
Por eso, una conclusión como «esta web bloquea la IA» resulta demasiado amplia si solo hemos mirado un agente. Antes de interpretar una regla hay que identificar qué bot afecta, para qué sirve y en qué ruta se aplica.
Cómo leer el semáforo
- Verde: encontramos permiso y la petición de prueba obtuvo respuesta.
- Rojo: robots.txt declara una restricción aplicable.
- Ámbar: la petición recibió un rechazo o un reto antibot.
- Gris: el acceso quedó sin confirmar o solo se evaluaron las reglas de robots.txt.
El permiso declarado y la respuesta técnica aparecen separados. Una web puede permitir un bot en robots.txt y rechazar la petición desde nuestra conexión. También puede devolver HTTP 200 sin proporcionar un robots.txt que podamos interpretar.
Qué hemos medido y qué queda fuera
Las comprobaciones se ejecutaron el 6 de septiembre de 2026, entre las 21:14 y las 21:52 UTC. Partimos de los 3.000 primeros dominios de cada exportación de Semrush del 5 de septiembre. Al eliminar los 619 compartidos quedan 5.381. Son rankings de visibilidad orgánica estimada, no un ranking mundial de autoridad.
Comprobamos la portada mediante HTTPS, robots.txt y las rutas de las redirecciones observadas. El catálogo contiene 17 agentes o tokens; para 12 se programaron peticiones con su user-agent. No rastreamos todas las páginas internas.
Las peticiones salen del servidor de Bee LLM, no de las IP oficiales de los proveedores. El resultado puede cambiar por conexión, ubicación, verificación del bot o modificaciones posteriores de la web. No mide visitas reales, indexación ni citas en respuestas de IA.
La unidad es el dominio incluido en el ranking: varios pueden acabar en el mismo destino. Los rankings de España y Estados Unidos comparten dominios y no representan muestras independientes. La metodología y los datos completos están publicados en Bee LLM.
Qué revisaría en una web de empresa
Empezaría por elegir el bot que corresponde al objetivo: búsqueda, entrenamiento o visitas solicitadas por una persona. Después comprobaría la regla exacta de robots.txt y la ruta a la que afecta. Si la prueba recibe un rechazo o un reto, lo contrastaría con los registros del servidor y los controles antibot.
Si tu web no aparece en el estudio, puedes hacer una comprobación nueva con el analizador de Bee LLM. La extensión GEO Check permite repetirla desde el navegador; al cambiar la conexión, también puede cambiar la respuesta.
El estudio sirve para detectar qué merece una revisión. Conseguir permiso y una respuesta satisfactoria es una señal técnica útil, pero por sí sola no garantiza que una IA recomiende una empresa.
