CONOCIMIENTOS · TUTORIAS
Robots.txt explicado
Última actualización 2025-06-06
Robots.txt explicado en una nuez:
Robots.txt es una herramienta útil cuando se utiliza para limitar el acceso de robots a su sitio, como el contenido en el trabajo y la información sensible. En este momento no hay ningún respaldo del Grupo de Trabajo Estándar de Exclusión Robots para una directiva que permita que los robots ingresen a partes índices de el sitio. Esto todavía puede iniciarse mediante la conexión interna y externa a su sitio web.
Usted puede haber notado al revisar sus estadísticas de uso de la página web una referencia a un archivo llamado 'robots.txt'. Este es un archivo de configuración básico que los robots (espídetes de motor de búsqueda) utilizan para notar qué archivos y directorios no deben indexar.
Es importante tener un archivo llamado robots.txt en la raíz de su sitio web (http://www.yourdomain.com/robots.txt). El uso básico de los robots.txt es notar qué archivos y directorios los robots no deben indexar.
Hay 2 componentes en la sintaxis de la estructura de archivos robots.txt: la línea de agente de usuario y la línea de desactivada.
La sintaxis es la siguiente:
Usuario-agent
Una lista de los robots que visitan su sitio puede ser vista en los registros de estadísticas de su sitio web. Se puede consultar una lista de usuarios en adultosnbsp;http://www.robotstxt.org/wc/active.html
Un robot específico puede ser referenciado en la sintaxis de Usuario-Agente.
Usuarios: Googlebot
Un comodín también puede ser utilizado para combinar todos los archivos robots.txt.
*
Distribuir
Esta sección de la sintaxis indica que los archivos y directorios no deben ser indexados.
Si tiene una página llamada 'addresses.html' y no quiere que el robot indexe , agregue la siguiente línea después de la sintaxis de Usuario-agente:
Aceptar: direcciones.html
También puede limitar el robot a nivel del directorio. Si el directorio '/billing' en su sitio web debe restringirse de indexación, coloque el texto siguiente después de la sintaxis de usuario-agente.
Distribución: /billing/
Un comodín también puede ser utilizado para notar todos los archivos en un sitio.
Disallow: /
¿Cómo hago comentarios en mi archivo robots.txt?
Los comentarios de codificación pueden ser colocados en el archivo robots.txt colocando '#' antes de cualquier texto. Un ejemplo es:
# especifica googlebot como el agente de usuario.
Usuarios: Googlebot
Es buena práctica tener sus comentarios en una línea separada que la directiva. Además, limite el espacio blanco al comienzo de las líneas directivas.
Poniendo robots.txt para usar:
Ahora que sabemos la funcionalidad de robots.txt, pongamoslo a práctica.
Si desea permitir que TODOS los robots visiten TODAS las páginas de su sitio web, debe utilizar el comodín "*" en su sintaxis en el archivo robots.txt.
*
- Sí.
Para desactivar toda la indexación de su sitio, introduzca el siguiente texto en su archivo robots.txt:
*
Disallow: /
Desactivar robots de páginas de indexación dentro de un directorio llamado 'billing'.
*
Distribución: /billing/
Dejar a los robots de las páginas de indexación dentro de directorios llamados "billing" y "address".
*
Distribución: /billing/
Desplazamiento: /dirección /
Deja de hablar de Googlebot de tu sitio.
Usuario-agent: googlebot
Disallow: /
Dejar de acceder a Googlebot de la página de contacto (contact-us.html).
Usuario-agent: googlebot
Desactivado: /contact-us.html
Dejar de acceder a Googlebot de la página de contacto (about-us/contact-us.html).
Usuario-agent: googlebot
Disallow: /about-us/contact-us.html
Robots.txt es una herramienta útil cuando se utiliza para limitar el acceso de robots a su sitio, como el contenido en el trabajo y la información sensible. En este momento no hay ningún respaldo del Grupo de Trabajo Estándar de Exclusión Robots para una directiva que permita que los robots ingresen a partes índices de el sitio. Esto todavía puede iniciarse mediante la conexión interna y externa a su sitio web.
Usted puede haber notado al revisar sus estadísticas de uso de la página web una referencia a un archivo llamado 'robots.txt'. Este es un archivo de configuración básico que los robots (espídetes de motor de búsqueda) utilizan para notar qué archivos y directorios no deben indexar.
Es importante tener un archivo llamado robots.txt en la raíz de su sitio web (http://www.yourdomain.com/robots.txt). El uso básico de los robots.txt es notar qué archivos y directorios los robots no deben indexar.
Hay 2 componentes en la sintaxis de la estructura de archivos robots.txt: la línea de agente de usuario y la línea de desactivada.
La sintaxis es la siguiente:
Usuario-agent
Una lista de los robots que visitan su sitio puede ser vista en los registros de estadísticas de su sitio web. Se puede consultar una lista de usuarios en adultosnbsp;http://www.robotstxt.org/wc/active.html
Un robot específico puede ser referenciado en la sintaxis de Usuario-Agente.
Usuarios: Googlebot
Un comodín también puede ser utilizado para combinar todos los archivos robots.txt.
*
Distribuir
Esta sección de la sintaxis indica que los archivos y directorios no deben ser indexados.
Si tiene una página llamada 'addresses.html' y no quiere que el robot indexe , agregue la siguiente línea después de la sintaxis de Usuario-agente:
Aceptar: direcciones.html
También puede limitar el robot a nivel del directorio. Si el directorio '/billing' en su sitio web debe restringirse de indexación, coloque el texto siguiente después de la sintaxis de usuario-agente.
Distribución: /billing/
Un comodín también puede ser utilizado para notar todos los archivos en un sitio.
Disallow: /
¿Cómo hago comentarios en mi archivo robots.txt?
Los comentarios de codificación pueden ser colocados en el archivo robots.txt colocando '#' antes de cualquier texto. Un ejemplo es:
# especifica googlebot como el agente de usuario.
Usuarios: Googlebot
Es buena práctica tener sus comentarios en una línea separada que la directiva. Además, limite el espacio blanco al comienzo de las líneas directivas.
Poniendo robots.txt para usar:
Ahora que sabemos la funcionalidad de robots.txt, pongamoslo a práctica.
Si desea permitir que TODOS los robots visiten TODAS las páginas de su sitio web, debe utilizar el comodín "*" en su sintaxis en el archivo robots.txt.
*
- Sí.
Para desactivar toda la indexación de su sitio, introduzca el siguiente texto en su archivo robots.txt:
*
Disallow: /
Desactivar robots de páginas de indexación dentro de un directorio llamado 'billing'.
*
Distribución: /billing/
Dejar a los robots de las páginas de indexación dentro de directorios llamados "billing" y "address".
*
Distribución: /billing/
Desplazamiento: /dirección /
Deja de hablar de Googlebot de tu sitio.
Usuario-agent: googlebot
Disallow: /
Dejar de acceder a Googlebot de la página de contacto (contact-us.html).
Usuario-agent: googlebot
Desactivado: /contact-us.html
Dejar de acceder a Googlebot de la página de contacto (about-us/contact-us.html).
Usuario-agent: googlebot
Disallow: /about-us/contact-us.html
nbsp;
Limitando los rastreadores
Si tienes muchos enlaces en tu sitio (por ejemplo, si tienes foros), es probable que el bot de Yahoo pueda arrastrar los enlaces demasiado rápido y terminar usando un montón de ancho de banda y otros recursos. Para evitarlo, agregue estas líneas a su archivo robots.txt:
Usuario-agent: Slurp
Crawl-delay: 60
Esto le dirá a Yahoo Slurp que sólo arrastra una página cada 60 segundos.
Díganos qué tiene que estar levantado.
Una breve conversación con un ingeniero. Sin cita-bot, sin cola de callback.