ForHosting KIT · Web: scraping y monitoreo

Genere robots.txt con reglas de rastreo y un sitemap

Este generador de robots.txt convierte instrucciones estructuradas para rastreadores en un archivo limpio y listo para publicar.

● BetaGratis · en su navegador
Úselo desde WebAPIEmailTelegramApp pronto

Añada cada agente de usuario, elija si su ruta se permite o se bloquea e indique la URL absoluta de su sitemap XML. El generador valida todas las rutas, agrupa las reglas del mismo rastreador, aplica la escritura canónica de las directivas y devuelve texto plano determinista con saltos de línea seguros. Resulta útil para definir una política nueva, sustituir un archivo manual propenso a errores o producir contenido robots.txt coherente dentro de un proceso de despliegue.

Describa el acceso de los rastreadores con reglas explícitas

Comience por añadir una fila para cada decisión relativa a un rastreador y una ruta. El agente de usuario identifica qué rastreador debe recibir la instrucción; use un asterisco cuando una regla se aplique a todos o indique un token concreto cuando el tratamiento de uno de ellos sea diferente. Seleccione después Allow o Disallow e introduzca el patrón de ruta correspondiente. Todas las rutas deben comenzar con una barra, incluida la propia ruta raíz. Este requisito detecta un error habitual de robots.txt antes de publicar el archivo. Las reglas del mismo agente de usuario se reúnen en un solo grupo aunque sus filas estén separadas en la entrada, mientras que el orden de grupos y reglas respeta su primera aparición. Ese orden estable facilita la revisión del resultado y evita cambios innecesarios entre compilaciones repetidas. El generador no decide qué zonas deben ser privadas o rastreables; reproduce fielmente la política indicada, por lo que conviene contrastar las rutas con la estructura real del sitio.

Comprenda qué controla el archivo generado

Un archivo robots.txt comunica a los rastreadores web que cooperan qué rutas URL pueden solicitar. No es un sistema de autenticación, una lista de control de acceso ni un mecanismo para ocultar información confidencial. Una dirección bloqueada puede descubrirse mediante enlaces, y los clientes que ignoran el protocolo pueden solicitarla si el servidor no impone una autorización independiente. Use permisos de aplicación, almacenamiento privado o reglas del servidor para cualquier recurso que deba estar protegido. Dentro de un grupo de agentes de usuario, cada rastreador interpreta los patrones Allow y Disallow según su propia documentación, especialmente si aparecen comodines o marcadores de final. Esta herramienta conserva el texto de las rutas en vez de intentar predecir las prioridades de un rastreador concreto. Además, rechaza saltos de línea incrustados en nombres, directivas, rutas y en el sitemap, de modo que un campo no pueda insertar registros adicionales. El resultado utiliza mayúsculas y espacios convencionales, sin añadir comentarios ni suposiciones ausentes de la entrada estructurada.

Publique el resultado y verifíquelo en su contexto

Guarde el contenido devuelto en un archivo de texto plano llamado robots.txt situado en la raíz del origen web correspondiente, por ejemplo, https://example.com/robots.txt. El sitemap debe ser una URL absoluta con HTTP o HTTPS; el generador la normaliza antes de añadir la línea Sitemap final. Esta declaración ayuda a los rastreadores a localizar el sitemap XML incluso si está alojado en una ruta poco evidente o en otro host permitido. Tras el despliegue, abra directamente la URL pública de robots.txt y compruebe que la respuesta sea correcta, de texto plano y que no haya sido sustituida por una página de error, un bucle de redirección o una pantalla de acceso. Pruebe las rutas importantes con las herramientas de inspección de los buscadores y rastreadores relevantes, ya que su compatibilidad y sus criterios pueden variar. Genere de nuevo el archivo cuando cambien las rutas, las áreas privadas, la protección del entorno de pruebas o la ubicación del sitemap. Para una misma entrada, la salida determinista se integra bien en control de versiones y despliegues repetibles.

Lanzar un sitio web nuevo

Cree una política de rastreo legible y una declaración de sitemap antes de abrir el dominio de producción a la indexación.

Estandarizar la configuración de despliegue

Genere contenido robots.txt idéntico a partir de ajustes estructurados en compilaciones repetibles del sitio.

Separar políticas de rastreadores

Agrupe reglas generales y excepciones específicas sin reorganizar manualmente bloques de texto.

¿Qué ocurre si una ruta de regla no empieza por una barra?

La solicitud falla con un error de entrada no válida que identifica la regla y no se genera contenido.

¿Puedo añadir reglas para más de un agente de usuario?

Sí. Las reglas se agrupan por agente de usuario según el orden de su primera aparición.

¿Disallow protege la información privada?

No. Robots.txt orienta a los rastreadores que cooperan, pero no aporta seguridad. Proteja los recursos sensibles mediante autorización en el servidor.

¿Dónde debo publicar el contenido generado?

Publíquelo como robots.txt en la raíz del origen web cuya política de rastreo describe.

¿Qué URL de sitemap se admite?

El sitemap debe tener una URL absoluta válida que utilice HTTP o HTTPS.

¿Cuánto cuesta la API?

La API cuesta $0.002 por solicitud. La versión para navegador está disponible gratis en esta página.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/web/robots-txt-generate

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, por email y desde Telegram — y pronto también desde nuestra app.

curl -X POST https://api.kit.forhosting.com/web/robots-txt-generate \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"rules":[{"user_agent":"*","directive":"allow","path":"/"},{"user_agent":"*","directive":"disallow","path":"/private/"},{"user_agent":"ResearchBot","directive":"disallow","path":"/"}],"sitemap_url":"https://example.com/sitemap.xml"}'
{
  "rules": [
    {
      "user_agent": "*",
      "directive": "allow",
      "path": "/"
    },
    {
      "user_agent": "*",
      "directive": "disallow",
      "path": "/private/"
    },
    {
      "user_agent": "ResearchBot",
      "directive": "disallow",
      "path": "/"
    }
  ],
  "sitemap_url": "https://example.com/sitemap.xml"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.robots_txt_generate",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

timeout_sec30
max_crawl_pages25
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →