Crawl
¿Eres un agente de IA que necesita una clave de API de Firecrawl? Consulta firecrawl.dev/agent-onboarding/SKILL.md para obtener instrucciones para la incorporación automatizada.
Autorizaciones
Bearer authentication header of the form Bearer <token>, where <token> is your auth token.
Cuerpo
La URL base desde la que se iniciará el rastreo
Permite que el rastreador siga enlaces a sitios web externos. Los enlaces externos se siguen con un solo salto (no se rastrean los enlaces encontrados en esas páginas externas). Los enlaces que apuntan a la página de inicio de un sitio externo (una URL raíz sin ruta) se omiten y se informan en Get Crawl Errors con el código EXTERNAL_LINK; las redirecciones a una página de inicio externa se omiten por el mismo motivo.
Permite que el rastreador siga enlaces a subdominios del dominio principal.
Permite que el crawler siga enlaces internos a URLs hermanas o padre, no solo rutas hijas.
false: Solo rastrea URLs más profundas (hijas). → p. ej. /features/feature-1 → /features/feature-1/tips ✅ → No seguirá /pricing ni / ❌
true: Rastrea cualquier enlace interno, incluidos hermanos y padres. → p. ej. /features/feature-1 → /pricing, /, etc. ✅
Usa true para lograr una cobertura interna más amplia, más allá de las rutas anidadas.
Retraso, en segundos, entre scrapes. Esto ayuda a respetar los límites de tasa del sitio web. Al configurar esto, la concurrencia se fuerza a 1.
Patrones de expresiones regulares para las rutas (pathname) de URL que excluyen del rastreo las URLs que coincidan con ellos. Por ejemplo, si configuras "excludePaths": ["blog/.*"] para la URL base firecrawl.dev, se excluirán todos los resultados que coincidan con ese patrón, como https://www.firecrawl.dev/blog/firecrawl-launch-week-1-recap. Los patrones usan sintaxis de expresiones regulares de Rust (estilo RE2): no se admiten las aserciones de anticipación ni retrospección ni las referencias inversas, y se rechaza con un 400 cualquier patrón que no se compile. Cada campo acepta como máximo 1000 patrones de hasta 2000 caracteres cada uno, y includePaths y excludePaths juntos pueden contener como máximo 1000 patrones y 100.000 caracteres en total. Para el filtrado por palabras clave, envía un patrón corto por término en lugar de combinar términos en una única alternancia larga.
10002000No vuelvas a scrapear la misma ruta con distintos parámetros de consulta (o sin parámetros)
Ignora las reglas de robots.txt del sitio web. Solo disponible para Enterprise; contacta con support@firecrawl.com para habilitarlo.
Patrones de expresión regular de rutas de URL que incluyen URLs coincidentes en el rastreo. Solo las rutas que coincidan con los patrones especificados se incluirán en la respuesta. Nota: la URL inicial también se comprueba con estos patrones; si no coincide, el rastreo puede devolver 0 páginas. Por ejemplo, si configuras "includePaths": ["blog/.*"] para la URL base firecrawl.dev/blog, solo se incluirán en los resultados las páginas bajo /blog/, como https://www.firecrawl.dev/blog/firecrawl-launch-week-1-recap. Los patrones usan sintaxis de expresión regular de Rust (estilo RE2): no se admiten aserciones de anticipación y retrospección ni referencias inversas, y se rechaza con un 400 cualquier patrón que no se compile. Cada campo acepta como máximo 1000 patrones de hasta 2000 caracteres cada uno, y includePaths y excludePaths juntos pueden contener como máximo 1000 patrones y 100.000 caracteres en total. Para el filtrado por palabras clave, envía un patrón corto por término en lugar de combinar términos en una única alternancia larga.
10002000Número máximo de páginas a rastrear. El límite por defecto es 10.000.
Número máximo de scrapes simultáneos. Este parámetro te permite establecer un límite de concurrencia para este rastreo. Si no se especifica, el rastreo respeta el límite de concurrencia de tu equipo.
Profundidad máxima de rastreo basada en el orden de descubrimiento. El sitio raíz y las páginas incluidas en el sitemap tienen una profundidad de descubrimiento de 0. Por ejemplo, si la estableces en 1 y configuras sitemap: 'skip', solo se rastreará la URL introducida y todas las URL que estén enlazadas en esa página.
Un prompt que se usa para generar las opciones del crawler (todos los parámetros que se indican a continuación) a partir de lenguaje natural. Los parámetros establecidos explícitamente tendrán prioridad sobre los equivalentes generados.
Cuando su valor es true, los patrones de expresiones regulares (regex) de includePaths y excludePaths se comparan con la URL completa (incluidos los parámetros de consulta), en lugar de solo con el pathname de la URL. Resulta útil cuando necesitas filtrar URLs en función de los parámetros de consulta.
Cadena User-Agent personalizada para evaluar robots.txt. Cuando se configura, robots.txt se obtiene con este User-Agent y las reglas de allow/disallow se aplican en función de él en lugar del predeterminado. Solo disponible para Enterprise; contacta con support@firecrawl.com para habilitarlo.
Modo de sitemap al rastrear. Si lo configuras en "skip", el crawler ignorará el sitemap del sitio web y solo rastreará la URL indicada y descubrirá páginas a partir de ahí. Si lo configuras en "only", el crawler solo rastreará las URLs del sitemap (más la URL inicial) y no descubrirá enlaces desde el HTML.
skip, include, only Un objeto de especificación de webhook.
Si se establece en true, se desactivará la retención de datos para este rastreo. Para habilitar esta función, póngase en contacto con help@firecrawl.dev

