🎓 GUÍA OFICIAL DE LA PLATAFORMA Y RECORRIDO VISUAL

Dominar FlyCrawl: opciones, RAG y vectores

Descubra cómo cada parámetro impulsa la extracción de IA de alta velocidad, cómo las incrustaciones de 1536-dim y 3072-dim transforman páginas web sin formato en bases de datos vectoriales y cómo funcionan los precios de crédito transparentes.

Área de juegos abierta en vivo 📖 API REST y SDK 🎯 Soluciones de IA y SEO

🚀 5 pasos desde cualquier página web hasta vectores de alta intensidad

Haga clic en cada paso a continuación para inspeccionar el recorrido visual interactivo y las maquetas.

PASO 1

Ingrese la URL de destino o elija entre más de 200 puntos de referencia

En FlyCrawl, nunca estás restringido. Puede pegar cualquier aplicación moderna de una sola página (React, Vue, Next.js), portal de documentación, catálogo de comercio electrónico o sitio web de noticias. Para una evaluación rápida de los invitados sin iniciar sesión, haga clic en cualquiera de los 200 chips de referencia seleccionados (Wikipedia, GitHub, Stripe, BBC, etc.).

💡 Consejo profesional: FlyCrawl antepone automáticamente https:// y elimina los parámetros UTM de seguimiento para que siempre obtenga la página canónica impecable.
https://flycrawl.net/#playground
URL del sitio web objetivo:
🌐 https://en.wikipedia.org/wiki/Artificial_intelligence SSL Valid
Puntos de referencia de tendencias rápidas:
Wikipedia ⚡ GitHub Docs Stripe API BBC News
PASO 2

Configurar la profundidad de rastreo, los límites y la orientación geográfica del proxy

Personalice el comportamiento del rastreador según su objetivo: si desea una única página rápida o un sitio de documentación completo. Seleccione entre Fit-Markdown (tokens limpios para LLM) o JSON (formato estructurado con metadatos).

  • Profundidad 0: Extracto de una sola página (el más rápido, consume 1 crédito).
  • Profundidad 1-3: Rastreador de red recursivo que sigue todos los enlaces internos.
  • Proxy de país: Rota IP residenciales de EE. UU., Alemania, Reino Unido, Francia y Japón para superar los bloqueos de Cloudflare/DataDome.
Parámetros del rastreador
Depth 1 (Page + Internal Links)
5 Pages (Parallel Workers)
🇺🇸 United States (Cloudflare Bypass)
Markdown (Fit-Tokens)
PASO 3

Habilite RAG Chunking y elija su modelo vectorial

Active el interruptor Smart Chunking & Vector para convertir el texto extraído en vectores matemáticos listos para buscar. Nuestro fragmentador inteligente divide por etiquetas de encabezado (#, ##, ###) manteniendo la superposición del contexto.

📐 Modelos de integración disponibles:
  • ⚡ FlyCrawl Native (1536-dim): Vectorizador de coseno en memoria de 10 ms, de costo cero.
  • 🔥 FlyCrawl Native Large (3072-dim): Resolución semántica de dimensiones ultraaltas (Gratis).
  • 🟢 OpenAI text-embedding-3-small (1536-dim): Integración de OpenAI estándar de la industria.
  • 🚀 OpenAI text-embedding-3-large (3072-dim): La precisión de referencia MTEB más alta del mundo.
Configuración de RAG y vectores
🧠 Fragmentación inteligente y vectores ENABLED
Chunk Size: 500 chars | Overlap: 50 chars
SELECTED MODEL:
🚀 OpenAI text-embedding-3-large 3072 Dimensions
PASO 4

Ejecute Scrape & Watch cálculos de crédito transparentes en vivo

Haga clic en Ejecutar raspado. La barra de precios dinámica de FlyCrawl calcula los costos exactos por adelantado sin sorpresas: 1 crédito por página base + créditos adicionales para incrustaciones de vectores. Si el rastreo falla o el destino lo bloquea, se deducen exactamente 0 créditos.

🛡️ Garantía de cero fugas ⚡ Velocidad inferior a un segundo
Monitor de crédito en vivo
💎 Costo: 1 crédito (¡1 página + vector 3072-dim incluido gratis!)
🟢 Ready
Balance: 500 Credits ➔ After Crawl: 499 Credits
PASO 5

Exportar con 1 clic a Pinecone, Qdrant y JSONL

Una vez que finalice el rastreo, haga clic en "Copiar carga útil de vector". El portapapeles se carga instantáneamente con vectores JSON preformateados (matriz de valores, metadatos de fragmentos, URL de origen y sección de encabezado) perfectamente formateados para Pinecone, Qdrant, ChromaDB o pgvector. También puede exportar el conjunto de datos completo como JSONL.

🌲 Pinecone Ready ⚡ Qdrant Ready 🌈 ChromaDB Ready 🐘 pgvector Ready
JSON Upsert Payload (3072 Dimensions)
{
  "upsert_request": {
    "namespace": "flycrawl-production",
    "model": "text-embedding-3-large",
    "dimensions": 3072,
    "vectors": [
      {
        "id": "vec_1725368400_1",
        "values": [0.0142, -0.0381, ... 3072 floats],
        "metadata": {
          "source": "https://en.wikipedia.org/wiki/AI",
          "section": "Machine Learning",
          "engine": "FlyCrawl High-Dim Engine"
        }
      }
    ]
  }
}
📋 MATRIZ COMPLETA DE FUNCIONES Y GLOSARIO DE PARÁMETROS

Cada opción de Playground y API explicada

Desglose detallado de lo que hace cada palanca, por qué es importante y cómo afecta el consumo de crédito.

🕸️ Param: depth (0 - 3)

Profundidad de rastreo (rastreador de enlaces recursivo)

La profundidad 0 raspa estrictamente la URL proporcionada. La profundidad 1 analiza la página, descubre todos los hipervínculos internos que pertenecen al mismo dominio y los extrae hasta el límite de su página. Las profundidades 2 y 3 continúan el recorrido del árbol.

💰 Costo: 1 crédito por página extraída.
📄 Param: limit (1 - 50,000)

Límite de páginas y presupuesto de simultaneidad

Limita el número máximo de páginas extraídas durante una única sesión de rastreo. Ejecutado con 4 trabajadores en segundo plano de alto rendimiento simultáneos para garantizar un rendimiento ultrarrápido sin disparar los límites de velocidad del servidor.

💰 Costo: deducido estrictamente según las páginas reales rastreadas.
🌍 Param: country (US, DE, GB, FR, JP)

Orientación geográfica por país y omisión anti-bot

Enruta el rastreo a través de servidores proxy residenciales empresariales en el país seleccionado. Crucial para sitios web con muros de pago geográficos, monedas regionales o desafíos estrictos de Cloudflare/DataDome.

💰 Coste: Incluido gratis en todas las extracciones.
📑 Param: format (markdown, json)

Motor Fit-Markdown frente a JSON

Elimina el 95% de la basura HTML, los estilos en línea, los rastreadores y el desorden de navegación. Ofrece encabezados semánticos, tablas, enlaces limpios y listas que consumen hasta un 80% menos de tokens en Claude y GPT-4.

💰 Costo: 1 base de crédito.
🧠 Param: chunkSize & overlap

Fragmentación de encabezados semánticos inteligentes

En lugar de dividir caracteres tontos, FlyCrawl comprende los encabezados de rebajas (#, ##, ###) y divide los párrafos de forma natural. La superposición deslizante garantiza que ningún límite semántico se corte por la mitad.

💰 Costo: 100% Gratis e incluido con cada raspado.
🚀 Param: model (native, large)

Modelos vectoriales (1536 atenuados y 3072 atenuados grandes)

Elija entre los modelos FlyCrawl Native Fast (1536-dim, costo cero), Native Large (3072-dim) u oficial OpenAI con incrustación de texto-3. Genera vectores flotantes normalizados matemáticamente listos para la similitud del coseno.

💰 Costo: Nativo (1536 y 3072) es 100% GRATIS en scrape. Independiente: 1 Cr por 25-50 textos. OpenAI: +1 a +2 Cr (o GRATIS con tu propia clave).
💻 INTEGRACIÓN DEL DESARROLLADOR

Scrape con incrustaciones de vectores en 3 líneas de código

Compatible con Python, LangChain, LlamaIndex, Cursor y Windsurf.

# Python 3: Scrape web page directly into 3072-dim Vector Embeddings
import requests

response = requests.post(
    "https://flycrawl.net/api/v1/scrape",
    headers={"Authorization": "Bearer fly_live_your_api_key"},
    json={
        "url": "https://en.wikipedia.org/wiki/Artificial_intelligence",
        "formats": ["markdown", "embeddings"],
        "embeddings": {
            "model": "text-embedding-3-large",
            "dimensions": 3072
        }
    }
)
data = response.json()
print(f"Extracted {len(data['chunks'])} chunks with 3072-dim vectors!")

¿Listo para probarlo en vivo?

Abra el patio de juegos interactivo, pruebe cualquier sitio web o punto de referencia y vea el Fit-Markdown limpio y los vectores de alta atenuación generados en tiempo real.

🚀 Ir al patio de juegos en vivo 🎁 Regístrese (obtenga 100 créditos gratis)