Dominar FlyCrawl: opciones, RAG y vectores
Descubra cómo cada parámetro impulsa la extracción de IA de alta velocidad, cómo las incrustaciones de 1536-dim y 3072-dim transforman páginas web sin formato en bases de datos vectoriales y cómo funcionan los precios de crédito transparentes.
🚀 5 pasos desde cualquier página web hasta vectores de alta intensidad
Haga clic en cada paso a continuación para inspeccionar el recorrido visual interactivo y las maquetas.
Ingrese la URL de destino o elija entre más de 200 puntos de referencia
En FlyCrawl, nunca estás restringido. Puede pegar cualquier aplicación moderna de una sola página (React, Vue, Next.js), portal de documentación, catálogo de comercio electrónico o sitio web de noticias. Para una evaluación rápida de los invitados sin iniciar sesión, haga clic en cualquiera de los 200 chips de referencia seleccionados (Wikipedia, GitHub, Stripe, BBC, etc.).
Configurar la profundidad de rastreo, los límites y la orientación geográfica del proxy
Personalice el comportamiento del rastreador según su objetivo: si desea una única página rápida o un sitio de documentación completo. Seleccione entre Fit-Markdown (tokens limpios para LLM) o JSON (formato estructurado con metadatos).
- Profundidad 0: Extracto de una sola página (el más rápido, consume 1 crédito).
- Profundidad 1-3: Rastreador de red recursivo que sigue todos los enlaces internos.
- Proxy de país: Rota IP residenciales de EE. UU., Alemania, Reino Unido, Francia y Japón para superar los bloqueos de Cloudflare/DataDome.
Habilite RAG Chunking y elija su modelo vectorial
Active el interruptor Smart Chunking & Vector para convertir el texto extraído en vectores matemáticos listos para buscar. Nuestro fragmentador inteligente divide por etiquetas de encabezado (#, ##, ###) manteniendo la superposición del contexto.
- ⚡ FlyCrawl Native (1536-dim): Vectorizador de coseno en memoria de 10 ms, de costo cero.
- 🔥 FlyCrawl Native Large (3072-dim): Resolución semántica de dimensiones ultraaltas (Gratis).
- 🟢 OpenAI text-embedding-3-small (1536-dim): Integración de OpenAI estándar de la industria.
- 🚀 OpenAI text-embedding-3-large (3072-dim): La precisión de referencia MTEB más alta del mundo.
Ejecute Scrape & Watch cálculos de crédito transparentes en vivo
Haga clic en Ejecutar raspado. La barra de precios dinámica de FlyCrawl calcula los costos exactos por adelantado sin sorpresas: 1 crédito por página base + créditos adicionales para incrustaciones de vectores. Si el rastreo falla o el destino lo bloquea, se deducen exactamente 0 créditos.
Exportar con 1 clic a Pinecone, Qdrant y JSONL
Una vez que finalice el rastreo, haga clic en "Copiar carga útil de vector". El portapapeles se carga instantáneamente con vectores JSON preformateados (matriz de valores, metadatos de fragmentos, URL de origen y sección de encabezado) perfectamente formateados para Pinecone, Qdrant, ChromaDB o pgvector. También puede exportar el conjunto de datos completo como JSONL.
{
"upsert_request": {
"namespace": "flycrawl-production",
"model": "text-embedding-3-large",
"dimensions": 3072,
"vectors": [
{
"id": "vec_1725368400_1",
"values": [0.0142, -0.0381, ... 3072 floats],
"metadata": {
"source": "https://en.wikipedia.org/wiki/AI",
"section": "Machine Learning",
"engine": "FlyCrawl High-Dim Engine"
}
}
]
}
}
Cada opción de Playground y API explicada
Desglose detallado de lo que hace cada palanca, por qué es importante y cómo afecta el consumo de crédito.
Profundidad de rastreo (rastreador de enlaces recursivo)
La profundidad 0 raspa estrictamente la URL proporcionada. La profundidad 1 analiza la página, descubre todos los hipervínculos internos que pertenecen al mismo dominio y los extrae hasta el límite de su página. Las profundidades 2 y 3 continúan el recorrido del árbol.
Límite de páginas y presupuesto de simultaneidad
Limita el número máximo de páginas extraídas durante una única sesión de rastreo. Ejecutado con 4 trabajadores en segundo plano de alto rendimiento simultáneos para garantizar un rendimiento ultrarrápido sin disparar los límites de velocidad del servidor.
Orientación geográfica por país y omisión anti-bot
Enruta el rastreo a través de servidores proxy residenciales empresariales en el país seleccionado. Crucial para sitios web con muros de pago geográficos, monedas regionales o desafíos estrictos de Cloudflare/DataDome.
Motor Fit-Markdown frente a JSON
Elimina el 95% de la basura HTML, los estilos en línea, los rastreadores y el desorden de navegación. Ofrece encabezados semánticos, tablas, enlaces limpios y listas que consumen hasta un 80% menos de tokens en Claude y GPT-4.
Fragmentación de encabezados semánticos inteligentes
En lugar de dividir caracteres tontos, FlyCrawl comprende los encabezados de rebajas (#, ##, ###) y divide los párrafos de forma natural. La superposición deslizante garantiza que ningún límite semántico se corte por la mitad.
Modelos vectoriales (1536 atenuados y 3072 atenuados grandes)
Elija entre los modelos FlyCrawl Native Fast (1536-dim, costo cero), Native Large (3072-dim) u oficial OpenAI con incrustación de texto-3. Genera vectores flotantes normalizados matemáticamente listos para la similitud del coseno.
Scrape con incrustaciones de vectores en 3 líneas de código
Compatible con Python, LangChain, LlamaIndex, Cursor y Windsurf.
import requests
response = requests.post(
"https://flycrawl.net/api/v1/scrape",
headers={"Authorization": "Bearer fly_live_your_api_key"},
json={
"url": "https://en.wikipedia.org/wiki/Artificial_intelligence",
"formats": ["markdown", "embeddings"],
"embeddings": {
"model": "text-embedding-3-large",
"dimensions": 3072
}
}
)
data = response.json()
print(f"Extracted {len(data['chunks'])} chunks with 3072-dim vectors!")
¿Listo para probarlo en vivo?
Abra el patio de juegos interactivo, pruebe cualquier sitio web o punto de referencia y vea el Fit-Markdown limpio y los vectores de alta atenuación generados en tiempo real.