Padroneggiare FlyCrawl: Opzioni, RAG e vettori
Scopri come ciascun parametro alimenta l'estrazione AI ad alta velocità, come gli incorporamenti 1536-dim e 3072-dim trasformano le pagine web grezze in database vettoriali e come funziona la determinazione trasparente dei prezzi del credito.
🚀 5 passaggi da qualsiasi pagina Web ai vettori ad alta dimensione
Fai clic su ciascun passaggio riportato di seguito per esaminare la procedura dettagliata visiva interattiva e i modelli.
Inserisci l'URL di destinazione o scegli tra oltre 200 benchmark
In FlyCrawl non sei mai limitato. Puoi incollare qualsiasi moderna applicazione a pagina singola (React, Vue, Next.js), portale di documentazione, catalogo di e-commerce o sito Web di notizie. Per una valutazione rapida degli ospiti senza effettuare l'accesso, fai clic su uno qualsiasi dei 200 chip di benchmark selezionati (Wikipedia, GitHub, Stripe, BBC, ecc.).
Configura profondità di scansione, limiti e targeting geografico proxy
Personalizza il comportamento del crawler in base al tuo obiettivo: se desideri una singola pagina veloce o un intero sito di documentazione. Seleziona tra Fit-Markdown (token puliti per LLM) o JSON (formato strutturato con metadati).
- Profondità 0: Estratto di una sola pagina (il più veloce, consuma 1 credito).
- Profondità 1-3: Crawler di rete ricorsivo che segue tutti i collegamenti interni.
- Rappresentante del paese: Ruota gli IP residenziali di Stati Uniti, Germania, Regno Unito, Francia e Giappone per sconfiggere i blocchi Cloudflare/DataDome.
Abilita RAG Chunking e scegli il tuo modello vettoriale
Attiva l'interruttore Smart Chunking e Vector per convertire il testo estratto in vettori matematici pronti per la ricerca. Il nostro blocco intelligente si divide per tag di intestazione (#, ##, ###) mantenendo la sovrapposizione del contesto.
- ⚡ FlyCrawl Native (1536-dim): Vettorizzatore coseno in memoria a costo zero, fulmineo da 10 ms.
- 🔥 FlyCrawl Native Large (3072-dim): Risoluzione semantica ultra-dimensionale (gratuita).
- 🟢 OpenAI text-embedding-3-small (1536-dim): Incorporamento OpenAI standard del settore.
- 🚀 OpenAI text-embedding-3-large (3072-dim): La massima precisione di riferimento MTEB al mondo.
Esegui scrape e guarda calcoli di credito trasparenti in tempo reale
Fare clic su Esegui scraping. La barra dei prezzi dinamica di FlyCrawl calcola i costi esatti in anticipo senza sorprese: 1 credito per pagina base + crediti aggiuntivi per incorporamenti vettoriali. Se la scansione fallisce o viene bloccata dalla destinazione, verranno detratti esattamente 0 crediti.
Esporta in 1 clic in Pinecone, Qdrant e JSONL
Una volta terminata la scansione, fai clic su "Copia payload vettoriale". Gli appunti vengono caricati istantaneamente con vettori JSON preformattati (array di valori, metadati di blocchi, URL di origine e sezione di intestazione) perfettamente formattati per Pinecone, Qdrant, ChromaDB o pgvector. Puoi anche esportare il set di dati completo come JSONL.
{
"upsert_request": {
"namespace": "flycrawl-production",
"model": "text-embedding-3-large",
"dimensions": 3072,
"vectors": [
{
"id": "vec_1725368400_1",
"values": [0.0142, -0.0381, ... 3072 floats],
"metadata": {
"source": "https://en.wikipedia.org/wiki/AI",
"section": "Machine Learning",
"engine": "FlyCrawl High-Dim Engine"
}
}
]
}
}
Spiegazione di ogni opzione Playground e API
Analisi dettagliata delle funzioni di ciascun interruttore, del motivo per cui è importante e dell'impatto sul consumo di credito.
Profondità di scansione (crawler di link ricorsivo)
La profondità 0 raschia rigorosamente l'URL specificato. La profondità 1 analizza la pagina, scopre tutti i collegamenti ipertestuali interni appartenenti allo stesso dominio e li estrae fino al limite della pagina. Le profondità 2 e 3 continuano la traversata degli alberi.
Limite di pagine e budget di concorrenza
Limita il numero massimo di pagine estratte durante una singola sessione di scansione. Eseguito con 4 operatori in background ad alte prestazioni simultanei per garantire un throughput eccezionale senza far scattare i limiti di velocità del server.
Targeting geografico per paese e bypass anti-bot
Instrada la scansione attraverso proxy residenziali aziendali nel Paese selezionato. Fondamentale per i siti Web con paywall geografici, valute regionali o rigorose sfide Cloudflare/DataDome.
Motore Fit-Markdown rispetto a JSON
Elimina il 95% della spazzatura HTML, degli stili in linea, dei tracker e del disordine della navigazione. Fornisce intestazioni semantiche, tabelle, collegamenti puliti ed elenchi che consumano fino all'80% in meno di token in Claude e GPT-4.
Chunking intelligente delle intestazioni semantiche
Invece di affettare i caratteri in modo stupido, FlyCrawl comprende i titoli di markdown (#, ##, ###) e partiziona i paragrafi in modo naturale. La sovrapposizione scorrevole garantisce che nessun confine semantico venga tagliato a metà.
Modelli Vector (1536-dim e 3072-dim Large)
Scegli tra FlyCrawl Native Fast (1536-dim, costo zero), Native Large (3072-dim) o i modelli ufficiali OpenAI text-embedding-3. Genera vettori float normalizzati matematicamente pronti per la similarità del coseno.
Raschiare con incorporamenti vettoriali in 3 righe di codice
Compatibile con Python, LangChain, LlamaIndex, Cursor e Windsurf.
import requests
response = requests.post(
"https://flycrawl.net/api/v1/scrape",
headers={"Authorization": "Bearer fly_live_your_api_key"},
json={
"url": "https://en.wikipedia.org/wiki/Artificial_intelligence",
"formats": ["markdown", "embeddings"],
"embeddings": {
"model": "text-embedding-3-large",
"dimensions": 3072
}
}
)
data = response.json()
print(f"Extracted {len(data['chunks'])} chunks with 3072-dim vectors!")
Pronti a provarlo dal vivo?
Apri il Playground interattivo, testa qualsiasi sito web o benchmark e osserva il Fit-Markdown pulito e i vettori ad alta luminosità generati in tempo reale.