POST /scrape
Web to Markdown
Single-page fast extraction + actions & caching.
POST /map
Site Mapper
Discover all URLs on a domain in <2 seconds.
POST /search
Search & Scrape
Live web search with auto-scraped Markdown results.
POST /extract
LLM Schema Extract
Extract typed JSON data matching any schema.
POST /batch/scrape
Batch Scraper
Scrape 50+ URLs concurrently in parallel.
官方 SDK 与主流开发框架集成
🐍 Python SDK (Official)
🟩 Node.js SDK (TypeScript)
🦜 LangChain Loader
🦙 LlamaIndex Reader
🧠 Python + Pinecone RAG
🗺️ cURL /map
🔍 cURL /search
⚡ cURL /scrape (embeddings)
🤖 OpenAI Client (/v1/embeddings)
# Direct Web-to-Vector Pipeline into Pinecone / Qdrant
from pinecone import Pinecone
from flycrawl import FlyCrawlApp
pc = Pinecone(api_key="YOUR_PINECONE_KEY" )
index = pc.Index("flycrawl-rag" )
fly = FlyCrawlApp(api_key="fly_live_your_key" )
# Single call scrapes, chunks, normalizes, and embeds into 1536-dim vectors:
result = fly.scrape_url("https://docs.flycrawl.net/ai" , params={"formats" : ["embeddings" , "markdown" ]})
# Direct 1-line Upsert:
index.upsert(vectors=result["upsert_request" ]["vectors" ], namespace="production" )
print(f"Successfully ingested {len(result['upsert_request']['vectors'])} vectors ready for semantic search!" )
curl -X POST https://api.flycrawl.net/api/v1/scrape \
-H "Authorization: Bearer fly_live_your_api_key" \
-H "Content-Type: application/json" \
-d '{"url": "https://example.com", "formats": ["embeddings", "markdown"]}'
✨ 100% OpenAI 客户端兼容且定价极其公平: 只需设置 base_url='https://flycrawl.net/v1' 即可使用您的 FlyCrawl 积分,零 KYC,无需外国信用卡,并且 100% 不受制裁的 USDT 加密货币计费。定价:1 个信用额涵盖 50 个文本(1536 维)或 25 个文本(3072 维大)。
# Official Python OpenAI Library Integration
from openai import OpenAI
client = OpenAI(
base_url="https://flycrawl.net/v1" ,
api_key="fly_live_your_api_key"
)
# Direct standalone embedding generation (Native 1536, Native Large 3072, or OpenAI)
response = client.embeddings.create(
model="native-large" , # or "native", "text-embedding-3-small", "text-embedding-3-large"
input=[
"First document chunk for semantic retrieval" ,
"Second paragraph ready for Pinecone / Qdrant"
]
)
for item in response.data:
print(f"Vector {item.index}: {len(item.embedding)} dimensions generated!" )
# pip install flycrawl
from flycrawl import FlyCrawlApp
app = FlyCrawlApp(api_key="fly_live_your_api_key" )
# 1. Scrape with Fit-Markdown & 24h Smart Cache
doc = app.scrape_url("https://example.com" , params={"format" : "markdown" , "maxAge" : 86400})
print(doc["content" ])
# 2. Fast Site Mapping (<2s)
sitemap = app.map_url("https://example.com" , params={"limit" : 1000})
print(f"Discovered {sitemap['total_links']} URLs" )
# 3. Live Web Search & Auto-Scrape
search_results = app.search("latest LLM reasoning benchmarks" , limit=5)
for res in search_results["results" ]:
print(res["title" ], res["url" ])
// npm install flycrawl
import { FlyCrawlApp } from 'flycrawl';
const app = new FlyCrawlApp({ apiKey: 'fly_live_your_api_key' });
// 1. Scrape with browser actions
const res = await app.scrapeUrl('https://example.com' , {
format: 'markdown' ,
actions: [{ type: 'wait' , milliseconds: 1000 }]
});
console.log(res.content);
// 2. Structured JSON Extract
const data = await app.extract('https://example.com/pricing' , {
prompt: 'Extract all pricing tiers and features'
});
console.log(data.data);
from flycrawl import FlyCrawlLoader
from langchain_text_splitters import MarkdownHeaderTextSplitter
# Load directly as clean LangChain Documents
loader = FlyCrawlLoader(
url="https://example.com" ,
api_key="fly_live_your_key" ,
mode="scrape"
)
docs = loader.load()
splitter = MarkdownHeaderTextSplitter(headers_to_split_on=[("#" , "H1" ), ("##" , "H2" )])
chunks = splitter.split_text(docs[0].page_content)
print(f"Ready for vector ingestion: {len(chunks)} chunks" )
from flycrawl import FlyCrawlReader
from llama_index.core import VectorStoreIndex
reader = FlyCrawlReader(api_key="fly_live_your_key" )
documents = reader.load_data(url="https://example.com" )
index = VectorStoreIndex.from_documents(documents)
query_engine = index.as_query_engine()
response = query_engine.query("What is this website about?" )
print(response)
curl -X POST https://api.flycrawl.net/api/v1/map \
-H "Authorization: Bearer fly_live_your_api_key" \
-H "Content-Type: application/json" \
-d '{"url": "https://example.com", "limit": 1000}'
curl -X POST https://api.flycrawl.net/api/v1/search \
-H "Authorization: Bearer fly_live_your_api_key" \
-H "Content-Type: application/json" \
-d '{"query": "best vector databases comparison", "limit": 5}'
🤖 本机 MCP 服务器 v3.5
模型上下文协议 (MCP) 服务器
JSON-RPC 2.0 Endpoint: /api/v1/mcp
直接将 FlyCrawl 连接为 Cursor IDE、Claude Desktop、Windsurf 或自定义 AI 代理中的本机工具服务器。允许法学硕士一键自动抓取、爬网、搜索和矢量化网络内容。
💻 Cursor IDE
🟣 Claude Desktop
🌊 Windsurf / Cascade
📋 Copy JSON
{
"mcpServers": {
"flycrawl": {
"url": "https://api.flycrawl.net/api/v1/mcp",
"headers": {
"Authorization": "Bearer YOUR_FLYCRAWL_API_KEY"
}
}
}
}
📋 Copy JSON
{
"mcpServers": {
"flycrawl": {
"command": "npx",
"args": [
"-y",
"mcp-remote",
"https://api.flycrawl.net/api/v1/mcp",
"--header",
"Authorization: Bearer YOUR_FLYCRAWL_API_KEY"
]
}
}
}
📋 Copy JSON
{
"mcpServers": {
"flycrawl": {
"serverUrl": "https://api.flycrawl.net/api/v1/mcp",
"headers": {
"Authorization": "Bearer YOUR_FLYCRAWL_API_KEY"
}
}
}
}
flycrawl_vectorize
Web Scrape + Chunk + 1536-dim Embedding
flycrawl_scrape
Ultra-clean Fit-Markdown for LLM prompts
flycrawl_search
Live real-time search with scraped results
flycrawl_crawl
Recursive multi-page deep site crawl