掌握 FlyCrawl:选项、RAG 和向量
了解每个参数如何支持高速 AI 提取、1536 维和 3072 维嵌入如何将原始网页转换为矢量数据库,以及透明的信用定价如何运作。
🚀 从任何网页到高亮度矢量的 5 个步骤
单击下面的每个步骤以检查交互式视觉演练和模型。
输入目标 URL 或从 200 多个基准中选择
在 FlyCrawl 中,您永远不会受到限制。您可以粘贴任何现代单页应用程序(React、Vue、Next.js)、文档门户、电子商务目录或新闻网站。要在不登录的情况下快速进行访客评估,请单击 200 个精选基准芯片中的任意一个(维基百科、GitHub、Stripe、BBC 等)。
配置抓取深度、限制和代理地理定位
根据您的目标自定义爬网程序的行为方式:您是想要单个快速页面还是整个文档站点。在 Fit-Markdown(LLM 的干净标记)或 JSON(带有元数据的结构化格式)之间进行选择。
- 深度 0: 单页摘录(最快,消耗 1 个学分)。
- 深度1-3: 递归网络爬虫跟踪所有内部链接。
- 国家代理: 轮换来自美国、德国、英国、法国和日本的住宅 IP 以击败 Cloudflare/DataDome 区块。
启用 RAG 分块并选择您的矢量模型
切换智能分块和向量开关,将提取的文本转换为可供搜索的数学向量。我们的智能分块器按标题标签(#、##、###)进行拆分,同时保持上下文重叠。
- ⚡ FlyCrawl Native (1536-dim): 零成本、闪电 10 毫秒内存余弦矢量化器。
- 🔥 FlyCrawl Native Large (3072-dim): 超高维语义解析(免费)。
- 🟢 OpenAI text-embedding-3-small (1536-dim): 行业标准 OpenAI 嵌入。
- 🚀 OpenAI text-embedding-3-large (3072-dim): 全球最高的 MTEB 基准精度。
执行抓取并观看实时透明信用计算
单击运行抓取。 FlyCrawl 的动态定价栏可预先计算准确的成本,零意外:每个基页 1 个积分 + 用于矢量嵌入的额外积分。如果抓取失败或被目的地阻止,则扣除 0 积分。
一键导出到 Pinecone、Qdrant 和 JSONL
爬网完成后,单击“复制矢量有效负载”。剪贴板会立即加载预格式化的 JSON 矢量(值数组、块元数据、源 URL 和标头部分),这些矢量的格式完美适合 Pinecone、Qdrant、ChromaDB 或 pgvector。您还可以将完整数据集导出为 JSONL。
{
"upsert_request": {
"namespace": "flycrawl-production",
"model": "text-embedding-3-large",
"dimensions": 3072,
"vectors": [
{
"id": "vec_1725368400_1",
"values": [0.0142, -0.0381, ... 3072 floats],
"metadata": {
"source": "https://en.wikipedia.org/wiki/AI",
"section": "Machine Learning",
"engine": "FlyCrawl High-Dim Engine"
}
}
]
}
}
每个 Playground 和 API 选项的解释
详细分析每个开关的作用、其重要性以及它如何影响信贷消费。
爬行深度(递归链接爬虫)
深度 0 严格抓取给定的 URL。深度 1 解析页面,发现属于同一域的所有内部超链接,并将它们提取到您的页面限制。深度 2 和 3 继续树遍历。
页数限制和并发预算
限制在单个爬网会话期间提取的最大页面数。由 4 个并发高性能后台工作人员执行,以确保闪电吞吐量,而不会超出服务器速率限制。
国家/地区地理定位和反机器人绕过
通过选定国家/地区的企业住宅代理路由爬网。对于具有地理付费墙、区域货币或严格的 Cloudflare/DataDome 挑战的网站至关重要。
Fit-Markdown 引擎与 JSON
消除 95% 的 HTML 垃圾、内联样式、跟踪器和导航混乱。提供语义标题、表格、干净链接和列表,在 Claude 和 GPT-4 中消耗的标记最多减少 80%。
智能语义标头分块
FlyCrawl 不是愚蠢的字符切片,而是理解 Markdown 标题(#、##、###)并自然地划分段落。滑动重叠确保语义边界不会被切成两半。
矢量模型(1536 维和 3072 维大)
在 FlyCrawl Native Fast(1536-dim,零成本)、Native Large(3072-dim)或官方 OpenAI text-embedding-3 模型之间进行选择。输出标准化浮点向量,在数学上为余弦相似度做好准备。
用 3 行代码进行向量嵌入的抓取
兼容 Python、LangChain、LlamaIndex、Cursor 和 Windsurf。
import requests
response = requests.post(
"https://flycrawl.net/api/v1/scrape",
headers={"Authorization": "Bearer fly_live_your_api_key"},
json={
"url": "https://en.wikipedia.org/wiki/Artificial_intelligence",
"formats": ["markdown", "embeddings"],
"embeddings": {
"model": "text-embedding-3-large",
"dimensions": 3072
}
}
)
data = response.json()
print(f"Extracted {len(data['chunks'])} chunks with 3072-dim vectors!")
准备好现场测试了吗?
打开交互式 Playground,测试任何网站或基准测试,并查看实时生成的干净的 Fit-Markdown 和高亮度矢量。