Освоение FlyCrawl: параметры, RAG и векторы
Узнайте, как каждый параметр обеспечивает высокоскоростное извлечение данных с помощью искусственного интеллекта, как встраивания 1536 и 3072 пикселей преобразуют необработанные веб-страницы в векторные базы данных и как работает прозрачное ценообразование по кредитам.
🚀 5 шагов от любой веб-страницы к векторам высокой яркости
Нажмите на каждый шаг ниже, чтобы просмотреть интерактивное визуальное пошаговое руководство и макеты.
Введите целевой URL или выберите один из более чем 200 тестов
В FlyCrawl вас никогда не ограничивают. Вы можете вставить любое современное одностраничное приложение (React, Vue, Next.js), портал документации, каталог электронной коммерции или новостной сайт. Для быстрой гостевой оценки без входа в систему щелкните любой из 200 тестовых чипов (Wikipedia, GitHub, Stripe, BBC и т. д.).
Настройка глубины сканирования, ограничений и прокси-геотаргетинга
Настройте поведение сканера в зависимости от вашей цели: хотите ли вы одну быструю страницу или целый сайт документации. Выбирайте между Fit-Markdown (чистые токены для LLM) или JSON (структурированный формат с метаданными).
- Глубина 0: Извлечение одной страницы (самое быстрое, потребляет 1 кредит).
- Глубина 1-3: Рекурсивный сетевой сканер, отслеживающий все внутренние ссылки.
- Прокси страны: Меняет жилые IP-адреса из США, Германии, Великобритании, Франции и Японии, чтобы обойти блокировки Cloudflare/DataDome.
Включите разделение RAG и выберите векторную модель
Переключите переключатель Smart Chunking & Vector, чтобы преобразовать извлеченный текст в готовые для поиска математические векторы. Наш интеллектуальный блокировщик разбивается по тегам заголовков (#, ##, ###), сохраняя при этом перекрытие контекста.
- ⚡ FlyCrawl Native (1536-dim): Нулевая стоимость, молниеносный векторизатор косинуса в памяти за 10 мс.
- 🔥 FlyCrawl Native Large (3072-dim): Сверхвысокое семантическое разрешение (бесплатно).
- 🟢 OpenAI text-embedding-3-small (1536-dim): Встраивание OpenAI в соответствии с отраслевым стандартом.
- 🚀 OpenAI text-embedding-3-large (3072-dim): Высочайшая в мире точность эталонного теста MTEB.
Выполняйте Scrape и наблюдайте за прозрачными кредитными расчетами в реальном времени
Нажмите «Запустить очистку». Динамическая ценовая панель FlyCrawl заранее рассчитывает точные затраты без каких-либо сюрпризов: 1 кредит за базовую страницу + дополнительные кредиты за векторное встраивание. Если сканирование не удается или блокируется пунктом назначения, из него вычитается ровно 0 кредитов.
Экспорт в 1 клик в шишку, Qdrant и JSONL
После завершения сканирования нажмите «Копировать векторную полезную нагрузку». В буфер обмена мгновенно загружаются предварительно отформатированные векторы JSON (массив значений, метаданные фрагмента, исходный URL-адрес и раздел заголовка), идеально отформатированные для Pinecone, Qdrant, ChromaDB или pgvector. Вы также можете экспортировать полный набор данных в формате JSONL.
{
"upsert_request": {
"namespace": "flycrawl-production",
"model": "text-embedding-3-large",
"dimensions": 3072,
"vectors": [
{
"id": "vec_1725368400_1",
"values": [0.0142, -0.0381, ... 3072 floats],
"metadata": {
"source": "https://en.wikipedia.org/wiki/AI",
"section": "Machine Learning",
"engine": "FlyCrawl High-Dim Engine"
}
}
]
}
}
Объяснение каждой игровой площадки и опции API
Подробное описание того, что делает каждый переключатель, почему это важно и как оно влияет на потребление кредитов.
Глубина сканирования (рекурсивный сканер ссылок)
Глубина 0 очищает строго заданный URL-адрес. Глубина 1 анализирует страницу, обнаруживает все внутренние гиперссылки, принадлежащие одному домену, и извлекает их до предела вашей страницы. Глубины 2 и 3 продолжают обход дерева.
Ограничение страниц и бюджет параллелизма
Ограничивает максимальное количество страниц, извлекаемых за один сеанс сканирования. Выполняется с участием 4 высокопроизводительных фоновых рабочих процессов, одновременно обеспечивающих молниеносную пропускную способность без превышения ограничений скорости сервера.
Геотаргетинг по стране и обход защиты от ботов
Направляет сканирование через корпоративные резидентные прокси-серверы в выбранной стране. Крайне важно для веб-сайтов с географическим платным доступом, региональными валютами или строгими требованиями Cloudflare/DataDome.
Механизм Fit-Markdown против JSON
Устраняет 95% HTML-мусора, встроенных стилей, трекеров и беспорядка в навигации. Предоставляет семантические заголовки, таблицы, чистые ссылки и списки, которые потребляют до 80 % меньше токенов в Claude и GPT-4.
Умное семантическое разделение заголовков
Вместо тупого разделения символов FlyCrawl понимает заголовки уценки (#, ##, ###) и естественным образом разбивает абзацы. Скользящее перекрытие гарантирует, что семантическая граница не будет разрезана пополам.
Векторные модели (размер 1536 и большой размер 3072)
Выбирайте между FlyCrawl Native Fast (1536-dim, нулевая стоимость), Native Large (3072-dim) или официальными моделями OpenAI с встраиванием текста-3. Выводит нормализованные векторы с плавающей запятой, математически готовые к косинусному подобию.
Scraping с векторными вложениями в 3 строки кода
Совместим с Python, LangChain, LlamaIndex, Cursor и Windsurf.
import requests
response = requests.post(
"https://flycrawl.net/api/v1/scrape",
headers={"Authorization": "Bearer fly_live_your_api_key"},
json={
"url": "https://en.wikipedia.org/wiki/Artificial_intelligence",
"formats": ["markdown", "embeddings"],
"embeddings": {
"model": "text-embedding-3-large",
"dimensions": 3072
}
}
)
data = response.json()
print(f"Extracted {len(data['chunks'])} chunks with 3072-dim vectors!")
Готовы протестировать это вживую?
Откройте интерактивную игровую площадку, протестируйте любой веб-сайт или тест и просмотрите чистые векторы Fit-Markdown и high-dim, созданные в режиме реального времени.