🎓 ОФИЦИАЛЬНОЕ РУКОВОДСТВО ПО ПЛАТФОРМЕ И ВИЗУАЛЬНОЕ ПРОХОЖДЕНИЕ

Освоение FlyCrawl: параметры, RAG и векторы

Узнайте, как каждый параметр обеспечивает высокоскоростное извлечение данных с помощью искусственного интеллекта, как встраивания 1536 и 3072 пикселей преобразуют необработанные веб-страницы в векторные базы данных и как работает прозрачное ценообразование по кредитам.

Открытая живая площадка 📖 REST API и SDK 🎯 Решения для искусственного интеллекта и SEO

🚀 5 шагов от любой веб-страницы к векторам высокой яркости

Нажмите на каждый шаг ниже, чтобы просмотреть интерактивное визуальное пошаговое руководство и макеты.

ШАГ 1

Введите целевой URL или выберите один из более чем 200 тестов

В FlyCrawl вас никогда не ограничивают. Вы можете вставить любое современное одностраничное приложение (React, Vue, Next.js), портал документации, каталог электронной коммерции или новостной сайт. Для быстрой гостевой оценки без входа в систему щелкните любой из 200 тестовых чипов (Wikipedia, GitHub, Stripe, BBC и т. д.).

💡 Совет для профессионалов: FlyCrawl автоматически добавляет https:// и удаляет параметры отслеживания UTM, поэтому вы всегда получаете каноническую нетронутую страницу.
https://flycrawl.net/#playground
URL целевого сайта:
🌐 https://en.wikipedia.org/wiki/Artificial_intelligence SSL Valid
Быстрые индикаторы тенденций:
Wikipedia ⚡ GitHub Docs Stripe API BBC News
ШАГ 2

Настройка глубины сканирования, ограничений и прокси-геотаргетинга

Настройте поведение сканера в зависимости от вашей цели: хотите ли вы одну быструю страницу или целый сайт документации. Выбирайте между Fit-Markdown (чистые токены для LLM) или JSON (структурированный формат с метаданными).

  • Глубина 0: Извлечение одной страницы (самое быстрое, потребляет 1 кредит).
  • Глубина 1-3: Рекурсивный сетевой сканер, отслеживающий все внутренние ссылки.
  • Прокси страны: Меняет жилые IP-адреса из США, Германии, Великобритании, Франции и Японии, чтобы обойти блокировки Cloudflare/DataDome.
Параметры сканера
Depth 1 (Page + Internal Links)
5 Pages (Parallel Workers)
🇺🇸 United States (Cloudflare Bypass)
Markdown (Fit-Tokens)
ШАГ 3

Включите разделение RAG и выберите векторную модель

Переключите переключатель Smart Chunking & Vector, чтобы преобразовать извлеченный текст в готовые для поиска математические векторы. Наш интеллектуальный блокировщик разбивается по тегам заголовков (#, ##, ###), сохраняя при этом перекрытие контекста.

📐 Доступные модели встраивания:
  • ⚡ FlyCrawl Native (1536-dim): Нулевая стоимость, молниеносный векторизатор косинуса в памяти за 10 мс.
  • 🔥 FlyCrawl Native Large (3072-dim): Сверхвысокое семантическое разрешение (бесплатно).
  • 🟢 OpenAI text-embedding-3-small (1536-dim): Встраивание OpenAI в соответствии с отраслевым стандартом.
  • 🚀 OpenAI text-embedding-3-large (3072-dim): Высочайшая в мире точность эталонного теста MTEB.
RAG и векторная конфигурация
🧠 Умное группирование и векторы ENABLED
Chunk Size: 500 chars | Overlap: 50 chars
SELECTED MODEL:
🚀 OpenAI text-embedding-3-large 3072 Dimensions
ШАГ 4

Выполняйте Scrape и наблюдайте за прозрачными кредитными расчетами в реальном времени

Нажмите «Запустить очистку». Динамическая ценовая панель FlyCrawl заранее рассчитывает точные затраты без каких-либо сюрпризов: 1 кредит за базовую страницу + дополнительные кредиты за векторное встраивание. Если сканирование не удается или блокируется пунктом назначения, из него вычитается ровно 0 кредитов.

🛡️ Гарантия нулевой утечки ⚡ Скорость менее секунды
Живой кредитный монитор
💎 Стоимость: 1 кредит (1 страница + вектор 3072-dim включен бесплатно!)
🟢 Ready
Balance: 500 Credits ➔ After Crawl: 499 Credits
ШАГ 5

Экспорт в 1 клик в шишку, Qdrant и JSONL

После завершения сканирования нажмите «Копировать векторную полезную нагрузку». В буфер обмена мгновенно загружаются предварительно отформатированные векторы JSON (массив значений, метаданные фрагмента, исходный URL-адрес и раздел заголовка), идеально отформатированные для Pinecone, Qdrant, ChromaDB или pgvector. Вы также можете экспортировать полный набор данных в формате JSONL.

🌲 Pinecone Ready ⚡ Qdrant Ready 🌈 ChromaDB Ready 🐘 pgvector Ready
JSON Upsert Payload (3072 Dimensions)
{
  "upsert_request": {
    "namespace": "flycrawl-production",
    "model": "text-embedding-3-large",
    "dimensions": 3072,
    "vectors": [
      {
        "id": "vec_1725368400_1",
        "values": [0.0142, -0.0381, ... 3072 floats],
        "metadata": {
          "source": "https://en.wikipedia.org/wiki/AI",
          "section": "Machine Learning",
          "engine": "FlyCrawl High-Dim Engine"
        }
      }
    ]
  }
}
📋 ПОЛНОФУНКЦИОНАЛЬНАЯ МАТРИЦА И ГЛОССАРИЙ ПАРАМЕТРОВ

Объяснение каждой игровой площадки и опции API

Подробное описание того, что делает каждый переключатель, почему это важно и как оно влияет на потребление кредитов.

🕸️ Param: depth (0 - 3)

Глубина сканирования (рекурсивный сканер ссылок)

Глубина 0 очищает строго заданный URL-адрес. Глубина 1 анализирует страницу, обнаруживает все внутренние гиперссылки, принадлежащие одному домену, и извлекает их до предела вашей страницы. Глубины 2 и 3 продолжают обход дерева.

💰 Стоимость: 1 кредит за извлеченную страницу.
📄 Param: limit (1 - 50,000)

Ограничение страниц и бюджет параллелизма

Ограничивает максимальное количество страниц, извлекаемых за один сеанс сканирования. Выполняется с участием 4 высокопроизводительных фоновых рабочих процессов, одновременно обеспечивающих молниеносную пропускную способность без превышения ограничений скорости сервера.

💰 Стоимость: вычитается строго за количество просканированных страниц.
🌍 Param: country (US, DE, GB, FR, JP)

Геотаргетинг по стране и обход защиты от ботов

Направляет сканирование через корпоративные резидентные прокси-серверы в выбранной стране. Крайне важно для веб-сайтов с географическим платным доступом, региональными валютами или строгими требованиями Cloudflare/DataDome.

💰 Стоимость: включено бесплатно во все извлечения.
📑 Param: format (markdown, json)

Механизм Fit-Markdown против JSON

Устраняет 95% HTML-мусора, встроенных стилей, трекеров и беспорядка в навигации. Предоставляет семантические заголовки, таблицы, чистые ссылки и списки, которые потребляют до 80 % меньше токенов в Claude и GPT-4.

💰 Стоимость: 1 кредитная база.
🧠 Param: chunkSize & overlap

Умное семантическое разделение заголовков

Вместо тупого разделения символов FlyCrawl понимает заголовки уценки (#, ##, ###) и естественным образом разбивает абзацы. Скользящее перекрытие гарантирует, что семантическая граница не будет разрезана пополам.

💰 Стоимость: 100% бесплатно и включено в каждую царапину.
🚀 Param: model (native, large)

Векторные модели (размер 1536 и большой размер 3072)

Выбирайте между FlyCrawl Native Fast (1536-dim, нулевая стоимость), Native Large (3072-dim) или официальными моделями OpenAI с встраиванием текста-3. Выводит нормализованные векторы с плавающей запятой, математически готовые к косинусному подобию.

💰 Стоимость: Native (1536 и 3072) 100% БЕСПЛАТНО при очистке. Автономный вариант: 1 Кр за 25–50 текстов. OpenAI: от +1 до +2 Кр (или БЕСПЛАТНО со своим ключом).
💻 ИНТЕГРАЦИЯ РАЗРАБОТЧИКА

Scraping с векторными вложениями в 3 строки кода

Совместим с Python, LangChain, LlamaIndex, Cursor и Windsurf.

# Python 3: Scrape web page directly into 3072-dim Vector Embeddings
import requests

response = requests.post(
    "https://flycrawl.net/api/v1/scrape",
    headers={"Authorization": "Bearer fly_live_your_api_key"},
    json={
        "url": "https://en.wikipedia.org/wiki/Artificial_intelligence",
        "formats": ["markdown", "embeddings"],
        "embeddings": {
            "model": "text-embedding-3-large",
            "dimensions": 3072
        }
    }
)
data = response.json()
print(f"Extracted {len(data['chunks'])} chunks with 3072-dim vectors!")

Готовы протестировать это вживую?

Откройте интерактивную игровую площадку, протестируйте любой веб-сайт или тест и просмотрите чистые векторы Fit-Markdown и high-dim, созданные в режиме реального времени.

🚀 Перейти на живую игровую площадку 🎁 Зарегистрируйтесь (получите 100 бесплатных кредитов)