🎓 دليل المنصة الرسمي والشرح المرئي

إتقان FlyCrawl: الخيارات، RAG والمتجهات

تعرف على كيفية تشغيل كل معلمة لاستخراج الذكاء الاصطناعي عالي السرعة، وكيف تعمل عمليات التضمين 1536-dim و3072-dim على تحويل صفحات الويب الأولية إلى قواعد بيانات متجهة، وكيفية عمل تسعير الائتمان الشفاف.

افتح الملعب المباشر 📖 REST API وSDKs 🎯 حلول الذكاء الاصطناعي وتحسين محركات البحث

🚀 5 خطوات من أي صفحة ويب إلى المتجهات ذات الإضاءة العالية

انقر على كل خطوة أدناه لفحص الإرشادات المرئية التفاعلية والنماذج بالحجم الطبيعي.

الخطوة 1

أدخل عنوان URL المستهدف أو اختر من بين أكثر من 200 معيار

في FlyCrawl، لن تكون مقيدًا أبدًا. يمكنك لصق أي تطبيق حديث من صفحة واحدة (React أو Vue أو Next.js) أو بوابة التوثيق أو كتالوج التجارة الإلكترونية أو موقع الأخبار. للحصول على تقييم سريع للضيوف دون تسجيل الدخول، انقر فوق أي من شرائح القياس المنسقة البالغ عددها 200 شريحة (Wikipedia، وGitHub، وStripe، وBBC، وما إلى ذلك).

💡 نصيحة للمحترفين: يقوم FlyCrawl تلقائيًا بإضافة https:// تلقائيًا وتتبع معلمات UTM حتى تحصل دائمًا على الصفحة الأصلية الأساسية.
https://flycrawl.net/#playground
رابط الموقع المستهدف:
🌐 https://en.wikipedia.org/wiki/Artificial_intelligence SSL Valid
معايير الاتجاه السريع:
Wikipedia ⚡ GitHub Docs Stripe API BBC News
الخطوة 2

تكوين عمق الزحف والحدود والاستهداف الجغرافي للوكيل

قم بتخصيص كيفية تصرف الزاحف وفقًا لهدفك: سواء كنت تريد صفحة سريعة واحدة أو موقع توثيق كاملاً. اختر بين Fit-Markdown (الرموز المميزة لـ LLMs) أو JSON (تنسيق منظم مع بيانات التعريف).

  • العمق 0: استخراج صفحة واحدة (الأسرع، يستهلك رصيدًا واحدًا).
  • العمق 1-3: زاحف الشبكة العودية الذي يتتبع جميع الروابط الداخلية.
  • وكيل البلد: يقوم بتدوير عناوين IP السكنية من الولايات المتحدة وألمانيا والمملكة المتحدة وفرنسا واليابان للتغلب على كتل Cloudflare/DataDome.
معلمات الزاحف
Depth 1 (Page + Internal Links)
5 Pages (Parallel Workers)
🇺🇸 United States (Cloudflare Bypass)
Markdown (Fit-Tokens)
الخطوة 3

قم بتمكين تقطيع RAG واختر نموذج المتجه الخاص بك

قم بتبديل مفتاح Smart Chunking & Vector لتحويل النص المستخرج إلى متجهات رياضية جاهزة للبحث. يتم تقسيم أداة القطع الذكية الخاصة بنا حسب علامات الرأس (#، ##، ###) مع الحفاظ على تداخل السياق.

📐 نماذج التضمين المتاحة:
  • ⚡ FlyCrawl Native (1536-dim): تكلفة صفر، ناقل جيب التمام في الذاكرة بسرعة 10 مللي ثانية.
  • 🔥 FlyCrawl Native Large (3072-dim): دقة دلالية فائقة الأبعاد (مجانية).
  • 🟢 OpenAI text-embedding-3-small (1536-dim): تضمين OpenAI القياسي في الصناعة.
  • 🚀 OpenAI text-embedding-3-large (3072-dim): أعلى دقة معيارية لـ MTEB في العالم.
تكوين RAG والمتجهات
🧠 التقطيع الذكي والمتجهات ENABLED
Chunk Size: 500 chars | Overlap: 50 chars
SELECTED MODEL:
🚀 OpenAI text-embedding-3-large 3072 Dimensions
الخطوة 4

قم بتنفيذ عمليات المسح والمشاهدة المباشرة لحسابات الائتمان الشفافة

انقر فوق تشغيل كشط. يحسب شريط التسعير الديناميكي الخاص بـ FlyCrawl التكاليف الدقيقة مقدمًا دون أي مفاجآت: رصيد واحد لكل صفحة أساسية + أرصدة إضافية لتضمينات المتجهات. إذا فشل الزحف أو تم حظره بواسطة الوجهة، فسيتم خصم 0 نقطة بالضبط.

🛡️ ضمان عدم التسرب ⚡ سرعة دون الثانية
مراقبة الائتمان الحية
💎 التكلفة: رصيد واحد (صفحة واحدة + ناقل 3072-dim متضمن مجانًا!)
🟢 Ready
Balance: 500 Credits ➔ After Crawl: 499 Credits
الخطوة 5

1-انقر فوق تصدير إلى Pinecone وQdrant وJSONL

بمجرد انتهاء الزحف، انقر فوق "نسخ الحمولة الناقلة". يتم تحميل الحافظة على الفور بمتجهات JSON منسقة مسبقًا (مصفوفة القيم، وبيانات تعريف القطعة، وعنوان URL المصدر، وقسم الرأس) المنسقة بشكل مثالي لـ Pinecone، أو Qdrant، أو ChromaDB، أو pgvector. يمكنك أيضًا تصدير مجموعة البيانات الكاملة بتنسيق JSONL.

🌲 Pinecone Ready ⚡ Qdrant Ready 🌈 ChromaDB Ready 🐘 pgvector Ready
JSON Upsert Payload (3072 Dimensions)
{
  "upsert_request": {
    "namespace": "flycrawl-production",
    "model": "text-embedding-3-large",
    "dimensions": 3072,
    "vectors": [
      {
        "id": "vec_1725368400_1",
        "values": [0.0142, -0.0381, ... 3072 floats],
        "metadata": {
          "source": "https://en.wikipedia.org/wiki/AI",
          "section": "Machine Learning",
          "engine": "FlyCrawl High-Dim Engine"
        }
      }
    ]
  }
}
📋 مصفوفة الميزات الكاملة ومسرد المعلمات

شرح كل خيار من خيارات Playground وواجهة برمجة التطبيقات

تفصيل تفصيلي لما يفعله كل تبديل، وسبب أهميته، وكيف يؤثر على استهلاك الائتمان.

🕸️ Param: depth (0 - 3)

عمق الزحف (زاحف الارتباط العودي)

يقوم العمق 0 بإلغاء عنوان URL المحدد بدقة. يقوم العمق 1 بتحليل الصفحة، واكتشاف كافة الارتباطات التشعبية الداخلية التي تنتمي إلى نفس المجال، واستخراجها حتى الحد الأقصى لصفحتك. يستمر العمقان 2 و 3 في اجتياز الشجرة.

💰 التكلفة: رصيد واحد لكل صفحة مستخرجة.
📄 Param: limit (1 - 50,000)

حد الصفحة وميزانية التزامن

يحدد الحد الأقصى لعدد الصفحات المستخرجة خلال جلسة زحف واحدة. تم تنفيذه باستخدام 4 عمال خلفية متزامنين وعاليي الأداء لضمان إنتاجية سريعة دون تجاوز حدود معدل الخادم.

💰 التكلفة: يتم خصمها بدقة من الصفحات الفعلية التي تم الزحف إليها.
🌍 Param: country (US, DE, GB, FR, JP)

الاستهداف الجغرافي للبلد وتجاوز مكافحة الروبوتات

يقوم بتوجيه الزحف عبر الوكلاء السكنيين للمؤسسة في البلد المحدد. ضروري لمواقع الويب ذات نظام حظر الاشتراك غير المدفوع الجغرافي أو العملات الإقليمية أو تحديات Cloudflare/DataDome الصارمة.

💰 التكلفة: متضمنة مجانًا في جميع عمليات الاستخراج.
📑 Param: format (markdown, json)

محرك Fit-Markdown مقابل JSON

يزيل 95% من HTML غير المرغوب فيه، والأنماط المضمنة، والمتتبعات، وفوضى التنقل. يقدم عناوين دلالية وجداول وروابط نظيفة وقوائم تستهلك ما يصل إلى 80% أقل من الرموز المميزة في Claude وGPT-4.

💰 التكلفة: قاعدة ائتمانية واحدة.
🧠 Param: chunkSize & overlap

تقطيع الرأس الدلالي الذكي

بدلاً من تقطيع الأحرف الغبية، يفهم FlyCrawl عناوين تخفيض السعر (#، ##، ###) ويقسم الفقرات بشكل طبيعي. يضمن التداخل المنزلق عدم قطع الحدود الدلالية إلى النصف.

💰 التكلفة: مجانية 100% ومتضمنة مع كل عملية خدش.
🚀 Param: model (native, large)

نماذج المتجهات (1536-خافتة و3072-خافتة كبيرة)

اختر من بين نماذج FlyCrawl Native Fast (1536-dim، تكلفة صفر)، أو Native Large (3072-dim)، أو نماذج OpenAI text-embedding-3 الرسمية. مخرجات متجهات عائمة طبيعية جاهزة رياضياً لتشابه جيب التمام.

💰 التكلفة: Native (1536 و3072) مجاني بنسبة 100% عند الخدش. مستقل: 1 س لكل 25-50 رسالة نصية. OpenAI: +1 إلى +2 Cr (أو مجانًا باستخدام مفتاحك الخاص).
💻 تكامل المطور

كشط باستخدام التضمينات المتجهة في 3 أسطر من التعليمات البرمجية

متوافق مع Python، وLangChain، وLlamaIndex، وCursor، وWindsurf.

# Python 3: Scrape web page directly into 3072-dim Vector Embeddings
import requests

response = requests.post(
    "https://flycrawl.net/api/v1/scrape",
    headers={"Authorization": "Bearer fly_live_your_api_key"},
    json={
        "url": "https://en.wikipedia.org/wiki/Artificial_intelligence",
        "formats": ["markdown", "embeddings"],
        "embeddings": {
            "model": "text-embedding-3-large",
            "dimensions": 3072
        }
    }
)
data = response.json()
print(f"Extracted {len(data['chunks'])} chunks with 3072-dim vectors!")

هل أنت مستعد لاختباره مباشرة؟

افتح ساحة اللعب التفاعلية، واختبر أي موقع ويب أو معيار مرجعي، وشاهد Fit-Markdown النظيف والمتجهات عالية التعتيم التي تم إنشاؤها في الوقت الفعلي.

🚀 انتقل إلى "الملعب المباشر". 🎁 التسجيل (احصل على 100 نقطة مجانية)