ما هي الخطوة الثالثة في RAG ولماذا تُعد قلب النظام الحقيقي؟ بعد أن قمنا في الخطوات السابقة باستخراج النصوص من الملفات، ثم تقسيمها، ثم تحويلها إلى Embeddings وتخزينها داخل Vector Database كما شرحنا في مقال الخطوة الثانية في RAG: تحويل قطع النصوص إلى Vectors وتخزينها في قاعدة البيانات، نصل الآن إلى أهم مرحلة تشغيلية: استرجاع…
الخطوة الثانية في RAG: تحويل قطع النصوص إلى Vectors وتخزينها في قاعدة البيانات بعد أن أنجزنا استخراج النصوص من الملفات في درس بناء الخطوة الأولى في RAG: استخراج النصوص من ملفات PDF برمجياً، وبعدها قمنا بمرحلة تقطيع النصوص الضخمة إلى أجزاء صغيرة تتناسب مع حجم الـ LLMs، نصل الآن إلى قلب البنية الدلالية لأي نظام…
ما المقصود بتقطيع النصوص الضخمة ولماذا يُعد خطوة حاسمة؟ عند بناء أي تطبيق يعتمد على LLMs، فإن أول قيد هندسي يظهر مباشرة هو حد النافذة السياقية Context Window. النموذج لا يستطيع استقبال كتاب كامل أو ملف PDF ضخم دفعة واحدة بدون خسارة في الأداء أو ارتفاع هائل في التكلفة. هنا تأتي وظيفة Text Splitters: تقسيم…
بناء الخطوة الأولى في RAG: استخراج النصوص من ملفات PDF برمجياً أي نظام RAG ناجح لا يبدأ من النموذج نفسه، بل من جودة البيانات الداخلة إليه. قبل الوصول إلى مرحلة Embeddings أو التخزين داخل Vector DB، يجب أولاً تحويل المستندات الخام إلى نص قابل للمعالجة. وهنا تظهر أهمية ملفات PDF، لأنها الصيغة الأكثر شيوعاً في…
ما هو نظام RAG؟ نظام RAG هو اختصار لـ Retrieval-Augmented Generation، أي “التوليد المعزز بالاسترجاع”. الفكرة الجوهرية بسيطة ظاهرياً لكنها عميقة هندسياً: بدلاً من إجبار LLM على الإجابة اعتماداً فقط على ما تعلّمه أثناء التدريب، نقوم أولاً باسترجاع معلومات ذات صلة من مصدر معرفة خارجي، ثم نمرر هذه المعلومات إلى النموذج داخل Prompt ليبني الإجابة…