تقييم تطبيقات الذكاء الاصطناعي مع DeepEval
تعلّم كيف تختبر وتقيّم تطبيقات الـ LLM والـ RAG والـ AI Agents باستخدام DeepEval: من فكرة LLM as a judge ومقاييس مثل Faithfulness و Task Completion، إلى مقاييسك الخاصة بـ G-Eval، وصولاً إلى framework تقييم كامل يشتغل بالتوازي على تطبيق حقيقي.
3 درس مجاني افتحها الآن — بلا حساب وبلا بطاقة.
ابدأ أول درس مجانياختبرت مواقع وتطبيقات لسنوات… والآن جاء دور الذكاء الاصطناعي
كل شركة اليوم تضيف Chatbot أو RAG أو AI Agent لمنتجها. والسؤال الذي سيصلك كمهندس جودة: كيف نتأكد أن هذا الشيء يعمل صح؟
المشكلة أن كل أدواتك القديمة مبنية على assertion: القيمة المتوقعة تساوي القيمة الفعلية. لكن الـ AI لا يعطيك نفس الجملة مرتين. قد تكون الإجابة صحيحة بعشر صيغ مختلفة، وقد تكون خاطئة بصيغة مقنعة جداً.
هذا الكورس يعلّمك الطريقة التي تستخدمها الشركات فعلاً لتقييم تطبيقات الذكاء الاصطناعي: DeepEval والـ LLM-as-a-judge — من فهم المقاييس، إلى كتابة اختباراتك بـ Python، إلى بناء مقاييسك الخاصة.
ماذا ستتعلم؟
المرحلة الأولى — تغيّر طريقة تفكيرك: من Testing إلى Evaluation قبل أي كود، ستفهم لماذا لا ينفع الـ Pass/Fail مع الـ AI، وكيف يحلّ الـ Scoring محلّه، وما هو الـ LLM-as-a-judge: نموذج لغوي يقرأ إجابة تطبيقك، يعطيها درجة، ويشرح لك السبب.
المرحلة الثانية — تقييم تطبيقات الـ LLM كيف يعمل الـ Chatbot خلف الكواليس، ثم أهم مقاييسه: Answer Relevancy (هل الإجابة مرتبطة بالسؤال؟)، Prompt Alignment (هل التزم بالتعليمات؟)، Hallucination (هل اخترع معلومات؟)، و G-Eval عندما لا يكفي أي مقياس جاهز.
المرحلة الثالثة — تقييم تطبيقات الـ RAG تفهم كيف يُبنى الـ RAG: قاعدة المعرفة، الـ chunks، والـ retriever. ثم تقيّم كل جزء لوحده — الإجابة بـ Faithfulness، والمعلومات المسترجعة بـ Contextual Relevancy و Contextual Recall و Contextual Precision. عندما تفشل الإجابة، ستعرف بالضبط أين المشكلة.
المرحلة الرابعة — تقييم الـ AI Agents و الـ MCP Servers الـ agent لا يجيب فقط، بل يستدعي أدوات ويتخذ قرارات. ستتعلم تقييم كل خطوة (Tool Correctness و Argument Correctness) والرحلة كاملة (Task Completion و Step Efficiency و Plan Adherence و Plan Quality)، ثم تقييم الـ MCP Servers بـ MCPUseMetric.
المرحلة الخامسة — DeepEval عملياً بـ Python
من مجلد فاضي: مشروع Python بـ uv، إعداد الـ API keys للنموذج الحَكَم (OpenAI أو OpenRouter)، بناء LLMTestCase، تطبيق أول مقياس، التحكم بالـ threshold، تقييم مجموعة كاملة بـ evaluate()، توليد الإجابات من نموذج حقيقي، ورفع النتائج إلى لوحة Confident AI ليراها الفريق كله.
المرحلة السادسة — ابنِ مقاييسك الخاصة مع G-Eval
هنا يصير DeepEval أداتك أنت. تبني مقاييس من الـ business logic الخاص بشركتك: مقياس correctness، خطوات تقييم دقيقة بـ evaluation_steps، مقياس للتهذيب، مقياس يمنع البوت من الوعد باسترجاع أموال خارج السياسة، ومقياس يتأكد أن كل رفض يأتي مع خطوة تالية واضحة.
المرحلة السابعة — المقاييس الجاهزة بالكود ترجع إلى المقاييس التي شرحناها نظرياً وتنفّذها واحداً واحداً: Prompt Alignment و Contextual Relevancy و Contextual Recall و Tool Correctness و Argument Correctness — ثم تتجوّل في توثيق DeepEval لتعرف كيف تأخذ أي مقياس آخر بنفسك.
المرحلة الثامنة — بيانات الاختبار: Goldens و Datasets
هنا يصير عندك framework حقيقي بدل اختبارات متفرّقة. تفهم الـ Golden وفرقه عن الـ LLMTestCase، تبني EvaluationDataset، تدور عليها بـ loop لتولّد الـ test cases، تستورد بياناتك من ملفات CSV و JSON كما يجهّزها فريقك فعلاً، ثم ترفع الـ dataset إلى Confident AI وتسحبها بالـ versions — وهذا ما يجعلها جاهزة للـ CI/CD.
المرحلة التاسعة — تطبيق حقيقي من أوله لآخره
تترك الأمثلة المكتوبة يدوياً وتختبر تطبيق LLM حقيقي: تجلبه من GitHub وتشغّله، تناديه بـ httpx كما يناديه المستخدم، تبني مقياس House Style بـ G-Eval، ثم تجهّز أسئلتك في ملف JSON وتقيّم التطبيق عليها كلها.
المرحلة العاشرة — من اختبارات متفرّقة إلى framework
آخر قسم هو الذي يفرّق بين من يعرف الأداة ومن يشتغل فيها: هيكلية مجلدات، ملف config، client مستقل، judge ديناميكي تغيّر نموذجه من مكان واحد، ملف metric، دالة لتوليد الـ dataset — ثم تكتشف لماذا اختباراتك بطيئة وتشغّلها بالتوازي بـ pytest.mark.parametrize.
لمن هذا الكورس؟
✅ مهندس QA شركته بدأت تبني ميزات بالذكاء الاصطناعي، ويريد أن يكون هو الشخص الذي يعرف كيف يقيّمها ✅ مهندس أتمتة يعرف Selenium أو Playwright ويريد أن يضيف أهم مهارة جديدة في المجال ✅ مطوّر يبني تطبيقات LLM أو RAG ويريد طريقة منهجية ليعرف إذا كان التعديل حسّن التطبيق أم أفسده ✅ QA lead يحتاج أن يفهم ما الذي يمكن قياسه في تطبيقات الـ AI قبل أن يخطط له ❌ مش لإلك إذا كنت تبحث عن كورس لبناء تطبيقات الذكاء الاصطناعي نفسها — هذا الكورس عن تقييمها واختبارها
ليش هذا الكورس مختلف؟
ينتهي بمشروع، مش بدرس. آخر قسمين تطبيق حقيقي: تطبيق LLM تجلبه وتشغّله وتختبره من الخارج، ثم framework مرتّب بـ config و client و judge و metric يشتغل بالتوازي — هذا ما ستكتبه في شغلك، لا سطور متفرّقة.
الفكرة قبل الأداة. أول خمسة أقسام تشرح كل مقياس بالأمثلة: متى يفشل، متى ينجح، وكيف تُحسب الدرجة. عندما تصل للكود، لن تنسخ مقياساً لا تفهمه.
مقسّم حسب نوع التطبيق. LLM، RAG، AI Agent، MCP — كل نوع يُقيَّم بطريقة مختلفة، والكورس يعطيك الخريطة لكل واحد منها. هذا ما ستواجهه فعلاً في الشركات.
مقاييس من الواقع، مش أمثلة جامدة. سياسة الاسترجاع، التهذيب، الخطوات التالية بعد الرفض — قواعد عمل حقيقية تكتبها بـ G-Eval، مش مجرد تكرار للمقاييس الجاهزة.
بالعربي، من مهندس جودة لمهندسي جودة. الشرح بالعربي والمصطلحات بالإنجليزي كما تستخدمها في الشغل.
ماذا ستستطيع أن تعمل بعد الكورس؟
- تشرح لفريقك لماذا لا يُختبر الـ AI بالـ assertions، وما البديل
- تختار المقياس المناسب لأي تطبيق ذكاء اصطناعي: LLM أو RAG أو Agent أو MCP
- تحدد مكان الخلل في الـ RAG: هل هو في الـ retriever أم في الـ generator
- تكتب اختبارات تقييم بـ DeepEval و Python من الصفر
- تبني مقاييس خاصة بقواعد عمل شركتك بـ G-Eval
- تنشر نتائج التقييم على Confident AI ليتابعها الفريق
- تجهّز بيانات الاختبار كـ Goldens و Datasets وتستوردها من ملفات فريقك
- تبني framework تقييم كامل وتشغّله بالتوازي بدل اختبارات متفرّقة بطيئة
أرقام الكورس
- 61 درس فيديو + 6 دروس مكتوبة
- 12 قسم
- 7 ساعات و47 دقيقة من الشرح
- 3 دروس مجانية — أول ثلاثة دروس من قسم المقدمة
- تطبيق حقيقي تختبره، وتطبيق ثانٍ تتمرّن عليه بعد الدورة
أسئلة شائعة
هل أحتاج خبرة برمجة؟ أول خمسة أقسام نظرية بالكامل ولا تحتاج كود. الأقسام العملية الأربعة بـ Python، ويكفيك أن تعرف الأساسيات: المتغيّرات، الـ import، واستدعاء الدوال. نبدأ المشروع معك من مجلد فاضي.
كيف أجهّز جهازي؟ في درس مكتوب في قسم المقدمة يمشي معك خطوة بخطوة على Mac و Windows: تثبيت uv، إنشاء المشروع، مفاتيح الـ API، والربط مع Confident AI — مع حلول لأشهر أربع مشاكل في الإعداد.
هل أحتاج أن أدفع لأي خدمة؟ الـ LLM-as-a-judge يحتاج نموذجاً حقيقياً، يعني API key برصيد بسيط — بضعة دولارات تكفي كل تمارين الكورس. الكورس يشرح OpenAI و OpenRouter، والثاني يعطيك كل النماذج برصيد واحد.
هل الكورس بالعربي؟ نعم، الشرح كامل بالعربي والمصطلحات التقنية بالإنجليزي كما هي مستخدمة في السوق.
هل أحتاج أن أعرف كيف تُبنى تطبيقات الذكاء الاصطناعي؟ لا. كل نوع تطبيق يبدأ بدرس يشرح كيف يعمل خلف الكواليس قبل أن نقيّمه.
هل التسجيل خلص؟ نعم — 61 درس فيديو كاملة، من أول مفهوم الـ Evaluation لحد framework يشتغل بالتوازي على تطبيق حقيقي. ومعها 6 دروس مكتوبة: تجهيز الجهاز، ملفات الدورة، خريطة المقاييس، اختيار الحَكَم وتكلفة التقييم، أسئلة المقابلات، ودرس الختام.
هل الوصول مدى الحياة؟ نعم، وتحديثات الكورس تصلك مجاناً.
ابدأ من هنا
جرّب أول ثلاثة دروس مجاناً — بتشرح ما هو DeepEval، الفرق بين الـ Testing والـ Evaluation، وفكرة الـ LLM-as-a-judge. إذا عجبك الأسلوب، الباقي يأخذك من فهم كل مقياس لحد بناء مقاييسك الخاصة بالكود.
المنهاج الكامل
-
- 1 ما هو DeepEval؟ مجاني 8 دقيقة
- 2 الفرق بين الـ Testing والـ Evaluation مجاني 6 دقيقة
- 3 مبدأ الـ LLM-as-a-judge مجاني 8 دقيقة
- 4 تجهيز جهازك: Mac و Windows خطوة بخطوة
- 5 ملفات الدورة والمشاريع اللي رح نشتغل عليها
