خدمة

تقييم GenAI و Agentic AI

اعرف أنه يعمل قبل العملاء.

ميزات الـ LLM تفشل بطريقة مختلفة عن البرمجيات. نبني البيانات والقياس وبوابة الإصدار التي تخبرك إن كان نموذجك آمناً للإطلاق — مؤتمتة، قابلة للتكرار، وتعمل مع كل تغيير.

ليش هذا مش اختبار عادياً

المدخل نفسه قد يعطي إجابة مختلفة.

التحقّقات الثابتة لا تنفع

لا يوجد نصٌّ صحيح واحد للمقارنة. تصبح الصحّة حُكماً، والحُكم يُقاس ولا يُفترض.

الخطأ بثقة هو الحالة الخطيرة

الانهيار مرئي. أما إجابة سليمة الصياغة وخاطئة فتصل العميل كوعدٍ يلزم العمل بالوفاء به.

الفحص المتفرّق لا يتوسّع

من يجرّب عشرين سؤالاً قبل الإصدار لا يشكّل بوابة، بل إحساساً يتدهور بصمت مع كل تحديث للنموذج.

ما نقيسه

خمسة أبعاد، تُقاس في كل إجابة.

الصحّة

هل الإجابة صحيحة وفق القواعد التي تحكم هذا السوق أو المنتج أو العقد فعلاً؟

الأمانة للمصدر

هل تبقى الإجابة داخل السياق المُسترجع أم تتجاوز ما تدعمه المصادر؟

الهلوسة

هل يُؤكَّد شيء لا يدعمه أي مصدر؟ هذا المقياس الذي يقلق الفريق القانوني.

صلة الإجابة

هل تجيب عن السؤال المطروح، أم عن سؤال قريب تفضّل الإجابة عنه؟

النبرة

هل تبدو كعلامتك تحت الضغط — حتى عندما يكون العميل غاضباً أو الجواب لا؟

ما تحصل عليه

بوابة، لا تقرير.

بيانات ذهبية

مبنيّة من قواعدك الحقيقية وتذاكرك الحقيقية، مُصدَّرة في مستودعك، ويملكها فريقك.

مجموعة تقييم مؤتمتة

قائمة على DeepEval، تعمل في الـ CI مع كل تغيير في الـ prompt أو النموذج أو الاسترجاع.

مجموعات هجومية

اختراقات وتحقين prompts والحالات الحدّية التي سيجدها مستخدموك في أول أسبوع.

نتيجة إصدار

نجاح أو فشل يمكنك حجز النشر عليه — لا لوحة لا يفتحها أحد.

الدليل

الذكاء الحواري في FedEx.

الكلفة الحقيقية

مساعدٌ نصّي وصوتي يجيب عن أسئلة الشحن في أسواقٍ لكل دولةٍ فيها قواعدها. إجابةٌ واحدة خاطئة بثقة تصل العميل كوعدٍ يلزم العمل بالوفاء به.

ما بنيناه
  1. 1بيانات ذهبية مبنيّة على قواعد الشحن الفعلية لكل دولة
  2. 2كل إجابة تُقاس على تلك القواعد قبل أن يراها أحد
  3. 3مجموعات هجومية تحرس الإصدار — لا يُطلق النموذج إلا إذا صمد
ما الذي حقّقه
  1. 1كل إجابة تُقاس على قواعد تلك الدولة قبل أن يراها العميل
  2. 2لا يُطلق أي إصدار ما لم يصمد أمام المجموعات الهجومية
  3. 3تُطلق FedEx الذكاء الحواري للعملاء بثقة

تُطلق ميزة LLM ولا تستطيع ضمانها بالكامل؟

أخبرنا ماذا تفعل ومن يراها — نردّ خلال يوم.

تواصل معنا
أسئلة

قبل أن تسأل.

كيف تختبرون شيئاً غير حتمي؟

تتوقّف عن التحقّق الثابت وتبدأ بالقياس. كل إجابة تُقاس على قواعدك في عدة محاور، والبوابة عتبةٌ على مجموعة بيانات — لا مطابقةً لنصٍّ متوقّع واحد.

من يحدّد ما هي الإجابة الصحيحة؟

أنتم. نستخرج القواعد من سياساتكم وعقودكم وتذاكركم الحقيقية، ويعتمد خبراء المجال لديكم مجموعة البيانات. نحن نبني الآلية، وتعريف الصحّة يبقى لكم.

هل تخرج بياناتنا من بيئتنا؟

مش بالضرورة. تعمل المجموعة داخل الـ CI لديكم مقابل نقطة النموذج التي تثقون بها أصلاً. وحين نحتاج نموذجاً حاكماً، نستخدم المزوّد الذي اعتمدتموه سابقاً.

وماذا لو كانت النتائج سيّئة؟

فقد عرفتم قبل عملائكم، وهذا هو المقصد كلّه. عادةً يكون الخطّ الأساسي الأول أدنى من توقّعات الفريق، وذلك الرقم تحديداً هو ما يجعل التحسّن قابلاً للقياس.

لدينا اختبارات prompts في مستودعنا أصلاً.

نقطة بداية جيدة. الثغرات المعتادة أنها غير مُصدَّرة مقابل مجموعة بيانات، ولا تُقاس على الهلوسة أو الأمانة للمصدر، ولا تحجز النشر. نحن نغلق هذه الثلاث.