إذا كنّا سنعطي الإجابة درجة من عشرة، فنحن نحتاج دماغاً يقرأها ويفهمها — والـ script لا يستطيع ذلك.
هنا نتعرّف على الـ LLM-as-a-judge: نموذج لغوي يقيّم مخرجات تطبيقك، يعطي score، ويشرح لك السبب (reason) وراء كل تقييم، وكيف يرتبط هذا كلّه بالـ test case.