سلة
هندسة البرمجيات·تقنية المعلوماتمنذ يومين

مهندس خلفي أول للذكاء الاصطناعي - تقييم وجودة الوكلاء

Senior AI Backend Engineer - Agent Evaluation & Quality

مكة المكرمة دوام كامل 5+ سنوات

حول الدور

نحن ندير أنظمة متعددة الوكلاء في الإنتاج تتعامل مع عمل حقيقي لقاعدة كبيرة من المستخدمين. مع نمو هذه الأنظمة، يصبح أكبر قيد لدينا هو الثقة: نحتاج إلى معرفة مدى جودة أداء الوكلاء، واكتشاف الانحدارات قبل إطلاقها، والحفاظ على الجودة ثابتة أثناء الإصدارات. هذا الدور يتولى ذلك.

ستبني أنظمة التقييم خلف وكلائنا - الحكام، وأدوات الاختبار، والمحاكيات التي تخبرنا ما إذا كان الوكيل يعمل وأين يفشل. الهدف هو تمكيننا من إطلاق الوكلاء بشكل أسرع لأننا نثق في ما يخبرنا به التقييم.

التقييم هو المحور، لكنه لن يكون الحدود. لأنك ستفهم أنماط فشل الوكلاء أفضل من أي شخص آخر، ستكون هناك أيضًا فرص للمساهمة في تطوير الوكلاء نفسه، وبناء وتحسين الوكلاء جنبًا إلى جنب مع الأنظمة التي تقيمهم.

المسؤوليات

  • امتلاك مجموعة التقييم. تصميم وبناء أنظمة «LLM كحكم»، ومعايرتها مقابل التصنيفات البشرية، وجعل جودة الوكيل قابلة للقياس لكل وكيل ولكل نمط فشل.
  • جعل بوابة الإصدار حقيقية. بناء أدوات تقييم لكل طلب سحب (PR) واكتشاف الانحدارات المدمجة في CI، بحيث يتم فرض الجودة تلقائيًا، وليس من خلال الفحوصات اليدوية.
  • بناء محاكيات المستخدم لتوليد تغطية اختبارية وحالات خصومة قبل أن يواجهها المستخدمون الحقيقيون.
  • تحويل إشارات الإنتاج إلى تحسين - إعادة تغذية حالات الفشل الحقيقية إلى مجموعات التقييم بحيث يتحسن النظام بمرور الوقت.
  • الشراكة مع المنتج لتحويل «شكل الجودة الجيد» إلى معايير ملموسة وقابلة للقياس.
  • النمو نحو تطوير الوكلاء - المساهمة في بناء وتقوية الوكلاء أنفسهم، بدءًا من المكونات التي تعرفها بعمق من تقييمها.

المتطلبات

المهارات الإضافية المرغوبة

  • أساسيات قوية في هندسة البرمجيات. خبرة إنتاجية في Python أو Typescript (أو ما يعادلها)، وتصميم نظيف لواجهات API والأنظمة، والاختبار، وCI/CD. تكتب كودًا يبني عليه الآخرون - البنية التحتية للتقييم هي هندسة حقيقية.
  • خبرة عملية مع LLMs/الوكلاء. لقد بنيت باستخدام LLMs - وكلاء، RAG، استدعاء الأدوات/الدوال، أطر التنسيق (LangGraph، LangChain، أو ما يعادلها) - وتفهم كيف تتصرف وتتعطل.
  • عقلية القياس. تفكر في المقاييس، والمعايرة، والتجارب؛ تريد قياس ما إذا كان شيء يعمل، وليس فقط إطلاقه.
  • خبرة إنتاجية. لقد قمت بتشغيل أنظمة LLM في الإنتاج وتعاملت مع الموثوقية، وزمن الاستجابة، والتكلفة، والمراقبة.
  • 5+ سنوات في هندسة البرمجيات، مع عمل عملي حديث مع LLMs/الوكلاء.
  • خبرة مباشرة في تقييم أنظمة LLM/الوكلاء - التقييم غير المتصل/المتصل، «LLM كحكم»، اختبار الانحدار المنهجي.
  • أدوات المراقبة (Arize، LangSmith، أو ما يعادلها).
  • خبرة في اللغة العربية / معالجة اللغة الطبيعية.
  • خبرة في التجارة الإلكترونية أو المنتجات الموجهة للتجار.

المهارات المطلوبة

PythonTypeScriptLLMLangGraphLangChainCI/CDRAGArizeLangSmithNLP
شارك هذه الوظيفة

تنبيهات ذكية

اختر متى نخبرك. · 1 مفعّل
كل وظائف سلة
جميع الوظائف الجديدة
وظائف في مكة المكرمة
وظائف جديدة في هذه المدينة
وظائف هندسة البرمجيات
وظائف في نفس المجال
سلة
عن الشركة

سلة

مكة المكرمة

كل وظائفها