نحن نبحث عن مهندس موثوقية مواقع أول (SRE) للمساعدة في تصميم وتوسيع نطاق وتأمين البنية التحتية لمنصتنا سريعة النمو.
ستعمل عبر جميع الأنظمة الحيوية - من التطبيقات وواجهات برمجة التطبيقات (APIs) التي تواجه العملاء إلى المنصات الداخلية وخدمات البيانات - لضمان التوفر والأداء وكفاءة التكلفة على نطاق واسع.
ستكون عمليًا مع Kubernetes والمراقبة وGitOps والأتمتة والبنية التحتية السحابية، مع التعاون الوثيق مع فرق التطبيقات والمنصات والبيانات لتقديم بيئة عالية الموثوقية وقادرة على الشفاء الذاتي.
هذا الدور مثالي لمهندس يزدهر في الأنظمة الموزعة المعقدة، ويحب أتمتة كل شيء، ويمكنه الموازنة بين السرعة والاستقرار وكفاءة التكلفة في الإنتاج.
المؤهلات
- درجة البكالوريوس في علوم الكمبيوتر أو الهندسة أو مجال ذي صلة - أو خبرة عمل معادلة.
- تصميم ونشر ومراقبة وصيانة أعباء العمل الإنتاجية عبر مجموعات Kubernetes (EKS/AKS/GKE).
- بناء أنظمة ذاتية الشفاء والتوسع التلقائي تقلل من التدخل اليدوي وتضمن وقت التشغيل.
- تصميم وتشغيل منصات قواعد بيانات وتخزين موثوقة (SQL و NoSQL ومخازن الكائنات) داخل بيئات Kubernetes.
- تنفيذ استراتيجيات النسخ الاحتياطي والتعافي من الكوارث والتكرار والتحويل لتلبية أهداف RPO/RTO.
- استكشاف أخطاء وحدات التخزين الثابتة في Kubernetes واستعادتها (StorageClasses و CSI drivers ومشكلات PVC).
- تحسين أداء التخزين والتكلفة من خلال استراتيجيات متعددة المستويات وفصل البيانات الساخنة/الباردة وسياسات دورة حياة S3/التفريغ.
- تأمين وتوسيع نطاق منصات تخزين الكائنات (مثل MinIO/S3-compatible) لخطوط أنابيب البيانات عالية الإنتاجية.
- إدارة التخزين الكتلي (EBS/io2/gp3) وأنظمة الملفات المشتركة (EFS و NFS) لتحقيق المرونة وتوازن التكلفة.
- التعاون مع الفرق لتحسين الشبكات وحركة المرور الواردة/الصادرة وشبكة الخدمات للاتصال الآمن.
موثوقية المنصة والبنية التحتية
- تصميم ونشر ومراقبة وصيانة أعباء العمل الإنتاجية عبر مجموعات Kubernetes (EKS/AKS/GKE).
- بناء أنظمة ذاتية الشفاء والتوسع التلقائي تقلل من الجهد اليدوي.
- تحسين الشبكات والتحكم في حركة المرور الواردة/الصادرة وشبكة الخدمات للاتصال الآمن والفعال.
- تصميم وتشغيل منصات قواعد بيانات وتخزين موثوقة (SQL و NoSQL ومخازن الكائنات) في بيئات Kubernetes.
- امتلاك استراتيجيات النسخ الاحتياطي والتعافي من الكوارث والتكرار والتحويل لتلبية أهداف RPO/RTO لخدمات البيانات الحيوية.
- تحسين أداء التخزين والتكلفة من خلال استراتيجيات متعددة المستويات وفصل البيانات الساخنة/الباردة وسياسات دورة حياة S3/التفريغ.
- استكشاف أخطاء وحدات التخزين الثابتة في Kubernetes واستعادتها بثقة أثناء الحوادث (StorageClasses و CSI drivers ومشكلات PVC).
- تأمين وتوسيع نطاق منصات تخزين الكائنات (مثل MinIO/S3-compatible) ودمجها مع أعباء العمل لخطوط أنابيب البيانات عالية الإنتاجية.
- العمل مع التخزين الكتلي (EBS/io2/gp3) وأنظمة الملفات المشتركة (EFS و NFS) لتحقيق التوازن بين الأداء والمرونة والتكلفة.
الأتمتة والتسليم
- دعم أفضل ممارسات GitOps و CI/CD (ArgoCD و Flux و GitHub Actions).
- بناء أتمتة لتوفير البنية التحتية وترقياتها باستخدام Terraform و Helm و Kubernetes Operators.
- تقليل مخاطر الإصدار من خلال استراتيجيات التسليم التدريجي (blue/green و canary و spot instance rolling updates).
المراقبة والاستجابة للحوادث
- امتلاك مجموعة المراقبة والتنبيه (Prometheus و Grafana و Loki و VictoriaMetrics و OpenSearch).
- قيادة إدارة الحوادث ومراجعات ما بعد الحادث لمنع التكرار.
- توفير رؤية فورية لصحة النظام والأداء ومقاييس التكلفة.
الأمان والامتثال
- تنفيذ سياسات IAM ذات الامتيازات الأقل وتأمين الاتصال بين الخدمات وقوائم ACL للشبكة/جدران الحماية.
- فرض RBAC في Kubernetes وإدارة الأسرار وسلسلة توريد الصور الآمنة.
- المشاركة في جاهزية التدقيق وجهود الامتثال.
تحسين الأداء والتكلفة
- تحليل وضبط أداء النظام تحت النطاق (CPU/ذاكرة/IO).
- الشراكة مع فرق المنتج والمنصة لتحجيم المجموعات وقواعد البيانات ومستويات التخزين بشكل مناسب.
- تقديم لوحات معلومات رؤية التكلفة لقادة الهندسة.
المؤهلات المفضلة
- خبرة في إدارة الأنظمة الحيوية على نطاق واسع (حركة مرور عالية، متعددة المناطق).
- تحسين التكلفة المثبت في البيئات السحابية/K8s.
- الإلمام بشبكة الخدمات (Istio و Linkerd) أو التحكم المتقدم في الشبكات/حركة المرور الصادرة.
- خبرة مع مكونات منصة البيانات (Airflow و Debezium و ClickHouse وما إلى ذلك) ميزة إضافية ولكنها غير مطلوبة.
- مهارات اتصال قوية والعمل الجماعي - القدرة على التعاون عبر فرق الهندسة و DevOps والأمان والمنتج.
الخبرة
- 8+ سنوات في أدوار SRE / DevOps / هندسة البنية التحتية.
- خبرة عميقة في Kubernetes (متعددة المجموعات، تطوير Helm charts، الشبكات المتقدمة).
- سير عمل GitOps قوي باستخدام ArgoCD/Flux.
- خبرة في AWS (مفضل) أو Azure/GCP، بالإضافة إلى البنية التحتية كرمز (Terraform و Pulumi و CloudFormation).
- معرفة متقدمة بقواعد بيانات SQL و NoSQL (MySQL/Aurora و PostgreSQL و MongoDB و Redis).
- مهارات البرمجة/الأتمتة في Python أو Bash أو Go.
- خلفية قوية في المراقبة/المراقبة (Prometheus و Grafana و Loki و ELK/Opensearch و VictoriaMetrics).
- خبرة في CI/CD على نطاق واسع وإدارة حوادث الإنتاج.
- خبرة في البث/المراسلة (Kafka و RabbitMQ أو ما شابه).
المزايا
- برامج تدريب وتطوير شاملة.
- مكافآت حوافز قائمة على الأداء.
- خيارات العمل من المنزل المرنة.
المهارات المطلوبة
KubernetesAWSTerraformGitOpsArgoCDPrometheusGrafanaPythonSQLNoSQL
شارك هذه الوظيفة
تنبيهات ذكية
اختر متى نخبرك. · 1 مفعّل
كل وظائف سلة
جميع الوظائف الجديدة
وظائف في المدينة المنورة
وظائف جديدة في هذه المدينة
وظائف الهندسة
وظائف في نفس المجال
