بازگشت به فرصت‌ها
حضوریمیان‌سطحقراردادیتوافقی

داده و اعتبار سنجی تجارت ایرانیان (داتا) | Datatejarat

شرح موقعیت

ما در داتا (بازوی هوش مصنوعی و تحلیل داده بانک تجارت) در حال توسعه سامانه‌های نسل جدید AI و Machine Learning هستیم که نیازمند زیرساخت‌هایی پایدار، مقیاس‌پذیر و قابل اتکا هستند. به همین دلیل به دنبال یک MLOps Engineer هستیم تا با همکاری نزدیک با تیم‌های AI و Software Engineering، مسئولیت طراحی، پیاده‌سازی، بهینه‌سازی و نگهداری زیرساخت‌های GPU و ML شامل ML Pipelines، Deployment، Monitoring و Automation را بر عهده بگیرد و زمینه اجرای پایدار و production-ready شدن workloadهای تحقیقاتی و عملیاتی را فراهم کند. توانمندی‌های مورد انتظار مزیت محسوب می‌شود

مسئولیت‌ها

  • طراحی و پیاده‌سازی GPU/CPU Health Checks در فرآیند Provisioning و بهره‌برداری، شامل بررسی ECC، PCIe، Thermal و Link Stability
  • طراحی، مدیریت و بهینه‌سازی کلاسترهای Kubernetes و Docker برای workloadهای AI و ML
  • طراحی، پیاده‌سازی و نگهداری ML Pipelines و workflowهای مرتبط با آموزش، ارزیابی و استقرار مدل‌ها با استفاده از ابزارهایی مانند Kubeflow و MLflow
  • مدیریت و استقرار سرویس‌ها و Deploymentها با استفاده از Helm و ArgoCD
  • طراحی و پیاده‌سازی فرآیندهای CI/CD و Automation با ابزارهایی مانند GitLab CI، GitHub Actions و Jenkins
  • طراحی و پیاده‌سازی Monitoring، Observability و Alerting با ابزارهایی مانند Prometheus و Grafana
  • مدیریت Configuration و اجرای فرآیندهای Infrastructure Automation با استفاده از Ansible
  • تحلیل و رفع مشکلات زیرساختی در محیط‌های Development، Staging و Production
  • همکاری با تیم‌های AI، ML و Software Engineering برای تبدیل workloadهای تحقیقاتی و prototypeها به سرویس‌ها و زیرساخت‌های پایدار و production-ready
  • حداقل ۲ سال تجربه در یکی از حوزه‌های DevOps، MLOps، SRE یا Infrastructure Engineering
  • تسلط مناسب به Linux و Python و توانایی توسعه ابزارهای Automation و Infrastructure Tooling
  • تجربه عملی در مدیریت و نگهداری Kubernetes و Docker در محیط‌های Production
  • تجربه کار با Helm و ArgoCD و آشنایی با مفاهیم GitOps و Modern Deployment
  • تجربه طراحی و پیاده‌سازی فرآیندهای CI/CD
  • تجربه یا آشنایی عملی با Kubeflow، MLflow و ML Workflows
  • تجربه پیاده‌سازی Monitoring و Alerting با ابزارهایی مانند Prometheus و Grafana
  • آشنایی با PyTorch / TensorFlow و مفاهیم مرتبط با اجرای workloadهای ML
  • درک مناسب از GPU Hardware و GPU Diagnostics شامل ECC، PCIe، Thermal و Link Stability
  • آشنایی با مفاهیم Networking، Security و System Administration
  • آشنایی با زیرساخت‌های Cloud و On-Premise
  • تجربه عملی در طراحی و مدیریت GPU Cluster و زیرساخت‌های محاسباتی AI/ML
  • تجربه کار با NVIDIA GPU، CUDA و ابزارهای GPU Diagnostics
  • تجربه استقرار و نگهداری LLM و AI Workloads روی GPU
  • آشنایی با Model Serving، Inference Infrastructure و GPU Scheduling
  • تجربه طراحی زیرساخت‌های Highly Available، Scalable و Fault-Tolerant
  • تجربه کار با Observability، Logging و Distributed Tracing
  • تجربه کار با Cloud Platforms و سرویس‌های مرتبط با Infrastructure و ML

نیازمندی‌ها

  • Python
  • MLOps
  • یادگیری ماشین