شرح موقعیت
ما در داتا (بازوی هوش مصنوعی و تحلیل داده بانک تجارت) در حال توسعه سامانههای نسل جدید AI و Machine Learning هستیم که نیازمند زیرساختهایی پایدار، مقیاسپذیر و قابل اتکا هستند. به همین دلیل به دنبال یک MLOps Engineer هستیم تا با همکاری نزدیک با تیمهای AI و Software Engineering، مسئولیت طراحی، پیادهسازی، بهینهسازی و نگهداری زیرساختهای GPU و ML شامل ML Pipelines، Deployment، Monitoring و Automation را بر عهده بگیرد و زمینه اجرای پایدار و production-ready شدن workloadهای تحقیقاتی و عملیاتی را فراهم کند. توانمندیهای مورد انتظار مزیت محسوب میشود
مسئولیتها
- طراحی و پیادهسازی GPU/CPU Health Checks در فرآیند Provisioning و بهرهبرداری، شامل بررسی ECC، PCIe، Thermal و Link Stability
- طراحی، مدیریت و بهینهسازی کلاسترهای Kubernetes و Docker برای workloadهای AI و ML
- طراحی، پیادهسازی و نگهداری ML Pipelines و workflowهای مرتبط با آموزش، ارزیابی و استقرار مدلها با استفاده از ابزارهایی مانند Kubeflow و MLflow
- مدیریت و استقرار سرویسها و Deploymentها با استفاده از Helm و ArgoCD
- طراحی و پیادهسازی فرآیندهای CI/CD و Automation با ابزارهایی مانند GitLab CI، GitHub Actions و Jenkins
- طراحی و پیادهسازی Monitoring، Observability و Alerting با ابزارهایی مانند Prometheus و Grafana
- مدیریت Configuration و اجرای فرآیندهای Infrastructure Automation با استفاده از Ansible
- تحلیل و رفع مشکلات زیرساختی در محیطهای Development، Staging و Production
- همکاری با تیمهای AI، ML و Software Engineering برای تبدیل workloadهای تحقیقاتی و prototypeها به سرویسها و زیرساختهای پایدار و production-ready
- حداقل ۲ سال تجربه در یکی از حوزههای DevOps، MLOps، SRE یا Infrastructure Engineering
- تسلط مناسب به Linux و Python و توانایی توسعه ابزارهای Automation و Infrastructure Tooling
- تجربه عملی در مدیریت و نگهداری Kubernetes و Docker در محیطهای Production
- تجربه کار با Helm و ArgoCD و آشنایی با مفاهیم GitOps و Modern Deployment
- تجربه طراحی و پیادهسازی فرآیندهای CI/CD
- تجربه یا آشنایی عملی با Kubeflow، MLflow و ML Workflows
- تجربه پیادهسازی Monitoring و Alerting با ابزارهایی مانند Prometheus و Grafana
- آشنایی با PyTorch / TensorFlow و مفاهیم مرتبط با اجرای workloadهای ML
- درک مناسب از GPU Hardware و GPU Diagnostics شامل ECC، PCIe، Thermal و Link Stability
- آشنایی با مفاهیم Networking، Security و System Administration
- آشنایی با زیرساختهای Cloud و On-Premise
- تجربه عملی در طراحی و مدیریت GPU Cluster و زیرساختهای محاسباتی AI/ML
- تجربه کار با NVIDIA GPU، CUDA و ابزارهای GPU Diagnostics
- تجربه استقرار و نگهداری LLM و AI Workloads روی GPU
- آشنایی با Model Serving، Inference Infrastructure و GPU Scheduling
- تجربه طراحی زیرساختهای Highly Available، Scalable و Fault-Tolerant
- تجربه کار با Observability، Logging و Distributed Tracing
- تجربه کار با Cloud Platforms و سرویسهای مرتبط با Infrastructure و ML
نیازمندیها
- Python
- MLOps
- یادگیری ماشین