بازگشت به فرصت‌ها
لوگوی مشاور مدیریت و خدمات ماشینی تامین | Tamin ICT
جدیدفارسی

کارشناس مدل‌های یادگیری ماشینی (ML Inference Engineer)

مشاور مدیریت و خدمات ماشینی تامین | Tamin ICT·تهران·امروز

حضوریمیان‌سطحقراردادیتوافقی

مشاور مدیریت و خدمات ماشینی تامین | Tamin ICT

شرح موقعیت

شرح شغل بهینه‌سازی مدل‌های یادگیری ماشین برای اجرای استنتاج با کارایی بالا در محیط عملیاتی، با تمرکز بر کاهش تأخیر پاسخ‌گویی، افزایش توان عملیاتی، بهبود بهره‌وری استفاده از GPU، مدیریت بهینه حافظه و ارتقای عملکرد سامانه‌های ارائه سرویس مدل. شرایط احراز و الزامات مزیت محسوب می‌شود

مسئولیت‌ها

  • بهینه‌سازی عملکرد استنتاج مدل‌های زبانی بزرگ، مدل‌های بینایی ماشین و مدل‌های گفتار و صوت.
  • اندازه‌گیری و ارزیابی تأخیر پاسخ‌گویی، توان عملیاتی، تعداد درخواست‌های هم‌زمان و میزان بهره‌برداری از GPU.
  • بهینه‌سازی مدل‌ها با استفاده از روش‌هایی مانند کوانتیزه‌سازی (Quantization)، کامپایل، پردازش دسته‌ای (Batching)، ذخیره‌سازی نتایج در حافظه نهان (Caching) و سایر روش‌های بهینه‌سازی.
  • کار با چارچوب‌های استنتاج مدل مانند vLLM، TensorRT، ONNX Runtime، TorchServe یا Ray Serve.
  • بهینه‌سازی مصرف حافظه GPU و نحوه اجرای مدل‌ها.
  • طراحی راهبردهای کارآمد برای پردازش دسته‌ای درخواست‌ها و زمان‌بندی آن‌ها.
  • شناسایی و بررسی گلوگاه‌های عملکردی در لایه‌های مدل، GPU، شبکه و زیرساخت ارائه سرویس.
  • طراحی و پیاده‌سازی آزمون‌های ارزیابی عملکرد استنتاج با قابلیت تکرارپذیری.
  • همکاری با مهندسان یادگیری ماشین برای آماده‌سازی مدل‌ها جهت بهره‌برداری در محیط عملیاتی.
  • همکاری با مهندسان عملیات یادگیری ماشین (MLOps) در زمینه زیرساخت ارائه سرویس مدل‌ها در محیط عملیاتی.
  • تسلط بر زبان برنامه‌نویسی Python و دانش قوی در زمینه یادگیری عمیق.
  • درک عمیق از فرایند استنتاج مدل‌های یادگیری ماشین و معماری مدل‌ها.
  • تجربه در اجرای استنتاج با PyTorch و بهینه‌سازی پردازش با GPU.
  • تجربه کار با حداقل یکی از چارچوب‌های استنتاج مورد استفاده در محیط عملیاتی.
  • آشنایی با مفاهیم پردازش دسته‌ای، اجرای هم‌زمان درخواست‌ها، تأخیر پاسخ‌گویی، توان عملیاتی و حافظه GPU.
  • مهارت بالا در تحلیل عملکرد، پروفایل‌گیری (Performance Profiling) و اشکال‌زدایی.
  • تجربه کار با سیستم‌عامل Linux و فناوری Docker.
  • تجربه کار با CUDA، TensorRT، Triton یا ابزارهای پروفایل‌گیری CUDA.
  • تجربه کار با vLLM و ارائه سرویس مدل‌های زبانی بزرگ.
  • تجربه در زمینه کوانتیزه‌سازی مدل‌ها با قالب‌ها و دقت‌های عددی مانند FP16، INT8 یا MXFP4.
  • تجربه کار با سامانه‌های استنتاج توزیع‌شده.
  • تجربه در بهینه‌سازی مدل‌ها روی پردازنده‌های گرافیکی NVIDIA.

نیازمندی‌ها

  • یادگیری ماشین
  • ML
  • Python
  • بهینه سازی
  • مستندسازی