بازگشت به فرصت‌ها
لوگوی موسسه باقر العلوم (ع) | Bagher Alolom
جدیدفارسی

LLM Training & Data Engineer (آقا-قم)

موسسه باقر العلوم (ع) | Bagher Alolom·قم·امروز

حضوریمیان‌سطحقراردادیتوافقی

موسسه باقر العلوم (ع) | Bagher Alolom

شرح موقعیت

ما یک تیم فنی و پژوهشی متشکل از فارغ‌التحصیلان و متخصصان دانشگاه‌های برتر ایران هستیم که روی توسعه و آموزش مدل‌های زبانی بزرگ بومی و راهکارهای پیشرفته هوش مصنوعی کار می‌کنیم. تمرکز ما بر حل مسائل واقعی و چالش‌برانگیز در حوزه LLM، ساخت و بهبود دیتاست‌های آموزشی، Post-Training، RAG و Agentهای هوشمند است. فضای تیم ما فنی، پژوهش‌محور و مبتنی بر یادگیری و تجربه عملی است و به دنبال افرادی هستیم که علاقه‌مند باشند در کنار یک تیم تخصصی، روی پروژه‌های جدی و راهبردی حوزه هوش مصنوعی کار کنند. این موقعیت شغلی به‌صورت حضوری است و حضور مستمر در شهر قم برای همکاری ضروری است. امکان جذب متقاضیان واجد شرایط به‌صورت سرباز امریه در شرکت نیز وجود دارد. پاک‌سازی، پردازش و کنترل کیفیت دیتاست‌های متنی، شامل شناسایی و حذف داده‌های تکراری، کم‌کیفیت و نامناسب طراحی و توسعه Pipelineهای مربوط به Filtering، Deduplication، Normalization و Quality Assessment آماده‌سازی Dataset برای مراحل مختلف Post-Training از جمله SFT و DPO اجرای Fine-tuning و Post-Training روی مدل‌های خانواده Qwen اجرای آزمایش‌های آموزشی و مقایسه مدل‌ها و Checkpointهای مختلف ارزیابی کیفیت مدل و تحلیل خطاها با هدف بهبود داده و فرآیند Training مشارکت در توسعه و ارزیابی سیستم‌های RAG مشارکت در توسعه AI Agentها و سیستم‌های مبتنی بر Tool Calling مهارت‌های مورد نیاز تسلط مناسب به Python آشنایی عملی با PyTorch و Hugging Face تجربه Fine-tuning مدل‌های زبانی آشنایی با SFT، LoRA و QLoRA توانایی کار با دیتاست‌های متنی و طراحی Pipelineهای پردازش داده آشنایی با Linux، Git و Docker مواردی که مزیت محسوب می‌شوند تجربه کار با ابزارها و فریم‌ورک‌های Fine-tuning و Post-Training مانند Axolotl، PEFT، Unsloth، LLaMA-Factory یا ابزارهای مشابه تجربه کار با GPU و آشنایی با Kubernetes و محیط‌های کلاستری برای اجرای workloadهای Training و Distributed Training آشنایی با DPO، RLHF، RLAIF یا سایر روش‌های Post-Training تجربه LLM Evaluation، طراحی Benchmark و Error Analysis آشنایی با Embedding، Retrieval، Reranking، Vector Database و Semantic Search تجربه عملی در توسعه RAG تجربه توسعه AI Agent و Tool Calling تجربه کار با داده‌های فارسی یا مدل‌های Multilingual

نیازمندی‌ها

  • LLM
  • Python