بازگشت به فرصت‌ها
لوگوی پرتو | Parto
جدیدفارسی

NLP-Clustering) Machine Learning Engineer-آقا-دورکاری)

پرتو | Parto·تهران·امروز

دورکاریمیان‌سطحقراردادیتوافقی

شرح موقعیت

پرتو یک پلتفرم تحلیل داده است که فهمیدن شبکه‌های اجتماعی و فضای آنلاین را برای سازمان‌ها، نهادها و کسب‌وکارهای بزرگ ساده‌تر می‌کند. ما داده‌ی شبکه‌های اجتماعی و رسانه‌ها را کرال می‌کنیم، پردازش می‌کنیم، و در قالب تحلیل قابل فهم ارائه می‌دهیم. تیم در حال رشد است و دنبال یک Machine Learning Engineer با تمرکز روی NLP و Clustering هستیم. یکی از چالش‌های اصلی ما این است که از بین حجم بزرگی از محتوای شبکه‌های اجتماعی، موضوع‌ها، رویدادها و جریان‌های مشابه را به‌صورت خودکار پیدا کنیم. برای این کار با حجم بالایی از embeddingهای متنی، الگوریتم‌های خوشه‌بندی و مدل‌های زبانی سر و کار داریم و نیاز داریم این فرایند علاوه بر دقت، در مقیاس بالا هم قابل اجرا باشد. استک و ابزارها Python / NumPy / Scikit-learn HDBSCAN / K-Means / Faiss PCA / UMAP Milvus / Elasticsearch Embedding Models / LLMs کاری که انجام می‌دهی طراحی و توسعه‌ی سیستم خوشه‌بندی محتوای شبکه‌های اجتماعی. از انتخاب و ارزیابی الگوریتم مناسب تا اجرای آن روی چندصد هزار یا چند میلیون embedding متنی. کار با الگوریتم‌هایی مثل HDBSCAN و K-Means و ابزارهایی مثل Faiss، تنظیم پارامترها و تحلیل کیفیت خوشه‌هایی که تولید می‌شوند. طراحی راهکار برای داده‌های واقعی؛ جایی که بعضی داده‌ها نویز هستند، اندازه‌ی خوشه‌ها متفاوت است و چگالی داده‌ها همیشه یکسان نیست. استفاده از روش‌هایی مثل PCA و UMAP برای کاهش ابعاد و بهینه‌تر کردن فرایند تحلیل و Clustering. طراحی pipeline مقیاس‌پذیر برای پردازش داده‌های جدید؛ به شکلی که مدل فقط یک آزمایش روی Notebook نباشد و بتواند به‌صورت پایدار در Production اجرا شود. استخراج نمونه‌ی نماینده، عنوان یا توضیح معنایی برای هر خوشه و در صورت نیاز استفاده از مدل‌های زبانی برای نام‌گذاری یا خلاصه‌سازی Clusterها. خواندن embeddingها از Milvus، ذخیره و versioning نتایج در Elasticsearch و بهینه‌سازی مصرف RAM و CPU در پردازش حجم بالای داده. تعریف و بررسی معیارهای ارزیابی مثل Silhouette Score، پایداری Clusterها و ارزیابی انسانی نمونه‌های خروجی. چی برای ما مهم است تسلط خوب به Python، NumPy و Scikit-learn. تجربه‌ی عملی با الگوریتم‌های Clustering مثل HDBSCAN، K-Means یا روش‌های مشابه. درک خوب از embeddingهای متنی، فضای برداری و معیارهایی مثل Cosine Similarity. آشنایی با Faiss یا ابزارهای مشابه برای جست‌وجو و پردازش حجم بالای بردارها. تجربه‌ی کار با PCA، UMAP یا روش‌های مشابه کاهش ابعاد. توانایی تحلیل رفتار الگوریتم‌های Unsupervised و تنظیم پارامترها بر اساس ویژگی داده. آشنایی با پردازش Batch و بهینه‌سازی مصرف حافظه و منابع پردازشی. توانایی تبدیل یک مدل یا آزمایش تحقیقاتی به pipeline قابل اجرا و قابل نگهداری در Production. خوب است اگر داشته باشی تجربه‌ی کار با مدل‌های زبانی و embeddingهای فارسی. آشنایی یا تجربه‌ی عملی با Milvus یا سایر Vector Databaseها. تجربه‌ی کار با Elasticsearch. تجربه‌ی Clustering روی چندصد هزار تا چند میلیون بردار. آشنایی با Docker و Linux. تجربه‌ی استفاده از LLMها برای نام‌گذاری، خلاصه‌سازی یا توصیف خودکار Clusterها. مزایای همکاری با ما: انعطاف کامل: دورکاری، هیبرید، یا حضوری در دفتر تهران. ساعت ورود و خروج نداریم. ابزار AI برای همه‌ی اعضای تیم فراهم می‌شود. چالش‌های فنی گسترده: چند میلیارد رکورد داده، سیستم‌هایی که در مقیاس بزرگ کار می‌کنند، استک متنوع. بیمه‌ی تکمیلی، سفر سالانه‌ی گروهی، وام دوره‌ای، و امکان امریه‌ی دانش‌بنیان برای آقایان واجد شرایط.

نیازمندی‌ها

  • یادگیری ماشین
  • Python
  • numpy