شرح موقعیت
پرتو یک پلتفرم تحلیل داده است که فهمیدن شبکههای اجتماعی و فضای آنلاین را برای سازمانها، نهادها و کسبوکارهای بزرگ سادهتر میکند. ما دادهی شبکههای اجتماعی و رسانهها را کرال میکنیم، پردازش میکنیم، و در قالب تحلیل قابل فهم ارائه میدهیم. تیم در حال رشد است و دنبال یک Machine Learning Engineer با تمرکز روی NLP و Clustering هستیم. یکی از چالشهای اصلی ما این است که از بین حجم بزرگی از محتوای شبکههای اجتماعی، موضوعها، رویدادها و جریانهای مشابه را بهصورت خودکار پیدا کنیم. برای این کار با حجم بالایی از embeddingهای متنی، الگوریتمهای خوشهبندی و مدلهای زبانی سر و کار داریم و نیاز داریم این فرایند علاوه بر دقت، در مقیاس بالا هم قابل اجرا باشد. استک و ابزارها Python / NumPy / Scikit-learn HDBSCAN / K-Means / Faiss PCA / UMAP Milvus / Elasticsearch Embedding Models / LLMs کاری که انجام میدهی طراحی و توسعهی سیستم خوشهبندی محتوای شبکههای اجتماعی. از انتخاب و ارزیابی الگوریتم مناسب تا اجرای آن روی چندصد هزار یا چند میلیون embedding متنی. کار با الگوریتمهایی مثل HDBSCAN و K-Means و ابزارهایی مثل Faiss، تنظیم پارامترها و تحلیل کیفیت خوشههایی که تولید میشوند. طراحی راهکار برای دادههای واقعی؛ جایی که بعضی دادهها نویز هستند، اندازهی خوشهها متفاوت است و چگالی دادهها همیشه یکسان نیست. استفاده از روشهایی مثل PCA و UMAP برای کاهش ابعاد و بهینهتر کردن فرایند تحلیل و Clustering. طراحی pipeline مقیاسپذیر برای پردازش دادههای جدید؛ به شکلی که مدل فقط یک آزمایش روی Notebook نباشد و بتواند بهصورت پایدار در Production اجرا شود. استخراج نمونهی نماینده، عنوان یا توضیح معنایی برای هر خوشه و در صورت نیاز استفاده از مدلهای زبانی برای نامگذاری یا خلاصهسازی Clusterها. خواندن embeddingها از Milvus، ذخیره و versioning نتایج در Elasticsearch و بهینهسازی مصرف RAM و CPU در پردازش حجم بالای داده. تعریف و بررسی معیارهای ارزیابی مثل Silhouette Score، پایداری Clusterها و ارزیابی انسانی نمونههای خروجی. چی برای ما مهم است تسلط خوب به Python، NumPy و Scikit-learn. تجربهی عملی با الگوریتمهای Clustering مثل HDBSCAN، K-Means یا روشهای مشابه. درک خوب از embeddingهای متنی، فضای برداری و معیارهایی مثل Cosine Similarity. آشنایی با Faiss یا ابزارهای مشابه برای جستوجو و پردازش حجم بالای بردارها. تجربهی کار با PCA، UMAP یا روشهای مشابه کاهش ابعاد. توانایی تحلیل رفتار الگوریتمهای Unsupervised و تنظیم پارامترها بر اساس ویژگی داده. آشنایی با پردازش Batch و بهینهسازی مصرف حافظه و منابع پردازشی. توانایی تبدیل یک مدل یا آزمایش تحقیقاتی به pipeline قابل اجرا و قابل نگهداری در Production. خوب است اگر داشته باشی تجربهی کار با مدلهای زبانی و embeddingهای فارسی. آشنایی یا تجربهی عملی با Milvus یا سایر Vector Databaseها. تجربهی کار با Elasticsearch. تجربهی Clustering روی چندصد هزار تا چند میلیون بردار. آشنایی با Docker و Linux. تجربهی استفاده از LLMها برای نامگذاری، خلاصهسازی یا توصیف خودکار Clusterها. مزایای همکاری با ما: انعطاف کامل: دورکاری، هیبرید، یا حضوری در دفتر تهران. ساعت ورود و خروج نداریم. ابزار AI برای همهی اعضای تیم فراهم میشود. چالشهای فنی گسترده: چند میلیارد رکورد داده، سیستمهایی که در مقیاس بزرگ کار میکنند، استک متنوع. بیمهی تکمیلی، سفر سالانهی گروهی، وام دورهای، و امکان امریهی دانشبنیان برای آقایان واجد شرایط.
نیازمندیها
- یادگیری ماشین
- Python
- numpy