شرح موقعیت
شرح شغل و وظایف ما به یک باSenior Data Engineer با بیش از 5 سال سابقه کاری نیاز داریم که بتواند در طراحی، توسعه و نگهداری زیرساخت داده پروژه هوشمندسازی زنجیره تأمین نقش کلیدی داشته باشد و دادههای مورد نیاز برای تحلیلهای پیشرفته، مدلهای پیشبینی، سیستمهای هوشمند و محصولات مبتنی بر AI را فراهم کند. این نقش ترکیبی از مهندسی داده، طراحی و توسعه Pipelineهای داده، مدیریت معماری Data Platform و همکاری نزدیک با تیمهای Data Science، Backend و Product است. فرد مناسب برای این موقعیت باید توانایی طراحی سیستمهای داده مقیاسپذیر، کار با دادههای حجیم، حل مسائل کیفیت داده و ایجاد فرآیندهای قابل اتکا برای جمعآوری، پردازش و ارائه داده را داشته باشد. شرایط موردنیاز: مواردی که امتیاز محسوب میشوند: مهارتهای فنی مورد نیاز Programming Languages Database & Storage Data Engineering Data Platform Tools & Technologies
مسئولیتها
- طراحی، توسعه و نگهداری Pipelineهای ETL/ELT برای استخراج، پردازش و انتقال داده از منابع مختلف
- توسعه فرآیندهای Data Ingestion برای دریافت دادههای ساختاریافته و غیرساختاریافته از منابع مختلف شامل Database، API، فایلها و سرویسهای خارجی
- پیادهسازی فرآیندهای پردازش داده به صورت Batch و Near Real-time
- طراحی و توسعه معماری Data Lake / Lakehouse برای مدیریت دادههای حجیم پروژه
- طراحی و نگهداری لایههای مختلف داده شامل Raw، Processed، Analytics و Feature Layer
- توسعه فرآیندهای پاکسازی، استانداردسازی، نرمالسازی و آمادهسازی دادهها
- پیادهسازی مکانیزمهای Data Quality، Data Validation و کنترل صحت دادهها
- شناسایی و رفع مشکلات مربوط به دادههای ناقص، تکراری، ناسازگار و غیرقابل اعتماد
- طراحی و بهینهسازی Data Model و Schemaهای مورد استفاده در تحلیل و پردازش داده
- توسعه و بهینهسازی Queryهای SQL برای پردازش و تحلیل دادههای حجیم
- طراحی و پیادهسازی فرآیندهای Monitoring، Logging و Alerting برای Pipelineها و Jobهای داده
- پایش عملکرد فرآیندهای پردازش داده، شناسایی خطاها و انجام Root Cause Analysis
- همکاری نزدیک با تیم Data Science برای آمادهسازی Datasetها، Feature Engineering و ارائه داده مورد نیاز مدلهای Machine Learning
- فراهمسازی زیرساخت داده مورد نیاز برای توسعه RAG، LLM و AI Agentهای سازمان
- توسعه فرآیندهای خودکارسازی داده و کاهش فعالیتهای دستی در چرخه پردازش اطلاعات
- مستندسازی معماری داده، Pipelineها، فرآیندهای پردازشی و استانداردهای داده
- همکاری با تیمهای Product، Backend و Business برای تبدیل نیازمندیهای کسبوکار به راهکارهای دادهای قابل استفاده
- حداقل 5 سال سابقه کار مرتبط در حوزه Data Engineering
- تسلط پیشرفته به SQL و توانایی نوشتن، بررسی و بهینهسازی Queryهای پیچیده
- تجربه عملی کار با PostgreSQL و دیتابیسهای رابطهای
- تجربه طراحی و توسعه Pipelineهای ETL/ELT
- تسلط به Python برای پردازش داده، توسعه ابزارهای Data Engineering و Automation
- تجربه کار با معماریهای Data Warehouse، Data Lake یا Lakehouse
- تجربه کار با دادههای حجیم و فرآیندهای پردازش داده
- توانایی طراحی Data Model و ساختارهای ذخیرهسازی مناسب
- تجربه کار با ابزارهای مدیریت Workflow و Orchestration مانند Airflow
- تجربه کار با Docker و محیطهای توسعه نرمافزاری
- آشنایی با Git و فرآیندهای توسعه نرمافزار
- توانایی تحلیل مشکلات داده، Debug کردن Pipelineها و حل مسئله به صورت مستقل
- توانایی مستندسازی و ارتباط موثر با تیمهای فنی و کسبوکار
- تجربه کار با Apache Spark و پردازش Distributed Data
- تجربه کار با Kafka و Streaming Data Pipeline
- تجربه CDC و ابزارهایی مانند Debezium
- تجربه کار با Data Lakehouse
- تجربه کار با ClickHouse یا سایر
- تجربه کار با Elasticsearch و Vector Databaseها
- تجربه طراحی Data Platform در مقیاس سازمانی
- تجربه کار با Data Governance، Data Lineage و Metadata Management
- تجربه همکاری در پروژههای AI، Machine Learning و LLM-based Applications
- آشنایی با RAG Pipeline و معماری Agent-based AI Systems
- Python (Intermediate/Advanced)
- SQL (Advanced)
- PostgreSQL (Advanced)
- Relational Database Design
- Query Optimization
- Data Modeling
- ETL / ELT Pipeline Development
- Data Ingestion
- Data Cleaning & Transformation
- Data Quality & Validation
- Workflow Automation
- Data Warehouse
- Data Lake
- Lakehouse Architecture
- Object Storage Concepts
- Apache Airflow
- Docker
- Git
- Linux
نیازمندیها
- Python
- Databases
- ETL