
این فرصت شغلی چقدر برای من مناسب است؟
محیط کاری ما
• زیرساخت on-prem با high traffic
• ترکیب معماری monolith و microservices روی VM و Docker
• Backend با .NET Core و frontend با Next.js
• داده روی SQL Server، MongoDB و Redis؛ messaging با RabbitMQ
• CI/CD روی Azure DevOps Server (on-premise)
• Monitoring و logging با Prometheus، Grafana، Zabbix و ELK
شرح وظایف و مسئولیتها
• تدوین و اجرای roadmap فنی DevOps و Automation
• تعریف KPIهای فنی شامل Availability، MTTR، Deployment Frequency و Change Failure Rate و ارائه گزارش قابل فهم برای مدیران
• ارزیابی تکنولوژیهای جدید و ارائه راهکارهای قابل اجرا با در نظر گرفتن هزینه و ریسک
• همکاری نزدیک با تیمهای Backend، Frontend، QA، Infrastructure، Security و Product
CI/CD و Release
• طراحی، توسعه و مدیریت pipelineهای CI/CD روی Azure DevOps Server از Build و Test تا Release و Deployment
• طراحی و پیادهسازی Zero-Downtime Deployment و الگوهای Rolling، Blue/Green و Canary روی زیرساخت VM و Docker
• استانداردسازی فرآیند release برای هر دو stack یعنی .NET Core و Next.js و حذف مراحل دستی و خطاپذیر
زیرساخت، Container و Automation
• مدیریت و بهینهسازی محیط production روی Linux و Windows Server شامل IIS
• مدیریت لایه virtualization، capacity planning و بهینهسازی مصرف منابع و هزینه زیرساخت
• مدیریت Docker در مقیاس production، استانداردسازی imageها و راهاندازی و نگهداری registry داخلی
• طراحی و پیادهسازی Infrastructure as Code و Configuration Management با Ansible و ابزارهای مشابه
• نگهداری configuration زیرساخت در Version Control و حرکت به سمت زیرساخت تکرارپذیر
• توسعه script و ابزارهای Automation با Python، Bash و PowerShell
• تدوین استراتژی میانمدت container orchestration و ارزیابی مهاجرت به Kubernetes
Reliability و Production
• طراحی و پیادهسازی High Availability، Fault Tolerance و Scalability برای سرویسهای high traffic
• توسعه Monitoring، Alerting، Logging و Observability روی stack موجود و کاهش alert noise
• تعریف و پایش شاخصهای Reliability، Availability، Performance و Capacity
• مدیریت رخدادهای مهم production، هدایت شرایط بحرانی و انجام Root Cause Analysis
• ایجاد و مدیریت فرآیندهای Incident Management، Postmortem و Problem Management و کاهش MTTR
• طراحی و اجرای Backup و Disaster Recovery و تست دورهای restore
Security
• مدیریت secretها، credentialها، certificateها و Access Control
• پیادهسازی Security Scan، Vulnerability Management و Security Gate در pipeline
• همکاری با تیم Security برای hardening و کاهش ریسکهای زیرساختی
• مستندسازی معماری، فرآیندها، Configurationها، Runbookها و استانداردهای عملیاتی
تجربه و شایستگیها
• حداقل 8 سال سابقه حرفهای در DevOps، SRE، Infrastructure یا Platform Engineering
• حداقل 3 سال سابقه موفق در نقش Lead یا Technical Lead و رهبری تیم
• تجربه اثباتشده در مدیریت محیطهای production در مقیاس بزرگ و high traffic
• تسلط عمیق به Linux و Windows Server
• تسلط عملی به Docker در production
• تجربه طراحی و مدیریت CI/CD در مقیاس سازمانی، ترجیحاً با Azure DevOps
• تجربه عملی Infrastructure as Code و Automation با Ansible، Python، Bash یا PowerShell
• دانش مناسب در معماری Microservices و Distributed Systems
• تسلط به مفاهیم Network شامل DNS، HTTP/HTTPS، Load Balancing، Reverse Proxy، Routing و Firewall
• تجربه Monitoring، Logging و Observability
• توانایی تحلیل و رفع Root Cause مشکلات پیچیده production
• تجربه مدیریت Incidentهای مهم و تصمیمگیری در شرایط بحرانی
• تجربه طراحی فرآیندهای Disaster Recovery
• دانش مناسب در حوزه Infrastructure Security و DevSecOps
• توانایی مستندسازی Architecture و Runbook و تعریف KPIهای فنی
• توانایی هدایت، Mentoring و توسعه اعضای تیم
مزیت محسوب میشود
• Kubernetes و Helm
• Terraform
• Kafka
• تجربه با AWS، Azure، GCP یا ابرهای داخلی و محیطهای Hybrid
• تجربه عملیاتی با SQL Server، MongoDB و Redis در production
• آشنایی عملی با کاربردهای AI، LLM، AI Agents و AIOps در عملیات فناوری
ثبت مشکل و تخلف آگهی
ارسال رزومه برای فلای تودی