فلای تودی
فلای تودی

Monitoring TeamLead

تهران، حشمتیه
تمام وقت
شنبه تا چهارشنبه 09:00 الی 18:00
-
وام -پاداش -امریه‌ی سربازی -بیمه درمان تکمیلی -کمک هزینه دوره آموزشی -بسته ها و هدایای مناسبتی

این فرصت شغلی چقدر برای من مناسب است؟

201 تا 500 نفر
گردشگری / هتلداری
شرکت ایرانی دارای مشتریان داخلی و خارجی
1384
Fly Today
خصوصی
توضیحات بیشتر

شاخص های کلیدی از نظر کارفرما

1 سال سابقه کار در گروه شغلی مشابه
Elastic Search - متوسط
Zabbix - متوسط

شرح شغل و وظایف

سرپرستی، برنامه‌ریزی و مدیریت عملکرد تیم مانیتورینگ
نظارت مستمر بر وضعیت سرویس‌ها، زیرساخت و سیستم‌های حیاتی شرکت
مدیریت و بهینه‌سازی فرآیندهای Monitoring، Alerting و Incident Management
تحلیل و بررسی رخدادها، هشدارها و اختلالات سرویس‌ها و پیگیری تا رفع کامل Incident
تعریف، بازبینی و بهینه‌سازی Alertها و Thresholdهای مانیتورینگ
کار با Elastic Stack جهت مانیتورینگ، Log Management و تحلیل رخدادها
کار با Zabbix جهت Monitoring زیرساخت، سرورها، سرویس‌ها و تجهیزات شبکه
تحلیل Logها و شناسایی الگوهای غیرعادی و خطاهای تکرارشونده
همکاری نزدیک با تیم‌های Infrastructure، Network، DevOps، Development و Support برای رفع مشکلات
مدیریت Escalation و ارجاع صحیح Incidentها به تیم‌های مربوطه
تهیه گزارش‌های دوره‌ای از وضعیت Monitoring، Incidentها، Downtime و عملکرد تیم
شناسایی نقاط ضعف فرآیند Monitoring و ارائه راهکار برای افزایش Reliability و Availability سرویس‌ها
مستندسازی فرآیندها، Runbookها، رخدادهای مهم و راهکارهای رفع Incident
آموزش، ارزیابی و توسعه اعضای تیم Monitoring
نظارت بر اجرای صحیح شیفت‌ها و اطمینان از پوشش مناسب Monitoring در تمام ساعات
مشارکت در بهبود فرآیندهای Incident، Problem و Root Cause Analysis (RCA)
بررسی و تحلیل رخدادهای تکرارشونده و ارائه اقدامات پیشگیرانه برای جلوگیری از وقوع مجدد

الزامات تخصصی:
حداقل 5 سال سابقه کاری مرتبط در حوزه Monitoring، NOC، Infrastructure یا Operations
حداقل 1 تا 2 سال تجربه سرپرستی یا لید کردن تیم
تسلط عملی به Elastic Stack / ELK
تسلط به Zabbix و مفاهیم Monitoring و Alerting
آشنایی مناسب با مفاهیم Linux و Windows Server
آشنایی با مفاهیم شبکه شامل TCP/IP، DNS، HTTP/HTTPS، Routing و Switching
توانایی تحلیل Log و Troubleshooting سرویس‌ها
آشنایی با مفاهیم Incident Management، Escalation و RCA
آشنایی با مفاهیم Availability، SLA، SLO و Service Monitoring
توانایی کار با ابزارهای Ticketing و ثبت و پیگیری Incidentها
توانایی تهیه مستندات فنی و Runbook
توانایی تحلیل داده‌های Monitoring و ارائه گزارش مدیریتی
استفاده عملی از AI یکی از مهارت‌های مهم این موقعیت شغلی است

مهارت‌های مدیریتی و رفتاری:
توانایی مدیریت و هدایت تیم در محیط عملیاتی و حساس
قدرت تصمیم‌گیری سریع در شرایط بحرانی
مسئولیت‌پذیری بالا و پیگیری تا حصول نتیجه
توانایی مدیریت فشار کاری و Incidentهای بحرانی
مهارت ارتباطی بالا و توانایی تعامل موثر با تیم‌های فنی مختلف
توانایی تقسیم وظایف و مدیریت اولویت‌ها
توانایی آموزش و انتقال دانش به اعضای تیم
نگاه فرآیندی و علاقه‌مند به بهبود مستمر
دقت بالا و حساسیت نسبت به Availability و پایداری سرویس‌ها

مزیت محسوب می‌شود:
تجربه کار در محیط‌های High Traffic / High Availability
تجربه فعالیت در شرکت‌های تکنولوژی، E-commerce یا پلتفرم‌های آنلاین
آشنایی با Prometheus / Grafana
آشنایی با APM و Observability
آشنایی با مفاهیم DevOps و CI/CD
آشنایی با ابزارهای Automation و Scripting مانند Bash یا Python
تجربه طراحی Dashboardهای حرفه‌ای Monitoring
تجربه تعریف و بهینه‌سازی فرآیندهای On-Call و Incident Response

شرایط احراز شغل

جنسیت
ترجیحاً آقا
نرم افزارها
Elastic Search| متوسط Zabbix| متوسط

ثبت مشکل و تخلف آگهی

ارسال رزومه برای فلای تودی