Khám phá việc làm Cloud & Infrastructure nổi bật.
Xem ngay

Senior/Expert Incident Responder (Platform) (24/7 Team)

Công ty Cổ phần Thanh toán số MobiFone
Tầng 30 - Tòa tháp C5 D’Capital, 119 Trần Duy Hưng, Phường Yên Hoà, Thành phố Hà Nội, Việt Nam, Yên Hòa, Hà Nội
Tại văn phòng
Đăng 5 giờ trước
Chuyên môn:
Lĩnh vực:
Dịch Vụ Tài Chính

3 Lý do để gia nhập công ty

  • Competitive salary & attractive benefits
  • Career growth and learning opportunities
  • Young, dynamic and collaborative culture

Mô tả công việc

Senior Incident Response (Platform) thuộc đội ngũ Incident Response vận hành 24/7, chịu trách nhiệm giám sát, phát hiện, phân tích và xử lý các sự cố liên quan đến hạ tầng, nền tảng kỹ thuật và các dịch vụ dùng chung của Công ty.

Vị trí đóng vai trò quan trọng trong việc đảm bảo tính sẵn sàng, ổn định và liên tục của các hệ thống trọng yếu, đặc biệt trên môi trường GCP và Private Cloud/Data Center. Bên cạnh việc xử lý sự cố trong thời gian thực, vị trí tham gia điều tra nguyên nhân, thực hiện RCA và phối hợp với các đội Platform, DevOps, SRE, Engineering để ngăn ngừa sự cố tái diễn.

Job Purpose: Đảm bảo các nền tảng và dịch vụ kỹ thuật trọng yếu được vận hành ổn định 24/7 thông qua:

  • Giám sát và phát hiện sớm các dấu hiệu bất thường, sự cố trên hệ thống.
  • Phân tích, troubleshooting và khôi phục dịch vụ khi xảy ra sự cố.
  • Tham gia xử lý và điều phối các Major/Critical Incident, đảm bảo phản ứng và khôi phục theo SLA.
  • Phân tích nguyên nhân gốc rễ (RCA) và triển khai các biện pháp phòng ngừa tái diễn.
  • Phối hợp với các team Platform, DevOps, SRE, Application và các bên liên quan trong quá trình xử lý sự cố.
  • Liên tục cải thiện monitoring, alerting, automation và khả năng phục hồi của hệ thống.

Responsibilities

1. 24/7 Incident Monitoring & Response

  • Tham gia trực vận hành và xử lý sự cố theo mô hình 24/7 Incident Response / On-call.
  • Theo dõi tình trạng hoạt động của hạ tầng, nền tảng và các dịch vụ dùng chung thông qua hệ thống monitoring/observability.
  • Tiếp nhận, phân loại và đánh giá mức độ nghiêm trọng, phạm vi ảnh hưởng của incident.
  • Trực tiếp troubleshooting và xử lý các sự cố liên quan đến Platform, Cloud, Container, Middleware và các dịch vụ dùng chung.
  • Thực hiện các biện pháp khôi phục dịch vụ nhanh chóng, giảm thiểu downtime và ảnh hưởng đến hệ thống/người dùng.
  • Tham gia xử lý và điều phối các Major Incident / Critical Incident, đảm bảo tiến độ và thông tin xử lý được cập nhật đầy đủ.
  • Thực hiện escalation tới các team chuyên môn khi incident vượt ngoài phạm vi xử lý.

2. Platform & Infrastructure Troubleshooting

  • Giám sát và xử lý sự cố trên các môi trường GCP và Private Cloud/Data Center.
  • Troubleshoot các nền tảng kỹ thuật dùng chung như Kong API Gateway, HashiCorp Vault, Temporal, Keycloak, GitLab và các middleware/platform services khác.
  • Phân tích các vấn đề liên quan đến availability, performance, resource utilization, connectivity và dependency giữa các hệ thống.
  • Phối hợp với Platform, DevOps, SRE, Application Engineering, Network, Security và các team liên quan để xử lý sự cố xuyên hệ thống.
  • Theo dõi incident đến khi dịch vụ được khôi phục ổn định và hoàn tất các bước xử lý sau incident.

3. Monitoring & Observability

  • Vận hành và khai thác các hệ thống monitoring, logging và observability như Splunk, ELK, Grafana, Prometheus, Zabbix, New Relic.
  • Phân tích metrics, logs, traces và alerts để phát hiện bất thường và xác định nguyên nhân sự cố.
  • Đánh giá chất lượng alert, phát hiện các cảnh báo thiếu hoặc chưa chính xác và đề xuất cải thiện.
  • Xây dựng/cải tiến dashboard, alert và monitoring nhằm nâng cao khả năng phát hiện sự cố sớm.
  • Theo dõi các chỉ số vận hành và xác định các dấu hiệu có nguy cơ dẫn đến incident.

4. Incident Investigation & RCA

  • Thực hiện điều tra sau sự cố, xác định Root Cause và Contributing Factors.
  • Tham gia thực hiện RCA, Post-Incident Review / Postmortem đối với các sự cố nghiêm trọng.
  • Phân tích recurring incident và các pattern bất thường để xác định các vấn đề mang tính hệ thống.
  • Đề xuất corrective/preventive actions nhằm giảm thiểu khả năng sự cố tái diễn.
  • Theo dõi việc thực hiện các action item sau incident và đánh giá hiệu quả của các biện pháp khắc phục.
  • Xây dựng và cập nhật Runbook, Troubleshooting Guide, Incident Playbook phục vụ vận hành 24/7.

5. Automation & Continuous Improvement

  • Tự động hóa các thao tác kiểm tra, chẩn đoán và khôi phục hệ thống nhằm rút ngắn MTTD/MTTR.
  • Sử dụng Python, Bash hoặc Go để xây dựng các script/tool hỗ trợ incident response và vận hành.
  • Đề xuất các cải tiến về monitoring, alerting, automation và operational process.
  • Phối hợp với Platform/DevOps/SRE để cải thiện system resiliency, fault tolerance và recoverability.
  • Tham gia xây dựng và cải tiến các tiêu chuẩn vận hành, quy trình escalation và cơ chế ứng phó sự cố.

6. Incident Coordination & Knowledge Sharing

  • Đóng vai trò đầu mối kỹ thuật trong quá trình xử lý các incident phức tạp liên quan đến Platform.
  • Chủ động phối hợp với các team Engineering, Product, Security, Network và các bên liên quan để xử lý sự cố.
  • Hỗ trợ các thành viên trong team trong việc troubleshooting và xử lý các incident phức tạp.
  • Chia sẻ kiến thức, kinh nghiệm xử lý sự cố và cập nhật tài liệu vận hành.
  • Tham gia xây dựng và cải thiện knowledge base phục vụ công tác Incident Response.

Yêu cầu công việc

Trình độ học vấn & kinh nghiệm

  • Tốt nghiệp Đại học chuyên ngành Công nghệ thông tin, Kỹ thuật phần mềm, Hệ thống thông tin hoặc các ngành liên quan.
  • Tối thiểu 03 năm kinh nghiệm trong các vị trí Incident Response, SRE, DevOps, Platform Engineer, System Engineer, Infrastructure Engineer hoặc tương đương.
  • Có kinh nghiệm thực tế trong môi trường Production System có yêu cầu cao về availability và reliability.
  • Có kinh nghiệm trực vận hành 24/7 và xử lý production incident là lợi thế.
  • Có kinh nghiệm troubleshooting và xử lý sự cố trên Cloud và/hoặc Data Center.

Kiến thức & năng lực chuyên môn

  • Có kinh nghiệm vận hành và troubleshooting trên GCP, AWS, Azure hoặc Private Cloud.
  • Có kinh nghiệm với một hoặc nhiều nền tảng như Kong API Gateway, HashiCorp Vault, Keycloak, Temporal, GitLab hoặc các hệ thống tương đương.
  • Có kinh nghiệm sử dụng các công cụ monitoring/observability như Splunk, ELK, Grafana, Prometheus, Zabbix, New Relic.
  • Có kiến thức tốt về Linux, Networking, HTTP/API, DNS, TCP/IP, Load Balancing và các thành phần hạ tầng phổ biến.
  • Có kinh nghiệm với Docker, Kubernetes và container orchestration.
  • Có khả năng đọc và phân tích logs, metrics, traces để troubleshooting.
  • Có khả năng scripting/programming bằng Python, Bash hoặc Go.
  • Hiểu về High Availability, Scalability, Fault Tolerance, Disaster Recovery và System Resilience.
  • Có kinh nghiệm thực hiện RCA / Postmortem và xây dựng action plan sau sự cố.

Năng lực cá nhân

  • Tư duy phân tích và troubleshooting tốt, có khả năng nhanh chóng xác định vấn đề trong tình huống áp lực cao.
  • Chủ động, quyết đoán và có khả năng đưa ra phương án xử lý trong điều kiện thông tin chưa đầy đủ.
  • Có tinh thần ownership cao, theo sát incident đến khi dịch vụ được khôi phục ổn định.
  • Giao tiếp và phối hợp tốt với nhiều team trong quá trình xử lý Major/Critical Incident.
  • Sẵn sàng làm việc theo mô hình 24/7, On-call/Shift theo yêu cầu vận hành.
  • Có tinh thần học hỏi và liên tục cải thiện hệ thống, quy trình và năng lực xử lý sự cố.

Tại sao bạn sẽ yêu thích làm việc tại đây

Lương & Phụ cấp

  • Lương tháng 13, thưởng hiệu quả công việc năm (theo kết quả kinh doanh của công ty).
  • Phụ cấp ăn trưa: 730.000đ/tháng.
  • Phép năm: Tối đa 15 ngày/năm (theo cấp nhân sự).
  • Sức khỏe: Bảo hiểm xã hội, BH sức khỏe và khám sức khỏe định kỳ hàng năm.
  • Máy tính xách tay, màn hình và các phương tiện/tài khoản/công cụ cần thiết khác cho công việc.

Cơ hội nghề nghiệp

  • Xét tăng lương hàng năm và cơ hội thăng tiến.
  • Công nhận và khen thưởng ở cấp độ nhóm và Công ty.

Môi trường làm việc

  • Môi trường làm việc trẻ trung, năng động và hợp tác.
  • Teambuilding hàng quý/ hàng năm & các sự kiện nội bộ gắn kết.

Công ty Cổ phần Thanh toán số MobiFone

Mô hình công ty
Sản phẩm
Lĩnh vực công ty
Dịch Vụ Tài Chính
Quy mô công ty
51-150 nhân viên
Quốc gia
Vietnam
Thời gian làm việc
Thứ 2 - Thứ 6
Làm việc ngoài giờ
Không có OT

Việc làm tương tự dành cho bạn

Nhận các việc làm tương tự qua email Nhận thông báo