⚡ New

System Engineer/Site Reliability Engineer (m/w/d)

Atruvia

MünchenFull-timeMid LevelOn-site

Job Description

Overview

In diesem Role arbeitest du standortübergreifend an stabilen, produktionsreifen Services. Du führst SRE-/DevOps-Praktiken ein, berätst Entwicklungsteams und sicherst Systemstabilität durch Observability, Monitoring und Kapazitätsplanung. Du betreibst cloudnative Anwendungen auf Kubernetes mit Fokus auf GCP/GKE und leitest Incident-Response sowie blameless Post-Mortems.

Es geht darum, Betriebsprozesse zu optimieren, Toil zu reduzieren und Sicherheits- sowie Compliance-Anforderungen zu berücksichtigen. Die Position bietet hybrides Arbeiten, Rufbereitschaft und die Chance, die digitale Transformation in der Bankenwelt voranzutreiben.

Leistungen / Benefits
  • 30 Tage Urlaub
  • Hybrides Arbeiten (Remote + Büro)
  • Lebensarbeitszeitkonto (Sabbatical/Freistellung vor Rentenbeginn)
  • Betriebliche Altersvorsorge
  • Bike-Leasing / IT-Hardware-Leasing
  • Individuelle Weiterbildungsangebote
Verantwortungsbereiche
  • Einführung und Weiterentwicklung von SRE-/DevOps-Praktiken und Beratung von Entwicklungsteams
  • Sicherstellung der Systemstabilität durch Observability, Monitoring, Alerting und Kapazitätsplanung (Prometheus, Grafana, Dynatrace)
  • Betrieb cloudnativer Anwendungen auf Kubernetes, insbesondere GCP/GKE
  • Analyse von Störungen im 2nd-/3rd-Level-Support; Incident-Response unterstützen; blameless Post-Mortem-Analysen etablieren
  • Optimierung von Betriebsprozessen, Runbooks, Automatisierungen und Standards zur Toil-Reduktion
  • Berücksichtigung von Security- und Compliance-Anforderungen im Production Readiness-Kontext
Zentrale Anforderungen
  • Abgeschlossenes Studium der Informatik oder vergleichbare Qualifikation
  • Erfahrung im stabilen Betrieb, Skalierung und Fehleranalyse produktionskritischer Anwendungen
  • Fundierte Kenntnisse in SRE-/DevOps-Methoden, Observability, Monitoring, Incident Response, SLIs/SLOs, Error Budgets, Toil Reduction
  • Praktische Erfahrung mit Kubernetes in produktionskritischen Cloud-Umgebungen (GKE) oder vergleichbar
  • Kenntnisse in Automatisierung, Infrastructure as Code und Script-/Programmiersprachen (Bash, Python, Go, Node.js) sowie Git
  • Beratungskompetenz, klare Kommunikation und strukturiertes Handeln auch in Krisensituationen
  • Deutsch C1, Englisch B2
  • Rufbereitschaft erforderlich
  • Teamfähigkeit
  • Analytisches Denken
  • Kommunikationsstärke
  • Prometheus
  • Grafana
  • Dynatrace

Posted Today

Related Jobs

Related Searches

Apply Now