System Engineer/Site Reliability Engineer (m/w/d)
Für unser Geschäftsfeld Omnichannel im Tribe Omnikanal, Portal und API Enabler (OMCOPA) suchen wir dich in Vollzeit als System Engineer/Site Reliability Engineer (m/w/d) in Aschheim, Karlsruhe bzw. Münster. Hier arbeitest du mit deinen Kolleg*innen standortübergreifend und mit vielfältigen, teilweise englischsprachigen Schnittstellen zusammen.
Beachte: Für diese Aufgabe ist Rufbereitschaft erforderlich.
Tätigkeiten
- Du bist für die Einführung und Weiterentwicklung von SRE-/DevOps-Praktiken verantwortlich und berätst Entwicklungsteams auf dem Weg zu stabilen, produktionsreifen Services.
- Du stellst die Systemstabilität durch Observability, Monitoring, Alerting und Kapazitätsbetrachtungen sicher, z. B. mit Prometheus, Grafana oder Dynatrace.
- Du unterstützt den zuverlässigen Betrieb cloudnativer Anwendungen auf Kubernetes, insbesondere im Umfeld von Google Cloud Platform und Google Kubernetes Engine.
- Du analysierst Störungen im 2nd-/3rd-Level-Support, unterstützt die Incident Response und etablierst gemeinsam mit dem Team blameless Post-Mortem-Analysen, um systematisch aus Incidents zu lernen und nachhaltige Verbesserungen abzuleiten.
- Du arbeitest mit dem Team an der Optimierung von Betriebsprozessen, Runbooks, Automatisierungen und Standards zur Reduktion von Toil sowie zur Steigerung von Verfügbarkeit und Kundenzufriedenheit.
- Du berücksichtigst betriebliche Security- und Compliance-Anforderungen im Rahmen von Production Readiness, Zugriffen, Runbooks und Incident-Prozessen.
Anforderungen
- Du hast ein abgeschlossenes Studium der Informatik sowie mehrjährige einschlägige Berufserfahrung oder eine vergleichbare Qualifikation.
- Du besitzt praktische Erfahrung im stabilen Betrieb, in der Skalierung und in der Fehleranalyse produktionskritischer Anwendungen.
- Du bringst fundierte Kenntnisse in SRE-/DevOps-Methoden, Observability, Monitoring, Incident Response, SLIs, SLOs, Error Budgets und Toil Reduction mit und hast Erfahrung in der Zusammenarbeit mit agilen Entwicklungsteams.
- Du hast praktische Erfahrung mit Google Cloud Platform und Google Kubernetes Engine oder bringst fundierte Erfahrung mit Kubernetes in produktionskritischen Cloud-Umgebungen mit.
- Du verfügst über Kenntnisse in Automatisierung, Infrastructure as Code und Script- oder Programmiersprachen wie Bash, Python, Go, Node.js oder vergleichbaren Technologien sowie über Erfahrung mit Git.
- Du kannst Entwicklungsteams methodisch und technisch beraten, komplexe Zusammenhänge verständlich erklären und auch in kritischen Situationen strukturiert handeln.
- Du verstehst SRE nicht nur als Tooling- oder Betriebsrolle, sondern als Ansatz, um Entwicklungsteams zu befähigen und Services nachhaltig zuverlässiger zu machen.
- Du zeichnest dich durch Teamfähigkeit, analytisches Denken, Kommunikationsstärke, Eigeninitiative und eine selbständige Arbeitsweise aus.
Team
Atruvia ist stolz darauf, Teil der Genossenschaftlichen FinanzGruppe zu sein. Diese Zugehörigkeit unterscheidet den Digitalisierungspartner klar von anderen Unternehmen. Denn in einer Genossenschaft zählt jede Stimme. Alle tragen Verantwortung. Dafür braucht es ein stabiles Wertefundament.
Bei Atruvia bedeutet das: füreinander da sein, offen, respektvoll und ehrlich miteinander umgehen, eigenverantwortlich handeln und ergebnisorientierte Entscheidungen treffen.
Bewerbungsprozess
Nachdem du unserer Datenschutzerklärung zugestimmt hast, übernehmen wir dein Profil in unser Bewerbermanagementsystem. Bitte fülle dort anschließend den hinterlegten Fragebogen aus. Wir begleiten dich dann durch die nächsten Schritte im Bewerbungsprozess, idealerweise folgt ein Gespräch mit der zuständigen Fachabteilung.
Wir freuen uns auf deine Bewerbung!