Beschäftigungsart
Vertrag
Industrie
Finanzdienstleistungen
Fachbereich
Incident Management, Application Monitoring
Ort
Luxemburg
Remote?
Nein
Homeoffice?
TBD
Vertragslaufzeit
Vertrag bis 31.01.2027
01
Aufgaben und Verantwortungen
- End-to-End-Verantwortung für den Incident-Lebenszyklus: Identifikation, Protokollierung, Kategorisierung, Priorisierung, Eskalation, Lösung, Abschluss und Post-Incident-Review.
- Design und Durchsetzung konsistenter SLAs/OLAs über Technologieteams und Drittparteien hinweg.
- Implementierung effektiver Protokolle für das Management schwerwiegender Störungen, einschliesslich War-Room-Aktivierung, Bridging und Krisenkommunikation.
- Integration von Incident-Daten mit Problemmanagement und Änderungskontrolle zur Reduzierung von Wiederholungen.
- Entwicklung klarer, zeitnaher und nicht-technischer Incident-Updates für Business-Stakeholder und das Senior Management.
- Erstellung standardisierter Incident-Berichte für Führungskräfte, die Folgenabschätzungen, Zeitplanaufschlüsselungen, Ursachen und Massnahmenpläne enthalten.
- Erstellung monatlicher oder vierteljährlicher Service-Health-Dashboards, die mit den Geschäftsbereichsleitern geteilt werden, um Transparenz und Vertrauen zu verbessern.
- Nutzung von Kommunikationskanälen (z.B. MS Teams-Benachrichtigungen, E-Mail-Bulletins, Intranet-Portale), die auf verschiedene Zielgruppen zugeschnitten sind.
- Einführung strukturierter Nachfassaktionen mit betroffenen Abteilungen, um das Vertrauen nach grösseren Störungen wiederherzustellen.
- Neugestaltung der Incident-Reporting-Struktur bei einem europäischen Vermögensverwalter, Einführung wöchentlicher Zusammenfassungen von Dienstunterbrechungen, die an C-Suite- und Vorstandsmitglieder verteilt werden.
- Automatisierte Incident-Briefing-Pakete unter Verwendung von Power BI- und ServiceNow-Integrationen, wodurch die Berichterstellungszeit um 70% reduziert wurde.
- Einführung eines zentralen Major Incident Registers mit Trendanalysen, das eine proaktive Minderung wiederkehrender Fehlerbilder ermöglicht.
- Erstellung von Trendanalysen und Dashboards sowie Ausschüssen, um L2- und L3-Teams zur kontinuierlichen Verbesserung herauszufordern.
- Leitung von Schulungs- und Simulationsübungen (Tabletop-Drills), um technische und geschäftliche Führungskräfte auf Szenarien mit hoher Schwere vorzubereiten.
- End-to-End-Observability über: Frontend-Applikationen (Web-, Desktop-, mobile Schnittstellen)
- Applikationsserver, Microservices usw.
- Middleware-Komponenten
- Geplante Batch-Jobs (Tagesabschluss, Monatsabschluss usw.)
- Dateibasierte Integrationen
- API-zu-API-Interaktionen
- Downstream-Outputs (Berichte, Zahlungsanweisungen, regulatorische Einreichungen, Kundenabrechnungen)
- Erkennung fehlender oder verzögerter Dateiankünfte
- Validierung der Dateiinhaltsintegrität: Grösse, Datensatzanzahl, Schema-Konformität, Abwesenheit von Fehler-Flags.
- Verfolgung von Batch-Job-Ausführungen, einschliesslich Start-/Endzeiten, Rückgabecodes, Ausnahme-Logs und Abhängigkeiten.
- Beobachtung von Integrations-Touchpoints, um eine erfolgreiche Nachrichtenübertragung und Bestätigung sicherzustellen.
- Automatisierte Abgleichsprüfungen zwischen Quell- und Zielsystemen (z.B. Anzahl der gesendeten vs. verarbeiteten Transaktionen).
- Intelligente Alarmierung bei logischen Anomalien, wie z.B. Nullsaldo-Positionen, doppelten Zahlungen oder nicht übereinstimmenden Währungsumrechnungen.
- Bereitstellung und Konfiguration von Enterprise-APM-Tools (Dynatrace, Datadog, AppDynamics, Splunk) zur Korrelation von Ereignissen über Systeme hinweg.
- Instrumentierung von Skripten und Backend-Prozessen zur Ausgabe benutzerdefinierter Metriken und Traces.
- Einsatz von synthetischem Monitoring und Heartbeat-Probes zur Simulation kritischer Workflows.
- Unterdrückung von Rauschen durch intelligente Alarmgruppierung, Deduplizierung und dynamische Schwellenwerte.
- Nahtlose Integration mit Incident-Management-Plattformen (z.B. ServiceNow) für die automatische Ticketerstellung.
- Bei einer Privatbank wurde eine Überwachungsschicht für Übertragungen entworfen und automatische Wiederholungsversuche oder Benachrichtigungen ausgelöst – wodurch unentdeckte Zahlungsfehler reduziert wurden.
- Implementierung von Integritätsprüfungen mittels Monitoring, die fehlerhafte Positionsdateien kennzeichnen, bevor nachgelagerte Reporting-Jobs beginnen.
- Erstellung eines Integrations-Health-Dashboards, das den Echtzeitstatus von APIs und Dateifeeds anzeigt, die Portfoliomanagement-, Verwahrungs- und Abrechnungssysteme verbinden und operativ vom L1/L2-Support genutzt werden.
- Automatisierter Abgleich zwischen ausgehenden Transaktions-Batches und vorgelagerten Bestätigungseingängen, wodurch Abweichungen vor dem Settlement-Cut-off identifiziert werden.
02
Erforderlich
- Fundierte operative Kenntnisse von End-to-End-Störungsmanagementprozessen
- ITIL v3/v4
- Starkes technisches Verständnis beim Aufbau ganzheitlicher Monitoring-Ökosysteme
- Erfahrung mit APM-Tools (Dynatrace, Datadog, AppDynamics, Splunk)
- Gute Erfahrung in der Arbeit und Navigation in einer multinationalen, globalen Organisation
- Proaktives Denken und Wissensaustausch
- Teamplayer-Mentalität
- Gute Kommunikationsfähigkeiten
- Fähigkeit, unter Druck zu arbeiten
- Bewahrt hohe Detailgenauigkeit in Hochdrucksituationen
03
Wünschenswert
- Deutsch- oder Französischkenntnisse sind von Vorteil.
04
Vertragslaufzeit
- Startdatum: so bald wie möglich
- Enddatum: 31.01.2027
05
Sprachliche Anforderungen
- Ausgezeichnete Englischkenntnisse
- Verhandlungssicheres Englisch, Muttersprache (C1/2)
06
Antragsformular