100%

Senior Berater(in) – Störungs-management & Applikationsüberwachung

Vertrag bis 31.01.2027 Luxemburg
Jetzt bewerben
Beschäftigungsart Vertrag
Industrie Finanzdienstleistungen
Fachbereich Incident Management, Application Monitoring
Ort Luxemburg
Remote? Nein
Homeoffice? TBD
Vertragslaufzeit Vertrag bis 31.01.2027
01
Aufgaben und Verantwortungen
  • End-to-End-Verantwortung für den Incident-Lebenszyklus: Identifikation, Protokollierung, Kategorisierung, Priorisierung, Eskalation, Lösung, Abschluss und Post-Incident-Review.
  • Design und Durchsetzung konsistenter SLAs/OLAs über Technologieteams und Drittparteien hinweg.
  • Implementierung effektiver Protokolle für das Management schwerwiegender Störungen, einschliesslich War-Room-Aktivierung, Bridging und Krisenkommunikation.
  • Integration von Incident-Daten mit Problemmanagement und Änderungskontrolle zur Reduzierung von Wiederholungen.
  • Entwicklung klarer, zeitnaher und nicht-technischer Incident-Updates für Business-Stakeholder und das Senior Management.
  • Erstellung standardisierter Incident-Berichte für Führungskräfte, die Folgenabschätzungen, Zeitplanaufschlüsselungen, Ursachen und Massnahmenpläne enthalten.
  • Erstellung monatlicher oder vierteljährlicher Service-Health-Dashboards, die mit den Geschäftsbereichsleitern geteilt werden, um Transparenz und Vertrauen zu verbessern.
  • Nutzung von Kommunikationskanälen (z.B. MS Teams-Benachrichtigungen, E-Mail-Bulletins, Intranet-Portale), die auf verschiedene Zielgruppen zugeschnitten sind.
  • Einführung strukturierter Nachfassaktionen mit betroffenen Abteilungen, um das Vertrauen nach grösseren Störungen wiederherzustellen.
  • Neugestaltung der Incident-Reporting-Struktur bei einem europäischen Vermögensverwalter, Einführung wöchentlicher Zusammenfassungen von Dienstunterbrechungen, die an C-Suite- und Vorstandsmitglieder verteilt werden.
  • Automatisierte Incident-Briefing-Pakete unter Verwendung von Power BI- und ServiceNow-Integrationen, wodurch die Berichterstellungszeit um 70% reduziert wurde.
  • Einführung eines zentralen Major Incident Registers mit Trendanalysen, das eine proaktive Minderung wiederkehrender Fehlerbilder ermöglicht.
  • Erstellung von Trendanalysen und Dashboards sowie Ausschüssen, um L2- und L3-Teams zur kontinuierlichen Verbesserung herauszufordern.
  • Leitung von Schulungs- und Simulationsübungen (Tabletop-Drills), um technische und geschäftliche Führungskräfte auf Szenarien mit hoher Schwere vorzubereiten.
  • End-to-End-Observability über: Frontend-Applikationen (Web-, Desktop-, mobile Schnittstellen)
  • Applikationsserver, Microservices usw.
  • Middleware-Komponenten
  • Geplante Batch-Jobs (Tagesabschluss, Monatsabschluss usw.)
  • Dateibasierte Integrationen
  • API-zu-API-Interaktionen
  • Downstream-Outputs (Berichte, Zahlungsanweisungen, regulatorische Einreichungen, Kundenabrechnungen)
  • Erkennung fehlender oder verzögerter Dateiankünfte
  • Validierung der Dateiinhaltsintegrität: Grösse, Datensatzanzahl, Schema-Konformität, Abwesenheit von Fehler-Flags.
  • Verfolgung von Batch-Job-Ausführungen, einschliesslich Start-/Endzeiten, Rückgabecodes, Ausnahme-Logs und Abhängigkeiten.
  • Beobachtung von Integrations-Touchpoints, um eine erfolgreiche Nachrichtenübertragung und Bestätigung sicherzustellen.
  • Automatisierte Abgleichsprüfungen zwischen Quell- und Zielsystemen (z.B. Anzahl der gesendeten vs. verarbeiteten Transaktionen).
  • Intelligente Alarmierung bei logischen Anomalien, wie z.B. Nullsaldo-Positionen, doppelten Zahlungen oder nicht übereinstimmenden Währungsumrechnungen.
  • Bereitstellung und Konfiguration von Enterprise-APM-Tools (Dynatrace, Datadog, AppDynamics, Splunk) zur Korrelation von Ereignissen über Systeme hinweg.
  • Instrumentierung von Skripten und Backend-Prozessen zur Ausgabe benutzerdefinierter Metriken und Traces.
  • Einsatz von synthetischem Monitoring und Heartbeat-Probes zur Simulation kritischer Workflows.
  • Unterdrückung von Rauschen durch intelligente Alarmgruppierung, Deduplizierung und dynamische Schwellenwerte.
  • Nahtlose Integration mit Incident-Management-Plattformen (z.B. ServiceNow) für die automatische Ticketerstellung.
  • Bei einer Privatbank wurde eine Überwachungsschicht für Übertragungen entworfen und automatische Wiederholungsversuche oder Benachrichtigungen ausgelöst – wodurch unentdeckte Zahlungsfehler reduziert wurden.
  • Implementierung von Integritätsprüfungen mittels Monitoring, die fehlerhafte Positionsdateien kennzeichnen, bevor nachgelagerte Reporting-Jobs beginnen.
  • Erstellung eines Integrations-Health-Dashboards, das den Echtzeitstatus von APIs und Dateifeeds anzeigt, die Portfoliomanagement-, Verwahrungs- und Abrechnungssysteme verbinden und operativ vom L1/L2-Support genutzt werden.
  • Automatisierter Abgleich zwischen ausgehenden Transaktions-Batches und vorgelagerten Bestätigungseingängen, wodurch Abweichungen vor dem Settlement-Cut-off identifiziert werden.
02
Erforderlich
  • Fundierte operative Kenntnisse von End-to-End-Störungsmanagementprozessen
  • ITIL v3/v4
  • Starkes technisches Verständnis beim Aufbau ganzheitlicher Monitoring-Ökosysteme
  • Erfahrung mit APM-Tools (Dynatrace, Datadog, AppDynamics, Splunk)
  • Gute Erfahrung in der Arbeit und Navigation in einer multinationalen, globalen Organisation
  • Proaktives Denken und Wissensaustausch
  • Teamplayer-Mentalität
  • Gute Kommunikationsfähigkeiten
  • Fähigkeit, unter Druck zu arbeiten
  • Bewahrt hohe Detailgenauigkeit in Hochdrucksituationen
03
Wünschenswert
  • Deutsch- oder Französischkenntnisse sind von Vorteil.
04
Vertragslaufzeit
  • Startdatum: so bald wie möglich
  • Enddatum: 31.01.2027
05
Sprachliche Anforderungen
  • Ausgezeichnete Englischkenntnisse
  • Verhandlungssicheres Englisch, Muttersprache (C1/2)
06
Antragsformular