IT-Outsourcing
Platform Engineering und Zuverlässigkeit für ein lateinamerikanisches Fintech
Auf einen Blick
- Sektor
- Finanzdienstleistungen und Fintech
- Geografie des Kunden
- Lateinamerikanisches Fintech, mehrere Länder
- Größe des Kunden
- Scale-up, digitale Finanzplattform für mehrere Märkte
- Servicelinie
- IT-Outsourcing, Platform Engineering, DevOps, Zuverlässigkeit
- Hauptsprache
- Englisch und Spanisch
- Delivery-Standort
- Bogotá
- Dauer des Engagements
- 16 Monate, fortlaufend
- Teamgröße
- 20 Ingenieure, 2 Leads, 7 Senior, 9 Mid, 2 Junior
Kundenprofil
Der Kunde ist ein lateinamerikanisches Fintech, das eine digitale Finanzplattform in mehreren Ländern betreibt, mit Hauptsitz in der Region und einer verteilten Engineering-Organisation. Seine Plattform wickelt Zahlungen und Finanztransaktionen in großem Maßstab ab, wo Verfügbarkeit und Zuverlässigkeit existenziell und nicht nur wichtig sind.
Die Herausforderung
Die Plattformverfügbarkeit des Fintechs lag bei 97,2 Prozent, was für eine Zahlungsplattform eine inakzeptable Ausfallzeit bedeutet. Jede Minute, in der die Plattform nicht verfügbar ist, bedeutet fehlgeschlagene Transaktionen und schwindendes Vertrauen, und das rasche Wachstum des Unternehmens überholte die Zuverlässigkeit seiner Infrastruktur. Die Engineering-Organisation war mit der Reaktion auf Störungen ausgelastet und hatte keine Kapazität, die Plattform zu verbessern. Jede Zuverlässigkeitsinitiative des Vorjahres war auf halbem Weg aufgegeben worden, als die Störungslast das Team wieder in Anspruch nahm, ein vertrautes und zermürbendes Muster. Die Bereitstellung war langsam und riskant. Ohne eine Infrastruktur für Progressive Delivery trug jedes Release das Risiko für die gesamte Plattform, was das Team zu seltenen Releases veranlasste, was jedes Release größer und riskanter machte, ein sich selbst verstärkendes Problem. Das Fintech hatte versucht, erfahrene Platform- und Reliability-Ingenieure in seinen Märkten einzustellen, und fand das Profil selten und teuer, während die eigenen Ingenieure durch den Produktdruck zur Feature-Arbeit hingezogen wurden.
Warum Corpshore Colombia
Corpshore Colombia schlug ein zweigleisiges Engagement vor, ein Run-Track zur Stabilisierung der Plattform und ein Build-Track zum Aufbau der Zuverlässigkeits- und Delivery-Infrastruktur, wobei der Build-Track vertraglich von der Störungsbehebung abgeschottet wurde, damit er nicht durch die Brandbekämpfung aufgezehrt werden konnte, die die früheren internen Versuche des Fintechs zunichte gemacht hatte.
Bogotá platzierte das Team im Finanz- und Engineering-Zentrum des Landes, auf der Uhr des Kunden, und die Erfahrung von Corpshore mit regulierten Finanzplattformen sowie seine Sicherheitsaufstellung waren für ein Zahlungsumfeld von Bedeutung.
Das Engagement
Zwanzig Ingenieure in Bogotá: zwei Technical Leads, sieben Senior, neun Mid-Level und zwei Junior, aufgeteilt auf einen Run-Track und einen abgeschotteten Build-Track. Die Run-Abdeckung beträgt 24 Stunden für kritische Störungen; der Build-Track arbeitet zu Standardzeiten und ist vertraglich vor der Störungsbehebung geschützt. Stack: Kubernetes, Terraform, AWS, Go, Python, Prometheus, Grafana, mit der bestehenden Plattform des Kunden.
Ansatz und Methodik
Stabilisieren nach Ursache, nicht nach Ticket. Die Störungsbehebung wechselte von der Brandbekämpfung zur Ursachenbeseitigung, wobei jede kritische Störung einen Root-Cause-Datensatz und eine präventive Maßnahme erzeugte. Die Verfügbarkeitskurve spiegelt die Ursachenbeseitigung wider und nicht eine schnellere Wiederherstellung. Abgeschotteter Zuverlässigkeitsaufbau. Der Build-Track baute Observability, Progressive Delivery und Self-Service-Infrastruktur auf, geschützt vor der Störungslast, was der einzige Grund ist, weshalb er bis zur Lieferung überlebte, wo die früheren Versuche des Fintechs gescheitert waren. Progressive Delivery. Feature-Flags, Canary-Deployments und automatisiertes Rollback entkoppelten das Release vom Risiko und ermöglichten eine häufige, sichere Bereitstellung. Dokumentierter Wissenstransfer. Die Infrastruktur und die Runbooks sind auf einen Standard gebaut, den die eigenen Ingenieure des Kunden betreiben, mit definierten Transfer-Meilensteinen.
Verfügbarkeit der Kernplattform
Ergebnisse
Die Verfügbarkeit der Kernplattform stieg bis zum Monat 12 von 97,2 Prozent auf 99,87 Prozent und reduzierte die monatliche Ausfallzeit von rund zwanzig Stunden auf unter eine, auf einer Zahlungsplattform, auf der dieser Unterschied existenziell ist. Die mittlere Zeit bis zur Behebung kritischer Störungen fiel von über elf Stunden auf 0,7 Stunden, und die Häufigkeit kritischer Störungen sank, als die Ursachenbeseitigung Wirkung zeigte. Die eigenen Ingenieure des Fintechs kehrten zur Feature-Arbeit zurück, als sich die Plattform stabilisierte, und die Bereitstellungshäufigkeit stieg pro Team auf wöchentlich oder besser.
Dauerhafter Wert
Die Infrastruktur für Observability und Progressive Delivery gehört dem Kunden und wird von den Ingenieuren des Fintechs betrieben. Das abgeschottete zweigleisige Modell ist zur Vorlage des Kunden für Infrastrukturarbeit geworden. Corpshore Colombia hat das Engagement auf Security Engineering für die Plattform ausgeweitet.
Kernkennzahlen
| Kennzahl | Ausgangspunkt | Monat 12 | Veränderung |
|---|---|---|---|
| Verfügbarkeit der Kernplattform | 97.2% | 99.87% | +2.67 pts |
| Monatliche Ausfallzeit | ≈ 20 hours | < 1 hour | -95% |
| Mittlere Zeit bis zur Behebung, kritisch | 11 h 10 m | 42 min | -94% |
| Kritische Störungen pro Monat | 13 | 3 | -77% |
| Bereitstellungshäufigkeit | Selten | Wöchentlich+ | Struktureller Wandel |
| Fehlerrate bei Änderungen | 22% | 7% | -68% |
| Abgeschlossene Zuverlässigkeitsinitiativen | 0 der vorherigen Versuche | Geliefert | Neue Fähigkeit |
Wenn eine Kennzahl nur eine Veränderung offenbarte, werden die absoluten Zahlen mit einem Bindestrich dargestellt. Die Zahlen sind vom Kunden berichtet oder gemeinsam gemessen.
Jedes Zuverlässigkeitsprogramm, das wir betrieben hatten, wurde von Störungen aufgefressen. Die vertragliche Abschottung des Build-Teams ist der einzige Grund, weshalb dieses eines überlebte und überhaupt etwas lieferte. Auf einer Zahlungsplattform ist diese Zuverlässigkeit das Geschäft.
Verwandte Themen