Temps de réponse API réduits de moitié.
Diagnostic instrumenté et corrections ciblées, sans réécriture.
SRE · Backend · Production systems
J’interviens du backend à l’infrastructure sur des systèmes de production à fort trafic pour diagnostiquer les problèmes, livrer les corrections et rendre l’équipe autonome.
Huit ans à construire et exploiter des systèmes complexes, avec une responsabilité de bout en bout, du diagnostic à la production.
Situations
Quand un sujet de production demande un responsable, pas une recommandation de plus.
Les incidents reviennent, la reprise dépend de quelques personnes ou la fiabilité reste mal mesurée.
Les moyennes semblent correctes, mais les utilisateurs, la p99 ou les traitements de fond disent l’inverse.
Les coûts progressent plus vite que l’usage et les arbitrages restent difficiles à objectiver.
Un changement Kubernetes, PostgreSQL ou cloud est bloqué par le risque en production.
Backend, PostgreSQL et infrastructure se renvoient la cause. Je mesure le système de bout en bout et corrige là où se trouve réellement le problème.
Observabilité, SLO, gestion d’incidents et responsabilités de production restent implicites ou dispersés.
Manière de travailler
La bonne solution, pas la plus impressionnante.
Établir le signal, le point de départ et la contrainte avant de choisir une solution.
Livrer les changements nécessaires, une étape maîtrisée à la fois, puis vérifier le résultat.
Documenter, automatiser et transférer l’exploitation. L’équipe continue sans moi.
Résultats
Diagnostic instrumenté et corrections ciblées, sans réécriture.
La facture de CI a aussi été divisée par trois.
Dont pg_repack et évolutions de Row Level Security.
Expertise
Le travail part du problème à résoudre, pas d’un catalogue d’outils.
Observabilité, SLO, gestion d’incidents, profilage et analyse de la latence de bout en bout.
APIs et services en Python ou Go, traitements asynchrones, PostgreSQL, performance et migrations sensibles en production.
Kubernetes, cloud, bare metal, CI/CD, infrastructure par le code et maîtrise des coûts.
Environnements fréquents — Python, Go, PostgreSQL, Kubernetes, AWS, GCP, OVH bare metal, Terraform/Pulumi, Cloudflare, Datadog.
Point de départ
Un format court et cadré pour objectiver un problème de production et déterminer où intervenir avant d’engager des changements plus larges.
Les signaux et les contraintes sont mesurés, pas supposés.
Les causes principales et les risques techniques sont explicités.
Les changements sont ordonnés par impact, risque et effort.
Ce qu’il faut faire ensuite, y compris si mon intervention n’est pas nécessaire.
Aucun engagement sur une mission plus longue.
Commencer par un diagnostic de productionDécrivez le problème en quelques lignes. Je vous réponds sous deux jours ouvrés et vous dis franchement si je suis la bonne personne.
Trente minutes, sans engagement. Le plus utile si vous avez déjà un chiffre ou un symptôme à examiner.
Parler de votre production — 30 min