Accord de niveau de service

Si nous tombons, vos applications, elles, restent debout.

La plateforme configure et déploie de l’infrastructure. Elle ne se trouve sur le chemin des requêtes d’aucune des applications qu’elle déploie.

Ce qu’une panne vous coûte réellement

Les déploiements s’exécutent comme des pipelines sur une infrastructure qui vous appartient. Une fois quelque chose déployé, cela tourne là-bas, répond à son propre trafic, sans aucune dépendance envers nous.

Si le plan de contrôle est indisponible, ce qui s’arrête, c’est donc votre capacité à changer les choses — pas votre capacité à servir vos utilisateurs.

Nous comptons le dire clairement plutôt que de l’enfouir. C’est la description honnête, et il se trouve que c’est aussi la plus favorable : une panne ici retarde un déploiement, elle ne met pas un système de production hors ligne.

Ce à quoi nous comptons nous engager

  • Un objectif de disponibilité pour le plan de contrôle lui-même — le portail, l’API, et la possibilité de soumettre des déploiements.
  • Des crédits de service limités à cette disponibilité de la plateforme, proportionnés à une interruption de la capacité à faire des changements.
  • Aucun engagement sur la disponibilité de vos propres applications, ni sur celle des fournisseurs de cloud et d’hyperviseur en dessous d’elles. Elles échappent à notre contrôle, et il serait malhonnête de les promettre.

Quand un déploiement peut être retardé par d’autres

Un déploiement traverse des systèmes que nous n’exploitons pas : votre fournisseur d’infrastructure, et la plateforme de pipelines qui exécute les jobs. Une défaillance de l’un ou de l’autre peut bloquer un déploiement alors que le plan de contrôle est en parfaite santé. Tout objectif mesuré doit tenir compte de cette frontière, pour que les chiffres décrivent quelque chose sur quoi nous avons réellement prise.

Encore à fixer

Le pourcentage de disponibilité, la fenêtre de mesure, le barème des crédits, les délais de réponse du support par offre, et la communication sur l’état du service et les incidents ne sont pas encore fixés. Ils le seront quand la plateforme aura assez d’historique d’exploitation pour qu’un objectif ait un sens, plutôt que choisis parce que le chiffre rassure.