Actualités

Panne GitHub du 17 août : quand un bug de retry dans VS Code multiplie le trafic par 10 — auditer vos budgets de réessai et vos HPA aveugles au sidecar Istio

Le post-mortem publié par GitHub le 19 août 2026 décrit une cascade exemplaire : saturation réseau régionale, limite de concurrence d'un sidecar Istio, autoscaling qui observait la mauvaise métrique, puis un bug de réessai dans VS Code qui a multiplié par ~10 le trafic vers le Copilot Token Service. Nous décortiquons la boucle de rétroaction, puis proposons les configurations Istio/Envoy, les requêtes PromQL et le protocole de test à appliquer sur vos propres services.

| | | 14 min read · 22 Aug 2026 · by
Schéma d'une boucle de rétroaction entre clients et services saturés provoquant une amplification du trafic

Le 19 août 2026, GitHub a publié le post-mortem de l’incident du 17 août. Sept heures et quarante-sept minutes d’indisponibilité partielle, une chaîne de causes en cinq maillons, et un dernier maillon particulièrement inconfortable pour tous ceux qui exploitent un service à API publique : ce n’est pas l’infrastructure de GitHub qui a empêché la reprise, ce sont les clients. Un bug latent de réessai dans VS Code a transformé une dégradation régionale en tempête de trafic auto-entretenue.

L’intérêt de ce RCA n’est pas la panne elle-même — les load balancers saturent, c’est un fait de la vie. Il est dans le fait que chaque maillon correspond à un réglage que la plupart des plateformes Kubernetes/Istio n’ont jamais audité.

Chronologie factuelle

  • 13h28 UTC : saturation du réseau au niveau des load balancers de la région Central US. Les services commencent à renvoyer des erreurs.
  • Bascule partielle du trafic vers North Virginia. Partielle : c’est le mot important. Le chemin d’authentification, lui, reste contraint.
  • 16h36 UTC : la majorité des services (web, API, Issues, Pull Requests) sont rétablis.
  • 18h03 UTC : Actions revient à la normale.
  • 21h02 UTC : le Copilot Token Service est rétabli — près de quatre heures et demie après le gros des autres services.
  • 21h15 UTC : clôture de l’incident.

Impact déclaré : environ 20 % d’erreurs sur le web et l’API, environ 50 % sur les téléchargements d’archives et de contenu brut. Côté Copilot Token Service, le trafic est passé de 7–9 K RPS en régime nominal à 70–100 K RPS pendant la crise, soit une amplification d’un facteur ~10 imputée à un…

Unlock the full article

Get full access to in-depth technical content written from real-world experience, not tutorials copied from documentation.