Incident & retour d'expérience Résolu — retour nominal

Incident de refroidissement Equinix PA4 : notre gestion de continuité

Mis à jour le

Mise à jour du 24 juillet 2026 — incident clos de bout en bout

Côté Equinix, la maintenance corrective des groupes froids de PA4 a été menée à bien entre le 16 et le 24 juillet 2026 (remplacement de ventilateurs, nettoyage de condenseur). La capacité de refroidissement du datacenter, et sa redondance N+3, sont désormais intégralement rétablies ; il ne subsiste plus aucune réparation en attente : l'incident est clos aussi bien côté RDEM Systems que côté datacenter.

Résolu
État de l'incident
24/06 · 15 h 06
Début (heure locale)
Aucune perte
Données clients
PA4 · Pantin
Site concerné

Le 24 juin 2026 à 15 h 06, un incident de refroidissement est survenu au datacenter Equinix PA4 (Pantin), l'un des trois sites sur lesquels nous opérons notre infrastructure. Cet incident relève de notre datacenter, pas de nos équipements. Nous publions ici, en toute transparence, la manière dont nous l'avons géré.

Notre priorité a été simple : préserver le matériel et les données plutôt que de maintenir coûte que coûte des services dans des conditions environnementales dégradées. Nos services sont revenus en fonctionnement nominal le 25 juin à 8 h 30, redondance comprise. Côté datacenter, la dernière unité de refroidissement a depuis été remise à pleine capacité : à la suite de la maintenance corrective d'Equinix, achevée le 24 juillet 2026, la capacité de refroidissement de PA4 est intégralement rétablie, redondance N+3 comprise.

En résumé

Une défaillance d'alimentation en eau du système de refroidissement adiabatique d'Equinix PA4 a provoqué l'arrêt de protection de plusieurs groupes froids et une montée des températures en salle. Conformément à notre plan de gestion d'incident, et après concertation avec les clients concernés, nous avons basculé les services redondants sur leur PCA, migré les machines mono-site entre clusters lorsque c'était possible, puis procédé à un arrêt contrôlé de la très grande majorité de nos équipements PA4. Aucune perte de données ni arrêt non maîtrisé n'a été constaté.

L'incident est résolu côté RDEM Systems et pour nos clients : l'ensemble de nos services PA4 sont revenus en fonctionnement nominal le 25 juin à 8 h 30, redondance comprise. La dernière réparation côté Equinix (un groupe froid à remettre à pleine capacité) a été menée à bien le 24 juillet 2026 : la capacité de refroidissement de PA4 — redondance N+3 comprise — est désormais intégralement rétablie, sans impact sur nos services.

Chronologie

HorodatageÉvénement
24/06 · 15 h 06Incident de climatisation détecté, pris en charge et communiqué par Equinix à PA4. La cause n'est pas encore connue à ce stade.
24/06 · 15 h 46Equinix communique une cause initiale suspectée : perte d'alimentation en eau du système de refroidissement adiabatique, ayant entraîné une mise en sécurité des compresseurs.
24/06 · ~16 h 00Nos graphes de température commencent à monter dans les salles, après la détection de l'incident.
24/06 · 20 h 30Atteinte de nos paliers d'alarme thermique. Activation du plan de gestion d'incident.
24/06 · 20 h 45 – 22 h 00Concertation avec les clients concernés afin de décider, ensemble, des mesures conservatoires à appliquer.
24/06 · 22 h 00 – 23 h 00Mise en œuvre des mesures conservatoires : déplacement des services critiques (à ne pas interrompre) vers les autres datacenters que nous exploitons, bascule des services redondants sur leur PCA, puis arrêt des préproductions et des environnements non critiques.
24/06 · 23 h 00Arrêt contrôlé de la très grande majorité de nos équipements PA4 pour préserver le matériel.
Nuit · 23 h – 07 hSurveillance des températures. Les mesures conservatoires étant en place, plus aucun risque immédiat pour le matériel : aucune intervention complémentaire n'a été nécessaire.
25/06 · 02 h – 04 hRetour à des conditions de température normales dans les datahalls — confirmé par la communication Equinix du 25/06 à 4 h.
25/06 · 07 h 30Température jugée suffisamment stable : début du redémarrage et de la reprise progressive de nos services.
25/06 · 08 h 30Retour en fonctionnement nominal de l'ensemble de nos services — fin de l'incident côté RDEM Systems.
Au lendemain de l'incidentRedondance rétablie côté datacenter ; cinq groupes froids à pleine capacité, un à 50 % (en attente de pièces) avant retour à la pleine capacité de refroidissement.
16 – 24 juil. 2026Maintenance corrective d'Equinix sur les groupes froids concernés (remplacement de ventilateurs, nettoyage de condenseur), achevée le 24 juillet 2026 : capacité de refroidissement de PA4 intégralement rétablie, redondance N+3 comprise.

Impact réseau : l'un de nos transitaires présents sur PA4 a vu son équipement s'éteindre en raison de la température. Grâce à notre raccordement multi-sites et multi-transitaires via notre AS206014, le trafic a continué d'être acheminé par nos autres points de présence, sans coupure de connectivité.

Notre réponse

Notre architecture sur trois datacenters Equinix interconnectés nous a donné des options de continuité réelles. Voici ce que nous avons activé :

Bascule PCA

Les services disposant d'un plan de continuité ont été basculés vers leur site de secours, hors de PA4.

Migration inter-clusters

Pour les machines mono-datacenter, migration vers d'autres clusters lorsque la situation le permettait, afin de maintenir le service.

Arrêt contrôlé

Extinction propre et ordonnée du reste des équipements PA4, pour éviter tout dommage matériel lié à la chaleur.

Ce que cet incident illustre

Une supervision thermique avec des paliers d'alarme définis à l'avance, et non subis.

Une décision proactive : préserver le matériel plutôt que de courir le risque d'une panne incontrôlée.

Une communication avec les clients avant d'agir, et non après.

Des options de continuité réelles grâce à une architecture multi-datacenters.

Des mesures conservatoires suffisamment réfléchies pour ramener le risque à un niveau acceptable, sans dépendre d'une présence humaine permanente.

Après la mise en œuvre des mesures conservatoires en soirée, aucune action complémentaire n'a été nécessaire pendant la nuit : le risque pour le matériel avait été ramené à un niveau acceptable. Les services ont simplement été remis en fonctionnement le lendemain matin, lorsque les conditions thermiques sont redevenues satisfaisantes.

Cause de l'incident

D'après les communications de notre datacenter, la cause initiale suspectée est une perte d'alimentation en eau du système de refroidissement adiabatique, ayant entraîné des conditions de haute pression et l'arrêt de protection des compresseurs de plusieurs groupes froids. Les interventions de remise en service et de réparation côté Equinix ont été achevées le 24 juillet 2026.

Nous ne reproduisons pas ici le détail opérationnel interne du datacenter. La cause racine consolidée (RCA) sera publiée une fois disponible et confirmée.

Notre engagement de transparence

  • Nous ne déclarons « aucun impact » que lorsque c'est objectivement vrai pour les clients concernés.
  • Le 25 juin, nos services PA4 sont revenus en fonctionnement nominal à 8 h 30, redondance comprise ; la capacité de refroidissement du datacenter (redondance N+3) a été intégralement rétablie le 24 juillet 2026.
  • Cette page est mise à jour à mesure de l'évolution de la situation.

Remerciements

Nous remercions les équipes d'Equinix PA4 à Pantin pour leur communication régulière tout au long de l'incident. Les communications régulières et les informations techniques diffusées tout au long de l'incident nous ont permis de suivre précisément l'évolution de la situation et d'adapter nos décisions d'exploitation.

Nous saluons également le travail des techniciens présents sur site qui, malgré des conditions particulièrement difficiles liées aux fortes chaleurs, ont permis de rétablir progressivement la situation.

Un incident bien géré n'est pas un incident qui n'a pas existé. C'est un incident documenté, communiqué et dont les enseignements servent à améliorer l'exploitation.

Une infrastructure pensée pour la continuité

Trois datacenters Equinix interconnectés, des clusters en haute disponibilité et des procédures d'incident éprouvées. Parlons de la résilience de votre infrastructure.

Contact

Adresse

5 B RUE DES NOYERS, 95300 PONTOISE, FRANCE

Téléphone

01 77 62 42 42

Parlons de votre projet

15 minutes pour comprendre vos besoins, sans engagement.

Réservez un créneau