Commencer gratuitement
KZero Staff / 3 min de lecture / 27 juill. 2023

Définition de la tolérance aux pannes

Qu'est-ce que la tolérance aux pannes ?

La tolérance aux pannes désigne la capacité d'un système à tolérer les pannes ou les événements défavorables qui nuisent à la capacité d'un composant ou d'un système à accomplir sa tâche. Par exemple, une application Web critique devrait pouvoir continuer de fonctionner même si le bloc d'alimentation d'un serveur Web qui la soutient tombe en panne.

Que sont les points de défaillance uniques ?

L'un des concepts clés lorsqu'on parle de tolérance aux pannes ou de résilience est le point de défaillance unique (SPOF). Mettre en œuvre la tolérance aux pannes consiste en grande partie à repérer et à éliminer les SPOF.

Un SPOF est un composant essentiel au fonctionnement d'un système. Si le SPOF se brise ou fonctionne moins efficacement, c'est tout le système qui en souffre.
Par exemple, un ordinateur comporte un certain nombre de SPOF potentiels. Si le bloc d'alimentation, le processeur (CPU), la carte d'interface réseau (NIC) ou l'un ou l'autre de nombreux autres composants tombe en panne, l'ordinateur peut devenir inutilisable jusqu'à ce que ce composant soit réparé ou remplacé.

Concevoir pour la tolérance aux pannes

Un système tolérant aux pannes, ou résilient, est un système où aucun composant n'est essentiel à lui seul. Pour atteindre la tolérance aux pannes, il faut repérer les SPOF potentiels et créer de la redondance pour ceux-ci.

Par exemple, considérons une application Web cruciale. Une organisation peut devoir prendre plusieurs mesures pour la rendre tolérante aux pannes.

Redondance des serveurs

Si cette application Web s'exécute sur un seul serveur, tout ce qui provoque la panne de ce serveur entraînera aussi la panne de l'application Web. Pour cette raison, une organisation peut mettre en place plusieurs serveurs Web derrière un répartiteur de charge. Si un serveur tombe en panne, le répartiteur de charge envoie le trafic vers les autres serveurs de la grappe.

L'organisation peut aussi mettre en place des systèmes de secours pour ce serveur. Le système de secours pourrait vérifier régulièrement si le serveur principal est hors ligne et prendre la relève le cas échéant. L'organisation pourrait également basculer manuellement vers le système de secours lorsqu'elle constate que le serveur principal est tombé en panne.

Alimentation et connectivité Internet de secours

Si tous les serveurs hébergeant l'application Web critique se trouvent dans le même centre de données, ils dépendent de la même infrastructure physique. Un événement qui coupe l'alimentation ou la connectivité Internet de l'un touchera aussi les autres. Pour cette raison, une organisation peut choisir de mettre en place une alimentation et une connectivité Internet redondantes, ou de répartir géographiquement les serveurs afin de réduire le risque que les deux soient touchés par un incident localisé.

Dépendances

Une organisation peut concevoir une application Web résiliente et tolérante aux pannes en utilisant des serveurs, une alimentation et une connectivité réseau redondants, etc. Cependant, cette application peut demeurer vulnérable aux perturbations si les services dont elle dépend constituent des SPOF potentiels.

Par exemple, une application Web peut devoir interroger régulièrement une base de données pour fonctionner correctement. Si cette base de données n'est pas tolérante aux pannes, l'application pourrait être rendue inutilisable par tout événement qui met la base de données hors service.

Conclusion

À mesure que les systèmes informatiques deviennent plus essentiels aux activités des entreprises et à leurs clients, la tolérance aux pannes des systèmes critiques est devenue indispensable. Atteindre la tolérance aux pannes consiste à repérer les points de défaillance uniques potentiels et à mettre en place de la redondance.

L'équipe KZero



Explorez d'autres contenus enrichissants de l'équipe compétente de KZero dans nos sections blogue et guides.