Ben c'est comment dire, BGP, c'est ce qui tient tout le réseau. Si ça part en sucette, tout ce qui est au dessus tombe. Et compte-tenu de sa nature (échange dynamique de routes et distribution de la topologie du réseau entre routeurs), il peut très bien y avoir des réactions en chaine. Donc oui, généralement, une boulette dans BGP, ça peut faire d’énormes dégâts.
Le DNS est aussi un bon candidat à la boulette de conf aussi.
Perso, ce que je trouve inquiétant dans l'incident Facebook, ce n'est pas tant que le réseau de prod soit tombé, ça bon, c'est limite compréhensible, c'est que tout le réseau d'exploitation, en gros, les couloirs de service, soit aussi tombé. Généralement, c'est une bonne pratique de séparé sur des infra bien distincte ce qui à trait au trafic de production et ce qui de l'ordre de l'exploitation et de la maintenance. Ils ont quand même été obligé de se rendre physiquement sur les DC, pour relancer le réseau avec en plus des problèmes d'accés du au fait que les systèmes de sécurité des DC était aussi impacté.
Je crois qu'ils ont un gros boulot d'analyse post-mortem à faire. Et d'ailleurs, ce travail si il est publié du moins en partie, sera surement très intéressant pour tout le monde.
Faut pas gonfler Gérard Lambert quand il répare sa mobylette.
[^] # Re: encore BGP ?
Posté par Big Pete . En réponse au lien Understanding How Facebook Disappeared from the Internet. Évalué à 5. Dernière modification le 06 octobre 2021 à 10:38.
Ben c'est comment dire, BGP, c'est ce qui tient tout le réseau. Si ça part en sucette, tout ce qui est au dessus tombe. Et compte-tenu de sa nature (échange dynamique de routes et distribution de la topologie du réseau entre routeurs), il peut très bien y avoir des réactions en chaine. Donc oui, généralement, une boulette dans BGP, ça peut faire d’énormes dégâts.
Le DNS est aussi un bon candidat à la boulette de conf aussi.
Perso, ce que je trouve inquiétant dans l'incident Facebook, ce n'est pas tant que le réseau de prod soit tombé, ça bon, c'est limite compréhensible, c'est que tout le réseau d'exploitation, en gros, les couloirs de service, soit aussi tombé. Généralement, c'est une bonne pratique de séparé sur des infra bien distincte ce qui à trait au trafic de production et ce qui de l'ordre de l'exploitation et de la maintenance. Ils ont quand même été obligé de se rendre physiquement sur les DC, pour relancer le réseau avec en plus des problèmes d'accés du au fait que les systèmes de sécurité des DC était aussi impacté.
Je crois qu'ils ont un gros boulot d'analyse post-mortem à faire. Et d'ailleurs, ce travail si il est publié du moins en partie, sera surement très intéressant pour tout le monde.
Faut pas gonfler Gérard Lambert quand il répare sa mobylette.