URL: https://linuxfr.org/users/boa13/journaux/vendredi-13 Title: Vendredi 13 Authors: Boa Treize Date: 2004年02月13日T19:00:17+01:00 Tags: Score: 0 Ca devait etre un rayon cosmique, ou un avertissement divin, en tout cas le message etait clair : sauvegarde tes donnees, la fin est proche. Enfin un truc du genre, en tout cas je l'ai senti passer. Au tout debut, quelque chose d'assez anodin, Mozilla qui plante. Pas tres frequent mais pas inconnu au bataillon non plus, ni une ni deux, je tue ce cher butineur et j'en relance une nouvelle instance. Qui n'arrive pas. Mmm, classique : l'ancienne doit etre dans un recoin de la memoire, refusant de mourir comme ca. Je lance un xterm, et un "ps -e f" me le confirme apres un petit temps d'attente : ca rame... Bon, "killall mozilla", qu'on en finisse. J'avise du coin de l'oeil la diode du disque dur allumee d'un long vert fixe, wow, Mozilla avait du bouffer toute la memoire. Un coup de "w" pour voir la charge de la machine... "w: Command not found". Alors la, rien ne va plus. Je m'apercois soudain que la fortune affichee en haut du xterm est completement corrompue, ca y est j'ai compris, une seconde barette de RAM m'a lache. Quelques coups de "fortune" bien corrompus confirment cette impression, il est grand temps de quitter le navire avant que le flot de donnees aleatoires n'atteigne des zones sensibles de la machine. J'evacue XFree86, je passe en root, et puis shutdown. "shutdown: Command not found". Ouyaya, ca craint. "ls /sbin | less" segfaulte. Rien ne va plus, je passe aux procedures d'urgence, je benis le createur de la combinaison de touches SysRq. Sync, Umount, PowerOff. Je respire profondement. Bien, il est maintenant temps de passer a l'autopsie. Je redemarre, j'active tous les tests du BIOS. Apres quelques minutes d'attente, il faut se rendre a l'evidence : la RAM n'a rien, en tout cas le BIOS n'y voit rien de mal, contrairement a sa grande soeur dont le diagnostic avait ete clair et immediat. Un probleme passager peut-etre ? Bon, je relance Linux, verification de la racine. Quelques blocs ont une taille incorrecte, bizarre, le sync+umount aurait du empecher ca. Apres quelques secondes toutefois, la tension monte d'un cran : "illegal block", il faut passer en mode single-user, verifier la partition en manuel. Ca, c'est vachement plus rare, et ca craint car c'est synonyme de perte de donnees. La roulette est lancee, faites vos jeux, sur quelle inode la faucheuse va-t-elle s'arreter ? Ah, e2fsck, quel festival, on a beau se croire blase, on en decouvre sans cesse. Des "block #1 causes symlink to be too big", des "inodes part of a corrupted orphan linked list", des "inode has too many errors, clear? [y/n]", des ecrans sans fin d'erreurs, dont on s'apercoit qu'elles sont concentrees sur une portion precise des inodes, ce qui laisse l'espoir de recuperer les autres. Vient la verification des repertoires, ou je finis par decouvrir l'ampleur du desastre : c'est /usr/bin qui a le plus morfle, avec quelque degats collateraux dans /sbin et /usr/lib. Il faut dire au revoir a AbiWord-2.0, gaim, xchat, xine, metacity, aspell et pas mal d'autres. Miracle quand meme : il ne s'agit que d'applications, le systeme lui-meme n'est pas trop touche, meme si "man" est dans les choux. On est parti pour une bonne reinstallation, une perte de temps certes, mais pas une perte de donnees. Ah, les donnees ! Que sont devenues mes deux autres partitions, qui hebergent mes si precieux /usr/local et /home ? Verification anxieuse faite, /usr/local se porte comme un charme, ce qui est heureux vu son contenu. /home a subi quelques degats, quelques fichiers archives par ailleurs et helas deux fichiers sur lesquels je travaillais. Quelques heures de travail a la poubelle, ca fait bien mal mais ca aurait pu etre tellement pire. Il est temps de se remettre de ces emotions, de faire une pause. Bob l'Eponge passe a point (sur Canal J) pour me remettre le moral. Retour sur les lieux du crime. Je me demande ce qui a bien pu se passer ? Disque dur foutu, noyau en folie, controleur IDE completement barjo ? Les logs les designent comme complices de ce crime : a 15:19:27, un timer DMA a expire, et apres un temps d'attente et une enieme reponse "Busy" des disques durs, le pilote IDE a reinitialise ma carte controleur Promise. Une bien mauvaise idee semble-t-il, puisqu'ensuite le log s'est rempli d'"attempt to access beyond end of device, want=1048458294 limit=4192965" (des "want" variables selon les acces disques, manifestement, mais systematiquement bien superieurs a la limite), enfin bref tout s'etait barre en cou1lle. Est-ce que je peux encore faire confiance a ce disque ? Ca c'est la question a 100 balles, plus precisement et beaucoup plus realistement a 100 euros, 100 euros que je prefererais ne pas depenser juste maintenant, la. Et la, c'est le mystere, puisque de nombreux diagnostics SMART plus tard, tout semble aller pour le mieux dans mon disque dur favori (un Maxtor de 15 Go, 1630 heures de travail, 1013 allumages, aucun secteur defecteux/relocalise, tous les indicateurs dans le vert et de loin). Alors quoi ? Le controleur qui fatigue ? Un bug dans Linux que jamais je ne pourrai reproduire - j'espere bien ! Un rayon cosmique, au mauvais endroit, au mauvais moment, le mauvais jour ? Qui sait ? Qu'en pensez-vous ? Et que feriez-vous a ma place ? _(Oui, il n'y a aucun caractere accentue dans ce texte. Je m'en excuse, mais c'est comme ca pour aujourd'hui.)_

AltStyle によって変換されたページ (->オリジナル) /