Veeam Backup & Replication : conseils utiles pour garantir la viabilité des sauvegardes et des réplicas

Aujourd'hui, j'ai de nouveau le plaisir de vous présenter des conseils utiles de mon collègue Evgueni Ivanov, le leader de l'équipe de support technique de Veeam. Cette fois, Jania a partagé des recommandations pour travailler avec les sauvegardes et les répliques. J'espère qu'elles vous aideront à éviter les erreurs typiques, et que vos répliques et sauvegardes ne seront jamais le « maillon faible » dans le processus de récupération, si nécessaire.

Donc, bienvenue sous le capot.

Veeam Backup & Replication : conseils utiles pour assurer la viabilité des sauvegardes et des répliques

Dans mon précédent article, article nous avons examiné comment optimiser la charge sur les composants de l'infrastructure de sauvegarde, et avons abordé les erreurs de configuration courantes. Passons à un autre sujet important : la préparation et l'exécution adéquates de la récupération. Nous allons également l'explorer avec des exemples réels, sur lesquels l'équipe de support technique a eu l'occasion de travailler.

Une sauvegarde sans test – de l'argent jeté par les fenêtres

Nous sommes régulièrement contactés par des utilisateurs qui se retrouvent dans des situations similaires : il est nécessaire d'effectuer une restauration à partir d'une sauvegarde, mais lorsqu'ils essaient de le faire, les gens se heurtent à un problème insoluble. Et ce problème n'est pas l'absence de sauvegarde, l'activité de CryptoLocker ou quelque chose de similaire. C'est « tout simplement » un manque d'attention à vérifier les sauvegardes et les répliques pour leur capacité à être restaurées. Beaucoup se concentrent souvent uniquement sur le processus de création de la sauvegarde, oubliant que la simple présence d'une sauvegarde n'est pas une panacée contre les éventuels malheurs. Il faut comprendre que la récupération est un processus totalement différent, qui a ses propres spécificités, et qui doit absolument être contrôlé et testé avant la mise en production. Voici quelques exemples évocateurs :

  1. Un utilisateur a subi une panne d'une machine virtuelle critique de 20 To. Les temps d'arrêt, évidemment, sont inacceptables, et l'administrateur lance le processus de récupération instantanée de la VM (VM instant recovery) – en 5 minutes, la machine est opérationnelle. Mais nous savons que cet état de la machine ne peut être utilisé que temporairement – elle doit absolument être migrée vers le datastore de production. Dans cet exemple, comme il s'est avéré, les capacités de l'infrastructure ne permettaient pas de copier 20 To de données dans un délai raisonnable. Dans les paramètres du processus de récupération instantanée, il a été choisi de conserver les modifications sur disque. De : Les serveurs Veeam Backup & Replication (contrairement au snapshot vSphere) ont rapidement rempli l'espace disque. Au moment où l'utilisateur a contacté le support, la machine virtuelle avait subi des modifications qui ne pouvaient être ignorées. Nous étions donc dans une situation où il était impossible de finaliser rapidement le processus de restauration instantanée de la machine critique – comment récupérer les données dans ce cas ?

    Je dois l'admettre, avec le temps qui passe, je ne me souviens plus de tous les détails de la fin, mais je me rappelle que finalement, nous n'avons pas trouvé de solution géniale. Les clients, de leur côté, ont plus ou moins résolu le problème en étendant le disque C: à partir des réserves, ils ont copié les fichiers les plus importants, puis ont éteint la machine virtuelle et ont ainsi migré. En gros, il n'y a pas eu de miracle.

  2. Dans l'infrastructure de l'utilisateur, il y avait un contrôleur de domaine, et tous les composants de Veeam Backup & Replication avaient été configurés en utilisant le DNS. Oui, oui, vous avez bien entendu. Il y avait des centaines de scénarios possibles, mais en réalité, cela s'est déroulé comme suit : les gens ont planifié une maintenance et ont décidé de passer à la réplique de leur contrôleur de domaine. Ils ont engagé un basculement planifié, ce qui est d'ailleurs recommandé dans de telles situations. Au premier stade, tout se passait bien, mais au second, la VM d'origine a été éteinte brièvement pour transférer les données restantes. Évidemment, la tâche de basculement a rapidement échoué car le DNS a cessé de fonctionner.

    Heureusement, nous avons réussi à gérer la situation en activant la réplique manuellement depuis vSphere (en réalité, il n'est pas recommandé d'effectuer cette opération de manière autonome, comme vous le verrez dans l'exemple suivant). Cependant, comme vous pouvez le comprendre, le processus de maintenance a été interrompu et reporté. De plus, nous avons dû entrer manuellement les noms d'hôtes dans le fichier C:WindowsSystem32driversetchosts sur le serveur Veeam Backup & Replication pour garantir la précision lors du retour au basculement.

  3. Un autre client avait construit toute son infrastructure de sauvegarde autour de dispositifs à bande magnétique, et seuls de courts fichiers étaient stockés sur disque. Lorsqu'il a été nécessaire de restaurer plusieurs fichiers d'un grand serveur de fichiers, il s'est avéré qu'aucune machine ne pouvait être utilisée comme dépôt auxiliaire pour la restauration à partir des bandes, car aucune d'entre elles n'avait suffisamment d'espace libre. (Pour des infos sur la restauration à partir de bandes magnétiques directement et en utilisant un dépôt auxiliaire, vous pouvez lire ici (pour l'instant en anglais)).

Je pense que dans les trois exemples, les utilisateurs étaient, pour ainsi dire, prisonniers d'illusions – ils ont supposé que si la sauvegarde s'était bien passée, il n'y aurait pas de problème avec la restauration. Mais comme vous le savez, ce n'est pas toujours le cas, et il est donc nécessaire de se préparer à la restauration aussi soigneusement qu'à la sauvegarde. Pour commencer, il vaut la peine d'étudier le manuel utilisateur, qui contient des informations assez détaillées sur les différents types de restauration. Au début de chaque paragraphe, les exigences, les actions préparatoires et les limitations possibles sont énumérées. La description de la restauration à partir de bandes magnétiques ou d'instantanés matériels de SAN peut être trouvée dans les sections de la documentation et dans nos des articles articles sur Habré. De plus, les actions de préparation pour la restauration des objets d'application à l'aide des outils Veeam Explorers sont décrites dans la section « Planning and preparation » (planification et préparation) du manuel pour chacun des outils. Je vous recommande de les consulter attentivement — cela vous aidera à bien préparer le système pour la restauration si nécessaire. En russe, les instructions pour la restauration de la base de données SQL Server sont présentées ici.

Pourquoi ne pas travailler avec des répliques depuis la console vSphere ?

En théorie, les répliques Veeam sont des machines virtuelles ordinaires avec lesquelles il semblerait logique de travailler en utilisant l'outillage vSphere, en particulier le client vSphere. Cependant, nous ne recommandons pas cela, et voici pourquoi : basculer vers une réplique dans Veeam Backup & Replication est un processus assez complexe, nécessitant une exécution stricte des étapes (afin que, si besoin, il soit possible de revenir en arrière) et des actions finales correctes – jetez juste un œil à l'image illustrant le processus :

Veeam Backup & Replication : conseils utiles pour assurer la viabilité des sauvegardes et des répliques

Cependant, si vous décidez d'activer la réplique depuis le client vSphere, il est fort probable que vous rencontriez par la suite une série de problèmes :

  1. Le mécanisme de basculement vers la réplique de Veeam Backup & Replication (illustré dans le schéma) ne fonctionnera plus pour cette machine.
  2. Les données dans la base de Veeam Backup ne correspondront pas à l'état réel de la VM. Dans le pire des cas, il sera nécessaire de modifier la base.
  3. Il est même possible de perdre des données, comme dans cet exemple : l'utilisateur a activé manuellement la réplique dans le client vSphere et a décidé de continuer à travailler avec. Après un certain temps, il a remarqué que la réplique était toujours affichée dans la console de Veeam Backup & Replication et a décidé de la supprimer par nécessité. Il a cliqué dessus avec le bouton droit et a donné l'ordre «Supprimer du disque». Veeam Backup & Replication a immédiatement supprimé du disque la réplique qui, pour mémoire, était déjà utilisée comme une VM normale et contenait des données nécessaires et utiles.

Il y a certainement des situations où il est nécessaire d'activer la réplique depuis le client vSphere – généralement, ce sont des cas où le serveur Veeam est éteint et que la réplique doit être activée avec un délai. Mais si le serveur Veeam fonctionne correctement, il est impératif de travailler avec les répliques depuis sa console.

Il n'est également pas conseillé de supprimer des répliques en utilisant le client vSphere. Veeam Backup & Replication restera dans l'ignorance quant à ce changement, ce qui peut entraîner des erreurs et des données obsolètes. Si la réplique n'est plus nécessaire, supprimez-la via la console Veeam, et non comme une VM depuis le client vSphere. Ainsi, vous aurez toujours une liste actuelle des répliques.

«O» — attention, mises à jour !

Ici, nous faisons bien sûr référence aux mises à jour des hyperviseurs et des diverses applications qui sont sauvegardées à l'aide de Veeam. Si l'on les considère du point de vue du travail avec Veeam Backup & Replication, les mises à jour peuvent être grossièrement divisées en 2 catégories : majeures, sérieuses, apportant de nombreux changements – et mineures.

Examinons d'abord la première catégorie.

Les mises à jour les plus importantes sont celles destinées à l'hyperviseur. Avant d'installer une telle mise à jour, il est essentiel de s'assurer qu'elle est prise en charge par Veeam Backup & Replication. De telles mises à jour apportent de nombreux changements aux bibliothèques et aux interfaces API utilisées par Veeam Backup & Replication, donc, pour pouvoir déclarer officiellement leur prise en charge, il est nécessaire de mettre à jour le code de Veeam Backup & Replication et de procéder à des tests approfondis.

Il est également important de noter que, par exemple, VMware ne fournit pas d'accès anticipé aux dernières versions de vSphere aux éditeurs de logiciels, de sorte que les développeurs et les testeurs de Veeam reçoivent la nouvelle version en même temps que le reste de l'humanité progressiste – par conséquent, un certain temps s'écoule généralement entre la sortie de VMware et l'annonce officielle de la prise en charge. La quantité et la diversité des modifications nécessaires sont telles que les chances de les intégrer dans un simple correctif sont minces – et la prise en charge officielle est généralement annoncée avec la sortie de la version publiée de Veeam Backup & Replication.

Il en résulte ce moment délicat où, après la sortie d'une nouvelle version de vSphere, le nombre de demandes au support technique augmente brusquement, car les utilisateurs se précipitent pour installer la nouvelle version, et leurs sauvegardes cessent immédiatement de fonctionner. Nous, le support technique de Veeam, devons expliquer aux utilisateurs ce qu'ils ont mal fait, leur demander de revenir en arrière (si possible) ou d'inventer des solutions compliquées pour sortir de l'impasse. C'est pourquoi, avant d'installer une mise à jour majeure, veuillez toujours vérifier sa compatibilité avec le logiciel que vous utilisez, je vous en prie !

Tout ce qui précède s'applique également aux applications que vous sauvegardez et que vous prévoyez de restaurer à l'aide de Veeam. La gamme d'outils Veeam Explorers a également une liste des versions des applications correspondantes qui sont prises en charge, laquelle est mise à jour à chaque version de Veeam Backup & Replication. Par conséquent, avant d'installer une nouvelle version de votre application – qu'il s'agisse d'Exchange, d'Oracle ou de SharePoint – assurez-vous de relire la section correspondante de la documentation de Veeam Explorers.

Dans la deuxième catégorie, c'est-à-dire pour les petites mises à jour, j'inclue par exemple les nouvelles versions de VMware Tools, les mises à jour cumulatives d'Exchange, les mises à jour de sécurité vSphere, etc. En règle générale, elles n'apportent pas de modifications majeures, et la plupart du temps, Veeam Backup & Replication ne rencontre pas de problèmes avec elles. (C'est pourquoi il n'y a pas d'annonces publiques concernant le support officiel dans le produit.) Cependant, nous avons rencontré des cas où même ces mises à jour modifiaient de manière si significative le cours habituel des opérations qu'elles provoquaient des erreurs dans le fonctionnement de Veeam Backup & Replication. Dans de telles situations, après avoir confirmé le problème, les ingénieurs de Veeam s'efforcent de publier rapidement un correctif.

Pour ceux qui maîtrisent l'anglais techniqueSi vous souhaitez rester informé sur le travail des ingénieurs et sur les défis rencontrés par les architectes système et les spécialistes du support technique, je vous recommande de vous abonner à nos forums. Chaque semaine, une newsletter intitulée « Word from Gostev » est envoyée à ses abonnés et rédigée par TheRealGostev. Dans celle-ci, Anton Gostev, responsable du département de la gestion des produits, parle des problèmes récemment trouvés (et pas seulement du côté de Veeam), des projets pour les nouvelles versions et des nouvelles du monde IT. Si vous souhaitez plus d'informations, vous pouvez parcourir les sujets du forum - si un de nos clients rencontre un problème avec le fonctionnement du produit après une mise à jour, il a probablement déjà écrit à ce sujet sur le forum.

Comme vous le comprenez, les patches et mises à jour peuvent poser des problèmes non seulement avec les sauvegardes, mais aussi avec les applications pour lesquelles ces sauvegardes sont effectuées. Et ici, les laboratoires virtuels - Veeam DataLabs - vous aideront. Vous avez probablement entendu parler de la fonctionnalité SureBackup, qui est destinée à la vérification des sauvegardes. Elle repose justement sur l'utilisation de DataLabs, créant un environnement isolé où vous pouvez, entre autres, tester les mises à jour avant de les installer en production. Je vous conseille vivement de le faire - cela vous permettra d'épargner de nombreuses neurones. Et si quelqu'un ne connaît pas encore SureBackup, je recommande de lire documentation.

Eh bien, c'est tout pour aujourd'hui, merci de votre attention !

Que lire encore

Articles sur Habr :

Guide de l'utilisateur (en français)

Source : habr.com

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster