GitHub stworzył tysiącletną skarbnice, w której przechowa repozytoria Open Source dla potomnych

GitHub stworzył tysiącletną skarbnice, w której przechowa repozytoria Open Source dla potomnych
Była kopalnia węgla, w której mieści się archiwum Arctic World Archive. Zdjęcie: Guy Martin / Bloomberg Businessweek

Wolne oprogramowanie jest kamieniem węgielnym nowoczesnej cywilizacji oraz wspólnym dziedzictwem całej ludzkości. Misją programu GitHub Archive jest zachowanie tego kodu dla przyszłych pokoleń, aby historia Biblioteki Aleksandryjskiej nigdy się nie powtórzyła.

W tym celu GitHub stworzy wiele kopii zapasowych na różnych nośnikach, w tym długoterminowym przechowywaniu Arctic Code Vault na Spitsbergenie. Znajduje się w byłej kopalni węgla na głębokości 250 metrów w wiecznej zmarzlinie i ma być przechowywane przez co najmniej 1000 lat.

Zdjęcie kodu oprogramowania ludzkości zostanie zrobione 2 lutego 2020 roku..

Projekt długoterminowego przechowywania danych został uruchomiony we współpracy z Long Now Foundation, Internet Archive, Fundacją Dziedzictwa Oprogramowania, Arctic World Archive i innymi partnerami.

Projekt LOCKSS

Dziś krytyczny kod może zostać zapomniany lub utracony. Najstraszniejszy scenariusz to, że w przypadku globalnej katastrofy stracimy wszystkie informacje przechowywane na «efemerycznych» nośnikach: HDD, SSD, CD i DVD, które są zaplanowane na kilka dziesięcioleci, na taśmach, których warunkowy okres użytkowania w długości 30 lat wymaga ścisłej kontroli temperatury i wilgotności.

Rozwiązaniem problemu jest duplikacja kopii zapasowych, czyli archiwizacja oprogramowania przez kilka organizacji w różnych formach. Projekt ten nosi nazwę LOCKSS i rozpoczął się prawie 20 lat temu.W maju 2019 roku przedstawiono program LOCKSS 2.0-alpha - pierwszy prototyp oprogramowania do rozproszonego długoterminowego przechowywania danych z wsparciem dla wielu uczestników i zewnętrznych przechowalni.

Twórcy systemu wychodzą z założenia, że sprzęt może być znacznie bardziej trwały niż efemeryczne nośniki: dlatego «istnieje cały szereg możliwych scenariuszy przyszłości, w których nowoczesne komputery działają, ale ich oprogramowanie w dużym stopniu zostało utracone».

GitHub przypomina o licznych utraconych technologiach, które mogłyby być użyteczne: beton rzymski (jego przepis został na nowo odkryty dopiero w 2014 roku), lek przeciwmalaryczny DFDT, utracone rysunki rakiety Saturn VŁatwo wyobrazić sobie przyszłość, w której dzisiejsze oprogramowanie będzie postrzegane jako kapryśne i zapomniane niepotrzebne narzędzie, dopóki nie pojawi się nagła potrzeba: „Jak każda kopia zapasowa, program archiwizacyjny GitHub również jest przeznaczony do nieprzewidzianej przyszłości,” mówi strona programu GitHub Archive.

GitHub Archive

GitHub Archive przewiduje trzy poziomy kopii zapasowych:

  • Gorący: prawie w czasie rzeczywistym
  • Ciepły: aktualizowany co miesiąc do roku
  • Zimny: aktualizowany co 5+ lat

Po każdej akcji użytkowników GitHub, wszystkie dane Git są replikowane w wielu data center na całym świecie. W różnych lokalizacjach przechowywane są kopie zapasowe Git, zgłoszenia, prośby o Pull Requesty oraz wszystkie dane użytkowników na GitHubie. Informacje te są dostępne w czasie rzeczywistym przez GitHub API.

Ponadto, zorganizowane jest rekurencyjne indeksowanie przez crawler GHTorrent, który codziennie lub miesięcznie publikuje archiwa. Przez GH Archive z archiwum można uzyskiwać zdjęcia za pomocą zapytań BigQuery. Inne kopie kodu są przechowywane w dobrze znanej „Maszynie czasu” Internet Archive, która przechowuje kopie w różnych miejscach. W końcu, Fundacja Dziedzictwa Oprogramowania (Software Heritage Foundation) regularnie skanuje GitHub i dodaje swoje publiczne repozytoria do swojego archiwum, dla którego dostępne jest publiczne API.

Arctic GitHub Archive

2 lutego 2020 roku GitHub utworzy kopię wszystkich aktywnych publicznych repozytoriów — i umieści je w Arctic GitHub Archive.

Dane będą przechowywane na 3500-stopowych taśmach filmowych dostarczonych przez norweską firmę Piql, która specjalizuje się w długotrwałym przechowywaniu danych. Zgodnie z pomiarami ISO, ta taśma z halogenkiem srebra w poliestrze ma żywotność 500 lat. Testy starzenia symulacyjnego pokazały, że taśma Piql przechowuje informacje co najmniej dwa razy dłużej.

Ponadto, GitHub Archive współpracuje z badaczami projektu Microsoft Silica, aby nagrać wszystkie publiczne repozytoria na kwarcowych płytkach szklanych za pomocą femtosekundowego lasera. Nośnik ten zapewni trwałość danych przez ponad 10 000 lat.

Arcticzne repozytorium kodu GitHub powstaje na bazie Arctic World Archive (AWA) na głębokości 250 metrów w wiecznej zmarzlinie. Archiwum znajduje się w byłej kopalni węgla na archipelagu Svalbard, stosunkowo niedaleko od Bieguna Północnego. Globalne ocieplenie dotknie tylko kilka metrów wiecznej zmarzliny i nie zagraża kopalni w najbliższym czasie (przez kilka tysięcy lat).

Svalbard jest regulowany międzynarodową umową jako strefa zdemilitaryzowana. To jedno z najbardziej odległych i geopolitycznie stabilnych osiedli ludzkich na Ziemi, uważa GitHub. W pobliżu znajduje się również słynne Światowe Repozytorium Nasion, główna nadzieja ludzkości na wypadek apokalipsy.

GitHub stworzył tysiącletną skarbnice, w której przechowa repozytoria Open Source dla potomnych
Światowe Repozytorium Nasion na Svalbardzie

AWA to wspólna inicjatywa między norweską państwową firmą górniczą Norske Spitsbergen Kulkompani (SNSK) a dostawcą zachowania cyfrowego Piql AS. Już teraz są tam przechowywane dane historyczne i kulturowe z Włoch, Brazylii, Norwegii, Watykanu i innych krajów.

GitHub stworzył tysiącletną skarbnice, w której przechowa repozytoria Open Source dla potomnych
Zdjęcie: Guy Martin / Bloomberg Businessweek

Tekturki z kodem GitHub będą przechowywane w kontenerze ze stalowymi ścianami wewnątrz hermetycznej komory. Na zdjęciu z dnia 02.02.2020 roku znajdą się wszystkie aktywne repozytoria GitHub oraz znaczna część nieaktywnych (według gwiazd, zależności itd.), wszystkie pliki binarne do 100 KB. Każde repozytorium w osobnym pliku tar. Wszystko powinno zmieścić się na 200 tekturach po 120 GB.

Wraz z archiwum położone zostaną czytelne katalogi oraz techniczne przewodniki dotyczące dekodowania QR, formatów plików, kodowań znaków i innych ważnych metadanych, aby potomkowie mogli przekształcić dane z powrotem w kod źródłowy.

Do archiwum zostanie również dołączony ogólny przewodnik Tech Tree na wypadek, gdyby przyszli czytelnicy nie mieli działających komputerów i musieli odbudować technologie od podstaw.

Źródło: habr.com

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster