
Eine ehemalige Kohlenmine, die das Arctic World Archive beherbergt. : Guy Martin / Bloomberg Businessweek
Freie Software ist das Fundament der modernen Zivilisation und ein gemeinsames Erbe der Menschheit. Die Mission besteht darin, diesen Code für zukünftige Generationen zu bewahren, damit sich die Geschichte der Bibliothek von Alexandria niemals wiederholt.
Hierfür wird GitHub zahlreiche Backups auf verschiedenen Medien erstellen, einschließlich des langfristigen Archivs auf Spitzbergen. Es befindet sich in einer ehemaligen Kohlenmine, 250 Meter unter der Erde, im ewigen Eis und ist auf eine Mindestlagerdauer von 1000 Jahren ausgelegt.
Eine Momentaufnahme des Menschen Codes wird am 2. Februar 2020 gemacht..
Das Projekt für die langfristige Datenspeicherung wurde in Zusammenarbeit mit der Long Now Foundation, dem Internet Archive, der Software Heritage Foundation, dem Arctic World Archive und anderen Partnern ins Leben gerufen.
Das LOCKSS-Projekt
Ein heute lebenswichtiger Code kann mit der Zeit vergessen oder verloren gehen. Am schlimmsten wäre es, wenn wir im Falle einer globalen Katastrophe all die Informationen verlieren, die auf „flüchtigen“ Speichermedien gesichert wurden: HDD, SSD, CD und DVD, die auf mehrere Jahrzehnte ausgelegt sind, sowie auf Bändern, deren voraussichtliche Lebensdauer von 30 Jahren strikte Temperatur- und Feuchtigkeitskontrollen erfordert.
Die Lösung für dieses Problem ist die Duplizierung von Backups, also die Archivierung von Software durch mehrere Organisationen und in verschiedenen Formen. Dieses Projekt mit dem Namen wurde vor ins Leben gerufen. Im Mai 2019 wurde das Programm vorgestellt – der erste Prototyp einer Software zur verteilten Langzeitspeicherung von Daten mit Unterstützung für viele Teilnehmer und externe Speichermedien.
Die Entwickler des Systems gehen davon aus, dass die Hardware viel langlebiger sein kann als flüchtige Speichermedien: Daher "gibt es eine ganze Reihe möglicher Zukünfte, in denen funktionierende moderne Computer existieren, aber ihre Software weitgehend verloren ist".
GitHub erinnert an viele verlorene Technologien, die nützlich hätten sein können: (dessen Rezept erst 2014 wiederentdeckt wurde), , verloren . Es ist leicht, sich eine Zukunft vorzustellen, in der die heutige Software als skurrile und längst vergessene Unnützlichkeit angesehen wird, bis unerwarteter Bedarf daran entsteht: "Wie jede Sicherung ist auch das Archivierungsprogramm GitHub für eine unvorhergesehene Zukunft ausgelegt", heißt es auf der Website des GitHub Archive-Programms.
GitHub Archive
GitHub Archive bietet drei Backup-Stufen an:
- Hot: nahezu in Echtzeit
- Warm: wird im Intervall von einem Monat bis zu einem Jahr aktualisiert
- Kalt: wird alle 5+ Jahre aktualisiert
Nach Nutzeraktivitäten werden alle Git-Daten von GitHub weltweit in mehreren Rechenzentren repliziert. An mehreren Standorten werden Backups von Git, Issues, Pull-Requests und allen Benutzerdaten auf GitHub gespeichert. Diese Informationen sind in Echtzeit über die GitHub API verfügbar.
Darüber hinaus ist eine rekursive Indizierung durch den GHTorrent-Crawler organisiert, der Archive täglich oder monatlich bereitstellt. Über das GH Archive können Schnappschüsse aus dem Archiv mittels BigQuery-Anfragen abgerufen werden. Weitere Code-Kopien werden in der bekannten „Wayback Machine“ des Internetarchivs gespeichert, die Kopien an mehreren Orten aufbewahrt. Schließlich wird die Software Heritage Foundation regelmäßig GitHub scannen und ihre öffentlichen Repositories in ihr Archiv aufnehmen, für das eine öffentliche API vorhanden ist.
Arktisches GitHub-Archiv
Am 2. Februar 2020 wird GitHub eine Kopie aller aktiven öffentlichen Repositories anfertigen und diese im Arktischen GitHub-Archiv speichern.
Die Daten werden auf 3500 Fuß langen Filmrollen gespeichert, die von dem norwegischen Unternehmen Piql bereitgestellt werden, das sich auf die langfristige Datenspeicherung spezialisiert hat. Laut ISO-Messungen hat dieses Filmmaterial aus Silberhalogenid in Polyester eine Lebensdauer von 500 Jahren. Tests zur beschleunigten Alterung haben gezeigt, dass der Piql-Film Informationen mindestens doppelt so lange aufbewahrt.
Darüber hinaus arbeitet das GitHub Archive mit Forschern des Microsoft Silica-Projekts zusammen, um alle öffentlichen Repositories auf Quarzglasplatten mittels Femtosekundenlasern zu archivieren. Dieses Medium wird die Daten über 10.000 Jahre lang sichern.
Das Arctic Code Vault von GitHub wird im Arctic World Archive (AWA) in 250 Metern Tiefe im Permafrost erstellt. Das Archiv befindet sich in einem ehemaligen Kohlebergwerk auf dem Svalbard-Archipel, nicht allzu weit vom Nordpol entfernt. Die globale Erwärmung wird nur wenige Meter des Permafrosts betreffen und stellt in absehbarer Zeit (in einigen tausend Jahren) keine Bedrohung für das Bergwerk dar.
Svalbard unterliegt als demilitarisierte Zone. Dies ist eine der abgelegensten und geopolitisch stabilsten menschlichen Siedlungen auf der Erde, glaubt GitHub. In der Nähe befindet sich auch das berühmte Svalbard Global Seed Vault, die Haupt Hoffnung der Menschheit für den Fall einer Apokalypse.

Svalbard Global Seed Vault
AWA — eine gemeinsame Initiative zwischen dem norwegischen Staatsbergbauunternehmen Norske Spitsbergen Kulkompani (SNSK) und dem Anbieter digitaler Archivierung Piql AS. Dort werden bereits historische und kulturelle Daten aus Italien, Brasilien, Norwegen, dem Vatikan und anderen Ländern aufbewahrt.

: Guy Martin / Bloomberg Businessweek
Die GitHub-Repositories werden in einem stahlumhüllten Container innerhalb einer hermetisch abgeschlossenen Kammer gelagert. In die Aufnahme vom 02.02.2020 fließen alle aktiven GitHub-Repositories sowie ein signifikanter Teil der inaktiven (basierend auf Sternen, Abhängigkeiten usw.) ein, einschließlich aller Binärdateien bis 100 KB. Jedes Repository wird in einer separaten tar-Datei gespeichert. Insgesamt sollen 200 Spulen mit je 120 GB belegt werden.
Zusammen mit dem Archiv wird ein menschenlesbares Verzeichnis und technische Anleitungen zur Dekodierung von QR-Codes, Dateiformaten, Zeichencodierungen und anderen wichtigen Metadaten beigelegt, damit die Nachkommen die Daten wieder in den Quellcode umwandeln können.
Das Archiv wird außerdem einen allgemeinen Tech-Tree-Leitfaden enthalten, für den Fall, dass zukünftige Leser keine funktionierenden Computer mehr haben und die Technologien von Grund auf wiederherstellen müssen.
Quelle: habr.com
