GitHub ha creato un repository millenario, dove conserverà i repository Open Source per le generazioni future.

GitHub ha creato un repository millenario, dove conserverà i repository Open Source per le generazioni future.
Un'ex-miniera di carbone che ospita il deposito Arctic World Archive. Foto: Guy Martin / Bloomberg Businessweek

Il software libero è la pietra angolare della civiltà moderna e un patrimonio comune dell'umanità. La missione del programma GitHub Archive è quella di preservare questo codice per le generazioni future, affinché la storia della biblioteca di Alessandria non si ripeta mai più.

Per questo motivo, GitHub creerà molte copie di sicurezza su diversi supporti, tra cui un deposito a lungo termine Arctic Code Vault a Svalbard. Esso è situato in una ex-miniera di carbone a 250 metri di profondità nel permafrost ed è progettato per durare almeno 1000 anni.

Un'istantanea del codice della razza umana verrà effettuata il 2 febbraio 2020..

Il progetto di archiviazione a lungo termine è stato avviato in collaborazione con Long Now Foundation, Internet Archive, Software Heritage Foundation, Arctic World Archive e altri partner.

Progetto LOCKSS

Un codice vitale oggi può essere dimenticato o perso nel tempo. La cosa peggiore è che, in caso di catastrofi globali, possiamo perdere tutte le informazioni archiviate su supporti "effimeri": HDD, SSD, CD e DVD, che sono progettati per durare diversi decenni, e su nastri il cui tempo di vita condizionato di 30 anni richiede un rigoroso controllo della temperatura e dell'umidità.

La soluzione a questo problema è la duplicazione dei backup, ovvero l'archiviazione del software da parte di diverse organizzazioni e in diverse forme. Questo progetto, chiamato LOCKSS è partito quasi 20 anni fa. Nel maggio 2019 è stato presentato il programma LOCKSS 2.0-alpha — il primo prototipo software per la conservazione distribuita dei dati a lungo termine, con supporto per numerosi partecipanti e archiviazione esterna.

Gli sviluppatori del sistema partono dal presupposto che l'hardware possa essere molto più durevole dei supporti effimeri: quindi "esiste una serie di possibili futuri in cui computer moderni funzionanti esistono, ma il loro software è in gran parte perso".

GitHub ricorda molte tecnologie perdute che potrebbero essere state utili: cemento romano (la cui ricetta è stata riscoperta solo nel 2014), farmaco antimalarico DFDT, perduti disegni del razzo 'Saturn V'. È facile immaginare un futuro in cui il software di oggi sarà visto come una stravaganza obsoleta e dimenticata, finché non si presenterà un'improvvisa necessità: «Come ogni backup, il programma di archiviazione GitHub è anche destinato a un futuro imprevisto», si legge sul sito del programma GitHub Archive.

GitHub Archive

GitHub Archive prevede tre livelli di backup:

  • Caldo: quasi in tempo reale
  • Tiepido: aggiornato con frequenza da un mese a un anno
  • Freddo: aggiornato ogni 5+ anni

Dopo ogni azione degli utenti, tutti i dati Git di GitHub vengono replicati in più data center in tutto il mondo. I backup di Git, issue, pull request e tutti i dati utente su GitHub sono memorizzati in più luoghi. Queste informazioni sono disponibili in tempo reale tramite l'API di GitHub.

Inoltre, è stato organizzato un indice ricorsivo con il crawler GHTorrent, che caricherà gli archivi su base giornaliera o mensile. Attraverso GH Archive, le istantanee dall'archivio possono essere ottenute tramite richieste BigQuery. Altre copie del codice sono ospitate nella nota "Macchina del tempo" dell'Internet Archive, che conserva copie in più luoghi. Infine, la Software Heritage Foundation scansionerà regolarmente GitHub e aggiungerà i suoi repository pubblici al suo archivio, per il quale è disponibile un API pubblico.

Arctic GitHub Repository

Il 2 febbraio 2020, GitHub farà una copia di tutti i repository pubblici attivi e li posizionerà nell'Arctic GitHub Repository.

I dati saranno conservati su bobine di pellicola da 3500 piedi fornite dall'azienda norvegese Piql, specializzata nell'archiviazione a lungo termine. Secondo le misurazioni ISO, questa pellicola a base di alogenuro d'argento in poliestere ha una durata di 500 anni. I test di invecchiamento simulato hanno dimostrato che la pellicola Piql conserva le informazioni per almeno il doppio del tempo.

Inoltre, il GitHub Archive collabora con i ricercatori del progetto Microsoft Silica per registrare tutti i repository pubblici su lastre di vetro quartzite utilizzando un laser a femtosecondi. Questo supporto garantirà la conservazione dei dati per oltre 10.000 anni.

Il deposito di codice artico di GitHub viene creato presso l'Arctic World Archive (AWA) a una profondità di 250 metri nel permafrost. L'archivio si trova in una ex miniera di carbone nell'arcipelago delle Svalbard, non molto lontano dal Polo Nord. Il riscaldamento globale interesserà solo pochi metri di permafrost e non minaccia la miniera nel prossimo futuro (per alcuni millenni).

Le Svalbard sono regolamentate da un trattato internazionale come zona demilitarizzata. È uno degli insediamenti umani più remoti e geograficamente stabili della Terra, secondo GitHub. Inoltre, nelle vicinanze si trova il famoso Deposito Mondiale di Semi, la principale speranza dell'umanità in caso di apocalisse.

GitHub ha creato un repository millenario, dove conserverà i repository Open Source per le generazioni future.
Deposito Mondiale di Semi alle Svalbard

AWA — un'iniziativa congiunta tra la compagnia mineraria statale norvegese Norske Spitsbergen Kulkompani (SNSK) e il fornitore di conservazione digitale Piql AS. Qui sono già conservati dati storici e culturali da Italia, Brasile, Norvegia, Vaticano e altri paesi.

GitHub ha creato un repository millenario, dove conserverà i repository Open Source per le generazioni future.
Foto: Guy Martin / Bloomberg Businessweek

Le bobine con il codice GitHub saranno conservate in un contenitore con pareti d'acciaio all'interno di una camera ermetica. Nella registrazione del 02.02.2020 saranno inclusi tutti i repository GitHub attivi e una parte significativa di quelli inattivi (in base a stelle, dipendenze, ecc.), insieme a tutti i file binari fino a 100 KB. Ogni repository sarà in un file tar separato. Tutto dovrebbe entrare in 200 bobine da 120 GB.

Insieme all'archivio saranno inclusi un catalogo leggibile da un uomo e guide tecniche per la decodifica dei QR, formati file, codifiche dei simboli e altri metadati importanti, affinché i discendenti possano riconvertire i dati nel codice sorgente originale.

L'archivio conterrà anche una guida generale Tech Tree nel caso in cui i futuri lettori non avessero computer funzionanti e dovessero ricostruire le tecnologie da zero.

Fonte: habr.com

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster