Wie wir einen hochdynamischen und kosteneffektiven DataLake organisiert haben und warum.
Wir leben in einer erstaunlichen Zeit, in der man schnell und einfach mehrere fertige Open-Source-Tools zusammenführen, sie nach dem "ausgeschalteten Bewusstsein" mit Tipps von Stack Overflow konfigurieren und ohne sich in "viele Buchstaben" zu vertiefen in den kommerziellen Betrieb nehmen kann. Wenn es dann Zeit wird, zu aktualisieren oder zu erweitern, oder wenn jemand versehentlich ein paar Maschinen neu startet — merkt man, dass ein aufdringlicher schlechter Traum im Wachzustand begonnen hat, und alles sich plötzlich kompliziert verhält bis […]
