Dostępny jest OpenSearch 3.0, fork platformy Elasticsearch

Organizacja non-profit OpenSearch Software Foundation, kontrolowana przez Linux Foundation, opublikowała wersję projektu OpenSearch 3.0, rozwijającego fork platformy do wyszukiwania, analizy i przechowywania danych Elasticsearch oraz interfejsu webowego Kibana. W rozwój forka zaangażowane są takie firmy jak Amazon, SAP, Uber, Aryn, Atlassian, Canonical, DigitalOcean i NetAp. Kod jest rozpowszechniany na licencji Apache 2.0.

Fork został utworzony w 2021 roku w odpowiedzi na przejście projektu Elasticsearch na nieskoszową licencję SSPL (Server Side Public License) oraz zaprzestanie publikacji zmian pod starą licencją Apache 2.0. Mimo powrotu Elasticsearch do korzystania z licencji wolnej, projekt OpenSearch nie stracił na znaczeniu, ponieważ w nim kontynuowane jest stosowanie permissywnej licencji Apache 2.0 zamiast licencji AGPLv3, na którą przeszedł Elasticsearch, a także rozwijany jest szereg specyficznych rozszerzeń, które wcześniej były dostarczane przez firmę Amazon w oddzielnym dystrybucie Open Distro for Elasticsearch i zastępują płatne komponenty Elasticsearch.

OpenSearch zawiera silnik przechowywania i wyszukiwania OpenSearch, interfejs webowy oraz środowisko wizualizacji danych OpenSearch Dashboards, a także zestaw dodatków dla uczenia maszynowego, obsługi SQL, generowania powiadomień, diagnostyki wydajności klastra, szyfrowania ruchu, kontroli dostępu opartej na rolach (RBAC), uwierzytelniania przez Active Directory, Kerberos, SAML i OpenID, realizacji jednolitych punktów dostępu (SSO) oraz prowadzenia szczegółowego logu audytowego.

Wśród zmian w OpenSearch 3.0:

  • Dodany został wektorowy silnik (OpenSearch Vector Engine), który może być stosowany do przechowywania i obróbki danych używanych w systemach uczenia maszynowego. W celu przyspieszenia wyszukiwania wektorowego wykorzystano obliczenia po stronie GPU, co pozwoliło zwiększyć prędkość indeksowania 9.3 razy i zmniejszyć koszty operacyjne 3.75 razy w porównaniu do rozwiązań wykorzystujących tylko CPU. W celu organizacji współpracy z źródłami danych, aplikacjami LLM oraz platformami AI zrealizowano wsparcie dla protokołu MCP (Model Context Protocol). Obsługiwana jest integracja z agentami AI firm Anthropic, LangChain i OpenAI.
  • Dodano optymalizacje, które pozwalają na zmniejszenie rozmiaru magazynu wektorów k-NN (k-najbliższych sąsiadów) o jedną trzecią oraz na zmniejszenie opóźnień w wykonywaniu zapytań nawet 30 razy po uruchomieniu (zimny start) dzięki usunięciu zbędnych informacji wtórnych i użyciu danych pierwotnych do rekonstrukcji potrzebnych informacji.
  • Dodano eksperymentalną możliwość użycia protokołu gRPC (protobuf nad gRPC) do przesyłania danych między klientami, serwerami a węzłami magazynowymi. W porównaniu do JSON, zastosowanie gRPC pozwala na obniżenie kosztów serializacji oraz zwiększenie wydajności dzięki jednoczesnemu wysyłaniu różnych zapytań w jednym połączeniu TCP.
  • Dodano tryb pull do pobierania danych, w którym OpenSearch bezpośrednio żąda danych z źródeł strumieniowych, takich jak Apache Kafka i Amazon Kinesis.
  • W klastrze wprowadzono możliwość podziału ruchu związanego z indeksowaniem i wyszukiwaniem. Dodano API, które pozwala wyłączyć operacje zapisu i udostępnić indeks tylko do wyszukiwania w celu optymalizacji pracy z danymi, które nie będą zmieniane (konfiguracje, w których dane są zapisywane raz i odczytywane wielokrotnie).
  • Rozszerzono integrację z Apache Calcite i wprowadzono możliwość użycia języka zapytań PPL (Piped Processing Language) do operacji wyszukiwania, filtrowania i scalania.
  • Zapewniono automatyczne określenie typu indeksów. Dla indeksów z danymi związanymi z prowadzeniem logów wprowadzono specyficzne optymalizacje, które przyspieszają operacje analizy logów.
  • Silnik wyszukiwania pełnotekstowego Lucene zaktualizowano do gałęzi 10, w której poprawiono działanie indeksów oraz zwiększono wydajność równoległego przetwarzania zadań.
  • Dodano wsparcie dla modułów Java (Java Platform Module System) w celu podziału komponentów na oddzielne biblioteki. Minimalna wymagania to wydanie Java 21.
  • Przyspieszono pracę z zakresami wartości i polami zawierającymi daty oraz liczby (czas przejścia zestawu testowego Big5 wzrósł o 25%). Operacje agregacji danych zostały przyspieszone (w teście p90 opóźnienia zmniejszyły się o 75%). Dla wektorów k-NN domyślnie włączono tryb równoległego wyszukiwania segmentów, co pozwoliło 2,5-krotnie zwiększyć wydajność zapytań.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster