Případová studie

Nová Big Data platforma zpracovávající desítky miliard záznamů denně? S Adastrou vybudována za 3 měsíce

Přední poskytovatel internetových služeb hledal řešení, které by bezproblémově zvládalo velkou zátěž sítě.

600 tisíc

záznamů se ukládá každou sekundu

3

měsíce trvala implementace

1PB

kapacita úložiště

Klient

Jeden z předních poskytovatelů internetového připojení v České republice.

Řešení

Adastra implementovala platformu pro big data, která umožňuje flexibilní alokaci zdrojů clusteru podle požadovaného datového toku.

Případová studie

Odvětví:

Technologie:

Expertíza:

Datum:

20. března 2023

Uřídit síťový a datový provoz významného poskytovatele internetu v ČR není snadný úkol, jeho základem jsou reálná data ukládaná v reálném čase.

Přenášené datové objemy jsou obrovské, přesně případ pro využití technologií Big Data. Jak na to, když s nimi nemáte zkušenosti?

Problém

Nová big data platforma si poradí s velkým objemem metadat o síťovém provozu

Přesně to si poskytovatel internetu uvědomil a stál tak před velkou výzvou. Vypsal výběrové řízení na řešení pro ukládání velkých objemů metadat o síťovém provozu, v němž kladl vysoký důraz na bezproblémový provoz a vysokou dostupnost nového řešení. Oslovil stávající i nové dodavatele, včetně Adastry, která má v oblasti Big Dat bohaté zkušenosti z celé řady úspěšně realizovaných projektů v různých odvětvích.

Nová platforma pro internetový provoz

Úložná kapacita 1 petabyte, 300 výpočetních vláken a 2,5 terabyte operační paměti

Vlastní instalace a realizace Hadoop platformy trvala 3 měsíce a v jejím rámci probíhal i testovací provoz. Ten Adastra navrhla na „první dobrou,“ takže ho nebylo potřeba významně upravovat a nová Big Data platforma byla spuštěna do ostrého provozu o měsíc dříve.

Nemožné na počkání

Nová Big Data platforma v ostrém provozu o měsíc dřív 

Adastra přišla s čistě generickou datovou platformou umožňující výborné škálování výpočetního výkonu a snadné rozšiřování diskové kapacity dle budoucích potřeb zákazníka. S ohledem na provozní náklady navrhla menší cluster, který plně vyhovuje současným požadavkům, poskytuje vysoký výpočetní výkon a dostatečné úložné kapacity. Ta se blíží 1 PB (petabytu), zpracovává 300 výpočetních vláken a disponuje 2,5 TB operační paměti a využívá distribuci Hortonworks.

Samotné zpracování metadat síťového provozu stojí na Spark frameworku, který využívá stabilní technologie jako Apache Kafka, Apache Hadoop a Apache HBase.

Výsledek

Nová Big Data platforma zpracovává všechna data týkající se internetového provozu zákazníka. Umožňuje flexibilní alokaci prostředků clusteru v závislosti na požadovaném průtoku dat. Reálné průtoky dat se pohybují v desítkách miliard denně. Základní denní agregaci spočítá Spark do 12 minut při alokaci 100 výpočetních vláken.

Součástí řešení je i komponenta třetí strany pro vysoko výkonnostní konverzi síťových metadat ze sond, která byla v rámci PoC (proof-of-concept) u zákazníka úspěšně otestována.

Reporting 

Big Data platforma je vynikajícím základem pro návazné aktivity a rozvoj, nad uloženými daty lze efektivně vybudovat kompletní reportingovou vrstvu a informace zpřístupnit a vizualizovat koncovým uživatelům.

Maximální výkon 

Navýšením jader lze dosáhnout průtoku ukládání blížící se 1 milionu záznamů za sekundu. Zákazník tak může velmi pružně reagovat na aktuální potřeby, jak ze strany datového provozu, tak při potřebě výpočetního výkonu pro pokročilé analytiky a zapojení machine learningu.

Univerzálnost

Dodané řešení není vázáno na konkrétního výrobce hardwaru či typ serveru. Cluster lze doplnit o jakýkoliv typ serveru podle konkrétní dostupnosti i o specializované servery s GPU pro akceleraci machine learning algoritmů.

24/7 podpora 

Adastra zajišťuje podporu při provozu a řešení případných problémů v režimu 24/7.

Máte zájem o podobné řešení?

CZ_Contact Form (Sidebar)

Sdílet

Přečtěte si další případové studie

Máte zájem o podobné řešení?