Big Data
Określenie „big data” jest często używane w środowiskach korporacyjnych do opisywania dużych ilości danych. Nie odnosi się ono do konkretnej ilości danych, lecz opisuje zbiór danych, którego nie można przechowywać ani przetwarzać za pomocą tradycyjnego oprogramowania baz danych.
Przykładami big data są indeks wyszukiwarki Google, baza profili użytkowników Facebooka oraz lista produktów Amazon.com. Te zbiory danych (czyli „zbiory danych”) są tak duże, że nie można ich przechowywać w typowej bazie danych ani nawet na jednym komputerze. Zamiast tego dane muszą być przechowywane i przetwarzane za pomocą wysoce skalowalnego systemu zarządzania bazami danych. Big data jest często rozproszona na wielu urządzeniach pamięci masowej, czasami w kilku różnych lokalizacjach.
Wiele tradycyjnych systemów zarządzania bazami danych ma ograniczenia dotyczące ilości danych, które mogą przechowywać. Na przykład baza danych Access 2010 może zawierać tylko dwa gigabajty danych, co uniemożliwia przechowywanie kilku petabajtów lub eksabajtów danych. Nawet jeśli system zarządzania bazami danych może przechowywać duże ilości danych, może działać nieefektywnie po utworzeniu zbyt wielu tabel lub rekordów, co może prowadzić do niskiej wydajności. Rozwiązania big data eliminują te problemy, zapewniając szybko reagujące i skalowalne systemy przechowywania danych.
Istnieje kilka różnych rodzajów rozwiązań oprogramowania big data, w tym platformy do przechowywania danych i programy do analizy danych. Do najpopularniejszych produktów oprogramowania big data należą Apache Hadoop, IBM Big Data Platform, Oracle NoSQL Database, Microsoft HDInsight i EMC Pivotal One.
Sprawdź swoją wiedzę