- Big data: datasets die zo groot of complex zijn dat ze de mogelijkheden van traditionele beheer- en analysetools te boven gaan.
- De vier V's: volume, variëteit, snelheid en betrouwbaarheid, beschrijven de omvang, soorten, veranderingssnelheid en betrouwbaarheid van de gegevens.
- Het omvat gestructureerde data (numerieke databases) en ongestructureerde data (web, e-mails, sociale netwerken), waardoor de bronnen en de complexiteit van de analyse toenemen.
- Toepassingen: gezondheidszorg, serviceverbetering, openbare veiligheid en bedrijfsoptimalisatie; de cloud maakt opslag en schaalbaarheid mogelijk in vergelijking met traditionele RDBMS.
Big data is een brede term voor datasets die zo groot of complex zijn dat traditionele gegevensverwerkingstoepassingen niet toereikend zijn. Big data kunnen allerlei soorten informatie omvatten, zowel gestructureerd als ongestructureerd.
Voorbeelden en definities van big data
Grote datasets
Big data is een brede term voor datasets die zo groot of complex zijn dat traditionele gegevensverwerkingstoepassingen niet toereikend zijn. De omvang van big data kan variëren van terabytes tot petabytes (1 biljoen bytes) en groter. Over het algemeen omvat het bereik van big data zowel gestructureerde als ongestructureerde soorten informatie.
Big data verwijst naar de enorme hoeveelheden informatie die worden gegenereerd door het internet, sociale media en andere bronnen . Big data betreft datasets waarvan de omvang de capaciteit van traditionele databasebeheersystemen (RDBMS) overstijgt om ze effectief vast te leggen, op te slaan, te beheren en te analyseren.
Geschat wordt dat 98% van alle data ter wereld alleen al in de afgelopen twee jaar is gecreëerd.
Data groeit exponentieel. Geschat wordt dat 98% van alle data ter wereld in de afgelopen twee jaar is gecreëerd. En als u zich afvraagt wat er met de overige 2% is gebeurd, dan weten wij dat ook niet.
Hoe kunnen we deze exponentiële groei het hoofd bieden? Wel, we hebben een nieuw dataopslagmodel nodig waarmee we al onze informatie kunnen opslaan en later kunnen bepalen wat we ermee doen (of niet).
Daarom maken de meeste organisaties gebruik van cloudopslagservices zoals Amazon Web Services (AWS), Google Cloud Platform (GCP) of Microsoft Azure, in plaats van hun eigen infrastructuur vanaf nul op te bouwen of traditionele relationele databases zoals Oracle DBMS of Microsoft SQL Server DBMS te gebruiken, waarvoor jaarlijks dure licenties moeten worden betaald om al die gigabytes aan digitale gegevens te kunnen opslaan.
De vier V's van big data
De vier V's van big data zijn volume, variëteit, snelheid en waarheidsgetrouwheid.
Volume verwijst naar de omvang van de data die uw bedrijf verwerkt. Variëteit verwijst naar alle soorten data: gestructureerd (zoals spreadsheets) en ongestructureerd (zoals afbeeldingen). Snelheid verwijst naar hoe snel de informatie in de loop van de tijd verandert: als het bijvoorbeeld gaat om de verkoopcijfers van een webwinkel die ongeveer elk uur veranderen, hebt u een systeem nodig dat die veranderingen snel genoeg kan verwerken, zodat ze geen significante invloed hebben op zakelijke beslissingen.
Ten slotte is er de waarheidsgetrouwheid, dat wil zeggen de nauwkeurigheid: in hoeverre is de informatie betrouwbaar? Als het afkomstig is van een externe bron, zoals sociale netwerken als Twitter of Facebook, waar iedereen op elk moment iets kan posten zonder voorafgaande verificatie, is het mogelijk minder betrouwbaar.
Gestructureerde en ongestructureerde gegevens.
Big data kunnen allerlei soorten informatie omvatten, zowel gestructureerd als ongestructureerd.
Voorbeelden van gestructureerde gegevens: burgerservicenummers, creditcardnummers en telefoonnummers.
Voorbeelden van ongestructureerde gegevens: webpagina's, e-mails, tweets en andere content van sociale media.
Big data-technologie kan worden gebruikt om het menselijk genoom te analyseren en genetische markers van ziekten te vinden.
Big data-technologie kan worden gebruikt om het menselijk genoom te analyseren en genetische markers voor ziekten te vinden. DNA-sequencing is een voorbeeld van big data-technologie die sinds de introductie ervan begin jaren 2000 in medisch onderzoek wordt gebruikt. Door individuele genen en hun variaties te identificeren, kunnen onderzoekers genetische factoren aanwijzen die bijdragen aan ziekten zoals kanker of diabetes.
Bij genoomwijde associatiestudies (GWAS) wordt gebruikgemaakt van een techniek genaamd microarrays. Hiermee kunnen wetenschappers duizenden monsters tegelijk analyseren en zoeken naar specifieke patronen in de genexpressieniveaus. Met dit proces kunnen ze genetische varianten identificeren die verband houden met ziekten als Alzheimer of schizofrenie; De meeste GWAS-resultaten blijven echter inconclusief, voornamelijk omdat ze gebaseerd zijn op kleine steekproeven (in veel gevallen minder dan 100 personen).
Naarmate het aantal deelnemers aan deze onderzoeken toeneemt, en vooral als deze deelnemers toestemming geven voor aanvullende tests, kunnen we verwachten dat de nauwkeurigheid toeneemt en dat we beter begrijpen hoe specifieke omgevingsfactoren tijdens ontwikkelingsstadia en later in ons leven interacteren met onze genen.
Toepassingen voor Big Data
Tegenwoordig zijn er veel toepassingen voor Big Data die de manier waarop we leven en werken veranderen.
Big data kan worden gebruikt om de gezondheidszorg, klantenservice en het onderwijs te verbeteren . Het kan ook openbare veiligheidsdiensten helpen hun gemeenschappen beter te beschermen en bedrijven toegang geven tot nieuwe kansen door big data in te zetten om bedrijfsprocessen te optimaliseren.
Gezondheidszorg : Artsen en verpleegkundigen gebruiken patiëntendossiers om behandelbeslissingen te nemen, maar met zoveel informatie over elke patiënt is het moeilijk om te vinden wat ze nodig hebben op het moment dat ze het nodig hebben. Met behulp van big data-analysetools krijgen artsen toegang tot een breder scala aan informatie over de medische geschiedenis van hun patiënten dan ooit tevoren, inclusief informatie over of een medicijn een bijwerking heeft veroorzaakt of of er andere medicijnen zijn die negatief op elkaar kunnen inwerken (zoals bloeddrukverlagende middelen). Dit kan levens redden, omdat artsen direct weten welke behandelingen het beste werken op basis van eerdere ervaringen, in plaats van tijd te verspillen met het uitproberen van verschillende combinaties totdat er iets werkt dat voldoende effectief is.
Big Data kent tegenwoordig veel toepassingen waarvan u zich misschien niet bewust bent.
Big data wordt op veel verschillende manieren gebruikt om menselijk gedrag te analyseren. Het kan worden gebruikt om te analyseren hoe mensen hun mobiele apparaten gebruiken, hoe ze met elkaar omgaan en zelfs hoe ze hun geld uitgeven.
Hier zijn enkele voorbeelden van Big Data-toepassingen:
- Analyseer sociale media om erachter te komen wat er om je heen gebeurt waar je zelf misschien geen weet van hebt (bijvoorbeeld trends op het gebied van mode of technologie).
- Met sensoren en camera's in steden het verkeer monitoren, zodat overheden openbare werken beter kunnen plannen of het openbaar vervoer kunnen verbeteren.
Conclusie
Big data is een term die wordt gebruikt om de enorme hoeveelheden gegevens te beschrijven die we kunnen verzamelen, analyseren en gebruiken in ons dagelijks leven. Deze informatie kan voor veel verschillende doeleinden worden gebruikt, bijvoorbeeld voor het vinden van genetische markers voor ziekten of voor het analyseren van het menselijk genoom om beter te begrijpen hoe het functioneert. Het is belangrijk om te onthouden dat deze technologie ook negatieve gevolgen heeft, zoals zorgen over de privacy van de mensen die toegang hebben tot uw persoonlijke gegevens.