- Большие данные: наборы данных настолько большие или сложные, что они выходят за рамки возможностей традиционных инструментов управления и анализа.
- Четыре «V»: объем, разнообразие, скорость и достоверность — описывают размер, типы, темпы изменений и надежность данных.
- Она включает структурированные данные (числовые базы данных) и неструктурированные данные (веб-ресурсы, электронная почта, социальные сети), что расширяет источники и усложняет анализ.
- Области применения: здравоохранение, улучшение качества обслуживания, общественная безопасность и оптимизация бизнеса; облачные технологии упрощают хранение и масштабируемость по сравнению с традиционными реляционными СУБД.
Большие данные — это широкий термин, обозначающий наборы данных настолько большие или сложные, что традиционные приложения для обработки данных оказываются неэффективными. Большие данные могут включать в себя любой тип информации, как структурированной, так и неструктурированной.
Примеры и определения больших данных
Большие наборы данных
Большие данные — это широкий термин, обозначающий наборы данных настолько большие или сложные, что традиционные приложения для обработки данных оказываются неэффективными. Объем больших данных может быть любым: от терабайтов до петабайтов (1 триллион байт) и более. В целом, большие данные включают в себя как структурированные, так и неструктурированные типы информации.
Большие данные — это огромные объемы информации, генерируемые интернетом, социальными сетями и другими источниками . Под большими данными подразумеваются наборы данных, размер которых превышает возможности традиционных инструментов управления базами данных по эффективному сбору, хранению, управлению и анализу с использованием стандартных реляционных систем управления базами данных (СУБД).
По оценкам, 98% мировых данных были созданы только за последние два года.
Объем данных растет экспоненциально. Фактически, по оценкам, 98% мировых данных были созданы только за последние два года. А если вам интересно, что случилось с оставшимися 2%, то этого мы тоже не знаем.
Как нам справиться с этим экспоненциальным ростом? Нам нужна новая модель хранения данных , которая позволит нам хранить всю нашу информацию, а затем решать, что с ней делать дальше (или нет).
Именно поэтому большинство организаций используют облачные сервисы хранения данных, такие как Amazon Web Services (AWS), Google Cloud Platform (GCP) или Microsoft Azure, вместо того, чтобы создавать собственную инфраструктуру с нуля или использовать традиционные реляционные базы данных, такие как Oracle DBMS или Microsoft SQL Server DBMS, которые требуют ежегодной оплаты дорогостоящих лицензий только для хранения всех этих гигабайтов и гигабайтов цифровых активов.
Четыре V больших данных
Четыре «V» больших данных — это объем, разнообразие, скорость и достоверность.
Объём (Volume) относится к размеру данных, обрабатываемых вашей компанией. Разнообразие (Variety) относится ко всем типам данных: структурированным (например, электронные таблицы) и неструктурированным (например, изображения). Скорость (Velocity) относится к тому, насколько быстро информация меняется со временем: если, например, данные о продажах интернет-магазина меняются примерно каждый час, вам нужна система, которая сможет обрабатывать эти изменения достаточно быстро, чтобы они не оказывали существенного влияния на бизнес-решения.
Наконец, существует правдивость, то есть точность: насколько достоверна информация? Если информация поступает из внешнего источника, например, из социальных сетей вроде Twitter или Facebook, где любой желающий может опубликовать что угодно в любое время без предварительной проверки, она может быть не столь надежной.
Структурированные и неструктурированные данные.
Большие данные могут включать в себя любой тип информации, как структурированной, так и неструктурированной.
Примеры структурированных данных: номера социального страхования, номера кредитных карт и номера телефонов.
Примеры неструктурированных данных: веб-страницы, электронные письма, твиты и другой контент социальных сетей.
Технологии больших данных можно использовать для анализа генома человека и поиска генетических маркеров заболеваний.
Технологии больших данных могут быть использованы для анализа генома человека и поиска генетических маркеров заболеваний. Секвенирование ДНК — это пример технологии больших данных, которая используется в медицинских исследованиях с момента своего появления в начале 2000-х годов. Идентифицируя отдельные гены и их вариации, исследователи могут точно определить генетические факторы, которые способствуют развитию таких заболеваний, как рак или диабет.
Исследования ассоциаций по всему геному (GWAS) используют метод, называемый микрочипами, который позволяет ученым одновременно анализировать тысячи образцов в поисках определенных закономерностей в уровнях экспрессии генов. Этот процесс позволяет им выявлять генетические варианты, связанные с такими заболеваниями, как болезнь Альцгеймера или шизофрения; Однако большинство результатов GWAS остаются неубедительными, во многом потому, что они основаны на небольших размерах выборки (во многих случаях менее 100 человек).
По мере увеличения числа людей, участвующих в этих исследованиях, и особенно если эти участники согласятся на дополнительное тестирование, мы должны ожидать повышения показателей точности, а также лучшего понимания того, как конкретные факторы окружающей среды взаимодействуют с нашими генами на более поздних этапах развития жизненного пути.
Использование больших данных
Сегодня существует множество способов использования больших данных, которые меняют наш образ жизни и работы.
Большие данные могут быть использованы для улучшения здравоохранения, обслуживания клиентов и образования . Они также могут помочь органам общественной безопасности лучше защищать свои сообщества, а предприятиям — получать доступ к новым возможностям за счет использования больших данных для улучшения бизнес-процессов.
Здравоохранение : Врачи и медсестры используют медицинские карты пациентов для принятия решений о лечении, но при таком огромном объеме информации о каждом пациенте трудно найти то, что им нужно, когда это необходимо. С помощью инструментов анализа больших данных врачи получат доступ к более широкому спектру информации о медицинской истории своих пациентов, чем когда-либо прежде, включая информацию о том, вызывало ли лекарство побочные реакции или есть ли другие лекарства, которые могут негативно взаимодействовать друг с другом (например, препараты от артериального давления). Это может спасти жизни, поскольку врачи смогут немедленно узнать, какие методы лечения будут наиболее эффективны, основываясь на прошлом опыте, вместо того, чтобы тратить время на перебор различных комбинаций, пока не найдется подходящий вариант.
Сегодня большие данные имеют множество применений, о которых вы, возможно, не догадываетесь.
Большие данные используются по-разному для анализа человеческого поведения. Его можно использовать для анализа того, как люди используют свои мобильные устройства, как они взаимодействуют друг с другом и даже как они тратят свои деньги.
Вот несколько примеров приложений Big Data:
- Анализируйте социальные сети, чтобы узнать, что происходит в мире вокруг вас, о чем вы, возможно, не знаете (например, тенденции в моде или технологиях).
- Использование датчиков и камер, размещенных в городах, для мониторинга дорожного движения, чтобы правительства могли лучше планировать общественные работы или совершенствовать общественный транспорт.
Заключение
Большие данные — это термин, используемый для описания огромных объемов данных, которые мы можем собирать, анализировать и использовать в повседневной жизни. Эту информацию можно использовать для самых разных целей, например, для поиска генетических маркеров заболеваний или анализа геномов человека для лучшего понимания того, как они функционируют. Важно помнить, что с этой технологией связаны и негативные последствия, такие как опасения по поводу конфиденциальности лиц, имеющих доступ к вашей личной информации.