- ビッグ データ: 従来の管理および分析ツールの能力を超えるほど大規模または複雑なデータ セット。
- 4 つの V (量、多様性、速度、正確性) は、データのサイズ、種類、変化率、信頼性を表します。
- これには、構造化データ (数値データベース) と非構造化データ (Web、電子メール、ソーシャル ネットワーク) が含まれ、ソースが拡大し、分析の複雑さが増しています。
- アプリケーション: 健康、サービスの改善、公共の安全、ビジネスの最適化。クラウドは、従来の RDBMS と比較して、ストレージとスケーラビリティを容易にします。
ビッグデータとは、従来のデータ処理アプリケーションでは対応できないほど大規模または複雑なデータセットを指す広義の用語です。ビッグデータには、構造化された情報と非構造化された情報の両方を含む、あらゆる種類の情報が含まれます。
ビッグデータの例と定義
ビッグデータセット
ビッグデータとは、従来のデータ処理アプリケーションでは対応できないほど大規模または複雑なデータセットを指す広義の用語です。ビッグデータの範囲は、テラバイトからペタバイト (1 兆バイト) 以上まで、あらゆるサイズになります。一般に、ビッグデータの範囲には、構造化された情報と非構造化された情報の両方が含まれます。
ビッグデータとは、インターネット、ソーシャルメディア、その他の情報源によって生成される膨大な量の情報を指します。ビッグデータとは、従来のデータベース管理ツールでは、標準的なリレーショナルデータベース管理システム(RDBMS)を使用して効果的に収集、保存、管理、分析する能力を超える規模のデータセットを指します。
世界のデータの 98% は、過去 XNUMX 年間だけで作成されたと推定されています。
データは指数関数的に増加します。実際、世界のデータの 98% は過去 2 年間だけで作成されたと推定されています。残りの XNUMX% がどうなったのか疑問に思うかもしれませんが、それもわかりません。
この爆発的な増加にどう対処すればよいでしょうか? それは、すべての情報を保存し、後でその情報をどうするか(あるいはどうしないか)を判断できるような、新しいデータストレージモデルが必要です。
そのため、ほとんどの組織は、独自のインフラストラクチャをゼロから構築したり、 Oracle DBMSやMicrosoft SQL Server DBMSのような従来の関係型データベースを使用したりする代わりに、Amazon Web Services(AWS)、Google Cloud Platform(GCP)、Microsoft Azureなどのクラウドストレージサービスを利用しています。これらの従来の関係型データベースは、膨大な量のデジタル資産を保存し続けるためだけに、毎年高額なライセンス料を支払う必要があるからです。
ビッグデータの4つのV
ビッグデータの 4 つの V は、量、多様性、速度、正確性です。
ボリュームとは、企業が処理するデータの量を指します。バラエティとは、構造化データ(スプレッドシートなど)と非構造化データ(画像など)を含む、データのあらゆる種類を指します。ベロシティとは、情報が時間とともに変化する速さを指します。例えば、オンラインストアの売上高が約1時間ごとに変化するような場合、ビジネス上の意思決定に大きな影響を与えないよう、変化に迅速に対応できるシステムが必要です。
最後に、真実性、つまり正確性があります。情報はどの程度信頼できるのでしょうか? Twitter や Facebook などのソーシャル ネットワークなど、事前の確認なしに誰でもいつでも何でも投稿できる外部ソースからの情報の場合は、信頼性が低い可能性があります。
構造化データと非構造化データ。
ビッグデータには、構造化された情報と非構造化された情報の両方を含む、あらゆる種類の情報が含まれます。
構造化データの例: 社会保障番号、クレジットカード番号、電話番号。
非構造化データの例: Web ページ、電子メール、ツイート、その他のソーシャル メディア コンテンツ。
ビッグデータ技術は、ヒトゲノムを分析し、病気の遺伝子マーカーを見つけるために使用できます。
ビッグデータ技術は、ヒトゲノムの解析や疾患の遺伝子マーカーの発見に利用できる。DNAシーケンスは、2000年代初頭の黎明期から医学研究に活用されてきたビッグデータ技術の一例である。個々の遺伝子とその変異を特定することで、研究者は癌や糖尿病などの疾患に関与する遺伝的要因を突き止めることができる。
ゲノムワイド関連研究 (GWAS) では、マイクロアレイと呼ばれる技術を採用しており、科学者はこれによって数千のサンプルを一度に分析し、遺伝子発現レベルの特定のパターンを探すことができます。このプロセスにより、アルツハイマー病や統合失調症などの疾患に関連する遺伝子変異を特定することができます。しかし、GWAS の結果のほとんどは、サンプル サイズが小さい (多くの場合、100 人未満) ため、決定的な結果は得られていません。
こうした研究に参加する人の数が増えれば、特に参加者が追加検査に同意すれば、人生の後半の発達段階で特定の環境要因が遺伝子とどのように相互作用するかについての理解が深まるとともに、精度も高まることが期待できます。
ビッグデータの用途
今日、ビッグデータはさまざまな用途に利用され、私たちの生活や仕事のやり方を変えています。
ビッグデータは、医療、顧客サービス、教育の改善に活用できます。また、公共安全機関が地域社会をより効果的に保護したり、企業がビッグデータを活用して業務プロセスを改善することで新たなビジネスチャンスを獲得したりするのに役立ち得ます。
医療:医師や看護師は患者の記録に基づいて治療方針を決定しますが、患者ごとに膨大な情報が蓄積されているため、必要な情報を必要な時に見つけるのが困難です。ビッグデータ分析ツールを活用することで、医師は患者の病歴に関するこれまで以上に幅広い情報にアクセスできるようになります。例えば、ある薬剤が副作用を引き起こしたかどうか、あるいは(血圧降下剤のように)他の薬剤と相互作用を起こす可能性があるかどうかといった情報も得られます。これにより、医師は過去の経験に基づいて最適な治療法を即座に判断できるようになり、効果が十分に現れるまで様々な組み合わせを試すという無駄な時間を費やすことなく、命を救うことができるでしょう。
ビッグデータは現在、あなたが気づいていない多くの用途で使用されています。
ビッグデータは、人間の行動を分析するためにさまざまな方法で使用されます。これを使用すると、人々がモバイル デバイスをどのように使用しているか、どのように互いにやり取りしているか、さらにはお金をどのように使っているかを分析できます。
ビッグデータ アプリケーションの例をいくつか示します。
- ソーシャル メディアを分析して、自分の知らない世界で何が起こっているか (ファッションやテクノロジーのトレンドなど) を調べます。
- 都市に設置されたセンサーやカメラを使用して交通を監視し、政府が公共事業をより適切に計画したり、公共交通機関を改善したりできるようにします。
結論
ビッグデータとは、私たちが日常生活で収集、分析、使用できる膨大な量のデータを表すために使用される用語です。この情報は、病気の遺伝子マーカーを見つけたり、ヒトゲノムを分析してその機能の理解を深めるなど、さまざまな目的に使用できます。このテクノロジーには、個人情報にアクセスできる人々のプライバシーに関する懸念など、マイナスの影響もあることを覚えておくことが重要です。