Analisis hit Spotify: data, algoritma dan sains kejayaan muzik

Kemaskini terakhir: 6 Mei 2026
Pengarang TecnoDigital
  • API Spotify menawarkan berpuluh-puluh pembolehubah audio dan konteks (tenaga, valens, tempoh, kebolehtarian, dll.) yang membolehkan anda memodelkan dan memahami apa yang menjadikan lagu popular.
  • Analisis statistik menunjukkan bahawa hampir semua ciri audio berbeza antara lagu popular dan tidak popular, manakala genre, tonaliti atau sentimen tajuk mempunyai kurang berat ramalan.
  • Model pembelajaran mesin seperti Regresi Logistik, KNN, SVM, Naive Bayes dan Random Forest mencapai ketepatan sekitar 84–85% dalam mengklasifikasikan sama ada sesuatu topik akan berada dalam 15% teratas paling popular.
  • Panjang trek, tenaga, kelantangan dan instrumennya menonjol sebagai faktor utama popularitinya di Spotify, dalam ekosistem yang mana senarai main editorial dan algoritma cadangan adalah penting.

Analisis Hit Spotify

Spotify telah menjadi makmal yang sempurna untuk mengkaji apa yang menjadikan sesebuah lagu menjadi hit : kami mempunyai data main balik masa nyata, metrik lanjutan untuk artis dan berjuta-juta pendengar membuat keputusan setiap saat. Jauh daripada sekadar platform mendengar, Spotify telah berubah menjadi pangkalan data yang besar di mana corak, emosi, genre dan strategi senarai main boleh dianalisis untuk memahami mengapa sesetengah lagu berkembang pesat dan yang lain hilang dalam kegelapan.

Dalam beberapa tahun kebelakangan ini, alatan, penyelidikan akademik dan model pembelajaran mesin yang dikhaskan untuk analisis hit Spotify telah muncul : daripada mengkaji carta editorial seperti Today's Top Hits atau Rap Caviar, kepada membina algoritma yang mampu meramalkan sama ada trek akan tergolong dalam kumpulan paling popular dalam katalog. Pada masa yang sama, Spotify for Artists telah mendemokrasikan akses kepada metrik ini, membolehkan mana-mana artis melihat siapa yang mendengarnya, di mana dan bagaimana ia ditemui, dan menyesuaikan strategi kreatif dan pemasaran mereka dengan sewajarnya.

Apakah sebenarnya analisis hit Spotify dan mengapa ia penting?

Apabila kita bercakap tentang analisis hit Spotify, kita bukan sahaja merujuk kepada berapa kali lagu telah dimainkan. Ia merupakan pendekatan yang lebih luas yang menggabungkan audio, konteks dan tingkah laku pengguna untuk menjawab soalan yang tidak selesa tetapi penting: bolehkah anda meramalkan kejayaan lagu sebelum ia dikeluarkan? Menggunakan data daripada API Spotify, penyelidik bekerja dengan pembolehubah seperti populariti, tenaga, valens, tempoh, tempo dan kebolehan menari untuk cuba mendapatkan jawapan yang lebih dekat.

Pendekatan ini berakar umbi dalam apa yang dipanggil "sains lagu hit ," satu idea yang dipopularkan oleh Mike McCready pada awal tahun 2000-an: menggunakan algoritma dan model matematik untuk meramalkan lagu mana yang akan berprestasi baik di carta dan radio. Walaupun kajian awal menyimpulkan bahawa ia sangat sukar (dan modelnya tidak cukup tepat), landskap telah berubah sepenuhnya dengan kemunculan penstriman, peningkatan besar-besaran dalam jumlah data dan penambahbaikan teknik pembelajaran mesin.

Hari ini, Spotify menawarkan API dengan akses kepada puluhan ribu trek dan atribut muzik dan konteksnya : daripada kekunci dan mod kepada kemungkinan trek itu akustik atau instrumental, termasuk metrik yang direka khusus untuk menggambarkan bagaimana lagu itu dirasakan (tenaga, valens, kebolehan menari, dll.). Semua ini membolehkan peralihan daripada pendapat subjektif kepada analisis kuantitatif yang lebih tepat.

Sementara itu, alat Spotify untuk Artis membantu pencipta mengelakkan diri daripada tersesat dalam metrik kesombongan dan menumpukan pada perkara yang benar-benar penting: pembangunan khalayak jangka panjang, penglibatan, pengekalan dan bagaimana usaha pemasaran memberi kesan kepada penciptaan peminat tulen. Dalam erti kata lain, nombor, ya, tetapi dengan konteks dan niat strategik.

Senarai main dan strategi rasmi: berat senarai editorial

Salah satu elemen terpenting dalam sebarang analisis serius terhadap lagu -lagu hit di Spotify ialah peranan senarai main editorial rasmi . Senarai seperti Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint atau ¡Viva Latino! bertindak sebagai penguat besar: menyertai salah satu daripadanya boleh mengubah sepenuhnya trajektori lagu atau kerjaya artis.

Alat pihak ketiga seperti Soundcharts membolehkan anda melihat prestasi artis pada senarai main ini : bilangan penampilan, tempoh penginapan, pasaran di mana ia mempunyai impak paling besar, dan sebagainya. Analisis jenis ini menjelaskan bahawa kehadiran pada carta editorial bukan sekadar untuk persembahan, tetapi komponen utama strategi pertumbuhan di platform.

Terdapat kriteria berulang tertentu dalam membina senarai main yang berkualiti. Contohnya, pelbagai artis dinilai kerana mengulang nama yang sama berulang kali . Senarai main di mana artis yang sama muncul terlalu banyak kali cenderung menerima penilaian yang lebih rendah kerana ia mengurangkan rasa penemuan pendengar.

Keseimbangan genre yang koheren juga dicari . Apabila senarai main mencampurkan terlalu banyak gaya tanpa hala tuju yang jelas, pengalaman menjadi berpecah-belah dan rating menurun. Senarai main yang berprestasi terbaik cenderung untuk memberi tumpuan kepada satu atau beberapa genre yang jelas, membantu pengguna memahami sepintas lalu apa yang diharapkan apabila mereka menekan main.

Satu lagi aspek penting ialah gabungan antara lagu-lagu terkenal dan lagu-lagu baru muncul . Senarai main yang hanya menyertakan lagu-lagu hit besar adalah baik, tetapi ia menawarkan sedikit penemuan. Sebaliknya, senarai main yang menggabungkan lagu-lagu lama dengan lagu-lagu yang kurang dikenali cenderung menjana penglibatan yang lebih besar dan membantu mencipta lagu-lagu hit baharu.

Akhir sekali, terdapat persetujuan umum bahawa senarai main yang baik harus mempunyai sekurang-kurangnya 50 trek untuk menawarkan pengalaman yang lengkap . Senarai main dengan kurang daripada 10 lagu sering dianggap lemah dan menerima skor yang lebih rendah, yang turut mempengaruhi prestasi trek yang disertakan.

Sejarah ringkas Spotify dan asal usul analitiknya

Sebelum Spotify dapat melakukan analisis hit lanjutan, platform itu sendiri perlu mencari tempatnya dalam industri muzik. Idea yang dicetuskan oleh pengasas bersama Daniel Ek, timbul selepas kejatuhan Napster pada tahun 2002: beliau ingin mewujudkan perkhidmatan "yang lebih baik daripada cetak rompak, tetapi itu juga memberi manfaat kepada industri ." Pada masa itu, Ek menjalankan uTorrent, salah satu klien muat turun dan perkongsian P2P yang terkemuka, jadi beliau mempunyai pengetahuan langsung tentang dunia pengedaran tanpa kebenaran.

  Semua tentang OLAP: apakah itu dan cara memanfaatkannya sepenuhnya

Selepas menjual uTorrent kepada BitTorrent pada akhir tahun 2006, Ek menumpukan sepenuhnya kepada pembinaan Spotify. Aplikasi ini dilancarkan secara rasmi pada tahun 2008 di Sweden, selepas mencapai perjanjian pelesenan dan ekuiti dengan label rakaman utama : Sony Music Entertainment, Universal Music Group dan Warner Music Group. Setahun kemudian, ia berkembang ke UK, dan pada tahun 2011, ia dilancarkan di AS.

Dalam tempoh awal itu, pangkalan pelanggan berbayar meningkat daripada sekitar 1 juta di Eropah kepada hampir 4 juta di seluruh dunia pada tahun 2012. Menjelang 2016, Spotify telah mengumumkan 40 juta pengguna berbayar dan sekitar 100 juta jumlah pengguna, sekali gus mengukuhkan penstriman sebagai bentuk penggunaan muzik yang dominan di seluruh dunia.

Pada masa yang sama, alat data untuk artis mula muncul. Mula-mula muncul Fan Insights , yang menawarkan akses terhad kepada data penstriman kepada sesetengah pasukan: demografi, geografi dan trend asas. Pada tahun 2017, penyelesaian ini berkembang menjadi Spotify untuk Artis, membuka pintu untuk semua artis melihat metrik utama mereka dan menggunakan data tersebut untuk membuat keputusan tentang jelajah, keluaran dan promosi.

Pada tahun 2018, syarikat itu disenaraikan sebagai syarikat awam dengan permodalan pasaran hampir $30.000 bilion . Sejak itu, bilangan pasaran tempat ia beroperasi terus berkembang, berserta kepentingan analitik dalam platform tersebut. Apa yang bermula sebagai pemain media berlesen telah menjadi infrastruktur global di mana data menguasai sepenuhnya.

Metrik Spotify: cara mengukur lagu melangkaui strim

Untuk membina model ramalan hit, pertama sekali perlu memahami jenis data yang ditawarkan oleh Spotify API . Dalam satu kajian yang tertumpu pada pasaran India, sebagai contoh, lebih daripada 46.000 rekod lagu telah diekstrak daripada senarai main yang dijana oleh Spotify, meliputi pelbagai genre dan subgenre.

Maklumat tersebut disusun kepada beberapa blok. Pada peringkat trek, kita dapati data seperti pengecam, tajuk, artis, populariti, tarikh keluaran dan tempoh dalam milisaat . Pada peringkat album, ID dan nama disimpan. Pada peringkat senarai main, nama, ID, genre dan subgenre yang berkaitan akan dipaparkan.

Tetapi aspek yang paling menarik untuk analisis hit ialah ciri audio , yang dibahagikan kepada kategori yang berbeza: ciri mood (kebolehtarian, tenaga, valens, tempo), sifat fizikal (kenyaringan, pertuturan, instrumental), konteks (akustik, keaktifan), dan segmen muzik (key, mod). Setiap pembolehubah ini ditakrifkan dan dinormalisasi dengan teliti.

Kebolehtarian, sebagai contoh, dinyatakan sebagai nilai antara 0 dan 1 yang meringkaskan betapa mudahnya untuk menari mengikut lagu , berdasarkan elemen seperti irama, kestabilan tempo dan kekuatan rentak. Tenaga juga berbeza-beza antara 0 dan 1 dan cuba untuk menangkap sama ada trek itu kedengaran kuat, pantas dan berkuasa, berbanding sesuatu yang lebih tenang atau lebih lembut.

Valensi menggambarkan "positiviti" emosi yang dirasakan dalam audio: nilai rendah sepadan dengan perasaan sedih, tegang atau muram, manakala nilai tinggi sepadan dengan muzik yang ceria, cerah atau euforia. Akustik mengukur kemungkinan trek menjadi akustik, keceriaan kehadiran penonton langsung dalam rakaman dan keterlaluan pertuturan mencerminkan perkadaran perkataan yang dituturkan dalam campuran (sangat tinggi, contohnya, dalam podcast atau trek perkataan yang dituturkan).

Parameter penting lain termasuk tempo dalam BPM , jumlah tempoh, kekunci (dikodkan sebagai integer), mod (major atau minor) dan populariti trek. Populariti ialah metrik dalaman Spotify antara 0 hingga 100 dan bergantung pada kedua-dua jumlah strim dan kebaharuannya . Lagu yang popular bertahun-tahun yang lalu tetapi kini jarang dimainkan akan menyaksikan skornya menurun dari semasa ke semasa.

Cara menyediakan dan membersihkan set data untuk dapat meramalkan hits

Satu langkah yang sering diabaikan ketika membincangkan analisis hit Spotify ialah penyediaan set data . Dalam kajian ini, data dikumpulkan menggunakan R dan RStudio, yang memanggil API Spotify untuk kombinasi pasaran (India), genre dan subgenre yang berbeza yang dipilih mengikut pemberat global dan tempatannya.

Apabila menggabungkan lagu daripada pelbagai senarai main bertema, adalah perkara biasa bagi banyak trek untuk diulang, kerana lagu yang sama boleh muncul dalam senarai yang berbeza. Memandangkan matlamatnya bukan untuk menganalisis strategi senarai main itu sendiri, tetapi sebaliknya ciri-ciri lagu, trek pendua telah dialih keluar , mengurangkan jumlah asas daripada 46.417 kepada kira-kira 39.147 lagu unik.

Lajur yang tidak akan digunakan sebagai pembolehubah penjelasan dalam model, seperti artis, ID dan nama album, dan medan khusus senarai main, telah dialih keluar. Pada masa yang sama, nama medan telah dinormalisasikan dan jenis data telah diselaraskan: contohnya, populariti, mod, kekunci dan tempoh telah ditukar kepada nilai apungan untuk memudahkan analisis statistik.

Satu keputusan penting adalah untuk mengubah populariti menjadi pembolehubah yang lebih mudah diurus. Daripada menggunakan nilai berterusan dari 0 hingga 100, satu ambang telah ditakrifkan untuk memisahkan lagu popular dan tidak popular . Dengan mengambil persentil ke-85 taburan (sekitar populariti 65), trek di atas nilai tersebut dianggap "popular" dan selebihnya "tidak popular".

Dengan cara ini, set data dibahagikan kepada hampir 6.000 lagu popular dan kira-kira 33.000 lagu yang tidak popular . Untuk analisis penerokaan, ia juga dibahagikan kepada lima kelas populariti (sangat tinggi, tinggi, sederhana, rendah dan sangat rendah), dengan selang 20 mata, yang membolehkan perbandingan trend halus antara tahap kejayaan.

Di samping itu, pembolehubah baharu telah dijana daripada tajuk lagu: penunjuk sentimen . Menggunakan pustaka TextBlob dalam Python, polariti untuk setiap tajuk (nombor antara -1 dan 1) telah dikira dan dikelaskan sebagai positif, negatif atau neutral. Nilai berangka ini telah ditambah pada kerangka data untuk mengkaji sama ada nada tajuk dikaitkan dengan popularitinya.

  Hukum Benford: Antara Sihir dan Sains

Penerokaan data: apa yang membezakan lagu-lagu paling popular

Sebelum melatih sebarang model pembelajaran mesin, adalah penting untuk memperuntukkan masa untuk penerokaan visual dan statistik data . Dalam kes kajian ini, lengkung taburan, purata setiap kumpulan populariti dan hubungan antara emosi dan kejayaan telah dianalisis.

Salah satu penemuan menarik berkaitan dengan valensi lagu-lagu yang paling berjaya. Apabila melihat trek dengan skor populariti melebihi 90, diperhatikan bahawa sebilangan besar daripadanya mempunyai nilai valensi di bawah 0,5 ; iaitu, ia kedengaran lebih sedih, lebih muram, atau melankolik daripada ceria. Ia bukanlah dominasi mutlak, tetapi ia adalah trend yang jelas.

Apabila taburan populariti mengikut genre diplotkan, kebanyakan lengkungan mengambil bentuk loceng anggaran , dengan banyak trek di sekitar purata dan lebih sedikit di hujungnya. Walau bagaimanapun, genre seperti rock, R&B, EDM, muzik dunia dan India menunjukkan beberapa asimetri disebabkan oleh sebilangan besar trek dengan populariti sifar. Sebaliknya, gaya seperti pop, rap, Latin dan desi kelihatan lebih seimbang dan kurang tumpuan pada sifar.

Ini menunjukkan bahawa dalam genre yang lebih arus perdana, secara amnya lebih mudah untuk mencapai tahap populariti tertentu , walaupun lagu-lagu tersebut tidak mempunyai semua ciri ideal, manakala dalam gaya lain, taburan kejayaan lebih terpolarisasi.

Apabila membandingkan purata ciri-ciri berbeza mengikut kelas populariti, corak yang sangat jelas muncul: trek yang paling berjaya cenderung mempunyai tenaga dan kelantangan yang lebih tinggi (kelantangan yang dirasakan) , serta lebih banyak instrumentalisme dan kurang keterlaluan. Secara ringkasnya, lagu yang berprestasi terbaik di platform penstriman biasanya lebih berkuasa dan lebih tertumpu pada muzik berbanding perkataan yang dituturkan.

Ia juga diperhatikan bahawa trek popular mempamerkan akustik dan keceriaan yang lebih rendah ; iaitu, ia kedengaran kurang "akustik" dan kurang "langsung." Ia lebih dihasilkan di studio, lebih digilap, dengan kurang hingar ambien atau nuansa seperti konsert.

Satu lagi penemuan penting ialah lagu popular cenderung lebih pendek daripada lagu yang tidak popular . Dalam konteks di mana pendapatan bergantung pada bilangan strim dan algoritma memberi ganjaran kepada pengulangan, adalah masuk akal bahawa trek yang lebih pendek dapat mengumpul mainan dengan lebih cepat dan menjadi lebih mesra senarai main.

Berkenaan dengan kebahagiaan yang dirasakan (valens), trendnya agak pelik: tahap meningkat daripada kelas populariti yang lebih rendah kepada kelas "atas", tetapi dalam kategori paling ekstrem, iaitu "sangat tinggi", terdapat penurunan yang ketara. Dalam erti kata lain, lagu-lagu super popular cenderung kedengaran lebih sedih daripada sekadar lagu "berjaya" , yang membuka pintu kepada banyak tafsiran tentang citarasa awam dan konteks sosio-emosi.

Analisis statistik: kesan genre dan atribut audio

Setelah data diterokai, langkah seterusnya adalah menggunakan ujian statistik formal untuk melihat pembolehubah mana yang boleh dianggap relevan dalam menjelaskan populariti. Untuk mengkaji sama ada jantina mempengaruhi kejayaan, analisis varians (ANOVA) telah digunakan dengan sembilan genre utama.

Keputusan ANOVA menghasilkan nilai-F yang sangat tinggi dan hampir tiada kepentingan, bermakna terdapat perbezaan populariti yang signifikan secara statistik antara jantina . Walau bagaimanapun, itu tidak mencukupi: penting juga untuk mengetahui pasangan jantina yang mana perbezaan ini wujud antara dan sama ada pembolehubah tersebut akan berguna untuk model ramalan.

Memandangkan varians tidak homogen dan bilangan lagu setiap genre berbeza-beza, ujian post hoc Games-Howell telah digunakan . Analisis ini membolehkan kami menentukan kombinasi genre yang tidak menunjukkan perbezaan populariti yang ketara, yang secara keseluruhannya menjadikannya kurang digalakkan untuk menggunakan genre sebagai peramal yang kuat dalam model pembelajaran mesin.

Secara selari, ujian-t bebas telah dijalankan untuk setiap ciri audio, membandingkan min antara kumpulan lagu popular dan tidak popular. Pada tahap keertian 95%, hampir semua pembolehubah (kebolehtarian, tenaga, kenyaringan, akustik, keaktifan, tempoh, tempo, valens dan instrumental) menunjukkan perbezaan yang ketara antara kedua-dua kumpulan.

Satu-satunya pengecualian yang ketara ialah kebolehucapan . Dalam ujian pertama, perbezaan min tidak signifikan, tetapi analisis lanjut mendedahkan bahawa julat kebolehucapan untuk topik yang sangat popular (dengan nilai antara 0,024 dan 0,685) berada dalam julat yang lebih luas bagi kelas yang kurang popular (antara 0 dan 0,964). Pertindihan ini tidak menghalang kebolehucapan, apabila digunakan dengan berkesan, daripada menyumbang maklumat kepada model, jadi diputuskan untuk mengekalkannya sebagai peramal.

Secara ringkasnya, blok ciri audio menunjukkan kuasa deskriptif yang jelas mengenai populariti , manakala genre dikendalikan dengan lebih berhati-hati dan dibuang sebagai pembolehubah utama dalam beberapa pendekatan ramalan.

Membina model pembelajaran mesin untuk meramalkan kejayaan

Setelah set data dibersihkan dan pembolehubah yang berkaitan dipilih, tiba masanya untuk mencipta model pengelasan binari yang mampu meramalkan sama ada lagu tergolong dalam 15% populariti teratas. Untuk melakukan ini, pembolehubah kategori kunci dan mod terlebih dahulu ditukar menjadi pembolehubah dummy menggunakan fungsi get_dummies Pandas.

Selepas menggabungkan dummy ini, lajur tonaliti dan mod asal, serta populariti berterusan, telah dialih keluar, dan medan populariti binari (popular vs. tidak popular) dikekalkan sebagai pembolehubah sasaran. Sebelum melatih model, semua ciri berangka telah diseragamkan menggunakan StandardScaler, kerana ia beroperasi pada skala yang sangat berbeza dan adalah penting bahawa ia mempunyai berat yang setanding.

Set data telah dibahagikan kepada latihan dan ujian menggunakan fungsi train_test_split, memperuntukkan 20% rekod untuk ujian . Ini menghalang kebocoran data dan memastikan metrik prestasi mencerminkan kebolehgeneralisasian sebenar model, bukan sekadar keupayaannya untuk menghafal data latihan.

  Panduan Lengkap untuk Analisis Data Moden dan Seni Bina Data

Model pertama yang digunakan ialah Regresi Logistik , satu teknik yang digunakan secara meluas dalam pengelasan binari. Versi lelaran dengan kadar pembelajaran 0,01 dan 200 lelaran telah dilaksanakan dan dinilai menggunakan pengesahan silang. Ketepatan purata mencapai kira-kira 84,7%, satu keputusan yang sangat kukuh untuk masalah yang serumit meramalkan kejayaan muzik.

Seterusnya, algoritma K-Nearest Neighbors (KNN) telah diuji , yang mengklasifikasikan setiap lagu mengikut k jiran terdekatnya dalam ruang ciri. Dengan melaraskan nilai ky menggunakan Grid Search untuk mencari konfigurasi optimum, ketepatan yang sangat serupa telah diperoleh, sekitar 84,8%, dengan sedikit peningkatan dalam skor pengesahan silang berbanding regresi logistik.

Model seterusnya ialah Mesin Vektor Sokongan (SVM) , satu lagi teknik yang diselia yang mampu mengendalikan kedua-dua hubungan linear dan tak linear. Sekali lagi, melalui penalaan hiperparameter, ketepatan sekitar 84,6% telah dicapai, dengan nilai setara dalam pengesahan silang, menunjukkan prestasi yang stabil.

Pengelas Naive Bayes , berdasarkan andaian kebebasan antara ciri, juga dinilai . Walaupun merupakan model yang lebih mudah dari segi andaian, keputusan ketepatannya (kira-kira 84,6%) adalah setanding dengan SVM dan sangat hampir dengan regresi logistik dan KNN, mengukuhkan idea bahawa struktur masalah sesuai untuk pendekatan kebarangkalian jenis ini.

Akhir sekali, model berasaskan pokok keputusan telah diuji. Pengelas Pokok Keputusan mencapai ketepatan yang jauh lebih rendah, sekitar 75,4%, dan pengesahan silang mengesahkan penurunan prestasi ini, mungkin disebabkan oleh isu overfitting. Pengelas Hutan Rawak , yang menggabungkan banyak pokok untuk melicinkan kesan ini, telah meningkat dengan ketara, mencapai ketepatan sekitar 84,1% dan lebih 84% dalam pengesahan silang.

Untuk melengkapkan analisis, matriks kekeliruan dan laporan pengelasan telah dijana untuk Hutan Rawak. Model ini menunjukkan keupayaan yang sangat baik untuk mengenal pasti lagu-lagu bukan popular (kelas majoriti), dengan ketepatan 0,85 dan penarikan balik hampir 0,99, manakala prestasinya dalam kelas lagu popular (kelas minoriti) adalah lebih sederhana, dengan ketepatan 0,40 dan penarikan balik 0,05. Ini menonjolkan cabaran klasik ketidakseimbangan kelas dalam masalah jenis ini.

Kepentingan pembolehubah: apa yang paling penting semasa mencipta kejayaan

Selain mengetahui model yang paling tepat, adalah penting untuk memahami ciri-ciri yang benar-benar memberikan maklumat berguna apabila meramalkan sama ada sesuatu lagu akan popular. Untuk tujuan ini, XGBoost (XGBClassifier) ​​​​telah digunakan untuk mendapatkan skor kepentingan yang berubah-ubah, berdasarkan sumbangan setiap ciri untuk mengurangkan ralat dalam pokok keputusan.

Keputusan menunjukkan bahawa panjang lagu itu jelas menonjol daripada yang lain , dengan skor F jauh melebihi 400. Penemuan ini sesuai dengan idea bahawa trek yang lebih pendek menggalakkan pendengaran berulang dan oleh itu mengumpul lebih banyak mainan dalam masa yang lebih singkat, sesuatu yang cenderung diberi ganjaran oleh algoritma cadangan Spotify.

Di hujung spektrum yang bertentangan, pembolehubah seperti kunci, mod atau sentimen yang diekstrak daripada tajuk itu sendiri menerima skor kepentingan di bawah 50, menunjukkan bahawa sumbangannya kepada kuasa ramalan keseluruhan model adalah minimum. Ini tidak bermakna ia tidak mempunyai kesan langsung, tetapi sebaliknya, berbanding dengan ciri-ciri lain, pemberatnya jauh lebih kecil.

Atribut audio yang selebihnya (seperti tenaga, kebolehtarian, valensi, kenyaringan, akustik, keaktifan, pertuturan dan instrumental) berada dalam julat pertengahan, dengan skor-F antara 200 dan 300, menunjukkan bahawa ia membentuk blok maklumat yang agak seimbang . Tiada satu pun daripadanya yang mendominasi sepenuhnya, tetapi bersama-sama ia membantu membina gambaran yang agak tepat tentang peluang kejayaan sesebuah lagu.

Secara keseluruhannya, model berdasarkan ciri audio dapat meramalkan dengan ketepatan sekitar 84-85% sama ada sesebuah trek akan menjadi sebahagian daripada 15% paling popular , yang memberikan sedikit sokongan empirikal kepada intuisi lama "sains lagu hit": dengan data yang baik dan teknik yang sesuai, kejayaan muzik tidak semata-mata rawak, walaupun masih terdapat komponen yang tidak dapat diramalkan yang ketara.

Gambaran yang dilukis oleh analisis ini menunjukkan bahawa menggabungkan data Spotify, statistik tradisional dan model pembelajaran mesin membolehkan kita melangkaui sekadar mengira strim. Memahami kesan tempoh, tenaga, valens dan instrumentaliti, berserta peranan senarai main editorial dan dinamik cadangan platform, menyediakan artis, label dan penganalisis dengan pelan tindakan yang sangat konkrit untuk mentafsir mengapa lagu-lagu tertentu menjadi hit dan bagaimana mereka boleh memaksimumkan peluang mereka untuk menyertai kumpulan terpilih itu tanpa kehilangan sepenuhnya elemen manusia dan kreatif yang, mujurlah, kekal tidak dapat dikurangkan kepada sebarang formula.

jenis kecerdasan buatan
Artikel berkaitan:
7 Jenis Kepintaran Buatan yang akan mengubah masa depan kita