Analisis lagu hits Spotify: data, algoritma, dan ilmu di balik kesuksesan musik.

Pembaharuan Terakhir: May 6 2026
  • API Spotify menawarkan puluhan variabel audio dan konteks (energi, valensi, durasi, kemampuan untuk menari, dll.) yang memungkinkan Anda untuk memodelkan dan memahami apa yang membuat sebuah lagu populer.
  • Analisis statistik menunjukkan bahwa hampir semua fitur audio berbeda antara lagu populer dan lagu yang tidak populer, sementara genre, tonalitas, atau sentimen judul memiliki bobot prediktif yang lebih rendah.
  • Model pembelajaran mesin seperti Regresi Logistik, KNN, SVM, Naive Bayes, dan Random Forest mencapai akurasi sekitar 84–85% dalam mengklasifikasikan apakah suatu topik akan masuk dalam 15% topik terpopuler.
  • Durasi lagu, energinya, volumenya, dan instrumentasinya menonjol sebagai faktor kunci dalam popularitasnya di Spotify, dalam ekosistem di mana daftar putar editorial dan algoritma rekomendasi sangat penting.

Analisis Hit Spotify

Spotify telah menjadi laboratorium yang sempurna untuk mempelajari apa yang membuat sebuah lagu menjadi hit : kami memiliki data pemutaran secara real-time, metrik canggih untuk artis, dan jutaan pendengar yang membuat keputusan setiap detik. Jauh dari sekadar platform mendengarkan, Spotify telah bertransformasi menjadi basis data besar di mana pola, emosi, genre, dan strategi daftar putar dapat dianalisis untuk memahami mengapa beberapa lagu menjadi populer dan yang lainnya terlupakan.

Dalam beberapa tahun terakhir, berbagai alat, riset akademis, dan model pembelajaran mesin yang didedikasikan untuk analisis hit Spotify telah muncul : mulai dari mempelajari tangga lagu editorial seperti Today's Top Hits atau Rap Caviar, hingga membangun algoritma yang mampu memprediksi apakah sebuah lagu akan termasuk dalam grup terpopuler di katalog. Pada saat yang sama, Spotify for Artists telah mendemokratisasi akses ke metrik ini, memungkinkan setiap artis untuk melihat siapa yang mendengarkan mereka, di mana dan bagaimana mereka ditemukan, dan menyesuaikan strategi kreatif dan pemasaran mereka sesuai dengan hal tersebut.

Apa sebenarnya analisis hit Spotify dan mengapa hal itu penting?

Ketika kita berbicara tentang analisis hit Spotify, kita tidak hanya merujuk pada berapa kali sebuah lagu diputar. Ini adalah pendekatan yang lebih luas yang menggabungkan audio, konteks, dan perilaku pengguna untuk menjawab pertanyaan yang tidak nyaman namun penting: dapatkah Anda memprediksi kesuksesan sebuah lagu sebelum dirilis? Menggunakan data dari API Spotify, para peneliti bekerja dengan variabel seperti popularitas, energi, valensi, durasi, tempo, dan kemampuan untuk membuat orang berdansa untuk mencoba mendekati jawaban tersebut.

Pendekatan ini berakar pada apa yang disebut "ilmu lagu hit ," sebuah gagasan yang dipopulerkan oleh Mike McCready pada awal tahun 2000-an: menggunakan algoritma dan model matematika untuk memprediksi lagu mana yang akan berkinerja baik di tangga lagu dan radio. Meskipun studi awal menyimpulkan bahwa hal itu sangat sulit (dan modelnya tidak cukup akurat), lanskapnya telah berubah sepenuhnya dengan munculnya streaming, peningkatan volume data yang masif, dan penyempurnaan teknik pembelajaran mesin.

Saat ini, Spotify menawarkan API dengan akses ke puluhan ribu lagu beserta atribut musik dan kontekstualnya : mulai dari kunci dan modus hingga kemungkinan sebuah lagu berupa akustik atau instrumental, termasuk metrik yang dirancang khusus untuk menggambarkan bagaimana lagu tersebut dipersepsikan (energi, valensi, kemampuan untuk menari, dll.). Semua ini memungkinkan pergeseran dari opini subjektif ke analisis kuantitatif yang jauh lebih tepat.

Sementara itu, fitur Spotify for Artists membantu para kreator menghindari terjebak dalam metrik yang dangkal dan fokus pada hal yang benar-benar penting: pengembangan audiens jangka panjang, keterlibatan, retensi, dan bagaimana upaya pemasaran memengaruhi terciptanya penggemar sejati. Dengan kata lain, angka memang penting, tetapi dengan konteks dan tujuan strategis.

Daftar putar resmi dan strategi: bobot daftar editorial

Salah satu elemen terpenting dalam analisis serius tentang lagu-lagu hits di Spotify adalah peran daftar putar editorial resmi . Daftar putar seperti Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint, atau ¡Viva Latino! bertindak sebagai penguat yang sangat besar: masuk ke salah satu daftar putar tersebut dapat sepenuhnya mengubah arah sebuah lagu atau bahkan karier seorang artis.

Alat pihak ketiga seperti Soundcharts memungkinkan Anda untuk melihat bagaimana performa seorang artis di playlist ini : jumlah penampilan, lamanya berada di playlist, pasar tempat mereka paling berpengaruh, dan lain sebagainya. Analisis semacam ini memperjelas bahwa kehadiran di tangga lagu editorial bukan hanya sekadar pajangan, tetapi merupakan komponen kunci dari strategi pertumbuhan di platform tersebut.

Ada beberapa kriteria berulang dalam membangun daftar putar berkualitas. Misalnya, keberagaman artis lebih dihargai daripada mengulang nama yang sama berulang kali . Daftar putar di mana artis yang sama muncul terlalu sering cenderung menerima peringkat lebih rendah karena mengurangi rasa penemuan bagi pendengar.

Keseimbangan genre yang koheren juga diupayakan . Ketika sebuah playlist mencampur terlalu banyak gaya tanpa arah yang jelas, pengalaman menjadi terfragmentasi dan peringkatnya menurun. Playlist dengan performa terbaik cenderung fokus pada satu atau beberapa genre yang terdefinisi dengan baik, membantu pengguna memahami sekilas apa yang diharapkan saat mereka menekan tombol putar.

Aspek penting lainnya adalah perpaduan antara lagu-lagu terkenal dan lagu-lagu baru . Daftar putar yang hanya berisi lagu-lagu hits besar memang bagus, tetapi kurang menawarkan peluang untuk menemukan lagu-lagu baru. Sebaliknya, daftar putar yang menggabungkan lagu-lagu yang sudah mapan dengan lagu-lagu yang kurang dikenal cenderung menghasilkan keterlibatan yang lebih besar dan membantu menciptakan lagu-lagu hits baru.

Terakhir, ada konsensus umum bahwa daftar putar yang baik setidaknya harus memiliki 50 lagu untuk menawarkan pengalaman yang lengkap . Daftar putar dengan kurang dari 10 lagu sering dianggap buruk dan menerima skor lebih rendah, yang juga memengaruhi kinerja lagu-lagu yang ada di dalamnya.

Sejarah singkat Spotify dan asal mula analitiknya

Sebelum Spotify dapat melakukan analisis hit tingkat lanjut, platform itu sendiri harus menemukan tempatnya di industri musik. Ide tersebut, yang dicetuskan oleh salah satu pendiri, Daniel Ek, muncul setelah runtuhnya Napster pada tahun 2002: ia ingin menciptakan layanan yang "lebih baik daripada pembajakan, tetapi juga memberikan keuntungan bagi industri ." Pada saat itu, Ek menjalankan uTorrent, salah satu klien unduhan dan berbagi P2P terkemuka, sehingga ia memiliki pengetahuan langsung tentang dunia distribusi ilegal.

  Contoh Algoritma Kuantitatif: Aplikasi Praktis dan Studi Kasus

Setelah menjual uTorrent ke BitTorrent pada akhir tahun 2006, Ek sepenuhnya fokus membangun Spotify. Aplikasi ini resmi diluncurkan pada tahun 2008 di Swedia, setelah mencapai kesepakatan lisensi dan ekuitas dengan label rekaman besar : Sony Music Entertainment, Universal Music Group, dan Warner Music Group. Setahun kemudian, aplikasi ini berekspansi ke Inggris, dan pada tahun 2011, diluncurkan di AS.

Pada periode awal tersebut, basis pelanggan berbayar tumbuh dari sekitar 1 juta di Eropa menjadi hampir 4 juta secara global pada tahun 2012. Pada tahun 2016, Spotify telah mengumumkan 40 juta pengguna berbayar dan sekitar 100 juta pengguna total, yang mengukuhkan streaming sebagai bentuk konsumsi musik yang dominan di seluruh dunia.

Pada saat yang sama, alat data untuk artis mulai bermunculan. Pertama muncul Fan Insights , yang menawarkan akses terbatas kepada beberapa tim terhadap data streaming: demografi, geografi, dan tren dasar. Pada tahun 2017, solusi ini berkembang menjadi Spotify for Artists, membuka pintu bagi semua artis untuk melihat metrik utama mereka dan menggunakan data tersebut untuk membuat keputusan tentang tur, perilisan, dan promosi.

Pada tahun 2018, perusahaan ini melakukan penawaran umum perdana (IPO) dengan kapitalisasi pasar hampir $30.000 miliar . Sejak saat itu, jumlah pasar tempat perusahaan beroperasi terus bertambah, seiring dengan meningkatnya pentingnya analitik dalam platform tersebut. Apa yang dimulai sebagai pemutar media berlisensi telah menjadi infrastruktur global di mana data menjadi sangat penting.

Metrik Spotify: cara mengukur sebuah lagu di luar jumlah streaming.

Untuk membangun model prediksi lagu hits, pertama-tama perlu dipahami jenis data apa yang ditawarkan oleh API Spotify . Dalam sebuah studi yang berfokus pada pasar India, misalnya, lebih dari 46.000 rekaman lagu diekstrak dari daftar putar yang dihasilkan Spotify, yang mencakup berbagai genre dan subgenre.

Informasi tersebut diorganisir ke dalam beberapa blok. Pada tingkat trek, kita menemukan data seperti pengidentifikasi, judul, artis, popularitas, tanggal rilis, dan durasi dalam milidetik . Pada tingkat album, ID dan nama disimpan. Pada tingkat daftar putar, nama, ID, genre, dan subgenre terkait muncul.

Namun, aspek yang paling menarik untuk analisis lagu hit adalah fitur audio , yang dibagi menjadi berbagai kategori: karakteristik suasana hati (kemampuan untuk menari, energi, valensi, tempo), sifat fisik (kekerasan suara, kejelasan suara, kualitas instrumen), konteks (akustik, kejelasan suara langsung), dan segmen musik (nada dasar, modus). Setiap variabel ini didefinisikan dan dinormalisasi dengan cermat.

Misalnya, "kemudahan menari" dinyatakan sebagai nilai antara 0 dan 1 yang merangkum seberapa mudahnya menari mengikuti sebuah lagu , berdasarkan elemen-elemen seperti ritme, stabilitas tempo, dan kekuatan ketukan. Energi juga bervariasi antara 0 dan 1 dan mencoba untuk menangkap apakah lagu tersebut terdengar intens, cepat, dan bertenaga, dibandingkan dengan sesuatu yang lebih tenang atau lembut.

Valensi menggambarkan "positivitas" emosional yang dirasakan dari audio: nilai rendah sesuai dengan perasaan sedih, tegang, atau muram, sedangkan nilai tinggi sesuai dengan musik yang ceria, terang, atau euforia. Akustik mengukur kemungkinan sebuah trek bersifat akustik, liveness mengukur kehadiran penonton langsung dalam rekaman, dan speechiness mencerminkan proporsi kata-kata yang diucapkan dalam campuran (sangat tinggi, misalnya, dalam podcast atau trek kata-kata yang diucapkan).

Parameter penting lainnya meliputi tempo dalam BPM , durasi total, kunci (dikodekan sebagai bilangan bulat), modus (mayor atau minor), dan popularitas lagu. Popularitas adalah metrik internal Spotify yang berkisar dari 0 hingga 100 dan bergantung pada volume pemutaran dan kekinian pemutaran . Lagu yang sangat populer beberapa tahun lalu tetapi sekarang jarang diputar akan mengalami penurunan skor seiring waktu.

Bagaimana cara mempersiapkan dan membersihkan dataset agar dapat memprediksi hit?

Salah satu langkah yang sering diabaikan ketika membahas analisis hit Spotify adalah persiapan dataset . Dalam studi ini, data dikumpulkan menggunakan R dan RStudio, dengan memanggil API Spotify untuk berbagai kombinasi pasar (India), genre, dan subgenre yang dipilih sesuai dengan bobot global dan lokalnya.

Saat menggabungkan lagu-lagu dari berbagai daftar putar bertema, seringkali banyak lagu yang diulang, karena lagu yang sama dapat muncul di daftar yang berbeda. Karena tujuannya bukan untuk menganalisis strategi pembuatan daftar putar itu sendiri, melainkan karakteristik lagu-lagu tersebut, lagu-lagu duplikat dihapus , sehingga mengurangi jumlah total lagu dari 46.417 menjadi sekitar 39.147 lagu unik.

Kolom yang tidak akan digunakan sebagai variabel penjelas dalam model, seperti artis, ID dan nama album, serta kolom khusus daftar putar, telah dihapus. Pada saat yang sama, nama kolom dinormalisasi dan tipe data disesuaikan: misalnya, popularitas, modus, kunci, dan durasi dikonversi ke nilai float untuk mempermudah analisis statistik.

Salah satu keputusan penting adalah mengubah popularitas menjadi variabel yang lebih mudah dikelola. Alih-alih menggunakan nilai kontinu dari 0 hingga 100, ambang batas ditetapkan untuk memisahkan lagu populer dan tidak populer . Dengan mengambil persentil ke-85 dari distribusi (sekitar popularitas 65), lagu-lagu di atas nilai tersebut dianggap "populer" dan sisanya "tidak populer".

Dengan cara ini, dataset dibagi menjadi hampir 6.000 lagu populer dan sekitar 33.000 lagu yang kurang populer . Untuk analisis eksplorasi, dataset bahkan dibagi lagi menjadi lima kelas popularitas (sangat tinggi, tinggi, sedang, rendah, dan sangat rendah), dengan interval 20 poin, yang memungkinkan perbandingan tren halus antar tingkat keberhasilan.

Selain itu, variabel baru dihasilkan dari judul lagu: indikator sentimen . Dengan menggunakan pustaka TextBlob di Python, polaritas untuk setiap judul (angka antara -1 dan 1) dihitung dan diklasifikasikan sebagai positif, negatif, atau netral. Nilai numerik ini ditambahkan ke dataframe untuk mempelajari apakah nada judul tersebut terkait dengan popularitasnya.

  Apa itu Tes Turing? 5 Kunci untuk Memahami Tes AI Ini

Eksplorasi data: apa yang membedakan lagu-lagu paling populer?

Sebelum melatih model pembelajaran mesin apa pun, sangat penting untuk meluangkan waktu untuk eksplorasi visual dan statistik data . Dalam studi ini, kurva distribusi, rata-rata per kelompok popularitas, dan hubungan antara emosi dan kesuksesan dianalisis.

Salah satu temuan yang mencolok berkaitan dengan valensi lagu-lagu paling sukses. Ketika melihat lagu-lagu dengan skor popularitas di atas 90, diamati bahwa lebih banyak lagu yang memiliki nilai valensi di bawah 0,5 ; artinya, lagu-lagu tersebut terdengar lebih sedih, muram, atau melankolis daripada ceria. Ini bukan dominasi mutlak, tetapi merupakan tren yang jelas.

Ketika distribusi popularitas berdasarkan genre diplot, sebagian besar kurva menyerupai bentuk lonceng , dengan banyak lagu di sekitar nilai rata-rata dan lebih sedikit di nilai ekstrem. Namun, genre seperti rock, R&B, EDM, musik dunia, dan musik India menunjukkan beberapa asimetri karena banyaknya lagu dengan popularitas nol. Sebaliknya, gaya seperti pop, rap, Latin, dan desi tampak lebih seimbang dan dengan konsentrasi yang lebih rendah pada nilai nol.

Hal ini menunjukkan bahwa dalam genre-genre yang lebih umum, biasanya lebih mudah untuk mencapai tingkat popularitas tertentu , meskipun lagu-lagu tersebut tidak memiliki semua karakteristik ideal, sementara dalam gaya musik lainnya, distribusi kesuksesan lebih terpolarisasi.

Saat membandingkan rata-rata berbagai fitur berdasarkan kelas popularitas, muncul pola yang sangat jelas: lagu-lagu yang paling sukses cenderung memiliki energi dan kekerasan suara (volume yang dirasakan) yang lebih besar , serta lebih banyak instrumen dan lebih sedikit kata-kata yang diucapkan. Sederhananya, lagu-lagu yang berkinerja terbaik di platform streaming biasanya lebih bertenaga dan lebih fokus pada musik daripada kata-kata yang diucapkan.

Selain itu, diamati juga bahwa lagu-lagu populer menunjukkan akustik dan kesan hidup yang lebih rendah ; artinya, lagu-lagu tersebut terdengar kurang "akustik" dan kurang "hidup". Lagu-lagu tersebut lebih banyak diproduksi di studio, lebih dipoles, dengan lebih sedikit kebisingan latar atau nuansa seperti konser.

Temuan penting lainnya adalah lagu-lagu populer cenderung lebih pendek daripada lagu-lagu yang kurang populer . Dalam konteks di mana pendapatan bergantung pada jumlah pemutaran dan algoritma memberi penghargaan pada pengulangan, masuk akal bahwa lagu-lagu yang lebih pendek dapat mengumpulkan pemutaran lebih cepat dan menjadi lebih mudah dimasukkan ke dalam daftar putar.

Mengenai persepsi kebahagiaan (valensi), trennya cukup menarik: tingkatnya meningkat dari kelas popularitas yang lebih rendah ke kelas "atas", tetapi dalam kategori yang paling ekstrem, yaitu "sangat tinggi," terjadi penurunan yang signifikan. Dengan kata lain, lagu-lagu yang sangat populer cenderung terdengar lebih sedih daripada lagu-lagu yang sekadar "sukses" , yang membuka pintu bagi banyak interpretasi tentang selera publik dan konteks sosial-emosional.

Analisis statistik: dampak genre dan atribut audio

Setelah data dieksplorasi, langkah selanjutnya adalah menerapkan uji statistik formal untuk melihat variabel mana yang dapat dianggap relevan dalam menjelaskan popularitas. Untuk mempelajari apakah gender memengaruhi kesuksesan, analisis varians (ANOVA) digunakan dengan sembilan genre utama.

Hasil ANOVA menunjukkan nilai F yang sangat tinggi dan hampir tidak signifikan, artinya terdapat perbedaan popularitas yang signifikan secara statistik antara jenis kelamin . Namun, itu saja tidak cukup: penting juga untuk mengetahui pasangan jenis kelamin mana yang menunjukkan perbedaan tersebut dan apakah variabel tersebut akan berguna untuk model prediktif.

Mengingat variansnya tidak homogen dan jumlah lagu per genre bervariasi, uji post hoc Games-Howell digunakan . Analisis ini memungkinkan kami untuk menentukan kombinasi genre mana yang tidak menunjukkan perbedaan popularitas yang signifikan, yang secara keseluruhan membuat penggunaan genre sebagai prediktor kuat dalam model pembelajaran mesin menjadi kurang disarankan.

Secara paralel, uji t independen dilakukan untuk setiap fitur audio, membandingkan rata-rata antara kelompok lagu populer dan tidak populer. Pada tingkat signifikansi 95%, hampir semua variabel (kemampuan untuk menari, energi, kekerasan suara, akustik, keaktifan, durasi, tempo, valensi, dan instrumentasi) menunjukkan perbedaan yang signifikan antara kedua kelompok.

Satu-satunya pengecualian yang tampak adalah kefasihan bicara . Pada pengujian pertama, perbedaan rata-rata tidak signifikan, tetapi analisis lebih lanjut mengungkapkan bahwa rentang kefasihan bicara untuk topik yang sangat populer (dengan nilai antara 0,024 dan 0,685) berada dalam rentang yang lebih luas dari kelas yang kurang populer (antara 0 dan 0,964). Tumpang tindih ini tidak menghalangi kefasihan bicara, bila digunakan secara efektif, untuk memberikan informasi pada model, sehingga diputuskan untuk mempertahankannya sebagai prediktor.

Singkatnya, blok fitur audio menunjukkan kekuatan deskriptif yang jelas terkait popularitas , sementara genre ditangani dengan lebih hati-hati dan diabaikan sebagai variabel utama dalam beberapa pendekatan prediksi.

Membangun model pembelajaran mesin untuk memprediksi keberhasilan.

Setelah dataset dibersihkan dan variabel yang relevan dipilih, tibalah saatnya untuk membuat model klasifikasi biner yang mampu memprediksi apakah sebuah lagu termasuk dalam 15% lagu terpopuler. Untuk melakukan ini, variabel kategorikal key dan mode pertama-tama diubah menjadi variabel dummy menggunakan fungsi get_dummies dari Pandas.

Setelah memasukkan variabel dummy ini, kolom tonalitas dan modus asli, serta popularitas kontinu, dihapus, dan kolom popularitas biner (populer vs. tidak populer) dipertahankan sebagai variabel target. Sebelum melatih model, semua fitur numerik distandarisasi menggunakan StandardScaler, karena fitur-fitur tersebut beroperasi pada skala yang sangat berbeda dan penting agar memiliki bobot yang sebanding.

Dataset dibagi menjadi data pelatihan dan pengujian menggunakan fungsi train_test_split, dengan mengalokasikan 20% data untuk pengujian . Hal ini mencegah kebocoran data dan memastikan bahwa metrik kinerja mencerminkan kemampuan generalisasi model yang sebenarnya, bukan hanya kemampuannya untuk menghafal data pelatihan.

  Jenjang karier untuk menjadi seorang Data Engineer

Model pertama yang diterapkan adalah Regresi Logistik , sebuah teknik yang banyak digunakan dalam klasifikasi biner. Versi iteratif dengan laju pembelajaran 0,01 dan 200 iterasi diimplementasikan dan dievaluasi menggunakan validasi silang. Akurasi rata-rata mencapai sekitar 84,7%, hasil yang sangat kuat untuk masalah yang kompleks seperti memprediksi kesuksesan musik.

Selanjutnya, algoritma K-Nearest Neighbors (KNN) diuji , yang mengklasifikasikan setiap lagu berdasarkan k tetangga terdekatnya di ruang fitur. Dengan menyesuaikan nilai ky menggunakan Grid Search untuk menemukan konfigurasi optimal, akurasi yang sangat mirip diperoleh, sekitar 84,8%, dengan sedikit peningkatan pada skor validasi silang dibandingkan dengan regresi logistik.

Model selanjutnya adalah Support Vector Machine (SVM) , teknik supervised learning lain yang mampu menangani hubungan linier dan nonlinier. Sekali lagi, melalui penyetelan hyperparameter, akurasi sekitar 84,6% tercapai, dengan nilai yang setara dalam validasi silang, menunjukkan kinerja yang stabil.

Pengklasifikasi Naive Bayes , yang didasarkan pada asumsi independensi antar fitur, juga dievaluasi . Meskipun merupakan model yang jauh lebih sederhana dalam hal asumsi, hasil akurasinya (sekitar 84,6%) setara dengan SVM dan sangat dekat dengan regresi logistik dan KNN, memperkuat gagasan bahwa struktur masalah sangat cocok untuk pendekatan probabilistik jenis ini.

Terakhir, model berbasis pohon keputusan diuji. Pengklasifikasi Pohon Keputusan mencapai akurasi yang jauh lebih rendah, sekitar 75,4%, dan validasi silang mengkonfirmasi penurunan kinerja ini, kemungkinan karena masalah overfitting. Pengklasifikasi Hutan Acak , yang menggabungkan banyak pohon untuk mengurangi efek ini, meningkat secara signifikan, mencapai akurasi sekitar 84,1% dan lebih dari 84% dalam validasi silang.

Untuk melengkapi analisis, matriks kebingungan dan laporan klasifikasi dihasilkan untuk Random Forest. Model menunjukkan kemampuan yang sangat baik untuk mengidentifikasi lagu-lagu yang tidak populer (kelas mayoritas), dengan akurasi 0,85 dan recall mendekati 0,99, sementara kinerjanya pada kelas lagu populer (kelas minoritas) lebih sederhana, dengan akurasi 0,40 dan recall 0,05. Hal ini menyoroti tantangan klasik ketidakseimbangan kelas dalam jenis masalah ini.

Pentingnya variabel: apa yang paling berpengaruh saat menciptakan sebuah karya yang sukses?

Selain mengetahui model mana yang paling akurat, sangat penting untuk memahami fitur mana yang benar-benar memberikan informasi yang berguna ketika memprediksi apakah sebuah lagu akan populer. Untuk tujuan ini, XGBoost (XGBClassifier) ​​​​digunakan untuk mendapatkan skor kepentingan variabel, berdasarkan kontribusi setiap fitur dalam mengurangi kesalahan pada pohon keputusan.

Hasil penelitian menunjukkan bahwa durasi lagu tersebut jelas menonjol dibandingkan lagu-lagu lainnya , dengan skor F jauh di atas 400. Temuan ini sesuai dengan gagasan bahwa lagu-lagu yang lebih pendek mendorong pendengaran berulang dan karenanya mengumpulkan lebih banyak pemutaran dalam waktu yang lebih singkat, sesuatu yang cenderung dihargai oleh algoritma rekomendasi Spotify.

Di sisi lain, variabel seperti kata kunci, modus, atau sentimen yang diekstrak dari judul itu sendiri menerima skor kepentingan di bawah 50, menunjukkan bahwa kontribusi mereka terhadap daya prediksi keseluruhan model sangat minimal. Ini bukan berarti mereka tidak berpengaruh sama sekali, tetapi lebih tepatnya, dibandingkan dengan fitur lain, bobotnya jauh lebih kecil.

Atribut audio lainnya (seperti energi, kemampuan untuk diiringi tarian, valensi, kekerasan suara, akustik, keaktifan, kualitas suara, dan kualitas instrumen) berada dalam kisaran menengah, dengan skor F antara 200 dan 300, menunjukkan bahwa atribut-atribut tersebut membentuk blok informasi yang cukup seimbang . Tidak ada satu pun yang sepenuhnya mendominasi, tetapi bersama-sama atribut-atribut tersebut membantu membangun gambaran yang cukup akurat tentang peluang keberhasilan sebuah lagu.

Secara keseluruhan, model yang didasarkan pada fitur audio mampu memprediksi dengan akurasi sekitar 84-85% apakah sebuah lagu akan termasuk dalam 15% lagu terpopuler , yang memberikan dukungan empiris terhadap intuisi lama tentang "ilmu lagu hit": dengan data yang baik dan teknik yang tepat, kesuksesan musik bukanlah sepenuhnya acak, meskipun masih ada komponen yang tidak dapat diprediksi secara signifikan.

Gambaran yang dilukiskan oleh analisis ini menunjukkan bahwa menggabungkan data Spotify, statistik tradisional, dan model pembelajaran mesin memungkinkan kita untuk melampaui sekadar menghitung jumlah pemutaran. Memahami dampak durasi, energi, valensi, dan instrumentasi, bersama dengan peran daftar putar editorial dan dinamika rekomendasi platform, memberikan artis, label, dan analis peta jalan yang sangat konkret untuk menafsirkan mengapa lagu-lagu tertentu menjadi hits dan bagaimana mereka dapat memaksimalkan peluang mereka untuk bergabung dengan kelompok terpilih tersebut tanpa sepenuhnya kehilangan elemen manusia dan kreatif yang, untungnya, tetap tidak dapat direduksi menjadi rumus apa pun.

jenis kecerdasan buatan
Artikel terkait:
7 Jenis Kecerdasan Buatan yang Akan Mengubah Masa Depan Kita