Pagsusuri ng mga hit sa Spotify: datos, mga algorithm at ang agham ng tagumpay sa musika

Huling pag-update: Mayo 6 2026
May-akda: TecnoDigital
  • Nag-aalok ang Spotify API ng dose-dosenang mga baryabol ng audio at konteksto (enerhiya, valence, tagal, kakayahang sumayaw, atbp.) na nagbibigay-daan sa iyong imodelo at unawain kung ano ang nagpapasikat sa isang kanta.
  • Ipinapakita ng pagsusuring istatistikal na halos lahat ng katangiang audio ay nagkakaiba sa pagitan ng mga sikat at hindi sikat na kanta, habang ang genre, tonality, o sentimyento ng pamagat ay may mas kaunting predictive weight.
  • Ang mga modelo ng machine learning tulad ng Logistic Regression, KNN, SVM, Naive Bayes, at Random Forest ay nakakamit ng humigit-kumulang 84–85% na katumpakan sa pag-uuri kung ang isang paksa ay mapapasailalim sa nangungunang 15% na pinakasikat.
  • Ang haba ng track, ang enerhiya, lakas ng tunog, at instrumentalidad nito ay namumukod-tangi bilang mga pangunahing salik sa popularidad nito sa Spotify, sa isang ecosystem kung saan mahalaga ang mga editorial playlist at ang algorithm ng rekomendasyon.

Pagsusuri ng Hit sa Spotify

Ang Spotify ay naging perpektong laboratoryo upang pag-aralan kung ano ang nagpapasikat sa isang kantaMayroon kaming real-time playback data, mga advanced na metrics para sa mga artista, at milyun-milyong tagapakinig na gumagawa ng mga desisyon bawat segundo. Malayo sa pagiging isang platform lamang ng pakikinig, ang Spotify ay naging isang napakalaking... database kung saan maaaring suriin ang mga padron, emosyon, genre, at estratehiya sa playlist upang maunawaan kung bakit ang ilang kanta ay sumisikat at ang iba ay nawawala na.

Sa mga nakaraang taon, ang mga kagamitan, akademikong pananaliksik, at mga modelo ng machine learning nakatuon sa Pagsusuri ng mga hit sa SpotifyMula sa pag-aaral ng mga editorial chart tulad ng Today's Top Hits o Rap Caviar, hanggang sa pagbuo ng mga algorithm na kayang hulaan kung ang isang track ay mapabilang sa pinakasikat na grupo sa katalogo. Kasabay nito, ginawang demokratiko ng Spotify for Artists ang mga sukatang ito, na nagbibigay-daan sa sinumang artist na makita kung sino ang nakikinig sa mga ito, saan at paano sila natutuklasan, at iakma ang kanilang creative at marketing strategy nang naaayon.

Ano nga ba ang Spotify hit analysis at bakit ito mahalaga?

Kapag makipag-usap namin tungkol sa Pagsusuri ng mga hit sa Spotify Hindi lang natin pinag-uusapan kung ilang beses na pinatugtog ang isang kanta. Ito ay isang mas malawak na pamamaraan na pinagsasama ang audio, konteksto, at pag-uugali ng gumagamit upang sagutin ang isang hindi komportable ngunit mahalagang tanong: mahuhulaan mo ba ang tagumpay ng isang kanta bago ito ilabas? Gamit ang data mula sa API ng Spotify, ang mga mananaliksik ay nagtatrabaho gamit ang mga baryabol tulad ng popularidad, enerhiya, valence, tagal, tempo, at kakayahang sumayaw upang subukang mapalapit sa sagot na iyon.

Ang pamamaraang ito ay nakaugat sa tinatawag na "agham ng mga hit na kanta"Ang ideyang ito, na pinasikat ni Mike McCready noong mga unang taon ng 2000s, ay kinabibilangan ng paggamit ng mga algorithm at mga modelo ng matematika upang mahulaan kung aling mga kanta ang magiging mahusay na gumanap sa mga tsart at radyo. Bagama't napagpasyahan ng mga unang pag-aaral na ito ay napakahirap (at ang mga modelo ay hindi sapat na tumpak), ang tanawin ay ganap na nagbago sa pagdating ng streaming, ang napakalaking pagtaas ng dami ng data, at ang pagpipino ng mga pamamaraan ng machine learning.

Ngayon, nag-aalok ang Spotify ng API na may access sa libu-libong track gamit ang... mga katangiang musikal at kontekstwalMula sa key at mode, hanggang sa probabilidad ng isang track na acoustic o instrumental, kabilang ang mga sukatang partikular na idinisenyo upang ilarawan kung paano nakikita ang kanta (enerhiya, valence, danceability, atbp.). Ang lahat ng ito ay nagbibigay-daan sa atin na lumipat mula sa mga subhetibong opinyon patungo sa mas tumpak na quantitative analyses.

Kasabay nito, ang kagamitan Spotify para sa Mga Artista Nakakatulong ito sa mga tagalikha na maiwasan ang pagkaligaw sa mga sukatan ng pagiging mapagmataas at tumuon sa kung ano ang tunay na mahalaga: pangmatagalang pag-unlad ng madla, pakikipag-ugnayan, pagpapanatili, at kung paano nakakaapekto ang mga pagsisikap sa marketing sa paglikha ng mga tunay na tagahanga. Sa madaling salita, mga numero, oo, ngunit may konteksto at estratehikong layunin.

Mga opisyal na playlist at estratehiya: ang bigat ng mga listahan ng editoryal

Isa sa mga pinakamahalagang bahagi sa anumang seryosong pagsusuri ng mga hit sa Spotify ay ang papel ng mga opisyal na playlist ng editoryalAng mga tsart tulad ng Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint o ¡Viva Latino! ay nagsisilbing napakalaking amplifier: ang pagtugtog sa isa sa mga ito ay maaaring ganap na magpabago sa takbo ng isang kanta o maging ng isang karera.

Ang mga tool ng ikatlong partido tulad ng Soundcharts ay nagbibigay-daan sa iyong makita kung paano kumikilos ang isang artista sa mga playlist na itoBilang ng mga pagpapakita, tagal ng pananatili, mga merkado kung saan sila may pinakamalaking epekto, atbp. Nililinaw ng ganitong uri ng pagsusuri na ang presensya sa mga listahan ng editoryal ay hindi isang palamuti, kundi isang mahalagang bahagi ng estratehiya sa paglago sa platform.

May ilang paulit-ulit na pamantayan sa pagbuo ng mga de-kalidad na playlist. Halimbawa, pinahahalagahan na mayroong iba't ibang artista sa halip na paulit-ulit na banggitin ang parehong mga pangalanAng mga listahan kung saan masyadong maraming beses na lumalabas ang iisang artista ay may posibilidad na makakuha ng mas mababang rating, dahil binabawasan nito ang pakiramdam ng tagapakinig na natuklasan ito.

Naghahanap din ng magkakaugnay na balanse ng kasarianKapag ang isang playlist ay naghahalo ng napakaraming estilo nang walang malinaw na direksyon, ang karanasan Ito ay nagiging pira-piraso at bumababa ang rating. Ang mga listahang may pinakamahusay na pananaw ay may posibilidad na nakatuon sa isa o ilang mahusay na natukoy na mga genre, na tumutulong sa gumagamit na maunawaan sa isang sulyap kung ano ang aasahan kapag pinindot nila ang play.

Ang isa pang pangunahing aspeto ay ang isang halo ng mga kilalang at umuusbong na temaAyos lang ang mga playlist na puro hit lang ang laman, pero kaunti lang ang maitutulong ng mga ito para matuklasan ang mga ito. Sa kabaligtaran, ang mga playlist na pinagsasama ang mga kilalang kanta at ang mga hindi gaanong kilalang kanta ay may posibilidad na makalikha ng mas malaking interes at makatulong sa paglikha ng mga bagong hit.

Panghuli, may ilang pinagkasunduan na ang isang mahusay na playlist ay dapat magkaroon ng kahit man lang humigit-kumulang 50 track para mag-alok ng kumpletong karanasanAng mga tsart na may mas mababa sa 10 kanta ay kadalasang itinuturing na mababa at nakakatanggap ng mas mababang iskor, na nakakaapekto rin sa pagganap ng mga track na kasama ng mga ito.

Isang maikling kasaysayan ng Spotify at ang pinagmulan ng analytics nito

Bago makapagsagawa ang Spotify ng advanced hit analysis, kinailangan munang hanapin ng platform mismo ang lugar nito sa industriya ng musika. Ang ideya, na naisip ng co-founder na si Daniel Ek, ay lumitaw matapos bumagsak ang Napster noong 2002. Gusto niyang lumikha ng isang serbisyo na "mas mahusay kaysa sa pamimirata, ngunit nagbabayad din sa industriya."Noong panahong iyon, ginagamit ni Ek ang uTorrent, isa sa mga pangunahing P2P download at sharing client, kaya may personal siyang kaalaman sa mundo ng hindi awtorisadong pamamahagi.

  Landas sa Karera tungo sa Pagiging Isang Data Engineer

Matapos ibenta ang uTorrent sa BitTorrent noong huling bahagi ng 2006, ang Ek ay ganap na nakatuon sa pagbuo ng Spotify. Ang aplikasyon ay opisyal na inilunsad noong 2008 sa Sweden, matapos maabot mga kasunduan sa paglilisensya at pakikilahok sa equity kasama ang mga pangunahing korporasyon ng musikaSony Music Entertainment, Universal Music Group, at Warner Music Group. Pagkalipas ng isang taon, lumawak ito sa United Kingdom at, noong 2011, napunta sa Estados Unidos.

Sa unang panahong iyon, ang base ng mga bayad na subscriber ay lumago mula sa humigit-kumulang 1 milyon sa Europa patungo sa humigit-kumulang 4 milyon sa buong mundo noong 2012Pagsapit ng 2016, inanunsyo na ng Spotify ang pagkakaroon ng 40 milyong nagbabayad na gumagamit at humigit-kumulang 100 milyong kabuuang gumagamit, na siyang dahilan kung bakit ang streaming ang pangunahing uri ng pagkonsumo ng musika sa buong mundo.

Kasabay nito, nagsimulang lumitaw ang mga kagamitan sa datos para sa mga artista. Una ay Mga Pananaw ng TagahangaAng solusyong ito ay nag-alok sa ilang mga koponan ng limitadong access sa streaming data: demograpiko, heograpiya, at mga pangunahing trend. Noong 2017, ang solusyong ito ay umunlad at naging Spotify para sa mga Artista, na nagbukas ng pinto para sa lahat ng mga artista upang makita ang kanilang mga pangunahing sukatan at gamitin ang data upang gumawa ng mga desisyon tungkol sa paglilibot, paglabas, at promosyon.

Noong 2018, ang kumpanya ay naging publiko na may market capitalization na humigit-kumulang 30.000 milyongSimula noon, patuloy na lumalaki ang bilang ng mga merkado kung saan ito nagpapatakbo, at kasabay nito, ang kahalagahan ng analytics sa loob ng platform. Ang nagsimula bilang isang lisensyadong media player ay naging isang pandaigdigang imprastraktura kung saan ang data ang nangingibabaw.

Mga sukatan ng Spotify: kung paano sukatin ang isang kanta na lampas sa mga stream

Upang makabuo ng mga modelo ng prediksyon ng hit, kinakailangan munang maunawaan kung anong uri datos na ibinigay ng Spotify APIHalimbawa, sa isang pag-aaral na nakatuon sa merkado ng India, mahigit 46.000 rekord ng kanta ang kinuha mula sa mga playlist na binuo ng Spotify, na sumasaklaw sa iba't ibang genre at subgenre.

Ang impormasyon ay nakaayos sa ilang seksyon. Sa antas ng track, makakahanap tayo ng datos tulad ng pagkakakilanlan, pamagat, artista, kasikatan, petsa ng paglabas, at tagal sa millisecondsSa antas ng album, nakaimbak ang ID at pangalan. Sa antas ng playlist, lumalabas ang pangalan, ID, genre, at kaugnay na subgenre.

Ngunit ang pinakainteresante para sa pagsusuri ng hit ay ang mga tampok ng audionahahati sa iba't ibang kategorya: mga katangian ng "mood" (kakayahang sumayaw, enerhiya, valence, tempo), mga pisikal na katangian (lakas, pagsasalita, instrumentalidad), konteksto (acousticness, liveness), at mga segment ng musika (key, mode). Ang bawat isa sa mga baryabol na ito ay maingat na binibigyang kahulugan at niraranggo.

Ang kakayahang sumayaw, halimbawa, ay ipinapahayag bilang isang halaga sa pagitan ng 0 at 1 na nagbubuod gaano kadali sumayaw sa isang kantaBatay sa mga elemento tulad ng ritmo, katatagan ng tempo, at lakas ng kumpas, ang enerhiya ay mula 0 hanggang 1, na sinusubukang makuha kung ang tunog ng track ay matindi, mabilis, at malakas, kumpara sa isang bagay na mas kalmado o mas mahina.

Inilalarawan ni Valencia ang pinaghihinalaang emosyonal na "positibidad" Sa audio, ang mababang halaga ay katumbas ng malungkot, tensyonado, o mapanglaw na damdamin, habang ang mataas na halaga ay akma sa masaya, masigla, o masayang musika. Sinusukat ng acousticness ang posibilidad na maging acoustic ang isang track, ang liveness ay ang presensya ng isang live na audience sa recording, at ang speechness ay sumasalamin sa proporsyon ng mga sinasalitang salita sa mix (napakataas, halimbawa, sa mga podcast o spoken-word track).

Ang iba pang mahahalagang parametro ay ang tempo sa BPMang kabuuang tagal, ang key (naka-encode bilang integer), ang mode (major o minor), at ang popularidad ng track. Ang huli ay isang panloob na sukatan ng Spotify na mula 0 hanggang 100. Depende ito sa dami ng mga stream at kung gaano ito kabago.Isang kantang sumikat ilang taon na ang nakalilipas, ngunit bihirang patugtugin ngayon, ay bababa pa rin ang rating sa paglipas ng panahon.

Paano ihanda at linisin ang dataset upang mahulaan ang mga hit

Isang hakbang na madalas na nakakaligtaan kapag tinatalakay ang pagsusuri ng hit sa Spotify ay ang paghahanda ng set ng datosSa pag-aaral na ito, ang datos ay nakalap gamit ang R at RStudio, na tinatawag ang Spotify API para sa iba't ibang kombinasyon ng merkado (India), mga genre, at mga subgenre na napili ayon sa kanilang pandaigdigan at lokal na timbang.

Kapag pinagsasama-sama ang mga kanta mula sa iba't ibang playlist na may temang pang-awit, karaniwan na maraming track ang inuulit, dahil ang parehong kanta ay maaaring lumitaw sa iba't ibang listahan. Dahil ang layunin ay hindi ang pag-aralan ang mismong estratehiya sa pag-playlist, kundi ang mga katangian ng mga kanta, ito ay Tinanggal nila ang mga duplicate na trackbinabawasan ang kabuuang base mula 46.417 patungo sa humigit-kumulang 39.147 natatanging kanta.

Ang mga kolum na hindi gagamitin bilang mga paliwanag na baryabol sa mga modelo, tulad ng artist, album ID at pangalan, at mga field na partikular sa playlist, ay inalis. Kasabay nito, Isinaayos nila ang mga pangalan ng larangan at ang mga uri ng datos ay inayos: halimbawa, ang popularidad, mode, key at tagal ay binago sa mga float-type na numeric value upang mapadali ang pagproseso sa istatistika.

Isang mahalagang desisyon ang gawing mas madaling pamahalaan ang popularidad. Sa halip na gumamit ng tuloy-tuloy na halaga mula 0 hanggang 100, isang hangganan para sa paghihiwalay ng mga sikat at hindi sikat na kantaKung kukunin ang ika-85 percentile ng distribusyon (humigit-kumulang 65 ang popularidad), ang mga track na higit sa halagang iyon ay itinuring na "popular" at ang natitira ay "hindi popular".

Sa ganitong paraan, ang dataset ay hinati sa halos 6.000 sikat na kanta at humigit-kumulang 33.000 hindi sikat na kantaPara sa eksploratory analysis, ang datos ay hinati pa sa limang klase ng popularidad (napakataas, mataas, katamtaman, mababa, at napakababa), na may mga pagitan na 20 puntos, na nagbigay-daan sa paghahambing ng mga pinong trend sa pagitan ng mga antas ng tagumpay.

Bukod pa rito, isang bagong baryabol ang nabuo mula sa mga pamagat ng kanta: a tagapagpahiwatig ng damdaminGamit ang TextBlob library sa Python, ang polarity ng bawat pamagat (isang numero sa pagitan ng -1 at 1) ay kinalkula at inuri bilang positibo, negatibo, o neutral. Ang numerical value na ito ay idinagdag sa dataframe upang pag-aralan kung ang tono ng pamagat ay nauugnay sa kasikatan nito.

  Ang modelo ng GPT-5 sa siyentipikong pananaliksik: mga gamit, pagsulong, at limitasyon

Paggalugad ng datos: ano ang nagpapaiba sa mga pinakasikat na kanta

Bago sanayin ang anumang modelo ng machine learning, mahalagang maglaan ng oras para sa biswal at istatistikal na paggalugad ng datosSa kaso ng pag-aaral na ito, sinuri ang mga kurba ng distribusyon, mga average bawat grupo ng popularidad, at ang mga ugnayan sa pagitan ng mga emosyon at tagumpay.

Isa sa mga kapansin-pansing natuklasan ay ang popularidad ng mga pinakamatagumpay na kanta. Nang tingnan ang mga track na may rating ng popularidad na higit sa 90, naobserbahan na Mas marami sa kanila ang mas mababa sa halagang 0,5 sa ValenciaSa madaling salita, mas malungkot, mas malungkot, o mapanglaw ang kanilang tunog kaysa masaya. Hindi ito isang ganap na pangingibabaw, ngunit ito ay isang malinaw na tendensiya.

Nang i-plot ang distribusyon ng popularidad ayon sa kasarian, karamihan sa mga kurba ay gumamit ng tinatayang hugis ng kampanilyana may maraming track na nasa average at mas kaunti sa mga sukdulan. Gayunpaman, ang mga genre tulad ng rock, R&B, EDM, world, at Indian music ay nagpakita ng ilang asymmetry dahil sa maraming track na walang popularidad. Sa kabaligtaran, ang mga istilo tulad ng pop, rap, Latin, at desi ay tila mas balanse at may mas kaunting konsentrasyon ng mga track na walang rating.

Ipinahihiwatig nito na sa mga mas mainstream na genre, sa pangkalahatan, mas madaling maabot ang isang tiyak na antas ng katanyagankahit na ang mga kanta ay hindi nagtataglay ng lahat ng ideal na katangian, habang sa ibang mga istilo ang distribusyon ng tagumpay ay mas polarisado.

Nang ikumpara ang mga average ng iba't ibang tampok ayon sa uri ng kasikatan, lumitaw ang isang napakalinaw na padron: ang mga pinakamatagumpay na paksa ay may posibilidad na magkaroon ng mas malaking enerhiya at mas malakas na tunog (napapansing lakas ng tunog)pati na rin ang mas maraming instrumentalismo at mas kaunting pagsasalita. Sa madaling salita, ang mga kantang pinakamahusay na tumutugtog sa streaming ay may posibilidad na maging mas malakas at mas nakatuon sa musika kaysa sa mga salitang binibigkas.

Napansin din na tampok ng mga sikat na kanta ang mas mababang acousticness at mas mababang livenessSa madaling salita, ang tunog ng mga ito ay hindi gaanong "acoustic" at hindi gaanong "live." Mas studio-produced ang mga ito, mas pulido, na may mas kaunting ingay sa paligid o parang konsiyerto.

Isa pang mahalagang natuklasan ay ang mga sikat na kanta ay may posibilidad na mas maikli kaysa sa mga hindi sikatSa konteksto kung saan ang kita ay nakasalalay sa bilang ng mga stream at ang mga algorithm ay nagbibigay ng gantimpala sa pag-uulit, makatuwiran na ang mas maiikling track ay maaaring mas mabilis na makaipon ng mga pag-play at maging mas "friendly" para sa mga playlist.

Tungkol sa pinaghihinalaang kaligayahan (valence), kakaiba ang kalakaran: tumataas ang mga antas mula sa mas mababang uri ng popularidad patungo sa "mataas" na uri, ngunit sa pinakamatinding kategorya, ang "napakataas," mayroong malaking pagbaba. Sa madaling salita, Ang mga sobrang sikat na kanta ay may posibilidad na mas malungkot ang tunog kaysa sa mga "matagumpay" lamang.Nagbubukas ito ng pinto sa maraming interpretasyon tungkol sa panlasa ng publiko at sa kontekstong sosyo-emosyonal.

Pagsusuring pang-estadistika: epekto ng mga genre at katangian ng audio

Kapag nasuri na ang mga datos, ang susunod na hakbang ay ang paglalapat ng mga pormal na pagsusulit na pang-estadistika upang makita kung aling mga baryabol ang maituturing na may kaugnayan sa pagpapaliwanag ng popularidad. Upang pag-aralan kung ang kasarian ay nakaimpluwensya sa tagumpay, isang pagsusuri ng variance (ANOVA) ang ginamit sa siyam na pangunahing genre.

Ang resulta ng ANOVA ay nagbunga ng napakataas na F-value at halos zero na kahalagahan, na nangangahulugang May mga makabuluhang pagkakaiba sa popularidad sa pagitan ng mga genre ayon sa istatistikaGayunpaman, hindi pa iyon sapat: mahalaga ring malaman kung sa aling mga pares ng kasarian nagaganap ang mga pagkakaibang ito at kung ang baryabol ay magiging kapaki-pakinabang para sa isang predictive model.

Dahil hindi homogenous ang mga variance at iba-iba ang bilang ng mga kanta sa bawat genre, ginamit ang mga sumusunod: Pagsusulit na post-hoc ng Games-HowellDahil sa pagsusuring ito, naging posible na mapatunayan kung aling mga kumbinasyon ng kasarian ang hindi nagpakita ng mga makabuluhang pagkakaiba sa popularidad, na, sa pangkalahatan, ay naging dahilan upang hindi gaanong maipapayo na gamitin ang kasarian bilang isang malakas na tagahula sa mga modelo ng machine learning.

Kasabay nito, isinagawa ang mga sumusunod mga independiyenteng t-test Para sa bawat katangiang audio, ang mga mean ay inihambing sa pagitan ng grupo ng mga sikat na kanta at ng grupo ng mga hindi sikat na kanta. Sa antas ng kahalagahan na 95%, natuklasan na halos lahat ng mga baryabol (kakayahang sumayaw, enerhiya, lakas, acousticness, liveness, tagal, tempo, valence, at instrumentalness) ay nagpakita ng mga makabuluhang pagkakaiba sa pagitan ng dalawang grupo.

Ang tanging maliwanag na eksepsiyon ay ang pagsasalitaSa unang pagsubok, ang pagkakaiba sa mean ay hindi makabuluhan, ngunit ipinakita ng karagdagang pagsusuri na ang saklaw ng kakayahang magsalita para sa mga paksang lubos na popular (na may mga halaga sa pagitan ng 0,024 at 0,685) ay nasa loob ng mas malawak na saklaw ng hindi gaanong popular na klase (sa pagitan ng 0 at 0,964). Ang pagsasanib na ito ay hindi pumigil sa kakayahang magsalita, kapag ginamit nang epektibo, sa pag-aambag ng impormasyon sa modelo, kaya napagpasyahan na panatilihin ito bilang isang tagahula.

Sa buod, ipinakita ang audio features block isang malinaw na naglalarawang kapangyarihan patungkol sa popularidad, habang ang kasarian ay mas maingat na hinawakan at itinanggi bilang pangunahing baryabol sa ilang pamamaraan ng prediksyon.

Pagbuo ng mga modelo ng machine learning upang mahulaan ang mga hit

Dahil napili na ang malinis na dataset at ang mga kaugnay na baryabol, oras na para lumikha mga modelo ng binaryong klasipikasyon kayang hulaan kung ang isang kanta ay kabilang sa nangungunang 15% ng popularidad. Upang magawa ito, ang mga categorical variable na key at mode ay unang ginawang dummy variable gamit ang get_dummies function ng Pandas.

Matapos maisama ang mga dummies na ito, ang mga orihinal na kolum para sa key at mode, pati na rin ang patuloy na popularidad, ay inalis, at ang target na variable ay pinanatili. binary na larangan ng popularidad (popular vs. hindi popular). Bago sanayin ang mga modelo, lahat ng numerical feature ay inistandardisa gamit ang StandardScaler, dahil gumagana ang mga ito sa magkakaibang iskala at mahalaga na mayroon silang maihahambing na timbang.

Ang dataset ay hinati sa training at test gamit ang train_test_split function, na inilalaan ang 20% ng mga rehistrasyon para sa pagsusulitSa ganitong paraan, naiwasan ang mga pagtagas ng impormasyon at natiyak na ang mga sukatan ng pagganap ay sumasalamin sa aktwal na kakayahang gawing pangkalahatan ng mga modelo, at hindi lamang sa kanilang kakayahang kabisaduhin ang datos ng pagsasanay.

  Paghawak ng File sa Mga Halimbawa ng C Language: Isang Kumpletong Gabay

Ang unang modelong ginamit ay ang Logistic regressionAng pamamaraang ito ay malawakang ginagamit sa binary classification. Isang iterative version na may learning rate na 0,01 at 200 iteration ang ipinatupad at sinuri gamit ang cross-validation. Ang average accuracy ay umabot sa humigit-kumulang 84,7%, isang napakalakas na resulta para sa isang problemang kasingsalimuot ng paghula sa tagumpay ng musika.

Pagkatapos ay sinubukan ang algorithm K-Nearest Neighbors (KNN)na nag-uuri sa bawat kanta ayon sa pinakamalapit na kapitbahay na k sa feature space. Ang pagsasaayos ng halaga ng ky gamit ang Grid Search upang mahanap ang pinakamainam na configuration ay nagbunga ng halos magkaparehong katumpakan, humigit-kumulang 84,8%, na may bahagyang pagbuti sa cross-validation score kumpara sa logistic regression.

Ang susunod na modelo ay ang Makinang Pang-Vector ng Suporta (SVM)Ginamit ang isa pang pinangangasiwaang pamamaraan na may kakayahang pangasiwaan ang parehong linear at nonlinear na mga ugnayan. Muli, sa pamamagitan ng hyperparameter fitting, nakamit ang mga katumpakan na humigit-kumulang 84,6%, na may katumbas na mga halaga sa cross-validation, na nagpapahiwatig ng matatag na pagganap.

Sinuri rin ang mga sumusunod: Naive Bayes classifierBatay sa hipotesis ng kalayaan sa pagitan ng mga katangian. Sa kabila ng pagiging isang mas simpleng modelo sa mga tuntunin ng mga pagpapalagay, ang mga resulta ng katumpakan nito (humigit-kumulang 84,6%) ay kapantay ng SVM at napakalapit sa logistic regression at KNN, na nagpapatibay sa ideya na ang istruktura ng problema ay angkop para sa ganitong uri ng probabilistikong pamamaraan.

Panghuli, sinubukan ang mga modelong batay sa mga decision tree. Tagapagklasipikar ng Puno ng Desisyon Nakamit nito ang mas mababang katumpakan, humigit-kumulang 75,4%, at kinumpirma ng cross-validation ang pagbabang ito sa performance, malamang dahil sa mga isyu sa overfitting. Random Forest Classifier, na pinagsasama ang maraming puno upang pakinisin ang mga epektong ito, ay bumuti nang malaki, na nakamit ang humigit-kumulang 84,1% na katumpakan at mahigit 84% sa cross-validation.

Upang makumpleto ang pagsusuri, isang matrix ng pagkalito at isang ulat ng klasipikasyon para sa Random Forest. Ang modelo ay nagpakita ng mahusay na kakayahang tukuyin ang mga hindi sikat na kanta (uring mayorya), na may katumpakan na 0,85 at recall na malapit sa 0,99, habang ang pagganap nito sa uri ng sikat na kanta (minorya) ay mas katamtaman, na may katumpakan na 0,40 at recall na 0,05. Itinatampok nito ang klasikong hamon ng kawalan ng balanse ng klase sa ganitong uri ng problema.

Kahalagahan ng mga baryabol: ano ang pinakamabigat kapag lumilikha ng isang hit

Bukod sa pag-alam kung aling modelo ang mas tumpak, mahalagang maunawaan kung aling mga tampok ang talagang nagbibigay ng kapaki-pakinabang na impormasyon kapag hinuhulaan kung magiging popular ang isang kanta. Para sa layuning ito, ginamit ang XGBoost (XGBClassifier) ​​upang makakuha ng mga variable na marka ng kahalagahan, batay sa kontribusyon ng bawat tampok sa pagbabawas ng error sa mga decision tree.

Ipinakita ng mga resulta na ang Ang haba ng kanta ay malinaw na namumukod-tangi sa ibana may F score na higit sa 400. Ang natuklasang ito ay naaayon sa ideya na ang mas maiikling track ay humihikayat ng paulit-ulit na pakikinig at samakatuwid ay nakakaipon ng mas maraming pag-play sa mas maikling oras, isang bagay na may posibilidad na gantimpalaan ng algorithm ng rekomendasyon ng Spotify.

Sa kabilang dulo, ang mga baryabol tulad ng susi, ang mode, o ang damdaming kinuha mula sa pamagat Nakakuha sila ng mga marka ng kahalagahan na mas mababa sa 50, na nagmumungkahi na ang kanilang kontribusyon sa pangkalahatang kapangyarihang maghula ng modelo ay maliit. Hindi ito nangangahulugan na wala silang anumang epekto, ngunit sa halip, kumpara sa iba pang mga tampok, ang kanilang timbang ay mas mababa.

Ang natitirang mga katangian ng audio (tulad ng enerhiya, kakayahang sumayaw, lakas, lakas ng tunog, akustika, sigla, kakayahang magsalita, at pagiging instrumento) ay nasa katamtamang saklaw na may mga F-score sa pagitan ng 200 at 300, na nagpapahiwatig na Bumubuo sila ng isang medyo balanseng bloke ng impormasyonWala sa mga ito ang ganap na nangingibabaw, ngunit lahat ng ito ay nakakatulong upang makabuo ng isang medyo tumpak na larawan ng tsansa ng tagumpay ng isang kanta.

Sa kabuuan, ang mga modelo batay sa mga tampok ng audio ay nagawang mahulaan gamit ang humigit-kumulang isang 84-85% na antas ng tagumpay kung ang isang palatandaan ay magiging bahagi ng pinakasikat na 15%Nagbibigay ito ng ilang empirikal na suporta sa lumang intuwisyon ng "agham ng mga hit song": na may mahusay na datos at angkop na mga pamamaraan, ang tagumpay sa musika ay hindi lamang basta-basta, bagama't nananatili ang isang mahalagang hindi mahuhulaan na sangkap.

Ang larawang ipininta ng pagsusuring ito ay nagpapakita na ang pagsasama-sama ng datos ng Spotify, mga tradisyunal na estadistika, at mga modelo ng machine learning ay nagbibigay-daan sa atin na higit pa sa pagbibilang lamang ng mga stream. Ang pag-unawa sa epekto ng tagal, enerhiya, valence, at instrumentality, kasama ang papel ng mga editorial playlist at ang dinamika ng rekomendasyon ng platform, ay nagbibigay sa mga artista, label, at analyst ng isang napaka-konkretong roadmap para sa pagbibigay-kahulugan kung bakit nagiging hit ang ilang mga kanta at kung paano nila mapapalaki ang kanilang mga pagkakataong sumali sa piling grupong iyon nang hindi ganap na nawawala ang elementong pantao at malikhain na, sa kabutihang palad, ay nananatiling hindi mababawasan sa anumang pormula.

mga uri ng artificial intelligence
Kaugnay na artikulo:
7 Uri ng Artificial Intelligence na magbabago sa ating kinabukasan