- Spotify API piedāvā desmitiem audio un konteksta mainīgo (enerģija, valence, ilgums, dejojamība utt.), kas ļauj modelēt un izprast, kas padara dziesmu populāru.
- Statistikas analīze rāda, ka gandrīz visas audio funkcijas atšķiras starp populārām un nepopulārām dziesmām, savukārt žanram, tonalitātei vai nosaukuma noskaņojumam ir mazāka paredzamā nozīme.
- Mašīnmācīšanās modeļi, piemēram, loģistiskā regresija, KNN, SVM, Naivā Bajesa metode un Random Forest, sasniedz aptuveni 84–85 % precizitāti, klasificējot, vai tēma būs starp 15 % populārākajām.
- Dziesmas garums, enerģija, skaļums un instrumentālā mūzika ir galvenie faktori, kas ietekmē tās popularitāti Spotify platformā, ekosistēmā, kurā redakcionālie atskaņošanas saraksti un ieteikumu algoritms ir izšķiroši svarīgi.

Spotify ir kļuvis par perfektu laboratoriju, lai pētītu, kas padara dziesmu par hitu : mums ir pieejami reāllaika atskaņošanas dati, uzlaboti metrikas māksliniekiem un miljoniem klausītāju, kas katru sekundi pieņem lēmumus. Spotify nebūt nav tikai klausīšanās platforma, bet gan ir pārveidojies par milzīgu datubāzi , kurā var analizēt modeļus, emocijas, žanrus un atskaņošanas sarakstu stratēģijas, lai saprastu, kāpēc dažas dziesmas kļūst populāras, bet citas izgaist aizmirstībā.
Pēdējos gados ir parādījušies rīki, akadēmiskie pētījumi un mašīnmācīšanās modeļi, kas veltīti Spotify hitu analīzei : sākot ar redakcionālo topu, piemēram, Today's Top Hits vai Rap Caviar, izpēti un beidzot ar algoritmu izveidi, kas spēj paredzēt, vai dziesma piederēs populārākajai grupai katalogā. Vienlaikus Spotify for Artists ir demokratizējis piekļuvi šiem rādītājiem, ļaujot jebkuram māksliniekam redzēt, kas viņu klausās, kur un kā viņš tiek atklāts, un attiecīgi pielāgot savu radošo un mārketinga stratēģiju.
Kas īsti ir Spotify hitu analīze un kāpēc tā ir svarīga?
Runājot par Spotify hitu analīzi, mēs nerunājam tikai par to, cik reižu dziesma ir atskaņota. Tā ir plašāka pieeja, kas apvieno audio, kontekstu un lietotāja uzvedību, lai atbildētu uz neērtu, bet būtisku jautājumu: vai var paredzēt dziesmas panākumus pirms tās izdošanas? Izmantojot datus no Spotify API, pētnieki strādā ar tādiem mainīgajiem lielumiem kā popularitāte, enerģija, valence, ilgums, temps un dejojamība, lai mēģinātu pietuvoties šai atbildei.
Šīs pieejas saknes meklējamas tā sauktajā “hitu dziesmu zinātnē ” — idejā, ko 2000. gadu sākumā popularizēja Maiks Makkrīdijs: algoritmu un matemātisko modeļu izmantošana, lai prognozētu, kuras dziesmas labi darbosies topos un radio. Lai gan agrīnie pētījumi secināja, ka tas ir ļoti sarežģīti (un ka modeļi nav pietiekami precīzi), ainava ir pilnībā mainījusies līdz ar straumēšanas parādīšanos, milzīgo datu apjoma pieaugumu un mašīnmācīšanās metožu pilnveidošanos.
Mūsdienās Spotify piedāvā API ar piekļuvi desmitiem tūkstošu dziesmu un to muzikālajiem un kontekstuālajiem atribūtiem : sākot no tonalitātes un režīma līdz dziesmas akustiskā vai instrumentālā rakstura iespējamībai, tostarp metrikas, kas īpaši izstrādātas, lai aprakstītu, kā dziesma tiek uztverta (enerģija, valence, dejojamība utt.). Tas viss ļauj pāriet no subjektīviem viedokļiem uz daudz precīzāku kvantitatīvu analīzi.
Tikmēr rīks “Spotify for Artists” palīdz satura veidotājiem neapmaldīties iedomības rādītājos un koncentrēties uz to, kas patiesi ir svarīgs: ilgtermiņa auditorijas attīstība, iesaiste, noturēšana un tas, kā mārketinga centieni ietekmē īstu fanu piesaisti. Citiem vārdiem sakot, skaitļi, jā, bet ar kontekstu un stratēģisku nolūku.
Oficiālie atskaņošanas saraksti un stratēģija: redakcionālo sarakstu svars
Viens no svarīgākajiem elementiem jebkurā nopietnā Spotify hitu analīzē ir oficiālo redakcionālo atskaņošanas sarakstu loma . Tādi saraksti kā Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint vai ¡Viva Latino! darbojas kā milzīgi pastiprinātāji: nokļūšana vienā no tiem var pilnībā mainīt dziesmas vai pat mākslinieka karjeras trajektoriju.
Trešo pušu rīki, piemēram, Soundcharts, ļauj redzēt, kā mākslinieks darbojas šajos atskaņošanas sarakstos : uzstāšanās reižu skaits, uzturēšanās ilgums, tirgi, kuros viņam ir vislielākā ietekme utt. Šāda veida analīze skaidri parāda, ka klātbūtne redakcionālajos sarakstos nav paredzēta tikai izrādīšanai, bet gan platformas izaugsmes stratēģijas galvenā sastāvdaļa.
Kvalitatīvu atskaņošanas sarakstu veidošanā pastāv noteikti atkārtoti kritēriji. Piemēram, mākslinieku daudzveidība tiek vērtēta augstāk par to pašu vārdu atkārtošanu atkal un atkal . Atskaņošanas saraksti, kuros viens un tas pats mākslinieks parādās pārāk daudzas reizes, parasti saņem zemākus vērtējumus, jo tie samazina klausītāja atklāšanas sajūtu.
Tiek meklēts arī saskaņots žanru līdzsvars . Ja atskaņošanas sarakstā ir pārāk daudz stilu bez skaidra virziena, pieredze kļūst sadrumstalota un vērtējums krītas. Vislabāk funkcionējošie atskaņošanas saraksti parasti koncentrējas uz vienu vai dažiem precīzi definētiem žanriem, palīdzot lietotājam uzreiz saprast, ko sagaidīt, nospiežot atskaņošanas pogu.
Vēl viens svarīgs aspekts ir labi zināmu un jaunu dziesmu sajaukums . Atskaņošanas saraksti, kas ietver tikai lielus hitus, ir labi, taču tie piedāvā maz atklāšanas iespēju. Turpretī atskaņošanas saraksti, kas apvieno jau zināmas dziesmas ar mazāk zināmiem dārgakmeņiem, parasti rada lielāku iesaisti un palīdz radīt jaunus hitus.
Visbeidzot, pastāv vispārēja vienprātība, ka labā atskaņošanas sarakstā jābūt vismaz 50 dziesmām, lai sniegtu pilnīgu pieredzi . Atskaņošanas saraksti ar mazāk nekā 10 dziesmām bieži tiek uztverti kā slikti un saņem zemākus vērtējumus, kas ietekmē arī tajos iekļauto dziesmu sniegumu.
Īsa Spotify vēsture un tā analītikas izcelsme
Pirms Spotify varēja veikt padziļinātu hitu analīzi, pašai platformai bija jāatrod sava vieta mūzikas industrijā. Ideja, ko izstrādāja līdzdibinātājs Daniels Eks, radās pēc Napster sabrukuma 2002. gadā: viņš vēlējās izveidot pakalpojumu, kas ir "labāks par pirātismu, bet kas arī atmaksājas nozarei ". Tobrīd Eks vadīja uTorrent, vienu no vadošajiem P2P lejupielādes un koplietošanas klientiem, tāpēc viņam bija tiešas zināšanas par neatļautas izplatīšanas pasauli.
Pēc uTorrent pārdošanas BitTorrent 2006. gada beigās, Eks pilnībā koncentrējās uz Spotify izveidi. Lietotne oficiāli tika laista klajā 2008. gadā Zviedrijā pēc licencēšanas un īpašumtiesību līgumu noslēgšanas ar lielākajām ierakstu kompānijām : Sony Music Entertainment, Universal Music Group un Warner Music Group. Gadu vēlāk tā paplašinājās uz Apvienoto Karalisti, un 2011. gadā tā tika laista klajā ASV.
Šajā sākotnējā periodā maksas abonentu bāze pieauga no aptuveni 1 miljona Eiropā līdz gandrīz 4 miljoniem visā pasaulē 2012. gadā. Līdz 2016. gadam Spotify jau paziņoja par 40 miljoniem maksas lietotāju un aptuveni 100 miljoniem kopējo lietotāju, nostiprinot straumēšanu kā dominējošo mūzikas patēriņa veidu visā pasaulē.
Vienlaikus sāka parādīties datu rīki māksliniekiem. Vispirms parādījās Fan Insights , kas dažām komandām piedāvāja ierobežotu piekļuvi straumēšanas datiem: demogrāfiskajiem datiem, ģeogrāfijai un pamata tendencēm. 2017. gadā šis risinājums attīstījās par Spotify māksliniekiem, paverot visiem māksliniekiem iespēju skatīt savus galvenos rādītājus un izmantot datus, lai pieņemtu lēmumus par koncerttūrēm, izlaidumiem un reklamēšanu.
2018. gadā uzņēmums kļuva publiski pieejams ar gandrīz 30.000 miljardu ASV dolāru tirgus kapitalizāciju . Kopš tā laika tirgu skaits, kuros tas darbojas, ir turpinājis pieaugt, kā arī ir pieaugusi analītikas nozīme platformā. Tas, kas sākās kā licencēts multivides atskaņotājs, ir kļuvis par globālu infrastruktūru, kurā dati ir vissvarīgākie.
Spotify metrika: kā izmērīt dziesmu ārpus straumēšanas
Lai izveidotu hitu prognozēšanas modeļus, vispirms ir jāsaprot, kāda veida datus piedāvā Spotify API . Piemēram, pētījumā, kas bija vērsts uz Indijas tirgu, no Spotify ģenerētiem atskaņošanas sarakstiem tika iegūti vairāk nekā 46 000 dziesmu ierakstu, aptverot plašu žanru un apakšžanru klāstu.
Informācija ir sakārtota vairākos blokos. Dziesmas līmenī atrodami tādi dati kā identifikators, nosaukums, izpildītājs, popularitāte, izdošanas datums un ilgums milisekundēs . Albuma līmenī tiek saglabāts ID un nosaukums. Atskaņošanas saraksta līmenī tiek parādīts nosaukums, ID, žanrs un saistītais apakšžanrs.
Taču visinteresantākais aspekts trāpījumu analīzei ir audio funkcijas , kas iedalītas dažādās kategorijās: noskaņojuma raksturojums (dejotspēja, enerģija, valence, temps), fizikālās īpašības (skaļums, runas kvalitāte, instrumentalitāte), konteksts (akustiskums, dzīvīgums) un muzikālie segmenti (toņkārta, moduss). Katrs no šiem mainīgajiem ir rūpīgi definēts un normalizēts.
Piemēram, dejojamība tiek izteikta kā vērtība no 0 līdz 1, kas apkopo, cik viegli ir dejot dziesmas pavadījumā , pamatojoties uz tādiem elementiem kā ritms, tempa stabilitāte un bīta stiprums. Enerģija arī mainās no 0 līdz 1 un mēģina noteikt, vai dziesma skan intensīvi, ātri un spēcīgi, nevis mierīgāk vai maigāk.
Valence apraksta audio uztverto emocionālo “pozitivitāti” : zemas vērtības atbilst skumjām, saspringtām vai drūmām sajūtām, savukārt augstas vērtības atbilst dzīvespriecīgai, spilgtai vai eiforiskai mūzikai. Akustiskums mēra ieraksta akustiskā rakstura iespējamību, dzīvīgums — dzīvas auditorijas klātbūtni ierakstā, un runas līmenis atspoguļo runāto vārdu īpatsvaru miksā (ļoti augsts, piemēram, podkāstos vai runāto vārdu ierakstos).
Citi svarīgi parametri ir temps BPM , kopējais ilgums, tonalitāte (kodēts kā vesels skaitlis), režīms (liels vai mazsvarīgs) un dziesmas popularitāte. Popularitāte ir iekšējs Spotify rādītājs, kas svārstās no 0 līdz 100 un ir atkarīgs gan no straumējumu skaita, gan no to nesenuma . Dziesmas, kas pirms gadiem bija ļoti populāra, bet tagad tiek reti atskaņota, vērtējums laika gaitā samazināsies.
Kā sagatavot un iztīrīt datu kopu, lai varētu paredzēt sakritības
Viens solis, kas bieži tiek aizmirsts, apspriežot Spotify hitu analīzi, ir datu kopas sagatavošana . Šajā pētījumā dati tika apkopoti, izmantojot R un RStudio, izsaucot Spotify API dažādām tirgus (Indija), žanru un apakšžanru kombinācijām, kas atlasītas atbilstoši to globālajam un vietējam svaram.
Apvienojot dziesmas no dažādiem tematiskiem atskaņošanas sarakstiem, bieži vien daudzas dziesmas atkārtojas, jo viena un tā pati dziesma var parādīties dažādos sarakstos. Tā kā mērķis nebija analizēt pašu atskaņošanas saraksta stratēģiju, bet gan dziesmu raksturlielumus, tika noņemtas dublikātu dziesmas , samazinot kopējo skaitu no 46 417 līdz aptuveni 39 147 unikālām dziesmām.
Kolonnas, kas modeļos netika izmantotas kā skaidrojošie mainīgie, piemēram, izpildītāja, albuma ID un nosaukuma, kā arī atskaņošanas sarakstam raksturīgie lauki, tika noņemtas. Vienlaikus tika normalizēti lauku nosaukumi un pielāgoti datu tipi: piemēram, popularitāte, režīms, tonalitāte un ilgums tika konvertēti uz peldošām vērtībām, lai atvieglotu statistisko analīzi.
Svarīgs lēmums bija pārveidot popularitāti par vieglāk pārvaldāmu mainīgo. Tā vietā, lai strādātu ar nepārtrauktu vērtību no 0 līdz 100, tika definēts slieksnis, lai atdalītu populāras un nepopulāras dziesmas . Ņemot sadalījuma 85. procentili (aptuveni popularitāte 65), dziesmas virs šīs vērtības tika uzskatītas par “populārām”, bet pārējās – par “nepopulārām”.
Tādā veidā datu kopa tika sadalīta gandrīz 6.000 populārās dziesmās un aptuveni 33 000 nepopulārās dziesmās . Izpētes analīzei tā pat tika segmentēta piecās popularitātes klasēs (ļoti augsta, augsta, vidēja, zema un ļoti zema) ar 20 punktu intervāliem, kas ļāva salīdzināt smalkas tendences starp panākumu līmeņiem.
Turklāt no dziesmu nosaukumiem tika ģenerēts jauns mainīgais: noskaņojuma indikators . Izmantojot TextBlob bibliotēku Python valodā, katra nosaukuma polaritāte (skaitlis no -1 līdz 1) tika aprēķināta un klasificēta kā pozitīva, negatīva vai neitrāla. Šī skaitliskā vērtība tika pievienota datu rāmim, lai izpētītu, vai nosaukuma tonis ir saistīts ar tā popularitāti.
Datu izpēte: kas atšķir populārākās dziesmas
Pirms jebkura mašīnmācīšanās modeļa apmācības ir svarīgi veltīt laiku datu vizuālai un statistiskai izpētei . Šajā pētījumā tika analizētas sadalījuma līknes, vidējie rādītāji katrā popularitātes grupā un attiecības starp emocijām un panākumiem.
Viens no pārsteidzošajiem atklājumiem ir saistīts ar veiksmīgāko dziesmu valenci. Aplūkojot dziesmas ar popularitātes rādītāju virs 90, tika novērots, ka lielākam skaitam no tām valences vērtība bija zem 0,5 ; tas ir, tās skanēja skumjāk, drūmāk vai melanholiskāk nekā dzīvespriecīgi. Tā nebija absolūta dominance, bet gan skaidra tendence.
Kad tika attēlots popularitātes sadalījums pa žanriem, lielākā daļa līkņu ieguva aptuvenu zvana formu , daudzas dziesmas bija ap vidējo vērtību un mazāk galējos punktos. Tomēr tādi žanri kā roks, ritmblūzs, elektroniskā deju mūzika, pasaules mūzika un indiešu mūzika uzrādīja zināmu asimetriju liela skaita dziesmu dēļ, kurām nebija popularitātes. Turpretī tādi stili kā pops, reps, latīņu mūzika un desi mūzika šķita līdzsvarotāki un ar mazāku koncentrāciju nulles līmenī.
Tas liek domāt, ka šajos plašāk izplatītajos žanros parasti ir vieglāk sasniegt noteiktu popularitātes līmeni , pat ja dziesmām nepiemīt visas ideālās īpašības, savukārt citos stilos panākumu sadalījums ir polarizētāks.
Salīdzinot dažādu pazīmju vidējos rādītājus pēc popularitātes klases, parādījās ļoti skaidra tendence: veiksmīgākajiem skaņdarbiem parasti ir lielāka enerģija un skaļums (uztvertais skaļums) , kā arī vairāk instrumentālisma un mazāk runas. Vienkārši sakot, dziesmas, kas vislabāk darbojas straumēšanas platformās, parasti ir spēcīgākas un vairāk vērstas uz mūziku, nevis uz runātiem vārdiem.
Tika arī novērots, ka populāriem skaņdarbiem ir zemāka akustiskā kvalitāte un dzīvīgums ; tas ir, tie skan mazāk "akustiski" un mazāk "dzīvi". Tie ir vairāk producēti studijā, izsmalcinātāki, ar mazāku apkārtējā trokšņa līmeni vai koncertam līdzīgu sajūtu.
Vēl viens svarīgs atklājums ir tas, ka populāras dziesmas mēdz būt īsākas nekā nepopulāras . Kontekstā, kurā ieņēmumi ir atkarīgi no straumējumu skaita un algoritmi atalgo atkārtošanu, ir loģiski, ka īsākas dziesmas var ātrāk uzkrāt atskaņošanas reižu skaitu un kļūt draudzīgākas atskaņošanas sarakstiem.
Runājot par uztverto laimi (valenci), tendence ir interesanta: līmeņi paaugstinās no zemākajām popularitātes klasēm līdz "augstākajai" klasei, bet galējā kategorijā - "ļoti augstajā" - ir vērojams ievērojams kritums. Citiem vārdiem sakot, superpopulāras dziesmas mēdz izklausīties skumjāk nekā tikai "veiksmīgās" , kas paver durvis daudzām interpretācijām par sabiedrības gaumi un sociāli emocionālo kontekstu.
Statistiskā analīze: žanru un audio atribūtu ietekme
Kad dati bija izpētīti, nākamais solis bija pielietot formālus statistikas testus, lai noskaidrotu, kurus mainīgos var uzskatīt par nozīmīgiem popularitātes skaidrošanā. Lai izpētītu, vai dzimums ietekmē panākumus, tika izmantota dispersijas analīze (ANOVA) ar deviņiem galvenajiem žanriem.
ANOVA rezultātā tika iegūta ļoti augsta F vērtība un praktiski nekāda nozīme, kas nozīmē, ka pastāv statistiski nozīmīgas atšķirības popularitātē starp dzimumiem . Tomēr ar to nepietiek: ir svarīgi arī zināt, starp kuriem dzimumu pāriem šīs atšķirības pastāv un vai mainīgais būs noderīgs paredzošajam modelim.
Ņemot vērā, ka dispersijas nebija homogēnas un dziesmu skaits katrā žanrā atšķīrās, tika izmantots Games-Howell post hoc tests . Šī analīze ļāva mums noteikt, kurās žanru kombinācijās nebija būtisku atšķirību popularitātē, kas kopumā padarīja mazāk ieteicamu žanra izmantošanu kā spēcīgu prognozētāju mašīnmācīšanās modeļos.
Paralēli katrai audio funkcijai tika veikti neatkarīgi t-testi , salīdzinot populāru un nepopulāru dziesmu grupu vidējos rādītājus. 95% nozīmīguma līmenī gandrīz visi mainīgie (dejotspēja, enerģija, skaļums, akustiskums, dzīvīgums, ilgums, temps, valence un instrumentalitāte) uzrādīja būtiskas atšķirības starp abām grupām.
Vienīgais acīmredzamais izņēmums bija runīgums . Pirmajā testā vidējo vērtību atšķirība nebija būtiska, taču turpmākā analīze atklāja, ka ļoti populāru tēmu runīguma diapazoni (ar vērtībām no 0,024 līdz 0,685) atbilda mazāk populārās klases plašākajam diapazonam (no 0 līdz 0,964). Šī pārklāšanās netraucēja runīgumam, efektīvi izmantojot, sniegt informāciju modelim, tāpēc tika nolemts to saglabāt kā prognozētāju.
Rezumējot, audio funkciju blokam bija skaidra aprakstošā spēja attiecībā uz popularitāti , savukārt žanrs tika apstrādāts piesardzīgāk un dažās prognozēšanas pieejās tika atmests kā primārais mainīgais.
Mašīnmācīšanās modeļu veidošana, lai prognozētu trāpījumus
Kad datu kopa bija iztīrīta un atbilstošie mainīgie bija atlasīti, bija pienācis laiks izveidot binārus klasifikācijas modeļus, kas spētu paredzēt, vai dziesma pieder pie 15% popularitātes augšējiem. Lai to izdarītu, kategoriskie mainīgie key un mode vispirms tika pārveidoti par fiktīviem mainīgajiem, izmantojot Pandas get_dummies funkciju.
Pēc šo fiktīvo modeļu iekļaušanas sākotnējās tonalitātes un režīma kolonnas, kā arī nepārtrauktā popularitāte tika noņemtas, un binārais popularitātes lauks (populārs pret nepopulāru) tika saglabāts kā mērķa mainīgais. Pirms modeļu apmācības visas skaitliskās pazīmes tika standartizētas, izmantojot StandardScaler, jo tās darbojās ļoti dažādos mērogos un bija svarīgi, lai tām būtu salīdzināms svars.
Datu kopa tika sadalīta apmācības un testēšanas daļās, izmantojot funkciju train_test_split, rezervējot 20% ierakstu testēšanai . Tas novērsa datu noplūdes un nodrošināja, ka veiktspējas rādītāji atspoguļo modeļu faktisko vispārināmību, ne tikai to spēju iegaumēt apmācības datus.
Pirmais izmantotais modelis bija loģistiskā regresija — metode, ko plaši izmanto binārajā klasifikācijā. Tika ieviesta iteratīva versija ar mācīšanās ātrumu 0,01 un 200 iterācijām un novērtēta, izmantojot krustvalidāciju. Vidējā precizitāte sasniedza aptuveni 84,7 %, kas ir ievērojami spēcīgs rezultāts tik sarežģītai problēmai kā muzikālo panākumu prognozēšana.
Pēc tam tika pārbaudīts K tuvāko kaimiņu (KNN) algoritms , kas klasificē katru dziesmu pēc tās k tuvākajiem kaimiņiem pazīmju telpā. Pielāgojot ky vērtību, izmantojot režģa meklēšanu, lai atrastu optimālo konfigurāciju, tika iegūta ļoti līdzīga precizitāte, aptuveni 84,8%, ar nelielu uzlabojumu krustvalidācijas rādītājā salīdzinājumā ar loģistisko regresiju.
Nākamais modelis bija atbalsta vektoru mašīna (SVM) — vēl viena uzraudzīta metode, kas spēj apstrādāt gan lineāras, gan nelineāras attiecības. Arī šajā gadījumā, izmantojot hiperparametru regulēšanu, tika sasniegta aptuveni 84,6 % precizitāte ar līdzvērtīgām vērtībām savstarpējā validācijā, kas norāda uz stabilu veiktspēju.
Tika novērtēts arī Naivā Bajesa klasifikators , kas balstīts uz pieņēmumu par pazīmju neatkarību . Lai gan pieņēmumu ziņā tas ir daudz vienkāršāks modelis, tā precizitātes rezultāti (aptuveni 84,6%) bija līdzvērtīgi SVM un ļoti tuvi loģistiskajai regresijai un KNN, pastiprinot ideju, ka problēmas struktūra labi atbilst šāda veida varbūtības pieejai.
Visbeidzot, tika pārbaudīti uz lēmumu kokiem balstīti modeļi. Lēmumu koku klasifikators sasniedza ievērojami zemāku precizitāti, aptuveni 75,4%, un šķērsvalidācija apstiprināja šo veiktspējas kritumu, kas, iespējams, bija saistīts ar pārmērīgu pielāgošanas problēmām. Nejaušo mežu klasifikators , kas apvieno daudzus kokus, lai izlīdzinātu šīs sekas, ievērojami uzlabojās, sasniedzot aptuveni 84,1% precizitāti un vairāk nekā 84% šķērsvalidācijā.
Lai pabeigtu analīzi, Random Forest modelim tika ģenerēta apjukuma matrica un klasifikācijas ziņojums . Modelis uzrādīja izcilu spēju identificēt nepopulāras dziesmas (vairākuma klase) ar precizitāti 0,85 un atcerēšanās spēju tuvu 0,99, savukārt tā sniegums populāro dziesmu klasē (mazākuma klase) bija pieticīgāks ar precizitāti 0,40 un atcerēšanās spēju 0,05. Tas izceļ klasisko klases nelīdzsvarotības izaicinājumu šāda veida problēmās.
Mainīgo svarīgums: kam ir vislielākā nozīme trāpījuma veidošanā
Papildus tam, lai zinātu, kurš modelis ir visprecīzākais, ir svarīgi saprast, kuras pazīmes patiesi sniedz noderīgu informāciju , prognozējot, vai dziesma būs populāra. Šim nolūkam tika izmantots XGBoost (XGBClassifier), lai iegūtu mainīgus svarīguma rādītājus, pamatojoties uz katras pazīmes ieguldījumu kļūdu samazināšanā lēmumu kokos.
Rezultāti parādīja, ka dziesmas garums nepārprotami izcēlās starp pārējām , un tās F vērtējums bija krietni virs 400. Šis atklājums atbilst idejai, ka īsāki skaņdarbi veicina atkārtotu klausīšanos un tādējādi uzkrāj vairāk atskaņošanas reižu īsākā laikā, ko Spotify ieteikumu algoritms parasti atalgo.
Pretējā spektra galā tādi mainīgie kā atslēga, režīms vai no paša nosaukuma iegūtais noskaņojums saņēma svarīguma vērtējumu zem 50, kas liecina, ka to ieguldījums modeļa kopējā prognozēšanas spējā bija minimāls. Tas nenozīmē, ka tiem vispār nav nekādas ietekmes, bet gan to, ka, salīdzinot ar citām funkcijām, to svars ir daudz mazāks.
Atlikušie audio atribūti (piemēram, enerģija, dejojamība, valence, skaļums, akustiskums, dzīvīgums, runas kvalitāte un instrumentalitāte) atradās vidējā diapazonā ar F-rādītājiem no 200 līdz 300, kas norāda, ka tie veido diezgan līdzsvarotu informācijas bloku . Neviens no tiem pilnībā nedominē, bet kopā tie palīdz veidot diezgan precīzu priekšstatu par dziesmas panākumu izredzēm.
Kopumā modeļi, kuru pamatā bija audio funkcijas, spēja ar aptuveni 84–85 % precizitāti paredzēt, vai dziesma būs starp 15 % populārāko , kas sniedz zināmu empīrisku atbalstu vecajai intuīcijai par "hitu dziesmu zinātni": ar labiem datiem un atbilstošām metodēm muzikālie panākumi nav pilnīgi nejauši, lai gan joprojām pastāv ievērojama neparedzama komponente.
Šīs analīzes radītais attēls rāda, ka Spotify datu, tradicionālās statistikas un mašīnmācīšanās modeļu apvienošana ļauj mums iet daudz tālāk par vienkāršu straumju skaitīšanu. Izpratne par ilguma, enerģijas, valences un instrumentalitātes ietekmi, kā arī redakcionālo atskaņošanas sarakstu lomu un platformas ieteikumu dinamiku sniedz māksliniekiem, ierakstu kompānijām un analītiķiem ļoti konkrētu ceļvedi, lai interpretētu, kāpēc noteiktas dziesmas kļūst par hitiem un kā viņi var maksimāli palielināt savas izredzes pievienoties šai atlasītajai grupai, pilnībā nezaudējot cilvēcisko un radošo elementu, kas, par laimi, joprojām nav reducējams uz nevienu formulu.