- Spotify API nudi desetine audio i kontekstualnih varijabli (energija, valencija, trajanje, plesnost itd.) koje vam omogućavaju da modelirate i razumijete šta pjesmu čini popularnom.
- Statistička analiza pokazuje da se gotovo sve audio karakteristike razlikuju između popularnih i nepopularnih pjesama, dok žanr, tonalitet ili sentiment naslova imaju manju prediktivnu težinu.
- Modeli mašinskog učenja kao što su logistička regresija, KNN, SVM, naivni Bayesov model i slučajna šuma postižu oko 84–85% tačnosti u klasifikaciji da li će neka tema biti među 15% najpopularnijih.
- Dužina pjesme, njena energija, glasnoća i instrumentalnost ističu se kao ključni faktori njene popularnosti na Spotifyju, u ekosistemu gdje su uredničke liste pjesama i algoritam preporuka ključni.

Spotify je postao savršena laboratorija za proučavanje onoga što pjesmu čini hitom : imamo podatke o reprodukciji u stvarnom vremenu, napredne metrike za izvođače i milione slušalaca koji donose odluke svake sekunde. Daleko od toga da bude samo platforma za slušanje, Spotify se transformirao u ogromnu bazu podataka u kojoj se mogu analizirati obrasci, emocije, žanrovi i strategije za playliste kako bi se razumjelo zašto neke pjesme postaju popularne, a druge padaju u zaborav.
Posljednjih godina pojavili su se alati, akademska istraživanja i modeli mašinskog učenja posvećeni analizi hitova na Spotifyju : od proučavanja uredničkih ljestvica poput Today's Top Hits ili Rap Caviar, do izgradnje algoritama sposobnih predvidjeti hoće li pjesma pripadati najpopularnijoj grupi u katalogu. Istovremeno, Spotify for Artists je demokratizirao pristup ovim metrikama, omogućavajući svakom umjetniku da vidi ko ga sluša, gdje i kako ga otkrivaju, te da u skladu s tim prilagodi svoju kreativnu i marketinšku strategiju.
Šta je tačno Spotify hit analiza i zašto je važna?
Kada govorimo o analizi hitova na Spotifyju, ne mislimo samo na to koliko je puta pjesma reproducirana. To je širi pristup koji kombinuje zvuk, kontekst i ponašanje korisnika kako bi odgovorio na neugodno, ali ključno pitanje: možete li predvidjeti uspjeh pjesme prije nego što bude objavljena? Koristeći podatke iz Spotifyjevog API-ja, istraživači rade s varijablama kao što su popularnost, energija, valencija, trajanje, tempo i plesnost kako bi pokušali da se približe tom odgovoru.
Ovaj pristup ima korijene u takozvanoj "nauci o hit pjesmama ", ideji koju je popularizirao Mike McCready početkom 2000-ih: korištenje algoritama i matematičkih modela za predviđanje koje će pjesme dobro proći na top listama i radiju. Iako su rane studije zaključile da je to vrlo teško (i da modeli nisu dovoljno tačni), situacija se potpuno promijenila pojavom streaminga, ogromnim povećanjem količine podataka i usavršavanjem tehnika mašinskog učenja.
Danas, Spotify nudi API s pristupom desetinama hiljada pjesama i njihovim muzičkim i kontekstualnim atributima : od tonaliteta i moda do vjerovatnoće da je pjesma akustična ili instrumentalna, uključujući metrike posebno dizajnirane da opišu kako se pjesma doživljava (energija, valencija, plesnost itd.). Sve ovo omogućava prelazak sa subjektivnih mišljenja na mnogo precizniju kvantitativnu analizu.
U međuvremenu, alat Spotify for Artists pomaže kreatorima da izbjegnu da se izgube u sujetnim metrikama i da se fokusiraju na ono što je zaista važno: dugoročni razvoj publike, angažman, zadržavanje i kako marketinški napori utiču na stvaranje pravih obožavatelja. Drugim riječima, brojke, da, ali s kontekstom i strateškom namjerom.
Zvanične plejliste i strategija: težina uredničkih lista
Jedan od najvažnijih elemenata u svakoj ozbiljnoj analizi hitova na Spotifyju je uloga službenih uredničkih playlista . Liste poput Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint ili ¡Viva Latino! djeluju kao ogromni pojačivači: uključivanje u jednu od njih može potpuno promijeniti putanju pjesme ili čak karijeru izvođača.
Alati trećih strana poput Soundchartsa omogućavaju vam da vidite kako se izvođač ponaša na ovim listama za reprodukciju : broj pojavljivanja, dužina zadržavanja, tržišta na kojima ima najveći utjecaj itd. Ova vrsta analize jasno pokazuje da prisustvo na uredničkim listama nije samo za pokazivanje, već ključna komponenta strategije rasta na platformi.
Postoje određeni ponavljajući kriteriji pri kreiranju kvalitetnih plejlista. Na primjer, raznolikost izvođača je vrijednija od ponavljanja istih imena iznova i iznova . Plejliste na kojima se isti izvođač pojavljuje previše puta obično dobijaju niže ocjene jer smanjuju osjećaj otkrivanja kod slušatelja.
Također se traži koherentna ravnoteža žanrova . Kada lista za reprodukciju miješa previše stilova bez jasnog smjera, iskustvo postaje fragmentirano i ocjena pada. Liste za reprodukciju s najboljim rezultatima obično se fokusiraju na jedan ili nekoliko dobro definiranih žanrova, pomažući korisniku da na prvi pogled shvati što može očekivati kada pritisne play.
Još jedan ključni aspekt je kombinacija poznatih pjesama i onih koje su u usponu . Plejliste koje uključuju samo velike hitove su u redu, ali nude malo otkrivanja. Nasuprot tome, plejliste koje kombiniraju poznate pjesme s manje poznatim draguljima obično generiraju veći angažman i pomažu u stvaranju novih hitova.
Konačno, postoji opći konsenzus da dobra lista za reprodukciju treba imati najmanje 50 pjesama kako bi ponudila potpuno iskustvo . Liste za reprodukciju s manje od 10 pjesama često se doživljavaju kao loše i dobijaju niže ocjene, što također utiče na performanse pjesama koje uključuju.
Kratka historija Spotifyja i porijeklo njegove analitike
Prije nego što je Spotify mogao vršiti naprednu analizu hitova, sama platforma je morala pronaći svoje mjesto u muzičkoj industriji. Ideja, koju je osmislio suosnivač Daniel Ek, nastala je nakon propasti Napstera 2002. godine: želio je stvoriti uslugu "bolju od piraterije, ali koja bi i isplatila industriji ". U to vrijeme, Ek je vodio uTorrent, jedan od vodećih P2P klijenata za preuzimanje i dijeljenje, tako da je imao znanje iz prve ruke o svijetu neovlaštene distribucije.
Nakon što je prodao uTorrent kompaniji BitTorrent krajem 2006. godine, Ek se u potpunosti fokusirao na izgradnju Spotifyja. Aplikacija je zvanično pokrenuta 2008. godine u Švedskoj, nakon što je postigla ugovore o licenciranju i vlasništvu s velikim izdavačkim kućama : Sony Music Entertainment, Universal Music Group i Warner Music Group. Godinu dana kasnije, proširila se na Veliku Britaniju, a 2011. godine pokrenuta je i u SAD-u.
U tom početnom periodu, baza plaćenih pretplatnika porasla je sa oko 1 milion u Evropi na skoro 4 miliona globalno u 2012. godini. Do 2016. godine, Spotify je već najavljivao 40 miliona plaćenih korisnika i oko 100 miliona ukupnih korisnika, učvršćujući streaming kao dominantan oblik konzumacije muzike širom svijeta.
Istovremeno, počeli su se pojavljivati alati za podatke za umjetnike. Prvo se pojavio Fan Insights , koji je nekim timovima ponudio ograničen pristup podacima o streamingu: demografiji, geografiji i osnovnim trendovima. 2017. godine ovo rješenje se razvilo u Spotify for Artists, otvarajući vrata svim umjetnicima da vide svoje ključne metrike i koriste podatke za donošenje odluka o turnejama, izdanjima i promociji.
Kompanija je 2018. godine izašla na berzu s tržišnom kapitalizacijom od skoro 30.000 milijardi dolara . Od tada, broj tržišta na kojima posluje nastavio je rasti, zajedno s važnošću analitike unutar platforme. Ono što je započelo kao licencirani medijski plejer postalo je globalna infrastruktura u kojoj podaci vladaju.
Spotify metrike: kako mjeriti pjesmu izvan streamova
Da bi se izgradili modeli za predviđanje hitova, prvo je potrebno razumjeti kakve podatke nudi Spotify API . U studiji usmjerenoj na indijsko tržište, na primjer, više od 46.000 pjesama je izvučeno iz playlista generiranih od strane Spotifyja, pokrivajući širok spektar žanrova i podžanrova.
Informacije su organizirane u nekoliko blokova. Na nivou pjesme nalazimo podatke kao što su identifikator, naslov, izvođač, popularnost, datum izlaska i trajanje u milisekundama . Na nivou albuma pohranjuju se ID i naziv. Na nivou liste pjesama pojavljuju se naziv, ID, žanr i pridruženi podžanr.
Ali najzanimljiviji aspekt za analizu pogodaka su audio karakteristike , podijeljene u različite kategorije: karakteristike raspoloženja (plesnost, energija, valencija, tempo), fizička svojstva (glasnoća, govornost, instrumentalnost), kontekst (akustika, živost) i muzički segmenti (tonalitet, modus). Svaka od ovih varijabli je pažljivo definirana i normalizirana.
Plesna sposobnost, na primjer, izražava se kao vrijednost između 0 i 1 koja sumira koliko je lako plesati uz pjesmu , na osnovu elemenata kao što su ritam, stabilnost tempa i snaga ritma. Energija također varira između 0 i 1 i pokušava uhvatiti da li pjesma zvuči intenzivno, brzo i snažno, nasuprot nečemu mirnijem ili tišem.
Valentnost opisuje percipiranu emocionalnu "pozitivnost" zvuka: niske vrijednosti odgovaraju tužnim, napetim ili tmurnim osjećajima, dok visoke vrijednosti odgovaraju veseloj, vedrijoj ili euforičnoj muzici. Akustika mjeri vjerovatnoću da je pjesma akustična, živost prisustvo žive publike u snimku, a govornost odražava udio izgovorenih riječi u miksu (vrlo visoka, na primjer, u podcastima ili pjesmama sa izgovorenom riječi).
Ostali važni parametri uključuju tempo u BPM-u , ukupno trajanje, tonalitet (kodiran kao cijeli broj), mod (durski ili molski) i popularnost pjesme. Popularnost je interna Spotify metrika u rasponu od 0 do 100 i zavisi i od količine streamova i od njihove nedavnosti . Pjesma koja je bila popularna prije mnogo godina, ali se sada rijetko pušta, s vremenom će vidjeti pad svog rezultata.
Kako pripremiti i očistiti skup podataka da bi se mogli predvidjeti pogoci
Jedan korak koji se često zanemaruje kada se raspravlja o analizi posjeta Spotifyju je priprema skupa podataka . U ovoj studiji, podaci su prikupljeni korištenjem R i RStudio, pozivajući Spotify API za različite kombinacije tržišta (Indija), žanrova i podžanrova odabranih prema njihovoj globalnoj i lokalnoj težini.
Prilikom kombinovanja pjesama sa različitih tematskih plejlista, uobičajeno je da se mnoge pjesme ponavljaju, jer se ista pjesma može pojaviti na različitim listama. Budući da cilj nije bio analizirati samu strategiju plejlista, već karakteristike pjesama, duplikati pjesama su uklonjeni , čime je ukupna baza smanjena sa 46.417 na približno 39.147 jedinstvenih pjesama.
Kolone koje se nisu trebale koristiti kao objašnjavajuće varijable u modelima, kao što su izvođač, ID i naziv albuma i polja specifična za listu pjesama, uklonjene su. Istovremeno, nazivi polja su normalizovani , a tipovi podataka su prilagođeni: na primjer, popularnost, način rada, tonalitet i trajanje su pretvoreni u vrijednosti s pomičnim zarezom radi olakšavanja statističke analize.
Ključna odluka bila je transformirati popularnost u varijablu kojom se lakše upravlja. Umjesto rada s kontinuiranom vrijednošću od 0 do 100, definiran je prag za odvajanje popularnih i nepopularnih pjesama . Uzimajući 85. percentil distribucije (oko popularnosti od 65), pjesme iznad te vrijednosti smatrane su "popularnima", a ostale "nepopularnima".
Na ovaj način, skup podataka je podijeljen na gotovo 6.000 popularnih pjesama i oko 33.000 nepopularnih . Za istraživačku analizu, čak je segmentiran u pet klasa popularnosti (vrlo visoka, visoka, srednja, niska i vrlo niska), s intervalima od 20 bodova, što je omogućilo poređenje suptilnih trendova između nivoa uspjeha.
Pored toga, iz naslova pjesama generirana je nova varijabla: indikator sentimenta . Korištenjem biblioteke TextBlob u Pythonu, polaritet za svaki naslov (broj između -1 i 1) izračunat je i klasificiran kao pozitivan, negativan ili neutralan. Ova numerička vrijednost dodana je u okvir podataka kako bi se proučilo da li je ton naslova povezan s njegovom popularnošću.
Istraživanje podataka: šta razlikuje najpopularnije pjesme
Prije treniranja bilo kojeg modela mašinskog učenja, bitno je posvetiti vrijeme vizualnom i statističkom istraživanju podataka . U slučaju ove studije, analizirane su krivulje distribucije, prosjeci po grupi popularnosti i odnosi između emocija i uspjeha.
Jedan od upečatljivih nalaza odnosi se na valentnost najuspješnijih pjesama. Prilikom pregleda pjesama s ocjenom popularnosti iznad 90, uočeno je da veći broj njih ima valentnost ispod 0,5 ; to jest, zvučale su tužnije, više tmurno ili melanholično nego veselo. Nije se radilo o apsolutnoj dominaciji, ali je bio jasan trend.
Kada je prikazana distribucija popularnosti po žanrovima, većina krivulja je poprimila približan oblik zvona , s mnogo pjesama oko srednje vrijednosti, a manje na ekstremnim vrijednostima. Međutim, žanrovi poput rocka, R&B-a, EDM-a, world muzike i indijske muzike pokazali su određenu asimetriju zbog velikog broja pjesama s nultom popularnošću. Nasuprot tome, stilovi poput popa, repa, latinoameričke i indijske muzike djelovali su uravnoteženije i s manjom koncentracijom na nuli.
Ovo ukazuje na to da je u onim mainstream žanrovima generalno lakše postići određeni nivo popularnosti , čak i ako pjesme nemaju sve idealne karakteristike, dok je u drugim stilovima raspodjela uspjeha polarizovanija.
Prilikom poređenja prosjeka različitih karakteristika prema klasi popularnosti, pojavio se vrlo jasan obrazac: najuspješnije pjesme obično imaju veću energiju i glasnoću (percipiranu jačinu zvuka) , kao i više instrumentalizma i manje govora. Jednostavno rečeno, pjesme koje najbolje prolaze na streaming platformama obično su snažnije i više fokusirane na muziku nego na izgovorene riječi.
Također je primijećeno da popularne pjesme pokazuju nižu akustičnost i živost ; to jest, zvuče manje "akustično" i manje "uživo". Više su studijski producirane, uglađenije, s manje ambijentalne buke ili osjećajem nalik koncertu.
Još jedno ključno otkriće je da popularne pjesme imaju tendenciju da budu kraće od nepopularnih . U kontekstu gdje prihod zavisi od broja streamova, a algoritmi nagrađuju ponavljanje, ima smisla da kraće pjesme mogu brže akumulirati reprodukcije i postati prilagođenije listama za reprodukciju.
Što se tiče percipirane sreće (valencije), trend je neobičan: nivoi rastu od nižih klasa popularnosti do "više" klase, ali u najekstremnijoj kategoriji, "vrlo visokoj", postoji značajan pad. Drugim riječima, superpopularne pjesme obično zvuče tužnije od onih koje su samo "uspješne" , što otvara vrata mnogim interpretacijama o javnom ukusu i socio-emocionalnom kontekstu.
Statistička analiza: utjecaj žanrova i audio atributa
Nakon što su podaci istraženi, sljedeći korak je bio primjena formalnih statističkih testova kako bi se utvrdilo koje se varijable mogu smatrati relevantnim u objašnjenju popularnosti. Da bi se proučilo da li spol utiče na uspjeh, korištena je analiza varijanse (ANOVA) sa devet glavnih žanrova.
Rezultat ANOVA analize dao je vrlo visoku F-vrijednost i praktično nikakvu značajnost, što znači da postoje statistički značajne razlike u popularnosti između spolova . Međutim, to nije dovoljno: važno je znati i između kojih parova spolova postoje ove razlike i hoće li varijabla biti korisna za prediktivni model.
S obzirom na to da varijance nisu bile homogene i da je broj pjesama po žanru varirao, korišten je Games-Howell post hoc test . Ova analiza nam je omogućila da utvrdimo koje kombinacije žanrova nisu pokazale značajne razlike u popularnosti, što je, generalno, učinilo manje preporučljivim korištenje žanra kao snažnog prediktora u modelima mašinskog učenja.
Paralelno, nezavisni t-testovi su provedeni za svaku audio karakteristiku, upoređujući srednje vrijednosti između popularnih i nepopularnih grupa pjesama. Na nivou značajnosti od 95%, gotovo sve varijable (plesnost, energija, glasnoća, akustika, živost, trajanje, tempo, valencija i instrumentalnost) pokazale su značajne razlike između dvije grupe.
Jedini očigledan izuzetak bila je govorljivost . U prvom testu, razlika u srednjim vrijednostima nije bila značajna, ali daljnja analiza je otkrila da su rasponi govorljivosti za vrlo popularne teme (s vrijednostima između 0,024 i 0,685) spadali u širi raspon manje popularne klase (između 0 i 0,964). Ovo preklapanje nije spriječilo govorljivost, kada se efikasno koristi, da doprinese informacijama modelu, pa je odlučeno da se zadrži kao prediktor.
Ukratko, blok audio karakteristika pokazao je jasnu deskriptivnu moć u pogledu popularnosti , dok je žanr tretiran opreznije i odbačen je kao primarna varijabla u nekim pristupima predviđanja.
Izrada modela mašinskog učenja za predviđanje pogodaka
Nakon što je skup podataka očišćen i relevantne varijable odabrane, bilo je vrijeme za kreiranje binarnih klasifikacijskih modela sposobnih predvidjeti da li pjesma pripada među prvih 15% popularnosti. Da bi se to postiglo, kategoričke varijable key i mode prvo su pretvorene u lažne varijable pomoću Pandasove funkcije get_dummies.
Nakon uključivanja ovih lutki, originalne kolone tonaliteta i moda, kao i kontinuirana popularnost, su uklonjene, a binarno polje popularnosti (popularno vs. nepopularno) je zadržano kao ciljna varijabla. Prije treniranja modela, sve numeričke karakteristike su standardizirane korištenjem StandardScalera, jer su radile na vrlo različitim skalama i bilo je važno da imaju usporedivu težinu.
Skup podataka je podijeljen na za obuku i testiranje pomoću funkcije train_test_split, rezervirajući 20% zapisa za testiranje . Ovo je spriječilo curenje podataka i osiguralo da metrike performansi odražavaju stvarnu generalizabilnost modela, a ne samo njihovu sposobnost pamćenja podataka za obuku.
Prvi primijenjeni model bila je logistička regresija , tehnika koja se široko koristi u binarnoj klasifikaciji. Iterativna verzija sa stopom učenja od 0,01 i 200 iteracija implementirana je i procijenjena korištenjem unakrsne validacije. Prosječna tačnost dostigla je približno 84,7%, što je izuzetno snažan rezultat za problem složen kao što je predviđanje muzičkog uspjeha.
Zatim je testiran algoritam K-Nearest Neighbors (KNN) , koji klasificira svaku pjesmu prema njenim k najbližim susjedima u prostoru karakteristika. Podešavanjem vrijednosti ky korištenjem Grid Search-a za pronalaženje optimalne konfiguracije, dobivena je vrlo slična tačnost, oko 84,8%, uz blago poboljšanje rezultata unakrsne validacije u poređenju s logističkom regresijom.
Sljedeći model bio je Support Vector Machine (SVM) , još jedna nadzirana tehnika sposobna za rukovanje i linearnim i nelinearnim odnosima. Ponovo, putem podešavanja hiperparametara, postignuta je tačnost od oko 84,6%, sa ekvivalentnim vrijednostima u unakrsnoj validaciji, što ukazuje na stabilne performanse.
Naivni Bayesov klasifikator , zasnovan na pretpostavci nezavisnosti između karakteristika, također je procijenjen . Uprkos tome što je mnogo jednostavniji model u smislu pretpostavki, njegovi rezultati tačnosti (približno 84,6%) bili su u rangu sa SVM-om i vrlo blizu logističkoj regresiji i KNN-u, što pojačava ideju da se struktura problema dobro uklapa u ovu vrstu probabilističkog pristupa.
Konačno, testirani su modeli zasnovani na stablu odlučivanja. Klasifikator stabla odlučivanja postigao je značajno nižu tačnost, oko 75,4%, a unakrsna validacija potvrdila je ovaj pad performansi, vjerovatno zbog problema s prekomjernim prilagođavanjem. Klasifikator slučajne šume , koji kombinuje mnoga stabla kako bi ublažio ove efekte, značajno se poboljšao, postižući tačnost od oko 84,1% i preko 84% u unakrsnoj validaciji.
Da bi se analiza dovršila, generirana je matrica konfuzije i izvještaj o klasifikaciji za Slučajnu šumu. Model je pokazao odličnu sposobnost identifikacije nepopularnih pjesama (klasa većine), s tačnošću od 0,85 i prisjetljivošću blizu 0,99, dok su njegove performanse u klasi popularnih pjesama (klasa manjine) bile skromnije, s tačnošću od 0,40 i prisjetljivošću od 0,05. Ovo naglašava klasičan izazov neravnoteže klasa u ovoj vrsti problema.
Važnost varijabli: šta je najvažnije pri stvaranju pogotka
Osim što znamo koji je model najtačniji, ključno je razumjeti koje karakteristike zaista pružaju korisne informacije prilikom predviđanja hoće li pjesma biti popularna. U tu svrhu, korišten je XGBoost (XGBClassifier) za dobijanje varijabilnih ocjena važnosti, na osnovu doprinosa svake karakteristike smanjenju grešaka u stablima odlučivanja.
Rezultati su pokazali da se dužina pjesme jasno izdvajala od ostalih , s F ocjenom znatno iznad 400. Ovaj nalaz se uklapa u ideju da kraće pjesme potiču ponovljeno slušanje i stoga akumuliraju više reprodukcija u kraćem vremenu, nešto što Spotifyjev algoritam za preporuke obično nagrađuje.
Na suprotnom kraju spektra, varijable poput tonaliteta, modusa ili osjećaja izvučenog iz samog naslova dobile su ocjene važnosti ispod 50, što ukazuje na to da je njihov doprinos ukupnoj prediktivnoj moći modela bio minimalan. To ne znači da uopće nemaju utjecaja, već da je, u poređenju s drugim karakteristikama, njihova težina mnogo manja.
Preostali audio atributi (kao što su energija, plesnost, valentnost, glasnoća, akustičnost, živost, govornost i instrumentalnost) spadali su u srednji raspon, s F-vrijednostima između 200 i 300, što ukazuje na to da formiraju prilično uravnotežen informacijski blok . Nijedan od njih ne dominira u potpunosti, ali zajedno pomažu u izgradnji prilično tačne slike o šansama pjesme za uspjeh.
Sve u svemu, modeli zasnovani na audio karakteristikama bili su u stanju da predvide sa oko 84-85% tačnosti da li će numera biti među 15% najpopularnijih , što daje određenu empirijsku podršku staroj intuiciji "nauke o hit pjesmama": sa dobrim podacima i odgovarajućim tehnikama, muzički uspeh nije potpuno slučajan, iako i dalje postoji značajna nepredvidiva komponenta.
Slika koju prikazuje ova analiza pokazuje da kombinovanje Spotify podataka, tradicionalne statistike i modela mašinskog učenja omogućava da idemo daleko dalje od pukog brojanja streamova. Razumijevanje uticaja trajanja, energije, valencije i instrumentalnosti, zajedno s ulogom uredničkih plejlista i dinamike preporuka platforme, pruža umjetnicima, izdavačkim kućama i analitičarima vrlo konkretan putokaz za tumačenje zašto određene pjesme postaju hitovi i kako mogu maksimizirati svoje šanse da se pridruže toj odabranoj grupi bez potpunog gubitka ljudskog i kreativnog elementa koji, srećom, ostaje nesvodiv na bilo koju formulu.