Analiza e hiteve në Spotify: të dhëna, algoritme dhe shkenca e suksesit muzikor

Përditësimi i fundit: Maj 6 2026
  • API-ja e Spotify ofron dhjetëra variabla audio dhe kontekstuale (energji, valencë, kohëzgjatje, vallëzim, etj.) që ju lejojnë të modeloni dhe kuptoni se çfarë e bën një këngë popullore.
  • Analiza statistikore tregon se pothuajse të gjitha karakteristikat audio ndryshojnë midis këngëve popullore dhe jo-popullore, ndërsa zhanri, tonaliteti ose ndjenja e titullit kanë më pak peshë parashikuese.
  • Modelet e të mësuarit automatik si Regresioni Logjistik, KNN, SVM, Naive Bayes dhe Random Forest arrijnë rreth 84–85% saktësi në klasifikimin nëse një temë do të jetë në 15% më të popullarizuarat.
  • Gjatësia e këngës, energjia, zhurma dhe instrumentaliteti i saj dallohen si faktorë kyç në popullaritetin e saj në Spotify, në një ekosistem ku listat editoriale dhe algoritmi i rekomandimeve janë thelbësore.

Analiza e Hit-eve në Spotify

Spotify është bërë laboratori perfekt për të studiuar se çfarë e bën një këngë hitNe kemi të dhëna për luajtjen në kohë reale, metrika të avancuara për artistët dhe miliona dëgjues që marrin vendime çdo sekondë. Larg nga të qenit thjesht një platformë dëgjimi, Spotify është transformuar në një platformë të madhe. Baza e të dhënave ku modelet, emocionet, zhanret dhe strategjitë e listave të këngëve mund të analizohen për të kuptuar pse disa këngë marrin hov dhe të tjerat zhyten në harresë.

Në vitet e fundit, mjetet, kërkimet akademike dhe modelet e mësimit të makinerive dedikuar për Analiza e hitit në SpotifyNga studimi i listave editoriale si Today's Top Hits ose Rap Caviar, deri te ndërtimi i algoritmeve të afta për të parashikuar nëse një këngë do t'i përkasë grupit më të njohur në katalog. Në të njëjtën kohë, Spotify for Artists ka demokratizuar aksesin në këto metrika, duke i lejuar çdo artisti të shohë se kush po i dëgjon, ku dhe si po zbulohen, dhe të përshtasë strategjinë e tij krijuese dhe të marketingut në përputhje me rrethanat.

Çfarë është saktësisht analiza e hiteve në Spotify dhe pse ka rëndësi?

Kur flasim Analiza e hitit në Spotify Nuk po flasim vetëm për të parë sa herë është luajtur një këngë. Është një qasje më e gjerë që kombinon audion, kontekstin dhe sjelljen e përdoruesit për t'iu përgjigjur një pyetjeje të pakëndshme, por thelbësore: a mund ta parashikoni suksesin e një kënge përpara se të publikohet? Duke përdorur të dhëna nga API-ja e Spotify, studiuesit po punojnë me variabla si popullariteti, energjia, valenca, kohëzgjatja, tempo dhe aftësia për të kërcyer për t'iu afruar kësaj përgjigjeje.

Kjo qasje i ka rrënjët në të ashtuquajturën “shkenca e këngëve hit”Kjo ide, e popullarizuar nga Mike McCready në fillim të viteve 2000, përfshin përdorimin e algoritmeve dhe modeleve matematikore për të parashikuar se cilat këngë do të performojnë mirë në top lista dhe radio. Ndërsa studimet e hershme arritën në përfundimin se kjo ishte shumë e vështirë (dhe se modelet nuk ishin mjaftueshëm të sakta), peizazhi ka ndryshuar plotësisht me ardhjen e transmetimit, rritjen masive të vëllimit të të dhënave dhe përsosjen e teknikave të të mësuarit automatik.

Sot, Spotify ofron një API me qasje në dhjetëra mijëra këngë me të. atributet muzikore dhe kontekstualeNga tonaliteti dhe modaliteti, te probabiliteti që një këngë të jetë akustike ose instrumentale, duke përfshirë metrikat e hartuara posaçërisht për të përshkruar se si perceptohet kënga (energjia, valenca, aftësia për të kërcyer, etj.). E gjithë kjo na lejon të kalojmë nga opinionet subjektive në analiza sasiore shumë më të sakta.

Paralelisht, mjeti Spotify për Artistët I ndihmon krijuesit të shmangin humbjen në metrika të kota dhe të përqendrohen në atë që ka vërtet rëndësi: zhvillimin afatgjatë të audiencës, angazhimin, mbajtjen e saj dhe mënyrën se si përpjekjet e marketingut ndikojnë në krijimin e fansave të vërtetë. Me fjalë të tjera, numra, po, por me kontekst dhe qëllim strategjik.

Listat zyrtare të këngëve dhe strategjia: pesha e listave editoriale

Një nga pjesët më të rëndësishme në çdo analizë serioze të klikimeve në Spotify është roli i listat zyrtare të dëgjimit editorialListat si Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint ose ¡Viva Latino! veprojnë si përforcues masivë: hyrja në njërën prej tyre mund ta ndryshojë plotësisht trajektoren e një kënge apo edhe të një karriere.

Mjetet e palëve të treta si Soundcharts ju lejojnë të shihni si sillet një artist në këto lista këngëshNumri i paraqitjeve, kohëzgjatja e qëndrimit, tregjet ku ato kanë ndikimin më të madh, etj. Ky lloj analize e bën të qartë se prania në listat editoriale nuk është një zbukurim, por një komponent kyç i strategjisë së rritjes në platformë.

Ekzistojnë disa kritere të përsëritura në ndërtimin e listave cilësore të këngëve. Për shembull, vlerësohet që të ketë një shumëllojshmëri artistësh në vend që të përsërisin të njëjtat emra vazhdimishtListat ku i njëjti artist shfaqet shumë herë kanë tendencë të marrin vlerësime më të këqija, sepse zvogëlojnë ndjenjën e zbulimit të dëgjuesit.

Gjithashtu duke kërkuar një balanca koherente gjinoreKur një listë këngësh përzien shumë stile pa një drejtim të qartë, përvojë Bëhet i fragmentuar dhe vlerësimi bie. Listat më të perceptuara kanë tendencë të përqendrohen në një ose disa zhanre të përcaktuara mirë, gjë që e ndihmon përdoruesin të kuptojë me një shikim se çfarë të presë kur shtyp butonin "play".

Një aspekt tjetër kyç është një përzierje temash të njohura dhe të rejaListat e këngëve që përfshijnë vetëm hite të mëdha janë në rregull, por ofrojnë pak mundësi për t’u zbuluar. Në të kundërt, listat e këngëve që kombinojnë këngë të njohura me këngë më pak të njohura kanë tendencë të gjenerojnë një angazhim më të madh dhe të ndihmojnë në krijimin e hiteve të reja.

Së fundmi, ekziston një konsensus se një listë e mirë dëgjimi duhet të ketë të paktën rreth 50 pista për të ofruar një përvojë të plotëListat me më pak se 10 këngë shpesh perceptohen si të dobëta dhe marrin rezultate më të ulëta, gjë që ndikon edhe në performancën e këngëve që ato përfshijnë.

Një histori e shkurtër e Spotify dhe origjina e analizave të saj

Përpara se Spotify të mund të kryente analiza të avancuara të hiteve, vetë platforma duhej të gjente vendin e saj në industrinë e muzikës. Ideja, e konceptuar nga bashkëthemeluesi Daniel Ek, lindi pas falimentimit të Napster në vitin 2002. Ai donte të krijonte një shërbim që ishte "më i mirë se pirateria, por që gjithashtu ia kthente fitimet industrisë".Në atë kohë, Ek përdorte uTorrent, një nga klientët kryesorë P2P për shkarkim dhe ndarje, kështu që ai kishte njohuri të drejtpërdrejta për botën e shpërndarjes së paautorizuar.

  Magazinimi i të dhënave për vendimmarrje

Pasi shiti uTorrent te BitTorrent në fund të vitit 2006, Ek u përqendrua tërësisht në ndërtimin e Spotify. Aplikacioni u lançua zyrtarisht në vitin 2008 në Suedi, pasi arriti marrëveshje licencimi dhe pjesëmarrjeje në kapital me korporata të mëdha muzikoreSony Music Entertainment, Universal Music Group dhe Warner Music Group. Një vit më vonë, u zgjerua në Mbretërinë e Bashkuar dhe, në vitin 2011, zbarkoi në Shtetet e Bashkuara.

Në atë periudhë fillestare, baza e abonentëve me pagesë u rrit nga rreth 1 milion në Evropë në afërsisht 4 milionë në nivel global në vitin 2012Deri në vitin 2016, Spotify tashmë njoftonte 40 milionë përdorues me pagesë dhe rreth 100 milionë përdorues gjithsej, duke konsoliduar transmetimin si formën dominuese të konsumit të muzikës në mbarë botën.

Në të njëjtën kohë, filluan të shfaqen mjetet e të dhënave për artistët. E para ishte Njohuri nga tifozëtKjo zgjidhje u ofroi disa ekipeve akses të kufizuar në të dhënat e transmetimit: demografia, gjeografia dhe trendet bazë. Në vitin 2017, kjo zgjidhje evoluoi në Spotify for Artists, duke hapur derën për të gjithë artistët që të shohin metrikat e tyre kryesore dhe të përdorin të dhënat për të marrë vendime në lidhje me turnetë, publikimet dhe promovimin.

Në vitin 2018, kompania u bë publike me një kapitalizim tregu prej afërsisht 30.000 milionëQë atëherë, numri i tregjeve ku operon ka vazhduar të rritet, dhe bashkë me të, rëndësia e analizave brenda platformës. Ajo që filloi si një media player i licencuar është shndërruar në një infrastrukturë globale ku të dhënat mbizotërojnë.

Metrikat e Spotify: si të matni një këngë përtej transmetimeve

Për të ndërtuar modele parashikimi të goditjeve, së pari është e nevojshme të kuptohet se çfarë lloji të dhëna të ofruara nga API-ja e Spotify-tNë një studim të fokusuar në tregun indian, për shembull, më shumë se 46.000 regjistrime këngësh u nxorën nga listat e këngëve të gjeneruara nga Spotify, duke mbuluar një gamë të gjerë zhanresh dhe nënzhanresh.

Informacioni është i organizuar në disa seksione. Në nivelin e pistës, gjejmë të dhëna të tilla si identifikues, titull, artist, popullaritet, datë publikimi dhe kohëzgjatje në milisekondaNë nivelin e albumit, ruhen ID-ja dhe emri. Në nivelin e listës së këngëve, shfaqet emri, ID-ja, zhanri dhe nëngjarja përkatëse.

Por gjëja më interesante për analizën e goditjeve është veçoritë audiotë ndara në kategori të ndryshme: karakteristikat e “gjendjes shpirtërore” (kërcimshmëria, energjia, valenca, tempo), vetitë fizike (fortësia, të folurit, instrumentaliteti), konteksti (akusticiteti, gjallëria) dhe segmentet muzikore (tonaliteti, modaliteti). Secila prej këtyre variablave është përcaktuar dhe normalizuar me kujdes.

Aftësia për të kërcyer, për shembull, shprehet si një vlerë midis 0 dhe 1 që përmbledh Sa e lehtë është të kërcesh me një këngëBazuar në elementë të tillë si ritmi, stabiliteti i tempos dhe forca e rrahjeve, energjia varion gjithashtu nga 0 në 1, duke u përpjekur të kapë nëse kënga tingëllon intensive, e shpejtë dhe e fuqishme, kundrejt diçkaje më të qetë apo më të butë.

Valencia përshkruan "pozitivitet" emocional i perceptuar Në audio, vlerat e ulëta korrespondojnë me ndjenja të trishtueshme, të tensionuara ose të zymta, ndërsa vlerat e larta përputhen me muzikë të gëzueshme, të ndritshme ose euforike. Akusticiteti mat gjasat që një këngë të jetë akustike, gjallëria praninë e një audience të drejtpërdrejtë në regjistrim dhe të folurit pasqyron përqindjen e fjalëve të folura në përzierje (shumë e lartë, për shembull, në podkaste ose këngë me fjalë të folura).

Parametra të tjerë të rëndësishëm janë tempo në BPMkohëzgjatja totale, tonaliteti (i koduar si numër i plotë), modaliteti (major ose minor) dhe popullariteti i këngës. Kjo e fundit është një metrikë e brendshme e Spotify që varion nga 0 në 100. Varet si nga vëllimi i transmetimeve ashtu edhe nga sa të fundit janë atoNjë këngë që ishte shumë e kërkuar vite më parë, por që mezi luhet më, do të shohë rënie të vlerësimit me kalimin e kohës.

Si të përgatitet dhe pastrohet dataset-i për të qenë në gjendje të parashikohen rezultatet

Një hap që shpesh anashkalohet kur diskutohet analiza e hiteve në Spotify është përgatitja e të dhënaveNë studimin në fjalë, të dhënat u mblodhën duke përdorur R dhe RStudio, duke thirrur API-n e Spotify për kombinime të ndryshme të tregut (India), zhanreve dhe nënzhanreve të përzgjedhura sipas peshës së tyre globale dhe lokale.

Kur kombinohen këngë nga lista dëgjimi me tema të ndryshme, është e zakonshme që shumë këngë të përsëriten, sepse e njëjta këngë mund të shfaqet në lista të ndryshme. Meqenëse objektivi nuk ishte të analizohej vetë strategjia e listës së dëgjimit, por karakteristikat e këngëve, ishte Ata hoqën gjurmët e dyfishtaduke e zvogëluar bazën totale nga 46.417 në afërsisht 39.147 këngë unike.

Kolonat që nuk do të përdoreshin si variabla shpjeguese në modele, siç janë artisti, ID-ja dhe emri i albumit, si dhe fushat specifike për listën e këngëve, u hoqën. Në të njëjtën kohë, Ata standardizuan emrat e fushave dhe llojet e të dhënave u rregulluan: për shembull, popullariteti, modaliteti, çelësi dhe kohëzgjatja u konvertuan në vlera numerike të tipit notues për të lehtësuar trajtimin statistikor.

Një vendim kyç ishte transformimi i popullaritetit në një variabël më të menaxhueshëm. Në vend që të punohej me një vlerë të vazhdueshme nga 0 në 100, një pragu për ndarjen e këngëve popullore dhe jopopulloreDuke marrë percentilin e 85-të të shpërndarjes (rreth një popullariteti prej 65), këngët mbi atë vlerë u konsideruan "popullore" dhe pjesa tjetër "jo popullore".

Në këtë mënyrë, të dhënat u ndanë në pothuajse 6.000 këngë të njohura dhe rreth 33.000 këngë jo të njohuraPër analizën eksploruese, të dhënat u segmentuan në pesë klasa popullariteti (shumë e lartë, e lartë, mesatare, e ulët dhe shumë e ulët), me intervale prej 20 pikësh, të cilat lejuan krahasimin e tendencave të imëta midis niveleve të suksesit.

Përveç kësaj, një variabël i ri u gjenerua nga titujt e këngëve: a treguesi i ndjenjësDuke përdorur bibliotekën TextBlob në Python, polariteti i secilit titull (një numër midis -1 dhe 1) u llogarit dhe u klasifikua si pozitiv, negativ ose neutral. Kjo vlerë numerike iu shtua të dhënave për të studiuar nëse toni i titullit është i lidhur me popullaritetin e tij.

  Algoritmi MergeSort në C dhe Java

Eksplorimi i të dhënave: çfarë i dallon këngët më të njohura

Para trajnimit të ndonjë modeli të të mësuarit automatik, është thelbësore t'i kushtoni kohë eksplorim vizual dhe statistikor i të dhënaveNë rastin e këtij studimi, u analizuan kurbat e shpërndarjes, mesataret për grup popullariteti dhe marrëdhëniet midis emocioneve dhe suksesit.

Një nga gjetjet mbresëlënëse lidhet me popullaritetin e këngëve më të suksesshme. Kur u shikuan këngët me një vlerësim popullariteti mbi 90, u vu re se Një numër më i madh i tyre ishin nën vlerën 0,5 në Valencia.Me fjalë të tjera, ato tingëllonin më të trishtuara, më të zymta ose melankolike sesa të gëzuara. Nuk ishte një dominim absolut, por ishte një tendencë e qartë.

Kur u vizatua shpërndarja e popullaritetit sipas gjinisë, shumica e kurbave pranuan një formë e përafërt e kambanësme shumë këngë rreth mesatares dhe më pak në ekstreme. Megjithatë, zhanre si rock, R&B, EDM, muzika botërore dhe indiane treguan njëfarë asimetrie për shkak të një numri të madh këngësh me zero popullaritet. Në të kundërt, stile si pop, rap, latin dhe desi dukeshin më të balancuara dhe me më pak përqendrim të këngëve me zero vlerësim.

Kjo sugjeron që në ato zhanre më të zakonshme është, në përgjithësi, më e lehtë për të arritur një nivel të caktuar popullaritetiedhe nëse këngët nuk i kanë të gjitha karakteristikat ideale, ndërsa në stile të tjera shpërndarja e suksesit është më e polarizuar.

Kur krahasohen mesataret e karakteristikave të ndryshme sipas klasës së popullaritetit, doli në pah një model shumë i qartë: temat më të suksesshme kanë tendencë të kenë energji më e madhe dhe zhurmë më e madhe (vëllim i perceptuar)si dhe më shumë instrumentalizëm dhe më pak ligjërim. Thënë thjesht, këngët që performojnë më mirë në transmetim kanë tendencë të jenë më të fuqishme dhe më të përqendruara te muzika sesa te fjalët e folura.

Gjithashtu u vu re se këngët e njohura kanë... akustikë më e ulët dhe gjallëri më e ulëtMe fjalë të tjera, ato tingëllojnë më pak "akustike" dhe më pak "live". Ato janë më shumë të prodhuara në studio, më të rafinuara, me më pak zhurmë ambienti ose ndjesi koncerti.

Një tjetër gjetje kyçe është se këngët popullore kanë tendencë të jenë më të shkurtër se ato jopopulloreNë një kontekst ku të ardhurat varen nga numri i transmetimeve dhe algoritmet shpërblejnë përsëritjen, ka kuptim që këngët më të shkurtra mund të grumbullojnë luajtje më shpejt dhe të bëhen më "miqësore" për listat e këngëve.

Lidhur me lumturinë e perceptuar (valencën), tendenca është kurioze: nivelet rriten nga klasat e popullaritetit më të ulët në klasën "e lartë", por në kategorinë më ekstreme, atë "shumë të lartë", ka një rënie të dukshme. Me fjalë të tjera, Këngët super të njohura kanë tendencë të tingëllojnë më të trishtueshme sesa ato thjesht "të suksesshme".Kjo hap derën për shumë interpretime rreth shijes publike dhe kontekstit socio-emocional.

Analiza statistikore: ndikimi i zhanreve dhe atributeve audio

Pasi të dhënat u analizuan, hapi tjetër ishte aplikimi i tyre. teste statistikore formale për të parë se cilat variabla mund të konsiderohen të rëndësishme në shpjegimin e popullaritetit. Për të studiuar nëse gjinia ndikoi në sukses, u përdor një analizë e variancës (ANOVA) me nëntë zhanre kryesore.

Rezultati i ANOVA-s dha një vlerë F shumë të lartë dhe një rëndësi praktikisht zero, që do të thotë se Ka dallime statistikisht të rëndësishme në popullaritet midis zhanreveMegjithatë, kjo nuk mjafton: është gjithashtu e rëndësishme të dihet se midis cilave çifte gjinish ndodhin këto ndryshime dhe nëse variabli do të jetë i dobishëm për një model parashikues.

Meqenëse ndryshimet nuk ishin homogjene dhe numri i këngëve për zhanër ndryshonte, u përdor sa vijon: Testi post-hoc i Games-HowellKjo analizë bëri të mundur verifikimin e kombinimeve gjinore që nuk tregonin dallime të konsiderueshme në popullaritet, gjë që, në përgjithësi, e bënte më pak të këshillueshme përdorimin e gjinisë si një parashikues i fortë në modelet e të mësuarit automatik.

Paralelisht, u kryen sa vijon testet t të pavarura Për secilën veçori audio, mesataret u krahasuan midis grupit të këngëve popullore dhe grupit të këngëve jopopullore. Me një nivel rëndësie prej 95%, u zbulua se pothuajse të gjitha variablat (kërcimshmëria, energjia, zhurma, akusticiteti, gjallëria, kohëzgjatja, tempo, valenca dhe instrumentaliteti) treguan ndryshime të rëndësishme midis dy grupeve.

I vetmi përjashtim i dukshëm ishte fjalëshmëriNë testin e parë, ndryshimi në mesatare nuk ishte i rëndësishëm, por analiza e mëtejshme zbuloi se diapazoni i të folurit për temat shumë të njohura (me vlera midis 0,024 dhe 0,685) binte brenda diapazonit më të gjerë të klasës më pak të njohur (midis 0 dhe 0,964). Ky mbivendosje nuk e pengoi të folurit, kur përdorej në mënyrë efektive, të kontribuonte me informacion në model, kështu që u vendos që të ruhej si një parashikues.

Në përmbledhje, blloku i veçorive audio demonstroi një fuqi e qartë përshkruese në lidhje me popullaritetin, ndërsa gjinia u trajtua me më shumë kujdes dhe u përjashtua si një variabël parësor në disa qasje parashikimi.

Ndërtimi i modeleve të të mësuarit automatik për të parashikuar goditjet

Me të dhënat e pastra dhe variablat përkatëse të përzgjedhura, ishte koha për të krijuar modelet e klasifikimit binar i aftë të parashikojë nëse një këngë i përket 15% të popullaritetit më të lartë. Për ta bërë këtë, variablat kategorike key dhe mode u konvertuan së pari në variabla dummy duke përdorur funksionin get_dummies të Pandas.

Pas inkorporimit të këtyre variablave artificialë, kolonat origjinale për çelësin dhe mënyrën, si dhe popullariteti i vazhdueshëm, u hoqën, dhe variabli objektiv u ruajt. fusha binare e popullaritetit (popullore kundrejt jopopullore). Përpara trajnimit të modeleve, të gjitha karakteristikat numerike u standardizuan me StandardScaler, meqenëse ato funksiononin në shkallë shumë të ndryshme dhe ishte e rëndësishme që ato të kishin një peshë të krahasueshme.

Seti i të dhënave u nda në trajnim dhe testim duke përdorur funksionin train_test_split, duke rezervuar 20% e regjistrimeve për testimNë këtë mënyrë, u shmangën rrjedhjet e informacionit dhe u sigurua që metrikat e performancës pasqyronin përgjithësueshmërinë aktuale të modeleve, dhe jo vetëm aftësinë e tyre për të memorizuar të dhënat e trajnimit.

  Binjakët dixhitalë: Inovacioni në epokën dixhitale

Modeli i parë i aplikuar ishte Regresioni logjistikKjo teknikë përdoret gjerësisht në klasifikimin binar. Një version përsëritës me një shkallë mësimi prej 0,01 dhe 200 përsëritjesh u zbatua dhe u vlerësua duke përdorur validimin e kryqëzuar. Saktësia mesatare arriti afërsisht 84,7%, një rezultat jashtëzakonisht i fortë për një problem aq kompleks sa parashikimi i suksesit muzikor.

Pastaj algoritmi u testua K-Fqinjët më të afërt (KNN)i cili klasifikon secilën këngë sipas k fqinjëve më të afërt në hapësirën e karakteristikave. Rregullimi i vlerës së ky duke përdorur Grid Search për të gjetur konfigurimin optimal dha saktësi shumë të ngjashme, rreth 84,8%, me një përmirësim të lehtë në rezultatin e validimit të kryqëzuar krahasuar me regresionin logjistik.

Modeli tjetër ishte Makina Vektoriale Mbështetëse (SVM)U përdor edhe një teknikë tjetër e mbikëqyrur e aftë të trajtojë si marrëdhëniet lineare ashtu edhe ato jolineare. Përsëri, nëpërmjet përshtatjes së hiperparametrave, u arritën saktësi prej rreth 84,6%, me vlera ekuivalente në validimin e kryqëzuar, duke treguar performancë të qëndrueshme.

U vlerësuan gjithashtu edhe sa vijon: Klasifikuesi Naive BayesBazuar në hipotezën e pavarësisë midis karakteristikave. Pavarësisht se është një model shumë më i thjeshtë për sa i përket supozimeve, rezultatet e saktësisë së tij (afërsisht 84,6%) ishin në të njëjtin nivel me SVM dhe shumë afër regresionit logjistik dhe KNN, duke përforcuar idenë se struktura e problemit i përshtatet mirë këtij lloji të qasjes probabilistike.

Së fundmi, u testuan modelet e bazuara në pemë vendimesh. Klasifikuesi i Pemës së Vendimeve Ai arriti një saktësi dukshëm më të ulët, rreth 75,4%, dhe validimi i kryqëzuar e konfirmoi këtë rënie të performancës, ndoshta për shkak të problemeve të mbipërshtatjes. Klasifikuesi i Pyllit të Rastësishëm, i cili kombinon shumë pemë për të zbutur këto efekte, u përmirësua ndjeshëm, duke arritur saktësi rreth 84,1% dhe mbi 84% në validimin e kryqëzuar.

Për të përfunduar analizën, një matrica e konfuzionit dhe një raport klasifikimi për Pyllin e Rastësishëm. Modeli tregoi një aftësi të shkëlqyer për të identifikuar këngët jo-popullore (klasa e shumicës), me një saktësi prej 0,85 dhe një kujtesë afër 0,99, ndërsa performanca e tij në klasën e këngëve popullore (minoritet) ishte më modeste, me një saktësi prej 0,40 dhe një kujtesë prej 0,05. Kjo nxjerr në pah sfidën klasike të çekuilibrit të klasës në këtë lloj problemi.

Rëndësia e variablave: çfarë ka më shumë rëndësi kur krijohet një rezultat

Përtej të diturit se cili model është më i saktë, është thelbësore të kuptohet cilat karakteristika ofrojnë në të vërtetë informacione të dobishme kur parashikohet nëse një këngë do të jetë popullore. Për këtë qëllim, XGBoost (XGBClassifier) ​​​​u përdor për të marrë rezultate të rëndësisë së ndryshueshme, bazuar në kontributin e secilës veçori në reduktimin e gabimeve në pemët e vendimmarrjes.

Rezultatet treguan se Gjatësia e këngës dallohej qartë nga pjesa tjetërme një rezultat F shumë mbi 400. Ky zbulim përputhet me idenë se këngët më të shkurtra inkurajojnë dëgjimin e përsëritur dhe për këtë arsye grumbullojnë më shumë luajtje në më pak kohë, diçka që algoritmi i rekomandimit të Spotify tenton ta shpërblejë.

Në ekstremin e kundërt, variabla të tilla si tonaliteti, modaliteti ose ndjesi e marrë nga titulli Ata morën rezultate rëndësie nën 50, duke sugjeruar që kontributi i tyre në fuqinë e përgjithshme parashikuese të modelit ishte i vogël. Kjo nuk do të thotë që ata nuk kanë asnjë efekt fare, por përkundrazi, krahasuar me karakteristikat e tjera, pesha e tyre është shumë më e vogël.

Atributet e mbetura audio (si energjia, vallëzueshmëria, valenca, zhurma, akusticiteti, gjallëria, të folurit dhe instrumentaliteti) ishin në një diapazon të ndërmjetëm me rezultate F midis 200 dhe 300, duke treguar se Ato formojnë një bllok informacioni mjaft të ekuilibruar.Asnjëra prej tyre nuk dominon plotësisht, por të gjitha së bashku ndihmojnë në ndërtimin e një pamjeje mjaft të saktë të shanseve të suksesit të një kënge.

Në përgjithësi, modelet e bazuara në veçoritë audio ishin në gjendje të parashikonin me rreth një shkallë suksesi prej 84-85% nëse një e dhënë do të ishte pjesë e 15% më të popullarizuarKjo i jep njëfarë mbështetjeje empirike intuitës së vjetër të "shkencës së këngëve hit": me të dhëna të mira dhe teknika të përshtatshme, suksesi muzikor nuk është thjesht i rastësishëm, megjithëse mbetet një komponent i rëndësishëm i paparashikueshëm.

Pamja e krijuar nga kjo analizë tregon se kombinimi i të dhënave të Spotify, statistikave tradicionale dhe modeleve të të mësuarit automatik na lejon të shkojmë shumë më tej se thjesht numërimi i transmetimeve. Të kuptuarit e ndikimit të kohëzgjatjes, energjisë, valencës dhe instrumentalitetit, së bashku me rolin e listave editoriale të këngëve dhe dinamikës së rekomandimeve të platformës, u ofron artistëve, etiketave muzikore dhe analistëve një plan shumë konkret për të interpretuar pse këngë të caktuara bëhen hite dhe si mund t'i maksimizojnë shanset e tyre për t'u bashkuar me atë grup të zgjedhur pa humbur plotësisht elementin njerëzor dhe krijues që, për fat të mirë, mbetet i pareduktueshëm në asnjë formulë.

llojet e inteligjencës artificiale
Artikuj të ngjashëm:
7 Llojet e Inteligjencës Artificiale që do të transformojnë të ardhmen tonë