„Spotify“ hitų analizė: duomenys, algoritmai ir muzikinės sėkmės mokslas

Paskutiniai pakeitimai: gegužės 6 d. 2026 m.
  • „Spotify“ API siūlo daugybę garso ir konteksto kintamųjų (energijos, valentingumo, trukmės, šokamumo ir kt.), kurie leidžia modeliuoti ir suprasti, kas daro dainą populiarią.
  • Statistinė analizė rodo, kad beveik visos garso ypatybės skiriasi tarp populiarių ir nepopuliarių dainų, o žanras, tonalumas ar pavadinimo nuotaika turi mažesnį prognozavimo svorį.
  • Mašininio mokymosi modeliai, tokie kaip logistinė regresija, KNN, SVM, Naivusis Bajesas ir Atsitiktinis miškas, pasiekia apie 84–85 % tikslumą klasifikuodami, ar tema pateks į 15 % populiariausių.
  • Dainos ilgis, energija, garsumas ir instrumentalumas išsiskiria kaip pagrindiniai veiksniai, lemiantys jos populiarumą „Spotify“ platformoje – ekosistemoje, kurioje redakciniai grojaraščiai ir rekomendacijų algoritmas yra labai svarbūs.

„Spotify“ hitų analizė

„Spotify“ tapo puikia laboratorija tyrinėti, kas dainą paverčia hitu.Turime realaus laiko atkūrimo duomenis, pažangius atlikėjų metrikos duomenis ir milijonus klausytojų, kurie kiekvieną sekundę priima sprendimus. „Spotify“ toli gražu nebėra tik klausymosi platforma, ji virto didžiule... duomenų bazė kur galima analizuoti modelius, emocijas, žanrus ir grojaraščių strategijas, siekiant suprasti, kodėl vienos dainos išpopuliarėja, o kitos nugrimzta į užmarštį.

Pastaraisiais metais įrankiai, akademiniai tyrimai ir mašininio mokymosi modeliai skirta „Spotify“ hitų analizėNuo redakcinių topų, tokių kaip „Today's Top Hits“ ar „Rap Caviar“, analizės iki algoritmų, galinčių numatyti, ar kūrinys priklausys populiariausiai katalogo grupei, kūrimo. Tuo pačiu metu „Spotify for Artists“ demokratizavo prieigą prie šių rodiklių, leisdama bet kuriam atlikėjui matyti, kas jo klausosi, kur ir kaip jis yra atrandamas, ir atitinkamai koreguoti savo kūrybinę ir rinkodaros strategiją.

Kas tiksliai yra „Spotify“ hitų analizė ir kodėl ji svarbi?

Kai mes kalbame apie „Spotify“ hitų analizė Kalbame ne tik apie tai, kiek kartų daina buvo grota. Tai platesnis požiūris, kuris apjungia garso įrašus, kontekstą ir vartotojo elgesį, kad atsakytų į nepatogų, bet esminį klausimą: ar galima numatyti dainos sėkmę prieš ją išleidžiant? Naudodami „Spotify“ API duomenis, tyrėjai dirba su tokiais kintamaisiais kaip populiarumas, energija, valentingumas, trukmė, tempas ir šokio prieinamumas, kad priartėtų prie šio atsakymo.

Šis požiūris yra pagrįstas vadinamuoju „Hitų dainų mokslas“Šią idėją, kurią XXI a. pradžioje išpopuliarino Mike'as McCready, sudaro algoritmų ir matematinių modelių naudojimas siekiant numatyti, kurios dainos gerai pasirodys topuose ir radijuje. Nors ankstyvieji tyrimai parodė, kad tai labai sunku (ir kad modeliai nebuvo pakankamai tikslūs), situacija visiškai pasikeitė atsiradus transliacijoms, smarkiai išaugus duomenų kiekiui ir patobulėjus mašininio mokymosi technikoms.

Šiandien „Spotify“ siūlo API su prieiga prie dešimčių tūkstančių dainų su savo muzikiniai ir kontekstiniai atributaiNuo tonacijos ir modos iki tikimybės, kad kūrinys yra akustinis, ar instrumentinis, įskaitant metrikas, specialiai sukurtas apibūdinti, kaip daina suvokiama (energija, valentingumas, tinkamumas šokti ir kt.). Visa tai leidžia mums pereiti nuo subjektyvių nuomonių prie daug tikslesnių kiekybinių analizių.

Lygiagrečiai, įrankis „Spotify“ menininkams Tai padeda kūrėjams nepasiklysti tuštybės metrikose ir sutelkti dėmesį į tai, kas iš tiesų svarbu: ilgalaikį auditorijos plėtrą, įsitraukimą, išlaikymą ir tai, kaip rinkodaros pastangos veikia tikrų gerbėjų kūrimą. Kitaip tariant, skaičiai – taip, bet su kontekstu ir strateginiais tikslais.

Oficialūs grojaraščiai ir strategija: redakcinių sąrašų svoris

Vienas svarbiausių aspektų atliekant rimtą „Spotify“ hitų analizę yra vaidmuo oficialūs redakciniai grojaraščiaiTokie topai kaip „Discover Weekly“, „Release Radar“, „Today's Top Hits“, „New Music Friday“, „Rap Caviar“, „Mint“ ar „¡Viva Latino!“ veikia kaip didžiuliai stiprintuvai: patekimas į vieną iš jų gali visiškai pakeisti dainos ar net karjeros trajektoriją.

Trečiųjų šalių įrankiai, tokie kaip „Soundcharts“, leidžia matyti kaip atlikėjas elgiasi šiuose grojaraščiuosePasirodymų skaičius, buvimo trukmė, rinkos, kuriose jie daro didžiausią įtaką ir kt. Šio tipo analizė aiškiai parodo, kad buvimas redakciniuose sąrašuose nėra puošmena, o pagrindinė platformos augimo strategijos dalis.

Kuriant kokybiškus grojaraščius, yra tam tikrų pasikartojančių kriterijų. Pavyzdžiui, vertinama, kad yra įvairių atlikėjų, užuot kartojus tuos pačius vardus vėl ir vėlSąrašai, kuriuose tas pats atlikėjas pasirodo per daug kartų, paprastai gauna prastesnius įvertinimus, nes jie sumažina klausytojo atradimo jausmą.

Taip pat ieško nuosekli lyčių pusiausvyraKai grojaraštyje sumaišyta per daug stilių be aiškios krypties, patirtis Jis tampa fragmentiškas ir reitingas krenta. Geriausiai vertinami sąrašai dažniausiai sutelkiami į vieną ar kelis aiškiai apibrėžtus žanrus, o tai padeda vartotojui iš pirmo žvilgsnio suprasti, ko tikėtis paspaudus paleidimo mygtuką.

Kitas svarbus aspektas yra gerai žinomų ir kylančių temų mišinysGrojaraščiai, kuriuose yra tik labai populiarūs hitai, yra gerai, tačiau jie mažai skatina atradimus. Priešingai, grojaraščiai, kuriuose derinamos žinomos dainos su mažiau žinomais perlais, paprastai sukelia didesnį įsitraukimą ir padeda kurti naujus hitus.

Galiausiai, yra tam tikras sutarimas, kad geras grojaraštis turėtų turėti bent apie 50 takelių, kad būtų galima mėgautis visaverčiu potyriuTopai, kuriuose yra mažiau nei 10 dainų, dažnai laikomi prastais ir gauna žemesnius įvertinimus, o tai taip pat turi įtakos juose esančių kūrinių atlikimui.

Trumpa „Spotify“ istorija ir jos analizės kilmė

Prieš tai, kai „Spotify“ galėjo atlikti pažangią hitų analizę, pati platforma turėjo rasti savo vietą muzikos industrijoje. Šią idėją sumanė vienas iš įkūrėjų Danielis Ekas po „Napster“ žlugimo 2002 m. Jis norėjo sukurti paslaugą, kuri būtų „geresnė už piratavimą, bet kartu ir apmokėtų pramonę“.Tuo metu Ekas naudojo „uTorrent“ – vieną iš pagrindinių P2P atsisiuntimo ir bendrinimo klientų, todėl turėjo tiesioginių žinių apie neleistino platinimo pasaulį.

  Dvejetainiai medžiai Java pavyzdžiai: Visas vadovas

2006 m. pabaigoje pardavęs „uTorrent“ bendrovei „BitTorrent“, Ekas visą dėmesį sutelkė į „Spotify“ kūrimą. Programėlė oficialiai buvo pristatyta 2008 m. Švedijoje, pasiekus licencijavimo ir akcijų dalyvavimo sutartys su didelėmis muzikos korporacijomis„Sony Music Entertainment“, „Universal Music Group“ ir „Warner Music Group“. Po metų ji išsiplėtė į Jungtinę Karalystę, o 2011 m. – į Jungtines Amerikos Valstijas.

Per tą pradinį laikotarpį mokamų abonentų bazė išaugo nuo maždaug 1 milijono Europoje iki maždaug 4 milijonai visame pasaulyje 2012 m.Iki 2016 m. „Spotify“ jau skelbė, kad turi 40 milijonų mokančių vartotojų ir apie 100 milijonų iš viso vartotojų, taip įtvirtindama transliacijų srautinį perdavimą kaip dominuojančią muzikos vartojimo formą visame pasaulyje.

Tuo pačiu metu pradėjo atsirasti duomenų įrankiai menininkams. Pirmiausia buvo Gerbėjų įžvalgosŠis sprendimas kai kurioms komandoms suteikė ribotą prieigą prie transliacijos duomenų: demografinių, geografinių ir pagrindinių tendencijų. 2017 m. šis sprendimas išsivystė į „Spotify for Artists“, atvėrusį visiems atlikėjams galimybę matyti savo pagrindinius rodiklius ir naudoti duomenis priimant sprendimus dėl gastrolių, leidinių ir reklamos.

2018 m. bendrovė tapo vieša, o jos rinkos kapitalizacija buvo maždaug 30.000 mlnNuo to laiko rinkų, kuriose ji veikia, skaičius toliau augo, o kartu su juo – ir analizės svarba platformoje. Tai, kas prasidėjo kaip licencijuotas medijos leistuvas, tapo pasauline infrastruktūra, kurioje duomenys yra svarbiausia.

„Spotify“ metrika: kaip išmatuoti dainos vertę ne tik transliacijose

Norint sukurti paspaudimų prognozavimo modelius, pirmiausia reikia suprasti, kokio tipo „Spotify“ API pateikti duomenysPavyzdžiui, viename tyrime, skirtame Indijos rinkai, iš „Spotify“ sugeneruotų grojaraščių buvo ištraukta daugiau nei 46 000 dainų įrašų, apimančių įvairius žanrus ir subžanrus.

Informacija suskirstyta į kelis blokus. Trasos lygmenyje randame tokius duomenis kaip identifikatorius, pavadinimas, atlikėjas, populiarumas, išleidimo data ir trukmė milisekundėmisAlbumo lygmenyje saugomi ID ir pavadinimas. Grojaraščio lygmenyje rodomas pavadinimas, ID, žanras ir susijęs subžanras.

Tačiau įdomiausias dalykas atliekant įvykių analizę yra garso funkcijossuskirstyti į skirtingas kategorijas: „nuotaikos“ charakteristikos (šokamumas, energija, valentingumas, tempas), fizinės savybės (garsumas, kalbumas, instrumentalumas), kontekstas (akustiškumas, gyvumas) ir muzikiniai segmentai (tonacija, modusas). Kiekvienas iš šių kintamųjų yra kruopščiai apibrėžtas ir normalizuotas.

Pavyzdžiui, šokio gebėjimas išreiškiamas reikšme nuo 0 iki 1, kuri apibendrina Kaip lengva šokti pagal dainąRemiantis tokiais elementais kaip ritmas, tempo stabilumas ir takto stiprumas, energija taip pat svyruoja nuo 0 iki 1, bandant užfiksuoti, ar kūrinys skamba intensyviai, greitai ir galingai, ar ramiau ar švelniau.

Valensija apibūdina, suvokiamas emocinis „pozityvumas“ Garso įrašuose žemos vertės atitinka liūdnus, įtemptus ar niūrius jausmus, o aukštos vertės – linksmą, šviesią ar euforišką muziką. Akustiškumas matuoja takelio akustinio skambesio tikimybę, gyvumas – gyvos auditorijos buvimą įraše, o kalbumas atspindi sakytinių žodžių dalį įraše (labai didelė, pavyzdžiui, tinklalaidėse ar sakytinių žodžių takeliuose).

Kiti svarbūs parametrai yra tempas BPMbendrą trukmę, tonaciją (užkoduotą kaip sveikąjį skaičių), modą (pagrindinį ar šalutinį) ir kūrinio populiarumą. Pastarasis yra vidinis „Spotify“ rodiklis, kurio vertė svyruoja nuo 0 iki 100. Tai priklauso ir nuo transliacijų kiekio, ir nuo to, kiek neseniai jos buvo transliuotos.Daina, kuri prieš daugelį metų buvo labai populiari, bet dabar beveik negrojama, laikui bėgant pastebės savo reitingo kritimą.

Kaip paruošti ir išvalyti duomenų rinkinį, kad būtų galima numatyti atitikmenis

Vienas žingsnis, kuris dažnai pamirštamas aptariant „Spotify“ hitų analizę, yra duomenų rinkinio paruošimasŠiame tyrime duomenys buvo renkami naudojant R ir RStudio, iškviečiant „Spotify“ API skirtingiems rinkos (Indija), žanrų ir subžanrų deriniams, atrinktiems pagal jų pasaulinį ir vietinį svorį.

Derinant dainas iš įvairių teminių grojaraščių, dažnai pasitaiko, kad daugelis kūrinių kartojasi, nes ta pati daina gali būti rodoma skirtinguose sąrašuose. Kadangi tikslas buvo ne analizuoti pačią grojaraščio sudarymo strategiją, o dainų charakteristikas, tai buvo Jie pašalino pasikartojančius takeliussumažinant bendrą bazę nuo 46 417 iki maždaug 39 147 unikalių dainų.

Stulpeliai, kurie modeliuose nebuvo naudojami kaip aiškinamieji kintamieji, pvz., atlikėjas, albumo ID ir pavadinimas bei grojaraščiui būdingi laukai, buvo pašalinti. Tuo pačiu metu, Jie standartizavo laukų pavadinimus ir duomenų tipai buvo pakoreguoti: pavyzdžiui, populiarumas, režimas, raktas ir trukmė buvo konvertuoti į slankiojo tipo skaitines reikšmes, kad būtų lengviau atlikti statistinį apdorojimą.

Svarbus sprendimas buvo populiarumą paversti lengviau valdomu kintamuoju. Užuot dirbus su nepertraukiama reikšme nuo 0 iki 100, slenkstis, skiriantis populiarias ir nepopuliarias dainasRemiantis 85-uoju pasiskirstymo procentiliu (apie 65 populiarumo), kūriniai, kurių populiarumas viršija šią vertę, buvo laikomi „populiariais“, o likę – „nepopuliariais“.

Tokiu būdu duomenų rinkinys buvo padalintas į beveik 6.000 populiarių dainų ir apie 33 000 nepopuliarių dainųŽvalgomosios analizės tikslais duomenys netgi buvo suskirstyti į penkias populiarumo klases (labai aukštas, aukštas, vidutinis, žemas ir labai žemas) su 20 balų intervalais, o tai leido palyginti smulkias tendencijas tarp sėkmės lygių.

Be to, iš dainų pavadinimų buvo sugeneruotas naujas kintamasis: a nuotaikų rodiklisNaudojant „TextBlob“ biblioteką „Python“ kalboje, buvo apskaičiuotas kiekvieno pavadinimo poliškumas (skaičius nuo -1 iki 1) ir klasifikuojamas kaip teigiamas, neigiamas arba neutralus. Ši skaitinė reikšmė buvo pridėta prie duomenų rėmelio, siekiant ištirti, ar pavadinimo tonas yra susijęs su jo populiarumu.

  Verslo žvalgyba: paverskite duomenis savo įmonės auksu

Duomenų tyrinėjimas: kuo skiriasi populiariausios dainos?

Prieš apmokant bet kokį mašininio mokymosi modelį, būtina skirti laiko vizualinis ir statistinis duomenų tyrimasŠio tyrimo atveju buvo analizuojamos pasiskirstymo kreivės, vidurkiai pagal populiarumo grupes ir emocijų bei sėkmės ryšiai.

Vienas iš ryškių išvadų susijęs su sėkmingiausių dainų populiarumu. Nagrinėjant kūrinius, kurių populiarumo reitingas viršija 90, pastebėta, kad Didesnis jų skaičius Valensijoje buvo mažesnis nei 0,5.Kitaip tariant, jų balsas skambėjo liūdniau, labiau niūriai ar melancholiškai nei linksmai. Tai nebuvo absoliutus dominavimas, bet tai buvo aiški tendencija.

Kai buvo braižytas populiarumo pasiskirstymas pagal lytį, daugumoje kreivių buvo pasirinkta apytikslė varpo formadaug kūrinių buvo maždaug vidurkio, o kraštutiniuose – mažiau. Tačiau tokie žanrai kaip rokas, R&B, EDM, world ir indiška muzika demonstravo tam tikrą asimetriją dėl didelio skaičiaus kūrinių, kurie nebuvo populiarūs. Priešingai, tokie stiliai kaip pop, repas, Lotynų Amerikos ir desi muzika atrodė labiau subalansuoti ir juose buvo mažiau kūrinių, kuriems nebuvo suteiktas populiarumas.

Tai rodo, kad tuose labiau paplitusiuose žanruose apskritai yra lengviau pasiekti tam tikrą populiarumo lygįnet jei dainos neturi visų idealių savybių, o kituose stiliuose sėkmės pasiskirstymas yra labiau poliarizuotas.

Lyginant skirtingų funkcijų vidurkius pagal populiarumo klasę, išryškėjo labai aiškus modelis: sėkmingiausios temos paprastai turi didesnė energija ir didesnis garsumas (suvokiamas garsumas)taip pat daugiau instrumentalizmo ir mažiau kalbėjimo. Paprastai tariant, dainos, kurios geriausiai transliuojamos internetu, paprastai yra galingesnės ir labiau orientuotos į muziką, o ne į žodžius.

Taip pat pastebėta, kad populiariuose kūriniuose yra mažesnis akustinis pajėgumas ir mažesnis gyvumasKitaip tariant, jie skamba mažiau „akustiškai“ ir mažiau „gyvai“. Jie labiau sukurti studijoje, labiau išbaigti, juose mažiau aplinkos triukšmo ar koncertinio pojūčio.

Dar viena svarbi išvada yra ta, kad populiarios dainos paprastai yra trumpesni nei nepopuliarūsKontekste, kai pajamos priklauso nuo srautų skaičiaus, o algoritmai apdovanoja už kartojimą, logiška, kad trumpesni kūriniai gali greičiau surinkti perklausų skaičių ir tapti „draugiškesni“ grojaraščiams.

Kalbant apie suvokiamą laimę (valentiškumą), tendencija įdomi: lygis kyla nuo žemesnio populiarumo klasių iki „aukštesnio“ lygio, tačiau kraštutinėje kategorijoje – „labai aukšto“ – pastebimas ryškus kritimas. Kitaip tariant, Labai populiarios dainos paprastai skamba liūdniau nei tiesiog „sėkmingos“.Tai atveria duris daugeliui interpretacijų apie visuomenės skonį ir socialinį-emocinį kontekstą.

Statistinė analizė: žanrų ir garso atributų poveikis

Kai duomenys buvo išnagrinėti, kitas žingsnis buvo taikyti formalūs statistiniai testai siekiant išsiaiškinti, kurie kintamieji galėtų būti laikomi svarbiais paaiškinant populiarumą. Norint ištirti, ar lytis turėjo įtakos sėkmei, buvo taikyta dispersinė analizė (ANOVA) su devyniais pagrindiniais žanrais.

ANOVA rezultatas parodė labai didelę F reikšmę ir praktiškai nulinį reikšmingumą, o tai reiškia, kad Žanrų populiarumas statistiškai reikšmingai skiriasiTačiau to nepakanka: taip pat svarbu žinoti, tarp kurių lyčių porų šie skirtumai atsiranda ir ar kintamasis bus naudingas prognozavimo modeliui.

Kadangi dispersijos nebuvo vienodos ir dainų skaičius pagal žanrą skyrėsi, buvo naudojamas toks metodas: Games-Howell post-hoc testasŠi analizė leido patikrinti, kurie lyčių deriniai neparodė reikšmingų populiarumo skirtumų, todėl apskritai mašininio mokymosi modeliuose lytį naudoti kaip stiprų prognozavimo veiksnį buvo mažiau patartina.

Lygiagrečiai buvo atlikti šie darbai nepriklausomi t-testai Kiekvienam garso elementui buvo palyginti populiarių dainų ir nepopuliarių dainų grupių vidurkiai. Esant 95 % reikšmingumo lygiui, nustatyta, kad beveik visi kintamieji (šokamumas, energija, garsumas, akustiškumas, gyvumas, trukmė, tempas, valentingumas ir instrumentiškumas) parodė reikšmingus skirtumus tarp dviejų grupių.

Vienintelė akivaizdi išimtis buvo kalbumasPirmajame teste vidurkių skirtumas nebuvo reikšmingas, tačiau tolesnė analizė parodė, kad labai populiarių temų kalbėjimo diapazonai (kurių vertės buvo nuo 0,024 iki 0,685) pateko į platesnį mažiau populiarios klasės diapazoną (nuo 0 iki 0,964). Šis sutapimas nesutrukdė kalbėjimui, kai jis buvo naudojamas efektyviai, prisidėti prie modelio informacijos, todėl buvo nuspręsta jį išlaikyti kaip prognozavimo veiksnį.

Apibendrinant, garso funkcijų blokas pademonstravo aiški aprašomoji galia, susijusi su populiarumu, o lytis buvo vertinama atsargiau ir kai kuriuose prognozavimo metoduose nebuvo laikoma pagrindiniu kintamuoju.

Mašininio mokymosi modelių kūrimas, siekiant numatyti įvykius

Sutvarkius duomenų rinkinį ir pasirinkus atitinkamus kintamuosius, atėjo laikas sukurti dvejetainiai klasifikavimo modeliai galintis nuspėti, ar daina priklauso 15 % populiariausių dainų sąrašo. Tam kategoriniai kintamieji „key“ ir „mode“ pirmiausia buvo paversti fiktyviais kintamaisiais naudojant „Pandas“ funkciją „get_dummies“.

Įtraukus šiuos fiktyvius kintamuosius, buvo pašalinti originalūs rakto ir režimo stulpeliai, taip pat ir nuolatinio populiarumo stulpelis, o tikslinis kintamasis buvo išsaugotas. dvejetainis populiarumo laukas (populiarūs ir nepopuliarūs). Prieš apmokant modelius, visos skaitinės savybės buvo standartizuotos naudojant „StandardScaler“, nes jos veikė labai skirtingose ​​skalėse ir buvo svarbu, kad jos turėtų palyginamą svorį.

Duomenų rinkinys buvo padalintas į mokymo ir testavimo duomenų rinkinius naudojant funkciją „train_test_split“, rezervuojant 20 % registracijų testavimuiTokiu būdu buvo išvengta informacijos nutekėjimo ir užtikrinta, kad našumo rodikliai atspindėtų tikrąjį modelių apibendrinamumą, o ne tik jų gebėjimą įsiminti mokymo duomenis.

  Galingas radikso rūšiavimo algoritmas

Pirmasis pritaikytas modelis buvo Logistinė regresijaŠi technika plačiai naudojama dvejetainėje klasifikacijoje. Buvo įdiegta ir kryžminiu patvirtinimu įvertinta iteracinė versija su 0,01 mokymosi greičiu ir 200 iteracijų. Vidutinis tikslumas siekė maždaug 84,7 % – tai nepaprastai geras rezultatas tokiai sudėtingai problemai kaip muzikinės sėkmės prognozavimas.

Tada buvo išbandytas algoritmas K-Artimiausi kaimynai (KNN)kuris klasifikuoja kiekvieną dainą pagal k artimiausių kaimynų požymių erdvėje. Koreguojant ky reikšmę naudojant tinklelio paiešką optimaliai konfigūracijai, gautas labai panašus tikslumas – apie 84,8 %, o kryžminio patvirtinimo balas šiek tiek pagerėjo, palyginti su logistine regresija.

Kitas modelis buvo Atramos vektoriaus mašina (SVM)Taip pat buvo panaudota kita prižiūrima technika, galinti apdoroti tiek tiesinius, tiek netiesinius ryšius. Vėlgi, pritaikius hiperparametrus, buvo pasiektas maždaug 84,6 % tikslumas, o kryžminio patvirtinimo metu gautos lygiavertės vertės, rodančios stabilų veikimą.

Taip pat buvo įvertinta: Naivusis Bajeso klasifikatoriusRemiantis požymių nepriklausomumo hipoteze. Nepaisant to, kad tai daug paprastesnis modelis prielaidų atžvilgiu, jo tikslumo rezultatai (maždaug 84,6 %) buvo tokie patys kaip SVM ir labai artimi logistinei regresijai bei KNN, o tai sustiprina mintį, kad problemos struktūra gerai tinka tokio tipo tikimybiniam metodui.

Galiausiai buvo išbandyti modeliai, pagrįsti sprendimų medžiais. Sprendimų medžio klasifikatorius Jis pasiekė žymiai mažesnį tikslumą, apie 75,4 %, o kryžminis patvirtinimas patvirtino šį našumo sumažėjimą, greičiausiai dėl per didelio pritaikymo problemų. Atsitiktinis miškų klasifikatorius, kuris sujungia daug medžių, kad išlygintų šiuos efektus, žymiai pagerėjo, pasiekdamas apie 84,1 % tikslumą ir daugiau nei 84 % kryžminio patvirtinimo tikslumą.

Norint užbaigti analizę, a. painiavos matrica ir klasifikavimo ataskaita „Atsitiktinių miškų“ modeliui. Modelis puikiai atpažino nepopuliarias dainas (daugumos klasė) – 0,85 tikslumu ir artimu 0,99 atkūrimo rodikliu, o populiarių dainų klasėje (mažumos) jo rezultatai buvo kuklesni – 0,40 tikslumu ir 0,05 atkūrimo rodikliu. Tai pabrėžia klasikinį klasės disbalanso iššūkį sprendžiant šio tipo problemas.

Kintamųjų svarba: kas svarbiausia kuriant įvykį

Be to, kad žinotume, kuris modelis yra tikslesnis, svarbu suprasti kurios funkcijos iš tikrųjų teikia naudingos informacijos prognozuojant, ar daina bus populiari. Šiuo tikslu buvo naudojamas „XGBoost“ (XGBClassifier) ​​​​kintamųjų svarbos balų gavimui, remiantis kiekvieno požymio indėliu į klaidų mažinimą sprendimų medžiuose.

Rezultatai parodė, kad Dainos ilgis akivaizdžiai išsiskyrė iš kitųsu F balu, gerokai viršijančiu 400. Šis atradimas atitinka idėją, kad trumpesni kūriniai skatina pakartotinį klausymąsi ir todėl per trumpesnį laiką sukaupia daugiau perklausų, o „Spotify“ rekomendacijų algoritmas linkęs už tai apdovanoti.

Priešingoje pusėje tokie kintamieji kaip raktas, režimas arba jausmas paimtas iš pavadinimo Jų gauti svarbos balai buvo mažesni nei 50, o tai rodo, kad jų indėlis į bendrą modelio prognozavimo galią buvo mažas. Tai nereiškia, kad jie visiškai neturi jokio poveikio, o veikiau, palyginti su kitais požymiais, jų svoris yra daug mažesnis.

Likę garso atributai (pvz., energija, šokamumas, valentingumas, garsumas, akustiškumas, gyvumas, kalbingumas ir instrumentalumas) buvo tarpiniame diapazone, o F balai buvo nuo 200 iki 300, o tai rodo, kad Jie sudaro gana subalansuotą informacijos blokąNei vienas iš jų visiškai nedominuoja, bet visi kartu padeda susidaryti gana tikslų vaizdą apie dainos sėkmės galimybes.

Apskritai, modeliai, pagrįsti garso savybėmis, galėjo numatyti maždaug 84–85 % sėkmės rodiklis, jei užuomina būtų viena iš 15 % populiariausiųTai suteikia tam tikrą empirinį pagrindą senai „hitų mokslo“ intuicijai: turint gerus duomenis ir taikant tinkamus metodus, muzikinė sėkmė nėra visiškai atsitiktinė, nors išlieka reikšmingas nenuspėjamumo komponentas.

Šios analizės nupieštas vaizdas rodo, kad derinant „Spotify“ duomenis, tradicinę statistiką ir mašininio mokymosi modelius, galime žengti daug toliau nei vien tik skaičiuoti srautus. Supratimas apie trukmės, energijos, valentingumo ir instrumentalumo poveikį, kartu su redakcinių grojaraščių vaidmeniu ir platformos rekomendacijų dinamika, suteikia atlikėjams, įrašų kompanijoms ir analitikams labai konkretų veiksmų planą, kaip interpretuoti, kodėl tam tikros dainos tampa hitais ir kaip jie gali maksimaliai padidinti savo galimybes prisijungti prie tos atrinktos grupės, visiškai neprarandant žmogiškojo ir kūrybinio elemento, kuris, laimei, lieka neapibrėžtas jokia formule.

dirbtinio intelekto rūšys
Susijęs straipsnis:
7 dirbtinio intelekto tipai, kurie pakeis mūsų ateitį