Анализ на хитовете в Spotify: данни, алгоритми и науката за музикалния успех

Последна актуализация: Май 6 2026
Автор: TecnoDigital
  • API на Spotify предлага десетки аудио и контекстуални променливи (енергия, валентност, продължителност, танцувалност и др.), които ви позволяват да моделирате и разберете какво прави една песен популярна.
  • Статистическият анализ показва, че почти всички аудио характеристики се различават между популярните и непопулярните песни, докато жанрът, тоналността или настроението в заглавието имат по-малка предсказваща тежест.
  • Модели за машинно обучение като логистична регресия, KNN, SVM, наивен байесов модел и случайна гора постигат около 84–85% точност при класифицирането дали дадена тема ще бъде сред 15% от най-популярните.
  • Дължината на песента, нейната енергия, сила на звука и инструменталност се открояват като ключови фактори за популярността ѝ в Spotify, в екосистема, където редакционните плейлисти и алгоритъмът за препоръки са от решаващо значение.

Анализ на посещенията в Spotify

Spotify се превърна в перфектната лаборатория за изучаване на това, което прави една песен хитРазполагаме с данни за възпроизвеждане в реално време, разширени показатели за изпълнителите и милиони слушатели, които вземат решения всяка секунда. Spotify далеч не е просто платформа за слушане, а се е превърнал в огромна... база данни където могат да се анализират модели, емоции, жанрове и стратегии за плейлисти, за да се разбере защо някои песни стават популярни, а други потъват в забрава.

През последните години, инструменти, академични изследвания и модели за машинно обучение посветен Анализ на посещенията в SpotifyОт изучаване на редакционни класации като „Top Hits for Today“ или „Rap Caviar“, до изграждане на алгоритми, способни да предскажат дали дадена песен ще принадлежи към най-популярната група в каталога. В същото време Spotify for Artists демократизира достъпа до тези показатели, позволявайки на всеки изпълнител да види кой го слуша, къде и как бива откриван и съответно да коригира своята творческа и маркетингова стратегия.

Какво точно е анализ на посещенията в Spotify и защо е важен?

Когато говорим за това Анализ на посещенията в Spotify Не говорим само за това колко пъти е била пускана една песен. Това е по-широк подход, който комбинира аудио, контекст и потребителско поведение, за да отговори на един неудобен, но важен въпрос: можете ли да предвидите успеха на една песен, преди да бъде пусната? Използвайки данни от API на Spotify, изследователите работят с променливи като популярност, енергия, валентност, продължителност, темпо и танцувалност, за да се опитат да се доближат до този отговор.

Този подход се корени в т.нар. „наука за хитови песни“Тази идея, популяризирана от Майк Маккрийди в началото на 2000-те, включва използването на алгоритми и математически модели, за да се предскаже кои песни ще се представят добре в класациите и радиото. Докато ранните проучвания заключават, че това е много трудно (и че моделите не са достатъчно точни), пейзажът се промени напълно с появата на стрийминга, огромното увеличение на обема на данните и усъвършенстването на техниките за машинно обучение.

Днес Spotify предлага API с достъп до десетки хиляди песни със своите музикални и контекстуални атрибутиОт тоналността и лада, до вероятността дадена песен да е акустична или инструментална, включително показатели, специално разработени да опишат как се възприема песента (енергия, валентност, танцувалност и др.). Всичко това ни позволява да преминем от субективни мнения към много по-прецизни количествени анализи.

Успоредно с това, инструментът Spotify за художници Това помага на създателите да не се изгубят в суетни показатели и да се съсредоточат върху това, което наистина има значение: дългосрочно развитие на аудиторията, ангажираност, задържане и как маркетинговите усилия влияят върху създаването на истински фенове. С други думи, числа, да, но с контекст и стратегическо намерение.

Официални плейлисти и стратегия: тежестта на редакционните списъци

Един от най-важните елементи във всеки сериозен анализ на хитовете в Spotify е ролята на официални редакционни плейлистиКласации като Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint или ¡Viva Latino! действат като огромни усилватели: попадането в една от тях може напълно да промени траекторията на песента или дори на кариерата.

Инструменти на трети страни, като Soundcharts, ви позволяват да видите как се държи един изпълнител в тези плейлистиБрой появявания, продължителност на престоя, пазари, където имат най-голямо въздействие и т.н. Този тип анализ ясно показва, че присъствието в редакционните списъци не е украшение, а ключов компонент от стратегията за растеж на платформата.

Има определени повтарящи се критерии при изграждането на качествени плейлисти. Например, ценно е, че има разнообразие от изпълнители, вместо да повтарят едни и същи имена отново и отновоСписъците, в които един и същ изпълнител се появява твърде много пъти, обикновено получават по-ниски оценки, защото намаляват чувството на слушателя за откривателство.

Също така търся съгласуван баланс между половетеКогато един плейлист смесва твърде много стилове без ясна посока, Experiencia Става фрагментиран и рейтингът спада. Най-добре възприеманите списъци обикновено се фокусират върху един или няколко добре дефинирани жанра, което помага на потребителя да разбере с един поглед какво да очаква, когато натисне „Пусни“.

Друг ключов аспект е смесица от добре познати и нововъзникващи темиПлейлистите, които включват само големи хитове, са приемливи, но предлагат малко възможности за откриване. За разлика от тях, плейлистите, които комбинират утвърдени песни с по-малко известни шедьоври, обикновено генерират по-голяма ангажираност и помагат за създаването на нови хитове.

Накрая, има известен консенсус, че един добър плейлист трябва да има поне около 50 песни, за да предложат пълноценно изживяванеКласациите с по-малко от 10 песни често се възприемат като лоши и получават по-ниски оценки, което се отразява и на представянето на включените в тях песни.

Кратка история на Spotify и произходът на неговите аналитични инструменти

Преди Spotify да може да извършва разширен анализ на хитовете, самата платформа трябваше да намери своето място в музикалната индустрия. Идеята, замислена от съоснователя Даниел Ек, възниква след краха на Napster през 2002 г. Той искал да създаде услуга, която е „по-добра от пиратството, но която също така да се отплаща на индустрията“.По това време Ек управляваше uTorrent, един от основните P2P клиенти за изтегляне и споделяне, така че имаше познания от първа ръка за света на неоторизираното разпространение.

  Примери за двоични дървета в Java: Пълно ръководство

След като продаде uTorrent на BitTorrent в края на 2006 г., Ек се фокусира изцяло върху изграждането на Spotify. Приложението беше официално пуснато през 2008 г. в Швеция, след като достигна споразумения за лицензиране и дялово участие с големи музикални корпорацииSony Music Entertainment, Universal Music Group и Warner Music Group. Година по-късно се разшири в Обединеното кралство, а през 2011 г. кацна и в Съединените щати.

В този начален период, платената абонатна база нарасна от около 1 милион в Европа до приблизително 4 милиона в световен мащаб през 2012 г.До 2016 г. Spotify вече обявяваше 40 милиона платени потребители и около 100 милиона общо потребители, консолидирайки стрийминга като доминираща форма на потребление на музика в световен мащаб.

По същото време започнаха да се появяват инструменти за данни за творци. Първият беше Прозрения на феноветеТова решение предлагаше на някои екипи ограничен достъп до стрийминг данни: демографски данни, география и основни тенденции. През 2017 г. това решение се превърна в Spotify for Artists, отваряйки вратата за всички артисти да виждат ключовите си показатели и да използват данните, за да вземат решения относно турнета, издания и промоции.

През 2018 г. компанията стана публична с пазарна капитализация от приблизително 30.000 милионаОттогава броят на пазарите, където оперира, продължава да расте, а с това и значението на анализите в платформата. Това, което започна като лицензиран медиен плейър, се превърна в глобална инфраструктура, където данните царуват.

Spotify метрики: как да измерите песен отвъд стриймовете

За да се изградят модели за прогнозиране на попадения, първо е необходимо да се разбере какъв тип данни, предоставени от Spotify APIВ едно проучване, фокусирано върху индийския пазар, например, над 46 000 записа с песни са извлечени от плейлисти, генерирани от Spotify, обхващащи голямо разнообразие от жанрове и поджанрове.

Информацията е организирана в няколко раздела. На ниво трасе намираме данни като идентификатор, заглавие, изпълнител, популярност, дата на издаване и продължителност в милисекундиНа ниво албум се съхраняват идентификаторът и името. На ниво плейлист се показват името, идентификаторът, жанрът и свързаният поджанр.

Но най-интересното нещо за анализа на ударите е аудио функцииразделени на различни категории: характеристики на „настроението“ (танцовост, енергия, валентност, темпо), физически свойства (сила на звука, говорливост, инструменталност), контекст (акустика, жизнерадост) и музикални сегменти (тоналност, лад). Всяка от тези променливи е внимателно дефинирана и нормализирана.

Танцувалността, например, се изразява като стойност между 0 и 1, която обобщава колко лесно е да танцуваш на песенВъз основа на елементи като ритъм, стабилност на темпото и сила на ударите, енергията също варира от 0 до 1, опитвайки се да улови дали песента звучи интензивно, бързо и мощно, спрямо нещо по-спокойно или по-меко.

Валенсия описва, възприемана емоционална „позитивност“ В аудиото ниските стойности съответстват на тъжни, напрегнати или мрачни чувства, докато високите стойности се вписват в весела, светла или еуфорична музика. Акустичността измерва вероятността дадена песен да е акустична, живостта - наличието на жива публика в записа, а речта отразява дела на изговорените думи в микса (много високи, например в подкасти или записи с изговорени думи).

Други важни параметри са темпо в BPMобщата продължителност, тоналността (кодирана като цяло число), ладът (мажор или минор) и популярността на песента. Последната е вътрешен показател на Spotify, който варира от 0 до 100. Зависи както от обема на стриймовете, така и от това колко скорошни са теПесен, която е била много популярна преди години, но почти не се изпълнява вече, ще види как рейтингът ѝ спада с времето.

Как да подготвим и почистим набора от данни, за да можем да предвиждаме попадения

Една стъпка, която често се пренебрегва, когато се обсъжда анализът на посещенията в Spotify, е подготовка на набор от данниВ разглежданото проучване данните са събрани с помощта на R и RStudio, като е извикан Spotify API за различни комбинации от пазар (Индия), жанрове и поджанрове, избрани според тяхната глобална и локална тежест.

Когато се комбинират песни от различни тематични плейлисти, е обичайно много песни да се повтарят, защото една и съща песен може да се появява в различни списъци. Тъй като целта не беше да се анализира самата стратегия за плейлисти, а по-скоро характеристиките на песните, беше Те премахнаха дублиращите се песнинамаляване на общата база от 46 417 до приблизително 39 147 уникални песни.

Колоните, които не е трябвало да се използват като обяснителни променливи в моделите, като например изпълнител, идентификатор и име на албум и специфични за плейлистите полета, бяха премахнати. В същото време, Те стандартизираха имената на полетата и типовете данни бяха коригирани: например, популярността, режимът, ключът и продължителността бяха преобразувани в числови стойности от тип float, за да се улесни статистическата обработка.

Ключово решение беше популярността да се превърне в по-лесно управляема променлива. Вместо да се работи с непрекъсната стойност от 0 до 100, праг за разграничаване на популярни от непопулярни песниВземайки предвид 85-ия персентил от разпределението (около популярност от 65), песните над тази стойност се считат за „популярни“, а останалите – за „непопулярни“.

По този начин наборът от данни беше разделен на почти 6.000 популярни песни и около 33 000 непопулярниЗа проучвателния анализ данните дори бяха сегментирани в пет класа на популярност (много висока, висока, средна, ниска и много ниска), с интервали от 20 точки, което позволи сравняването на фините тенденции между нивата на успех.

Освен това, от заглавията на песните беше генерирана нова променлива: a индикатор за настроенияС помощта на библиотеката TextBlob в Python, полярността на всяко заглавие (число между -1 и 1) беше изчислена и класифицирана като положителна, отрицателна или неутрална. Тази числова стойност беше добавена към базата данни, за да се проучи дали тонът на заглавието е свързан с неговата популярност.

  Бизнес разузнаване: Превърнете данните в злато за вашата компания

Изследване на данни: какво отличава най-популярните песни

Преди да се обучи който и да е модел за машинно обучение, е важно да се отдели време на визуално и статистическо изследване на даннитеВ случая на това изследване бяха анализирани криви на разпределение, средни стойности за група популярност и връзки между емоциите и успеха.

Едно от поразителните открития е свързано с популярността на най-успешните песни. При разглеждане на песни с рейтинг на популярност над 90 се наблюдава, че По-голям брой от тях са били под стойността от 0,5 във ВаленсияС други думи, звучаха по-тъжно, по-мрачно или меланхолично, отколкото весело. Не беше абсолютно доминиране, но беше ясна тенденция.

Когато беше начертано разпределението на популярността по пол, повечето криви приеха приблизителна форма на камбанас много парчета около средното ниво и по-малко в крайностите. Жанрове като рок, R&B, EDM, световна и индийска музика обаче показаха известна асиметрия поради големия брой парчета с нулева популярност. За разлика от тях, стилове като поп, рап, латино и деси изглеждаха по-балансирани и с по-малка концентрация на парчета с нулева оценка.

Това предполага, че в тези по-масови жанрове като цяло е така, по-лесно е да се достигне определено ниво на популярностдори ако песните нямат всички идеални характеристики, докато в други стилове разпределението на успеха е по-поляризирано.

При сравняване на средните стойности на различните функции по клас на популярност се очертава много ясна закономерност: най-успешните теми обикновено имат по-голяма енергия и по-голяма сила на звука (възприемана сила на звука)както и повече инструментализъм и по-малко реч. Казано по-просто, песните, които се представят най-добре при стрийминг, са по-силни и по-фокусирани върху музиката, отколкото върху изговорените думи.

Беше наблюдавано също, че популярните песни включват по-ниска акустика и по-ниска живостС други думи, те звучат по-малко „акустично“ и по-малко „на живо“. Те са по-скоро студийно продуцирани, по-изпипани, с по-малко околни шумове или концертно усещане.

Друго ключово откритие е, че популярните песни са склонни да бъдат по-къси от непопулярнитеВ контекст, където приходите зависят от броя на стриймовете, а алгоритмите възнаграждават повторението, е логично по-кратките песни да натрупват по-бързо възпроизвеждане и да станат по-„приятелски“ настроени за плейлисти.

Що се отнася до възприеманото щастие (валентност), тенденцията е любопитна: нивата се покачват от по-ниските класове на популярност към „горната“ класа, но в най-крайната категория, „много високата“, има забележим спад. С други думи, Суперпопулярните песни са склонни да звучат по-тъжно от просто „успешните“.Това отваря вратата към много интерпретации относно обществения вкус и социално-емоционалния контекст.

Статистически анализ: въздействие на жанрове и аудио атрибути

След като данните бяха проучени, следващата стъпка беше да се приложи формални статистически тестове за да се види кои променливи могат да се считат за релевантни при обяснението на популярността. За да се проучи дали полът е повлиял на успеха, е използван дисперсионен анализ (ANOVA) с девет основни жанра.

Резултатът от ANOVA даде много висока F-стойност и практически нулева значимост, което означава, че Има статистически значими разлики в популярността между жанроветеТова обаче не е достатъчно: важно е също да се знае между кои двойки полове се наблюдават тези разлики и дали променливата ще бъде полезна за предсказващ модел.

Тъй като дисперсиите не бяха хомогенни и броят на песните в различните жанрове варираше, беше използвано следното: Пост-хок тест на Games-HowellТози анализ позволи да се провери кои комбинации от полове не показват значителни разлики в популярността, което като цяло направи по-малко препоръчително използването на пола като силен предиктор в моделите за машинно обучение.

Успоредно с това бяха извършени следните независими t-тестове За всяка аудио характеристика бяха сравнени средните стойности между групата популярни песни и групата непопулярни песни. С ниво на значимост от 95% беше установено, че почти всички променливи (танцувалност, енергия, сила на звука, акустичност, жизненост, продължителност, темпо, валентност и инструменталност) показват значителни разлики между двете групи.

Единственото видимо изключение беше речливостВ първия тест разликата в средните стойности не беше значителна, но по-нататъшен анализ разкри, че диапазоните на речевост за силно популярните теми (със стойности между 0,024 и 0,685) попадат в по-широкия диапазон на по-малко популярния клас (между 0 и 0,964). Това припокриване не попречи на речевостта, когато се използва ефективно, да допринесе с информация за модела, така че беше решено да се запази като предиктор.

В обобщение, блокът с аудио функции демонстрира ясна описателна сила по отношение на популярността, докато полът беше третиран по-предпазливо и беше изключен като основна променлива в някои подходи за прогнозиране.

Изграждане на модели за машинно обучение за прогнозиране на попадения

След като наборът от данни беше чист и съответните променливи бяха избрани, беше време да се създаде бинарни класификационни модели способни да предскажат дали дадена песен принадлежи към топ 15% от популярността. За да се направи това, категоричните променливи key и mode първо бяха преобразувани във фиктивни променливи, използвайки функцията get_dummies на Pandas.

След включването на тези манекени, оригиналните колони за тоналност и режим, както и за продължаваща популярност, бяха премахнати, а целевата променлива беше запазена. бинарно поле на популярността (популярни срещу непопулярни). Преди обучението на моделите, всички числени характеристики бяха стандартизирани със StandardScaler, тъй като те работеха в много различни мащаби и беше важно да имат сравнима тежест.

Наборът от данни беше разделен на тренировъчна и тестова част, използвайки функцията train_test_split, като се запази 20% от регистрациите за тестванеПо този начин се избягваха изтичания на информация и се гарантира, че показателите за производителност отразяват действителната обобщаемост на моделите, а не само способността им да запомнят данни за обучение.

  Мощният алгоритъм за радикално сортиране

Първият приложен модел беше Логистична регресияТази техника се използва широко в двоичната класификация. Беше внедрена и оценена итеративна версия с коефициент на обучение от 0,01 и 200 итерации, използвайки кръстосана валидация. Средната точност достигна приблизително 84,7%, което е забележително силен резултат за толкова сложен проблем, колкото прогнозирането на музикалния успех.

След това алгоритъмът беше тестван K-най-близки съседи (KNN)който класифицира всяка песен според k най-близки съседи в пространството на характеристиките. Коригирането на стойността на ky с помощта на Grid Search за намиране на оптималната конфигурация даде много подобна точност, около 84,8%, с леко подобрение в резултата от кръстосаната валидация в сравнение с логистичната регресия.

Следващият модел беше Машина с опорни вектори (SVM)Използвана е и друга контролирана техника, способна да обработва както линейни, така и нелинейни зависимости. Отново, чрез хиперпараметрично напасване, е постигната точност от около 84,6%, с еквивалентни стойности при кръстосана валидация, което показва стабилна производителност.

Следното също беше оценено: Наивен байесов класификаторБазиран на хипотезата за независимост между характеристиките. Въпреки че е много по-опростен модел по отношение на допусканията, резултатите му за точност (приблизително 84,6%) са наравно с SVM и много близки до логистичната регресия и KNN, което подсилва идеята, че структурата на проблема е подходяща за този тип вероятностен подход.

Накрая бяха тествани модели, базирани на дървета на решенията. Класификатор на дърво на решенията Той постигна значително по-ниска точност, около 75,4%, и кръстосаната валидация потвърди този спад в производителността, вероятно поради проблеми с пренареждането. Класификатор на произволна гора, който комбинира много дървета, за да изглади тези ефекти, се подобри значително, постигайки около 84,1% точност и над 84% при кръстосана валидация.

За да завършите анализа, a матрица на объркване и доклад за класификация за Случайната гора. Моделът показа отлична способност да идентифицира непопулярни песни (клас мнозинство), с точност от 0,85 и извикаемост близка до 0,99, докато представянето му в класа популярни песни (малцинство) беше по-скромно, с точност от 0,40 и извикаемост от 0,05. Това подчертава класическото предизвикателство на дисбаланса в класовете при този тип проблеми.

Значение на променливите: какво е най-важно при създаването на хит

Освен че е важно да се знае кой модел е по-точен, е важно да се разбере кои функции действително предоставят полезна информация при прогнозиране дали дадена песен ще бъде популярна. За тази цел беше използван XGBoost (XGBClassifier), за да се получат променливи оценки за важност, базирани на приноса на всяка характеристика за намаляване на грешките в дърветата на решенията.

Резултатите показаха, че Дължината на песента ясно се открояваше от останалитес F-оценка доста над 400. Това откритие се вписва в идеята, че по-кратките песни насърчават многократното слушане и следователно натрупват повече възпроизвеждания за по-кратко време, нещо, което алгоритъмът за препоръки на Spotify е склонен да възнаграждава.

В противоположния край, променливи като тоналността, режима или чувство, че е откраднато от заглавието Те получиха оценки за важност под 50, което предполага, че приносът им към общата предсказваща сила на модела е малък. Това не означава, че те изобщо нямат ефект, а по-скоро, че в сравнение с други характеристики, тежестта им е много по-малка.

Останалите аудио атрибути (като енергия, танцувалност, валентност, сила на звука, акустичност, жизненост, речевост и инструменталност) бяха в междинен диапазон с F-оценки между 200 и 300, което показва, че Те формират сравнително балансиран информационен блокНито един от тях не доминира напълно, но всички заедно помагат да се изгради сравнително точна картина за шансовете на песента за успех.

Като цяло, моделите, базирани на аудио характеристики, успяха да предскажат с около 84-85% успеваемост, ако дадена улика е част от най-популярните 15%Това дава известна емпирична подкрепа на старата интуиция на „науката за хитовите песни“: с добри данни и подходящи техники, музикалният успех не е чисто случаен, въпреки че остава значителен непредсказуем компонент.

Картината, изрисувана от този анализ, показва, че комбинирането на данни от Spotify, традиционна статистика и модели за машинно обучение ни позволява да отидем далеч отвъд простото броене на стриймове. Разбирането на въздействието на продължителността, енергията, валентността и инструменталността, заедно с ролята на редакционните плейлисти и динамиката на препоръките на платформата, предоставя на изпълнители, звукозаписни компании и анализатори много конкретна пътна карта за тълкуване на това, защо определени песни стават хитове и как могат да увеличат максимално шансовете си да се присъединят към тази избрана група, без напълно да загубят човешкия и творчески елемент, който, за щастие, остава несводим до каквато и да е формула.

видове изкуствен интелект
Свързана статия:
7 вида изкуствен интелект, които ще преобразят нашето бъдеще