Аналіз хітів Spotify: дані, алгоритми та наука музичного успіху

Останнє оновлення: Травень 6 2026
Автор: TecnoDigital
  • API Spotify пропонує десятки аудіо- та контекстних змінних (енергія, валентність, тривалість, танцювальність тощо), які дозволяють моделювати та розуміти, що робить пісню популярною.
  • Статистичний аналіз показує, що майже всі аудіохарактеристики відрізняються між популярними та непопулярними піснями, тоді як жанр, тональність чи настрій назви мають меншу прогностичну вагу.
  • Моделі машинного навчання, такі як логістична регресія, KNN, SVM, наївний байєсівський метод та випадковий ліс, досягають точності близько 84–85% у класифікації того, чи буде тема серед 15% найпопулярніших.
  • Тривалість треку, його енергія, гучність та інструментальність є ключовими факторами його популярності на Spotify, в екосистемі, де редакційні плейлисти та алгоритм рекомендацій мають вирішальне значення.

Аналіз хітів Spotify

Spotify став ідеальною лабораторією для вивчення того, що робить пісню хітомУ нас є дані про відтворення в режимі реального часу, розширені показники для виконавців і мільйони слухачів, які приймають рішення щосекунди. Spotify вже не просто платформа для прослуховування, а величезна... база даних де можна проаналізувати патерни, емоції, жанри та стратегії плейлистів, щоб зрозуміти, чому одні пісні стають популярними, а інші кануть у забуття.

В останні роки інструменти, академічні дослідження та моделі машинного навчання присвячений Аналіз хітів SpotifyВід вивчення редакційних чартів, таких як Today's Top Hits або Rap Caviar, до створення алгоритмів, здатних передбачити, чи належатиме трек до найпопулярнішої групи в каталозі. Водночас Spotify for Artists демократизував доступ до цих показників, дозволяючи будь-якому артисту бачити, хто його слухає, де і як його знаходять, і відповідно коригувати свою креативну та маркетингову стратегію.

Що саме таке аналіз відвідувань Spotify і чому це важливо?

Коли ми говоримо Аналіз хітів Spotify Ми говоримо не лише про те, скільки разів було програно пісню. Це ширший підхід, який поєднує аудіо, контекст та поведінку користувача, щоб відповісти на незручне, але важливе питання: чи можна передбачити успіх пісні до її виходу? Використовуючи дані з API Spotify, дослідники працюють з такими змінними, як популярність, енергія, валентність, тривалість, темп і танцювальність, щоб спробувати наблизитися до цієї відповіді.

Цей підхід ґрунтується на т.зв. «Наука про хіти»Ця ідея, популяризована Майком Маккріді на початку 2000-х років, передбачає використання алгоритмів та математичних моделей для прогнозування того, які пісні добре показуватимуть себе в чартах та на радіо. Хоча ранні дослідження показали, що це дуже складно (і що моделі були недостатньо точними), ситуація повністю змінилася з появою потокового передавання, масовим збільшенням обсягів даних та вдосконаленням методів машинного навчання.

Сьогодні Spotify пропонує API з доступом до десятків тисяч треків за допомогою... музичні та контекстуальні атрибутиВід тональності та ладу до ймовірності того, чи є трек акустичним чи інструментальним, включаючи метрики, спеціально розроблені для опису сприйняття пісні (енергія, валентність, танцювальність тощо). Все це дозволяє нам перейти від суб'єктивних думок до набагато точніших кількісних аналізів.

Паралельно, інструмент Spotify для художників Це допомагає творцям не загубитися в марнославних метриках і зосередитися на тому, що дійсно важливо: довгостроковому розвитку аудиторії, залученні, утриманні та тому, як маркетингові зусилля впливають на створення справжніх шанувальників. Іншими словами, цифри, так, але з урахуванням контексту та стратегічного наміру.

Офіційні плейлисти та стратегія: вага редакційних списків

Одним з найважливіших елементів будь-якого серйозного аналізу хітів на Spotify є роль офіційні редакційні плейлистиТакі чарти, як Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint або ¡Viva Latino!, діють як потужні підсилювачі: потрапляння в один із них може повністю змінити траєкторію пісні або навіть кар'єри.

Сторонні інструменти, такі як Soundcharts, дозволяють вам бачити як виконавець поводиться в цих плейлистахКількість появи, тривалість перебування, ринки, де вони мають найбільший вплив тощо. Такий тип аналізу чітко показує, що присутність у редакційних списках — це не прикраса, а ключовий компонент стратегії зростання на платформі.

Існують певні повторювані критерії у створенні якісних плейлистів. Наприклад, цінується наявність різноманітність виконавців замість повторення тих самих імен знову і зновуСписки, де один і той самий виконавець з'являється занадто багато разів, як правило, отримують гірші рейтинги, оскільки вони зменшують відчуття слухача, що він щось відкриває.

Також шукаю узгоджений гендерний балансКоли плейлист змішує забагато стилів без чіткого напрямку, досвід Він стає фрагментованим, і рейтинг падає. Найкраще сприйняті списки, як правило, зосереджені на одному або кількох чітко визначених жанрах, що допомагає користувачеві одразу зрозуміти, чого очікувати, коли він натискає кнопку відтворення.

Іншим ключовим аспектом є поєднання добре відомих та нових темПлейлисти, що містять лише відомі хіти, непогані, але вони мало що можуть дати про себе знати. Натомість, плейлисти, що поєднують відомі пісні з менш відомими хітами, як правило, генерують більшу залученість і допомагають створювати нові хіти.

Зрештою, існує певний консенсус щодо того, що хороший плейлист повинен мати щонайменше близько 50 треків для повного враженняЧарти з менш ніж 10 піснями часто сприймаються як погані та отримують нижчі оцінки, що також впливає на ефективність треків, які вони включають.

Коротка історія Spotify та походження його аналітики

Перш ніж Spotify зміг виконувати розширений аналіз хітів, сама платформа мала знайти своє місце в музичній індустрії. Ідея, запропонована співзасновником Даніелем Еком, виникла після краху Napster у 2002 році. Він хотів створити сервіс, який був би «кращим за піратство, але водночас прибутковим для галузі».У той час Ек керував uTorrent, одним з основних клієнтів для завантаження та обміну P2P, тому він мав незрозумілий досвід у світі несанкціонованого розповсюдження.

  Приклади бінарних дерев у Java: повний посібник

Після продажу uTorrent компанії BitTorrent наприкінці 2006 року, Ек повністю зосередився на створенні Spotify. Додаток був офіційно запущений у 2008 році у Швеції, після досягнення ліцензійні угоди та угоди про участь у капіталі з великими музичними корпораціямиSony Music Entertainment, Universal Music Group та Warner Music Group. Через рік компанія розширила свою діяльність до Великої Британії, а у 2011 році — до Сполучених Штатів.

У цей початковий період база платних абонентів зросла з приблизно 1 мільйона в Європі до приблизно 4 мільйони у світі у 2012 роціДо 2016 року Spotify вже оголошував про 40 мільйонів платних користувачів та близько 100 мільйонів загальних користувачів, що зміцнило стрімінг як домінуючу форму споживання музики в усьому світі.

Водночас почали з'являтися інструменти для роботи з даними для митців. Спочатку це було Статистика шанувальниківЦе рішення пропонувало деяким командам обмежений доступ до потокових даних: демографічних, географічних та основних тенденцій. У 2017 році це рішення перетворилося на Spotify for Artists, відкривши всім артистам можливість бачити свої ключові показники та використовувати дані для прийняття рішень щодо гастролей, релізів та просування.

У 2018 році компанія стала публічною з ринковою капіталізацією приблизно 30.000 млн.Відтоді кількість ринків, де вона працює, продовжує зростати, а разом з цим зростає і важливість аналітики в рамках платформи. Те, що починалося як ліцензований медіаплеєр, перетворилося на глобальну інфраструктуру, де дані панують.

Метрики Spotify: як вимірювати пісню поза межами стрімів

Щоб побудувати моделі прогнозування влучань, спочатку необхідно зрозуміти, який тип дані, надані Spotify APIНаприклад, в одному дослідженні, зосередженому на індійському ринку, зі списків відтворення, згенерованих Spotify, було вилучено понад 46 000 записів пісень, що охоплюють широкий спектр жанрів та піджанрів.

Інформація організована в кілька розділів. На рівні треків ми знаходимо такі дані, як ідентифікатор, назва, виконавець, популярність, дата випуску та тривалість у мілісекундахНа рівні альбому зберігаються ідентифікатор та назва. На рівні списку відтворення відображаються назва, ідентифікатор, жанр та пов’язаний піджанр.

Але найцікавіше для аналізу влучань – це те, аудіофункціїрозділені на різні категорії: характеристики «настрою» (танцювальність, енергія, валентність, темп), фізичні властивості (гучність, мовленнєва здатність, інструментальність), контекст (акустика, жвавість) та музичні сегменти (тональність, лад). Кожна з цих змінних ретельно визначена та нормалізована.

Танцювальність, наприклад, виражається як значення від 0 до 1, яке підсумовує як легко танцювати під піснюЗалежно від таких елементів, як ритм, стабільність темпу та сила удару, енергія також коливається від 0 до 1, намагаючись передати, чи звучить трек інтенсивно, швидко та потужно, чи щось спокійніше чи м'якше.

Валенсія описує, сприйнятий емоційний «позитив» В аудіо низькі значення відповідають сумним, напруженим або похмурим почуттям, тоді як високі значення підходять для веселої, яскравої або ейфоричної музики. Акустичність вимірює ймовірність того, що трек буде акустичним, жвавість – присутність живої аудиторії в записі, а мовленнєва складність відображає частку розмовних слів у міксі (дуже високі, наприклад, у подкастах або треках розмовних слів).

Іншими важливими параметрами є темп у BPMзагальна тривалість, тональність (закодована як ціле число), лад (мажорний чи мінорний) та популярність треку. Остання є внутрішньою метрикою Spotify, яка коливається від 0 до 100. Це залежить як від обсягу потоків, так і від того, наскільки вони нещодавніПісня, яка була дуже популярною багато років тому, але зараз майже не грає, з часом втратить свій рейтинг.

Як підготувати та очистити набір даних для прогнозування результатів

Один крок, який часто ігнорується під час обговорення аналізу переглядів Spotify, це підготовка набору данихУ цьому дослідженні дані були зібрані за допомогою R та RStudio, викликаючи Spotify API для різних комбінацій ринку (Індія), жанрів та піджанрів, відібраних відповідно до їхньої глобальної та локальної ваги.

Під час поєднання пісень з різних тематичних плейлистів часто трапляється, що багато треків повторюються, оскільки одна й та сама пісня може з'являтися в різних списках. Оскільки метою був не аналіз самої стратегії складання плейлистів, а радше характеристики пісень, було Вони видалили дублікати треківзменшивши загальну базу з 46 417 до приблизно 39 147 унікальних пісень.

Стовпці, які не планувалося використовувати як пояснювальні змінні в моделях, такі як виконавець, ідентифікатор та назва альбому, а також поля, специфічні для списку відтворення, були видалені. Водночас, Вони стандартизували назви полів а типи даних були скориговані: наприклад, популярність, режим, ключ і тривалість були перетворені на числові значення типу «float» для полегшення статистичної обробки.

Ключовим рішенням було перетворити популярність на більш керовану змінну. Замість роботи з безперервним значенням від 0 до 100, поріг для розмежування популярних і непопулярних пісеньБеручи 85-й процентиль розподілу (близько популярності 65), треки вище цього значення вважалися «популярними», а решта — «непопулярними».

Таким чином, набір даних було розділено на майже 6.000 популярних пісень та близько 33 000 непопулярнихДля дослідницького аналізу дані були навіть сегментовані на п'ять класів популярності (дуже висока, висока, середня, низька та дуже низька) з інтервалами 20 балів, що дозволило порівняти чіткі тенденції між рівнями успіху.

Крім того, з назв пісень було згенеровано нову змінну: a індикатор настроївЗа допомогою бібліотеки TextBlob у Python було обчислено полярність кожного заголовка (число від -1 до 1) та класифіковано як позитивну, негативну або нейтральну. Це числове значення було додано до фрейму даних, щоб дослідити, чи пов'язаний тон заголовка з його популярністю.

  Бізнес-аналітика: перетворюйте дані на золото для вашої компанії

Дослідження даних: що відрізняє найпопулярніші пісні

Перш ніж навчати будь-яку модель машинного навчання, важливо приділити час візуальне та статистичне дослідження данихУ випадку цього дослідження було проаналізовано криві розподілу, середні значення для кожної групи популярності та взаємозв'язки між емоціями та успіхом.

Один із вражаючих висновків стосується популярності найуспішніших пісень. При розгляді треків з рейтингом популярності вище 90 було помічено, що Більша кількість з них була нижчою за значення 0,5 у Валенсії.Іншими словами, вони звучали скоріше сумно, похмуро чи меланхолійно, ніж весело. Це не було абсолютним домінуванням, але це була чітка тенденція.

Коли було побудовано графік розподілу популярності за статтю, більшість кривих мали приблизна форма дзвоназ багатьма треками приблизно середнього рівня та меншою кількістю на крайніх рівнях. Однак, такі жанри, як рок, R&B, EDM, світ та індійська музика, демонстрували певну асиметрію через велику кількість треків з нульовою популярністю. Натомість, стилі, такі як поп, реп, латино та дезі, виглядали більш збалансованими та з меншою концентрацією треків з нульовим рейтингом.

Це говорить про те, що в цих більш мейнстрімних жанрах це, загалом, легше досягти певного рівня популярностінавіть якщо пісні не мають усіх ідеальних характеристик, тоді як в інших стилях розподіл успіху більш поляризований.

При порівнянні середніх значень різних функцій за класом популярності виявилася дуже чітка закономірність: найуспішніші теми, як правило, мають більша енергія та більша гучність (сприйнятий об'єм)а також більше інструменталізму та менше ораторського мистецтва. Простіше кажучи, пісні, які найкраще прослуховуються в стрімінгу, як правило, потужніші та більше зосереджені на музиці, ніж на розмовних словах.

Також було помічено, що популярні треки містять нижча акустика та нижча жвавістьІншими словами, вони звучать менш «акустично» і менш «живо». Вони більше схожі на студійне звучання, більш відшліфовані, з меншим рівнем навколишнього шуму чи концертного відчуття.

Ще один ключовий висновок полягає в тому, що популярні пісні, як правило, коротші за непопулярніУ контексті, де дохід залежить від кількості стрімів, а алгоритми винагороджують повторення, має сенс, що коротші треки можуть швидше накопичувати прослуховування та ставати більш «дружніми» для плейлистів.

Щодо сприйнятого щастя (валентності), тенденція є цікавою: рівні зростають від нижчих класів популярності до «вищого» класу, але в найекстремальнішій категорії, «дуже високому», спостерігається помітне падіння. Іншими словами, Надзвичайно популярні пісні, як правило, звучать сумніше, ніж просто «успішні».Це відкриває шлях для багатьох інтерпретацій щодо суспільного смаку та соціально-емоційного контексту.

Статистичний аналіз: вплив жанрів та аудіоатрибутів

Після того, як дані були досліджені, наступним кроком було застосування формальні статистичні тести щоб побачити, які змінні можна вважати релевантними для пояснення популярності. Щоб дослідити, чи впливає стать на успіх, було використано дисперсійний аналіз (ANOVA) з дев'ятьма основними жанрами.

Результат дисперсійного аналізу дав дуже високе значення F та практично нульову значущість, що означає, що Існують статистично значущі відмінності в популярності між жанрамиОднак цього недостатньо: важливо також знати, між якими парами статей виникають ці відмінності та чи буде змінна корисною для прогностичної моделі.

Оскільки дисперсії не були однорідними, а кількість пісень у кожному жанрі варіювалася, було використано наступне: Пост-хок тест Games-HowellЦей аналіз дозволив перевірити, які комбінації статей не показали суттєвих відмінностей у популярності, що загалом зробило менш доцільним використовувати стать як сильний предиктор у моделях машинного навчання.

Паралельно було проведено наступне незалежні t-тести Для кожної аудіоознаки порівнювалися середні значення між групою популярних пісень та групою непопулярних пісень. З рівнем значущості 95% було виявлено, що майже всі змінні (танцювальність, енергія, гучність, акустичність, жвавість, тривалість, темп, валентність та інструментальність) показали значну різницю між двома групами.

Єдиним очевидним винятком було красномовствоУ першому тесті різниця в середніх значеннях не була суттєвою, але подальший аналіз показав, що діапазони мовленнєвої активності для дуже популярних тем (зі значеннями від 0,024 до 0,685) потрапляли в ширший діапазон менш популярного класу (від 0 до 0,964). Це перекриття не завадило мовленнєвій активності, за умови її ефективного використання, надавати інформацію моделі, тому було вирішено зберегти її як предиктор.

Підсумовуючи, продемонстровано блок аудіофункцій чітка описова здатність щодо популярності, тоді як стать розглядалася більш обережно та була виключена як основна змінна в деяких підходах до прогнозування.

Створення моделей машинного навчання для прогнозування влучань

Після того, як набір даних був чистим, а відповідні змінні вибрані, настав час створити бінарні моделі класифікації здатний передбачити, чи належить пісня до 15% найпопулярніших. Для цього категоріальні змінні key та mode спочатку були перетворені на фіктивні змінні за допомогою функції get_dummies у Pandas.

Після включення цих фіктивних змінних, оригінальні стовпці для ключа та режиму, а також для постійної популярності були видалені, а цільова змінна збережена. бінарне поле популярності (популярні проти непопулярних). Перед навчанням моделей усі числові характеристики були стандартизовані за допомогою StandardScaler, оскільки вони працювали на дуже різних шкалах, і було важливо, щоб вони мали порівнянну вагу.

Набір даних було розділено на навчальну та тестову частини за допомогою функції train_test_split, резервуючи 20% реєстрацій на тестуванняТаким чином, вдалося уникнути витоку інформації та забезпечити, щоб показники продуктивності відображали фактичну узагальнюваність моделей, а не лише їхню здатність запам'ятовувати навчальні дані.

  Потужний алгоритм сортування за системою радикса

Першою застосованою моделлю була Логістична регресіяЦей метод широко використовується в бінарній класифікації. Ітераційну версію з коефіцієнтом навчання 0,01 та 200 ітераціями було реалізовано та оцінено за допомогою перехресної перевірки. Середня точність досягла приблизно 84,7%, що є надзвичайно високим результатом для такої складної проблеми, як прогнозування музичного успіху.

Потім алгоритм було протестовано K-найближчі сусіди (KNN)який класифікує кожну пісню відповідно до k найближчих сусідів у просторі ознак. Коригування значення ky за допомогою пошуку по сітці для знаходження оптимальної конфігурації дало дуже схожу точність, близько 84,8%, з незначним покращенням показника перехресної перевірки порівняно з логістичною регресією.

Наступною моделлю була Метод опорних векторів (SVM)Також було використано інший метод контролю, здатний обробляти як лінійні, так і нелінійні залежності. Знову ж таки, завдяки гіперпараметричному підбору було досягнуто точності близько 84,6% з еквівалентними значеннями при перехресній перевірці, що свідчить про стабільну продуктивність.

Також було оцінено наступне: Наївний баєсівський класифікаторНа основі гіпотези незалежності між ознаками. Незважаючи на те, що це набагато простіша модель з точки зору припущень, її результати точності (приблизно 84,6%) були на рівні SVM та дуже близькими до логістичної регресії та KNN, що підтверджує ідею про те, що структура проблеми добре підходить для цього типу ймовірнісного підходу.

Нарешті, було протестовано моделі, засновані на деревах рішень. Класифікатор дерева рішень Він досяг значно нижчої точності, близько 75,4%, і перехресна перевірка підтвердила це падіння продуктивності, ймовірно, через проблеми з перенавчанням. Класифікатор випадкового лісу, який поєднує багато дерев для згладжування цих ефектів, значно покращився, досягнувши точності близько 84,1% та понад 84% у перехресній перевірці.

Щоб завершити аналіз, a матриця плутанини та звіт про класифікацію для Випадкового лісу. Модель продемонструвала чудову здатність ідентифікувати непопулярні пісні (клас більшості) з точністю 0,85 та повнотою близькою до 0,99, тоді як її ефективність у класі популярних пісень (меншості) була скромнішою, з точністю 0,40 та повнотою 0,05. Це підкреслює класичну проблему дисбалансу класів у цьому типі задачі.

Важливість змінних: що має найбільше значення при створенні хіта

Окрім знання того, яка модель є точнішою, ключовим є розуміння які функції насправді надають корисну інформацію при прогнозуванні популярності пісні. Для цього було використано XGBoost (XGBClassifier) ​​для отримання змінних оцінок важливості, заснованих на внеску кожної ознаки у зменшення помилок у деревах рішень.

Результати показали, що Тривалість пісні чітко виділялася серед іншихз оцінкою F значно вище 400. Цей висновок узгоджується з ідеєю, що коротші треки заохочують багаторазове прослуховування і, отже, накопичують більше відтворень за менший час, що, як правило, винагороджує алгоритм рекомендацій Spotify.

На протилежному полюсі, такі змінні, як тональність, лад або відчуття, ніби взяте з назви Вони отримали бали важливості нижче 50, що свідчить про те, що їхній внесок у загальну прогностичну силу моделі був невеликим. Це не означає, що вони взагалі не мають жодного впливу, а радше те, що порівняно з іншими ознаками їхня вага набагато менша.

Решта аудіоатрибутів (таких як енергія, танцювальність, валентність, гучність, акустичність, жвавість, мовленнєвість та інструментальність) знаходилися в середньому діапазоні з F-балами від 200 до 300, що вказує на те, що Вони утворюють досить збалансований інформаційний блокЖоден з них не домінує повністю, але всі разом вони допомагають створити досить точну картину шансів пісні на успіх.

Загалом, моделі, засновані на аудіохарактеристиках, змогли передбачити приблизно рівень успіху 84-85%, якщо підказка буде частиною найпопулярніших 15%Це певним чином емпірично підтверджує стару інтуїцію «науки про хіти»: за наявності хороших даних та відповідних методів музичний успіх не є суто випадковим, хоча й залишається значний непередбачуваний компонент.

Картина, отримана в результаті цього аналізу, показує, що поєднання даних Spotify, традиційної статистики та моделей машинного навчання дозволяє нам вийти далеко за рамки простого підрахунку стрімів. Розуміння впливу тривалості, енергії, валентності та інструментальності, а також ролі редакційних плейлистів та динаміки рекомендацій платформи, надає артистам, лейблам та аналітикам дуже конкретну дорожню карту для інтерпретації того, чому певні пісні стають хітами, і як вони можуть максимізувати свої шанси приєднатися до цієї обраної групи, не втрачаючи повністю людського та творчого елементу, який, на щастя, залишається незвідним до жодної формули.

види штучного інтелекту
Пов'язана стаття:
7 типів штучного інтелекту, які змінять наше майбутнє