- API Spotify предлагает десятки аудио- и контекстных переменных (энергия, валентность, длительность, танцевальность и т. д.), которые позволяют моделировать и понимать, что делает песню популярной.
- Статистический анализ показывает, что почти все аудиохарактеристики различаются между популярными и непопулярными песнями, в то время как жанр, тональность или эмоциональное содержание названия имеют меньшую прогностическую значимость.
- Модели машинного обучения, такие как логистическая регрессия, KNN, SVM, наивный байесовский классификатор и случайный лес, достигают точности около 84–85% при классификации того, войдет ли тема в число 15% самых популярных.
- Длительность трека, его энергетика, громкость и инструментальное исполнение являются ключевыми факторами его популярности на Spotify в экосистеме, где редакционные плейлисты и алгоритмы рекомендаций играют решающую роль.
Spotify стал идеальной лабораторией для изучения того, что делает песню хитом.У нас есть данные о воспроизведении в реальном времени, расширенные метрики для исполнителей и миллионы слушателей, принимающих решения каждую секунду. Spotify — это не просто платформа для прослушивания, а огромная платформа. база данных где можно анализировать закономерности, эмоции, жанры и стратегии составления плейлистов, чтобы понять, почему одни песни становятся популярными, а другие канут в забвение.
В последние годы инструменты, академические исследования и модели машинного обучения посвященный Анализ хитов SpotifyОт изучения редакционных чартов, таких как Today's Top Hits или Rap Caviar, до создания алгоритмов, способных предсказывать, войдет ли трек в самую популярную группу в каталоге. В то же время Spotify for Artists демократизировал доступ к этим показателям, позволяя любому артисту видеть, кто его слушает, где и как его находят, и соответствующим образом корректировать свою творческую и маркетинговую стратегию.
Что именно представляет собой анализ хитов на Spotify и почему это важно?
Когда мы говорим о Анализ хитов Spotify Речь идёт не просто о подсчёте количества прослушиваний песни. Это более широкий подход, сочетающий в себе аудио, контекст и поведение пользователей, чтобы ответить на неудобный, но крайне важный вопрос: можно ли предсказать успех песни до её релиза? Используя данные из API Spotify, исследователи работают с такими переменными, как популярность, энергетика, валентность, продолжительность, темп и танцевальность, чтобы приблизиться к этому ответу.
Этот подход основан на так называемом «Наука о хитовых песнях»Эта идея, популяризированная Майком МакКриди в начале 2000-х годов, предполагает использование алгоритмов и математических моделей для прогнозирования того, какие песни будут хорошо держаться в чартах и на радио. Хотя ранние исследования пришли к выводу, что это очень сложно (и что модели недостаточно точны), ситуация полностью изменилась с появлением стриминга, огромным увеличением объёма данных и усовершенствованием методов машинного обучения.
Сегодня Spotify предлагает API с доступом к десяткам тысяч треков. музыкальные и контекстуальные атрибутыНачиная от тональности и лада и заканчивая вероятностью того, что трек является акустическим или инструментальным, включая метрики, специально разработанные для описания того, как воспринимается песня (энергия, эмоциональное содержание, танцевальность и т. д.). Все это позволяет нам перейти от субъективных мнений к гораздо более точному количественному анализу.
Параллельно с этим, инструмент Spotify для художников Это помогает создателям контента избегать излишней помпезности и сосредоточиться на действительно важных вещах: долгосрочном развитии аудитории, вовлечении, удержании и влиянии маркетинговых усилий на формирование настоящих поклонников. Другими словами, цифры, да, но в контексте и со стратегическим замыслом.
Официальные плейлисты и стратегия: значение редакционных списков
Одним из важнейших элементов любого серьезного анализа хитов на Spotify является роль официальные редакционные плейлистыТакие чарты, как Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint или ¡Viva Latino!, действуют как мощные усилители: попадание в один из них может полностью изменить траекторию развития песни или даже всей карьеры.
Сторонние инструменты, такие как Soundcharts, позволяют вам увидеть как артист ведет себя в этих плейлистахКоличество появлений, продолжительность пребывания, рынки, на которых они оказывают наибольшее влияние и т.д. Этот тип анализа ясно показывает, что присутствие в редакционных списках — это не украшение, а ключевой компонент стратегии роста на платформе.
При составлении качественных плейлистов существуют определенные повторяющиеся критерии. Например, высоко ценится наличие следующих элементов: Разнообразие художников вместо того, чтобы постоянно повторять одни и те же имена.Списки, в которых один и тот же исполнитель появляется слишком часто, как правило, получают более низкие оценки, поскольку это снижает у слушателя ощущение открытия нового.
Также ищу согласованный гендерный балансКогда плейлист смешивает слишком много стилей без четкого направления, опыт Рейтинг становится фрагментированным, и он падает. Наиболее популярные списки, как правило, сосредоточены на одном или нескольких четко определенных жанрах, что помогает пользователю с первого взгляда понять, чего ожидать, нажав кнопку воспроизведения.
Еще одним ключевым аспектом является сочетание хорошо известных и новых темПлейлисты, включающие только самые популярные хиты, хороши, но они мало что могут предложить для новых открытий. Напротив, плейлисты, сочетающие известные песни с менее известными шедеврами, как правило, вызывают больший интерес и способствуют созданию новых хитов.
Наконец, существует определенное согласие в том, что хороший плейлист должен включать в себя как минимум следующее: Около 50 трасс для полноценного игрового опыта.Чарты, содержащие менее 10 песен, часто воспринимаются как слабые и получают более низкие оценки, что также влияет на успех включенных в них треков.
Краткая история Spotify и происхождение его аналитики.
Прежде чем Spotify смог проводить углубленный анализ хитов, самой платформе нужно было найти свое место в музыкальной индустрии. Идея, задуманная соучредителем Даниэлем Эком, возникла после краха Napster в 2002 году. Он хотел создать сервис, который был бы «лучше пиратства, но при этом приносил бы прибыль индустрии».В то время Эк использовал uTorrent, один из крупнейших P2P-клиентов для скачивания и обмена файлами, поэтому он имел непосредственное представление о мире несанкционированного распространения.
После продажи uTorrent компании BitTorrent в конце 2006 года Эк полностью сосредоточился на разработке Spotify. Приложение было официально запущено в Швеции в 2008 году, после достижения определенного уровня популярности. Лицензионные соглашения и соглашения о долевом участии с крупными музыкальными корпорациямиSony Music Entertainment, Universal Music Group и Warner Music Group. Год спустя компания расширила свою деятельность в Великобританию, а в 2011 году вышла на рынок США.
В начальный период число платных подписчиков выросло с примерно 1 миллиона в Европе до приблизительно 4 миллиона человек во всем мире в 2012 годуК 2016 году Spotify уже объявил о 40 миллионах платных пользователей и примерно 100 миллионах пользователей в общей сложности, закрепив за стримингом доминирующую форму потребления музыки во всем мире.
Одновременно с этим начали появляться инструменты обработки данных для художников. Первым был Статистика фанатовЭто решение предоставляло некоторым командам ограниченный доступ к данным о потоковой передаче: демографическим данным, географическому положению и основным тенденциям. В 2017 году это решение трансформировалось в Spotify for Artists, открыв возможность для всех артистов видеть свои ключевые показатели и использовать данные для принятия решений о гастролях, релизах и продвижении.
В 2018 году компания провела первичное публичное размещение акций с рыночной капитализацией приблизительно в 2018 году. 30.000 млн.С тех пор количество рынков, на которых она работает, продолжает расти, а вместе с ним и важность аналитики в рамках платформы. То, что начиналось как лицензированный медиаплеер, превратилось в глобальную инфраструктуру, где данные играют первостепенную роль.
Метрики Spotify: как измерить эффективность песни помимо простого прослушивания.
Для построения моделей прогнозирования попаданий в цель необходимо сначала понять, к какому типу относятся... данные предоставлены API SpotifyНапример, в одном исследовании, посвященном индийскому рынку, из плейлистов, созданных Spotify, было извлечено более 46 000 музыкальных записей, охватывающих широкий спектр жанров и поджанров.
Информация организована в несколько разделов. На уровне трека мы находим такие данные, как... идентификатор, название, исполнитель, популярность, дата выпуска и продолжительность в миллисекундахНа уровне альбома хранятся идентификатор и название. На уровне плейлиста отображаются название, идентификатор, жанр и соответствующий поджанр.
Но наиболее интересным аспектом для анализа попаданий является... аудиофункцииРазделены на различные категории: характеристики «настроения» (танцевательность, энергия, валентность, темп), физические свойства (громкость, речевость, инструментальный характер), контекст (акустические свойства, живость) и музыкальные сегменты (тональность, лад). Каждая из этих переменных тщательно определена и нормализована.
Например, танцевальность выражается значением от 0 до 1, которое суммирует... Насколько легко танцевать под песню?Энергетический уровень, основанный на таких элементах, как ритм, стабильность темпа и сила бита, также варьируется от 0 до 1, пытаясь определить, звучит ли трек интенсивно, быстро и мощно, или же более спокойно или мягко.
Валенсия описывает воспринимаемая эмоциональная «позитивность» В аудиоформате низкие значения соответствуют грустным, напряженным или мрачным чувствам, а высокие — жизнерадостной, светлой или эйфорической музыке. Акустичность измеряет вероятность того, что трек будет акустическим, живость — наличие живой аудитории в записи, а речевость отражает долю произнесенных слов в миксе (очень высокая, например, в подкастах или аудиозаписях с разговорной речью).
К другим важным параметрам относятся темп в BPMОбщая продолжительность, тональность (закодированная в виде целого числа), лад (мажорный или минорный) и популярность трека. Последний показатель является внутренним критерием Spotify и варьируется от 0 до 100. Это зависит как от количества просмотров, так и от того, насколько они свежие.Песня, которая была невероятно популярна много лет назад, но сейчас её почти не играют, со временем увидит, как её рейтинг снизится.
Как подготовить и очистить набор данных, чтобы иметь возможность прогнозировать попадания в цель?
Один из шагов, который часто упускается из виду при обсуждении анализа хитов на Spotify, — это подготовка набора данныхВ данном исследовании данные были собраны с использованием R и RStudio, путем обращения к API Spotify для различных комбинаций рынка (Индия), жанров и поджанров, выбранных в соответствии с их глобальным и локальным значением.
При объединении песен из различных тематических плейлистов часто встречаются повторы, поскольку одна и та же песня может появляться в разных списках. Поскольку целью исследования был не анализ самой стратегии составления плейлистов, а характеристики песен, было определено следующее: Они удалили дублирующиеся дорожки.В результате общее количество уникальных песен сократилось с 46 417 до приблизительно 39 147.
Были удалены столбцы, которые не предполагалось использовать в качестве объясняющих переменных в моделях, такие как исполнитель, идентификатор и название альбома, а также поля, специфичные для плейлистов. Одновременно с этим, Они стандартизировали названия полей. Были скорректированы типы данных: например, популярность, режим, ключ и продолжительность были преобразованы в числовые значения с плавающей запятой для упрощения статистической обработки.
Ключевым решением стало преобразование популярности в более управляемую переменную. Вместо работы с непрерывным значением от 0 до 100, порог для разделения популярных и непопулярных песенИсходя из 85-го процентиля распределения (примерно 65 процентов популярности), треки с рейтингом выше этого значения считались «популярными», а остальные — «непопулярными».
Таким образом, набор данных был разделён на почти 6.000 популярных песен и около 33.000 непопулярных.Для проведения предварительного анализа данные были даже разделены на пять классов популярности (очень высокий, высокий, средний, низкий и очень низкий) с интервалом в 20 баллов, что позволило сравнить тонкие тенденции между уровнями успеха.
Кроме того, на основе названий песен была создана новая переменная: a индикатор настроенияС помощью библиотеки TextBlob в Python была рассчитана полярность каждого заголовка (число от -1 до 1), которая затем была классифицирована как положительная, отрицательная или нейтральная. Это числовое значение было добавлено в датафрейм для изучения того, связана ли тональность заголовка с его популярностью.
Анализ данных: что отличает самые популярные песни?
Перед обучением любой модели машинного обучения крайне важно уделить время этому процессу. визуальный и статистический анализ данныхВ рамках данного исследования были проанализированы кривые распределения, средние значения по группам популярности, а также взаимосвязь между эмоциями и успехом.
Один из поразительных выводов касается популярности самых успешных песен. При анализе треков с рейтингом популярности выше 90 было замечено, что В Валенсии большее число из них имели значение ниже 0,5.Иными словами, их речь звучала более грустно, мрачно или меланхолично, чем весело. Это не было абсолютным доминированием, но тенденция была очевидной.
При построении графика распределения популярности по полу большинство кривых имели следующую форму: приблизительно колоколообразная формаВ целом, в жанрах с низким рейтингом было много треков, а в крайних случаях — меньше. Однако в таких жанрах, как рок, R&B, EDM, мировая и индийская музыка, наблюдалась некоторая асимметрия из-за большого количества треков с нулевой популярностью. В отличие от этого, стили поп, рэп, латиноамериканская и индийская музыка выглядели более сбалансированными и с меньшей концентрацией треков с нулевым рейтингом.
Это говорит о том, что в этих более популярных жанрах, как правило, так и есть. легче достичь определенного уровня популярностидаже если песни не обладают всеми идеальными характеристиками, в то время как в других стилях распределение успеха более поляризовано.
При сравнении средних значений различных характеристик по категориям популярности выявилась очень четкая закономерность: наиболее успешные темы, как правило, имеют большая энергия и большая громкость (воспринимаемая громкость)а также больше инструментальной составляющей и меньше разговорных фраз. Проще говоря, песни, которые лучше всего показывают себя на стриминговых платформах, как правило, более мощные и больше ориентированы на музыку, чем на разговорные слова.
Также было отмечено, что популярные треки представлены в более низкая акустика и более низкая живостьИными словами, они звучат менее «акустически» и менее «живо». Они больше похожи на студийную запись, более отполированы, в них меньше фонового шума и ощущения концерта.
Ещё один важный вывод заключается в том, что популярные песни, как правило, короче непопулярныхВ условиях, когда доход зависит от количества прослушиваний, а алгоритмы поощряют повторы, вполне логично, что более короткие треки быстрее набирают просмотры и становятся более «удобными» для плейлистов.
Что касается воспринимаемого уровня счастья (валентности), то тенденция любопытна: его уровень повышается от низших классов популярности к «высшему» классу, но в самой крайней категории, «очень высокой», наблюдается заметное падение. Другими словами, Сверхпопулярные песни, как правило, звучат грустнее, чем просто "успешные".Это открывает двери для множества интерпретаций общественного вкуса и социально-эмоционального контекста.
Статистический анализ: влияние жанров и аудиохарактеристик
После анализа данных следующим шагом было их применение. формальные статистические тесты Чтобы определить, какие переменные можно считать релевантными для объяснения популярности, был проведен дисперсионный анализ (ANOVA) с использованием девяти основных жанров.
Результаты дисперсионного анализа (ANOVA) показали очень высокое значение F и практически нулевую значимость, что означает, что Существуют статистически значимые различия в популярности между жанрами.Однако этого недостаточно: важно также знать, между какими парами полов наблюдаются эти различия и будет ли эта переменная полезна для прогностической модели.
Поскольку дисперсии были неоднородными, а количество песен в каждом жанре варьировалось, использовалась следующая методика: апостериорный тест Геймса-ХауэллаЭтот анализ позволил проверить, какие комбинации полов не показали существенных различий в популярности, что в целом сделало использование пола в качестве сильного предиктора в моделях машинного обучения менее целесообразным.
Параллельно были проведены следующие работы. независимые t-тесты Для каждой аудиохарактеристики средние значения сравнивались между группой популярных песен и группой непопулярных песен. При уровне значимости 95% было установлено, что почти все переменные (танцевательность, энергия, громкость, акустические качества, живость, длительность, темп, валентность и инструментальное исполнение) показали значительные различия между двумя группами.
Единственным очевидным исключением было красноречиеВ первом тесте разница средних значений не была статистически значимой, но дальнейший анализ показал, что диапазоны речевости для наиболее популярных тем (со значениями от 0,024 до 0,685) попадали в более широкий диапазон менее популярного класса (от 0 до 0,964). Это перекрытие не помешало речевости, при эффективном использовании, вносить вклад в модель, поэтому было решено сохранить ее в качестве предиктора.
В заключение, блок аудиофункций продемонстрировал следующее: четкая описательная способность в отношении популярностиПри этом к гендерному признаку относились более осторожно, и он был исключен из числа основных переменных в некоторых подходах к прогнозированию.
Создание моделей машинного обучения для прогнозирования попаданий в цель.
После очистки набора данных и выбора соответствующих переменных пришло время создать модели бинарной классификации способный предсказывать, входит ли песня в 15% самых популярных. Для этого категориальные переменные key и mode были сначала преобразованы в фиктивные переменные с помощью функции get_dummies из библиотеки Pandas.
После добавления этих фиктивных переменных исходные столбцы для ключа и режима, а также столбец «продолжающаяся популярность» были удалены, а целевая переменная была сохранена. бинарное поле популярности (популярные против непопулярных). Перед обучением моделей все числовые характеристики были стандартизированы с помощью StandardScaler, поскольку они работали в совершенно разных масштабах, и было важно, чтобы они имели сопоставимый вес.
Набор данных был разделён на обучающую и тестовую выборки с помощью функции train_test_split, при этом были зарезервированы следующие данные: 20% регистраций на тестированиеТаким образом удалось избежать утечек информации и гарантировать, что показатели производительности отражают реальную обобщающую способность моделей, а не только их способность запоминать обучающие данные.
Первой примененной моделью была Логистическая регрессияЭтот метод широко используется в бинарной классификации. Была реализована итеративная версия с шагом обучения 0,01 и 200 итерациями, которая была оценена с помощью перекрестной проверки. Средняя точность достигла приблизительно 84,7%, что является замечательно высоким результатом для такой сложной задачи, как прогнозирование успеха в музыке.
Затем алгоритм был протестирован. K-Ближайшие соседи (KNN)который классифицирует каждую песню в соответствии с k ближайшими соседями в пространстве признаков. Корректировка значения ky с помощью поиска по сетке для нахождения оптимальной конфигурации дала очень схожую точность, около 84,8%, с небольшим улучшением показателя перекрестной проверки по сравнению с логистической регрессией.
Следующей моделью была Метод опорных векторов (SVM)Также был использован еще один метод обучения с учителем, способный обрабатывать как линейные, так и нелинейные зависимости. И снова, благодаря подбору гиперпараметров, была достигнута точность около 84,6%, с аналогичными значениями при перекрестной проверке, что указывает на стабильную работу.
Также была проведена оценка следующих показателей: Наивный байесовский классификаторОснованная на гипотезе независимости между признаками, эта модель, несмотря на значительно более простые допущения, показала точность (приблизительно 84,6%), сопоставимую с SVM и очень близкую к логистической регрессии и KNN, что подтверждает идею о том, что структура задачи хорошо подходит для такого рода вероятностного подхода.
Наконец, были протестированы модели, основанные на деревьях решений. Классификатор дерева решений Была достигнута значительно более низкая точность, около 75,4%, и перекрестная проверка подтвердила это снижение производительности, вероятно, из-за проблем с переобучением. Классификатор случайного лесаМетод, объединяющий множество деревьев для сглаживания этих эффектов, значительно улучшил свои показатели, достигнув точности около 84,1% и более 84% при перекрестной проверке.
Для завершения анализа, а Матрица ошибок и отчет о классификации Для алгоритма Random Forest модель продемонстрировала отличную способность идентифицировать непопулярные песни (класс большинства) с точностью 0,85 и полнотой, близкой к 0,99, в то время как ее результаты в классе популярных песен (класс меньшинства) были более скромными, с точностью 0,40 и полнотой 0,05. Это подчеркивает классическую проблему дисбаланса классов в задачах такого типа.
Важность переменных: что имеет наибольший вес при создании хита?
Помимо знания того, какая модель точнее, важно понимать... какие функции действительно предоставляют полезную информацию при прогнозировании популярности песни. Для этой цели использовался алгоритм XGBoost (XGBClassifier) для получения оценок важности переменных, основанных на вкладе каждой характеристики в снижение ошибки в деревьях решений.
Результаты показали, что Продолжительность этой песни явно выделяла её на фоне остальных.с показателем F значительно выше 400. Этот вывод согласуется с идеей о том, что более короткие треки стимулируют повторное прослушивание и, следовательно, накапливают больше прослушиваний за меньшее время, что алгоритм рекомендаций Spotify, как правило, поощряет.
На противоположном полюсе находятся такие переменные, как ключ, режим или ощущение, взятое из названия Они получили оценки важности ниже 50, что говорит о том, что их вклад в общую прогностическую способность модели невелик. Это не означает, что они вообще не оказывают никакого влияния, а скорее, что по сравнению с другими признаками их вес значительно меньше.
Остальные звуковые характеристики (такие как энергия, танцевальность, валентность, громкость, акустика, живость, речевой характер и инструментальность) находились в промежуточном диапазоне с F-баллами от 200 до 300, что указывает на то, что Они образуют достаточно сбалансированный информационный блок.Ни один из них не является абсолютно доминирующим, но все вместе они помогают составить достаточно точную картину шансов песни на успех.
В целом, модели, основанные на аудиохарактеристиках, смогли предсказывать результаты с точностью около Вероятность успеха составит 84-85%, если подсказка войдет в число 15% самых популярных вариантов.Это дает некоторую эмпирическую поддержку старой интуиции «науки о хитах»: при наличии качественных данных и соответствующих методов музыкальный успех не является чисто случайным, хотя значительная доля непредсказуемости все же присутствует.
Результаты этого анализа показывают, что сочетание данных Spotify, традиционной статистики и моделей машинного обучения позволяет нам выйти далеко за рамки простого подсчета прослушиваний. Понимание влияния длительности, энергии, эмоциональной окраски и инструментального характера, а также роли редакционных плейлистов и динамики рекомендаций платформы, предоставляет артистам, лейблам и аналитикам очень конкретную дорожную карту для понимания того, почему определенные песни становятся хитами и как они могут максимизировать свои шансы попасть в эту избранную группу, не теряя при этом человеческий и творческий элемент, который, к счастью, остается не поддающимся какой-либо формуле.