Ανάλυση επιτυχιών στο Spotify: δεδομένα, αλγόριθμοι και η επιστήμη της μουσικής επιτυχίας

Τελευταία ενημέρωση: Μάιος 6 του 2026
Συγγραφέας: TecnoDigital
  • Το Spotify API προσφέρει δεκάδες μεταβλητές ήχου και περιβάλλοντος (ενέργεια, σθένος, διάρκεια, χορευτική ικανότητα κ.λπ.) που σας επιτρέπουν να μοντελοποιήσετε και να κατανοήσετε τι κάνει ένα τραγούδι δημοφιλές.
  • Η στατιστική ανάλυση δείχνει ότι σχεδόν όλα τα ηχητικά χαρακτηριστικά διαφέρουν μεταξύ δημοφιλών και μη δημοφιλών τραγουδιών, ενώ το είδος, η τονικότητα ή η αίσθηση του τίτλου έχουν μικρότερο προγνωστικό βάρος.
  • Τα μοντέλα μηχανικής μάθησης όπως η Λογιστική Παλινδρόμηση, το KNN, το SVM, το Naive Bayes και το Random Forest επιτυγχάνουν ακρίβεια περίπου 84–85% στην ταξινόμηση του εάν ένα θέμα θα βρίσκεται στο κορυφαίο 15% των πιο δημοφιλών.
  • Η διάρκεια του κομματιού, η ενέργειά του, η ένταση και η ορχηστρική του υπόσταση ξεχωρίζουν ως βασικοί παράγοντες της δημοτικότητάς του στο Spotify, σε ένα οικοσύστημα όπου οι λίστες αναπαραγωγής των συντακτών και ο αλγόριθμος προτάσεων είναι κρίσιμοι.

Ανάλυση Επιτυχιών στο Spotify

Το Spotify έχει γίνει το τέλειο εργαστήριο για να μελετήσει κανείς τι κάνει ένα τραγούδι επιτυχίαΈχουμε δεδομένα αναπαραγωγής σε πραγματικό χρόνο, προηγμένες μετρήσεις για καλλιτέχνες και εκατομμύρια ακροατές που λαμβάνουν αποφάσεις κάθε δευτερόλεπτο. Το Spotify, αντί να είναι απλώς μια πλατφόρμα ακρόασης, έχει μετατραπεί σε μια τεράστια... βάση δεδομένων όπου τα μοτίβα, τα συναισθήματα, τα είδη και οι στρατηγικές για τις λίστες αναπαραγωγής μπορούν να αναλυθούν για να κατανοηθεί γιατί κάποια τραγούδια απογειώνονται και άλλα βυθίζονται στη λήθη.

Τα τελευταία χρόνια, τα εργαλεία, η ακαδημαϊκή έρευνα και μοντέλα μηχανικής μάθησης αφιερωμένη στην Ανάλυση επιτυχιών στο SpotifyΑπό τη μελέτη συντακτικών charts όπως τα Today's Top Hits ή το Rap Caviar, μέχρι την κατασκευή αλγορίθμων ικανών να προβλέψουν εάν ένα κομμάτι θα ανήκει στην πιο δημοφιλή ομάδα στον κατάλογο. Ταυτόχρονα, το Spotify for Artists έχει εκδημοκρατικοποιήσει την πρόσβαση σε αυτές τις μετρήσεις, επιτρέποντας σε κάθε καλλιτέχνη να βλέπει ποιος το ακούει, πού και πώς το ανακαλύπτουν, και να προσαρμόζει ανάλογα τη δημιουργική και εμπορική του στρατηγική.

Τι ακριβώς είναι η ανάλυση επισκέψεων στο Spotify και γιατί είναι σημαντική;

Όταν μιλάμε Ανάλυση επιτυχιών στο Spotify Δεν μιλάμε μόνο για το πόσες φορές έχει παιχτεί ένα τραγούδι. Είναι μια ευρύτερη προσέγγιση που συνδυάζει τον ήχο, το πλαίσιο και τη συμπεριφορά των χρηστών για να απαντήσει σε ένα άβολο αλλά κρίσιμο ερώτημα: μπορείτε να προβλέψετε την επιτυχία ενός τραγουδιού πριν κυκλοφορήσει; Χρησιμοποιώντας δεδομένα από το API του Spotify, οι ερευνητές εργάζονται με μεταβλητές όπως η δημοτικότητα, η ενέργεια, το σθένος, η διάρκεια, ο ρυθμός και η χορευτική ικανότητα για να προσπαθήσουν να πλησιάσουν σε αυτήν την απάντηση.

Αυτή η προσέγγιση έχει τις ρίζες της στο λεγόμενο «επιστήμη των επιτυχημένων τραγουδιών»Αυτή η ιδέα, που διαδόθηκε από τον Mike McCready στις αρχές της δεκαετίας του 2000, περιλαμβάνει τη χρήση αλγορίθμων και μαθηματικών μοντέλων για την πρόβλεψη ποια τραγούδια θα έχουν καλή απόδοση στα charts και στο ραδιόφωνο. Ενώ οι πρώτες μελέτες κατέληξαν στο συμπέρασμα ότι αυτό ήταν πολύ δύσκολο (και ότι τα μοντέλα δεν ήταν αρκετά ακριβή), το τοπίο έχει αλλάξει εντελώς με την έλευση του streaming, την τεράστια αύξηση του όγκου δεδομένων και τη βελτίωση των τεχνικών μηχανικής μάθησης.

Σήμερα, το Spotify προσφέρει ένα API με πρόσβαση σε δεκάδες χιλιάδες κομμάτια με το μουσικά και συμφραζόμενα χαρακτηριστικάΑπό την κλίμακα και τη λειτουργία, μέχρι την πιθανότητα ένα κομμάτι να είναι ακουστικό ή ορχηστρικό, συμπεριλαμβανομένων μετρήσεων ειδικά σχεδιασμένων για να περιγράψουν πώς γίνεται αντιληπτό το τραγούδι (ενέργεια, σθένος, χορευτική ικανότητα, κ.λπ.). Όλα αυτά μας επιτρέπουν να περάσουμε από τις υποκειμενικές απόψεις σε πολύ πιο ακριβείς ποσοτικές αναλύσεις.

Παράλληλα, το εργαλείο Spotify για καλλιτέχνες Βοηθά τους δημιουργούς να αποφεύγουν να χάνονται σε μετρήσεις ματαιοδοξίας και να επικεντρώνονται σε αυτό που πραγματικά έχει σημασία: τη μακροπρόθεσμη ανάπτυξη κοινού, την αλληλεπίδραση, τη διατήρηση και τον τρόπο με τον οποίο οι προσπάθειες μάρκετινγκ επηρεάζουν τη δημιουργία γνήσιων θαυμαστών. Με άλλα λόγια, αριθμοί, ναι, αλλά με βάση το πλαίσιο και τη στρατηγική πρόθεση.

Επίσημες λίστες αναπαραγωγής και στρατηγική: το βάρος των συντακτικών λιστών

Ένα από τα πιο σημαντικά κομμάτια σε κάθε σοβαρή ανάλυση των επισκέψεων στο Spotify είναι ο ρόλος του επίσημες λίστες αναπαραγωγής συντακτώνCharts όπως τα Discover Weekly, Release Radar, Today's Top Hits, New Music Friday, Rap Caviar, Mint ή ¡Viva Latino! λειτουργούν ως τεράστιοι ενισχυτές: η συμμετοχή σε ένα από αυτά μπορεί να αλλάξει εντελώς την πορεία ενός τραγουδιού ή ακόμα και μιας καριέρας.

Εργαλεία τρίτων όπως το Soundcharts σάς επιτρέπουν να δείτε πώς συμπεριφέρεται ένας καλλιτέχνης σε αυτές τις λίστες αναπαραγωγήςΑριθμός εμφανίσεων, διάρκεια παραμονής, αγορές όπου έχουν τη μεγαλύτερη απήχηση, κ.λπ. Αυτού του είδους η ανάλυση καθιστά σαφές ότι η παρουσία στις λίστες συντακτών δεν αποτελεί στολίδι, αλλά βασικό στοιχείο της στρατηγικής ανάπτυξης στην πλατφόρμα.

Υπάρχουν ορισμένα επαναλαμβανόμενα κριτήρια στη δημιουργία ποιοτικών λιστών αναπαραγωγής. Για παράδειγμα, εκτιμάται ότι υπάρχουν μια ποικιλία καλλιτεχνών αντί να επαναλαμβάνουμε τα ίδια ονόματα ξανά και ξανάΟι λίστες όπου ο ίδιος καλλιτέχνης εμφανίζεται πάρα πολλές φορές τείνουν να λαμβάνουν χειρότερες βαθμολογίες, επειδή μειώνουν την αίσθηση ανακάλυψης του ακροατή.

Ψάχνω επίσης για ένα συνεκτική ισορροπία των φύλωνΌταν μια λίστα αναπαραγωγής συνδυάζει πάρα πολλά στυλ χωρίς σαφή κατεύθυνση, το εμπειρία Γίνεται κατακερματισμένη και η βαθμολογία μειώνεται. Οι λίστες με την καλύτερη αντίληψη τείνουν να επικεντρώνονται σε ένα ή σε μερικά σαφώς καθορισμένα είδη, κάτι που βοηθά τον χρήστη να καταλάβει με μια ματιά τι να περιμένει όταν πατήσει το play.

Μια άλλη βασική πτυχή είναι η ένα μείγμα γνωστών και αναδυόμενων θεμάτωνΟι λίστες αναπαραγωγής που περιλαμβάνουν μόνο μεγάλες επιτυχίες είναι καλές, αλλά προσφέρουν ελάχιστα στον τρόπο ανακάλυψης. Αντίθετα, οι λίστες αναπαραγωγής που συνδυάζουν καθιερωμένα τραγούδια με λιγότερο γνωστά διαμάντια τείνουν να δημιουργούν μεγαλύτερη αλληλεπίδραση και να βοηθούν στη δημιουργία νέων επιτυχιών.

Τέλος, υπάρχει κάποια συναίνεση ότι μια καλή λίστα αναπαραγωγής θα πρέπει να έχει τουλάχιστον περίπου 50 πίστες για να προσφέρουν μια ολοκληρωμένη εμπειρίαΤα charts με λιγότερα από 10 τραγούδια συχνά θεωρούνται κακά και λαμβάνουν χαμηλότερες βαθμολογίες, κάτι που επηρεάζει και την απόδοση των κομματιών που περιλαμβάνουν.

Μια σύντομη ιστορία του Spotify και η προέλευση των αναλυτικών στοιχείων του

Προτού το Spotify μπορέσει να πραγματοποιήσει προηγμένη ανάλυση επιτυχιών, η ίδια η πλατφόρμα έπρεπε να βρει τη θέση της στη μουσική βιομηχανία. Η ιδέα, που συνέλαβε ο συνιδρυτής Daniel Ek, προέκυψε μετά την κατάρρευση του Napster το 2002. Ήθελε να δημιουργήσει μια υπηρεσία που θα ήταν «καλύτερη από την πειρατεία, αλλά που θα πλήρωνε και τον κλάδο».Εκείνη την εποχή, ο Ek έτρεχε το uTorrent, έναν από τους σημαντικότερους πελάτες λήψης και κοινής χρήσης P2P, επομένως είχε άμεση γνώση του κόσμου της μη εξουσιοδοτημένης διανομής.

  Επαγγελματική πορεία για να γίνεις Μηχανικός Δεδομένων

Αφού πούλησε το uTorrent στην BitTorrent στα τέλη του 2006, ο Ek επικεντρώθηκε αποκλειστικά στην κατασκευή του Spotify. Η εφαρμογή κυκλοφόρησε επίσημα το 2008 στη Σουηδία, αφού έφτασε στο... συμφωνίες αδειοδότησης και συμμετοχής στο μετοχικό κεφάλαιο με μεγάλες μουσικές εταιρείεςSony Music Entertainment, Universal Music Group και Warner Music Group. Ένα χρόνο αργότερα, επεκτάθηκε στο Ηνωμένο Βασίλειο και, το 2011, προσγειώθηκε στις Ηνωμένες Πολιτείες.

Σε αυτήν την αρχική περίοδο, η βάση συνδρομητών επί πληρωμή αυξήθηκε από περίπου 1 εκατομμύριο στην Ευρώπη σε περίπου 4 εκατομμύρια παγκοσμίως το 2012Μέχρι το 2016, το Spotify ανακοίνωνε ήδη 40 εκατομμύρια χρήστες επί πληρωμή και περίπου 100 εκατομμύρια συνολικούς χρήστες, εδραιώνοντας το streaming ως την κυρίαρχη μορφή κατανάλωσης μουσικής παγκοσμίως.

Ταυτόχρονα, άρχισαν να εμφανίζονται εργαλεία δεδομένων για καλλιτέχνες. Το πρώτο ήταν Πληροφορίες θαυμαστώνΑυτή η λύση προσέφερε σε ορισμένες ομάδες περιορισμένη πρόσβαση σε δεδομένα ροής: δημογραφικά στοιχεία, γεωγραφία και βασικές τάσεις. Το 2017, αυτή η λύση εξελίχθηκε στο Spotify for Artists, ανοίγοντας την πόρτα σε όλους τους καλλιτέχνες να δουν τις βασικές τους μετρήσεις και να χρησιμοποιήσουν τα δεδομένα για να λαμβάνουν αποφάσεις σχετικά με περιοδείες, κυκλοφορίες και προώθηση.

Το 2018, η εταιρεία εισήχθη στο χρηματιστήριο με κεφαλαιοποίηση αγοράς περίπου 30.000 εκατομμύριαΈκτοτε, ο αριθμός των αγορών όπου δραστηριοποιείται συνεχίζει να αυξάνεται, και μαζί με αυτόν, η σημασία των αναλυτικών στοιχείων εντός της πλατφόρμας. Αυτό που ξεκίνησε ως ένα αδειοδοτημένο πρόγραμμα αναπαραγωγής πολυμέσων έχει γίνει μια παγκόσμια υποδομή όπου τα δεδομένα κυριαρχούν.

Μετρήσεις Spotify: πώς να μετρήσετε ένα τραγούδι πέρα ​​από τις ροές

Για να δημιουργήσουμε μοντέλα πρόβλεψης επιτυχιών, είναι πρώτα απαραίτητο να κατανοήσουμε τι είδους δεδομένα που παρέχονται από το API του SpotifyΣε μια μελέτη που επικεντρώθηκε στην ινδική αγορά, για παράδειγμα, περισσότερα από 46.000 αρχεία τραγουδιών εξήχθησαν από λίστες αναπαραγωγής που δημιουργήθηκαν από το Spotify, καλύπτοντας μια μεγάλη ποικιλία ειδών και υποείδων.

Οι πληροφορίες είναι οργανωμένες σε διάφορες ενότητες. Σε επίπεδο διαδρομής, βρίσκουμε δεδομένα όπως αναγνωριστικό, τίτλος, καλλιτέχνης, δημοτικότητα, ημερομηνία κυκλοφορίας και διάρκεια σε χιλιοστά του δευτερολέπτουΣε επίπεδο άλμπουμ, αποθηκεύονται το αναγνωριστικό και το όνομα. Σε επίπεδο λίστας αναπαραγωγής, εμφανίζονται το όνομα, το αναγνωριστικό, το είδος και το σχετικό υποείδος.

Αλλά το πιο ενδιαφέρον πράγμα για την ανάλυση επιτυχιών είναι το χαρακτηριστικά ήχουχωρίζονται σε διαφορετικές κατηγορίες: χαρακτηριστικά «διάθεσης» (χορευτική ικανότητα, ενέργεια, σθένος, τέμπο), φυσικές ιδιότητες (ένταση, ομιλία, οργανικότητα), συμφραζόμενα (ακουστικότητα, ζωντάνια) και μουσικά τμήματα (κλάση, τρόπος). Κάθε μία από αυτές τις μεταβλητές ορίζεται και κανονικοποιείται προσεκτικά.

Η ικανότητα χορού, για παράδειγμα, εκφράζεται ως μια τιμή μεταξύ 0 και 1 που συνοψίζει πόσο εύκολο είναι να χορέψεις με ένα τραγούδιΜε βάση στοιχεία όπως ο ρυθμός, η σταθερότητα του τέμπο και η δύναμη του ρυθμού, η ενέργεια κυμαίνεται επίσης από 0 έως 1, προσπαθώντας να αποτυπώσει αν το κομμάτι ακούγεται έντονο, γρήγορο και δυνατό, σε αντίθεση με κάτι πιο ήρεμο ή πιο απαλό.

Η Βαλένθια περιγράφει το αντιληπτή συναισθηματική «θετικότητα» Στον ήχο, οι χαμηλές τιμές αντιστοιχούν σε θλιβερά, τεταμένα ή μελαγχολικά συναισθήματα, ενώ οι υψηλές τιμές ταιριάζουν με χαρούμενη, φωτεινή ή ευφορική μουσική. Η ακουστικότητα μετρά την πιθανότητα ένα κομμάτι να είναι ακουστικό, η ζωντάνια την παρουσία ενός ζωντανού κοινού στην ηχογράφηση και η ομιλία αντικατοπτρίζει την αναλογία των προφορικών λέξεων στο μείγμα (πολύ υψηλή, για παράδειγμα, σε podcast ή κομμάτια προφορικών λέξεων).

Άλλες σημαντικές παράμετροι είναι η τέμπο σε BPMη συνολική διάρκεια, η κλίμακα (κωδικοποιημένη ως ακέραιος αριθμός), η λειτουργία (μείζον ή ελάσσονα) και η δημοτικότητα του κομματιού. Η τελευταία είναι μια εσωτερική μέτρηση του Spotify που κυμαίνεται από 0 έως 100. Εξαρτάται τόσο από τον όγκο των ροών όσο και από το πόσο πρόσφατες είναιΈνα τραγούδι που ήταν πολύ δημοφιλές πριν από χρόνια, αλλά σπάνια παίζεται πια, θα δει την τηλεθέασή του να μειώνεται με την πάροδο του χρόνου.

Πώς να προετοιμάσετε και να καθαρίσετε το σύνολο δεδομένων για να μπορείτε να προβλέψετε επισκέψεις

Ένα βήμα που συχνά παραβλέπεται όταν συζητάμε την ανάλυση επισκέψεων στο Spotify είναι το προετοιμασία συνόλου δεδομένωνΣτην παρούσα μελέτη, τα δεδομένα συλλέχθηκαν χρησιμοποιώντας R και RStudio, καλώντας το Spotify API για διαφορετικούς συνδυασμούς αγοράς (Ινδία), ειδών και υποείδων που επιλέχθηκαν ανάλογα με το παγκόσμιο και τοπικό τους βάρος.

Όταν συνδυάζετε τραγούδια από διάφορες θεματικές λίστες αναπαραγωγής, είναι σύνηθες να επαναλαμβάνονται πολλά κομμάτια, επειδή το ίδιο τραγούδι μπορεί να εμφανίζεται σε διαφορετικές λίστες. Δεδομένου ότι ο στόχος δεν ήταν να αναλυθεί η ίδια η στρατηγική της λίστας αναπαραγωγής, αλλά μάλλον τα χαρακτηριστικά των τραγουδιών, ήταν Αφαίρεσαν τα διπλότυπα κομμάτιαμειώνοντας τη συνολική βάση από 46.417 σε περίπου 39.147 μοναδικά τραγούδια.

Οι στήλες που δεν επρόκειτο να χρησιμοποιηθούν ως επεξηγηματικές μεταβλητές στα μοντέλα, όπως ο καλλιτέχνης, το αναγνωριστικό και το όνομα του άλμπουμ, καθώς και τα πεδία που αφορούν συγκεκριμένες λίστες αναπαραγωγής, αφαιρέθηκαν. Ταυτόχρονα, Τυποποίησαν τα ονόματα των πεδίων και οι τύποι δεδομένων προσαρμόστηκαν: για παράδειγμα, η δημοτικότητα, η λειτουργία, το κλειδί και η διάρκεια μετατράπηκαν σε αριθμητικές τιμές τύπου float για να διευκολυνθεί η στατιστική επεξεργασία.

Μια βασική απόφαση ήταν να μετατραπεί η δημοτικότητα σε μια πιο διαχειρίσιμη μεταβλητή. Αντί να δουλεύουμε με μια συνεχή τιμή από 0 έως 100, ένα όριο για τον διαχωρισμό δημοφιλών και μη δημοφιλών τραγουδιώνΛαμβάνοντας υπόψη το 85ο εκατοστημόριο της κατανομής (γύρω στο 65% δημοτικότητα), τα κομμάτια πάνω από αυτήν την τιμή θεωρήθηκαν «δημοφιλή» και τα υπόλοιπα «όχι δημοφιλή».

Με αυτόν τον τρόπο, το σύνολο δεδομένων χωρίστηκε σε σχεδόν 6.000 δημοφιλή τραγούδια και περίπου 33.000 μη δημοφιλήΓια την διερευνητική ανάλυση, τα δεδομένα χωρίστηκαν σε πέντε κατηγορίες δημοτικότητας (πολύ υψηλή, υψηλή, μέτρια, χαμηλή και πολύ χαμηλή), με διαστήματα 20 βαθμών, γεγονός που επέτρεψε τη σύγκριση λεπτομερών τάσεων μεταξύ των επιπέδων επιτυχίας.

Επιπλέον, δημιουργήθηκε μια νέα μεταβλητή από τους τίτλους των τραγουδιών: a δείκτης συναισθήματοςΧρησιμοποιώντας τη βιβλιοθήκη TextBlob σε Python, υπολογίστηκε η πολικότητα κάθε τίτλου (ένας αριθμός μεταξύ -1 και 1) και ταξινομήθηκε ως θετική, αρνητική ή ουδέτερη. Αυτή η αριθμητική τιμή προστέθηκε στο dataframe για να μελετηθεί εάν ο τόνος του τίτλου συνδέεται με τη δημοτικότητά του.

  Το μοντέλο GPT-5 στην επιστημονική έρευνα: χρήσεις, πρόοδοι και περιορισμοί

Εξερεύνηση δεδομένων: τι διακρίνει τα πιο δημοφιλή τραγούδια

Πριν από την εκπαίδευση οποιουδήποτε μοντέλου μηχανικής μάθησης, είναι απαραίτητο να αφιερώσετε χρόνο στο οπτική και στατιστική εξερεύνηση των δεδομένωνΣτην περίπτωση αυτής της μελέτης, αναλύθηκαν οι καμπύλες κατανομής, οι μέσοι όροι ανά ομάδα δημοτικότητας και οι σχέσεις μεταξύ συναισθημάτων και επιτυχίας.

Ένα από τα εντυπωσιακά ευρήματα σχετίζεται με τη δημοτικότητα των πιο επιτυχημένων τραγουδιών. Όταν εξετάσαμε κομμάτια με βαθμολογία δημοτικότητας άνω του 90, παρατηρήθηκε ότι Ένας μεγαλύτερος αριθμός από αυτούς ήταν κάτω από την τιμή του 0,5 στη Βαλένθια.Με άλλα λόγια, ακουγόντουσαν πιο θλιμμένα, πιο μελαγχολικά ή πιο σκυθρωπά παρά χαρούμενα. Δεν ήταν απόλυτη κυριαρχία, αλλά ήταν μια σαφής τάση.

Όταν σχεδιάστηκε η κατανομή της δημοτικότητας ανά φύλο, οι περισσότερες καμπύλες υιοθέτησαν μια κατά προσέγγιση σχήμα καμπάναςμε πολλά κομμάτια γύρω στον μέσο όρο και λιγότερα στα άκρα. Ωστόσο, είδη όπως η ροκ, η R&B, η EDM, η παγκόσμια και η ινδική μουσική παρουσίασαν κάποια ασυμμετρία λόγω του μεγάλου αριθμού κομματιών με μηδενική δημοτικότητα. Αντίθετα, στυλ όπως η ποπ, η ραπ, η λάτιν και η ντεσί εμφανίστηκαν πιο ισορροπημένα και με λιγότερη συγκέντρωση κομματιών με μηδενική βαθμολογία.

Αυτό υποδηλώνει ότι σε αυτά τα πιο mainstream είδη είναι, γενικά, πιο εύκολο να επιτευχθεί ένα ορισμένο επίπεδο δημοτικότηταςακόμη και αν τα τραγούδια δεν έχουν όλα τα ιδανικά χαρακτηριστικά, ενώ σε άλλα στυλ η κατανομή της επιτυχίας είναι πιο πολωμένη.

Κατά τη σύγκριση των μέσων όρων των διαφόρων χαρακτηριστικών ανά κατηγορία δημοτικότητας, προέκυψε ένα πολύ σαφές μοτίβο: τα πιο επιτυχημένα θέματα τείνουν να έχουν μεγαλύτερη ενέργεια και μεγαλύτερη ένταση (αντιληπτή ένταση)καθώς και περισσότερη οργανική μουσική και λιγότερη ομιλία. Με απλά λόγια, τα τραγούδια που αποδίδουν καλύτερα στο streaming τείνουν να είναι πιο δυνατά και να επικεντρώνονται περισσότερο στη μουσική παρά στα λόγια.

Παρατηρήθηκε επίσης ότι τα δημοφιλή κομμάτια διαθέτουν χαμηλότερη ακουστικότητα και χαμηλότερη ζωντάνιαΜε άλλα λόγια, ακούγονται λιγότερο «ακουστικά» και λιγότερο «ζωντανά». Είναι περισσότερο παραγόμενα σε στούντιο, πιο στιλβωμένα, με λιγότερο θόρυβο περιβάλλοντος ή αίσθηση συναυλίας.

Ένα άλλο βασικό εύρημα είναι ότι τα δημοφιλή τραγούδια τείνουν να είναι πιο κοντοί από τους μη δημοφιλείςΣε ένα πλαίσιο όπου τα έσοδα εξαρτώνται από τον αριθμό των streams και οι αλγόριθμοι ανταμείβουν την επανάληψη, είναι λογικό τα μικρότερα κομμάτια να μπορούν να συσσωρεύουν αναπαραγωγές πιο γρήγορα και να γίνονται πιο «φιλικά» για λίστες αναπαραγωγής.

Όσον αφορά την αντιληπτή ευτυχία (valence), η τάση είναι περίεργη: τα επίπεδα αυξάνονται από τις χαμηλότερες τάξεις δημοτικότητας στην «ανώτερη» τάξη, αλλά στην πιο ακραία κατηγορία, την «πολύ υψηλή», υπάρχει μια αξιοσημείωτη πτώση. Με άλλα λόγια, Τα υπερ-δημοφιλή τραγούδια τείνουν να ακούγονται πιο θλιβερά από τα απλώς «επιτυχημένα».Αυτό ανοίγει την πόρτα σε πολλές ερμηνείες σχετικά με το δημόσιο γούστο και το κοινωνικοσυναισθηματικό πλαίσιο.

Στατιστική ανάλυση: επίδραση των ειδών και των ηχητικών χαρακτηριστικών

Αφού εξερευνήθηκαν τα δεδομένα, το επόμενο βήμα ήταν η εφαρμογή τους επίσημες στατιστικές δοκιμές για να διαπιστωθεί ποιες μεταβλητές θα μπορούσαν να θεωρηθούν σχετικές με την εξήγηση της δημοτικότητας. Για να μελετηθεί εάν το φύλο επηρέασε την επιτυχία, χρησιμοποιήθηκε μια ανάλυση διακύμανσης (ANOVA) με εννέα κύρια είδη.

Το αποτέλεσμα της ANOVA απέδωσε πολύ υψηλή τιμή F και πρακτικά μηδενική σημαντικότητα, πράγμα που σημαίνει ότι Υπάρχουν στατιστικά σημαντικές διαφορές στη δημοτικότητα μεταξύ των ειδώνΩστόσο, αυτό δεν είναι αρκετό: είναι επίσης σημαντικό να γνωρίζουμε μεταξύ ποια ζεύγη φύλων εμφανίζονται αυτές οι διαφορές και εάν η μεταβλητή θα είναι χρήσιμη για ένα προγνωστικό μοντέλο.

Δεδομένου ότι οι διακυμάνσεις δεν ήταν ομοιογενείς και ο αριθμός των τραγουδιών ανά είδος ποικίλλει, χρησιμοποιήθηκαν τα ακόλουθα: Δοκιμή μετά την ολοκλήρωση της Games-HowellΑυτή η ανάλυση κατέστησε δυνατή την επαλήθευση των συνδυασμών φύλων που δεν παρουσίασαν σημαντικές διαφορές στη δημοτικότητα, γεγονός που, συνολικά, καθιστούσε λιγότερο σκόπιμη τη χρήση του φύλου ως ισχυρού προγνωστικού παράγοντα σε μοντέλα μηχανικής μάθησης.

Παράλληλα, πραγματοποιήθηκαν τα ακόλουθα ανεξάρτητα t-tests Για κάθε ηχητικό χαρακτηριστικό, οι μέσοι όροι συγκρίθηκαν μεταξύ της ομάδας των δημοφιλών τραγουδιών και της ομάδας των μη δημοφιλών τραγουδιών. Με επίπεδο σημαντικότητας 95%, διαπιστώθηκε ότι σχεδόν όλες οι μεταβλητές (χορευτική ικανότητα, ενέργεια, ένταση, ακουστικότητα, ζωντάνια, διάρκεια, τέμπο, σθένος και οργανικότητα) έδειξαν σημαντικές διαφορές μεταξύ των δύο ομάδων.

Η μόνη εμφανής εξαίρεση ήταν η ομιλητικότηταΣτην πρώτη δοκιμή, η διαφορά στους μέσους όρους δεν ήταν σημαντική, αλλά περαιτέρω ανάλυση αποκάλυψε ότι τα εύρη ομιλητικότητας για τα ιδιαίτερα δημοφιλή θέματα (με τιμές μεταξύ 0,024 και 0,685) εμπίπτουν στο ευρύτερο εύρος της λιγότερο δημοφιλούς κατηγορίας (μεταξύ 0 και 0,964). Αυτή η επικάλυψη δεν εμπόδισε την ομιλητικότητα, όταν χρησιμοποιήθηκε αποτελεσματικά, να συνεισφέρει πληροφορίες στο μοντέλο, επομένως αποφασίστηκε να διατηρηθεί ως προγνωστικός παράγοντας.

Συνοπτικά, το μπλοκ χαρακτηριστικών ήχου που παρουσίασε μια σαφής περιγραφική δύναμη σχετικά με τη δημοτικότητα, ενώ το φύλο αντιμετωπίστηκε με μεγαλύτερη προσοχή και αποκλείστηκε ως κύρια μεταβλητή σε ορισμένες προσεγγίσεις πρόβλεψης.

Δημιουργία μοντέλων μηχανικής μάθησης για την πρόβλεψη επιτυχιών

Με το καθαρό σύνολο δεδομένων και τις σχετικές μεταβλητές που επιλέχθηκαν, ήρθε η ώρα να δημιουργήσουμε μοντέλα δυαδικής ταξινόμησης ικανό να προβλέψει εάν ένα τραγούδι ανήκει στο κορυφαίο 15% της δημοτικότητας. Για να γίνει αυτό, οι κατηγορικές μεταβλητές key και mode μετατράπηκαν πρώτα σε εικονικές μεταβλητές χρησιμοποιώντας τη συνάρτηση get_dummies του Pandas.

Μετά την ενσωμάτωση αυτών των ομοιωμάτων, οι αρχικές στήλες για το κλειδί και την κατάσταση, καθώς και η συνεχιζόμενη δημοτικότητά τους, αφαιρέθηκαν και η μεταβλητή-στόχος διατηρήθηκε. δυαδικό πεδίο δημοτικότητας (δημοφιλές έναντι μη δημοφιλών). Πριν από την εκπαίδευση των μοντέλων, όλα τα αριθμητικά χαρακτηριστικά τυποποιήθηκαν με το StandardScaler, καθώς λειτουργούσαν σε πολύ διαφορετικές κλίμακες και ήταν σημαντικό να έχουν συγκρίσιμο βάρος.

Το σύνολο δεδομένων χωρίστηκε σε εκπαίδευση και δοκιμή χρησιμοποιώντας τη συνάρτηση train_test_split, κρατώντας το 20% των εγγραφών για εξετάσειςΜε αυτόν τον τρόπο, αποφεύχθηκαν οι διαρροές πληροφοριών και διασφαλίστηκε ότι οι μετρήσεις απόδοσης αντανακλούσαν την πραγματική γενίκευση των μοντέλων και όχι μόνο την ικανότητά τους να απομνημονεύουν δεδομένα εκπαίδευσης.

  Χειρισμός αρχείων στη γλώσσα C Παραδείγματα: Ένας πλήρης οδηγός

Το πρώτο μοντέλο που εφαρμόστηκε ήταν το Λογιστική ΠαλινδρόμησηΑυτή η τεχνική χρησιμοποιείται ευρέως στην δυαδική ταξινόμηση. Μια επαναληπτική έκδοση με ρυθμό εκμάθησης 0,01 και 200 ​​επαναλήψεις υλοποιήθηκε και αξιολογήθηκε χρησιμοποιώντας διασταυρούμενη επικύρωση. Η μέση ακρίβεια έφτασε περίπου το 84,7%, ένα αξιοσημείωτα ισχυρό αποτέλεσμα για ένα πρόβλημα τόσο περίπλοκο όσο η πρόβλεψη μουσικής επιτυχίας.

Στη συνέχεια, ο αλγόριθμος δοκιμάστηκε K-Κοντινότεροι Γείτονες (KNN)η οποία ταξινομεί κάθε τραγούδι σύμφωνα με τους k πλησιέστερους γείτονες στον χώρο χαρακτηριστικών. Η προσαρμογή της τιμής του ky χρησιμοποιώντας την Αναζήτηση Πλέγματος για την εύρεση της βέλτιστης διαμόρφωσης απέδωσε πολύ παρόμοια ακρίβεια, περίπου 84,8%, με μια μικρή βελτίωση στη βαθμολογία διασταυρούμενης επικύρωσης σε σύγκριση με τη λογιστική παλινδρόμηση.

Το επόμενο μοντέλο ήταν το Μηχανή Υποστήριξης Διανυσμάτων (SVM)Χρησιμοποιήθηκε μια άλλη εποπτευόμενη τεχνική ικανή να χειριστεί τόσο γραμμικές όσο και μη γραμμικές σχέσεις. Και πάλι, μέσω της προσαρμογής υπερπαραμέτρων, επιτεύχθηκαν ακρίβειες περίπου 84,6%, με ισοδύναμες τιμές σε διασταυρούμενη επικύρωση, υποδεικνύοντας σταθερή απόδοση.

Αξιολογήθηκαν επίσης τα εξής: Ταξινομητής Naive BayesΒασισμένο στην υπόθεση της ανεξαρτησίας μεταξύ των χαρακτηριστικών. Παρά το γεγονός ότι είναι ένα πολύ απλούστερο μοντέλο όσον αφορά τις υποθέσεις, τα αποτελέσματα ακρίβειάς του (περίπου 84,6%) ήταν ισάξια με το SVM και πολύ κοντά στη λογιστική παλινδρόμηση και την KNN, ενισχύοντας την ιδέα ότι η δομή του προβλήματος προσφέρεται καλά για αυτό το είδος πιθανοτικής προσέγγισης.

Τέλος, δοκιμάστηκαν μοντέλα που βασίζονται σε δέντρα αποφάσεων. Ταξινόμηση δέντρων απόφασης Πέτυχε σημαντικά χαμηλότερη ακρίβεια, περίπου 75,4%, και η διασταυρούμενη επικύρωση επιβεβαίωσε αυτήν την πτώση στην απόδοση, πιθανώς λόγω προβλημάτων υπερπροσαρμογής. Ταξινόμηση τυχαίων δασών, το οποίο συνδυάζει πολλά δέντρα για την εξομάλυνση αυτών των εφέ, βελτιώθηκε σημαντικά, επιτυγχάνοντας ακρίβεια περίπου 84,1% και πάνω από 84% στη διασταυρούμενη επικύρωση.

Για να ολοκληρωθεί η ανάλυση, ένα πίνακας σύγχυσης και έκθεση ταξινόμησης για το Random Forest. Το μοντέλο έδειξε εξαιρετική ικανότητα αναγνώρισης μη δημοφιλών τραγουδιών (κατηγορία πλειοψηφίας), με ακρίβεια 0,85 και ανάκληση κοντά στο 0,99, ενώ η απόδοσή του στην κατηγορία δημοφιλών τραγουδιών (μειονότητα) ήταν πιο μέτρια, με ακρίβεια 0,40 και ανάκληση 0,05. Αυτό υπογραμμίζει την κλασική πρόκληση της ανισορροπίας των τάξεων σε αυτό το είδος προβλήματος.

Σημασία των μεταβλητών: τι έχει τη μεγαλύτερη βαρύτητα κατά τη δημιουργία ενός hit

Πέρα από το να γνωρίζουμε ποιο μοντέλο είναι πιο ακριβές, είναι σημαντικό να κατανοήσουμε ποιες λειτουργίες παρέχουν πραγματικά χρήσιμες πληροφορίες κατά την πρόβλεψη για το αν ένα τραγούδι θα είναι δημοφιλές. Για τον σκοπό αυτό, χρησιμοποιήθηκε το XGBoost (XGBClassifier) ​​για την απόκτηση μεταβλητών βαθμολογιών σημαντικότητας, με βάση τη συμβολή κάθε χαρακτηριστικού στη μείωση των σφαλμάτων στα δέντρα απόφασης.

Τα αποτελέσματα έδειξαν ότι το Η διάρκεια του τραγουδιού ξεχώριζε σαφώς από τα υπόλοιπαμε βαθμολογία F πολύ πάνω από 400. Αυτό το εύρημα ταιριάζει με την ιδέα ότι τα μικρότερα κομμάτια ενθαρρύνουν την επαναλαμβανόμενη ακρόαση και επομένως συσσωρεύουν περισσότερα παιχνίδια σε λιγότερο χρόνο, κάτι που ο αλγόριθμος προτάσεων του Spotify τείνει να ανταμείβει.

Στο αντίθετο άκρο, μεταβλητές όπως το κλειδί, η λειτουργία ή το αίσθηση βγαλμένη από τον τίτλο Έλαβαν βαθμολογίες σημαντικότητας κάτω από 50, γεγονός που υποδηλώνει ότι η συμβολή τους στη συνολική προγνωστική ισχύ του μοντέλου ήταν μικρή. Αυτό δεν σημαίνει ότι δεν έχουν καμία επίδραση, αλλά μάλλον ότι, σε σύγκριση με άλλα χαρακτηριστικά, το βάρος τους είναι πολύ μικρότερο.

Τα υπόλοιπα ηχητικά χαρακτηριστικά (όπως η ενέργεια, η χορευτική ικανότητα, το σθένος, η ένταση, η ακουστικότητα, η ζωντάνια, η ομιλία και η οργανική ποιότητα) βρίσκονταν σε ενδιάμεσο εύρος με F-βαθμολογίες μεταξύ 200 και 300, υποδεικνύοντας ότι Αποτελούν ένα αρκετά ισορροπημένο μπλοκ πληροφοριώνΚανένα από αυτά δεν κυριαρχεί απόλυτα, αλλά όλα μαζί βοηθούν στη δημιουργία μιας αρκετά ακριβούς εικόνας για τις πιθανότητες επιτυχίας ενός τραγουδιού.

Συνολικά, τα μοντέλα που βασίζονται σε ηχητικά χαρακτηριστικά ήταν σε θέση να προβλέψουν με περίπου ποσοστό επιτυχίας 84-85% εάν μια ένδειξη θα ήταν μέρος του πιο δημοφιλούς 15%Αυτό προσδίδει κάποια εμπειρική υποστήριξη στην παλιά διαίσθηση της «επιστήμης των επιτυχημένων τραγουδιών»: με ​​καλά δεδομένα και κατάλληλες τεχνικές, η μουσική επιτυχία δεν είναι εντελώς τυχαία, αν και παραμένει ένα σημαντικό απρόβλεπτο στοιχείο.

Η εικόνα που σκιαγραφείται από αυτήν την ανάλυση δείχνει ότι ο συνδυασμός δεδομένων Spotify, παραδοσιακών στατιστικών και μοντέλων μηχανικής μάθησης μας επιτρέπει να πάμε πολύ πέρα ​​από την απλή καταμέτρηση των streams. Η κατανόηση του αντίκτυπου της διάρκειας, της ενέργειας, του σθένους και της οργανικής σύνθεσης, μαζί με τον ρόλο των συντακτικών λιστών αναπαραγωγής και τη δυναμική των προτάσεων της πλατφόρμας, παρέχει σε καλλιτέχνες, δισκογραφικές εταιρείες και αναλυτές έναν πολύ συγκεκριμένο οδικό χάρτη για την ερμηνεία του γιατί ορισμένα τραγούδια γίνονται επιτυχίες και πώς μπορούν να μεγιστοποιήσουν τις πιθανότητές τους να ενταχθούν σε αυτήν την επιλεγμένη ομάδα χωρίς να χάσουν εντελώς το ανθρώπινο και δημιουργικό στοιχείο που, ευτυχώς, παραμένει αμετάβλητο σε οποιαδήποτε φόρμουλα.

είδη τεχνητής νοημοσύνης
Σχετικό άρθρο:
7 Τύποι Τεχνητής Νοημοσύνης που θα μεταμορφώσουν το μέλλον μας