Τύποι ταξινόμησης

29 λεπτά
Μπλοκ 2 — Ταυτοποίηση του προβλήματος
Στόχος
να είστε σε θέση να χαρακτηρίσετε αυστηρά ένα έργο ταξινόμησης, να διακρίνετε τους τέσσερις κανονικούς τύπους — δυαδικό, πολυκλασικό, τακτικό, πολυετικετικό — από τη μορφή της μεταβλητής στόχου, να γνωρίζετε τις συνέπειες κάθε τύπου στην επιλογή αλγορίθμου και μετρικών, και να άρετε οριστικά την αμφισημία ονομασίας της λογιστικής παλινδρόμησης.
Εκτιμώμενη διάρκεια
40 λεπτά
Προαπαιτούμενα
κεφάλαια 001 έως 010
Σχετικά κουίζ
011.1-quiz-qualification-tache.md έως 011.7-quiz-synthese-comparative.md

1. Χαρακτηρισμός έργου ταξινόμησης: τρεις διακριτικές ερωτήσεις

Το κεφάλαιο 010 καθιέρωσε την πρώτη απόφαση μοντελοποίησης: ο στόχος είναι κατηγορικός ή αριθμητικός. Η απάντηση «κατηγορικός» δεν κλείνει το πλαισίωμα. Απομένει να καθοριστεί ποιος τύπος ταξινόμησης πρόκειται, διότι αυτός ο τύπος καθορίζει τη μορφή της μεταβλητής στόχου, τους χρησιμοποιήσιμους αλγορίθμους, τις αποδεκτές μετρικές και την ερμηνεία ενός σφάλματος.

ΟΡΙΣΜΟΣ — Έργο ταξινόμησης

Αυστηρός ορισμός

Έστω χώρος εισόδου X και πεπερασμένο σύνολο ετικετών C = {c_1, ..., c_K} πληθικότητας K ≥ 2. Ένα έργο ταξινόμησης συνίσταται στην επαγωγή, από δείγμα {(x_i, y_i)}, i = 1..n, μιας συνάρτησης απόφασης f : X → Y της οποίας ο χώρος άφιξης Y κατασκευάζεται επί του C σύμφωνα με μία από δύο κατασκευές, που θεμελιώνουν τη διαμέριση αυτού του κεφαλαίου:

  • Y = C — κάθε παρατήρηση λαμβάνει ακριβώς μία ετικέτα μεταξύ K. Το πρόβλημα λέγεται μονοετικετικό (single-label).
  • Y = {0, 1}^K, σύνολο των μερών του C — κάθε παρατήρηση λαμβάνει ένα οποιοδήποτε υποσύνολο ετικετών, ενδεχομένως κενό. Το πρόβλημα λέγεται πολυετικετικό (multilabel).

Μετάφραση σε καθημερινή γλώσσα

Το να ταξινομήσετε σημαίνει να αποδώσετε ετικέτες ληφθείσες από κλειστή λίστα. Η πρώτη ερώτηση προς επίλυση είναι αν μια παρατήρηση λαμβάνει μία μόνον ή πολλές.

Σημείο προσοχής

Η λίστα των ετικετών θεωρείται κλειστή και γνωστή στην εκπαίδευση. Ένας ταξινομητής δεν μπορεί να προβλέψει κλάση που δεν έχει ποτέ παρατηρήσει· η διαχείριση των πρωτόγνωρων κλάσεων ανήκει στην ανίχνευση ανωμαλιών (κεφάλαιο 003).

1.1 Οι τρεις ερωτήσεις, με τη σειρά

ΣειράΕρώτησηΑπάντησηΔιατηρούμενος τύπος
1Μπορεί μια παρατήρηση να φέρει πολλές ετικέτες ταυτόχρονα;ΝαιΠολυετικετική
2Πόσες αμοιβαία αποκλειστικές κλάσεις;K = 2Δυαδική
2Πόσες αμοιβαία αποκλειστικές κλάσεις;K > 2Μετάβαση στην ερώτηση 3
3Είναι οι κλάσεις εφοδιασμένες με φυσική ολική διάταξη;ΌχιΠολυκλασική (ονομαστική)
3Είναι οι κλάσεις εφοδιασμένες με φυσική ολική διάταξη;ΝαιΤακτική

Η σειρά δεν είναι αυθαίρετη: η ερώτηση της αποκλειστικότητας προέχει, διότι αλλάζει την ίδια τη μορφή του πίνακα στόχου — διάνυσμα στη μία περίπτωση, πίνακας στην άλλη. Οι ερωτήσεις 2 και 3 αφορούν μόνον την εσωτερική δομή του C.

1.2 Ο τύπος ταξινόμησης είναι απόφαση, όχι διαπίστωση

Το ίδιο επιχειρηματικό φαινόμενο δέχεται συχνά πολλές έγκυρες διατυπώσεις. Μια έρευνα ικανοποίησης βαθμολογημένη από 1 έως 5 μπορεί να αντιμετωπιστεί ως τακτικός στόχος πέντε επιπέδων, ως δυαδικός στόχος μετά ομαδοποίηση ({1,2,3} έναντι {4,5}), ή ως αριθμητικός στόχος.

Το κριτήριο απόφασης είναι η χρήση της πρόβλεψης. Αν η κατάντη λειτουργική απόφαση είναι δυαδική — επαναπροσέγγιση του πελάτη ή όχι —, η δυαδική διατύπωση συγκεντρώνει την ικανότητα του μοντέλου στο μόνο χρήσιμο σύνορο.

Σημείο προσοχής : η ομαδοποίηση κλάσεων είναι μη αναστρέψιμη από την άποψη του μοντέλου. Ένα μοντέλο εκπαιδευμένο σε δύο επίπεδα δεν θα αποκαταστήσει ποτέ την κοκκοποίηση των πέντε επιπέδων.


2. Η δυαδική ταξινόμηση

ΟΡΙΣΜΟΣ — Δυαδική ταξινόμηση

Αυστηρός ορισμός

Περίπτωση της μονοετικετικής ταξινόμησης όπου K = 2 : C = {c_0, c_1} και Y = C. Η συνάρτηση απόφασης f : X → {c_0, c_1} διαμερίζει τον χώρο εισόδου σε δύο περιοχές χωρισμένες από σύνορο απόφασης.

Οι περισσότεροι αλγόριθμοι δεν μαθαίνουν το f απευθείας, αλλά μια συνάρτηση βαθμολογίας s : X → ℝ ή μια εκτίμηση δεσμευμένης πιθανότητας p(x) = P(Y = c_1 | X = x), η απόφαση προκύπτοντας από σύγκριση με κατώφλι t : f(x) = c_1 αν p(x) ≥ t, c_0 διαφορετικά.

Μετάφραση σε καθημερινή γλώσσα

Δύο δυνατές απαντήσεις, και μόνον δύο. Το μοντέλο παράγει στην πραγματικότητα έναν βαθμό εμπιστοσύνης, μετατρεπόμενο σε απάντηση με καθορισμό μιας ράβδου.

Σημείο προσοχής

Ο διαχωρισμός μεταξύ της εκτίμησης του p(x) και της επιλογής του κατωφλίου t είναι θεμελιώδης. Το κατώφλι 0,5 είναι σύμβαση υλοποίησης, ποτέ αποδεδειγμένο βέλτιστο. Η ρύθμισή του αντιμετωπίζεται στο κεφάλαιο 062.

2.1 Η σύμβαση 0 / 1

Η χρήση επιβάλλει την κωδικοποίηση του δυαδικού στόχου με τους ακέραιους 0 και 1. Αυτή η σύμβαση είναι δομική, όχι διακοσμητική.

ΙδιότηταΣυνέπεια της σύμβασης 0 / 1
y.mean()Δίνει απευθείας τον επιπολασμό της κλάσης 1
Πιθανοφάνεια BernoulliΓράφεται p^y · (1−p)^(1−y), βάση της log-loss (κεφάλαιο 061)
predict_probaΕπιστρέφει πίνακα (n, 2)· η στήλη δείκτη 1 φέρει την κλάση 1
Πίνακας σύγχυσηςΗ σειρά [0, 1] καθορίζει τη διάταξη TN, FP, FN, TP (κεφάλαιο 052)
Ακρίβεια, ανάκληση, F1Υπολογίζονται ως προς την κλάση 1 εξ ορισμού

Σημείο προσοχής : η scikit-learn διατάσσει τις κλάσεις με αύξουσα ταξινόμηση, στην ιδιότητα classes_. Με κειμενικές ετικέτες {"Fraude", "Normal"}, η αλφαβητική σειρά τοποθετεί το "Fraude" στον δείκτη 0 — το αντίστροφο της επιχειρηματικής πρόθεσης. Η ρητή κωδικοποίηση του στόχου σε 0/1 καταργεί αυτόν τον κίνδυνο.

2.2 Παράδειγμα δεδομένων — ανίχνευση απάτης με τραπεζική κάρτα

transaction_idmontantpays_cartepays_marchandheurecanalest_fraude
T-00000142,90FRFR14Boutique0
T-0000021 890,00FRRU3En ligne1
T-00000312,50FRFR9Boutique0
T-0000047,20FRFR19En ligne0
T-0000052 450,00FRUS4En ligne1
python
import pandas as pd

df = pd.read_csv("transactions.csv")
y = df["est_fraude"]

print(y.shape)
print(y.dtype)
print(sorted(y.unique()))
print(y.value_counts(normalize=True).round(4))
(284807,)
int64
[0, 1]
est_fraude
0    0.9983
1    0.0017
Name: proportion, dtype: float64

Ερμηνεία : το y είναι μονοδιάστατο διάνυσμα μήκους n, μία τιμή ανά παρατήρηση, με δύο τρόπους κωδικοποιημένους 0 και 1. Η θετική κλάση αντιπροσωπεύει το 0,17 % των παρατηρήσεων: το πρόβλημα είναι ισχυρά ανισόρροπο, πράγμα που αποκλείει την ορθότητα ως μετρική πλοήγησης και επιβάλλει την αντιμετώπιση των κεφαλαίων 050 και 051.

2.3 Η επιλογή της θετικής κλάσης και οι συνέπειές της

ΟΡΙΣΜΟΣ — Θετική κλάση

Αυστηρός ορισμός

Σε δυαδικό πρόβλημα, η θετική κλάση είναι εκείνη ως προς την οποία ορίζονται οι καταμετρήσεις του πίνακα σύγχυσης — αληθώς θετικά, ψευδώς θετικά, ψευδώς αρνητικά — και επομένως οι ασύμμετρες μετρικές που παράγονται από αυτές: ακρίβεια, ανάκληση, ειδικότητα, F-beta.

Μετάφραση σε καθημερινή γλώσσα

Η θετική κλάση είναι εκείνη που το μοντέλο είναι επιφορτισμένο να ανιχνεύσει. Η λέξη «θετικό» δεν φέρει καμία ευνοϊκή χροιά: ένα θετικό αποτέλεσμα προληπτικού ελέγχου είναι κακό αποτέλεσμα για τον ασθενή.

Κανόνας ονομασίας

Η θετική κλάση είναι, κατά επαγγελματική σύμβαση, η κλάση ενδιαφέροντος: το σπάνιο, δαπανηρό ή ενεργοποιήσιμο γεγονός — απάτη, αθέτηση πληρωμής, ασθένεια, αναχώρηση πελάτη, βλάβη. Συμπίπτει στη μεγάλη πλειονότητα των περιπτώσεων με την μειοψηφική κλάση.

Σημείο προσοχής

Αυτή η ονομασία είναι ρητή απόφαση μοντελοποίησης. Το να την αφήσουμε να εξαρτηθεί από την αλφαβητική σειρά των ετικετών παράγει μετρικές ορθώς υπολογισμένες αλλά ερμηνευμένες αντίστροφα.

Η αντιστροφή της θετικής κλάσης δεν αλλάζει το μοντέλο, αλλά αλλάζει το νόημα όλων των ασύμμετρων μετρικών.

ΜέγεθοςΕπίδραση της αντιστροφής της θετικής κλάσης
Εκμαθημένο μοντέλο, σύνορο απόφασηςΑμετάβλητο
Ορθότητα (accuracy)Αμετάβλητη — συμμετρική μετρική
Ακρίβεια, ανάκληση, F1Αλλάζουν τιμή: αφορούν την άλλη κλάση
Ανάκληση και ειδικότηταΑνταλλάσσονται
Ψευδώς θετικά και ψευδώς αρνητικάΑνταλλάσσονται
ROC-AUCΓίνεται 1 − AUC
PR-AUCΑλλάζει ριζικά: η γραμμή βάσης περνά από τον επιπολασμό της μιας κλάσης σε εκείνον της άλλης

Λειτουργική συνέπεια : μια ανακοινωμένη ανάκληση 0,92 δεν έχει κανένα νόημα εφόσον η θετική κλάση δεν έχει ονομαστεί. Κάθε απόδοση αποτελεσμάτων δυαδικής ταξινόμησης πρέπει να την διατυπώνει ρητά.

ΑΝΑΛΟΓΙΑ — Ο προληπτικός έλεγχος

Ένα εργαστήριο ανακοινώνει ότι το τεστ του «ανιχνεύει το 95 % των περιπτώσεων». Η φράση είναι μη εκμεταλλεύσιμη όσο αγνοούμε τι ανιχνεύεται.

Αν πρόκειται για ανίχνευση των ασθενών, το 95 % είναι η ανάκληση επί της κλάσης «άρρωστος»: πέντε ασθενείς στους εκατό διαφεύγουν.

Αν πρόκειται για ανίχνευση των υγιών, το 95 % είναι η ανάκληση επί της κλάσης «υγιής», δηλαδή η ειδικότητα: πέντε υγιείς στους εκατό ανησυχούν αδίκως, και ο ρυθμός των διαφευγόντων ασθενών παραμένει εντελώς άγνωστος.

Ο ίδιος αριθμός, υπολογισμένος στο ίδιο μοντέλο, περιγράφει δύο κλινικές πραγματικότητες χωρίς σχέση. Η ονομασία της θετικής κλάσης είναι η συνθήκη ερμηνευσιμότητας του αριθμού.

Ουσιώδες σημείο : το βήμα της ταξινόμησης καθ' εαυτό είναι η σύγκριση με το κατώφλι, κατάντη του μοντέλου· το μοντέλο παράγει ένα συνεχές μέγεθος. Αυτή η διάκριση θεμελιώνει το σημείο 6 αυτού του κεφαλαίου.


3. Η πολυκλασική ταξινόμηση

ΟΡΙΣΜΟΣ — Πολυκλασική ταξινόμηση (multiclass classification)

Αυστηρός ορισμός

Μονοετικετική ταξινόμηση όπου K > 2, το σύνολο C = {c_1, ..., c_K} ον εξαντλητικό — κάθε παρατήρηση δέχεται ετικέτα στο C — και αμοιβαία αποκλειστικό — μια παρατήρηση δέχεται ακριβώς μία. Τυπικά Y = C, και Σ_k P(Y = c_k | X = x) = 1 για κάθε x.

Γίνεται επίσης λόγος για ονομαστική ταξινόμηση για να υπογραμμιστεί ότι το C δεν είναι εφοδιασμένο με καμία σχέση διάταξης.

Μετάφραση σε καθημερινή γλώσσα

Περισσότερες από δύο δυνατές απαντήσεις, μία μόνον απάντηση ανά παρατήρηση, και καμία απάντηση δεν είναι «ανώτερη» από άλλη.

Σημείο προσοχής

Εξαντλητικότητα και αποκλειστικότητα είναι δύο διακριτές υποθέσεις, και οι δύο διαψεύσιμες επί των δεδομένων. Μια ονοματολογία που περιλαμβάνει τρόπο «Άλλο» ικανοποιεί την εξαντλητικότητα με τίμημα μια ετερογενή κλάση δύσκολη στη μοντελοποίηση.

3.1 Διάκριση από το πολυετικετικό

Η διάκριση δεν αφορά τον αριθμό των κλάσεων αλλά τον αριθμό των ετικετών αποδιδόμενων σε μια παρατήρηση.

ΚριτήριοΠολυκλασικόΠολυετικετικό
Αριθμός δυνατών κλάσεων KK > 2K ≥ 2
Αριθμός ετικετών ανά παρατήρησηΑκριβώς 10, 1, ή πολλές
Αμοιβαία αποκλειστικότητα των κλάσεωνΝαι, εξ υποθέσεωςΌχι
Μορφή του ακατέργαστου y(n,)(n, K)
Άθροισμα των δεικτών σε μια γραμμήΠάντα 1Μεταξύ 0 και K
Άθροισμα των προβλεπόμενων πιθανοτήτων1, περιορισμός softmaxΧωρίς περιορισμό

Λειτουργικός έλεγχος : διατυπώστε την επιχειρηματική ερώτηση με το οριστικό άρθρο. «Ποιο είναι το κίνητρο αυτού του εισιτηρίου;» δηλώνει πολυκλασικό πρόβλημα. «Ποια είναι τα κίνητρα αυτού του εισιτηρίου;» δηλώνει πολυετικετικό πρόβλημα.

3.2 Παράδειγμα δεδομένων — δρομολόγηση εισιτηρίων υπηρεσίας πελατών

ticket_idcanallongueur_texteclient_premiumanciennete_moiscategorie
TK-0001Courriel412014Facturation
TK-0002Téléphone87161Technique
TK-0003Formulaire23503Commercial
TK-0004Courriel1 104128Résiliation
TK-0005Téléphone15609Technique
python
y = df["categorie"]

print(y.shape)
print(y.nunique())
print(y.value_counts())
(12000,)
4
categorie
Technique      5184
Facturation    3612
Commercial     2076
Résiliation    1128
Name: count, dtype: int64

Ερμηνεία : το y παραμένει διάνυσμα μορφής (n,), ακριβώς όπως στη δυαδική περίπτωση· μόνον ο αριθμός των τρόπων αλλάζει. Η μετάβαση από το δυαδικό στο πολυκλασικό δεν τροποποιεί τη δομή του y. Τα μεγέθη κυμαίνονται από 1 128 έως 5 184, δηλαδή λόγος 4,6: η ανισορροπία είναι μέτρια αλλά επιβάλλει ήδη την προτίμηση των μακρο-μέσων έναντι των μικρο-μέσων ώστε να μην αποκρυφθεί η κλάση Résiliation (κεφάλαιο 065).

3.3 Οι στρατηγικές αποσύνθεσης

Ορισμένοι αλγόριθμοι είναι εγγενώς δυαδικοί — οι μηχανές διανυσμάτων στήριξης (κεφάλαιο 041) είναι το κανονικό παράδειγμα. Δύο σχήματα αναγωγής επιτρέπουν τότε την αντιμετώπιση K κλάσεων με δυαδικούς ταξινομητές.

ΟΡΙΣΜΟΣ — Ένα-έναντι-όλων και ένα-έναντι-ενός

Ένα-έναντι-όλων (One-vs-Rest, OvR, επίσης One-vs-All)

Εκπαιδεύονται K δυαδικοί ταξινομητές· ο ταξινομητής k αντιπαραθέτει το c_k στην ένωση όλων των άλλων κλάσεων. Στην πρόβλεψη, κρατείται το argmax_k s_k(x).

Ένα-έναντι-ενός (One-vs-One, OvO)

Εκπαιδεύεται ένας ταξινομητής ανά ζεύγος κλάσεων, δηλαδή K(K−1)/2 ταξινομητές· ο ταξινομητής (j, k) εκπαιδεύεται μόνον στις παρατηρήσεις του c_j ή του c_k. Στην πρόβλεψη, κάθε ταξινομητής ψηφίζει και η πλειοψηφική κλάση υπερισχύει.

Μετάφραση σε καθημερινή γλώσσα

Ένα-έναντι-όλων: «είναι γάτα, ναι ή όχι;», κατόπιν «είναι σκύλος, ναι ή όχι;»· κρατούμε την πιο βέβαιη απάντηση. Ένα-έναντι-ενός: οργανώνουμε τουρνουά μονομαχιών μεταξύ όλων των ζευγών και μετράμε τις νίκες.

Σημείο προσοχής

Οι βαθμολογίες των K ταξινομητών OvR προέρχονται από μοντέλα εκπαιδευμένα χωριστά, σε προβλήματα διαφορετικής δυσκολίας και επιπολασμού. Η άμεση συγκρισιμότητά τους με argmax δεν είναι εγγυημένη: αυτή είναι η αναγνωρισμένη θεωρητική αδυναμία της στρατηγικής.

ΚριτήριοΈνα-έναντι-όλων (OvR)Ένα-έναντι-ενός (OvO)
Αριθμός ταξινομητώνKK(K−1)/2
Για K = 4 / 10 / 1004 / 10 / 1006 / 45 / 4 950
Μέγεθος κάθε υποπροβλήματοςn παρατηρήσειςπερίπου 2n/K παρατηρήσεις
Συνολικό κόστος, αλγόριθμος γραμμικός σε nO(K · n)O(K · n)
Συνολικό κόστος, αλγόριθμος τετραγωνικός σε nO(K · n²)O(n²)
Επαγόμενη ανισορροπίαΙσχυρή: 1 κλάση έναντι K−1Καμία μεταξύ των δύο κλάσεων του ζεύγους
Ζώνες αμφισημίαςΚανένας ή πολλοί θετικοί ταξινομητέςΚυκλικές ψήφοι: το A νικά το B, το B νικά το C, το C νικά το A

Ανάγνωση του πίνακα : ο αριθμός των μοντέλων αυξάνεται τετραγωνικά στο OvO, αλλά κάθε μοντέλο εκπαιδεύεται μόνον σε κλάσμα των δεδομένων. Για αλγόριθμο του οποίου το κόστος εκπαίδευσης είναι τετραγωνικό σε n — περίπτωση των SVM με πυρήνα —, το OvO είναι επομένως συνολικά λιγότερο δαπανηρό από το OvR παρά τον ανώτερο αριθμό μοντέλων. Αυτός είναι ο λόγος για τον οποίο η scikit-learn κρατά το OvO εξ ορισμού για το SVC, και το OvR για το LinearSVC, του οποίου το κόστος είναι γραμμικό.

python
from sklearn.datasets import make_classification
from sklearn.multiclass import OneVsRestClassifier, OneVsOneClassifier
from sklearn.svm import SVC

X, y = make_classification(n_samples=600, n_features=8, n_informative=6,
                           n_classes=6, n_clusters_per_class=1, random_state=0)

ovr = OneVsRestClassifier(SVC()).fit(X, y)
ovo = OneVsOneClassifier(SVC()).fit(X, y)

print("K                  :", len(set(y)))
print("OvR nb estimateurs :", len(ovr.estimators_))
print("OvO nb estimateurs :", len(ovo.estimators_))
K                  : 6
OvR nb estimateurs : 6
OvO nb estimateurs : 15

Ερμηνεία : 6 ταξινομητές έναντι 6 × 5 / 2 = 15. Η αποσύνθεση είναι εσωτερική μηχανική: και στις δύο περιπτώσεις το y παραμένει διάνυσμα (n,) και το predict επιστρέφει μοναδική ετικέτα.

3.4 Οι εγγενώς πολυκλασικοί αλγόριθμοι

ΑλγόριθμοςΑντιμετώπιση του πολυκλασικούΚεφάλαιο
Δέντρο απόφασηςΕγγενής — κατανομή κλάσεων ανά φύλλο037
Τυχαίο δάσοςΕγγενής — συνάθροιση των ψήφων των δέντρων038
Gradient boostingΕγγενής, γενικά με K σύνολα δέντρων039
K πλησιέστεροι γείτονεςΕγγενής — πλειοψηφική ψηφοφορία στη γειτονιά040
Naive BayesΕγγενής — argmax της εκ των υστέρων πιθανότητας042
Λογιστική παλινδρόμησηΕγγενής σε πολυωνυμική διατύπωση (softmax)036
Πολυστρωματικό perceptronΕγγενής — K νευρώνες εξόδου και softmax043
SVM με πυρήνα (SVC)Αποσύνθεση OvO041
Γραμμικό SVM (LinearSVC)Αποσύνθεση OvR041

Σημείο προσοχής : η ύπαρξη εγγενούς αντιμετώπισης δεν απαλλάσσει από την επαλήθευση της ανισορροπίας μεταξύ κλάσεων. Ένα πρόβλημα 12 κλάσεων εκ των οποίων τρεις συγκεντρώνουν το 90 % των μεγεθών θέτει, κλάση προς κλάση, τις ίδιες δυσκολίες με ένα ανισόρροπο δυαδικό πρόβλημα.


4. Η τακτική ταξινόμηση

ΟΡΙΣΜΟΣ — Τακτική κλίμακα (Stevens, 1946)

Αυστηρός ορισμός

Στην τυπολογία των κλιμάκων μέτρησης που πρότεινε ο S. S. Stevens (1946), μια κλίμακα λέγεται τακτική όταν η σχέση διάταξης μεταξύ των τρόπων είναι ορισμένη και σημαίνουσα, αλλά η απόσταση μεταξύ δύο διαδοχικών τρόπων δεν είναι. Οι αποδεκτές πράξεις είναι η σύγκριση (<, >, =), οι τάξεις, η διάμεσος και τα ποσοστημόρια· το άθροισμα, ο αριθμητικός μέσος και η διαφορά δεν είναι.

Η κλίμακα διαστήματος, αμέσως ανώτερη, προσθέτει τη σημασία των αποκλίσεων· η κλίμακα λόγου προσθέτει απόλυτο μηδέν.

Μετάφραση σε καθημερινή γλώσσα

Γνωρίζουμε να ταξινομήσουμε τους τρόπους από τον ασθενέστερο στον ισχυρότερο, αλλά δεν γνωρίζουμε κατά πόσο διαφέρουν.

Σημείο προσοχής

Η κωδικοποίηση τακτικής μεταβλητής σε ακέραιους 0, 1, 2, 3 είναι νόμιμη πράξη κωδικοποίησης. Η κατόπιν αντιμετώπιση αυτών των ακεραίων ως μετρημένων ποσοτήτων δεν είναι: η κωδικοποίηση δημιουργεί μετρική που η μέτρηση δεν φέρει.

ΟΡΙΣΜΟΣ — Τακτική ταξινόμηση (ordinal regression, ordinal classification)

Αυστηρός ορισμός

Μονοετικετική ταξινόμηση όπου K > 2 και όπου το C είναι εφοδιασμένο με ολική διάταξη c_1 ≺ c_2 ≺ ... ≺ c_K σημαίνουσα για το πεδίο, χωρίς να ορίζεται απόσταση στο C. Η συνάρτηση απώλειας πρέπει να αντανακλά αυτή τη διάταξη: το κόστος σύγχυσης μεταξύ c_1 και c_K πρέπει να υπερβαίνει εκείνο μιας σύγχυσης μεταξύ c_1 και c_2.

Μετάφραση σε καθημερινή γλώσσα

Κλάσεις ταξινομημένες από την ασθενέστερη στην ισχυρότερη, όπου το μεγάλο λάθος είναι σοβαρότερο από το μικρό.

Σημείο προσοχής

Η συνήθης αγγλική ονομασία είναι ordinal regression, πράγμα που συντηρεί σύγχυση με την παλινδρόμηση με την έννοια του κεφαλαίου 010. Το έργο παραμένει ταξινόμηση: ο χώρος άφιξης είναι πεπερασμένος.

4.1 Παράδειγμα δεδομένων — εσωτερική βαθμολόγηση πιστωτικού κινδύνου

dossier_idrevenu_annueltaux_endettementincidents_12manciennete_bancaireniveau_risque
D-000154 0000,21012Faible
D-000228 5000,4713Moyen
D-000319 2000,6341Critique
D-000441 0000,3827Élevé
D-000567 3000,15021Faible

Η διάταξη Faible ≺ Moyen ≺ Élevé ≺ Critique φέρεται από το επιχειρηματικό πεδίο. Κανένα δεδομένο δεν λέει ότι ένας φάκελος Critique είναι «διπλά πιο επικίνδυνος» από έναν φάκελο Moyen.

python
import pandas as pd
from pandas.api.types import CategoricalDtype

ordre = CategoricalDtype(
    categories=["Faible", "Moyen", "Élevé", "Critique"], ordered=True
)
y = df["niveau_risque"].astype(ordre)

print(y.dtype)
print(y.cat.codes.head().tolist())
print((y > "Moyen").head().tolist())
category
[1, 0, 3, 2, 1]
[False, False, True, True, False]

Ερμηνεία : το y παραμένει διάνυσμα (n,), όπως στο δυαδικό και στο πολυκλασικό. Η διαφορά φέρεται από τον τύπο: το ordered=True καθιστά τη σύγκριση y > "Moyen" έγκυρη και ερμηνεύσιμη. Οι κωδικοί 0 έως 3 είναι τάξεις, όχι ποσότητες.

4.2 Οι δύο αφελείς αντιμετωπίσεις και τι κοστίζουν

ΑντιμετώπισηΤι υποτίθεταιΤι χάνεται ή εισάγεται αδίκως
Ως ονομαστικό πολυκλασικόΚαμία διάταξη μεταξύ των κλάσεωνΑπώλεια πληροφορίας: όλες οι συγχύσεις είναι ισοδύναμες· η πρόβλεψη Faible αντί Critique κοστίζει όσο η πρόβλεψη Élevé αντί Critique
Ως παλινδρόμηση επί των κωδικών 0-3Ίσες αποκλίσεις μεταξύ διαδοχικών επιπέδων και στόχος διαστήματοςΑθεμελίωτη υπόθεση: τίποτε δεν αποδεικνύει ότι η απόκλιση Faible → Moyen ισούται με την απόκλιση Élevé → Critique· η συνεχής έξοδος επιβάλλει επιπλέον αυθαίρετα κατώφλια στρογγυλοποίησης
Ως τακτικόΟλική διάταξη, μη ορισμένες αποστάσειςΑντιμετώπιση σύμφωνη με τη φύση της μέτρησης

Η απώλεια πληροφορίας της πολυκλασικής αντιμετώπισης μετράται απευθείας.

python
import numpy as np
from sklearn.metrics import accuracy_score, mean_absolute_error, cohen_kappa_score

y_true = np.array([0, 1, 2, 3, 2, 1, 0, 3, 2, 1])
pred_A = np.array([0, 1, 2, 3, 2, 1, 0, 3, 1, 1])   # μια σφάλμα μιας τάξης
pred_C = np.array([0, 1, 2, 3, 2, 1, 0, 0, 2, 1])   # μια σφάλμα τριών τάξεων

for nom, p in [("A — erreur de 1 rang", pred_A), ("C — erreur de 3 rangs", pred_C)]:
    print(nom)
    print("  accuracy  :", accuracy_score(y_true, p))
    print("  MAE rangs :", round(mean_absolute_error(y_true, p), 3))
    print("  QWK       :", round(cohen_kappa_score(y_true, p, weights="quadratic"), 3))
A — erreur de 1 rang
  accuracy  : 0.9
  MAE rangs : 0.1
  QWK       : 0.952
C — erreur de 3 rangs
  accuracy  : 0.9
  MAE rangs : 0.3
  QWK       : 0.571

Ερμηνεία : οι δύο προβλέψεις λαμβάνουν την ίδια ορθότητα, 0,90, ενώ η δεύτερη συγχέει έναν φάκελο Critique με έναν φάκελο Faible — το δαπανηρότερο σφάλμα του πεδίου. Η ορθότητα, μετρική ονομαστικής ταξινόμησης, είναι δομικά τυφλή στο πλάτος του σφάλματος. Το MAE επί των τάξεων τις διακρίνει αμέσως, σε λόγο 1 προς 3, και το τετραγωνικά σταθμισμένο κάππα περνά από 0,952 σε 0,571.

Σημείο προσοχής : το MAE επί τάξεων είναι δείκτης σύγκρισης μεταξύ μοντέλων, όχι επιχειρηματική ποσότητα. Δεν ερμηνεύεται ως «0,3 επίπεδο κινδύνου κατά μέσο όρο», διότι το επίπεδο κινδύνου δεν είναι μετρήσιμο.

ΑΝΑΛΟΓΙΑ — Το ολυμπιακό βάθρο

Οι θέσεις πρώτης, δεύτερης και τρίτης είναι αυστηρά διατεταγμένες: κανείς δεν αμφισβητεί ότι η πρώτη προηγείται της δεύτερης.

Τίποτε δεν επιτρέπει ωστόσο να γραφεί ότι η απόκλιση μεταξύ πρώτου και δεύτερου ισούται με την απόκλιση μεταξύ δεύτερου και τρίτου. Σε έναν αγώνα 100 μέτρων, ο πρώτος μπορεί να προηγείται του δεύτερου κατά δύο εκατοστά του δευτερολέπτου και ο δεύτερος να προηγείται του τρίτου κατά μισό δευτερόλεπτο.

Η αντιμετώπιση των τάξεων ως αριθμών θα ισοδυναμούσε με τον ισχυρισμό ότι αυτές οι δύο αποκλίσεις είναι ταυτόσημες. Η πλήρης αγνόησή τους θα ισοδυναμούσε με τον ισχυρισμό ότι το να τερματίσει κανείς τρίτος αντί πρώτος δεν είναι πιο λυπηρό από το να τερματίσει δεύτερος. Η τακτική ταξινόμηση είναι η διατύπωση που αρνείται αυτά τα δύο σφάλματα.

4.3 Οι διαθέσιμες προσεγγίσεις

ΠροσέγγισηΑρχήΠαρατήρηση
Μοντέλο αναλογικών πιθανοτήτων (McCullagh, 1980)Σωρευτικό λογιστικό μοντέλο: K−1 κατώφλια μοιράζονται το ίδιο διάνυσμα συντελεστώνΣτατιστική αναφορά· υπόθεση αναλογικότητας των πιθανοτήτων προς επαλήθευση
Σωρευτική δυαδική αποσύνθεση (Frank και Hall, 2001)K−1 δυαδικοί ταξινομητές «y > c_k ;», πιθανότητες ανασυντεθειμένες με διαφοράΕπιτρέπει τη χρήση οποιουδήποτε πιθανοτικού δυαδικού ταξινομητή
Παλινδρόμηση κατόπιν διακριτοποίησηΠαλινδρόμηση επί των τάξεων, κατόπιν διαίρεση με βελτιστοποιημένα κατώφλιαΑπλή και συχνά αποτελεσματική· υποθέτει σιωπηρά την ισαπόσταση
Πολυκλασικό με ασύμμετρα κόστηΚλασικό πολυκλασικό με πίνακα κόστους που τιμωρεί τις μεγάλες αποκλίσειςΕπανεισάγει τη διάταξη μέσω της συνάρτησης κόστους

Προσαρμοσμένες μετρικές : MAE ή RMSE επί των τάξεων (κεφάλαια 067 και 069), τετραγωνικά σταθμισμένο κάππα (Quadratic Weighted Kappa), πίνακας σύγχυσης αναγνωσμένος παρατηρώντας τη συγκέντρωση γύρω από τη διαγώνιο (κεφάλαιο 052).


5. Η πολυετικετική ταξινόμηση

ΟΡΙΣΜΟΣ — Πολυετικετική ταξινόμηση (multi-label classification)

Αυστηρός ορισμός

Έργο όπου ο χώρος άφιξης είναι Y = {0, 1}^K, δηλαδή το σύνολο των μερών του C = {c_1, ..., c_K}. Σε κάθε παρατήρηση x συνδέεται ένα δυαδικό διάνυσμα y = (y_1, ..., y_K) όπου y_k = 1 αν η ετικέτα c_k εφαρμόζεται. Κανένας περιορισμός δεν βαραίνει το Σ_k y_k, που μπορεί να ισούται με 0 (καμία ετικέτα) έως K (όλες).

Οι ετικέτες δεν είναι ούτε αποκλειστικές ούτε ανεξάρτητες: η μοντελοποίηση των συσχετίσεών τους αποτελεί την ίδια δυσκολία του προβλήματος.

Μετάφραση σε καθημερινή γλώσσα

Μια παρατήρηση μπορεί να λάβει πολλές ετικέτες ταυτόχρονα, ή καμία. Κάθε ετικέτα είναι μια ερώτηση «ναι ή όχι» φαινομενικά ανεξάρτητη, αλλά οι απαντήσεις συνδέονται μεταξύ τους.

Σημείο προσοχής

Το πολυετικετικό διακρίνεται από το πολυκλασικό-πολυέξοδο (multiclass-multioutput), όπου προβλέπονται πολλές μεταβλητές στόχου, καθεμία ούσα η ίδια πολυκλασική. Το πολυετικετικό είναι η ειδική περίπτωση όπου όλες οι έξοδοι είναι δυαδικές.

5.1 Παράδειγμα δεδομένων — αυτόματη επισημείωση φωτογραφιών

photo_idluminance_moyteinte_dominantevisages_detectesplagecoucher_de_soleilpersonneanimal
P-0001182Orange01100
P-000295Gris20010
P-0003164Bleu11011
P-000447Vert00000
P-0005201Orange31110

Μια φωτογραφία μπορεί να είναι ταυτόχρονα παραλία, ηλιοβασίλεμα και να περιέχει πρόσωπο. Η φωτογραφία P-0004 δεν φέρει καμία από τις τέσσερις ετικέτες: το μηδενικό διάνυσμα είναι έγκυρη παρατήρηση, πράγμα αδύνατο στο πολυκλασικό.

python
from sklearn.preprocessing import MultiLabelBinarizer

etiquettes = [
    ["plage", "coucher_de_soleil"],
    ["personne"],
    ["plage", "personne", "animal"],
    [],
]
mlb = MultiLabelBinarizer(
    classes=["animal", "coucher_de_soleil", "personne", "plage"]
)
Y = mlb.fit_transform(etiquettes)

print(mlb.classes_)
print(Y)
print(Y.shape)
print(Y.sum(axis=1))
['animal' 'coucher_de_soleil' 'personne' 'plage']
[[0 1 0 1]
 [0 0 1 0]
 [1 0 1 1]
 [0 0 0 0]]
(4, 4)
[2 1 3 0]

Ερμηνεία : το Y είναι πίνακας (n, K), και όχι πλέον διάνυσμα. Το άθροισμα ανά γραμμή ισούται με 2, 1, 3, 0: δεν περιορίζεται στο 1.

5.2 Η αυστηρή διάκριση από το πολυκλασικό

Ένας πολυκλασικός στόχος κωδικοποιημένος σε δείκτες (one-hot) παράγει επίσης πίνακα (n, K). Η σύγχυση είναι συχνή και η τυπική διάκριση είναι ωστόσο σαφής.

python
from sklearn.preprocessing import LabelBinarizer

lb = LabelBinarizer()
print(lb.fit_transform(["Technique", "Facturation", "Commercial", "Technique"]))
[[0 0 1]
 [0 1 0]
 [1 0 0]
 [0 0 1]]
ΚριτήριοΠολυκλασικό κωδικοποιημένο σε δείκτεςΠολυετικετικό
Μορφή του πίνακα(n, K)(n, K)
Άθροισμα κάθε γραμμήςΑκριβώς 1Μεταξύ 0 και K
Αποδεκτό μηδενικό διάνυσμαΌχιΝαι
Έξοδος του μοντέλουsoftmax, πιθανότητες που αθροίζουν σε 1K ανεξάρτητες σιγμοειδείς
Συνήθης συνάρτηση απώλειαςΚατηγορική διασταυρούμενη εντροπίαΆθροισμα K δυαδικών διασταυρούμενων εντροπιών
Ανασύνθεση της ετικέταςargmax επί της γραμμήςΑνεξάρτητο κατώφλι κάθε στήλης

Κριτήριο αναγνώρισης : Y.sum(axis=1) σταθερό και ίσο με 1 υπογράφει κωδικοποιημένο πολυκλασικό· κάθε άλλη κατανομή υπογράφει πολυετικετικό.

Αυτό το σχήμα είναι η δυαδική συνάφεια (binary relevance): K ανεξάρτητοι δυαδικοί ταξινομητές. Είναι απλό και παραλληλοποιήσιμο, αλλά αγνοεί εκ κατασκευής τις συσχετίσεις μεταξύ ετικετών — η συχνή συνεμφάνιση plage και coucher_de_soleil δεν αξιοποιείται ποτέ. Οι αλυσίδες ταξινομητών (Read et al., 2011) το διορθώνουν προσθέτοντας τις προβλέψεις των προηγούμενων ετικετών στις ερμηνευτικές μεταβλητές των επόμενων.

5.3 Συνέπεια επί των μετρικών

Μια πολυετικετική πρόβλεψη μπορεί να είναι μερικώς ορθή, κατάσταση που δεν υπάρχει ούτε στο δυαδικό ούτε στο πολυκλασικό. Οι μετρικές πρέπει να το λάβουν υπόψη.

python
import numpy as np
from sklearn.metrics import accuracy_score, hamming_loss, f1_score

Y_true = np.array([[1,1,0,0], [0,0,1,0], [1,0,1,1], [0,0,0,1], [1,1,1,0]])
Y_pred = np.array([[1,1,0,0], [0,0,1,0], [1,0,1,0], [0,1,0,1], [1,0,1,0]])

print("exactitude exacte :", accuracy_score(Y_true, Y_pred))
print("hamming loss      :", round(hamming_loss(Y_true, Y_pred), 3))
print("F1 micro          :", round(f1_score(Y_true, Y_pred, average="micro"), 3))
print("F1 macro          :", round(f1_score(Y_true, Y_pred, average="macro"), 3))
exactitude exacte : 0.4
hamming loss      : 0.15
F1 micro          : 0.842
F1 macro          : 0.792

Ερμηνεία : η ακριβής ορθότητα (subset accuracy) απονέμει τον βαθμό μόνον αν όλες οι ετικέτες της γραμμής είναι ορθές· πέφτει στο 0,40 ενώ το 85 % των αποφάσεων ετικέτα προς ετικέτα είναι σωστές. Αυτοί οι δύο αριθμοί περιγράφουν το ίδιο μοντέλο και δεν είναι αντιφατικοί: απαντούν σε δύο διαφορετικές ερωτήσεις.

ΜετρικήΤι μετράΣυνιστώμενη χρήση
Ακριβής ορθότητα (subset accuracy)Αναλογία γραμμών πλήρως ορθώνΠολύ αυστηρή· σχετική αν η έξοδος καταναλώνεται ως σύνολο
Hamming lossΑναλογία εσφαλμένων ατομικών ετικετώνΣυνολικός δείκτης ανεκτικός στα μερικά σφάλματα
F1 μικροΣυναθροίζει τις καταμετρήσεις σε όλες τις ετικέτεςΚυριαρχείται από τις συχνές ετικέτες
F1 μακροΜέσος των F1 ανά ετικέταΔίνει ίσο βάρος στις σπάνιες ετικέτες
F1 ανά ετικέταΛεπτομέρεια ετικέτα προς ετικέταΔιάγνωση· απαραίτητη στην πλοήγηση

Σημείο προσοχής : σχεδόν όλες οι ετικέτες ενός ρεαλιστικού πολυετικετικού προβλήματος είναι σπάνιες. Ένα μοντέλο που προβλέπει συστηματικά το μηδενικό διάνυσμα λαμβάνει συχνά εξαιρετικό hamming loss. Η ανάγνωση ετικέτα προς ετικέτα δεν είναι προαιρετική.


6. Η λογιστική παλινδρόμηση: ταξινομητής με παραπλανητικό όνομα

Αυτή είναι η συχνότερη παγίδα ονομασίας του πεδίου. Η λογιστική παλινδρόμηση φέρει τη λέξη «παλινδρόμηση» και επιλύει πρόβλημα ταξινόμησης.

ΟΡΙΣΜΟΣ — Λογιστική παλινδρόμηση (logistic regression)

Αυστηρός ορισμός

Γενικευμένο γραμμικό μοντέλο (Nelder και Wedderburn, 1972) για απόκριση νόμου Bernoulli, του οποίου η συνάρτηση σύνδεσης είναι το logit. Το μοντέλο υποθέτει

logit(p(x)) = ln( p(x) / (1 − p(x)) ) = β_0 + β_1 x_1 + ... + β_p x_p

όπου p(x) = P(Y = 1 | X = x). Αντιστρέφοντας τη σύνδεση, λαμβάνουμε

p(x) = 1 / (1 + exp(−(β_0 + β·x))), δηλαδή τη λογιστική συνάρτηση εφαρμοσμένη σε γραμμικό συνδυασμό των ερμηνευτικών μεταβλητών. Οι συντελεστές εκτιμώνται με μεγιστοποίηση της πιθανοφάνειας.

Μετάφραση σε καθημερινή γλώσσα

Προσαρμόζουμε μια ευθεία, όχι επί της ίδιας της κλάσης, αλλά επί του λογαρίθμου της πιθανότητας του γεγονότος· κατόπιν μετατρέπουμε αυτό το αποτέλεσμα σε πιθανότητα μέσω καμπύλης σε S μεταξύ 0 και 1.

Σημείο προσοχής

Η εγγενής έξοδος του μοντέλου είναι μια πιθανότητα, όχι μια κλάση. Η ταξινόμηση εμφανίζεται μόνον στο επόμενο βήμα, με σύγκριση με κατώφλι (κεφάλαιο 062). Το μοντέλο είναι επομένως όντως παλινδρόμηση επί συνεχούς ποσότητας — της πιθανότητας — στην υπηρεσία ενός έργου ταξινόμησης.

6.1 Η προέλευση του ονόματος

ΒήμαΣυμβολήΕπίδραση στην ονομασία
Verhulst, 1838-1845Εισάγει τη λογιστική συνάρτηση για τη μοντελοποίηση της αύξησης πληθυσμού υπό περιορισμόΠαρέχει το επίθετο «λογιστική», που δηλώνει την καμπύλη σε S
Berkson, 1944Επινοεί τον όρο logit και προωθεί το μοντέλο στη βιοστατιστικήΕγκαθιστά τη σύνδεση logit ως πρότυπο
Cox, 1958Τυποποιεί την ανάλυση δυαδικών δεδομένων με αυτό το μοντέλοΔιάδοση στην εφαρμοσμένη στατιστική
Nelder και Wedderburn, 1972Ενοποιητικό πλαίσιο των γενικευμένων γραμμικών μοντέλωνΚατατάσσει το μοντέλο στην οικογένεια «παλινδρόμηση», κατά συγγένεια με τη γραμμική παλινδρόμηση

Η λέξη «παλινδρόμηση» είναι επομένως κληρονομιά της στατιστικής οικογένειας του μοντέλου — γραμμικό μοντέλο προσαρμοσμένο σε μετασχηματισμό της δεσμευμένης προσδοκίας —, όχι περιγραφή του επιλυόμενου έργου.

6.2 Επαλήθευση στη scikit-learn

python
from sklearn.base import is_classifier, is_regressor
from sklearn.linear_model import LogisticRegression, LinearRegression

print(is_classifier(LogisticRegression()), is_regressor(LogisticRegression()))
print(is_classifier(LinearRegression()), is_regressor(LinearRegression()))
print(hasattr(LogisticRegression(), "predict_proba"))
True False
False True
True

Ερμηνεία : η scikit-learn κατατάσσει το LogisticRegression στη μονάδα linear_model — κατά μαθηματική οικογένεια — αλλά το εκθέτει ως ταξινομητή: το is_classifier επιστρέφει True, η κλάση κληρονομεί από το ClassifierMixin, διαθέτει predict_proba, το predict επιστρέφει ετικέτες και το score υπολογίζει ορθότητα. Η κατάταξη της μονάδας μεταφράζει την αλγοριθμική συγγένεια· η διεπαφή μεταφράζει το έργο.

python
import numpy as np

X = np.array([[10.0], [20.0], [30.0], [40.0], [50.0], [60.0]])
y = np.array([0, 0, 0, 1, 1, 1])

clf = LogisticRegression().fit(X, y)
print(clf.classes_)
print(clf.predict_proba(np.array([[25.0], [45.0]])).round(3))
print(clf.predict(np.array([[25.0], [45.0]])))
[0 1]
[[0.997 0.003]
 [0.003 0.997]]
[0 1]

Ερμηνεία : το predict_proba επιστρέφει πίνακα (2, 2) πιθανοτήτων που αθροίζουν σε 1 ανά γραμμή — η εγγενής, συνεχής έξοδος. Το predict επιστρέφει ετικέτες κλάσης 0 και 1 — την έξοδο μετά κατώφλι στο 0,5. Ο πλήρης μηχανισμός αντιμετωπίζεται στο κεφάλαιο 036.

6.3 Οι άλλες ονομασίες προς επιτήρηση

ΌνομαΠραγματική φύσηΠαρατήρηση
LogisticRegressionΤαξινομητήςΔυαδικός, ή πολυκλασικός σε πολυωνυμική διατύπωση
RidgeClassifierΤαξινομητήςΠαλινδρόμηση Ridge επί στόχου κωδικοποιημένου −1 / +1, κατόπιν πρόσημο
SGDClassifierΤαξινομητήςΒελτιστοποιητής, όχι οικογένεια μοντέλων· η απώλεια καθορίζει το μοντέλο
LinearSVCΤαξινομητήςΤο «C» για Classifier· το LinearSVR είναι η παραλλαγή παλινδρόμησης
LinearRegressionΠαλινδρομητήςΣυνεχής αριθμητικός στόχος
Ordinal regressionΤαξινομητήςΚαθιερωμένος όρος για την τακτική ταξινόμηση (σημείο 4)
KNeighborsClassifier / KNeighborsRegressorΤαξινομητής / ΠαλινδρομητήςΊδιος αλγόριθμος, δύο έργα, δύο διακριτές κλάσεις

Επαγγελματικός κανόνας : το όνομα μιας κλάσης δηλώνει τη μαθηματική οικογένειά της ή την ιστορία της· μόνον η φύση της μεταβλητής στόχου καθορίζει το έργο. Σε περίπτωση αμφιβολίας, το is_classifier και η παρουσία του predict_proba αποφασίζουν.


7. Συνοπτικός πίνακας των τεσσάρων τύπων

ΚριτήριοΔυαδικήΠολυκλασικήΤακτικήΠολυετικετική
Αριθμός κλάσεωνK = 2K > 2K > 2K ≥ 2
Ετικέτες ανά παρατήρηση1110 έως K
Διάταξη επί των κλάσεωνΆνευ αντικειμένουΌχιΝαι, χωρίς απόστασηΆνευ αντικειμένου
Μορφή του y(n,)(n,)(n,) διατεταγμένο(n, K) δυαδικό
Εγγενής έξοδος του μοντέλου1 πιθανότηταK πιθανότητες softmaxΣωρευτικές πιθανότητες ή τάξηK ανεξάρτητες πιθανότητες
Άθροισμα των πιθανοτήτων111Χωρίς περιορισμό
ΠαράδειγμαΔόλια συναλλαγή ή όχιΔρομολόγηση εισιτηρίου προς ομάδαΕπίπεδο πιστωτικού κινδύνουΕπισημείωση φωτογραφίας
Κατάλληλες μετρικέςΑκρίβεια, ανάκληση, F1, ROC-AUC, PR-AUCΟρθότητα, F1 μακρο / μικρο / σταθμισμένο, πίνακας σύγχυσηςMAE επί τάξεων, τετραγωνικά σταθμισμένο κάππα, πίνακας σύγχυσηςHamming loss, F1 μικρο / μακρο, F1 ανά ετικέτα, ακριβής ορθότητα
Μετρική προς αποκλεισμόΟρθότητα αν έντονη ανισορροπίαΟρθότητα αν έντονη ανισορροπίαΟρθότητα μόνη: τυφλή στο πλάτοςΑκριβής ορθότητα μόνη: υπερβολικά αυστηρή
Κεφάλαια παραπομπής052 έως 064065067, 069, 052065, 059

Τρία αναλλοίωτα προς απομνημόνευση :

  1. Δυαδική, πολυκλασική και τακτική μοιράζονται την ίδια μορφή του y· μόνον ο αριθμός των τρόπων και η παρουσία διάταξης τις χωρίζουν.
  2. Το πολυετικετικό είναι ο μόνος τύπος του οποίου ο στόχος είναι πίνακας.
  3. Ο τύπος ταξινόμησης καθορίζει τις αποδεκτές μετρικές πριν καθορίσει τους αλγορίθμους.

8. Συχνά σφάλματα συλλογισμού

ΣΦΑΛΜΑ — Χαρακτηρισμός ως πολυκλασικού ενός πολυετικετικού προβλήματος

Το κριτήριο δεν είναι ο αριθμός των κλάσεων αλλά ο αριθμός των ετικετών ανά παρατήρηση. Ένα πρόβλημα τριών κλάσεων του οποίου μια παρατήρηση μπορεί να φέρει δύο ετικέτες είναι πολυετικετικό, όχι πολυκλασικό.

Σωστή διατύπωση : «Το πολυκλασικό προϋποθέτει την αμοιβαία αποκλειστικότητα των κλάσεων· μόλις μια παρατήρηση μπορεί να φέρει πολλές ετικέτες ταυτόχρονα, το πρόβλημα είναι πολυετικετικό και ο στόχος γίνεται πίνακας (n, K)

ΣΦΑΛΜΑ — Αντιμετώπιση τακτικού στόχου ως παλινδρόμησης χωρίς αιτιολόγηση

Η κωδικοποίηση Faible, Moyen, Élevé, Critique σε 0, 1, 2, 3 και κατόπιν παλινδρόμηση υποθέτει ότι οι αποκλίσεις μεταξύ διαδοχικών επιπέδων είναι ίσες. Μια τακτική κλίμακα δεν φέρει αυτή την πληροφορία (Stevens, 1946).

Σωστή διατύπωση : «Η παλινδρόμηση επί των τάξεων είναι πραγματιστική προσέγγιση της οποίας η υπόθεση ισαπόστασης πρέπει να διατυπωθεί και, ει δυνατόν, να αιτιολογηθεί από το επιχειρηματικό πεδίο· δεν είναι η αντιμετώπιση αναφοράς.»

ΣΦΑΛΜΑ — Αντιμετώπιση τακτικού στόχου ως ονομαστικού πολυκλασικού

Η ονομαστική αντιμετώπιση καθιστά όλες τις συγχύσεις ισοδύναμες. Η σύγχυση Critique και Faible καταλογίζεται τότε στον ίδιο βαθμό με τη σύγχυση Élevé και Critique, ενώ το επιχειρηματικό κόστος διαφέρει κατά τάξη μεγέθους.

Σωστή διατύπωση : «Η ονομαστική αντιμετώπιση τακτικού στόχου είναι αποδεκτή ως σημείο εκκίνησης, υπό τον όρο να συμπληρωθεί η ορθότητα με μετρική ευαίσθητη στο πλάτος του σφάλματος, όπως το MAE επί των τάξεων ή το τετραγωνικά σταθμισμένο κάππα.»

ΣΦΑΛΜΑ — Πεποίθηση ότι η λογιστική παλινδρόμηση είναι μοντέλο παλινδρόμησης

Το όνομα παραπέμπει στην οικογένεια των γενικευμένων γραμμικών μοντέλων και στη λογιστική συνάρτηση του Verhulst, όχι στη φύση του έργου. Ο στόχος είναι κατηγορικός.

Σωστή διατύπωση : «Η λογιστική παλινδρόμηση είναι αλγόριθμος ταξινόμησης. Παλινδρομεί το logit μιας πιθανότητας επί των ερμηνευτικών μεταβλητών· η απόφαση κλάσης προκύπτει από σύγκριση αυτής της πιθανότητας με κατώφλι.»

ΣΦΑΛΜΑ — Να αφεθεί η θετική κλάση να οριστεί από την αλφαβητική σειρά

Με κειμενικές ετικέτες, η εξ ορισμού σειρά της scikit-learn είναι αλφαβητική. Το "Fraude" γίνεται τότε η αρνητική κλάση και το "Normal" η θετική: ακρίβεια και ανάκληση υπολογίζονται ορθώς, αλλά επί της κλάσης που δεν ενδιαφέρει κανέναν.

Σωστή διατύπωση : «Η θετική κλάση ορίζεται ρητά ως η κλάση ενδιαφέροντος, γενικά το σπάνιο και δαπανηρό γεγονός, και αυτή η ονομασία συνοδεύει συστηματικά την απόδοση των μετρικών.»

ΣΦΑΛΜΑ — Πεποίθηση ότι K > 2 επιβάλλει αποσύνθεση OvR ή OvO

Τα δέντρα, τα δάση, οι μέθοδοι boosting, KNN, Naive Bayes, η πολυωνυμική λογιστική παλινδρόμηση και τα νευρωνικά δίκτυα αντιμετωπίζουν εγγενώς το K > 2. Η αποσύνθεση αφορά μόνον τους εγγενώς δυαδικούς αλγορίθμους.

Σωστή διατύπωση : «Η αποσύνθεση ένα-έναντι-όλων ή ένα-έναντι-ενός είναι μηχανισμός συμβατότητας για τους δυαδικούς ταξινομητές, εφαρμοζόμενος διαφανώς από τη βιβλιοθήκη, και όχι υποχρεωτικό βήμα του πολυκλασικού.»

ΣΦΑΛΜΑ — Πλοήγηση πολυετικετικού μοντέλου μόνον επί της ακριβούς ορθότητας

Η ακριβής ορθότητα απαιτεί όλες οι ετικέτες μιας παρατήρησης να είναι ταυτόχρονα ορθές. Σε K ετικέτες, καταρρέει μηχανικά όταν το K αυξάνεται, ακόμη και για μοντέλο του οποίου κάθε ατομική απόφαση είναι καλή.

Σωστή διατύπωση : «Ένα πολυετικετικό μοντέλο πλοηγείται επί συνόλου μετρικών: hamming loss για τη συνολική όψη, F1 μακρο για την ευαισθησία στις σπάνιες ετικέτες, και F1 ανά ετικέτα για τη διάγνωση.»


9. Σύνθεση

ΟΙ ΤΡΕΙΣ ΕΡΩΤΗΣΕΙΣ ΧΑΡΑΚΤΗΡΙΣΜΟΥ
    1. Πολλές ετικέτες ανά παρατήρηση;   Ναι -> ΠΟΛΥΕΤΙΚΕΤΙΚΟ
    2. Πόσες αποκλειστικές κλάσεις;      K = 2 -> ΔΥΑΔΙΚΟ
    3. Είναι οι κλάσεις διατεταγμένες;   Ναι -> ΤΑΚΤΙΚΟ
                                         Όχι -> ΠΟΛΥΚΛΑΣΙΚΟ

ΜΟΡΦΗ ΤΟΥ ΣΤΟΧΟΥ
    Δυαδικό      y μορφής (n,)      τιμές 0 / 1
    Πολυκλασικό  y μορφής (n,)      K μη διατεταγμένοι τρόποι
    Τακτικό      y μορφής (n,)      K διατεταγμένοι τρόποι, χωρίς απόσταση
    Πολυετικετικό Y μορφής (n, K)   δυαδικός πίνακας, ελεύθερο άθροισμα γραμμής

ΤΥΠΙΚΗ ΥΠΟΓΡΑΦΗ ΤΟΥ ΠΟΛΥΕΤΙΚΕΤΙΚΟΥ
    Y.sum(axis=1) σταθερό και ίσο με 1  ->  κωδικοποιημένο πολυκλασικό
    Y.sum(axis=1) οποιοδήποτε           ->  πολυετικετικό

ΘΕΤΙΚΗ ΚΛΑΣΗ (δυαδικό)
    Πάντα οριζόμενη ρητά: το σπάνιο, δαπανηρό, ενεργοποιήσιμο γεγονός.
    Η αντιστροφή ανταλλάσσει ανάκληση και ειδικότητα και μετατρέπει το AUC σε 1 - AUC.

ΤΑΚΤΙΚΟΣ ΣΤΟΧΟΣ
    Αντιμετωπισμένος ως πολυκλασικό: απώλεια της διάταξης, όλα τα σφάλματα ισοδύναμα.
    Αντιμετωπισμένος ως παλινδρόμηση: υπόθεση ίσων αποκλίσεων, αθεμελίωτη (Stevens 1946).
    Σύμφωνη αντιμετώπιση: σωρευτικά μοντέλα, μετρικές ευαίσθητες στην απόκλιση.

ΑΠΟΣΥΝΘΕΣΗ ΠΟΛΥΚΛΑΣΙΚΟΥ
    Ένα-έναντι-όλων : K ταξινομητές,        ανισόρροπα υποπροβλήματα
    Ένα-έναντι-ενός : K(K-1)/2 ταξινομητές, υποπροβλήματα μεγέθους 2n/K

ΛΟΓΙΣΤΙΚΗ ΠΑΛΙΝΔΡΟΜΗΣΗ
    Όνομα κληρονομημένο από τη λογιστική συνάρτηση (Verhulst) και την οικογένεια των
    γενικευμένων γραμμικών μοντέλων (Nelder και Wedderburn, 1972).
    Επιλυόμενο έργο: ΤΑΞΙΝΟΜΗΣΗ. Εγγενής έξοδος: μια πιθανότητα.
    Λεπτομέρεια στο κεφάλαιο 036.

Δήλωση σύνθεσης

Ο τύπος ενός έργου ταξινόμησης διαβάζεται στη μορφή της μεταβλητής στόχου και όχι στο χρησιμοποιούμενο λεξιλόγιο: ένα διάνυσμα δύο τρόπων δηλώνει δυαδικό πρόβλημα, ένα διάνυσμα K τρόπων πολυκλασικό πρόβλημα — τακτικό αν αυτοί οι τρόποι είναι ταξινομημένοι χωρίς να είναι μετρημένοι —, ένας δυαδικός πίνακας πολυετικετικό πρόβλημα· και το όνομα ενός αλγορίθμου, όπως εκείνο της λογιστικής παλινδρόμησης, πληροφορεί για τη μαθηματική οικογένειά του, ποτέ για το έργο που επιλύει.


Σχετικά κουίζ

  • 011.1-quiz-qualification-tache.md
  • 011.2-quiz-classification-binaire.md
  • 011.3-quiz-classification-multiclasse.md
  • 011.4-quiz-classification-ordinale.md
  • 011.5-quiz-classification-multilabel.md
  • 011.6-quiz-regression-logistique.md
  • 011.7-quiz-synthese-comparative.md

Επόμενο κεφάλαιο : 012-cycle-de-vie-ml.md