Το κεφάλαιο 010 καθιέρωσε την πρώτη απόφαση μοντελοποίησης: ο στόχος είναι κατηγορικός ή αριθμητικός. Η απάντηση «κατηγορικός» δεν κλείνει το πλαισίωμα. Απομένει να καθοριστεί ποιος τύπος ταξινόμησης πρόκειται, διότι αυτός ο τύπος καθορίζει τη μορφή της μεταβλητής στόχου, τους χρησιμοποιήσιμους αλγορίθμους, τις αποδεκτές μετρικές και την ερμηνεία ενός σφάλματος.
Αυστηρός ορισμός
Έστω χώρος εισόδου X και πεπερασμένο σύνολο ετικετών
C = {c_1, ..., c_K} πληθικότητας K ≥ 2. Ένα έργο ταξινόμησης συνίσταται στην
επαγωγή, από δείγμα {(x_i, y_i)}, i = 1..n, μιας συνάρτησης απόφασης
f : X → Y της οποίας ο χώρος άφιξης Y κατασκευάζεται επί του C σύμφωνα με
μία από δύο κατασκευές, που θεμελιώνουν τη διαμέριση αυτού του κεφαλαίου:
Y = C — κάθε παρατήρηση λαμβάνει ακριβώς μία ετικέτα μεταξύ K.
Το πρόβλημα λέγεται μονοετικετικό (single-label).Y = {0, 1}^K, σύνολο των μερών του C — κάθε παρατήρηση λαμβάνει ένα
οποιοδήποτε υποσύνολο ετικετών, ενδεχομένως κενό. Το πρόβλημα λέγεται
πολυετικετικό (multilabel).Μετάφραση σε καθημερινή γλώσσα
Το να ταξινομήσετε σημαίνει να αποδώσετε ετικέτες ληφθείσες από κλειστή λίστα. Η πρώτη ερώτηση προς επίλυση είναι αν μια παρατήρηση λαμβάνει μία μόνον ή πολλές.
Σημείο προσοχής
Η λίστα των ετικετών θεωρείται κλειστή και γνωστή στην εκπαίδευση. Ένας ταξινομητής δεν μπορεί να προβλέψει κλάση που δεν έχει ποτέ παρατηρήσει· η διαχείριση των πρωτόγνωρων κλάσεων ανήκει στην ανίχνευση ανωμαλιών (κεφάλαιο 003).
| Σειρά | Ερώτηση | Απάντηση | Διατηρούμενος τύπος |
|---|---|---|---|
| 1 | Μπορεί μια παρατήρηση να φέρει πολλές ετικέτες ταυτόχρονα; | Ναι | Πολυετικετική |
| 2 | Πόσες αμοιβαία αποκλειστικές κλάσεις; | K = 2 | Δυαδική |
| 2 | Πόσες αμοιβαία αποκλειστικές κλάσεις; | K > 2 | Μετάβαση στην ερώτηση 3 |
| 3 | Είναι οι κλάσεις εφοδιασμένες με φυσική ολική διάταξη; | Όχι | Πολυκλασική (ονομαστική) |
| 3 | Είναι οι κλάσεις εφοδιασμένες με φυσική ολική διάταξη; | Ναι | Τακτική |
Η σειρά δεν είναι αυθαίρετη: η ερώτηση της αποκλειστικότητας προέχει, διότι αλλάζει
την ίδια τη μορφή του πίνακα στόχου — διάνυσμα στη μία περίπτωση, πίνακας στην
άλλη. Οι ερωτήσεις 2 και 3 αφορούν μόνον την εσωτερική δομή του C.
Το ίδιο επιχειρηματικό φαινόμενο δέχεται συχνά πολλές έγκυρες διατυπώσεις. Μια
έρευνα ικανοποίησης βαθμολογημένη από 1 έως 5 μπορεί να αντιμετωπιστεί ως τακτικός
στόχος πέντε επιπέδων, ως δυαδικός στόχος μετά ομαδοποίηση ({1,2,3} έναντι
{4,5}), ή ως αριθμητικός στόχος.
Το κριτήριο απόφασης είναι η χρήση της πρόβλεψης. Αν η κατάντη λειτουργική απόφαση είναι δυαδική — επαναπροσέγγιση του πελάτη ή όχι —, η δυαδική διατύπωση συγκεντρώνει την ικανότητα του μοντέλου στο μόνο χρήσιμο σύνορο.
Σημείο προσοχής : η ομαδοποίηση κλάσεων είναι μη αναστρέψιμη από την άποψη του μοντέλου. Ένα μοντέλο εκπαιδευμένο σε δύο επίπεδα δεν θα αποκαταστήσει ποτέ την κοκκοποίηση των πέντε επιπέδων.
Αυστηρός ορισμός
Περίπτωση της μονοετικετικής ταξινόμησης όπου K = 2 : C = {c_0, c_1} και
Y = C. Η συνάρτηση απόφασης f : X → {c_0, c_1} διαμερίζει τον χώρο εισόδου
σε δύο περιοχές χωρισμένες από σύνορο απόφασης.
Οι περισσότεροι αλγόριθμοι δεν μαθαίνουν το f απευθείας, αλλά μια συνάρτηση
βαθμολογίας s : X → ℝ ή μια εκτίμηση δεσμευμένης πιθανότητας
p(x) = P(Y = c_1 | X = x), η απόφαση προκύπτοντας από σύγκριση με κατώφλι
t : f(x) = c_1 αν p(x) ≥ t, c_0 διαφορετικά.
Μετάφραση σε καθημερινή γλώσσα
Δύο δυνατές απαντήσεις, και μόνον δύο. Το μοντέλο παράγει στην πραγματικότητα έναν βαθμό εμπιστοσύνης, μετατρεπόμενο σε απάντηση με καθορισμό μιας ράβδου.
Σημείο προσοχής
Ο διαχωρισμός μεταξύ της εκτίμησης του p(x) και της επιλογής του κατωφλίου t
είναι θεμελιώδης. Το κατώφλι 0,5 είναι σύμβαση υλοποίησης, ποτέ αποδεδειγμένο
βέλτιστο. Η ρύθμισή του αντιμετωπίζεται στο κεφάλαιο 062.
Η χρήση επιβάλλει την κωδικοποίηση του δυαδικού στόχου με τους ακέραιους 0 και
1. Αυτή η σύμβαση είναι δομική, όχι διακοσμητική.
| Ιδιότητα | Συνέπεια της σύμβασης 0 / 1 |
|---|---|
y.mean() | Δίνει απευθείας τον επιπολασμό της κλάσης 1 |
| Πιθανοφάνεια Bernoulli | Γράφεται p^y · (1−p)^(1−y), βάση της log-loss (κεφάλαιο 061) |
predict_proba | Επιστρέφει πίνακα (n, 2)· η στήλη δείκτη 1 φέρει την κλάση 1 |
| Πίνακας σύγχυσης | Η σειρά [0, 1] καθορίζει τη διάταξη TN, FP, FN, TP (κεφάλαιο 052) |
| Ακρίβεια, ανάκληση, F1 | Υπολογίζονται ως προς την κλάση 1 εξ ορισμού |
Σημείο προσοχής : η scikit-learn διατάσσει τις κλάσεις με αύξουσα ταξινόμηση,
στην ιδιότητα classes_. Με κειμενικές ετικέτες {"Fraude", "Normal"}, η
αλφαβητική σειρά τοποθετεί το "Fraude" στον δείκτη 0 — το αντίστροφο της
επιχειρηματικής πρόθεσης. Η ρητή κωδικοποίηση του στόχου σε 0/1 καταργεί αυτόν
τον κίνδυνο.
| transaction_id | montant | pays_carte | pays_marchand | heure | canal | est_fraude |
|---|---|---|---|---|---|---|
| T-000001 | 42,90 | FR | FR | 14 | Boutique | 0 |
| T-000002 | 1 890,00 | FR | RU | 3 | En ligne | 1 |
| T-000003 | 12,50 | FR | FR | 9 | Boutique | 0 |
| T-000004 | 7,20 | FR | FR | 19 | En ligne | 0 |
| T-000005 | 2 450,00 | FR | US | 4 | En ligne | 1 |
import pandas as pd
df = pd.read_csv("transactions.csv")
y = df["est_fraude"]
print(y.shape)
print(y.dtype)
print(sorted(y.unique()))
print(y.value_counts(normalize=True).round(4))(284807,)
int64
[0, 1]
est_fraude
0 0.9983
1 0.0017
Name: proportion, dtype: float64Ερμηνεία : το y είναι μονοδιάστατο διάνυσμα μήκους n, μία τιμή ανά
παρατήρηση, με δύο τρόπους κωδικοποιημένους 0 και 1. Η θετική κλάση
αντιπροσωπεύει το 0,17 % των παρατηρήσεων: το πρόβλημα είναι ισχυρά ανισόρροπο,
πράγμα που αποκλείει την ορθότητα ως μετρική πλοήγησης και επιβάλλει την
αντιμετώπιση των κεφαλαίων 050 και 051.
Αυστηρός ορισμός
Σε δυαδικό πρόβλημα, η θετική κλάση είναι εκείνη ως προς την οποία ορίζονται οι καταμετρήσεις του πίνακα σύγχυσης — αληθώς θετικά, ψευδώς θετικά, ψευδώς αρνητικά — και επομένως οι ασύμμετρες μετρικές που παράγονται από αυτές: ακρίβεια, ανάκληση, ειδικότητα, F-beta.
Μετάφραση σε καθημερινή γλώσσα
Η θετική κλάση είναι εκείνη που το μοντέλο είναι επιφορτισμένο να ανιχνεύσει. Η λέξη «θετικό» δεν φέρει καμία ευνοϊκή χροιά: ένα θετικό αποτέλεσμα προληπτικού ελέγχου είναι κακό αποτέλεσμα για τον ασθενή.
Κανόνας ονομασίας
Η θετική κλάση είναι, κατά επαγγελματική σύμβαση, η κλάση ενδιαφέροντος: το σπάνιο, δαπανηρό ή ενεργοποιήσιμο γεγονός — απάτη, αθέτηση πληρωμής, ασθένεια, αναχώρηση πελάτη, βλάβη. Συμπίπτει στη μεγάλη πλειονότητα των περιπτώσεων με την μειοψηφική κλάση.
Σημείο προσοχής
Αυτή η ονομασία είναι ρητή απόφαση μοντελοποίησης. Το να την αφήσουμε να εξαρτηθεί από την αλφαβητική σειρά των ετικετών παράγει μετρικές ορθώς υπολογισμένες αλλά ερμηνευμένες αντίστροφα.
Η αντιστροφή της θετικής κλάσης δεν αλλάζει το μοντέλο, αλλά αλλάζει το νόημα όλων των ασύμμετρων μετρικών.
| Μέγεθος | Επίδραση της αντιστροφής της θετικής κλάσης |
|---|---|
| Εκμαθημένο μοντέλο, σύνορο απόφασης | Αμετάβλητο |
| Ορθότητα (accuracy) | Αμετάβλητη — συμμετρική μετρική |
| Ακρίβεια, ανάκληση, F1 | Αλλάζουν τιμή: αφορούν την άλλη κλάση |
| Ανάκληση και ειδικότητα | Ανταλλάσσονται |
| Ψευδώς θετικά και ψευδώς αρνητικά | Ανταλλάσσονται |
| ROC-AUC | Γίνεται 1 − AUC |
| PR-AUC | Αλλάζει ριζικά: η γραμμή βάσης περνά από τον επιπολασμό της μιας κλάσης σε εκείνον της άλλης |
Λειτουργική συνέπεια : μια ανακοινωμένη ανάκληση 0,92 δεν έχει κανένα νόημα εφόσον η θετική κλάση δεν έχει ονομαστεί. Κάθε απόδοση αποτελεσμάτων δυαδικής ταξινόμησης πρέπει να την διατυπώνει ρητά.
Ένα εργαστήριο ανακοινώνει ότι το τεστ του «ανιχνεύει το 95 % των περιπτώσεων». Η φράση είναι μη εκμεταλλεύσιμη όσο αγνοούμε τι ανιχνεύεται.
Αν πρόκειται για ανίχνευση των ασθενών, το 95 % είναι η ανάκληση επί της κλάσης «άρρωστος»: πέντε ασθενείς στους εκατό διαφεύγουν.
Αν πρόκειται για ανίχνευση των υγιών, το 95 % είναι η ανάκληση επί της κλάσης «υγιής», δηλαδή η ειδικότητα: πέντε υγιείς στους εκατό ανησυχούν αδίκως, και ο ρυθμός των διαφευγόντων ασθενών παραμένει εντελώς άγνωστος.
Ο ίδιος αριθμός, υπολογισμένος στο ίδιο μοντέλο, περιγράφει δύο κλινικές πραγματικότητες χωρίς σχέση. Η ονομασία της θετικής κλάσης είναι η συνθήκη ερμηνευσιμότητας του αριθμού.
Ουσιώδες σημείο : το βήμα της ταξινόμησης καθ' εαυτό είναι η σύγκριση με το κατώφλι, κατάντη του μοντέλου· το μοντέλο παράγει ένα συνεχές μέγεθος. Αυτή η διάκριση θεμελιώνει το σημείο 6 αυτού του κεφαλαίου.
Αυστηρός ορισμός
Μονοετικετική ταξινόμηση όπου K > 2, το σύνολο C = {c_1, ..., c_K} ον
εξαντλητικό — κάθε παρατήρηση δέχεται ετικέτα στο C — και αμοιβαία
αποκλειστικό — μια παρατήρηση δέχεται ακριβώς μία. Τυπικά Y = C, και
Σ_k P(Y = c_k | X = x) = 1 για κάθε x.
Γίνεται επίσης λόγος για ονομαστική ταξινόμηση για να υπογραμμιστεί ότι το
C δεν είναι εφοδιασμένο με καμία σχέση διάταξης.
Μετάφραση σε καθημερινή γλώσσα
Περισσότερες από δύο δυνατές απαντήσεις, μία μόνον απάντηση ανά παρατήρηση, και καμία απάντηση δεν είναι «ανώτερη» από άλλη.
Σημείο προσοχής
Εξαντλητικότητα και αποκλειστικότητα είναι δύο διακριτές υποθέσεις, και οι δύο διαψεύσιμες επί των δεδομένων. Μια ονοματολογία που περιλαμβάνει τρόπο «Άλλο» ικανοποιεί την εξαντλητικότητα με τίμημα μια ετερογενή κλάση δύσκολη στη μοντελοποίηση.
Η διάκριση δεν αφορά τον αριθμό των κλάσεων αλλά τον αριθμό των ετικετών αποδιδόμενων σε μια παρατήρηση.
| Κριτήριο | Πολυκλασικό | Πολυετικετικό |
|---|---|---|
Αριθμός δυνατών κλάσεων K | K > 2 | K ≥ 2 |
| Αριθμός ετικετών ανά παρατήρηση | Ακριβώς 1 | 0, 1, ή πολλές |
| Αμοιβαία αποκλειστικότητα των κλάσεων | Ναι, εξ υποθέσεως | Όχι |
Μορφή του ακατέργαστου y | (n,) | (n, K) |
| Άθροισμα των δεικτών σε μια γραμμή | Πάντα 1 | Μεταξύ 0 και K |
| Άθροισμα των προβλεπόμενων πιθανοτήτων | 1, περιορισμός softmax | Χωρίς περιορισμό |
Λειτουργικός έλεγχος : διατυπώστε την επιχειρηματική ερώτηση με το οριστικό άρθρο. «Ποιο είναι το κίνητρο αυτού του εισιτηρίου;» δηλώνει πολυκλασικό πρόβλημα. «Ποια είναι τα κίνητρα αυτού του εισιτηρίου;» δηλώνει πολυετικετικό πρόβλημα.
| ticket_id | canal | longueur_texte | client_premium | anciennete_mois | categorie |
|---|---|---|---|---|---|
| TK-0001 | Courriel | 412 | 0 | 14 | Facturation |
| TK-0002 | Téléphone | 87 | 1 | 61 | Technique |
| TK-0003 | Formulaire | 235 | 0 | 3 | Commercial |
| TK-0004 | Courriel | 1 104 | 1 | 28 | Résiliation |
| TK-0005 | Téléphone | 156 | 0 | 9 | Technique |
y = df["categorie"]
print(y.shape)
print(y.nunique())
print(y.value_counts())(12000,)
4
categorie
Technique 5184
Facturation 3612
Commercial 2076
Résiliation 1128
Name: count, dtype: int64Ερμηνεία : το y παραμένει διάνυσμα μορφής (n,), ακριβώς όπως στη δυαδική
περίπτωση· μόνον ο αριθμός των τρόπων αλλάζει. Η μετάβαση από το δυαδικό στο
πολυκλασικό δεν τροποποιεί τη δομή του y. Τα μεγέθη κυμαίνονται από 1 128 έως
5 184, δηλαδή λόγος 4,6: η ανισορροπία είναι μέτρια αλλά επιβάλλει ήδη την
προτίμηση των μακρο-μέσων έναντι των μικρο-μέσων ώστε να μην αποκρυφθεί η κλάση
Résiliation (κεφάλαιο 065).
Ορισμένοι αλγόριθμοι είναι εγγενώς δυαδικοί — οι μηχανές διανυσμάτων στήριξης
(κεφάλαιο 041) είναι το κανονικό παράδειγμα. Δύο σχήματα αναγωγής επιτρέπουν τότε
την αντιμετώπιση K κλάσεων με δυαδικούς ταξινομητές.
Ένα-έναντι-όλων (One-vs-Rest, OvR, επίσης One-vs-All)
Εκπαιδεύονται K δυαδικοί ταξινομητές· ο ταξινομητής k αντιπαραθέτει το c_k
στην ένωση όλων των άλλων κλάσεων. Στην πρόβλεψη, κρατείται το argmax_k s_k(x).
Ένα-έναντι-ενός (One-vs-One, OvO)
Εκπαιδεύεται ένας ταξινομητής ανά ζεύγος κλάσεων, δηλαδή K(K−1)/2 ταξινομητές·
ο ταξινομητής (j, k) εκπαιδεύεται μόνον στις παρατηρήσεις του c_j ή του
c_k. Στην πρόβλεψη, κάθε ταξινομητής ψηφίζει και η πλειοψηφική κλάση υπερισχύει.
Μετάφραση σε καθημερινή γλώσσα
Ένα-έναντι-όλων: «είναι γάτα, ναι ή όχι;», κατόπιν «είναι σκύλος, ναι ή όχι;»· κρατούμε την πιο βέβαιη απάντηση. Ένα-έναντι-ενός: οργανώνουμε τουρνουά μονομαχιών μεταξύ όλων των ζευγών και μετράμε τις νίκες.
Σημείο προσοχής
Οι βαθμολογίες των K ταξινομητών OvR προέρχονται από μοντέλα εκπαιδευμένα
χωριστά, σε προβλήματα διαφορετικής δυσκολίας και επιπολασμού. Η άμεση συγκρισιμότητά
τους με argmax δεν είναι εγγυημένη: αυτή είναι η αναγνωρισμένη θεωρητική αδυναμία
της στρατηγικής.
| Κριτήριο | Ένα-έναντι-όλων (OvR) | Ένα-έναντι-ενός (OvO) |
|---|---|---|
| Αριθμός ταξινομητών | K | K(K−1)/2 |
Για K = 4 / 10 / 100 | 4 / 10 / 100 | 6 / 45 / 4 950 |
| Μέγεθος κάθε υποπροβλήματος | n παρατηρήσεις | περίπου 2n/K παρατηρήσεις |
Συνολικό κόστος, αλγόριθμος γραμμικός σε n | O(K · n) | O(K · n) |
Συνολικό κόστος, αλγόριθμος τετραγωνικός σε n | O(K · n²) | O(n²) |
| Επαγόμενη ανισορροπία | Ισχυρή: 1 κλάση έναντι K−1 | Καμία μεταξύ των δύο κλάσεων του ζεύγους |
| Ζώνες αμφισημίας | Κανένας ή πολλοί θετικοί ταξινομητές | Κυκλικές ψήφοι: το A νικά το B, το B νικά το C, το C νικά το A |
Ανάγνωση του πίνακα : ο αριθμός των μοντέλων αυξάνεται τετραγωνικά στο OvO, αλλά
κάθε μοντέλο εκπαιδεύεται μόνον σε κλάσμα των δεδομένων. Για αλγόριθμο του οποίου
το κόστος εκπαίδευσης είναι τετραγωνικό σε n — περίπτωση των SVM με πυρήνα —,
το OvO είναι επομένως συνολικά λιγότερο δαπανηρό από το OvR παρά τον ανώτερο
αριθμό μοντέλων. Αυτός είναι ο λόγος για τον οποίο η scikit-learn κρατά το OvO εξ
ορισμού για το SVC, και το OvR για το LinearSVC, του οποίου το κόστος είναι
γραμμικό.
from sklearn.datasets import make_classification
from sklearn.multiclass import OneVsRestClassifier, OneVsOneClassifier
from sklearn.svm import SVC
X, y = make_classification(n_samples=600, n_features=8, n_informative=6,
n_classes=6, n_clusters_per_class=1, random_state=0)
ovr = OneVsRestClassifier(SVC()).fit(X, y)
ovo = OneVsOneClassifier(SVC()).fit(X, y)
print("K :", len(set(y)))
print("OvR nb estimateurs :", len(ovr.estimators_))
print("OvO nb estimateurs :", len(ovo.estimators_))K : 6
OvR nb estimateurs : 6
OvO nb estimateurs : 15Ερμηνεία : 6 ταξινομητές έναντι 6 × 5 / 2 = 15. Η αποσύνθεση είναι εσωτερική
μηχανική: και στις δύο περιπτώσεις το y παραμένει διάνυσμα (n,) και το
predict επιστρέφει μοναδική ετικέτα.
| Αλγόριθμος | Αντιμετώπιση του πολυκλασικού | Κεφάλαιο |
|---|---|---|
| Δέντρο απόφασης | Εγγενής — κατανομή κλάσεων ανά φύλλο | 037 |
| Τυχαίο δάσος | Εγγενής — συνάθροιση των ψήφων των δέντρων | 038 |
| Gradient boosting | Εγγενής, γενικά με K σύνολα δέντρων | 039 |
| K πλησιέστεροι γείτονες | Εγγενής — πλειοψηφική ψηφοφορία στη γειτονιά | 040 |
| Naive Bayes | Εγγενής — argmax της εκ των υστέρων πιθανότητας | 042 |
| Λογιστική παλινδρόμηση | Εγγενής σε πολυωνυμική διατύπωση (softmax) | 036 |
| Πολυστρωματικό perceptron | Εγγενής — K νευρώνες εξόδου και softmax | 043 |
SVM με πυρήνα (SVC) | Αποσύνθεση OvO | 041 |
Γραμμικό SVM (LinearSVC) | Αποσύνθεση OvR | 041 |
Σημείο προσοχής : η ύπαρξη εγγενούς αντιμετώπισης δεν απαλλάσσει από την επαλήθευση της ανισορροπίας μεταξύ κλάσεων. Ένα πρόβλημα 12 κλάσεων εκ των οποίων τρεις συγκεντρώνουν το 90 % των μεγεθών θέτει, κλάση προς κλάση, τις ίδιες δυσκολίες με ένα ανισόρροπο δυαδικό πρόβλημα.
Αυστηρός ορισμός
Στην τυπολογία των κλιμάκων μέτρησης που πρότεινε ο S. S. Stevens (1946), μια
κλίμακα λέγεται τακτική όταν η σχέση διάταξης μεταξύ των τρόπων είναι ορισμένη
και σημαίνουσα, αλλά η απόσταση μεταξύ δύο διαδοχικών τρόπων δεν είναι. Οι
αποδεκτές πράξεις είναι η σύγκριση (<, >, =), οι τάξεις, η διάμεσος και τα
ποσοστημόρια· το άθροισμα, ο αριθμητικός μέσος και η διαφορά δεν είναι.
Η κλίμακα διαστήματος, αμέσως ανώτερη, προσθέτει τη σημασία των αποκλίσεων· η κλίμακα λόγου προσθέτει απόλυτο μηδέν.
Μετάφραση σε καθημερινή γλώσσα
Γνωρίζουμε να ταξινομήσουμε τους τρόπους από τον ασθενέστερο στον ισχυρότερο, αλλά δεν γνωρίζουμε κατά πόσο διαφέρουν.
Σημείο προσοχής
Η κωδικοποίηση τακτικής μεταβλητής σε ακέραιους 0, 1, 2, 3 είναι νόμιμη πράξη
κωδικοποίησης. Η κατόπιν αντιμετώπιση αυτών των ακεραίων ως μετρημένων ποσοτήτων
δεν είναι: η κωδικοποίηση δημιουργεί μετρική που η μέτρηση δεν φέρει.
Αυστηρός ορισμός
Μονοετικετική ταξινόμηση όπου K > 2 και όπου το C είναι εφοδιασμένο με
ολική διάταξη c_1 ≺ c_2 ≺ ... ≺ c_K σημαίνουσα για το πεδίο, χωρίς να
ορίζεται απόσταση στο C. Η συνάρτηση απώλειας πρέπει να αντανακλά αυτή τη
διάταξη: το κόστος σύγχυσης μεταξύ c_1 και c_K πρέπει να υπερβαίνει εκείνο
μιας σύγχυσης μεταξύ c_1 και c_2.
Μετάφραση σε καθημερινή γλώσσα
Κλάσεις ταξινομημένες από την ασθενέστερη στην ισχυρότερη, όπου το μεγάλο λάθος είναι σοβαρότερο από το μικρό.
Σημείο προσοχής
Η συνήθης αγγλική ονομασία είναι ordinal regression, πράγμα που συντηρεί σύγχυση με την παλινδρόμηση με την έννοια του κεφαλαίου 010. Το έργο παραμένει ταξινόμηση: ο χώρος άφιξης είναι πεπερασμένος.
| dossier_id | revenu_annuel | taux_endettement | incidents_12m | anciennete_bancaire | niveau_risque |
|---|---|---|---|---|---|
| D-0001 | 54 000 | 0,21 | 0 | 12 | Faible |
| D-0002 | 28 500 | 0,47 | 1 | 3 | Moyen |
| D-0003 | 19 200 | 0,63 | 4 | 1 | Critique |
| D-0004 | 41 000 | 0,38 | 2 | 7 | Élevé |
| D-0005 | 67 300 | 0,15 | 0 | 21 | Faible |
Η διάταξη Faible ≺ Moyen ≺ Élevé ≺ Critique φέρεται από το επιχειρηματικό πεδίο.
Κανένα δεδομένο δεν λέει ότι ένας φάκελος Critique είναι «διπλά πιο επικίνδυνος»
από έναν φάκελο Moyen.
import pandas as pd
from pandas.api.types import CategoricalDtype
ordre = CategoricalDtype(
categories=["Faible", "Moyen", "Élevé", "Critique"], ordered=True
)
y = df["niveau_risque"].astype(ordre)
print(y.dtype)
print(y.cat.codes.head().tolist())
print((y > "Moyen").head().tolist())category
[1, 0, 3, 2, 1]
[False, False, True, True, False]Ερμηνεία : το y παραμένει διάνυσμα (n,), όπως στο δυαδικό και στο
πολυκλασικό. Η διαφορά φέρεται από τον τύπο: το ordered=True καθιστά τη
σύγκριση y > "Moyen" έγκυρη και ερμηνεύσιμη. Οι κωδικοί 0 έως 3 είναι
τάξεις, όχι ποσότητες.
| Αντιμετώπιση | Τι υποτίθεται | Τι χάνεται ή εισάγεται αδίκως |
|---|---|---|
| Ως ονομαστικό πολυκλασικό | Καμία διάταξη μεταξύ των κλάσεων | Απώλεια πληροφορίας: όλες οι συγχύσεις είναι ισοδύναμες· η πρόβλεψη Faible αντί Critique κοστίζει όσο η πρόβλεψη Élevé αντί Critique |
| Ως παλινδρόμηση επί των κωδικών 0-3 | Ίσες αποκλίσεις μεταξύ διαδοχικών επιπέδων και στόχος διαστήματος | Αθεμελίωτη υπόθεση: τίποτε δεν αποδεικνύει ότι η απόκλιση Faible → Moyen ισούται με την απόκλιση Élevé → Critique· η συνεχής έξοδος επιβάλλει επιπλέον αυθαίρετα κατώφλια στρογγυλοποίησης |
| Ως τακτικό | Ολική διάταξη, μη ορισμένες αποστάσεις | Αντιμετώπιση σύμφωνη με τη φύση της μέτρησης |
Η απώλεια πληροφορίας της πολυκλασικής αντιμετώπισης μετράται απευθείας.
import numpy as np
from sklearn.metrics import accuracy_score, mean_absolute_error, cohen_kappa_score
y_true = np.array([0, 1, 2, 3, 2, 1, 0, 3, 2, 1])
pred_A = np.array([0, 1, 2, 3, 2, 1, 0, 3, 1, 1]) # μια σφάλμα μιας τάξης
pred_C = np.array([0, 1, 2, 3, 2, 1, 0, 0, 2, 1]) # μια σφάλμα τριών τάξεων
for nom, p in [("A — erreur de 1 rang", pred_A), ("C — erreur de 3 rangs", pred_C)]:
print(nom)
print(" accuracy :", accuracy_score(y_true, p))
print(" MAE rangs :", round(mean_absolute_error(y_true, p), 3))
print(" QWK :", round(cohen_kappa_score(y_true, p, weights="quadratic"), 3))A — erreur de 1 rang
accuracy : 0.9
MAE rangs : 0.1
QWK : 0.952
C — erreur de 3 rangs
accuracy : 0.9
MAE rangs : 0.3
QWK : 0.571Ερμηνεία : οι δύο προβλέψεις λαμβάνουν την ίδια ορθότητα, 0,90, ενώ η
δεύτερη συγχέει έναν φάκελο Critique με έναν φάκελο Faible — το δαπανηρότερο
σφάλμα του πεδίου. Η ορθότητα, μετρική ονομαστικής ταξινόμησης, είναι δομικά τυφλή
στο πλάτος του σφάλματος. Το MAE επί των τάξεων τις διακρίνει αμέσως, σε λόγο 1
προς 3, και το τετραγωνικά σταθμισμένο κάππα περνά από 0,952 σε 0,571.
Σημείο προσοχής : το MAE επί τάξεων είναι δείκτης σύγκρισης μεταξύ μοντέλων, όχι επιχειρηματική ποσότητα. Δεν ερμηνεύεται ως «0,3 επίπεδο κινδύνου κατά μέσο όρο», διότι το επίπεδο κινδύνου δεν είναι μετρήσιμο.
Οι θέσεις πρώτης, δεύτερης και τρίτης είναι αυστηρά διατεταγμένες: κανείς δεν αμφισβητεί ότι η πρώτη προηγείται της δεύτερης.
Τίποτε δεν επιτρέπει ωστόσο να γραφεί ότι η απόκλιση μεταξύ πρώτου και δεύτερου ισούται με την απόκλιση μεταξύ δεύτερου και τρίτου. Σε έναν αγώνα 100 μέτρων, ο πρώτος μπορεί να προηγείται του δεύτερου κατά δύο εκατοστά του δευτερολέπτου και ο δεύτερος να προηγείται του τρίτου κατά μισό δευτερόλεπτο.
Η αντιμετώπιση των τάξεων ως αριθμών θα ισοδυναμούσε με τον ισχυρισμό ότι αυτές οι δύο αποκλίσεις είναι ταυτόσημες. Η πλήρης αγνόησή τους θα ισοδυναμούσε με τον ισχυρισμό ότι το να τερματίσει κανείς τρίτος αντί πρώτος δεν είναι πιο λυπηρό από το να τερματίσει δεύτερος. Η τακτική ταξινόμηση είναι η διατύπωση που αρνείται αυτά τα δύο σφάλματα.
| Προσέγγιση | Αρχή | Παρατήρηση |
|---|---|---|
| Μοντέλο αναλογικών πιθανοτήτων (McCullagh, 1980) | Σωρευτικό λογιστικό μοντέλο: K−1 κατώφλια μοιράζονται το ίδιο διάνυσμα συντελεστών | Στατιστική αναφορά· υπόθεση αναλογικότητας των πιθανοτήτων προς επαλήθευση |
| Σωρευτική δυαδική αποσύνθεση (Frank και Hall, 2001) | K−1 δυαδικοί ταξινομητές «y > c_k ;», πιθανότητες ανασυντεθειμένες με διαφορά | Επιτρέπει τη χρήση οποιουδήποτε πιθανοτικού δυαδικού ταξινομητή |
| Παλινδρόμηση κατόπιν διακριτοποίηση | Παλινδρόμηση επί των τάξεων, κατόπιν διαίρεση με βελτιστοποιημένα κατώφλια | Απλή και συχνά αποτελεσματική· υποθέτει σιωπηρά την ισαπόσταση |
| Πολυκλασικό με ασύμμετρα κόστη | Κλασικό πολυκλασικό με πίνακα κόστους που τιμωρεί τις μεγάλες αποκλίσεις | Επανεισάγει τη διάταξη μέσω της συνάρτησης κόστους |
Προσαρμοσμένες μετρικές : MAE ή RMSE επί των τάξεων (κεφάλαια 067 και 069), τετραγωνικά σταθμισμένο κάππα (Quadratic Weighted Kappa), πίνακας σύγχυσης αναγνωσμένος παρατηρώντας τη συγκέντρωση γύρω από τη διαγώνιο (κεφάλαιο 052).
Αυστηρός ορισμός
Έργο όπου ο χώρος άφιξης είναι Y = {0, 1}^K, δηλαδή το σύνολο των μερών του
C = {c_1, ..., c_K}. Σε κάθε παρατήρηση x συνδέεται ένα δυαδικό διάνυσμα
y = (y_1, ..., y_K) όπου y_k = 1 αν η ετικέτα c_k εφαρμόζεται. Κανένας
περιορισμός δεν βαραίνει το Σ_k y_k, που μπορεί να ισούται με 0 (καμία ετικέτα)
έως K (όλες).
Οι ετικέτες δεν είναι ούτε αποκλειστικές ούτε ανεξάρτητες: η μοντελοποίηση των συσχετίσεών τους αποτελεί την ίδια δυσκολία του προβλήματος.
Μετάφραση σε καθημερινή γλώσσα
Μια παρατήρηση μπορεί να λάβει πολλές ετικέτες ταυτόχρονα, ή καμία. Κάθε ετικέτα είναι μια ερώτηση «ναι ή όχι» φαινομενικά ανεξάρτητη, αλλά οι απαντήσεις συνδέονται μεταξύ τους.
Σημείο προσοχής
Το πολυετικετικό διακρίνεται από το πολυκλασικό-πολυέξοδο (multiclass-multioutput), όπου προβλέπονται πολλές μεταβλητές στόχου, καθεμία ούσα η ίδια πολυκλασική. Το πολυετικετικό είναι η ειδική περίπτωση όπου όλες οι έξοδοι είναι δυαδικές.
| photo_id | luminance_moy | teinte_dominante | visages_detectes | plage | coucher_de_soleil | personne | animal |
|---|---|---|---|---|---|---|---|
| P-0001 | 182 | Orange | 0 | 1 | 1 | 0 | 0 |
| P-0002 | 95 | Gris | 2 | 0 | 0 | 1 | 0 |
| P-0003 | 164 | Bleu | 1 | 1 | 0 | 1 | 1 |
| P-0004 | 47 | Vert | 0 | 0 | 0 | 0 | 0 |
| P-0005 | 201 | Orange | 3 | 1 | 1 | 1 | 0 |
Μια φωτογραφία μπορεί να είναι ταυτόχρονα παραλία, ηλιοβασίλεμα και να περιέχει
πρόσωπο. Η φωτογραφία P-0004 δεν φέρει καμία από τις τέσσερις ετικέτες: το
μηδενικό διάνυσμα είναι έγκυρη παρατήρηση, πράγμα αδύνατο στο πολυκλασικό.
from sklearn.preprocessing import MultiLabelBinarizer
etiquettes = [
["plage", "coucher_de_soleil"],
["personne"],
["plage", "personne", "animal"],
[],
]
mlb = MultiLabelBinarizer(
classes=["animal", "coucher_de_soleil", "personne", "plage"]
)
Y = mlb.fit_transform(etiquettes)
print(mlb.classes_)
print(Y)
print(Y.shape)
print(Y.sum(axis=1))['animal' 'coucher_de_soleil' 'personne' 'plage']
[[0 1 0 1]
[0 0 1 0]
[1 0 1 1]
[0 0 0 0]]
(4, 4)
[2 1 3 0]Ερμηνεία : το Y είναι πίνακας (n, K), και όχι πλέον διάνυσμα. Το
άθροισμα ανά γραμμή ισούται με 2, 1, 3, 0: δεν περιορίζεται στο 1.
Ένας πολυκλασικός στόχος κωδικοποιημένος σε δείκτες (one-hot) παράγει επίσης
πίνακα (n, K). Η σύγχυση είναι συχνή και η τυπική διάκριση είναι ωστόσο σαφής.
from sklearn.preprocessing import LabelBinarizer
lb = LabelBinarizer()
print(lb.fit_transform(["Technique", "Facturation", "Commercial", "Technique"]))[[0 0 1]
[0 1 0]
[1 0 0]
[0 0 1]]| Κριτήριο | Πολυκλασικό κωδικοποιημένο σε δείκτες | Πολυετικετικό |
|---|---|---|
| Μορφή του πίνακα | (n, K) | (n, K) |
| Άθροισμα κάθε γραμμής | Ακριβώς 1 | Μεταξύ 0 και K |
| Αποδεκτό μηδενικό διάνυσμα | Όχι | Ναι |
| Έξοδος του μοντέλου | softmax, πιθανότητες που αθροίζουν σε 1 | K ανεξάρτητες σιγμοειδείς |
| Συνήθης συνάρτηση απώλειας | Κατηγορική διασταυρούμενη εντροπία | Άθροισμα K δυαδικών διασταυρούμενων εντροπιών |
| Ανασύνθεση της ετικέτας | argmax επί της γραμμής | Ανεξάρτητο κατώφλι κάθε στήλης |
Κριτήριο αναγνώρισης : Y.sum(axis=1) σταθερό και ίσο με 1 υπογράφει
κωδικοποιημένο πολυκλασικό· κάθε άλλη κατανομή υπογράφει πολυετικετικό.
Αυτό το σχήμα είναι η δυαδική συνάφεια (binary relevance): K ανεξάρτητοι
δυαδικοί ταξινομητές. Είναι απλό και παραλληλοποιήσιμο, αλλά αγνοεί εκ κατασκευής
τις συσχετίσεις μεταξύ ετικετών — η συχνή συνεμφάνιση plage και
coucher_de_soleil δεν αξιοποιείται ποτέ. Οι αλυσίδες ταξινομητών (Read et al.,
2011) το διορθώνουν προσθέτοντας τις προβλέψεις των προηγούμενων ετικετών στις
ερμηνευτικές μεταβλητές των επόμενων.
Μια πολυετικετική πρόβλεψη μπορεί να είναι μερικώς ορθή, κατάσταση που δεν υπάρχει ούτε στο δυαδικό ούτε στο πολυκλασικό. Οι μετρικές πρέπει να το λάβουν υπόψη.
import numpy as np
from sklearn.metrics import accuracy_score, hamming_loss, f1_score
Y_true = np.array([[1,1,0,0], [0,0,1,0], [1,0,1,1], [0,0,0,1], [1,1,1,0]])
Y_pred = np.array([[1,1,0,0], [0,0,1,0], [1,0,1,0], [0,1,0,1], [1,0,1,0]])
print("exactitude exacte :", accuracy_score(Y_true, Y_pred))
print("hamming loss :", round(hamming_loss(Y_true, Y_pred), 3))
print("F1 micro :", round(f1_score(Y_true, Y_pred, average="micro"), 3))
print("F1 macro :", round(f1_score(Y_true, Y_pred, average="macro"), 3))exactitude exacte : 0.4
hamming loss : 0.15
F1 micro : 0.842
F1 macro : 0.792Ερμηνεία : η ακριβής ορθότητα (subset accuracy) απονέμει τον βαθμό μόνον αν όλες οι ετικέτες της γραμμής είναι ορθές· πέφτει στο 0,40 ενώ το 85 % των αποφάσεων ετικέτα προς ετικέτα είναι σωστές. Αυτοί οι δύο αριθμοί περιγράφουν το ίδιο μοντέλο και δεν είναι αντιφατικοί: απαντούν σε δύο διαφορετικές ερωτήσεις.
| Μετρική | Τι μετρά | Συνιστώμενη χρήση |
|---|---|---|
| Ακριβής ορθότητα (subset accuracy) | Αναλογία γραμμών πλήρως ορθών | Πολύ αυστηρή· σχετική αν η έξοδος καταναλώνεται ως σύνολο |
| Hamming loss | Αναλογία εσφαλμένων ατομικών ετικετών | Συνολικός δείκτης ανεκτικός στα μερικά σφάλματα |
| F1 μικρο | Συναθροίζει τις καταμετρήσεις σε όλες τις ετικέτες | Κυριαρχείται από τις συχνές ετικέτες |
| F1 μακρο | Μέσος των F1 ανά ετικέτα | Δίνει ίσο βάρος στις σπάνιες ετικέτες |
| F1 ανά ετικέτα | Λεπτομέρεια ετικέτα προς ετικέτα | Διάγνωση· απαραίτητη στην πλοήγηση |
Σημείο προσοχής : σχεδόν όλες οι ετικέτες ενός ρεαλιστικού πολυετικετικού προβλήματος είναι σπάνιες. Ένα μοντέλο που προβλέπει συστηματικά το μηδενικό διάνυσμα λαμβάνει συχνά εξαιρετικό hamming loss. Η ανάγνωση ετικέτα προς ετικέτα δεν είναι προαιρετική.
Αυτή είναι η συχνότερη παγίδα ονομασίας του πεδίου. Η λογιστική παλινδρόμηση φέρει τη λέξη «παλινδρόμηση» και επιλύει πρόβλημα ταξινόμησης.
Αυστηρός ορισμός
Γενικευμένο γραμμικό μοντέλο (Nelder και Wedderburn, 1972) για απόκριση νόμου Bernoulli, του οποίου η συνάρτηση σύνδεσης είναι το logit. Το μοντέλο υποθέτει
logit(p(x)) = ln( p(x) / (1 − p(x)) ) = β_0 + β_1 x_1 + ... + β_p x_p
όπου p(x) = P(Y = 1 | X = x). Αντιστρέφοντας τη σύνδεση, λαμβάνουμε
p(x) = 1 / (1 + exp(−(β_0 + β·x))), δηλαδή τη λογιστική συνάρτηση εφαρμοσμένη
σε γραμμικό συνδυασμό των ερμηνευτικών μεταβλητών. Οι συντελεστές εκτιμώνται με
μεγιστοποίηση της πιθανοφάνειας.
Μετάφραση σε καθημερινή γλώσσα
Προσαρμόζουμε μια ευθεία, όχι επί της ίδιας της κλάσης, αλλά επί του λογαρίθμου της πιθανότητας του γεγονότος· κατόπιν μετατρέπουμε αυτό το αποτέλεσμα σε πιθανότητα μέσω καμπύλης σε S μεταξύ 0 και 1.
Σημείο προσοχής
Η εγγενής έξοδος του μοντέλου είναι μια πιθανότητα, όχι μια κλάση. Η ταξινόμηση εμφανίζεται μόνον στο επόμενο βήμα, με σύγκριση με κατώφλι (κεφάλαιο 062). Το μοντέλο είναι επομένως όντως παλινδρόμηση επί συνεχούς ποσότητας — της πιθανότητας — στην υπηρεσία ενός έργου ταξινόμησης.
| Βήμα | Συμβολή | Επίδραση στην ονομασία |
|---|---|---|
| Verhulst, 1838-1845 | Εισάγει τη λογιστική συνάρτηση για τη μοντελοποίηση της αύξησης πληθυσμού υπό περιορισμό | Παρέχει το επίθετο «λογιστική», που δηλώνει την καμπύλη σε S |
| Berkson, 1944 | Επινοεί τον όρο logit και προωθεί το μοντέλο στη βιοστατιστική | Εγκαθιστά τη σύνδεση logit ως πρότυπο |
| Cox, 1958 | Τυποποιεί την ανάλυση δυαδικών δεδομένων με αυτό το μοντέλο | Διάδοση στην εφαρμοσμένη στατιστική |
| Nelder και Wedderburn, 1972 | Ενοποιητικό πλαίσιο των γενικευμένων γραμμικών μοντέλων | Κατατάσσει το μοντέλο στην οικογένεια «παλινδρόμηση», κατά συγγένεια με τη γραμμική παλινδρόμηση |
Η λέξη «παλινδρόμηση» είναι επομένως κληρονομιά της στατιστικής οικογένειας του μοντέλου — γραμμικό μοντέλο προσαρμοσμένο σε μετασχηματισμό της δεσμευμένης προσδοκίας —, όχι περιγραφή του επιλυόμενου έργου.
from sklearn.base import is_classifier, is_regressor
from sklearn.linear_model import LogisticRegression, LinearRegression
print(is_classifier(LogisticRegression()), is_regressor(LogisticRegression()))
print(is_classifier(LinearRegression()), is_regressor(LinearRegression()))
print(hasattr(LogisticRegression(), "predict_proba"))True False
False True
TrueΕρμηνεία : η scikit-learn κατατάσσει το LogisticRegression στη μονάδα
linear_model — κατά μαθηματική οικογένεια — αλλά το εκθέτει ως ταξινομητή:
το is_classifier επιστρέφει True, η κλάση κληρονομεί από το ClassifierMixin,
διαθέτει predict_proba, το predict επιστρέφει ετικέτες και το score υπολογίζει
ορθότητα. Η κατάταξη της μονάδας μεταφράζει την αλγοριθμική συγγένεια· η διεπαφή
μεταφράζει το έργο.
import numpy as np
X = np.array([[10.0], [20.0], [30.0], [40.0], [50.0], [60.0]])
y = np.array([0, 0, 0, 1, 1, 1])
clf = LogisticRegression().fit(X, y)
print(clf.classes_)
print(clf.predict_proba(np.array([[25.0], [45.0]])).round(3))
print(clf.predict(np.array([[25.0], [45.0]])))[0 1]
[[0.997 0.003]
[0.003 0.997]]
[0 1]Ερμηνεία : το predict_proba επιστρέφει πίνακα (2, 2) πιθανοτήτων που
αθροίζουν σε 1 ανά γραμμή — η εγγενής, συνεχής έξοδος. Το predict επιστρέφει
ετικέτες κλάσης 0 και 1 — την έξοδο μετά κατώφλι στο 0,5. Ο πλήρης μηχανισμός
αντιμετωπίζεται στο κεφάλαιο 036.
| Όνομα | Πραγματική φύση | Παρατήρηση |
|---|---|---|
LogisticRegression | Ταξινομητής | Δυαδικός, ή πολυκλασικός σε πολυωνυμική διατύπωση |
RidgeClassifier | Ταξινομητής | Παλινδρόμηση Ridge επί στόχου κωδικοποιημένου −1 / +1, κατόπιν πρόσημο |
SGDClassifier | Ταξινομητής | Βελτιστοποιητής, όχι οικογένεια μοντέλων· η απώλεια καθορίζει το μοντέλο |
LinearSVC | Ταξινομητής | Το «C» για Classifier· το LinearSVR είναι η παραλλαγή παλινδρόμησης |
LinearRegression | Παλινδρομητής | Συνεχής αριθμητικός στόχος |
| Ordinal regression | Ταξινομητής | Καθιερωμένος όρος για την τακτική ταξινόμηση (σημείο 4) |
KNeighborsClassifier / KNeighborsRegressor | Ταξινομητής / Παλινδρομητής | Ίδιος αλγόριθμος, δύο έργα, δύο διακριτές κλάσεις |
Επαγγελματικός κανόνας : το όνομα μιας κλάσης δηλώνει τη μαθηματική οικογένειά
της ή την ιστορία της· μόνον η φύση της μεταβλητής στόχου καθορίζει το έργο. Σε
περίπτωση αμφιβολίας, το is_classifier και η παρουσία του predict_proba
αποφασίζουν.
| Κριτήριο | Δυαδική | Πολυκλασική | Τακτική | Πολυετικετική |
|---|---|---|---|---|
| Αριθμός κλάσεων | K = 2 | K > 2 | K > 2 | K ≥ 2 |
| Ετικέτες ανά παρατήρηση | 1 | 1 | 1 | 0 έως K |
| Διάταξη επί των κλάσεων | Άνευ αντικειμένου | Όχι | Ναι, χωρίς απόσταση | Άνευ αντικειμένου |
Μορφή του y | (n,) | (n,) | (n,) διατεταγμένο | (n, K) δυαδικό |
| Εγγενής έξοδος του μοντέλου | 1 πιθανότητα | K πιθανότητες softmax | Σωρευτικές πιθανότητες ή τάξη | K ανεξάρτητες πιθανότητες |
| Άθροισμα των πιθανοτήτων | 1 | 1 | 1 | Χωρίς περιορισμό |
| Παράδειγμα | Δόλια συναλλαγή ή όχι | Δρομολόγηση εισιτηρίου προς ομάδα | Επίπεδο πιστωτικού κινδύνου | Επισημείωση φωτογραφίας |
| Κατάλληλες μετρικές | Ακρίβεια, ανάκληση, F1, ROC-AUC, PR-AUC | Ορθότητα, F1 μακρο / μικρο / σταθμισμένο, πίνακας σύγχυσης | MAE επί τάξεων, τετραγωνικά σταθμισμένο κάππα, πίνακας σύγχυσης | Hamming loss, F1 μικρο / μακρο, F1 ανά ετικέτα, ακριβής ορθότητα |
| Μετρική προς αποκλεισμό | Ορθότητα αν έντονη ανισορροπία | Ορθότητα αν έντονη ανισορροπία | Ορθότητα μόνη: τυφλή στο πλάτος | Ακριβής ορθότητα μόνη: υπερβολικά αυστηρή |
| Κεφάλαια παραπομπής | 052 έως 064 | 065 | 067, 069, 052 | 065, 059 |
Τρία αναλλοίωτα προς απομνημόνευση :
y· μόνον
ο αριθμός των τρόπων και η παρουσία διάταξης τις χωρίζουν.Το κριτήριο δεν είναι ο αριθμός των κλάσεων αλλά ο αριθμός των ετικετών ανά παρατήρηση. Ένα πρόβλημα τριών κλάσεων του οποίου μια παρατήρηση μπορεί να φέρει δύο ετικέτες είναι πολυετικετικό, όχι πολυκλασικό.
Σωστή διατύπωση : «Το πολυκλασικό προϋποθέτει την αμοιβαία αποκλειστικότητα των
κλάσεων· μόλις μια παρατήρηση μπορεί να φέρει πολλές ετικέτες ταυτόχρονα, το
πρόβλημα είναι πολυετικετικό και ο στόχος γίνεται πίνακας (n, K).»
Η κωδικοποίηση Faible, Moyen, Élevé, Critique σε 0, 1, 2, 3 και κατόπιν
παλινδρόμηση υποθέτει ότι οι αποκλίσεις μεταξύ διαδοχικών επιπέδων είναι ίσες. Μια
τακτική κλίμακα δεν φέρει αυτή την πληροφορία (Stevens, 1946).
Σωστή διατύπωση : «Η παλινδρόμηση επί των τάξεων είναι πραγματιστική προσέγγιση της οποίας η υπόθεση ισαπόστασης πρέπει να διατυπωθεί και, ει δυνατόν, να αιτιολογηθεί από το επιχειρηματικό πεδίο· δεν είναι η αντιμετώπιση αναφοράς.»
Η ονομαστική αντιμετώπιση καθιστά όλες τις συγχύσεις ισοδύναμες. Η σύγχυση
Critique και Faible καταλογίζεται τότε στον ίδιο βαθμό με τη σύγχυση Élevé
και Critique, ενώ το επιχειρηματικό κόστος διαφέρει κατά τάξη μεγέθους.
Σωστή διατύπωση : «Η ονομαστική αντιμετώπιση τακτικού στόχου είναι αποδεκτή ως σημείο εκκίνησης, υπό τον όρο να συμπληρωθεί η ορθότητα με μετρική ευαίσθητη στο πλάτος του σφάλματος, όπως το MAE επί των τάξεων ή το τετραγωνικά σταθμισμένο κάππα.»
Το όνομα παραπέμπει στην οικογένεια των γενικευμένων γραμμικών μοντέλων και στη λογιστική συνάρτηση του Verhulst, όχι στη φύση του έργου. Ο στόχος είναι κατηγορικός.
Σωστή διατύπωση : «Η λογιστική παλινδρόμηση είναι αλγόριθμος ταξινόμησης. Παλινδρομεί το logit μιας πιθανότητας επί των ερμηνευτικών μεταβλητών· η απόφαση κλάσης προκύπτει από σύγκριση αυτής της πιθανότητας με κατώφλι.»
Με κειμενικές ετικέτες, η εξ ορισμού σειρά της scikit-learn είναι αλφαβητική. Το
"Fraude" γίνεται τότε η αρνητική κλάση και το "Normal" η θετική: ακρίβεια και
ανάκληση υπολογίζονται ορθώς, αλλά επί της κλάσης που δεν ενδιαφέρει κανέναν.
Σωστή διατύπωση : «Η θετική κλάση ορίζεται ρητά ως η κλάση ενδιαφέροντος, γενικά το σπάνιο και δαπανηρό γεγονός, και αυτή η ονομασία συνοδεύει συστηματικά την απόδοση των μετρικών.»
Τα δέντρα, τα δάση, οι μέθοδοι boosting, KNN, Naive Bayes, η πολυωνυμική λογιστική
παλινδρόμηση και τα νευρωνικά δίκτυα αντιμετωπίζουν εγγενώς το K > 2. Η αποσύνθεση
αφορά μόνον τους εγγενώς δυαδικούς αλγορίθμους.
Σωστή διατύπωση : «Η αποσύνθεση ένα-έναντι-όλων ή ένα-έναντι-ενός είναι μηχανισμός συμβατότητας για τους δυαδικούς ταξινομητές, εφαρμοζόμενος διαφανώς από τη βιβλιοθήκη, και όχι υποχρεωτικό βήμα του πολυκλασικού.»
Η ακριβής ορθότητα απαιτεί όλες οι ετικέτες μιας παρατήρησης να είναι ταυτόχρονα
ορθές. Σε K ετικέτες, καταρρέει μηχανικά όταν το K αυξάνεται, ακόμη και για
μοντέλο του οποίου κάθε ατομική απόφαση είναι καλή.
Σωστή διατύπωση : «Ένα πολυετικετικό μοντέλο πλοηγείται επί συνόλου μετρικών: hamming loss για τη συνολική όψη, F1 μακρο για την ευαισθησία στις σπάνιες ετικέτες, και F1 ανά ετικέτα για τη διάγνωση.»
ΟΙ ΤΡΕΙΣ ΕΡΩΤΗΣΕΙΣ ΧΑΡΑΚΤΗΡΙΣΜΟΥ
1. Πολλές ετικέτες ανά παρατήρηση; Ναι -> ΠΟΛΥΕΤΙΚΕΤΙΚΟ
2. Πόσες αποκλειστικές κλάσεις; K = 2 -> ΔΥΑΔΙΚΟ
3. Είναι οι κλάσεις διατεταγμένες; Ναι -> ΤΑΚΤΙΚΟ
Όχι -> ΠΟΛΥΚΛΑΣΙΚΟ
ΜΟΡΦΗ ΤΟΥ ΣΤΟΧΟΥ
Δυαδικό y μορφής (n,) τιμές 0 / 1
Πολυκλασικό y μορφής (n,) K μη διατεταγμένοι τρόποι
Τακτικό y μορφής (n,) K διατεταγμένοι τρόποι, χωρίς απόσταση
Πολυετικετικό Y μορφής (n, K) δυαδικός πίνακας, ελεύθερο άθροισμα γραμμής
ΤΥΠΙΚΗ ΥΠΟΓΡΑΦΗ ΤΟΥ ΠΟΛΥΕΤΙΚΕΤΙΚΟΥ
Y.sum(axis=1) σταθερό και ίσο με 1 -> κωδικοποιημένο πολυκλασικό
Y.sum(axis=1) οποιοδήποτε -> πολυετικετικό
ΘΕΤΙΚΗ ΚΛΑΣΗ (δυαδικό)
Πάντα οριζόμενη ρητά: το σπάνιο, δαπανηρό, ενεργοποιήσιμο γεγονός.
Η αντιστροφή ανταλλάσσει ανάκληση και ειδικότητα και μετατρέπει το AUC σε 1 - AUC.
ΤΑΚΤΙΚΟΣ ΣΤΟΧΟΣ
Αντιμετωπισμένος ως πολυκλασικό: απώλεια της διάταξης, όλα τα σφάλματα ισοδύναμα.
Αντιμετωπισμένος ως παλινδρόμηση: υπόθεση ίσων αποκλίσεων, αθεμελίωτη (Stevens 1946).
Σύμφωνη αντιμετώπιση: σωρευτικά μοντέλα, μετρικές ευαίσθητες στην απόκλιση.
ΑΠΟΣΥΝΘΕΣΗ ΠΟΛΥΚΛΑΣΙΚΟΥ
Ένα-έναντι-όλων : K ταξινομητές, ανισόρροπα υποπροβλήματα
Ένα-έναντι-ενός : K(K-1)/2 ταξινομητές, υποπροβλήματα μεγέθους 2n/K
ΛΟΓΙΣΤΙΚΗ ΠΑΛΙΝΔΡΟΜΗΣΗ
Όνομα κληρονομημένο από τη λογιστική συνάρτηση (Verhulst) και την οικογένεια των
γενικευμένων γραμμικών μοντέλων (Nelder και Wedderburn, 1972).
Επιλυόμενο έργο: ΤΑΞΙΝΟΜΗΣΗ. Εγγενής έξοδος: μια πιθανότητα.
Λεπτομέρεια στο κεφάλαιο 036.Δήλωση σύνθεσης
Ο τύπος ενός έργου ταξινόμησης διαβάζεται στη μορφή της μεταβλητής στόχου και όχι στο χρησιμοποιούμενο λεξιλόγιο: ένα διάνυσμα δύο τρόπων δηλώνει δυαδικό πρόβλημα, ένα διάνυσμα
Kτρόπων πολυκλασικό πρόβλημα — τακτικό αν αυτοί οι τρόποι είναι ταξινομημένοι χωρίς να είναι μετρημένοι —, ένας δυαδικός πίνακας πολυετικετικό πρόβλημα· και το όνομα ενός αλγορίθμου, όπως εκείνο της λογιστικής παλινδρόμησης, πληροφορεί για τη μαθηματική οικογένειά του, ποτέ για το έργο που επιλύει.
Σχετικά κουίζ
011.1-quiz-qualification-tache.md011.2-quiz-classification-binaire.md011.3-quiz-classification-multiclasse.md011.4-quiz-classification-ordinale.md011.5-quiz-classification-multilabel.md011.6-quiz-regression-logistique.md011.7-quiz-synthese-comparative.mdΕπόμενο κεφάλαιο : 012-cycle-de-vie-ml.md