Παράμετροι και υπερπαράμετροι

38 λεπτά
Μπλοκ 1 — Το θεμελιώδες λεξιλόγιο
Στόχος
να διακρίνετε χωρίς δισταγμό αυτό που μαθαίνει ένα μοντέλο από αυτό που του επιβάλλει ένας μηχανικός, να ονομάζετε τις συνήθεις υπερπαραμέτρους κάθε οικογένειας αλγορίθμων και την επίδραση καθεμιάς, να επαληθεύετε αυτή τη διάκριση στον κώδικα και να διαθέτετε το λεξιλόγιο αξιολόγησης που θα εμβαθυνθεί στα επόμενα μπλοκ: απώλεια, μετρική, σκορ, κατώφλι, αφελής αναφορά.
Εκτιμώμενη διάρκεια
45 λεπτά
Προαπαιτούμενα
κεφάλαια 001 έως 008
Σχετικά κουίζ
009.1-quiz-parametre-appris.md έως 009.7-quiz-loss-metric-score-seuil-baseline.md

1. Δύο κατηγορίες αριθμών σε ένα μοντέλο

Ένα εκπαιδευμένο μοντέλο είναι αριθμητικό αντικείμενο: περιέχει αριθμούς. Αυτοί οι αριθμοί δεν είναι όλοι της ίδιας φύσης και η σύγχυσή τους αποτελεί ένα από τα συχνότερα σφάλματα στην αρχή της πρακτικής.

ΚατηγορίαΠροέλευσηΚαθορίζεται πότεΠοιος αποφασίζει
ΠαράμετροςΥπολογισμένη από τη διαδικασία βελτιστοποίησηςΚατά την εκπαίδευσηΟ αλγόριθμος, από τα δεδομένα
ΥπερπαράμετροςΣυμπληρωμένη πριν από την έναρξη της εκπαίδευσηςΠριν από την εκπαίδευσηΟ μηχανικός, ή διαδικασία αναζήτησης

Το κεφάλαιο 008 διέκρινε τον αλγόριθμο, που είναι διαδικασία, από το μοντέλο, που είναι το αποτέλεσμα της εφαρμογής του σε σύνολο δεδομένων. Οι υπερπαράμετροι διαμορφώνουν τη διαδικασία· οι παράμετροι αποτελούν το αποτέλεσμα.

Ανάγνωση του διαγράμματος: οι υπερπαράμετροι εμφανίζονται στο τελικό μοντέλο στον ίδιο βαθμό με τις παραμέτρους, αφού περιγράφουν τη διαμόρφωσή του, αλλά φτάνουν εκεί από διαφορετική διαδρομή: δεν έχουν διασχίσει ποτέ τη διαδικασία βελτιστοποίησης.

ΑΝΑΛΟΓΙΑ — Η συνταγή, η ρύθμιση του φούρνου, η ζύμη και το γλυκό

Τέσσερα διακριτά αντικείμενα παρεμβαίνουν στην παρασκευή ενός γλυκού και αντιστοιχούν όρο προς όρο στα τέσσερα αντικείμενα της μηχανικής μάθησης.

Η συνταγή είναι η ακολουθία πράξεων προς διεξαγωγή: ανάμειξη, ενσωμάτωση, ψήσιμο, ανάπαυση. Υπάρχει ανεξάρτητα από κάθε συγκεκριμένο γλυκό. Αυτός είναι ο αλγόριθμος.

Οι ρυθμίσεις είναι οι αποφάσεις που λαμβάνονται πριν μπει το ταψί στον φούρνο: φούρνος στους 180 °C, ψήσιμο 35 λεπτών, μέγεθος φόρμας. Ο ζαχαροπλάστης τις καθορίζει εκ των προτέρων· καμία δεν ανακαλύπτεται κατά το ψήσιμο, όλες το καθορίζουν. Αυτές είναι οι υπερπαράμετροι.

Αυτό που γίνεται η ζύμη κατά το ψήσιμο — δομή της ψίχας, χρωματισμός της κρούστας, κατανομή υγρασίας — δεν αποφασίζεται από κανέναν: προκύπτει από την αλληλεπίδραση μεταξύ υλικών και ρυθμίσεων. Αυτές είναι οι μαθημένες παράμετροι.

Το γλυκό που βγαίνει από τον φούρνο είναι το τελικό αντικείμενο που προκύπτει από την εφαρμογή αυτής της συνταγής σε αυτά τα υλικά με αυτές τις ρυθμίσεις. Αυτό είναι το μοντέλο.

Η σύγχυση μεταξύ παραμέτρου και υπερπαραμέτρου ισοδυναμεί με το να πιστεύει κανείς ότι ο φούρνος «ανακαλύπτει» μόνος του τη θερμοκρασία κατά το ψήσιμο, ή ότι ο ζαχαροπλάστης αποφασίζει εκ των προτέρων τη δομή της ψίχας.

Τρεις συνέπειες διαβάζονται άμεσα στην αναλογία. Τα ίδια υλικά και η ίδια συνταγή δίνουν διαφορετικά γλυκά ανάλογα με τις ρυθμίσεις: εξ ου και η βελτιστοποίηση υπερπαραμέτρων, που αντιμετωπίζεται στο κεφάλαιο 035. Δεν υπάρχει καθολικά ορθή θερμοκρασία, αλλά θερμοκρασία προσαρμοσμένη σε ένα γλυκό και σε έναν φούρνο: ούτε υπάρχει max_depth βέλτιστο αφ’ εαυτού. Τέλος, δεν προσδιορίζουμε την ορθή θερμοκρασία σερβίροντας το γλυκό στην κριτική επιτροπή του διαγωνισμού και μετά ξεκινώντας από την αρχή: η επιτροπή γεύεται μία φορά, οι δοκιμές γίνονται σε παρτίδες δοκιμής. Αυτό είναι το καθεστώς του συνόλου δοκιμής, που αναπτύσσεται στο σημείο 6.

Όριο της αναλογίας: ο ζαχαροπλάστης μπορεί να ανοίξει τον φούρνο και να παρατηρήσει το ψήσιμο. Η διαμόρφωση των παραμέτρων δεν είναι, αντίθετα, παρατηρήσιμη βήμα προς βήμα με ερμηνεύσιμο τρόπο. Η αναλογία περιγράφει τους ρόλους, όχι τη διαφάνεια της διαδικασίας.


2. Η παράμετρος: αυτό που προσαρμόζει η διαδικασία βελτιστοποίησης

ΟΡΙΣΜΟΣ — Παράμετρος μοντέλου (model parameter)

Αυστηρός ορισμός

Εσωτερικό μέγεθος μοντέλου του οποίου η τιμή καθορίζεται από τη διαδικασία βελτιστοποίησης εφαρμοζόμενη στα δεδομένα εκπαίδευσης, με σκοπό την ελαχιστοποίηση μιας αντικειμενικής συνάρτησης ορισμένης σε αυτά τα δεδομένα. Το σύνολο των παραμέτρων, σημειούμενο συνήθως θ, ταυτοποιεί μονοσήμαντα μία ιδιαίτερη συνάρτηση εντός της οικογένειας συναρτήσεων που ο αλγόριθμος είναι ικανός να αναπαραστήσει.

Συνολοθεωρητική διατύπωση

Ο αλγόριθμος ορίζει οικογένεια υποψήφιων συναρτήσεων, ονομαζόμενη χώρος υποθέσεων και σημειούμενη H. Η εκπαίδευση συνίσταται στην επιλογή στοιχείου h ∈ H. Οι παράμετροι είναι οι συντεταγμένες αυτού του στοιχείου στο H.

Μετάφραση σε καθημερινή γλώσσα

Είναι οι αριθμοί που το ίδιο το μοντέλο υπολόγισε από τα δεδομένα και που αποτελούν το ουσιώδες όσων κράτησε. Αυτοί θα γραφτούν στο αρχείο του μοντέλου και θα επαναφορτωθούν τη στιγμή της πρόβλεψης.

Σημείο προσοχής

Μία παράμετρος έχει νόημα μόνο σε σχέση με το σύνολο δεδομένων που την παρήγαγε. Η επανεκπαίδευση του ίδιου αλγορίθμου σε άλλο δείγμα παράγει άλλες παραμέτρους. Ένας συντελεστής δεν είναι επομένως φυσική σταθερά: είναι εκτίμηση, συνοδευόμενη από δειγματοληπτική αβεβαιότητα.

2.1 Γραμμικά μοντέλα: συντελεστές και σταθερά

Η πολλαπλή γραμμική παλινδρόμηση μοντελοποιεί τον στόχο ως αφινικό συνδυασμό των ερμηνευτικών μεταβλητών:

ŷ = b₀ + b₁·x₁ + b₂·x₂ + ... + b_p·x_p

Οι μαθημένες παράμετροι είναι οι p συντελεστές b₁ έως bpb_p και η σταθερά b₀, δηλαδή p + 1 τιμές. Κανένα άλλο μέγεθος δεν απομνημονεύεται.

Αριθμητικό παράδειγμα — εκτίμηση τιμής κατοικίας

ΜεταβλητήΜαθημένος συντελεστήςΕρμηνεία
Σταθερά (b₀)42 300Τιμή βάσης σε δολάρια, όλες οι μεταβλητές μηδενικές
Κατοικήσιμη επιφάνεια (m²)2 180Κάθε επιπλέον m² προσθέτει 2 180 $
Αριθμός υπνοδωματίων6 400Κάθε επιπλέον υπνοδωμάτιο προσθέτει 6 400 $
Ηλικία του αγαθού (έτη)−870Κάθε έτος αρχαιότητας αφαιρεί 870 $
Απόσταση από το κέντρο (km)−3 150Κάθε επιπλέον km αφαιρεί 3 150 $

Ολόκληρο το μοντέλο χωρά σε αυτούς τους πέντε αριθμούς. Για κατοικία 85 m², τριών υπνοδωματίων, δώδεκα ετών, τεσσάρων χιλιομέτρων από το κέντρο: ŷ = 42 300 + 2 180×85 + 6 400×3 − 870×12 − 3 150×4 = 224 570 $.

Σημείο προσοχής: η ρήτρα «όλα τα άλλα ίσα» προϋποθέτει ότι οι μεταβλητές μπορούν να μεταβάλλονται σχετικά ανεξάρτητα, υπόθεση σπάνια επαληθευμένη. Η συγγραμμικότητα αντιμετωπίζεται στο κεφάλαιο 045.

Στη λογιστική παλινδρόμηση, η δομή είναι ταυτόσημη, με τον γραμμικό συνδυασμό μετασχηματισμένο από σιγμοειδή για την παραγωγή πιθανότητας. Οι παράμετροι παραμένουν οι συντελεστές και η σταθερά (κεφάλαιο 036).

2.2 Νευρωνικά δίκτυα: βάρη και μεροληψίες

ΟΡΙΣΜΟΣ — Βάρη και μεροληψίες νευρωνικού δικτύου

Αυστηρός ορισμός

Σε πολυεπίπεδο perceptron, κάθε νευρώνας ενός στρώματος υπολογίζει σταθμισμένο άθροισμα των εξόδων του προηγούμενου στρώματος, αυξημένο κατά σταθερό όρο, και στη συνέχεια εφαρμόζει μη γραμμική συνάρτηση ενεργοποίησης. Οι συντελεστές του σταθμισμένου αθροίσματος είναι τα βάρη (weights), ο σταθερός όρος είναι η μεροληψία (bias). Βάρη και μεροληψίες αποτελούν το σύνολο των μαθημένων παραμέτρων του δικτύου.

Καταμέτρηση

Για στρώμα που δέχεται m εισόδους και περιλαμβάνει n νευρώνες, ο αριθμός παραμέτρων είναι m × n βάρη συν n μεροληψίες.

Μετάφραση σε καθημερινή γλώσσα

Κάθε σύνδεση μεταξύ δύο νευρώνων φέρει έναν αριθμό, που δηλώνει τη σημασία που αποδίδεται σε ό,τι μεταδίδει η σύνδεση. Κάθε νευρώνας φέρει επιπλέον έναν αριθμό που μετατοπίζει το κατώφλι ενεργοποίησής του.

Ορολογικό σημείο προσοχής

Η λέξη «μεροληψία» έχει εδώ αυστηρά τεχνική σημασία: είναι ο σταθερός όρος ενός αφινικού μετασχηματισμού. Δεν πρέπει να συγχέεται με τη στατιστική μεροληψία του συμβιβασμού μεροληψίας-διακύμανσης (κεφάλαιο 032), ούτε με την κοινωνική μεροληψία ενός διακριτικού μοντέλου (κεφάλαιο 080). Τρεις ομώνυμες έννοιες, τρεις ξένες μεταξύ τους ορισμοί.

Αριθμητικό παράδειγμα — πολυεπίπεδο perceptron για σκορ αποχώρησης

Αρχιτεκτονική: 20 μεταβλητές εισόδου, δύο κρυφά στρώματα 64 και έπειτα 32 νευρώνων, μία έξοδος.

ΜετάβασηΒάρηΜεροληψίεςΣύνολο
Είσοδος → στρώμα 120 × 64 = 1 280641 344
Στρώμα 1 → στρώμα 264 × 32 = 2 048322 080
Στρώμα 2 → έξοδος32 × 1 = 32133
Σύνολο3 360973 457

Αυτό το δίκτυο μαθαίνει 3 457 αριθμούς. Ο αριθμός στρωμάτων και το μέγεθός τους — δηλαδή hidden_layer_sizes=(64, 32) — δεν μαθαίνονται: είναι υπερπαράμετροι και αυτές καθορίζουν τον αριθμό παραμέτρων προς μάθηση. Μία υπερπαράμετρος διέπει επομένως την ποσότητα παραμέτρων, γεγονός που αποτελεί τον άμεσο δεσμό με την έννοια της ικανότητας, που αντιμετωπίζεται στο σημείο 7.

2.3 Δέντρα απόφασης: δομή, μεταβλητές διαίρεσης και κατώφλια

Ένα δέντρο απόφασης δεν έχει ούτε συντελεστή ούτε βάρος. Αυτό που μαθαίνει είναι συνδυαστικής φύσης:

  • για κάθε εσωτερικό κόμβο, η μεταβλητή επί της οποίας γίνεται διαίρεση·
  • για κάθε εσωτερικό κόμβο, το κατώφλι διαίρεσης σε αυτή τη μεταβλητή·
  • η τοπολογία του δέντρου, δηλαδή ποιοι κόμβοι διαιρούνται και ποιοι γίνονται φύλλα·
  • για κάθε φύλλο, η προβλεπόμενη τιμή ή η κατανομή των κλάσεων.

Μερική όψη: τα τρία πρώτα επίπεδα του δέντρου που όντως προέκυψε στο σημείο 5.3, εκ των οποίων δύο κλάδοι έχουν συντομευθεί.

Η τιμή 32,50 δεν επιλέχθηκε από αναλυτή: ο αλγόριθμος αξιολόγησε τις υποψήφιες διαιρέσεις σε κάθε μεταβλητή και κράτησε εκείνη που μείωνε περισσότερο την ακαθαρσία του κόμβου. Μαθαίνεται, στον ίδιο βαθμό με συντελεστή παλινδρόμησης (μηχανισμός λεπτομερής στο κεφάλαιο 037). Αυτό που καθόρισε ο μηχανικός είναι το πλαίσιο αυτής της αναζήτησης: μέγιστο βάθος, ελάχιστο πλήθος φύλλου, κριτήριο ακαθαρσίας.

2.4 Μηχανές διανυσμάτων υποστήριξης

ΟΡΙΣΜΟΣ — Διανύσματα υποστήριξης (support vectors)

Αυστηρός ορισμός

Στη δυϊκή διατύπωση μηχανής διανυσμάτων υποστήριξης (Boser, Guyon και Vapnik, 1992· Cortes και Vapnik, 1995), η λύση εκφράζεται ως γραμμικός συνδυασμός συναρτήσεων πυρήνα αξιολογημένων σε υποσύνολο των παρατηρήσεων εκπαίδευσης. Οι παρατηρήσεις των οποίων ο δυϊκός συντελεστής αi\alpha_i είναι αυστηρά θετικός ονομάζονται διανύσματα υποστήριξης: είναι οι μόνες που παρεμβαίνουν στη συνάρτηση απόφασης.

Τι μαθαίνεται

Οι δυϊκοί συντελεστές αi\alpha_i, η ταυτότητα των παρατηρήσεων που κρατούνται ως διανύσματα υποστήριξης και η σταθερά απόφασης. Με γραμμικό πυρήνα, αυτές οι ποσότητες ανασυντίθενται σε διάνυσμα συντελεστών ομοιογενές εκείνου γραμμικού μοντέλου.

Μετάφραση σε καθημερινή γλώσσα

Το μοντέλο κρατά τα παραδείγματα εκπαίδευσης που βρίσκονται κοντά στο σύνορο μεταξύ των κλάσεων και τους αποδίδει βάρος· τα απομακρυσμένα παραδείγματα δεν επηρεάζουν την απόφαση.

Σημείο προσοχής

Ο αριθμός διανυσμάτων υποστήριξης είναι αποτέλεσμα της εκπαίδευσης, ποτέ εντολή. Ένας αριθμός κοντά στο πλήθος εκπαίδευσης σηματοδοτεί πολύ ανώμαλο σύνορο και κίνδυνο υπερπροσαρμογής, συχνά συνδεδεμένο με υπερβολικά μεγάλο gamma (κεφάλαιο 041).

2.5 Η περίπτωση των μεθόδων απομνημόνευσης

ΟΡΙΣΜΟΣ — Μη παραμετρική μέθοδος και οκνηρή μάθηση

Αυστηρός ορισμός

Μία μέθοδος ονομάζεται μη παραμετρική όταν η πολυπλοκότητα της μαθημένης συνάρτησης δεν οριοθετείται από αριθμό παραμέτρων καθορισμένο a priori, αλλά αυξάνεται με το πλήθος των δεδομένων εκπαίδευσης. Μία μέθοδος ονομάζεται οκνηρή (lazy learning) όταν αναβάλλει κάθε υπολογισμό γενίκευσης έως το αίτημα πρόβλεψης.

Εφαρμογή στους k πλησιέστερους γείτονες

Η κλήση fit() σε KNeighborsClassifier δεν υπολογίζει κανέναν συντελεστή: απομνημονεύει το σύνολο εκπαίδευσης και κατασκευάζει ενδεχομένως δομή ευρετηρίασης. Αυτό που «μαθαίνεται» είναι το ίδιο το σύνολο δεδομένων: το μοντέλο δεν συνοψίζει τίποτα, συγκρίνει τη νέα παρατήρηση με τα διατηρημένα παραδείγματα τη στιγμή της απάντησης.

Σημείο προσοχής

Μη παραμετρική δεν σημαίνει «χωρίς υπερπαράμετρο». Ο αριθμός γειτόνων k, η μετρική απόστασης και η στάθμιση είναι αποφασιστικά (κεφάλαιο 040).

2.6 Τάξεις μεγέθους

ΜοντέλοΦύση των μαθημένων παραμέτρωνΑριθμός για τυπική περίπτωση
Γραμμική παλινδρόμηση, 20 μεταβλητέςΣυντελεστές + σταθερά21
Δυαδική λογιστική παλινδρόμηση, 50 μεταβλητέςΣυντελεστές + σταθερά51
Λογιστική παλινδρόμηση, 10 κλάσεις, 100 μεταβλητέςΠίνακας συντελεστών + σταθερές1 010
Δέντρο απόφασης, max_depth=3Μεταβλητές, κατώφλια, τιμές φύλλων15 κόμβοι εκ των οποίων 8 φύλλα
Δέντρο απόφασης, max_depth=10Το ίδιο757 κόμβοι εκ των οποίων 379 φύλλα
Τυχαίο δάσος, 300 δέντρα, max_depth=6Το ίδιο, συναθροισμένο σε 300 δέντραπερίπου 35 000 κόμβοι
Πολυεπίπεδο perceptron (20, 64, 32, 1)Βάρη και μεροληψίες3 457
SVM με πυρήνα RBF, 4 000 παρατηρήσειςΔιανύσματα υποστήριξης και δυϊκοί συντελεστέςμερικές εκατοντάδες έως μερικές χιλιάδες
k πλησιέστεροι γείτονες, 4 000 παρατηρήσειςΤο απομνημονευμένο σύνολο εκπαίδευσης4 000 διατηρημένες παρατηρήσεις

Οι γραμμές «δέντρο» και «δάσος» επαναλαμβάνουν τις τιμές που μετρήθηκαν στο σημείο 5. Απεικονίζουν κεντρικό γεγονός: ο αριθμός μαθημένων παραμέτρων δεν είναι ιδιότητα του αλγορίθμου μόνο, καθορίζεται από κοινού από τις υπερπαραμέτρους και τα δεδομένα.


3. Η υπερπαράμετρος: αυτό που καθορίζει ο μηχανικός πριν από τη βελτιστοποίηση

ΟΡΙΣΜΟΣ — Υπερπαράμετρος (hyperparameter)

Αυστηρός ορισμός

Μέγεθος που διαμορφώνει τον αλγόριθμο μάθησης, του οποίου η τιμή καθορίζεται πριν από την εκτέλεση της διαδικασίας βελτιστοποίησης και δεν τροποποιείται από αυτή. Οι υπερπαράμετροι καθορίζουν τον εξερευνούμενο χώρο υποθέσεων, την αντικειμενική συνάρτηση που όντως ελαχιστοποιείται, την αριθμητική διαδικασία που χρησιμοποιείται και το κριτήριο διακοπής της.

Επιχειρησιακή διατύπωση

Υπερπαράμετρος είναι μεταβλητή της οποίας η τιμή πρέπει να είναι γνωστή ώστε να μπορεί να ξεκινήσει η εκπαίδευση και της οποίας η τιμή είναι αμετάβλητη όταν τελειώνει η εκπαίδευση.

Μετάφραση σε καθημερινή γλώσσα

Είναι οι ρυθμίσεις που γράφουμε οι ίδιοι ανάμεσα στις παρενθέσεις του μοντέλου, πριν ξεκινήσουμε τη μάθηση.

Προέλευση του προθέματος

Το πρόθεμα «υπερ-» δηλώνει ανώτερο επίπεδο: αυτά τα μεγέθη βρίσκονται πάνω από τις παραμέτρους, αφού καθορίζουν τον τρόπο με τον οποίο αυτές θα προσδιοριστούν.

Σημείο προσοχής — στατιστική ομωνυμία

Στη μπεϋζιανή στατιστική, «υπερπαράμετρος» δηλώνει παράμετρο του εκ των προτέρων νόμου πιθανότητας που φέρεται επί των παραμέτρων του μοντέλου. Οι δύο αποδοχές μοιράζονται την ίδια ιδέα δεύτερου επιπέδου, αλλά δεν καλύπτουν τα ίδια αντικείμενα. Σε πλαίσιο εφαρμοσμένης μηχανικής μάθησης, επικρατεί η αποδοχή που δίνεται παραπάνω.

3.1 Οι συνήθεις υπερπαράμετροι ανά οικογένεια αλγορίθμων

ΑλγόριθμοςΥπερπαράμετροςΡόλοςΕπίδραση αύξησης
Λογιστική παλινδρόμησηCΑντίστροφο της ισχύος κανονικοποίησηςΑσθενέστερη κανονικοποίηση, ελευθερότεροι συντελεστές, αυξημένη ικανότητα
Λογιστική παλινδρόμησηpenalty / l1_ratioΦύση της ποινής (L1, L2, μικτή)Η L1 μηδενίζει συντελεστές, η L2 τους συστέλλει
Ridge, Lasso, ElasticNetalphaΙσχύς της κανονικοποίησηςΠερισσότερο δεσμευμένοι συντελεστές, μειωμένη ικανότητα
Δέντρο απόφασηςmax_depthΜέγιστο βάθοςΒαθύτερο δέντρο, αυξημένη ικανότητα, πιθανή υπερπροσαρμογή
Δέντρο απόφασηςmin_samples_leafΕλάχιστο πλήθος φύλλουΠυκνότερα φύλλα, κανονικότερο δέντρο, μειωμένη ικανότητα
Δέντρο απόφασηςccp_alphaΚόστος πολυπλοκότητας για κλάδεμαΕπιθετικότερο κλάδεμα, μειωμένη ικανότητα
Τυχαίο δάσοςn_estimatorsΑριθμός συναθροισμένων δέντρωνΜειωμένη διακύμανση πρόβλεψης, αυξημένο υπολογιστικό κόστος
Τυχαίο δάσοςmax_featuresΥποψήφιες μεταβλητές ανά διαίρεσηΠερισσότερο συσχετισμένα δέντρα μεταξύ τους, μειωμένο όφελος συνάθροισης
Gradient boostinglearning_rateΒήμα συστολής κάθε δέντρουΤαχύτερη μάθηση, αυξημένος κίνδυνος υπερπροσαρμογής
Gradient boostingn_estimatorsΑριθμός επαναλήψεων boostingΑυξημένη ικανότητα, δυνατή υπερπροσαρμογή χωρίς πρόωρη διακοπή
Gradient boostingsubsampleΚλάσμα παρατηρήσεων ανά επανάληψηΛιγότερη στοχαστική κανονικοποίηση όταν τείνει στο 1
k πλησιέστεροι γείτονεςn_neighbors (k)Αριθμός συμβουλευόμενων γειτόνωνΛειότερο σύνορο, μειωμένη ικανότητα
SVMCΠοινή παραβιάσεων περιθωρίουΣτενότερο περιθώριο, αυστηρότερη προσαρμογή στα δεδομένα
SVMkernel, gammaΜορφή του συνόρουΥψηλό gamma: πολύ τοπικό σύνορο, υπερπροσαρμογή
Πολυεπίπεδο perceptronhidden_layer_sizesΑρχιτεκτονική του δικτύουΠερισσότερες παράμετροι προς μάθηση, αυξημένη ικανότητα
Πολυεπίπεδο perceptronalphaΚανονικοποίηση L2 των βαρώνΠερισσότερο δεσμευμένα βάρη, μειωμένη ικανότητα

Σημείο προσοχής για τα C και alpha: αυτές οι δύο υπερπαράμετροι διέπουν το ίδιο πράγμα — την ισχύ της κανονικοποίησης — αλλά σε αντίθετες κατευθύνσεις. Το alpha είναι ανάλογο της ισχύος της ποινής· το C είναι το αντίστροφό της. Η αύξηση του alpha κανονικοποιεί περισσότερο· η αύξηση του C κανονικοποιεί λιγότερο. Αυτή η αντιστροφή αποτελεί σταθερή πηγή σφάλματος σε τεχνική συνέντευξη.

ΟΡΙΣΜΟΣ — Ισχύς κανονικοποίησης: alpha και C

Αυστηρός ορισμός

Η κανονικοποίηση προσθέτει στη συνάρτηση απώλειας όρο που ποινικοποιεί το μέγεθος των παραμέτρων, ώστε να περιοριστεί ο χώρος των επιτρεπτών λύσεων. Το επιλυόμενο πρόβλημα γίνεται ελαχιστοποίηση του J(θ) = απώλεια_στα_δεδομένα(θ) + λ · ποινή(θ). Τα Ridge και Lasso εκθέτουν άμεσα το λ υπό το όνομα alpha· η λογιστική παλινδρόμηση και τα SVM εκθέτουν το C, ορισμένο ως αντίστροφο του λ πλην σταθεράς.

Μετάφραση σε καθημερινή γλώσσα

Το alpha είναι φρένο: όσο μεγαλύτερο είναι, τόσο περισσότερο περιορίζεται το μοντέλο. Το C είναι άδεια: όσο μεγαλύτερο είναι, τόσο ελευθερότερο είναι το μοντέλο να κολλήσει στα δεδομένα.

Σημείο προσοχής

Η κανονικοποίηση έχει νόημα μόνο σε μεταβλητές συγκρίσιμης κλίμακας: η ποινικοποίηση συντελεστών που φέρονται σε ετερογενείς μονάδες ισοδυναμεί με αυθαίρετη ποινικοποίηση ορισμένων μεταβλητών. Τυποποίηση στο κεφάλαιο 023, κανονικοποίηση στο κεφάλαιο 047.

ΟΡΙΣΜΟΣ — Ρυθμός μάθησης (learning rate)

Αυστηρός ορισμός

Πολλαπλασιαστικός συντελεστής εφαρμοζόμενος στην κατεύθυνση ενημέρωσης των παραμέτρων σε κάθε επανάληψη επαναληπτικής βελτιστοποίησης: σε κάθοδο κλίσης, θ_(t+1) = θ_t − η · ∇J(θ_t), όπου η δηλώνει τον ρυθμό μάθησης. Στο gradient boosting, η ίδια ρύθμιση ερμηνεύεται ως παράγοντας συστολής εφαρμοζόμενος στη συμβολή κάθε προστιθέμενου εκτιμητή.

Μετάφραση σε καθημερινή γλώσσα

Το μέγεθος του βήματος που γίνεται σε κάθε διόρθωση. Ένα υπερβολικά μεγάλο βήμα χάνει το ελάχιστο και μπορεί να αποκλίνει τη μάθηση· ένα υπερβολικά μικρό βήμα δεν προχωρά αρκετά γρήγορα για τον διαθέσιμο προϋπολογισμό επαναλήψεων.

Σημείο προσοχής

Τα learning_rate και n_estimators είναι συζευγμένα στο boosting: η διαίρεση του ρυθμού μάθησης διά δύο επιβάλλει κατά προσέγγιση διπλασιασμό του αριθμού επαναλήψεων για συγκρίσιμη προσαρμογή. Αυτές οι δύο υπερπαράμετροι δεν πρέπει επομένως ποτέ να ρυθμίζονται ανεξάρτητα η μία από την άλλη. Αντιμετωπίζεται στο κεφάλαιο 039.

3.2 Οι πέντε λειτουργίες μιας υπερπαραμέτρου

Όλες οι υπερπαράμετροι δεν έχουν την ίδια εμβέλεια. Η κατάταξή τους κατά λειτουργία αποφεύγει την τυχαία ρύθμισή τους.

Οι υπερπαράμετροι ικανότητας είναι καθοριστικές και ρυθμίζονται κατά προτεραιότητα· εκείνες της βελτιστοποίησης βαραίνουν ιδίως στο boosting και στα νευρωνικά δίκτυα· εκείνες της δομής συνόλου έχουν ταχέως φθίνουσες αποδόσεις· εκείνες της επεξεργασίας του προβλήματος γίνονται κρίσιμες σε ανισορροπημένο πλαίσιο ή με ασύμμετρα κόστη σφάλματος· εκείνες της εκτέλεσης δεν έχουν καμία επίδραση κατ’ αναμονή στην επίδοση.

Σημείο προσοχής για το random_state: αυτό το όρισμα είναι τυπικά υπερπαράμετρος — καθορίζεται πριν από την εκπαίδευση και δεν προσαρμόζεται από τη διαδικασία. Δεν πρέπει ωστόσο ποτέ να εντάσσεται σε αναζήτηση βελτιστοποίησης. Η επιλογή του σπόρου που μεγιστοποιεί το σκορ επικύρωσης ισοδυναμεί με εκμετάλλευση του δειγματοληπτικού θορύβου, όχι με βελτίωση του μοντέλου. Ο νόμιμος ρόλος του random_state είναι η αναπαραγωγιμότητα.


4. Το επιχειρησιακό κριτήριο διάκρισης, οριακές περιπτώσεις και παγίδες

4.1 Το μοναδικό ερώτημα που πρέπει να τεθεί

Ένα μόνο ερώτημα διαχωρίζει τις δύο κατηγορίες, όποια και αν είναι η βιβλιοθήκη ή ο χρησιμοποιούμενος αλγόριθμος:

Προσαρμόζεται αυτό το μέγεθος από τη διαδικασία βελτιστοποίησης που εκτελείται κατά το fit(), ή καθορίζεται πριν ξεκινήσει αυτή η διαδικασία;

ΟΡΙΣΜΟΣ — Η σύμβαση ονοματοδοσίας του scikit-learn

Κανονιστικός κανόνας της βιβλιοθήκης

Στο API του scikit-learn, η διάκριση υλοποιείται στην ονοματοδοσία:

  • οι υπερπαράμετροι είναι τα ορίσματα του κατασκευαστή του εκτιμητή· είναι προσβάσιμες μέσω get_params(), τροποποιήσιμες μέσω set_params(), και το όνομά τους δεν φέρει επίθημα·
  • τα μαθημένα χαρακτηριστικά κατά το fit() φέρουν όνομα με επίθημα κάτω παύλας: coef_, intercept_, feature_importances_, classes_, tree_, estimators_, support_vectors_.

Πρακτική συνέπεια

Η πρόσβαση σε χαρακτηριστικό με επίθημα πριν από κάθε κλήση fit() εγείρει εξαίρεση NotFittedError. Αυτός είναι ο ταχύτερος έλεγχος για να κριθεί: ένα χαρακτηριστικό που δεν υπάρχει πριν από την εκπαίδευση είναι κατ’ ανάγκη μαθημένο.

Ορολογικό σημείο προσοχής

Η μέθοδος ονομάζεται get_params() ενώ επιστρέφει τις υπερπαραμέτρους. Αυτή η επιλογή ονοματοδοσίας οφείλεται στη γενική ορολογία του προγραμματισμού, όπου «παράμετρος» δηλώνει όρισμα συνάρτησης. Διατηρεί λυπηρή σύγχυση με τη στατιστική ορολογία. Σε αυτό το μάθημα, και σε συνέντευξη, η «παράμετρος» διατηρεί πάντα τη στατιστική της σημασία: μέγεθος εκτιμώμενο από τα δεδομένα.

4.2 Κατάταξη συγκεκριμένων περιπτώσεων

ΜέγεθοςΚατηγορίαΑιτιολόγηση
coef_ λογιστικής παλινδρόμησηςΠαράμετροςΥπολογισμένο από τον επιλυτή για ελαχιστοποίηση της απώλειας
C λογιστικής παλινδρόμησηςΥπερπαράμετροςΠρέπει να είναι γνωστό πριν από την κλήση του επιλυτή
Κατώφλι 32,50 στο anciennete_mois σε δέντροΠαράμετροςΕπιλεγμένο από την αναζήτηση διαίρεσης
max_depth δέντρουΥπερπαράμετροςΟριοθετεί την αναζήτηση, δεν προέρχεται από αυτή
feature_importances_ δάσουςΠαράγωγη παράμετροςΥπολογισμένη από τη μαθημένη δομή
n_estimators δάσουςΥπερπαράμετροςΚαθορίζει τον αριθμό δέντρων προς κατασκευή
max_iter επιλυτήΥπερπαράμετροςΠροϋπολογισμός που χορηγείται πριν από την έναρξη
n_iter_ επιλυτήΑποτέλεσμα εκτέλεσηςΑριθμός επαναλήψεων που όντως καταναλώθηκαν
mean_ και scale_ ενός StandardScalerΠαράμετρος του μετασχηματιστήΕκτιμώμενες στα δεδομένα εκπαίδευσης
k ενός KNeighborsClassifierΥπερπαράμετροςΚαθορισμένο πριν, ποτέ βελτιστοποιημένο από fit()
Αριθμός διανυσμάτων υποστήριξης που προέκυψανΑποτέλεσμα εκτέλεσηςΣυνέπεια της δυϊκής βελτιστοποίησης
Αριθμός συνιστωσών μιας PCAΥπερπαράμετροςΕπιλεγμένος πριν· οι άξονες μαθαίνονται
Κατώφλι απόφασης στο 0,50Υπερπαράμετρος απόφασηςΠροεπιλεγμένη σύμβαση, δεν προέρχεται από fit()
random_stateΥπερπαράμετρος εκτέλεσηςΚαθορισμένο πριν, αλλά δεν πρέπει να βελτιστοποιείται

4.3 Οι τέσσερις οριακές περιπτώσεις προς κατάκτηση

Οριακή περίπτωση 1 — Οι στατιστικές ενός προεπεξεργαστή. Ο μέσος και η τυπική απόκλιση ενός StandardScaler εκτιμώνται από τα δεδομένα: είναι παράμετροι με την έννοια της διαδικασίας fit(), ακόμη και αν δεν ανήκουν στο προβλεπτικό μοντέλο. Καθοριστική συνέπεια: εκτιμώνται μόνο στο σύνολο εκπαίδευσης και εφαρμόζονται ως έχουν στα άλλα σύνολα. Η εκτίμησή τους στο σύνολο των δεδομένων αποτελεί διαρροή πληροφορίας (κεφάλαιο 028).

Οριακή περίπτωση 2 — Η πρόωρη διακοπή. Με early_stopping=True, ο αριθμός επαναλήψεων που κρατείται καθορίζεται από την ίδια τη διαδικασία, παρατηρώντας την απώλεια σε εσωτερικό σύνολο επικύρωσης. Το σύνορο φαίνεται να θολώνει· δεν θολώνει. Η απόφαση ενεργοποίησης της πρόωρης διακοπής, το μέγεθος αυτού του εσωτερικού συνόλου, η υπομονή και η εποπτευόμενη μετρική παραμένουν υπερπαράμετροι καθορισμένες εκ των προτέρων· ο αριθμός επαναλήψεων που κρατείται είναι αποτέλεσμα.

Οριακή περίπτωση 3 — Οι αυτόματα βελτιστοποιημένες υπερπαράμετροι. Το ότι μια αναζήτηση πλέγματος καθορίζει το max_depth δεν το μετατρέπει σε παράμετρο: η αναζήτηση είναι εξωτερικός βρόχος που επανεκκινεί πλήρεις εκπαιδεύσεις, καθεμία με προκαθορισμένη τιμή. Μία παράμετρος προσαρμόζεται εντός μιας εκπαίδευσης, μία υπερπαράμετρος επιλέγεται μεταξύ πολλών εκπαιδεύσεων (κεφάλαιο 035).

Οριακή περίπτωση 4 — Οι παράγωγες παράμετροι. Το feature_importances_ δεν βελτιστοποιείται άμεσα: είναι στατιστική υπολογισμένη εκ των υστέρων από τις μειώσεις ακαθαρσίας της μαθημένης δομής. Ανήκει ωστόσο στα μαθημένα μεγέθη, αφού δεν υπάρχει πριν από το fit() και εξαρτάται πλήρως από τα δεδομένα. Η ίδια παρατήρηση ισχύει για το coef_ γραμμικού SVM, ανασυντεθειμένο από τους δυϊκούς συντελεστές.


5. Επαλήθευση στον κώδικα: get_params() έναντι coef_ και feature_importances_

Το σύνολο δεδομένων επίδειξης περιγράφει 4 000 πελάτες τηλεπικοινωνιακού φορέα, με πέντε ερμηνευτικές μεταβλητές και δυαδικό στόχο a_resilie του οποίου το ποσοστό θετικών ισούται με 0,3795.

5.1 Οι υπερπαράμετροι: get_params()

python
from sklearn.linear_model import LogisticRegression
from sklearn.preprocessing import StandardScaler
import pandas as pd, numpy as np

Xs = pd.DataFrame(StandardScaler().fit_transform(X), columns=X.columns)

lr = LogisticRegression(C=1.0, max_iter=1000, random_state=0)
lr.fit(Xs, y)

for k, v in sorted(lr.get_params().items()):
    print(f"{k}: {v!r}")
C: 1.0
class_weight: None
dual: False
fit_intercept: True
intercept_scaling: 1
l1_ratio: 0.0
max_iter: 1000
n_jobs: None
penalty: 'deprecated'
random_state: 0
solver: 'lbfgs'
tol: 0.0001
verbose: 0
warm_start: False

Ερμηνεία. Εκτίθενται δεκατέσσερις ρυθμίσεις ενώ μόνο τρεις συμπληρώθηκαν· οι ένδεκα άλλες είναι οι προεπιλεγμένες τιμές του εκτιμητή. Όλες ήταν γνωστές πριν από το fit() και καμία δεν τροποποιήθηκε από αυτό: μια δεύτερη κλήση μετά την εκπαίδευση επιστρέφει το ίδιο λεξικό.

Σημείο προσοχής για τις προεπιλεγμένες τιμές. Ένα μοντέλο που εγκαθίσταται χωρίς όρισμα δεν είναι μοντέλο «χωρίς υπερπαραμέτρους»: είναι μοντέλο του οποίου όλες οι υπερπαράμετροι έλαβαν την προεπιλεγμένη τιμή τους, που είναι συμβάσεις βιβλιοθήκης και όχι βέλτιστα. Το C=1.0 κανονικοποιεί ήδη ουσιαστικά.

Σημείο προσοχής για τις εκδόσεις. Η έξοδος προέρχεται από scikit-learn 1.8, όπου το penalty βρίσκεται σε πορεία απόσυρσης υπέρ του l1_ratio, με την τιμή 0.0 να δηλώνει καθαρή ποινή L2· οι προηγούμενες εκδόσεις εμφανίζουν penalty: 'l2'. Οι υπερπαράμετροι ανήκουν στη διεπαφή μιας βιβλιοθήκης και εξελίσσονται μαζί της· οι μαθημένες παράμετροι ανήκουν στη μαθηματική διατύπωση του μοντέλου και δεν αλλάζουν όνομα.

5.2 Οι μαθημένες παράμετροι: coef_ και intercept_

python
print(pd.Series(np.round(lr.coef_[0], 4), index=X.columns).to_string())
print("intercept_:", np.round(lr.intercept_, 4))
print("n_iter_:", lr.n_iter_)
print("classes_:", lr.classes_)
anciennete_mois     -0.8957
facture_mensuelle    0.5515
nb_appels_support    0.5829
satisfaction        -0.7586
data_go_moyen       -0.0216
intercept_: [-0.6809]
n_iter_: [6]
classes_: [0 1]

Ερμηνεία. Αυτοί οι έξι αριθμοί — πέντε συντελεστές και μία σταθερά — αποτελούν το σύνολο όσων έμαθε το μοντέλο και κανένας δεν γράφτηκε από τον μηχανικό. Εφόσον οι μεταβλητές έχουν τυποποιηθεί, οι συντελεστές είναι συγκρίσιμοι μεταξύ τους: η αρχαιότητα κυριαρχεί, η κατανάλωση δεδομένων είναι αμελητέα.

ΜεταβλητήΣυντελεστήςΛόγος πιθανοτήτωνΕπαγγελματική ανάγνωση
anciennete_mois−0,89570,41Μία επιπλέον τυπική απόκλιση αρχαιότητας διαιρεί την πιθανότητα αποχώρησης διά 2,4
satisfaction−0,75860,47Μία επιπλέον τυπική απόκλιση ικανοποίησης διαιρεί την πιθανότητα διά 2,1
nb_appels_support+0,58291,79Μία επιπλέον τυπική απόκλιση κλήσεων πολλαπλασιάζει την πιθανότητα επί 1,8
facture_mensuelle+0,55151,74Συγκρίσιμη επίδραση, ίδιας κατεύθυνσης
data_go_moyen−0,02160,98Καμία αξιοποιήσιμη επίδραση

Σημείο προσοχής. Τα n_iter_ και classes_ φέρουν τελική κάτω παύλα και υπάρχουν μόνο μετά το fit(), χωρίς να είναι της ίδιας φύσης με το coef_. Το n_iter_ είναι διάγνωση σύγκλισης: η τιμή 6, πολύ κατώτερη του προϋπολογισμού max_iter=1000, δηλώνει σύγκλιση χωρίς διακοπή. Τιμή ίση με max_iter θα σηματοδοτούσε διακοπή λόγω εξάντλησης προϋπολογισμού, άρα μη συγκλίνον μοντέλο.

5.3 Ένα δέντρο: επιβεβλημένες υπερπαράμετροι έναντι μαθημένης δομής

python
from sklearn.tree import DecisionTreeClassifier, export_text

dt = DecisionTreeClassifier(max_depth=3, min_samples_leaf=50, random_state=0)
dt.fit(X, y)

print("noeuds:", dt.tree_.node_count, "profondeur:", dt.get_depth(),
      "feuilles:", dt.get_n_leaves())
print(export_text(dt, feature_names=list(X.columns), decimals=2))
print(pd.Series(np.round(dt.feature_importances_, 4), index=X.columns).to_string())
noeuds: 15 profondeur: 3 feuilles: 8
|--- anciennete_mois <= 32.50
|   |--- satisfaction <= 2.50
|   |   |--- nb_appels_support <= 0.50
|   |   |   |--- class: 1
|   |   |--- nb_appels_support >  0.50
|   |   |   |--- class: 1
|   |--- satisfaction >  2.50
|   |   |--- facture_mensuelle <= 59.15
|   |   |   |--- class: 0
|   |   |--- facture_mensuelle >  59.15
|   |   |   |--- class: 1
|--- anciennete_mois >  32.50
|   |--- satisfaction <= 2.50
|   |   |--- nb_appels_support <= 1.50
|   |   |   |--- class: 0
|   |   |--- nb_appels_support >  1.50
|   |   |   |--- class: 1
|   |--- satisfaction >  2.50
|   |   |--- facture_mensuelle <= 59.45
|   |   |   |--- class: 0
|   |   |--- facture_mensuelle >  59.45
|   |   |   |--- class: 0

anciennete_mois      0.4497
facture_mensuelle    0.1065
nb_appels_support    0.1156
satisfaction         0.3282
data_go_moyen        0.0000

Τι επιβλήθηκε. Μόνο δύο τιμές, max_depth=3 και min_samples_leaf=50. Το βάθος που προέκυψε ισούται ακριβώς με 3: ο περιορισμός είναι ενεργός, χωρίς αυτόν το δέντρο θα συνέχιζε να μεγαλώνει.

Τι μαθεύτηκε. Επτά εσωτερικές διαιρέσεις, καθεμία ορισμένη από ζεύγος (μεταβλητή, κατώφλι), και οκτώ φύλλα με την κατανομή κλάσεών τους. Οι τιμές 32,50, 2,50, 59,15, 0,50, 1,50 και 59,45 προέρχονται όλες από την αναζήτηση διαίρεσης. Το ότι η facture_mensuelle κόβεται στο 59,15 σε έναν κλάδο και στο 59,45 σε άλλον δείχνει ότι πρόκειται για τοπικά εκτιμώμενα μεγέθη, όχι για επαγγελματικά κατώφλια.

Οι σημαντικότητες. Το feature_importances_ είναι διάνυσμα που αθροίζει στο 1 και κατανέμει τη συνολική μείωση ακαθαρσίας μεταξύ των μεταβλητών. Το data_go_moyen λαμβάνει 0,0000: υπό αυτόν τον περιορισμό βάθους, η μεταβλητή δεν επιλέχθηκε ποτέ για διαίρεση. Αυτό το μηδέν δεν σημαίνει επομένως «χωρίς δεσμό με τον στόχο» αλλά «ποτέ επιλεγμένη υπό αυτές τις συνθήκες»· μεγαλύτερο βάθος θα της απέδιδε μη μηδενική σημασία. Όρια αυτού του δείκτη στο κεφάλαιο 080.

Δύο ζεύγη υποκλάδων καταλήγουν στην ίδια προβλεπόμενη κλάση. Η διαίρεση κρατήθηκε παρόλα αυτά επειδή μειώνει την ακαθαρσία: οι προβλεπόμενες πιθανότητες διαφέρουν, ακόμη και όταν συμπίπτει η πλειοψηφική κλάση (κεφάλαιο 029).

5.4 Μία υπερπαράμετρος καθορίζει τον αριθμό παραμέτρων

python
for d in [2, 3, 5, 10, None]:
    m = DecisionTreeClassifier(max_depth=d, random_state=0).fit(X, y)
    print(f"max_depth={str(d):>4} -> noeuds={m.tree_.node_count:>5}"
          f"  feuilles={m.get_n_leaves():>5}  acc_train={m.score(X, y):.4f}")
max_depth=   2 -> noeuds=    7  feuilles=    4  acc_train=0.6980
max_depth=   3 -> noeuds=   15  feuilles=    8  acc_train=0.7202
max_depth=   5 -> noeuds=   63  feuilles=   32  acc_train=0.7445
max_depth=  10 -> noeuds=  757  feuilles=  379  acc_train=0.8498
max_depth=None -> noeuds= 2033  feuilles= 1017  acc_train=1.0000

Ερμηνεία. Μία μοναδική υπερπαράμετρος μεταφέρει το μοντέλο από 7 σε 2 033 μαθημένους κόμβους, δηλαδή παράγοντα 290, και η ορθότητα εκπαίδευσης προχωρά έως 1,0000: το μη δεσμευμένο δέντρο απομονώνει κάθε παρατήρηση. Αυτή η τιμή δεν είναι επιτυχία αλλά απομνημόνευση — σε θορυβώδη δεδομένα όπου το ποσοστό θετικών ισούται με 0,38, κανένα ειλικρινές μοντέλο δεν ταξινομεί τέλεια το σύνολο εκπαίδευσής του (κεφάλαιο 031).

5.5 Ο ίδιος μηχανισμός στην κανονικοποίηση

python
for C in [0.001, 0.01, 0.1, 1.0, 100.0]:
    m = LogisticRegression(C=C, max_iter=1000).fit(Xs, y)
    print(f"C={C:<8} coef_={np.round(m.coef_[0], 3)}  "
          f"norme_L2={np.linalg.norm(m.coef_):.3f}")
C=0.001    coef_=[-0.336  0.205  0.22  -0.283 -0.002]  norme_L2=0.533
C=0.01     coef_=[-0.737  0.451  0.479 -0.623 -0.014]  norme_L2=1.168
C=0.1      coef_=[-0.877  0.539  0.57  -0.742 -0.021]  norme_L2=1.392
C=1.0      coef_=[-0.896  0.551  0.583 -0.759 -0.022]  norme_L2=1.422
C=100.0    coef_=[-0.898  0.553  0.584 -0.76  -0.022]  norme_L2=1.425

Ερμηνεία. Το C δεν εμφανίζεται ποτέ στο coef_ αλλά διέπει το εύρος του: η νόρμα των συντελεστών περνά από 0,533 σε 1,425 όταν το C αυξάνεται από 0,001 σε 100. Η συστολή είναι ομοιόμορφη και διατηρεί τη σειρά των μεταβλητών. Πέραν του C=1, οι συντελεστές σχεδόν δεν κινούνται: η ποινή έχει γίνει αμελητέα έναντι του όρου απώλειας. Η εξερεύνηση C=10 000 θα ήταν χωρίς επίδραση εδώ, γεγονός που δικαιολογεί τα οριοθετημένα λογαριθμικά πλέγματα (κεφάλαιο 035).

Διατύπωση προς απομνημόνευση: οι υπερπαράμετροι δεν βρίσκονται στο μοντέλο δίπλα στις παραμέτρους, είναι οι περιορισμοί υπό τους οποίους υπολογίστηκαν οι παράμετροι.


6. Γιατί οι υπερπαράμετροι δεν ρυθμίζονται ποτέ στο σύνολο δοκιμής

6.1 Η αρχή

Η ρύθμιση υπερπαραμέτρου προϋποθέτει σύγκριση πολλών εκπαιδεύσεων και κράτηση της καλύτερης, γεγονός που απαιτεί σύνολο μη χρησιμοποιημένο για την προσαρμογή των παραμέτρων. Ο πειρασμός είναι να χρησιμοποιηθεί το σύνολο δοκιμής, αφού αυτό φέρει την εκτίμηση επίδοσης. Ακριβώς αυτή η χρήση του απαγορεύεται.

Κάθε απόφαση που λαμβάνεται κοιτάζοντας ένα σύνολο δεδομένων μεταφέρει πληροφορία από αυτό το σύνολο προς το μοντέλο. Αυτό το σύνολο παύει τότε να είναι αδημοσίευτο και το σκορ που παράγει παύει να εκτιμά την επίδοση σε νέα δεδομένα.

ΣύνολοΤι αποφασίζεται εκείΑριθμός συμβουλώνΤι εκτιμά το σκορ του
ΕκπαίδευσηΟι παράμετροι του μοντέλουΜία φορά ανά εκπαίδευσηΤην ικανότητα αναπαραγωγής των ιδωμένων δεδομένων, χωρίς προβλεπτική αξία
ΕπικύρωσηΟι υπερπαράμετροι, ο αλγόριθμος, το κατώφλι, οι κρατημένες μεταβλητέςΜία φορά ανά δοκιμασμένη διαμόρφωσηΑισιόδοξη επίδοση, μεροληπτική λόγω επιλογής
ΔοκιμήΤίποταΜία μόνο φορά, στο τέλοςΗ αναμενόμενη επίδοση σε νέα δεδομένα

6.2 Ο ποσοτικός μηχανισμός της μεροληψίας επιλογής

Το σκορ που προκύπτει σε πεπερασμένο σύνολο φέρει δειγματοληπτική μεταβλητότητα: σε 800 παρατηρήσεις επικύρωσης, η τυπική απόκλιση ορθότητας κοντά στο 0,75 ισούται περίπου με 0,015. Η σύγκριση K διαμορφώσεων και η κράτηση του μεγίστου ισοδυναμεί με επιλογή, μεταξύ K θορυβωδών κληρώσεων, εκείνης της οποίας ο θόρυβος είναι ο πιο ευνοϊκός.

Συγκρινόμενες διαμορφώσειςΑναμενόμενη απόκλιση μεταξύ παρατηρούμενου μεγίστου και πραγματικής επίδοσης
1περίπου 0,000
10περίπου +0,023
50περίπου +0,032
200περίπου +0,040

Αυτές οι τάξεις μεγέθους αντιστοιχούν στην αναμονή του μεγίστου K κεντραρισμένων γαουσιανών μεταβλητών τυπικής απόκλισης 0,015. Το συμπέρασμα είναι δομικό και δεν εξαρτάται από την επιμέλεια της προσέγγισης: το σκορ της κρατημένης διαμόρφωσης είναι αισιόδοξο εκ κατασκευής. Απαιτείται επομένως επιπλέον σύνολο, που έμεινε εκτός κάθε απόφασης, για αμερόληπτη εκτίμηση.

6.3 Επιχειρησιακές διατυπώσεις

  • Το σύνολο δοκιμής είναι προϋπολογισμός μοναδικής χρήσης: καταναλώνεται όταν το κοιτάζουμε, όχι όταν το τροποποιούμε.
  • Μόλις οποιαδήποτε επιλογή διαιτητευτεί σε σύνολο — υπερπαράμετρος, αλγόριθμος, κατώφλι, υποσύνολο μεταβλητών, στρατηγική καταλογισμού — αυτό το σύνολο παίζει τον ρόλο συνόλου επικύρωσης, όποιο και αν είναι το όνομα της μεταβλητής που το περιέχει. Ένα σύνολο δοκιμής που συμβουλεύεται πολλές φορές υποβαθμίζεται έτσι σε σύνολο επικύρωσης, σταδιακά και αόρατα στις μετρικές.
  • Η απόκλιση μεταξύ της επίδοσης που ανακοινώνεται σε συνάντηση και εκείνης που διαπιστώνεται στην παραγωγή βρίσκει εδώ μία από τις δύο κύριες αιτίες της, η άλλη είναι η διαρροή πληροφορίας που αντιμετωπίζεται στο κεφάλαιο 028.

Παραπομπές: η κατασκευή των τριών συνόλων αντιμετωπίζεται στο κεφάλαιο 026, τα ιδιαίτερα σχήματα τεμαχισμού στο κεφάλαιο 027, η διασταυρωμένη επικύρωση στο κεφάλαιο 034, οι διαδικασίες αναζήτησης υπερπαραμέτρων στο κεφάλαιο 035 και η επιλογή κατωφλίου απόφασης στο κεφάλαιο 062.


7. Ικανότητα μοντέλου και συμβιβασμός μεροληψίας-διακύμανσης

ΟΡΙΣΜΟΣ — Ικανότητα μοντέλου (model capacity)

Αυστηρός ορισμός

Μέτρο του πλούτου της οικογένειας συναρτήσεων που ένας αλγόριθμος, διαμορφωμένος με ορισμένο τρόπο, είναι σε θέση να αναπαραστήσει. Τυποποιείται από τη διάσταση Vapnik-Chervonenkis (Vapnik και Chervonenkis, 1971) — καρδινικότητα του μεγαλύτερου συνόλου σημείων που η οικογένεια μπορεί να διαχωρίσει σύμφωνα με όλες τις δυνατές επισημειώσεις — ή από συγγενή μέτρα όπως η πολυπλοκότητα Rademacher.

Αντίστοιχος ρόλος των δύο κατηγοριών μεγεθών

Οι υπερπαράμετροι οριοθετούν τον χώρο υποθέσεων H· οι παράμετροι επιλέγουν ένα στοιχείο h εντός του H. Η αύξηση της ικανότητας σημαίνει διεύρυνση του H.

Μετάφραση σε καθημερινή γλώσσα

Μέχρι ποιου σημείου ένα μοντέλο μπορεί να αγκαλιάσει τη μορφή των δεδομένων. Μία ανεπαρκής ικανότητα το εμποδίζει να αναπαραστήσει το φαινόμενο· μία υπερβολική ικανότητα του επιτρέπει να αγκαλιάσει και τον θόρυβο.

Σημείο προσοχής

Η ικανότητα δεν είναι η επίδοση: ένα μη δεσμευμένο δέντρο επιτυγχάνει τέλεια ορθότητα στην εκπαίδευση και μπορεί να είναι μέτριο σε νέα δεδομένα (σημείο 5.4).

ΥπερπαράμετροςΑύξηση της τιμής τηςΙκανότηταΚυρίαρχος κίνδυνος αν ωθηθεί στο άκρο
max_depthΒαθύτερο δέντροΑυξάνεταιΥπερπροσαρμογή
min_samples_leafΠυκνότερα φύλλαΜειώνεταιΥποπροσαρμογή
alpha (Ridge, Lasso, MLP)Ισχυρότερη ποινήΜειώνεταιΥποπροσαρμογή
C (λογιστική, SVM)Ασθενέστερη ποινήΑυξάνεταιΥπερπροσαρμογή
n_neighbors (k)Ευρύτερη γειτονίαΜειώνεταιΥποπροσαρμογή
hidden_layer_sizesΕυρύτερο ή βαθύτερο δίκτυοΑυξάνεταιΥπερπροσαρμογή
gamma (πυρήνας RBF)Πιο τοπική επίδρασηΑυξάνεταιΈντονη υπερπροσαρμογή
learning_rate (boosting)Μεγαλύτερο βήμαΑυξάνεται με σταθερό προϋπολογισμό επαναλήψεωνΥπερπροσαρμογή
n_estimators (τυχαίο δάσος)Περισσότερα συναθροισμένα δέντραΣταθεροποιεί τη διακύμανσηΥπολογιστικό κόστος, χωρίς αξιοσημείωτη υποβάθμιση

Σημείο προσοχής για το n_estimators. Η τελευταία γραμμή αποτελεί εξαίρεση. Σε τυχαίο δάσος, η αύξηση του αριθμού δέντρων μειώνει τη διακύμανση του αθροίσματος χωρίς να αυξάνει την υπερπροσαρμογή, με ταχέως φθίνουσες αποδόσεις. Στο boosting, κάθε επανάληψη διορθώνει τα υπόλοιπα των προηγούμενων: το n_estimators αυξάνει εκεί την ικανότητα και πρέπει να οριοθετείται, με πρόωρη διακοπή ή επικύρωση. Η ίδια ονομασία καλύπτει επομένως δύο αντίθετες συμπεριφορές ανάλογα με την οικογένεια αλγορίθμων.

Ο συμβιβασμός. Μία ανεπαρκής ικανότητα παράγει συστηματικό σφάλμα, τη μεροληψία: το μοντέλο αποτυγχάνει τόσο στην εκπαίδευση όσο και στη δοκιμή. Μία υπερβολική ικανότητα παράγει ευαισθησία στο συγκεκριμένο σύνολο εκπαίδευσης, τη διακύμανση: το μοντέλο επιτυγχάνει στην εκπαίδευση και αποτυγχάνει σε νέα δεδομένα. Η ρύθμιση των υπερπαραμέτρων ικανότητας ισοδυναμεί με διαιτησία μεταξύ αυτών των δύο καθεστώτων. Συμβιβασμός μεροληψίας-διακύμανσης στο κεφάλαιο 032, υπερπροσαρμογή και υποπροσαρμογή στο κεφάλαιο 031, μοχλοί διόρθωσης στο κεφάλαιο 033.


8. Το συναφές λεξιλόγιο: απώλεια, μετρική, σκορ, κατώφλι, αφελής αναφορά

Αυτές οι πέντε έννοιες εισάγονται εδώ επειδή είναι αδιαχώριστες από την προηγούμενη διάκριση: η απώλεια είναι αυτό που ελαχιστοποιεί η βελτιστοποίηση για να παράγει τις παραμέτρους, η μετρική είναι αυτό που συγκρίνει η επικύρωση για να επιλέξει τις υπερπαραμέτρους, το κατώφλι και η αφελής αναφορά είναι δύο αποφάσεις μηχανικής που τίποτα δεν μαθαίνει. Καθεμία αντιμετωπίζεται εις βάθος αργότερα.

ΟΡΙΣΜΟΣ — Συνάρτηση απώλειας (loss function)

Αυστηρός ορισμός

Συνάρτηση ℓ(y, ŷ) που αντιστοιχίζει σε ζεύγος παρατηρούμενης και προβλεπόμενης τιμής έναν θετικό πραγματικό που μετρά το κόστος της απόκλισης. Ο μέσος της στο σύνολο εκπαίδευσης αποτελεί τον εμπειρικό κίνδυνο, ποσότητα που όντως ελαχιστοποιεί η διαδικασία βελτιστοποίησης. Γίνεται αδιάκριτα λόγος για συνάρτηση κόστους, αντικειμενική συνάρτηση ή κριτήριο.

Μετάφραση σε καθημερινή γλώσσα

Η μέτρηση του σφάλματος που το μοντέλο αναζητεί να μειώσει ενώ μαθαίνει. Είναι οι χαμένοι βαθμοί και η μάθηση συνίσταται στο να χαθούν όσο το δυνατόν λιγότεροι.

Τεχνικός περιορισμός

Μία συνάρτηση απώλειας πρέπει να είναι βελτιστοποιήσιμη από τη χρησιμοποιούμενη διαδικασία: συχνότερα διαφορίσιμη, ή τουλάχιστον αποσυνθέσιμη σε τοπικά κριτήρια, γεγονός που αποκλείει τις περισσότερες επαγγελματικές μετρικές.

Σημείο προσοχής

Η απώλεια υπολογίζεται στο σύνολο εκπαίδευσης κατά τη μάθηση. Μία χαμηλή απώλεια εκπαίδευσης δεν πληροφορεί σε τίποτα για τη γενίκευση. Η σύγκριση απωλειών εκπαίδευσης και επικύρωσης αντιμετωπίζεται στο κεφάλαιο 030.

ΈργοΣυνήθης απώλειαΤι ποινικοποιεί
ΠαλινδρόμησηΜέσο τετραγωνικό σφάλμα (MSE)Το τετράγωνο της απόκλισης, άρα έντονα τις μεγάλες αποκλίσεις
Ανθεκτική παλινδρόμησηΑπόλυτο σφάλμα (MAE), απώλεια HuberΓραμμικά, άρα λιγότερο ευαίσθητη στις ακραίες τιμές
Πιθανοτική ταξινόμησηΔιασταυρούμενη εντροπία, log lossΤην εμπιστοσύνη που αποδίδεται σε εσφαλμένη πρόβλεψη
SVMΑπώλεια άρθρωσης (hinge)Τις παραβιάσεις του περιθωρίου
Διαίρεση δέντρουΑκαθαρσία Gini, εντροπίαΤην ετερογένεια των κλάσεων σε έναν κόμβο
ΟΡΙΣΜΟΣ — Μετρική αξιολόγησης (evaluation metric)

Αυστηρός ορισμός

Μέγεθος υπολογισμένο από τις προβλέψεις ενός μοντέλου και τις παρατηρούμενες τιμές, προορισμένο να χαρακτηρίσει την επίδοσή του ενόψει σύγκρισης ή απόφασης. Δεν παρεμβαίνει στη βελτιστοποίηση των παραμέτρων και δεν υπόκειται σε κανέναν περιορισμό διαφορισιμότητας.

Μετάφραση σε καθημερινή γλώσσα

Ο αριθμός που παρουσιάζουμε για να πούμε αν το μοντέλο είναι καλό και σύμφωνα με ποιο κριτήριο.

Διάκριση από την απώλεια

Η απώλεια χρησιμεύει στη μάθηση, η μετρική στην κρίση. Ένας ταξινομητής μπορεί να ελαχιστοποιεί τη διασταυρούμενη εντροπία ενώ αξιολογείται στην ανάκληση: είναι δύο διαφορετικά μεγέθη υπολογισμένα στις ίδιες προβλέψεις.

Σημείο προσοχής

Η μετρική ευθυγραμμίζεται με το επαγγελματικό διακύβευμα, όχι με τη μαθηματική ευκολία. Η επιλογή της μετρικής αντιμετωπίζεται στα κεφάλαια 052 έως 075 και η κατευθυντήρια αρχή του μαθήματος υπενθυμίζεται στο κεφάλαιο 075: το ερώτημα δεν είναι ποια μετρική είναι η καλύτερη, αλλά ποιο σφάλμα κοστίζει περισσότερο.

ΚριτήριοΣυνάρτηση απώλειαςΜετρική αξιολόγησης
ΣκοπόςΚαθοδήγηση της βελτιστοποίησηςΧαρακτηρισμός και επικοινωνία
ΧρήστηςΗ διαδικασία fit()Ο μηχανικός και ο επαγγελματικός αποφασίζων
ΠεριορισμόςΒελτιστοποιήσιμη, γενικά διαφορίσιμηΚανένας
Στιγμή υπολογισμούΣε κάθε επανάληψη της εκπαίδευσηςΜετά την πρόβλεψη, σε δεσμευμένο σύνολο
ΠαραδείγματαMSE, log loss, hinge, GiniΟρθότητα, ακρίβεια, ανάκληση, F1, AUC, MAE, R²
Επιλέγεται απόΣε μεγάλο βαθμό επιβαλλόμενη από τον αλγόριθμοΤον μηχανικό, σύμφωνα με το κόστος των σφαλμάτων
ΑΝΑΛΟΓΙΑ — Η βαθμολογική κλίμακα και ο χαρακτηρισμός

Ένας φοιτητής διαβάζει για εξέταση. Η βαθμολογική κλίμακα διόρθωσης του λέει πόσους βαθμούς χάνει σε κάθε τύπο σφάλματος: αυτό αναζητεί να ελαχιστοποιήσει δουλεύοντας. Αυτή είναι η συνάρτηση απώλειας.

Ο χαρακτηρισμός στο απολυτήριό του — μέτρια, καλά, άριστα — είναι αυτό που θα κοιτάξει ο εργοδότης. Αυτή είναι η μετρική.

Τα δύο υπολογίζονται στην ίδια κόλλα και δεν συμπίπτουν: δύο κόλλες που έχασαν τον ίδιο αριθμό βαθμών μπορούν να λάβουν διαφορετικές εκτιμήσεις ανάλογα με την κατανομή των σφαλμάτων μεταξύ των δοκιμασιών.

Η βελτιστοποίηση της κλίμακας χωρίς ποτέ να κοιτάζεται ο χαρακτηρισμός αποτελεί συχνό μεθοδολογικό σφάλμα: ένα μοντέλο του οποίου η απώλεια μειώνεται τακτικά μπορεί να δει την επαγγελματική του μετρική να σταματά ή να υποβαθμίζεται.

ΟΡΙΣΜΟΣ — Σκορ

Αυστηρός ορισμός

Ο όρος καλύπτει δύο διακριτές αποδοχές που δεν πρέπει ποτέ να συγχέονται.

Αποδοχή 1 — σκορ εξόδου του μοντέλου. Συνεχής τιμή που παράγει το μοντέλο για μία παρατήρηση, πριν από κάθε απόφαση: εκτιμώμενη πιθανότητα που επιστρέφει το predict_proba(), ή μη βαθμονομημένη τιμή που επιστρέφει το decision_function(). Ένα σκορ δεν είναι κλάση.

Αποδοχή 2 — σκορ επίδοσης. Αριθμητική τιμή μετρικής αξιολόγησης σε σύνολο δεδομένων. Αυτή είναι η σημασία του model.score(X, y) στο scikit-learn, που επιστρέφει την ορθότητα για ταξινομητή και τον συντελεστή προσδιορισμού R² για παλινδρομητή.

Σύμβαση scikit-learn

Οι συναρτήσεις αξιολόγησης ακολουθούν τον κανόνα «μεγαλύτερο είναι καλύτερο». Οι μετρικές σφάλματος, που πρέπει να ελαχιστοποιούνται, εκτίθενται επομένως σε αρνητική μορφή: neg_mean_squared_error, neg_log_loss. Μία αρνητική τιμή που εμφανίζει αναζήτηση πλέγματος δεν αποτελεί ανωμαλία.

Σημείο προσοχής

Η ανακοίνωση «το σκορ του μοντέλου είναι 0,91» δεν έχει καμία πληροφοριακή αξία όσο δεν ονομάζονται η μετρική και το σύνολο δεδομένων.

ΟΡΙΣΜΟΣ — Κατώφλι απόφασης (decision threshold)

Αυστηρός ορισμός

Τιμή αποκοπής εφαρμοζόμενη στο συνεχές σκορ που παράγει ένας ταξινομητής για να μετατρέψει αυτό το σκορ σε διακριτή απόφαση. Σε δυαδικό πρόβλημα, η παρατήρηση αποδίδεται στη θετική κλάση όταν το εκτιμώμενο σκορ είναι μεγαλύτερο ή ίσο του κατωφλίου.

Μετάφραση σε καθημερινή γλώσσα

Από ποιο επίπεδο πιθανότητας αποφασίζουμε να δράσουμε.

Καθεστώς ως προς το κεφάλαιο

Το κατώφλι δεν μαθαίνεται. Η τιμή 0,50 είναι προεπιλεγμένη σύμβαση, όχι βέλτιστο. Το κατώφλι είναι υπερπαράμετρος απόφασης, της οποίας η ρύθμιση διεξάγεται σε σύνολο επικύρωσης, ποτέ στο σύνολο δοκιμής.

Σημείο προσοχής

Η μείωση του κατωφλίου αυξάνει τον αριθμό προβλεπόμενων θετικών, άρα την ανάκληση, εις βάρος της ακρίβειας· η αύξησή του παράγει το αντίστροφο αποτέλεσμα. Η ρύθμιση ανήκει σε οικονομική διαιτησία μεταξύ του κόστους ενός ψευδώς θετικού και εκείνου ενός ψευδώς αρνητικού. Αντιμετωπίζεται στα κεφάλαια 029 και 062.

ΟΡΙΣΜΟΣ — Αφελής αναφορά (baseline)

Αυστηρός ορισμός

Εσκεμμένα τετριμμένο μοντέλο αναφοράς, που χρησιμεύει ως κατώτερο όριο με το οποίο συγκρίνεται κάθε υποψήφιο μοντέλο. Η επίδοσή του αποτελεί το κατώφλι κάτω από το οποίο ένα μαθημένο μοντέλο δεν προσφέρει καμία αξία.

Συνήθεις αναφορές

ΈργοΑφελής αναφοράΥλοποίηση
ΤαξινόμησηΠρόβλεψη συστηματικά της πλειοψηφικής κλάσηςDummyClassifier(strategy="most_frequent")
ΤαξινόμησηΤυχαία κλήρωση σύμφωνα με τις παρατηρούμενες συχνότητεςDummyClassifier(strategy="stratified")
ΠαλινδρόμησηΠρόβλεψη του μέσου του στόχουDummyRegressor(strategy="mean")
ΠαλινδρόμησηΠρόβλεψη της διαμέσου του στόχουDummyRegressor(strategy="median")
ΧρονοσειρέςΕπανάληψη της τελευταίας παρατηρούμενης τιμήςΜοντέλο εμμονής
Βιομηχανικό πλαίσιοΟ επαγγελματικός κανόνας που βρίσκεται ήδη στην παραγωγήΕπανυλοποίηση του υπάρχοντος κανόνα

Μετάφραση σε καθημερινή γλώσσα

Πριν ισχυριστείτε ότι ένα μοντέλο είναι αποδοτικό, πρέπει να επαληθεύσετε ότι κάνει καλύτερα από μια ηλίθια στρατηγική.

Σημείο προσοχής

Σε ανισορροπημένο σύνολο με 2 % θετικών, η αφελής αναφορά «πλειοψηφική κλάση» επιτυγχάνει 98 % ορθότητα χωρίς να μάθει τίποτα. Μία ορθότητα 97 % που ανακοινώνεται για επιτηδευμένο μοντέλο αποτελεί τότε οπισθοδρόμηση. Αυτός είναι ο λόγος για τον οποίο κάθε αξιολόγηση αρχίζει με τον υπολογισμό της αναφοράς. Αντιμετωπίζεται στα κεφάλαια 049 και 050.

ΈννοιαΡόλος στην αλυσίδαΠοιος την καθορίζειΚεφάλαιο επεξεργασίας
Συνάρτηση απώλειαςΚαθοδηγεί την προσαρμογή των παραμέτρωνΕπιβαλλόμενη από τον αλγόριθμο, ενίοτε διαμορφώσιμη030
ΜετρικήΣυγκρίνει μοντέλα και διαμορφώσειςΟ μηχανικός, σύμφωνα με το επαγγελματικό διακύβευμα052 έως 075
ΣκορΣυνεχής έξοδος, ή τιμή μετρικήςΤο μοντέλο, ή η επιλεγμένη μετρική029, 061, 063
ΚατώφλιΜετατρέπει σκορ σε απόφασηΟ μηχανικός, σε σύνολο επικύρωσης062, 088
Αφελής αναφοράΚαθορίζει το όριο προστιθέμενης αξίαςΟ μηχανικός, πριν από κάθε μοντελοποίηση049

9. Συχνά σφάλματα συλλογισμού

ΣΦΑΛΜΑ — Να αποκαλούμε «παραμέτρους» τα ορίσματα που περνούν στον κατασκευαστή

Η έκφραση «παραμετροποίησα το μοντέλο μου με max_depth ίσο με 5» είναι ασαφής και η μέθοδος get_params() διατηρεί τη σύγχυση, αφού επιστρέφει στην πραγματικότητα τις υπερπαραμέτρους. Η ορολογία του προγραμματισμού και εκείνη της στατιστικής αποκλίνουν εδώ.

Σωστή διατύπωση: «Καθόρισα την υπερπαράμετρο max_depth στο 5. Οι παράμετροι του μοντέλου είναι τα κατώφλια και η δομή του δέντρου, που καθόρισε η εκπαίδευση.»

ΣΦΑΛΜΑ — Να αντιμετωπίζουμε τιμή υπερπαραμέτρου ως καθολικά καλή

Καμία τιμή υπερπαραμέτρου δεν είναι βέλτιστη αφ’ εαυτής. Η κατάλληλη τιμή εξαρτάται από το πλήθος, τον αριθμό μεταβλητών, το επίπεδο θορύβου και τη δομή του φαινομένου. Μία τιμή παρμένη από ανάρτηση ιστολογίου ή προηγούμενο έργο είναι υπόθεση εκκίνησης, όχι ρύθμιση.

Σωστή διατύπωση: «Το max_depth=5 αποδείχθηκε ο καλύτερος συμβιβασμός σε αυτό το σύνολο δεδομένων, μετά από αναζήτηση επικυρωμένη με διασταυρωμένη επικύρωση.»

ΣΦΑΛΜΑ — Να ρυθμίζουμε τις υπερπαραμέτρους στο σύνολο δοκιμής

Το σύνολο δοκιμής πρέπει να μένει εκτός κάθε απόφασης. Μόλις μία διαμόρφωση συγκριθεί εκεί με άλλη, ασκεί τη λειτουργία συνόλου επικύρωσης και το τελικό σκορ γίνεται αισιόδοξο. Η μόλυνση είναι προοδευτική και δεν παράγει κανένα σήμα συναγερμού.

Σωστή διατύπωση: «Οι υπερπαράμετροι επιλέχθηκαν με διασταυρωμένη επικύρωση στο σύνολο εκπαίδευσης. Το σύνολο δοκιμής συμβουλεύθηκε μία μόνο φορά, για την τελική εκτίμηση.»

ΣΦΑΛΜΑ — Να θεωρούμε τις στατιστικές ενός προεπεξεργαστή προκαθορισμένες

Ο μέσος και η τυπική απόκλιση ενός StandardScaler, οι τιμές που κρατά ένας κωδικοποιητής, οι τιμές καταλογισμού εκτιμώνται από τα δεδομένα. Ο υπολογισμός τους στο σύνολο του συνόλου πριν από τον τεμαχισμό μεταφέρει πληροφορία από τη δοκιμή προς την εκπαίδευση.

Σωστή διατύπωση: «Αυτές οι στατιστικές είναι μαθημένα μεγέθη. Εκτιμώνται μόνο στο σύνολο εκπαίδευσης, εντός αγωγού, και εφαρμόζονται στη συνέχεια στα άλλα σύνολα.» Αντιμετωπίζεται στα κεφάλαια 028 και 076.

ΣΦΑΛΜΑ — Να συγχέουμε τη συνάρτηση απώλειας και τη μετρική αξιολόγησης

Μία απώλεια εκπαίδευσης που μειώνεται τακτικά δεν εγγυάται ούτε τη γενίκευση ούτε την ικανοποίηση του επαγγελματικού κριτηρίου. Τα δύο μεγέθη απαντούν σε διαφορετικούς σκοπούς και μπορούν να εξελίσσονται σε αντίθετη κατεύθυνση.

Σωστή διατύπωση: «Το μοντέλο ελαχιστοποιεί τη διασταυρούμενη εντροπία κατά την εκπαίδευση· αξιολογείται στην ανάκληση, επειδή το κόστος ενός ψευδώς αρνητικού κυριαρχεί σε αυτή την περίπτωση χρήσης.»

ΣΦΑΛΜΑ — Να υποθέτουμε ότι η αύξηση της ικανότητας βελτιώνει την επίδοση

Ένα μη δεσμευμένο δέντρο επιτυγχάνει ορθότητα 1,0000 στα δεδομένα εκπαίδευσής του, όπως δείχνει το σημείο 5.4. Αυτή η τιμή μετρά απομνημόνευση, όχι ικανότητα γενίκευσης. Πέραν ορισμένου επιπέδου ικανότητας, το σφάλμα σε νέα δεδομένα αυξάνεται.

Σωστή διατύπωση: «Πέραν ορισμένου επιπέδου ικανότητας, το μοντέλο προσαρμόζει τον θόρυβο του συνόλου εκπαίδευσης· το σφάλμα γενίκευσης υποβαθμίζεται ενώ το σφάλμα εκπαίδευσης συνεχίζει να μειώνεται.»

ΣΦΑΛΜΑ — Να εντάσσουμε το random_state στην αναζήτηση υπερπαραμέτρων

Ο τυχαίος σπόρος καθορίζεται πριν από την εκπαίδευση, γεγονός που τον καθιστά τυπικά υπερπαράμετρο, αλλά δεν φέρει καμία πληροφορία για το φαινόμενο. Η κράτηση του σπόρου που μεγιστοποιεί το σκορ επικύρωσης ισοδυναμεί με επιλογή θορύβου και παράγει όφελος που δεν θα αναπαραχθεί.

Σωστή διατύπωση: «Το random_state καθορίζεται για να διασφαλιστεί η αναπαραγωγιμότητα. Η ευαισθησία του μοντέλου στον σπόρο μετράται, δεν βελτιστοποιείται.»

ΣΦΑΛΜΑ — Να πιστεύουμε ότι το κατώφλι 0,50 παράγεται από την εκπαίδευση

Το predict() εφαρμόζει προεπιλεγμένη σύμβαση. Το μοντέλο παράγει συνεχές σκορ· είναι η βιβλιοθήκη, όχι η μάθηση, που το κόβει στο 0,50.

Σωστή διατύπωση: «Το κατώφλι είναι απόφαση μηχανικής, ρυθμισμένη σε σύνολο επικύρωσης σύμφωνα με το αντίστοιχο κόστος των ψευδώς θετικών και των ψευδώς αρνητικών.»


10. Σύνθεση

ΟΙ ΔΥΟ ΚΑΤΗΓΟΡΙΕΣ
    ΠΑΡΑΜΕΤΡΟΣ       μαθημένη από τη διαδικασία βελτιστοποίησης, κατά το fit()
                    συντελεστές, βάρη και μεροληψίες, κατώφλια και δομή δέντρου,
                    δυϊκοί συντελεστές και διανύσματα υποστήριξης
    ΥΠΕΡΠΑΡΑΜΕΤΡΟΣ  καθορισμένη από τον μηχανικό, πριν από το fit()
                    max_depth, n_estimators, k, learning_rate, alpha, C

ΤΟ ΜΟΝΑΔΙΚΟ ΚΡΙΤΗΡΙΟ ΔΙΑΚΡΙΣΗΣ
    Προσαρμόζεται αυτό το μέγεθος από τη διαδικασία βελτιστοποίησης,
    ή έπρεπε να είναι γνωστό ώστε να ξεκινήσει αυτή η διαδικασία;

Η ΣΥΜΒΑΣΗ SCIKIT-LEARN
    get_params()            -> οι υπερπαράμετροι
    attribut_ (κάτω παύλα)  -> τα μαθημένα μεγέθη
    coef_, intercept_, feature_importances_, tree_, support_vectors_
    Πριν από το fit(), αυτά τα χαρακτηριστικά δεν υπάρχουν: NotFittedError.

Η ΑΝΑΛΟΓΙΑ ΑΝΑΦΟΡΑΣ
    συνταγή             = αλγόριθμος
    ρυθμίσεις φούρνου    = υπερπαράμετροι
    αυτό που γίνεται η ζύμη = μαθημένες παράμετροι
    γλυκό              = μοντέλο

ΤΙ ΔΙΕΠΟΥΝ ΟΙ ΥΠΕΡΠΑΡΑΜΕΤΡΟΙ
    την ικανότητα              max_depth, C, alpha, k, hidden_layer_sizes
    τη βελτιστοποίηση           learning_rate, solver, max_iter, tol
    τη δομή συνόλου  n_estimators, max_features, subsample
    την επεξεργασία του προβλήματος class_weight, criterion, κατώφλι
    την εκτέλεση              n_jobs, verbose, random_state

ΙΚΑΝΟΤΗΤΑ
    Οι υπερπαράμετροι οριοθετούν τον χώρο υποθέσεων H.
    Οι παράμετροι επιλέγουν ένα στοιχείο h στο H.
    Υπερβολικά χαμηλή ικανότητα -> υψηλή μεροληψία, υποπροσαρμογή.
    Υπερβολικά υψηλή ικανότητα  -> υψηλή διακύμανση, υπερπροσαρμογή.

ΚΑΝΟΝΑΣ ΠΡΩΤΟΚΟΛΛΟΥ
    Εκπαίδευση -> προσαρμόζει τις παραμέτρους
    Επικύρωση   -> επιλέγει τις υπερπαραμέτρους και το κατώφλι
    Δοκιμή         -> εκτιμά την επίδοση, συμβουλεύεται μία μόνο φορά
    Ένα σύνολο επί του οποίου αποφασίζουμε παύει να είναι σύνολο αξιολόγησης.

ΤΟ ΣΥΝΑΦΕΣ ΛΕΞΙΛΟΓΙΟ
    απώλεια     αυτό που ελαχιστοποιεί η βελτιστοποίηση για να παράγει τις παραμέτρους
    μετρική  αυτό που συγκρίνουμε για να επιλέξουμε τις υπερπαραμέτρους
    σκορ     συνεχής έξοδος του μοντέλου, ή τιμή μετρικής
    κατώφλι     αποκοπή εφαρμοζόμενη στο σκορ, σύμβαση 0,50, μη μαθημένη
    αφελής αναφορά  όριο κάτω από το οποίο το μοντέλο δεν προσφέρει τίποτα

Δήλωση σύνθεσης

Ένα εκπαιδευμένο μοντέλο διαβάζεται σε δύο επίπεδα: οι υπερπαράμετροι, καθορισμένες πριν από τη μάθηση, οριοθετούν την οικογένεια προσβάσιμων συναρτήσεων και τον τρόπο με τον οποίο θα διεξαχθεί η αναζήτηση· οι παράμετροι, παραγόμενες από αυτή την αναζήτηση, δηλώνουν την τελικά κρατημένη συνάρτηση. Οι πρώτες ρυθμίζονται με σύγκριση διαδοχικών εκπαιδεύσεων σε σύνολο επικύρωσης, ποτέ στο σύνολο δοκιμής, του οποίου η μοναδική συμβουλευτική αποτελεί τη μόνη αμερόληπτη εκτίμηση της αναμενόμενης επίδοσης.


Σχετικά κουίζ

  • 009.1-quiz-parametre-appris.md
  • 009.2-quiz-hyperparametre.md
  • 009.3-quiz-critere-de-distinction.md
  • 009.4-quiz-inspection-scikit-learn.md
  • 009.5-quiz-reglage-et-jeu-de-test.md
  • 009.6-quiz-capacite-biais-variance.md
  • 009.7-quiz-loss-metric-score-seuil-baseline.md

Επόμενο κεφάλαιο: 010-classification-ou-regression.md