Ένα εκπαιδευμένο μοντέλο είναι αριθμητικό αντικείμενο: περιέχει αριθμούς. Αυτοί οι αριθμοί δεν είναι όλοι της ίδιας φύσης και η σύγχυσή τους αποτελεί ένα από τα συχνότερα σφάλματα στην αρχή της πρακτικής.
| Κατηγορία | Προέλευση | Καθορίζεται πότε | Ποιος αποφασίζει |
|---|---|---|---|
| Παράμετρος | Υπολογισμένη από τη διαδικασία βελτιστοποίησης | Κατά την εκπαίδευση | Ο αλγόριθμος, από τα δεδομένα |
| Υπερπαράμετρος | Συμπληρωμένη πριν από την έναρξη της εκπαίδευσης | Πριν από την εκπαίδευση | Ο μηχανικός, ή διαδικασία αναζήτησης |
Το κεφάλαιο 008 διέκρινε τον αλγόριθμο, που είναι διαδικασία, από το μοντέλο, που είναι το αποτέλεσμα της εφαρμογής του σε σύνολο δεδομένων. Οι υπερπαράμετροι διαμορφώνουν τη διαδικασία· οι παράμετροι αποτελούν το αποτέλεσμα.
Ανάγνωση του διαγράμματος: οι υπερπαράμετροι εμφανίζονται στο τελικό μοντέλο στον ίδιο βαθμό με τις παραμέτρους, αφού περιγράφουν τη διαμόρφωσή του, αλλά φτάνουν εκεί από διαφορετική διαδρομή: δεν έχουν διασχίσει ποτέ τη διαδικασία βελτιστοποίησης.
Τέσσερα διακριτά αντικείμενα παρεμβαίνουν στην παρασκευή ενός γλυκού και αντιστοιχούν όρο προς όρο στα τέσσερα αντικείμενα της μηχανικής μάθησης.
Η συνταγή είναι η ακολουθία πράξεων προς διεξαγωγή: ανάμειξη, ενσωμάτωση, ψήσιμο, ανάπαυση. Υπάρχει ανεξάρτητα από κάθε συγκεκριμένο γλυκό. Αυτός είναι ο αλγόριθμος.
Οι ρυθμίσεις είναι οι αποφάσεις που λαμβάνονται πριν μπει το ταψί στον φούρνο: φούρνος στους 180 °C, ψήσιμο 35 λεπτών, μέγεθος φόρμας. Ο ζαχαροπλάστης τις καθορίζει εκ των προτέρων· καμία δεν ανακαλύπτεται κατά το ψήσιμο, όλες το καθορίζουν. Αυτές είναι οι υπερπαράμετροι.
Αυτό που γίνεται η ζύμη κατά το ψήσιμο — δομή της ψίχας, χρωματισμός της κρούστας, κατανομή υγρασίας — δεν αποφασίζεται από κανέναν: προκύπτει από την αλληλεπίδραση μεταξύ υλικών και ρυθμίσεων. Αυτές είναι οι μαθημένες παράμετροι.
Το γλυκό που βγαίνει από τον φούρνο είναι το τελικό αντικείμενο που προκύπτει από την εφαρμογή αυτής της συνταγής σε αυτά τα υλικά με αυτές τις ρυθμίσεις. Αυτό είναι το μοντέλο.
Η σύγχυση μεταξύ παραμέτρου και υπερπαραμέτρου ισοδυναμεί με το να πιστεύει κανείς ότι ο φούρνος «ανακαλύπτει» μόνος του τη θερμοκρασία κατά το ψήσιμο, ή ότι ο ζαχαροπλάστης αποφασίζει εκ των προτέρων τη δομή της ψίχας.
Τρεις συνέπειες διαβάζονται άμεσα στην αναλογία. Τα ίδια υλικά και η ίδια συνταγή
δίνουν διαφορετικά γλυκά ανάλογα με τις ρυθμίσεις: εξ ου και η βελτιστοποίηση
υπερπαραμέτρων, που αντιμετωπίζεται στο κεφάλαιο 035. Δεν υπάρχει καθολικά ορθή
θερμοκρασία, αλλά θερμοκρασία προσαρμοσμένη σε ένα γλυκό και σε έναν φούρνο: ούτε
υπάρχει max_depth βέλτιστο αφ’ εαυτού. Τέλος, δεν προσδιορίζουμε την ορθή
θερμοκρασία σερβίροντας το γλυκό στην κριτική επιτροπή του διαγωνισμού και μετά
ξεκινώντας από την αρχή: η επιτροπή γεύεται μία φορά, οι δοκιμές γίνονται σε
παρτίδες δοκιμής. Αυτό είναι το καθεστώς του συνόλου δοκιμής, που αναπτύσσεται στο
σημείο 6.
Όριο της αναλογίας: ο ζαχαροπλάστης μπορεί να ανοίξει τον φούρνο και να παρατηρήσει το ψήσιμο. Η διαμόρφωση των παραμέτρων δεν είναι, αντίθετα, παρατηρήσιμη βήμα προς βήμα με ερμηνεύσιμο τρόπο. Η αναλογία περιγράφει τους ρόλους, όχι τη διαφάνεια της διαδικασίας.
Αυστηρός ορισμός
Εσωτερικό μέγεθος μοντέλου του οποίου η τιμή καθορίζεται από τη διαδικασία βελτιστοποίησης εφαρμοζόμενη στα δεδομένα εκπαίδευσης, με σκοπό την ελαχιστοποίηση μιας αντικειμενικής συνάρτησης ορισμένης σε αυτά τα δεδομένα. Το σύνολο των παραμέτρων, σημειούμενο συνήθως θ, ταυτοποιεί μονοσήμαντα μία ιδιαίτερη συνάρτηση εντός της οικογένειας συναρτήσεων που ο αλγόριθμος είναι ικανός να αναπαραστήσει.
Συνολοθεωρητική διατύπωση
Ο αλγόριθμος ορίζει οικογένεια υποψήφιων συναρτήσεων, ονομαζόμενη χώρος υποθέσεων και σημειούμενη H. Η εκπαίδευση συνίσταται στην επιλογή στοιχείου h ∈ H. Οι παράμετροι είναι οι συντεταγμένες αυτού του στοιχείου στο H.
Μετάφραση σε καθημερινή γλώσσα
Είναι οι αριθμοί που το ίδιο το μοντέλο υπολόγισε από τα δεδομένα και που αποτελούν το ουσιώδες όσων κράτησε. Αυτοί θα γραφτούν στο αρχείο του μοντέλου και θα επαναφορτωθούν τη στιγμή της πρόβλεψης.
Σημείο προσοχής
Μία παράμετρος έχει νόημα μόνο σε σχέση με το σύνολο δεδομένων που την παρήγαγε. Η επανεκπαίδευση του ίδιου αλγορίθμου σε άλλο δείγμα παράγει άλλες παραμέτρους. Ένας συντελεστής δεν είναι επομένως φυσική σταθερά: είναι εκτίμηση, συνοδευόμενη από δειγματοληπτική αβεβαιότητα.
Η πολλαπλή γραμμική παλινδρόμηση μοντελοποιεί τον στόχο ως αφινικό συνδυασμό των ερμηνευτικών μεταβλητών:
ŷ = b₀ + b₁·x₁ + b₂·x₂ + ... + b_p·x_pΟι μαθημένες παράμετροι είναι οι p συντελεστές b₁ έως και η σταθερά b₀, δηλαδή p + 1 τιμές. Κανένα άλλο μέγεθος δεν απομνημονεύεται.
Αριθμητικό παράδειγμα — εκτίμηση τιμής κατοικίας
| Μεταβλητή | Μαθημένος συντελεστής | Ερμηνεία |
|---|---|---|
| Σταθερά (b₀) | 42 300 | Τιμή βάσης σε δολάρια, όλες οι μεταβλητές μηδενικές |
| Κατοικήσιμη επιφάνεια (m²) | 2 180 | Κάθε επιπλέον m² προσθέτει 2 180 $ |
| Αριθμός υπνοδωματίων | 6 400 | Κάθε επιπλέον υπνοδωμάτιο προσθέτει 6 400 $ |
| Ηλικία του αγαθού (έτη) | −870 | Κάθε έτος αρχαιότητας αφαιρεί 870 $ |
| Απόσταση από το κέντρο (km) | −3 150 | Κάθε επιπλέον km αφαιρεί 3 150 $ |
Ολόκληρο το μοντέλο χωρά σε αυτούς τους πέντε αριθμούς. Για κατοικία 85 m², τριών
υπνοδωματίων, δώδεκα ετών, τεσσάρων χιλιομέτρων από το κέντρο:
ŷ = 42 300 + 2 180×85 + 6 400×3 − 870×12 − 3 150×4 = 224 570 $.
Σημείο προσοχής: η ρήτρα «όλα τα άλλα ίσα» προϋποθέτει ότι οι μεταβλητές μπορούν να μεταβάλλονται σχετικά ανεξάρτητα, υπόθεση σπάνια επαληθευμένη. Η συγγραμμικότητα αντιμετωπίζεται στο κεφάλαιο 045.
Στη λογιστική παλινδρόμηση, η δομή είναι ταυτόσημη, με τον γραμμικό συνδυασμό μετασχηματισμένο από σιγμοειδή για την παραγωγή πιθανότητας. Οι παράμετροι παραμένουν οι συντελεστές και η σταθερά (κεφάλαιο 036).
Αυστηρός ορισμός
Σε πολυεπίπεδο perceptron, κάθε νευρώνας ενός στρώματος υπολογίζει σταθμισμένο άθροισμα των εξόδων του προηγούμενου στρώματος, αυξημένο κατά σταθερό όρο, και στη συνέχεια εφαρμόζει μη γραμμική συνάρτηση ενεργοποίησης. Οι συντελεστές του σταθμισμένου αθροίσματος είναι τα βάρη (weights), ο σταθερός όρος είναι η μεροληψία (bias). Βάρη και μεροληψίες αποτελούν το σύνολο των μαθημένων παραμέτρων του δικτύου.
Καταμέτρηση
Για στρώμα που δέχεται m εισόδους και περιλαμβάνει n νευρώνες, ο αριθμός παραμέτρων είναι m × n βάρη συν n μεροληψίες.
Μετάφραση σε καθημερινή γλώσσα
Κάθε σύνδεση μεταξύ δύο νευρώνων φέρει έναν αριθμό, που δηλώνει τη σημασία που αποδίδεται σε ό,τι μεταδίδει η σύνδεση. Κάθε νευρώνας φέρει επιπλέον έναν αριθμό που μετατοπίζει το κατώφλι ενεργοποίησής του.
Ορολογικό σημείο προσοχής
Η λέξη «μεροληψία» έχει εδώ αυστηρά τεχνική σημασία: είναι ο σταθερός όρος ενός αφινικού μετασχηματισμού. Δεν πρέπει να συγχέεται με τη στατιστική μεροληψία του συμβιβασμού μεροληψίας-διακύμανσης (κεφάλαιο 032), ούτε με την κοινωνική μεροληψία ενός διακριτικού μοντέλου (κεφάλαιο 080). Τρεις ομώνυμες έννοιες, τρεις ξένες μεταξύ τους ορισμοί.
Αριθμητικό παράδειγμα — πολυεπίπεδο perceptron για σκορ αποχώρησης
Αρχιτεκτονική: 20 μεταβλητές εισόδου, δύο κρυφά στρώματα 64 και έπειτα 32 νευρώνων, μία έξοδος.
| Μετάβαση | Βάρη | Μεροληψίες | Σύνολο |
|---|---|---|---|
| Είσοδος → στρώμα 1 | 20 × 64 = 1 280 | 64 | 1 344 |
| Στρώμα 1 → στρώμα 2 | 64 × 32 = 2 048 | 32 | 2 080 |
| Στρώμα 2 → έξοδος | 32 × 1 = 32 | 1 | 33 |
| Σύνολο | 3 360 | 97 | 3 457 |
Αυτό το δίκτυο μαθαίνει 3 457 αριθμούς. Ο αριθμός στρωμάτων και το μέγεθός τους —
δηλαδή hidden_layer_sizes=(64, 32) — δεν μαθαίνονται: είναι υπερπαράμετροι και
αυτές καθορίζουν τον αριθμό παραμέτρων προς μάθηση. Μία υπερπαράμετρος διέπει
επομένως την ποσότητα παραμέτρων, γεγονός που αποτελεί τον άμεσο δεσμό με την
έννοια της ικανότητας, που αντιμετωπίζεται στο σημείο 7.
Ένα δέντρο απόφασης δεν έχει ούτε συντελεστή ούτε βάρος. Αυτό που μαθαίνει είναι συνδυαστικής φύσης:
Μερική όψη: τα τρία πρώτα επίπεδα του δέντρου που όντως προέκυψε στο σημείο 5.3, εκ των οποίων δύο κλάδοι έχουν συντομευθεί.
Η τιμή 32,50 δεν επιλέχθηκε από αναλυτή: ο αλγόριθμος αξιολόγησε τις υποψήφιες διαιρέσεις σε κάθε μεταβλητή και κράτησε εκείνη που μείωνε περισσότερο την ακαθαρσία του κόμβου. Μαθαίνεται, στον ίδιο βαθμό με συντελεστή παλινδρόμησης (μηχανισμός λεπτομερής στο κεφάλαιο 037). Αυτό που καθόρισε ο μηχανικός είναι το πλαίσιο αυτής της αναζήτησης: μέγιστο βάθος, ελάχιστο πλήθος φύλλου, κριτήριο ακαθαρσίας.
Αυστηρός ορισμός
Στη δυϊκή διατύπωση μηχανής διανυσμάτων υποστήριξης (Boser, Guyon και Vapnik, 1992· Cortes και Vapnik, 1995), η λύση εκφράζεται ως γραμμικός συνδυασμός συναρτήσεων πυρήνα αξιολογημένων σε υποσύνολο των παρατηρήσεων εκπαίδευσης. Οι παρατηρήσεις των οποίων ο δυϊκός συντελεστής είναι αυστηρά θετικός ονομάζονται διανύσματα υποστήριξης: είναι οι μόνες που παρεμβαίνουν στη συνάρτηση απόφασης.
Τι μαθαίνεται
Οι δυϊκοί συντελεστές , η ταυτότητα των παρατηρήσεων που κρατούνται ως διανύσματα υποστήριξης και η σταθερά απόφασης. Με γραμμικό πυρήνα, αυτές οι ποσότητες ανασυντίθενται σε διάνυσμα συντελεστών ομοιογενές εκείνου γραμμικού μοντέλου.
Μετάφραση σε καθημερινή γλώσσα
Το μοντέλο κρατά τα παραδείγματα εκπαίδευσης που βρίσκονται κοντά στο σύνορο μεταξύ των κλάσεων και τους αποδίδει βάρος· τα απομακρυσμένα παραδείγματα δεν επηρεάζουν την απόφαση.
Σημείο προσοχής
Ο αριθμός διανυσμάτων υποστήριξης είναι αποτέλεσμα της εκπαίδευσης, ποτέ εντολή.
Ένας αριθμός κοντά στο πλήθος εκπαίδευσης σηματοδοτεί πολύ ανώμαλο σύνορο και
κίνδυνο υπερπροσαρμογής, συχνά συνδεδεμένο με υπερβολικά μεγάλο gamma
(κεφάλαιο 041).
Αυστηρός ορισμός
Μία μέθοδος ονομάζεται μη παραμετρική όταν η πολυπλοκότητα της μαθημένης συνάρτησης δεν οριοθετείται από αριθμό παραμέτρων καθορισμένο a priori, αλλά αυξάνεται με το πλήθος των δεδομένων εκπαίδευσης. Μία μέθοδος ονομάζεται οκνηρή (lazy learning) όταν αναβάλλει κάθε υπολογισμό γενίκευσης έως το αίτημα πρόβλεψης.
Εφαρμογή στους k πλησιέστερους γείτονες
Η κλήση fit() σε KNeighborsClassifier δεν υπολογίζει κανέναν συντελεστή:
απομνημονεύει το σύνολο εκπαίδευσης και κατασκευάζει ενδεχομένως δομή
ευρετηρίασης. Αυτό που «μαθαίνεται» είναι το ίδιο το σύνολο δεδομένων: το μοντέλο
δεν συνοψίζει τίποτα, συγκρίνει τη νέα παρατήρηση με τα διατηρημένα παραδείγματα
τη στιγμή της απάντησης.
Σημείο προσοχής
Μη παραμετρική δεν σημαίνει «χωρίς υπερπαράμετρο». Ο αριθμός γειτόνων k, η μετρική απόστασης και η στάθμιση είναι αποφασιστικά (κεφάλαιο 040).
| Μοντέλο | Φύση των μαθημένων παραμέτρων | Αριθμός για τυπική περίπτωση |
|---|---|---|
| Γραμμική παλινδρόμηση, 20 μεταβλητές | Συντελεστές + σταθερά | 21 |
| Δυαδική λογιστική παλινδρόμηση, 50 μεταβλητές | Συντελεστές + σταθερά | 51 |
| Λογιστική παλινδρόμηση, 10 κλάσεις, 100 μεταβλητές | Πίνακας συντελεστών + σταθερές | 1 010 |
Δέντρο απόφασης, max_depth=3 | Μεταβλητές, κατώφλια, τιμές φύλλων | 15 κόμβοι εκ των οποίων 8 φύλλα |
Δέντρο απόφασης, max_depth=10 | Το ίδιο | 757 κόμβοι εκ των οποίων 379 φύλλα |
Τυχαίο δάσος, 300 δέντρα, max_depth=6 | Το ίδιο, συναθροισμένο σε 300 δέντρα | περίπου 35 000 κόμβοι |
| Πολυεπίπεδο perceptron (20, 64, 32, 1) | Βάρη και μεροληψίες | 3 457 |
| SVM με πυρήνα RBF, 4 000 παρατηρήσεις | Διανύσματα υποστήριξης και δυϊκοί συντελεστές | μερικές εκατοντάδες έως μερικές χιλιάδες |
| k πλησιέστεροι γείτονες, 4 000 παρατηρήσεις | Το απομνημονευμένο σύνολο εκπαίδευσης | 4 000 διατηρημένες παρατηρήσεις |
Οι γραμμές «δέντρο» και «δάσος» επαναλαμβάνουν τις τιμές που μετρήθηκαν στο σημείο 5. Απεικονίζουν κεντρικό γεγονός: ο αριθμός μαθημένων παραμέτρων δεν είναι ιδιότητα του αλγορίθμου μόνο, καθορίζεται από κοινού από τις υπερπαραμέτρους και τα δεδομένα.
Αυστηρός ορισμός
Μέγεθος που διαμορφώνει τον αλγόριθμο μάθησης, του οποίου η τιμή καθορίζεται πριν από την εκτέλεση της διαδικασίας βελτιστοποίησης και δεν τροποποιείται από αυτή. Οι υπερπαράμετροι καθορίζουν τον εξερευνούμενο χώρο υποθέσεων, την αντικειμενική συνάρτηση που όντως ελαχιστοποιείται, την αριθμητική διαδικασία που χρησιμοποιείται και το κριτήριο διακοπής της.
Επιχειρησιακή διατύπωση
Υπερπαράμετρος είναι μεταβλητή της οποίας η τιμή πρέπει να είναι γνωστή ώστε να μπορεί να ξεκινήσει η εκπαίδευση και της οποίας η τιμή είναι αμετάβλητη όταν τελειώνει η εκπαίδευση.
Μετάφραση σε καθημερινή γλώσσα
Είναι οι ρυθμίσεις που γράφουμε οι ίδιοι ανάμεσα στις παρενθέσεις του μοντέλου, πριν ξεκινήσουμε τη μάθηση.
Προέλευση του προθέματος
Το πρόθεμα «υπερ-» δηλώνει ανώτερο επίπεδο: αυτά τα μεγέθη βρίσκονται πάνω από τις παραμέτρους, αφού καθορίζουν τον τρόπο με τον οποίο αυτές θα προσδιοριστούν.
Σημείο προσοχής — στατιστική ομωνυμία
Στη μπεϋζιανή στατιστική, «υπερπαράμετρος» δηλώνει παράμετρο του εκ των προτέρων νόμου πιθανότητας που φέρεται επί των παραμέτρων του μοντέλου. Οι δύο αποδοχές μοιράζονται την ίδια ιδέα δεύτερου επιπέδου, αλλά δεν καλύπτουν τα ίδια αντικείμενα. Σε πλαίσιο εφαρμοσμένης μηχανικής μάθησης, επικρατεί η αποδοχή που δίνεται παραπάνω.
| Αλγόριθμος | Υπερπαράμετρος | Ρόλος | Επίδραση αύξησης |
|---|---|---|---|
| Λογιστική παλινδρόμηση | C | Αντίστροφο της ισχύος κανονικοποίησης | Ασθενέστερη κανονικοποίηση, ελευθερότεροι συντελεστές, αυξημένη ικανότητα |
| Λογιστική παλινδρόμηση | penalty / l1_ratio | Φύση της ποινής (L1, L2, μικτή) | Η L1 μηδενίζει συντελεστές, η L2 τους συστέλλει |
| Ridge, Lasso, ElasticNet | alpha | Ισχύς της κανονικοποίησης | Περισσότερο δεσμευμένοι συντελεστές, μειωμένη ικανότητα |
| Δέντρο απόφασης | max_depth | Μέγιστο βάθος | Βαθύτερο δέντρο, αυξημένη ικανότητα, πιθανή υπερπροσαρμογή |
| Δέντρο απόφασης | min_samples_leaf | Ελάχιστο πλήθος φύλλου | Πυκνότερα φύλλα, κανονικότερο δέντρο, μειωμένη ικανότητα |
| Δέντρο απόφασης | ccp_alpha | Κόστος πολυπλοκότητας για κλάδεμα | Επιθετικότερο κλάδεμα, μειωμένη ικανότητα |
| Τυχαίο δάσος | n_estimators | Αριθμός συναθροισμένων δέντρων | Μειωμένη διακύμανση πρόβλεψης, αυξημένο υπολογιστικό κόστος |
| Τυχαίο δάσος | max_features | Υποψήφιες μεταβλητές ανά διαίρεση | Περισσότερο συσχετισμένα δέντρα μεταξύ τους, μειωμένο όφελος συνάθροισης |
| Gradient boosting | learning_rate | Βήμα συστολής κάθε δέντρου | Ταχύτερη μάθηση, αυξημένος κίνδυνος υπερπροσαρμογής |
| Gradient boosting | n_estimators | Αριθμός επαναλήψεων boosting | Αυξημένη ικανότητα, δυνατή υπερπροσαρμογή χωρίς πρόωρη διακοπή |
| Gradient boosting | subsample | Κλάσμα παρατηρήσεων ανά επανάληψη | Λιγότερη στοχαστική κανονικοποίηση όταν τείνει στο 1 |
| k πλησιέστεροι γείτονες | n_neighbors (k) | Αριθμός συμβουλευόμενων γειτόνων | Λειότερο σύνορο, μειωμένη ικανότητα |
| SVM | C | Ποινή παραβιάσεων περιθωρίου | Στενότερο περιθώριο, αυστηρότερη προσαρμογή στα δεδομένα |
| SVM | kernel, gamma | Μορφή του συνόρου | Υψηλό gamma: πολύ τοπικό σύνορο, υπερπροσαρμογή |
| Πολυεπίπεδο perceptron | hidden_layer_sizes | Αρχιτεκτονική του δικτύου | Περισσότερες παράμετροι προς μάθηση, αυξημένη ικανότητα |
| Πολυεπίπεδο perceptron | alpha | Κανονικοποίηση L2 των βαρών | Περισσότερο δεσμευμένα βάρη, μειωμένη ικανότητα |
Σημείο προσοχής για τα C και alpha: αυτές οι δύο υπερπαράμετροι διέπουν
το ίδιο πράγμα — την ισχύ της κανονικοποίησης — αλλά σε αντίθετες κατευθύνσεις.
Το alpha είναι ανάλογο της ισχύος της ποινής· το C είναι το αντίστροφό της.
Η αύξηση του alpha κανονικοποιεί περισσότερο· η αύξηση του C κανονικοποιεί
λιγότερο. Αυτή η αντιστροφή αποτελεί σταθερή πηγή σφάλματος σε τεχνική συνέντευξη.
Αυστηρός ορισμός
Η κανονικοποίηση προσθέτει στη συνάρτηση απώλειας όρο που ποινικοποιεί το μέγεθος
των παραμέτρων, ώστε να περιοριστεί ο χώρος των επιτρεπτών λύσεων. Το επιλυόμενο
πρόβλημα γίνεται ελαχιστοποίηση του
J(θ) = απώλεια_στα_δεδομένα(θ) + λ · ποινή(θ). Τα Ridge και Lasso εκθέτουν
άμεσα το λ υπό το όνομα alpha· η λογιστική παλινδρόμηση και τα SVM εκθέτουν
το C, ορισμένο ως αντίστροφο του λ πλην σταθεράς.
Μετάφραση σε καθημερινή γλώσσα
Το alpha είναι φρένο: όσο μεγαλύτερο είναι, τόσο περισσότερο περιορίζεται το
μοντέλο. Το C είναι άδεια: όσο μεγαλύτερο είναι, τόσο ελευθερότερο είναι το
μοντέλο να κολλήσει στα δεδομένα.
Σημείο προσοχής
Η κανονικοποίηση έχει νόημα μόνο σε μεταβλητές συγκρίσιμης κλίμακας: η ποινικοποίηση συντελεστών που φέρονται σε ετερογενείς μονάδες ισοδυναμεί με αυθαίρετη ποινικοποίηση ορισμένων μεταβλητών. Τυποποίηση στο κεφάλαιο 023, κανονικοποίηση στο κεφάλαιο 047.
Αυστηρός ορισμός
Πολλαπλασιαστικός συντελεστής εφαρμοζόμενος στην κατεύθυνση ενημέρωσης των
παραμέτρων σε κάθε επανάληψη επαναληπτικής βελτιστοποίησης: σε κάθοδο κλίσης,
θ_(t+1) = θ_t − η · ∇J(θ_t), όπου η δηλώνει τον ρυθμό μάθησης. Στο gradient
boosting, η ίδια ρύθμιση ερμηνεύεται ως παράγοντας συστολής εφαρμοζόμενος στη
συμβολή κάθε προστιθέμενου εκτιμητή.
Μετάφραση σε καθημερινή γλώσσα
Το μέγεθος του βήματος που γίνεται σε κάθε διόρθωση. Ένα υπερβολικά μεγάλο βήμα χάνει το ελάχιστο και μπορεί να αποκλίνει τη μάθηση· ένα υπερβολικά μικρό βήμα δεν προχωρά αρκετά γρήγορα για τον διαθέσιμο προϋπολογισμό επαναλήψεων.
Σημείο προσοχής
Τα learning_rate και n_estimators είναι συζευγμένα στο boosting: η διαίρεση
του ρυθμού μάθησης διά δύο επιβάλλει κατά προσέγγιση διπλασιασμό του αριθμού
επαναλήψεων για συγκρίσιμη προσαρμογή. Αυτές οι δύο υπερπαράμετροι δεν πρέπει
επομένως ποτέ να ρυθμίζονται ανεξάρτητα η μία από την άλλη. Αντιμετωπίζεται στο
κεφάλαιο 039.
Όλες οι υπερπαράμετροι δεν έχουν την ίδια εμβέλεια. Η κατάταξή τους κατά λειτουργία αποφεύγει την τυχαία ρύθμισή τους.
Οι υπερπαράμετροι ικανότητας είναι καθοριστικές και ρυθμίζονται κατά προτεραιότητα· εκείνες της βελτιστοποίησης βαραίνουν ιδίως στο boosting και στα νευρωνικά δίκτυα· εκείνες της δομής συνόλου έχουν ταχέως φθίνουσες αποδόσεις· εκείνες της επεξεργασίας του προβλήματος γίνονται κρίσιμες σε ανισορροπημένο πλαίσιο ή με ασύμμετρα κόστη σφάλματος· εκείνες της εκτέλεσης δεν έχουν καμία επίδραση κατ’ αναμονή στην επίδοση.
Σημείο προσοχής για το random_state: αυτό το όρισμα είναι τυπικά υπερπαράμετρος
— καθορίζεται πριν από την εκπαίδευση και δεν προσαρμόζεται από τη διαδικασία. Δεν
πρέπει ωστόσο ποτέ να εντάσσεται σε αναζήτηση βελτιστοποίησης. Η επιλογή του σπόρου
που μεγιστοποιεί το σκορ επικύρωσης ισοδυναμεί με εκμετάλλευση του δειγματοληπτικού
θορύβου, όχι με βελτίωση του μοντέλου. Ο νόμιμος ρόλος του random_state είναι η
αναπαραγωγιμότητα.
Ένα μόνο ερώτημα διαχωρίζει τις δύο κατηγορίες, όποια και αν είναι η βιβλιοθήκη ή ο χρησιμοποιούμενος αλγόριθμος:
Προσαρμόζεται αυτό το μέγεθος από τη διαδικασία βελτιστοποίησης που εκτελείται κατά το
fit(), ή καθορίζεται πριν ξεκινήσει αυτή η διαδικασία;
Κανονιστικός κανόνας της βιβλιοθήκης
Στο API του scikit-learn, η διάκριση υλοποιείται στην ονοματοδοσία:
get_params(), τροποποιήσιμες μέσω set_params(), και
το όνομά τους δεν φέρει επίθημα·fit() φέρουν όνομα με επίθημα κάτω
παύλας: coef_, intercept_, feature_importances_, classes_, tree_,
estimators_, support_vectors_.Πρακτική συνέπεια
Η πρόσβαση σε χαρακτηριστικό με επίθημα πριν από κάθε κλήση fit() εγείρει
εξαίρεση NotFittedError. Αυτός είναι ο ταχύτερος έλεγχος για να κριθεί: ένα
χαρακτηριστικό που δεν υπάρχει πριν από την εκπαίδευση είναι κατ’ ανάγκη μαθημένο.
Ορολογικό σημείο προσοχής
Η μέθοδος ονομάζεται get_params() ενώ επιστρέφει τις υπερπαραμέτρους. Αυτή η
επιλογή ονοματοδοσίας οφείλεται στη γενική ορολογία του προγραμματισμού, όπου
«παράμετρος» δηλώνει όρισμα συνάρτησης. Διατηρεί λυπηρή σύγχυση με τη στατιστική
ορολογία. Σε αυτό το μάθημα, και σε συνέντευξη, η «παράμετρος» διατηρεί πάντα τη
στατιστική της σημασία: μέγεθος εκτιμώμενο από τα δεδομένα.
| Μέγεθος | Κατηγορία | Αιτιολόγηση |
|---|---|---|
coef_ λογιστικής παλινδρόμησης | Παράμετρος | Υπολογισμένο από τον επιλυτή για ελαχιστοποίηση της απώλειας |
C λογιστικής παλινδρόμησης | Υπερπαράμετρος | Πρέπει να είναι γνωστό πριν από την κλήση του επιλυτή |
Κατώφλι 32,50 στο anciennete_mois σε δέντρο | Παράμετρος | Επιλεγμένο από την αναζήτηση διαίρεσης |
max_depth δέντρου | Υπερπαράμετρος | Οριοθετεί την αναζήτηση, δεν προέρχεται από αυτή |
feature_importances_ δάσους | Παράγωγη παράμετρος | Υπολογισμένη από τη μαθημένη δομή |
n_estimators δάσους | Υπερπαράμετρος | Καθορίζει τον αριθμό δέντρων προς κατασκευή |
max_iter επιλυτή | Υπερπαράμετρος | Προϋπολογισμός που χορηγείται πριν από την έναρξη |
n_iter_ επιλυτή | Αποτέλεσμα εκτέλεσης | Αριθμός επαναλήψεων που όντως καταναλώθηκαν |
mean_ και scale_ ενός StandardScaler | Παράμετρος του μετασχηματιστή | Εκτιμώμενες στα δεδομένα εκπαίδευσης |
k ενός KNeighborsClassifier | Υπερπαράμετρος | Καθορισμένο πριν, ποτέ βελτιστοποιημένο από fit() |
| Αριθμός διανυσμάτων υποστήριξης που προέκυψαν | Αποτέλεσμα εκτέλεσης | Συνέπεια της δυϊκής βελτιστοποίησης |
| Αριθμός συνιστωσών μιας PCA | Υπερπαράμετρος | Επιλεγμένος πριν· οι άξονες μαθαίνονται |
| Κατώφλι απόφασης στο 0,50 | Υπερπαράμετρος απόφασης | Προεπιλεγμένη σύμβαση, δεν προέρχεται από fit() |
random_state | Υπερπαράμετρος εκτέλεσης | Καθορισμένο πριν, αλλά δεν πρέπει να βελτιστοποιείται |
Οριακή περίπτωση 1 — Οι στατιστικές ενός προεπεξεργαστή. Ο μέσος και η τυπική
απόκλιση ενός StandardScaler εκτιμώνται από τα δεδομένα: είναι παράμετροι με την
έννοια της διαδικασίας fit(), ακόμη και αν δεν ανήκουν στο προβλεπτικό μοντέλο.
Καθοριστική συνέπεια: εκτιμώνται μόνο στο σύνολο εκπαίδευσης και εφαρμόζονται ως
έχουν στα άλλα σύνολα. Η εκτίμησή τους στο σύνολο των δεδομένων αποτελεί διαρροή
πληροφορίας (κεφάλαιο 028).
Οριακή περίπτωση 2 — Η πρόωρη διακοπή. Με early_stopping=True, ο αριθμός
επαναλήψεων που κρατείται καθορίζεται από την ίδια τη διαδικασία, παρατηρώντας
την απώλεια σε εσωτερικό σύνολο επικύρωσης. Το σύνορο φαίνεται να θολώνει· δεν
θολώνει. Η απόφαση ενεργοποίησης της πρόωρης διακοπής, το μέγεθος αυτού του
εσωτερικού συνόλου, η υπομονή και η εποπτευόμενη μετρική παραμένουν υπερπαράμετροι
καθορισμένες εκ των προτέρων· ο αριθμός επαναλήψεων που κρατείται είναι αποτέλεσμα.
Οριακή περίπτωση 3 — Οι αυτόματα βελτιστοποιημένες υπερπαράμετροι. Το ότι μια
αναζήτηση πλέγματος καθορίζει το max_depth δεν το μετατρέπει σε παράμετρο: η
αναζήτηση είναι εξωτερικός βρόχος που επανεκκινεί πλήρεις εκπαιδεύσεις, καθεμία
με προκαθορισμένη τιμή. Μία παράμετρος προσαρμόζεται εντός μιας εκπαίδευσης, μία
υπερπαράμετρος επιλέγεται μεταξύ πολλών εκπαιδεύσεων (κεφάλαιο 035).
Οριακή περίπτωση 4 — Οι παράγωγες παράμετροι. Το feature_importances_ δεν
βελτιστοποιείται άμεσα: είναι στατιστική υπολογισμένη εκ των υστέρων από τις
μειώσεις ακαθαρσίας της μαθημένης δομής. Ανήκει ωστόσο στα μαθημένα μεγέθη, αφού
δεν υπάρχει πριν από το fit() και εξαρτάται πλήρως από τα δεδομένα. Η ίδια
παρατήρηση ισχύει για το coef_ γραμμικού SVM, ανασυντεθειμένο από τους δυϊκούς
συντελεστές.
get_params() έναντι coef_ και feature_importances_Το σύνολο δεδομένων επίδειξης περιγράφει 4 000 πελάτες τηλεπικοινωνιακού
φορέα, με πέντε ερμηνευτικές μεταβλητές και δυαδικό στόχο a_resilie του οποίου
το ποσοστό θετικών ισούται με 0,3795.
get_params()from sklearn.linear_model import LogisticRegression
from sklearn.preprocessing import StandardScaler
import pandas as pd, numpy as np
Xs = pd.DataFrame(StandardScaler().fit_transform(X), columns=X.columns)
lr = LogisticRegression(C=1.0, max_iter=1000, random_state=0)
lr.fit(Xs, y)
for k, v in sorted(lr.get_params().items()):
print(f"{k}: {v!r}")C: 1.0
class_weight: None
dual: False
fit_intercept: True
intercept_scaling: 1
l1_ratio: 0.0
max_iter: 1000
n_jobs: None
penalty: 'deprecated'
random_state: 0
solver: 'lbfgs'
tol: 0.0001
verbose: 0
warm_start: FalseΕρμηνεία. Εκτίθενται δεκατέσσερις ρυθμίσεις ενώ μόνο τρεις συμπληρώθηκαν· οι
ένδεκα άλλες είναι οι προεπιλεγμένες τιμές του εκτιμητή. Όλες ήταν γνωστές πριν
από το fit() και καμία δεν τροποποιήθηκε από αυτό: μια δεύτερη κλήση μετά την
εκπαίδευση επιστρέφει το ίδιο λεξικό.
Σημείο προσοχής για τις προεπιλεγμένες τιμές. Ένα μοντέλο που εγκαθίσταται
χωρίς όρισμα δεν είναι μοντέλο «χωρίς υπερπαραμέτρους»: είναι μοντέλο του οποίου
όλες οι υπερπαράμετροι έλαβαν την προεπιλεγμένη τιμή τους, που είναι συμβάσεις
βιβλιοθήκης και όχι βέλτιστα. Το C=1.0 κανονικοποιεί ήδη ουσιαστικά.
Σημείο προσοχής για τις εκδόσεις. Η έξοδος προέρχεται από scikit-learn 1.8,
όπου το penalty βρίσκεται σε πορεία απόσυρσης υπέρ του l1_ratio, με την τιμή
0.0 να δηλώνει καθαρή ποινή L2· οι προηγούμενες εκδόσεις εμφανίζουν
penalty: 'l2'. Οι υπερπαράμετροι ανήκουν στη διεπαφή μιας βιβλιοθήκης και
εξελίσσονται μαζί της· οι μαθημένες παράμετροι ανήκουν στη μαθηματική διατύπωση
του μοντέλου και δεν αλλάζουν όνομα.
coef_ και intercept_print(pd.Series(np.round(lr.coef_[0], 4), index=X.columns).to_string())
print("intercept_:", np.round(lr.intercept_, 4))
print("n_iter_:", lr.n_iter_)
print("classes_:", lr.classes_)anciennete_mois -0.8957
facture_mensuelle 0.5515
nb_appels_support 0.5829
satisfaction -0.7586
data_go_moyen -0.0216
intercept_: [-0.6809]
n_iter_: [6]
classes_: [0 1]Ερμηνεία. Αυτοί οι έξι αριθμοί — πέντε συντελεστές και μία σταθερά — αποτελούν το σύνολο όσων έμαθε το μοντέλο και κανένας δεν γράφτηκε από τον μηχανικό. Εφόσον οι μεταβλητές έχουν τυποποιηθεί, οι συντελεστές είναι συγκρίσιμοι μεταξύ τους: η αρχαιότητα κυριαρχεί, η κατανάλωση δεδομένων είναι αμελητέα.
| Μεταβλητή | Συντελεστής | Λόγος πιθανοτήτων | Επαγγελματική ανάγνωση |
|---|---|---|---|
anciennete_mois | −0,8957 | 0,41 | Μία επιπλέον τυπική απόκλιση αρχαιότητας διαιρεί την πιθανότητα αποχώρησης διά 2,4 |
satisfaction | −0,7586 | 0,47 | Μία επιπλέον τυπική απόκλιση ικανοποίησης διαιρεί την πιθανότητα διά 2,1 |
nb_appels_support | +0,5829 | 1,79 | Μία επιπλέον τυπική απόκλιση κλήσεων πολλαπλασιάζει την πιθανότητα επί 1,8 |
facture_mensuelle | +0,5515 | 1,74 | Συγκρίσιμη επίδραση, ίδιας κατεύθυνσης |
data_go_moyen | −0,0216 | 0,98 | Καμία αξιοποιήσιμη επίδραση |
Σημείο προσοχής. Τα n_iter_ και classes_ φέρουν τελική κάτω παύλα και
υπάρχουν μόνο μετά το fit(), χωρίς να είναι της ίδιας φύσης με το coef_. Το
n_iter_ είναι διάγνωση σύγκλισης: η τιμή 6, πολύ κατώτερη του προϋπολογισμού
max_iter=1000, δηλώνει σύγκλιση χωρίς διακοπή. Τιμή ίση με max_iter θα
σηματοδοτούσε διακοπή λόγω εξάντλησης προϋπολογισμού, άρα μη συγκλίνον μοντέλο.
from sklearn.tree import DecisionTreeClassifier, export_text
dt = DecisionTreeClassifier(max_depth=3, min_samples_leaf=50, random_state=0)
dt.fit(X, y)
print("noeuds:", dt.tree_.node_count, "profondeur:", dt.get_depth(),
"feuilles:", dt.get_n_leaves())
print(export_text(dt, feature_names=list(X.columns), decimals=2))
print(pd.Series(np.round(dt.feature_importances_, 4), index=X.columns).to_string())noeuds: 15 profondeur: 3 feuilles: 8
|--- anciennete_mois <= 32.50
| |--- satisfaction <= 2.50
| | |--- nb_appels_support <= 0.50
| | | |--- class: 1
| | |--- nb_appels_support > 0.50
| | | |--- class: 1
| |--- satisfaction > 2.50
| | |--- facture_mensuelle <= 59.15
| | | |--- class: 0
| | |--- facture_mensuelle > 59.15
| | | |--- class: 1
|--- anciennete_mois > 32.50
| |--- satisfaction <= 2.50
| | |--- nb_appels_support <= 1.50
| | | |--- class: 0
| | |--- nb_appels_support > 1.50
| | | |--- class: 1
| |--- satisfaction > 2.50
| | |--- facture_mensuelle <= 59.45
| | | |--- class: 0
| | |--- facture_mensuelle > 59.45
| | | |--- class: 0
anciennete_mois 0.4497
facture_mensuelle 0.1065
nb_appels_support 0.1156
satisfaction 0.3282
data_go_moyen 0.0000Τι επιβλήθηκε. Μόνο δύο τιμές, max_depth=3 και min_samples_leaf=50. Το
βάθος που προέκυψε ισούται ακριβώς με 3: ο περιορισμός είναι ενεργός, χωρίς αυτόν
το δέντρο θα συνέχιζε να μεγαλώνει.
Τι μαθεύτηκε. Επτά εσωτερικές διαιρέσεις, καθεμία ορισμένη από ζεύγος
(μεταβλητή, κατώφλι), και οκτώ φύλλα με την κατανομή κλάσεών τους. Οι τιμές
32,50, 2,50, 59,15, 0,50, 1,50 και 59,45 προέρχονται όλες από την αναζήτηση
διαίρεσης. Το ότι η facture_mensuelle κόβεται στο 59,15 σε έναν κλάδο και στο
59,45 σε άλλον δείχνει ότι πρόκειται για τοπικά εκτιμώμενα μεγέθη, όχι για
επαγγελματικά κατώφλια.
Οι σημαντικότητες. Το feature_importances_ είναι διάνυσμα που αθροίζει στο
1 και κατανέμει τη συνολική μείωση ακαθαρσίας μεταξύ των μεταβλητών. Το
data_go_moyen λαμβάνει 0,0000: υπό αυτόν τον περιορισμό βάθους, η μεταβλητή δεν
επιλέχθηκε ποτέ για διαίρεση. Αυτό το μηδέν δεν σημαίνει επομένως «χωρίς δεσμό με
τον στόχο» αλλά «ποτέ επιλεγμένη υπό αυτές τις συνθήκες»· μεγαλύτερο βάθος θα της
απέδιδε μη μηδενική σημασία. Όρια αυτού του δείκτη στο κεφάλαιο 080.
Δύο ζεύγη υποκλάδων καταλήγουν στην ίδια προβλεπόμενη κλάση. Η διαίρεση κρατήθηκε παρόλα αυτά επειδή μειώνει την ακαθαρσία: οι προβλεπόμενες πιθανότητες διαφέρουν, ακόμη και όταν συμπίπτει η πλειοψηφική κλάση (κεφάλαιο 029).
for d in [2, 3, 5, 10, None]:
m = DecisionTreeClassifier(max_depth=d, random_state=0).fit(X, y)
print(f"max_depth={str(d):>4} -> noeuds={m.tree_.node_count:>5}"
f" feuilles={m.get_n_leaves():>5} acc_train={m.score(X, y):.4f}")max_depth= 2 -> noeuds= 7 feuilles= 4 acc_train=0.6980
max_depth= 3 -> noeuds= 15 feuilles= 8 acc_train=0.7202
max_depth= 5 -> noeuds= 63 feuilles= 32 acc_train=0.7445
max_depth= 10 -> noeuds= 757 feuilles= 379 acc_train=0.8498
max_depth=None -> noeuds= 2033 feuilles= 1017 acc_train=1.0000Ερμηνεία. Μία μοναδική υπερπαράμετρος μεταφέρει το μοντέλο από 7 σε 2 033 μαθημένους κόμβους, δηλαδή παράγοντα 290, και η ορθότητα εκπαίδευσης προχωρά έως 1,0000: το μη δεσμευμένο δέντρο απομονώνει κάθε παρατήρηση. Αυτή η τιμή δεν είναι επιτυχία αλλά απομνημόνευση — σε θορυβώδη δεδομένα όπου το ποσοστό θετικών ισούται με 0,38, κανένα ειλικρινές μοντέλο δεν ταξινομεί τέλεια το σύνολο εκπαίδευσής του (κεφάλαιο 031).
for C in [0.001, 0.01, 0.1, 1.0, 100.0]:
m = LogisticRegression(C=C, max_iter=1000).fit(Xs, y)
print(f"C={C:<8} coef_={np.round(m.coef_[0], 3)} "
f"norme_L2={np.linalg.norm(m.coef_):.3f}")C=0.001 coef_=[-0.336 0.205 0.22 -0.283 -0.002] norme_L2=0.533
C=0.01 coef_=[-0.737 0.451 0.479 -0.623 -0.014] norme_L2=1.168
C=0.1 coef_=[-0.877 0.539 0.57 -0.742 -0.021] norme_L2=1.392
C=1.0 coef_=[-0.896 0.551 0.583 -0.759 -0.022] norme_L2=1.422
C=100.0 coef_=[-0.898 0.553 0.584 -0.76 -0.022] norme_L2=1.425Ερμηνεία. Το C δεν εμφανίζεται ποτέ στο coef_ αλλά διέπει το εύρος του:
η νόρμα των συντελεστών περνά από 0,533 σε 1,425 όταν το C αυξάνεται από 0,001
σε 100. Η συστολή είναι ομοιόμορφη και διατηρεί τη σειρά των μεταβλητών. Πέραν
του C=1, οι συντελεστές σχεδόν δεν κινούνται: η ποινή έχει γίνει αμελητέα
έναντι του όρου απώλειας. Η εξερεύνηση C=10 000 θα ήταν χωρίς επίδραση εδώ,
γεγονός που δικαιολογεί τα οριοθετημένα λογαριθμικά πλέγματα (κεφάλαιο 035).
Διατύπωση προς απομνημόνευση: οι υπερπαράμετροι δεν βρίσκονται στο μοντέλο δίπλα στις παραμέτρους, είναι οι περιορισμοί υπό τους οποίους υπολογίστηκαν οι παράμετροι.
Η ρύθμιση υπερπαραμέτρου προϋποθέτει σύγκριση πολλών εκπαιδεύσεων και κράτηση της καλύτερης, γεγονός που απαιτεί σύνολο μη χρησιμοποιημένο για την προσαρμογή των παραμέτρων. Ο πειρασμός είναι να χρησιμοποιηθεί το σύνολο δοκιμής, αφού αυτό φέρει την εκτίμηση επίδοσης. Ακριβώς αυτή η χρήση του απαγορεύεται.
Κάθε απόφαση που λαμβάνεται κοιτάζοντας ένα σύνολο δεδομένων μεταφέρει πληροφορία από αυτό το σύνολο προς το μοντέλο. Αυτό το σύνολο παύει τότε να είναι αδημοσίευτο και το σκορ που παράγει παύει να εκτιμά την επίδοση σε νέα δεδομένα.
| Σύνολο | Τι αποφασίζεται εκεί | Αριθμός συμβουλών | Τι εκτιμά το σκορ του |
|---|---|---|---|
| Εκπαίδευση | Οι παράμετροι του μοντέλου | Μία φορά ανά εκπαίδευση | Την ικανότητα αναπαραγωγής των ιδωμένων δεδομένων, χωρίς προβλεπτική αξία |
| Επικύρωση | Οι υπερπαράμετροι, ο αλγόριθμος, το κατώφλι, οι κρατημένες μεταβλητές | Μία φορά ανά δοκιμασμένη διαμόρφωση | Αισιόδοξη επίδοση, μεροληπτική λόγω επιλογής |
| Δοκιμή | Τίποτα | Μία μόνο φορά, στο τέλος | Η αναμενόμενη επίδοση σε νέα δεδομένα |
Το σκορ που προκύπτει σε πεπερασμένο σύνολο φέρει δειγματοληπτική μεταβλητότητα: σε 800 παρατηρήσεις επικύρωσης, η τυπική απόκλιση ορθότητας κοντά στο 0,75 ισούται περίπου με 0,015. Η σύγκριση K διαμορφώσεων και η κράτηση του μεγίστου ισοδυναμεί με επιλογή, μεταξύ K θορυβωδών κληρώσεων, εκείνης της οποίας ο θόρυβος είναι ο πιο ευνοϊκός.
| Συγκρινόμενες διαμορφώσεις | Αναμενόμενη απόκλιση μεταξύ παρατηρούμενου μεγίστου και πραγματικής επίδοσης |
|---|---|
| 1 | περίπου 0,000 |
| 10 | περίπου +0,023 |
| 50 | περίπου +0,032 |
| 200 | περίπου +0,040 |
Αυτές οι τάξεις μεγέθους αντιστοιχούν στην αναμονή του μεγίστου K κεντραρισμένων γαουσιανών μεταβλητών τυπικής απόκλισης 0,015. Το συμπέρασμα είναι δομικό και δεν εξαρτάται από την επιμέλεια της προσέγγισης: το σκορ της κρατημένης διαμόρφωσης είναι αισιόδοξο εκ κατασκευής. Απαιτείται επομένως επιπλέον σύνολο, που έμεινε εκτός κάθε απόφασης, για αμερόληπτη εκτίμηση.
Παραπομπές: η κατασκευή των τριών συνόλων αντιμετωπίζεται στο κεφάλαιο 026, τα ιδιαίτερα σχήματα τεμαχισμού στο κεφάλαιο 027, η διασταυρωμένη επικύρωση στο κεφάλαιο 034, οι διαδικασίες αναζήτησης υπερπαραμέτρων στο κεφάλαιο 035 και η επιλογή κατωφλίου απόφασης στο κεφάλαιο 062.
Αυστηρός ορισμός
Μέτρο του πλούτου της οικογένειας συναρτήσεων που ένας αλγόριθμος, διαμορφωμένος με ορισμένο τρόπο, είναι σε θέση να αναπαραστήσει. Τυποποιείται από τη διάσταση Vapnik-Chervonenkis (Vapnik και Chervonenkis, 1971) — καρδινικότητα του μεγαλύτερου συνόλου σημείων που η οικογένεια μπορεί να διαχωρίσει σύμφωνα με όλες τις δυνατές επισημειώσεις — ή από συγγενή μέτρα όπως η πολυπλοκότητα Rademacher.
Αντίστοιχος ρόλος των δύο κατηγοριών μεγεθών
Οι υπερπαράμετροι οριοθετούν τον χώρο υποθέσεων H· οι παράμετροι επιλέγουν ένα στοιχείο h εντός του H. Η αύξηση της ικανότητας σημαίνει διεύρυνση του H.
Μετάφραση σε καθημερινή γλώσσα
Μέχρι ποιου σημείου ένα μοντέλο μπορεί να αγκαλιάσει τη μορφή των δεδομένων. Μία ανεπαρκής ικανότητα το εμποδίζει να αναπαραστήσει το φαινόμενο· μία υπερβολική ικανότητα του επιτρέπει να αγκαλιάσει και τον θόρυβο.
Σημείο προσοχής
Η ικανότητα δεν είναι η επίδοση: ένα μη δεσμευμένο δέντρο επιτυγχάνει τέλεια ορθότητα στην εκπαίδευση και μπορεί να είναι μέτριο σε νέα δεδομένα (σημείο 5.4).
| Υπερπαράμετρος | Αύξηση της τιμής της | Ικανότητα | Κυρίαρχος κίνδυνος αν ωθηθεί στο άκρο |
|---|---|---|---|
max_depth | Βαθύτερο δέντρο | Αυξάνεται | Υπερπροσαρμογή |
min_samples_leaf | Πυκνότερα φύλλα | Μειώνεται | Υποπροσαρμογή |
alpha (Ridge, Lasso, MLP) | Ισχυρότερη ποινή | Μειώνεται | Υποπροσαρμογή |
C (λογιστική, SVM) | Ασθενέστερη ποινή | Αυξάνεται | Υπερπροσαρμογή |
n_neighbors (k) | Ευρύτερη γειτονία | Μειώνεται | Υποπροσαρμογή |
hidden_layer_sizes | Ευρύτερο ή βαθύτερο δίκτυο | Αυξάνεται | Υπερπροσαρμογή |
gamma (πυρήνας RBF) | Πιο τοπική επίδραση | Αυξάνεται | Έντονη υπερπροσαρμογή |
learning_rate (boosting) | Μεγαλύτερο βήμα | Αυξάνεται με σταθερό προϋπολογισμό επαναλήψεων | Υπερπροσαρμογή |
n_estimators (τυχαίο δάσος) | Περισσότερα συναθροισμένα δέντρα | Σταθεροποιεί τη διακύμανση | Υπολογιστικό κόστος, χωρίς αξιοσημείωτη υποβάθμιση |
Σημείο προσοχής για το n_estimators. Η τελευταία γραμμή αποτελεί εξαίρεση.
Σε τυχαίο δάσος, η αύξηση του αριθμού δέντρων μειώνει τη διακύμανση του αθροίσματος
χωρίς να αυξάνει την υπερπροσαρμογή, με ταχέως φθίνουσες αποδόσεις. Στο boosting,
κάθε επανάληψη διορθώνει τα υπόλοιπα των προηγούμενων: το n_estimators αυξάνει
εκεί την ικανότητα και πρέπει να οριοθετείται, με πρόωρη διακοπή ή επικύρωση. Η
ίδια ονομασία καλύπτει επομένως δύο αντίθετες συμπεριφορές ανάλογα με την οικογένεια
αλγορίθμων.
Ο συμβιβασμός. Μία ανεπαρκής ικανότητα παράγει συστηματικό σφάλμα, τη μεροληψία: το μοντέλο αποτυγχάνει τόσο στην εκπαίδευση όσο και στη δοκιμή. Μία υπερβολική ικανότητα παράγει ευαισθησία στο συγκεκριμένο σύνολο εκπαίδευσης, τη διακύμανση: το μοντέλο επιτυγχάνει στην εκπαίδευση και αποτυγχάνει σε νέα δεδομένα. Η ρύθμιση των υπερπαραμέτρων ικανότητας ισοδυναμεί με διαιτησία μεταξύ αυτών των δύο καθεστώτων. Συμβιβασμός μεροληψίας-διακύμανσης στο κεφάλαιο 032, υπερπροσαρμογή και υποπροσαρμογή στο κεφάλαιο 031, μοχλοί διόρθωσης στο κεφάλαιο 033.
Αυτές οι πέντε έννοιες εισάγονται εδώ επειδή είναι αδιαχώριστες από την προηγούμενη διάκριση: η απώλεια είναι αυτό που ελαχιστοποιεί η βελτιστοποίηση για να παράγει τις παραμέτρους, η μετρική είναι αυτό που συγκρίνει η επικύρωση για να επιλέξει τις υπερπαραμέτρους, το κατώφλι και η αφελής αναφορά είναι δύο αποφάσεις μηχανικής που τίποτα δεν μαθαίνει. Καθεμία αντιμετωπίζεται εις βάθος αργότερα.
Αυστηρός ορισμός
Συνάρτηση ℓ(y, ŷ) που αντιστοιχίζει σε ζεύγος παρατηρούμενης και προβλεπόμενης τιμής έναν θετικό πραγματικό που μετρά το κόστος της απόκλισης. Ο μέσος της στο σύνολο εκπαίδευσης αποτελεί τον εμπειρικό κίνδυνο, ποσότητα που όντως ελαχιστοποιεί η διαδικασία βελτιστοποίησης. Γίνεται αδιάκριτα λόγος για συνάρτηση κόστους, αντικειμενική συνάρτηση ή κριτήριο.
Μετάφραση σε καθημερινή γλώσσα
Η μέτρηση του σφάλματος που το μοντέλο αναζητεί να μειώσει ενώ μαθαίνει. Είναι οι χαμένοι βαθμοί και η μάθηση συνίσταται στο να χαθούν όσο το δυνατόν λιγότεροι.
Τεχνικός περιορισμός
Μία συνάρτηση απώλειας πρέπει να είναι βελτιστοποιήσιμη από τη χρησιμοποιούμενη διαδικασία: συχνότερα διαφορίσιμη, ή τουλάχιστον αποσυνθέσιμη σε τοπικά κριτήρια, γεγονός που αποκλείει τις περισσότερες επαγγελματικές μετρικές.
Σημείο προσοχής
Η απώλεια υπολογίζεται στο σύνολο εκπαίδευσης κατά τη μάθηση. Μία χαμηλή απώλεια εκπαίδευσης δεν πληροφορεί σε τίποτα για τη γενίκευση. Η σύγκριση απωλειών εκπαίδευσης και επικύρωσης αντιμετωπίζεται στο κεφάλαιο 030.
| Έργο | Συνήθης απώλεια | Τι ποινικοποιεί |
|---|---|---|
| Παλινδρόμηση | Μέσο τετραγωνικό σφάλμα (MSE) | Το τετράγωνο της απόκλισης, άρα έντονα τις μεγάλες αποκλίσεις |
| Ανθεκτική παλινδρόμηση | Απόλυτο σφάλμα (MAE), απώλεια Huber | Γραμμικά, άρα λιγότερο ευαίσθητη στις ακραίες τιμές |
| Πιθανοτική ταξινόμηση | Διασταυρούμενη εντροπία, log loss | Την εμπιστοσύνη που αποδίδεται σε εσφαλμένη πρόβλεψη |
| SVM | Απώλεια άρθρωσης (hinge) | Τις παραβιάσεις του περιθωρίου |
| Διαίρεση δέντρου | Ακαθαρσία Gini, εντροπία | Την ετερογένεια των κλάσεων σε έναν κόμβο |
Αυστηρός ορισμός
Μέγεθος υπολογισμένο από τις προβλέψεις ενός μοντέλου και τις παρατηρούμενες τιμές, προορισμένο να χαρακτηρίσει την επίδοσή του ενόψει σύγκρισης ή απόφασης. Δεν παρεμβαίνει στη βελτιστοποίηση των παραμέτρων και δεν υπόκειται σε κανέναν περιορισμό διαφορισιμότητας.
Μετάφραση σε καθημερινή γλώσσα
Ο αριθμός που παρουσιάζουμε για να πούμε αν το μοντέλο είναι καλό και σύμφωνα με ποιο κριτήριο.
Διάκριση από την απώλεια
Η απώλεια χρησιμεύει στη μάθηση, η μετρική στην κρίση. Ένας ταξινομητής μπορεί να ελαχιστοποιεί τη διασταυρούμενη εντροπία ενώ αξιολογείται στην ανάκληση: είναι δύο διαφορετικά μεγέθη υπολογισμένα στις ίδιες προβλέψεις.
Σημείο προσοχής
Η μετρική ευθυγραμμίζεται με το επαγγελματικό διακύβευμα, όχι με τη μαθηματική ευκολία. Η επιλογή της μετρικής αντιμετωπίζεται στα κεφάλαια 052 έως 075 και η κατευθυντήρια αρχή του μαθήματος υπενθυμίζεται στο κεφάλαιο 075: το ερώτημα δεν είναι ποια μετρική είναι η καλύτερη, αλλά ποιο σφάλμα κοστίζει περισσότερο.
| Κριτήριο | Συνάρτηση απώλειας | Μετρική αξιολόγησης |
|---|---|---|
| Σκοπός | Καθοδήγηση της βελτιστοποίησης | Χαρακτηρισμός και επικοινωνία |
| Χρήστης | Η διαδικασία fit() | Ο μηχανικός και ο επαγγελματικός αποφασίζων |
| Περιορισμός | Βελτιστοποιήσιμη, γενικά διαφορίσιμη | Κανένας |
| Στιγμή υπολογισμού | Σε κάθε επανάληψη της εκπαίδευσης | Μετά την πρόβλεψη, σε δεσμευμένο σύνολο |
| Παραδείγματα | MSE, log loss, hinge, Gini | Ορθότητα, ακρίβεια, ανάκληση, F1, AUC, MAE, R² |
| Επιλέγεται από | Σε μεγάλο βαθμό επιβαλλόμενη από τον αλγόριθμο | Τον μηχανικό, σύμφωνα με το κόστος των σφαλμάτων |
Ένας φοιτητής διαβάζει για εξέταση. Η βαθμολογική κλίμακα διόρθωσης του λέει πόσους βαθμούς χάνει σε κάθε τύπο σφάλματος: αυτό αναζητεί να ελαχιστοποιήσει δουλεύοντας. Αυτή είναι η συνάρτηση απώλειας.
Ο χαρακτηρισμός στο απολυτήριό του — μέτρια, καλά, άριστα — είναι αυτό που θα κοιτάξει ο εργοδότης. Αυτή είναι η μετρική.
Τα δύο υπολογίζονται στην ίδια κόλλα και δεν συμπίπτουν: δύο κόλλες που έχασαν τον ίδιο αριθμό βαθμών μπορούν να λάβουν διαφορετικές εκτιμήσεις ανάλογα με την κατανομή των σφαλμάτων μεταξύ των δοκιμασιών.
Η βελτιστοποίηση της κλίμακας χωρίς ποτέ να κοιτάζεται ο χαρακτηρισμός αποτελεί συχνό μεθοδολογικό σφάλμα: ένα μοντέλο του οποίου η απώλεια μειώνεται τακτικά μπορεί να δει την επαγγελματική του μετρική να σταματά ή να υποβαθμίζεται.
Αυστηρός ορισμός
Ο όρος καλύπτει δύο διακριτές αποδοχές που δεν πρέπει ποτέ να συγχέονται.
Αποδοχή 1 — σκορ εξόδου του μοντέλου. Συνεχής τιμή που παράγει το μοντέλο για
μία παρατήρηση, πριν από κάθε απόφαση: εκτιμώμενη πιθανότητα που επιστρέφει το
predict_proba(), ή μη βαθμονομημένη τιμή που επιστρέφει το decision_function().
Ένα σκορ δεν είναι κλάση.
Αποδοχή 2 — σκορ επίδοσης. Αριθμητική τιμή μετρικής αξιολόγησης σε σύνολο
δεδομένων. Αυτή είναι η σημασία του model.score(X, y) στο scikit-learn, που
επιστρέφει την ορθότητα για ταξινομητή και τον συντελεστή προσδιορισμού R² για
παλινδρομητή.
Σύμβαση scikit-learn
Οι συναρτήσεις αξιολόγησης ακολουθούν τον κανόνα «μεγαλύτερο είναι καλύτερο». Οι
μετρικές σφάλματος, που πρέπει να ελαχιστοποιούνται, εκτίθενται επομένως σε
αρνητική μορφή: neg_mean_squared_error, neg_log_loss. Μία αρνητική τιμή που
εμφανίζει αναζήτηση πλέγματος δεν αποτελεί ανωμαλία.
Σημείο προσοχής
Η ανακοίνωση «το σκορ του μοντέλου είναι 0,91» δεν έχει καμία πληροφοριακή αξία όσο δεν ονομάζονται η μετρική και το σύνολο δεδομένων.
Αυστηρός ορισμός
Τιμή αποκοπής εφαρμοζόμενη στο συνεχές σκορ που παράγει ένας ταξινομητής για να μετατρέψει αυτό το σκορ σε διακριτή απόφαση. Σε δυαδικό πρόβλημα, η παρατήρηση αποδίδεται στη θετική κλάση όταν το εκτιμώμενο σκορ είναι μεγαλύτερο ή ίσο του κατωφλίου.
Μετάφραση σε καθημερινή γλώσσα
Από ποιο επίπεδο πιθανότητας αποφασίζουμε να δράσουμε.
Καθεστώς ως προς το κεφάλαιο
Το κατώφλι δεν μαθαίνεται. Η τιμή 0,50 είναι προεπιλεγμένη σύμβαση, όχι βέλτιστο. Το κατώφλι είναι υπερπαράμετρος απόφασης, της οποίας η ρύθμιση διεξάγεται σε σύνολο επικύρωσης, ποτέ στο σύνολο δοκιμής.
Σημείο προσοχής
Η μείωση του κατωφλίου αυξάνει τον αριθμό προβλεπόμενων θετικών, άρα την ανάκληση, εις βάρος της ακρίβειας· η αύξησή του παράγει το αντίστροφο αποτέλεσμα. Η ρύθμιση ανήκει σε οικονομική διαιτησία μεταξύ του κόστους ενός ψευδώς θετικού και εκείνου ενός ψευδώς αρνητικού. Αντιμετωπίζεται στα κεφάλαια 029 και 062.
Αυστηρός ορισμός
Εσκεμμένα τετριμμένο μοντέλο αναφοράς, που χρησιμεύει ως κατώτερο όριο με το οποίο συγκρίνεται κάθε υποψήφιο μοντέλο. Η επίδοσή του αποτελεί το κατώφλι κάτω από το οποίο ένα μαθημένο μοντέλο δεν προσφέρει καμία αξία.
Συνήθεις αναφορές
| Έργο | Αφελής αναφορά | Υλοποίηση |
|---|---|---|
| Ταξινόμηση | Πρόβλεψη συστηματικά της πλειοψηφικής κλάσης | DummyClassifier(strategy="most_frequent") |
| Ταξινόμηση | Τυχαία κλήρωση σύμφωνα με τις παρατηρούμενες συχνότητες | DummyClassifier(strategy="stratified") |
| Παλινδρόμηση | Πρόβλεψη του μέσου του στόχου | DummyRegressor(strategy="mean") |
| Παλινδρόμηση | Πρόβλεψη της διαμέσου του στόχου | DummyRegressor(strategy="median") |
| Χρονοσειρές | Επανάληψη της τελευταίας παρατηρούμενης τιμής | Μοντέλο εμμονής |
| Βιομηχανικό πλαίσιο | Ο επαγγελματικός κανόνας που βρίσκεται ήδη στην παραγωγή | Επανυλοποίηση του υπάρχοντος κανόνα |
Μετάφραση σε καθημερινή γλώσσα
Πριν ισχυριστείτε ότι ένα μοντέλο είναι αποδοτικό, πρέπει να επαληθεύσετε ότι κάνει καλύτερα από μια ηλίθια στρατηγική.
Σημείο προσοχής
Σε ανισορροπημένο σύνολο με 2 % θετικών, η αφελής αναφορά «πλειοψηφική κλάση» επιτυγχάνει 98 % ορθότητα χωρίς να μάθει τίποτα. Μία ορθότητα 97 % που ανακοινώνεται για επιτηδευμένο μοντέλο αποτελεί τότε οπισθοδρόμηση. Αυτός είναι ο λόγος για τον οποίο κάθε αξιολόγηση αρχίζει με τον υπολογισμό της αναφοράς. Αντιμετωπίζεται στα κεφάλαια 049 και 050.
| Έννοια | Ρόλος στην αλυσίδα | Ποιος την καθορίζει | Κεφάλαιο επεξεργασίας |
|---|---|---|---|
| Συνάρτηση απώλειας | Καθοδηγεί την προσαρμογή των παραμέτρων | Επιβαλλόμενη από τον αλγόριθμο, ενίοτε διαμορφώσιμη | 030 |
| Μετρική | Συγκρίνει μοντέλα και διαμορφώσεις | Ο μηχανικός, σύμφωνα με το επαγγελματικό διακύβευμα | 052 έως 075 |
| Σκορ | Συνεχής έξοδος, ή τιμή μετρικής | Το μοντέλο, ή η επιλεγμένη μετρική | 029, 061, 063 |
| Κατώφλι | Μετατρέπει σκορ σε απόφαση | Ο μηχανικός, σε σύνολο επικύρωσης | 062, 088 |
| Αφελής αναφορά | Καθορίζει το όριο προστιθέμενης αξίας | Ο μηχανικός, πριν από κάθε μοντελοποίηση | 049 |
Η έκφραση «παραμετροποίησα το μοντέλο μου με max_depth ίσο με 5» είναι ασαφής
και η μέθοδος get_params() διατηρεί τη σύγχυση, αφού επιστρέφει στην πραγματικότητα
τις υπερπαραμέτρους. Η ορολογία του προγραμματισμού και εκείνη της στατιστικής
αποκλίνουν εδώ.
Σωστή διατύπωση: «Καθόρισα την υπερπαράμετρο max_depth στο 5. Οι παράμετροι
του μοντέλου είναι τα κατώφλια και η δομή του δέντρου, που καθόρισε η εκπαίδευση.»
Καμία τιμή υπερπαραμέτρου δεν είναι βέλτιστη αφ’ εαυτής. Η κατάλληλη τιμή εξαρτάται από το πλήθος, τον αριθμό μεταβλητών, το επίπεδο θορύβου και τη δομή του φαινομένου. Μία τιμή παρμένη από ανάρτηση ιστολογίου ή προηγούμενο έργο είναι υπόθεση εκκίνησης, όχι ρύθμιση.
Σωστή διατύπωση: «Το max_depth=5 αποδείχθηκε ο καλύτερος συμβιβασμός σε αυτό
το σύνολο δεδομένων, μετά από αναζήτηση επικυρωμένη με διασταυρωμένη επικύρωση.»
Το σύνολο δοκιμής πρέπει να μένει εκτός κάθε απόφασης. Μόλις μία διαμόρφωση συγκριθεί εκεί με άλλη, ασκεί τη λειτουργία συνόλου επικύρωσης και το τελικό σκορ γίνεται αισιόδοξο. Η μόλυνση είναι προοδευτική και δεν παράγει κανένα σήμα συναγερμού.
Σωστή διατύπωση: «Οι υπερπαράμετροι επιλέχθηκαν με διασταυρωμένη επικύρωση στο σύνολο εκπαίδευσης. Το σύνολο δοκιμής συμβουλεύθηκε μία μόνο φορά, για την τελική εκτίμηση.»
Ο μέσος και η τυπική απόκλιση ενός StandardScaler, οι τιμές που κρατά ένας
κωδικοποιητής, οι τιμές καταλογισμού εκτιμώνται από τα δεδομένα. Ο υπολογισμός τους
στο σύνολο του συνόλου πριν από τον τεμαχισμό μεταφέρει πληροφορία από τη δοκιμή
προς την εκπαίδευση.
Σωστή διατύπωση: «Αυτές οι στατιστικές είναι μαθημένα μεγέθη. Εκτιμώνται μόνο στο σύνολο εκπαίδευσης, εντός αγωγού, και εφαρμόζονται στη συνέχεια στα άλλα σύνολα.» Αντιμετωπίζεται στα κεφάλαια 028 και 076.
Μία απώλεια εκπαίδευσης που μειώνεται τακτικά δεν εγγυάται ούτε τη γενίκευση ούτε την ικανοποίηση του επαγγελματικού κριτηρίου. Τα δύο μεγέθη απαντούν σε διαφορετικούς σκοπούς και μπορούν να εξελίσσονται σε αντίθετη κατεύθυνση.
Σωστή διατύπωση: «Το μοντέλο ελαχιστοποιεί τη διασταυρούμενη εντροπία κατά την εκπαίδευση· αξιολογείται στην ανάκληση, επειδή το κόστος ενός ψευδώς αρνητικού κυριαρχεί σε αυτή την περίπτωση χρήσης.»
Ένα μη δεσμευμένο δέντρο επιτυγχάνει ορθότητα 1,0000 στα δεδομένα εκπαίδευσής του, όπως δείχνει το σημείο 5.4. Αυτή η τιμή μετρά απομνημόνευση, όχι ικανότητα γενίκευσης. Πέραν ορισμένου επιπέδου ικανότητας, το σφάλμα σε νέα δεδομένα αυξάνεται.
Σωστή διατύπωση: «Πέραν ορισμένου επιπέδου ικανότητας, το μοντέλο προσαρμόζει τον θόρυβο του συνόλου εκπαίδευσης· το σφάλμα γενίκευσης υποβαθμίζεται ενώ το σφάλμα εκπαίδευσης συνεχίζει να μειώνεται.»
Ο τυχαίος σπόρος καθορίζεται πριν από την εκπαίδευση, γεγονός που τον καθιστά τυπικά υπερπαράμετρο, αλλά δεν φέρει καμία πληροφορία για το φαινόμενο. Η κράτηση του σπόρου που μεγιστοποιεί το σκορ επικύρωσης ισοδυναμεί με επιλογή θορύβου και παράγει όφελος που δεν θα αναπαραχθεί.
Σωστή διατύπωση: «Το random_state καθορίζεται για να διασφαλιστεί η
αναπαραγωγιμότητα. Η ευαισθησία του μοντέλου στον σπόρο μετράται, δεν βελτιστοποιείται.»
Το predict() εφαρμόζει προεπιλεγμένη σύμβαση. Το μοντέλο παράγει συνεχές σκορ·
είναι η βιβλιοθήκη, όχι η μάθηση, που το κόβει στο 0,50.
Σωστή διατύπωση: «Το κατώφλι είναι απόφαση μηχανικής, ρυθμισμένη σε σύνολο επικύρωσης σύμφωνα με το αντίστοιχο κόστος των ψευδώς θετικών και των ψευδώς αρνητικών.»
ΟΙ ΔΥΟ ΚΑΤΗΓΟΡΙΕΣ
ΠΑΡΑΜΕΤΡΟΣ μαθημένη από τη διαδικασία βελτιστοποίησης, κατά το fit()
συντελεστές, βάρη και μεροληψίες, κατώφλια και δομή δέντρου,
δυϊκοί συντελεστές και διανύσματα υποστήριξης
ΥΠΕΡΠΑΡΑΜΕΤΡΟΣ καθορισμένη από τον μηχανικό, πριν από το fit()
max_depth, n_estimators, k, learning_rate, alpha, C
ΤΟ ΜΟΝΑΔΙΚΟ ΚΡΙΤΗΡΙΟ ΔΙΑΚΡΙΣΗΣ
Προσαρμόζεται αυτό το μέγεθος από τη διαδικασία βελτιστοποίησης,
ή έπρεπε να είναι γνωστό ώστε να ξεκινήσει αυτή η διαδικασία;
Η ΣΥΜΒΑΣΗ SCIKIT-LEARN
get_params() -> οι υπερπαράμετροι
attribut_ (κάτω παύλα) -> τα μαθημένα μεγέθη
coef_, intercept_, feature_importances_, tree_, support_vectors_
Πριν από το fit(), αυτά τα χαρακτηριστικά δεν υπάρχουν: NotFittedError.
Η ΑΝΑΛΟΓΙΑ ΑΝΑΦΟΡΑΣ
συνταγή = αλγόριθμος
ρυθμίσεις φούρνου = υπερπαράμετροι
αυτό που γίνεται η ζύμη = μαθημένες παράμετροι
γλυκό = μοντέλο
ΤΙ ΔΙΕΠΟΥΝ ΟΙ ΥΠΕΡΠΑΡΑΜΕΤΡΟΙ
την ικανότητα max_depth, C, alpha, k, hidden_layer_sizes
τη βελτιστοποίηση learning_rate, solver, max_iter, tol
τη δομή συνόλου n_estimators, max_features, subsample
την επεξεργασία του προβλήματος class_weight, criterion, κατώφλι
την εκτέλεση n_jobs, verbose, random_state
ΙΚΑΝΟΤΗΤΑ
Οι υπερπαράμετροι οριοθετούν τον χώρο υποθέσεων H.
Οι παράμετροι επιλέγουν ένα στοιχείο h στο H.
Υπερβολικά χαμηλή ικανότητα -> υψηλή μεροληψία, υποπροσαρμογή.
Υπερβολικά υψηλή ικανότητα -> υψηλή διακύμανση, υπερπροσαρμογή.
ΚΑΝΟΝΑΣ ΠΡΩΤΟΚΟΛΛΟΥ
Εκπαίδευση -> προσαρμόζει τις παραμέτρους
Επικύρωση -> επιλέγει τις υπερπαραμέτρους και το κατώφλι
Δοκιμή -> εκτιμά την επίδοση, συμβουλεύεται μία μόνο φορά
Ένα σύνολο επί του οποίου αποφασίζουμε παύει να είναι σύνολο αξιολόγησης.
ΤΟ ΣΥΝΑΦΕΣ ΛΕΞΙΛΟΓΙΟ
απώλεια αυτό που ελαχιστοποιεί η βελτιστοποίηση για να παράγει τις παραμέτρους
μετρική αυτό που συγκρίνουμε για να επιλέξουμε τις υπερπαραμέτρους
σκορ συνεχής έξοδος του μοντέλου, ή τιμή μετρικής
κατώφλι αποκοπή εφαρμοζόμενη στο σκορ, σύμβαση 0,50, μη μαθημένη
αφελής αναφορά όριο κάτω από το οποίο το μοντέλο δεν προσφέρει τίποταΔήλωση σύνθεσης
Ένα εκπαιδευμένο μοντέλο διαβάζεται σε δύο επίπεδα: οι υπερπαράμετροι, καθορισμένες πριν από τη μάθηση, οριοθετούν την οικογένεια προσβάσιμων συναρτήσεων και τον τρόπο με τον οποίο θα διεξαχθεί η αναζήτηση· οι παράμετροι, παραγόμενες από αυτή την αναζήτηση, δηλώνουν την τελικά κρατημένη συνάρτηση. Οι πρώτες ρυθμίζονται με σύγκριση διαδοχικών εκπαιδεύσεων σε σύνολο επικύρωσης, ποτέ στο σύνολο δοκιμής, του οποίου η μοναδική συμβουλευτική αποτελεί τη μόνη αμερόληπτη εκτίμηση της αναμενόμενης επίδοσης.
Σχετικά κουίζ
009.1-quiz-parametre-appris.md009.2-quiz-hyperparametre.md009.3-quiz-critere-de-distinction.md009.4-quiz-inspection-scikit-learn.md009.5-quiz-reglage-et-jeu-de-test.md009.6-quiz-capacite-biais-variance.md009.7-quiz-loss-metric-score-seuil-baseline.mdΕπόμενο κεφάλαιο: 010-classification-ou-regression.md