Αλγόριθμος, μοντέλο, εκπαίδευση και πρόβλεψη

24 λεπτά
Μπλοκ 1 — Το θεμελιώδες λεξιλόγιο
Στόχος
να ορίσετε με αυστηρότητα τον αλγόριθμο μάθησης και το μοντέλο, να θεμελιώσετε την αυστηρή διάκριση μεταξύ των δύο, να χαρακτηρίσετε την εκπαίδευση ως διαδικασία επιλογής σε έναν χώρο υποθέσεων και την πρόβλεψη ως αποτίμηση μιας συνάρτησης, και να εντοπίσετε τι πράγματι εκδίδεται σε έκδοση, σειριοποιείται και αναπτύσσεται στην παραγωγή.
Εκτιμώμενη διάρκεια
35 λεπτά
Προαπαιτούμενα
κεφάλαια 001 έως 007
Σχετικά κουίζ
008.1-quiz-algorithme-apprentissage.md έως 008.6-quiz-cycle-complet.md

1. Ο αλγόριθμος μάθησης

1.1 Το πρόβλημα του λεξιλογίου

Οι τέσσερις ακόλουθες διατυπώσεις εντοπίζονται συχνά σε πρακτικά έργων. Τρεις είναι εσφαλμένες.

ΔιατύπωσηΚαθεστώςΑιτία
«Εκπαιδεύσαμε ένα Random Forest επί 40 000 παρατηρήσεων.»ΑποδεκτήΕπιτρεπτή έλλειψη: εκπαίδευση με τον αλγόριθμο Random Forest
«Ο αλγόριθμος προβλέπει πιθανότητα καταγγελίας 0,72.»ΕσφαλμένηΈνας αλγόριθμος δεν προβλέπει· το μοντέλο παράγει την πρόβλεψη
«Αναπτύξαμε ένα XGBoost στην παραγωγή.»ΕσφαλμένηΑυτό που αναπτύσσεται είναι ένα μοντέλο προερχόμενο από το XGBoost, όχι η βιβλιοθήκη
«Ο αλγόριθμος έμαθε ότι η αρχαιότητα μειώνει τον κίνδυνο.»ΕσφαλμένηΟ αλγόριθμος εκτελεί μια διαδικασία· η μαθευμένη πληροφορία εδράζεται στις παραμέτρους του μοντέλου

Η απόκλιση δεν είναι καθαρά λεξιλογική: αυτό που εκδίδεται σε έκδοση, αυτό που είναι αναπαραγώγιμο, αυτό που πρέπει να επανεκτελεστεί όταν τα δεδομένα εξελίσσονται και αυτό που μεταδίδεται στην εκμετάλλευση δεν είναι τα ίδια αντικείμενα ανάλογα με το αν μιλάμε για τον αλγόριθμο ή για το μοντέλο (σημείο 3).

1.2 Ορισμοί

ΟΡΙΣΜΟΣ — Αλγόριθμος, με τη γενική έννοια

Αυστηρός ορισμός. Πεπερασμένη και μη αμφίσημη ακολουθία στοιχειωδών πράξεων που επιτρέπει, από εισόδους ανήκουσες σε καθορισμένο πεδίο, την παραγωγή μιας εξόδου σε πεπερασμένο αριθμό βημάτων. Ο κλασικός χαρακτηρισμός κρατά πέντε ιδιότητες (Knuth, The Art of Computer Programming, 1968): περατότητα, μη αμφίσημος ορισμός κάθε βήματος, καθορισμένες είσοδοι, καθορισμένες έξοδοι, αποτελεσματικότητα των πράξεων.

Μετάφραση σε καθημερινή γλώσσα. Μια μέθοδος γραμμένη μία φορά για πάντα, που περιγράφει τι πρέπει να γίνει και με ποια σειρά, ανεξάρτητα από τις τιμές επί των οποίων θα εκτελεστεί.

Σημείο προσοχής. Ένας αλγόριθμος είναι περιγραφή διαδικασίας: δεν έχει κατάσταση, δεν περιέχει καμία γνώση για έναν συγκεκριμένο τομέα και δεν αλλάζει όταν αλλάζουν τα δεδομένα.

ΟΡΙΣΜΟΣ — Αλγόριθμος μάθησης (learning algorithm, learner)

Αυστηρός ορισμός. Ιδιαίτερη περίπτωση του προηγούμενου: διαδικασία που, εφαρμοζόμενη σε ένα σύνολο δεδομένων D = {(x₁, y₁), …, (xₙ, yₙ)} και σε μια διαμόρφωση υπερπαραμέτρων λ, επιλέγει ένα στοιχείο ĥ ενός χώρου υποθέσεων H σύμφωνα με ένα ρητό κριτήριο αξιολογούμενο επί του D. Τυπικά, A : (D, λ) ⟼ ĥ ∈ H.

Μετάφραση σε καθημερινή γλώσσα. Η μέθοδος που, από έναν πίνακα παραδειγμάτων ήδη επισημασμένων, κατασκευάζει τον κανόνα απόφασης. Περιγράφει πώς να αναζητήσει, όχι τι θα βρεθεί. Τρία στοιχεία πρέπει να ονομαστούν ώστε να προδιαγραφεί: ο χώρος υποθέσεων που διατρέχεται (σημείο 1.3), το κριτήριο που αξιολογείται επί των δεδομένων, και η στρατηγική αναζήτησης (σημείο 4.2).

Σημείο προσοχής. Ο αλγόριθμος είναι ταυτόσημος για όλα τα έργα που τον χρησιμοποιούν: το RandomForestClassifier είναι το ίδιο σε όλους τους χρήστες μιας δεδομένης έκδοσης του scikit-learn. Αυτό που διαφέρει από έργο σε έργο είναι το μοντέλο που παράγεται, ποτέ ο αλγόριθμος.

1.3 Ο χώρος υποθέσεων και η επαγωγική μεροληψία

ΟΡΙΣΜΟΣ — Χώρος υποθέσεων (hypothesis space, H)

Αυστηρός ορισμός. Σύνολο H όλων των υποψήφιων συναρτήσεων h : X → Y που ο αλγόριθμος είναι δομικά ικανός να παράγει, όπου X δηλώνει τον χώρο των ερμηνευτικών μεταβλητών και Y εκείνον της μεταβλητής-στόχου. Το H καθορίζεται από κοινού από την οικογένεια συναρτήσεων που κρατήθηκε και από τις υπερπαραμέτρους που περιορίζουν τη μορφή της: ο καθορισμός max_depth=3 δεν τροποποιεί τον αλγόριθμο, αλλά περιορίζει το H στα δέντρα βάθους το πολύ 3.

Μετάφραση σε καθημερινή γλώσσα. Το σύνολο όλων των κανόνων που η μέθοδος έχει το δικαίωμα να κατασκευάσει: δεν θα παράγει ποτέ κανόνα απόντα από αυτό το σύνολο, όποια και αν είναι η ποσότητα δεδομένων που παρέχεται. Για μια γραμμική παλινδρόμηση δύο μεταβλητών, το H είναι το σύνολο των συναρτήσεων h(x) = β₀ + β₁x₁ + β₂x₂, άπειρου πληθικού αριθμού αλλά παραμετροποιημένου από τρεις πραγματικούς· κανένα σύνολο δεδομένων δεν θα επιτρέψει την παραγωγή εκεί μιας συνάρτησης σε σκαλοπάτι ή περιοδικής.

Σημείο προσοχής. Ένα υποαποδίδον μοντέλο είναι τέτοιο για δύο διακριτούς λόγους: η σωστή συνάρτηση δεν ανήκει στο H (σφάλμα προσέγγισης, συνδεδεμένο με την επιλογή του αλγορίθμου), ή ανήκει σε αυτό χωρίς να έχει βρεθεί (σφάλμα εκτίμησης, συνδεδεμένο με τα δεδομένα και τη βελτιστοποίηση) — κεφάλαιο 032.

ΟΡΙΣΜΟΣ — Επαγωγική μεροληψία (inductive bias)

Αυστηρός ορισμός (Mitchell, 1980). Σύνολο των συμπληρωματικών υποθέσεων, μη συνάξιμων από τα δεδομένα εκπαίδευσης, που ένας αλγόριθμος κινητοποιεί για να προτιμήσει ορισμένες γενικεύσεις έναντι άλλων μεταξύ εκείνων που είναι συμβατές με τα παρατηρηθέντα δεδομένα. Εκδηλώνεται υπό δύο μορφές: ο περιορισμός του χώρου υποθέσεων και η προτίμηση εντός του H, για παράδειγμα υπέρ της απλούστερης υπόθεσης σε ίση επίδοση.

Μετάφραση σε καθημερινή γλώσσα. Ένα σύνολο παραδειγμάτων δεν καθορίζει ποτέ έναν μόνο κανόνα: άπειροι κανόνες διέρχονται από τα ίδια σημεία. Η επαγωγική μεροληψία είναι το σύνολο των προτιμήσεων ενσωματωμένων στη μέθοδο, που κρίνουν μεταξύ αυτών των κανόνων.

Συνδεδεμένο αποτέλεσμα (Wolpert, 1996 — No Free Lunch). Κατά μέσο όρο στο σύνολο όλων των δυνατών προβλημάτων, κανένας αλγόριθμος δεν είναι ανώτερος από έναν άλλο: η επίδοσή του σε ένα δεδομένο πρόβλημα προέρχεται από την αντιστοιχία μεταξύ της επαγωγικής μεροληψίας του και της πραγματικής δομής του φαινομένου. Η επιλογή ενός αλγορίθμου ισοδυναμεί λοιπόν με στοίχημα επί αυτής της δομής (κεφάλαιο 049).

Σημείο προσοχής. Μια μάθηση χωρίς επαγωγική μεροληψία είναι αδύνατη: ένας αλγόριθμος στερημένος κάθε προτίμησης δεν θα μπορούσε να ισχυριστεί τίποτα για μια παρατήρηση απόυσα από το σύνολο εκπαίδευσης.

1.4 Οι κύριες οικογένειες αλγορίθμων

ΑλγόριθμοςΧώρος υποθέσεων HΜορφή μιας υπόθεσηςΚύρια επαγωγική μεροληψία
Γραμμική παλινδρόμησηΑφινικές συναρτήσεις του XΣταθμισμένο άθροισμα των μεταβλητώνΓραμμικότητα και προσθετικότητα των επιδράσεων
Λογιστική παλινδρόμησηΛογιστικές αφινικών συναρτήσεωνΣιγμοειδής γραμμικού συνδυασμούΓραμμικό σύνορο απόφασης
Δέντρο απόφασης (CART)Διαμερίσεις του X με κοπές ορθογώνιες προς τους άξονεςΑκολουθία δοκιμών κατωφλίου, σταθερά ανά φύλλοΚοπές παράλληλες προς τους άξονες, προτίμηση για μικρά δέντρα
k πλησιέστεροι γείτονεςΣυναρτήσεις σταθερές ανά γειτονιάΤοπική ψηφοφορία ή μέσοςΤοπική συνέχεια: δύο κοντινές παρατηρήσεις έχουν κοντινούς στόχους
Naive BayesΠαραγοντοποιημένες δεσμευμένες κατανομέςΓινόμενο πιθανοφανειών ανά μεταβλητήΔεσμευμένη ανεξαρτησία των μεταβλητών δεδομένης της κλάσης
Πολυστρωματικό perceptronΣυνθέσεις αφινικών απεικονίσεων και μη γραμμικοτήτωνΓράφος υπολογισμού κατά στρώματαΣυνθετικότητα και κανονικότητα των αναπαραστάσιμων συναρτήσεων

Ανάγνωση: κάθε γραμμή περιγράφει ένα διαφορετικό στοίχημα επί της δομής του φαινομένου. Ένα έντονο φαινόμενο κατωφλίου θα εξυπηρετηθεί άσχημα από μια γραμμική παλινδρόμηση και καλά από ένα δέντρο· ένα προσθετικό και ομαλό φαινόμενο, το αντίστροφο.


2. Το μοντέλο ως παραμετροποιημένο τεχνούργημα

2.1 Ορισμός

ΟΡΙΣΜΟΣ — Μοντέλο (model, εκπαιδευμένο μοντέλο, fitted model)

Αυστηρός ορισμός. Στοιχείο ĥ ∈ H επιλεγμένο από τον αλγόριθμο A στο τέλος της εκτέλεσής του επί συνόλου δεδομένων D με υπερπαραμέτρους λ. Το μοντέλο προδιαγράφεται πλήρως από δύο συνιστώσες: μια δομή — τη συναρτησιακή μορφή, καθορισμένη από τα A και λ — και ένα σύνολο τιμών παραμέτρων προσαρμοσμένο από το D.

Λειτουργικός ορισμός. Λογισμικό τεχνούργημα που υλοποιεί μια ντετερμινιστική συνάρτηση από τις ερμηνευτικές μεταβλητές προς τον χώρο εξόδου, της οποίας η συμπεριφορά εξαρτάται εξ ολοκλήρου από το σύνολο δεδομένων επί του οποίου προσαρμόστηκε, και που μπορεί να σειριοποιηθεί, να εκδοθεί σε έκδοση, να μεταφερθεί και να αξιολογηθεί ανεξάρτητα από τη διαδικασία που το παρήγαγε.

Μετάφραση σε καθημερινή γλώσσα. Το αποτέλεσμα της εκπαίδευσης: ένας παγωμένος κανόνας απόφασης, στη μνήμη ή σε αρχείο, που απαντά σε ένα ακριβές ερώτημα για μια δεδομένη παρατήρηση.

Σημείο προσοχής. Το μοντέλο δεν είναι το αρχείο: εκείνο δεν είναι παρά ένα υποστήριγμα σειριοποίησης, όπως μια παρτιτούρα δεν είναι η μουσική. Το ίδιο μοντέλο εξάγεται σε joblib, σε ONNX ή σε PMML χωρίς να αλλάζει φύση.

2.2 Δομή και παράμετροι

Οικογένεια μοντέλωνΔομή καθορισμένη από τον αλγόριθμο και το λΠαράμετροι προσαρμοσμένες επί των δεδομένωνΤάξη μεγέθους
Γραμμική παλινδρόμηση p μεταβλητώνΜια αφινική εξίσωσηp συντελεστές και μια σταθεράp + 1
Λογιστική παλινδρόμηση p μεταβλητώνΜια αφινική εξίσωση συντεθειμένη με λογιστικήp συντελεστές και μια σταθεράp + 1
Δέντρο απόφασηςΈνα δυαδικό δέντρο πεπερασμένου βάθουςΜεταβλητή και κατώφλι κάθε κόμβου, τιμή κάθε φύλλου10¹ έως 10³
Τυχαίο δάσος 200 δέντρων200 δέντρα συναθροισμένα με ψηφοφορία ή μέσοΌλες οι παράμετροι των 200 δέντρων10⁴ έως 10⁷
k πλησιέστεροι γείτονεςΜια μετρική και ένας ακέραιος kΚαμία με την αυστηρή έννοια: το σύνολο εκπαίδευσης απομνημονεύεταιn × p αποθηκευμένες τιμές
Πολυστρωματικό perceptronΑριθμός στρωμάτων, εύρη, ενεργοποιήσειςΒάρη και πολώσεις όλων των συνδέσεων10³ έως 10¹¹

Σημείο προσοχής — οι k πλησιέστεροι γείτονες. Αυτός ο αλγόριθμος δεν παράγει παραμέτρους με τη συνήθη έννοια: διατηρεί τις παρατηρήσεις εκπαίδευσης και αναβάλλει κάθε υπολογισμό στη στιγμή της πρόβλεψης (τεμπέλικο μοντέλο, lazy learner). Ο ορισμός του μοντέλου ως τεχνουργήματος παραμένει έγκυρος: η δομή είναι ο κανόνας ψηφοφορίας επί των k γειτόνων, το προσαρμοσμένο περιεχόμενο είναι το απομνημονευμένο σύνολο (κεφάλαιο 040).

Το σύνορο μεταξύ όσων ρυθμίζει ο άνθρωπος και όσων μαθαίνονται αποτελεί αντικείμενο του κεφαλαίου 009· η αρχή εδώ είναι ότι οι υπερπαράμετροι ορίζουν το H και ότι οι παράμετροι δηλώνουν το στοιχείο που κρατήθηκε στο H.

2.3 Ανάγνωση ενός μοντέλου σε Python

Στο scikit-learn, οι ιδιότητες των οποίων το όνομα τελειώνει με χαρακτήρα υπογράμμισης υπάρχουν μόνο μετά την εκπαίδευση: η παρουσία τους είναι το λειτουργικό κριτήριο που διακρίνει έναν στιγμιοτυποποιημένο αλγόριθμο από ένα μοντέλο.

python
from sklearn.linear_model import LinearRegression

def appris(objet):
    return [a for a in dir(objet) if a.endswith("_") and not a.startswith("_")]

estimateur = LinearRegression()
print("Πριν το fit — υπερπαράμετροι  :", estimateur.get_params())
print("Πριν το fit — μαθευμένες ιδιότητες :", appris(estimateur))
estimateur.fit(X, y)
print("Μετά το fit — μαθευμένες ιδιότητες :", appris(estimateur))
Πριν το fit — υπερπαράμετροι  : {'copy_X': True, 'fit_intercept': True,
                                'n_jobs': None, 'positive': False, 'tol': 1e-06}
Πριν το fit — μαθευμένες ιδιότητες : []
Μετά το fit — μαθευμένες ιδιότητες : ['coef_', 'feature_names_in_', 'intercept_',
                                'n_features_in_', 'rank_', 'singular_']

Ερμηνεία: πριν από την κλήση, το αντικείμενο υλοποιεί τον αλγόριθμο και τον χώρο υποθέσεων, με τις υπερπαραμέτρους συμπληρωμένες και τη γνώση μηδενική. Μετά, τα coef_ και intercept_ φέρουν την πληροφορία επαγόμενη από τα δεδομένα, και τα n_features_in_ όπως feature_names_in_ καταγράφουν το αναμενόμενο σχήμα εισόδου (σημείο 5.2). Το ίδιο αντικείμενο παίζει διαδοχικά δύο ρόλους: το scikit-learn ονομάζει estimator το αντικείμενο πριν όπως και μετά το fit.


3. Η διάκριση και οι συνέπειές της στην παραγωγή

3.1 Πίνακας διάκρισης

ΚριτήριοΑλγόριθμος μάθησηςΜοντέλο
ΦύσηΜια διαδικασίαΈνα τεχνούργημα
Στιγμή ύπαρξηςΠριν από κάθε δεδομένοΜετά την εκπαίδευση
Εξάρτηση από τα δεδομέναΜηδενικήΟλική
ΠεριεχόμενοΟδηγίεςΜια δομή και τιμές παραμέτρων
Καθορίζεται απόΜια ανθρώπινη επιλογή σχεδιασμούΤα δεδομένα εκπαίδευσης
Υλικό υποστήριγμαΚώδικας, μια εγκατεστημένη βιβλιοθήκηΈνα αντικείμενο στη μνήμη, ένα σειριοποιημένο αρχείο
ΜοναδικότηταΈνας αλγόριθμος, πολλά μοντέλαΈνα μοντέλο για μια χρονολογημένη εκπαίδευση
Τι εκδίδεται σε έκδοσηΜια εξάρτηση λογισμικού (scikit-learn==1.8.0)Ένα ταυτοποιημένο παραδοτέο (modele_attrition_v3.joblib)
Τι αναπτύσσεταιΌχι, εκτός για επανεκπαίδευσηΝαι
ΓήρανσηΑπό απαξίωση της βιβλιοθήκηςΑπό παρέκκλιση της κατανομής των δεδομένων (κεφάλαιο 082)

3.2 Η αναλογία της συνταγής και του κέικ

ΑΝΑΛΟΓΙΑ — Η συνταγή και το κέικ

Μια συνταγή είναι ένα κείμενο: δεν τρώγεται, δεν λήγει, παραμένει ταυτόσημη όσες φορές και αν εκτελεστεί και φωτοτυπείται χωρίς απώλεια. Το κέικ είναι ένα αντικείμενο: προκύπτει από την εκτέλεση της συνταγής επί συγκεκριμένων συστατικών, σε φούρνο ρυθμισμένο με ορισμένο τρόπο, μια δεδομένη ημέρα. Δύο κέικ προερχόμενα από την ίδια συνταγή διαφέρουν αν διαφέρουν τα συστατικά· το κέικ μεταφέρεται, χρονολογείται, λήγει.

Μαγειρικό στοιχείοΑντίστοιχο στην επιβλεπόμενη μάθησηΔικαιολόγηση
Η γραπτή συνταγήΟ αλγόριθμος μάθησηςΑναπαραγώγιμη διαδικασία, ανεξάρτητη από κάθε εκτέλεση
Τα συστατικάΤο σύνολο δεδομένων εκπαίδευσηςΠρώτη ύλη που καταναλώνει η διαδικασία
Η ρύθμιση του φούρνου και ο χρόνος ψησίματοςΟι υπερπαράμετροιΚαθορισμένες πριν από την εκτέλεση, από άνθρωπο, μη συναγόμενες από την ύλη
Η πράξη του ψησίματοςΗ εκπαίδευσηΕκτέλεση της διαδικασίας επί της πρώτης ύλης
Το κέικ που προέκυψεΤο μοντέλοΜοναδικό, χρονολογημένο αποτέλεσμα, εξαρτώμενο εξ ολοκλήρου από τα συστατικά
Ένα κομμάτι σε έναν συνδαιτυμόναΜια πρόβλεψηΧρήση του αποτελέσματος σε μια συγκεκριμένη περίπτωση
Αποστολή της συνταγής σε πεινασμένο συνδαιτυμόναΑνάπτυξη του αλγορίθμου αντί του μοντέλουΟ συνδαιτυμόνας θα έπρεπε να αγοράσει τα συστατικά και να ψήσει μόνος του
Το συσκευασμένο και παραδομένο κέικΤο σειριοποιημένο και αναπτυγμένο μοντέλοΑυτό που πράγματι μεταδίδεται στον καταναλωτή
Επανάληψη ψησίματος με φρέσκα συστατικάΗ επανεκπαίδευσηΊδια συνταγή, νέα ύλη, νέο αποτέλεσμα

Όρια της αναλογίας. Το κέικ είναι παθητικό αντικείμενο, ενώ το μοντέλο είναι μια συνάρτηση εισόδου προς έξοδο (σημείο 5.2)· ένα καταναλωμένο κομμάτι δεν είναι πλέον διαθέσιμο, ενώ ένα μοντέλο παράγει απεριόριστο αριθμό προβλέψεων χωρίς να εξαντλείται· τέλος το κέικ λήγει από φυσική αλλοίωση, ενώ το αρχείο ενός μοντέλου δεν υποβαθμίζεται — είναι η κατανομή των δεδομένων παραγωγής που αποκλίνει από εκείνη της εκπαίδευσης (κεφάλαιο 082).

3.3 Ένας ίδιος αλγόριθμος, δύο σύνολα δεδομένων, δύο μοντέλα

Ο ακόλουθος κώδικας εφαρμόζει έναν μοναδικό αλγόριθμο σε δύο σύνολα δεδομένων που περιγράφουν το ίδιο φαινόμενο — την τιμή μιας κατοικίας σύμφωνα με την επιφάνεια, τον αριθμό δωματίων και την ηλικία της — σε δύο διακριτές αγορές ακινήτων.

Κάθε σύνολο περιλαμβάνει 800 συναλλαγές περιγραφόμενες από τρεις ερμηνευτικές μεταβλητές.

python
import pandas as pd
from sklearn.linear_model import LinearRegression

VARIABLES = ["surface_m2", "nb_pieces", "age_bien"]
lyon, nantes = pd.read_csv("marche_lyon.csv"), pd.read_csv("marche_nantes.csv")
X_lyon,   y_lyon   = lyon[VARIABLES],   lyon["prix"]
X_nantes, y_nantes = nantes[VARIABLES], nantes["prix"]

modele_lyon   = LinearRegression().fit(X_lyon,   y_lyon)
modele_nantes = LinearRegression().fit(X_nantes, y_nantes)
print("Ίδια κλάση αλγορίθμου :", type(modele_lyon) is type(modele_nantes))

for nom, m in [("LYON", modele_lyon), ("NANTES", modele_nantes)]:
    print(f"{nom:7s} σταθερά = {m.intercept_:>10,.1f} | " +
          " | ".join(f"{v} = {c:,.1f}" for v, c in zip(X_lyon.columns, m.coef_)))

bien = pd.DataFrame([{"surface_m2": 85, "nb_pieces": 4, "age_bien": 12}])
print("Πρόβλεψη Lyon   :", round(float(modele_lyon.predict(bien)[0]), 1))
print("Πρόβλεψη Nantes :", round(float(modele_nantes.predict(bien)[0]), 1))
Ίδια κλάση αλγορίθμου : True
LYON    σταθερά =   43,617.1 | surface_m2 = 3,201.6 | nb_pieces = 8,090.7 | age_bien = -878.3
NANTES  σταθερά =   30,521.4 | surface_m2 = 1,904.5 | nb_pieces = 4,658.9 | age_bien = -1,473.9
Πρόβλεψη Lyon   : 337575.3
Πρόβλεψη Nantes : 193349.8

Ερμηνεία. Μία μόνο κλάση αλγορίθμου στιγμιοτυποποιήθηκε, χωρίς τροποποίηση καμίας υπερπαραμέτρου. Τα δύο αντικείμενα μοιράζονται τον ίδιο τύπο και την ίδια δομή — μια αφινική εξίσωση τριών μεταβλητών — και διαφέρουν μόνο ως προς τις τιμές των τεσσάρων παραμέτρων τους, προερχόμενες εξ ολοκλήρου από τα δεδομένα. Η απόκλιση είναι επιχειρησιακής φύσης: το λυωνέζικο μοντέλο αποτιμά το τετραγωνικό μέτρο σε περίπου 3 200 νομισματικές μονάδες, το νανταίικο σε περίπου 1 900, και η έκπτωση λόγω ηλικίας είναι σχεδόν 1,7 φορές ισχυρότερη στη δεύτερη αγορά. Ερωτώμενα για το ίδιο ακίνητο, απαντούν 337 575 και 193 350: κανένα δεν κάνει λάθος, κωδικοποιούν δύο διαφορετικές αγορές.

Άμεση συνέπεια: «χρησιμοποιούμε γραμμική παλινδρόμηση» δεν ταυτοποιεί ένα σύστημα πρόβλεψης, αλλά ονομάζει την επαγωγική μεροληψία που κρατήθηκε. Το σύστημα ταυτοποιείται από το ζεύγος (μοντέλο, σύνολο εκπαίδευσης), χρονολογημένο.

3.4 Αυτό που πράγματι αναπτύσσεται

Το μοντέλο με την αυστηρή έννοια — δομή και παράμετροι του τελικού εκτιμητή — δεν αρκεί για την παραγωγή πρόβλεψης στην παραγωγή. Μια ακατέργαστη παρατήρηση πρέπει να υποστεί ακριβώς τις ίδιες μετασχηματισμούς με τα δεδομένα εκπαίδευσης: συμπλήρωση με τις ίδιες τιμές αντικατάστασης, κωδικοποίηση με τις ίδιες κατηγορίες αναφοράς, κλιμάκωση με τους ίδιους μέσους και τυπικές αποκλίσεις. Αυτοί οι μετασχηματισμοί περιλαμβάνουν οι ίδιοι παραμέτρους προσαρμοσμένες επί της εκπαίδευσης: αποτελούν μέρος όσων μαθεύτηκαν και πρέπει να σειριοποιηθούν μαζί με τον εκτιμητή.

ΟΡΙΣΜΟΣ — Σειριοποίηση ενός μοντέλου

Αυστηρός ορισμός. Μετατροπή της πλήρους κατάστασης ενός αντικειμένου στη μνήμη — δομή και τιμές παραμέτρων — σε μια μόνιμη ακολουθία οκτάδων, που επιτρέπει την κατοπινή ανασύστασή του σε διακριτή διαδικασία με λειτουργικά ταυτόσημη συμπεριφορά.

Μετάφραση σε καθημερινή γλώσσα. Καταγραφή του μοντέλου σε αρχείο ώστε να μπορεί να επαναφορτωθεί αργότερα, αλλού, χωρίς επανεκπαίδευση. Οι συνήθεις μορφές είναι joblib και pickle (οικοσύστημα Python, εξαρτώμενες από τις εκδόσεις), ONNX (διαλειτουργικό μεταξύ γλωσσών και μηχανών εκτέλεσης), PMML (πρότυπο XML, περιορισμένες οικογένειες μοντέλων) και οι εγγενείς μορφές βιβλιοθήκης, όπως Booster.save_model για XGBoost και LightGBM.

Σημείο προσοχής. Ένα αρχείο joblib ή pickle ανασυστήνει αυθαίρετα αντικείμενα Python κατά την ανάγνωση: η φόρτωσή του χωρίς έλεγχο της προέλευσης ισοδυναμεί με εκτέλεση μη επαληθευμένου κώδικα. Επιπλέον, η αποσειριοποίηση υπό διαφορετική έκδοση βιβλιοθήκης δεν είναι εγγυημένη: η έκδοση πρέπει να καταγράφεται στα μεταδεδομένα και να επαληθεύεται κατά τη φόρτωση.

python
import os, joblib, sklearn, numpy as np
from sklearn.compose import ColumnTransformer
from sklearn.ensemble import RandomForestClassifier
from sklearn.impute import SimpleImputer
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import OneHotEncoder, StandardScaler

num = ["anciennete_mois", "facture_mensuelle", "nb_appels_support"]
cat = ["type_forfait"]

pipeline = Pipeline([
    ("preparation", ColumnTransformer([
        ("num", Pipeline([("imputation", SimpleImputer(strategy="median")),
                          ("mise_a_echelle", StandardScaler())]), num),
        ("cat", OneHotEncoder(handle_unknown="ignore"), cat)])),
    ("modele", RandomForestClassifier(n_estimators=200, max_depth=8,
                                      random_state=42))]).fit(df, y)

artefact = {"pipeline": pipeline, "version_sklearn": sklearn.__version__,
            "colonnes_attendues": num + cat, "seuil_decision": 0.42,
            "date_entrainement": "2026-08-22"}
joblib.dump(artefact, "modele_attrition_v3.joblib", compress=3)
print("Μέγεθος :", round(os.path.getsize("modele_attrition_v3.joblib")/1024, 1), "Ko")

recharge   = joblib.load("modele_attrition_v3.joblib")
p_memoire  = pipeline.predict_proba(df.head(5))[:, 1]
p_recharge = recharge["pipeline"].predict_proba(df.head(5))[:, 1]
print("Επαναφορτωμένες πιθανότητες :", np.round(p_recharge, 4))
print("Αυστηρή ταυτότητα :", np.array_equal(p_memoire, p_recharge))
print("Έκδοση και κατώφλι :", recharge["version_sklearn"], recharge["seuil_decision"])
Μέγεθος : 1242.5 Ko
Επαναφορτωμένες πιθανότητες : [0.0678 0.0711 0.0735 0.2408 0.0108]
Αυστηρή ταυτότητα : True
Έκδοση και κατώφλι : 1.8.0 0.42

Ερμηνεία. Το αρχείο ζυγίζει 1,2 Mo ενώ το σύνολο εκπαίδευσης δεν περιλαμβάνει παρά μερικές χιλιάδες γραμμές: αυτός ο όγκος είναι εκείνος των 200 δέντρων, δηλαδή των μαθευμένων παραμέτρων, και εξαρτάται από τη δομή που κρατήθηκε, όχι από τον όγκο δεδομένων. Η επαναφόρτωση αποκαθιστά αυστηρά ταυτόσημες πιθανότητες: ένα μοντέλο είναι ντετερμινιστικό, και κάθε μεταβολή που παρατηρείται στην παραγωγή χωρίς επανεκπαίδευση σηματοδοτεί διαφορά στις εισόδους ή στο περιβάλλον εκτέλεσης, ποτέ στο μοντέλο. Τέλος το τεχνούργημα δεν ανάγεται στον αγωγό: το κατώφλι απόφασης (κεφάλαιο 062) είναι επιχειρησιακή απόφαση εξωτερική ως προς τις παραμέτρους, και η έκδοση βιβλιοθήκης όπως η διατεταγμένη λίστα στηλών καθορίζουν την εγκυρότητα της φόρτωσης.


4. Η εκπαίδευση ως διαδικασία επιλογής

4.1 Ορισμός

ΟΡΙΣΜΟΣ — Εκπαίδευση (training, μάθηση, προσαρμογή, fit)

Αυστηρός ορισμός. Εκτέλεση του αλγορίθμου A επί συνόλου δεδομένων D με υπερπαραμέτρους λ, που συνίσταται στην επιλογή εντός του H της υπόθεσης ĥ που βελτιστοποιεί ένα ρητό κριτήριο αξιολογούμενο επί του D, ενδεχομένως συνοδευόμενο από όρο κανονικοποίησης:

ĥ = argmin επί h ∈ H του [ (1/n) · Σᵢ L(h(xᵢ), yᵢ) + Ω(h) ]

όπου L δηλώνει τη συνάρτηση κόστους και Ω έναν όρο που επιβάλλει ποινή στην πολυπλοκότητα της υπόθεσης. Αυτό το πλαίσιο είναι εκείνο της ελαχιστοποίησης του εμπειρικού κινδύνου (Vapnik). Η ελαχιστοποιούμενη ποσότητα μετράται επί του δείγματος εκπαίδευσης, όχι επί του πληθυσμού: αυτό το χάσμα είναι η προέλευση της υπερπροσαρμογής (κεφάλαιο 031).

Μετάφραση σε καθημερινή γλώσσα. Η φάση μελέτης: ο αλγόριθμος διατρέχει τα διορθωμένα παραδείγματα, προσαρμόζει τις παραμέτρους του για να κάνει όσο το δυνατόν λιγότερα λάθη σε αυτά τα παραδείγματα, και σταματά όταν το κριτήριο δεν βελτιώνεται πλέον σημαντικά.

Τι δεν κάνει η εκπαίδευση. Δεν τροποποιεί τις υπερπαραμέτρους, που παραμένουν όπως παρασχέθηκαν· δεν συσσωρεύει τις διαδοχικές κλήσεις, ένα δεύτερο fit αντικαθιστά εξ ολοκλήρου την προηγούμενη κατάσταση εκτός προσφυγής σε partial_fit ή warm_start· δεν αξιολογεί το παραγόμενο μοντέλο, καθώς η αξιολόγηση απαιτεί δεδομένα που δεν έχουν ιδωθεί.

Σημείο προσοχής. Το κριτήριο που βελτιστοποιείται κατά την εκπαίδευση (η συνάρτηση κόστους) και το κριτήριο επιχειρησιακής αξιολόγησης (η μετρική) είναι διακριτά και συμπίπτουν σπάνια (κεφάλαιο 030).

4.2 Οι τρεις συνιστώσες μιας διαδικασίας εκπαίδευσης

Η τροποποίηση μίας από αυτές τις τρεις συνιστώσες παράγει διαφορετικό μοντέλο, με σταθερό σύνολο δεδομένων.

4.3 Μορφές αναζήτησης και αναπαραγωγιμότητα

ΑλγόριθμοςΣτρατηγική αναζήτησης στο HΝτετερμινισμός σε σταθερά δεδομένα
Γραμμική παλινδρόμηση (ελάχιστα τετράγωνα)Αναλυτική λύση ή μητρική αποσύνθεσηΝαι
Λογιστική παλινδρόμησηΕπαναληπτική κυρτή αριθμητική βελτιστοποίησηΝαι, με καθορισμένο επιλυτή και ανοχή
Δέντρο απόφασηςΆπληστη αναζήτηση, τοπικά βέλτιστη κοπή ανά κόμβοΝαι αν δεν υπάρχει τυχαία κλήρωση μεταβλητών
Τυχαίο δάσοςΔέντρα κατασκευασμένα επί δειγμάτων και υποχώρων κληρωμένων τυχαίαΌχι, εκτός καθορισμένου σπόρου
Gradient boostingΔιαδοχική προσθήκη μαθητών που διορθώνουν τα υπόλοιπαΌχι, εκτός καθορισμένου σπόρου
k πλησιέστεροι γείτονεςΚαμία αναζήτηση: απομνημόνευση του συνόλου εκπαίδευσηςΝαι
Πολυστρωματικό perceptronΣτοχαστική κάθοδος κλίσης με οπισθοδιάδοσηΌχι, εκτός καθορισμένου σπόρου και επιβεβλημένης ντετερμινιστικής εκτέλεσης

Σημείο προσοχής: για τους αλγορίθμους σημειωμένους «Όχι», δύο διαδοχικές εκπαιδεύσεις επί του ίδιου συνόλου με τις ίδιες υπερπαραμέτρους παράγουν δύο διαφορετικά μοντέλα. Ο καθορισμός ενός σπόρου (random_state) καθορίζει την αναπαραγωγιμότητα του παραδοτέου και πρέπει να εμφανίζεται στα μεταδεδομένα.


5. Η πρόβλεψη και το συμπέρασμα

5.1 Ορισμός

ΟΡΙΣΜΟΣ — Πρόβλεψη (prediction, scoring)

Αυστηρός ορισμός. Αποτίμηση της συνάρτησης ĥ σε ένα σημείο x του χώρου των ερμηνευτικών μεταβλητών, που παράγει μια τιμή ŷ = ĥ(x) του χώρου εξόδου. Η παρατήρηση x δεν ανήκει κατ' ανάγκη στο σύνολο εκπαίδευσης· το λειτουργικό ενδιαφέρον έγκειται ακριβώς στην περίπτωση όπου δεν ανήκει σε αυτό.

Μετάφραση σε καθημερινή γλώσσα. Να δοθεί μια απάντηση για μια νέα περίπτωση, με εφαρμογή του μαθευμένου κανόνα. Η σύμβαση διακρίνει το y, πραγματική παρατηρηθείσα τιμή, και το ŷ, τιμή παραγόμενη από το μοντέλο· η διαφορά τους είναι το υπόλοιπο (κεφάλαιο 066).

Σημείο προσοχής. Ο όρος δεν περιέχει καμία χρονική συνδήλωση. Ένα μοντέλο που διαγιγνώσκει μια παθολογία επί παρόντων δεδομένων παράγει μια πρόβλεψη με την τεχνική έννοια, αν και κανένα μέλλον δεν διακυβεύεται.

5.2 Το μοντέλο ως συνάρτηση εισόδου προς έξοδο

Τρεις ιδιότητες χαρακτηρίζουν αυτή τη συνάρτηση. Ντετερμινισμός: δύο κλήσεις με την ίδια είσοδο παράγουν την ίδια έξοδο, καθώς το μοντέλο δεν περιλαμβάνει κανένα τυχαίο στοιχείο στην πρόβλεψη ακόμη και όταν η εκπαίδευσή του περιλάμβανε. Απουσία κατάστασης: μια πρόβλεψη δεν τροποποιεί το μοντέλο, και η προσαρμογή σε νέα δεδομένα απαιτεί επανεκπαίδευση, διακριτή λειτουργία. Κλείσιμο επί του σχήματος εισόδου του: το μοντέλο δέχεται μόνο εισόδους σύμφωνες με το σχήμα που καταγράφηκε στην εκπαίδευση — ίδιες μεταβλητές, ίδια σειρά, ίδιοι τύποι, ίδιες γνωστές κατηγορικές κατηγορίες, και μετασχηματισμοί εφαρμοσμένοι με τις παραμέτρους που μαθεύτηκαν στην εκπαίδευση, όχι επανυπολογισμένες (κεφάλαιο 028).

Σημείο προσοχής: ο πιο δαπανηρός τρόπος αποτυχίας δεν είναι το σφάλμα εκτέλεσης, που είναι ορατό, αλλά η πρόβλεψη που παράγεται χωρίς σφάλμα από μια κακώς μετασχηματισμένη είσοδο. Ένας μοναδικός σειριοποιημένος αγωγός, αντί για μια ακολουθία βημάτων που αναπαράγονται χειροκίνητα στην παραγωγή, εξαλείφει αυτή την κλάση αποτυχίας εκ κατασκευής (κεφάλαια 076 έως 079).

5.3 Οι μορφές εξόδου

ΚλήσηΠαραγόμενη έξοδοςΜορφήΔιαθεσιμότητα
predict(X)Προβλεπόμενη κλάση ή αριθμητική τιμήΔιάνυσμα μήκους nΌλοι οι επιβλεπόμενοι εκτιμητές
predict_proba(X)Εκτιμώμενες πιθανότητες ανά κλάσηΠίνακας n × K, γραμμές αθροίσματος 1Ταξινομητές πιθανοτικής εξόδου
decision_function(X)Μη φραγμένο, μη βαθμονομημένο σκορΔιάνυσμα μήκους nΜοντέλα με περιθώριο, SVM και γραμμικά μοντέλα
transform(X)Μετασχηματισμένη αναπαράσταση των εισόδωνΠίνακας n × p′Μετασχηματιστές, όχι τελικοί εκτιμητές

Σημείο προσοχής: το predict εφαρμόζει από προεπιλογή κατώφλι 0,5 επί της εκτιμώμενης πιθανότητας. Αυτό το κατώφλι είναι σύμβαση υλοποίησης, όχι βέλτιστο· η αναθεώρησή του είναι μείζων μοχλός (κεφάλαια 062 και 029).

5.4 Συμπέρασμα με την έννοια του Machine Learning και με τη στατιστική έννοια

ΟΡΙΣΜΟΣ — Συμπέρασμα: δύο διακριτές αποδοχές

Αποδοχή 1 — συμπέρασμα με την έννοια του Machine Learning (inference, serving). Λειτουργία που συνίσταται στην αποτίμηση ενός εκπαιδευμένου μοντέλου επί νέων δεδομένων για την παραγωγή προβλέψεων. Συνώνυμο της πρόβλεψης, ο όρος αντιτίθεται στην εκπαίδευση και κυριαρχεί στο λεξιλόγιο της μηχανικής παραγωγής: inference server, inference latency, batch inference.

Αποδοχή 2 — συμπέρασμα με τη στατιστική έννοια (statistical inference). Προσέγγιση που συνίσταται στην εκτίμηση των χαρακτηριστικών ενός πληθυσμού από ένα δείγμα και στην ποσοτικοποίηση της συνδεδεμένης αβεβαιότητας: σημειακή εκτίμηση, διάστημα εμπιστοσύνης, έλεγχος υπόθεσης, σημαντικότητα. Παράδοση των Fisher, Neyman και Pearson.

Προέλευση της αμφισημίας. Οι δύο κοινότητες χρησιμοποιούν την ίδια λέξη για λειτουργίες των οποίων τα αντικείμενα αντιτίθενται: μια ατομική παρατήρηση από τη μία, μια παράμετρος πληθυσμού από την άλλη. Η διάκριση αναπτύσσεται από τον Breiman (2001, Statistical Modeling: The Two Cultures) και την Shmueli (2010, To Explain or to Predict?).

Σημείο προσοχής. Ένα πολύ αποδοτικό μοντέλο στην πρόβλεψη δεν παρέχει καμία συμπερασματική εγγύηση: ένας υψηλός συντελεστής δεν θεμελιώνει ούτε τη σημαντικότητα της επίδρασης, ούτε την αιτιακή της κατεύθυνση (κεφάλαιο 016).

ΚριτήριοΣυμπέρασμα με την έννοια MLΣυμπέρασμα με τη στατιστική έννοια
Επιδιωκόμενο αντικείμενοΜια ατομική παρατήρησηΜια παράμετρος πληθυσμού
Ερώτηση που τίθεταιΠοια τιμή για αυτή την ακριβή περίπτωση;Ποια είναι η τιμή του θ στον πληθυσμό, και με ποια αβεβαιότητα;
Παραγόμενη έξοδοςΜια πρόβλεψη ŷΜια εκτίμηση, ένα διάστημα εμπιστοσύνης, μια απόφαση ελέγχου
Κριτήριο ποιότηταςΣφάλμα γενίκευσης επί μη ιδωμένων δεδομένωνΙδιότητες του εκτιμητή: μεροληψία, σύγκλιση, κάλυψη
Κινητοποιούμενες υποθέσειςΠαρατηρήσεις i.i.d., σταθερότητα της κατανομήςΚαθορισμένο γεννητικό μοντέλο, συνθήκες κανονικότητας
Πλαίσιο χρήσηςΜηχανική, παραγωγή, MLOpsΣτατιστική, επιδημιολογία, οικονομετρία

Σύσταση διατύπωσης: χρήση «παραγωγή πρόβλεψης» ή «εξυπηρέτηση του μοντέλου» για την πρώτη αποδοχή, και ρητή ονομασία «στατιστικό συμπέρασμα» για τη δεύτερη.

6. Ο πλήρης κύκλος, από το σύνολο δεδομένων στο σειριοποιημένο μοντέλο

ΒήμαΚαταναλισκόμενη είσοδοςΠαραγόμενο τεχνούργημαΚεφάλαιο
Καθορισμός πλαισίουΈνα επιχειρησιακό ερώτημαΕργασία T και μετρική P ρητά διατυπωμένες012
Συγκρότηση του συνόλου δεδομένωνΛειτουργικές πηγέςΕπισημασμένο σύνολο δεδομένων X, y005 έως 007
ΔιαχωρισμόςΠλήρες σύνολοΥποσύνολα εκπαίδευσης, επικύρωσης, δοκιμής026, 027
Προσαρμοσμένη προετοιμασίαXtrainX_{\mathrm{train}}Προσαρμοσμένοι μετασχηματιστές022, 023
Επιλογή του αλγορίθμουΦύση του προβλήματος και περιορισμοίΧώρος H και επαγωγική μεροληψία που κρατήθηκαν049
Επιλογή των υπερπαραμέτρωνΕκπαίδευση και επικύρωσηΔιαμόρφωση λ που κρατήθηκε034, 035
Τελική εκπαίδευσηXtrainX_{\mathrm{train}}, ytrainy_{\mathrm{train}}Μοντέλο ĥ029
ΑξιολόγησηXtestX_{\mathrm{test}}, ytesty_{\mathrm{test}}Μέτρα επίδοσης στη γενίκευση052 έως 075
ΣειριοποίησηΠλήρης αγωγός και μεταδεδομέναΑρχείο τεχνουργήματος με έκδοση081
ΕξυπηρέτησηΠαρατηρήσεις παραγωγήςΠροβλέψεις081
ΕπιτήρησηΡοή παραγωγήςΕιδοποιήσεις παρέκκλισης, απόφαση επανεκπαίδευσης082

Ανάγνωση του κύκλου. Εμφανίζονται δύο βρόχοι διαφορετικής φύσης. Ο βραχύς βρόχος, μεταξύ επιλογής υπερπαραμέτρων και εκπαίδευσης, εξερευνά πολλούς χώρους υποθέσεων κατά την ανάπτυξη. Ο μακρύς βρόχος, από την επιτήρηση προς το σύνολο δεδομένων, ενεργοποιείται από την υποβάθμιση των επιδόσεων στην παραγωγή: επανεκτελεί τον ίδιο αλγόριθμο επί ενημερωμένων δεδομένων για να παράγει ένα νέο μοντέλο, εκδιδόμενο σε διακριτή έκδοση. Η επανεκπαίδευση δεν συνίσταται λοιπόν ποτέ στην τροποποίηση του αλγορίθμου, αλλά στην παραγωγή ενός νέου τεχνουργήματος.


7. Συχνά λάθη συλλογισμού

ΣΦΑΛΜΑ — Να λέει κανείς «αναπτύξαμε ένα Random Forest»

Αυτό που αναπτύσσεται είναι ένα τεχνούργημα — δομή και τιμές παραμέτρων — προερχόμενο από την εκτέλεση του αλγορίθμου Random Forest επί καθορισμένου συνόλου δεδομένων, σε μια καθορισμένη ημερομηνία. Ο αλγόριθμος εδράζεται στην εγκατεστημένη βιβλιοθήκη.

Σωστή διατύπωση: «Αναπτύξαμε το μοντέλο attrition_v3, που προέκυψε από εκπαίδευση τυχαίου δάσους επί των δεδομένων Ιανουαρίου έως Ιουνίου.»

ΣΦΑΛΜΑ — Απόδοση της μάθησης στον αλγόριθμο

Ο αλγόριθμος εκτελεί μια διαδικασία αναζήτησης και δεν διατηρεί τίποτα στο τέλος της εκτέλεσής του· η επαγόμενη γνώση εδράζεται στις παραμέτρους του παραγόμενου μοντέλου.

Σωστή διατύπωση: «Ο αλγόριθμος επέλεξε, στον χώρο υποθέσεων, ένα μοντέλο του οποίου οι συντελεστές υποδεικνύουν αρνητική σύνδεση μεταξύ αρχαιότητας και καταγγελίας.»

ΣΦΑΛΜΑ — Σύγχυση επανεκπαίδευσης και επαναπρογραμματισμού

Η επανεκπαίδευση συνίσταται στην επανεκτέλεση του ίδιου αλγορίθμου, με τις ίδιες υπερπαραμέτρους, επί ενημερωμένων δεδομένων: καμία γραμμή κώδικα δεν τροποποιείται. Η σύγχυση οδηγεί στην υποεκτίμηση του πραγματικού κόστους του κύκλου συντήρησης.

Σωστή διατύπωση: «Η μηνιαία επανεκπαίδευση παράγει μια νέα έκδοση του μοντέλου χωρίς τροποποίηση του κώδικα εκπαίδευσης.»

ΣΦΑΛΜΑ — Σειριοποίηση του εκτιμητή χωρίς τον αγωγό προετοιμασίας του

Οι μετασχηματισμοί προετοιμασίας περιλαμβάνουν παραμέτρους μαθευμένες επί των δεδομένων εκπαίδευσης: διάμεσοι συμπλήρωσης, κατηγορίες κωδικοποίησης, μέσοι και τυπικές αποκλίσεις. Ένας εκτιμητής σειριοποιημένος μόνος, τροφοδοτούμενος από μετασχηματισμούς που επανυλοποιούνται χειροκίνητα, παράγει εσφαλμένες προβλέψεις χωρίς ορατό σφάλμα.

Σωστή διατύπωση: «Το σειριοποιημένο τεχνούργημα είναι ο πλήρης αγωγός, από το ακατέργαστο δεδομένο έως την πρόβλεψη, συνοδευόμενος από τα μεταδεδομένα του.»

ΣΦΑΛΜΑ — Χρήση του «συμπέρασμα» χωρίς διευκρίνιση της αποδοχής

Ο όρος δηλώνει, ανάλογα με την κοινότητα, την παραγωγή μιας πρόβλεψης επί μιας παρατήρησης ή την εκτίμηση μιας παραμέτρου πληθυσμού συνοδευόμενη από μέτρο αβεβαιότητας: ούτε το ίδιο αντικείμενο, ούτε τα ίδια κριτήρια εγκυρότητας.

Σωστή διατύπωση: «Ο διακομιστής συμπεράσματος παράγει προβλέψεις. Τα συμπεράσματα σχετικά με τον πληθυσμό θα ανήκαν σε στατιστικό συμπέρασμα, που αυτή η διάταξη δεν παρέχει.»


8. Σύνθεση

ΤΑ ΔΥΟ ΑΝΤΙΚΕΙΜΕΝΑ
    ΑΛΓΟΡΙΘΜΟΣ ΜΑΘΗΣΗΣ — μια διαδικασία.  A : (D, λ) → ĥ ∈ H
        Υπάρχει πριν από τα δεδομένα, δεν περιέχει καμία γνώση,
        εκδίδεται σε έκδοση ως εξάρτηση λογισμικού.
    ΜΟΝΤΕΛΟ — ένα τεχνούργημα.  Δομή καθορισμένη από τα A και λ,
        παράμετροι προσαρμοσμένες επί του D. Υπάρχει μόνο μετά την εκπαίδευση,
        εξαρτάται εξ ολοκλήρου από το D, εκδίδεται σε έκδοση ως χρονολογημένο παραδοτέο.

ΟΙ ΤΡΕΙΣ ΣΥΝΙΣΤΩΣΕΣ ΕΝΟΣ ΑΛΓΟΡΙΘΜΟΥ ΜΑΘΗΣΗΣ
    1. Ένας χώρος υποθέσεων H    ποιοι κανόνες είναι υποψήφιοι
    2. Ένα κριτήριο βελτιστοποίησης   πώς να μετρηθεί η ποιότητά τους επί του D
    3. Μια στρατηγική αναζήτησης  πώς να διατρέξουμε το H

ΕΠΑΓΩΓΙΚΗ ΜΕΡΟΛΗΨΙΑ (Mitchell, 1980)
    Οι προτιμήσεις μη συναγόμενες από τα δεδομένα που επιτρέπουν την επιλογή
    μιας γενίκευσης μεταξύ εκείνων που είναι συμβατές με το D. Χωρίς μεροληψία,
    καμία γενίκευση δεν είναι δυνατή. No Free Lunch (Wolpert, 1996):
    καμία μεροληψία δεν είναι καθολικά ανώτερη· η επιλογή ενός αλγορίθμου
    είναι στοίχημα επί της μορφής του φαινομένου.

ΟΙ ΔΥΟ ΛΕΙΤΟΥΡΓΙΕΣ
    ΕΚΠΑΙΔΕΥΣΗ   D, λ → ĥ         επιλογή στο H
    ΠΡΟΒΛΕΨΗ     x    → ŷ = ĥ(x)  αποτίμηση μιας συνάρτησης

ΤΟ ΜΟΝΤΕΛΟ ΩΣ ΣΥΝΑΡΤΗΣΗ
    ΕΙΣΟΔΟΣ (μεταβλητές) → [ ΜΟΝΤΕΛΟ ] → ΕΞΟΔΟΣ (πρόβλεψη)
    ντετερμινιστικό · χωρίς κατάσταση · κλειστό επί του σχήματος εισόδου του

ΜΑΓΕΙΡΙΚΗ ΑΝΑΛΟΓΙΑ
    συνταγή → αλγόριθμος          συστατικά → σύνολο εκπαίδευσης
    φούρνος → υπερπαράμετροι      ψήσιμο    → εκπαίδευση
    κέικ    → μοντέλο             κομμάτι   → πρόβλεψη
    συσκευασμένο και παραδομένο κέικ → σειριοποιημένο αναπτυγμένο τεχνούργημα

ΔΥΟ ΕΝΝΟΙΕΣ ΤΗΣ ΛΕΞΗΣ ΣΥΜΠΕΡΑΣΜΑ
    Έννοια ML          παραγωγή πρόβλεψης για μια παρατήρηση
    Στατιστική έννοια  εκτίμηση παραμέτρου πληθυσμού με
                       ποσοτικοποίηση της αβεβαιότητας

ΑΥΤΟ ΠΟΥ ΠΡΑΓΜΑΤΙ ΑΝΑΠΤΥΣΣΕΤΑΙ
    Όχι ο εκτιμητής μόνος, αλλά ο πλήρης αγωγός (συμπλήρωση,
    κωδικοποίηση, κλιμάκωση, εκτιμητής) και τα μεταδεδομένα του:
    έκδοση βιβλιοθήκης, σχήμα εισόδου, κατώφλι απόφασης,
    τυχαίος σπόρος, ημερομηνία, περίμετρος εγκυρότητας.

Η ΔΟΚΙΜΗ ΛΕΞΙΛΟΓΙΟΥ
    «Η διαδικασία» υποκαθιστά τον όρο → ο αλγόριθμος.
    «Το εκπαιδευμένο αρχείο» υποκαθιστά    → το μοντέλο.

Συνθετική διατύπωση

Ο αλγόριθμος μάθησης είναι μια διαδικασία που, από ένα σύνολο δεδομένων και υπερπαραμέτρους, επιλέγει σε έναν χώρο υποθέσεων τον κανόνα που βελτιστοποιεί ένα κριτήριο· το μοντέλο είναι αυτός ο κανόνας αφού επιλεγεί, τεχνούργημα αποτελούμενο από μια δομή και προσαρμοσμένες παραμέτρους, εξαρτώμενο εξ ολοκλήρου από τα δεδομένα που το παρήγαγαν· η εκπαίδευση είναι η λειτουργία επιλογής, η πρόβλεψη είναι η αποτίμηση της συνάρτησης που προέκυψε επί μιας νέας παρατήρησης, και αυτό που εκδίδεται σε έκδοση, σειριοποιείται και αναπτύσσεται στην παραγωγή δεν είναι ποτέ ο αλγόριθμος αλλά το μοντέλο συνοδευόμενο από τον αγωγό προετοιμασίας του και τα μεταδεδομένα του.


Σχετικά κουίζ

  • 008.1-quiz-algorithme-apprentissage.md
  • 008.2-quiz-modele-artefact.md
  • 008.3-quiz-distinction-production.md
  • 008.4-quiz-entrainement.md
  • 008.5-quiz-prediction-inference.md
  • 008.6-quiz-cycle-complet.md

Επόμενο κεφάλαιο: 009-parametres-hyperparametres.md