Έστω η ακόλουθη διατύπωση, αντιπροσωπευτική της εφαρμοσμένης βιβλιογραφίας:
« Το dataset περιλαμβάνει 10 000 instances περιγραφόμενες από 14 attributes, εκ των οποίων μία κατηγορική μεταβλητή απόκρισης. Κάθε sample έχει επισημανθεί χειροκίνητα. »
Πλήρης μετάφραση, χωρίς απώλεια πληροφορίας:
« Ο πίνακας περιλαμβάνει 10 000 γραμμές και 14 στήλες. Μία από τις στήλες περιέχει την τιμή προς πρόβλεψη και αυτή η τιμή είναι κατηγορία. Αυτή η στήλη συμπληρώθηκε από ανθρώπινους χειριστές. »
Οι δύο διατυπώσεις είναι αυστηρά ισοδύναμες. Η απόκλιση προέρχεται από ορολογική κληρονομιά: το πεδίο συγκεντρώνει λεξιλόγιο από τη συμπερασματική στατιστική, την πληροφορική, τις σχεσιακές βάσεις δεδομένων και την άμεση μετάφραση από τα αγγλικά. Προκύπτουν έτσι αρκετές ανταγωνιστικές ονομασίες για το ίδιο αντικείμενο.
Σημείο προσοχής: η ασάφεια δεν είναι μόνο λεξιλογική. Η λέξη δείγμα δηλώνει δύο διαφορετικά αντικείμενα ανάλογα με τον κλάδο (σημείο 2.1) και η λέξη feature δηλώνει άλλοτε οποιαδήποτε στήλη, άλλοτε στήλη που όντως υποβάλλεται στο μοντέλο (σημείο 3.3). Αυτές οι δύο συγχύσεις παράγουν πραγματικά μεθοδολογικά σφάλματα.
Αυστηρός ορισμός
Δομημένη συλλογή παρατηρήσεων, κάθε παρατήρηση περιγραφόμενη από κοινό σύνολο μεταβλητών μετρημένων ή καταγεγραμμένων σύμφωνα με ομοιογενές πρωτόκολλο.
Τρία στοιχεία αυτού του ορισμού είναι δεσμευτικά: η οργάνωση σε γραμμές και στήλες είναι ρητή και σταθερή· όλες οι παρατηρήσεις περιγράφονται από τις ίδιες μεταβλητές, γεγονός που επιτρέπει τη σύγκριση όρο προς όρο· μία ίδια μεταβλητή διατηρεί την ίδια σημασία και την ίδια μονάδα από παρατήρηση σε παρατήρηση.
Κανονική μορφή
Το σύνολο δεδομένων αναπαρίσταται από ορθογώνιο πίνακα του οποίου κάθε γραμμή αντιστοιχεί σε παρατήρηση και κάθε στήλη σε μεταβλητή. Αυτή η μορφή ονομάζεται πινακοειδή δεδομένα ή tidy data στην ορολογία του Wickham (2014), που θέτει τρεις κανόνες: μία μεταβλητή ανά στήλη, μία παρατήρηση ανά γραμμή, μία μονάδα παρατήρησης ανά πίνακα.
Μετάφραση σε καθημερινή γλώσσα
Ένας πίνακας του οποίου κάθε γραμμή περιγράφει μία παρατηρηθείσα περίπτωση και κάθε στήλη μία πληροφορία καταγεγραμμένη σε αυτή την περίπτωση, την ίδια πληροφορία για όλες τις περιπτώσεις.
Σημείο προσοχής
Ένα σύνολο ετερογενών αρχείων δεν αποτελεί σύνολο δεδομένων με την παραπάνω έννοια. Γίνεται τέτοιο μετά από ενοποίηση, που αποτελεί αυτοτελές στάδιο μηχανικής.
| Σύμβολο | Ονομασία | Τι μετρά | Συνώνυμα που συναντώνται |
|---|---|---|---|
| n | Αριθμός παρατηρήσεων | Οι γραμμές | Μέγεθος δείγματος, πλήθος, αριθμός instances, αριθμός παραδειγμάτων |
| p | Αριθμός μεταβλητών | Οι στήλες | Αριθμός attributes, αριθμός features, διαστατικότητα |
| X | Πίνακας των ερμηνευτικών μεταβλητών | n γραμμές × p στήλες | Πίνακας σχεδίασης, design matrix |
| y | Διάνυσμα της μεταβλητής στόχου | n τιμές | Διάνυσμα απόκρισης, ετικέτες, labels |
Ένα σύνολο που περιγράφεται ως « n = 10 000, p = 14 » διαβάζεται: 10 000 παρατηρήσεις περιγραφόμενες η καθεμία από 14 μεταβλητές.
Σημείο προσοχής: καμία σύμβαση δεν είναι καθολική. Η στατιστική βιβλιογραφία σημειώνει τον αριθμό μεταβλητών p (predictors), η βιβλιογραφία μηχανικής μάθησης άλλοτε d ή m. Ομοίως, το p δηλώνει ανάλογα με τους συγγραφείς τον συνολικό αριθμό στηλών ή μόνο τον αριθμό ερμηνευτικών μεταβλητών. Η άρση της ασάφειας γίνεται με ρητοποίηση, όχι με σύμβαση.
Αυστηρός ορισμός
Αριθμός μεταβλητών που περιγράφουν κάθε παρατήρηση, δηλαδή διάσταση του διανυσματικού χώρου στον οποίο κάθε παρατήρηση αναπαρίσταται ως σημείο.
Γεωμετρική ερμηνεία
Ένα σύνολο με p μεταβλητές τοποθετεί κάθε παρατήρηση ως σημείο σε χώρο p διαστάσεων. Δύο κοντινές παρατηρήσεις σε αυτόν τον χώρο παρουσιάζουν γειτονικές τιμές στο σύνολο των μεταβλητών. Οι περισσότεροι αλγόριθμοι αξιοποιούν αυτή τη δομή, ρητά για τις μεθόδους που βασίζονται σε αποστάσεις, σιωπηρά για τις μεθόδους που διαμερίζουν τον χώρο.
Μεθοδολογική συνέπεια
Ο όγκος του χώρου αυξάνεται εκθετικά με το p. Με σταθερό n, η αύξηση του p αραιώνει τις παρατηρήσεις και υποβαθμίζει κάθε τοπική εκτίμηση. Αυτό το φαινόμενο είναι η κατάρα της διαστατικότητας, που αντιμετωπίζεται στο κεφάλαιο 025.
Μετάφραση σε καθημερινή γλώσσα
Ο αριθμός στηλών που περιγράφουν κάθε περίπτωση. Όσο υψηλότερος είναι, τόσο περισσότερες γραμμές χρειάζονται ώστε η επαγωγή να παραμένει θεμελιωμένη.
Η λογική δομή — ένας πίνακας n × p — είναι ανεξάρτητη από το μέσο αποθήκευσης. Οι ακόλουθες μορφές κωδικοποιούν το ίδιο αντικείμενο.
| Μορφή | Τεχνική φύση | Τυποποίηση στηλών | Προσαρμοσμένος όγκος | Χαρακτηριστική χρήση |
|---|---|---|---|---|
| CSV | Αρχείο κειμένου με διαχωριστικό | Καμία: όλα είναι συμβολοσειρές, ο τύπος συνάγεται κατά την ανάγνωση | Έως μερικές εκατοντάδες MB | Ανταλλαγή μεταξύ εφαρμογών, εξαγωγή |
| Υπολογιστικό φύλλο (XLSX, ODS) | Δυαδικό αρχείο με φύλλα | Ανά κελί, ετερογενές και μη δεσμευτικό | Μερικές δεκάδες χιλιάδες γραμμές | Επαγγελματική καταχώριση και συμβουλευτική |
| Σχεσιακός πίνακας | Έμμονος πίνακας SQL | Δηλωμένος και δεσμευμένος από το σχήμα | Εκατομμύρια έως δισεκατομμύρια γραμμές | Πληροφοριακό σύστημα παραγωγής |
| DataFrame | Δομή στη μνήμη (pandas, polars, R) | Ανά στήλη, ομοιογενής και ρητή | Περιορισμένη από τη διαθέσιμη μνήμη | Ανάλυση και μοντελοποίηση |
| Parquet | Δυαδικό αρχείο προσανατολισμένο σε στήλες | Δηλωμένος στα μεταδεδομένα | Πολύ μεγάλος, με συμπίεση και μερική ανάγνωση | Αναλυτική αποθήκευση, αλυσίδες επεξεργασίας |
Σημείο προσοχής για τη μορφή CSV: η απουσία τυποποίησης είναι η συχνότερη
αιτία κακώς συναγόμενων τύπων. Ένα αναγνωριστικό με αρχικά μηδενικά (00742)
διαβάζεται ως ακέραιος και χάνει τα μηδενικά του· ένα δεκαδικό με κόμμα ως
διαχωριστικό διαβάζεται ως κείμενο· μια συμβολοσειρά N/A εμποδίζει την αριθμητική
συναγωγή ολόκληρης της στήλης. Αυτά τα ελαττώματα εντοπίζονται με df.info()
(σημείο 5.3).
Το ίδιο κείμενο μπορεί να εκτυπωθεί, να δακτυλογραφηθεί, να εμφανιστεί ή να υπαγορευτεί. Το μέσο καθορίζει το κόστος χειρισμού και τους δυνατούς τρόπους αλλοίωσης, όχι το ίδιο το κείμενο.
Ένα σύνολο δεδομένων συμπεριφέρεται ομοίως: η λογική του δομή παραμένει πίνακας n × p, είτε το μέσο είναι αρχείο κειμένου 3 KB είτε κατανεμημένος πίνακας 400 GB. Η πρακτική συνέπεια είναι ότι η αλλαγή μορφής δεν επιλύει ποτέ πρόβλημα περιεχομένου: η μετατροπή σε Parquet ενός κακώς συμπληρωμένου CSV παράγει ένα κακώς συμπληρωμένο Parquet.
Ο αριθμός παρατηρήσεων δεν έχει απόλυτη σημασία: ερμηνεύεται σε σχέση με τον αριθμό μεταβλητών και την πολυπλοκότητα του φαινομένου. Οι ακόλουθες τάξεις μεγέθους ισχύουν για επιβλεπόμενη πινακοειδή μοντελοποίηση με μέτριο p, της τάξης των δέκα έως πενήντα μεταβλητών.
| Όγκος (n) | Ετυμηγορία | Μεθοδολογική συνέπεια |
|---|---|---|
| Κάτω από 100 | Ανεπαρκής για θεμελιωμένη επαγωγή | Περιγραφική στατιστική και επαγγελματική εμπειρογνωμοσύνη. Κάθε εκτίμηση επίδοσης κυριαρχείται από τον δειγματοληπτικό θόρυβο |
| 100 έως 1 000 | Αξιοποιήσιμο υπό αυστηρές συνθήκες | Απλά και κανονικοποιημένα μοντέλα, λίγες μεταβλητές. Υποχρεωτική διασταυρωμένη επικύρωση, ένα απομονωμένο test set είναι υπερβολικά μικρό για να είναι πληροφοριακό |
| 1 000 έως 100 000 | Ονομαστικό πεδίο του πινακοειδούς ML | Διαχωρισμός train / validation / test εφικτός, μέθοδοι συνόλων σχετικές, εύλογη βελτιστοποίηση υπερπαραμέτρων |
| Πάνω από 100 000 | Άνετος όγκος | Μοντέλα υψηλής ικανότητας εφικτά. Ο περιορισμός μετατοπίζεται από τον όγκο προς την ποιότητα, την αντιπροσωπευτικότητα και το υπολογιστικό κόστος |
Κατευθυντήρια αρχή: ο λόγος n / p έχει μεγαλύτερη σημασία από το n μόνο. Ένα σύνολο 5 000 παρατηρήσεων περιγραφόμενων από 8 μεταβλητές είναι άνετο· ο ίδιος όγκος περιγραφόμενος από 3 000 μεταβλητές ανήκει σε καθεστώς υψηλής διάστασης.
Σημείο προσοχής: στην ταξινόμηση, ο καθοριστικός όγκος δεν είναι το n αλλά το πλήθος της λιγότερο αντιπροσωπευόμενης κλάσης. Ένα σύνολο 200 000 παρατηρήσεων εκ των οποίων 60 είναι θετικές αποτελεί πρόβλημα 60 χρήσιμων παρατηρήσεων. Το σημείο αναπτύσσεται στο κεφάλαιο 050.
Αυστηρός ορισμός
Στοιχειώδης μονάδα του συνόλου δεδομένων, που αντιστοιχεί σε στατιστικό άτομο στο οποίο έχει καταγραφεί το σύνολο των μεταβλητών. Μία παρατήρηση υλοποιείται από μία γραμμή του πίνακα n × p.
Προέλευση του όρου
Στατιστική. Η λέξη άτομο δηλώνει εκεί την παρατηρούμενη μονάδα, είτε πρόκειται για πρόσωπο, αντικείμενο, γεγονός ή περίοδο.
Μετάφραση σε καθημερινή γλώσσα
Μία παρατηρηθείσα περίπτωση, πλήρως περιγεγραμμένη.
Σύσταση
Είναι ο πιο ουδέτερος και ακριβής όρος από τους οκτώ που καταγράφονται στο σημείο 2.2. Κρατείται ως όρος αναφοράς σε αυτό το μάθημα.
Αυστηρός ορισμός
Συγκεκριμένη εμφάνιση περιγραφόμενη από το διάνυσμα των τιμών των γνωρισμάτων της, στην ορολογία της μηχανικής μάθησης και της αναπαράστασης γνώσης.
Προέλευση του όρου
Πληροφορική, κατ’ αναλογία με την εγκατάσταση μιας κλάσης: το σχήμα του συνόλου δεδομένων παίζει τον ρόλο της κλάσης, κάθε γραμμή εκείνον ενός στιγμιότυπου.
Σημείο προσοχής
Ο όρος χρησιμοποιείται κάποτε με περιοριστική έννοια παρατήρησης χωρίς ετικέτα, που παρουσιάζεται στο μοντέλο στη φάση πρόβλεψης. Αυτή η χρήση είναι μειοψηφική αλλά τεκμηριωμένη.
Στατιστική σημασία — η ιστορική σημασία
Υποσύνολο πληθυσμού, επιλεγμένο σύμφωνα με σχέδιο δειγματοληψίας, από το οποίο συνάγονται ιδιότητες ολόκληρου του πληθυσμού. Ένα δείγμα είναι εδώ σύνολο παρατηρήσεων, μεγέθους n.
« Το δείγμα περιλαμβάνει 10 000 πελάτες. »
Σημασία Machine Learning — το αγγλικό πατρόν
Άμεση μετάφραση του sample, που χρησιμοποιείται στις βιβλιοθήκες μάθησης για
να δηλώσει μία μόνο γραμμή. Η τεκμηρίωση του scikit-learn ορίζει συστηματικά
το X ως πίνακα σχήματος (n_samples, n_features), όπου κάθε sample είναι
μεμονωμένη παρατήρηση.
« Το σύνολο περιλαμβάνει 10 000 δείγματα. »
Συνέπεια
Η ίδια λέξη δηλώνει το σύνολο σε μία πρόταση και το στοιχείο στην άλλη. Η σημασία συνάγεται μόνο από το πλαίσιο, ιδίως από τον αριθμό (ενικός/πληθυντικός).
Σύσταση
Σε επαγγελματική σύνταξη, να επιφυλάσσετε το δείγμα για τη στατιστική σημασία και να χρησιμοποιείτε παρατήρηση για τη γραμμή. Κατά την ανάγνωση, να μην τεκμαίρετε ποτέ τη σημασία.
Αυστηρός ορισμός
Δομημένο σύνολο πεδίων που αποτελεί μονάδα αποθήκευσης και πρόσβασης σε σύστημα διαχείρισης δεδομένων. Στο σχεσιακό μοντέλο, μία εγγραφή αντιστοιχεί σε πλειάδα μιας σχέσης, δηλαδή σε γραμμή πίνακα.
Μετάφραση σε καθημερινή γλώσσα
Μία καρτέλα: η μονάδα που το σύστημα διαβάζει, γράφει ή διαγράφει ως ενιαίο σύνολο.
Σημείο προσοχής
Μία εγγραφή με την έννοια του πληροφοριακού συστήματος δεν συμπίπτει κατ’ ανάγκη με μία παρατήρηση με την έννοια της μοντελοποίησης. Ένας πίνακας συναλλαγών περιλαμβάνει μία εγγραφή ανά συναλλαγή· αν η μονάδα ανάλυσης που κρατείται είναι ο πελάτης, μία παρατήρηση συναθροίζει αρκετές εγγραφές. Αυτή η μη σύμπτωση είναι το αντικείμενο του σημείου 2.3.
Αυστηρός ορισμός
Αναπαράσταση μιας παρατήρησης ως σημείου χώρου p διαστάσεων, κάθε συντεταγμένη αντιστοιχούσα στην τιμή μιας μεταβλητής.
Προέλευση του όρου
Γεωμετρικό λεξιλόγιο της στατιστικής μάθησης, που χρησιμοποιείται όταν ο συλλογισμός αφορά αποστάσεις, γειτονιές ή σύνορα απόφασης.
Σημείο προσοχής
Σε χαλαρή χρήση, το data point δηλώνει κάποτε μεμονωμένη τιμή, δηλαδή ένα κελί και όχι μία γραμμή. Αυτή η χρήση είναι αδόκιμη σε τεχνικό πλαίσιο.
| Όρος | Κλάδος προέλευσης | Τι δηλώνει | Χαρακτηριστικό πλαίσιο χρήσης |
|---|---|---|---|
| Παρατήρηση | Στατιστική | Μία γραμμή | Αυστηρή σύνταξη, μεθοδολογικά άρθρα |
| Άτομο | Στατιστική | Μία γραμμή | Περιγραφική στατιστική, γαλλική ανάλυση δεδομένων |
| Στιγμιότυπο | Πληροφορική, συμβολική ΤΝ | Μία γραμμή | Βιβλιογραφία μηχανικής μάθησης |
| Δείγμα, sample | Αγγλικά, βιβλιοθήκες ML | Μία γραμμή (σημασία ML) ή σύνολο (στατιστική σημασία) | Τεκμηρίωση scikit-learn, σχέδιο δειγματοληψίας |
| Εγγραφή, record | Βάσεις δεδομένων | Μία γραμμή πίνακα | Μηχανική δεδομένων, SQL |
| Γραμμή, row | Πινακοειδής αναπαράσταση | Μία γραμμή | Χειρισμός αρχείων και DataFrames |
| Παράδειγμα, example | Επιβλεπόμενη μάθηση | Μία επισημασμένη γραμμή | Περιγραφή του συνόλου εκπαίδευσης |
| Σημείο δεδομένων, data point | Γεωμετρία της μάθησης | Μία γραμμή ως σημείο | Συλλογισμός επί αποστάσεων και γειτονιών |
Οι οκτώ όροι δηλώνουν το ίδιο αντικείμενο στο πλαίσιο αυτού του μαθήματος. Η συνύπαρξή τους είναι γεγονός της βιβλιογραφίας, όχι ουσιαστική διάκριση. Η μόνη πραγματική ασάφεια αφορά το δείγμα.
Η επιλογή του τι αντιπροσωπεύει μία γραμμή δεν είναι δεδομένη ιδιότητα του συνόλου δεδομένων: είναι απόφαση μοντελοποίησης, που λαμβάνεται εκ των προτέρων και καθορίζει το ερώτημα στο οποίο θα μπορεί να απαντήσει το μοντέλο.
Αυστηρός ορισμός
Οντότητα αναφοράς επί της οποίας φέρεται η μέτρηση και στην οποία αναφέρεται η συμπερασματολογία. Ορίζει τι μετρά το n και καθορίζει την εμβέλεια των συμπερασμάτων που εξάγονται από το μοντέλο.
Επιχειρησιακή διατύπωση
Η μονάδα ανάλυσης απαντά στο ερώτημα: επί τίνος φέρεται μία πρόβλεψη; Το μοντέλο θα παράγει μία τιμή ανά μονάδα ανάλυσης, ούτε περισσότερες ούτε λιγότερες.
Μετάφραση σε καθημερινή γλώσσα
Αυτό που μία γραμμή αντιπροσωπεύει ακριβώς.
Σημείο προσοχής
Η μονάδα ανάλυσης πρέπει να συμπίπτει με τη μονάδα επαγγελματικής απόφασης. Ένα μοντέλο του οποίου η μονάδα ανάλυσης είναι η συναλλαγή δεν απαντά άμεσα στο ερώτημα «είναι αυτός ο πελάτης σε κίνδυνο». Μια απόκλιση επιβάλλει ρητό στάδιο συνάθροισης, με τις δικές του υποθέσεις.
| Πρόβλημα που τίθεται | Μία παρατήρηση αντιστοιχεί σε | Τάξη μεγέθους του n |
|---|---|---|
| Πρόβλεψη αποχώρησης συνδρομής | Ένας πελάτης, σε δεδομένη ημερομηνία παρατήρησης | Αριθμός ενεργών πελατών |
| Πρόβλεψη τιμής πώλησης κατοικίας | Μία ακίνητη συναλλαγή | Αριθμός ιστορικών πωλήσεων |
| Ανίχνευση δόλιας συναλλαγής | Μία συναλλαγή με κάρτα | Αριθμός επεξεργασμένων συναλλαγών |
| Πρόβλεψη βλάβης εξοπλισμού | Ένας εξοπλισμός παρατηρούμενος σε χρονικό παράθυρο | Αριθμός εξοπλισμών × αριθμός παραθύρων |
| Ταξινόμηση μηνύματος ως ανεπιθύμητου | Ένα μήνυμα | Αριθμός μηνυμάτων του σώματος |
| Εκτίμηση ζήτησης προϊόντος | Ένα ζεύγος προϊόν × ημέρα | Αριθμός προϊόντων × αριθμός ημερών |
| Διάγνωση παθολογίας σε απεικόνιση | Μία εξέταση ασθενούς | Αριθμός εξετάσεων |
| Πρόβλεψη ποσοστού μετατροπής καμπάνιας | Μία καμπάνια | Αριθμός διεξαχθεισών καμπανιών |
Παρατήρηση στην τελευταία γραμμή: ο αριθμός καμπανιών που διεξάγει μια επιχείρηση μετράται συχνά σε δεκάδες. Η μονάδα ανάλυσης καθορίζει επομένως άμεσα το καθεστώς όγκου του σημείου 1.5 και συνεπώς τη σκοπιμότητα του έργου. Η μετάβαση από την καμπάνια στην ατομική επαφή μεταφέρει το n από 40 σε 400 000. Δεν πρόκειται για την ίδια μελέτη.
Κατάσταση
Ένα σύνολο δεδομένων παραγγελιών παρουσιάζει μία γραμμή ανά παραγγελία. Ο ίδιος πελάτης που έχει περάσει πολλές παραγγελίες καταλαμβάνει πολλές γραμμές.
| commande_id | client_id | date | montant | canal | retour_produit |
|---|---|---|---|---|---|
| CMD-1001 | C-042 | 2025-01-14 | 89,90 | web | 0 |
| CMD-1002 | C-317 | 2025-01-14 | 240,00 | magasin | 0 |
| CMD-1003 | C-042 | 2025-02-02 | 55,00 | web | 1 |
| CMD-1004 | C-042 | 2025-02-19 | 132,40 | web | 1 |
| CMD-1005 | C-988 | 2025-02-20 | 17,50 | web | 0 |
| CMD-1006 | C-317 | 2025-03-03 | 310,00 | magasin | 0 |
Συνέπεια στον διαχωρισμό των δεδομένων
Ένας τυχαίος διαχωρισμός τοποθετεί, με υψηλή πιθανότητα, ορισμένες παραγγελίες του C-042 στην εκπαίδευση και άλλες στη δοκιμή. Το μοντέλο αξιολογείται τότε σε πελάτη του οποίου έχει ήδη μάθει τις ιδιαιτερότητες: προτίμηση καναλιού, μέσο καλάθι, τάση επιστροφής. Η μετρούμενη επίδοση ενσωματώνει συνιστώσα απομνημόνευσης ήδη ιδωμένων οντοτήτων και υπερεκτιμά την πραγματική επίδοση σε άγνωστους πελάτες, μόνη σχετική αν η στοχευμένη χρήση αφορά νέους πελάτες.
Μεθοδολογική απάντηση
Ο διαχωρισμός πρέπει να γίνεται κατά ομάδα: όλες οι γραμμές του ίδιου πελάτη
τοποθετούνται στην ίδια πλευρά της διαμέρισης. Ο αντίστοιχος μηχανισμός είναι
GroupKFold, που αντιμετωπίζεται στο κεφάλαιο 027, με μεταβλητή ομαδοποίησης
εδώ το client_id.
Σημείο προσοχής
Αυτός ο περιορισμός δίνει στο client_id διπλό καθεστώς: η στήλη πρέπει να
αποκλειστεί από τις ερμηνευτικές μεταβλητές (σημείο 3.4) ενώ διατηρείται
στο σύνολο δεδομένων ως κλειδί ομαδοποίησης. Η πρόωρη διαγραφή της καθιστά
αδύνατο τον ορθό διαχωρισμό.
Συγγενείς περιπτώσεις
Ασθενής με πολλές επισκέψεις, εξοπλισμός με πολλές μετρήσεις, κατάστημα με πολλούς μήνες δραστηριότητας, εικόνα με πολλούς επισημειωτές.
Ένας υπεύθυνος logistics ανακοινώνει ότι επεξεργάστηκε 12 000 μονάδες τον προηγούμενο μήνα. Η πληροφορία είναι αναξιοποίητη όσο η μονάδα δεν ονομάζεται: 12 000 άρθρα, 12 000 δέματα, 12 000 παλέτες ή 12 000 παραγγελίες δηλώνουν όγκους δραστηριότητας χωρισμένους από αρκετές τάξεις μεγέθους.
Η ανακοίνωση «το σύνολο δεδομένων περιλαμβάνει 50 000 γραμμές» χωρίς διευκρίνιση του τι είναι μία γραμμή ανήκει στην ίδια απροσδιοριστία. Το ερώτημα «50 000 τι;» είναι το πρώτο που πρέπει να τεθεί και η απάντησή του καθορίζει τον πραγματικά διαθέσιμο όγκο, τη στρατηγική διαχωρισμού και την εμβέλεια των συμπερασμάτων.
Ερώτημα προς συστηματική διερεύνηση, πριν από κάθε χειρισμό:
Τι αντιπροσωπεύει ακριβώς μία γραμμή αυτού του συνόλου δεδομένων και μπορεί η ίδια οντότητα του πραγματικού κόσμου να εμφανίζεται εκεί πολλές φορές;
Η απάντηση καθορίζει τον υπολογισμό του αποτελεσματικού n, τη στρατηγική διαχωρισμού (κεφάλαια 026 και 027), την ενδεχόμενη παρουσία διαρροής μέσω οντότητας (κεφάλαιο 028) και την επαγγελματική ερμηνεία των προβλέψεων.
Αυστηρός ορισμός
Μέγεθος ικανό να λάβει διαφορετικές τιμές ανάλογα με την εξεταζόμενη παρατήρηση, που αποτελεί κοινή διάσταση περιγραφής για το σύνολο των παρατηρήσεων.
Προέλευση του όρου
Στατιστική. Ο όρος αντιτίθεται στη σταθερά: μία στήλη της οποίας όλες οι τιμές είναι ταυτόσημες δεν είναι μεταβλητή με την πλήρη έννοια.
Μετάφραση σε καθημερινή γλώσσα
Μία στήλη: μία πληροφορία καταγεγραμμένη με τον ίδιο τρόπο σε όλες τις περιπτώσεις.
Σημείο προσοχής
Μία στήλη μηδενικής διακύμανσης είναι τυπικά στήλη αλλά δεν έχει καμία διακριτική ικανότητα. Ο εντοπισμός της αποτελεί μέρος του αρχικού ελέγχου.
Γνώρισμα (attribute) — Πληροφορική και εξόρυξη δεδομένων. Περιγραφική ιδιότητα ενός στιγμιότυπου. Κυρίαρχος όρος στη βιβλιογραφία data mining και στα ακαδημαϊκά σύνολα αναφοράς.
Πεδίο (field) — Βάσεις δεδομένων. Ονομασμένη και τυποποιημένη συνιστώσα μιας εγγραφής. Ο όρος είναι αδιαχώριστος από την έννοια του σχήματος: ένα πεδίο έχει όνομα, δηλωμένο τύπο και περιορισμούς ακεραιότητας.
Διάσταση — Γεωμετρία της μάθησης. Άξονας του χώρου αναπαράστασης. Ψευδοφίλος: στην αποφασιολογική μοντελοποίηση, μία διάσταση δηλώνει πίνακα αξόνων ανάλυσης, έννοια εντελώς διακριτή.
Χαρακτηριστικό — Κανονικοποιημένη μετάφραση του feature, που κρατείται στις γαλλόφωνες δημοσιεύσεις και από το Office québécois de la langue française.
Feature — Κυρίαρχος αγγλισμός στην πράξη. Στην αυστηρή χρήση του δηλώνει μεταβλητή που όντως υποβάλλεται στο μοντέλο ως είσοδος, μετά από επιλογή και μετασχηματισμό. Αυτή η αυστηρή χρήση κρατείται εδώ.
Σημείο προσοχής
Μεταβλητή και στήλη είναι περιγραφικοί όροι: χαρακτηρίζουν αυτό που υπάρχει στο αρχείο. Feature είναι λειτουργικός όρος: χαρακτηρίζει ρόλο που αποδίδει ο μοντελοποιητής. Η σύγχυση μεταξύ των δύο είναι το αντικείμενο του σημείου 3.3.
| Όρος | Κλάδος προέλευσης | Ιδιαίτερη απόχρωση | Μητρώο |
|---|---|---|---|
| Μεταβλητή | Στατιστική | Ουδέτερος, περιγραφικός | Αυστηρή σύνταξη |
| Γνώρισμα | Εξόρυξη δεδομένων, ΤΝ | Ιδιότητα στιγμιότυπου | Ακαδημαϊκή βιβλιογραφία |
| Πεδίο | Βάσεις δεδομένων | Τυποποιημένη συνιστώσα σχήματος | Μηχανική δεδομένων |
| Στήλη | Πινακοειδής αναπαράσταση | Καθαρά δομικός | Χειρισμός αρχείων |
| Διάσταση | Γεωμετρία, αποφασιολογία | Άξονας του χώρου αναπαράστασης | Γεωμετρικός συλλογισμός |
| Χαρακτηριστικό | Κανονικοποιημένη ορολογία | Μετάφραση του feature | Γαλλόφωνη τεκμηρίωση |
| Feature | Επαγγελματικός αγγλισμός | Μεταβλητή υποβαλλόμενη στο μοντέλο | Τρέχουσα πρακτική |
| Προβλέπων, παλινδρομητής | Συμπερασματική στατιστική | Ερμηνευτική μεταβλητή μοντέλου | Οικονομετρία, βιοστατιστική |
| Ρόλος | Κριτήριο ταυτοποίησης | Επεξεργασία | Παραπομπή |
|---|---|---|---|
| Αναγνωριστικό | Μοναδική ή σχεδόν μοναδική τιμή ανά οντότητα, χωρίς εγγενή επαγγελματική σημασία | Αποκλεισμός από τις ερμηνευτικές μεταβλητές, διατήρηση για ιχνηλασιμότητα και ομαδοποίηση | Σημείο 3.4, κεφάλαιο 027 |
| Ερμηνευτική μεταβλητή | Διαθέσιμη και συμπληρωμένη τη στιγμή που πρέπει να παραχθεί η πρόβλεψη | Υποβολή στο μοντέλο, μετά από κωδικοποίηση και μετασχηματισμό | Κεφάλαια 006, 022, 024 |
| Μεταβλητή στόχος | Μέγεθος που πρέπει να εκτιμήσει το μοντέλο | Απομόνωση στο y, να μην μείνει ποτέ στο X | Κεφάλαιο 006 |
| Μεταβλητή διαρροής | Συμπληρωμένη μετά ή εξαιτίας του γεγονότος προς πρόβλεψη | Αποκλεισμός χωρίς εξαίρεση | Κεφάλαιο 028 |
Ένα αρχείο 14 στηλών δεν παρέχει 14 ερμηνευτικές μεταβλητές. Παρέχει 14 στήλες των οποίων ο ρόλος μένει να καθοριστεί, μία προς μία. Σε απόσπασμα αρχείου αποχώρησης τηλεπικοινωνιών:
| Στήλη | Ρόλος | Αιτιολόγηση |
|---|---|---|
client_id | Αναγνωριστικό | Δηλώνει την οντότητα, χωρίς ερμηνευτικό περιεχόμενο |
anciennete_mois | Ερμηνευτική μεταβλητή | Γνωστή πριν από το γεγονός, φορέας πληροφορίας |
type_forfait | Ερμηνευτική μεταβλητή | Γνωστή πριν από το γεγονός |
nb_appels_support | Ερμηνευτική μεταβλητή | Γνωστή πριν από το γεγονός |
a_resilie | Μεταβλητή στόχος | Μέγεθος προς πρόβλεψη |
date_resiliation | Μεταβλητή διαρροής | Συμπληρώνεται μόνο αν έχει γίνει αποχώρηση |
motif_resiliation | Μεταβλητή διαρροής | Συλλέγεται κατά την αποχώρηση |
agent_retention_assigne | Μεταβλητή διαρροής | Ανατίθεται ως αντίδραση σε ανακοινωθείσα αποχώρηση |
Από οκτώ στήλες, μόνο τρεις είναι ερμηνευτικές μεταβλητές. Οι τρεις στήλες διαρροής θα παρήγαγαν, αν διατηρούνταν, μοντέλο που εμφανίζει σχεδόν τέλεια επίδοση στην επικύρωση και καμία αξία στην παραγωγή: κωδικοποιούν την απάντηση. Αυτός ο μηχανισμός αντιμετωπίζεται στο κεφάλαιο 028.
Μοναδικό επιχειρησιακό κριτήριο, εφαρμοστέο σε κάθε στήλη:
Είναι αυτή η τιμή γνωστή και συμπληρωμένη την ακριβή στιγμή που το μοντέλο πρέπει να παράγει την πρόβλεψή του;
Αρνητική απάντηση αποκλείει τη στήλη, όποια και αν είναι η συσχέτισή της με τον στόχο. Μια υψηλή συσχέτιση είναι άλλωστε το συχνότερο σύμπτωμα διαρροής, όχι εγγύηση ποιότητας.
Αυστηρός ορισμός
Γνώρισμα του οποίου η λειτουργία είναι να δηλώνει μονοσήμαντα μία οντότητα εντός συλλογής, ανεξάρτητα από τις ιδιότητες αυτής της οντότητας. Στο σχεσιακό μοντέλο αντιστοιχεί σε πρωτεύον κλειδί.
Χαρακτηριστική ιδιότητα
Η τιμή ενός αναγνωριστικού είναι αυθαίρετη εκ κατασκευής. Προκύπτει από σύμβαση απόδοσης — ακολουθία, χρονοσήμανση, τυχαία κλήρωση — και όχι από μέτρηση του μελετώμενου φαινομένου.
Μετάφραση σε καθημερινή γλώσσα
Ένας αριθμός φακέλου: επιτρέπει την εύρεση του φακέλου, δεν λέει τίποτα για το περιεχόμενό του.
Ένα αναγνωριστικό πρέπει να αποκλειστεί από τις ερμηνευτικές μεταβλητές για τρεις λόγους που σωρεύονται.
Απουσία πληροφοριακού περιεχομένου. Η τιμή δεν μετρά τίποτα. Καμία κανονικότητα που συνδέει το αναγνωριστικό με τον στόχο δεν μπορεί να έχει αιτιώδες θεμέλιο.
Παραπλανητική συσχέτιση. Η απόδοση ακολουθεί συχνά χρονολογική σειρά: τα χαμηλά αναγνωριστικά δηλώνουν τις αρχαιότερες οντότητες. Ένα μοντέλο ανιχνεύει τότε στατιστικά πραγματική σχέση μεταξύ αναγνωριστικού και στόχου, που είναι μόνο αντανάκλαση της αρχαιότητας. Η σχέση συλλαμβάνεται από αυθαίρετο ενδιάμεσο αντί από τη μεταβλητή που την φέρει πραγματικά.
Απομνημόνευση. Ένα σχεδόν μοναδικό αναγνωριστικό επιτρέπει σε μοντέλο υψηλής ικανότητας να απομονώσει κάθε παρατήρηση σε διακριτό φύλλο. Το μοντέλο απομνημονεύει το σύνολο εκπαίδευσης αντί να επάγει κανόνα: αυτό είναι η υπερπροσαρμογή, που αντιμετωπίζεται στο κεφάλαιο 031.
Ορισμένα αναγνωριστικά δεν είναι αυθαίρετα: η δομή τους κωδικοποιεί πραγματική επαγγελματική πληροφορία.
| Αναγνωριστικό | Κωδικοποιημένη πληροφορία | Ορθή επεξεργασία |
|---|---|---|
NUM-2019-PAR-00471 | Έτος δημιουργίας, υπηρεσία προέλευσης | Εξαγωγή annee_creation και agence |
Αριθμός σειράς AX7-2021W34-0912 | Σειρά, εβδομάδα κατασκευής | Εξαγωγή gamme και semaine_fabrication |
Αναφορά προϊόντος EL-TV-55-OLED | Τμήμα, κατηγορία, μορφή | Εξαγωγή rayon, categorie, taille |
| IBAN | Χώρα, τραπεζικό ίδρυμα | Εξαγωγή pays και code_banque |
Αρχή
Η πληροφορία εξάγεται σε ρητές και τυποποιημένες μεταβλητές· το ακατέργαστο αναγνωριστικό αποκλείεται στη συνέχεια.
Αιτιολόγηση
Η εξαγόμενη πληροφορία είναι ερμηνεύσιμη: μία μεταβλητή agence αναλύεται,
ένα απόσπασμα συμβολοσειράς δεν αναλύεται. Είναι ανθεκτική: αλλαγή μορφής
αρίθμησης ακυρώνει την άμεση εκμετάλλευση του αναγνωριστικού, όχι την εξαγόμενη
μεταβλητή. Είναι επαληθεύσιμη: ο κανόνας εξαγωγής είναι ρητός και ελέγξιμος.
Σημείο προσοχής
Η διατήρηση του ακατέργαστου αναγνωριστικού επιπλέον των εξαγόμενων μεταβλητών επανεισάγει τους τρεις παραπάνω κινδύνους. Η εξαγωγή αντικαθιστά το αναγνωριστικό, δεν προστίθεται σε αυτό.
Ο τύπος μιας μεταβλητής καθορίζει τις νόμιμες περιγραφικές στατιστικές, τους εφαρμόσιμους μετασχηματισμούς και την απαιτούμενη κωδικοποίηση. Η κατάταξη κάθε στήλης αποτελεί προϋπόθεση κάθε μοντελοποίησης.
Αυστηρός ορισμός
Ποσοτική μεταβλητή ικανή να λάβει, τουλάχιστον θεωρητικά, κάθε τιμή διαστήματος του συνόλου των πραγματικών. Μεταξύ δύο παρατηρούμενων τιμών υπάρχει πάντα επιτρεπτή ενδιάμεση τιμή.
Νοητικός έλεγχος αναγνώρισης
Έχει νόημα μία ενδιάμεση τιμή μεταξύ δύο παρατηρούμενων τιμών; Μεταξύ 1,72 m και 1,73 m, η τιμή 1,7248 m είναι επιτρεπτή: η μεταβλητή είναι συνεχής.
Παραδείγματα
Τιμή, μισθός, θερμοκρασία, βάρος, ύψος, διάρκεια, απόσταση, συγκέντρωση.
Συνέπεια στην επεξεργασία
Χρησιμοποιείται άμεσα από τους περισσότερους αλγορίθμους. Ευαίσθητη στην κλίμακα για μεθόδους που βασίζονται σε αποστάσεις ή σε κάθοδο κλίσης, γεγονός που επιβάλλει κανονικοποίηση ή τυποποίηση (κεφάλαιο 023). Οι μέθοδοι δέντρων είναι αναισθητες σε αυτό.
Σημείο προσοχής
Η μέτρηση στρογγυλεύεται πάντα στην ακρίβεια του οργάνου. Η συνέχεια είναι ιδιότητα του φαινομένου, όχι της καταγραφής.
Αυστηρός ορισμός
Ποσοτική μεταβλητή της οποίας το σύνολο επιτρεπτών τιμών είναι αριθμήσιμο, συνήθως προερχόμενη από καταμέτρηση.
Νοητικός έλεγχος αναγνώρισης
Προκύπτει η τιμή από καταμέτρηση, ενώ οι ενδιάμεσες τιμές στερούνται νοήματος; Κατοικία 2,5 υπνοδωματίων δεν υπάρχει.
Παραδείγματα
Αριθμός υπνοδωματίων, παιδιών, παραγγελιών, κλήσεων υποστήριξης, ζημιών.
Συνέπεια στην επεξεργασία
Αντιμετωπίζεται ως αριθμητική στην μεγάλη πλειονότητα των περιπτώσεων. Μία μεταβλητή καταμέτρησης πολύ χαμηλής καρδινικότητας μπορεί επίσης να αντιμετωπιστεί ως τακτική· η επιλογή ανήκει στον πειραματισμό.
Σημείο προσοχής
Οι μεταβλητές καταμέτρησης παρουσιάζουν συχνά έντονα ασύμμετρη κατανομή με μάζα
στο μηδέν. Ένας μετασχηματισμός log(1 + x) είναι συχνά επωφελής για γραμμικά
μοντέλα.
Αυστηρός ορισμός
Ποιοτική μεταβλητή της οποίας οι τιμές αποτελούν εξαντλητικές και αμοιβαία αποκλειόμενες κλάσεις, χωρίς σχέση σειράς μεταξύ τους.
Νοητικός έλεγχος αναγνώρισης
Έχει νόημα κατάταξη των τιμών από τη χαμηλότερη στην υψηλότερη; Αν η απάντηση είναι αρνητική, η μεταβλητή είναι ονομαστική: το Παρίσι δεν είναι ούτε ανώτερο ούτε κατώτερο της Λυών.
Παραδείγματα
Πόλη, χώρα, μάρκα, χρώμα, κλάδος δραστηριότητας, τύπος σύμβασης, κανάλι απόκτησης, ομάδα αίματος.
Συνέπεια στην επεξεργασία
Υποχρεωτική κωδικοποίηση πριν από την υποβολή σε αλγόριθμο. Η κωδικοποίηση one-hot είναι η αναφορά για γραμμικά μοντέλα· είναι κοστοβόρα σε υψηλή καρδινικότητα. Η τακτική κωδικοποίηση απαγορεύεται, διότι εισάγει ανύπαρκτη σειρά (κεφάλαιο 022).
Σημείο προσοχής
Η καρδινικότητα είναι ο καθοριστικός παράγοντας. Μία μεταβλητή πέντε τιμών και μία μεταβλητή δεκαπέντε χιλιάδων τιμών απαιτούν διακριτές επεξεργασίες.
Αυστηρός ορισμός
Ποιοτική μεταβλητή της οποίας οι τιμές φέρουν σχέση ολικής σειράς, χωρίς το διάστημα μεταξύ διαδοχικών τιμών να είναι ποσοτικοποιήσιμο ή να τεκμαίρεται σταθερό.
Νοητικός έλεγχος αναγνώρισης
Έχει νόημα η κατάταξη, ενώ η διαφορά μεταξύ δύο διαδοχικών επιπέδων δεν είναι μετρήσιμη; Το «Δυσαρεστημένος < Ουδέτερος < Ικανοποιημένος» κατατάσσεται, αλλά τα δύο διαστήματα δεν είναι αριθμητικά συγκρίσιμα.
Παραδείγματα
Επίπεδο ικανοποίησης, επίπεδο διπλώματος, ενεργειακή κλάση, γκάμα προϊόντος, στάδιο παθολογίας, βαθμολογία οίκου αξιολόγησης.
Συνέπεια στην επεξεργασία
Τακτική κωδικοποίηση που σέβεται την επαγγελματική σειρά, με την αντιστοιχία τιμή–αριθμός ορισμένη ρητά και ποτέ συναγόμενη από την αλφαβητική σειρά.
Σημείο προσοχής
Ο υπολογισμός μέσου όρου επί τακτικής κωδικοποίησης προϋποθέτει ισαπόσταση των επιπέδων, υπόθεση που ο ίδιος ο ορισμός της τακτικότητας αποκλείει. Ένας μέσος ικανοποίησης 2,7 είναι διαχειριστική ευκολία, όχι θεμελιωμένο στατιστικό μέγεθος.
Αυστηρός ορισμός
Κατηγορική μεταβλητή με ακριβώς δύο τιμές. Είναι ονομαστική ή τακτική ανάλογα με τον τομέα, η διάκριση χωρίς πρακτική επίδραση στις δύο τιμές.
Νοητικός έλεγχος αναγνώρισης
Δέχεται η μεταβλητή ακριβώς δύο δυνατές τιμές, εξαιρουμένων των ελλειπουσών;
Παραδείγματα
Ενεργός πελάτης, εγγραφή σε επιλογή, παρουσία ανελκυστήρα, αποτέλεσμα δοκιμής.
Συνέπεια στην επεξεργασία
Άμεση κωδικοποίηση σε 0 / 1, χωρίς one-hot. Η υιοθετημένη σύμβαση πρέπει να τεκμηριώνεται: το 1 δηλώνει συμβατικά την τιμή ενδιαφέροντος.
Σημείο προσοχής
Όταν δυαδική μεταβλητή είναι στόχος ταξινόμησης, η κωδικοποίηση της θετικής κλάσης καθορίζει την ερμηνεία όλων των ασύμμετρων μετρικών — ακρίβειας, ανάκλησης, PR-AUC. Αντιστροφή σύμβασης ακυρώνει την ανάγνωση των αποτελεσμάτων (κεφάλαια 053 και 064).
Αυστηρός ορισμός
Μεταβλητή της οποίας οι τιμές δηλώνουν στιγμές ή διαστήματα σε χρονολογικό άξονα, εφοδιασμένο με σχέση σειράς και μετρική διαφοράς.
Νοητικός έλεγχος αναγνώρισης
Δηλώνει η τιμή μία στιγμή και έχει νόημα η διαφορά δύο τιμών σε μονάδες χρόνου;
Παραδείγματα
Ημερομηνία εγγραφής, χρονοσήμανση συναλλαγής, ημερομηνία γέννησης, ημερομηνία τελευταίας σύνδεσης.
Συνέπεια στην επεξεργασία
Αναξιοποίητη ως έχει. Κινητοποιούνται δύο οικογένειες μετασχηματισμών: η αποσύνθεση σε ημερολογιακές συνιστώσες (έτος, μήνας, ημέρα της εβδομάδας, ώρα, δείκτης σαββατοκύριακου ή αργίας) και η μετατροπή σε σχετική διάρκεια ως προς σημείο αναφοράς (αρχαιότητα σε ημέρες, καθυστέρηση από το τελευταίο γεγονός, χρόνος που απομένει πριν από τη λήξη). Αυτές οι κατασκευές ανήκουν στη μηχανική μεταβλητών (κεφάλαιο 024).
Σημείο προσοχής
Η παρουσία χρονικής μεταβλητής σηματοδοτεί ενδεχόμενη χρονολογική εξάρτηση. Αν το μοντέλο προορίζεται να προβλέψει το μέλλον από το παρελθόν, ο διαχωρισμός train / test πρέπει να είναι χρονολογικός και όχι τυχαίος (κεφάλαιο 027). Ένα μοντέλο εκπαιδευμένο σε δεδομένα μεταγενέστερα εκείνων της δοκιμής επικυρώνεται σε συνθήκες αδύνατες στην παραγωγή.
Αυστηρός ορισμός
Μεταβλητή της οποίας οι τιμές είναι συμβολοσειρές φυσικής γλώσσας, μεταβλητού μήκους και μη δεσμευμένης δομής.
Νοητικός έλεγχος αναγνώρισης
Είναι το περιεχόμενο ελεύθερα συνταγμένο, χωρίς πεπερασμένο σύνολο τιμών; Ένα σχόλιο πελάτη είναι κειμενικό· ένας κωδικός χώρας τριών γραμμάτων είναι κατηγορικός αν και αποθηκευμένος επίσης ως συμβολοσειρά.
Παραδείγματα
Σχόλιο αξιολόγησης, περιγραφή αγγελίας, θέμα μηνύματος, αυτολεξεί απάντηση έρευνας, ελεύθερα καταχωρισμένος λόγος παραπόνου.
Συνέπεια στην επεξεργασία
Υποχρεωτική διανυσματοποίηση: καταμέτρηση εμφανίσεων, στάθμιση TF-IDF, ή πυκνή διανυσματική αναπαράσταση. Το κεφάλαιο 042 προσεγγίζει την ταξινόμηση κειμένου με μπεϋζιανές μεθόδους· η εις βάθος επεξεργασία φυσικής γλώσσας εκφεύγει του πεδίου αυτού του μαθήματος.
Σημείο προσοχής
Μία κειμενική στήλη χαμηλής καρδινικότητας είναι στην πραγματικότητα κακώς
τυποποιημένη κατηγορική μεταβλητή. Το κριτήριο διάκρισης είναι ο αριθμός
διακριτών τιμών σε σχέση με τον αριθμό παρατηρήσεων: df["colonne"].nunique().
Η προηγούμενη τυπολογία είναι επιχειρησιακή. Στηρίζεται σε θεωρητικό πλαίσιο που πρότεινε ο ψυχοφυσικός S. S. Stevens το 1946, ο οποίος κατατάσσει τις κλίμακες μέτρησης σύμφωνα με τις μαθηματικές πράξεις που επιτρέπουν.
Ονομαστική κλίμακα — Οι τιμές είναι μόνο ετικέτες. Ορίζεται μόνο η ισότητα· καμία αριθμητική πράξη δεν έχει νόημα. Νόμιμη κεντρική τάση: ο τρόπος (mode).
Τακτική κλίμακα — Οι τιμές είναι διατεταγμένες, αλλά τα διαστήματα δεν είναι ερμηνεύσιμα. Ορίζονται ισότητα και σύγκριση. Νόμιμοι δείκτες: τρόπος, διάμεσος, ποσοστημόρια.
Κλίμακα διαστήματος — Τα διαστήματα είναι ερμηνεύσιμα και σταθερά, αλλά το μηδέν είναι συμβατικό. Η διαφορά έχει νόημα, ο λόγος όχι. Κανονικό παράδειγμα: η θερμοκρασία σε βαθμούς Κελσίου, οι 20 °C δεν είναι δύο φορές θερμότεροι από τους 10 °C. Νόμιμοι δείκτες: τρόπος, διάμεσος, μέσος, τυπική απόκλιση.
Κλίμακα λόγου — Το μηδέν είναι απόλυτο και σημαίνει απουσία του μεγέθους. Διαφορές και λόγοι είναι και οι δύο ερμηνεύσιμοι: 40 € είναι πράγματι το διπλάσιο των 20 €. Όλες οι πράξεις είναι νόμιμες, συμπεριλαμβανομένου του γεωμετρικού μέσου και του συντελεστή μεταβλητότητας.
Εμβέλεια του πλαισίου
Η ταξινόμηση του Stevens παρέχει το αυστηρό κριτήριο νομιμότητας των στατιστικών. Η επιχειρησιακή τυπολογία του σημείου 4 του αντιστοιχεί, με το διάστημα και τον λόγο συγκεντρωμένους υπό την ονομασία αριθμητική διότι οι συνήθεις αλγόριθμοι δεν τους διακρίνουν.
Σημείο προσοχής
Αυτό το πλαίσιο έχει δεχθεί κριτική, ιδίως από τους Velleman και Wilkinson (1993), που αμφισβητούν τη μηχανική εφαρμογή του στην απαγόρευση ορισμένων αναλύσεων. Παραμένει η παιδαγωγική αναφορά και το καλύτερο διαθέσιμο ανάχωμα έναντι υπολογισμών χωρίς νόημα.
| Κλίμακα | Ορισμένες σχέσεις | Μηδέν | Νόμιμες στατιστικές | Παράδειγμα |
|---|---|---|---|---|
| Ονομαστική | Ισότητα | Άνευ αντικειμένου | Τρόπος, πλήθη, χ-τετράγωνο | Πόλη, μάρκα |
| Τακτική | Ισότητα, σειρά | Άνευ αντικειμένου | Τρόπος, διάμεσος, ποσοστημόρια, συσχέτιση βαθμίδας | Ενεργειακή κλάση |
| Διαστήματος | Ισότητα, σειρά, διαφορά | Συμβατικό | Μέσος, τυπική απόκλιση, γραμμική συσχέτιση | Θερμοκρασία Κελσίου, έτος |
| Λόγου | Ισότητα, σειρά, διαφορά, λόγος | Απόλυτο | Όλες, συμπεριλαμβανομένου γεωμετρικού μέσου | Τιμή, βάρος, διάρκεια |
Μία στήλη αποθηκευμένη ως ακέραιος δεν είναι κατ’ ανάγκη αριθμητική μεταβλητή. Το αποφασιστικό κριτήριο δεν είναι ο τύπος αποθήκευσης αλλά η φύση του μεγέθους: έχουν οι αριθμητικές πράξεις επαγγελματικό νόημα;
| Στήλη | Τύπος αποθήκευσης | Πραγματική φύση | Έλεγχος αποκλεισμού |
|---|---|---|---|
| Ταχυδρομικός κωδικός | Ακέραιος | Ονομαστική κατηγορική | Ο μέσος δύο ταχυδρομικών κωδικών δεν δηλώνει κανέναν δήμο |
| Κωδικός περιφέρειας, κωδικός νομού | Ακέραιος | Ονομαστική κατηγορική | Ο αριθμός διατάσσει αλφαβητικά, όχι γεωγραφικά |
| Κωδικός προϊόντος, κωδικός καταστήματος | Ακέραιος | Ονομαστική κατηγορική | Καμία επαγγελματική σχέση σειράς μεταξύ δύο κωδικών |
| Αριθμός τριμήνου (1 έως 4) | Ακέραιος | Κυκλική τακτική | Το τρίμηνο 4 προηγείται του τριμήνου 1 του επόμενου έτους |
| Βαθμός αξιολόγησης (1 έως 5) | Ακέραιος | Τακτική | Το διάστημα μεταξύ 1 και 2 δεν ισούται με εκείνο μεταξύ 4 και 5 |
| Αριθμητικό αναγνωριστικό πελάτη | Ακέραιος | Αναγνωριστικό | Καμία επαγγελματική σημασία (σημείο 3.4) |
| Κωδικός NAF, κωδικός CSP | Συμβολοσειρά ή ακέραιος | Ιεραρχική ονομαστική | Ονοματολογία επιπέδων, προς αξιοποίηση ανά επίπεδο |
| Έτος κατασκευής | Ακέραιος | Αριθμητική διαστήματος | Αντίστροφη περίπτωση: η διαφορά έχει νόημα, ο λόγος όχι |
Συνέπεια σφάλματος κατάταξης. Η αντιμετώπιση ταχυδρομικού κωδικού ως αριθμητικού οδηγεί δέντρο απόφασης να παράγει διαμερίσεις του τύπου «ταχυδρομικός κωδικός μικρότερος από 44300», που ομαδοποιούν δήμους χωρίς καμία γεωγραφική ή κοινωνικοοικονομική εγγύτητα: το μοντέλο μαθαίνει την αυθαίρετη δομή της ονοματολογίας. Ένα γραμμικό μοντέλο υποθέτει από την πλευρά του μονότονη σχέση μεταξύ αριθμού δήμου και στόχου, υπόθεση χωρίς θεμέλιο.
Σημείο προσοχής: ο ορθός μετασχηματισμός ταχυδρομικού κωδικού δεν συνίσταται κατ’ ανάγκη σε κωδικοποίηση one-hot χιλιάδων τιμών. Οι συνήθεις προσεγγίσεις είναι η συνάθροιση σε ανώτερο επίπεδο (νομός, αστική περιοχή), η σύνδεση εδαφικών κοινωνικοοικονομικών μεταβλητών, ή η κωδικοποίηση μέσω του στόχου με τις συνήθεις προφυλάξεις έναντι διαρροής (κεφάλαια 022 και 028).
| Τύπος | Νοητικός έλεγχος | Παραδείγματα | Απαιτούμενη κωδικοποίηση | Παραπομπή |
|---|---|---|---|---|
| Συνεχής αριθμητική | Έχει νόημα ενδιάμεση τιμή; | Τιμή, μισθός, θερμοκρασία, διάρκεια | Καμία· κανονικοποίηση ανάλογα με τον αλγόριθμο | Κεφάλαιο 023 |
| Διακριτή αριθμητική | Πρόκειται για καταμέτρηση; | Αριθμός δωματίων, αριθμός κλήσεων | Καμία· λογαριθμικός μετασχηματισμός αν ισχυρή ασυμμετρία | Κεφάλαιο 024 |
| Ονομαστική κατηγορική | Έχει νόημα κατάταξη των τιμών; Όχι | Πόλη, μάρκα, κλάδος | One-hot· κωδικοποίηση μέσω στόχου σε υψηλή καρδινικότητα | Κεφάλαιο 022 |
| Τακτική κατηγορική | Έχει νόημα κατάταξη, χωρίς μετρήσιμο διάστημα; | Ικανοποίηση, δίπλωμα, ενεργειακή κλάση | Τακτική, με ρητή αντιστοιχία | Κεφάλαιο 022 |
| Δυαδική | Ακριβώς δύο τιμές; | Ναι / όχι, ενεργός / ανενεργός | 0 / 1, τεκμηριωμένη σύμβαση | Κεφάλαιο 022 |
| Χρονική | Δηλώνει στιγμή; | Ημερομηνία, χρονοσήμανση | Ημερολογιακή αποσύνθεση και σχετικές διάρκειες | Κεφάλαια 024 και 027 |
| Κειμενική | Ελεύθερα συνταγμένο περιεχόμενο; | Σχόλιο, περιγραφή | Διανυσματοποίηση: καταμέτρηση, TF-IDF, ενσωμάτωση | Κεφάλαιο 042 |
Έξι πράξεις διεξάγονται συστηματικά, με αυτή τη σειρά. Η σειρά δεν είναι αδιάφορη: οι διαστάσεις καθορίζουν την ανάγνωση των τύπων, οι τύποι καθορίζουν την ανάγνωση των στατιστικών και η κατανομή του στόχου καθορίζει την επιλογή των μετρικών.
Οι παρακάτω έξοδοι αφορούν σύνολο δεδομένων αποχώρησης τηλεπικοινωνιών με 10 000 παρατηρήσεις και 14 στήλες.
import pandas as pd
df = pd.read_csv("attrition_telecom.csv")
print(df.shape)(10000, 14)Ερμηνεία: 10 000 παρατηρήσεις, 14 στήλες. Το καθεστώς όγκου είναι ονομαστικό με την έννοια του σημείου 1.5, με ευνοϊκό λόγο n / p. Αυτός ο αριθμός μένει να επαναχαρακτηριστεί μετά από δύο επαληθεύσεις: τον αριθμό πραγματικά διακριτών παρατηρήσεων (σημείο 5.6) και το πλήθος της μειοψηφικής κλάσης (σημείο 5.5).
pd.set_option("display.max_columns", None)
print(df.head()) client_id age region anciennete_mois type_forfait engagement \
0 C-00001 34 IDF 8 Mobile Sans_eng
1 C-00002 67 PACA 45 Fibre 24_mois
2 C-00003 29 ARA 2 Mobile Sans_eng
3 C-00004 52 IDF 61 Fibre+TV 24_mois
4 C-00005 41 OCC 17 Fibre 12_mois
facture_mensuelle data_go_moyen nb_appels_support satisfaction \
0 29,90 8.4 0 4.0
1 64,90 2.1 3 2.0
2 19,90 14.7 1 NaN
3 89,90 31.5 0 5.0
4 49,90 6.8 7 1.0
revenu_estime mode_paiement date_souscription a_resilie
0 1850.0 Prelevement 2024-06-12 0
1 3120.0 Prelevement 2021-09-03 0
2 NaN Carte 2024-12-20 1
3 4470.0 Prelevement 2020-02-28 0
4 2260.0 Virement 2024-01-15 1Ερμηνεία: η ανάγνωση επικυρώνει τη δομή και αποκαλύπτει δύο ανωμαλίες μορφής.
Η στήλη facture_mensuelle χρησιμοποιεί το κόμμα ως δεκαδικό διαχωριστικό,
γεγονός που εμποδίζει την αριθμητική συναγωγή. Η στήλη date_souscription
παραμένει συμβολοσειρά όσο δεν ζητείται μετατροπή.
Σημείο προσοχής: το df.head() εμφανίζει τις πέντε πρώτες γραμμές του
αρχείου, που δεν αποτελούν τυχαίο δείγμα. Αν το αρχείο είναι ταξινομημένο κατά
ημερομηνία ή περιφέρεια, αυτές οι γραμμές δεν είναι αντιπροσωπευτικές.
Το df.sample(5, random_state=0) συμπληρώνει χρήσιμα τον έλεγχο.
df.info()<class 'pandas.core.frame.DataFrame'>
RangeIndex: 10000 entries, 0 to 9999
Data columns (total 14 columns):
# Column Non-Null Count Dtype
--- ------ -------------- -----
0 client_id 10000 non-null object
1 age 10000 non-null int64
2 region 10000 non-null object
3 anciennete_mois 10000 non-null int64
4 type_forfait 10000 non-null object
5 engagement 9964 non-null object
6 facture_mensuelle 10000 non-null object
7 data_go_moyen 8791 non-null float64
8 nb_appels_support 10000 non-null int64
9 satisfaction 7412 non-null float64
10 revenu_estime 9503 non-null float64
11 mode_paiement 10000 non-null object
12 date_souscription 10000 non-null object
13 a_resilie 10000 non-null int64
dtypes: float64(3), int64(4), object(7)
memory usage: 1.1+ MBΠρώτη ανάγνωση — η πληρότητα. Κάθε τιμή Non-Null Count μικρότερη από
10 000 σηματοδοτεί ελλείπουσες τιμές: engagement (36), data_go_moyen
(1 209), satisfaction (2 588), revenu_estime (497). Το εύρος καθορίζει τη
στρατηγική: μία στήλη με 26 % ελλείπουσες δεν αντιμετωπίζεται όπως στήλη με
0,4 % (κεφάλαιο 018).
Δεύτερη ανάγνωση — οι τύποι. Ο τύπος object σηματοδοτεί στήλη αποθηκευμένη
ως συμβολοσειρά. Διακρίνονται τρεις περιπτώσεις.
| Στήλη | Συναγόμενος τύπος | Αναμενόμενος τύπος | Διάγνωση |
|---|---|---|---|
client_id, region, type_forfait, engagement, mode_paiement | object | object | Ορθό: αναγνωριστικό και κατηγορικές μεταβλητές |
facture_mensuelle | object | float64 | Κακώς συναγόμενος τύπος: δεκαδικό διαχωριστικό κόμμα |
date_souscription | object | datetime64 | Κακώς συναγόμενος τύπος: δεν ζητήθηκε μετατροπή |
Σημείο προσοχής: ένας κακώς συναγόμενος τύπος αποκλείει σιωπηρά τη στήλη από
τις περιγραφικές στατιστικές και τις αριθμητικές επεξεργασίες. Η στήλη
facture_mensuelle, παρότι μία από τις πιο ερμηνευτικές ενός φαινομένου
αποχώρησης, δεν θα εμφανιστεί στο df.describe() και θα αντιμετωπιζόταν ως
κατηγορική μεταβλητή εκατοντάδων τιμών από αυτόματη κωδικοποίηση. Οι συνήθεις
αιτίες είναι το δεκαδικό διαχωριστικό, τα κενά χιλιάδων, τα σύμβολα μονάδας και
οι συμβολοσειρές N/A, - ή inconnu.
df["facture_mensuelle"] = (
df["facture_mensuelle"].str.replace(",", ".", regex=False).astype(float)
)
df["date_souscription"] = pd.to_datetime(df["date_souscription"])print(df.describe().round(2)) age anciennete_mois data_go_moyen nb_appels_support \
count 10000.00 10000.00 8791.00 10000.00
mean 46.31 32.47 12.84 1.72
std 16.42 24.56 9.77 2.14
min 18.00 1.00 0.00 0.00
25% 33.00 9.00 5.60 0.00
50% 45.00 29.00 10.90 1.00
75% 58.00 55.00 18.20 3.00
max 142.00 72.00 94.30 21.00
satisfaction revenu_estime a_resilie
count 7412.00 9503.00 10000.00
mean 3.41 2841.66 0.27
std 1.18 1420.33 0.44
min 1.00 -5000.00 0.00
25% 3.00 1950.00 0.00
50% 4.00 2680.00 0.00
75% 4.00 3520.00 1.00
max 5.00 18400.00 1.00Αντικείμενο αυτής της πράξης: εντοπισμός αδύνατων τιμών, δηλαδή τοποθετημένων εκτός του επαγγελματικού πεδίου ορισμού της μεταβλητής. Δεν είναι ακραίες τιμές αλλά σφάλματα.
| Διαπίστωση | Τιμή | Διάγνωση |
|---|---|---|
Μέγιστο age | 142 | Εκτός πεδίου: σφάλμα καταχώρισης, τιμή φρουρός, ή κακώς συμπληρωμένη ημερομηνία γέννησης |
Ελάχιστο revenu_estime | −5 000 | Εκτός πεδίου: σφάλμα προσήμου, ή καταχρηστικός κωδικός φρουρός |
Μέγιστο data_go_moyen | 94,3 | Ακραίο αλλά εύλογο: νόμιμη άτυπη τιμή, προς εξέταση (κεφάλαιο 021) |
satisfaction count | 7 412 | Μερική πληρότητα: 26 % ελλείπουσες |
a_resilie mean | 0,27 | Ο μέσος δυαδικής μεταβλητής είναι το ποσοστό της θετικής κλάσης |
Σημείο προσοχής για τις τιμές φρουρούς. Οι τιμές -1, 999, 9999,
-9999, 0 σε αυστηρά θετική μεταβλητή και οι ημερομηνίες 1ης Ιανουαρίου 1900
είναι συμβατικοί κωδικοί που σηματοδοτούν απουσία πληροφορίας σε πολλά κληροδοτημένα
συστήματα. Αντιμετωπιζόμενες ως πραγματικές τιμές, διαστρεβλώνουν τους μέσους και
δημιουργούν τεχνητές σχέσεις.
Σημείο προσοχής για την εμβέλεια. Το df.describe() καλύπτει από προεπιλογή
μόνο τις αριθμητικές στήλες. Η εξέταση των κατηγορικών απαιτεί
df.describe(include="object"), που αποδίδει πλήθος, καρδινικότητα και συχνότερη
τιμή. Μια αφύσικα υψηλή καρδινικότητα αποκαλύπτει εκεί αναγνωριστικό μη δηλωμένο
ως τέτοιο, ή κακώς καταταγμένη κειμενική μεταβλητή.
Πρόκειται για τον έλεγχο με τον καλύτερο λόγο κόστους–πληροφορίας. Απαιτεί μία γραμμή κώδικα και καθορίζει τον τύπο προβλήματος, την επιλογή μετρικών, τη στρατηγική διαχωρισμού και το μοντέλο αναφοράς.
print(df["a_resilie"].value_counts(normalize=True).round(4))
print(df["a_resilie"].value_counts())a_resilie
0 0.7347
1 0.2653
Name: proportion, dtype: float64
a_resilie
0 7347
1 2653
Name: count, dtype: int64Φύση του προβλήματος. Δύο τιμές: δυαδική ταξινόμηση. Ένας συνεχής στόχος θα ανήκε στην παλινδρόμηση, ένας στόχος με περισσότερες από δύο τιμές σε πολυκλασική ταξινόμηση (κεφάλαιο 006).
Επίπεδο ανισορροπίας. Ένας λόγος 73 / 27 αποτελεί μέτρια ανισορροπία, διαχειρίσιμη με στρωματοποιημένο διαχωρισμό και στάθμιση κλάσεων.
Μοντέλο αναφοράς. Ένας ταξινομητής που προβλέπει συστηματικά την πλειοψηφική κλάση επιτυγχάνει 73,47 % ορθότητα χωρίς να μάθει τίποτα. Κάθε επίδοση συγκρίνεται με αυτό το κατώφλι, όχι με το 50 %: ένα μοντέλο που εμφανίζει 75 % προσφέρει οριακό όφελος 1,5 μονάδας.
Χρήσιμο πλήθος. Η θετική κλάση μετρά 2 653 παρατηρήσεις. Αυτός ο αριθμός, και όχι οι 10 000, οριοθετεί την ικανότητα του μοντέλου να χαρακτηρίσει τις αποχωρήσεις.
| Λόγος πλειοψηφικής / μειοψηφικής | Χαρακτηρισμός | Μεθοδολογική συνέπεια |
|---|---|---|
| 50 / 50 έως 65 / 35 | Ισορροπημένο | Καμία ειδική επεξεργασία· η ορθότητα παραμένει ερμηνεύσιμη |
| 65 / 35 έως 90 / 10 | Μέτρια ανισορροπία | Στρωματοποιημένος διαχωρισμός, στάθμιση κλάσεων, μετρικές ανά κλάση |
| 90 / 10 έως 99 / 1 | Ισχυρή ανισορροπία | Αποκλεισμός ορθότητας· PR-AUC, ανάκληση, ακρίβεια· προσαρμογή κατωφλίου |
| Πέραν του 99 / 1 | Ακραία ανισορροπία | Ελεγχόμενη επαναδειγματοληψία, μάθηση ευαίσθητη στο κόστος, ανίχνευση ανωμαλίας |
Η ανισορροπία αναπτύσσεται στο κεφάλαιο 050, η επιλογή των συναφών μετρικών στα κεφάλαια 053 και 064, η προσαρμογή του κατωφλίου στο κεφάλαιο 062.
Σημείο προσοχής: το value_counts() αγνοεί από προεπιλογή τις ελλείπουσες
τιμές. Η κλήση df["a_resilie"].value_counts(dropna=False) είναι απαραίτητη:
ένας μερικώς μη συμπληρωμένος στόχος σηματοδοτεί ελάττωμα συγκρότησης του συνόλου
δεδομένων, καθώς αυτές οι παρατηρήσεις δεν είναι αξιοποιήσιμες ούτε στην
εκπαίδευση ούτε στην αξιολόγηση.
manquants = df.isnull().sum()
manquants = manquants[manquants > 0].sort_values(ascending=False)
print(manquants)
print((manquants / len(df) * 100).round(2))satisfaction 2588
data_go_moyen 1209
revenu_estime 497
engagement 36
dtype: int64
satisfaction 25.88
data_go_moyen 12.09
revenu_estime 4.97
engagement 0.36
dtype: float64Ερμηνεία: το ποσοστό έχει μεγαλύτερη σημασία από το ακατέργαστο πλήθος. Ένα συνήθης κατώφλι τοποθετεί γύρω στο 5 % το όριο κάτω από το οποίο μια απλή καταλογισμός είναι γενικά χωρίς συνέπειες, και γύρω στο 40 έως 50 % το επίπεδο πέραν του οποίου πρέπει να αμφισβητηθεί η συνάφεια της στήλης. Αυτές οι τιμές είναι ορόσημα, όχι κανόνες.
Σημείο προσοχής: η απουσία τιμής συχνά φέρει πληροφορία. Μία μη συμπληρωμένη
satisfaction σηματοδοτεί πελάτη που δεν απάντησε ποτέ σε έρευνα, γεγονός που
αποτελεί αφ’ εαυτού συμπεριφορικό σήμα. Η δημιουργία δυαδικού δείκτη
satisfaction_manquante πριν από τον καταλογισμό διατηρεί αυτή την πληροφορία
(κεφάλαιο 018).
print("Lignes strictement dupliquées :", df.duplicated().sum())
print("Identifiants dupliqués :", df["client_id"].duplicated().sum())
print("Clients distincts :", df["client_id"].nunique())Lignes strictement dupliquées : 0
Identifiants dupliqués : 143
Clients distincts : 9857Ερμηνεία, και αυτό είναι το βαρύτερο αποτέλεσμα ολόκληρου του ελέγχου. Καμία γραμμή δεν είναι πλήρως διπλότυπη, γεγονός που αποκλείει την υπόθεση σφάλματος συνένωσης. Αντίθετα, 143 αναγνωριστικά εμφανίζονται πολλές φορές: το σύνολο περιλαμβάνει 9 857 διακριτούς πελάτες περιγραφόμενους από 10 000 γραμμές.
Η μονάδα ανάλυσης δεν είναι επομένως ακριβώς ο πελάτης. Επιβάλλονται τρία ερωτήματα: αντιστοιχούν αυτές οι γραμμές σε πολλές ημερομηνίες παρατήρησης του ίδιου πελάτη, σε διακριτές συμβάσεις, ή σε ελάττωμα ενοποίησης; Ανάλογα με την απάντηση, ο διαχωρισμός θα πρέπει να γίνει κατά ομάδα (κεφάλαιο 027) και το σημείο 2.3 εφαρμόζεται πλήρως.
Αυστηρό διπλότυπο
Δύο γραμμές ταυτόσημες στο σύνολο των στηλών. Εντοπισμός: df.duplicated().
Συνήθης προέλευση: επαναλαμβανόμενη συνένωση, κακώς καρδιναλοποιημένη σύνδεση,
μερική επαναφόρτωση.
Λειτουργικό διπλότυπο
Δύο γραμμές που δηλώνουν την ίδια οντότητα του πραγματικού κόσμου χωρίς να είναι
ταυτόσημες, λόγω διαφοράς πεζών-κεφαλαίων, διαστημάτων, μορφής ή χρονοσήμανσης.
Εντοπισμός: df.duplicated(subset=[...]) στις στήλες που αποτελούν το
επαγγελματικό κλειδί.
Συνέπεια στη μοντελοποίηση
Ένα αυστηρό διπλότυπο παρόν και στις δύο πλευρές τυχαίου διαχωρισμού εγγυάται ορθή πρόβλεψη στην αντίστοιχη παρατήρηση δοκιμής, μέσω απομνημόνευσης. Η μετρούμενη επίδοση υπερεκτιμάται μηχανικά. Πρόκειται για μορφή διαρροής (κεφάλαιο 028).
Σημείο προσοχής
Η διαγραφή των διπλότυπων δεν δικαιολογείται συστηματικά. Δύο συναλλαγές του ίδιου ποσού, στον ίδιο έμπορο, την ίδια ημέρα, μπορούν να είναι αυθεντικές. Η απόφαση απαιτεί το επαγγελματικό κλειδί, ποτέ μόνο την ταυτότητα των τιμών.
ΚΑΤΑΛΟΓΟΣ ΕΛΕΓΧΟΥ ΤΗΣ ΠΡΩΤΗΣ ΕΠΑΦΗΣ ΜΕ ΣΥΝΟΛΟ ΔΕΔΟΜΕΝΩΝ
1. Τι αντιπροσωπεύει ακριβώς μία γραμμή; Να διατυπώσετε την απάντηση
σε πλήρη πρόταση, επικυρωμένη από τον επαγγελματικό τομέα.
2. Πόσες παρατηρήσεις (n) και πόσες στήλες (p);
Είναι ο λόγος n / p συμβατός με τη φιλοδοξία του μοντέλου;
3. Εμφανίζεται η ίδια οντότητα σε πολλές γραμμές;
Να επαληθεύσετε nunique() στο επαγγελματικό κλειδί, όχι μόνο duplicated().
4. Ποια στήλη αποτελεί τη μεταβλητή στόχο και είναι πλήρως
συμπληρωμένη;
5. Ποια είναι η κατανομή του στόχου; Να συναγάγετε τον τύπο
προβλήματος, το επίπεδο ανισορροπίας και το μοντέλο αναφοράς.
6. Ποιος είναι ο λειτουργικός ρόλος κάθε στήλης: αναγνωριστικό,
ερμηνευτική μεταβλητή, στόχος, μεταβλητή διαρροής;
7. Ποιος είναι ο τύπος κάθε μεταβλητής και συμπίπτει ο συναγόμενος
τύπος κατά την ανάγνωση με την πραγματική φύση του μεγέθους;
8. Ποιες στήλες παρουσιάζουν ελλείπουσες τιμές, με ποιο ποσοστό,
και φέρει η απουσία πληροφορία;
9. Είναι οι ακραίες τιμές εύλογες; Να διακρίνετε την αδύνατη τιμή
από τη νόμιμη άτυπη τιμή.
10. Χρησιμοποιούνται τιμές φρουροί για να σηματοδοτήσουν
την απουσία πληροφορίας (-1, 999, 9999, 1900-01-01);
11. Υπάρχει χρονική συνιστώσα και επιβάλλει χρονολογικό
διαχωρισμό αντί τυχαίου;
12. Θα είναι κάθε ερμηνευτική μεταβλητή διαθέσιμη και συμπληρωμένη
ΤΗ ΣΤΙΓΜΗ που θα πρέπει να παραχθεί η πρόβλεψη;Το δωδέκατο σημείο παραλείπεται συχνότερα. Τα ένδεκα πρώτα αφορούν το αρχείο όπως παρουσιάζεται και επαληθεύονται από τον κώδικα. Το δωδέκατο αφορά τη επαγγελματική διαδικασία που παράγει τα δεδομένα και επαληθεύεται μόνο με συνέντευξη των προσώπων που εκμεταλλεύονται το σύστημα.
Μία μεταβλητή μπορεί να είναι τέλεια συμπληρωμένη στο ιστορικό και μη διαθέσιμη τη στιγμή της πρόβλεψης: συμπληρωμένη αργότερα στη διαδικασία, υπολογισμένη σε νυχτερινή επεξεργασία, ή καταχωρισμένη από χειριστή ως αντίδραση στο ίδιο το γεγονός που το μοντέλο πρέπει να προβλέψει. Ένα μοντέλο κατασκευασμένο σε τέτοιες μεταβλητές εμφανίζει εξαιρετική επίδοση στην επικύρωση και γίνεται αναξιοποίητο στην παραγωγή (κεφάλαιο 028).
Καθεμία από τις τρεις ακόλουθες περιπτώσεις παρουσιάζει ρεαλιστικό απόσπασμα και στη συνέχεια τη δομημένη ανάλυση που πρέπει να παραχθεί πριν από κάθε μοντελοποίηση.
| client_id | age | anciennete_mois | type_forfait | engagement | facture_mensuelle | nb_appels_support | satisfaction | date_souscription | a_resilie |
|---|---|---|---|---|---|---|---|---|---|
| C-00001 | 34 | 8 | Mobile | Sans_eng | 29,90 | 0 | 4 | 2024-06-12 | 0 |
| C-00002 | 67 | 45 | Fibre | 24_mois | 64,90 | 3 | 2 | 2021-09-03 | 0 |
| C-00003 | 29 | 2 | Mobile | Sans_eng | 19,90 | 1 | — | 2024-12-20 | 1 |
| C-00004 | 52 | 61 | Fibre+TV | 24_mois | 89,90 | 0 | 5 | 2020-02-28 | 0 |
| C-00005 | 41 | 17 | Fibre | 12_mois | 49,90 | 7 | 1 | 2024-01-15 | 1 |
| Στοιχείο ανάλυσης | Προσδιορισμός |
|---|---|
| Τι αντιπροσωπεύει μία παρατήρηση | Ένας πελάτης, περιγεγραμμένος στην ημερομηνία εξαγωγής, με την κατάσταση αποχώρησης διαπιστωμένη στους επόμενους δώδεκα μήνες |
| Αναγνωριστικά προς αποκλεισμό | client_id: αφαιρείται από τις ερμηνευτικές μεταβλητές, διατηρείται για ιχνηλασιμότητα και ενδεχόμενη ομαδοποίηση |
| Μεταβλητή στόχος | a_resilie, δυαδική |
| Τύπος προβλήματος | Δυαδική ταξινόμηση, ανισορροπημένος στόχος περίπου 27 % θετικών |
| Ερμηνευτικές μεταβλητές | age, anciennete_mois, type_forfait, engagement, facture_mensuelle, nb_appels_support, satisfaction, συν οι παράγωγες μεταβλητές της date_souscription |
| Τύποι μεταβλητών | Συνεχής: facture_mensuelle. Διακριτές: anciennete_mois, nb_appels_support, age. Ονομαστική: type_forfait. Τακτικές: engagement, satisfaction. Χρονική: date_souscription |
| Σημεία προσοχής | Η facture_mensuelle είναι κακώς τυποποιημένη (διαχωριστικό κόμμα). Η satisfaction παρουσιάζει 26 % ελλείπουσες των οποίων η απουσία είναι πληροφοριακή. Η date_souscription είναι πλεονάζουσα με την anciennete_mois και πρέπει να αποσυντεθεί. Η στήλη date_resiliation του αρχείου πηγής είναι μεταβλητή διαρροής, προς αποκλεισμό χωρίς εξαίρεση |
Σχόλιο για την τακτικότητα του engagement. Οι τιμές Sans_eng, 12_mois
και 24_mois διατάσσονται κατά αύξουσα διάρκεια· δικαιολογείται τακτική
κωδικοποίηση. Σημείο προσοχής: μια αυτόματη κωδικοποίηση βασισμένη στην
αλφαβητική σειρά θα παρήγαγε 12_mois < 24_mois < Sans_eng, τοποθετώντας την
απουσία δέσμευσης στο υψηλότερο επίπεδο. Η αντιστοιχία πρέπει να είναι ρητή.
| annonce_id | commune | code_postal | surface_m2 | nb_pieces | etage | annee_construction | classe_energie | ascenseur | date_vente | prix_vente |
|---|---|---|---|---|---|---|---|---|---|---|
| A-10471 | Lyon 3e | 69003 | 68 | 3 | 4 | 1972 | D | 1 | 2024-03-14 | 331 000 |
| A-10472 | Villeurbanne | 69100 | 42 | 2 | 1 | 2015 | B | 1 | 2024-03-18 | 218 500 |
| A-10473 | Lyon 6e | 69006 | 105 | 5 | 2 | 1930 | E | 0 | 2024-04-02 | 712 000 |
| A-10474 | Bron | 69500 | 77 | 4 | 0 | 1988 | D | 0 | 2024-04-11 | 249 000 |
| A-10475 | Lyon 3e | 69003 | 31 | 1 | 6 | 2019 | A | 1 | 2024-05-06 | 189 900 |
| Στοιχείο ανάλυσης | Προσδιορισμός |
|---|---|
| Τι αντιπροσωπεύει μία παρατήρηση | Μία ολοκληρωμένη ακίνητη συναλλαγή, και όχι ένα αγαθό: το ίδιο αγαθό που μεταπωλείται δύο φορές καταλαμβάνει δύο νόμιμες γραμμές |
| Αναγνωριστικά προς αποκλεισμό | annonce_id |
| Μεταβλητή στόχος | prix_vente, συνεχής αριθμητική αυστηρά θετική |
| Τύπος προβλήματος | Παλινδρόμηση |
| Ερμηνευτικές μεταβλητές | commune, surface_m2, nb_pieces, etage, annee_construction, classe_energie, ascenseur, συν οι παράγωγες μεταβλητές της date_vente |
| Τύποι μεταβλητών | Συνεχής: surface_m2. Διακριτές: nb_pieces, etage. Διαστήματος: annee_construction. Ονομαστική: commune. Τακτική: classe_energie (A έως G). Δυαδική: ascenseur. Χρονική: date_vente |
| Σημεία προσοχής | Ο code_postal είναι αριθμητικός ψευδοφίλος: ονομαστικός κατηγορικός, πλεονάζων με την commune, προς αποκλεισμό ή συνάθροιση. Η annee_construction είναι μεταβλητή διαστήματος· προτιμάται η μετατροπή της σε ηλικία του αγαθού κατά την ημερομηνία πώλησης. Η classe_energie είναι τακτική, με φθίνουσα σειρά επίδοσης προς ρητοποίηση. Ο στόχος είναι έντονα ασύμμετρος δεξιά, γεγονός που δικαιολογεί την εξέταση μοντελοποίησης επί του λογαρίθμου του |
Σχόλιο για τη χρονική εξάρτηση. Η αγορά ακινήτων γνωρίζει μετατόπιση του επιπέδου τιμών. Ένα μοντέλο εκπαιδευμένο σε συναλλαγές του 2024 και εφαρμοσμένο το 2026 εκτίθεται σε μετατόπιση έννοιας (κεφάλαιο 082). Αν η στοχευμένη χρήση συνίσταται στην εκτίμηση μελλοντικών συναλλαγών, ο διαχωρισμός πρέπει να είναι χρονολογικός: εκπαίδευση στις παλαιότερες περιόδους, αξιολόγηση στην πιο πρόσφατη περίοδο (κεφάλαιο 027).
| transaction_id | carte_id | horodatage | montant | commercant | categorie_mcc | pays | canal | delai_depuis_precedente_s | est_fraude |
|---|---|---|---|---|---|---|---|---|---|
| T-9910001 | K-4471 | 2025-02-11 08:14:22 | 12,40 | Boulangerie Vidal | 5462 | FR | Sans_contact | 43 120 | 0 |
| T-9910002 | K-4471 | 2025-02-11 08:19:07 | 1 890,00 | ElectroDirect | 5732 | LT | En_ligne | 285 | 1 |
| T-9910003 | K-4471 | 2025-02-11 08:21:55 | 1 940,00 | ElectroDirect | 5732 | LT | En_ligne | 168 | 1 |
| T-9910004 | K-2038 | 2025-02-11 09:02:11 | 67,30 | Station Aral | 5541 | DE | Puce | 61 400 | 0 |
| T-9910005 | K-7712 | 2025-02-11 09:03:48 | 8,90 | Metro Ligne 4 | 4111 | FR | Sans_contact | 22 010 | 0 |
| Στοιχείο ανάλυσης | Προσδιορισμός |
|---|---|
| Τι αντιπροσωπεύει μία παρατήρηση | Μία συναλλαγή με κάρτα, σε χρονολογημένη στιγμή. Η μονάδα ανάλυσης είναι η συναλλαγή, ούτε η κάρτα ούτε ο κάτοχος |
| Αναγνωριστικά προς αποκλεισμό | transaction_id και carte_id από τις ερμηνευτικές μεταβλητές. Το carte_id διατηρείται επιτακτικά ως κλειδί ομαδοποίησης |
| Μεταβλητή στόχος | est_fraude, δυαδική, με ποσοστό θετικών της τάξης 0,1 έως 0,5 % στον πραγματικό πληθυσμό |
| Τύπος προβλήματος | Δυαδική ταξινόμηση με ακραία ανισορροπία |
| Ερμηνευτικές μεταβλητές | montant, categorie_mcc, pays, canal, delai_depuis_precedente_s, συν οι παράγωγες μεταβλητές του horodatage και τα κυλιόμενα αθροίσματα ανά κάρτα |
| Τύποι μεταβλητών | Συνεχείς: montant, delai_depuis_precedente_s. Ονομαστικές: categorie_mcc, pays, canal, commercant. Χρονική: horodatage |
| Σημεία προσοχής | Τρεις παγίδες σωρεύονται, αναπτυσσόμενες παρακάτω. Ο commercant παρουσιάζει καρδινικότητα εκατοντάδων χιλιάδων τιμών και δεν κωδικοποιείται σε one-hot. Η categorie_mcc είναι αριθμητικός ψευδοφίλος: κατηγορική ονοματολογία |
Πρώτη παγίδα — η ακραία ανισορροπία. Με 0,17 % απάτες, ένας ταξινομητής που προβλέπει συστηματικά την απουσία απάτης επιτυγχάνει 99,83 % ορθότητα. Αυτή η μετρική αποκλείεται εξαρχής. Η αξιολόγηση στηρίζεται στην ακρίβεια, την ανάκληση και το εμβαδόν υπό την καμπύλη ακρίβειας-ανάκλησης, καθώς η καμπύλη ROC είναι υπερβολικά αισιόδοξη υπό ακραία ανισορροπία. Το κατώφλι απόφασης γίνεται παράμετρος πλοήγησης διαιτητευόμενη σύμφωνα με το σχετικό κόστος μη ανιχνευμένης απάτης και αδικαιολόγητου αποκλεισμού.
Δεύτερη παγίδα — η επαναλαμβανόμενη οντότητα. Μία κάρτα παράγει πολλές
συναλλαγές. Ένας τυχαίος διαχωρισμός τοποθετεί συναλλαγές της ίδιας κάρτας και
στις δύο πλευρές της διαμέρισης: το μοντέλο μαθαίνει τις συνήθειες κατανάλωσης
καρτών που θα ξαναβρεί στην αξιολόγηση, ενώ η στοχευμένη χρήση συνίσταται στην
κρίση καρτών των οποίων το πρόσφατο ιστορικό δεν έχει μαθευτεί. Η ομαδοποίηση
κατά carte_id είναι υποχρεωτική.
Τρίτη παγίδα — η χρονική σειρά. Τα σχήματα απάτης εξελίσσονται ταχέως, κατά κύματα συνδεδεμένα με ενεργές εκστρατείες. Ένας τυχαίος διαχωρισμός εκπαιδεύει το μοντέλο σε συναλλαγές μεταγενέστερες εκείνων της αξιολόγησης: το μοντέλο γνωρίζει σχήματα που, στην παραγωγή, δεν θα υπήρχαν ακόμη. Ο διαχωρισμός πρέπει να είναι αυστηρά χρονολογικός, με το παράθυρο αξιολόγησης μεταγενέστερο του παραθύρου εκπαίδευσης.
Σημείο προσοχής για τη σώρευση. Οι τρεις περιορισμοί εφαρμόζονται ταυτόχρονα. Ο διαχωρισμός πρέπει να είναι χρονολογικός και να σέβεται τις ομάδες, γεγονός που αποκλείει τους πρότυπους τεμαχισμούς και επιβάλλει ειδική διαδικασία: χρονικός τεμαχισμός και στη συνέχεια αποκλεισμός των καρτών παρόντων και στις δύο πλευρές του συνόρου. Είναι περίπτωση όπου η προκαταρκτική ανάλυση του συνόλου δεδομένων καθορίζει πλήρως την αρχιτεκτονική της επικύρωσης.
Ένας εξεταστής θέλει να αξιολογήσει την ικανότητα υποψηφίου να διαγνώσει σπάνια νόσο.
Αν συνθέσει δοκιμασία όπου μία περίπτωση στις εξακόσιες είναι παθολογική, ένας υποψήφιος που απαντά συστηματικά «υγιές υποκείμενο» επιτυγχάνει 99,8 % ορθές απαντήσεις χωρίς καμία ιατρική ικανότητα. Αυτή είναι η πρώτη παγίδα.
Αν παρουσιάσει στην εξέταση φακέλους ασθενών ήδη συναντηθέντων κατά την κατάρτιση, μετρά τη μνήμη του υποψηφίου και όχι τη διάγνωσή του. Αυτή είναι η δεύτερη παγίδα.
Αν κοινοποιήσει στον υποψήφιο, κατά την κατάρτιση, τις περιπτώσεις που θα εμφανιστούν σε μεταγενέστερη συνεδρία, μετρά ικανότητα που δεν θα υπάρξει ποτέ στην πραγματική άσκηση. Αυτή είναι η τρίτη παγίδα.
Οι τρεις μεροληψίες προστίθενται: μια διάταξη αξιολόγησης που τις σωρεύει παράγει υψηλό σκορ χωρίς καμία προβλεπτική αξία.
Ένα σύνολο 50 000 γραμμών παρουσιάζεται ως περιλαμβάνον 50 000 πελάτες. Στην πραγματικότητα περιλαμβάνει 50 000 συμβάσεις κατανεμημένες σε 12 000 πελάτες. Ο αποτελεσματικός όγκος διαιρείται διά τεσσάρων, ο τυχαίος διαχωρισμός είναι άκυρος και η επαγγελματική εμβέλεια των προβλέψεων δεν είναι εκείνη που ανακοινώθηκε.
Σωστή διατύπωση: «Πριν από κάθε χειρισμό, το ερώτημα προς διερεύνηση είναι τι αντιπροσωπεύει ακριβώς μία γραμμή και αν μπορεί η ίδια οντότητα να εμφανίζεται εκεί πολλές φορές. Η απάντηση καθορίζει τον αποτελεσματικό όγκο, τη στρατηγική διαχωρισμού και την ερμηνεία των προβλέψεων.»
Ένα αναγνωριστικό είναι αυθαίρετο εκ κατασκευής. Δεν έχει καμία ερμηνευτική ικανότητα, συλλαμβάνει τις παραπλανητικές συσχετίσεις που επάγει η σειρά απόδοσης και η σχεδόν μοναδικότητά του επιτρέπει σε μοντέλα υψηλής ικανότητας να απομνημονεύσουν κάθε παρατήρηση.
Σωστή διατύπωση: «Τα αναγνωριστικά αποκλείονται από τις ερμηνευτικές μεταβλητές ενώ διατηρούνται στο σύνολο δεδομένων, για ιχνηλασιμότητα και για ομαδοποίηση κατά τον διαχωρισμό. Όταν ένα αναγνωριστικό κωδικοποιεί επαγγελματική πληροφορία, αυτή εξάγεται σε ειδική μεταβλητή και το ακατέργαστο αναγνωριστικό απορρίπτεται στη συνέχεια.»
Αυτή η εξέταση κοστίζει μία γραμμή κώδικα και καθορίζει τον τύπο προβλήματος, το επίπεδο ανισορροπίας, το μοντέλο αναφοράς, την επιλογή μετρικών και τη στρατηγική διαχωρισμού. Η παράλειψή της οδηγεί στην ερμηνεία ορθότητας 97 % ως επίδοσης, ενώ μπορεί να είναι κατώτερη εκείνης σταθερού ταξινομητή.
Σωστή διατύπωση: «Η κατανομή της μεταβλητής στόχου εξετάζεται πριν από κάθε εκπαίδευση. Καθορίζει το μοντέλο αναφοράς με το οποίο πρέπει να συγκριθεί κάθε μεταγενέστερη επίδοση.»
Ένας ταχυδρομικός κωδικός, ένας κωδικός περιφέρειας, ένας κωδικός προϊόντος ή ένας κωδικός ονοματολογίας αποθηκεύονται ως ακέραιοι και είναι κατηγορικοί στη φύση. Αντιμετωπιζόμενοι ως αριθμητικοί, οδηγούν δέντρο να παράγει διαμερίσεις χωρίς νόημα («ταχυδρομικός κωδικός μικρότερος από 44300») και γραμμικό μοντέλο να υποθέτει μονότονη σχέση μεταξύ αριθμού δήμου και στόχου.
Σωστή διατύπωση: «Ο τύπος αποθήκευσης δεν καθορίζει τη φύση της μεταβλητής. Το κριτήριο είναι το επαγγελματικό νόημα των αριθμητικών πράξεων: αν ο μέσος δύο τιμών δεν δηλώνει τίποτα, η μεταβλητή είναι κατηγορική.»
Ένα αρχείο δεκατεσσάρων στηλών δεν παρέχει δεκατέσσερις ερμηνευτικές μεταβλητές. Παρέχει δεκατέσσερις στήλες των οποίων ο λειτουργικός ρόλος μένει να καθοριστεί: αναγνωριστικό, ερμηνευτική μεταβλητή, μεταβλητή στόχος ή μεταβλητή διαρροής. Οι στήλες διαρροής παράγουν φαινομενική επίδοση κοντά στην τελειότητα στην επικύρωση και μοντέλο χωρίς αξία στην παραγωγή.
Σωστή διατύπωση: «Ο ρόλος κάθε στήλης καθορίζεται ατομικά. Το κριτήριο εισδοχής μεταξύ των ερμηνευτικών μεταβλητών είναι η πραγματική διαθεσιμότητα της τιμής τη στιγμή που πρέπει να παραχθεί η πρόβλεψη.»
Ένα αυστηρό διπλότυπο παρόν και στις δύο πλευρές διαχωρισμού εγγυάται ορθή
πρόβλεψη μέσω απομνημόνευσης και υπερεκτιμά τη μετρούμενη επίδοση. Ένα λειτουργικό
διπλότυπο — ίδια οντότητα, μη ταυτόσημες γραμμές — δεν εντοπίζεται από το
df.duplicated() και απαιτεί επαλήθευση στο επαγγελματικό κλειδί.
Σωστή διατύπωση: «Η επαλήθευση αφορά δύο επίπεδα: τις αυστηρά ταυτόσημες γραμμές και τις γραμμές που δηλώνουν την ίδια οντότητα του πραγματικού κόσμου. Το δεύτερο επίπεδο απαιτεί γνώση του επαγγελματικού κλειδιού και δεν αυτοματοποιείται χωρίς αυτή.»
Ένα εκατομμύριο παρατηρήσεων των οποίων ο στόχος είναι κακώς επισημασμένος, των οποίων οι μεταβλητές είναι μη διαθέσιμες στην παραγωγή, ή των οποίων μία οντότητα αντιπροσωπεύει το 40 % των γραμμών, δεν παράγει καλύτερο μοντέλο από δέκα χιλιάδες καθαρές και ορθά πλαισιωμένες παρατηρήσεις.
Σωστή διατύπωση: «Ο όγκος καθορίζει τη διακύμανση της εκτίμησης. Δεν διορθώνει καμία μεροληψία. Ένα ελάττωμα πλαισίωσης επανευρίσκεται ταυτόσημο σε όλες τις κλίμακες.»
ΔΟΜΗ
Ένα σύνολο δεδομένων είναι πίνακας n × p.
n = αριθμός παρατηρήσεων (οι γραμμές)
p = αριθμός μεταβλητών (οι στήλες)
X = πίνακας ερμηνευτικών μεταβλητών, y = διάνυσμα στόχου
ΟΡΟΛΟΓΙΑ ΤΗΣ ΓΡΑΜΜΗΣ
παρατήρηση · άτομο · στιγμιότυπο · δείγμα (σημασία ML) ·
εγγραφή · γραμμή · παράδειγμα · σημείο δεδομένων
Ένας μόνο όρος είναι ασαφής: δείγμα, που δηλώνει επίσης
υποσύνολο πληθυσμού με τη στατιστική έννοια.
ΟΡΟΛΟΓΙΑ ΤΗΣ ΣΤΗΛΗΣ
μεταβλητή · γνώρισμα · πεδίο · στήλη · διάσταση ·
χαρακτηριστικό · feature · προβλέπων
μεταβλητή και στήλη περιγράφουν· feature χαρακτηρίζει ρόλο.
ΟΙ ΤΕΣΣΕΡΕΙΣ ΛΕΙΤΟΥΡΓΙΚΟΙ ΡΟΛΟΙ ΜΙΑΣ ΣΤΗΛΗΣ
αναγνωριστικό → αποκλεισμός, διατήρηση ως κλειδί
ερμηνευτική μεταβλητή → υποβολή στο μοντέλο
μεταβλητή στόχος → απομόνωση στο y
μεταβλητή διαρροής → αποκλεισμός με απόλυτη προτεραιότητα
ΤΥΠΟΛΟΓΙΑ ΜΕΤΑΒΛΗΤΩΝ
συνεχής αριθμητική · διακριτή αριθμητική
ονομαστική κατηγορική · τακτική κατηγορική · δυαδική
χρονική · κειμενική
Κλίμακες Stevens : ονομαστική · τακτική · διαστήματος · λόγου
ΨΕΥΔΟΦΙΛΟΙ
ταχυδρομικός κωδικός, κωδικός περιφέρειας, κωδικός προϊόντος, κωδικός ονοματολογίας :
αριθμητικοί στην εμφάνιση, κατηγορικοί στη φύση.
ΠΡΩΤΟΚΟΛΛΟ ΑΡΧΙΚΟΥ ΕΛΕΓΧΟΥ
df.shape · df.head() · df.info() · df.describe()
df[cible].value_counts(normalize=True)
df.isnull().sum() · df.duplicated().sum()
ΤΟ ΠΡΩΤΟ ΕΡΩΤΗΜΑ
Τι αντιπροσωπεύει ακριβώς μία γραμμή,
και μπορεί η ίδια οντότητα να εμφανίζεται εκεί πολλές φορές;
Ο ΕΛΕΓΧΟΣ ΜΕ ΤΗΝ ΚΑΛΥΤΕΡΗ ΑΠΟΔΟΣΗ
Η κατανομή της μεταβλητής στόχου.
ΤΟ ΣΗΜΕΙΟ ΠΟΥ ΠΑΡΑΛΕΙΠΕΤΑΙ ΣΥΧΝΟΤΕΡΑ
Θα είναι κάθε ερμηνευτική μεταβλητή διαθέσιμη
τη στιγμή που θα πρέπει να παραχθεί η πρόβλεψη;Δήλωση σύνθεσης
Ένα σύνολο δεδομένων είναι πίνακας του οποίου οι γραμμές είναι παρατηρήσεις και οι στήλες μεταβλητές· η επαγγελματική ανάγνωσή του συνίσταται στο να καθοριστεί τι αντιπροσωπεύει μία γραμμή, να αποδοθεί σε κάθε στήλη λειτουργικός ρόλος αντί να τεκμαίρεται ερμηνευτική, να καταταγεί κάθε μεταβλητή σε τυπολογία που καθορίζει την επεξεργασία της και να επαληθευτεί ότι κάθε κρατημένη μεταβλητή θα είναι πράγματι διαθέσιμη τη στιγμή της πρόβλεψης.
Σχετικά κουίζ
005.1-quiz-jeu-de-donnees.md005.2-quiz-observation-unite-analyse.md005.3-quiz-variable-roles.md005.4-quiz-typologie-variables.md005.5-quiz-inspection-initiale.md005.6-quiz-etudes-de-cas.mdΕπόμενο κεφάλαιο: 006-features-target.md