Ο καθαρισμός δεδομένων στο SPSS πρέπει να ολοκληρώνεται πριν από κάθε βασικό στατιστικό έλεγχο. Στόχος είναι να εντοπίσεις τιμές που δεν συμφωνούν με τον σχεδιασμό της έρευνας. Πρέπει επίσης να ελέγξεις αν οι μεταβλητές έχουν κωδικοποιηθεί σωστά. Ένα λάθος 99 μπορεί να επηρεάσει έναν μέσο όρο. Μία διπλή καταχώριση μπορεί να αλλάξει το πραγματικό μέγεθος δείγματος. Για αυτό χρειάζεται σταθερό checklist πριν ξεκινήσει η ανάλυση.

Περιεχόμενα άρθρου

1. Καθαρισμός δεδομένων στο SPSS: έλεγξε πρώτα τη δομή του αρχείου

Ξεκίνα από τη βασική δομή της βάσης. Σε μια συνηθισμένη διατομεακή έρευνα κάθε γραμμή αντιστοιχεί σε έναν συμμετέχοντα. Κάθε στήλη αντιστοιχεί σε μία μεταβλητή.

Αν υπάρχουν δύο σειρές τίτλων μέσα στα δεδομένα, αφαίρεσέ τες από το αρχείο ανάλυσης. Το ίδιο ισχύει για κενές γραμμές που δεν αντιπροσωπεύουν πραγματικές περιπτώσεις.

Έλεγξε μετά τα ονόματα των μεταβλητών. Το Q1 ή Q2 μπορεί να λειτουργεί σε μικρό ερωτηματολόγιο. Σε μεγαλύτερη έρευνα χρειάζεται πιο σαφής οργάνωση.

Μια μεταβλητή ηλικίας μπορεί να ονομάζεται AGE. Μια συνολική βαθμολογία άγχους μπορεί να έχει διαφορετικό σύντομο όνομα. Το σημαντικό είναι να χρησιμοποιείς σταθερή λογική.

Στο Variable View έλεγξε και τον τύπο κάθε μεταβλητής. Μία αριθμητική μεταβλητή δεν πρέπει να έχει εισαχθεί κατά λάθος ως κείμενο.

Έλεγξε επίσης το επίπεδο μέτρησης. Το SPSS διακρίνει Nominal, Ordinal και Scale. Η ρύθμιση πρέπει να συμφωνεί με τη φύση της μεταβλητής.

Μια περιοχή κατοικίας είναι ονομαστική μεταβλητή. Μια διατεταγμένη βαθμίδα ικανοποίησης μπορεί να δηλωθεί ως διατακτική. Η ηλικία σε έτη αντιμετωπίζεται συνήθως ως ποσοτική.

Αν δεν έχεις οργανώσει ακόμη τις μεταβλητές, χρειάζεται πρώτα βιβλίο κωδικοποίησης. Αυτό λειτουργεί ως οδηγός για ολόκληρο το αρχείο δεδομένων.

Για τη γενική διαδικασία μπορείς να δεις και τον οδηγό πώς να κάνεις εργασία με το SPSS. Ο καθαρισμός προηγείται των βασικών στατιστικών ελέγχων.

2. Έλεγξε κωδικούς και επιτρεπτές τιμές πριν από την ανάλυση

Το δεύτερο βήμα αφορά το πραγματικό περιεχόμενο κάθε μεταβλητής. Πρέπει να γνωρίζεις ποιες τιμές επιτρέπονται σύμφωνα με το ερωτηματολόγιο.

Ας υποθέσουμε ότι μια ερώτηση Likert επιτρέπει απαντήσεις από 1 έως 5. Αν στον πίνακα εμφανίζεται 7, χρειάζεται διερεύνηση.

Ο γρηγορότερος έλεγχος γίνεται συχνά με πίνακες συχνοτήτων. Επίλεξε Analyze > Descriptive Statistics > Frequencies και εξέτασε τις κατηγορικές μεταβλητές.

Οι πίνακες μπορούν να αποκαλύψουν κωδικούς που δεν θα έπρεπε να υπάρχουν. Μπορούν επίσης να εντοπίσουν λάθη όπως 55 αντί για 5.

Στις ποσοτικές μεταβλητές έλεγξε ελάχιστη και μέγιστη τιμή. Αν η ηλικία του δείγματος πρέπει να είναι τουλάχιστον 18, μια τιμή 8 χρειάζεται έλεγχο.

Μην διορθώνεις όμως μια ασυνήθιστη τιμή χωρίς να γνωρίζεις την πραγματική απάντηση. Αν υπάρχει το αρχικό ερωτηματολόγιο, σύγκρινε την καταχώριση με την πηγή.

Ιδιαίτερη προσοχή χρειάζονται οι αντίστροφα βαθμολογούμενες ερωτήσεις. Πρέπει να έχεις εφαρμόσει την ανακωδικοποίηση πριν δημιουργήσεις συνολική βαθμολογία.

Για παράδειγμα, σε κλίμακα 1 έως 5 μια αντίστροφη ερώτηση μπορεί να απαιτεί μετατροπή του 1 σε 5. Αν παραλείψεις αυτό το βήμα, η συνολική βαθμολογία γίνεται προβληματική.

Διατήρησε κατά προτίμηση την αρχική μεταβλητή. Δημιούργησε νέα μεταβλητή για την αντίστροφη κωδικοποίηση. Έτσι μπορείς να ελέγξεις αργότερα τι ακριβώς άλλαξε.

Το ίδιο ισχύει για κάθε παράγωγη μεταβλητή. Αν δημιουργήσεις συνολικό σκορ, πρέπει να γνωρίζεις ποιες αρχικές ερωτήσεις συμμετέχουν στον υπολογισμό.

3. Στον καθαρισμό δεδομένων στο SPSS έλεγξε ελλιπείς τιμές και διπλές περιπτώσεις

Οι ελλιπείς τιμές χρειάζονται έλεγχο πριν υπολογίσεις οποιοδήποτε τελικό αποτέλεσμα. Ένα κενό δεν σημαίνει πάντα το ίδιο πράγμα.

Κάποιος μπορεί να παρέλειψε μια ερώτηση. Σε άλλη περίπτωση η ερώτηση μπορεί να μην αφορούσε τον συγκεκριμένο συμμετέχοντα.

Πρόσεξε επίσης ειδικούς κωδικούς όπως 99 ή 999. Αν χρησιμοποιούνται για μη απάντηση, πρέπει να δηλωθούν ως ελλιπείς τιμές.

Διαφορετικά το SPSS μπορεί να τους συμπεριλάβει στους υπολογισμούς. Ένας κωδικός 99 μπορεί τότε να επηρεάσει δραματικά τον μέσο όρο.

Τρέξε Frequencies και έλεγξε το Valid N κάθε μεταβλητής. Αν το συνολικό δείγμα είναι 300 αλλά μια μεταβλητή έχει N = 242, χρειάζεται διερεύνηση.

Δεν αρκεί να γνωρίζεις πόσες τιμές λείπουν. Πρέπει να δεις αν συγκεντρώνονται σε συγκεκριμένη μεταβλητή ή ομάδα.

Έλεγξε μετά για πιθανές διπλές περιπτώσεις. Αυτό είναι ιδιαίτερα σημαντικό σε ηλεκτρονικά ερωτηματολόγια. Ο ίδιος συμμετέχων μπορεί να έχει υποβάλει δύο φορές τη φόρμα.

Μια κοινή μεταβλητή ταυτοποίησης μπορεί να βοηθήσει στον εντοπισμό. Μην αφαιρέσεις όμως δύο γραμμές μόνο επειδή έχουν ίδιες δημογραφικές απαντήσεις.

Πρέπει να υπάρχει επαρκής λόγος να θεωρήσεις ότι πρόκειται πραγματικά για διπλή καταχώριση. Η απόφαση πρέπει να στηρίζεται στα διαθέσιμα στοιχεία.

Το UK Data Service χρησιμοποιεί στους ελέγχους ποιότητας αριθμητικών δεδομένων ζητήματα όπως missingness και duplication. Εξετάζει επίσης ακραίες παρατηρήσεις. Δες το QAMyData του UK Data Service.

4. Έλεγξε ακραίες τιμές και ασυνήθιστες παρατηρήσεις

Οι ακραίες τιμές αποτελούν επόμενο βασικό στάδιο στον καθαρισμό. Μια παρατήρηση μπορεί να βρίσκεται πολύ μακριά από τις υπόλοιπες χωρίς να είναι λανθασμένη.

Για αυτό δεν πρέπει να εφαρμόζεις αυτόματη διαγραφή. Πρώτα πρέπει να ελέγξεις αν η τιμή είναι θεωρητικά δυνατή.

Αν μια κλίμακα έχει εύρος 10 έως 50, η τιμή 84 είναι αδύνατη. Μια τιμή 50 μπορεί όμως να είναι απολύτως έγκυρη.

Ένα boxplot αποτελεί χρήσιμο πρώτο εργαλείο. Το SPSS μπορεί να επισημάνει παρατηρήσεις που βρίσκονται αρκετά έξω από το κεντρικό εύρος.

Μπορείς επίσης να εξετάσεις τυποποιημένες τιμές. Πολύ μεγάλες απόλυτες τιμές χρειάζονται προσοχή, αλλά δεν αποτελούν αυτόματο κριτήριο αποκλεισμού.

Αν εντοπίσεις ακραία παρατήρηση, επέστρεψε στην αρχική γραμμή. Έλεγξε αν υπάρχει λάθος πληκτρολόγησης ή λανθασμένη μεταφορά από Excel.

Αν η τιμή είναι πραγματική, συνήθως πρέπει να παραμείνει εκτός αν υπάρχει σαφής μεθοδολογικός λόγος αποκλεισμού. Μην διαγράφεις τιμές επειδή αλλάζουν το p-value.

Εξέτασε επίσης αν η παρατήρηση επηρεάζει σημαντικά τον συγκεκριμένο έλεγχο. Διαφορετικές αναλύσεις έχουν διαφορετική ευαισθησία στις ακραίες τιμές.

Στον Pearson, για παράδειγμα, μία ακραία περίπτωση μπορεί να αλλάξει αισθητά τη συσχέτιση. Σε άλλη μέθοδο η επίδραση μπορεί να είναι μικρότερη.

Ο καθαρισμός δεν σημαίνει ότι κάνεις τα δεδομένα πιο «όμορφα». Σημαίνει ότι ξεχωρίζεις τα πιθανά σφάλματα από την πραγματική μεταβλητότητα του δείγματος.

5. Τελικό checklist πριν από κάθε στατιστικό έλεγχο

Ο καθαρισμός δεδομένων στο SPSS ολοκληρώνεται με έναν τελικό έλεγχο της βάσης. Πρώτα επιβεβαίωσε ότι χρησιμοποιείς τη σωστή έκδοση του αρχείου.

Κράτησε ξεχωριστό αντίγραφο των αρχικών δεδομένων. Μην αποθηκεύεις όλες τις αλλαγές πάνω στο μοναδικό αρχικό αρχείο.

Έλεγξε ξανά τον αριθμό των περιπτώσεων. Επιβεβαίωσε ότι δεν υπάρχουν κενές γραμμές ή ανεπιθύμητες διπλές εγγραφές.

Τρέξε Frequencies στις κατηγορικές μεταβλητές. Αναζήτησε τιμές έξω από τους επιτρεπτούς κωδικούς. Έλεγξε επίσης αν οι ετικέτες Values είναι σωστές.

Στις ποσοτικές μεταβλητές έλεγξε το ελάχιστο και το μέγιστο. Οι τιμές πρέπει να συμφωνούν με το πραγματικό εύρος της μεταβλητής.

Έλεγξε το πλήθος των ελλιπών τιμών. Μετά αποφάσισε πώς θα τις χειριστεί η συγκεκριμένη ανάλυση. Μην εφαρμόζεις την ίδια λύση σε κάθε μεταβλητή.

Επιβεβαίωσε ότι οι αντίστροφες ερωτήσεις έχουν κωδικοποιηθεί σωστά. Μετά έλεγξε τους τύπους των συνολικών βαθμολογιών.

Κάνε επίσης έναν πρώτο έλεγχο της κατανομής. Ιστόγραμμα και boxplot μπορούν να αποκαλύψουν προβλήματα που δεν φαίνονται στον πίνακα δεδομένων.

Μετά τον καθαρισμό ξεκινά ο έλεγχος των προϋποθέσεων της συγκεκριμένης ανάλυσης. Η κανονικότητα ή η ομοιογένεια δεν αποτελούν γενικό καθαρισμό δεδομένων.

Αποτελούν ελέγχους που σχετίζονται με συγκεκριμένες στατιστικές μεθόδους. Για αυτό πρέπει να προηγηθεί η βασική ποιότητα της βάσης.

Αποθήκευσε τέλος ένα νέο αρχείο με σαφή ονομασία. Για παράδειγμα, μπορείς να χρησιμοποιήσεις διαφορετική έκδοση για τα καθαρισμένα δεδομένα.

Η τεκμηρίωση κάθε αλλαγής είναι επίσης χρήσιμη. Αν διορθώσεις μία καταχώριση, σημείωσε τι άλλαξε και γιατί. Έτσι μπορείς να αναπαράγεις τη διαδικασία αργότερα.

Αν η εργασία σου έχει μεγαλύτερο ποσοτικό μέρος, δες τη σελίδα για στατιστικές αναλύσεις. Η σωστή ανάλυση ξεκινά πάντα από σωστά προετοιμασμένα δεδομένα.

Χρειάζεσαι βοήθεια με τον καθαρισμό δεδομένων στο SPSS;

Αν χρειάζεσαι βοήθεια με τη στατιστική ανάλυση της πτυχιακής σου, στείλε το αρχείο δεδομένων. Στείλε επίσης τα ερευνητικά ερωτήματα και ό,τι άλλο έχεις στη διάθεσή σου.

Μπορείς να συμβουλευτείς τις ενδεικτικές τιμές για μια πρώτη εικόνα. Η τελική κοστολόγηση εξαρτάται από τα δεδομένα. Εξαρτάται επίσης από την πολυπλοκότητα της απαιτούμενης ανάλυσης.

Για συγκεκριμένη εκτίμηση, συμπλήρωσε τη φόρμα κοστολόγησης και επισύναψε τα διαθέσιμα αρχεία. Αν χρειάζεσαι πρώτα διευκρίνιση, μπορείς να επικοινωνήσεις μαζί μας.

Σύνδεση

Εγγραφή

Επαναφορά κωδικού

Πληκτρολογήστε το ψευδώνυμο ή την ηλ. διεύθυνσή σας και θα σας αποσταλεί σύνδεσμος να δημιουργήσετε νέο συνθηματικό.