Αρχική Προϊόν Λύσεις Τιμές Μετρημένη ακρίβεια Ασφάλεια & αρχιτεκτονική Σύγκριση με άλλα εργαλεία Developers Plugins για VS Code και JetBrains Επικοινωνία Σύνδεση

Μετρημένη ακρίβεια

Πώς το filterit μετρά τον εαυτό του

Για: υπεύθυνους προστασίας δεδομένων, ελεγκτές, αξιολογητές ασφάλειας και μηχανικούς που αξιολογούν το προϊόν. Αντικείμενο: η μέθοδος. Οι αριθμοί που παράγει βρίσκονται στη σελίδα ακρίβειας, ο καθένας με την έκδοση της μεθόδου με την οποία μετρήθηκε.

Ένας αριθμός ακρίβειας από έναν προμηθευτή αξίζει ακριβώς όσο η μέθοδος πίσω του. Μέθοδο που δεν μπορείτε να εξετάσετε σημαίνει αριθμό που δεν πρέπει να εμπιστευτείτε, και αυτό ισχύει και για εμάς. Το κείμενο είναι γραμμένο έτσι ώστε ένας ικανός αξιολογητής να βρει πού βάζουμε το χέρι στη ζυγαριά, αν το βάζουμε.


1. Τι είναι το προϊόν, νομικά

Το filterit εφαρμόζει ψευδωνυμοποίηση ως τεχνικό μέτρο κατά το άρθρο 32(1)(α) του ΓΚΠΔ και υποστηρίζει την προστασία δεδομένων ήδη από τον σχεδιασμό κατά το άρθρο 25. Δεν είναι ανωνυμοποίηση: η αντιστοίχιση κάθε υποκατάστατου με την αρχική τιμή διατηρείται, κρυπτογραφημένη, επειδή η επαναφορά της απάντησης του μοντέλου είναι το ίδιο το προϊόν.

Τα ψευδωνυμοποιημένα δεδομένα παραμένουν προσωπικά δεδομένα. Η αιτιολογική σκέψη 26 και το άρθρο 4(5) του ΓΚΠΔ είναι σαφή: δεδομένα που μπορούν να αποδοθούν σε πρόσωπο με τη χρήση πρόσθετων πληροφοριών, και το filterit διατηρεί σκόπιμα αυτές τις πληροφορίες, παραμένουν στο πεδίο εφαρμογής του Κανονισμού.

Η χρήση του filterit δεν βγάζει έναν υπεύθυνο επεξεργασίας έξω από τον ΓΚΠΔ, δεν καταργεί την ανάγκη νομικής βάσης, δεν καταργεί τις υποχρεώσεις διαφάνειας και δεν καλύπτει από μόνη της μια εκτίμηση αντικτύπου. Είναι μέτρο ασφάλειας και ελαχιστοποίησης δεδομένων που μειώνει τι λαμβάνει ένας τρίτος πάροχος μοντέλου. Αυτό είναι κάτι πραγματικό και χρήσιμο. Δεν είναι εξαίρεση.

Οι μετρήσεις που ακολουθούν ποσοτικοποιούν πόσο καλά λειτουργεί αυτό το μέτρο στα σετ αξιολόγησής μας. Δεν πιστοποιούν συμμόρφωση, επειδή καμία μέτρηση δεν μπορεί.


2. Τι μετράμε

Τρία προγράμματα, που αναφέρονται χωριστά και δεν συγχωνεύονται ποτέ σε έναν αριθμό «ακρίβειας», επειδή αποτυγχάνουν με διαφορετικό τρόπο και ένας πελάτης πρέπει να ξέρει ποιο από τα τρία αποτυγχάνει.

Πρόγραμμα Ερώτημα που απαντά Κατάσταση
Ποιότητα ανίχνευσης Από τα προσωπικά δεδομένα που υπάρχουν, πόσα βρίσκονται, και πόσο συνηθισμένο κείμενο καλύπτεται κατά λάθος; Μετριέται, δημοσιεύεται ανά έκδοση στη σελίδα ακρίβειας
Ορθότητα αναστροφής Είναι η απόκρυψη αναστρέψιμη χωρίς απώλεια, και μπορεί ένα υποκατάστατο να επιστρέψει ποτέ λάθος τιμή; Επιβάλλεται ως πύλη στο build (ενότητα 6)
Πιστότητα απάντησης Υποβαθμίζει η απόκρυψη την απάντηση που δίνει το μοντέλο; Μέθοδος σε σχέδιο, δεν έχει μετρηθεί ακόμη, δεν γίνεται κανένας ισχυρισμός

3. Ποιότητα ανίχνευσης

3.1 Η μονάδα μέτρησης

Ένα span: μια συνεχόμενη ακολουθία χαρακτήρων που φέρει ένα προσωπικό δεδομένο, με έναν τύπο (NAME, AFM, IBAN κ.ο.κ.). Τα προβλεπόμενα spans βαθμολογούνται απέναντι σε spans που έχει επισημάνει άνθρωπος.

Όλο το κείμενο κανονικοποιείται σε Unicode NFC πριν υπολογιστεί οποιαδήποτε θέση, και στις δύο πλευρές. Τα ελληνικά έχουν πολλούς τόνους, και το ίδιο όνομα σε αποσυντεθειμένη μορφή μετατοπίζει κάθε επόμενη θέση κατά έναν χαρακτήρα ανά τόνο· η σύγκριση θέσεων μεταξύ διαφορετικών μορφών κανονικοποίησης παράγει σιωπηλές, εύλογες στην όψη ανοησίες. Οι θέσεις είναι δείκτες κωδικών σημείων Unicode, ημιανοιχτά διαστήματα.

3.2 Τρεις τρόποι να βαθμολογηθεί μία πρόβλεψη

Δημοσιεύουμε τρεις αριθμούς ανά σετ και ανά επίπεδο ανίχνευσης, και λέμε ποιον διαβάζει η πύλη της έκδοσης.

Αριθμός Μία πρόβλεψη μετρά όταν έχει Τι σας λέει
EXACT σωστό τύπο και ίδια ακριβώς όρια Ο αριθμός ποιότητας: το υποκατάστατο καλύπτει ακριβώς την τιμή, τίποτα παραπάνω, τίποτα λιγότερο
PARTIAL σωστό τύπο και οποιαδήποτε επικάλυψη χαρακτήρων με το επισημασμένο span Ο αριθμός κάλυψης: η περιοχή αντιμετωπίστηκε ως δεδομένο αυτού του είδους
Leak recall οποιονδήποτε τύπο, με το επισημασμένο span πλήρως μέσα στην πρόβλεψη Ο αριθμός ασφάλειας: ξέφυγε κάτι ακάλυπτο;

Η πύλη της έκδοσης διαβάζει το PARTIAL recall, και το διαβάζει ανά τύπο: στο βαθύ επίπεδο, ένα επισημασμένο span οποιουδήποτε τύπου σε οποιοδήποτε από τα δύο σετ αναφοράς που δεν αγγίζει καμία πρόβλεψη αυτού του τύπου σταματά το build. Το PARTIAL precision έχει επίσης κατώφλι (0,90 στο ελληνικό σετ, 0,95 στο αγγλικό), και στο ελληνικό σετ κάθε τύπος με επισημασμένα spans πρέπει να κρατά EXACT F1 τουλάχιστον 0,90.

Το leak recall αναφέρεται δίπλα τους επειδή η διαφορά ανάμεσα στο leak recall και στην ανάκληση με τύπο είναι εξ ολοκλήρου σύγχυση τύπου: δεδομένα που καλύφθηκαν αλλά χαρακτηρίστηκαν ως κάτι άλλο. Αυτό έχει σημασία για το ίχνος ελέγχου και καμία σημασία για το τι λαμβάνει ο πάροχος του μοντέλου, και η συγχώνευση των δύο σε έναν αριθμό θα παρουσίαζε λάθος όποιον από τους δύο ενδιαφέρει τον αναγνώστη.

Γιατί ο αριθμός διαρροής είναι αυστηρός ως προς την πλήρη κάλυψη και όχι ως προς την επικάλυψη: το filterit δεν εντοπίζει προσωπικά δεδομένα, τα αντικαθιστά. Κάθε επισημασμένος χαρακτήρας που μια πρόβλεψη δεν καλύπτει είναι χαρακτήρας που μένει στο κείμενο που στέλνεται στον πάροχο του μοντέλου. Με κανόνα επικάλυψης 80 τοις εκατό, ένας εννιαψήφιος ΑΦΜ με οκτώ ψηφία καλυμμένα βαθμολογείται ως επιτυχία. Το ΑΦΜ: [AFM_1]3 δεν είναι επιτυχία, και δεν θέλουμε μετρική που λέει ότι είναι.

Δύο συνέπειες, και οι δύο αναφέρονται:

  • Τα συγχωνευμένα spans μετρούν πλήρως. Μία πρόβλεψη που καλύπτει δύο γειτονικά ονόματα του ίδιου τύπου μετρά ως δύο σωστές ανιχνεύσεις. Η περιοχή καλύφθηκε· τίποτα δεν διέρρευσε. Ένας αυστηρότερος κανόνας αντιστοίχισης ένα προς ένα θα υποτιμούσε το προϊόν, και το λάθος προς οποιαδήποτε κατεύθυνση είναι ελάττωμα της μετρικής.
  • Οι αστοχίες ορίων χωρίζονται από τις τυφλές αστοχίες. Μία πρόβλεψη με σωστό τύπο που επικαλύπτει αλλά δεν περιέχει πλήρως το επισημασμένο span μετρά ως αστοχία και ως λάθος εύρημα, σε δική της κατηγορία. Είναι διαφορετική αποτυχία από το να μη δει κανείς τίποτα, και η συγχώνευση των δύο κρύβει ποια από τις δύο συμβαίνει.

3.3 Λάθος ευρήματα, ανά είδος

Δεν κοστίζει το ίδιο κάθε περιττή απόκρυψη, γι' αυτό δεν αθροίζεται σε έναν αριθμό.

Είδος Ορισμός Κόστος για τον πελάτη
Σύγχυση τύπου Σωστή περιοχή, λάθος τύπος Μόνο η ακρίβεια του ίχνους ελέγχου. Τίποτα δεν διέρρευσε, τίποτα δεν χάθηκε
Όρια Σωστός τύπος, ελλιπής κάλυψη Υπολειπόμενοι χαρακτήρες εκτεθειμένοι και ένα ελαφρώς αλλοιωμένο κείμενο
Ανύπαρκτο Δεν υπάρχει εκεί προσωπικό δεδομένο Καθαρή απώλεια χρησιμότητας: συνηθισμένο κείμενο που έγινε υποκατάστατο

Δίπλα στον απλό αριθμό υπολογίζουμε ένα σταθμισμένο ως προς τη χρησιμότητα ποσοστό λάθος ευρημάτων: κάθε λάθος εύρημα σταθμίζεται με το πόσες φορές εμφανίζεται ο όρος στο έγγραφο (με όριο τις δέκα) και με το αν βρίσκεται μέσα στην ίδια την οδηγία του χρήστη αντί στο συνημμένο κείμενο. Η κάλυψη ενός όρου που εμφανίζεται μία φορά σε ένα παράρτημα δεν κοστίζει σχεδόν τίποτα· η κάλυψη ενός όρου που εμφανίζεται δώδεκα φορές ξαναγράφει το λεξιλόγιο του εγγράφου.

Η στάθμιση αυτή είναι υπόθεση για τη βλάβη, όχι μέτρησή της. Οι παράγοντες είναι εύλογοι και ελέγξιμοι, αλλά τίποτα δεν δείχνει ακόμη ότι προβλέπουν πραγματική υποβάθμιση της απάντησης. Ο έλεγχος αυτού απέναντι στη μετρημένη πιστότητα απάντησης είναι προγραμματισμένος· αν η συσχέτιση δεν επιβεβαιωθεί, το σχήμα αντικαθίσταται αντί να υπερασπίζεται.

3.4 Δύο επίπεδα ανίχνευσης, και τα δύο δημοσιευμένα

Το προϊόν τρέχει δύο βάθη της ίδιας διαδικασίας, και ένας αριθμός δεν σημαίνει τίποτα αν δεν λέει ποιο από τα δύο τον παρήγαγε.

Επίπεδο Πού τρέχει Τι περιέχει
Βασικό Το chat, όπου η απάντηση πρέπει να έρθει γρήγορα Η ντετερμινιστική βαθμίδα (επαληθευτές μορφής και ψηφίου ελέγχου, λίστες αναγνωριστικών, λίστες ονομάτων και μορφολογία επωνύμων, συμφραζόμενα, γραμματική διευθύνσεων) και ο στατιστικός αναγνωριστής οντοτήτων
Βαθύ Έγγραφα, σκαναρισμένα αρχεία, οπτική απαλοιφή, πίνακας ελέγχου εγγράφων, συναντήσεις Όλα του βασικού επιπέδου, συν τα μοντέλα transformer για ονόματα και για ελληνικές οντότητες

Η πύλη της έκδοσης διαβάζει το βαθύ επίπεδο. Το βασικό δημοσιεύεται δίπλα του, ενημερωτικά, ώστε ένας χρήστης του chat να βλέπει τι πετυχαίνει το επίπεδο που χρησιμοποιεί και όχι τον καλύτερο αριθμό που μπορεί να παραγάγει το προϊόν.

3.5 Σημείο λειτουργίας: η ακρίβεια δεν αναφέρεται ποτέ μόνη της

Η ακρίβεια (precision) και η ανάκληση (recall) ανταλλάσσονται μεταξύ τους, οπότε ένας αριθμός ακρίβειας χωρίς την ανάκληση στην οποία μετρήθηκε δεν είναι πληροφορία. Κάθε αριθμός που δημοσιεύουμε φέρει τη διαμόρφωσή του: το σετ, την έκδοσή του, το επίπεδο ανίχνευσης, τη λειτουργία επανάληψης και το commit από το οποίο παράχθηκαν οι αριθμοί. Η δημοσιευμένη διαμόρφωση είναι αυτή που τρέχουν οι πελάτες.

Μέρος της ανίχνευσης είναι ντετερμινιστικό: κανόνες ψηφίου ελέγχου και μορφής χωρίς κατώφλι εμπιστοσύνης. Δεν μπορούν να χαμηλώσουν, άρα θέτουν ένα δάπεδο στην ανάκληση και μια οροφή στην ακρίβεια που καμία σάρωση κατωφλίων δεν περνά. Όπου μια διαμόρφωση δεν φτάνει έναν στόχο, αναφέρουμε πού φτάνει. Δεν παρεμβάλλουμε σε στρογγυλότερο αριθμό.

3.6 Απόδοση ανά βαθμίδα ανίχνευσης

Η ανίχνευση έχει τέσσερις βαθμίδες: ντετερμινιστικούς κανόνες, έναν στατιστικό αναγνωριστή, μοντέλα transformer (μόνο στο βαθύ επίπεδο) και έναν προαιρετικό επαληθευτή που παραδίδεται απενεργοποιημένος. Όπου περισσότερες βαθμίδες ανιχνεύουν το ίδιο span, αποδίδεται στην πρώτη βαθμίδα που θα αρκούσε μόνη της, επειδή το ερώτημα που αξίζει να απαντηθεί είναι «ποιες βαθμίδες θα μπορούσαν να κλείσουν χωρίς να χαθεί αυτό;», και η πίστωση του πιο εξελιγμένου εξαρτήματος για spans που ένας κανόνας είχε ήδη βρει θα έκανε κάθε επόμενη απόφαση λάθος.

Για τα λάθος ευρήματα ισχύει η ίδια σειρά, αλλά η απόδοση δεν είναι αποκλειστική: κάθε βαθμίδα που συνέβαλε μετριέται, οπότε τα λάθος ευρήματα ανά βαθμίδα αθροίζουν σε περισσότερα από το σύνολο. Αυτό είναι σκόπιμο και σημειώνεται όπου εμφανίζεται.


4. Τα δεδομένα

4.1 Δύο είδη σετ, αντίθετοι σκοποί

Σετ αναφοράς (gold): επισημασμένα έγγραφα που περιέχουν γνωστά προσωπικά δεδομένα. Μετρούν την ανάκληση. Το ελληνικό σετ καλύπτει ονόματα σε όλες τις πτώσεις, επώνυμα με γένος, κεφαλαία, πεζά, ελληνικά με λατινικούς χαρακτήρες, greeklish, γραμμές με εναλλαγή γλώσσας και τα δομημένα ελληνικά αναγνωριστικά (ΑΦΜ, ΑΜΚΑ, ταυτότητα, IBAN, πινακίδες, τηλέφωνα). Το αγγλικό σετ καλύπτει ονόματα με προσφωνήσεις, αρχικά, μόρια και παύλες, διευθύνσεις, και τα αναγνωριστικά των αγγλόφωνων χωρών. Και τα δύο είναι γραμμένα με το χέρι, και τα δύο μένουν εκτός ρύθμισης: κανένας ανιχνευτής δεν ρυθμίζεται πάνω τους.

Αντιπαραδειγματικό σετ: έγγραφα που δεν περιέχουν προσωπικά δεδομένα αλλά είναι κατασκευασμένα να μοιάζουν ότι περιέχουν. Μετρά την ακρίβεια. Έξι οικογένειες παγίδων: νομικές παραπομπές, επωνυμίες οργανισμών που είναι και επώνυμα, δημόσιοι κωδικοί ταξινόμησης, αριθμοί που μοιάζουν με αναγνωριστικά με ψηφίο ελέγχου, παραλλαγές greeklish και τεχνικά αναγνωριστικά. Κάθε εύρημα σε αυτά τα έγγραφα είναι λάθος εξ ορισμού, με μία εξαίρεση που καταγράφεται ανά παγίδα: μια εταιρεία με όνομα επωνύμου είναι σωστά εταιρεία, και μόνο ο χαρακτηρισμός ως πρόσωπο είναι το λάθος που η παγίδα υπάρχει για να πιάσει.

Το αντιπαραδειγματικό σετ έχει μεγαλύτερη σημασία από όση δείχνει το μέγεθός του. Χωρίς αυτό, η ακρίβεια θα μετριόταν μόνο στα τυχαία λάθος ευρήματα που τυχαίνει να περιέχουν τα σετ αναφοράς, που είναι δείγμα στο οποίο κανείς δεν πρέπει να στηρίξει ισχυρισμό.

4.2 Πώς χτίζεται το αντιπαραδειγματικό σετ, και γιατί οι αριθμοί του είναι αξιόπιστοι

Εξ ολοκλήρου συνθετικό, από ντετερμινιστική γεννήτρια που φυλάσσεται μαζί με το σετ. Η επανεκτέλεσή της αναπαράγει το σετ byte προς byte, και το build συνεχούς ενσωμάτωσης κάνει ακριβώς αυτό σε κάθε αλλαγή, οπότε μια διαφορά σημαίνει ότι άλλαξε η γεννήτρια, όχι ότι αναπαραγάγαμε μέχρι να βελτιωθούν οι αριθμοί.

Οι παγίδες ψηφίου ελέγχου επαληθεύονται με τους πραγματικούς αλγορίθμους κατά το build: ένα «αρνητικό» που αποδεικνύεται πραγματικά έγκυρο αναγνωριστικό σταματά το build, επειδή μία λάθος χαρακτηρισμένη γραμμή δηλητηριάζει όλο τον αριθμό ακρίβειας. Ένα σκόπιμο υποσύνολο ικανοποιεί το ψηφίο ελέγχου (αριθμοί πρωτοκόλλου που περνούν τον έλεγχο ΑΦΜ εκ κατασκευής), επειδή αυτοί απορρίπτονται μόνο από τα συμφραζόμενα, και θέλουμε αυτό να μετριέται αντί να θεωρείται δεδομένο.

Κανένα πραγματικό έγγραφο δεν αντιγράφηκε. Κανένα πραγματικό πρόσωπο, εταιρεία, διεύθυνση, αναγνωριστικό ή αριθμός λογαριασμού δεν εμφανίζεται.

4.3 Ο κανόνας που κρατά το αντιπαραδειγματικό σετ ουσιαστικό

Κανένας ανιχνευτής δεν ρυθμίζεται πάνω του. Τη στιγμή που ένας κανόνας προσαρμόζεται για να περάσει μια συγκεκριμένη παγίδα, το σετ παύει να μετρά ακρίβεια και αρχίζει να μετρά απομνημόνευση.

Επιβάλλεται διαδικαστικά: το δέκα τοις εκατό κρατιέται εκτός και αναφέρεται χωριστά, τα συγκεντρωτικά αποτελέσματα διαβάζονται ανά κατηγορία και όχι ανά γραμμή κατά την ανάπτυξη, και αν μια παγίδα πρέπει να γίνει σήμα εκπαίδευσης, αντιγράφεται σε δοκιμαστικό αρχείο και διαγράφεται από το σετ, με καταγραφή στο commit. Το σετ μικραίνει ορατά αντί να υποβαθμίζεται σιωπηλά. Το σύνολο ελέγχου δημοσιεύεται δίπλα στο κύριο, ώστε ο αναγνώστης να βλέπει αν οι κανόνες μεταφέρονται σε έγγραφα στα οποία δεν μετρήθηκαν.

4.4 Περιπτώσεις που επισημαίνουμε με επιφύλαξη

Ορισμένες περιπτώσεις είναι ζητήματα πολιτικής, όχι τεχνικά, και τις κρατάμε έξω από κάθε μετρική αντί να τις λύνουμε σιωπηλά προς όποια κατεύθυνση κολακεύει το αποτέλεσμα. Σήμερα απομονωμένες: αναφορές σε δημόσια πρόσωπα στη νομολογία, αξιωματούχοι που προσδιορίζονται από το αξίωμα και όχι από το όνομα, και ακαδημαϊκές παραπομπές με πραγματικά επώνυμα. Είναι καταγεγραμμένες και εξαιρούνται, και θα συμπεριληφθούν μόνο όταν η θέση αποφασιστεί και δηλωθεί.

4.5 Πραγματικά έγγραφα

Τρέχουμε επίσης τους ντετερμινιστικούς επαληθευτές σε ένα μικρό σύνολο πραγματικών ελληνικών δημόσιων εγγράφων (σφραγίδες, σκαναρισμένες φόρμες, λεζάντες κάτω από τις τιμές). Κάθε εύρημα γίνεται μόνιμος κανόνας και μόνιμος έλεγχος. Τα έγγραφα αυτά δεν μπορούν να διαμοιραστούν, οπότε οι αριθμοί τους δεν δημοσιεύονται: ένας μη επαληθεύσιμος αριθμός δεν είναι τεκμήριο. Μια πιλοτική δοκιμή στα δικά σας έγγραφα είναι ο τρόπος να δείτε τι κάνει το προϊόν σε αυτά.


5. Αναπαραγωγιμότητα

Ιδιότητα Πώς
Χωρίς δίκτυο στη διαδρομή της μέτρησης Οι αποκρίσεις των υπηρεσιών μοντέλων καταγράφονται μία φορά και επαναλαμβάνονται από αποθηκευμένα αρχεία. Μια μέτρηση δεν μπορεί να επηρεαστεί από το αν μια υπηρεσία είχε καλή μέρα
Ντετερμινιστική Σταθεροί σπόροι, καμία ανάγνωση ρολογιού μέσα σε μετρούμενες διαδρομές, σταθερές ταξινομήσεις παντού
Σετ με έκδοση Κάθε σετ φέρει ρητή έκδοση. Μια αλλαγή που σπάει τη συγκρισιμότητα δημιουργεί νέα έκδοση· η παλιά μένει στον δίσκο ώστε οι ιστορικοί αριθμοί να παραμένουν αναπαραγώγιμοι
Καταγεγραμμένα κατώφλια Τα κατώφλια της πύλης έκδοσης ζουν σε αρχείο υπό έλεγχο εκδόσεων. Το χαμήλωμα ενός κατωφλίου απαιτεί καταγεγραμμένη αιτιολόγηση στο commit που το κάνει
Μία υλοποίηση βαθμολόγησης Ελληνικά και αγγλικά βαθμολογούνται από τον ίδιο κώδικα, οπότε μια σύγκριση μεταξύ γλωσσών δεν συγκρίνει δύο βαθμολογητές
Ο δημοσιευμένος πίνακας δεν αποκλίνει Η σελίδα που διαβάζετε παράγεται από το αποτέλεσμα της μέτρησης, και το build αποτυγχάνει όταν το δημοσιευμένο αρχείο διαφέρει από μια νέα εκτέλεση

6. Ορθότητα αναστροφής

Η αναστρεψιμότητα αντιμετωπίζεται ως αυστηρή αναλλοίωτη ιδιότητα με πύλη στο build, όχι ως μετρική με στόχο. Επαληθεύεται με έλεγχο ιδιοτήτων σε δεκάδες χιλιάδες παραγόμενες εισόδους που καλύπτουν τόνους και στις δύο μορφές κανονικοποίησης, τελικό σίγμα, κεφαλαία, μικτές ελληνικές και λατινικές λέξεις, greeklish, κλιτά επώνυμα, δομημένα αναγνωριστικά, ταυτόχρονη πρόσβαση και ροές απάντησης κομμένες σε κάθε όριο χαρακτήρα.

Ένα αποτέλεσμα ανήκει σε δημόσιο κείμενο μεθόδου επειδή είναι αντίθετο με τη διαίσθηση:

Η επαναφορά δεν είναι πάντα πανομοιότυπη byte προς byte, σκόπιμα. Στα ελληνικά, ένα όνομα που επαναφέρεται κλίνεται ξανά ώστε να συμφωνεί με τα συμφραζόμενά του: όνομα που αποκρύφτηκε στην ονομαστική επαναφέρεται στη γενική μετά από άρθρο γενικής. Χωρίς αυτό, το αποτέλεσμα θα ήταν λάθος ελληνικά.

Άρα η εγγύηση είναι ακριβής: το επαναφερόμενο κείμενο φέρει την ίδια πληροφορία, και ένα υποκατάστατο δεν επιστρέφει ποτέ την τιμή άλλου προσώπου. Δεν είναι «το αποτέλεσμα είναι πανομοιότυπο με την είσοδο», και προτιμούμε να το πούμε παρά να αφήσουμε τον αναγνώστη να υποθέσει ισχυρότερο ισχυρισμό.

Ένα όριο κάλυψης, που δηλώνεται επειδή είναι ουσιώδες: οι ιδιότητες αυτές αποδεικνύονται για το vault στη μνήμη και για το vault της συσκευής. Το vault με βάση δεδομένων της φιλοξενούμενης υπηρεσίας διασφαλίζεται από τον σχεδιασμό και από μοναδιαίους ελέγχους, όχι ακόμη από έλεγχο ιδιοτήτων.


7. Παραγωγή τεκμηρίων

Το προϊόν μπορεί να παραγάγει πακέτο τεκμηρίων συμμόρφωσης από το ίχνος ελέγχου του. Δύο περιορισμοί που δηλώνουμε αντί να περιμένουμε να μας ρωτήσουν:

  • Η αλυσίδα ελέγχου αποδεικνύει ακεραιότητα και σειρά, όχι απόλυτο χρόνο. Μια αλυσίδα κατακερματισμού δείχνει ότι οι γραμμές δεν άλλαξαν ούτε αναδιατάχθηκαν η μία ως προς την άλλη. Δεν αποδεικνύει πότε γράφτηκαν. Δεν υπάρχει σήμερα χρονοσήμανση έμπιστου τρίτου στην κεφαλή της αλυσίδας, οπότε οι χρονικοί ισχυρισμοί του πακέτου στηρίζονται στο ρολόι του διαχειριστή.
  • Η ισχύς της σφράγισης διαφέρει ανά εγκατάσταση. Το πακέτο της συσκευής φέρει υπογραφή δημόσιου κλειδιού που επαληθεύεται χωρίς σύνδεση. Το φιλοξενούμενο πακέτο σφραγίζεται με συμμετρικό κωδικό αυθεντικοποίησης, που σημαίνει ότι επαληθεύεται από τον κάτοχο του κλειδιού, τον διαχειριστή, και όχι ανεξάρτητα από τρίτο. Είναι ασθενέστερη ιδιότητα από όση υπονοεί η λέξη «υπογεγραμμένο» για τους περισσότερους αναγνώστες, και δεν αφήνουμε τη λέξη να κάνει δουλειά που δεν έχει κερδίσει.

8. Τι δεν σας λένε αυτές οι μετρήσεις

Η ενότητα με το μεγαλύτερο βάρος σε αυτό το κείμενο.

Δεν καλύπτεται Γιατί σας αφορά
Η απόδοση στα δικά σας έγγραφα Τα σετ είναι επιμελημένα και συνθετικά. Τα πραγματικά έγγραφα είναι πιο ακατάστατα: θόρυβος σάρωσης, ασυνήθιστες διατάξεις, λεξιλόγιο κλάδου. Ζητήστε πιλοτική δοκιμή στα δικά σας δεδομένα
Εγγύηση ανάκλησης Κανένα σύστημα ανίχνευσης δεν βρίσκει τα πάντα. Υψηλή βαθμολογία σε ένα σετ δεν είναι υπόσχεση για το επόμενο έγγραφο, γι' αυτό το προϊόν σας δείχνει τι βρήκε πριν φύγει οτιδήποτε και σας ζητά να το ελέγξετε
Ό,τι προηγείται της ανίχνευσης Αν η αναγνώριση κειμένου δεν διαβάσει ένα σκαναρισμένο όνομα, η ανίχνευση δεν το βλέπει ποτέ. Η ποιότητα της αναγνώρισης κειμένου είναι χωριστή αποτυχία με χωριστή διόρθωση
Η ποιότητα της απάντησης Το αν η απόκρυψη υποβαθμίζει την απάντηση του μοντέλου είναι χωριστό πρόγραμμα (ενότητα 2) και δεν έχει μετρηθεί ακόμη. Κάθε ισχυρισμός γι' αυτό είναι σήμερα ατεκμηρίωτος, και από εμάς
Τι κάνει ο πάροχος του μοντέλου με τα αποκρυμμένα δεδομένα Εκτός του ελέγχου μας και εκτός της μέτρησής μας. Το filterit μειώνει τι λαμβάνει· δεν λέει τίποτα για το πώς το χειρίζεται
Μέγεθος δείγματος Τα σετ αναφοράς είναι μερικές εκατοντάδες έγγραφα. Αρκούν για να πιάσουν παλινδρομήσεις και δεν αρκούν για ισχυρισμό σε επίπεδο πληθυσμού. Τα μεγέθη δείγματος τυπώνονται δίπλα σε κάθε αριθμό
Συμμόρφωση Είναι μετρήσεις μηχανικής. Μπορούν να στηρίξουν ένα επιχείρημα κατά το άρθρο 32. Δεν μπορούν να το κάνουν για εσάς, και κανένας προμηθευτής δεν μπορεί

9. Τι δημοσιεύουμε και τι όχι

Δημοσιεύεται: αυτή η μέθοδος· τα αποτελέσματα κάθε έκδοσης με το σετ, την έκδοση του σετ, το επίπεδο ανίχνευσης, το μέγεθος δείγματος, τα κατώφλια της πύλης και το commit· τα λάθος ευρήματα του αντιπαραδειγματικού σετ ανά επίπεδο, κύριο σύνολο και σύνολο ελέγχου· το γεγονός και η κατεύθυνση κάθε παλινδρόμησης.

Δεν δημοσιεύεται, και γιατί:

  • Ένας μοναδικός αριθμός ακρίβειας. Η ποιότητα ανίχνευσης, η αναστρεψιμότητα και η πιστότητα απάντησης αποτυγχάνουν διαφορετικά. Ένας αριθμός θα έκρυβε όποιο από τα τρία είναι χειρότερο.
  • Ένας αριθμός ανάκλησης μόνος του. Ανάκληση 1,000 σε επιμελημένο σετ λίγων δεκάδων εγγράφων είναι αληθινή και παραπλανητική. Τυπώνεται πάντα με το σετ της, το μέγεθος δείγματος και την ακρίβειά της.
  • Τα ίδια τα σετ. Τα σετ αναφοράς και το αντιπαραδειγματικό σετ, και η γεννήτρια, μένουν στο αποθετήριο. Η μέθοδος δημοσιεύεται ώστε ένας αξιολογητής να την εφαρμόσει στα δικά του έγγραφα, που είναι η μέτρηση που τον αφορά.
  • Αποτελέσματα σε πραγματικά έγγραφα πελατών. Μη επαληθεύσιμα από τον αναγνώστη και επικίνδυνα για τον πελάτη.
  • Αριθμοί πιστότητας απάντησης πριν η μέθοδος κρίσης βαθμονομηθεί απέναντι σε ανθρώπινη συμφωνία. Ένας αυτόματος κριτής που δεν έχει αποδειχθεί ότι συμφωνεί με άνθρωπο δεν είναι μέτρηση.
  • Ακρίβεια χωρίς την ανάκλησή της, και κάθε αριθμός του οποίου το διάστημα εμπιστοσύνης θα έπρεπε να κρύψουμε για να φαίνεται καλός. Όπου το διάστημα είναι πλατύ, δημοσιεύεται το διάστημα.

10. Έλεγχος αλλαγών

Η μέθοδος αυτή έχει έκδοση. Μια αλλαγή που θα μπορούσε να μετακινήσει έναν αριθμό (ο κανόνας αντιστοίχισης, η ταξινομία, η σύνθεση των σετ, τα επίπεδα, τα κατώφλια της πύλης) αυξάνει την έκδοση και καταγράφεται με αιτιολόγηση. Τα αποτελέσματα δηλώνουν πάντα ποια έκδοση τα παρήγαγε, ώστε ένας αριθμός να μην μπορεί ποτέ να βελτιωθεί σιωπηλά με επαναπροσδιορισμό της μέτρησης από κάτω του.

Έκδοση Ημερομηνία Αλλαγή
1.0 2026-10-07 Πρώτη δημοσιευμένη έκδοση. Τρεις τρόποι βαθμολόγησης με την πύλη στο PARTIAL recall· δύο επίπεδα ανίχνευσης δημοσιευμένα· το αντιπαραδειγματικό σετ ανά επίπεδο με το σύνολο ελέγχου του· τα σετ δεν δημοσιεύονται

Αξιολογητές που βρίσκουν λάθος, αδήλωτη παραδοχή ή σημείο όπου η μέθοδος κολακεύει το προϊόν καλούνται να το πουν μέσω της επαφής στη σελίδα ασφάλειας. Γι' αυτό δημοσιεύεται η μέθοδος.

Ψευδωνυμοποίηση προσωπικών δεδομένων στα ελληνικά και τα αγγλικά.

Προϊόν

  • Προϊόν
  • Πώς δουλεύει
  • Τιμές
  • Μετρημένη ακρίβεια
  • Ασφάλεια & αρχιτεκτονική
  • Σύγκριση με άλλα εργαλεία
  • Επικοινωνία

Λύσεις ανά κλάδο

  • Δικηγορικά γραφεία
  • Λογιστικά γραφεία
  • Τμήματα HR
  • Ιατρεία & κλινικές
  • Δημόσιος τομέας
  • Οδηγός: GDPR checklist για AI
  • Οδηγός: AI χωρίς διαρροή για δικηγόρους

Developers

  • Masking API
  • SDK για Python και Node
  • MCP server
  • Plugins για VS Code και JetBrains
  • Επέκταση browser
  • Πρόσθετο Word
  • Desktop agent

Νομικά

  • Όροι Χρήσης
  • Πολιτική Απορρήτου
  • Πολιτική αποδεκτής χρήσης
  • Ενημέρωση AI
  • Cookies
  • Υποεπεξεργαστές
  • Σύμβαση επεξεργασίας (DPA)

Το filterit εντοπίζει και ψευδωνυμοποιεί ή απαλείφει τα προσωπικά δεδομένα που αναγνωρίζει. Κανένα αυτοματοποιημένο εργαλείο δεν εγγυάται πλήρη κάλυψη: η ακρίβειά μας μετριέται και δημοσιεύεται, και το εργαλείο βελτιώνεται σε κάθε έκδοση. Ελέγχετε τα ευρήματα πριν στείλετε ένα κείμενο, εισάγετε δεδομένα με δική σας ευθύνη και μόνο όπου έχετε το δικαίωμα, και χρησιμοποιείτε την υπηρεσία αποκλειστικά για νόμιμους σκοπούς. Όροι Χρήσης, Πολιτική αποδεκτής χρήσης.

© 2026 filterit. Με επιφύλαξη κάθε δικαιώματος.

ChatGPT, Claude και τα λοιπά ονόματα προϊόντων ανήκουν στους κατόχους τους. Το filterit δεν συνδέεται με τους κατασκευαστές τους ούτε έχει την έγκρισή τους.