Ce que nous mesurons, et comment
Cette page est faite pour les gens qui veulent vérifier avant d'acheter. Elle contient nos chiffres, la méthode qui les produit, et ce qui ne marche pas.
Un nom à moitié masqué est une fuite
La plupart des outils publient un score F1 par token, qui récompense les détections partielles. Masquer « Jean » dans « Jean Dupont » y compte comme une réussite. Pour nous, c'est un échec : le nom de famille est parti chez le fournisseur du modèle.
Une entité n'est protégée que si 100 % de ses caractères significatifs sont masqués. Nous mesurons le taux de fuite, et séparément le taux de sur-masquage, parce que masquer trop dégrade la réponse du modèle sans rien protéger de plus.
Les chiffres
Mesuré le 31 juillet 2026 sur de la correspondance professionnelle française authentique, annotée à la main.
| Jeu de documents | Entités | Fuite | Sur-masquage |
|---|---|---|---|
| Validation, tenue à l'écart | 555 | 3,96 % | 17,7 % |
| Entraînement | 3 576 | 3,30 % | 11,2 % |
| Aveugle, annoté avant exécution | 55 | 5,45 % | 8,0 % |
Par type de donnée
Sur le jeu le plus large, 407 documents.
| Type | Entités | Fuite |
|---|---|---|
| Personnes | 1 037 | 0,00 % |
| Courriels, SIREN, SIRET, TVA, IP | 117 | 0,00 % |
| Adresses web | 168 | 0,60 % |
| Communes | 136 | 1,47 % |
| Adresses postales | 172 | 1,74 % |
| Téléphones | 116 | 2,59 % |
| Dates | 335 | 3,58 % |
| Montants | 240 | 4,58 % |
| Sociétés | 1 227 | 5,70 % |
Face aux autres modèles
Ces chiffres ont été produits en rejouant chaque modèle sur exactement le même jeu que le nôtre, avec le même outil de mesure. C'est la seule façon honnête de comparer : nous avions d'anciens comparatifs, mesurés sur un autre protocole, et les afficher ici nous aurait flattés injustement.
| Modèle seul, sans couches déterministes | Fuite | Sur-masquage |
|---|---|---|
| camembert-ner, le NER français généraliste | 51,5 % | 37,4 % |
| Anonym-IA V2, la référence PII française | 58,7 % | 8,2 % |
| Noirci, le modèle seul | 14,8 % | 11,3 % |
| Noirci, pipeline complet | 3,96 % | 17,7 % |
Comment lire ce tableau sans se tromper
Ces modèles sont généralistes. camembert-ner ne connaît que trois catégories, personnes, organisations et lieux ; il est mécaniquement pénalisé sur les IBAN, les montants ou les dates qu'il n'a jamais appris à voir. La conclusion juste est « meilleur pour cet usage précis », pas « meilleur dans l'absolu ».
Le tableau montre aussi que notre modèle seul, à 14,8 %, ne suffirait pas. Ce sont les couches déterministes qui font tomber le chiffre à 3,96 %. Un bon modèle ne remplace pas une somme de contrôle.
Nous n'affichons que les modèles que nous avons pu rejouer nous-mêmes sur ce jeu. D'autres (GLiNER, piiranha, les modèles cliniques) ont été testés sur un protocole antérieur et ne figurent pas ici tant qu'ils n'y sont pas repassés.
Pourquoi nous ne publions pas de score sur données synthétiques
Nous en avons, et il est flatteur : 0,04 % de fuite. Il ne veut rien dire. Un corpus généré finit par mesurer la capacité à reconnaître son propre générateur, pas à protéger un vrai document. Nos progrès des derniers jours étaient tous invisibles sur ce corpus et bien réels sur la correspondance authentique.
Ce qui ne marche pas
Les montants nus dans un tableau de facture
Un « 200.00 » isolé n'a aucun mot déclencheur à proximité, l'en-tête « Montant » est plusieurs lignes plus haut. L'attraper reviendrait à masquer tout nombre à deux décimales, y compris les numéros de version et les quantités.
Le sur-masquage
Entre 8 et 15 % selon les documents. Environ un mot masqué sur sept l'est inutilement. Ça dégrade un peu la réponse du modèle, sans rien exposer. Un réglage plus discret existe, au prix de trois points de fuite.
Les jours abrégés
« mar. » et « jeu. » ne sont pas reconnus dans les dates. La date elle-même est masquée, seul le préfixe passe. C'est corrigé dans un prochain lot.
Le français, et rien d'autre
Quelques formats anglo-saxons sont couverts parce qu'ils apparaissent dans de la correspondance française, comme les adresses ou les téléphones internationaux. Ce n'est pas un modèle multilingue et nous ne prétendons pas le contraire.
Reproduire ces chiffres
Le harness de mesure, les générateurs et le modèle sont publiés sous licence MIT. Les documents réels restent privés, mais le protocole est public et fonctionne sur vos propres documents annotés.
python -m bench.eval_prive --detector lite2 --gold mes_documents.jsonl
Les liens vers le dépôt et le modèle seront ajoutés ici à la publication.