Noirci
Mesures

Ce que nous mesurons, et comment

Cette page est faite pour les gens qui veulent vérifier avant d'acheter. Elle contient nos chiffres, la méthode qui les produit, et ce qui ne marche pas.

Un nom à moitié masqué est une fuite

La plupart des outils publient un score F1 par token, qui récompense les détections partielles. Masquer « Jean » dans « Jean Dupont » y compte comme une réussite. Pour nous, c'est un échec : le nom de famille est parti chez le fournisseur du modèle.

Une entité n'est protégée que si 100 % de ses caractères significatifs sont masqués. Nous mesurons le taux de fuite, et séparément le taux de sur-masquage, parce que masquer trop dégrade la réponse du modèle sans rien protéger de plus.

Les chiffres

Mesuré le 31 juillet 2026 sur de la correspondance professionnelle française authentique, annotée à la main.

Jeu de documents Entités Fuite Sur-masquage
Validation, tenue à l'écart5553,96 %17,7 %
Entraînement3 5763,30 %11,2 %
Aveugle, annoté avant exécution555,45 %8,0 %

Par type de donnée

Sur le jeu le plus large, 407 documents.

Type Entités Fuite
Personnes1 0370,00 %
Courriels, SIREN, SIRET, TVA, IP1170,00 %
Adresses web1680,60 %
Communes1361,47 %
Adresses postales1721,74 %
Téléphones1162,59 %
Dates3353,58 %
Montants2404,58 %
Sociétés1 2275,70 %

Face aux autres modèles

Ces chiffres ont été produits en rejouant chaque modèle sur exactement le même jeu que le nôtre, avec le même outil de mesure. C'est la seule façon honnête de comparer : nous avions d'anciens comparatifs, mesurés sur un autre protocole, et les afficher ici nous aurait flattés injustement.

Modèle seul, sans couches déterministes Fuite Sur-masquage
camembert-ner, le NER français généraliste 51,5 %37,4 %
Anonym-IA V2, la référence PII française 58,7 %8,2 %
Noirci, le modèle seul 14,8 %11,3 %
Noirci, pipeline complet 3,96 %17,7 %

Comment lire ce tableau sans se tromper

Ces modèles sont généralistes. camembert-ner ne connaît que trois catégories, personnes, organisations et lieux ; il est mécaniquement pénalisé sur les IBAN, les montants ou les dates qu'il n'a jamais appris à voir. La conclusion juste est « meilleur pour cet usage précis », pas « meilleur dans l'absolu ».

Le tableau montre aussi que notre modèle seul, à 14,8 %, ne suffirait pas. Ce sont les couches déterministes qui font tomber le chiffre à 3,96 %. Un bon modèle ne remplace pas une somme de contrôle.

Nous n'affichons que les modèles que nous avons pu rejouer nous-mêmes sur ce jeu. D'autres (GLiNER, piiranha, les modèles cliniques) ont été testés sur un protocole antérieur et ne figurent pas ici tant qu'ils n'y sont pas repassés.

Pourquoi nous ne publions pas de score sur données synthétiques

Nous en avons, et il est flatteur : 0,04 % de fuite. Il ne veut rien dire. Un corpus généré finit par mesurer la capacité à reconnaître son propre générateur, pas à protéger un vrai document. Nos progrès des derniers jours étaient tous invisibles sur ce corpus et bien réels sur la correspondance authentique.

Ce qui ne marche pas

Les montants nus dans un tableau de facture

Un « 200.00 » isolé n'a aucun mot déclencheur à proximité, l'en-tête « Montant » est plusieurs lignes plus haut. L'attraper reviendrait à masquer tout nombre à deux décimales, y compris les numéros de version et les quantités.

Le sur-masquage

Entre 8 et 15 % selon les documents. Environ un mot masqué sur sept l'est inutilement. Ça dégrade un peu la réponse du modèle, sans rien exposer. Un réglage plus discret existe, au prix de trois points de fuite.

Les jours abrégés

« mar. » et « jeu. » ne sont pas reconnus dans les dates. La date elle-même est masquée, seul le préfixe passe. C'est corrigé dans un prochain lot.

Le français, et rien d'autre

Quelques formats anglo-saxons sont couverts parce qu'ils apparaissent dans de la correspondance française, comme les adresses ou les téléphones internationaux. Ce n'est pas un modèle multilingue et nous ne prétendons pas le contraire.

Reproduire ces chiffres

Le harness de mesure, les générateurs et le modèle sont publiés sous licence MIT. Les documents réels restent privés, mais le protocole est public et fonctionne sur vos propres documents annotés.

python -m bench.eval_prive --detector lite2 --gold mes_documents.jsonl

Les liens vers le dépôt et le modèle seront ajoutés ici à la publication.

Essayer sur votre texte