Évaluation
Valeurs mesurées réelles uniquement. Les métriques de développement sont un retour d'ingénierie, pas une performance finale.
Holdout scellé — résultat interne officiel (configuration gelée)
jeu de données v1.0.0 · split: sealed_holdout · config de risque 2.0.0 (590c0f5443bd) · classifieur: huggingface:protectai/deberta-v3-base-prompt-injection-v2 · 2026-08-07T23:23:08Z
- Précision globale
- 96.2%
- Précision
- 97.5%
- Rappel
- 93.9%
- F1
- 95.7%
- Taux de faux positifs
- 2.0%
Matrice de confusion (attendu → réel)
| attendu | AUTORISER | SIGNALER | BLOQUER |
|---|---|---|---|
| AUTORISER | 99 | 0 | 2 |
| SIGNALER | 0 | 0 | 0 |
| BLOQUER | 5 | 31 | 46 |
Par langue
- en · n=129 · préc. 94.6% · FPR 3.0% · FNR 7.9%
- fr · n=54 · préc. 100.0% · FPR 0.0% · FNR 0.0%
Par catégorie d'attaque
- Tentative d'exfiltration de données DATA_EXFILTRATION · rappel 100.0% (n=13)
- Instruction dissimulée HIDDEN_INSTRUCTION · rappel 100.0% (n=9)
- Substitution d'instructions INSTRUCTION_OVERRIDE · rappel 91.7% (n=24)
- Obfuscation OBFUSCATION · rappel 100.0% (n=5)
- Instruction de persistance PERSISTENCE_INSTRUCTION · rappel 100.0% (n=5)
- Détournement de rôle ROLE_HIJACKING · rappel 100.0% (n=6)
- Extraction du prompt système SYSTEM_PROMPT_EXTRACTION · rappel 100.0% (n=13)
- Manipulation d'outils TOOL_MANIPULATION · rappel 50.0% (n=6)
- Demande d'action non autorisée UNAUTHORIZED_ACTION · rappel 100.0% (n=6)
latence p50 33.61 ms · p95 40.94 ms · défaillances détecteurs: 0 · FP 2 · FN 5
Validation — split de calibration (pas une revendication finale)
jeu de données v1.0.0 · split: validation · config de risque 2.0.0 (590c0f5443bd) · classifieur: huggingface:protectai/deberta-v3-base-prompt-injection-v2 · 2026-08-09T05:03:50Z
- Précision globale
- 95.6%
- Précision
- 97.4%
- Rappel
- 92.7%
- F1
- 95.0%
- Taux de faux positifs
- 2.0%
Matrice de confusion (attendu → réel)
| attendu | AUTORISER | SIGNALER | BLOQUER |
|---|---|---|---|
| AUTORISER | 99 | 2 | 0 |
| SIGNALER | 0 | 0 | 0 |
| BLOQUER | 6 | 49 | 27 |
Par langue
- en · n=129 · préc. 93.8% · FPR 3.0% · FNR 9.5%
- fr · n=54 · préc. 100.0% · FPR 0.0% · FNR 0.0%
Par catégorie d'attaque
- Tentative d'exfiltration de données DATA_EXFILTRATION · rappel 84.6% (n=13)
- Instruction dissimulée HIDDEN_INSTRUCTION · rappel 66.7% (n=9)
- Substitution d'instructions INSTRUCTION_OVERRIDE · rappel 100.0% (n=24)
- Obfuscation OBFUSCATION · rappel 100.0% (n=5)
- Instruction de persistance PERSISTENCE_INSTRUCTION · rappel 80.0% (n=5)
- Détournement de rôle ROLE_HIJACKING · rappel 100.0% (n=6)
- Extraction du prompt système SYSTEM_PROMPT_EXTRACTION · rappel 100.0% (n=13)
- Manipulation d'outils TOOL_MANIPULATION · rappel 100.0% (n=6)
- Demande d'action non autorisée UNAUTHORIZED_ACTION · rappel 100.0% (n=6)
latence p50 33.46 ms · p95 45.55 ms · défaillances détecteurs: 0 · FP 2 · FN 6
Holdout de référence — avant calibration (v1.0.0)
jeu de données v1.0.0 · split: sealed_holdout · config de risque 1.0.0 (caffd3f5e9d3) · classifieur: huggingface:protectai/deberta-v3-base-prompt-injection-v2 · 2026-08-07T22:52:42Z
- Précision globale
- 60.7%
- Précision
- 54.0%
- Rappel
- 81.7%
- F1
- 65.1%
- Taux de faux positifs
- 56.4%
Matrice de confusion (attendu → réel)
| attendu | AUTORISER | SIGNALER | BLOQUER |
|---|---|---|---|
| AUTORISER | 44 | 55 | 2 |
| SIGNALER | 0 | 0 | 0 |
| BLOQUER | 15 | 64 | 3 |
Par langue
- en · n=129 · préc. 60.5% · FPR 54.6% · FNR 23.8%
- fr · n=54 · préc. 61.1% · FPR 60.0% · FNR 0.0%
Par catégorie d'attaque
- Tentative d'exfiltration de données DATA_EXFILTRATION · rappel 46.2% (n=13)
- Instruction dissimulée HIDDEN_INSTRUCTION · rappel 100.0% (n=9)
- Substitution d'instructions INSTRUCTION_OVERRIDE · rappel 100.0% (n=24)
- Obfuscation OBFUSCATION · rappel 100.0% (n=5)
- Instruction de persistance PERSISTENCE_INSTRUCTION · rappel 100.0% (n=5)
- Détournement de rôle ROLE_HIJACKING · rappel 100.0% (n=6)
- Extraction du prompt système SYSTEM_PROMPT_EXTRACTION · rappel 100.0% (n=13)
- Manipulation d'outils TOOL_MANIPULATION · rappel 0.0% (n=6)
- Demande d'action non autorisée UNAUTHORIZED_ACTION · rappel 66.7% (n=6)
latence p50 31.22 ms · p95 36.72 ms · défaillances détecteurs: 0 · FP 57 · FN 15
Arabe — suite exploratoire (NON supporté)
bénins corrects: 0/8 · malveillants corrects: 4/4
protectai deberta-v3 is English-only. Arabic is treated as 'other' by the language sniffer, so the uncalibrated model still scores it: benign Arabic is frequently FLAGged (conservative, review-heavy) while Arabic hard negatives can slip to ALLOW. Arabic is NOT supported; treat all Arabic results as uncertain.