Évaluation

Valeurs mesurées réelles uniquement. Les métriques de développement sont un retour d'ingénierie, pas une performance finale.

Holdout scellé — résultat interne officiel (configuration gelée)

jeu de données v1.0.0 · split: sealed_holdout · config de risque 2.0.0 (590c0f5443bd) · classifieur: huggingface:protectai/deberta-v3-base-prompt-injection-v2 · 2026-08-07T23:23:08Z

Précision globale
96.2%
Précision
97.5%
Rappel
93.9%
F1
95.7%
Taux de faux positifs
2.0%

Matrice de confusion (attendu → réel)

attendu AUTORISER SIGNALER BLOQUER
AUTORISER 99 0 2
SIGNALER 0 0 0
BLOQUER 5 31 46

Par langue

  • en · n=129 · préc. 94.6% · FPR 3.0% · FNR 7.9%
  • fr · n=54 · préc. 100.0% · FPR 0.0% · FNR 0.0%

Par catégorie d'attaque

  • Tentative d'exfiltration de données DATA_EXFILTRATION · rappel 100.0% (n=13)
  • Instruction dissimulée HIDDEN_INSTRUCTION · rappel 100.0% (n=9)
  • Substitution d'instructions INSTRUCTION_OVERRIDE · rappel 91.7% (n=24)
  • Obfuscation OBFUSCATION · rappel 100.0% (n=5)
  • Instruction de persistance PERSISTENCE_INSTRUCTION · rappel 100.0% (n=5)
  • Détournement de rôle ROLE_HIJACKING · rappel 100.0% (n=6)
  • Extraction du prompt système SYSTEM_PROMPT_EXTRACTION · rappel 100.0% (n=13)
  • Manipulation d'outils TOOL_MANIPULATION · rappel 50.0% (n=6)
  • Demande d'action non autorisée UNAUTHORIZED_ACTION · rappel 100.0% (n=6)

latence p50 33.61 ms · p95 40.94 ms · défaillances détecteurs: 0 · FP 2 · FN 5

Validation — split de calibration (pas une revendication finale)

jeu de données v1.0.0 · split: validation · config de risque 2.0.0 (590c0f5443bd) · classifieur: huggingface:protectai/deberta-v3-base-prompt-injection-v2 · 2026-08-09T05:03:50Z

Précision globale
95.6%
Précision
97.4%
Rappel
92.7%
F1
95.0%
Taux de faux positifs
2.0%

Matrice de confusion (attendu → réel)

attendu AUTORISER SIGNALER BLOQUER
AUTORISER 99 2 0
SIGNALER 0 0 0
BLOQUER 6 49 27

Par langue

  • en · n=129 · préc. 93.8% · FPR 3.0% · FNR 9.5%
  • fr · n=54 · préc. 100.0% · FPR 0.0% · FNR 0.0%

Par catégorie d'attaque

  • Tentative d'exfiltration de données DATA_EXFILTRATION · rappel 84.6% (n=13)
  • Instruction dissimulée HIDDEN_INSTRUCTION · rappel 66.7% (n=9)
  • Substitution d'instructions INSTRUCTION_OVERRIDE · rappel 100.0% (n=24)
  • Obfuscation OBFUSCATION · rappel 100.0% (n=5)
  • Instruction de persistance PERSISTENCE_INSTRUCTION · rappel 80.0% (n=5)
  • Détournement de rôle ROLE_HIJACKING · rappel 100.0% (n=6)
  • Extraction du prompt système SYSTEM_PROMPT_EXTRACTION · rappel 100.0% (n=13)
  • Manipulation d'outils TOOL_MANIPULATION · rappel 100.0% (n=6)
  • Demande d'action non autorisée UNAUTHORIZED_ACTION · rappel 100.0% (n=6)

latence p50 33.46 ms · p95 45.55 ms · défaillances détecteurs: 0 · FP 2 · FN 6

Holdout de référence — avant calibration (v1.0.0)

jeu de données v1.0.0 · split: sealed_holdout · config de risque 1.0.0 (caffd3f5e9d3) · classifieur: huggingface:protectai/deberta-v3-base-prompt-injection-v2 · 2026-08-07T22:52:42Z

Précision globale
60.7%
Précision
54.0%
Rappel
81.7%
F1
65.1%
Taux de faux positifs
56.4%

Matrice de confusion (attendu → réel)

attendu AUTORISER SIGNALER BLOQUER
AUTORISER 44 55 2
SIGNALER 0 0 0
BLOQUER 15 64 3

Par langue

  • en · n=129 · préc. 60.5% · FPR 54.6% · FNR 23.8%
  • fr · n=54 · préc. 61.1% · FPR 60.0% · FNR 0.0%

Par catégorie d'attaque

  • Tentative d'exfiltration de données DATA_EXFILTRATION · rappel 46.2% (n=13)
  • Instruction dissimulée HIDDEN_INSTRUCTION · rappel 100.0% (n=9)
  • Substitution d'instructions INSTRUCTION_OVERRIDE · rappel 100.0% (n=24)
  • Obfuscation OBFUSCATION · rappel 100.0% (n=5)
  • Instruction de persistance PERSISTENCE_INSTRUCTION · rappel 100.0% (n=5)
  • Détournement de rôle ROLE_HIJACKING · rappel 100.0% (n=6)
  • Extraction du prompt système SYSTEM_PROMPT_EXTRACTION · rappel 100.0% (n=13)
  • Manipulation d'outils TOOL_MANIPULATION · rappel 0.0% (n=6)
  • Demande d'action non autorisée UNAUTHORIZED_ACTION · rappel 66.7% (n=6)

latence p50 31.22 ms · p95 36.72 ms · défaillances détecteurs: 0 · FP 57 · FN 15

Arabe — suite exploratoire (NON supporté)

bénins corrects: 0/8 · malveillants corrects: 4/4

protectai deberta-v3 is English-only. Arabic is treated as 'other' by the language sniffer, so the uncalibrated model still scores it: benign Arabic is frequently FLAGged (conservative, review-heavy) while Arabic hard negatives can slip to ALLOW. Arabic is NOT supported; treat all Arabic results as uncertain.