← Lexique

Prompt injection

Aussi : injection de prompt

Attaque glissant des instructions malveillantes dans le contenu lu par le modèle.

La prompt injection est une manipulation où des instructions hostiles sont dissimulées dans les données que le modèle ingère — page web, document, requête — pour détourner son comportement. Le modèle confond alors la donnée à traiter et la consigne à exécuter.

Le risque vise surtout les systèmes RAG et les agents qui lisent du contenu externe non maîtrisé. Pour une agence qui récupère et synthétise des sources tierces, la menace est concrète : consignes exfiltrées, ton détourné, liens ou affirmations injectés à l'insu du prompt.

On s'en protège par des guardrails, une séparation stricte entre instructions et données, et la validation systématique des sorties. Isoler la voix dans un système de prompt stable et traiter tout contenu externe comme non fiable réduit fortement la surface d'attaque.

Séparer données et instructions ferme la porte à l'injection.
Surface d'attaqueDonnées anonymisées

Besoin d’appliquer ce concept sur un cas concret ?

Parler de votre prochaine mission