Prompt injection
Aussi : injection de prompt
Attaque glissant des instructions malveillantes dans le contenu lu par le modèle.
La prompt injection est une manipulation où des instructions hostiles sont dissimulées dans les données que le modèle ingère — page web, document, requête — pour détourner son comportement. Le modèle confond alors la donnée à traiter et la consigne à exécuter.
Le risque vise surtout les systèmes RAG et les agents qui lisent du contenu externe non maîtrisé. Pour une agence qui récupère et synthétise des sources tierces, la menace est concrète : consignes exfiltrées, ton détourné, liens ou affirmations injectés à l'insu du prompt.
On s'en protège par des guardrails, une séparation stricte entre instructions et données, et la validation systématique des sorties. Isoler la voix dans un système de prompt stable et traiter tout contenu externe comme non fiable réduit fortement la surface d'attaque.

Besoin d’appliquer ce concept sur un cas concret ?
Parler de votre prochaine mission