Que sont les garde-fous (guardrails) de l'IA ?
Les garde-fous sont des contrôles au moment de l'exécution (runtime) qui limitent ce qui entre et sort d'un système d'IA, garantissant un comportement sûr, conforme aux politiques et réglementations. Ils vérifient et filtrent les entrées et les sorties, valident les actions des outils, bloquent les contenus non autorisés et imposent des limites, agissant comme une couche de sécurité autour du modèle. Les garde-fous constituent un contrôle opérationnel de premier plan dans la gouvernance de l'IA et une défense clé contre les abus et l'injection de prompts.
Définition
Les garde-fous de l'IA sont des protections au moment de l'exécution qui valident, filtrent ou limitent les entrées, les sorties et les actions d'un modèle afin de maintenir son comportement sûr, conforme et respectueux des politiques définies.
Points clés
- Les garde-fous agissent au moment de l'exécution sur les entrées, les sorties et les actions.
- Ils garantissent la sécurité, la conformité et le respect des politiques, et non la qualité du modèle.
- Types : filtrage des entrées, validation des sorties, listes d'autorisation d'actions, limites.
- Une défense essentielle contre les abus et l'injection de prompts.
- Les garde-fous complètent l'évaluation et la surveillance, mais ne les remplacent pas.
Contexte
Un modèle seul n'a pas de limites applicables ; il tentera de répondre à tout ce que le prompt suscite. Les garde-fous ajoutent ces limites de manière opérationnelle : des vérifications déterministes ou basées sur des modèles qui s'interposent entre l'utilisateur, le modèle et les systèmes avec lesquels il peut interagir.
C'est ainsi que les politiques de gouvernance deviennent des contrôles actifs. Une politique stipulant « ne jamais exposer de données personnelles (PII) » ou « ne jamais exécuter de paiements sans approbation » se concrétise sous la forme d'un garde-fou qui vérifie et bloque réellement au moment de l'exécution.
Architecture
Les garde-fous d'entrée filtrent les prompts (par exemple, pour détecter les injections, les violations de politiques, les PII). Les garde-fous de sortie valident les réponses (format, sécurité, contraintes factuelles, masquage des PII). Les garde-fous d'action contrôlent les appels d'outils à l'aide d'autorisations et de listes d'autorisation. Les limites de débit, de portée et de budget restreignent le rayon d'impact (blast radius).
Les garde-fous peuvent être déterministes (règles, schémas, regex, listes d'autorisation) ou basés sur des modèles (un classificateur ou un LLM juge). Ils s'associent à l'observabilité pour consigner les violations et à l'approbation humaine (human-in-the-loop) pour les actions à fort impact.
Composants
Avantages
- Applique la sécurité et les politiques au moment de l'exécution, et pas seulement sous forme de directives.
- Réduit les abus, les sorties non sécurisées et l'impact des injections.
- Opérationnalise les exigences de gouvernance et de conformité.
- Limite le rayon d'impact (blast radius) des actions des agents.
Risques
- Un blocage excessif nuit à l'utilité (faux positifs).
- Un blocage insuffisant crée un faux sentiment de sécurité.
- Les garde-fous basés sur des modèles ajoutent de la latence et des coûts.
- Ils ne constituent pas une défense complète ; combinez-les avec de la surveillance et des évaluations (evals).
Outils et technologies
Exemples
- Masquer les données personnelles de la sortie d'un modèle avant qu'elle ne soit affichée.
- Bloquer un appel d'outil qui ne figure pas dans une liste d'autorisation d'actions sûres.
- Rejeter les réponses qui ne correspondent pas à un schéma JSON requis.
FAQ
- Les garde-fous sont-ils identiques à l'alignement ?
- Non. L'alignement façonne le comportement intrinsèque du modèle pendant l'entraînement ; les garde-fous sont des contrôles externes au moment de l'exécution autour du système déployé. Ils sont complémentaires.
- Les garde-fous empêchent-ils l'injection de prompts ?
- Ils réduisent son impact — le filtrage des entrées et les listes d'autorisation d'actions y contribuent — mais aucun garde-fou ne prévient totalement l'injection. Utilisez des défenses multicouches ainsi qu'une approbation humaine pour les actions sensibles.
- Garde-fous déterministes ou basés sur des modèles ?
- Les deux. Les vérifications déterministes (schémas, listes d'autorisation) sont peu coûteuses et fiables pour des règles claires ; les vérifications basées sur des modèles gèrent les contenus nuancés au détriment de la latence.
- Comment les garde-fous s'intègrent-ils dans la gouvernance de l'IA ?
- Ils constituent la couche opérationnelle : les contrôles au moment de l'exécution qui transforment les politiques de gouvernance en comportements appliqués, attestés par la journalisation et l'audit.