Jailbreak & guardrail bypass
Contournement des garde-fous du modèle pour obtenir un comportement explicitement interdit. Nous testons notamment les changements de rôle, l’obfuscation et les séquences multi-tours.
CONTRÔLES DE SÛRETÉ
Audit offensif · chatbots · RAG · agents IA connectés
Nous évaluons sa résistance aux jailbreaks, prompt injections directes et indirectes, extractions du prompt système, exfiltrations de contexte RAG et détournements d’outils. Chaque vulnérabilité est reproduite, qualifiée par son impact et accompagnée d’une remédiation.
Audit de sécurité des chatbots et agents IA : jailbreak,
prompt injection, fuite de données et abus d’API.
Nous auditons tous les modèles, plateformes et architectures IA.
EXPERTISES
Un chatbot public, un assistant documentaire et un agent capable d’agir n’exposent ni les mêmes données ni les mêmes conséquences. Chaque périmètre est analysé séparément, puis relié aux risques métier réellement atteignables.
Jailbreak, prompt injection directe, fuite du prompt système, données exposées et contournement des règles conversationnelles.
VOIR L’AUDIT → 02Permissions, mémoire, appels d’outils, API, chaînes multi-agents, validation humaine et actions non autorisées.
VOIR L’AUDIT → 03Différences, vecteurs directs ou indirects, effets observables et contrôles techniques à tester.
COMPRENDRE LES ATTAQUES → 04Documents piégés, empoisonnement des sources, défaut de cloisonnement, retrieval manipulé et exfiltration.
VOIR LES RISQUES RAG →01 — Surface d’attaque LLM
Le modèle reçoit dans un même contexte des instructions de confiance et des données non fiables. Nous vérifions si un attaquant peut exploiter cette confusion pour modifier son comportement, récupérer du contexte confidentiel ou déclencher un outil hors périmètre.
Contournement des garde-fous du modèle pour obtenir un comportement explicitement interdit. Nous testons notamment les changements de rôle, l’obfuscation et les séquences multi-tours.
CONTRÔLES DE SÛRETÉUne instruction hostile est fournie par l’utilisateur — ou dissimulée dans un document, une page web ou un email que le modèle ingère — afin de supplanter les consignes légitimes.
HIÉRARCHIE DES INSTRUCTIONSExtraction totale ou partielle du prompt système : les instructions internes qui définissent le rôle, les interdictions, la logique métier et parfois l’architecture de l’agent.
PROMPT SYSTÈMEIntroduction d’instructions ou de contenus manipulés dans les sources indexées afin d’influencer les réponses, les citations ou les décisions prises à partir du contexte récupéré.
RETRIEVAL & EMBEDDINGSDétournement des connecteurs, fonctions ou API d’un agent. Nous vérifions si ses fonctionnalités, permissions ou son autonomie permettent une action non autorisée.
OUTILS & PRIVILÈGESRecherche de fuite depuis la mémoire, le contexte RAG, les journaux ou une autre session : données personnelles, fragments internes, secrets métier ou informations d’un autre utilisateur.
CONFIDENTIALITÉ DES DONNÉES02 — Protocole de test offensif
Autorisation écrite, périmètre, comptes de test, données interdites, limites opérationnelles et conditions d’arrêt.
Cartographie du prompt système, du modèle, de la mémoire, du pipeline RAG, des outils, des permissions et des frontières de confiance.
Jailbreaks, injections directes et indirectes, obfuscation, attaques multi-tours et variations sémantiques adaptées aux défenses observées.
Nous reproduisons le finding et cherchons si plusieurs faiblesses peuvent être chaînées pour atteindre une donnée, une règle métier ou un outil.
Criticité établie selon l’exploitabilité, les privilèges atteints, les données exposées et la reproductibilité, puis vérification des correctifs.
La couverture est structurée à partir de l’OWASP Top 10 for LLM Applications 2025, de l’OWASP AI Agent Security Cheat Sheet, du NIST AI 100-2e2025, de MITRE ATLAS et des recommandations de l’ANSSI pour les systèmes d’IA générative. Ces références guident le protocole ; elles ne remplacent pas l’analyse propre à votre architecture.
LE LIVRABLE
03 — Offres
La différence entre les offres tient au nombre de vecteurs, à la profondeur multi-tours et aux composants accessibles. Aucun test ne commence sans périmètre et Rules of Engagement validés.
DIAGNOSTIC CHATBOT
Pour un chatbot simple, sans RAG sensible ni capacité d’action sur un système tiers.
AUDIT APPROFONDI
Pour une application LLM métier, un chatbot RAG ou un assistant qui manipule des données internes.
AGENT CONNECTÉ
Pour un agent capable d’appeler des fonctions, API, CRM, messageries, comptes ou workflows métier.
POUR QUI ?
Heldguard intervient lorsque le système dépasse le simple démonstrateur : accès à des documents internes, mémoire utilisateur, logique commerciale, connecteurs ou actions ayant un effet réel.
VOCABULAIRE OFFENSIF
Le jargon n’a de valeur que s’il décrit précisément un mécanisme. Ces définitions sont celles utilisées dans nos findings et pendant la restitution.
04 — Questions techniques
Les deux termes ne décrivent pas exactement la même chose. La prompt injection exploite la confusion entre données et instructions pour modifier le comportement d’une application LLM. Elle peut être directe, dans le message d’un utilisateur, ou indirecte, depuis un document, un email, une page web ou la sortie d’un outil. Le jailbreak vise précisément à neutraliser les règles de sûreté ou d’alignement du modèle afin d’obtenir un comportement normalement refusé. Dans la classification OWASP LLM01, le jailbreak constitue une forme de prompt injection, mais toute prompt injection n’est pas un jailbreak : elle peut aussi détourner un processus métier, exfiltrer des données ou provoquer un appel d’API sans chercher à contourner la modération.
Oui. Nous cherchons l’extraction verbatim, la reconstruction partielle et l’inférence des règles internes par comportement différentiel. Un prompt système doit toutefois être conçu comme une instruction, jamais comme un coffre-fort : aucun secret ou identifiant ne devrait y être stocké.
Dans un environnement autorisé, nous introduisons des contenus de test dans une source contrôlée, puis vérifions si le pipeline de retrieval les isole comme données ou si le modèle les exécute comme instructions. Le finding documente la source, le chemin d’ingestion et l’effet observé.
Nous examinons les frontières de privilèges, la portée des fonctions, la validation des paramètres, la confirmation humaine et les actions réversibles. L’objectif est de déterminer si une sortie manipulée du LLM peut provoquer un appel d’outil non autorisé ou trop puissant.
Uniquement si les Rules of Engagement l’autorisent explicitement. Elles définissent les environnements, comptes, horaires, données interdites, limites de charge et conditions d’arrêt. Un environnement isolé est privilégié lorsqu’une action pourrait affecter des utilisateurs ou des données réelles.
Non. Le rapport décrit un périmètre, une période, des vecteurs et des hypothèses de test. Il apporte des preuves reproductibles et mesure la résistance aux scénarios couverts ; il ne peut démontrer l’absence universelle de vulnérabilité.
05 — PREMIER ÉCHANGE
Indiquez le modèle utilisé, la présence d’un RAG ou d’une mémoire, les outils connectés et les données accessibles. Nous vous proposerons un périmètre de test cohérent avec l’impact potentiel.