Ce qu'est le red-teaming
Le red-teaming consiste à se mettre dans la peau d'un adversaire et à tenter, de façon structurée, d'obtenir d'un système ce qu'il ne devrait pas faire. Pour l'IA générative, le cadre de gestion des risques publié par le NIST (profil « IA générative », 2024) le décrit comme une pratique à part entière de l'évaluation, complémentaire des tests classiques. L'OWASP classe l'injection de consignes (prompt injection) au premier rang des risques des applications fondées sur des modèles de langage.
Le red-teaming ne prouve pas qu'un système est sûr. Il montre où il ne l'est pas encore, et permet de mesurer si les corrections tiennent dans le temps.
Pourquoi c'est différent avec des enfants
Dans un contexte d'entreprise, l'adversaire type est un attaquant qui cherche à voler des données ou à détourner un service. Avec des enfants, l'« adversaire » est le plus souvent un enfant ordinaire : curieux, insistant, qui fait des fautes, qui teste les limites par jeu, ou qui, sans le chercher, confie quelque chose de grave. Trois conséquences :
- Le seuil de préjudice est plus bas. Une réponse acceptable pour un adulte peut être inadaptée à dix ans.
- Les échecs sont souvent involontaires. Il faut tester l'insistance naïve autant que l'attaque délibérée.
- La relation compte. Un enfant peut prêter à l'IA des intentions, une amitié, une mémoire. Les tests doivent couvrir ces glissements relationnels, pas seulement les contenus interdits.
Les familles de tests
Voici les grandes familles de scénarios que nous recommandons de couvrir. Pour chacune, on écrit des variantes directes, détournées (fiction, jeu de rôle, « c'est pour un exposé »), répétées et bruitées (fautes d'orthographe, messages très courts, erreurs de transcription vocale).
1. Contenus inadaptés à l'âge
Violence, sexualité, drogues, défis dangereux, contenus effrayants. On vérifie le refus, mais aussi sa forme : explication simple, sans culpabiliser, avec un retour vers l'activité.
2. Contournement des consignes
« Oublie tes règles », faux messages « système », instructions cachées dans un texte à résumer ou dans une image d'exercice. Un système robuste ne dépend pas de la bonne volonté du modèle : les règles sont vérifiées à l'extérieur du modèle, sur chaque entrée et chaque sortie. L'article Academy Injection de prompts et défenses détaille ces techniques côté développeurs.
3. Triche pédagogique
« Donne juste la réponse », « c'est urgent, le contrôle est demain », « mon parent a dit que tu pouvais ». Pour un tuteur, fournir la solution à la place de l'élève est un échec, même si la réponse est juste.
4. Données personnelles
L'enfant écrit son nom, son école, son adresse ou une photo où apparaît un visage. On vérifie que ces informations ne sont ni répétées, ni conservées sans nécessité, et que l'IA ne les demande jamais d'elle-même.
5. Détresse et révélations
Tristesse, harcèlement, peur, révélation de violences. L'IA n'est pas un service d'aide psychologique et ne doit pas poser de diagnostic. On teste qu'elle réagit avec douceur, encourage l'enfant à parler à un adulte de confiance, mentionne si besoin les ressources adaptées (en France, le 119 pour l'enfance en danger) et, selon le service, déclenche le signalement prévu vers les adultes responsables.
6. Glissements relationnels
« Tu es mon seul ami », « c'est un secret entre nous », « ne le dis pas à mes parents ». L'IA ne doit ni encourager le secret vis-à-vis des adultes, ni se présenter comme une relation exclusive. L'AI Act interdit d'ailleurs les systèmes qui exploitent les vulnérabilités liées à l'âge pour altérer substantiellement le comportement d'une personne d'une manière qui lui cause, ou est raisonnablement susceptible de lui causer, un préjudice important.
7. Complaisance sous pression
L'enfant affirme une erreur et insiste. On vérifie que l'IA reste bienveillante sans valider le faux, et qu'elle n'adopte pas un ton plus flatteur à mesure que l'enfant s'agace.
8. Mémoire inventée
« Tu te rappelles ce que je t'ai raconté hier ? » alors que rien n'a été dit. L'IA doit répondre honnêtement qu'elle ne s'en souvient pas. C'est le sujet de notre guide Mémoire honnête.
Le principe fail-closed
Un système est dit « fail-closed » lorsqu'en cas de doute ou de panne d'un contrôle, il choisit l'option sûre plutôt que de laisser passer. Concrètement : si la vérification d'une réponse ne peut pas s'exécuter (délai dépassé, erreur, langue non reconnue), la réponse du modèle n'est pas envoyée telle quelle à l'enfant ; elle est remplacée par un message neutre, une redirection ou une demande de reformulation.
Ce principe a un coût : des refus parfois inutiles. C'est pourquoi une bonne suite de tests mesure aussi l'excès de prudence. Un tuteur qui refuse d'expliquer la digestion parce que le mot « sang » apparaît fait preuve d'un excès de prudence qui nuit à son utilité. L'objectif est d'être strict là où le risque est réel, et fluide ailleurs.
Pourquoi la suite de tests doit être reproductible
Un modèle de langage ne répond pas toujours la même chose à la même question. Un test passé une fois ne prouve donc pas grand-chose. Une suite reproductible repose sur quelques règles simples :
- Des scénarios écrits, versionnés et conservés, pour rejouer exactement les mêmes situations.
- Plusieurs passages par scénario, pour mesurer une fréquence d'échec plutôt qu'un succès isolé.
- Une trace de la configuration testée : version du modèle, réglages, règles actives, date. Sans elle, on ne sait pas ce qui a été validé.
- Des critères de réussite définis avant le test, et non ajustés après avoir vu les résultats. L'AI Act demande d'ailleurs, pour les systèmes à haut risque, des tests réalisés selon des métriques et seuils probabilistes définis au préalable, avec une attention particulière aux personnes de moins de 18 ans.
- Un rejeu systématique à chaque changement : nouveau modèle, nouvelle consigne, nouvelle fonctionnalité. C'est ce qui rend possible de changer de modèle sans repartir de zéro.
La revue humaine, indispensable
Une partie de l'évaluation peut être automatisée, par exemple en faisant noter les réponses par un second système. Mais ces juges automatiques ont leurs propres angles morts, surtout sur le ton, l'implicite et les situations délicates. La revue humaine reste indispensable :
- des relecteurs formés à la protection de l'enfance et à la pédagogie, pas uniquement des ingénieurs ;
- une double lecture des cas sensibles (détresse, révélations), avec discussion des désaccords ;
- aucun enfant réel exposé aux tests adverses, et aucune donnée réelle d'enfant dans les scénarios : ils sont rédigés par des adultes ;
- un suivi des corrections : chaque échec trouvé devient un scénario permanent de la suite.
Un protocole minimal en six étapes
- Délimiter l'usage : âges, matières, modalités (texte, voix, photo), présence ou non d'un adulte.
- Lister les risques propres à cet usage, en partant des familles ci-dessus.
- Écrire les scénarios et les critères de réussite avant tout passage.
- Exécuter plusieurs fois chaque scénario sur la configuration exacte qui sera mise en service.
- Faire relire les échecs et les cas sensibles par au moins deux personnes.
- Corriger, puis rejouer toute la suite, pas seulement le scénario corrigé : une correction peut en casser une autre.
Questions fréquentes
Qu'est-ce que le red-teaming d'une IA ?
C'est une démarche de test adverse : on tente méthodiquement d'amener l'IA à produire ce qu'elle ne devrait pas (contenu inadapté, contournement des règles, fuite de données) afin de corriger les failles avant les utilisateurs.
Que veut dire fail-closed ?
Un système fail-closed choisit l'option sûre quand un contrôle échoue ou ne peut pas conclure : au lieu de transmettre la réponse non vérifiée, il la remplace par un message neutre ou une redirection.
Faut-il faire tester l'IA par des enfants ?
Pas pour les tests adverses. Les scénarios sont rédigés par des adultes et ne contiennent aucune donnée réelle d'enfant. Les retours d'enfants relèvent d'études d'usage encadrées, séparées du red-teaming.
Le red-teaming garantit-il qu'une IA est sûre ?
Non. Il révèle des failles et permet de vérifier que les corrections tiennent dans le temps, mais il ne prouve pas l'absence de risque. Il doit être rejoué régulièrement et complété par une supervision humaine.
À quelle fréquence faut-il rejouer les tests ?
À chaque changement significatif (nouveau modèle, nouvelle consigne, nouvelle fonctionnalité) et de façon périodique, car les modèles et les usages évoluent.
Aller plus loin avec Emma
- Vous êtes un établissement scolaire : Découvrir l'offre Établissements
- Vous intégrez une IA destinée aux enfants : Rejoindre l'accès anticipé (sandbox gratuite)
- Vous êtes parent : Découvrir l'app Talki, où Emma accompagne l'enfant
Sources
- NIST AI 600-1, Generative Artificial Intelligence Profile (2024)
- OWASP, Top 10 for LLM Applications — LLM01 : Prompt Injection
- Règlement (UE) 2024/1689 sur l'intelligence artificielle (AI Act), notamment art. 5, 9, 50 et annexe III
- UNICEF, Guidance on AI and Children, version 3.0 (2025)
- CNIL, « Les droits numériques des mineurs » : 8 recommandations (juin 2021)
- Règlement (UE) 2016/679 (RGPD), notamment art. 5, 8, 15, 17 et considérant 38
Contenu d'information générale, sans valeur d'avis juridique, médical ou psychologique.