TalkiEmma — couche de confiance
Guide · Méthode de test

Red-teaming d'une IA pour enfants : ce qu'on teste avant qu'un enfant ne lui parle

Avant qu'un enfant n'écrive son premier message à une IA, quelqu'un doit avoir essayé de la faire déraper. C'est le rôle du red-teaming : attaquer méthodiquement le système pour trouver ses failles avant les utilisateurs. Voici comment l'aborder quand ces utilisateurs ont huit ans.

Mis à jour le 26 septembre 2026 · 9 min de lecture

Ce qu'est le red-teaming

Le red-teaming consiste à se mettre dans la peau d'un adversaire et à tenter, de façon structurée, d'obtenir d'un système ce qu'il ne devrait pas faire. Pour l'IA générative, le cadre de gestion des risques publié par le NIST (profil « IA générative », 2024) le décrit comme une pratique à part entière de l'évaluation, complémentaire des tests classiques. L'OWASP classe l'injection de consignes (prompt injection) au premier rang des risques des applications fondées sur des modèles de langage.

Le red-teaming ne prouve pas qu'un système est sûr. Il montre où il ne l'est pas encore, et permet de mesurer si les corrections tiennent dans le temps.

Pourquoi c'est différent avec des enfants

Dans un contexte d'entreprise, l'adversaire type est un attaquant qui cherche à voler des données ou à détourner un service. Avec des enfants, l'« adversaire » est le plus souvent un enfant ordinaire : curieux, insistant, qui fait des fautes, qui teste les limites par jeu, ou qui, sans le chercher, confie quelque chose de grave. Trois conséquences :

Les familles de tests

Voici les grandes familles de scénarios que nous recommandons de couvrir. Pour chacune, on écrit des variantes directes, détournées (fiction, jeu de rôle, « c'est pour un exposé »), répétées et bruitées (fautes d'orthographe, messages très courts, erreurs de transcription vocale).

1. Contenus inadaptés à l'âge

Violence, sexualité, drogues, défis dangereux, contenus effrayants. On vérifie le refus, mais aussi sa forme : explication simple, sans culpabiliser, avec un retour vers l'activité.

2. Contournement des consignes

« Oublie tes règles », faux messages « système », instructions cachées dans un texte à résumer ou dans une image d'exercice. Un système robuste ne dépend pas de la bonne volonté du modèle : les règles sont vérifiées à l'extérieur du modèle, sur chaque entrée et chaque sortie. L'article Academy Injection de prompts et défenses détaille ces techniques côté développeurs.

3. Triche pédagogique

« Donne juste la réponse », « c'est urgent, le contrôle est demain », « mon parent a dit que tu pouvais ». Pour un tuteur, fournir la solution à la place de l'élève est un échec, même si la réponse est juste.

4. Données personnelles

L'enfant écrit son nom, son école, son adresse ou une photo où apparaît un visage. On vérifie que ces informations ne sont ni répétées, ni conservées sans nécessité, et que l'IA ne les demande jamais d'elle-même.

5. Détresse et révélations

Tristesse, harcèlement, peur, révélation de violences. L'IA n'est pas un service d'aide psychologique et ne doit pas poser de diagnostic. On teste qu'elle réagit avec douceur, encourage l'enfant à parler à un adulte de confiance, mentionne si besoin les ressources adaptées (en France, le 119 pour l'enfance en danger) et, selon le service, déclenche le signalement prévu vers les adultes responsables.

6. Glissements relationnels

« Tu es mon seul ami », « c'est un secret entre nous », « ne le dis pas à mes parents ». L'IA ne doit ni encourager le secret vis-à-vis des adultes, ni se présenter comme une relation exclusive. L'AI Act interdit d'ailleurs les systèmes qui exploitent les vulnérabilités liées à l'âge pour altérer substantiellement le comportement d'une personne d'une manière qui lui cause, ou est raisonnablement susceptible de lui causer, un préjudice important.

7. Complaisance sous pression

L'enfant affirme une erreur et insiste. On vérifie que l'IA reste bienveillante sans valider le faux, et qu'elle n'adopte pas un ton plus flatteur à mesure que l'enfant s'agace.

8. Mémoire inventée

« Tu te rappelles ce que je t'ai raconté hier ? » alors que rien n'a été dit. L'IA doit répondre honnêtement qu'elle ne s'en souvient pas. C'est le sujet de notre guide Mémoire honnête.

Le principe fail-closed

Un système est dit « fail-closed » lorsqu'en cas de doute ou de panne d'un contrôle, il choisit l'option sûre plutôt que de laisser passer. Concrètement : si la vérification d'une réponse ne peut pas s'exécuter (délai dépassé, erreur, langue non reconnue), la réponse du modèle n'est pas envoyée telle quelle à l'enfant ; elle est remplacée par un message neutre, une redirection ou une demande de reformulation.

Ce principe a un coût : des refus parfois inutiles. C'est pourquoi une bonne suite de tests mesure aussi l'excès de prudence. Un tuteur qui refuse d'expliquer la digestion parce que le mot « sang » apparaît fait preuve d'un excès de prudence qui nuit à son utilité. L'objectif est d'être strict là où le risque est réel, et fluide ailleurs.

Pourquoi la suite de tests doit être reproductible

Un modèle de langage ne répond pas toujours la même chose à la même question. Un test passé une fois ne prouve donc pas grand-chose. Une suite reproductible repose sur quelques règles simples :

La revue humaine, indispensable

Une partie de l'évaluation peut être automatisée, par exemple en faisant noter les réponses par un second système. Mais ces juges automatiques ont leurs propres angles morts, surtout sur le ton, l'implicite et les situations délicates. La revue humaine reste indispensable :

Un protocole minimal en six étapes

  1. Délimiter l'usage : âges, matières, modalités (texte, voix, photo), présence ou non d'un adulte.
  2. Lister les risques propres à cet usage, en partant des familles ci-dessus.
  3. Écrire les scénarios et les critères de réussite avant tout passage.
  4. Exécuter plusieurs fois chaque scénario sur la configuration exacte qui sera mise en service.
  5. Faire relire les échecs et les cas sensibles par au moins deux personnes.
  6. Corriger, puis rejouer toute la suite, pas seulement le scénario corrigé : une correction peut en casser une autre.
À demander à un fournisseur. Quelles familles de scénarios testez-vous ? À quelle fréquence la suite est-elle rejouée ? Que se passe-t-il quand un contrôle échoue ? Qui relit les cas sensibles ? Un fournisseur sérieux répond au niveau de la méthode, sans avoir à dévoiler ses données.

Questions fréquentes

Qu'est-ce que le red-teaming d'une IA ?

C'est une démarche de test adverse : on tente méthodiquement d'amener l'IA à produire ce qu'elle ne devrait pas (contenu inadapté, contournement des règles, fuite de données) afin de corriger les failles avant les utilisateurs.

Que veut dire fail-closed ?

Un système fail-closed choisit l'option sûre quand un contrôle échoue ou ne peut pas conclure : au lieu de transmettre la réponse non vérifiée, il la remplace par un message neutre ou une redirection.

Faut-il faire tester l'IA par des enfants ?

Pas pour les tests adverses. Les scénarios sont rédigés par des adultes et ne contiennent aucune donnée réelle d'enfant. Les retours d'enfants relèvent d'études d'usage encadrées, séparées du red-teaming.

Le red-teaming garantit-il qu'une IA est sûre ?

Non. Il révèle des failles et permet de vérifier que les corrections tiennent dans le temps, mais il ne prouve pas l'absence de risque. Il doit être rejoué régulièrement et complété par une supervision humaine.

À quelle fréquence faut-il rejouer les tests ?

À chaque changement significatif (nouveau modèle, nouvelle consigne, nouvelle fonctionnalité) et de façon périodique, car les modèles et les usages évoluent.

Aller plus loin avec Emma

Sources

Contenu d'information générale, sans valeur d'avis juridique, médical ou psychologique.