D'où viennent nos informations ?
De documents publics, et uniquement de ceux-là.
Notre point de départ est le catalogue MITRE ATLAS. MITRE est un organisme américain à but non lucratif, qui tient aussi ATT&CK, le référentiel qu'utilisent les équipes de cybersécurité pour décrire les attaques informatiques classiques. ATLAS fait la même chose pour l'IA : c'est une base publique des techniques d'attaque visant les systèmes d'IA, construite à partir d'attaques réelles et de démonstrations d'équipes de sécurité.
ATLAS en deux minutes
Une technique, c'est une façon d'attaquer : par exemple empoisonner les données sur lesquelles un modèle apprend, ou contourner ses garde-fous pour lui faire dire ce qu'il refuse.
Un cas, c'est une attaque documentée, décrite étape par étape.
Un grade dit où en est chaque technique : envisageable (décrite, jamais montrée), démontrée (réussie en laboratoire) ou réalisée (observée dans une attaque réelle). Ce sont les deux passages entre ces grades que notre page d'accueil appelle « du laboratoire au réel ».
ATLAS est librement consultable sur atlas.mitre.org.
Pour savoir ce qui bloque encore, nous lisons ce que publient ceux qui testent ces systèmes : les instituts publics d'évaluation, comme l'AI Security Institute britannique, les laboratoires qui évaluent leurs propres modèles, les rapports d'incidents, et les fournisseurs qui décrivent leurs contrôles.
Comment les trions-nous ?
Nous cherchons des verrous. Un verrou, c'est une défense qui tient encore : ce qui manque pour qu'une attaque devienne possible.
La règle essentielle : le verrou doit être écrit noir sur blanc dans un document publié. Nous ne le devinons jamais. Quand personne n'a vérifié si une défense tient encore, nous l'écrivons tel quel : non testé. C'est une information en soi, et personne ne la publie.
Pour aller plus loin : les huit types de défenses
Capacité (le modèle ne sait pas encore faire), ressource (argent, calcul), identité (paiement, compte, pièce d'identité), accès (droits privilégiés), durée (tenir sans être détecté), savoir tacite (un savoir-faire absent des textes), contrôle installé (quelqu'un le maintient volontairement : limite de débit, filtre, bac à sable) et non testé.
Chaque verrou reçoit un seul type. Si deux types conviennent, il est classé non testé plutôt que tranché au jugé.
Que refusons-nous de publier ?
Pour des raisons évidentes, une entrée n'indique jamais comment contourner la défense.
Souvent, il suffit de reformuler. « La vérification d'identité des fournisseurs de calcul bloque l'ouverture autonome d'un compte » est un verrou. Nous ne nommons pas le fournisseur qui ne la pratique pas : ce serait un mode d'emploi d'attaque.
Quand la reformulation est impossible, l'entrée n'est ni publiée ni conservée. C'est arrivé deux fois sur les treize candidats examinés pour la liste du 26 septembre, avec des sources par ailleurs excellentes.
Qu'est-ce qui reste difficile à mesurer ?
- Les deux étapes se franchissent de plus en plus vite, de l'idée à la démonstration en laboratoire, puis de la démonstration au cas réel. Dans le catalogue MITRE ATLAS, environ 1,5 fois plus vite chaque année pour la première, 2,2 fois pour la seconde, après correction de l'activité croissante du catalogue lui-même, une correction impossible à mesurer avant 2025. Il est difficile de distinguer un domaine qui accélère d'un catalogue mieux tenu ; notre hypothèse est que les deux effets sont présents. Sans la correction, les chiffres seraient plus élevés : nous publions les plus petits.
- Les tests publics se font sans défenseur. Les bancs d'essai des évaluateurs n'ont ni équipe de surveillance, ni détection. Ce que donnerait la même attaque contre un système bien défendu reste à mesurer.
- Ce qui bloquait hier peut céder demain. Quatre limites des modèles publiées en mars étaient franchies en mai. Quatre observations, pas une loi générale, mais elles suffisent : notre liste donne l'état à une date, et chaque entrée porte la sienne.
Pourquoi la liste est datée
Nous voulions d'abord une liste qui reste valable dans le temps. C'est impossible, et nous l'avons mesuré.
Avec une règle écrite avant tout comptage, un seul scénario sur dix remplissait les conditions d'une liste durable. Avec une règle écrite, elle aussi, avant tout comptage, mais pour un état à une date, huit candidats sur treize les remplissent. Nous publions les deux résultats côte à côte, et les deux règles.
Comment nous vérifier ?
Tout ce que nous affirmons peut être refait par quelqu'un d'autre.
- Chaque verrou cite sa source.
- Chaque chiffre se recalcule d'une seule commande, à partir de sources publiques dont la version est figée.
- L'article est archivé avec un identifiant permanent (DOI), qui date ce que nous avons publié et empêche de le réécrire après coup.
Nous publions aussi nos échecs. Avant cette liste, nous avons tenté de construire un outil qui reconstitue automatiquement des scénarios d'attaque. Le test était fixé à l'avance, et l'outil ne l'a pas passé. Nous avons publié ce résultat négatif, avec de quoi le vérifier (note de méthode, en anglais, archivée sur Zenodo).
Ce que la méthode produit
L'article
La liste des défenses qui tiennent encore, scénario par scénario, avec pour chacun ce qui a déjà été observé dans le réel. Et la découverte qui l'accompagne : du laboratoire au réel, c'est la seconde étape qui résiste.
Lire l'article à paraître
Déjà visible sur l'accueil : la découverte en une figure · une défense de la liste, en exemple