Comment nous travaillons

Cinq questions, cinq réponses courtes. Le détail complet est dans l'article.

D'où viennent nos informations ?

De documents publics, et uniquement de ceux-là.

Notre point de départ est le catalogue MITRE ATLAS. MITRE est un organisme américain à but non lucratif, qui tient aussi ATT&CK, le référentiel qu'utilisent les équipes de cybersécurité pour décrire les attaques informatiques classiques. ATLAS fait la même chose pour l'IA : c'est une base publique des techniques d'attaque visant les systèmes d'IA, construite à partir d'attaques réelles et de démonstrations d'équipes de sécurité.

ATLAS en deux minutes

Une technique, c'est une façon d'attaquer : par exemple empoisonner les données sur lesquelles un modèle apprend, ou contourner ses garde-fous pour lui faire dire ce qu'il refuse.

Un cas, c'est une attaque documentée, décrite étape par étape.

Un grade dit où en est chaque technique : envisageable (décrite, jamais montrée), démontrée (réussie en laboratoire) ou réalisée (observée dans une attaque réelle). Ce sont les deux passages entre ces grades que notre page d'accueil appelle « du laboratoire au réel ».

ATLAS est librement consultable sur atlas.mitre.org.

Pour savoir ce qui bloque encore, nous lisons ce que publient ceux qui testent ces systèmes : les instituts publics d'évaluation, comme l'AI Security Institute britannique, les laboratoires qui évaluent leurs propres modèles, les rapports d'incidents, et les fournisseurs qui décrivent leurs contrôles.

Comment les trions-nous ?

Nous cherchons des verrous. Un verrou, c'est une défense qui tient encore : ce qui manque pour qu'une attaque devienne possible.

La règle essentielle : le verrou doit être écrit noir sur blanc dans un document publié. Nous ne le devinons jamais. Quand personne n'a vérifié si une défense tient encore, nous l'écrivons tel quel : non testé. C'est une information en soi, et personne ne la publie.

Du document public à la liste : chaque document passe par quatre questions — ce qui manque, quel type de défense, où c'est écrit, qui peut la lever. Trois issues : publiée avec sa date et sa source ; non testé, quand personne n'a vérifié ; refusée, quand elle reviendrait à un mode d'emploi d'attaque.
Chaque document public passe par quatre questions : ce qui manque, quel type de défense, où c'est écrit, qui peut la lever. Il y a trois issues : publiée avec sa date et sa source, non testé quand personne n'a vérifié, refusée quand ce serait un mode d'emploi.
Pour aller plus loin : les huit types de défenses

Capacité (le modèle ne sait pas encore faire), ressource (argent, calcul), identité (paiement, compte, pièce d'identité), accès (droits privilégiés), durée (tenir sans être détecté), savoir tacite (un savoir-faire absent des textes), contrôle installé (quelqu'un le maintient volontairement : limite de débit, filtre, bac à sable) et non testé.

Chaque verrou reçoit un seul type. Si deux types conviennent, il est classé non testé plutôt que tranché au jugé.

Que refusons-nous de publier ?

Pour des raisons évidentes, une entrée n'indique jamais comment contourner la défense.

Souvent, il suffit de reformuler. « La vérification d'identité des fournisseurs de calcul bloque l'ouverture autonome d'un compte » est un verrou. Nous ne nommons pas le fournisseur qui ne la pratique pas : ce serait un mode d'emploi d'attaque.

Quand la reformulation est impossible, l'entrée n'est ni publiée ni conservée. C'est arrivé deux fois sur les treize candidats examinés pour la liste du 26 septembre, avec des sources par ailleurs excellentes.

Qu'est-ce qui reste difficile à mesurer ?

Pourquoi la liste est datée

Nous voulions d'abord une liste qui reste valable dans le temps. C'est impossible, et nous l'avons mesuré.

Avec une règle écrite avant tout comptage, un seul scénario sur dix remplissait les conditions d'une liste durable. Avec une règle écrite, elle aussi, avant tout comptage, mais pour un état à une date, huit candidats sur treize les remplissent. Nous publions les deux résultats côte à côte, et les deux règles.

Comment nous vérifier ?

Tout ce que nous affirmons peut être refait par quelqu'un d'autre.

Nous publions aussi nos échecs. Avant cette liste, nous avons tenté de construire un outil qui reconstitue automatiquement des scénarios d'attaque. Le test était fixé à l'avance, et l'outil ne l'a pas passé. Nous avons publié ce résultat négatif, avec de quoi le vérifier (note de méthode, en anglais, archivée sur Zenodo).

Ce que la méthode produit

L'article

La liste des défenses qui tiennent encore, scénario par scénario, avec pour chacun ce qui a déjà été observé dans le réel. Et la découverte qui l'accompagne : du laboratoire au réel, c'est la seconde étape qui résiste.

Déjà visible sur l'accueil : la découverte en une figure · une défense de la liste, en exemple