CeSIA
fr | en

Que disent les politiques sur l'IA ?

Notre outil analyse 15 000 déclarations officielles de responsables politiques sur l’IA afin de suivre l’évolution des principaux sujets de préoccupation au fil du temps et d’un pays à l’autre.

Créé et maintenu par Lennart Finke (ETH Zurich) et Markov Grey (CeSIA).

Mise à jour le 2026-09-29

À propos

Ce projet analyse les déclarations de responsables gouvernementaux et d’organisations intergouvernementales sur l’intelligence artificielle, ses risques et les approches de politique publique. Le jeu de données rassemble environ 15 000 interventions sur l’IA, tirées d’environ 200 000 documents publiés par 19 gouvernements et organisations intergouvernementales. Il est particulièrement utile pour les travaux sur les politiques de sécurité de l’IA. L’intégralité du jeu de données est publique : vous pouvez la télécharger au format CSV, TSV ou JSON depuis la page d’exploration, et chaque export est archivé sous forme de version publique permanente.

Méthode

Notre code est ouvert : vous pouvez consulter la collecte et le traitement des données ainsi que leur affichage sur ce site.

Les documents bruts sont recueillis auprès de sources gouvernementales officielles, dont la liste complète figure ci-dessous. Nous choisissons les pays et les organisations en fonction du volume de discussions sur l’IA que nous anticipons et de la facilité de collecte des données. Nous choisissons leurs sources selon les mêmes critères : volume de discussions, facilité d’extraction et droit d’auteur. Certaines sources présentent un délai de publication important : les auditions parlementaires américaines, par exemple, ne sont parfois mises en ligne que plusieurs mois après leur tenue. Nos sources ne sont ni exhaustives ni nécessairement représentatives. Ainsi, si nous constatons que les responsables britanniques parlent beaucoup plus des risques liés à l’IA que les parlementaires américains, cela pourrait s’expliquer par l’absence, dans notre collecte, de sources américaines qui abordent ces risques. Nous cherchons néanmoins à couvrir les sources les plus importantes pour chaque pays ou organisation.

Nous découpons les documents recueillis en interventions attribuables à un seul intervenant. Ces interventions sont filtrées à l’aide d’un large ensemble de mots-clés liés à l’IA, dans l’une des 11 langues de nos sources. La liste des mots-clés par langue est disponible ici. Seules les interventions contenant au moins un de ces mots-clés passent à l’étape suivante.

Les interventions retenues sont annotées par trois IA évaluatrices (gpt-oss-120b, GLM 5.2 et Deepseek Flash V4 0731), appelées via OpenRouter. Voici les consignes utilisées. Les annotations ne sont pas toutes vérifiées par des humains. Les IA attribuent à chaque intervention des scores pour les grands thèmes et des étiquettes indiquant notamment si elle apporte un contenu substantiel, si les propos sont bien ceux de la personne nommée, si celle-ci exerce une fonction publique, ou encore si la citation est directe ou paraphrasée. Elles attribuent aussi des étiquettes de risques et de stratégies de politique publique. Les étiquettes de stratégies proviennent de l’AI Governance and Regulatory Archive de l’Existential Risk Observatory. Celles des risques proviennent du Risk Repository de la MIT AI Risk Initiative.

Le jeu de données final comprend les interventions qui ont passé le filtre par mots-clés et pour lesquelles au moins deux des trois évaluateurs s’accordent sur chacune des quatre conditions suivantes : le score relatif à l’IA dépasse un seuil fixe, l’intervention est substantielle, elle est attribuable à un seul intervenant et celui-ci exerce une fonction publique. Nous éliminons également les interventions en double.

Pour les interventions incluses dans la base, l’IA évaluatrice extrait aussi une courte citation et la traduit en anglais si l’intervention est dans une autre langue. Nous vérifions que le texte de chaque citation figure mot pour mot dans l’intervention, tout en autorisant les coupures signalées par des crochets, comme « [...] ».

Nous classons la tonalité de l’intervention vis-à-vis des risques liés à l’IA dans l’une des catégories suivantes : « optimiste », « neutre », « mitigée » ou « préoccupée ». Cette annotation se fait lors d’une étape distincte, pour éviter que le cadrage par les risques de la première étape n’oriente les évaluateurs vers une tonalité négative. Nous utilisons un vote majoritaire de GLM 5.2, Deepseek V4 0731 et gpt-oss-120b. Dans les rares cas où les trois modèles donnent des réponses différentes, nous retenons « mitigée ». Les consignes d’annotation de la tonalité sont disponibles ici.

Une vérification humaine sur des échantillons de 100 textes anglais chacun a permis de mesurer la concordance entre l’évaluateur fondé sur un grand modèle de langage et un annotateur humain. L’accord était d’environ 75 % pour l’inclusion dans la base (κ de Cohen = 0,52), et la précision d’environ 70 % pour les étiquettes de risques et de stratégies de gouvernance (κ de Cohen = 0,56).

Sources de données

Les citations sont recueillies sur les sites officiels des gouvernements et des organisations intergouvernementales. Quelques-unes le sont indirectement, par l’intermédiaire de sites miroirs, comme précisé ci-dessous. Certaines sources sont des API de recherche : nous utilisons alors les mots-clés généraux liés à l’IA comme termes de recherche, de manière analogue au filtrage appliqué aux sources qui ne nécessitent pas de recherche.

Voici un aperçu des sources par gouvernement ou organisation intergouvernementale :

  • États-Unis : les citations proviennent des comptes rendus du Congrès et des auditions de ses commissions, via la recherche de l’API GovInfo (api.govinfo.gov), ainsi que des points de presse, allocutions et fiches d’information de la Maison-Blanche, via les pages HTML de whitehouse.gov, et des documents présidentiels, via l’API du Federal Register (federalregister.gov).
  • République populaire de Chine : les citations proviennent des rubriques d’actualité et de presse du Conseil des affaires d’État (gov.cn), du ministère des Sciences et des Technologies, du ministère de l’Industrie et des Technologies de l’information, du ministère des Affaires étrangères et de l’Administration chinoise du cyberespace, ainsi que de la une du Quotidien du peuple (people.com.cn). Les éditions du Quotidien du peuple antérieures à décembre 2024 ne sont plus accessibles chez l’éditeur ; nous les consultons dans les captures d’Internet Archive.
  • Union européenne : les citations proviennent des comptes rendus in extenso des séances plénières du Parlement européen et des questions parlementaires accompagnées de leurs réponses, via l’API de données ouvertes (data.europarl.europa.eu). Les anciens comptes rendus en PDF servent de solution de repli pour les séances non couvertes par l’API. Nous utilisons aussi les discours, déclarations, communiqués de presse et questions-réponses de la Commission européenne, via l’API JSON de son espace presse (ec.europa.eu/commission/presscorner), ainsi que les communiqués du Conseil de l’UE et du Conseil européen, consultés dans les captures d’Internet Archive de consilium.europa.eu.
  • OTAN : les citations proviennent des transcriptions de discours, conférences de presse et déclarations du secrétaire général, sur les pages HTML de nato.int, repérées à partir du plan du site.
  • Nations unies : les citations proviennent des procès-verbaux du Conseil de sécurité et de l’Assemblée générale, téléchargés en PDF via l’API d’accès par cote du service des documents de l’ONU (documents.un.org), ainsi que des transcriptions automatiques d’UN Web TV (transcripts.un.org). Ces dernières couvrent les réunions, conférences et points de presse sans compte rendu officiel. Il s’agit de transcriptions automatiques, signalées comme telles dans tout le jeu de données : leur fidélité mot pour mot n’est pas garantie et les noms des intervenants sont souvent mal reconnus.
  • Royaume-Uni : les citations proviennent des débats du Parlement, via la recherche de l’API Hansard (hansard-api.parliament.uk).
  • Allemagne : les citations proviennent des débats du Bundestag, via les comptes rendus de séances plénières en XML du service de données ouvertes du Bundestag, repérés à l’aide de ses points d’accès d’indexation (bundestag.de).
  • France : les citations proviennent des débats de l’Assemblée nationale et du Sénat, via les archives de comptes rendus intégraux en XML que les deux chambres publient sous forme de fichiers ZIP (data.assemblee-nationale.fr, data.senat.fr), ainsi que des discours, déclarations et communiqués de l’Élysée, via les pages HTML d’elysee.fr.
  • Canada : les citations proviennent des débats de la Chambre des communes, via les fichiers XML du Hansard de chaque séance sur ourcommons.ca. Nous utilisons l’édition anglaise, dans laquelle les interventions prononcées en français sont traduites.
  • Japon : les citations proviennent des travaux de la Diète nationale, via la recherche de l’API Kokkai Kaigiroku de la Bibliothèque nationale de la Diète (kokkai.ndl.go.jp).
  • Afrique du Sud : les citations proviennent du Hansard de l’Assemblée nationale et du Conseil national des provinces, des questions écrites aux ministres et de leurs réponses, ainsi que des réunions de commissions, via la recherche de l’API du Parliamentary Monitoring Group (api.pmg.org.za). Les réunions de commissions ne disposent pas de citations mot pour mot : il s’agit de paraphrases.
  • Pays-Bas : les citations proviennent des débats en séance plénière et en commission de la Tweede Kamer, via l’API OData Gegevensmagazijn (gegevensmagazijn.tweedekamer.nl), y compris les interruptions au cours des prises de parole. Elles proviennent aussi des documents parlementaires, des questions parlementaires et des comptes rendus de l’Eerste Kamer, via la recherche du dépôt KOOP (repository.overheid.nl).
  • Russie : les citations proviennent des discours, transcriptions et comptes rendus de l’administration présidentielle, via les archives HTML classées par date de kremlin.ru, ainsi que des comptes rendus sténographiques des séances plénières de la Douma, via la base de données transcript.duma.gov.ru.
  • Singapour : les citations proviennent du Hansard du Parlement, via le service de rapports parlementaires (sprs.parl.gov.sg).
  • Brésil : les citations proviennent des interventions en séance du Sénat fédéral, via l’API Dados Abertos (legis.senado.leg.br). Celle-ci répertorie toutes les interventions d’une période, accompagnées des résumés et des étiquettes thématiques du Sénat ; le texte intégral est ensuite recueilli lorsque ces métadonnées correspondent aux mots-clés.
  • Mexique : les citations proviennent des comptes rendus sténographiques des séances plénières du Sénat de la République, via senado.gob.mx.
  • Australie : les citations proviennent du Hansard de la Chambre des représentants et du Sénat, via l’API de transcription utilisée par le lecteur Hansard d’aph.gov.au.
  • Taïwan : les citations proviennent du journal officiel du Yuan législatif, via un miroir non officiel appelé LYAPI (v2.ly.govapi.tw).
  • Suisse : les citations proviennent du Bulletin officiel du Conseil national et du Conseil des États, via le service OData de parlament.ch.