Ressources IA

De la même manière que le centre de ressources EVAL documente les ressources en évaluation, cette section du site explore les différentes jonctions entre intelligence artificielle et évaluation, et notamment le déploiement et bouleversement des pratiques dans le champ de l’évaluation des politiques publiques.

Intelligence artificielle et évaluation

Articles

L’auteur examine différents écueils de l’usage de l’IA en évaluation comme le manque d’explicabilité (la difficulté de retracer comment un résultat a été produit) ou la distorsion de la réalité (une simplification qui efface nuances et voix minoritaires) et le renforcement des inégalités. Il observe que l’engouement pour l’IA ne traduit pas toujours une quête de rigueur. Celui-ci répond aussi à une pression concurrentielle exercée par les institutions ou cabinets de conseil, qui présentent l’IA comme un gage d’efficacité. Steve Jacob expose une responsabilité de l’évaluateur de déclarer les outils utilisés et d’en expliquer les limites, responsabilité qui incombe aussi aux commanditaires qui les sollicient.

L’article présente d’abord les applications de l’IA qui augmentent les capacités des évaluateurs. Il examine ensuite l’impact potentiel de l’IA sur le cycle des politiques publiques, notamment l’accélération des boucles de rétroaction. Il envisage enfin l’intégration de l’évaluation dans des systèmes d’IA autonomes, capables de concevoir, de mettre en œuvre et d’évaluer des politiques publiques avec une supervision humaine minimale, voire inexistante.

Blogs

L’idée centrale de ce texte est qu’il ne faut pas chercher l’outil d’IA parfait ou la commande magique (« prompt »), mais plutôt développer une compétence critique et pratique. L’auteure explique que l’IA ne doit pas servir à automatiser ce que les évaluateurs font déjà (ce qui les rendrait obsolètes), mais à repenser complètement la manière de faire de l’évaluation. L’idée n’est pas uniquement d’aller plus vite mais de changer la portée et la focale.

Etudes

L’Intelligence Artificielle (IA) est une force de transformation  pour la modernisation du secteur public, visant la productivité, la réactivité et la responsabilité du gouvernement. Cependant, l’adoption par le secteur public est fragmentée et en retard par rapport au privé. Le rapport s’appuie sur une analyse de 200 cas d’usage dans 11 fonctions gouvernementales. Le succès dépend de trois piliers : les facilitateurs (enablers), les garde-fous (guardrails) et l’engagement des parties prenantes . Les auteurs suggèrent que l’utilisation de l’IA dans la sphère publique est une nécessité stratégique et non une simple option technologique. Si les gouvernements n’accélèrent pas une adoption responsable de l’IA, ils risquent de perdre leur capacité à réglementer efficacement et à répondre aux attentes croissantes des citoyens. La « culture de l’aversion au risque » du secteur public, combinée à une bureaucratie excessive et à un manque de compétences, empêche la concrétisation des avantages potentiels. 

Guides

Guide coproduit par le groupe de travail IA de la société britannique d’évaluation, avec des contributions d’évaluateurs, de commanditaires et de chercheurs. Il couvre chaque phases du cycle d’évaluation et s’applique indifféremment aux outils grand public et aux solutions développées sur mesure. Quatre principes : transparence, redevabilité et compétence ; contrôle humain et usage proportionné ; gestion active des risques et prévention des préjudices ; assurance qualité et vérification. Chacun s’accompagne de questions à se poser. Le guide fournit ensuite un cadre d’analyse du risque, une graduation des niveaux de risque et des modèles de déclaration d’usage.

En se subordonnant explicitement aux standards existants, l’UKES refuse de faire de l’IA un régime professionnel à part : la question n’est pas de savoir ce que la technologie permet, mais si l’évaluation reste ce qu’elle doit être. Aussi, dès lors que l’usage de l’IA s’écrit dans un contrat, il cesse d’être une affaire de conscience individuelle pour devenir un objet de négociation entre commanditaire et évaluateur.

Cette note technique vise à guider l’intégration de l’IA dans la pratique évaluative du CGIAR. Explicitement présentée comme une version bêta appelée à être révisée au fil des retours d’expérience, elle organise ses recommandations autour de trois verbes (explorer, négocier, utiliser de manière responsable) et détaille les usages possibles à chaque phase du cycle évaluatif : recherche documentaire, conception, collecte de données, analyse, dissémination. La note insiste sur la négociation explicite des usages de l’IA entre évaluateurs, commanditaires et parties prenantes à chaque phase de l’évaluation, et propose un exemple de clause de divulgation de l’usage de l’IA à intégrer aux contrats de consultants.

Ce document établit un cadre pour intégrer l’IA dans les évaluations de l’ONU sans compromettre ses valeurs. L’idée centrale est que l’IA offre une efficacité analytique accrue , mais qu’elle doit impérativement être soumise à une supervision humaine stricte (« Human-in-the-loop »). Le document propose de dépasser l’analyse de données traditionnelle pour exploiter le « Big Data » et l’IA générative (NLP) dans des contextes de crise. Il encourage des partenariats inédits entre l’ONU, le monde académique et le secteur technologique privé pour moderniser les outils d’évaluation. Le texte admet explicitement que l’IA, si elle n’est pas contrôlée, perpétue discrimination et inégalités, et manque d’intelligence émotionnelle et morale. L’IA ne doit pas être une boîte noire. Rédigé en référence aux technologies actuelles (IA générative, NLP), le document devra anticiper son obsolescence afin de ne pas être être dépassé par la mise en place, par exemple, d’agents IA autonomes.

Plan

Ce plan organise le passage à l’échelle de l’IA dans l’État français, avec 655 millions d’euros supplémentaires (France 2030) consacrés aux infrastructures. Il déploie des outils souverains (L’Assistant, DiploIA pour la traduction, Visio pour la transcription) pour alléger le travail des agents (IA utile). Il encadre les pratiques via un guide d’usage et un dialogue social visant un accord-cadre à l’automne 2026, avec un refus affiché du remplacement des agents (IA humaine). Il cherche enfin à réduire les dépendances technologiques en imposant l’hébergement SecNumCloud, en transformant la DINUM en autorité ARIANE au 1er janvier 2027, et en engageant la réinternalisation de compétences numériques clés dès 2027 (IA, cloud, cybersécurité, données, architecture, développement) (IA souveraine).

💡 ALLiaNCE est l’incubateur interministériel d’IA de la DINUM, opérationnel depuis juillet 2023. Il accompagne les administrations porteuses d’un cas d’usage sur les plans méthodologique (méthode beta.gouv.fr) et technique, avec un co-financement possible via les fonds FTAP, PIA et France 2030. Les produits incubés à ce jour comprennent notamment L’Assistant IA, Albert API et EvalAP. Le plan « Notre IA » annonce son articulation avec le programme « Territoires d’IA » de la Banque des Territoires, pour partager les pratiques développées avec les collectivités.

Charte

Sous licence CC BY-SA, cette charte version 1 est valable 18 mois avant révision. Elle distingue trois formes de pratiques (déploiement, expérimentation, usages courants), désigne un référent IA et prévoit un dispositif de retour d’expérience interne. La charte ajoute deux principes propres au secteur de l’évaluation : la responsabilité publique (effets de l’IA sur l’action publique et participation au débat) et les impacts professionnels et organisationnels (transformation des métiers, vigilance sur les tâches confiées aux jeunes professionnels, sanctuarisation de tâches formatrices). Elle propose quatre mentions types pour informer les parties prenantes du niveau d’usage de l’IA dans les productions (aide à la rédaction, idéation, usage spécialisé, usage mixte).

Règlementation

Le règlement (UE) 2024/1689 sur l’intelligence artificielle, entré en vigueur le 1er août 2024, encadre les systèmes d’IA selon une approche fondée sur les risques. Il interdit les usages jugés inacceptables (comme la notation sociale). Il impose des obligations strictes (gestion des risques, supervision humaine, transparence) aux systèmes à « haut risque », utilisés notamment dans l’éducation, l’emploi, le crédit ou la justice. Il exige la transparence des systèmes à « risque limité » (chatbots, deepfakes) et fixe des obligations propres aux modèles d’IA à usage général. Son application est progressive : les interdictions s’appliquent depuis février 2025, les obligations des nouveaux modèles à usage général depuis août 2025, et la plupart des autres dispositions depuis le 2 août 2026. Le règlement (UE) 2026/1744 du 8 juillet 2026, dit « Omnibus IA », entré en vigueur le 27 juillet 2026, a reporté les obligations des systèmes à haut risque au 2 décembre 2027 (systèmes listés à l’annexe III) et au 2 août 2028 (systèmes intégrés à des produits réglementés). Il ajoute deux pratiques interdites, applicables à partir du 2 décembre 2026, et précise la répartition des compétences entre le Bureau européen de l’IA et les autorités nationales.

L’idée clé : l’AI Act a trois problèmes différents, et le retard n’est que le plus visible. 1. Il arrive en retard. Les règles sur les IA à haut risque sont repoussées à fin 2027, parce que les normes techniques qui disent concrètement comment être conforme n’étaient pas prêtes. 2. Là où il s’applique déjà, il manque de bras. Pour surveiller les grands modèles d’IA de toute l’Europe, le Bureau de l’IA a une trentaine à une quarantaine de personnes affectées au contrôle. La loi a des pouvoirs, mais peu de moyens pour les exercer. 3. Il ne regarde pas au bon moment. Le texte contrôle surtout les IA une fois mises sur le marché. Or les comportements les plus inquiétants apparaissent pendant les tests, avant la sortie, c’est-à-dire dans une zone que la loi couvre mal.

Institutions et autorités de régulation de l’IA

Créé en 2024 au sein de la Commission européenne (DG CNECT), le Bureau de l’IA dispose d’une compétence exclusive pour superviser les modèles d’IA à usage général (GPAI). Des obligations supplémentaires s’appliquent à ceux qui présentent des risques systémiques. Depuis le 2 août 2026, il peut enquêter, évaluer les modèles, exiger des mesures correctives et infliger des amendes allant jusqu’à 3 % du chiffre d’affaires mondial. L’Omnibus IA de juillet 2026 étend sa supervision à certains systèmes construits sur ces modèles, ainsi qu’aux systèmes intégrés aux très grandes plateformes et moteurs de recherche relevant du DSA. Il prépare les instruments d’application du règlement (lignes directrices, actes d’exécution, Code de bonnes pratiques sur les modèles à usage général publié en juillet 2025). Il soutient le Comité européen de l’IA, qui réunit les représentants des États membres et coordonne les autorités nationales chargées notamment du contrôle des systèmes à haut risque. Le Bureau a aussi pour mission de soutenir l’innovation et de porter l’approche européenne au niveau international.

Selon la Commission, il emploie plus de 125 personnes (spécialistes des technologies, juristes, spécialistes des politiques publiques, économistes, personnel administratif), réparties en six unités. Le Bureau de l’IA est un service de la Commission, et non une autorité indépendante, entouré d’organes qui le conseillent (Comité des États membres, groupe scientifique, forum consultatif).

L’AI Security Institute (créé initialement sous le nom d’AI Safety Institute à la suite du sommet de Bletchley Park, et officiellement rebaptisé début 2025) est une entité pionnière du gouvernement britannique rattachée au DSIT (ministère de la Science, de l’Innovation et de la Technologie). Ce changement de nom marque un tournant stratégique : l’Institut se concentre désormais exclusivement sur les menaces pures de sécurité nationale et les usages malveillants, laissant les questions d’éthique et de biais aux autres régulateurs. Contrairement à l’Europe, le Royaume-Uni n’a pas de loi globale stricte sur l’IA : la mission de l’Institut n’est donc pas de faire appliquer un règlement unique. Il a la responsabilité directe d’évaluer techniquement les modèles d’IA dits « frontières » (les plus avancés et imprévisibles) présentant des risques systémiques. Concrètement, cela recouvre l’utilisation de l’IA pour développer des armes chimiques ou biologiques, conduire des cyberattaques, ou faciliter des crimes comme la fraude et les abus sexuels sur mineurs.

Le Center for AI Standards and Innovation est l’entité de référence du gouvernement américain en matière d’évaluation de l’IA. Initialement créé fin 2023 sous le nom d’US AI Safety Institute au sein du NIST (rattaché au Département du Commerce), il a été restructuré et renommé CAISI en juin 2025. Ce changement de nom marque une réorientation stratégique claire : la priorité est désormais de protéger l’innovation américaine et de garantir la domination des États-Unis sur les standards internationaux de l’IA, une approche à l’opposé de celle de l’Union européenne et son AI Act. Le CAISI est le point de contact principal du gouvernement américain vis-à-vis de l’industrie pour les tests et la recherche sur les modèles frontières. Il évalue aussi bien les systèmes américains qu’adversaires, notamment les modèles chinois, dans une logique de compétition technologique mondiale. Son périmètre de risques se concentre sur des menaces démontrables : cybersécurité, biosécurité et armes chimiques. Son financement reste historiquement modeste, environ 10 millions de dollars initialement, soit près de dix fois moins que son homologue britannique, ce qui en fait une structure aux ressources limitées au regard de l’ampleur de sa mission.

Ouvrages

Pouvoir et Progrès : Technologie et prospérité, notre combat millénaire. Acemoğlu, D. & Johnson, S., Flammarion, 2023

« Pouvoir et Progrès » défie l’idée que le progrès technologique conduit automatiquement à une prospérité largement partagée. Les auteurs soutiennent que l’histoire, sur plus de mille ans, montre que la direction de la technologie et la répartition de ses bénéfices dépendent des rapports de pouvoir au sein de la société.

Selon Acemoğlu et Johnson, les périodes de prospérité partagée (comme après la Seconde Guerre mondiale) ne sont pas le résultat naturel de la technologie, mais de l’émergence de contre-pouvoirs efficaces. Ces contre-pouvoirs (syndicats, mouvements sociaux, législation gouvernementale) ont forcé les élites à réorienter l’innovation vers des technologies qui bénéficient à la majorité.

Le livre est un avertissement concernant l’Intelligence Artificielle (IA) actuelle. L’IA est principalement développée pour l’automatisation et la surveillance une concentration des richesses et du pouvoir sans précédent.

Les auteurs appellent à une réorientation des priorités technologiques. Ils proposent des politiques pour taxer l’automatisation excessive et subventionner les innovations « centrées sur l’humain » (qui augmentent les capacités des travailleurs). Le progrès social futur dépendra de la capacité des citoyens et des politiques à reprendre le contrôle sur la direction du changement technologique.

Classiques

Norbert Wiener est l’un des pères fondateurs de la société numérique, le premier à poser la question de la responsabilité morale des créateurs d’automates. Il défend une société ouverte où la fluidité de l’information garantit la liberté. Wiener affirme que le progrès technique, s’il n’est pas guidé par une conscience morale forte, peut accélérer la fin de l’humanité. Il suggère que « savoir-faire » (know-how) sans « savoir-quoi » (know-what/le but) est dangereux. L’enjeu crucial est d’éviter que les nouvelles technologies ne soient utilisées pour asservir l’homme ou créer des structures sociales rigides et totalitaires. Wiener défend une société ouverte où la fluidité de l’information garantit la liberté. Il anticipe que la machine ne sera pas juste un outil de puissance (levier), mais un outil de décision et de gouvernance, prédisant ainsi le remplacement du cerveau humain dans ses fonctions routinières.

Posséder les moyens de cette transformation digitale coûte cher et demande une infrastructure que seule une élite peut financer. De plus, nous avons troqué notre autonomie contre du confort et de l’efficacité. Conséquence : nous ne sommes pas les esclaves de nos machines, mais nous sommes en passe de devenir les esclaves de ceux qui les possèdent.

Par thème : intelligence artificielle et climat

Le scepticisme climatique pose un défi majeur car les sceptiques pratiquent « l’évitement de l’information ». Cet article de la TSE (WP 25-1678) teste une intervention où une IA générative (Llama 3) reformule subtilement les titres d’articles scientifiques pour réduire le « désaccord anticipé » qu’ils génèrent, sans altérer les faits. Lors d’une expérience contrôlée sur 2000 participants, les titres modifiés par l’IA ont généré significativement plus d’engagement (upvotes, favoris), un effet particulièrement fort chez les individus les plus sceptiques. Fait crucial, cette interaction a provoqué un changement mesurable dans leurs croyances, les rapprochant du consensus scientifique. L’étude démontre que l’IA peut modifier le « régime informationnel » des sceptiques et, loin d’être un simple outil de désinformation, peut servir de puissant « outil pour la vérité » pour lutter contre la polarisation.

Intelligence artificielle : gouvernance et régulation

Le dirigeant de Google DeepMind estime que l’AGI est « probablement à quelques années » et compare son impact à la découverte de l’électricité ou du feu. Constatant que les progrès des modèles les plus avancés dépassent notre compréhension de la technologie, dans un contexte de course commerciale et géopolitique intense, il plaide pour un « optimisme prudent » et formule une proposition institutionnelle précise : la création aux États-Unis d’un organisme de normalisation de l’IA de frontière (Frontier AI Standards Body), partenariat public-privé sous supervision fédérale inspiré de la FINRA (l’autorité d’autorégulation des marchés financiers américains), financé principalement par l’industrie. L’organisme fixerait les seuils de capacités qualifiant un modèle de « classe frontière », élaborerait des protocoles d’évaluation (cybersécurité, risques biologiques, tests agentiques de contournement des garde-fous ou de tromperie), actualisés régulièrement et dépréciés quand les benchmarks saturent. Le partage volontaire des modèles, 30 jours avant leur sortie, deviendrait à terme une condition d’accès au marché américain, l’organisme pouvant aller jusqu’à coordonner un ralentissement du développement entre laboratoires si la situation l’exige. Pour l’évaluateur, la proposition soulève des questions familières : un organisme financé par l’industrie peut-il évaluer en toute indépendance ses financeurs, et qui gouverne les référentiels qui déterminent le périmètre des acteurs régulés ?

➡ Une recommandation de Demis Hassabis : que l’organisme de normalisation développe, à terme, ses propres jeux de tests tenus secrets et indépendants des laboratoires afin d’éviter que les modèles soient optimisés pour réussir les benchmarks (surapprentissage), et qu’il promeuve avec le gouvernement américain un écosystème d’auditeurs tiers contribuant aux évaluations et au développement de nouveaux référentiels.

L’essai décrit la transition critique de l’humanité face à l’émergence imminente d’une intelligence artificielle surpuissante, comparant cette période à une « adolescence » : nous faisons face à un pic de puissance brutale sans posséder la maturité émotionnelle ou institutionnelle pour la maîtriser. L’auteur dresse une cartographie de cinq risques systémiques (perte de contrôle, autonomisation d’acteurs malveillants, dérives autoritaires, bouleversements économiques de masse, et menaces existentielles imprévues). 


➡ Une recommandation de Dario Amodei : l’obligation légale d’instaurer des audits de sécurité par des tiers indépendants et gouvernementaux (comme les AI Safety Institutes) avant chaque entraînement d’un nouveau modèle majeur, incluant des tests de pénétration pour vérifier si l’IA peut tromper les humains, générer des armes ou s’échapper des serveurs.

Lexique

Charte d’utilisation de l’IA :

C’est un document de référence qui définit le cadre légal, éthique et technique de l’usage des outils d’intelligence artificielle au sein d’une organisation. Elle fixe les droits et les devoirs des collaborateurs afin de concilier innovation et sécurité, tout en prévenant les risques liés à la Shadow IA (fuites de données, erreurs factuelles, non-conformité).

Design Centré Utilisateur (DCU) :

Le Design Centré Utilisateur (DCU), ou User-Centered Design (UCD) en anglais, est une philosophie et une méthode de conception qui place l’humain au cœur de chaque étape du développement d’un produit (qu’il soit numérique comme une application, ou physique comme un aspirateur). L’idée fondamentale est simple : on ne crée pas un produit en espérant que les gens s’y adaptent, on crée un produit qui s’adapte aux gens.

IA de frontière (Frontier AI) :

L’expression désigne les modèles d’intelligence artificielle les plus avancés du moment, ceux qui repoussent l’état de l’art et dont les capacités, comme les risques, ne sont pas encore bien compris. La notion s’est imposée dans le vocabulaire de la gouvernance à partir du sommet de Bletchley Park (novembre 2023), qui a donné naissance aux premiers instituts publics chargés d’évaluer ces systèmes.

Shadow IA (intelligence artificielle de l’ombre) :

La Shadow IA désigne l’utilisation d’outils, d’applications ou de services d’Intelligence Artificielle au sein d’une entreprise ou d’une organisation sans l’approbation, la supervision ou le contrôle explicite du département informatique (DSI) ou de la direction. En clair, les employés utilisent ces outils pour leurs missions sans que la sécurité n’ait été validée.

Cette pratique expose l’organisation à des risques critiques : fuites de données personnelles, perte de crédibilité ou prises de décisions erronées due à des hallucinations.

Sycophantie :

La sycophantie désigne la tendance d’un modèle d’IA à s’aligner sur les opinions, les croyances ou les erreurs de l’utilisateur, même lorsque cela implique de sacrifier la vérité objective ou la logique. Ce comportement découle souvent de l’apprentissage par renforcement humain (RLHF), où le modèle apprend qu’être « d’accord » avec l’utilisateur génère souvent une meilleure récompense que de le contredire, même si l’utilisateur a tort

Température :

Paramètre de contrôle déterminant la stabilité des réponses générées. Une température basse (0) force l’IA à rester strictement factuelle et constante, idéal pour l’extraction de données. Une température élevée autorise l’IA à s’écarter des réponses standard, favorisant la diversité des idées mais augmentant le risque d’inexactitude.

Attention : une température de 0 rend l’IA constante (elle répétera la même chose), mais cela ne garantit pas à 100 % qu’elle soit factuelle. Si l’IA se trompe sur un fait, avec une température de 0, elle se trompera de manière très assurée et répétitive.

Mirroring (effet miroir) :

Le mirroring désigne la tendance d’un LLM à imiter le ton, le style et la structure de raisonnement de l’utilisateur pour fluidifier l’échange. Si cette adaptation rend l’interaction plus naturelle, elle crée une « chambre d’écho » où le modèle reflète les biais, les erreurs ou la posture de son interlocuteur. Pour un métier d’évaluation, ce phénomène est particulièrement critique : l’IA risque d’épouser les hypothèses de l’évaluateur au lieu de les challenger, compromettant ainsi l’impartialité et la distance critique indispensables à la rigueur d’une analyse factuelle.

Les fonctionnalités d’intelligence artificielle désormais intégrées aux plateformes et logiciels de suivi évaluation (assistant IA de NVivo, choix du moteur dans QDA Miner, CommCare Companion, requêtes en langage naturel de Metabase…) sont présentées sur la page ci-dessus.

Carré de la souveraineté IA
Une grille de lecture pour évaluer la relation de travail à l’IA selon six dimensions critiques. Ce modèle permet de situer l’usage de la technologie sur un spectre allant de l’aliénation algorithmique (zone d’asservissement) à l’augmentation des compétences (zone de contrôle

Pour aller plus loin

Date de publication : aout 2025
Date de mise à jour : octobre 2026