Quelques outils d’intelligence artificielle utiles pour l’évaluation
Les IA à Usage Général (GPAI)
Contrairement à une IA « spécifique » (conçue pour une seule tâche précise, comme la transcription automatique de focus groups ou le nettoyage de bases de données), une GPAI (General Purpose AI, terme repris par le règlement européen sur l’IA) est un modèle de fondation (foundation model) doté d’une grande polyvalence. Entraînés sur d’immenses volumes de données, ces modèles peuvent comprendre et générer du contenu (texte, image, code…) pour une multitude d’applications. C’est à cette catégorie qu’appartiennent les modèles les plus connus du grand public : GPT (OpenAI, derrière ChatGPT), Gemini (Google), Claude (Anthropic) ou, en France notamment, ceux de Mistral AI.
NotebookLM, développé par Google, est un assistant d’analyse et de synthèse documentaire. Il transforme une masse de documents bruts (rapports, entretiens, données, etc.) en une base de connaissances interactive. L’évaluateur peut y rassembler les termes de référence, les rapports annuels, les modélisations, le cadre logique, les transcriptions d’entretiens et les tableaux de suivi des indicateurs, puis interroger ce corpus à partir des questions évaluatives, repérer des thèmes récurrents ou faire émerger des pistes à approfondir. Ses réponses s’appuient uniquement sur les documents chargés et renvoient aux passages sources, ce qui permet de vérifier chaque affirmation. Les documents étant traités sur les serveurs de Google, la prudence s’impose pour les données de terrain sensibles, comme les entretiens non anonymisés (voir la protection des données personnelles).
Google AI Studio est la plateforme en ligne de Google permettant de tester les modèles Gemini et de les configurer, au moyen d’instructions personnalisées, pour en faire un assistant dédié à des tâches précises : préparer, structurer ou améliorer une démarche d’évaluation. Il peut par exemple aider à affûter des questions évaluatives, à explorer les hypothèses d’une théorie du changement, à analyser de façon critique les discours institutionnels (voir Évaluation versus communication) ou à confronter les observations de terrain aux cadres d’analyse de l’évaluation.
Conçu d’abord pour les développeurs, l’outil propose aussi un mode « Build » : l’utilisateur décrit en langage courant l’application souhaitée et un agent en écrit le code. Depuis mai 2026, ces applications peuvent accéder aux données de Google Workspace, par exemple pour construire un tableau de bord à partir d’un fichier Google Sheets.
Ces outils restent des prototypes : un non-programmeur n’est pas en mesure de vérifier le code produit, ni la sécurité des données que l’application manipule. Par ailleurs, hors Espace économique européen, Suisse et Royaume-Uni, les contenus soumis gratuitement peuvent être utilisés par Google pour améliorer ses produits et lus par des relecteurs humains, ce qui concerne directement les évaluateurs travaillant en Afrique.
L’appli EVAL a été réalisée avec AI studio.
Claude est une famille de modèles d’IA à usage général développée par Anthropic, entreprise américaine fondée en 2021 par d’anciens chercheurs d’OpenAI.
Anthropic met en avant une méthode d’entraînement appelée « IA constitutionnelle » (Constitutional AI) : le modèle apprend à évaluer et à réviser ses propres réponses à partir d’un texte de référence, la « constitution ». La première version, publiée en 2023, s’inspirait notamment de la Déclaration universelle des droits de l’homme ; elle a été entièrement refondue en janvier 2026 pour privilégier le jugement plutôt que l’application de règles. Pour l’évaluation, l’objectif affiché est que le modèle évite d’amplifier les stéréotypes présents dans les données ou d’infléchir une analyse vers une conclusion attendue. Il s’agit d’une intention de conception, non d’une garantie : des biais restent possibles et les analyses produites doivent être vérifiées, comme pour tout modèle.
Depuis l’automne 2025, les conversations des comptes personnels (offres Free, Pro et Max) servent à entraîner les modèles, sauf si l’utilisateur désactive cette option dans ses paramètres de confidentialité. Les offres professionnelles et l’accès par API ne sont pas concernés.
Mistral AI est une société française fondée en avril 2023 par trois chercheurs issus de Google DeepMind (Arthur Mensch) et de Meta (Guillaume Lample, Timothée Lacroix). Elle développe des modèles d’IA à usage général et propose un assistant grand public, Vibe (anciennement Le Chat).
Pour l’évaluation, notamment dans le champ des politiques publiques ou lorsque des données sensibles sont en jeu, son principal intérêt tient à la souveraineté numérique, que les gouvernements français et européens cherchent à renforcer. Une partie de ses modèles est publiée en poids ouverts, dont Mistral Large 3, diffusé sous licence Apache 2.0 depuis décembre 2025 : ces modèles peuvent être installés sur des serveurs maîtrisés par l’institution, sans que les données quittent son infrastructure. Pour les services en ligne de Mistral, le statut d’entreprise européenne facilite la conformité au RGPD sans la garantir : les conditions d’utilisation restent à vérifier, comme pour tout fournisseur.
Les modèles Mistral traitent bien le français et les principales langues européennes, mais cet avantage s’est réduit avec les progrès des modèles concurrents. Sur les tâches de raisonnement complexe, ils restent en général en retrait des modèles américains les plus avancés. Leur choix relève donc davantage d’un arbitrage entre souveraineté, confidentialité et performance que d’une supériorité technique.
Plateformes pour tester et comparer les modèles
Surnommée le « GitHub de l’IA », Hugging Face est la principale plateforme de partage de modèles d’IA ouverts.
Pour l’évaluateur : l’interface HuggingChat, relancée en octobre 2025, permet d’interroger de nombreux modèles ouverts (Qwen, DeepSeek, GPT-OSS, etc.), gratuitement dans la limite de crédits d’utilisation. Par défaut, un routeur choisit automatiquement le modèle selon la demande. Les requêtes étant traitées par des fournisseurs tiers, l’outil n’offre pas de garantie particulière de confidentialité.
Pour l’institution : les équipes techniques peuvent y télécharger des modèles à poids ouverts et les installer sur leurs propres serveurs, afin que les données sensibles ne transitent pas par un prestataire extérieur. Cela suppose des compétences techniques et un matériel adapté : les plus grands modèles exigent des serveurs de calcul spécialisés, les plus petits peuvent tourner sur un ordinateur bien équipé. Les licences varient d’un modèle à l’autre et doivent être vérifiées avant tout usage.
Les résultats d’évaluation des modèles sont publiés sur leurs pages respectives et dans des classements communautaires, à lire avec prudence : les modèles sont souvent optimisés pour réussir ces tests, sans que cela reflète leur utilité réelle.
- Arena (anciennement LMArena et Chatbot Arena)
Arena est une plateforme en ligne qui compare les grands modèles d’IA (texte, code, image, vidéo) à partir des préférences de ses utilisateurs. Le principe : l’utilisateur soumet une même demande à deux modèles dont l’identité est masquée, compare leurs réponses côte à côte et vote pour celle qu’il juge la meilleure. Ces votes, accumulés par millions, servent à calculer un classement des modèles.
Lancé en 2023 par des chercheurs de l’Université de Californie à Berkeley sous le nom de Chatbot Arena, le projet est devenu en 2025 une entreprise indépendante, financée par des fonds d’investissement, et a pris le nom d’Arena en janvier 2026.
Pour l’évaluateur, ce classement est un repère utile mais à manier avec prudence. Il mesure une préférence et non une exactitude : des votants rarement experts peuvent favoriser une réponse plus longue, mieux présentée ou plus assurée. Sa méthode a aussi été critiquée pour avoir avantagé les grands laboratoires, en mesure de tester en privé plusieurs versions de leurs modèles avant d’en publier une. Enfin, un bon rang général ne garantit pas la pertinence d’un modèle pour une tâche précise : le plus sûr reste de comparer les modèles sur ses propres cas d’usage.
Outils spécialisés
AIDA (Artificial Intelligence for Development Analytics) est un outil lancé en 2022 par le Bureau indépendant d’évaluation (IEO) du PNUD pour exploiter son centre de ressources en évaluation (Evaluation Resource Centre), qui rassemble près de 7 000 rapports d’évaluation produits depuis 2002 (voir aussi les bases de données d’évaluations). La première version reposait sur le traitement automatique du langage pour extraire, paragraphe par paragraphe, les constats, conclusions et recommandations des rapports. Depuis 2025, AIDA fonctionne comme un assistant conversationnel : l’utilisateur pose une question, dans la langue de son choix, et obtient une réponse construite à partir des rapports.
L’outil peut servir à synthétiser des recommandations, identifier des facteurs de succès, repérer des tendances ou des initiatives innovantes sur un thème ou un pays. Ses réponses ne valent toutefois que ce que valent les rapports sources, de qualité inégale, et ne reflètent que les évaluations du PNUD. Elles doivent être vérifiées en revenant aux documents d’origine, le jugement de l’évaluateur restant indispensable pour apprécier la pertinence des enseignements extraits.
Elicit est un assistant de recherche basé sur l’intelligence artificielle, spécialement conçu pour l’analyse et la synthèse de la littérature scientifique ou académique. Contrairement aux IA à usage général (GPAI), Elicit restreint son périmètre de recherche à des bases de données académiques vérifiées (dont Semantic Scholar), ce qui réduit le risque d’hallucination par rapport à un chatbot généraliste, sans toutefois l’éliminer. C’est un outil particulièrement pertinent pour les évaluateurs et les chercheurs qui ont besoin de réaliser des revues de littérature ou un état de l’art rigoureux sur une thématique précise.
Sa fonctionnalité phare réside dans l’extraction de données sous forme de tableau comparatif. À partir d’une question évaluative ou de recherche, Elicit est capable d’analyser des dizaines de publications simultanément (ou des PDF importés) pour en extraire des variables spécifiques : méthodologies utilisées, tailles d’échantillons, biais potentiels ou conclusions principales. L’outil rédige également des synthèses globales en citant systématiquement ses sources, pour garantir la traçabilité de l’information.
Initialement développé au sein d’Ought, un laboratoire de recherche à but non lucratif axé sur le raisonnement et l’alignement de l’IA, Elicit est aujourd’hui une entreprise à mission (Public Benefit Corporation).
Whisper est un modèle de reconnaissance vocale développé par OpenAI et publié en open source en 2022 (licence MIT). Il transcrit des enregistrements audio dans une centaine de langues, dont le français. Son principal intérêt pour l’évaluation : il peut être installé et exécuté entièrement en local, sur un ordinateur ordinaire pour les versions légères. Les enregistrements d’entretiens ou de focus groups ne transitent alors par aucun serveur tiers, ce qui facilite le respect des exigences de confidentialité propres aux données de terrain.
Whisper s’utilise en principe en ligne de commande, mais des logiciels libres conçus pour la recherche qualitative permettent de s’en servir sans compétence en programmation. noScribe et aTrain, par exemple, fonctionnent hors ligne, distinguent les différents locuteurs, ce qui est utile pour les focus groups, et facilitent la relecture de la transcription.
La qualité de la transcription dépend fortement de celle de l’enregistrement (bruit, voix qui se chevauchent, accents) et varie selon les langues : elle est nettement plus faible pour de nombreuses langues africaines. Le modèle peut aussi, occasionnellement, inventer des phrases qui n’ont pas été prononcées, notamment lors de silences. Une relecture intégrale reste donc indispensable avant toute analyse. Enfin, la transcription en local prend du temps : sur un ordinateur portable, jusqu’à deux à trois fois la durée de l’enregistrement avec les modèles les plus précis.
- Rubric Maker (Detecting-AI)
Rubric Maker génère des grilles d’évaluation (rubrics) à partir des informations fournies par l’utilisateur (sujet, niveau, objectifs) : une liste de critères assortie d’une description pour chaque niveau de performance (excellent, satisfaisant, à améliorer). Il fait gagner du temps et, partagée dès le début d’un projet, la grille permet aux personnes évaluées de connaître les attentes. Issu du monde éducatif, l’outil propose toutefois des critères génériques, à adapter au contexte de chaque évaluation.
Gephi est un logiciel libre d’analyse et de visualisation de réseaux, disponible en version de bureau ou en version web simplifiée, Gephi Lite. Ce n’est pas un outil d’intelligence artificielle, mais il complète utilement ceux présentés ici. À partir de données relationnelles simples (par exemple un tableau listant des acteurs et leurs liens), il produit des cartographies interactives. Ses algorithmes de spatialisation regroupent visuellement les entités connectées, et son module statistique calcule la position de chaque élément dans le système : degré de centralité, détection de communautés ou de sous-groupes.
Les usages en évaluation sont variés : cartographie des parties prenantes d’une politique publique, analyse des flux de financements ou d’informations entre partenaires d’un programme, observation des dynamiques de collaboration au sein d’un consortium, identification des acteurs clés sur un territoire. La carte ne vaut toutefois que ce que valent les données collectées : des liens oubliés ou mal qualifiés suffisent à fausser l’image du réseau, et la disposition graphique peut suggérer des proximités qui n’existent pas.
Le projet a été lancé en 2008 par des étudiants et chercheurs de l’Université de technologie de Compiègne (UTC). Il est aujourd’hui maintenu par une association à but non lucratif, le Gephi Consortium, qui réunit une communauté internationale de développeurs, de chercheurs et de passionnés de données. Gephi Lite, la version accessible par navigateur, a été développée par OuestWare, un studio français spécialisé dans le web et la visualisation de données.
Theorymaker est un outil web gratuit et open source créé par Steve Powell et référencé par BetterEvaluation. Il permet de construire rapidement des théories du changement, des cadres logiques (logframes) et des cartes causales, sans se perdre dans la mise en forme.
Là où la plupart des outils de dessin demandent de placer et relier chaque boîte à la main, Theorymaker inverse la logique : l’utilisateur saisit ses éléments dans une fenêtre de texte, et le diagramme se génère et se réorganise en temps réel. Depuis sa refonte en 2026, l’outil intègre un assistant IA optionnel pour construire ou affiner une chaîne causale par conversation. Ses propositions restent des hypothèses, à discuter avec les acteurs concernés.
Les nœuds peuvent être regroupés par phases, régions ou groupes d’acteurs. Le diagramme est enregistré dans l’adresse du navigateur : partager ce lien suffit pour le retrouver à l’identique, sans inscription. En contrepartie, un lien perdu signifie un diagramme perdu, et toute personne disposant du lien en voit le contenu. L’export en SVG permet enfin de retravailler le schéma dans un logiciel graphique.
AMI Labs et les World Models : à suivre
Bien qu’aucun outil opérationnel ne soit encore à la disposition des praticiens, les travaux d’AMI Labs (Advanced Machine Intelligence) méritent une veille attentive. Cette startup française, basée à Paris, a été cofondée par Yann LeCun après son départ de Meta fin 2025 : il en assure la présidence exécutive, la direction générale étant confiée à Alexandre LeBrun, fondateur de Nabla. En mars 2026, elle a levé 1,03 milliard de dollars sans avoir encore commercialisé de produit.
Sur le plan méthodologique, cette approche marque une rupture avec les grands modèles de langage (LLM), que LeCun juge intrinsèquement limités à la prédiction statistique de texte, pour développer des « world models » (modèles du monde).
Basée sur l’architecture JEPA (Joint Embedding Predictive Architecture), cette nouvelle génération de modèles vise à doter les systèmes d’IA d’une compréhension du monde physique en apprenant à partir de données sensorielles réelles plutôt que du seul langage. Là où les LLM prédisent le mot suivant, sans saisir, selon leurs critiques, les dynamiques sous-jacentes, ces modèles doivent apprendre les règles et contraintes du monde réel par observation et interaction.
Pour le secteur de l’évaluation, cette technologie s’apparente à une démarche de modélisation proche de la conception d’une théorie du changement. À terme, de tels modèles pourraient servir de simulateurs de politiques publiques, permettant non plus seulement de synthétiser des données rétrospectives, mais de tester des hypothèses et de modéliser en amont les effets d’interventions complexes, avec une compréhension plus systémique des dynamiques de terrain.

Convivialité :
Lancés en mai 2024 par le Conseil national du numérique (devenu en 2025 le Conseil national de l’IA et du numérique), les Cafés IA sont aujourd’hui portés par une mission nationale rattachée à la Direction générale des entreprises. Leur objectif : faire de l’intelligence artificielle un sujet de débat citoyen accessible à tous. Le site met à disposition un kit pour organiser des rencontres informelles dans les écoles, les entreprises, les associations ou les communes, avec des méthodes d’animation simples, des guides pratiques et des jeux pédagogiques. Chacun peut y échanger sur ses usages sans être expert, dans une logique proche des communautés de pratiques. Les discussions portent notamment sur les effets sociaux et environnementaux de l’IA et sur la place à lui donner au quotidien. Une première Semaine de l’IA pour tous a été organisée en mai 2026. Le format relève de la sensibilisation : il ouvre le débat, sans remplacer une formation aux outils.

- Intelligence artificielle : les outils
- Plateformes de suivi évaluation apprentissage
- Retour d’expérience : IA et évaluation de projets
- Structurer un système de suivi évaluation apprentissage avec l’IA
- Notes
- AI-Powered Development Project Evaluator
- I-Delphi
- Ressources
Actualisation : septembre 2026
