Article 10 AI Act : gouvernance des données, biais et preuves attendues.
La qualité ne se résume pas à un taux de complétude. L’article 10 relie conception, origine, préparation, hypothèses, représentativité, biais et contexte réel d’utilisation.
L’article 10 se traduit par une gouvernance documentée des données d’entraînement, validation et test, avec critères de pertinence, qualité, biais, traçabilité et responsabilités.
Cluster éditorial : Données, contrôles et preuve · Intention : Mettre en œuvre la gouvernance des données prévue par l’article 10
En bref
L’essentiel à retenir
01
Relier les jeux de données à la finalité, au contexte et aux populations concernées.
02
Définir des critères de qualité et de représentativité vérifiables.
03
Tracer les transformations, exclusions, versions et décisions.
04
Surveiller les dérives après la mise en production.
01
Documenter la chaîne de fabrication des jeux de données
Pour chaque jeu d’entraînement, de validation et de test utilisé, conservez les choix de conception, les processus de collecte et l’origine, les opérations de préparation, les hypothèses et l’évaluation de la disponibilité, de la quantité et de l’adéquation.
L’examen doit repérer les biais susceptibles de porter atteinte à la santé, à la sécurité, aux droits fondamentaux ou de produire une discrimination interdite. Les mesures de détection, de prévention et d’atténuation doivent être reliées aux populations, aux usages et aux seuils de décision.
Prouver la pertinence dans le contexte de déploiement
Les jeux doivent être pertinents, suffisamment représentatifs et, dans toute la mesure possible, exempts d’erreurs et complets au regard de la destination. Ils doivent aussi tenir compte des caractéristiques géographiques, contextuelles, comportementales ou fonctionnelles du cadre d’usage.
Cartographiez les sources, droits d’utilisation, périodes, populations, transformations, enrichissements et exclusions. Distinguez les données d’entraînement, de validation, de test et d’exploitation. Reliez chaque jeu à une version du système et à un responsable. Cette traçabilité permet de comprendre une performance, de reproduire un test et d’investiguer un incident.
Pour un système acheté, demandez au fournisseur les informations disponibles et documentez les limites d’accès. Le déployeur complète avec ses propres données d’entrée, ses paramètres et les observations du contexte local. Une absence d’information devient un risque à traiter, pas une case supposée conforme.
La qualité ne se résume pas à l’absence de valeurs manquantes. Définissez la pertinence, la fraîcheur, la précision, la cohérence et la représentativité nécessaires à la finalité. Analysez les erreurs par population, contexte et situation rare. Un résultat moyen peut masquer un écart grave pour un groupe ou une zone d’utilisation.
Documentez les seuils acceptables, la méthode d’échantillonnage et les limites. Lorsque le volume est faible, complétez les statistiques par une analyse métier et des tests ciblés. Les décisions d’acceptation doivent être explicites, datées et reliées au risque.
En recrutement, vérifiez que les historiques ne reproduisent pas mécaniquement des pratiques discriminatoires et que les catégories pertinentes sont représentées. Dans l’industrie, contrôlez les capteurs, les régimes de fonctionnement et les conditions environnementales. Dans la finance, analysez la stabilité des variables et les écarts entre segments. Dans le commerce, surveillez les effets de saison et les boucles créées par les recommandations.
Pour un modèle génératif, les contrôles locaux portent aussi sur les sources documentaires, les droits, les instructions, les filtres, les tests de réponses et la capacité à citer. Le fait que le modèle de base soit fourni par un tiers n’élimine pas la responsabilité sur la configuration et l’utilisation.
Surveiller les données et les effets après déploiement
Définissez des indicateurs de dérive, de qualité des entrées, de performance et d’écarts entre populations. Attribuez un seuil, un responsable et une action à chaque alerte. Conservez les versions de données, résultats de tests et décisions de continuer, corriger, limiter ou suspendre.
Reliez cette surveillance aux incidents et aux changements. Une nouvelle source, une modification de collecte ou l’arrivée d’une population différente peut invalider les hypothèses initiales. La gouvernance des données est donc un cycle, pas un contrôle ponctuel avant lancement.
Son application dépend du système et du rôle, mais une gouvernance cohérente doit couvrir les données qui influencent la performance et le risque.
Documentez la limite, demandez les preuves alternatives disponibles, renforcez les tests locaux et décidez si le risque résiduel est acceptable.
Comparez le jeu aux populations et situations de l’usage prévu, puis analysez les écarts de performance pertinents.
Appliquez les règles de protection et de conservation. Conservez au moins la traçabilité, les versions, les critères, les résultats et les décisions nécessaires.
Le propriétaire des données, le métier, la technique et les fonctions de contrôle contribuent selon les enjeux et les responsabilités.