Action publique——Analyse

Transparence performée : la CNAF ouvre son code pour mieux fermer ses données

Le 15 janvier 2026, la Caisse nationale des allocations familiales (CNAF) a mis en ligne le code source de son nouvel algorithme de ciblage des contrôles, le DMDE 2026. L'organisme montre la mécanique, c'est-à-dire les variables et leurs pondérations, mais soustrait la genèse, c'est-à-dire les données qui ont entraîné le modèle. Cet écart entre ce qui est exposé et ce qui reste dans l'ombre est l'objet de cette analyse : la publication du code fonctionne moins comme une reddition de comptes que comme un déplacement du regard, au moment précis où le contentieux devant le Conseil d'État entre dans sa phase décisive.

AB
Par Alexandre Berge24 septembre 2026 · 17 min de lecture
Une vitrine expose trois rouages, mais des tiroirs opaques masquent le cœur du dispositif observé par une femme.
Entre ambition et réalité : les transformations à l’épreuve du terrain.

Ouvrir le code, janvier 2026 : ce que la CNAF montre

Le fait est daté et vérifiable. Depuis le 15 janvier 2026, quiconque veut examiner le fonctionnement du « DataMining Données Entrantes » (DMDE 2026), l'outil statistique que les caisses d'allocations familiales utilisent pour repérer les dossiers présentant un risque de trop-perçu, peut consulter son code source en ligne sur le site de la CNAF. Le modèle est codé en Python et en PySpark (l'interface Python du moteur de calcul distribué Apache Spark). Il attribue un score de risque à chaque dossier parmi les 13,8 millions de foyers allocataires, un contrôleur humain décidant ensuite d'engager ou non une vérification.

La note détaillée publiée par la CNAF en janvier 2026 précise l'architecture. Le dispositif repose sur deux régressions logistiques (des modèles statistiques qui pondèrent des variables pour estimer une probabilité) coexistant durant la transition liée à la réforme de la « solidarité à la source ». Le modèle 1, applicable aux périodes antérieures au préremplissage des déclarations, comporte 17 variables. Le modèle 2, postérieur, en comporte 11. Parmi les variables figurent la situation d'activité du responsable de dossier et de son conjoint, la présence d'un enfant de plus de dix-neuf ans dans le foyer, ou encore le montant moyen de prestations perçues sur les douze derniers mois.

L'organisme revendique une démarche « éthique dès la conception ». Un comité d'éthique consultatif, installé en mars 2025, et une charte encadrent le développement. Certaines données jugées sensibles ou discriminantes ont été explicitement exclues du modèle : la nationalité, le genre, l'adresse et le lieu de résidence, de même que les informations sur le comportement ou l'historique de contentieux. La note technique indique par ailleurs qu'aucune variable relative à la perception de prestations liées au handicap (l'allocation aux adultes handicapés ou l'allocation d'éducation de l'enfant handicapé) n'a été retenue à l'issue de la phase de sélection statistique. Dans son édito au dossier de presse, le directeur général Nicolas Grivel place la démarche sous le signe d'un objectif : « Conjuguer efficacité des contrôles avec la transparence et l'éthique dans l'usage des données. »

Le geste est réel et, à l'aune des versions précédentes, notable. La CNAF avait jusqu'alors refusé de communiquer le code de l'algorithme en service. La Quadrature du Net elle-même salue l'ouverture. C'est précisément ce qui rend le cas intéressant : la question n'est pas de savoir si l'administration cache son IA, mais ce que produit le fait de la sur-exposer partiellement.

Ce que la CNAF ne montre pas : la genèse plutôt que la mécanique

Ce que la publication laisse dans l'ombre est identifiable avec précision. Les données d'entraînement, celles qui ont façonné les coefficients du modèle et donc les profils jugés « à risque », ne sont pas communiquées. Voir le code sans accéder à ces données revient à lire une recette sans connaître les ingrédients réellement employés : la logique est visible, le résultat effectif ne l'est pas. Sans les données d'apprentissage, il devient impossible de vérifier de l'extérieur si le modèle reproduit ou amplifie des biais sociaux, quand bien même les variables les plus sensibles ont été retirées de la liste finale.

L'exclusion affichée de la nationalité, du genre et de l'adresse ne referme pas la question, elle la déplace. Un modèle statistique peut restituer un critère écarté par le jeu des corrélations entre variables conservées. Le cas du revenu illustre le mécanisme. Percevoir le RSA ou la prime d'activité continue de faire monter le score dans le DMDE 2026. La CNAF avance une justification technique cohérente : ces prestations, calculées à partir de ressources que les allocataires déclarent eux-mêmes, génèrent statistiquement davantage d'écarts, donc de trop-perçus. Mais l'effet reste le même : en ciblant les prestations les plus déclaratives, l'outil sélectionne mécaniquement les foyers les plus modestes, non parce qu'ils fraudent davantage, mais parce que leurs droits sont les plus complexes à liquider.

Le juriste de La Quadrature du Net Bastien Le Querrec résume le déplacement : la question n'est plus « comment fonctionne le code » mais « sur quoi a-t-il appris ». C'est ce cadrage que le concept académique central de cette analyse permet de nommer.

La « transparence sans savoir » (Ananny et Crawford, 2018). 

Dans « Seeing without knowing: Limitations of the transparency ideal and its application to algorithmic accountability » (New Media & Society, vol. 20, n° 3, 2018, p. 973-989), Mike Ananny et Kate Crawford soutiennent que rendre un système visible n'équivaut pas à le rendre intelligible ni gouvernable. Ils recensent dix limites de l'idéal de transparence et proposent d'en sortir en reliant l'accès à l'information à une capacité effective d'action. Voir un système (seeing) ne produit pas le savoir (knowing) nécessaire pour le tenir responsable. Appliqué au DMDE 2026, le cadre éclaire un point aveugle : la publication du code satisfait l'exigence de visibilité tout en laissant intacte l'opacité qui compte, celle de la construction du modèle.

De la boîte noire à la visibilité orientée

Le cas résiste à la métaphore la plus répandue en matière d'algorithmes publics, celle de la « boîte noire ». Dans The Black Box Society (2015), Frank Pasquale décrit des systèmes dont l'invisibilité protège le pouvoir de ceux qui les opèrent : le problème est alors le secret, et le remède supposé, l'ouverture. Or la CNAF a ouvert. Le code est public, les pondérations sont lisibles, la démarche est documentée. Si l'analyse s'arrêtait à Pasquale, le cas serait clos et le grief serait levé.

C'est ici que la lecture d'Ananny et Crawford se révèle plus opératoire. Le problème n'est pas l'invisibilité mais une visibilité orientée, qui donne à voir la zone la moins litigieuse (la mécanique de calcul) et maintient hors champ la zone la plus litigieuse (la fabrication des coefficients à partir de données d'apprentissage non communiquées). La transparence, loin de dissoudre la controverse, en redessine le périmètre. Elle simule la reddition de comptes en fournissant un objet inspectable qui n'est pas celui sur lequel porte le litige. Le concept accomplit ici un travail que « boîte noire » ne peut pas faire : il distingue l'ouverture qui informe de l'ouverture qui désamorce.

Le découplage : une charte éthique, un contrôle inchangé

Reste à comprendre pourquoi une organisation publie ce qui l'expose. La sociologie des organisations offre un mécanisme. Dans « Institutionalized Organizations: Formal Structure as Myth and Ceremony » (American Journal of Sociology, vol. 83, n° 2, 1977, p. 340-363), John Meyer et Brian Rowan montrent que les organisations adoptent des structures formelles conformes aux attentes de leur environnement pour gagner en légitimité, puis découplent (decoupling) ces structures de leur activité réelle. La façade cérémonielle et l'opération quotidienne évoluent en parallèle sans se contraindre mutuellement.

La grille s'applique au cas. Le comité d'éthique, la charte, le code ouvert et le vocabulaire de la « transparence » constituent une structure formelle qui répond à une attente sociale et juridique montante. Rien n'indique que cette structure modifie la politique de contrôle elle-même : le volume des vérifications, l'orientation vers les prestations déclaratives et la logique de ciblage des dossiers à fort enjeu financier restent inchangés. Le comité d'éthique est explicitement consultatif et n'a pas le pouvoir d'empêcher un usage. L'ouverture est réelle au plan symbolique et découplée au plan opérationnel.

Ce découplage éclaire l'angle mort du débat, que ni l'institution ni, dans une moindre mesure, ses critiques ne formulent pleinement. En se concentrant sur la technique (variables, pondérations, données), la controverse laisse dans l'ombre la politique de contrôle qui précède l'outil. Le sociologue Vincent Dubois, dans Contrôler les assistés. Genèses et usages d'un mot d'ordre (Raisons d'agir, 2021), a montré que le datamining n'a pas créé la différenciation sociale du contrôle mais l'a intensifiée, tout en permettant à l'institution de se dédouaner de ses propres choix en les présentant comme la déduction neutre d'un modèle. La publication du code prolonge ce mouvement : elle donne à débattre d'un artefact technique là où se joue une orientation de l'action publique. Le cas montre aussi que le code ne dit rien de la manière dont les agents contrôleurs utilisent effectivement les scores, ni de la marge locale entre la prescription statistique et la pratique de terrain, un écart entre livraison et adoption qui échappe entièrement à l'inspection du dépôt de code.

Le rapport de proportion que le code ne montre pas.

Les données de cadrage situent l'enjeu. Selon le dossier de presse de la CNAF du 15 janvier 2026, le score du DMDE n'oriente que 0,5 % de l'ensemble des contrôles (soit 6,5 % des seuls contrôles sur pièces ou sur place), l'essentiel des vérifications relevant de régularisations automatisées issues d'échanges de données. Surtout, dans son rapport de certification publié le 16 mai 2025, la Cour des comptes a refusé de certifier les comptes de la branche famille pour la troisième année consécutive (exercices 2022, 2023 et 2024), relevant fin 2024 « 6,3 Md€ de versements indus mais aussi de prestations non versées (…) qui ne seront jamais régularisés », soit 8 % du montant des prestations, majoritairement des erreurs déclaratives et non des fraudes. La fraude détectée en 2025 s'établissait, selon la CNAF, à 508,8 millions d'euros. L'écart entre le stock d'erreurs et le montant de fraude situe la nature réelle du phénomène que l'algorithme est censé traiter.

Parcoursup, ou la transparence sélective déjà éprouvée

Le cas n'est pas isolé. Il rejoue, sur un autre terrain, une configuration que le droit français a déjà connue : la publication partielle d'un algorithme public comme réponse à une exigence de transparence, calibrée pour préserver la zone jugée non communicable. Le précédent le plus proche structurellement est celui de Parcoursup.

Saisi par l'Union nationale des étudiants de France, le Conseil constitutionnel a jugé, dans sa décision n° 2020-834 QPC du 3 avril 2020, que le droit d'accès aux documents administratifs a valeur constitutionnelle au titre de l'article 15 de la Déclaration de 1789. Il a néanmoins validé le régime dérogatoire du code de l'éducation qui protège les « algorithmes locaux » des établissements au nom du secret des délibérations des équipes pédagogiques, en n'ouvrant l'accès des tiers qu'une fois la procédure achevée. La structure est parallèle à celle du DMDE : une administration expose les critères généraux et maintient hors de portée la partie opérante du dispositif, le juge arbitrant la ligne entre ce qui doit être montré et ce qui peut rester couvert. Dans les deux cas, la transparence est réelle, sélective, et son périmètre est précisément l'objet du litige. La différence est instructive : la CNAF, elle, n'a pas attendu une injonction pour publier, ce qui déplace la transparence du registre de l'obligation subie vers celui de l'initiative défensive.

D'autres épisodes bordent le champ sans en offrir la même proximité. Aux Pays-Bas, le tribunal de La Haye a invalidé le 5 février 2020 le système de détection de fraude sociale SyRI au nom du droit à la vie privée, sans ordonner la divulgation du modèle de risque. Le scandale néerlandais des allocations familiales (toeslagenaffaire), qui a provoqué la démission du gouvernement Rutte en janvier 2021, a révélé les effets d'un profilage opaque sur des dizaines de milliers de familles. Chacun de ces cas confirme la centralité contemporaine de la question des données et du profilage, mais aucun ne met en scène, comme la CNAF et Parcoursup, la publication partielle elle-même comme instrument.

Ce que le droit européen déplace vers les données

Le cadre juridique explique pourquoi la zone soustraite est aussi celle qui compte. En droit interne, la loi pour une République numérique du 7 octobre 2016 a instauré, à l'article L. 311-3-1 du code des relations entre le public et l'administration, un droit à la communication des règles définissant un traitement algorithmique, précisé par l'article R. 311-3-1-2 qui vise les paramètres et leur pondération. La publication du code satisfait largement cette exigence, centrée sur les règles de calcul.

Le droit de l'Union, lui, pousse la focale en amont. L'article 22 du RGPD encadre les décisions automatisées, et la Cour de justice de l'Union européenne a, dans son arrêt SCHUFA du 7 décembre 2023 (C-634/21), qualifié de décision automatisée le score de probabilité utilisé de manière déterminante par un tiers, même en présence d'une validation humaine formelle. L'arrêt Dun & Bradstreet Austria du 27 février 2025 (C-203/22) a précisé le contenu du droit à l'information : le responsable doit expliquer « la logique sous-jacente » de manière à permettre une compréhension effective, sans que le secret des affaires y fasse obstacle devant l'autorité ou le juge. Ce mouvement jurisprudentiel valorise l'explicabilité réelle plutôt que la seule mise à disposition du code. Enfin, le règlement européen sur l'intelligence artificielle prohibe depuis le 2 février 2025, à son article 5, la notation sociale par les autorités publiques lorsqu'elle conduit à un traitement défavorable détaché de son contexte, une qualification dont la portée exacte sur les scores de contrôle social reste discutée.

C'est sur ce terrain que se joue le contentieux. Le 16 octobre 2024, quinze organisations conduites par La Quadrature du Net, parmi lesquelles Amnesty International France, la Ligue des droits de l'Homme, le Gisti, la Fondation Abbé Pierre et le Syndicat des avocats de France, ont saisi le Conseil d'État pour faire interdire l'algorithme, au nom de la protection des données personnelles et du principe de non-discrimination. La coalition s'est élargie à vingt-cinq organisations le 20 janvier 2026, avec l'arrivée de dix nouvelles structures dont des ONG européennes de défense des droits fondamentaux. La Défenseure des droits, Claire Hédon, a transmis en octobre 2025 des observations, non rendues publiques, dans lesquelles, selon les éléments rapportés par la presse, elle estime que le traitement paraît produire un surcontrôle des populations les plus précaires et qu'une présomption de discrimination indirecte semble établie. La coalition a par ailleurs versé au dossier une étude interne de la CNAF datant d'octobre 2025 dont elle indique qu'elle reconnaît des effets discriminatoires. La phase écrite du contentieux devait se clore fin janvier 2026, une audience publique étant attendue par les requérants au printemps, et une demande de renvoi préjudiciel à la CJUE a été formulée.

La décision à venir se jouera sur les données d'apprentissage

Le titre annonçait un paradoxe : un code sans les données, une transparence qui protège en exposant. Le chapô posait l'écart entre le discours d'éclaircissement et la trace d'exécution. Les concepts mobilisés convergent : la « transparence sans savoir » d'Ananny et Crawford nomme la visibilité orientée, le découplage de Meyer et Rowan explique la coexistence d'une façade éthique et d'une pratique inchangée, la sociologie de Dubois désigne l'orientation politique que la technique recouvre. Le cas montre une administration qui ne dissimule pas son outil mais le sur-expose là où l'exposition coûte le moins.

De là une hypothèse vérifiable. Si la logique de transparence-écran domine effectivement, alors la question décisive que le Conseil d'État devra trancher portera sur la communicabilité des données d'apprentissage, et non sur le seul code déjà public. L'indicateur observable, constatable par tout lecteur à la lecture de la décision sans accès à aucune information interne, sera la présence explicite, dans les motifs ou le dispositif, de la notion de données d'entraînement ou d'apprentissage, distincte de celle de règles de traitement. La jurisprudence Dun & Bradstreet, en consacrant un droit à la logique sous-jacente, rend cette bascule plausible. Horizon de vérification : la décision au fond, ou un éventuel renvoi préjudiciel à la CJUE, attendus à un horizon de douze à vingt-quatre mois à compter du printemps 2026.


Note méthodologique

L'analyse s'appuie sur les sources primaires de la CNAF (note détaillée et dossier de presse de janvier 2026, page « Modèle de datamining données entrantes ») et sur les publications de La Quadrature du Net, recoupées par la presse spécialisée (CIO, Clubic, Le Média social). Trois arbitrages factuels ont été rendus. Les observations de la Défenseure des droits n'étant pas publiques, leur teneur est restituée au discours indirect à partir de la presse (Mediapart, 20 janvier 2026, reprenant des extraits non vérifiables dans une source primaire accessible) et signalée comme telle. L'étude interne de la CNAF de 2025 n'étant pas publique, son contenu est attribué à la restitution qu'en donne La Quadrature du Net, sans vérification indépendante possible. La part des contrôles orientés par le score varie selon les sources (0,5 % selon la CNAF, jusqu'à 1 % selon certains relais de presse) et est traitée en ordre de grandeur ; le nombre de foyers allocataires est donné à 13,8 millions par la presse spécialisée, la CNAF évoquant par ailleurs 13,5 millions d'allocataires selon le périmètre retenu. Deux pistes de parallèle historique ont été écartées au profit de Parcoursup : SyRI et le scandale néerlandais des allocations, structurellement centrés sur l'opacité et non sur la publication partielle. Le concept de « transparence sans savoir » a été retenu comme central car il opère un travail que la métaphore de la boîte noire ne permet pas dans un cas où l'ouverture a bien eu lieu.

image générée par IA (ChatGPT Images 2.5)


Sources

Sources primaires institutionnelles

CNAF, « Présentation détaillée du DataMining Données entrantes 2026 », note détaillée, janvier 2026. https://www.caf.fr/sites/default/files/medias/cnaf/Note_explicative_datamining.pdf

CNAF, « Transparence et garanties éthiques autour de l'algorithme d'appui aux contrôles des Caf », dossier de presse, 15 janvier 2026. https://www.caf.fr/professionnels/actualites/controles-caf-transparence-et-garanties-ethiques-autour-de-l-algorithme

CNAF, « Modèle de datamining données entrantes », page de publication du code source du DMDE 2026, mise en ligne le 15 janvier 2026. https://www.caf.fr/professionnels/etudes-et-international/donnees-et-outils/modele-de-datamining-donnees-entrantes

République française, code des relations entre le public et l'administration, article L. 311-3-1, issu de la loi n° 2016-1321 du 7 octobre 2016 pour une République numérique. https://www.legifrance.gouv.fr/codes/article_lc/LEGIARTI000033205535

République française, code des relations entre le public et l'administration, article R. 311-3-1-2, décret n° 2017-330 du 14 mars 2017. https://www.legifrance.gouv.fr/codes/article_lc/LEGIARTI000034195881

Rapports et actes officiels

Cour des comptes, « Certification des comptes du régime général de la sécurité sociale, exercice 2024 », 16 mai 2025. Troisième refus consécutif de certification des comptes de la branche famille. https://www.ccomptes.fr

Conseil constitutionnel, décision n° 2020-834 QPC, Union nationale des étudiants de France, 3 avril 2020. Algorithmes locaux de Parcoursup et droit d'accès aux documents administratifs. https://www.conseil-constitutionnel.fr/decision/2020/2020834QPC.htm

Défenseure des droits, observations transmises au Conseil d'État dans le contentieux relatif à l'algorithme de la CNAF, octobre 2025. Document non public, à vérifier avant publication.

Cadres théoriques

Mike Ananny et Kate Crawford, « Seeing without knowing: Limitations of the transparency ideal and its application to algorithmic accountability », New Media & Society, volume 20, numéro 3, 2018, pages 973 à 989. https://doi.org/10.1177/1461444816676645

Frank Pasquale, The Black Box Society. The Secret Algorithms That Control Money and Information, Harvard University Press, 2015.

John W. Meyer et Brian Rowan, « Institutionalized Organizations: Formal Structure as Myth and Ceremony », American Journal of Sociology, volume 83, numéro 2, 1977, pages 340 à 363. https://doi.org/10.1086/226550

Vincent Dubois, Contrôler les assistés. Genèses et usages d'un mot d'ordre, Raisons d'agir, 2021.

Droit européen et parallèles historiques

Cour de justice de l'Union européenne, SCHUFA Holding, affaire C-634/21, arrêt du 7 décembre 2023, ECLI:EU:C:2023:957. https://curia.europa.eu/juris/liste.jsf?num=C-634/21

Cour de justice de l'Union européenne, Dun & Bradstreet Austria, affaire C-203/22, arrêt du 27 février 2025. https://curia.europa.eu/juris/liste.jsf?num=C-203/22

Parlement européen et Conseil, règlement (UE) 2024/1689 établissant des règles harmonisées concernant l'intelligence artificielle, 13 juin 2024, article 5. https://eur-lex.europa.eu/legal-content/FR/TXT/?uri=OJ:L_202401689

Tribunal de première instance de La Haye, NJCM et autres contre État néerlandais (SyRI), jugement du 5 février 2020, ECLI:NL:RBDHA:2020:1878. https://uitspraken.rechtspraak.nl/details?id=ECLI:NL:RBDHA:2020:1878

Presse spécialisée et publications associatives

La Quadrature du Net, « Notation des allocataires : la CNAF publie son code mais omet l'essentiel », 26 février 2026. https://www.laquadrature.net/2026/02/26/notation-des-allocataires-la-cnaf-publie-son-code-mais-omet-lessentiel/

CIO, « Scoring à la Cnaf, un petit pas vers la transparence », 4 février 2026. https://www.cio-online.com/actualites/lire-scoring-a-la-cnaf-un-petit-pas-vers-la-transparence-16821.html

Clubic, « Oui, la CAF a ouvert son algorithme, mais la transparence s'arrête là », 27 février 2026. https://www.clubic.com/actualite-602446-oui-la-caf-a-ouvert-son-algorithme-mais-la-transparence-s-arrête-la.html

Mediapart, « L'algorithme de la CAF peut provoquer une discrimination indirecte, juge le Défenseur des droits », 20 janvier 2026. Accès restreint aux abonnés. https://www.mediapart.fr/journal/france/200126/l-algorithme-de-la-caf-peut-provoquer-une-discrimination-indirecte-juge-le-defenseur-des-droits


Voir aussi

Toutes les analyses