consulting-numerique.com

Conseil numérique · mise à jour du 27 septembre 2026

Méthode

La base vectorielle enrichit la requête avant le modèle

Le guide ANSSI-PA-102, version 1.0 du 29 avril 2024, aligne 35 recommandations pour un système d'IA générative [1]. L'architecture qu'il décrit stocke des données d'indexation dans une base vectorielle, afin d'enrichir la requête avant le modèle, sous le nom RAG. La page du même guide, publiée le même jour, laisse de côté la qualité des données et la performance métier [2].

Publié le · Mis à jour le

Recommandations du guide

35

Version 1.0 du 29 avril 2024, référence ANSSI-PA-102. La liste va de R1 à R35 [1].

À retenir

  • La base vectorielle sert à enrichir la requête avant le modèle. Le guide l'appelle RAG.
  • Les droits d'accès se posent sur les documents de production. Ils ne se posent pas sur l'entraînement.
  • Le score 44,5 de l'article de 2020 mesure un index Wikipédia, pas un fonds d'entreprise.

Le sigle désigne ici une architecture : une recherche documentaire, puis une génération. Les rôles, les registres et les dates du règlement sont sur la page de la gouvernance de l'IA. On ne les recalcule pas. On retient ce que les textes ouverts disent du fonds documentaire, des droits et de l'évaluation.

Deux définitions, deux graphies

La foire aux questions de la CNIL, datée du 18 juillet 2024, appelle cela la génération augmentée de récupération, en anglais « Retrieval Augmented Generation ». Le mécanisme cherche dans une base de données vectorisée, ou embedding. Il produit des réponses enrichies par des données externes, « potentiellement plus spécifiques et plus faciles à actualiser que le modèle lui-même ». La méthode demande davantage de ressources et de compétences qu'un modèle sur étagère. Elle est « plus facile à adapter » et permet « davantage de traçabilité des informations contenues dans les réponses » [3].

Le PDF de l'ANSSI, version 1.0, écrit une autre graphie : « Retrieval Augmentation Generation », sans le d de augmented. La phrase décrit « la base de données vectorielle, qui est généralement utilisée pour stocker sous forme de vecteurs des données d'indexation de données additionnelles, dans le but d'enrichir les requêtes des utilisateurs avant l'envoi au modèle ». Cette base peut venir de sources internes ou de sources partenaires. La note 7 ajoute qu'elle sert, dans le contexte des grands modèles de langue, à établir des comparaisons et à identifier des relations entre objets. Le schéma qui porte cette phrase « ne reprend pas de manière exhaustive l'ensemble des composants ». Il signale aussi des filtres en entrée et en sortie, et des plugins [1].

La même page sépare ce branchement d'un ajustement. Le fine-tuning « consiste à modifier les paramètres (poids) d'un modèle tout en conservant son architecture principale » et « requiert des ressources importantes, notamment en termes de capacités de calcul ». Le texte ne donne ni un nombre de jours ni un prix. Il recommande des systèmes qui limitent les hallucinations, citent leurs sources et filtrent les sorties. Aucun de ces trois critères n'est chiffré.

Les modèles génératifs, écrit encore la CNIL, « ne sont pas des bases de connaissance ». Ils suivent une logique probabiliste et peuvent produire des résultats inexacts qui paraissent plausibles. Le cas cité est une information absente des données d'entraînement, par exemple un événement postérieur au développement, lorsque le système n'est pas relié à une base actualisée. Une confiance excessive sans vérification « peut donc conduire à des décisions erronées ». La note 14 du guide ANSSI définit l'hallucination comme un contenu erroné qui n'est pas basé sur des données réelles.

21 millions de passages, un index de décembre 2018

L'article de Patrick Lewis et de ses coauteurs, dans les actes de NeurIPS dont l'URL porte l'année 2020, nomme retrieval-augmented generation des modèles qui combinent une mémoire paramétrique pré-entraînée et une mémoire non paramétrique. La première est un modèle seq2seq. La seconde est un index vectoriel dense de Wikipédia, interrogé par un retriever neuronal. Le générateur retenu est BART-large, « a pre-trained seq2seq transformer with 400M parameters », soit 400 millions de paramètres. Le jour de la session du congrès n'est pas imprimé dans les pages lues [5].

L'index utilise l'extrait Wikipédia de décembre 2018. Chaque article est découpé en blocs disjoints de 100 mots, « to make a total of 21M documents ». L'entraînement considère 5 ou 10 documents retrouvés. RAG-Sequence conditionne toute la séquence sur le même passage. RAG-Token peut changer de passage à chaque jeton. Le retriever est initialisé depuis Dense Passage Retriever. Le générateur concatène la question et le passage.

Le tableau 1, scores de test en question-réponse ouverte, donne la correspondance exacte sur Natural Questions. RAG-Sequence est à 44,5. RAG-Token est à 44,1. T5-11B en livre fermé, sans recherche, est à 34,5 sur la même colonne. REALM est à 40,4 et DPR à 41,5. Ces écarts comparent des systèmes sur Wikipédia. Ils ne décrivent pas le taux de bonnes réponses d'un assistant branché sur les procédures d'une société.

Le modèle peut générer une réponse juste alors que le passage retrouvé ne la contient pas : 11,8 % de ces cas sur Natural Questions, là où un modèle extractif serait à 0 %. Sur MS-MARCO ouvert, les auteurs écrivent que RAG-Sequence dépasse BART de 2,6 points Bleu et de 2,6 points Rouge-L. Le remplacement de l'index, sans ré-entraînement, est testé sur 82 dirigeants dont la fonction a changé entre les extraits de décembre 2016 et de décembre 2018. Index et titulaires de la même année : 70 % puis 68 %. Index croisés : 12 % et 4 %. La connaissance se met à jour en remplaçant la mémoire non paramétrique.

Trois stocks de données, un seul où les droits se posent

Le guide demande, à la recommandation R7, de cartographier les jeux de chaque phase. En production, la liste nomme les données additionnelles et la base vectorielle, plus les requêtes des utilisateurs et les réponses. Un modèle « hérite de la sensibilité des données qui ont contribué à l'entraîner ». Le mot du guide pour la restitution involontaire de ces données est « régurgitation ». R18 en tire une consigne forte : entraîner avec des données dont la sensibilité reste cohérente avec le besoin d'en connaître des utilisateurs. Le postulat écrit juste avant est qu'une personne qui interroge le modèle pourrait atteindre les données d'entraînement [1].

R8 sépare trois stocks. Sur les données d'entraînement, « la gestion de droits d'accès pour les utilisateurs n'est pas possible » à cause du design des réseaux de neurones. Sur les données additionnelles en production, elle est possible, selon les outils, nommés RBAC pour Role Based Access Control : gestion documentaire interne ou base vectorielle. Sur les requêtes et les réponses, des données sensibles peuvent être stockées le temps du traitement, et parfois réutilisées pour ré-entraîner.

Le système « doit intégrer la question des droits d'accès et du respect du besoin d'en connaître dans les réponses qu'il apporte ». Le guide ne publie pas un schéma de rôles. Il renvoie aux possibilités de l'outil de stockage.

R29 demande de journaliser les requêtes, les traitements appliqués avant l'envoi au modèle, les appels aux plugins, les appels aux données additionnelles, les filtres de sortie et les réponses. Il faut distinguer la requête de l'utilisateur et « les données réellement envoyées au modèle », parce qu'un prétraitement les modifie. Dans une architecture qui concatène des passages, ce second journal est celui de la recherche. La durée de conservation est renvoyée à la CNIL, sans nombre de mois dans ce paragraphe. R21 déconseille fortement de ré-entraîner le modèle directement en production. L'apprentissage en continu est « à éviter au possible ». Un rythme « tous les mois » est un exemple, à côté d'un seuil de performance ou d'une demande ponctuelle.

Huit lignes, et la limite de chacune

Ce que chaque texte ouvert demande, et ce qu'il ne mesure pas
ContrôleTexteRègle ou chiffre lusLimite
Architecture, avant le modèleANSSI, 29 avril 2024Base vectorielle, nommée RAGSchéma non exhaustif. Graphie : Augmentation
Droits d'accèsRecommandation R8Possibles en production, pas à l'entraînementSelon le contrôle d'accès de l'outil
JournauxRecommandation R29Appels aux données additionnellesDurée renvoyée à la CNIL, sans chiffre
Tests des réponsesR24 et page du guidePerformance et qualité, sans scoreLa page exclut la performance métier
Outil grand publicRecommandation R34Le corps écrit : obligatoireLe préambule écarte le caractère normatif
Cloud publicRecommandation R14SecNumCloud si les données sont sensiblesListe des offres non rouverte
Index de recherche, 2020Lewis et al., tableau 121 millions de passages. Score 44,5Wikipédia, décembre 2018
Catalogue France TravailCNIL, décembre 2024Plus de 20 000 formationsAccompagnement de janvier à juin 2024

Télécharger ce tableau au format CSV. ANSSI, guide du 29 avril 2024. CNIL, 18 juillet 2024 et note de décembre 2024. Lewis et al., actes NeurIPS 2020.

La page de présentation du guide, publiée le 29 avril 2024, écrit que les problèmes de sécurité liés à la qualité des données et à la performance d'un modèle « d'un point de vue métier » ne sont pas traités, non plus que l'éthique, la vie privée ou la protection des données personnelles. La recommandation R24, dans le PDF, demande pourtant des tests de performance et de qualité des réponses avant le déploiement, et un encadré ajoute que ces tests peuvent continuer à une fréquence donnée. Aucun seuil n'accompagne la recommandation. Les deux phrases se lisent ensemble : le guide demande de tester, et sa page d'accueil dit qu'il ne traite pas la performance métier [2].

R23 place, avant la production, des tests d'intrusion sur les composants usuels, dont la base de données, et des tests visant les modèles. Le PDF mentionne des prestataires PASSI qualifiés par l'ANSSI, sans les compter. R25 ajoute des filtres sur les requêtes malveillantes, les requêtes non légitimes du point de vue métier, les informations internes du modèle et les informations sensibles, plus une limite de taille. Les réponses doivent rester de simples chaînes de caractères, sans le vecteur de score. R4 demande d'évaluer la confiance des sources externes, y compris les jeux additionnels de production.

Le préambule borne l'ensemble. Sauf disposition réglementaire contraire, les recommandations « n'ont pas de caractère normatif ». Elles sont adaptées aux menaces du 29 avril 2024. Le tableau des évolutions s'arrête à la version initiale. Aucune version ultérieure n'a été ouverte le 27 septembre 2026.

Sur site, cloud, outil grand public

Pour des données personnelles, clients ou collaborateurs, ou une documentation sensible ou stratégique, « par exemple pour le RAG », la CNIL écrit qu'il « semble généralement plus opportun et plus sécurisé » de privilégier un déploiement sur site, afin de limiter l'extraction auprès d'un tiers. La parenthèse renvoie au guide de l'ANSSI. Le même paragraphe dit que l'installation sur site a un coût, sans le chiffrer, et qu'une infrastructure distante sera souvent plus aisée, avec un contrat de sous-traitance sur les responsabilités et les accès. Une API laisse « la maîtrise du système » quasi exclusivement au fournisseur [3].

R14 vise le cloud public, un hébergement mutualisé exposé sur Internet. Il recommande d'y privilégier SecNumCloud si les données sont sensibles, si l'impact métier est critique, ou si les utilisateurs ne sont pas de confiance. La liste des offres qualifiées n'a pas été rouverte. R34 vise l'outil grand public. Le corps écrit qu'il est obligatoire de ne jamais y intégrer de données sensibles. Le préambule du même PDF écarte le caractère normatif. Une clause qui reprend cette tension est sur la page de la charte d'utilisation de l'IA.

R9 interdit les actions critiques automatisées : transaction, contenu publié, effet direct sur une personne, reconfiguration d'un réseau, création d'un compte à privilège, déploiement d'un serveur. R27 vise les actions automatiques déclenchées par des entrées non maîtrisées, par exemple un courriel ou une page web. Le guide nomme alors l'injection de requête indirecte. L'article cité en note n'a pas été ouvert : seul le nom du risque est repris. Le cas où le système enchaîne des actions est sur la page des agents d'IA en entreprise. R35 demande une revue des droits sur les applications métier dès l'activation, puis une revue régulière, avec l'exemple « tous les mois ».

Plus de 20 000 formations, un modèle sur site

La note de la CNIL sur le projet « Conseils Personnalisés », rédigée en décembre 2024 et publiée dans le recueil de mars 2025, décrit un accompagnement de France Travail de janvier à juin 2024. L'outil recommande des formations à partir du profil du demandeur d'emploi et des instructions du conseiller. Il repose sur un grand modèle de langue « alimenté en RAG ». Ce RAG comprend le catalogue des formations, le profil France Travail et les invites du conseiller. Le catalogue regroupait plus de 20 000 formations, venant aussi de partenaires. La CNIL recommande d'harmoniser le format des offres, pour éviter que certaines deviennent invisibles, et de tenir les bases nettoyées et à jour [4].

Le contexte lu est le modèle Mixtral déployé sur site, choix de France Travail après une comparaison dont le détail n'est pas dans la note. La fiche du modèle n'a pas été ouverte : aucune taille n'est reprise. Un modèle hors site, dans le réseau du fournisseur de licence, présente selon la CNIL des risques de perte de confidentialité. L'accompagnement a porté uniquement sur ce projet, d'après les informations communiquées par l'organisme.

La note écrit qu'en l'espèce, l'utilisation de l'outil « ne semble pas pouvoir entraîner de décision ayant des effets juridiques ou affectant la personne de manière significative de façon similaire et n'est par conséquent pas interdit par principe par l'article 22 ». La condition écrite est une intervention significative de l'agent après la suggestion. France Travail avait prévu une formation continue, un accompagnement à l'outil et des « correspondants IA ». La note indique qu'il convient de limiter, dans les invites, la situation familiale, l'état de santé ou une réinsertion sociale. Aucun taux de bonnes recommandations n'est publié.

Le déployeur de la base, et ce qui n'a pas de prix

La foire aux questions du 18 juillet 2024 écrit que le déployeur qui connecte sa propre base « sera lui aussi responsable de son traitement lorsqu'elle contient des données personnelles ». Celui qui affine le modèle le devient « seulement pour ce qui concerne cet affinage ». La page recommande d'associer le délégué et, le cas échéant, une analyse d'impact. Elle date encore l'entrée en vigueur du règlement au 1er août 2024, sans citer de texte modificatif. Les dates d'application se lisent ailleurs [3].

Aucune offre publique lue le 27 septembre 2026 ne donne un taux journalier, un nombre de jours ou un forfait pour une base vectorielle, les tests de R24 ou la revue de R35. Il n'y a pas de prix sur cette page. Les taux déjà relevés, et le produit d'un taux par des jours, sont sur la page du coût d'un projet d'IA.

Le guide nomme trois catégories d'attaques, sans mode d'emploi : manipulation, infection, exfiltration. Les besoins qu'elles peuvent atteindre sont la confidentialité, l'intégrité, la disponibilité et la traçabilité. R2 demande une analyse de risque avant l'entraînement, par exemple avec EBIOS-RM, sans en livrer le résultat pour un secteur.

Ce que les pages ouvertes ne chiffrent pas

  1. Décembre 2018 : extrait Wikipédia de l'index, 21 millions de passages de 100 mots.
  2. 2020 : actes NeurIPS. Correspondance exacte 44,5 et 44,1 sur Natural Questions.
  3. 29 avril 2024 : guide ANSSI-PA-102, version 1.0, recommandations R1 à R35.
  4. 18 juillet 2024 : la CNIL définit le RAG et la responsabilité du déployeur.
  5. Décembre 2024 : note France Travail, plus de 20 000 formations, modèle sur site.
  6. 27 septembre 2026 : pas de version ultérieure du guide, pas de prix de mission, pas de liste SecNumCloud rouverte.

Le score 44,0 lu dans une table d'ablation n'est pas publié : l'en-tête de colonne, dans l'extraction, ne permettait pas de le distinguer du 44,5 de test. Aucune statistique ouverte ne dit quelle part des entreprises françaises fait tourner ce dispositif. Une question sur le périmètre documentaire, les droits de lecture ou les tests de réponses peut être posée par le formulaire de contact.

Questions fréquentes

RAG entreprise : de quoi s'agit-il ?

La foire aux questions de la CNIL du 18 juillet 2024 décrit une recherche dans une base vectorisée. Les réponses sont enrichies par des données externes, plus faciles à actualiser que le modèle, avec davantage de traçabilité. Le guide ANSSI du 29 avril 2024 place cette base avant l'envoi au modèle et l'appelle RAG. L'article de NeurIPS 2020, lui, indexe 21 millions de passages de Wikipédia, de décembre 2018, découpés en blocs de 100 mots.

RAG IA : quelle différence avec un ajustement du modèle ?

La foire aux questions du 18 juillet 2024 sépare les deux. Le RAG branche une base de connaissance. L'ajustement, ou fine-tuning, modifie les poids en gardant l'architecture, et demande des capacités de calcul. Le déployeur qui connecte sa base devient responsable du traitement si elle contient des données personnelles. Celui qui affine le modèle le devient seulement pour cet affinage. Le guide ANSSI ajoute que les droits d'accès ne se gèrent pas sur les données d'entraînement.

Retrieval augmented generation entreprise : qui répond des documents ?

La CNIL, le 18 juillet 2024, écrit que le déployeur qui connecte sa propre base est responsable du traitement lorsque cette base contient des données personnelles. Le guide du 29 avril 2024 demande de cartographier ces données additionnelles, y compris la base vectorielle. La note sur France Travail, de décembre 2024, décrit un catalogue de plus de 20 000 formations, le profil du demandeur d'emploi et les invites du conseiller. L'accompagnement a duré de janvier à juin 2024.

Comment évaluer les réponses d'un RAG en entreprise ?

La recommandation R24 demande des tests de performance et de qualité des réponses avant la production, et ces tests peuvent continuer ensuite. Elle ne fixe aucun score. La page du guide dit que la performance métier n'est pas traitée dans le document. L'article de 2020 publie, sur Natural Questions, 44,5 de correspondance exacte pour RAG-Sequence et 44,1 pour RAG-Token. Ce score porte sur un index Wikipédia de décembre 2018. Il ne décrit pas un fonds documentaire d'entreprise.

Faut-il héberger un RAG sur site ?

Pour des données personnelles ou une documentation sensible ou stratégique, la CNIL écrit le 18 juillet 2024 qu'un déploiement sur site limite le risque d'extraction auprès d'un tiers. Le cloud distant reste possible avec un contrat de sous-traitance. La recommandation R14 privilégie SecNumCloud lorsque le cloud est public et que les données sont sensibles, que l'impact métier est critique, ou que les utilisateurs ne sont pas de confiance. La liste des offres qualifiées n'a pas été rouverte.

Un RAG supprime-t-il les réponses inexactes ?

La CNIL écrit que les modèles génératifs suivent une logique probabiliste et peuvent produire des résultats inexacts mais plausibles, souvent appelés hallucinations, notamment sur des faits absents des données d'entraînement. L'article de 2020 mesure 11,8 % de réponses justes sur Natural Questions alors que le passage retrouvé ne contient pas la réponse. Un modèle extractif y serait à 0 %. Le guide ANSSI définit l'hallucination comme un contenu erroné qui ne repose pas sur des données réelles.

Sources

  1. ANSSI, « Recommandations de sécurité pour un système d'IA générative », version 1.0 du 29 avril 2024, référence ANSSI-PA-102 (PDF), messervices.cyber.gouv.fr, consulté le 27 septembre 2026.
  2. ANSSI, page « Recommandations de sécurité pour un système d'IA générative » (publié le 29 avril 2024), messervices.cyber.gouv.fr, consulté le 27 septembre 2026.
  3. CNIL, « Les questions-réponses sur l'utilisation d'un système d'IA générative » (18 juillet 2024), cnil.fr, consulté le 27 septembre 2026.
  4. CNIL, bac à sable « IA et services publics », recommandations aux lauréats (mars 2025, section France Travail rédigée en décembre 2024), cnil.fr, consulté le 27 septembre 2026.
  5. Patrick Lewis et al., « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks », actes NeurIPS 2020, proceedings.neurips.cc, consulté le 27 septembre 2026.